三分钟导读:本文提出TANGO,一种通过噪声引导优化在测试时避免自回归视频扩散模型陷入“终端点”的方法,从而提升生成视频的真实性和语义一致性。
英文题目:Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.15849
原始论文:PDF / 论文页面
对应视频标题:TANGO:测试时噪声引导自适应,解决自回归视频生成的终端点崩溃问题|推荐指数:★★★★★
这篇论文解决什么问题?
自回归视频生成模型在生成长视频时,由于训练与推理时的分布不匹配,生成的轨迹会逐渐偏离真实流形,最终到达模型无法继续生成的“终端点”,导致视频内容变得不真实或崩溃。
核心创新
- 揭示了自回归视频生成中的“终端点”现象,即单帧有效但联合轨迹无效的问题。
- 提出噪声一致性假设,利用预测噪声残差的统计特性(均值、方差、偏度、峰度、频谱平坦度)来检测终端点。
- 设计了测试时噪声引导优化机制,无需重新训练模型即可提升生成质量。
方法概览
提出TANGO(Terminal points Avoidance through Noise Guided Optimization),利用扩散模型作为自身输出的评判者。通过预测下一步并检查预测噪声残差是否符合各向同性高斯分布(噪声一致性),识别终端点。在测试时,通过约束优化更新可训练参数,使模型偏离终端点,保持在真实流形内。
逐图理解论文
方法概述:TANGO噪声引导自适应

本文提出TANGO,即Terminal points Avoidance through Noise Guided Optimization。该方法利用扩散模型作为自身输出的评判者,通过预测下一步并检查预测噪声残差是否符合各向同性高斯分布,即噪声一致性,来识别终端点,并在测试时通过约束优化更新可训练参数,使模型保持在真实流形内。
实验设置:基准与评估指标

我们在VBench基准上对比SOTA自回归视频生成方法,并使用LV-Bench数据集计算Fréchet Video Distance,即FVD,以评估视频真实性。此外,还进行了消融实验分析不同损失项的影响,以及超参数敏感性分析,包括LoRA秩、噪声向量数和正则化系数。
消融实验:损失项与超参数分析

消融实验表明,噪声一致性损失Lb和正则化损失Lreg对避免终端点至关重要。超参数敏感性分析显示,LoRA秩和噪声向量数B对FVD有显著影响,但存在最优区间。合理设置这些参数可在性能增益与计算成本之间取得平衡,确保优化效果最大化。
效率分析:计算成本权衡

TANGO在运行时和内存使用效率上进行了详细分析。虽然测试时优化增加了推理时间和计算资源消耗,但相比使用更大模型提升性能的方法,TANGO在保持较低内存占用的同时实现了显著的性能提升,证明了其在资源受限场景下的实用价值。
定性评估:视觉质量与一致性

定性评估显示,TANGO生成的视频在视觉质量和语义一致性上优于基线方法。通过避免终端点,模型能够生成更连贯、自然的长视频序列,减少了内容崩溃和失真现象。然而,对于训练数据中代表性不足的领域,生成的视频在技术细节上可能完全错误。
实验与关键结果
- 在VBench基准上对比SOTA自回归视频生成方法。
- 使用LV-Bench数据集计算Fréchet Video Distance (FVD)。
- 消融实验分析不同损失项(La, Lb, Ls, Ll, Lreg)的影响。
- 超参数敏感性分析(LoRA秩、噪声向量数B、正则化系数)。
- 运行时和内存使用效率分析。
- 定性评估和失败案例分析。
- VBench总分提升3.1%绝对值(第 1 页)
- 15秒视频平均FVD降低28.3%(第 1 页)
- VBench语义分数提升4.8%,质量分数提升2.6%(第 10 页)
- 相比基线,15秒生成后FVD降低38.7%(第 12 页)
阅读时需要注意
- 对于训练数据中代表性不足的领域(如异星物理、纳米生物学),即使避免了终端点,生成的视频在技术细节上可能完全错误。
- 测试时优化增加了推理时间和计算资源消耗。
- 该方法依赖于预训练模型流形中存在有效解,若流形本身缺乏相关知识,优化无法创造新知识。
- 需要权衡计算成本与性能增益。
关联工作
- Self-Forcing [22]:基线方法,通过自蒸馏减少误差积累。(第 5 页)
- RollingForcing [34]:基线方法,使用滚动缓存和注意力机制。(第 5 页)
- CausVid [64]:基线方法,自回归视频生成模型。(第 5 页)
- LongLive [63]:基线方法,实时交互式长视频生成。(第 5 页)
- RewardForcing [37]:基线方法,通过奖励分布匹配蒸馏优化。(第 5 页)
- Wan2.1-T2V-1.3B [53]:基础双向视频扩散Transformer模型。(第 9 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
测试时噪声引导的自适应用于逼真的自回归视频生成
Dimitrios Karageorgiou1,2, Symeon Papadopoulos1, Ioannis Kompatsiaris1, 和 Efstratios Gavves2
1 希腊塞萨洛尼基 CERTH 信息技术研究所 2 荷兰阿姆斯特丹大学
{dkarageo,papadop,ikom}@iti.gr, {d.karageorgiou,e.gavves}@uva.nl
摘要。自回归视频扩散模型通过移除对后续帧的条件约束,使得生成任意长度的视频成为可能,从而极大地提高了计算效率。然而,它们存在随时间推移的错误累积问题,因为去噪序列会逐渐偏离训练期间看到的条件分布。最近的进展试图通过将每个生成的帧锚定到真实帧的学习流形上来减少这种误差。然而,即使所有生成的单帧都靠近真实流形,也存在模型缺乏足够的流形知识以在终端点(Terminal Points)处继续生成后续帧的轨迹,从而导致模型陷入终端点。为了防止这种情况,我们从以下假设出发:对于建模良好的未来轨迹,预测噪声的分布应与前向加噪过程的分布相匹配。为了在测试时强制执行这种先验,我们引入了通过噪声引导优化实现的终端点避免方法(Terminal points Avoidance through Noise Guided Optimization, TANGO),该方法利用扩散模型作为其自身输出的评判者,通过预测下一步并要求预测各向同性高斯噪声来实现。我们利用与该预期噪声分布的偏差来搜索一条不导致终端点的替代轨迹。我们的方法在 VBench 上相比最先进方法取得了 3.1% 的绝对提升,同时在 15 秒视频上将 Fréchet Video Distance (FVD) 平均降低了 28.3%。我们的代码可在 https://mever-team.github.io/tango 获取。
1 引言
自回归视频扩散模型 [22, 34, 57, 64] 最近已成为生成任意长度视频的一种范式。为了实现这一目标,它们采用因果注意力结构,仅基于过去帧来生成未来帧——在实践中,通过滚动缓存机制 [64] 仅基于有限数量的过去帧。此前,双向扩散模型 [2, 53, 58] 必须一次性处理所有帧,并且通常仅在训练期间考虑的固定长度上运行。这限制了可实现的长度上限,因为常用架构(如 UNets [45] 和扩散 Transformer [42])的计算成本随长度呈二次方增长。
第 2 页
2 Karageorgiou 等人
图 1:尽管终端点位于学习到的真实流形内,但从这些点出发在流形内部不存在延续路径。因此,它们充当了陷阱,迫使生成的轨迹在不符合现实的区域中继续。通过采用 TANGO,我们在测试时通过噪声引导优化避免终端点,从而将生成过程保持在真实流形内。图的上半部分可视化了 TANGO 执行的轨迹校正。由于 TANGO 通过预测前进一步来优化自回归扩散 Transformer 的视觉轨迹,且不依赖于初始条件,因此它可以统一应用于文本、图像和视频到视频的生成。图的下半部分展示了三个相应的示例。
第 3 页
测试时噪声引导的自适应以生成逼真视频 3
尽管此类进展使得生成长视频成为可能,但自回归方法在其所关注的过去视觉序列的分布上存在训练与推理时的不匹配问题,因为通常它们是在源自真实视频的一组过去轨迹上进行训练的。相反,在推理时,它们必须关注自身生成的帧序列。随着生成过程的推进,生成序列分布与训练期间所见分布之间的微小偏移会不断累积,导致自回归过程最终崩溃 [22]。我们将导致自回归扩散模型生成的序列偏离其训练分布的两个原因区分开来。第一个原因——也是近期文献中讨论的原因——与生成各个未来帧期间噪声去除的不完美性有关。由于固有的偶然不确定性以及训练分布建模过程中的不完美性,去噪过程无法匹配训练数据的噪声水平。因此,去噪后的帧最终会落在真实样本的学习流形之外。最近,出现了几种解决此问题的技术。包括在训练期间对生成过程进行时间展开 [22,67]、在测试时重复去噪时间步 [24],或引入注意力汇 [11,34,63] 以将生成流形锚定在初始帧附近。然而,这些方法假设,只要生成序列中的所有单个帧都位于真实样本的学习流形内,生成的序列就会与训练分布相匹配。
相反,在本工作中,我们提出,即使生成轨迹中的所有单个帧都源自真实样本的学习流形,其联合分布仍可能与训练期间所见的分布不同,即自回归过程最终会生成一条轨迹,假设训练集有限,该轨迹在学习流形下不存在延续——从而到达终端点(Terminal Points)。强制自回归过程继续会导致其脱离真实样本的学习流形,并使生成的视频变得极不真实。在本工作中,我们制定了一种避免终端点的方法,从而防止模型生成它不知道如何继续的序列。
理解生成轨迹中的某一点是否为终端点,最终需要捕捉自回归扩散模型中分布外(out-of-distribution)的条件序列。为此,我们的核心观点是,对于建模良好的条件序列,预测噪声的分布应与前向加噪过程中考虑的分布相匹配。我们利用这一观察结果,通过观察预测噪声的属性是否与各向同性高斯分布的属性相匹配,从而将去噪模型本身用作对其过去输出的评判器。为了在测试时引导扩散模型远离终端点,我们引入了通过噪声引导优化避免终端点的方法(Terminal points Avoidance through Noise Guided Optimization, TANGO),该方法搜索不会导致终端点的替代轨迹。这是通过向前预测一步并在终端点邻域执行约束优化来实现的。最终,提出的解决方案不断校正生成的轨迹,以避免被困在生成模型缺乏继续知识的点上。我们工作的摘要如图 1 所示。
第 4 页
4 Karageorgiou 等人
本文的主要贡献如下:
– 我们指出,终端点(Terminal Points)阻碍了将许多真实轨迹用作自回归视频生成模型的有效条件序列。 – 我们提出,通过观察预测噪声的属性,可以在自回归扩散模型中捕捉终端点。 – 我们引入了 TANGO,这是一种测试时噪声引导的自适应方法,旨在通过使扩散模型能够批判其自身输出来避免生成导致终端点的轨迹。 – 通过噪声引导优化,我们在 VBench [23] 上实现了比最先进方法高出 3.1% 的绝对提升,同时在 15 秒视频上将 Fréchet Video Distance (FVD) 平均降低了 28.3%。
2 相关工作
视频扩散模型。扩散模型 [10,18] 的出现彻底革新了视频生成建模,在很大程度上取代了早期的对抗生成 [9,50] 和基于标记的自回归 [52,61] 方法。这些模型最初基于 3D U-Net 架构 [19,46],随后逐渐转向扩散 Transformer (DiTs) [42],它们在生成高保真、时间一致的视频帧方面表现出色。奠基性工作主要侧重于通过引入时间注意力或 3D 卷积将图像扩散模型扩展,以生成长度固定的片段 [4,19]。扩展这些架构催生了强大的基础模型,能够模拟高度逼真的物理世界动态 [1,5]。与此同时,Lumiere [3] 等模型展示了时空 U-Net (STUNets) 在一次传递中合成完整时间持续时间的有效性,这与早期的级联时间超分辨率方法形成对比。最近最先进的双向扩散模型 [2,53] 同时处理整个视频序列,利用全局时间上下文以确保所有帧之间的高度一致性。然而,由于注意力机制的二次计算复杂度以及训练期间考虑的固定上下文窗口,这种全局处理范式限制了可生成的最大序列长度。
自回归视频生成。自回归视频生成已成为一种突出的范式,将视频合成视为序列延续任务 [6,13,26]。这种方法在很大程度上受到高度压缩视觉标记器 [65] 发展的推动,这些标记器允许基础模型将多模态输入作为离散标记进行处理 [30]。为了在更长的序列中保持时间连贯性,最近的方法如 StreamingT2V [17] 利用了专门的短期和长期记忆模块。最近,Yin 等人 [64] 引入了一种方法,将双向扩散 Transformer 蒸馏为具有因果注意力结构和滚动 KV 缓存的自回归模型,最终根据用于初始化缓存的帧数,在单一管道下实现文本、图像和视频到视频的合成。然而,自回归生成引入了重大挑战,其中最显著的是暴露偏差(exposure bias)。由于模型是在真实视频帧的条件下训练以预测下一帧,依赖于
第 5 页
在推理过程中使用其自身不完美的生成帧会导致与训练分布的不匹配 [22]。随着生成的进行,生成帧序列与训练分布的微小偏差会累积,导致严重的误差积累,并最终导致生成轨迹的崩溃。
限制分布外生成输出。一种方法试图通过在训练时展开生成过程 [22,37,67] 来缓解这一问题,使模型暴露于其自身的预测中。然而,这显著增加了训练成本和内存开销,并且仅能缓解训练期间固定窗口内的误差积累。更高效的方法是,其他工作微调噪声增强网络以防止生成低保真度的帧 [66]。另一种显著的技术是引入注意力汇 [11,34,63],将生成过程锚定在初始帧上,从而有效地缩小生成流形。或者,越来越多的免微调推理方法试图通过重新调度噪声序列以建立长程相关性 [43]、在重叠片段上应用时间协同去噪 [54],或在去噪过程中平衡多频带频率分布以防止高频细节退化 [36],来保持一致性。其他方法施加测试时目标以符合人类偏好 [27,44],试图通过在测试时重复去噪时间步来稳定输出 [24],使生成帧收敛到学习到的真实流形,或者优化模型本身以保持在
第 6 页
6 Karageorgiou 等人
锚点 [56]。此类方法的共同点在于,试图将每一帧生成的图像拉近到真实帧的学习流形中。当应用于自回归设置时,它们假设如果生成模型以与其训练样本相似的单帧为条件,它将能够成功地在同一流形内生成轨迹。然而,其联合分布并不能保证与训练分布匹配,最终导致高度不真实的输出。
在本文中,我们认为,为了使自回归模型能够随时间推移持续生成逼真的输出,其条件帧的联合分布不能偏离其训练分布,即避免到达终端点。为此,我们引入了噪声引导公式,通过检查其预测噪声的属性,使自回归模型能够捕捉终端点。然后,我们将噪声引导用作测试时优化目标,以引导扩散模型生成没有终端点的轨迹,显著提高了生成内容的逼真度,同时允许模型在其整个真实帧学习流形中探索轨迹。
3 通过噪声引导优化避免终端点
3.1 生成轨迹中的终端点问题
设 V = {x1, x2, . . . } 表示一个视频,其中 xi ∈Rh×w×c 是其帧,p(V) 是真实视频的分布。在典型的自回归分解 [22,64] 下,视频生成模型的目标是匹配条件分布 p(xi|x<i),即给定过去轨迹生成合理的后续帧,因为 xi ∈supp(p(xi|x<i)) ⇒{x<i, xi} ∈supp(p(V))。由于我们将时间视界视为无限,对于每一个生成的过去轨迹,都应该存在真实的未来轨迹,因此 ∅̸ = supp(p(xi+1|{x<i, xi})) ⊂supp(p(V))。然而在实践中,自回归生成模型是在有限长度轨迹的有限集合 D ∼pD(V) 上训练的,其中 supp(pD(V)) ⊂supp(p(V)),对分布 pD(xi|x<i) 进行建模。在后一种情况下,无限时间视界的假设不再成立,因此 ∃v = {x<i, xi}, xi ∈supp(pD(xi|x<i)) 使得 ∄u = {v, xi+1} ∈supp(pD(V)),其中 xi+1 ∈supp(pD(xi+1|v))。因此,即使自回归生成模型学会了针对其训练分布生成完全有效的单个未来帧,它迟早会生成帧序列,这些序列相对于训练分布共同构成分布外样本。因此,它将被困在学习流形中不存在有效延续的区域,而无法离开该区域。我们将这些区域称为终端点。图 1 的上半部分提供了终端点的可视化。
为了使自回归模型避免生成带有终端点的轨迹,它既需要一种识别它们的机制,也需要一种引导其远离它们的策略。在本工作中,我们对这两个方向都做出了贡献。所提出解决方案的概述如图 2 所示。
第 7 页
用于生成逼真视频的测试时噪声引导自适应 7
3.2 捕捉终端点的噪声一致性假设
从现在开始,我们假设自回归视频生成模型是一种扩散模型,并且为了简化符号且不失一般性,我们的推导基于得分匹配公式 [48]。其他公式(如 DDIM [47] 或流匹配 [33])的推导可以直接从中构建——我们在补充材料中提供了后者的推导。 扩散模型从根本上基于这样一个思想:从空间中的任意点出发,沿着使样本为真实的似然最大化的方向移动,最终到达真实样本流形上的某一点。已有研究 [28,48] 表明,通过在正向扩散过程中向一组真实样本 $x^0$ 添加各向同性高斯噪声,模型可以学习从空间中的任意点开始近似这一方向:
\label{eq:forward_diffusion} x^{t}=\alpha^tx^0+\sigma^t\epsilon, \epsilon \sim \mathcal{N}(0,I) (1)
其中 $\alpha^t$ 和 $\sigma^t$ 是根据噪声调度控制噪声水平的标量。$t$ 定义了由后者指示的去噪时间步,不应与生成的视频的时间维度混淆——在当前上下文中记为 $i$。然后,学习一个模型 $\epsilon_\theta$ 来去除该噪声,其中 $\theta$ 是其可训练参数集,最终近似得分函数:
score s(x^t, t) = \nabla_{x^t} \log p(x^t) \approx -\frac{\epsilon_\theta(x^t,t)}{\sigma^t} = s_\theta(x^t,t) (2) n 去噪器通常被训练以最小化相对于添加噪声的均方误差:
\mathcal{L}(\theta) = \mathbb{E}_{t,x^0,\epsilon} \| \epsilon – \epsilon_\theta(x^t,t) \|_2^2 (3) 在全局视频去噪过程中,即当 $x^0 = V \sim p_D(V)$ 时,测试期间 $L(\theta) > 0$ 的唯一原因可能是由于训练期间不可避免地考虑了有限的噪声样本以及模型容量的限制,导致对得分函数的建模不完善。然而,在自回归分解下,得分函数采用以下形式:
down_{x^i} s(x_i^t, t, x^0_{<i}) = \nabla_{x_i^t} \log p(x_i^t | x^0_{<i}) \approx -\frac{\epsilon_\theta(x_i^t, x^0_{<i})}{\sigma^t} = s_\theta(x_i^t, x^0_{<i}) (4) t} 因此,任何序列 $x^0_{<i} \notin \text{supp}(p_D(V))$ 在最小化 $L(\theta)$ 时均未被考虑,即使我们可以假设存在无限量的噪声样本和具有足够容量的模型。因此,$\epsilon_\theta$ 在这些区域的输出是未定义的,并且允许违反公式 (1) 中假设的各向同性高斯噪声的性质。总体而言,我们利用这种违反情况,将 $\epsilon_\theta$ 用作对其自身过去输出的评判器。 我们假设,在去噪时间步 $t$,可以通过检查预测的前向残差 $\hat{r}_{i+1} = \epsilon_\theta(x_i^{t+1}, t, \{x_{<i}, \hat{x}_i^0\})$ 是否违反各向同性高斯噪声的性质,来判断预测的 $\hat{x}_i^0$ 是否构成终端点。
第 8 页
8 Karageorgiou 等人
3.3 通过测试时适应避免终端点
为了捕捉 $\hat{r}_{i+1} \in \mathbb{R}^{h \times w \times c}$ 与各向同性高斯噪声的偏差,我们计算其像素的统计矩与 $\mathcal{N}(0, I)$ 的定义矩在空间域上的距离,以及其在频域上的平坦度。 一阶矩和二阶矩:令 $\mu_{\hat{r}_{i+1}}$ 和 $\sigma^2_{\hat{r}_{i+1}}$ 为 $\hat{r}_{i+1}$ 的经验均值和有偏方差。我们惩罚与各向同性高斯分布的定义零均值和单位方差的偏差,构建损失函数:
\ Loss_{a} =\lambda(\mu{r}_{i+1}})^2+\lambda(\sigma^2_{\hat{r}_{i+1}}1)^2 (5)
其中 $\lambda_\mu$ 和 $\lambda_\sigma$ 是标量超参数。 高阶矩:为了检测不对称性和结构性伪影(重尾),我们使用 z-分数 $z = (\hat{r}_{i+1} – \mu_{\hat{r}_{i+1}})/ \sqrt{\sigma^2_{\hat{r}_{i+1}}}$ 来计算偏度和超额峰度。我们再次惩罚它们与各向同性高斯分布下取值(即零)的偏差:
\ Lo ss _{b _\g amma \ u nde (6) \lambda} = rce {\mbru (z^3)^2}_{\texta{skewness}}\lambda_\kappa\underbrace{(\mu(z^4)-3)^2}_{\text{excesskurtosis}}
其中 $\mu(\cdot)$ 是逐像素均值操作,$\lambda_\gamma, \lambda_\kappa$ 是标量超参数。 频谱平坦度:各向同性噪声的一个关键特性是其所有频率的能量水平相等,因此功率谱密度是平坦的 [38]。非平坦的功率谱密度将表明存在空间相关性,因此去噪器也会连同添加的噪声一起去除视觉内容。为了确定预测的噪声残差是否各向同性,我们评估频谱平坦度度量 (SFM) [16]。令 $S(f) = |\mathcal{F}(\hat{r}_{i+1})|^2$ 为其功率谱密度,其中 $\mathcal{F}$ 表示离散傅里叶变换。为了确保数值稳定性并避免给定零均值信号时的对数零错误,我们排除直流分量 ($f = 0$) 并添加一个小常数 $\zeta$。然后,我们定义频谱平坦度损失,该损失惩罚与 1.0(完美各向同性噪声)的偏差:
\ s {s} \= l ambd a _s \l e ft p _ left(\frac{1}{|F|}\sum_{f\inF}(S(f)\zeta)\right)}{\frac{1}{|F|}\sum_{f\inF}(S(f)\zeta\right(7) \ Lo s ( – \f rac { \ ex 1
其中 $F$ 是非零频率的集合,$\lambda_s$ 是标量超参数。 低频矩:由于 $\hat{r}_{i+1}$ 主要由高频主导,对其进行的统计矩计算主要被高频所淹没。然而,真实视觉内容的能量主要存在于低频中 [15]。为了显式地强制低频的高斯特性,我们还对 $\hat{r}_{i+1}$ 的低通滤波变体计算偏度和超额峰度,其 z-分数记为 $z^l$。我们定义相应的损失如下:
\ Loss _{l} = \ lambda _{l \ m u }\mu((z^l)^3)^2+}(\mu((z^l)^4)3)^2 (8)
第 9 页
其中 $\lambda_{l\mu}$ 和 $\lambda_{l\sigma}$ 再次为标量超参数。随后,总噪声一致性目标变为:
$$ \text{Loss}_{\mathcal{L}_a, \mathcal{L}_b, \mathcal{L}_s, \mathcal{L}_l} \quad (9) $$
为了在测试时强制执行这种一致性,我们引入了一组自适应参数 $\phi$,其初始化为预训练权重 $\theta$。在每个自回归步骤 $i$ 中,我们优化 $\phi$ 以生成 $\hat{x}^0_i(\phi)$,使其满足使用冻结的评论家 $\epsilon_\theta$ 计算出的 $LN$。
为了避免平凡解,我们将适应过程表述为一个约束优化问题。我们更新 $\phi$ 以最小化 $LN$,同时受到正则化约束的限制,该约束将搜索过程锚定在 $\hat{x}^0_i(\theta)$ 的邻域内,其中 $\hat{x}^0_i(\theta)$ 表示原始模型的预测。总目标变为:
$$ \mathcal{J}(\phi) = \mathbb{E}_{\epsilon \sim \mathcal{N}(0,I)} [\text{Loss}] + \| \hat{x}^0_i(\phi) – \hat{x}^0_i(\theta) \|_2^2 \quad (10) $$
其中 $\lambda_{reg}$ 表示加权超参数。在实践中,我们通过每个优化步骤中一批 $B$ 个噪声向量来近似 $\mathbb{E}_{\epsilon \sim \mathcal{N}(0,I)} [LN]$,这可以根据测试时可用的计算能力进行控制。通过最小化公式 (10),优化后的模型被强制避免在冻结流形内的终端点。
4 实验
4.1 实现细节
为了促进我们在噪声引导优化方面的实验,我们遵循最近的文献 [34, 63],并根据 Huang 等人 [22] 引入的具有自展开、因果注意力和 KV 缓存的分布匹配蒸馏方案初始化我们的去噪器 $\epsilon_\theta$,该方案始于 Wan2.1-T2V-1.3B [53] 的双向视频扩散 Transformer [19],并使用 [37] 中的推理优化。由于所采用的模型基于流匹配 [33],我们求解相对于噪声的预测流的方程,以获得预测的噪声残差 $\hat{r}_{i+1}$,我们利用它来指导去噪过程。推导过程见补充材料。生成视频的 RGB 分辨率为 832 × 480,帧率为 16 FPS,并且由于保留 21 个潜在帧(约 5 秒视频)的滚动 KV 缓存,时间范围是无限的。所有计算都在 3D 变分自编码器 [29] 的压缩潜在空间中进行,该编码器提供 ×8 的空间压缩和 ×4 的时间压缩,除了初始帧外,初始帧不进行时间压缩以捕捉更丰富的上下文。因此,$h = 60$,$w = 104$,而 $c = 16$ 用于潜在通道。在每个优化阶段,我们通过秩为 8 的低秩自适应 [20] 向因果扩散 Transformer 的自注意力层引入一小组可训练参数。我们根据 MSR-VTT [59] 测试集的初步调整设置 $\lambda_\mu = \lambda_\sigma = \lambda_\gamma = \lambda_\kappa = \lambda_s = 0.1$,$\lambda_{l\mu} = \lambda_{l\sigma} = 0.2$ 和 $\lambda_{reg} = 0.9$,我们在评估中不再使用 MSR-VTT,以避免任何潜在的过拟合。我们优化
第 10 页
10 Karageorgiou 等人
模型的学习率为 2 × 10−6,共使用 B = 10 个噪声向量,在一个 epoch 内以 batch size 为 2 进行训练,使用 AdamW [35] 优化器。实验在单块拥有 96 GB 内存的 Nvidia RTX Pro 6000 GPU 上进行。
4.2 基准测试与考虑的生成方法
为了计算生成视频的真实性,我们遵循最近的文献 [22,34,64] 并采用 VBench [23] 套件。该套件定义了一组 946 个文本提示,涵盖 11 个评估维度和 8 类视觉内容,用于计算一组精心设计的 16 项指标。这些指标用于计算质量和语义得分,以及一个反映生成方法整体性能的单一总分。我们在文本到视频生成管道中使用所有这些指标。此外,仅通过手工设计的指标无法涵盖影响视频视觉忠实度的所有可能方面。因此,我们还采用 Fréchet Video Distance (FVD) [51] 来计算生成模型产生的视频分布与真实视频分布之间的距离。作为真实视频的参考数据集,我们采用 LV-Bench [67],它结合了来自 DanceTrack [49]、GOT-10k [21]、HD-VILA-100M [60] 和 ShareGPT4V [7] 的视频,涵盖了以人类、动物和环境为主的视觉场景,并配有精心策划的标题。为了更好地关注视频的视觉效果,限制生成视频与真实视频之间潜在上下文差异的影响,我们在视频到视频续写管道中使用它们。
在我们的实验中,我们考虑了一组最近提出的自回归视频生成方法,这些方法拥有公开可用的代码且规模相似。具体而言,我们考虑了 CausVid [64]、Self-Forcing [22]、RollingForcing [34]、LongLive [63] 和 RewardForcing [37],因为它们都使用 Wan2.1-T2V-1.3B [53] 双向视频扩散 Transformer 进行初始化,从而尽可能消除不同训练数据和规模的影响,使我们能够更好地专注于算法本身。为了公平比较,我们使用每种方法的公开代码生成长度相等(15 秒)的视频。
4.3 与最先进方法的比较
我们计算了所有考虑方法的 VBench 指标,并在表 1 中展示。总体而言,我们观察到语义得分绝对提升了 4.8%,质量得分提升了 2.6%,总分提升了 3.1%,并且在大多数单项指标上均优于之前的最先进水平。值得注意的是,即使在量化生成内容多样性的动态程度指标上,我们的方法也仅次于 CausVid [64],而 CausVid 是以牺牲生成帧的语义连贯性为代价的。相反,主要依赖锚定早期帧以维持视觉一致性的方法,如 [34,63],则牺牲了其生成多样化内容的能力。
第 11 页
面向真实视频生成的测试时噪声引导自适应 11
表 1:与最先进的自回归视频生成方法在 16 个视觉方面的比较。通过在测试时避免终端点,TANGO 提升了视觉质量和语义一致性,同时更好地保留了内容多样性。最佳值以粗体显示,次佳值以下划线标示。
美学外观 背景 动态 人类成像 运动 多对象 质量 风格 一致性 程度 动作 平滑度 对象类别
方法 颜色 质量 风格 一致性 程度 动作 平滑度 对象类别
RollingForcing [34] 0.658 0.205 0.957 0.819 0.403 0.940 0.712 0.986 0.932 0.935 SelfForcing [22] 0.644 0.206 0.942 0.848 0.611 0.950 0.696 0.985 0.896 0.959 CausVid [64] 0.665 0.242 0.966 0.824 0.872 0.998 0.702 0.976 0.747 0.937 RewardForcing [37] 0.650 0.205 0.954 0.896 0.625 0.980 0.687 0.984 0.845 0.940 LongLive [63] 0.660 0.205 0.958 0.885 0.361 0.960 0.695 0.988 0.851 0.969
TANGO (ours) 0.690 0.257 0.962 0.850 0.769 0.960 0.727 0.985 0.937 0.972
总体 空间 主体 时间 时间 质量 语义 方法 场景 总分 一致性 关系 一致性 闪烁 风格 得分 得分
RollingForcing [34] 0.269 0.563 0.747 0.958 0.991 0.241 0.802 0.814 0.804 SelfForcing [22] 0.271 0.578 0.768 0.928 0.989 0.249 0.832 0.808 0.827 CausVid [64] 0.275 0.556 0.667 0.933 0.938 0.252 0.837 0.794 0.828 RewardForcing [37] 0.269 0.539 0.830 0.932 0.986 0.244 0.835 0.804 0.829 LongLive [63] 0.268 0.591 0.801 0.953 0.992 0.242 0.838 0.812 0.832
TANGO (ours) 0.283 0.603 0.859 0.945 0.989 0.275 0.864 0.860 0.863
表 2:噪声引导优化中关键损失的消融研究。报告了真实视频片段与生成视频片段之间的平均 Fréchet 视频距离(FVD),分别针对 3 秒片段以及整个视频。越低越好。最佳值以粗体显示。
消融 (FVD ↓) 1-3s 4-6s 7-9s 10-12s 13-15s 总计
TANGO (ours) 365.1 408.8 412.7 441.4 438.8 413.3
w/o La 364.6 418.1 467.1 469.8 488.2 441.6 w/o Ll 380.3 452.8 518.4 534.8 545.2 486.3 w/o Ls 369.3 443.9 507.1 530.6 578.4 487.9 w/o Lb 363.7 449.8 561.2 587.1 572.3 506.8 w/o Lreg 420.1 634.4 630.9 823.9 811.7 664.2
w/o LN (baseline) 367.9 554.6 600.7 645.4 715.6 576.8
4.4 消融研究
损失项:由于我们的目标是防止自回归过程偏离真实视频的学习流形,而不仅仅是强制特定的视觉属性,我们通过直接测量生成视频分布与真实片段分布之间的发散程度来消融我们的关键选择。为此,我们计算了 LV-Bench [67] 真实视频中相应片段对应的生成视频连续 3 秒片段的平均 FVD。我们在表 2 中报告了结果。我们观察到,高阶矩对于捕捉预测噪声残差与各向同性高斯噪声分布之间的偏差非常重要。与其他与噪声一致性相关的损失相比,移除相应的损失对性能的影响最大。接下来,我们观察到移除频谱平坦度目标会导致性能显著下降,这验证了我们的假设,即空间相关性会移除实际的视觉内容,从而增加相对于所考虑的真实视频分布的漂移。类似地,显式计算低频
第 12 页
12 Karageorgiou 等人
表 3:超参数消融研究。报告了 15 秒视频的真实片段与生成片段之间的平均 Fréchet 视频距离(FVD)。越低越好。
LoRA 秩 (R) FVD ↓ B FVD ↓ λreg FVD ↓
2 596.2 1 473.7 0.1 656.5 4 496.3 5 461.8 0.5 449.3 8 413.3 10 413.3 0.9 413.3 16 425.6 20 399.4 10 475.6
(a) 测试时适应过程中涉及的关键超参数消融。
λµ FVD ↓ λσ FVD ↓ λlµ FVD ↓ λlσ FVD ↓ λγ FVD ↓ λκ FVD ↓ λs FVD ↓
.01 503.8 .01 482.8 .02 419.8 .02 482.8 .01 468.1 .01 479 .01 477.4 .1 413.3 .1 413.3 .2 413.3 .2 413.3 .1 413.3 .1 413.3 .1 413.3 1 449.3 1 540.7 2 464.7 2 464.7 1 442.7 1 482.6 1 429.1
(b) 噪声一致性目标权重的消融。
表 4:提出的测试时方法与通过采用更大模型来提升性能的方法在运行时间和内存使用方面的对比。
模型 参数量 VBench (↑) 运行时间 (↓) 内存 (↓)
基线 (SelfForcing) [22] 1.3B 0.827 1.2 分钟 23.4 GiB
HunyuanVideo [31] 13B 0.832 92.3 分钟 62.5 GiB SVI-1.0 (Wan2.1) [32] 14B 0.837 30.6 分钟 37.9 GiB SVI-2.0 (Wan2.1) [32] 14B 0.849 39.8 分钟 37.9 GiB SVI-2.0-Pro (Wan2.2) [32] 27B 0.869 43.2 分钟 68.4 GiB
TANGO ( ours) 1.3B 0.863 8.6 分钟 37.6 GiB
频率有助于优化过程更好地捕捉可见的不一致性。 此外,结果表明正则化对于防止优化过程收敛到平凡解至关重要。事实上,在不进行正则化的情况下执行优化会导致性能低于基线。总体而言,与基线相比,我们的测试时优化过程在生成 15 秒后使 FVD 降低了 38.7%,同时在视频级别平均降低了 28.3%。这表明我们的方法不仅有助于改善生成视频的具体方面(如表 1 先前所示),而且更普遍地减少了生成视频分布与真实视频分布之间的距离。 超参数:我们进一步对关键超参数进行了消融,并将结果报告在表 3 中。总体而言,虽然非常低的 LoRA 秩甚至可能恶化性能,但随着可训练参数增加带来的收益最终会递减。相反,我们观察到进一步增加噪声向量数量 B 可以提供额外的性能提升。然而,由于这会以计算能力为代价,我们将 B 设置为 10,以在效率和性能之间取得合理的权衡。至于正则化系数和我们噪声一致性目标的权重,我们观察到当它们处于同一数量级时性能更高。
4.5 运行时间与内存使用分析
我们将测试时优化方法的运行时间和内存使用与开源视频生成方法 [31,32] 进行了比较,这些方法通过增加视觉
第 13 页
测试时噪声引导的自适应以实现逼真视频生成 13
图 3:与最先进方法的定性比较。
第 14 页
14 Karageorgiou 等人
图 4:失败案例。从左到右,展示了四个时间视频片段的代表性帧,总时长为 15 秒。考虑了两个视频,分别涉及异质物理和纳米生物学等细分主题。虽然结果在视觉上令人愉悦,但在技术上完全不准确。
主要通过扩大模型规模来提升性能。我们在表 4 中报告了相应的结果。总体而言,在测试时对较小的自回归视频扩散模型 [22] 进行引导,使其远离终端点,有助于提升视觉性能,同时保持运行时和内存使用方面的更好权衡。
4.6 定性评估
在图 3 中,我们根据表 1 所示,针对表现最好的两种方法进行了定性评估。我们考虑了四个不同 15 秒视频片段的代表性帧。如前两个视频所示,在复杂场景或基于模糊文本提示生成的场景中,生成模型会迅速偏离学习到的真实流形,产生带有明显伪影的不真实场景。在多次情况下,将探索空间限制在生成轨迹初始点周围的狭窄区域内,虽然以牺牲动态程度为代价,但提高了真实感。相反,采用 TANGO 避免陷入终端点,通过在扩散模型有限的世界知识下寻找有效的延续,从而提高了真实感。
4.7 讨论与失败案例
任何测试时适应方法都能有效地分配推理时间的计算资源,以在建模分布下找到更好的解决方案,使模型能够远离其可能被困住的局部最大值。我们的方法也不例外。然而,正如大型语言模型领域所展示的那样,使模型能够对其输出进行推理 [55] 并修复
第 15 页
其错误是推理过程中的一个关键组成部分,具有使模型能够外推至其训练范围之外的潜力。然而,与基于语言的自回归建模不同,自回归视频扩散模型缺乏一种使其远离终端点的公式化方法,而在本工作中我们引入了这样一种方法。未来的工作可以涵盖那些能够内在学习量化其认知不确定性 [25] 的架构,而无需依赖基于梯度下降的优化过程。
给定固定的尺度,我们的测试时优化方法增强了模型的能力。然而,在其学习到的流形下寻找更好的解,前提是该解存在。对于训练数据中显著代表性不足的视觉主题,寻找没有终端点的轨迹具有挑战性。以图 4 为例,该图展示了两个视频的帧,其提示词主题涉及奇异物理学和纳米生物学。虽然噪声引导找到了视觉上令人愉悦的轨迹,但从技术角度来看,这些结果完全错误。因此,测试时适应并非与扩大训练数据和模型容量相竞争,而是互补的,因为后者才是增加有效解空间的手段。相反,噪声引导旨在寻找更好的解。
5 结论
在本工作中,我们强调自回归视频生成模型仅仅生成位于学习到的真实流形内的未来轨迹是不够的,因为流形中的多个点构成终端点。一旦到达这些点,若不离开流形则无法继续生成。为了避免到达此类点,从而避免生成不真实的视觉内容,我们引入了一种噪声引导的测试时适应机制,该机制利用扩散模型本身作为其输出的评判者。其原理是,当试图继续一条已到达终端点的轨迹时,前向加噪过程中假设的噪声特性将不再适用于去噪器的预测。我们在约束优化过程中利用了这一观察结果,以远离终端点。总体而言,通过采用这种测试时方法,我们在无需任何额外数据的情况下,成功提升了视频真实性多个指标上的最先进性能。
局限性:任何测试时适应方法本质上都是在预训练期间学习到的流形下搜索改进的解,如果不存在这样的解,最终将会失败。因此,我们将数据和模型扩展视为增加可能解空间的互补方向。然而,我们提出的噪声引导优化过程有助于在自回归视频扩散模型的学习流形下找到此类更好的解。
致谢
本研究得到了 Horizon Europe 项目 ELIAS(项目编号 101120237)和 ELLIOT(项目编号 101214398)的支持。计算资源由 GRNET 提供支持。
第 16 页
16 Karageorgiou 等人
参考文献
1. Agarwal, N., Ali, A., Bala, M., Balaji, Y., Barker, E., Cai, T., Chattopadhyay, P., Chen, Y., Cui, Y., Ding, Y., 等:Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575 (2025) 2. Ali, A., Bai, J., Bala, M., Balaji, Y., Blakeman, A., Cai, T., Cao, J., Cao, T., Cha, E., Chao, Y.W., 等:利用视频基础模型进行物理人工智能的世界模拟。arXiv 预印本 arXiv:2511.00062 (2025) 3. Bar-Tal, O., Chefer, H., Tov, O., Herrmann, C., Paiss, R., Zada, S., Ephrat, A., Hur, J., Liu, G., Raj, A., 等:Lumiere:一种用于视频生成的时空扩散模型。在:SIGGRAPH Asia 2024 会议论文。第 1–11 页 (2024) 4. Blattmann, A., Rombach, R., Ling, H., Dockhorn, T., Kim, S.W., Fidler, S., Kreis, K.:对齐你的潜变量:使用潜在扩散模型进行高分辨率视频合成。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 22563–22575 页 (2023) 5. Brooks, T., Peebles, B., Holmes, C., DePue, W., Guo, Y., Jing, L., Schnurr, D., Taylor, J., Luhman, T., Luhman, E., Ng, C., Wang, R., Ramesh, A.:作为世界模拟器的视频生成模型 (2024),https://openai.com/index/video- generation-models-as-world-simulators/ 6. Chen, G., Lin, D., Yang, J., Lin, C., Zhu, J., Fan, M., Zhang, H., Chen, S., Chen, Z., Ma, C., 等:Skyreels-v2:无限长度电影生成模型。arXiv 预印本 arXiv:2504.13074 (2025) 7. Chen, L., Li, J., Dong, X., Zhang, P., He, C., Wang, J., Zhao, F., Lin, D.:ShareGPT4V:通过更好的字幕改进大型多模态模型。在:欧洲计算机视觉会议。第 370–387 页。Springer (2024) 8. Chung, H.W., Constant, N., Garcia, X., Roberts, A., Tay, Y., Narang, S., Firat, O.: Unimax:更公平且更有效的用于大规模多语言预训练的语言采样方法。在:国际学习表征会议 (ICLR) (2023) 9. Clark, A., Donahue, J., Simonyan, K.:复杂数据集上的对抗性视频生成。arXiv 预印本 arXiv:1907.06571 (2019) 10. Croitoru, F.A., Hondru, V., Ionescu, R.T., Shah, M.:视觉中的扩散模型: 一项综述。IEEE 模式分析与机器智能汇刊 45(9), 10850–10869 (2023) 11. Cui, J., Wu, J., Li, M., Yang, T., Li, X., Wang, R., Bai, A., Ban, Y., Hsieh, C.J.:Lol:长于更长,将视频生成扩展至小时级。arXiv 预印本 arXiv:2601.16914 (2026) 12. Dao, T.:FlashAttention-2:具有更好并行性和工作划分的更快注意力机制。在:国际学习表征会议 (ICLR) (2024) 13. Deng, H., Pan, T., Diao, H., Luo, Z., Cui, Y., Lu, H., Shan, S., Qi, Y., Wang, X.:无需向量量化的自回归视频生成。在:国际学习表征会议 (ICLR) (2025) 14. Ding, J., Zhang, Y., Shang, Y., Zhang, Y., Zong, Z., Feng, J., Yuan, Y., Su, H., Li, N., Sukiennik, N., 等:理解世界还是预测未来?世界模型全面综述。ACM 计算调查 58(3),1–38 (2025) 15. Field, D.J.:自然图像的统计特性与皮层细胞响应特性之间的关系。美国光学学会杂志 A 4(12), 2379–2394 (1987)
第 17 页
实时噪声引导适应以实现逼真视频生成 17
16. Gray, A., Markel, J: 一种用于研究语音分析线性预测自相关方法的谱平坦度度量。IEEE 声学、语音和信号处理汇刊 22(3), 207–217 (1974) 17. Henschel, R., Khachatryan, L., Poghosyan, H., Hayrapetyan, D., Tadevosyan, V., Wang, Z., Navasardyan, S., Shi, H: Streamingt2v: 从文本生成一致、动态且可扩展的长视频。在:计算机视觉与模式识别会议论文集。第 2568–2577 页 (2025) 18. Ho, J., Jain, A., Abbeel, P: 去噪扩散概率模型。神经信息处理系统进展 33, 6840–6851 (2020) 19. Ho, J., Salimans, T., Gritsenko, A., Chan, W., Norouzi, M., Fleet, D.J: 视频扩散模型。神经信息处理系统进展 35, 8633–8646 (2022) 20. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W: Lora: 大语言模型的低秩自适应。国际学习表征会议 (ICLR) (2022) 21. Huang, L., Zhao, X., Huang, K: Got-10k: 一个用于野外通用目标跟踪的大型高多样性基准。IEEE 模式分析与机器智能汇刊 43(5), 1562–1577 (2019) 22. Huang, X., Li, Z., He, G., Zhou, M., Shechtman, E: 自强制:弥合自回归视频扩散中的训练-测试差距。在:神经信息处理系统进展 (NeurIPS) (2025) 23. Huang, Z., He, Y., Yu, J., Zhang, F., Si, C., Jiang, Y., Zhang, Y., Wu, T., Jin, Q., Chanpaisit, N., et al: Vbench: 视频生成模型的全面基准测试套件。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 21807–21818 页 (2024) 24. Jang, S., Ki, T., Jo, J., Xie, S., Yoon, J., Hwang, S.J: 自精炼视频采样。在:国际机器学习会议 (ICML) (2026) 25. Jazbec, M., Wong-Toi, E., Xia, G., Zhang, D., Nalisnick, E., Mandt, S: 扩散模型中的生成不确定性。在:人工智能中的不确定性 (UAI) (2025) 26. Kim, J., Kang, J., Choi, J., Han, B: Fifo-diffusion: 无需训练即可从文本生成无限视频。神经信息处理系统进展 37, 89834–89868 (2024) 27. Kim, S., Kim, M., Park, D: 无需奖励过度优化的扩散模型实时对齐。在:国际学习表征会议 (ICLR) (2025) 28. Kingma, D., Salimans, T., Poole, B., Ho, J: 变分扩散模型。神经信息处理系统进展 34, 21696–21707 (2021) 29. Kingma, D.P., Welling, M: 自动编码变分贝叶斯。在:国际学习表征会议 (ICLR) (2014) 30. Kondratyuk, D., Yu, L., Gu, X., Lezama, J., Huang, J., Schindler, G., Hornung, R., Birodkar, V., Yan, J., Chiu, M.C., et al: Videopoet: 用于零样本视频生成的大语言模型。在:国际机器学习会议 (ICML) (2024) 31. Kong, W., Tian, Q., Zhang, Z., Min, R., Dai, Z., Zhou, J., Xiong, J., Li, X., Wu, B., Zhang, J., et al: Hunyuanvideo: 大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603 (2024) 32. Li, W., Pan, W., Luan, P.C., Gao, Y., Alahi, A: Stable video infinity: 通过错误回收实现无限长度视频生成。arXiv 预印本 arXiv:2510.09212 (2025)
第 18 页
18 Karageorgiou 等人
33. Lipman, Y., Chen, R.T., Ben-Hamu, H., Nickel, M., Le, M.: Flow matching for generative modeling. In: International Conference on Learning Representations (ICLR) (2023) 34. Liu, K., Hu, W., Xu, J., Shan, Y., Lu, S.: Rolling forcing: Autoregressive long video diffusion in real time. In: International Conference on Learning Representations (ICLR) (2026) 35. Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: International Conference on Learning Representations (ICLR) (2019) 36. Lu, Y., Liang, Y., Zhu, L., Yang, Y.: Freelong: Training-free long video generation with spectralblend temporal attention. Advances in Neural Information Processing Systems 37, 131434–131455 (2024) 37. Lu, Y., Zeng, Y., Li, H., Ouyang, H., Wang, Q., Cheng, K.L., Zhu, J., Cao, H., Zhang, Z., Zhu, X., et al.: Reward forcing: Efficient streaming video generation with rewarded distribution matching distillation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 34385–34397 (2026) 38. Madhu, N.: Note on measures for spectral flatness. Electronics letters 45(23), 1195–1196 (2009) 39. Maliakel, P.J., Ilager, S., Brandic, I.: Investigating energy efficiency and perfor- mance trade-offs in llm inference across tasks and dvfs settings. arXiv preprint arXiv:2501.08219 (2025) 40. Miao, Y., Zhu, Y., Yu, L., Zhu, J., Gao, X.S., Dong, Y.: T2vsafetybench: Evaluating the safety of text-to-video generative models. Advances in Neural Information Processing Systems 37, 63858–63872 (2024) 41. Muennighoff, N., Rush, A., Barak, B., Le Scao, T., Tazi, N., Piktus, A., Pyysalo, S., Wolf, T., Raffel, C.A.: Scaling data-constrained language models. Advances in Neural Information Processing Systems 36, 50358–50376 (2023) 42. Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 4195–4205 (2023) 43. Qiu, H., Xia, M., Zhang, Y., He, Y., Wang, X., Shan, Y., Liu, Z.: Freenoise: Tuning- free longer video diffusion via noise rescheduling. arXiv preprint arXiv:2310.15169 (2023) 44. Qu, L., Wang, Z., Zheng, N., Wang, W., Nie, L., Chua, T.S.: Ttom: Test-time optimization and memorization for compositional video generation. arXiv preprint arXiv:2510.07940 (2025) 45. Ronneberger, O., Fischer, P., Brox, T.: U-net: Convolutional networks for biomedical image segmentation. In: International Conference on Medical image computing and computer-assisted intervention. pp. 234–241. Springer (2015) 46. Singer, U., Polyak, A., Hayes, T., Yin, X., An, J., Zhang, S., Hu, Q., Yang, H., Ashual, O., Gafni, O., et al.: Make-a-video: Text-to-video generation without text- video data. In: International Conference on Learning Representations (ICLR) (2023) 47. Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models. In: International Conference on Learning Representations (ICLR) (2021) 48. Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., Poole, B.: Score- based generative modeling through stochastic differential equations. In: International Conference on Learning Representations (ICLR) (2021) 49. Sun, P., Cao, J., Jiang, Y., Yuan, Z., Bai, S., Kitani, K., Luo, P.: Dancetrack: Multi-object tracking in uniform appearance and diverse motion. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 20993–21002 (2022)
第 19 页
实时噪声引导适应以实现逼真视频生成 19
50. Tulyakov, S., Liu, M.Y., Yang, X., Kautz, J.: Mocogan: Decomposing motion and content for video generation. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 1526–1535 (2018) 51. Unterthiner, T., Van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M., Gelly, S.: Fvd: A new metric for video generation. In: Deep Generative Models for Highly Structured Data, ICLR 2019 Workshop (2019) 52. Villegas, R., Babaeizadeh, M., Kindermans, P.J., Moraldo, H., Zhang, H., Saffar, M.T., Castro, S., Kunze, J., Erhan, D.: Phenaki: Variable length video generation from open domain textual description. In: International Conference on Learning Representations (ICLR) (2023) 53. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J., et al.: Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314 (2025) 54. Wang, F.Y., Chen, W., Song, G., Ye, H.J., Liu, Y., Li, H.: Gen-l-video: Multi-text to long video generation via temporal co-denoising. arXiv preprint arXiv:2305.18264 (2023) 55. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Xia, F., Chi, E., Le, Q.V., Zhou, D., et al.: Chain-of-thought prompting elicits reasoning in large language models. Advances in neural information processing systems 35, 24824–24837 (2022) 56. Xiang, X., Duan, Z., Zhang, G., Zhang, H., Gao, Z., Wu, J., Zhang, S., Wang, T., Fan, Q., Guo, C.: Pathwise test-time correction for autoregressive long video generation. arXiv preprint arXiv:2602.05871 (2026) 57. Xie, D., Xu, Z., Hong, Y., Tan, H., Liu, D., Liu, F., Kaufman, A., Zhou, Y.: Progressive autoregressive video diffusion models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) (2025) 58. Xing, Z., Feng, Q., Chen, H., Dai, Q., Hu, H., Xu, H., Wu, Z., Jiang, Y.G.: A survey on video diffusion models. ACM Comput. Surv. 57(2) (Nov 2024). https: //doi.org/10.1145/3696415, https://doi.org/10.1145/3696415 59. Xu, J., Mei, T., Yao, T., Rui, Y.: Msr-vtt: A large video description dataset for bridging video and language. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 5288–5296 (2016) 60. Xue, H., Hang, T., Zeng, Y., Sun, Y., Liu, B., Yang, H., Fu, J., Guo, B.: Advancing high-resolution video-language representation with large-scale video transcriptions. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 5036–5045 (2022) 61. Yan, W., Zhang, Y., Abbeel, P., Srinivas, A.: Videogpt: Video generation using vq-vae and transformers. arXiv preprint arXiv:2104.10157 (2021) 62. Yang, L., Zhang, Z., Song, Y., Hong, S., Xu, R., Zhao, Y., Zhang, W., Cui, B., Yang, M.H.: Diffusion models: A comprehensive survey of methods and applications. ACM computing surveys 56(4), 1–39 (2023) 63. Yang, S., Huang, W., Chu, R., Xiao, Y., Zhao, Y., Wang, X., Li, M., Xie, E., Chen, Y., Lu, Y., et al.: Longlive: Real-time interactive long video generation. In: International Conference on Learning Representations (ICLR) (2026) 64. Yin, T., Zhang, Q., Zhang, R., Freeman, W.T., Durand, F., Shechtman, E., Huang, X.: From slow bidirectional to fast autoregressive video diffusion models. In: Proceed- ings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 22963–22974 (2025) 65. Yu, L., Cheng, Y., Sohn, K., Lezama, J., Zhang, H., Chang, H., Hauptmann, A.G., Yang, M.H., Hao, Y., Essa, I., et al.: Magvit: Masked generative video transformer.
第 20 页
20 Karageorgiou 等人
收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 10459–10469 (2023) 66. Yu, Z., Hayakawa, A., Ishii, M., Yu, Q., Shibuya, T., Zhang, J., Mitsufuji, Y.: Autorefiner: 通过随机采样路径上的反射细化改进自回归视频扩散模型。arXiv 预印本 arXiv:2512.11203 (2025) 67. Zhang, Z., Chang, S., He, Y., Han, Y., Tang, J., Wang, F., Zhuang, B.: Blockvid: 块扩散用于高质量且一致的一分钟长视频生成。arXiv 预印本 arXiv:2511.22973 (2025)
第 21 页
用于实现逼真自回归视频生成的测试时噪声引导自适应
补充材料
A1 流匹配自适应
在正文中,我们使用生成式扩散模型 [10] 的分数匹配 [48] 推导,构建了我们的终端点避免通过噪声引导优化过程。这使得我们能够保持符号简洁,并专注于我们引入的测试时自适应机制。然而,最近的一些自回归视频生成模型 [34, 64],包括我们的实现基线 [22],采用了替代公式和训练目标,主要遵循最优传输流匹配 [33] 范式。为了可复现性,并促进将我们的测试时自适应机制应用于不同的自回归模型,我们在下面提供了针对流匹配的自适应方法。
在流匹配中,我们不是反转随机微分方程,而是构建一个确定性连续归一化流,将基础噪声分布传输到数据分布。令 $x_0$ 为真实样本,$\epsilon \sim \mathcal{N}(0, I)$ 为各向同性高斯噪声。我们定义数据样本 $x_0$ 和噪声 $\epsilon$ 之间 $t \in [0, 1]$ 的路径 $x_t$。利用最优传输假设 [33],这条路径是直线插值:
\label{eq:forward_flow}x^t=(1-t)x^0+t\epsilon\epsilon\mathcal{N}(0,I) (A1)
流匹配模型 $v_\theta$(其中 $\theta$ 代表其可训练参数集)并非直接预测噪声 $\epsilon$,而是被训练去回归指向从数据到噪声的条件向量场 $u_t(x_t|x_0)$:
| \frac{d}{dt}x^tx^0 u_t(x^t x^0 ) = (A2) 速度模型通常被训练以最小化与该目标向量场的均方误差:
\Loss (\theta ) = \ E _ { t, x^0,(x^t,t)(\epsilonx^0)\|^2_2 (A3)
在我们为视频生成考虑的自回归分解下,目标向量场包含了过去生成的历史 $x_{0<i}$:
u_t(x_i^t |x ^ 0 _ { <i},x_i^0)\epsilonx_i^0 (A4) 因此,训练后的模型近似条件场 $v_\theta(x_i^t, t, x_{0<i}) \approx \epsilon – x_i^0$。类似于分数匹配范式,任何历史序列 $x_{0<i} \notin \text{supp}(p_D(\mathcal{V}))$ 在最小化 $\mathcal{L}(\theta)$ 期间均不被考虑。因此,这些区域中的预测速度是未定义的,并且将违反预期的
第 22 页
22 Karageorgiou 等人
路径的几何约束导致各向同性高斯噪声实例。我们利用这些违反情况,将 $v_\theta$ 用作其自身过去输出的评判器。 为了利用流匹配模型作为终端点的评判器,我们必须从预测的速度中分离出隐含噪声。鉴于我们的路径如公式 (A1) 所示,以及速度近似 $v_\theta \approx \epsilon – x_0$,我们可以仅用已知状态 $x_t$ 和模型输出来代数地表达隐含噪声 $\hat{\epsilon}$:
\hat{\epsilon} = x^t + (1-t)v_\theta(x^t,t) (A5)
在自回归设置下,我们可以通过计算其前瞻隐含噪声残差 $\hat{r}_{i+1}$ 并检查其是否违反各向同性高斯噪声的属性,来考察预测的 $\hat{x}_0^i$ 是否构成终端点:
\label{eq:flow_matching_lookahead_residual} r_{i+1}=x^t_{i+1}+(1-t)v_\theta(x^t_{i+1},\{x^0_{<i},{x}^0_i\}) (A6)
由于 $\hat{r}_{i+1}$ 隔离了噪声分量,它可以作为噪声一致性目标 $LN$(主论文中的公式 9)计算的直接替代品。然后,如第 3.3 节所述,测试时适应过程按原样应用。对于其他扩散模型公式 [62],可以推导出类似的适应方法,这些方法依赖于不同的训练目标。然而,详尽涵盖每种类型的扩散模型超出了本工作的范围。相反,我们侧重于强调避免终端点的重要性,我们通过引入一种通用的噪声引导测试时优化机制来促进这一点。
A2 扩展实现细节
遵循最近的文献 [34,63],我们的自回归视频扩散模型根据分布匹配蒸馏方案进行初始化,该方案由 Huang 等人 [22] 引入,包括自展开、因果注意力和 KV 缓存,起始于 Wan2.1-T2V-1.3B [53] 的双向视频扩散 Transformer [19]。由于后者基于最优传输流匹配 [33] 公式,我们采用第 A1 节中提出的适应方法,以获得预测的噪声残差 $\hat{r}_{i+1}$,随后我们在计算 $LN$ 时使用它。除了视觉条件外,我们使用的扩散 Transformer 还对潜在文本序列进行条件处理,这些序列由 umt5-xxl [8] 预训练 Transformer 编码。 生成的 RGB 视频的空间分辨率为 832 × 480,帧率为 16 FPS,并且具有无限的时间视界,这是由于滚动 KV 缓存保留了最后 21 个潜在帧 [34],同时采用了 [37] 的优化推理管道。所有计算都在 3D 变分自编码器 [29] 的压缩潜在空间中进行,该编码器提供 ×8 的空间压缩和 ×4 的时间压缩,除了初始帧未进行时间压缩以捕获更丰富的上下文。因此,$h = 60$,$w = 104$,而 $c = 16$ 用于潜在通道。去噪在 3 个潜在帧的块上联合执行,即公式 (A6) 中的 $i$ 指的是这样一个块。此外,还使用了四个去噪时间步。
第 23 页
面向真实视频生成的测试时噪声引导自适应 23
表 A1:在不同视频长度下与最先进的自回归视频生成方法的对比。报告了语义一致性和视觉质量的 VBench [23] 综合得分,以及总分。最佳值以粗体显示,次佳值以下划线标示。
语义得分 质量得分 总分 方法 5s 10s 15s 5s 10s 15s 5s 10s 15s
RollingForcing [34] 0.835 0.831 0.814 0.800 0.798 0.802 0.807 0.804 0.804 SelfForcing [22] 0.839 0.837 0.808 0.834 0.817 0.832 0.835 0.821 0.827 CausVid [64] 0.813 0.809 0.794 0.842 0.831 0.837 0.836 0.827 0.828 RewardForcing [37] 0.847 0.836 0.804 0.808 0.807 0.835 0.816 0.813 0.829 LongLive [63] 0.829 0.825 0.812 0.816 0.813 0.838 0.819 0.815 0.832
TANGO (ours) 0.867 0.856 0.860 0.868 0.864 0.864 0.868 0.862 0.863
KV 缓存中的初始帧数量定义了生成的类型。空缓存用于文生视频,而单帧和多帧初始化分别用于图生视频和视频生视频。具体而言,在视频生视频实验中,我们使用 9 个 RGB 帧作为视觉提示。此外,在后一种情况下,我们以与生成器帧率匹配的帧率对视觉提示序列进行采样。我们这样做是为了避免学习到的时间表示与提示视频中存在的时间表示之间的不匹配,即当提示视频的帧率高于/低于 16 FPS 时,不会导致提示视频变慢/变快。我们通过根据需要丢弃/重复中间帧来实现这一点。
我们根据在 MSR-VTT [59] 测试集上的初步调整,将超参数设置为 $\lambda_\mu = \lambda_\sigma = \lambda_\gamma = \lambda_\kappa = \lambda_s = 0.1$,$\lambda_{l\mu} = \lambda_{l\sigma} = 0.2$ 和 $\lambda_{reg} = 0.9$。这是在有限时长视频(5 秒)的视频生视频设置下进行的,与我们的实验评估相比,后者考虑了长度大得多的视频。所采用的验证目标是最小化来自该数据的 Fréchet Video Distance [51]。为了避免任何潜在的过拟合,我们在整个展示评估过程中不再使用此数据。
在每个优化阶段,我们将一小组可训练参数引入因果扩散 Transformer 的自注意力层。我们通过秩为 8 的低秩自适应 [20] 来实现这一点,应用于其查询、键和值矩阵。我们以 $2 \times 10^{-6}$ 的学习率优化模型,每个阶段共 $B = 10$ 个噪声向量,使用 AdamW [35] 优化器,以 2 的批量大小训练一个 epoch。该实现基于 PyTorch,而 FlashAttention [12] 用于注意力操作。使用了梯度检查点以减少优化期间的内存占用。实验在单块 Nvidia RTX Pro 6000 96 GB GPU 上进行。在该设备上,每个 RGB 帧的生成耗时约 900 毫秒。
第 24 页
24 Karageorgiou 等人
A3 视频长度消融研究
为了评估避免终端点对生成轨迹长度的影响,我们在三种不同长度的视频上计算了 VBench [23] 的 16 项评估指标。我们在表 A1 中展示了 5 秒、10 秒和 15 秒视频在语义方面、视觉质量以及总体分数的综合得分。这表明,在测试时避免终端点可以一致地提高不同视频长度下的性能——我们的方法在所有长度上均取得了最先进(state-of-the-art)的结果。这突显出终端点不仅出现在生成非常长的序列之后。相反,它们可能在生成过程中的任何时间点被引入到生成的轨迹中,导致生成模型无法在不脱离真实视频学习流形的情况下继续生成,从而产生不真实的内容。通过我们的噪声引导优化过程远离这些点,使模型能够忠实地继续生成轨迹。
A4 伦理考量
我们的工作引入了一种测试时方法,以改进基于扩散的自回归视频生成模型的一致性,而无需额外的训练数据。虽然这直接有利于创意应用和世界建模 [14],但与任何生成方法一样,它也表现出双重用途风险。特别是,恶意行为者可以利用生成的媒体来伪造虚假信息或促进欺诈活动 [40]。然而,我们对开放科学实践的承诺使得在开发 AI 生成视频检测器时可以考虑噪声引导,以减轻滥用的风险。此外,任何测试时适应方法都有效地以测试时计算量为代价换取性能提升,从而增加了推理期间的能源消耗。尽管如此,多模态生成建模的最新研究表明,训练时的扩展通常收益递减 [41],而更大的模型表现出较低的推理效率 [39]。在这个更大的框架下,我们的测试时适应方法不仅提供了克服数据可用性限制的工具,还作为在大规模部署中定义性能与效率之间黄金比例的额外工具。
A5 扩展定性评估
为了直观评估生成视频的质量,我们展示了涵盖文本、图像和视频到视频生成的多个生成样本。具体而言,在图 A1 至 A6 下,我们从每个样本中包含了七帧,这些帧在 14 秒的时间跨度内均匀采样。采用噪声引导优化将生成轨迹引导远离终端点,通过使生成模型能够生成它知道如何进一步继续的视频序列,改善了所描绘主体的动态行为。
第 25 页
测试时噪声引导的自适应用于真实视频生成 25
(a) TANGO 生成的文本到视频样本。主体忠实地遵循给定提示,未生成不真实或静态的序列。
(b) TANGO 生成的文本到视频样本。主体自然地进入场景,执行文本提示所描述的动作。部分遮挡不影响模型对场景的感知。
图 A1:文本到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示。
第 26 页
26 Karageorgiou 等人
(a) TANGO 生成的文本到视频样本。该视频在时间维度上忠实地遵循所提供的提示,并保持对背景的准确表征。
(b) TANGO 生成的文本到视频样本。缝纫机的运动部件被正确识别,而场景的其余部分保持完整。
图 A2:文本到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示。
第 27 页
测试时噪声引导的自适应用于真实视频生成 27
(a) TANGO 生成的图像到视频样本。环境得到合理维持,舞者以高度逼真的方式移动。
(b) TANGO 生成的图像到视频样本。场景自然延伸,主体保持一致且移动自然。
图 A3:图像到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示,而输入图像则显示在左上角。
第 28 页
28 Karageorgiou 等人
(a) TANGO 生成的图像到视频样本。即使初始视角移出相机视野,环境中逼真的美学特征仍得以保持。
(b) TANGO 生成的图像到视频样本。人物动作自然,环境中逼真的美学特征得以保持。
图 A4:图像到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示,而输入图像则显示在左上角。
第 29 页
测试时噪声引导的自适应用于真实视频生成 29
(a) TANGO 的视频到视频样本。初始视角得到自然延伸,场景美学得以保持。
(b) TANGO 的视频到视频样本。舞者动作自然,且其动作保持同步。
图 A5:视频到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示,而输入视频则显示在左上角。
第 30 页
30 Karageorgiou 等人
(a) TANGO 生成的视频到视频样本。主体与摄像机的独立运动得到了恰当处理。
(b) TANGO 生成的视频到视频样本。主要物体的不同视角被正确生成,并在物体运动及摄像机运动过程中保持一致性。
图 A6:视频到视频生成的定性评估。(a) 和 (b) 展示了从两个生成视频中在 14 秒的时间跨度内均匀采样的 7 帧。每幅图的底部展示了所使用的文本提示,而输入视频则显示在左上角。