三分钟导读:该论文揭示了视频扩散模型在预测长链依赖事件时存在的“串行性差距”,证明双向扩散的去噪步骤无法提供可扩展的串行计算,而自回归生成和增加模型深度能有效缓解此问题。
英文题目:The Seriality Gap in Video Diffusion Models
论文出处:arXiv 每日论文精选 · arXiv:2607.13031
原始论文:PDF / 论文页面
对应视频标题:视频扩散模型中的串行性差距:为何增加去噪步数无法解决长链物理推理|推荐指数:★★★★★
这篇论文解决什么问题?
视频扩散模型在处理需要长链因果推理(如多球碰撞动力学)的任务时,随着依赖链长度增加,物理准确性显著下降,且增加去噪步数无法弥补这一差距。
核心创新
- 定义并实证了“串行性差距”(Seriality Gap):双向扩散模型在长依赖链任务中性能下降,而自回归模型保持稳健。
- 理论证明:对于确定性视频预测,去噪步骤不提供超出骨干网络容量的可扩展串行计算。
- 发现增加骨干网络深度比增加宽度更能有效改善物理准确性,且自回归/块状推理因子化能单调提升性能。
方法概览
使用硬球动力学(Hard-Sphere Dynamics)作为测试床,通过改变球体数量(n=1 vs n=5)和预测长度(f)来控制串行复杂度;对比双向(Bidirectional)、块自回归(Blockwise)和全自回归(Autoregressive)扩散模型,并分析去噪步数、模型深度和宽度的影响。
逐图理解论文
背景:双向扩散的计算局限

视频扩散模型通常通过双向去噪生成视频,即同时去噪所有帧。尽管总计算量随视频长度二次方增长,但这种架构缺乏针对串行依赖的有效计算分配机制。理论分析表明,对于确定性过程,单次评分网络评估即可恢复未来状态,去噪迭代并未增加串行计算深度。
方法:硬球动力学测试床

研究使用硬球动力学作为测试床,通过改变球体数量和预测长度来控制串行复杂度。对比双向、块自回归和全自回归扩散模型,并分析去噪步数、模型深度和宽度的影响。这种设置能清晰分离串行与非串行依赖,便于量化评估。
创新点一:串行性差距的实证

本文定义并实证了“串行性差距”。在n=5硬球动力学数据集上,双向模型在长预测长度下性能显著下降,而自回归模型保持稳健。例如,在f=49时,双向模型的∆x(5)为0.883,而自回归模型仅为0.607,差距明显。
创新点二:去噪步数无效性

理论证明去噪步骤不提供可扩展的串行计算。实验显示,增加去噪步数从T=50到T=200,双向模型在f=49时的∆x(5)从0.883微增至0.916,未缩小与自回归模型的差距。这表明单纯增加去噪迭代无法弥补串行计算能力的不足。
创新点三:深度优于宽度

研究发现增加骨干网络深度比增加宽度更能有效改善物理准确性。在n=5设置下,增加nlayers能显著降低∆x(5),而增加dmodel效果有限。这表明串行计算能力更依赖于网络深度,而非宽度,为模型架构设计提供了新方向。
实验与关键结果
- 在n=5硬球动力学数据集上评估不同视频长度(f=25, 33, 41, 49)下双向、块自回归和自回归模型的性能。
- 在n=1单球控制实验中验证非串行设置下双向与自回归模型的性能差异消失。
- 测试不同去噪步数(T=10, 20, 50, 100, 200)对双向模型性能的影响。
- 进行模型深度(nlayers)和宽度(dmodel)的缩放实验。
- 在振动墙壁(Vibrating-Wall)随机性设置下进行初步实验。
- 进行人类偏好研究以验证物理一致性与感知合理性之间的关系。
- 在f=49, n=5设置下,Bidir (dmodel=1536) 的 ∆x(5) 为 0.883,而 AR (dmodel=1536) 为 0.607(第 16 页)
- 在f=49, n=1设置下,Bidir 和 AR 的 ∆x(5) 分别为 0.246 和 0.220,差距极小(第 17 页)
- 增加去噪步数从T=50到T=200,Bidir在f=49时的 ∆x(5) 从0.883微增至0.916,未缩小差距(第 17 页)
- 人类偏好研究中,AR和Block-3生成结果比Bidir更受青睐,AR对Bidir的偏好率显著高于Block-3对Bidir(第 22 页)
阅读时需要注意
- 理论仅适用于确定性视频预测,随机性或噪声可能打破假设,但实验显示差距在随机设置下依然存在。
- 自回归并非通用解决方案,仅当任务依赖结构与时间顺序对齐时才有效。
- 硬球动力学是高度简化的抽象,可能无法完全代表自然视频中的视觉复杂性和语义歧义。
- 结果基于合成数据,自然视频中的物理一致性失败可能由更多因素引起。
- 预训练模型(Wan)微调后绝对性能下降,可能由于分辨率不匹配或分布外任务。
- 深度增加超过30层后收益递减,可能因优化难度增加。
关联工作
- Wan2.1:作为基础架构进行微调和研究(第 4 页)
- PhyGenBench, T2VPhysBench:相关物理一致性基准测试(第 10 页)
- FlexAttention:用于实现块因果掩码的注意力机制(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
视频扩散模型中的串行性差距
Jorge Diaz Chao∗ Konpat Preechakul∗ Yuxi Liu Yutong Bai
加州大学伯克利分校 {jdiazchao,konpat,yuxi_liu,yutongbai}@berkeley.edu
2026年7月14日
图 1:依赖事件预测揭示了串行性差距。(a) 硬球动力学将非串行视频预测与串行视频预测区分开来。(i) 在单球控制中,任何未来状态都可以直接从初始状态计算得出,无需解析中间状态。(ii) 在多球情况下,每次球-球碰撞都会改变支配后续碰撞的状态,从而形成必须按时间顺序解析的依赖事件链。(b) 给定初始帧,当更长的预测视界需要更多的串行计算时,扩散模型能否保持准确性?
摘要
当一个球撞击另一个球,接着又撞击第三个球时,视频模型应当预测每次弹跳的后果。在多球硬球动力学的受控实验中,我们发现,即使提供更多的去噪步数,标准双向扩散模型的性能仍会随着因果链长度的增加而下降。在与多球场景长度匹配的仅含单球的对照组中,由于不存在球-球相互作用,性能下降现象基本消失,从而将依赖事件结构而非视频长度隔离为根本原因。在一系列干预研究中,能够增加有效串行计算的方法显著提升了模型性能,包括自回归/块状生成以及增加架构深度。我们将这种模式识别为串行性差距:即任务所需的串行计算量不断增长与视频扩散模型的去噪循环无法提供可扩展串行计算之间的不匹配。随后,我们证明,对于确定性视频预测,去噪步数并未在骨干网络之外增加串行计算,这表明视频扩散模型在串行推理和模拟任务上存在结构性障碍。
∗ 同等贡献。 https://seriality-gap.jdiazchao.com
预印本。
第 2 页
1 引言
当一个球撞击第二个球,后者又撞击第三个球时,预测这一连串后果似乎应该是任何视频模型具备的最基本能力。然而,尽管视频扩散模型能够生成引人入胜的片段,并日益被定位为世界模拟器和视觉推理器 [1, 2],但在物理一致性 [3–9] 和推理 [2, 10] 方面仍存在持续的失败。如果这不仅仅是因为数据覆盖的不足,还源于扩散模型本身的局限性呢?因此,我们提出以下问题:
视频扩散模型能否预测越来越长的依赖事件链?
这个问题之所以重要,恰恰是因为否定答案会令人惊讶。由于扩散模型通过重复去噪来生成视频,在此任务上的失败将质疑这些迭代过程究竟提供了何种计算——这一问题最近受到了广泛关注,但仍未得到解决。一些研究将推理归因于去噪步骤之间的计算 [11];另一些研究则报告了后期步骤中运动结构的侵蚀 [12]、早期计划承诺以及长序列解决方案需要链式生成的必要性 [10],或者额外步骤带来的收益迅速饱和 [13]。这些发现共同促使我们表征去噪是否提供了随依赖链长度扩展的计算能力(第 6 节)。
我们通过一个刻意简化的视频预测任务来研究这个问题:硬球动力学(Hard-Sphere Dynamics)。相同的球在盒子中无摩擦地移动并发生弹性碰撞;给定轨迹的初始帧,模型必须预测未来的视频(图 1b)。在此设置中,视觉复杂性最小,动力学是确定性的,且预测误差是明确的。我们的设置改变了依赖事件链的长度:当 $n > 1$ 个球时,更长的 f-frame rollout 包含更长的球-球相互作用链,而 $n = 1$ 作为对照组,没有此类相互作用,并允许解析解。这使得我们能够在保持视觉内容基本固定的情况下改变串行复杂性,而在自然视频中很难获得这种控制(第 2 节)。
任务的简单性是刻意为之的。自然视频增加了外观复杂性、不确定性和歧义性,但没有任何因素消除了传播依赖事件的需求。因此,在这种受控设置中的失败识别了一个可能在更丰富设置中持续存在的瓶颈;相反,成功将解决该瓶颈,而非解决整个视频建模问题。
图 2:串行扩展。(a) 双向扩散(Bidirectional Diffusion)联合去噪未来帧,但去噪并未提供可扩展的串行计算(第 4 节)。与我们的理论一致,性能通过 (b) 自回归(Autoregressive, AR)/块状生成(Blockwise Generation)推理分解或 (c) 更深的骨干网络得到改善。
串行性差距(Seriality Gap)(第 3 节) 在受控的多球($n = 5$)实验中,标准的双向视频扩散随着因果链的延长而性能下降。这种退化在长度匹配的单个球($n = 1$)对照组中基本消失,表明该差距是由更困难的事件依赖关系驱动的,而非视频长度。增加去噪步骤带来的收益微乎其微,且无法缩小差距。相比之下,在总计算量相当的情况下,增加有效串行计算的干预措施带来了不成比例的帮助:增加深度比增加宽度更有效,而将生成串行化则带来了单调的改进——从双向生成到逐渐缩小的时间块,再到完全的自回归生成。
2
第 3 页
为什么去噪步骤无法缩小差距(第4节) 这一结果在两个方面是违反直觉的。首先,更长的 rollout( rollout 指从初始状态开始的模拟轨迹)已经为双向视频 DiT [14] 提供了远超模拟器所需的大量总计算量:时间自注意力(temporal self-attention)的复杂度为 O(f^2),而物理 rollout 仅需 O(f)。其次,扩散去噪本身是迭代进行的,这表明更多的步骤可能缩小串行性差距(Seriality Gap)。然而,这两种直觉均不成立。问题不在于总计算量,而在于可扩展的串行计算(scalable serial computation)。
对于封闭的确定性视频过程,未来由初始帧唯一确定。如果评分网络(score network)计算出精确的评分(score),单次评估就包含足以恢复该未来的信息(命题 4.1)。因此,重复去噪并不会提供超出骨干网络(backbone)已计算内容的额外串行计算。当预测依赖事件所需的串行计算超出固定深度骨干网络的能力时,所需的计算必须来自更深的骨干网络或与时间依赖图对齐的推理分解——例如自回归(autoregression)(图 2)。这解释了为什么深度和时间分解有助于预测依赖事件,而额外的去噪步骤则不能。
超越硬球动力学 在准确的评分匹配(score matching)下,去噪并非骨干网络之外可扩展串行计算的独立来源。这一局限性并非特定于硬球动力学(Hard-Sphere Dynamics):当扩散模型面临串行需求随问题规模增长的任务时,均可能出现此问题,包括迷宫和谜题求解。然而,在这些任务中,依赖结构不必遵循时间顺序,因此逐帧自回归并非通用的解决方案。所需的串行计算必须来自更深的骨干网络、与任务对齐的推理分解,或者潜在地来自一类新的非评分匹配生成模型。
贡献
(i) 我们引入了一种基于硬球动力学的视频预测测试平台,用于研究依赖事件预测。该平台在保持视觉内容基本固定的同时变化串行复杂度(第2节)。 (ii) 我们识别出串行性差距(Seriality Gap):尽管总计算量增加,双向视频扩散的性能随着依赖事件链的延长而下降。这种下降不能由视频长度解释,也不能通过额外的去噪步骤来缩小,但可以通过增加有效串行计算的干预措施来减少(第3节)。
(iii) 我们从理论上证明,对于确定性视频预测,去噪步骤不会在骨干网络已可计算的内容之外增加可扩展的串行计算(第4节)。
2 作为依赖事件预测测试平台的硬球动力学
为了研究串行时间预测,我们设计了一个设置,其中依赖长度可以变化,同时视觉复杂度和歧义性保持可控。我们使用硬球动力学(图 1a):n 个相同的球在一个方形盒子中无摩擦地运动,并与墙壁及彼此之间发生完全弹性碰撞。渲染简单,动力学是确定性的,且每个初始条件都有唯一的真实 rollout。这种刻意极简的设置具有诊断性——如果视频模型在此失败,该失败不太可能由视觉复杂性或模糊的未来来解释。
在此设置中,串行依赖性由球-球碰撞的数量决定。这使我们能够比较多球(n > 1)的 rollout,其中碰撞链随预测视界增长,与单球(n = 1)的 rollout 进行对比,后者可以具有相同的长度,但具有闭式、非串行的未来。这种对比将因视频长度引起的难度与因串行依赖性引起的难度区分开来。
2.1 实验设置
数据集 对于每种数据集配置,我们以 128 × 128 的分辨率合成 f 帧的硬球模拟视频。由于模拟器是确定性的,每个初始条件都有唯一的真实 rollout,因此预测误差可以直接且无歧义地测量。附录 G 记录了模拟器、初始条件采样和过滤标准。
我们构建了两类数据集。在串行设置(n = 5)中,我们的过滤程序强制执行最小化的后条件球-球碰撞密度,因此碰撞事件的最小数量随 f 帧预测视界的增长而增长。由于每次碰撞都会改变决定状态
第 4 页
随后的碰撞,这些事件必须按时间顺序解决,因此 $f$ 成为串行复杂度的代理指标。在长度匹配的对照组($n = 1$)中,不存在球-球碰撞,因此可以从初始条件直接计算任何未来状态,而无需模拟中间状态。
随着 $f$ 的增加,双向视频扩散模型处理更大的时空张量,因此接收更多的总计算量 [15]。如果这些计算足以跟踪依赖事件,那么在多球设置中,局部物理精度不应比单球对照组随 $f$ 的增加而显著下降。
模型 我们训练基于 DiT 风格 [14] 的视频扩散模型,该模型改编自 Wan2.1 [15],这是一种具有竞争力的标准双向视频扩散架构。每个模型均在 Wan2.1 VAE 潜在空间中运行,该空间沿每个空间轴将视频下采样 8 倍,沿时间轴下采样 4 倍。补丁嵌入器将 $2 \times 2$ 的空间潜在补丁分组,不进行额外的时间下采样,因此一个时间潜在帧对应四个渲染视频帧。
我们将标准的双向去噪与以更具串行方式分配计算量的变体进行比较,如图 2 所示。自回归和块状自回归变体使用相同的基架构,但用 FlexAttention [16] 块因果掩码替换了时间潜在帧上的完整时间注意力。我们将块大小为 $k$ 的时间潜在帧生成记为 Block-$k$;附录 H 展示了训练和推理的注意力掩码。除非另有说明,评估使用 $T = 50$ 个去噪步骤。为了将推理分解与架构分离,我们还改变了骨干网络宽度 $d_{model}$ 和深度 $n_{layers}$。
训练 模型使用 AdamW 训练 200,000 次迭代,批量大小为 64,权重衰减为 0.01,恒定学习率为 $2 \times 10^{-4}$。我们维护权重指数移动平均(EMA),衰减率为 0.9999,并使用 EMA 权重进行评估。报告的训练运行大约需要 300 个 A100-80GB GPU 天。
评估 我们从三个维度评估预测结果。
1. 全局误差 $\Delta x(GT)$ 衡量所有球和评估帧中预测球心与真实球心之间的平均欧几里得距离。这是预测准确性最直接的概念,但它对累积的长时域漂移敏感。 2. 局部误差 $\Delta x(k)$ 衡量局部物理一致性。对于每个生成的帧,我们回溯 $k$ 帧,从生成的像素中提取球心和速度,将模拟器向前滚动 $k$ 步,并将结果与生成的帧进行比较。这避免了对由状态估计误差引起的累积漂移进行惩罚。默认情况下,我们报告 $\Delta x(5)$。 3. 视觉质量(IoU)独立于位置误差衡量形状保真度。对于每个球,我们将其生成的轮廓与具有正确半径的理想圆形掩码进行中心对齐,并计算它们的交并比。
令 $I = \{f_0 + 1, \dots, f\}$ 表示用于评估的预测帧,其中 $f_0 = 5$ 为所有实验中的条件帧。我们定义全局和局部准确性指标如下:
$$ \Delta x(GT) = \frac{1}{|I|} \sum_{t \in I} \sum_{i=1}^{n} \|\hat{x}_{t,i} – x_{t,i}^{GT}\|_2^2, $$
$$ \Delta x(k) = \frac{1}{|I|} \sum_{t \in I} \sum_{i=1}^{n} \|\hat{x}_{t,i} – \tilde{x}_{t,i}^{(k)}\|_2^2, $$
其中 $\hat{x}_{t,i}$ 表示球 $i$ 在时间 $t$ 的预测位置,$x_{t,i}^{GT}$ 为真实位置,$\tilde{x}_{t,i}^{(k)}$ 为在时间 $t-k$ 提取生成状态并将模拟器向前滚动 $k$ 步后获得的位置。附录 F 中的人工评估证实,这些指标中的较大差距是显著的。
由于模型预测的是像素而非坐标,我们通过阈值处理每个生成帧中球 $i$ 的已知颜色范围并取分割掩码的质心来恢复 $\hat{x}_{t,i}$;$x_{t,i}^{GT}$ 从模拟器中获得。
4
第 5 页
3 硬球动力学中的串行性差距
我们将实证发现总结为五项观察。附录 B 提供了完整结果;附录 E 排除了优化和初始化混淆因素。
[Figure 3: 串行性差距的实证证据。(左上) 随着碰撞链变长,双向扩散性能下降,而自回归生成保持更高的准确性。(右上) 增加去噪步数无法缩小差距。(左下) 改变骨干网络的深度和宽度以探测架构串行计算是否有帮助。(右下) 随着推理在时间上变得更加串行,从双向扩散到块状生成再到自回归生成的插值过程中,性能得到提升。所有绘制的误差均为 ∆x(5)(越低越好)。]
观察 1 随着视频变长,双向扩散性能下降。在 $n = 5$ 的设置中,我们的过滤标准使得后条件化球-球碰撞的最小数量随视频长度 $f$ 增长,从而增加了串行复杂度(附录 G)。尽管双向和自回归模型在更长的时间范围内接收更多的推理计算量,且时间自注意力大致按 $O(f^2)$ 缩放,但自回归生成保持了较低且近乎平坦的局部物理误差 ∆x(5)。相反,双向扩散随着 $f$ 的增加而恶化,如图 3(左上)所示。
观察 2 没有球-球碰撞时,差距消失。作为长度匹配的对照,我们将 $n = 1$,移除球-球碰撞,留下可以从初始状态封闭形式计算的轨迹。在这种非串行设置中,双向和自回归模型具有几乎相同的局部物理误差 ∆x(5),并且随着 $f$ 的增加保持稳定,如图 3(左上)所示。结合 $n = 5$ 的结果,这一对照表明仅视频长度无法解释性能下降,并支持串行复杂度是其关键驱动因素。
观察 3 使推理串行化可提升性能。我们使用时域潜在帧上的块因果掩码,从双向扩散插值到自回归扩散,同时保持骨干网络固定。较大的块联合去噪更多帧,而较小的块施加更顺序的生成顺序。随着因子分解变得更加串行,局部物理误差得到改善,遵循双向 (Block-11) → Block-3 → Block-2 ≈ 自回归 (Block-1) 的路径,跨越不同模型大小,如图 3(右下)所示。由于模型容量未改变,这些增益反映了时间计算量的分配,而非更大的骨干网络。
第 6 页
观察 4 更多的去噪步骤无法缩小差距。一种自然的解释是,双向扩散在推理时可能计算不足。如果去噪迭代能提供预测更长碰撞链所需的串行计算,那么增加 $T$ 应该特别有助于改善长视界(long-horizon)的 rollout。因此,我们在所有视频长度上评估了 $T \in \{10, 20, 50, 100, 200\}$ 的双向扩散模型。性能在 $T \approx 50$ 之前有所提升;超过这一点后,额外的去噪步骤并未提供一致的好处,有时甚至会增加误差,而长视界退化现象依然存在。如图 3(右上角)所示,增加 $T$ 并不能缩小与自回归生成的差距。
观察 5 深度扩展比宽度扩展更有效。接下来我们探讨缺失的串行计算是否可由骨干网络本身提供。我们在宽度 $d_{model}$ 和深度 $n_{layers}$ 上对双向模型进行扫描,改变容量和计算的分配方式。在增加到约 30 层之前,双向模型从增加深度中获得的收益强于从增加宽度中获得的收益。在可比预算下,更深更窄的模型优于更浅更宽的模型,且从 $n_{layers} = 10$ 增加到 30 层带来的增益超过了将 30 层模型的宽度从 $d_{model} = 640$ 增加到 1536 所带来的改进,如图 3(左下角)所示。超过 30 层后,额外的深度带来的收益递减,这可能是因为更深的模型更难优化 [17]。
图 4:双向生成中的典型失败模式。我们展示了在 $f = 49, n = 5, d_{model} = 1536$ 和 $n_{layers} = 30$ 下训练的双向扩散模型产生的常见定性失败案例。(a) 深蓝色球分裂成两个,导致球数违规。(b) 深蓝色和浅蓝色球交换颜色,同时绿色和黄色球合并为一个;这两种失败都违反了状态一致性。(c) 深蓝色球本应从浅蓝色球上反弹,但却穿透了它。附录 C 中展示了额外的定性示例,包括与自回归生成的并排比较。
定性失败模式 我们观察到三种反复出现的一致性失败,如图 4 所示:穿透、球数违规和颜色身份违规。在穿透中,一个球穿过另一个物体或在没有物理有效中间轨迹的情况下消失并在别处重新出现。在球数违规中,两个球合并为一个,或一个球分裂成多个球。在颜色身份违规中,一个球改变颜色、复制另一个球的颜色,或与其交换颜色身份。这些失败可能出现在双向和自回归生成中,但在双向模型中更为频繁,特别是在高速球和长多球 rollout 中。
在骨干网络深度-宽度消融实验中,所有模型尺寸都生成了视觉上合理的视频,但较小且特别是较浅的骨干网络更频繁地出现这些状态一致性失败。
4 为什么去噪步骤不能提供可扩展的串行计算
上述观察结果令人困惑。随着视频变长,双向扩散模型已经通过自注意力获得了大约 $O(f^2)$ 的推理计算量,而真实模拟器仅需 $O(f)$ 的计算量。此外,由于我们的主要指标是局部准确性,这种退化不能仅由长视界漂移来解释。因此,问题不仅仅缺乏总计算量,而是未能将该计算量转化为用于预测依赖事件的、可扩展的串行计算。
从复杂性理论的角度来看,这并不令人困惑。视频扩散模型被要求解决一个本质上具有串行性的问题,但其去噪步骤并未提供可扩展的串行计算。为了精确阐述这一点,我们首先引入相关的复杂性类。 在可并行的一端,类 $TC^0$ 捕获多项式大小、常数深度的阈值电路;通俗地说,这些计算更接近于闭式捷径,而非逐步模拟。
6
第 7 页
在串行端,P-完全问题(P-complete problems)捕获了被认为无法高效并行化的多项式时间计算。¹
在我们的案例中,多球任务与经典的P-完全台球计算[19, 18]共享弹性碰撞基元。同时,在标准精度假设下,固定深度的Transformer骨干网络属于有界深度并行计算[20]。因此,固定深度的骨干网络不能成为随任务增长的串行计算的来源。自然的期望是,重复的去噪步骤提供了缺失的串行计算;我们现在展示为什么这在确定性视频预测中不会发生。
确定性视频预测 如果我们假设物理过程是确定性的,那么在给定系统初始状态的情况下,有效物理轨迹的集合是所有可能轨迹空间中的一个单点,因为从该点出发的正确轨迹只有一条,无论轨迹有多长。
给定视频的单个初始帧,我们可能不知道系统的精确初始状态。例如,我们可能只观察到弹跳球的位置,而没有观察到速度。然而,在这种情况下,我们只需要观察2帧即可确定每个球的位置和速度,从而确定系统的状态。一般来说,如果我们可以通过观察 O(1) 帧来确定系统的精确状态,那么从此之后只有一条有效的视频轨迹。这一条件称为完全可观测性(full observability)。
在这些假设下,视频预测问题简化为计算一个确定性函数:
$$ \text{帧} \quad O(1) \text{ 初始帧 } f \rightarrow \text{未来} $$
我们将正式建立两个问题,一个关于视频预测,一个关于状态预测。然后我们论证:
1. 如果视频预测问题可以由具有 TC0 骨干网络的扩散模型解决,那么其底层的状态预测问题也属于 TC0。
2. 弹跳球问题,事实上大多数状态预测问题都是 P-完全的,因此在计算复杂性理论的标准假设下,它们不属于 TC0。
3. 因此,大多数视频预测问题不能由具有 TC0 骨干网络的扩散模型解决。
从这个角度来看,扩散模型的缺陷在于,尽管每个串行步骤消耗 O(f²) 的并行计算资源,但它仅在 O(1) 个串行步骤内收敛。相比之下,自回归模型消耗 O(f) 个串行步骤,足以解决 P-完全问题。
—
¹ 此处,“高效并行化”意味着可以使用多项式总资源(如多项式大小的电路或多项式数量的处理器)来解决。如果没有此限制,串行深度通常可以通过宽度的指数级爆炸来降低,但这不被视为高效的并行算法[18]。与 P-完全问题的分离依赖于标准猜想(如 P ≠ NC),这些猜想被广泛相信但尚未证明。
第 8 页
4.1 问题形式化
假设我们给定一个确定性过程。令状态空间为 $\mathcal{X}$,确定性时间演化为 $\Phi : \mathcal{X} \rightarrow \mathcal{X}$。我们有一个观测函数 $F : \mathcal{X} \rightarrow \mathcal{Y}$,它接收一个状态 $x \in \mathcal{X}$ 并将其转换为图像。这里,$\mathcal{Y}$ 是所有可能图像的集合。例如,如果我们考虑图像为像素数组,则 $\mathcal{Y} = \mathbb{R}^{H \times W}$。
假设物理过程是完全可观测的。也就是说,我们假设存在一个常数 $f_0$,使得给定任意两条轨迹 $x_0, x_1 = \Phi(x_0), x_2 = \Phi(x_1), \dots ; \quad x'_0, x'_1 = \Phi(x'_0), x'_2 = \Phi(x'_1), \dots$, 如果 $F(x_0) = F(x'_0), F(x_1) = F(x'_1), \dots, F(x_{f_0}) = F(x'_{f_0})$,那么 $x_0 = x'_0$。 换句话说,如果我们观测到 $f_0 + 1$ 个连续帧 $F(x_0), F(x_1), \dots, F(x_{f_0})$,我们就可以完全确定 $x_0$。
我们还假设可观测性可以在常数时间内计算得出。也就是说,我们有一个常数时间算法,给定 $F(x_{0:f_0})$,返回 $x_{0:f_0}$。在弹球的情况下,这是显而易见的:给定两帧,我们可以通过计算它们的差值来找到球的速度。
关键点很简单。对于确定性视频预测,一旦条件帧确定了状态,就只有一个正确的未来视频。经过高斯加噪后,条件分布仍然以该唯一未来为中心,因此在任何固定噪声水平下的精确得分(score)包含在一步中恢复它所需的全部信息。因此,重复去噪并不会在骨干网络已经提供的计算基础上增加可扩展的串行计算,如图 5 所示。
基于此设置,我们可以定义两个形式化问题:
1. 视频片段预测:给定物理轨迹的初始视频片段 $F(x_{0:f_0})$ 和一个数字 $f$,计算其未来视频片段 $F(x_{f_0+1:f})$。 2. 状态预测:给定初始物理轨迹 $x_{0:f_0}$ 和一个数字 $f$,计算 $x_f$。
进一步假设我们有一个扩散模型可以解决以下问题:给定物理轨迹的初始视频片段 $y_{0:f_0} := F(x_{0:f_0})$ 和一个数字 $f$,计算其未来视频轨迹 $y_{f_0+1:f} := F(x_{f_0+1:f})$。
4.2 扩散建模
现在,我们指定扩散建模的含义。我们使用噪声条件得分匹配网络(NCSN)的形式化方法。其他形式化方法中的扩散模型可以转换为等效的 NCSN 扩散模型 [21]。完整的形式化方法见附录 A。
扩散建模是一种从条件概率分布中采样的技术。令 $w$ 为我们想要采样的对象,令 $u$ 为条件输入。$w$ 是样本空间中的一个元素,这里取为 $\mathbb{R}^d$,其中 $d$ 是某个正整数。^2 例如,在我们的视频建模案例中,条件是 $y_{0:f_0}$(初始视频片段),我们要采样的对象是 $y_{f_0+1:f}$(视频的其余部分),位于样本空间 $\mathbb{R}^{H \times W \times (f-f_0)}$ 中。
现在,我们定义前向扩散过程。我们使用标准的高斯扩散过程。该过程由噪声率函数 $\beta : [0, \infty) \rightarrow (0, \infty)$ 定义,并满足条件 $\int_0^\infty \beta(t) dt = \infty$。我们首先采样一个起点 $w_0 \sim \rho_0(w|u)$,然后以速率 $\beta(t)$ 逐步添加白噪声。累积效应是,在时刻 $t$,加噪样本具有如下分布: $$ w_t = \sqrt{1 – \sigma(t)^2} w_0 + \sigma(t) z, \quad z \sim \mathcal{N}(0, I_d), \quad (1) $$ 其中 $\sigma(t)^2 = 1 – e^{-\int_0^t \beta(\tau) d\tau}$ 是由于累积噪声引起的方差。
换句话说,$w_t$ 的条件概率分布(给定 $u$)是缩放后的 $\rho_0(\cdot|u)$ 与高斯函数的卷积。概率分布 $\rho(\cdot|u, t)$ 是缩放后的原始分布 $\rho_0(\cdot|u)$ 逐渐模糊的版本,从 $\rho(\cdot|u, 0) = \rho_0(\cdot|u)$ 开始,最终变为
^2 我们选择字母 $w, u$ 只是为了避免混淆,因为我们已经分配了字母 $x, y$。
8
第 9 页
当 $t \to \infty$ 时,$\rho(\cdot|u, \infty) = \mathcal{N}(0, I_d)$,此时我们失去了原始分布的所有痕迹,得到标准高斯分布。
定义得分函数 $$ s(w_t|u, t) := \nabla_{w_t} \log \rho(w_t|u, t). \quad (2) $$ 得分函数可用于定义一个反向随机过程,该过程从 $\mathcal{N}(0, I_d)$ 开始,最终回到原始分布 $\rho_0(\cdot|u)$。在 NCSN 形式化框架中,我们使用神经网络 $s_\theta$ 对其进行近似。该网络即所谓的“噪声条件得分网络”(NCSN)。随后,我们通过数值随机积分来近似反向过程。
精确的得分函数 $s$ 通常没有闭式解,因为 $\rho_0(w_0|u)$ 过于通用而无法进行积分。然而,如果 $w_0$ 是 $u$ 的确定性函数,则得分函数具有闭式解,这允许我们在一步中求解出 $w_0(u)$:
$$ w_0(u) = \sigma(t)^2 s(w_t|u, t) + w_t \frac{\sqrt{1 – \sigma(t)^2}}{\sigma(t)} \quad . \quad (3) $$
特别是,这意味着如果我们有一个计算得分函数的神经网络,我们可以利用它在任意选择的 $t > 0$ 和任意选择的 $w_t$ 下计算 $w_0(u)$。直观上,这是可能的,因为相应流匹配问题(flow-matching problem)中的流仅仅是直线,因此可以在不评估任何积分的情况下一步求解(图 5)。
现在,我们可以在此形式化框架下构建视频扩散模型。其骨干网络以初始视频片段 $y_{0:f_0}$、正整数 $f > f_0$、噪声水平 $t$ 以及噪声未来视频片段 $\hat{y}_{f_0+1:f}$ 作为输入。它输出噪声条件得分:
$$ s(\hat{y}_{f_0+1:f}|y_{0:f_0}, f, t) = \nabla_{\hat{y}_{f_0+1:f}} \log \rho(\hat{y}_{f_0+1:f}|y_{0:f_0}, t). \quad (4) $$
命题 4.1. 如果扩散模型解决了视频预测问题,且其 NCSN $s_\theta$ 是一个计算精确得分(2)的 $TC^0$ 网络,那么状态预测问题属于 $TC^0$。
证明。 我们通过一种仅调用一次 NCSN 的算法来解决状态预测问题。整个算法在 $TC^0$ 中运行。细节见附录 A。
评论。 假设得分函数被精确匹配是否不切实际?我们使用精确得分匹配是为了尽可能清晰地呈现核心论点,但结论并不要求完全相等。即使当 $s_\theta \approx s$ 时,只要对 $|s_\theta – s|$ 有足够强的上界,我们仍然可以证明状态预测问题属于 $TC^0$;参见 [22, App. F]。
此处考虑的扩散模型经过训练以近似得分,因此大的得分误差反映了优化失败或模型容量不足。增加模型规模和训练计算量应能改善得分估计。这使得我们的命题在大规模场景下更具相关性。
值得庆幸的是,我们的结果指向了一类不同的迭代生成模型。这类模型不仅可以训练每次迭代仅近似得分,还可以训练其中间状态以在迭代间执行并保留有用的计算。开发能够实现这种行为的目标函数是一个开放的研究方向。
5 讨论与局限性
测试平台隔离了依赖事件预测。硬球动力学是一种诊断性抽象:通过去除视觉真实性、语义歧义、随机性和开放世界的不确定性,它隔离了一个单一问题:视频扩散模型能否跟踪不断增长的依赖事件链?因此,串行性差距并非特指弹跳球或物理问题,而是指更广泛的一类任务,其预测需要通过中间状态的确定性转换链进行串行处理。
9
第 10 页
自回归并非万能解药 在我们的设定中,自回归之所以有效,是因为依赖关系主要是时间性的:每个短期的未来块依赖于最近的过去,因此串行生成与因果顺序相匹配。其他视觉推理任务未必需要以这种方式进行分解。视觉推理研究反而发现,早期全局规划或跨去噪步骤的渐进式细化 [2, 10, 11];此类任务无需分解为帧对齐的转换。仅当自回归的分解方式与任务依赖结构一致时,自回归才有效;否则,所需的串行计算必须来自深度、搜索、规划或其他机制。
此外,即使提供了更多的串行计算,也不能保证模型会利用它来跟踪事件依赖关系。在自然视频中,有限的模型容量还必须表示外观和随机性。这些相互竞争的需求可能会主导学习过程,使得模型——无论是自回归还是双向的——都倾向于生成视觉上合理的输出,而非忠实预测依赖事件。我们的受控测试平台消除了这些混淆因素,因此确立了明确的计算优势,但这并不保证模型在不受约束的真实世界视频上能取得成功。
局限性 我们的理论适用于确定性视频预测,且是单向的:它并未描述去噪步骤未能提供可扩展串行计算的每种情况。随机性或噪声可能会破坏假设,但这并不意味着扩散模型获得了可扩展的串行计算。事实上,我们在附录 D 中的振动墙壁硬球动力学变体显示了相同的定性模式:即使确定性假设被违反,自回归生成在局部一致性方面仍优于双向去噪。这表明,违反定理的假设并不一定会消除串行性差距。
6 相关工作
视频模型作为模拟器和推理器 视频生成器越来越被视为不仅仅是合成系统:它们被提议为世界模拟器、物理推理器和视觉规划模型 [1, 15, 2, 23, 24]。这导致了测试物理一致性、时间连贯性和物理常识的基准测试,包括 PhyGenBench、T2VPhysBench、Physics-IQ、Morpheus、VBench 和 VBench2 [3–9]。最近的迷宫求解研究将这一观点推向视觉规划和推理 [2, 10]。合成物理环境提供了一种互补的方法来消除视觉真实性这一混淆因素:Kang 等人 [25] 在 PHYRE 物理模拟器 [26] 中研究视频扩散模型,表明即使在视觉简单的设置中,模型也可能难以掌握物理定律。我们的硬球数据集遵循这种受控评估理念,但侧重于以下问题:当真实情况明确且视觉真实性不是混淆因素时,视频扩散模型能否跟踪一系列依赖事件?
视频扩散架构与推理范式 现代视频生成器通常使用带有时间注意力的 Transformer 或 U-Net 骨干网络,对时空张量应用潜在扩散 [27–29, 15]。主流的推理范式是双向去噪:所有帧通过一个具有有限深度的骨干网络进行联合细化,该网络可以访问过去和未来的帧。最近的工作探索了用于流式和长视界生成的自回归和滑动窗口扩散 [30–32]。我们将这些推理选择不仅视为工程权衡,更视为在不同时间点上分配串行计算的不同方式。
视频扩散中的其他时间瓶颈 先前的工作通过噪声重调度 [33, 34]、联合外观-运动表示 [35]、时间正则化 [36] 或在细化过程中保留少步运动先验 [12] 来解决时间瓶颈问题。这些方法改善了时间结构;我们的关注点不同:更好的先验可能会提高连贯性,但并未解决双向去噪在长依赖链中缺乏可扩展串行计算的问题。
我们的解释将这些实证失败与关于 Transformer 并行性、深度-宽度权衡以及串行扩展的先前工作联系起来,后者认为模型的深度、宽度和去噪步骤并非可互换的计算资源 [20, 37, 38, 22]。
致谢与资金披露
我们要感谢 Alexei Efros 不断与我们进行辩论。我们要感谢 Nicolas Dufour 为提高实验严谨性提出的建议。我们要感谢 Amil Dravid 提出的添加
第 11 页
向实验部分补充“更多点”。我们感谢 Berkeley AI Research 的其他成员提供的有益讨论。KP 和 YB 由 ONR MURI 资助。
参考文献
[1] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, 和 Aditya Ramesh。Video generation models as world simulators, 2024. URL https://openai.com/research/video-generation-models-as-world-simulators.
[2] Thaddäus Wiedemer, Yuxuan Li, Paul Vicol, Shixiang Shane Gu, Nick Matarese, Kevin Swersky, Been Kim, Priyank Jaini, 和 Robert Geirhos。Video models are zero-shot learners and reasoners, 2025. URL https://arxiv.org/abs/2509.20328.
[3] Fanqing Meng, Jiaqi Liao, Xinyu Tan, Wenqi Shao, Quanfeng Lu, Kaipeng Zhang, Yu Cheng, Dianqi Li, Yu Qiao, 和 Ping Luo。Towards world simulator: Crafting physical commonsense-based benchmark for video generation, 2024. URL https://arxiv.org/abs/2410.05363.
[4] Xuyang Guo, Jiayan Huo, Zhenmei Shi, Zhao Song, Jiahao Zhang, 和 Jiale Zhao。T2vphysbench: A first-principles benchmark for physical consistency in text-to-video generation, 2025. URL https://arxiv.org/abs/2505.00337.
[5] Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, 和 Robert Geirhos。Do generative video models understand physical principles?, 2025. URL https://arxiv.org/abs/2501.09038.
[6] Tim Rädsch, Yuki M. Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, 和 Carsten T. Lüth。Physics-iq verified, 2026. URL https://arxiv.org/abs/2606.18943.
[7] Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark Bodracska, Nicu Sebe, Andrii Zadaianchuk, 和 Efstratios Gavves。Evaluating newtonian mechanics in video generative models with real physical systems, 2026. URL https://arxiv.org/abs/2504.02918.
[8] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, Yaohui Wang, Xinyuan Chen, Limin Wang, Dahua Lin, Yu Qiao, 和 Ziwei Liu。Vbench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 21807–21818, June 2024.
[9] Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Lulu Gu, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, 和 Ziwei Liu。Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness, 2025. URL https://arxiv.org/abs/2503.21755.
[10] Kaleb Newman, Tyler Zhu, 和 Olga Russakovsky。Video models reason early: Exploiting plan commitment for maze solving, 2026. URL https://arxiv.org/abs/2603.30043.
[11] Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, 和 Lei Yang。Demystifying video reasoning. In Proceedings of the European Conference on Computer Vision, 2026. URL https://arxiv.org/abs/2603.16870.
[12] Woojung Han, Seil Kang, Youngjun Jun, Min-Hung Chen, Fu-En Yang, 和 Seong Jae Hwang。Physics in 2-steps: Locking motion priors before visual refinement erases them. In Proceedings of the 43rd International Conference on Machine Learning, 2026. URL https://arxiv.org/abs/2606.06361.
[13] Nanye Ma, Shangyuan Tong, Haolin Jia, Hexiang Hu, Yu-Chuan Su, Mingda Zhang, Xuan Yang, Yandong Li, Tommi Jaakkola, Xuhui Jia, 和 Saining Xie。Inference-time scaling for diffusion models beyond scaling denoising steps, 2025. URL https://arxiv.org/abs/2501.09732.
[14] William Peebles 和 Saining Xie。Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 4195–4205, October 2023.
[15] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen,
11
第 12 页
Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, and Ziyu Liu. Wan: Open and advanced large-scale video generative models, 2025. URL https://arxiv.org/abs/2503.20314.
[16] Juechu Dong, Boyuan Feng, Driss Guessous, Yanbo Liang, and Horace He. Flex attention: A programming model for generating optimized attention kernels. arXiv preprint arXiv:2412.05496, 2(3):4, 2024.
[17] Rupesh K Srivastava, Klaus Greff, and Jürgen Schmidhuber. Training very deep networks. In C. Cortes, N. Lawrence, D. Lee, M. Sugiyama, and R. Garnett, editors, Advances in Neural Information Processing Systems, volume 28. Curran Associates, Inc., 2015. URL https://proceedings.neurips.cc/paper_ files/paper/2015/file/215a71a12769b056c3c32e7299f1c5ed-Paper.pdf.
[18] Raymond Greenlaw, H. James Hoover, and Walter L. Ruzzo. Limits to Parallel Computation: P- Completeness Theory. Oxford University Press, June 1995. ISBN 9780197560518. doi: 10.1093/oso/ 9780195085914.001.0001. URL http://dx.doi.org/10.1093/oso/9780195085914.001.0001.
[19] Edward Fredkin and Tommaso Toffoli. Conservative logic. International Journal of Theoretical Physics, 21(3-4):219–253, April 1982. ISSN 1572-9575. doi: 10.1007/bf01857727. URL http://dx.doi.org/ 10.1007/BF01857727.
[20] William Merrill and Ashish Sabharwal. The parallelism tradeoff: Limitations of log-precision transformers. Transactions of the Association for Computational Linguistics, 11:531–545, 2023. ISSN 2307-387X. doi: 10.1162/tacl_a_00562. URL http://dx.doi.org/10.1162/tacl_a_00562.
[21] Calvin Luo. Understanding diffusion models: A unified perspective, 2022. URL https://arxiv.org/ abs/2208.11970.
[22] Yuxi Liu, Konpat Preechakul, Kananart Kuwaranancharoen, and Yutong Bai. The serial scaling hypothesis, 2026. URL https://arxiv.org/abs/2507.12549.
[23] Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, and Hokin Deng. A very big video reasoning suite. In Proceedings of the 43rd International Conference on Machine Learning, 2026. URL https://arxiv.org/abs/2602.20159.
[24] Yutong Bai, Danny Tran, Amir Bar, Yann LeCun, Trevor Darrell, and Jitendra Malik. Whole-body conditioned egocentric video prediction. In D. Belgrave, C. Zhang, H. Lin, R. Pascanu, P. Koniusz, M. Ghassemi, and N. Chen, editors, Advances in Neural Information Processing Systems, volume 38, pages 164375–164418. Curran Associates, Inc., 2025. URL https://proceedings.neurips.cc/paper_ files/paper/2025/file/f0552f14388d95b19740dee809f5cad1-Paper-Conference.pdf.
[25] Bingyi Kang, Yang Yue, Rui Lu, Zhijie Lin, Yang Zhao, Kaixin Wang, Gao Huang, and Jiashi Feng. How far is video generation from world model: A physical law perspective. In Aarti Singh, Maryam Fazel, Daniel Hsu, Simon Lacoste-Julien, Felix Berkenkamp, Tegan Maharaj, Kiri Wagstaff, and Jerry Zhu, editors, Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pages 28991–29017. PMLR, 13–19 Jul 2025. URL https://proceedings.mlr.press/v267/kang25g.html.
[26] Anton Bakhtin, Laurens van der Maaten, Justin Johnson, Laura Gustafson, and Ross Girshick. Phyre: A new benchmark for physical reasoning. In H. Wallach, H. Larochelle, A. Beygelzimer, F. d'Alché-Buc, E. Fox, and R. Garnett, editors, Advances in Neural Information Processing Systems, volume 32. Cur- ran Associates, Inc., 2019. URL https://proceedings.neurips.cc/paper_files/paper/2019/ file/4191ef5f6c1576762869ac49281130c9-Paper.pdf.
[27] Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, and David Fleet. Video diffusion models. In S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, and A. Oh, editors, Advances in Neural Information Processing Systems, volume 35, pages 8633–8646. Curran As- sociates, Inc., 2022. URL https://proceedings.neurips.cc/paper_files/paper/2022/file/ 39235c56aef13fb05a6adc95eb9d8d66-Paper-Conference.pdf.
12
第 13 页
[28] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, Varun Jampani, 和 Robin Rombach。Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023. URL https://arxiv.org/abs/ 2311.15127.
[29] Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, Yuanzhen Li, Michael Rubinstein, Tomer Michaeli, Oliver Wang, Deqing Sun, Tali Dekel, 和 Inbar Mosseri。Lumiere: A space-time diffusion model for video generation. In SIGGRAPH Asia 2024 Conference Papers, SA ’24, pages 1–11. ACM, December 2024. doi: 10.1145/ 3680528.3687614. URL http://dx.doi.org/10.1145/3680528.3687614.
[30] Wenming Weng, Ruoyu Feng, Yanhui Wang, Qi Dai, Chunyu Wang, Dacheng Yin, Zhiyuan Zhao, Kai Qiu, Jianmin Bao, Yuhui Yuan, Chong Luo, Yueyi Zhang, 和 Zhiwei Xiong。Art•v: Auto-regressive text-to-video generation with diffusion models. In 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pages 7395–7405. IEEE, June 2024. doi: 10.1109/cvprw63382. 2024.00735. URL http://dx.doi.org/10.1109/CVPRW63382.2024.00735.
[31] Desai Xie, Zhan Xu, Yicong Hong, Hao Tan, Difan Liu, Feng Liu, Arie Kaufman, 和 Yang Zhou。 Progressive autoregressive video diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, pages 6376–6386, June 2025.
[32] Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang。From slow bidirectional to fast autoregressive video diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 22963–22974, June 2025.
[33] Agrim Gupta, Lijun Yu, Kihyuk Sohn, Xiuye Gu, Meera Hahn, Fei-Fei Li, Irfan Essa, Lu Jiang, 和 José Lezama。Photorealistic Video Generation with Diffusion Models, pages 393–411. Springer Nature Switzerland, November 2024. ISBN 9783031729867. doi: 10.1007/978-3-031-72986-7_23. URL http://dx.doi.org/10.1007/978-3-031-72986-7_23.
[34] Haonan Qiu, Menghan Xia, Yong Zhang, Yingqing He, Xintao Wang, Ying Shan, 和 Ziwei Liu。Freenoise: Tuning-free longer video diffusion via noise rescheduling, 2024. URL https://arxiv.org/abs/2310. 15169.
[35] Hila Chefer, Uriel Singer, Amit Zohar, Yuval Kirstain, Adam Polyak, Yaniv Taigman, Lior Wolf, 和 Shelly Sheynin。VideoJAM: Joint appearance-motion representations for enhanced motion generation in video models. In Aarti Singh, Maryam Fazel, Daniel Hsu, Simon Lacoste-Julien, Felix Berkenkamp, Tegan Maharaj, Kiri Wagstaff, 和 Jerry Zhu, editors, Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pages 7595–7616. PMLR, 13–19 Jul 2025. URL https://proceedings.mlr.press/v267/chefer25a.html.
[36] Harold Haodong Chen, Haojian Huang, Xianfeng Wu, Yexin Liu, Yajing Bai, Wen-Jie Shu, Harry Yang, 和 Ser-Nam Lim。Temporal regularization makes your video generator stronger, 2025. URL https://arxiv.org/abs/2503.15417.
[37] Matus Telgarsky。benefits of depth in neural networks. In Vitaly Feldman, Alexander Rakhlin, 和 Ohad Shamir, editors, 29th Annual Conference on Learning Theory, volume 49 of Proceedings of Machine Learning Research, pages 1517–1539, Columbia University, New York, New York, USA, 23–26 Jun 2016. PMLR. URL https://proceedings.mlr.press/v49/telgarsky16.html.
[38] Lijie Chen, Binghui Peng, 和 Hongxun Wu。Theoretical limitations of multi-layer transformer, 2024. URL https://arxiv.org/abs/2412.02975.
[39] Brian D.O. Anderson。Reverse-time diffusion equation models. Stochastic Processes and their Applications, 12(3):313–326, May 1982. ISSN 0304-4149. doi: 10.1016/0304-4149(82)90051-5. URL http://dx. doi.org/10.1016/0304-4149(82)90051-5.
[40] Hao Li, Yang Zou, Ying Wang, Orchid Majumder, Yusheng Xie, R. Manmatha, Ashwin Swaminathan, Zhuowen Tu, Stefano Ermon, 和 Stefano Soatto。On the scalability of diffusion-based text-to-image generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 9400–9409, June 2024.
[41] Nicolas Dufour, Alexei A. Efros, 和 Patrick Pérez。The fid lottery: Quantifying hidden randomness in generative-model evaluation, 2026. URL https://arxiv.org/abs/2606.20536.
13
第 14 页
[42] Charles R. Harris, K. Jarrod Millman, Stéfan J. van der Walt, Ralf Gommers, Pauli Virtanen, David Cournapeau, Eric Wieser, Julian Taylor, Sebastian Berg, Nathaniel J. Smith, Robert Kern, Matti Picus, Stephan Hoyer, Marten H. van Kerkwijk, Matthew Brett, Allan Haldane, Jaime Fernández del Río, Mark Wiebe, Pearu Peterson, Pierre Gérard-Marchant, Kevin Sheppard, Tyler Reddy, Warren Weckesser, Hameer Abbasi, Christoph Gohlke, 和 Travis E. Oliphant。使用 numpy 进行数组编程。Nature, 585 (7825):357–362, 2020年9月。ISSN 1476-4687。doi: 10.1038/s41586-020-2649-2。URL http: //dx.doi.org/10.1038/s41586-020-2649-2。
14
第 15 页
A 理论细节
如前所述,令 $w$ 为我们希望采样的对象,令 $u$ 为条件输入。$w$ 是样本空间中的一个元素,此处取为 $\mathbb{R}^d$,其中 $d$ 为某个正整数。
前向扩散过程由噪声率函数 $\beta: [0, \infty) \to (0, \infty)$ 定义,并满足条件 $\int_0^\infty \beta(t)dt = \infty$。我们首先从起始点 $w_0 \sim \rho_0(w|u)$ 采样,然后定义前向随机过程:
$$ w_{t+dt} = \underbrace{w_t – \frac{1}{2}\beta(t)w_t dt}_{\text{漂移}} + \underbrace{\sqrt{\beta(t)}dW_t}_{\text{噪声}}, $$
对于所有 $t \in [0, \infty)$,其中 $W_t$ 是 $\mathbb{R}^d$ 中的标准布朗运动。$W$ 代表“维纳”(Wiener),因为这也称为维纳过程。它可以被概念性地视为 $dW_t \sim \mathcal{N}(0, dt I_d)$。这是一个具有闭式解的随机微分方程:
$$ w_t = \sqrt{1 – \sigma(t)^2} w_0 + \sigma(t) z, \quad z \sim \mathcal{N}(0, I_d), $$
其中 $\sigma(t)^2 = 1 – e^{-\int_0^t \beta(\tau)d\tau}$ 是由于累积噪声引起的方差。
换句话说,$w_t$ 在给定 $u$ 条件下的概率分布是 $\rho_0(\cdot|u)$ 的缩放版本与高斯函数的卷积。概率分布 $\rho(\cdot|u, t)$ 是原始 $\rho_0(\cdot|u)$ 逐渐模糊的版本,从 $\rho(\cdot|u, 0) = \rho_0(\cdot|u)$ 开始,最终在 $\lim_{t\to\infty}\rho(\cdot|u, \infty) = \mathcal{N}(0, I_d)$ 结束,此时我们失去了原始信息的所有痕迹,并获得标准高斯分布。
定义得分函数(score function)
$$ s(w_t|u, t) := \nabla_{w_t} \log \rho(w_t|u, t). $$
有了得分函数,相同的过程可以表示为时间反转形式 [39]:
$$ w_{t-dt} = w_t + \frac{1}{2}\beta(t)w_t dt + \beta(t) \underbrace{s(w_t|u, t) dt}_{\text{得分函数}} + \sqrt{\beta(t)}dW_t. $$
在 NCSN 形式化中,我们有一个神经网络 $s_\theta \approx s$。然后通过数值随机积分求解反向过程:
$$ \hat{w}_{t-\Delta t} = \hat{w}_t + \frac{1}{2}\beta(t)\hat{w}_t \Delta t + \beta(t)s_\theta(\hat{w}_t|u, t)\Delta t + \sqrt{\beta(t)}\Delta W_t. $$
精确的得分函数 $s$ 通常没有闭式解,因为 $\rho_0(w_0|u)$ 过于通用而无法积分。然而,如果 $w_0$ 是 $u$ 的确定性函数,那么
$$ \log \rho(w_t|u, t) = -\frac{1}{2\sigma(t)^2} \left\| w_t – \sqrt{1 – \sigma(t)^2} w(u) \right\|^2 + \text{Const} $$
$$ s(w_t|u, t) = \frac{-\sigma(t)^2 w_0(u) – w_t}{\sigma(t)^2}. $$
因此,我们实际上能够使用得分函数一步求解出 $w_0(u)$:
$$ w_0(u) = \sigma(t)^2 s(w_t|u, t) + \sqrt{1 – \sigma(t)^2} w_t. $$
命题 4.1 的证明。
1. 将 $t$ 设为任意常数。任何常数都可以。例如,$t := 1$ 即可。 2. 将 $\hat{y}_{f_{0+1:f,t}}$ 设为任意常数。任何常数都可以。例如,这就可以:
$$ \hat{y}_{f_{0+1:f,t}} = (0, 0, \dots, 0), $$
其中 $0$ 代表空白图像。
第 16 页
3. 计算得分 st := s(ˆyf0+1:f|y0:f0, f, t) 使用 NCSN 骨干网络。 4. 求解未来视频片段
σ(t)2st + ˆyf0+1:f,t yf0+1:f := . p1 −σ(t)2 5. 将视频轨迹的最后片段反演回其状态: xf−f0:f = F −1(yf−f0:f).
6. 输出 xf。 根据假设,NCSN 骨干网络是一个 TC0 网络,且其他每个步骤也都在 O(1) 串行时间内运行。因此,该算法属于 TC0,因此状态预测问题也属于 TC0。
B 数值结果
表 1:不同视频长度和推理分解下的结果。双向、块状和自回归扩散模型在 n = 5 个硬球动力学视频上的物理准确性和视觉保真度,视频长度 f 范围各异。较低的 ∆x(GT)、∆x(1) 和 ∆x(5) 表示更高的物理准确性;较高的 IoU 表示更高的视觉保真度。结果支持观察结果 1 和 3:双向模型在更长的依赖事件链中性能下降,而时间串行化提高了局部物理准确性。 类型 dmodel nlayers nparams TFLOPs ∆x(GT) ↓ ∆x(1) ↓ ∆x(5) ↓ IoU ↑ f = 25 帧,n = 5 个球 Bidir 768 30 217M 10.4 1.441 0.197 0.799 0.703 Bidir 1536 30 867M 39.9 1.265 0.160 0.670 0.726 AR 768 30 217M 7.3 1.179 0.166 0.664 0.714 AR 1536 30 867M 28.1 1.042 0.148 0.613 0.730
f = 33 帧,n = 5 个球 Bidir 768 30 217M 13.8 2.047 0.210 0.873 0.693 Bidir 1536 30 867M 52.0 1.944 0.164 0.718 0.725 AR 768 30 217M 10.3 1.905 0.175 0.712 0.705 AR 1536 30 867M 39.6 1.645 0.142 0.604 0.735
f = 41 帧,n = 5 个球 Bidir 768 30 217M 17.2 2.581 0.227 0.952 0.696 Bidir 1536 30 867M 64.4 2.402 0.200 0.856 0.698 AR 768 30 217M 13.4 2.423 0.167 0.695 0.712 AR 1536 30 867M 51.3 2.165 0.142 0.606 0.732
f = 49 帧,n = 5 个球 Bidir 768 30 217M 20.9 2.923 0.261 1.055 0.691 Bidir 1536 30 867M 77.0 2.868 0.205 0.883 0.704 Block-3 768 30 217M 16.9 2.749 0.182 0.762 0.713 Block-3 1536 30 867M 63.7 2.675 0.174 0.716 0.705 Block-2 768 30 217M 16.7 2.717 0.169 0.708 0.715 Block-2 1536 30 867M 63.4 2.578 0.145 0.620 0.731 AR 768 30 217M 16.6 2.798 0.178 0.739 0.703 AR 1536 30 867M 63.1 2.548 0.142 0.607 0.733
16
第 17 页
表 2:单球控制作为非串行设置。双向和自回归扩散模型在长度为 $f$ 的 $n=1$ 硬球动力学视频上的物理准确性和视觉保真度。与多球设置不同,更长的单球视频不会引入更长的依赖事件链。结果支持观察 2:在没有串行依赖的情况下,双向–自回归差距在很大程度上消失了。
| | $\Delta x(\text{GT}) \downarrow$ | $\Delta x(5) \downarrow$ | $\Delta x(5) \downarrow$ | $\text{IoU} \uparrow$ | Type | $d_{\text{model}}$ | $n_{\text{layers}}$ | $n_{\text{params}}$ | TFLOPs | | :— | :—: | :—: | :—: | :—: | :— | :—: | :—: | :—: | :—: | | | $n=1$ | $n=1$ | $n=5$ | $n=1$ | | | | | | | $f = 25$ 帧 | | | | | | | | | | | Bidir | 768 | 30 | 217M | 10.4 | 0.310 | 0.220 | 0.799 | 0.823 | | AR | 768 | 30 | 217M | 7.3 | 0.162 | 0.201 | 0.664 | 0.819 | | $f = 49$ 帧 | | | | | | | | | | | Bidir | 768 | 30 | 217M | 20.9 | 1.417 | 0.246 | 1.055 | 0.810 | | AR | 768 | 30 | 217M | 16.6 | 0.471 | 0.220 | 0.739 | 0.815 |
表 3:更多的去噪步骤并不能缩小串行性差距。具有 $T \in \{10, 20, 50, 100, 200\}$ 个去噪步骤的双向扩散模型在长度为 $f$ 的 $n=5$ 硬球动力学视频上的局部物理准确性。在适度的步骤数之后,性能趋于平稳,而更长的视频仍然更难处理。结果支持观察 4:去噪深度不能为更长的依赖事件链提供可扩展的串行计算。
| | $\Delta x(5) \downarrow$ | $\Delta x(5) \downarrow$ | $\Delta x(5) \downarrow$ | $\Delta x(5) \downarrow$ | $\Delta x(5) \downarrow$ | Type | $d_{\text{model}}$ | $n_{\text{layers}}$ | TFLOPs | | :— | :—: | :—: | :—: | :—: | :—: | :— | :—: | :—: | :—: | | | $T=10$ | $T=20$ | $T=50$ | $T=100$ | $T=200$ | | | | | | $f = 25$ 帧,$n=5$ 球 | | | | | | | | | | | Bidir | 1536 | 30 | 39.9 | 0.690 | 0.667 | 0.670 | 0.679 | 0.689 | | $f = 33$ 帧,$n=5$ 球 | | | | | | | | | | | Bidir | 1536 | 30 | 52.0 | 0.746 | 0.719 | 0.718 | 0.724 | 0.740 | | $f = 41$ 帧,$n=5$ 球 | | | | | | | | | | | Bidir | 1536 | 30 | 64.4 | 0.946 | 0.886 | 0.856 | 0.847 | 0.848 | | $f = 49$ 帧,$n=5$ 球 | | | | | | | | | | | Bidir | 1536 | 30 | 77.0 | 0.991 | 0.931 | 0.883 | 0.889 | 0.916 |
表 4:深度扩展比宽度扩展更有效。具有不同宽度 $d_{\text{model}}$ 和深度 $n_{\text{layers}}$ 的双向扩散模型在 $n=5$ 硬球动力学视频上的物理准确性和视觉保真度。在大约 30 层之前,深度比宽度更能提高物理准确性,超过该层数后,进一步的改进尚不清楚。结果支持观察 5:主干深度比单独使用宽度更有效地提供有用的串行计算。
| Type | $d_{\text{model}}$ | $n_{\text{layers}}$ | $n_{\text{params}}$ | TFLOPs | $\Delta x(\text{GT}) \downarrow$ | $\Delta x(1) \downarrow$ | $\Delta x(5) \downarrow$ | $\text{IoU} \uparrow$ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | $f = 49$ 帧,$n=5$ 球 | | | | | | | | | | Bidir | 640 | 30 | 151M | 14.9 | 2.973 | 0.307 | 1.172 | 0.665 | | Bidir | 768 | 20 | 146M | 14.0 | 3.038 | 0.403 | 1.420 | 0.640 | | Bidir | 768 | 30 | 217M | 20.9 | 2.923 | 0.261 | 1.055 | 0.691 | | Bidir | 768 | 60 | 430M | 41.7 | 2.839 | 0.233 | 0.950 | 0.696 | | Bidir | 768 | 90 | 643M | 62.6 | 2.788 | 0.210 | 0.881 | 0.700 | | Bidir | 1152 | 10 | 169M | 14.8 | 3.076 | 0.416 | 1.466 | 0.653 | | Bidir | 1152 | 20 | 329M | 29.7 | 2.941 | 0.261 | 1.060 | 0.690 | | Bidir | 1152 | 30 | 488M | 44.5 | 2.822 | 0.227 | 0.951 | 0.694 | | Bidir | 1152 | 50 | 807M | 74.2 | 2.739 | 0.251 | 1.000 | 0.676 | | Bidir | 1536 | 10 | 301M | 25.7 | 2.939 | 0.324 | 1.230 | 0.680 | | Bidir | 1536 | 30 | 867M | 77.0 | 2.868 | 0.205 | 0.883 | 0.704 |
17
第 18 页
C 定性结果
Bidir
0-5 AR
28 29 30 32 33 35 36 38
Bidir
0-5 AR
32 33 34 35 36 37 38 40
Bidir
0-5 AR
28 29 30 32 33 35 36 38
Bidir
0-5 AR
20 22 24 26 29 31 33 36
(a)
图 6:定性失败案例。我们比较了具有 $d_{model} = 1536$ 和 $n_{layers} = 30$ 的双向和自回归模型输出。左列显示了带有运动轨迹的共享条件帧;其余列显示了 8 个输出帧,帧索引位于下方。粗边框突出了出现失败的帧。双向输出表现出状态一致性失败,如穿模、球数违规和颜色身份违规,而自回归对应项则保持更高的物理一致性。
18
第 19 页
Bidir
0-5 AR
27 28 29 30 32 33 34 36
Bidir
0-5 AR
23 24 25 27 28 30 31 33
Bidir
0-5 AR
20 22 24 26 28 30 32 35
(b)
图 6:定性失败案例,续。插图遵循与图 6a 相同的格式。
D 振动墙壁硬球动力学
在第 4 节中,我们构建了确定性视频预测的理论:在给定完全观测的初始状态条件下,未来轨迹是唯一的。然而,自然视频通常涉及随机性、部分可观测性或未被建模的扰动。为了测试串行性差距是否在确定性设置之外依然存在,我们在硬球动力学数据集的随机变体上进行了初步实验。
在这个振动墙壁变体中,墙壁碰撞不再完全确定。每当球从墙壁反弹时,我们以随机量扰动其速度
safter = |sbefore + δs|, δs ∼Unif[−6, 6], 同时保持碰撞后速度的方向不变。因此,即使初始状态相同,未来轨迹也不再唯一:不同的墙壁振动会导致不同的有效 rollout。
振动墙壁设置破坏了确定性理论中使用的质点假设,但它并未消除所有的串行结构。在振动墙壁碰撞之间,运动保持确定性,并遵循与原始硬球系统中相同的局部物理定律。因此,我们仅在确定性片段上评估局部物理一致性。具体而言,我们计算 rollout-5 误差 ∆x(5),但排除任何五步 rollout 窗口中包含球与墙壁碰撞的帧。这隔离了生成的轨迹在动力学确定的区间内是否在局部保持一致。
图 7 中的结果是初步的,我们并不声称这种简单的振动墙壁扰动完全捕捉到了自然视频的歧义性。尽管如此,相同的定性趋势依然存在:双向去噪在局部物理一致性方面仍劣于具有更有效串行计算的推理方案。这表明确定性理论揭示了串行性差距背后的一个清晰机制,但该现象可能超出定理的精确假设范围。
19
第 20 页
↓)1.6 双向扩散 nlayers = 30 ( 自回归 ∆x(5) 1.4 非振动 振动 1.2 误差 1.0
0.8 Rollout-5 0.6 25 33 41 49 帧数 f (∝ 串行复杂度) 图 7:振动墙壁硬球动力学的初步结果。我们通过扰动每次墙壁碰撞后球的速度来引入随机性,同时保持速度方向不变。评估仅在确定性片段上报告 rollout-5 误差,排除包含墙壁碰撞的窗口。尽管是初步结果,但结果显示与确定性设置相同的定性模式,表明串行性差距并非仅仅是全局确定性 Rollout 的产物。
表 5:在振动墙壁动力学下,模型趋势保持一致。双向扩散和自回归扩散模型在 n = 5 个不同长度 f 的振动墙壁硬球视频上的物理准确性和视觉质量。 类型 dmodel nlayers nparams TFLOPs ∆x(GT) ↓ ∆x(1) ↓ ∆x(5) ↓ IoU ↑ f = 25 帧, n = 5 个球, 振动墙壁 双向 768 30 217M 10.4 1.941 0.312 1.135 0.670 自回归 768 30 217M 7.3 1.726 0.197 0.826 0.718
f = 33 帧, n = 5 个球, 振动墙壁 双向 768 30 217M 13.8 2.454 0.354 1.242 0.660 自回归 768 30 217M 10.3 2.281 0.177 0.768 0.728
f = 41 帧, n = 5 个球, 振动墙壁 双向 768 30 217M 17.2 2.895 0.397 1.383 0.660 自回归 768 30 217M 13.4 2.720 0.177 0.762 0.722
f = 49 帧, n = 5 个球, 振动墙壁 双向 768 30 217M 20.9 3.163 0.421 1.447 0.662 自回归 768 30 217M 16.6 3.017 0.167 0.727 0.726
E 排除其他解释
我们测试观察到的自回归生成的优势是否可以用优化或初始化来解释,而不是推理分解。具体而言,我们改变训练批次大小,在独立种子下重复训练,并使用从预训练 Wan 检查点初始化的模型进行微调。在每种情况下,自回归与双向扩散之间的定性差距依然存在。
E.1 批次大小
扩散训练对批次大小可能很敏感,先前的缩放实验报告称,在较大的批次大小下生成指标有所改善 [40]。由于计算限制使我们的主要实验仅限于批次大小 b = 64,因此我们用 b = 256 重复了自回归与双向扩散的比较。我们保持所有其他设置不变,包括 2 × 10−4 的学习率,我们没有针对更大的批次重新调整该学习率。结果如图 8 所示。尽管 b = 256 模型的绝对误差较高,这可能是由于未重新调整学习率,但在这两个批次大小下,串行性差距依然存在。
20
第 21 页
↓) 双向扩散 dmodel = 768, nlayers = 30 ( 1.2 自回归 (AR)
b = 64 ∆x(5) 1.0 b = 256 误差 0.8
0.6 Rollout-5 25 33 41 49 帧数 f (∝ 串行复杂度) 图 8:批量大小消融实验。Rollout-5 误差随视频长度 f 的变化情况,针对使用 b ∈{64, 256} 训练的双向扩散和自回归模型。b = 256 的模型误差略高,可能是因为学习率未重新调整。在两种批量大小下,双向扩散的误差随 f 的增长速度比自回归更快,从而保留了串行性差距。
真实值误差 ( ↓) Rollout-5 误差 ∆x(5) ( ↓) IoU ( ↑) 2.95 1.1 0.705 2.90 1.0 0.700
2.85 0.9 0.695
2.80 0.8 0.690
0.7 0.685 2.75 自回归 (AR) 双向扩散 自回归 (AR) 双向扩散 自回归 (AR) 双向扩散
图 9:对训练种子变化的鲁棒性。自回归 (AR) 和双向扩散 (Bidir) 模型在三次独立训练运行中的平均全局轨迹误差 ∆x(GT)、Rollout-5 误差 ∆x(5) 和 IoU。误差棒和阴影区域表示 ±1 个标准差。AR 具有更低的误差和更高的 IoU,且区间不重叠。
真实值误差 ( ↓) 2.0 Rollout-5 误差 ∆x(5) ( ↓) 0.75 IoU ( ↑) 自回归 (从头训练) 3.4
双向扩散 (从头训练) 3.2 1.5 0.70 3.0 双向扩散 (从头训练) 0.65 2.8 1.0 双向扩散 (从头训练)
2.6 自回归 (从头训练) 自回归 (从头训练) 0.60 0.5 2.4 Wan 自回归 Wan 双向扩散 Wan 自回归 Wan 双向扩散 Wan 自回归 Wan 双向扩散 (基于预训练微调) (基于预训练微调) (基于预训练微调)
图 10:Wan 初始化保留了模型排序,但降低了绝对性能。基于 Wan2.1-T2V-1.3B 微调的模型的全局轨迹误差 ∆x(GT)、Rollout-5 误差 ∆x(5) 和 IoU。圆圈显示微调后的模型,虚线显示从头训练的相应模型。AR 比 Bidir 保持更低的误差和更高的 IoU,但两个微调模型的表现均低于其从头训练的对应模型,这可能是由于分辨率不匹配以及分布外 (out-of-distribution) 的硬球动力学任务所致。
21
第 22 页
E.2 训练种子变化
独立的扩散模型训练运行可能因参数初始化、小批量顺序以及采样的训练噪声而产生不同的评估结果 [41]。因此,我们在 $d_{model} = 768$ 和 $n_{layers} = 30$ 的配置下,使用 $f = 49$ 帧和 $n = 5$ 个球,对每个模型使用三个独立的种子进行训练,并在 1,024 个样本上评估每次运行。结果如图 9 所示。在所有指标上,误差棒不重叠且分离良好,表明自回归的优势对于训练种子的变化是稳健的,而非有利种子彩票的结果。
E.3 从预训练检查点微调
为了测试预训练是否改变模型排序,我们将从头训练的模型与从 Wan-AI/Wan2.1-T2V-1.3B 检查点 [15] 初始化并在硬球数据集上微调的变体进行比较。我们使用相同的训练配置,仅将微调时的学习率从 $2 \times 10^{-4}$ 更改为 $2 \times 10^{-5}$。结果如图 10 所示。
F 感知合理性的主观评估
为了验证我们的 rollout-k 误差指标是否反映感知合理性,我们进行了一项轻量级的人类偏好研究。评估者使用在线可用的盲法 A/B 界面$^3$。该界面并排显示两个视频,并询问哪一个看起来在物理上更合理,指示评估者关注运动和伪影而非清晰度。我们汇总了 21 名志愿评估者的判断。未提供报酬,且界面未请求个人或人口统计信息。每位评估者对三组比较中的每一组进行了 7 对视频的评分:AR vs. Bidir(自回归与双向)、AR vs. Block-3(自回归与块状生成)以及 Block-3 vs. Bidir(块状生成与双向),每位评估者共进行 21 次成对判断,总计 441 次判断。视频对是从 rollout 指标显示两个模型之间存在较大差异的样本中采样的。
100 100 77 (%) 90 91 80 80 (%) 64 64 60 60 preference 40 40 Preference 20 20 9 Pairwise 0 0 AR Block Bidir AR Bidir AR Block Block Bidir
图 11:人类偏好研究。左图:按模型汇总的偏好率显示,AR 和 Block-3 的生成被显著更频繁地偏好,优于双向生成。右图:成对偏好显示人类强烈偏好 AR 优于 Bidir,以及 Block-3 优于 Bidir,而 AR 仅适度优于 Block-3。这与 rollout 误差排名相符,表明 $\Delta x(5)$ 的大幅差异对应于物理合理性方面感知上显著的差异。
人类判断与 rollout 指标一致。当 $\Delta x(5)$ 指示存在较大分离时,这种分离对人工评估者也是可感知的:AR 和 Block-3 均被强烈偏好优于双向生成,而 AR 和 Block-3 之间的感知差距则小得多。这支持将 rollout 误差作为物理显著性生成故障的代理指标。
G 数据合成
视频是使用自定义的 NumPy [42] 事件驱动模拟器合成的,该模拟器模拟封闭方形盒子中无摩擦球的运动。对于球与球的相互作用,模拟器计算下一次碰撞时间
3https://seriality-gap.jdiazchao.com/arena
22
第 23 页
解析地。对于一对球体 $(i, j)$,其相对位移为 $\Delta x = x_j – x_i$,相对速度为 $\Delta v = v_j – v_i$,半径分别为 $r_i, r_j$,碰撞时间 $t$ 是以下方程的最小非负根:
$$ \|\Delta x + t\Delta v\|^2 = (r_i + r_j)^2, $$
该方程在 $t$ 上构成一个二次方程。一旦找到 $t$,碰撞位置可直接由 $x_i(t) = x_i + v_i t$ 和 $x_j(t) = x_j + v_j t$ 得出。
对于每次 rollout(轨迹展开),我们均匀随机采样初始球体位置,确保第一帧中没有任何两个球体重叠,然后从 $[0, 2\pi)$ 中均匀采样每个球体的初始方向,并从 $[8, 10]$ 中均匀采样速度。接着,我们模拟更长的轨迹,并使用滑动窗口提取长度为 $f$ 帧的固定长度片段,保留重叠最多为 $f/2$ 的窗口,以避免高度相似的相邻片段并增加多样性。每个数据集配置固定球体数量、帧长、盒子大小、球体半径和渲染分辨率。
在报告的实验中,我们使用 $n \in \{1, 5\}$ 个球体,视频长度 $f \in \{25, 33, 41, 49\}$,球体半径 $0.7$,世界大小 $10 \times 10$,渲染分辨率 $128 \times 128$,以及 5 个条件帧。训练集包含 20,000 个视频。为了评估,我们生成 1,024 个长度为 57 帧的基础视频,并通过仅保留每个视频的前 $f$ 帧来推导较短的集合。这保留了条件帧,因此对于相同的样本,不同帧长下的初始条件保持一致,使得跨长度比较更加公平。为了避免平凡轨迹,我们仅保留满足以下球体-球体碰撞密度的窗口:
$$ \frac{\text{球体-球体碰撞次数}}{\text{激活帧数} \times \text{球体数量}} $$
超过 0.035。对于 $n = 5$,当 $f = 33$ 时,这对应于至少 5 次碰撞;当 $f = 49$ 时,对应于至少 8 次碰撞。对于基础 57 帧评估集,我们还尝试使样本在球体-球体碰撞次数上分布得更加均匀,尽管 resulting 分布并非完全均匀;较短的裁剪评估集继承了这种覆盖范围。训练和评估使用不同的随机种子,但使用相同的模拟器和参数设置,因此评估保持在分布内。
为了评估,我们使用基于颜色的跟踪从生成的帧中恢复球体位置。每个球体渲染为不同的 RGB 颜色;对于每一帧和每个球体,我们构建 RGB 值位于该球体颜色固定容差内的像素的二值掩码,并通过图像矩计算掩码质心。得到的坐标用于计算 $\Delta x(\text{GT})$ 和 $\Delta x(k)$。
Rollout 指标 $\Delta x(k)$ 还需要每球速度来启动模拟器。我们通过有限差分恢复的质心来估计第 $n$ 帧的速度,$\hat{v}_n = \hat{x}_n – \hat{x}_{n-1}$。当在区间 $(n-1, n)$ 内发生碰撞时,该有限差分跨越了碰撞,不再反映碰撞后的瞬时速度;在这种情况下,我们改为从前一个区间估计碰撞前的速度,$\hat{x}_{n-1} – \hat{x}_{n-2}$,并根据硬球碰撞规则设定的分析后碰撞速度设置 $\hat{v}_n$。
第 24 页
H 注意力掩码
块1(自回归) 块2 块3 块4(双向)
推理 帧 (a) 查询
关键帧 关键帧 关键帧 关键帧
训练 词元 (b) 查询
关键词元 关键词元 关键词元 关键词元
条件-条件注意力 块内注意力 干净-噪声注意力(训练) 掩码 条件-输出注意力 过去块注意力 噪声-噪声注意力(训练)
图12:块状生成的注意力掩码。掩码针对 f = 25 的设置进行说明。行表示查询位置,列表示键/值位置;彩色单元格表示允许的注意力条目,白色单元格为被掩码的位置。顶行显示推理时针对条件和输出帧的掩码,底行显示训练时针对干净和噪声词元副本的相应掩码。各列比较了自回归块1的掩码、中间块因果掩码以及双向掩码。粗线标记了条件/输出以及干净/噪声的边界;虚线显示了单个帧或词元单元格。
24