三分钟导读:本文提出自梯度强制(SGF),通过两阶段训练策略恢复自生成历史KV缓存的梯度监督,显著提升了自回归视频扩散模型在长视频生成中的身份、背景和时序一致性。
英文题目:Self Gradient Forcing: Native Long Video Extrapolation
论文出处:arXiv 每日论文精选 · arXiv:2607.20368
原始论文:PDF / 论文页面
对应视频标题:自梯度强制:解决自回归视频模型长视频生成中的身份漂移与上下文断裂|推荐指数:★★★★★
这篇论文解决什么问题?
现有的Self Forcing方法虽然减少了暴露偏差,但将历史KV缓存视为冻结状态,导致未来损失无法监督干净时间步(clean-timestep)下自生成潜变量写入KV内存的过程,造成“历史上下文梯度缺口”。
核心创新
- 识别并定义了冻结缓存Self Forcing中的“历史上下文梯度缺口”。
- 提出SGF两阶段训练框架,通过并行重建恢复上下文梯度,避免直接可微缓存带来的内存爆炸。
- 证明了仅使用5秒训练窗口即可外推至分钟级视频,且在不牺牲短期质量的前提下提升长期一致性。
方法概览
提出SGF,一种两阶段训练策略:Pass 1执行无梯度的自回归 rollout 并记录自生成上下文和噪声潜变量;Pass 2并行重建采样退出步的计算,将自生成上下文作为 stop-gradient 输入重新编码,使未来DMD损失能监督KV写入过程,而无需全序列反向传播。
逐图理解论文
SGF:两阶段梯度恢复框架

本文提出自梯度强制(SGF),一种两阶段训练策略。Pass 1执行无梯度的自回归Rollout并记录自生成上下文和噪声潜变量。Pass 2并行重建采样退出步的计算,将自生成上下文作为Stop-Gradient输入重新编码,使未来DMD损失能监督KV写入过程,而无需全序列反向传播。
定量评估:一致性显著提升

在60秒帧级TF初始化下,Subject一致性从0.976提升至0.983,Background从0.970提升至0.974。在240秒帧级TF初始化下,Subject一致性从0.965提升至0.972,Background从0.965提升至0.968。这些结果基于VBench-Long和MovieGen-128提示集进行定量评估。
人类偏好:GSB盲测结果

在GSB盲测用户偏好研究中,超过1900次配对判断显示,SGF在60秒帧级TF初始化下获得45.1%的偏好得分,在240秒帧级TF初始化下获得48.7%的偏好得分。这表明人类观察者更倾向于SGF生成的长视频,认为其具有更好的长期一致性。
重建保真度:Pass-2的准确性

Pass-2重建与Pass-1的整体相对L2误差为0.01409,余弦相似度为0.999886。消融实验分析了两阶段恢复保真度,证明SGF通过有界重建能忠实复现采样退出步的串行上下文关系,为梯度监督提供可靠基础。
长视频生成:定性对比分析

在240秒帧级TF初始化下,Self Forcing出现视角跳跃和身份漂移,而SGF能更好地保持主体身份、姿态和餐厅布局。在60秒帧级TF初始化下,SGF在汽车和摩托车场景中保持更固定的位置和道路几何结构,在深蹲人物场景中维持一致的动作和背景。
实验与关键结果
- 在5秒、60秒和240秒的时间尺度上进行帧级(frame-wise)和块级(chunk-wise)生成评估。
- 使用VBench-Long和MovieGen-128提示集进行定量评估。
- 进行GSB盲测用户偏好研究(超过1900次配对判断)。
- 分析两阶段恢复保真度、VAE边界效应及sink潜变量数量的消融实验。
- 在60秒帧级TF初始化下,Subject一致性从0.976提升至0.983,Background从0.970提升至0.974(第 8 页)
- 在240秒帧级TF初始化下,Subject一致性从0.965提升至0.972,Background从0.965提升至0.968(第 8 页)
- 在60秒帧级TF初始化下,GSB偏好得分为45.1%(第 9 页)
- 在240秒帧级TF初始化下,GSB偏好得分为48.7%(第 9 页)
- Pass-2重建与Pass-1的整体相对L2误差为0.01409,余弦相似度为0.999886(第 17 页)
阅读时需要注意
- SGF是缺失上下文梯度信号有界代理,而非通过自回归 rollout 的全反向传播。
- 假设Pass-2重建能忠实复现采样退出步的串行上下文关系,若掩码或对齐偏差可能导致训练错误的注意力关系。
- 不直接优化产生自生成潜变量的去噪决策序列。
- 动态度(Dynamics)指标在SGF下可能较低,但这并非因为运动质量差,而是Self Forcing因场景跳跃和变形产生的非连贯运动人为 inflated 了该分数。
- 直接可微缓存训练会导致内存溢出(OOM),SGF通过有界重建解决了这一问题。
关联工作
- Self Forcing:基础方法,SGF旨在解决其KV缓存冻结导致的梯度缺失问题。(第 1 页)
- Causal Forcing:相关初始化不匹配问题的解决方案,SGF与其正交。(第 3 页)
- Diffusion Forcing:连接下一个token预测和扩散的基础工作,SGF遵循其自回归接口。(第 3 页)
- StreamingT2V:结合短期和长期记忆的自回归流水线,SGF与其在内存暴露设计上正交。(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
自梯度强制:原生长视频外推
庄俊豪 张世一 边宇轩 李亚伟 罗雅文 刘一军 金维扬 张松春 何祥龙 张旭颖 李浩然 黄浩洋 薛泽岳 段楠 京东 未来研究院
摘要
近期的自回归视频扩散方法越来越多地基于自强制(Self Forcing)构建,其中学生模型在其自身生成的历史轨迹上进行训练,而非使用真实视频上下文。这减少了暴露偏差,但历史键值缓存(KV cache)仅作为冻结的轨迹状态供后续帧使用。因此,后续的损失无法监督早期生成的潜变量应如何被写入更有用的键和值中,以利于后续视频潜变量的生成。我们将此称为历史上下文-梯度鸿沟。我们提出了自梯度强制(Self Gradient Forcing, SGF),这是一种两阶段训练策略,旨在无需通过完整串行轨迹进行反向传播的情况下恢复这一缺失的监督信号。第一阶段执行与推理匹配的非梯度自回归轨迹生成,并在采样的去噪退出步骤记录自生成的上下文以及输入模型的带噪潜变量。第二阶段并行计算上下文梯度,使用停止梯度(stop-gradient)的上下文重建作为输入,记录退出步骤生成的上下文,并计算上下文的键值表示以及未来到上下文的因果注意力。因此,SGF 在原生自回归训练目标内提供了缺失的记忆写入监督,利用未来视频潜变量的损失来训练模型将上下文编码为更有效的因果记忆。在不同初始化设置下的广泛长视界逐帧和分块实验中,SGF 实现了比自强制更强的原生长视频外推能力,特别是在主体身份、背景/布局一致性和时间稳定性方面。值得注意的是,仅使用 5 秒的训练窗口,SGF 即可外推至长达数分钟的视频。代码和模型将在项目页面 https://zhuang2002.github.io/SelfGradientForcing 发布。
1 引言
长程自回归视频生成要求场景、物体、布局和动态在生成过程远超训练窗口时保持连贯。在自回归视频扩散中,这种连贯性取决于从模型生成的历史中进行外推:一旦轨迹生成开始,每一帧或每一块都基于提示词和先前生成的内容进行条件生成。
然而,在教师强制(Teacher-Forcing, TF)训练中,模型基于真实视频上下文进行条件生成,而在推理时则基于自生成的历史。这种训练-推理的不匹配产生了暴露偏差,使得原生长视频外推变得困难。自强制(Huang et al., 2025)通过在自回归轨迹生成的历史上训练学生模型来缓解这种不匹配,并使用双向视频模型的分布匹配蒸馏(DMD)监督。这种自轨迹生成的配方已成为自回归视频扩散中日益常见的训练范式(Huang et al., 2025; Liu et al., 2025; Cui et al., 2025; Yang et al., 2025; Chen et al., 2026b;a; Xu et al., 2026a; Ji et al., 2026; Tian et al., 2026; Hu et al., 2026; Meng et al., 2026)。然而,为了使自轨迹生成训练可行,这些方法通常继承了一个关键的计算约束:通过历史键值缓存的跨块梯度流被截断。
其后果是,自强制让模型接触到自生成的历史,但并未让未来的损失去训练该历史应如何被写入为未来可读的记忆。在轨迹生成期间,
第 2 页
0 s 48 s 96 s 144 s 192 s 240 s
自强制 + 教师强制初始化 解耦的键值缓存 梯度阻断
视角跳跃 场景切换 身份漂移 自梯度强制 + 教师强制初始化 上下文-梯度 流动激活
在 240 秒内保持主体、姿态和餐厅布局的一致性 提示:一个头发梳得整齐的戴眼镜的中国男孩坐在一家温馨诱人的快餐店里,闭着眼睛 大口咬着一个多汁的芝士汉堡。他用双手拿着汉堡,带着一种略带梦幻的神情享受着这一刻,…
图 1:使用自梯度强制实现长视界一致性。在相同的提示、种子和教师强制初始化条件下,自强制使用自生成的历史进行训练,但不对清洁时间步的键值写入计算施加来自未来损失的监督;它最终会出现视角跳跃、场景切换和身份漂移。自梯度强制为自生成记忆写入恢复了有界的上下文-梯度路径,并在 240 秒内更好地保留了主体身份、姿态和餐厅布局。
生成的潜变量在清洁上下文时间步由因果 DiT 处理,并存储为因果键值缓存;后续块将此缓存作为冻结的历史上下文读取。因此,未来损失可以训练噪声去噪令牌以读取缓存历史,但无法反向传播到写入历史 K/V 条目的清洁时间步计算中。我们将这种缺失的信用分配路径称为历史上下文-梯度间隙。图 1 说明了定性影响:自强制模型在许多帧中可能保持局部合理性,但随着外推的继续,身份、视角和布局的一致性逐渐崩溃。
在教师强制、一致性蒸馏或常微分方程初始化之后(Huang et al., 2025; Zhu et al., 2026; Zhao et al., 2026),模型具有将真实视频上下文写入清洁时间步缓存的有用先验。然而,最终的自展开目标改变了上下文分布和监督信号:历史是自生成的,并且在采样的噪声去噪时间步应用少步分布匹配蒸馏损失。这为自生成历史留下了缓存写入间隙。由于相同的因果 DiT 跨时间步共享参数,该间隙可能会进一步扩大:噪声去噪步骤的更新可能会改变清洁时间步 $t_{ctx} = 0$ 的缓存写入计算,而后续块的损失不会反向传播到它写入的历史键值条目。因此,上下文写入路径可能会偏离长自回归展开所需的状态。
直接的解决方案是保持历史键值缓存的可微性,允许未来损失反向传播到清洁时间步的 K/V 写入计算中。在实践中,这将要求保留每个历史缓存写入的自动计算图,直到后续块消耗它。这些计算图随着展开长度、Transformer 深度和顺序缓存更新而增长,使得直接的键值梯度路径难以扩展。
我们提出了自梯度强制(SGF),它将这种串行图保留问题转化为有界的并行重新计算问题。SGF 是一种两阶段训练策略,无需通过采样的展开进行完整反向传播即可恢复缺失的记忆写入监督。第 1 阶段执行真实的串行无梯度自回归展开,并记录自生成上下文以及模型在采样的去噪退出步骤接收到的噪声潜变量。第 2 阶段丢弃展开缓存并并行重建相同的退出步骤计算:生成的上下文作为停止梯度的清洁潜变量输入重新处理,记录的噪声潜变量再次作为预测输入馈送。模型重新计算上下文隐藏状态、键值表示以及未来到上下文的因果注意力,因此对后续视频潜变量的损失会更新用于为后续生成写入清洁时间步 K/V 表示的共享参数。
作为基于强制的自回归视频扩散的原生训练框架,SGF 恢复了冻结缓存自强制未使用的上下文写入梯度,并且与现有的强制改进正交,允许直接叠加在其之上。我们在多种初始化和逐帧及逐块自回归生成上评估了 SGF。经验表明,SGF 在 5 秒时与自强制相当,并在 60 和 240 秒时显著改善了原生长视频外推能力,在主体身份、背景/布局一致性和时间稳定性方面收益最明显。值得注意的是,仅使用 5 秒窗口训练的模型仍然可以外推到分钟级视频。我们进一步分析了两阶段恢复的准确性、因果视频 VAE 的起始边界效应以及 Sink 潜变量数量对流式生成质量的影响。
2
第 3 页
我们的贡献如下:
• 我们指出了在冻结缓存的自强制(Self Forcing)中存在的历史上下文-梯度鸿沟,其中未来损失监督缓存读取,但不监督将自生成历史写入 K/V 内存的干净上下文写入计算;由于在几步分布匹配蒸馏(DMD)期间,共享的 DiT 参数在其他时间步被更新,这条无监督路径可能会发生漂移。 • 我们引入了 SGF,这是一种两阶段训练策略,其串行 Pass 1 记录自生成的 rollout 状态,而并行 Pass 2 通过自生成上下文的 KV 表示和未来到上下文的因果注意力,对采样的退出步计算进行上下文梯度重构。 • 我们在 5s、60s 和 240s 的不同初始化条件下,对帧级和块级生成进行了大量实验,表明 SGF 在 5s 时与自强制(Self Forcing)表现相当,并在 60s 和 240s 时显著改善了长视频的外推能力。我们研究了两阶段恢复精度、因果 VAE 边界诊断以及 sink latents 对流式生成质量的影响。
2 相关工作
自回归视频扩散。现代视频生成建立在扩散目标、加速采样器、潜在扩散和扩散变换器的基础上,这些为图像和视频生成器提供了建模和扩展原则 (Ho et al., 2020; Song et al., 2021; Rombach et al., 2022; Peebles & Xie, 2023)。视频扩散系统通过 3D 去噪、级联生成、潜在视频建模、运动模块、时空架构和多模态自回归令牌建模扩展了这些基础 (Ho et al., 2022b;a; Singer et al., 2023; Blattmann et al., 2023b;a; Guo et al., 2024; Chen et al., 2024b; Bar-Tal et al., 2024; Kondratyuk et al., 2024)。然而,对于长格式生成,关键区别在于对生成历史的因果使用:每个生成的潜在帧或块都成为后续生成上下文的一部分。扩散强制(Diffusion Forcing)(Chen et al., 2024a) 通过独立地对序列元素加噪,将下一个令牌预测与扩散联系起来;CausVid (Yin et al., 2025) 将双向视频扩散蒸馏为具有因果缓存的快速自回归学生模型。SGF 遵循这种自回归视频扩散接口,并探讨一旦自生成历史被写入因果 KV 状态,它是否作为未来可读的内存接收未来监督。
用于自生成历史的强制目标。教师强制(Teacher-Forcing)在真实前缀上进行训练,而自回归推理则基于自生成的历史进行条件生成。自强制(Self Forcing)(Huang et al., 2025) 通过使用来自双向教师的分布匹配蒸馏(DMD)监督,直接在由模型自身 rollout 产生的历史上训练学生模型,从而直接减少了这种暴露偏差。随后的强制方法在此基础上构建了自 rollout 训练范式。因果强制(Causal Forcing)(Zhu et al., 2026) 和因果强制++(Causal Forcing++)(Zhao et al., 2026) 解决了一个互补的初始化不匹配问题:因果学生模型不应依赖于在推理时不可用的双向教师轨迹,其流映射(flow map)在推理时不可用。滚动强制(Rolling Forcing)(Liu et al., 2025)、自强制++(Self-Forcing++)(Cui et al., 2025)、Matrixgame3 (Wang et al., 2026) 和 ShotStream (Luo et al., 2026) 通过更长的片段和窗口去噪进一步扩展了 rollout 暴露。Video-Mirai (Yu et al., 2026) 和 Next Forcing (Xu et al., 2026b) 做出了一个相关的观察,即下一步监督可能会丢弃后续帧所需的信息,并引入了未来感知或多块监督。这些方法改进了历史分布、因果初始化或监督的时间范围。SGF 解决了冻结缓存自 rollout 训练中剩余的一个鸿沟:未来损失可以监督后续去噪令牌如何读取缓存历史,但不能监督干净时间步计算如何将自生成历史写入 KV 内存。
长视界上下文和缓存设计。一系列工作通过改变可用上下文的内容、位置或保留方式来改善长视界生成。Gen-L-Video 为长多文本视频执行重叠的时间协同去噪 (Wang et al., 2023);FreeNoise 重新调度噪声并融合窗口时间注意力 (Qiu et al., 2024);FIFO-Diffusion 在不同噪声级别下维护帧队列 (Kim et al., 2024);StreamingT2V 在自回归管道中结合短期和长期记忆 (Henschel et al., 2025)。循环序列建模和高效注意力研究了片段循环 (Dai et al., 2019)、旋转位置嵌入 (Su et al., 2021)、注意力汇点 (attention sinks) (Xiao et al., 2024)、缓存保留 (Zhang et al., 2023; Li et al., 2024)、流式长微调 (Yang et al., 2025; Chen et al., 2026b)、长上下文监督
3
第 4 页
sion (Chen et al., 2026a), 可训练稀疏注意力 (Xu et al., 2026a; Zhuang et al., 2026), KV 压缩 (Ji et al., 2026), 逐头缓存行为 (Tian et al., 2026), 检索增强的潜在历史 (Hu et al., 2026), 以及带有可信对齐的门控回忆 (Meng et al., 2026)。这些方法改变了暴露给生成器的内存。SGF 与该方向正交:对于给定的上下文和缓存设计,它改善了自生成内容写入未来可读 KV 表示的方式。我们在逐帧和分块生成、多种初始化以及外推范围上评估了 SGF,结果表明,即使在使用短窗口强制训练的情况下,更好的 KV 内存写入也能改善长范围自回归视频生成。
3 方法
3.1 历史上下文-梯度差距
自回归视频扩散按顺序生成潜在块。在块 $j$ 处,因果生成器在关注历史 K/V 缓存而非原始过去潜在变量的同时对 $z_t^j$ 进行去噪。在块 $i < j$ 生成后,其预测的干净潜在变量 $\tilde{x}_i$ 在干净上下文时间步 $t_{\text{ctx}} = 0$ 进行处理,并将产生的 K/V 条目追加到缓存中。因此,后续块基于从 $\tilde{x}_i$ 写入的干净时间步内存表示进行条件生成,而不是直接基于 $\tilde{x}_i$。
令 $C_\theta$ 表示因果生成器在干净上下文时间步诱导的缓存写入计算。在串行展开中,此更新是递归的:模型读取现有缓存并写入下一个历史 K/V 条目, $$ KV_i^0(\theta) = C_\theta(\tilde{x}_i, t_{\text{ctx}}; KV_{<i}^0), \quad t_{\text{ctx}} = 0. \quad (1) $$ 新条目 $KV_i^0$ 随后成为后续块使用的状态的一部分,包括后续的缓存更新。如果未来损失能够对该历史条目进行微分,它们将为编码 $\tilde{x}_i$ 到 K/V 内存的干净上下文计算分配信用。这将不仅训练后续噪声 token 如何读取自生成历史,还将训练早期生成的潜在变量应如何写入内存以供未来去噪使用。
冻结缓存的 Self Forcing 移除了这种内存写入信号。它在自生成历史上进行训练,减少了训练与推理之间的不匹配,并且后续块的损失仍然可以更新读取记录缓存的目标侧去噪计算。然而,历史 K/V 条目被视为解耦的展开状态。因此,未来损失不监督产生这些条目的 $t_{\text{ctx}} = 0$ 计算。
这种遗漏在最终的 Self Forcing 期间变得成问题,因为相同的 DiT 参数在噪声去噪和干净上下文缓存写入之间共享。噪声时间步的 DMD 损失更新共享参数, $$ \theta_{r+1} = \theta_r – \eta \nabla_\theta L_{\text{SF}}(\theta_r), \quad KV_i^0(\theta_{r+1}) \not\equiv KV_i^0(\theta_r) \quad \text{通常情况}. \quad (2) $$ 因此,训练可以改变干净上下文缓存写入器,但冻结缓存的 Self Forcing 没有提供关于自生成潜在变量如何编码到 K/V 内存中的未来损失校正。我们将这种缺失的监督路径称为历史上下文-梯度差距。图 2 说明了 SGF 如何通过用上下文梯度重建替换冻结缓存重建来恢复这条缺失的路径。
3.2 直接可微缓存
缩小差距的一种直接方法是保持串行历史 K/V 缓存的可微性。这样,未来损失可以通过缓存的 K/V 条目反向传播到产生它们的早期干净上下文调用中。然而,这需要保留每个缓存写入的反向图,直到所有消耗它的后续块都被处理完毕。由于自回归展开在去噪步骤和 Transformer 层之间反复写入、读取和扩展缓存,图的大小随展开长度增长,而不是保持为固定窗口计算。因此,瓶颈不仅仅是 K/V 张量的存储,而是附加到递归缓存轨迹上的保存激活值。这使得直接可微缓存训练对于长范围自展开来说不切实际。
3.3 自梯度强制
4
第 5 页
自强制 分布匹配损失 $\nabla D_{KL}$
退出步骤 噪声 0 ❄ KV 缓存 噪声 1 ❄ 真实 = n ❄ 评分 ❄ 因果 🔥 因果 ❄ 因果 更新 缓存 ❄ 因果 🔥 因果 ❄ 因果 ❄ 🔥 ❄ … DiT DiT DiT DiT DiT DiT – n-1 n-1 🔥 假 步骤 预测 0 步骤 预测 1 … 评分 时间步 n 时间步 0 时间步 n 时间步 0 无梯度 KV 缓存的自回滚 分布匹配蒸馏 (DMD) 概念等效视图 自梯度强制 (Self Gradient Forcing)
、 、 、 、 、 、 、 、 … 、 、 、 、 、 、 、 、 …
❄ 第 1 遍:无梯度自回滚 ❄ 第 1 遍:无梯度自回滚
干净键/值 噪声键/值 干净键/值 噪声键/值 ❄ 🔥 噪声潜变量:… 🔥 噪声潜变量:… 查询 查询 恢复 干净 干净 跨帧 ❄ 真实 KV ❄ 真实 查询 🔥 假 – 梯度 查询 🔥 假 – … … 噪声 噪声 DMD DMD 时间步 0 时间步 n 时间步 0 时间步 n 第 2 遍:并行冻结 KV 计算 第 2 遍:并行上下文梯度重建
图 2:从冻结缓存的自强制 (Self Forcing) 到自梯度强制 (Self Gradient Forcing)。自强制在自生成的历史数据上进行训练,但将历史 K/V 条目视为分离的缓存状态。SGF 保持无梯度回滚不变,并添加一个并行重建遍,其中分离的上下文潜变量在干净上下文时间步重新编码,以便未来的 DMD 损失监督 K/V 写入,而无需串行回滚反向传播。
算法 1 自梯度强制训练 算法 1 总结了 SGF 的训练步骤。SGF 可以从自强制的等效两遍视图来理解。在此视图中,第 1 遍执行普通的无梯度自回滚并记录采样的退出状态,而第 2 遍并行重建相应的因果计算。冻结缓存的自强制在第 2 遍中将重建的上下文 K/V 路径视为分离的内存。SGF 保持第 1 遍和重建几何结构不变,但改变第 2 遍的梯度边界,以便未来的 DMD 损失也监督干净上下文 K/V 的写入。
第 1 遍:无梯度自回滚。第一遍是推理时使用的普通串行自回归回滚。对于每个块 $i$,模型使用当前的历史缓存进行去噪,并记录采样的退出状态:噪声输入 $z_{t^*}^i$ 和预测的干净潜变量 $\tilde{x}_i$。然后,潜变量 $\tilde{x}_i$ 在干净上下文时间步 $t_{ctx} = 0$ 进行处理,以更新后续块的串行 K/V 缓存。此遍中的所有计算均在无梯度跟踪的情况下运行,记录的狀態被视为第 2 遍的固定数据。
SF 第 2 遍:冻结 K/V 计算。冻结缓存的自强制可以看作是对采样退出计算的并行重建,具有分离的上下文 K/V 路径。给定记录的噪声潜变量 $Z^* = \{z_{t^*}^i\}_{i=1}^N$ 和上下文潜变量 $\tilde{X}_{ctx} = \{\tilde{x}_i\}_{i=1}^N$,它在因果掩码 $M_{rec}$ 下重建目标预测:
$$ \hat{X}_{tar} = G_\theta (Z^*, t^*; \tilde{X}_{ctx}, t_{ctx}, M_{rec}) \quad . \quad (3) $$
5
第 6 页
掩码 $M_{rec}$ 复现了由串行缓存引发的 sink-plus-window 注意力关系。然而,在冻结缓存的 Self Forcing(自强制)中,当噪声目标 token 关注由干净上下文侧产生的 K/V 条目时,这些条目被视为分离的内存。因此,DMD(分布匹配蒸馏)损失训练的是未来噪声 token 如何读取自生成的历史,而不是该历史如何被编码到 K/V 内存中。
SGF Pass 2:上下文梯度重建。SGF 保持 Pass 1 和重建几何结构不变,但移除了重建上下文 K/V 路径上的 stop-gradient(停止梯度)边界。上下文潜变量 $\tilde{X}_{ctx}$ 本身仍作为 stop-gradient 输入,因此 SGF 不优化采样的 rollout 轨迹。相反,模型在 $t_{ctx} = 0$ 时重新编码这些固定的自生成潜变量,并且当未来目标 token 关注它们时,产生的 K/V 条目保持可微分:
$$ \nabla_\theta L_{DMD}(\hat{X}_{tar}) \supset \frac{\partial L_{DMD}}{\partial KV_{rec}} \frac{\partial KV_{rec}^{ctx}}{\partial \theta} \quad (4) $$
因此,未来的 DMD 损失同时监督目标侧的去噪和干净上下文的 K/V 写入。
Pass-2 重建旨在恢复 Pass 1 中采样的退出计算。在确定性层、匹配的位置索引以及相同的因果重建几何结构下,$\hat{X}_{tar}$ 在理论上与对应退出状态记录的预测上下文潜变量 $\tilde{X}_{ctx}$ 完全相同。在实践中,由于浮点精度和实现层面的影响,仍可能出现微小偏差。附录 D 通过实验验证了这种恢复保真度。
这种两遍设计避免了直接可微缓存带来的内存爆炸。Pass 1 是串行的但无梯度;Pass 2 支持梯度,但在 $M_{rec}$ 下是固定窗口且并行的。因此,SGF 在不通过完整自 rollout 打开循环自动计算图的情况下,恢复了缺失的内存写入监督信号。
3.4 梯度边界
SGF 是对采样退出计算的有界重建,而非完整的 rollout BPTT(反向传播通过时间)。记录的上下文潜变量 $\tilde{X}_{ctx}$、噪声样本、调度器状态以及 Pass-1 串行缓存轨迹均为 stop-gradient。梯度仅通过 Pass-2 重建流动:即干净上下文的前向传播、K/V 投影、未来到上下文的注意力以及目标侧的去噪计算。该边界在保持训练图固定窗口和并行的同时,恢复了内存写入监督。
3.5 流式上下文策略
对于逐帧流式生成,Self Forcing 和 SGF 均使用相同的 sink-plus-FIFO 上下文策略。我们保持固定的 sink 前缀和近期潜变量的 FIFO 窗口,以便评估隔离 SGF 的效果,而非上下文选择的影响。对于 Wan 视频 VAE,我们使用四个 sink latents(Sink潜变量)以保留由其非对称分组模式诱导的时间边界前缀。附录 E 提供了边界诊断和 sink 数量消融实验。
4 实验
我们评估 SGF 是否在牺牲短视界质量的情况下改善了原生长视频外推能力。附录提供了完整的 5s VBench-Long 表格、两遍恢复保真度、sink/上下文消融实验以及额外的定性比较(附录 B、D、E 和 G)。
4.1 实验设置
所有模型均使用相同的 5 秒训练窗口进行训练;因此,60s 和 240s 的结果测试的是超出训练视界之外的原生外推能力。遵循先前的长视频外推实践(Yesiltepe et al., 2025),我们将 SGF 与在 5s、60s 和 240s 下匹配的 Self Forcing 基线进行比较。每对匹配模型共享相同的初始化、提示集、随机种子、sink/FIFO 策略、滑动窗口、分块策略和采样配置。唯一的区别在于,采样的退出损失是读取如 Self Forcing 中的冻结历史 KV 缓存,还是如 SGF 中通过梯度重建自生成的上下文。对于逐帧生成,我们使用 sink 4,总窗口
6
第 7 页
0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + TF 初始化
SGF + TF 初始化
提示词:电影质感 35mm 胶片风格的极度特写,一位沉思的 60 岁白发男子,留着浓密的胡须,戴着眼镜和棕色贝雷帽,坐在巴黎咖啡馆里。他凝视着屏幕外,沉浸在对宇宙历史的深深思考中,… 0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + TF 初始化
SGF + TF 初始化
提示词:电影质感的颗粒照片,一只白橙相间的虎斑猫欢快地穿过茂密的花园,追逐着看不见的东西。 它沿着一条狭窄蜿蜒的小路奔跑,睁大快乐的双眼扫视着树叶。…
图 3:在 TF 初始化下的逐帧 240 秒对比。两行使用匹配的提示词、随机种子、初始化、时间视界和推理几何结构。
21,FIFO 16,以及当前块 1;对于分块生成,我们使用 sink 3,总窗口 12,FIFO 6,当前块 3,以及块大小 3。
5 秒评估遵循标准的 VBench 协议,并作为短视界的一致性检查。完整的 5 秒 VBench 结果报告在附录 B 中,其中 SGF 和 Self Forcing 在逐帧和分块设置中大致相当。因此,本文主要关注 60 秒和 240 秒的外推,因为记忆写入错误有时间在此过程中累积。
60 秒设置使用 VBench-Long 提示词,240 秒设置使用 128 个随机采样的 MovieGen 提示词 (Polyak et al., 2024)。对于这两个长视界,我们报告官方的 VBench-Long 指标:美学质量、背景一致性、动态程度、成像质量、运动平滑度、主体一致性和闪烁。在 VBench 导向下,分数越高越好。GSB 人类偏好结果作为成对比较单独报告。
4.2 长视频生成 (60S 和 240S)
定量结果。表 1 和表 2 报告了逐帧和分块自回归生成的长视界自动指标。所有比较均在每个生成设置内控制,应按初始化成对阅读。
在两种生成粒度和两种长视界中,SGF 在大多数质量和一致性指标上优于匹配的 Self Forcing 基线。这些增益在美学质量、背景一致性、成像质量、运动平滑度、主体一致性和闪烁方面尤为一致。这些指标直接反映了 SGF 针对的失效模式:自生成的潜变量是否被写入在整个长外推过程中保持有用的记忆表示中。
动态程度是主要的例外,Self Forcing 可以获得更高的分数。这并不一定表明运动质量更好:附录 G 显示,长周期的 Self Forcing rollout 通常包含场景跳跃、相机几何结构断裂和物体变形,这会产生巨大但不连贯的表观运动,并可能夸大动态程度。相比之下,SGF 保持了更稳定的图像质量和更合理的相机演化,因此在这种情况下其较低的动态程度分数并不是生成质量更差的证据。
定性结果。图 3 展示了在 TF 初始化下具有代表性的 240 秒逐帧对比。两种方法使用相同的提示词、种子、视界和推理几何结构,因此视觉差异反映了训练目标而非采样变化。Self Forcing 在 rollout 早期保持局部合理性,但逐渐累积身份漂移、裁剪漂移和
7
第 8 页
表 1:帧级 60 秒和 240 秒长时距指标。60 秒设置使用 VBench-Long 提示词;240 秒设置使用 MovieGen-128 提示词。
| 时距 | 指标↑ | 因果 ODE 初始化 | | 因果 CD 初始化 | | TF 初始化 | | | :— | :— | :— | :— | :— | :— | :— | :— | | | | SF | SGF | SF | SGF | SF | SGF | | 60s | 美学 | 0.543 | 0.606 | 0.608 | 0.630 | 0.650 | 0.653 | | | 背景 | 0.947 | 0.966 | 0.969 | 0.973 | 0.970 | 0.974 | | | 动态 | 0.867 | 0.566 | 0.489 | 0.267 | 0.647 | 0.730 | | | 成像 | 0.657 | 0.715 | 0.684 | 0.708 | 0.704 | 0.714 | | | 运动 | 0.975 | 0.986 | 0.984 | 0.988 | 0.985 | 0.982 | | | 主体 | 0.928 | 0.971 | 0.974 | 0.983 | 0.976 | 0.983 | | | 闪烁 | 0.971 | 0.987 | 0.992 | 0.992 | 0.988 | 0.991 | | 240s | 美学 | 0.510 | 0.543 | 0.533 | 0.584 | 0.614 | 0.619 | | | 背景 | 0.943 | 0.966 | 0.964 | 0.971 | 0.965 | 0.968 | | | 动态 | 0.840 | 0.556 | 0.599 | 0.385 | 0.669 | 0.648 | | | 成像 | 0.648 | 0.698 | 0.632 | 0.690 | 0.701 | 0.718 | | | 运动 | 0.971 | 0.985 | 0.981 | 0.986 | 0.980 | 0.982 | | | 主体 | 0.936 | 0.969 | 0.967 | 0.976 | 0.965 | 0.972 | | | 闪烁 | 0.937 | 0.972 | 0.971 | 0.977 | 0.967 | 0.968 |
表 2:块级 60 秒和 240 秒长时距指标。60s 使用 VBench-Long 提示词;240s 使用 MovieGen-128 提示词。
| 时距 | 指标↑ | 双向 ODE 初始化 | 因果 ODE 初始化 | | 因果 CD 初始化 | | TF 初始化 | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | SF | SF | SF | SGF | SF | SGF | | 60s | 美学 | 0.605 | 0.599 | 0.603 | 0.605 | 0.582 | 0.654 | | | 背景 | 0.966 | 0.952 | 0.957 | 0.958 | 0.947 | 0.971 | | | 动态 | 0.613 | 0.935 | 0.832 | 0.913 | 0.909 | 0.634 | | | 成像 | 0.692 | 0.700 | 0.677 | 0.681 | 0.686 | 0.715 | | | 运动 | 0.983 | 0.961 | 0.974 | 0.976 | 0.968 | 0.985 | | | 主体 | 0.974 | 0.948 | 0.960 | 0.960 | 0.951 | 0.982 | | | 闪烁 | 0.991 | 0.993 | 0.988 | 0.989 | 0.989 | 0.990 | | 240s | 美学 | 0.559 | 0.564 | 0.569 | 0.578 | 0.557 | 0.629 | | | 背景 | 0.962 | 0.941 | 0.948 | 0.950 | 0.944 | 0.970 | | | 动态 | 0.622 | 0.916 | 0.823 | 0.923 | 0.943 | 0.566 | | | 成像 | 0.668 | 0.679 | 0.671 | 0.667 | 0.688 | 0.712 | | | 运动 | 0.977 | 0.957 | 0.967 | 0.970 | 0.967 | 0.985 | | | 主体 | 0.962 | 0.939 | 0.939 | 0.942 | 0.946 | 0.975 | | | 闪烁 | 0.959 | 0.915 | 0.941 | 0.943 | 0.934 | 0.970 |
布局发生变化,表明其自生成的 K/V 记忆对于后续潜变量的生成变得不可靠。相比之下,SGF 使用未来损失来监督自生成潜变量的干净上下文 K/V 表示,从而在整个展开过程中更好地保留主体身份、相机关系和纹理背景。附录 G 提供了在其他初始化下的其他帧级和块级比较。
4.3 用户研究
自动指标无法直接捕捉人类感知的长时距一致性,因此我们进行了盲选 GSB 偏好研究,在 10 组匹配的比较中收集了超过 1,900 对判断。每对比较均在相同的初始化、提示词集、时距和推理几何条件下,将 SGF 与匹配的自强制基线进行对比。我们报告 GSB = (G−B)/(G+S+B)×100%,其中 G 偏好 SGF,B 偏好自强制,S 表示无明显偏好;因此正分表示偏好 SGF。如表 3 所示,所有分数均为正,表明评分者一致偏好 SGF 而非自强制进行长时距生成。
8
第 9 页
表 3:SGF 与匹配基线 Self Forcing 在逐帧和分块生成中的长视界 GSB 偏好得分。每个单元格报告在相同初始化、提示集、 rollout 视界和推理几何条件下的 $(G – B)/(G + S + B) \times 100\%$。正值表示偏好 SGF 而非 Self Forcing。
设置 视界 因果 ODE 初始化 因果 CD 初始化 TF 初始化
逐帧 60s 29.6% 36.8% 45.1% 逐帧 240s 38.6% 35.9% 48.7% 分块 60s – 32.9% 37.5% 分块 240s – 34.3% 44.9%
表 4:上下文梯度恢复的训练可行性。直接可微缓存训练保持串行缓存形成图并耗尽内存。SGF 在采样的退出步骤使用有界并行上下文梯度重建,以适度的峰值内存和运行时开销恢复上下文 K/V 梯度。
训练变体 峰值内存 稳定内存 时间 / 5 步 结果
Self Forcing,冻结历史 KV 缓存 79.01GB 79.01GB 10.39s 训练 SGF,串行 Pass 1 + 并行 Pass 2 87.01GB 63.73GB 11.71s 训练 Self Forcing,可微历史 KV 缓存 OOM OOM – OOM
4.4 定性结果
我们总结了附录 G 中提供的长视界定性比较。每个条带在相同的提示、随机种子、初始化、视界和推理几何条件下比较 SGF 和 Self Forcing,因此视觉差异反映了训练目标而非采样变化。这些条带可视化了 SGF 针对的时间失效模式:生成的历史可能在局部上是合理的,但随着后续潜变量的内存增加,其有用性逐渐降低。图 7 和图 3 中 TF 初始化的逐帧 60s 和 240s 比较提供了最清晰的示例,其他初始化还涵盖了额外的逐帧和分块案例。
在附录示例中,Self Forcing 经常积累长视界漂移,包括场景跳跃、相机几何结构破坏、物体变形、身份漂移、裁剪漂移以及背景/布局替换。这些失效可能导致大幅但不连贯的表观运动,解释了为何尽管感知质量下降,动态度可能会增加。相比之下,SGF 更好地保留了主体身份、相机关系、场景布局和时间稳定性,这与主体一致性、背景一致性、闪烁和运动平滑度的提升相匹配。
4.5 训练可行性
我们分析恢复上下文梯度是否会使训练成本过高。表 4 比较了冻结缓存的 Self Forcing、SGF 和直接可微缓存变体。直接通过历史 KV 缓存启用梯度会耗尽内存,因为每个缓存条目都保留了产生它的串行缓存形成图。SGF 避免了这种循环图:Pass 1 是无梯度 rollout,梯度仅在 Pass-2 重建的有界范围内开启。在我们的实现中,Pass 2 使用 FlexAttention 和编译的静态块稀疏因果掩码,使重建的未来到上下文注意力内存高效。
测量的开销适中。与冻结缓存的 Self Forcing 相比,SGF 将峰值内存从 79.01GB 增加到 87.01GB,而稳定内存从 79.01GB 降低到 63.73GB。因此,激活上下文梯度路径不会导致直接可微缓存训练的循环内存增长。运行时也相近:每五个训练步骤的墙钟时间从 10.39s 增加到 11.71s。这是因为,对于退出步骤 $n$,Self Forcing 执行 $n – 1$ 次无梯度生成器前向传播和一次在退出步骤的梯度启用前向/反向传播,而 SGF 在 Pass 1 中执行 $n$ 次无梯度前向传播,在 Pass 2 中执行一次梯度启用前向/反向传播。由于假分数的生成器更新遵循 5:1 的调度,额外的 Pass-2 工作仅影响每个五步周期内的生成器更新。
9
第 10 页
5 结论
我们提出了自梯度强制(Self Gradient Forcing, SGF),这是一种两阶段训练策略,旨在解决冻结缓存自强制(Self Forcing)中的历史上下文-梯度差距。通过保持串行自生成的无梯度特性,并并行重构采样出口计算,SGF 使得未来损失能够监督自生成历史如何写入 K/V 缓存,而无需进行完整的 rollout 反向传播。在逐帧和分块生成、多种初始化方法以及 5 秒、60 秒和 240 秒的时间跨度上,SGF 在保持短期生成质量的同时,提升了长视频的身份一致性、布局一致性和时间稳定性。这些增益通过定性比较和人类偏好评估得到了证实,未来的工作可以将 SGF 与更强的初始化、长上下文微调、检索和缓存压缩技术相结合。
参考文献
Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, Yuanzhen Li, Michael Rubinstein, Tomer Michaeli, Oliver Wang, Deqing Sun, Tali Dekel, and Inbar Mosseri. Lumiere: A space-time diffusion model for video generation. arXiv preprint arXiv:2401.12945, 2024.
Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, Varun Jampani, and Robin Rom- bach. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127, 2023a.
Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, and Karsten Kreis. Align your latents: High-resolution video synthesis with latent diffusion models. arXiv preprint arXiv:2304.08818, 2023b.
Boyuan Chen, Diego Marti Monso, Yilun Du, Max Simchowitz, Russ Tedrake, and Vincent Sitz- mann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. arXiv preprint arXiv:2407.01392, 2024a.
Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang, Chao Weng, and Ying Shan. Videocrafter2: Overcoming data limitations for high-quality video diffusion models. In IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024b.
Shuo Chen, Cong Wei, Sun Sun, Tiancheng Shen, Ping Nie, Kai Zou, Ge Zhang, Ming-Hsuan Yang, and Wenhu Chen. Context forcing: Consistent autoregressive video generation with long context. In International Conference on Machine Learning, 2026a.
Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, Yuyang Zhao, Huizi Mao, Ying-Cong Chen, Enze Xie, Xiaojuan Qi, and Song Han. Longlive-2.0: An nvfp4 parallel infrastructure for long video generation. arXiv preprint arXiv:2605.18739, 2026b.
Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, and Cho- Jui Hsieh. Self-forcing++: Towards minute-scale high-quality video generation. arXiv preprint arXiv:2510.02283, 2025.
Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc V. Le, and Ruslan Salakhutdinov. Transformer-xl: Attentive language models beyond a fixed-length context. In Annual Meeting of the Association for Computational Linguistics, 2019.
Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, and Bo Dai. Animatediff: Animate your personalized text-to-image diffu- sion models without specific tuning. In International Conference on Learning Representations, 2024.
Roberto Henschel, Levon Khachatryan, Hayk Poghosyan, Daniil Hayrapetyan, Vahram Tadevosyan, Zhangyang Wang, Shant Navasardyan, and Humphrey Shi. Streamingt2v: Consistent, dynamic, and extendable long video generation from text. In IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025.
10
第 11 页
Jonathan Ho、Ajay Jain 和 Pieter Abbeel。去噪扩散概率模型。在《神经信息处理系统进展》中,2020年。
Jonathan Ho、William Chan、Chitwan Saharia、Jay Whang、Ruiqi Gao、Alexey Gritsenko、Diederik P. Kingma、Ben Poole、Mohammad Norouzi、David J. Fleet 和 Tim Salimans。Imagen 视频:使用扩散模型生成高清视频。arXiv 预印本 arXiv:2210.02303,2022a。
Jonathan Ho、William Chan、Chitwan Saharia、Jay Whang、Ruiqi Gao、Alexey Gritsenko、Diederik P. Kingma、Ben Poole、Mohammad Norouzi、David J. Fleet 和 Tim Salimans。视频扩散模型。arXiv 预印本 arXiv:2204.03458,2022b。
Qixin Hu、Shuai Yang、Wei Huang、Song Han 和 Yukang Chen。Longlive-rag:一种用于长视频生成的通用检索增强框架。arXiv 预印本 arXiv:2606.02553,2026年。
Xun Huang、Zhengqi Li、Guande He、Mingyuan Zhou 和 Eli Shechtman。Self Forcing:弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009,2025年。
Yicheng Ji、Zhizhou Zhong、Jun Zhang、Qin Yang、Xitai Jin、Ying Qin、Wenhan Luo、Shuiyang Mao、Wei Liu 和 Huan Li。Forcing-kv:用于高效自回归视频扩散模型的混合 KV 缓存压缩。arXiv 预印本 arXiv:2605.09681,2026年。
Jihwan Kim、Junoh Kang、Jinyoung Choi 和 Bohyung Han。Fifo-diffusion:无需训练即可从文本生成无限视频。在《神经信息处理系统进展》中,2024年。
Dan Kondratyuk、Lijun Yu、Xiuye Gu、Jos´e Lezama、Jonathan Huang、Grant Schindler、Rachel Hornung、Vighnesh Birodkar、Jimmy Yan、Ming Chuang、David Ross、Irfan Essa、Yonatan Bisk、Mohammad Norouzi、Gerard de Melo 和 Bryan Seybold。Videopoet:用于零样本视频生成的大语言模型。在《国际机器学习会议》中,2024年。
Yuhong Li、Yingbing Huang、Bowen Yang、Bharat Venkitesh、Acyr Locatelli、Hanchen Ye、Tianle Cai、Patrick Lewis 和 Deming Chen。Snapkv:在生成之前,LLM 就知道你在看什么。在《神经信息处理系统进展》中,2024年。
Kunhao Liu、Wenbo Hu、Jiale Xu、Ying Shan 和 Shijian Lu。Rolling forcing:实时自回归长视频扩散。arXiv 预印本 arXiv:2509.25161,2025年。
Yawen Luo、Xiaoyu Shi、Junhao Zhuang、Yutian Chen、Quande Liu、Xintao Wang、Pengfei Wan 和 Tianfan Xue。Shotstream:用于交互式叙事的流式多镜头视频生成。arXiv 预印本 arXiv:2603.25746,2026年。
Yu Meng、Xiangyang Luo、Letian Li、Wenyuan Jiang、Chen Gao、Xinlei Chen、Yong Li 和 Xiao-Ping Zhang。Tethercache:通过门控回忆和可信对齐稳定自回归长格式视频生成。arXiv 预印本 arXiv:2606.13035,2026年。
William Peebles 和 Saining Xie。可扩展的基于 Transformer 的扩散模型。在 IEEE/CVF 国际计算机视觉会议中,2023年。
Adam Polyak、Amit Zohar、Andrew Brown、Andros Tjandra、Animesh Sinha、Ann Lee、Apoorv Vyas、Bowen Shi、Chih-Yao Ma、Ching-Yao Chuang 等人。Movie gen:一系列媒体基础模型。arXiv 预印本 arXiv:2410.13720,2024年。
Haonan Qiu、Menghan Xia、Yong Zhang、Yingqing He、Xintao Wang、Ying Shan 和 Ziwei Liu。Freenoise:通过噪声重调度实现无需调优的更长视频扩散。在《表示学习国际会议》中,2024年。
Robin Rombach、Andreas Blattmann、Dominik Lorenz、Patrick Esser 和 Bj¨orn Ommer。使用潜在扩散模型进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议中,2022年。
Uriel Singer、Adam Polyak、Thomas Hayes、Xi Yin、Jie An、Songyang Zhang、Qiyuan Hu、Harry Yang、Oron Ashual、Oran Gafni、Devi Parikh、Sonal Gupta 和 Yaniv Taigman。Make-a-video:无需文本-视频数据即可进行文本到视频生成。在《表示学习国际会议》中,2023年。
11
第 12 页
Jiaming Song, Chenlin Meng, 和 Stefano Ermon. Denoising diffusion implicit models. 在 International Conference on Learning Representations, 2021.
Jianlin Su, Yu Lu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, 和 Yunfeng Liu. Roformer: 增强型 Transformer 与旋转位置嵌入. arXiv 预印本 arXiv:2104.09864, 2021.
Jiahao Tian, Yiwei Wang, Gang Yu, 和 Chi Zhang. Head forcing: 通过头部异质性实现长自回归视频生成. arXiv 预印本 arXiv:2605.14487, 2026.
Fu-Yun Wang, Wenshuo Chen, Guanglu Song, Han-Jia Ye, Yu Liu, 和 Hongsheng Li. Gen-l-video: 通过时间联合去噪实现多文本到长视频生成. arXiv 预印本 arXiv:2305.18264, 2023.
Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, Peiyu Wang, Biao Jiang, Yichen Wei, Yidan Xietian, Jiangbo Pei, Liang Hu, Boyi Jiang, Hua Xue, Zidong Wang, Haofeng Sun, Wei Li, Wanli Ouyang, Xianglong He, Yang Liu, Yangguang Li, 和 Yahui Zhou. Matrix-game 3.0: 具有长程记忆的实时流式交互世界模型. arXiv 预印本 arXiv:2604.08995, 2026.
Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, 和 Mike Lewis. 具有注意力汇点的高效流式语言模型. 在 International Conference on Learning Representations, 2024.
Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, 和 Peng Li. Sparse forcing: 用于实时自回归扩散视频生成的原生可训练稀疏注意力. arXiv 预印本 arXiv:2604.21221, 2026a.
Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, 和 Yinghao Xu. Next forcing: 基于多块预测的因果世界建模. arXiv 预印本 arXiv:2606.11187, 2026b.
Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Yingcong Chen, Yao Lu, Song Han, 和 Yukang Chen. Longlive: 实时交互长视频生成. arXiv 预印本 arXiv:2509.22622, 2025.
Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, 和 Pinar Yanardag. Infinity-RoPE: 动作可控的无限视频生成源于自回归自展开. arXiv 预印本 arXiv:2511.20649, 2025.
Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang. 从慢速双向到快速自回归视频扩散模型. 在 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025.
Yonghao Yu, Lang Huang, Runyi Li, Zerun Wang, 和 Toshihiko Yamasaki. Video-mirai: 自回归视频扩散模型需要远见. arXiv 预印本 arXiv:2606.03971, 2026.
Zhenyu Zhang, Ying Sheng, Tianyi Zhou, Tianlong Chen, Lianmin Zheng, Ruisi Cai, Zhao Song, Yuandong Tian, Christopher R´e, Clark Barrett, Zhangyang Wang, 和 Beidi Chen. H2o: 用于大型语言模型高效生成推理的重击预言机. 在 Advances in Neural Information Processing Systems, 2023.
Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan, Xinyuan Li, Xiao Yang, Chongxuan Li, 和 Jun Zhu. Causal forcing++: 用于实时交互视频生成的可扩展少步自回归扩散蒸馏. arXiv 预印本 arXiv:2605.15141, 2026.
Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu. Causal forcing: 正确执行的自回归扩散蒸馏用于高质量实时交互视频生成. arXiv 预印本 arXiv:2602.02214, 2026.
Junhao Zhuang, Shi Guo, Xin Cai, Xiaohui Li, Yihao Liu, Chun Yuan, 和 Tianfan Xue. Flashvsr: 迈向基于扩散的流式视频超分辨率. 在 IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026.
12
第 13 页
A 额外实验细节
基准协议。我们在 5 秒、60 秒和 240 秒的设置下评估配对的 Self Forcing 和 SGF。5 秒设置遵循标准 VBench 协议,并报告所有 16 项质量和语义维度。60 秒设置使用 VBench-Long 协议,而 240 秒设置使用 128 个随机采样的 MovieGen 提示词,并采用相同的 VBench-Long 质量指标。对于长视界评估,我们省略文本对齐指标,并专注于自回归外推下的视觉持久性。
Self Forcing 检查点来源。帧级和块级因果 ODE Self Forcing 基线使用发布的 Causal Forcing 检查点 (Zhu et al., 2026)。块级双向 ODE Self Forcing 基线使用发布的 Self Forcing 检查点 (Huang et al., 2025)。我们表中所有其他 Self Forcing 检查点均在我们复现,且训练设置与相应的 SGF 检查点相同;在每个比较中,评估提示词、随机种子、采样配置和推理上下文几何结构均保持一致。
A.1 帧级配置
对于帧级训练,我们使用完整的 5 秒训练窗口,不进行滑动窗口驱逐。因此,Pass-2 重建使用针对记录帧序列的标准教师强制风格因果掩码,而不是 sink 加 FIFO 滑动窗口掩码。该掩码与帧级 Pass-1 训练 rollout 中使用的完整上下文因果关系相匹配。
在推理和长视界评估时,帧级生成以流式模式运行,sink 为 4,FIFO 为 16,当前块为 1,总上下文窗口为 21 个潜帧。该流式策略由 Self Forcing 和 SGF 共享;在每对匹配模型中,提示词集、随机种子、采样配置、初始化和推理上下文策略均保持固定。唯一预期的区别在于采样退出损失的梯度边界:Self Forcing 将历史 KV cache 作为冻结的 rollout 状态消耗,而 SGF 通过干净上下文的 K/V 路径以梯度方式重建自生成上下文。
相应的 5 秒结果报告在表 5 中,60 秒和 240 秒的结果报告在表 1 中。
A.2 块级配置
对于块级训练,我们在 Pass-1 rollout 期间使用滑动窗口上下文。该窗口包含 sink 3、FIFO 6 和当前块 3,块大小为 3。Pass-2 重建掩码旨在匹配此 Pass-1 滑动窗口缓存关系,因此上下文梯度恢复遵循采样 rollout 期间使用的相同注意力几何结构。
相同的块级上下文策略也用于推理和长视界评估。我们包括发布的双向 ODE Self Forcing 和因果 ODE Self Forcing 检查点作为参考基线。受控的 SGF 比较是配对的因果 CD 和 TF 对,其中 Self Forcing 和 SGF 共享相同的初始化和推理几何结构。
此设置测试当内存以较粗的时间粒度更新时,上下文梯度信号是否仍然有用。5 秒块级结果报告在表 6 中,60 秒和 240 秒的结果报告在表 2 中。人类偏好分数单独报告在表 3 中。
B 完整指标表
本附录报告了完整的 5 秒 VBench 结果。指标为行,模型变体为列,粗体标记每对配对的 Self Forcing–SGF 中更好的值。这些短视界结果用作健全性检查:SGF 旨在改善长自回归外推,因此不应降低标准 5 秒视频质量。长视界 60 秒和 240 秒的结果在正文中报告。
13
第 14 页
表 5:逐帧 5 秒 VBench 指标。评估使用 sink 4、FIFO 16 和当前块 1,总上下文窗口为 21 个潜帧。成对列隔离了在相同初始化下 SGF 梯度边界的变化。
| Metric | Causal ODE init | | Causal CD init | | TF init | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | | SF | SGF | SF | SGF | SF | SGF | | Aesthetics | 0.651 | 0.665 | 0.663 | 0.672 | 0.667 | 0.671 | | Background | 0.928 | 0.956 | 0.963 | 0.968 | 0.959 | 0.959 | | Dynamics | 0.989 | 0.703 | 0.616 | 0.375 | 0.633 | 0.653 | | Imaging | 0.694 | 0.713 | 0.711 | 0.714 | 0.698 | 0.713 | | Motion | 0.972 | 0.985 | 0.983 | 0.989 | 0.986 | 0.983 | | Subject | 0.911 | 0.963 | 0.953 | 0.976 | 0.961 | 0.968 | | Flickering | 0.947 | 0.984 | 0.993 | 0.993 | 0.988 | 0.990 | | Object | 0.938 | 0.951 | 0.955 | 0.960 | 0.941 | 0.950 | | Multiple | 0.789 | 0.865 | 0.861 | 0.883 | 0.849 | 0.855 | | Action | 0.968 | 0.962 | 0.954 | 0.950 | 0.962 | 0.958 | | Color | 0.842 | 0.863 | 0.885 | 0.883 | 0.847 | 0.882 | | Spatial | 0.732 | 0.778 | 0.771 | 0.780 | 0.781 | 0.739 | | Scene | 0.563 | 0.567 | 0.574 | 0.584 | 0.538 | 0.547 | | Appearance | 0.206 | 0.204 | 0.199 | 0.204 | 0.204 | 0.203 | | Temporal | 0.246 | 0.250 | 0.242 | 0.242 | 0.239 | 0.239 | | Consistency | 0.264 | 0.262 | 0.263 | 0.263 | 0.262 | 0.264 |
B.1 逐帧 5 秒 VBench
逐帧 5 秒设置评估添加上下文梯度重建目标是否保留了短视频生成质量。逐帧训练使用完整的 5 秒训练窗口,无需滑动窗口驱逐,且 Pass-2 重建使用标准的教师强制风格因果掩码。在评估时,我们使用与长视界逐帧实验相同的流式策略:sink 4、FIFO 16 和当前块 1,总共 21 个潜帧的上下文窗口。对于 5 秒视频,该窗口覆盖了完整的生成潜序列,因此该表主要衡量短视界质量,而非长程外推。
B.2 块级 5 秒 VBench
块级 5 秒设置检查当内存以较粗的时间粒度更新时,SGF 是否与 Self Forcing 相当。与逐帧训练不同,块级训练在 Pass 1 中已经使用滑动窗口上下文,其中 sink 为 3,FIFO 为 6,当前块为 3,块大小为 3。Pass-2 重建掩码与此滑动窗口缓存关系相匹配,因此恢复的上下文梯度路径遵循与采样 rollout 相同的注意力几何结构。发布的双向 ODE 和因果 ODE Self Forcing 行作为参考基线包含在内,而受控的 SGF 比较则是匹配的因果 CD 和 TF 对。
C 直接缓存梯度可行性
本附录扩展了主论文中关于训练可行性的讨论。测量的比较结果报告在表 4 中。这里我们将通过自回归历史暴露梯度的三种可能方式分开:冻结缓存 Self Forcing、不带去噪轨迹梯度的直接可微缓存训练,以及完整 rollout BPTT。这种区分阐明了为什么 SGF 使用有界并行重建。
冻结缓存 Self Forcing。在冻结缓存 Self Forcing 中,采样退出步预测使用梯度进行训练,但历史缓存更新被分离。非退出去噪步骤在不跟踪梯度的情况下执行,并且在预测每个生成的块后,模型在上下文时间步再次调用,以在无梯度执行下更新持久 KV 缓存。因此,未来损失可以训练读取历史缓存条目的目标侧去噪计算,但不能反向传播到产生这些历史 KV 条目的 $t_{ctx} = 0$ 前向计算中。
14
第 15 页
表 6:分块 5 秒 VBench 指标。训练和评估使用 sink 3、FIFO 6、当前块 3 和块大小 3。受控的自梯度强制(SGF)比较是匹配因果一致性蒸馏(Causal-CD)和教师强制(TF)对;ODE 初始化的自强制(Self Forcing)行是参考基线。
| Metric | Bidirectional ODE init SF | Causal ODE init SF | Causal ODE init SF | Causal CD init SGF | Causal CD init SF | TF init SGF | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | Aesthetics | 0.659 | 0.660 | 0.661 | 0.663 | 0.663 | 0.678 | | Background | 0.961 | 0.959 | 0.945 | 0.958 | 0.948 | 0.964 | | Dynamics | 0.647 | 0.836 | 0.753 | 0.875 | 0.908 | 0.692 | | Imaging | 0.694 | 0.705 | 0.699 | 0.699 | 0.695 | 0.706 | | Motion | 0.984 | 0.974 | 0.978 | 0.975 | 0.976 | 0.985 | | Subject | 0.955 | 0.955 | 0.946 | 0.956 | 0.938 | 0.970 | | Flickering | 0.991 | 0.982 | 0.979 | 0.981 | 0.978 | 0.988 | | Object | 0.952 | 0.958 | 0.951 | 0.958 | 0.958 | 0.958 | | Multiple | 0.863 | 0.866 | 0.844 | 0.816 | 0.852 | 0.861 | | Action | 0.968 | 0.956 | 0.962 | 0.952 | 0.950 | 0.964 | | Color | 0.880 | 0.879 | 0.880 | 0.890 | 0.872 | 0.875 | | Spatial | 0.811 | 0.791 | 0.741 | 0.752 | 0.779 | 0.802 | | Scene | 0.574 | 0.558 | 0.560 | 0.557 | 0.542 | 0.551 | | Appearance | 0.203 | 0.205 | 0.200 | 0.199 | 0.202 | 0.203 | | Temporal Consistency | 0.244 | 0.247 | 0.245 | 0.244 | 0.241 | 0.242 |
对于批量大小 $B$、保留的历史块 $T$、每块令牌数 $L$、宽度 $D$ 和 $H$ 个 Transformer 层,原始分离缓存存储的规模约为
$$ M_{\text{cache}} \approx H \cdot 2 \cdot B \cdot T L D \cdot \text{bytes}, \quad (5) $$
其中因子 2 对应于键(keys)和值(values)。该项仅是保留缓存的张量占用空间,而非用于对其形成过程进行微分的激活图。
无去噪轨迹梯度的直接可微缓存。恢复缺失的历史形成梯度的一种直接方法是保持持久历史缓存可微,同时仍将生成的潜变量本身视为停止梯度(stop-gradient)输入。在此变体中,
$$ KV^0_i(\theta) = C_\theta \text{sg}(\tilde{x}_i), t_{\text{ctx}}; \quad KV^0_{<i}, \quad t_{\text{ctx}} = 0, \quad (6) $$
其中 $C_\theta$ 表示产生历史 K/V 条目的相同因果模型前向传播。尽管 $\tilde{x}_i$ 是分离的,但缓存形成本身仍然是串行的:块 $i$ 的 K/V 条目是在读取早期历史缓存条目时计算的。如果这些早期条目也可微,则自动微分图在展开过程中变为循环的。
因此,内存成本大于原始缓存存储:
$$ M_{\text{direct}} \gtrsim M_{\text{cache}} + \sum_{i=1}^{T} M_{\text{KV formation}(i)} + M_{\text{saved attention}}, \quad (7) $$
其中 $M_{\text{KV formation}(i)}$ 表示形成块 $i$ 的历史 K/V 条目的 $t_{\text{ctx}} = 0$ 前向计算所保存的激活,包括其对早期缓存状态的依赖。该表达式是一种缩放论证,而非精确的分配器公式。其目的是表明,即使是最小化的直接缓存替代方案(生成的潜变量已分离),也会打开一个串行的历史形成图。
完整展开的 BPTT。一种更强的替代方案是完整展开的 BPTT,其中生成的潜变量未被分离。那么,块 $i$ 的历史 K/V 条目不仅依赖于 $t_{\text{ctx}} = 0$ 的 K/V 形成前向传播,还依赖于产生 $\tilde{x}_i$ 的去噪轨迹。内存成本进一步包括去噪步骤的保存激活:
$$ M_{\text{full-BPTT}} \gtrsim M_{\text{direct}} + \sum_{i=1}^{T} \sum_{s=1}^{K_i} M_{\text{denoise}(i, s)}, \quad (8) $$
15
第 16 页
其中 $K_i$ 是用于第 $i$ 个块的去噪步数,$M_{\text{denoise}}(i, s)$ 表示生成器在去噪步 $s$ 处的激活足迹。完整的回卷反向传播(BPTT)因此同时随回卷长度和去噪深度增长,使其比上述直接可微缓存变体严格更具挑战性。
SGF 有界重建。SGF 避免了保留任一串行计算图。Pass 1 在无梯度执行下进行真实的自回归回卷,并记录自生成的上下文潜变量 $\tilde{X}_{\text{ctx}}$ 以及采样的噪声退出状态 $Z_{t^\star}$。Pass 2 丢弃持久回卷缓存,并执行一次有界的并行重建: $$ M_{\text{SGF}} \approx M_{\text{pass1 cache data}} + M_{\text{records}}(\tilde{X}_{\text{ctx}}, Z_{t^\star}) + M_{\text{parallel window}}(N), \quad (9) $$ 其中 $N$ 是固定的重建窗口长度。恢复的梯度经过 Pass 2 中 $t_{\text{ctx}} = 0$ 处的上下文侧前向传播、K/V 投影以及未来到上下文的注意力关系。它不会反向传播通过产生所记录潜变量的去噪轨迹,也不会反向传播通过 Pass 1 中的串行持久缓存更新。
解释。这给出了相关的缩放阶数: $$ M_{\text{SGF}} < M_{\text{direct}} < M_{\text{full-BPTT}}, \quad (10) $$ 其中中间项指的是使用停止梯度生成的潜变量的直接可微缓存训练,而非冻结缓存的 Self Forcing 基线。冻结缓存的 Self Forcing 可能更便宜,因为它将历史 K/V 形成路径断开,但这正是 SGF 旨在恢复的缺失梯度。表 4 中的测量结果与此观点一致:在我们的设置中,直接可微缓存训练会耗尽内存,而 SGF 通过有界的退出步重放恢复了上下文梯度路径。
D 两阶段恢复保真度
SGF 依赖于 Pass 2 是对 Pass 1 中采样的退出计算的忠实重放。本附录在正向层面验证了这一假设。目标并非声称与完整回卷 BPTT 等价,而是检查并行重建是否以混合精度执行预期的数值差异为限,复现了与串行无梯度回卷相同的局部因果关系。
协议。我们在 24 个提示和四个退出步 $t^\star \in \{1000, 750, 500, 250\}$ 上评估恢复保真度,共 96 个提示/退出比较。对于每次比较,Pass 1 在无梯度执行下进行串行自回卷,并记录采样的噪声输入以及相应的退出步预测。Pass 2 随后使用记录的噪声状态和断开的自生成上下文,在匹配的 Teacher-Forcing 注意力掩码下执行一次并行重建。我们在 VAE 解码之前比较 Pass-1 和 Pass-2 的潜变量预测。
指标。令 $x^{(1)}$ 表示 Pass-1 的退出预测,$x^{(2)}$ 表示相应的 Pass-2 重建。我们报告均方误差、均方根误差、平均绝对误差、最大绝对误差、相对 $\ell_2$ 误差和余弦相似度: $$ \text{RMSE} = \sqrt{\text{mean}((x^{(2)} – x^{(1)})^2)}, \quad (11) $$ $$ \text{RelL2} = \frac{\|x^{(2)} – x^{(1)}\|_2}{\max(\|x^{(1)}\|_2, 10^{-12})}, \quad (12) $$ $$ \text{Cosine} = \frac{\langle x^{(1)}, x^{(2)} \rangle}{\|x^{(1)}\|_2 \|x^{(2)}\|_2}. \quad (13) $$
为了将恢复误差与混合精度数值尺度相关联,我们还报告 $\text{RelL2}/\epsilon_{\text{bf16}}$,其中 $\epsilon_{\text{bf16}} = 2^{-7}$ 是 bf16 的相对精度尺度。由于串行缓存执行和并行重建都经过许多 bf16 变换器操作,累积舍入误差自然可以是该参考尺度的一个小倍数。
16
第 17 页
表 7:Pass-1 与 Pass-2 潜变量恢复保真度对比。各项指标为每个退出步骤(exit step)在 24 个提示词上的平均值。总体平均值基于所有 96 个提示词/退出步骤的比较计算得出。我们还报告了相对于 bf16 相对精度 $\epsilon_{\text{bf16}} = 2^{-7}$ 归一化的相对 $\ell_2$ 误差。
| 退出步骤 | 比较次数 | MSE | RMSE | 平均绝对误差 | 最大绝对误差 | 相对 $\ell_2$ | 相对 $\ell_2$ / $\epsilon_{\text{bf16}}$ | 余弦相似度 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 1000 | 24 | 3.123e-4 | 0.01745 | 0.01093 | 0.58396 | 0.02133 | 2.73 | 0.999766 | | 750 | 24 | 2.148e-4 | 0.01449 | 0.00884 | 0.58189 | 0.01566 | 2.00 | 0.999874 | | 500 | 24 | 1.141e-4 | 0.01064 | 0.00693 | 0.49110 | 0.01125 | 1.44 | 0.999936 | | 250 | 24 | 6.041e-5 | 0.00774 | 0.00535 | 0.29028 | 0.00812 | 1.04 | 0.999967 | | 总体 | 96 | 1.754e-4 | 0.01258 | 0.00801 | 0.48681 | 0.01409 | 1.80 | 0.999886 |
<!– Image (105, 566, 869, 766) –>
图 4:解码后的 Pass-1 和 Pass-2 恢复对比。各行展示了在退出步骤 1000、750、500 和 250 时,Pass 1 和 Pass 2 的成对解码输出。解码后的成对输出在视觉上几乎无法区分,这与表 7 中的潜空间恢复结果一致。
结果。表 7 显示,Pass 2 在整个去噪调度过程中紧密复现了 Pass-1 的退出预测。总体相对 $\ell_2$ 误差为 1.41%,平均余弦相似度为 0.999886。相对 $\ell_2$ 误差也接近 bf16 数值尺度:总体上是 $\epsilon_{\text{bf16}}$ 的 1.80 倍,且该比率从最噪声的退出步骤的 2.73 下降到退出步骤 250 时的 1.04。由于两条路径执行了许多具有不同串行和并行计算顺序的 bf16 Transformer 操作,这种接近 bf16 参考尺度的微小倍数与累积的浮点舍入误差一致,而非恢复计算中的实质性不匹配。
这些结果支持将 Pass 2 用作采样退出计算的有界局部代理。该诊断验证了局部注意力计算的前向恢复达到了预期的混合精度数值误差水平;但这并不意味着 SGF(自梯度强制)恢复了完整串行展开的精确梯度。
17
第 18 页
20) 局部编码不匹配 (idx. 训练 0 1 2 3 4 5 6 7 … 0.6 潜变量
推断 sink = 1 1 0 n n+1 n+2 n+3 n+4 n+5 n+6 … 完整前缀 0.4 至 0.2 L2 推断 0.0 0 1 2 3 4 5 6 7 8 9 sink = 4 0 1 2 3 n n+1 n+2 n+3 … 相对 目标局部 VAE 索引 (0 = 单帧)
图 5:VAE 边界与 sink 潜变量选择。左侧:sink 1 仅保留流起始锚点,而 sink 4 保留短边界过渡前缀。右侧:在添加之前的潜变量组后,相对于完整前缀第 21 个潜变量的局部重新编码不匹配迅速下降,并在前四个位置附近趋于平稳。这促使我们在逐帧流式推理中使用四个 sink 潜变量。
E VAE 边界与 Sink 选择
逐帧流式推理使用“sink 加 FIFO”上下文策略。该策略被 Self Forcing 和 SGF 共同使用,因此它并非 SGF 的独立贡献。我们包含此附录以证明逐帧实验中使用的 sink 大小的合理性。
Wan VAE 起始边界诊断。Wan 视频 VAE 使用非对称分组模式对时间进行编码:流以 1 帧的边界组开始,随后是 4 帧的组。因此,新编码片段的初始几个潜变量位置不一定等同于流内稳定状态的潜变量。为了测量这种影响,我们使用 10 个视频,每个视频包含 81 个像素空间帧,对应 21 个 VAE 潜变量帧。对于每个视频,我们编码完整前缀并取第 21 个潜变量,即从零开始的索引 20,作为参考。
然后,我们重新编码以相同目标帧组结束的局部窗口,并将最后一个局部潜变量与完整前缀参考进行比较。新的 4 帧控制仅使用帧 [77, 81),但由于 VAE 以 1 帧边界组启动每个新流,这会产生一个起始边界潜变量,而不是正常的流内 4 帧潜变量。锚窗口设置包括一个边界锚帧,加上目标组之前的 W 个 4 帧潜变量组。因此,W = 0 编码帧 [76, 81),而更大的 W 值包含 progressively 更多的先前潜变量组。
诊断显示,当目标组作为新流编码时,存在较大的不匹配:相对 L2 误差为 0.607。添加边界锚将误差降低至 W = 0 时的 0.271,而包含更多先前潜变量组进一步将其降低至 W = 1, 2, 3, 4 时的 0.124, 0.084, 0.067 和 0.060。超出此范围后,误差变化很小。这表明早期的 VAE 潜变量形成一个短的边界过渡区域,而不是单个孤立的 sink 标记。
Sink 数量消融实验。因此,我们在 60 秒时采用 TF 初始化的逐帧 SGF 中对 sink 潜变量的数量进行消融实验。总流式上下文预算是固定的,因此增加 sink 大小会保留更多前缀潜变量,但留给近期 FIFO 上下文的槽位更少。因此,相关趋势并非严格的单调改进,而是小的 sink 是否能在不不必要减少近期上下文预算的情况下覆盖 VAE 边界区域。
表 8 显示,sink 1 在美学质量和闪烁方面表现较弱,而 sink 4 达到了 VAE 边界诊断所建议的稳定范围。Sink 8 在某些指标上仅带来边际增益,并消耗了更多的固定上下文预算。因此,我们在逐帧长视界实验中使用 sink 4,因为它是覆盖观察到的边界过渡前缀的最小 sink 大小。
F 局限性
SGF 是对缺失的上下文梯度信号的一种有界替代方案,而非通过自回归展开进行完整的反向传播。它监督记录的自生成潜变量如何写入未来可读的内存,但它不通过未来损失更新采样的潜变量本身,
18
第 19 页
表 8:在 60 秒评估中,使用 TF 初始化的逐帧 SGF 的 Sink 消融实验。在 VBench 导向后,所列分数越高越好。
| Metric | Sink 1 | Sink 2 | Sink 4 | Sink 8 | | :— | :— | :— | :— | :— | | Aesthetics | 0.627 | 0.645 | 0.653 | 0.655 | | Background | 0.970 | 0.974 | 0.974 | 0.976 | | Dynamics | 0.743 | 0.733 | 0.730 | 0.728 | | Imaging | 0.715 | 0.713 | 0.714 | 0.714 | | Motion | 0.982 | 0.982 | 0.982 | 0.983 | | Subject | 0.983 | 0.982 | 0.983 | 0.983 | | Flickering | 0.990 | 0.990 | 0.991 | 0.992 |
| | 0 s | 12 s | 24 s | 36 s | 48 s | 60 s | | :— | :— | :— | :— | :— | :— | :— | | Sink size = 1 | | | | | | | | Sink size = 2 | | | | | | | | Sink size = 4 | | | | | | | | Sink size = 8 | | | | | | |
提示词:在一部黑白经典电影风格的影片中,一对衣着考究、身着优雅晚礼服的夫妇撑着黑色雨伞,一同走在回家的路上。他们突然遭遇倾盆大雨,……
图 6:60 秒时的定性 Sink 消融实验。极小的 Sink 保留的早期流起始边界信息过少,而多潜变量 Sink 则在长外推期间更好地维持了主体和场景的一致性。该消融实验支持所选的逐帧流式策略;核心 SGF 主张仍是通过自生成上下文 K/V 形成来恢复梯度。
它也不优化产生这些结果的去噪决策序列。因此,我们并不声称能恢复完整串行展开的精确梯度。
SGF 还假设并行 Pass-2 重建在采样的退出步骤忠实地复现了串行上下文关系。如果教师强制掩码、Sink 位置、FIFO 窗口、RoPE 处理、上下文时间步或块对齐与推理存在偏差,SGF 可能会为错误的注意力关系恢复梯度,从而训练出一个不同的生成器。这种对齐在干净上下文时间步尤其重要,正是因为该缓存写入调用在冻结缓存训练中是与噪声退出步骤损失共享的,但并未直接受其监督。
最后,SGF 并非其他长视频技术的替代品。流式长展开微调、检索增强记忆、稀疏注意力、更强的因果初始化以及长上下文教师均针对系统的互补部分。我们的主张更为狭窄:自展开训练使用生成的历史作为上下文,但留出了一个特定的历史形成梯度未被使用,而 SGF 提供了一种恢复该梯度的实用方法。一个自然的下一步是将 SGF 与长展开曝光或检索相结合,使模型既能写出更好的短窗口记忆,又能访问更丰富的长程上下文。
19
第 20 页
0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + TF 初始化
SGF + TF 初始化
提示词:一辆汽车位于干净空旷道路上一辆摩托车的右侧,正面视角。汽车是一辆流线型的现代轿车, 拥有抛光的金属漆面,摩托车是一辆运动型车型,拥有光亮的黑色外观。… 0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + TF 初始化
SGF + TF 初始化
提示词:一个人蹲在公园里,周围是郁郁葱葱的绿草和高大树木提供的树荫。该个体 双手 resting 在膝盖上,低头看着地面,表情专注。…
图 7:在 TF 初始化下的逐帧 60 秒对比。在汽车与摩托车的提示词中,两种方法都保持合理,但 SGF 使汽车位置、道路几何结构和摩托车关系保持得更固定。在蹲姿人物的提示词中,Self Forcing 随时间改变主体姿态、身份和构图,而 SGF 保持了一致的蹲姿动作和公园背景。此示例说明,SGF 可以在发生灾难性视觉崩溃之前减少身份和相机漂移。
G 附加定性结果
本附录提供了逐帧和分块实验的额外长时距定性比较。这些视频条旨在通过展示聚合分数背后的时间失效模式,来补充定量表格。每次比较应在匹配的设置下进行阅读:Self Forcing 和 SGF 使用相同的提示词、种子、初始化、时距、采样配置和推理上下文几何结构。我们关注与记忆相关的漂移,包括视角变化、裁剪漂移、场景替换、主体身份变化、物体消失以及退化为不相关的纹理。
G.1 逐帧比较
逐帧生成将每个生成的潜在帧写回历史上下文,因此历史 K/V 形成中的误差会在最细的时间粒度上累积。在 TF、因果 CD 和因果 ODE 初始化下,Self Forcing 在早期帧中通常保持局部合理性,但会逐渐改变主体、相机距离、物体布局或背景。在较弱的初始化下,漂移可能变得严重,产生裁剪片段、色块或不相关的场景纹理。SGF 始终减少这些失效模式:它在 60 秒和 240 秒的 rollout 中更好地保留了主体-场景关系、相机构图和物体布局。
20
第 21 页
0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + CD 初始化
SGF + CD 初始化
提示词:一辆时尚、现代的绿色跑车行驶在风景优美的沿海公路上。车身拥有光泽感的外饰和极简主义设计 元素,如平滑的线条和流线型的轮廓。夕阳西下,…… 0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + CD 初始化
SGF + CD 初始化
提示词:一只拥有光泽羽毛的黑色 sleek 鸟的特写镜头,优雅地栖息在一根光秃秃的树枝上。这只鸟尖锐 的喙和锐利的眼睛清晰可见,它微微歪着头,全神贯注地观察着周围的环境。……
图 8:因果一致性蒸馏(causal CD)初始化下的逐帧 60 秒对比。在因果一致性蒸馏初始化下,自强制(Self Forcing)并不总是崩溃,但会表现出系统性的裁剪和缩放漂移。海龟和大象的例子逐渐放大主体,减少了场景上下文,有时甚至截断物体。自梯度强制(SGF)保持了动物比例、背景和相机距离的稳定性,表明 SGF 不仅改善了非灾难性的长视界组成漂移,还改善了完全失败的情况。
0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + CD 初始化
SGF + CD 初始化
提示词:一只快乐的 Otter(水獭)自信地站在冲浪板上的迷人 3D 数字渲染图,穿着明亮的黄色救生衣, 在清澈碧绿的热带水域中滑行。水獭拥有柔软、细节丰富的皮毛和富有表现力的…… 0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + CD 初始化
SGF + CD 初始化
提示词:一幅充满活力的动漫风格插画,采用粗犷、富有表现力的笔触,描绘了一位 20 多岁的年轻男子,留着凌乱的黑色短发和温暖的棕色眼睛,正全神贯注地阅读一本经典的皮革装订书籍。……
图 9:因果一致性蒸馏(causal CD)初始化下的逐帧 240 秒对比。水獭提示词显示,自强制(Self Forcing)可以保留广泛的语义,但会累积姿态和边界失真,而自梯度强制(SGF)使水獭保持在冲浪板中央,热带水域布局更加稳定。在动漫阅读提示词中,自强制(Self Forcing)在后期时间戳中漂移至部分裁剪和高饱和度色彩条纹;自梯度强制(SGF)在完整的 240 秒内保留了男孩、书籍和云朵背景。
21
第 22 页
0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + ODE 初始化
SGF + ODE 初始化
提示词:一幅黑白插图,描绘格温·斯泰西舒适地坐在温馨的图书馆里,全神贯注地阅读一本书。格温留着长长的红发,盘成一个松散的发髻,身穿经典的白色衬衫和及膝百褶裙。… 0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + ODE 初始化
SGF + ODE 初始化
提示词:花瓶位于画面右侧的前视图,时钟位于花瓶左侧。时钟和花瓶清晰可见,时钟显示逼真的时间,并具有罗马数字等复杂细节,以及…
图 10:因果 ODE 初始化下的逐帧 60 秒对比。在“图书馆阅读”提示词中,自强制(Self Forcing)在 24 秒时引入彩色背景伪影,在 36 秒时丢失坐着的读者,并在 48–60 秒时退化为书架/窗户碎片;而 SGF 保持读者、扶手椅、打开的书和书架布局的稳定。在“时钟与花瓶”提示词中,自强制从预期的正面双物体构图漂移至裁剪或模糊的特写及背景碎片,而 SGF 在整个生成过程中保留了时钟在左/花瓶在右的桌面排列。
0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + ODE 初始化
SGF + ODE 初始化
提示词:一个短小、毛茸茸的怪物的大特写 3D 动画场景,它有着大而圆的眼睛和张开的嘴巴,跪在一根融化的红色蜡烛旁,敬畏地凝视着摇曳的火焰。 creature 柔软、毛绒般的皮毛在温暖的… 0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + ODE 初始化
SGF + ODE 初始化
提示词:一幅色彩鲜艳的卡通风格插图,描绘一只快乐的袋鼠充满活力地跳着迪斯科舞,身穿闪闪发光的亮片上衣和裤子,在彩色灯光下闪闪发光。这只袋鼠有着富有表现力的眼睛,顽皮的笑容,…
图 11:因果 ODE 初始化下的逐帧 240 秒对比。在匹配的初始化和逐帧流式设置下,自强制(Self Forcing)发生严重的长时域漂移:蜡烛/怪物示例退化为色块和部分主体替换,迪斯科袋鼠示例反复丢失舞台布局和主体身份。SGF 在 240 秒内更一致地保留了提示词特定的主体、姿态家族和场景布局。
22
第 23 页
0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + TF 初始化
SGF + TF 初始化
提示:一位表情温暖友好的人正在木质厨房台面上削苹果。他们穿着适合烹饪的休闲、舒适的衣服。这个人一只手拿着苹果,另一只手拿着削皮器,…… 0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + TF 初始化
SGF + TF 初始化
提示:特写镜头显示一个人在美容院修眉。这个人舒适地坐在椅子上,面前有一面镜子,他们的脸向上倾斜,美容师正小心翼翼地为他们化妆……
图 12:在 TF 初始化下的分块 60 秒对比。在削苹果提示中,使用 TF 初始化的 Self Forcing 改变了人物身份和摄像机视角,有时将桌面动作替换为微笑面部的特写。SGF 使手、苹果和台面动作保持一致性更高。在修眉提示中,Self Forcing 随时间改变了人物数量和身份;SGF 保持了相同的坐姿客户、化妆手势和沙龙环境。
G.2 分块对比
分块生成以更粗的时间粒度更新记忆,每个生成的分块作为后续分块的上下文。分块图表测试当历史以多帧块的形式写入和消费时,恢复的上下文梯度信号是否仍然有用。当包含 ODE 初始化行时,它们作为参考基线;受控比较是在相同初始化下匹配的 Self Forcing 和 SGF 行。定性模式与逐帧情况一致:Self Forcing 可能会替换动作、改变人物、丢失物体或漂移至不相关的纹理,而 SGF 在长序列生成中更好地保持了动作、主体身份和场景布局。
23
第 24 页
0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + TF 初始化
SGF + TF 初始化
提示词:高度详细的科学纪录片风格微距摄影,单个具有光滑半透明膜球形细菌,显示出内部核糖体和拟核结构,悬浮在清澈的液体介质中。 …. 0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + TF 初始化
SGF + TF 初始化
提示词:一张高分辨率的逼真照片,展示了一只带有黑色斑点的鲜艳绿色蜥蜴,栖息在郁郁葱葱的热带森林的一片叶子上,舌头在半空中伸出,即将捕捉一只蟋蟀。蜥蜴锐利的眼睛锁定猎物, ….
图 13:在 TF 初始化下的分块 240 秒对比。较粗粒度的分块滚动测试生成的块在几个块之后是否仍作为上下文有用。在细菌提示词中,SGF 更一致地维持了一群半透明球形细胞,而 Self Forcing 经常将场景变成不相关的圆形纹理或稀疏粒子。在蜥蜴提示词中,Self Forcing 经常丢失动物或坍塌为植被;SGF 在长视界中更好地在树叶间保留了绿色蜥蜴。
24
第 25 页
0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + CD 初始化
SGF + CD 初始化
提示词:动画风格,一对衣着考究的夫妇身着正式晚礼服走在繁华的城市街道上,突然下起了倾盆大雨。他们迅速拿出雨伞,鲜艳的颜色与黑暗的背景形成对比,…… 0 秒 12 秒 24 秒 36 秒 48 秒 60 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + CD 初始化
SGF + CD 初始化
提示词:一只快乐、开心的柯基犬在日落时分阳光充足的公园里奔跑玩耍。柯基犬表情顽皮,尾巴剧烈摇摆,正在探索草地。这只狗戴着一个小巧的彩色项圈。……
图 14:因果 CD 初始化下的分块 60 秒对比。该条带包含了双向 ODE 和因果 ODE 的自强制(Self Forcing)参考,以及匹配的因果 CD 对。在“雨伞夫妇”提示词中,因果 CD 初始化下的自梯度强制(SGF)在保持两人、雨伞颜色以及雨中街道布局的一致性方面表现更好,而自强制变体经常改变视角或主体排列。在“柯基犬”提示词中,因果 CD 初始化下的自梯度强制(SGF)比匹配的自强制行更一致地保留了可见的奔跑狗狗和公园草地背景,后者倾向于漂移至特写裁剪。
25
第 26 页
0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + CD 初始化
SGF + CD 初始化
提示词:一部电影质感的 35mm 胶片镜头,拍摄一名留着短而凌乱的棕色头发、眼神坚定有力的年轻男子,在霓虹灯照亮的城市街道上全力奔跑,双臂有力地摆动,面部表情专注且充满活力。摄像机从低角度近距离跟随拍摄,…. 0 秒 48 秒 96 秒 144 秒 192 秒 240 秒
SF + BiODE 初始化
SF + ODE 初始化
SF + CD 初始化
SGF + CD 初始化
提示词:一幅戏剧性的高角度奇幻插画,描绘一个形似人类的巨大云巨人,双臂张开,向下方暴风雨肆虐的景观释放出强大的闪电。这个高大的身影表情凶猛且坚定,….
图 15:因果 CD 初始化下的分块 240 秒对比。该条带包括 ODE 初始化的自强制(Self Forcing)参考以及匹配的因果 CD 对。在奔跑者提示词中,ODE 基线漂移至夜间街道或背面视角镜头,而在因果 CD 初始化下的匹配自强制方法虽然间歇性地保留了主体,但仍改变了视角和面部身份。因果 CD 初始化下的自梯度强制(SGF)更一致地保持了面向前方的奔跑者和霓虹街道背景。在云巨人提示词中,SGF 更好地维持了连贯的人形闪电形象,而不是崩溃成特写片段或不相关的风暴纹理。
26