三分钟导读:本文提出了一种免训练的推理时框架Surprise Forcing,通过基于“惊讶度”信号动态管理外部记忆库和去噪步数,解决了长视频生成中上下文遗忘和计算资源分配不均的问题。
英文题目:Surprise Forcing: What to Remember, When to Skip in Long Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.18436
原始论文:PDF / 论文页面
对应视频标题:Surprise Forcing:长视频生成中的记忆保留与跳过策略|推荐指数:★★★★★
这篇论文解决什么问题?
流式自回归扩散模型在生成长视频时面临两个主要限制:1. 滚动KV缓存按时间顺序遗忘历史,导致重要视觉证据(如主体身份)丢失;2. 固定的去噪调度对所有视频块分配相同的计算资源,无法适应视频内容的动态难度变化。
核心创新
- 提出了一种统一的免训练视角,将长视频推理视为历史上下文和去噪计算的选择性分配问题。
- 设计了Surprise-Gated Memory Bank,结合反馈控制的准入机制、效用感知的驱逐策略和查询依赖的动态路由。
- 引入了自referential的难度估计器,无需辅助网络即可在块级别自适应调整去噪深度。
- 提出了Budget-Norm Gating,通过在线统计和反馈更新实现稳定的记忆库利用率控制。
方法概览
Surprise Forcing包含两个核心组件:1. Surprise-Gated Memory Bank:利用价值令牌(Value Tokens)提取帧描述符,通过全局偏差和最近邻新颖性计算惊讶度,结合Budget-Norm Gating反馈控制器动态调节记忆库的写入和基于优先级的驱逐;2. Surprise-Aware Denoising:通过计算去噪第一步后相邻帧的最大余弦距离来估计块难度,动态决定是执行完整去噪还是跳过中间步骤。
逐图理解论文
方法概览:Surprise Forcing

Surprise Forcing是一种免训练的推理时框架,包含两个核心组件。Surprise-Gated Memory Bank利用惊讶度信号动态管理记忆库的写入与驱逐。Surprise-Aware Denoising则根据块难度估计,自适应调整去噪步数,实现计算资源的动态分配。
创新一:Surprise-Gated Memory Bank

该模块利用Value Tokens提取帧描述符,通过全局偏差和最近邻新颖性计算惊讶度。结合Budget-Norm Gating反馈控制器,动态调节记忆库写入,并基于优先级驱逐低效用条目,确保关键上下文被保留。
创新二:Surprise-Aware Denoising

通过计算去噪第一步后相邻帧的最大余弦距离,估计当前块的难度。高惊讶度意味着高难度,需执行完整去噪;低惊讶度则允许跳过中间步骤。这种自referential的难度估计器无需辅助网络,即可实现块级自适应调整。
主要结果:SOTA表现

在VBench-Long上,Surprise Forcing获得81.88的总分,主体一致性达到63.98,均为SOTA。在保持17.18 FPS的同时,实现了长视频生成的质量与速度平衡,显著优于基线方法。
长程一致性评估

在VBench-2.0上,模型在Human Identity上达到82.63,Multi-View Consistency为29.76。定性比较显示,该方法在长视频生成中维持了强主体一致性和平滑运动连续性,视觉质量退化极小。
实验与关键结果
- 在VBench (5s)和VBench-Long (60s)基准上进行定量比较。
- 在VBench-2.0上进行长程一致性评估(主体身份、服装、实例保持、多视角一致性)。
- 消融实验分析惊讶度分数分解、记忆库容量、路由策略、目标写入比率、驱逐策略和去噪预测器。
- 定性比较展示主体一致性和运动连续性。
- VBench-Long Total Score: 81.88 (SOTA)(第 8 页)
- VBench-Long Subject Consistency: 63.98 (SOTA)(第 8 页)
- VBench-Long FPS: 17.18(第 8 页)
- VBench-2.0 Human Identity: 82.63(第 9 页)
- VBench-2.0 Multi-View Consistency: 29.76(第 9 页)
- Skip Ratio 0.4时加速15.8%且质量接近全调度(第 10 页)
阅读时需要注意
- 描述符为紧凑的平均池化摘要,可能无法区分具有相似全局内容但空间排列不同的帧。
- 优先级权重和目标比率在生成过程中固定,缺乏针对任务或提示结构的高级控制器。
- 当前评估仅涵盖长达一分钟的片段,未验证更长时间或交互式轨迹下的表现。
- 步数跳过仅在两种调度方案间二元选择,缺乏更丰富的求解器路径分配。
- 该方法为免训练推理时优化,依赖于基础模型(LongLive/Wan2.1)的性能。
- 惊讶度分数依赖于局部统计量,在视频内容分布剧烈变化时可能需要冷启动缓冲。
- 记忆库容量较小(C=6),可能无法容纳极其复杂的多主体场景。
关联工作
- 现有的Self Forcing和Rolling Forcing等方法通过因果块生成实现实时性,但缺乏对历史上下文的选择性访问机制。它们无法区分重要信息与冗余帧,导致长程一致性下降,且计算预算固定,难以应对复杂场景。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Surprise Forcing:长视频生成中该记住什么、何时跳过
Shuwei Shi1, Zhen Li1, Muyao Niu1, Chuanhao Li1, Bo Zheng1, Kaipeng Zhang1,†, Yinqiang Zheng2,†
1 Alaya Lab 2 东京大学
流式自回归扩散使得分钟级视频合成成为可能,但其有限的上下文和固定的去噪调度将资源均匀分配给高度非平稳的序列。滚动键值缓存会遗忘远处的视觉证据,即使这些证据仍然重要;而无论实际难度如何,每个生成的块都会获得相同数量的去噪步骤。我们提出了 Surprise Forcing,这是一个免训练框架,将这两个限制视为在线资源分配问题。Surprise-Gated Memory Bank 使用 value-token 描述符总结被驱逐的帧,利用互补的全局偏差和最近邻新颖性信号对其进行评估,并通过归一化分数空间中的反馈控制预算来调节准入。基于优先级的替换和相关性感知的路由随后保持外部记忆库紧凑且有用。并行地,Surprise-Aware Denoising 根据第一次去噪步骤后最大相邻帧余弦距离来估计块的难度,并使用局部百分位数调度器跳过相对容易的块的中间步骤。在 VBench、VBench-Long 和 VBench-2.0 上的实验表明,所提出的分配策略在保持实时流式吞吐量的同时,改善了长程一致性和视觉质量。
2026 年 7 月 20 日 [cs.CV]
图 1 Surprise Forcing 生成的样本。我们的方法可以在保持良好时间一致性的同时进行实时长视频生成。arXiv:2607.18436v1 1 引言
最近的文本到视频扩散模型在保真度、运动和提示遵循方面有了显著改进 [6, 26, 30, 31, 37, 28]。然而,将这些模型从短片扩展到持续生成,改变了推理问题的性质。流式自回归 (AR) 系统必须反复决定如何在视觉状态跨越数百帧演变的过程中使用有限的上下文窗口和有限的计算预算。现有的少步 AR 管道 [8, 4, 36, 19, 7] 通过因果块生成使这种模式成为可能,
† 通讯作者:kaipeng.zhang@shanda.com; yqzheng@ai.u-tokyo.ac.jp
1
第 2 页
滚动键值(KV)缓存,以及分布匹配蒸馏 [40, 39];它们本身并不能决定哪些历史证据值得持续访问,或哪些块值得进一步细化。
第一个问题是选择性遗忘。滚动缓存通过按时间顺序丢弃旧状态来限制内存。这种策略成本较低,但时间年龄与未来的有用性相关性较弱。早期的视图可能确立了主体身份、服装、几何结构或场景布局,并在很久之后仍然相关,而最近的帧可能除了近邻上下文外几乎没有增加新信息。一旦具有信息量的历史被驱逐,身份漂移和场景不一致将难以纠正。
第二个问题是均匀计算。固定的去噪调度对每个块花费相同数量的 Transformer 评估次数。长视频的难度并非均匀分布 [23]:近乎静态的延续通常能迅速稳定,而突然的运动、物体进入、视角变化和场景转换则需要更多的迭代修正。因此,均匀细化会导致对简单区域过度计算,并限制交互吞吐量。
我们将这两个问题重新构建在一个共同原则周围:模型自身的中间表示包含一个在线的惊讶度信号。对于记忆管理,惊讶度衡量的是新驱逐的帧在当前记忆库中的表示质量有多差。对于去噪,惊讶度衡量的是在第一步细化之后,时间变化仍然可见的程度。这些信号成本低廉、具有因果性,并且无需重新训练即可获取。
基于这一原则,我们引入了 Surprise Forcing。其第一个组件是 Surprise-Gated Memory Bank,它在滚动缓存之外存储选定的帧。由 Value Tokens 派生的帧描述符根据其与记忆库的整体偏差以及最近邻新颖性进行评分。自适应控制器在归一化分数空间中调节准入率;复合优先级规则决定替换;动态路由仅检索最相关的全局上下文。其第二个组件是 Surprise-Aware Denoising,它根据一步去噪后的相邻帧潜在变化来预测块的难度,并使用滑动窗口百分位规则分配减少或完整的调度。
我们将 Budget-Norm Gating 表述为一个完全在线的控制器,具有显式的运行统计量、反馈更新和冷启动行为。我们通过 VBench-2.0 对身份、服装、实例和视角一致性的测量来评估长程保持能力,并结合对惊讶度公式、记忆容量、路由、准入预算、驱逐策略和去噪预测器的受控研究进行评估。
我们的主要贡献如下:
• 一种统一的、免训练的长视频推理视角,将其视为对历史上下文和去噪计算的 selective allocation(选择性分配);
• 一种带有反馈控制准入、效用感知驱逐和查询依赖检索的 surprise-gated external memory(基于惊讶度门控的外部记忆库);
• 一种自引用的难度估计器,它在不使用辅助网络的情况下在块级别适应去噪深度;以及
• 一项全面的实证评估,展示了每个设计选择如何影响长序列运行中的一致性、质量、速度和内存使用。
2 相关工作
2.1 自回归长视频生成
双向视频扩散在短片段上提供了强大的全局建模能力,但其成本随时间范围的增长而迅速增加。FreeNoise [24]、FreeLong [20]、FreeLong++ [21]、FIFO-Diffusion [14] 和滚动扩散 [25] 等免训练方法通过修改噪声调度或时间处理来扩展采样范围。Diffusion Forcing [2] 和 HistoryGuidance [27] 则将扩散与因果预测连接起来,这一方向也反映在 SkyReels-V2 [3] 和 Magi-1 [29] 等系统中。
第二条路线明确针对流式自回归(AR)生成。StreamingT2V [5] 融合了历史信息,CausVid [41] 将双向教师蒸馏为因果学生,StreamDiT [15] 将蒸馏与移动缓冲区相结合,Rolling Forcing [19] 开发了实时扩散强制滚动,而 Self Forcing [8] 通过自滚动减少训练-测试不匹配。Self-Forcing++ [4] 和 LongLive [36] 进一步扩展了可用
第 3 页
时间跨度。Surprise Forcing 与这些训练策略互补:它仅在推理时运行,并重新分配已训练流式生成器的内存和去噪预算。
2.2 上下文管理与显式记忆
有界局部注意力是控制流式计算成本的标准机制。Attention sinks 最初针对语言模型流式处理进行了分析 [34],它保留了一些初始锚点,但大多数中间历史仍被遗忘。Deep Forcing [38] 通过活跃窗口内的 sink 设计和压缩,保留高参与度令牌。相比之下,我们的方法将选定的被驱逐帧移入紧凑的外部存储,并以帧粒度检索它们。
相关方法在重用之前压缩或打包上下文。LoViC [12]、FramePack 风格的条件 [43]、学习的记忆编码器 [44] 以及打包与强制策略 [32] 以表示细节换取更长的有效时间跨度。显式检索在长程生成中也变得重要。其总体思路类似于检索增强生成 [16],但视频记忆必须在严格的延迟约束下保持因果视觉状态。WorldMem [35]、Context-as-Memory [42]、VMem [17]、Memory Forcing [7] 和 MemFlow [11] 为世界模拟和长叙事学习或设计检索机制。Surprise Forcing 的不同之处在于使用轻量级、免训练的写入控制器,并联合考虑准入、替换和路由。
2.3 高效视频扩散
少步合成通常通过分布匹配及相关蒸馏目标获得 [40, 39];CausVid [41] 和 StreamDiT [15] 将这些思想应用于流式视频。免训练缓存,以 AdaCache [13] 为例,重用中间 Transformer 计算并根据运动调节重用。Sparse VideoGen [33]、Radial Attention [18] 和 Mixture-of-Contexts [1] 通过架构稀疏性减少令牌或注意力成本。我们的侧重点不同:骨干网络和权重保持不变,计算是在观察一步时间难度估计后在块级别分配的。
3 方法
我们的框架建立在蒸馏流式生成器之上,并添加了两个推理时控制器。我们首先总结潜在的自回归(AR)公式,然后描述惊讶度如何控制外部记忆和去噪深度。
3.1 预备知识
假设长视频生成为固定长度潜在块的序列。在文本 $c$ 的条件下,因果分解为
$$ p_\theta(x_{1:N} | c) = \prod_{n=1}^{N} p_\theta(x_n | x_{<n}, c), \quad (1) $$
其中 $x_n$ 是第 $n$ 个块,前面的块通过有界滚动 KV 缓存表示。
基础生成器遵循分布匹配蒸馏(DMD),它将因果学生模型与短程双向教师模型对齐。设 $t$ 为采样的扩散时间,$z \sim \mathcal{N}(0, I)$ 为生成器噪声,$G_\theta(z)$ 为学生输出,$\Phi(\cdot, t)$ 为前向加噪算子。用 $p^S_{\theta,t}$ 和 $p^T_t$ 表示时间 $t$ 时的学生和教师分布,对应的分数为 $s^S_\theta$ 和 $s^T$。目标函数为
$$ L_{\text{DMD}} = \mathbb{E}_t \text{KL} \left( p^S_{\theta,t} \parallel p^T_t \right), \quad (2) $$
其中分数形式的近似为
3
第 4 页
帧描述符模块 基于优先级的驱逐 块内惊讶度预测器 记忆库 · 𝟐 余弦距离 最大值 均值 帧间帧被驱逐 L2 归一化 描述符 𝒅 惊讶度 𝑠4 使用率 u4 年龄 𝑎4 池化帧 𝑉 惊讶度得分 检索频率 已流逝步数 第 0 步去噪块 /𝑦(;)
惊讶度得分计算 𝑝4 = 𝑤5 · 𝑠4 + w6 · u4 −𝑤7 · 𝑎4 块内惊讶度得分 𝑑48<=7 全局偏差 𝑆!"#$ min 𝑝4 与整体记忆库的偏差 自适应步长调度 + 惊讶度得分 𝒔记忆 局部新颖性 𝑆%&' 驱逐 记忆库滑动窗口 最近的 𝑑48<=7 得分 预算归一化门控 添加新槽位 更新 𝜇 𝑝89: 百分位排名 < 指数加权 权重 𝜎 𝒛= (𝒔−𝝁)/𝝈 𝑧≥𝜏 目标跳过比率? 𝜏←clamp(𝜏+ 𝜂1 z ≥𝜏−𝑟, −3, 3) 插入 更新后的 是 否 记忆库 简单块,低惊讶度 困难块,高惊讶度 自适应阈值更新 否则记忆库已满
动态帧路由 候选池 最终路由上下文 分配缩减调度 {0, 3} 跳过 分配完整 调度 + + + cos(𝑑", 𝑑#$%&') 调度 + + + 查询 相关性 远端局部 记忆库 TOP-K 汇点帧 近端局部 0 1 2 3 {0, 1, 2, 3} 描述符 𝑑" 得分 帧 槽位 帧 帧 当前生成
(a) 惊讶度门控记忆库 (b) 惊讶度感知去噪
图 2 Surprise Forcing 的框架。我们的方法由两个惊讶度驱动的组件组成。第一个是惊讶度门控记忆库(Surprise-Gated Memory Bank),它根据与惊讶度相关的信号调节记忆条目的写入和驱逐。第二个是惊讶度感知去噪(Surprise-Aware Denoising),它利用块内惊讶度预测器(Intra-Chunk Surprise Predictor)来估计当前块的去噪过程是否可以加速。
Z ∂Gθ(z) ∇θLDMD ≈−Et,z sT Φ(Gθ(z), t), t −sSθ Φ(Gθ(z), t), t dz . (3) ∂θ
由于教师模型仅覆盖较短的时间范围,训练样本从更长的自滚动(self-rollout)中截取窗口。对于包含 N 个块的滚动序列,均匀采样一个长度为 K 的连续窗口 Wi := xi:i+K−1,并在评估前重新去噪
LextDMD = Et Ei∼Unif{1,…,N−K+1} KL pSθ,t(Wi) ∥pTt (Wi) . (4)
3.2 概述
图 2 总结了这两个控制器。记忆路径在帧离开本地缓存时观察它们,判断它们是否包含记忆库中尚未表示的信息,并管理一组有上限的已接受条目。在注意力机制计算时,它结合记忆库条目和仍然有效的远端局部帧,仅选择与当前查询匹配的那些。去噪路径观察部分去噪的当前块,估计其相对难度,并选择保留或缩短剩余的调度步数。两条路径都是因果的,且不需要参数更新。
3.3 惊讶度门控记忆库
时间顺序缓存对所有历史一视同仁,直到发生驱逐。外部记忆库则询问:一个离开的帧是否扩展了对过去的表示。静态重复通常应被拒绝;而新的姿态、视角、物体配置或场景转换则更有可能被保留。
帧描述符。对于被驱逐的帧,我们总结其空间值令牌(Value Tokens)并对结果进行归一化:
4
第 5 页
L 1 ¯v ¯v = X Vl ∈RD, d = . (5) L ∥¯v∥2 l=1
在此设定下,Value Tokens 优于 Key Tokens 用于内容比较。Key 针对查询相关的判别性进行优化,并与位置编码交互,这可能导致相似度对注意力路由而非视觉内容敏感。Value 携带通过注意力输出传播的信息,并且在经验上提供了更稳定的内容描述符。
双分量惊讶度。单一的记忆库相似度是不够的。平均相似度可能掩盖与已存储帧之一的近重复,而最近邻相似度可能会忽略候选者是否已作为整体被记忆库分布所覆盖。使用记忆库描述符 $\{d_i\}_{i=1}^M$,我们因此使用全局偏差项 $s_{pred} = \frac{1}{2}(1 – \frac{1}{M} \sum_i \cos(d, d_i))$ 和局部新颖性项 $s_{nov} = \frac{1}{2}(1 – \max_i \cos(d, d_i))$。它们的混合为
s = \alpha \cdot s_{pred} + (1 -\alpha) \cdot s_{nov} (6)
Budget-Norm Gating。原始惊讶度在视频之间甚至同一视频的不同阶段之间未经校准。静态片段可能在狭窄的低范围内产生分数,而动作片段会将整个分布向上移动。因此,固定的原始阈值或固定的归一化阈值会导致不稳定的记忆库利用率。Budget-Norm Gating 将相对异常性与所需的写入频率分离开来。
对于每个记忆库,我们维护指数加权在线统计量。使用时序索引符号,
\mu_{t+1} = m\mu_t + (1 -m)s_t, (7)
\sigma^2_{t+1} = m\sigma^2_t + (1 -m)(s_t -\mu_{t+1})^2, (8)
并将当前分数归一化为 s_t -\mu_t q z_t = , \sigma_t = \sigma^2_t . (9) \sigma_t 统计量针对每个被评估的帧进行更新,而不仅仅是被接受的帧,因此它们跟踪未审查的局部分数分布。
准入条件为 $p_{ast} = 1[z_t \ge \tau_t]$。阈值遵循反馈规则
\tau_{t+1} = \text{clamp}(\tau_t + \eta(p_{ast} -r), -3, 3) , (10)
其中 $r$ 是目标准入比率。忽略 clamp 操作,预期的阈值漂移为 $\eta(\Pr[p_{ast} = 1] -r)$;因此平稳条件是接受概率为 $r$。控制器在过度写入后提高门槛,在准入过于稀疏时降低门槛,使预算对内容而非分数规模具有响应性。
在冷启动期间,前几次评估会绕过门控,以便填充记忆库和运行统计量。在我们的实验中,初始控制器状态为 $\tau_0 = 0.002$;当记忆库填充不足时,活动阈值由该值限制,以防止过早的饥饿。钳位到 $[-3, 3]$ 避免了会接受或拒绝几乎所有内容的饱和状态。目标 $r$ 描述的是惊讶门控本身:最终提交率可能较低,因为近重复过滤和相邻块节流可能会在候选者通过控制器后将其拒绝。
3.3.1 基于优先级的驱逐。
当记忆库达到容量时,替换不应仅由年龄决定。一个旧的建立视图可能仍会被反复检索,而当前低相关性的帧可能是早期状态的唯一剩余代表。相反,最近的条目可能与活动的滑动窗口冗余。我们使用写入时的惊讶度、累积的检索使用量和年龄对每个槽位进行评分:
p_i = w_s \cdot s_i + w_u \cdot u_i -w_a \cdot a_i (11)
5
第 6 页
…… … 选定的帧 在 相似度 驱逐 ℎ−2 在 惊讶度 最旧的 使用量 年龄ℎ−1 当前 驱逐 驱逐 𝑠𝑠𝑖𝑖 记忆库 文本特征 u0, 𝑎𝑎0 u1, 𝑎𝑎1 u2, 𝑎𝑎2 u𝑖𝑖, 𝑎𝑎𝑖𝑖 最不相似 最小 在 h (a) 先进先出 (FIFO) (b) 贪婪最小相关性驱逐 𝑝𝑝𝑖𝑖= 𝑓𝑓(𝑠𝑠𝑖𝑖, u𝑖𝑖,(c)𝑎𝑎𝑖𝑖)基于优先级的驱逐 (本文方法)
图 3 历史上下文驱逐策略的比较。与仅依赖时间顺序或当前相关性作为驱逐标准的先前方法不同,我们的方法为记忆驱逐提供了更严谨的机制。
(a) PLCC (皮尔逊线性相关系数) (b) SRCC (斯皮尔曼等级相关系数) 4000 PLCC = 0.695 误差 SRCC = 0.730 3500 0.4误差 3000
2500 0.3 去噪 2000去噪 0.2 1500
1000 残差 0.1 的 500残差 0 0.0 等级 0.0 0.1 0.2 0.3 0.4 0 1000 2000 3000 4000 块内惊讶度得分 块内惊讶度得分的等级
图 4 块内惊讶度得分与每个块的第一次和最后一次去噪步骤之间的均方误差 (MSE) 之间的统计相关性。如图 (a) 和 (b) 所示,这两个变量表现出明显的正相关关系,从两个图表中强烈的上升趋势可以直观地看出这一点。
所有三个信号都归一化到 [0, 1]。待处理的帧获得相同的得分,并且仅当其优先级更大时才替换最小优先级的条目。使用量项保护那些在操作上仍然有用的条目,而年龄惩罚防止记忆库被早期帧永久占用。
3.3.2 动态帧路由。
选择性写入并不意味着每个存储的帧都应参与每次注意力操作。关注完整的记忆库会增加成本并稀释近局部信号。因此,对于每个块,我们从有效的记忆库条目和滚动缓存中保留但在近局部邻域之外的远局部帧中形成一个候选池。当前生成查询的描述符 $d_q$ 通过 $\cos(d_q, d_{candi})$ 对候选项 $i$ 进行评分。前 $k$ 个候选项与 sink 和近局部帧一起被路由。这在保持全局注意力预算固定的同时,保留了广泛的时间覆盖范围。
3.4 惊讶度感知去噪
四步蒸馏采样器为每个块执行四次变换器传递,即使输出在第一次传递后已经接近其最终状态。我们寻求一个早期可用的信号,不需要辅助预测器,并且在内容变化时仍然有意义。
块内惊讶度预测器。在第一次去噪传递之后,部分去噪的潜在变量 $\hat{y}^{(0)} \in \mathbb{R}^{B \times T \times C \times H \times W}$ 揭示了当前块内的时间变化。我们计算相邻帧的余弦距离并
6
第 7 页
保留最大的转移量:
$$ c_t = 1 – \cos(\vec{y}^{(0)}_t, \vec{y}^{(0)}_{t+1}), \quad t = 1, \dots, T-1 \quad (12) $$
$$ d_{\text{intra}} = \max_t c_t \quad (13) $$
使用最大值是因为,即使其他帧对几乎静止,单个突然的转移也能决定剩余精炼的程度。余弦距离消除了对全局潜在幅度变化的敏感性。在 50 个 MovieGen 提示词的一分钟生成中,该分数与第一次和最终去噪输出之间的残差误差的 PLCC 为 0.695,SRCC 为 0.730,如图 4 所示。该信号是自引用的:它仅取决于当前块的第一步输出,因此避免了对单独学习的校准模型的依赖。
自适应步长调度。难度是相对于最近的块来判断的,而不是通过固定的全局阈值。我们对滑动窗口内的 $d_{\text{intra}}$ 进行排名,并使用
$$ \text{steps} = \begin{cases} \{0, 3\} & \text{如果 rank} < r_{\text{skip}} \text{ (跳过中间步骤)} \\ \{0, 1, 2, 3\} & \text{否则 (完整调度)} \end{cases} \quad (14) $$
其中 $r_{\text{skip}}$ 控制有资格采用简化调度的相对简单块的比例。在实现中,每个块包含 $T=3$ 帧,排名窗口包含 20 个最近的块,且前五个块始终使用所有四个步骤。因此,调度器首先建立局部参考分布,然后适应当前视频的运动模式。
4 实验
4.1 实验设置
基模型与生成协议。我们在 LongLive [36] 上实现 Surprise Forcing,这是一个由 Self Forcing DMD 管道训练的 Wan2.1-T2V-1.3B [30] 流式生成器。该模型产生基于滚动缓存条件生成的短因果块。除非另有说明,短视频评估使用 5 秒输出,长视频评估使用 832 × 480 分辨率的 60 秒输出。
内存配置。长视频的银行容量为 $C=6$,短视频的银行容量为 $C=3$。我们使用 $\alpha = 0.7$,EMA 动量 $m = 0.95$,控制器步长 $\eta = 0.1$,目标准入率 $r = 0.3$,以及 $\tau_0 = 0.002$。优先级权重为 $\{w_s, w_u, w_a\} = \{1.8, 1.0, 0.4\}$,路由选择 $k=3$ 个候选者。前三个块在内存预热期间被接纳;随后它们的存储惊讶值被重置为当前的 EMA 均值,以便初始种群不会获得人为的优先级优势。
去噪配置。完整调度为 $\{0, 1, 2, 3\}$,简化调度为 $\{0, 3\}$。我们的默认值为 $r_{\text{skip}} = 0.4$。百分位窗口和预热遵循第 3.4 节中描述的设置。
指标。我们使用 VBench [9] 和 VBench-Long [10] 的官方提示词和指标。我们报告 VBench 总分、VBench-Long 质量分数、代表性的语义和视觉维度,以及每秒帧数的吞吐量。长程一致性使用 VBench-2.0 [45] 进行评估。需要更大规模长视频集的组件研究使用 128 个随机采样的 MovieGen [22] 提示词。
4.2 与流式替代方案的比较
我们将 CausVid [41]、Self Forcing [8]、Rolling Forcing [19] 和 LongLive [36] 进行比较。这些方法共享高效因果生成的广泛目标,但在蒸馏、 rollout、调度和上下文处理方面存在差异。
第 8 页
图 5 与其他方法的定性比较。我们的方法在长视频生成过程中保持了强大的主体一致性和平滑的运动连续性,同时引入了极小的视觉质量退化。
表 1 VBench(5s) [9] 短视频和 VBench-Long(60s) [10] 长视频的定量比较。在可比的推理速度下,我们的方法在所有指标上均达到了最先进(state-of-the-art)的性能,并且在生成更长视频时,速度提升变得更加显著。
VBench VBench-Long Model Sub. Mul. Sub. Total↑ FPS ↑ Quality↑ Aesthetic ↑ FPS ↑ Consistency ↑ Objects ↑ Consistency ↑
CausVid [41] 80.47 94.66 79.99 15.84 75.97 96.41 48.42 15.84 Self Forcing [8] 82.12 96.23 80.22 15.84 80.53 97.19 55.98 15.84 Rolling Forcing [19] 80.49 96.21 84.53 15.52 80.23 98.3 60.97 15.52 LongLive [36] 80.63 96.19 84.89 18.01 80.32 98.42 61.71 18.01 Surprise Forcing 83.40 96.28 87.50 16.45 81.88 98.51 63.98 17.18
定量结果。在 5 秒 VBench 生成中,Surprise Forcing 将最强基线的总分从 82.12 提升至 83.40,并将多对象(Multiple Objects)指标提升至 87.50。这一增益是在不改变已训练网络的情况下获得的。在 60 秒 VBench-Long 生成中,该方法在表 1 中达到了最佳的报告质量(Quality)、主体一致性(Subject Consistency)和美学(Aesthetic)分数,同时运行速度为 17.18 FPS。该结果支持了核心假设,即选择性全局历史可以在不牺牲流式操作的情况下提高长时域质量。
定性比较。图 5 中的一分钟示例揭示了不同模式的长时域退化。CausVid 会累积颜色和质量误差;Self Forcing 在超出其有效训练时域后会恶化;Rolling Forcing 提高了视觉稳定性,但允许主体在空间上漂移;而 LongLive 在保持整体质量的同时,主体细节随时间发生变化。Surprise Forcing 更好地保留了主体外观和运动连续性,因为历史上独特的状态在离开局部缓存后仍然可用。
8
第 9 页
表 5 不同跳过比例(skip ratios)的消融研究。
| | 总分 ↑ | 质量分 ↑ | 语义分 ↑ | 准确率 ↑ | | :— | :— | :— | :— | :— | | 跳过比例 | | | | | | $r_{skip} = 0.2$ | 83.36 | 83.85 | 81.40 | 8.7% | | $r_{skip} = 0.4$ | 83.20 | 83.70 | 81.21 | 15.8% | | $r_{skip} = 0.6$ | 82.15 | 82.46 | 80.93 | 21.6% | | $r_{skip} = 0$ | 84.03 | 84.55 | 81.95 | 0% |
4.3 针对性长程一致性
聚合基准分数可能会掩盖由遗忘引起的特定失败。因此,我们报告了四个 VBench-2.0 维度,这些维度旨在匹配记忆库的预期作用:人类身份(Human Identity)、人类衣着(Human Clothes)、实例保持(Instance Preservation)和多视角一致性(Multi-View Consistency)。
表 2 在选定 VBench-2.0 指标上的长程一致性结果。
| 指标 | CausVid | Self Forcing | Rolling Forcing | LongLive | Surprise Forcing | | :— | :— | :— | :— | :— | :— | | 人类身份 | 63.96 | 65.81 | 61.94 | 78.23 | 82.63 | | 人类衣着 | 93.33 | 93.84 | 93.24 | 95.27 | 96.67 | | 实例保持 | 71.93 | 77.19 | 77.19 | 79.53 | 83.63 | | 多视角一致性 | 23.80 | 24.10 | 18.87 | 24.53 | 29.76 |
该方法在所有四个维度上表现最强。与 LongLive 相比,最大的绝对提升出现在多视角一致性上,分数从 24.53 增加到 29.76。身份和实例保持的改善也超过四个点。这些测量结果通过直接测试早期视角和外观的信息是否仍可恢复,补充了主要基准测试。
4.4 核心控制器消融
表 3 至表 5 中的紧凑消融研究隔离了官方 30 秒 VBench-Long 提示集上的三个在线控制器。
表 3 固定门控与 Budget-Norm Gating 的消融研究。
| 方法 | 总分 ↑ | 质量分 ↑ | 语义分 ↑ | | :— | :— | :— | :— | | $z_{thres} = 0.1$ | 81.24 | 81.37 | 80.7 | | $z_{thres} = 2.0$ | 81.66 | 81.83 | 80.98 | | Budget-Norm | 83.20 | 83.70 | 81.21 |
表 4 FIFO 与基于优先级的驱逐的消融研究。
| 方法 | 总分 ↑ | 质量分 ↑ | 语义分 ↑ | | :— | :— | :— | :— | | FIFO | 82.92 | 83.44 | 80.84 | | Priority | 83.20 | 83.70 | 81.21 |
准入控制器。用固定的归一化阈值替换反馈控制会损害所有报告的分数。过于宽松的阈值会写入太多低价值帧,并使路由选择变得不具选择性;而过于保守的
第 10 页
阈值会导致记忆库利用不足。Budget-Norm Gating 通过将阈值的严格程度适应于观测到的数据流,避免了这两种极端情况。
替换策略。FIFO 仅因帧陈旧而将其丢弃。基于优先级的驱逐策略则保留那些具有惊讶性或被频繁检索的条目,从而产生更高的 Total、Quality 和 Semantic 分数。
步长分配。增加 $r_{skip}$ 会产生单调的加速-质量权衡。默认的 $r_{skip} = 0.4$ 在保持接近完整调度分数的同时,将去噪工作量减少了 15.8%。在 $r_{skip} = 0.6$ 时,加速率达到 21.6%,但质量下降变得更加明显。
4.5 惊讶分数分解
记忆分数结合了分布级别的偏差和最近邻的新颖性。我们在 128 个 MovieGen 一分钟生成样本上测试了单独使用每一项、默认的预测主导混合以及新颖性主导的交换混合。
表 6 不同惊讶分数设置的定量比较。此处,$S_{swap}$ 表示主文中 $S_{pred}$ 和 $S_{nov}$ 的混合权重互换的变体,旨在研究惊讶分数更强调 $S_{nov}$ 的情况。所有生成的视频长度均为 60 秒。
| Method | Subject Consistency | Background Consistency | Motion Smoothness | Dynamic Degree | Aesthetic Quality | Imaging Quality | | :— | :— | :— | :— | :— | :— | :— | | $S_{pred}$ | 97.12 | 95.94 | 98.39 | 55.75 | 61.67 | 68.30 | | $S_{nov}$ | 97.07 | 95.96 | 98.35 | 55.32 | 61.46 | 68.11 | | $S_{swap}$ | 97.13 | 96.02 | 98.37 | 56.28 | 61.96 | 68.47 | | Ours | 97.16 | 96.25 | 98.44 | 56.56 | 61.63 | 68.49 |
仅使用 $S_{pred}$ 略优于仅使用 $S_{nov}$,这表明相对于整个记忆库的偏差是更可靠的基础信号。然而,两种混合方法在多个维度上均优于单一项。因此,新颖性项作为对稀疏事件的校正很有用,因为均值聚合可能会稀释这些事件。我们保留 $0.7S_{pred} + 0.3S_{nov}$,因为它提供了最佳的整体平衡,而非优化单一指标。
4.6 记忆容量、路由与准入预算
记忆库大小。
表 7 记忆库大小的消融分析。
| Bank Size | Subject Cons. | Backgr. Cons. | Motion Smooth. | Dynamic Degree | Aesthetic Quality | Imaging Quality | GPU Mem. | FPS | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | $c = 3$ | 97.04 | 96.13 | 98.42 | 56.50 | 61.42 | 68.33 | 17.33 | 22.67 | | $c = 6$ | 97.16 | 96.25 | 98.44 | 56.56 | 61.63 | 68.49 | 17.18 | 23.48 | | $c = 9$ | 97.23 | 96.22 | 98.46 | 56.98 | 61.60 | 68.46 | 16.78 | 24.28 | | $c = 12$ | 97.28 | 96.29 | 98.47 | 54.79 | 61.75 | 68.63 | 16.70 | 25.08 |
将容量从 3 增加到 12 仅产生微小且不一致的质量变化,同时降低了 FPS 并增加了 GPU 显存。容量 $C = 6$ 位于该曲线的有利部分:它在保持长视频所需的时间多样性的同时,避免将外部记忆库转化为巨大的注意力负担。
路由策略。
10
第 11 页
表 8 动态路由方法的消融分析。
主体一致性 背景一致性 运动平滑度 动态程度 美学质量 成像质量 GPU 显存 路由方式 FPS k = 3 97.16 96.25 98.44 56.56 61.63 68.49 17.18 23.48 k = 6 97.24 96.29 98.57 54.42 61.48 68.01 16.14 24.26 近期选择 96.25 95.34 97.32 54.84 61.27 68.25 17.18 23.48 随机选择 96.23 95.16 97.49 54.73 61.44 68.28 17.18 23.48
选择六帧略微提升了部分一致性指标,但降低了动态程度、美学质量、成像质量和吞吐量。随机选择或仅基于近期性的选择明显劣于基于相似性的 top-3 路由。结果表明,记忆库的价值不仅在于存储历史,还在于将检索限制在与当前查询相关的上下文中。
目标准入比率。
表 9 目标写入比率的消融分析。
写入比率 主体一致性 背景一致性 运动平滑度 动态程度 美学质量 成像质量
r = 0.1 97.09 96.09 98.38 55.16 61.58 68.43 r = 0.3 97.16 96.25 98.44 56.56 61.63 68.49 r = 0.5 97.12 96.14 98.39 54.84 61.51 68.42 r = 0.7 97.09 96.09 98.37 54.74 61.59 68.39
最佳整体设置为 r = 0.3。在 r = 0.1 时,控制器准入的历史信息过少;在 r = 0.5 或 0.7 时,频繁的更替会在条目支持后续路由之前将其移除。本实验阐明,目标是一个稳定性与新鲜度的平衡操作点,而不仅仅是请求最大化写入。
4.7 替代驱逐与去噪预测器
贪婪最小相关性驱逐。
表 10 我们的驱逐方法与贪婪最小相关性驱逐 [11] 之间的定量比较。所有生成的视频长度均为 60 秒。
主体一致性 背景一致性 运动平滑度 动态程度 美学质量 成像质量 方法 贪婪最小相关性驱逐 97.14 96.07 98.36 55.00 61.64 68.37 基于优先级的驱逐 97.16 96.25 98.44 56.56 61.63 68.49
根据当前的文本检索需求进行驱逐是短视的:一个当前无用的条目在后续视角或叙事回归后可能变得重要。基于优先级的策略在一致性、运动和成像质量方面更强,因为它结合了历史惊讶度、实际使用情况和年龄,而非单一瞬时查询。
块难度代理。
表 11 不同块内预测器的相关性比较。
预测器 PLCC SRCC
首尾惊讶度得分 0.6641 0.7123 帧间最大惊讶度得分 0.6953 0.7298
11
第 12 页
0 分钟 1 分钟
允许 惊讶门控 无 驱逐 基于优先级 无
强制 惊讶
一幅充满活力的数字艺术作品,风格为奇幻冒险,描绘了一只巨大的、长满叶子的怪物正穿过繁忙的机场航站楼。这只完全由各种深浅绿色植物组成的怪物,拥有一张表情丰富的宽大面孔,长着两只好奇的大眼睛和一抹顽皮的笑容。它用肩膀扛着一个鲜绿色的手提箱,随着它的移动,叶子轻轻沙沙作响。背景展示了一个繁忙的机场景象,乘客们匆匆走过,头顶上的行李传送带正在运转。光线柔和且漫射,投下斑驳的阴影。怪物的姿态放松但警觉,步伐 playful。这是一个从略微 elevated 角度拍摄的中景镜头,捕捉到了怪物和充满活力的机场环境。
图 6 所提出的惊讶门控记忆库的定性分析。
首尾帧得分仅测量净端点变化,可能会错过三帧块中间的突然转换。最大相邻帧得分更好地跟踪残差去噪误差,提高了 PLCC 和 SRCC,因此在所有实验中使用。
4.8 定性组件分析
图 6 中的消融实验可视化了为何记忆准入和替换都很重要。在没有惊讶门控的情况下按时间顺序写入被驱逐的帧,会导致冗余或较弱的条目占据记忆库,随后主体身份和帧质量逐渐下降。用 FIFO 替换基于优先级的驱逐会导致颜色和植被结构等属性发生漂移,因为信息丰富的旧状态被过早移除。完整方法为后续块保持了更清晰的历史基础。
5 讨论与局限性
惊讶强制(Surprise Forcing)证明了可以从它们所调节的相同推理轨迹中提取有用的控制信号。记忆控制器使用相对新颖性而非特定模型的绝对得分,去噪控制器使用局部百分位排名而非全局校准的阈值。这种设计有助于框架在静态和动态片段之间适应,同时保持免训练特性。
仍存在若干局限性。首先,描述符是一个紧凑的平均池化摘要,可能无法区分具有相似全局内容但空间排列不同的情况。其次,优先级权重和目标比率在 rollout 期间是固定的;更高级的控制器可以根据任务或提示结构调整这些预算。第三,当前的评估集中在长达一分钟的片段上,并未建立显著更长或交互式轨迹上的行为。最后,步长跳过仅在两个调度之间是二元的。更丰富的控制器可以分配更广泛的求解器路径族,同时显式估计不确定性。
6 结论
我们提出了惊讶强制(Surprise Forcing),作为流式长视频扩散的统一分配机制。惊讶门控记忆库(Surprise-Gated Memory Bank)通过归一化惊讶度、反馈控制的准入、优先级替换和动态路由,保留了一小部分有用的被驱逐历史。惊讶感知去噪(Surprise-Aware Denoising)利用第一步的时间变化,为困难的块保留完整的细化过程。定性和定量证据表明,选择性记忆提高了长程一致性,而自适应调度通过可控的质量权衡恢复了计算能力。这些结果激励未来系统在生成过程中联合预算记忆、注意力和迭代细化。
12
第 13 页
参考文献
[1] S. Cai, C. Yang, L. Zhang, Y. Guo, J. Xiao, Z. Yang, Y. Xu, Z. Yang, A. Yuille, L. Guibas, 等人。用于长视频生成的上下文混合。arXiv 预印本 arXiv:2508.21058, 2025.
[2] B. Chen, D. Martí Monsó, Y. Du, M. Simchowitz, R. Tedrake, 和 V. Sitzmann。扩散强制:下一个令牌预测与全序列扩散的结合。神经信息处理系统进展, 37:24081–24125, 2024.
[3] G. Chen, D. Lin, J. Yang, C. Lin, J. Zhu, M. Fan, H. Zhang, S. Chen, Z. Chen, C. Ma, 等人。Skyreels-v2:无限长度电影生成模型。arXiv 预印本 arXiv:2504.13074, 2025.
[4] J. Cui, J. Wu, M. Li, T. Yang, X. Li, R. Wang, A. Bai, Y. Ban, 和 C.-J. Hsieh。Self-forcing++:迈向分钟级高质量视频生成。arXiv 预印本 arXiv:2510.02283, 2025.
[5] R. Henschel, L. Khachatryan, H. Poghosyan, D. Hayrapetyan, V. Tadevosyan, Z. Wang, S. Navasardyan, 和 H. Shi。Streamingt2v:来自文本的一致性、动态且可扩展的长视频生成。在计算机视觉与模式识别会议论文集 (CVPR) 中, 第 2568–2577 页, 2025.
[6] J. Ho, A. Jain, 和 P. Abbeel。去噪扩散概率模型。神经信息处理系统进展, 33:6840–6851, 2020.
[7] J. Huang, X. Hu, B. Han, S. Shi, Z. Tian, T. He, 和 L. Jiang。记忆强制:用于《我的世界》中一致场景生成的时空记忆。arXiv 预印本 arXiv:2510.03198, 2025.
[8] X. Huang, Z. Li, G. He, M. Zhou, 和 E. Shechtman。自强制:弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009, 2025.
[9] Z. Huang, Y. He, J. Yu, F. Zhang, C. Si, Y. Jiang, Y. Zhang, T. Wu, Q. Jin, N. Chanpaisit, 等人。Vbench:视频生成模型的全面基准套件。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中, 第 21807–21818 页, 2024.
[10] Z. Huang, F. Zhang, X. Xu, Y. He, J. Yu, Z. Dong, Q. Ma, N. Chanpaisit, C. Si, Y. Jiang, Y. Wang, X. Chen, Y.-C. Chen, L. Wang, D. Lin, Y. Qiao, 和 Z. Liu。VBench++:视频生成模型的全面且通用的基准套件。IEEE 模式分析与机器智能汇刊, 2025.
[11] S. Ji, X. Chen, S. Yang, X. Tao, P. Wan, 和 H. Zhao。Memflow:流动自适应记忆用于一致且高效的长视频叙事。arXiv 预印本 arXiv:2512.14699, 2025.
[12] J. Jiang, W. Li, J. Ren, Y. Qiu, R. Pei, F. Song, Y. Guo, X. Xu, H. Wu, 和 W. Zuo。Lovic:通过上下文压缩实现高效长视频生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中, 第 4022–4034 页, 2026.
[13] K. Kahatapitiya, H. Liu, S. He, D. Liu, M. Jia, C. Zhang, M. S. Ryoo, 和 T. Xie。用于加速扩散 Transformer 视频生成的自适应缓存。在 IEEE/CVF 国际计算机视觉会议论文集 (ICCV) 中, 第 15240–15252 页, 2025.
[14] J. Kim, J. Kang, J. Choi, 和 B. Han。Fifo-diffusion:无需训练从文本生成无限视频。神经信息处理系统进展, 37:89834–89868, 2024.
[15] A. Kodaira, T. Hou, J. Hou, M. Georgopoulos, F. Juefei-Xu, M. Tomizuka, 和 Y. Zhao。Streamdit:实时流式文本到视频生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中, 第 29200–29210 页, 2026.
[16] P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal, H. Küttler, M. Lewis, W.-t. Yih, T. Rocktäschel, 等人。用于知识密集型 NLP 任务的检索增强生成。神经信息处理系统进展, 33:9459–9474, 2020.
[17] R. Li, P. Torr, A. Vedaldi, 和 T. Jakab。Vmem:使用点云索引视图记忆进行一致交互式视频场景生成。在 IEEE/CVF 国际计算机视觉会议论文集 (ICCV) 中, 第 25690–25699 页, 2025.
13
第 14 页
[18] X. Li, M. Li, T. Cai, H. Xi, S. Yang, Y. Lin, L. Zhang, S. Yang, J. Hu, K. Peng, 等. 径向注意力:用于长视频生成的具有能量衰减的 O(n log n) 稀疏注意力。神经信息处理系统进展,38:16822–16852, 2026.
[19] K. Liu, W. Hu, J. Xu, Y. Shan, 和 S. Lu. 滚动强制:实时自回归长视频扩散。arXiv 预印本 arXiv:2509.25161, 2025.
[20] Y. Lu, Y. Liang, L. Zhu, 和 Y. Yang. Freelong:具有频谱混合时间注意力的免训练长视频生成。神经信息处理系统进展,37:131434–131455, 2024.
[21] Y. Lu 和 Y. Yang. Freelong++:通过多带频谱融合实现免训练长视频生成。arXiv 预印本 arXiv:2507.00162, 2025.
[22] A. Polyak, A. Zohar, A. Brown, A. Tjandra, A. Sinha, A. Lee, A. Vyas, B. Shi, C.-Y. Ma, C.-Y. Chuang, 等. Movie Gen:一组媒体基础模型。arXiv 预印本 arXiv:2410.13720, 2024.
[23] H. Qiu, S. Liu, Z. Zhou, Z. An, W. Ren, Z. Liu, J. Schult, S. He, S. Chen, Y. Cong, 等. Histream:通过消除冗余流式传输实现高效高分辨率视频生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 4603–4613 页,2026.
[24] H. Qiu, M. Xia, Y. Zhang, Y. He, X. Wang, Y. Shan, 和 Z. Liu. Freenoise:通过噪声重新调度实现免调优更长视频扩散。在国际学习表征会议,卷 2024,第 5260–5274 页,2024.
[25] D. Ruhe, J. Heek, T. Salimans, 和 E. Hoogeboom. 滚动扩散模型。arXiv 预印本 arXiv:2402.09470, 2024.
[26] J. Song, C. Meng, 和 S. Ermon. 去噪扩散隐式模型。arXiv 预印本 arXiv:2010.02502, 2020.
[27] K. Song, B. Chen, M. Simchowitz, Y. Du, R. Tedrake, 和 V. Sitzmann. 历史引导的视频扩散。arXiv 预印本 arXiv:2502.06764, 2025.
[28] S. Tan, B. Gong, Y. Feng, K. Zheng, D. Zheng, S. Shi, Y. Shen, J. Chen, 和 M. Yang. Mimir:改进视频扩散模型以实现精确文本理解。在计算机视觉与模式识别会议论文集,第 23978–23988 页,2025.
[29] H. Teng, H. Jia, L. Sun, L. Li, M. Li, M. Tang, S. Han, T. Zhang, W. Zhang, W. Luo, 等. Magi-1:大规模自回归视频生成。arXiv 预印本 arXiv:2505.13211, 2025.
[30] T. Wan, A. Wang, B. Ai, B. Wen, C. Mao, C.-W. Xie, D. Chen, F. Yu, H. Zhao, J. Yang, 等. Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025.
[31] B. Wu, C. Zou, C. Li, D. Huang, F. Yang, H. Tan, J. Peng, J. Wu, J. Xiong, J. Jiang, 等. Hunyuanvideo 1.5 技术报告。arXiv 预印本 arXiv:2511.18870, 2025.
[32] X. Wu, G. Zhang, Z. Xu, Y. Zhou, Q. Lu, 和 X. He. 打包并强制你的记忆:长格式且一致的视频生成。arXiv 预印本 arXiv:2510.01784, 2025.
[33] H. Xi, S. Yang, Y. Zhao, C. Xu, M. Li, X. Li, Y. Lin, H. Cai, J. Zhang, D. Li, 等. Sparse Videogen:通过时空稀疏性加速视频扩散 Transformer。arXiv 预印本 arXiv:2502.01776, 2025.
[34] G. Xiao, Y. Tian, B. Chen, S. Han, 和 M. Lewis. 具有注意力汇的高效流式语言模型。在国际学习表征会议,卷 2024,第 21875–21895 页,2024.
[35] Z. Xiao, Y. Lan, Y. Zhou, W. Ouyang, S. Yang, Y. Zeng, 和 X. Pan. Worldmem:具有记忆的长期一致世界模拟。神经信息处理系统进展,38:49632–49652, 2026.
[36] S. Yang, W. Huang, R. Chu, Y. Xiao, Y. Zhao, X. Wang, M. Li, E. Xie, Y. Chen, Y. Lu, 等. Longlive:实时交互式长视频生成。arXiv 预印本 arXiv:2509.22622, 2025.
14
第 15 页
[37] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng, 等人。 Cogvideox:具有专家变换器的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072, 2024。
[38] J. Yi, W. Jang, P. H. Cho, J. Nam, H. Yoon, 和 S. Kim。Deep forcing:利用深层汇合与参与式压缩的免训练长视频 生成。arXiv 预印本 arXiv:2512.05081,2025。
[39] T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 B. Freeman。改进的分布 匹配蒸馏以实现快速图像合成。神经信息处理系统进展, 37:47455–47487,2024。
[40] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park。具有分布匹配蒸馏的单步扩散。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 6613–6623 页,2024。
[41] T. Yin, Q. Zhang, R. Zhang, W. T. Freeman, F. Durand, E. Shechtman, 和 X. Huang。从缓慢的双向到快速的自回归视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22963–22974 页,2025。
[42] J. Yu, J. Bai, Y. Qin, Q. Liu, X. Wang, P. Wan, D. Zhang, 和 X. Liu。上下文即记忆:基于记忆检索的场景一致交互式长视频生成。在 SIGGRAPH Asia 2025 会议论文集,第 1–11 页,2025。
[43] L. Zhang, S. Cai, M. Li, G. Wetzstein, 和 M. Agrawala。下一帧预测视频扩散模型中的帧上下文打包与漂移预防。神经信息处理系统第 39 届年度会议,2025。
[44] L. Zhang, S. Cai, M. Li, C. Zeng, B. Lu, A. Rao, S. Han, G. Wetzstein, 和 M. Agrawala。自回归视频记忆压缩中的预训练帧保留。arXiv 预印本 arXiv:2512.23851,2025。
[45] D. Zheng, Z. Huang, H. Liu, K. Zou, Y. He, F. Zhang, Y. Zhang, J. He, W.-S. Zheng, Y. Qiao, 和 Z. Liu。VBench-2.0:推进视频生成基准套件以增强内在忠实度。arXiv 预印本 arXiv:2503.21755,2025。
15