快速导读:现有方法未能适应噪声水平,且训练与推理间存在分布失配,影响长视频生成质量。
流式视频生成旨在实时生成连续视频帧,但传统方法如 Rolling Forcing (RF) 面临高延迟和不稳定性问题。Ms. Forcing 提出一种新颖框架,通过适应噪声水平的多尺度处理,显著提升效率和一致性。
该方法核心在于 Multi-Scale Patchification (MSP) 和 Multi-Scale Self-Attention (MSSA),它们根据去噪窗口中各状态的噪声水平调整空间粒度。结合 Homogeneous-Noise-Level DMD (H-DMD),Ms. Forcing 解决了训练与推理间的分布失配,实现高效且稳定的长视频生成。
英文题目:Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention
论文出处:arXiv 每日论文精选 · arXiv:2607.20940
原始论文:PDF / 论文页面
对应视频标题:流式视频生成提速秘诀:Ms. Forcing 如何用多尺度注意力打破延迟瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
Rolling Forcing (RF) 通过在联合去噪窗口中处理连续帧来提高吞吐量和稳定性,但所有帧采用统一空间粒度,忽略了高噪声状态需要更粗糙处理的事实。这导致计算冗余和效率低下。
此外,RF 在分布匹配蒸馏 (DMD) 中组装不同噪声水平的假视频,造成训练与推理时的分布不匹配,影响长视频生成的稳定性。现有方法如 Self Forcing 和 SkyReels-V2 未能有效解决这些问题。
因此,需要一种能适应噪声水平、减少冗余计算并消除训练推理失配的新方法,以实现高效且稳定的流式视频生成。
核心创新
方法概览
现有方法未能适应噪声水平,且训练与推理间存在分布失配,影响长视频生成质量。
- Multi-Scale Patchification (MSP) 根据去噪窗口中各状态的噪声水平分配不同大小的图像块。高噪声状态使用更粗糙的块,减少 Token 数量,从而降低计算负担。
- Multi-Scale Self-Attention (MSSA) 匹配查询与键值对的空域密度。对于粗糙查询,MSSA 以步长 2 下采样其注意力可见的键值对,进一步减少注意力计算开销。
- Homogeneous-Noise-Level DMD (H-DMD) 从共享相同源噪声水平的干净预测中组装假视频。这消除了训练与推理间的分布差异,无需辅助 Self-Forcing 训练。
- 静态计算图确保调度由窗口位置固定,保证硬件友好执行,无需动态路由。这使得 Ms. Forcing 在保持灵活性的同时,实现高效推理。
逐图理解论文
直觉失败

传统 Rolling Forcing 对所有帧采用统一空间粒度,忽略高噪声状态需要更粗糙处理,导致计算冗余和不稳定。
核心贡献

图 3 概述 Ms. Forcing,MSP 映射噪声水平到静态块大小层级,MSSA 匹配查询层级密度。观察窗口滚动时状态从粗糙到精细的重新标记过程。
最强结论

表 1 比较短视频生成和累积消融,显示 H-DMD、MSP 和 MSSA 逐步添加的效果。注意最佳和次佳结果。
实验如何设计?
- 短视频生成(5秒)在 VBench 上评估,使用 946 个提示词,衡量总质量、质量和语义分数。
- 长视频生成(60秒)在 MovieGen 基准提示词上评估,关注主体/背景一致性、运动平滑度和质量漂移。
- 吞吐量在单 H200 GPU 上以 832×480 分辨率测量,单位为 FPS。
- 消融研究逐步将 H-DMD、MSP 和 MSSA 添加到 Rolling Forcing 基线,验证各组件贡献。
关键结果与论文证据
- Ms. Forcing 在 H200 上实现 22.84 FPS,比 Rolling Forcing 快 39.6%(第 8 页)。
- VBench 总分为 83.36,高于 Rolling Forcing 的 82.88(第 8 页)。
- VBench 语义分数为 81.13,优于 Rolling Forcing 的 79.88(第 8 页)。
- 60 秒质量漂移为 1.700,显著低于 Rolling Forcing 的 2.227(第 9 页)。
- 去噪窗口中 Token 数量减少 45%(第 5 页)。
- 注意力计算减少 12.9%(第 5 页)。
阅读时需要注意
- 实验仅限于 1.3B 参数 Wan2.1 骨干网络在 832×480 分辨率;未测试更大模型或更高分辨率的扩展性。
- 每一步滚动时的 KV-cache 更新开销带来显著延迟,部分抵消 DiT 计算增益。
关联工作
- Rolling Forcing (Liu et al., 2026) 是直接基线,Ms. Forcing 在其基础上提升效率和稳定性。
- Self Forcing (Huang et al., 2025) 使用嵌套采样,Ms. Forcing 避免辅助 Self-Forcing 训练。
- SkyReels-V2 (Chen et al., 2025) 和 CausVid (Yin et al., 2025) 是长视频生成和蒸馏因果模型的基线。
- DDiT (Kim et al., 2026) 涉及动态块调度,但依赖运行时重要性估计,而 Ms. Forcing 使用静态调度。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
MS. FORCING: 结合多尺度分块与注意力的高效流式视频生成
Zekun Li1∗ Xiaoyan Cong1∗ Hongyu Li1 Zhiyang Dou2 Chuan Guo3 Abhay Mittal3† Sizhe An3† Srinath Sridhar1‡ 1布朗大学 2麻省理工学院 3Meta
在画廊中游览,欣赏许多不同风格的精美艺术作品。
一朵干枯的彩虹玫瑰正在复苏。 2026 7月 实时运行速度达 22.8 FPS! 23 图 1:Ms. Forcing 是一个基于滚动扩散(rolling diffusion)构建的实时流式视频生成框架(22.8 FPS)。它结合了我们的新型多尺度分块(MSP)和多尺度自注意力(MSSA),将计算的空域粒度适配到滚动去噪窗口中每个状态的噪声水平,并采用同噪声水平分布匹配蒸馏(H-DMD),从而减少 DMD 训练序列与推理时 rollout 之间的不匹配。[cs.CV]
摘要
流式视频扩散模型在实现交互式动态世界模拟方面取得了显著进展,但传统逐帧生成方法中嵌套的自回归和去噪循环阻碍了实时部署。最近的滚动窗口方法通过在具有不同噪声水平的多个连续帧上流水线化去噪过程,提高了吞吐量并增强了长视域稳定性。然而,这些方法以相同的细粒度空间粒度对每个状态进行标记,导致联合去噪窗口中存在大量依赖于噪声的冗余。我们提出了 Ms. Forcing,一种高效的流式视频生成范式,其将空间粒度适配到每个状态的噪声水平。其多尺度分块(MSP)为噪声较大的状态分配更粗的分块,将活跃窗口中的 token 数量减少了 45%,而多尺度自注意力(MSSA)则使可见的非吸收键(keys)和值(values)的密度与每个查询(query)尺度相匹配,以进一步降低注意力计算成本。由于这两种调度均由窗口位置固定,Ms. Forcing 保持了静态且对硬件友好的计算图。我们进一步引入了同噪声水平分布匹配蒸馏(H-DMD),它通过组装共享相同源噪声水平的干净预测来构建每个虚假视频,从而减少 DMD 训练序列与推理时 rollout 之间的不匹配。多尺度设计有助于抵消通过重叠窗口进行反向传播所带来的额外训练成本。我们提供了定量和定性实验,表明 Ms. Forcing 在单个 H200 GPU 上达到 22.84 FPS 的帧率,比 Rolling Forcing 快 39.6%,同时在短视频和长视频生成设置中均显著提升了 VBench 评分。
- 同等贡献。 † 联合项目负责人。 ‡ 通讯作者。
1
第 2 页
1 引言
近期的大规模视频扩散模型 (Wan et al., 2025; HaCohen et al., 2026; Team et al., 2025) 能够生成具有复杂动态和高视觉质量的逼真视频。然而,通过迭代的双向去噪合成完整片段会导致高延迟,并阻碍按需输出。生成式世界模型 (Bruce et al., 2024; Gao et al., 2026) 和实时虚拟化身 (Sun et al., 2026; Huang et al., 2026) 等交互式应用则需要流式生成:帧必须以低延迟顺序发出,同时在长时间内保持连贯性。在不牺牲视觉保真度、运动质量或长程稳定性的情况下实现实时吞吐量,仍然是一个核心挑战。
近期方法通过将缓慢的双向扩散模型蒸馏为少步因果自回归生成器来实现流式生成 (Yin et al., 2025; Huang et al., 2025)。传统的因果采样器在每个新帧的外层自回归循环内嵌套一个内层去噪循环。每帧在生成下一帧之前被确定,因此误差会沿着自回归轨迹传播。此外,推理效率限制会限制历史上下文长度,并进一步加剧长程漂移 (Huang et al., 2025)。Liu et al. (2026) 引入了滚动强制 (Rolling Forcing, RF),它沿着时间轴通过一个包含 $T$ 个连续帧的联合窗口,以逐渐增加的噪声水平流水线式地处理 $T$ 个去噪步骤。每次传递将所有窗口状态推进一个噪声水平,并发出干净的头部帧。窗口内的双向注意力允许帧在发出之前相互细化,从而扩展去噪上下文并减少误差累积,同时保持因果输出。
RF 以较重的正向传递为代价替代了嵌套采样:尽管所有 $T$ 个活动状态具有不同的噪声水平,但它们都以骨干网络的原生分块大小进行标记。修剪或压缩历史键值对 (KVs) (Guo et al., 2026; Yang et al., 2026) 降低了过去上下文的成本,但并未解决这种混合噪声的活跃窗口问题。扩散去噪本质上是粗到细的,即高噪声状态恢复低频结构,而低噪声状态细化高频细节 (Kim et al., 2026; Jin et al., 2025)。在 RF 中,每个状态的噪声水平由其窗口位置预先固定,从而实现了无需输入依赖路由的静态多尺度调度。受第 3.2 节中联合去噪窗口冗余性的零样本探针启发,我们提出了多尺度分块 (Multi-Scale Patchification, MSP),它为噪声较大的状态分配更粗的分块,以及多尺度自注意力 (Multi-Scale Self-Attention, MSSA),它在保持全分辨率 sink 帧的同时,将可见非 sink 键值对的密度与每个查询的分块粒度相匹配。在我们的 5 步 RF 调度下,MSP 将去噪窗口中的标记减少了 45%,MSSA 进一步减少了 MSP 后点积注意力计算的 12.9%。两者均由窗口位置固定,从而产生静态计算图。
降低的训练成本也使得分布匹配蒸馏 (Distribution Matching Distillation, DMD; Yin et al., 2024a;b) 能够更忠实地构建。为了控制内存,RF 通过连接每个选定窗口中所有 $T$ 个预测的干净状态,从非重叠窗口构建其假视频。因此,相邻帧源自不同的 rollout 噪声水平,而推理则连接来自连续窗口的头部预测。这种异质性导致了 DMD 训练序列与推理时发出的 rollout 之间的不匹配。我们提出了同噪声水平分布匹配蒸馏 (Homogeneous-Noise-Level DMD, H-DMD) 用于联合去噪,它在每次更新时采样一个窗口位置,并从每个连续窗口收集其预测的干净状态。组装的假视频中的所有帧然后共享一个源噪声水平,从而在不改变 DMD 目标的情况下产生一致的时间边缘分布。尽管它需要穿过重叠窗口的梯度,但 MSP 和 MSSA 使其可行,并消除了对辅助自强制 (Self-Forcing) (Huang et al., 2025) rollout 更新的需求。
综上所述,这些设计构成了 Ms. Forcing。在 832×480 分辨率下,它在单个 H200 GPU 上达到 22.84 FPS(比 RF 快 39.6%),在 RF 的基础上将五秒 VBench 质量和语义分数分别提高了 0.29 和 1.25,并将 60 秒的质量漂移从 2.227 降低到 1.700,同时保持竞争性质量。我们的贡献如下:
- 我们引入了多尺度分块和多尺度自注意力,这是一种静态噪声匹配调度,将去噪窗口中的标记减少了 45%,并将 MSP 后的注意力计算进一步减少了 12.9%。
- 我们识别了由 RF 的异质性 DMD 组装引入的训练-推理不匹配,并提出了同噪声水平分布匹配蒸馏,它在不需要辅助自强制训练的情况下提高了蒸馏效果和生成质量。
2
第 3 页
2 相关工作
自回归视频扩散模型。大规模视频扩散模型(VDMs)(Wan et al., 2025; HaCohen et al., 2026; Team et al., 2025; Yang et al., 2025; Kong et al., 2024; Seedance et al., 2026; Cong et al., 2026; Du et al., 2026; Li et al., 2026)通常使用双向注意力合成整个片段,因此不适合低延迟流式传输。为了将这些缓慢的双向 VDM 转换为高效的流式生成器,最近的工作在几种框架下将自回归建模与迭代扩散去噪相结合(Chen et al., 2024)。大多数现有的流式视频生成器(Yin et al., 2025; Huang et al., 2025; Lu et al., 2026)采用嵌套采样过程:外层自回归循环按顺序生成帧,而内层扩散循环逐步去噪每个新帧。另一条互补的研究路线(Ruhe et al., 2024; Kim et al., 2024; Sun et al., 2025; Liu et al., 2026)沿时间轴流水线化去噪步骤,在滚动窗口内以逐渐增加噪声水平联合更新连续块,并在每次前向传播中输出一个干净块。为了缓解暴露偏差并提高生成质量,最近的方法进一步应用分布匹配蒸馏(DMD)到自生成的 rollout 上,从而更好地对齐训练与推理时的分布(Huang et al., 2025)。
高效视频扩散。除了通过蒸馏减少去噪步数外,互补的加速方法消除了冗余计算或降低了每次模型评估的成本。对于高效且有效的流式推理,滑动窗口注意力和持久 sink 帧在保留关键长程上下文的同时限制了历史上下文长度(Yang et al., 2026; Shin et al., 2026)。最近的方法进一步通过 KV 缓存 token 剪枝或压缩来降低历史成本(Guo et al., 2026; Chen et al., 2026; Yi et al., 2026)。其他加速策略重用相邻去噪步骤之间的中间特征(Liu et al., 2025b;a),执行分阶段的由粗到细生成(Jin et al., 2025; Ding et al., 2026; Zheng et al., 2026),或在去噪期间使用自适应 patch 调度(Kim et al., 2026)。其中大多数依赖于运行时重要性估计或自适应路由,这可能会引入依赖于输入且不规则的执行。更重要的是,联合去噪窗口内的加速(Ruhe et al., 2024; Liu et al., 2026)在很大程度上仍未被探索。我们利用窗口位置与噪声水平之间的确定性对应关系,预先分配噪声匹配的 patch 大小和历史感受野,从而产生静态、硬件友好的调度。
3 预备知识与动机
3.1 预备知识:自回归视频扩散模型
自回归视频扩散将 N 帧序列 $x_{1:N}$ 分解为遵循 $p(x_{1:N}) = \prod_{i=1}^N p(x_i | x_{<i})$,其中每个 $x_i$ 可以代表一个短帧块,为简单起见,称为“帧”。为了实现高效的流式计算,最近的工作(Lu et al., 2026; Yang et al., 2026)在因果注意力下将上下文 token 组织为 [ sink | recent | now ],并通过少步去噪生成每个新块(Yin et al., 2025; Huang et al., 2025; Yang et al., 2026)。给定一个 T 步扩散($t_1 \le \dots \le t_T$)模型 $p_\theta$,第 i 帧的生成可以表述为
$$ p(x_{i:t_0:T} | x_{<i}) = \prod_{j=1}^T p_\theta(x_{i:t_{j-1}} | x_{i:t_j}, x_{<i}), \quad x_{i:t_T} \sim \mathcal{N}(0, I). \quad (1) $$
虽然它们实现了连贯的顺序生成,但其严格的因果帧预测导致每帧继承其前驱帧的错误,使得微小的瑕疵在长视界中累积,最终导致明显的漂移和质量下降。为此,滚动强制(Rolling Forcing, RF)通过包含 T 个连续帧的联合滚动窗口,将每个生成帧的 T 个去噪步骤沿时间轴流水线化,这些帧被分配逐渐更高的噪声水平 $t_1 \le \dots \le t_T$。RF 不是在移动到下一帧之前完全去噪每帧,而是扩展去噪上下文长度,并允许帧在最终确定之前通过双向注意力相互细化,从而在保持因果流式传输的同时减少局部错误和长视界漂移。在每次滚动中,RF 在单次前向传播中通过一个噪声水平联合去噪窗口中的帧,从转移分布中采样:
$$ p_\theta(x_{i:i+T:t_0:T-1-1} | x_{i:i+T:t_1:T-1}, x_{<i}), \quad x_{i+T:t_{T-1}} \sim \mathcal{N}(0, I). \quad (2) $$
3
第 4 页
位置 $l$ 包含 $x_{i+l-1}^{t_l}$,按从 $t_1$ 处接近干净的头部到 $t_T$ 处接近噪声的尾部排序。每次通过后,RF 发出去噪后的头部帧,将剩余帧向 $t_0$ 推进,并在尾部追加一个新鲜噪声帧 $x_{i+T}^{t_T} \sim \mathcal{N}(0, I)$,从而允许窗口无限向前滚动。
3.2 联合去噪窗口中冗余性的零样本探测
扩散去噪过程由粗到细进行:高噪声水平的去噪主要建立全局结构,而低噪声步骤则细化局部细节。这一观察结果促使先前的扩散模型以较低的空间分辨率处理高噪声状态 (Kim et al., 2026; Jin et al., 2025)。与在每次去噪过程中在单一噪声水平下处理输入的常规去噪推理不同,RF 在双向去噪窗口内联合处理混合噪声水平的输入。然而,RF 以统一的空间粒度对联合去噪窗口中的所有帧进行分块。因此,我们测试是否可以根据噪声调度将此混合噪声去噪窗口表示为基于混合粒度的输入序列。为此,我们在零样本预训练 RF rollout 期间采用两种扰动,通过逐帧 LPIPS (Zhang et al., 2018) 探测分块和自注意力的混合粒度敏感性。
探测分块粒度。 直接在零样本中应用混合粒度分块是不可行的,因为每个新补丁大小都需要学习的补丁嵌入和解嵌入层。因此,我们在原始分块之后模拟粗粒度分块:在选定的噪声窗口位置,我们将空间令牌网格划分为不重叠的 $2 \times 2$ 块,并用其均值替换每个块中的所有四个令牌。在此代理下,LPIPS 相对于配对基线的偏差在超过 10 秒的 rollout 期间始终低于 0.26(图 2 中的蓝色曲线),这表明混合粒度分块层在联合去噪窗口内是可学习的。
探测注意力上下文粒度。 对于选定的噪声水平,我们通过根据分配给每个噪声水平的步长对可见的键和值进行空间下采样,来应用多尺度自注意力 (MSSA, 第 4.1 节)。这降低了高噪声查询的 KV 上下文的空间密度。LPIPS 在整个 rollout 期间保持在 0.15 以下(图 2 中的红色曲线),显示出在联合去噪窗口的 resulting 混合粒度自注意力下稳定的 rollout 行为。
4 方法论
4.1 多尺度分块与自注意力
在本节中,我们介绍基于 RF 联合去噪架构构建的多尺度分块 (MSP) 和多尺度自注意力 (MSSA)。如图 3 所示,MSP 在窗口内分配噪声匹配的混合粒度补丁设置,而 MSSA 将其注意力可见的键和值的空间密度匹配到该粒度。生成的尺度层级由共享的 DiT 与轻量级的层级特定模块联合处理,无需动态路由。
多尺度分块。 在正向 $k$ 的联合去噪窗口中,位置 $l$ 处的潜在帧 $x_{k+l-1}^{t_l}$ 在单调调度 $p_1 \le \cdots \le p_T$ 下被分配补丁大小 $p_l$,其中 $p_l \in \{p, 2p, 4p, \cdots \}$,如图 3 所示。每个补丁大小定义一个层级,包含完整的特定尺度处理模块,包括补丁嵌入和解嵌入层、LoRA 适配器和潜在残差分支。原始的 $p$ 层级直接重用预训练模型的原始路径,
4
第 5 页
清理后的历史 多尺度 DiT 模型 多尺度自注意力 (MSSA) 分块 (Patchification) 0 0 1 2 3 0 层级 (Tier) 48 59 106 117 层级 (Tier) @ 前向传播@k 12 13 14 15 @ 𝑡1 查询 (Query) @ 层级0 (Tier0) 嵌入 (Emb.) 0 1 去嵌入 (De-Emb.) 前向传播@k+1 𝑡2 分块 (Patch) 分块 (Patch) 𝑡0|2 𝑡0|1 查询2 @3层级1 (Tier1) 0 1 2 3 0 1 𝑡3 𝑡0|2 𝑡0|3 4 5 6 7 2 3 1 1 LoRA @ 8 9 10 11 = 08 102 19 113 124 146 135 157 嵌入 (Emb.) 层级 (Tier) 1 键 (Key) @ 层级1 (Tier1) 去嵌入 (De-Emb.) 层级 (Tier) 12 13 14 15 层级 (Tier) 𝑔4 𝑡0|4 𝑡0|3 @ MSSA @ @ 键 (Key) @ 层级0 (Tier0) 分块 (Patch) 层级 (Tier) 1 分块 (Patch) 联合 (Joint) 分块残差 (Patch Residual) 𝑡0|4 去噪 (Denoising) 去噪 (Denoising) @ 层级 1 (Tier 1) 模块 (Block) 包含 窗口 (Window) DMD 梯度 (Gradient)
图 3: Ms. Forcing 概述。多尺度分块 (MSP) 将联合去噪窗口中的混合噪声水平映射到静态分块大小层级,这些层级由共享的 DiT 模型处理,并辅以轻量级的层级特定模块。多尺度自注意力 (MSSA) 在不改变注意力掩码的情况下,使注意力可见的键和值的空间密度与每个查询层级相匹配。随着窗口滚动,每个状态从粗到细重新进行分词;在共享噪声水平下预测的干净状态形成用于 DMD 训练的同质序列。
参数,而每个较粗的层级拥有其各自独立参数化的模块;底层的 DiT 骨干网络在层级间保持共享。为了量化节省情况,我们将 RF 作为对比基准,RF 以原生分块大小对所有 T 个窗口状态进行分词,因此每个窗口使用 $N_{RF} = THW/p^2$ 个 token。对于空间尺寸为 $H \times W$ 的潜在帧,MSP 改为使用
T T 2 HW ≜N_{MSP} = 1 X p . (3) N_{lMSP} = , N_{MSP} = X N_{lMSP} , ρ_{tok} p^2l l=1 N_{RF} T l=1 p_l Here, ρ_{tok} is the fraction of tokens retained by MSP in the joint denoising window relative to RF. For the 5-step RF with (p, p, 2p, 2p, 2p) used in our experiments, ρ_{tok} = 0.55, corresponding to a 45% token reduction in the joint denoising window.
多尺度自注意力。受第 3.2 节中注意力上下文粒度探针的启发,MSSA 通过使每个可见的非汇聚键值 (KV) 上下文密度不超过查询表示,同时保持注意力汇聚 (attention-sink) KV 不变,从而消除剩余的注意力冗余(图 3)。经过 MSP 后,令 $C_{sink}$ 和 $C_b$ 分别表示来自注意力汇聚和非汇聚帧在位置 $b$ 的 KV 上下文,并令 $V(a)$ 为在原始注意力掩码下位置 $a$ 的查询可见的非汇聚帧位置。对于位置 $a$ 的查询 token,MSSA 构建的注意力 KV 上下文为
h p_a i C^{MSSA}_a = C_{sink} Concat Subsample C_b, stride = max 1, , (4) b∈V(a) p_b
为了量化相对于 MSP 的增量增益,定义归一化 token 分数 $\eta_l = (p/p_l)^2$ 和二维空间步长 $s_{ab} = \max(1, p_a/p_b)$。点积注意力计算产生的减少量为
" T T # r_{MSSA} = 1 − X η_a 1 + X η_b/s^2_{ab} . X η_a 1 + X η_b . (5) a=1 b∈V(a) a=1 b∈V(a)
对于具有一个汇聚帧、一个近期历史帧和五个联合去噪帧的 5 步 RF 布局,将 MSP 调度 $(p,p,2p,2p,2p)$ 代入公式 5,得到 $r_{MSSA} \approx 12.9\%$。
4.2 同质噪声水平组装分布匹配蒸馏
少步流式生成器通常使用分布匹配蒸馏 (DMD; Yin et al., 2024b;a) 在自生成的 rollout (Huang et al., 2025; Liu et al., 2026) 上进行训练,以最小化真实分布 $p_{real}(x)$ 和生成分布 $p_{fake}(x)$ 在时间步之间的反向 KL 散度
5
第 6 页
算法 1 具有同噪声水平分布匹配蒸馏(H-DMD)的滚动强制(Ms. Forcing)训练 需要:展开层级 $\{\tau_0, \tau_1, \dots, \tau_T\}$;块大小 $p_1 \le \dots \le p_T$;序列长度 $N$ 需要:生成器 $G_\theta$;假分网络 $s_\phi$;冻结的教师分数网络 $s^{\text{teacher}}$ 1: 循环 2: 初始化 $X_\theta \leftarrow [\,]$,$KV \leftarrow [\,]$,并预热前 $T-1$ 个滚动状态 3: 采样 $j \sim \text{Uniform}\{1, \dots, T\}$ $\triangleright$ 共享展开层级 4: 对于 $i = 1, \dots, N$ 执行 5: 附加 $x_{i+T\tau_{T-1}} \sim \mathcal{N}(0, I)$ 以构成 $x_{i:i+T\tau_{1:T-1}}$ 6: $\hat{W}^{(i)}_0 \leftarrow G_\theta(x_{i:i+T\tau_{1:T-1}}, \tau_{1:T}, KV)$ $\triangleright$ 多尺度分块(MSP)和多尺度自注意力(MSSA) 7: $X_\theta.\text{append } \pi_j(\hat{W}^{(i)}_0)$ $\triangleright$ 公式 8 8: 使用 $\text{sg}[\pi_1(\hat{W}^{(i)}_0)]$ 更新 $KV$ 9: $x_{i+1:i+T\tau_{1:T-1}-1} \leftarrow \Psi(\text{sg}[\pi_{2:T}(\hat{W}^{(i)}_0)], \tau_{1:T-1})$ 10: 结束循环 11: 在 $\text{sg}[X_\theta]$ 上使用扩散去噪损失更新 $\phi$ 12: 如果是生成器更新步骤则
13: 采样 DMD 时间步 $t$ 和噪声 $\epsilon$;设置 $X_t = \alpha_t X_\theta + \sigma_t \epsilon$ 14: 冻结 $s_\phi$ 并在 $X_t$ 上使用公式 6 更新 $\theta$ 15: end if 16: end loop
同时减少自回归中的训练-推理差距: $\nabla_\theta L_{\text{DMD}} \triangleq \mathbb{E}_t(\nabla_\theta D_{\text{KL}}(p_{\text{fake},t}(x_t) || p_{\text{real},t}(x_t)))$ $Z$ (6) $\approx -\mathbb{E}_t \int (s_{\text{real}}(\Psi(G_\theta(\epsilon), t), t) – s_{\text{fake}}(\Psi(G_\theta(\epsilon), t), t)) \frac{d G_\theta(\epsilon)}{d\theta} d\epsilon$ , $d\theta$ 其中 $\epsilon \sim \mathcal{N}(0, I)$,$\Psi$ 表示在时间步 $t$ 的前向扩散。在扩散模型中,得分函数定义为:$s_{\text{real}}(x_t, t) = \nabla_{x_t} \log p_{\text{real},t}(x_t) = -\frac{x_t – \alpha_t \mu_{\text{real}}(x_t,t)}{\sigma_t^2}$,其中 $\mu_{\text{real}}$ 是去噪估计值,$\alpha_t, \sigma_t$ 是噪声调度参数 (Ho et al., 2020; Nichol & Dhariwal, 2021; Karras et al., 2022)。DMD 冻结预训练的 $\mu_{\text{real}}$(教师模型)并更新生成器输出上的 $\mu_{\text{fake}}$。
滚动强制(Rolling Forcing, RF)采样一组非重叠窗口的子集,以构建用于分布匹配蒸馏(DMD)训练的目标干净视频。在此过程中,梯度计算仅在这些选定的窗口上进行,从而在保留有效监督信号的同时显著降低了内存占用。
$$ \hat{x}_{1:N_0, \text{RF}} = \underset{1 \le i \le N}{\text{Concat}} \ G_\theta(x_{i:i+T}, t_{1:T-1}, x_{<i_0}), \quad r \sim \text{Uniform}\{0, \dots, T-1\}, \quad i \equiv r \ (\text{mod } T). \quad (7) $$
然而,公式 (7) 将来自不同展开噪声水平 $t_{1:T}$ 的干净预测进行拼接,生成了一个具有依赖于噪声水平的边缘时间分布的异质虚假序列。滚动强制(RF)通过交替使用自强制(Self-Forcing)和滚动强制(Rolling-Forcing)更新来缓解这一问题,但后者仍然使 DMD 暴露于清晰度和运动变化的影响之下,这可能导致不自然的视觉外观变化或相机运动。
相反,我们在每次迭代中提出同噪声水平分布匹配蒸馏(H-DMD),采样一个窗口位置 $j$,并从每个连续的滚动窗口中收集对应的干净预测:
$$ \hat{x}_{1:N_0, \text{Our}} = \underset{i=1}{\overset{N}{\text{Concat}}} \ \pi_j G_\theta(x_{i:i+T}, t_{1:T-1}, x_{<i_0}), \quad j \sim \text{Uniform}\{1, \dots, T\}. \quad (8) $$
这里 $\pi_j$ 选择每个窗口中与噪声水平 $t_j$ 相关联的干净预测。因此,每个组装的干净预测视频在其源噪声水平上是同质的。通过减少 token 和注意力计算,多尺度分块(MSP)和多尺度自注意力(MSSA)使得尽管通过所有重叠的联合去噪窗口反向传播 DMD 梯度,训练过程依然具有可行性。完整的训练流程总结在算法 1 中。
5 实验
5.1 实现细节
模型。我们使用 Wan2.1-T2V-1.3B (Wan et al., 2025) 作为基础模型来实现 Ms. Forcing,该模型生成帧率为 16 FPS、分辨率为 832×480 的视频。遵循自强制(Self Forcing)(Huang et al.,
6
第 7 页
2025) 以及滚动强制 (Rolling Forcing, Liu et al., 2026),我们首先使用因果注意力掩码在从基础模型采样的 16k 个 ODE 解对上初始化基础模型。¹ 然后,我们使用来自因果强制 (Causal Forcing, Zhu et al., 2026) 的另外 6k 个 ODE 解对来预热 patch 嵌入、patch 解嵌入、patch 残差以及 LoRA,使用 AdamW 优化器,批量大小为 8,学习率为 $10^{-4}$,进行 800 步训练。我们将 $T$ 设置为 5,联合去噪窗口中的每个块包含 3 个潜在帧。在分布匹配蒸馏 (DMD) 阶段,模型以 64 的批量大小训练 1400 步,训练的时间窗口为 21 个潜在帧。我们使用 AdamW 优化器分别训练生成器 $G_\theta$(学习率 $1.5 \times 10^{-6}$)和假分数 $s_{gen}$(学习率 $4.0 \times 10^{-7}$)。生成器每 5 步更新一次,对应于假分数的更新步数。
t=0s t=30s t=60s t=90s t=120s
Rolling ForcingRolling (Ours)Forcing
Self Forcing
CausVid
SkyReels-V2
Ms. MAGI-1Forcing (Ours)
Rolling ForcingRolling (Ours)Forcing
Self Forcing
CausVid
SkyReels-V2
Ms. MAGI-1Forcing (Ours)
图 4:长时域生成的定性比较。每一行展示了从 30 秒片段中以递增时间采样的帧。与基线方法相比,Ms. Forcing 在后期帧中保持了清晰度、一致的色彩色调以及对提示的遵循,而其他方法则表现出曝光漂移和高频伪影。
评估。遵循奖励强制 (Reward Forcing, Lu et al., 2026),我们在相同的协议下评估短视频和长视频生成,但不包括其基于 VLM 的评分。对于短视频,我们使用相同的 946 个重写官方 VBench 提示生成 5 秒片段,每个提示使用五个随机种子,并报告标准的 VBench 总分、质量分和语义分 (Huang et al., 2024)。对于长视频,我们使用前 128 个 MovieGen 基准提示 (Polyak et al., 2024) 生成 60 秒视频,并评估主体一致性、背景一致性、运动平滑度、动态程度、美学质量和成像质量。各个指标是
¹ 我们使用 Self Forcing 提供的官方 ODE 初始化检查点。
7
第 8 页
使用标准 VBench 系数进行归一化和聚合。所有视频均以 16 FPS 的帧率和 832 × 480 的分辨率生成。遵循相同的协议,我们将长视频质量漂移量化为每个视频 30 个不重叠的 2 秒片段的成像质量分数的标准差,并在评估集上取平均值;较低的值表示更稳定的视觉质量。我们在单张 H200 GPU 上报告推理吞吐量(FPS)。
5.2 定性结果
图 4 将 Ms. Forcing 与基线方法在持续超过两分钟的长视界自回归生成任务上进行了比较。Ms. Forcing 即使在后续帧中也保持了高视觉质量和语义一致性,而具有稀疏长程上下文的方法则会出现曝光漂移和高频伪影。此外,Ms. Forcing 在比较的方法中实现了最快的推理速度,同时其训练成本远低于 Rolling Forcing。
5.3 定量比较与消融实验
我们将 Ms. Forcing 与规模相当的流式视频生成器进行比较。这些包括基于 Diffusion-Forcing 的 SkyReels-V2 (Chen et al., 2025; 2024) 以及蒸馏因果模型 CausVid (Yin et al., 2025)、Self Forcing (Huang et al., 2025)、LongLive (Yang et al., 2026) 和 Rolling Forcing (Liu et al., 2026)。Rolling Forcing 是我们的直接基线,而其他方法代表了因果蒸馏和长视界生成的互补策略。
表 1:短视频比较与累积消融。H-DMD、MSP 和 MSSA 被依次添加到 Rolling Forcing 中。最佳和次佳结果分别以粗体和下划线标示。 VBench 评估分数 ↑ 模型 参数量 FPS↑ 总分 质量 语义 SkyReels-V2 (Chen et al., 2025) 1.3B 0.43 82.67 84.70 74.53 CausVid (Yin et al., 2025) 1.3B 15.92 82.88 83.93 78.69 Self Forcing (Huang et al., 2025) 1.3B 15.92 83.80 84.59 80.64 LongLive (Yang et al., 2026) 1.3B 19.85 83.22 83.68 81.37
组件消融(累积) Rolling Forcing (Liu et al., 2026) 1.3B 16.35 82.88 83.63 79.88 + H-DMD 1.3B 16.35 83.10 83.57 81.22 + MSP 1.3B 21.93 83.89 84.61 81.01 + MSSA (Ms. Forcing) 1.3B 22.84 83.36 83.92 81.13
短视频质量与效率。表 1 报告了 5 秒短视频的 VBench 结果和累积组件消融实验。与基线方法相比,Ms. Forcing 速度最快,同时总分与最佳总分相差仅 0.44,语义得分与最佳语义得分相差仅 0.24。消融实验进一步分离了各个组件的贡献。H-DMD 保持吞吐量不变(16.35 FPS),但将语义得分和总分分别提高了 1.34 和 0.22,这表明同噪声水平提高了文本-视频对齐能力,且未增加推理成本。添加 MSP 和 MSSA 带来了显著的效率提升,将吞吐量提高了 39.6% 至 22.84 FPS,同时进一步改善了质量和语义得分。这些在效率和生成质量方面的同步提升表明,以相同的细粒度空间粒度统一处理不同噪声水平的状态,会在联合去噪窗口中引入冗余,这反过来可能会阻碍自回归生成。
长视频质量与漂移。表 2 评估了 60 秒的生成,其中误差累积变得更加明显。H-DMD 将 Rolling Forcing 的动态程度从 33.67 大幅提高到 51.80,表明在长视界 rollout 过程中具有更强的运动动态。然而,这种改进伴随着质量漂移的增加。通过 MSP 和 MSSA 从联合去噪窗口中移除冗余的细粒度计算,漂移逐渐降低至 2.582 和 1.700。这种稳定伴随着动态程度的逐渐下降,但完整的 Ms. Forcing 模型在实现显著更低的漂移的同时,仍然比 Rolling Forcing 具有明显更高的动态程度。总体而言,Ms. Forcing 在运动
第 9 页
表 2:长视频生成对比。H-DMD、MSP 和 MSSA 是依次添加到 Rolling Forcing 中的。最佳和次佳结果分别以粗体和下划线标示。
| | VBench Long Evaluation Scores ↑ | | | | | | | Model | Drift↓ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :— | :—: | | | Total | Subject | Background | Smoothness | Dynamic | Aesthetic | Imaging Quality | | | | Diffusion Forcing | | | | | | | | | | | SkyReels-V2 (Chen et al., 2025) | 75.94 | 96.43 | 96.59 | 98.91 | 39.86 | 50.76 | 58.65 | | 7.315 | | Distilled Causal | | | | | | | | | | | CausVid (Yin et al., 2025) | 77.78 | 97.92 | 96.62 | 98.47 | 27.55 | 58.39 | 67.77 | | 2.906 | | Self Forcing (Huang et al., 2025) | 79.34 | 97.10 | 96.03 | 98.48 | 54.94 | 54.40 | 67.61 | | 5.075 | | LongLive (Yang et al., 2026) | 79.53 | 97.96 | 96.50 | 98.79 | 35.54 | 57.81 | 69.91 | | 2.531 | | Component ablation (cumulative) | | | | | | | | | | | Rolling Forcing (Liu et al., 2026) | 79.38 | 97.78 | 96.41 | 98.73 | 33.67 | 60.06 | 70.66 | | 2.227 | | + H-DMD | 80.67 | 97.51 | 95.98 | 98.67 | 51.80 | 60.11 | 69.72 | | 3.041 | | + MSP | 79.95 | 97.50 | 96.07 | 98.56 | 48.78 | 59.06 | 68.60 | | 2.582 | | + MSSA (Ms. Forcing) | 79.66 | 97.90 | 96.58 | 98.70 | 41.85 | 58.89 | 69.04 | | 1.700 |
在保持其他指标具有竞争力的生成质量的同时,实现了动态性和长视域稳定性,并提供了比 Rolling Forcing 更快的流式推理速度。
6 结论
我们提出了 Ms. Forcing,这是一种高效的流式视频生成范式,它减少了滚动窗口去噪的固定粒度计算。利用窗口位置与噪声水平之间的确定性对应关系,Multi-Scale Patchification (MSP) 为噪声更大的状态分配更粗糙的图像块,并将联合去噪窗口中的 token 数量减少了 45%。Multi-Scale Self-Attention (MSSA) 通过将可见的非 sink KV 上下文的密度与每个查询的图像块粒度相匹配,同时保留全分辨率的注意力 sink,进一步减少了 MSP 之后的点积注意力计算量,降低了 12.9%。这两种调度方案均由窗口位置固定,因此保持静态且对硬件友好。我们还引入了 Homogeneous-Noise-Level DMD (H-DMD),它用具有共同源噪声水平的预测序列替换了 RF 中异构的假视频组装,从而在不辅助 Self-Forcing 训练的情况下,减少了与推理时展开的不匹配。在 832 × 480 分辨率下,Ms. Forcing 在单个 H200 GPU 上将吞吐量从 16.35 FPS 提高到 22.84 FPS,相比 RF 提升了 39.6%。它还使五秒 VBench 质量和语义分数分别提高了 0.29 和 1.25,并将 60 秒的质量漂移从 2.227 降低到 1.700,证明了在生成质量、长视域稳定性和效率之间取得了有利的平衡。
局限性与未来工作。 首先,我们目前的实验集中在 1.3B 参数的 Wan2.1 骨干网络上,分辨率为 832×480。将 Ms. Forcing 的训练和评估扩展到更大的模型和更高分辨率的视频是未来工作的自然方向。其次,在每个滚动步骤更新 KV 缓存(算法 1 中的第 7 行)对于维持自回归上下文是必要的,但其当前实现引入了显著的延迟。因此,缓存更新开销部分抵消了通过 MSP 和 MSSA 减少 DiT 计算所获得的加速效果。优化这一必需的更新可以使 DiT 计算的减少更充分地转化为端到端吞吐量的提升。
致谢
本研究得到了 NSF CAREER 奖 No. 2143576 以及 Meta Inc. 赞助研究资助的支持。
参考文献
Jake Bruce, Michael D Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, et al. Genie: Generative interactive environments. In Forty-first International Conference on Machine Learning, 2024.
9
第 10 页
Boyuan Chen, Diego Mart´ı Mons´o, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vincent Sitz- mann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. Advances in Neural Information Processing Systems, 37:24081–24125, 2024.
Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, 等人. Skyreels-v2: Infinite-length film generative model. arXiv preprint arXiv:2504.13074, 2025.
Jiayu Chen, Junbei Tang, Wenbiao Zhao, Maoliang Li, Jiayi Luo, Zihao Zheng, Jiawei Yang, Guojie Luo, 和 Xiang Chen. Pyramid forcing: Head-aware pyramid kv cache policy for high-quality long video generation. arXiv preprint arXiv:2605.13111, 2026.
Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, 和 Chongyang Ma. Viva: Vlm-guided instruction-based video editing with reward optimization. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 34364–34374, 2026.
Kaixin Ding, Xi Chen, Sihui Ji, Yuan Gao, Liang Hou, Xin Tao, 和 Hengshuang Zhao. Surf: Signature-retained fast video generation. In Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition, pp. 9171–9181, 2026.
Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, 和 Yue Wang. Videogpa: Distilling geometry priors for 3d- consistent video generation. arXiv preprint arXiv:2601.23286, 2026.
Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, 等人. Infinite worlds with versatile interactions. arXiv preprint arXiv:2607.07534, 2026.
Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, 和 Yan Lu. Efficient autoregressive video diffusion with dummy head. arXiv preprint arXiv:2601.20499, 2026.
Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, 等人. Ltx-2: Efficient joint audio-visual foundation model. arXiv preprint arXiv:2601.03233, 2026.
Jonathan Ho, Ajay Jain, 和 Pieter Abbeel. Denoising diffusion probabilistic models. Advances in neural information processing systems, 33:6840–6851, 2020.
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, 等人. Video = world+ event stream. arXiv preprint arXiv:2607.15038, 2026.
Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion. Advances in Neural Information Processing Systems, 38:167283–167308, 2025.
Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianx- ing Wu, Qingyang Jin, Nattapol Chanpaisit, 等人. Vbench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 21807–21818, 2024.
Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, 和 Zhouchen Lin. Pyramidal flow matching for efficient video generative modeling. In International Conference on Learning Representations, volume 2025, pp. 23378–23402, 2025.
Tero Karras, Miika Aittala, Timo Aila, 和 Samuli Laine. Elucidating the design space of diffusion- based generative models. Advances in neural information processing systems, 35:26565–26577, 2022.
Dahye Kim, Deepti Ghadiyaram, 和 Raghudeep Gadde. Ddit: Dynamic patch scheduling for efficient diffusion transformers. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 11459–11471, 2026.
10
第 11 页
Jihwan Kim, Junoh Kang, Jinyoung Choi, 和 Bohyung Han。 Fifo-diffusion: 无需训练即可从文本生成无限视频。在 Advances in Neural Information Processing Systems, 2024.
Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等人。 Hunyuanvideo: 大型视频生成模型的系统框架。 arXiv 预印本 arXiv:2412.03603, 2024.
Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, 和 Srinath Sridhar。 Genhsi: 可控生成人类-场景交互视频。 在 Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pp. 138–149, 2026.
Feng Liu, Shiwei Zhang, Xiaofeng Wang, Yujie Wei, Haonan Qiu, Yuzhong Zhao, Yingya Zhang, Qixiang Ye, 和 Fang Wan。 Timestep embedding tells: 是时候为视频扩散模型进行缓存了。 In Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 7353– 7363, 2025a.
Jiacheng Liu, Chang Zou, Yuanhuiyi Lyu, Junjie Chen, 和 Linfeng Zhang。 From reusing to fore- casting: 使用 taylorseers 加速扩散模型。 In Proceedings of the IEEE/CVF Inter- national Conference on Computer Vision, pp. 15853–15863, 2025b.
Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, 和 Shijian Lu。 Rolling forcing: 实时自回归长 视频扩散。 In The Fourteenth International Conference on Learning Represen- tations, 2026. URL https://openreview.net/forum?id=IAyzXjbfwo.
Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, 等人。 Reward forcing: 使用奖励分布匹配蒸馏进行高效的流式视频 生成。 In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 34385–34397, 2026.
Alexander Quinn Nichol 和 Prafulla Dhariwal。 Improved denoising diffusion probabilistic models. In International conference on machine learning, pp. 8162–8171. PMLR, 2021.
Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Ankit Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang, 等人。 Movie gen: 一组媒体基础 模型。 arXiv 预印本 arXiv:2410.13720, 2024.
David Ruhe, Jonathan Heek, Tim Salimans, 和 Emiel Hoogeboom。 Rolling diffusion models. In International Conference on Machine Learning, 2024.
Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng, 等人。 Seedance 2.0: 推进面向世界复杂性的视频生成。 arXiv 预印本 arXiv:2604.14148, 2026.
Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, 和 Xun Huang。 Motionstream: 具有交互式运动控制的实时视频生成。 In The Fourteenth International Conference on Learning Representations, 2026. URL https: //openreview.net/forum?id=v1DKz5Vxr7.
Mingzhen Sun, Weining Wang, Gen Li, Jiawei Liu, Jiahui Sun, Wanquan Feng, Shanshan Lao, SiYu Zhou, Qian He, 和 Jing Liu。 Ar-diffusion: 使用自回归扩散进行异步视频生成。 In Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 7364– 7373, 2025.
Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, 等人。 Streamavatar: 用于实时交互式人类数字人的流式扩散模型。 In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 10887–10897, 2026.
Meituan LongCat Team, Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, 等人。 Longcat-video technical report. arXiv 预印本 arXiv:2510.22200, 2025.
11
第 12 页
万团队,王昂,艾宝乐,文斌,毛超杰,谢晨玮,陈迪,余飞武, 赵海明,杨建晓,等。万:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。
杨帅,黄伟,楚瑞航,肖一程,赵宇扬,王先彪,李沐阳, 曾恩泽,陈颖聪,陆瑶,韩松,陈玉康。Longlive:实时交互式长视频生成。在第十四届国际学习表征会议,2026。URL https://openreview.net/forum?id=nCAODkpsPJ。
杨卓一,滕佳言,温迪·郑,明丁,黄诗雨,徐佳正,杨元明, 文一·洪,张孝涵,冯冠宇,等。Cogvideox:具有专家变换器的文本到视频扩散模型。在国际学习表征会议,卷 2025,页码 83048–83077,2025。
李正一,张宇硕,保罗·贤彬·曹,南智秀,尹熙智,金承龙。Deep forcing:具有深层汇合与参与式压缩的免训练长视频生成。在 国际机器学习会议,2026。
尹天伟,米歇尔·加布里,朴泰成,张理查德,埃利·谢赫特曼,弗雷多·杜兰德,和 威廉·T·弗里曼。改进的分布匹配蒸馏以实现快速图像合成。神经信息处理系统进展,37:47455–47487,2024a。
尹天伟,米歇尔·加布里,张理查德,埃利·谢赫特曼,弗雷多·杜兰德,威廉·T·弗里曼, 和朴泰成。一步扩散与分布匹配蒸馏。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 6613–6623,2024b。
尹天伟,张强,张理查德,威廉·T·弗里曼,弗雷多·杜兰德,埃利·谢赫特曼, 和黄迅。从缓慢的双向到快速的自回归视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 22963– 22974,2025。
理查德·张,菲利普·伊索拉,阿列克谢·A·埃夫罗斯,埃利·谢赫特曼,和奥利弗·王。深度特征作为感知度量的不合理有效性。在 IEEE 计算机视觉与模式识别会议论文集,页码 586–595,2018。
郑兴宇,刘祥龙,丁一夫,冯伟伦,林俊清,郭金阳,和秦浩通。多分辨率流匹配:通过分阶段采样实现免训练扩散加速。 arXiv 预印本 arXiv:2607.01642,2026。
朱宏洲,赵敏,何冠德,苏航,李崇轩,和朱军。因果强制: 正确完成自回归扩散蒸馏以实现高质量实时交互式视频生成。在 国际机器学习会议,2026。
12