Stream Forcing:用统一训练轨迹解决流式视频生成的训练-推理错位

快速导读:提出 Stream Forcing,将训练噪声级采样重构为帧索引随机过程,通过联合校准与时间相关采样构建从独立采样到推理一致采样的连续课程训练轨迹,以平衡训练覆盖与推理一致性。

流式视频生成要求模型在推理时以流线型方式逐步产生新帧,但训练阶段若完全对齐这种特殊去噪顺序,会牺牲训练分布的多样性;若完全忽略它,又会在推理时暴露严重的分布偏移。本文提出的 Stream Forcing 将这一矛盾形式化为一个可优化的轨迹设计问题,而不是简单地选择某一种采样策略。

核心思路是把训练时的噪声级采样看作一个帧索引随机过程:每一帧的噪声级服从 Logit-normal 分布,帧与帧之间的依赖关系由相关系数 ρ 刻画。独立采样(ρ=0)和渐进采样(ρ→1)只是这个连续谱系的两个端点,Stream Forcing 通过课程训练在这两个端点之间平滑过渡,从而在训练覆盖与推理一致性之间取得平衡。

英文题目:Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2608.10439

原始论文:PDF / 论文页面

这篇论文解决什么问题?

流式推理的核心特征是因果性:新帧的生成只能依赖已生成的帧,且去噪过程在滑动窗口内交错进行,以降低帧间延迟。这种流线型生成顺序与标准扩散训练中随机采样的噪声级配置存在系统性差异。

现有训练策略大致分为两类。Diffusion Forcing 采用独立采样,每一帧的噪声级独立同分布地采样,训练分布覆盖充分,但推理时的时间结构被破坏。Rolling Diffusion 等渐进采样方法强制帧间噪声级单调递增,更贴近推理时的流线型顺序,但训练分布被限制在一个狭窄的子空间内。

这两类方法实际上代表了训练覆盖与推理一致性之间的一个根本权衡:独立采样覆盖了完整的联合分布,但推理时模型需要面对训练中从未见过的噪声级组合;渐进采样保证了推理一致性,却牺牲了对多样化噪声级配置的泛化能力。

本文的关键观察是:这个权衡不是二元的。如果能把噪声级采样参数化为一个可控的随机过程,就可以在独立采样和渐进采样之间构造连续的过渡路径,让模型在训练过程中逐步适应推理时的分布结构。

核心创新

  • 将训练噪声级采样重构为帧索引随机过程,统一独立采样与渐进采样两种训练范式
  • 提出联合校准算法,通过模式插值与峰值密度匹配同时满足轨迹平滑和每帧覆盖一致性约束
  • 提出基于 Gaussian Copula 的时间相关采样算法,在不改变边际分布的前提下引入帧间相关性
  • 构建从独立训练到推理对齐训练的连续课程训练轨迹,平衡训练覆盖与推理一致性

方法概览

将训练噪声级采样重构为帧索引随机过程,以 Logit-normal 分布参数化每帧边际,用相关系数 ρ 刻画帧间依赖。以独立采样(ρ=0,帧不变参数)和渐进采样(帧依赖偏置,ρ→1)为端点,构建连续训练轨迹。提出联合校准算法(Joint Calibration)满足轨迹平滑与每帧覆盖一致性约束,提出基于 Gaussian Copula 的时间相关采样算法(Temporal Correlated Sampling)实现帧间相关性。训练分三阶段:独立训练、课程过渡、推理对齐训练。

  • 将训练噪声级采样重构为帧索引随机过程:每一帧的噪声级由 Logit-normal 分布参数化,帧间依赖由相关系数 ρ 控制。ρ=0 对应独立采样,ρ→1 对应渐进采样,中间值构成连续谱系。
  • 提出两条轨迹约束:约束一(Trajectory Transition Smoothness, TS)要求课程过渡过程中相邻阶段的采样分布平滑变化,避免训练目标突变;约束二(Per-frame Distribution Coverage Consistency, DCC)要求每一帧的边际分布在过渡过程中保持覆盖一致性,防止某些噪声级区域被遗忘。
  • 提出 Joint Calibration 联合校准算法:通过模式插值与峰值密度匹配,联合优化所有帧的 Logit-normal 参数,使整个课程轨迹同时满足轨迹平滑与每帧覆盖一致性约束。
  • 提出基于 Gaussian Copula 的 Temporal Correlated Sampling:利用 Gaussian Copula 解耦时间依赖结构与边际分布,在不改变每帧边际分布的前提下引入帧间相关性,实现从独立采样到推理对齐采样的平滑过渡。
  • 训练分为三个阶段:独立训练(Independent Training, IT)阶段使用 ρ=0 的独立采样,充分覆盖训练分布;课程过渡(Curriculum Transition, CT)阶段逐步增大 ρ,让模型适应帧间相关结构;推理对齐训练(Inference-Aligned Training, IAT)阶段使用接近推理时的采样配置进行微调。
  • 整个框架不改变模型架构,只改变训练时的噪声级采样策略,因此可以与现有的流式视频扩散模型直接结合。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 2. Illustration of trajectory constraints. Each subfigure shows marginals for a three-frame sampling process. (a) Neither Constraint 1 nor Constraint 2 is satisfied. (b) Only Constraint 1 is satisfied. (c) Only Constraint 2 is satisfied. (d) Both Constraints are satisfied.

该图用三帧采样过程的边际分布示意两条轨迹约束。子图(a)两条约束均不满足,(b)仅满足轨迹平滑,(c)仅满足覆盖一致性,(d)两条约束同时满足。观察(d)中边际分布如何在保持覆盖的同时平滑过渡,是理解 Joint Calibration 目标的关键。

核心区分与研究空白

核心区分与研究空白
Figure 3. Overview of the curriculum training. Our method builds a continuous curriculum transition between independent training and inference-aligned training that balances full distribution coverage with consistency at inference time.

该图展示课程训练的完整流程:从独立训练阶段经过课程过渡阶段到达推理对齐训练阶段。注意图中采样分布如何从完全独立逐步演变为具有帧间相关结构,这直观体现了 ρ 从 0 到 1 的连续过渡。

最强结论

最强结论
Table 2. 128-frame unconditional generation results on UCF- 101 [40] and Taichi-HD [37], evaluated on the full datasets at a resolution of 256 × 256.

最有力的证据来自长视频外推。在 128 帧零样本外推中,Stream Forcing 在 UCF-101 上把 FVD 从 Diffusion Forcing 的 447.3 降到了 322.5,降幅接近三成。这说明课程训练带来的推理一致性不是靠牺牲训练覆盖换来的,而是两者真正被统一到了一个框架里。

实验如何设计?

  • 在 UCF-101 和 Taichi-HD 两个视频数据集上进行 16 帧无条件生成实验,与 Diffusion Forcing、AR-Diffusion 等基线方法对比。
  • 在相同数据集上进行 128 帧零样本长视频外推实验,检验模型在远超训练时长条件下的鲁棒性。
  • 在 nuScenes 自动驾驶数据集上进行视频生成对比,验证方法在真实场景数据上的适用性。
  • 进行四组消融实验:轨迹约束消融(TS、DCC、IFC)、课程训练阶段消融(IT、CT、IAT)、时间相关系数调度消融、独立训练与课程过渡比例消融。
  • 在 UCF-101 上进行条件生成实验,验证方法在条件设定下的表现。

关键结果与论文证据

  • 在 UCF-101 16 帧无条件生成中,Stream Forcing 取得 FVD 177.0,显著优于 Diffusion Forcing 的 349.4(第 5 页 Table 1)。
  • 在 128 帧零样本外推中,UCF-101 上 FVD 从 Diffusion Forcing 的 447.3 降至 322.5,Taichi-HD 上从 340.2 降至 230.4,表明长视频外推鲁棒性显著提升(第 5 页 Table 2)。
  • 在 nuScenes 自动驾驶视频生成中取得 FID 9.4、FVD 105.0,验证了方法在真实场景数据上的有效性(第 6 页 Table 3)。
  • 轨迹约束消融显示,移除 DCC 导致 FVD 从 334.4 退化至 577.0,是最严重的退化,说明每帧覆盖一致性约束对性能至关重要(第 6 页 Table 4)。
  • 课程训练消融显示,仅独立训练 FVD 为 394.2,仅推理对齐训练为 359.4,完整课程训练为 334.4,证明课程过渡阶段的必要性(第 6 页 Table 5)。
  • 时间相关系数消融显示,ρ 线性调度取得最优 FVD 334.4,固定 ρ=0 为 466.1,固定 ρ=1 为 368.3,说明动态调度优于任何静态配置(第 6 页 Table 6)。
  • 独立训练与课程过渡比例消融显示,IT:CT 比例为 2:1 时取得最优 FVD 318.4(第 6 页 Table 7)。
  • 可视化对比显示,Stream Forcing 生成的视频在视觉质量和长时域外推鲁棒性上均优于 Diffusion Forcing 和 AR-Diffusion(第 7 页 Figure 4)。

阅读时需要注意

  • 实验仅在小到中等规模数据集上进行,未充分验证大规模训练下的行为。
  • 未系统研究与记忆压缩技术、闭环蒸馏方法等正交方向的结合潜力。
  • 未在预训练大模型基础上进行大规模扩展验证,实际部署效果有待进一步检验。

关联工作

  • Diffusion Forcing 是独立采样范式的代表方法,本文将其作为主要对比基线之一。
  • AR-Diffusion 采用渐进采样策略,代表了另一端的训练范式。
  • Rolling Diffusion Models 是渐进采样训练策略的早期工作,为本文的轨迹设计提供了问题背景。
  • Self Forcing 和 Rolling Forcing 使用知识蒸馏进行闭环一致训练,属于正交方向,作者指出未来可以结合。
  • FIFO-Diffusion 是流线型推理策略的代表方法,本文的推理设定与其一致。

发表评论