OPSD-V:自回归视频长程退化问题的策略内自蒸馏解决方案

三分钟导读:学生模型遵循推理时的确切 rollout,将自身生成的块写入KV缓存。教师模型在相同的去噪状态进行评估,但使用AR一致的真实视频缓存,其中旧历史被真实视频块替换,最近块保留学生生成。

英文题目:OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

论文出处:arXiv 每日论文精选 · arXiv:2607.08766

原始论文:PDF / 论文页面

对应视频标题:OPSD-V:自回归视频长程退化问题的策略内自蒸馏解决方案|推荐指数:★★★★★

这篇论文解决什么问题?

自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。现有方法依赖短片段教师进行监督,难以有效指导长自回归轨迹,导致长视频质量下降。

核心创新

方法概览

学生模型遵循推理时的确切 rollout,将自身生成的块写入KV缓存。教师模型在相同的去噪状态进行评估,但使用AR一致的真实视频缓存,其中旧历史被真实视频块替换,最近块保留学生生成。

逐图理解论文

OPSD-V方法概述

OPSD-V方法概述
Figure 3: OPSD-V post-trains a few-step autoregressive video generator with cache-aware on-policy self-distillation. The student follows the exact inference-time rollout and writes its own generated chunks into the KV cache. The teacher is evaluated at the same student-visited denoising states, but uses an AR-consistent real-video cache, where older history is replaced by real-video chunks while the most recent chunk remains student-generated.

OPSD-V提出一种缓存感知的策略内自蒸馏框架,利用真实长视频数据作为特权时间上下文,对少步自回归视频生成器进行后训练,显著降低长程误差累积并提升运动动态。

实验设置与数据集

实验设置与数据集
Table 1: Quantitative comparison on one-minute video generation. We generate 240 videos in total, including 120 prompts from MovieGenBench and 120 internal prompts from MeiBench, and evaluate all results with VBenchLong (Huang et al., 2025b). All methods are based on the same Wan2.1-T2V-1.3B backbone, use the same 4-step autoregressive inference path, and adopt the same attention-sink cache mechanism. Higher scores are better. OPSD-V improves Quality Score and Dynamic Degree on both LongLive and Self-Forcing without increasing inference cost.

实验在Self-Forcing和LongLive两个基模型上进行后训练,使用包含3800个一分钟视频的定制数据集。评估在MovieGenBench和MeiBench上进行,采用VBenchLong指标。

用户研究结果

用户研究结果
Figure 5: User study preference results. Ten participants compare 20 paired videos each, consisting of 10 LongLive pairs and 10 Self-Forcing pairs. Each pair contains a base-model video and its OPSD-V post-trained counterpart under the same prompt. For each pair, participants choose Model A, Model B, or Same for overall preference, motion quality, and visual quality. Each panel shows percentages over 100 judgments per criterion.

用户研究显示,66.0%的参与者偏好OPSD-V生成的视频(排除平局后为82.5%)。在运动质量和视觉质量方面,OPSD-V也获得了更高的偏好比例,分别为57.5%和60.5%。

速度匹配与干净潜变量匹配对比

速度匹配与干净潜变量匹配对比
Figure 6: Velocity versus clean-latent matching. We compare distillation in the predicted clean-latent (x0) space and in the native velocity space over a one-minute rollout. Both variants remain plausible at the beginning, but x0 matching progressively smooths fine structures and introduces geometric degradation in the bridge truss and foliage. Velocity matching better preserves these details at later timestamps. Red boxes highlight representative regions.

速度匹配在长 rollout 中更好地保留了细节,而干净潜变量匹配会导致结构平滑和几何退化。例如,在桥梁桁架和植被区域,速度匹配保持了更清晰的细节。

教师轨迹监督的失败案例

教师轨迹监督的失败案例
Figure 7: Failure of teacher-trajectory supervision. When distillation states are sampled from the teacher’s own denois- ing trajectory, the teacher rollout remains sharp and coherent (bottom), but the student becomes severely blurred under its own autoregressive rollout (top). This discrepancy reveals the off-policy state mismatch introduced by teacher-trajectory supervision.

当蒸馏状态从教师自身的去噪轨迹采样时,教师 rollout 保持清晰,但学生在自回归 rollout 中变得严重模糊。这揭示了教师轨迹监督引入的策略外状态不匹配问题。

实验与关键结果

  • 实验在Self-Forcing和LongLive两个基模型上进行后训练,使用包含3800个一分钟视频的定制数据集。评估在MovieGenBench和MeiBench上进行,采用VBenchLong指标。
  • OPSD-V显著提升了质量分数和动态程度。例如,LongLive+OPSD-V的质量分数为0.8242,高于基模型的0.8138;Self-Forcing+OPSD-V的质量分数为0.8389,高于基模型的0.8259。
  • 用户研究显示,66.0%的参与者偏好OPSD-V生成的视频(排除平局后为82.5%)。在运动质量和视觉质量方面,OPSD-V也获得了更高的偏好比例,分别为57.5%和60.5%。
  • 实验在Self-Forcing和LongLive两个基模型上进行后训练,使用包含3800个一分钟视频的定制数据集。评估在MovieGenBench和MeiBench上进行,采用VBenchLong指标。
  • OPSD-V显著提升了质量分数和动态程度。例如,LongLive+OPSD-V的质量分数为0.8242,高于基模型的0.8138;Self-Forcing+OPSD-V的质量分数为0.8389,高于基模型的0.8259。
  • 用户研究显示,66.0%的参与者偏好OPSD-V生成的视频(排除平局后为82.5%)。在运动质量和视觉质量方面,OPSD-V也获得了更高的偏好比例,分别为57.5%和60.5%。

阅读时需要注意

  • OPSD-V在语义匹配上略有下降,表明运动动态与语义匹配之间存在轻微权衡。此外,该方法依赖高质量长视频数据,性能可能受数据质量和多样性影响。
  • Direct teacher-forcing with real videos breaks inference-time rollout distribution and should be avoided.
  • Using teacher-trajectory supervision leads to off-policy state mismatch and severe blurring in student rollouts.
  • Clean-latent (x0) matching causes progressive smoothing and geometric degradation in long rollouts compared to velocity matching.

关联工作


展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

OPSD-V 用于后训练少步自回归视频生成器的策略内自蒸馏

Hongyu Liu1,2, Chun Wang1,2, Feng Gao1,†, Xuanhua He1,2, Yue Ma2, Ziyu Wan3, Yong Zhang1,‡, Xiaoming Wei1, Qifeng Chen2,† 1美团 2香港科技大学 3香港城市大学 †通讯作者 ‡项目负责人 hliudq@connect.ust.hk

我们提出了 OPSD-V,这是一种用于后训练少步自回归 (AR) 视频扩散模型的策略内自蒸馏范式。现有的少步 AR 视频生成器通常通过分布匹配蒸馏 (DMD) 风格的蒸馏获得,能够以低延迟生成长视频,但在长程自回归展开过程中仍存在误差累积和运动动力学减弱的问题。OPSD-V 旨在进一步减少长程退化并改善运动动力学,同时保持原始的少步推理路径。我们的核心思想是在训练过程中引入真实的长视频数据作为时间上下文,并利用其提供密集的轨迹级监督。与仅依赖短片段教师分布相比,真实的长视频为监督长程 AR 展开提供了更丰富且更干净的目标分布。具体而言,学生模型遵循确切的推理时间展开过程,根据之前生成的键值缓存 (KV Cache) 生成每个片段。并行地,教师模型在评估时其历史 KV 缓存可以被真实视频上下文替换。但为了保持自回归一致性并防止教师退化为完全强制教师 (teacher-forced) 的神谕,两个分支共享一个初始的真实视频前缀,且教师保留由其自身生成的最新缓存片段。这种设计在策略内 AR 缓存动力学下提供了密集的去噪级校正目标,而无需更改采样器、去噪步数或推理时的缓存机制。我们将 OPSD-V 应用于代表性的少步 AR 视频模型,包括 Self-Forcing 和 LongLive。实验表明,在视觉质量、运动动力学和 VBenchLong 分数上均有一致的提升。在包含 10 名参与者的用户研究中,对比 20 对视频,OPSD-V 在 66.0% 的整体偏好判断中优于基础模型(排除平局时为 82.5%),证明了结合真实长视频上下文的策略内自蒸馏在长程 AR 视频生成中的有效性。

项目页面:https://meigen-ai.github.io/OPSD-V 代码:MeiGen-AI/OPSD-V

1 引言

视频生成已从短片段离线合成迅速演变为能够生成高分辨率、文本对齐且时间连贯视频的大规模视频基础模型。现代视频生成模型主要基于扩散变换器 (DiTs) (Peebles & Xie, 2022),其可扩展性在视觉保真度、运动质量、提示遵循以及长视频生成方面取得了显著进展 (Yang et al., 2024; Kong et al., 2024; Wan Team, 2025; Meituan LongCat Team et al., 2025; HaCohen et al., 2026; Brooks et al., 2024)。尽管取得了这些进展,大多数大规模视频基础模型仍主要设计用于离线生成,即在整个视频采样完成后进行合成,而不是在用户交互过程中连续生成。

与离线视频生成不同,实时视频生成要求模型以低观看延迟顺序生成内容。这一需求自然倾向于自回归 (AR) 视频模型,其中每个新帧或片段都基于先前的输出进行生成,并复用变换器的 KV 缓存以高效维护历史上下文。为了使 AR 生成具有实用性,最近的方法将因果视频建模与少步蒸馏相结合,将缓慢的扩散或流模型压缩为高效的少步生成器 (Yin et al., 2024b;a; Wang et al., 2023)。基于这一方法,CausVid 将双向视频 DiT 蒸馏为因果 AR 学生模型以实现快速流式生成 (Yin et al., 2025),而 Self-Forcing 进一步通过对模型自身生成的帧和展开的 KV 缓存进行展开,使训练与推理保持一致 (Huang et al., 2025a)。总之,这些 AR 和少步生成技术是

第 2 页

图 1:OPSD-V 改善了长视距自回归视频生成。我们在相同的提示词和种子下比较了原始基础模型及其经过 OPSD-V 后训练的版本的性能。第一个示例基于 LongLive,第二个示例基于 Self-Forcing。在每个示例中,第一行显示基础模型的结果,而第二行显示应用 OPSD-V 后的结果。我们的方法产生了更具动态性且时间上更稳定的视频,同时减少了长视距误差的累积。对于 LongLive,OPSD-V 显著减少了草地区域和远处背景中的伪影。对于 Self-Forcing,OPSD-V 改善了角色头部的运动并抑制了背景伪影。

使得诸如流式头像 (Yang et al., 2025a; Team et al., 2026a; Wang et al., 2026)、交互式媒体 (Shin et al., 2025; ai et al., 2025)、类世界模型应用 (Ball et al., 2025; Team et al., 2026b) 以及具身智能 (Li et al., 2026b; Ye et al., 2026) 等应用成为可能,在这些应用中,模型必须在长视距内持续生成视频,同时保持稳定的身份、运动和场景结构。

尽管将自强制风格训练与 DMD 风格少步蒸馏相结合取得了成功,但现有的自回归视频生成器仍然遭受长视距退化的问题。一个根本性的限制在于,DMD 风格训练中使用的目标分布通常由双向短片段视频教师模型提供,这无法直接监督真正的长自回归轨迹。尽管最近的方法 Yang et al. (2025b); Cui et al. (2025); Zhang et al. (2026); Li et al. (2026a) 扩展了 rollout 长度并采用注意力汇聚机制 (attention-sink mechanisms) Xiao et al. (2023) 来减轻误差累积,但其监督仍然受限于底层片段级教师模型的能力和时序范围。此外,DMD 本身可能会引入动态性减弱和颜色漂移等副作用,且其监督通常定义在块或片段分布层面,而不是作为沿整个去噪轨迹的密集校正目标。

这一局限性指出了现有 DMD 风格后训练的一个固有上限:少步采样路径得以保留,但评分匹配信号 (score-matching signal) 仍然受限于有限短片段教师模型的时序范围和质量。这引发了关于后训练少步自回归视频生成器的一个核心问题:

真实长视频数据能否在保留原始少步自回归生成能力的同时,作为更强的训练监督信号?

我们的答案是:不使用真实长视频作为直接的教师强制目标,而是将其作为特权时序上下文,用于在学生模型自身的 rollout 状态上构建更纯净的教师分布。策略内自蒸馏 (On-Policy Self-Distillation, OPSD) 提供了一种

2

第 3 页

图 2:概述及动机性的缓存干预。上图:与在自生成(self-rollout)之后应用分布匹配蒸馏(DMD)监督的自强制(Self-Forcing)训练不同,OPSD-V 通过对齐以更干净的长视频上下文为条件的教师模型,继续训练现有的少步自回归(AR)生成器。学生模型将其自身生成的块写入键值缓存(KV Cache),而教师模型则在相同的去噪状态下,利用数据辅助的缓存进行评估。下图:在任何 OPSD-V 后训练之前,我们在测试时隔离缓存质量的影响,使用原始的 LongLive 模型。两行均使用来自源视频的真实第一个块进行初始化。第一行是标准的 LongLive 生成过程;在第二行中,较旧的 KV 缓存条目被替换为从相应真实视频块计算得出的条目,而最新的缓存块仍由模型生成。这种数据上下文干预已经提高了长时程稳定性,这激励了我们在训练中使用真实视频上下文来构建更干净的教师目标。

适合实现这一目标。最近在对自回归大型语言模型的研究中(Zhao et al., 2026; Shenfeld et al., 2026; Hübotter et al., 2026),策略内自蒸馏(OPSD)采用了一种策略内学习范式,其中模型从其当前策略中采样作为学生,而通过以更丰富的上下文信息为条件对同一模型进行条件化,获得更强的教师分布。这种表述自然地沿着模型自身的轨迹提供了密集的监督。在我们的 AR 视频设置中,真实长视频可以充当这种更丰富的上下文:通过对同一视频生成器以更干净的长视频状态为条件,教师模型可以为学生模型的生成轨迹提供更可靠的目标分布。一项密切相关的工作 D-OPSD(Jiang et al., 2026)证明了这种上下文增强型自蒸馏思想在文生图生成中的可行性,其中将真实图像与文本提示配对作为额外上下文,以获得更强的教师分布。受此范式启发,我们探索使用真实长视频作为可靠的时间上下文来构建更干净的教师分布,从而对学生模型的自回归生成状态提供密集的去噪级别监督。

在本文中,我们提出了 OPSD-V,这是一种用于少步 AR 视频扩散模型后训练的缓存感知策略内自蒸馏框架。如图 2 所示,OPSD-V 从现有的少步 AR 生成器开始,并以针对长自回归生成进行定制的监督继续训练。一个关键挑战是直接使用真实长视频并非易事:即使在相同的提示下,学生模型的生成轨迹也可能与真实视频不同,因此简单地使用真实视频块作为重建目标或教师上下文可能会引入语义和时间不匹配。因此,我们将真实视频视为特权时间上下文,而非直接输出目标。具体而言,学生模型保持完全策略内:它使用原始少步采样器对每个块进行去噪,将其自身生成的块写入键值缓存,并从由此产生的自诱导时间状态继续生成。教师模型在相同的时间位置、时间步长和学生访问过的噪声潜在变量处进行评估,但使用从真实

第 4 页

长视频上下文。两个分支共享相同的初始真实视频前缀以锚定场景;对于每个目标块,教师模型用对应的真实视频上下文替换较早生成的缓存历史,同时保留最近生成的块。这种设计在保持从学生当前状态进行的自回归延续的同时,减少了教师上下文中的累积退化。沿着固定的少步去噪轨迹进行密集的速度匹配,从而在不改变原始低延迟采样路径的情况下改善长时域生成。

图2的下半部分展示了导致这一设计的诊断性观察结果。在应用任何OPSD-V后训练之前,我们使用原始的LongLive模型,在测试时从相同的真实第一个块出发,在两种缓存设置下运行。在这两种设置中,第一个块均取自源视频,仅用于初始化缓存。第一种设置是标准推理,其中历史缓存完全由生成的块构建。在第二种设置中,我们仅通过用来自相应真实视频块的特征计算出的KV条目替换那些较旧的缓存历史,从而向较旧的缓存历史提供数据上下文,同时保留由模型自身生成的最近缓存块。不更新任何模型参数,去噪采样器也保持不变。这一测试时数据上下文干预本身就能产生视觉上更稳定的长时域展开,这直接表明生成的KV缓存中的退化是一个关键瓶颈。这一观察结果激发了OPSD-V的设计:在训练过程中,我们使用真实的长视频上下文作为特权教师信息以提供更干净的目标,而学生仍然遵循其在部署时将遇到的相同自生成缓存轨迹。

我们在一个包含3,800个视频的小型定制长视频数据集上执行OPSD-V后训练,每个视频长度约为1分钟。为了验证我们后训练框架的通用性,我们将OPSD-V应用于两个代表性的少步自回归视频生成器:Self-Forcing Huang et al. (2025a) 和 LongLive Yang et al. (2025b),并对两个模型使用基于LoRA的继续训练。Self-Forcing是一个被广泛比较的少步自回归基线,但其原始训练主要在短片段上进行;如果仅将其作为长视频基线,将使评估不完整,并可能夸大长时域后训练带来的增益。由于OPSD-V默认采用注意力汇聚缓存机制进行长视频训练和推理,我们在所有长视频评估中还为Self-Forcing配备了相同的注意力汇聚机制,以增强比较的说服力。为了进一步确保公平性并在已经为流式长视频生成进行训练的骨干网络上验证OPSD-V,我们还在LongLive上进行训练和比较,该模型结合了用于长视频合成的流式长调优。后训练后,OPSD-V一致地改善了运动动态,并有效缓解了长时域生成过程中的误差累积。图1进一步显示,我们的方法在保持原始少步自回归推理路径的同时,减少了长展开的退化。

2 相关工作

视频扩散基础模型。视频生成的最新进展主要建立在扩散和流匹配生成范式之上,这些范式通过从噪声到数据的迭代去噪或连续传输来合成数据 (Song et al., 2020; Lipman et al., 2023; Ho et al., 2020)。结合可扩展的扩散Transformer架构 Peebles & Xie (2022),这些技术显著提高了文本到视频的保真度、运动质量、提示遵循能力和时间连贯性。CogVideoX、HunyuanVideo、Wan 和 LongCat-Vide 等代表性系统进一步通过更强的Transformer骨干网络、潜在视频自编码器和大型训练语料库扩展了视频扩散 (Yang et al., 2024; Kong et al., 2024; Wan Team, 2025; Meituan LongCat Team et al., 2025; Brooks et al., 2024; Zheng et al., 2024)。这些模型通常使用双向注意力对时间窗口进行去噪,允许帧之间丰富的交互,从而产生强大的离线生成质量。然而,其全窗口去噪接口和多步采样过程不太适合实时或交互式场景,在这些场景中,需要在合成整个视频之前按顺序发出帧或块。这激发了因果自回归视频生成的发展,它在保持扩散模型生成优势的同时,使其适应流式推理。

自回归视频生成和基于强制的训练。自回归(AR)视频模型通过使每个新帧或块依赖于先前生成的内容来按顺序生成视频,通常使用Transformer键值缓存(KV Cache)来高效重用历史上下文。早期的因果视频扩散方法通常遵循教师强制或扩散强制范式,其中模型学习在干净或部分加噪的上下文帧条件下对未来的帧进行去噪 (Jin et al., 2025; Chen et al., 2024; 2025)。为了使AR扩散适用于实时生成,CausVid 使用DMD风格的少步蒸馏将双向视频DiT蒸馏为因果学生模型 (Yin et al., 2025; 2023)。Self-Forcing 通过在训练期间执行自回归自展开,进一步减少了暴露偏差,使模型能够基于其自身生成的帧和滚动的KV Cache进行条件生成 (Huang et al., 2025a)。沿着这一方向,Self-Forcing++ (Cui et al., 2025) 将自展开扩展到分钟级时域;Causal Forcing 通过更好的初始化策略改进了因果AR蒸馏 (Zhu et al., 2026);Reward Forcing 引入奖励反馈和EMA注意力汇聚以优化训练和推理性能 (Zhang et al., 2026);LongLive 开发了具有KV重缓存和流式长调优的块级AR生成,用于交互式长视频 (Yang et al., 2025b)。其他工作进一步改进了缓存管理、长上下文外推、注意力汇聚或开放-ended AR生成的推理时稳定性 (Li et al., 2026a; Liu et al., 2025b; Mao et al., 2026; Yi et al., 2025; Yesiltepe et al., 2026)。这些方法提高了因果视频生成的效率和稳定性,但其监督主要仍基于短片段教师、展开级目标、奖励信号或缓存启发式方法。最近,Cai et al. (2026) 也通过引入双头DiT设计探索了使用真实长视频数据作为监督;然而,它针对的是非因果长视频训练范式

第 5 页

而非针对因果少步自回归(AR)视频生成的缓存感知后训练。相比之下,OPSD-V 专注于对已经高效的少步 AR 视频模型进行后训练,通过在学生的推理时缓存状态上提供密集的去噪级别监督来实现。

策略内自蒸馏。策略内自蒸馏(On-policy self-distillation, OPSD)最近作为一种改进模型在其实际访问轨迹上表现的方法而出现。在自回归大语言模型中,同一模型可以在不同上下文中同时充当学生和教师:学生从其当前策略中采样,而教师分布是通过对模型施加更丰富的上下文信息条件获得的 (Zhao et al., 2026; Shenfeld et al., 2026; Hübotter et al., 2026; He et al., 2026)。这一思想也已扩展到步骤蒸馏扩散模型和流模型。D-OPSD 将 OPSD 应用于文生图任务,通过对教师施加文本提示及其配对真实图像的条件,使得监督微调能够沿着学生自身的少步 rollout 进行,同时不牺牲少步推理能力 (Jiang et al., 2026)。相关的 OPD 风格方法进一步研究了扩散模型和流模型的轨迹级蒸馏 (Fang et al., 2026; Li et al., 2026c; Gu et al., 2026)。OPSD-V 遵循这种上下文增强的自蒸馏原则,但将其扩展到 AR 视频设置,其中策略内状态不仅包括噪声潜变量和去噪时间步,还包括由先前生成的块写入的 evolving KV 缓存。通过使用真实长视频作为特权时间上下文,OPSD-V 构建了更干净的教师分布,并为长视野少步 AR 视频生成提供了缓存感知的密集监督。

3 预备知识

3.1 少步自回归视频生成

我们考虑一个因果自回归(AR)视频扩散模型,该模型将视频生成为潜块序列。令 $x_{1:N} = \{x_1, \dots, x_N\}$ 表示被划分为 $N$ 个块的视频,其中每个块可以包含一个或多个潜帧,令 $c$ 表示文本提示或其他条件信号。AR 视频生成器将视频分布分解为

$$ p_\theta(x_{1:N} | c) = \prod_{i=1}^{N} p_\theta(x_i | x_{<i}, c). $$

在因果视频扩散 Transformer 中,历史上下文 $x_{<i}$ 通过 Transformer 键值(KV)缓存实现,因此在前面的块不需要在每一步生成时从头重新计算。我们将生成块 $i$ 之前可用的缓存状态记为 $h_i$。在推理过程中,模型基于 $h_i$ 生成块 $i$,然后将生成的块追加到缓存中以供后续块使用。

对于少步 AR 视频生成模型,每个块由少量去噪步骤生成。从高斯噪声 $z_{i,K}$ 开始,模型按照固定的时间步调度 $\{t_K, \dots, t_1\}$ 对其进行去噪。令 $f_\theta$ 表示因果视频 DiT 速度预测器。在去噪步骤 $k$,模型预测一个速度场

$$ \hat{v}_{i,k} = f_\theta(z_{i,k}, t_k, c, h_i), $$

其中 $z_{i,k}$ 是块 $i$ 的当前噪声潜变量,$t_k$ 是去噪时间步,$h_i$ 是历史 KV 缓存状态。预测的速度 $\hat{v}_{i,k}$ 并不是下一个潜变量本身;相反,它指定了数值求解器使用的去噪方向。给定该速度,求解器转换 $\Phi$ 更新潜状态:

$$ z_{i,k-1} = \Phi(z_{i,k}, t_k, t_{k-1}, \hat{v}_{i,k}), \quad k = K, \dots, 1. $$

经过最终去噪步骤后,获得干净的潜块

$$ \hat{x}_i = z_{i,0}. $$

生成的块随后被写入 KV 缓存。我们用 $KV_\theta(\hat{x}_i)$ 表示从生成的干净块中获得的 KV 条目,并用 $\oplus$ 表示将新的 KV 条目追加到现有缓存中。缓存更新可以写为

$$ h_{i+1} = h_i \oplus KV_\theta(\hat{x}_i). $$

因此,未来的块通过不断演变的 KV 缓存递归地依赖于先前生成的块。

少步 AR 视频生成器通常是通过将因果视频建模与分布匹配蒸馏(DMD)或相关的少步蒸馏目标相结合获得的 (Yin et al., 2023; Liu et al., 2025a)。DMD 通过将学生分布匹配到教师或数据分布,将强大但缓慢的扩散模型压缩为高效的一步或少步生成器。在 AR 视频生成中,诸如 CausVid 等方法使用 DMD 风格的蒸馏将双向视频扩散教师适应为因果少步学生 (Yin et al., 2025),而 Self-Forcing 进一步在训练期间执行自回归自 rollout,使模型能够基于其自身生成的帧和滚动的 KV 缓存进行条件生成 (Huang et al., 2025a)。这些技术提供了高效的少步 AR 生成器,作为我们后训练框架的起点。

5

第 6 页

图 3:OPSD-V 使用感知缓存的策略内自蒸馏对少步自回归视频生成器进行后训练。学生模型遵循确切的推理时展开过程,并将其自身生成的块写入键值缓存。教师模型在与学生访问相同的去噪状态下进行评估,但使用自回归一致的实视频缓存,其中较旧的历史被实视频块替换,而最新的块仍为学生生成。

3.2 策略内自蒸馏

策略内自蒸馏(On-Policy Self-Distillation, OPSD)最近已在自回归语言模型中得到研究,作为一种改进模型在其实际采样轨迹上表现的方法 Zhao et al. (2026); Shenfeld et al. (2026)。给定输入查询 $q$,模型首先作为学生,从其当前策略中采样输出轨迹:

$$ \hat{o}_{1:T} \sim \pi_\theta(\cdot \mid q), \quad (1) $$

其中 $\hat{o}_{1:T}$ 表示采样的序列。同一模型或其指数移动平均副本随后在更强的上下文下作为教师。令 $r$ 表示额外的上下文内信息,例如演示、中间推理或其他特权监督。在每个令牌位置 $m$,学生预测基于查询及其自身采样前缀 $\hat{o}_{<m}$ 的下一个令牌分布,而教师则在相同的采样前缀但带有额外上下文 $r$ 的条件下进行预测:

$$ \pi_\theta(\cdot \mid q, \hat{o}_{<m}), \quad \bar{\pi}_\theta(\cdot \mid q, r, \hat{o}_{<m}), \quad (2) $$

其中 $\bar{\theta}$ 表示教师参数。OPSD 随后通过在由学生采样的轨迹上匹配这两个分布来优化学生:

$$ \mathcal{L}_{\text{OPSD}} = \mathbb{E}_{\hat{o}_{1:T} \sim \pi_\theta(\cdot \mid q)} \left[ \sum_{m=1}^T D(\bar{\pi}_\theta(\cdot \mid q, r, \hat{o}_{<m}) \parallel \pi_\theta(\cdot \mid q, \hat{o}_{<m})) \right], \quad (3) $$

其中 $D(\cdot \parallel \cdot)$ 表示蒸馏散度。关键思想是,展开前缀 $\hat{o}_{<m}$ 来自学生自身,因此轨迹保持策略内,而教师通过使用额外上下文 $r$ 提供更强的目标。

D-OPSD 将此思想扩展到步蒸馏的文生图扩散模型 (Jiang et al., 2026)。在 D-OPSD 中,学生遵循基于文本提示的自身少步去噪轨迹,而教师则基于由文本提示及其配对的实视频构建的更丰富的多模态上下文进行条件生成。随后,学生在其自身的展开状态下对学生模型进行监督,从而保留原始的少步推理行为。我们的目标是将这一原则实例化应用于少步自回归视频生成。与图像扩散相比,自回归视频中的策略内状态更为复杂:它不仅包括当前的噪声潜在变量和去噪时间步,还包括由先前生成的块产生的时间键值缓存。在下一节中,我们将介绍 OPSD-V,它使用真实的长视频作为特权时间上下文以构建更纯净的教师分布,同时保持学生展开和缓存动态与推理过程一致。

4 方法

4.1 概述

我们提出了 OPSD-V,这是一种用于少步因果自回归视频生成器后训练的感知缓存策略内自蒸馏框架。给定划分为潜在块 $x_{\text{data}}^{1:N}$ 的长训练视频,我们使用第一个块 $x_{\text{data}}^1$ 作为共享实视频

6

第 7 页

学生端和教师端的前缀。该前缀用于初始化键值缓存(KV Cache)并锚定场景,但不参与生成或损失计算。从块 $i = 2$ 开始,学生端遵循原始推理时的 rollout(展开)过程:它使用固定的少步采样器对每个块进行去噪,将其生成的块写入键值缓存,并从这个自生成的时间状态继续。

如图 3 所示,核心思想是在构建来自真实长视频上下文的更干净教师分布的同时,保持学生端 rollout 完全处于策略内(on-policy)。对于每个生成的块,教师端在与学生端访问过的相同噪声潜变量和去噪时间步处进行评估,但使用不同的时间缓存:较旧的历史被真实视频块替换,而最新的块仍由学生端生成,以保持自回归的连续性。例如,在块 $i = 7$ 时,学生端以 $x_{data1}, \hat{x}_{s2}, \hat{x}_{s3}, \hat{x}_{s4}, \hat{x}_{s5}, \hat{x}_{s6}$ 为条件,而教师端以 $x_{data1}, x_{data2}, x_{data3}, x_{data4}, x_{data5}, \hat{x}_{s6}$ 为条件。这种设计在学生端自身的 rollout 状态上提供了密集的去噪级别校正目标,且不改变原始的少步采样路径。接下来我们将描述学生端策略内 rollout、真实视频教师缓存的构建以及密集蒸馏目标。

4.2 学生端策略内 Rollout

学生端分支定义了用于训练的策略内 rollout 状态。我们首先用真实第一个块 $x_{data1}$ 初始化学生端缓存。具体而言,将 $x_{data1}$ 通过因果 DiT 以获得其键值条目: $$ h_{s2} = \text{KV}_\theta(x_{data1}), \quad (4) $$ 其中 $\text{KV}_\theta(\cdot)$ 表示将干净块转换为相应缓存键值条目的操作。这个第一个块仅作为共享上下文,并非由学生端生成。

从块 $i = 2$ 开始,学生端遵循确切的推理时程序。给定当前学生端缓存 $h_{si}$,学生端从高斯噪声 $z_{si,K}$ 开始,并使用固定的少步采样器对其进行去噪。在去噪步骤 $k$,学生端预测一个速度场: $$ \hat{v}_{si,k} = f_\theta(z_{si,k}, t_k, c, h_{si}), \quad (5) $$ 其中 $z_{si,k}$ 是学生端噪声潜变量,$t_k$ 是去噪时间步,$c$ 是文本条件。求解器随后通过下式更新潜变量状态: $$ z_{si,k-1} = \text{sg } \Phi(z_{si,k}, t_k, t_{k-1}, \hat{v}_{si,k}), \quad k = K, \dots, 1. \quad (6) $$ 这里 $\text{sg}(\cdot)$ 表示通过 rollout 转换的停止梯度(stop-gradient),这防止了后续块上的损失通过整个自回归历史进行反向传播。在 rollout 期间,我们记录所有学生端状态 $\{z_{si,k}, \hat{v}_{si,k}\}_{k=1}^K$ 以供教师端评估和蒸馏。

在最终去噪步骤之后,生成的块为: $$ \hat{x}_{si} = z_{si,0}. \quad (7) $$

然后使用与推理时相同的缓存更新规则将其写入学生端缓存: $$ h_{si+1} = h_{si} \oplus \text{KV}_\theta(\hat{x}_{si}), \quad (8) $$ 其中 $\oplus$ 表示将新的键值条目追加到现有缓存中。

等价地,在生成块 $i$ 之前,学生端缓存包含真实第一个块以及所有先前生成的学生端块: $$ h_{si} \equiv \text{KV}_\theta(x_{data1}) \oplus \text{KV}_\theta(\hat{x}_{s2}) \oplus \dots \oplus \text{KV}_\theta(\hat{x}_{si-1}). \quad (9) $$ 因此,每个有监督的学生端预测都基于与模型在部署期间遇到的相同类型的自生成键值缓存状态进行条件化。

4.3 自回归一致的真实视频教师缓存

教师端分支提供干净的校正目标,同时保持自回归连续性。令 $\bar{\theta}$ 表示教师端参数。在我们的 LoRA 后训练设置中,基础视频生成器被冻结,学生端 LoRA 可训练,教师端 LoRA 维护为学生端 LoRA 的指数移动平均(EMA)副本。教师端仅用于生成停止梯度的目标。

对于块 $i$,教师端在与学生端访问过的相同噪声潜变量 $z_{si,k}$ 和时间步 $t_k$ 处进行评估,但使用不同的时间缓存 $h_{ti}$: $$ \hat{v}_{ti,k} = f_{\bar{\theta}}(z_{si,k}, t_k, c, h_{ti}). \quad (10) $$ 重要的是,教师端并不采样其自身的去噪轨迹。去噪状态保持策略内,因为 $z_{si,k}$ 来自学生端 rollout,而教师端缓存提供了更干净的时间上下文以构建目标速度。换句话说,学生端轨迹决定了应用监督的位置,而教师端缓存决定了校正方向。

7

第 8 页

教师缓存由真实长视频片段构建,并带有自回归一致性约束。在对片段 $i$ 进行监督之前,学生缓存包含真实的第一片段以及先前生成的学生片段: $$ h^s_i \equiv \text{KV}_\theta(x^{\text{data}}_1) \oplus \text{KV}_\theta(\hat{x}^s_2) \oplus \cdots \oplus \text{KV}_\theta(\hat{x}^s_{i-1}). \quad (11) $$

相比之下,教师缓存用对应的真实视频片段替换了较旧的生成历史,同时保留最近的学生生成片段: $$ h^t_i \equiv \text{KV}_{\bar{\theta}}(x^{\text{data}}_1) \oplus \text{KV}_{\bar{\theta}}(x^{\text{data}}_2) \oplus \cdots \oplus \text{KV}_{\bar{\theta}}(x^{\text{data}}_{i-2}) \oplus \text{KV}_{\bar{\theta}}(\hat{x}^s_{i-1}). \quad (12) $$

例如,在片段 $i = 7$ 时,两个缓存分别为 $$ h^s_7 : [x^{\text{data}}_1, \hat{x}^s_2, \hat{x}^s_3, \hat{x}^s_4, \hat{x}^s_5, \hat{x}^s_6], \quad (13) $$ $$ h^t_7 : [x^{\text{data}}_1, x^{\text{data}}_2, x^{\text{data}}_3, x^{\text{data}}_4, x^{\text{data}}_5, \hat{x}^s_6]. $$

这种缓存策略平衡了两个目标。用真实视频片段替换较旧的历史可以减少教师上下文中的累积误差污染,并提供更干净的长程时间状态。保留最近的学生生成片段可防止教师变成完全的教师强制(teacher-forced)预言机:教师仍然预测如何从学生最新生成的状态继续,这更好地匹配了自回归部署。学生和老师都使用带有滚动相对 RoPE 的注意力汇聚(attention-sink)缓存机制。随着展开过程的进行,汇聚位置一致更新,因此学生和老师预测之间的差异主要来自缓存内容,而非不一致的位置索引。

4.4 密集去噪级别目标

OPSD-V 在少步采样器使用的固定去噪步骤上提供监督。对于每个监督的片段-步骤对 $(i, k)$,学生预测 $\hat{v}^s_{i,k}$ 和教师目标 $\hat{v}^t_{i,k}$ 在相同的学生访问噪声潜在变量 $z^s_{i,k}$ 和时间步 $t_k$ 下进行评估,但处于不同的时间缓存中。我们使用纯速度匹配目标:

$$ \mathcal{L}_{\text{OPSD-V}} = \frac{1}{|S|} \sum_{(i,k) \in S} \| \hat{v}^s_{i,k} – \text{sg}(\hat{v}^t_{i,k}) \|^2. \quad (14) $$

其中 $\text{sg}(\cdot)$ 停止通过教师预测的梯度,$S$ 表示监督片段-步骤对的集合。

在我们的实现中,底层 AR 生成器使用四步采样器,我们对所有四个去噪步骤进行监督。我们通过从损失中排除前 $M = 7$ 个片段来应用展开预热(rollout warm-up):

$$ S = \{(i, k) \mid i > M, k = 1, \dots, K\}, \quad M = 7, K = 4. \quad (15) $$

预热片段仍以自回归方式生成并写入学生缓存,但它们不贡献蒸馏损失。我们将 $M$ 设为 7,因为实验中使用的基于 Wan 的 AR 模型最初是在七个片段的局部窗口内训练的,对应 $3 \times 7 = 21$ 个潜在帧。在此局部视界之后开始损失计算,鼓励监督集中在长展开状态上,此时累积的缓存退化开始显现。然后,损失应用于同一连续长视频展开中的所有后续片段。

4.5 训练过程

我们在算法 1 中总结了 OPSD-V 的训练过程。对于每个长训练视频,两个分支都从相同的真实第一片段开始。学生随后执行自回归自展开以定义策略内去噪状态。展开预热后,为每个监督片段构建教师缓存,包含真实视频较旧历史和最近的学生生成片段,如公式 (12) 所定义。EMA 教师在相同的学生访问噪声潜在变量上进行评估,学生则在这些监督片段上使用密集速度匹配进行优化。

内存高效的截断反向传播。一种朴素实现会保留所有监督片段-步骤对的计算图,直到完成整个长视频展开,导致激活内存随展开长度和去噪步骤数量而增长。在我们的公式中这是不必要的,因为公式 (6) 中的求解器转换是停止梯度的,并且所有 KV 缓存写入均不带梯度执行。因此,公式 (14) 的梯度在监督对上分解:

$$ \nabla_\theta \mathcal{L}_{\text{OPSD-V}} = \sum_{(i,k) \in S} \nabla_\theta \ell_{i,k}, \quad \ell_{i,k} = \frac{1}{|S|} \| \hat{v}^s_{i,k} – \text{sg}(\hat{v}^t_{i,k}) \|^2. \quad (16) $$

因此,我们在每个学生前向传播后立即反向传播每个归一化项 $\ell_{i,k}/|S|$ 并累积参数梯度,而不更新模型。然后在进入下一个去噪步骤之前释放当前的激活图。监督片段的教师预测、预热的学生预测、去噪转换以及

8

第 9 页

算法 1 OPSD-V 的内存高效训练过程 要求:长视频数据集 $D$,学生模型 $f_\theta$,EMA 教师 $\bar{f}_\theta$,去噪步数 $K$,预热块数 $M$ 1: while 未收敛 do 2: 从 $D$ 中采样连续长视频及条件 $(x_{data_{1:N}}, c) \sim D$。 3: 从共享前缀 $x_{data_{1}}$ 初始化分离的学生缓存。 4: 初始化累积参数梯度:$g \leftarrow 0$。 5: for $i = 2$ to $N$ do 6: 采样初始噪声 $z_{si,K} \sim \mathcal{N}(0, I)$。 7: if $i > M$ then 8: 如公式 (12) 所示,使用真实的历史记录和最新的学生生成块构建 $h_{ti}$。 9: end if 10: for $k = K$ to 1 do 11: if $i > M$ then 12: 无梯度预测教师目标:$\hat{v}_{ti,k} \leftarrow \bar{f}_\theta(z_{si,k}, t_k, c, h_{ti})$。 13: 有梯度预测学生速度:$\hat{v}_{si,k} \leftarrow f_\theta(z_{si,k}, t_k, c, h_{si})$。 2 14: 计算 $\ell_{i,k} \leftarrow \left\| \hat{v}_{si,k} – \text{sg}(\hat{v}_{ti,k}) \right\|^2$。 15: 立即反向传播:$g \leftarrow g + \nabla_\theta(\ell_{i,k}/|S|)$。 16: 释放当前激活图并分离所有缓存张量。 17: else 18: 无梯度预测学生速度:$\hat{v}_{si,k} \leftarrow f_\theta(z_{si,k}, t_k, c, h_{si})$。 19: end if 20: 无梯度更新学生潜在变量:$z_{si,k-1} \leftarrow \text{sg } \Phi(z_{si,k}, t_k, t_{k-1}, \hat{v}_{si,k})$。 21: end for 22: 获得生成块:$\hat{x}_{si} \leftarrow z_{si,0}$。 23: 将 $\hat{x}_{si}$ 追加到分离的学生缓存中。 24: end for 25: 对 $g$ 进行裁剪并更新学生 LoRA 参数 $\theta$ 一次。 26: 使用 EMA 更新教师 LoRA 参数 $\bar{\theta}$。 27: end while

所有缓存更新均在无梯度情况下评估。优化器仅在完整 rollout 后步进一次,随后更新 EMA 教师。这种在线累积在数学上等同于对求和后的目标进行反向传播,同时每次最多只保留一个带有梯度的学生前向计算图。因此,激活内存不会随监督块-步对的数量增长;只有分离的 KV 缓存和累积的参数梯度在 rollout 期间持续存在。

在我们的实验中,$K = 4$ 且所有去噪步均接受监督。我们设置 $M = 7$,因此前七个块仍被生成并写入学生缓存,但它们不对损失产生贡献。这种预热机制使学生在密集蒸馏开始前进入长 rollout 缓存状态。尽管所有四个去噪步均接受监督,但根据公式 16,它们的激活图是一次处理并释放的。在推理时,教师分支和真实视频缓存被移除;模型使用原始的少步自回归 (AR) 采样路径。

5 实验

5.1 实验设置

训练数据。我们为 OPSD-V 的后期训练构建了一个小型定制长视频数据集。该数据集包含 3,800 个视频,每个视频长度约为 1 分钟,分辨率为 480p。视频内容涵盖多样化的场景,包括自然景观、大幅相机运动以及以人为中心的场景。我们应用基于光流和其他基本质量指标的轻量级过滤流程,以去除低运动、不稳定或低质量的样本。所有视频均使用 Wan2.1 VAE Wan Team (2025) 编码为潜在块。与短片训练数据相比,这些长视频提供了更丰富的时间上下文,因此适合在我们的框架中构建真实视频教师缓存。在训练期间,我们使用第一个块作为学生和教师共享的真实视频前缀,并对后续块执行自回归 rollout。

基础模型。我们在两个代表性的少步 AR 视频生成器上评估 OPSD-V:Self-Forcing (Huang et al., 2025a) 和 LongLive (Yang et al., 2025b)。这两个模型均基于 Wan2.1-T2V-1.3B 骨干网络 Wan Team (2025) 构建。对于 Self-Forcing,我们从其官方基础检查点开始,为我们的后期训练训练一个 LoRA 适配器。对于 LongLive,

9

第 10 页

图 4:长自回归视频生成的定性比较。前两个示例基于 LongLive Yang 等人 (2025b),后两个示例基于 Self-Forcing Huang 等人 (2025a)。对于每个示例,第一行显示由原始基础模型生成的结果,第二行显示应用 OPSD-V 后训练后的结果。每对示例使用相同的提示词、相同的随机种子、相同的 4 步采样器以及相同的注意力汇聚(attention-sink)推理设置。与基础模型相比,OPSD-V 在长序列生成过程中更好地保留了运动动态和视觉质量,减少了常见的自回归(AR)退化伪影,如运动减弱、模糊、时间闪烁以及后续片段中的语义漂移。

我们使用其官方基础模型和发布的 LoRA 检查点,并使用 OPSD-V 继续对 LoRA 适配器进行后训练。在两个模型上进行评估使我们能够测试 OPSD-V 是否可以作为针对不同少步(Few-Step)AR 视频生成器的通用后训练细化方法。

后训练设置。学生分支使用可训练的 LoRA 适配器,而教师分支使用学生 LoRA 的指数移动平均(EMA)副本,衰减率为 0.9999。教师分支仅用于

第 11 页

表 1:一分钟视频生成的定量比较。我们总共生成了 240 个视频,包括来自 MovieGenBench 的 120 个提示和来自 MeiBench 的 120 个内部提示,并使用 VBenchLong (Huang et al., 2025b) 评估所有结果。所有方法均基于相同的 Wan2.1-T2V-1.3B 骨干网络,使用相同的 4 步自回归推理路径,并采用相同的注意力汇聚缓存机制。分数越高越好。OPSD-V 在 LongLive 和 Self-Forcing 上均提高了质量分数 (Quality Score) 和动态程度 (Dynamic Degree),且未增加推理成本。

| Method | Params | NFE | Quality Score ↑ | Dynamic Degree ↑ | Semantic Score ↑ | | :— | :— | :— | :— | :— | :— | | LongLive | 1.3B | 4 | 0.8138 | 0.5012 | 0.4911 | | LongLive + OPSD-V | 1.3B | 4 | 0.8242 | 0.5890 | 0.4904 | | Self-Forcing | 1.3B | 4 | 0.8259 | 0.6218 | 0.4897 | | Self-Forcing + OPSD-V | 1.3B | 4 | 0.8389 | 0.6570 | 0.4864 |

在训练期间使用,并在推理时移除。我们使用基础自回归视频模型的原始四步采样器,并使用公式 14 中的速度匹配损失对所有四个去噪步骤进行监督。未使用额外的分布匹配蒸馏 (DMD)、奖励或对抗损失。我们在 24 块 H800 GPU 上对每个模型进行 200 次迭代训练,每块 GPU 的批次大小为 1。训练使用 BF16 混合精度、激活检查点 (activation checkpointing) 和完全分片数据并行 (fully sharded data parallelism)。结合第 4.5 节中描述的即时每步反向传播策略,这些选择使得长 rollout 后训练成为可能,而无需保留完整的 rollout 计算图。

Rollout 和缓存构建。每个训练样本是一个连续的长视频片段。对于每个 rollout,我们总共使用 180 个潜在帧,分为 60 个块,每个块包含 3 个潜在帧。学生模型和教师模型均从相同的真实第一个块初始化。学生模型随后遵循确切的推理时 rollout 过程,将每个生成的块写入其 KV 缓存。教师缓存由用于较早历史的真实视频块和用于自回归延续的最新学生生成块构建而成。我们从蒸馏损失中排除前 $M = 7$ 个块,这对应于基于 Wan 的自回归模型原始的局部训练视界。这些预热块仍会被生成并写入学生缓存,但只有随后的块对损失有贡献。

评估协议。我们在 16 FPS 下对一分钟视频生成的 OPSD-V 进行定性和定量评估。对于定性比较,我们对每一对基线和经过 OPSD-V 后训练的模型使用相同的提示、随机种子、采样器和注意力汇聚推理设置。这使我们在相同的推理条件下直接比较后训练目标的效果。对于定量评估,我们总共使用 240 个提示:前 120 个提示来自 MovieGenBench (Polyak et al., 2024),另外 120 个为内部提示,我们称之为 MeiBench。每种方法针对每个提示生成一个视频,生成的 240 个视频使用 VBenchLong (Huang et al., 2025b) 进行评估。我们报告 MovieGenBench 和 MeiBench 上的平均结果。所有比较模型均使用与其对应基础模型相同的 4 步自回归推理路径和推理时 KV 缓存机制。因此,任何改进都来自后训练,而非额外的推理计算。

5.2 定性比较

图 4 在相同的推理设置下比较了原始的少步自回归生成器与其经过 OPSD-V 后训练的对应模型。在 LongLive 和 Self-Forcing 示例中,基础模型可以产生合理的早期块,但随着自回归 rollout 的继续,视觉质量往往会下降。典型的故障模式包括运动减弱、模糊累积、局部伪影以及后续帧中的语义或结构漂移。应用 OPSD-V 后,生成的视频在整个一分钟的视界内更好地保留了场景结构和运动动态。对于 LongLive,OPSD-V 在长景观序列中保持了更清晰的背景细节和更稳定的相机演变。对于 Self-Forcing,OPSD-V 产生了更连贯的对象运动,并减少了主体和背景周围的后期伪影。这些改进是在不改变采样器、去噪步骤数量或推理时 KV 缓存机制的情况下获得的,这表明感知缓存的策略内监督改善了模型在部署期间自然访问的状态下的行为。

5.3 定量比较

表 1 报告了 MovieGenBench 和 MeiBench 上的平均定量结果。在 LongLive 和 Self-Forcing 骨干网络中,OPSD-V 在保持相同模型规模、4 步推理路径和注意力汇聚缓存机制的情况下,一致地提高了质量分数和动态程度。这些结果表明,我们的感知缓存的策略内蒸馏主要通过增强运动动态来提高长视频生成质量,而不是依赖额外的推理计算。语义分数与相应的基础模型相当,略有下降

第 12 页

长期保持 自强制 运动 运动 49% 36% 15% 66% 25% 9% 质量 质量

视觉 视觉 42% 33% 25% 79% 12% 9% 质量 质量

总体 54% 28% 18% 总体 78% 12% 10%

OPSD-V 相同 基础

图 5:用户研究偏好结果。十名参与者每人比较 20 对视频,包括 10 对 LongLive 对和 10 对 Self-Forcing 对。每对包含一个基础模型生成的视频及其在相同提示下经过 OPSD-V 后训练的版本。对于每一对,参与者就总体偏好、运动质量和视觉质量选择模型 A、模型 B 或相同。每个面板显示每个标准下 100 次判断的百分比。

后训练之后,这表明更活跃的运动生成与保守的语义匹配指标之间存在轻微的权衡。

我们进一步进行了包含 10 名参与者的用户研究。每位参与者比较 20 对视频,包括 10 对 LongLive 对和 10 对 Self-Forcing 对。每对包含一个由基础模型生成的视频和一个在应用 OPSD-V 后生成的视频,并连同相应的提示一起展示。对于每一对,参与者回答三个问题:考虑所有因素的总体偏好、关注平滑性、自然性以及无抖动或不连续性的运动质量,以及关注清晰度、细节水平和整体美学质量的视觉质量。对于每个问题,当没有可察觉的差异时,参与者选择模型 A、模型 B 或相同。图 5 分别报告了两个骨干网络的结果。在 LongLive 上,OPSD-V 在总体和运动质量判断中优于基础模型,而视觉质量显示出更大比例的平局和基础模型偏好。在 Self-Forcing 上,OPSD-V 在所有三个标准上都获得了强烈的偏好。综合两个骨干网络,OPSD-V 在 66.0% 的总体质量比较中更受青睐,排除平局后为 82.5%。用户也偏爱 OPSD-V 的运动质量(57.5%,排除平局后为 82.7%)和视觉质量(60.5%,排除平局后为 78.1%)。总体而言,定量结果和人类偏好支持 OPSD-V 作为少步自回归视频生成的有效后训练细化策略。

5.4 消融研究

我们研究了两个直接影响长期后训练稳定性的设计选择:用于蒸馏的预测空间以及评估蒸馏目标的轨迹。除非另有说明,所有变体均使用与我们的主要方法相同的训练视频、四步采样器、展开长度、缓存构建和 LoRA 后训练设置。

图 6:速度匹配与清洁潜在变量匹配。我们比较了在预测的清洁潜在变量 ($x_0$) 空间和原生速度空间中的蒸馏,展开长度为 1 分钟。两种变体在开始时都保持合理,但 $x_0$ 匹配逐渐平滑了精细结构,并在桥梁桁架和植被中引入了几何退化。速度匹配在较晚的时间戳更好地保留了这些细节。红色方框突出了代表性区域。

12

第 13 页

速度匹配与去噪后潜在变量(clean-latent)匹配。我们的默认目标直接匹配学生模型和教师模型的速度预测,如公式 14 所定义。作为替代方案,我们在每个去噪步骤中将两种预测转换为去噪后潜在变量估计值,并优化

$$ L_{x_0} = \frac{1}{|S|} \sum_{(i,k) \in S} \| \hat{x}^{s_0}_{i,k} – \text{sg}(\hat{x}^{t_0}_{i,k}) \|^2. \quad (17) $$

在流参数化(flow parameterization)下,将速度预测转换为 $x_0$ 会引入一个依赖于时间步长的缩放因子。因此,$x_0$ 空间中的均方误差(MSE)会对四个固定去噪步骤中的预测误差进行重新加权,并相对更强调高噪声状态。如图 6 所示,这种变体在长程生成过程中会产生越来越平滑的细节,特别是在桥梁结构和树木边界处。直接的速度匹配则在其原生预测空间中对模型进行监督,从而更好地保留高频结构。因此,我们在所有主要实验中使用速度匹配。

图 7:教师轨迹监督的失败。当蒸馏状态从教师自身的去噪轨迹中采样时,教师生成的结果保持清晰连贯(底部),但学生模型在其自身的自回归生成过程中变得严重模糊(顶部)。这种差异揭示了由教师轨迹监督引入的离策略(off-policy)状态不匹配问题。

学生轨迹与教师轨迹。OPSD-V 的一个核心设计选择是,教师模型是在学生模型访问的噪声潜在变量 $z^s_{i,k}$ 上进行评估,而不是采样一个独立的去噪轨迹。我们通过从教师自身的轨迹 $z^t_{i,k}$ 构建蒸馏对来消融这一选择。尽管这些教师状态产生了视觉上更干净的目标,但它们并非学生模型在推理时进行自回归生成时所遇到的状态。结果,学生模型在如何从其自身去噪状态中的错误中恢复方面几乎没有得到监督,并且这种不匹配在每次生成的块被写入 KV 缓存后都会被反复放大。图 7 展示了由此产生的失败模式:教师轨迹保持清晰,而学生生成的结果迅速失去空间细节并变得以模糊为主。这一结果证实,教师应提供校正预测,但学生必须确定对该预测进行评估的状态。因此,我们在最终设计中保持去噪轨迹完全处于策略内(on-policy)。

6 分析与未来工作

我们的工作始于一个简单的问题:在微调少步自回归视频生成器时,应该使用什么作为目标分布?现有的 DMD 风格方法通常依赖短片段扩散模型作为教师分布。虽然这种方法能有效加速生成,但此类目标受限于教师模型的时间范围和生成质量,难以为真正的长程自回归生成提供可靠的监督。一个自然的替代方案是直接利用真实长视频,其中包含更丰富的时间结构和更清晰的全局动态。

然而,将真实视频纳入少步自回归微调并非易事。直接的教师强制(teacher forcing)会破坏推理时的生成分布,而仅将真实视频用作重建目标则无法纠正模型在其自身生成的缓存状态上的错误。我们的关键观察是,策略内自蒸馏为此问题提供了一个合适的接口:真实视频可被视为特权时间上下文,而非直接的输出目标。通过这种方式,学生模型仍遵循其自身的推理轨迹,而教师模型则使用更干净的真实视频缓存状态来提供密集的去噪级别校正监督。

这一视角为未来工作指明了一个有前景的方向。由于 OPSD-V 明确利用了真实长视频数据,其性能可能会进一步受益于增加训练视频的数量、多样性和质量,以及增加训练算力。此外,我们当前的缓存构建和损失设计仅是这一思想的其中一种实现方式。

13

第 14 页

更有效的教师缓存策略、自适应的监督调度或更强的上下文增强教师可能会进一步改善长视界生成。我们希望 OPSD-V 能作为一个有用的基线,并为因果自回归视频模型的数据驱动后训练的未来研究提供见解。

7 结论

我们提出了 OPSD-V,这是一种用于后训练少步自回归视频生成器的缓存感知策略内自蒸馏框架。与依赖短片段教师目标或完全教师强制训练不同,OPSD-V 在学生的推理时间展开状态上进行监督,同时使用真实的长视频上下文构建更干净的教师缓存。这在自生成的 KV 缓存状态下提供了密集的降噪级别校正,从而在不改变原始少步推理路径的情况下改善了长视界生成行为。在 Self-Forcing 和 LongLive 上的实验表明,OPSD-V 在保持相同模型规模和推理成本的同时,提高了视频质量和运动动态。我们希望这项工作能为因果长视频生成的数据驱动后训练提供有用的步骤。

参考文献

Sand. ai, Hansi Teng, Hongyu Jia, Lei Sun, Lingzhi Li, Maolin Li, Mingqiu Tang, Shuai Han, Tianning Zhang, W. Q. Zhang, Weifeng Luo, Xiaoyang Kang, Yuchen Sun, Yue Cao, Yunpeng Huang, Yutong Lin, Yuxin Fang, Zewei Tao, Zheng Zhang, Zhongshu Wang, Zixun Liu, Dai Shi, Guoli Su, Hanwen Sun, Hong Pan, Jie Wang, Jiexin Sheng, Min Cui, Min Hu, Ming Yan, Shucheng Yin, Siran Zhang, Tingting Liu, Xianping Yin, Xiaoyu Yang, Xin Song, Xuan Hu, Yankai Zhang, 和 Yuqiao Li。Magi-1: 大规模自回归视频生成, 2025. URL https://arxiv.org/abs/2505.13211.

Philip J. Ball, Jakob Bauer, Frank Belletti, Bethanie Brownfield, Ariel Ephrat, Shlomi Fruchter, Agrim Gupta, Kristian Holsheimer, Aleksander Holynski, Jiri Hron, Christos Kaplanis, Marjorie Limont, Matt McGill, Yanko Oliveira, Jack Parker-Holder, Frank Perbet, Guy Scully, Jeremy Shar, Stephen Spencer, Omer Tov, Ruben Villegas, Emma Wang, Jessica Yung, Cip Baetu, Jordi Berbel, David Bridson, Jake Bruce, Gavin Buttimore, Sarah Chakera, Bilva Chandra, Paul Collins, Alex Cullum, Bogdan Damoc, Vibha Dasagi, Maxime Gazeau, Charles Gbadamosi, Woohyun Han, Ed Hirst, Ashyana Kachra, Lucie Kerley, Kristian Kjems, Eva Knoepfel, Vika Koriakin, Jessica Lo, Cong Lu, Zeb Mehring, Alex Moufarek, Henna Nandwani, Valeria Oliveira, Fabio Pardo, Jane Park, Andrew Pierson, Ben Poole, Helen Ran, Tim Salimans, Manuel Sanchez, Igor Saprykin, Amy Shen, Sailesh Sidhwani, Duncan Smith, Joe Stanton, Hamish Tomlinson, Dimple Vijaykumar, Luyu Wang, Piers Wingfield, Nat Wong, Keyang Xu, Christopher Yew, Nick Young, Vadim Zubov, Douglas Eck, Dumitru Erhan, Koray Kavukcuoglu, Demis Hassabis, Zoubin Gharamani, Raia Hadsell, Aäron van den Oord, Inbar Mosseri, Adrian Bolton, Satinder Singh, 和 Tim Rocktäschel。Genie 3: 世界模型的新前沿。2025.

Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, 和 Aditya Ramesh。作为世界模拟器的视频生成模型。2024. URL https://openai.com/research/video-generation-models-as-world-simulators.

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, 和 Arash Vahdat。模式寻求与均值寻求相结合以实现快速长视频生成。在 ICML, 2026.

Boyuan Chen, Diego Monso, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vincent Sitzmann。扩散强制:下一个令牌预测与全序列扩散。arXiv 预印本 arXiv:2407.01392, 2024.

Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, Weiming Xiong, Wei Wang, Nuo Pang, Kang Kang, Zhiheng Xu, Yuzhe Jin, Yupeng Liang, Yubing Song, Peng Zhao, Boyuan Xu, Di Qiu, Debang Li, Zhengcong Fei, Yang Li, 和 Yahui Zhou。Skyreels-v2: 无限长度电影生成模型, 2025. URL https://arxiv.org/abs/2504.13074.

Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh。Self-forcing++: 迈向分钟级高质量视频生成。arXiv 预印本 arXiv:2510.02283, 2025.

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, 和 Feng Zhao。Flow-opd: 用于流匹配模型的政策内蒸馏。arXiv 预印本 arXiv:2605.08063, 2026.

Yuchao Gu, Guian Fang, Yuxin Jiang, Weijia Mao, Song Han, Han Cai, 和 Mike Zheng Shou。Anyflow: 具有策略内流映射蒸馏的任意步视频扩散模型。arXiv 预印本 arXiv:2605.13724, 2026.

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, 等。Ltx-2: 高效联合音视频基础模型。arXiv 预印本 arXiv:2601.03233, 2026.

14

第 15 页

Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam Fowl, Abhishek Panigrahi, Danqi Chen, 和 Sanjeev Arora。Self-distillation zero:自我修正将二元奖励转化为密集监督。arXiv 预印本 arXiv:2604.12002,2026。

Jonathan Ho, Ajay Jain, 和 Pieter Abbeel。去噪扩散概率模型。神经信息处理系统进展,33:6840–6851,2020。

Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman。自强制:弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009,2025a。

Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nattapol Chanpaisit, Chenyang Si, Yuming Jiang, 等。Vbench++:视频生成模型的全面且多功能的基准套件。IEEE 模式分析与机器智能汇刊,2025b。

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, 和 Andreas Krause。通过自蒸馏进行强化学习。 arXiv 预印本 arXiv:2601.20802,2026。

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, 和 Steven Hoi。D-opsd:用于连续微调步蒸馏扩散模型的对策内自蒸馏。arXiv 预印本 arXiv:2605.05204,2026。

Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, 和 Zhouchen Lin。用于高效视频生成的金字塔流匹配。在国际学习表征会议,卷 2025,页 23378–23402,2025。

Weijie Kong, Qi Tian, Zijian Zhang, 等。Hunyuanvideo:大型视频生成模型的系统框架。 arXiv 预印本 arXiv:2412.03603,2024。

Haodong Li, Shaoteng Liu, Zhe Lin, 和 Manmohan Chandraker。滚动吸收:弥合自回归视频扩散中有限 horizon 训练与开放式测试之间的差距。arXiv 预印本 arXiv:2602.07775,2026a。

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, 和 Yinghao Xu。用于机器人控制的因果世界建模。arXiv 预印本 arXiv:2601.21998,2026b。

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, 和 Zuxuan Wu。Diffusionopd:扩散模型中策略内蒸馏的统一视角。arXiv 预印本 arXiv:2605.15055,2026c。

Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matthew Le。用于生成建模的流匹配。国际学习表征会议,2023。

Dongyang Liu, Peng Gao, David Liu, Ruoyi Du, Zhen Li, Qilong Wu, Xin Jin, Sihan Cao, Shifeng Zhang, Hongsheng Li, 和 Steven Hoi。解耦 DMD:以 CFG 增强为矛,以分布匹配为盾。arXiv 预印本 arXiv:2511.22677,2025a。

Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, 和 Shijian Lu。滚动强制:实时自回归长视频扩散。 arXiv 预印本 arXiv:2509.25161,2025b。

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, 和 Kaipeng Zhang。Packforcing: 短视频训练足以支持长视频采样和长上下文推理。arXiv 预印本 arXiv:2603.25730, 2026。

美团 LongCat 团队,Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, 和 Tong Zhang。Longcat-video 技术报告。arXiv 预印本 arXiv:2510.22200,2025。

William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。arXiv 预印本 arXiv:2212.09748,2022。

Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih- Yao Ma, Ching-Yao Chuang, 等。Movie gen:一系列媒体基础模型。arXiv 预印本 arXiv:2410.13720, 2024。

Idan Shenfeld, Mehul Damani, Jonas Hübotter, 和 Pulkit Agrawal。自蒸馏使持续学习成为可能。arXiv 预印本 arXiv:2601.19897,2026。

Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, 和 Xun Huang。Motionstream: 具有交互式运动控制的实时视频生成。arXiv 预印本 arXiv:2511.01266,2025。

15

第 16 页

Jiaming Song, Chenlin Meng, 和 Stefano Ermon。Denoising diffusion implicit models。arXiv 预印本 arXiv:2010.02502,2020。

美团 LongCat 团队,蔡寻良,程孟,高峰,孔哲,李甲木,李乐,李伟恒,刘洪宇,谭帅,等。Longcat-video-avatar 1.5 技术报告。arXiv 预印本 arXiv:2605.26486,2026a。

Robbyant 团队,高泽林,王秋宇,曾艳红,朱家鹏,Cheng Ka Leong,李一轩,王翰林,徐英浩,马帅雷,陈一航,刘杰,程严松,姚瑶,朱家怡,孟一浩,郑克成,白庆岩,陈静烨,沈泽宏,岳宇,朱兴,沈宇俊,欧阳浩。推进开源世界模型。arXiv 预印本 arXiv:2601.20540,2026b。

Wan 团队。Wan:开放且先进的超大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。

王立珍,朱永明,葛志鹏,郑有伟,张龙浩,胡天舒,秦士扬,罗明双,张家旭,陈鑫,等。Flowact-r1:迈向交互式人形视频生成。arXiv 预印本 arXiv:2601.10103,2026。

王正一,Lu Cheng,王一凯,范宝,李崇轩,苏航,朱军。Prolificdreamer:基于变分分数蒸馏的高保真多样化文本到3D生成。神经信息处理系统进展,36:8406–8441,2023。

Xiao Guangxuan,田友东,Beidi Chen,韩松,Mike Lewis。具有注意力汇点的流式高效语言模型。arXiv,2023。

杨少书,孔哲,高峰,程孟,刘翔宇,张勇,康卓良,罗文汉,蔡寻良,何然,魏小明。Infinitetalk:用于稀疏帧视频配音的音频驱动视频生成,2025a。URL https://arxiv.org/abs/2508.14033。

杨帅,黄伟,褚瑞航,肖一程,赵宇扬,王先邦,李沐阳,谢恩泽,陈颖聪,陆瑶,韩松,陈玉康。Longlive:实时交互式长视频生成。arXiv 预印本 arXiv:2509.22622,2025b。

杨卓一,滕佳言,卫文迪,丁明,黄诗雨,徐佳正,杨元明,王文毅,张孝涵,冯冠宇,殷达,张宇轩,王威汉,程艳,徐斌,顾晓涛,董雨萧,唐杰。Cogvideox:基于专家 Transformer 的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072,2024。

Ye Seonghyeon,Ge Yunhao,Zheng Kaiyuan,Gao Sihyun,Yu Sihyun,Kurian George,Indupuru Suneel,Tan You Liang,Zhu Chuning,Xiang Jiannan,Malik Ayaan,Lee Kyungmin,Liang William,Ranawaka Nadun,Gu Jiasheng,Xu Yinzhen,Wang Guanzhi,Hu Fengyuan,Narayan Avnish,Bjorck Johan,Wang Jing,Kim Gwanghyun,Niu Dantong,Zheng Ruijie,Xie Yuqi,Wu Jimmy,Wang Qi,Julian Ryan,Xu Danfei,Du Yilun,Chebotar Yevgen,Reed Scott,Kautz Jan,Zhu Yuke,Fan Linxi "Jim",Jang Joel。世界动作模型是零样本策略,2026。URL https://arxiv.org/abs/2602.15922。

Hidir Yesiltepe,Tuna Meral,Adil Kaan Akan,Kaan Oktay,Pinar Yanardag。Infinity-rope:自回归自 rollout 涌现出动作可控的无限视频生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 40256–40265,2026。

Jung Yi,Jang Wooseok,Cho Paul Hyunbin,Nam Jisu,Yoon Heeji,Kim Seungryong。Deep forcing:基于深度汇点和参与式压缩的免训练长视频生成。arXiv 预印本 arXiv:2512.05081,2025。

Tianwei Yin,Michaël Gharbi,Richard Zhang,Eli Shechtman,Fredo Durand,William T. Freeman,Park Taesung。基于分布匹配蒸馏的一步扩散。arXiv 预印本 arXiv:2311.18828,2023。

Tianwei Yin,Michaël Gharbi,Park Taesung,Richard Zhang,Eli Shechtman,Fredo Durand,William T Freeman。改进的分布匹配蒸馏用于快速图像合成。神经信息处理系统进展,37:47455–47487,2024a。

Tianwei Yin,Michaël Gharbi,Richard Zhang,Eli Shechtman,Fredo Durand,William T Freeman,Park Taesung。基于分布匹配蒸馏的一步扩散。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 6613–6623,2024b。

Tianwei Yin,Qiang Zhang,Richard Zhang,William T. Freeman,Fredo Durand,Eli Shechtman,Xun Huang。从缓慢的双向到快速的自回归视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议,2025。

Jingran Zhang,Ning Li,Yuanhao Ban,Andrew Bai,Justin Cui。Reward-forcing:基于奖励反馈的自回归视频生成。arXiv 预印本 arXiv:2601.16933,2026。

16

第 17 页

Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, 和 Aditya Grover。自蒸馏推理器: 针对大语言模型的策略内自蒸馏。arXiv 预印本 arXiv:2601.18734,2026。

Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, 和 Yang You。Open-sora:让所有人享受高效视频制作。arXiv 预印本 arXiv:2412.20404,2024。

Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu。因果强制:正确执行自回归扩散蒸馏以实现高质量实时交互式视频生成。arXiv 预印本 arXiv:2602.02214,2026。

17

发表评论