Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积

三分钟导读:Cycle-World提出了一种基于时间可逆性的框架,通过训练时的循环一致性学习(CCL)和推理时的循环引导推理(CGI),有效抑制了自回归视频生成中的生成漂移和结构幻觉。

英文题目:Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

论文出处:arXiv 每日论文精选 · arXiv:2607.11836

原始论文:PDF / 论文页面

对应视频标题:Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积|推荐指数:★★★★★

这篇论文解决什么问题?

自回归视频模型在长时域生成中面临严重的误差累积(Error Accumulation)和生成漂移(Generative Drift),导致结构崩塌、主体身份丢失及物理规律违背。

核心创新

  • 提出Cycle-Bounded Drift (CBD)定理,从理论上证明通过最小化反向重建误差可严格限制前向生成漂移。
  • 设计Intrinsic Latent Reversibility机制,直接在潜在流形上定义循环一致性,避免昂贵的Decode-Flip-Encode循环。
  • 提出零样本、无需重训练的Cycle-Guided Inference (CGI)策略,作为即插即用的运行时校正模块。

方法概览

提出Cycle-World框架,包含:1) Cycle-Consistent Learning (CCL):引入反向预测模型Rϕ,通过隐空间循环一致性损失Lcycle约束前向生成器;2) Cycle-Guided Inference (CGI):利用冻结的反向模型作为运行时校正器,通过梯度下降迭代优化潜在变量。

逐图理解论文

方法概览:Cycle-World框架

方法概览:Cycle-World框架
Fig. 2: Overview of Cycle-World. We mitigate generative drift in autoregressive video synthesis by enforcing temporal reversibility. (a) Training (CCL): The forward generator Gθ and reverse model Rϕ are jointly optimized. A latent cycle-consistency loss (Lcycle) explicitly penalizes physically irreversible trajectories. (b) Inference (CGI): The frozen Rϕ acts as a runtime corrector. By evaluating cycle discrepancy (D), it per- forms iterative gradient-based latent refinement to actively prune accumulated errors before they enter the historical context.

Cycle-World提出基于时间可逆性的框架,包含两部分:一是Cycle-Consistent Learning (CCL),引入反向预测模型Rϕ,通过隐空间循环一致性损失Lcycle约束前向生成器;二是Cycle-Guided Inference (CGI),利用冻结的反向模型作为运行时校正器,通过梯度下降迭代优化潜在变量。

实验设置:VBench与VideoPhy基准

实验设置:VBench与VideoPhy基准
Table 1: Quantitative comparison on the VBench for 5s and 60s video generation.

在VBench基准上对比5秒和60秒视频生成的定量指标,并使用VideoPhy基准评估物理一致性(PC和PACE指标)。消融实验分析CCL和CGI各自及组合对生成质量的影响,定性比较展示长视频生成的主体一致性和物理合理性。

物理一致性评估

物理一致性评估
Table 2: Quantitative evalua- tion of physical consistency. Our proposed method outperforms all baseline approaches across both metrics, demonstrating a compre- hensive understanding of complex physical dynamics.

物理一致性平均得分75.66,优于所有基线模型。在VideoPhy基准的PC和PACE指标上,Cycle-World展现了全面的复杂物理动态理解能力,证明了其在保持物理规律方面的有效性。

消融实验:CCL与CGI的作用

消融实验:CCL与CGI的作用
Table 3: Ablation study of the proposed compo- nents on the VBench benchmark. We evaluate the individual and synergistic effects of the training- time cycle loss (Lcycle) and the inference-time cy- cle guidance on 5s video generation. The best re- sults are highlighted in bold.

消融实验显示,训练时的循环损失(Lcycle)建立了稳健的参数基础,而运行时校正器(CGI)作为主动防护机制。两者结合实现了强大的双阶段协同效应,有效防止轨迹漂移和背景退化,在长视频生成中取得优越结果。

定性比较:主体一致性与物理合理性

定性比较:主体一致性与物理合理性
Fig. 3: Qualitative comparison of long video generation. We compare our proposed method against several baseline models. The figure displays sampled frames at 0, 30, and 60 seconds for two distinct scenes. While the baseline methods struggle with subject loss, severe structural distortion, or identity shifts over the extended timeframe, our method successfully preserves temporal consistency, visual quality, and subject identity throughout the entire 60-second duration.

定性比较展示,基线方法在长时域内面临主体丢失、严重结构扭曲或身份转换问题。而Cycle-World成功保持了时间一致性、视觉质量和主体身份,在整个60秒时长内维持了高质量生成。

实验与关键结果

  • 在VBench基准上对比5秒和60秒视频生成的定量指标。
  • 使用VideoPhy基准评估物理一致性(PC和PACE指标)。
  • 消融实验分析CCL和CGI各自及组合对生成质量的影响。
  • 定性比较展示长视频生成的主体一致性和物理合理性。
  • 60s生成Total Score 82.88,Semantic Score 76.86,优于LongLive (82.62, 74.97)(第 11 页)
  • 物理一致性平均得分75.66,优于所有基线模型(第 13 页)
  • 5s生成Total Score 84.36,达到SOTA水平(第 13 页)

阅读时需要注意

  • CGI策略需要额外的梯度计算和迭代优化,可能增加推理延迟。
  • 反向模型Rϕ需要与正向模型共享相同的Video VAE潜在空间。
  • 循环损失权重λ影响视觉质量与物理一致性的平衡,需仔细调优(文中设为0.1)。
  • CGI的优化步长η和迭代次数K对结果敏感,过大可能导致视觉质量下降。

关联工作

  • Self-Forcing:基线方法,通过自强制缓解训练-推理差距,但仍受限于单向生成。(第 2 页)
  • LongLive:基线方法,采用流式长序列微调,本文在长视频生成上与其竞争。(第 4 页)
  • Diffusion Forcing:相关工作,提出联合去噪优化以缓解误差累积。(第 2 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积

苏子涵1⋆,胡腾1⋆,张江宁2,王瑞岩1,易然1†, 马立壮1†,陶达诚3

1 上海交通大学计算机科学与技术学院,中国上海 2 浙江大学控制科学与工程学院,中国杭州 3 南洋理工大学,新加坡 https://szhcz.github.io/projects/Cycle-World/

摘要。自回归扩散模型已实现高质量的视频生成,但其序列特性本质上存在误差累积问题。在长时域视频合成中,微小的预测偏差会随时间不断放大,不可避免地导致生成漂移(Generative Drift)、结构崩溃以及严重的视觉退化。为解决这一问题,我们提出了 Cycle-World,这是一种旨在实现稳定且无时间漂移的长视频生成的新颖框架。我们的方法在训练和推理两个阶段同时解决误差累积问题。理论上,我们证明了前向生成漂移可以通过循环一致性目标进行严格约束。在训练阶段,我们集成了一种高效的反向预测模型,将因果约束隐式嵌入前向生成器中,迫使其产生严格遵循自然视频流形的可逆序列。在推理阶段,我们将此冻结的反向模型重新用作运行时校正器。通过基于梯度的循环引导(Cycle-Guided Inference, CGI),它迭代地优化生成的潜在表示,在误差被提交到历史上下文之前主动抑制累积误差。在 VBench 基准上的大量实验表明,Cycle-World 的双阶段协同作用显著缓解了误差漂移,在 60 秒合成中实现了最先进的整体生成质量和长时域时间一致性。

关键词:视频生成 · 循环一致性 · 误差累积

1 引言

近年来,在 Sora [36, 37]、Seedance [12, 41] 等强大模型的推动下,视频生成领域见证了前所未有的进步。

⋆ 共同一作,† 通讯作者。

第 2 页

2 Z. Su 等

5s

一艘船在塞纳河上悠闲航行, 一只穿着紫色长袍的胖兔子穿过 背景是埃菲尔铁塔,梵高风格 奇幻景观

30s

一个平视镜头,展示一只毛色一致 赛博朋克电影风格,女性特工拥有发光的 的橙白相间英国短毛猫,身处明亮温暖的客厅中 赛博义眼,雨夜霓虹灯

60s+

一个跟随镜头,展示一名背着红色背包的徒步者 一个跟随镜头,展示一只金毛寻回犬在 在日出时的山间小径上奔跑

图 1:Cycle-World 的高保真、长视界视频生成。 通过利用时间可逆性有效遏制生成漂移,我们的框架 严格抑制了仅前向模型固有的结构幻觉。Cycle- World 在扩展的生成视界内保持了最先进的视觉质量、严格的物理守恒以及时 间上一致的对象状态。

Kling [44],以及 Wan [45]、Hunyuan- Video [29] 等开创性的开源工作。尽管这些模型主要依赖双向或全序列 架构,从而实现了卓越的视觉质量,但其非因果特性 从根本上限制了其在开放式、序列式和交互式生成中的灵活性。随着社区转向世界模型 [17, 25, 34, 42] 的范式,业界形成了关键共识,即实时交互、连续生成和因果推理不可或缺。因此,该领域正经历向因果自回归生成模型 [16,23,57,61] 的范式转变。 然而,这种向因果自回归模型的转变给长视频生成带来了严重的瓶颈。一个主要挑战是训练-推理不匹配,通常导致误差迅速累积。传统上,模型使用教师强制(Teacher-Forcing)进行训练,这严格依赖于真实过去的帧,导致显著的暴露偏差(exposure bias):在推理过程中,自回归模型依赖于其自身的过去预测,其中微小的偏差——在训练期间未见——会传播并放大。为了弥合这一差距并减轻漂移,社区不断演进出更稳健的训练范式。这一进展涵盖了从引入扩散强制(Diffusion Forcing)[5] 到最近的先进训练-推理对齐策略,如自强制(Self-Forcing)[23] 和 LongLive [51]。 尽管如此,我们观察到,即使有这些复杂的缓解措施,仅前向生成仍然遭受更根本且更具破坏性的问题:结构幻觉。虽然现有的渐进式方法有效地抑制了通用噪声的累积,但它们严格以单向、正向时间的方式运行。关键在于,它们缺乏时间循环一致性——

第 3 页

Cycle-World 3

确保生成的状态在逻辑上允许其过去状态发生,从而使得过去状态可以从未来状态进行反向预测,这需要明确的时序约束。如果没有这种双向验证,模型就缺乏维持物体状态连续性的物理约束。因此,它们容易出现严重的视频失真和非物理伪影——例如角色穿模穿过固体物体、实体凭空出现或物体毫无踪迹地消失。与一般的噪声不同,这些结构性幻觉是对现实物理规律的不可逆违背,会突然破坏生成序列的完整性。

为了从根本上解决这些不可逆的结构性幻觉,我们提出了 Cycle-World,这是一个通过时序可逆性来强制物理一致性的统一框架。我们的核心动机基于一个基本前提:如果生成的因果序列遵循现实世界的动力学规律,那么它在时间上必须是可逆的。基于这一洞察,我们首先建立了循环有界漂移(Cycle-Bounded Drift, CBD)定理,形式化地证明了前向自回归合成中无约束的误差累积可以通过最小化反向重建误差来严格限制瓶颈。在这一理论保证的指引下,我们将数学界限转化为实用的循环一致性学习(Cycle-Consistent Learning, CCL)范式。通过引入反向预测分支,我们显式地约束前向生成器产生内在可逆的潜在变量,使其能够在训练过程中预见并抑制非物理伪影。此外,为了将我们的理论适用范围扩展到预训练模型和资源受限的场景,我们提出了循环引导推理(Cycle-Guided Inference, CGI)。这种推理时策略将反向模型重新用作运行时评判器,以迭代方式细化潜在变量,提供了一种即插即用的解决方案,在无需昂贵架构修改的情况下显著提升了稳定性。

在 VBench 上进行的广泛实验验证了我们框架的有效性。Cycle-World 显著减轻了误差漂移,在长视频生成中实现了最先进的视觉保真度、语义一致性和整体时序稳定性,如图 1 所示。

总之,我们的主要贡献有三方面:

– 我们建立了循环有界漂移(CBD)定理,这是一个理论框架,证明了通过强制时序可逆性,可以严格限制前向自回归合成中无约束的生成漂移和结构性幻觉。 – 我们提出了循环一致性学习(CCL)范式。通过引入一种新的反向预测循环一致性损失(Lcycle),我们显式地约束前向因果生成器内化物理守恒定律并维持长期的结构完整性。 – 我们引入了循环引导推理(CGI),这是一种零样本运行时优化策略。通过将冻结的反向模型重新用作运行时评判器,CGI 利用基于梯度的迭代潜在变量细化来主动纠正非物理伪影,在不修改前向模型架构的情况下显著提升了长期生成质量。

第 4 页

4 Z. Su 等

2 相关工作

2.1 视频生成

扩散模型 [14,35,43],特别是扩散 Transformer (DiT) [38],已确立了视频生成的主流范式 [21,29,45,52,60],并实现了卓越的视觉保真度。这一快速进展涵盖了各种专用能力,包括多模态定制生成 [4, 19, 20]、原生高分辨率合成 [22,48] 以及时空一致的视频处理 [27,32]。此外,最近的进展已扩展到联合音视频生成,利用跨模态交互和跨任务协同来实现同步的多感官合成 [18,30,33,46,58]。然而,尽管在视觉和多模态方面取得了成就,它们对用于并发帧去噪的非因果双向注意力的依赖,限制了其在开放式生成中的灵活性。相比之下,纯自回归 (AR) 模型 [15,28] 通过离散下一个 token 预测提供了序列灵活性,但在潜在压缩过程中遭受不可逆的信息损失,且生成多样性欠佳。

为了弥补这一差距,最近的研究探索了混合自回归扩散架构 [10,11,23,26,57],这些架构通过对过去上下文进行条件约束,在时间上分解生成过程。尽管前景广阔,但这些模型遭受严重的暴露偏差 (exposure bias)。在迭代推理过程中,基于不完美的先前预测进行条件约束会导致微小偏差不断放大。这种灾难性的误差累积构成了我们工作所解决的主要瓶颈。

2.2 长视频生成

早期的长视频方法依赖于生成重叠片段 [8, 39, 47] 或在稀疏关键帧之间进行时插值 [3, 54]。虽然这些启发式设计扩展了生成窗口,但未能实现真正的、无限长的流式合成。因此,研究重点已转向原生因果建模。然而,这些模型的常规训练范式通常采用教师强制 (Teacher Forcing) [40, 50],这不可避免地引入了训练阶段和推理阶段之间严重的分布差异。为了缓解这一问题,Diffusion Forcing [5] 提出了针对具有独立噪声级别的 token 的联合去噪优化,SkyReels-V2 [6] 进一步将其与多模态大语言模型集成,以促进无限长度、电影级视频合成。CausVid [57] 将分布匹配蒸馏 [55,56] 扩展到视频领域,以减轻 AR 生成中的误差累积。为了解决暴露偏差并弥合训练-测试差距,Self-Forcing [23] 创新性地通过在训练期间执行带有键值缓存 (Key-Value cache) 的自回归 rollout,直接模拟推理条件,从而基于模型自身历史生成的输出对模型进行优化。大多数最近的尖端工作都是在此基础上建立的。例如,LongLive [51] 采用流式长序列微调,以严格保持端到端的“长训练-长测试”一致性。

第 5 页

Cycle-World 5

标准自回归 ℒ௖௬௖௟௘ – 循环一致性损失 ∥𝑧̂௡ିଵ−𝑅థ𝑧̂௡∥ଶଶ 无约束生成漂移 ℒ௙௪ௗ – DMD 损失 Cycle-World

𝑧̂ழ௡ିଵ ℒ௧௢௧௔௟= ℒ௙௪ௗ+ 𝜆ℒ௖௬௖௟௘ 𝑧̂௡ିଵ 𝑧̃௡ିଶ 模型 前向 反向 生成器 𝑧̂௡ିଵ 𝑧̂௡ 𝑧̃௡ିଵ 稳定轨迹

(a) 循环一致性学习 (CCL) 训练范式

迭代循环 初始 𝑘= 0, … , 𝐾−1 循环差异 𝒟 提议 ௞ ଶ ∥𝑧̂௡ିଵ−𝑧̃௡ିଵ ∥ଶ ௞ 细化更新 𝑧௡,௧ 𝑧̃௡ିଵ௞ 𝑧௡,௧௞ାଵ= 模型 前向 反向 {𝑧̂଴, … , 𝑧̂௡ିଵ} 生成器 𝑧௡଴ ௞ 𝑧̂௡= 𝑧௡௄ 𝑧௡,௧௞−𝜂∇௭೙,೟ೖ𝒟𝑧௡,௧

(b) 循环引导推理 (CGI) 运行时优化

图 2: Cycle-World 概述。我们通过强制时间可逆性来缓解自回归视频合成中的生成漂移。(a) 训练 (CCL):前向生成器 Gθ 和反向模型 Rϕ 联合优化。潜在循环一致性损失 (Lcycle) 明确惩罚物理上不可逆的轨迹。(b) 推理 (CGI):冻结的 Rϕ 充当运行时校正器。通过评估循环差异 (D),它在误差进入历史上下文之前执行基于梯度的迭代潜在细化,以主动剪除累积误差。

3 方法论

Cycle-World 的总体目标是缓解长期自回归视频合成中固有的无约束生成漂移和结构幻觉。为了实现这一目标,我们引入了一个基于时间可逆性原则的新颖框架——即物理有效且结构合理的视频动态必须能够被准确逆转。如图 2 所示,我们的方法通过一个连贯的管道来解决这一挑战,该管道包括理论依据、循环一致性学习和推理时优化。具体而言,我们首先建立了循环有界漂移 (CBD) 定理(第 3.1 节),这是一个理论基础,表明前向生成误差可以通过最小化反向预测循环一致性误差来严格约束。受此洞察的引导,我们提出了循环一致性学习 (CCL) 范式(第 3.2 节)。在此阶段,我们引入反向预测模型 Rϕ,对前向因果生成器 Gθ 施加循环一致性损失 (Lcycle),明确惩罚不可逆的结构幻觉。

第 6 页

6 Z. Su 等

最后,为了应对开放式生成过程中的分布外扰动,我们引入了循环引导推理(Cycle-Guided Inference, CGI)(见第 3.3 节)。在该策略下,我们将冻结的反向模型重新用作运行时校正器。通过主动评估循环差异,它在这些非物理伪影被提交到历史上下文之前,执行基于梯度的迭代潜在变量细化,从而将其剪除。

3.1 理论基础:通过时间可逆性界定生成漂移

设 $Z = \{z_1, z_2, \dots, z_N\}$ 表示自然视频的真实潜在序列,其中每个 $z_n$ 为一个潜在块。在标准的自回归合成中,前向因果生成器 $G_\theta$ 根据先前生成的上下文 $\hat{z}_{<n}$ 顺序预测 $\hat{z}_n$。由于这种顺序生成本质上不受约束,微小的预测偏差会在每一步 $n$ 累积,导致生成漂移无界增长,并在长视频合成中引发结构崩溃。

我们从理论上论证,通过强制时间可逆性,可以严格限制这种生成漂移。因为自然视频动力学遵循物理定律和时空因果律,它们本质上是可逆的。如果生成的帧 $\hat{z}_n$ 严重偏离自然流形,它将失去重建其历史所需的因果信息。

设 $e_n = \|\hat{z}_n – z_n\|$ 为第 $n$ 步累积的生成漂移。为了限制这一点,我们引入一个反向预测模型 $R_\phi$,将状态从 $n$ 映射回 $n-1$。我们基于两个温和的假设建立理论保证:

假设 1(自然动力学的反向可预测性):反向模型 $R_\phi$ 在自强制范式 [23] 下经过全面训练。鉴于这种对齐的训练方案,其对于短视距反向预测的近似误差由一个小常数 $\epsilon_R > 0$ 界定。即,$\|R_\phi(z_n) – z_{n-1}\| \le \epsilon_R$。

假设 2(反向利普希茨连续性):学习到的反向映射 $R_\phi$ 保留了相关潜在流形内的距离属性,满足反向利普希茨条件。存在一个常数 $C > 0$,使得对于任意两个状态 $z_a$ 和 $z_b$,$\|z_a – z_b\| \le C \|R_\phi(z_a) – R_\phi(z_b)\|$。

在这些条件下,我们证明前向生成误差 $e_n$ 受到循环一致性目标和前一步误差的约束。我们正式定义单步循环一致性距离为 $d_{cycle}^{(n)} = \|\hat{z}_{n-1} – R_\phi(\hat{z}_n)\|$。

由于篇幅限制,本节中提出的理论结果的所有详细证明均推迟至补充材料。

定理 1(循环有界漂移)。在假设 1 和 2 下,前向生成漂移 $e_n$ 满足:

$$ e_n \le C \left( d_{cycle}^{(n)} + e_{n-1} + \epsilon_R \right) \quad (1) $$

为了理解长视距上漂移的累积效应,我们递归地展开此逐步递推关系。

第 7 页

Cycle-World 7

推论 1(长视界误差界)。假设单步循环一致性距离存在最坏情况上界,$\max_i d^{(i)}_{cycle} \le \delta_{cycle}$,则在步骤 $n$ 处的总生成漂移(对于 $C \neq 1$)由下式明确控制:

$$ e_n \le C^n e_0 (\delta_{cycle} \epsilon_R) \frac{C^n – 1}{C – 1} \quad (2) $$

基于推论 1,接下来我们证明 Cycle-World 框架在理论上优于无约束基线。令 $\delta_{unc} = \max_i \| \hat{z}^{unc}_i – R_\phi(\hat{z}^{unc}_{i-1}) \|$ 表示标准无约束生成器的最大局部循环误差,$\delta_{cycle}$ 表示我们的约束误差,其中 $\delta_{cycle} \ll \delta_{unc}$。

命题 1(相对于无约束基线的理论优势)。给定相同的初始漂移条件 $e_0$ 和相同的预训练反向模型 $R_\phi$(其性质由假设 1 和 2 定义),令 $E^{unc}_n$ 和 $E^{our}_n$ 分别表示无约束基线和我们的约束方法在步骤 $n$ 处生成漂移的理论上限。我们的方法所实现的显式漂移减少(即这两个理论上限之间的差距)为:

$$ \Delta E_n = E^{unc}_n – E^{our}_n = (\delta_{unc} – \delta_{cycle}) \frac{C^n – 1}{C – 1} > 0. \quad (3) $$

注记。命题 1 是我们方法的理论基石。项 $(\delta_{unc} – \delta_{cycle})$ 代表通过显式强制时间可逆性所获得的单步优势。关键在于,乘子 $C \frac{C^{n-1}}{C-1}$ 意味着这种优势不仅仅是累加的,而是随序列长度 $n$ 缩放。这证明了虽然标准生成和我们方法在极短片段上可能表现相似,但无约束基线不可避免地会随时间推移遭受更快的误差爆炸。通过最小化单步循环误差上界 $\delta_{cycle}$,Cycle-World 有效地抑制了累积生成漂移的基础幅度,从而在理论上保证了长视频生成中显著更好的结构保持能力。

3.2 循环一致性学习:通过反向预测强制循环一致性

通过时间循环一致性约束前向模型。 基于第 3.1 节建立的理论保证——特别是命题 1,该命题证明了限制单步循环误差在数学上可以遏制复合生成漂移——我们将这一见解转化为实际的学习框架。我们扩展了一个前向自回归视频生成器 $G_\theta$,用于根据历史 $\hat{z}_{<n}$ 预测潜在块 $\hat{z}_n$。由于标准最大似然训练仅优化前向预测,无约束的反向一致性会导致误差随序列长度 $n$ 以 $C \frac{C^{n-1}}{C-1}$ 的速度无界累积(推论 1)。为了最小化该上界并减轻结构幻觉,我们引入了一个反向预测模型 $R_\phi$ 来强制时间循环一致性。

第 8 页

8 Z. Su 等

像素-潜在空间不匹配瓶颈。通过在对视频进行反向处理后训练独立的自回归模型来朴素地实现 $R_\phi$,不仅会带来严重的双重蒸馏开销,还面临一个难以逾越的结构障碍:像素-潜在空间不匹配。由于视频 VAE 将连续的帧序列在时间维度上压缩为紧凑的潜在表示,正向序列的潜在特征与反向序列的潜在特征之间并不存在简单的时间对称性。这种不匹配使得无法直接计算定理 1 中定义的循环一致性距离 $d^{(n)}_{cycle} = \|\hat{z}_{n-1} – R_\phi(\hat{z}_n)\|$。对齐正向排序的块 $\hat{z}_{n-1}$ 与位于不相交流形上的反向预测块,需要执行代价高昂的“解码-翻转-编码”循环(即解码、时间翻转和重新编码),这使得联合训练在计算上不可行。

我们的解决方案:内在潜在可逆性。为了从根本上规避这一瓶颈和固有的特征不匹配问题,我们提出了内在潜在可逆性(Intrinsic Latent Reversibility),直接在内在潜在流形上重新定义循环一致性目标,而不是映射回外在像素域。$R_\phi$ 无需预测解码后时间翻转的帧。相反,我们将反向任务表述为学习潜在空间内的逆转移动力学。我们将 $R_\phi(\hat{z}_n)$ 的优化目标设为正向排序的历史 $\hat{z}_{n-1}$,直接学习逆概率 $P(z_{n-1}|\hat{z}_n)$。这种方法消除了对“解码-翻转-编码”循环的需求。因此,循环一致性距离 $d^{(n)}_{cycle}$ 简化为共享潜在空间中的直接向量减法。这使我们能够以可忽略的计算开销施加严格的结构约束,从而使联合训练成为可能。

通过自强制的前向生成。为了弥合训练与推理之间的差异,我们通过自强制训练 $G_\theta$,使其根据生成的历史 $\hat{z}_{<n}$ 预测当前块 $\hat{z}_n$,而不是使用真实标签。由于分布匹配蒸馏(DMD)缺乏成对的回归约束,优化此过程使用其分数差梯度更新前向目标 $\mathcal{L}_{fwd}$:

$$ \nabla_{\theta} \mathcal{L}_{fwd} = -\mathbb{E}_{t} \left[ s_{real}(\hat{z}_{n,t},t) s_{fake}(\hat{z}_{n,t},t) \frac{\partial G_\theta(\hat{z}_{<n})}{\partial\theta} \right] \quad (4) $$

其中 $\hat{z}_{n,t}$ 是扩散时间步 $t$ 处的噪声潜在变量。虽然这种梯度更新确保了高保真度的块生成,但它缺乏对长序列中累积的结构漂移的显式惩罚。

潜在循环一致性目标。为了限制这种生成漂移,我们通过反向预测模型 $R_\phi$ 实现了所提出的内在潜在可逆性。如前所述,$R_\phi$ 直接在潜在流形上运行,其任务是根据当前生成结果 $\hat{z}_n$ 重建前一个潜在变量 $z_{n-1}$。形式上,令 $\hat{z}_n$ 为前向生成器合成的潜在块。反向模型试图预测直接历史 $\tilde{z}_{n-1} = R_\phi(\hat{z}_n)$。循环一致性目标定义为前向模型使用的实际自回归条件上下文与反向模型推断出的重建历史之间的期望平方欧几里得距离:

$$ \mathcal{L}_{cycle} = \mathbb{E}_{\hat{z}_n \sim G_\theta(\hat{z}_{n-1}, R_\phi(\hat{z}_n))} \left[ \dots \right] \quad (5) $$

第 9 页

Cycle-World 9

最小化该目标显式地强制了可逆性假设(假设 2),确保生成的 $\hat{z}_n$ 保留了足够的因果信息以恢复其起源,从而防止误差累积。

联合优化。最终的训练目标将分布级监督与我们的结构循环约束无缝集成:

$$ \mathcal{L}_{total} = \mathcal{L}_{fwd} + \lambda \mathcal{L}_{cycle}, \quad (6) $$

其中 $\lambda$ 是缩放惩罚强度的超参数。关键在于,在反向传播过程中,来自 $\mathcal{L}_{cycle}$ 的梯度流经反向模型 $R_\phi$ 并回传至前向生成器 $G_\theta$。这种机制隐式地赋予了 $G_\theta$ 预见能力——它惩罚生成物理上不可信的伪影(如消失的物体),尽管这些伪影在 $\mathcal{L}_{fwd}$ 下局部看来是合理的,但无法准确重建其历史,从而在学习阶段显式地剪枝发散的轨迹。

3.3 循环引导推理:通过运行时引导优化生成潜在变量

尽管提出的循环一致性学习(Cycle-Consistent Learning, CCL)范式确保生成器内在保留了时间可逆性,但它需要全规模的参数重新训练。在大规模基础模型时代,由于权重封闭,这种重新训练通常在计算上是不可行的或在实践中不可行。为了解决这一局限性并将时间可逆性的好处扩展到更广泛的场景,我们引入了循环引导推理(Cycle-Guided Inference, CGI),这是一种零样本、无需训练的潜在优化策略。关键在于,该策略与模型无关:只要目标模型和反向校正器在相同的潜在流形内运行(共享相同的 Video VAE),CGI 就可以无缝插入任何现成的自回归视频生成器中,而无需更新任何模型参数,从而缓解结构幻觉。

潜在空间中的循环引导。在自回归推理阶段,前向生成器 $G_\theta$ 和反向模型 $R_\phi$ 的权重均严格冻结。尽管前面的章节将第 $n$ 个块的生成抽象为单个输出 $z_n$,但扩散模型中的实际合成涉及在时间步 $\{t_T, \dots, t_1\}$ 上的迭代去噪过程。与被动接受前向预测的传统解码不同,我们主动在中间扩散时间步校正累积的误差,并将其提交到历史上下文缓冲区(KV 缓存)。令 $z_{n,t}$ 表示扩散时间步 $t$ 的潜在状态。首先,前向生成器 $G_\theta$ 基于历史上下文 $H$ 预测相应的干净潜在变量 $\hat{z}_{n|t} = G_\theta(z_{n,t}, t, H)$。为了评估此预测的物理合理性,我们计算循环差异 $D$。具体而言,反向评估被表述为两阶段自回归过程。预测的干净潜在变量在时间上翻转,由算子 $F(\cdot)$ 表示,并在固定的上下文噪声水平 $t_{ctx}$ 下由反向模型处理,以构建反向上下文缓存 $H_{rev}$。随后,反向模型利用这个新构建的缓存,从标准高斯噪声 $\epsilon$ 中预测干净的先前状态,

第 10 页

10 Z. Su et al.

以初始扩散时间步 $t_T$ 为条件。该差异定义为因果条件 $\hat{z}_{n-1}$(前一模块的确认输出)与时间翻转的反向重建之间的欧几里得距离:

$$ \mathcal{D}(z_{n,t}^{(k)}) = \left\| \hat{z}_{n-1} – \tilde{z}_{n-1}^{(k)} \right\|, \quad \tilde{z}_{n-1}^{(k)} = R_\phi \left( \mathcal{F} \left( \hat{z}_{n|t}^{(k)} \right), t_{\text{ctx}}, \mathcal{H}_{\text{rev}}^{(k)} \right)_{\text{rev}}^{(k)}, \quad \hat{z}_{n|t}^{(k)} = G_\theta(z_{n,t}^{(k)}, t, \mathcal{H}), \quad \epsilon \sim \mathcal{N}(0, I) $$

其中 $k$ 为优化迭代索引。

基于梯度的潜在状态细化。由于前向预测和反向重建都是完全可微的过程,我们可以通过循环引导迭代细化潜在状态。为了最大化效率和结构影响,该优化策略性地仅应用于早期去噪时间步的特定窗口内(从 $T_{\text{start}}$ 到 $T_{\text{end}}$)。我们计算循环差异相对于当前状态 $z_{n,t}^{(k)}$ 的梯度,并执行梯度下降:

$$ z_{n,t}^{(k+1)} = z_{n,t}^{(k)} – \eta \nabla_{z_{n,t}^{(k)}} \mathcal{D}(z_{n,t}^{(k)}), \quad (8) $$

其中 $\eta$ 为优化步长。经过 $K$ 次迭代后,细化后的状态 $z_{n,t}^{(K)}$ 从计算图中分离。该优化后的状态随后被传递给标准的扩散转移函数 $\Psi$,以获得后续时间步的潜在状态。当到达最终去噪步骤 $t_1$ 时,生成的干净潜在状态 $\hat{z}_n$ 被附加到历史上下文缓冲区中,以指导下一个模块的生成。这种主动校正机制充当了结构瓶颈,防止固有的漂移表现为视觉退化。完整的推理过程总结在补充材料中。

4 实验

4.1 实验设置

基线模型。我们将所提出的方法与几种视频生成基线模型进行评估对比,这些基线模型按其架构范式进行分类。对于双向扩散和 Transformer 模型,我们与 LTX-Video [13] 和 Wan2.1 [45] 进行比较。在自回归家族中,我们评估了不同规模的通用模型,包括 NOVA [10] (0.6B)、SkyReels-V2 [6] (1.3B)、Pyramid Flow [26] (2B) 和 MAGI-1 [11] (4.5B)。为了确保与共享我们基础架构和高效训练设置的模型进行直接比较,我们包含了 1.3B 参数的蒸馏少步生成器 CausVid [57] 和分块式自强制 [23]。最后,为了评估在长序列上的性能,我们与专为长视频生成设计的模型进行比较:LongLive [51]、Self Forcing++ [9]、Rolling Forcing [31]、Infinity-RoPE [53] 和 Context Forcing [7]。

评估指标。我们按照 [7, 23, 51] 在 VBench [24, 59] 上报告性能。为了评估物理一致性,我们使用两个指标。第一个是

第 11 页

Cycle-World 11

表 1:在 VBench 上针对 5 秒和 60 秒视频生成的定量比较。

5 秒视频生成评估得分 ↑ 60 秒视频生成评估得分 ↑ 模型 参数量 总质量 语义 总质量 语义

双向模型

LTX-Video [13] 1.9B 80.00 82.30 70.79 – – – Wan2.1 [45] 1.3B 84.26 85.30 80.09 – – –

自回归模型

SkyReels-V2 [6] 1.3B 82.67 84.70 74.53 70.47 75.30 51.15 MAGI-1 [11] 4.5B 79.18 82.04 67.74 69.87 76.12 44.87 CausVid [57] 1.3B 81.20 84.05 69.80 71.04 76.80 48.01 NOVA [10] 0.6B 80.12 80.39 79.05 65.25 70.25 45.24 Pyramid Flow [26] 2B 81.72 84.74 69.62 – – – 自强制,分块方式 [23] 1.3B 84.31 85.07 81.28 71.86 77.20 50.51

长自回归模型

LongLive [51] 1.3B 83.72 85.42 76.95 82.62 84.53 74.97 Self Forcing++ [9] 1.3B 83.11 83.79 80.37 – – – Rolling Forcing [31] 1.3B 81.22 84.08 69.78 79.31 81.87 67.69 Infinity-RoPE [53] 1.3B 81.79 83.27 75.87 79.99 80.81 74.30 Context Forcing [7] 1.3B 83.44 84.98 77.29 82.45 83.55 76.10 本文方法 1.3B 84.36 86.14 77.25 82.88 84.39 76.86

来自 VideoPhy 基准测试 [1, 2] 的物理常识 (Physical Commonsense, PC),用于衡量对现实世界物理规律的遵循程度。第二个指标是物理对齐与一致性评估 (Physical Alignment and Consistency Evaluation, PACE),这是一种由 Gemini 驱动的“大语言模型即裁判” (LLM-as-a-Judge) 指标。PACE 对视频进行 0 到 100 的评分,基于提示词合规性及以下四个标准对物理幻觉进行惩罚:重力与质量表现、碰撞动力学、运动连续性(避免突然的瞬移或不自然的扭曲)以及长期时间一致性。

4.2 比较结果

VBench 上的定量评估。我们在 VBench 基准测试上,将我们的方法与最先进的双向模型、标准自回归模型以及针对长视频特定的自回归模型进行了全面评估。如表 1 所示,我们评估了短视界(5 秒)和长视界(60 秒)的视频生成,以展示我们的模型对抗生成漂移的鲁棒性。 对于 5 秒生成,我们的模型取得了最高的总分 (Total score) 和质量分 (Quality score),优于 LongLive 和 Self-Forcing 等强基线模型。在极长视界(60 秒)设置下,我们方法的优势变得尤为显著。标准自回归模型在长上下文中遭受灾难性的误差累积;例如,Self-Forcing 的总分从 84.31(5 秒)暴跌至 71.86(60 秒),SkyReels-V2 也从 82.67 降至 70.47。相比之下,我们的方法有效地限制了这种生成漂移,在 60 秒时保持了惊人的总分,并取得了最高的语义得分。这种随时间推移的性能微小退化证实,我们的循环一致性框架成功地保持了生成序列在无限视界下的结构完整性和视觉保真度。 物理一致性评估。为了进一步验证我们的模型是否准确捕捉了视觉世界背后的物理规律,我们评估了

第 12 页

12 Z. Su 等

8K 慢动作白色安达卢西亚种马,凉爽 广角芭蕾舞者,镜面盐湖 晨光,从高山草甸到湖泊 平面,天空至紫色日落

MAGI-1

SkyReels -V2

CausVid

自 强制

LongLive

滚动 强制

Infinity -RoPE

ours

0 秒 30 秒 60 秒 0 秒 30 秒 60 秒

图 3:长视频生成的定性比较。我们将提出的方法与几种基线模型进行了比较。该图展示了两个不同场景在 0、30 和 60 秒时采样的帧。尽管基线方法在长时间跨度下面临主体丢失、严重的结构扭曲或身份变化等问题,但我们的方法在整个 60 秒的持续时间内成功保持了时间一致性、视觉质量和主体身份。

在物理常识(Physical Commonsense, PC)和物理对齐与一致性评估(Physical Alignment and Consistency Evaluation, PACE)指标上对其进行评估。如表 2 所示,我们的方法显著优于所有基线方法,取得了 75.66 的最高平均分。通过强制时间可逆性,我们的模型内在化了因果约束,使其相比标准的自回归预测器,对复杂物理动力学具有更深刻的理解。

定性比较。图 3 可视化了我们的模型与基线模型在 60 秒生成质量上的对比。随着自回归步骤的累积,基线方法表现出严重的结构扭曲、主要主体的丢失以及显著的身份变化。然而,我们的 Cycle-World 框架充当了严格的时间正则器。它始终保留主体的身份,保持清晰的背景细节,并确保从第一帧到最后一帧的时间连续性,将表 1 中观察到的定量韧性转化为引人注目的视觉稳定性。

第 13 页

Cycle-World 13

表 2:物理一致性的定量评估。我们的方法在两项指标上均优于所有基线方法,表明其对复杂物理动力学具有全面的理解。

表 3:所提组件在 VBench 基准上的消融研究。我们评估了训练时间循环损失 ($L_{cycle}$) 和推理时间循环引导在 5 秒视频生成中的单独及协同效应。最佳结果以粗体显示。

| Method | PC | PACE | Avg. | | :— | :— | :— | :— | | Self-Forcing | 55.97 | 78.57 | 67.27 | | LongLive | 61.94 | 78.03 | 69.99 | | RollingForcing | 67.91 | 75.05 | 71.48 | | Infinity-Rope | 60.45 | 78.58 | 69.52 | | Ours | 69.40 | 81.91 | 75.66 |

| Method | Tot. Qual. | Sem. | PC | PACE | | :— | :— | :— | :— | :— | | Baseline | 83.72 | 85.42 | 76.95 | 61.94 | 78.03 | | + CCL | 83.89 | 85.72 | 76.55 | 68.70 | 79.5 | | + CGI | 84.51 | 86.37 | 77.05 | 65.67 | 78.80 | | Cycle-World | 84.36 | 86.14 | 77.25 | 69.40 | 81.91 |

4.3 消融研究

Cycle-World 组件的有效性。为了评估我们提出的模块的贡献,我们对视觉质量和物理一致性进行了消融研究。表 3 报告了 5 秒视频生成的定量指标,而图 4 展示了 30 秒长视域下的定性稳定性。

短视域生成中的定量协同效应。如表 3 所示,Baseline 在 VBench 总分上得分为 83.72,而在 PC 指标上得分为 61.94。添加循环一致性学习(+ CCL)提供了学习到的参数先验。虽然它在一般视觉指标上有所提升,但其主要益处在于物理一致性,使 PC 提高了近 7 分。这表明惩罚反向预测误差将因果约束嵌入到了生成器中。相反,仅在推理期间应用运行时校正器(+ CGI)作为一种针对视觉退化的实例级正则化器,实现了最高的 VBench 质量和总分。然而,仅依赖基于梯度的推理优化而没有学习到的参数物理先验,会导致物理一致性次优。

完整的 Cycle-World 模型结合了这两种机制。虽然其一般 VBench 分数略低于仅使用 CGI 的变体,但它在物理一致性方面取得了最高性能。这种组合策略确保了生成的视频既保持视觉质量又保持物理准确性。

长视域生成中的定性结果。当将生成扩展到 30 秒时(图 4),这种组合的好处更加明显。在长视域合成中,Baseline 表现出快速的轨迹漂移和背景退化。+CCL 变体保留了核心结构身份,但在扩展的自回归步骤中难以抑制高频时间伪影。+CGI 变体在局部保持了美学连贯性,但由于缺乏内在因果先验,最终偏离了物理流形。完整的 Cycle-World 模型结合了这些优势。通过使用 CCL 来

第 14 页

14 Z. Su 等

32岁咖啡师在明亮现代的咖啡馆中培训两名学员,拉花,动作流畅,流体逼真,无穿模。

无循环 约束

有循环 损失

有循环 引导

循环 世界

图 4:所提出的 Cycle-World 组件的定性消融研究。 我们比较了不同模型变体的视觉质量和时间一致性。 虽然训练循环损失 ($L_{cycle}$) 为结构稳定性建立了稳健的参数基础,而运行时校正器作为对抗时间伪影的主动防护机制,两者的结合实现了强大的双阶段协同效应。完整的 Cycle-World 模型有效防止了轨迹漂移和背景退化,在长视频生成中取得了优越的结果。

使初始前向提议保持在可逆流形附近,运行时校正器 (CGI) 执行更准确的潜在变量细化。该方法消除了空间扭曲和时间身份偏移,生成了视觉上稳定且符合物理规律的长视频。

5 结论

在本文中,我们提出了 Cycle-World,这是一种新颖的自回归视频生成框架,旨在解决长视界合成中普遍存在的无约束生成漂移问题。基于前向预测误差可以通过强制时间可逆性来严格限制的理论见解,我们提出了一种统一的策略,在训练和推理阶段均保持因果一致性。在训练阶段,我们在分布匹配蒸馏 (DMD) 目标之外引入了反向预测循环损失。这明确地将因果约束嵌入到生成器的参数权重中,为结构稳定的帧生成奠定了坚实的基础。在推理阶段,我们将冻结的反向模型重新用作完全可微的运行时校正器。通过利用基于梯度的循环引导,该机制作为一种主动的、实例级的防护手段,在分布外轨迹漂移和时间伪影累积之前动态地将其剔除。在 VBench 基准上的大量实验表明,这种双阶段协同效应有效地防止了通常在长期自回归生成中观察到的结构崩溃和美学退化。因此,Cycle-World 在生成高度一致、平滑且高保真的 60 秒视频方面达到了最先进 (SOTA) 的性能。

第 15 页

Cycle-World 15

致谢

本研究得到了国家自然科学基金(项目编号:62302297, 625B2115, 62272447, 62472285, 72192821, 62472285)以及中央高校基本科研业务费专项资金(项目编号:YG2023QNB17, YG2024QNA44)的支持。 [致陶教授] 本项目由新加坡国家研究基金会(National Research Foundation, Singapore)在其 NRF 教授奖(NRF Professorship Award,编号:NRF-P2024-001)的支持下开展。

参考文献

1. Bansal, H., Lin, Z., Xie, T., Zong, Z., Yarom, M., Bitton, Y., Jiang, C., Sun, Y., Chang, K.W., Grover, A.: Videophy: Evaluating physical commonsense for video generation. arXiv preprint arXiv:2406.03520 (2024) 11, 23 2. Bansal, H., Peng, C., Bitton, Y., Goldenberg, R., Grover, A., Chang, K.W.: Videophy-2: A challenging action-centric physical commonsense evaluation in video generation. arXiv preprint arXiv:2503.06800 (2025) 11, 23 3. Blattmann, A., Rombach, R., Ling, H., Dockhorn, T., Kim, S.W., Fidler, S., Kreis, K.: Align your latents: High-resolution video synthesis with latent diffusion mod- els. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 22563–22575 (2023) 4 4. Cai, Y., Zhang, H., Chen, X., Xing, J., Hu, Y., Zhou, Y., Zhang, K., Zhang, Z., Kim, S.Y., Wang, T., Zhang, Y., Yang, X., Lin, Z., Yuille, A.: Omnivcus: Feedfor- ward subject-driven video customization with multimodal control conditions. In: Belgrave, D., Zhang, C., Lin, H., Pascanu, R., Koniusz, P., Ghassemi, M., Chen, N. (eds.) Advances in Neural Information Processing Systems. vol. 38, pp. 115404– 115423. Curran Associates, Inc. (2025), https://proceedings.neurips.cc/ paper_files/paper/2025/file/a79054a9da91d73ed3cb1a9e87d7cd2d- Paper- Conference.pdf 4 5. Chen, B., Martí Monsó, D., Du, Y., Simchowitz, M., Tedrake, R., Sitzmann, V.: Diffusion forcing: Next-token prediction meets full-sequence diffusion. Advances in Neural Information Processing Systems 37, 24081–24125 (2024) 2, 4, 22 6. Chen, G., Lin, D., Yang, J., Lin, C., Zhu, J., Fan, M., Zhang, H., Chen, S., Chen, Z., Ma, C., et al.: Skyreels-v2: Infinite-length film generative model. arXiv preprint arXiv:2504.13074 (2025) 4, 10, 11 7. Chen, S., Wei, C., Sun, S., Nie, P., Zhou, K., Zhang, G., Yang, M.H., Chen, W.: Context forcing: Consistent autoregressive video generation with long context. arXiv preprint arXiv:2602.06028 (2026) 10, 11 8. Chen, X., Wang, Y., Zhang, L., Zhuang, S., Ma, X., Yu, J., Wang, Y., Lin, D., Qiao, Y., Liu, Z.: Seine: Short-to-long video diffusion model for generative transition and prediction. In: The Twelfth International Conference on Learning Representations (2023) 4 9. Cui, J., Wu, J., Li, M., Yang, T., Li, X., Wang, R., Bai, A., Ban, Y., Hsieh, C.J.: Self-forcing++: Towards minute-scale high-quality video generation. arXiv preprint arXiv:2510.02283 (2025) 10, 11 10. Deng, H., Pan, T., Diao, H., Luo, Z., Cui, Y., Lu, H., Shan, S., Qi, Y., Wang, X.: Autoregressive video generation without vector quantization. arXiv preprint arXiv:2412.14169 (2024) 4, 10, 11

第 16 页

16 Z. Su 等人

11. Dobrosotskaya, I.Y., James, G.L.: Magi-1 与 β-catenin 相互作用并与细胞间粘附结构相关。《生物化学与生物物理研究通讯》270(3), 903–909 (2000) 4, 10, 11 12. Gao, Y., Guo, H., Hoang, T., Huang, W., Jiang, L., Kong, F., Li, H., Li, J., Li, L., Li, X., 等: Seedance 1.0:探索视频生成模型的边界。arXiv 预印本 arXiv:2506.09113 (2025) 1 13. HaCohen, Y., Chiprut, N., Brazowski, B., Shalem, D., Moshe, D., Richardson, E., Levin, E., Shiran, G., Zabari, N., Gordon, O., Panet, P., Weissbuch, S., Kulikov, V., Bitterman, Y., Melumian, Z., Bibi, O.: Ltx-video:实时视频潜在扩散模型。arXiv 预印本 arXiv:2501.00103 (2024) 10, 11 14. Ho, J., Jain, A., Abbeel, P.: 去噪扩散概率模型。《神经信息处理系统进展》33, 6840–6851 (2020) 4 15. Hong, W., Ding, M., Zheng, W., Liu, X., Tang, J.: Cogvideo:通过 Transformer 进行文本到视频生成的规模化预训练。arXiv 预印本 arXiv:2205.15868 (2022) 4 16. Hou, S., Wang, C., Zhuang, W., Chen, Y., Wang, Y., Bao, H., Chai, J., Xu, W.: 用于多主体运动建模与生成的因果卷积神经网络。《计算视觉媒体》10(1), 45–59 (2024)。https://doi.org/10.1007/s41095-022-0307-3 2 17. Hu, T., Lu, M., Wang, Y., Zhang, J., Hao, J., Pan, Y., Yi, R., Ma, L., Tao, D.: Metaworld:从单视图视频数据扩展多代理视频世界模型 (2026),https://arxiv.org/abs/2606.02753 2 18. Hu, T., Yu, Z., Zhang, G., Su, Z., Zhou, Z., Zhang, Y., Zhou, Y., Lu, Q., Yi, R.: Harmony:通过跨任务协同协调音频和视频生成。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。pp. 16085–16095 (2026 年 6 月) 4 19. Hu, T., Yu, Z., Zhou, Z., Liang, S., Zhou, Y., Lin, Q., Lu, Q.: Hunyuancustom:一种用于定制视频生成的多模态驱动架构 (2025),https://arxiv.org/abs/2505.04512 4 20. Hu, T., Yu, Z., Zhou, Z., Zhang, J., Zhou, Y., Lu, Q., Yi, R.: Polyvivid:通过跨模态交互与增强实现生动的多主体视频生成。在:Belgrave, D., Zhang, C., Lin, H., Pascanu, R., Koniusz, P., Ghassemi, M., Chen, N. (编) 《神经信息处理系统进展》。卷 38, pp. 49394–49420。Curran Associates, Inc. (2025),https://proceedings.neurips.cc/paper_files/paper/2025/file/4683beb6bab325650db13afd05d1a14a-Paper-Conference.pdf 4 21. Hu, T., Zhang, J., Huang, H., Yi, R., Su, Z., Weng, J., Xue, Z., Ma, L., Yang, M.H., Tao, D.: 视频生成基础模型的演进 (2026),https://arxiv.org/abs/2604.06339 4 22. Hu, T., Zhang, J., Su, Z., Yi, R.: Ultragen:具有分层注意力的高分辨率视频生成 (2025),https://arxiv.org/abs/2510.18775 4 23. Huang, X., Li, Z., He, G., Zhou, M., Shechtman, E.: Self forcing:弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009 (2025) 2, 4, 6, 10, 11, 22 24. Huang, Z., He, Y., Yu, J., Zhang, F., Si, C., Jiang, Y., Zhang, Y., Wu, T., Jin, Q., Chanpaisit, N., Wang, Y., Chen, X., Wang, L., Lin, D., Qiao, Y., Liu, Z.: VBench:视频生成模型的全面基准测试套件。在:IEEE/CVF 计算机视觉与模式识别会议论文集 (2024) 10

第 17 页

Cycle-World 17

25. HunyuanWorld, T.: Hy-world 1.5: A systematic framework for interactive world modeling with real-time latency and geometric consistency. arXiv preprint (2025) 2 26. Jin, Y., Sun, Z., Li, N., Xu, K., Jiang, H., Zhuang, N., Huang, Q., Song, Y., Mu, Y., Lin, Z.: Pyramidal flow matching for efficient video generative modeling. arXiv preprint arXiv:2410.05954 (2024) 4, 10, 11 27. Karacan, L., Sarıgül, M.: Full-frame video stabilization via spatiotemporal trans- formers. Computational Visual Media 11(3), 655–667 (2025). https://doi.org/ 10.26599/CVM.2025.9450416 4 28. Kondratyuk, D., Yu, L., Gu, X., Lezama, J., Huang, J., Schindler, G., Hornung, R., Birodkar, V., Yan, J., Chiu, M.C., et al.: Videopoet: A large language model for zero-shot video generation. arXiv preprint arXiv:2312.14125 (2023) 4 29. Kong, W., Tian, Q., Zhang, Z., Min, R., Dai, Z., Zhou, J., Xiong, J., Li, X., Wu, B., Zhang, J., et al.: Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:2412.03603 (2024) 2, 4 30. Liu, K., Zheng, Y., Wang, K., Wu, S., Zhang, R., Luo, J., Hatzinakos, D., Liu, Z., Fei, H., Chua, T.S.: Javisdit++: Unified modeling and optimization for joint audio-video generation. In: The Fourteenth International Conference on Learning Representations (2026) 4 31. Liu, K., Hu, W., Xu, J., Shan, Y., Lu, S.: Rolling forcing: Autoregressive long video diffusion in real time. arXiv preprint arXiv:2509.25161 (2025) 10, 11 32. Liu, Y., Zhao, H., Chan, K.C.K., Wang, X., Loy, C.C., Qiao, Y., Dong, C.: Temporally consistent video colorization with deep feature propagation and self-regularization learning. Computational Visual Media 10(2), 375–395 (2024). https://doi.org/10.1007/s41095-023-0342-8 4 33. Low, C., Wang, W., Katyal, C.: Ovi: Twin backbone cross-modal fusion for audio- video generation (2025), https://arxiv.org/abs/2510.01284 4 34. Mao, X., Li, Z., Li, C., Xu, X., Ying, K., He, T., Pang, J., Qiao, Y., Zhang, K.: Yume-1.5: A text-controlled interactive world generation model. arXiv preprint arXiv:2512.22096 (2025) 2 35. Nichol, A.Q., Dhariwal, P.: Improved denoising diffusion probabilistic models. In: International conference on machine learning. pp. 8162–8171. PMLR (2021) 4 36. OpenAI: Sora. https://openai.com/sora (2024) 1 37. OpenAI: Sora 2. https://openai.com/index/sora-2/ (2025) 1 38. Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 4195–4205 (2023) 4 39. Qiu, H., Xia, M., Zhang, Y., He, Y., Wang, X., Shan, Y., Liu, Z.: Freenoise: Tuning- free longer video diffusion via noise rescheduling. arXiv preprint arXiv:2310.15169 (2023) 4 40. Rasul, K., Seward, C., Schuster, I., Vollgraf, R.: Autoregressive denoising diffu- sion models for multivariate probabilistic time series forecasting. In: International conference on machine learning. pp. 8857–8868. PMLR (2021) 4 41. Seed, B.: Seedance 2.0. https://seed.bytedance.com/en/seedance2_0 (2026) 1 42. Skywork AI Matrix-Game Team: Matrix-game 3.0: Real-time and streaming inter- active world model with long-horizon memory. Technical report (2026), https: //github.com/SkyworkAI/Matrix-Game/blob/main/Matrix-Game-3/assets/ pdf/report.pdf 2 43. Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020) 4

第 18 页

18 Z. Su 等人

44. Technology, K.: Kling. https://kling.kuaishou.com/ (2025) 2 45. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J., 等: Wan: 开放且先进的大规模视频生成模型。 arXiv 预印本 arXiv:2503.20314 (2025) 2, 4, 10, 11, 22 46. Wang, D., Zuo, W., Li, A., Chen, L.H., Liao, X., Zhou, D., Yin, Z., Dai, X., Jiang, D., Yu, G.: Universe-1: 通过拼接专家实现统一的音视频生成。 arXiv 预印本 arXiv:2509.06155 (2025) 4 47. Wang, F.Y., Chen, W., Song, G., Ye, H.J., Liu, Y., Li, H.: Gen-l-video: 通过时间协同去噪实现多文本到长视频生成。arXiv 预印本 arXiv:2305.18264 (2023) 4 48. Wang, H., Ma, C.Y., Liu, Y.C., Hou, J., Xu, T., Wang, J., Juefei-Xu, F., Luo, Y., Zhang, P., Hou, T., 等: Lingen: 迈向具有线性计算复杂度的高分辨率分钟级文本到视频生成。在: 计算机视觉与模式识别会议论文集。第 2578–2588 页 (2025) 4 49. Wang, W., Yang, Y.: Vidprom: 面向文本到视频扩散模型的百万级真实提示图库数据集 (2024), https://openreview.net/forum?id=pYNl76onJL 22 50. Williams, R.J., Zipser, D.: 一种用于持续运行的全递归神经网络的算法。《神经计算》1(2), 270–280 (1989) 4 51. Yang, S., Huang, W., Chu, R., Xiao, Y., Zhao, Y., Wang, X., Li, M., Xie, E., Chen, Y., Lu, Y., 等: Longlive: 实时交互式长视频生成。 arXiv 预印本 arXiv:2509.22622 (2025) 2, 4, 10, 11, 22 52. Yang, Z., Teng, J., Zheng, W., Ding, M., Huang, S., Xu, J., Yang, Y., Hong, W., Zhang, X., Feng, G., 等: Cogvideox: 基于专家 Transformer 的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072 (2024) 4 53. Yesiltepe, H., Meral, T.H.S., Akan, A.K., Oktay, K., Yanardag, P.: Infinity-rope: 动作可控的无限视频生成源于自回归自展开。arXiv 预印本 arXiv:2511.20649 (2025) 10, 11 54. Yin, S., Wu, C., Yang, H., Wang, J., Wang, X., Ni, M., Yang, Z., Li, L., Liu, S., Yang, F., 等: Nuwa-xl: 扩散之上的扩散用于极长视频生成。在: 第 61 届计算语言学协会年会论文集(第 1 卷:长论文)。第 1309–1320 页 (2023) 4 55. Yin, T., Gharbi, M., Park, T., Zhang, R., Shechtman, E., Durand, F., Freeman, B.: 改进的分布匹配蒸馏以实现快速图像合成。《神经信息处理系统进展》37, 47455–47487 (2024) 4 56. Yin, T., Gharbi, M., Zhang, R., Shechtman, E., Durand, F., Freeman, W.T., Park, T.: 基于分布匹配蒸馏的一步扩散。在: IEEE/CVF 计算机视觉与模式识别会议论文集。第 6613– 6623 页 (2024) 4 57. Yin, T., Zhang, Q., Zhang, R., Freeman, W.T., Durand, F., Shechtman, E., Huang, X.: 从缓慢的双向到快速的自回归视频扩散模型。在: IEEE/CVF 计算机视觉与模式识别会议论文集。第 22963–22974 页 (2025) 2, 4, 10, 11, 22 58. Zhang, G., Zhou, Z., Hu, T., Peng, Z., Zhang, Y., Chen, Y., Zhou, Y., Lu, Q., Wang, L.: Uniavgen: 具有非对称跨模态交互的统一音视频生成。在: IEEE/CVF 计算机视觉与模式识别会议论文集。第 1950–1960 页 (2026) 4 59. Zheng, D., Huang, Z., Liu, H., Zou, K., He, Y., Zhang, F., Zhang, Y., He, J., Zheng, W.S., Qiao, Y., Liu, Z.: VBench-2.0: 推进视频生成基准测试套件以增强内在忠实度。arXiv 预印本 arXiv:2503.21755 (2025) 10

第 19 页

Cycle-World 19

60. Zheng, Z., Peng, X., Yang, T., Shen, C., Li, S., Liu, H., Zhou, Y., Li, T., You, Y.: Open-sora: Democratizing efficient video production for all. arXiv preprint arXiv:2412.20404 (2024) 4 61. Zhu, H., Zhao, M., He, G., Su, H., Li, C., Zhu, J.: Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video genera- tion. arXiv preprint arXiv:2602.02214 (2026) 2 62. Zhu, J.Y., Park, T., Isola, P., Efros, A.A.: Unpaired image-to-image translation using cycle-consistent adversarial networks. In: Proceedings of the IEEE interna- tional conference on computer vision. pp. 2223–2232 (2017) 29

第 20 页

20 Z. Su 等

A 概述

本补充材料提供了进一步的理论推导、算法细节、严谨的实验设置以及广泛的定性和定量评估,以全面支持主论文中提出的主张。本文档的逻辑结构如下:

– 第 B 节提供了主文中建立的理论界限(定理 1、推论 1 和命题 1)的详细数学证明。 – 第 C 节提供了我们提出的零样本循环引导推理(Cycle-Guided Inference, CGI)策略的完整伪代码及逐步分解。 – 第 D 节概述了全面的实现细节,包括数据准备、模型构建和超参数配置。 – 第 E 节详细说明了用于我们的物理一致性评估指标(Physical Consistency, PC 和 PACE)的准确定义和提示模板。 – 第 F 节提供了在具有挑战性的 60 秒视频生成任务上的扩展定量比较和消融研究。 – 第 G.1 和 G.2 节展示了额外的定性比较,突出了 Cycle-World 在交互式生成和单提示扩展合成中的鲁棒性。 – 第 I 节对关键训练和推理超参数进行了彻底的敏感性分析。 – 第 J 节进一步验证了 CGI 在标准仅前向基线模型上的即插即用可扩展性。 – 第 K 节阐明了我们的时间循环一致性框架与传统空间循环一致性模型之间的根本区别。 – 第 L 节以严谨的讨论结束,探讨了 Cycle-World 框架的理论边界及其在其他序列模态中的更广泛应用性。

B 理论界限的详细证明

本节提供了主论文中建立的理论主张的完整数学推导。我们依赖于生成漂移 $e_n = \|\hat{z}_n – z_n\|$ 和单步循环一致性距离 $d^{(n)}_{\text{cycle}} = \|\hat{z}_{n-1} – R_\phi(\hat{z}_n)\|$ 的定义。

B.1 定理 1(循环有界漂移)的证明

证明。将反向利普希茨条件(假设 2)应用于生成状态 $\hat{z}_n$ 和真实状态 $z_n$,我们有:

$e_n = \left\| \hat{z}_n – z_n \right\| \le C \left\| R_\phi(\hat{z}_n) – R_\phi(z_n) \right\|$

第 21 页

Cycle-World 21

通过对右侧范数内同时加上/减去生成历史 $\hat{z}_{n-1}$ 和真实历史 $z_{n-1}$,并应用三角不等式,我们得到:

$$ e_n \leq C \left( \left| R_\phi(\hat{z}_n) – \hat{z}_{n-1} \right| + \left| \hat{z}_{n-1} – z_{n-1} \right| + \left| z_{n-1} – R_\phi(z_n) \right| \right) $$

代入循环一致性距离 $d_{\text{cycle}}^{(n)}$、上一步的生成漂移 $e_{n-1}$ 以及固有反向近似误差 $\epsilon_R$(假设 1)的定义,可得步长递推式:

$$ e_n \leq C \left( d_{\text{cycle}}^{(n)} + e_{n-1} + \epsilon_R \right) $$

B.2 推论 1 的证明(长视界误差界)

证明。从定理 1 出发,递归代入 $e_{n-1}$ 的递推关系:

$$ \begin{aligned} e_n &\leq C e_{n-1} + C \left( d_{\text{cycle}}^{(n)} + \epsilon_R \right) \\ &\leq C \left( C e_{n-2} + d_{\text{cycle}}^{(n-1)} + \epsilon_R \right) + C \left( d_{\text{cycle}}^{(n)} + \epsilon_R \right) \\ &= C^2 e_{n-2} + C \left( d_{\text{cycle}}^{(n-1)} + \epsilon_R \right) + C \left( d_{\text{cycle}}^{(n)} + \epsilon_R \right) \end{aligned} $$

将此展开继续向下递推至初始条件 $e_0$,可得求和式: $$ e_n \leq C^n e_0 + \sum_{i=1}^n C^{n-i+1} d_{\text{cycle}}^{(i)} + \epsilon_R \left( \frac{C^n – 1}{C – 1} \right) $$ 提取最大局部损失 $\delta_{\text{cycle}}$,可将其解析为主文本公式 2 中的封闭形式几何表达式。

B.3 命题 1 的证明(相对于无约束基线的理论优势)

证明。将推论 1 应用于两条生成流水线,它们各自的漂移极限分别为:

$$ \begin{aligned} E_n^{\text{unc}} &= C^n e_0 + (\delta_{\text{unc}} + \epsilon_R) \frac{C^n – 1}{C – 1} \\ E_n^{\text{ours}} &= C^n e_0 + (\delta_{\text{cycle}} + \epsilon_R) \frac{C^n – 1}{C – 1} \end{aligned} $$

从 $E_n^{\text{unc}}$ 中减去 $E_n^{\text{ours}}$ 立即得到减少量间隙:

$$ \Delta E_n = (\delta_{\text{unc}} – \delta_{\text{cycle}}) \frac{C^n – 1}{C – 1} $$

由于 $\delta_{\text{unc}} > \delta_{\text{cycle}}$ 且 $C \neq 1$,显然有 $\Delta E_n > 0$。

第 22 页

22 Z. Su 等

C 循环引导推理算法

正如主稿所述,循环引导推理(CGI)是一种零样本、无需训练的潜在优化策略,旨在冻结的基础模型中强制实现时间可逆性。算法 1 提供了该过程的完整逐步伪代码。

具体而言,在自回归扩散循环内的指定优化窗口 $[T_{start}, T_{end}]$ 期间,CGI 使用冻结的反向校正器 $R_\phi$ 计算欧几里得循环差异 $D$。由于反向重建在潜在空间中是完全可微的,$D$ 的梯度被迭代反向传播,以主动细化中间噪声潜在变量 $z_{n,t}$。这种运行时校正充当结构瓶颈,在最终潜在变量永久提交到历史上下文缓冲区之前,剪除非物理伪影。

D 实现细节

在本节中,我们提供了所提出框架的全面实现细节,涵盖数据集准备、模型配置、训练策略和超参数设置。

数据准备。在扩散强制 [5] 过程的常微分方程(ODE)初始化阶段,真实 ODE 潜在变量通过 CausVid [57] 提供的 Wan2.1 14B 模型 [45] 获取。对于随后的 DMD 训练阶段,我们使用经过过滤和增强的 VidProM [23,49] 提示数据集。

反向模型构建。反向预测模型从预训练的 Wan2.1 1.3B 模型初始化。在 ODE 初始化阶段,我们对正向视频的时间潜在轨迹进行时间翻转,以初始化反向模型。随后,利用自强制范式对模型进行训练。我们实现的一个关键效率在于,在训练期间,我们简单地沿时间维度反转流式潜在输出。这一优雅的操作使我们能够直接重用双向 Wan 模型——该模型原本用于正向预测模型——同时作为教师模型和判别器,从而消除了训练专用反向教师模型的昂贵计算成本。

正向模型微调。正向生成器基于预训练的 LongLive [51] 框架构建。我们针对 60 秒视频序列调整流式长程微调 [51],其中每个序列包含一次提示切换,以鼓励动态上下文转换。正向模型使用低秩自适应(LoRA)在 LongLive 权重上进行微调。训练过程总共持续 3,000 次迭代,批量大小为 4。

超参数配置。在联合训练阶段,循环一致性损失($\lambda$)的权重经验性地设置为 0.1。在推理阶段,循环引导应用于所有去噪时间步。对于运行时校正器,我们将每个时间步的优化迭代次数设置为

第 23 页

Cycle-World 23

K = 1,优化步长为 η = 10。所有其他未提及的架构和优化超参数均严格遵循 LongLive 的默认配置。

E 物理一致性评估指标

为了严格评估生成视频的物理真实性,我们使用了两个互补的指标:物理常识(Physical Commonsense, PC)和物理对齐与一致性评估(Physical Alignment and Consistency Evaluation, PACE)。我们从 VideoPhy [1, 2] 提示集中随机采样 150 个提示,以合成我们评估协议所需的测试视频。对于 5 秒短视频的短视域评估,指标直接在整个片段上计算。对于 60 秒长视频的长视域评估,我们将每个生成的序列划分为不重叠的 5 秒片段,并随机采样每个视频中的三个不同片段进行评估。

物理常识(PC)。PC 指标采用 VideoPhy 基准测试中引入的自动评分模型,该模型为每个视频片段分配 1 到 5 的离散物理一致性分数。为了建立物理真实性的严格基线,我们将最终 PC 分数定义为获得 4 分或更高分数的评估片段所占的百分比。

物理对齐与一致性评估(PACE)。为了获得对复杂物理动态的细粒度、与人类判断一致的评估,我们引入了 PACE,这是一种基于多模态大语言模型作为裁判(Multimodal-LLM-as-a-Judge)的指标。我们利用 Gemini 模型根据专用提示对视频进行评估。该模型被指示充当专家评估者,并输出 0 到 100 的综合分数。评估通过仔细检查基本提示合规性以及四个核心物理维度来明确惩罚物理幻觉:重力与质量的真实表现、碰撞的自然动力学、运动连续性(避免突然的瞬移或不自然的扭曲)以及长期时间一致性。为了便于自动解析,模型被限制为严格以 JSON 格式返回评估结果。提供给模型的确切提示模板如下:

作为一名视频质量评估和物理领域的专家,请根据以下标准评估提供的视频:(1) 提示合规性:视频内容是否严格遵循预期的动作和描述?(2) 物理一致性:视频是否符合现实世界的物理定律?注意重力和重量(物体下落或移动时是否具有 realistic mass?),碰撞(物体间的交互是否看起来自然?),运动连续性(是否有突然的瞬移或不自然的扭曲?),以及时间一致性(场景随时间推移是否保持一致?)。请给出 0 到 100 的分数,并简要说明评分理由。请严格以包含 'score' 和 'reason' 键的 JSON 格式返回结果。

第 24 页

24 Z. Su 等

F 物理一致性扩展评估

为了全面验证我们提出的框架在极长序列中的有效性,我们首先针对 60 秒视频生成任务,展示了扩展的定量比较和消融研究。

表 S1:60 秒视频生成中物理一致性的定量比较。

方法 PC PACE 平均

Self Forcing 65.67 49.96 57.82 LongLive 59.45 75.71 67.58 Rolling Forcing 61.69 74.59 68.14 Infinity-RoPE 63.18 72.77 67.98 ours 70.90 75.42 73.16

长视界物理一致性优势。为了评估我们的方法在扩展序列上的鲁棒性,我们在 60 秒生成任务中将我们的物理一致性与最先进基线进行了比较,详见表 S1。结果表明,像 Self Forcing 这样的标准自回归方法难以随时间处理复杂的物理动力学,尽管保持了中等水平的物理常识得分,但其 PACE 得分极低,仅为 49.96。虽然 LongLive 和 Rolling Forcing 等长上下文模型提高了 PACE,但其整体物理一致性仍局限于平均约 68 的水平。我们的方法有效地协调了提示遵循与现实物理定律,取得了最高的平均得分 73.16。这种优势证实,强制时间可逆性是防止极长视频中物理幻觉的关键机制。

表 S2:60 秒视频生成中物理一致性的消融研究。

方法 PC PACE 平均

基线 59.45 75.71 67.58 + CCL 70.40 74.94 72.67 + CGI 62.77 76.67 69.72 ours (Cycle-World) 70.90 75.42 73.16

循环约束的协同效应。60 秒消融研究揭示了所提出模块的独特且互补的作用。基线模型在长视界上表现出明显的失衡,保持了相对较高的 PACE 得分 75.71,但在基础物理常识方面表现不佳,这由较低的 PC 得分 59.45 所证明。引入

第 25 页

Cycle-World 25

5s 15s 25s 35s 45s 55s

LongLive

Infinity -RoPE

Ours

LongLive

Infinity -RoPE

Ours

图 S1:在 60 秒时间跨度上的交互式长视频生成定性比较。文本提示每 10 秒动态更新。Cycle-World 在保持严格身份和背景一致性的同时无缝插值新指令,而基线模型则遭受严重的物理幻觉和突兀的过渡。

训练阶段的循环一致性学习(CCL)立即提供了稳健的参数基础,将物理常识(PC)分数大幅提升至 70.40,尽管物理对齐与一致性评估(PACE)分数略有下降至 74.94。这表明参数先验有效地强制执行了刚性的结构规律,但可能略微限制了不受约束的动态方差。相反,仅应用循环引导推理(CGI)主要将高 PACE 指标保持在 76.67,但 PC 分数仅微幅提升至 62.77,这表明在没有学习到的物理先验的情况下,运行时优化不足以从根本上纠正结构性的物理违规。完整模型整合了这两种机制,实现了强大的双阶段协同效应,将 PC 分数最大化至 70.90,并将 PACE 分数恢复至 75.42,从而达到了 73.16 的最高整体平均性能。

G 更多定性比较

G.1 交互式长视频生成

除了连续预测外,真正的视频世界模型必须支持交互式、开放式的生成,允许用户基于共享的历史上下文动态改变未来的轨迹。然而,在自回归生成过程中动态更改文本条件往往会加剧标准模型中的结构崩溃,因为突然的语义变化破坏了原本脆弱的时序连续性。

第 26 页

26 Z. Su 等

利用 Cycle-World 框架提供的稳健物理基础,我们在 60 秒的时间跨度内评估了其在交互式生成场景中的性能,其中文本提示每 10 秒更新一次。在这种极具挑战性的设置下,Infinity-RoPE 和 LongLive 等标准基线模型表现显著不佳。当面临语义变化或主体大规模移动时,这些模型经常表现出突兀且不自然的场景转换。此外,它们还遭受严重的身份退化和物理幻觉,例如背景物体和角色突然消失或出现。 如图 S1 所示,Cycle-World 表现出卓越的适应性和结构韧性。运行时循环判别器明确惩罚物理上不可能的转换,确保尽管语义分支发生变化,背景保持稳定且主体身份得到严格保留。与在提示变化时幻觉出全新实体的仅前向基线不同,我们的模型在保持严格时间可逆性的同时,无缝插值了新指令所需的流体动力学。这表明,强制循环一致性建立了一个高度稳健的潜在流形,为开放式世界模拟解锁了稳定和交互式控制。

G.2 单提示长视频生成

为了进一步展示我们框架的鲁棒性,我们在 60 秒单提示生成设置下,将 Cycle-World 与最先进的长视频自回归模型(即 LongLive、Infinity-RoPE 和 Rolling Forcing)进行了比较。在没有中间文本指导的情况下生成长序列,暴露了现有方法随时间推移的关键脆弱性。 如图 S2 所示,LongLive 遭受物理幻觉,包括不存在的主体自发显现和不自然的物体相互穿透(结构裁剪)。Infinity-RoPE 虽然试图保持结构连贯性,但表现出显著退化的运动动力学,并且无法在长时间内保持主体一致性。同样,Rolling Forcing 表现出有限的动态范围,并倾向于幻觉出突兀的、脱离上下文的实体。 与之形成鲜明对比的是,我们的 Cycle-World 框架成功地在视觉一致性和丰富的运动动力学之间实现了最佳平衡。通过严格执行时间可逆性,我们的模型防止了不受约束的生成漂移。它确保了在整个 60 秒的持续时间内,主要主体、背景完整性和自然物理交互得以保留,同时没有牺牲生成运动的幅度和真实性。

H 更多定性结果

我们在图 S3 中提供了额外的定性结果,以展示 Cycle-World 在不同场景和复杂物理运动中的多功能性和高视觉保真度。这些例子进一步证实了我们循环一致性

第 27 页

Cycle-World 27

红狐狸在阳光照耀的金黄色森林中嬉戏地追逐着秋叶,充满活力与生机,采用中景跟踪镜头。

LongLive

Infinity- RoPE

Rolling Forcing

Ours

两名身穿白色宇航服宇航员探索着拥有紫色沙丘和发光植物的外星星球,呈现未来感的太空动画风格。

LongLive

Infinity- RoPE

Rolling Forcing

Ours

图 S2:60 秒单提示词视频生成的定性比较。与 LongLive、Infinity-RoPE 和 Rolling Forcing 相比,我们的方法有效防止了物体相互穿透和幻觉伪影,在长期视觉一致性与丰富的运动动态之间实现了最佳平衡。

框架。通过内在地限制自回归预测误差,Cycle-World 能够针对各种开放域提示词,生成高度稳定、结构合理且具美学吸引力的长时域视频模拟。

I 超参数分析

我们分析了框架中的关键超参数,以理解它们对视觉质量与物理一致性之间权衡的影响。具体而言,我们考察了训练循环损失权重,以及推理循环引导的时间分布和步长。

第 28 页

28 Z. Su 等

表 S3:训练期间循环损失权重的影响(在 5 秒生成上评估)。

权重 (λ) 总质量 语义 PC PACE

0.2 82.89 84.80 75.27 68.66 75.80 0.1 84.05 85.83 76.93 64.18 79.04 0.05 84.47 86.56 76.13 56.72 76.53

表 S3 展示了训练期间循环损失权重对 5 秒视频生成的影响。结果表明,美学质量与结构遵循之间存在权衡。较低的权重 0.05 提高了视觉和语义得分,但导致物理常识(Physical Commonsense)急剧下降至 56.72。这表明模型难以保持在物理流形上。较高的权重 0.2 强制执行严格的循环一致性,并将 PC 得分提高至 68.66。然而,这种正则化惩罚了视觉保真度,将总 VBench 得分降低至 82.89。权重 0.1 平衡了这些方面,在保持具有竞争力的视频质量的同时,获得了最高的 PACE 得分 79.04。

表 S4:推理期间优化步骤时间分布的影响。

优化策略 总质量 语义 PC PACE

在所有 4 个时间步上各 1 步 84.36 86.14 77.25 69.40 81.91 在前 2 个时间步上各 2 步 84.22 85.89 77.52 69.40 81.77 在第 1 个时间步上 4 步 84.07 85.90 76.78 68.66 76.79

表 S4 详细说明了在推理期间将固定数量的四个优化步骤分布在去噪时间步上的影响。将所有四个步骤集中在初始时间步会导致最弱的性能,特别是将 PACE 得分降低至 76.79。通过在每个时间步应用一个优化步骤来均匀分布步骤,在视觉和物理指标上均取得了最佳结果。沿着生成轨迹的连续梯度引导比早期的孤立干预更有效地维持时间一致性。

表 S5:推理梯度引导步长的敏感性分析。

步长 (η) 总质量 语义 PC PACE

5 84.20 85.86 77.58 68.66 76.79 10 84.36 86.14 77.25 69.40 81.91 15 83.92 85.62 77.12 70.15 82.27

第 29 页

Cycle-World 29

梯度引导步长控制运行时校正器的强度。如表 S5 所示,将步长从 5 增加到 15 稳步提高了模型对物理约束的遵循程度,其中 PC 和 PACE 分别达到 70.15 和 82.27。激进的步长 15 会损害整体生成质量,导致总 VBench 分数和语义 VBench 分数降低。步长 10 提供了最佳配置,在保持物理对齐的同时,不牺牲序列的视觉和语义完整性。

J Cycle-Guided Inference 的即插即用可扩展性

Cycle-Guided Inference (CGI) 的一个实际优势在于其可扩展性。由于运行时校正器使用基于梯度的潜在变量细化,且不改变前向生成器的架构,因此可以直接集成到现有的自回归视频模型中。这种推理策略适用于任何与预训练反向模型处于相同 VAE 潜在空间的前向生成框架。

为了评估这种适应性,我们将冻结的反向预测校正器应用于两个标准的仅前向基线模型 CausVid 和 Self-Forcing。如图 S4 所示,在 60 秒长视界设置下,添加 CGI 始终能提升这两个模型的性能。

定性结果突显了这种集成带来的几项改进。CGI 增强了生成序列的全局时空一致性,在长帧序列中保持主体身份和背景细节。它还纠正了无约束自回归模型中常见的物理异常。例如,在动态追逐场景中,未经修改的基线模型经常生成相对于奔跑主体错误向前移动的背景。通过强制时间可逆性,CGI 模块纠正了这一运动误差,确保背景自然后退。

此外,虽然标准的仅前向模型在长上下文中会受到生成漂移(Generative Drift)的影响,但应用 CGI 可以延缓结构崩溃。通过在每一步自回归步骤中去除累积的伪影,该策略延长了底层基线模型的有效生成长度。这产生了更长、结构稳定的视频序列,而无需对模型进行额外的重新训练。

K 与传统循环一致性的区别

循环一致性概念在计算机视觉中已被广泛探索,最著名的是在非配对图像到图像翻译框架如 CycleGAN [62] 中。这些传统方法引入循环一致性目标,以学习两个不同空间或风格域之间的双射映射。通过确保转换到目标域的图像能够准确重建回其原始域,这些模型有效地绕过了对严格配对训练数据的需求。该约束主要在空间上起作用,侧重于在不同艺术或传感器模态之间保留纹理、几何和结构内容。

第 30 页

30 Z. Su 等

我们的 Cycle-World 框架在其核心目标和操作领域上,与传统应用有着根本性的区别。我们的方法并非在不同视觉域之间进行映射,而是严格在单一连续域的时间轴上强制执行循环一致性。其主要目标不是风格迁移,而是限制长程自回归合成中固有的累积生成漂移(Generative Drift)。我们将循环一致性概念化为一种基本的物理约束,这一概念基于以下观察:有效的自然动力学和因果事件在时间上必须是可逆的。

在功能上,这种区别转化为不同的架构实现。传统框架采用两个对称的跨域空间生成器,而 Cycle-World 将前向自回归生成器与时间反向预测模型配对。这种配置在连续状态之间构建了一个逐步的循环。通过主动最小化历史状态与其从未来状态反向预测的重建之间的差异,我们的方法作为一种内在的物理正则化器。这种时间循环明确惩罚结构幻觉和非物理运动伪影,从而维持长期的因果连贯性,而不仅仅是空间保真度。

L 对一般时间模态的适用性

尽管本研究将 Cycle-World 框架应用于长程视频合成,但其理论公式本质上是模态无关的。通过循环一致性限制自回归漂移的核心机制完全依赖于潜在流形的拓扑属性,而非数据的具体视觉性质。因此,只要底层数据分布严格遵循局部时间可逆性原则,该框架就可以扩展到其他顺序域。

音频生成是该扩展的一个高度兼容的领域。声学信号,无论是语音、音乐还是环境声音,都是受机械定律和时间因果律控制的连续物理波形。当前的自回归音频模型经常经历累积误差,表现为节奏退化、相位偏移或随着上下文延长而逐渐丧失说话人身份。由于声学动力学在其局部时间窗口内保留了短期历史信息,训练反向声学预测器在数学上是适定的。将循环引导推理(Cycle-Guided Inference, CGI)应用于音频潜在空间可以主动纠正这些偏差,确保生成的序列保持在自然的声学流形上,而无需对基础音频模型进行架构更改。

除了感知模态外,循环一致性范式在基于物理环境的通用时间预测任务中也具有巨大潜力。自动驾驶、机器人运动学和分子动力学中的预测模型模拟的空间-时间状态主要受经典力学支配。在这些牛顿系统中,状态转换本质上是时间可逆的。一个有效的未来状态必须包含足够的确定性信息以推导其直接前驱状态。通过利用循环引导作为

第 31 页

作为运行时物理正则化器,预测模型将被迫遵守这些力学约束,从而防止模拟轨迹在长时间跨度内出现无约束的发散。

然而,严格的理论边界限制了该框架在所有自回归任务中的普遍适用性。Cycle-World 的有效性严格依赖于反向可预测性假设。该机制无法推广到高熵、离散或有损的序列过程,其中时间箭头会导致严重的信息坍缩。在抽象文本生成或金融市场预测等领域,状态转换通常表示多对一映射,即多个不同的过去上下文可以收敛到相同的当前状态。在这种宏观不可逆条件下,反向映射从根本上是不适定的,且反向近似误差将违反我们定理成立所需的理论边界。因此,Cycle-World 的适用性被严格限制在连续、基于物理或信息保持的潜在流形上,在这些流形中时间反转在局部仍是确定性的。

第 32 页

32 Z. Su 等.

算法 1 带运行时校正器的循环引导推理

要求:前向生成器 $G_\theta$,反向校正器 $R_\phi$,扩散转移函数 $\Psi$,初始上下文 $\hat{z}_0$,序列长度 $N$,时间步 $\{t_T, \dots, t_1\}$,优化窗口 $[T_{\text{start}}, T_{\text{end}}]$,上下文噪声 $t_{\text{ctx}}$,细化迭代次数 $K$,步长 $\eta$。 确保:生成的视频潜在变量 $\hat{Z} = \{\hat{z}_1, \dots, \hat{z}_N\}$

1: 初始化历史缓冲区 $H = \{\hat{z}_0\}$ 2: 初始化输出序列 $\hat{Z} = \emptyset$ 3: for $n = 1$ to $N$ do 4: 采样初始噪声 $z_{n,t_T} \sim \mathcal{N}(0, I)$ 5: for $j = T$ down to $1$ do 6: 令 $t = t_j$ 7: if $n > 1$ and $t \in [T_{\text{start}}, T_{\text{end}}]$ then $\triangleright$ 循环引导优化窗口 8: $z^{(0)}_{n,t} \leftarrow z_{n,t}$ 9: 采样目标噪声 $\epsilon \sim \mathcal{N}(0, I)$ 10: for $k = 0$ to $K – 1$ do 11: $\hat{z}_{n|t} \leftarrow G_\theta(z^{(k)}_{n,t}, t, H)$ $\triangleright$ 预测干净潜在变量 12: $R_\phi(F(\hat{z}_{n|t}), t_{\text{ctx}}, H_{\text{rev}})$ $\triangleright$ 构建反向上下文 13: $\tilde{z}_{n-1} \leftarrow F(R_\phi(\epsilon, t_T, H_{\text{rev}}))$ $\triangleright$ 从噪声预测前驱 14: $D \leftarrow \| \hat{z}_{n-1} – \tilde{z}_{n-1} \|_2^2$ $\triangleright$ 计算循环差异 15: $z^{(k+1)}_{n,t} \leftarrow z^{(k)}_{n,t} – \eta \nabla_{z^{(k)}_{n,t}} D$ $\triangleright$ 梯度下降更新 16: end for 17: $z_{n,t} \leftarrow \text{Detach}(z^{(K)}_{n,t})$ $\triangleright$ 最终细化状态 18: end if 19: $\hat{z}_{n|t} \leftarrow G_\theta(z_{n,t}, t, H)$ $\triangleright$ 用于转移的前向预测 20: if $j = 1$ then $\triangleright$ 最终去噪步骤 21: $\hat{z}_n \leftarrow \hat{z}_{n|t}$ $\triangleright$ 最终生成的干净潜在变量 22: $H \leftarrow H \cup \{\hat{z}_n\}$ $\triangleright$ 更新 KV 缓存 23: $\hat{Z} \leftarrow \hat{Z} \cup \{\hat{z}_n\}$ $\triangleright$ 更新输出序列 24: else $\triangleright$ 中间去噪步骤 25: 采样 $\epsilon_{\text{trans}} \sim \mathcal{N}(0, I)$ 26: $z_{n,t_{j-1}} \leftarrow \Psi(\hat{z}_{n|t}, \epsilon_{\text{trans}}, t_{j-1})$ $\triangleright$ 标准扩散转移 27: end if 28: end for 29: end for 30: return $\hat{Z}$

第 33 页

Cycle-World 33

男性健身教练在明亮的健身房带领进行高强度间歇训练(HIIT),充满活力,指令清晰,专业镜头拍摄。

身穿白色芭蕾舞裙的专业芭蕾舞者在大舞台聚光灯下表演同步、优雅的动作。

可爱的卡通企鹅在阳光明媚的南极雪坡上欢乐滑行,背景有冰山,采用生动的跟踪镜头。

黑白画面中,边境牧羊犬在阳光明媚的绿色山坡上放牧绵羊,神情专注且敏捷,采用中广角镜头。

杰克·斯派洛和巴博萨在暴风雨中的海盗船甲板上进行剑术对决,具有电影《加勒比海盗》风格,动作动态激烈。

哥特式恐怖动画:手持烛台的女子在暴风雨之夜探索闹鬼的维多利亚式豪宅。

可爱的水獭在阳光照耀的河岸上弹奏红色尤克里里,氛围自然清新,采用中近景镜头。

图 S3:Cycle-World 在不同场景和复杂运动中的额外定性结果,展示了其高视觉保真度和稳健的时空一致性。

第 34 页

34 Z. Su 等

一个人正在扫地。

CausVid

CausVid + CGI

Self Forcing

Self Forcing + CGI

蜘蛛侠与绿魔在霓虹灯闪烁的纽约夜晚追逐,《蜘蛛侠:平行宇宙》的赛璐珞风格,动态动作。

CausVid

CausVid + CGI

Self Forcing

Self Forcing + CGI

图 S4:将 Cycle-Guided Inference (CGI) 集成到 CausVid 和 Self-Forcing 中的定性结果。集成 CGI 在不重新训练模型的情况下,提高了时空一致性并纠正了物理运动异常。

发表评论