走出去再回来,场景还能一致吗?AlayaWorld

三分钟导读:AlayaWorld是一个基于LTX-2.3微调的全栈开源框架,通过结合3D缓存、历史压缩、错误银行和少步蒸馏,实现了支持实时交互、长视界一致性和开放动作生成的可玩视频世界模型。

英文题目:AlayaWorld: Long-Horizon and Playable Video World Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.06291

原始论文:PDF / 论文页面

对应视频标题:走出去再回来,场景还能一致吗?AlayaWorld|推荐指数:★★★★★

这篇论文解决什么问题?

传统游戏世界构建成本高且难以修改;现有视频世界模型在交互控制精度、长视界时空一致性(特别是回路闭合)、生成稳定性(避免视觉漂移)以及实时推理延迟方面存在挑战。

核心创新

  • 结合显式渲染证据(3D缓存)与轻量级架构注入(AdaLN)以实现精确相机控制。
  • 在块粒度(chunk granularity)支持提示词切换,实现无重新生成的实时意图响应。
  • 联合使用空间索引记忆(3D缓存)和时间索引记忆(压缩历史)以支持可靠的回路闭合(loop closure)。
  • 引入错误银行,在训练中将累积误差注入记忆条件和目标片段,增强长视界生成的鲁棒性。
  • 采用少步蒸馏和小时间块设计以降低视觉和语义延迟,实现实时交互。

方法概览

基于LTX-2.3微调的自回归DiT架构,集成AdaLN风格相机控制模块、显式3D空间缓存、压缩时间历史模块、错误银行(Error Bank)以及基于DMD的少步蒸馏技术。

逐图理解论文

AlayaWorld架构概览

AlayaWorld架构概览
Figure 1 Interactive world simulation across diverse scenes. AlayaWorld synthesizes explorable worlds that span first- and third-person viewpoints, real-world, game, and synthetic domains, and both indoor and outdoor environments. Moreover, it accommodates open-ended actions such as spell-casting, weapon combat, and monster summoning.

AlayaWorld基于LTX-2.3微调,采用自回归DiT架构。它集成了AdaLN风格相机控制模块、显式3D空间缓存、压缩时间历史模块、Error Bank以及基于DMD的少步蒸馏技术。该框架旨在平衡生成质量、控制精度和推理速度,实现全栈开源的可玩视频世界生成。

精确相机控制

精确相机控制
Figure 2 shows generated sequences under varied camera and action commands. AlayaWorld faithfully follows the requested viewpoint changes and translations while preserving scene identity and geometric plausibility, illustrating precise camera-controllable generation under interactive control.

通过结合显式渲染证据即3D缓存与轻量级架构注入AdaLN,AlayaWorld实现了精确的相机控制。如图2所示,模型能忠实遵循视点变化和平移指令,同时保持场景身份和几何合理性。这种设计确保了在交互式控制下生成的视频具有高度的几何一致性和视觉稳定性。

实时意图响应

实时意图响应
Figure 3 shows sequences in which the text prompt is switched on the fly during generation. By updating the text condition at chunk boundaries, AlayaWorld transitions to the new prompt within a short delay while preserving visual continuity across the switch, without regenerating the preceding sequence. This illustrates that AlayaWorld follows changing user intent at interactive latency, supporting responsive control beyond a single fixed prompt to achieve open-ended actions.

AlayaWorld在块粒度支持提示词切换,实现无重新生成的实时意图响应。如图3所示,在生成过程中动态更新文本条件,模型能在短时间内过渡到新提示,同时保持视觉连续性。这种机制支持超越单一固定提示的开放动作生成,如施法、战斗和召唤怪物,满足交互式延迟要求。

可靠回路闭合

可靠回路闭合
Figure 4 presents leave-and-return trajectories in which the viewpoint departs from a region and later revisits it. The revisited regions remain consistent with their earlier appearance in geometry, layout, and texture, demonstrating that the explicit spatial cache and the compressed temporal history jointly support reliable loop closure.

联合使用空间索引记忆即3D缓存和时间索引记忆即压缩历史,AlayaWorld支持可靠的回路闭合。如图4所示,当视点离开并重新访问区域时,几何、布局和纹理保持一致。这种双重记忆机制有效解决了长视界生成中的视觉漂移问题,确保场景在长时间探索中的稳定性和一致性。

长视界稳定性

长视界稳定性
Figure 5 shows extended rollouts generated autoregressively over long horizons. AlayaWorld maintains visual quality, object identity, and motion continuity as the rollout grows, without pronounced accumulation of artifacts, indicating strong stability under purely forward exploration.

AlayaWorld在长视界生成中表现出强大的稳定性。如图5所示,在一分钟的自回归生成中,模型保持了视觉质量、物体身份和运动连续性,没有明显的伪影累积。这种能力得益于Error Bank在训练中将累积误差注入记忆条件和目标片段,增强了长视界生成的鲁棒性。

实验与关键结果

  • 相机控制生成定性结果(Figure 2)。
  • 提示词驱动动作的定性结果(Figure 3)。
  • 与现有方法的回路闭合一致性对比(Figure 4)。
  • 一分钟长视界生成的定性结果(Figure 5)。
  • 多样化风格(写实、Minecraft、水墨等)下的场景一致性测试(Figure 6)。
  • 相机控制生成定性结果(Figure 2)。
  • 提示词驱动动作的定性结果(Figure 3)。
  • 与现有方法的回路闭合一致性对比(Figure 4)。
  • 一分钟长视界生成的定性结果(Figure 5)。
  • 多样化风格(写实、Minecraft、水墨等)下的场景一致性测试(Figure 6)。

阅读时需要注意

  • 显式3D缓存主要表示静态结构,难以完全编码所有近期时间动态。
  • 依赖深度或几何估计,对动态对象的状态表示存在困难。
  • 少步蒸馏可能在激进步数减少下削弱运动保真度和多样性。
  • 论文主要展示定性结果,缺乏广泛的定量基准测试数据。
  • 完整代码库和详细技术细节计划在2026年7月中旬发布,当前版本可能不完整。
  • 实时性能依赖于特定的硬件加速和蒸馏策略,通用性需进一步验证。

关联工作

  • LTX-Video:基础模型 (Backbone)(第 3 页)
  • GEN3C:3D缓存与相机控制参考(第 4 页)
  • Frame Preservation:历史压缩参考(第 5 页)
  • Helios:长视界稳定性与错误处理参考(第 6 页)
  • Yume / Yume 1.5:交互式世界生成对比(第 3 页)
  • Genie 3:实时生成对比(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

AlayaWorld:长视野且可玩的视频 世界生成

AlayaWorld 团队,Alaya Lab 作者名单请参阅贡献部分

游戏世界传统上通过劳动密集型的生产管线构建,这使得它们的开发成本高昂、难以定制,且在部署后修改费用昂贵。视频世界模型方面的最新进展提供了一种根本不同的范式。这些模型不再显式地编写虚拟环境的每个组件,而是根据当前世界状态和用户交互自回归地合成未来观测结果,从而能够在线生成可玩的世界。通过在 gameplay 录制和真实世界视频上进行训练,它们能够捕捉多样的视觉外观和物理动态,为游戏之外的交互式应用(包括具身智能)开辟了新机遇。在本文中,我们提出了 AlayaWorld,一个用于构建交互式生成式世界的端到端开源框架。AlayaWorld 支持开放的实时交互,允许用户自由导航并执行多种动作,如战斗、施法和召唤怪物。该框架在一个模块化和可扩展的架构中统一了从数据准备、模型架构、模型训练、推理加速到部署的完整开发流程。除了框架本身,我们还发布了可复现的管线、参考实现、评估工具和全面的文档,为生成式世界模型的未来研究和实时应用奠定了实用基础。2026 7月8日 项目页面:https://alaya-lab.github.io/AlayaWorld/ 视频:https://www.youtube.com/watch?v=n0jIEg7taTI 通讯作者:kaipeng.zhang@shanda.com 日期:2026年7月8日 [cs.CV]

Alaya World arXiv:2607.06291v1

图 1 跨不同场景的交互式世界模拟。AlayaWorld 合成可探索的世界,涵盖第一人称和第三人称视角、真实世界、游戏和合成领域,以及室内和室外环境。此外,它还支持开放式动作,如施法、武器战斗和召唤怪物。

1

第 2 页

1 引言

Alaya 是智能、创造力与新世界诞生的基石。

交互式虚拟世界是 3D 电子游戏的核心,并日益作为娱乐之外的实验平台,应用于具身智能体、机器人仿真以及可控环境中人类决策的研究。这些世界的重要性不仅源于其视觉真实感,还源于其交互性:玩家或智能体持续发出动作,环境则以连贯且持久的观测流作为响应。因此,构建同时具备丰富性、交互性和持久性的虚拟世界,长期以来一直是人工智能领域的核心目标。

传统的游戏世界创建依赖于劳动密集型的生产管线。虽然它能提供高质量的游戏,但成本高昂。物体、动画、游戏玩法、交互规则等都必须预先明确指定,导致世界在很大程度上是预定义的,且在部署后难以修改。扩展现有环境或引入新内容通常要求重新投入整个生产流程,这限制了虚拟世界的可扩展性和适应性。

视频世界模型 [2, 5, 13, 44, 45, 60, 63, 71, 87, 99] 的最新进展为交互式世界创建引入了一个根本不同的范式。生成模型不再显式地构建整个世界,而是可以直接预测未来的观测值,并根据用户交互合成后续的视觉状态。在这种范式下,单个模型隐式地执行内容生成、行为建模和渲染,直接从数据中学习世界的底层规律,而非依赖人工编写的规则。此外,由于这些模型可以在多样化的视频上进行训练,它们生成的环境不再受限于游戏领域。相反,它们可以展现出视觉外观以及可控的动力学和物理特性,从工程构建的世界迈向生成的世界,从而赋能具身智能。

然而,利用视频世界模型构建可玩的世界仍面临挑战。首先是控制(control),即询问世界在多大程度上对玩家开放。无论是导航是否无限,还是动作是否任意,不受预设物理定律的限制。其次是consistency(一致性),即询问世界在多大程度上实现了与自然动力学相符的空间和时间一致性,且保持物理上的合理性。第三是稳定性(stability),即询问其是否能够在长时域生成中避免视觉漂移。第四是运行时(runtime),即询问其是否能够在低延迟下实现实时生成。

在本工作中,我们首先回顾了交互式生成世界建模中的主要挑战和代表性方法,为这一快速兴起的研究领域提供了统一的视角。基于此分析,我们引入了 AlayaWorld,这是一个集成了提示切换机制(prompt-switching mechanism)、AdaLN 风格相机控制模块、3D 缓存、历史压缩模块、错误银行(Error Bank)以及少步蒸馏(few-step distillation)的自回归 DiT,旨在应对上述挑战。

AlayaWorld 是一个全栈、开源且长期的项目,旨在作为未来视频世界模型研究的基础。完整的技术细节、实验结果和完整代码库将于 7 月中旬发布。

2 相关工作

我们首先回顾作为世界生成骨干的视频生成模型,随后讨论将世界生成表述为端到端、可玩系统的交互式世界模型。细粒度的、技术层面的比较将推迟至第 3 节的相应小节中讨论。

2.1 视频生成模型

现代视频生成建立在扩散模型和潜在扩散模型 [53] 之上,其中基于 Transformer 的去噪器(DiT)[49] 被扩展为大型生成器。Sora [7] 确立了“视频即世界模拟器”的范式,随后的开源骨干网络包括 Open-Sora [97]、Open-Sora-Plan [35]、HunyuanVideo [29]、CogVideoX [79]、Wan [66]、LTX-Video [18]、Step-Video-T2V [43] 和 MAGI-1 [64],已经

第 3 页

使得大规模文本到视频和图像到视频合成变得广泛可用,并辅以强大的专有系统,如 Veo [15]、Kling [30]、Gen-3 [54] 和 MovieGen [51]。另一条并行研究路线致力于开发面向物理和具身设置的视频基础模型,包括 Cosmos [1] 和长上下文视频-语言建模 [36]。这些模型沿预定轨迹合成高保真、时间连贯的视频,因此为交互式世界生成提供了自然的骨干网络。这些模型构成了交互式世界生成的生成式骨干;如何将其扩展为交互式、用户驱动的世界,是下文讨论的系统以及 AlayaWorld 的重点。

2.2 交互式世界模型

越来越多的研究将世界生成为端到端、可玩系统。动作条件世界模型,如 Genie [8],从大规模无标签视频中学习可控环境,Genie 2 [48] 将此公式化扩展至可探索的 3D 场景。相关方向利用扩散模型或自回归模型作为神经游戏引擎,直接模拟可玩世界,包括 DOOM 上的 GameNGen [65]、Minecraft 上的 DIAMOND [3] 和 Oasis [12],以及可提示或可玩的游戏模型 [46, 77];GameGen-X [9] 通过专用数据集进一步解决开放世界游戏视频生成问题。由于许多此类系统在单一游戏之外表现出有限的泛化能力,后续工作寻求提高可控性和泛化能力,例如 The Matrix [14]、GameFactory [84] 以及开源实时 MineWorld [17]。更契合自由探索交互式世界生成的研究包括 Yume [45],它在键盘式动作控制下从单张图像合成可探索世界,其继任者 Yume 1.5 [44] 进一步提升了生成质量和交互可控性。最近的系统越来越针对具有扩展一致性的实时流式交互:Genie 3 [5] 实时生成交互环境,具有分钟级的一致性,但保持闭源;Matrix-Game [21] 和 Hunyuan-GameCraft [32] 整合动作条件、基于历史的一致性和少步蒸馏,以公开权重实现实时生成,并进一步扩展了长程记忆和基于指令的控制 [71, 59];Lingbot-World [60] 通过扩展扩散模型的上下文长度来提高长程几何一致性。在互补方向上,面向游戏的努力,如微软的 WHAM/Muse [26] 及其实时变体 WHAMM [47],联合建模环境和人类动作以实现可玩生成。

3 AlayaWorld

AlayaWorld 是一个用于交互式生成世界的全栈框架。它基于 LTX-2.3 进行微调,并结合了我们设计的模块。

3.1 交互

AlayaWorld 提供两种类型的交互,包括导航和提示驱动的动作。

3.1.1 导航

相机作为条件信号。第一条工作路线将相机运动视为视频模型必须转换为图像空间运动的外部条件。无需训练的方法通过在推理时操作潜在特征、注意力特征或布局先验来引导预训练视频模型。CamTrol [24] 通过 3D 点云重排对相机运动进行建模,并利用噪声潜在特征的布局先验来引导生成,无需额外的相机姿态训练。Latent-Reframe [98] 遵循相关原理,通过 3D 点云重映射来重构潜在特征。这些方法与现成的视频生成器兼容,但其控制精度受限于估计几何的质量以及潜在引导的间接性质。学习到的相机条件方法则训练专用模块来编码相机轨迹。MotionCtrl [72] 将相机运动表示为旋转和平移序列,并通过时间 Transformer 块中的相机运动控制模块注入。CameraCtrl [19] 使用 Plücker 射线嵌入表示相机姿态,并将编码的相机特征融合到时间注意力层中。CamI2V [96] 和 CamCo [76] 通过将基于 Plücker 的姿态条件与显式几何约束(如对极注意力)相结合,进一步加强了这一方向。CameraCtrl II [20] 将相机条件视频扩散扩展至更广泛的动态场景探索

3

第 4 页

视点范围。另一种变体将相机运动离散化为动作令牌。Yume [45] 通过键盘式动作暴露相机控制,这简化了交互使用,但仅提供动作级别而非任意连续轨迹的控制。总体而言,这些方法通过连续姿态、离散动作或潜在空间引导提供灵活的相机控制,但其准确性取决于生成器学习将条件转换为一致图像空间运动的可靠性。

相机作为架构偏置。第二条工作线将相机几何结构整合到 Transformer 的内部算子中。Ray-map conditioning(射线映射条件)将像素对齐的相机射线作为令牌级别的几何输入。相对相机编码则使令牌交互依赖于视点之间的几何关系。PRoPE [33] 将完整的相机视锥(包括内参和外参)编码为注意力机制内的投影相对位置编码。HY-World 1.5 [61] 采用这一理念进行交互式世界建模,通过 PRoPE 将连续相机姿态注入因果自注意力中,同时将离散键值融入时间步嵌入以实现稳健的用户控制。UCPE [88] 通过在统一公式中对 6-DoF 姿态、相机内参、镜头畸变和绝对方向进行建模,进一步推广了相机位置编码。其他工作使用归一化级别的调制,以最小的开销注入相机信息。BulletTime [70] 通过轻量级 4D 位置编码和相机条件归一化分支(Camera-AdaLN)结合相机和时间控制,其中 Camera-AdaLN 分支通过相机依赖的仿射归一化参数调节 DiT 特征。这些架构机制高效且与现代基于 Transformer 的视频生成器兼容。然而,由于相机控制被注入到去噪主干网络中,弱条件可能被忽略,而过强或校准错误的条件可能会降低外观质量和时间连贯性。

相机作为显式渲染证据。第三条工作线通过在目标相机轨迹下渲染几何代理,减轻了隐式姿态到图像推理的负担。GEN3C [52] 从深度反投影的种子帧或先前生成的帧构建 3D 缓存,沿所需轨迹渲染此缓存,并对视频生成器进行渲染视图的条件约束。这将相机控制从参数解释问题转化为图像条件生成问题。生成器随后可以专注于补全遮挡缺失区域、修正渲染伪影并推进场景动态。TrajectoryCrafter [85] 遵循相关的生成式重渲染公式,通过对点云渲染和源视频进行联合条件约束,以重定向单目视频的相机轨迹。ReCamMaster [4] 和 ReCapture [89] 在保持场景外观和动态的同时,在新型相机轨迹下重渲染给定视频。CamCloneMaster [41] 从参考视频转移相机运动,无需在推理时显式相机参数。我们注意到,第三条工作线运行在视频到视频(V2V)重渲染设置中:它以现有源视频作为输入并重定向其相机轨迹,因此与从单帧或文本提示合成未观察世界的交互式自由探索设置不同。这些方法为目标视点提供直接的图像空间引导,从而提高了几何保真度和相机跟随准确性。其代价是更重的流水线,依赖于几何估计、渲染质量、源视频覆盖范围或参考运动的可用性。

我们的方法。AlayaWorld 结合了显式渲染证据与轻量级架构注入。遵循 GEN3C [52],我们维护一个 3D 缓存并沿玩家的目标相机轨迹进行渲染。渲染后的缓存为查询视点提供了具体的视觉证据,提高了轨迹跟随性和跨视图一致性。这对于交互式世界尤为重要,因为玩家可能会离开某个区域,随后又返回该区域。同时,我们避免了在生成主干内部使用沉重的相机融合模块。我们通过 AdaLN 风格的调制注入紧凑的相机条件,这仅引入了少量的参数和计算开销。这种设计分离了两种条件路径的角色。渲染的 3D 缓存提供空间 grounded 的外观和几何结构。轻量级相机调制在主干内部提供轨迹感知。两者共同支持精确的代理控制,同时保留了响应式交互所需的效率。

3.1.2 提示驱动的动作

导航是一种基本交互,而 AlayaWorld 还支持自由提示驱动的动作,如施法、武器战斗和怪物召唤,以实现真正可玩的世界。具体而言,AlayaWorld 在 Chunk(块)粒度上引入了提示切换机制。它可以在任何 Chunk 边界替换文本条件,使得从下一个 Chunk 开始生成的新内容不会影响先前

第 5 页

生成的内容,避免对现有序列进行重新生成。该机制在概念上与注意力层面的提示编辑 [23, 38] 一致。

3.2 一致性

一致性要求空间和时间上与自然动力学保持一致,且保持物理上的合理性。例如,玩家离开某个区域后稍后返回该区域。我们强调,这是地点身份(place identity)的一种属性:即使生成的视频流完全稳定且无漂移,只要重访的区域与之前的外观不一致,持久性(persistence)就会失效。该特性通过“离开-返回”的回路闭合轨迹进行测试,且独立于原始视觉质量。其难点在于结构性问题:自回归世界模型将每个新片段条件化于有限的上下文之上,而注意力成本随保留帧数的增加而增长。因此,保留整个 rollout 在计算上是不可行的,而仅保留最近的窗口则会丢弃回路闭合所需的证据。我们根据确定如何检索过去证据的索引原则对先前的工作进行分类:时间索引记忆根据观察时间检索历史,而空间索引记忆根据观察位置检索历史,这更符合重访的回路闭合性质。

时间索引记忆。时间索引方法将历史表示为序列,并根据近期性、叙事顺序或循环传播来保留过去的证据。第一条路线直接保留原始时间上下文,要么通过将过去的帧附加到当前生成窗口中,要么通过在镜头之间保留选定的关键帧来实现。当相关证据仍在上下文中时,这些方法保留了高保真度的观察结果,但其成本随历史增长,且一旦某个位置超出保留窗口,其检索能力就会减弱。第二条路线在条件化生成器之前压缩时间上下文。FramePack [91] 通过逐步压缩过去的帧信息,将长历史打包到有限的上下文预算中。Frame Preservation [92] 学习一个轻量级的历史编码器,将长视频历史映射为短嵌入,同时保留任意时间位置的帧级信息。其他基于压缩的方法使用混合、打包、记忆流或分层记忆设计来降低长程条件化的成本 [91, 92, 73]。第三条路线通过循环或状态空间计算隐式地携带历史。这些方法在片段之间传播紧凑的隐藏状态,而不是显式地存储所有视觉 token [11, 50, 86]。它们提供了有利的扩展性,但压缩状态是按 rollout 顺序索引的,而不是按物理位置索引的。因此,时间记忆可以维持短期动力学和全局连续性,但不能直接保证长时间延迟重访所需的精确证据仍然可访问。

空间索引记忆。空间索引方法根据视角、姿态或重建的场景几何来组织历史。一种轻量级形式将历史帧与相机状态一起存储,并通过空间重叠进行检索。Context-as-Memory [83] 以帧格式保留历史,并根据视场重叠选择相关上下文。WorldMem [75] 存储带有姿态和时间戳的记忆帧,然后根据查询状态读取记忆。这种类型的记忆仍然是基于帧的,但其检索键是空间性的,而非纯粹时间性的。一种更强的形式将记忆绑定到显式的几何基底上。GEN3C [52] 从深度反投影帧构建 3D 缓存,并在目标相机轨迹下渲染此缓存以条件化未来的生成。Video World Models with Long-term Spatial Memory [74]、EvoWorld [68] 和 Spatia [93] 维护显式的空间记忆,这些记忆在 rollout 过程中更新,并在视角被重访时重新投影或查询。Lyra 2.0 [56] 为每帧维护 3D 几何结构以进行信息路由,检索从目标视角可见的历史帧,并为长视界生成建立密集对应关系。系统级 3D 世界模型如 HY-World 2.0 [62] 进一步结合视角生成、重建、世界扩展和组合,以产生持久的可导航 3D 场景。最近的工作通过在扩散潜在空间中直接存储缓存来降低显式 RGB 空间记忆的成本 [93]。因此,空间索引更符合回路闭合和长距离绕行,因为查询的视角可以从相应区域检索证据,而不是从最近的片段中检索。其主要局限性在于管道复杂性、对深度或几何估计的依赖,以及表示状态不固定在静态空间缓存中的动态对象的困难。

我们的方法。这两种记忆形式是互补的。空间记忆锚定先前访问区域的几何和外观,而时间记忆捕捉近期的运动、瞬态变化,

5

第 6 页

以及全局展开上下文。AlayaWorld 结合了这两种机制。遵循 GEN3C [52] 的做法,我们维护一个显式的 3D 缓存,并将其重投影到查询视角,为先前观察到的区域提供空间锚定的证据,并在重访时提高一致性。由于此类缓存主要表示静态结构,它本身无法编码所有近期的时间动态。因此,我们遵循 Frame Preservation [92] 的方法,将近期的帧历史压缩为轻量级嵌入。显式缓存提供空间持久性,而压缩的历史提供时间持久性。两者共同覆盖了纯空间记忆和纯时间记忆各自的互补性失效模式。

3.3 稳定性

我们将稳定性实例化为长视界视频生成。目标不仅是生成更多帧,还要随着展开过程的进行,保持视觉质量、物体身份、运动连续性和可控性。与持久性不同,这是关于视界范围内稳定性的属性,且与是否重访任何区域无关:即使玩家从不回头且从未发生回路闭合,纯前向展开仍会因误差累积而退化。这之所以困难,是因为自回归视频生成反复以其自身的输出作为条件。因此,小的伪影、不一致的运动或分布偏移可能会随时间累积,并将后续片段推离数据流形。针对这种漂移的干预措施可以放置在自回归管道的四个阶段:条件输入、训练过程、采样计划和预测目标。

条件输入:更长且组织更好的历史。缓解漂移的一种方法是让生成器访问更长或组织更好的历史。与 §3.2 中用于回路闭合的空间回忆不同,这里关注的是条件输入如何稳定前向展开,其评估标准是单调长展开过程中的退化程度,而非重访一致性。一些方法简单地扩大可用上下文:Context Forcing [10] 使用匹配的教师训练长上下文学生模型,以避免短上下文监督不匹配。其他方法则在固定预算下压缩或重组该上下文:Infinite-World [73] 将历史潜在变量蒸馏为无姿态的固定预算记忆,而 Relax Forcing [95] 认为仅添加记忆是不够的,而是将上下文分配给功能角色,如汇(sink)、尾(tail)和选定历史。这些方法保留了更多有用的历史处于活动状态,但它们仍然依赖模型来决定如何使用这些历史来修正当前生成,因此其效果受限于记忆选择、压缩损失以及长上下文的训练分布。我们注意到,尽管它们与 §3.2 中的记忆压缩机制共享原理,但其目标是稳定前向展开,而非通过空间索引实现回路一致性的回忆;两者是互补而非冗余的。

训练过程:展开感知训练与误差修正。另一种方法将漂移视为训练-测试不匹配。教师强制视频模型在干净的历史上训练,但自回归推理则基于已包含误差的自生成帧进行条件约束。Self-Forcing [25] 通过在模型自身的自回归展开下进行训练来解决这一问题,减少了训练与推理之间的暴露偏差。Stable Video Infinity [34] 通过 Error-Recycling Fine-Tuning(误差回收微调)使这一想法更加明确。它将历史误差注入干净输入,估计由此产生的残差误差,将其存储在不同扩散时间步的错误银行(Error Bank)中,并在训练期间重新采样。这教导 DiT 识别并纠正其在长展开过程中将遇到的误差类型。Helios [87] 也针对长视频漂移,但避免了运行时抗漂移启发式方法,如自强制、错误银行和关键帧采样。相反,它表征了漂移失效模式,并使用模拟的漂移历史训练模型,同时在源头上抑制重复运动。这些方法直接解决了误差累积问题,但它们通常需要额外的长展开训练、误差模拟或针对模型的抗漂移配方。

采样计划:松弛因果与基于锚点的生成。漂移还可以通过改变生成计划来解决,使得误差不会严格地从一段传播到下一段。Rolling Forcing [37] 在保持前向流式传输的同时松弛了严格的因果性,以递增的噪声级别联合去噪一个滚动帧窗口,并使用初始帧作为注意力汇,从而在实时延迟下抑制误差增长。Anchored Tree Sampling [6] 则放弃了因果顺序,在整个视界上生成稀疏锚点并填充中间跨度,这在局部限制了漂移,但需要非因果生成,因此不太适合实时交互。

预测目标:几何与感知稳定器。漂移还可以通过用比原始 RGB 更稳定的辅助信号增强预测目标来进一步约束。WorldWeaver [39] 联合

6

第 7 页

模型对 RGB 帧和感知条件进行建模,并使用深度线索作为记忆信号,因为与 RGB 外观相比,深度不易发生视觉漂移。Endless World [90] 添加了 3D 感知注意力,使得生成过程受显式几何约束,并在长序列生成中保持连贯性。具有显式空间记忆的世界模型通过将生成的视图锚定在持久的场景结构上,而不是仅依赖之前的 RGB 帧,从而稳定了长序列生成 [74, 68, 93]。这些方法通过利用几何、感知或世界状态线索约束生成来减少漂移。其代价是增加了额外的估计、表示或记忆维护成本,并且它们可能仍然难以应对状态在长时域内变化的动态物体。

我们的方法。AlayaWorld 将稳定性视为自回归生成过程中的训练时鲁棒性问题。遵循 Helios [87] 的做法,我们在训练期间向模型暴露漂移的历史数据,而不是假设每个条件片段都保持干净。我们进一步引入了一个错误银行(Error Bank),用于存储生成过程中累积的残差伪影,并将其作为结构化扰动重用。与仅将此类误差应用于预测目标的方法不同,我们将错误银行样本注入到记忆条件和目标片段中。这种联合扰动更好地匹配了长时域推理,其中模型必须在不完美的记忆基础上生成,同时纠正下一个片段中的错误。因此,模型不仅学会了延续干净的视频,还学会了在历史数据受损的情况下稳定生成,并防止错误在自回归步骤中累积。

3.4 运行时

我们将运行时实例化为在交互约束下的实时视频生成。交互生成受两种不同的延迟限制,响应式系统必须保持这两种延迟都很小。视觉延迟(Visual latency)是从决定生成到帧出现的时间;这是一个计算问题。语义延迟(Semantic latency)是从用户意图变化到输出反映该变化的时间;这是一个条件更新问题。我们据此组织相关工作:使生成更快的方法减少视觉延迟,而使条件可即时更新的方法减少语义延迟。

减少视觉延迟:更快的生成。三条互补的路径缩短了从触发到帧出现的时间。第一条通过蒸馏减少去噪步骤的数量。渐进式蒸馏(Progressive Distillation)[55] 和一致性模型(Consistency Models)[58] 训练学生模型以近似教师模型的采样轨迹或概率流解,这一思想通过潜在一致性模型(Latent Consistency Models)[40] 引入潜在扩散,并被 DMD [81] 和 DMD2 [80] 重新表述为分布匹配;VideoLCM [69]、AnimateLCM [67] 和 T2V-Turbo [31] 将少步蒸馏扩展到视频领域。第二条将生成重构为因果流而非离线片段,从而连续暴露结果:Reuse and Diffuse [16] 和 FIFO-Diffusion [27] 通过重用潜在变量或对角去噪继续生成,StreamingT2V [22] 和 StreamDiT [28] 在重叠块或移动缓冲区上流式传输,CausVid [82]、MotionStream [57] 和 LongLive [78] 将双向教师蒸馏为因果学生模型,以进行帧级或块级(Chunk)的即时生成。第三条在运行时重用计算:金字塔注意力广播(Pyramid Attention Broadcast)[94] 在扩散步骤间广播冗余的注意力输出,FasterCache [42] 动态重用特征并利用无分类器引导中条件分支和无条件分支之间的冗余。激进的步数减少可能会削弱运动保真度和多样性;流式传输会引入块边界不连续性和误差累积;而缓存重用仅修剪固定采样过程中的计算,不影响语义运行时。

减少语义延迟:即时条件更新。运行时还要求在生成过程中条件状态发生变化,而无需重新生成序列。该机制源于注意力级别的提示编辑:Prompt-to-Prompt [23] 通过操作交叉注意力图来编辑文本条件扩散,Video-P2P [38] 将其扩展到视频,同时保持未变化区域的时序连贯性。LongLive [78] 通过引入 KV 重缓存(KV-recache)使这项工作适用于流式传输,该机制使用新提示和先前生成的帧重新计算缓存状态,在切换时消除语义惯性并保持视觉连续性。这些方法表明,运行时不仅仅是采样速度:系统还必须足够快地更新其条件,以遵循用户意图,同时避免突兀的视觉变化或延迟的语义响应。

我们的方法。AlayaWorld 通过简单的实时生成设计针对运行时。我们采用标准的基于 DMD 的蒸馏来减少每个生成块所需的去噪步骤数。我们

第 8 页

进一步采用较小的时间块(chunk)大小,使得每次生成调用的延迟较低,且用户指令可以在短暂延迟后影响输出。通过在生成下一个块之前更新文本条件,支持在块边界处切换提示(prompt)。这避免了全序列重新生成,同时保持了交互循环的简单性和可预测性。与沉重的运行时缓存工程或专门的 KV 重缓存机制相比,我们的设计优先考虑每个块的计算量低以及频繁的条件更新点。通过这种方式,少步蒸馏(few-step distillation)提供了速度,短块提供了交互粒度,而提示切换则在用户意图变化时提供了可控性。

4 定性结果

AlayaWorld 基于 LTX-2.3 [18] 进行微调,以 720p 24fps 进行自回归生成,其中每个块通过四个去噪步骤生成,对应大约一秒的视频。为了公平起见,只要其公共实现允许,所有基线均在与 AlayaWorld 相同的输入条件和分辨率下进行评估。

4.1 相机控制

图 2 展示了在不同相机和操作指令下生成的序列。AlayaWorld 忠实地遵循了请求的视角变化和平移,同时保持了场景身份和几何合理性,说明了在交互控制下精确的相机可控生成。

图 2 相机控制生成的定性结果。

4.2 开放式动作

图 3 展示了在生成过程中动态切换文本提示的序列。通过在块边界更新文本条件,AlayaWorld 在短暂延迟后过渡到新提示,同时在切换过程中保持视觉连续性,而无需重新生成前面的序列。这表明 AlayaWorld 能够以交互延迟响应变化的用户意图,支持超越单一固定提示的响应式控制,从而实现开放式动作。

4.3 一致性

图 4 展示了离开并返回的轨迹,其中视角离开某个区域后稍后再次访问该区域。被重新访问的区域在几何、布局和纹理上与其早期外观保持一致,证明了显式空间缓存和压缩的时间历史共同支持可靠的回路闭合(Loop Closure)。

我们还在相同设置下评估了代表性的交互式世界模型。先前的模型表现出典型的故障模式:视觉退化、相机控制不准确以及在被重新访问先前观察到的区域时出现不一致。相比之下,AlayaWorld 产生了视觉上合理且时间连贯的结果,这些结果忠实地遵循控制输入,同时在整个轨迹中保持场景结构。

4.4 长视界生成

图 5 展示了在长视界上通过自回归生成的扩展 rollout。随着 rollout 的增长,AlayaWorld 保持了视觉质量、物体身份和运动连续性,没有出现明显的伪影累积,表明在纯前向探索下具有强大的稳定性。

8

第 9 页

图 3 提示驱动动作的定性结果。

图 4 与现有方法的一致性对比。

图 5 一分钟生成的定性结果。

4.5 多样风格

AlayaWorld 在广泛的视觉风格中保持场景一致性。如图 6 所示,相同的导航轨迹被渲染为写实、我的世界、水墨画、油画、赛博朋克、像素

第 10 页

艺术,以及受《塞尔达传说》启发的风格。尽管渲染风格差异显著,但场景几何结构、相机轨迹和语义内容均得到一致保留。

图 6 不同风格的定性结果。

5 贡献

作者按名字首字母顺序排列。

核心负责人:Zhang Kaipeng

负责人:Li Chuanhao

核心贡献者:Li Chuanhao, Zhang Kaipeng, Zhan Yifan, Ge Yongtao, Yin Yuanyang

贡献者:Tan Jiaming, He Kang, Fan Liaoyuan, Liu Ruicong, Xu Xiaojie, Chu Xuangeng, Li Zhen, Lin Zhengyuan, Wang Zhixiang, Meng Zian, Gao Zihui

参考文献

[1] N. Agarwal, A. Ali, M. Bala, Y. Balaji, E. Barker, T. Cai, P. Chattopadhyay, Y. Chen, Y. Cui, Y. Ding, 等。Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575, 2025。

[2] 阿里巴巴 ATH。Happy Oyster。https://happyoyster.cn/, 2026。

[3] E. Alonso, A. Jelley, V. Micheli, A. Kanervisto, A. Storkey, T. Pearce, 和 F. Fleuret。用于世界建模的扩散模型:视觉细节在 Atari 中至关重要。神经信息处理系统进展 (NeurIPS), 37:58757–58791, 2024。

[4] J. Bai, M. Xia, X. Fu, X. Wang, L. Mu, J. Cao, Z. Liu, H. Hu, X. Bai, P. Wan, 等。Recammaster:基于单视频进行相机控制的生成式渲染。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集,第 14834–14844 页,2025。

[5] P. Ball, J. Bauer, 等。Genie 3:世界模型的新前沿。https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/, 2025。

[6] M. Bendel, S. W. Bailey, M. Vaidya, S. Badam, 和 X. He。告别漂移:用于长周期视频到视频生成的锚定树采样。arXiv 预印本 arXiv:2605.20476, 2026。

[7] T. Brooks, B. Peebles, C. Holmes, W. DePue, Y. Guo, L. Jing, D. Schnurr, J. Taylor, T. Luhman, E. Luhman, 等。作为世界模拟器的视频生成模型。OpenAI 博客, 2024。

[8] J. Bruce, M. D. Dennis, A. Edwards, J. Parker-Holder, Y. Shi, E. Hughes, M. Lai, A. Mavalankar, R. Steigerwald, C. Apps, 等。Genie:生成式交互环境。在国际机器学习会议 (ICML) 上, 2024。

10

第 11 页

[9] H. Che, X. He, Q. Liu, C. Jin, 和 H. Chen。Gamegen-x:交互式开放世界游戏视频生成。 在国际学习表征会议(ICLR),第 37546–37593 页,2025 年。

[10] S. Chen, C. Wei, S. Sun, P. Nie, K. Zhou, G. Zhang, M.-H. Yang, 和 W. Chen。Context forcing: 具有长上下文的自回归视频生成一致性。arXiv 预印本 arXiv:2602.06028,2026 年。

[11] T. Chen, Z. Ding, A. Li, C. Zhang, Z. Xiao, Y. Wang, 和 C. Jin。循环自回归扩散: 全局记忆与局部注意力。arXiv 预印本 arXiv:2511.12940,2025 年。

[12] E. Decart, Q. McIntyre, S. Campbell, X. Chen, 和 R. Wachen。Oasis:Transformer 中的宇宙。 https://oasis-model.github.io,2024 年。

[13] Echo Team @ Joy Future Academy, JD。Joyai-echo:推动长视频生成的前沿。 技术报告,京东未来学院,京东,2026 年 5 月。

[14] R. Feng, H. Zhang, Z. Shu, Z. Yang, L. Tang, Z. Wang, A. Zheng, J. Xiao, Z. Liu, R. Chu 等人。The Matrix:具有实时移动控制的无限视界世界生成。神经信息处理系统进展(NeurIPS),38:87318–87344,2026 年。

[15] Google DeepMind。Veo。https://deepmind.google/models/veo/,2024 年。

[16] J. Gu, S. Wang, H. Zhao, T. Lu, X. Zhang, Z. Wu, S. Xu, W. Zhang, Y.-G. Jiang, 和 H. Xu。复用与 扩散:用于文生视频生成的迭代去噪。arXiv 预印本 arXiv:2309.03549,2023 年。

[17] J. Guo, Y. Ye, T. He, H. Wu, Y. Jiang, T. Pearce, 和 J. Bian。Mineworld:Minecraft 上的实时开源 交互式世界模型。arXiv 预印本 arXiv:2504.08388,2025 年。

[18] Y. HaCohen, N. Chiprut, B. Brazowski, D. Shalem, D. Moshe, E. Richardson, E. Levin, G. Shiran, N. Zabari, O. Gordon 等人。Ltx-video:实时视频潜在扩散。arXiv 预印本 arXiv:2501.00103, 2024 年。

[19] H. He, Y. Xu, Y. Guo, G. Wetzstein, B. Dai, H. Li, 和 C. Yang。Cameractrl:启用文生视频生成的 相机控制。arXiv 预印本 arXiv:2404.02101,2024 年。

[20] H. He, C. Yang, S. Lin, Y. Xu, M. Wei, L. Gui, Q. Zhao, G. Wetzstein, L. Jiang, 和 H. Li。Cameractrl ii:通过相机控制的视频扩散模型进行动态场景探索。在 IEEE/CVF 国际计算机视觉会议(ICCV) 论文集,第 13416–13426 页,2025 年。

[21] X. He, C. Peng, Z. Liu, B. Wang, Y. Zhang, Q. Cui, F. Kang, B. Jiang, M. An, Y. Ren 等人。Matrix-game 2.0:一个开源的实时流式交互式世界模型。arXiv 预印本 arXiv:2508.13009, 2025 年。

[22] R. Henschel, L. Khachatryan, H. Poghosyan, D. Hayrapetyan, V. Tadevosyan, Z. Wang, S. Navasardyan, 和 H. Shi。Streamingt2v:来自文本的一致、动态且可扩展的长视频生成。 在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 2568–2577 页,2025 年。

[23] A. Hertz, R. Mokady, J. Tenenbaum, K. Aberman, Y. Pritch, 和 D. Cohen-Or。使用交叉注意力控制进行 提示到提示的图像编辑。arXiv 预印本 arXiv:2208.01626,2022 年。

[24] C. Hou 和 Z. Chen。无需训练的生成视频相机控制。arXiv 预印本 arXiv:2406.10126, 2024 年。

[25] X. Huang, Z. Li, G. He, M. Zhou, 和 E. Shechtman。Self forcing:弥合自回归视频扩散中的训练-测试差距。 神经信息处理系统进展(NeurIPS),38:167283– 167308,2026 年。

[26] A. Kanervisto, D. Bignell, L. Y. Wen, M. Grayson, R. Georgescu, S. Valcarcel Macua, S. Z. Tan, T. Rashid, T. Pearce, Y. Cao 等人。面向游戏玩法构思的世界和人类动作模型。《自然》, 638(8051):656–663,2025 年。

[27] J. Kim, J. Kang, J. Choi, 和 B. Han。Fifo-diffusion:无需训练从文本生成无限视频。 神经信息处理系统进展(NeurIPS),37:89834–89868,2024 年。

11

第 12 页

[28] A. Kodaira, T. Hou, J. Hou, M. Georgopoulos, F. Juefei-Xu, M. Tomizuka, 和 Y. Zhao。Streamdit:实时流式文本到视频生成。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 29200–29210 页,2026。

[29] W. Kong, Q. Tian, Z. Zhang, R. Min, Z. Dai, J. Zhou, J. Xiong, X. Li, B. Wu, J. Zhang 等。Hunyuanvideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024。

[30] 快手。Kling。https://klingai.com/,2024。

[31] J. Li, W. Feng, T.-J. Fu, X. Wang, S. Basu, W. Chen, 和 W. Y. Wang。T2v-turbo:通过混合奖励反馈打破视频一致性模型的质量瓶颈。神经信息处理系统进展(NeurIPS),37:75692–75726,2024。

[32] J. Li, J. Tang, Z. Xu, L. Wu, Y. Zhou, S. Shao, T. Yu, Z. Cao, 和 Q. Lu。Hunyuan-gamecraft:具有混合历史条件的高动态交互式游戏视频生成。arXiv 预印本 arXiv:2506.17201,2025。

[33] R. Li, B. Yi, J. Liu, H. Gao, Y. Ma, 和 A. Kanazawa。相机作为相对位置编码。神经信息处理系统进展(NeurIPS),38:15984–16009,2026。

[34] W. Li, W. Pan, P.-C. Luan, Y. Gao, 和 A. Alahi。Stable video infinity:通过错误回收实现无限长度视频生成。arXiv 预印本 arXiv:2510.09212,2025。

[35] B. Lin, Y. Ge, X. Cheng, Z. Li, B. Zhu, S. Wang, X. He, Y. Ye, S. Yuan, L. Chen 等。Open-sora plan:开源大型视频生成模型。arXiv 预印本 arXiv:2412.00131,2024。

[36] H. Liu, W. Yan, M. Zaharia, 和 P. Abbeel。基于块状环形注意力(blockwise ringattention)的百万长度视频与语言世界模型。在国际学习表征会议(ICLR)论文集,第 45953–45977 页,2025。

[37] K. Liu, W. Hu, J. Xu, Y. Shan, 和 S. Lu。Rolling forcing:实时自回归长视频扩散。arXiv 预印本 arXiv:2509.25161,2025。

[38] S. Liu, Y. Zhang, W. Li, Z. Lin, 和 J. Jia。Video-p2p:通过交叉注意力控制进行视频编辑。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 8599–8608 页,2024。

[39] Z. Liu, X. Deng, S. Chen, A. Wang, Q. Guo, M. Han, Z. Xue, M. Chen, P. Luo, 和 L. Yang。Worldweaver:通过丰富感知生成长视野视频世界。神经信息处理系统进展(NeurIPS),38:46268–46293,2026。

[40] S. Luo, Y. Tan, L. Huang, J. Li, 和 H. Zhao。潜在一致性模型:通过少步推理合成高分辨率图像。arXiv 预印本 arXiv:2310.04378,2023。

[41] Y. Luo, X. Shi, J. Bai, M. Xia, T. Xue, X. Wang, P. Wan, D. Zhang, 和 K. Gai。Camclonemaster:实现基于参考的视频生成相机控制。在 SIGGRAPH Asia 2025 会议论文,第 1–10 页,2025。

[42] Z. Lyu, C. Si, J. Song, Z. Yang, Y. Qiao, Z. Liu, 和 K.-Y. K. Wong。Fastercache:无需训练的高质量视频扩散模型加速。在国际学习表征会议(ICLR)论文集,第 33132–33156 页,2025。

[43] G. Ma, H. Huang, K. Yan, L. Chen, N. Duan, S. Yin, C. Wan, R. Ming, X. Song, X. Chen 等。Step-video-t2v 技术报告:视频基础模型实践、挑战与未来。arXiv 预印本 arXiv:2502.10248,2025。

[44] X. Mao, Z. Li, C. Li, X. Xu, K. Ying, 和 K. Zhang。Yume1.5:一种文本控制的交互式世界生成模型。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 7752–7761 页,2026。

[45] X. Mao, S. Lin, Z. Li, C. Li, W. Peng, T. He, J. Pang, M. Chi, Y. Qiao, 和 K. Zhang。Yume:一种交互式世界生成模型。arXiv 预印本 arXiv:2507.17744,2025。

12

第 13 页

[46] W. Menapace, A. Siarohin, S. Lathuilière, P. Achlioptas, V. Golyanik, S. Tulyakov, 和 E. Ricci。可提示的游戏模型:通过掩码扩散模型进行文本引导的游戏模拟。ACM 图形学汇刊,43(2):1–16,2024。

[47] 微软研究院。Whamm! 交互式环境的实时世界建模。https://www.microsoft.com/en-us/research/articles/whamm-real-time-world-modelling-of-interactive-environments/,2025。

[48] J. Parker-Holder, P. Ball, J. Bruce, V. Dasagi, K. Holsheimer, C. Kaplanis, A. Moufarek, G. Scully, J. Shar, J. Shi 等人。Genie 2:大规模基础世界模型。https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model,2024。

[49] W. Peebles 和 S. Xie。基于 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集,第 4195–4205 页,2023。

[50] R. Po, Y. Nitzan, R. Zhang, B. Chen, T. Dao, E. Shechtman, G. Wetzstein, 和 X. Huang。长上下文状态空间视频世界模型。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集,第 8733–8744 页,2025。

[51] A. Polyak, A. Zohar, A. Brown, A. Tjandra, A. Sinha, A. Lee, A. Vyas, B. Shi, C.-Y. Ma, C.-Y. Chuang 等人。Movie gen:一组媒体基础模型。arXiv 预印本 arXiv:2410.13720,2024。

[52] X. Ren, T. Shen, J. Huang, H. Ling, Y. Lu, M. Nimier-David, T. Müller, A. Keller, S. Fidler, 和 J. Gao。Gen3c:具有精确相机控制的 3D 感知世界一致视频生成。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,第 6121–6132 页,2025。

[53] R. Rombach, A. Blattmann, D. Lorenz, P. Esser, 和 B. Ommer。使用潜在扩散模型进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,第 10684–10695 页,2022。

[54] Runway。介绍 Gen-3 Alpha。https://runwayml.com/research/introducing-gen-3-alpha,2024。

[55] T. Salimans 和 J. Ho。用于快速采样扩散模型的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512,2022。

[56] T. Shen, S. Bahmani, K. He, S. G. Srinivasan, T. Cao, J. Ren, R. Li, Z. Wang, N. Sharp, Z. Gojcic 等人。Lyra 2.0:可探索的生成式 3D 世界。arXiv 预印本 arXiv:2604.13036,2026。

[57] J. Shin, Z. Li, R. Zhang, J.-Y. Zhu, J. Park, E. Shechtman, 和 X. Huang。Motionstream:具有交互式运动控制的实时视频生成。arXiv 预印本 arXiv:2511.01266,2025。

[58] Y. Song, P. Dhariwal, M. Chen, 和 I. Sutskever。一致性模型。在国际机器学习会议 (ICML),2023。

[59] J. Tang, J. Liu, J. Li, L. Wu, H. Yang, P. Zhao, S. Gong, X. Yuan, S. Shao, L. Zhang 等人。Hunyuan-gamecraft-2:遵循指令的交互式游戏世界模型。arXiv 预印本 arXiv:2511.23429,2025。

[60] R. Team, Z. Gao, Q. Wang, Y. Zeng, J. Zhu, K. L. Cheng, Y. Li, H. Wang, Y. Xu, S. Ma 等人。推进开源世界模型。arXiv 预印本 arXiv:2601.20540,2026。

[61] Team HunyuanWorld。Hy-world 1.5:具有实时延迟和几何一致性的交互式世界建模系统框架。arXiv 预印本,2025。

[62] Team HY-World。Hy-world 2.0:用于重建、生成和模拟 3D 世界的多模态世界模型。arXiv e-prints,2026。

[63] 腾讯混元基础模型团队。Hunyuanvideo 1.5 技术报告,2025。

[64] H. Teng, H. Jia, L. Sun, L. Li, M. Li, M. Tang, S. Han, T. Zhang, W. Zhang, W. Luo 等人。Magi-1:大规模自回归视频生成。arXiv 预印本 arXiv:2505.13211,2025。

13

第 14 页

[65] D. Valevski, Y. Leviathan, M. Arar, 和 S. Fruchter。扩散模型是实时游戏引擎。在《国际学习表征会议》(ICLR),第 73754–73776 页,2025 年。

[66] T. Wan, A. Wang, B. Ai, B. Wen, C. Mao, C.-W. Xie, D. Chen, F. Yu, H. Zhao, J. Yang 等人。Wan:开放且先进的超大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025 年。

[67] F.-Y. Wang, Z. Huang, X. Shi, W. Bian, G. Song, Y. Liu, 和 H. Li。Animatelcm:通过解耦一致性学习加速个性化扩散模型和适配器的动画生成。在《SIGGRAPH Asia 2024 技术通讯》,2024 年。

[68] J. Wang, L. Ye, T. Lu, J. Xiao, J. Zhang, Y. Guo, X. Liu, R. Chellappa, C. Peng, A. Yuille 等人。Evoworld:通过显式 3D 记忆进行全景世界生成的演化。arXiv 预印本 arXiv:2510.01183,2025 年。

[69] X. Wang, S. Zhang, H. Zhang, Y. Liu, Y. Zhang, C. Gao, 和 N. Sang。Videolcm:视频潜在一致性模型。arXiv 预印本 arXiv:2312.09109,2023 年。

[70] Y. Wang, Q. Zhang, S. Cai, T. Wu, J. Ackermann, Z. Kuang, Y. Zheng, F. Rajiˇc, S. Tang, 和 G. Wetzstein。Bullettime:视频生成中时间与相机姿态的解耦控制。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR),第 18319–18330 页,2026 年。

[71] Z. Wang, Z. Liu, J. Li, K. Huang, B. Xu, F. Kang, M. An, P. Wang, B. Jiang, Y. Wei 等人。Matrix-game 3.0:具有长程记忆的实时流式交互世界模型。arXiv 预印本 arXiv:2604.08995,2026 年。

[72] Z. Wang, Z. Yuan, X. Wang, Y. Li, T. Chen, M. Xia, P. Luo, 和 Y. Shan。Motionctrl:用于视频生成的统一且灵活的运动控制器。在《ACM SIGGRAPH 2024 会议论文集》,第 1–11 页,2024 年。

[73] R. Wu, X. He, M. Cheng, T. Yang, Y. Zhang, Z. Kang, X. Cai, X. Wei, C. Guo, C. Li 等人。Infinite-world:通过无姿态分层记忆将交互世界模型扩展至 1000 帧视界。arXiv 预印本 arXiv:2602.02393,2026 年。

[74] T. Wu, S. Yang, R. Po, Y. Xu, Z. Liu, D. Lin, 和 G. Wetzstein。具有长期空间记忆的视频世界模型。《神经信息处理系统进展》(NeurIPS),38:49371–49393,2026 年。

[75] Z. Xiao, Y. Lan, Y. Zhou, W. Ouyang, S. Yang, Y. Zeng, 和 X. Pan。Worldmem:具有记忆的长期一致世界模拟。《神经信息处理系统进展》(NeurIPS),38:49632–49652,2026 年。

[76] D. Xu, W. Nie, C. Liu, S. Liu, J. Kautz, Z. Wang, 和 A. Vahdat。Camco:相机可控的 3D 一致性图像到视频生成。arXiv 预印本 arXiv:2406.02509,2024 年。

[77] M. Yang, J. Li, Z. Fang, S. Chen, Y. Yu, Q. Fu, W. Yang, 和 D. Ye。可玩游戏生成。arXiv 预印本 arXiv:2412.00887,2024 年。

[78] S. Yang, W. Huang, R. Chu, Y. Xiao, Y. Zhao, X. Wang, M. Li, E. Xie, Y. Chen, Y. Lu 等人。Longlive:实时交互长视频生成。arXiv 预印本 arXiv:2509.22622,2025 年。

[79] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng 等人。Cogvideox:基于专家 Transformer 的文生视频扩散模型。在《国际学习表征会议》(ICLR),第 83048–83077 页,2025 年。

[80] T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 W. T. Freeman。改进的分布匹配蒸馏以实现快速图像合成。《神经信息处理系统进展》(NeurIPS),37:47455–47487,2024 年。

[81] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park。使用分布匹配蒸馏的一步扩散。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR),第 6613–6623 页,2024 年。

[82] T. Yin, Q. Zhang, R. Zhang, W. T. Freeman, F. Durand, E. Shechtman, 和 X. Huang。从缓慢的双向到快速的因果视频生成器。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR),2025 年。

14

第 15 页

[83] J. Yu, J. Bai, Y. Qin, Q. Liu, X. Wang, P. Wan, D. Zhang, and X. Liu. Context as memory: Scene-consistent interactive long video generation with memory retrieval. In SIGGRAPH Asia 2025 Conference Papers, pages 1–11, 2025.

[84] J. Yu, Y. Qin, X. Wang, P. Wan, D. Zhang, and X. Liu. Gamefactory: Creating new games with generative interactive videos. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 11590–11599, 2025.

[85] M. Yu, W. Hu, J. Xing, and Y. Shan. Trajectorycrafter: Redirecting camera trajectory for monocular videos via diffusion models. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 100–111, 2025.

[86] Y. Yu, X. Wu, X. Hu, T. Hu, Y. Sun, X. Lyu, B. Wang, L. Ma, Y. Ma, Z. Wang, et al. Videossm: Autoregressive long video generation with hybrid state-space memory. arXiv preprint arXiv:2512.04519, 2025.

[87] S. Yuan, Y. Yin, Z. Li, X. Huang, X. Yang, and L. Yuan. Helios: Real real-time long video generation model. arXiv preprint arXiv:2603.04379, 2026.

[88] C. Zhang, B. Li, M. Wei, Y.-P. Cao, C. Gambardella, D. Phung, and J. Cai. Unified camera positional encoding for controlled video generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 38027–38037, 2026.

[89] D. J. Zhang, R. Paiss, S. Zada, N. Karnad, D. E. Jacobs, Y. Pritch, I. Mosseri, M. Z. Shou, N. Wadhwa, and N. Ruiz. Recapture: Generative video camera controls for user-provided videos using masked video fine-tuning. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2050–2062, 2025.

[90] K. Zhang, J. Xu, Y. Mei, and V. M. Patel. Endless world: Real-time 3d-aware long video generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 18386–18395, 2026.

[91] L. Zhang, S. Cai, M. Li, G. Wetzstein, and M. Agrawala. Frame context packing and drift prevention in next-frame-prediction video diffusion models. Advances in Neural Information Processing Systems (NeurIPS), 38:30546–30566, 2026.

[92] L. Zhang, S. Cai, M. Li, C. Zeng, B. Lu, A. Rao, S. Han, G. Wetzstein, and M. Agrawala. Pretraining frame preservation in autoregressive video memory compression. arXiv preprint arXiv:2512.23851, 2025.

[93] J. Zhao, F. Wei, Z. Liu, H. Zhang, C. Xu, and Y. Lu. Spatia: Video generation with updatable spatial memory. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 4245–4257, 2026.

[94] X. Zhao, X. Jin, K. Wang, and Y. You. Real-time video generation with pyramid attention broadcast. In International Conference on Learning Representations (ICLR), pages 3296–3319, 2025.

[95] Z. Zhao, Y. Lu, Z. Liu, J. Song, J. Deng, and I. Patras. Relax forcing: Relaxed kv-memory for consistent long video generation. arXiv preprint arXiv:2603.21366, 2026.

[96] G. Zheng, T. Li, R. Jiang, Y. Lu, T. Wu, and X. Li. Cami2v: Camera-controlled image-to-video diffusion model. arXiv preprint arXiv:2410.15957, 2024.

[97] Z. Zheng, X. Peng, T. Yang, C. Shen, S. Li, H. Liu, Y. Zhou, T. Li, and Y. You. Open-sora: Democratizing efficient video production for all. arXiv preprint arXiv:2412.20404, 2024.

[98] Z. Zhou, J. An, and J. Luo. Latent-reframe: Enabling camera control for video diffusion models without training. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 12779–12789, 2025.

[99] H. Zhu, H. Liu, Y. Zhao, T. Ye, J. Chen, J. Yu, T. He, S. Han, and E. Xie. Sana-wm: Efficient minute-scale world modeling with hybrid linear diffusion transformer. arXiv preprint arXiv:2605.15178, 2026.

15

发表评论