快速导读:Wonder 的核心创新在于将控制信号从抽象嵌入转化为像素空间坐标场,并采用稀疏全保真记忆机制。像素空间坐标场通过渲染 3D 晶格和环境贴图,提供密集的视觉线索,提高控制精度。稀疏记忆机制则保留完整 KV Cache,通过轻量级池化摘要选择关键块,确保低延迟与长期一致性。
视频生成正从固定时长片段向交互式世界建模转变。然而,现有方法难以同时兼顾精准相机控制、长期记忆一致性和实时推理效率。Wonder 论文提出了一种新的视频世界模型架构,旨在解决这一三角矛盾。
该模型通过引入像素空间坐标场(Pixel-Space Coordinate Field)替代抽象嵌入,实现了更稳定的相机控制。同时,利用稀疏上下文强制(Sparse Context Forcing)和全保真 KV Cache 记忆机制,模型能够在长程生成中保持场景一致性。最后,通过 Mixture-of-Students 蒸馏策略,Wonder 实现了分钟级的实时交互探索。
英文题目:Wonder: Video World Model Done Better
论文出处:arXiv 每日论文精选 · arXiv:2607.26037
原始论文:PDF / 论文页面
对应视频标题:Wonder:如何用稀疏注意力解决视频世界模型的长程记忆与控制漂移|推荐指数:★★★★★
这篇论文解决什么问题?
当前视频世界模型面临三大核心挑战。首先,控制精度不足:隐式控制(如姿态嵌入)在蒸馏过程中容易漂移,而显式控制(如点云重渲染)计算量大且视角受限。其次,长期记忆丢失:密集注意力导致延迟随序列长度线性增长,而压缩记忆机制往往牺牲视觉保真度。最后,推理效率低下:现有方法难以在保持高画质的同时实现实时帧率。
具体而言,当用户尝试在生成的世界中长时间探索或返回先前位置时,模型往往无法保持场景结构的一致性,出现物体变形或消失。此外,相机运动的微小误差会在长程生成中累积,导致严重的控制漂移。这些问题限制了视频世界模型在交互式应用中的实际可用性。
为了解决这些问题,Wonder 重新设计了控制信号表示、记忆机制和训练策略。它不再依赖抽象的嵌入向量,而是将相机运动转化为可视化的像素空间坐标场。同时,它摒弃了传统的密集注意力,转而采用基于相似度的稀疏记忆检索。
核心创新
方法概览
Wonder 的核心创新在于将控制信号从抽象嵌入转化为像素空间坐标场,并采用稀疏全保真记忆机制。像素空间坐标场通过渲染 3D 晶格和环境贴图,提供密集的视觉线索,提高控制精度。稀疏记忆机制则保留完整 KV Cache,通过轻量级池化摘要选择关键块,确保低延迟与长期一致性。
- 像素空间坐标场:Wonder 将相机运动转化为密集的、帧对齐的视觉线索,包括渲染的 3D 晶格和环境贴图。这种方法比抽象嵌入更直观,有助于模型学习精确的相机-图像对应关系,从而提高控制精度和蒸馏稳定性。
- 稀疏全保真记忆:模型保留完整的 KV Cache 作为记忆库,但在推理时仅通过轻量级的池化查询-键相似度选择固定数量的相关块进行注意力计算。这确保了推理延迟恒定,同时保留了足够的全保真信息以支持长期一致性。
- 稀疏上下文强制:在训练因果学生模型时,Wonder 随机丢弃非局部上下文边,模拟推理时的稀疏注意力模式。这种训练策略使学生模型能够适应稀疏推理条件,避免训练-推理不匹配导致的性能下降。
- Mixture-of-Students 蒸馏:为了增加模型容量而不增加推理延迟,Wonder 使用多个专用生成器(G1, G2, G3)处理不同的去噪步骤。这种混合策略提高了生成质量,同时保持了高效的推理速度。
- GAN 控制正则化:在蒸馏过程中,引入对抗性目标函数,专注于冻结教师模型的低频特征差异。这有助于防止相机漂移,确保学生模型在控制信号上的稳定性。
逐图理解论文
失败案例:控制漂移与记忆丢失

图 9 对比了不同模型在回访轨迹下的表现。Wonder 能够保持场景结构的一致性,而 RELIC 和 LingBot-World 等模型在长程生成中出现结构不一致或外观变化。这突显了 Wonder 在长期记忆保持方面的优势。
核心区分:像素空间坐标场与稀疏记忆

图 5 详细说明了稀疏上下文强制和稀疏推理机制。左侧展示了训练过程中随机丢弃非局部上下文边的策略,右侧展示了推理时基于池化查询-键相似度选择固定数量记忆块的机制。这种设计确保了训练与推理的一致性,同时保持了低延迟。
方法贡献:稀疏上下文强制与 MoS 蒸馏

为对齐训练与推理,Wonder 引入稀疏上下文强制,在训练时随机丢弃非局部上下文边。同时,采用 Mixture-of-Students 蒸馏策略,使用多个专用生成器处理不同去噪步骤,增加模型容量而不增加推理延迟。GAN 控制正则化进一步防止相机漂移,确保蒸馏稳定性。
最强结论:实时高保真长程探索

表 1 总结了 Wonder 在视觉质量和控制精度方面的表现。Wonder 在 I2V 和 V2V 任务中均取得了最佳的平均得分和最低的 RPE,证明了其在综合性能上的优越性。
意义与局限:算力需求与位姿依赖

Wonder 解决了视频世界模型的核心矛盾,但其训练需要 32 张 H200 GPU,且依赖外部位姿估计,可能引入噪声。V2V 训练限于短序列,长程学习主要依赖 I2V。尽管如此,它为交互式视频生成提供了新的技术路径。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 评估基准:Wonder 在 Image-to-Video (I2V) 和 Video-to-Video (V2V) 两个基准上进行评估。I2V 基准包含 1,000 张多样图像,每张图像对应 5 种相机轨迹。V2V 基准包含 500 个动态视频,每个视频对应 6 种相机轨迹。
- 评估指标:使用 VBench 评估视觉质量,包括成像、美学、动态、运动和闪烁等维度。同时,使用相对位姿误差(Relative Pose Error, RPE)评估平移和旋转的准确性。
- 对比基线:Wonder 与 RELIC、LingBot-World、Inspatio-World 和 SANA-WM-Streaming 等主流视频世界模型进行对比。
关键结果与论文证据
- 视觉质量:在 I2V 任务中,Wonder 的平均得分为 0.8558,显著优于 RELIC (0.8225) 和 LingBot-World (0.8261)。在 V2V 任务中,Wonder 的平均得分为 0.8527,优于 Inspatio-World (0.8374)。
- 控制精度:在 I2V 任务中,Wonder 的平移 RPE 为 0.0132,旋转 RPE 为 0.0784,均低于最佳基线 SANA-WM (0.0240 和 0.1155)。在 V2V 任务中,Wonder 的平移 RPE 为 0.0187,旋转 RPE 为 0.1119,显著优于 Inspatio-World (0.0436 和 0.2470)。
- 长期一致性:在回访轨迹测试中,Wonder 能够保持场景结构的一致性,而 RELIC 和 LingBot-World 等模型在长程生成中出现结构不一致或外观变化。
- 实时性能:Wonder 实现了 16 FPS 的实时生成,并在分钟级的长程 rollout 中保持稳定的延迟。
阅读时需要注意
- 训练成本高:Wonder 需要 32 张 NVIDIA H200 GPU 进行训练,计算资源需求巨大。
- 依赖外部位姿估计:数据策展依赖 Depth Anything 3 等外部位姿估计模型,可能引入噪声。
- V2V 训练限制:由于内存限制,V2V 训练主要限于较短的时间跨度(5秒),长程学习主要依赖 I2V 任务。
关联工作
- RELIC 和 LingBot-World:这些基线模型在长程 rollout 中视觉质量下降,难以保持长期记忆。
- Inspatio-World:由于点云重建误差和有限的探索空间,该模型在大幅视角变化下难以产生合理的相机运动并保留动态对象。
- SANA-WM-Streaming:虽然也是流式世界模型,但其平移和旋转 RPE 高于 Wonder。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Wonder:更优的视频世界模型 徐家聪∗,1,2,姜汉文1,舒志新1,Kalyan Sunkavalli1, Vishal M. Patel2,梅一群∗†,1
1 Adobe Research,2 约翰斯·霍普金斯大学 ∗ 同等贡献,† 项目负责人。
我们提出了 Wonder,这是一种通用的视频世界模型,支持实时的、由相机控制的世界探索。 给定一张图像或条件视频,Wonder 构建一个可玩的世界,用户可以在其中通过移动相机进行 交互式导航,发现未观察到的区域,并在实时和长期范围内重访之前观察到的区域。 实现这一能力需要对控制方法、记忆机制和训练策略进行系统级的协同设计。我们引入了一种新颖的相机条件化方法,结合稠密坐标场(Pixel-Space Coordinate Field),其渲染结果提供空间对齐的运动和方向线索,使模型能够直接将相机运动解释为视觉证据。为了支持在增长生成上下文中的快速且精确的记忆检索,我们提出了一种基于稀疏注意力的记忆机制(Sparse Context Forcing),使模型在推理时能够选择性地关注少量相关的上下文 token,而与实际上下文长度无关。我们进一步开发了几种技术来修正自强制式蒸馏(self-forcing-style distillation)流水线,提高了学生模型(Student Model)遵循控制信号的能力,同时保持来自教师模型的多样化生成模式和长期记忆。这些组件共同使 Wonder 能够以 16 FPS 的帧率合成多样化的、分钟级时长的视频,同时在长达 2026 帧的长序列生成中保持几何、外观和动力学的连贯性。除了图像到视频(Image-to-Video, I2V)生成外,Wonder 自然支持视频条件化生成,允许对现有的动态场景进行实时重拍。 日期:2026年6月17日 项目页面:https://wonder-world-model.github.io/
1 引言 [cs.CV] 视频生成正迅速从固定时长的片段合成向交互式视觉世界建模演变,潜在应用包括游戏创作 (Tang et al., 2025)、虚拟制作 (Rahimi et al., 2025) 和机器人技术 (Xiao et al., 2025)。在这些场景中,模型应从初始条件(如图像、视频或文本提示)构建持久的视觉环境,并允许用户或智能体通过控制信号进行探索。这种转变提出了超越视觉保真度的要求。交互式应用需要准确的控制跟随和低延迟响应;仿真设置需要长期连贯性;编辑工作流要求模型在控制下保留源内容。同时实现这些特性仍然具有挑战性,因为可控性、记忆和实时效率往往对模型架构和训练流水线提出相互冲突的需求。
大多数现有方法 (Wang et al., 2026b; Li et al., 2025; Team et al., 2026a) 仅解决了这些需求的一个子集。相机可控视频生成器提供准确的轨迹条件化,但它们通常是双向的、固定长度的且计算昂贵,使其不适合低延迟交互或分钟级长序列生成 (Bai et al., 2025a; Yu et al., 2025)。自回归视频扩散和蒸馏方法通过将双向模型转换为因果少步生成器来提高流式传输效率,但它们通常侧重于视频延续,并未明确解决精确的相机跟随、持久的空间记忆或一致的重访问题 (Huang et al., 2025c; Cui et al., 2025; Zhu et al., 2026b)。最近的交互式世界模型系统试图结合控制、记忆和实时生成,但每个组件都引入了新的权衡:抽象的姿态或射线条件在蒸馏后可能会漂移 (Zhu et al., 2026a; Team et al., 2025),基于重建的控制仅限于观察到的视图 (Yu et al., 2024; Team et al., 2026b),稠密的历史注意力随生成序列长度增加延迟 (Robbyant Team, 2026),而压缩或滑动窗口记忆会丢失视觉细节 (Hong et al., 2025)。因此,现有系统仍然难以同时实现准确的控制、忠实的长期记忆和稳定的实时推理。
在本报告中,我们提出了 Wonder,这是一种通用的视频世界模型,支持实时的、相机可控的世界探索。
1
第 2 页
探索。Wonder 遵循常见的教师-学生范式:将双向视频扩散模型适配用于相机控制,将其转换为因果自回归生成器,并将其蒸馏为少步流式模型。与先前在很大程度上孤立优化这些阶段的系统不同,Wonder 将管道视为一个耦合系统。我们联合重新设计了控制表示、记忆机制和蒸馏策略,以从教师模型到实时学生模型保持可控性、持久性和效率。因此,Wonder 支持图像和视频条件引导的探索,具备准确的相机跟随、连贯的长程记忆、开放式生成以及稳定的实时延迟。我们将我们的设计具体说明如下:
1. 控制。我们引入了一种新颖的相机控制表示法,将相机运动暴露为渲染的视觉证据,而不仅仅是相机几何结构。虽然位姿(Hong et al., 2025)或普吕克射线(Plücker-ray)(Wang et al., 2026a)提供了每图像或像素射线的几何信息,但它们仍然需要扩散模型来推断这些坐标应如何转化为图像运动。相反,我们沿目标相机轨迹渲染合成 3D 支架和环境贴图,直接将平移、旋转和视差转化为帧对齐的视觉线索。由于渲染的场景是合成的而非从输入重建的,因此即使在观察视角之外,控制信息依然丰富,从而支持针对开放式图像和视频条件引导探索的准确且可流式传输的相机控制。此外,由于渲染的线索具有明确的视觉语义,它们在少步自回归蒸馏过程中比抽象嵌入更好地得以保留,从而减少了实时学生模型中的控制漂移。
2. 记忆。我们开发了一种稀疏全保真记忆机制,以实现高效的长程生成。交互式世界模型需要近期上下文以保持局部运动连续性,需要远期上下文以保持持久的场景记忆,但密集地(Robbyant Team, 2026)关注所有历史 KV 状态会导致每步延迟随 rollout 长度增长。现有系统通过压缩历史(Hong et al., 2025)、重建上下文(Huang et al., 2025b)、使用滑动窗口(He et al., 2025b)或依赖基于几何的检索(Team et al., 2026a)来降低此成本,但这牺牲了记忆保真度、重访一致性或检索鲁棒性。相反,Wonder 将记忆存储与注意力计算解耦:它以全保真度保留不断增长的历史 KV 缓存,但使用轻量级的池化查询-键摘要,在每个 rollout 步骤中选择一组固定大小的相关记忆块。仅对选定的块使用全分辨率的键和值进行注意力计算,从而在生成序列增长时,既保留了用于重访的忠实视觉历史,又使活跃注意力成本和每步延迟保持稳定。此外,我们引入了一种协同设计的训练策略,即稀疏上下文强制(Sparse Context Forcing),该策略在学生模型中稳定地激活这种稀疏记忆能力,使得因果学生模型能够在与推理时相同的检索记忆条件下平滑地学习生成内容。
3. 蒸馏。我们围绕在实时学生模型中保留教师模型能力的目标,重新设计了少步自回归蒸馏。因果学生模型必须用远少于去噪步数的步骤来近似双向多步教师模型,这导致了生成多样性的降低和相机漂移的累积。我们通过时间步混合的学生模型(timestep-wise mixture-of-students)来解决这两个损失,该模型在不改变流式接口的情况下增加了有效的学生模型容量;以及相机感知的对抗正则化器(camera-aware adversarial regularizer),该正则化器在蒸馏过程中提供低频控制监督。两者结合,使得少步学生模型在长自回归 rollout 过程中能够保留视觉质量、多样性和相机跟随准确性。
在图像和视频条件设置下的实验表明,Wonder 在视觉质量和相机跟随准确性方面优于最近的流式世界模型。该模型支持超出观察视角的探索,在重新渲染源视频时保留动态内容,并在长轨迹上保持连贯的重访。它以 16 FPS 生成分钟级的 rollout,且随着历史增长保持稳定的延迟。
2 相关工作
视频扩散模型。现代文本到视频和图像到视频生成器通常构建在 3D VAE 潜在空间中的扩散 Transformer 之上。开源的 DiT/MMDiT 风格骨干网络,如 CogVideoX(Yang et al., 2025)、HunyuanVideo(Kong et al., 2024)、Wan(Wan et al., 2025)和 LTX-Video(HaCohen et al., 2026),能够合成多秒高保真视频片段,并已成为下游视频生成任务的事实上的预训练基础。然而,这些模型是双向的,并在单次操作中去噪固定长度的片段,这使得它们不太适合交互式控制和无界 rollout。
自回归视频生成。另一条工作路线将双向视频扩散模型转换为因果自回归生成器。Diffusion Forcing(Chen et al., 2024)通过分配
2
第 3 页
Wonder I2VDual +ModalityV2V 实时16 FPS生成 像素空间坐标场 控制 快速 内存 稀疏注意力
I2V 图像到视频 世界探索
V2V 视频到视频 重拍
图 1 Wonder 支持从图像和视频进行交互式世界探索。给定单张图像,Wonder 将其转化为可导航的世界,用户可移动相机以探索可见区域及输入视角外合理的不可见区域。给定视频,Wonder 构建动态世界,在保留源运动的同时允许用户自由更改相机轨迹,实现相机可控的 4D 视频探索。
独立噪声水平应用于各个 token。CausVid (Yin et al., 2025) 通过分布匹配蒸馏 (Yin et al., 2024b) 将双向教师蒸馏为几步因果学生。Self-Forcing (Huang et al., 2025c) 通过在训练期间让学生基于自身预测进行 rollout 进一步缩小训练-推理差距,而 Rolling Forcing (Liu et al., 2025) 和 Causal Forcing (Zhu et al., 2026b) 将此范式扩展至长视界、实时流式生成。这些方法共同建立了低延迟、支持 KV-cache 的自回归基础,使交互式视频世界模型成为可能。
相机可控视频生成。姿态条件视频扩散已成为轨迹控制视频合成的标准方法。MotionCtrl (Wang et al., 2024) 将 6-DoF 相机外参注入视频扩散模型,CameraCtrl (He et al., 2025a) 引入 Plücker 嵌入作为插件适配器,ViewCrafter (Yu et al., 2024) 基于点云渲染条件生成以提高几何一致性。ReCamMaster (Bai et al., 2025a) 将相机控制表述为沿新轨迹的视频到视频重渲染,后续工作 (Wang et al., 2026a; Huang et al., 2025d) 进一步解耦相机运动与场景动态及时空相关性。这些相机条件设计启发了近期视频世界模型的进展。
交互式视频世界模型。与我们的工作最相关的是响应用户操作的神经模拟器。Genie 3 (Ball et al., 2025) 生成通用、文本提示可交互的世界,代表了当前闭源前沿。并行地,包括 Matrix-Game 及其实时/流式后继者 (Zhang et al., 2025; He et al., 2025b; Wang et al., 2026b)、MineWorld (Guo et al., 2025)、Hunyuan-GameCraft (Li et al., 2025) 及其指令跟随扩展 Hunyuan-GameCraft-2 (Tang et al., 2025)、Yume (Mao et al., 2025) 和 RELIC (Hong et al., 2025) 在内的快速增长的开源工作线,探索了实时流式、长视界记忆和更丰富的动作接口。最近,LingBot-World (Robbyant Team, 2026) 和 DreamX-World (Team et al., 2026a) 在照片级真实、游戏风格和卡通领域实现了分钟级上下文的实时流式。最接近我们设置的是 Inspatio-World (Team et al., 2026b),它为实时动态世界建模和重渲染提供了 I2V 和 V2V 基线。这些先前工作从不同角度推进了视频世界建模,但仍面临相机漂移、记忆丢失和长视界 rollout 期间视觉质量下降等持续挑战。相比之下,Wonder 在控制表示、记忆机制和蒸馏方面采用了系统级协同设计
3
第 4 页
1 数据收集与生成 2 视频标注与位姿估计 3 质量检查与最终数据集
开源分层静态 数据集:字幕生成: DL3DV, CamXTime, Global Summary, MultiCamVideo… 多长度字幕……
自采集位姿与动作字幕:阳光充足的现代客厅带阳台…… 数据集:估计: UE Navigation, 外参与内参动态 Blender 时空预测,动作…… 渲染……
裁剪与平滑字幕:一名男子穿过现代公寓,从 过滤与平衡: 客厅走向厨房。场景展示了一个 多长度裁剪,平滑位姿噪声,温暖、舒适的家居内部,有沙发区、厨房、餐桌、书架、室内植物和柔和的傍晚灯光。 碰撞过滤…… 平衡动作…… 字幕:一个人站在餐桌旁的厨房里……
原始视频池 丰富视频片段 静态与动态数据集
图像到世界 视频到世界
输入图像 生成视频 输入视频 生成视频
图 2 数据策展流程。我们构建了一个统一的图像到世界(I2W)和视频到世界(V2W)训练数据引擎。我们首先从公开数据集和自渲染的 UE/Blender 环境中收集视频,然后进行多时长裁剪、碰撞过滤和基于规则的质量筛选以构建原始视频池。每个片段进一步通过 Depth Anything 3 (DA3) 估计的层次化 VLM 字幕和相机位姿进行丰富,从中我们推导出离散的相机动作。为了提高轨迹质量和动作覆盖率,我们应用高斯位姿平滑以及反向播放和速度重采样等时间增强。最终的基于 VLM 的质量检查移除了视觉退化的片段和具有不自然相机运动的序列,从而得到用于可控世界模型训练的策展静态和动态数据集。
策略,有效缓解了这些问题,并实现了更稳定的交互式世界探索。
3 训练数据
训练可控世界模型需要大规模视频,包含多样的视觉内容、准确的相机运动以及足够长的时间跨度。与短视频生成相比,长视界世界建模要求模型强制执行记忆,在扩展的 rollout 中保持场景几何、外观和动态。因此,我们构建了如图 2 所示的统一数据策展流程,以收集、标注和过滤视频片段。
对于 I2V 训练,我们首先利用 DL3DV (Ling et al., 2024) 作为真实世界导航视频的主要来源。它包含多样的场景和自然捕获的相机轨迹,有助于学习真实的几何感知运动。然而,此类真实世界视频中的相机运动通常相对简单和平滑,而交互式用户可能会执行更具挑战性的控制,如急转弯、横向移动、后退运动和复合相机动作。为了更好地覆盖这些困难案例,我们另外使用虚幻引擎 (UE) 构建了大规模合成 I2V 数据集。通过渲染具有类用户控制轨迹的多样室内和室外环境,合成数据为鲁棒的相机可控世界探索提供了更丰富的监督。
对于 V2V 训练,数据要求更具挑战性,因为模型需要共享相同底层动态场景但相机轨迹或时间演化不同的配对视频。尽管 MultiCamVideo (Bai et al., 2025a) 和 CamXTime (Huang et al., 2025d) 等开源数据集提供了有用的配对视频,但它们的片段通常很短,大约 5 秒,这对于长视界世界建模来说是不够的。因此,我们使用 Blender 渲染了大量长配对 V2V 数据。渲染的配对包括标准配对轨迹、速度变化的序列以及子弹时间视频,其中相机运动和场景时间部分解耦。这些数据帮助模型学习空间视角变化与时间场景动态之间的区别,这对于可控 V2V 生成至关重要。
在构建原始视频池后,我们应用统一的标注和过滤流程。我们首先将视频裁剪为多个时长,包括 5 秒、10 秒和 20 秒,以支持从短视界到长视界的渐进式训练。使用基于规则的过滤器移除损坏的视频、黑帧、失败的渲染以及具有碰撞或明显无效运动的轨迹。然后,我们使用 VLM (Bai et al., 2025b) 为每个长片段生成层次化字幕 (Robbyant Team, 2026),包括全局视频级摘要及其短时空子片段的细粒度字幕。对于度量相机监督,我们使用 Depth Anything 3 (DA3) (Lin et al., 2025) 估计相机内参和外参
4
第 5 页
阶段 1 阶段 2 阶段 3 流式传输 双向教师 稀疏 ODE 初始化 少步自回归学生 推理
像素空间坐标 ODE 潜在对 学生模型混合 运行时优化 相机控制 粗略适应 生成保真度 编译、缓存等
多 horizon 训练 稀疏上下文强制 GAN 控制正则化 多 GPU 并行 I2V+V2V,5s 到 20s 内存检索 相机监督 负载分布
图 3 训练和部署流程。Wonder 首先在双向教师中学习高质量的相机控制,然后将模型转换为稀疏上下文因果学生,将其蒸馏为少步自回归生成器,最后使用驻留流式运行时进行部署。
针对真实和合成视频。恢复的轨迹被转换为离散相机动作。由于估计的位姿可能包含高频抖动,我们在动作离散化之前应用高斯平滑,这在抑制噪声位姿波动的同时保留了整体相机路径。我们进一步使用时间增强技术,如反向播放和速度重采样,以平衡动作分布。最后,额外的基于 VLM 的质量检查阶段移除了视觉质量低、相机运动不自然或时间动力学不一致的视频,从而得到用于训练的精心策划的静态和动态数据集。
4 Wonder 世界模型
Wonder 生成遵循用户流式传输相机轨迹的可探索视频。它支持两种推理模式。在图像到视频模式中,单个输入帧初始化一个可探索的世界。在视频到视频模式中,源视频锚定现有事件的外观和运动,而目标相机轨迹指定该事件的新视角。通过在单个模型中统一这两种模式,Wonder 实现了多模态视频世界建模。
遵循近期工作的通用框架 (Hong et al., 2025; Robbyant Team, 2026),我们采用两阶段流程,从双向视频扩散教师中蒸馏少步自回归视频扩散模型,两个模型均以相机控制信号为条件。虽然该框架已显示出有希望的早期结果,但实现高质量、低延迟、内存感知的长 horizon rollout 仍然是一个开放挑战。现有方法往往无法同时满足这些要求:一些方法 (Robbyant Team, 2026; Team et al., 2025) 难以忠实地遵循相机指令;许多方法 (Zhu et al., 2026a; He et al., 2025b; Li et al., 2025) 缺乏显式记忆机制或依赖有损场景摘要 (Hong et al., 2025);而通过保留完整历史 KV 缓存来保留记忆的方法 (Robbyant Team, 2026) 会导致延迟随上下文长度线性增长。这些局限性促使我们系统地重新设计流程,包括控制表示、内存检索机制和自回归训练策略。
我们在图 3 中突出了框架中的几个关键创新。首先,我们重新设计了双向视频扩散教师,使其以密集的像素空间相机表示为条件,使相机运动可以被解释为像素对齐的视觉信号,并产生强大的动作跟随行为(第 4.1.1 节)。然后,我们将该教师蒸馏为少步自回归视频扩散模型,以实现低延迟的交互式流式传输。为了在不增加推理成本的情况下支持长 horizon 生成,我们引入了一种无损但高效的记忆机制,从 KV 缓存中选择性地检索一组紧凑且忠实的历史视频 token。该机制与一种在自回归 rollout 期间诱导涌现式内存检索的训练策略相结合(第 4.2.1 节)。我们进一步通过两种技术改进了自强制训练范式,以减轻蒸馏过程中的质量退化和相机漂移(第 4.2.2 & 4.2.3 节),显著提高了训练稳定性和可控性。最后,我们应用运行时优化,实现实时推理和分钟级生成。
4.1 阶段 1:用于长视频生成的相机条件教师
在我们的设置中,训练具有精确相机跟随和多模态输入支持能力的强大双向教师至关重要,因为它既作为自回归学生的初始化点,又作为蒸馏的监督信号。接下来我们描述用于获得该双向教师的技术。
5
第 6 页
隐式相机控制 点云重渲染 格点表示 相机位姿/外参 输入图像/视频 客厅(渲染格点视频) 重建 A … 相机 … 位姿 展平 … 场景帧(含噪声的真实值) 拼接 [ … ]
位姿引导重渲染 MLP 像素空间坐标场 渲染器 格点 … (相机空间) 遗产大厅(渲染格点视频) … 1. 球面颜色 世界模型 编码 观察方向 世界模型 细化 和旋转角度 … 2. 网格结构捕获 生成轨迹 度量平移。场景帧(含噪声的预测值) 拼接。 生成轨迹 3. 高速渲染 … 支持流媒体应用 … 相机 … t 4. 无限空间 用于自由位姿 t 导航和控制。 B … ❌ 隐式表示 ❌ 数据饥渴 ❌ 准确但视角受限 ❌ 控制不精确 ❌ 未见区域 → 空白渲染 半显式:像渲染一样精确,像导航一样灵活。精确控制 + 自由探索。 ❌ 泛化能力弱 ❌ 不可流式传输
图 4 使用像素空间坐标场进行相机控制。先前的相机控制方法要么是隐式的,使用 MLP(Bai et al., 2025a)或 RoPE(Wang et al., 2026a)编码相机位姿,要么是显式的,重渲染重建的点云(Team et al., 2026b)。前者数据饥渴且通常不精确,而后者准确但视角受限,当相机探索未见区域时会失败。我们的格点表示结合了这两者的优势。我们构建了一个像素空间坐标场,在无穷远处有一个带颜色的球形环境贴图,内部有一个密集的 3D 格点支架。轻量级渲染器将任意相机轨迹转换为像素对齐的格点视频,编码观察方向和度量平移。将这些渲染结果与含噪声的场景输入拼接,为世界建模提供精确、可流式传输且利于探索的相机控制。
4.1.1 像素空间坐标场
如图 4 所示,现有的相机控制方法大致可分为两类:隐式和显式。 隐式方法通常将相机运动表示为由相机外参(Robbyant Team, 2026; Bai et al., 2025a; Hong et al., 2025)导出的低维向量序列。这些向量被投影到高维嵌入中,并以 token 方式注入扩散 Transformer,其中同一潜在帧内的所有空间 token 共享相同的相机条件。虽然紧凑,但这种全局数值表示仅提供粗略的运动线索,因此即使经过大规模训练,模型也难以将其与细微的、局部的或高频的像素空间变化关联起来。基于射线的表示及其与 RoPE 的组合(Wang et al., 2026a; Team et al., 2026a)提供了更几何化的替代方案,但仍存在尺度、原点和深度的歧义。这些局限性在蒸馏过程中变得更加明显:常用的目标如 DMD(Yin et al., 2024b)没有为相机跟随提供直接监督,这通常导致相机漂移,并且在蒸馏模型中针对多样化相机运动的泛化能力较弱。
相比之下,显式方法(Team et al., 2026b; Yu et al., 2024)依赖于离线位姿或几何估计模型,从输入图像或视频中重建点云,然后从用户指定的视角进行重渲染。这种表示提供了强大的几何锚点,并将世界模型的作用减少到细化或修复。然而,它们也引入了一些实际限制。首先,其有效性严重依赖外部位姿、深度或重建模型的质量和鲁棒性。其次,生成的控制信号本质上视角受限:当相机移动到输入中观察到的区域之外时,重渲染的点云通常会变空或变黑,提供很少有用的相机引导并导致控制失败。最后,准确的重建通常需要缓冲多帧并运行额外的外部模块,这引入了延迟并使训练和推理管道复杂化。这些要求使得显式重渲染难以部署在低延迟流媒体应用中。
为了克服这些限制,我们引入了一种像素空间相机表示,将相机运动暴露为视觉证据。具体而言,我们构建了一个合成相机空间,并从目标相机轨迹对其进行渲染,生成与待生成视频空间对齐的条件帧。合成场景由两个互补组件组成。首先,我们在相机空间中放置一个密集的 3D 支架,它为环境提供了显式的空间参数化并减轻了深度歧义。其 2D 投影在相机
6
第 7 页
平移并诱导帧间视差,使模型能够推断度量相机平移,并将渲染结构与条件图像或视频对齐。其次,我们在无穷远处放置一个彩色环境贴图,其外观随相机方向变化,从而为旋转提供明确的线索。结合脚手架和环境贴图,平移和旋转被转换为密集且帧对齐的视觉信号,便于视频扩散模型理解。我们使用轻量级 OpenGL 渲染器实现此表示,以 negligible overhead 在 150 FPS 下合成条件帧。渲染后的帧由 VAE 编码,并与目标噪声潜在变量在通道维度上拼接,随后由 DiT 处理。经验表明,这种表示显著提高了相机可控性并稳定了蒸馏过程。
4.1.2 基础架构
我们的框架基于 Wan2.1-I2V-14B (Wan et al., 2025) 构建,这是一个最初为短视域图像到视频生成开发的双向视频扩散模型。Wan 由两个主要组件组成:时空 VAE 和扩散 Transformer 主干。VAE 通过 3D 因果编码器-解码器将输入视频映射为紧凑的潜在序列,空间分辨率下采样 8 倍,时间分辨率下采样 4 倍。其因果设计和特征缓存机制为我们系统中的流式视频生成提供了自然且高效的接口。扩散主干在分块视频潜在变量上运行。经过一组 Transformer 块后,潜在令牌通过相应的去分块层映射回视频潜在变量。文本提示由 umT5 (Chung et al., 2023) 编码并通过交叉注意力注入,扩散时间步由共享 MLP 嵌入并用于调制 Transformer 块。该架构提供了强大的双向教师初始化,我们进一步将其适配用于相机可控的世界探索。
为了在统一框架内支持图像条件和视频条件生成,我们将模型输入表示为可选的源段后跟目标段。对于视频条件生成,源段对应于条件视频,并提供为干净潜在变量。对于图像条件生成,没有源段;相反,目标视频的第一帧直接作为干净、无噪声的潜在变量提供。噪声仅应用于需要生成的目标帧,而条件潜在变量在训练和推理过程中始终保持干净。重要的是,二值掩码用于区分源段和目标段。源视频的掩码值设为 0,目标视频的掩码值设为 1。类似地,编码后的相机条件潜在变量仅在源段进行零填充,并为整个目标轨迹提供。形式上,令 $z_s$ 为可选的源视频潜在变量,目标潜在变量分解为 $z_t = [z_a, z_p]^T$,其中 $z_a$ 表示干净的目标锚定帧,$z_p$ 表示待生成的目标帧。在扩散时间步 $\tau$ 的模型输入构建为
$u_\tau = [[z_s, z_a, \alpha_\tau z_p + \sigma_\tau \epsilon]^T, [0_{s_m}, 1_{a_m}, 1_{p_m}]^T, [0_{s_c}, z_{c,a}, z_{c,p}]^T]_C$. (1)
这里,$\epsilon \sim \mathcal{N}(0, I)$ 是高斯噪声,$[\cdot]^T$ 和 $[\cdot]_C$ 分别表示沿时间维度和通道维度的拼接。对于位置编码,我们将目标视频的 RoPE 坐标镜像到源视频上,并添加单独的可学习位置嵌入以帮助模型区分源和目标令牌。
4.1.3 多任务多视域训练
我们训练一个单一的学生模型,支持图像到视频和视频到视频生成,并能够扩展到长视域。遵循 (Hong et al., 2025) 的渐进视域蒸馏策略,我们逐步扩展训练视域,而不是直接在最长序列上进行训练。具体而言,我们首先在 5 秒片段上对基础模型进行后训练,同时启用 I2V 和 V2V 任务。然后我们将视域扩展到 10 秒,最后扩展到 20 秒,其中 RoPE 位置通过 YaRN (Peng et al., 2023) 进行外推以支持更长的时间上下文。
直接扩展到长视域的多任务扩展在计算上效率低下,因为 V2V 样本包含源视频和目标视频,因此产生显著更高的内存和计算成本。因此,我们在长视域阶段采用混合长度训练调度。在大多数训练迭代中,我们将 V2V 样本保持在 5 秒视域,同时在当前长视域(即 10 或 20 秒)训练 I2V 样本。这种设计基于以下观察:长视域相机跟随可以从 I2V 数据中有效学习,而 V2V 主要教授源-目标对应关系,可以从较短的配对片段中学习。剩余的迭代仍向模型暴露全视域多任务样本,以保持任务间的兼容性。该策略最大化了训练吞吐量,同时使模型能够泛化到长视域 V2V 动态世界探索。
7
第 8 页
稀疏推理 源视频键 目标视频键 1) 源视频缓存 当前源 … 帧仅查询 源第一帧及其自身。 源 当前视频 第一帧 源帧 源 2) 目标视频推理 池化 KQ 相似度 当前目标 … … 帧关注: 自身 当前 前一个 目标 源 源帧 第一目标帧 第一帧 相似度选定的查询 目标 … … 源目标帧第一帧帧视频 源相似度- 目标 当前 选定帧 第一帧 相似度选定的 前一个目标帧 当前源 目标帧 目标 池化 KQ 相似度
随机 0/1 随机 0/1 确定零 源视频 真实值 预测 自适应 可扩展 稀疏掩码 稀疏掩码 (被屏蔽) 自注意力 教师强制 自注意力 选择 在真实值上下文中推理 在预测中推理
图 5 稀疏上下文强制与稀疏推理。左:在 ODE 初始化期间,我们为 I2V 和 V2V 训练具有统一注意力布局的因果学生模型。源视频 token 仅关注源第一帧及其自身,而目标视频 token 结合教师强制的干净上下文和扩散强制的预测上下文。为了让学生适应稀疏内存推理,我们在真实值和预测区域中随机丢弃符合条件的非局部上下文边,同时保留必需的锚点,如自注意力、第一帧锚点和近期上下文。右:在推理时,源视频被缓存为参考流,每个目标块关注一组固定大小的记忆,包括自身、近期目标块、第一帧锚点、当前/源参考,以及通过池化查询-键相似度选定的额外源/目标块。
4.2 阶段 2:用于实时流式传输的快速自回归学生模型
相机条件教师提供准确的控制,但并非直接可交互:它是双向的,依赖密集注意力,且需要大量去噪步骤,使得实时控制成本过高。遵循最近的视频世界模型管线(Robbyant Team, 2026; Team et al., 2025; Hong et al., 2025),我们将此教师适应并蒸馏为用于低延迟流式生成的自回归少步学生模型。我们的蒸馏框架基于自强制(Huang et al., 2025c),这是一种基于展开的蒸馏范式,旨在减少长视界生成中的暴露偏差。具体而言,学生模型从教师模型初始化,首先使用 ODE 初始化进行训练,在此过程中它在四个去噪时间步上回归预计算的教师 ODE 轨迹。然后,我们在学生模型自身的自回归展开上应用 DMD(Yin et al., 2024b),最小化扩散真实数据分布与学生模型在采样时间步上自诱导生成分布之间的反向 KL 散度。
4.2.1 稀疏上下文强制
在自回归展开期间,学生模型不断将生成的块写入 KV 缓存。随着展开变长,缓存大小相应增加,导致生成速度大致随上下文长度线性下降(Robbyant Team, 2026)。然而,世界建模需要持久记忆以支持对先前观察区域的一致性重访。因此,不能简单地通过滑动窗口策略丢弃缓存(Zhu et al., 2026a; Li et al., 2025; Team et al., 2026a)。现有解决方案仍然有限。一种方法是在潜在空间中压缩远处的历史帧(Hong et al., 2025),但激进的压缩往往导致视觉质量明显下降并削弱长期一致性。另一类工作通过估计当前视点与历史视点之间的视场重叠来检索相关记忆(Yu et al., 2025; Team et al., 2026a)。虽然更具适应性,但此类基于几何的启发式方法在实践中很脆弱:它们依赖于可靠的相机几何结构,并在边缘情况下可能失败,例如从相反视点重访同一位置。
视频扩散模型自然地学习了丰富的跨帧对应关系(Xu et al., 2025)。因此,我们不压缩或丢弃历史 KV 状态,而是保持整个 KV 缓存的完整保真度,并让模型通过内容感知的稀疏注意力检索相关块。如图 5 所示,每个历史块存储其密集键和
8
第 9 页
注意力机制的值,而检索仅使用轻量级的池化键摘要。在每次展开步骤中,将当前查询摘要与历史分块的摘要进行比较,以选择一小部分活跃记忆分块。我们始终保持初始分块和最近的 $r$ 个分块处于活跃状态,前者作为注意力汇聚点(attention sink),后者保留短期运动连续性。
令 $I_c$ 表示缓存分块 $c$ 的令牌索引集,$K_{I_c}$ 和 $V_{I_c}$ 为对应的全分辨率键和值。我们通过池化键 $\bar{K}_c$ 对每个历史分块进行摘要,并将当前查询分块摘要为 $\bar{Q}_t$。活跃记忆集 $A_t$ 通过结合初始分块、最近的 $r$ 个分块以及具有最高查询-键相似度的前 $k$ 个中间历史分块来选择:
$$ A_t = \{0\} \cup N_r(t) \cup \text{TopK}_k \{ \text{sim}(\bar{Q}_t, \bar{K}_c) \}_{c \in M(t)}, \quad (2) $$ $$ K_{\text{ctxt}} = [K_{I_c}]_{c \in A_t}, \quad V_{\text{ctxt}} = [V_{I_c}]_{c \in A_t}. $$
这里,$N_r(t)$ 表示当前分块之前的最近 $r$ 个分块,$M(t)$ 表示排除初始和最近分块后的中间历史分块。$\text{TopK}_k$ 返回相似度得分最高的 $k$ 个分块的索引,$[\cdot]_{c \in A_t}$ 表示按原始时间顺序对选定分块进行拼接。在实践中,我们设置 $r=2$ 以保持局部运动平滑。由于检索仅在轻量级池化摘要上进行,选择开销可忽略不计。同时,选定的分块仍使用其全分辨率键和值进行注意力计算,使模型能够在没有潜在压缩的情况下保留真实的视觉记忆。在固定的 top-k 预算下,无论展开长度如何,活跃注意力上下文保持恒定,从而实现具有稳定延迟的长视域生成。
在分布级蒸馏期间直接应用稀疏注意力是不稳定的,因为学生模型尚未学会在历史上下文不完整的情况下生成。因此,我们在 ODE 初始化期间引入稀疏上下文强制(Sparse Context Forcing),以便学生模型在推理时将遇到的相同记忆约束下进行预热。我们的 ODE 初始化在因果注意力布局下结合了教师强制(Teacher Forcing)(Gao et al., 2024; Hu et al., 2024)和扩散强制(Diffusion Forcing)(Chen et al., 2024)。教师强制上下文提供干净的目标帧以模拟低噪声历史上下文,而扩散强制上下文让学生模型接触之前的噪声目标帧,从而减少自回归展开期间的训练-测试不匹配(Hong et al., 2025)。对于视频到视频(Video-to-Video, V2V)训练,源视频被额外缓存为参考流,其中每个源帧仅关注自身和第一个源帧。对于图像到视频(Image-to-Video, I2V)训练,布局自然退化为仅目标情况。
为了使学生对稀疏记忆检索具有鲁棒性,我们在 ODE 初始化期间随机丢弃符合条件的历史上下文边。必需的边,如自注意力、第一帧锚点和最近上下文帧,始终被保留以维持身份和局部运动连续性。非局部历史边被视为可选记忆,并在每一层和每次前向传播中随机保留。形式上,令 $a(i, j)$ 表示查询分块 $i$ 与键/值分块 $j$ 之间的基础因果关系。我们将 $R$ 定义为必需关系的集合,$O$ 定义为可选历史上下文关系的集合。第 $\ell$ 层的注意力掩码采样如下:
$$ M_{ij}^{(\ell)} = \mathbb{1}[a(i, j) \in R] + b_{ij}^{(\ell)} \mathbb{1}[a(i, j) \in O], \quad b_{ij}^{(\ell)} \sim \text{Bernoulli}(1 – p_\ell). \quad (3) $$
这里,$p_\ell$ 控制可选记忆边的稀疏程度。我们对较长的目标视域使用更强的丢弃率,鼓励模型依赖少量信息丰富的记忆,而不是密集访问完整历史。这种训练策略使 ODE 初始化的学生模型与我们的稀疏推理模式保持一致:即使只有有限的历史分块可用,模型也能学会保持质量和相机一致性。
4.2.2 学生模型混合(Mixture-of-Students, MoS)
经过 ODE 初始化后,学生模型已经能够恢复粗略的场景结构和布局,但在合成细粒度局部细节方面仍然困难。因此,我们进一步使用 DMD(Yin et al., 2024b)优化学生模型,使其展开分布更好地与数据分布对齐。如图 6 所示,少步因果学生模型基于先前生成的干净分块自回归生成完整的视频展开。这些展开随后被添加噪声并输入到双向教师模型和评论家模型中进行分数估计。产生的分数差异为更新学生生成器提供梯度信号。
自强制(Self-forcing)(Huang et al., 2025c)通过在学生模型自身的自回归展开上进行训练来减少暴露偏差。然而,底层的蒸馏问题仍然极具挑战性:学生模型需要使用因果架构和仅几步去噪步骤来近似强大的双向多步教师模型。这些架构和采样约束显著降低了单个学生模型的有效建模能力,使其难以捕捉
第 10 页
(a) DMD 蒸馏用于交互式视频世界模型 ! 因果学生展开 冻结双向教师 分数差异 (DMD) 步骤 1 步骤 2 步骤 3 步骤 4 高质量先验 相机控制 更新 c₁ c₂ c₃ c₄ G G G G (全上下文) 教师分数 sᵀ 学生 − − ! 可训练评论家 !!""#" 学习学生 评论家分数 sᶜ !"!! !"!& !"!' !"!( 分布
(b) 用于 4 步因果生成的学生模型混合 (Mixture-of-Students) (c) 用于相机保真度的 GAN 控制正则化 不同去噪阶段使用不同的学生,共享来自 G₃ 的 KV 缓存。利用低频特征差异线索来强制相机一致性。 ! 控制判别器 步骤 1 步骤 2 步骤 3 步骤 4 真实 (GT) 双向教师 (无梯度) 注册 Token 噪声 干净 干净 潜在 L₁ … M₁ … M₂ … M₃ … 潜在 潜在 G₁ G₂ G₃ G₃ + 高噪声 $
!"# !%!# !%"# !%## 交叉注意力
粗略结构 结构细化 细节细化 最终细节 !"$ !%!$ !%"$ !%#$ z₁ z₂ z₃
来自 G₃ 的共享 KV 缓存 虚假 (学生) 第一层的特征差异 展开潜在 ∆!%! = !%!$ −!"$ ∆!%" = !%"$ −!"$ ∆!%# = !%#$ −!"$ +
+ 高噪声 $ MLP
卷积 卷积 ↓ ↓ 卷积 ↓ ours (学生模型混合) 先前 (单个学生) 额外 真实 / 虚假 推理 (相机一致性) 低频 G₂ G₃ G₃ ! 无 G G G G G₁ 延迟 图 1 图 2 图 1
GAN 控制损失 / 相机控制监督 冻结 ! 可训练 G 学生生成器 教师 (双向) 评论家 注册 Token KV 缓存 低频特征图 信息流
图 6 具有学生模型混合 (Mixture-of-Students) 和 GAN 控制正则化的蒸馏框架。(a) 因果少步学生模型在相机控制下自回归地展开视频块。生成的展开结果被噪声扰动,并由冻结的双向教师和可训练评论家进行评估,其分数差异提供用于更新学生的 DMD 梯度。(b) 为了增加学生侧容量,我们为不同的去噪阶段专门化不同的生成器。4 步采样器使用 G1 进行粗略结构构建,G2 进行结构细化,G3 进行细节细化和最终重建,同时共享相同的流式 KV 缓存以避免额外的推理延迟。(c) 为了提高相机保真度,我们引入了基于低频教师特征差异构建的控制判别器。真实和虚假的噪声潜在变量通过具有相同相机条件的冻结教师传递。中间特征与第一层特征进行比较,下采样为低频图,并通过注册 Token 判别器聚合,以区分相机一致的真实样本和学生展开结果。
教师分布的多种模式。在实践中,这通常导致模式收缩、局部真实感减弱,以及在长视界展开过程中细粒度细节退化。这促使我们引入学生模型混合 (Mixture-of-Students) 设计,在保持相同自回归少步推理接口的同时增加学生侧容量。
受上述容量瓶颈的启发,我们采用了基于时间步的学生模型混合设计,类似于 Wan2.2 (Wan et al., 2025) 中的去噪阶段 MoE。我们的 4 步采样器不使用单个生成器进行所有少步更新,而是使用三个学生生成器:G1 用于第一步,G2 用于第二步,G3 用于最后两步:
ˆx0 = G(4)3 ◦G(3)3 ◦G(2)2 ◦G(1)1 (xτ1), (4)
其中上标表示去噪步骤。该设计根据每个去噪阶段的作用分配容量:G1 专注于粗略结构形成,G2 执行结构细化,G3 负责细节细化和最终重建。
为了保持流式效率,我们不维护不同学生的独立 KV 缓存。相反,所有生成器共享自回归接口并重用 G3 产生的 KV 缓存。因此,学生模型混合 (Mixture-of-Students) 在不改变去噪步骤数量或引入额外推理延迟的情况下增加了有效的学生侧容量。经验上,该设计改善了与教师分布的匹配,导致在长视界展开过程中产生更多样化的输出和更好的细粒度视觉质量。
4.2.3 GAN 控制正则化
基于 DMD (Yin et al., 2024b),DMD2 (Yin et al., 2024a) 在评论家上附加了额外的 GAN 目标,并已被最近的视频世界模型蒸馏管道 (Robbyant Team, 2026) 采用,以改善高频细节和局部真实感。然而,这些目标并非专门为相机控制的自回归视频
10
第 11 页
生成。在我们的设置中,观察到 DMD 训练期间存在一种明显的失效模式:学生模型逐渐丧失相机保真度,生成的相机运动变得更快,偏离目标轨迹,并最终导致严重模糊或场景坍塌。由于相机控制误差随时间累积,这一问题在因果展开(causal rollout)中被放大。
我们将这种相机漂移问题归因于标准 DMD 目标中控制监督的不足。DMD 产生的分数残差主要强调高频局部伪影(如边缘和纹理),但为相机运动引起的低频布局变化提供的梯度较弱。一旦学生展开严重偏离教师的训练分布(例如,相机已经飞离或场景严重退化),冻结的双向教师便无法再提供可靠的分数指导。先前的工作通过在自展开与真实视频之间添加额外的下采样 $\ell_2$ 损失来缓解这种不稳定性(Hong et al., 2025)。虽然这对稳定化有效,但直接回归往往会导致分布收缩,并经常产生模糊的新探索区域。
为解决此问题,我们引入了 GAN 控制正则化(GAN Control Regularization),这是一种对抗性目标,侧重于低频相机一致性线索,而非高频纹理真实性。如图 6(c) 所示,我们通过使用高噪声水平扰动真实潜在变量和学生展开潜在变量,构建真实和虚假的加噪潜在变量:
$z_r^\tau = \alpha_\tau z_0 + \sigma_\tau \epsilon, \quad z_f^\tau = \alpha_\tau \hat{z}_0 + \sigma_\tau \epsilon, \quad \epsilon \sim \mathcal{N}(0, I), \quad (5)$
其中 $z_0$ 表示干净的真实潜在变量,$\hat{z}_0$ 表示学生展开潜在变量,$\tau$ 从高噪声范围中采样。这两个潜在变量均在相同的相机条件 $c$ 下通过冻结的相机条件双向教师进行前向传播。由于教师是固定的,其中间表示提供了一个稳定的相机感知特征空间,用于比较真实和虚假轨迹。我们经验性地发现,这种设计比从可训练判别器中提取特征更有效,因为后者的表示在蒸馏训练过程中不断变化。
我们的控制判别器不直接对最终潜在变量进行判别,而是作用于教师特征动态。由于相机条件在输入端注入,第一层特征提供了直接的相机感知参考。我们将中间教师特征与该参考进行比较,以评估输入潜在变量是否与规定的相机轨迹保持一致。对于 $x \in \{r, f\}$(其中 $r$ 表示真实潜在变量,$f$ 表示虚假学生展开),我们从冻结的教师中提取第一层和三个选定的中间层特征:
$F_{x}^1, F_{x}^{M_1}, F_{x}^{M_2}, F_{x}^{M_3} = T_{\text{feat}}(z_x^\tau, c), \quad (6)$
其中 $T_{\text{feat}}$ 表示冻结的相机条件教师特征提取器。对于每个中间层,我们计算相对于第一层特征的低频特征差异图:
$\Delta F_{x}^{M_i} = \psi_i \left( \eta_i F_{x}^{M_i} – \eta_1(F_{x}^1) \right), \quad i \in \{1, 2, 3\}. \quad (7)$
这里,$\eta_1$ 和 $\eta_i$ 是第一层和层 $M_i$ 的线性特征提取器,$\psi_i$ 是一个步长卷积下采样器,用于抑制高频纹理细节,并鼓励判别器关注低频布局和相机运动一致性。然后,我们将生成的特征差异图与 3 个可学习的寄存器令牌(register tokens)进行聚合。寄存器令牌通过交叉注意力机制关注其对应的低频图,并将生成的令牌特征求和以产生控制一致性对数几率(logit):
$h_x^i = \text{CrossAttn}_i \left( q, \Delta F_{x}^{M_i} \right), \quad d_x^{\text{ctrl}} = \text{MLP} \left( \sum_{i=1}^3 h_x^i, e_\tau \right), \quad x \in \{r, f\}. \quad (8)$
这里,$q$ 是可学习的寄存器令牌,$e_\tau$ 指时间步嵌入,$d_r^{\text{ctrl}}$ 和 $d_f^{\text{ctrl}}$ 分别表示真实潜在变量和虚假学生展开潜在变量的判别器对数几率。我们使用相对软plus 对抗损失训练控制判别器与学生生成器:
$L_{D}^{\text{ctrl}} = \mathbb{E}_{\tau, \epsilon} \left[ \text{softplus} \left( d_f^{\text{ctrl}} – d_r^{\text{ctrl}} \right) \right], \quad L_{G}^{\text{ctrl}} = \mathbb{E}_{\tau, \epsilon} \left[ \text{softplus} \left( d_r^{\text{ctrl}} – d_f^{\text{ctrl}} \right) \right]. \quad (9)$
生成器通过 $L_{\text{DMD}} + \lambda_{\text{ctrl}} L_{G}^{\text{ctrl}}$ 进行优化。与 DMD2 中的高频对抗目标相比,我们的控制正则化为相机保真度提供了互补的低频监督信号。经验上,提出的目标稳定了蒸馏过程,显著改善了自回归展开期间的相机跟随能力,并避免了先前基于回归的稳定化损失引入的模式收缩。
11
第 12 页
4.3 推理时优化
为实现低延迟推理,我们遵循 (Hong et al., 2025) 进行代码优化。以下简要介绍相关技术。由于推理延迟可能由 GPU 内存流量、内核启动开销以及重复的 Transformer 计算引起,我们将优化重点放在这些方面。对于重复预测和缓存更新步骤,我们一次性编译模型操作,跨运行重用生成的 GPU 内核,并重放相同的 CUDA 执行模式以减少启动开销。我们采用自注意力 KV 缓存来保留先前计算的视频上下文,同时使用文本交叉注意力缓存以消除提示键和值投影的重复计算。对于内存检索,我们维护一个单独的缓存,存储压缩的键摘要,以支持高效检索相关的历史块。我们进一步在 Hopper GPU 上采用 FlashAttention-3 (Shah et al., 2024)、融合 QKV 投影、BF16 RMSNorm、缓存的 RoPE 嵌入以及时间步调制。最后,根据分析结果,我们手动重构部分 PyTorch 操作以消除额外的运行时开销。
在推理期间,我们采用多 GPU 并行性,将计算和内存工作负载分布在设备上。FFN 层和交叉注意力模块沿序列维度使用序列并行进行分布,而自注意力则使用张量并行在注意力头之间进行分区。NCCL All-to-All 集合操作在这两种张量布局之间进行转换。这种设计还将 KV 缓存沿注意力头维度进行分区,使得每个 GPU 仅存储和处理其分配的头子集。辅助工作负载,包括文本编码和 VAE 处理,从主要生成 GPU 卸载,而采用源自 (Shin et al., 2025) 的 Tiny VAE 用于高效解码条件输入和生成输出。
为了支持超出我们训练时间跨度的长达数分钟的生成,我们采用滚动/滑动窗口缓存方案 (Xiao et al., 2024)。具体而言,KV 缓存组织为 [sink 块、top-k 块、近期上下文块] 的连接。top-k 块由我们在每个预测步骤中的稀疏注意力动态选择。为了避免沿帧轴出现未见过的定位嵌入,我们根据相对距离将帧索引重新映射回训练时间跨度。这些设计共同保持了活动上下文大小和定位范围有界,从而在不增加每步推理延迟的情况下实现稳定的分钟级 rollout。
4.4 训练基础设施与模型细节
在 20 秒的时间跨度上训练双向教师模型以及三个 14B 学生生成器 (MoS) 对内存要求极高。遵循先前的工作 (Hong et al., 2025; Robbyant Team, 2026),我们结合多种技术以提高训练效率:(1) 完全分片数据并行 2 (FSDP2) (Zhao et al., 2023) 用于在 GPU 间分片模型参数、梯度和优化器状态;(2) 序列并行用于在设备间分布视频 token 序列;(3) 张量并行用于分区自注意力头及相关计算;(4) 梯度检查点;以及 (5) 梯度累积。在分布级蒸馏期间,我们进一步采用重播反向传播 (Hong et al., 2025) 以减少对自回归 rollout 进行微分所需的内存。这些技术共同使我们能够在 32 块 NVIDIA H200 GPU 上使用 64 的全局批量大小进行训练。在推理时,我们的学生模型混合采样器使用三个生成器进行四步去噪:G1 用于第一步,G2 用于第二步,G3 用于最后两步。我们使用两个潜在帧的块大小以维持低流式延迟。
5 实验
在本节中,我们将 Wonder 评估为用于图像和视频条件生成的统一交互式视频世界模型。我们将其与最近先进的世界模型进行比较,并表明 Wonder 实现了最佳的总体视觉质量和相机跟随精度。我们的实验涵盖两种设置。在图像到视频设置中,模型接收单张图像,必须在遵循用户指定相机控制的同时推断未见区域。在视频到视频设置中,模型接收输入视频,必须在保持主体动态的同时实现自由相机导航,从而构建动态且可控的世界。我们首先描述基准和评估指标,随后提供两项任务的定量和定性结果。
5.1 图像到视频世界建模
基准。我们构建了一个包含 1,000 张多样化开源图像的一般图像到视频世界建模基准,涵盖真实照片、AI 生成图像、卡通、艺术图像和游戏场景。对于每张图像,我们使用 VLM 生成场景描述,并生成与图像内容一致的导航键。每张
12
第 13 页
图7 导航至多样化图像。
13
第 14 页
图8 导航至多样化图像。
14
第 15 页
视觉质量 ↑ 动作精度 (RPE ↓) 模型 平均得分† 成像 美学 动态 运动 闪烁 平移 旋转
图像到视频 (I2V) HY-WorldPlay 1.5 0.7900 0.6825 0.6915 0.6120 0.9893 0.9745 0.0195 0.1711 RELIC 0.8225 0.5983 0.6334 0.9243 0.9889 0.9675 0.0208 0.1426 LingBot-World-Fast 0.8261 0.6553 0.6360 0.8991 0.9769 0.9633 0.0174 0.2922 SANA-WM-Streaming 0.8415 0.6480 0.6099 1.0000 0.9889 0.9608 0.0240 0.1155 DreamX-World 0.8385 0.6891 0.6655 0.8927 0.9847 0.9604 0.0244 0.2547 Wonder 0.8558 0.7113 0.6416 0.9874 0.9794 0.9622 0.0132 0.0784
视频到视频 (V2V) Inspatio-World 0.8374 0.6756 0.5815 1.0000 0.9794 0.9506 0.0436 0.2470 Wonder 0.8527 0.6981 0.6196 1.0000 0.9855 0.9602 0.0187 0.1119
表 1 视觉质量与动作精度对比。†平均得分为成像、美学、动态、运动和闪烁得分的算术平均值。我们报告了在图像到视频 (I2V) 和视频到视频 (V2V) 设置下的结果。Wonder 实现了最佳的总体视频合成质量和相机跟随精度。
图像与五种不同平移尺度和旋转速度的相机轨迹配对,使我们能够评估不同模型在各种相机控制模式下的鲁棒性。
指标。遵循先前的工作 (Robbyant Team, 2026; Zhu et al., 2026a),我们报告了来自 VBench (Huang et al., 2024) 的五项视觉质量指标:成像质量、美学质量、动态程度、运动平滑度和时间闪烁。为了评估相机跟随精度,我们使用两个姿态估计模型 Depth Anything 3 (Lin et al., 2025) 和 ViPE (Huang et al., 2025a) 从每个生成的视频中估计相对相机姿态,并平均它们的姿态误差以获得更稳健的评估。由于不同模型可能产生具有不同平移尺度和坐标系的轨迹,我们使用 Umeyama 对齐 (Umeyama, 2002) 将每个重建的轨迹对齐到规范的目标轨迹。然后,我们计算平移和旋转的相对位姿误差 (RPE),以衡量每个模型遵循指定相机运动的准确程度。
基线。我们将 Wonder 与本报告发布时可用的五个最近的交互式视频世界模型进行比较:HY-WorldPlay 1.5 (Team et al., 2025)、RELIC (Hong et al., 2025)、LingBot-World-Fast (Robbyant Team, 2026)、SANA-WM-Streaming (Zhu et al., 2026a) 和 DreamX-World (Team et al., 2026a)。这些模型都旨在实现具有交互式相机控制的实时或流式视频生成,使其成为我们设置中最相关的基线。对于每个基线,只要可用,我们就使用官方发布的模型或推荐的推理设置。
结果。表 1 报告了图像到视频设置下的定量比较。Wonder 实现了最佳的总体视觉质量,平均得分为 0.8558,优于所有最近的流式世界模型基线。这一提升主要来自于成像质量的改善,Wonder 获得了最高的 0.7113 分,表明其场景合成能力更强且视觉伪影更少。虽然某些基线在单个时间指标(如运动平滑度或闪烁)上取得了更高的分数,但它们往往牺牲了相机可控性。在动作精度方面,Wonder 在所有方法中实现了最低的平移和旋转 RPE。与最强的基线相比,Wonder 将平移误差从 0.0174 降低到 0.0132,将旋转误差从 0.1155 降低到 0.0784。这些结果表明,我们的半显式相机表示和蒸馏策略在保持高视觉质量的同时显著提高了相机跟随能力,从而实现了更可靠的交互式世界探索。图 9 展示了 Wonder 与最近的先进模型在长程记忆和视觉质量方面的定性比较。大多数先前方法在重新访问时无法忠实地重建之前观察到的区域,而其他方法则随着 rollout 长度的增加遭受严重的视觉退化。
我们在图 7 和图 8 中展示了 Wonder 更多的定性结果。在各种输入图像上,Wonder 能够理解并保留潜在的场景结构,同时在用户控制的相机运动下合成合理的未见区域。生成的视图准确地遵循指定的相机指令,新发现的区域在语义上与输入图像保持一致,同时表现出高视觉质量和多样化的内容。此外,当相机在长程探索后重新访问之前观察到的区域时,Wonder 保留了场景细节和外观一致性,证明了我们稀疏记忆机制的有效性。得益于多任务训练,Wonder 在 I2V 设置下也表现出动态世界建模能力,产生了与场景语义一致的意义对象和主体运动。
15
第 16 页
我们的 DreamX-World
SANA-WM Lingbot-World
RELIC HY-WorldPlay
图 9 图像到视频(Image-to-Video)世界建模性能的视觉对比。我们通过重访轨迹评估每个模型的记忆能力。具体而言,相机首先向右平移以观察目标区域,然后向左平移以远离该区域,最后再次向右平移以重访同一区域。我们比较在同一相机位置捕获的两帧图像,以评估场景内容是否保持一致。大多数现有模型难以检索长期视觉记忆,导致重访后结构不一致或外观发生变化。RELIC (Hong et al., 2025) 和 LingBot-World (Robbyant Team, 2026) 在长视域展开过程中进一步遭受视觉质量下降的问题,这凸显了在扩展交互探索中同时保持记忆一致性和生成质量的难度。
5.2 视频到视频(Video-to-Video)世界建模
基准与指标。与图像到视频(I2V)设置类似,我们构建了一个包含 500 个视频的视频到视频基准,涵盖多样化的场景。与 I2V 基准不同,所有视频均包含动态主体,如人类、动物和车辆,使我们能够评估模型在支持相机控制的世界探索时,能否保留源视频的动力学特征。我们使用视觉语言模型(VLM)为每个输入视频生成视频描述和用户导航键。每个视频配对 6 条相机轨迹,分为三类:后退(retreat),相机向后移动以展示完整物体或场景;跟随(follow),相机跟踪移动主体并保持其可见;自由(free),相机进行无约束的探索性导航。我们使用与 I2V 设置相同的视觉质量和相机跟随指标。具体而言,使用 VBench 指标评估生成质量,并根据估计的相机轨迹计算平移和旋转相对位姿误差(Relative Pose Error, RPE),以衡量动作跟随的准确性。
基线。我们省略了短视域双向重拍模型 (Bai et al., 2025a; Huang et al., 2025d; Wang et al., 2026a),因为它们并非为长视频生成或实时流媒体而设计。截至本报告撰写时,唯一支持长视域视频到视频(V2V)世界建模的开源基线是 Inspatio-World (Team et al., 2026b)。Inspatio-World 采用点云重渲染作为相机控制信号,并使用滑动窗口策略,通过丢弃远距离视频令牌以实现高效推理。然而,如前几节所述,点云重渲染本质上受限于重建视角的覆盖范围,因此不太适合开放式的自由探索。同时,丢弃远距离令牌会移除长期视觉记忆,使得在重访先前观察到的区域时难以保持一致性。值得注意的是,与 Wonder 不同,Inspatio-World 并非为流式推理而设计,因为其点云重渲染流水线需要访问整个输入视频。
结果。表 1 报告了视频到视频设置下的定量结果。与 Inspatio-World 相比,Wonder 实现了更好的整体视觉质量,平均分从 0.8374 提升至 0.8527。这种提升在大多数视觉指标中保持一致,包括成像质量、美学质量、运动平滑度和时间闪烁。这表明 Wonder 能够在用户控制的相机运动下合成高质量的目标视角,同时更好地保留输入视频的动态内容。更重要的是,Wonder 显著提高了相机跟随的准确性。它将平移 RPE 从 0.0436 降低至 0.0187,将旋转 RPE 从 0.2470 降低至 0.1119,显示出与预定相机轨迹更强的对齐能力。这些改进证明了我们半显式网格控制相对于点云重渲染的优势,特别是在相机移动超出重建视角覆盖范围时。图 10 和图 11 中的定性结果进一步表明
16
第 17 页
视频 来源 Inspatio-World
ours
图 10 视频到视频世界建模性能的视觉对比。由于外部姿态估计模型重建的点云存在误差,且点云表示的探索空间有限,Inspatio-World (Team et al., 2026b) 往往难以在大幅视角变化下产生合理的相机运动并保留动态物体。
Wonder 支持流式 V2V 世界建模,具有更好的动态保留能力、更强的相机跟随性以及更稳定的长视域视觉一致性。我们认为 Wonder 也为视频重拍(video re-shotting)建立了强有力的基线。
6 结论
我们介绍了 Wonder,这是一种实时相机可控的视频世界模型,它将单张图像转换为可探索的世界,并沿用户指定的相机轨迹重新渲染观测视频,同时保留其外观和动态特性。Wonder 通过统一的系统设计共同解决了可控性、持久性和效率问题。密集的像素空间坐标场提供空间对齐的相机线索,稀疏的全保真记忆机制支持连贯的重访,并将活跃注意力成本控制在有限范围内,而改进的自回归蒸馏流水线则在几步因果学生模型中保留了视觉质量和相机保真度。在图像条件和视频条件的基准测试中,Wonder 实现了比近期流式世界模型更强的视觉质量和相机跟随精度,同时在新颖视角下保留动态内容,并在长序列生成中维持场景一致性。这些进展实现了在 16 FPS 下以稳定的推理延迟进行分钟级生成,在一个模型内统一了超出观测视角的开放式探索和动态场景的实时重渲染。
17
第 18 页
图11 视频导航。
18
第 19 页
参考文献
Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, 等人。Recammaster:从单个视频进行相机控制的生成式渲染。在 IEEE/CVF 国际计算机视觉会议论文集,第 14834–14844 页,2025a。
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等人。Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631,2025b。
Philip J. Ball, Jakob Bauer, Frank Belletti, Bethanie Brownfield, Ariel Ephrat, Shlomi Fruchter, Agrim Gupta, Kristian Holsheimer, Aleksander Holynski, Jiri Hron, Christos Kaplanis, Marjorie Limont, Matt McGill, Yanko Oliveira, Jack Parker-Holder, Frank Perbet, Guy Scully, Jeremy Shar, Stephen Spencer, Omer Tov, Ruben Villegas, Emma Wang, Jessica Yung, Cip Baetu, Jordi Berbel, David Bridson, Jake Bruce, Gavin Buttimore, Sarah Chakera, Bilva Chandra, Paul Collins, Alex Cullum, Bogdan Damoc, Vibha Dasagi, Maxime Gazeau, Charles Gbadamosi, Woohyun Han, Ed Hirst, Ashyana Kachra, Lucie Kerley, Kristian Kjems, Eva Knoepfel, Vika Koriakin, Jessica Lo, Cong Lu, Zeb Mehring, Alex Moufarek, Henna Nandwani, Valeria Oliveira, Fabio Pardo, Jane Park, Andrew Pierson, Ben Poole, Helen Ran, Tim Salimans, Manuel Sanchez, Igor Saprykin, Amy Shen, Sailesh Sidhwani, Duncan Smith, Joe Stanton, Hamish Tomlinson, Dimple Vijaykumar, Luyu Wang, Piers Wingfield, Nat Wong, Keyang Xu, Christopher Yew, Nick Young, Vadim Zubov, Douglas Eck, Dumitru Erhan, Koray Kavukcuoglu, Demis Hassabis, Zoubin Gharamani, Raia Hadsell, Aäron van den Oord, Inbar Mosseri, Adrian Bolton, Satinder Singh, 和 Tim Rocktäschel。Genie 3:世界模型的新前沿,2025。https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/。
Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vincent Sitzmann。Diffusion forcing:下一个词元预测与全序列扩散的结合。神经信息处理系统进展,37:24081–24125,2024。
Hyung Won Chung, Noah Constant, Xavier García, Adam Roberts, Yi Tay, Sharan Narang, 和 Orhan Firat。Unimax:大规模多语言预训练中更公平且更有效的语言采样。ArXiv,abs/2304.09151,2023。https://api. semanticscholar.org/CorpusID:258187051。
Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh。Self-forcing++:迈向分钟级高质量视频生成。arXiv 预印本 arXiv:2510.02283,2025。
Kaifeng Gao, Jiaxin Shi, Hanwang Zhang, Chunping Wang, Jun Xiao, 和 Long Chen。Ca2-vdm:具有因果生成和缓存共享的高效自回归视频扩散模型。arXiv 预印本 arXiv:2411.16375,2024。
Junliang Guo, Yang Ye, Tianyu He, Haoyu Wu, Yushu Jiang, Tim Pearce, 和 Jiang Bian。Mineworld:Minecraft 上实时且开源的交互式世界模型。arXiv 预印本 arXiv:2504.08388,2025。
Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, 等人。Ltx-2:高效联合音视频基础模型。arXiv 预印本 arXiv:2601.03233, 2026。
Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, 和 Ceyuan Yang。Cameractrl:为视频扩散模型提供相机控制。在第十三届学习表征国际会议,2025a。
Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren, 等人。Matrix-game 2.0:开源、实时且流式传输的交互式世界模型。arXiv 预印本 arXiv:2508.13009, 2025b。
Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, 等人。Relic:具有长程记忆的交互式视频世界模型。arXiv 预印本 arXiv:2512.04040,2025。
Jinyi Hu, Shengding Hu, Yuxuan Song, Yufei Huang, Mingxuan Wang, Hao Zhou, Zhiyuan Liu, Wei-Ying Ma, 和 Maosong Sun。 Acdit:插值自回归条件建模与扩散 Transformer。arXiv 预印本 arXiv:2412.07720,2024。
Jiahui Huang, Qunjie Zhou, Hesam Rabeti, Aleksandr Korovko, Huan Ling, Xuanchi Ren, Tianchang Shen, Jun Gao, Dmitry Slepichev, Chen-Hsuan Lin, Jiawei Ren, Kevin Xie, Joydeep Biswas, Laura Leal-Taixe, 和 Sanja Fidler。Vipe:用于 3D 几何感知的视频姿态引擎。在 NVIDIA 研究白皮书中,2025a。
Junchao Huang, Xinting Hu, Boyao Han, Shaoshuai Shi, Zhuotao Tian, Tianyu He, 和 Li Jiang。Memory forcing:Minecraft 上一致场景生成的时空记忆。arXiv 预印本 arXiv:2510.03198,2025b。
Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman。Self forcing:弥合自回归视频扩散中的训练-测试差距。在神经信息处理系统进展中,2025c。
Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y Wang, Joan Lasenby, 和 Chun-Hao Huang。 Spacetimepilot:跨时空动态场景的生成式渲染。arXiv 预印本 arXiv:2512.25075,2025d。
19
第 20 页
Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, Yaohui Wang, Xinyuan Chen, Limin Wang, Dahua Lin, Yu Qiao, and Ziwei Liu. VBench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024.
Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, et al. Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:2412.03603, 2024.
Jiaqi Li, Junshu Tang, Zhiyong Xu, Longhuang Wu, Yuan Zhou, Shuai Shao, Tianbao Yu, Zhiguo Cao, and Qinglin Lu. Hunyuan- gamecraft: High-dynamic interactive game video generation with hybrid history condition. arXiv preprint arXiv:2506.17201, 2025.
Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, Jiashi Feng, and Bingyi Kang. Depth anything 3: Recovering the visual space from any views. arXiv preprint arXiv:2511.10647, 2025.
Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu, et al. Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 22160–22169, 2024.
Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, and Shijian Lu. Rolling forcing: Autoregressive long video diffusion in real time. arXiv preprint arXiv:2509.25161, 2025.
Xiaofeng Mao, Shaoheng Lin, Zhen Li, Chuanhao Li, Wenshuo Peng, Tong He, Jiangmiao Pang, Mingmin Chi, Yu Qiao, and Kaipeng Zhang. Yume: An interactive world generation model. arXiv preprint arXiv:2507.17744, 2025.
Bowen Peng, Jeffrey Quesnelle, Honglu Fan, and Enrico Shippole. Yarn: Efficient context window extension of large language models. arXiv preprint arXiv:2309.00071, 2023.
Fatema Rahimi, Abolghasem Sadeghi-Niaraki, and Soo-Mi Choi. Generative ai meets virtual reality: A comprehensive survey on applications, challenges, and future direction. IEEE Access, 2025.
Robbyant Team. Advancing open-source world models. arXiv preprint arXiv:2601.20540, 2026.
Jay Shah, Ganesh Bikshandi, Ying Zhang, Vijay Thakkar, Pradeep Ramani, and Tri Dao. Flashattention-3: Fast and accurate attention with asynchrony and low-precision. ArXiv, abs/2407.08608, 2024. https://api.semanticscholar.org/CorpusID: 271098045.
Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Schechtman, and Xun Huang. Motionstream: Real-time video generation with interactive motion controls. arXiv preprint arXiv:2511.01266, 2025.
Junshu Tang, Jiacheng Liu, Jiaqi Li, Longhuang Wu, Haoyu Yang, Penghao Zhao, Siruis Gong, Xiang Yuan, Shuai Shao, Linfeng Zhang, et al. Hunyuan-gamecraft-2: Instruction-following interactive game world model. arXiv preprint arXiv:2511.23429, 2025.
DreamX Team, Yancheng Bai, Rui Chen, Xiangxiang Chu, Rujing Dang, Hao Dou, Bingjie Gao, Qiwen Gu, Siyu Hong, Jiachen Lei, et al. Dreamx-world 1.0: A general-purpose interactive world model. arXiv preprint arXiv:2606.16993, 2026a.
HunyuanWorld Team, Zhenwei Wang, Yuhao Liu, Junta Wu, Zixiao Gu, Haoyuan Wang, Xuhui Zuo, Tianyu Huang, Wenhuan Li, Sheng Zhang, et al. Hunyuanworld 1.0: Generating immersive, explorable, and interactive 3d worlds from words or pixels. arXiv preprint arXiv:2507.21809, 2025.
InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, et al. Inspatio-world: A real-time 4d world simulator via spatiotemporal autoregressive modeling. arXiv preprint arXiv:2604.07209, 2026b.
Shinji Umeyama. Least-squares estimation of transformation parameters between two point patterns. IEEE Transactions on pattern analysis and machine intelligence, 13(4):376–380, 2002.
Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025.
Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, and Gordon Wetzstein. Bullettime: Decoupled control of time and camera pose for video generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18319–18330, 2026a.
Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ping Luo, and Ying Shan. Motionctrl: A unified and flexible motion controller for video generation. In ACM SIGGRAPH 2024 Conference Papers, pages 1–11, 2024.
Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, Peiyu Wang, Biao Jiang, Yichen Wei, et al. Matrix-game 3.0: Real-time and streaming interactive world model with long-horizon memory. arXiv preprint arXiv:2604.08995, 2026b.
20
第 21 页
Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, 和 Mike Lewis. 具有注意力汇点的流式高效语言模型. 在《表示学习国际会议》, 卷 2024, 页码 21875–21895, 2024.
Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, 和 Qing Zhang. World-env: 利用世界模型作为 VLA 后训练的虚拟环境. arXiv 预印本 arXiv:2509.24948, 2025.
Jiacong Xu, Yiqun Mei, Ke Zhang, 和 Vishal M Patel. Freevis: 使用不一致参考进行免训练视频风格化. arXiv 预印本 arXiv:2510.01686, 2025.
Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等. Cogvideox: 具有专家 Transformer 的文生视频扩散模型. 在《表示学习国际会议》, 卷 2025, 页码 83048–83077, 2025.
Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 Bill Freeman. 改进的分布 匹配蒸馏以实现快速图像合成. 神经信息处理系统进展, 37:47455–47487, 2024a.
Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T Freeman, 和 Taesung Park. 一步 扩散与分布匹配蒸馏. 在《IEEE/CVF 计算机视觉与模式识别会议论文集》, 页码 6613–6623, 2024b.
Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang. 从缓慢 双向到快速自回归视频扩散模型. 在《计算机视觉与模式识别会议论文集》, 页码 22963–22974, 2025.
Jiwen Yu, Jianhong Bai, Yiran Qin, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Xihui Liu. 上下文即记忆: 具有记忆检索的场景一致交互式长视频生成. arXiv 预印本 arXiv:2506.03141, 2025.
Wangbo Yu, Jinbo Xing, Li Yuan, Wenbo Hu, Xiaoyu Li, Zhipeng Huang, Xiangjun Gao, Tien-Tsin Wong, Ying Shan, 和 Yonghong Tian. Viewcrafter: 驯服视频扩散模型以实现高保真新视角合成. arXiv 预印本 arXiv:2409.02048, 2024.
Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Fei Kang, Biao Jiang, Zedong Gao, Eric Li, Yang Liu, 等. Matrix-game: 交互式世界基础模型. arXiv 预印本 arXiv:2506.18701, 2025.
Yanli Zhao, Andrew Gu, Rohan Varma, Liang Luo, Chien-Chin Huang, Min Xu, Less Wright, Hamid Shojanazeri, Myle Ott, Sam Shleifer, 等. Pytorch fsdp: 扩展完全分片数据并行的经验. arXiv 预印本 arXiv:2304.11277, 2023.
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, 和 Enze Xie. Sana-wm: 使用混合线性扩散 Transformer 进行高效的分钟级世界建模. arXiv 预印本 arXiv:2605.15178, 2026a.
Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu. 因果强制: 正确执行自回归扩散蒸馏以实现高质量实时交互式视频生成. arXiv 预印本 arXiv:2602.02214, 2026b.
21