三分钟导读:M4World是一个基于DiT的多视角多模态驾驶世界模型,通过细粒度物体控制接口和五阶段训练策略,实现了稳定、低延迟的分钟级多摄像头视频与LiDAR同步生成,并支持长尾场景的高效定制。
英文题目:M4World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
论文出处:arXiv 每日论文精选 · arXiv:2607.14005
原始论文:PDF / 论文页面
对应视频标题:M4World:分钟级多视角多模态驾驶世界模型与细粒度物体操控|推荐指数:★★★★★
这篇论文解决什么问题?
现有驾驶世界模型在物体级细粒度可控性(特别是视觉外观控制)和长时程生成的稳定性方面存在不足,且难以高效生成罕见长尾场景数据。
核心创新
- 细粒度物体控制接口:融合3D几何、语义、图像描述和文本属性,实现空间布局与视觉外观的双重控制。
- 多阶段因果训练配方:通过Teacher Forcing、ODE初始化和Self-Forcing DMD实现低延迟(4步)的自回归流式生成。
- 长时程稳定性机制:引入潜在上下文刷新(Latent Context Refresh)以减少块间闪烁,并通过迭代长视频微调缓解累积误差。
- 长尾场景高效适配:提出基于LoRA的少样本后训练策略,仅需少量罕见样本即可绑定特定物体属性。
- VLM自动化评估管道:构建基于视觉语言模型的评估体系,量化场景级条件遵循、物体级可控性及跨视角一致性。
方法概览
M4World采用共享DiT骨干网络,结合自注意力进行长程时空建模,并通过交叉注意力注入异构控制信号(包括3D框、语义类别、图像描述和文本描述)。训练流程包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD以及迭代长视频微调。
逐图理解论文
方法:共享DiT骨干与多模态控制接口

M4World采用共享DiT骨干网络,结合自注意力进行长程时空建模。通过交叉注意力注入异构控制信号,包括3D框、语义类别、图像描述和文本描述。这种设计使得模型能够统一处理多视角和跨传感器上下文,实现细粒度的物体级控制,同时保持跨视角的一致性。
创新:五阶段因果训练配方

为实现低延迟生成,M4World设计了五阶段训练策略。包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD以及迭代长视频微调。这一配方使得模型仅需4步即可进行自回归流式生成,显著降低了推理延迟,同时保证了生成的质量。
创新:长时程稳定性机制

针对长时程生成中的累积误差问题,M4World引入了潜在上下文刷新机制,以减少块间闪烁。此外,通过迭代长视频微调,模型能够缓解自回归过程中的视觉漂移。这些机制共同作用,使得模型在60秒的长视频生成中仍能保持连贯的运动和视觉外观。
实验:基础生成质量评估

在10秒视频的基础生成质量评估中,M4World在相同数据集上与MagicDriveV2进行对比。结果显示,M4World的FID为34.8,FVD为288.7,均优于MagicDriveV2的41.7和346.1。这表明其统一的自注意力建模和细粒度控制条件注入有效提升了生成质量。
实验:细粒度可控性与跨视角一致性

使用VLM Judge评估细粒度可控性,M4World在物体视觉保真度上达到62.7%,文本保真度59.1%,远超MagicDriveV2的13.4%和11.6%。跨视角物体一致性达到84.5%,优于MagicDriveV2的78.9%。这证明了其控制接口在空间布局和视觉外观控制上的有效性。
实验与关键结果
- 基础生成质量评估:在10秒视频上对比FID和FVD指标。
- 细粒度可控性评估:使用VLM Judge评估天气、时间、物体存在性、清晰度、视觉/文本保真度及跨视角一致性。
- 长时程流式生成:评估60秒多视角视频生成的稳定性与连贯性。
- 长尾场景数据增强:针对“运载树木的卡车”案例,合成500条视频增强BEV检测模型训练。
- 视觉参考条件生成:测试首帧条件化和物体补全能力。
- FID 34.8, FVD 288.7 (优于MagicDriveV2的41.7/346.1)(第 13 页)
- 物体视觉保真度62.7%,文本保真度59.1% (优于MagicDriveV2的13.4%/11.6%)(第 13 页)
- 跨视角物体一致性84.5% (优于MagicDriveV2的78.9%)(第 13 页)
- 运载卡车目标Recall从1.0%提升至69.7%,常规mAP保持66.8%(第 18 页)
- 吞吐量2.3 FPS (424×800, 6视角+LiDAR, 8xA100)(第 13 页)
阅读时需要注意
- 长尾场景的泛化能力依赖于特定的少样本后训练,通用模型可能无法直接处理未见过的罕见物体。
- LiDAR生成依赖Range Map表示,可能丢失部分3D几何细节。
- VLM评估结果受限于基础模型的能力,可能存在评估偏差。
- 长时程生成中,尽管引入了上下文刷新,但自回归累积误差仍可能导致细微的视觉漂移。
- 少样本适配可能导致模型在通用驾驶场景下的多样性略有下降(尽管LoRA缓解了此问题)。
关联工作
- MagicDriveV2:基线模型,在相同数据集上进行对比,M4World在生成质量和可控性上均优于该模型。(第 13 页)
- Wan2.1-T2V:M4World的初始化基础模型,提供强大的视频生成先验。(第 6 页)
- LongLive:参考其KV缓存刷新和异步解码机制以优化长时程生成和推理效率。(第 8 页)
- CausVid:参考其将双向扩散模型转化为少数步因果生成器的方法。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
M4World 2026年7月
M4World:用于交互式物体操作和分钟级流式传输的多视角多模态驾驶 世界模型
程珂1∗, 叶汉桥2∗, 施磊1, 刘亚辉1, 沈云汉1, 董景涛3, 王振凯1, 敖文轩1, 徐伟翔2, 黄凯宁1, 沈舒涵2†
1美团, 2中国科学院自动化研究所 3北京理工大学, ∗共同一作, †通讯作者
驾驶世界生成已成为可扩展自动驾驶仿真的一项核心能力,然而现有方法在物体级可控性和长时 间稳定性方面仍存在局限。 我们提出了 M4World,这是一种多视角和多模态生成式驾驶世界模型,能够合成未来的环绕视图视频流和同步的 LiDAR 扫描数据,同时支持交互式物体 Manipulation(操作)和稳定的 Minute-long(分钟级)流式传输。细粒度的物体 Manipulation 是通过一个灵活的条件接口实现的,该接口支持对单个物体的空间布局2026 和视觉外观进行显式控制。另一方面,稳定的分钟级流式传输是通过一个多阶段训练框架实现的,该框架仅用四个去噪步骤即可实现在线因果生成,同时在扩展的 rollout( rollout 指模型生成的序列或轨迹)过程中保持连贯的世界动态。基于这些组件,我们引入了一种高效的 few-clip(少片段)后训练方法以及一系列视觉参考条件生成模型,在保留通用生成能力的同时,允许针对长尾可控性的罕见案例定制。为了评估超越真实性的可控性,我们进一步引入了一种基于 VLM 的自动化评判管道,用于评估场景级条件遵循度、视图级物体可控性和跨视图物体一致性。综合实验表明,M4World 始终提供高质量的生成结果、精确的可控性和稳定的分钟级流式传输。结合下游的长尾数据增强和场景编辑,这些结果展示了 M4World 在可控、可扩展驾驶仿真方面的潜力。[cs.CV]
1 引言
扩展自动驾驶测试床和增强训练数据需要可控的仿真环境,以克服真实世界数据收集的成本和稀疏性限制。与仅回放日志或仅重建的仿真器不同,生成式驾驶世界模型旨在合成动作条件化的多传感器未来观测数据,这些数据在长视域内保持照片级真实感、可控性、时间稳定性,并能响应自车行为 [11, 15, 35, 44, 51, 62, 65]。这些能力使它们非常适合大规模策略评估、端到端训练以及针对罕见但安全关键的驾驶场景进行定向增强。
仅重建的仿真器在观测区域提供强大的几何保真度,但在覆盖范围上存在根本性局限:它们继承了已记录传感器轨迹的支持范围,并在外推到未见过的视角、新的遮挡或不常见的场景构成时会退化 [23, 29, 65, 76]。生成式和交互式世界模型开始通过启用开放式合成和因果 rollout 来缓解这一瓶颈 [1, 11, 15, 70],但关键的可控性差距仍然存在。在当前实践中,物体条件化主要是几何层面的,依赖于 3D 边界框或占据网格来引导场景构成和物体放置,而对单个物体的视觉属性几乎没有显式控制 [13, 52, 54, 72]。这种属性级控制在闭环仿真中尤其有价值,因为在构建针对特定目标的安全关键场景时,不仅需要将物体放置在期望的姿态,还需要指定
1
第 2 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
随时间演变的条件
511
26 881
89 798 336 321 87494 135 348
424 699 775 4 654 43161 699 53 841 188 611 881 726 801 130 294 7
671 413 679 502 76 688 766 701 105 450 612 284 132
591 333 494 105 271 1676 780 T = 0 s T = 30 s T = 60 s
噪声 … … … … … 全局潜在变量 条件
文本
少步自回归视频扩散模型 传感器
干净潜在变量 … … … … …
T = 0 s T = 30 s T = 60 s
多视角多模态展开
图 1 M4World 是一个用于可控驾驶模拟的少步自回归视频扩散世界模型。在随时间演变的控制信号以及全局场景和传感器上下文的条件下,它逐步去噪流式潜在块,并在长视域内联合展开同步的多视角视频和 LiDAR 观测结果,从而实现细粒度的物体级控制并保持稳定的跨视角一致性。
精确地描述该物体应有的外观。同时,现有的长尾模拟管道通常将稀有智能体的规范限制在合成初始帧中,然后将时间演化委托给图像到视频模型,从而在展开过程中丧失了对姿态、方向和多智能体交互的显式控制 [33, 44]。除了可控性之外,闭环模拟还需要低延迟的稳定长视域流式生成,而大多数现有的因果适应管道仍然容易受到训练-测试暴露偏差或高推理延迟的影响 [11, 35]。
为了克服这些局限性,我们提出了 M4World,这是一种生成式驾驶世界模型,它将多视角和多模态生成与细粒度的物体可控性及长视域展开稳定性统一起来。其核心基于共享的潜在 DiT 骨干网络 [34, 43],其中自注意力捕获长程时空依赖关系,交叉注意力将异构控制信号和跨传感器上下文整合到去噪过程中。这种基于标记的条件路径自然地支持细粒度且灵活的物体控制接口:我们将传统的几何物体条件扩展为信息更丰富的物体标记,该标记融合了 3D 框几何形状、语义类别、视觉外观描述和文本属性,允许控制信号在空间布局和视觉外观两个层面发挥作用。为了弥合离线视频先验与因果流式展开之间的差距,我们开发了一种包含五个阶段的渐进式训练配方:双向中期训练、教师强制因果适应、少步学生 ODE 初始化、非对称 DMD 自强制以及迭代长视频微调,并辅以潜在上下文刷新机制以提高块间一致性。
基于这些生成能力,我们进一步将 M4World 适应于实际的长尾模拟,其中安全关键案例通常单独指定,且仅有少量真实片段可用。我们引入了一种高效的逐案例后训练策略,结合平衡的稀有/常见采样与 LoRA 适应 [19],使模拟器能够将稀有的视觉和文本属性绑定到物体控制上,同时保留基础模型的一般驾驶世界可控性。为了适应存在参考观测或编辑图像的情况,我们进一步将模型扩展为一套视觉参考
2
第 3 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
条件生成变体,包括首帧条件引导和物体补全,使得罕见场景的构建能够以具体的视觉证据为锚点,而无需更改原始控制令牌接口。
为了使所提出的驾驶世界模型在训练和评估中均具备可扩展性,我们将其与专用的数据和评估流水线相结合。我们整理大规模、同步的多视角相机和 LiDAR 驾驶序列;挖掘涵盖恶劣天气、运动模式和交通参与者分布的挑战性片段;并自动标注场景级提示词以及物体级的视觉和文本描述,以实现细粒度的条件引导。由于标准的 FID/FVD 指标 [16, 50] 仅捕捉分布真实性,而无法反映条件遵循程度,我们开发了一套基于 VLM 的自动化评判流水线,用于评估场景级条件遵循度、视角级物体可控性以及跨视角物体一致性。
实验从基础生成到针对长尾场景的下游定制仿真,对 M4World 进行了全面评估。在 10 秒驾驶视频上,M4World 生成了连贯的多视角相机流和同步 LiDAR 扫描,将 FID/FVD 从现有基线 [11] 的 41.7/346.1 分别降低至 34.8/288.7。在我们基于 VLM 的可控性评估协议下,M4World 将物体级视觉和文本保真度分别从 13.4% 和 11.6% 提升至 62.7% 和 59.1%,证明其对物体级视觉和文本条件具有忠实遵循能力。这些细粒度条件反过来也提升了生成过程中的跨视角一致性,使其从 78.9% 提高至 84.5%。对于自回归流式生成,因果少步学生模型能够维持 60 秒的多相机生成,保持外观和动力学的连贯性。在我们的吞吐量基准测试中,当在八块 A100 GPU 上联合生成六个相机视角和一个同步 LiDAR 流时,它在 424 × 800 分辨率下达到了 2.3 FPS。除了基础生成外,少片段定制能力使我们的模型能够合成针对涉及运树卡车这一代表性长尾案例的目标数据。用 500 个合成片段增强 50,000 个真实片段,使目标召回率从 1.0% 提升至 69.7%,同时常规集合的 mAP 基本保持不变(66.7% 至 66.8%)。最后,通过将首帧中的常见物体替换为长尾对应物体,我们的视觉参考条件引导生成模型将编辑后的外观传播至所有视角及后续整个生成过程,实现了长尾驾驶数据的零样本合成。
我们将贡献总结如下:
- 我们构建了一个统一的驾驶世界模型,集成了可控仿真所需的核心生成能力:多传感器支持、低延迟因果流式生成,以及对空间布局和视觉外观的灵活物体级控制接口。
- 在此基础上,我们提出了两种用于可控长尾场景生成的定制路径:针对罕见案例的少片段后训练,以及通过真实观测或编辑图像指定的场景的视觉参考条件引导生成。
- 我们建立了一套以可控性为导向的评估套件,利用 VLM 评判器评估条件遵循度和跨视角一致性。实验证明了生成质量和条件遵循度的显著提升,并进一步展示了 M4World 在下游长尾感知数据增强方面的有效性。
2 相关工作
2.1 驾驶仿真中的世界模型
闭环自动驾驶仿真主要依赖于世界模型,该模型在智能体控制下生成环境的未来状态。我们沿以下两个维度讨论现有的自动驾驶仿真世界模型系统。
基于重建的世界模型。基于重建的世界模型利用捕获的多视角观测来恢复准确的驾驶场景结构,并提供照片级真实的渲染。在这一研究方向中,NeRF [6, 14, 22, 29, 30, 40, 46] 和 3D Gaussian Splatting [23, 25, 28, 53, 57] 是两种主导的神经表示方法。基于这些表示,大量工作致力于建模动态 4D 驾驶场景。一些方法使用形变网络将依赖于时间的观测映射到规范空间 [55, 66],或将时间戳作为额外输入馈送,以
第 4 页
神经表示 [20, 48, 60]。为了支持对动态智能体的独立控制,场景可以被分解为静态背景模型和独立的移动物体模型 [5, 46, 49, 59, 65, 71, 76]。为了克服逐场景优化的低效性,人们提出了前馈框架以学习跨场景的可泛化先验,通过单次前向传播推断 3D 高斯表示 [3, 39, 61]。尽管取得了这些进展,基于重建的世界模型仍然受到传感器数据覆盖范围的限制,并且往往难以渲染未观测区域以及泛化到不常见的场景条件。
自动驾驶的视频生成。基于扩散的视频生成模型 [17, 32, 34, 41, 43, 45, 75] 释放了合成超出捕获数据覆盖范围的多样化驾驶场景的潜力。受这种互补优势的启发,一些方法利用扩散先验来合成未来观测 [12, 73] 或恢复新视角渲染中的伪影以进行重建增强 [31, 38, 56, 64]。与此同时,越来越多的工作致力于直接从结构化的场景表示和驾驶行为生成逼真且可控的驾驶视频。这些方法沿着三个主要方向演进。第一种方法引入针对场景布局、天气、智能体和自车轨迹的结构化条件,以实现逼真且可控的生成 [13, 18, 36, 51]。第二种方法通过显式的 3D 几何、BEV 风格控制或全景生成来追求空间可控性和多视图一致性 [10, 11, 52, 54]。第三种方法扩展至大规模通用预测器和基础世界模型,这些模型扩大了训练规模、下游效用以及在相机和 LiDAR 观测上的可控 rollout [35, 62]。综上所述,这些方向为从开环视频合成向自动驾驶的交互式、动作条件仿真更广泛的转变奠定了基础。最近的系统已经通过整合重建和生成以实现几何保真度 [44]、扩展实时闭环生成式仿真 [33]、通过自校正蒸馏改善长视距自回归稳定性 [72] 以及实现可控的自车多相机 rollout 以进行可扩展的端到端评估 [15] 来操作化这一转变。基于这一系列工作,我们的方法强调以对象为中心的控制,以提高生成 rollout 中的可控性和场景多样性。这两种能力对于驾驶仿真至关重要,其中长尾场景的可扩展合成仍然是一个核心挑战。
2.2 实时交互式视频世界模型
用于离线视频生成的最新基础模型为视觉外观、运动和场景演化提供了强大的生成先验 [2, 17, 41, 43, 75]。交互式世界模型可以利用这些先验,在用户控制(如相机轨迹)下实现低延迟的因果 rollout。为此,最近的工作将扩散建模与自回归 (AR) 预测相结合,以适应视频生成器进行因果、流式 rollout。MAGI-1 [1] 执行分块自回归生成,并采用渐进式去噪。CausVid [70] 通过非对称蒸馏 [69] 和 ODE 初始化,将预训练的双向扩散变换器 [17] 转换为几步因果生成器。基于这种因果公式,人们提出了多种训练策略以减少训练-推理差距,并提高 rollout 质量和时间一致性 [8, 9, 21, 74, 77]。为了维持更长的 rollout,Rolling Forcing [26] 扩展了扩散窗口,而 LongLive [63] 则刷新 KV 缓存以在场景转换期间保持视觉连续性和提示遵循性。同时,注意力汇聚行为 [58, 67] 已被探索以改善长程时间一致性。遵循先前的交互式世界模型,我们采用 DiT 骨干网络进行多视图、多模态视频生成。细粒度的可控性是通过交叉注意力实现的,它调节控制信号与跨传感器观测之间的信息交换。
3 概述
3.1 问题表述
我们的目标是开发一种用于自动驾驶的低延迟、长视距视频世界模型,该模型在支持多视图和多模态生成(在多样化控制信号下)的同时,保持强大的空间和时间一致性。我们的模型在视频 VAE 的潜在空间中自回归运行。令 $z_{1:T}$ 表示潜在上下文,$C_{T+1:T+W}$ 表示要生成的后续 $W$ 帧的控制信号。在每个自回归步骤中,模型根据以下公式采样下一个潜在块:
$$ \hat{z}_{T+1:T+W} \sim p_\theta(z_{T+1:T+W} \mid z_{1:T}, C_{T+1:T+W}) , \quad (1) $$
4
第 5 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
图 2 架构概览。M4World 模型采用共享的 DiT 骨干网络,并配备两条交叉注意力路径以整合控制信号和跨传感器上下文,从而在异构驾驶条件下实现统一的多视角和多模态生成。
并将其追加到下一步的上下文中。生成的潜在块被解码为时间对齐的环绕视图视频和表示为范围图的同步 LiDAR 扫描。我们通过多阶段训练策略,将一个开源的双向文本到视频生成模型 [43] 实例化为自回归、可控的多模态世界模型。模型架构和训练过程分别在第 3.2 节和第 4 节中详述。
与大多数先前工作 [10, 11, 51] 不同,其物体级控制主要局限于几何层面,我们引入了补充传统几何控制的细粒度条件。这些条件使得对单个物体的精确控制成为可能,并且关键在于,能够可控地生成在真实世界驾驶数据中难以大规模捕获的罕见长尾物体(第 5 节)。为了大规模评估这一能力,我们进一步引入了一套专用的指标套件,用于自动测量生成驾驶场景中细粒度控制的保真度(第 8 节)。
3.2 M4World 模型架构
扩散变换器 (DiT) [34] 被用作我们潜在视频世界模型的骨干网络。DiT 首先将视频潜在表示分块并展平为时空标记,通过堆叠的 Transformer 块进行处理,然后将输出重新分块回潜在网格。如图 2 所示,在每个块中,自注意力捕获长程时空依赖关系,而交叉注意力将异构控制信号注入共享骨干网络。与 U-Net 骨干网络或 ControlNet 风格的辅助分支相比,这些特性提供了更灵活的多模态条件控制和更有利的扩展能力。
控制信号。我们采用 [10, 11] 中定义的控制信号,每帧条件集表示为 $C_t = \{L, S, P_t, M_t, O_t\}$。这些信号分为两类:全局条件(时间上一致)和时间演化条件。时间一致条件包括场景文本提示 $L$ 和传感器参数 $S$,在整个生成序列中保持固定。相机阵列条件定义为 $S_{cam} = \{(K_i, R_i, t_i)\}_{i=1}^{N_{cam}}$,其中 $K_i$ 是相机 $i$ 的内参矩阵,$(R_i, t_i)$ 指定其相对于 LiDAR 坐标系的位姿。时间演化条件包括自车位姿 $P_t = \{(R_t, t_t)\}$、表示 $w \times h$ 米交通区域且包含 $c$ 个类别的静态鸟瞰图 (BEV) 地图 $M_t \in \{0, 1\}^{w \times h \times c}$,以及物体属性 $O_t$,它们随时间演变以控制每帧中的场景动态。
具体而言,在时间戳 $t$,$O_t = \{o_{t,n}\}_{n=1}^{N_t}$ 收集了场景中所有 $N_t$ 个物体的属性。在帧 $t$,每个物体表示 $o_{t,n}$ 不仅包括传统的 3D 边界框 $b_{t,n} = \{(x_j, y_j, z_j) \in \mathbb{R}^3\}_{j=1}^8$ 和语义类别 $c$,还包括图像描述 $I_{obj_{t,n}}$ 和细粒度文本描述 $L_{obj_{t,n}}$,从而在物体位置和方向之外实现精确的外观级控制。
第 6 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
• 文本令牌(Text tokens):我们采用 umT5 模型 [7] 对高层场景描述 $L$ 进行编码。
• 传感器令牌和自车令牌(Sensor tokens and ego tokens):相机 rig 参数 $S_{cam}$ 和自车位姿 $P_t$ 均可表示为 3D 向量序列。每个相机条件构成形式为 $[K_i; R_i; t_i^\top] \in \mathbb{R}^{7 \times 3}$,而时刻 $t$ 的自车位姿定义为相对于第一帧的 $[R_t; t_t^\top] \in \mathbb{R}^{4 \times 3}$。我们对每个 3D 向量应用傅里叶嵌入 [29],并使用独立的 MLP 获取相机参数和自车位姿的控制令牌。LiDAR 传感器 $S_{lidar}$ 作为参考坐标系,因此不需要显式的类相机几何参数化。我们改用随机初始化的可学习令牌来表示它。
• 地图令牌(Map tokens):与先前通过 ControlNet 风格的辅助分支注入 2D 结构条件的方法不同,后者通常会引入大量的参数和计算开销,我们采用一种轻量级分词器,将 2D BEV 地图 $M_t$ 进行分块(patchify)并展平,形成控制令牌序列。
• 物体令牌(Object tokens):每个物体 $o_{t,n}$ 的控制令牌结合了上述四种互补类型的信息:3D 边界框、类别标签、图像描述和文本描述。对于类别标签,遵循先前做法 [24],我们使用其类别名称的池化嵌入作为标签嵌入。对于由八个角点坐标表示的 3D 框 $b_{t,n} \in \mathbb{R}^{8 \times 3}$,我们对每个点应用傅里叶嵌入 [29],并使用 MLP 对生成的特征进行编码。对于图像描述 $I_{obj_{t,n}}$,我们使用 SigLIP-V2 [47] 提取外观特征。对于文本描述 $L_{obj_{t,n}}$,我们使用 umT5 模型 [7] 获取其嵌入。最后,我们将这些嵌入拼接并通过 MLP 进行压缩,为每个单独的物体生成一个控制令牌,该令牌同时捕捉其几何布局以及细粒度的外观和语义信息。
LiDAR 模态支持。我们将每个 LiDAR 扫描投影为范围图(range map),这是一种 2D 图像,其像素编码了沿每条射线到最近表面的径向距离。这种表示允许我们直接重用 DiT 骨干网络进行并行多模态生成。原始范围图的分辨率为 $128 \times 1300$,其中垂直维度对应 128 个 LiDAR 波束,水平维度对应方位角采样。在 VAE 编码之前,我们将有效范围 $[0, 100]$ 米内的 LiDAR 距离归一化到 $[-1, 1]$,并将范围图调整大小以与图像输入具有相同的空间分辨率。然后,我们重用相同的视频 VAE 将范围图编码为潜在表示,从而在统一的潜在空间中对齐 LiDAR 和视频观测。
多条件与多视角聚合。在通用的文本到视频 DiT 架构基础上,我们保留其原始文本条件路径以整合高层场景描述 $L$。然后,源自传感器参数 $S$、自车位姿 $P_t$、BEV 地图 $M_t$ 和物体属性 $O_t$ 的驾驶特定控制令牌通过每个 DiT 块中的额外交叉注意力层注入到视频骨干网络中。为了进一步增强环绕视图和 LiDAR 生成中的跨视图一致性,我们遵循 Magic-DriveV2 [10] 并引入另一个用于逐视图特征聚合的交叉注意力层。具体而言,对于每个目标视图的潜在令牌,该层关注具有重叠视场的所有视图的潜在特征,允许每个视图在保留其自身视图特定结构的同时融入共享的观测上下文。在我们的实现中,我们将此跨视图注意力每五个 Transformer 层插入一次,这是在有效性和效率之间做出的设计权衡。
4 长视界流式展开
我们从双向 Wan2.1-T2V 模型 [43] 初始化我们的模型,该模型提供了强大的视觉生成先验,但最初是为离线文本到视频合成而设计的。将其转变为支持可控多模态生成、因果流式展开和稳定长视界外推的低延迟交互式驾驶世界模型,需要几个专门的训练阶段。
第 7 页
面向交互式物体操控与分钟级流式生成的多视图多模态驾驶世界模型
4.1 驾驶场景动力学的双向中期训练
第一阶段通过在自动驾驶数据上训练,将基础视频生成器迁移至驾驶领域,并使用第 3.2 节介绍的全部控制信号。除了领域适应之外,这一中期训练阶段还扩展了模型的输入-输出接口:它学习响应多种驾驶控制信号,同时生成同步的多视图和多模态观测结果。在此阶段,我们保留原始的双向注意力机制,使模型能够在每个训练片段中利用过去和未来的上下文,并在因果适应之前保留其建模驾驶场景动力学的能力。
具体而言,我们使用整流流目标 [27] 对模型进行优化。令 $x_0$ 表示干净的潜在训练样本,$\epsilon \sim \mathcal{N}(0, I)$ 表示具有相同形状的高斯噪声。对于随机采样的插值时间 $t \sim U(0, 1)$,我们通过线性混合两个端点来构建中间潜在状态:
$$ x_t = (1 – t)\epsilon + tx_0. \tag{2} $$
在这种直线传输路径下,目标速度沿轨迹恒定,并从噪声样本指向数据样本,即:
$$ v^* = x_0 – \epsilon. \tag{3} $$
DiT 骨干网络在驾驶控制信号 $C$ 的条件下训练以预测此速度场,从而产生目标函数:
$$ \mathcal{L}_{rf}(\theta) = \mathbb{E}_{x_0, \epsilon, t} \left[ \| v_\theta(x_t, t; C) – (x_0 – \epsilon) \|_2^2 \right]. \tag{4} $$
在训练期间,我们首先仅进行视觉生成,以建立稳定的驾驶场景先验。我们将视频片段混合为三种空间分辨率:$224 \times 400$、$424 \times 800$ 和 $576 \times 1024$,序列长度范围为 13 到 93 帧。同样,我们在每次训练迭代中随机采样相机配置,最多使用 10 个视图。在此训练充分进展后,我们启用 LiDAR 距离图生成。
在生成时,样本通过从高斯噪声开始并数值遵循学习到的速度场向数据分布移动来获得。一个实际问题是,标准的无分类器引导(CFG)通常会导致生成图像过饱和;对于 LiDAR 距离图,这种效应转化为对驾驶模拟不可接受的系统性深度偏移。因此,我们采用自适应投影引导(APG)[37] 进行 LiDAR 采样,它在标准引导的基础上不增加额外计算,同时有效提高了生成距离图的质量。
4.2 用于自回归展开的因果学生蒸馏
教师强制(Teacher Forcing, TF)。双向中期训练后,教师强制通过应用因果掩码到时间注意力,将模型从离线生成适应为自回归流式展开。具体而言,给定一个训练序列,我们采样真实视频潜在变量 $z_{1:T}$ 作为上下文前缀,并使用后续块 $z_{T+1:T+W}$ 作为预测目标。在此阶段,模型使用因果注意力进行训练,因此目标块只能以观察到的前缀和相应的未来控制信号 $C_{T+1:T+W}$ 为条件。遵循相同的整流流参数化,我们在时间 $t \sim U(0, 1)$ 用高斯噪声 $\epsilon \sim \mathcal{N}(0, I)$ 扰动目标块:
$$ x_t = (1 – t)\epsilon + tz_{T+1:T+W}. \tag{5} $$
模型在同时以驾驶信号 $C_{T+1:T+W}$ 和教师强制历史 $z_{1:T}$ 为条件的情况下,预测从噪声块到干净目标的速度:
$$ \mathcal{L}_{tf}(\theta) = \mathbb{E}_{z_{1:T+W}, \epsilon, t} \left[ \| v_\theta (x_t, t; C_{T+1:T+W}, z_{1:T}) – (z_{T+1:T+W} – \epsilon) \|_2^2 \right]. \tag{6} $$
通过在训练期间始终提供干净的历史上下文,教师强制在模型暴露于长程展开中的自身生成历史之前,为其提供了用于少步块预测的稳定监督信号。
第 8 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
因果 ODE 初始化。遵循先前的工作 [70, 74, 77],我们使用通过教师强制(Teacher Forcing)训练的自回归扩散模型来监督一个四步因果学生模型。这种初始化降低了 rollout 延迟,并为后续的自强制(Self-Forcing)和非对称分布匹配蒸馏(DMD)阶段提供了更强的起点。具体而言,教师模型首先在地面真值历史 $z_{1:T}$ 和未来控制 $C_{T+1:T+W}$ 下,为目标块生成离散的 ODE 轨迹。然后,我们在这些轨迹上对部分 $t$ 值采样中间噪声潜在变量 $x_t$,并训练学生生成器 $G_\theta$ 将其映射回干净的目标块 $z_{T+1:T+W}$:
$$ \mathcal{L}_{ode}(\theta) = \mathbb{E}_{z_{1:T+W}, t, x_t} \| G_\theta (x_t, t; C_{T+1:T+W}, z_{1:T}) – z_{T+1:T+W} \|_2^2 \quad . \quad (7) $$
自强制与非对称 DMD。为了缩小训练-测试分布差距,四步因果学生模型进一步通过自强制 [21] 进行训练,即在训练过程中让模型暴露于其自身生成的历史中。作为一种整体的视频级监督形式,我们采用 DMD [68, 69] 来对齐因果学生输出与双向教师输出的分布。该目标公式化为反向 KL 散度,其梯度可以通过教师和学生评分函数之间的差异来近似:
$$ \mathcal{L}_{dmd}(\theta) = \mathbb{E}_{\hat{z}, t, \hat{z}_t} \| \hat{z} – \text{sg} [\hat{z} – (s_{fake}(\hat{z}_t, t) – s_{real}(\hat{z}_t, t))] \|_2^2 \quad , \quad (8) $$
其中 $\text{sg}[\cdot]$ 表示停止梯度算子。完整视频序列 $\hat{z}$ 由学生 $G_\theta$ 通过自 rollout 生成,然后通过前向扩散过程扰动为 $\hat{z}_t$。$\hat{z}_t$ 在真实数据分布中的评分由冻结的教师模型估计,而 $\hat{z}_t$ 在学生分布中的评分由在线训练的假评分网络(判别器模型)估计。由于判别器提供学生分布评分 $s_{fake}$,不准确的判别器估计会直接导致不稳定或有偏的 DMD 梯度。因此,为了保持判别器与学生生成器不断变化的分布紧密对齐,我们遵循 DMD2 [68],在学生生成器更新五次后更新判别器一次。此外,在训练期间以 10% 的概率,我们将 DMD 目标与地面真值视频潜在变量上的监督去噪损失 $\mathcal{L}_{denoise}$ 相结合,这在经验上提高了训练稳定性并缓解了模式崩溃。
潜在上下文刷新。尽管在固定大小窗口内滚动 KV 缓存 [21] 能够通过上下文重用实现高效的外推,但由于分布不匹配,块边界处仍然会出现显著的闪烁伪影。受图像到视频条件设置以及现有滑动窗口间重叠帧的 KV 重新缓存实现 [1, 70] 的启发,我们在推理时引入了一种简单的潜在上下文刷新机制。具体而言,在对每个块进行去噪后,我们将其最后一帧的潜在表示作为额外的上下文输入反馈给网络,用于下一个块。这与纯自回归 KV 缓存不同,在纯自回归 KV 缓存中,缓存的键和值仅从历史标记计算,并且保持不变地重用。在我们的设置中,刷新的上下文输入参与下一个块噪声潜在标记的注意力机制;因此,其键和值取决于当前块的噪声,必须重新计算,而不仅仅是向前滚动。通过允许下一个块关注显式刷新的视觉锚点,该机制以无需训练的方式在经验上提高了块间的视觉一致性。
4.3 长视频上的迭代微调
尽管因果学生可以自回归地 rollout 超出训练期间看到的短片段,但之前的 DMD 阶段仍然仅在最多 93 帧的片段上运行。在更长的 rollout 过程中,模型通过有限的时间窗口反复依赖于其自身的预测,因此累积误差会逐渐破坏自生成的上下文并降低生成质量。遵循 LongLive [63],我们进一步通过迭代长视频微调来适配学生模型,使用更长的自 rollout 和本地时间监督,以更好地使训练时的上下文分布与自回归推理期间遇到的分布对齐。具体而言,学生生成一个 600 帧的自 rollout,在此期间,我们将其在每一个新生成的短片段上进行迭代微调,同时将之前生成的帧视为因果上下文。
此外,由于控制信号包括随时间变化的条件,如自车运动、地图和物体状态,每个 rollout 步骤的训练都旨在纳入当前时间戳的控制标记。新注入的
8
第 9 页
因此,控制指令可以在自回归生成过程中自然地生效,而无需像 [63] 那样执行显式的 KV 重缓存(KV-recache)操作。
4.4 基础设施优化
在描述了多阶段训练配方如何通过四步因果学生模型实现低延迟流式推理后,我们进一步介绍在训练和推理过程中使用的基础设施级优化措施。
去噪 DiT。我们使用如 [4] 中所述的平衡序列并行性来优化长时空 token 序列的去噪过程。该策略沿序列维度将 token 分布在多个 GPU 上,从而在保持全序列计算的同时降低每个 GPU 的激活内存占用。此外,由于我们的模型提供多视图和多模态生成,我们引入了传感器并行性(sensor parallelism),即将不同传感器的完整序列分布在 GPU 上进行并行计算。与序列并行不同,传感器并行性仅在跨视图注意力层需要通信。在实践中,我们发现每隔五个 Transformer 块插入一个这样的层就足够了;因此,我们优先考虑传感器并行性,因为它需要的通信频率较低。
VAE 解码。针对作为另一个推理瓶颈的最终 VAE 解码,我们采用了 LongLive2.0 [4] 的异步流水线,并在传感器和模态之间并行化解码过程。
5 面向长尾场景的高效后训练
尽管模型能够从大量常见样本中学习几何控制指令与场景级或对象级提示之间的关联,但驾驶模拟中的许多安全关键对象和其他感兴趣的对象本质上属于长尾分布。在我们的数据中,罕见的提示上下文往往仅出现几次,在许多情况下,包含目标对象的片段少于五个。我们发现,仅使用通用驾驶数据集进行训练并不能保证对长尾对象的可靠可控性。
为了解决这一局限性,我们针对每种罕见情况分别对基础模型进行监督微调。对于每种罕见情况,我们构建一个具有平衡采样策略的微调数据集:50% 来自目标罕见对象片段,其余 50% 来自普通驾驶片段。对目标罕见对象片段进行过采样提供了直接的学习信号,将罕见对象的视觉和文本提示绑定到相应的对象 token,从而增强模型在指定 3D 边界框内渲染目标对象的能力。同时,混合常见训练数据可防止适配过程偏离通用驾驶分布。
仅在少数罕见片段上进行全参数微调仍可能导致输出多样性下降,并削弱预训练模型的广泛可控性。因此,我们采用 LoRA [19] 适配器进行这种逐案例适配,同时冻结基础模型。这种参数高效的更新仅需几百次迭代即可学习罕见对象的属性,同时保留基础模型对对象位置、天气和照明的原始控制能力。
6 视觉参考条件生成
前述模型使用的条件集 $\mathcal{C}$ 仅包含可控驾驶场景生成所需的基本控制信号;它不包含场景级的视觉外观信息。然而,在实际应用中,有时可以提供额外的场景级视觉观测,并且应将其作为外观约束注入到后续生成中。
因此,我们将第 4 节中训练的双向教师模型扩展为一套视觉参考条件生成模型。有三个变体对应于不同形式的可用视觉信息:
- 首帧多视图条件:给定所有视图的首帧,模型预测后续的多视图帧。
第 10 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
• 首帧单视角条件引导:给定来自单个视角的首帧图像,模型合成同步的多摄像头视角并预测未来帧。
• 物体补全:给定一个掩蔽了单个物体的完整视频,模型根据控制信号补全缺失的物体。
所有三种变体共享相同的条件引导机制。视频 VAE 将提供的场景级视觉信息编码为参考潜在变量(reference latent),该潜在变量在空间和时间上进行扩展,以匹配初始噪声潜在变量的分辨率和长度。我们将此参考潜在变量与噪声潜在变量沿通道维度进行拼接,然后输入到 DiT 骨干网络中。对于每个任务,我们进一步构建一个任务特定的二值掩码,以指示观察到的视觉区域或目标补全区域,并通过相同的通道级拼接方式注入。这种设计在保持原始控制令牌路径不变的同时,允许生成过程锚定到明确的视觉外观条件上。
7 数据
训练可控的驾驶世界模型需要既在视觉上逼真又在行为上多样化的真实世界序列。我们收集了大规模、高保真的驾驶序列,涵盖了广泛的照明和天气条件、高速自车行为以及周围交通参与者。这些序列为学习驾驶场景动力学以及对细粒度条件的可控响应奠定了基础。
从自收集的原始驾驶日志池中,我们设计了一套自动化的数据挖掘和处理流水线,以构建用于我们世界模型的高质量训练数据。
7.1 数据筛选
传感器配置。我们为所有训练和评估序列采用统一的传感器配置。每个选定的序列以 10 FPS 的帧率捕获,由覆盖完整 360 度视场的 10 个环绕视角摄像头和一个朝前的 LiDAR 传感器组成。该配置为训练多视角和多模态世界模型提供了同步的视觉和几何观测数据。
数据选择。我们从原始语料库中进一步选择多样化的片段,以提高模型生成复杂动态场景的能力。具体而言,我们使用 BEV 感知模型的检测结果来识别自车周围具有密集且多样化物体分布的场景。这些检测结果提供了片段级属性,我们利用这些属性来选择包含密集且多样化交通参与者的片段,如行人、两轮车、三轮车和大型车辆。除了上述以物体为中心的场景外,我们还包括了在各种天气条件下捕获的片段以及具有高速自车运动的片段,涵盖了驾驶模拟所需的具有挑战性的外观和运动模式。
数据平衡。最后,我们在训练前对筛选后的数据进行属性平衡。这种平衡防止了常见和简单场景主导训练分布,并保留了对安全关键和复杂案例的充分曝光。最终的属性比例如图 3 所示。表 1 总结了训练集和评估集中的最终数据统计。
<!– Image (Figure 3 and Table 1 content is represented textually based on the layout) –>
图 3 筛选后的训练数据在片段级属性上的分布。极坐标条形图报告了由每个筛选标准选定的片段比例,涵盖了密集的交通参与者、具有挑战性的天气和高速自车运动。
| 属性 | 比例 | | :— | :— | | 行人 (Pedestrians) | 16% | | 两轮车 (Two-wheelers) | 22.6% | | 三轮车 (Tricycles) | 10% | | 卡车 (Trucks) | 30.6% | | 汽车 (Cars) | 38.2% | | 锥桶 (Cone) | 5.3% | | 雪天 (Snowy) | 14.1% | | 高速 (High-speed) | 32.4% |
筛选标准:
- 行人:10米内属性描述 > 15
- 两轮车:10米内 > 10
- 三轮车:10米内 > 5
- 卡车:30米内 > 10
- 汽车:20米内 > 15
- 锥桶:10米内 > 10
- 雪天:积雪路面
- 高速:自车速度 > 15 m/s
10
第 11 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
表 1 数据集统计信息与传感器配置详情。该数据集包含 10 秒的短片段和分钟级的长片段。10 秒的训练片段用于初始自回归因果模型的双向中间训练(第 4.1 节)和教师强制(TF,第 4.2 节),而 60 秒的长片段支持迭代长视频微调(第 4.3 节)。所有训练和测试序列均遵循相同的传感器配置。
| 统计信息 | 训练集 | | | 测试集 | | :— | :— | :— | :— | :— | | | 中间训练与 TF | 长时微调 | | | | 序列时长 | 10 秒 | 60 秒 | | 10 秒, 60 秒 | | 序列数量 | ~40,000 | ~4,000 | | 4,000 (10 秒), 300 (60 秒) | | 传感器套件 | 10 个摄像头,10 FPS;1 个 128 线 LiDAR,10 FPS,视场角 120° | | | | | 摄像头类型 | 1 个 60° 透视,5 个 120° 广角,4 个 190° 鱼眼 | | | | | 原始分辨率 | 576×1024 图像;128×1300 LiDAR 扫描 | | | |
7.2 条件自动打标
驾驶日志已经提供了模型所需的几种结构化条件,包括传感器参数、自车位姿和 BEV 地图。对于其余的条件输入,我们采用完全自动化的打标流程,为每个视频片段标注场景级和物体级的描述。
- 场景级文本提示:我们使用 Qwen3-VL [42],一种视觉语言模型(VLM),为每个驾驶视频片段生成自然语言描述。描述侧重于影响视觉外观和动力学的全局场景属性,包括天气(例如,晴天、雨天或雪天)和一天中的时间(例如,白天、黄昏或夜间)。具体而言,我们将每个片段的第一帧输入 VLM,该模型从该参考图像中解析场景级属性。
- 物体级描述:BEV 模型提供每个物体的 3D 边界框和语义类别。对于每个附近的物体,我们使用其标注的 3D 边界框从视频中裁剪出物体区域,并将生成的裁剪图像作为相应的图像描述。然后,我们提示 VLM 用自然语言描述标注每个物体,侧重于外观、大小和状态。
总体而言,生成的数据集为训练长视界驾驶世界模型提供了全面的基础。它包含同步的多视角视频和对齐的 LiDAR 观测数据,使得在一致的传感器几何结构下能够进行联合相机–LiDAR 生成。这些片段既包含用于密集短期动力学的 10 秒片段,也包含用于长视界推演的分钟级序列。结合额外的物体级标注,该数据集支持对单个物体进行细粒度控制,超越了单纯的几何放置。
8 使用 VLM 裁判进行可控性评估
我们从两个互补的角度评估生成的驾驶视频。首先,我们采用标准的分布级指标,包括 FID [16] 和 FVD [50],以衡量完整视频推演的感知真实性。这些指标反映了模型的基本视频生成能力,但不能直接衡量驾驶世界模型是否遵循定义目标模拟的丰富控制信号。为了评估这种细粒度的可控性,我们引入了一种基于 VLM 的自动化裁判,利用基础模型中编码的视觉和语义知识来检查生成驾驶场景中的条件遵循情况。我们的评估流程涵盖三个维度:场景级可控性、逐视角物体级可控性以及跨视角物体级一致性。
<!– Image (Figure 4) –>
图 4 场景可控性评估。
第 12 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
8.1 场景可控性
我们首先评估生成的序列是否遵循请求的全局场景属性,包括天气和一天中的时间。对于每次生成的 rollout(运行/序列),我们使用源自目标场景提示的二元问题查询 VLM。例如,在晴朗的白天条件下,我们提出两个问题:“这个场景是晴天吗?回答是或否。”以及“这个场景是白天吗?回答是或否。”这两个是/否回答分别用于衡量天气正确性和时间正确性。
8.2 视角级物体可控性
除了全局场景属性外,我们的模型旨在支持对自车周围每个交通物体的细粒度控制。每个物体通过四种互补的条件模态进行指定:其 3D 边界框、语义类别、图像描述和文本描述。在评估过程中,我们取为某个相机视图生成的视频以及与给定物体轨迹 ID 关联的四个条件输入,然后从视频中均匀采样帧。对于每个采样帧,我们将条件化的 3D 边界框投影到图像平面上,并裁剪相应的区域。我们仅保留较短边大于 100 像素的有效裁剪区域,并使用以下视角级物体级提示评估每个裁剪区域:
- 存在性(Existence)。我们提示 VLM 验证裁剪区域是否包含指定语义类别的物体:“这个物体是 [物体标签] 吗?回答是或否。”
- 清晰度(Clarity)。我们要求 VLM 判断裁剪中的物体在视觉上是否可识别:“这个物体清晰可辨吗?回答是或否。”
- 视觉保真度(Visual fidelity)。当物体以图像裁剪为条件时,我们使用该裁剪作为参考外观,并要求 VLM 将其与生成的裁剪进行比较:“这两张图像是同一物体吗?回答是或否。”
- 文本保真度(Textual fidelity)。当为物体提供文本描述时,我们要求 VLM 确定生成的裁剪是否与描述匹配:“这张图像是否与描述 [文本描述] 匹配?回答是或否。”
8.3 跨视角物体一致性
在共享 3D 物体条件下,同一交通物体应在时间和视角上保持视觉一致性。在评估过程中,我们从多个视图的生成视频中均匀采样帧。对于每个时间戳,我们将与同一物体轨迹 ID 关联的条件化 3D 边界框投影到所有相机视图上,并裁剪相应的物体区域。我们仅保留较短边大于 100 像素的有效裁剪区域,并将来自同一时间戳和轨迹 ID 的所有有效裁剪区域共同输入 VLM。我们向 VLM 提出以下问题:“这些图像裁剪是同一物体吗?回答是或否。”二元回答用于衡量生成的多视图观测是否在视角间保持了物体身份的一致性。
评分。对于每种提示类型,我们报告 VLM 回答“是”的频率作为相应的可控性得分。得分越高,表明生成的 rollout 越可靠地满足
第 13 页
评估条件。我们进一步按语义类别聚合对象级得分,这提供了对模型生成和控制不同类型交通对象能力的类别级评估。
9 实验与结果
9.1 基础评估
多视图与多模态生成。我们首先评估在第 4.1 节中训练的双向驾驶世界模型教师模型。我们使用生成的 10 秒驾驶视频来评估其生成质量和细粒度可控性。
图 7 展示了两个生成的驾驶片段,每个片段使用十个相机视图中的六个和一个 LiDAR 扫描进行可视化,展示了连贯的跨视图和跨模态合成。为了对生成质量进行定量比较,我们报告了与 MagicDriveV2 [11] 的 FID [16] 和 FVD [50];两个模型均在相同的数据集上训练。如表 2 所示,我们的方法通过统一设计实现了更低的 FID 和 FVD:自注意力执行长程时空建模,共享交叉注意力注入编码的控制信号。这些改进也表明,结合细粒度的对象级条件有效地提升了视觉质量。
细粒度可控性。在图 8 中,我们定性可视化了 M4World 的细粒度对象可控性。在保持条件指定的对象位置和方向的同时,我们的方法还控制了外观级属性,如形状和局部视觉细节。然后,我们使用第 8 节中引入的指标评估条件遵循性能。作为基线,我们使用 MagicDriveV2 [11],其输入排除了对象级文本和图像描述。如表 3 所示,M4World 不仅有效地遵循了对象级文本和视觉条件,而且受益于这些细粒度条件,进一步提升了场景控制、对象级空间可控性、视觉清晰度和跨视图一致性。
表 3 细粒度可控性的定量评估。我们的模型在场景级和对象级控制方面均优于 MagicDriveV2 [11],同时保持了高跨视图对象一致性。我们通过评估真实测试视频报告 Oracle 结果,这为可控性指标提供了经验上限。
| 方法 | 场景可控性 (%) ↑ | | | 视图级对象评估 (%) ↑ | | | 跨视图评估 | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 天气 | 一天中的时间 | 存在性 | 清晰度 | 视觉保真度 | 文本保真度 | 对象一致性 (%) ↑ | | Oracle | 76.7 | 83.0 | 95.4 | 74.6 | 87.0 | 75.4 | 93.3 | | MagicDriveV2 [11] | 75.4 | 79.1 | 82.6 | 59.1 | 13.4 | 11.6 | 78.9 | | Ours | 76.6 | 80.9 | 90.6 | 67.2 | 62.7 | 59.1 | 84.5 |
长视界流式生成。如图 9 所示,M4World 在 1024 × 567 分辨率和 10 FPS 下生成了两个 60 秒的多相机 rollout,并在长视界范围内保持了连贯的运动和外观,没有发生灾难性漂移。图 10 展示了具有细粒度对象可控性的分钟级 rollout 的整体结果。在吞吐量方面,我们的四步学生去噪器在八个 A100 GPU 上,针对六个相机视图加一个同步 LiDAR 流,在 1024 × 567、424 × 800 和 224 × 400 分辨率下分别达到了 0.7、2.3 和 7 FPS。此外,图 11 可视化了我们长视界生成训练配方中关键组件的影响。结果表明,在真实视频潜在变量上补充监督去噪损失 $L_{denoise}$ 以增强 DMD 目标,可以减轻背景退化,而潜在上下文刷新则减少了块间闪烁伪影。
9.2 案例研究:长尾驾驶场景
自动驾驶模拟的一个关键价值在于可控地丰富长尾场景的训练数据多样性。尽管每天收集的数千小时驾驶数据可以不断改进常见案例下的感知基础模型,但这些模型在泛化到罕见场景时仍然面临困难。
第 14 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
12
48 28
44
34 52
33 13
51 22 0
53 54 16
6
28 44
12
48 13
52 22
33
0
51
16
66
180 412 313 272 289 123 119 233 310 246 287 147 214
295 143 1 100 411 196
381 153
236 271
2 4
237 373 13
189 222 303
247 357
394 53
66
85 412 269 313 123 119 363
180 289
310 246 287
233
214
147 295
381 153 143 1 100 196
2 5
1 237 373 236 222 24 189 248
图 7 多视角和多模态生成的定性结果。从左到右,我们展示了输入控制信号、生成的多摄像头流以及同步时间戳下的 LiDAR 扫描。
14
第 15 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
9
11 30 16 25 21
20
12 1
23
2 4 28 14 39
196 34 22 36 3
29
37 0
32783391472 65 64
92 4 77622681904497969584592994396925515812 46 1610708622935436 2030 7
14
19 61 0
45 68
9136 24 80
1 66
82
61
79
73 72 482951 57 69 126 30 25 53 67 4162 49 56
75 44144011662621 3258 63
7 20 17 68 3 22 51 385550193947 13 315960 78 8 2 80
7742 23 0
93543363464741876 81 45 24 4
71
46 3728
32
7 19 8 40 1
27
23 2 161710153306241226229392129205 35313813 14 3436 4 2518 33
28 11
图 8 细粒度物体控制的定性评估。对于每种情况,左侧面板显示了自车附近四个物体的输入文本和视觉描述。在右侧的六视角生成结果中,彩色编码的边界框突出了相应的条件物体。
15
第 16 页
面向交互式物体操控与长达一分钟连续生成的多视角多模态驾驶世界模型
图 9 长时程生成的定性评估。我们展示了在六个视角下并行生成的 60 秒驾驶视频的关键帧。这些生成结果在长时程内保持稳定,保持了连贯的运动和视觉外观,未出现灾难性漂移。
16
第 17 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
186 881
336
654
798 775 7 841 188
679
132
494
518
45
148 169 424 881 841 271
780
133 679 481
696
595
494 236322207 334
491640 5
309
473
882 135 717 350 726 335
606
861
749 699
511 679 262
348 87 321 4 89 494 135 424 611
43161 881
53 502 699 726
801
413
105 612 450
284
271
780
825
196
881 127
338 612
699 886
413
105 1265631446 856490743
140
699
130 294 6 688 766 701 671
591
105 1676
图 10 展示具有细粒度物体可控性的长达一分钟连续生成的整体定性结果。
17
第 18 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
图 11 我们长视域生成训练配方中关键组件的可视化消融实验。我们的完整模型在自回归 rollout 过程中保持了更清晰的场景结构和更稳定的视觉质量。
在捕获数据中代表性不足的 scenarios。在实际工作流中,此类长尾案例通常根据具体属性逐个定义:场景本身罕见,需要解决的具体故障模式特定,且获取足够的真实世界数据成本高昂。
我们研究了一个具有代表性的案例:一辆运载大树的卡车。从后视图来看,卡车车身几乎完全被树枝遮挡,导致其外观与普通车辆显著不同,并可能对下游感知构成严峻挑战。然而,此类案例在真实日志中极为稀缺,在数十万小时的数据中仅观察到少于五个片段。尽管我们的世界模型是在常规驾驶数据上训练的,但其细粒度的物体控制接口,以及第 5 节介绍的 efficient 后训练过程,使得模型仅从少数几个罕见片段中即可适应。图 12 展示了由生成的驾驶模拟器合成的两种运载树木的卡车变体。结果表明,向经过少量片段适应的模拟器提供卡车的文本和图像描述,足以在各种条件下生成目标长尾场景。
此外,我们合成了 500 个 10 秒的运载树木卡车视频片段,并将其与 50,000 个真实片段混合,以构建增强训练集。然后,我们在此数据集上训练一个 BEV 检测模型,并在包含 99 个标注的运载树木卡车框的测试集上对其进行评估。表 4 显示,这些合成片段作为有效的数据增强,显著提高了对该特定长尾案例的感知性能,同时保持了与常规集检测性能相当的水平。
表 4 运载树木卡车长尾案例上的 BEV 检测结果。由少量片段适应的模拟器生成的合成片段提高了目标长尾物体的召回率,同时保留了常规集检测性能。
| BEV 检测器训练数据 | 运载树木卡车召回率 ↑ | 常规集 mAP ↑ | | :— | :— | :— | | 50k 真实片段 | 1.0% | 66.7% | | 50k 真实片段 + 500 合成片段 | 69.7% | 66.8% |
9.3 首帧条件生成
最后,我们展示了通过第 6 节介绍的微调视觉参考条件模型进行首帧编辑来实现可定制的驾驶模拟。给定一个原始前视图图像,我们使用图像
18
第 19 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
44
48
27 30
22 11 174529153191464 25
23
21 12
8
1 28
38
278413 315846804116 40 11 4436376850 8
14
81
64
51
85 25
61
56 86
图 12 长尾场景增强的定性评估。我们将同一个长尾物体——运树卡车——插入两种不同的场景配置中,从而增加了目标场景的多样性。
64
5 19
10
53
6255 31 6344 61 341651 59522948 38 4120 6924 22 11 65 12 27402 5035
23
68
37 66 5413
图 13 基于编辑后的第一帧前视图提示的视觉条件生成定性结果。左侧:$t=0$ 时的原始前视图以及物体替换后的编辑提示图像。右侧:基于编辑后提示在 $t=1$ 秒时生成的结果。顶行和底行分别展示了原始公交车被替换为水泥搅拌车和运树卡车的结果。
19
第 20 页
用于交互式物体操控和长达一分钟的流式生成的多视图多模态驾驶世界模型
编辑工具可将任何物体替换为不常见的目标物体,例如水泥搅拌车或运树卡车,如图 13 所示。基于此编辑后的第一帧前视图像,模型补全其余相机视角,并根据后续随时间变化的控制信号预测未来帧。在这些示例中,替换目标通过单视图编辑指定,其后续演化通过密集的时间信号保持可控。该过程为生成长尾驾驶数据提供了一种零样本、可控的路径。
10 结论
本文介绍了 M4World,一种适用于自动驾驶仿真生成的驾驶世界模型。M4World 的一个核心目标是超越仅基于几何的场景描述:该模型在给定 3D 布局、类别、视觉外观和文本属性作为条件下,生成同步的多视图相机流和 LiDAR 点云图,并对各个交通代理进行条件控制。这种以物体为中心的接口是在共享的 DiT 潜在骨干网络中实现的,并通过渐进式训练管道使其适用于流式生成。对于流式生成,所开发的训练配方将双向视频先验知识迁移到低延迟的因果学生模型中,让学生模型接触自生成的历史数据,并通过潜在上下文刷新提高块间一致性。在基础模型之上,高效的少片段后训练和视觉参考条件变体为构建定制化的长尾场景提供了两条互补的路径。
在生成质量、条件遵循、生成稳定性以及下游数据增强方面,结果证明了在空间布局和视觉外观层面控制物体对于驾驶仿真的有效性。与现有的可控驾驶视频生成基线相比,M4World 将 FID/FVD 从 41.7/346.1 提升至 34.8/288.7,将物体视觉和文本保真度分别从 13.4% 和 11.6% 提升至 62.7% 和 59.1%,并将跨视图物体一致性从 78.9% 提升至 84.5%。蒸馏后的少步因果学生模型能够生成稳定的 60 秒生成序列,证明了细粒度条件控制可以在长自回归生成中得以保留。我们还证明,由高效少片段后训练启发的可控长尾合成可以带来可衡量的感知性能提升:在典型的运树卡车案例中,将 500 个合成片段添加到 50,000 个真实片段中,使目标召回率从 1.0% 提升至 69.7%,同时保持了常规集合的 mAP。更广泛地说,M4World 指明了一条通向仿真系统的道路,在该系统中,罕见事件不仅由物体出现的位置指定,还由它们的外观以及在视图、模态和时间上的持久性来指定。未来的工作应扩展罕见事件分类法的覆盖范围,并在真正的闭环设置中评估模型,其中学习的驾驶策略与生成的环境交互,并评估其对安全关键事件的响应。
参考文献
[1] Sand AI. MAGI-1: Autoregressive Video Generation at Scale, arXiv preprint arXiv:2505.13211, 2025. Available at http://arxiv.org/abs/2505.13211.
[2] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. Video generation models as world simulators, 2024.
[3] Xiaoxue Chen, Ziyi Xiong, Yuantao Chen, Gen Li, Nan Wang, Hongcheng Luo, Long Chen, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Hongyang Li, Ya-Qin Zhang, and Hao Zhao. DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images. In CVPR. 2026.
[4] Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, Yuyang Zhao, Huizi Mao, Ying-Cong Chen, Enze Xie, Xiaojuan Qi, and Song Han. LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation, arXiv preprint arXiv:2605.18739, 2026. Available at http://arxiv.org/abs/2605.18739.
[5] Ziyu Chen, Jiawei Yang, Jiahui Huang, Riccardo de Lutio, Janick Martinez Esturo, Boris Ivanovic, Or Litany, Zan Gojcic, Sanja Fidler, Marco Pavone, Li Song, and Yue Wang. OmniRe: Omni Urban Scene Reconstruction. In ICLR. 2025.
[6] Kai Cheng, Xiaoxiao Long, Wei Yin, Jin Wang, Zhiqiang Wu, Yuexin Ma, Kaixuan Wang, Xiaozhi Chen, and
20
第 21 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
Xuejin Chen。UC-NeRF:用于自动驾驶中未充分校准的多视角相机的神经辐射场。 在 ICLR,2024。
[7] Hyung Won Chung, Noah Constant, Xavier Garcia, Adam Roberts, Yi Tay, Sharan Narang, 和 Orhan Firat。 UniMax:面向大规模多语言预训练更公平且更有效的语言采样。在 ICLR,2023。
[8] Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh。 Self-forcing++:迈向分钟级高质量视频生成。在 ICLR,2026。
[9] Jiaqi Feng, Justin Cui, Yuanhao Ban, 和 Cho-Jui Hsieh。One-Forcing:迈向稳定的一步自回归视频生成,arXiv 预印本 arXiv:2605.23458,2026。可访问 http://arxiv.org/abs/2605.23458。
[10] Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, 和 Qiang Xu。MagicDrive:具有多样化 3D 几何控制的街景生成。在 ICLR。2024。
[11] Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, 和 Qiang Xu。MagicDrive-V2:具有自适应控制的高分辨率长视频生成用于自动驾驶。在 ICCV,2025。
[12] Ruiyuan Gao, Kai Chen, Zhihao Li, Lanqing Hong, Zhenguo Li, 和 Qiang Xu。MagicDrive3D:面向街景任意视角渲染的可控 3D 生成。在 WACV。2026。
[13] Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, 和 Hongyang Li。 Vista:具有高保真度和多功能可控性的通用驾驶世界模型。在 NeurIPS。2024。
[14] Jianfei Guo, Nianchen Deng, Xinyang Li, Yeqi Bai, Botian Shi, Chiyu Wang, Chenjing Ding, Dongliang Wang, 和 Yikang Li。StreetSurf:将多视角隐式表面重建扩展至街景,arXiv 预印本 arXiv:2306.04988,2023。可访问 https://arxiv.org/abs/2306.04988。
[15] XPeng Inc. GWM Team。X-World:面向可扩展端到端驾驶的可控自中心多相机世界模型,2026。可访问 https://arxiv.org/abs/2603.19979v2。
[16] Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, 和 Sepp Hochreiter。GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium。在 NeurIPS。2017。
[17] Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, 和 Jie Tang。CogVideo:通过 Transformer 进行文本到视频生成的大规模预训练。在 ICLR。2023。
[18] Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton, 和 Gianluca Corrado。GAIA-1:自动驾驶的生成式世界模型,arXiv 预印本 arXiv:2309.17080,2023。 可访问 http://arxiv.org/abs/2309.17080。
[19] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, 和 Weizhu Chen。LoRA:大语言模型的低秩适应。在 ICLR。2022。
[20] Nan Huang, Xiaobao Wei, Wenzhao Zheng, Pengju An, Ming Lu, Wei Zhan, Masayoshi Tomizuka, Kurt Keutzer, 和 Shanghang Zhang。$\textit{S}^3$Gaussian:用于自动驾驶的自监督街景高斯模型。在 ICRA。2026。
[21] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman。Self Forcing:弥合自回归视频扩散中的训练-测试差距。在 arXiv.Org,2025。
[22] Muhammad Zubair Irshad, Sergey Zakharov, Katherine Liu, Vitor Guizilini, Thomas Kollar, Adrien Gaidon, Zsolt Kira, 和 Rares Ambrus。NeO 360:用于户外场景稀疏视图合成的神经场。在 ICCV,2023。
[23] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, 和 George Drettakis。用于实时辐射场渲染的 3D 高斯溅射。ACM Trans. Graph., 42(4):1–14, 2023。
[24] Yuheng Li, Haotian Liu, Qingyang Wu, Fangzhou Mu, Jianwei Yang, Jianfeng Gao, Chunyuan Li, 和 Yong Jae Lee。GLIGEN:开放集接地文本到图像生成。在 CVPR。2023。
[25] Zhuopeng Li, Yilin Zhang, Chenming Wu, Jianke Zhu, 和 Liangjun Zhang。HO-Gaussian:面向城市场景的 3D 高斯溅射混合优化。在 ECCV。2024。
[26] Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, 和 Shijian Lu。Rolling Forcing:实时自回归长视频扩散。 在 ICLR,2026。
[27] Xingchao Liu, Chengyue Gong, 和 Qiang Liu。Flow Straight and Fast:学习使用整流流生成和转移数据。 在 ICLR。2023。
21
第 22 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
[28] Yang Liu, He Guan, Chuanchen Luo, Lue Fan, Junran Peng, 和 Zhaoxiang Zhang。CityGaussian:使用高斯进行实时高质量大规模场景渲染。发表于 ECCV,2024。
[29] Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron, Ravi Ramamoorthi, 和 Ren Ng。NeRF:将场景表示为神经辐射场以进行视图合成。发表于 ECCV,2020。
[30] Thomas Müller, Alex Evans, Christoph Schied, 和 Alexander Keller。具有多分辨率哈希编码的即时神经图形基元。ACM Trans. Graph., 41(4):1–15, 2022。
[31] Chaojun Ni, Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Wenkang Qin, Guan Huang, Chen Liu, Yuyin Chen, Yida Wang, Xueyang Zhang, Yifei Zhan, Kun Zhan, Peng Jia, Xianpeng Lang, Xingang Wang, 和 Wenjun Mei。ReconDreamer:通过在线重建打造驾驶场景重建的世界模型。发表于 CVPR,2025。
[32] NVIDIA。Cosmos World Foundation Model Platform for Physical AI,2025。可访问 https://arxiv.org/abs/2501.03575v3。
[33] NVIDIA。NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型,arXiv 预印本 arXiv:2606.03159,2026。可访问 http://arxiv.org/abs/2606.03159。
[34] William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。发表于 ICCV,2023。
[35] Xuanchi Ren, Yifan Lu, Tianshi Cao, Ruiyuan Gao, Shengyu Huang, Amirmojtaba Sabour, Tianchang Shen, Tobias Pfaff, Jay Zhangjie Wu, Runjian Chen, Seung Wook Kim, Jun Gao, Laura Leal-Taixe, Mike Chen, Sanja Fidler, 和 Huan Ling。Cosmos-Drive-Dreams:利用世界基础模型进行可扩展的合成驾驶数据生成,arXiv 预印本 arXiv:2506.09042,2025。可访问 http://arxiv.org/abs/2506.09042。
[36] Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, 和 Gianluca Corrado。GAIA-2:一种可控的多视角生成式世界模型,用于自动驾驶,arXiv 预印本 arXiv:2503.20523,2025。可访问 http://arxiv.org/abs/2503.20523。
[37] Seyedmorteza Sadat, Otmar Hilliges, 和 Romann M. Weber。消除扩散模型中高引导尺度下的过饱和和伪影。发表于 ICLR,2025。
[38] Kaiyuan Tan, Yingying Shen, Haohui Zhu, Zhiwei Zhan, Shan Zhao, Mingfei Tu, Hongcheng Luo, Haiyang Sun, Bing Wang, Guang Chen, 和 Hangjun Ye。ExtraGS:具有不确定性引导生成先验的几何感知轨迹外推,arXiv 预印本 arXiv:2508.15529,2025。可访问 http://arxiv.org/abs/2508.15529。
[39] Kaiyuan Tan, Yingying Shen, Mingfei Tu, Haohui Zhu, Bing Wang, Guang Chen, Hangjun Ye, 和 Haiyang Sun。UFO:统一前馈和优化方法用于大规模驾驶场景建模。发表于 CVPR,2026。
[40] Matthew Tancik, Vincent Casser, Xinchen Yan, Sabeek Pradhan, Ben Mildenhall, Pratul P. Srinivasan, Jonathan T. Barron, 和 Henrik Kretzschmar。Block-NeRF:可扩展的大规模场景神经视图合成。发表于 CVPR,2022。
[41] Hunyuan Foundation Model Team。HunyuanVideo:大型视频生成模型的系统框架,arXiv 预印本 arXiv:2412.03603,2025。可访问 http://arxiv.org/abs/2412.03603。
[42] Qwen Team。Qwen3-VL 技术报告,arXiv 预印本 arXiv:2511.21631,2025。可访问 http://arxiv.org/abs/2511.21631。
[43] Wan Team。Wan:开放且先进的超大规模视频生成模型,arXiv 预印本 arXiv:2503.20314,2025。可访问 http://arxiv.org/abs/2503.20314。
[44] Xiaomi EV World Model Team。Xiaomi EV World Model:一种集成重建与生成的自动驾驶联合世界模型,arXiv 预印本 arXiv:2605.18137,2026。可访问 http://arxiv.org/abs/2605.18137。
[45] The Movie Gen team。Movie Gen:一组媒体基础模型,arXiv 预印本 arXiv:2410.13720,2025。可访问 http://arxiv.org/abs/2410.13720。
[46] Adam Tonderski, Carl Lindström, Georg Hess, William Ljungbergh, Lennart Svensson, 和 Christoffer Petersson。NeuRAD:用于自动驾驶的神经渲染。发表于 CVPR,2024。
[47] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier Hénaff, Jeremiah Harmsen, Andreas Steiner, 和 Xiaohua Zhai。SigLIP 2:具有改进语义理解、定位和密集特征的多语言视觉语言编码器,arXiv 预印本 arXiv:2502.14786,2025。可访问 http://arxiv.org/abs/2502.14786。
22
第 23 页
面向交互式物体操控与分钟级流式生成的多视角多模态驾驶世界模型
[48] Haithem Turki, Jason Y. Zhang, Francesco Ferroni, 和 Deva Ramanan. SUDS: Scalable Urban Dynamic Scenes. 在 CVPR. 2023.
[49] Haithem Turki, Qi Wu, Xin Kang, Janick Martinez Esturo, Shengyu Huang, Ruilong Li, Zan Gojcic, 和 Riccardo de Lutio. SimULi: Real-Time LiDAR and Camera Simulation with Unscented Transforms. 在 ICLR. 2026.
[50] Thomas Unterthiner, Sjoerd van Steenkiste, Karol Kurach, Raphael Marinier, Marcin Michalski, 和 Sylvain Gelly. Towards Accurate Generative Models of Video: A New Metric & Challenges, arXiv 预印本 arXiv:1812.01717, 2019. 可在 http://arxiv.org/abs/1812.01717 获取.
[51] Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu. DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving. 在 ECCV, 2024.
[52] Yuqi Wang, Jiawei He, Lue Fan, Hongxin Li, Yuntao Chen, 和 Zhaoxiang Zhang. Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous Driving. 在 CVPR. 2024.
[53] Xiaobao Wei, Zhangjie Ye, Yuxiang Gu, Zunjie Zhu, Yunfei Guo, Yingying Shen, Shan Zhao, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Rongfeng Lu, 和 Hangjun Ye. ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking, arXiv 预印本 arXiv:2601.01386, 2026. 可在 http://arxiv.org/abs/2601.01386 获取.
[54] Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, 和 Xiangyu Zhang. Panacea: Panoramic and Controllable Video Generation for Autonomous Driving. 在 CVPR. 2024.
[55] Guanjun Wu, Taoran Yi, Jiemin Fang, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Qi Tian, 和 Xinggang Wang. 4D gaussian splatting for real-time dynamic scene rendering. 在 CVPR, 2024.
[56] Jay Zhangjie Wu, Yuxuan Zhang, Haithem Turki, Xuanchi Ren, Jun Gao, Mike Zheng Shou, Sanja Fidler, Zan Gojcic, 和 Huan Ling. Difix3D+: Improving 3D Reconstructions with Single-Step Diffusion Models. 在 CVPR. 2025.
[57] Qi Wu, Janick Martinez Esturo, Ashkan Mirzaei, Nicolas Moenne-Loccoz, 和 Zan Gojcic. 3DGUT: Enabling Distorted Cameras and Secondary Rays in Gaussian Splatting. 在 CVPR. 2025.
[58] Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, 和 Mike Lewis. Efficient Streaming Language Models with Attention Sinks. 在 ICLR. 2024.
[59] Yunzhi Yan, Haotong Lin, Chenxu Zhou, Weijie Wang, Haiyang Sun, Kun Zhan, Xianpeng Lang, Xiaowei Zhou, 和 Sida Peng. Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting. 在 ECCV. 2024.
[60] Jiawei Yang, Boris Ivanovic, Or Litany, Xinshuo Weng, Seung Wook Kim, Boyi Li, Tong Che, Danfei Xu, Sanja Fidler, 和 Marco Pavone. EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision. 在 ICLR, 2024.
[61] Jiawei Yang, Jiahui Huang, Yuxiao Chen, Yan Wang, Boyi Li, Yurong You, Apoorva Sharma, Maximilian Igl, Peter Karkus, Danfei Xu, Boris Ivanovic, Yue Wang, 和 Marco Pavone. STORM: Spatio-Temporal Reconstruction Model for Large-Scale Outdoor Scenes. 在 ICLR. 2025.
[62] Jiazhi Yang, Shenyuan Gao, Yihang Qiu, Li Chen, Tianyu Li, Bo Dai, Kashyap Chitta, Penghao Wu, Jia Zeng, Ping Luo, Jun Zhang, Andreas Geiger, Yu Qiao, 和 Hongyang Li. GenAD: Generalized Predictive Model for Autonomous Driving. 在 CVPR. 2024.
[63] Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Ying- cong Chen, Yao Lu, Song Han, 和 Yukang Chen. LongLive: Real-time Interactive Long Video Generation, 2025. 可在 https://arxiv.org/abs/2509.22622v2 获取.
[64] Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, 和 Zhaoxiang Zhang. NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos. 在 CVPR, 2026.
[65] Ze Yang, Yun Chen, Jingkang Wang, Sivabalan Manivasagam, Wei-Chiu Ma, Anqi Joyce Yang, 和 Raquel Urtasun. UniSim: A neural closed-loop sensor simulator. 在 CVPR, 2023.
[66] Ziyi Yang, Xinyu Gao, Wen Zhou, Shaohui Jiao, Yuqing Zhang, 和 Xiaogang Jin. Deformable 3D Gaussians for High-Fidelity Monocular Dynamic Scene Reconstruction. 在 CVPR. 2024.
[67] Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, 和 Seungryong Kim. Deep Forcing: Training- Free Long Video Generation with Deep Sink and Participative Compression. 在 ICML. 2026.
第 24 页
面向交互式物体操控与长达一分钟流式生成的多视角多模态驾驶世界模型
[68] Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, and William T. Freeman. Improved Distribution Matching Distillation for Fast Image Synthesis. In NeurIPS. 2024.
[69] Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T. Freeman, and Taesung Park. One-step Diffusion with Distribution Matching Distillation. In CVPR, 2024.
[70] Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Fredo Durand, Eli Shechtman, and Xun Huang. From Slow Bidirectional to Fast Autoregressive Video Diffusion Models. In CVPR, 2025.
[71] Zikang Yuan, Yuechuan Pu, Hongcheng Luo, Fengtian Lang, Cheng Chi, Teng Li, Yingying Shen, Haiyang Sun, Bing Wang, and Xin Yang. Uni-Gaussians: Unifying Camera and Lidar Simulation with Gaussians for Dynamic Driving Scenarios, arXiv preprint arXiv:2503.08317, 2025. Available at http://arxiv.org/abs/2503.08317.
[72] Conglang Zhang, Yifan Zhan, Qingjie Wang, Zhanpeng Ouyang, Yu Li, Zihao Yang, Xiaoyang Guo, Weiqiang Ren, Qian Zhang, Zhen Dong, Yinqiang Zheng, Wei Yin, and Zhengqing Chen. HorizonDrive: Self-Corrective Autoregressive World Model for Long-horizon Driving Simulation, arXiv preprint arXiv:2605.11596, 2026. Available at http://arxiv.org/abs/2605.11596.
[73] Guosheng Zhao, Chaojun Ni, Xiaofeng Wang, Zheng Zhu, Xueyang Zhang, Yida Wang, Guan Huang, Xinze Chen, Boyuan Wang, Youyi Zhang, Wenjun Mei, and Xingang Wang. DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation. In CVPR. 2025.
[74] Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, and Jun Zhu. minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models, 2026. Available at https://arxiv.org/abs/2605.30263v1.
[75] Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, and Yang You. Open-Sora: Democratizing Efficient Video Production for All, arXiv preprint arXiv:2412.20404, 2024. Available at http://arxiv.org/abs/2412.20404.
[76] Xiaoyu Zhou, Zhiwei Lin, Xiaojun Shan, Yongtao Wang, Deqing Sun, and Ming-Hsuan Yang. DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving Scenes. In CVPR. 2024.
[77] Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, and Jun Zhu. Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation. In ICML. 2026.
24