三分钟导读:Orbis 2提出了一种分层驾驶世界模型,通过抽象层进行长时域语义预测和细节层进行短时域高保真生成,并结合扩散强制预训练与教师强制微调,实现了状态级的长程稳定性和内部表征质量。
英文题目:Orbis 2: A Hierarchical World Model for Driving
论文出处:arXiv 每日论文精选 · arXiv:2607.15898
原始论文:PDF / 论文页面
对应视频标题:Orbis 2:分层世界模型解决自动驾驶长程预测漂移与语义丢失问题|推荐指数:★★★★★
这篇论文解决什么问题?
现有世界模型通常在单一抽象层级运行,优先考虑感知保真度而缺乏空间推理和语义理解,导致长时域预测中误差累积和语义结构丢失。
核心创新
- 分层世界模型架构,解耦长时域抽象预测与短时域细节生成
- 使用压缩的DINO latent作为高层抽象表示,平衡语义结构与生成稳定性
- 提出Diffusion Forcing预训练结合Teacher Forcing微调的两阶段训练范式
- 引入FVD-slope指标量化长时域预测中的渐进式保真度损失
方法概览
提出分层架构:高层抽象预测器在压缩的16维DINO latent空间中以2Hz运行,捕获长时域动态;低层细节预测器在像素对齐的latent空间中以10Hz运行,生成高保真帧。训练策略采用两阶段范式:先用Diffusion Forcing预训练以增强内部表征,再用Teacher Forcing微调以保证自回归生成的稳定性。
逐图理解论文
方法:分层架构设计

Orbis 2采用双层架构。高层抽象预测器在压缩的16维DINO latent空间中以2Hz运行,捕获长时域动态与语义结构。低层细节预测器在像素对齐的latent空间中以10Hz运行,生成高保真帧。这种设计使高层专注于状态推理,低层专注于视觉细节,避免单一模型同时优化多尺度目标的困难。
创新:压缩DINO Latent

传统方法直接使用高维DINO特征作为latent,导致生成质量差且不稳定。Orbis 2引入压缩的16维DINO latent,通过流匹配目标有效建模。实验表明,全维DINO空间预测退化迅速,而压缩latent空间能保持长程稳定性,即使在小模型下也能实现高质量生成。
训练策略:两阶段范式

训练采用两阶段范式。首先使用Diffusion Forcing预训练,独立噪声化序列中所有帧并联合预测速度,增强内部表征的鲁棒性。随后使用Teacher Forcing微调,保证自回归生成的稳定性。这种组合既利用了扩散模型的表征能力,又确保了推理时的时序一致性。
实验:长程预测性能

在nuPlan、Waymo和nuPlan-turns数据集上进行6秒长时域评估。Orbis 2在nuPlan上FVD为98.97,Waymo上为98.01,nuPlan-turns上为187.53。更重要的是,FVD-slope为46.45,表明视频质量随时间渐进损失较小,优于Cosmos-v2.5和Vista等基线模型。
实验:反事实转向控制

在原始和反事实轨迹上进行转向控制评估。在速度减半时ADE为0.53,速度加倍时为1.65;偏航率减半时为0.73,加倍时为0.73。模型能跟随偏离原始轨迹的指令,执行更温和或更急的转弯,证明其具备反事实推理能力。
实验与关键结果
- 在nuPlan, Waymo, nuPlan-turns数据集上进行6秒长时域FVD评估
- 在Cityscapes和KITTI数据集上进行线性探测以评估语义分割和深度估计的表征质量
- 在原始和反事实轨迹上进行转向控制响应评估(ADE指标)
- 层级设计消融实验(不同抽象层级和帧率组合)
- 训练策略消融实验(Diffusion Forcing vs Teacher Forcing)
- 与Cosmos-v2.5, Vista, GEM, Epona, Orbis v1等SOTA模型对比
- 在nuPlan, Waymo, nuPlan-turns数据集上进行6秒长时域FVD评估
- 在Cityscapes和KITTI数据集上进行线性探测以评估语义分割和深度估计的表征质量
- 在原始和反事实轨迹上进行转向控制响应评估(ADE指标)
- 层级设计消融实验(不同抽象层级和帧率组合)
- 训练策略消融实验(Diffusion Forcing vs Teacher Forcing)
- 与Cosmos-v2.5, Vista, GEM, Epona, Orbis v1等SOTA模型对比
阅读时需要注意
- Diffusion Forcing提升表征的具体原因未深入研究,仅假设其作为隐式数据增强
- 分层架构依赖分离的抽象和细节latent空间,限制了层级间的交互
- 在稀有类别(如bus, train, motorcycle)的语义分割上表现不如DINOv2-Base
- Cosmos-v2.5的训练数据混合未公开,且参数量是Orbis 2的两倍,数据量是3倍,直接比较需考虑资源差异
- Epona仅在nuPlan和nuScenes上训练,泛化到Waymo表现较差
- 反事实转向评估中,ADE计算需对齐轨迹尺度以消除全局尺度误差
关联工作
- Orbis (v1):前身工作,使用混合tokenizer但为单分支结构,Orbis 2通过分层设计进一步提升了长程稳定性(第 3 页)
- Cosmos-v2.5:SOTA基线,在nuPlan上FVD最低,但长程稳定性(FVD-slope)和表征质量不如Orbis 2(第 6 页)
- Epona:自回归扩散世界模型,在nuPlan上表现好但泛化性差,转向控制略逊于Orbis 2(第 6 页)
- Vista:高保真通用驾驶世界模型,长程稳定性较差(第 6 页)
- DINO-WM:使用DINO特征作为latent,但未实现分层结构(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Orbis 2:一种用于驾驶的层次化世界模型
Sudhanshu Mittal∗ Arian Mousakhan∗ Silvio Galesso∗
Karim Farid Jonannes Dienert Rajat Sahay Thomas Brox
弗赖堡大学,德国
摘要
当前的世界模型在单一抽象层级上运行,大多数优先考虑感知保真度,但缺乏现实世界下游任务所需的推理能力和语义理解。我们提出了一种层次化驾驶世界模型,该模型在两个不同时间和抽象尺度的层级上分解未来预测:高层预测器在扩展的时间范围内预测粗略的场景结构,而低层生成器则基于高层输出生成详细的帧预测。这种分解既产生了高感知保真度,又捕捉到了强大的空间和语义表征。我们进一步表明,使用扩散强制(Diffusion Forcing)目标进行预训练比标准的教师强制(Teacher Forcing)目标能产生更丰富的内部表征,而教师强制——仅从干净上下文预测下一帧——能产生更稳定的自回归 rollout。因此,我们引入了一种通用的两阶段训练范式,先用扩散强制预训练模型,再用教师强制进行微调,从而结合前者的表征优势与后者的 rollout 稳定性。我们的方法在既定基准上的标准驾驶世界模型评估中取得了最先进(SOTA)的结果,包括长时域生成保真度、在反事实场景上评估的转向响应能力以及内部表征质量。项目页面包含代码、演示、检查点和定性结果:https://lmb-freiburg.github.io/orbis2.github.io
1 引言
世界模型 [15, 17, 30] 是学习到的动态系统,它们近似环境如何响应智能体的动作而演变,提供内部转换动态预测,以支持规划、模拟和策略学习 [45]。在高维、复杂的领域(如自动驾驶)中,世界模型通常在学习到的潜在空间中构建,其中编码器将原始观测值映射为紧凑的潜在表征,预测器则根据智能体的动作将这些状态向前传播。当前对该范式的实现在两个关键方面存在局限。首先,预测器在单一时间尺度上运行 [3, 2]:rollout 是逐帧生成的,误差随时间累积,限制了模型显式推理长时域场景演变的能力。其次,潜在空间通常由重建目标塑造,以保留所有细微的视觉细节(如纹理和外观),尽管长时域动态主要由粗略、缓慢变化的语义属性主导,这使得此类表征对于长时域预测而言并非最优。这与认知科学中一个既定的原则一致:人类使用简化的
第 2 页
摘要 长时域预测
摘要 潜在令牌
Abstract Abstract Abstract Encoder Predictor Decoder
Start 0.5s 1s 1.5s 2s Spatial AdaLN 2s 2.5s
Detail latent tokens
Detail Detail Detail Encoder Predictor Decoder
详细短时域预测
图 1: Orbis 2:一种分层驾驶世界模型。抽象预测器在长时域上下文中运行,以预测潜在空间中的未来状态,捕捉长时域的抽象场景动态,并实现转向控制。细节预测器以该抽象预测为条件,生成细粒度的短时域帧,从而在长时域上下文的约束下实现高保真的局部预测。
抽象表征,并仅在动作接近执行时细化细节 [47, 21]。基于这一原则,我们提出了一种将未来预测分解为两个抽象层级的设置。高层预测器在抽象潜在空间中预测长时域动态,生成子目标以条件化低层预测器。后者在更细粒度的潜在空间中运行,专门用于详细的短时域预测。图 1 概述了我们的分层框架。
对于高层预测器,我们需要一个能够强烈捕捉空间结构和语义理解的潜在空间,从而实现长时域的时间估计。因此,我们利用压缩的 DINO [38] 表征作为高层预测器的目标。由于直接在高分辨率空间中应用流匹配 [33] 具有挑战性 [56, 29],我们引入了一种轻量级投影,将 DINOv2 特征压缩到较低维度的潜在空间中,这稳定了训练并提高了长时域 rollout 的质量,同时保留了 DINO 的表征特性。低层预测器的目标则是捕捉细粒度的细节和精确的运动动态,并以高层预测为条件。这自然适合基于像素重建的潜在空间(如 VAEs [28]),这些空间保留了短时域高保真生成所需的细粒度视觉细节。
为了实现这两个预测器,我们依赖于流匹配 [33],该方法已被证明在驾驶世界模型的长时域预测中特别有效 [35]。由于世界模型的主要目标是泛化到以前仅在不同上下文中观察到的未见场景,因此世界模型质量的一个重要指标是其所学内部表征的质量。驾驶世界模型通常使用 FVD [12, 1, 35] 进行评估,该指标衡量生成帧的视觉保真度。然而,在抽象潜在空间中运行的高层预测器并不期望重现细粒度的外观,尽管它可能捕捉到对长时域预测至关重要的场景结构。因此,我们还通过语义分割和深度估计上的线性探测来评估两个预测器的内部表征质量,这直接衡量了所学潜在空间对场景结构和几何形状的编码能力。在提出的分层世界模型中,两个预测器都可以发挥其优势:抽象预测器学习更高质量的结构表征和动态,而低层预测器则能满足高保真、短时域 rollout 的要求,并获得较高的 FVD 分数。通过对模型内部表征进行探测,我们发现标准的教师强制(Teacher Forcing)配方——以干净的真实上下文为条件来预测目标帧——无法学习强大的内部表征,因为模型在训练期间从未观察到分布外(out-of-distribution)的上下文。使用扩散强制(Diffusion Forcing)目标进行预训练 [6],该目标独立地对序列中的所有帧进行破坏和去噪,产生了显著更丰富的内部表征。
我们将贡献总结如下:
一种分层驾驶世界模型。我们引入了一种两层世界模型,将未来预测分解为在抽象潜在空间中运行的高层预测器和生成高保真帧的低层预测器。
2
第 3 页
预测表征学习的双阶段训练范式。我们提出先使用扩散强制(Diffusion Forcing)目标进行预训练,随后使用教师强制(Teacher Forcing)进行短期微调。这种组合使得能够直接从时序预测损失中实现自监督表征学习,并且与仅使用下一帧预测目标相比,显著提升了表征质量。
驾驶世界建模的最先进结果。如图 2 所示,我们的模型在基于视频的驾驶世界建模方面,在互补维度上均达到了最先进性能:长时域感知保真度(FVD)和表征质量(用于语义分割和深度的线性探测)。在反事实场景的转向响应方面,我们的模型也优于先前方法。
2 相关工作
自动驾驶的世界模型旨在根据过去的观测和自身动作预测未来场景的演变。第一类工作将这种预测建模在离散标记空间(token space)中:GAIA-1 [22]、DrivingWorld [23] 和 DrivingGPT [7] 在量化视觉标记上采用自回归 Transformer,而 Cosmos [1] 将该范式扩展至大规模视频预训练。第二类工作在连续潜在空间(latent space)中运行,通常采用扩散 [20, 25] 或流匹配 [33] 目标:Vista [12]、DriveDreamer [51]、GenAD [52]、MagicDrive-V2 [11]、Epona [54] 和 Orbis [35] 展示了在多样化驾驶场景下的高保真多帧生成能力。Orbis 在混合标记器下直接比较了这两种范式,发现与离散标记相比,连续表征在长时域预测中更不易出错且更有效。尽管这些模型在表征选择上有所不同,但它们的预测器都共享单一抽象层级。
2.1 分层规划器
在强化学习中,分层方法是同时学习高层技能和详细控制的流行范式 [46, 31]。Director [16] 学习一个两层层级结构,其中高层规划器在潜在空间中选择子目标,低层策略执行这些子目标。许多近期的视觉-语言-动作模型也可以被视为分层规划器,其中基于语言的规划覆盖抽象的战略层级,而细粒度策略覆盖低层控制。例如,Hi Robot [43] 使用视觉语言模型(VLM)解释复杂指令以确定下一步,从而为低层动作策略提供条件。HiLAM [26] 通过建模长期时序结构以无监督方式发现潜在技能,然后利用这些技能为短时域预测提供条件。
2.2 具有抽象潜在空间的世界模型
THICK [14] 在分层基于模型强化学习的背景下学习多尺度时序抽象。这与我们的工作最为接近,因为它在预测器侧包含了多个抽象层级。DINO-WM [57] 没有实现层级结构,但使用 DINO 特征作为其预测器的潜在变量,这与我们抽象层级的预测器类似。在同期工作中,Zhang 等人 [55] 在两个层级使用预测器进行分层规划,但两个预测器共享相同的潜在空间。他们证明,与各种扁平模型相比,使用这种预测器层级进行规划显著提高了成功率。
3 方法
3.1 预备知识:流匹配
我们采用流匹配目标 [33] 来建模潜在空间中未来帧 $x_N$ 的分布。构建噪声插值 $x_N^\tau = (1-\tau)x_N + \tau\epsilon$,其中 $\epsilon \sim \mathcal{N}(0, I)$ 且 $\tau \in [0, 1]$,
第 4 页
定义从数据到噪声的线性路径。速度网络 $v(x_\tau^N; x_{0:N-1})$ 以上下文帧 $x_{0:N-1}$ 为条件,训练用于回归真实速度场: $$ L_{FM} = \mathbb{E}_{\tau, \epsilon} \|v(x_\tau^N; x_{0:N-1}) – (\epsilon – x^N)\|^2 \quad . \quad (1) $$
在推理阶段,预测帧是通过从 $\tau=1$ 到 $\tau=0$ 积分学习到的速度场生成的,初始化为 $x_1^N \sim \mathcal{N}(0, I)$。
教师强制与扩散强制:一个核心设计选择是速度网络在训练期间如何以上下文帧为条件。在教师强制(Teacher Forcing)下,上下文帧始终作为干净的真实观测值提供,并且仅针对最后一帧预测速度,如公式 (1) 所示。相比之下,扩散强制(Diffusion Forcing)[6] 使用独立的噪声水平 $\tau_i \sim [0, 1]$ 独立地破坏完整序列 $x_{0:N}$ 中的每一帧 $x_i$,并训练模型联合预测所有帧的速度: $$ L_{DF} = \mathbb{E}_{\tau_{0:N}, \epsilon_{0:N}} \|v(x_{\tau_{0:N}}^{0:N}) – (\epsilon_{0:N} – x_{0:N})\|^2 \quad . \quad (2) $$
虽然教师强制已成为视频世界模型的常见训练目标 [35, 1, 54, 49],但我们发现它产生的内部表征较弱,因为模型在训练期间从未接触过被破坏的上下文。我们证明扩散强制能产生更强的内部表征。
3.2 分层世界模型
我们提出了一种两级分层世界模型,沿抽象和时间轴分解未来预测。高层预测器 $F_H$ 在抽象潜在空间中以较粗的时间分辨率运行,捕捉长时域动态。低层预测器 $F_L$ 在像素对齐的潜在空间中以较细的时间分辨率运行,根据高层预测进行详细的短时域预测。架构概述如图 1 所示。
Tokenizer 潜在表示:令 $o$ 表示观测到的驾驶帧。对于每一帧 $o$,我们提取两种互补的表示。细粒度潜在 $x = E_L(o)$ 由通过重建目标训练的 tokenizer 编码器 $E_L$ 生成 [42, 10]。该潜在保留了像素对齐的细节,并由低层预测器使用。并行地,我们学习一个抽象编码器 $E_H$,生成高层潜在表示 $z = E_H(o)$。与细节 tokenizer 不同,$z$ 经过优化以捕捉对长时域预测有用的语义和结构信息。我们通过学习到的投影头 $P$ 将其表示与冻结的 DINO 嵌入 [38] 对齐来训练 $E_H$。我们通过轻量级解码器 $D_H$ 添加一个弱重建正则化项,权重为 $\lambda_{rec} = 0.1$,以便抽象潜在在不降低其语义对齐的情况下保留任务相关的视觉信息。形式上,给定观测 $o$ 及其冻结的 DINO 嵌入 $E_{DINO}(o)$,我们训练 $E_H$、$P$ 和 $D_H$:
$$ L_{abs} = \underbrace{\| P E_H(o) – E_{DINO}(o) \|_2^2}_{\text{对齐}} + \lambda_{rec} \underbrace{\| D_H E_H(o) – o \|_2^2}_{\text{正则化项}} \quad , \quad (3) $$
所得的抽象潜在 $z$ 仅为 16 维潜在空间,提供了紧凑的 DINO 对齐表示,非常适合高层预测器的流匹配目标。
抽象长时域预测器:高层预测器 $F_H$ 在抽象潜在空间中以较粗的时间分辨率建模未来动态。令 $z_i$ 为时间步 $i$ 处帧的抽象潜在,令 $Z_{k}^{N} = \{z_0, z_k, z_{2k}, \dots, z_N\}$ 表示每隔 $k$ 帧采样的过去抽象潜在的空步上下文。以该上下文和当前自车动作 $a_N$ 为条件,$F_H$ 预测 $k$ 步之后的抽象潜在:
$$ \hat{z}_{N+k} = F_H(Z_{k}^{N}, a_N) \quad . \quad (4) $$
详细短时域预测器:低层预测器 $F_L$ 在细时间分辨率下运行,负责生成 $z_N$ 和 $\hat{z}_{N+k}$ 之间的 $k$ 个中间细粒度帧。令 $x_i$ 为时间步 $i$ 处的细粒度潜在。以其自身的高频短上下文窗口 $m$ 帧和抽象子目标 $\hat{z}_{N+k}$ 为条件,$F_L$ 预测接下来的 $k$ 帧:
$$ \hat{x}_{N+1:N+k} = F_L(x_{N-m:N}, \hat{z}_{N+k}) \quad . \quad (5) $$
4
第 5 页
在训练过程中,抽象高层预测器首先使用扩散强制损失公式 (2) 进行预训练,随后通过教师强制损失公式 (1) 进行微调。详细的低层预测器则直接以高层预测器输出为条件,使用教师强制目标进行训练。
动作条件化:我们首先无条件地预训练分层预测器,不使用动作信息。然后,我们对世界模型进行微调,以支持在平面轨迹上的条件生成。嵌入的转向向量被添加到 $\tau$ 嵌入中,并通过自适应层归一化层 [40, 39, 3] 输入到预测器中。我们仅对顶层预测器分支进行条件化。
3.3 用于改进预测器表征的扩散强制预训练
扩散强制 [6] 最初被引入以通过缓解序列生成中的暴露偏差来延长 rollout 长度:使用教师强制训练的模型在训练期间观察干净的真实上下文,但在推理时必须基于自身的预测进行条件化。这通常会导致误差在长 rollout 过程中累积。我们发现,扩散强制也能显著改善预测器学习的内部表征。基于这一发现,我们提出将扩散强制作为预训练阶段,随后进行教师强制微调,用于预测器的训练。微调阶段使预测器与下游的未来预测目标对齐,同时保留在扩散强制期间获得的表征质量。
我们通过语义分割和深度估计的线性探针验证了这一效果,并在细节和抽象 tokenizer 潜在空间中运行的预测器以及两种探针任务中均观察到一致的增益。这种训练策略独立于我们的分层架构,并泛化到任何预测器层级。在我们的模型中,我们将其应用于抽象预测器 $F_H$,它产生了更强的高层动态表征和更好的下游世界建模性能。
4 实验
4.1 数据集与训练细节
表 1 概述了用于训练两个预测器的训练数据。两个层级均在完整的 5,890 小时视频上训练了一个 epoch。两个 tokenizer 均在从 BDD100K [53]、OpenDV [52]、Honda HAD [27]、Honda HDD [41]、ONCE [34]、nuScenes [4] 和 nuPlan [5] 采样的 260 万帧精心策划的混合数据上进行训练。对于转向条件生成,模型在 NVIDIA PhysicalAI AV 数据集 [37] 的 500 小时子集上进行微调,使用该数据集的 IMU 标注来计算平面轨迹输入。
本研究使用的视频数据集 [36] 是与 NATIX 合作获取的。该数据集部分公开可用。它是一个大规模、众包的多摄像头驾驶数据集,涵盖美国、欧洲和日本,包括各种道路条件、交通环境和区域驾驶行为。对于这项工作,我们使用了 2,374 小时的前置摄像头驾驶视频数据子集。在未来的工作中,我们计划使用多摄像头数据扩展这种方法。
高层预测器以 2Hz 运行,窗口大小为 6 帧(3 秒),输入 5 帧并预测 1 帧。其预测的抽象潜在变量作为条件化低层预测器的子目标。低层预测器以 10Hz 运行,窗口大小为 10 帧(1 秒),输入 5 帧作为上下文并生成接下来的 5 帧。在训练期间,低层预测器以真实抽象潜在变量为条件。在推理时,它使用来自高层预测器的预测潜在变量。Rollout 以自回归方式执行:高层预测器以 1 帧的滑动窗口推进,低层预测器以 5 帧的滑动窗口推进。两个预测器模型均在 512 × 288 的分辨率下进行训练。
表 1:用于世界模型训练的数据集概述。*部分公开
| | OpenDV [52] | BDD100k [53] | PhysicalAI-AV [37] | NATIX [36]* | 总计 | | :— | :— | :— | :— | :— | :— | | 小时数 (h) | 1124 | 659 | 1633 | 2374 | 5890 |
5
第 6 页
4.2 模型设计
在第一阶段,我们使用 [35] 中提出的混合标记器(tokenizer),该标记器由基于 ViT [9] 的图像编码器和用于正则化的向量量化瓶颈组成,并使用 VQGAN [10] 目标进行训练。编码器包含 86M 参数,而解码器是一个基于 CNN 的架构,包含 91M 参数。在分层设置中,我们为每个预测器训练两个独立的标记器。高层标记器主要用于 DINOv2B 嵌入重建,像素重建权重较小,为 $\lambda_{rec} = 0.1$。低层标记器遵循 VQGAN [10] 的像素对齐重建目标进行训练。
遵循 [35] 的做法,我们将 DiT 块 [39] 扩展为具有 512M 参数的时空 Transformer(ST-Transformer)骨干网络。低层细节预测器通过 adaLN 进行空间对齐的条件注入,增加了 43M 参数,总计 555M 参数。完整的分层预测器总计 1067M 参数。我们维护模型权重的指数移动平均(EMA),衰减率为 0.9999,并在推理时使用 EMA 模型。对于模型内部设计研究,我们在 336 × 192 的较低分辨率下训练,使用较小的 257M 抽象预测器和 279M 细节预测器。
4.3 评估
表征质量。我们通过两个下游任务的线性探测来评估内部表征:在 Cityscapes [8] 上进行语义分割,报告 mIoU;在 KITTI [13] 上进行深度估计,报告 RMSE。线性探测设置的详细信息包含在附录 A.7 中。
预测性能。我们使用 Fréchet Video Distance (FVD) [48] 评估预测展开(rollouts)的视觉质量和多样性,评估基于三个基准测试:Waymo [44]、nuPlan 和 nuPlan-turns [35]。nuPlan-turns 是 nuPlan 数据集的一个子集,专注于转弯场景。nuPlan 基准测试使用 800 个序列,Waymo 和 nuPlan-turns 基准测试使用 400 个序列。
长时域稳定性。在预测设置中,标准 FVD 可能会受到每个展开起始处共享条件帧的干扰。优先考虑感知保真度或针对长块生成优化的方法,可以在没有真正捕捉语义或物理结构的情况下实现较强的短时域 FVD。为了解决这个问题,我们采用 [35] 中的分块 FVD 指标,该指标测量连续 4 秒窗口内的 FVD。我们另外引入了 FVD-slope,这是一个标量指标,用于捕捉连续块之间视频质量的时序退化:$FVD\text{-}slope = FVD_T – FVD_1 – 1$,其中 $FVD_t$ 表示第 $t$ 个块的 FVD,$T$ 是块的总数。较低的 FVD-slope 表示长时域预测具有更高的稳定性。
动作可控性。鉴于动作条件生成对世界模型的重要性,我们评估它们遵循给定转向命令(以 2D 轨迹形式)的能力。此外,我们评估模型在无条件下生成的自车轨迹(ego-trajectories)的质量,衡量世界模型覆盖真实运动模式分布的程度。
5 结果
5.1 与最先进方法的比较
长时域展开性能。执行长时域展开的能力反映了所学转换函数的质量——即世界模型将过去状态映射到未来状态的能力。我们首先通过使用 FVD 比较驾驶世界模型来评估这一点。表 2(前三列)报告了 6 秒时域窗口内的 FVD。Cosmos-v2.5(版本:Predict-2B,后训练,Video2World)在 nuPlan 基准测试中实现了最低的 FVD 分数。然而,它的规模是 [35] 中方法的 2 倍
第 7 页
表 2:在 nuPlan、Waymo 和 nuPlan-turns 数据集上 6 秒 rollout 的 FVD 指标。FVD-slope 针对每块 4 秒的 4 个块展示。线性探测结果展示了在 Cityscapes 上的语义分割和在 KITTI 上的深度估计。*Epona 仅在 nuPlan 和 nuScenes 数据集上训练。Cosmos 的训练混合数据未公开。
| Model | FVD↓ nuPlan | FVD↓ Waymo | FVD↓ nuPlan-turns | FVD-slope↓ nuPlan-turns | Segmentation mIoU↑ | Depth RMSE↓ | | :— | :— | :— | :— | :— | :— | :— | | Vista | 289.95 | 351.42 | 353.27 | 434.67 | 39.76 | 4.884 | | GEM | 348.36 | 218.61 | 318.73 | 258.00 | 45.81 | 4.373 | | Orbis | 132.25 | 180.54 | 239.05 | 99.67 | 52.39 | 4.321 | | Epona* | 251.81 | 373.03 | 123.60 | 93.89 | 35.81 | 5.720 | | Cosmos-v2.5* | 67.74 | 116.12 | 126.26 | 189.34 | 43.20 | 6.384 | | Orbis 2 | 98.97 | 98.01 | 187.53 | 46.45 | 58.29 | 4.157 |
优于我们的模型,并且是在来自未公开数据混合的超过 3 倍驾驶数据上训练的。尽管如此,我们的模型在 Waymo 基准测试中优于 Cosmos-v2.5。我们进一步使用分块 FVD(见图 3)和 FVD-slope(见表 2)比较长视界 rollout 的稳定性,其中我们的模型取得了最佳分数,表明其稳定性显著高于包括 Cosmos-v2.5 在内的所有基线。Epona 仅在 nuPlan 和 nuScenes 数据集上训练,在 nuPlan 基准测试中表现良好,但未能泛化到未见过的 Waymo 数据集。Orbis 显示出次优的 rollout 稳定性。它也使用两个抽象层级,但在单分支设置中且时间分辨率相同。附录 A.2 中添加了与 Orbis (v1) 模型的直接比较。不同基线的长视界预测定性示例请见此处:https://lmb-freiburg.github.io/orbis2.github.io/model_comparison.html
条件轨迹评估 为了评估我们的模型对转向命令的响应能力,我们考虑两种设置。1) 原始轨迹:使用与每个验证样本对应的未修改的真实转向信号(如 [12, 18, 35] 中所示);2) 反事实轨迹:通过修改原始里程计获得,以构建替代的转向事件(例如,转向不足/转向过度)。具体而言,我们通过将原始速度和偏航率缩放 0.5 和 1.5 的因子,为每个样本获得四个反事实轨迹。在反事实设置中评估转向至关重要,因为原始轨迹部分被上下文帧泄露,即一个无法转向的模型仅依靠上下文仍可获得高分。我们通过使用外部逆动力学模型估计生成视频的轨迹来评估模型,如 [12, 18, 35] 中所示,具体使用 VGGT [50]。然后,我们计算估计轨迹与真实轨迹之间的平均位移误差 (ADE)。
表 3:原始和反事实轨迹上的完整转向评估。
| | ADE↓(m) 原始 | | | ADE↓(m) 反事实 | | | :— | :— | :— | :— | :— | :— | | Model | speed×0.5 | speed×1.5 | yaw rate×0.5 | yaw rate×1.5 | | | Orbis | 2.23 | 3.49 | 1.42 | 3.02 | 1.31 | | Epona | 1.36 | 2.08 | 1.48 | 4.01 | 0.91 | | Orbis 2 | 1.20 | 2.18 | 0.53 | 1.65 | 0.73 |
由于 VGGT 轨迹存在尺度模糊性,我们在计算 ADE 之前,使用最小二乘法尺度 $s^* = \sum_t x_t^\top \bar{x}_t / \sum_t x_t^\top x_t$ 将每个生成轨迹 $x$ 与其真实对应轨迹 $\bar{x}$ 对齐。这消除了全局尺度误差,同时保留了对形状、方向和曲率的惩罚。我们在 100 个六秒 nuPlan-turns 样本(共 500 次生成)上评估了一个原始轨迹和四个反事实轨迹模式。表 3 显示,我们的模型在原始轨迹和三种反事实情况下表现最佳;Epona 在 speed×0.5 情况下略好。一些定性示例包含在附录 A.5 中。
7
第 8 页
5.2 强大的预测器表征有助于构建稳定的世界模型
我们通过语义分割和深度估计上的线性探测来评估驾驶世界模型的内部表征质量(表2)。我们观察到一个明显的趋势:具有更强语义和几何理解能力的模型,其长时域预测也更稳定,这通过 FVD-slope 指标来衡量。我们的模型在两项探测任务和长时域稳定性指标上均取得了最佳结果。Orbis (v1) 同样学习了强大的表征,在长时域稳定性方面排名第二。几个基线模型以显著更高的分辨率运行,以最大化感知保真度,然而我们的模型在 512 × 288 分辨率下表现得更稳定。这表明,在世界建模中,表征质量起着互补作用,且 arguably(可以说)比单纯的感知保真度更为重要。
5.3 层级变体之间的比较
表4比较了顶层和底层预测器的设计选择(如图1所示),涉及潜在抽象级别、帧率和训练模式的不同变化。前两行建立了不同抽象级别的扁平(单分支)基线。细节级模型(实验1)实现了较强但逐渐退化的 FVD,并学习了较弱的内部表征;而抽象级模型(实验2)产生了显著更丰富的表征,尽管其绝对 FVD 较高,但在长时域内的 rollout 质量却非常稳定。层级配置(实验3–5)均将底层预测器固定为在 10 fps 下操作于细节潜在空间,并改变顶层预测器。实验3展示了最佳的层级设计,其中顶层预测器在 2 fps 的更长时域上操作于高抽象潜在空间:它既实现了强大的表征,又取得了最佳的 FVD-slope,同时保持了具有竞争力的绝对 FVD 性能。实验4具有较高的 FVD-slope:顶层预测器在细节潜在空间中的次优长时域 rollout 导致模型偏离分布(out-of-distribution)。在实验5中,顶层预测器在抽象空间中以高时间分辨率运行,导致 rollout 出现停止行为。我们将此归因于抽象潜在空间不够详细,无法在 10 fps 下捕捉微小运动,从而导致运动信号丢失。所有底层预测器由于具有强条件约束的细节预测任务,均未学习到强大的表征。最佳模型设计是层级结构,顶层预测器使用抽象潜在空间且帧率为 2 fps(实验3):这在整体(FVD)和长时域视频保真度(FVD-slope)之间提供了最佳平衡,同时实现了最强的表征质量。图4从定性角度证实了这些趋势:实验1发生漂移,实验2稳定但缺乏细节,实验4偏离分布,实验5逐渐丢失运动,而实验3保持稳定且感知细节丰富。
表4:不同抽象级别和时间分辨率下的层级设计研究。所有实验的模型参数量相当。实验3对应我们最终的层级设置。Top/Bottom 指代图1中预测器的位置。FVD 和 FVD-slope 在 nuPlan-turns 基准上报告。
| Model | Abstraction | Frame-rate | Sem. Seg. | Depth | FVD↓ | FVD-slope↓ | | :— | :— | :— | :— | :— | :— | :— | | Exp. | branch | detail/abstract | fps | mIoU ↑ | RMSE ↓ | 16s | 4 x 4s | | 1. | Single-branch | detail | 10 | 32.72 | 6.107 | 170.02 | 101.63 | | 2. | Single-branch | abstract | 10 | 47.88 | 4.624 | 490.04 | 48.38 | | 3. | Top | abstract | 2 | 49.39 | 4.498 | 209.15 | 47.87 | | | Bottom | detail | 10 | 31.97 | 6.396 | | | | 4. | Top | detail | 2 | 41.02 | 5.256 | 207.71 | 81.40 | | | Bottom | detail | 10 | 25.52 | 6.514 | | | | 5. | Top | abstract | 10 | 49.27 | 4.460 | 551.38 | 137.07 | | | Bottom | detail | 10 | 31.46 | 6.311 | | |
5.4 训练策略:扩散强制 + 教师强制
我们评估了扩散强制预训练后接教师强制微调对抽象预测器表征质量的影响。表5报告了语义分割和深度估计的线性探测结果。扩散强制在两项任务上均优于单独使用教师强制,随后的教师强制微调提供了额外的提升,使我们的预测器变体中获得了最佳的总体探测性能。最终的预测器优于抽象
第 9 页
0.5s 4s 8s 12s 16s Experiment-1 Experiment-2
(ours) Exp-3 Experiment-4 Experiment-5
图 4:定性示例,展示了表 4 中讨论的不同层级变体的行为。 我们观察到 Exp-2 的 rollout 结果稳定但缺乏细节,Exp-4 偏离分布(drifts out-of-distribution),而 Exp-5 存在运动丢失问题。
基于 DINOv2-B 的 tokenizer 在两项探测任务上均有所提升,将 mIoU 从 57.19 提高至 58.29,并将 RMSE 从 4.574 降低至 4.157。此外,图 5 显示了在基于像素重建的 tokenizer 潜在变量上训练的预测器也呈现相同的趋势,其中扩散强制(Diffusion Forcing)改善了模型所有块的预测器表征。
DINOv2-Base 在分割探测中显示出更强的整体性能,但我们的预测器在道路、汽车、人行道和植被等常见驾驶类别上表现更好,而在巴士、火车和摩托车等稀有类别上表现较差(详见附录 A.1 中的各类别性能)。将 DINOv2 特征压缩到 tokenizer 中会降低深度估计性能,但我们的训练策略显著缩小了与 DINOv2 的差距。
内部表征的线性探测 内部表征的线性探测 0.36 教师强制 (TF) 6.80 教师强制 (TF) 0.34 扩散强制 (DF) 6.60 扩散强制 (DF) 0.32 6.40 0.30 (KITTI) (Cityscapes) 0.28 6.20
0.26 6.00 RMSE mIoU 0.24 5.80 0.22
L0 L1 L2 L3 L5 L7 L8 L9 L0 L1 L2 L3 L5 L7 L8 L9 预测器块索引 预测器块索引
(a) Cityscapes 上的语义分割 (mIoU ↑)。 (b) KITTI 上的深度估计 (RMSE ↓)。
图 5:针对在细节潜在变量上训练的预测器,通过线性探测得到的每个预测器块的表征质量。扩散强制在语义分割和深度估计上持续改善中间表征。
5.5 更多分析
模型效率。 我们最终的 1.07B 参数模型在不到 6k H100-GPU 小时内完成训练(在 25% MFU 下为 6 × 10²¹ FLOPs),其计算量远少于同类驾驶世界模型。
9
第 10 页
表 5:所提出训练策略的消融实验。所有指标均针对抽象分支报告,包括分词器和预测器。mIoU 和验证损失用于语义分割,RMSE 用于深度估计。
| 模型 | 分割 mIoU ↑ (验证损失↓) | 深度 RMSE ↓ | | :— | :— | :— | | 抽象分词器 (Abstract Tokenizer) | 57.19 (0.265) | 4.574 | | 仅教师强制 (Teacher forcing, TF) | 55.01 (0.270) | 4.355 | | 仅扩散强制 (Diffusion forcing, DF) | 58.03 (0.254) | 4.274 | | DF + TF (本文最终方案) | 58.29 (0.250) | 4.157 | | DINOv2-Base | 60.01 (0.284) | 3.890 |
表 6:各模型的推理速度与显存需求。显存以 GB 为单位显示。
| 方法 | FPS ↑ | VRAM ↓ | | :— | :— | :— | | Cosmos v2.5 | 0.66 | 22 | | Vista | 0.58 | 86 | | GEM | 0.44 | 45 | | Epona | 0.4 | 17 | | Orbis | 0.70 | 24 | | Orbis 2 | 3.64 | 19 |
图 6:在完整的 768 维 DINO 空间中进行预测会导致生成质量较差。压缩技术使得即使使用小模型也能实现稳定、长时域的生成。展示的是我们压缩后的(16 维)和完整 DINO 潜在变量的 rollout 结果,帧率为 2fps。更多定性示例见附录。
GAIA-1 的 65 亿参数世界模型需要 23,000 个 A100 小时,Epona 用于训练一个规模相似的 25 亿参数模型需要 16,000 个 A100 小时,而 Orbis (v1) 用于训练一个 4.69 亿参数模型需要 8,000 个 A100 小时,参数量不到我们模型的一半。我们的模型实现了最快的推理速度,达到 3.64 FPS,同时仅需 19 GB 显存,比所有基线方法至少快 5 倍,如表 6 所示。通过 torch.compile 可以进一步加速推理,且只需极少的代码修改。
抽象潜在变量设计:压缩与非压缩 DINO。与我们压缩的 DINO 潜在空间相比,一种自然的替代方案是直接在高分辨率的 DINO 空间中进行预测,正如表示自编码器 (Representation Autoencoders, RAE) [56] 中所提出的那样。原则上,RAE 可以通过用原始 DINO 特征替换我们的压缩潜在变量,作为我们层级结构中的抽象预测器。然而,我们发现其维度对于自回归 rollout 来说过高:如图 6 所示,当预测器直接在完整的 DINO 空间中运行时,随着预测时域的延长,帧质量逐渐下降。我们的压缩 DINO 潜在变量在降低维度的同时保留了 DINO 的语义结构,这对于使用流匹配目标进行稳定的长时域预测至关重要。更多定性结果包含在附录 A.3 中。
6 结论
我们证明了所提出的层级方法有效地利用了抽象和详细潜在空间,从而产生了一个结合高保真短期预测和长时域稳定性的世界模型。该模型可通过动作条件进行引导。我们进一步证明了表示质量与 rollout 稳定性之间的强相关性,并表明扩散强制预训练策略 consistently 增强了所学表示。
局限性。尽管扩散强制改善了预测器的表示,但本工作并未充分研究这种改善的原因。我们假设,帧间独立的噪声水平起到了隐式数据增强的作用,而不同的噪声模式鼓励模型从去噪、插值和预测等相关任务中学习。本工作未单独研究这些因素,并将对噪声调度方案和损坏模式的更详细分析留待未来工作。我们的层级结构依赖于分离的抽象和细粒度潜在空间,每个空间都使用不同的目标进行优化。虽然这种分离阐明了每个层级的作用,但它限制了
10
第 11 页
抽象层级之间的相互作用。改善这两个空间之间的联系是未来工作的重要方向。
社会影响。目前,这项工作仍是一项早期的研究贡献,任何实际的社会影响将取决于模型设计、扩展、验证和系统集成方面的重大未来进展。
致谢
本研究由德国联邦经济与能源部资助,项目编号为“NXT GEN AI METHODS”(19A23014R)。作者衷心感谢高斯超算中心协会(Gauss Centre for Supercomputing e.V.,www.gauss-centre.eu)通过冯·诺依曼计算研究所(NIC)在 GCS 超级计算机 JUWELS [24] 以及于利希超算中心(JSC)的 JUPITER 上提供的计算时间。本项目入选由高斯超算中心(GCS)和于利希超算中心(JSC)组织的高斯 AI 计算竞赛优胜项目。本项目在 GCS 计算资助——multiscale-wm 和 nxtaim-1 的支持下完成。进一步的本地计算资源由德国科学基金会(DFG,Deutsche Forschungsgemeinschaft)资助,项目编号为 417962828 和 539134284,以及通过 EFRE(FEIH_2698644)和巴登-符腾堡州资助。
我们要感谢 NATIX 提供其大规模、众包、多摄像头驾驶数据集 [36],以支持这项开源研究。我们要感谢 Marcel Aach 在 GCS 高性能计算集群方面提供的技术支持和协助。我们还要感谢 Muhammad Ali 改进了 Hugging Face 演示模型的延迟。
11
第 12 页
参考文献
[1] Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, 等。Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575,2025。
[2] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, 等。V-jepa 2:自监督视频模型实现理解、预测和规划。arXiv 预印本 arXiv:2506.09985, 2025。
[3] Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, 和 Yann LeCun。Navigation world models。在计算机视觉与模式识别会议论文集(CVPR)中,第 15791–15801 页,2025。
[4] Holger Caesar, Varun Bankiti, Alex H. Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, 和 Oscar Beijbom。nuscenes:自动驾驶多模态数据集。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,2020 年 6 月。
[5] Holger Caesar, Juraj Kabzan, Kok Seang Tan, Whye Kit Fong, Eric Wolff, Alex Lang, Luke Fletcher, Oscar Beijbom, 和 Sammy Omari。nuplan:基于闭环机器学习的自动驾驶规划基准。arXiv 预印本 arXiv:2106.11810,2021。
[6] Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vincent Sitzmann。Diffusion forcing:下一个词元预测与全序列扩散的结合。神经信息处理系统进展,37:24081–24125,2024。
[7] Yuntao Chen, Yuqi Wang, 和 Zhaoxiang Zhang。Drivinggpt:通过多模态自回归 Transformer 统一驾驶世界建模与规划。在 IEEE/CVF 国际计算机视觉会议(ICCV)论文集,第 26890–26900 页,2025 年 10 月。
[8] Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Rehfeld, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, 和 Bernt Schiele。Cityscapes 数据集:用于语义城市场景理解。在 IEEE 计算机视觉与模式识别会议论文集,第 3213–3223 页,2016。
[9] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, 等。一张图片胜过 16×16 个词:用于大规模图像识别的 Transformer。arXiv 预印本 arXiv:2010.11929,2020。
[10] Patrick Esser, Robin Rombach, 和 Bjorn Ommer。驯服 Transformer 以实现高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 12873–12883 页,2021。
[11] Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, 和 Qiang Xu。Magicdrive- v2:通过自适应控制实现自动驾驶的高分辨率长视频生成。在 IEEE/CVF 国际计算机视觉会议(ICCV)论文集,第 28135–28144 页,2025 年 10 月。
[12] Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, 和 Hongyang Li。Vista:一种具有高保真度和多功能可控性的可泛化驾驶世界模型。在 A. Globerson, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. Tomczak, 和 C. Zhang 编辑的神经信息处理系统进展中,第 37 卷,第 91560–91596 页。Curran Associates, Inc.,2024。
[13] Andreas Geiger, Philip Lenz, 和 Raquel Urtasun。我们准备好自动驾驶了吗?Kitti 视觉基准套件。在计算机视觉与模式识别会议(CVPR)中,2012。
[14] Christian Gumbsch, Noor Sajid, Georg Martius, 和 Martin V. Butz。从离散潜在动态中学习具有自适应时间抽象的分层世界模型。在第十二届国际学习表征会议中,2024。
12
第 13 页
[15] David Ha 和 Jürgen Schmidhuber。世界模型。arXiv 预印本 arXiv:1803.10122,2(3):440,2018。
[16] Danijar Hafner,Kuang-Huei Lee,Ian Fischer,和 Pieter Abbeel。从像素进行深度分层规划。神经信息处理系统进展,35:26091–26104,2022。
[17] Danijar Hafner,Jurgis Pasukonis,Jimmy Ba,和 Timothy Lillicrap。通过世界模型掌握多样化领域。arXiv 预印本 arXiv:2301.04104,2023。
[18] Mariam Hassan,Sebastian Stapf,Ahmad Rahimi,Pedro Rezende,Yasaman Haghighi,David Brüggemann,Isinsu Katircioglu,Lin Zhang,Xiaoran Chen,Suman Saha 等人。Gem:一种用于细粒度自车运动、物体动态和场景组成控制的泛化自视多模态世界模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22404–22415 页,2025。
[19] Kaiming He,Xinlei Chen,Saining Xie,Yanghao Li,Piotr Dollár,和 Ross Girshick。掩码自编码器是可扩展的视觉学习者。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 16000–16009 页,2022。
[20] Jonathan Ho,Ajay Jain,和 Pieter Abbeel。去噪扩散概率模型。神经信息处理系统进展,33:6840–6851,2020。
[21] Mark K Ho,David Abel,Carlos G Correa,Michael L Littman,Jonathan D Cohen,和 Thomas L Griffiths。人们构建简化的心理表征以进行规划。自然,606(7912):129–136,2022。
[22] Anthony Hu,Lloyd Russell,Hudson Yeo,Zak Murez,George Fedoseev,Alex Kendall,Jamie Shotton,和 Gianluca Corrado。Gaia-1:一种用于自动驾驶的生成式世界模型。arXiv 预印本 arXiv:2309.17080,2023。
[23] Xiaotao Hu,Wei Yin,Mingkai Jia,Junyuan Deng,Xiaoyang Guo,Qian Zhang,Xiaoxiao Long,和 Ping Tan。Drivingworld:通过视频 GPT 构建自动驾驶的世界模型。arXiv 预印本 arXiv:2412.19505,2024。
[24] Jülich 超级计算中心。JUWELS 集群和 Booster:Jülich 超级计算中心具有模块化超级计算架构的百亿亿次级路径finder。大型研究设施期刊,7(A138),2021。
[25] Tero Karras,Miika Aittala,Timo Aila,和 Samuli Laine。阐明基于扩散的生成模型的设计空间。神经信息处理系统进展,35:26565–26577,2022。
[26] Hanjung Kim,Lerrel Pinto,和 Seon Joo Kim。分层潜在动作模型。arXiv 预印本 arXiv:2603.05815,2026。
[27] Jinkyu Kim,Teruhisa Misu,Yi-Ting Chen,Ashish Tawari,和 John Canny。为自动驾驶车辆建立人机建议的基础。在 IEEE 计算机视觉与模式识别会议 (CVPR),2019。
[28] Diederik P Kingma 和 Max Welling。自动编码变分贝叶斯。arXiv 预印本 arXiv:1312.6114,2013。
[29] Amandeep Kumar 和 Vishal M Patel。在流形上学习:通过表示编码器解锁标准扩散 Transformer。arXiv 预印本 arXiv:2602.10099,2026。
[30] Yann LeCun 和 Courant。迈向自主机器智能的路径 0.9.2 版,2022-06-27。2022。
[31] Alexander Li,Carlos Florensa,Ignasi Clavera,和 Pieter Abbeel。分层强化学习中的子策略适应。在国际学习表征会议,2020。
[32] Xiang Li,Kai Qiu,Hao Chen,Jason Kuen,Jiuxiang Gu,Bhiksha Raj,和 Zhe Lin。Imagefolder:使用折叠标记的自回归图像生成。arXiv 预印本 arXiv:2410.01756,2024。
13
第 14 页
[33] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。Flow matching for generative modeling. arXiv preprint arXiv:2210.02747, 2022.
[34] Jiageng Mao, Minzhe Niu, Chenhan Jiang, Hanxue Liang, Jingheng Chen, Xiaodan Liang, Yamin Li, Chaoqiang Ye, Wei Zhang, Zhenguo Li, 等。One million scenes for autonomous driving: Once dataset. arXiv preprint arXiv:2106.11037, 2021.
[35] Arian Mousakhan, Sudhanshu Mittal, Silvio Galesso, Karim Farid, 和 Thomas Brox。Over- coming challenges of long-horizon prediction in driving world models. In The Thirty-ninth Annual Conference on Neural Information Processing Systems, 2026.
[36] NATIX。NATIX Multi-Camera Driving Dataset. Hugging Face Hub: https://huggingface. co/datasets/natix-network-org/natix-multi-camera-driving-dataset, 2026。 Multi-camera driving dataset with telemetry metadata. NATIX website: https://www.natix.network/。
[37] NVIDIA。Physical ai autonomous vehicles dataset, 2025.
[38] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, 等。Dinov2: Learning robust visual features without supervision. arXiv preprint arXiv:2304.07193, 2023.
[39] William Peebles 和 Saining Xie。Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF international conference on computer vision, pages 4195–4205, 2023.
[40] Ethan Perez, Florian Strub, Harm De Vries, Vincent Dumoulin, 和 Aaron Courville。Film: Visual reasoning with a general conditioning layer. In Proceedings of the AAAI conference on artificial intelligence, volume 32, 2018.
[41] Vasili Ramanishka, Yi-Ting Chen, Teruhisa Misu, 和 Kate Saenko。Toward driving scene understanding: A dataset for learning driver behavior and causal reasoning. In Conference on Computer Vision and Pattern Recognition (CVPR), 2018.
[42] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer。High- resolution image synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 10684–10695, 2022.
[43] Lucy Xiaoyang Shi, Brian Ichter, Michael Equi, Liyiming Ke, Karl Pertsch, Quan Vuong, James Tanner, Anna Walling, Haohuan Wang, Niccolo Fusai, 等。Hi robot: Open-ended instruction following with hierarchical vision-language-action models. arXiv preprint arXiv:2502.19417, 2025.
[44] Pei Sun, Henrik Kretzschmar, Xerxes Dotiwalla, Aurelien Chouard, Vijaysai Patnaik, Paul Tsui, James Guo, Yin Zhou, Yuning Chai, Benjamin Caine, 等。Scalability in perception for autonomous driving: Waymo open dataset. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 2446–2454, 2020.
[45] Richard S Sutton。An adaptive network that constructs and uses and internal model of its world. Cognition and Brain Theory, 4(3):217–246, 1981.
[46] Richard S. Sutton, Doina Precup, 和 Satinder Singh。Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning. Artificial Intelligence, 112(1):181– 211, 1999.
[47] Momchil S. Tomov, Samyukta Yagati, Agni Kumar, Wanqian Yang, 和 Samuel J. Gershman。 Discovery of hierarchical representations for efficient planning. bioRxiv, 2018.
[48] Thomas Unterthiner, Sjoerd van Steenkiste, Karol Kurach, Raphaël Marinier, Marcin Michalski, 和 Sylvain Gelly。FVD: A new metric for video generation, 2019.
[49] Dani Valevski, Yaniv Leviathan, Moab Arar, 和 Shlomi Fruchter。Diffusion models are real-time game engines. arXiv preprint arXiv:2408.14837, 2024。
14
第 15 页
[50] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny。Vggt:视觉几何接地 Transformer。在计算机视觉与模式识别会议论文集,页码 5294–5306,2025。
[51] Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu。Drive- dreamer:迈向自动驾驶的真实世界驾驶世界模型。在欧洲计算机视觉会议,页码 55–72。Springer,2024。
[52] Jiazhi Yang, Shenyuan Gao, Yihang Qiu, Li Chen, Tianyu Li, Bo Dai, Kashyap Chitta, Penghao Wu, Jia Zeng, Ping Luo 等。Genad:自动驾驶的通用预测模型。arXiv 预印本 arXiv:2403.09630,2024。
[53] Fisher Yu, Haofeng Chen, Xin Wang, Wenqi Xian, Yingying Chen, Fangchen Liu, Vashisht Madhavan, 和 Trevor Darrell。Bdd100k:用于异构多任务学习的多样化驾驶数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 2636–2645,2020。
[54] Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiao-Xiao Long 等。Epona:用于自动驾驶的自回归扩散世界模型。在 IEEE/CVF 国际计算机视觉会议论文集,页码 27220–27230,2025。
[55] Wancong Zhang, Basile Terver, Artem Zholus, Soham Chitnis, Harsh Sutaria, Mido Assran, Randall Balestriero, Amir Bar, Adrien Bardes, Yann LeCun 等。基于潜在世界模型的层次化规划。arXiv 预印本 arXiv:2604.03208,2026。
[56] Boyang Zheng, Nanye Ma, Shengbang Tong, 和 Saining Xie。具有表示自编码器的扩散 Transformer。arXiv 预印本 arXiv:2510.11690,2025。
[57] Gaoyue Zhou, Hengkai Pan, Yann LeCun, 和 Lerrel Pinto。Dino-wm:基于预训练视觉特征的世界模型实现零样本规划。arXiv 预印本 arXiv:2411.04983,2024。
15
第 16 页
A 附录
A.1 按类别语义分割探测结果
表 7 比较了分词器(tokenizer)、预测器(predictor)和 DINOv2-Base 表示的按类别语义分割探测性能。DINOv2-Base 实现了更强的整体分割性能,但我们的预测器在道路、汽车、人行道和植被等常见驾驶类别上表现更好,提升了 2–5 个 mIoU 点。相比之下,它在巴士、火车、骑行者和摩托车等稀有类别上表现较差,差距为 5–20 个 mIoU 点。
表 7:我们的分词器和抽象预测器模型与 DINOv2-base 的比较。报告了 Cityscapes 上的语义分割每类 IoU。 Ours Ours Class Dino v2-B ∆(Predictor −Dino v2-B) tokenizer predictor
Road 94.88 95.3 95.9 +1.02 Sidewalk 66.58 67.6 71.0 +4.42 Building 82.98 84.4 84.8 +1.82 Wall 48.28 47.7 47.9 −0.38 Fence 45.84 44.8 44.9 −0.94 Pole 17.54 16.7 18.5 +0.96 Traffic Light 33.97 30.1 31.5 −2.47 Traffic Sign 42.93 41.4 43.6 +0.67 Vegetation 80.87 83.3 83.6 +2.73 Terrain 53.05 53.5 53.4 +0.35 Sky 82.11 86.6 87.0 +4.89 Person 54.18 53.0 52.7 −1.48 Rider 34.04 28.1 28.2 −5.84 Car 84.27 85.0 86.4 +2.13 Truck 70.25 67.0 67.1 −3.15 Bus 77.80 63.4 69.5 −8.30 Train 70.57 48.5 50.0 −20.57 Motorcycle 45.48 37.4 38.1 −7.38 Bicycle 54.57 52.9 53.1 −1.47
mIoU 60.01 57.2 58.3 −1.71
A.2 单分支、混合抽象
表 8 展示了我们的模型与通过 token 因子化 [32] 结合的多级抽象单分支模型 [35] 之间的比较。尽管 FVD 和表示质量良好,但视频保真度随时间下降更快,如较高的 FVD-slope 所示。
表 8:单分支与分层预测器的比较。
Parameters Sem. Seg. Depth FVD↓ FVD-slope↓ Model M mIoU ↑ RMSE ↓ 16s 4 × 4s
Single-branch, mixed 512 47.16 4.680 184.69 96.55 Hierarchical (ours) 257+279 49.39 4.498 209.15 47.87
A.3 完整 DINO 空间与压缩 DINO 空间的定性 rollout
图 7 展示了定性结果,比较了使用我们的压缩 DINO 潜在目标与完整 768 维 DINOv2 潜在目标生成的 1 秒 rollout。完整维度 DINO 空间中的 rollout 迅速退化,而压缩 DINO 潜在空间由流匹配目标有效建模,在整个时间范围内产生稳定的预测。
16
第 17 页
768维 DINO
我们的方法
768维 DINO
我们的方法
768维 DINO
我们的方法
768维 DINO
我们的方法
图7:原始DINO特征与我们压缩后的DINO潜在变量作为抽象预测器的标记器的对比。(2Hz下的 rollout)
A.4 不同层级变体的定性示例
在图4中,我们展示了定性示例,说明了第5.3节中讨论的层级设计变体的失败模式。实验1在详细抽象级别以单分支模式运行,产生的 rollout 偏离起始分布。实验2是抽象级别的单分支模型,产生了稳定的 rollout,但未能捕捉细粒度运动和感知细节。实验3对应于我们提出的层级设计,实现了具有高质量感知的稳定 rollout。实验4使用详细潜在变量作为顶层分支,迅速偏离分布外,导致 rollout 效果差。实验5在高频时间下运行抽象潜在变量,未能捕捉详细运动,尽管保留了高感知质量,但导致运动退化。
A.5 反事实引导
评估细节 与[12, 18, 35]中仅使用真实数据进行引导评估的标准方法相比,使用反事实引导输入进行评估带来了额外的挑战,其中逆动力学模型应用于真实和生成的视频,以补偿尺度模糊性。在这里,我们将估计生成的轨迹与实际输入轨迹进行比较,但这
17
第 18 页
这使我们面临尺度不匹配的问题,因为 VGGT 的输出并非处于度量空间(metric space)。为此,对于每一对真实轨迹 $(\bar{x})$ 和生成轨迹 $(x)$,我们计算后者的最优尺度参数:
$$ s^* = \frac{\sum_{t=1}^{T} x_t^\top \bar{x}_t}{\sum_{t=1}^{T} x_t^\top x_t} \quad (6) $$
并在计算 ADE 之前相应地对其进行重新缩放。这仍然会对形状、方向和曲率施加惩罚,但很大程度上消除了全局轨迹尺度误差。
图 8 展示了在反事实轨迹上引导模型的示例。对于世界模型而言,能够遵循偏离原始上下文绑定轨迹的指令至关重要,即使这些指令会导致分布外(out-of-distribution)或非法的操作。
原始
×0.5
×1.5
0s 0.5s 1s 1.5s 2s 2.5s
图 8:反事实引导示例。第一行:原始转向轨迹,模型按预期执行转弯。第二行:偏航率缩放为 0.5(转向不足),模型遵循指令并执行更平缓的转弯。第三行:偏航率缩放为 0.5(此处原文标注有误,应为 1.5 或类似大于 1 的值以表示过度转向,但原文写的是 0.5,且描述为 oversteering,请留意原文逻辑,通常 oversteering 对应放大,understeering 对应缩小。根据图示和常规逻辑,第二行是缩小,第三行应为放大。但翻译需忠实原文,原文第三行文字写的是 "scaled by 0.5 (oversteering)",这显然是原文笔误,通常 oversteering 是放大。不过作为翻译,我们保留原文的数字和描述,或根据上下文修正?指令要求准确翻译。原文第三行确实写的是 "scaled by 0.5 (oversteering)",这极可能是笔误,应为 1.5 或 2.0 等。但为了忠实于“准确翻译”,我将翻译原文内容,但需注意原文可能有误。然而,观察图注,第二行是 understeering (0.5),第三行是 oversteering。通常 oversteering 意味着更剧烈的转弯,即放大。如果原文坚持写 0.5,那可能是指某种特定的归一化方式?不,更可能是笔误。鉴于指令要求准确翻译,我将翻译为“缩放为 0.5”,但括号内保留 oversteering。*修正思考*:再看一眼原文,第三行写的是 "scaled by 0.5 (oversteering)"。这绝对是笔误。通常 oversteering 是放大。如果我不修改,翻译出来会很奇怪。但指令说“准确翻译”。我将翻译为“缩放为 0.5(过度转向)”,并在心中标记这是原文错误。或者,也许原文意思是相对于某个基准?不,第二行是 0.5 导致 understeering,第三行如果是 0.5 也应该导致 understeering。所以这肯定是笔误。为了提供最有帮助的翻译,我可能会在翻译中保留原文的数字,因为这是翻译任务。*再次检查*:原文第三行确实是 "scaled by 0.5 (oversteering)"。这非常奇怪。也许它是 "scaled by 1.5" 被 OCR 错了?或者 "scaled by 2.0"?不管怎样,我将忠实翻译原文文本。
原始
×0.5
×1.5
0s 0.5s 1s 1.5s 2s 2.5s
图 8:反事实引导示例。第一行:原始转向轨迹,模型按预期执行转弯。第二行:偏航率缩放为 0.5(转向不足),模型遵循指令并执行更平缓的转弯。第三行:偏航率缩放为 0.5(过度转向),模型遵循指令并执行更剧烈的转弯。
A.6 模型细节
Tokenizer:我们训练了两个混合分词器,分别具有用于细节和抽象潜变量的编码器与解码器分支。混合架构遵循 Mousakhan 等人 [35] 提出的设计。两个编码器均从 MAE 预训练 [19] 的 ViT 初始化,补丁大小为 16 × 16,产生 768 维嵌入,并将其量化为 16 维代码。
Abtract long-horizon predictor(抽象长视界预测器):该预测器以 2 Hz 的频率自回归生成语义潜变量,并使用因果时间注意力(causal_time_attn=True)。它接收 5 个上下文帧,并在每次 rollout 步骤中预测 1 个未来帧。
Detailed short-horizon predictor(详细短视界预测器):该预测器以 10 Hz 的频率运行,并受抽象预测器预测的潜变量条件约束。时间注意力是非因果的。条件注入是通过每帧的小的、非零初始化的线性投影和学习的帧位置 MLP 在空间上进行的,确保预训练的 STDiT 主干网络在初始化时受到最小扰动。每个块包含一个额外的门控空间交叉注意力层(小的、非零初始化的门控),用于处理抽象预测器的信号。详细预测器在抽象条件约束下从头开始训练。
推理协议。在推理时,生成以级联方式进行。抽象预测器接收 5 个上下文帧,并使用 15 次 NFE(网络函数评估)以 2 Hz 的频率生成 1 帧。其预测的抽象潜变量作为条件约束详细预测器的子目标。详细预测器随后接收 5 个上下文帧,并使用 30 次 NFE 以 10 Hz 的频率生成接下来的 5 帧,条件约束为预测的抽象潜变量。在训练期间,详细预测器受真实抽象潜变量的条件约束,而在推理时,它运行于抽象预测器的预测潜变量之上。Rollouts 以自回归方式执行。抽象预测器以 1 帧的滑动窗口前进,在 2 Hz 频率下在 6 帧窗口(3 秒)上操作。详细预测器以 5 帧的滑动窗口前进,在 10 Hz 频率下在 10 帧窗口(1 秒)上操作。
18
第 19 页
A.7 线性探测细节
语义分割 为了评估 Stage-2 预测器模型所学表征的质量,我们在 Cityscapes 细标注基准(19 类)上使用模型冻结的中间特征训练了一个用于语义分割的线性探测器。输入图像被归一化到 [−1, 1] 并通过冻结的主干网络进行编码。在探测过程中,上下文被丢弃(设为空),输入图像在所有预测帧槽位上进行平铺,并从最后一个帧槽位提取特征。对于主模型,从倒数第 4 个 Transformer 块中提取中间 patch-token 特征,对于消融模型,则从倒数第 2 个块中提取,然后将平坦的 patch 序列重塑为 2D 空间特征图。线性探测头是一个单一的 1×1 LazyConv2d,将该特征图映射到 19 类 logits,随后进行双线性上采样以匹配真实掩码的分辨率。仅训练探测参数,主干网络在整个过程中保持完全冻结。训练使用 AdamW(lr=1e-3, wd=1e-4)和交叉熵损失进行 100 个 epoch。性能报告为 Cityscapes 验证集上的平均交并比(mIoU)。
深度估计 为了探测 Stage-2 预测器模型的几何感知能力,我们遵循 DINOv2 线性深度评估协议,在 KITTI Eigen 划分上训练了一个线性深度探测器。输入图像通过冻结的主干网络进行编码;在探测过程中,上下文被丢弃(设为空),输入图像作为唯一的帧目标传入,并从最后一个帧槽位提取特征。中间 patch-token 特征从倒数第 4 个 Transformer 块中提取,然后重塑为 2D 空间特征图。线性探测头遵循 DINOv2 Lin-1 设计:一个单一的 1×1 LazyConv2d,在覆盖 [0, 80] 米的 256 个均匀间隔深度 bin 上产生 logits,在此之前进行 4× 双线性上采样以恢复空间分辨率,随后对 bin 中心进行 softmax 和加权求和以产生连续深度预测。在训练时,真实深度值被离散化为相同的均匀 bin,并使用 AdamW(lr=1e-3, wd=1e-4)最小化交叉熵损失,持续 10 个 epoch;缺失和超出范围的深度像素被排除在损失计算之外。仅训练探测参数;主干网络保持完全冻结。性能报告为 KITTI Eigen 验证划分上的均方根误差(RMSE)。
19