三分钟导读:HyWorldVLA提出了一种混合世界模型框架,通过结合像素级重建和潜在空间预测,在保持细粒度时空推理能力的同时显著提升了自动驾驶在噪声场景下的鲁棒性。
英文题目:HYWORLDVLA: A VISION-LANGUAGE-ACTION MODEL WITH HYBRID WORLD MODELING FOR AUTONOMOUS DRIVING
论文出处:arXiv 每日论文精选 · arXiv:2607.20988
原始论文:PDF / 论文页面
对应视频标题:HyWorldVLA:混合世界模型如何提升自动驾驶鲁棒性|推荐指数:★★★★★
这篇论文解决什么问题?
现有的像素级世界模型对场景噪声敏感,而潜在级世界模型缺乏像素级接地导致表征退化和解释性差,两者在自动驾驶中均存在局限性。
核心创新
- 提出混合世界建模范式,统一了像素级监督的细粒度时空建模能力和潜在级预测的噪声鲁棒性。
- 引入语言引导和潜在条件机制,有效引导模型关注与动作生成相关的语义信息。
- 建立了首个针对自动驾驶世界模型噪声鲁棒性的全面定性和定量分析基准。
方法概览
HyWorldVLA采用三阶段训练:首先训练文本引导的视频VAE以压缩和重建视频帧;其次在预训练阶段联合优化视频潜在预测和原始像素重建;最后在协同微调阶段,仅预测潜在特征并通过联合注意力机制传递给动作专家生成轨迹。
逐图理解论文
方法概览:三阶段训练框架

HyWorldVLA采用三阶段训练策略。首先,训练文本引导的视频VAE以压缩和重建视频帧,提供高质量目标。其次,在预训练阶段联合优化视频潜在预测与原始像素重建,引入可学习潜在查询聚合信息。最后,在协同微调阶段,仅预测潜在特征,并通过联合注意力机制传递给动作专家生成轨迹。
实验设置:NAVSIM基准对比

我们在NAVSIM v1和v2基准上进行了全面评估。作为基线,我们对比了像素级模型DriveVLA-W0和潜在级模型Latent-WAM。HyWorldVLA基于Emu3骨干网络,通过混合建模显著提升了性能。实验涵盖了标准场景、扩展指标以及噪声鲁棒性测试,确保评估的全面性。
噪声鲁棒性:定性与定量分析

在包含雨雾和光照变化的噪声测试集中,HyWorldVLA展现出卓越的鲁棒性。定量数据显示其性能下降幅度远小于基线。定性可视化表明,DriveVLA-W0在光照变化下行为方差大,而HyWorldVLA保持了一致的驾驶轨迹,既不过于保守也不激进,更符合人类驾驶模式。
可视化分析:复杂场景理解

未来图像生成可视化展示了模型对复杂场景的理解。在右转场景中,即使前视摄像头缺乏车道线,模型仍能可靠预测未来车道线。在会车场景中,模型正确预测了对向公交车的运动模式及本车的避让动作。这些结果证明了混合世界模型在缺乏显式几何线索时,仍能利用学到的世界知识进行推理。
成功案例分析:避障与转向

在避障测试中,面对前方停靠且后备箱开启的卡车,基线模型试图强行挤过,而HyWorldVLA能正确识别并停车保持安全距离。在左转场景中,尽管前视视野受限,模型仍能根据历史轨迹和语义理解完成左转,而基线模型则直行通过。这些案例展示了模型在长尾场景下的决策合理性。
实验与关键结果
- 在NAVSIM v1和v2基准上进行对比实验,验证SOTA性能。
- 进行消融实验以验证各组件(如语言引导、潜在条件)及损失权重的有效性。
- 在包含雨雾噪声的测试集上进行场景噪声鲁棒性定量和定性分析。
- 可视化未来图像生成和规划轨迹,展示模型对复杂场景的理解能力。
- PDMS 90.59(第 7 页)
- EPDMS 89.71(第 7 页)
- 噪声鲁棒性PDMS 86.87(第 9 页)
阅读时需要注意
- 单目摄像头在转弯场景下存在视野限制,可能导致关键元素(如车道线、前车)丢失。
- 模型难以捕捉由少数像素表示的关键细微元素(如排队车辆的刹车灯、红绿灯状态)。
- 增加多摄像头输入以提高鲁棒性会与推理延迟产生权衡,尚未解决。
- 潜在损失权重(λ3)过大虽能提升噪声鲁棒性,但可能损害正常场景下的性能,需仔细平衡。
- 预训练阶段视觉token预测权重(λ1)过高会导致性能下降,需保持适当比例。
关联工作
- DriveVLA-W0:像素级世界模型基线,本文方法在其基础上通过混合建模提升鲁棒性。(第 3 页)
- Latent-WAM:潜在级世界模型基线,本文方法弥补了其缺乏像素级接地的缺陷。(第 7 页)
- Emu3:作为HyWorldVLA的骨干网络基础。(第 6 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HYWORLDVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型
Yu Quanfu∗, Wu Xian∗, Xu Hao∗, Ma Liulong† 比亚迪股份有限公司汽车新技术研究院 {yqf2018619, wuxian7x, xuhaovic}@gmail.com, ma.liulong@byd.com
摘要
结合世界建模的视觉-语言-动作(VLA)模型代表了端到端自动驾驶的一种有前景的范式。虽然像素级未来预测能够实现细粒度的时空推理,但它在嘈杂的驾驶场景中会损害鲁棒性。相反,基于潜在变量的世界模型减轻了这种敏感性,但由于缺乏像素级接地(grounding),往往导致可解释性有限和表示退化。为了调和这一权衡,我们提出了 HyWorldVLA,这是一种混合世界-VLA 框架,统一了像素级监督和潜在表示学习。在预训练阶段,HyWorldVLA 预测由预训练视频变分自编码器(Video VAE)编码的视频潜在变量,同时重建视频帧以提供精确的像素级接地。在随后的微调阶段,动作专家模型仅接收潜在特征并生成轨迹。在 NAVSIM v1 和 v2 基准测试上的广泛实验表明,HyWorldVLA 显著优于基于像素和基于潜在变量的世界模型基线。值得注意的是,我们首次对自动驾驶中世界模型的噪声鲁棒性进行了全面的定性和定量分析,为评估未来架构建立了新的基准。[cs.CV]
1 引言
端到端自动驾驶已成为构建智能车辆系统的主要研究方向,旨在将感知、推理和控制统一在一个整体的流水线中。作为核心的驾驶中心范式,视觉-语言-动作(VLA)模型(Wang 等,2023;Hwang 等,2024;Li 等,2025e;Lu 等,2026a)整合了视觉场景感知、语言语义理解和低级动作预测,有效利用了大规模驾驶数据集和通用视觉-语言先验来学习鲁棒的驾驶行为。与传统的模块化自动驾驶系统相比,后者在长尾和交互式交通场景中容易受到级联错误的影响且泛化能力有限,基于 VLA 的框架提供了更具适应性和泛化能力的决策能力,显示出在现实世界车辆部署中的巨大潜力。
为了进一步增强 VLA 模型的时空推理和场景泛化能力,最近的进展通过引入世界建模能力来增强标准的驾驶 VLA 流水线,这些模型学习预测未来的场景状态以进行前瞻性的因果推理(Jia 等,2023;Wang 等,2024a;Chen 等,2025)。现有的用于驾驶 VLA 的世界建模范式主要分为两类,且存在固有的权衡。基于像素的世界模型通过完整未来帧的重建施加监督,提供了密集的几何和物理约束,从而在遮挡、交互和长尾驾驶场景中表现出强大的泛化能力,如图 1 (a) 所示。然而,像素级重建本质上对环境变化(从雨雾到光照波动)非常敏感,这从根本上限制了基于像素的世界模型在复杂驾驶条件下的部署鲁棒性。相比之下,基于潜在变量的世界模型
∗ 同等贡献。 † 通讯作者。
第 2 页
图像 动作 潜在变量 图像 动作 潜在变量
基于像素的世界模型 基于潜在变量的世界模型 混合世界模型
图像 动作 文本 图像 动作 文本 图像 动作 文本
(a) 基于像素的世界模型 (b) 基于潜在变量的世界模型 (c) 混合世界模型
√ 细粒度时空推理 × 细粒度时空推理 √ 细粒度时空推理 × 场景噪声鲁棒性 √ 场景噪声鲁棒性 √ 场景噪声鲁棒性
图 1:世界模型范式的比较。(a) 基于像素的世界模型:迭代预测动作和图像,易受场景噪声影响;(b) 基于潜在变量的世界模型:预测潜在状态,在时空动态建模方面较弱;(c) 混合世界模型:我们的方法同时建模迭代动作-图像预测和未来的潜在状态预测。
如图 1 (b) 所示,视觉-语言-动作 (VLA) 模型通过纯粹在紧凑的特征空间中预测未来场景状态来提高场景噪声鲁棒性。然而,缺乏显式的像素级接地(grounding)导致表示退化(representation degeneration)和可解释性有限,这严重恶化了模型在复杂真实世界驾驶场景中的性能 (Tu et al., 2025)。
为了解决世界建模领域中的这一根本困境,我们提出了 HyWorldVLA,这是一种新颖的混合世界-VLA 框架,统一了像素接地监督和潜在特征预测的优势,为端到端自动驾驶提供准确性和鲁棒性。如图 1 (c) 所示,与现有的纯基于像素或基于潜在变量的世界模型不同,HyWorldVLA 在预训练阶段采用双监督范式,联合优化视频变分自编码器(Video VAE)潜在变量预测和原始像素帧重建。在随后的协同微调(co-fine-tuning)阶段,模型仅预测潜在特征,这些特征被输入到动作专家(action expert)中以生成驾驶轨迹。在这种设计下,像素级重建在预训练期间作为严格的结构正则化器,以完善潜在嵌入学习并防止表示崩溃(representation collapse)。对于协同微调阶段,动作生成以保留紧凑时间表示的潜在特征建模为条件,从而增强生成驾驶轨迹的场景噪声鲁棒性。大量的实验结果表明,HyWorldVLA 成功结合了基于像素的世界模型带来的细粒度时空动态建模的高性能,以及基于潜在变量的世界模型固有的场景噪声鲁棒性。我们的贡献总结如下:
• 我们提出了 HyWorldVLA,它建立了一种混合世界建模范式,将世界动作模型和潜在世界模型的互补特性统一到一个框架中。
• 我们引入了语言指导和潜在条件机制,以有效地引导模型关注与动作生成相关的语义信息。
• 在 NAVSIM 基准测试上的大量实验表明,我们的方法达到了最先进的性能,验证了我们混合世界建模的有效性。
2 相关工作
驾驶中的视觉-语言-动作模型。凭借卓越的 multimodal 场景理解和推理能力,视觉-语言模型(VLMs)正被广泛集成到自动驾驶系统中,推动了端到端视觉-语言-动作(VLA)架构的发展 (Hu et al., 2025)。早期的探索包括 DriveMLM (Wang et al., 2023) 和 DriveGPT4 (Xu et al., 2024),它们直接利用 VLM 固有的文本生成能力来生成文本形式的驾驶动作,从而充分利用预训练 VLM 中的世界知识 (Hwang et al., 2024; Sima et al., 2024; Jiang et al., 2025)。然而,离散语言令牌与连续控制空间之间的根本差距引入了精度限制,并破坏了端到端的可微性。因此,最近的工作通过机制增强 VLM 骨干网络
第 3 页
视频描述:“自车正在右转,道路左侧有几辆静止车辆……”
文本
视觉
空间编码器 时间编码器 时间解码器 空间解码器 动作
潜在特征
输入视频 重建视频 潜在查询 $\mathbf{q}_1$ $\mathbf{q}_2$
监督 监督 … 1 1 … MLP 2 3 3 … $\mathbf{q}_t$ MLP $\mathbf{q}_t^v$ $\mathbf{q}_t^a$ $\mathbf{q}_t^v$ $\mathbf{q}_t^a$ $\mathbf{q}_t^v$ $\mathbf{q}_t^a$ $\mathbf{q}_2$ $\mathbf{q}_3$ $\mathbf{q}_4$ $\mathbf{q}_t^v$ 视觉语言模型 视觉语言模型 注意力共享 动作模型
CMD 1 1 1 … 2 3 3 … $\mathbf{q}_t$ 1 1 1 … $\mathbf{q}_t^v$ $\mathbf{q}_t^a$ $\mathbf{q}_t^v$ $\mathbf{q}_t$ $\mathbf{q}_t^a$ $\mathbf{q}_t^v$ $\mathbf{q}_t^a$ $\mathbf{q}_t^a$ $\mathbf{q}_t^a$ $\mathbf{q}_t$ $\mathbf{q}_{t-1}$ $\mathbf{q}_t^0$ $\mathbf{q}_t^1$
图 2:HyWorldVLA 概述。HyWorldVLA 包含三个训练阶段。首先,在文本指导下训练视频 VAE 模型以压缩和重建视频帧,从而为后续训练提供真实目标。在预训练阶段,使用由文本、图像和动作组成的序列来训练世界模型进行迭代预测,其中引入可学习的潜在查询 $\mathbf{Q}$ 来聚合信息并预测未来的潜在特征。在协同微调阶段,历史序列与 $\mathbf{Q}$ 一起输入到 VLM 中以获取全局上下文和预测的潜在特征,然后通过联合注意力机制传递给动作专家以生成动作。
产生直接数值输出的机制。ReCogDrive (Li et al., 2025e) 通过分层认知管道将自回归模型与扩散规划器集成,而 AutoVLA (Zhou et al., 2025b) 在具有双思考模式的单个自回归模型中统一了语义推理和轨迹规划。ORION (Fu et al., 2025) 和 OpenDriveVLA (Zhou et al., 2025a) 进一步通过聚合长期上下文并执行分层视觉-语言对齐来弥合语义-动作差距。
自动驾驶中的世界模型。世界模型已应用于自动驾驶 (Zheng et al., 2024; Hu et al., 2023a; Jia et al., 2023; Wang et al., 2024a; Li et al., 2025d; Chen et al., 2025; Zhang et al., 2025),因为它们能够预测未来状态并理解世界的时序动态。FSDrive (Zeng et al., 2025) 生成带有显式物理先验的统一未来帧,作为视觉时空思维链。DriveVLA-W0 (Li et al., 2025c) 通过预测未来图像作为密集自监督信号来解决 VLA 中的“监督缺失”问题,该信号通过自回归和扩散世界模型实例化。OneVL (Lu et al., 2026a) 通过紧凑令牌路由潜在推理,并由双辅助解码器监督,匹配仅答案的延迟。Latent-CoT-Drive (Tan et al., 2025) 使用动作提议和世界模型令牌在动作对齐的潜在空间中表示思维链推理。像素级预测本质上容易受到场景噪声的影响,而潜在级预测难以捕捉物理世界的基本因果关系。为了解决这些互补的局限性,我们提出了一种新颖的框架来弥合像素级和潜在级预测之间的差距。
3 方法论
3.1 问题定义与整体框架
HyWorldVLA 旨在基于多模态观测预测未来的自车航点。具体而言,在每个时间步 $t$,模型接收一系列前视相机图像 $V_{t-H:t} = \{v_{t-H}, \dots, v_t\}$,包括当前帧和 $H$ 个 preceding 帧,以及历史车辆航点 $W_{t-H:t} = \{w_{t-H}, \dots, w_t\}$,其中 $w_t = (x_t, y_t, \theta_t)$ 表示步骤 $t$ 的位置和航向角。此外,历史导航命令 $L_{t-H:t}$(例如,直行和右转)用于明确指定预期方向。然后基于这些输入,模型输出在 $T$ 个时间步范围内的未来航点序列 $W_{t+1:t+T}$。
如图 2 所示,HyWorldVLA 的整体框架由三个主要组件和三个训练阶段组成。(1) 视频编码器:第 3.2 节详细阐述了一个视频编码器,它压缩
第 4 页
将视频帧序列编码为潜在特征,提供对未来世界动态的紧凑表示;(2) VLM 主干网络:随后,潜在特征和视频帧由 VLM 主干网络联合预测,该网络在第 3.3 节中介绍;(3) 动作专家:最后,在第 3.4 节中,我们介绍了 VLM 模型与基于查询的动作模型的协同微调,该模型根据 VLM 主干网络各层的隐藏状态、预测的未来视觉潜在特征以及自车的历史运动来预测轨迹。
3.2 文本引导的潜在特征学习
为了将未来帧编码为用于 VLM 监督的紧凑潜在特征,我们采用视频变分自编码器 (Xing et al., 2024)。如图 2 所示,以视频片段 $v \in \mathbb{R}^{C \times T \times H \times W}$ 作为输入,模型首先采用空间编码器生成空间潜在特征 $z_1 \in \mathbb{R}^{c \times T \times \frac{H}{8} \times \frac{W}{8}}$。基于 Stable Diffusion 图像 VAE (Rombach et al., 2022),该空间编码器堆叠 3D 卷积以执行 8 倍空间下采样,同时保留完整的时间长度。随后,轻量级时间自编码器以 $z_1$ 为输入,堆叠 3D ResNet 块以实现 4 倍时间压缩,生成潜在特征 $z_2 \in \mathbb{R}^{c' \times \frac{T}{4} \times \frac{H}{8} \times \frac{W}{8}}$,从而消除冗余的帧间静态信息。然后在重建过程中,通过对称的两阶段解码管道恢复全分辨率视频 $\hat{v}$。
为了进一步提高重建质量,我们在每个块内嵌入多层文本交叉注意力机制,以在特征编码过程中引入文本引导。我们将视觉特征分割为 patch 标记,将视觉 patch 作为查询和值,并采用 Flan-T5 (Chung et al., 2024) 文本嵌入作为键来计算交叉注意力。注意力输出通过残差连接加回原始视觉特征。这种文本语义先验有效地抑制了运动鬼影、边缘模糊和时间闪烁,极大地提高了复杂交通场景的重建保真度。
VAE 通过多组件损失进行优化,该损失平衡了重建损失 $L_{rec}$、对抗损失 $L_{GAN}$ 和 KL 散度正则化损失 $L_{KL}$: $$ L_{vae} = L_{rec} + \lambda_{GAN}L_{GAN} + \lambda_{KL}L_{KL}. \quad (1) $$
通过分层时空压缩和文本跨模态注入,视频 VAE 生成紧凑的潜在表示,为下游 VLA 预训练和协同微调提供有效的监督。
3.3 预训练
预训练阶段旨在使主干网络具备在图像级和潜在级预测世界演变的能力。
视觉建模。我们遵循 VQGAN (Esser et al., 2021) 将连续视频流转换为离散视觉标记。具体而言,给定连续视频序列 $V_{t-H:t+T}$,我们首先将序列划分为 $N$ 个不重叠的块,其中 $N = (H + T)/t_{chunk} + 1$,$t_{chunk}$ 表示块持续时间。对于每个块,我们采用 VQ 标记器将第一个视觉观测值离散化为离散视觉标记,得到: $$ V_q = \{V_{q1}, V_{q2}, \dots, V_{qN}\}, \quad (2) $$ 其中 $V_{qj}$ 表示对应于第 $j$ 个块初始帧的量化视觉标记。
动作建模。我们采用 FAST (Pertsch et al., 2025) 将连续动作序列离散化为离散动作标记。给定航点序列 $W_{t-H:t+T}$,我们将绝对坐标转换为自车相对坐标以获得动作序列 $V_{t-H:t+T}$,将其分割为块并使用 FAST 动作标记器将 $V_{t-H:t+T}$ 编码为离散标记,得到: $$ A_q = \{A_{1q}, A_{2q}, \dots, A_{Nq}\}, \quad (3) $$ 其中每个 $A_{jq}$ 对应于第 $j$ 个时间块内的动作标记。
语言建模。我们利用 Emu3 标记器 (Wang et al., 2024b) 将驾驶指令 $CMD_{t-H:t+T}$ 离散化为语言标记: $$ L_q = \{L_{1q}, L_{2q}, \dots, L_{Nq}\}, \quad (4) $$
第 5 页
其中每个 $L_{jq}$ 对应第 $j$ 个语言标记。
未来潜在预测。我们在输入标记序列中战略性地插入一个可学习的查询标记 $Q$,并将查询位置的隐藏状态输入到一个多层感知机(MLP)中,以在前向传播期间预测未来的潜在表示 $\hat{z}_2$。
训练目标。由于所有模态信号都被转换为从共享词汇表中采样的离散标记,我们将世界模型的输入序列构建为: $$ S = [L_{1q}, V_{q1}, A_{1q}, L_{2q}, V_{q2}, Q, A_{2q}, L_{3q}, \dots, V_{qN}, A_{Nq}], \quad (5) $$ 为了防止信息泄露,应用因果掩码,使得每个标记只能关注序列中 preceding(前导)的标记。最终的训练目标由三项组成:
$$ L_{\text{world}} = \sum_{j=1}^{N} \text{CE}(\hat{L}_{jq}, L_{jq}) + \sum_{j=1}^{N} \text{CE}(\hat{A}_{jq}, A_{jq}) + \lambda_1 \sum_{j=1}^{N} \text{CE}(\hat{v}_{jq}, v_{jq}) + \lambda_2 \|\hat{z}_2 – z_2\|_2^2. \quad (6) $$
这里,第一项是语言标记预测损失,第二项是动作预测损失,第三项是视觉标记预测损失,最后一项强制预测的潜在表示与从未来视频序列中提取的真实压缩特征之间的一致性。$\lambda_1$ 和 $\lambda_2$ 分别是视觉标记和潜在表示损失的权重。
3.4 联合微调
在联合微调阶段,世界模型和行动专家被联合优化,以实现连续且可靠的动作预测。
我们通过联合注意力机制(Black et al., 2024)将骨干网络和行动专家集成在一起。历史动作 $V_{t-H:t}$、驾驶指令 $\text{CMD}_{t-H:t}$ 以及来自骨干网络的预测潜在表示 $\hat{z}_2$ 被连接起来作为注意力模块的序列输入。在与骨干网络上下文交互后,动作标记位置的隐藏状态通过一个 MLP 头进行解码。
为了验证跨范式的兼容性,我们在两种主要的动作模型家族上实例化了我们的方法:基于选择的(Li et al., 2024)和基于生成模型的(Lipman et al., 2022)。
对于包括流匹配在内的生成模型训练目标,我们有: $$ L_{\text{cotrain}} = \|\hat{v} – v\|_2^2 + \lambda_3 \|\hat{z} – z\|_2^2 \quad (7) $$ 第一项是流匹配向量场回归损失,第二项是潜在预测损失,$\lambda_3$ 是潜在损失权重。
基于选择的训练目标如下: $$ L_{\text{cotrain}} = \text{KL}(p_{\text{pred}} \| p_{\text{gt}}) + \lambda_3 \|\hat{z} – z\|_2^2, \quad (8) $$ 其中 $p_{\text{pred}}$ 是离线轨迹词汇表中每个轨迹的预测得分,$p_{\text{gt}}$ 是通过综合考虑专家轨迹以及评估指标计算出的真实得分,并采用 KL 散度损失来监督预测得分分布。
4 实验
4.1 数据集
我们在 NAVSIM v1 (Dauner et al., 2024) 和 v2 (Cao et al., 2025) 基准测试上评估我们的方法,提供闭环评估协议和多维定量指标。
NAVSIM v1。NAVSIM v1 从五个核心维度衡量驾驶能力:无责任碰撞(No at-fault Collision, NC)、可行驶区域合规性(Drivable Area Compliance, DAC)、碰撞时间(Time-To-Collision, TTC)、舒适性(Comfort, C.)和自身进展(Ego Progress, EP)。整体性能通过加权乘积公式聚合为预测驾驶员模型得分(PDMS): $$ \text{PDMS} = \text{NC} \times \text{DAC} \times \frac{5 \times \text{EP} + 5 \times \text{TTC} + 2 \times \text{C.}}{12}. \quad (9) $$
第 6 页
NAVSIM v2。作为扩展和精炼版本,NAVSIM v2 (Cao et al., 2025) 引入了更细粒度的评估维度,以更好地契合现实世界的驾驶需求。除了继承自 v1 的核心指标外,它还增加了行驶方向合规性 (DDC)、交通灯合规性 (TLC)、车道保持 (LK)、历史舒适度 (HC) 和扩展舒适度 (EC)。相应的综合指标为扩展预测驾驶员模型得分 (EPDMS),定义如下:
$$ \text{EPDMS} = \frac{5 \times \text{EP} + 5 \times \text{TTC} + 2 \times \text{LK} + 2 \times \text{HC} + 2 \times \text{EC}}{16} \times \text{NC} \times \text{DAC} \times \text{DDC} \times \text{TLC}. \quad (10) $$
4.2 实现细节
我们的模型骨干基于 Emu3 (Wang et al., 2024b),这是一种统一的自回归多模态模型。
VideoVAEPlus 微调。我们从预训练的 4 通道 VideoVAEPlus (Xing et al., 2024) 模型初始化,并在 NuPlan 数据集 (Caesar et al., 2021) 上进行微调。对于每个视频片段,我们均匀采样 8 帧并调整大小为 216 × 216,同时使用 Qwen3.6-plus 生成简短的场景描述。训练在 4 个 PPUs (Alibaba Cloud, 2026) 上进行,每个 PPU 的批次大小为 1。对抗损失和 KL 损失的权重分别设置为 0.5 和 1e-6,对抗损失在第 50K 步后启用。我们训练模型 100K 步,使其能够从视频中学习紧凑的表示。
预训练。在预训练阶段,我们使用 OpenScenes 数据集 (Contributors, 2023),该数据集包含超过 120 小时的驾驶视频记录,这些记录被分割为 20.0 秒的片段。在训练过程中,对于每个片段,我们随机采样一个未来时间跨度 $T = 4.0$ 秒、历史时间跨度 $H = 1.0$ 秒的帧序列。给定块持续时间 $t_{\text{chunk}} = 1.0$ 秒,非重叠块的数量 $\text{num } N$ 为 6。训练配置采用跨两个节点的批次大小为 4,每个节点配备 16 个 PPUs (Alibaba Cloud, 2026)。我们将学习率设置为 $2.2 \times 10^{-4}$,最大训练步数为 4000。损失权重系数配置为 $\lambda_1 = 0.5$ 和 $\lambda_2 = 0.1$。
联合微调。在联合微调阶段,我们在 NAVSIM trainval 数据集 (Dauner et al., 2024) 上对预训练模型进行微调,该数据集包含超过 100,000 帧带有真实自车轨迹标注的数据。与预训练配置一致,未来时间跨度 $T$ 和历史时间跨度 $H$ 分别设置为 4 秒和 1 秒。我们训练 4000 步,总批次大小为 96。学习率设置为 $5 \times 10^{-5}$,潜在预测损失权重 $\lambda_3 = 0.1$。
4.3 与最先进方法的比较
我们将 HyWorldVLA 与代表性的基于像素的世界模型 (WM) 方法、基于潜在变量的世界模型方法,以及几种经典的端到端和基于 VLA 的基线进行了基准测试。如表 1 和表 2 所示,我们的方法在 v1 和 v2 基准测试中均实现了最先进 (SOTA) 的性能,显著优于具有竞争力的基于像素的 WM 基线(如 DriveVLA-W0 (Li et al., 2025c))以及包括 Latent-WAM (Wang et al., 2026) 在内的基于潜在变量的 WM 基线。这种性能提升可归因于我们的混合世界建模范式,该范式调和了基于像素的世界模型的细粒度时空建模能力与基于潜在变量的世界模型固有的高级语义表示能力。
4.4 消融分析
组件消融。表 3 展示了 HyWorldVLA 各组件的消融结果。移除像素回归能力(纯 LWM)导致得分最低(87.50),证实了其在理解环境和生成准确动作方面的时空建模能力的关键作用。移除潜在表示能力(纯 WAM)也导致显著下降(89.91),表明其对学习高级语义具有积极作用。从潜在模块中移除语言指导使得分降至 90.35,表明语言有效地引导模型关注与规划相关的语义。移除动作专家模型中的潜在条件使得分降至 90.29,表明显式利用预测
第 7 页
表 1:在 NAVSIM v1 上与最先进方法的比较。缩写:1x Cam(单前视摄像头),Nx Cam(环视摄像头),L(激光雷达)。
| 方法 | 参考文献 | 传感器 | NC↑ | DAC↑ | TTC↑ | C.↑ | EP↑ | PDMS↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 人类 | – | – | – | – | – | 100 | 100 | 100 | 99.9 | 87.5 | 94.8 | | 基于端到端的方法 | | | | | | | | | | | UniAD (Hu et al., 2023b) | CVPR’23 | 6x Cam | 97.8 | 91.9 | 92.9 | 100.0 | 78.8 | 83.4 | | TransFuser (Prakash et al., 2021) | TPAMI’23 | 3x Cam + L | 97.7 | 92.8 | 92.8 | 100.0 | 79.2 | 84.0 | | PARA-Drive (Weng et al., 2024) | CVPR’24 | 6x Cam | 97.9 | 92.4 | 93.0 | 99.8 | 79.3 | 84.0 | | Hydra-MDP (Li et al., 2024) | arXiv’24 | 3x Cam + L | 98.3 | 96.0 | 94.6 | 100.0 | 78.7 | 86.5 | | DiffusionDrive (Liao et al., 2025) | CVPR’25 | 3x Cam + L | 98.2 | 96.2 | 94.7 | 100.0 | 82.2 | 88.1 | | 基于 VLA 的方法 | | | | | | | | | | | AutoVLA (Zhou et al., 2025b) | NeurIPS’25 | 3x Cam | 98.4 | 95.6 | 98.0 | 99.9 | 81.9 | 89.1 | | ReCogDrive-8B (Li et al., 2025e) | ICLR’26 | 3x Cam | 97.8 | 97.7 | 94.9 | 100.0 | 86.3 | 90.5 | | 基于像素的世界模型方法 | | | | | | | | | | | WoTE (Li et al., 2025d) | ICCV’25 | 3x Cam + L | 98.5 | 96.8 | 94.4 | 99.9 | 81.9 | 88.3 | | FSDrive (Zeng et al., 2026) | NeurIPS’25 | 1x Cam | 98.2 | 93.8 | 93.3 | 99.9 | 80.1 | 85.1 | | ReSim (Yang et al., 2026a) | NeurIPS’25 | 1x Cam | – | – | – | – | – | 86.6 | | PWM (Zhao et al., 2026) | NeurIPS’25 | 1x Cam | 98.6 | 95.9 | 95.4 | 100.0 | 81.8 | 88.1 | | CoWorld-VLA (Huang et al., 2026) | arXiv’26 | 1x Cam | 99.2 | 96.8 | 96.6 | 100.0 | 83.6 | 89.8 | | DriveLaW (Xia et al., 2026) | CVPR’26 | 1x Cam | 99.0 | 97.1 | 96.7 | 100.0 | 81.3 | 89.1 | | DriveVLA-W0 (Li et al., 2025c) | ICLR’26 | 1x Cam | 98.7 | 99.1 | 95.3 | 99.3 | 83.3 | 90.2 | | 基于潜在变量的世界模型方法 | | | | | | | | | | | LAW (Li et al., 2025b) | ICLR’25 | 1x Cam | 96.4 | 95.4 | 88.7 | 99.9 | 81.7 | 84.6 | | World4Drive (Zheng et al., 2025) | ICCV’25 | 1x Cam | 97.4 | 94.3 | 92.8 | 100.0 | 79.9 | 85.1 | | Epona (Zhang et al., 2025) | ICCV’25 | 1x Cam | 97.9 | 95.1 | 93.8 | 99.9 | 80.4 | 86.2 | | DreamerAD (Yang et al., 2026c) | arXiv’26 | 1x Cam | 98.0 | 97.2 | 94.3 | 100.0 | 83.1 | 88.7 | | OneVL (Lu et al., 2026b) | arXiv’26 | 1x Cam | – | – | – | – | – | 88.8 | | WorldRFT (Yang et al., 2026b) | AAAI’26 | 1x Cam | 97.8 | 96.8 | 94.0 | 100.0 | 81.7 | 87.8 | | ResWorld (Zhang et al., 2026) | ICLR’26 | 4x Cam + L | 98.9 | 96.5 | 95.6 | 100.0 | 83.1 | 89.0 | | 本文方法 | – | 1x Cam | 98.6 | 98.9 | 95.1 | 99.3 | 84.6 | 90.59 |
表 2:在 NAVSIM v2 上使用扩展指标与最先进方法的比较。
| 方法 | NC↑ | DAC↑ | DDC↑ | TLC↑ | EP↑ | TTC↑ | LK↑ | HC↑ | EC↑ | EPDMS↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 基于端到端的方法 | | | | | | | | | | | | TransFuser (Prakash et al., 2021) | 96.9 | 89.9 | 97.8 | 99.7 | 87.1 | 95.4 | 92.4 | 98.3 | 87.2 | 76.7 | | HydraMDP++ (Li et al., 2025a) | 97.2 | 97.5 | 99.4 | 99.6 | 83.1 | 96.5 | 94.4 | 98.2 | 70.9 | 81.4 | | DriveSuprim (Yao et al., 2026) | 97.5 | 96.5 | 99.4 | 99.6 | 88.4 | 96.6 | 95.5 | 98.3 | 77.0 | 83.1 | | ARTEMIS (Feng et al., 2025) | 98.3 | 95.1 | 98.6 | 99.8 | 81.5 | 97.4 | 96.5 | 98.3 | – | 83.1 | | DiffusionDrive (Liao et al., 2025) | 98.2 | 95.9 | 99.4 | 99.8 | 87.5 | 97.3 | 96.8 | 98.3 | 87.7 | 84.5 | | 基于 VLA 的方法 | | | | | | | | | | | | ReCogDrive (Li et al., 2025e) | 98.3 | 95.2 | 98.3 | 99.8 | 87.1 | 97.5 | 96.6 | 99.5 | 86.5 | 83.6 | | 基于像素的世界模型方法 | | | | | | | | | | | | DriveVLA-W0 (Li et al., 2025c) | 98.5 | 99.1 | 98.0 | 99.7 | 86.4 | 98.1 | 93.2 | 97.9 | 58.9 | 86.1 | | ExploreVLA (Sheng et al., 2026) | 98.8 | 96.2 | 99.6 | 99.8 | 87.1 | 98.2 | 97.8 | 98.3 | 86.8 | 88.8 | | 基于潜在变量的世界模型方法 | | | | | | | | | | | | DriveWorld-VLA (Liu et al., 2026) | 98.6 | 99.1 | 99.6 | 99.8 | 87.4 | 97.9 | 97.0 | 97.9 | 78.6 | 86.8 | | DreamerAD (Yang et al., 2026c) | 98.6 | 99.1 | 99.6 | 99.8 | 87.4 | 97.9 | 97.0 | 97.9 | 78.6 | 86.8 | | Latent-WAM (Wang et al., 2026) | 98.0 | 97.2 | 99.5 | 99.8 | 87.8 | 97.4 | 97.5 | 98.3 | 72.4 | 87.7 | | 本文方法 | 98.8 | 98.2 | 99.5 | 99.9 | 87.8 | 98.1 | 96.2 | 98.3 | 77.4 | 89.71 |
未来信息有助于更准确的动作生成。在协同微调期间消除潜在监督会导致得分为 90.17,这突显了保留预训练潜在语义并防止过度优化的重要性。
第 8 页
表 3:NAVSIM 基准上的消融研究。
| Config | NC↑ | DAC↑ | TTC↑ | C.↑ | EP↑ | PDMS↑ | | :— | :— | :— | :— | :— | :— | :— | | Pure WAM | | 98.3 | 98.6 | 94.5 | 99.6 | 84.0 | 89.91 | | Pure LWM | | 97.2 | 97.8 | 92.0 | 98.9 | 82.4 | 87.50 | | w/o language guidance in latent | | 98.5 | 98.8 | 94.7 | 99.6 | 84.5 | 90.35 | | w/o latent condition in action expert | | 98.6 | 98.7 | 94.9 | 99.3 | 84.3 | 90.29 | | w/o latent supervision in co-fine-tuning | | 98.6 | 98.9 | 95.3 | 99.8 | 83.3 | 90.17 | | Ours | | 98.6 | 98.9 | 95.1 | 99.3 | 84.6 | 90.59 |
预训练阶段损失权重的消融研究。如表 4 所示,我们首先固定 $\lambda_2 = 0.1$ 并考察 $\lambda_1$ 的影响。当 $\lambda_1$ 从 0.1 增加到 0.5 和 1.0 时,得分从 90.48 提升至 90.59,随后显著下降至 89.83。这表明视觉 token 预测的权重不应过高。当我们固定 $\lambda_1 = 0.5$ 并将 $\lambda_2$ 从 0.1 增加到 0.2、0.5 和 1.0 时,得分分别从 90.59 下降至 90.47,随后继续下降至 90.34 和 90.16。这表明在预训练阶段同时引入视觉 token 预测 ($\lambda_1 = 0.5$) 和潜在运动 ($\lambda_2 = 0.1$) 能最有效地引导轨迹。
协同微调阶段损失权重的消融研究。如表 5 所示,从 $\lambda_3 = 0.05$ 开始,我们观察到将其增加到 0.1 使得分从 90.47 提升至 90.59,表明适当的监督可防止由潜在空间语义坍缩引起的性能下降。然而,当 $\lambda_3$ 进一步增加到 0.2 和 1.0 时,得分分别下降至 90.01 和 89.75,这表明过强的监督会阻碍模型自主学习与动作生成最相关的潜在语义。
表 4:预训练阶段损失权重的消融研究。 | $\lambda_1$ | $\lambda_2$ | NC↑ | DAC↑ | TTC↑ | C.↑ | EP↑ | PDMS↑ | | :— | :— | :— | :— | :— | :— | :— | :— | | 0.1 | 0.1 | 98.6 | 98.7 | 94.9 | 99.6 | 84.6 | 90.48 | | 0.5 | 0.1 | 98.6 | 98.9 | 95.1 | 99.3 | 84.6 | 90.59 | | 1.0 | 0.1 | 98.5 | 98.5 | 94.9 | 99.6 | 83.5 | 89.83 | | 0.5 | 0.2 | 98.6 | 98.9 | 95.0 | 99.5 | 84.4 | 90.47 | | 0.5 | 0.5 | 98.6 | 98.6 | 94.5 | 99.4 | 84.9 | 90.34 | | 0.5 | 1.0 | 98.6 | 98.6 | 94.7 | 99.5 | 84.4 | 90.16 |
表 5:协同微调阶段损失权重的消融研究。 | $\lambda_3$ | NC↑ | DAC↑ | TTC↑ | C.↑ | EP↑ | PDMS↑ | | :— | :— | :— | :— | :— | :— | :— | | 0.05 | 98.5 | 98.8 | 95.0 | 99.3 | 84.6 | 90.47 | | 0.1 | 98.6 | 98.9 | 95.1 | 99.3 | 84.6 | 90.59 | | 0.2 | 98.6 | 98.7 | 94.6 | 99.4 | 83.9 | 90.01 | | 1.0 | 98.6 | 98.3 | 95.0 | 99.4 | 83.4 | 89.75 |
4.5 场景噪声鲁棒性分析
定量分析。为了进一步分析 HyWorldVLA 在噪声条件下的行为,我们通过从 Openscene 测试数据集中收集 655 个案例构建了一个噪声鲁棒性测试集,这些案例均包含因雨雾导致的非均匀噪声。我们在性能方面比较了多种方法和配置:WoTE (Li et al., 2025d)、DriveLaW (Xia et al., 2026)、DriveVLA-W0 (Li et al., 2025c)、HyWorldVLA(Pure WM)、HyWorldVLA(w/o latent supervision) 和 HyWorldVLA。如表 6 所示,HyWorldVLA 在受损案例上取得了 86.87 的最高性能,而 WoTE (Li et al., 2025d)、DriveLaW (Xia et al., 2026) 和 DriveVLA-W0 (Li et al., 2025c) 仅分别获得 60.65、67.49 和 61.18,远低于 HyWorldVLA,证明了我们方法的优越鲁棒性。Pure WAM 和协同微调中 w/o latent supervision 配置分别获得 69.95 和 73.18,这进一步阐明 HyWorldVLA 的潜在表示设计在噪声场景中产生了这种鲁棒性能。
定性分析。为了进行定性鲁棒性评估,我们系统地调节前视光照,从晴天过渡到阴天条件。如图 3a 所示,HyWorldVLA 保持了一致的行为模式,在很大程度上不受光照变化的影响,而 DriveVLA-W0 表现出显著的不稳定性。此外,图 3b 展示了从我们提出的噪声鲁棒性测试集中提取的两个额外案例,具有非均匀的视觉退化。在这些具有挑战性的条件下,HyWorldVLA 继续执行正确的驾驶操作,而 DriveVLA-W0 未能做出适当响应。更多案例见附录 C(图 11-13)。
第 9 页
表 6:在 NAVSIM 基准测试上与其他方法相比的场景噪声鲁棒性对比。
方法/配置 NC↑ DAC↑ TTC↑ C.↑ EP↑ PDMS↑
WoTE (Li et al., 2025d) 98.9 76.0 64.4 100.0 64.4 60.65 DriveLaW (Xia et al., 2026) 99.4 75.7 82.9 100.0 69.5 67.49 DriveVLA-W0 (Li et al., 2025c) 93.4 76.2 83.1 98.6 59.8 61.18 Pure WAM 99.1 75.7 94.3 99.8 67.8 69.95 在协同微调中去除潜在监督 99.2 78.5 94.8 99.7 70.9 73.18
我们的方法 99.7 91.1 96.9 99.2 84.4 86.87
前视图像 我们的方法 DriveVLA-W0
光照
暗
(a) 在波动光照下右转。
雾霾
模糊
(b) 在雨雾引起的非均匀噪声下左转并直行。 NPC 自车 车道中心线 • 真实轨迹 • 预测轨迹
图 3:混合世界建模提高了对场景噪声的鲁棒性。(a) DriveVLA-W0 在光照变化下表现出严重的行为方差,而我们的方法保持了显著的一致性。(b) DriveVLA-W0 表现出过于保守的行为,牺牲了交通效率,而我们的方法保持了与人类对齐轨迹的准确驾驶。
5 结论
我们提出了一种混合自动驾驶世界模型,结合了基于像素方法的细粒度时空建模与潜在变体的噪声鲁棒性。像素级重建保留了详细的空间和动态信息,而 VAE 空间中的潜在预测则天然提高了对噪声的抵抗力。在 NAVSIM v1/v2 上的实验表明,我们的方法达到了最先进的性能,并在雨/雾损坏的输入上进行了进一步验证。局限性和未来工作包括将基于单目的框架扩展到多模态传感器,并加强潜在动态与关键交通要素的耦合。
第 10 页
参考文献
阿里云。Ppu 介绍。[在线],2026。https://help.aliyun.com/zh/document_detail/2864586.html。
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 等。π0:一种用于通用机器人控制的视觉-语言-动作流模型。arXiv 预印本 arXiv:2410.24164,2024。
Holger Caesar, Juraj Kabzan, Kok Seang Tan, Whye Kit Fong, Eric Wolff, Alex Lang, Luke Fletcher, Oscar Beijbom, 和 Sammy Omari。nuplan:一种基于闭环机器学习的自动驾驶规划基准。arXiv 预印本 arXiv:2106.11810,2021。
Wei Cao, Marcel Hallgarten, Tianyu Li, Daniel Dauner, Xunjiang Gu, Caojun Wang, Yakov Miron, Marco Aiello, Hongyang Li, Igor Gilitschenski, 等。自动驾驶伪仿真。arXiv 预印本 arXiv:2506.04218,2025。
Yuntao Chen, Yuqi Wang, 和 Zhaoxiang Zhang。Drivinggpt:利用多模态自回归 Transformer 统一驾驶世界建模与规划。在 IEEE/CVF 国际计算机视觉会议论文集,第 26890–26900 页,2025。
Hyung Won Chung, Le Hou, Shayne Longpre, Barret Zoph, Yi Tay, William Fedus, Yunxuan Li, Xuezhi Wang, Mostafa Dehghani, Siddhartha Brahma, 等。扩展指令微调语言模型。机器学习研究杂志,25(70):1–53,2024。
OpenScene 贡献者。OpenScene:自动驾驶中最新、最大的 3D 占据预测基准。https://github.com/OpenDriveLab/OpenScene,2023。
Daniel Dauner, Marcel Hallgarten, Tianyu Li, Xinshuo Weng, Zhiyu Huang, Zetong Yang, Hongyang Li, Igor Gilitschenski, Boris Ivanovic, Marco Pavone, 等。Navsim:数据驱动的自动驾驶仿真与基准测试。arXiv 预印本 arXiv:2406.15349,2024。
Patrick Esser, Robin Rombach, 和 Bjorn Ommer。驯化 Transformer 以实现高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 12873–12883 页,2021。
Renju Feng, Ning Xi, Duanfeng Chu, Rukang Wang, Zejian Deng, Anzheng Wang, Liping Lu, Jinxiang Wang, 和 Yanjun Huang。Artemis:用于自动驾驶的混合专家自回归端到端轨迹规划。IEEE 机器人与自动化快报,11(1):226–233,2025。
Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Dingkang Liang, Chong Zhang, Dingyuan Zhang, Hongwei Xie, Bing Wang, 和 Xiang Bai。Orion:一种通过视觉-语言指导动作生成的整体端到端自动驾驶框架。arXiv 预印本 arXiv:2503.19755,2025。
Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton, 和 Gianluca Corrado。Gaia-1:一种用于自动驾驶的生成式世界模型。arXiv 预印本 arXiv:2309.17080,2023a。
Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, 等。自动驾驶中的视觉-语言-动作模型:过去、现在与未来。arXiv 预印本 arXiv:2512.16760,2025。
Yihan Hu, Jiazhi Yang, Li Chen, Keyu Li, Chonghao Sima, Xizhou Zhu, Siqi Chai, Senyao Du, Tianwei Lin, Wenhai Wang, 等。面向规划的自动驾驶。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 17853–17862 页,2023b。
Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, 和 Gong Che。Coworld-vla:在自动驾驶的多专家世界模型中思考。arXiv 预印本 arXiv:2605.10426,2026。
第 11 页
Jyh-Jing Hwang, Runsheng Xu, Hubert Lin, Wei-Chih Hung, Jingwei Ji, Kristy Choi, Di Huang, Tong He, Paul Covington, Benjamin Sapp, 等人。EMMA:用于自动驾驶的端到端多模态模型。arXiv 预印本 arXiv:2410.23262,2024。
Fan Jia, Weixin Mao, Yingfei Liu, Yucheng Zhao, Yuqing Wen, Chi Zhang, Xiangyu Zhang, 和 Tiancai Wang。Adriver-i:用于自动驾驶的通用世界模型。arXiv 预印本 arXiv:2311.13549,2023。
Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, 和 Xinggang Wang。AlphaDrive:通过强化学习和推理释放 VLMs 在自动驾驶中的潜力。arXiv 预印本 arXiv:2503.07608,2025。
Kailin Li, Zhenxin Li, Shiyi Lan, Jiayi Liu, Yuan Xie, Zuxuan Wu, Zhiding Yu, Jose M Alvarez, 等人。Hydra-mdp++:通过专家引导的决策分析进行海豹蒸馏,推进端到端驾驶。2025a。
Yingyan Li, Lue Fan, Jiawei He, Yuqi Wang, Yuntao Chen, Zhaoxiang Zhang, 和 Tieniu Tan。 通过潜在世界模型增强端到端自动驾驶。在 International Conference on Learning Representations, volume 2025, pp. 42942–42959, 2025b。
Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xi- aoman Wang, Yasong An, Chufeng Tang, Lu Hou, Lue Fan, 和 Zhaoxiang Zhang。Drivevla-w0: 世界模型放大自动驾驶中的数据缩放定律。arXiv 预印本 arXiv:2510.12796, 2025c。
Yingyan Li, Yuqi Wang, Yang Liu, Jiawei He, Lue Fan, 和 Zhaoxiang Zhang。通过 BEV 世界模型进行在线轨迹评估的端到端驾驶。在 Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision, pp. 27137–27146, 2025d。
Yongkang Li, Kaixin Xiong, Xiangyu Guo, Fang Li, Sixu Yan, Gangwei Xu, Lijun Zhou, Long Chen, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, 和 Xinggang Wang。Recogdrive:用于端到端自动驾驶的强化认知框架。arXiv 预印本 arXiv:2506.08052,2025e。
Zhenxin Li, Kailin Li, Shihao Wang, Shiyi Lan, Zhiding Yu, Yishen Ji, Zhiqi Li, Ziyue Zhu, Jan Kautz, Zuxuan Wu, 等人。Hydra-mdp:具有多目标海豹蒸馏的端到端多模态规划。arXiv 预印本 arXiv:2406.06978,2024。
Bencheng Liao, Shaoyu Chen, Haoran Yin, Bo Jiang, Cheng Wang, Sixu Yan, Xinbang Zhang, Xiangyu Li, Ying Zhang, Qian Zhang, 等人。Diffusiondrive:用于端到端自动驾驶的截断扩散模型。在 Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 12037–12047, 2025。
Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747,2022。
Lin Liu, Ziying Song, Caiyan Jia, Hangjun Ye, Xiaoshuai Hao, Long Chen, 等人。Driveworld-vla: 用于自动驾驶的视觉-语言-动作统一潜在空间世界建模。arXiv 预印本 arXiv:2602.06521,2026。
Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, 和 Bing Wang。Xiaomi onevl:具有视觉-语言解释的一步潜在推理和规划。arXiv 预印本 arXiv:2604.18486,2026a。
Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, 等人。Xiaomi onevl:具有视觉-语言解释的一步潜在推理和规划。arXiv 预印本 arXiv:2604.18486,2026b。
Karl Pertsch, Kyle Stachowicz, Brian Ichter, Danny Driess, Suraj Nair, Quan Vuong, Oier Mees, Chelsea Finn, 和 Sergey Levine。Fast:用于视觉-语言-动作模型的高效动作标记化。arXiv 预印本 arXiv:2501.09747,2025。
第 12 页
Aditya Prakash, Kashyap Chitta, 和 Andreas Geiger. 用于端到端自动驾驶的多模态融合Transformer. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 7077–7087 页, 2021.
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer. 使用潜在扩散模型进行高分辨率图像合成. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 10684–10695 页, 2022.
Zihao Sheng, Xin Ye, Jingru Luo, Sikai Chen, 和 Liu Ren. Explorevla: 用于端到端自动驾驶的密集世界建模与探索. arXiv 预印本 arXiv:2604.02714, 2026.
Chonghao Sima, Katrin Renz, Kashyap Chitta, Li Chen, Hanxue Zhang, Chengen Xie, Jens Beißwenger, Ping Luo, Andreas Geiger, 和 Hongyang Li. DriveLM: 基于图视觉问答的驾驶. 在欧洲计算机视觉会议, 第 256–274 页. Springer, 2024.
Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, 和 Boris Ivanovic. 用于端到端驾驶的潜在思维链世界建模. arXiv 预印本 arXiv:2512.10226, 2025. 已被 CVPR 2026 接收.
Sifan Tu, Xin Zhou, Dingkang Liang, Xingyu Jiang, Yumeng Zhang, Xiaofan Li, 和 Xiang Bai. 世界模型在塑造自动驾驶中的作用:一项综合调查. arXiv 预印本 arXiv:2502.10498, 2025.
Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, 等人. Latent-wam: 用于端到端自动驾驶的潜在世界动作建模. arXiv 预印本 arXiv:2603.24581, 2026.
Wenhai Wang, Jiangwei Xie, ChuanYang Hu, Haoming Zou, Jianan Fan, Wenwen Tong, Yang Wen, Silei Wu, Hanming Deng, Zhiqi Li, 等人. DriveMLM: 将多模态大语言模型与自动驾驶的行为规划状态对齐. arXiv 预印本 arXiv:2312.09245, 2023.
Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu. Drivedreamer: 迈向用于自动驾驶的真实世界驾驶世界模型. 在欧洲计算机视觉会议, 第 55–72 页. Springer, 2024a.
Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu, 等人. Emu3: 下一个词元预测即所需. arXiv 预印本 arXiv:2409.18869, 2024b.
Xinshuo Weng, Boris Ivanovic, Yan Wang, Yue Wang, 和 Marco Pavone. Para-drive: 用于实时自动驾驶的并行化架构. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 15449–15458 页, 2024.
Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, 等人. Drivelaw: 在潜在驾驶世界中统一规划与视频生成. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 39701–39712 页, 2026.
Yazhou Xing, Yang Fei, Yingqing He, Jingye Chen, Jiaxin Xie, Xiaowei Chi, 和 Qifeng Chen. 使用跨模态视频 VAE 的大规模运动视频自编码. arXiv 预印本 arXiv:2412.17805, 2024.
Zhenhua Xu, Yujia Zhang, Enze Xie, Zhen Zhao, Yong Guo, Kwan-Yee K Wong, Zhenguo Li, 和 Hengshuang Zhao. DriveGPT4: 通过大语言模型实现可解释的端到端自动驾驶. IEEE 机器人与自动化快报, 9(10):8186–8193, 2024.
Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, 和 Li Chen. Resim: 用于自动驾驶的可靠世界模拟. 神经信息处理系统进展, 38:167710–167741, 2026a.
第 13 页
Pengxuan Yang, Ben Lu, Zhongpu Xia, Chao Han, Yinfeng Gao, Teng Zhang, Kun Zhan, XianPeng Lang, Yupeng Zheng, and Qichao Zhang. Worldrft: 基于强化微调的潜在世界模型规划用于自动驾驶。在《人工智能国际会议论文集》(Proceedings of the AAAI Conference on Artificial Intelligence)中,第 40 卷,pp. 11649–11657,2026b。
Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, 等人。Dreamerad: 通过潜在世界模型实现高效的强化学习用于自动驾驶。arXiv 预印本 arXiv:2603.24587,2026c。
Wenhao Yao, Zhenxin Li, Shiyi Lan, Zi Wang, Xinglong Sun, Jose M Alvarez, and Zuxuan Wu. Drivesuprim: 迈向端到端规划中的精确轨迹选择。在《人工智能国际会议论文集》(Proceedings of the AAAI Conference on Artificial Intelligence)中,第 40 卷,pp. 11910–11918,2026。
Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, and Ning Guo. Futuresightdrive: 通过时空思维链进行视觉思考用于自动驾驶。arXiv 预印本 arXiv:2505.17685,2025。已被 NeurIPS 2025 接收为 Spotlight。
Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, and Xing Wei. Futuresightdrive: 通过时空思维链进行视觉思考用于自动驾驶。《神经信息处理系统进展》(Advances in Neural Information Processing Systems),38:67299–67318,2026。
Jinqing Zhang, Zehua Fu, Zelin Xu, Wenying Dai, Qingjie Liu, and Yunhong Wang. Resworld: 用于端到端自动驾驶的时间残差世界模型。arXiv 预印本 arXiv:2602.10884,2026。
Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiao-Xiao Long, 等人。Epona: 用于自动驾驶的自回归扩散世界模型。在《IEEE/CVF 国际计算机视觉会议论文集》(Proceedings of the IEEE/CVF International Conference on Computer Vision)中,pp. 27220–27230,2025。
Zhida Zhao, Talas Fu, Yifan Wang, Lijun Wang, and Huchuan Lu. From forecasting to planning: Policy world model for collaborative state-action prediction. 《神经信息处理系统进展》(Advances in Neural Information Processing Systems),38:134585–134611,2026。
Wenzhao Zheng, Zetian Xia, Yuanhui Huang, Sicheng Zuo, Jie Zhou, and Jiwen Lu. Doe-1: Closed- loop autonomous driving with large world model. arXiv 预印本 arXiv:2412.09627,2024。
Yupeng Zheng, Pengxuan Yang, Zebin Xing, Qichao Zhang, Yuhang Zheng, Yinfeng Gao, Pengfei Li, Teng Zhang, Zhongpu Xia, Peng Jia, 等人。World4drive: 通过意图感知的物理潜在世界模型实现端到端自动驾驶。在《IEEE/CVF 国际计算机视觉会议论文集》(Proceedings of the IEEE/CVF International Conference on Computer Vision)中,pp. 28632–28642,2025。
Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, and Alois Knoll. Open- drivevla: Towards end-to-end autonomous driving with large vision language action model. arXiv 预印本 arXiv:2503.23463,2025a。
Zewei Zhou, Tianhui Cai, Seth Z. Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou, and Jiaqi Ma. Autovla: A vision-language-action model for end-to-end autonomous driving with adaptive rea- soning and reinforcement fine-tuning. arXiv 预印本 arXiv:2506.13757,2025b。已被 NeurIPS 2025 接收。
第 14 页
附录
A 总体概述 14
B 更多实验 14
B.1 基于流匹配的实验 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
B.2 场景噪声鲁棒性的消融研究 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
C 可视化 15
C.1 未来图像生成 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
C.2 规划轨迹 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
C.3 失败案例 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
C.4 更多场景噪声鲁棒性案例 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
D LLM的使用 17
A 总体概述
本附录包含随主论文提供的补充材料。§ B 报告了额外的实验,包括在 NAVSIM 基准测试上对比流匹配动作专家,以及对场景噪声鲁棒性的潜在损失权重的消融研究。进一步的定性结果在 § C 中展示,包括由我们的世界模型生成的图像,其中展示了挑战性案例研究的可视化,以及对光照干扰和模糊噪声案例的定性分析。最后,§ D 披露了我们在写作辅助中使用大型语言模型(LLM)的情况。
B 更多实验
B.1 基于流匹配的实验
为了验证我们的方法在不同类型动作模型上的通用性,除了锚点选择动作模型方法外,我们还进行了与流匹配动作模型的对比实验,如表 7 所示。
表 7:在 NAVSIM 基准测试上,作为动作专家的流匹配版本对比。
方法 NC↑ DAC↑ TTC↑ C.↑ EP↑ PDMS↑ DriveVLA-W0 (fm) 98.4 95.3 95.2 100.0 80.9 87.2 ours (fm) 98.8 96.3 95.5 100.0 82.9 88.76
B.2 场景噪声鲁棒性的消融研究
为了进一步阐明潜在表示如何有助于噪声鲁棒性,我们对 λ3 进行了消融研究。表 8 显示,较大的 λ3 始终能提升模型在噪声数据上的性能,验证了潜在表示在噪声鲁棒性方面的积极作用。然而,无限制地增加 λ3 会降低正常情况下的性能,因此在这两种能力之间进行权衡是一个关键的未来研究方向。
第 15 页
表 8:潜在损失权重在噪声鲁棒性测试中的消融研究。
λ3 NC↑ DAC↑ TTC↑ C.↑ EP↑ PDMS↑
0.05 99.5 88.7 96.6 99.1 82.4 84.52 0.1 99.7 91.1 96.9 99.2 84.4 86.87 ↑+2.35 0.2 99.1 94.8 94.5 99.4 88.1 89.45 ↑+2.58 1.0 98.8 98.3 95.1 100.0 90.8 92.94 ↑+3.49
C 可视化
C.1 未来图像生成
我们的模型继承了 World Action Model 强大的未来帧预测能力。如图 4a 所示,仅使用单个前视摄像头,我们的模型生成了输入帧中缺失的中心双黄线。此外,如图 4b 所示,在我们的模型在高度交互的场景中准确预测了自车(ego vehicle)和障碍物的未来机动动作。
Vt−1 Vt
输入
Vt+1 Vt+2 Vt+3 Vt+4
GT
Pred
(a) 在受限前视摄像头视角下的路口右转。
Vt−1 Vt
输入
Vt+1 Vt+2 Vt+3 Vt+4
GT
Pred
(b) 在狭窄道路上与迎面而来的公交车相遇。
图 4:未来图像生成。(a) 在右转过程中,尽管前视摄像头输入中缺少车道标线,我们的模型仍能可靠地预测未来的车道标线,证明了其习得的世界知识。(b) 我们的模型正确预测了迎面而来的公交车的运动模式以及自车相应的向右让行动作,证明了其复杂场景理解能力。
第 16 页
C.2 规划轨迹
在本节中,我们进行定性案例分析,以更深入地了解我们模型的行为并验证我们的关键发现。具体而言,我们在多个具有挑战性的场景中将我们的混合世界模型(Hybrid World Model)与基线 DriveVLA-W0 进行对比,如图 5、图 6 和图 7 所示。
前视图像 ours DriveVLA-W0
非自车 (NPC) 自车 (Ego Car) 车道中心线 • 真实轨迹 (GT Traj.) • 预测轨迹 (Pred Traj.)
图 5:右转并停在一辆后备箱打开的卡车后面。DriveVLA-W0 基线在试图推动一辆后备箱打开的停止卡车时失败。我们的方法停止并保持适当距离。
前视图像 ours DriveVLA-W0
非自车 (NPC) 自车 (Ego Car) 车道中心线 • 真实轨迹 (GT Traj.) • 预测轨迹 (Pred Traj.)
图 6:在视野受限的小型路口左转。DriveVLA-W0 基线在应该左转的小型路口直行。尽管前视视野受限,我们的方法仍能左转。
前视图像 ours DriveVLA-W0
非自车 (NPC) 自车 (Ego Car) 车道中心线 • 真实轨迹 (GT Traj.) • 预测轨迹 (Pred Traj.)
图 7:在施工路口左转。DriveVLA-W0 基线在施工路口驶入对向车道。我们的方法左转并保持在右侧车道。
第 17 页
C.3 失败案例
为了客观地评估我们模型的性能并明确后续改进的方向,我们对评估过程中遇到的典型失败案例进行了分析。这些案例主要归结为两类:一是对关键小元素的捕捉能力不足,二是前视摄像头在转弯场景下的局限性,如图 8、图 9 和图 10 所示。
Vt−1 Vt 轨迹 规划
Vt+1 Vt+2 Vt+3 Vt+4
世界模型 (WM)
真实值 (GT)
非玩家角色 (NPC) 自车 (Ego Car) 车道中心线 •真实轨迹 (GT Traj.) •预测轨迹 (Pred Traj.)
图 8:失败案例分析:对关键小元素的捕捉能力不足。我们展示了一个失败案例,其中我们的模型试图超越前方排队等待的车辆。世界模型的预测显示,该模型将排队车辆误分类为低速移动车辆,并试图超越它以获取更高的交通效率,但未能识别出前方红灯和车辆刹车灯所指示的排队状态。由于这一关键线索仅由少数像素构成,细粒度元素捕捉和因果推理仍然是未来研究的核心方向。
C.4 更多场景噪声鲁棒性案例
为了全面展示我们模型对场景噪声的鲁棒性,我们对光照干扰和模糊噪声案例进行了定性分析。与基线模型相比,我们的模型在噪声环境下表现出更稳定且合理的性能。除了正文中提到的左转场景外,我们还通过仅调整光照强度,比较了典型右转和直行场景下的输出变化,验证了我们的模型在光照扰动下能产生更一致的结果,如图 11a 和图 11b 所示。我们进一步展示了由雨雾引起的自然非均匀模糊案例,其中交通信号灯和车辆被部分或完全遮挡。纯像素回归基线表现出严重退化:它在红灯排队时爬行,并对减速表现得过于保守。相比之下,得益于世界模型 (LWM) 固有的场景噪声鲁棒性,我们的模型在相同的噪声输入下仍能保持准确且合理的驾驶行为,其轨迹更符合人类驾驶模式,如图 12 和图 13 所示。
D 大语言模型 (LLMs) 的使用
本文稿的写作润色使用了大语言模型 (LLMs)。
第 18 页
Vt−1 Vt 轨迹 规划
Vt+1 Vt+2 Vt+3 Vt+4
世界模型
真实轨迹
非玩家角色 本车 车道中心线 •真实轨迹 •预测轨迹
图 9:失败案例分析:左转时前视摄像头的限制。我们展示了一个模型在左转时跨越中央双黄线的失败案例。受限于视野,历史帧和当前帧无法为左转过程中的目标车道提供有效线索;世界模型的预测也相应地缺失了双道路标线。这证明了多视角摄像头输入在转弯场景中的重要性,而权衡摄像头数量与推理延迟仍然是一个尚未解决的关键问题。
Vt−1 Vt 轨迹 规划
Vt+1 Vt+2 Vt+3 Vt+4
世界模型
真实轨迹
非玩家角色 本车 车道中心线 •真实轨迹 •预测轨迹
图 10:失败案例分析:右转时前视摄像头的限制。我们展示了一个模型在右转时追尾排队前车(queuing leading vehicle)的失败案例。受限于视野,在右转过程中无法获得周围车辆的有效线索,世界模型的预测也相应地遗漏了前方车辆。这再次证明了多视角摄像头输入在转弯场景中的必要性。
第 19 页
前视图像 我们的方法 DriveVLA-W0
光照
黑暗
(a) 在路口右转。
光照
黑暗
(b) 在路口直行。 非玩家角色 自车 车道中心线 • 真实轨迹 • 预测轨迹
图 11:在光照波动下右转和直行。(a) DriveVLA-W0 在右转指令下直行,而我们的方法保持鲁棒。(b) DriveVLA-W0 的行为从变道变为直行,而我们的方法保持直行。
前视图像 我们的方法 DriveVLA-W0
非玩家角色 自车 车道中心线 • 真实轨迹 • 预测轨迹
图 12:在模糊噪声下于红灯路口保持静止。DriveVLA-W0 基线在红灯排队时蠕行,而我们的方法保持静止。
第 20 页
正面图像 我们的方法 DriveVLA-W0
NPC 自车 车道中心线 • 真实轨迹 • 预测轨迹
图13:在模糊噪声下直行。DriveVLA-W0基线由于图像模糊而试图减速。我们的方法保持了合理的速度,并且更符合人类的驾驶模式。