OpenLongTail:生成式扩展长尾驾驶数据,提升VLA策略鲁棒性

三分钟导读:OpenLongTail通过从异构长尾视频恢复度量级自车轨迹,并利用Plücker射线几何、时间深度扭曲和跨视图记忆库引导扩散模型,将单目驾驶视频转化为同步的多视图资产,从而显著提升自动驾驶策略在长尾场景下的闭环鲁棒性。

英文题目:OpenLongTail: Generative Scaling of Long-Tail Driving Data

论文出处:arXiv 每日论文精选 · arXiv:2607.09655

原始论文:PDF / 论文页面

对应视频标题:OpenLongTail:生成式扩展长尾驾驶数据,提升VLA策略鲁棒性|推荐指数:★★★★★

这篇论文解决什么问题?

现有自动驾驶策略在长尾场景(如罕见障碍物、复杂路口)下表现受限,且这些场景在结构化数据集中稀缺;同时,来自异构来源(如众包行车记录仪)的长尾视频缺乏多视角覆盖和精确位姿,存在模态差距,无法直接用于训练。

核心创新

  • 提出OpenLongTail框架,将异构长尾视频转化为策略学习可用的多视图资产。
  • 集成Plücker射线几何编码,将目标相机射线与自车运动结合,提供统一的3D射线帧条件。
  • 设计时间深度扭曲模块,利用自车运动将前视可见证据传播到无重叠的后视目标相机。
  • 构建跨视图记忆库,通过拓扑依赖图自回归地传播几何和语义信息,确保多视图间的一致性。

方法概览

OpenLongTail是一个生成式数据引擎,包含两个主要阶段:首先使用MapAnything恢复度量级自车轨迹并进行平滑处理;随后,基于Wan 2.1-VACE骨干网络,注入Plücker射线几何条件、时间深度扭曲(Temporal Depth Warp)和跨视图记忆库(Cross-View Memory Bank),从单目前视视频合成目标相机 rig 下的同步多视图视频。

逐图理解论文

OpenLongTail框架概览

OpenLongTail框架概览
Figure 2 Overview of OpenLongTail. Given a long-tail front-view driving video, OpenLongTail first recovers a motion- consistent metric ego-trajectory and uses it to construct pose-aware geometric conditions. The generation model combines Plücker-ray geometry, temporal depth warping, and a cross-view memory bank within a Wan 2.1-VACE backbone to synthesize synchronized non-front views under the target camera rig. The resulting surround-view rollout provides geometry-grounded multi-view assets for scaling downstream driving policy training.

OpenLongTail是一个生成式数据引擎,旨在将异构长尾视频转化为策略学习可用的多视图资产。其核心流程包含两阶段:首先利用MapAnything恢复度量级自车轨迹并进行平滑处理,随后基于Wan 2.1-VACE骨干网络,从单目前视视频合成目标相机rig下的同步多视图视频。

轨迹恢复与几何一致性

轨迹恢复与几何一致性
Table 2 Unseen-scene extrapolative view evaluation. We evaluate target-view synthesis on held-out unseen driving scene. We compare OpenLongTail with novel trajectory video synthesis baselines and report PSNR and LPIPS for each target view, together with GeoKPM µ for cross-view geometric consistency, where values closer to 100 indicate better consistency.

在自车轨迹恢复方面,OpenLongTail在度量尺度下取得ATE 2.212,Jerk为283.9,优于DROID-W等基线。在视图合成评估中,未见场景的GeoKPM均值达82.41,Cross-left视图PSNR为13.28,LPIPS为0.597,显著优于Vista4D等基线,证明了几何条件的有效性。

闭环评估与性能提升

闭环评估与性能提升
Table 1 Main result: Closed-loop AlpaSim evaluation in long-tail events. We report AlpaSim Score (AS, higher is better) and Collision Rate (CR, lower is better) across four representative long-tail categories and the overall average. SFT denotes supervised fine-tuning; 10K Rand denotes 10K randomly sampled training trajectories; NV-OOD denotes the NVIDIA ood subset; GT and Syn denote ground-truth and OpenLongTail synthesized multi-view data, respectively. Complex Int. and Uncommon Veh. denote complex intersections and uncommon vehicles. The best and second-best results are shown in bold and underlined, respectively.

在AlpaSim模拟器中对Alpamayo R1策略进行闭环评估,使用合成数据训练的模型AlpaSim Score达0.748,碰撞率为0.0%,接近使用GT多视图数据的0.764得分。定性结果显示,在复杂路口和罕见车辆场景中,合成数据显著改善了策略的轨迹规划能力。

外部数据源与分布对齐

外部数据源与分布对齐
Figure 7 Distribution gap in complex-intersection scenarios. We compare the occurrence of two complex-intersection patterns in NVIDIA and Waymo data: Temporary Path Reassignment, where cones, closures, or temporary routing cues override nominal lane markings, and Human-Guided Traffic Control, where workers or police officers actively direct vehicle behavior. NVIDIA contains substantially higher coverage of these long-tail cases, while Waymo contains few or no examples.

模型在Waymo E2E和Nexar等外部数据源上展现出泛化能力。然而,分布差异显著影响效果。NVIDIA数据包含大量人类引导的复杂路口场景,而Waymo数据中此类长尾案例极少。若源数据与目标长尾切片分布不一致,生成式扩展带来的性能提升将受限。

局限性与使用建议

局限性与使用建议
Figure9 Closed-loopbenefitsofgenerativescalingonlong-tailscenarios. We compare Alpamayo R1 with variants augmented by OpenLongTail-generated assets from NV data and from both NV and external sources. Across representative long-tail cases, including uncommon vehicles, cyclists, and complex intersections, adding generated assets improves the closed-loop rollout behavior. The policy trained with additional NV and external synthesized data produces trajectories that better follow the intended drivable corridor and avoid unsafe interactions. This demonstrates that generative scaling does not merely increase data volume, but expands useful long-tail coverage for downstream VLA training.

尽管效果显著,该方法仍存在局限。基于扩散模型的合成推理成本较高,且生成的视频中可能存在残留的时间伪影。此外,后视相机的合成难度显著高于侧视相机。使用外部数据源时,需严格评估源数据与目标场景的分布对齐程度,以避免无效扩展。

实验与关键结果

  • 在AlpaSim模拟器中对Alpamayo R1策略进行闭环评估,测试在长尾事件中的表现。
  • 在未见场景(Unseen-scenario)和外部源(Waymo E2E, Nexar)上评估视图合成的视觉保真度和几何一致性。
  • 评估自车轨迹恢复的精度和平滑度,对比DROID-W, MegaSAM, VGGT等方法。
  • 分析不同数据源(NVIDIA PAV vs Waymo E2E)在复杂路口场景下的分布差异及其对策略训练的影响。
  • AlpaSim Score 0.748, Collision Rate 0.0% (使用NV Syn数据)(第 6 页)
  • AlpaSim Score 0.764, Collision Rate 0.0% (使用GT多视图数据)(第 6 页)
  • Unseen-scenario GeoKPM µ 82.41(第 7 页)
  • Unseen-scenario Cross-left PSNR 13.28, LPIPS 0.597(第 7 页)
  • Metric-scale ATE 2.212, Jerk 283.9(第 9 页)

阅读时需要注意

  • 基于扩散模型的合成推理成本较高。
  • 生成的视频中仍存在残留的时间伪影。
  • 不同相机 rig 配置下存在持续的相机偏差。
  • 外部数据源(如Waymo)的贡献受分布对齐程度限制,若源数据与目标长尾切片分布不一致,提升有限。
  • 生成数据的质量依赖于自车轨迹恢复的准确性,特别是在无标定或低质量视频中。
  • 后视相机的合成难度显著高于侧视相机,因为存在更大的视角外推和重叠缺失。
  • 使用外部数据源进行生成式扩展时,需考虑源数据与目标评估场景的分布对齐,否则可能无法带来预期的性能提升。

关联工作

  • Alpamayo R1:作为下游VLA策略模型,用于评估OpenLongTail生成数据的有效性。(第 6 页)
  • MapAnything:用于从单目视频恢复度量级自车轨迹的基础模型。(第 4 页)
  • Wan 2.1-VACE:作为OpenLongTail的视频生成骨干网络。(第 4 页)
  • Vista4D:作为视图合成任务的基线模型进行对比。(第 7 页)
  • Waymo E2E:作为外部单目数据源,用于评估模型的泛化能力和分布对齐影响。(第 7 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

OpenLongTail:长尾驾驶数据的生成式扩展 Lulin Liu∗1, Nuo Chen∗1, Yan Wang2, Bangya Liu3, Wenyan Cong4, Hezhen Hu4, Boris Ivanovic2, Hao Wang1, Ziyao Zeng5, Xinyu Gong6, Yang Zhou1, Zixiang Xiong1, Dilin Wang7, Zhangyang Wang4, Weisong Shi8, Ruohan Zhang9, Marco Pavone2,9, Zhiwen Fan1,†

1德州农工大学, 2英伟达, 3威斯康星大学麦迪逊分校, 4德克萨斯大学奥斯汀分校, 5耶鲁大学, 6Adobe, 7Meta, 8特拉华大学, 9斯坦福大学 ∗共同一作, †通讯作者

扩展鲁棒的驾驶策略从根本上受限于精心策划数据集中边缘案例的稀缺性。尽管现实世界不断捕捉到这些关键事件,但当从异构来源收集时,这些长尾事件仍未得到充分利用。具体而言,多样但珍贵的野外长尾视频缺乏训练策略模型所需的全视角覆盖,通常缺少多视角位姿,或仅源自单目行车记录仪。这种模态差距使得这些无处不在的观测结果无法转化为用于长尾泛化的可扩展训练数据。我们引入了 OpenLongTail,这是一个开源的生成式数据引擎,旨在通过长尾事件来扩展自动驾驶策略。为了将异构数据源转化为对策略学习有用的、视角对齐且时间连贯的多视角资产,我们开发了一种基于位姿的外推视角合成管线,用于生成缺失的视角。我们进一步增强了跨视图一致性和时间生成对齐引擎。通过注入新合成的异构长尾数据,我们在闭环驾驶中观察到处理长尾事件的鲁棒性有显著提升。通过测量外推视角合成和位姿指标,我们验证了 OpenLongTail 在视觉保真度、跨视图一致性和自车轨迹恢复方面的有效性。

日期:2026年7月13日 关键词:自动驾驶,视频扩散模型,VLA 模型 项目网站:https://openlongtail.github.io/[cs.CV]

1 引言

得益于大规模驾驶数据集(Sun 等,2020;Ettinger 等,2021;Caesar 等,2020;Xu 等,2025),近期的视觉-语言-动作(VLA)驾驶策略在常见场景上取得了显著进展,通过在结构良好的训练条件下学习从场景理解到车辆控制的端到端映射(Wang 等,2025c;Zhou 等,2025, 2026;Xu 等,2024a;Yuan 等,2025;Jiang 等,2025b;Hwang 等,2024;Jiang 等,2024;Feng 等,2025;Jiang 等,2025a)。然而,现实世界的自主性还要求这些策略在长尾情况下保持可靠,其中动态障碍物和异常的环境条件可能导致安全关键性故障。然而,训练数据面临几个挑战。首先,如道路上有动物和施工区域等事件在精心策划的数据集中非常稀缺,并且通常使用校准的多相机阵列进行大规模采集的成本更高。尽管有时记录了此类事件,但产生的数据分散在异构来源中,从最近发布的大规模存储库(如 NVIDIA PhysicalAI 自动驾驶汽车 (PAV) (NVIDIA Corporation, 2025) 和 Waymo E2E 数据集 (Xu 等,2025))到广泛可用的单目行车记录仪视频。这些观测结果通常遵循不兼容的注释格式,并提供缺失或不可靠的度量相机位姿。这种模态差距使得常见的现实世界长尾视频无法直接转换为同步的多视角训练资产,限制了所学驾驶策略向鲁棒长尾泛化的持续扩展。

弥合这一差距需要一个转换引擎,将无位姿或单目驾驶数据转换为同步的、

1

第 2 页

OpenLongTail 长尾事件 动物 逆行 异构 NV PAV 条件 深度扭曲 记忆库 生成资产 异构 长尾视频 众包

Waymo E2E : : 扩散模型 骑行者 施工区域 左前 前(真值) 右前 开放 扩展

数据

检查点 左后 后视遥测 右后

转换

微调数据:10K 随机 + 指定来源 代码

图 1 OpenLongTail 将来自不同来源的异构长尾驾驶视频转换为在目标相机支架下具有位姿基准、同步的多视图资产。它以 Plücker 射线几何、时间深度扭曲和跨视图记忆为条件,利用扩散模型合成超出观测前视相机范围的扩展视图。左下角图表显示,使用我们合成的长尾数据进行微调显著提高了闭环驾驶性能,并接近使用真值多视图数据进行训练的效果。为了支持开放扩展,我们发布了生成的数据、模型检查点、转换工具和代码。

与最先进模型兼容的位姿基准资产(Zhou 等,2025,2026;Gao 等,2026)。现有方法存在不足,因为目标输出是一个目标支架的展开序列,其侧方和后视相机可能观察到输入视频中不存在的区域。尽管最近的视频生成和相机控制合成方法在可控位姿下生成高质量序列方面取得了显著进展(Yu 等,2025;Bai 等,2025;Ren 等,2025b;Lin 等,2026;Van Hoorick 等,2026;Yu 等,2024;Wu 等,2025;Yang 等,2026),但在扩展到未观测空间时表现不佳。具体而言,它们通常要么缺乏跨视图一致性,要么依赖于 3D 边界框和 LiDAR 等条件,而这些条件在异构视频中并不存在(Gao 等,2023;Wang 等,2024a;Zhao 等,2025;Ren 等,2025a;Hu 等,2023;Russell 等,2025;Wang 等,2024b)。基于神经渲染的显式重建(例如 3D 高斯溅射,3DGS (Kerbl 等,2023))面临局限性,因为这些方法依赖于足够的视图重叠和跨视图光度一致性,在窄单目覆盖、动态物体和捕获伪影的情况下非常脆弱。3DGS 转换还依赖于准确的相机轨迹,而这些轨迹很难从野外视频序列中获取。

为了弥补这一差距,我们引入了 OpenLongTail(图 1),这是一个开源生成式数据引擎,将异构长尾驾驶视频统一为空间对齐且时间连贯的多视图资产,以促进更安全的策略学习。OpenLongTail 利用 GFMs 的泛化能力,从弱标注的驾驶视频中恢复度量尺度的自车轨迹,然后将此恢复的运动转化为几何条件,通过生成引擎指导基于位姿的扩展视图合成。生成式扩散模型注入 Plücker 射线几何以编码目标相机射线,并使用时间深度扭曲将可见证据从观测到的前视图传播到目标支架,从而在共享相机帧下合成缺失的侧方和后视上下文。最终,OpenLongTail 将行车记录仪驾驶日志转换为鲁棒的、具有位姿基准的多视图资产。通过位姿恢复基准、扩展视图合成和闭环策略评估,我们证明 OpenLongTail 显著提高了长尾事件期间的驾驶鲁棒性,并增强了视觉保真度和自车轨迹精度。OpenLongTail 引入了以下主要贡献: 1. 我们引入了 OpenLongTail,这是一个开放扩展的生成式数据引擎,将异构长尾驾驶视频转换为位姿基准的多视图数据,使得从异构源进行可扩展的 VLA 策略学习成为可能。

2. 我们将 Plücker 射线相机几何和跨视图记忆库集成到生成过程中, 允许合成的目标视图共享空间基准的潜在上下文,并实现更强的

2

第 3 页

在目标相机阵列下保持跨视图一致性。

3. 我们在 AlpaSim 中对 OpenLongTail 进行了下游闭环 VLA 评估,并结合视图合成与自车轨迹恢复,表明我们生成的资产显著提高了长尾驾驶策略的鲁棒性,有效地将无处不在的单目长尾视频转化为可扩展的训练源。

2 相关工作

自动驾驶中的视觉-语言-动作模型。近期的视觉-语言-动作(VLA)模型统一了感知、语言条件推理和端到端规划 (Wang et al., 2025c; Zhou et al., 2025, 2026; Li et al., 2025a; Sima et al., 2024; Shao et al., 2024; Xu et al., 2024b; Wang et al., 2023; Ma et al., 2024),越来越多地利用强化学习、扩散模型和可解释策略 (Jiang et al., 2025b; Hwang et al., 2024; Jiang et al., 2024; Feng et al., 2025; Jiang et al., 2025a; Rowe et al., 2025; Song et al., 2025)。尽管在正常条件下取得了成功,但由于严格依赖精心策划的同步多视图日志,将这些策略扩展到罕见长尾事件仍然面临瓶颈。标准基准提供了丰富的传感器数据 (Sun et al., 2020; Caesar et al., 2020; Wilson et al., 2023; Mao et al., 2021; Yu et al., 2020; Caesar et al., 2021) 以及针对长尾极端情况的针对性评估 (Li et al., 2022; Xu et al., 2025; Tian et al., 2024; Xie et al., 2025),但其僵化的协议阻止了从异构来源(例如行车记录仪或网络视频)持续吸收开放式现实异常。OpenLongTail 直接解决了这一数据转换瓶颈,将非结构化观测数据转化为同步的全景资产,以支持稳健的下游策略学习。

可控视频生成。近期的世界基础模型为连贯的视觉合成提供了强大的生成先验 (Ali et al., 2025; Wan et al., 2025; Yang et al., 2024; Chen et al., 2025)。面向驾驶的方法利用这些先验进行多视图、长视界和闭环模拟 (Swerdlow et al., 2024; Yang et al., 2023; Li et al., 2024; Ren et al., 2025a; Gao et al., 2023; Wen et al., 2024; Lu et al., 2024b; Gao et al., 2024; Wang et al., 2025b; Hu et al., 2024; Gao et al., 2025; Fu et al., 2024; Guo et al., 2024; Li et al., 2026b),但严重依赖密集的结构化条件,如 3D 布局或占据网格 (Yang et al., 2025; Lu et al., 2025)。与此同时,基于相机的生成可以从稀疏观测中合成新视角 (Yu et al., 2025; Bai et al., 2025; Yang et al., 2026; Chen et al., 2024; Lu et al., 2024a; Yao et al., 2024; Guo et al., 2025),但在自动驾驶场景中,由于全景阵列相机之间的重叠区域极小,这种方法难以奏效。这种稀疏的重叠导致大量目标区域完全不可观测,且无法通过标准的几何投影或扭曲来恢复。为了解决这一问题,我们引入了 OpenLongTail。通过耦合姿态感知的几何恢复与可控的世界生成,OpenLongTail 在严格强制执行跨视图几何对齐和时间一致性的同时,对不可观测的阵列视图进行幻觉生成。

3 方法论

在本节中,我们介绍了 OpenLongTail,这是一种姿态感知的外推视图合成流水线,它将单目长尾前视驾驶视频转换为目标相机阵列下的同步多视图视频(图 2)。我们的方法围绕四个主要阶段构建。首先,我们将任务表述为以连续自车轨迹为条件的姿态感知多视图生成。其次,我们从非约束视频输入中恢复并稳定度量尺度的相机轨迹,以建立绝对空间锚点。第三,我们通过将生成骨干网络与统一的 3D 射线几何、时间回溯深度扭曲以及拓扑跨视图图记忆相结合,执行多视图外推合成。最后,我们使用流匹配训练目标优化整个基于几何的流水线。

3.1 问题陈述

我们的目标是将异构的长尾单目驾驶视频 $x_{mono}^{1:T}$ 转换为在目标相机阵列 $\mathbf{R}$ 下运动一致的多视图资产 $\hat{\mathbf{X}}_{\mathbf{R}}^{1:T}$,从而为驾驶策略实现可扩展的长尾数据构建。我们将这一转换表述为一个两阶段生成过程,该过程分解为

第 4 页

长尾事件 多视图 WAN 2.1 长尾视频 资产

解码器 银行 扭曲 分块 + 块 块 … & DiT DiT 深度 VAE 记忆

MLP 深度扭曲(时间) 可用 记忆库 跨 视图 密集记忆 3D +RTS 3D L/R 记忆 基础 Plücker射线 基础 模型 模型 后 编码器 L/R/Tele 语义记忆

图 2 OpenLongTail 概述。给定一个长尾前视驾驶视频,OpenLongTail 首先恢复运动一致的度量自车轨迹,并利用它构建姿态感知的几何条件。生成模型在 Wan 2.1-VACE 骨干网内结合 Plücker 射线几何、时间深度扭曲和跨视图记忆库,以在目标相机支架下合成同步的非前视视图。生成的环绕视图滚动提供了基于几何的多视图资产,用于扩展下游驾驶策略训练。

连续的自车轨迹 $p_{1:T}$:

$\hat{X}_{R_{1:T}} \sim P_{\theta}(\cdot | x_{mono_{1:T}}, R) = P(p_{1:T} | x_{mono_{1:T}}) \cdot P_{\theta}(\hat{X}_{R_{1:T}} | x_{mono_{1:T}}, p_{1:T}, R)$ . (1) |相机 $\{z_{轨迹}\}$ | 几何基础 $\{z_{生成}\}$ 恢复

我们通过使用 MapAnything (Keetha et al., 2025) 从输入的单目视频中恢复度量相机姿态来实例化第一项,随后进行前向-后向运动平滑以抑制帧级姿态抖动,同时保持度量尺度。得到的 $p^*_{1:T}$ 为第二项提供稳定的姿态条件,在该项中,我们利用几何先验在目标支架下合成外推视图:

$\hat{X}_{R_{1:T}} \sim P_{\theta}(\cdot | x_{mono_{1:T}}, p^*_{1:T}, R; W_{1:T}, G_{pl}, M_{1:T})$ , (2)

其中 $W_{1:T}$ 表示提供几何对齐视觉证据的时间深度扭曲,$G_{pl}$ 表示编码目标相机几何的 Plücker 射线条件,$M_{1:T}$ 表示在生成的视图间传播信息的跨视图记忆。这些组件共同将长尾视频转换为连贯、同步的多视图资产,用于下游策略学习。

3.2 度量尺度自车轨迹恢复

为了构建姿态对齐的多视图资产,我们使用 MapAnything 从输入视频 $V_{1:T}$ 中提取度量尺度的相机轨迹: $\hat{T}_{1:T} = \Phi_{MA}(V_{1:T}) = \{\hat{T}_t\}_{t=1}^T$ (3) 其中每个姿态 $\hat{T}_t \in SE(3)$。由于帧级姿态通常包含高频波动,这会破坏视图合成的稳定性,我们通过运动一致性稳定阶段对其进行细化:

$\tilde{T}_{1:T} = \Psi_{RTS} \Psi_{KF} \hat{T}_{1:T}$ . (4)

具体而言,前向卡尔曼滤波器 ($\Psi_{KF}$) 抑制局部噪声,而后向 Rauch-Tung-Striebel 平滑器 ($\Psi_{RTS}$) 利用完整片段稳定全局路径。输出轨迹 $\tilde{T}_{1:T}$ 在减少抖动的同时保持度量尺度的自车运动,从而产生更平滑的姿态条件。

3.3 姿态感知的外推合成

我们从前视潜在变量 $z_0$、相机校准内参和外参 $(K, E)$、自车轨迹 $T_{anchor}$ 和文本提示 $c_{txt}$ 合成五个非前视视图 $\{z_t\}_{t=1}^5$。生成在潜在空间中进行

4

第 5 页

冻结的 Wan 2.1 VAE 潜在空间,使用 Wan 2.1-VACE DiT 1.3B 主干网络 (Jiang et al., 2025c)。为了将生成过程锚定在驾驶场景的物理结构上,我们将三个核心条件模块集成到主干网络中:几何编码器(Geometry Encoder)、时间深度扭曲(Temporal Depth Warp)和跨视图记忆库(Cross-View Memory Bank)。所有可训练参数仅限于 Wan-DiT/VACE 自注意力层上的 LoRA Hu et al. (2022) 适配器以及这三个条件模块。

几何条件(Geometry Conditioning)。几何编码器注入每个 token 的相机射线几何信息。对于视图 $v$ 在帧 $\tau$ 的潜在网格位置 $(h, w)$ 处的每个时空 token,我们将其在自车锚点帧(ego-anchor frame)中的 3D 射线计算为 Plücker 射线: $$ r_{h,w}^{(v,\tau)} = \left[ d_{h,w}^{(v,\tau)} ; \mu_{h,w}^{(v,\tau)} \right] \in \mathbb{R}^6, \quad \mu = o \times d, \quad (5) $$ 其中 $d$ 是单位射线方向,$\mu$ 是其力矩。结合相机身份、流角色(目标或条件)的离散嵌入以及自车运动 MLP,几何编码器产生统一的 token 级偏置: $$ g_{h,w}^{(v,\tau)} = \phi_{\text{Plücker}} \left( r_{h,w}^{(v,\tau)} \right) + e_{\text{cam}}(v) + e_{\text{role}}(r) + \phi_{\text{traj}} T_{\text{anchor}} \in \mathbb{R}^d. \quad (6) $$ 关键在于,$g$ 在三个并行入口点被广播相加:主 DiT 隐藏状态、VACE 控制分支隐藏状态以及记忆条件库。这种共享编码确保所有网络分支在一致的 3D 射线帧中运行。

时间深度扭曲(Temporal Depth Warp)。为了提供与每个目标视图对齐的像素级 RGB 先验,深度扭曲模块为每个目标视图 $t$ 构建几何对齐的先验 $(z_{\text{warp}}^{t}, m_{t})$。该先验包括通过 Wan VAE 编码的重投影到目标帧 $t$ 的前视像素,以及一个 token 级可见性掩码。该模块不包含可训练参数,完全依赖于从冻结的 DepthCrafter 提取的深度和分析扭曲操作。具体的重投影策略取决于相机之间的空间重叠情况。对于与前置相机共享重叠视场的侧向相机($t \in \{1, 2\}$),我们在同一帧内应用空间扭曲。帧 $\tau$ 处的一个前视像素 $u$ 使用其深度 $d_0$ 进行反投影,并通过相对 SE(3) 位姿进行变换: $$ \Pi_{0 \to t}^{\text{same}}(u, \tau) = K_t (E_t^{-1} E_0) K_0^{-1} u_{d_0}(u, \tau). \quad (7) $$

相比之下,后置相机($t \in \{3, 4, 5\}$)与前视视图没有直接重叠。为了解决这个问题,我们利用车辆的向前自车运动,应用时间偏移扭曲,从覆盖当前目标 $t$ 的过去前视帧中进行采样: $$ \Pi_{0 \to t}^{\text{look}}(u, \tau; \Delta t) = K_t T_{\text{cam}}(t, \tau)^{-1} T_{\text{cam}}(0, \tau – \Delta t) K_0^{-1} u_{d_0}(u, \tau – \Delta t). \quad (8) $$

我们不使用固定的时间窗口,而是利用针对每个视图特定的帧偏移 $\Delta t$。这种设计使得视场较窄的相机可以从轨迹更远处获取信息,从而有效地最大化所有目标的空间覆盖范围。

跨视图记忆库(Cross-View Memory Bank)。虽然深度扭曲提供了与位姿对齐的内容,但要保持相邻相机之间的无缝一致性,需要每个目标视图对先前生成的空间邻居进行条件约束。我们通过针对五个目标相机的有向自回归依赖图对此结构进行编码:$G(1) = G(2) = \{0\}$,$G(3) = \{0, 1\}$,$G(4) = \{0, 2\}$,以及 $G(5) = \{0, 3, 4\}$,其中 $G(i)$ 表示用于合成目标视图 $i$ 的条件视图。推理过程按拓扑顺序遍历 $G$,从而在视图间传播一致的几何信息。

在每次前向传播中,$G(t)$ 中的最多三个条件潜在变量被分块,与几何编码器偏置结合,并通过 $N$ 个适配器块处理,以产生密集记忆 $M_{\text{dense}} \in \mathbb{R}^{3 \times T \times H'W' \times d}$。一个具有 64 个查询的 Perceiver 风格重采样器将此表示压缩为语义记忆 $M_{\text{sem}} \in \mathbb{R}^{3 \times T \times 64 \times d}$。在选定的一组稀疏 DiT 层中,目标流 token $h_{\tau}^{\text{tgt}}$ 对两个记忆的时间窗口进行交叉注意力机制: $$ \Delta \tau = g_d(\sigma) \Phi_{\text{dense}} \left( h_{\tau}^{\text{tgt}}, M_{\text{dense}}^{N(\tau)} \right) + g_s(\sigma) \Phi_{\text{sem}} \left( h_{\tau}^{\text{tgt}}, M_{\text{sem}}^{N(\tau)} \right), \quad h_{\tau}^{\text{tgt}} \leftarrow h_{\tau}^{\text{tgt}} + \Delta \tau. \quad (9) $$ 其中 $N(\tau)$ 表示帧 $\tau$ 周围的局部时间邻域。密集路径锚定了视图间的像素级对应关系,而语义路径提供了内容级摘要,使其对空间错位具有鲁棒性。

5

第 6 页

表 1 主要结果:长尾事件中的闭环 AlpaSim 评估。我们报告了 AlpaSim 得分(AS,越高越好)和碰撞率(CR,越低越好),涵盖四个代表性的长尾类别及总体平均值。SFT 表示监督微调;10K Rand 表示 10K 个随机采样的训练轨迹;NV-OOD 表示 NVIDIA 的 OOD 子集;GT 和 Syn 分别表示真实数据和 OpenLongTail 合成的多视图数据。Complex Int. 和 Uncommon Veh. 分别表示复杂路口和不常见车辆。最佳和次佳结果分别以粗体和下划线显示。

额外训练数据 代表性长尾事件 平均 模型 10K NV-OOD Waymo-E2E 复杂路口 骑行者 不常见车辆 施工区域 Rand GT Syn GT Syn AS↑ CR↓ AS↑ CR↓ AS↑ CR↓ AS↑ CR↓ AS↑ CR↓

Alpamayo R1 (Wang et al., 2025c) 0.457 71.4% 0.534 50.0% 0.575 50.0% 0.683 50.0% 0.534 58.8% Alpamayo 1.5 (Wang et al., 2025c) 0.469 75.0% 0.347 100.0% 0.517 33.3% 0.731 50.0% 0.501 61.1% ✓ 0.659 25.0% 0.670 0.0% 0.733 0.0% 0.936 0.0% 0.716 11.1% Alpamayo R1 ✓ ✓ 0.743 0.0% 0.688 0.0% 0.758 0.0% 0.938 0.0% 0.764 0.0% + SFT ✓ ✓ 0.747 0.0% 0.662 0.0% 0.717 0.0% 0.935 0.0% 0.748 0.0% (Wang et al., 2025c) ✓ ✓ ✓ 0.691 12.5% 0.691 0.0% 0.735 0.0% 0.958 0.0% 0.736 5.6% ✓ ✓ ✓ 0.699 12.5% 0.689 0.0% 0.765 0.0% 0.950 0.0% 0.748 5.6%

Alpamayo R1 Alpamayo R1 Alpamayo R1 施工区域 Alpamayo R1 + GT + NV Syn. + NV/Ex. Syn.

Off Road

图 3 施工区域长尾事件的定性闭环评估。左侧:罕见施工区域场景的前视观测。右侧:在不同长尾训练数据下,Alpamayo R1 的 BEV rollout,其中 NV 表示 NVIDIA LT 数据,Ex. 表示 Waymo E2E 数据。

3.4 训练目标

我们使用流匹配目标优化目标流。对于采样的目标相机 $v \in \{1, \dots, 5\}$ 和干净的视频潜在变量 $z_v$,我们定义噪声状态 $z^{(\sigma)}_v = (1-\sigma)z_v + \sigma\epsilon$ 和目标速度 $v_v = \epsilon – z_v$,给定噪声水平 $\sigma \sim p(\sigma)$。模型 $f_\theta$ 预测速度 $\hat{v}_v$,条件包括 $z^{(\sigma)}_v$、$\sigma$、观测到的前视潜在变量 $z_0$、文本 $c_{\text{txt}}$ 以及视图特定的几何和控制特征 $(c^{\text{VACE}}_v, M^{\text{dense}}_v, M^{\text{sem}}_v, g_v)$。训练损失最小化均方误差:

h i L(\theta) = E_{v,\sigma,\epsilon} [w_v \|\hat{v}_v – v_v\|^2_2] , (10)

其中 $w_v = 1$,除了后视广角相机,其权重为 $w_5 = \lambda_{\text{rear}}$。

4 评估

我们将 OpenLongTail 评估为用于扩展具有异构长尾驾驶视频的 VLA 策略的生成数据引擎。我们的评估围绕最终任务展开:合成的长尾多视图数据是否改善了闭环驾驶行为。随后,我们分析了使这种改进成为可能的中间组件,包括姿态感知的外推视图合成和度量尺度自车轨迹恢复。具体而言,我们首先在 AlpaSim (NVIDIA et al., 2025) 中评估闭环驾驶性能,然后使用视觉和跨视图一致性指标在已知场景、未知场景和 Waymo E2E (Xu et al., 2025) 划分下评估生成质量,最后与最近的轨迹估计方法相比测量姿态精度和时间一致性。

6

第 7 页

表 2 未见场景的外推视角评估。我们在保留的未见驾驶场景上评估目标视角合成。我们将 OpenLongTail 与新颖轨迹视频合成基线进行比较,并报告每个目标视角的 PSNR 和 LPIPS,以及用于跨视图几何一致性的 GeoKPM µ,其中值越接近 100 表示一致性越好。

| Method | Cross-left PSNR ↑ | Cross-left LPIPS ↓ | Cross-right PSNR ↑ | Cross-right LPIPS ↓ | Rear-left PSNR ↑ | Rear-left LPIPS ↓ | Rear-right PSNR ↑ | Rear-right LPIPS ↓ | Rear-tele PSNR ↑ | Rear-tele LPIPS ↓ | GeoKPM µ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | TrajectoryCrafter (Yu et al., 2025) | 10.02 | 0.734 | 9.70 | 0.725 | 9.79 | 0.736 | 9.14 | 0.751 | 9.29 | 0.768 | 10.77 | | Gen3C (Ren et al., 2025b) | 12.08 | 0.649 | 11.74 | 0.675 | 11.24 | 0.738 | 10.99 | 0.751 | 11.52 | 0.750 | 8.61 | | ReCamMaster (Bai et al., 2025) | 12.20 | 0.677 | 11.91 | 0.703 | 11.12 | 0.754 | 10.98 | 0.760 | 11.36 | 0.756 | 16.58 | | Vista4D (Lin et al., 2026) | 11.00 | 0.677 | 11.05 | 0.686 | 10.73 | 0.725 | 10.03 | 0.745 | 10.77 | 0.737 | 18.86 | | Ours | 13.28 | 0.597 | 12.38 | 0.628 | 12.21 | 0.643 | 11.71 | 0.643 | 11.80 | 0.639 | 82.41 |

图 4 生成的多视角驾驶视频定性比较。我们将 OpenLongTail 与 Vista4D (Lin et al., 2026) 进行比较。我们的模型以前置摄像头和目标摄像头几何结构为条件,生成同步的目标视角,保留了场景布局以及侧方和后置摄像头之间的跨视图一致性。更多结果请参阅补充材料。

4.1 实验设置与实现

我们整理了大规模驾驶视频日志,包含来自 NVIDIA PhysicalAI-Autonomous-Vehicles (NVIDIA Corporation, 2025)、PandaSet (Xiao et al., 2021) 和 nuScenes (Caesar et al., 2020) 的约 50K 个场景中的超过 200K 个片段。我们使用 32 块 NVIDIA H200 GPU 对 Wan2.1-VACE-1.3B 进行微调,作为视频生成骨干网络,耗时约 96 小时。微调与评估的实现细节请参阅补充材料。我们将开源代码并发布模型检查点。

4.2 下游闭环策略性能

我们首先评估 OpenLongTail 生成的资产是否改善了下游闭环驾驶行为。对于下游 SFT 和 AlpaSim (NVIDIA et al., 2025) 评估,我们遵循 Alpamayo-R1 (Wang et al., 2025c) 的相机接口,该接口以四个视角作为输入。具体而言,前置视角取自原始真实视频,前置长焦视角通过对前置视角应用确定性视场角 (FoV-Z) 裁剪获得,视场角为 30°,而交叉左和交叉右视角由我们的姿态感知生成模型在目标相机支架下合成。用于生成条件和策略输入的自车运动由我们的自车轨迹模块恢复。

为了评估微调后 VLA 策略的下游性能,我们在 AlpaSim (NVIDIA et al., 2025) 中对 53 个长尾事件进行了闭环仿真。在每个仿真步骤中,AlpaSim 根据其 3D 重建和新视角合成管线,根据当前自车状态渲染相应的多摄像头观测结果,并将生成的观测结果反馈给 VLA 策略以进行动作预测。这种闭环设置将策略部署为自车驾驶员,其连续动作更新模拟器状态,直接测试在长尾事件中对协变量偏移和累积误差的鲁棒性。对于每个策略和事件,我们运行两次独立 rollout 并报告平均指标。如表 1 所示,基线在这些长尾场景中表现困难,成功率 (AS) 低且碰撞率 (CR) 高。相比之下,使用 NVIDIA 合成资产 (NV Syn) 进行微调将平均 AS 从 0.534 提高到 0.748,碰撞率为 0.0%,与真实多视角数据 (NV GT, 0.764) 相当,表明 OpenLongTail 生成的资产是长尾策略训练中多摄像头采集的有效替代方案。

第 8 页

左前 前视(GT) 右前 右后 后视长焦 左后

图 5 Waymo E2E 长尾数据上的定性结果。我们将 OpenLongTail 应用于外部长尾驾驶视频,并合成同步的目标视角。在给定观测到的前视图像的情况下,我们的模型生成了空间一致的侧视和后视图像,同时保持了整体场景布局和驾驶上下文。更多结果请参阅补充材料。

左前 前视(GT) 右前 右后 后视长焦 左后

图 6 Nexar 众包行车记录仪视频上的定性结果。我们将 OpenLongTail 应用于消费级行车记录仪视频。仅给定观测到的单目前视图像,我们的模型恢复自车轨迹,并在目标 rigs 下合成同步的外推视角,同时保持整体场景布局和驾驶上下文。

扩展到外部数据源。通过将单目视频转换为目标 rigs 资产,OpenLongTail 可以进一步解锁外部数据。使用来自 Waymo E2E (Xu et al., 2025) 前视相机合成的资产增强 NV Syn.(NV + Waymo Syn)补充了仅使用 NV 的策略,并恢复了一些失败案例,提升了罕见车辆(0.717→0.765)、骑行者(0.662→0.689)和施工区域(0.935→0.950)的性能。这种收益是与对齐条件相关的:复杂交叉路片子集的性能出现回落,因为 Waymo 数据中人类引导和锥桶标示的案例(在 NV 中占主导地位)代表性不足(详见补充材料)。我们在图 3 中进一步提供了定性闭环回放结果。在施工区域事件中,Alpamayo R1 基线偏离了可行驶车道并驶离道路,而使用真实多视角数据或 OpenLongTail 合成视图进行微调的策略则产生了与车道结构更一致的更稳定轨迹。这一定性结果与表 1 中的定量趋势一致,表明 OpenLongTail 提高了闭环性能,并在具有挑战性的长尾场景中产生了更安全的行为。请参阅补充材料以获取全面的结果和分析。

4.3 位姿感知的外推视角评估

在确立了下游收益之后,我们接下来评估生成的多视角视频。我们在三种设置下评估位姿感知的扩散模型:已知场景、未知场景和外部单目源评估。已知场景拆分包含来自训练期间观测到的场景的保留时间段的 20 个片段,用于衡量模型在熟悉环境中补全缺失视角的能力。请参阅补充材料了解此评估。未知场景拆分包含来自完全未见场景的 218 个片段,用于评估来自同一数据源的陌生驾驶场景的泛化能力。最后,外部单目拆分仅使用来自 Waymo E2E (Xu et al., 2025) 的前视相机视频,这些视频在训练期间从未见过。

我们报告 PSNR、SSIM (Wang et al., 2004)、LPIPS (Zhang et al., 2018)、FID (Heusel et al., 2017) 和 FVD (Unterthiner et al., 2018) 作为评估指标。遵循 Drive-WM (Wang et al., 2024b) 的做法,我们在极线几何过滤下通过关键点匹配 (KPM) 评估跨视图一致性,以避免诸如视图复制等捷径解决方案。表 2 显示,该模型在未知场景上优于基线,特别是在 GeoKPM µ 指标上,表明具有更强的跨视图几何一致性。GeoKPM µ 的大幅提升表明,OpenLongTail 不仅提高了单视角的视觉保真度,更重要的是在extrapolated目标视角之间保持了共享的 3D 场景结构。我们在图 4 中提供了生成环绕视角视频的定性比较。对于 Waymo E2E (Xu et al., 2025) 拆分,我们在图 5 中报告了定性结果。更多结果请参阅补充材料。

我们进一步将 OpenLongTail 应用于 Nexar (Moura et al., 2025),这是一个大规模众包消费级行车记录仪视频集合。与 Waymo E2E (Xu et al., 2025) 不同,后者虽然是外部数据,但仍然是

第 9 页

表 3 在度量尺度(Metric-scale)和 Sim(3) 对齐协议下的位姿评估结果。度量尺度评估保留绝对尺度;Sim(3) 对齐在计算误差前去除全局位姿和尺度。浅灰色单元格表示非度量尺度的方法。ATE、RPE-r、RPE-t、RotErr、RotAnc、TrErr、Jerk 和 Acc.Var 越低越好;LDJ 越高越好。

| Method | \multicolumn{7}{c}{Metric-scale Evaluation} | \multicolumn{7}{c}{Sim(3)-aligned Evaluation} | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | ATE↓ | RPE-r↓ | RPE-t↓ | RotErr↓ | Jerk↓ | Acc.Var↓ | LDJ↑ | ATE↓ | RotAnc↓ | RotErr↓ | TrErr↓ | Jerk↓ | Acc.Var↓ | | DROID-W (Li et al., 2026a) | | | | | | | | 0.284 | 0.861 | 0.217 | 12.99 | 4570.6 | 119.60 | | MegaSAM (Li et al., 2025b) | | | | | | | | 0.444 | 0.456 | 0.129 | 15.57 | 3704.4 | 80.69 | | VGGT (Wang et al., 2025a) | | | | | | | | 0.202 | 0.393 | 0.134 | 13.54 | 2947.7 | 61.19 | | ViPE (Huang et al., 2025) | 3.831 | 0.137 | 59.47 | 0.472 | 929.5 | 15.51 | -9.18 | 0.162 | 0.472 | 0.137 | 9.86 | 1055.5 | 18.44 | | MapAnything (Keetha et al., 2025) | 2.212 | 0.155 | 23.52 | 0.352 | 4737.4 | 53.22 | -12.65 | 0.171 | 0.352 | 0.155 | 12.57 | 4243.9 | 47.52 | | Ours | 2.212 | 0.129 | 23.05 | 0.340 | 283.9 | 5.96 | -7.48 | 0.162 | 0.340 | 0.129 | 11.24 | 254.5 | 5.33 |

专门针对自动驾驶的研究采用了统一的相机硬件,而 Nexar 更直接地代表了无处不在的车载摄像头(dashcam)场景。其视频片段来自异构的消费级设备,具有未知且变化的内参,包含滚动快门和压缩伪影,缺乏经过校准的多相机 rig,且不提供可靠的度量相机位姿。我们仅使用单目前视视频流,并且与所有外部来源一样,完全通过我们的位姿估计模块恢复自车运动。如图 6 所示,仅给定原始前视视频,OpenLongTail 在目标 rig 下合成同步的外推视图,同时保留主导的场景结构,包括道路方向、路边布局和周围交通,并保持生成相机之间的一致性。尽管输入质量下降且未校准,恢复的轨迹仍为外推合成提供了稳定的几何锚点,这表明 OpenLongTail 能够从精心策划的数据集泛化到真正无约束的消费级视频。

4.4 度量尺度位姿恢复评估

最后,我们评估为目标视图合成提供位姿条件的自车轨迹。我们在来自 109 个场景的 218 个视频片段上进行了相机轨迹恢复评估,将 OpenLongTail 与最近的轨迹估计方法(包括 DROID-W (Li et al., 2026a)、MegaSAM (Li et al., 2025b)、VGGT (Wang et al., 2025a)、MapAnything (Keetha et al., 2025) 和 ViPE (Huang et al., 2025))在度量尺度和 Sim(3) 对齐协议下进行比较。如表 3 所示,我们的管道在 ATE 方面与 MapAnything 的最佳结果持平,同时将 jerk 从 4737.4 降低到 283.9,加速度方差从 53.22 降低到 5.96,表明恢复的轨迹显著更平滑,且未牺牲绝对尺度精度。在 Sim(3) 对齐下,我们的方法也达到了最佳的 ATE,并实现了最低的旋转误差、jerk 和加速度方差,仅在平移误差上与 ViPE 有微小差距。这些结果表明,OpenLongTail 恢复了既几何准确又时间稳定的轨迹,为目标 rig 视图合成提供了平滑且具有度量意义的位姿条件。

5 结论与局限性

我们提出了 OpenLongTail,这是一个开放扩展的生成框架,将异构的、无位姿的视频转换为同步的、以位姿为基准的多视图资产,用于扩展驾驶策略。在 AlpaSim (NVIDIA et al., 2025) 中的闭环评估、外推视图合成和自车轨迹恢复中,OpenLongTail 合成的资产在长尾事件下持续提高了策略的鲁棒性,确立了普遍存在的单目视频作为一种可扩展的训练来源。除了这些增益之外,我们的分析完善了生成式扩展的概念:有效的扩展不仅由数据数量决定,还由数据分布决定。源外数据提高了鲁棒性并恢复了失败案例,但其贡献是依赖于对齐条件的,这表明样本高效的扩展需要将源分布与目标长尾切片对齐,而不仅仅是扩大训练池。剩余的局限性包括基于扩散的合成推理成本、残留的时间伪影以及在不同 rig 配置中持续存在的相机偏差。未来的工作将把高效推理和显式相机参数条件与分布感知的源选择相结合,推动生成式扩展向更高保真度和更高样本效率迈进。

9

第 10 页

参考文献

Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Eliza- beth Cha, Yu-Wei Chao, 等. 利用视频基础模型进行物理人工智能的世界模拟. arXiv 预印本 arXiv:2511.00062, 2025.

Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, 等. Recammaster: 基于单视频相机控制的生成式渲染. 在 IEEE/CVF 国际计算机视觉会议论文集, 页码 14834–14844, 2025.

Holger Caesar, Varun Bankiti, Alex H Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, 和 Oscar Beijbom. nuscenes: 自动驾驶多模态数据集. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 11621–11631, 2020.

Holger Caesar, Juraj Kabzan, Kok Seang Tan, Whye Kit Fong, Eric Wolff, Alex Lang, Luke Fletcher, Oscar Beijbom, 和 Sammy Omari. nuplan: 基于闭环机器学习的自动驾驶规划基准. arXiv 预印本 arXiv:2106.11810, 2021.

Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, 等. Skyreels-v2: 无限长度电影生成模型. arXiv 预印本 arXiv:2504.13074, 2025.

Rui Chen, Zehuan Wu, Yichen Liu, Yuxin Guo, Jingcheng Ni, Haifeng Xia, 和 Siyu Xia. Unimlvg: 用于自动驾驶的多视图长视频生成统一框架,具备全面的控制能力. arXiv 预印本 arXiv:2412.04842, 2024.

Scott Ettinger, Shuyang Cheng, Benjamin Caine, Chenxi Liu, Hang Zhao, Sabeek Pradhan, Yuning Chai, Ben Sapp, Charles R Qi, Yin Zhou, 等. 自动驾驶的大规模交互式运动预测:Waymo 开放运动数据集. 在 IEEE/CVF 国际计算机视觉会议论文集, 页码 9710–9719, 2021.

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, 和 Felix Heide. Verdi: 嵌入自动驾驶的 VLM 推理. arXiv 预印本 arXiv:2505.15925, 2025.

Yongjie Fu, Anmol Jain, Xu Chen, Zhaobin Mo, 和 Xuan Di. Drivegenvlm: 基于视觉语言模型的自动驾驶真实世界视频生成. 在 2024 IEEE 国际自动驾驶车辆验证会议 (IAVVC), 页码 1–6. IEEE, 2024.

Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, 和 Qiang Xu. Magicdrive: 具有多样化 3D 几何控制的街景生成. arXiv 预印本 arXiv:2310.02601, 2023.

Ruiyuan Gao, Kai Chen, Bo Xiao, Lanqing Hong, Zhenguo Li, 和 Qiang Xu. Magicdrive-v2: 具有自适应控制的自动驾驶高分辨率长视频生成. 在 IEEE/CVF 国际 计算机视觉会议论文集, 页码 28135–28144, 2025.

Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, 和 Hongyang Li. Vista: 具有高保真度和多功能可控性的通用驾驶世界模型. 神经信息处理系统进展, 37:91560–91596, 2024.

Tian Gao, Celine Tan, Catherine Glossop, Timothy Gao, Jiankai Sun, Kyle Stachowicz, Shirley Wu, Oier Mees, Dorsa Sadigh, Sergey Levine, 等. Steervla: 在长尾驾驶场景中引导视觉-语言-动作模型. arXiv 预印本 arXiv:2602.08440, 2026.

Jiazhe Guo, Yikang Ding, Xiwu Chen, Shuo Chen, Bohan Li, Yingshuang Zou, Xiaoyang Lyu, Feiyang Tan, Xiaojuan Qi, Zhiheng Li, 等. Dist-4d: 用于 4D 驾驶场景生成的解耦时空扩散与度量深度. 在 IEEE/CVF 国际计算机视觉会议论文集, 页码 27231–27241, 2025.

Xi Guo, Chenjing Ding, Haoxuan Dou, Xin Zhang, Weixuan Tang, 和 Wei Wu. Infinitydrive: 打破驾驶世界模型的时间限制. arXiv 预印本 arXiv:2412.01522, 2024.

Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, 和 Sepp Hochreiter. 通过双时间尺度更新规则训练的 GAN 收敛到局部纳什均衡. 神经信息处理系统进展, 30, 2017.

Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton, 和 Gianluca Corrado. Gaia-1: 自动驾驶的生成式世界模型. arXiv 预印本 arXiv:2309.17080, 2023.

10

第 11 页

Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Liang Wang, Weizhu Chen, et al. Lora: 大型语言模型的低秩自适应。Iclr, 1(2):3, 2022.

Xiaotao Hu, Wei Yin, Mingkai Jia, Junyuan Deng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, and Ping Tan. Drivingworld: 通过 Video GPT 构建自动驾驶的世界模型。arXiv 预印本 arXiv:2412.19505, 2024.

Jiahui Huang, Qunjie Zhou, Hesam Rabeti, Aleksandr Korovko, Huan Ling, Xuanchi Ren, Tianchang Shen, Jun Gao, Dmitry Slepichev, Chen-Hsuan Lin, Jiawei Ren, Kevin Xie, Joydeep Biswas, Laura Leal-Taixe, and Sanja Fidler. Vipe: 用于 3D 几何感知的视频姿态引擎。在 NVIDIA Research Whitepapers arXiv:2508.10934, 2025.

Jyh-Jing Hwang, Runsheng Xu, Hubert Lin, Wei-Chih Hung, Jingwei Ji, Kristy Choi, Di Huang, Tong He, Paul Covington, Benjamin Sapp, et al. Emma: 用于自动驾驶的端到端多模态模型。arXiv 预印本 arXiv:2410.23262, 2024.

Anqing Jiang, Yu Gao, Zhigang Sun, Yiru Wang, Jijun Wang, Jinghao Chai, Qian Cao, Yuweng Heng, Hao Jiang, Yunda Dong, et al. Diffvla: 视觉-语言引导的自动驾驶扩散规划。arXiv 预印本 arXiv:2505.19381, 2025a.

Bo Jiang, Shaoyu Chen, Bencheng Liao, Xingyu Zhang, Wei Yin, Qian Zhang, Chang Huang, Wenyu Liu, and Xinggang Wang. Senna: 弥合大型视觉-语言模型与端到端自动驾驶之间的差距。arXiv 预印本 arXiv:2410.22313, 2024.

Bo Jiang, Shaoyu Chen, Qian Zhang, Wenyu Liu, and Xinggang Wang. Alphadrive: 通过强化学习和推理释放 VLMs 在 自动驾驶中的潜力。arXiv 预印本 arXiv:2503.07608, 2025b.

Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, and Yu Liu. Vace: 一站式视频创建和 编辑。在 IEEE/CVF 国际计算机视觉会议论文集, 页码 17191–17202, 2025c.

Nikhil Keetha, Norman Müller, Johannes Schönberger, Lorenzo Porzi, Yuchen Zhang, Tobias Fischer, Arno Knapitsch, Duncan Zauss, Ethan Weber, Nelson Antunes, et al. Mapanything: 通用前馈度量 3D 重建。 arXiv 预印本 arXiv:2509.13414, 2025.

Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis, et al. 用于实时辐射场渲染的 3D 高斯溅射。ACM Trans. Graph., 42(4):139–1, 2023.

Kaican Li, Kai Chen, Haoyu Wang, Lanqing Hong, Chaoqiang Ye, Jianhua Han, Yukuai Chen, Wei Zhang, Chunjing Xu, Dit-Yan Yeung, et al. Coda: 自动驾驶中目标检测的真实世界道路极端案例数据集。 arXiv 预印本 arXiv:2203.07724, 2022.

Moyang Li, Zihan Zhu, Marc Pollefeys, and Daniel Barath. Droid-slam in the wild。arXiv 预印本 arXiv:2603.19076, 2026a.

Xiaofan Li, Yifu Zhang, and Xiaoqing Ye. Drivingdiffusion: 基于潜在扩散模型的布局引导多视角驾驶场景视频生成 。在欧洲计算机视觉会议, 页码 469–485. Springer, 2024.

Yaoru Li, Federico Landi, Marco Godi, Xin Jin, Ruiju Fu, Yufei Ma, Muyang Sun, Heyu Si, and Qi Guo. Far-drive: 闭环自动驾驶中的帧自回归视频生成。arXiv 预印本 arXiv:2603.14938, 2026b.

Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xiaoman Wang, Yasong An, Chufeng Tang, et al. Drivevla-w0: 世界模型放大自动驾驶中的数据缩放定律。arXiv 预印本 arXiv:2510.12796, 2025a.

Zhengqi Li, Richard Tucker, Forrester Cole, Qianqian Wang, Linyi Jin, Vickie Ye, Angjoo Kanazawa, Aleksander Holynski, and Noah Snavely. Megasam: 从日常动态视频中准确、快速且鲁棒地恢复结构和运动。 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 10486–10496, 2025b.

Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert, Yuancheng Xu, Koichi Namekata, Yiwei Zhao, Bolei Zhou, Micah Goldblum, Paul Debevec, and Ning Yu. Vista4D: 使用 4D 点云进行视频重拍。 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 2026.

Hannan Lu, Xiaohe Wu, Shudong Wang, Xiameng Qin, Xinyu Zhang, Junyu Han, Wangmeng Zuo, and Ji Tao. Seeing beyond views: 使用整体注意力进行多视角驾驶场景视频生成。arXiv 预印本 arXiv:2412.03520, 2024a.

Jiachen Lu, Ze Huang, Zeyu Yang, Jiahui Zhang, and Li Zhang. Wovogen: 用于可控多摄像头驾驶场景生成的 世界体积感知扩散模型。在欧洲计算机视觉会议, 页码 329–345. Springer, 2024b.

11

第 12 页

Yifan Lu, Xuanchi Ren, Jiawei Yang, Tianchang Shen, Zhangjie Wu, Jun Gao, Yue Wang, Siheng Chen, Mike Chen, Sanja Fidler, et al. Infinicube: Unbounded and controllable dynamic 3d driving scene generation with world-guided video models. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 27272–27283, 2025.

Yingzi Ma, Yulong Cao, Jiachen Sun, Marco Pavone, and Chaowei Xiao. Dolphins: Multimodal language model for driving. In European Conference on Computer Vision, pages 403–420. Springer, 2024.

Jiageng Mao, Minzhe Niu, Chenhan Jiang, Hanxue Liang, Jingheng Chen, Xiaodan Liang, Yamin Li, Chaoqiang Ye, Wei Zhang, Zhenguo Li, et al. One million scenes for autonomous driving: Once dataset. arXiv preprint arXiv:2106.11037, 2021.

Daniel C. Moura, Shizhan Zhu, and Orly Zvitia. Nexar dashcam collision prediction dataset and challenge, 2025. https://arxiv.org/abs/2503.03848.

NVIDIA, Yulong Cao, Riccardo de Lutio, Sanja Fidler, Guillermo Garcia Cobo, Zan Gojcic, Maximilian Igl, Boris Ivanovic, Peter Karkus, Janick Martinez Esturo, Marco Pavone, Aaron Smith, Ellie Tanimura, Michal Tyszkiewicz, Michael Watson, Qi Wu, and Le Zhang. AlpaSim: A modular, lightweight, and data-driven research simulator for autonomous driving, October 2025. https://github.com/NVlabs/alpasim.

NVIDIA Corporation. PhysicalAI-Autonomous-Vehicles. https://huggingface.co/datasets/nvidia/ PhysicalAI-Autonomous-Vehicles, 2025.

Xuanchi Ren, Yifan Lu, Tianshi Cao, Ruiyuan Gao, Shengyu Huang, Amirmojtaba Sabour, Tianchang Shen, Tobias Pfaff, Jay Zhangjie Wu, Runjian Chen, et al. Cosmos-drive-dreams: Scalable synthetic driving data generation with world foundation models. arXiv preprint arXiv:2506.09042, 2025a.

Xuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling, Yifan Lu, Merlin Nimier-David, Thomas Müller, Alexander Keller, Sanja Fidler, and Jun Gao. Gen3c: 3d-informed world-consistent video generation with precise camera control. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025b.

Luke Rowe, Rodrigue de Schaetzen, Roger Girgis, Christopher Pal, and Liam Paull. Poutine: Vision-language-trajectory pre-training and reinforcement learning post-training enable robust end-to-end autonomous driving. arXiv preprint arXiv:2506.11234, 2025.

Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, and Gianluca Corrado. Gaia-2: A controllable multi-view generative world model for autonomous driving. arXiv preprint arXiv:2503.20523, 2025.

Hao Shao, Yuxuan Hu, Letian Wang, Guanglu Song, Steven L Waslander, Yu Liu, and Hongsheng Li. Lmdrive: Closed-loop end-to-end driving with large language models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 15120–15130, 2024.

Chonghao Sima, Katrin Renz, Kashyap Chitta, Li Chen, Hanxue Zhang, Chengen Xie, Jens Beißwenger, Ping Luo, Andreas Geiger, and Hongyang Li. Drivelm: Driving with graph visual question answering. In European conference on computer vision, pages 256–274. Springer, 2024.

Nan Song, Bozhou Zhang, Xiatian Zhu, Jiankang Deng, and Li Zhang. Lmad: Integrated end-to-end vision-language model for explainable autonomous driving. arXiv preprint arXiv:2508.12404, 2025.

Jiaming Sun, Zehong Shen, Yuang Wang, Hujun Bao, and Xiaowei Zhou. LoFTR: Detector-free local feature matching with transformers. CVPR, 2021.

Pei Sun, Henrik Kretzschmar, Xerxes Dotiwalla, Aurelien Chouard, Vijaysai Patnaik, Paul Tsui, James Guo, Yin Zhou, Yuning Chai, Benjamin Caine, et al. Scalability in perception for autonomous driving: Waymo open dataset. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 2446–2454, 2020.

Alexander Swerdlow, Runsheng Xu, and Bolei Zhou. Street-view image generation from a bird’s-eye view layout. IEEE Robotics and Automation Letters, 9(4):3578–3585, 2024.

Ran Tian, Boyi Li, Xinshuo Weng, Yuxiao Chen, Edward Schmerling, Yue Wang, Boris Ivanovic, and Marco Pavone. Tokenize the world into object-level knowledge to address long-tail events in autonomous driving. arXiv preprint arXiv:2407.00959, 2024.

Thomas Unterthiner, Sjoerd Van Steenkiste, Karol Kurach, Raphael Marinier, Marcin Michalski, and Sylvain Gelly. Towards accurate generative models of video: A new metric & challenges. arXiv preprint arXiv:1812.01717, 2018.

12

第 13 页

Basile Van Hoorick, Dian Chen, Shun Iwase, Pavel Tokmakov, Muhammad Zubair Irshad, Igor Vasiljevic, Swati Gupta, Fangzhou Cheng, Sergey Zakharov, and Vitor Campagnolo Guizilini. Anyview: Synthesizing any novel view in dynamic scenes. arXiv preprint arXiv:2601.16982, 2026.

Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025.

Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, and David Novotny. Vggt: Visual geometry grounded transformer. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 5294–5306, 2025a.

Wenhai Wang, Jiangwei Xie, ChuanYang Hu, Haoming Zou, Jianan Fan, Wenwen Tong, Yang Wen, Silei Wu, Hanming Deng, Zhiqi Li, et al. Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving. arXiv preprint arXiv:2312.09245, 2023.

Xiaodong Wang, Zhirong Wu, and Peixi Peng. Longdwm: Cross-granularity distillation for building a long-term driving world model. arXiv preprint arXiv:2506.01546, 2025b.

Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, and Jiwen Lu. Drivedreamer: Towards real-world- drive world models for autonomous driving. In European conference on computer vision, pages 55–72. Springer, 2024a.

Yan Wang, Wenjie Luo, Junjie Bai, Yulong Cao, Tong Che, Ke Chen, Yuxiao Chen, Jenna Diamond, Yifan Ding, Wenhao Ding, et al. Alpamayo-r1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail. arXiv preprint arXiv:2511.00088, 2025c.

Yuqi Wang, Jiawei He, Lue Fan, Hongxin Li, Yuntao Chen, and Zhaoxiang Zhang. Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 14749–14759, 2024b.

Zhou Wang, Alan C Bovik, Hamid R Sheikh, and Eero P Simoncelli. Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing, 13(4):600–612, 2004.

Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, and Xiangyu Zhang. Panacea: Panoramic and controllable video generation for autonomous driving. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 6902–6912, 2024.

Benjamin Wilson, William Qi, Tanmay Agarwal, John Lambert, Jagjeet Singh, Siddhesh Khandelwal, Bowen Pan, Ratnesh Kumar, Andrew Hartnett, Jhony Kaesemodel Pontes, et al. Argoverse 2: Next generation datasets for self-driving perception and forecasting. arXiv preprint arXiv:2301.00493, 2023.

Rundi Wu, Ruiqi Gao, Ben Poole, Alex Trevithick, Changxi Zheng, Jonathan T Barron, and Aleksander Holynski. Cat4d: Create anything in 4d with multi-view video diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 26057–26068, 2025.

Pengchuan Xiao, Zhenlei Shao, Steven Hao, Zishuo Zhang, Xiaolin Chai, Judy Jiao, Zesong Li, Jian Wu, Kai Sun, Kun Jiang, et al. Pandaset: Advanced sensor suite dataset for autonomous driving. In 2021 IEEE international intelligent transportation systems conference (ITSC), pages 3095–3101. IEEE, 2021.

Shaoyuan Xie, Lingdong Kong, Yuhao Dong, Chonghao Sima, Wenwei Zhang, Qi Alfred Chen, Ziwei Liu, and Liang Pan. Are vlms ready for autonomous driving? an empirical study from the reliability, data and metric perspectives. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 6585–6597, 2025.

Runsheng Xu, Hubert Lin, Wonseok Jeon, Hao Feng, Yuliang Zou, Liting Sun, John Gorman, Ekaterina Tolstaya, Sarah Tang, Brandyn White, et al. Wod-e2e: Waymo open dataset for end-to-end driving in challenging long-tail scenarios. arXiv preprint arXiv:2510.26125, 2025.

Yi Xu, Yuxin Hu, Zaiwei Zhang, Gregory P Meyer, Siva Karthik Mustikovela, Siddhartha Srinivasa, Eric M Wolff, and Xin Huang. Vlm-ad: End-to-end autonomous driving through vision-language model supervision. arXiv preprint arXiv:2412.14446, 2024a.

Zhenhua Xu, Yujia Zhang, Enze Xie, Zhen Zhao, Yong Guo, Kwan-Yee K Wong, Zhenguo Li, and Hengshuang Zhao. Drivegpt4: Interpretable end-to-end autonomous driving via large language model. IEEE Robotics and Automation Letters, 9(10):8186–8193, 2024b.

Kairui Yang, Enhui Ma, Jibin Peng, Qing Guo, Di Lin, and Kaicheng Yu. Bevcontrol: Accurately controlling street-view elements with multi-perspective consistency via bev sketch layout. arXiv preprint arXiv:2308.01661, 2023.

13

第 14 页

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, 和 Zhaoxiang Zhang. Neoverse: 利用野外单目视频增强 4D 世界模型. arXiv 预印本 arXiv:2601.00393, 2026.

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, 和 Hengshuang Zhao. Geniedrive: 迈向由 4D 占据栅格引导视频生成的物理感知驾驶世界模型. arXiv 预印本 arXiv:2512.12751, 2025.

Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等. Cogvideox: 具有专家 Transformer 的文生视频扩散模型. arXiv 预印本 arXiv:2408.06072, 2024.

Yining Yao, Xi Guo, Chenjing Ding, 和 Wei Wu. Mygo: 具有相机控制的连贯且可控的多视角驾驶视频生成. arXiv 预印本 arXiv:2409.06189, 2024.

Fisher Yu, Haofeng Chen, Xin Wang, Wenqi Xian, Yingying Chen, Fangchen Liu, Vashisht Madhavan, 和 Trevor Darrell. Bdd100k: 用于异构多任务学习的多样化驾驶数据集. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中, 第 2636–2645 页, 2020.

Mark Yu, Wenbo Hu, Jinbo Xing, 和 Ying Shan. Trajectorycrafter: 通过扩散模型重定向单目视频的相机轨迹. 在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision) 中, 第 100–111 页, 2025.

Wangbo Yu, Jinbo Xing, Li Yuan, Wenbo Hu, Xiaoyu Li, Zhipeng Huang, Xiangjun Gao, Tien-Tsin Wong, Ying Shan, 和 Yonghong Tian. Viewcrafter: 驯化视频扩散模型以实现高保真新视角合成. arXiv 预印本 arXiv:2409.02048, 2024.

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, 和 Shuo Li. Autodrive-r2: 激励 VLA 模型在自动驾驶中的推理和自我反思能力. arXiv 预印本 arXiv:2509.01944, 2025.

Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang. 深度特征作为感知度量的不合理有效性. 在 IEEE 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE conference on computer vision and pattern recognition) 中, 第 586–595 页, 2018.

Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen, Guan Huang, Xiaoyi Bao, 和 Xingang Wang. Drivedreamer-2: 大型语言模型增强的世界模型,用于多样化驾驶视频生成. 在 AAAI 人工智能会议论文集 (Proceedings of the AAAI Conference on Artificial Intelligence) 中, 第 39 卷, 第 10412–10420 页, 2025.

Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, 和 Alois Knoll. Opendrivevla: 迈向基于大型视觉-语言-动作模型 (VLA) 的端到端自动驾驶. 在 AAAI 人工智能会议论文集 (Proceedings of the AAAI Conference on Artificial Intelligence) 中, 第 40 卷, 第 13782–13790 页, 2026.

Zewei Zhou, Tianhui Cai, Seth Z Zhao, Yun Zhang, Zhiyu Huang, Bolei Zhou, 和 Jiaqi Ma. Autovla: 一种用于端到端自动驾驶的视觉-语言-动作 (VLA) 模型,具备自适应推理和强化微调能力. arXiv 预印本 arXiv:2506.13757, 2025.

14

第 15 页

A 数据集构建与划分

A.1 数据来源

我们从 NVIDIA PhysicalAI-Autonomous-Vehicles (PAV) (NVIDIA Corporation, 2025)、PandaSet (Xiao et al., 2021) 和 nuScenes (Caesar et al., 2020) 中整理驾驶视频日志,最终获得约 20 万个包含 41 帧的片段,涵盖约 5 万个场景。大多数训练片段来自 PAV,该数据集提供了多样化且大规模驾驶日志以及丰富的长尾驾驶场景。引入 PandaSet 和 nuScenes 旨在进一步提升传感器、相机、天气、场景布局和地点的多样性。每个训练样本包含 41 个连续帧。对于多视图数据源,我们使用前向相机作为观测条件视图,并使用其余目标车载相机作为外推视图合成的监督信号。对于 Waymo E2E (Xu et al., 2025),我们使用 OpenLongTail 在目标车载配置下合成缺失的视图。

表 4 数据来源及用途。我们主要从 PAV 整理大规模驾驶片段,并辅以 PandaSet 和 nuScenes 以增加相机和场景的多样性。Waymo E2E 仅用于外部单目源评估,从未用于训练。

| 来源 | 近似片段数量 | 规模 | 视图类型 | 片段长度 | 主要用途 | 划分规则 | | :— | :— | :— | :— | :— | :— | :— | | PAV (NVIDIA Corporation, 2025) | 200,000 | 多视图 | 41 帧 | 训练/测试/验证 | 场景 ID + 时间划分 | | PandaSet (Xiao et al., 2021) | 1,236 | 多视图 | 41 帧 | 训练/验证 | 场景 ID + 时间划分 | | nuScenes (Caesar et al., 2020) | 12,000 | 多视图 | 41 帧 | 训练/验证 | 场景 ID + 时间划分 | | Waymo E2E (Xu et al., 2025) | 1,000 | 前向视图 | 41 帧 | 仅测试 | 未用于训练 |

A.2 训练/测试划分协议

已知场景划分 (Seen-scenario split)。已知场景划分评估在训练期间观察到的场景内的时间泛化能力。对于给定的数据源片段,我们为训练和测试分配不相交的 41 帧时间窗口。例如,帧 0–40 可用于训练,而后续跨越帧 42–82 的窗口则保留用于测试。因此,测试片段与训练数据共享相同的场景 ID 和全局环境,确保模型在熟悉环境的严格未见帧上进行评估。

未知场景划分 (Unseen-scenario split)。未知场景划分评估对新颖场景的泛化能力。我们按场景 ID 划分数据,使得所有来自保留场景 ID 的片段均被排除在训练之外。这防止模型在微调过程中观察到相同的场景布局、相机轨迹或视觉外观。我们将此划分用于主要的外推视图评估。

Waymo E2E 划分。Waymo E2E (Xu et al., 2025) 用作外部源评估集。我们使用其前向视图视频作为输入,并使用 OpenLongTail 合成缺失的目标车载视图。没有任何 Waymo E2E 片段用于模型训练、验证、超参数调整或检查点选择。

B 跨多样化数据源的生成式扩展

OpenLongTail 旨在通过将异构视频转换为策略兼容的多视图资产来扩展长尾驾驶数据。在此设置下,生成式扩展不应被解释为简单地增加来自固定分布的样本数量。相反,它通过允许来自不同数据集、相机设置和采集协议的视频转换为共享的目标车载格式,从而扩展了可用的源池。这一点很重要,因为每个源自然带有其自身的分布偏差,包括道路拓扑、自车运动模式、交通参与者组成、临时交通控制提示以及相机视点。因此,添加外部源提供了互补的长尾多样性,而其下游贡献取决于其场景因素与目标评估分布的对齐程度。

Waymo E2E (Xu et al., 2025) 为生成式扩展提供了有用的外部源。OpenLongTail 将 Waymo 前向相机视频转换为目标相机车载配置下的策略兼容多视图资产,使得这些源外视频可用于下游 VLA 训练。除了定性转换质量外,我们还进一步评估转换后的资产是否在闭环长尾场景中提供实际训练益处。如图 9 所示,使用 OpenLongTail 生成的数据增强 Alpamayo R1 改善了 rollout

15

第 16 页

复杂路口场景中的分布差异

图7 复杂路口场景中的分布差异。我们比较了NVIDIA和Waymo数据中两种复杂路口模式的出现情况:临时路径重新分配(Temporary Path Reassignment),即路锥、封闭区域或临时路由提示覆盖标准车道标线;以及人工引导交通控制(Human-Directed Traffic Control),即工作人员或警察主动引导车辆行为。NVIDIA包含显著更高比例的这些长尾案例,而Waymo包含极少或没有此类示例。

图8 PAV(NVIDIA Corporation, 2025)中代表性的人工引导复杂路口示例。我们的长尾数据包括工作人员或警察使用标志或手势主动指挥交通的场景,要求策略遵循临时的人工引导,而不是仅依赖静态道路几何结构。这些人工引导案例在Waymo E2E(Xu et al., 2025)中 largely 缺失。

在几个代表性的长尾案例(包括不常见的车辆、骑行者和复杂路口)上的行为。使用NV和外部合成资产共同训练得到的模型,比基础模型产生了更具场景一致性的轨迹,这表明异构生成的数据可以扩展有用的长尾覆盖范围,而不仅仅是增加样本数量。

与此同时,这些增益自然地受到对齐条件的限制。为了更好地理解这种效应,我们分析了复杂路口类别,其中目标评估资产包含超出标准四向路口的几个细粒度场景因素。这些因素包括弯曲的道路几何结构、不规则的路口布局、标记较弱或由路锥 delineated 的可行驶路径,以及人工引导的交通控制场景,例如警察或建筑工人指挥交通。此类案例要求策略超越静态车道几何结构进行推理,并对临时、非标准的控制提示做出响应。图8可视化了来自PAV的代表性人工引导示例,其中自车必须响应临时的人工指令,而不是仅依赖静态车道几何结构。这些案例代表了一类重要的长尾监督信号,但在新增的Waymo数据源中 largely 缺失。

我们通过测量这些关键场景因素的覆盖范围,量化了NV与Waymo之间的源对齐情况。如图7所示,对于临时路径重新分配和标记较弱的复杂路口案例,NV子集包含671个示例,而Waymo E2E包含52个。对于人工引导的交通控制案例,NV子集包含62个示例,而Waymo E2E包含0个。这些统计数据显示,两个数据源在广泛的复杂路口标签内强调了不同的子分布。NV提供了更广泛的弯曲、路锥引导和人工引导案例的覆盖范围,而新增的Waymo子集相对更集中于具有规则车道结构的典型路口布局。

这一分析为生成式扩展提供了更精确的解释。OpenLongTail 允许通过使用目标刚性多视图资产将异构视频转换,从而利用外部数据集(如Waymo E2E (Xu et al., 2025))来扩展长尾训练池。然而,这些

第 17 页

正面视图 Alpamayo R1 Alpamayo R1 + NV Syn. Alpamayo R1 + NV/Ex. Syn.

罕见 车辆

骑行者

复杂 交叉路口

图9 生成式扩展在长尾场景下的闭环收益。我们将 Alpamayo R1 与由 NV 数据和 NV 及外部来源生成的 OpenLongTail 资产增强后的变体进行比较。在包括罕见车辆、骑行者和复杂交叉路口在内的代表性长尾案例中,添加生成资产改善了闭环 rollout 行为。使用额外 NV 和外部合成数据训练的策略生成的轨迹更好地遵循预期的可行驶走廊,并避免不安全交互。这表明生成式扩展不仅增加了数据量,还扩展了下游 VLA 训练有用的长尾覆盖率。

添加的来源在很大程度上取决于源类别的对齐情况。当外部源与目标评估切片共享关键因素时,它会产生直接的训练收益;当它强调不同的子分布时,它会扩大整体多样性,但对该特定切片的增益有限。最终,有效的长尾生成式扩展既需要强大的转换能力,也需要基于分布的源选择。

C 实现细节

C.1 生成模型微调

我们微调 Wan2.1-VACE-1.3B (Jiang et al., 2025c) 以作为我们的视频生成骨干网络。虽然 Wan VAE 保持冻结,但可训练参数严格限制为应用于 Wan-DiT/VACE 自注意力层的 LoRA 适配器,以及我们提出的条件模块:几何编码器、时间深度扭曲接口和记忆库模块。

Sigma 依赖记忆门。密集和语义记忆分支由噪声依赖门 $g_d(\sigma)$ 和 $g_s(\sigma)$ 调制,其中 $\sigma$ 表示流匹配噪声水平。这些门控制不同去噪阶段跨视图记忆注入的强度,使模型能够自适应地平衡语义上下文与空间对应关系。

在每个记忆层 $\ell$,门由一个轻量级的、层特定的 MLP 生成:

[g_d(\sigma), g_s(\sigma)] = Sigmoid(\psi_\ell(\sigma)), 其中 \psi_\ell= Linear2 \circ SiLU \circ Linear1. (11)

该 MLP 按样本进行评估,确保每个片段根据其自身的采样噪声水平接收条件门。输出门是范围在 (0, 1) 内的标量,并应用于其对应的密集和语义记忆更新。

我们将 $\psi_\ell$ 的最终投影初始化为零权重和负偏置,产生约 0.2 的初始门值。因此,记忆在训练初期充当弱残差路径,保留预训练 Wan-VACE 控制分支。由于这些门在六个记忆层之间不共享,每层可以独立学习不同的噪声依赖注入时间表。这种设计通过引入扩散时间依赖的记忆调制,扩展了零初始化 ControlNet 风格残差分支的稳定化原理。

17

第 18 页

表 5 生成模型微调配置。

| 项目 | 值 | | :— | :— | | 架构 | | | 骨干网络 | Wan2.1-VACE-1.3B | | VAE | 冻结的 Wan VAE | | Clip 长度 | 41 帧 | | 潜在分辨率 | 11 × 60 × 104 (T×H×W) | | 目标视角 | cross-left, cross-right, rear-left, rear-right, rear-tele | | 可训练模块 | LoRA 适配器 + 几何编码器 + 记忆库 | | LoRA 秩 / alpha | 32 / 16 | | LoRA 目标投影 | Wan DiT 和 VACE 块中的自注意力 {Q, K, V, O} | | 跨视图(记忆)层 | 30 个 DiT 层中的 {4, 9, 14, 19, 24, 29} | | 语义重采样器查询 | 64 | | 图门控初始化偏置 | −1.4 | | 优化 | | | 优化器 | AdamW(混合:新模块和 LoRA 的独立组) | | 学习率(新模块) | 1×10−5 | | 学习率(LoRA) | 1×10−5 | | 学习率调度器 | 带预热余弦调度,最小学习率比率 0.1 | | 预热步数 | 500 | | 总训练步数 | 20,000 | | 梯度裁剪 | 0.5 | | 全局批次大小 | 32 个 clips(32 块 GPU × 每 GPU 1 个 clip) | | 计算资源 | | | 训练 GPU | 32 × NVIDIA H200(4 个节点 × 8 块 GPU) | | 训练时间 | ∼96 小时 |

D 推理流程

算法 1 总结了推理过程。给定一个 41 帧的前视视频,OpenLongTail 首先恢复自车轨迹,估计深度,构建时间深度扭曲条件,编码目标相机的 Plücker 射线,然后以自回归拓扑顺序合成五个非前视视角。生成的视角被添加回跨视图记忆库,并用作后续目标相机的空间上下文。

E 评估协议

E.1 图像和视频保真度指标

我们报告 PSNR、SSIM、LPIPS、FID 和 FVD。PSNR、SSIM 和 LPIPS 是在将所有方法调整大小到相同的评估分辨率后,在生成的目标视角帧与相应的真实目标视角帧之间计算的。除非另有说明,这些指标是在整个目标相机图像上计算的。FID 是在评估分割中聚合的生成帧和真实帧上计算的。FVD 是在 41 帧的生成片段和真实片段上计算的。对于分布内结果,我们遵循 A.2 节中定义的 seen-scenario 分割,其中测试片段在时间上是保留的,但与训练数据共享场景 ID。

E.2 跨视图几何一致性

我们使用 GeoKPM 评估跨视图一致性,GeoKPM 是 Drive-WM (Wang et al., 2024b) 中使用的关键点匹配度量的几何感知变体。给定一个同步的生成视图对 $(\hat{I}_{t,a}, \hat{I}_{t,b})$,我们首先运行 LoFTR (Sun et al., 2021) 并保留高于固定置信度阈值的可靠匹配。令 $M(\hat{I}_{t,a}, \hat{I}_{t,b})$ 表示原始可靠匹配的数量,令 $M_{geo}(\hat{I}_{t,a}, \hat{I}_{t,b})$ 表示满足由已知相机内参、外参和恢复的自车姿态诱导的对极几何的这些匹配的子集。如果匹配在相应的基础矩阵下的 Sampson 误差低于固定阈值 $\tau_{epi}$,则认为该匹配在几何上是有效的。

我们将 GeoKPM 定义为几何上有效的生成匹配的比例:

$$ \text{GeoKPM} = \frac{1}{|S|} \sum_{(t,a,b) \in S} \frac{M_{geo}(\hat{I}_{t,a}, \hat{I}_{t,b})}{M(\hat{I}_{t,a}, \hat{I}_{t,b})} \times 100\%. \quad (12) $$

18

第 19 页

算法 1 从单段前视视频进行 OpenLongTail 推理 要求:前视视频 $x_{0:1:T}$,目标刚性结构 $R$,相机内参/外参 $(K, E)$,文本提示 $c_{\text{txt}}$,片段长度 $T=41$ 确保:合成的多视图展开 $\hat{X}_{R1:T}$ 1: 从 $x_{0:1:T}$ 恢复度量级自车轨迹 $\tilde{T}_{1:T}$ 2: 应用卡尔曼滤波和 RTS 平滑以稳定 $\tilde{T}_{1:T}$ 3: 使用冻结的深度模型估计前视深度 $D_{0:1:T}$ 4: 使用冻结的 Wan VAE 将前视视频编码为潜在变量 $z_0$ 5: 初始化记忆库 $M \leftarrow \{z_0\}$ 6: 定义目标视图依赖图:

$G^{(1)} = G^{(2)} = \{0\}, \quad G^{(3)} = \{0, 1\}, \quad G^{(4)} = \{0, 2\}, \quad G^{(5)} = \{0, 3, 4\}$.

7: 对于按拓扑顺序排列的目标视图 $v \in (1, 2, 3, 4, 5)$ 执行: 8: 根据 $(K_v, E_v, \tilde{T}_{1:T})$ 构建 Plücker 射线几何条件 $G_v^{\text{pl}}$ 9: 如果 $v \in \{1, 2\}$ 则 10: 从前视构建到目标视图 $v$ 的同帧深度扭曲 $W_{1:T}^v$ 11: 否则 12: 使用视图特定偏移 $\Delta_v$ 构建时间回溯深度扭曲 $W_{1:T}^v$ 13: 结束如果 14: 根据 $G^{(v)}$ 从 $M$ 中检索条件潜在变量 15: 构建密集记忆 $M_{\text{dense}}^v$ 和语义记忆 $M_{\text{sem}}^v$ 16: 使用姿态条件化的 Wan2.1-VACE 扩散模型采样目标潜在变量 $\hat{z}_v$ 17: 使用冻结的 Wan VAE 解码器将 $\hat{z}_v$ 解码为 RGB 视频 $\hat{x}_{v1:T}$ 18: 更新记忆库 $M \leftarrow M \cup \{\hat{z}_v\}$ 19: 结束循环 20: 返回 $\hat{X}_{R1:T} = \{x_{01:T}, \hat{x}_{11:T}, \dots, \hat{x}_{51:T}\}$

与仅测量 LoFTR 匹配数量的原始 KPM 不同,GeoKPM 衡量生成的对应关系是否与真实跨视图相机几何一致。这一区别很重要,因为诸如将前视图复制到目标视图之类的捷径解决方案可能会产生大量原始匹配,但这些匹配通常违反目标相机的对极约束。因此,GeoKPM 会对前视复制伪影进行惩罚,并提供对生成视图间几何一致性的更直接度量。

在我们的实验中,所有方法均使用相同的相机参数、恢复的自车位姿、输出分辨率、LoFTR 置信度阈值和对极阈值进行评估。我们使用 0.6 的 LoFTR 置信度阈值,并设置 $\tau_{\text{epi}} = 10$ 像素。

E.3 基线评估公平性

所有基线方法均在相同的输入前视视频、目标相机刚性结构、恢复的自车轨迹、输出分辨率和片段长度下进行评估。我们使用相同的扩散采样步数,不同方法均为 50 步。如果基线使用固定的公开推理调度,我们遵循其官方推理设置,并在计算指标之前将输出调整大小至统一的评估分辨率。测试时,没有任何方法可以访问额外的目标视图图像。

F 附加视图合成结果

F.1 分布内已知场景新视角评估

表 6 报告了分布内、已知场景的视图合成结果。交叉左和交叉右相机获得了最强的图像级保真度,其 PSNR 和 SSIM 更高,LPIPS 更低,优于后向相机。这是预期的,因为交叉视图与观察到的前视具有更强的空间重叠

第 20 页

表 6 分布内已知场景的新视角评估。遵循 A.2 节中的已知场景划分,我们评估了来自训练期间观察到的场景 UUID 的时间保持外推片段,并报告了针对目标摄像头的每视图生成保真度。

目标视图 PSNR ↑ SSIM ↑ LPIPS ↓ FID ↓ FVD ↓

Cross-left 15.33 0.563 0.505 127.86 127.58 Cross-right 14.80 0.526 0.521 133.95 123.24 Rear-left 13.73 0.511 0.627 142.23 115.31 Rear-right 12.68 0.462 0.625 149.98 121.56 Rear-tele 13.18 0.450 0.637 159.80 117.31

摄像头,使模型能够更直接地依赖于基于位姿的视觉证据。相比之下,Rear-left、Rear-right 和 Rear-tele 视图需要更大的视角外推,并且包含从前视图观察较弱或未观察到的区域,导致图像级相似度得分较低。

在后向视图中,Rear-tele 尤其具有挑战性,因为其较窄的视野和较大的方向变化使得外观重建对位姿和时间对齐误差更加敏感。尽管如此,FVD 得分在目标视图之间保持相对稳定,这表明生成的 41 帧片段即使在单帧图像保真度因更具外推性的摄像头而下降时,仍能保持合理的时间连贯性。总体而言,已知场景的结果表明,OpenLongTail 能够在熟悉场景几何结构下合成时间保持外推的目标刚性视图,同时也揭示了部分重叠的交叉视图与更具强外推性的后向视图之间预期的难度差距。

F.2 未知场景的额外定性结果

图 10、图 11 和图 12 提供了未知场景的额外定性结果。这些示例来自训练期间未观察到的场景 UUID,因此测试模型是否能够超越记忆的场景几何进行泛化。所选案例涵盖了多样化的视觉领域,包括植被茂密的秋季乡村道路、带有建筑物和停放车辆的住宅区,以及道路边界对比度低的积雪城市街道。在这些设置中,OpenLongTail 生成了合理同步的目标刚性视图,并保持了主要的场景结构,包括道路方向、路边布局、建筑物、植被和周围的交通上下文。

定性结果还突出了不同目标视图之间的不同难度水平。与观察到的前摄像头具有更强几何重叠的视图保留了更清晰的局部外观和更一致的道路边界。更具外推性的后向视图要求模型幻觉化更大的未观察区域,使得细粒度纹理恢复更加困难。尽管如此,生成的片段在 41 帧的时间范围内保持时间连贯性:静态背景元素与自车运动一致移动,道路几何结构保持稳定,车辆、房屋、树木和雪堆等大型物体未表现出严重的帧间漂移。

这些未知场景示例通过展示模型不仅提高了图像级指标,而且在有意义的域偏移下产生了视觉上可用的多视图资产,从而补充了定量 OOD 结果。特别是,积雪和住宅示例展示了对仅从前视图证据难以捕捉的外观变化的鲁棒性。总体而言,定性结果表明,OpenLongTail 可以将前视观察到的长尾驾驶视频转换为连贯的多摄像头片段,适用于下游策略微调与评估。

G 位姿恢复协议

用于数据生成和评估的位姿恢复模块遵循与主论文相同的协议。我们使用 MapAnything 从输入视频中恢复度量尺度的自车轨迹,然后应用前向卡尔曼滤波器和后向 Rauch–Tung–Striebel 平滑器。平滑后的轨迹一致地用于构建 Plücker-ray 几何结构、时间深度扭曲、目标刚性相机位姿以及下游策略输入。

我们报告了度量尺度和 Sim(3) 对齐的位姿评估。度量尺度评估保留了恢复轨迹的绝对尺度,并直接测量该方法是否提供了度量上有用的运动

20

第 21 页

+21 F

+41 F

+21 F

+41 F

+21 F

+41 F

图 10 未见场景下的额外定性时间新视角合成。我们展示了跨越不同道路布局、外观域和天气条件的代表性未见场景示例,包括乡村林荫道、住宅区和积雪的城市街道。每个示例展示了在 41 帧片段上合成的目标刚性视角,后续行对应于未来帧,如第 21 帧和第 41 帧。

用于视角合成和策略学习。Sim(3) 对齐评估在计算轨迹误差之前去除全局旋转、平移和缩放,因此专注于相对轨迹几何。这两种协议衡量不同的属性,不应作为同一指标直接比较。

H 下游 VLA 微调配置

H.1 策略骨干网络与输入构建

我们使用 Alpamayo-R1 (Wang et al., 2025c) 作为监督微调 (SFT) 的下游驾驶 VLA 骨干网络。遵循 Alpamayo-R1 的相机接口,每个策略输入由四个相机视图及其对应的自车运动信号构建而成。前视图像直接从原始视频中获取。前远视视图是通过对前视视图应用确定性视场角-Z 裁剪获得的,视场角为 30◦。交叉左视图和交叉右视图要么取自真实的多相机日志,要么由 OpenLongTail 在目标相机刚性结构下合成,具体取决于 SFT 配方。策略使用的自车运动是通过用于生成条件估计的相同自车轨迹模块恢复的。

21

第 22 页

表 7 两阶段 SFT 配置。第 1 阶段使用轨迹 token 预测目标训练 VLM,而第 2 阶段注入第 1 阶段的 VLM 检查点,并在冻结 VLM 的情况下仅训练扩散专家。

| 参数 | 第 1 阶段 | 第 2 阶段 | | :— | :— | :— | | 骨干网络 | Alpamayo-R1-10B | Alpamayo-R1-10B + 第 1 阶段 VLM 替换 | | 配置文件 yaml | sft_stage1 | sft_stage2 | | 损失函数 | 轨迹 token CE | Flow-matching | | 可训练参数 | 完整 VLM | 仅扩散专家 | | VLM 协同训练 | – | cotrain_vlm=false | | 第 1 阶段检查点注入 | – | model.stage1_vlm_checkpoint_path | | 轮数 (Epochs) | 3 | 3 | | 总步数 | 1,149 | 4,593 | | 每轮步数 | 383 | 1,531 | | GPU | 8× H200 | 8× H200 | | 每设备训练批次大小 | 1 | 1 | | 梯度累积步数 | 4 | 1 | | 全局批次大小 | 8 × 1 × 4 = 32 | 8 × 1 × 1 = 8 | | 每轮样本数 | ≈12,256 | ≈12,248 | | 精度 | bf16 | bf16 | | DeepSpeed | ZeRO-2 | none | | 梯度检查点 | ✓ | – | | 学习率 | 1 × 10−5 | 1 × 10−4 | | 学习率调度器 | 带最小学习率的余弦预热 | 带最小学习率的余弦预热 | | 最小学习率 | 1 × 10−6 | 1 × 10−6 | | 预热步数 | 500 | 100 |

表 8 下游 VLA SFT 数据组成。所有变体在相同的优化和相机输入协议下对 Alpamayo-R1 进行三轮微调。配方之间的区别仅在于用于 SFT 的额外训练数据。GT 表示真实多视图数据,Syn 表示 OpenLongTail 合成的多视图资产。

| 配方 | 10K Rand | NV-OOD GT | NV-OOD Syn | Waymo-E2E GT | Waymo-E2E Syn | 目的 | | :— | :—: | :—: | :—: | :—: | :—: | :— | | Base Alpamayo-R1 | | | | | | 无额外 SFT 基线 | | Base Alpamayo 1.5 | | | | | | 无额外 SFT 基线 | | 10K nominal SFT | ✓ | | | | | 名义数据适应基线 | | NV-OOD GT SFT | | ✓ | | | | 真实 NV 长尾上限比较 | | NV-OOD Syn SFT | | | ✓ | | | 评估来自 PAV/NV 源的合成 NV 长尾资产 | | GT long-tail mixture | ✓ | ✓ | | ✓ | | 评估 NV+Waymo 真实长尾 SFT | | Syn long-tail mixture | ✓ | | ✓ | | ✓ | 评估 NV+Waymo OpenLongTail 生成的 SFT |

此协议确保所有 SFT 变体使用相同的策略架构、相机接口、动作格式和评估环境。变体之间的唯一区别是额外训练数据的组成,以及非前视视图是真实多视图观测还是 OpenLongTail 合成的视图。

我们对 Alpamayo-R1-10B (Wang et al., 2025c) 使用两阶段 SFT 策略。第 1 阶段使用 sft_stage1 以轨迹 token CE 损失训练完整 VLM,共 3 轮,总计 1,149 步,在 8 块 H200 GPU 上全局批次大小为 32。第 2 阶段通过 model.stage1_vlm_checkpoint_path 加载第 1 阶段的 VLM 检查点,使用 cotrain_vlm=false 冻结 VLM,并使用 sft_stage2 以 flow-matching 损失仅训练扩散专家。该阶段运行 3 轮和 4,593 步,全局批次大小为 8。两个阶段均使用 bf16 精度和带最小学习率 1 × 10−6 的余弦预热调度;第 1 阶段使用 1 × 10−5 的学习率,并采用 ZeRO-2 和梯度检查点,而第 2 阶段使用 1 × 10−4 的学习率,不使用 DeepSpeed。

H.2 SFT 数据组成

我们对每种 SFT 配方对 Alpamayo-R1 进行三轮微调。所有配方使用相同的优化设置,仅在额外训练数据混合方面有所不同。名义数据由 10K 个随机采样的驾驶轨迹组成。长尾数据包括 PAV (NVIDIA Corporation, 2025) 长尾片段和 Waymo E2E (Xu et al., 2025) 片段。对于每个长尾来源,我们考虑真实多视图数据(如果可用)和 OpenLongTail 合成的多视图资产。

对于 GT 配方,目标视图来自同步校准的多摄像头日志。对于 Syn 配方,目标视图由 OpenLongTail 使用相同的目标刚性相机协议,从相应的前视视频中合成。这种设计隔离了合成多视图长尾资产的影响,同时保持策略接口和 SFT 过程固定。

22

第 23 页

H.3 AlpaSim 闭环评估

AlpaSim 仿真环境。我们使用 AlpaSim 作为 photorealistic(照片级真实感)闭环仿真环境,用于评估端到端自动驾驶策略。与针对固定记录观测值测试策略的开环评估不同,AlpaSim 在每个 rollout 步骤中,根据策略当前的仿真自车状态重新渲染传感器输入。因此,策略能够观察到自身行为的后果,从而在逼真的视觉条件下评估累积误差、恢复行为、驶离道路、车道错误驾驶、碰撞以及路线进度。

场景资产构建。AlpaSim 将真实世界的驾驶日志转换为可复用的仿真资产。从同步的多摄像头数据、标定参数、自车位姿、目标轨迹和地图信息开始,该流程首先将所有传感器数据和轨迹归一化到共享的世界坐标系中。随后,使用 NuRec 将场景重建为神经 3D 资产,通常以 3D Gaussian Splatting(3D 高斯溅射)表示。这种表示法保留了高保真的外观,如路面纹理、车道标线、植被、建筑物、标志和施工元素,同时支持从与原始记录轨迹不同的自车位姿进行高效的视角合成渲染。

除了视觉 3DGS 场景外,每个资产还包含显式的驾驶结构,包括地面网格、可行驶表面、车道几何、道路边界、路线信息和动态目标轨迹。地面网格和地图层为仿真器提供了可解释的几何信息,用于碰撞检测、驶离道路检测、车道合规性检查和进度测量,而神经重建则为策略提供逼真的相机观测。这种分离使得 AlpaSim 能够将照片级真实感渲染与可靠的闭环评估指标相结合。

闭环渲染与视角合成。在仿真过程中,AlpaSim 维护自车状态,将虚拟相机架放置在相应的位姿,并查询神经渲染器以合成当前的多摄像头观测值。驾驶策略接收这些渲染图像并输出动作或未来轨迹。随后,仿真器通过车辆动力学或轨迹跟随模型更新自车状态,并重复该过程。由于下一次观测取决于策略的前一个动作,AlpaSim 并非简单的数据集回放;它是一个闭环环境,随着策略偏离轨迹,视觉反馈会发生变化。

视角合成是实现这一反馈循环的关键机制。由于自车可能会移动到原始日志中未观测到的位姿,AlpaSim 使用重建的 3DGS 场景从任意邻近视角渲染照片级真实的相机视图。这对于评估 VLA 驾驶模型尤为重要,因为 VLA 模型依赖于图像级线索,如车道标线、交通锥、标志、工人、警察、遮挡物和不规则的道路交叉口布局。因此,AlpaSim 提供了一个逼真的下游测试平台,用于衡量生成的长尾多视图数据是否改善了实际的闭环驾驶行为。

23

第 24 页

左前侧 正前方(GT) 右前侧 右后侧 后视(Tele.) 左后侧

图 11 长尾驾驶场景在首帧的定性多视图生成结果。每一行对应一个数据样本,每一列按顺序展示生成的相机视角:左、前、右、右后、后、左后。

24

第 25 页

左前 前(GT) 右前 右后 后视(Tele.) 左后

图 12 长尾驾驶示例在最后一帧的定性多视图生成结果。每一行对应一个数据示例,每一列按顺序显示一个生成的相机视角:左、前、右、右后、后和左后。

25

发表评论