三分钟导读:SafeGen提出了一种目标条件扩散框架,通过VLM推理识别潜在脆弱性并定义灾难性终点状态,进而生成物理合理且时间连贯的安全关键视频,以评估和提升VLMAD系统的安全性。
英文题目:SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving
论文出处:arXiv 每日论文精选 · arXiv:2607.19701
原始论文:PDF / 论文页面
对应视频标题:SafeGen:用VLM逆向推理生成安全关键视频,测试自动驾驶模型极限|推荐指数:★★★★★
这篇论文解决什么问题?
现有基于模拟器(simulator-based)的安全关键场景生成方法存在显著的sim-to-real gap,难以捕捉真实世界中复杂、多样且不可预见的人车交互动态,导致对VLMAD的安全评估不足。
核心创新
- 将安全关键场景生成重构为边界条件(首帧与灾难性终点)的状态演化问题,而非传统的正向预测。
- 提出Context Grounded End State Reasoning,利用VLM进行逆向推理以发现时空依赖中的潜在脆弱性,并生成结构化的终点状态规范。
- 提出End State Conditioned Video Evolution,结合深度感知投影和迭代潜在修复(latent inpainting),将语义威胁转化为物理上合理的视觉动态。
方法概览
提出SafeGen框架,包含两个核心模块:1) Context Grounded End State Reasoning:利用VLM结合深度和分割先验分析良性视频,识别潜在脆弱性并定义包含VRU特征、插入区域和场景演变的灾难性终点状态规范;2) End State Conditioned Video Evolution:基于终点状态规范,通过深度感知几何投影将VRU插入场景,并利用边界条件视频扩散模型(FLF2V)从良性首帧插值生成至对抗性末帧,确保运动连贯性和物理合理性。
逐图理解论文
方法概览:SafeGen框架

SafeGen提出了一种目标条件扩散框架,核心在于将安全关键场景生成重构为边界条件状态演化问题。该框架包含两个模块:利用VLM结合深度和分割先验分析良性视频,识别潜在脆弱性并定义灾难性终点状态规范,进而生成物理合理的对抗性视频。
实验设置与对抗有效性

在nuScenes数据集上生成850个安全关键场景,评估Dolphins、DriveLMM-o1和EM-VLM4AD三个VLMAD模型。结果显示,SafeGen生成的场景显著降低了模型的感知对齐和规划合规性,JOS平均提升24.25%,证明其对抗有效性。
定性分析:语义与物理一致性

定性分析显示,生成的对抗性行人保持与环境的强语义对齐,自然调整衣着、位置和运动以融入复杂环境。由于入侵视觉合理且物理 grounded,模型难以在碰撞不可避免前识别其轨迹,从而绕过初始异常检测。
场景质量:运动学与视觉指标

场景质量评估显示,TTC压缩至0.5秒以下,DRAC达到15-20 m/s²,体现高运动学紧迫性。视觉保真度方面,FID和FVD指标表现良好,且场景在建筑、雨天等不同条件下具有高度语义多样性。
消融实验:条件机制与VLM选择

消融实验验证了边界条件机制和VLM推理模块的鲁棒性。FLF2V相比F2V在JOS上表现更优,且不同VLM的选择显著影响终点规范的质量,进而影响生成场景的对抗有效性,证实了逆向推理模块的关键作用。
实验与关键结果
- 在nuScenes数据集上生成850个安全关键场景,评估3个VLMAD模型(Dolphins, DriveLMM-o1, EM-VLM4AD)的对抗有效性。
- 评估生成场景的运动学紧迫性(TTC, DRAC)、视觉保真度(FID, FVD)和语义多样性。
- 消融实验:验证边界条件机制(F2V vs FLF2V)和VLM推理模块的鲁棒性。
- 下游任务:使用SafeGen生成的数据微调Dolphins模型,并在VRU-Accident基准上评估性能提升。
- 人类评估:通过沉浸式模拟器进行人机回路(HITL)研究,评估场景的真实感和威胁强度。
- JOS平均提升24.25%(第 1 页)
- JOS在Dolphins上达到9.03,DriveLMM-o1上7.96,EM-VLM4AD上9.61(第 6 页)
- 感知对齐(PA)平均降低65.38%(第 7 页)
- 规划合规性(PC)平均降低62.59%(第 7 页)
- TTC压缩至0.5s以下,DRAC达到15-20 m/s²(第 7 页)
- 微调后Dolphins在VRU-Accident上准确率平均提升15.9%(第 8 页)
- 人类评估中SafeGen在威胁真实感评分上显著高于ScenGE(第 9 页)
阅读时需要注意
- 当前框架主要关注单 Agent(VRU)交互,未来工作需扩展至 Multi-Agent交互。
- 下游微调实验仅在一个模型(Dolphins)和一个数据集(VRU-Accident)上验证,泛化性需进一步考察。
- 生成的视频具有高度逼真性和威胁性,可能被用于恶意目的,需负责任地使用。
- 评估指标JOS依赖于VLM Judge,其主观性可能影响评估结果的绝对一致性。
关联工作
- Learning-to-Collide (LC):基线方法,基于强化学习的碰撞场景生成(第 6 页)
- AdvSim (AS):基线方法,基于梯度自由搜索的对抗场景生成(第 6 页)
- Adversarial Trajectory Optimization (AT):基线方法,基于轨迹优化的对抗场景生成(第 6 页)
- ScenGE:基线方法,结合LLM语义推理与 Multi-Agent协作优化的场景生成(第 6 页)
- Dolphins:被评估的VLMAD模型之一(第 6 页)
- DriveLMM-o1:被评估的VLMAD模型之一(第 6 页)
- EM-VLM4AD:被评估的VLMAD模型之一(第 6 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
SafeGen:面向基于视觉语言模型的自动驾驶的安全关键场景目标条件视频扩散
Jiangfan Liu Zexuan Cui Tianyuan Zhang 北京航空航天大学,中国 北京航空航天大学,中国 北京航空航天大学,中国 liujiangfan@buaa.edu.cn zxtsui@bjfu.edu.cn zhangtianyuan@buaa.edu.cn
Zonglei Jing Zonghao Ying Yaoyuan Zhang 北京航空航天大学,中国 北京航空航天大学,中国 北京航空航天大学,中国 raykr@buaa.edu.cn yingzonghao@buaa.edu.cn yaoyzhang@buaa.edu.cn
Jiakai Wang Xiaoqi Jiang Aishan Liu∗ 中关村实验室,中国 奇瑞汽车股份有限公司,中国 北京航空航天大学,中国 wangjk@mail.zgclab.edu.cn jiangxiaoqi1@mychery.com liuaishan@buaa.edu.cn
Xianglong Liu 北京航空航天大学,中国 中关村实验室,中国 xlliu@buaa.edu.cn
2026 摘要 [对抗性场景描述] … A一名行人正从左向右高速奔跑穿过道路… 视觉语言模型 (VLMs) 正越来越多地部署于自 VLM 加速,身体前倾… Benign Video (良性视频) [对抗性 VRU 描述]Jul 动驾驶 (AD) 系统中,这迫切需要在罕见但安全 orous safety evaluation under rare yet safety-critical scenarios. Adulthair, male,slightlyEasttexturedAsian, ⋯Neaton top withblack… short Among these, interactions with vulnerable road users (VRUs), such [ScenarioThis is a daytimeUnderstanding]urban [对抗性 VRU 放置]22 street scene. The 接近自车道中心 … as pedestrians, represent a major source of real-world failures. How- background features lush … ever, existing safety-critical scenario generation methods predomi- Depth & Visual Analysis (深度与视觉分析) nantly rely on simulator-based pipelines, which suffer from a sub- stantial sim-to-real gap and often fail to capture realistic, diverse, and unforeseen human–vehicle interaction dynamics. To address this, we present SafeGen, a goal-conditioned diffusion framework[cs.CV] for safety-critical scenario generation in vision-language model- … Catastrophic End-State (灾难性终态) based autonomous driving systems (VLMADs). Our key insight is Safety-Critical Video (安全关键视频) to formulate scenario generation as a goal-conditioned diffusion process, where a predefined catastrophic end-state (e.g., a collision Figure 1: Given a benign driving video, SafeGen can synthe- with a pedestrian) serves as a strong supervisory signal, guiding the size a physically plausible and temporally coherent safety- generation of temporally coherent video trajectories that naturally critical scenario video for VLMAD evaluation. evolve toward safety-critical outcomes. Building on this formula- tion, we introduce Context Grounded End State Reasoning, which leverages VLMs to analyze benign driving contexts and in- improves performance in real-world driving scenes by an average fer latent vulnerabilities in human–vehicle interactions, producing of 15.9%. Our code is available at https://github.com/JoFrc/SafeGen. structured end-state specifications that induce high-risk scenar- ios. Conditioned on these targets, we further propose End State CCS Concepts (CCS 概念) Conditioned Video Evolution, which grounds semantic threats • Security and privacy →Social aspects of security and pri- into physically plausible visual dynamics. Specifically, we instanti- vacy; • Computing methodologies →Scene understanding. ate high-risk agents (e.g., VRUs) within the scene via depth-aware geometric projection, followed by boundary-conditioned diffusion KeywordsarXiv:2607.19701v1 to generate intermediate frames with consistent motion patterns Safety-Critical Scenario Generation (安全关键场景生成), Autonomous Driving (自动驾驶) and temporal coherence. Extensive experiments across 3 VLMADs demonstrate that SafeGen increases the Judge Overall Score, a 1 引言 metric using a VLM judge to evaluate VLMADs’ understanding and decision-making, by 24.25% on average compared to SoTA baselines. 随着视觉语言模型 (VLMs) 的广泛部署, Furthermore, fine-tuning a VLMAD with SafeGen-generated data 其在复杂开放世界环境中进行复杂推理和决策的 making in complex, open-world environments is rapidly advancing ∗The corresponding author. autonomous driving (AD) systems [11, 13, 19]. These VLMADs
第 2 页
MM ’26, 2026年11月10日–11月14日, 巴西里约热内卢 Jiangfan Liu 等
利用海量的多模态知识来解释细微的交通语义并导航不可预测的城市场景。部署这些系统需要对安全关键场景进行广泛的评估 [7, 14, 20],特别是涉及人类与车辆交互以及弱势道路使用者 (VRU) 的场景。由于 VRU 表现出高度非线性的行为和复杂的意图,生成多样化、高保真的安全关键场景不仅是一个测试要求,更是确保 VLMAD 在高风险、边缘案例条件下可靠性的基本前提。然而,现有方法 [4, 5, 18, 22, 25] 主要依赖基于模拟器的流水线,这难以克服显著的“仿真到现实”(sim-to-real)差距,从而限制了其有效性。合成纹理和简化的物理模型无法捕捉现实世界的视觉复杂性,而受限于预定义机动模板和刚性模拟器动力学的 Agent无法复制不可预测的人车交互。因此,这种受限环境产生的评估数据既不能反映真实性,也无法捕捉未预见的人车冲突。
• 我们引入了 SafeGen,这是一个目标条件扩散框架,通过将场景生成重构为进化过程来生成安全关键场景视频。 • 我们提出了一种流水线,结合上下文锚定终点状态推理(Context Grounded End State Reasoning)以发现脆弱性,以及终点状态条件视频进化(End State Conditioned Video Evolution)以生成运动学一致、时间连贯的视频。 • 广泛的评估表明,SafeGen 能有效暴露安全缺陷,与基线方法相比,平均将裁判总体得分 (JOS) 提高了 24.25%。
为了解决这些问题,我们提出了 SafeGen,这是一个目标条件扩散框架,将安全关键场景视频合成表述为边界条件状态进化问题。通过在良性起始状态和特定对抗性终点状态之间约束生成,该框架将合成建模为目标条件扩散生成问题。该框架首先提出 ❶上下文锚定终点状态推理,通过在动态交通场景中建模时空依赖关系来识别潜在脆弱性。在此阶段,VLM 对交通上下文进行高层语义推理,并识别高风险因素,如遮挡区域。包含提取出的因素的具体帧随后被定义为关键最后一帧。VLM 然后针对该最后一帧构建对抗性规范,在保持场景级合理性和逻辑连贯性的同时最大化碰撞风险。基于此,我们引入了 ❷终点状态条件视频进化,它通过物理基础的生成将抽象语义威胁转化为高保真视觉证据。以对抗性终点状态作为几何锚点,SafeGen 合成逼真的 VRU,并通过深度感知投影和迭代潜在图像修复将其集成到场景中,确保与 3D 几何结构和环境光照的一致性。最后,使用非对称策略,SafeGen 在边界约束下进行边界条件扩散生成,以强制执行严格的运动学对齐,从而生成从正常驾驶状态平滑演变为指定灾难性结果的合成视频。
在 3 个代表性 VLMAD 上的广泛实验证明了 SafeGen 的卓越有效性,与最先进基线相比,其平均将裁判总体得分 (Judge Overall Score) 提高了 24.25%,暴露了 VLMAD 推理和规划模块中的关键脆弱性。此外,对合成视频的人工验证表明,其威胁程度和视觉保真度相当高,表明这些机器生成的风险对经验丰富的驾驶员构成了根本性的安全挑战。最后,在 SafeGen 生成的数据上微调 VLMAD 使真实场景中的性能提高了 15.9%,有效地通过高影响力的边缘案例扩充了训练分布,这对于在不可预见的环境中生存至关重要。我们的贡献如下:
2 相关工作
2.1 生成视频合成
最近的视频扩散模型可以通过基于初始状态生成未来帧来预测驾驶场景。研究人员将这种设置称为首帧到视频 (First-Frame-to-Video, F2V) [2],其中模型仅使用第一帧并采样场景的合理延续。尽管 F2V 对于开放式预测是有效的,但它对终端结果的控制有限。因此,可靠地合成罕见的安全关键事件(例如特定碰撞)仍然很困难,因为随机采样可能会产生不同的终点状态。首尾帧到视频 (First-Last-Frame-to-Video, FLF2V) 通过同时对第一帧和最后一帧进行条件约束扩展了这一表述 [21, 27]。在我们的术语中,F2V 和 FLF2V 分别是具有 1 个和 2 个边界锚点的边界条件变体。在 FLF2V 中,中间帧通过边界条件扩散采样生成,产生满足显式边界约束的时间连贯视频。
2.2 安全关键场景生成
传统的安全关键场景生成主要基于模拟器,其中通过控制 Agent和改变环境参数来挖掘具有挑战性的边缘案例。现有流水线通常采用基于优化的搜索来升级威胁,演化出多种技术:强化学习 [6]、无梯度方法 [22] 和基于梯度的轨迹优化 [28],以及最近结合 LLM 驱动的语义推理与 Multi-Agent协同优化的方法 [18]。虽然这种范式提供了强大的可控性并有效地对特定模块进行压力测试,但它本质上存在源于模拟器 [8, 16] 局限性的“仿真到现实”差距,例如合成纹理、简化的传感器伪影和受限的机动模板。因此,这些基于模拟器的方法难以充分捕捉现实交通中依赖于上下文的视觉复杂性。同时,最近的生成世界模型 [10, 24] 优先考虑视觉真实性和通用场景合成,而非明确的安全关键威胁升级,在评估驾驶模型是否面临新兴的高保真危害方面留下了空白。因此,它们与本工作解决的核心问题并不直接对齐。
比较。我们的框架在三个关键方面与先前的工作不同:❶动机。基于模拟器的方法主要旨在在预定义机动下对特定模块进行压力测试,而 SafeGen 旨在通过合成意外的人车交互来针对 VLMAD 中的高层语义推理脆弱性。❷技术实现。SafeGen 不依赖参数化动作空间,而是使对抗性意图得以演化
第 3 页
自然。❸性能。通过将对抗性VRU以照片级真实感注入现实世界的良性视频中,SafeGen产生了更多样化和真实的故障模式。
$$ s = \{\Phi_{sce}, \Phi_{adv}, \Phi_{pos} \mid \hat{T}\} \quad (3.1) $$ $$ = f_{vlm}(V, \{f_{dep}(I_t)\}_{t=0}^T, \{f_{seg}(I_t)\}_{t=0}^T). $$
3 方法论
3.1 问题定义
令 $s = \{\Phi_{sce}, \Phi_{adv}, \Phi_{pos} \mid \hat{T}\}$ 表示灾难性终态规范,该规范源自良性驾驶视频 $V = \{I_t\}_{t=0}^T$。此终态规范 $s$ 包含以下内容的描述:❶安全关键场景的演化过程 $\Phi_{sce}$,❷VRU特征 $\Phi_{adv}$,以及❸插入区域 $\Phi_{pos}$。这些元素均受选定的关键最后一帧 $\hat{I}_{\hat{T}}$ 条件约束,其中 $\hat{T} \in (0, T]$。
为了确定这一关键最后一帧 $\hat{I}_{\hat{T}}$,VLM $f_{vlm}$ 分析良性驾驶视频序列 $V$,以确定最可能发生灾难性终态的位置。这种语义推理由来自深度估计模型 $f_{dep}$ 和分割模型 $f_{seg}$ 的空间和实例级先验进行物理 grounding。
该过程涉及在选定最后一帧 $\hat{I}_{\hat{T}}$ 处对推理出的灾难性终态规范 $s$ 中的3个核心组件进行具体实例化。安全关键场景描述 $\Phi_{sce}$ 描述了威胁从良性初始状态演化到定义好的灾难性终态的过程,明确指定了对抗性 Agent的意图、运动模式和碰撞动力学。VRU特征描述 $\Phi_{adv}$ 定义了对抗实体的视觉和语义属性,详细说明了合成照片级真实感且上下文适宜威胁所需的细微特征。最后,目标区域 $\Phi_{pos}$ 指定了一个局部化的候选搜索区域,定义了场景内的特定高风险空间边界,明确缩小了后续最优插入对抗性 Agent的搜索空间。
基于已建立的规范 $s$,SafeGen 合成安全关键视频序列 $\hat{V} = \{\hat{I}_t\}_{t=0}^{\hat{T}}$,保持第一帧为 $\hat{I}_0 = I_0$。具体而言,扩散模型 $f_{sd}$ 首先根据 $\Phi_{adv}$ 条件生成对抗性特征 $A_{adv}$,随后利用相机内参矩阵 $K$ 对其进行缩放。为了确保物理合理性,我们将空间搜索限制在指定目标区域 $\Phi_{pos}$ 与有效平面地面表面 $M_{ground}$ 的交集内。在此局部区域内,我们通过评估估计的深度信息和自车速度 $v_{ego}$ 来确定最优插入坐标 $P_{adv}$,以最大化交互威胁水平。然后将视觉特征 $A_{adv}$ 和空间坐标 $P_{adv}$ 无缝集成,以构建高度逼真的对抗性最后一帧 $\hat{I}_{\hat{T}}$。最后,在场景描述 $\Phi_{sce}$ 的引导下,边界条件视频扩散模型 $f_{vd}$ 插值中间动力学过程。该模型生成一个时间连贯的序列,从良性第一帧 $I_0$ 平滑演化至合成的对抗性最后一帧 $\hat{I}_{\hat{T}}$,从而产生完整的安全关键场景视频 $\hat{V}$。我们提出的 SafeGen 概览如图2所示。
3.2 上下文锚定的终态推理
给定良性驾驶视频 $V = \{I_t\}_{t=0}^T$,SafeGen 首先通过提取物理和语义先验来构建场景上下文。为此,我们采用深度估计模型 $f_{dep}$ 和分割模型 $f_{seg}$ 处理 $V$,生成深度图 $\{f_{dep}(I_t)\}_{t=0}^T$ 和视觉提示 $\{f_{seg}(I_t)\}_{t=0}^T$。这些空间和语义先验促进了从2D像素观察到3D物理理解的转变,显著增强了标准VLM的推理能力。利用这种丰富的上下文,上下文锚定的终态推理采用VLM $f_{vlm}$,通过分析视频序列来推理潜在的人车交互威胁,从而识别出特定的关键帧 $\hat{I}_{\hat{T}}$,在该帧处发生灾难性终态 $s$ 的可能性极高。在深度和分割先验的引导下,$f_{vlm}$ 有效地解析道路拓扑,评估可导航空间,并系统地扫描易发生交互冲突的候选区域。这确保了所识别的威胁在物理上是合理的且具有高度威胁性,最终产生灾难性终态规范:
与通常默认安全、高概率轨迹的标准前向预测不同,我们的方法显式地引入潜在脆弱性。与其从当前条件投射不确定的未来,我们确定性地锚定预定义的灾难性终态于关键帧 $\hat{I}_{\hat{T}}$。作为强大的监督信号,此锚点使框架能够进行反向推理,并产生诱导高风险场景的结构化终态规范 $s$。最终,上下文锚定的终态推理将抽象的脆弱性转化为显式的空间和语义约束,为生成自然演化至安全关键结果的、物理上合理且时间连贯的视频提供蓝图。
3.3 终态条件视频演化
基于已建立的灾难性终态规范 $s$,SafeGen 利用文本到图像 (T2I) 扩散模型 $f_{sd}$,根据VRU描述 $\Phi_{adv}$ 条件合成初始对抗性特征。这一生成阶段将抽象的语义属性转化为高保真度的视觉表示。关键在于,扩散模型确保合成实体拥有真实的纹理、适当的结构姿态以及与整体场景 $\Phi_{sce}$ 规定的碰撞动力学严格一致的视觉特征。为了促进无缝的物理集成到目标3D环境中,我们随后对生成的输出执行精确的前景分离。此隔离过程系统地去除无关的背景伪影,最终生成精炼的、无背景的对抗性特征 $A_{adv}$,为下游的空间对齐做好准备。
为了确定确切的最优插入坐标 $P_{adv}$,我们无缝地将语义推理与物理约束联系起来。我们首先利用局部候选搜索区域 $\Phi_{pos}$。在此特定的空间边界内,我们评估相应的深度图 $f_{dep}(\hat{I}_{\hat{T}})$ 以识别表现出低深度变化的平面区域。这定义了一个空间约束集 $M_{ground}$,代表有效的、可行驶的地面表面。为了最大化交互威胁水平,我们通过选择此交集中使碰撞时间 (TTC) 最小化的确切空间坐标来最终确定 $P_{adv}$。
第 4 页
MM ’26, 2026年11月10日–11月14日, 巴西里约热内卢 Jiangfan Liu 等
上下文锚定的终态推理 推理 灾难性终态规范
VLM 道路拓扑解析 [对抗性 VRU 描述] 成年男性, 东亚裔, ⋯ Φadv 良性视频 可通行空间评估 深灰色飞行员夹克 ⋯
[对抗性 VRU 放置] 候选区域扫描 深度图 行人应靠近自车道中心 Φpos 且靠近底部(在地面上)。 深度估计模型 末帧选择 [对抗性场景描述] & 潜在威胁识别 一名行人正在奔跑……向左侧跑来……专注于穿越车道…… Φsce 分割模型 视觉提示 终态条件视频演化
前景 良性 Φadv 分离 𝐀adv 首帧 视频 Φsce 文生图 高保真视觉 对抗性 扩散模型 表示 Portraitx 场景 多轮 最优插入 修复 扩散 𝐏adv 模型 Φpos <最大> 交互威胁等级 对抗性 <最小> 碰撞时间 末帧 安全关键 插入坐标
图 2: 所提出的 SafeGen 框架概述,用于安全关键场景视频生成。
该空间优化过程表述为: 3.4 系统性生成工作流 𝑓𝑑𝑒𝑝(Î𝑇)(P) SafeGen 的系统性生成工作流首先利用深度估计 P𝑎𝑑𝑣= arg min , (3.2) 模型 𝑓𝑑𝑒𝑝 和分割模型 𝑓𝑠𝑒𝑔 提取物理和语义先验,将良性驾驶视频 V 转换为安全关键场景视频 V̂。 𝑣𝑒𝑔𝑜 P∈Φpos∩Mground 在此丰富上下文的条件下,VLM 𝑓𝑣𝑙𝑚 在逆向模拟范 式下进行推理,以识别包含潜在威胁的关键帧 Î𝑇,该帧随后被指定为对抗性 其中 𝑓𝑑𝑒𝑝(Î𝑇)(P) 提取空间坐标 P 处的局部深度值,𝑣𝑒𝑔𝑜 代表自车速度。利用无背景肖像 𝐀𝑎𝑑𝑣 和由相机内参矩阵 K 推导出的空间几何信息,我们将对抗实体显式投影到优化点 P𝑎𝑑𝑣 上。随后,我们在选定的关键帧 Î𝑇 上执行多轮修复过程。这种迭代操作确保了环境光照、阴影和颜色分布的物理一致性,最终构建出高度逼真的对抗性末帧 Î̂𝑇。
利用由良性首帧 I0 和合成的对抗性末帧 Î̂𝑇 牢固确立的时间边界,我们采用边界条件视频扩散模型 𝑓𝑣𝑑 来插值对抗性交互的动态进展。在总体安全关键场景描述 Φsce 的指导下,这种目标条件生成形式化为: V̂ = {Î𝑡}ˆ𝑇𝑡=0 (3.3) = 𝑓𝑣𝑑(I0, Î̂𝑇| Φsce). 视频扩散模型处理这些结构边界和语义条件,以生成中间帧,从而形成完整的安全关键场景视频 V̂。这种演化式生成在整个序列中保持严格的时间一致性和物理上合理的人车交互。
To instantiate this threat, a text-to-image diffusion model 𝑓𝑠𝑑 generates a background-free adversarial portrait 𝐀𝑎𝑑𝑣 conditioned on Φadv. Concurrently, the exact insertion coordinate P𝑎𝑑𝑣 is localized by minimizing the TTC within the intersection of the search region Φpos and valid ground surfaces Mground. The portrait is geometrically scaled via the camera intrinsic matrix K, projected onto P𝑎𝑑𝑣, and integrated into Î𝑇 through multi-round inpainting to construct the highly realistic adversarial last frame Î̂𝑇. Finally, utilizing the benign first frame I0 and Î̂𝑇 as structural anchors, a boundary-conditioned video diffusion model 𝑓𝑣𝑑 interpolates the intermediate dynamic progression of the adversarial human-vehicle interaction. Guided by Φsce, 𝑓𝑣𝑑 generates a kinematically plausible trajectory that smoothly evolves the scene toward the targeted collision state, outputting the final sequence V̂.
第 5 页
SafeGen:面向基于VLM的自动驾驶的、针对安全关键场景的目标条件视频扩散模型 MM ’26,2026年11月10日–11月14日,巴西里约热内卢
……在左行交通中……
……在右行交通中……
……在雨天条件下……
……穿着安全背心……来自施工区域……
图3:SafeGen生成的跨越施工、雨天及不同交通导向的安全关键场景视频。
4 实验 评估指标。评估安全关键生成视频 4.1 实验设置 提出了一个独特的困境:传统模拟器测试依赖于 闭环物理碰撞指标,这使得其无法应用于 实现细节。我们最初使用DepthAnythingV3 [17] 开环视频,而生成式方法 [10, 24] 主要 和MobileSAM [26] 分别提供深度图和视觉提示。 优先考虑视觉保真度而非安全关键逻辑。为了弥补这一差距, 在此基础上,我们利用Qwen3- 我们在第4.2节中提出了裁判总体得分 (JOS ↑)。JOS采用一个 VL-32B [1] 进行语义威胁识别。为了将这些已识别的威胁物理具象 高容量VLM作为自动裁判,以评估视觉威胁与 Agent文本推理之间的逻辑一致 化,我们使用Stable Diffusion 3.5 [9] 生成行人资产,并通过多轮 性。它系统地评估了感知对齐 (PA ↓)、预期误差 (AE ↑) 和规划合规性 (PC ↓) 图像修复将其锚定在场景中。最后,Wan2.1-FLF2V [21] 通过边界 (详见附录)。该指标公式化为 JOS = 0.2(10−PA) +0.3AE+0.5(10−PC), 条件扩散连接整个序列。我们从nuScenes数据集 [3] 中生成了850个 该指标严重惩罚关键规划违规,以专门暴露基于QA的VLMADs 安全关键场景,每个视频标准化为1280 × 720分辨率,10 FPS(共81帧)。 文本响应中的决策脆弱性。关于不同超参数设置的全面消融研究 VLMAD算法。我们使用3种基于问答 见补充材料。为了确保视觉保真度和物理场景威胁,我们 (QA)范式的代表性推理中心VLMADs来评估SafeGen, 遵循标准实验协议来评估 TTC ↓、DRAC ↑、 选择它们是为了覆盖不同的架构设计和推理机制。Dolphins [19] 是一个对话框 FID ↓ 和 FVD ↓,详见第4.3节。较高的 ↑ 表示更差的 架,处理视频令牌和文本指令以进行接地推理。DriveLMM-o1 [13] 将自动驾驶 VLMADs性能,而 ↓ 表示相反情况。 表述为基于图的QA任务,以建立感知与规划之间的因果关系。EM-VLM4AD [11] 采用 基于LLaVA的指令遵循方法,将视觉观测映射为基于语言的控制令牌。选择这些模型是为了评估 确定性安全关键冲突对其逻辑一致性的影响。 4.2 主要结果与分析 对比基线。我们将SafeGen与4个基线进行评估:Learning-to-Collide (LC) [6]、AdvSim (AS) [22]、对抗 如表1所示,SafeGen在所有评估的VLMADs中始终获得最高的 轨迹优化 (AT) [28] 和 ScenGE [18]。为了确保公平比较,我们使用开环设置 裁判总体得分 (JOS ↑),与基线方法相比平均提高了24.25%。由于JOS指标 为每个基线生成850个场景,重放原始自车轨迹以生成最终威胁视频。此外,我们 严格惩罚文本推理与视觉威胁之间的不对齐,这些高分 将这些主要基于车对车的基线调整为以人车交互为中心的冲突。 暴露了系统性故障,而非准确率的表面下降。具体而言,SafeGen将Dolphins的JOS推至9.03, DriveLMM-o1为7.96,EM-VLM4AD为9.61,完全超越了各自组别中最强的基线。 这种一致的脆弱性揭示了已识别的推理缺陷
第 6 页
MM ’26, 2026年11月10日–11月14日, 巴西里约热内卢 Jiangfan Liu 等
表 1: 不同 VLMAD 的对抗有效性主要结果。我们报告了裁判总体得分 (JOS) 及其子指标。我们还报告了相对于基线的性能变化 (Δ)。SafeGen 列以灰色阴影显示。提升和退化分别以红色和蓝色高亮显示。
Dolphins DriveLMM-o1 EM-VLM4AD 指标 LC AS AT ScenGE SafeGen LC AS AT ScenGE SafeGen LC AS AT ScenGE SafeGen JOS ↑ 6.26 6.45 7.59 7.51 9.03 5.05 4.96 5.00 7.41 7.96 8.00 9.05 9.04 9.32 9.61 Δ / +0.19 +1.33 +1.25 +2.77 / -0.09 -0.05 +2.36 +2.91 / +1.05 +1.04 +1.32 +1.61 PA ↓ 5.20 4.82 2.91 2.57 1.26 6.81 6.93 6.92 2.99 2.39 3.85 1.58 1.52 0.93 0.42 Δ / -0.38 -2.29 -2.63 -3.94 / +0.12 +0.11 -3.82 -4.42 / -2.27 -2.33 -2.92 -3.43 AE ↑ 7.08 7.12 8.04 5.77 9.08 7.43 7.26 7.16 7.68 7.97 8.35 9.28 9.22 9.08 9.62 Δ / +0.04 +0.96 -1.31 +2.00 / -0.17 -0.27 +0.25 +0.54 / +0.93 +0.87 +0.73 +1.27 PC ↓ 3.65 3.45 2.48 1.41 0.88 5.64 5.66 5.53 2.59 1.91 1.48 0.83 0.84 0.44 0.39 Δ / -0.20 -1.17 -2.24 -2.77 / +0.02 -0.11 -3.05 -3.73 / -0.65 -0.64 -1.04 -1.09
是现有模态范式的固有缺陷。因此,我们的目标条件场景不仅触发孤立的感知错误。相反,SafeGen 在整个决策管道中主动引发严重的级联推理失败。
图 3 提供了关键的定性证据,解释了这种对抗有效性。生成的对抗性行人保持与周围环境强烈的语义对齐。它们自然地调整服装、位置和运动,以融入包括施工区域、雨天和不同交通方向在内的复杂环境。由于这些入侵在视觉上可信且基于物理,它们轻松绕过了 VLMAD 的初始异常检测。因此,模型将这些代理误认为是良性的,直到碰撞在运动学上不可避免时才未能预测其轨迹。
感知。感知对齐 (PA ↓) 衡量 VLMAD 识别和空间定位驾驶场景中关键对象的能力。实验结果表明,SafeGen 严重降低了这种感知能力。所提出的框架使 PA 分数相对于基线平均值平均降低了 65.38%。DriveLMM-o1 表现出最显著的绝对感知失败,其分数从基线平均值 5.91 降至 2.39。这种性能下降是因为生成的行人保持了几何基础,并以照片般逼真的方式融入真实世界的驾驶帧。深度感知锚定机制确保对抗性代理无缝融入交通拓扑结构,防止感知模块标记合成纹理异常。因此,代理直到冲突迫在眉睫时才未能将入侵识别为高优先级威胁。
预测。预期误差 (AE ↑) 量化了其他代理的预期意图与实际对抗轨迹之间的偏差。SafeGen 最大化 AE,在所有测试模型中,相对于基线平均值平均增加了 14.13%。Dolphins 模型在此阶段表现出极端的脆弱性,其中 SafeGen 触发了从基线平均值 7.00 到 9.08 的跳跃。上下文接地终点状态推理模块通过识别最大化碰撞可能性的轨迹规划的潜在脆弱性,推动了这一增加。该框架
然而,在运动学上具有攻击性,迫使 VLM 误解迫在眉睫的威胁。推理逻辑失败,因为它无法预测行人路径的目标导向演变。
规划。规划合规性 (PC ↓) 评估 VLMAD 在面对 imminent 碰撞时的紧急 maneuvers 的安全性。我们的研究结果证实,SafeGen 在安全关键压力下显著降低了这种合规性。相对于基线,SafeGen 使 PC 分数平均降低了 62.59%。DriveLMM-o1 表现出合规性分数的巨大绝对减少,从基线平均值 4.86 降至 1.91。这种对抗有效性直接源于生成场景的确定性目标设置。边界条件扩散生成在语义约束下运行,以持续引导合成运动朝向预期的对抗性终点状态。此过程保留了时间和物理合理性,同时严重降低了 VLMAD 的规划能力。严重降低的合规性值表明,发现的漏洞反映了一种根本性的无能,即在精确控制的物理威胁下无法生成安全响应。
4.3 场景质量与多样性
虽然第 4.2 节通过 JOS 指标评估了 VLMAD 的推理脆弱性,但验证生成场景的内在质量(独立于目标驾驶模型)同样至关重要。评估生成性安全关键数据提出了独特的挑战,因为它需要桥接两个截然不同的领域。传统的 AD 指标(例如,TTC)严格量化运动学威胁,但无法评估 Multi-Agent语义上下文。相反,标准视频生成指标(例如,FID)优先考虑像素级视觉保真度,而完全忽略所描绘威胁的物理有效性。由于两种评估范式单独来看都不足,因此建立综合基准是必要的。为了弥补这一差距,我们从三个正交的角度评估 SafeGen:运动学紧迫性、视觉真实性和语义多样性。这些模型无关的验证证实,我们合成的视频不仅视觉上令人信服,而且是物理危害的严格接地、高保真表示。
运动学紧迫性覆盖。有效的安全关键场景必须明确地迫使规避机动。我们量化这一点
第 7 页
使用碰撞时间(TTC ↓)和避免碰撞的减速度(DRAC ↑)来衡量物理威胁等级。如图 4a 所示,SafeGen 诱导出的分布偏移与源数据相比严重且刻意。原始的良性驾驶日志位于低风险域,TTC 值密集聚集在 2.5 至 3.0 秒之间,且 DRAC 峰值远低于 10 m/s²。与之形成鲜明对比的是,SafeGen 生成的场景将 TTC 急剧压缩至 0.5 秒以下的极高危窗口,同时将所需的紧急减速推至 15-20 m/s² 的极端水平。这种显著的定量升级证实,我们的框架有效地将安全、标准的驾驶轨迹转化为迫在眉睫的碰撞事件,完全消除了 VLMAD 通常依赖的反应余地。
视觉保真度。如果生成的威胁缺乏视觉真实感,高物理紧迫性就会大打折扣,因为 VLMAD 可能会因表面的像素级伪影而非真正的推理缺陷而失败。我们使用弗雷歇初始距离(FID ↓)和弗雷歇视频距离(FVD ↓)在整个包含 850 个生成场景的数据集上测量视觉质量(图 4b)。SafeGen 表现出卓越的生成稳定性,平均 FID 接近 100,平均 FVD 约为 400。更重要的是,这些分数的分布显示出在整个数据集中紧密且一致的聚类,避免了无约束视频合成中经常观察到的严重退化。这种持续的高保真度验证了我们的结构设计。通过以深度感知的空间投影和迭代潜在空间修复来锚定生成过程,SafeGen 有效地抑制了边界伪影和时间闪烁,确保合成的 VRU 无缝且逼真地融入高度复杂的环境背景中。
生成多样性。除了物理指标外,VLMAD 的开放世界鲁棒性在很大程度上取决于其对语义多样化威胁的接触。基于标准模拟器的流水线受限于有限的手动装配 3D 资产库,导致重复且可预测的危险特征。如图 4c 所示,SafeGen 通过合成丰富谱系的 VRU 克服了这一限制,这些 VRU 自然地存在于驾驶分布的长尾部分。通过无缝实例化高保真、非传统的交互场景,如骑赛格板的人、轮椅使用者或建筑工人,SafeGen 迫使 VLMAD 对新的语义类别进行推理,而不仅仅是记忆标准的行人边界框。这种开放词汇生成能力确保我们的安全评估反映了真实、不可预测的城市环境多样性。
(a) TTC 和 (b) FID 和 FVD 统计比较。 (c) VRU 类别的代表性示例。 图 4:威胁和真实性分析,包括运动学指标、视觉指标和定性多样性示例。
4.4 消融实验
我们进行消融实验以评估 SafeGen 中核心机制的必要性,并评估其对特定组件选择的敏感性,如图 5 所示。为了提供全面的评估,我们分析 JOS 及其详细的子指标,以揭示脆弱性如何在感知、预测和规划阶段显现。除非另有说明,否则所有实验均使用默认的 SafeGen 设置。
❶ 边界条件机制。我们通过将默认的 SafeGen 架构与两种替代合成策略进行比较,来验证目标条件公式。第一种替代方案是基于对抗性第一帧初始化的首帧到视频(F2V)基线。第二种是边界条件的 FLF2V 基线,它在第一帧注入威胁并针对良性最后一帧。图 5 表明,以对抗性最后一帧锚定生成显著优于这两种替代方案。除了使 JOS 指标平均增加 60.36% 外,子指标的分解揭示了威胁是如何具体实现的。默认的 FLF2V (Last) 设置严重降低了 VLMAD 的感知和规划能力,将 PA 降至 1.36,PC 降至 1.03,同时将预期误差(AE)增加至 8.75。相比之下,F2V 配置缺乏终止约束,而 FLF2V (First) 基线迫使模型向良性结局插值。因此,缺乏确定性末端状态约束导致生成结果高度可变,导致非碰撞事件频率高,其中 VLMAD 仍能保持中等 PA 和 PC 分数。相反,严格在终端状态锚定灾难性事件,迫使中间视觉动态自然升级为碰撞。这一结果证实了在安全关键合成中末端状态条件化的必要性。
❷ VLM 推理的鲁棒性。我们评估语义威胁推理模块对特定 VLM 的依赖性。我们将默认的 Qwen3-VL-32B 模型替换为较小的 GLM-4.1V-9B-Thinking [12] 和 InternVL3.5-38B [23]。图 5 表明,在这些不同架构下,整体 JOS 始终保持高位。此外,子指标(PA、AE、PC)保持紧密聚类,表明这种特定的故障模式一致地降低了不同推理引擎的预期和规划能力。替代模型在对抗效力方面没有显著下降。这一结果表明,我们的生成方法独立于所选的 VLM。
第 8 页
MM ’26, 2026年11月10日–11月14日, 巴西里约热内卢 Jiangfan Liu 等
条件机制 VLM 鲁棒性 随后在该合成数据集上进行微调,并在基准测试上评估 10 VRU-Accident [15]。 为了严格聚焦于高 PA 8.75 8.86 8.48 8.23 8.65 8.75 8.86 未见场景 8.12 AE 风险交互, 我们选择 3 个 安全关键型 VQA 类别: 8 PC 事故原因 (ACCAC ↓)、预防措施 (ACCPM ↓) 和 分数 6 JOS 5.07 4.81 5.33 5.54 5.72 事故人/自车类型 (ACCAT ↓)。值得注意的是,虽然 SafeGen 在基准测试上首先生成了 4.36 4.02 具有多样化的相机视角,包括一部分 4 3.73 第三人称人机碰撞,如图 6 所示。尽管这种部分视角不匹配限制了我们的绝对准 2 1.36 15.9% 的 ACCAVG. ↓ 提升。 1.03 1.55 1.29 1.24 1.18 1.36 1.03 确度上限,表 2 显示 这一提升证实了 SafeGen 生成的数据能够迁移 0 F2V FLF2V FLF2V GLM-4.1V InternVL3.5 Qwen3-VL 至未见过的真实世界领域,证明了其 (First) (First) (Default – Last) (9B) (38B) (Default – 32B) 对下游模型增强的价值。 人工评估。虽然运动学指标提供了客观 Figure 5: 生成条件机制 的物理紧迫性测量,但确立真正的场景真实 (左) 和 VLM 选择 (右) 对 JOS 及其子指标的影响。 性和威胁有效性需要人类认知评估。我们 进行了一项涉及 30 名持证驾驶员的 Table 2: 在基于 SafeGen 生成数据微调前后,Dolphins 在 VRU-Accident 上的准确率 人在回路 (HITL) 研究,以比较 SafeGen 生成 较低的 ACC𝑖 值表示 VLMAD 性能较差。 的场景与 ScenGE 基线的感知质量。为了准确复制 真实世界驾驶的认知负荷,该研究利用了一个配备有 座舱控制界面的 210 度沉浸式环绕显示屏模拟器(图 7a)。为了减轻预期偏差并防止 方法 ACCAC ↓ ACCPM ↓ ACCAT ↓ ACCAVG. ↓ 参与者仅仅为不可避免的碰撞做准备,每位驾 Dolphins (Vanilla) 29.1 43.6 43.8 38.8 驶员暴露于一个连续序列中,其中包含 10 个对抗性 Dolphins (SafeGen) 46.7 55.5 61.8 54.7 场景,并与 40 个良性驾驶片段无缝混合, 事先不知道事件发生的时间。每次会话后,参与者 [事故原因, AC] 在 5 点李克特量表上对感知的真实性和威胁强度进行评分。图 7b 说明了 Ø Q: 事故是如何发生的?选择正确的选项 (A, 由此产生的分数分布,揭示了 B, C, 或 D) 无需任何解释。 Ø GT: C. 行人移动或停留在道路上 我们框架的决定性优势。在两个评估维度上,SafeGen 的分布始终集中在 [预防措施, PM] 比 ScenGE 更高的值上。来自参与者的定性反馈强调,ScenGE 场景通常表现出僵硬的 Ø Q: 如何 这 事故 被预防? 选择正确的 行人运动学和 unnatural 的时空进展, 选项 (A, B, C, 或 D) 无需任何解释。 Ø GT: A. 行人应遵守交通规则 从而削弱了冲突的感知紧迫性。与之形成鲜明对比的是,SafeGen 场景始终被判定为行为 [事故类型, AT] 上合理但极具威胁性。生成的 VRU 的流体、上下文感知的 Ø Q: 发生了什么样的事故?选择正确的选项 (A, B, C, 或 D) 无需任何解释。 演变成功引发了真正的 Ø GT: A. 汽车撞人 惊讶和强烈的人类感知安全压力,验证了 我们的生成管道有效地弥合了 安全关键型评估中的 sim-to-real 差距。 第三人称视角
5 结论
我们介绍了 SafeGen,一种用于生成 Figure 6: VRU-Accident 的示例帧,这是一个包含混合视角(如第三人称碰撞)的数据集, 真实安全关键型视频的基于扩散的框架。通过揭示长尾 VRU 说明了所选的 3 个最相关的 QA 类别。 故障,SafeGen 提供了更严格的安全评估, 并通过微调提高了 VLMAD 性能。未来的工作 包括将该框架扩展到 Multi-Agent交互。 伦理声明。我们旨在通过识别部署前的风险来改善 VLMAD 安全性。我们提倡负责任地、 4.5 下游效用与人工验证 在人类监督下使用我们的生成工具,以确保它们仅用于 下游微调。为了评估 SafeGen 生成场景对模型增强的下游效用,我们使用 Dolphins 进行 鲁棒性增强。 微调实验。我们使用 JOS Judge 自动标注高质量的 QA 训练对。Dolphins 参考文献 [1] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo,
第 9 页
SafeGen:面向基于VLM的自动驾驶的安全关键场景目标条件视频扩散模型 MM ’26,2026年11月10日-11月14日,巴西里约热内卢
威胁感 均值 [13] Ayesha Ishaq, Jean Lahoud, Ketan More, Omkar Thawakar, Ritesh Thawkar, 真实性 核心区域 Dinura Dissanayake, Noor Ahsan, Yuhao Li, Fahad Shahbaz Khan, Hisham Cholakkal, 等. 2025. DriveLLM-o1:用于驾驶场景理解的逐步推理数据集和 大型多模态模型。在2025 IEEE/RSJ 5 智能机器人与系统国际会议 (IROS)。IEEE, 20501– 20508。 SafeGen 4.07 [14] Nidhi Kalra 和 Susan M Paddock. 2016. 驶向安全:需要多少英里的 场景 驾驶里程才能证明自动驾驶汽车的可靠性?运输 4 3.60 研究部分A:政策与实践 94 (2016), 182–193。 [15] Younggun Kim, Ahmed S. Abdelrahman, 和 Mohamed Abdel-Aty. 2025. VRU- 3 事故:用于事故场景理解的视频问答和密集 标注的视觉语言基准。在IEEE/CVF国际计算机视觉会议 (ICCV) 研讨会论文集。761– 771。 1.97 [16] Quanyi Li, Zhenghao Peng, Lan Feng, Qihang Zhang, Zhenghai Xue, 和 Bolei Zhou. 2023. MetaDrive:为可泛化强化学习构建多样化的驾驶场景。IEEE模式分析与机器 场景 智能汇刊 45, 3 (2023), 3461–3475。 [17] Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, 1 Jiashi Feng, 和 Bingyi Kang. 2025. Depth anything 3:从任意视角恢复视觉 空间。arXiv预印本 arXiv:2511.10647 (2025)。 [18] Jiangfan Liu, Yongkang Guo, Fangzhi Zhong, Tianyuan Zhang, Zonglei Jing, ScenGE SafeGen Siyuan Liang, Jiakai Wang, Mingchuan Zhang, Aishan Liu, 和 Xianglong Liu. 2026. 自动驾驶汽车安全关键场景的对抗生成与协同演化。在AAAI人工智能会议论文集 (a) 人在回路平台 (b) 参与者对感知威胁和真实性的评分图表。 中, 第40卷。38926–38934。 [19] Yingzi Ma, Yulong Cao, Jiachen Sun, Marco Pavone, 和 Chaowei Xiao. 2024. Dolphins:用于驾驶的 multimodal 语言模型。在欧洲计算机视觉会议。Springer, 403–420。 图7:人类评估,左侧为模拟器设置,右侧为评分分布。 [20] Matthew O’Kelly, Aman Sinha, Hongseok Namkoong, Russ Tedrake, 和 John C Duchi. 2018. 通过罕见事件仿真实现可扩展的端到端自动驾驶汽车测试。神经信息处理系统进展 31 (2018)。 [21] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等. 2025. Wan:开放且先进的 Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei 大规模视频生成模型。arXiv预印本 arXiv:2503.20314 (2025)。 Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, [22] Jingkang Wang, Ava Pun, James Tu, Sivabalan Manivasagam, Abbas Sadat, Sergio Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Casas, Mengye Ren, 和 Raquel Urtasun. 2021. Advsim:为自动驾驶车辆生成安全关键 Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, 场景。在IEEE/CVF计算机视觉与模式识别会议论文集。9909–9918。 Yuanzhi Zhu, 和 Ke Zhu. 2025. Qwen3-VL 技术报告。arXiv预印本 [23] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, arXiv:2511.21631 (2025)。 Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, 等. 2025. InternVL3.5:在多功能、推理和效率方面推进开源多模态模型。 [2] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Leo Jing, David arXiv预印本 arXiv:2508.18265 (2025)。 Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, 等. 2024. 作为世界模拟器的视频生成模型。OpenAI博客 1, 8 (2024), 1。 [24] Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu. [3] Holger Caesar, Varun Bankiti, Alex H Lang, Sourabh Vora, Venice Erin Liong, [25] Hao Xiang, Runsheng Xu, Xin Xia, Zhaoliang Zheng, Bolei Zhou, 和 Jiaqi Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, 和 Oscar Beijbom. 2020. 2024. DriveDreamer:迈向面向真实世界驾驶的自动驾驶世界模型。在欧洲计算机视觉会议。Springer, 55–72。 nuscenes:自动驾驶的多模态数据集。在IEEE/CVF计算机视觉与模式识别会议论文集。11621–11631。 [26] Chaoning Zhang, Dongshen Han, Yu Qiao, Jung Uk Kim, Sung-Ho Bae, Seungkyu [4] Yulong Cao, Chaowei Xiao, Anima Anandkumar, Danfei Xu, 和 Marco Pavone. Lee, 和 Choong Seon Hong. 2023. Faster segment anything:面向移动应用的轻量级 2022. Advdo:用于轨迹预测的真实对抗攻击。在欧洲计算机视觉会议。Springer, 36–52。 sam。arXiv预印本 arXiv:2306.14289 (2023)。 [5] Baiming Chen, Xiang Chen, Qiong Wu, 和 Liang Li. 2021. 换道场景中的自动驾驶汽车对抗评估。IEEE智能运输系统汇刊 23, 8 (2021), 10333–10342。 [27] Lvmin Zhang 和 Maneesh Agrawala. 2025. 在视频生成的下一帧预测模型中打包输入帧上下文。arXiv预印本: 2504.12626 [6] Wenhao Ding, Baiming Chen, Minjun Xu, 和 Ding Zhao. 2020. 学习碰撞:一种自适应安全关键场景生成方法。在2020 IEEE/RSJ智能机器人与系统国际会议 (IROS)。IEEE, 2243– (2025)。 2250。 [28] Qingzhao Zhang, Shengtuo Hu, Jiachen Sun, Qi Alfred Chen, 和 Z Morley [7] Wenhao Ding, Chejian Xu, Mansur Arief, Haohong Lin, Bo Li, 和 Ding Zhao. Mao. 2022. 关于自动驾驶汽车轨迹预测的对抗鲁棒性。在IEEE/CVF计算机视觉与模式识别会议论文集。15159–15168。 2023. 安全关键驾驶场景生成综述——方法论视角。IEEE智能运输系统汇刊 24, 7 (2023), 6971–6988。 [8] Alexey Dosovitskiy, German Ros, Felipe Codevilla, Antonio Lopez, 和 Vladlen Koltun. 2017. CARLA:一个开放的城市驾驶模拟器。在机器人学习首届年会论文集。1–16。 [9] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, 等. 2024. 扩展整流流变换器以实现高分辨率图像合成。在第四十一届国际机器学习会议论文集。 [10] Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, 和 Qiang Xu. 2024. MagicDrive:具有多样化3D几何控制的街景生成。在国际学习表征会议论文集。 [11] Akshay Gopalkrishnan, Ross Greer, 和 Mohan Trivedi. 2024. 用于自动驾驶问答的多帧、轻量级且高效视觉语言模型。arXiv预印本 arXiv:2403.19838 (2024)。 [12] Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, 等. 2025. Glm-4.5 v 和 glm-4.1 v-thinking:通过可扩展强化学习实现多功能多模态推理。arXiv预印本 arXiv:2507.01006 (2025)。