从体育到安全:多模态大模型为何“看见”危险却“看不懂”因果?

快速导读:提出SPRINT基准,通过2888个真实体育视频评估MLLMs的主动物理危险预警能力,揭示模型在危险感知与因果理解之间存在巨大差距,且高度依赖提示词。

当前多模态大模型(MLLMs)在安全评估领域的研究,长期聚焦于有害内容检测和对抗鲁棒性,却忽视了一个更根本的问题:模型能否在动态物理环境中,主动预测即将发生的危险?SPRINT(Sports Proactive Risk INference Testbed)基准的提出,正是为了填补这一空白。该工作通过构建包含2888个真实体育视频的大规模测试平台,系统性地揭示了MLLMs在主动安全预警能力上的巨大鸿沟。

本文的核心发现是,当前最先进的MLLMs普遍存在“表面主动安全”现象——模型能够敏锐地感知到视觉场景中的异常变化,从而在危险检测任务上取得高分,但在需要深层物理因果推理的原因识别任务上表现急剧下降。这一发现对将MLLMs部署于自动驾驶、工业监控等安全关键场景的设想提出了严肃警示。

英文题目:From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.05560

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有MLLM安全研究主要沿着两条路径展开:一是反应式有害内容检测,如Video-SafetyBench等基准关注模型对暴力、色情等内容的识别能力;二是对抗鲁棒性评估,测试模型对恶意输入的抵抗能力。然而,这些工作均未触及“主动安全”这一维度——即在危险发生之前,基于微弱的视觉线索进行预警的能力。

在主动风险感知领域,已有工作如PaSBench-Video虽然支持视频主动预警,但其数据并非完全来自真实世界。同时,主动LLM研究多集中于任务辅助场景,而非物理安全。体育场景因其伤害诱因与经典伤害预防框架Haddon矩阵高度一致,且包含丰富的动态物理交互,成为评估主动安全预警能力的理想平台。

SPRINT基准的设计直面一个关键研究缺口:现有评估体系无法区分模型是真正理解了物理因果,还是仅仅对视觉突变做出了反应。这一区分对于安全关键应用至关重要——一个只会对已发生的碰撞做出反应,却无法预判滑雪者即将失控的模型,在真实场景中毫无预警价值。

此外,提示敏感性(Prompt Sensitivity)作为影响模型行为的关键因素,在安全评估中鲜有系统研究。SPRINT通过设计描述性、分析性和明确安全询问三种提示类型,首次量化了提示词如何影响模型的危险感知与误报行为。

核心创新

  • 提出首个完全基于真实世界视频、支持主动物理危险预警及系统化提示敏感性评估的基准SPRINT。
  • 设计包含时间窗口截断和安全对照视频的诊断实验,量化模型误报行为与提示词偏差。
  • 构建从危险感知到因果归因的递进式评估体系(D1/D2/D3),揭示MLLMs的“表面主动安全”现象。

方法概览

构建SPRINT基准,包含2888个真实体育视频(2440个事故,448个安全对照),覆盖14项运动和3种环境。事故视频标注最早线索时刻(T1)、最明显时刻(T2)及分层原因(H1宏观因素, H2直接描述)。设计全视频评估、时间窗口评估和诊断实验,从危险检测(D1)、因素覆盖(D2)和原因识别(D3)三个递进维度评估MLLMs。

  • 数据集构建:SPRINT包含2888个真实体育视频,其中2440个为事故视频,448个为安全对照视频,覆盖滑雪、自行车、滑板等14项运动,以及自然场地、标准化场馆和城市街道3种环境。事故视频均标注了最早线索时刻(T1)、危险最明显时刻(T2),以及分层原因(H1宏观因素如环境、设备,H2直接描述如“滑雪者失去平衡”)。
  • 递进式评估维度:评估体系包含三个递进维度——D1危险检测(判断是否存在危险)、D2因素覆盖(识别危险涉及的人、设备、环境等因素)、D3原因识别(准确描述危险发生的因果链条)。这三个维度从感知到理解逐层深入,能够有效区分模型的表面能力与深层能力。
  • 全视频评估:在完整视频上使用三种提示(描述性提示要求模型客观描述视频内容;分析性提示要求模型分析潜在风险;明确安全询问直接要求模型判断是否存在危险)评估7个主流MLLMs,包括GPT-5、Doubao-seed-1.8等闭源模型和Qwen3-VL-8B等开源模型。
  • 时间窗口评估:为测试模型的早期预警能力,将视频截断为三个时间窗口——窗口A(开始至T1,即危险最早线索出现时)、窗口B(开始至T1与T2的中点)、窗口C(开始至T2,即危险已明显可见)。在明确提示和客观提示两种条件下评估模型表现。
  • 诊断实验:利用448个安全对照视频,进行时间截断测试和静态首帧测试,量化模型在无危险场景下的误报率。通过对比明确提示与客观提示下的误报差异,揭示提示词引发的虚假警报行为。
  • 微调验证:使用SPRINT的标注数据对Qwen3-VL-8B进行监督微调,验证基准作为训练资源的效用,同时探索通过数据驱动方式缓解“表面主动安全”问题的可能性。
  • 标注质量控制:T1和T2时间边界的标注由多位标注员完成,并通过一致性检验确保标注质量。H2直接原因采用自然语言描述,以保留因果信息的丰富性,但这也限制了评估的精确结构化程度。
  • 评估指标设计:D1采用二分类准确率,D2采用因素覆盖的召回率,D3采用因果描述的语义相似度评分。三个指标相互独立又层层递进,共同构成完整的主动安全能力画像。

逐图理解论文

一个令人警醒的失败案例

一个令人警醒的失败案例
Figure 1: Data examples from SPRINT and illus- trative MLLM responses. Upper: at the incipient stage, MLLMs require explicit prompts to detect danger. Lower: once the hazard materializes, MLLMs recognize it without guidance.

图1展示了SPRINT的数据示例和模型响应对比。上方显示在危险初期,模型需要明确提示才能检测到危险;下方显示一旦危险显现,模型无需引导即可识别。这一对比直观揭示了模型对提示的依赖性和主动预警能力的不足。

研究空白与SPRINT的独特定位

研究空白与SPRINT的独特定位
Figure 2: Overview of SPRINT. (Left) Key features of SPRINT. (Right) Statistics of SPRINT.

图2呈现了SPRINT基准的整体概览。左侧列出关键特征,包括真实世界数据、时间窗口设计、递进式评估维度等;右侧展示数据统计,包括运动类型分布、事故与安全视频比例等。该图帮助读者快速理解基准的设计理念和规模。

递进式评估揭示“表面主动安全”

递进式评估揭示“表面主动安全”
Figure 3: Full-video hazard prediction. A sharp gap between hazard sensitivity (D1) and causal understanding (D3).

图3展示了全视频评估的核心结果。横轴为不同模型和提示条件,纵轴为得分。D1(危险检测)普遍较高,但D3(原因识别)急剧下降,清晰呈现了“表面主动安全”现象。Doubao-seed-1.8在D1上超过95%但在D3上低于50%的对比尤为突出。

早期预警与提示敏感性的双重困境

早期预警与提示敏感性的双重困境
Figure 4: Early-warning trends across temporal windows. Performance improves as hazards escalate, but early-stage warnings remain highly prompt-sensitive.

图4展示了时间窗口评估的趋势。随着窗口从A到C推进(即危险线索逐渐增多),模型表现逐步提升,但早期窗口(A)下的得分仍然很低,且高度依赖提示类型。客观提示下的表现远低于明确提示,说明模型缺乏自主预警能力。

实验如何设计?

  • 评估模型选择:涵盖7个主流MLLMs,包括闭源模型GPT-5、Doubao-seed-1.8、Claude-3.5-Sonnet,以及开源模型Qwen3-VL-8B、LLaVA-OneVision等,确保结论的代表性。
  • 提示设计策略:三种提示类型分别对应不同的使用场景——描述性提示模拟客观观察者,分析性提示模拟风险评估者,明确安全询问模拟安全监控者。这种设计能够揭示模型能力对提示措辞的依赖程度。
  • 时间窗口划分依据:窗口A对应危险最早可感知线索出现的时刻,窗口B为线索积累阶段,窗口C为危险已明显可见。这一划分基于伤害预防理论,能够测试模型在不同信息充分程度下的预警能力。
  • 安全对照视频设计:448个安全视频在运动类型、场景复杂度上与事故视频匹配,但全程无危险事件发生。这一设计使得误报率评估具有统计意义,能够区分模型的真实预警能力与过度敏感倾向。
  • 微调实验设置:使用SPRINT训练集对Qwen3-VL-8B进行监督微调,训练目标同时覆盖D1、D2、D3三个维度,以验证基准数据的训练价值。
  • 统计显著性检验:主要结论均通过多模型平均和跨条件对比得出,避免单一模型或单一条件的偶然性。误报率分析采用配对对比,确保提示敏感性结论的可靠性。

关键结果与论文证据

  • 全视频评估揭示“表面主动安全”现象:最佳模型Doubao-seed-1.8在D1(危险检测)上超过95%,但在D3(原因识别)上低于50%(第6页,Figure 3)。所有闭源模型均呈现D1到D3的剧烈下降,表明模型主要依赖表面视觉变化信号进行危险检测,缺乏对物理因果的深层感知。
  • 早期预警能力严重不足:在最早时间窗口A下,使用客观提示时,Doubao-seed-1.8的D1从88%降至59%,开源模型低于9%(第6页,Figure 4)。这表明在危险线索尚不明显的早期阶段,模型的预警能力急剧退化。
  • 提示敏感性导致严重误报:诊断实验中,明确提示引发大量虚假警报——GPT-5误报率从0.28升至0.59,Doubao-Seed-1.8从0.13升至0.88(第8页,Figure 5)。这意味着当用户明确询问安全问题时,模型倾向于“过度警觉”,将正常场景误判为危险。
  • 微调显著提升能力但因果推理仍是瓶颈:微调后,Qwen3-VL-8B在描述性提示下D1从0.48升至0.99,D3从0.16升至0.52(第7页,Table 3)。在窗口A客观提示下,D1从0.09升至0.84,D3从0.02升至0.32(第8页,Table 4)。微调大幅提升了危险感知能力,但因果推理的绝对水平仍然有限。
  • 人际交互因素最难识别:按Haddon矩阵分类,人际交互因素(如运动员之间的碰撞预判)在所有危险类别中得分最低(第21页,Figure 10)。这反映了模型在理解复杂社会性物理交互方面的根本困难。
  • 自然场景表现优于标准化场馆:按场地类型分析,自然和非结构化环境下的模型得分高于标准化场馆(第17页,Table 12)。这可能因为自然场景中的危险线索更加视觉显著,而标准化场馆中的危险往往涉及更微妙的规则和交互理解。
  • 危险持续时间与模型表现弱相关:危险片段持续时间与模型得分呈弱正相关,危险开始时间与得分呈弱负相关(第22页,Figure 12、13)。这表明视频长度和危险时机对模型表现有一定影响,但并非决定性因素。
  • 不同运动类型间表现差异显著:按运动类型分析,模型在不同运动上的D3得分差异明显(第20页,Figure 8)。某些运动(如滑雪)的危险模式可能更容易被模型捕捉,而另一些运动(如团队球类)的因果推理难度更高。

阅读时需要注意

  • 缺少音频模态:SPRINT仅使用视觉信息,忽略了碰撞声、尖叫声等关键物理预警信号。在真实安全场景中,音频往往是危险即将发生的重要线索。
  • 仅评估通用MLLMs:未包含专门的视频异常检测或动作预测模型,因此无法判断专用模型是否已在主动预警能力上超越通用模型。
  • T1和T2标注存在主观性:最早线索时刻和最明显时刻的判定依赖标注员的主观判断,尽管通过多人标注和一致性检验进行了控制,但固有主观性无法完全消除。
  • H2原因描述的非结构化限制:直接原因采用自然语言描述而非结构化分类,虽然保留了因果信息的丰富性,但限制了评估的精确性和可重复性。
  • 数据集偏差:数据主要来自英语YouTube内容,存在地域和语言偏差,可能无法完全代表全球范围内的体育伤害模式。

关联工作

  • PaSBench-Video是唯一与SPRINT同样支持视频主动预警的基准,但其数据并非完全来自真实世界,且未进行系统化的提示敏感性评估(第3页,Table 1)。SPRINT在数据真实性和评估维度上均有显著推进。
  • Video-SafetyBench等视频安全基准专注于反应式有害内容检测,即判断视频中是否包含不安全内容,而非预测即将发生的危险。SPRINT的主动预警定位与此形成根本区别。
  • Haddon矩阵是经典的伤害预防框架,将伤害因素分为个人、人际、设备和环境四个维度。SPRINT的伤害诱因分类与此框架对齐,使得评估结果能够与公共卫生和安全管理领域的理论对话。

发表评论