BRUCE:科学VLM的推理稳定性为何一碰就碎?

快速导读:提出BRUCE框架及RCI/T-RCI指标,量化视觉语言模型在渐进式视觉扰动和空间信息移除下的科学推理鲁棒性退化。

视觉语言模型(VLM)在科学推理基准上不断刷新记录,但真实世界的输入远非理想——模糊的仪器读数、低对比度的图表、被遮挡的分子结构,这些视觉退化会如何瓦解模型的推理能力?BRUCE框架正是为回答这一问题而设计。它不满足于报告“模型在噪声下变差”这一笼统结论,而是通过渐进式扰动缩放和方向性空间信息移除,精细刻画推理性能的退化轨迹。

BRUCE的核心贡献在于两个新指标:RCI量化视觉腐败下的推理退化速度,T-RCI量化渐进空间信息损失下的退化速度。配合帕累托鲁棒性图和层次化失败分类法,该框架能够诊断出模型究竟是因为OCR失效、空间关系错乱、符号推理断裂还是语义误解而犯错。这项工作覆盖了ScienceQA Chemistry、MMJEE Chemistry和MathVista MCQ三个数据集上的7个主流VLM,揭示了干净精度与鲁棒性之间令人警醒的脱节。

英文题目:BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

论文出处:arXiv 每日论文精选 · arXiv:2608.07742

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有VLM评估体系存在一个根本性盲区:它们几乎只关注干净输入下的任务精度,却对推理稳定性在多种鲁棒性维度下的退化情况缺乏全面分析。Hendrycks & Dietterich (2019) 曾提出常见腐败下的鲁棒性基准,但主要针对图像分类任务;R-Bench (Li et al., 2024) 评估了多模态模型对真实世界腐败的鲁棒性,却使用聚合响应度量,未深入分析推理失败模式;Bench-C (Sui et al., 2025) 将评估扩展到精度之外,但仍未揭示腐败如何传播为不同的多模态推理失败。

科学推理场景对鲁棒性提出了更高要求。一道化学题可能依赖分子结构图中的空间排列、反应方程式的符号逻辑、以及图表中的OCR文本,任何一个环节的视觉信息丢失都可能引发连锁推理错误。然而,现有研究缺乏一个统一的框架来回答:视觉扰动究竟在哪个推理环节造成了断裂?不同模型对同一扰动的脆弱性模式有何差异?

更关键的是,模型对空间信息移除的敏感性具有方向性。从左侧裁剪图像与从右侧裁剪图像,对推理的影响可能截然不同——这取决于关键信息在画面中的位置分布。这种方向性脆弱性在以往的评估中几乎被完全忽略。

BRUCE正是为填补这些空白而提出。它不满足于报告一个聚合的鲁棒性分数,而是通过受控的扰动缩放协议和细粒度的失败分类,将“模型变差”这一模糊观察拆解为可诊断、可比较、可解释的退化信号。

核心创新

  • 提出BRUCE多模态推理脆弱性框架,对VLM进行全面的扰动缩放评估。
  • 设计RCI和T-RCI两个新指标,分别量化视觉腐败和渐进空间信息损失下的推理性能退化速度。
  • 引入受控的扰动缩放协议,涵盖渐进式模糊、旋转、对比度退化和空间裁剪,并扩展至方向性空间遍历。
  • 构建层次化失败分类法,包含OCR、空间、符号推理和语义四类高层失败域及细粒度子类型。

方法概览

BRUCE框架通过渐进式施加模糊、低对比度、裁剪、旋转等扰动及方向性空间遍历,计算预测退化、校准漂移、熵坍塌和失败传播信号,整合为RCI和T-RCI指标,并结合层次化失败分类法进行可解释的鲁棒性分析。

  • BRUCE框架的核心流程分为三步:首先对输入图像施加渐进式扰动,包括模糊、低对比度、裁剪和旋转四种单一扰动类型,每种扰动按多个严重级别递增;其次进行方向性空间遍历,从上下左右四个方向逐步移除图像区域,模拟关键信息被遮挡的场景。
  • RCI指标的设计基于预测退化曲线下的面积。对于每种扰动类型,BRUCE记录模型在各级严重度下的准确率,计算准确率随扰动强度增加而下降的速率,最终聚合为平均RCI和最大RCI。RCI值越低,说明模型对视觉腐败的容忍度越高。
  • T-RCI指标专门量化空间信息损失下的推理退化。它沿四个遍历方向分别计算准确率随裁剪比例增加的下降曲线,并整合为平均T-RCI和最大T-RCI。此外,BRUCE还识别每个模型的最脆弱遍历方向,为理解模型的空间信息依赖提供线索。
  • 帕累托鲁棒性图将腐败精度与RCI、遍历精度与T-RCI分别绘制在二维平面上,直观展示模型在“保持高精度”与“抵抗退化”之间的权衡关系。位于右下区域的模型同时具备高鲁棒精度和低退化速度。
  • 层次化失败分类法是BRUCE可解释性的关键。它将腐败诱导的预测失败分为四大高层领域:OCR失败(文本识别错误)、空间失败(位置或方向判断错误)、符号推理失败(公式或逻辑推导错误)和语义失败(概念理解错误)。每个高层领域下又细分为多个子类型,例如符号推理失败中包含多步链式失败、单位转换错误等。
  • 脆弱性曲线进一步刻画了模型在不同扰动类型下的退化模式。有些模型呈现渐进式退化,有些则在特定严重度阈值后突然崩溃,这种非线性行为对实际部署具有重要警示意义。
  • BRUCE在ScienceQA Chemistry、MMJEE Chemistry和MathVista MCQ三个数据集上评估了7个VLM,涵盖闭源模型(GPT-4.1、Claude Opus 4.7、Gemini 3.5 Flash)和开源模型(Qwen2.5-VL-72B、InternVL2.5-8B、LLaVA-NeXT-Mistral-7B、ChemVLM-8B),确保了结论的广泛适用性。
  • 值得注意的是,BRUCE的评估仅限于多项选择问答设置,未涵盖开放式生成任务,且RCI和T-RCI的聚合权重默认设为均匀,未针对特定数据集进行调优——这些是论文明确指出的局限。

逐图理解论文

一个令人警醒的案例

一个令人警醒的案例
Figure 7: Example traversal-induced failure on a chemistry reasoning question.

想象一道化学题:模型需要根据分子结构图判断反应产物。当图像只是轻微模糊——就像手机拍照时手抖了一下——某些顶级VLM的答案就从正确变成了错误。更令人不安的是,这种失败并非随机猜测,而是模型自信地给出了一个逻辑自洽但完全错误的推理过程。这说明视觉扰动不只是降低了“视力”,它直接污染了推理链条。

现有评估的盲区

现有评估的盲区
Figure 2: Examples of Single Perturbation Types: (a) Blurry Image; (b) Low-Contrast Image; (c) Cropped Image; and (d) Rotated Image.

目前主流的VLM评估几乎只关注干净输入下的精度,但真实世界的图像充满了模糊、低对比度、遮挡和旋转。更关键的是,现有鲁棒性研究只报告“模型变差了”,却从不追问:它到底是在哪一步推理上摔了跟头?是没看清化学式,还是搞错了空间结构,抑或是逻辑推导本身断裂了?这个诊断能力的缺失,正是BRUCE框架要填补的研究空白。

BRUCE如何诊断脆弱性

BRUCE如何诊断脆弱性
Figure 3: Left: Pareto Robustness Map showing the trade-off between mean corrupted accuracy [%] and Mean Robustness Corruption Index (RCIµ) across evaluated models and datasets. Lower-right regions indicate stronger robustness to corruption/perturbations. Right: Pareto Traversal Robustness map showing the trade-off between mean traversal ac- curacy [%] and Mean Traversal Robustness Corruption Index (Tµ). Lower-right regions indicate stronger robustness to progressive spatial information removal. Colors denote mod- els and marker shapes denote datasets.

图3的帕累托鲁棒性图是理解模型鲁棒性权衡的核心。左图展示腐败精度与RCI的关系,右图展示遍历精度与T-RCI的关系。重点关注右下区域的模型——它们同时具备高鲁棒精度和低退化速度。InternVL2.5-8B和Qwen2.5-VL-72B在多个数据集上占据这一优势位置。

最有力的发现

最有力的发现
Table 1 reports clean accuracy (ACL), corrupted accuracy under perturbations (ACR), and average and maximum values of the both robustness degradation metrics (RCIµ, RCImax, Tµ, and Tmax) across all evaluated datasets and models. The last two columns also illustrate the most fragile traversal direction (WD) and its corresponding T-RCI score (WT) to provide more insights into the traversal robustness analysis. In the following, we discuss the key observations from Table 1 and Figure 3 of Pareto-frontiers.

表1汇总了所有模型在所有数据集上的核心指标。注意对比同一模型在不同数据集上的RCI和T-RCI差异——这揭示了鲁棒性具有强烈的任务依赖性。同时关注最脆弱遍历方向(WD列),它暴露了模型对空间信息的非对称依赖。

结论与局限

结论与局限
Figure 5: Spatial traversal robustness curves under progressive directional cropping. Accu- racy is measured as increasing portions of the image are removed from four traversal direc- tions (top-down, bottom-up, left-to-right, and right-to-left). Qwen2.5-VL-7B shows stable degradation; GPT-4.1 exhibits progressive degradation; and, Gemini 3.5 Flash shows severe traversal sensitivity.

图5的空间遍历鲁棒性曲线揭示了三种典型的退化模式:Qwen2.5-VL-7B的稳定退化、GPT-4.1的渐进式退化、以及Gemini 3.5 Flash的剧烈敏感性。注意不同遍历方向下曲线的分离程度——分离越大,方向性脆弱性越强。

实验如何设计?

  • 数据集选择覆盖了科学推理的三个关键领域:ScienceQA Chemistry侧重基础化学概念的多模态问答,MMJEE Chemistry包含更具挑战性的化学竞赛级题目,MathVista MCQ则测试数学与视觉推理的交叉能力。
  • 七款评估模型代表了当前VLM生态的多样性:GPT-4.1和Claude Opus 4.7作为顶级闭源模型,Gemini 3.5 Flash作为轻量级闭源选项,Qwen2.5-VL-72B和InternVL2.5-8B作为高性能开源模型,LLaVA-NeXT-Mistral-7B作为通用开源基线,ChemVLM-8B作为领域专用模型。
  • 扰动协议覆盖四种单一扰动类型,每种设置多个严重级别:模糊从轻微高斯模糊到重度失焦,低对比度从正常到几乎不可辨认,裁剪从边缘小幅移除到中心区域大幅丢失,旋转从小角度倾斜到完全倒置。
  • 空间遍历沿四个方向(自上而下、自下而上、从左到右、从右到左)逐步移除图像区域,每次增加固定比例的裁剪,直至仅剩极小窗口。这模拟了关键信息可能出现在画面任意位置的现实场景。
  • 评估指标包括干净精度、腐败精度、平均RCI、最大RCI、平均T-RCI、最大T-RCI,以及最脆弱遍历方向及其对应的T-RCI值。失败分类基于模型在遍历诱导错误下的预测输出进行人工标注和统计。

关键结果与论文证据

  • InternVL2.5-8B在ScienceQA-Chemistry上取得最低平均RCI (0.065),同时保持高干净精度(85.11%)和腐败精度(84.04%),证明高鲁棒性并非以牺牲干净性能为代价(第10页)。
  • Qwen2.5-VL-72B在MathVista-MCQ和ScienceQA-Chemistry上取得最低平均T-RCI,并在ScienceQA-Chemistry上取得最高干净精度(87.23%),展现出全面的鲁棒性优势(第10页)。
  • GPT-4.1在MMJEE-Chemistry-MCQ上表现出最高的遍历退化(Tµ=0.501, Tmax=0.707),尽管其干净精度(21.74%)相对较高,说明闭源顶级模型在特定领域仍存在严重的空间脆弱性(第10页)。
  • Claude Opus 4.7在ScienceQA-Chemistry上记录最高平均RCI (0.348),这一反直觉的结果表明干净任务性能绝不自动转化为腐败鲁棒性(第10页)。
  • 符号推理失败在多数模型的遍历诱导错误中占主导地位,其中多步链式失败(5800例)是最普遍的显式推理失败类别,说明视觉信息损失最常破坏的是模型的逻辑推导链条(第22页)。
  • 帕累托鲁棒性图显示,腐败鲁棒性和遍历鲁棒性捕获的是不同的失败机制,模型在两种鲁棒性维度上的排名并不一致,因此需要分别评估(第9页)。
  • 空间遍历的方向性效应显著:Right-to-Left是多个模型在ScienceQA-Chemistry上的最脆弱遍历方向,这可能与化学结构式通常从左到右书写、关键官能团常位于右侧有关(第10页)。
  • ChemVLM-8B作为化学领域专用模型,并未在化学数据集上展现出明显的鲁棒性优势,说明领域专业化不一定带来鲁棒性提升(第10页)。

阅读时需要注意

  • 评估仅限于多项选择问答设置,未涵盖开放式生成任务,而后者在真实科学应用中更为常见,其鲁棒性退化模式可能更为复杂。
  • RCI和T-RCI的聚合权重默认设为均匀,未针对特定数据集进行调优,这可能掩盖某些扰动类型在特定领域中的不成比例影响。
  • 失败分类法中“其他”类别占比较大(5986例),表明存在大量复杂的复合失败机制难以归因到单一类别,这限制了分类法的诊断精度。
  • 扰动类型虽覆盖了常见的视觉退化,但真实世界的腐败往往以复合形式出现(如模糊叠加低对比度),BRUCE目前仅评估单一扰动的影响。

关联工作

  • Hendrycks & Dietterich (2019) 开创了常见腐败下的鲁棒性基准测试,但其工作聚焦于图像分类,未涉及多模态推理场景。
  • R-Bench (Li et al., 2024) 首次将鲁棒性评估引入多模态大模型领域,但使用聚合响应度量,未能揭示推理失败的具体模式。
  • Bench-C (Sui et al., 2025) 将鲁棒性评估从精度扩展到校准和置信度,但仍停留在聚合层面,未分析腐败如何传播为不同的推理失败类型。
  • ChemVLM (Li et al., 2025) 作为化学领域专用VLM的代表,其领域专业化策略在BRUCE评估中未转化为鲁棒性优势,提示领域知识注入与鲁棒性提升之间可能存在尚未解决的张力。

发表评论