自信但不可靠:对脑MRI视觉语言模型的行为安全审计

快速导读:对六款VLM在脑MRI上的审计表明,模型几乎回答所有问题且高度自信,但校准极差,准确率最高的模型在其错误上最为过度自信,医疗微调提升了肿瘤检测却未改善置信度可靠性。

视觉语言模型(VLM)在医学影像分析中展现出令人印象深刻的流畅性,但其口头表达的置信度与正确性之间的关系尚未得到充分审视。本文对六款指令微调VLM在脑MRI上进行了系统的行为安全审计,核心发现令人警醒:模型几乎回答所有问题且高度自信,但校准极差,准确率最高的模型在其错误上反而最为过度自信。

研究构建了一个无需新人工标注的自动评分审计框架,利用BraTS和IXI数据集的元数据和专家分割掩码自动生成切片级标签。通过五项多选题任务和开放式任务,评估了覆盖率、校准误差、错误答案平均置信度、高置信度错误率、幻觉和弃权行为等安全关键指标。结果表明,准确率提升并不等同于可靠性提升,医疗微调带来了肿瘤检测能力的提升,却以牺牲通用视觉能力和置信度可靠性为代价。

英文题目:Confident but Unreliable: A Behavioral Safety Audit of Vision–Language Models on Brain MRI

论文出处:arXiv 每日论文精选 · arXiv:2608.02790

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现代神经网络普遍存在校准不良和过度自信问题,这一现象自Guo等人2017年的经典研究以来已被广泛记录。在医学领域,Byun等人2026年的研究发现,医学VQA中的过度自信和校准问题持续存在,且不受思维链等提示策略的影响。Khanmohammadi等人2026年进一步报告,医学VLM的置信度无法可靠区分正确与错误答案,且对问题改写具有鲁棒性。

标准基准测试通常仅关注准确率,忽略了校准、自信错误和弃权等安全关键指标。在临床辅助场景中,一个高置信度的错误建议可能比一个低置信度的正确建议更具危害性,因为前者可能误导临床决策且不被质疑。脑MRI因其可从元数据和分割掩码自动获取真实标签的特性,成为研究VLM可靠性问题的理想高 stakes 测试平台。

此外,Li等人2023年指出大型VLM容易生成图像不支持的内容(幻觉),Zhu等人2026年发现医学多模态LLM在图像任务上性能可能低于其基础模型,归因于视觉表示流水线的退化。这些发现共同构成了本研究的背景:VLM在医学影像中的行为安全性需要超越准确率的系统审计。

核心创新

  • 提出一个可复现的审计协议,无需新标注即可评估VLM在脑MRI上的可靠性,包含切片级准确标签和一套涵盖覆盖率、校准、自信错误及弃权的度量套件。
  • 通过六款模型的试点证据,揭示了置信度与能力脱钩:覆盖率接近完全,校准普遍较差,且最准确的模型在其错误上最为过度自信。
  • 通过基础模型与医疗微调模型的家族对比,发现医疗适配以牺牲通用视觉任务性能为代价提升了肿瘤检测,但未改善置信度可靠性。

方法概览

构建了一个无需新人工标注的自动评分行为审计框架。使用来自BraTS和IXI的4102张脑MRI切片及70张非脑对照图像,通过采集元数据和专家分割掩码自动生成切片级标签。对六款指令微调VLM进行五项多选题任务测试,要求模型给出答案和0-100置信度,并评估覆盖率、校准误差(ECE、Brier)、错误答案平均置信度、高置信度错误率(CW-rate),以及开放式回答中的幻觉和弃权行为。

  • 审计框架设计:构建了一个无需新人工标注的自动评分行为审计框架。使用来自BraTS和IXI的4102张脑MRI切片及70张非脑对照图像,通过采集元数据和专家分割掩码自动生成切片级标签,涵盖肿瘤存在、肿瘤位置、侧化、脑/非脑识别等任务。
  • 模型面板:审计了六款指令微调VLM,包括通用模型(Gemma-4-12B、Gemma-3-4B、Qwen2.5-VL-7B、Qwen2.5-VL-3B、InternVL2.5-8B)和医疗专家模型(MedGemma-4B),以及基础模型与医疗微调版本的家族对比(Gemma-3-4B vs. MedGemma-4B)。
  • 任务设计:五项多选题(MC)任务要求模型给出答案和0-100置信度,同时进行开放式(OE)任务以评估幻觉和弃权行为。多选题涵盖肿瘤存在检测、肿瘤位置分类、侧化判断、脑/非脑识别等。
  • 评估指标套件:包括覆盖率(模型给出可评分答案的比例)、准确率和平衡准确率、ECE(期望校准误差)、Brier分数、错误答案平均置信度、高置信度错误率(CW-rate,置信度≥0.8的错误答案占比),以及开放式回答中的幻觉率和弃权适当性。
  • 提示策略:使用中性提示,未采用思维链或其他校准干预策略,以评估模型的原生行为。
  • 标签生成:肿瘤标签基于治疗后胶质瘤掩码和固定可见性阈值自动生成;侧化任务使用显示切片坐标,作为探索性压力测试而非临床定位基准。

逐图理解论文

一个令人警醒的发现

一个令人警醒的发现
Figure 1: Overall multiple-choice accuracy versus mean stated confidence on incorrect answers for the six audited VLMs (neutral prompts). Higher accuracy does not imply safer confidence behavior: Gemma-4-12B is the most accu- rate model overall, but it also has the highest confidence on its errors. Qwen2.5-VL-7B is less accurate but substantially less overconfident when wrong.

Figure 1以散点图形式直观展示了准确率与错误答案平均置信度的关系。Gemma-4-12B位于右上角(高准确率、高过度自信),Qwen2.5-VL-7B位于左下区域(较低准确率、较低过度自信),直观证实了准确率提升并不带来更安全的置信度行为。

审计框架与核心贡献

审计框架与核心贡献
Table 1: Reliability summary (neutral prompts, MC). “Conf. wrong” is the mean stated confidence on incorrect answers; “CW-rate” is the fraction of answered items that are high-confidence (≥0.8) and wrong. Lower is better for ECE, Brier, Conf.

Table 1展示了六款VLM在多项选择题上的可靠性摘要。重点关注ECE、错误答案平均置信度和CW-rate三列:所有模型的ECE均高于0.27,错误答案平均置信度均高于0.81,表明校准普遍较差且过度自信严重。Gemma-4-12B准确率最高但错误答案平均置信度也最高(0.968),揭示了准确率与置信度可靠性的脱钩。

医疗微调的代价

医疗微调的代价
Table 2: Compact task-resolved patterns (neutral prompts, MC). We report ranges and representative magnitudes rather than the full model-by-task matrix. BA = balanced accuracy.

Table 2呈现了按任务分解的紧凑模式。注意医疗微调模型MedGemma-4B在肿瘤存在检测上的平衡准确率(0.58)优于其基础模型(0.46),但在脑/非脑识别上(0.66)远低于通用模型(0.91-0.99),清晰展示了医疗适配的权衡效应。

实验如何设计?

  • 数据集:BraTS(脑肿瘤分割)和IXI(健康脑影像)共4102张脑MRI切片,另加70张非脑对照图像(OOD样本)用于评估弃权行为。
  • 任务类型:五项多选题任务(肿瘤存在、肿瘤位置、侧化、脑/非脑识别等)和开放式任务,所有任务均要求模型输出答案和置信度。
  • 评估流程:对每个模型在每个任务上的回答进行自动评分,计算覆盖率、准确率、平衡准确率、ECE、Brier分数、错误答案平均置信度、CW-rate、幻觉率和弃权率。
  • 对比维度:通用模型与医疗专家模型的对比,基础模型与医疗微调版本的家族内对比(Gemma-3-4B vs. MedGemma-4B)。
  • 负对照:70张非脑图像用于评估模型在分布外输入上的弃权行为,弃权估计仅为描述性。

关键结果与论文证据

  • 覆盖率接近完全:所有模型几乎回答所有问题,覆盖率接近1.0,表明模型缺乏有效的弃权机制(第3页)。
  • 校准普遍较差:ECE范围从0.272(Qwen2.5-VL-7B)到0.404(Gemma-3-4B),所有模型的校准误差均处于较高水平(第3页,Table 1)。
  • 准确率与过度自信脱钩:Gemma-4-12B总体准确率最高(0.670),但其错误答案平均置信度也最高(0.968),高置信度错误率(CW-rate)为0.330;而准确率较低的Qwen2.5-VL-7B错误答案平均置信度仅为0.819(第3页,Table 1和Figure 1)。
  • 医疗微调的双刃剑效应:MedGemma-4B在肿瘤存在检测上的平衡准确率(0.58)优于其基础模型Gemma-3-4B(0.46),但脑/非脑识别平衡准确率(0.66)远低于通用模型(0.91-0.99),表明医疗适配以牺牲通用视觉能力为代价(第3页,Table 2)。
  • 幻觉与弃权行为:幻觉率范围从0.031(InternVL2.5-8B)到0.130(Gemma-3-4B);弃权率范围从0.368(Qwen2.5-VL-3B)到0.750(Gemma-4-12B),但弃权行为与准确性无一致关联(第4页,Table 3)。
  • 准确率最高的模型开放式幻觉率最高:Gemma-4-12B在开放式任务中幻觉率最高,进一步证实准确率提升并不等同于可靠性提升(第4页)。
  • 与先前研究一致:本研究的ECE范围与Khanmohammadi等人2026年的报告一致,验证了医学VLM校准问题的普遍性(第4页)。

阅读时需要注意

  • 审计使用单张2D切片和多选题格式,更丰富的上下文(如3D体积或临床病史)可能提高准确率,但未必解决校准或弃权问题。
  • 审计的是模型自报的置信度,而非重新校准后的置信度,跨模型校准排名部分反映了各模型表达确定性的训练方式差异。
  • 肿瘤标签基于治疗后胶质瘤掩码和固定可见性阈值,而非放射科医生复读;侧化任务使用显示切片坐标,是探索性压力测试而非临床定位基准。
  • 负对照集较小(70张图像),弃权估计仅为描述性,不足以得出统计显著性结论。
  • BraTS和IXI为公开数据集,无法排除训练数据暴露的可能性,但审计评估的是受控提示下的切片级视觉行为。
  • 模型面板包含六款模型,结果仅适用于此分布,不构成临床诊断声明。

关联工作

  • Guo等人2017年的经典研究指出现代神经网络普遍存在校准不良和过度自信问题,为本研究提供了理论基础。
  • Byun等人2026年发现医学VQA中过度自信和校准问题持续存在,且不受思维链等提示策略影响,与本研究结论一致。
  • Khanmohammadi等人2026年报告了医学VLM的置信度无法可靠区分正确与错误答案,其ECE范围与本研究一致。
  • Li等人2023年指出大型VLM容易生成图像不支持的内容(幻觉),本研究在医学场景下验证了该现象。
  • Zhu等人2026年发现医学多模态LLM在图像任务上性能可能低于其基础模型,归因于视觉表示流水线退化,与本研究医疗微调导致通用视觉能力下降的发现一致。

发表评论