无根基的注意力:医学VLM热力图为何不可信

三分钟导读:该研究通过因果扰动和受控定位指标审计发现,当前主流医学视觉语言模型(VLM)的注意力热力图虽看似合理,但并未真正锚定驱动预测的图像证据,且无法通过随机控制测试。

英文题目:Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

论文出处:arXiv 每日论文精选 · arXiv:2607.18577

原始论文:PDF / 论文页面

对应视频标题:无根基的注意力:医学VLM热力图为何不可信|推荐指数:★★★★★

这篇论文解决什么问题?

医学VLM生成的注意力热力图是否忠实反映了驱动模型输出的实际图像证据,目前缺乏因果层面的验证,仅靠视觉检查不可靠。

核心创新

  • 提出包含因果扰动(16×16 patch occlusion)的三轴验证协议,要求热力图必须同时满足图像使用度和注意力-因果对齐。
  • 发现减少释义翻转率的微调(如LoRA)并未改善模型对解剖结构的因果 grounding,反而可能降低图像使用率。
  • 证明VLM的注意力与因果重要性呈负相关或无关,而专用CXR分类器(DenseNet/ResNet)能通过相同的严格测试。

方法概览

提出三轴解释验证协议:(1) 在PadChest上测试与放射科医生边界框的重叠度(对比移位、随机远距和随机大小框);(2) 在CheXlocalize上测试像素掩码指标(pointing-game, AMiM, pixel-AP);(3) 通过16×16补丁遮挡进行因果扰动,记录预测边际变化以构建因果重要性图。

逐图理解论文

方法:三轴解释验证协议

方法:三轴解释验证协议
Fig. 1. Explanation-validation protocol. A saliency map (pipeline, top) is tested along three independent axes: (i) controlled overlap against shifted, random-far, and random- size bounding boxes on PadChest; (ii) pixel-mask metrics (pointing-game, attribution mass in mask, pixel-AP) against radiologist segmentations on CheXlocalize; (iii) causal perturbation via 16×16 patch occlusion (256 forward passes per case). A heatmap is faithful only if overlap exceeds the controls and high-saliency patches are causally important; in this audit every evaluated VLM fails at least one axis, while the CXR- trained classifier controls pass all three.

本研究提出三轴解释验证协议:首先,在PadChest上测试与放射科医生边界框的重叠度,对比移位、随机远距和随机大小框;其次,在CheXlocalize上测试像素掩码指标,包括pointing-game、AMiM和pixel-AP;最后,通过16×16补丁遮挡进行因果扰动,记录预测边际变化以构建因果重要性图。

实验设置:模型与数据集

实验设置:模型与数据集
Table 1. Models evaluated. LoRA adapters use rank 16, α=32, dropout 0.05, lr 2×10−4, batch 8, at n=500 binary-presence and n=12K multi-task scales; the 98 pres- ence test items are held out from both. Classifiers use class-specific Grad-CAM [22] upsampled to 224×224.

我们在PadChest和CheXlocalize数据集上评估了MedGemma-4B变体、LLaVA-RAD、Qwen3-VL、CheXagent-2-3b及CXR分类器基线。使用六种归因方法,包括Raw attention、Attention rollout、Gradient attention、Winsor-CAM、Integrated gradients和RISE进行对比。

结果:VLM的因果失败

结果:VLM的因果失败
Table 3 summarises patch-occlusion causal grounding across the MedGemma variants and cross-family probes on PadChest. Spearman ρ between raw-attention saliency and the causal-importance map is negative for every MedGemma variant (−0.098 base, −0.050 targeted LoRA, −0.168 full LoRA at n=500), persisting at the n=12K multi-task scale-up. Qwen3-VL agrees in direction (ρ=−0.117 on its native 8×8 grid, n=637). LLaVA-RAD reverses sign (ρ=+0.137), but its causal AMiM is close to zero (0.005 vs. 0.066 attention): it barely uses the image, so its attention agrees with the very small causal signal that exists, not clinical

结果显示,MedGemma变体与Qwen3-VL的注意力-因果Spearman ρ为负值,分别为-0.098至-0.168。LLaVA-RAD虽为正,但其因果AMiM接近零,表明其几乎不使用图像信息。所有VLM在CheXlocalize上的AMiM均不超过22%,而CXR分类器在相同图像和类别上产生显著更大的差距。

结果:分类器的优势

结果:分类器的优势
Table 2. Attribution method comparison on CheXlocalize (n=643). PG: pointing- game hit rate (%). AMiM: attribution mass in mask. Pixel-AP: pixel average precision. ∆: gap between true and shuffled-mask saliency (positive favors true). Best VLM ∆ per metric is bold. Among VLMs no method exceeds 22% AMiM; rollout and Winsor- CAM give ∆≈0. Both CXR classifiers produce larger gaps on the same images and classes (p<10−4).

相比之下,DenseNet-CXR在插入/删除协议中显示显著效应,插入AUC为0.690,而随机为0.666。所有VLM效应微弱,边际变化绝对值不超过0.024。这表明专用分类器在因果接地方面表现更好,而VLM的注意力机制并未真正锚定图像证据。

讨论:视觉检查的不足

讨论:视觉检查的不足
Fig. 2. Qualitative attribution comparison on three CheXlocalize cases. Columns show the CXR, radiologist mask, MedGemma-4B base methods, DenseNet-CXR Grad-CAM, and Qwen3-VL raw attention. MedGemma maps are broad or near-empty and Qwen3- VL is nearly uniform; DenseNet-CXR is the only method whose peak reliably falls near the mask.

视觉检查热力图不足以验证接地,需结合受控定位指标和因果扰动。高释义一致性不等于因果接地,甚至可能伴随图像使用率的下降。LLaVA-RAD的正相关ρ是虚假的,源于其几乎不使用图像(因果信号接近零)。

实验与关键结果

  • 在PadChest (n=637) 和 CheXlocalize (n=643) 数据集上评估MedGemma-4B变体、LLaVA-RAD、Qwen3-VL、CheXagent-2-3b及CXR分类器基线。
  • 使用六种归因方法(Raw attention, Attention rollout, Gradient attention, Winsor-CAM, Integrated gradients, RISE)进行对比。
  • 在VinDr-CXR (n=300) 上进行二次复现测试。
  • MedGemma变体与Qwen3-VL的注意力-因果Spearman ρ为负值(-0.098至-0.168),LLaVA-RAD虽为正(+0.137)但其因果AMiM接近零(0.005)。(第 5 页)
  • 所有VLM在CheXlocalize上的AMiM均不超过22%,而CXR分类器在相同图像和类别上产生显著更大的差距(p<10^-4)。(第 6 页)
  • LLaVA-RAD的文本-only一致性高达99.1%,表明其几乎不使用图像信息。(第 5 页)
  • DenseNet-CXR在插入/删除协议中显示显著效应(insertion AUC 0.690 vs random 0.666),而所有VLM效应微弱(|∆AUC| ≤0.024)。(第 7 页)

阅读时需要注意

  • 因果图使用16×16 token网格,可能掩盖亚补丁级别的病理细节。
  • Qwen3-VL因内存限制仅在8×8网格上评估。
  • 未涵盖具有显式grounding头(如MIMO)的架构。
  • 仅评估了特定类型的医学VLM和归因方法,未穷尽所有可能性。
  • 视觉检查热力图不足以验证grounding,需结合受控定位指标和因果扰动。
  • 高释义一致性(paraphrase consistency)不等于因果grounding,甚至可能伴随图像使用率的下降。
  • LLaVA-RAD的正相关ρ是虚假的,源于其几乎不使用图像(因果信号接近零)。

关联工作

  • Ribeiro et al. (CheckList):行为测试NLP模型,强调超越准确率的行为测试。(第 3 页)
  • Sadanandan & Behzadan (PSF-Med):同行工作,测量医学VLM的释义敏感性,本文复用其LoRA checkpoint。(第 3 页)
  • Sadanandan & Behzadan (Mechanistically guided LoRA):同行工作,通过机制引导的LoRA提高释义一致性,本文评估其grounding效果。(第 3 页)
  • Saporta et al. (CheXlocalize):提供CheXlocalize数据集和基准,用于评估胸片解释的显著性方法。(第 2 页)
  • Chen et al. (MIMO):提及具有视觉指代和多模态像素grounding输出的模型,作为未来研究方向。(第 9 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

无锚定的注意力: 医学视觉语言模型中视觉解释的因果评估

Binesh Sadanandan 和 Vahid Behzadan

SAIL 实验室,新罕布什尔大学,西黑文,康涅狄格州,美国 {bsada1@unh,vbehzadan@}newhaven.edu

摘要。注意力和显著性热力图越来越多地被用作医学视觉语言模型(VLM)在胸部 X 光片(CXR)上输出的解释,但热力图是否指向实际驱动答案的图像证据,尚未通过因果方式进行测试。我们从三个维度审计解释的忠实度:在 PadChest [4] 上与放射科医生边界框的重叠(n=637),在 CheXlocalize [12] 上放射科医生像素掩码内的归因质量(Attribution Mass in Mask, AMiM)(n=643),以及记录哪些区域被隐藏时会改变预测的 16×16 补丁遮挡(Patch occlusion)因果图。我们在 LLaVA-RAD [1] 上使用跨族探针评估了三种 MedGemma-4B 变体 [21,18] 和 Qwen3-VL-8B-Instruct [24],以及专家模型 CheXagent-2-3b [29];两个经过 CXR 训练的分类器(DenseNet121, ResNet50)[22,23] 作为阳性对照。一个忠实的热力图必须同时满足两点:它必须落在图像中模型实际使用的区域,并且它的注意力变化必须与遮挡变化一致。没有经过评估的 VLM 同时满足这两点。MedGemma 变体和 Qwen3-VL 探针使用了图像,但它们的注意力与补丁遮挡因果重要性呈负相关(-0.098 基础模型,-0.050 目标 LoRA,-0.168 全量 LoRA,-0.117 Qwen3-VL;所有 95% 自举置信区间均低于零)。LLaVA-RAD 的注意力呈正相关,但这仅仅是因为它几乎不使用图像(99.1% 纯文本一致性,因果质量接近零),因此其斯皮尔曼等级相关系数(Spearman ρ)是两个接近零的信号的结合。注意力也未能命中标注的解剖结构:真实区域的重叠率从未超过移位或随机对照组,且没有任何方法将其超过 22% 的质量放置在放射科医生的掩码内。两个经过 CXR 训练的分类器通过了相同的协议(在所有指标上,随机打乱后的 p<10−4),因此失败是热力图特有的,而非指标的问题。这些热力图令人安心但并不可靠:临床解释需要受控的定位指标和因果扰动,而不仅仅是视觉检查。

关键词:视觉解释 · 解释忠实度 · 注意力锚定 · 因果扰动 · 医学 VLM。

1 引言

当放射学 VLM 声称“存在心脏肥大”时,自然的后续问题是:图像的哪一部分驱动了该答案?通常的回答是注意力

第 2 页

热力图。如果高亮区域落在心脏轮廓上,解释就会让人感到安心。但安心并非证据。我们询问这些热力图是否指向具有临床意义的图像证据,以及何种因果探针可以佐证这一判断,这是一个仅凭视觉检查无法解决的解释性问题。

注意力作为解释的忠实度在语言模型中存在争议 [8,9],且在胸部 X 光分类器中表现有限 [12]。对于联合对文本和图像 token 进行注意力机制并通过生成式解码的视觉语言模型(VLMs),其是否产生更忠实的解释尚未定论;我们将评估扩展至多种归因方法、受控的边界框和像素掩码基线,以及补丁级别的因果扰动。

我们研究了 MedGemma-4B [21] 的三种配置:基础模型、针对第 15–19 层的目标低秩适应(LoRA)[18],以及覆盖所有 34 层的完整 LoRA。三种跨架构探针用于测试该行为是否具有架构特异性。LLaVA-RAD [1] 是一个带有 BiomedCLIP-CXR 编码器的 7B Vicuna 模型;Qwen3-VL-8B-Instruct [24] 是一个通用 VLM;CheXagent-2-3b [29] 是胸部 X 光专家模型。两个经过 CXR 训练的分类器 DenseNet121-Chex 和 ResNet50-All 通过 Grad-CAM [22,23] 提供正向定位控制。这些家族涵盖了广泛范围的视觉编码器和解码器,因此一致的失败不能归咎于单一架构。我们在 MIMIC-CXR [5] 上进行评估,在 PadChest [4] 上使用放射科医生的边界框对 n=637 个病例进行评估,并在 CheXlocalize [12] 上使用像素掩码对涵盖十种病理的 n=643 个病例进行评估。

贡献。我们提出三项主张,每项主张均通过因果扰动而非视觉检查确立。(i) 在所有评估的医疗 VLM 中,注意力和显著性热力图并未追踪因果重要性:真实区域的重叠率并未超过随机控制,且 MedGemma 变体和 Qwen3-VL 的注意力-因果斯皮尔曼等级相关系数(Spearman ρ)为负,LLaVA-RAD 仅因其因果质量接近零而反转了符号。(ii) 这种失败并非方法、模态或指标的伪影:它在六种归因方法中均成立,包括公理化的积分梯度 [27] 和模型无关的 RISE [25],而相同的协议在 CXR 训练的分类器基线中检测到了强定位能力。(iii) 接地(Grounding)是可以实现的,但并非通过这些通用医疗 VLM 实现:CXR 专家在其匹配的标注风格上具有因果接地,但在第二个数据集上则没有,且减少释义翻转(paraphrase flips)的微调并未改善接地。

我们未声称的内容。我们并未声称所有 VLM 解释都失败,也未声称分类器基线在临床上更优越,或我们已穷尽归因方法的空间。实际主张是狭窄且可证伪的:对这些热力图的视觉检查并非接地(Grounding)的可靠测试。

2 相关工作

注意力忠实度在自然语言处理(NLP)中存在争议 [8,9],并已在胸部 X 光分类器中进行基准测试 [12,26,15]。医疗 VLM 可信度基准测试衡量

第 3 页

医学视觉语言模型中缺乏接地(Grounding)的注意力机制 3

视觉语言模型 (VLM) 基于 CXR 训练的分类器 · 控制 01 输入 02 模型 03 归因

04 显著性

胸部 X 光 + 问题 回答问题 提取热力图 “是否存在发现 X?” MedGemma 4B 原始注意力 显著性图 LLaVA-RAD 注意力回滚 16 × 16 令牌网格 MIMIC-CXR PadChest × Qwen3-VL 梯度 × 注意力 CheXlocalize DenseNet-CXR Winsor-CAM

05 验证 三个独立轴;全部通过,否则热力图不具备忠实性。

轴 I 轴 II 轴 III 因果

受控重叠 像素掩码指标 因果扰动 真实边界框 偏移框 指认游戏 (Pointing-game) AMiM 补丁遮挡 (Patch occlusion) 256/例 · 随机远距 随机大小 像素 AP ROI 删除 vs. 随机

图 1. 解释验证协议。热力图(管道,顶部)沿三个独立轴进行测试:(i) 在 PadChest 上针对偏移框、随机远距框和随机大小框的控制重叠;(ii) 在 CheXlocalize 上针对放射科医生分割的像素掩码指标(指认游戏 (Pointing-game)、掩码内的归因质量 (AMiM)、像素 AP);(iii) 通过 16×16 补丁遮挡(每例 256 次前向传播)进行因果扰动。仅当重叠超过控制组且高显著性补丁在因果上重要时,热力图才具备忠实性;在此次审计中,每个被评估的 VLM 至少在某个轴上失败,而基于 CXR 训练的分类器控制组通过了所有三个轴。

释义敏感性 (Paraphrase sensitivity) [17,3]、模态偏差 (modality bias) [14]、幻觉 (hallucination) [11,10] 以及分布偏移下的不确定性 (uncertainty under shift) [19] 分别被单独考察。同期研究发现,视觉语言基准测试几乎未检验视觉接地 (visual grounding) [30],医学 VLM 在社会压力下以接地 (grounding) 换取阿谀奉承式的同意 [31],并且在罕见发现上默认使用解剖学先验 [32];我们增加了对这些模型生成的热力图的直接因果忠实性审计。机制研究 [18] 将释义一致性追溯至第 17 层的稀疏自编码器特征,并通过定向 LoRA 减少翻转;我们复用了该检查点,并贡献了接地 (grounding)、多方法归因和反事实分析。

3 方法

3.1 模型与数据集

我们在六个模型家族(表 1)中评估了八种配置:MedGemma-4B-IT [21] 的三种配置、两个跨家族 VLM 探针、一个胸部 X 光专科 VLM,以及两个基于 CXR 训练的分类器基线。

第 4 页

4 B. Sadanandan 和 V. Behzadan

表 1. 评估的模型。LoRA 适配器使用秩 16,$\alpha=32$,dropout 0.05,学习率 $2\times10^{-4}$,批次大小 8,在 $n=500$ 的二元存在性任务和 $n=12\text{K}$ 的多任务规模下;98 个存在性测试项从两者中留出。分类器使用类特定的 Grad-CAM [22] 并上采样至 $224\times224$。

| 模型 | 骨干网络/配置 | 角色 | | :— | :— | :— | | MedGemma-4B | Base Gemma | 2 + SigLIP; 256 tokens | | Targeted LoRA | rank-16 Q/K/V, L15–19; SAE feature(16×16)3818 @ L17 [6] | tuned VLM | | Full LoRA | rank-16 all projections, L0–33 | tuned | | LLaVA-RAD-7B [1] | Vicuna-7B + BiomedCLIP-CXR | probe | | Qwen3-VL-8B-Instruct [24] | general-purpose dense VLM (8×8 grid) | probe | | CheXagent-2-3b [29] | chest-X-ray specialist VLM | decision | | DenseNet121-Chex [23] | densenet121-res224-chex @ features.norm5 | control | | ResNet50-All [23] | resnet50-res512-all (multi-dataset) @ model.layer4 | control |

数据集。MIMIC-CXR [5](98 个二元存在性问题,每个问题有 3–5 个释义,经认证);PadChest [4](861 个二元问题,其中 637 个带有放射科医生在八个发现组上的边界框,公开);CheXlocalize [12] 验证集(643 个样本,涵盖十种病理的像素掩码,公开);以及 VinDr-CXR [28]($n=300$ 个带有放射科医生边界框的存在性问题)作为次要复制集。释义来自基于五种语言现象的模板规则,并使用 BioClinicalBERT [20] 余弦相似度 > 0.95 进行过滤;未使用任何由 LLM 生成的文本。

可复现性。MedGemma-4B-IT [21]、LLaVA-RAD [1]、Qwen3-VL-8B-Instruct [24] 以及通过 TorchXRayVision [23] 获得的 DenseNet-CXR 权重在其许可证下可用;LoRA 遵循 Hu 等人 [2] 的默认设置,层选择来自 [18]。所有指标均报告 95% 的 Bootstrap 置信区间(2000 次重采样)。按病理分组的配对置换检验(真实显著性图 vs. 随机打乱显著性图,10,000 次重采样)在 CheXlocalize 的十种病理上经过 Holm-Bonferroni 校正,$\alpha=0.05$;池化配对 Cohen's $d$ 用于量化效应量。即使是功能最强的 VLM 配置(Full LoRA,gradient-attention)也表现出异质性:10 种病理中有 8 种在至少一个指标上具有 Holm 显著性,唯一的例外是两种患病率最低的类别(气胸 $n=8$,肺部病变 $n=1$);统计功效充足的类别($n=33–125$)主导了聚合结果。代码和评估协议位于 https://github.com/thedatasense/medicalvlm_attention_without_grounding;$n=12\text{K}$ 的 LoRA 适配器是一个 Hugging Face 集合。1 CheXagent-2-3b 需要单独的 Transformers 4.40 / float32 环境。

3.2 评估协议

该协议(图 1)包含三个维度。Grounding 重叠度:来自最后一个文本 token 到 256 个图像 token 的注意力,在头和层 10–20 上平均,并在第 90 百分位数处进行阈值处理,针对边界框掩码与真实值、偏移、随机远端和随机大小控制(具有九组层扫描)进行评分。像素掩码归因:四种方法(原始注意力、attention rollout [13]、gradient-attention 乘积 [7]、Winsor-CAM),上采样至 $224\times224$

1 https://huggingface.co/collections/saillab/mechanistically-guided-lora-chil-2026-69ff7afccce7547a00180b2a

第 5 页

医学视觉语言模型中缺乏锚定的注意力机制 5

并通过指认游戏命中率、掩码内的归因质量(AMiM)以及配对置换下的像素级平均精度(pixel-AP)与放射科医生掩码进行评分对比。反事实扰动:补丁遮挡对每个补丁进行均值填充,并记录边际偏移 $\delta_{r,c} = m_{\text{orig}} – m_{\text{occluded}}$(当遮挡某个补丁导致答案边际降低时为正),从而构建 $16 \times 16$ 的因果图;主表针对带符号的偏移量进行相关性分析,各方法间的比较则针对 $|\delta_{r,c}|$ 进行。我们在此维度上增加了积分梯度 [27] 和 RISE [25](共六种方法),并报告插入/删除 AUC。全文使用中灰色填充,这是已知的协议选择。

4 实验与结果

行为背景。伴随研究 [17,18] 表明,释义敏感性的降低与图像使用率的降低相一致(LLaVA-RAD:99.1% 纯文本一致性;Full LoRA:高达 77.9%),这引发了对这些热力图是否具有锚定性的质疑。

4.1 注意力锚定失败

边界框重叠。对于 PadChest 数据集(n=637)上的基础 MedGemma 模型,真实边界框的注意力覆盖率(0.037,95% CI 0.031–0.044)是四种条件中最低的,低于偏移框(0.042)、随机远距离框(0.052)和随机大小框(0.048)。该模式在两种 LoRA 变体以及跨九个组的层扫描中均保持一致,因此并非层选择的人工产物。LLaVA-RAD 的表现更弱(真实边界框覆盖率仅为 1.2%)。

像素掩码的多方法评估(表 2;图 2)。在 CheXlocalize [12] 像素掩码(n=643)上,没有任何 VLM 归因方法将超过 22% 的显著性质量放置在放射科医生掩码内。梯度-注意力乘积达到了最高的 VLM 指认游戏得分(44–51%),但 AMiM 保持在 $\le 0.20$;原始注意力随着微调而改善(PG 从 7.2% 提升至 42.9%),但 AMiM 饱和在 0.214;Rollout 和 Winsor-CAM 处于或低于随机掩码基线,而 Qwen3-VL 探针表现最弱(PG 恰好为 0%)。相比之下,经过 CXR 训练的分类器在所有指标上均产生 $p<10^{-4}$ 的显著差异(相对于随机打乱),因此 VLM 的负面结果并非成像模态或定位指标带来的人工产物。

4.2 反事实扰动

表 3 总结了 PadChest 上 MedGemma 变体及跨家族探针的补丁遮挡因果锚定情况。原始注意力显著性与因果重要性图之间的斯皮尔曼等级相关系数(Spearman ρ)对于每个 MedGemma 变体均为负值(n=500 时:基础模型 -0.098,目标 LoRA -0.050,全量 LoRA -0.168),在 n=12K 的多任务扩展中依然持续。Qwen3-VL 在方向上保持一致(在其原生 $8 \times 8$ 网格上 $\rho=-0.117$,n=637)。LLaVA-RAD 的符号相反($\rho=+0.137$),但其因果 AMiM 接近于零(0.005 对比 0.066 的注意力):它几乎不使用图像,因此其注意力与存在的极小因果信号一致,而非临床

第 6 页

6 B. Sadanandan 和 V. Behzadan

表 2. CheXlocalize 上的归因方法比较 (n=643)。PG:指认游戏命中率 (%)。AMiM:掩码内的归因质量。Pixel-AP:像素平均精度。∆:真实掩码与随机打乱掩码显著性之间的差距(正值有利于真实情况)。每种指标下表现最好的 VLM 已加粗。在 VLM 中,没有方法的 AMiM 超过 22%;rollout 和 Winsor-CAM 给出 ∆≈0。相同的图像和类别上,两个 CXR 分类器产生的差距更大 (p<10−4)。

PG (%) AMiM Pixel-AP

方法 模型 真实 ∆ 真实 ∆ 真实 ∆

原始注意力 基础模型 7.2 +3.9 0.158 +0.043 0.211 +0.073 定向 LoRA 21.0 +12.0 0.189 +0.059 0.264 +0.107 完整 LoRA 42.9 +22.6 0.214 +0.066 0.340 +0.149 注意力 rollout 所有 3 个 MedGemma 0.3 +0.2 0.073 ≈0 0.068 ≈0 梯度注意力 基础模型 44.3 +20.8 0.178 +0.044 0.296 +0.113 定向 LoRA 39.7 +17.1 0.176 +0.044 0.279 +0.103 完整 LoRA 50.9 +26.4 0.200 +0.057 0.333 +0.139

Winsor-CAM 基础模型 12.0 +2.2 0.109 +0.004 0.143 +0.018 定向 LoRA 7.9 完整 LoRA 9.8 −0.2+3.1 0.0990.103 +0.002+0.006 0.1260.120 +0.015+0.010

跨架构探针: 原始 注意力 LLaVA-RAD 原始 注意力 Qwen3-VL-8B 0.0 0.2 −0.2+0.0 0.0760.063 +0.015+0.005 0.1030.081 +0.006+0.017

仅定位基线(CXR CNN 分类器,n=536 匹配发现): Grad-CAM DenseNet-CXR-Chex 37.5 +12.5 0.209 +0.046 0.306 +0.074 Grad-CAM ResNet50-CXR-All 28.7 +13.6 0.170 +0.043 0.213 +0.060

解剖结构。对于三个 MedGemma 变体,AMiM 差异(因果 − 注意力)为正且显著 (pperm<0.001, n=474),完整 LoRA 变体最大,该变体的翻转率最低:一致性改进的微调并未使注意力与因果关系对齐。仅保留 n=474 张图像,所有五个模型的处理结果均保持这一模式,所有 95% 置信区间均不包含零。 这种不匹配并非原始注意力特有(表 3,下半部分):rollout、梯度×注意力以及公理化积分梯度 [27] 与每个 MedGemma 变体的因果重要性均呈负相关(−0.18 至 −0.28 相对于绝对位移因果图,n=474,置信区间不包含零),Winsor-CAM 接近零,而模型无关的 RISE [25] 接近均匀分布(ρ 在 +0.009 和 +0.010 之间,对 N=1500 个掩码稳定),因为模型对随机掩码几乎没有反应。 第二个标注数据集(VinDr-CXR)。接地失败在 VinDr-CXR [28] 上复现(n=300 个存在性问题,每个模型对应放射科医生标注框)。放射科医生框内的注意力质量保持在较低水平(0.075–0.105),低于因果图(0.100–0.133),且真实框的 AMiM 仅在 27–33% 的案例中超过随机打乱的控制组,因此注意力再次未能集中在标注的解剖结构上。注意力-因果相关性接近零(ρ=+0.061 基础模型,+0.061 定向 LoRA,+0.053 完整 LoRA),因此注意力在第二个数据集上也不追踪因果重要性;残差相关性在符号上依赖于数据集(|ρ| < 0.17 始终成立),这本身也是不应将热力图-因果对齐视为可靠的原因。

第 7 页

医学视觉语言模型中缺乏锚定的注意力机制 7

DenseNet-CXR Qwen3-VL CXR Mask Raw attention Attention rollout Gradient×attention Winsor-CAM Grad-CAM raw attention Cardiomegaly

Atelectasis

Effusion Pleural

Radiologist mask

图 2. 三个 CheXlocalize 案例的定性归因比较。各列分别显示 CXR、放射科医生掩码、MedGemma-4B 基础方法、DenseNet-CXR Grad-CAM 以及 Qwen3-VL 原始注意力。MedGemma 的映射图要么过于宽泛,要么几乎为空;Qwen3-VL 则几乎呈均匀分布;DenseNet-CXR 是唯一一个峰值可靠地落在掩码附近的方法。

CXR 专用 VLM(CheXagent):锚定具有数据集依赖性。 CheXagent-2-3b [29] 不暴露跨模态注意力,因此我们通过仅基于边界的 ROI 测试(遮挡放射科医生标注框与遮挡一个随机同尺寸区域)来探测其决策。它在 PadChest 上未表现出锚定特性(+0.038,95% CI [−0.025, +0.100]),但在 VinDr-CXR 上表现出锚定特性(灰度 +0.568,模糊 +0.692);在模糊条件下效应增强,排除了灰度-不透明度伪影的可能性。专用 VLM 可能在其匹配的标注风格上具有因果锚定特性,但并非普遍如此。 插入/删除保真度。在标准的插入/删除协议(每个 VLM n=200)下,DenseNet-CXR 显示出真实的显著性效应(插入 AUC 0.690 对比随机 0.666,∆=+0.024,pper m<10−4),而所有五个 VLM 的效应均均匀地微小(|∆AUC| ≤0.024)。VLM 方法在三个探测任务(标注对齐、输入-归因对齐、跨架构健全性检查)中均沿同一方向失败,而 DenseNet 通过了标注和插入探测任务,因此该结果在独立维度上均成立,而非仅依赖于单一指标。

第 8 页

8 B. Sadanandan 和 V. Behzadan

表 3. PadChest 上的补丁遮挡因果接地(Causal Grounding)。上部:原始注意力(raw-attention)斯皮尔曼等级相关系数(Spearman ρ)与有符号因果图(signed causal map)的对比;AMiM ∆ 为放射科医生边界框内的因果质量减去注意力质量(如所示,pperm<0.001;ρ 的 95% 置信区间)。下部:各方法的 ρ 与绝对边际偏移(absolute margin shift)的对比,解释了为何原始注意力与有符号 ρ 值存在差异。在 24 倍规模扩展下,负 ρ 值依然持续存在。

模型 ρ 95% CI L1 因果注意力 ∆

MedGemma 基础 系列 (n=474; 16×16 网格): 1.440 0.148 0.087 +0.061 定向 LoRA (500) −0.098 [−0.121,−0.075] 1.442 0.147 0.085 +0.062 定向 LoRA (12K MT) −0.050 [−0.071,−0.030] 1.388 0.160 0.092 +0.068 全参数 LoRA (500) −0.115 [−0.136,−0.095] 1.433 0.180 0.091 +0.088 全参数 LoRA (12K MT) −0.168 [−0.190,−0.146] 1.443 0.162 0.085 +0.077 −0.145 [−0.167,−0.123] 跨系列探测 (n=637; 原生网格): Qwen3-VL-8B LLaVA-RAD (8×8) −0.117+0.137 [−0.130,−0.104][+0.117,+0.156] 1.4811.276 0.0310.005 0.1980.066 −0.167 (16×16) −0.062 各方法的 ρ 与绝对偏移因果图 (n=474; RISE n=200, N=320):

方法 基础 定向 LoRA 全参数 LoRA

原始 注意力 注意力 rollout −0.263 −0.202 −0.253 梯度 注意力 −0.257 −0.178 −0.238 Winsor-CAM× −0.243 −0.189+0.052 −0.258+0.040 积分梯度 −0.059 RISE −0.276+0.010 −0.208+0.009 −0.281+0.009

5 讨论与结论

无接地的自洽性。降低释义翻转率并不能产生关注正确解剖结构的模型。微调以自洽性换取纯文本一致性,且仅带来适度的接地增益:原始注意力的 AMiM 仍有五分之四的质量位于掩码之外,且 Winsor-CAM 并未改善。自洽性告诉你的是机制,而非模型是否阅读了证据。

没有评估过的视觉语言模型(VLM)实现了注意力接地。接地需要同时满足两个条件(图 3):MedGemma 变体和 Qwen3-VL 使用了图像,但其注意力未能追踪因果关系(负斯皮尔曼 ρ,且在 n=12K 多任务规模扩展下依然存活),而 LLaVA-RAD 之所以呈现正相关,仅仅是因为它未能满足第一个条件(因果归因质量仅为 0.005),因此其 ρ 是两个接近零的信号的结合。CheXagent 表明,决策在分布内(VinDr)仍可实现因果接地,因此我们记录的是热力图并不能证明接地,而非医疗 VLM 从未使用正确的区域。这种失败并非特定于方法或模态:没有 VLM 方法的掩码 AMiM 超过 22%,且两个经过 CXR 训练的分类器通过了相同的协议。具有显式接地头(如 MIMO [16])的架构表现是否更好,仍有待探讨。

范围与局限性。DenseNet/ResNet 的对比并非声称分类器在全局上更优;它表明当模型针对 CXR 分类进行训练时,该协议能够检测到局部显著性。因果图使用 16×16 令牌网格,因此亚补丁(sub-patch)病理可能被部分掩盖,且 Qwen3-VL 是

第 9 页

医学视觉语言模型中缺乏锚定的注意力机制 9

0.20 忽略图像 已锚定 (GROUNDED) 0.15 LLaVA-RAD 0.10 CXR 分类器 (表 2) 0.05 0.00 0.05 目标 LoRA 基础模型 注意力因果 0.10 Qwen3-VL 0.15 全量 LoRA 0.20 两者皆无 注意力产生误导 0.00 0.05 0.10 0.15 0.20 0.25 图像的因果使用:归因质量

图 3. 锚定需要同时具备图像使用(水平轴:因果归因质量)和注意力因果对齐(垂直轴:斯皮尔曼 ρ)。数据点为表 3 的精确值;虚线仅为视觉引导。没有任何视觉语言模型进入已锚定象限;CXR 分类器对照组由表 2 实现锚定。

在 8×8 分辨率下进行评估以节省内存。填充敏感性检查显示,在任何填充条件下均无正相关系数 ρ,因此报告值为下界。 结论。这些医学视觉语言模型生成的热力图令人安心但并不可靠:在边界框重叠率、像素掩码 AMiM 以及补丁遮挡斯皮尔曼 ρ 指标上,当 CXR 分类器基线通过测试时,注意力机制却未能通过。临床解释应通过受控的定位指标和因果扰动进行验证,而非仅凭视觉检查。 AI 工具使用声明。我们使用大型语言模型(Claude Opus 4.8)进行语言编辑和 LaTeX 格式排版(语法、句子级重写、布局);该模型未生成研究问题、方法、实验或分析。作者核实了所有数据、引用和声明,并承担全部责任。

致谢。本研究在纽黑文大学安全与可信智能学习(SAIL)实验室完成。未收到特定的外部资助。

利益冲突披露。B. Sadanandan 是美国康涅狄格州美敦力医疗外科公司的研究工程师;其任职与本研究无关。作者引用了各自相关的初步研究 [17,18,19],这些研究已发表或正在其他期刊审稿中。未声明其他利益冲突。

参考文献

1. Zambrano Chaves, J.M., et al.: Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation. arXiv:2403.08002 (2024) 2. Hu, E.J., et al.: LoRA: low-rank adaptation of large language models. In: ICLR (2022) 3. Ribeiro, M.T., Wu, T., Guestrin, C., Singh, S.: Beyond accuracy: behavioral testing of NLP models with CheckList. In: ACL, pp. 4902–4912 (2020) 4. Bustos, A., Pertusa, A., Salinas, J.-M., de la Iglesia-Vayá, M.: PadChest: a large chest X-ray image dataset with multi-label annotated reports. Med. Image Anal. 66, 101797 (2020) 5. Johnson, A.E.W., et al.: MIMIC-CXR, a de-identified publicly available database of chest ra- diographs with free-text reports. Sci. Data 6(1), 317 (2019)

第 10 页

10 B. Sadanandan 和 V. Behzadan

6. Lieberum, T., 等:Gemma Scope:在 Gemma 2 上随时随地全面开放稀疏自编码器。arXiv:2408.05147 (2024) 7. Chefer, H., Gur, S., Wolf, L.:超越注意力可视化的 Transformer 可解释性。在:CVPR,第 782–791 页 (2021) 8. Jain, S., Wallace, B.C.:注意力并非解释。在:NAACL,第 3543–3556 页 (2019) 9. Wiegreffe, S., Pinter, Y.:注意力并非非解释。在:EMNLP,第 11–20 页 (2019) 10. Xia, P., 等:CARES:医疗视觉语言模型可信度的综合基准。arXiv:2406.06007 (2024) 11. Gu, Z., Yin, C., Liu, F., Zhang, P.:MedVH:面向医疗语境下大型视觉语言模型幻觉的系统性评估。arXiv:2407.02730 (2024) 12. Saporta, A., 等:基准测试胸部 X 光解释的显著性方法。Nat. Mach. Intell. 4(10), 867–878 (2022) 13. Abnar, S., Zuidema, W.:量化 Transformer 中的注意力流。在:ACL,第 4190–4197 页 (2020) 14. Wan, X., 等:通过反事实对比训练消除医疗视觉问答中的语言偏差。在:MICCAI (2025) 15. Han, T., Adams, L.C., Nebelung, S., 等:多模态大语言模型是通用的医学图像解释器。medRxiv 2023.12.21.23300146 (2023) 16. Chen, Y., Xu, D., Huang, Y., 等:MIMO:一种具有视觉指称多模态输入和像素接地多模态输出的医疗视觉语言模型。arXiv:2510.10011 (2025) 17. Sadanandan, B., Behzadan, V.:PSF-Med:测量和解释医疗视觉语言模型中的释义敏感性。arXiv:2602.21428 (2026) 18. Sadanandan, B., Behzadan, V.:机制引导的 LoRA 提高医疗视觉语言模型中的释义一致性。在:机器学习研究论文集 (CHIL 2026),第 333 卷,第 703–720 页 (2026) 19. Sadanandan, B., Behzadan, V.:预测熵链接医疗视觉语言模型中的校准与释义敏感性。arXiv:2604.08941 (2026) 20. Alsentzer, E., 等:公开可用的临床 BERT 嵌入。在:临床 NLP 研讨会,NAACL,第 72–78 页 (2019) 21. Sellergren, A., Kazemzadeh, S., Jaroensri, T., 等:MedGemma 技术报告。arXiv:2507.05201 (2025) 22. Selvaraju, R.R., 等:Grad-CAM:通过基于梯度的定位从深度网络生成可视化解释。在:ICCV,第 618–626 页 (2017) 23. Cohen, J.P., Viviano, J.D., Bertin, P., 等:TorchXRayVision:胸部 X 光数据集和模型库。在:MIDL (2022) 24. Bai, S., Cai, Y., 等:Qwen3-VL 技术报告。arXiv:2511.21631 (2025) 25. Petsiuk, V., Das, A., Saenko, K.:RISE:用于黑盒模型解释的随机输入采样。在:BMVC (2018) 26. Adebayo, J., 等:显著性地图的健全性检查。在:NeurIPS,第 31 卷 (2018) 27. Sundararajan, M., Taly, A., Yan, Q.:深度网络的公理化归因。在:ICML,第 3319–3328 页 (2017) 28. Nguyen, H.Q., 等:VinDr-CXR:带有放射科医生注释的胸部 X 光开放数据集。Sci. Data 9(1), 429 (2022) 29. Chen, Z., Varma, M., Delbrouck, J.-B., 等:CheXagent:迈向胸部 X 光解释的基础模型。arXiv:2401.12208 (2024) 30. Lan, Z., Sun, L., Walter, M.R., Zhou, J.:不看即视:视觉语言基准测试真的在测试视觉能力吗?arXiv:2605.22903 (2026) 31. Aranya, O.F.M.R.R., Desai, K.:同意还是正确?医疗视觉语言模型中的接地-阿谀奉承权衡。arXiv:2603.22623 (2026) 32. Mayer, L., 等:6 根手指,1 个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点。arXiv:2512.04238 (2025)

发表评论