无根基的注意力:医学VLM热力图为何不可信
医学视觉语言模型(VLM)生成的注意力热力图是否忠实反映了驱动预测的图像证据?本研究通过因果扰动和受控定位指标审计发现,当前主流医学VLM(如MedGemma, LLaVA-RAD, Qwen3-VL)的注意力热力图虽看似合理,但并未真正锚定驱动预测的图像证据,且无法通过随机控制测试。相比之下,专用CXR分类器(如DenseNet)在相同测试中表现显著更好。视频详细解析了三轴验证协议、实验结果及VLM解释的局限性,提醒研究者避免仅凭视觉检查验证可解释性。