多模态模型真的在看自己画的草图吗?See2Think的诊断与发现

论文代表图:figure-02-p003-01

多模态大模型在推理时越来越喜欢画草图、做标注,但它们真的依赖这些自生成的视觉信息吗?See2Think这篇论文没有只看最终答案,而是设计了一套诊断框架,把视觉推理拆成三个环节:动作是否相关、渲染是否保真、后续推理是否采纳。通过在1200个样本上对四个主流模型进行标准与损坏渲染的对照实验,研究发现一个反直觉的结论——模型经常提出相关动作,但渲染质量普遍不高,而且即使渲染正确,收益也远小于损坏反馈带来的伤害。这说明当前模型的中间视觉推理更像一种行为惯性,而非真正的视觉依赖。视频将带你理解这一诊断逻辑及其对多模态系统设计的启示。

无根基的注意力:医学VLM热力图为何不可信

方法:三轴解释验证协议

医学视觉语言模型(VLM)生成的注意力热力图是否忠实反映了驱动预测的图像证据?本研究通过因果扰动和受控定位指标审计发现,当前主流医学VLM(如MedGemma, LLaVA-RAD, Qwen3-VL)的注意力热力图虽看似合理,但并未真正锚定驱动预测的图像证据,且无法通过随机控制测试。相比之下,专用CXR分类器(如DenseNet)在相同测试中表现显著更好。视频详细解析了三轴验证协议、实验结果及VLM解释的局限性,提醒研究者避免仅凭视觉检查验证可解释性。

VLMs如何失败?组合式VQA中的视觉-操作错位与通路解离

问题背景:组合推理的复杂性

本研究深入分析Qwen2.5-VL-3B-Instruct在组合式视觉问答中的失败机制。通过因果均值消融、注意力消除和MLP消除,发现接地与属性提取失败源于前馈网络,而推理失败源于晚期注意力。跨架构分析显示LLaVA-1.5-7B因编码器压缩空间细节而表现不同。

VLM计数为何失败?探针揭示内部编码与输出错位,自校正提升15.6%

论文代表图:figure-01-p003-01

视觉语言模型(VLM)在物体计数任务中常出现幻觉。本研究通过探针分析发现,VLM内部编码了正确的计数信息,但输出方向存在错位。论文提出基于误差检测器的自校正方法,在不更新参数的情况下将计数准确率提高了最高15.6%。视频涵盖探针分析、SVCCA子空间对齐、因果干预实验及自校正框架效果,并讨论模型差异与局限性。