多模态模型真的在看自己画的草图吗?See2Think的诊断与发现
多模态大模型在推理时越来越喜欢画草图、做标注,但它们真的依赖这些自生成的视觉信息吗?See2Think这篇论文没有只看最终答案,而是设计了一套诊断框架,把视觉推理拆成三个环节:动作是否相关、渲染是否保真、后续推理是否采纳。通过在1200个样本上对四个主流模型进行标准与损坏渲染的对照实验,研究发现一个反直觉的结论——模型经常提出相关动作,但渲染质量普遍不高,而且即使渲染正确,收益也远小于损坏反馈带来的伤害。这说明当前模型的中间视觉推理更像一种行为惯性,而非真正的视觉依赖。视频将带你理解这一诊断逻辑及其对多模态系统设计的启示。