GraphVerse:当多模态模型看图推理时,瓶颈到底在哪里?

核心区分:视觉推理不能被绕过

GraphVerse 的核心洞察是:真正的视觉图推理,必须让模型无法绕过图像本身。为此,论文提出了四种以图为中心的图像编辑策略。比如,把图切成碎片打乱,模型必须先在大脑里拼回原图才能推理;或者把两张图叠在一起,要求模型在视觉上分离它们再进行比较。这些操作让视觉推理从可选项变成了必选项。