多模态大模型的空间幻觉:如何不训练就揪出推理链中的错误证据?

方法贡献

提出一种无训练、模块化的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA)来定位并纠正多模态大模型推理链中与视觉输入不一致的中间空间证据,从而提升最终答案准确性。

MLLMs 看不懂动态视频?ViSTR-Bench 揭示空间时间推理的真实短板

直观失败案例

本文介绍 ViSTR-Bench,一个针对动态场景定性推理的新基准。研究发现,尽管 MLLMs 在静态任务上表现优异,但在处理连续视觉线索时存在严重缺陷,准确率远低于人类。论文通过四维框架诊断错误类型,并证明引入显式视觉证据(如 VGGT-Ω 和 WAFT)比单纯依赖文本思维链更有效。注意:当前模型在物理动力学预测上仍表现薄弱。