MLLMs 看不懂动态视频?ViSTR-Bench 揭示空间时间推理的真实短板
本文介绍 ViSTR-Bench,一个针对动态场景定性推理的新基准。研究发现,尽管 MLLMs 在静态任务上表现优异,但在处理连续视觉线索时存在严重缺陷,准确率远低于人类。论文通过四维框架诊断错误类型,并证明引入显式视觉证据(如 VGGT-Ω 和 WAFT)比单纯依赖文本思维链更有效。注意:当前模型在物理动力学预测上仍表现薄弱。
本文介绍 ViSTR-Bench,一个针对动态场景定性推理的新基准。研究发现,尽管 MLLMs 在静态任务上表现优异,但在处理连续视觉线索时存在严重缺陷,准确率远低于人类。论文通过四维框架诊断错误类型,并证明引入显式视觉证据(如 VGGT-Ω 和 WAFT)比单纯依赖文本思维链更有效。注意:当前模型在物理动力学预测上仍表现薄弱。