JigShape:用拼图锁扣给大模型做几何推理体检,结果发现一道悬崖
视觉语言模型看图说话很厉害,但空间推理到底行不行?JigShape 基准用带凹凸锁扣的拼图来测试,发现所有模型在 8×8 网格上性能集体崩塌。问题出在哪?模型过度依赖几何形状线索,却无法有效整合视觉内容进行推理。本期视频带你拆解这个“悬崖”背后的真相。
视觉语言模型看图说话很厉害,但空间推理到底行不行?JigShape 基准用带凹凸锁扣的拼图来测试,发现所有模型在 8×8 网格上性能集体崩塌。问题出在哪?模型过度依赖几何形状线索,却无法有效整合视觉内容进行推理。本期视频带你拆解这个“悬崖”背后的真相。
视觉语言模型处理长视频时,常因无关帧干扰而答非所问。传统基于注意力的内部检索信号不可靠,外部检索器又需重新编码图像。本文发现VLM的值空间比键空间携带更强的文本对齐信号,并据此提出ReToken——一个可学习的检索令牌。它附加在问题后,通过计算与各帧值向量的相似度来检索相关帧,仅增加极少参数。实验表明,在Visual Haystacks上,ReToken的检索召回率远超基于注意力的方法;在长视频基准LVBench上,零样本迁移即带来显著提升。但该方法需要两次前向传播,且在需要全局总结的任务上表现不佳。
现有的具身评测要么抽象掉物理运动,要么将决策与电机控制纠缠在一起,无法单独评估 VLM 的动作推理能力。HumanCLAW 提出了一套解耦框架:VLM 只负责决策,技能条件运动生成器负责执行,半物理仿真器负责反馈。在包含 1218 个长程寻找-导航-交互任务的基准测试中,最强的 VLM 也只能完成 16.8% 的完整交互任务。错误分析表明,失败主要源于 VLM 无法感知自身身体状态——它不知道何时已到达目标、何时被卡住、何时会坐到空气里。这项研究为具身智能的评估提供了新视角,但也受限于仅使用自我中心视觉输入、交互任务单一等局限。 论文介绍、全文中文翻译与相关资料: https://www.pc
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。
本研究通过构建包含100张电影场景图像的CSB数据集,评估了2017-2025年间9个视觉语言模型在描述复杂场景时的表现。研究发现,尽管MLLMs在准确性上已接近人类水平,但仍存在空间依赖误差。研究还建立了五类视觉认知误差分类体系,并开发了基于掩码范式的空间依赖误差(SDE)量化方法。