HumanCLAW:VLM 为何能看却不会动?具身自我感知才是真正的瓶颈
现有的具身评测要么抽象掉物理运动,要么将决策与电机控制纠缠在一起,无法单独评估 VLM 的动作推理能力。HumanCLAW 提出了一套解耦框架:VLM 只负责决策,技能条件运动生成器负责执行,半物理仿真器负责反馈。在包含 1218 个长程寻找-导航-交互任务的基准测试中,最强的 VLM 也只能完成 16.8% 的完整交互任务。错误分析表明,失败主要源于 VLM 无法感知自身身体状态——它不知道何时已到达目标、何时被卡住、何时会坐到空气里。这项研究为具身智能的评估提供了新视角,但也受限于仅使用自我中心视觉输入、交互任务单一等局限。 论文介绍、全文中文翻译与相关资料: https://www.pc