快速导读:现有的具身评测要么完全抽象掉物理身体,要么将决策与电机控制纠缠在一起。如果机器人摔倒了,我们分不清是它想错了,还是只是没站稳。HumanCLAW 的核心洞察是:要评估 VLM 的行动智能,必须将决策从执行中解耦。让 VLM 只负责“想”,让一个可靠的执行器负责“做”,让失败干净地归因于推理错误。
HumanCLAW 是一篇系统评估视觉语言模型(VLM)“行动智能”的论文。它提出的核心问题是:现成的 VLM 能否在物理世界中做出正确的全身动作决策?为了回答这个问题,作者构建了一套解耦的评估框架,将 VLM 的决策与运动执行分离,从而能够干净地将任务失败归因于推理错误,而非电机控制或平衡问题。
在包含 1218 个长程寻找-导航-交互任务的基准测试中,作者对 9 个主流 VLM 进行了全面评估。结果显示,即使最强的模型也只能完成 16.8% 的完整交互任务。更关键的是,错误分析揭示了一个反直觉的发现:VLM 的主要瓶颈并非视觉感知——一旦目标进入视野,模型几乎总能识别——而是“具身自我感知”,即模型无法在线估计自身身体状态及其与场景的关系。
英文题目:HumanCLAW: Can Vision-Language Models Act Through a Body?
论文出处:arXiv 每日论文精选 · arXiv:2607.27180
原始论文:PDF / 论文页面
对应视频标题:HumanCLAW:VLM 为何能看却不会动?具身自我感知才是真正的瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
现有的具身评测大致分为两类。一类如 VirtualHome 和 ALFRED,使用预定义的动画或离散动作,完全抽象掉了物理运动,无法评估模型在连续物理世界中的决策能力。另一类如 RT-2、Octo 等端到端视觉-语言-动作(VLA)策略,将任务推理与电机控制耦合在一起,使得失败无法被清晰地归因——是模型想错了,还是它只是没站稳?
这种决策与执行的纠缠,是评估 VLM 行动智能的核心障碍。HumanCLAW 的作者认为,要真正理解 VLM 能否“通过身体行动”,必须将决策从执行中解耦出来,让 VLM 只负责“想”,而让一个可靠的执行器负责“做”。
此外,现有的 VLM 训练数据以互联网图文为主,缺乏对物理身体状态的感知经验。它们能识别图像中的物体,但能否理解“我的身体相对于这个物体的位置”?能否预测“如果我向前走一步,我的手臂会撞到桌子”?这些关于具身自我感知的问题,在以往的评测中从未被系统性地考察过。
HumanCLAW 正是在这样的背景下,提出了一个全新的评估框架和基准,旨在填补这一研究空白。
核心创新
方法概览
现有的具身评测要么完全抽象掉物理身体,要么将决策与电机控制纠缠在一起。如果机器人摔倒了,我们分不清是它想错了,还是只是没站稳。HumanCLAW 的核心洞察是:要评估 VLM 的行动智能,必须将决策从执行中解耦。让 VLM 只负责“想”,让一个可靠的执行器负责“做”,让失败干净地归因于推理错误。
- 决策与执行解耦框架(第 3 页,图 2):整个系统由三个模块组成——VLM 推理支架(Harness)、技能条件运动生成器(Generator)、半物理仿真器(Simulator)。VLM 接收自我中心的 RGB 图像和文本历史,输出一个原子化的、参数化的全身技能指令(如 walk<0, 0.3, 0>)。运动生成器将其转化为 0.5 秒的连续运动片段,仿真器在接触和重力约束下执行该运动,并返回下一帧自我中心观察,形成闭环。
- 高-中-低层推理支架(第 5 页,图 3):为了引导开放式 VLM 从自我中心感知输出可执行的人形控制指令,作者设计了一个分层推理支架。高层负责空间理解和目标可见性判断,中层制定未来 2-3 秒的短期目标,底层预测未来 0.5 秒的具体运动参数。这种分层设计使得 VLM 的推理过程更加结构化和可控。
- 技能特定验证器(第 5 页,图 3;第 25 页,表 6):在 VLM 提出技能指令后,一个基于规则的验证器会检查其空间安全性。例如,如果 VLM 提议“坐下”但目标物体不在可坐范围内,验证器会拒绝该提议并替换为修正后的技能。这个验证器是技能特定的,每个技能都有独立的检查规则,确保动作不会导致穿模或不安全的行为。
- 技能条件运动生成器(第 6 页,图 4):运动生成器由一个技能无关的运动基础 DiT 和多个即插即用的 ControlNet 适配器组成。基础 DiT 通过流匹配从 5 个历史姿态预测 15 个未来帧的速度场。每个技能对应一个 ControlNet 适配器,通过零初始化的残差连接注入到冻结的基础模型中,使得新技能可以零样本添加而不影响已有技能。
- 半物理仿真器(第 9 页,图 6):与纯运动学回放不同,半物理仿真器在运动执行时引入了接触和重力约束。墙壁会阻挡身体,楼梯会支撑身体,但平衡和电机跟踪失败被有意排除。这种设计使得物理交互得以保留,同时避免了因“摔倒”而导致的决策归因混淆。
- 即插即用的技能扩展(第 6 页,图 4c):所有技能适配器共享同一个运动基础 DiT,VLM 选择的技能会自动路由到对应的 ControlNet。新技能只需添加一个新的适配器,无需重新训练基础模型或其他适配器,实现了真正的即插即用。
- 技能可控性验证(第 7 页,图 5):作者通过实验证明,技能条件生成器能够精确追踪连续参数。例如,walk 技能可以精确执行 0.3 米的步幅指令,sit 技能可以根据参数(0, 0.5, 0.8)调整坐姿高度。不同技能之间还能自然过渡,形成流畅的动作序列。
- HumanCLAW-Bench 基准构建(第 10 页,图 7):基准包含 1218 个长程寻找-导航-交互任务,分布在 41 个室内场景中。每个任务根据距离、选择和障碍物三个几何维度被分为简单、中等、困难三个等级,确保了评测的全面性和难度分层。
逐图理解论文
失败案例与直觉

图 8 是全文最重要的错误分析图。(a) 展示了寻找→导航→交互的漏斗效应,成功率逐级骤降;(b-d) 分别展示了三个阶段失败的根本原因,颜色编码不同的能力缺陷。注意导航和交互阶段的失败主要集中在“身体感知”和“自我空间定位”,而非视觉感知。
研究空白与核心区分

图 2 展示了 HumanCLAW 的闭环框架。从左至右:VLM 推理支架接收指令和观察,输出技能调用;技能条件运动生成器将其转化为 0.5 秒运动片段;半物理仿真器执行运动并返回新观察。注意新技能注册是即插即用的,无需重新训练 VLM。
方法贡献与验证

图 3 详细展示了推理支架的内部结构。从自我中心感知开始,经过高层空间理解、中层动态规划、底层技能提议,最后通过技能特定验证器进行安全检查。注意中层规划关注 2-3 秒的未来,底层提议精确到 0.5 秒,这种时间尺度的分层是引导 VLM 的关键。
意义与局限

图 1 展示了动作智能的三种层级。左侧是纯代码代理,无物理身体;中间是机器人运动控制,决策与平衡耦合;右侧是 HumanCLAW 的中间层,保留物理交互但排除平衡失败。主面板展示了一个完整的寻找-导航-交互任务,每个彩色人形代表一个亚秒级的决策。这张图是理解全文核心设计哲学的关键。
实验如何设计?
- 运动生成器零样本保真度评估(第 12 页,表 1):将技能条件生成器与文本到运动基线 MoMask 进行对比,评估其对连续参数(如步幅、转向角度)的追踪精度。指标为“达成率”(achieved / commanded),理想值接近 1.0。
- 全基准 VLM 评估(第 12 页,表 2):在 HumanCLAW-Bench 上评估 9 个主流 VLM,包括 GPT-5.5、Gemini-3.1、Gemini-2.5、Claude-4.8、Gemma-4-31B、Qwen 系列和 InternVL3.5-38B。指标涵盖高层成功率、身体感知、动作质量和计算成本。
- 推理支架消融实验(第 13 页,表 3):在 100 个任务的迷你验证集上,消融文本历史长度、视觉历史帧数、验证器和中层推理等组件,分析各组件对性能的贡献。
- 错误根因分析(第 14-15 页,表 4、图 8):将失败归因到感知、身体感知、自我空间定位等根因类别,分别在寻找、导航、交互三个阶段进行统计。
- 身体部位碰撞分析(第 16 页,表 5):按身体部位(手臂、腿、躯干、头部)统计碰撞率,量化 VLM 对身体不同部位的感知缺失程度。
- 技能验证器规则(第 25 页,表 6)和自动根因规则(第 26 页,表 7):详细列出了验证器的检查规则和错误归因的自动化规则,确保了分析的可复现性。
关键结果与论文证据
- 运动生成器零样本可靠(第 12 页,表 1):技能条件生成器的达成率接近 1.0(如 walk 步幅 0.966±0.022),而 MoMask 基线则忽略参数,生成通用动作,达成率偏离 1.0 且方差大一个数量级。这确保了后续 VLM 评估中运动执行不是混淆因素。
- 最强 VLM 仅完成 16.8% 的完整交互任务(第 12 页,表 2):Gemini-3.1 在寻找(FindSR 64.9%)、导航(NavSR 42.4%)和交互(InteractSR 16.8%)三个阶段均表现最佳,但成功率逐级骤降,呈现明显的漏斗效应。
- 视觉感知不是瓶颈(第 14 页,表 4):GeoFindSR(目标客观呈现在视野中)与 FindSR(模型声称看到目标)的差距仅 5-10 个百分点。一旦目标进入视野,模型几乎总能识别。失败主要发生在“将目标带入视野”的上游阶段。
- 具身自我感知是核心瓶颈(第 15 页,图 8):错误根因分析显示,导航和交互阶段的失败主要集中在“自我空间定位”和“身体感知”类别——模型在距离目标很远时就停止,不知道已到达或被卡住,坐到空气里。
- 碰撞率揭示身体无意识(第 16 页,表 5):所有模型都有显著的碰撞率,其中手臂和腿部的碰撞最为频繁。模型在移动时无法感知四肢与家具的接触,导致持续的物理干扰。
- 推理支架组件贡献显著(第 13 页,表 3):消融实验表明,移除验证器会导致成功率大幅下降(FindSR 从 58.1% 降至 27.0%),移除中层推理同样影响显著。文本历史和视觉历史的长度也有明显影响。
- 低扰动指标可能意味着不作为(第 12 页,表 2):一些模型(如 Qwen3.5-27B)的碰撞率和扰动指标很低,但成功率也极低。这表明它们可能倾向于不移动或少移动,从而避免了碰撞,但也没有完成任务。
- 任务难度分层有效(第 10 页,图 7):距离、选择和障碍物三个维度的分布合理,困难任务确实对模型构成了更大的挑战,验证了基准设计的有效性。
阅读时需要注意
- 输入模态受限:智能体仅接收自我中心的 RGB 图像和文本历史,缺乏本体感觉(如关节角度、接触力)等关键的身体状态信息,这从根本上限制了模型发展具身自我感知的能力。
- 交互任务单一:当前基准中的交互任务仅实例化为“坐下”这一种动作,虽然参数化(不同高度)提供了一定变化,但仍远未覆盖真实世界中丰富的交互类型。
- 半物理仿真的简化:虽然有意排除了平衡和电机跟踪失败以隔离决策评估,但这确实简化了具身行动的全部挑战。在真实世界中,决策和执行是紧密耦合的。
- VLM 结构化输出依赖:框架要求 VLM 输出结构化的技能指令,这对模型的指令遵循能力有一定要求,部分模型可能因输出格式问题而表现不佳。
关联工作
- VirtualHome 和 ALFRED 等早期具身评测使用预定义动画或离散动作,完全抽象掉了物理运动,无法评估连续物理世界中的决策能力。
- Habitat 2.0 和 BEHAVIOR-1K 等物理仿真平台虽然支持连续运动,但通常与机器人特定控制绑定,将空间决策与电机执行纠缠在一起。
- RT-2、Octo、π0 等端到端 VLA 策略直接学习从感知到电机指令的映射,耦合了任务推理与具身控制,使得失败归因困难。
- MoMask 等文本到运动生成模型虽然能生成多样化的动作,但无法可靠追踪连续参数,不适合作为 VLM 决策的可靠执行器。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HumanCLAW:视觉语言模型能通过身体行动吗? Li Siyao1,2,*,‡, Jiawei Gu3,*, Shuai Liu2,#, Kairui Hu2,#, Zekun Li1,4,‡, Linjie Li3, Chengcheng Tang1, Po-Chen Wu1, Ivan Shugurov1, Lingni Ma1, Michael Zollhoefer1, Sizhe An1, Abhay Mittal1,†, Amy Zhao1,†, Ranjay Krishna3,†, Manling Li5,†, Ziwei Liu2,†, Chuan Guo1,†
1Meta, 2南洋理工大学, 3华盛顿大学, 4布朗大学, 5西北大学 *同等贡献, ‡Meta实习生, #同等贡献, †通讯作者
评估视觉语言模型(VLM)能否通过物理身体行动是一项挑战。动作的结果将VLM的决策与运动控制耦合在一起。当任务失败时,很难判断是VLM做出了错误选择,还是运动控制器未能成功执行(例如失去平衡而摔倒)。在这项工作中,我们引入了HumanCLAW,一个将动作决策与低层执行解耦的评估框架。在每个步骤中,一个受约束的、现成的VLM发出一个原子技能(atomic skill)命令,该命令被转化为一段亚秒级的连续全身运动,并产生真实的物理后果,包括重力和碰撞。因此,身体可以在物理世界中自由行动,而执行端的干扰、平衡和运动误差被排除在外。剩下可衡量的是模型的动作智能(action intelligence):它每时每刻对身体下一步该执行什么的选择。基于此框架,我们构建了HumanCLAW-Bench:涵盖41个室内场景的1218个长周期、自我中心视角的“寻找-导航-交互”片段。我们测试了9个最先进的VLM,发现没有一个能解决该基准测试;表现最好的模型成功率仅为16.8%。识别目标并非瓶颈。当前VLM缺乏的是体态自知(embodied self-awareness):它们会丢失对自身身体轨迹的追踪,无法判断自己身在何处、是否已到达目标,或是否碰到了障碍物。
项目页面:https://human-claw.github.io 日期:2026年7月30日 [cs.CV]
1 引言
最近的视觉语言模型(VLM)在涉及视觉定位、空间关系和空间推理的任务中表现出强大的性能(Chen et al., 2024; Yang et al., 2024)。如果赋予这样的模型一个物理身体、自我中心视角的观察、其动作历史以及一个目标,它能否确定一个适合当前时刻的可执行动作?一个肯定的答案将是诱人的:决策将来自通用推理,而非针对特定具身轨迹拟合的策略;基于这种推理构建的智能体可以在从未训练过的场景中行动,而无需为决策者收集大量动作演示。我们将这种能力称为动作智能:在执行的闭环中,每时每刻决定物理身体下一步应该做什么的能力,其中每个决策都被执行,其物理结果会告知下一个决策。我们将其视为空间智能的操作组件,通过随着物理后果的展开选择、参数化和排序动作,将空间理解转化为闭环的具身决策。arXiv:2607.27180v1
在本文中,我们探讨近期的VLM是否具备动作智能。然而,将VLM的决策转化为可执行的运动并非易事。对于一个简单的具身形态,路径很短:一个7自由度的末端执行器动作可以直接写成文本(Yang et al., 2025)。而像人体这样复杂的具身形态则没有捷径。由于人体姿态维度远超一百个,且每秒变化多次,全身运动远非在每个控制步都能以文本形式写出所能及。现有的评估大多落在文本命令与可执行运动之间鸿沟的两侧。一方面,智能体基准测试抽象掉了运动:为了保持评估的可处理性,命令通过模拟器定义的动作抽象来执行,
第 2 页
“找到楼梯, 去二楼”
“找到长沙发, 坐上去” 第0步 第1步 (a) 代码Agent ① 开环;长步长; 无物理结果
②
第0步 第1步 (b) 机器人运动 (c) 行动智能:在亚秒级闭环中持续在线观察、思考与移动,毫秒级电机控制; ① ② 可能失去平衡
物理
空间行动的物理基础化结果
图1 行动智能居于何处?按实体化程度递增的三种行动模式:(a) 无躯体行动,(b) 躯体行动与平衡及运动控制不可分。(c) HumanCLAW 使躯体与世界保持在亚秒闭环中,但分解掉底层控制,因此失败回合被解读为错误决策,而非失去平衡。主图:一次寻找-导航-交互回合,每个摆放的身体姿态对应一次亚秒决策。底部:其产生的物理结果。
脚本或预动画例程 (Puig 等人,2018;Shridhar 等人,2020;Liu 等人,2024;Chang 等人,2025),因此模型无需实现物理后果源于运动本身的全身行为。另一方面,端到端视觉语言动作模型(VLA)确实会学习生成可执行的运动 (Zitkovich 等人,2023;Kim 等人,2025;Black 等人,2024;Lee 等人,2025),但在具身特定轨迹上的拟合使决策与所学的控制策略纠缠在一起,难以分离出通用推理本身向物理行动外推的程度。此外,对于人形机器人,电机执行会进一步干扰评估:例如,身体可能在爬楼梯时失去平衡,产生与行动决策无关的失败。因此,测量行动智能需要两边都不提供的设置:决策与执行解耦,但身体仍在物理世界中自由行动(图 1)。
为此,我们首先赋予现成的视觉语言模型(VLM)在物理世界中自由行动的能力。HumanCLAW 无需训练决策器即可弥补这一差距。在每一个亚秒步骤中,被驾驭的 VLM 以其自我中心视角和文本历史为输入,显式推理所见之物、身体所处的位置以及下一步该做什么,并输出一个带参数的原子全身技能,该技能由技能特定验证器检查。原子性是操作关键:一项技能是身体行动的最小、无歧义单元——以给定步幅行走、旋转给定角度、在给定高度坐下——决不是像“坐在沙发上”这样的复合指令,这类指令无声地将寻找、靠近、定向和执行捆绑成一个模糊命令。保持原子词汇表将此组合推入 VLM 自身的逐步推理中,决策器无需任务特定的行动训练。技能条件化运动生成器提供 VLM 无法发出的部分:它将每个被接受的技能实现为连续、上百自由度的类人运动。半物理仿真随后
第 3 页
新观测 \(o_{t+1}\)
即插即用技能注册 驾驭世界更新 技能 \(s_0\) \(s_1\) \(s_2\) … 列表/规则 移动 “find a sofa skill 技能条件化解耦 and sit on it” <参数> 运动生成 … 物理 指令 \(p\) 现成VLM 仿真 0.5秒运动学 \(\mathbf{H}\) \(\mathbf{G}\) 运动块 \(\hat{\mathbf{x}}_{fut}\) \(\mathbf{W}\)
图2 HumanCLAW闭环框架。一个被驾驭的现成VLM将每个自我中心视角观测映射为技能调用skill<param>;技能条件化生成器将其转换为0.5秒的全身运动块,再由半物理仿真器在接触和重力下执行,返回下一观测。新技能即插即用注册,无需重新训练VLM。
通过接触、碰撞、重力和物体位移施加其物理后果,同时排除了平衡和运动跟踪失败。产生的自我中心视角返回供下一步决策,从而闭环(图2)。实际上,VLM在玩一个第一人称游戏(Tan et al., 2024; Zhang et al., 2025a),但通过更丰富、物理根基的抽象:动作空间由参数化全身技能(skill)组成而非按键,结果由物理交互而非脚本决定。因此,每一步都使明确的决策与其物理结果配对,失败可归因于技能决策层面。
基于HumanCLAW,我们随后提出HumanCLAW-Bench,探究当前VLM能否将一个抽象的、长时程任务贯彻到底。它实例化了行动智能的一个具体切片:闭环全身决策。该基准包含1,218个自我中心视角的全身寻物-导航-交互片段,分布在41个室内房屋中:找到一个目标物体,把身体带到它那里,然后坐上去。每个目标指定了要达成什么,但未规定身体每一刻该做什么,因此成功取决于一系列亚秒级的行动决策。决策者全程保持冻结;基准衡量的是当每一个选择变成物理动作时,互联网学到的推理能外推到多远。
在九个前沿VLM中,没有一个能可靠地解决该基准:最强模型仅在16.8%的片段中完成了完整的寻物-导航-交互进程。结果揭示了通过身体去看与行动之间的持续差距。一旦目标在自我中心视角中真实渲染出来,最强模型报告的目标看见率与客观测量的可视率相差在5个百分点以内。失败集中在看见之后的一切:智能体无法可靠地判定自己是否已到达,它的身体相对场景的位置,或者它的运动何时与世界发生了碰撞。我们将这种缺失的能力称为体态自知:维持对自身身体状态、它与周围场景的关系、以及它近期行动的物理后果的在线估计的能力。当前的VLM可以描述世界,但它们无法可靠地追踪它们现在控制的身体。由于运动执行被人为排除在外,这些失败属于决策者。
总之,我们的贡献有三方面:
• HumanCLAW,一个受控环境,其中现成的VLM在物理世界中自由行动:决策与运动执行解耦,每一个原子技能(skill)实现为带有物理后果的连续全身运动,每一次失败解读在决策层面——且决策者从未被训练。
• HumanCLAW-Bench,1,218个自我中心视角的全身寻物-导航-交互片段,分布在41个室内房屋中,带有分阶段的渐进式指标。
• 对九个前沿VLM的广泛评估与失败分析,将其瓶颈定位于感知之外在于体态自知:知晓身体在哪里,是否已经到达,以及它的运动刚刚造成了什么。
第 4 页
2 HumanCLAW
2.1 问题设定
类似CLAW的智能体通过符号化接口将语言目标转化为可执行动作。HumanCLAW研究的是当接口变为物理空间中的完整身体时,相同的智能体闭环。智能体仍然观察、决策、行动并接收反馈,但动作不再以命令结束:它被实现为身体运动,并受物理世界约束。
具体而言,HumanCLAW追求由单一高层指令p(例如,“找到沙发并坐上去”)指定的长程任务,该指令固定了目标,但将所有执行细节保持开放。如图2所示,它以至次秒的速率闭合此闭环。在每个时间步t,智能体获取2D自我中心视角RGB观测ot和包含过往决策与反馈的紧凑文本历史ht,并由基于驾驭型VLM构建的技能决策模块将其映射为单个参数化技能调用
⟨st, ct⟩ = H(p, ot, ht), (1)
其中st是固定技能集中的一个原子技能,ct是其连续参数。然后,一个解耦的运动生成器G将该调用实现为一个次秒级、零样本可靠的下一个运动片段
ˆxfutt = G(xt, st, ct), (2)
该片段以当前身体状态xt为条件。最后,一个与运动执行解耦的物理仿真器W执行此片段,更新世界的物理状态,并返回下一个观测ot+1 = W(xt, ˆxfutt)。
观察–思考–行动由此构成一个完整的闭环:智能体并非固守预设计划,而是动态决定下一步做什么,并持续调整其身体与自身行动所重塑场景之间的空间关系。
2.2 自我中心视角动作决策
如图3所示,HumanCLAW采用一个上下文推理驾驭框架,使开放式的VLM能从自我中心视角的视觉观测中推断出人形机器人在接下来0.5秒内应执行的低层运动技能。该驾驭框架并非直接提示VLM预测运动,而是通过引导式推理逐步构建其决策过程。它将模型根植于智能体的具身和任务上下文中,引出显式的自我中心空间状态,引导从高层意图到中层决策再到低层技能的推理,并在执行前验证所提出的技能。
上下文提示。在每一步,VLM接收到一条提示,指明智能体身份、高层指令、可用的运动技能以及使用每项技能的规则。例如,模型被告知它控制一个带有自我中心视角摄像头的蓝色人形机器人,其高层目标是找到一个目标物体并导航至其附近或与之交互,比如找到马桶并坐下。提示还包含最近步骤的紧凑文本历史,包括先前的视觉状态、推理轨迹和已选动作。这段历史是动作连贯性的关键线索:它告知VLM它一直在尝试做什么,环境如何响应,而不是将每张自我中心图像视为独立的图像描述问题。
自我感知与空间理解。在选择运动前,要求VLM从当前的自我中心观测中输出一个格式化的视觉状态。该状态从左到右描述可见物体、它们与身体的近似距离、目标物体是否可见,以及紧邻的周围区域是否包含障碍物或相关可供性,如楼梯、开放空间或可坐表面。此步骤外化了模型的空间解释,使得后续决策依赖于显式的自我中心视角理解,而非从图像到动作的隐式猜测。
高-中-低层推理。该驾驭框架的核心是一个渐进的高-中-低层推理支架。VLM首先在当前的视觉状态下解释长程指令,例如,智能体是应该搜索目标、接近目标、对准目标还是完成交互。然后,它推导出一个可能持续数秒的中层目标,如朝可见物体移动、进入开放区域、对准楼梯或在坐下前转身。最后,VLM将此中层目标转化为当前步骤要执行的低层运动技能。这与将中层目标视为
第 5 页
Prompt 系统提示词 高层任务指令. 技能列表 规则
“你控制一个蓝白相间的带 自我中心视角相机的人形机器人…” 行走 <x,z,ω > 视觉状态 中层规划与思考 底层技能与思考
寻找沙发, 导航过去并坐下 避障 当前自我视角 历史文本记录 侧移 <x> 移动前探索… 通用规则 第21步: 攀爬 <h,d> 视觉状态 坐下 <h> 转向 中层规划 & 思考 … 不要Z字形移动 转身 攀爬 底层技能 & 思考 界面 参数 … 验证器 记录 解释 各技能特定规则 第22步: …
1 | 感知与理解 2 | 动态中层规划 3 | 底层技能提案 空间理解 中层规划 底层运动 “从左到右,我能看到 “接下来2-3秒的目标” “接下来0.5秒的动作” <物体>,距离我<距离>” 动态继承 上下文与规则感知推理 目标可见性 “继承/修改前一步的 “基于中层目标、 “<目标> 在/不在视野内” 动态目标?” 视觉状态、规则选择技能; 历史保持连续性” 周围障碍物 上下文与规则感知推理 参数预测 “根据自我视角、高层 “我周围是否畅通可移动?” “基于视觉状态和规则 目标、历史与规则制定计划, 预测技能参数” 附带简短推理” 视觉状态 中层规划与思考 底层技能与思考
4 | 短上下文动作结果验证器 行走<x,z,ω> 技能特定问题 技能检查 可选更新 侧移<x> “应用此动作的结果是什么? “接受/拒绝” 从技能列表中选择 攀爬<h,d> 是否违反<规则>?” 新的行走<x,z,ω> 坐下<h> … 技能池 当前自我视角 验证器记录 最终选定技能
图3 HumanCLAW框架。我们引导一个开放式的VLM从自我中心视角感知到可执行的人形机器人动作
通过一种上下文相关的高-中-低层次推理框架进行控制,随后由一个特定技能的空间响应验证器修正那些在空间上不安全或过早提出的技能方案。
开环规划。在每一步,VLM显式地决定是继承上一个中层目标,还是根据新的自我中心视角观察和反馈对其进行修正。因此,该控制框架在保持分层规划稳定性的同时,使策略具有闭环和反应式的特性。
底层运动技能选择。在空间理解和中层推理之后,VLM从预定义的技能库中选择一个运动skill,并预测其关联参数。具体来说,它同时推断skill类别(例如,转身或坐下)及其连续参数(例如,<degree>或<height>)。最终动作以结构化的JSON格式输出,为运动生成器提供了一个确定性接口,用于实例化选定的skill。
特定技能的空间响应验证器。在进行运动生成之前,HumanCLAW会应用一个针对所提skill专门定制的短上下文验证器。该验证器检查在当前空间状态下执行所提议的动作是否会导致非预期的后果:例如,撞向障碍物、在未抵达目标前就停止、在没有可见楼梯的情况下攀爬,或从无效姿态坐下。此步骤的动机源于一个观察:随着执行轨迹上下文的增长,VLM的空间推理能力会下降;规划器可能会产生进度幻觉,例如声称已经到达了一个实际上还很远的物体。验证器使用紧凑且针对特定skill的提示词,来决定是接受该提议还是用修正后的skill指令来替换它。
第 6 页
速度场 Tj5zCn8gfP5A3fHjwQ=</latexit>ˆv … 未来skill3的运动块 … 线性 ControlNet 包 adaLN-0 LN 一个技能,一个 ControlNet s0 s1 s2 zω+1 + Wω 运动 adaLN-0 adaLN-0 DiT 新技能: DiT 块 Bω 控制DiT块 Cω s3 s4 即插即用 <0353ZWnKmWP4BefjGyS/jlM=</latexit>ω > 位置嵌入 + zω + zω + es(c) 线性 线性 技能条件编码器 es <ω > 动态路径 20 →219 1 →K snew 450np0353ZWnKmWP4BefjGyS/jlM=</latexit>ω … c skill3 <param> 时间步 xt→4:t ˜xt+1:t+15(ω) 技能条件 运动历史 来自VLM agent 5 历史位姿 15 噪声未来 (a) 运动基座 DiT (b) 技能 ControlNet (c) 即插即用技能
图4 技能条件化的运动生成器。(a) 一个技能不可知的运动基座 DiT 通过流匹配,从5个历史位姿预测15个未来帧的速度场。(b) 每个技能都是一个通过零初始化 Wℓ 注入的 ControlNet 适配器,基座保持冻结。(c) 适配器构成一个即插即用的技能包:VLM 选择的技能路由到其自身的 ControlNet,新技能只需新增一个适配器,无需触动其余部分。
来自同一动作池;每个技能的检查表见表6。
2.3 技能条件化运动生成
真实的人类动作与符号化 agent 中的硬编码动作有着根本不同。代码 agent 可以左转后立刻右转,或者从向前走直接切换为向后走而无需任何过渡。人类动作则不然:人需要减速、转移重心、恢复平衡,并在不同意图之间产生短暂的过渡动作。这些不可避免的“不完美”正是具身行动智能的一部分。因此,行动决策应当在自然人体运动所产生的物理后果下去执行和评估,而不是在一个理想化的瞬时控制器下进行。
然而,与此同时,解耦设计需要一个可靠的零样本接口,连接 VLM 技能选择器与运动执行器。如果规划器发出向前走的指令,生成的运动应产生一个符合常识的人类行走:它不应是太空步、蹒跚而行、或产生无关的上半身动作。否则,失败将无法归因于规划器的行动智能,因为运动接口本身就与技能的语义含义错位了。
具备确定性文本接口的原子技能。为解决这种张力,我们定义了一组有限、语义无歧义的原子运动技能。VLM agent 负责在时间维度上组合这些技能,而运动生成器仅负责实现所选的基本动作。例如,坐在沙发上不会暴露为一个像 sit(sofa at (x,z)) 这样的单一指令。相反,由 VLM agent 决定是否走向沙发、转身、后退一步,或根据当前自我中心视角的状态坐下。这使得长程组合保留在行动智能模块中,同时保持每个运动基本动作局部可靠。
walk(x, z, ψ), side_step(x), step_back(z), turn_in_place(θ), climb_upstairs(h, d), walk_downstairs(h, d), sit_in_place(h), stop.
其中 (x, z, ψ) 指定局部行走位移和朝向变化,θ 是有符号的转向角度,(h, d) 表示楼梯的阶高和阶深,h 表示目标坐高。每个技能对 VLM 具有确定性的文本和 JSON 接口,但其执行是以连续的人体运动生成,而非作为固定动画检索。
这种设计使 HumanCLAW 获得了解耦设计的两方面优势。从 VLM 的视角看,动作空间是稳定、可解释、且与常识对齐的:一个技能名称具有可预测的局部结果。从
第 7 页
×5 ×10 side_step<-0.3> ×5 step_back<0.5> walk<0,0.3,0>
0.3m ×5 sit<0> sit<0.5> side_step<-0.3> sit<0.8> walk<0,0.5,0> ×5 (a) 无技能控制 (b) 有技能控制 (c) 技能衔接 (d) 不同技能参数
图 5 技能可控性。(a) 无技能控制时,先验坍缩为碰撞姿态;(b) 有控制时,行走跟踪所要求的 0.3 m 步幅。(c) 技能以自然过渡组合(行走/侧步/后退形成循环);(d) 在 0/0.5/0.8 高度坐下,实现所命令的参数。
从仿真器视角看,所执行的轨迹仍为具有自然过渡、接触相关身体姿态及跨场景变化的逼真全身运动。下方的运动生成器通过使用通用运动 DiT 作为人体运动先验,并附加技能特定的 ControlNet 适配器进行参数化控制,来实现此接口。
该接口要求运动生成在轨迹层面逼真,且在技能层面可靠:运动应包含自然的过渡与变化,同时每个技能名称应一致地产生其预期的局部结果。
运动基座 DiT。 与大多数合成完整序列的运动生成模型不同,我们的主干网络遵循 Zhang et al. (2025c) 的方法,并针对滚动时域延续进行训练。在步骤 t,它观察最后五个干净的身体状态,并以 30 fps 生成接下来的十五帧,对应于仿真器执行的 0.5 秒运动块。基座模型有意设计为技能无关:它继承当前的运动动力学,但不继承技能名称或任务意图。因此,它作为局部自然人体运动的通用先验,而语义控制则随后通过技能 ControlNet 添加。
一个关键设计选择是过去的运动状态如何条件化生成。我们没有将历史压缩为单一条件向量 (Zhang et al., 2025c),而是将其作为运动令牌直接与带噪未来拼接: uτ = [xt−4:t, ˜xt+1:t+15(τ)] ∈R20×d, d = 219. (3) 每帧状态被线性投影到一个具有 3800 万参数、10 层 DiT 中,该 DiT 使用 8 头自注意力处理完整的 20 帧序列。流时间 τ 通过正弦 MLP 嵌入,并在每个 DiT 块中通过 adaLN-Zero 注入;基座模型不使用历史编码器,也不使用语义条件。网络为所有令牌预测速度场,而我们仅保留未来令牌的输出:
ˆvθ = Gθ([xt−4:t, ˜xt+1:t+15(τ)] , τ)t+1:t+15 . (4)
这种历史作为令牌的条件化方式使运动学连续性变得明确:未来令牌可以直接关注精确的近期姿态和速度状态,而非依赖可能丢失边界信息的压缩历史表示。
我们在 AMASS 运动数据上训练主干网络,数据被预处理为 30Hz 的 20 帧块。训练前,每个片段被校准到一个块局部坐标系,其原点和朝向由初始身体状态定义。这移除了全局平移和偏航,因此基座 DiT 建模的是局部人体动力学,而非绝对世界运动。前五帧是干净的历史,后十五帧构成干净的未来块 xfut = xt+1:t+15。流匹配采样高斯噪声 ϵ ∼N(0, I) 和时间 τ ∈[0, 1],在未来帧上构建 ˜xt+1:t+15(τ) = (1 −(1 −σmin)τ) ϵ + τxfut, v⋆= xfut −(1 −σmin)ϵ, (5) 并最小化 ∥ˆvθ −v⋆∥2。推理时,我们从噪声开始,使用 30 步中点求解器求解学习到的 ODE。由此得到的基座 DiT 提供了一个技能无关的运动先验:它产生
第 8 页
运动在运动学上与过去保持连续,而下一阶段则将该先验与文本级技能名称及其连续参数对齐。
即插即用技能作为ControlNet。 一旦基础DiT提供了运动学上连续的运动先验,接下来的问题就是将该先验与暴露给VLM的零样本技能接口对齐。如图4所示,我们通过为每个原子技能配备一个ControlNet风格的适配器来实现这一点,同时保持基础DiT冻结。因此,添加新技能只需训练一个新的ControlNet,而不会改变任何先前训练的技能。在部署时,VLM选择的技能名称仅决定附加哪个适配器,技能参数则提供适配器条件。
对于具有连续参数 \(c_t\) 的技能 \(s\),我们将基础模型的DiT块复制到一个可训练的控制分支中,并添加一个技能条件编码器 \(e_s(c_t)\)。编码器根据参数类型选择:标量条件(如侧步距离或坐下高度)使用MLP,而空间条件(如行走位移和偏航)在投影到DiT隐藏维度之前使用傅里叶特征。在第 \(\ell\) 层,冻结的基础分支和可训练的控制分支按如下方式组合:
\[ z_{\ell+1} = B_\ell(z_\ell, \tau) + W_\ell C_\ell(z_\ell + e_s(c_t), \tau), \]
其中 \(B_\ell\) 是冻结的基础块,\(C_\ell\) 是可训练的控制块,\(e_s\) 是技能条件编码器,\(W_\ell\) 初始化为零。最终的投影层仍为基础DiT的投影层;适配器仅修改隐藏的token流。
技能参数化被刻意与可从运动片段本身读取的物理结果绑定。对于行走,条件是片段局部的最终骨盆位移和偏航变化。对于侧步和后退,条件是相应的横向或向后位移。对于转身,条件是最终的身体偏航。对于楼梯和坐下,参数是启发式几何量,如台阶高度/深度或目标坐下高度。因此,训练不需要手动标注的动作参数:在为一个技能整理或过滤AMASS片段后,连续条件从校准的片段几何中提取。这并不意味着训练数据被不加区分地使用。我们手动审查并积极过滤每个ControlNet的片段,以保持技能分布的单一目的性和常识对齐。风格异常或意图混合的片段,如不稳定的行走、行走时执行无关的上半身动作,或身体过度扭转的楼梯动作,均被移除。这种整理对于零样本对齐至关重要:当VLM调用行走、转身或上楼梯时,相应的适配器应实现该技能的普通含义,而非某种特异的AMASS动作。
每个适配器使用与基础DiT相同的流匹配目标进行训练。基础网络被冻结,仅优化条件编码器、复制的控制块和零初始化的残差投影。给定干净的历史、带噪声的未来以及提取的技能条件,适配器预测未来帧的速度场,并以 \(\|\hat{v}_{\theta,s} – v^\star\|_2^2\) 进行监督。我们使用AdamW训练技能适配器,学习率为 \(3 \times 10^{-4}\),批量大小为2048,优化步数根据技能在 \(5 \times 10^5\) 到 \(1.5 \times 10^6\) 之间。我们不使用分类器引导或无分类器引导;技能控制直接由选定的适配器及其确定性参数接口提供。
图5定性地展示了这些特性。基础DiT自身产生多样但不受约束的轨迹(a);附加技能ControlNet后,它们收敛到技能名称所表示的零样本可靠行为(b)。由于所有技能共享相同的运动主干,连续技能之间的过渡保持平滑,惯性符合人体动力学(c)。此外,由于连续条件直接从运动几何中读取,这种无监督的参数化提供了对技能结果的细粒度控制,例如,坐到不同的目标高度(d)。
这种设计使技能集具有可扩展性。添加一个新的基元只需定义其文本/JSON模式,收集或过滤具有相关结果参数的运动片段,并在冻结的基础上训练一个新的适配器。反之,改进一个技能适配器不会影响VLM提示格式、仿真器、基础先验或其他技能。
2.4 运动解耦的物理仿真
研究具身行动智能的另一个挑战是如何将行动推理与底层运动电机控制解耦。在全动态人形仿真中,长程任务失败可能源于
第 9 页
重力
运动学 半物理仿真 运动学 半物理仿真 运动学 半物理仿真 (地面 vs 楼梯) (a) 穿墙 (b) 物体碰撞 (c) 爬楼梯
图 6 半物理仿真与纯运动学对比。纯运动学回放会穿墙而过并在半空中爬楼梯;半物理仿真使同一动作受接触和重力约束——墙壁阻挡身体,楼梯支撑身体——同时排除了平衡和运动跟踪失败的因素。
运动系统。例如,在杂乱环境或楼梯上,人形机器人可能失去平衡并摔倒,提前终止回合,从而无法对其动作智能进行有意义的评估。
与此同时,动作智能必须通过物理结果来评估。现有的代码智能体往往表现得更像幽灵:它们遵循预定义的运动学动画轨迹,绕过了人形机器人完整动作空间所带来的物理效应。然而,对于人形机器人来说,一个动作是否合适取决于它在世界中的效果:人形机器人可能安全通过狭窄空间、撞倒可移动物体、被墙壁阻挡,或在到达目标前停下。纯运动学模拟器消除了这些后果,而全动态力矩控制器则将其与平衡和运动技能(原子动作基元)失败纠缠在一起。因此,HumanCLAW 采用了一种中间层的半物理仿真(Siyao et al., 2025)机制,既保留了与场景的物理交互,又抽象掉了底层运动控制。
在 HumanCLAW 模拟中,世界遵循刚体物理,包括碰撞、摩擦、重力、铰接物体和可移动物体。然而,人体并非由模拟的关节力矩驱动。相反,它由从生成的运动序列中推导出的等效运动学速度驱动。这意味着智能体不会因失去平衡或不完美的运动跟踪而失败(例如,在踩踏楼梯时),但仍会与环境进行物理交互:墙壁可以阻挡身体,接触可以推动可移动物体,无支撑的垂直运动仍受重力和接触约束。
具体来说,我们基于 AI Habitat(Savva et al., 2019)和 Bullet(Coumans, 2015)物理引擎构建环境。给定第 2 节生成的 0.5 秒姿态序列,我们将连续姿态转换为等效的根部和关节速度。对于两个相邻姿态 qt 和 qt+1,模拟步长为 ∆t,线性关节速度计算为 qt+1 ˙qt = −qt , ∆t 旋转分量则从相应切空间中的相对旋转计算得出。这些等效速度作为人形机器人的唯一驱动信号。遵循先前的被动体模拟实践(Siyao et al., 2025),我们以 120 Hz 运行模拟器,并使用被动关节刚度 λ = 1.0 来保持柔顺的接触响应。
这种半物理仿真设计使 HumanCLAW 能够在物理后果下评估动作智能,而不会让基准测试被运动控制器失败所主导。生成的动作指定了预期的身体运动,而模拟器则决定该运动如何与物理世界交互。因此,诸如撞墙、扰动物体或过早停止等失败可归因于动作层面的决策,而来自底层平衡控制的失败则被大幅排除。
3 HumanCLAW-Bench
3.1 任务设计与 3D 场景设置
我们设计了一个寻找-导航-交互任务,以探测长程动作智能——控制身体、在 0.5 秒时间尺度上果断行动,并持续感知自身行为如何重塑场景。开始时
9
第 10 页
图7 基准测试1218个场景的难度分布。每个场景沿三个几何维度评分——距离(到最近目标的测地线长度)、选择(转弯数加穿过的房间数)和障碍物(路径1米范围内的平均障碍物数量)——并通过固定阈值划分为简单/中等/困难;柱状颜色表示难度等级(绿/蓝/粉),内嵌表格列出总体数量。距离呈右偏分布,而选择和障碍物分布平滑,形成了区分良好的难度层级。
每个场景开始时,智能体收到一条指令:“找到一个<物体>,导航至其零距离处,最后坐在上面。”任务是递进式的:每个阶段只有在前置条件满足后才能尝试,因此智能体需自主探索并决定其动作。我们目前将交互实例化为“坐”(例如坐在沙发或床上)。
我们在HSSD(Khanna et al., 2024)上构建3D场景,这是一个大规模、多样化的人工设计室内住宅数据集,涵盖多个楼层以及种类丰富的家具和小型物体。我们的基准测试使用41个验证住宅,提供1218个场景,涉及六个目标类别(椅子、床、沙发、盆栽、马桶、电视);每个场景指定智能体的起始位姿和一个目标物体类别,通过到达该类别的任意实例即可完成。六个类别分为两个子集:床、沙发和马桶构成597个场景的“坐”子集,其场景包含完整的寻找–导航–交互递进过程;而椅子、盆栽和电视构成621个场景的导航子集,在导航阶段即终止。因此,寻找和导航指标在所有1218个场景上计算,交互指标在597个“坐”场景上计算。为使智能体体验物理后果,我们进一步将可合理移动的物体(如桌面物品、小型家具)从静态转换为动态,使接触可使其移位;大型固定装置(床、沙发、马桶、墙壁)保持静态。
难度分析。为实现按难度分层评估,我们沿通往目标路径的三个可解释几何维度对每个场景评分:距离,即到最近同类目标的测地线距离;选择,即导航分支度,由经Douglas–Peucker简化路径上大于30°的转弯数加上穿过的房间数给出;障碍物,即杂乱度,由路径1米范围内的平均障碍物数量给出。由于HSSD仅提供标量测地线距离而无路径几何信息,我们首先通过在每层5厘米二维占据栅格(包含墙壁和静态家具)上运行A⋆算法重建最短可行路径;其长度与真实测地线距离匹配度在几个百分点以内(中位数比值为0.99),证实路径是可靠的。每个维度通过固定物理阈值(距离≤3.5/≤8米;选择≤2/≤5;障碍物≤2.5/≤5)划分为简单/中等/困难,使场景分布
10
第 11 页
跨层级分布(大致为23/46/31%),而非强制三等分,整体难度取三个层级的平均值。图7展示了最终分布,并附有每个层级的一个示例,使我们能够分别分析简单、中等和困难片段中的性能及各个几何因素。
3.2 评估指标
我们从四个维度评估VLM:(1)高层任务成功率,(2)低层动作质量,(3)身体意识与物理扰动,以及(4)计算成本。
渐进式成功率。 寻物-导航-交互基准测试是一个渐进式任务:智能体只有完成前一个子任务后才能进入下一个。因此,我们将阶段性成功定义为客观达成与主观确认兼具。即,智能体需要满足几何成功标准,同时也要认识到子任务已完成。客观标准定义如下:当目标语义ID出现在自我中心视角渲染图像中,且在512×512视图中占据至少100个像素时,即达成FindSR。当人类智能体与目标物体的轴对齐包围盒(AABB)之间的最小距离小于20厘米时,即达成NavSR。当智能体坐下且对应于臀部区域的骨盆链节与目标接触时,即达成InteractSR。主观完成情况根据智能体的逐步视觉状态及其在完成导航或交互后主动停止的决策来判断;我们表格中的主要指标要求同时满足客观标准和主观完成,而以Geo-为前缀的变体仅报告客观标准。
动作质量。 VLM智能体应将运动技能组合成流畅连贯的行为。糟糕的技能编排可能导致不稳定的动作,例如频繁交替左右转向。我们使用运动急动度(Motion Jerk),即智能体运动学动作的三阶导数,来衡量动作的平滑度。
身体意识与物理扰动。 身体意识是具身动作智能的关键组成部分。缺乏身体意识可能导致与环境的意外交互,例如穿过走廊时刮蹭墙壁或碰倒花瓶。因此,我们报告每个片段中发生碰撞的平均步数,记为Colls.。我们还通过计算每个片段内被人类智能体直接或间接移动的可移动物体的平均数量(记为#Dtb),以及每个被扰动物体的平均位移距离(记为dDtb),来衡量环境扰动。
成本。 最后,我们报告智能体每个片段平均消耗的令牌数,包括输入和输出令牌,作为计算成本的度量。
4 实验结果
4.1 零样本运动保真度
低层技能在零样本条件下是可靠的。 我们的可控运动先验——一个共享基础扩散变换器(DiT)加上每个技能的控制网络适配器(ControlNet),在AMASS/BABEL上一次性训练,部署时进行零样本查询——能忠实地实现每个技能所指令的方向和幅度,无需任何针对特定任务或场景的调优。在表1中,以目标幅度指令一项技能,其达成率接近1且方差很小:行走对指令步距的跟踪率为0.97,转向对指令角度的跟踪率为0.99,侧步为1.00,后退为0.99,坐下达到指令骨盆高度的比率为0.98,而爬楼梯实现了指令踏步高度的0.74–0.79,这是一个稳定、可校准的增益。每个指令的标准差极小(≤0.12),因此控制器每次都以相同方式执行相同指令——近乎恒定的比率反映的是固定、可预测的增益,而非噪声。我们将其与MoMask(Guo et al., 2024)进行对比,后者是一个强大的文本到动作模型,我们使用以自然语言呈现并明确说明幅度的相同指令(例如“以每秒0.8米的速度向前行走”)对其进行提示。即使提示中包含了数字,MoMask为每个动词渲染的也是通用动作,而非所请求的幅度——无论指令如何,它都以习惯速度行走,以习惯的椅子高度坐下——因此其保真度比率偏离1,且方差大一个数量级(标准差为0.3–1.3,而我们的为0.02–0.12)。由于我们的运动层在开箱即用时如此可靠,该基准测试在很大程度上隔离了高层具身推理——去哪里、感知什么以及如何编排动作序列——而非
第 12 页
表1 技能功能保真度。达成比 = 达成量 / 指令量(均值±标准差),基于多次 rollout 统计,两种方法在相同条件下评估。我们的可控先验以≈1的比例精确跟踪每个指令幅度,且方差很小;而文本到动作基线仅为每个动词生成通用动作,忽略请求的幅度,导致比值偏离1,且方差大一个数量级。
方法 walk side_step step_back turn_in_place climb_upstairs walk_downstairs sit_in_place Ours 0.966±0.022 1.002±0.123 0.986±0.056 0.994±0.038 0.794±0.019 0.738±0.052 0.977±0.078 MoMask (Guo et al., 2024) 1.921±1.031 1.717±1.234 2.072±1.067 0.608±0.284 0.820±0.826 1.540±0.421 1.817±1.279
表2 HumanClawBench 完整验证结果。FindSR = 目标在自我中心视角中渲染(≥100 语义像素)且在模型可见状态文本中被确认。扰动/动作质量/成本均按每回合归一化。碰撞 = 相对于地面的非地面碰撞步数占比。Motion Jerk = 在约0.27秒时间尺度上的根刚体急动度,取各回合均值;越低表示动作越连贯。每列最佳/次佳。
高层成功率 身体失察与场景扰动 动作质量 成本
VLM Backbone FindSR ↑ NavSR ↑ InteractSR ↑ Coll. ↓ #Dtb/ep ↓ dDtb(m) ↓ Motion Jerk ↓ avg steps in tok/step ↓ out tok/step ↓
GPT-5.5 55.1% 13.9% 3.4% 43.4% 1.53 1.56 4.2 82.4 4360 354 Gemini-3.1 64.9% 42.4% 16.8% 39.5% 1.50 1.22 5.7 59.1 5890 311 Gemini-2.5 58.5% 21.6% 3.5% 37.7% 1.35 3.03 8.7 71.3 6412 401 Claude-4.8 32.6% 8.6% 1.5% 44.2% 1.73 2.76 5.3 81.0 7047 625
Gemma-4-31B 58.1% 28.7% 11.1% 40.1% 1.66 1.86 4.8 78.5 4632 322 Qwen3.6-27B 51.0% 20.9% 0.2% 43.0% 1.95 2.16 6.5 81.6 4862 482 Qwen3.6-35B-A3B 44.6% 5.8% 0.0% 34.6% 1.45 2.38 7.4 74.0 4766 477 Qwen3.5-27B 37.8% 13.5% 0.0% 34.5% 0.93 2.38 6.8 37.6 4641 473 InternVL3.5-38B 46.8% 0.8% 0.0% 51.2% 1.90 2.56 7.2 93.0 4459 309
而非低层运动能力,我们分析的失败可归因于规划、感知和体态自知,而非底层技能的执行。
4.2 基准测试
我们评估了九个现成的 VLM 作为冻结决策器,并在表2中报告了完整验证结果。
发现1:当前尚无 VLM 能解决该基准测试。
最佳模型 Gemini-3.1 仅在 16.8% 的回合中找到并坐在目标上,九个模型中有四个在最多 0.2% 的回合中完成该动作。这一低上限背后是每个模型共有的逐阶段急剧下降。FindSR 范围从 32.6% 到 64.9%,NavSR 从 0.8% 到 42.4%,InteractSR 从 0% 到 16.8%,因此任务的大部分成功率丢失了两次:第一次在发现目标与到达目标之间,第二次在到达目标与与之交互之间。
看到目标很少能转化为到达目标。我们用抵达率(NavSR 与 FindSR 的比值)来概括第一次下降,该比率衡量模型发现的目标中有多少被实际到达。即使是 Gemini-3.1,其抵达率也仅为 0.65,Gemma-4-31B 为 0.49,InternVL3.5-38B 为 0.02。识别目标在各模型中很常见。将这种识别转化为一个停在目标旁边的身体,才是区分它们的关键,也是该基准测试留下最大改进空间的地方。
体态自知和成本应与成功率结合解读。低扰动可能意味着不作为而非控制。Qwen3.5-27B 记录了最低的物体位移(每回合 0.93)和最少的步数(37.6),但它几乎不移动,且在 0% 的回合中交互。另一个极端是,InternVL3.5-38B 和 Claude-4.8 将最高的碰撞占比(51.2% 和 44.2%)与崩溃的 NavSR 配对,呈现出一种无控制移动的智能体特征。消耗更多 token 也无济于事。Claude-4.8 每步使用最多的输入和输出 token(7047 和 625),但在所有成功指标上均落后,而 Gemini-3.1 以更低的成本领先。
第 13 页
表3 在HumanClawBench mini-val 100个回合上的消融实验。其余列均为全部100个回合的结果。文本历史长度、视觉历史帧数及设计组件均在基线(hist 10, img 1)基础上变化。FindSR采用离线渲染判定口径(目标在自我中心视角中渲染≥100像素且被无否定地确认),与主表一致。Motion Jerk = 决策时间尺度(步长8)下的根刚体急动度,取各回合均值。VLM骨干为Gemma-4-31B。
| 设置 | 高层成功率 | | | 身体误判与场景干扰 | | | 动作质量 | 成本 | | |——|————|——|——|—————-|——|———|————|———-|———|————| | | FindSR ↑ | NavSR ↑ | InteractSR ↑ | Coll.% ↓ | #Dtb ↓ | dDtb(m) ↓ | Motion Jerk ↓ | 平均步数 | 输入token/步 ↓ | 输出token/步 ↓ | | 基线 (hist 10, img 1) | 58.0% | 27.0% | 18.9% | 41.4% | 1.35 | 9.38 | 4.9 | 78.5 | 4676 | 322 | | 文本历史长度 | | | | | | | | | | | | hist 0 | 65.0% | 11.0% | 0.0% | 38.6% | 1.27 | 6.46 | 5.1 | 88.9 | 2582 | 292 | | hist 20 | 59.0% | 27.0% | 7.5% | 42.9% | 1.18 | 1.56 | 4.8 | 80.3 | 6692 | 326 | | hist 50 | 60.0% | 28.0% | 7.5% | 40.4% | 1.24 | 6.16 | 4.8 | 77.6 | 10538 | 320 | | hist 100 | 56.0% | 26.0% | 11.3% | 37.6% | 1.08 | 7.23 | 4.7 | 79.7 | 12904 | 318 | | 视觉历史帧数 | | | | | | | | | | | | img 2 | 57.0% | 31.0% | 9.4% | 43.0% | 1.19 | 2.55 | 4.7 | 78.8 | 5234 | 321 | | img 5 | 55.0% | 28.0% | 7.5% | 41.1% | 1.30 | 8.86 | 5.1 | 82.7 | 6335 | 324 | | img 10 | 53.0% | 13.0% | 3.8% | 34.9% | 0.95 | 3.19 | 5.2 | 92.3 | 7685 | 303 | | 设计组件 | | | | | | | | | | | | 无验证器 | 51.0% | 2.0% | 0.0% | 33.2% | 0.71 | 10.40 | 4.8 | 47.5 | 4095 | 247 | | 无中层目标 | 62.0% | 30.0% | 0.0% | 35.4% | 1.22 | 2.08 | 5.0 | 70.3 | 3769 | 264 |
动作质量反映模型编排动作的连贯性。任务成功与否并不能说明智能体如何移动,因此我们报告了Motion Jerk列——在决策时间尺度上对骨盆轨迹进行去噪后的三阶时间导数——用于衡量骨干模型编排动作的连贯性,而非共享生成器的固定步态。从设计上,它惩罚不连贯的序列编排,而非运动量:单个skill得分为4–6(前进走5.2,转身4.3),一个有目的的走-转-走轨迹得分为5.8,而一个无目的编排的策略可达9.7;固定skill内容仅改变顺序即可证实这一点——五个前进走块接五个侧向步得分为4.7,但将相同的十个块交错执行则得分为7.4(高出1.6倍),纯粹源于顺序差异。在此指标下(越低越平滑),GPT-5.5最连贯(4.2),其次是Gemma-4-31B(4.8),且动作质量与成功率解耦:Gemini-2.5尽管成功率有竞争力,却是最差的(8.7),左右摇摆且转身反转率最高(约每五步一次),而Qwen3.6-35B-A3B次差(7.4),伴有原地旋转的阵发。
最强的开源模型已接近前沿水平。Gemma-4-31B(58.1/28.7/11.1)在全部三项成功率上均匹敌或超越除Gemini-3.1外的所有闭源模型,并超越了GPT-5.5和Claude-4.8。因此,HumanCLAW-Bench上的进展对社区开放,而非被单一闭源模型所垄断。
4.3 消融研究
我们在100个回合的mini-val划分上对框架进行消融,在表3中围绕基线(hist 10, img 1)改变文本历史长度、视觉历史帧数及设计组件。
发现2:推理支架——记忆、中层目标与验证——提升了行动智能;更长的文本或视觉历史则无此效果。
验证器是决定性组件。移除验证器导致NavSR从27.0%骤降至2.0%,InteractSR从18.9%降至0.0%,而FindSR几乎不变(58.0%至51.0%)。其作用在于行动,而非感知。无验证器时,回合也结束得早得多(47.5步 vs. 78.5步),表明智能体在闭环完成前即停止或漂移。验证器正是将一连串skill提议转变为能够抵达并确认的闭环的关键。
文本历史是必要的,但很快饱和。无历史时,智能体无法维持计划,NavSR和InteractSR分别降至11.0%和0.0%。一段简短的结构化记忆即可恢复大部分差距,但延长它并无帮助。在10、20、50和100步的历史长度下,NavSR保持在26–28%附近,InteractSR
第 14 页
表4 HumanClawBench完整验证集上的寻物/导航/交互成功率变体。FindSR = 渲染可见(自我中心视角中≥100像素)且模型确认(无否定);GeoFindSR = 仅渲染可见≥100像素。NavSR = 主动停止且身体-目标AABB距离≤阈值;GeoNavSR = 仅AABB距离判据。InteractSR = 坐动作在确认停止时使骨盆与目标网格接触;GeoInteractSR = 某次坐动作在任意步骤使骨盆与目标网格接触(曾坐于座位上,即使后续姿态丢失)。每列最佳/次佳。
| VLM Backbone | FindSR ↑ | GeoFindSR ↑ | NavSR@20cm ↑ | GeoNavSR@20cm ↑ | NavSR@1m ↑ | InteractSR ↑ | GeoInteractSR ↑ | |—————|———-|————–|—————|——————|————|————–|——————| | GPT-5.5 | 55.1% | 63.2% | 13.9% | 27.7% | 15.5% | 3.4% | 9.7% | | Gemini-3.1 | 64.9% | 69.9% | 42.4% | 44.7% | 52.5% | 16.8% | 21.4% | | Gemini-2.5 | 58.5% | 66.4% | 21.6% | 23.6% | 31.0% | 3.5% | 4.5% | | Claude-4.8 | 32.6% | 55.7% | 8.6% | 13.5% | 11.4% | 1.5% | 2.2% | | Gemma-4-31B | 58.1% | 67.7% | 28.7% | 35.6% | 33.4% | 11.1% | 17.9% | | Qwen3.6-27B | 51.0% | 62.8% | 20.9% | 34.8% | 24.2% | 0.2% | 0.3% | | Qwen3.6-35B-A3B | 44.6% | 59.0% | 5.8% | 14.0% | 11.4% | 0.0% | 0.0% | | Qwen3.5-27B | 37.8% | 48.9% | 13.5% | 17.7% | 19.2% | 0.0% | 0.0% | | InternVL3.5-38B | 46.8% | 59.1% | 0.8% | 12.6% | 1.6% | 0.0% | 0.0% |
在最短设置下最高,而每步输入token数从约4.7K攀升至12.9K。紧凑的历史记录以极小的代价捕获了几乎全部收益。
更多图像帧可能有害。添加少量视觉历史帧大致中性,但过多则会降低智能体性能。在img 10时,NavSR从27.0%降至13.0%,InteractSR从18.9%降至3.8%,同时输入token数上升。决策模型受限于对当前视图的推理,因此用过去帧淹没它会稀释信号,而非改善覆盖范围。
中层推理支撑长程交互。移除中层目标几乎不影响寻物或导航——FindSR(62.0%)和NavSR(30.0%)甚至略高于基线——但InteractSR从18.9%骤降至0.0%。原因在于,坐下并非单一反应步骤,而是一个简短的组合例程:智能体必须到达座位,转身使背部对准,然后才坐下——这是一个持续数秒的序列,纯粹逐步执行的策略无法维系。没有中层目标将这些步骤绑定,智能体接近目标但从未完成终端交互,且回合更早结束(70.3步 vs 78.5步)。因此,中层推理是维持将导航转化为交互所需的中程承诺的关键。
4.4 错误分析与关键发现
鉴于当前尚无VLM能解决该基准,我们现在剖析回合在何处以及为何失败,使用同一批rollout的四个互补视角。能力漏斗追踪回合在寻物→导航→交互各阶段的流失情况,逐阶段分解将每个阶段的失败归因于单一根本原因(图8);所有根本原因标签均由固定规则根据记录的rollout自动分配(第B节)。表4报告了成功率变体,将各阶段的客观(仅几何)成功与模型确认的成功分开,以隔离感知与决策;表5按身体部位分解碰撞情况;图9展示了代表性的身体无意识rollout。我们将分析组织为四项发现,对应具身循环的每个阶段。
发现3:感知重要,但并非瓶颈。
表4区分了两种寻物概念:GeoFindSR统计目标在自我中心视角中客观渲染可见(512×512图像中至少100像素)的回合,无论模型是否报告;而FindSR额外要求模型确认。对于最强模型,两者仅相差5-10个百分点(Gemini-3.1 69.9 vs. 64.9,GPT-5.5 63.2 vs. 55.1,Gemma-4-31B 67.7 vs. 58.1),因此一旦目标真正进入自我中心视角,几乎总能被识别——识别本身已基本解决(图8a)。寻物失败的上游原因在于根本未能将目标纳入视野:约半数回合从未
第 15 页
图 8 九个 VLM 的失败环节分布。(a) 所有回合的 Find→Nav→Interact 漏斗图;(b–d) 按能力维度着色的各阶段根因分解。失败集中在自我中心的身体感知和空间自定位——距离尚远即停止、未意识到已到达或被卡住、以及坐向空中——而非感知或运动执行。
重放每一个失败回合并将其归因于单一根因(图 8b),主要缺陷在于中层推理:主要是无效探索(38%),即智能体无条理地搜索场景且从未渲染出目标,以及相关的搜索失败——靠近但从未转向查看(10%)和半途放弃(3%)。真正的感知失误——目标已渲染但未被识别——占次要的 23%,其余为无效动作(12%)、未意识到被几何体卡住(9%)以及因目标过远而放弃(6%)。因此,寻找受限于智能体选择探索的位置和方式,而非目标出现后能否识别。
发现 4:自我中心的自定位是导航瓶颈。
在所有九个 VLM 中,智能体主动找到目标(目标在自我中心视角中以 ≥100 个语义像素渲染,且在模型的可见状态描述中被确认)的 5,473 个回合中,仍有 3,706 个(68%)未能导航至目标(到达 0.2 米内并停止)。我们离线重放每一条此类轨迹,并利用客观的最后一帧渲染、逐帧身体位移和动作流,将每次失败归因于单一根因(图 8)。近三分之二的失败是自我中心的空间自感知错误,而非感知或底层控制错误,表现为双向终止决策失误:智能体要么在已到达后继续导航,要么在距离尚远时停止,因为它无法判断自身相对于目标的位置。最大类别是身体感知(34%):智能体物理上已位于或紧贴目标,却误判自身状态——20% 的情况是已到达 0.2 米内但从未发出到达信号并继续导航,14% 的情况是被障碍物卡住一段时间却仍持续发出前进指令,未意识到被阻挡。另有 30% 是自我中心空间距离幻觉:智能体在距离仍超过 0.2 米时停止并声明到达,误以为远处目标触手可及。其余失败相对次要:中层推理(17%;智能体转向——例如为避开障碍物——导致目标从视野中丢失且无法重新捕获,占 16%,或发现目标过晚以致无法物理到达,不足 1%)、视觉感知(9%;目标已离开自我中心视角但模型仍声称看到它)以及纯动作/运动(10%;身体自由移动但持续
第 16 页
表5 HumanClaw-Bench上按身体部位分组的碰撞统计。Coll.% = 任意非地面身体部位;四个分组列分别为各部位步数占比与重叠情况。每列最佳 / 次佳。 (a) 无感知手臂碰撞
VLM 主干 Coll.% ↓ Arm/Hand ↓ Torso ↓ Leg/Foot ↓ Head ↓
GPT-5.5 43.37 23.24 13.78 38.83 2.99 Gemini-3.1 39.48 20.97 11.72 33.29 2.62 Gemini-2.5 37.69 22.70 13.63 30.87 2.94 Claude-4.8 44.18 28.97 16.90 37.94 6.93
Gemma-4-31B 40.09 21.21 11.38 34.72 2.66 Qwen3.6-27B 42.97 25.48 12.70 36.86 3.54 Qwen3.6-35B-A3B 34.58 21.20 11.40 27.99 3.71 Qwen3.5-27B 34.53 20.59 10.93 29.58 2.87 (b) 无感知腿部卡滞 InternVL3.5-38B 51.17 34.68 23.12 44.75 6.10 图9 身体无感知失败案例。两个片段,每个均以自我中心视角(上)和第三人称视角(下)展示连续步数:(a) 手臂刮擦家具未被察觉;(b) 腿部卡在低矮物体上,而前进指令持续执行——这些代价由Coll.和#Dtb捕获。
转向并发出无效动作,始终无法接近可见目标)。发现时机的影响微乎其微(低于1%):采用距离感知标准,仅0.5%的失败案例在首次发现目标后,剩余步数不足以覆盖所需距离。简言之,人形智能体的核心弱点不在于能否看见目标或能否移动,而在于无法知晓自身相对于已见目标的位置,以及是否已抵达该目标。
发现5:抵达不等于交互。
在九个VLM共726个智能体成功导航至座位的片段中——即主动停在距目标0.2米以内,已满足导航条件——仍有513个(71%)未能完成坐下。我们回放每条此类轨迹,并根据沿轨迹记录的骨盆-物体网格接触(精确接触,非包围盒重叠)及动作流,将每次失败归因于单一根本原因(图8)。失败绝大多数源于体态自知错误——智能体决定坐下,却将身体置于错误位置(81%)——而非决策错误(19%)。主要模式是坐向虚空(58%):智能体发出坐下指令,但骨盆在任何一步都未接触任何表面——它仅在自己站立的位置降低身体,下方并无座位。另有14%坐错物体:骨盆落在其他物体或地面上,而非目标座位(最常见于目标为沙发、床或马桶时,其邻近物体容易导致错误落点)。最后9%短暂接触座位——骨盆在坐下过程中确实与网格发生接触——但智能体随后继续动作(主要是转向,偶尔站起再坐下)而非停止,并在最后一帧前将身体移离座位。其余19%为决策失败:智能体抵达并停在座位前方,但始终未发出坐下指令。简言之,一旦人形智能体走到目标旁,能否坐下并不取决于是否决定坐下,而取决于将身体置于何处:五分之四的失败将骨盆落在虚空、错误物体或离开座位——这是限制导航的自我中心空间缺陷的更精细体现。交互最终要求的,正是最精细的具身空间推理:相对于自身和周围场景精确放置身体,并预判每个动作将产生的空间关系——坐下动作展开后骨盆相对于座位将落在何处——而非仅仅决定行动。
第 17 页
发现 6:当前尚无 VLM 能感知自身躯体。
每个阶段失败的根源在于智能体对自身躯体的无视。碰撞集中在其未注视的部位:在所有九个模型中,腿脚碰撞最为频繁(占步数的 28–45%),手臂和手次之(20–35%),而头部——很少靠近障碍物——几乎从不碰撞(低于 7%,表 5)。两次运行具体呈现了这种失败(图 9):在 (a) 中,智能体的手臂碰倒了一把几帧前还清晰可见的椅子,但它从未察觉到接触;在 (b) 中,一个障碍物持续出现在正前方视野中,但智能体仍不断将腿撞上去。在这两种情况下,场景被看见,但躯体未被感知。一个仅通过视觉问答训练的 VLM 表现得如同幽灵:它不具备关于哪些像素属于自身肢体的本能模型,也从不尝试推断它们的位置。这种盲目性部分源于接口本身:智能体仅接收自我中心视角的 RGB 图像和文本历史,没有本体感觉的躯体状态或接触信号,因此任何对自身躯体的感知只能完全从视觉中重建(第 6 节)。这并非无关紧要的麻烦——躯体感知是 34% 导航失败和 81% 交互失败的根源(发现 4–5)——而是具身行动尚未获得的核心能力:感受躯体,而不仅仅是观察世界。
5 相关工作
5.1 具身任务与交互环境
具身环境不仅在其包含的任务上有所不同,在智能体动作如何在仿真中落地和执行方面也存在差异。VirtualHome (Puig et al., 2018) 将家庭活动建模为基于结构化场景状态的程序,并使用预定义化身动画渲染原子指令,优先考虑活动语义而非闭环物理控制。ALFRED (Shridhar et al., 2020) 引入了自我中心视角的语言遵循,但暴露了一组离散的导航和交互动作,其执行由模拟器解析。Habitat 2.0 (Szot et al., 2021) 和 BEHAVIOR-1K (Li et al., 2023) 转向支持物理的重排和移动操作,在机器人特定控制下支持关节物体和持久物理状态。Habitat 3.0 进一步引入了人形化身和人在回路交互,主要用于研究机器人在人类伙伴周围行动或与之协作 (Puig et al., 2024)。
现有的具身环境通常与通用 MLLM 不匹配。程序驱动的环境通过预定义转换来解析动作,几乎不需要对躯体运动或物理后果进行推理。相比之下,完全基于物理的模拟器需要高频连续控制,并将空间决策与运动执行纠缠在一起。HumanCLAW 采取了一种折中方案:一个冻结的 MLLM 基于自我中心视角的观察选择参数化的全身运动技能,利用运动生成模型自回归地生成连续的长期行为。半物理仿真执行保留了碰撞、接触和物体扰动,同时抽象了底层控制,从而实现了基础的具身交互。
与我们的寻物导航设定最接近的是物体目标导航和视觉与语言导航,其中具身智能体根据自我中心视角的观察定位并移动到目标 (Savva et al., 2019; Khanna et al., 2024; Anderson et al., 2018)。然而,这些任务通常将智能体抽象为一个移动的摄像头或速度受控的点,并且仅评估是否到达某个位置,忽略了完整躯体如何在物理后果下到达、定向和交互——这正是 HumanCLAW 所针对的中间层。
5.2 作为具身决策者的多模态基础模型
近期的综述区分了分层智能体系统和端到端的视觉-语言-动作 (VLA) 策略 (Ma et al., 2026; Liang et al., 2025)。分层智能体使用多模态大语言模型 (MLLM) 进行任务分解、空间锚定、技能选择、反馈驱动的重规划 (Ichter et al., 2023; Liang et al., 2023; Huang et al., 2023b; Song et al., 2023; Driess et al., 2023; Huang et al., 2023a; Duan et al., 2024; Li et al., 2026b),以及具有可复用技能的开放世界记忆 (Wang et al., 2023, 2024)。冻结的 VLM 也已被用于通过第一人称游戏进行闭环驱动 (Tan et al., 2024; Zhang et al., 2025a),其中动作仍然是按键,其结果由游戏脚本解析。尽管适用于长程推理,但它们通常将执行简化为符号动作或技能结果,掩盖了与环境在躯体层面的具身交互。端到端的 VLA 策略则直接从
第 18 页
具身数据(Zitkovich et al., 2023; Ghosh et al., 2024; Kim et al., 2025; Black et al., 2024; NVIDIA et al., 2025),但将任务推理与机器人特定数据及底层控制耦合。动作推理模型如MolmoAct(Lee et al., 2025)在输出动作前,会外化一个可编辑的中层空间轨迹,但其决策器仍基于动作数据训练,并以闭环执行方式评估,而非作为冻结的通用模型被查询。
现有基准评估目标解释、动作序列化和长程规划(Li et al., 2024; Choi et al., 2024; Chang et al., 2025; Yang et al., 2025; Hong et al., 2026),但主要对规划、仿真器动作或机器人轨迹进行评分。HumanCLAW则评估冻结的现成VLM如何在长程任务中维持自我中心视角的空间动作。其技能(原子动作基元)级决策在物理世界中实现为连续的全身运动,该世界保留了碰撞、接触、重力和物体动力学,同时很大程度上抽象掉了平衡和运动跟踪失败。此设置评估渐进式任务成功,同时考量动作连贯性、身体感知和环境扰动。
越来越多的工作直接探究VLM的空间智能(Chen et al., 2024; Yang et al., 2024, 2025; Li et al., 2025),报告称当前模型在度量距离、方向和多步空间模拟方面存在困难。然而,这些评估大多将空间理解视为对图像、视频或跨视角对的问答,处于无环境反馈的开环设置中。我们所用的“动作智能”一词,是此类设置未衡量的空间智能的操作性组成部分:将空间理解转化为闭环具身决策——随着物理后果的展开,选择、参数化和序列化动作——模型自身的身体状态也是问题的一部分。它同样比通用意义上的规划器(给定观察和目标,输出智能体下一步应做什么)更窄:规划器通常根据其提议的合理性进行开环评分,而动作智能则通过执行来衡量,其中每个决策都实现为运动,其后果在下一个自我中心视角中返回。我们的错误分析与空间推理发现一致:即使感知成功,主要失败也是自我中心空间性的——自我定位、可达性以及知晓身体何时到达——因此HumanCLAW正是对这一瓶颈的物理闭环压力测试。
5.3 可控人体运动生成作为智能体工具
文本到运动模型从大规模运动-语言语料库中学习到合理的全身运动强先验(Guo et al., 2022; Tevet et al., 2023; Guo et al., 2024; Huang et al., 2024)。除仅使用文本外,后续的可控运动生成方法进一步将运动条件化于空间约束、角色身份、人际交互、自我感知、物理和音乐(Hassan et al., 2021; Zhang and Tang, 2022; Zhao et al., 2023; Xie et al., 2024; Yuan et al., 2023; Siyao et al., 2025; Wu et al., 2025; Jia et al., 2026; Cong et al., 2026; Zhang et al., 2025b; Li et al., 2026a; Zhang et al., 2025b; Diomataris et al., 2025; Zhang et al., 2025c; Siyao et al., 2022, 2023, 2024)。尽管额外的控制模态提高了运动保真度,但其输入协议超出了现有多模态大语言模型智能体的输出格式,即纯文本输出。一个智能体可执行工具集需要一个紧凑且可预测的接口:每次工具调用应遵循其语义意图和连续参数,同时产生可靠的局部结果。因此,HumanCLAW提出了一个共享的滚动时域运动先验,以及基于带参数的文本模板为每个原子技能(原子动作基元)设计的即插即用适配器,将长程技能选择、参数化和组合留给VLM。
6 讨论
HumanCLAW隔离了物理动作的一个中间层——具有真实场景后果的连续全身运动,但无平衡或运动跟踪失败——并用它来探究当今的VLM通过身体行动的能力如何。在九个最先进的模型中,答案是一致的:没有一个能解决该基准,且失败之处并非视觉-语言智能体通常被评判的方面。感知基本完好——一旦目标被渲染,几乎总能被识别(发现3)——但在识别之后的所有环节,能力都崩溃了。缺失的是体态自知:知晓身体在何处以及何时到达(发现4),足够精确地放置身体以进行交互(发现5),以及感知到身体何时与世界碰撞(发现6)。共同点是,当前的VLM能推理场景,但不能推理它们此刻所栖居的身体。
18
第 19 页
我们将此归因于这些模型的构建方式。通过视觉问答训练的VLM学会的是描述所见,而非感知所为;它将自身的肢体仅视为更多像素,从未形成通过身体行动所需的本体感知与后果预测模型。其结果如同幽灵——对世界侃侃而谈,对自身浑然不觉。弥合这一鸿沟,可能需要的不仅是更敏锐的识别或更长的上下文窗口:它呼唤持久的空间记忆、校准的终止判断,以及一个包含身体及其每个动作所产生的空间关系的内部模型。
框架之下是一种哲学信念:我们认为,可泛化的行动智能源于推理,而非对行动数据的拟合。基于轨迹拟合的策略在其数据支撑范围内泛化;而推理者则能泛化至其知识所能外推的边界。HumanCLAW正是建立在这一赌注之上——决策器保持冻结且通用,运动层是固定、可复用的先验,所有任务层面的组合均在推理中以零样本方式完成。依此观点,通用行动智能体的进步不在于收集更多轨迹,而在于成为更好的推理者:新技能无需重新训练即可注册,新任务仅需新规则,基础模型的每一次进步都能无偿迁移至身体。我们的结果使这一赌注保持开放但更为聚焦:当前的推理尚未触及身体,然而失败发生在决策层面——这正是更好的推理,而非更多数据,可以发挥作用的地方。由于缺乏与拟合行动策略的对比,这最后一步仍是我们的工作假设:实验所确立的是失败所在的位置,而非哪条路径能够弥合它们。
我们的研究存在局限。交互词汇量较小;更丰富的操作将拓宽交互阶段,并对更精细的身体定位提出更高要求。决策层面的归因同样相对于技能词汇:在排除运动执行因素后,被解读为决策失败的情况仍取决于原子技能的粒度,更细或更粗的词汇划分会将边界划在别处。半物理仿真刻意抽象掉了平衡与运动跟踪,因此HumanCLAW衡量的是行动决策而非底层控制,将胜任的决策器迁移到物理人形机器人上仍是未来工作。该界面同样未模拟触觉通道:碰撞会改变世界状态,但从未被感知,因此智能体只能通过其自我中心视角获得本体感知——这可能存在内在困难,而身体状态或接触信号可能是缺失的输入,而非缺失的能力。最后,我们评估的是冻结的现成VLM;针对身体感知的定向训练能否突破这些上限,是一个开放且——我们认为——可解的问题。
HumanCLAW-Bench留下了充足的提升空间:最强模型仅在16.8%的回合中完成全部任务,即使仅导航一项,成功率峰值也仅为42.4%——提升空间恰好集中在体态自知取得进展将产生复合效益的地方。我们将其作为一个洁净的测试平台,献给下一代智能体——那些不仅能看、能规划,更能行动的智能体。
19
第 20 页
参考文献
Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian Reid, Stephen Gould, and Anton van den Hengel. Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments. In *Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)*, 2018.
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, and Ury Zhilinsky. π0: A vision-language-action flow model for general robot control, 2024. https://arxiv.org/abs/2410.24164.
Matthew Chang, Gunjan Chhablani, Alexander Clegg, Mikael Dallaire Cote, Ruta Desai, Michal Hlavac, Vladimir Karashchuk, Jacob Krantz, Roozbeh Mottaghi, Priyam Parashar, Siddharth Patki, Ishita Prasad, Xavier Puig, Akshara Rai, Ram Ramrakhya, Daniel Tran, Joanne Truong, John M. Turner, Eric Undersander, and Tsung-Yen Yang. PARTNR: A benchmark for planning and reasoning in embodied multi-agent tasks. In *The Thirteenth International Conference on Learning Representations*, 2025. https://openreview.net/forum?id=T5QLRRHyL1.
Boyuan Chen, Zhuo Xu, Sean Kirmani, Brian Ichter, Dorsa Sadigh, Leonidas Guibas, and Fei Xia. SpatialVLM: Endowing vision-language models with spatial reasoning capabilities. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, pages 14455–14465, 2024.
Jae-Woo Choi, Youngwoo Yoon, Hyobin Ong, Jaehong Kim, and Minsu Jang. LoTa-Bench: Benchmarking language-oriented task planners for embodied agents. In *The Twelfth International Conference on Learning Representations*, 2024. https://openreview.net/forum?id=ADSxCpCu9s.
Xiaoyan Cong, Zekun Li, Zhiyang Dou, Hongyu Li, Omid Taheri, Chuan Guo, Abhay Mittal, Sizhe An, Taku Komura, Wojciech Matusik, et al. Umo: Unified in-context learning unlocks motion foundation model priors. *arXiv preprint arXiv:2603.15975*, 2026.
Erwin Coumans. Bullet physics simulation. In *ACM SIGGRAPH 2015 Courses*, page 7:1. ACM, 2015. doi: 10.1145/2776880.2792704.
Markos Diomataris, Berat Mert Albaba, Giorgio Becherini, Partha Ghosh, Omid Taheri, and Michael J Black. Moving by looking: Towards vision-driven avatar motion generation. *arXiv preprint arXiv:2509.19259*, 2025.
Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, Wenlong Huang, Yevgen Chebotar, Pierre Sermanet, Daniel Duckworth, Sergey Levine, Vincent Vanhoucke, Karol Hausman, Marc Toussaint, Klaus Greff, Andy Zeng, Igor Mordatch, and Pete Florence. PaLM-E: An embodied multimodal language model. In *Proceedings of the 40th International Conference on Machine Learning*, volume 202 of *Proceedings of Machine Learning Research*, pages 8469–8488. PMLR, 2023. https://proceedings.mlr.press/v202/driess23a.html.
Jiafei Duan, Wentao Yuan, Wilbert Pumacay, Yi Ru Wang, Kiana Ehsani, Dieter Fox, and Ranjay Krishna. Manipulate-anything: Automating real-world robots using vision-language models. In *Conference on Robot Learning*, 2024.
Dibya Ghosh, Homer Rich Walke, Karl Pertsch, Kevin Black, Oier Mees, Sudeep Dasari, Joey Hejna, Tobias Kreiman, Charles Xu, Jianlan Luo, You Liang Tan, Lawrence Yunliang Chen, Quan Vuong, Ted Xiao, Pannag R. Sanketi, Dorsa Sadigh, Chelsea Finn, and Sergey Levine. Octo: An open-source generalist robot policy. In *Proceedings of Robotics: Science and Systems*, Delft, Netherlands, July 2024. doi: 10.15607/RSS.2024.XX.090.
Chuan Guo, Shihao Zou, Xinxin Zuo, Sen Wang, Wei Ji, Xingyu Li, and Li Cheng. Generating diverse and natural 3d human motions from text. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition*, pages 5152–5161, 2022. doi: 10.1109/CVPR52688.2022.00509.
Chuan Guo, Yuxuan Mu, Muhammad Gohar Javed, Sen Wang, and Li Cheng. MoMask: Generative masked modeling of 3d human motions. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition*, pages 1900–1910, 2024. https://openaccess.thecvf.com/content/CVPR2024/html/Guo_MoMask_Generative_Masked_Modeling_of_3D_Human_Motions_CVPR_2024_paper.html.
Mohamed Hassan, Duygu Ceylan, Ruben Villegas, Jun Saito, Jimei Yang, Yi Zhou, and Michael J. Black. Stochastic scene-aware motion prediction. In *Proceedings of the IEEE/CVF International Conference on Computer Vision*, pages 11354–11364, 2021. doi: 10.1109/ICCV48922.2021.01118.
20
第 21 页
Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, and Yejin Choi. ESI-Bench: Towards embodied spatial intelligence that closes the perception-action loop. arXiv preprint arXiv:2605.18746, 2026.
Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li, Jiajun Wu, and Li Fei-Fei. VoxPoser: Composable 3d value maps for robotic manipulation with language models. In Proceedings of the 7th Conference on Robot Learning, volume 229 of Proceedings of Machine Learning Research, pages 540–562. PMLR, 2023a. https://proceedings.mlr.press/v229/huang23b.html.
Wenlong Huang, Fei Xia, Ted Xiao, Harris Chan, Jacky Liang, Pete Florence, Andy Zeng, Jonathan Tompson, Igor Mordatch, Yevgen Chebotar, Pierre Sermanet, Tomas Jackson, Noah Brown, Linda Luu, Sergey Levine, Karol Hausman, and Brian Ichter. Inner monologue: Embodied reasoning through planning with language models. In Proceedings of the 6th Conference on Robot Learning, volume 205 of Proceedings of Machine Learning Research, pages 1769–1782. PMLR, 2023b. https://proceedings.mlr.press/v205/huang23c.html.
Yiming Huang, Weilin Wan, Yue Yang, Chris Callison-Burch, Mark Yatskar, and Lingjie Liu. Como: Controllable motion generation through language guided pose code editing. In European Conference on Computer Vision, pages 180–196. Springer, 2024.
Brian Ichter, Anthony Brohan, Yevgen Chebotar, Chelsea Finn, Karol Hausman, Alexander Herzog, Daniel Ho, Julian Ibarz, Alex Irpan, Eric Jang, et al. Do as i can, not as i say: Grounding language in robotic affordances. In Proceedings of the 6th Conference on Robot Learning, volume 205 of Proceedings of Machine Learning Research, pages 287–318. PMLR, 2023. https://proceedings.mlr.press/v205/ichter23a.html.
Wenqi Jia, Zekun Li, Abhay Mittal, Chengcheng Tang, Chuan Guo, Lezi Wang, James Matthew Rehg, Lingling Tao, and Size An. Iam: Identity-aware human motion and shape joint generation. arXiv preprint arXiv:2604.25164, 2026.
Mukul Khanna, Yongsen Mao, Hanxiao Jiang, Sanjay Haresh, Brennan Shacklett, Dhruv Batra, Alexander Clegg, Eric Undersander, Angel X. Chang, and Manolis Savva. Habitat synthetic scenes dataset (HSSD-200): An analysis of 3d scene scale and realism tradeoffs for objectgoal navigation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 16384–16393, 2024. doi: 10.1109/CVPR52733.2024.01550.
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan P. Foster, Pannag R. Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, and Chelsea Finn. OpenVLA: An open-source vision-language-action model. In Proceedings of the 8th Conference on Robot Learning, volume 270 of Proceedings of Machine Learning Research, pages 2679–2713. PMLR, 2025. https://proceedings.mlr.press/v270/kim25c.html.
Jason Lee, Jiafei Duan, Haoquan Fang, Yuquan Deng, Shuo Liu, Boyang Han, Mohammadreza Salehi, Jae Sung Hwang, et al. MolmoAct: Action reasoning models that can reason in space. arXiv preprint arXiv:2508.07917, 2025.
Chengshu Li, Ruohan Zhang, Josiah Wong, Cem Gokmen, Sanjana Srivastava, Roberto Martín-Martín, Chen Wang, Gabrael Levine, Michael Lingelbach, Jiankai Sun, et al. BEHAVIOR-1K: A benchmark for embodied AI with 1,000 everyday activities and realistic simulation. In Proceedings of the 6th Conference on Robot Learning, volume 205 of Proceedings of Machine Learning Research, pages 80–93. PMLR, 2023. https://proceedings.mlr.press/v205/li23a.html.
Linjie Li, Mahtab Bigverdi, Jiawei Gu, Zixian Ma, Yinuo Yang, Ziang Li, Yejin Choi, and Ranjay Krishna. Unfolding spatial cognition: Evaluating multimodal models on visual simulations. arXiv preprint arXiv:2506.04633, 2025.
Manling Li, Shiyu Zhao, Qineng Wang, Kangrui Wang, Yu Zhou, Sanjana Srivastava, Cem Gokmen, Tony Lee, Li Erran Li, Ruohan Zhang, Weiyu Liu, Percy Liang, Li Fei-Fei, Jiayuan Mao, and Jiajun Wu. Embodied agent interface: Benchmarking LLMs for embodied decision making. In Advances in Neural Information Processing Systems, volume 37, 2024. doi: 10.52202/079017-3188. https://papers.nips.cc/paper_files/paper/2024/hash/b631da756d1573c24c9ba9c702fde5a9-Abstract-Datasets_and_Benchmarks_Track.html.
Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, and Abhay Mittal. Llamo: Scaling pretrained language models for unified motion understanding and generation with continuous autoregressive tokens. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2209–2220, June 2026a.
Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, and Srinath Sridhar. Genhsi: Controllable generation of human-scene interaction videos. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 138–149, 2026b.
21
第 22 页
Jacky Liang, Wenlong Huang, Fei Xia, Peng Xu, Karol Hausman, Brian Ichter, Pete Florence, and Andy Zeng. Code as policies: Language model programs for embodied control. In *IEEE International Conference on Robotics and Automation*, 2023.
Wenlong Liang, Rui Zhou, Yang Ma, Bing Zhang, Songlin Li, Yijia Liao, and Ping Kuang. Large model empowered embodied AI: A survey on decision-making and embodied learning, 2025. https://arxiv.org/abs/2508.10399.
Xiao Liu, Tianjie Zhang, Yu Gu, Iat Long Iong, Yifan Xu, Xixuan Song, Shudan Zhang, Hanyu Lai, Xinyi Liu, Hanlin Zhao, et al. VisualAgentBench: Towards large multimodal models as visual foundation agents. *arXiv preprint arXiv:2408.06327*, 2024.
Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, and Irwin King. A survey on vision-language-action models for embodied AI. *IEEE Transactions on Neural Networks and Learning Systems*, 2026. doi: 10.1109/TNNLS.2025.3650584.
NVIDIA, Johan Bjorck, Fernando Castañeda, Nikita Cherniadev, Xingye Da, Runyu Ding, Linxi Fan, Yu Fang, Dieter Fox, Fengyuan Hu, Spencer Huang, Joel Jang, Zhenyu Jiang, Jan Kautz, Kaushil Kundalia, Lawrence Lao, Zhiqi Li, Zongyu Lin, Kevin Lin, et al. GR00T N1: An open foundation model for generalist humanoid robots, 2025. https://arxiv.org/abs/2503.14734.
Xavier Puig, Kevin Ra, Marko Boben, Jiaman Li, Tingwu Wang, Sanja Fidler, and Antonio Torralba. VirtualHome: Simulating household activities via programs. In *Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition*, pages 8494–8502, 2018. https://openaccess.thecvf.com/content_cvpr_2018/html/Puig_VirtualHome_Simulating_Household_CVPR_2018_paper.html.
Xavier Puig, Eric Undersander, Andrew Szot, Mikael Dallaire Cote, Tsung-Yen Yang, Ruslan Partsey, Ruta Desai, Alexander Clegg, Michal Hlavac, So Yeon Min, Vladimir Vondrus, Theophile Gervet, Vincent-Pierre Berges, John M. Turner, Oleksandr Maksymets, Zsolt Kira, Mrinal Kalakrishnan, Jitendra Malik, Devendra Singh Chaplot, Unnat Jain, Dhruv Batra, Akshara Rai, and Roozbeh Mottaghi. Habitat 3.0: A co-habitat for humans, avatars, and robots. In *The Twelfth International Conference on Learning Representations*, 2024. https://openreview.net/forum?id=4znwzG92CE.
Manolis Savva, Abhishek Kadian, Oleksandr Maksymets, Yili Zhao, Erik Wijmans, Bhavana Jain, Julian Straub, Jia Liu, Vladlen Koltun, Jitendra Malik, Devi Parikh, and Dhruv Batra. Habitat: A platform for embodied AI research. In *Proceedings of the IEEE/CVF International Conference on Computer Vision*, pages 9339–9347, 2019. doi: 10.1109/ICCV.2019.00943.
Mohit Shridhar, Jesse Thomason, Daniel Gordon, Yonatan Bisk, Winson Han, Roozbeh Mottaghi, Luke Zettlemoyer, and Dieter Fox. ALFRED: A benchmark for interpreting grounded instructions for everyday tasks. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition*, pages 10740–10749, 2020. https://openaccess.thecvf.com/content_CVPR_2020/html/Shridhar_ALFRED_A_Benchmark_for_Interpreting_Grounded_Instructions_for_Everyday_Tasks_CVPR_2020_paper.html.
Li Siyao, Weijiang Yu, Tianpei Gu, Chunze Lin, Quan Wang, Chen Qian, Chen Change Loy, and Ziwei Liu. Bailando: 3D dance generation by actor-critic GPT with choreographic memory. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*, 2022.
Li Siyao, Weijiang Yu, Tianpei Gu, Chunze Lin, Quan Wang, Chen Qian, Chen Change Loy, and Ziwei Liu. Bailando++: 3D dance GPT with choreographic memory. *IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)*, 45(12):14192–14207, 2023.
Li Siyao, Tianpei Gu, Zhitao Yang, Zhengyu Lin, Ziwei Liu, Henghui Ding, Lei Yang, and Chen Change Loy. Duolando: Follower GPT with off-policy reinforcement learning for dance accompaniment. In *International Conference on Learning Representations (ICLR)*, 2024.
Li Siyao, Yao Feng, Omid Taheri, Chen Change Loy, and Michael J Black. Half-physics: Enabling kinematic 3d human model with physical interactions. *arXiv preprint arXiv:2507.23778*, 2025.
Chan Hee Song, Jiaman Wu, Clayton Washington, Brian M. Sadler, Wei-Lun Chao, and Yu Su. LLM-Planner: Few-shot grounded planning for embodied agents with large language models. In *Proceedings of the IEEE/CVF International Conference on Computer Vision*, pages 2998–3009, 2023. https://openaccess.thecvf.com/content/ICCV2023/html/Song_LLM-Planner_Few-Shot_Grounded_Planning_for_Embodied_Agents_with_Large_Language_ICCV_2023_paper.html.
Andrew Szot, Alexander Clegg, Eric Undersander, Erik Wijmans, Yili Zhao, John Turner, Noah Maestre, Mustafa Mukadam, Devendra Singh Chaplot, Oleksandr Maksymets, Aaron Gokaslan, Vladimir Vondrus, Sameer Dharur,
22
第 23 页
Franziska Meier, Wojciech Galuba, Angel X. Chang, Zsolt Kira, Vladlen Koltun, Jitendra Malik, Manolis Savva, and Dhruv Batra. Habitat 2.0: Training home assistants to rearrange their habitat. In Advances in Neural Information Processing Systems, volume 34, pages 251–266, 2021. https://proceedings.neurips.cc/paper/2021/hash/021bbc7ee20b71134d53e20206bd6feb-Abstract.html.
Weihao Tan, Wentao Zhang, Xinrun Xu, Haochong Xia, Ziluo Ding, Boyu Li, Bohan Zhou, Junpeng Yue, Jiechuan Jiang, Yewen Li, et al. Cradle: Empowering foundation agents towards general computer control. arXiv preprint arXiv:2403.03186, 2024.
Guy Tevet, Sigal Raab, Brian Gordon, Yonatan Shafir, Daniel Cohen-Or, and Amit H. Bermano. Human motion diffusion model. In The Eleventh International Conference on Learning Representations, 2023. https://openreview.net/forum?id=SJ1kSyO2jwu.
Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, and Anima Anandkumar. Voyager: An open-ended embodied agent with large language models. Transactions on Machine Learning Research, 2024. ISSN 2835-8856. https://openreview.net/forum?id=ehfRiF0R3a.
Zihao Wang, Shaofei Cai, Guanzhou Chen, Anji Liu, Xiaojian Ma, and Yitao Liang. Describe, explain, plan and select: Interactive planning with LLMs enables open-world multi-task agents. In Advances in Neural Information Processing Systems, volume 36, 2023. https://proceedings.neurips.cc/paper_files/paper/2023/hash/6b8dfb8c0c12e6fafc6c256cb08a5ca7-Abstract-Conference.html.
Qingxuan Wu, Zhiyang Dou, Chuan Guo, Yiming Huang, Qiao Feng, Bing Zhou, Jian Wang, and Lingjie Liu. Text2interact: High-fidelity and diverse text-to-two-person interaction generation. arXiv preprint arXiv:2510.06504, 2025.
Yiming Xie, Varun Jampani, Lei Zhong, Deqing Sun, and Huaizu Jiang. OmniControl: Control any joint at any time for human motion generation. In The Twelfth International Conference on Learning Representations, 2024. https://openreview.net/forum?id=gd0lAEtWso.
Jihan Yang, Shusheng Yang, Anjali W. Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie. Thinking in space: How multimodal large language models see, remember, and recall spaces. arXiv preprint arXiv:2412.14171, 2024.
Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella, Marziyeh Movahedi, Manling Li, Heng Ji, Huan Zhang, and Tong Zhang. EmbodiedBench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents. In Proceedings of the 42nd International Conference on Machine Learning, volume 267 of Proceedings of Machine Learning Research, pages 70576–70631. PMLR, 2025. https://proceedings.mlr.press/v267/yang25f.html.
Ye Yuan, Jiaming Song, Umar Iqbal, Arash Vahdat, and Jan Kautz. PhysDiff: Physics-guided human motion diffusion model. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 16010–16021, 2023. doi: 10.1109/ICCV51070.2023.01467.
Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, and Ofir Press. VideoGameBench: Can vision-language models complete popular video games? arXiv preprint arXiv:2505.18134, 2025a.
Libo Zhang, Zekun Li, Tianyu Li, Zeyu Cao, Rui Xu, Xiaoxiao Long, Wenjia Wang, Jingbo Wang, Yuan Liu, Wenping Wang, et al. Egoreact: Egocentric video-driven 3d human reaction generation. arXiv preprint arXiv:2512.22808, 2025b.
Yan Zhang and Siyu Tang. The wanderings of odysseus in 3d scenes. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 20481–20491, 2022. https://openaccess.thecvf.com/content/CVPR2022/html/Zhang_The_Wanderings_of_Odysseus_in_3D_Scenes_CVPR_2022_paper.html.
Yan Zhang, Yao Feng, Alpár Cseke, Nitin Saini, Nathan Bajandas, Nicolas Heron, and Michael J. Black. PRIMAL: Physically reactive and interactive motor model for avatar learning. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 12725–12736, 2025c. https://openaccess.thecvf.com/content/ICCV2025/html/Zhang_PRIMAL_Physically_Reactive_and_Interactive_Motor_Model_for_Avatar_Learning_ICCV_2025_paper.html.
Kaifeng Zhao, Yan Zhang, Shaofei Wang, Thabo Beeler, and Siyu Tang. Synthesizing diverse human motions in 3d indoor scenes. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 14738–14749, 2023. https://openaccess.thecvf.com/content/ICCV2023/html/Zhao_Synthesizing_Diverse_Human_Motions_in_3D_Indoor_Scenes_ICCV_2023_paper.html.
23
第 24 页
Brianna Zitkovich, Tianhe Yu, Sichun Xu, Peng Xu, Ted Xiao, Fei Xia, Jialin Wu, Paul Wohlhart, Stefan Welker, Ayzaan Wahid, 等. RT-2: 视觉-语言-动作模型将网络知识迁移至机器人控制. 收录于第7届机器人学习会议论文集, 《机器学习研究论文集》第229卷, 页码2165–2183. PMLR, 2023. https://proceedings.mlr.press/v229/zitkovich23a.html.
第 25 页
附录
A 技能专项验证器检查
验证器采用一套固定的、由技能触发的检查清单。其目的是应对长上下文退化问题:随着展开历史增长,规划器对空间距离和关系的估计变得不可靠,因此每项检查都仅通过一个紧凑的、技能专项的提示,从当前自我中心视角重新回答。验证器仅在表6中的某项技能被提议时运行;若某项检查失败,该提议将被替换为来自同一动作池的修正技能。对于无法从自我中心视角评估其前提条件的技能——例如后退,此时身体后方的区域不可见——则不进行检查。
触发技能 检查内容
向前走 前方路径是否畅通;移动是否会与墙壁或家具碰撞;向前移动是否推进当前目标。
停止 高层目标是否确实完成;身体是否已到达或接触到目标。
向上攀爬 脚下是否直接有楼梯台阶;身体是否面向楼梯。
向下攀爬 与向上攀爬相同的检查:脚下直接有台阶且身体面向楼梯。
转身(坐下前) 身体是否已紧贴座位(零距离);转身后,座位是否直接位于身体后方。
表6 技能专项验证器检查。每条规则仅在其对应技能被提议时触发;检查失败时,将提议替换为来自同一动作池的修正技能。
B 自动化根因归因
图8(b–d)中的所有根因标签均为自动分配——不涉及任何人工标注。一个确定性分类器会重放每个失败回合的日志,并在每个决策步骤评估以下内容:从骨盆到场景导航网格上最近目标实例的测地距离、骨盆与物体网格的接触情况、目标在自我中心视角中渲染的语义像素数量、动作流,以及模型自身声明的可见状态。在每个阶段内,表7中的规则按从上到下的顺序评估,首个匹配的规则即分配标签,因此每个失败回合恰好获得一种错误类型,且标签分配完全可从日志中复现。
25
第 26 页
表 7 图 8(b–d) 中各阶段分解背后的自动化根因规则。所有量均从记录的 rollout 中读取(导航网格测地距离、骨盆-物体网格接触、每步自我中心视角渲染、动作流以及模型声明的可见状态);接触为精确网格接触,而非包围盒重叠。
错误类型规则(自上而下评估;首次匹配即分配标签)
Find 失败 — 没有任何一步既在 512 × 512 的自我中心视角中以 ≥100 个语义像素渲染出目标,又让模型确认看到它
- 目标在视野内但未被看到:目标在某一步渲染出 ≥100 个像素,但模型在其可见状态输出中从未确认看到它。
- 靠近但不在视野内:骨盆进入目标实例 1.5 米范围内,但目标从未渲染出 ≥100 个像素:智能体到达了物体附近,却从未将其纳入视野。
- 距离过远:从起始位姿到最近目标实例的测地距离超过 20 米。
- 未察觉卡住:智能体连续 ≥8 步发出移动指令,但每步身体位移低于 0.1 米。
- 无效动作:存在一个 ≥25 步的连续窗口,在此期间智能体持续发出移动或转向指令,但身体始终被限制在一个 2 米的方框内。
- 中途放弃:智能体首先将其到目标的测地距离缩短至初始值的一半以下,但随后后退,直到回合结束时距离超过初始距离的 0.6 倍。
- 无效探索:所有智能体从未将目标纳入视野的其余情况。
Nav 失败 — 目标被主动找到,但智能体从未同时做到主动停止并将骨盆置于目标 0.2 米范围内
- 未察觉到达/触碰:骨盆在某一步进入目标 0.2 米范围内,但智能体从未主动停止:它在到达后仍继续发出导航动作。
- 远离时停止:智能体主动停止并声明到达,但骨盆从未进入目标 0.2 米范围内。
- 发现过晚:目标在 100 步预算的第 70 步之后才首次被渲染,导致剩余步数不足以到达。
- 未察觉卡住:目标在最后一帧仍在视野内(≥100 像素),且轨迹中包含 ≥8 步身体位移低于 0.1 米的连续移动步:智能体被几何体卡住,却仍持续发出移动指令。
- 无效动作:目标在最后一帧处于视野内且身体可自由移动(无卡住情况),但智能体的动作从未使其进入 0.2 米范围内。
- 目标幻觉:目标在最后一帧渲染出 <100 个像素,但模型的最终可见状态仍声称看到了它。
- 丢失目标:目标在最后一帧脱离视野,且模型不再声称看到它:智能体转向别处且未能重新捕获目标。
Interact 失败 — 导航成功(在 0.2 米内主动停止),但坐下失败
- 坐下后站起:某次坐下步骤实现了骨盆与目标座椅网格的接触,但智能体继续行动,且其骨盆在最后一帧离开了座椅。
- 悬空坐下:发出了坐下指令,但骨盆在整个回合中从未与任何表面发生网格接触。
- 坐错位置:发出了坐下指令,骨盆最终停留在不同的物体、地板或墙壁上,而非目标座椅。
- 停止但从未坐下:智能体到达座椅并停止,但从未发出坐下指令。