三分钟导读:本文提出REAL框架,通过去除Oracle感知API并集成模拟用户,实现无需特权信息的主动探索与交互式消歧,结合SFT与GSPO训练Qwen3-VL-8B智能体,在REAL-Bench基准及真实机器人部署中展现出卓越的零样本迁移能力。
英文题目:Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
论文出处:arXiv 每日论文精选 · arXiv:2607.13653
原始论文:PDF / 论文页面
对应视频标题:REAL框架:去Oracle化的开放世界移动操作具身智能体|推荐指数:★★★★★
这篇论文解决什么问题?
现有具身智能框架依赖特权模拟器状态(如全局物体列表、Oracle定位API)或假设指令完全明确,导致在真实世界部署时面临探索失败和意图消歧困难,且缺乏视觉与物理执行的紧密耦合。
核心创新
- 无Oracle感知环境:移除全局物体列表和3D姿态特权信息,仅保留物理可获取的场景先验(Receptacle List),强制智能体进行主动视觉探索。
- 模拟用户交互:集成由LLM驱动的模拟用户,支持动态、上下文感知的自然语言反馈,解决模糊指令的意图对齐问题。
- GSPO强化学习:采用序列级信用分配的策略优化算法,解决长轨迹训练中的方差爆炸问题,提升智能体在交互密集任务中的表现。
- Sim-to-Real零样本迁移:通过标准化的MCP工具接口,将仿真中训练的高层视觉交互策略直接迁移至物理机器人,无需重新训练高层策略。
方法概览
提出REAL框架,构建无Oracle感知的闭环视觉环境,提供基于RGB的主动探索工具链(nav_to, walk_around, show_object_by_category, gaze_at)和模拟用户交互接口。采用两阶段训练:首先通过SFT对齐Qwen3-VL-8B的工具调用接口,随后使用Group Sequence Policy Optimization (GSPO)进行在线强化学习,以优化自适应推理和错误恢复。
逐图理解论文
方法:REAL框架核心设计

本文提出REAL框架,构建无Oracle感知的闭环视觉环境。智能体仅接收基于RGB的主动探索工具链,包括nav_to、walk_around、show_object_by_category和gaze_at,以及模拟用户交互接口。通过移除全局物体列表和3D姿态特权信息,仅保留物理可获取的场景先验,强制智能体进行主动视觉探索,从而更贴近真实世界的感知约束。
训练:SFT与GSPO两阶段优化

采用两阶段训练策略。首先通过SFT对齐Qwen3-VL-8B的工具调用接口,使其适应无Oracle环境下的工具使用。随后使用Group Sequence Policy Optimization进行在线强化学习,以优化自适应推理和错误恢复。GSPO采用序列级信用分配,有效解决了长轨迹训练中的方差爆炸问题,显著提升了智能体在交互密集任务中的表现。
部署:Sim-to-Real零样本迁移

REAL通过标准化的MCP工具接口,将仿真中训练的高层视觉交互策略直接迁移至物理机器人,无需重新训练高层策略。在Ark LIFT2双臂移动机器人上进行端到端的真实世界部署评估,展示了因果规划、人机消歧和语言到物理接地能力。这种零样本迁移能力验证了框架在真实场景中的实用性和可扩展性。
结果:真实世界性能表现

在真实世界60个episode的端到端评估中,整体成功率为78.3%。其中,FDO任务成功率为80.0%,FODP任务达到100.0%。底层VLA原语执行成功率为85.3%。尽管高层策略零样本迁移,但整体成功率仍受到底层执行可靠性的制约。VLM推理延迟和Ask次数等指标也表明,框架在保持高效交互的同时,具备较好的实时性。
局限:任务空间与模型约束

任务空间主要集中于跨容器物体重排,未包含更复杂的组合约束,如时间顺序子任务或空间关系目标。容器被建模为单体实体,缺乏部分级区分,限制了空间精度。此外,冻结视觉编码器导致在铰链操作等动态视觉状态变化任务中,受限于基础模型的视觉接地能力,无法充分利用动态视觉信息。
实验与关键结果
- 在REAL-Bench基准上进行仿真评估,涵盖主动探索、视觉干扰、铰链操作和交互消歧四类任务。
- 在Ark LIFT2双臂移动机器人上进行端到端的真实世界部署评估。
- 对比开源及商业闭源VLMs(如GPT-4o, Gemini, Claude)的Zero-shot性能。
- 分析SFT与RL各阶段的性能变化及失败模式。
- REAL-Bench SUL任务成功率56.9%,超越所有Zero-shot VLM基线(第 10 页)
- 真实世界60个episode端到端成功率78.3%(第 13 页)
- FDO任务真实世界成功率80.0%,FODP任务100.0%(第 13 页)
- VLA底层原语执行成功率85.3%(第 12 页)
阅读时需要注意
- 任务空间主要集中于跨容器物体重排,未包含更复杂的组合约束(如时间顺序子任务或空间关系目标)。
- 模拟用户的行为受限于预设偏好和场景内物体,无法模拟真实用户中途改变目标或通过隐性线索表达意图。
- 容器被建模为单体实体,缺乏部分级区分(如独立架子),限制了空间精度。
- 冻结视觉编码器导致在铰链操作等动态视觉状态变化任务中,受限于基础模型的视觉接地能力。
- SFT第二阶段出现行为克隆过拟合,导致在视觉干扰丰富的FODP任务上性能下降,需依赖RL恢复泛化能力。
- 真实世界部署依赖底层VLA策略(pi0.5)的稳定执行,高层策略虽零样本迁移,但整体成功率受到底层执行可靠性的制约。
- 模拟用户虽能生成自然语言反馈,但其响应基于轨迹历史,可能与真实人类用户的非结构化交互存在差异。
关联工作
- VoTa-Bench:依赖不切实际的图元(如teleport工具),阻碍真实机器人部署(第 3 页)
- EMMOE:使用轻量级策略进行移动操作,但未解决Oracle-free主动探索问题(第 4 页)
- RoboOS:支持真实世界部署,但未显式训练智能体规划能力(第 4 页)
- GRUtopia:REAL构建的基础仿真平台,提供高保真渲染和刚体物理(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
探索性、可沟通且可部署:面向开放世界移动操作的视觉驱动具身智能体
米博宇*,1,2 马梦辰*,2,3 姚一飞*,1,2 高星2# 陈俊廷4 李杨子5 朱子豪2 李国浩6 尹振飞7 王泰2 穆瑶1,2 庞剑淼2 王汉青2#
1上海交通大学 2上海人工智能实验室 3东南大学 4新加坡国立大学 5浙江大学 6Camel AI 7牛津大学
# 通讯作者:高星 (gaoxing@pjlab.org.cn);王汉青 (hanqingwang.c@gmail.com)。
- 共同一作。
具身智能体在现实世界中的部署需要主动探索、视觉定位以及交互意图消歧。然而,现有框架往往依赖特权模拟器状态或假设指令完整,从而规避了现实部署中的挑战。为了弥补这一差距,我们提出了 REAL,一个面向开放世界移动操作的智能体框架。REAL 建立了无需 Oracle 感知(特权信息,如全局物体列表、3D姿态)且符合仿真到现实一致性(sim-to-real-consistent)的环境 API,并集成了模拟用户以支持人在回路(human-in-the-loop)交互。在此环境中,我们设计了多样化的任务组合以驱动数据收集、监督微调(SFT)和在线强化学习,系统地优化智能体性能。为了全面评估该方法,我们引入了 REAL-Bench,这是一个涵盖 241 个任务的基准测试,涉及主动探索、视觉干扰、关节操作和交互消歧。实验结果表明,我们训练的智能体在交互任务上的成功率达到 56.9%,优于领先的商业闭源视觉语言模型(VLM)。进一步的实证分析表明,我们的分层训练流程成功对齐了模型的工具使用能力,同时在扩展的探索视界下保持了强大的开放词汇推理能力。最后,我们在物理双臂移动机器人上部署并评估了我们的框架,在 60 个真实世界片段中实现了 78.3% 的端到端成功率。[cs.CV] 这些物理试验证明了我们框架对未见家庭场景具有鲁棒的零样本迁移能力,验证了我们的仿真到现实一致性设计成功弥合了长视界移动操作中的现实差距。代码可在 github.com/InternRobotics/REAL 获取。
关键词:具身智能体;移动操作
1. 引言
凭借其先进的推理和规划能力,大语言模型(LLMs)已成为具身智能体的主要驱动力 [1, 20, 21, 29, 30, 49]。早期框架主要利用这些模型在基于底层物理模拟器的文本环境中,通过文本感知和工具调用执行各种家庭任务 [25, 27, 39, 44, 45, 47]。然而,纯文本交互本质上缺乏复杂执行所必需的空间和物理定位。这一局限性推动了视觉语言模型(VLMs)的广泛采用,赋予智能体丰富的视觉感知能力 [5, 14, 48, 62]。通过利用高保真渲染图像,现代视觉驱动环境实现了精确的空间推理,并显著扩展了可执行任务的范围 [12, 53, 56]。然而,一个关键瓶颈依然存在:现有基准测试通常在两个基本维度上将仿真与现实世界的复杂性脱节——主动探索和交互沟通(见图 1,左侧)。规避这些现实约束必然导致仿真到现实迁移期间的部署失败。
© 2026 上海人工智能实验室。保留所有权利。
第 2 页
任务:从餐桌上给我拿些零食来。
先前的环境 我们的环境
通过特权信息进行探索 无特权信息的探索
特权物体列表 不切实际的工具 检测到 • bread_1 (在冰箱_1中) 面包,现在 • donut_1 (在桌子_1上) find(bread) (瞬移) 在桌子周围 • donut_2 (在桌子_1上) 移动。
实际部署失败 找到两个 原始视觉 • 信息无法检索 甜甜圈。 感知 • 工具无法实现 发起 用户查询。
执行歧义 视觉消歧 意图对齐
哪一个? 我找到了一个面包和两个 0 1 不同的甜甜圈,你 想要哪一个?
请给我白色的甜甜圈。
检测与视觉 现在我知道该选哪个了。 提示
图 1. 具身智能体框架的比较。左侧:依赖特权感知 API 和开环执行阻碍了歧义解决和现实世界部署。右侧:REAL 移除了特权感知 API,同时保留了物理上可获取的场景先验,支持基于 RGB 的探索和自然语言交互以处理模糊指令。
具体而言,第一个局限性在于物理探索过程中对模拟器特权感知信息的依赖。许多现有环境为智能体配备了理想化的工具,这些工具可以访问全局物体列表 [12, 29, 56] 或通过特权类别查找 API 定位目标 [53, 56]。由于这些特权接口在物理环境中难以获取,在此类设置下训练的策略在现实世界部署时可能会面临性能差异。为了解决这个问题,最近的一些工作 [6, 28, 41] 采用了非特权范式,将智能体限制在标准传感器输入(如 RGB 图像)范围内。然而,它们的探索和规划轨迹主要在文本层面运行,而非紧密地扎根于视觉观察。因此,当遇到视觉上相似的对象或干扰项时,这些方法仍然难以进行精确的视觉消歧。
第二个局限性源于对显式用户指令的假设,使得动态意图对齐的需求较少受到关注。当前的基准测试 [7, 28, 53] 通常将执行视为开环过程,假设用户对环境有充分的了解并发出明确的命令。然而,在实际部署中,人类用户往往在信息不完整的情况下操作,导致初始目标模糊,需要通过主动的、上下文感知的交互来澄清意图。虽然最近的研究 [36, 37, 54] 引入了模拟用户以促进交互,但其范围主要集中在基于文本的偏好提取或记忆上,使得通信与物理移动操作任务的联合优化研究较少。
为了解决这些问题,我们提出了 REAL(exploRatory, communicativE, And, deployLable,即探索性、可通信、且可部署),这是一个专为交互式且可部署的开放世界移动操作设计的智能体框架。如图 1(右侧)所示,REAL 建立了一个完全不含特权感知 API 的闭环视觉环境。智能体被限制无法访问全局物体列表、目标 3D 姿态、特权
第 3 页
模拟器状态或目标位置。相反,为了定位物体,智能体必须主动探索环境,并通过涵盖导航、物体检测和用于操作的视觉提示的可部署工具链,从原始 RGB 观测中发现物体 [32]。此外,我们集成了一个模拟用户,该用户发出初始模糊的指令,并提供动态的、上下文感知的自然语言反馈。这种反馈紧密地基于智能体持续的探索结果,有效地捕捉了真实人类交互中固有的信息盲区。
在此环境中,我们开发了一个自动化、可扩展的数据生成和过滤管道,以构建多样化的探索和交互任务。利用生成的轨迹数据,我们基于 Qwen3-VL-8B-Instruct [40],通过两阶段范式对齐并优化 REAL 智能体:首先进行监督微调(SFT)以对齐工具使用,随后进行在线强化学习以增强自适应推理和错误恢复能力。为了系统地评估我们的智能体,我们引入了 REAL-Bench,这是一个综合基准测试,包含 241 个任务实例,涵盖四个不同的类别:主动探索、视觉干扰、铰链式操作和交互式消歧。实验结果表明,我们训练的智能体成功超越了领先的商业闭源 VLM,在交互任务中取得了 56.9% 的成功率。最后,我们在物理 LIFT2 双臂移动机器人上部署并评估了我们的智能体。高层策略在 60 个真实世界片段中实现了 78.3% 的端到端成功率,展示了强大的零样本迁移能力,并验证了我们的仿真到现实一致(sim-to-real-consistent)框架设计有效地弥合了现实差距。
总之,我们的主要贡献有三方面:
1. REAL 框架。我们引入了 REAL,这是一个无需 Oracle 感知(特权信息,如全局物体列表、3D姿态)的仿真到现实一致(sim-to-real-consistent)智能体框架,并耦合了模拟用户以实现动态的人在人环(human-in-the-loop)意图对齐。 2. 训练管道。我们开发了一个自动化任务生成管道,并基于 Qwen3-VL-8B 训练智能体,采用双阶段 SFT 和在线强化学习,实现了稳健的工具使用对齐和自适应重规划。 3. 基准测试与部署。我们构建了包含 241 个任务的 REAL-Bench,并表明训练后的智能体在仿真中优于强大的商业基线,同时以 78.3% 的成功率零样本迁移到物理双臂移动机器人上。
2. 相关工作
2.1. 具身智能体环境与基准测试
大多数具身智能体环境建立在基础模拟器之上 [13, 25–27, 39, 45, 47, 57]。Embodied Agent Interface [29] 和 ManiTaskGen [12] 评估 LLM 或生成细粒度任务,但通过提供真实物体列表简化了探索过程。VisualAgentBench [31]、EmbodiedBench [56] 和 VoTa-Bench [53] 结合了视觉输入,但依赖于不切实际的基元(例如,可以瞬移物体的“find”工具),阻碍了真实机器人的部署。PARTNR [6] 通过概念图 [18] 探索房间,EMMOE [28] 使用无特权状态的低层策略,但两者都通过文本引用物体,导致与视觉干扰物产生歧义。相比之下,我们的环境消除了 Oracle 感知 API,并将发现的物体定位在视觉空间中,从而实现稳健的消歧和与现实兼容的探索。
2.2. 视觉驱动的具身智能体
最近的工作探索了视觉 grounding 的具身智能体,范围从基于 LLM 的探索智能体(如 Voyager [51])到直接以视觉观测为条件的 VLA 策略(如
3
第 4 页
OpenVLA [24] 和 𝜋0.5 [38]。在面向仿真的设置中,VoTa-Bench [53] 对状态预测和行动选择应用双重偏好优化;EMMOE [28] 使用轻量级策略 [10] 训练基于 DPO 的规划器以进行移动操作;ERA [7] 蒸馏具身先验并通过在线强化学习优化智能体;OWMM-Agent [8] 通过基于仿真的多模态智能体数据合成,将 VLM 适应于开放世界的移动操作。然而,这些方法并不以无 Oracle 的主动探索和动态用户交互为核心,以获取缺失的任务状态。RoboOS [50] 和 Being-0 [58] 均支持真实世界机器人的部署。然而,RoboOS 并未显式训练智能体规划能力,而 Being-0 将高层规划委托给闭源的基础模型 API。相比之下,REAL 在仿真中对高层 VLM 智能体进行端到端训练,其中程序化环境和数据生成管道大规模生成规划层面的训练数据。
经典的任务与运动规划(TAMP)将符号任务规划与连续运动可行性及状态跟踪相结合 [15, 23]。LLM 规划器如 SayCan [1] 将语言 grounding 到预定义技能和功能上,而像 KnowNo [42] 和 RePLan [46] 这样的不确定性感知或重规划框架则决定何时寻求帮助或从执行失败中恢复。REAL 与此类工作互补:它不解决 TAMP 问题,也不对底层运动执行中的所有不确定性进行建模。相反,REAL 研究如何训练一个可部署的视觉交互策略,该策略在分发物理技能之前,通过 RGB 探索和用户对话获取缺失的任务状态。
2.3. 面向具身智能体的模拟用户建模
多智能体系统已在具身任务中得到广泛研究,以促进灵活的合作。除了单智能体配置外,EMOS [9] 提出了一种由 LLM 智能体驱动的异构多机器人操作系统。同样,REMAC [59] 通过自我反思和自我进化实现多智能体长时程操作。聚焦于通信,CoELA [60] 研究了智能体之间的自然语言交互,尽管其假设共享的环境感知。这些工作强调了在复杂环境中开放式智能体合作的重要性。TEACh [35] 为家庭任务建立了多轮对话,VL-LN [22] 使用模拟用户通过主动通信解决歧义。对于用户意图理解,ADAPT [36] 通过提问引出偏好,而 FARMER [54] 运用心智理论推断未明确表达的目标。我们的框架超越了查询生成或习惯记忆,通过强制执行主动探索、多轮对话和操作的闭环过程,模拟需要真正的人机合作的现实场景。
3. 环境设计
为了促进视觉驱动的具身智能体从仿真到真实世界的部署,我们构建了一个闭环具身环境(图 2)。该环境基于 GRUtopia [52] 平台构建,具有高保真渲染和刚体物理特性。在宏观层面,其设计遵循两个核心原则,使其区别于以往简化探索和通信的环境:提供一套无 Oracle 感知 API 且能够真实世界实施的工具链,以及集成用于自然语言交互的模拟用户。在此架构中,场景实体被分类为固定的宏观容器(如桌子、柜子)和可操作物体(如杯子、书籍)。对于特定场景,容器在不同任务实例中保持静止,而可操作物体的数量、类别和空间放置位置则发生变化。
第 5 页
具身智能体 工具链 观测
容器列表 探索工具 发现的物体 导航 探索容器 0 🍰 1 🍞 水槽 2 🍞 3 🥧
床 我找到了一个面包和两个 桌子 水槽不同种类的多拿圈,你更 SoM 桌子 喜欢哪一个? 检测物体 聚焦于检测到的物体 执行 3 0 床 动作 1 2
0
VLMs
回答 🔥Qwen “我想要白色的 选择下一个动作 抓取/放置/打开/关闭 … 询问 面包。”
问题 历史 模拟 配置 ❄ Gemini 用户 action[t] obs[t]
图 2. 环境设计概览。具身智能体接收物理上可获得的容器先验信息和带有视觉 ID 的 RGB/SoM 观测数据,但没有全局物体列表、姿态、模拟器状态或目标位置。工具链提供了可部署的探索工具(nav_to, walk_around, show_object_by_category, gaze_at)、抓取/放置/打开/关闭控制以及询问功能。模拟用户基于智能体的动作/观测历史以及任务配置来回答问题;后端状态可能被处理器使用,但绝不会暴露给策略。
3.1. 无特权环境建模
初始观测。我们假设智能体配备了长期的 3D 占据地图和容器的语义分割,这使得通过路径规划导航至容器成为可能。这种先验信息可以从机器人的先前扫描或建图堆栈中物理获得。因此,在任务初始化时,智能体仅接收容器 ID 及其语义类别的先验列表(例如,table_2;见图 2 中的具身智能体模块)。尽管拥有这种结构先验,智能体无法访问全局物体列表、目标 3D 姿态、模拟器物体状态或目标位置。它也无法获得容器的细粒度外观以及其上或其中的物体分布。为了定位目标物体,智能体必须采用下面描述的主动探索工具链来获取观测数据。
多级主动探索。为了实现探索,我们引入了一个多级主动探索工具链(见图 2 中的探索工具模块)。这些工具避免了在策略接口处使用特权感知 API,并且可以迁移到现实世界(详细信息见附录)。整体过程被构建为四个顺序动作。容器间导航工具(nav_to)基于结构先验实现不同容器节点之间的移动。随后,容器内扫描工具(walk_around)作为由开放词汇 2D 感知模型驱动的广谱扫描仪。该工具引导智能体围绕特定容器移动,以绕过物理遮挡并从多个视角检测常见物体类别。此后,物体检测工具(show_object_by_category)主动隔离用户定义的
第 6 页
当前自我中心视角内的类别。最终,目标接近与对齐工具(gaze_at)将智能体引导至选定的目标,使其在相机视野中居中,同时考虑物理距离约束。
视觉接地交互。为了在不依赖特权3D坐标的情况下维持空间记忆,检测到的物体会从2D分割掩码动态反投影到3D空间中。这种几何投影构建了一个临时探索地图,记录了在最近一次调用探索工具期间发现的所有物体类别及其空间锚点。在此地图中记录的物体会在智能体的RGB/SoM观测中被高亮显示[55](见图2中的观测模块)。这一机制 bridging 了感知与物理交互,使智能体能够通过引用分配的视觉ID来区分同一类别的物体,并参数化下游操作技能(例如,抓取、打开;见图2中的ToolChain模块中的Pick/Place/Open/Close控制)。
用于协作任务的模拟用户。为了模拟协作任务,我们将由gemini-3-flash [16]驱动的模拟用户服务器直接集成到环境动力学中(见图2中的Simulated User模块)。在顶层,该模块作为一个交互式监督者,指导整体任务流程。它提供模糊的初始指令,远程监控智能体的任务进度,并根据实时探索结果回答问题,从而逐步澄清目标。
为了实现这一顶层设计,该模块依赖于特定的配置、同步和通信机制。为模拟用户初始化了一个特定于任务的配置文件,以建立偏好和选择的边界,例如将目标限制为场景中当前存在的物体。此配置确保了评估的稳定性,并防止生成涉及不存在或未探索项目的指令。此外,服务器与具身智能体的执行轨迹保持持续同步。通过访问智能体的交互历史和物理观测,系统为多轮对齐构建了一致的共享上下文,准确复制了具有有限初始场景布局感知能力的人类用户。最后,一个双向通信接口促进了交互。当仅靠物理探索无法解决歧义时,智能体可以发出ask动作来查询用户(见图2中的Ask控制和提问流程)。利用共享上下文和预定义配置文件,模拟用户随后生成自然语言指导以澄清意图并推动任务完成。
4. 智能体训练
为了最小化在线推理开销,并缓解在长周期部署期间上下文爆炸或时间幻觉的风险,我们将决策过程建模为部分可观察马尔可夫决策过程(POMDP)。我们的策略不依赖于连续拼接原始历史观测,而是结合紧凑的聚合状态与当前视觉输入来推导离散的工具动作,从而保持计算高效且局部的历史代理。
我们的训练流程包含三个步骤。首先,我们构建马尔可夫状态表示和转换管道,以支持高效的数据生成(第4.1节)。其次,我们使用专家演示来对齐模型与工具接口及结构化推理格式(第4.2节)。最后,我们使用组序列策略优化(GSPO)[61]优化策略,利用探索和环境影响来提高任务解决性能(第4.3节)。
第 7 页
4.1. 问题建模与上下文管理
闭环执行。我们将具身智能体的单步决策过程建模为 POMDP(完整元组定义见附录)。由于无法直接访问底层环境状态 $s_t \in S$,智能体通过观察函数 $\Omega(o_t| s_t)$ 从真实状态中提取可感知信息,从而接收部分观测 $o_t$。智能体在持续的感知-推理-行动循环中运行。给定任务指令 $T$,VLM 策略将当前观测 $o_t$ 映射为格式化的工具调用 $a_t \in A$,并使用不含 Oracle 感知 API 的环境工具。工具执行器验证格式并分发调用,立即将无效动作作为环境反馈返回。这种架构将高层决策与底层安全验证及环境动力学解耦。
观测与状态聚合。为了解决长视域任务中固有的上下文爆炸和时间幻觉问题,我们将智能体的观测划分为环境组件和历史组件: $o_t = \langle o^{env}_t, o^{hist}_t \rangle$ (1) 环境观测 $o^{env}_t$ 封装了即时感知结果(例如,自-centric 视觉特征、结构化世界图的变化)以及与 $a_{t-1}$ 对应的执行反馈 $e_t$。为了避免通过拼接完整交互历史导致线性增长的上下文,我们通过自摘要来管理 $o^{hist}_t$。我们将此压缩观测定义为:
$o^{hist}_t = \langle o^{env}_{t-1}, a_{t-1}, h_{t-1} \rangle$ (2)
其中 $h_t$ 表示由 VLM 维护的结构化历史状态。由 $T$ 初始化,VLM 将全局任务分解为子目标。在每一步,除了思维链(CoT)推理和工具调用外,VLM 还会生成已完成工作的摘要 $\sigma_t$ 以及对当前阶段 $task_t$ 的分析。
历史聚合为 $h_t = (\Sigma_t, task_t)$,其中 $\Sigma_t = [\sigma_0, \sigma_1, . . . , \sigma_t]$,并通过以下方式在线更新:
$h_t \leftarrow \text{VLM}(o^{env}_t, a_t, h_{t-1})$ (3)
注意,$o^{hist}_t$ 的所有组件(即 $o^{env}_{t-1}$、$a_{t-1}$ 和 $h_{t-1}$)完全由步骤 $t-1$ 之前可用的信息决定,即相对于自然滤过群 $\{F_t\}_{t \ge 0}$,$o^{hist}_t$ 是 $F_{t-1}$-可测的。这确保了策略 $\pi_\theta(a_t| o_t)$ 仅基于合法可用的信息进行条件判断,保留了 POMDP 建模所需的因果结构。
这将每步的提示词限制为固定结构(当前观测、前一个动作和压缩历史),而不是重放交互轨迹。关键在于,$\Sigma_t$ 仅记录由工具返回 $e_t$ 确认为成功的动作。仅在 $o^{env}_t$ 中跟踪执行失败而非持久化历史,为后续推理提供了确定性基础,并有效缓解了时间幻觉。
可扩展资产库与任务实例化。我们的数据引擎利用了 GRScenes [52] 中的 7 个高保真场景(11 种房间类型,100 个可交互容器)以及 MesaTask [19] 中跨越 639 个类别的超过 2,500 个物体实例。我们将每个场景状态表示为世界图(WG),形式化地表示为 $WG = \{(r_j, E_j)\}$,将每个容器 $r_j$ 映射到其包含的物体实例 $E_j$。WG 作为整个框架中的规范状态表示:它使任务定义落地,支持状态差分奖励计算(第 4.3 节),并提供评估的成功标准。
7
第 8 页
任务围绕跨容器物体重排展开:我们提示大语言模型(LLM)根据场景布局生成语义合理的(源容器、目标容器、物体)三元组,这些三元组通过在模拟器中指定初始 WG(World Goal,世界目标)和目标 WG 实例化为任务配置。
为了系统地挑战智能体,我们在物体和容器两个层级引入干扰项。物体级干扰项注入同一类别中视觉上不同的实例,以要求细粒度的判别能力。在容器级,每个容器都标注了涵盖功能用途和视觉外观的唯一标识描述。LLM 随后根据这些标注生成无歧义的自然语言指令。更多细节和数据集统计信息见附录。
SFT 数据合成。对于每个任务,基于规则的规划器将目标分解为涵盖导航、探索和操作的动作序列 $\{a_t\}_{t=1}^L \subset \mathcal{A}$,并在模拟器中执行。在每一步,观测提取器 $\Omega$ 产生 $o_{env}^t$,包括带有视觉 ID 的自中心 RGB 图像和执行反馈 $e_t$;所有操作仅针对来自 2D 感知的视觉 ID 进行。在用于协作轨迹的自动化社会标注阶段,LLM 重写指令使其故意模糊,并在轨迹中注入带有模拟用户响应的通信动作(ask),以训练智能体在不确定性下主动沟通。生成的 SFT 数据集为 $\mathcal{D} = \{(T^{(i)}, \tau^{(i)})\}_{i=1}^N$,其中每条长度为 $L$ 的轨迹 $\tau = \{(o_t, a_t, h_t)\}_{t=1}^L$ 记录了每一步的观测、动作和历史状态。动作和观测来自执行过的轨迹,而历史状态由 gemini-3-pro [16] 进行标注。标注细节见附录。
4.2. 通过 SFT 进行范式对齐
统一输入-输出范式。我们选择 Qwen3-VL-8B 作为骨干 VLM,以支持在计算资源受限的机器人系统上部署,并为训练和推理实现统一的输入-输出结构。
在每个时间步 $t$,VLM 接收包含可用工具 API $\mathcal{A}$、任务指令 $T$ 和观测 $o_t = \langle o_{env}^t, o_{hist}^t \rangle$ 的提示。模型生成内部推理(例如,〈think〉…〈/think〉)以分析视觉状态并进行规划,然后输出一个 JSON,指定更新后的历史状态 $h_t$ 和下一个工具调用 $a_t \in \mathcal{A}$。
通过行为克隆进行工具调用对齐。在第一阶段,我们通过基于 $\mathcal{D}$ 的行为克隆将预训练 VLM 适配到工具接口。令 $\pi_\theta$ 表示 VLM 策略。我们最小化专家轨迹的负对数似然:
$$ L_{SFT} = – \sum_{(T, \tau) \in \mathcal{D}} \sum_{t=1}^L \log \pi_\theta(a_t, h_t | T, o_t), \quad (4) $$
其中 $o_t$ 是智能体在步骤 $t$ 的观测。我们冻结视觉编码器以保留预训练的视觉表示。
4.3. 用于技能优化的强化学习
在闭环推理中部署经过 SFT 对齐的初始策略 $\pi_{init}$(第 4.2 节)暴露了两个局限性:(1) 分布偏移,即在专家演示上进行的行为克隆并未使模型具备重新规划或从执行失败中恢复的能力(例如,目标被遮挡、无效的 API 调用);以及
8
第 9 页
(2) 稀缺的交互数据,静态数据集无法覆盖主动人机交互的多样性,导致策略过拟合于模板,而非在存在歧义时向用户查询。强化学习通过使智能体能够探索动态环境并主动向用户获取信息,解决了这两个问题。
算法选择。我们的目标是在部分可观察马尔可夫决策过程(POMDP)框架下(第4.1节),最大化变长轨迹上的期望折扣回报。为基于视觉语言模型(VLM)的强化学习准确建模评论家(critic)在计算上是不可行的,因此无评论家方法如组相对策略优化(GRPO)成为自然选择。然而,GRPO通过逐步重要性比率分配序列级信用,其累积对数比率随轨迹长度增长而方差增大,经常触发裁剪并导致训练不稳定。因此,我们采用组序列策略优化(GSPO),它用长度归一化的序列比率替换逐步比率,将方差压缩为原来的 $1/L_i^2$,并在长 rollout 期间保持近端更新的有效性。这驱动模型走向自适应重规划和主动交互,而非静态模板匹配。详细公式见附录。
环境接地奖励塑造。我们设计了一个基于 WG(第4.1节)的逐步奖励 $r_t$,而非稀疏的任务完成信号。我们计算 $\Delta_{task}$,即初始 WG 和目标 WG 之间所需的状态变化集合(例如,拾取和放置 $n$ 个物体产生 $2n$ 个条目)。在每一步,瞬时差异 $\delta_t = WG_t – WG_{t-1}$ 与 $\Delta_{task}$ 进行匹配;匹配成功给予正奖励,并移除该项以防止奖励黑客行为。物理引擎内在强制执行时间因果关系(例如,先拾取后放置),无需手动建模时间依赖关系。关节和导航子目标被附加到 $\Delta_{task}$ 中并在线评估。
除了任务进度外,智能体还因效率受到每步时间惩罚 $-\lambda_{time}$,并根据 $e_t$ 回溯日志对失败动作施加基于严重程度的惩罚。对于涉及干扰物的任务,我们奖励使用沟通工具 ask 来解决歧义,但受限于难度条件查询预算 $B_{ask}$,以防止过度依赖用户。通过将奖励公式化为 $r_t = R(o^{env}_{t-1}, a_t, o^{env}_t)$,保持了马尔可夫性质,且密集信号与 GSPO 优化目标一致(详细数值配置见附录)。
5. 实验
5.1. 基准构建
为了从两个关键维度评估具身智能体:主动探索和交互沟通,我们引入了 REAL-Bench。该基准建立在环境及工具接口(第3节)和数据生成流水线(第4.1节)之上,涵盖了 REAL 房间中的新颖场景。REAL-Bench 包含四个类别的 241 个任务实例:家具-干扰物拾取与放置(FDP,72个)、家具与物体-干扰物拾取与放置(FODP,56个)、家具-干扰物开/关(FDO,48个)以及模拟器-用户循环(SUL,65个)。
FDP 和 FODP 是杂乱的移动操作任务,要求将目标物体从源位置移动到目标容器。FODP 进一步在家具和物体层面采用开放词汇、全类别的干扰物设置,对主动探索和细粒度视觉消歧提出了更高要求。FDO 评估以关节操作为中心的操作,涉及可打开和关闭的家具。这些任务涉及高度动态的状态转换,挑战时间一致性和精确的顺序工具使用(例如,将开/关操作与感知及拾取放置动作交错进行)。最后,SUL 通过设计引入指令歧义,以测试
第 10 页
智能体可以在执行前通过“ask”主动查询模拟用户。
5.2. SFT 和 RL 训练的结果与分析
我们评估了 (i) 在零样本提示下的强大开源和商业 VLM,以及 (ii) 经过 SFT 进行工具接口对齐并通过 GSPO 进行闭环改进的 Qwen3-VL-8B 智能体。表 1 报告了 REAL-Bench 四个任务族的成功率(越高越好)。
表 1. REAL-Bench 上的主要结果。成功率(成功/总回合数)在四个任务族中报告。粗体标记每组内每列的最佳结果,高亮行表示用于 SFT 标注的教师模型。SFT 使 Qwen3-VL-8B 对齐到无需 Oracle 感知 API 的工具接口,而 GSPO 进一步改善了交互密集的 SUL 分割,并超越了所有零样本 VLM 基线,包括教师模型。
模型名称 FDP FODP FDO SUL
零样本提示 gemini-3-pro-preview [17] 81.9 39.3 50.0 53.8 gemini-2.5-pro [11] 66.7 41.1 43.8 49.2 gpt-5 [34] 68.1 30.4 47.9 52.3 gpt-4o [33] 30.6 28.6 27.1 40.0 claude-haiku-4-5 [3] 45.8 16.1 52.1 47.7 Qwen3-VL-235B-A22B-Instruct [4] 22.2 14.3 14.6 18.5 Qwen3-VL-8B-Instruct [4] 0.0 0.0 0.0 1.5
本文方法 Ours-8B-SFT-only (1 epoch) 45.8 30.4 35.4 36.9 Ours-8B-SFT-only (2 epoch) 65.3 28.6 43.8 50.8 Ours-8B-SFT+RL 58.3 33.9 41.7 56.9
工具对齐与行为克隆过拟合。零样本 Qwen3-VL-8B 在操作任务上失败,在交互场景上仅达到 1.5%。一个轮次的监督微调使模型与工具接口对齐,在 FDP 上达到 45.8%。然而,第二个轮次暴露了行为克隆的局限性:虽然标准操作上的执行稳定性提高(FDP 上升至 65.3%),但在富含干扰项的 FODP 分割上的性能从 30.4% 下降到 28.6%。这表明严格的模仿会过拟合专家轨迹,并在开放词汇杂乱和视觉模糊下削弱鲁棒性。
强化学习恢复泛化能力。将闭环组序列策略优化应用于单轮次检查点可避免这种过拟合。RL 恢复了在扩展监督训练期间丢失的探索能力,将 FODP 成功率提高至 33.9%,同时保持了与在标准任务上更紧密微调的模型相当的工具调用性能。这表明环境反馈促进了适应性问题解决,而非死记硬背轨迹,帮助智能体处理边缘情况。
社会奖励改善主动意图对齐。闭环优化的影响在交互密集的 SUL 分割中最为显著,智能体在此达到 56.9% 的成功率,并优于最强的专有零样本基线。通过整合难度条件查询预算和解决歧义的显式奖励,训练流程将智能体从
第 11 页
1. 打开微波炉门 2. 导航至橱柜并拿起面包
3. 将面包放入微波炉
3 4
2 4. 关闭微波炉门
1
图 4. 在 Ark LIFT2 移动机械臂上的真实世界部署。REAL 将高层视觉交互策略零样本迁移至具有相同 MCP 工具接口的物理后端。执行轨迹展示了因果规划(例如,在取食物前准备微波炉)、多候选物体下的人机消歧,以及用于闭环任务完成的语言到物理 grounding。定量可靠性报告见表 2。
从被动指令遵循到主动意图对齐。策略学会了何时暂停并查询模拟器用户,表明社交互动是从端到端的环境反馈中涌现出来的,而非来自静态的提示工程。
动态操作揭示了视觉瓶颈。尽管策略优化带来了收益,但在关节结构复杂的 FDO 子集中,成功率持续下降。操作门和抽屉引入了高度动态的视觉状态变化。由于我们冻结了视觉编码器以保留预训练表示,智能体仍受限于基础模型的视觉 grounding 能力瓶颈。这表明,虽然闭环 RL 改进了动作和沟通能力,但要掌握关节结构的操作,可能需要在多模态能力方面进一步扩展。
失败模式分类。我们从最佳的 SFT+RL 检查点手动标注了 100 个片段以诊断剩余错误(图 3)。在 53 个失败案例中,大多数属于物体混淆(25),其次是关键动作缺失(17)、记忆丢失(9)和其他错误(2)。这些结果确定了杂乱的视觉 grounding、程序完整性和长程记忆是主要的剩余瓶颈。
11
第 12 页
5.3. 通过仿真到现实迁移实现现实世界部署
为了验证我们训练流程的有效性和鲁棒性,我们使用 Ark LIFT2 移动操作臂在真实的家庭场景中部署了仿真智能体。这种直接的仿真到现实(sim-to-real)迁移测试了在仿真中学习到的能力如何映射到不同环境复杂度下的物理执行。
通过标准化接口实现无缝迁移。该系统使用模型上下文协议(MCP)服务器进行工具调用,保持仿真与物理机器人之间高层认知框架的一致性。在每一步中,智能体接收实时自中心观测,将其与结构化历史和最近的动作相结合,并输出下一个离散的工具调用。这种标准化接口将推理算法与环境解耦,允许物理世界作为仿真的替代后端,而无需重新训练高层策略。
具有专用物理策略的分层执行。虽然高层规划是从仿真中零样本迁移的,但连续的物理动力学仍然需要稳健的运动控制。因此,我们将仿真中使用的抽象工具映射到专用的现实世界实现中。具体而言,原子操作命令由微调后的 $\pi_{0.5}$ [38] 基础模型执行。这种分层结构使视觉语言模型(VLM)专注于视觉定位、状态跟踪和任务规划,而 $\pi_{0.5}$ 策略则提供打开、关闭、抓取和放置的稳定执行。
物理环境中的长视域因果推理。如图 4 所示,该系统成功执行了一个多阶段的食物准备任务,要求机器人取面包并将其放入微波炉。推理引擎并没有立即导航到橱柜,而是先接近桌子并打开微波炉门。只有在准备好容器后,机器人才导航到次要位置,选择目标物体,并返回完成放置和关闭。这一序列表明,结构化记忆机制有助于防止时间幻觉,保持准确的内部状态,并在长物理执行过程中尊重因果约束。
物理评估与流程分析。我们进一步在不同的空间布局下在物理环境中评估了该流程。在 60 个真实世界片段中,REAL 实现了 78.3% 的端到端成功率,且没有发生任何不可恢复的系统崩溃(表 2)。底层原语层在 600 次 VLA 原语执行中的 85.3% 情况下可执行,这表明高层策略在无需特权仿真状态的情况下进行了迁移,但仍依赖于稳健的物理技能。这些现实世界试验的更详细分解,以及原语级评估和失败分析,见附录。
6. 结论与局限性
我们提出了 REAL,这是一个用于训练探索性和交流型具身智能体的闭环框架,这些智能体可以直接迁移到物理机器人上。通过用物理上可实现的探索工具链替换特权感知 API,并集成由大语言模型驱动的仿真用户以实现动态意图对齐,REAL 解决了先前工作中的两个关键过度简化问题。通过在 REAL-Bench(241 个任务,四个家庭)上对 Qwen3-VL-8B 智能体进行监督微调(SFT),随后进行闭环组序列策略优化(GSPO),结果表明,工具接口对齐是闭合感知-动作循环的前提条件,而强化学习(RL)独特地
12
第 13 页
表 2. 端到端真实世界评估。SR 表示任务成功率,SPL 衡量路径效率,Ask 为用户查询的平均次数,VLM Lat. 报告每集 VLM 推理的总延迟。
| | 任务 | SR | 步数 | SPL | Ask | VLM Lat. | | :— | :— | :— | :— | :— | :— | :— | | | FDO | 80.0% | 12.2 | 67.0% | 0.90 | 71.1s | | | FODP | 100.0% | 9.6 | 86.9% | 0.70 | 53.5s | | | SUL | 55.0% | 13.0 | 35.4% | 0.55 | 80.5s | | | 总体 | 78.3% | 11.6 | 63.1% | 0.72 | 68.4s |
提升了交互式消歧能力。在 Ark LIFT2 双臂移动机器人上的部署进一步验证了长视域家庭任务的仿真到现实(sim-to-real)迁移能力。
尽管取得了这些结果,但仍存在若干局限性。首先,任务空间主要围绕跨容器重排展开,尚未编码更丰富的组合约束,如时间有序的子任务 [6] 或空间关系目标 [12](例如,“将杯子放在盘子的左侧”)。其次,模拟用户的行为受限于有界的行为包络——其偏好局限于场景内的物体,且其响应锚定于智能体的轨迹——而真实用户可能会在任务中途引入新目标,或通过隐含线索传达意图。第三,容器被建模为单体实体(例如,cabinet_1),缺乏部件级区分(例如,单独的架子),这限制了探索和操作的空间精度。引入部件级分割和分层容器建模可以弥补这一差距。
7. 致谢
本研究部分得到了上海人工智能实验室、国家自然科学基金(批准号:62401367)以及上海市浦江人才计划(批准号:25PJA076)的支持。
13
第 14 页
附录
A. 场景设置与任务合成
A.1. 训练场景
训练和评估数据集使用源自 GRScene [52] 的高保真 3D 场景构建。图 A.1 展示了两个训练环境的俯视平面图,说明了空间布局和物体排列情况。训练集包含 6 个住宅室内环境,共有 82 件家具和 157 条自然语言描述。场景的复杂度从 5 到 7 种房间类型,每个场景包含 10 到 17 件家具不等。每个场景包含多个房间和多种家具,提供了多样化的空间配置,有助于移动操作和空间推理的学习。表 A.1 详细列出了每个场景的房间、家具和描述的细分情况。
表 A.1. 6 个训练环境的逐场景统计信息。#Furniture 表示可交互容器类家具的数量;#Captions 表示标注的自然语言描述的总数。
| 场景 | 房间类型 | 家具类型 | #Furn. | #Cap. | | :— | :— | :— | :— | :— | | S1 | 阳台、卧室、餐厅、厨房、客厅、书房、卫生间 | 床、柜子、抽屉柜、书桌、微波炉、床头柜、冰箱、鞋柜、桌子、茶几 | 17 | 32 | | S2 | 阳台、卧室、餐厅、入口、厨房、客厅 | 床、柜子、沙发、书桌、冰箱、微波炉、桌子 | 17 | 29 | | S3 | 阳台、卧室、餐厅、厨房、客厅 | 床、沙发、书桌、微波炉、冰箱、桌子、电视柜 | 12 | 21 | | S4 | 浴室、卧室、走廊、餐厅、厨房、客厅 | 床、柜子、沙发、书桌、微波炉、冰箱、桌子 | 12 | 24 | | S5 | 卧室、餐厅、厨房、客厅、卫生间 | 床、柜子、沙发、柜台、书桌、微波炉、冰箱、桌子 | 14 | 32 | | S6 | 卧室、餐厅、厨房、客厅、卫生间 | 床、柜子、冰箱、水槽、桌子、电视柜 | 10 | 19 | | 总计 | | | 82 | 157 |
A.2. 评估场景
测试集由一个保留的场景(S7)组成,用于评估模型对先前未见过的空间配置的泛化能力。该场景经过专门选择,以建立有意义的评估基准,同时引入与训练场景的分布偏移。S7 包含 6 种房间类型(卧室、餐厅、厨房、客厅、书房和洗手间)以及 18 件家具。此外,它还包含铰接式电器(如洗衣机和电…
14
第 15 页
图 A.1. 训练场景:两个训练环境的俯视平面图。这些场景展示了空间布局以及家具和物体的排列方式。它们在复杂性、房间配置和物体密度方面各不相同,提供了多样化的训练样本,以学习空间推理、主动感知和操纵能力。
炊具)在训练期间并未显著展示。
A.3. 3D 资产库
为了支持生成多样且逼真的布局,我们整理了一个大规模的资产库,其中包含来自 MesaTask [19] 的可操纵物体。
物体资产。物体资产库包含 3,204 个独特的 3D 资产,涵盖 810 个细粒度语义类别。如表 A.2 所示,这些资产被组织为四个一般类别:家居用品(1,865 个资产)、容器(1,185 个资产)、食物(127 个资产)和家具(27 个资产)。实验主要使用家居用品和容器类别中的资产。每个资产都标注了物理尺寸信息、语义类别标签和详细描述。这种广泛的覆盖范围确保了生成的任务反映了日常家庭操纵场景的多样性,从将食物放入容器到在不同房间类型中重新排列家居物品。
表 A.2. 物体资产在各一般类别中的分布。
一般类别 资产数量 比例
家居用品 1,865 58.2%
容器 1,185 37.0%
食物 127 4.0%
家具 27 0.8%
总计 3,204 100%
15
第 16 页
图 A.2. 评估场景:评估环境的俯视平面图。该场景在训练中被保留(即未参与训练),用于评估模型在未见过的空间布局上的性能。与训练集相比,该场景的构成和物体布置呈现出不同的空间挑战,从而能够公平地评估模型的泛化能力。
A.4. 语义感知任务生成
如第 4.1 节所述,任务由大语言模型(LLM)生成的(源位置,目标位置,物体)三元组定义。这些三元组指定了用于拾取的源容器、用于放置的目标容器,以及一组语义上合理的用于转移的物体。三元组的生成以场景布局和房间间的语义兼容性为条件,从而产生了 291 个独特的容器对组,涵盖了房间间重新布置的多样化场景。表 A.3 展示了一些示例,说明了生成任务在空间和语义上的多样性。
A.5. 任务指令示例
任务分为两类。静态任务不需要人类交互,旨在测试智能体的核心操作能力,包括空间推理、物体识别和目标导向导航。动态任务要求智能体与人类用户交互,以消除任务真实目标的歧义,从而测试智能体的沟通和澄清能力。表 A.4 提供了说明性示例。蓝色高亮显示源或目标家具,红色高亮显示目标物体。
16
第 17 页
表 A.3. 用于实例化任务的(源,目标,物体)三元组示例。每一行对应一个单一的容器对;“物体”列列出了指定转移任务中语义兼容的物品样本。源和目标表示为 房间/家具。
源 目标 物体(样本)
厨房 / 餐厅 / 桌子 饮料、苹果、蛋糕、果汁 冰箱
餐厅 / 桌子 厨房 / 苹果、黄油、水果、甜点 冰箱
卧室 / 床 卧室 / 闹钟、书、笔记本、 床头柜 遥控器
书房 / 书桌 卧室 / 柜子 笔记本、笔筒、 相框、书
客厅 / 桌子 客厅 / 电视支架 音箱、书、篮子、 电视支架 遥控器
浴室 / 水槽 浴室 / 柜子 毛巾、餐巾、托盘、洗手 液
阳台 / 桌子 客厅 / 柜子 篮子、花、书、 柜子 装饰品
表 A.4. 按交互类型分组的任务示例。精确指令使用视觉属性引用物体,而模糊指令仅使用类别标签。动态任务采用故意模糊的语言以引发澄清对话。蓝色:源和目标家具。红色:目标物体。
划分 任务指令
“去带有细把手的床头柜那里,取回那个设计简洁、 表面光洁的长方形木质相框,并将其带回展示柜 静态任务 进行展示。” 装饰。”
“从金色腿的咖啡桌上拿起那个带有圆形导航按钮 和多色按钮的流线型黑色遥控器,并将其放在 带有白色大理石台面的书桌上。”
“去双抽屉柜那里,取一个牛油果, 并将其带回场景中唯一的冰箱。”
“去场景中唯一的冰箱那里,取一个 花生,并将其带回房间里唯一的茶几。”
“从带有肋纹抽屉正面的书桌取一本笔记本, 动态任务 放到内部背板为深色的柜子里。”
“你能找到我的笔筒吗?它在卧室里。”
“你能帮我搬一本书吗?”
17
第 18 页
B. 训练数据生成流程
本节描述了将原始任务规范转换为最终 SFT 训练语料的三阶段数据生成流程:(1) 两阶段基于几何和物理的任务过滤,(2) 仿真驱动的 Oracle 轨迹生成,以及 (3) 基于大语言模型的社会交互标注。
B.1. 无碰撞物体放置
在过滤之前,每个任务规范必须被实例化为具体的 3D 物体位置。给定一个具有边界框 $B$ 的容器表面以及场景的预计算占用图 $M$(一个编码了约 5 cm 分辨率下空闲与占用单元格的 2D 网格),放置算法为每个物体分配一个无碰撞的 2D 位置,同时满足除简单不重叠之外的两个约束:(i) 空闲空间可行性——以选定位置为中心、半径为 $r_i = \frac{1}{2} \sqrt{w_i^2 + d_i^2}$ 的圆形足迹必须完全位于 $M$ 的空闲单元格内,确保没有静态障碍物遮挡该物体;(ii) 边缘邻近性以实现可达性——每个物体被限制在距离最近容器边缘宽度为 $d_{max} = 0.5$ m 的周长带内,且距离物体最近的边缘点也必须在一个小的机器人站立半径(5 cm)内未被占用,从而保证移动机械臂可以无障碍地接近并抓取该物体。候选位置通过对平铺周长带的轴对齐边缘条进行均匀网格采样生成;在每次迭代的所有有效候选者中,算法选择使到已放置物体的最小欧几里得距离最大化的那个,以促进空间分布。图 B.1 展示了由该过程生成的代表性布局。
图 B.1. 放置算法在厨房桌面上生成的示例物体布局。五个食物项分布在表面上,每个都在周长可达带内,且远离静态障碍物。
B.2. 两阶段任务过滤
原始任务规范包含的物体放置可能在目标 3D 场景中几何上不可行或物理上不稳定。我们应用两阶段过滤流程,以确保每个训练回合在物理上可实现且可复现。
阶段 1:静态几何过滤。静态过滤器检查任务初始世界图中的所有物体是否可以放置在指定的容器表面上,而无需启动物理仿真器。对于每个容器,我们从场景家具库中检索其表面边界框 $B = [p_{min}, p_{max}]$,并从资产尺寸库中获取每个物体 $i$ 的物理足迹 $(w_i, d_i, h_i)$。一个
第 19 页
随机无碰撞放置算法(算法 B.1)随后尝试为 B 中的每个对象分配一个 2D 位置,对象间最小间距为 𝛿= 0.05 m。
算法 B.1 静态放置可行性检查 要求:对象列表 O,容器边界框 B,间距 𝛿,最大尝试次数 𝐾 确保:放置字典 P 或 Fail 1: P ←{}; placed ←[] 2: for each object 𝑜𝑖∈O with footprint (𝑤𝑖, 𝑑𝑖) do 3: 𝑥lo ←𝑝𝑥min + 𝑤𝑖/2 + 𝛿; 𝑥hi ←𝑝𝑥max −𝑤𝑖/2 −𝛿 4: 𝑦lo ←𝑝𝑦min + 𝑑𝑖/2 + 𝛿; 𝑦hi ←𝑝𝑦max −𝑑𝑖/2 −𝛿 5: if 𝑥lo ≥𝑥hi or 𝑦lo ≥𝑦hi then return Fail ⊲对象太大,无法放置于表面 6: end if 7: found ←False 8: for 𝑘= 1 to 𝐾do 9: Sample (𝑥, 𝑦) ∼U([𝑥lo, 𝑥hi] × [𝑦lo, 𝑦hi]) 10: if no collision with any (𝑥𝑗, 𝑦𝑗, 𝑤𝑗, 𝑑𝑗) ∈placed then ⊲AABB 检查 11: P[𝑜𝑖] ←(𝑥, 𝑦, 𝑝𝑧max + ℎ𝑖/2) 12: Append (𝑥, 𝑦, 𝑤𝑖/2, 𝑑𝑖/2) to placed; found ←True; break 13: end if 14: end for 15: if ¬ found then return Fail ⊲超过 𝐾=2000 次尝试 16: end if 17: end forreturn P
通过静态过滤的任务,其计算出的放置位置 P 将被缓存,以供后续物理阶段使用。
阶段 2:物理验证。通过静态过滤的任务被加载到 GRUTopia [52] 物理模拟器(Isaac Sim 后端)中,以验证对象在生成后是否保持稳定。每个对象以其缓存位置 P[𝑜𝑖] 放置,并带有 +0.1 m 的微小向上偏移,仿真运行 𝑇settle = 500 个物理步(Δ𝑡= 1/240 s),以使对象静止。如果每个对象均满足以下条件,则任务被视为有效:
𝑧final ≥𝑧init −𝜏fall, ∥pfinal∥∞≤50 m, (5)
其中 𝜏fall = 0.3 m 为坠落阈值。通过两个阶段的任务将与其最终静止位置 {(𝑥∗𝑖, 𝑦∗𝑖, 𝑧∗𝑖)} 一起保存,从而保证轨迹生成过程中的完全可复现性。
B.3. Oracle 轨迹生成
给定一个经过验证的任务片段,我们在物理模拟器中执行其 oracle execution_plan,以记录适合 SFT 的演示轨迹。Oracle 计划是一个由任务生成阶段预计算的高级动作确定性序列;轨迹生成器执行每个动作,并记录由此产生的视觉观察结果,以形成动作-观察对。
环境设置。在每个片段开始时,所有目标和干扰对象均使用世界图在其验证位置上生成,仿真经历短暂的物理预热以使对象稳定,并初始化安装在机器人头部上方的 RGB 相机(分辨率 640 × 480),以提供策略所消耗的视觉观察结果。
19
第 20 页
动作执行。算法 B.2 详细说明了 oracle 规划器,该规划器根据任务配置和当前模拟器状态生成成功轨迹。抓取动作值得特别关注:oracle 总是先执行物体类别检测步骤,以探测机器人头戴摄像头当前可见的内容。如果目标物体出现在生成的标记地图中,机器人会直接注视该物体(可见分支)。
否则,它会回退到 walk_around 搜索:它以文本形式枚举当前地标处所有同类别的物体,然后以随机顺序遍历这些物体——通过打乱探索序列来注入轨迹多样性,而不是始终按照固定的空间顺序访问物体。
B.4. 社交交互标注
原始 oracle 轨迹不包含任何交际交互。我们通过基于 LLM 的标注器注入 ask 步骤,为每条轨迹增强逼真的“人-机”对话。
标注策略。LLM 标注器针对每个任务应用最多两种交互策略,这些策略基于场景上下文进行选择。策略 A(主动澄清,ask)在任务描述模糊或不充分时触发:在执行前注入多轮对话,其中机器人请求澄清,用户回应以提供额外细节。策略 B(物体消歧,ask)在场景中同一家具类别出现多个实例时触发(例如,两个柜子):机器人在继续之前询问用户具体指的是哪个实例。
标注提示词。标注器接收 (i) 场景上下文(房间布局、家具说明、物体描述,以及可选的俯视图场景图像)和 (ii) 带有步骤索引标注的任务摘要。提示 LLM 标注器推理哪些策略适用,然后输出结构化的 JSON 标注动作列表。关键提示词模板如下所示:
标注提示词
## 角色 你是创建家庭环境中具身操作任务逼真的人机交互 场景的专家。
## 场景上下文 __SCENE_CONTEXT__
## 待标注任务 __TASK_SUMMARY__
## 标注策略
策略 A – 主动澄清 (ask) 当任务指令模糊或用户遗漏重要细节时应用。在机器人开始 执行之前插入一个 ‘ask’ 步骤,其中机器人请求澄清,用户 提供更具体的指令。
策略 B – 物体消歧 (ask) 当存在同一家具类型的多个实例时应用(例如,两个柜子)。插入一个 ‘ask’ 步骤,其中机器人
20
第 21 页
询问用户指的是哪个具体实例。
输出格式
响应单个 JSON 对象: { "reasoning": "<思维链:适用哪些策略及其原因>", "actions": [ { "strategy": "A" | "B", "insertion_point": <int, execution_plan 中的步骤索引>, "content": { "turns": [ {"role": "robot", "content": "<机器人话语>"}, {"role": "user", "content": "<用户回复>"} ] }, "modifications": {"task_annotation": "<如需更新的任务注释>"} } ] }
后处理。注释操作按插入点倒序应用,以保持索引有效性。处理以异步批处理方式进行(批大小为 10),并支持检查点恢复以从中断处继续运行。
示例注释轨迹。图 B.2 展示了社会注释对代表性任务的影响。原始 oracle 计划(左侧)在步骤 0 增加了策略 B 的消歧对话,从而生成社会增强轨迹(右侧)。
注释前: 注释后(策略 B):
0: nav_to(cabinet_1) 0: ask [B] 1: show_object_by_category(book) 具身智能体: 2: gaze_at(book) “哪个柜子——橡木的那个 3: pick(book) 还是玻璃门的那个?” 4: nav_to(desk_1) 用户:“请选橡木的那个。” 5: place(desk_1) 1: nav_to(cabinet_1) 2: show_object_by_category(book) 3: gaze_at(book) 4: pick(book) 5: nav_to(desk_1) 6: place(desk_1)
图 B.2. 社会注释示例。策略 B(消歧)插入在导航之前,提示机器人澄清用户意图的具体家具实例。
B.5. 专家轨迹注释
如第 4.1 节所述,我们的 SFT 数据集不仅需要物理执行轨迹,还需要内部推理轨迹以及结构化的历史状态 $h_t = (\Sigma_t, task_t)$。我们使用
21
第 22 页
gemini-3-pro 对从模拟器收集的原始专家轨迹中的这些认知变量进行回溯标注。
状态对齐与 Oracle 注入。原始轨迹由成对的动作 $a_t$ 和环境观测 $o^{env}_t$(第一人称 RGB 图像和文本反馈)组成。为了使 gemini-3-pro 能够在标注期间产生准确的视觉推理,我们将任务特定的 Oracle 元数据注入其提示中,明确指定目标源物体、目标容器及其各自的视觉干扰项。关键在于,这种 Oracle 信息仅限于离线标注阶段;最终的 SFT 数据集仅保留面向策略的观测 $o_t$,不包含 Oracle 感知 API,以用于训练在线策略。
逐步推理标注。标注过程分为两个阶段以构建完整的历史上下文。在初始规划阶段(Step 0),模型接收自然语言指令 $T$ 和 Oracle 元数据,以生成初始任务分析 ($task_0$) 和第一个真实动作的推理轨迹。对于后续的闭环步骤 ($t \ge 1$),标注器接收当前视觉观测 $o^{env}_t$、先前执行的动作 $a_{t-1}$ 以及累积的历史记录 $\Sigma_{t-1}$。基于此状态,gemini-3-pro 输出一个包含以下内容的结构化 JSON:(1) 解释下一个最优真实动作 $a_t$ 的推理过程,(2) 对上一个执行动作结果的简明摘要 $\sigma_t$,以及 (3) 更新后的任务阶段分析 $task_t$,共同构成历史状态 $h_t = (\Sigma_t, task_t)$。
确定性历史构建。我们不依赖 LLM 自由回忆过去的上下文,而是强制执行确定性脚本来维护 $\Sigma_t$。在每一步 $t$,脚本从模型的结构化输出中提取 $\sigma_t$ 并将其附加到单调增长的历史字符串中。生成的 $\Sigma_t$ 随后被输入到步骤 $t+1$ 的提示中,确保历史上下文与实际物理执行严格对齐,并直接实例化第 4.1 节中描述的 $O(1)$ 持久上下文。
用于监督微调的格式化。最终 SFT 数据集使用与推理时相同的单轮每步格式(附录 E.2)。在每一步中,提示包括一个定义工具 API $A$ 的系统消息,以及一个包含完整观测 $o_t = \langle o^{env}_t, o^{hist}_t \rangle$ 的用户消息。目标响应将内部推理(〈think〉…〈/think〉)与指定 $h_t$ 和 $a_t$ 的 JSON 配对,确保训练和推理范式完全对齐。
22
第 23 页
算法 B.2 单集(Episode)的 Oracle 轨迹生成 输入:集 𝑒,包含执行计划(execution_plan)、初始世界图(initial_world_graph) 输出:轨迹 𝜏(动作-观测对列表) 1: 根据 initial_world_graph 生成物体;运行物理预热 2: 𝜏←[{task: 𝑒.task_description}]; inv ←∅ 3: 对执行计划中的每个步骤 𝑠 执行: 4: if 𝑠.action = ask then 5: 将对话轮次追加到 𝜏 ⊲社会标注(见附录 B.4) 6: else if 𝑠.action = nav_to then 7: 通过 NavManager 查找无遮挡的相机位置 8: 移动相机;步进 20 次;将 nav_to + obs(RGB) 追加到 𝜏 9: else if 𝑠.action = pick then 10: img, 𝑀←ShowObjectByCategory(𝑠.target_cat.) ⊲始终先探测可见性 11: 将 show_object_by_category + obs(img) 追加到 𝜏 12: if target ∈values(𝑀) then ⊲目标在头部相机视图中可见 13: 𝑚∗←𝑀 中目标对应的标记键(marker key) 14: GazeAt(𝑚∗);步进 10 次;将 gaze_at + obs(RGB) 追加到 𝜏 15: 追加 pick(𝑚∗);将物体传送走;更新 W;inv ←target 16: else ⊲目标被遮挡:回退到随机绕行 17: 𝐶←地标处同类物体(来自 W) 18: 将 walk_around + obs(𝐶 的文本枚举) 追加到 𝜏 19: RandomShuffle(𝐶) ⊲随机化顺序以增加轨迹多样性 20: 对每个候选 𝑐∈𝐶 执行: 21: GazeAt(𝑐);步进 10 次;将 gaze_at + obs(RGB) 追加到 𝜏 22: if 𝑐= target then 23: 追加 pick(𝑐);更新 W;inv ←𝑐;break 24: end if 25: end for 26: end if 27: else if 𝑠.action = place then 28: ShowReceptacles;叠加容器标记;查找目标标记 29: 通过 ClampAlgorithm(Bsurf, robot pos) 计算放置位置 30: 将 inv 传送到放置位置;步进 1000 次;inv ←∅ 31: 将 show_receptacles + obs(RGB) + place 追加到 𝜏 32: else if 𝑠.action ∈{open, close} then 33: 将门驱动至 90◦/ 0◦;步进 100 次 34: 将 open/close + obs(RGB) 追加到 𝜏 35: end if 36: end for 37: 将 𝜏 保存至 .pkl;将任务元数据保存至 .json
23
第 24 页
🤖 具身智能体
🔧 工具调用
MCP 服务器
路由器
需要仿真
Isaac Sim 后端
仿真相关工具
无需仿真
修改仿真器状态
逐步执行直至稳定
工具处理器
渲染相机观测
模拟用户 …
📦 MCP 响应
📝 文本响应 🖼️ 图像响应
图 C.1. MCP 工具分发流水线。具身智能体始终通过相同的 MCP 模式发出相同的工具调用。在仿真环境中,确定性处理器会更新 Isaac Sim 并高效返回 RGB/文本观测结果。在实体机器人上,后端被替换为机载导航、开放词汇感知、VLA 操作和人机交互(HRI)模块。仅后端实现发生变化;面向策略的工具名称、输入签名和响应类型保持不变。
C. 环境实现
C.1. 概述
我们的系统围绕模型上下文协议(MCP)[2] 构建,这是一个标准化接口,具身智能体通过该接口发出所有工具调用并接收所有响应。如图 C.1 所示,每个工具调用首先到达路由器,由路由器对其进行分类并沿两条路径之一进行分发。与仿真相关的工具——那些需要物理接地(physical grounding)的工具,如导航、抓取放置和关节控制——被转发到 Isaac Sim 后端,该后端修改仿真器状态,逐步执行物理引擎直至场景稳定,并将生成的相机观测结果渲染为图像响应。
24
第 25 页
不需要物理交互的工具——例如查询用户——完全绕过仿真后端,由模拟用户模块处理,并返回纯文本响应。在这两种情况下,代理都通过相同的 MCP 接口接收其结果,形成一个封闭的感知-行动循环,且代理对响应由哪个后端产生毫无察觉。
当代理在实体机器人上运行时,使用相同的 MCP 接口。路由器和工具协议保持不变;仅后端发生变化——Isaac Sim 引擎被机器人的机载导航栈和操纵系统所取代,而 MCP 服务器继续提供相同的工具名称集、输入签名和响应类型。因此,代理以完全相同的方式与仿真环境和真实机器人进行交互,无需修改其工具调用或规划逻辑。
C.2. 工具实现细节
我们描述了策略端工具链中的每个工具,该工具链不包含任何 Oracle 感知 API(见第 3 节),以及其具体的仿真实现。
Sim-to-Real 原理:仿真效率与物理保真度。我们系统的核心设计通过将策略端接口与后端实现分离,解决了仿真效率与物理保真度之间的张力。在仿真期间,确定性的服务器端处理器高效地执行导航、感知和操纵效果,从而减少轨迹噪声并降低大规模数据收集的单步墙钟时间。关键在于,这些处理器不向策略暴露 Oracle 感知 API:代理仅接收 RGB/SoM 图像、文本响应、执行回溯以及部署时使用的相同工具返回格式。这保留了零样本迁移所需的不变性。在现实世界中,仅后端发生变化:确定性仿真处理器被机器人的导航栈、开放词汇感知、VLA 操纵模型和人机交互(HRI)接口所取代,而代理权重、工具名称、输入签名和响应类型保持不变。
物理基础设施。为了在 Ark LIFT2 平台上实现此部署并弥合 Sim-to-Real 差距,我们将 ConceptGraph [18] 与 Intel RealSense D455 相机集成,用于构建语义 3D 场景图。此外,为了克服 RealSense 相机重定位误差超过 5 厘米的问题,我们引入了一种双跟踪架构。该设置配备了一个具有专有 SLAM 的 Odin1 深度相机,有效地将重定位误差降低到 1 厘米以下。它与一个健壮的导航栈耦合,该导航栈使用 A* 搜索进行全局规划,使用动态窗口法(DWA)进行局部避障,并使用 PID 控制器以确保可靠、细粒度的移动性。
nav_to(容器间导航)。仿真。给定目标容器的名称,处理器识别出一个无碰撞的相机位置,该位置保持对容器主要交互表面(例如,顶层架子或门)的无障碍视线。为此,它确定可导航部分的轴对齐包围盒,推导适当的 standoff 半径,并查询基于占用图的导航模块,以在二维平面图中找到最近的非遮挡视点。观测值从新的相机姿态渲染,工具返回 resulting viewpoint 的 RGB 渲染图。真实世界。MCP 服务器从 ConceptGraph 查询目标节点,A* 规划器生成从机器人当前姿态到有效交互点的轨迹。目标姿态保持与目标至少 0.6 米的 standoff 距离,以确保足够的操纵工作空间。如果不存在有效轨迹,则
25
第 26 页
工具返回失败日志。机器人使用 DWA 和 PID 控制跟踪该路径,并在到达时返回最终的 RGB 帧。
walk_around(容器内广泛扫描)。仿真。仿真环境维护一个每容器对象注册表,并在每个 episode 期间保持同步:每次抓取操作会从源容器中移除一个对象条目,每次放置操作会在目标容器插入一个条目,确保注册表始终反映当前场景状态。当调用 walk_around 时,处理器读取智能体当前容器的实时注册表,并将每个条目解析为相应的语义类别,返回自然语言库存字符串(例如,“我发现了以下对象:0: 一个苹果。”)以及用于下游引用的整数到类别索引。真实世界。该实现为每个家具节点生成覆盖占用地图整个视场的预定义导航航点。机器人遍历这些航点并捕获图像,Grounded-SAM-2 [43] 处理这些图像以提取对象掩码。这些掩码通过视觉特征匹配在不同视角间去重,随后合并为带注释的图像。此后,机器人导航至目标对象聚类中心最近的航点,以进行后续交互。
show_object_by_category。仿真。该工具通过四阶段感知流水线实现开放词汇对象检测。首先,仿真器的照片级渲染器与逐实例分割标注器耦合,为当前视图中可见的所有实体生成像素级精确的对象掩码。其次,使用嵌入服务为智能体的开放词汇查询以及场景中存在的每个资产类别计算文本嵌入;选择与查询余弦相似度最高的类别作为匹配结果。第三,从分割输出中提取匹配实例的像素级掩码。第四,将带编号的 Set-of-Mark [55] 叠加层——带有整数标识符的彩色区域掩码——合成到 RGB 图像上。生成的带注释图像返回给智能体,id-对象映射存储在环境中,以便在引用整数标识符的工具调用后进行解析。真实世界。感知接口在物理部署中使用 Grounded-SAM-2 [43] 进行复制。该模型接收查询的类别名称,执行开放词汇分割,并为每个生成的掩码分配一个整数 ID。这些特定的 ID 和掩码随后作为视觉提示输入到下游 VLA 模型中。
show_receptacles(容器标注)。仿真。处理器检索当前相机视锥内所有容器的 3D 边界框,将每个框投影到图像平面以计算 2D 区域掩码,并将带编号的 Set-of-Mark [55] 叠加层合成到 RGB 帧上。带注释的图像以及整数到容器名称的映射返回给智能体,使后续的 nav_to 或 place 调用能够通过相应的视觉标识符引用容器。真实世界。在物理部署中,标注信息针对头戴式 RGB-D 点云和 ConceptGraph 进行注册,以将 3D 边界框与 2D 掩码对齐。与对象检测流水线类似,特定的 ID 和掩码作为下游 VLA 模型的视觉提示。
gaze_at(目标接近与对齐)。仿真。该工具将机器人移动到指定对象附近,以便进行详细观察和后续抓取。目标对象可能来自两个上游工具,其输出模态不同:walk_around 为每个发现的对象返回 3D 边界框,而 show_object_by_category 产生 2D 分割掩码,通过深度相机反投影从中恢复 3D 质心。给定 3D 位置后,
第 27 页
物体,处理器查询占用地图以在机械臂可达范围内寻找无碰撞的接近位姿,命令移动底盘导航至该位姿,并将相机重新朝向物体。在仿真中,3D 位置直接从场景图中读取。当请求标记持久性时,Set-of-Mark 叠加层会在新的特写视图中重新渲染,确保视觉标识在视角变化之间保持一致,以便智能体后续进行抓取调用。真实世界。如果关联 ID 识别的目标掩码在当前视场中不清晰可见,系统会从最初捕获该掩码的 walk_around 历史记录中检索导航航点。机器人自主导航回此最佳视点,以将目标居中以便进行操控。
pick / place / open / close(操控基元)。仿真。所有四种操控工具遵循相同的模式:处理器将智能体提供的整数标记解析为场景图中对应的物体或容器,随后执行确定性状态变更。具体而言,pick 从场景中移除目标物体并将物品转移到虚拟库存;place 将持有的物体恢复到由容器边界框计算的无碰撞位置上的指定表面;open 和 close 分别将门或抽屉的关节驱动至完全打开或静止角度。每个操作都会相应地更新每个容器的物体注册表和世界图的状态,同时仿真器从结果场景中重新渲染 RGB 观测值。真实世界。经过微调的 Vision-Language-Action (VLA) 模型执行所有操控基元。由于 Grounded-SAM-2 [43] 在 VLA 的视觉指令微调阶段作为数据集预处理方案,部署的 VLA 模型直接摄取由感知工具生成的掩码和 ID 作为初始视觉提示。这种架构有效地将 RGB-D 观测映射到 6-DoF 末端执行器轨迹。
ask(向用户发起自然语言查询)。仿真。此工具绕过物理分发管道,直接路由到 Simulated User 模块。Simulated User 是一个有状态的语言模型包装器,它维护着编码用户目标状态和偏好配置文件的任务特定系统提示、交错的对话历史,以及与智能体最新动作和观测同步的视图。当智能体调用 ask 时,该模块将机器人的当前状态注入系统提示,将问题追加到对话历史中,并查询语言模型后端以生成回复。响应从结构化输出格式中提取,并以纯文本工具结果的形式返回给智能体,使其在形式上与任何其他工具的输出无法区分。真实世界。对于物理部署,我们开发了一个 Human-Robot Interaction GUI。为了确保人类用户能够充当 Oracle 替代者,GUI 显示智能体的决策历史、推理过程以及实时的第一人称观测。人类用户基于此上下文输入回复,从而有效地闭合物理执行的循环。
C.3. Simulated User 模块
Simulated User 由 gemini-3-flash 驱动,作为交互式协作者回答具身智能体的问题。为了复制逼真的人类行为,Simulated User 受两个互补机制的支配:一个定义其人格和行为约束的配置文件,以及一个使其与机器人不断变化的状态保持同步的观测接口。
Profile 模板。每个任务实例使用包含三个元素的结构化配置文件初始化 Simulated User:初始物体布局 $S_{init}$、目标布局 $S_{goal}$ 以及模糊的自然语言
第 28 页
该指令故意省略了确切的目标身份。为了确保模拟用户的行为像真实的人类协作者——即目标导向但信息受限——行为规则被嵌入到用户画像中:
1. 目标驱动。每次回复都必须引导机器人从初始状态 $S_{init}$ 走向目标状态 $S_{goal}$。 2. 信息屏障。用户不得透露目标物体的确切位置;只允许使用模糊的指代,例如“看看里面有什么”。 3. 动态澄清。只有在机器人明确报告在其当前观测中看到了特定目标物体后,用户才能命名该目标物体,忠实地模拟真实人员随着情境展开而逐步披露信息的过程。 4. 禁止使用原始 ID。$S_{init}$ 和 $S_{goal}$ 中存在的内部字母数字对象标识符绝不会被逐字说出;用户会将它们映射为源自模糊指令或视觉描述的自然语言描述。
规则 2 和 3 共同创造了一个渐进式披露循环:用户最初隐瞒具体细节,机器人进行探索并报告其感知到的内容,随后用户基于这些具体的观测结果来提供后续指导。以下是“移动餐具”任务的示例用户画像:
示例用户画像
[系统指令] 你是一位与家庭服务机器人互动的“人类用户”。 你心中有一个最终的 [目标状态],但你的行为必须像一个真实、随意的人类,具有自然的信息盲区。
[你的核心规则]: 1. 目标驱动:每次回复都必须引导机器人朝向 [目标状态]。 2. 信息屏障:假装你不知道物体的确切位置, 先让机器人“寻找某物”或“检查里面有什么”。 3. 动态澄清:只有在机器人报告在 [当前观测] 中看到它之后, 才命名确切的目标物体。 4. 禁止使用原始 ID:永远不要说出状态中的字母数字 ID; 将它们转换为自然语言。
[初始状态] { 在‘不锈钢双水槽’上有: _4004e25c…, _267d51ba…, _091bbc88… }
[目标状态 / 真实意图] { _4004e25c… 位于‘带黑色把手的桌子’上。 }
[模糊初始指令] { 从不锈钢双水槽中取一件餐具, 并将其移动到带黑色把手的桌子上。 }
[交互上下文] 机器人当前动作:{Current_Action} 机器人当前观测:{Current_Obs}
[输出格式] <Thought> 推理目标与当前观测的差异;将 ID 映射为词汇 </Thought> <Speech> 给机器人的自然语言回复 </Speech>
28
第 29 页
辅助观测。仿真用户与具身智能体之间存在根本性的表征差距:用户配置文件使用内部字母数字 ID(例如 _4004e25c...)对物体布局进行编码,而智能体仅通过自中心 RGB 图像感知世界。这两种模态是不可通约的——仿真用户无法直接“看到”机器人摄像头捕捉到的内容,也无法仅从原始 ID 推断出哪些物体进入了智能体的视野。为了弥合这一差距并使仿真用户能够准确跟踪智能体的探索进度,我们引入了辅助文本观测。
每次工具调用后,环境会对当前渲染结果进行可见性检查,并生成一个结构化摘要,记录 (i) 机器人刚刚执行的动作,以及 (ii) 当前在其自中心视图中可见的物体列表,每个物体均以其语义类别和自然语言描述进行说明。此摘要在每一步中替换仿真用户上下文中的前一个摘要,确保其始终基于最新的机器人状态进行推理,而无需积累不断增长的对话历史。示例如下:
辅助观测
“在执行 nav_to({"receptacle_name": "sink_0"}) 后, 机器人的视图中包含以下物体: {ID: …; 类别: chopstick(筷子); 描述: 一对红尖木筷。 ID: …; 类别: fork(叉子); 描述: 一把四齿银色金属叉。}。”
通过语义描述(例如,“一对红尖木筷”)而非原始资产标识符来表达可见物体,辅助观测具有两个目的。首先,它使仿真用户能够自然地应用“无原始 ID”规则,因为这些描述提供了真实人类日常使用的语言类型。其次,它闭合了由规则 2 和 3 定义的渐进式披露循环:当识别出具有语义描述的物体符合模糊指令(例如,“木筷”符合所请求的“餐具”)时,仿真用户便可以在其下一次回复中明确无误地命名目标物体。
D. 强化学习设置
D.1. 完整 POMDP 定义
我们提供了单步决策过程的完整形式化定义。具身智能体在部分可观察马尔可夫决策过程(POMDP)中运行,该过程由元组 $M = \langle S, A, O, P, R, \Omega, \gamma \rangle$ 定义。
不可观测的真实状态空间 $S$ 包含精确的 3D 物体位姿、底层物理世界图以及仿真器的内部动力学。动作空间 $A$ 包含通过环境提供的 11 种非特权工具,涵盖导航、感知、操作和通信。受观测函数 $\Omega(o_t | s_t)$ 支配,智能体接收解耦的观测 $o_t = \langle o^{env}_t, o^{hist}_t \rangle$。环境组件 $o^{env}_t$ 包括自中心 RGB 视图、执行回溯和动态工具模式。为了在保持单轮提示长度恒定的同时维持马尔可夫性质,历史组件 $o^{hist}_t$ 将交互历史压缩为 VLM 生成的摘要 $h_{t-1} = (\Sigma_{t-1}, task_{t-1})$ 以及最近 $K=3$ 轮文本对话的滑动窗口。较早的对话轮次被截断至最多 1,200 个字符。转移动力学 $P(s_t | s_{t-1}, a_t)$ 代表由 Isaac Sim 引擎执行的物理状态变化以及仿真用户的对话响应。奖励函数 $R$ 提供密集的、逐步的
29
第 30 页
基于世界图(World Graph)和执行安全性(第 D.3 节)的差异,计算信号 $r_t = R(oenv_{t-1}, a_t, oenv_t)$。
折扣因子 $\gamma$ 设置为 0.99,以优化长视界交互中的预期回报。
D.2. 动作空间与工具配置
策略模型输出一个推理块,后跟一个 JSON 对象,该对象指定更新后的历史 $h_t$ 和所选的工具调用 $a_t \in A$。环境在执行过程中强制执行物理约束。如果智能体输出结束动作(finish action)、达到最大视界 $T_{max} = 30$ 步,或遇到不可恢复的错误,则回合终止。
D.3. 详细的奖励配置
基于第 4.3 节确立的环境接地奖励塑造原则,步骤奖励 $r_t$ 聚合了世界图(WG)结构变化、中间物理进展和安全惩罚的信号。
我们将全局任务目标 $\Delta_{task}$ 定义为 WG 初始状态与目标状态之间的差异。在每一步 $t$,计算 WG 的瞬时差异 $\delta_t = WG_t – WG_{t-1}$。如果 $\delta_t$ 与剩余目标列表 $\Delta_{rem}$ 中的某项匹配,智能体将获得 +1.5 的匹配奖励。为了严格防止奖励黑客行为(reward hacking),匹配的项会立即从列表中移除。我们还应用基于势的进展塑造奖励 $+2.0 \times (\rho_t – \rho_{t-1})$,其中 $\rho_t = 1 – |\Delta_{rem}| / |\Delta_{task}|$。完全完成($|\Delta_{rem}| = 0$)提供一次性奖励 +2.0。相反,逆转进展的动作会受到 -0.5 的惩罚,将物体放置在错误的容器上会导致 -2.0 的惩罚。
虽然开合容器等关节动作(articulation actions)和导航原语不会直接在对象和家具的核心 WG 中表现为结构变化,但它们对于物理执行至关重要。我们通过将相应的关节和导航目标(例如,nav_to(src) 的首次访问奖励或 (receptacle, open) 的状态变化)直接附加到初始 $\Delta_{task}$ 中来解决这些隐式依赖关系。这些附加的目标与标准对象操作项共享相同的匹配逻辑和 +1.5 的奖励权重。由于物理引擎内在强制执行时间因果关系——必须先打开容器才能将物体放入其中——这种统一的队列设计有效地引导了策略,而无需手动构建复杂的逻辑图。
为了缓解长视界任务中的稀疏奖励,我们分配了中间物理信用。拾取有效的目标对象可获得 +0.3 的奖励,在传输过程中持有对象可获得 +0.5 的奖励。在错误拾取后成功重新规划可获得 +1.0 的恢复奖励。此外,通过 ask 工具与模拟用户进行显式交互,对于有效的消歧查询可获得 +1.0 的奖励,调用次数限制为三次,以防止智能体过度依赖用户。
我们通过在每个步骤(初始三步之后)应用恒定的时间惩罚 $\lambda_{time} = -0.03$ 来促进执行效率。为了确保工具链的有效调用,使用 $oenv_t$ 内的执行回溯 $e_t$ 评估安全约束。严重的执行错误(如不可见的目标边界框或无效的 API 格式)会受到 -0.5 的惩罚。中等的感知错误和违反夹爪约束均受到 -0.3 的惩罚。
D.4. 分布式训练基础设施
在强化学习(RL)之前,策略从基于 Qwen3-VL-8B-Instruct 的 SFT 检查点初始化。我们使用 $5 \times 10^{-6}$ 的学习率,每设备批次大小 2,梯度累积步数 4,以及预热
第 31 页
比例为 0.08。最大图像分辨率设置为 100,352 像素,最小为 784 像素,上下文长度为 8,192 个 token,训练使用 bfloat16 精度。此阶段在 8 块 NVIDIA A800 GPU 上进行,并生成用于初始化后续 GSPO 优化的检查点。
训练后端使用九个任务池,通过 MCP 提供 144 个并发的 Isaac Sim 端点。中央服务器池为每个提示组(组大小 $G=8$)分配一个独占的仿真实例,以维持 GSPO 优势 $bA_i$ 计算的一致性。模型的优化运行在单个 8-GPU NVIDIA 4090 节点上,以确保与 Isaac Sim 的兼容性。其中两块 GPU 托管用于轨迹生成的 vLLM rollout 服务器,其余六块 GPU 使用 DeepSpeed ZeRO-2 和 6 路数据并行运行训练器。训练的超参数列于表 D.1 中。
表 D.1. GSPO 训练超参数
| 超参数 | 配置 | | :— | :— | | 基础模型 | Qwen3-VL-8B-Instruct (SFT 检查点) | | 参数高效微调 | LoRA (秩 32, $\alpha=64$, 目标:所有线性层) | | 视觉编码器 | 冻结 | | 优化器 | AdamW (通过 DeepSpeed ZeRO-2) | | 学习率 | $5 \times 10^{-6}$ | | KL 惩罚系数 ($\beta$) | 0.04 | | GSPO 组大小 ($G$) | 8 | | 每设备批次大小 | 1 | | 梯度累积步数 | 8 | | 每步有效唯一提示 | 6 | | 最大训练步数 | 1000 |
D.5. 评估指标
系统性能在五个主要维度上进行衡量。成功率 (SR) 衡量达到完整结构完成($|\Delta r_{em}| = 0$)的回合比例。完成率 (CR) 定义为终端步骤时的 $\rho_T = 1 – |\Delta r_{em}|/|\Delta t_{ask}$,用于量化部分成功。累积奖励是步骤奖励的无折扣总和 $\sum r_t$,反映了执行的整体质量。回合长度衡量所需的平均交互步数,作为效率的指标。最后,询问频率跟踪每个回合中通信工具调用的平均次数,以评估智能体的主动消歧能力。
D.6. RL 训练分析:成功与瓶颈
我们分析了 RL 阶段生成的 7,304 条 rollout 轨迹,以评估 GSPO 训练的影响。训练期间的总体成功率收敛至 39.3%。除了数值指标外,对轨迹的分析揭示了两个明显的趋势:智能体展示了改进的逻辑推理能力,但其性能受到硬件引起的感知瓶颈的限制。
认知与交互策略的改进 RL 阶段引发了在 SFT 基线中不稳定的认知能力,使智能体能够构建可靠的流水线并解决开放世界的不确定性。智能体形成了一种标准的执行流程:nav_to → show_object_by_category → gaze_at → pick → nav_to → show_receptacles → place。
31
第 32 页
这表明智能体在锁定目标之前会系统地缩小视觉搜索范围,并考察放置区域,而不是猜测容器的状态。
此外,在 SFT 数据集中很少被调用的“询问”(ask)工具,在 15.8% 的强化学习(RL)轨迹中出现了。在这些实例的 90.3% 中,智能体正确识别了多个视觉干扰项(例如:“我看到床头柜上有一块手表和一个时钟。你想要哪一个?”),并暂停执行以查询模拟用户。这表明 GSPO 优化促使策略从稀疏奖励中学习人机协作。
感知瓶颈。尽管逻辑规划有所改进,但训练期间的成功率仍受限于视觉识别失败。对 4,431 条失败轨迹的分析表明,94.3% 并非流水线故障;智能体正确执行了抓取和放置序列,但操作了错误的物体。
这些幻觉标记选择源于冻结的 411M 参数 ViT 主干网络在细粒度视觉定位方面的局限性。SFT 和 RL 均使用 max_pixels= 100,352 作为图像输入,且分辨率对齐控制对各任务族的最终成功率的影响仅约为 ±3%。因此,GSPO 的性能提升并非源于分辨率不匹配。相反,剩余的错误反映了那些视觉上相似的干扰项在纹理、颜色或部件级几何形状等细微属性上存在差异的情况,而冻结的视觉表示无法可靠地将这些属性与指令绑定。
训练与基准测试性能之间的差异。39.3% 的训练期间成功率与离线基准测试的最终评估结果不同,主要是因为训练 rollout 是从异构任务池中在线采样的,没有明确的课程学习。单个 GSPO 采样组内的内在难度会波动(例如,不同的书籍与高度模糊的几何干扰项),从而引入步骤级成功率的方差。然而,基准测试套件在固定且更均匀分层的任务分布上评估智能体,从而产生对策略更稳定的评估。总体而言,GSPO 优化了用于推理和交互的认知策略,而观察到的训练上限主要是细粒度感知瓶颈,而非 POMDP 或 RL 公式中的算法缺陷。
E. 智能体推理与评估设置
E.1. 零样本 VLM 基线
我们在基准测试上评估了一系列专有 VLM 作为零样本具身智能体。每个模型都通过支持原生函数调用的 OpenAI 兼容聊天完成 API 进行查询。
在每个 episode 开始时,智能体接收到一个系统提示,其中编码了任务规则、基于标记的对象引用协议以及可用的动作词汇表。系统提示会增强场景描述,枚举当前房屋布局中的所有房间及其家具/容器,为智能体提供环境的静态、纯文本概览。完整的系统提示模板如下所示:
32
第 33 页
零样本智能体提示
你是一个位于房屋内的智能具身智能体,旨在完成家务任务。你可以执行提供的动作来移动、操作物体并与用户交互。
marker_id 系统
你不能直接通过名称或 ID 来指定 ‘gaze_at’(注视)、‘pick’(拾取)、‘place’(放置)、‘open’(打开)或 ‘close’(关闭)的对象或容器。相反,你必须参考最新观测中提供的标记地图(marker map),该地图将简单的数字 ID 映射到场景中的实际对象或容器。
标记地图可能是一个文本列表,例如:
或者包含在图像观测中,表现为带有数字的彩色掩码。
- 0: 一个苹果
- 1: 一个杯子
注意:该映射是动态的——不要假设相同的数字在不同观测中始终映射到相同的对象。在执行涉及对象或容器的动作之前,务必检查最新观测以获取正确的映射。
完成策略
在完成任务所需的所有必要动作后,调用 ‘finish’(完成)动作以表示任务完成。不要向用户请求确认;完成后直接调用 ‘finish’。
工具调用策略
每轮必须且仅调用一个工具。切勿同时调用多个工具。
场景描述
场景包含以下房间和容器:
{SCENE_DESCRIPTION}
以下是一个填充场景描述占位符的示例场景描述:
示例场景描述
房间:餐厅/0
房间:客厅/0
房间:书房/0
房间:洗衣房/0
- 桌子_1
- 沙发_2
- 桌子_2
- 书桌_1
- 柜子_6
- 柜子_7
- 洗衣机_1
33
第 34 页
房间:卧室/0
房间:卧室/1
房间:厨房/0
- sink_1
- bed_1
- cabinet_8
- desk_2
- cabinet_9
- bed_2
- cabinet_10
- sink_0
- potlid_0
- pot_0
- electriccooker_0
任务指令作为第一条用户消息提供,此后智能体在每个步骤中应响应工具调用。工具调用被转发至仿真服务器,其响应(文本或视觉观察)被追加到上下文中以用于下一轮交互。每个回合最多运行 $T_{max} = 30$ 步。当智能体调用 finish 动作或耗尽步数预算时,回合终止。成功与否通过将最终世界状态与任务配置中的真实目标状态进行比较来确定。
E.2. Real-Agent( ours)
如第 4.1 节所述,我们的智能体在每个步骤将整个回合状态重新格式化为单个用户轮次。提示模板中的四个动态占位符直接映射到观察分区:{TASK} $\leftrightarrow T$,{TASK_PROGRESS} $\leftrightarrow h_{t-1}$,{LAST_ACTION} $\leftrightarrow a_{t-1}$,以及 {LAST_OBS} $\leftrightarrow o_{env}^{t-1}$。工具列表作为 JSON 数组直接嵌入提示中,而不是从 MCP 服务器动态获取。
系统提示 — 微调后的具身智能体
你是一台在家庭中运行的机器人。给定一项任务,你必须使用定义的一组动作来完成该任务,以达到期望的结果。
## 场景描述
场景包含以下房间和容器: {SCENE_DESCRIPTION}
## 工具列表
你必须调用以下工具来完成该任务: {TOOL_LIST}
## 输出格式要求
1. 逐步思考: 反思当前状态、已完成的工作、下一步需要做什么以及原因。具体说明需要完成的内容。本质上,叙述你的思维过程:例如,分析目标、考虑使用哪些工具、验证之前的动作
34
第 35 页
成功,以及你计划如何继续。 2. 摘要(Summary): 该字段是一个对象(字典),提供对当前情况和计划的简明总结。它包含三个子字段:
- 历史(History): 一个字符串,总结最近采取的行动及关键观察结果/结果。例如,它可能列出已执行的操作及其是否成功,或者观察到了什么。
- 抓取/持有状态规则(Grasp/hold state rule): 如果智能体成功执行了“抓取(Pick)”操作,则机器人被视为持续持有该物体,直到成功完成“放置(Place)”操作。
- 新计划(New Schedule): 基于历史记录,制定新的进阶计划或即将执行的一系列行动(3-4个高层级子任务)。重点关注高层级目标和描述性引用,而非具体的物体标识符。如果原始计划发生变化,使用此字段列出任何更新后的高层级计划或即将执行的行动序列,或指示重新规划。
- 当前子任务(Current subtask): 一个简短的字符串,描述基于当前状态(在所有历史行动完成后)机器人接下来需要做什么。
3. 然后以 JSON 格式输出你的行动决策。
重要注意事项
1. Marker_id(标记ID) 仅用于指代当前步骤中的特定物体。切勿在当前步骤中使用之前的 marker_id,因为物体位置可能已发生变化。相反,你必须参考最新的观察结果以获取当前步骤正确的 marker_id。 2. 防止重复行动序列: 不要重复执行相同的行动或行动序列。 3. 多个实例: 可能存在同一物体的多个实例,通过其名称后的索引进行区分,例如 Cabinet_2、Cabinet_3。 4. 开/关操作仅在你没有任何库存物品时有效。
你的任务是: {TASK} 当前任务进度: {TASK_PROGRESS} 近期交互历史: 最后行动:{LAST_ACTION} {LAST_OBS}
工具定义(JSON Schema)
"description": "导航至一个容器", "parameters": {"type": "object", "required": ["receptacle_name"], "properties": {"receptacle_name": {"type": "string", "description": "容器的名称"}}}}
"description": "围绕当前容器行走,以获取其顶部上的所有物体。", "parameters": {}}
"description": "注视并靠近一个物体以进行操作。", "parameters": {"type": "object", "required": ["marker_id"], "properties": {"marker_id": {"type": "string",
- {"name": "nav_to",
- {"name": "walk_around",
- {"name": "gaze_at",
35
第 36 页
"描述": "要注视的物体的标记ID"}}}}
"description": "检测视野中某类别的物体 并显示其标记。", "parameters": {"type": "object", "required": ["target_category"], "properties": {"target_category": {"type": "string"}}}}
"description": "高亮显示视野中的所有容器物体 并显示其标记。", "parameters": {}}
"description": "通过标记ID拾取视野中的特定物体, 该物体将成为你的库存物品。", "parameters": {"type": "object", "required": ["marker_id"], "properties": {"marker_id": {"type": "string"}}}}
"description": "将你的库存物品放置在容器 表面上。", "parameters": {"type": "object", "required": ["marker_id"], "properties": {"marker_id": {"type": "string"}}}}
"description": "打开关节物体的门", "parameters": {"type": "object", "required": ["marker_id"], "properties": {"marker_id": {"type": "string"}}}}
"description": "关闭关节物体的门", "parameters": {"type": "object", "required": ["marker_id"], "properties": {"marker_id": {"type": "string"}}}}
"description": "当你认为已完成所有指令时, 调用此工具以结束当前回合。", "parameters": {}}
"description": "向用户提问以获取关于任务的更多 信息。", "parameters": {"type": "object", "required": ["question"], "properties": {"question": {"type": "string"}}}}
- {"name": "show_object_by_category",
- {"name": "show_receptacles",
- {"name": "pick",
- {"name": "place",
- {"name": "open",
- {"name": "close",
- {"name": "finish",
- {"name": "ask",
示例场景和输出。下面是一个代表性的模型输出,展示了三部分 结构(思维链、摘要字典和操作JSON)。
示例模型输出
〈think〉 我需要从桌子上拿起时钟。我导航到了 desk_0并调用了walk_around,这揭示了一个标记ID为 "3"的时钟。我现在应该注视它以在拿起之前靠近它。 〈/think〉 { "summary": { "History": "0) 收到任务并准备开始。\n
36
第 37 页
1) nav_to desk_0: 移动到书桌。\n 2) walk_around: 观察到时钟(标记 3)。” “新计划”: “1) 注视时钟。 2) 拿起时钟。 3) nav_to shelf_1。 4) 放置时钟。” “当前子任务”: “注视书桌 (desk_0) 上的时钟(标记 3)。” }, “下一步动作”: { “工具名称”: “gaze_at”, “参数”: {“marker_id”: “3”} } }
回合循环。 算法 E.1 总结了每个回合的推理过程。每个回合最多运行 $T= 30$ 步,采用贪婪解码,每步预算为 4096 个新 token。 当前提示中仅包含来自最近一次动作的图像;之前的图像会被丢弃。
算法 E.1 微调智能体回合循环 要求: 任务指令 $\tau$, 场景描述 $S$, 最大步数 $T$ 1: 构建提示模板 $P(S)$ $\triangleright$ 嵌入场景一次 2: $h \leftarrow \text{None}, \quad a_{\text{prev}} \leftarrow \{\}, \quad o_{\text{prev}} \leftarrow ""$ 3: for $t= 0, 1, \dots , T-1$ do 4: $p_t \leftarrow P(S)[\tau, h, a_{\text{prev}}, o_{\text{prev}}]$ $\triangleright$ 填充动态字段 5: $\hat{y}_t \leftarrow \text{Generate}(\text{model}, p_t, \text{images})$ 6: $(\text{summary}_t, a_t) \leftarrow \text{ParseJSON}(\hat{y}_t)$ 7: $h \leftarrow \text{HistoryManager.Update}(\text{summary}_t.\text{History})$ 8: if $a_t.\text{tool_name} = \text{finish}$ then 9: $\text{success} \leftarrow \text{Eval}(\text{current scene state}, \text{goal state})$ 10: break 11: end if 12: $(o_t, \text{images}) \leftarrow \text{ENV}(a_t)$ 13: $a_{\text{prev}} \leftarrow a_t, \quad o_{\text{prev}} \leftarrow o_t$ 14: end for
E.3. 模拟用户保真度与真实用户泛化能力
模拟用户答案保真度。 为了验证模拟用户提供的澄清既有用又有界限,我们手动评估了由 Gemini 驱动的用户模块生成的 50 个答案。在这些答案中,47 个准确且足以推动目标进展,2 个方向正确但细节不足,无法完全消除目标的歧义,1 个不正确。这一评估支持将模拟用户作为可扩展的训练和基准交互代理,同时保留了模拟答案并非完全可靠这一局限性。
对真实用户的泛化。 我们还在 50 个 SUL 任务子集上评估了训练好的智能体,涉及两种用户来源:Gemini 模拟用户和真实人类用户。真实用户的回答比模拟回答短得多(平均 4.3 个词,而模拟回答为 30.2 个词),但智能体获得的成功次数相当:使用人类用户时成功 27 个回合,而使用模拟用户时成功 29 个
37
第 38 页
与 Gemini 配合使用。性能的微小下降主要发生在人类反馈未能充分区分视觉干扰物中的目标时,这表明策略可以从模拟对话迁移到真实用户,但仍对未明确指定的反馈敏感。
F. 定性分析
为了补充主论文(第 5 节)中的定量失败分类,我们展示了基准评估中具有代表性的失败和成功案例的分步轨迹可视化。每个案例都追踪了智能体的工具调用和第一人称观察,展示了我们智能体的能力以及尚存的局限性。
F.1. 失败案例分析
我们选择了四个失败案例,涵盖了主论文分析(图 3)中确定的主要失败模式:对象混淆(包括错误选择对象和相似家具混淆)、关键动作缺失和记忆丢失。
错误选择对象。图 F.1 描绘了一个指令为:“从比另一个小得多的桌子上取下一个具有经典设计、顶部有两个铃铛、表面光滑的圆形白色闹钟,并将其放置在铺有哑光白色床单的床上。”智能体导航至 table_2(第 0 步),并调用 show_object_by_category(target_category="clock")(第 1 步),该调用在候选对象上生成了两个带编号的标记叠加层——一个蓝色闹钟和目标白色闹钟。尽管指令明确指定了白色闹钟,但智能体未能正确定位颜色属性,最终错误地选择了蓝色闹钟(第 2–5 步)。在此过程中还发生了过期的标记 ID 错误(第 3 步),但根本性的失败在于视觉属性辨别:智能体将两个对象都识别为闹钟,但无法根据指令中指定的颜色和外观属性可靠地区分它们。此案例体现了细粒度视觉定位的局限性。强化学习奖励对错误的抓取结果进行惩罚,但未提供属性级对象匹配的显式监督,导致当区分特征为颜色等细微表面属性时,智能体无法解决视觉上相似的候选对象。
相似家具混淆。图 F.2 展示了一个任务,指令为:“将一只具有圆形身体、伸展双臂、浅棕色、光滑纹理的泰迪熊玩偶从铺有全白床单的床上搬运到看电视时放零食的桌子上。”智能体导航至 bed_1(第 0 步),通过 show_object_by_category 检测到三只泰迪熊(第 1 步,标记 1–3),使用 gaze_at 靠近标记 1(第 2 步),并成功抓取(第 3 步)。在放置阶段,智能体导航至 table_2(第 4 步),该处显示为空的白色表面。预期的目的地是 table_2,因为它是客厅中电视机前的桌子。然而,智能体未能对目的地描述进行语义定位,随后转向 table_1(第 5 步)。它调用 show_receptacles 标记附近的家具(第 6 步),揭示了两个容器标记。智能体将泰迪熊放置在标记 2 处(第 7 步),但这对应的是错误的桌子。目的地描述“用于看电视时放零食的桌子”需要常识推理,即目标应是靠近电视区域的桌子,这种语义定位水平是冻结的视觉编码器无法可靠捕捉的。
第 39 页
图 F.1. 失败案例:错误的物体选择。任务:从 table_2 上取一个白色闹钟。在检测到两个候选闹钟——一个蓝色和一个白色(步骤 1)后,智能体未能对颜色属性进行定位(grounding),而是错误地选择了蓝色闹钟,而非目标白色闹钟。
关键动作缺失。图 F.3 展示了一个任务,其指令为:“从带有矩形木质把手的白色书桌上取一个计时设备,并将其移动到比另一个大得多的桌子上。”智能体导航至 desk_1(步骤 0)并调用 show_object_by_category(target_category="clock")(步骤 1),该操作揭示了书桌上多个候选物体。指令使用了模糊术语“计时设备”,而非指定特定物体,从而在选取哪个候选物体时产生了真正的歧义。智能体没有调用 ask 工具向模拟用户查询以寻求澄清,而是任意地注视其中一个候选物体(步骤 2)并将其拿起(步骤 3),选择了错误的物体,导致任务失败。此类失败属于“关键动作缺失”类别(占失败总数的 17%)。模糊的指令需要通过交流消歧,而智能体无法仅凭视觉观察解决这一问题。尽管经过带有社会奖励的强化学习(RL)训练以鼓励主动查询,但在面对未充分指定的指令时,智能体仍倾向于立即采取行动,而非寻求澄清。
动作记忆丢失。图 F.4 展示了一个长视界(long-horizon)失败案例,其指令为:“从圆角矩形桌子上取一个小型白色狗雕像,该雕像呈坐姿,表面光滑,带有轻微纹理,比例逼真,姿态直立,并将其放置在带有黑色把手的书桌上。”抓取阶段顺利完成:智能体导航至 table_2(步骤 0),通过 show_
39
第 40 页
图 F.2. 失败案例:相似家具混淆。任务:将一只泰迪熊从床上移动到用于看电视的桌子上。智能体正确选取了目标物体(步骤 0–3),但在两张候选桌子之间导航(步骤 4–5),最终将其放置在错误的位置(步骤 7),导致失败。
object_by_category(target_category="figurine")(步骤 1),注视标记 1(步骤 2),并选取它(步骤 3)。然而,在放置阶段,智能体陷入持续的振荡循环:它导航至 desk_1(步骤 4),然后到 desk_2(步骤 5),再回到 desk_1(步骤 6),并在步骤 11 之前持续在两张桌子之间交替——连续八次调用 nav_to,却从未调用 show_receptacles、place 或任何其他工具。这种行为体现了“丢失动作记忆”(lost action memory)故障模式:自我总结机制通过维持 O(1) 上下文来
40
第 41 页
图 F.3. 失败案例:关键动作缺失——未发起询问(ask)。任务:从一张摆放有多个候选物体的书桌中取回一个“计时装置”。模糊的指令导致对选取哪个物体存在歧义,但智能体在步骤 1–3 中任意选择了一个物体,而未调用 ask 来消除歧义,最终导致选取了错误的物体。
设计,但压缩后的历史未能编码“两张书桌均已被访问并经过视觉检查”这一信息。缺乏这一否定证据,智能体无法排除候选对象或打破决策僵局,从而产生无限循环,直至耗尽步骤预算。
F.2. 成功探索案例
我们展示了突出显示智能体涌现能力的成功案例。
通过 walk_around 进行主动物体发现。图 F.5 展示了一个任务:“从我们吃饭的桌子上拿起那个流线型黑色遥控器,其设计弯曲,表面光亮,按钮有颜色,握持符合人体工程学,并将其移动到带有橙色内衬的抽屉柜中。”智能体导航至 table_1(步骤 0),并调用 show_object_by_category 搜索遥控器(步骤 1),揭示出两个分别标注为标记 1 和 2 的视觉特征不同的候选对象。智能体并未立即选择其中一个,而是调用了 walk_around()(步骤 2)。扫描确认了所有三个候选对象的存在:“我发现了以下物体:0:一个遥控器。1:一个遥控器。2:一个遥控器。”在核实库存后,智能体注视标记 0(步骤 3)——即那个流线型
41
第 42 页
图 F.4. 失败案例:动作记忆丢失——无限导航循环。任务:将一个小狗摆件送到“带有黑色把手的桌子”处。在拿起摆件(步骤 0–3)后,智能体在 desk_1 和 desk_2 之间交替移动了八个步骤(步骤 4–11),期间既未放置物体,也未调用任何非导航工具。
与指令匹配的黑色遥控器——拿起它(步骤 4),并导航至 cabinet_7(步骤 5)以完成任务。此示例展示了我们智能体的开放词汇探索能力,以及
42
第 43 页
使用 walk_around 工具进行全方位场景探索的必要性。智能体可以利用多视角的 walk_around 工具,发现从初始视角不可见的物体。
图 F.5. 成功:通过 walk_around 进行主动物体发现。任务:从一张放有三个不同颜色遥控器的桌子上取下一个黑色遥控器。智能体检测到所有三个候选对象(步骤 1),使用 walk_around 确认完整清单(步骤 2),然后正确选择并拿起黑色遥控器(步骤 3–4),最后将其交付到目标柜子(步骤 5)。
多容器探索。图 F.6 展示了一个任务,指令为:“从铺有纯白床品的床上取下一本螺旋装订、封面为纹理白色、书脊为红色、内页为带有草图的横线笔记本,并将其放置在底座平坦的全黑柜子上。”源位置和目的地都需要视觉定位,因为场景中有多张床和多个柜子。智能体首先导航至 bed_2(步骤 0),但观察到床品与描述不符。它重定向到 bed_1(步骤 1),通过 show_object_by_category(target_category="notebook") 检测到笔记本(步骤 2),注视标记 1(步骤 3),并将其拿起(步骤 4)。在放置阶段,智能体系统地探索了四个柜子:cabinet_7(步骤 5)、cabinet_9(步骤 6)、cabinet_8(步骤 7)和 cabinet_10(步骤 8)。到达最后一个候选对象时,它调用 show_receptacles(步骤 9)以标记可见家具并确认正确的目的地,将笔记本放置在标记 2 处(步骤 10),并通过 finish() 发出任务完成信号(步骤 11,“Success: True”)。这一轨迹展示了智能体在保持目标持久性的同时,在多个候选容器之间执行系统搜索的能力。与无限循环的失败模式不同,此处的智能体逐步探索,从未重新访问之前被拒绝的候选对象。
43
第 44 页
并在识别出匹配的家具后确定其放置位置。
图 F.6. 成功示例:多容器探索任务。任务:将笔记本从“铺有纯白床品的床”移动到“全黑柜子”。智能体探索了两张床以定位正确的源位置(步骤 0–1),并探索了四个柜子以识别正确的目标位置(步骤 5–8),在 12 步任务中未重复访问任何容器。
44
第 45 页
G. 真实世界部署细节
为了验证我们的训练流程在物理环境中的有效性,我们将 REAL-Agent 部署在一台真实的移动操作臂上。本节详细介绍了硬件设置、连接视觉语言模型(VLM)与物理执行模块的软件架构,以及一个复杂长视域任务的定性演示。
硬件平台。真实世界实验在 Ark LIFT2 上进行,这是一款功能强大的双臂移动操作臂。该机器人基于三轮全向底盘构建,以实现敏捷的室内移动,并配备垂直可调的躯干,可自由升降双臂平台以扩展操作工作空间。在视觉感知方面,它配备了三个 Intel RealSense 相机:一个 D455 安装在头部用于自我中心的全局观测,两个 D405 安装在手腕上用于高分辨率的近距离操作视图。自主导航由底盘上的 Odin 模块驱动,该模块融合激光雷达和 RGB 相机数据。机器人配备了一块板载 NVIDIA RTX 4070 Ti GPU,用于实时运行底层控制器和 MCP 服务器。
系统架构与 MCP 服务器。为了无缝连接 VLM 的高级认知推理与底层硬件控制器,我们使用了 MCP 服务器架构(如 C.2 节所述)。VLM 策略部署在云服务器上以进行高性能推理。它以头部相机的 RGB 图像和累积的历史记录为输入,并通过网络向机器人输出离散的、JSON 格式的工具调用。
板载 MCP 服务器充当中央调度器。当基于云的 VLM 发出导航命令(例如,nav_to)时,MCP 服务器将目标坐标路由到 Odin 导航模块。当发出操作命令(例如,pick、place、open、close)时,MCP 服务器将视觉标记 ID 和命令传递给部署在 RTX 4090 上的云端 $\pi_{0.5}$ 模型。为了实现稳健的物理执行,我们收集了 980 条真实世界的遥操作轨迹来微调该 Pi-0.5 模型,使其能够可靠地将手腕相机的 RGB-D 输入转换为双臂的连续电机轨迹。如果 VLM 发出通信命令(例如,ask),MCP 服务器将触发文本转语音/语音转文本接口以与人类用户交互。这种模块化设计确保了工具范式(在仿真中无需使用 Oracle 感知 API)无需修改即可直接迁移到真实世界。
定量真实世界评估。我们在三个层面上评估物理部署:导航和视线对齐的可重复性、底层 VLA 原语的可执行性以及端到端任务的成功率。如表 G.1 所示,在 30 次试验中,机器人实现了厘米级的导航/视线重复性;在 600 次执行中,原语成功率为 85.3%;在 60 个回合中,全系统成功率为 78.3%,且没有发生不可恢复的系统崩溃。VLM Lat. 列仅报告了一个回合期间累积的高级 VLM 推理时间。底层物理执行具有独立的固定视域:每个 Pi-0.5 操作原语运行 1000 个底层控制步骤,分为 50 步的动作块,在物理平台上大约需要 60 秒。因此,主要的挂钟部署成本来自物理机器人执行,而非 VLM 推理。
真实世界失败分析。在 60 个端到端物理回合中,仅有 2 个回合因冻结视觉编码器的高级视觉误解而失败。其余失败是由底层 VLA 执行错误、物理超时或模糊情况下的缺失 ask 调用引起的。这种失败分析表明,部署的高级策略将其视觉交互推理能力
第 46 页
表 G.1. 真实世界定量评估。Odom Err.(里程计误差)、Yaw Err.(偏航误差)和 Img. Shift(图像偏移)衡量重复导航/注视指令后的可重复性。Primitive VLA 可执行性基于 600 次底层执行进行测量。端到端片段使用与仿真相同的高级策略和 MCP 工具接口。
导航/注视可重复性
目标 试验次数 Odom Err. Yaw Err. Img. Shift RMSE
全部 30 1.78±0.40 cm 0.74±0.57◦ 21.5±10.4 px 1.96 px
基础 VLA 可执行性 技能 N SR 技能 N SR 打开 120 63.3% 关闭 120 100.0% 抓取 120 89.2% 放置-桌面 120 100.0% 放置-微观 120 74.2% 总计 600 85.3%
端到端真实世界片段
任务 SR 步数 SPL Ask VLM Lat.
FDO 80.0% 12.2 67.0% 0.90 71.1s FODP 100.0% 9.6 86.9% 0.70 53.5s SUL 55.0% 13.0 35.4% 0.55 80.5s 总计 78.3% 11.6 63.1% 0.72 68.4s
转向物理环境,而整体鲁棒性仍取决于提高基础可靠性和及时的查询行为。
定性执行 walkthrough(12 步任务)。正如正文(第 5 节)所强调的,我们在一个复杂的、语义模糊的任务上评估智能体:从面包摊取特定食物并将其放入微波炉。执行跨越 12 个不同步骤,展示了智能体的能力:
1. 指令接收与预测性规划:智能体接收用户的高级指令。智能体没有立即搜索食物,而是通过首先导航至微波炉表现出因果推理。 2. 准备(打开):智能体执行打开工具以打开微波炉门,提前准备目标容器。 3. 导航至源点:智能体穿过房间导航至面包摊。 4. 主动探索:智能体调用视觉感知工具扫描面包摊,在观察到的物品上生成 SoM 叠加层。 5. 歧义检测:智能体处理视觉观察并意识到存在多个与模糊指令匹配的视觉相似食物项(干扰项)。 6. 人机消歧(Ask):智能体没有猜测,而是主动暂停物理执行,并使用 ask 工具查询用户以澄清具体目标。 7. 用户反馈:用户提供澄清响应(例如,指定目标项的颜色或确切位置)。 8. 目标定位:智能体将用户的反馈与当前视觉观察相结合,以唯一确定正确的目标 ID。
46
第 47 页
9. 精确抓取(Pick):智能体执行抓取工具,成功抓取已消除歧义的食物。 10. 返回导航:智能体手持物品,导航返回微波炉。 11. 任务执行(Place):智能体执行放置工具,小心地将食物放入打开的微波炉内。 12. 任务完成:智能体结束回合,成功完成长视野、闭环任务。
这12步轨迹验证了经强化学习优化的策略(GSPO)能有效克服分布偏移,从而在非结构化物理环境中实现自适应规划、主动视觉定位和主动社交互动。
从第1步到第12步的真实世界任务的逐步执行过程如图G.1–G.4所示。
47
第 48 页
图 G.1. 现实世界任务的执行序列(步骤 1–3)。
48
第 49 页
图 G.2. 现实世界任务的执行序列(步骤 4–6)。
49
第 50 页
图 G.3. 现实世界任务的执行序列(步骤 7–9)。
50
第 51 页
图 G.4. 现实世界任务的执行序列(步骤 10–12)。
51
第 52 页
参考文献
[1] Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alexander Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J. Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, and Andy Zeng. Do as i can, not as i say: Grounding language in robotic affordances. In CoRL, 2023.
[2] Anthropic. Introducing the model context protocol, Nov 2024, https://www.anthropic. com/news/model-context-protocol, accessed: June 26, 2026.
[3] Anthropic. Claude haiku 4.5 system card. System card, Anthropic, Oct 2025, https: //www-cdn.anthropic.com/7aad69bf12627d42234e01ee7c36305dc2f6a970.pdf, accessed: July 1, 2026.
[4] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, and Ke Zhu. Qwen3-VL technical report. arXiv preprint arXiv:2511.21631, 2025.
[5] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, et al. RT-1: Robotics transformer for real-world control at scale. In RSS, 2023.
[6] Matthew Chang, Gunjan Chhablani, Alexander Clegg, Mikael Dallaire Cote, Ruta Desai, Michal Hlavac, Vladimir Karashchuk, Jacob Krantz, Roozbeh Mottaghi, Priyam Parashar, Siddharth Patki, Ishita Prasad, Xavier Puig, Akshara Rai, Ram Ramrakhya, Daniel Tran, Joanne Truong, John M. Turner, Eric Undersander, and Tsung-Yen Yang. PARTNR: A benchmark for planning and reasoning in embodied multi-agent tasks. In ICLR, 2025.
[7] Hanyang Chen, Mark Zhao, Rui Yang, Qinwei Ma, Ke Yang, Jiarui Yao, Kangrui Wang, Hao Bai, Zhenhailong Wang, Rui Pan, Mengchao Zhang, Jose Barreiros, Aykut Onol, ChengXiang Zhai, Heng Ji, Manling Li, Huan Zhang, and Tong Zhang. Era: Transforming vlms into em- bodied agents via embodied prior learning and online reinforcement learning. arXiv preprint arXiv:2510.12693, 2025.
[8] Junting Chen, Haotian Liang, Lingxiao Du, Weiyun Wang, Mengkang Hu, Yao Mu, Wenhai Wang, Jifeng Dai, Ping Luo, Wenqi Shao, and Lin Shao. OWMM-Agent: Open world mobile manipulation with multi-modal agentic data synthesis. In NeurIPS, 2025.
[9] Junting Chen, Checheng Yu, Xunzhe Zhou, Tianqi Xu, Yao Mu, Mengkang Hu, Wenqi Shao, Yikai Wang, Guohao Li, and Lin Shao. EMOS: Embodiment-aware heterogeneous multi-robot operating system with LLM agents. In ICLR, 2025.
52
第 53 页
[10] Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, 和 Shuran Song。Diffusion policy: Visuomotor policy learning via action diffusion. IJRR, 2024. doi: 10.1177/02783649241273668.
[11] Gheorghe Comanici, 等人。Gemini 2.5: Pushing the frontier with advanced reasoning, multi- modality, long context, and next generation agentic capabilities. arXiv preprint arXiv:2507.06261, 2025.
[12] Liu Dai, Haina Wang, Weikang Wan, 和 Hao Su。ManiTaskGen: A comprehensive task generator for benchmarking and improving vision-language agents on embodied decision-making. arXiv preprint arXiv:2505.20726, 2025.
[13] Matt Deitke, Eli VanderBilt, Alvaro Herrasti, Luca Weihs, Kiana Ehsani, Jordi Salvador, Winson Han, Eric Kolve, Aniruddha Kembhavi, 和 Roozbeh Mottaghi。ProcTHOR: Large-scale embodied AI using procedural generation. In NeurIPS, 2022.
[14] Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, 等人。PaLM-E: An embodied multimodal language model. In ICML, 2023.
[15] Caelan Reed Garrett, Rohan Chitnis, Rachel Holladay, Beomjoon Kim, Tom Silver, Leslie Pack Kaelbling, 和 Tomás Lozano-Pérez。Integrated task and motion planning. An- nual Review of Control, Robotics, and Autonomous Systems, 4(1), 2021. doi: 10.1146/ annurev-control-091420-084139.
[16] Google DeepMind。Gemini。https://deepmind.google/models/gemini/, 2025, accessed: June 26, 2026.
[17] Google DeepMind。Gemini 3 pro model card。Model card, Google DeepMind, 2026, https://storage.googleapis.com/deepmind-media/Model-Cards/ Gemini-3-Pro-Model-Card.pdf, model release: November 2025; last updated: May 2026. Used to document the Gemini 3 Pro family corresponding to the evaluated gemini-3-pro-preview API identifier. Accessed: July 1, 2026.
[18] Qiao Gu, Alihusein Kuwajerwala, Sacha Morin, Krishna Murthy Jatavallabhula, Bipasha Sen, Aditya Agarwal, Corban Rivera, William Paul, Kirsty Ellis, Rama Chellappa, 等人。ConceptGraphs: Open-vocabulary 3D scene graphs for perception and planning. In ICRA, 2024.
[19] Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, 和 Jiangmiao Pang。MesaTask: Towards task-driven tabletop scene generation via 3D spatial reasoning. In NeurIPS, 2025.
[20] Wenlong Huang, Pieter Abbeel, Deepak Pathak, 和 Igor Mordatch。Language models as zero- shot planners: Extracting actionable knowledge for embodied agents. In ICML, 2022.
[21] Wenlong Huang, Fei Xia, Ted Xiao, Harris Chan, Jacky Liang, Pete Florence, Andy Zeng, Jonathan Tompson, Igor Mordatch, Yevgen Chebotar, 等人。Inner monologue: Embodied reasoning through planning with language models. In CoRL, 2023.
[22] Wensi Huang, Shaohao Zhu, Meng Wei, Jinming Xu, Xihui Liu, Hanqing Wang, Tai Wang, Feng Zhao, 和 Jiangmiao Pang。VL-LN bench: Towards long-horizon goal-oriented navigation with active dialogs. arXiv preprint arXiv:2512.22342, 2025.
[23] Leslie Pack Kaelbling 和 Tomás Lozano-Pérez。Hierarchical task and motion planning in the now. In ICRA, 2011.
53
第 54 页
[24] Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, and Chelsea Finn. OpenVLA: 一个开源的视觉-语言-动作模型。在 CoRL, 2024.
[25] Eric Kolve, Roozbeh Mottaghi, Winson Han, Eli VanderBilt, Luca Weihs, Alvaro Herrasti, Matt Deitke, Kiana Ehsani, Daniel Gordon, Yuke Zhu, Aniruddha Kembhavi, Abhinav Gupta, and Ali Farhadi. AI2-THOR: 用于视觉 AI 的交互式 3D 环境。arXiv 预印本 arXiv:1712.05474, 2017.
[26] Zixing Lei, Sheng Yin, Yichen Xiong, Yuanzhuo Ding, Wenhao Huang, Yuxi Wei, Qingyao Xu, Yiming Li, Weixin Li, Yunhong Wang, and Siheng Chen. EmboMatrix: 一个可扩展的具身决策训练场。arXiv 预印本 arXiv:2510.12072, 2025.
[27] Chengshu Li, Ruohan Zhang, Josiah Wong, Cem Gokmen, Sanjana Srivastava, Roberto Martín- Martín, Chen Wang, Gabrael Levine, Michael Lingelbach, Jiankai Sun, et al. Behavior-1k: 一个包含 1,000 种日常活动和逼真模拟的具身 AI 基准测试。在 CoRL, 2023.
[28] Dongping Li, Tielong Cai, Tianci Tang, Wenhao Chai, Katherine Rose Driggs-Campbell, and Gaoang Wang. EMMOE: 开放环境中具身移动操作的综合基准测试。arXiv 预印本 arXiv:2503.08604, 2025.
[29] Manling Li, Shiyu Zhao, Qineng Wang, Kangrui Wang, Yu Zhou, Sanjana Srivastava, Cem Gokmen, Tony Lee, Li Erran Li, Ruohan Zhang, Weiyu Liu, Percy Liang, Li Fei-Fei, Jiayuan Mao, and Jiajun Wu. 具身智能体接口:评估大语言模型在具身决策中的表现。在 NeurIPS, 2024.
[30] Jacky Liang, Wenlong Huang, Fei Xia, Peng Xu, Karol Hausman, Brian Ichter, Pete Florence, and Andy Zeng. 代码即策略:用于具身控制的语言模型程序。在 ICRA, 2023.
[31] Xiao Liu, Tianjie Zhang, Yu Gu, Iat Long Iong, Song XiXuan, Yifan Xu, Shudan Zhang, Hanyu Lai, Jiadai Sun, Xinyue Yang, Yu Yang, Zehan Qi, Shuntian Yao, Xueqiao Sun, Siyi Cheng, Qinkai Zheng, Hao Yu, Hanchen Zhang, Wenyi Hong, Ming Ding, Lihang Pan, Xiaotao Gu, Aohan Zeng, Zhengxiao Du, Chan Hee Song, Yu Su, Yuxiao Dong, and Jie Tang. Visualagentbench: 迈向作为视觉基础智能体的大型多模态模型。在 ICLR, 2025.
[32] Soroush Nasiriany, Fei Xia, Wenhao Yu, Ted Xiao, Jacky Liang, Ishita Dasgupta, Annie Xie, Danny Driess, Ayzaan Wahid, Zhuo Xu, Quan Vuong, Tingnan Zhang, Tsang-Wei Edward Lee, Kuang-Huei Lee, Peng Xu, Sean Kirmani, Yuke Zhu, Andy Zeng, Karol Hausman, Nicolas Heess, Chelsea Finn, Sergey Levine, and Brian Ichter. PIVOT: 迭代视觉提示激发 VLMs 的可操作知识。在 ICML, 2024.
[33] OpenAI. Gpt-4o 系统卡片。arXiv 预印本 arXiv:2410.21276, 2024.
[34] OpenAI. Openai gpt-5 系统卡片。arXiv 预印本 arXiv:2601.03267, 2026.
[35] Aishwarya Padmakumar, Jesse Thomason, Ayush Shrivastava, Patrick Lange, Anjali Narayan- Chen, Spandana Gella, Robinson Piramuthu, Gökhan Tür, and Dilek Hakkani-Tür. TEACh: 能聊天的任务驱动型具身智能体。在 AAAI, 2022.
[36] Maithili Patel, Xavier Puig, Ruta Desai, Roozbeh Mottaghi, Sonia Chernova, Joanne Truong, and Akshara Rai. ADAPT: 主动发现并适应任何任务的偏好。在 COLM, 2025.
54
第 55 页
[37] Daniel Philipov, Vardhan Dongre, Gökhan Tür, 和 Dilek Hakkani-Tür。为具身对话式人工智能模拟用户智能体。arXiv 预印本 arXiv:2410.23535,2024。
[38] Physical Intelligence, Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai 等人。𝜋0.5:具有开放世界泛化能力的视觉-语言-动作模型。arXiv 预印本 arXiv:2504.16054,2025。
[39] Xavier Puig, Kevin Ra, Marko Boben, Frieda Li, Tingwu Wang, Sanja Fidler, 和 Antonio Torralba。VirtualHome:通过程序模拟家庭活动。在 CVPR 中,2018。
[40] Qwen, An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Haoran Wei, Huan Lin, Jian Yang, Jianhong Tu, Jianwei Zhang, Jianxin Yang, Jiaxi Yang, Jingren Zhou, Junyang Lin, Kai Dang, Keming Lu 等人。Qwen2.5 技术报告。arXiv 预印本 arXiv:2412.15115,2024。
[41] Allen Z. Ren, Jaden Clark, Anushri Dixit, Masha Itkina, Anirudha Majumdar, 和 Dorsa Sadigh。探索直至确信:具身问答的高效探索。在 RSS 中,2024。
[42] Allen Z. Ren, Anushri Dixit, Alexandra Bodrova, Sumeet Singh, Stephen Tu, Noah Brown, Peng Xu, Leila Takayama, Fei Xia, Jake Varley, Zhenjia Xu, Dorsa Sadigh, Andy Zeng, 和 Anirudha Majumdar。寻求帮助的机器人:大语言模型规划器的不确定性对齐。在 CoRL 中,2023。
[43] Tianhe Ren, Shilong Liu, Ailing Zeng, Jing Lin, Kunchang Li, He Cao, Jiayu Chen, Xinyu Huang, Yukang Chen, Feng Yan, Zhaoyang Zeng, Hao Zhang, Feng Li, Jie Yang, Hongyang Li, Qing Jiang, 和 Lei Zhang。Grounded SAM:组装用于多样化视觉任务的开放世界模型。arXiv 预印本 arXiv:2401.14159,2024。
[44] Mohit Shridhar, Jesse Thomason, Daniel Gordon, Yonatan Bisk, Winson Han, Roozbeh Mottaghi, Luke Zettlemoyer, 和 Dieter Fox。ALFRED:用于解释日常任务接地指令的基准测试。在 CVPR 中,2020。
[45] Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, Yonatan Bisk, Adam Trischler, 和 Matthew Hausknecht。ALFWorld:对齐文本与具身环境以进行交互式学习。在 ICLR 中,2021。
[46] Marta Skreta, Zihan Zhou, Jia Lin Yuan, Kourosh Darvish, Alán Aspuru-Guzik, 和 Animesh Garg。Replan:利用感知和语言模型进行机器人重规划。arXiv 预印本 arXiv:2401.04157,2024。
[47] Andrew Szot, Alex Clegg, Eric Undersander, Erik Wijmans, Yili Zhao, John Turner, Noah Maestre, Mustafa Mukadam, Devendra Chaplot, Oleksandr Maksymets, Aaron Gokaslan, Vladimir Vondrus, Sameer Dharur, Franziska Meier, Wojciech Galuba, Angel Chang, Zsolt Kira, Vladlen Koltun, Jitendra Malik, Manolis Savva, 和 Dhruv Batra。Habitat 2.0:训练家庭助手重新排列其栖息地。在 NeurIPS 中,2021。
[48] Andrew Szot, Bogdan Mazoure, Omar Attia, Aleksei Timofeev, Harsh Agrawal, Devon Hjelm, Zhe Gan, Zsolt Kira, 和 Alexander Toshev。从多模态大语言模型到通用具身智能体:方法与经验教训。在 CVPR 中,2025。
[49] Andrew Szot, Max Schwarzer, Harsh Agrawal, Bogdan Mazoure, Ryan Metcalf, Walter Talbott, Natalie Mackraz, R. Devon Hjelm, 和 Alexander Toshev。作为具身任务可泛化策略的大语言模型。在 ICLR 中,2024。
第 56 页
[50] Huajie Tan, Xiaoshuai Hao, Cheng Chi, Minglan Lin, Yaoxu Lyu, Mingyu Cao, Dong Liang, Zhuo Chen, Mengsi Lyu, Cheng Peng, Chenrui He, Yulong Ao, Yonghua Lin, Pengwei Wang, Zhongyuan Wang, 和 Shanghang Zhang。RoboOS:一种用于跨具身和多智能体协作的分层具身框架。arXiv 预印本 arXiv:2505.03673,2025。doi: 10.48550/arXiv.2505.03673。
[51] Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, 和 Anima Anandkumar。Voyager:具有大语言模型的开放式具身智能体。 TMLR,2024。
[52] Hanqing Wang, Jiahe Chen, Wensi Huang, Qingwei Ben, Tai Wang, Boyu Mi, Tao Huang, Siheng Zhao, Yilun Chen, Sizhe Yang, Peizhou Cao, Wenye Yu, Zichao Ye, Jialun Li, Junfeng Long, Zirui Wang, Huiling Wang, Ying Zhao, Zhongying Tu, Yu Qiao, Dahua Lin, 和 Jiangmiao Pang。 GRUtopia:在大规模城市环境中梦想通用机器人。arXiv 预印本 arXiv:2407.10943,2024。
[53] Siyin Wang, Zhaoye Fei, Qinyuan Cheng, Shiduo Zhang, Panpan Cai, Jinlan Fu, 和 Xipeng Qiu。世界建模使规划器更优:用于具身任务规划的双偏好优化。在 ACL,2025。
[54] Yuanfei Wang, Xinju Huang, Fangwei Zhong, Yaodong Yang, Yizhou Wang, Yuanpei Chen, 和 Hao Dong。用于具身智能体-人类适应的高效通信欲望对齐。 arXiv 预印本 arXiv:2505.22503,2025。
[55] Jianwei Yang, Hao Zhang, Feng Li, Xueyan Zou, Chunyuan Li, 和 Jianfeng Gao。Set-of-Mark 提示在 GPT-4V 中释放非凡的视觉定位能力。arXiv 预印本 arXiv:2310.11441, 2023。
[56] Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella, Marziyeh Movahedi, Manling Li, Heng Ji, Huan Zhang, 和 Tong Zhang。EmbodiedBench:针对视觉驱动具身智能体的多模态大语言模型综合基准测试。在 ICML,2025。
[57] Yue Yang, Fan-Yun Sun, Luca Weihs, Eli VanderBilt, Jae Sung Fox, Aniruddha Kembhavi, 和 Roozbeh Mottaghi。Holodeck:语言引导的 3D 具身 AI 环境生成。 在 CVPR,2024。
[58] Haoqi Yuan, Yu Bai, Yuhui Fu, Bohan Zhou, Yicheng Feng, Xinrun Xu, Yi Zhan, Börje F Karlsson, 和 Zongqing Lu。Being-0:一种具有视觉语言模型和模块化技能的人形机器人智能体。arXiv 预印本 arXiv:2503.12533,2025。
[59] Puzhen Yuan, Angyuan Ma, Yunchao Yao, Huaxiu Yao, Masayoshi Tomizuka, 和 Mingyu Ding。REMAC:用于长周期机器人操作的自我反思和自我进化的多智能体协作。arXiv 预印本 arXiv:2503.22122,2025。
[60] Hongxin Zhang, Weihua Du, Jiaming Shan, Qinhong Zhou, Yilun Du, Joshua B. Tenenbaum, Tianmin Shu, 和 Chuang Gan。使用大语言模型模块化地构建合作型具身智能体。在 ICLR,2024。
[61] Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, 和 Junyang Lin。组序列策略优化 (GSPO)。arXiv 预印本 arXiv:2507.18071,2025。
第 57 页
[62] Brianna Zitkovich, Tianhe Yu, Sichun Xu, Peng Xu, Ted Xiao, Fei Xia, Jialin Wu, Paul Wohlhart, Stefan Welker, Ayzaan Wahid, Quan Vuong, Vincent Vanhoucke, Huong Tran, Radu Soricut, Anikait Singh, Jaspiar Singh, Pierre Sermanet, Pannag R. Sanketi, Grecia Salazar, Michael S. Ryoo, Krista Reymann, Kanishka Rao, Karl Pertsch, Igor Mordatch, Henryk Michalewski, Yao Lu, Sergey Levine, Lisa Lee, Tsang-Wei Edward Lee, Isabel Leal, Yuheng Kuang, Dmitry Kalashnikov, Ryan Julian, Nikhil J. Joshi, Alex Irpan, Brian Ichter, Jasmine Hsu, Alexander Herzog, Karol Hausman, Keerthana Gopalakrishnan, Chuyuan Fu, Pete Florence, Chelsea Finn, Kumar Avinava Dubey, Danny Driess, Tianli Ding, Krzysztof Marcin Choromanski, Xi Chen, Yevgen Chebotar, Justice Carbajal, Noah Brown, Anthony Brohan, Montserrat Gonzalez Arenas, and Kehang Han. RT-2:视觉-语言-动作模型将网络知识迁移至机器人控制。在 CoRL,2023。
57