具身操作的数据金字塔:如何平衡数据规模与机器人对齐?

快速导读:本文提出“具身数据金字塔”分类法,从可扩展性与机器人对齐度两个维度系统梳理了真实机器人、UMI、第一人称、仿真及通用数据五大来源,并分析其在具身基础模型中的应用与挑战。

具身智能的发展正面临数据瓶颈。与多模态大模型不同,具身智能体需要理解物理状态、动力学及动作后果,而现有数据源在可扩展性、机器人对齐度、物理保真度等方面存在显著差异。本文提出“具身数据金字塔”分类法,旨在从数据中心视角对异构数据源进行系统化分析。

该分类法基于“可扩展性”和“机器人对齐度”两个核心原则,将数据分为五层:真实机器人数据、UMI风格数据、第一人称/第三人称数据、仿真数据、通用数据。通过这一框架,本文不仅梳理了各数据层的收集管线与局限性,还分析了代表性具身基础模型在预训练中数据源使用的演变,为未来具身智能体的数据整合提供了清晰的路径。

英文题目:Data Pyramid for Embodied Manipulation

论文出处:arXiv 每日论文精选 · arXiv:2607.24744

原始论文:PDF / 论文页面

对应视频标题:具身操作的数据金字塔:如何平衡数据规模与机器人对齐?|推荐指数:★★★★★

这篇论文解决什么问题?

具身智能体需要在复杂物理环境中执行任务,这要求其具备对物理状态、动力学及动作后果的深刻理解。然而,现有研究多关注模型架构,缺乏从数据中心视角对异构数据源的收集、组织、比较及整合进行系统化分析。

不同数据源在可扩展性、机器人对齐度、物理保真度等方面存在显著差异。例如,真实机器人数据虽然具有高机器人对齐度,但收集成本高,难以大规模扩展;仿真数据虽然可扩展性强,但存在Sim-to-Real差距,物理保真度有限。

此外,UMI和Ego数据缺乏直接的机器人本体感知,需进行复杂的跨具身重定向(Retargeting);通用数据缺乏物理交互和动作监督,无法直接用于动作生成。这些差异使得直接混合训练面临巨大挑战。

因此,亟需一个系统化的分类框架,以指导不同数据源的有效整合与利用,从而推动具身智能体的发展。

核心创新

  • 提出基于可扩展性与机器人对齐度张力的数据金字塔分类体系。
  • 从数据中心视角分析具身基础模型(VLA, WAM, Embodied Brain)的数据配方与对齐策略。
  • 系统梳理了各数据层的收集管线、传感器配置、监督信号及局限性。
  • 讨论了触觉数据、失败恢复数据、跨具身对齐等未来挑战。

方法概览

提出“具身数据金字塔”分类法,基于“可扩展性”(Scalability)和“机器人对齐度”(Robot Alignment)两个核心原则,结合质量、多样性、可重用性和物理保真度四个辅助维度,将数据分为五层:真实机器人数据、UMI风格数据、第一人称/第三人称数据、仿真数据、通用数据。

  • 提出“具身数据金字塔”分类法,基于“可扩展性”(Scalability)和“机器人对齐度”(Robot Alignment)两个核心原则。可扩展性指数据收集和生成的难易程度及规模潜力;机器人对齐度指数据对物理机器人学习和执行的直接支持程度。
  • 结合质量、多样性、可重用性和物理保真度四个辅助维度,将数据分为五层:真实机器人数据、UMI风格数据、第一人称/第三人称数据、仿真数据、通用数据。每一层数据在金字塔中的位置反映了其在可扩展性与机器人对齐度之间的权衡。
  • 详细分析了各数据层的收集管线、传感器配置、监督信号及局限性。例如,真实机器人数据通常通过遥操作或自主执行收集,具有高物理保真度但规模有限;UMI数据通过手持夹具收集末端执行器运动数据,无需机器人参与,可扩展性强但需重定向。
  • 探讨了触觉数据、失败恢复数据、跨具身对齐等未来挑战。触觉数据对于精细操作至关重要,但现有数据集覆盖不足;失败恢复数据有助于提高鲁棒性,但收集难度大;跨具身对齐是实现通用具身智能的关键,但技术复杂。
  • 分析了代表性具身基础模型在预训练中数据源使用的演变。早期系统主要依赖真实机器人轨迹,而近期系统 increasingly 探索与真实机器人、第一人称、仿真、通用及UMI风格数据的协同训练。
  • 讨论了不同数据源的动作空间和对齐方式差异。直接混合训练需解决几何和对齐问题,例如通过重定向技术将UMI数据转换为机器人可执行的动作。
  • 强调了数据规模增长并不等同于质量提升。需关注轨迹的重复性、标注准确性和同步性,以确保数据的有效利用。
  • 提出了未来研究方向,包括开发更高效的跨具身对齐方法、构建包含触觉和失败恢复数据的大规模数据集、以及探索更逼真的仿真环境以缩小Sim-to-Real差距。

逐图理解论文

直觉与困境:规模与对齐的矛盾

直觉与困境:规模与对齐的矛盾
Figure 2 Evolution of Data Scale. Evolution of data scale across the embodied data pyramid. From left to right, we select a subset of representative datasets from simulation data, UMI data, robot data, ego data, and general data to visualize their chronological scale growth. Simulation, UMI, and robot datasets are measured by the number of demonstrations, ego datasets by the number of collected hours, and general datasets by the number of question-answer pairs. The inset curves summarize the scale evolution of selected datasets within the corresponding data categories.

该图展示了各数据类别随时间演进的规模增长趋势。通过对比不同数据类型的规模变化,可以直观看到仿真和通用数据的快速增长,以及真实机器人数据的相对缓慢增长。

核心区分:数据金字塔的维度

核心区分:数据金字塔的维度
Figure 1 Overview of Organization and Scope. This work is organized into three parts. We first introduce the embodied data pyramid, which categorizes data sources into real-robot, UMI-style, egocentric-exocentric, simulation, and general data according to their scalability and robot alignment, and reviews their datasets, collection pipelines, embodiments, sensing configurations, supervision, scale, diversity, and transferability. We then examine how these heterogeneous sources support embodied foundation models. Finally, we discuss future directions in embodied data.

该图展示了本文的组织结构和范围。首先介绍具身数据金字塔,然后根据可扩展性和机器人对齐度对数据源进行分类,最后讨论未来方向。这是理解全文框架的关键。

贡献与验证:模型数据使用的演变

贡献与验证:模型数据使用的演变
Figure 3 Evolution of Data Utilization. Evolution of data utilization in representative embodied foundation models. Early systems primarily rely on real-robot trajectories, whereas recent systems increasingly explore co-training with real-robot, egocentric, simulation, general, and UMI-style data. The architectural landscape also expands from action-centric VLA systems toward world-model-augmented and unified world-action models. Data sources are indicated by real-robot data, egocentric data, UMI data, simulation data, and general data.

该图展示了代表性具身基础模型在预训练中数据源使用的演变。从依赖真实机器人轨迹到混合多源数据,反映了领域内对数据多样性和可扩展性的重视。

结论:系统化分类的价值

结论:系统化分类的价值
Table 7 Representative VLA and WAM approaches. The models are grouped and sorted by release time, model type, institution, and data source icons. Left Half: Models from 2023 to 2025; Right Half: Models from 2026. Data sources are indicated by real-robot data, egocentric data, UMI data, simulation data, and general data.

该表列出了代表性VLA和WAM方法,并按发布时间和数据源图标分组。通过对比不同模型的数据源构成,可以清晰看到领域内数据使用策略的演变。

实验如何设计?

  • 可视化展示了各数据类别随时间演进的规模增长趋势(Figure 2)。通过选取代表性数据集,展示了仿真、UMI、机器人、第一人称及通用数据在轨迹数量、收集时长或问答对数量上的增长情况。
  • 分析了代表性具身基础模型在预训练中数据源使用的演变(Figure 3)。通过对比不同模型的数据源构成,揭示了从依赖真实机器人轨迹转向混合多源数据的趋势。
  • 通过启发式方法提取关键动作帧,可视化展示了不同数据集在抓取和交互轨迹上的空间分布多样性(Figure 4)。这为评估数据多样性提供了直观依据。
  • 统计并对比了真实机器人、UMI、Ego/Exo、仿真及通用数据集的关键属性与规模(Table 1-6)。包括具身形态数量、传感器配置、监督信号类型、数据规模等。
  • 讨论了不同数据源在具身基础模型中的应用效果。例如,仿真数据在预训练阶段可提供大规模多样化样本,而真实机器人数据在微调阶段可提供高保真监督。
  • 分析了跨具身对齐技术的挑战与进展。例如,UMI数据需通过重定向技术转换为机器人可执行的动作,这涉及复杂的几何变换和运动学映射。

关键结果与论文证据

  • 真实机器人数据具有高机器人对齐度,但规模有限且收集成本高。代表性数据集如Open X-Embodiment包含2.4M轨迹,覆盖22种具身形态(Page 9)。
  • UMI数据可扩展性强,但需重定向。代表性数据集如AgiBot World Beta包含1M轨迹,2976.4小时数据(Page 9)。
  • 第一人称/第三人称数据规模大,但缺乏直接机器人本体感知。代表性数据集如RoboMIND 2.0包含310K轨迹,1000+小时数据,覆盖739个任务(Page 9)。
  • 仿真数据可扩展性最强,但存在Sim-to-Real差距。代表性数据集如Xperience-10M包含10M轨迹(Page 4)。
  • 通用数据规模巨大,但缺乏物理交互和动作监督。代表性数据集如WildDet3D包含3.7M问答对(Page 4)。
  • 具身基础模型的数据使用正从单一真实机器人数据转向多源混合数据。早期模型如RT-1主要依赖真实机器人数据,而近期模型如GR00T和Motus则整合了多种数据源(Page 3, 36)。
  • 不同数据源在抓取和交互轨迹上的空间分布多样性存在显著差异。仿真数据通常具有更高的多样性,而真实机器人数据则更集中于特定任务(Page 7)。
  • 跨具身对齐技术是实现UMI和Ego数据有效利用的关键。现有方法在几何变换和运动学映射方面仍面临挑战(Page 8, 14)。

阅读时需要注意

  • 真实机器人数据收集成本高,难以大规模扩展。
  • 仿真数据存在Sim-to-Real差距,物理保真度有限。
  • UMI和Ego数据缺乏直接的机器人本体感知,需进行复杂的跨具身重定向(Retargeting)。
  • 通用数据缺乏物理交互和动作监督,无法直接用于动作生成。
  • 现有数据集在触觉、失败恢复、柔性物体交互等方面覆盖不足。

关联工作

  • Motus和GR00T等模型引入了分层或金字塔式数据视图的具身基础模型(Page 3)。
  • 现有综述多关注模型架构或特定子问题,缺乏从数据中心视角的系统化分析(Page 3)。
  • Vision-Language-Action models surveys和World-Action models surveys提供了相关背景,但未深入探讨数据源的分类与整合(Page 3)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

具身操作数据金字塔

Yifan Ye∗1, Yankai Fu∗1, Yaoxu Lv∗1, Bohan Hou∗2, Jun Cen∗,†3, Lingdong Kong∗4, Duo Zheng5, Tianxing Chen6, Jiaming Liu1, Ziang Cao2, Yunfan Lou1, Wei Chow4, Xian Sun7, Yingshuo Wang8, Kuangzhi Ge3, Xiaowei Chi3, Xidong Zhang9, Zhibo Pang1, Yiwu Zhong1, Sirui Han3, Zhihe Lu10, Weihao Yuan10, Qifeng Chen3, Michael Yu Wang9, Yao Mu11, Ziwei Liu2, Jianfei Yang2, Ping Luo6, Shanghang Zhang‡1

1北京大学, 2南洋理工大学, 3香港科技大学, 4新加坡国立大学, 5香港中文大学, 6香港大学, 7杜克大学, 8加州大学伯克利分校, 9北京理工大学, 10南京大学, 11上海交通大学 ∗共同第一作者, †项目负责人, ‡通讯作者

多模态基础模型通过消费整个互联网学会了“看”和“说”。具身智能体无法享受这种捷径,因为它们需要耦合观察、物理状态和动作的数据。这些数据信号可以由多种数据源以不同程度的方式提供。在本工作中,我们将具身数据生态系统组织为一个跨越五个互补来源的“金字塔”:1真实机器人数据,2UMI风格数据,3第一人称和第三人称数据,4仿真数据,以及5通用视觉-语言数据。我们围绕可扩展性与机器人对齐度之间的张力来组织这个金字塔,并从数据质量、多样性、可重用性和物理保真度方面进一步刻画每个来源。随后,我们从数据配方(data recipes)的角度分析近期的具身基础模型,考察在预训练过程中如何选择、对齐和混合不同的数据源。对于具身大脑模型、视觉-语言-动作模型(VLA)和世界-动作模型(WAM),我们将数据组成与以下六大开放挑战联系起来讨论:大规模数据集的构建与收集、失败与恢复数据的获取、可扩展数据收集管道的开发、跨具身形态的动作对齐、利用第一人称数据进行灵巧操作,以及为机器人学习设计原则性的数据配方。我们希望这项工作能为下一代具身系统的设计奠定基础。

项目:具身数据金字塔 [cs.RO] GitHub: Awesome Embodied Data Pyramid 日期:2026年7月28日

具身数据金字塔 数据金字塔布局(第II-VI节) 应用(第VII节) 趋势(第VIII节)

a b c a 机器人数据组成与大规模 动作表示 触觉数据集 数据 2 (第II节) 具身形态与传感器 收集方法 多样性/规模 1 数据 动作空间 b a b 配方 表示 恢复/失败数据 和 UMI 数据 (第III节) UMI 数据收集 跨具身部署 c a b 可扩展数据收集 第一人称数据 (第IV节) b 采集基础设施 监督 生成 数据 跨模型范式 跨具身 仿真 a b c d 1 用于具身动作对齐的数据 (第V节) 仿真数据集与收集 模型 世界作为大脑模型 e 用于 基础设施 基准 方法 模拟器 2 机器人学习 arXiv:2607.24744v1 用于 VLA 模型的数据 通用 a b c d f 3 用于灵巧操作的第一人称数据 用于世界-动作模型的数据 (第VI节) 用于认知 用于感知数据 用于感知数据 用于动作推理 物理仿真 UMI 机器人 第一人称 通用

图 1 组织与范围概览。本工作分为三个部分。我们首先介绍具身数据金字塔,根据可扩展性和机器人对齐度将数据源分类为真实机器人、UMI风格、第一人称-第三人称、仿真和通用数据,并回顾它们的数据集、收集管道、具身形态、传感配置、监督信号、规模、多样性和可迁移性。然后,我们考察这些异构来源如何支持具身基础模型。最后,我们讨论具身数据的未来方向。

第 2 页

目录

1 引言 … 3 2 真实机器人数据 … 7 2.1 数据概览 … 7 2.2 具身形态与模态 … 8 2.3 数据收集范式 … 10 2.4 规模与多样性 … 12 2.5 优势与局限性 … 13 3 UMI 数据 … 14 3.1 数据概览 … 14 3.2 UMI 数据收集流程 … 14 3.3 跨具身形态部署 … 15 3.4 优势与局限性 … 16 4 第一人称与第三人称数据 … 16 4.1 数据概览 … 16 4.2 采集基础设施 … 17 4.3 监督信号构建 … 19 4.4 优势与局限性 … 22 5 仿真数据 … 22 5.1 数据概览 … 22 5.2 仿真基础设施与资产生态 … 23 5.3 基准测试与仿真数据集 … 25 5.4 合成演示生成 … 26 5.5 作为仿真器的世界模型 … 28 5.6 Sim-to-Real Gap … 28 5.7 优势与局限性 … 29 6 通用数据 … 29 6.1 数据概览 … 29 6.2 视觉-语言数据 … 30 6.3 分割与定位数据 … 32 6.4 3D 数据 … 32 6.5 任务分解的规划数据 … 33 6.6 视频与时间序列数据 … 34 6.7 物理、因果与故障推理 … 34 6.8 抓取数据 … 34 6.9 优势与局限性 … 35 7 具身基础模型中的数据应用 … 35 7.1 概览 … 35 7.2 数据组成与动作表示 … 35 7.3 具身大脑的应用 … 38 7.4 VLA 模型的应用 … 39 7.5 WAM 的应用 … 41 8 挑战与未来方向 … 43 8.1 接触丰富机器人学习的触觉数据 … 43 8.2 故障数据与以恢复为中心的机器人学习 … 43 8.3 跨金字塔层的可扩展数据收集 … 44 8.4 跨具身形态的状态-动作对齐 … 44 8.5 灵巧手策略学习的第一人称先验 … 45 8.6 数据配方 … 45 9 结论 … 45

第 3 页

1 引言

多模态基础模型主要通过利用海量的视觉和语言数据进行预训练扩展,从而获得了广泛的感知、语言和推理能力 [24, 88]。将这一范式扩展至具身基础模型,不仅需要处理视觉和语言输入的能力。具身智能体还必须理解物理状态和动力学,推理动作如何改变环境,并在物理世界中执行适当的行为 [20, 23, 174, 258]。这些要求从根本上改变了预训练所需的监督性质,并引出了一个核心问题:

应该使用什么数据来训练具备此类能力的具身基础模型?

社区已经探索了多种用于具身基础模型的互补监督源。这些来源包括从物理机器人和仿真中收集的观察-动作轨迹、人类交互的自我中心(egocentric)和外中心(exocentric)记录、通用的图像、视频、语言和视觉-语言数据,以及最近出现的 UMI (Universal Manipulation Interface) 风格演示,后者在收集过程中无需机器人参与,即可捕捉以物体和末端执行器为中心的操控行为 [23, 24, 26, 62, 119, 359]。每种来源都贡献了不同形式的语义、时间、物理和动作相关的监督。然而,它们各自的角色、权衡、关系和集成策略仍未得到充分的系统化梳理。

包括 Motus [18] 和 GR00T [20] 在内的几个近期具身基础模型引入了分层或金字塔式的训练数据视图,以说明使用异构来源的必要性。这些公式通常围绕特定模型的训练配方设计,并提供了关于数据类别在收集可扩展性、具身依赖性、物理保真度、可转移性和下游效用方面差异的有限分析。现有的综述同样往往侧重于模型架构或特定子问题,包括 VLA (Vision-Language-Action) 模型 [446]、WAM (World-Action Model) [141] 和世界建模 [177]。因此,具身数据生态系统尚未在类别层面得到系统组织,具身基础模型对异构数据的使用也尚未从以数据为中心的视角进行全面分析。

为了系统地回答这个问题,我们将具身数据问题框架化为两个问题:

• “尽管异构具身数据源在可扩展性、机器人对齐度、物理保真度和可转移性方面存在差异,我们如何收集、组织、比较和集成它们?”

• “具身基础模型如何有效地选择、组合和利用这些异构数据源?”

为了考察第一个问题,我们将现有的具身数据生态系统组织为一个用于机器人技术和具身智能的数据金字塔。该金字塔由两个互补的设计原则指导。第一个是可扩展性(Scalability),它关注数据源在硬件依赖性、人力、环境重置、安全监督和边际生成成本方面扩展的效率。第二个是 Robot Alignment(机器人对齐度),它关注其观察、表示和监督信号在多大程度上能直接支持在物理机器人上的学习和执行。

这两个原则通常存在张力:与真实机器人执行紧密对齐的数据通常昂贵且难以扩展,而高度可扩展的数据可能仅为物理交互提供间接或不完善的监督。例如,一旦构建了所需的资产、任务和生成管道,仿真就可以持续生成面向机器人的轨迹,但其效用仍受限于仿真物理系统与真实物理系统之间的差异 [67, 144, 202, 262, 332, 359]。

除了这两个主要的组织原则外,我们引入了四个互补的类别级维度来表征不同数据源的更广泛效用。质量(Quality)关注收集经验的效度、一致性、信息量和任务相关性;当轨迹重复、标注不准确、信号同步不良或收集条件存在系统性偏差时,单纯增加数据量可能带来的益处有限 [211]。多样性(Diversity)反映了对任务、物体、场景、视角、指令、具身形态、传感配置、行为和结果的覆盖范围,对于分布偏移下的鲁棒性至关重要 [64, 113]。如图 4 所示,代表性数据集在交互轨迹、观察视角、任务阶段的分布上表现出显著差异,

3

第 4 页

RoboDojo WildDet3D 3.5k [2026.07] 3.7M [2026.04] RoboVid-X MolmoB0T [2026.01] 4M Genie Sim 3.0 [2026.03] 1.7M RoboAfford++ 10k+ hours [2026.01] 2M [2025.11] ShareRobot InternData-A1 [2025.02] 1M 637k LLaVA- [2025.11] InternData-M1 MolmoACT2 Video-178K Dexora Open-Aoe HumanNet PixMo-Points 244k [2025.10] 32K [2026.05] [2026.05] 10k 1.3M [2024.10] 2k [2026.07] RoboTwin [2024.09] 2.3M 2.0 Daimon-Infinity [2026.05] 967k RoboVerse [2025.06] 126k 274k [2026.04] UMI-3D LET-Base Agibot World PixMo 91K [2026.04] 2026 4.6k [2026.04] EgoLive LLaVA- 510k 3.3M [2024.09] [2025.04] EgoVerse OneVision-SI [2026.03] 20k Groot-X Sim 1.6k [2026.04] RealOmni RoboMind 2.0 [2026.04] 1.3k 3.2M [2024.08] RoboPoint 345k [2025.03] VLABench FastUMI-100k [2026.01] 790k Robocoin 310K [2025.12] 5K [2024.12] 1.4M [2024.06] [2025.10] 100k Xperience-10M Egocentric- [2025.11] 180K EgoPlan-IT Touch in ManiSkill-HAB RealSource 100k 10k [2026.03] Open- 50k [2023.12] DexMimicGen the Wild World [2025.12] 100k ROBOVQA 44k [2024.12] Galaxea [2025.11] FreeTacMan 2.7K [2025.07] 26K 21K [2024.10] 829.5K [2023.11] 10k [2025.06] [2025.08] 20K OpenEgo DexGraspNet 2.0 PACO-LVIS EgoDex ActionNet DexUMI 1.1k [2025.09] 502K [2023.01] ManiSkill 3 427M EgoTaskQA [2024.10] Agibot [2025.05] 0.82k DexWild 30K [2025.08] [2025.05] 1.8K 33K [2024.10] World-β 40K [2022.10] [2025.05] 9.5k Ego-Exo4D [2025.03] 1M Ego4D A-OKVQA RoboMind RoboCasa MimicGen 1.3k [2023.11] DSL [2021.10] 3.6k 100k OCR-VQA [2024.06] 107K [2024.12] [2022.06] 25k 50k [2023.10] Fast-UMI [2024.10] 24K Open-X- 1M [2019.09] Charades Epic- [2024.09] 9k Embodiment LIBERO -Ego RH20T ADE20K UMI Kitchens-100 DexGraspNet [2023.10] 2.4M RefCOCO 50k [2023.10] 110K [2023.07] 68.8 [2018.04] 27.6k [2016.08] [2024.02] 2.5K 1.32M [2022.10] [2020.06] 100 142k [2016.08]

仿真数据 UMI数据 机器人数据 第一人称数据 通用数据

图2 数据规模的演变。具身数据金字塔中数据规模的演变。从左到右,我们从仿真数据、UMI数据、机器人数据、第一人称数据和通用数据中选取代表性数据集子集,以可视化其按时间顺序的规模增长。仿真、UMI和机器人数据集以演示数量衡量,第一人称数据集以采集时长衡量,通用数据集以问答对数量衡量。插图曲线总结了相应数据类别中选定数据集的规模演变。

和操作环境。可重用性表征数据在不同任务、环境、具身形态、感知系统和模型族之间转移的难易程度。例如,以物体或末端执行器为中心的演示可以重定向到更灵巧的具身形态 [62, 303],而第一人称视频为手物交互、功能理解(affordance understanding)和任务分解提供了可重用的监督信号 [118, 119, 171, 325, 391]。最后,物理保真度描述数据类别在多大程度上真实地捕捉了真实的交互动态和反馈,包括接触、摩擦、顺应性、感知噪声、执行延迟和物体运动。这四个维度通过解释数据源是否不仅规模庞大且与机器人相关,而且信息丰富、多样化、可转移且具有物理意义,从而补充了可扩展性和机器人对齐度。

综上所述,这六个维度促使我们对具身数据生态系统进行类别级组织。从顶端到底部,我们将五个类别排序为:真实机器人数据、UMI风格数据(通用操作接口)、第一人称和第二人称数据、仿真数据和通用数据。这种排序反映了一个总体转变:从更强的物理基础和更直接可操作的机器人监督,转向更高的可访问性和可扩展性。

因此,沿金字塔向下是一种系统的权衡。真实机器人数据位于顶端,因为其记录的动作可直接在产生它们平台上执行,这种保真度是以硬件、人力和重置为代价的 [24, 26, 64, 347]。每一层都通过放松部分耦合来换取覆盖范围:UMI风格装置将机器人从采集循环中移除,同时保留末端执行器监督 [62, 218, 224, 303, 441];人类记录移除了机械夹爪,但保留了真实物理和日常多样性 [118, 119, 148, 171, 237, 391];仿真恢复了可执行动作和特权标签,但近似了物理本身 [67, 144, 202, 262, 332, 359];而通用数据则完全放弃机器人基础,以获取网络规模的语义和推理覆盖 [23, 74]。下方的卡片总结了每一层,该排序代表了六个维度的总体综合,而非沿每个单独属性的严格单调进展。

数据金字塔概览

两个主要轴组织着金字塔。可扩展性捕捉数据源扩展的效率,而机器人对齐度捕捉其对物理机器人学习和执行的直接支持程度。这两个轴通常存在张力。质量、多样性、可重用性和物理保真度进一步表征了每一层的效用和局限性。

4

第 5 页

类型 1:真实机器人数据:真实机器人

在目标机器人上通过遥操作或脚本生成的轨迹,在一个闭环中记录观测、状态、动作和结果。没有什么比这更可直接执行,也更为昂贵:每一小时都需要硬件、操作员和重置。

类型 2:UMI 风格数据:UMI

使用手持夹具捕获的演示,记录末端执行器运动而不将机器人纳入闭环,使数据采集能够进入日常环境。夹具监督在此过程中得以保留;关节级本体感觉则不复存在,且重定向仍然必要。

类型 3:第一人称/第三人称数据:第一人称

记录人们行动的第一人称和第三人称视频,以可穿戴设备捕获的规模提供真实的物理特性、灵巧的手部操作和日常多样性。不涉及机器人,因此必须跨越人机差距重建动作并进行重定向。

类型 4:仿真数据:仿真

在物理引擎中生成的交互,以并行方式和可忽略的边际成本返回可执行动作以及特权标签,如接触、姿态和成功信号。它无法返回其所近似的物理特性。

类型 5:通用数据:通用

网络规模的图像、视频、语言以及视觉-语言语料库,包含远超任何机器人数据集的语义、空间结构和常识。它们为感知和推理提供基础,而非动作,且对接触或后果只字未提。

数据金字塔提供了具身数据生态系统的静态、类别级组织。在此分类法之外,我们进一步考察每类数据规模随时间的演变。如图 2 所示,真实机器人、UMI 风格、第一人称和第三人称、仿真以及通用数据集均随时间扩展,每类均表现出强劲的增长趋势。

我们从以数据为中心的视角进一步考察具身基础模型。如图 3 所示,我们考察了代表性具身基础模型预训练期间使用的数据源。回顾的系统表明,训练配方正从早期以真实机器人轨迹为主,转向日益异构的真实机器人、仿真、通用、第一人称以及较少使用的 UMI 风格数据的混合。表 7 提供了所涵盖模型及其数据组成的更综合摘要。

除了记录这些数据配方外,我们还从动作空间对齐和几何对齐两个角度分析具身基础模型如何适应异构数据集。前者关注模型如何协调不同机器人形态在动作维度、控制接口和动作语义上的差异,后者关注如何将从不同视角、坐标系和形态收集的观测和演示映射到机器人兼容的表示中。随后,我们考察了三个代表性模型家族如何利用数据金字塔的不同层级。具身大脑模型主要利用广泛的 multimodal 和具身数据来支持感知、时空推理、功能理解、记忆和高层规划 [74, 158, 258]。视觉-语言-动作模型需要机器人兼容的动作监督,以将观测和指令映射为可执行行为 [20, 23, 174]。世界-动作模型还利用无动作的时间数据、动作条件交互和合成经验来建模环境演化和动作后果。

5

第 6 页

2023.3 2023.7 2024.5 2024.10 2024.10 2024.10 2025.3

PaLM-E RT-2 Octo GR-2 π0 RDT-1B Gr00t N1 Google DeepMind UCB ByteDance IntelligencePhysical THU NVIDIA

模型类型:VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA

2025.8 2025.7 2025.7 2025.6 2025.5 2025.4 2025.4

Galaxea-0 GR-3 Being-H0 Gr00t N1.5 UniVLA π0.5 UWM Galaxea ByteDance PKU NVIDIA HKU IntelligencePhysical UW

模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2VLA 模型类型:RT-2WAM

2025.9 2025.10 2025.12 2025.12 2025.12 2026.1 2026.1

RynnVLA-001 InternVLA-M1 Video-VLA Motus Gr00t N1.6 InternVLA-A1Shanghai AI Lab LingbotVLA-1 Shanghai AI Lab Ant Group

模型类型:VLA 模型类型: 模型类型:VLA 模型类型:VLA DAMORT-2VLA 模型ShanghaiRT-2Type: VLAAi Lab 模型类型:RT-2XJTUWAM 模型RT-2Type:THUWAM 模型类型:RT-2NvidiaVLA

2026.4 2026.4 2026.2 2026.2 2026.2 2026.2 2026.1

GR00T N1.7 π0.7 EgoScale DreamZero ABot-M0 Xiaomi-R-0 LingbotVA-1 NVIDIA IntelligencePhysical NVIDIA NVIDIA AMAP CV Lab Xiaomi Ant Group

模型类型:VLA 模型类型:RT-2VLA 模型类型:VLA 模型类型:WAM 模型类型:VLA 模型类型:VLA 模型类型:WAM

2026.4 2026.4 2026.5 2026.5 2026.6 2026.7 2026.7

Being-H0.7 MotuBrain Qwen-VLA Wall-OSS-0.5 Qwen-Manip LingbotVA-2 LingbotVLA-2 BeingBeyond Shengshu Qwen X Square Robot Qwen Ant Group Ant Group

模型类型:WAM 模型类型:WAM 模型类型:VLA 模型类型:VLA 模型类型:VLA 模型类型:WAM 模型类型:VLA

图3 数据利用的演变。代表性具身基础模型中数据利用的演变。早期系统主要依赖真实机器人轨迹,而近期系统越来越多地探索与真实机器人、第一人称视角、仿真、通用和UMI风格数据的联合训练。架构景观也从以动作为中心的VLA系统向世界模型增强型和统一的世界-动作模型扩展。数据来源包括真实机器人数据、第一人称视角数据、UMI数据、仿真数据和通用数据。

序列 [3, 8, 36, 109, 141]。本分析将异构训练数据的组成和对齐度与其在不同具身基础模型架构中的作用联系起来。

最后,我们围绕三个问题组织具身数据的关键挑战和未来方向:收集什么、如何收集以及如何利用。首先,未来的数据集应更好地代表目前稀缺的交互信号,特别是失败和恢复轨迹 [21, 70, 235] 以及捕捉接触状态、力、材料属性和细粒度交互动态的触觉反馈 [232, 387, 444]。其次,数据收集流程应减少对昂贵手动遥操作的依赖,扩大任务和环境覆盖范围,并自适应地优先处理代表性不足或信息量丰富的交互 [24, 26, 62]。第三,应更系统地利用异构数据,通过跨具身形态对齐动作表示、确定来自金字塔不同层级的数据的有效混合比例,并将人类交互经验迁移到机器人操作中 [20, 64, 171, 303, 391]。

总体而言,本文通过数据金字塔分类法组织具身数据生态系统,回顾各类数据的构建与收集,并考察具身基础模型如何利用异构来源的数据。

本文的主要贡献总结如下。

• 一个由可扩展性和机器人对齐度指导的数据金字塔分类法。我们将具身AI数据组织为五个互补类别,按从顶端到底部的顺序排列:真实机器人数据、UMI风格数据、第一人称和第三人称视角数据、仿真数据和通用数据。我们从质量、多样性、可重用性、物理保真度、收集可扩展性以及与物理机器人学习的对齐度等方面对每个类别进行表征。为了支持社区,我们还发布并维护了一个开源仓库,在该分类法下整理具有代表性的数据集和相关资源。

6

第 7 页

AgiBot-World-2026 (机器人) RoboMIND (机器人) RoboMIND 2.0 (机器人)

任务:货架食品整理 任务:将土豆放入小蒸笼 任务:清扫并将垃圾倒入垃圾桶

EgoVerse (第一人称视角) Fast-UMI (UMI) InternData-A1 (仿真)

任务:折叠衣物 任务:放置土豆 任务:倒酒

图 4 代表性数据集的动作轨迹多样性可视化。遵循 PerAct [314] 的启发式过程提取关键动作帧。在初始配置可比的情况下,抓取和交互关键帧的空间分布可作为演示轨迹多样性的代理指标。人类手部轨迹采用类似的启发式方法提取相应的手部关键帧。

• 以数据为中心的具身基础模型分析。我们考察了异构数据源如何支持具身视觉语言模型、视觉-语言-动作模型和世界动作模型。我们的分析将数据集属性(包括语义覆盖范围、时间结构、动作监督、机器人对齐度、多样性和物理保真度)与模型能力(如感知、推理、规划、动作生成和世界预测)联系起来。

• 开放挑战与未来方向的讨论。我们确定了具身数据中的关键挑战,包括质量和多样性评估、跨具身形态复用、多模态标准化、可扩展的现实世界数据采集、人到机器人及仿真到现实的迁移、失败与恢复数据策展,以及异构数据源的整合与评估。我们进一步讨论了构建更通用、更鲁棒、可重用且基于物理现实的具身智能体的机遇。

2 真实机器人数据

2.1 数据概览

真实机器人数据位于具身智能数据金字塔的顶端,代表了最接近现实执行的一层。它是通过机器人与环境的物理交互收集的,通常包括感官观测、机器人状态和控制动作。与人类视频或具身形态无关的演示数据相比,它直接捕捉了在特定机器人具身形态下感知、动作与物理后果之间的闭环关系。因此,它具有高质量、物理保真度、多样性和可重用性的特点,使其成为学习可执行操作策略和将模型预测锚定在现实世界动力学中的最直接监督来源。

真实机器人数据集的发展已从孤立的、特定任务的数据集演变为越来越通用和可重用的数据资源,如表 1 所示。早期的工作主要集中于少量行为的大量尝试,例如机器人抓取,通常是在受控环境中使用脚本控制器收集的 [169, 275]。随后的数据集扩展到涵盖更广泛任务集和更多样化场景的人类操作演示 [91, 173, 248, 308]。最近的工作进一步跨机构、机器人平台和应用领域扩展数据采集 [64, 142, 366, 372],并整合了

第 8 页

UMI 数据 真实机器人数据

硬件具身形态

单臂 双臂 灵巧手 移动 人形 手部 模态 遥操作系统

腕部相机 触觉/力 RGB / RGB-D VR GELLO 基于视觉的外骨骼手套 属性 模态

无机器人 野外 相对末端执行器 跨具身形态 采集 演示 轨迹 友好 RGB / RGB-D 比例 音频 触觉/力 LiDAR/IMU 采集流程 采集流程

z y x / / 人类 便携式 视觉/姿态 相对末端执行器 脚本 遥操作 人在回路 多模态 机器人 操作接口 信号 动作 轨迹

重定向 跨具身形态 部署

图 5 UMI 数据和真实机器人数据的概览。左侧:UMI 数据使用便携式人工操作接口采集,强调无机器人在野外演示、多模态感知以及相对末端执行器轨迹。右侧:真实机器人数据在具有不同遥操作系统的物理机器人具身形态上采集,涉及多种感知模态和采集范式。重定向通过将 UMI 演示迁移到可执行的机器人动作,从而实现跨具身形态部署,将两者连接起来。

双臂系统 [98, 335]、移动操作臂 [103]、人形机器人 [294, 440] 以及灵巧手 [203, 435]。 这一进展反映了从为单个策略收集数据向构建用于训练通用机器人模型的大规模数据生态系统的更广泛转变。

2.2 具身形态与模态

真实机器人数据集在收集交互数据的物理具身形态方面存在显著差异。早期数据集主要围绕配备平行夹爪的固定基座单臂操作臂构建, 大型抓取和操作数据集如 Pinto 和 Gupta、QT-Opt 以及 RoboNet [75, 169, 275] 即为典型代表。这种配置提供了相对受限的动作空间, 并促进了可扩展的数据收集,但仅涵盖有限的全身和协调操作行为。后来的数据集越来越多地纳入双臂系统,用于协调和双臂操作 [257, 438, 439], 移动操作臂联合控制底座和上半身 [103, 162],以及涉及全身运动和 locomotion 的人形平台 [102, 132, 440]。 更近期的工作进一步将数据收集扩展到灵巧手和异构机器人舰队,使得研究细粒度的接触丰富操作和跨具身形态学习成为可能 [142, 372, 435]。

另一个显著趋势是真实机器人数据集中感知模态的日益丰富。除了标准的视觉-本体感觉-动作接口外, 几个数据集还纳入了额外的信号,以捕捉仅从图像中无法可靠推断的物理交互方面。触觉感知已成为接触丰富和灵巧操作的重要补充模态, 因为它提供了关于接触位置、压力分布、初始滑动、抓取稳定性以及

8

第 9 页

表 1 真实机器人操作数据集的统计数据和关键属性。“Embod.”表示不同的具身形态类型数量;“Calib.”表示校准后的相机外参。“Dex.”表示灵巧手数据。“Anno.”表示片段内的子任务标签;“Mobile”表示移动操作数据。在“Arm”列中,‘S’、‘D’、‘H’分别表示单臂、双臂和人形具身形态。

数据集 时间 机械臂 具身形态 轨迹/小时 任务 模态 校准 灵巧手 标注 移动

Pinto and Gupta [275] 2015 S 1 50K / 700 1 RGB; 本体感觉; 动作; 抓取 成功 ✗ ✗ ✗ ✗ DAML [407] 2018 S 2 2.9K / 4.08 3 RGB; 本体感觉; 动作 ✗ ✗ ✗ ✗ MIME [308] 2018 S/D 1 8.3K / 13.7 20 RGB-D; 本体感觉 ✗ ✗ ✗ ✗ QT-Opt [169] 2018 S 1 580k / 800 1 RGB; 本体感觉; 动作; 抓取 成功 ✗ ✗ ✗ ✗ RoboTurk [248] 2018 S 3 2.1K / 111.3 3 RGB-D; 本体感觉; ✗ ✗ ✗ ✗ RoboNet [75] 2019 S 7 162k / 833.3 – RGB; 本体感觉; 动作 ✗ ✗ ✗ ✗ MT-Opt [170] 2021 S 1 800k / – 12 RGB; 本体感觉; 动作 ✗ ✗ ✗ ✗ BridgeData [91] 2021 S 1 7.2k / – 71 RGB; 本体感觉; 动作 ✗ ✗ ✗ ✗ BC-Z [154] 2022 S 1 26K / 125 100 RGB; 本体感觉; 动作; 语言 ✗ ✗ ✗ ✗ RT-1 [24] 2022 S 1 130K / – 700+ RGB; 本体感觉; 动作; 语言 ✓ FurnitureBench [134] 2023 S 1 5.1K / 219.6 9 RGB-D; 本体感觉; 动作 ✗ ✗ ✗ ✗ RGB-D; 本体感觉; 动作; 语言; 触觉; 力; ✓ ✗ ✗ ✗RH20T [95] 2023 S 4 110K / – 147 音频 RoboSet [16] 2023 S 1 98.5K / – 48 RGB-D; 本体感觉; 动作; 语言; 力; 扭矩 ✗ ✓ ✗ BridgeData V2 [347] 2023 S 1 60.1K / – 13 RGB; 本体感觉; 动作; 语言 ✗ ✗ ✗ ✗ Open X-Embodiment [64] 2023 S/D 22 2.4M / – 527 RGB-D; 本体感觉; 动作; 语言; 力 ✗ ✗ ✗ ✗ ALOHA Unleashed [439] 2024 D 1 26.2K / – 5 RGB; 本体感觉; 动作 ✗ ✗ ✗ ✗ DROID [173] 2024 S 1 76K / 350 86 RGB; 本体感觉; 动作; 语言 ✓ ✗ ✗ ✗ EgoMimic [171] 2024 D 1 1K / 12 3 RGB; 本体感觉; 动作 ✓ ✗ ✗ ✗ FMB dataset [240] 2024 S 1 22.6K / – 2 RGB-D; 本体感觉; 动作; 力; 扭矩 ✗ ✗ ✗ ✗ RoboMIND [366] 2024 S/D 4 107K / 305.5 479 RGB; 本体感觉; 动作; 语言; 失败标签 ✓ ✓ ✓ ✗ AgiBot World Beta [26] 2025 D 1 1M / 2976.4 217 RGB-D; 本体感觉; 动作; 语言; 力 ✓ ✓ ✓ ✓ REASSEMBLE [323] 2025 S 1 4.6K / 13.02 121 RGB; 本体感觉; 动作; 音频; 力; 扭矩 ✓ ✗ ✓ ✗ PH2D [283] 2025 H 1 1.6K / – – RGB; 本体感觉; 动作; 语言 ✗ ✓ ✗ ✗ AIST-Bimanual [257] 2025 D 1 10.7K / – 119 RGB; 本体感觉; 动作; 语言 ✗ ✗ ✗ ✗ ActionNet [98] 2025 H 3 30K / 140 – RGB-D; 本体感觉; 动作; 语言 ✗ ✓ ✗ ✗ MotionTrans [411] 2025 S 1 1.5K / – 15 RGB; 本体感觉; 动作; 语言 ✗ ✓ ✗ ✗ Open Galaxea [162] 2025 D 1 20.5K / 500 150 RGB-D; 本体感觉; 动作; 语言 ✗ ✗ ✓ ✓

RealSource World [292] 2025 D 1 26.7K / – 35 RGB; 本体; 动作; 语言; 力; 扭矩 ✓ ✗ ✓ ✗ RoboCOIN [372] 2025 D 15 180K / – 421 RGB-D; 本体; 动作; 语言 ✗ ✓ ✓ ✗ Humanoid Everyday [440] 2025 H 2 10.3k / 27.8+ 260 RGB-D; 本体; 语言; 触觉; 激光雷达; IMU; 里程计 RoboMIND 2.0 [142] 2026 S/D 6 310K / 1000+ 739 RGB-D; 本体; 动作; 语言; 触觉; 力; 扭矩; 失败标签 ✓ ✓ ✓ ✓ DECO-50 [203] 2026 D 1 8K / 50+ 28 RGB; 本体; 动作; 触觉 ✗ ✓ ✗ ✗ Dexora [435] 2026 D 1 12.2K / 40.5 200 RGB; 本体; 动作; 语言 ✗ ✓ ✗ ✗ MolmoAct2-BimanualYAM [97] 2026 D 1 34.5K / 720 736 RGB; 本体; 动作; 语言 ✗ ✗ ✗ ✗ MolmoAct2-SO100/101 [97] 2026 S 2 38K / 184 1315 RGB; 本体; 动作; 语言 ✗ ✗ ✗ ✗ AgiBot World 2026 [335] 2026 D 1 20.7K / – – RGB-D; 本体; 动作; 语言; 触觉 ✓ ✓ ✓ ✓ Unitree UnifoLM-WBT [294] 2026 H 1 4.5K / 30.74 14 RGB; 本体; 动作; 语言 ✗ ✓ ✗ ✓ Open-H-Embodiment [264] 2026 S/D 20 125.8K / 780 33 RGB; 本体; 语言 ✗ ✗ ✗ ✗ Baihu-VTouch [145] 2026 S/D 3 – / 1000+ 380+ RGB-D; 本体; 动作; 语言; 触觉 ✗ ✓ ✗ ✓ LET-Base-Dataset [186] 2026 H 2 91.5K / 1000+ 31 RGB-D; 本体; 语言; IMU ✗ ✓ ✓ ✗ LET-Dex-Dataset 2026 H 1 3K / 20 14 RGB-D; 本体; 语言; 触觉; 力; 扭矩; IMU ✗ ✓ ✗ ✗ Haptile [4] 2026 S 1 1.7K / 12.5 38 RGB; 本体; 动作; 语言; 触觉 ✗ ✗ ✗ ✗ OmniViTac [444] 2026 S 1 21.9K / – 86 RGB-D; 本体; 动作; 语言; 触觉 ✗ ✗ ✗ ✗ ABC-130K [5] 2026 D 1 130.7K / 3591 197 RGB; 本体; 动作; 语言; 扭矩 ✗ ✗ ✓ ✗

物体-手交互状态 [4, 95, 142, 203, 440, 444]。相比之下,力和扭矩测量通常表征手腕、夹爪或机器人关节处的净交互力矩,提供了接触力和交互动力学的更全局视角 [95, 240, 323]。音频可以进一步提供关于碰撞、摩擦和任务进展的补充线索 [95, 323]。全身平台可能还包括 IMU、激光雷达和里程计信号,以表示平衡、运动学和空间导航 [186, 440]。这些更丰富的多模态观测不仅使得对机器人和环境交互的表征更加全面,也增加了数据集之间的异构性。

本体感知和动作表示在不同具身形态之间也存在显著差异。固定基座机械臂通常记录关节位置(qpos),表示为关节坐标的有序向量,或末端执行器

9

第 10 页

(EEF) 位姿,由腕部或工具的笛卡尔位置和方向表示,以及夹爪状态。相应地,动作通常以关节空间或笛卡尔 EEF 空间表示 [16, 64, 75, 91, 95, 134]。灵巧手由于其高维铰接结构,通常通过手指关节位置表示 [203, 366, 372, 435],有时辅以指尖位姿以促进与人类数据的对齐 [101, 391, 443]。移动和仿人平台进一步纳入基座速度、躯干配置和全身关节状态 [103, 142, 294, 440]。

这些差异不仅影响学习问题的维度,还影响数据在不同平台间共享的程度。关节空间表示为铰接手提供直接且精确的控制,但与机器人形态紧密相关。相比之下,以末端执行器为中心的表示可以为跨具身形态的手臂运动提供更可迁移的接口,尽管它们仍需要一致的坐标系和控制约定。在策略学习中,本体感受状态和动作通常经过归一化,以维持合适的数值尺度并促进跨具身形态的学习。常见选择包括 MinMax、Q01-Q99 和 MeanStd 归一化 [377]。

2.3 数据收集范式

2.3.1 脚本

脚本式收集广义上指机器人行为在无持续人工控制下执行的数据生成过程。人类精力从手动控制每个回合转移到设计任务逻辑、控制管道和执行条件。这种系统设计与回合级执行之间的分离使得以相对较低的边际成本进行重复和平行数据收集成为可能。根据机器人动作的产生方式,脚本式收集可 broadly 分为基于规则的执行、轨迹回放和自主策略 rollout。

基于规则的执行。在基于规则的收集中,机器人行为通过手动指定的任务逻辑生成,通常实现为动作序列、有限状态机或启发式控制器。任务通常被分解为预定义阶段,例如检测目标、选择交互位姿、接近目标、执行抓取并将物体运送到指定区域。在此管道中,逆运动学、运动规划和轨迹优化可用于将阶段级目标转换为运动学可行且无碰撞的机器人运动,而视觉观测或传感器阈值决定目标位姿并触发阶段间的转换。早期的大规模抓取数据集采用此类结构化管道来执行重复的抓取尝试,并自动记录成功和失败的交互 [75, 275, 355]。基于规则的执行对于目标明确、工作空间结构化且重置机制可靠的任务特别有效。然而,由于任务分解和运动生成过程都依赖于预定义假设,收集到的行为可能表现出有限的多样性,并且可能无法很好地泛化到意外状态或复杂的接触交互中。

轨迹回放。轨迹回放通过重新执行先前记录的机器人运动来收集数据。源轨迹可能来自人类遥操作、力导教学、运动规划或早期的策略 rollout。在回放期间,机器人可以在不同的物体配置或环境条件下重现演示,并可以在初始状态、轨迹或控制参数中引入扰动以增加变化。这种方法减少了对重复人工操作的需求,同时保留了成功演示的整体结构。例如,RoboSet 将人类收集的演示与基于回放的执行相结合,以扩展其真实机器人经验 [16]。然而,回放对原始环境与当前环境之间的差异敏感,因为当物体位置或接触条件发生显著变化时,开环重放可能会失败。因此,通常需要闭环校正和重新规划以确保可靠的重用。

自主策略 Rollout。一种更具适应性的自动化收集形式使用学习到的或启发式策略与环境交互并生成新轨迹。此类策略可通过强化学习、模仿学习或先前的数据收集轮次获得,并随着额外经验的可用而迭代改进。QT-Opt [169] 和 MT-Opt [170] 等大型系统使用自主 rollout 在重复任务执行中收集交互数据,使数据集和策略能够通过持续的数据生成周期得到改进。RoboSet [16] 同样包括启发式策略 rollout,与人类演示和轨迹回放并列。与固定脚本相比,自主

10

第 11 页

轨迹(rollouts)能够响应观测结果并覆盖更广泛的状态,包括策略失败和恢复行为。然而,其数据分布强烈受限于当前策略的能力与探索策略,可能会强化现有偏差或产生大量低质量轨迹。

2.3.2 遥操作

遥操作通过允许人类操作员在任务执行期间持续控制机器人来收集机器人演示。与脚本化采集相比,它能更自然地捕捉适应性、目标导向及接触丰富的行为,特别是在尚无可用的合适控制策略的任务中。如图 5 所示,遥操作系统呈现出多样化的配置。

运动学示教(Kinesthetic Teaching)。运动学示教提供了最直接的人类控制形式:操作员通过物理引导机器人手臂或末端执行器完成期望运动,同时系统记录关节状态、末端执行器位姿和夹爪指令。该方法无需额外的接口硬件,允许操作员通过直接物理交互指定精确轨迹,如 MIME [308] 等数据集所示。它特别适用于固定基座机械臂及需要精确几何引导的任务。然而,对机器人的物理操控会给操作员带来巨大的体力负担,且难以应用于高负载系统、移动平台或复杂的全身具身形态。

主从遥操作(Leader-Follower Teleoperation)。主从系统使用专用的输入机制,其运动被映射到从属机器人上。当主从机器人具有相同或紧密匹配的运动学结构时,关节级对应关系提供了直观且精确的控制接口。该范式已被广泛用于双臂操作,例如 ALOHA 及其后续扩展 [438, 439],以及 AIST-Bimanual [257] 和 Open Galaxea [162] 等大型双臂数据集。GELLO [371] 进一步证明,主操作臂可以实施为低成本、按比例缩放且运动学等效的目标手臂副本,使用 3D 打印组件和廉价执行器,同时保留直接的关节级对应关系。主从控制非常适合协调的双臂行为,因为它保留了双臂之间的时间同步性,并降低了笛卡尔控制的复杂性。其主要局限性在于对专用且通常具身特定的硬件的依赖,这限制了跨机器人平台的便携性。

集成式主从遥操作(Integrated Leader-Follower Teleoperation)。集成式主从遥操作将输入设备与控制机器人结合在同一机制中:操作员通过末端执行器手柄操控一个重力补偿手臂,同时系统记录机器人状态、视觉观测和交互信号。该方法提供直接的视觉和力反馈,支持精确的接触丰富操作,并避免了独立主臂的运动学映射误差。消除专用主设备也减少了硬件、校准和工作空间要求。一个典型的实际例子是 ARX AC-One,它最近已被用作双臂操作研究的真实平台 [18, 28]。主要缺点是操作员的手可能出现在训练图像中,但在自主部署期间缺失,从而造成视觉分布偏移。然而,来自人机 [391, 443] 转移的现有证据表明,模型可以在预训练期间学习适应此类差异。

设备中介遥操作(Device-Mediated Teleoperation)。一种更具便携性的替代方案使用通用输入设备,包括 VR 或 XR 控制器、智能手机、SpaceMouse 设备和操纵杆。人类输入通常被解释为笛卡尔末端执行器位姿或速度,并通过逆运动学或底层控制器转换为机器人关节指令。例如,RoboTurk [248] 使用移动设备进行六自由度控制,而 DROID [173] 采用 VR 控制器收集 diverse 环境中的操作演示。SpaceMouse 和力反馈设备也已用于 FMB [240] 和 REASSEMBLE [323] 等数据集。对于移动操作臂,脚踏板可以提供额外的免提控制通道来命令基座运动,允许操作员在保持双手可用于手臂操作的同时导航平台。由于这些设备在很大程度上独立于机器人形态,它们可以在不同操作臂上部署,只需相对有限的硬件修改。然而,其间接控制接口可能会引入延迟、缩放模糊性和精度降低,特别是在协调、高维或接触密集的任务中。

基于视觉的遥操作(Vision-Based Teleoperation)。基于视觉的系统直接从 RGB 或

11

第 12 页

RGB-D 观测,无需物理标记或专用可穿戴传感器。估计的位姿随后在考虑运动学可行性和关节约束的情况下重定向至机器人。此类方法既支持全身人形机器人控制,也支持灵巧手遥操作。例如,HumanPlus [102] 将单目估计的人类运动迁移至人形机器人,而 DexPilot [130] 和 Anyteleop [281] 将视觉估计的人类手部运动映射至灵巧机器人手。通过减少对专用传感硬件的需求,基于视觉的遥操作提供了低成本且易用的接口,尽管其性能仍对遮挡、快速运动和位姿估计误差敏感。

可穿戴与动作捕捉重定向。可穿戴系统使用惯性服、光学追踪器、数据手套或手臂和手部外骨骼等设备捕捉人类运动。这些接口提供的运动测量维度更高且更稳定,优于通用控制器,使其特别适用于双臂、灵巧和全身遥操作。RoboMIND [142, 366] 结合多种遥操作接口(包括动作捕捉系统)以收集跨异构机器人形态的数据,而 RoboCOIN [372] 将可穿戴控制扩展至大量双臂平台。对于灵巧操作,Dexora [435] 等系统使用手臂外骨骼和基于 VR 的手部控制来捕捉协调的手臂和手指运动。全身遥操作系统进一步将人类上半身、 locomotion(移动)和基座运动映射至人形机器人 [294, 440]。所需的映射取决于传感接口以及人类与机器人形态之间的对应程度。基于外骨骼的系统通常提供直接的关节级控制,而数据手套和动作捕捉设备通常需要进行校准和运动学重定向,以应对尺度、关节范围和形态的差异。

反馈机制。反馈机制构成了遥操作系统设计的另一个重要维度。视觉反馈通过外部或第一人称视角摄像头向操作员提供环境、物体和机器人状态的观测。沉浸式系统进一步采用立体显示和头部追踪主动视点以改善深度感知和空间意识 [59, 86]。力反馈通过双边主从设备、触觉控制器或外骨骼将机器人与环境的交互力或末端执行器阻力传输给操作员,从而在插入、组装和其他力敏感任务中实现更精确的接触控制 [323, 421]。触觉反馈通过振动、压力或指尖刺激等方式传达手指或抓取接口处的局部接触事件,帮助操作员感知接触起始并调整抓取行为 [4, 86, 421]。这些反馈通道的集成提高了遥操作的准确性、稳定性和操作员意识,实现了更自然的控制和更高质量的数据演示,特别是在接触丰富的任务中。

2.3.3 人在回路增强

人在回路增强是一种迭代式的真机数据收集范式,其中人类监督者在策略执行期间介入,并在困难或易出错的状态下记录纠正动作。与重复收集完整演示不同,它选择性地用策略诱导的状态、失败案例和恢复轨迹来扩充数据集,这些内容在原始训练数据中代表性不足。

遵循 DAgger [297] 引入的数据集聚合原则,机器人学习方法已逐步提高了该过程的效率和可扩展性。Intervention Weighted Regression [249] 通过远程遥操作收集纠正性演示,并在训练期间增加其贡献。ThriftyDAgger [135] 根据状态新颖性和估计失败风险选择性请求协助,而 Sirius [220] 持续整合在机器人部署期间收集的干预数据。Fleet-DAgger [136] 将此收集过程扩展至多个并发运行的机器人。在灵巧操作中,DexCap [348] 记录策略 rollout 期间的人类接管和残余纠正。InterveneGen [137] 随后通过从少量人类干预中生成额外的纠正轨迹来提高数据效率。最近,CR-DAgger [385] 收集用于接触丰富操作的合规性 delta 动作纠正,而无需完全中断自主执行。总体而言,人在回路增强将真机部署过程中遇到的错误转化为针对性的训练数据,在提高挑战性状态覆盖范围的同时减少了对完整轨迹演示的需求。

2.4 规模与多样性

过去十年中,真机数据的规模显著增加。早期数据集通常在 narrowly defined(狭窄定义)的任务分布内积累大量交互。例如,Pinto 和 Gupta [275]

12

第 13 页

以及 QT-Opt [169] 收集了数万至数十万次的抓取试验,但主要集中于单一行为。随后的工作扩展了轨迹数量以及任务范围。MT-Opt [170] 包含约 80 万个回合(episodes),涵盖 12 项任务;而 RT-1 [24] 和 RoboMIND [366] 分别以 13 万和 10.7 万条轨迹覆盖了数百种操作技能。更近期的数据集已达到百万级收集量或数千小时的交互时长。AgiBot World Beta [26] 报告了 100 万条轨迹和近 3,000 小时的数据,而 RoboMIND 2.0 [142] 包含 739 项任务下的超过 31 万条轨迹以及超过 1,000 小时的执行时间。Open X-Embodiment [64] 等跨数据集倡议进一步聚合了来自多个机构和机器人平台的超过 200 万条轨迹。

对于策略学习而言,数据多样性往往比轨迹的原始数量更为关键,因为它决定了训练期间所表示的状态、行为和交互条件的范围。因此,近期真实机器人数据集的一个明显趋势是任务覆盖范围的扩展,从抓取或组装等定义狭窄的行为,扩展到数百种家庭、工业、移动操作和灵巧操作任务 [97, 142, 372, 435]。这种任务多样性伴随着物体、场景布局、初始配置和相机视角的日益变化,从而提供了更广泛的部署时遇到的状态分布覆盖。同时,数据集越来越多地跨越异构具身形态,包括单臂和双臂机械臂、移动平台、人形机器人和灵巧手,以及更丰富的感知模态,如 RGB-D、力和力矩、音频、IMU、激光雷达和里程计 [64, 142, 372, 440]。总之,任务、环境、具身形态和模态的多样性为学习在狭窄的数据收集设置之外更具鲁棒性和可迁移性的策略奠定了基础。

除了任务、具身形态和模态的多样性外,轨迹级多样性捕捉了演示中执行同一名义任务时的变化。这种变化可能源于初始和终止状态、运动路径、接触序列和执行速度的差异,从而拓宽了每个任务内覆盖的状态-动作分布。图 4 中关键帧的笛卡尔分布直观地展示了由此产生的空间覆盖和分布结构的差异。在所示示例中,AgiBot-World-2026 [335] 表现出几个分离良好的空间簇,表明覆盖了不同的工作空间区域和交互高度。RoboMIND [366] 显示出更紧凑且各向异性的分布,而 RoboMIND 2.0 [142] 则呈现出更广泛、部分连接且垂直分层的空间覆盖。

2.5 优势与局限

真实机器人数据通过直接捕捉机器人观察、动作及其物理后果之间的关系,提供了基于物理的监督。与仿真或人类视频相比,它们自然地反映了真实的感知噪声、控制延迟、接触动力学和硬件约束。此外,记录的动作可直接在相应平台上执行,使得此类数据对于学习可靠的操作策略和恢复行为具有特别高的价值。

主要局限在于收集成本高昂。真实机器人数据需要物理硬件、人工操作或自动化收集管道、重复的环境重置、维护以及安全监督,这限制了大规模和并行的数据获取。此外,许多数据集仍集中于特定的机器人、任务和环境中。具身形态、传感器配置、坐标系和动作表示的差异进一步复杂化了数据聚合和跨平台迁移。

要点

真实机器人数据位于金字塔顶端:它提供直接的机器人控制信号,以及机器人与真实世界之间物理交互的观察。我们认为,未来的真实机器人数据发展应沿三个方向进行。首先,遥操作系统应支持更简单、更平滑且更直观的控制,同时保留细粒度轨迹和直接物理交互反馈。在这方面,集成式主从遥操作(Integrated Leader-Follower Teleoperation)因其相对较低的硬件成本、易用性以及流畅演示收集能力,提供了一个有前景的方向。其次,真实机器人数据集应捕捉场景、物体和环境条件中更广泛的野外(in-the-wild)变化。AIGC 可能通过合成具身特定数据或增强场景和观察来补充物理收集,从而扩展环境

13

第 14 页

无需成比例增加现实部署即可实现多样性。第三,数据收集应从人类遥操作扩展到包括策略 rollout(执行),这反映了具身智能体在其自身诱导的状态分布下如何探索物理世界。在这些 rollout 期间的人机交互干预可以将失败转化为恢复轨迹,为错误纠正、任务延续和提高策略鲁棒性提供监督。

3 UMI 数据

3.1 数据概览

通用操作接口(UMI)数据指通过便携式、与机器人无关的接口收集的一系列真实世界操作数据集,而非直接操作目标机器人 [62]。典型的 UMI 系统集成一个或多个摄像头、手持夹具或灵巧接口,以及姿态追踪模块,以记录视觉观测、末端执行器运动、夹具状态,以及在某些最新系统中记录力或触觉信号。这些演示可以通过校准、动作转换和特定具身形态的重定向(Retargeting)转换为机器人兼容的轨迹。

与人类第一人称视角视频相比,UMI 数据保留了真实世界操作的自然第一人称观测,同时提供了同步的末端执行器姿态、夹具状态和校准后的动作轨迹。这些结构化信号产生了高质量、物理上忠实且易于用于机器人策略学习的演示数据,并可通过适当的重定向实现跨具身形态部署。自原始 UMI 系统以来,这一范式已从单臂夹具操作 [229, 441] 扩展到双臂系统 [261]、灵巧手 [333, 383, 384]、移动平台 [125]、多视角感知、3D 传感以及触觉或力感知数据收集 [191, 368, 453]。如表 2 所示,UMI 风格的数据集涵盖了日益增长的具身形态、传感模态、任务和收集规模。

3.2 UMI 数据收集流程

3.2.1 UMI 风格系统的演进

UMI 风格系统的演进首先体现在物理收集接口的设计上。原始 UMI 建立了一种基于便携式手持夹具的无机器人收集范式,该夹具集成了腕部摄像头、姿态追踪和夹具状态传感,以在自然人类演示期间捕获同步的观测和动作 [62]。后来的系统改进了该设计的便携性、模块化程度和部署便利性。例如,FastUMI [441] 简化了硬件和追踪流程,以减少设置工作量并支持更高效的规模化收集,而 LEGATO [303] 引入了一种抓取工具接口,旨在为不同的机器人平台提供一致的演示表示。更近的系统进一步重新考虑了用户如何与收集设备进行物理交互。与传统的 UMI 接口(操作员握住夹具形状的工具并通过扳机控制其开合)不同,FreeTacMan [369] 采用指戴式接口,允许操作员通过自然的手指运动直接控制夹具。这一进展反映了从机械中介的手持工具向更自然、可穿戴和接触感知的收集接口的更广泛转变。

UMI 风格系统产生的数据在具身形态、传感模态和规模方面也变得越来越多样化。早期的 UMI 数据集主要关注具有平行夹具和腕部视角 RGB 观测的单臂操作。随后的工作将该范式扩展到移动操作器和全身人形系统,如 UMI on Legs [125] 和 HuMI [261],以及双臂操作和灵巧手 [333, 384]。

观测空间同样从单目腕部视角图像扩展开来。MV-UMI [291] 引入了额外的摄像头视角,而 UMI-3D [362] 包含了显式的 3D 空间观测。ViTaMIn [218]、FreeTacMan [369]、exUMI [386] 和 ManipForce [182] 进一步用触觉或力相关测量值增强视觉轨迹,从而能够收集富含接触的操作数据。同时,收集效率的提高使数据集规模从数百个特定任务的演示增加到包含数万甚至数十万条轨迹的集合,例如

14

第 15 页

表 2 UMI 数据集的统计数据和关键属性。这些是使用便携式手持接口收集的真实世界操作数据集,支持跨不同任务和环境的可扩展、低成本演示收集。

数据集 时间 机械臂类型 任务 末端执行器 演示数量 触觉

UMI [62] 2024 单臂/双臂 5 夹爪 2.5K ✗ ManiWAV [229] 2024 单臂 5 夹爪 1.0K ✗ UMI on Legs [125] 2024 单臂 2 夹爪 514 ✗ FastUMI [441] 2024 单臂 22 夹爪 9.0K ✗ Data Scaling Laws [211] 2024 单臂 6 夹爪 24.1K ✗ LEGATO [303] 2024 单臂 6 夹爪 900 ✗ ViTaMIn [218] 2025 单臂 8 夹爪 841 ✓ DexWild [333] 2025 单臂 10 灵巧手 9.5K ✗ DexUMI [384] 2025 单臂 5 灵巧手 1.8K 力/力矩 FreeTacMan [369] 2025 单臂 50 夹爪 10K ✓ Touch in the Wild [453] 2025 单臂 20 夹爪 2.7K ✓ exUMI [386] 2025 单臂 8 夹爪 1.7K ✓ MV-UMI [291] 2025 单臂 4 夹爪 1.4K ✗ ManipForce [182] 2025 单臂 6 夹爪 597 力/力矩 FastUMI-100K [224] 2025 单臂 32 夹爪 100K ✗ ViTaMIn-B [191] 2025 单臂 4 夹爪 884 ✓ HuMI [261] 2026 双臂 5 夹爪 827 ✓ RealOmni 2026 双臂 多样化 夹爪 789.8K ✓ UMI-3D [362] 2026 单臂 3 夹爪 4.6K ✗ TAMEn [368] 2026 双臂 4 夹爪 724 ✓ Daimon-Infinity 2026 双臂 多样化 夹爪 274.7K ✓

如 FastUMI-100K [224] 所示。总体而言,UMI 风格的数据已从单臂视觉轨迹演变为更广泛的大规模、多模态和多具身形态操作数据类。

3.2.2 相对轨迹动作表示

由于 UMI 演示是在不直接操作目标机器人的情况下收集的,因此它们不包含特定具身形态的关节状态或关节空间动作。相反,UMI 结合腕部摄像头、机载 IMU 和视觉-惯性 SLAM 来估计手持夹爪的六自由度位姿轨迹及其开合状态。为了降低对全局跟踪框架的敏感性,未来末端执行器目标相对于当前末端执行器位姿进行表示。这种相对轨迹表示保留了演示运动的空间结构,同时减少了执行过程中的误差累积。它还提供了一个与具身形态无关的动作空间,可以通过校准、逆运动学和底层控制映射到不同的机器人平台。

3.3 跨具身形态部署

跨具身形态部署旨在将从无机器人 UMI 演示中学习到的策略转移到具有不同运动学结构和传感配置的机器人上。其核心思想是将与具身形态无关的任务表示与特定具身形态的执行分离开来。UMI 风格的策略不在与特定机器人绑定的关节空间命令中进行预测,而是在以末端执行器为中心的动作空间中运行,通常产生相对六自由度轨迹和夹爪命令。在部署期间,预测的相对轨迹与机器人的当前末端执行器位姿组合,并转换为机器人基座坐标系。生成的目标位姿随后通过逆运动学、运动规划或底层笛卡尔控制器转换为可执行的关节命令。

这种部署策略已扩展到具有越来越不同形态的机器人。LEGATO [303] 将演示映射到运动不变的任务空间,并通过全身逆运动学将预测的夹爪运动重定向到不同的固定基座和移动机械臂。然而,对于灵巧操作,仅转移腕部轨迹是不够的,因为人类和机器人的手在手指形态、自由度和视觉外观上存在显著差异。DexUMI [384] 通过可穿戴外骨骼解决这些差距,该外骨骼将人类运动约束为机器人可行的手部配置,并结合视觉修复技术,在演示图像中将人手替换为目标机器人手。其他系统通过使用可在收集接口和机器人之间共享的模块化摄像头或触觉传感器来提高部署一致性 [191, 368]。这些方法逐步扩展了 UMI 数据

15

第 16 页

从夹爪级传输转向跨具身形态部署,涵盖多种机械臂、移动操作机械手和灵巧手。

3.4 优势与局限

UMI 数据的主要优势在于其可扩展性、环境多样性以及对特定机器人具身形态依赖的降低。特别是,其便携且无需机器人的采集设置使得在野外多样化日常环境中获取数据成为可能。人类操作员可以在多样化的现实场景中收集平滑且自然的操控演示,而以末端执行器为中心的动作表示促进了在不同机器人平台间的复用。近期纳入双臂运动、灵巧手和触觉感知的扩展进一步拓宽了 UMI 风格系统所捕捉的行为范围。

然而,UMI 数据并未完全消除具身形态差距。相机视角、末端执行器几何形状、运动学约束、动力学特性以及接触条件的差异可能导致演示与机器人执行之间的偏差。其质量还依赖于准确的姿态跟踪和传感器同步,这在遮挡、快速运动或视觉挑战性环境下可能会退化 [362]。此外,UMI 通常缺乏特定于机器人的本体感觉和执行器动力学信息。因此,它最好被视为特定具身形态真实机器人数据的可扩展补充,而非完全替代品。

要点

UMI 风格数据通过便携、无需机器人的接口 bridging 人类演示与机器人执行,以远低于遥操作的成本提供明确的末端执行器动作结构。然而,其可靠性受限于脆弱的视觉跟踪和校准、缺乏机器人执行时验证轨迹质量的困难,以及接触丰富任务中缺乏力反馈。

4 第一人称与第三人称数据

4.1 数据概览

第一人称和第三人称数据位于具身数据金字塔的中间层,相比仿真数据提供更真实的现实世界观察和物理交互,但相比 UMI 数据,其与机器人执行的直接对齐度较低。大多数第一人称数据集依赖于佩戴在头部或身体上的相机,跟随佩戴者并保持正在进行的活动在视野内。然而,这种移动视角可能导致交互的关键方面未被观察到:手部可能遮挡接触区域,而身体的大部分和周围场景可能保持在帧外。因此,通常添加同步的第三人称相机以提供互补视角和更完整的记录。此类数据易于扩展,具有高多样性、可复用性和物理保真度,但其质量往往受限于单相机捕获的约束。

除了 RGB 视频外,第一人称数据集可以通过三种互补途径进行丰富:采集过程中的多模态传感、录制流的后期处理以及转换为面向机器人的表示。在采集过程中,额外的硬件提供互补信号:H2O [181] 记录同步的 RGB-D 视图。HoloAssist [356] 将 RGB 和深度与头部跟踪、手部跟踪、视线和音频相结合。EgoEMG [378] 记录肌肉活动,而 FEEL [85] 测量施加的力,EgoTouch [449] 提供触觉压力。

后期处理进一步增加了语义和几何结构。在 EPIC-KITCHENS [72, 73] 中,旁白和手动注释生成了动作片段和动宾标签。HOT3D [11] 使用校准的运动捕捉来获取手部和物体姿态。EgoDex [138] 结合头戴式跟踪与 SLAM 以恢复相机和手部轨迹。

最后,获取面向机器人的表示需要将人类运动映射到机器人兼容的动作空间:EgoMimic [171] 将跟踪的人类手部轨迹与机器人演示对齐,而 EgoVLA [391] 使用逆运动学和重定向将人类手腕和手部姿态映射到机器人动作。图 6 说明了捕获基础设施和监督类型。表 3 总结了代表性第一人称和第三人称数据集及其关键特征。

16

第 17 页

表 3 第一人称视角和第三人称视角数据集的统计数据和关键属性。模态仅包括作为每个数据集一部分报告的语义、注视和交互注释;交互包括接触、力、触觉和手物注释。“Cam. Calib.”、“Hand Pose”和“3D”分别表示提供的相机校准参数、关节级帧手部姿态和度量 3D 监督。

数据集 年份 视角 小时/片段 模态 相机校准 手部姿态 3D

EgoHands [10] 2015 第一人称 -/48 语义 ✗ ✗ ✗ KrishnaCam [322] 2016 第一人称 70.2/460 – ✗ ✗ ✗ FPHA [110] 2017 第一人称 -/1,175 语义 ✓ ✓ ✓ Charades-Ego [319] 2018 第一人称+第三人称 68.8/7,860 语义 ✗ ✗ ✗ EGTEA Gaze+ [206] 2018 第一人称 28/86 语义;注视 ✗ ✗ ✗ EPIC-KITCHENS v1 [72] 2018 第一人称 55/432 语义 ✗ ✗ ✗ EPIC-KITCHENS-100 [73] 2020 第一人称 100/700 语义;交互 ✗ ✗ ✗ Ego4D [118] 2021 第一人称 3,670/- 语义;注视;交互 ✗ ✗ ✓ H2O [181] 2021 第一人称+第三人称 -/- 语义;交互 ✓ ✓ ✓ Assembly101 [302] 2022 第一人称+第三人称 513/- 语义 ✓ ✓ ✓ HOI4D [227] 2022 第一人称 -/4,000 语义;交互 ✓ ✓ ✓ ARCTIC [93] 2023 第一人称+第三人称 -/339 交互 ✓ ✓ ✓ AssemblyHands [270] 2023 第一人称+第三人称 -/- – ✓ ✓ ✓ CaptainCook4D [272] 2023 第一人称 94.5/384 语义;交互 ✗ ✗ ✓ Ego-Exo4D [119] 2023 第一人称+第三人称 1,286/5,035 语义;注视 ✓ ✓ ✓ ENIGMA-51 [287] 2023 第一人称 22/51 语义;交互 ✗ ✓ ✗ HoloAssist [356] 2023 第一人称 166/2,221 语义;注视 ✓ ✓ ✓ EgoExo-Fitness [207] 2024 第一人称+第三人称 32/1,276 语义 ✗ ✗ ✗ EgoExoLearn [148] 2024 第一人称+第三人称 120/747 语义;注视 ✗ ✗ ✗ EgoSurgery [104] 2024 第一人称 15/21 语义;注视 ✗ ✗ ✗ HOT3D [11] 2024 第一人称 13.9/425 注视;交互 ✓ ✓ ✓ IndustReal [299] 2024 第一人称 5.8/84 语义;注视 ✗ ✓ ✓ EgoDex [138] 2025 第一人称 829/338,000 语义 ✓ ✓ ✓ Egocentric-100K [1] 2025 第一人称 100,405/2.01M – ✓ ✗ ✗ EgoLife [390] 2025 第一人称+第三人称 266/- 语义;注视 ✗ ✗ ✓ EgoMe [282] 2025 第一人称+第三人称 82.8/15,804 语义;注视 ✗ ✗ ✗ HD-EPIC [274] 2025 第一人称 41.3/156 语义;注视;交互 ✓ ✓ ✓ IndEgo [40] 2025 第一人称+第三人称 293.9/- 语义;注视 ✓ ✓ ✓ OpenEgo [157] 2025 第一人称 1,107/- 语义;交互 ✓ ✓ ✓ TASTE-Rob [436] 2025 第一人称 -/100,856 语义;交互 ✗ ✗ ✗ ChildLens [327] 2026 第一人称 108.58/354 语义 ✗ ✗ ✗ Ego-1K [183] 2026 第一人称 -/956 – ✓ ✗ ✗ EgoLive [205] 2026 第一人称 1,680/- 语义;交互 ✓ ✓ ✓ EgoMAGIC [343] 2026 第一人称 -/3,355 语义;交互 ✗ ✗ ✗ EgoVerse [278] 2026 第一人称 1,362/- 语义;交互 ✗ ✓ ✓ HumanNet [81] 2026 第一人称+第三人称 967,000/- 语义 ✗ ✓ ✓ Open-AoE [209] 2026 第一人称 2,000/- 语义;交互 ✓ ✓ ✓ Xperience-10M [296] 2026 第一人称 10,000/- 语义;交互 ✓ ✓ ✓

4.2 采集基础设施

第一人称和第三人称采集系统结合可穿戴设备和环境设备,以测量外观、几何形状、运动、注意力和物理交互。我们根据硬件所观察的物理量对其进行组织:视觉传感器记录图像和深度流,运动跟踪系统测量设备或身体的运动学,辅助传感器揭示注意力、肌肉激活和接触。在这些类别中,主要的权衡涉及空间覆盖范围、时间分辨率、移动性、侵入性、准确性和校准要求。

4.2.1 视觉感知

可穿戴相机。单目 RGB 采集使用单个彩色相机,通常安装在头部或胸部,以近似佩戴者的视觉流。此类相机轻便、廉价,适合长时间采集,正如 EPIC-KITCHENS [72, 73] 和 Ego4D [118] 所演示的那样;然而,它们不能直接测量度量深度,快速头部运动可能会引入模糊,而手部可能会遮挡被操作的对象。

立体 rigs 则使用两个具有已知基线的同步相机,从双目视差估计深度。它们避免主动照明,但需要精确校准,并且在无纹理或

17

第 18 页

捕获基础设施监督领域 语义几何 自视角相机 肌电图 任务:打开微波炉 动作:张开手 姿态 物体姿态 外视角相机 惯性测量单元 触觉 b b

多模态机器人导向

触觉压力分布 任务对齐演示

b b

图 6 自视角和外视角数据中捕获基础设施和监督表示的概览。可穿戴和外部相机、运动追踪器以及辅助传感器记录互补的原始信号,随后经过注释、重建或对齐,形成语义、几何、多模态和机器人导向的监督信号。

遮挡区域。例如,HOT3D [11] 利用 Project Aria 和 Quest 3 的车载多相机配置,从略有不同的视角观察手部和物体。RGB-D 相机将彩色图像与逐像素深度配对,提供更直接的 3D 测量,但具有设备依赖的范围以及对反射表面或强环境光的敏感性。H2O [181] 同步自视角和外视角 RGB-D 视图,而 HoloAssist [356] 使用 HoloLens 2 记录 RGB 和深度。

事件相机采取不同的方法:每个像素异步报告亮度变化,而不是以固定速率产生常规帧。其高时间分辨率减少了快速手部运动期间的运动模糊,但产生稀疏数据,需要专门的处理;EgoEV-HandPose [351] 使用立体事件相机探索了这一设置。

外视角相机系统。外视角系统在环境中放置一个或多个相机,从固定的第三人称视角观察佩戴者。它们揭示了可能被遮挡或超出可穿戴相机视场的身体、手部和场景上下文,同步视图支持三角测量和多视角重建。Assembly101 [302] 结合可穿戴和外部相机进行细粒度的组装活动,而 Ego-Exo4D [119] 将 Project Aria 眼镜与多个周围的 GoPro 相机配对。额外的覆盖范围以环境设置、跨相机校准和同步、更高的存储需求以及降低的采集移动性为代价。

4.2.2 运动和姿态追踪

惯性身体追踪。惯性测量单元 (IMU) 结合加速度计和陀螺仪,有时还有磁力计,以测量线性加速度和角速度。IMU 紧凑且在视觉遮挡下仍可用,但方向估计以及尤其是位置估计在随时间积分测量时会累积漂移。Ego-Exo4D [119] 记录内置在 Project Aria 中的 IMU,而 WEAR [22] 分发身体佩戴的 IMU 以捕捉户外活动动态。全身惯性动作捕捉系统通过在整个身体上放置多个同步的 IMU 并将它们的测量值拟合到关节骨架,扩展了这一想法。Nymeria [245] 结合 Project Aria 和手腕佩戴的 miniAria 设备以及 Xsens 套装,在没有外部相机阵列的情况下捕捉头部、手部和身体运动,尽管套装增加了拟合和身体特定校准的工作量。

手部佩戴追踪设备。手部佩戴追踪器将磁性、惯性、柔性或光学传感器放置在手指、手部或手腕上,以获得与姿态相关的测量值,如传感器方向、手指弯曲、指尖位置和手腕运动。这些测量值通过设备校准、传感器融合或运动学拟合转换为关节手部姿态;因此,它们应被视为基于传感器的姿态

18

第 19 页

捕获而非未处理的姿态标签。FPHA [110] 在指尖附着六个磁传感器,即使在手指被视觉遮挡的情况下也能恢复关节手部运动,尽管附近的金属和电磁干扰可能会扭曲测量结果。DexGloveHOI [178] 则将第一人称图像与手套安装的 6-DoF IMU 和动作捕捉参考姿态同步,用于视觉惯性 3D 手部跟踪。与仅基于图像的估计相比,仪器化可穿戴设备在手-物严重遮挡的情况下通常能提供更连续、更准确的 3D 手部运动。然而,它们的可扩展性仍受限于手部形状校准、传感器位移、磁干扰或惯性漂移,以及对自然抓握的潜在干扰。

光学与头戴式跟踪。光学动作捕捉使用多个外部相机对可见标记进行三角测量,在校准的工作空间中产生准确的 3D 轨迹。HOT3D [11] 在手部和物体上放置小标记以获得姿态真值,以受控的设置和可能的标记遮挡为代价换取准确性。AR/VR 头戴设备通过设备原生的内向外跟踪提供了更便携的替代方案,该方案融合机载相机和惯性传感来估计头戴设备和手部。EgoDex [138] 使用 Apple Vision Pro 跟踪,而 HoloAssist [356] 使用 HoloLens 2。这些系统减少了外部基础设施,但依赖于专有的跟踪管道,并且在快速运动、遮挡或视野有限的情况下可能会失效。

4.2.3 辅助与交互传感

视线与音频。眼动仪使用面向内部的相机和照明来估计视线方向,提供视觉注意力的线索,但需要针对佩戴者的校准和稳定的头戴设备放置。麦克风记录语音、环境声音和声学接触事件;多通道阵列额外捕获空间信息并支持更稳健的语音记录,但仍对背景噪声和隐私约束敏感。Ego-Exo4D [119] 使用 Project Aria 记录眼动视线和七通道音频,而 HoloAssist [356] 将其视线和音频与视觉和跟踪流同步。

肌电图。肌电图 (EMG) 使用皮肤接触电极来测量由肌肉激活产生的电活动,而不是手部姿态本身。EgoEMG [378] 以高于视频的速率记录双侧手腕 EMG 和 IMU,即使在手部被视觉遮挡时也暴露出运动活动。该信号关于肌肉募集具有信息量,但强烈依赖于电极放置、皮肤接触、参与者生理特征和特定会话的校准。

力与触觉传感。力与触觉设备更直接地测量物理交互。力传感器报告一个或多个位置处载荷的大小或方向,而触觉或压力阵列解析接触如何在区域内分布。FEEL [85] 在指尖和手掌上放置压阻式力传感器,Touch and Go [388] 使用触觉传感器记录视觉探测,而 EgoTouch [449] 将连续的可穿戴压力测量与头部和手腕安装的 RGB 以及双手姿态相结合。这些可穿戴设备提供了仅凭视觉无法获得的接触信号,但有限的传感区域、传感器贴合、针对每个用户的校准、布线以及对自然抓握的干扰可能会限制收集规模和保真度。

4.3 监督构建

第一人称监督可能由传感器记录、由人工标注员添加或通过后处理恢复。我们根据暴露给学习的信息将其分为四个互补类别:语义监督描述任务内容和结构;几何监督描述空间状态和运动;多模态监督提供超出 RGB 的注意力、动态和接触线索;以及面向机器人的监督以旨在用于机器人策略学习的形式表达人类演示。它们的构建结合了标注、校准、同步、重建和跨具身对齐,具有不同的成本和误差来源。

4.3.1 语义监督

动作与语言标注。动作和语言标注识别发生什么活动以及何时发生。常见形式包括叙述、对象引用、动宾动作、动作类别和时间段。参与者叙述被转录并与视频对齐,而动作类别和边界通过人工或模型辅助分配,随后进行人工验证。EPIC-KITCHENS [72, 73],

19

第 20 页

例如,将自由形式的参与者叙述转化为时间上定位的动宾动作。Ego4D [118] 将大规模叙述与针对各个基准测试量身定制的注释相结合,Assembly101 [302] 则提供装配动作的细粒度标签。这些注释支持识别、检索和时间定位,但并未指定执行动作所需的连续运动或接触。

程序与状态注释。程序注释描述各个动作如何组合成任务。它们包括有序步骤、任务进度、执行错误以及物体或环境状态变化,通常通过将视频与任务脚本对齐并验证与预期程序的偏差来构建。Assembly101 [302] 在装配程序中组织细粒度动作,而 CaptainCook4D [272] 则标记烹饪步骤以及错误和物体状态。这种监督揭示了孤立动作标签所遗漏的长视域依赖关系和任务结果,尽管其词汇表通常特定于某个特定程序或领域。

4.3.2 几何监督

相机与场景几何。相机与场景监督建立了交互发生的空间参考。它包括相机内参和外参、深度图、点云、相机姿态和轨迹、场景重建以及点跟踪。深度可以直接测量,如 H2O [181] 中的 RGB-D 观测;其他量则需要校准、视觉惯性 SLAM、多视图重建或跟踪。HOT3D [11] 提供校准后的相机姿态,而 EgoDex [138] 结合头显跟踪与 SLAM 以恢复移动的第一人称相机轨迹。同步的第一人称和外部视角,如 Ego-Exo4D [119] 中的视角,进一步支持可穿戴相机视场之外的重建。由此产生的几何结构对校准漂移、运动模糊和坐标系的选择敏感。

手部和身体姿态。人体姿态监督以多种详细程度发布。手部可编码为 2D 或 3D 关键点、手腕和指尖姿态、关节旋转和轨迹,或 MANO 姿态和形状参数,而身体监督范围从头部和上半身轨迹到完整的关节骨架或参数化身体模型。由于这些表示描述的是输出而非其获取方式,姿态标签可按三种主要构建路线组织。

(1) 注释辅助的几何重建。标注者在单个或多个 RGB 视图中标记 2D 手部或身体关键点。借助已配准的深度,可见关键点可反投影至 3D;借助同步且校准的相机,相应的关键点可在视图间进行三角测量。AssemblyHands [270] 展示了一种可扩展的变体:它从手动标注的子集开始,训练多视图标注模型,将准确的 3D 手部姿态扩展到更大的集合。此路线保留了直接的人工质量控制,但手动标注成本高昂,且其 3D 准确性取决于深度质量、跨视图对应关系和相机校准。

(2) 基于模型的姿态预测与参数拟合。学习到的视觉模型直接从记录的 RGB 或 RGB-D 观测中生成姿态标签。关键点检测器预测 2D 或 3D 关节,而模型恢复网络可回归 MANO 姿态和形状参数或类似的身体模型参数。这些初始预测可用作伪标签,或利用深度、轮廓、多视图一致性、时间约束和参数模型拟合进一步细化。例如,H2O [181] 使用 OpenPose 预测来初始化其手部标注,然后利用同步的多视图 RGB-D 观测优化 MANO 手部模型。此路线更容易扩展到未标注的录制数据,但由此产生的监督继承了由遮挡、运动模糊和域偏移引起的模型误差和偏差。

(3) 基于传感器的姿态捕捉。上述佩戴在手上的、光学的、基于头显的和惯性系统独立于仅基于图像的推理提供姿态相关测量。其信号通过校准、传感器融合或运动学拟合转换为关节姿态。FPHA [110] 使用磁性指尖传感器,HOT3D [11] 将专业光学动作捕捉转换为 UmeTrack 和 MANO 手部注释,EgoDex [138] 从头显跟踪获得上半身和手部轨迹,而 Nymeria [245] 将可穿戴设备与惯性服结合以实现全身运动。仪器化捕捉通常在视觉遮挡下产生更连续和准确的 3D 运动,但增加了校准工作和参与者负担,并且仍然依赖于特定设备的跟踪模型。在所有三种路线中,姿态监督在关节定义、坐标系、时间稳定性和置信度方面存在差异,在比较或组合数据集时应明确报告这些差异。

20

第 21 页

对象与交互几何。以对象为中心的监督描述了被操作对象相对于手和场景的运动方式。典型形式包括对象6自由度位姿、对象轨迹、手-对象相对位姿以及耦合的手-对象轨迹。这些数据通过CAD模型配准、多视图重建、基于标记的运动捕捉、位姿估计或时序跟踪获得。H2O [181] 联合提供RGB-D序列中的手和对象位姿,HOI4D [227] 标注了手-对象交互的空间演变,HOT3D [11] 发布了校准后的手和对象位姿。与语义对象标签不同,这些注释直接揭示了操作几何结构,尽管遮挡和对象对称性可能导致位姿恢复存在歧义。

4.3.3 多模态监督

视线与音频。视线和音频将视觉观察与注意力和声学上下文关联起来。原始视线测量必须经过校准并投影为注视点、关注区域或视线轨迹,而音频必须与视频同步,并可选地与动作或状态变化对齐。EGTEA Gaze+ [206] 提供了与厨房活动对齐的视线,Ego-Exo4D [119] 记录了同步的视线和多通道音频。HoloAssist [356] 同样将视线和音频与指导活动配对。这些线索有助于定位相关对象和事件,但视线校准误差和环境声音可能会削弱其语义对应关系。

惯性信号与生理信号。惯性和生理监督捕捉图像中未明确显示的运动动力学和肌肉活动。IMU流提供加速度和角速度,而EMG测量肌肉激活;其使用需要同步、滤波、归一化和分段,且采样率通常远高于视频。WEAR [22] 将第一人称视频与用于户外活动的身体佩戴式IMU相结合,Ego-Exo4D [119] 包含Project Aria惯性测量数据,EgoEMG [378] 将双侧EMG和IMU流与手部运动配对。这些信号在视觉遮挡下仍然可用,但对传感器放置、漂移和参与者生理特征敏感。

力觉与触觉信号。力觉和触觉监督提供了物理接触的直接证据。根据传感器不同,它可以表示为标量或矢量力、二元接触事件、指尖和手掌压力或空间触觉图。FEEL [85] 将指尖和手掌力测量与第一人称观察同步,Touch and Go [388] 记录了视觉探索与触觉感知的结合,EgoTouch [449] 将可穿戴触觉压力与头部和手腕安装的RGB图像及双手位姿配对。此类测量区分了具有不同接触结果的视觉相似动作,尽管可穿戴传感并不一定能复现机器人的接触几何或力响应。

4.3.4 面向机器人的监督

机器人兼容的动作监督。机器人兼容监督将人类运动映射到目标动作空间,如末端执行器位姿、机器人关节配置、夹爪命令或重定向的灵巧手动作。它是通过坐标变换、逆运动学、形态感知重定向和可行性过滤,从跟踪的手腕、指尖或MANO运动构建而成。例如,EgoVLA [391] 预测手腕位姿和MANO参数,并通过逆运动学和手部重定向将其转换为机器人命令。EgoScale [443] 使用相对手腕运动和重定向的高自由度手部动作对人类预训练进行监督,而MotionTrans [411] 将人类VR运动转换为机器人策略学习。这些目标通常由方法生成,而非作为源数据集的原生注释发布,且几何合理性并不能保证动态可行或接触一致的执行。

人机对齐监督。人机对齐监督关联不同具身形态的演示,而无需相同的原始动作空间。它可以表现为任务或场景匹配的人类和机器人演示、时间对齐的轨迹,或两者映射到的共享表示。EgoMimic [171] 对人类手部演示和机器人演示进行归一化以进行联合策略训练,而EgoScale [443] 使用匹配任务和场景中对齐的人机交互作为中间训练阶段。H-RDT [19] 则将人类手部位姿预训练与特定于机器人的动作适配器相结合,METIS [101] 在一致的动作空间下整合了多种人类和机器人来源。这些示例提供了不同程度的对应关系,而非统一的帧级配对,因此应明确说明对齐的类型和精度。

21

第 22 页

4.4 优势与局限

自我中心(Egocentric)与外部中心(Exocentric)数据能够在无需在目标机器人上执行的情况下,大规模地捕获自然的人类演示。可穿戴系统可部署于不同的参与者、环境、物体和任务中,而第一人称视角的观察则强调手-物交互及长时程的活动结构。与固定基座机器人采集不同,人类操作员可以在环境中自由移动,并直接用灵巧手操作物体。这种机动性实现了更广阔的空间覆盖和更多样的手部轨迹,包括接近方向、运动路径和交互高度的变化。图 4 中的 EgoVerse 示例展示了这一潜力:其人手交互关键帧跨越了广阔的三维工作空间,并表现出显著的空间变化。

然而,自我中心数据并不等同于机器人经验。第一人称录像存在部分可观测性、手-物遮挡、相机快速运动、运动模糊以及依赖设备的视角等问题。密集几何和多模态监督需要额外的硬件、校准、同步和重建,且无法大规模均匀获取。更根本的是,人类录像缺乏机器人本体感觉、执行器动力学和可直接执行的动作。形态、运动学、传感和接触响应的差异进一步阻碍了轨迹的直接迁移。因此,将其用于机器人学习需要可靠的状态重建、具身感知表示以及人机对齐或重定向。

要点

自我中心与外部中心数据位于具身数据金字塔的中间层,为在多样化野外环境中收集具有物理基础的交互轨迹提供了可扩展的途径。通过记录人类代理与物理世界的交互,这些数据捕捉了自然的操控行为和具有高自由度的手部运动,在不同机器人具身形态中具有巨大的重用潜力。然而,其收集涉及可扩展性与标注保真度之间的权衡。无设备记录具有非侵入性和易于扩展的特点,但通常缺乏准确的手部姿态和交互标签,需要下游流水线依赖基于模型的估计或学习到的视觉重定向。可穿戴传感系统能提供更直接和精确的测量,但仍受限于硬件成本、耐用性、用户负担和便携性,特别是在大规模户外采集时。除了这种采集权衡外,由于人类与机器人具身形态之间的对齐问题尚未解决,其在机器人学习中的效用进一步受限。

5 仿真数据

5.1 数据概览

在具身数据金字塔中,仿真数据作为真实世界机器人数据的可扩展且可控的补充。虽然真实机器人数据对于捕捉具身特定的动力学、传感器噪声、接触效应和部署约束是必要的,但其收集往往受限于成本、安全性、硬件可用性和标注难度。仿真通过实现可重复的交互条件、自动访问特权状态和标签以及低成本轨迹生成,缓解了部分瓶颈。近期的数据集进一步尝试通过数字孪生 [349, 366]、域随机化 [49, 50, 259] 和配对的仿真到现实评估 [202] 来缩小仿真到现实的差距。因此,仿真不仅成为基准构建和评估的工具,也成为训练通用机器人策略的重要数据层。然而,与具身数据金字塔的上面三层相比,仿真数据在多样性和物理保真度方面通常仍然较为有限。

如表 4 和表 5 总结所示,仿真机器人数据在规模和范围上均已扩展。早期的基准主要集中于受限的刚体操控,如桌面控制 [408]、语言条件操控 [153] 和大规模抓取 [92]。后来的数据集引入了长时程交互 [254]、组合任务设置 [217] 和家庭操控 [262]。更近期的资源进一步将仿真扩展至双臂操控 [49, 50, 259]、人形操控 [26]、铰接物体交互 [121]、可变形物体和流体操控 [233, 341, 360],以及带有触觉传感的丰富接触操控 [43]。与此同时,数据生成日益自动化,从脚本化

22

第 23 页

表 4 仿真基准。按具身形态配置、触觉感知、物体可变形性、灵巧操作和移动操作总结的仿真基准。在“Embod.”列中,‘S’、‘D’和‘H’分别表示单臂、双臂和人形具身形态。

基准 时间 具身 触觉 变形 灵巧 移动

Adroit [288] 2017 S ✗ 刚性 ✓ ✗ Franka Kitchen [122] 2019 S ✗ 刚性 ✗ ✗ Meta-World [408] 2019 S ✗ 刚性 ✗ ✗ RLBench [153] 2019 S ✗ 刚性 ✗ ✗ PlasticineLab [149] 2021 S ✗ 软性 ✗ ✗ RoboMimic [250] 2021 S/D ✗ 刚性 ✗ ✗ CALVIN [254] 2021 S ✗ 刚性 ✗ ✗ Tactile Gym 2.0 [214] 2022 S ✓ 刚性 ✗ ✗ Bi-DexHands [56] 2022 D ✗ 刚性 ✓ ✗ BEHAVIOR-1K [189] 2022 S ✗ 软性 ✗ ✓ VIMA-Bench [164] 2022 S ✗ 刚性 ✗ ✗ DaXBench [48] 2023 S ✗ 软性 ✗ ✗ DexArt [12] 2023 S ✗ 刚性 ✓ ✗ RoboHive [180] 2023 S ✗ 刚性 ✓ ✗ ARNOLD [115] 2023 S ✗ 刚性 ✗ ✗ FurnitureBench [134] 2023 S ✗ 刚性 ✗ ✗ ManiSkill2 [121] 2023 S/D ✗ 软性 ✗ ✓ LIBERO [217] 2023 S ✗ 刚性 ✗ ✗ ManiSkill-HAB [315] 2024 S ✗ 刚性 ✗ ✓ TacSL [2] 2024 S ✓ 软性 ✗ ✗ ManiSkill-ViTac [190] 2024 S ✓ 软性 ✗ ✗ GarmentLab [233] 2024 S/D ✗ 软性 ✓ ✓ HumanoidBench [305] 2024 H ✗ 刚性 ✓ ✓ BiGym [61] 2024 D ✗ 刚性 ✗ ✓ The Colosseum [277] 2024 S ✗ 刚性 ✗ ✗ VLABench [427] 2024 S ✗ 刚性 ✗ ✗ SIMPLER-Env [202] 2024 S ✗ 刚性 ✗ ✗ ManiSkill3 [332] 2024 S/H ✗ 软性 ✓ ✓ RoboTwin [259] 2024 S/D ✗ 刚性 ✗ ✗ RoboCasa [262] 2024 S/H ✗ 刚性 ✗ ✓ MemoryBench [96] 2025 S ✗ 刚性 ✗ ✗ RoboCerebra [129] 2025 S ✗ 刚性 ✗ ✗ GenManip [107] 2025 S ✗ 刚性 ✗ ✗ RoboTwin 2.0 [49] 2025 D ✗ 刚性 ✗ ✗ RoboEval [358] 2025 D ✗ 刚性 ✗ ✗ REALM [301] 2025 S ✗ 刚性 ✗ ✗ RobotArena∞[156] 2025 S ✗ 刚性 ✗ ✗ DuoBench [167] 2026 D ✗ 刚性 ✗ ✗ BiCoord [273] 2026 D ✗ 刚性 ✗ ✗ MIKASA-Robo-VLA [60] 2026 S ✗ 刚性 ✗ ✗ RoboMemArena [185] 2026 S ✗ 刚性 ✗ ✗ RoboMME [71] 2026 S ✗ 刚性 ✗ ✗ RMBench [51] 2026 D ✗ 刚性 ✗ ✗ UniVTAC [43] 2026 S ✓ 软性 ✗ ✗ RoboCasa365 [263] 2026 S/H ✗ 刚性 ✗ ✓ RoboDojo [50] 2026 D ✗ 刚性 ✗ ✗

任务和遥操作,转向基于运动规划和强化学习专家 [332]、演示增强 [251]、数字孪生重建 [349, 366] 以及大语言模型辅助的任务或环境合成 [53, 144, 341, 359] 的流水线。

5.2 仿真基础设施与资产生态

如图 7 所示,模拟机器人学习生态系统可被视为由三个耦合的基础设施组件组成:具身-传感器系统、物体和场景资产,以及物理和渲染后端。具身-传感器系统不仅定义了机器人的形态学、运动学、驱动模型和控制接口,还定义了与机器人身体物理关联的感知通道,如本体感觉、腕部或头部安装的视觉、力传感和触觉阵列。物体和场景资产提供了环境的几何、语义和可供性结构,而物理和渲染后端决定了生成数据的接触动力学、视觉外观和执行保真度。

23

第 24 页

仿真基础设施数据收集方法 人工遥操作轨迹回放 回放轨迹 . . .

单臂 双臂 触觉传感器 深度 … 具身形态与传感器

采集的背景 … 物体 轨迹 增强 增强 场景 基于规则的 场景 任务逻辑:逆运动学与 规划 启发式技能组合 程序化专家策略 人类专家航点序列… 动作轨迹

自主方法构建 物体 训练好的策略 rollout

运动 LLM 规划 规划 仿真引擎 轨迹

图 7 仿真基础设施和数据收集流程概览。左面板总结了构建仿真环境所需的核心组件,包括机器人具身形态和传感器、场景、物体资产以及仿真引擎。右面板将代表性的轨迹收集方法分类为:人工遥操作、带有场景和物体增强的轨迹回放、基于专家定义的任务逻辑和运动规划的基于规则的执行,以及通过训练好的策略或基于 LLM 的规划进行的自主生成。

5.2.1 机器人具身形态与传感器

构建仿真操作数据首先需要将具身形态-传感器系统导入仿真器,其中机器人资产被实例化为可控的关节模型,其传感器被配置为在交互过程中获取观测值。仿真器解析 URDF、MJCF、SDF 或 USD 等机器人描述,以指定运动学、关节限制、惯性属性、碰撞和视觉几何体、执行器和传感器附件 [53, 341, 439],然后将该系统放置在具有定义初始位姿、关节状态、物体、光照、重力和求解器设置的场景中。

在仿真机器人数据集中,固定的单臂机械臂是最常见的具身形态,如 Franka Kitchen [122]、Meta-World [408]、RLBench [153]、RoboMimic [250]、CALVIN [254]、Simpler-Env [202]、RMBench [51]、UniVTAC [43] 和 LIBERO [217]。其他基准测试涵盖了灵巧手,包括 Adroit [288]、Bi-DexHands [56] 和 DexArt [12];移动操作,包括 BEHAVIOR-1K [189]、ManiSkill2 [121]、ManiSkill-HAB [315] 和 RoboCasa [262];以及双臂或双工系统,包括 RoboTwin [259]、BiGym [61]、RMBench [51]、DuoBench [167]、BiCoord [273] 和 RoboDojo [50]。ManiSkill3 [332]、RoboTwin 2.0 [49]、RoboMIND-Sim [366] 和 RoboMME [71] 进一步支持多种具身形态类别,而 HumanoidBench [305] 则针对人形控制。

5.2.2 物体与场景资产

资产生态系统不仅包括机器人模型,还包括可操作物体、材料和场景布局。物体级资产决定了仿真操作数据的类别覆盖范围、几何变化、纹理真实感和功能结构。基于 CAD 和网络规模资源,如 ShapeNet [39]、Objaverse [78] 和 Objaverse-XL [77],提供了广泛的物体形状多样性。扫描或基于产品的资源,如 Google Scanned Objects [87]、Amazon Berkeley Objects [65] 和 OmniObject3D [375],通过将资产锚定在真实物体或产品数据上,提高了几何和纹理的真实感。

然而,机器人学习资产不仅仅是视觉上合理的网格:它们还需要与仿真器兼容的碰撞几何体、一致的尺度、稳定的位姿、质量和惯性参数、材料属性,以及在适用情况下的抓取功能或关节标注。PartNet-Mobility [379] 提供了带有部分级交互运动标注的关节物体。ObjectFolder 2.0 [108] 引入了多感官

24

第 25 页

表 5 机器人学习的大规模仿真数据集,按具身形态配置、数据规模、任务覆盖、物体可变形性、灵巧操作和移动操作进行总结。在“Arm”列中,‘S’和‘D’分别表示单臂和双臂。

数据集 时间 手臂 具身 轨迹/小时 任务 变形 灵巧 移动

DexGraspNet [353] 2022 S 1 1.32M / – 抓取 刚性 ✓ ✗ MimicGen [251] 2023 S 3 50K / – 16 刚性 ✗ ✗ DexMimicGen [166] 2024 D 2 21K / – 9 刚性 ✓ ✗ DexGraspNet 2.0 [424] 2024 S 1 427M / – 抓取 刚性 ✓ ✗ InternData-A1 [341] 2025 S/D 4 637K / 7.4K h 70 软 ✗ ✗ InternData-M1 [53] 2025 S 1 244K / – 200 刚性 ✗ ✗ NVIDIA GR00T-X Sim [267] 2025 S/D 6+ 345K / – 58+ 刚性 ✓ ✓ SynGrasp-1B [80] 2025 S 1 10M / – 抓取 刚性 ✗ ✗ Dex1B [395] 2025 S 3 1B / – 2 刚性 ✓ ✗ MolmoB0T [84] 2026 S 2 1.7M / 5.8K h 8 关节 ✗ ✓

连接视觉、声学和触觉属性的物体表示。PhysXNet [33] 进一步引入了首个物理感知的 3D 数据集,将 3D 表示从几何和外观扩展到包括物理属性。PhysX-Mobility [34] 随后提供了即插即用的仿真就绪关节资产,而 PhysXVerse [35] 将此范式推广到更广泛、更多样化的仿真就绪 3D 资产集合。

除了精心策划或重建的集合外,生成式建模为扩展资产池提供了可扩展的途径:ManiTwin [349] 贡献了一个包含超过 100K 个 AIGC 生成的刚体对象的大型库,每个对象都配备了用于自动化数据合成的面向操作的注释。这种耦合至关重要,因为仅靠资产扩展是不够的——如果没有可操作的注释,即使资产丰富也无法转化为可用的操作数据——这使得由 AIGC 驱动的生成成为同时扩展资产多样性和下游数据合成的有前景的方向。在场景层面,ScanNet [68]、Replica [326]、Matterport3D [38]、HM3D [289]、HSSD [172]、3D-FRONT [100] 和 ProcTHOR [76] 提供了用于导航、重新排列和家庭交互的重建、合成或程序生成的室内环境。因此,资产生态系统不仅定义了智能体观察什么,还定义了它可以物理接触、操作和推理什么。

5.2.3 物理和渲染后端

物理和渲染后端决定了接触动力学、关节约束、数值稳定性、并行化和视觉逼真度。MuJoCo [342] 因其高效的动力学和稳定的接触建模,在刚体控制、接触丰富的操作和运动中仍被广泛使用。MuJoCo Playground [414] 进一步将这一方向扩展到基于加速器的并行训练。Isaac Sim [268]、Isaac Gym [247] 和 Isaac Lab/Orbit [256] 强调 GPU 并行仿真、照片级渲染、传感器建模和合成数据生成。SAPIEN/PartNet-Mobility [379] 专注于基于 PhysX 的仿真下的关节对象交互和可扩展操作。PyBullet [66] 在轻量级原型设计和基线环境中仍然有用。CoppeliaSim [295] 和 PyRep [152] 支持灵活的任务构建,如 RLBench [153] 所示。Habitat 2.0 [329] 和 Habitat 3.0 [276] 针对导航、重新排列和人机共居。

专用引擎进一步扩展了物理机制:SoftGym [213] 支持可变形对象操作,TDW [105] 支持多模态物理交互,Brax [99] 提供 JAX 原生加速器友好的仿真,Genesis [112] 针对统一的多物理仿真,而 Newton [216] 旨在实现可微物理仿真。从这个意义上说,仿真器后端限制了可行的数据分布:刚体引擎倾向于接触丰富的控制和操作,面向渲染的引擎支持视觉多样的合成数据,而专用引擎则支持可变形、触觉或可微的机器人学习。

5.3 基准和仿真数据集

表 4 和表 5 总结了仿真数据生态系统的两个互补组成部分。表 4 侧重于基准和评估环境,描述其支持的具身形态和交互设置。在此表中,‘S’、‘D’和‘H’分别表示单臂、双臂和人形具身形态,

25

第 26 页

分别;灵巧手和移动能力在“Dex.”和“Mobile”列中单独报告。 现有基准涵盖了广泛的操作配置,从单臂桌面操作 [153, 217, 408] 到双臂协调 [49, 50]、灵巧操作、移动操作 [262, 263] 以及人形控制 [305]。然而,刚性物体操作仍占主导地位,而触觉感知和可变形物体交互仅由相对有限的环境子集支持。

表 5 从数据量、任务覆盖范围、具身形态多样性以及支持的操作设置方面总结了大规模合成和基于仿真的数据资源。这些资源涵盖了从任务级操作轨迹到大规模抓取和灵巧手样本。最近的数据集越来越多地包含多种具身形态和显著更大的数据量,包括数十万或数百万条轨迹,以及对于以抓取为中心的资源,包含大量生成的样本。然而,大多数数据集仍集中在刚性或关节物体操作上,对可变形交互和移动操作的覆盖相对有限。

5.4 合成演示生成

人类执行的演示。最直接的仿真数据收集形式记录了通过人类控制产生的轨迹。此类包括遥操作、基于 VR 的控制、动作捕捉重定向以及模拟环境中的游戏式交互 [61, 217, 254]。在此设置中,模拟器主要作为仪器化的记录环境,能够提供同步的观察、机器人状态、动作、语言标注、物体状态和成功标签。与完全脚本化的生成相比,人类执行的演示能更好地捕捉自适应行为、恢复策略和时间连贯的操作模式,特别是在接触丰富或长视界任务中,合适的脚本化专家难以指定。然而,其可扩展性受限于每集的人类劳动、操作员技能以及遥操作接口的保真度。因此,仿真中的人类演示通常直接用作模仿学习数据,或作为后续回放、增强或合成扩展的种子轨迹。

基于规则的执行。基于规则的执行从手动指定或特权任务级专家生成仿真轨迹,包括启发式技能组合 [427]、程序化专家策略 [164] 和航点序列 [153]。任务通常被分解为选择目标物体、计算抓取或接触位姿、接近目标、执行交互和检查任务完成等阶段。随后,逆运动学、任务与运动规划、模型预测控制、碰撞感知运动规划、轨迹优化或特定任务控制器可能将这些阶段级目标转换为密集的关节空间或末端执行器动作 [121, 332]。该范式已广泛用于仿真基准和数据生成环境,其中可用特权状态、物体位姿、关节状态和碰撞模型,包括 RLBench [153]、ManiSkill2 [121]、ManiSkill3 [332]、VIMA-Bench [164] 和 VLABench [427]。

基于规则的执行提高了可重复性并降低了收集额外轨迹的边际成本。它对于具有明确指定几何目标、结构化工作空间、可靠重置和明确成功条件的任务特别有效。然而,产生的行为分布受限于程序化指定专家的表达力。传统的运动规划主要解决几何执行问题,本身并不确定任务语义、接触可用性(affordances)或恢复策略。因此,基于规则的数据集可能无法充分代表模糊的语义决策、非抓取交互、接触丰富的适应性以及在实际部署中遇到的各种次优但可恢复的行为。

轨迹回放与演示扩展。轨迹回放和演示扩展从现有轨迹开始,并重复使用它们来合成额外的仿真数据。源轨迹可能来自遥操作、运动教学、人类视频重定向、运动规划或之前的策略 rollout。在仿真中,这些轨迹可以在新的物体配置、场景布局、具身形态和相机条件下进行回放、空间变换、分割、拼接或重定向。以物体为中心的增强方法如 MimicGen 重用少量演示的时间结构,同时将其适应于新的物体位姿和任务实例 [251]。该范式已扩展至 DexMimicGen [166] 中的双臂和灵巧操作。RoboCasa 将相关的自动化轨迹生成方法整合为更广泛的家居和厨房操作框架的一个组成部分 [262]。

26

第 27 页

此类方法在人工执行数据与完全脚本化生成之间占据中间位置。 与遥操作相比,它大幅减少了重复的人工劳动;与手工设计的基于规则的专家系统相比,它能够保留人类演示中存在的时序结构、运动风格和任务策略。然而,其覆盖范围仍受限于种子轨迹的多样性和质量。当物体几何形状、接触条件或任务约束与原始演示存在显著差异时,开环回放可能会失败,此时需要进行闭环校正、重新规划或过滤。因此,当任务允许以物体为中心的变换或可复用的技能片段时,演示扩展最为有效;但对于需要定性新策略或长程语义决策的任务,其效果仍然有限。

自主策略与生成式 rollout。更自动化的类别通过学习的策略 [398]、强化学习专家、LLM 或 VLM 生成的任务程序、场景图求解器、组合技能库、世界模型或生成式仿真流水线来生成仿真轨迹。在自主策略 rollout 中,动作由通过强化学习、模仿学习、课程学习或上一轮数据生成训练的策略产生。此类 rollout 通常收集于多任务操作、灵巧操作、铰接物体操作、可变形物体操作和全身控制的仿真环境中。代表性环境包括 Meta-World [408]、DexArt [12]、Bi-DexHands [56]、SoftGym [213]、PlasticineLab [149]、DaXBench [48] 和 HumanoidBench [305]。相对于固定的基于规则的专家,学习的策略能够响应观测结果,并可能访问由策略诱导的状态,包括失败和恢复。尽管如此,生成的数据分布强烈受限于奖励设计、探索策略、策略能力、仿真器保真度和数据保留标准。因此,低质量的策略可能会产生大量冗余或失败的数据,使得验证和过滤变得至关重要。

最近的生成式数据工厂进一步将人工劳动从编写特定任务的专家转向设计可扩展的任务、资产、技能和验证流水线。LLM 辅助系统如 GenSim [350] 和 GenSim2 [144] 生成仿真任务、任务代码或铰接物体操作设置,随后使用规划或强化学习求解器生成演示。RoboGen [359] 同样探索了用于任务、场景和监督生成的生成式仿真。RoboTwin [259] 和 RoboTwin2.0 [49] 强调通过生成式数字孪生、域随机化和具身感知执行来扩展双臂操作数据的生成。InternData-M1 [53]、GenManip [107] 和 InternData-A1 [341] 实例化了该范式的更模块化形式,其中场景图、物体状态、技能规范、航点、运动规划、物理验证和渲染被解耦,以生成用于指令跟随、空间定位和通用策略训练的数据。更大的仿真平台和数据引擎,包括 RoboVerse [113]、Genie Sim 3.0 [401]、ManiTwin [349] 和 RoboCasa365 [263],通过将资产构建、场景生成、多具身执行、渲染和基准测试集成到统一的合成数据流水线中,进一步扩展了这一方向。

此类还包括近期将合成数据扩展到传统 RGB 和本体感知轨迹之外的努力。GraspVLA/SynGrasp-1B [80] 和 Dex1B [395] 为抓取和灵巧操作生成大规模合成动作数据。视觉触觉仿真框架通过合成触觉观测、弹性体变形、标记位移场或其他多模态触觉信号,将策略 rollout 扩展到富含接触的设置中。代表性系统包括 Taxim [317]、TACTO [354]、Tactile Gym [214]、Tacchi [58]、DiffTactile [318]、TacEx [265]、TacSL [2]、TacCel [208]、TacFlex [418]、UniVTac [43] 和 Tac2Real [387]。Tac2Real [387] 是这一趋势的代表,因为它使用高吞吐量的视觉触觉仿真来支持在线强化学习和富含接触操作的零样本仿真到现实迁移。

除了基于物理的仿真外,DreamGen [155] 引入了一种相关的基于世界模型的方向,其中视频世界模型从初始视觉状态和语言指令生成合成机器人视频或神经轨迹,随后进行伪动作恢复以进行策略学习。这些方法减少了对特定任务遥操作和手动脚本的需求,但也引入了额外的风险,包括任务无效、语义不一致、视觉-动作不对齐、幻觉动力学、规划器诱导的行为偏差以及与真实机器人经验的分布不匹配。

27

第 28 页

5.5 世界模型作为模拟器

除了传统的基于物理的仿真,近期工作越来越多地探索将世界模型作为机器人学习的习得模拟器(learned simulators)[141]。世界模型不依赖手动指定的资产、动力学和渲染管线,而是从收集的观测和交互中学习预测环境动力学。在观测历史、任务描述和候选动作的条件下,它们生成未来的观测、潜在状态、奖励或任务结果,从而将现有经验转化为想象的交互轨迹。这一思想建立在基于模型的强化学习和潜在想象(latent imagination)[124, 126–128] 之上,并已通过 DayDreamer 和 UniSim 等系统扩展至真实机器人学习和交互式视觉仿真 [370, 392]。

5.5.1 用于策略训练和训练后调整的世界模型

世界模型可作为虚拟环境,在其中优化策略而无需反复与物理机器人交互。想象的转移和估计的奖励支持强化学习、策略适应和 VLA 训练后调整(post-training)。代表性方法包括 World-Env、VLA-RFT、DiWA 和 World4RL [37, 165, 193, 380],而近期系统进一步探索了自主游玩、进度估计和基于大规模世界模型的策略优化 [307, 336, 381, 389, 402, 423, 452]。这些方法可以减少现实世界的交互成本并并行生成经验,但其益处取决于习得的模拟器是否保留了机器人动作的因果效应。

5.5.2 用于策略评估的世界模型

习得的模拟器还可以在物理部署前估计策略性能。WorldGym 和 WorldEval 研究了生成的轨迹(rollouts)是否支持策略评估和检查点选择,而基于 Veo 的评估则考察了名义上、分布外以及安全相关的行为 [111, 204, 286]。与策略训练不同,此处的目标是预测任务进度、完成、失败或不安全结果,而非直接更新策略。因此,仅靠视觉逼真度是不够的:有用的评估器必须保留动作可控性、任务语义、时间一致性以及候选策略的相对排名。

5.5.3 作为合成数据引擎的世界模型

世界模型进一步提供了一种可扩展的机制,用于根据场景、指令、动作、视角或具身形态合成交互数据。DreamGen 生成机器人视频并通过潜在动作或逆动力学模型恢复伪动作,而 GigaWorld-0 明确将生成式世界模型视为具身学习的数据引擎 [114, 155]。与传统的增强方法相比,这些方法建模了时间演化和动作后果;与基于物理的仿真相比,它们减少了对手动构建资产的依赖。然而,生成的视频不一定包含准确的可执行动作,且动作恢复可能引入视觉-动作不对齐。

总体而言,世界模型正从辅助预测组件演变为用于策略优化、评估和数据生成的习得环境。其可扩展性和视觉覆盖范围使其成为基于物理的仿真器的有前景的补充,但预测误差、模型利用、动作歧义和分布偏移可能会产生看似合理但物理上无效的轨迹。因此,习得仿真需要过滤、不确定性估计,并与真实机器人或基于物理的交互数据进行校准。

5.6 仿真到现实的差距

仿真到现实(Sim-to-Real)的迁移长期以来一直是基于仿真的机器人数据中的核心问题,因为合成轨迹预期应支持真实机器人的部署,而不仅仅是在仿真器内的学习 [43, 259, 263]。从以数据为中心的视角来看,这一差距主要源于观测不匹配和交互不匹配。

首先涉及渲染感官观测与真实机器人感知之间的差异。尽管最近的仿真数据集通过 3D 资产、光照、相机模型、关节物体和多模态传感器提高了逼真度 [53, 84, 341],但其观测在纹理、照明、材质外观、深度噪声、相机校准、遮挡、触觉响应和力信号方面仍可能与真实数据存在差异。

28

第 29 页

第二点涉及仿真机器人与真实机器人-环境交互之间的不匹配,这可以进一步细分为运动学差距和动力学差距。运动学差距源于机器人形态、关节限制、坐标系、动作接口、控制器频率和校准等方面的差异,通常可以通过精确的机器人建模、真实到仿真的对齐以及硬件一致的控制接口来减少。动力学差距更难消除,因为真实执行涉及执行器延迟、顺应性、扭矩饱和、背隙、摩擦、接触、变形、物体惯性和多体相互作用效应,而这些效应目前仅被仿真引擎部分捕捉。为了提高效率,许多仿真流水线进一步简化接触动力学,使用粗时间步长,或近似机器人-环境状态更新,产生的轨迹可能在视觉上合理,但在动力学上与真实执行不一致 [14, 67, 361]。因此,核心问题不仅在于能生成多少仿真数据,还在于生成的数据是否捕捉到了决定真实机器人部署的感觉变化、运动学一致性和不可约简的动力学不确定性。

5.7 优势与局限性

仿真数据通过在可控的虚拟环境中生成机器人观察、动作和任务结果,提供可扩展的监督。与真实机器人数据相比,它们可以以更低边际成本、广泛并行化、有限安全风险和无硬件磨损的方式收集。仿真器还提供难以从真实系统获得的特权标签,如物体姿态、分割掩码、接触状态、物理参数、成功信号和密集奖励。这些特性使仿真在大规模策略预训练、受控评估、场景和任务随机化以及多样化交互轨迹的合成中非常有用。

仿真数据的一个主要局限性是物理保真度有限。感知、驱动、接触和物体动力学方面的近似可能导致显著的仿真到现实差距,特别是在接触丰富的操作、可变形物体、反射材料、液体和长视域任务中。此外,规模并不一定意味着多样性:如图 4 中的 InternData-A1 所示,技能约束生成可以产生许多轨迹,其动作关键点仍集中在一个小区域内,表明存在大量重复。因此,仿真策略通常需要进行域随机化、系统识别、数字孪生重建或现实世界微调。

要点

仿真 仿真数据构成了金字塔中最具可扩展性和成本效益的机器人对齐层。自动化生成使得能够重复收集细粒度分割的原子行为,为学习特定操作技能提供密集且可控的监督。然而,现实世界部署要求策略内化无法从不完美的仿真动力学中完全恢复的物理规律——特别是在接触、材料和物体交互方面。场景多样性同样难以保证,因为生成的数据仍受限于可用资产。此外,在仿真中扩展技能和任务多样性仍然依赖于标注、技能脚本或人类演示;从视频中自动化技能发现并利用其驱动数据合成将是关键的一步。

6 通用数据

6.1 数据概览

机器人学习不仅仅依赖于直接从物理机器人收集的数据。虽然机器人轨迹为动作生成和控制提供最直接的监督,但它们的收集成本高昂,通常仅覆盖有限的物体、环境和任务范围。因此,现代机器人基础模型融入了大量通用图像、视频、语言、空间和推理数据。此类数据的主要目的不是教特定机器人如何移动,而是建立在执行动作之前所需的高效学习所需的感知、语义、空间、时间和规划能力。通用数据的特点是规模巨大、覆盖广泛和高多样性,但与可执行机器人动作的对齐度较弱,且缺乏直接的机器人-环境交互。

应根据通用数据为机器人模型贡献的能力来理解它。如图所示

29

第 30 页

图8 通用数据类别概览。通用数据类别及代表性任务的概览,涵盖认知、任务推理、感知与动作,包括视觉-语言问答、OCR、视频时序推理、物理推理、规划、分割与定位、空间与3D感知以及抓取等示例。

如图8和表6所示,通用视觉-语言数据提供广泛的语义知识和常识推理;分割与定位数据将这些知识锚定在空间区域中;视频数据引入时序和程序结构;空间与3D数据提供几何感知;面向规划的数据教导模型将观察和目标组织为可执行步骤。这些能力构成了认知基础,在此之上学习特定机器人的轨迹和控制信号。

6.2 视觉-语言数据

视觉-语言数据为现代机器人模型提供了语义和推理基础。虽然机器人轨迹通常局限于有限的环境、物体和任务,但大规模图像-文本和视频-文本语料库使模型接触到多样的场景、活动、工具、材料和语言表达。除了视觉识别和指令理解外,描述、视觉问答和多模态指令数据提供了关于物体属性、空间关系、人类意图、功能及可能事件结果的常识性知识,这些知识在机器人演示中很少被显式标注,但对于任务解释和规划至关重要。

基于图像的指令混合数据,包括LLaVA风格数据[188, 219]、ShareGPT4V [46]和PixMo [79],结合了来自COCO、VQA、Visual Genome和A-OKVQA [6, 179, 212, 300]等基准的描述、问题、详细描述和推理回答。它们教导模型识别场景内容、理解关系、比较区域或视角,并回答自然语言问题。视频-语言数据进一步引入了人类动作、物体状态变化、时序顺序和程序结构。带有描述或问答对标注的以自我为中心或机器人视角的视频提供了第一人称语义和时序理解,尽管它们不直接监督机器人动作[118, 139, 159, 434]。

这些数据集收集自公共视觉存储库、网页、视频平台、教学视频和现有基准。虽然早期的语料库主要依赖人工标注,但最近的流程越来越多地使用多模态模型大规模生成描述、问题、答案、理由和对话。这种生成提高了覆盖率和多样性,但可能会引入幻觉物体、错误关系或通用语言。因此,自动标注通常通过置信度估计、一致性检查、答案验证、模型一致性或人工审查进行过滤,并经常与较小的高质量人工标注数据集结合使用。

在机器人基础模型中,视觉-语言数据主要用于多模态对齐和指令

30

第 31 页

表 6 代表性通用数据集。按主要监督类型分组的代表性数据集,包括其数据模态、规模、监督目标和标注流程。VL 表示视觉-语言,Seg./Loc. 表示分割和定位,EE 表示末端执行器。标注类型分为:Manual(人工提供的标签)、Automatic(从元数据、几何、仿真、计算机视觉方法或程序化过程生成的标签)和 Semi-auto(模型辅助标注后经过过滤或人工验证)。

任务 数据集 模态 规模 标签/目标 标注

VL (8) LLaVA-Instruct- 图像-文本 158K 描述;VQA;指令;对话 Semi-auto 150K [219] LLaVA-OneVision- 图像-文本 3.2M VQA;描述;OCR;知识;Semi-auto SI [188] 指令 ShareGPT4V [46] 图像-文本 1.2M 描述 密集描述;图像-文本对齐 Semi-auto PixMo [79] 图像-文本 1M 图像;3.3M 标注 描述;问答;计数;点;文档 Manual A-OKVQA [300] 图像-文本 24.9K 问答 知识 VQA;推理 Manual LLaVA-Video- 视频-文本 178K 视频;1.34M 标注 描述;开放/多选问答 Semi-auto 178K [434] RoboVQA [304] 机器人/人类 238 小时;829.5K 对 计划;成功;功能;过去/未来 Semi-auto 视频-文本 问答 EgoTaskQA [159] 视频-文本 40K 问答 状态;因果;预测性问答 Automatic

机器人 视频 RoVid-X [82] 视频/深度/ 4M 片段;10K+ 小时 动词;分割;描述;深度;流 Automatic (4) 光流 RoboNet [75] 机器人 视频 162K 视频;15M 帧 原始机器人轨迹 – RH20T-P [57] 机器人 视频 38K 片段;67 个任务 基元标签;时间片段 Manual RobAVA [328] 机器人 视频 40K 视频 动作类别;正常/异常 Manual 属性

OCR/UI (5) OCR-VQA [255] 图像-文本 207K 图像;1.0M 问答 基于 OCR 的 VQA Automatic TextOCR [321] 图像-文本 28K 图像;900K 词 文本框;转录 Manual DocVQA [253] 文档-文本 12.8K 图像;50K 问题 文档 VQA Manual ChartQA [252] 图表-文本 32.7K 问答 图表问答;数值推理 Semi-auto MultiUI [223] UI-文本 7.3M UI 定位;元素;动作 Automatic

Seg./Loc. (8) Objects365 [306] 图像-框 638K 图像;10M 框 物体框;类别 Manual SA-1B [176] 图像-掩码 11M 图像;1.1B 掩码 可提示掩码 Semi-auto ADE20K [448] 图像-掩码 25K 图像;150 类 语义掩码;场景标签 Manual PACO-LVIS [290] 图像-掩码 641K 部分掩码 物体/部分掩码;属性 Manual RefCOCO [404] 图像-文本-框 142K 表达式 指代表达式定位 Manual PixMo-Points [79] 图像-文本-点 428k 图像;2.3M 表达式 指向;计数 Manual RoboPoint [413] 图像-文本-点 1.43M 问答 物体/功能/自由空间点 Automatic RoboAfford++ [131] 图像-文本-点 870K 图像;2.0M 问答 部分/功能定位 Semi-auto

Temporal (6) Ego4D NLQ [118] 视频-文本-时间 227 小时;19K 查询 查询到时刻定位 Manual Charades-STA [106] 视频-文本-时间 16K 时刻对 句子到时刻定位 Semi-auto DiDeMo [133] 视频-文本-时间 10K 视频;40K 描述 文本到时刻定位 Manual HiREST [415] 视频-文本-时间 3.4K 对;8.6K 步骤 时刻;步骤片段;描述 Manual Moment-10M [279] 视频-文本-时间 10M 时刻 片段级定位 Semi-auto COIN [331] 视频-步骤-时间 11.8K 视频;46.3K 分割 程序步骤;时间片段 Manual

Spatial/3D ScanNet [68] RGB-D/网格 1.5K 场景;2.5M 深度;姿态;网格;3D 语义 Semi-auto (7) 视图 ScanNet++ [399] RGB-D/网格 460 场景 高分辨率几何;视图;语义 Semi-auto ARKitScenes [13] RGB-D/激光雷达 5K 容量;1.7K 场景 深度;重建;3D 框 Semi-auto WildDet3D [147] 图像-3D 框 1.00M 图像;3.91M 开放词汇单目 3D 框 Semi-auto 框 MMScan [242] 3D-文本 1.4M 描述;3.04M 问答 3D 描述;定位;问答 Semi-auto ScanQA [9] 3D-文本 41K 问题;800 场景 自由形式 3D 问答 Manual SQA3D [246] 3D-文本 33.4K 问题;6.8K 情境 情境化以智能体为中心的 3D 问答 Manual

Planning (4) ALFRED [313] 观测-语言-动作 25K 指令;8K 演示 目标/子目标指令;动作 Manual EgoPlan-IT [55] 视频-文本-计划 50K 计划问答 目标;子目标;下一步动作 Semi-auto ShareRobot [158] 机器人 视频/图像- 51.4K 集;1.028M 问答 计划;功能;EE 轨迹 Semi-auto 文本-点 LLaRP [330] 3D-语言-动作 114 个任务 语言任务;高级动作 Automatic

Physics/Failure CLEVRER [400] 视频-问答 20K 视频;300K+ 问题 描述性/因果/预测性/反事实 Automatic (4) 问答 IntPhys [293] 视频-标签 15K 视频 可能 vs 不可能 Automatic InfLevel [363] 视频-标签 5.8K 真实;75.3K 仿真 连续性;坚固性;重力; Automatic 合理性 RoboFail [228] 视频-文本 100 仿真;30 真实 失败类型/原因;恢复 Manual

Grasping (4) RealVLG-11B [197] 图像-文本-掩码- 165K 图像;1.3M 标注; 定位;框;掩码;4-DoF 抓取; Semi-auto 抓取 11B 次抓取 接触 GraspNet- RGB-D-点-抓取 97K 图像;1.1B 次抓取 场景级 6-DoF 抓取 Semi-auto 1Billion [94] SuctionNet- RGB-D-点-抓取 97K 图像;1.1B 标签 接触;法线;吸力质量 Automatic 1Billion [32] DexGraspNet 网格-手-抓取 8.3K 场景;427M 手部姿态;接触;抓取质量 Automatic 2.0 [424] 次抓取

31

第 32 页

调优,建立广泛的场景理解、常识推理、任务理解和问答能力,包括在指令模糊、不足或嘈杂的情况下 [160, 373, 374]。在随后的机器人特定训练期间,通用视觉-语言数据可能被保留以维持语义和语言能力,而空间定位、规划、抓取和轨迹监督则将这种广泛知识与可执行行为联系起来。

6.3 分割与定位数据

物体检测、分割和定位仍然是机器人感知的核心,因为操作通常围绕物体及其功能部件组织。在抓取杯子、打开抽屉、按下按钮或放置物品之前,机器人必须识别相关物体,估计其位置,并确定交互发生的位置。因此,这些数据通过显式的空间定位,补充了从视觉-语言语料库中学到的语义知识。

经典数据集通过边界框、语义或实例掩码以及部件级区域来监督物体类别。COCO [212]、LVIS [123]、Objects365 [306]、ADE20K [448] 和 SA-1B [176] 提供了对日常物体和场景的广泛覆盖,而以部件为中心的资源如 PACO [290] 则标注了更细粒度的功能组件。这种区分对于操作尤为重要:如果策略无法定位把手,仅识别抽屉是不够的;使用工具可能需要将其可抓取区域与其功能端分离。

语言条件定位进一步将视觉感知与自然语言指令联系起来。指代表达数据集如 RefCOCO [404] 将描述与目标边界框或掩码关联,而 PixMo-Points [79] 监督基于坐标的指向。面向机器人的数据集,包括 RoboRefIt [236] 和 RoboPoint [413],将这些任务扩展到杂乱的室内和操作场景。 affordance(可供性)数据集通过识别可抓取部分、把手、按钮、放置区域或可导航区域来增加动作相关性,将预测目标从“物体是什么”转变为“交互应在何处发生”。

这些数据集收集自网络图像、照片库、识别基准、桌面场景、第一人称记录、机器人安装摄像头和合成环境。它们的注释形式可能包括手动绘制的框和掩码、交互式或模型辅助分割、指代表达或点点击。仿真提供了精确的物体身份、掩码、坐标和可见性信息,无需人工标注,而最近的流程越来越多地使用多模态模型生成区域描述或指代表达,随后进行几何检查、置信度过滤或人工验证。

对于机器人学习,此类数据的主要价值在于将语义概念转化为空间上可操作的目标。模型可能理解指令“拿起红色的杯子”,但操作系统的当前观察中仍需要一个框、掩码、点或部件级区域来识别杯子。然后,该表示可以条件化抓取生成、导航、运动规划或底层控制。因此,分割、定位、指向和 affordance 定位提供了通用视觉理解与物理执行之间的直接接口。

然而,通用图像的注释并不能完全捕捉机器人感知的难度。机器人场景通常涉及严重的遮挡、重复的物体类别、不寻常的视角、运动模糊和部分可见的功能部件,而自动生成的表达可能模糊或指向错误的实例。因此,鲁棒的系统通常将大规模通用分割数据与较小的、任务相关的机器人数据集相结合,并在实际操纵场景中应用关系感知的注释、过滤或验证。

6.4 3D 数据

3D 数据为具身感知和物理交互所需的几何基础提供支持。通用视觉-语言数据可能允许模型识别物体并理解场景语义,但机器人还必须估计物体的位置、距离、方向以及它们相对于智能体和周围环境的排列方式。因此,此类数据支持关于深度、距离、方向、包含、支撑关系、可见性、自由空间和视角变化的推理。

32

第 33 页

此类数据包括 RGB-D 图像、点云、重建网格、多视图观测、相机轨迹、3D 物体标注以及空间问答数据。室内场景数据集如 ScanNet [68]、ScanNet++ [399]、ARKitScenes [13] 和 3RScan [345] 提供 RGB-D 序列以及相机位姿和重建几何结构。语言增强资源如 ScanQA [9] 和 SQA3D [246] 进一步要求模型回答关于物体位置、相对方向和以智能体为中心的观测的问题。其他数据集从物体坐标、场景图或重建环境中生成空间问题,为度量和关系推理提供可扩展的监督。

这些数据通常使用 RGB-D 相机、移动设备深度传感器、立体系统、激光雷达或多视图重建管线收集。深度图 [13, 320] 和相机位姿可直接从传感器、视觉惯性跟踪、SLAM [260] 或运动恢复结构 [298] 获得。多个观测值随后融合为点云或网格。物体身份 [68, 345]、语义区域 [68, 399]、3D 框 [13] 和场景关系通常由人工标注 [346],而距离、相对方向、可见性和包含关系等几何属性可以从重建场景中自动计算。合成环境提供了额外的监督来源,因为它们可以直接输出精确的深度、表面法线、相机参数、分割标签和物体位姿。

对于机器人学习,这些数据的主要价值在于将视觉观测转化为对环境具有物理意义的表示。机器人必须确定哪个物体是相关的,以及它是否可达、是否有其他物体阻挡接近路径、是否有足够的自由空间进行操控,以及从哪个视角可以最清晰地观察目标。三维场景表示还允许整合来自不同视图的信息,这在物体部分遮挡或暂时超出相机视野时非常重要。

因此,空间和 3D 监督支持导航、避障、视角选择、物体搜索、抓取规划和操控。它提供了评估语义合理动作在物理上是否可行的几何上下文。在机器人基础模型中,这些数据通过将物体和任务概念扎根于深度、尺度、方向和场景结构中,补充了视觉-语言理解,从而为规划和控制模块的操作提供了几何基础。

6.5 用于任务分解的规划数据

规划数据监督将任务目标和当前观测转化为有序的步骤、子目标或下一步动作序列。与低级控制数据不同,它们的目标描述抽象的任务结构,例如定位物体、准备工作区、执行操控步骤以及验证 resulting 状态。因此,它们在语义理解和特定具身执行之间提供了一个中间推理层。

此类数据可源自人工编写的指令、手册、教学或第一人称视频、机器人演示和仿真。基于视频的数据集将演示分割为有意义的阶段,并将观测与下一步预测、子目标序列或推理轨迹相关联,EgoPlan-IT 和 EgoCOT [55, 258] 即为示例。机器人轨迹通过动作序列和物体状态转换提供更物理化的监督,而仿真则利用显式状态、动作前提条件和成功条件实现可扩展的生成和验证。

语言和多模态模型也越来越多地用于生成计划或下一步动作标注,尽管此类输出可能包含合理但物理上无效的步骤。一种互补用法是让预训练模型在部署时直接提供计划,而非作为离线监督:ASCENT 通过将前沿排序与基于 LLM 的上下文推理相结合,在多楼层建筑中执行零样本物体目标导航,无需针对特定任务重新训练即可泛化到未见过的物体类别 [116]。这种无需训练的流程说明了仅凭通用数据先验能在多大程度上支持高级具身决策,同时也暴露了其局限性,因为生成的计划仍未扎根于具身形态自身的动力学中。因此,这些标注需要通过演示动作顺序、状态变化、模拟器执行、成功条件或人工审查进行过滤。结合机器人轨迹和控制数据,规划监督有助于具身模型分解长视域目标、跟踪任务进度并选择可执行的子目标。

33

第 34 页

6.6 视频与时间数据

视频-时间数据为具身模型提供了一种感知记忆形式。机器人并非将任务视为单张图像进行观察,而是接收连续的部分观测流,其中物体可能移动、改变状态、被遮挡或从视野中消失。因此,模型必须将当前观测与过去的事件联系起来,并确定何时发生了与任务相关的动作或状态转换。该类别主要涵盖时间定位(temporal grounding)、事件定位、步骤分割和长视频记忆监督,而非通用的动作识别。

时间定位将语言查询或任务描述与特定的视频区间对齐。给定诸如“抽屉何时被打开?”或“定位将物体放入容器的步骤”之类的查询,模型预测相应的开始和结束时间戳。这需要搜索观测历史,检索相关事件,并将其与其他时间发生的相似动作区分开来。长视频和情景记忆数据进一步训练模型回答发生了什么、何时发生以及物体此前在何处被观察到。第一人称视角(Egocentric)记录特别有用,因为它们提供了长时、移动且部分观测的流,类似于具身智能体的感知历史。

这些数据集通常来自教学、日常活动或第一人称视角视频。人工标注员可能将视频分割为有意义的步骤,为每个区间编写描述,或针对查询选择时间边界。旁白时间戳提供了较弱的事件-语言对齐,而更大规模的流水线可能使用多模态模型生成描述和候选时间戳,随后进行转录对齐、一致性过滤或人工验证。此类监督有助于具身模型检索过去的事件、跟踪物体状态变化,并在长时间交互中识别任务进展。

6.7 物理、因果与失败推理

物理推理数据教导模型预测在不同动作下场景可能发生的变化。CLEVRER [400] 和 IntPhys [293] 等数据集为碰撞、物体恒存性、稳定性、未来状态预测和反事实推理提供监督。它们帮助模型区分物理上可能的结果与不可能的结果。

以失败为导向的数据 [228] 如 RoboFail [228] 更直接地关注机器人执行。它们可能标记任务是否失败、识别失败发生的阶段、解释其原因或描述可能的恢复动作。此类监督可用于训练评论家(critics)、进度估计器或规划时验证器。

合成物理数据集在仿真中生成,其中物体状态、碰撞和反事实结果可以自动获得。现实世界的失败数据需要在不同条件下重复执行任务。标签可由人工提供、源自任务成功检测器,或通过比较观测到的状态转换与预期目标生成。

6.8 抓取数据

抓取数据指定机器人末端执行器应在何处以及如何接触物体。适当的表示形式取决于任务。Cornell [187]、Jacquard [83] 和 Grasp-Anything [344] 提供图像平面抓取矩形,而 GraspNet-1Billion [94]、ACRONYM [92] 和 Grasp-Anything-6D [266] 提供三维平行夹爪抓取候选项。SuctionNet [32] 提供表面接触和吸力质量,而 DexGraspNet 风格的数据集 [353, 424] 表示手腕姿态和多指关节配置。

二维抓取数据构建高效,支持自上而下的抓取预测,但其输出在机器人执行前通常需要深度和相机校准。相比之下,6-DoF 数据集直接指定三维坐标中的夹爪姿态,并可能包括夹爪宽度、碰撞状态和抓取质量。语言条件数据集如 RefGraspNet [17] 还将指代表达式与一组可执行的抓取姿态联系起来。

抓取注释使用几种方法生成。小型 2D 数据集可能使用手动绘制的定向矩形。大型合成数据集在物体网格周围采样候选姿态,并使用几何指标、碰撞检查或物理仿真对其进行评估。场景级数据集渲染或捕获 RGB-D 观测,并将有效的物体级抓取转换为场景坐标。随后可使用真实机器人试验来验证仿真得出的质量评分。

34

第 35 页

区分直接抓取姿态数据与辅助抓取资源至关重要。接触图、人手-物体交互数据、物体姿态标注和 3D 物体网格提供了有用的先验,但它们并不直接指定可执行的机器人夹爪姿态。它们通常需要单独的抓取生成器、重定向方法或优化阶段。

6.9 优势与局限

通用数据提供了任何机器人收集源都无法比拟的规模、多样性和可访问性。它们既不需要硬件、遥操作,也不需要环境重置,可以以极低的边际成本从现有的网络、视频和基准资源中组装而成,并且保持具身形态无关性,因此相同的语料库可在不同平台和任务间复用。它们的贡献也是互补而非冗余的:来自视觉-语言语料库的语义和常识知识、来自分割和定位数据的空间 grounding、来自 3D 数据的几何结构、来自视频的感知记忆、来自规划数据的任务结构,以及来自推理基准的物理合理性,共同构成了认知基础,使得后续的机器人特定训练更加高效。

相应的局限性在于动作 grounding 较弱。通用数据既未捕捉本体感觉、执行器动力学、接触力,也未捕捉执行动作的物理后果,因此无法单独指定特定机器人应做什么。它们的视觉分布也与机器人观测不同,后者更常涉及遮挡、非典型视角、运动模糊和重复的物体实例。日益自动化的标注流水线增加了进一步的风险,因为生成的标签、指代表达式和计划可能是幻觉、模糊或物理上无效的,在使用前需要验证。因此,通用数据最好被视为感知、语义和推理上的广泛先验,而更贴近机器人的层级必须将其 grounding 于物理执行中。

要点

通用数据提供了远超物理交互数据的网络级语义、感知和推理先验,但动作和接触 grounding 较弱。它在构建感知、推理和规划能力方面最有价值,这些能力随后由更高层、更贴近机器人的层级 grounding 于物理执行中。

7 具身基础模型中的数据应用

7.1 概述

前述章节介绍了具身数据的收集范式主要形式。我们现在从数据构建转向数据应用,考察不同类型的数据如何用于训练具身基础模型。我们首先总结代表性模型架构采用的数据配方和动作表示。然后讨论三大模型家族,即具身大脑模型、视觉-语言-动作模型(VLA)和世界-动作模型(WAM),重点关注每个家族如何利用带有和不带有机器人动作标签的数据。这一视角突出了不同类型数据在支持具身理解、控制和动力学建模中的不同作用。

7.2 数据组成与动作表示

7.2.1 具身基础模型的数据配方

如表 7 所示,具身基础模型的数据配方正从单一来源的机器人演示演变为日益异质的混合物。这种演变在相同模型家族的连续代际中清晰可见。例如,π 系列从 π0 [21] 中的真实机器人数据,扩展到 π0.5 [150] 中的真实机器人和通用数据,并在 π0.7 [151] 中进一步融入了第一人称视角数据。同样,LingbotVA [196] 结合了真实机器人、UMI 和仿真数据,而 LingbotVA 2.0 [426] 将其配方扩展至数据金字塔的所有五个层级。

尽管存在这种向异质预训练发展的趋势,但对于具身

35

第 36 页

表 7 代表性 VLA 和 WAM 方法。模型按发布时间、模型类型、机构和数据来源图标分组并排序。左半部分:2023 年至 2025 年的模型;右半部分:2026 年的模型。数据来源包括真实机器人数据、第一人称视角数据、UMI 数据、仿真数据和通用数据。

时间 方法 机构 模型 数据

2023.3 PaLM-E [88] Google VLA 2026.1 InternVLA-A1 [28] 上海人工智能实验室 VLA

2023.7 RT-2 [23] DeepMind VLA 2026.1 LaST0 [230] 北京大学 VLA

2026.1 Being-H0.5 [238] BeingBeyond VLA 2024.5 Octo [339] 加州大学伯克利分校 VLA 2026.1 LingbotVLA [376] 蚂蚁集团 VLA 2024.6 OpenVLA [174] 斯坦福大学 VLA 2026.1 LingbotVA [196] 蚂蚁集团 WAM 2024.10 GR-2 [41] 字节跳动 VLA 2026.2 RDT2 [226] 清华大学 VLA 2024.10 π0 [21] Physical Intelligence VLA 2026.2 Xiaomi Robotics-0 [29] 小米 VLA 2026.2 ABot-M0 [393] 高德地图计算机视觉实验室 VLA 2024.10 RDT-1B [225] 清华大学 VLA 2026.2 DM0 [403] Dexmal VLA 2024.11 CogACT [198] 清华大学 VLA 2026.2 LDA-1B [241] 北京大学 WAM 2025.1 SpatialVLA [285] 上海人工智能实验室 VLA 2026.2 DreamZero [397] 英伟达 WAM 2025.1 UP-VLA [425] 清华大学 VLA 2026.2 EgoScale [443] 英伟达 VLA 2025.3 HybridVLA [221] 北京大学 VLA GigaWorld- 2026.3 GigaAI WAM 2025.3 GR00T N1 [20] 英伟达 VLA Policy [394] 2025.3 GO-1 [26] 上海人工智能实验室 VLA 2026.3 MolmoB0T [84] AI2 VLA & AgiBot 2026.3 UniDex [420] 清华大学 VLA

2025.3 CoT-VLA [437] 英伟达 VLA 2026.4 JoyAI-RA 0.1 [428] 京东 VLA 2025.4 UWM [450] 华盛顿大学 WAM 2026.4 π0.7 [151] Physical Intelligence VLA 2025.4 π0.5 [150] Physical Intelligence VLA 2026.4 GR00T N1.7 [20] 英伟达 VLA 2026.4 Being-H0.7 [239] BeingBeyond WAM 2025.5 UniVLA [27] 香港大学 VLA 2026.4 MotuBrain [338] 圣数 WAM 2025.6 SmolVLA [316] Hugging Face VLA 2026.5 Qwen-VLA [352] 通义千问 VLA 2025.6 GR00T N1.5 [20] 英伟达 VLA 2026.5 Wall-OSS-0.5 [406] X Square Robot VLA 2025.7 DreamVLA [430] 上海交通大学 VLA 2026.5 MolmoAct2 [97] 华盛顿大学 & AI2 VLA 2025.7 EgoVLA [391] 加州大学圣地亚哥分校 VLA 2026.6 Wall-WM [200] X Square Robot WAM 2025.7 Being-H0 [237] 北京大学 VLA 2026.6 LaST-HD [222] 北京大学 VLA 2025.7 GR-3 [42] 字节跳动 Seed VLA Hy-Embodied-0.5- 2026.6 腾讯机器人 VLA 2025.7 H-RDT [19] 清华大学 VLA VLA [422] X 2025.8 GalaxeaVLA(G0) [162] Galaxea VLA 2026.6 Kairos [168] ACE Robotics WAM 2025.8 ReconVLA [324] 香港科技大学 VLA Qwen- 2026.6 Qwen VLA 2025.8 MolmoAct [184] AI2 & 华盛顿大学 VLA RobotManip [412] 2025.8 EO-1 [284] 上海人工智能实验室 VLA 2026.7 ABot-M0.5 [47] 高德地图计算机视觉实验室 WAM 2025.9 RynnVLA-001 [163] 达摩院 VLA 2026.7 ACE-Brain-0.5 [334] ACE-Robotics VLA InternVLA- 2025.10 X-VLA [442] 清华大学 VLA 2026.7 上海人工智能实验室 VLA A1.5 [243] 2025.10 InternVLA-M1 [53] 上海人工智能实验室 VLA LingbotVLA 2026.7 蚂蚁集团 VLA 2025.10 VITRA [199] 清华大学 VLA 2.0 [377] 2025.11 METIS [101] 北京大学 VLA 2026.7 LingbotVA 2.0 [426] 蚂蚁集团 WAM 2025.11 iFlyBot-VLA [433] 科大讯飞 & VLA 2026.7 HumanScale [244] 北京大学 WAM LindenBot GigaWorld-Policy- 2026.7 GigaAI WAM 0.5 [337] 2025.12 VideoVLA [311] 西安交通大学 VLA 2025.12 Motus [18] 清华大学 WAM Xiaomi-Robotics- 2025.12 GR00T N1.6 [20] 英伟达 VLA 2026.7 1 [340] 小米 VLA 2026.7 Xiaomi Robotics WAM U0 [201]

基础模型仍然是一个未解之谜。主要或完全在机器人数据上预训练的模型,如 LingbotVLA [376] 和 DreamZero [397],也能取得强大的性能,且目前的证据并未表明纳入更多数据类型 inherently 更优。然而,我们认为不同类型的数据可以提供互补的能力:通用数据可以支持广泛的视觉、语义和推理能力;第一人称视角和 UMI 数据可以扩展场景、物体、视角和人类行为的覆盖范围;而仿真数据可以通过可控且可扩展的交互生成来加强特定技能。

第二个趋势是预训练规模的快速增长。早期的模型如 OpenVLA [174] 和

36

第 37 页

VideoVLA [311] 主要在 Open X-Embodiments 生态系统的机器人演示语料库上进行预训练,而 GR-2 [41] 则代表了早期尝试在相对有限的机器人和第一人称数据混合体上进行联合训练。到 2026 年,报告的规模已大幅增加。Qwen-RobotManip [412] 构建了一个约 38,100 小时的多源语料库,包括约 11.4K 小时的开源机器人数据和 24,808 小时从 1,933 小时第一人称视频合成的与机器人兼容的轨迹。Xiaomi-Robotics-1 [340] 进一步报告了在超过 100,000 小时的真实世界 UMI (Universal Manipulation Interface) 轨迹上进行预训练,随后进行了约 10,000 小时的跨具身形态后训练数据训练,其中包括超过 7,200 小时的内部机器人轨迹和超过 1,000 小时带有指令标注的 UMI 数据。尽管由于模态、处理、过滤和训练阶段的差异,这些数量不可直接比较,但它们共同说明了具身预训练从传统机器人数据集向包含数万甚至数十万小时交互数据的语料库的演进过程。

第三个且密切相关的趋势是第一人称人类数据的重要性日益增加。如表 7 所示,第一人称数据已被纳入越来越多模型的异构预训练配方中,包括 GR-2 [41]、GR00T N1 [20]、GR-3 [42]、Motus [18]、π0.7 [151]、Qwen-VLA [352]、Qwen-RobotManip [412] 和 LingbotVA 2.0 [426]。

其他研究更进一步,在预训练期间将第一人称数据作为主要或唯一来源,包括 EgoVLA [391]、Being-H0 [237]、H-RDT [19]、VITRA [199]、UniDex [420] 和 HumanScale [244]。HumanScale 使用多达 5,000 小时精心策划的第一人称视频进行受控预训练,而 EgoScale [443] 将带有动作标注的第一人称预训练扩展至 20,854 小时,并报告了在从 1,000 到 20,000 小时的子集上的一致改进。这些研究共同表明,第一人称数据已不仅仅是辅助来源:其可扩展性和对人类-物体交互的丰富覆盖使其成为通用网络数据与特定具身形态机器人轨迹之间日益重要的预训练基础。

除了这些主要趋势外,最近的工作也开始重新审视严格的数据质量要求。早期的训练管道主要保留成功且精心策划的演示,而 π0.7 [151] 表明,当与足够清晰的提示配对时,较低质量的轨迹仍可能提供有用的监督。这一观察结果仍处于初步阶段,但表明从激进的数据过滤向更明确地基于轨迹质量和意图的条件控制可能发生转变。

7.2.2 机器人基础模型中的动作空间表示

机器人基础模型越来越多地整合来自不同具身形态的动作轨迹,但这些动作在不同数据集中并不直接可比。差异不仅源于特定具身形态的控制维度和执行器语义,还源于用于表达末端执行器运动的坐标系和几何约定。因此,现有方法在两个互补的层面上解决动作空间异构性问题:跨具身形态结构对齐,它确定如何将不同的控制变量映射到共享的动作接口;以及几何对齐,它确定空间动作所表示的参考框架。以下讨论回顾沿这两个维度的代表性策略,并考察它们对多具身形态预训练和迁移的影响。

跨具身形态动作空间表示。现有的具身基础模型通过三种主要策略协调异构的机器人动作空间:特定具身形态投影、固定维度零填充动作接口和语义动作槽。这些策略在解决动作空间异构性的层面上有所不同。第一种保留特定具身形态的动作接口,并仅在共享模型表示内对其进行对齐;第二种标准化动作向量的维度,而不强制执行一致的物理语义;第三种明确将异构的机器人动作组织成一组共同的、语义定义的控制维度。

(1) 特定具身形态投影。该策略保留每个机器人的原生动作维度和控制语义,同时使用特定具身形态的投影器、适配器或动作头,将异构的状态-动作表示映射到共享策略骨干网中并从中映射出来。因此,它实现了表示级别的共享,而无需替换特定机器人的控制接口,如 GR00T N1 [20]、Octo [339] 和 SmolVLA [316] 所采用的那样。

(2) 固定维度零填充动作接口。该策略预留一个共同的动作向量维度,

第 38 页

跨具身形态的维度。动作空间维度较低的机器人将未使用的维度填充为零,通常配合有效性掩码,从学习目标中排除非活跃维度。这为联合训练提供了统一的张量接口,但不要求不同机器人间的对应维度具有相同的物理语义 [21, 352, 393]。

(3) 语义动作槽。该策略为共享动作向量中预定义的维度或块分配固定的物理含义,使得对应条目在不同具身形态间保持一致的控制语义,同时不可用的组件被掩码或零填充。Qwen-RobotManip[412] 提供了一个典型的实现,定义了一个由两个 29 维机械臂块和 22 个保留维度组成的 80 维规范状态-动作向量。每个机械臂块分配 7 维给机械臂关节,9 维给末端执行器位姿,1 维给平行夹爪,12 维给灵巧手关节。不同的具身形态仅填充相关子集,非活跃字段填充为零,并使用逐维度二元掩码将其从流匹配目标中排除。相关的语义槽设计也被 RDT-1B [225]、Being-H0.5 [238]、Green-VLA [7]、UniDex [420]、JoyAI-RA 0.1 [428]、Wall-OSS-0.5 [406] 和 LingbotVLA 2.0 [377] 采用。与形状级填充相比,这种形式通过统一动作维度和物理语义,提供了更强的跨具身形态对齐。

几何动作表示。

除了维度和语义对齐外,更好的跨数据集对齐可能还需要考虑用于表示末端执行器动作的坐标系,因为在不同的几何约定下,等效运动可能获得不同的数值。现有方法大致可分为三类。

(1) 机器人中心表示。该策略在世界坐标系或机器人基座坐标系中表示末端执行器位姿或运动指令,为传统机器人控制器提供直接接口。然而,由此产生的表示可能仍然与特定具身形态的基座位姿、安装配置和工作空间约定耦合,Open X-Embodiment [64] 即为例证。

(2) 相机中心表示。该策略将动作转换到相机坐标系,旨在为不同具身形态和场景中视觉上相似的运动分配更一致的数值表示。Qwen-RobotManip [412] 和 OC-VLA [429] 采用了相机中心动作表示。

(3) 手腕中心表示。该策略在规范手腕坐标系中表示指尖位姿、手部关键点或局部手部运动,旨在将局部手部关节运动与全局手腕平移和旋转分离。METIS [101] 和 LDA-1B [241] 使用了此类表示。

无论选择何种坐标系,其实现都应明确指定坐标系原点、轴、坐标系手性、工具中心点、绝对与增量动作模式、旋转参数化以及物理单位。然而,现有研究在这些表示上的受控消融实验有限,目前尚不清楚是否有任何坐标约定在不同数据集和具身形态间始终提供优越的迁移或控制性能。

7.3 具身大脑的应用

具身大脑模型通常指在物理世界理解任务上预训练的视觉-语言模型,以支持机器人感知和高层决策。与直接强调动作生成或动力学预测的 VLA 和 WAM 不同,这些模型侧重于时空感知、物理推理、接地、时间记忆和任务规划。代表性模型包括 RynnBrain [74]、HY-Embodied [409] 和 Pelican-VL [431],它们在下游控制之前或同时增强这些能力。

因此,它们的训练数据不一定总是包含低级机器人动作;关键在于监督是否有助于形成具有物理意义的表示。通用多模态数据可以支持语义理解、视觉常识 [140]、OCR、记忆和空间推理,而包含动作、状态或运动线索的交互数据可以提供功能、抓取、轨迹和规划监督。因此,最近的具身大脑模型结合了通用多模态数据和具身接地数据 [74, 158]。基于可用的监督,我们将这些数据分为两类:用于具身理解的无动作数据和用于物理接地的带动作标签数据。

38

第 39 页

7.3.1 面向具身理解的无动作数据

用于训练具身大脑的数据中,有相当一部分不包含显式的动作标注。这包括通用图文、视频文本、视觉问答(VQA)、光学字符识别(OCR)、时空问答以及指令遵循数据,还包括为字幕生成、问答、时间记忆或任务理解而重新标注的第一人称视频。尽管缺乏机器人状态和控制指令,此类数据为物体识别、语言理解、视觉常识、时空推理、物体功能推断及任务理解提供了必要的监督 [31, 74]。

无动作视频还可以通过时间预测、掩码视频建模或未来帧生成来支持以机器人为中心的视频预训练。这些目标使模型能够学习物体恒常性、运动模式、手-物交互、状态转换和粗略的物理动力学,而无需为每个片段提供动作标签。代表性示例包括 GR-1、V-JEPA 2、DreamDojo 以及 Cosmos Predict 等物理人工智能视频基础模型 [3, 8, 109, 365]。由此产生的视觉-时间表示可作为具身大脑的主干,或在下游适应过程中与规划和动作模块耦合。

然而,仅基于视频的预训练主要提供观察性知识而非可执行知识。它并不一定揭示哪种动作导致了状态转换,或者该转换对于特定具身形态是否可行;可执行控制仍需动作条件轨迹、机器人状态、逆动力学监督或策略适应。因此,无动作数据的主要作用是支持物理世界理解,而非特定具身形态的动作对齐。通用多模态数据提供广泛的语义和常识先验,而第一人称数据则让具身大脑接触到第一人称视角、遮挡、手-物交互、物体状态变化以及长周期任务进展 [74, 409]。

7.3.2 面向物理锚定的动作标注数据

动作标注数据包含显式的交互信号或可从中恢复此类信号的演示。它们包括真实机器人轨迹、手持夹具演示、模拟 rollout 以及包含机器人状态、手或夹具运动、物体状态变化或动作标注的交互视频。对于具身大脑而言,这些信号通常不作为原始控制目标使用,而是转换为更具可迁移性的监督信号,如可用性(affordance)位置、抓取姿态、轨迹航点、动作边界、子任务标签和下一动作标注。RoboBrain 和 ShareRobot 通过将任务规划、物体可用性和末端执行器轨迹视为核心监督信号, exemplify 了这一方法 [158]。

此类监督支持三种紧密相关的能力。首先,可用性标签识别具有功能意义的交互区域,如把手、按钮、接触表面和放置区域。它们可以通过分割、手或夹具跟踪、接触估计和物体状态变化检测进行手动标注或恢复 [158, 431]。其次,跟踪、姿态估计、SLAM 和相机运动恢复可以将演示转换为 2D 或 3D 轨迹、稀疏航点和接近方向。这些目标比静态可用性提供更丰富的物理信息,同时比特定具身形态的关节指令更具可迁移性 [158, 432]。第三,演示可以被分割为原子动作、子目标和步骤边界,使具身大脑能够识别任务进展并预测后续动作 [74, 158]。

不同的数据源提供互补的动作监督。真实机器人数据提供与具身形态对齐的状态和控制轨迹;手持夹具数据提供更可扩展的类末端执行器运动来源;而模拟则提供自动可访问的物体状态、接触、轨迹、成功条件和失败标签。总体而言,动作标注数据在物理理解和可执行行为之间架起了桥梁。它们不要求具身大脑直接模仿底层控制,而是将感知和推理锚定在可用性、轨迹和任务结构上,从而随后支持下游 VLA 和 WAM 的训练 [269, 409, 432]。

7.4 视觉-语言-动作模型的应用

视觉-语言-动作(VLA)模型通常建立在视觉语言模型主干之上,并将其多模态理解能力扩展至下游机器人控制。虽然具身 VLM 主要关注感知、锚定、时空推理和高层任务理解,

39

第 40 页

视觉-语言-动作(VLA)模型进一步强调了如何将多模态表征转化为可执行的行为。因此,VLA 模型不仅被期望识别与任务相关的物体、状态和可供性(affordances),还需规划动作序列、预测底层动作块,并适应特定的机器人形态和环境。OpenVLA [174]、Octo [339] 和 π0.5 [150] 等近期系统通过整合大规模视觉-语言预训练与具身数据, exemplify 了这一范式,实现了通用操作策略,能够遵循语言指令、定位与任务相关的物体,并在 diverse 任务、场景和机器人平台上生成动作。

VLA 模型的动作导向特性涉及两个互补的能力层级。一方面,VLA 模型必须理解场景和环境,包括与任务相关的物体定位、物体跟踪、空间关系、物体状态、可供性和时间上下文。这些能力建立在高层视觉-语言理解之上,为决定“应该做什么”提供必要的 grounding。另一方面,VLA 模型必须将这种 grounded 理解转化为特定于形态的规划和执行,例如动作块生成,以及适应机器人的形态和动作空间。这一双重目标导致了对具身训练数据的独特视角:无动作数据主要支持具身理解和物理 grounding,而有动作标签的数据直接监督策略学习和动作生成。

7.4.1 有动作标签的数据

有动作标签的数据构成了训练 VLA 模型的主要监督来源,因为它们明确规定了如何将视觉-语言观测映射到可执行的机器人行为。一种常见策略是将连续的机器人动作离散化为动作 token,允许以与语言 token 相同的格式自回归地生成动作。这种表述使得重用预训练的 VLM 骨干网络成为可能,并保留从大规模视觉-语言预训练中获得的知识,同时通过轨迹监督将模型适应于机器人控制 [23, 174]。

然而,离散的动作 token 可能不足以应对高频、细粒度或灵巧的操作,因为在连续控制中的微小误差会显著影响执行结果。为了解决这一局限性,近期的 VLA 系统越来越多地采用连续动作头。基于扩散的策略 [20, 225, 364] 将动作生成表述为连续动作序列上的条件去噪过程,从而能够表达性地建模高维且可能多模态的动作分布。与此同时,基于流匹配的策略 [28, 150, 316] 学习一个连续向量场,将噪声动作样本传输至可执行的动作轨迹,为高频连续控制提供了一种直接且高效的表述。这些方法表明,有动作标签的数据不仅提供直接的控制监督,还塑造了 VLA 模型使用的动作表征,从类似语言的离散 token 到表达性强的连续动作分布。

除了机器人收集的轨迹外,带有手部姿态的自我中心人类视频为灵巧 VLA 学习提供了可扩展的监督来源。一些方法重建人类手部运动,将其重定向到特定的机器人手部,并通过手部修复或机器人手部渲染进一步缩小视觉形态差距 [192, 280, 310, 384]。其他方法将人类和机器人演示映射到共享的动作或交互空间,如手腕和指尖姿态、MANO 参数、3D 关键点或实体级手-物表征,从而能够在人类数据上进行大规模预训练,随后轻量级地适应机器人形态 [101, 238, 391, 420, 443]。这些方法拓宽了有动作标签数据的范围,超越了直接收集的机器人轨迹,为扩展灵巧策略学习提供了一条有前景的途径。

7.4.2 无动作数据

从无动作视频中学习动作代理。大规模视频提供了关于物体在操作过程中如何移动以及状态如何变化的丰富证据,尽管缺乏相应的动作标签。为了利用此类数据进行 VLA 学习,现有方法从时间观测中推导动作代理,既可以是隐式的潜在表征,也可以是显式的几何结构,如点轨迹和运动场。这些代理并不被假设为可执行的机器人动作。相反,它们编码了可以在视频规模上学习并随后 grounding 到特定机器人动作空间中的视觉转换或交互动力学。

40

第 41 页

潜在动作是从观察序列中学习到的、与动作相关的状态转移的紧凑表示,无需显式的动作标签。LAPA [396] 从无标签视频中学习离散潜在动作,并将其作为 VLA 预训练的伪动作标签。Moto [54] 将视觉运动表示为潜在运动令牌,用于自回归运动先验学习。UniVLA [27] 引入以任务为中心的潜在动作,以抑制与任务无关的视觉动态。Villa-X [52] 进一步利用视觉和本体感觉的未来预测来约束潜在动作,而 CLAP [419] 和 ConLA [69] 则使用对比目标将与动作相关的动态从无关的视觉变化中解耦。这些方法具有可扩展性,因为它们避免了显式的手-物体标注,但学习到的潜在空间仍需机器人演示、动作解码器或下游对齐,才能在特定具身形态上可执行。

另一类互补工作明确从视频中重建操作的空間或几何表示。尽管这些方法在严格意义上并非 VLA 模型,但它们展示了此类表示如何桥接视觉观察与机器人控制。VideoDex [309] 将从视频中提取的人类手部运动转移到机器人策略,而 ViSA-Flow [44] 从人类演示中学习视觉运动表示,随后利用机器人数据进行适配。General Flow [410] 将操作表示为以物体为中心的运动场,Track2Act [15] 将预测的点轨迹转换为物体变换和机器人动作。VidBot [45] 和 Actron3D [417] 进一步从人类视频中恢复三维轨迹或可转移的动作表示。与潜在动作相比,这些几何表示更具可解释性且可转移到机器人控制,但更依赖于可靠的感知和跨具身形态的对齐。

分层与中间监督。利用无动作数据的另一种方式是将其用于学习分层或中间监督,以指导下游的动作生成。通用视觉-语言数据、人类视频和任务演示可以提供高层语义知识、任务分解、子目标预测和思维链推理,帮助 VLA 模型在预测如何行动之前决定应该做什么。例如,π0.5 [150] 利用异构数据改进语义场景理解和高层任务结构建模,而 CoT 风格的 VLA 模型 [312, 437, 445, 447] 引入显式的中间推理,如视觉目标、语言计划或动作级思维,以支持长时程操作。此外,无动作或弱标注数据可以提供可供性(affordance)级别的监督,例如预测与任务相关的交互区域、可抓取区域或功能性物体部件,这作为感知与控制之间的空间基础桥梁。最近的可供性感知 VLA 模型 [195, 405] 利用此类中间表示,使策略专注于交互的位置和方式,从而提高复杂场景中动作生成的鲁棒性。

7.5 世界-动作模型的应用

世界-动作模型(WAM)模拟物理世界的时序演化以及动作对这种演化的影响。与强调感知和推理的具身 VLM 以及直接将多模态观察映射到可执行行为的 VLA 模型不同,WAM 将世界动态作为主要学习目标,因此训练好的 WAM 可以作为学习到的模拟器、规划器、策略评估器或合成交互数据的生成器。

这一范式源于基于模型的控制在潜在世界模型中的应用,其中 Dreamer 系列 [128, 370] 学习动作条件的潜在动态,并通过在模拟和真实环境中的想象 rollout 优化策略。生成式视频建模随后将世界建模扩展到开放域视觉数据,如 UniSim [392]、GAIA-1 [143] 和 Genie 系列 [25, 117] 所代表。在机器人领域,包括 GR-2 [41]、IRASim [451]、EnerVerse [146]、Genie Envisioner [210]、V-JEPA 2 [8]、WorldVLA [36] 和 Cosmos [269] 在内的近期系统将这一范式应用于操作,将动作条件的未来预测与动作生成和策略评估相结合。

最近的综述沿着互补的轴组织这一迅速扩展的设计空间:按输出表示,涵盖基于视频、占用栅格和激光雷达的世界建模与生成 [177];按能力水平,区分仅进行预测的模型与作为可控模拟器或自我改进智能体的模型,以及它们各自应遵守的物理和数字规律 [63]。这些组织视角在此很有用,因为它们明确了给定世界模型角色所需的数据:被动预测可以仅从观察中学习,而模拟器和评估器风格的使用还需要动作条件和结果标注的交互数据。

41

第 42 页

从数据角度来看,WAM 的训练数据可根据是否存在用于建模世界状态转移的动作条件进行划分。带有动作标签的数据(包括真实机器人轨迹、UMI 风格的演示以及来自数据金字塔上层部分的仿真 rollout)提供了可执行或类动作的信号,用于指定引发特定状态转移的动作。无动作数据(包括通用多模态语料库以及来自下层部分的自我中心或外部视角视频)仅支持观察层面的未来预测。在实践中,大多数系统遵循两阶段配方:大规模无动作预训练建立通用的动力学先验,而基于动作条件的后训练则将这些先验锚定在交互数据上 [8, 41, 269, 365]。

7.5.1 带有动作标签的数据

大多数 WAM 基于扩散视频生成模型构建,因此将动作预测表述为连续生成问题。给定真实动作序列,根据扩散调度添加噪声,模型学习通过类似于视频生成所使用的扩散或流匹配目标来恢复干净的动作。在架构方面,Genie Envisioner 在其预训练的世界模型主干上附加了一个轻量级的流匹配动作专家 [210, 231]。Motus 采用混合 Transformer 架构,拥有独立的视频和动作专家,允许两种模态交互的同时保留模态特定的参数 [18, 194]。VideoVLA 在多模态 Diffusion Transformer [311] 内联合建模视频和动作流,而 Cosmos Policy 直接将动作编码为潜在帧,并使用原始视频扩散主干进行处理,未引入单独的动作架构 [175]。

一个重要的例外是 WorldVLA,它基于自回归生成模型而非扩散模型构建 [36]。它将视觉观察和连续机器人动作离散化为标记,并通过带有交叉熵损失的自回归下一个标记预测联合预测它们。一种相关的设计压缩了预测目标而非主干:在自动驾驶中,Xiaomi OneVL 通过一组使用辅助解码器训练的潜在标记进行推理,这些解码器重建文本思维链并预测未来帧标记,从而在训练期间将世界动力学吸收进潜在空间,而推理保持为单次并行传递 [234]。从数据角度来看,这种潜在表示具有吸引力,因为未来预测目标可以由原始未来观察监督,而不是由额外的动作或推理注释监督。

因此,WAM 中动作标签的使用可以广泛总结为两种范式:使用扩散或流匹配目标的连续动作去噪,以及使用自回归目标的离散动作标记预测。在这两种情况下,动作监督都将模型对未来世界演化的表示与可执行的机器人控制对齐。

7.5.2 无动作数据

无动作数据建立了 WAM 的基本世界先验。此类数据包括不包含显式或可恢复动作变量的通用多模态数据和自我中心或外部视角视频。相应的监督是仅观察的未来预测,例如预测未来帧、视觉潜在变量、场景状态或状态变化的语言描述。此类目标教会模型世界通常如何演化,但不教会哪种动作引发特定的状态转移,因此无动作数据贡献的是广泛的时间和物理先验,而非可执行的动作条件动力学。

通用视频和多模态数据。网络规模的视频语料库构成了动力学监督的最大来源。UniPi [89] 将决策表述为文本条件的视频生成,UniSim [392] 将异构视频和交互数据聚合到真实世界的交互式模拟器中,Cosmos [269] 在网络规模视频上预训练全模态世界模型,随后进行物理 AI 后训练。预测不一定发生在像素空间:V-JEPA 2 从超过一百万小时的互联网视频中学习潜在视频预测 [8]。这些数据提供了通用但至关重要的先验,包括物体恒存性、场景几何、物理合理性以及日常任务的典型时间结构。

自我中心和外部视角视频。EPIC-KITCHENS [72]、Ego4D [118] 和 Ego-Exo4D [119] 等自我中心数据集在分布上比通用网络视频更接近机器人观察。它们使模型接触到第一人称交互、手-物体遮挡、视角变化、物体状态转换以及

42

第 43 页

长程任务进展,这些正是部署中的操作系统的观测模式,且难以从其他来源获得。

透过数据金字塔来看,底层无动作数据提供了可扩展且多样的观测先验,而更高层级则逐步增加语义、潜在和具身特定的动作接地。训练好的世界模型反过来通过生成合成交互数据 [155, 269] 以及在策略评估中替代物理环境 [161, 286] 反馈到金字塔中。统一系统如 Pelican-Unified [432] 和 Cosmos 3 [269] 进一步展示了如何将异构监督——包括视觉、语言、未来生成和动作数据——纳入共享建模框架。

要点

数据应用 具身基础模型训练配方正转向更多样化的数据源和显著更大的规模。自数据也在发挥越来越重要的作用,同时人们对噪声或较低质量轨迹的容忍度也在增加。然而,最佳配方仍未解决,因为尚未系统地隔离每种数据源的贡献,且仅机器人模型仍能取得强劲性能。在具身大脑(VLMs)、VLAs 和 WAMs 中,无动作标签数据主要保留通用能力或支持潜在动力学学习,而有动作标签数据则将模型接地于物理交互和可执行控制。

8 挑战与未来方向

本节围绕三个问题组织机器人学习数据的未来方向:收集什么、如何收集以及如何利用。首先,收集什么涉及现有数据集中代表性不足的交互信息形式。特别是,需要失败和恢复轨迹使模型接触不成功的行为和纠正动作,而触觉数据对于表征接触状态、力、材料属性和细粒度交互动态是必需的,这些无法仅从视觉观测中完全推断。

其次,如何收集侧重于可扩展和自适应的数据获取。未来的收集管道应减少对昂贵手动遥操作的依赖,扩展任务和场景覆盖范围,并将收集工作分配给数据分布中代表性不足、不确定或行为信息丰富的区域。

最后,如何利用解决模型训练期间异构数据源的集成问题。这包括对齐不同具身形态的动作表示,确定结合数据金字塔不同层级来源的有效数据配方,以及将自人类交互数据转移到灵巧机器人操作。这些方向共同将焦点从单纯增加数据集规模转向提高具身数据的覆盖范围、获取效率和有效利用。

8.1 接触丰富机器人学习的触觉数据

尽管大规模机器人学习数据集迅速扩展,但大多数现有数据资源仍以 RGB-D 观测、本体感受状态、语言指令和动作轨迹为中心,而触觉感知仍未作为标准模态系统性地纳入 [64, 173, 232]。这导致当前数据金字塔中缺失接触层:视觉观测可以描述场景几何和物体运动,但它们仅提供接触力、滑动、局部变形、摩擦和抓取稳定性的间接证据。虽然最近的机器人数据集如 RoboMIND 2.0 [142] 和 Humanoid Everyday [440] 已开始纳入触觉信号,但触觉感知尚未成为机器人数据收集的常见或标准化组成部分。与 RGB-D 观测和动作轨迹相比,触觉数据仍然较少见,并且通常受限于特定传感器的硬件、不一致的信号格式、有限的任务覆盖以及与长程操作轨迹的集成较弱。

8.2 失败数据与以恢复为中心的机器人学习

大多数现有机器人学习数据集强烈偏向成功的专家演示,而失败、接近失败和次优轨迹经常被丢弃或仅粗略标记。这

43

第 44 页

以成功为中心的数据偏差限制了所学策略在现实世界部署中接触多样化错误状态的机会。主要基于成功轨迹训练的策略可能学会在正常条件下完成任务,但在识别即将发生的故障、诊断其原因或执行偏离预期轨迹后的恢复方面缺乏足够的监督。因此,故障数据不应仅仅被视为低质量的经验,而应被视为故障意识、因果诊断和恢复行为的重要监督来源。

现有工作已开始从多个角度探索以故障为中心的数据。一些研究构建了面向故障的数据集或基准,用于故障检测、诊断、解释和纠正推理 [90, 120, 228, 235, 271, 416]。其他研究明确使用故障和恢复轨迹增强训练数据,使策略能够学习超出正常专家演示的纠正行为 [70, 215]。同时,不完美的和不成功的演示也被证明包含可重用的轨迹片段,当被适当识别和过滤而非简单丢弃时,这些片段有助于策略学习 [367]。

尽管如此,故障数据在规模上仍然有限,且缺乏系统性的组织。机器人操作中的故障具有高度异质性,可能源于感知错误、定位不准确、任务规划不当、抓取失败、物体滑脱、接触力过大、运动学约束或长周期执行中的累积误差。二元成功或失败标签不足以表示这种时间和因果结构。未来的数据集应提供更丰富的以故障为中心的注释,包括故障前上下文、故障发生、故障类别和原因、物体和机器人状态变化、恢复动作以及最终恢复结果。更重要的是,未来的数据收集流程应系统地保留和整理机器人在执行过程中遇到的故障,而不是将其视为不可用的轨迹。构建大规模、多样化和结构化的故障-恢复数据集,可能使具身代理不仅能够模仿成功行为,还能理解、预测并从自身的错误中恢复。

8.3 跨金字塔层级的可扩展数据收集

自我中心数据收集正从第一人称 RGB 视频扩展到多样化的可穿戴传感器。头戴式 AR/MR 设备可以记录视线、头部姿态、深度和空间上下文,而手腕相机、手部安装的 IMU 和仪器化手套则捕捉手部运动和手-物交互。触觉贴片、力传感器和肌电图 (EMG) 进一步提供视觉无法直接观察的接触、抓握力、滑脱和肌肉激活信号 [138, 171, 178, 245, 351, 378, 449]。DexUMI 和 RealDexUMI 等可穿戴接口也显示出收集与机器人学习更兼容的灵巧演示的潜力 [383, 384]。

然而,许多这些设备尚未成熟,无法大规模部署。头部和手部跟踪仍然对遮挡、运动模糊、漂移和有限的视场敏感,而手套、触觉传感器和 EMG 需要仔细的贴合、校准和同步,并可能干扰自然操作。因此,未来的系统应变得更轻、无线、模块化且侵入性更小,同时支持自动跨设备校准、机载手-物重建和标准化的传感器元数据。这些发展可以在不牺牲机器人学习所需的详细运动和接触信号的情况下,扩展新兴的任务导向自我数据集的规模 [157, 205, 443]。

8.4 跨具身形态的状态-动作对齐

随着真实机器人数据集越来越多地聚合来自异构平台的轨迹,仅靠统一的数据格式并不能确保兼容的监督。为了促进跨具身形态的聚合,机器人状态和动作通常表示为笛卡尔末端执行器位姿空间,而不是形态特定的关节空间,从而提供跨平台更具可转移性的接口。然而,末端执行器位姿仍可能相对于机器人基座、相机、局部末端执行器或世界坐标系定义,导致相同的物理运动在不同数据集中对应不同的数值表示 [64]。这种不一致性可能在联合训练期间引入冲突的监督,并显著影响跨具身形态的转移和数据缩放行为 [357, 412]。因此,有效的状态-动作对齐需要一致的几何语义,而不仅仅是共享的存储模式。未来的数据集应将坐标约定、校准参数和控制模式作为一等元数据记录。当可靠的变换

44

第 45 页

可用,动作可规范化到共享参考系(如相机、末端执行器或世界坐标系),以支持跨具身形态的一致性聚合 [382, 412]。

8.5 灵巧手策略学习中的自我中心先验

尽管自我中心的人类数据为灵巧操作提供了直观的先验来源 [30, 101, 238, 391, 443],但如何最优地利用此类先验进行机器人策略学习仍是一个开放问题。人机差距不仅在于视觉,还涉及运动学、形态学和物理层面:人手与机械手在关节拓扑、自由度、指尖几何形状、柔顺性、驱动方式、传感、摩擦和力限制等方面存在差异。因此,重定向后的运动即便在几何上看似合理,仍可能违反机器人特定的约束条件,或无法在真实硬件上产生稳定的接触。具身感知的图像修复(Embodiment-aware inpainting)[192, 384] 可以通过用人手渲染图替换人手来缩小视觉差距,但合成的交互往往缺乏物理基础,可能会损害模型学习真实手部-物体交互动力学的能力,而这对于灵巧操作至关重要 [383, 411]。

一个有前景的方向是将自我中心数据视为结构化交互先验的来源,而非精确的机器人动作标签。人类视频可以提供关于任务意图、物体功能、抓取选择、接触序列、工具使用策略和长时程操作结构的可迁移信息,而机器人数据则将这些先验锚定在具身特定的动作和接触动力学上。形态条件化策略、以接触为中心的代表性表示以及不确定性感知的重定向可能有助于将广泛可迁移的交互知识与依赖具身形态的执行细节分离开来。

8.6 数据配方

如图 3 所示,具身基础模型的数据配方已逐渐扩展到数据金字塔的不同层级。早期模型主要将真实机器人数据与通用视觉-语言数据相结合,而最近的报告越来越多地构建涉及真实机器人、仿真、自我中心、UMI 风格和通用多模态数据的混合体。不同模型并未收敛于单一的组成方式,而是根据其训练流程选择和组合这些数据来源的不同子集。特别是,自我中心数据已成为大规模预训练中日益常见的组成部分,而通用数据继续与具身特定和对齐动作的数据广泛结合使用。这一趋势表明,从依赖单一主导数据来源转向联合利用数据金字塔的多个层级。

然而,最有效的数据组成仍然是一个开放问题。通用、自我中心、仿真、UMI 风格和真实机器人数据之间的最优比例尚未确立。现有报告在来源组合、采样比例和分阶段分配策略方面存在显著差异。针对单个数据集和数据类别的精确、计算量匹配的消融研究仍然有限。同一数据来源在不同模型架构、动作表示和训练目标下产生的性能增益也缺乏充分的表征。因此,未来的工作应研究架构感知和阶段依赖的数据配方,对固定、基于课程和自适应混合策略进行系统比较。此类研究可能有助于确定数据金字塔的每一层在何时最有用,并为在受限的采集和训练预算下分配数据提供更可复现的原则。

9 结论

本文提供了以数据为中心的具身智能综合,并定义了一个主要按可扩展性和机器人对齐度组织,以质量、多样性、可重用性和物理保真度为补充维度的具身数据金字塔。从顶端到底部,金字塔包含五个具有不同优势和局限性的数据类别。真实机器人数据为可执行行为和物理交互提供了最直接的监督,但成本高昂且难以扩展。UMI 风格数据支持便携式真实世界采集,具有明确的末端执行器和夹爪监督,但需要校准、重定向和具身特定的控制。自我中心和外中心数据捕捉了多样化的人类活动、手-物体交互和长时程任务结构,但受人机具身差距的限制。仿真数据能够以特权

45

第 46 页

监督信号,尽管其效用受限于环境覆盖范围和仿真到现实的差距。大规模通用多模态数据提供了广泛的语义、感知和推理先验,但在机器人动作、接触和物理结果方面的接地(grounding)有限。

基于此分类法,我们从数据配方(data recipes)的角度分析了最近的具身基础模型。我们总结了动作表示及其对数据兼容性和跨具身形态迁移的影响,并考察了具身大脑模型、视觉-语言-动作模型(VLA)和世界-动作模型(WAM)如何利用异构数据分别支持推理与规划、可执行控制和预测性世界建模。最后,我们指出了数据质量评估、多模态和动作空间标准化、跨具身形态复用、人到机器人和仿真到现实迁移、可扩展的现实世界数据采集、失败与恢复数据以及异构数据混合物的设计与评估等方面的开放挑战。我们希望本文能为理解具身数据景观提供连贯的基础,并为针对不同能力、具身形态和部署场景选择、收集、组合和评估数据提供前瞻性的路线图。

参考文献

[1] Builddotai/egocentric-100k · hugging face 上的数据集。https://huggingface.co/datasets/builddotai/ Egocentric-100K, 2025. URL https://huggingface.co/datasets/builddotai/egocentric-100k.

[2] Iretiayo Akinola, Jie Xu, Jan Carius, Dieter Fox, 和 Yashraj Narang。TacSL: 用于视觉触觉传感器仿真和学习的库。IEEE Trans. Robot., 2025. URL https://arxiv.org/abs/2408.06506.

[3] Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, 等。利用视频基础模型进行物理 AI 的世界仿真。arXiv 预印本 arXiv:2511.00062, 2025. URL https://arxiv.org/abs/2511.00062.

[4] Amirhosein Alian, Yongqiang Zhao, Shiyi Gu, Xuyang Zhang, Zhuo Chen, Christopher E Mower, Haitham Bou-Ammar, 和 Shan Luo。HapTile: 一个触觉感知的视觉-触觉-语言-动作数据集,用于接触丰富的模仿学习。arXiv 预印本 arXiv:2606.04825, 2026. URL https://arxiv.org/abs/2606.04825.

[5] Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, 和 Angjoo Kanazawa。利用开放数据进行可扩展的行为克隆、训练和评估,2026. URL https://arxiv.org/abs/2606.27375.

[6] Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C. Lawrence Zitnick, 和 Devi Parikh。VQA: 视觉问答。In IEEE/CVF Int. Conf. Comput. Vis., 2015. URL https: //arxiv.org/abs/1505.00468.

[7] I. Apanasevich, M. Artemyev, R. Babakyan, P. Fedotova, D. Grankin, E. Kupryashin, A. Misailidi, D. Nerus, 等。Green-VLA: 面向通用机器人的分阶段视觉-语言-动作模型。arXiv 预印本 arXiv:2602.00919, 2026. URL https://arxiv.org/abs/2602.00919.

[8] Mahmoud Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Mojtaba Komeili, Matthew J. Muckley, Ammar Rizvi, 等。V-JEPA 2: 自监督视频模型实现理解、预测和规划。arXiv 预印本 arXiv:2506.09985, 2025. URL https://arxiv.org/abs/2506.09985.

[9] Daichi Azuma, Taiki Miyanishi, Shuhei Kurita, 和 Motoaki Kawanabe。ScanQA: 用于空间场景理解的 3D 问答。In IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2022. URL https://arxiv.org/ abs/2112.10482.

[10] Sven Bambach, Stefan Lee, David J. Crandall, 和 Chen Yu。伸出援手:在复杂的自我中心交互中检测手部和识别活动。In IEEE/CVF Int. Conf. Comput. Vis., 2015. URL https: //doi.org/10.1109/iccv.2015.226.

[11] Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon, Shreyas Hampali, Fan Zhang, Jade Fountain, Edward Miller, Selen Basol, Richard Newcombe, Robert Wang, Jakob Julian Engel, 和 Tomas Hodan。引入 hot3d: 一个用于 3D 手部和物体跟踪的自我中心数据集。arXiv 预印本 arXiv:2406.09598, 2024. URL https://arxiv.org/abs/2406.09598.

46

第 47 页

[12] Chen Bao, Helin Xu, Yuzhe Qin, 和 Xiaolong Wang。DexArt:基于铰接物体的可泛化灵巧操作基准测试。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2023。URL https://arxiv.org/abs/2305.05706。

[13] Gilad Baruch, Zhuoyuan Chen, Afshin Dehghan, Tal Dimry, Yuri Feigin, Peter Fu, Thomas Gebauer, Brandon Joffe, Daniel Kurz, Arik Schwartz, 和 Elad Shulman。Arkitscenes:利用移动 RGB-D 数据进行 3D 室内场景理解的多样化真实世界数据集。在神经信息处理系统进展 (NeurIPS) 上,2021。URL https://arxiv.org/abs/2111.08897。

[14] Charles Beattie, Joel Z. Leibo, Denis Teplyashin, Tom Ward, Marcus Wainwright, Heinrich Küttler, Andrew Lefrancq, Simon Green 等人。DeepMind Lab。arXiv 预印本 arXiv:1612.03801,2016。URL https://arxiv.org/abs/1612.03801。

[15] Homanga Bharadhwaj, Roozbeh Mottaghi, Abhinav Gupta, 和 Shubham Tulsiani。Track2Act:从互联网视频中预测点轨迹可实现可泛化的机器人操作。在欧洲计算机视觉会议 (ECCV) 上,2024。URL https://arxiv.org/abs/2405.01527。

[16] Homanga Bharadhwaj, Jay Vakil, Mohit Sharma, Abhinav Gupta, Shubham Tulsiani, 和 Vikash Kumar。RoboAgent:通过语义增强和动作分块实现机器人操作的泛化与效率。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2024。URL https://arxiv.org/abs/2309.01918。

[17] Vineet Bhat, Naman Patel, Prashanth Krishnamurthy, Ramesh Karri, 和 Farshad Khorrami。MapleGrasp:掩码引导的特征池化用于语言驱动的高效机器人抓取。在 IEEE/CVF 应用计算机视觉冬季会议 (WACV) 上,2026。URL https://arxiv.org/abs/2506.06535。

[18] Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng 等人。Motus:统一的潜在动作世界模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/2512.13030。

[19] Hongzhe Bi, Lingxuan Wu, Tianwei Lin, Hengkai Tan, Zhizhong Su, Hang Su, 和 Jun Zhu。H-RDT:人类操作增强的双臂机器人操作。在 AAAI 人工智能会议 (AAAI) 上,2026。URL https://doi.org/10.1609/aaai.v40i22.38875。

[20] Johan Bjorck, Fernando Castañeda, Nikita Cherniadev, Xingye Da, Runyu Ding, Linxi Fan, Yu Fang, Dieter Fox, Fengyuan Hu, Spencer Huang 等人。GR00T n1:面向通用人形机器人的开源基础模型。arXiv 预印本 arXiv:2503.14734,2025。URL https://arxiv.org/abs/2503.14734。

[21] Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom 等人。π0:用于通用机器人控制的视觉-语言-动作流模型。在机器人科学与系统会议 (RSS) 上,2025。URL https://arxiv.org/abs/2410.24164。

[22] Marius Bock, Hilde Kuehne, Kristof Van Laerhoven, 和 Michael Moeller。WEAR:用于可穿戴和第一人称活动识别的户外运动数据集。ACM 交互、移动、可穿戴和通用技术汇刊,2024。URL https://arxiv.org/abs/2304.05088。

[23] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess 等人。RT-2:视觉-语言-动作模型将网络知识迁移至机器人控制。在机器人学习会议 (CoRL) 上,2023。URL https://arxiv.org/abs/2307.15818。

[24] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu 等人。RT-1:用于大规模现实世界控制的机器人 Transformer。在机器人科学与系统会议 (RSS) 上,2023。URL https://arxiv.org/abs/2212.06817。

[25] Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps 等人。Genie:生成式交互环境。在国际机器学习会议 (ICML) 上,2024。URL https://arxiv.org/abs/2402.15391。

[26] Qingwen Bu, Jisong Cai, Li Chen, Xiuqi Cui, Yan Ding, Siyuan Feng, Shenyuan Gao, Xindong He, Xuan Hu, Xu Huang 等人。AgiBot World Colosseo:面向可扩展和智能具身系统的大规模操作平台。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,2025。URL https://arxiv.org/abs/2503.06669。

[27] Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, 和 Hongyang Li。UniVLA:通过以任务为中心的潜在动作学习在任何地方执行操作。在机器人科学与系统会议 (RSS) 上,2025。URL https://doi.org/10.15607/rss.2025.xxi.014。

47

第 48 页

[28] 蔡俊豪,蔡泽涛,曹家飞,陈一伦,何泽宇,蒋磊,李航,李恒杰,李阳,刘雨飞,等。InternVLA-A1:统一机器人操作的理解、生成与动作。arXiv 预印本 arXiv:2601.02456,2026。URL https://arxiv.org/abs/2601.02456。

[29] 蔡瑞,郭军,何新泽,金飘飘,李杰,林秉轩,刘福腾,刘伟,等。Xiaomi-Robotics-0:一款具备实时执行能力的开源视觉-语言-动作模型。arXiv 预印本 arXiv:2602.12684,2026。URL https://arxiv.org/abs/2602.12684。

[30] 蔡雄毅,邱日昭,陈庚,韦来,Isabella Liu,黄天舒,程旭旭,王小龙。In-N-On:利用野外数据和任务数据扩展第一人称操作。arXiv 预印本 arXiv:2511.15704,2025。URL https://arxiv.org/abs/2511.15704。

[31] 蔡忠刚,王瑞思,顾晨阳,蒲凡,徐俊翔,王宇博,殷万奇,杨志涛,等。利用多模态基础模型扩展空间智能。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/2511.13719。

[32] 曹汉文,方浩水,刘文海,陆兆寿。SuctionNet-1Billion:吸盘抓取的大规模基准测试。IEEE 机器人与自动化快报,2021。URL https://arxiv.org/abs/2103.12311。

[33] 曹子昂,陈兆熙,潘亮,刘子威。PhysX-3D:基于物理的 3D 资产生成。在神经信息处理系统进展 (NeurIPS) 上,2025。URL https://arxiv.org/abs/2507.12465。

[34] 曹子昂,洪方舟,陈兆熙,潘亮,刘子威。PhysX-Anything:从单张图像生成仿真就绪的物理 3D 资产。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/2511.13648。

[35] 曹子昂,刘英浩,李海天,姚润茂,洪方舟,陈兆熙,潘亮,刘子威。PhysX-Omni:面向刚性、可变形和关节物体的统一仿真就绪物理 3D 生成。arXiv 预印本 arXiv:2605.21572,2026。URL https://arxiv.org/abs/2605.21572。

[36] 岑军,余超辉,袁航杰,蒋宇明,黄思腾,郭佳言,李欣,宋一兵,罗浩,王帆,赵德利,陈浩。WorldVLA:迈向自回归动作世界模型。arXiv 预印本 arXiv:2506.21539,2025。URL https://arxiv.org/abs/2506.21539。

[37] Akshay L. Chandra, Iman Nematollahi, Chenguang Huang, Tim Welschehold, Wolfram Burgard, 和 Abhinav Valada。DiWA:基于世界模型的扩散策略适配。在机器人学习会议 (CoRL) 上,2025。URL https://arxiv.org/abs/2508.03645。

[38] Angel Chang, Angela Dai, Thomas Funkhouser, Maciej Halber, Matthias Nießner, Manolis Savva, Shuran Song, Andy Zeng, 和 Yinda Zhang。Matterport3D:从室内环境的 RGB-D 数据中学习。在三维视觉国际会议 (3DV) 上,2017。URL https://doi.org/10.1109/3dv.2017.00081。

[39] Angel X. Chang, Thomas Funkhouser, Leonidas Guibas, Pat Hanrahan, Qixing Huang, Zimo Li, Silvio Savarese, Manolis Savva,等。ShapeNet:一个信息丰富的 3D 模型存储库。arXiv 预印本 arXiv:1512.03012,2015。URL https://arxiv.org/abs/1512.03012。

[40] Vivek Chavan, Yasmina Imgrund, Tung Dao, Sanwantri Bai, 王波松, 陆泽, Oliver Heimann, 和 Jörg Krüger。IndEgo:面向第一人称助手的数据集,包含工业场景与协作工作。在神经信息处理系统进展 (NeurIPS) 上,2025。URL https://arxiv.org/abs/2511.19684。

[41] 郑智霖,陈光增,景雅,孔涛,李航,李一峰,刘宇晓,吴宏涛,徐家峰,杨一楚,张韩博,朱敏昭。GR-2:一款拥有网络规模知识的生成式视频-语言-动作模型,用于机器人操作。arXiv 预印本 arXiv:2410.06158,2024。URL https://arxiv.org/abs/2410.06158。

[42] Chilam Cheang, 陈思金, 崔仲仁, 胡英东, 黄立群, 孔涛, 李航, 李一峰,等。GR-3 技术报告。arXiv 预印本 arXiv:2507.15493,2025。URL https://arxiv.org/abs/2507.15493。

[43] 陈柏钧,万伟杰,陈天兴,郭曦丹,徐聪胜,齐元阳,张浩杰,吴龙岩,徐天凌,李梓轩,等。UnivTac:用于视觉-触觉操作数据生成、学习和基准测试的统一仿真平台。arXiv 预印本 arXiv:2602.10093,2026。

[44] 陈长河,杨 Quantao, 徐晓浩, Nima Fazeli, 和 Olov Andersson。Visa-Flow:通过大规模视频语义动作流加速机器人技能学习。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2026。URL https://arxiv.org/abs/2505.01288。

48

第 49 页

[45] Hanzhi Chen, Boyang Sun, Anran Zhang, Marc Pollefeys, 和 Stefan Leutenegger。Vidbot:从野外 2D 人类视频中学习可泛化的 3D 动作以实现零样本机器人操作。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2025。URL https://doi.org/10.1109/cvpr52734.2025.02576。

[46] Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Conghui He, Jiaqi Wang, Feng Zhao, 和 Dahua Lin。ShareGPT4V:通过改进的图像描述提升大型多模态模型性能。在欧洲计算机视觉会议 (ECCV) 上,2024。URL https://arxiv.org/abs/2311.12793。

[47] Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen 等。ABot-M0.5:统一的移动与操作世界动作模型。arXiv 预印本 arXiv:2607.00678,2026。URL https://arxiv.org/abs/2607.00678。

[48] Siwei Chen, Yiqing Xu, Cunjun Yu, Linfeng Li, Xiao Ma, Zhongwen Xu, 和 David Hsu。Daxbench:利用可微物理进行变形物体操作基准测试。在国际学习表征会议 (ICLR) 上,2023。URL https://arxiv.org/abs/2210.13066。

[49] Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu 等。Robotwin 2.0:具有强大域随机化的可扩展数据生成器和基准,用于鲁棒的双臂机器人操作。arXiv 预印本 arXiv:2506.18088,2025。URL https://arxiv.org/abs/2506.18088。

[50] Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Weijie Wan, Baijun Chen, Haoran Lu, Haowen Yan, Honghao Su 等。Robodojo:用于全面评估通用机器人操作策略的统一仿真与现实基准。arXiv 预印本 arXiv:2607.04434,2026。

[51] Tianxing Chen, Yuran Wang, Mingleyang Li, Yan Qin, Hao Shi, Zixuan Li, Yifan Hu, Yingsheng Zhang, Kaixuan Wang, Yue Chen 等。Rmbench:具有策略设计见解的依赖记忆的机器人操作基准。arXiv 预印本 arXiv:2603.01229,2026。

[52] Xiaoyu Chen, Hangxing Wei, Pushi Zhang, Chuheng Zhang, Kaixin Wang, Yanjiang Guo, Rushuai Yang, Yucen Wang, Xinquan Xiao, Li Zhao 等。Villa-x:增强视觉-语言-动作模型中的潜在动作建模。在国际学习表征会议 (ICLR) 上,2026。URL https://arxiv.org/abs/2507.23682。

[53] Xinyi Chen, Yilun Chen, Yanwei Fu, Ning Gao, Jiaya Jia, Weiyang Jin, Hao Li, Yao Mu 等。InternVLA-M1:一种空间引导的视觉-语言-动作框架,用于通用机器人策略。arXiv 预印本 arXiv:2510.13778,2025。URL https://arxiv.org/abs/2510.13778。

[54] Yi Chen, Yuying Ge, Weiliang Tang, Yizhuo Li, Yixiao Ge, Mingyu Ding, Ying Shan, 和 Xihui Liu。Moto:将潜在运动令牌作为从视频中学习机器人操作的桥梁语言。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2025。URL https://arxiv.org/abs/2412.04445。

[55] Yi Chen, Yuying Ge, Yixiao Ge, Mingyu Ding, Bohao Li, Rui Wang, Ruifeng Xu, Ying Shan, 和 Xihui Liu。EgoPlan-Bench:对人类级规划的多模态大型语言模型进行基准测试。《国际计算机视觉杂志》,2026。URL https://arxiv.org/abs/2312.06722。

[56] Yuanpei Chen, Tianhao Wu, Shengjie Wang, Xidong Feng, Jiechuang Jiang, Stephen Marcus McAleer, Yiran Geng, Hao Dong, Zongqing Lu, Song-Chun Zhu, 和 Yaodong Yang。通过强化学习迈向人类级双臂灵巧操作。在神经信息处理系统进展 (NeurIPS) 上,2022。URL https://arxiv.org/abs/2206.08686。

[57] Zeren Chen, Zhelun Shi, Xiaoya Lu, Lehan He, Sucheng Qian, Enshen Zhou, Zhenfei Yin, Wanli Ouyang, Jing Shao, Yu Qiao, Cewu Lu, 和 Lu Sheng。RH20T-P:面向现实场景中可组合泛化智能体的基元级机器人操作数据集。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,2025。URL https://arxiv.org/abs/2403.19622。

[58] Zixi Chen, Shixin Zhang, Shan Luo, Fuchun Sun, 和 Bin Fang。Tacchi:一种可插拔且计算成本低的弹性变形模拟器,用于光学触觉传感器。《IEEE 机器人与自动化快报》,2023。URL https://arxiv.org/abs/2301.08343。

[59] Xuxin Cheng, Jialong Li, Shiqi Yang, Ge Yang, 和 Xiaolong Wang。Open-television:具有沉浸式主动视觉反馈的遥操作。在机器人学习会议 (CoRL) 上,2024。URL https://arxiv.org/abs/2407.01512。

[60] Egor Cherepanov, Nikita Kachaev, Alexey K. Kovalev, 和 Aleksandr I. Panov。记忆、基准与机器人:一个用于通过强化学习解决复杂任务的基准。在国际学习表征会议 (ICLR) 上,2026。URL https://doi.org/10.48550/arXiv.2502.10550。

49

第 50 页

[61] Nikita Chernyadev, Nicholas Backshall, Xiao Ma, Yunfan Lu, Younggyo Seo, 和 Stephen James。BiGym:一个演示驱动的移动双臂操作基准。在 Conf. Robot Learn., 2024。URL https://arxiv.org/abs/2407.07788。

[62] Cheng Chi, Zhenjia Xu, Chuer Pan, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Russ Tedrake, 和 Shuran Song。通用操作接口:无需野外机器人的野外机器人教学。在 Robot. Sci. Syst., 2024。URL https://arxiv.org/abs/2402.10329。

[63] Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang 等。代理式世界建模:基础、能力、定律及 beyond。arXiv 预印本 arXiv:2604.22748, 2026。URL https://arxiv.org/abs/2604.22748。

[64] OX-Embodiment Collaboration, Abby O’Neill, Abdul Rehman, Abhinav Gupta, Abhiram Maddukuri, Abhishek Gupta, Abhishek Padalkar, Abraham Lee, Acorn Pooley, Agrim Gupta 等。Open X-Embodiment:机器人学习数据集和 RT-X 模型。在 IEEE Int. Conf. Robot. Autom., 2024。URL https://arxiv.org/abs/2310.08864。

[65] Jasmine Collins, Shubham Goel, Kenan Deng, Achleshwar Luthra, Leon Xu, Erhan Gundogdu, Xi Zhang, Tomas F. Yago Vicente, Thomas Dideriksen, Himanshu Arora, Matthieu Guillaumin, 和 Jitendra Malik。ABO:面向真实世界 3D 物体理解的数据集和基准。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2022。URL https://arxiv.org/abs/2110.06199。

[66] Erwin Coumans 和 Yunfei Bai。PyBullet,一个用于游戏、机器人和机器学习的物理仿真 Python 模块。http://pybullet.org, 2016–2021。URL https://pybullet.org/wordpress/。

[67] Longchao Da, Justin Turnau, Thirulogasankar Pranav Kutralingam, Alvaro Velasquez, Paulo Shakarian, 和 Hua Wei。强化学习中仿真到现实方法的综述:进展、前景以及基础模型带来的挑战。arXiv 预印本 arXiv:2502.13187, 2025。URL https://arxiv.org/abs/2502.13187。

[68] Angela Dai, Angel X. Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, 和 Matthias Nießner。ScanNet:富含注释的室内场景 3D 重建。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2017。URL https://arxiv.org/abs/1702.04405。

[69] Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, 和 Shuo Yang。Conla:从人类视频中学习对比潜在动作以用于机器人操作。arXiv 预印本 arXiv:2602.00557, 2026。URL https://arxiv.org/abs/2602.00557。

[70] Yinpei Dai, Jayjun Lee, Nima Fazeli, 和 Joyce Chai。RACER:用于模仿学习的丰富语言引导的失败恢复策略。在 IEEE Int. Conf. Robot. Autom., 2025。URL https://arxiv.org/abs/2409.14674。

[71] Yinpei Dai, Hongze Fu, Jayjun Lee, Yuejiang Liu, Haoran Zhang, Jianing Yang, Chelsea Finn, Nima Fazeli, 和 Joyce Chai。RoboMME:机器人通用策略的记忆基准测试与理解。在 Int. Conf. Mach. Learn., 2026。URL https://doi.org/10.48550/arXiv.2603.04639。

[72] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Sanja Fidler, Antonino Furnari, Evangelos Kazakos, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, 和 Michael Wray。扩展第一人称视觉:Epic-Kitchens 数据集。在 Eur. Conf. Comput. Vis., 2018。URL https://arxiv.org/abs/1804.02748。

[73] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Antonino Furnari, Evangelos Kazakos, Jian Ma, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, 和 Michael Wray。重新缩放第一人称视觉。Int. J. Comput. Vis., 2022。URL https://arxiv.org/abs/2006.13256。

[74] Ronghao Dang, Jiayan Guo, Bohan Hou, Sicong Leng, Kehan Li, Xin Li, Jiangpin Liu, Yunxuan Mao 等。RynnBrain:开放具身基础模型。arXiv 预印本 arXiv:2602.14979, 2026。URL https://arxiv.org/abs/2602.14979。

[75] Sudeep Dasari, Frederik Ebert, Stephen Tian, Suraj Nair, Bernadette Bucher, Karl Schmeckpeper, Siddharth Singh, Sergey Levine, 和 Chelsea Finn。RoboNet:大规模多机器人学习。在 Conf. Robot Learn., 2020。URL https://arxiv.org/abs/1910.11215。

[76] Matt Deitke, Eli VanderBilt, Alvaro Herrasti, Luca Weihs, Jordi Salvador, Kiana Ehsani, Winson Han, Eric Kolve, Ali Farhadi, Aniruddha Kembhavi, 和 Roozbeh Mottaghi。ProcTHOR:使用程序生成的具身 AI。在 Adv. Neural Inf. Process. Syst., 2022。URL https://doi.org/10.52202/068431-0433。

[77] Matt Deitke, Ruoshi Liu, Matthew Wallingford, Huong Ngo, Oscar Michel, Aditya Kusupati, Alan Fan, Christian Laforte 等。Objaverse-xl:一个包含 1000 万+ 3D 物体的宇宙。在 Adv. Neural Inf. Process. Syst., 2023。URL https://doi.org/10.52202/075280-1554。

50

第 51 页

[78] Matt Deitke, Dustin Schwenk, Jordi Salvador, Luca Weihs, Oscar Michel, Eli VanderBilt, Ludwig Schmidt, Kiana Ehsani, Aniruddha Kembhavi, 和 Ali Farhadi。Objaverse:一个带注释的 3D 对象宇宙。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2023。URL https://doi.org/10.1109/cvpr52729.2023.01263。

[79] Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff 等人。Molmo 和 PixMo:用于最先进视觉-语言模型的开放权重和开放数据。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2025。URL https://arxiv.org/abs/2409.17146。

[80] Shengliang Deng, Mi Yan, Songlin Wei, Haixin Ma, Yuxin Yang, Jiayi Chen, Zhiqi Zhang, Taoyu Yang 等人。GraspVLA:一种在十亿级合成动作数据上预训练的抓取基础模型。在机器人学习会议 (CoRL) 上,2025。URL https://arxiv.org/abs/2505.03233。

[81] Yufan Deng 和 Daquan Zhou。HumanNet:将以人为中心的视频学习扩展至一百万小时。arXiv 预印本 arXiv:2605.06747,2026。URL https://arxiv.org/abs/2605.06747。

[82] Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, 和 Daquan Zhou。重新思考具身世界的视频生成模型。在国际机器学习会议 (ICML) 上,2026。URL https://arxiv.org/abs/2601.15282。

[83] Amaury Depierre, Emmanuel Dellandréa, 和 Liming Chen。Jacquard:一个用于机器人抓取检测的大规模数据集。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,2018。URL https://doi.org/10.1109/iros.2018.8593950。

[84] Abhay Deshpande, Maya Guru, Rose Hendrix, Snehal Jauhri, Ainaz Eftekhar, Rohun Tripathi, Max Argus, Jordi Salvador 等人。MolmoB0T:大规模仿真实现零样本操作。arXiv 预印本 arXiv:2603.16861,2026。URL https://arxiv.org/abs/2603.16861。

[85] Eadom Dessalene, Botao He, Michael Maynord, Yonatan Tussa, Pavan Mantripragada, Yianni Karabati, Nirupam Roy, 和 Yiannis Aloimonos。Feel(力增强型自我中心学习):一个用于物理动作理解的数据集。arXiv 预印本 arXiv:2603.15847,2026。URL https://arxiv.org/abs/2603.15847。

[86] Runyu Ding, Yuzhe Qin, Jiyue Zhu, Chengzhe Jia, Shiqi Yang, Ruihan Yang, Xiaojuan Qi, 和 Xiaolong Wang。Bunny-VisionPro:用于模仿学习的实时双臂灵巧遥操作。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,2025。URL https://arxiv.org/abs/2407.03162。

[87] Laura Downs, Anthony Francis, Nate Koenig, Brandon Kinman, Ryan Hickman, Krista Reymann, Thomas B. McHugh, 和 Vincent Vanhoucke。Google Scanned Objects:一个高质量的家庭用品 3D 扫描数据集。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2022。URL https://arxiv.org/abs/2204.11918。

[88] Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson 等人。PaLM-E:一种具身多模态语言模型。在国际机器学习会议 (ICML) 上,2023。URL https://arxiv.org/abs/2303.03378。

[89] Yilun Du, Sherry Yang, Bo Dai, Hanjun Dai, Ofir Nachum, Joshua B. Tenenbaum, Dale Schuurmans, 和 Pieter Abbeel。通过文本引导的视频生成学习通用策略。在神经信息处理系统进展 (NeurIPS) 上,2023。URL https://arxiv.org/abs/2302.00111。

[90] Jiafei Duan, Wilbert Pumacay, Nishanth Kumar, Yi Ru Wang, Shulin Tian, Wentao Yuan, Ranjay Krishna, Dieter Fox, Ajay Mandlekar, 和 Yijie Guo。Aha:一种用于检测和推理机器人操作中失败的视觉-语言模型。在国际学习表征会议 (ICLR) 上,2025。URL https://arxiv.org/abs/2410.00371。

[91] Frederik Ebert, Yanlai Yang, Karl Schmeckpeper, Bernadette Bucher, Georgios Georgakis, Kostas Daniilidis, Chelsea Finn, 和 Sergey Levine。Bridge Data:利用跨领域数据集提升机器人技能的泛化能力。在机器人科学与系统会议 (RSS) 上,2022。URL https://arxiv.org/abs/2109.13396。

[92] Clemens Eppner, Arsalan Mousavian, 和 Dieter Fox。Acronym:一个基于仿真的大规模抓取数据集。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2021。URL https://arxiv.org/abs/2011.09584。

[93] Zicong Fan, Omid Taheri, Dimitrios Tzionas, Muhammed Kocabas, Manuel Kaufmann, Michael J. Black, 和 Otmar Hilliges。Arctic:一个用于灵巧双臂手-物操作的数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2023。URL https://arxiv.org/abs/2204.13662。

[94] Hao-Shu Fang, Chenxi Wang, Minghao Gou, 和 Cewu Lu。GraspNet-1Billion:一个通用物体抓取的大规模基准。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2020。URL https://doi.org/10.1109/cvpr42600.2020.01146。

51

第 52 页

[95] Hao-Shu Fang, Hongjie Fang, Zhenyu Tang, Jirong Liu, Chenxi Wang, Junbo Wang, Haoyi Zhu, 和 Cewu Lu。RH20T:一个用于学习一次性多样技能的全面机器人数据集。在 IEEE 国际机器人与自动化会议 (IEEE Int. Conf. Robot. Autom.),2024。URL https://arxiv.org/abs/2307.00595。

[96] Haoquan Fang, Markus Grotz, Wilbert Pumacay, Yi Ru Wang, Dieter Fox, Ranjay Krishna, 和 Jiafei Duan。SAM2Act:将视觉基础模型与记忆架构集成以用于机器人操作。在国际机器学习会议 (Int. Conf. Mach. Learn.),2025。URL https://arxiv.org/abs/2501.18564。

[97] Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang 等。MolmoAct2:用于现实世界部署的动作推理模型。arXiv 预印本 arXiv:2605.02881,2026。URL https://arxiv.org/abs/2605.02881。

[98] Yao Mu Fourier ActionNet Team。ActionNet:一个用于灵巧双臂操作的数据集,2025。URL https://action-net.org。

[99] C. Daniel Freeman, Erik Frey, Anton Raichuk, Sertan Girgin, Igor Mordatch, 和 Olivier Bachem。Brax:一种用于大规模刚体仿真的可微物理引擎。在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.),2021。URL https://arxiv.org/abs/2106.13281。

[100] Huan Fu, Bowen Cai, Lin Gao, Ling-Xiao Zhang, Jiaming Wang, Cao Li, Qixun Zeng, Chengyue Sun, Rongfei Jia, Binqiang Zhao, 和 Hao Zhang。3D-front:具有布局和语义的3D家具房间。在 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF Int. Conf. Comput. Vis.),2021。URL https://arxiv.org/abs/2011.09127。

[101] Yankai Fu, Ning Chen, Junkai Zhao, Shaozhe Shan, Guocai Yao, Pengwei Wang, Zhongyuan Wang, 和 Shanghang Zhang。Metis:用于集成灵巧视觉-语言-动作模型的多源第一人称训练。arXiv 预印本 arXiv:2511.17366,2025。URL https://arxiv.org/abs/2511.17366。

[102] Zipeng Fu, Qingqing Zhao, Qi Wu, Gordon Wetzstein, 和 Chelsea Finn。HumanPlus:来自人类的人形机器人影子跟随与模仿。在机器人学习会议 (Conf. Robot Learn.),2024。URL https://arxiv.org/abs/2406.10454。

[103] Zipeng Fu, Tony Z Zhao, 和 Chelsea Finn。Mobile ALOHA:通过低成本全身遥操作学习双臂移动操作。在机器人学习会议 (Conf. Robot Learn.),2024。URL https://arxiv.org/abs/2401.02117。

[104] Ryo Fujii, Masashi Hatano, Hideo Saito, 和 Hiroki Kajita。Egosurgery-phase:来自第一人称开放手术视频的手术阶段识别数据集。在国际医学图像计算与计算机辅助干预会议 (Int. Conf. Med. Image Comput. Comput.-Assist. Interv.),2024。URL https://arxiv.org/abs/2405.19644。

[105] Chuang Gan, Jeremy Schwartz, Seth Alter, Damian Mrowca, Martin Schrimpf, James Traer, Julian De Freitas, Jonas Kubilius 等。ThreeDWorld:一个用于交互式多模态物理仿真的平台。在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.),2021。URL https://arxiv.org/abs/2007.04954。

[106] Jiyang Gao, Chen Sun, Zhenheng Yang, 和 Ram Nevatia。Tall:通过语言查询进行时间活动定位。在 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF Int. Conf. Comput. Vis.),2017。URL https://doi.org/10.1109/iccv.2017.563。

[107] Ning Gao, Yilun Chen, Shuai Yang, Xinyi Chen, Yang Tian, Hao Li, Haifeng Huang, Hanqing Wang, Tai Wang, 和 Jiangmiao Pang。GENMANIP:由大语言模型驱动的仿真以实现可泛化的指令跟随操作。在 IEEE/CVF 计算机视觉与模式识别会议 (IEEE/CVF Conf. Comput. Vis. Pattern Recog.),2025。URL https://arxiv.org/abs/2506.10966。

[108] Ruohan Gao, Zilin Si, Yen-Yu Chang, Samuel Clarke, Jeannette Bohg, Li Fei-Fei, Wenzhen Yuan, 和 Jiajun Wu。ObjectFolder 2.0:一个用于 Sim2Real 迁移的多感官物体数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (IEEE/CVF Conf. Comput. Vis. Pattern Recog.),2022。URL https://arxiv.org/abs/2204.02389。

[109] Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin 等。DreamDojo:源自大规模人类视频的通用人形机器人世界模型。arXiv 预印本 arXiv:2602.06949,2026。URL https://arxiv.org/abs/2602.06949。

[110] Guillermo Garcia-Hernando, Shanxin Yuan, Seungryul Baek, 和 Tae-Kyun Kim。带有 RGB-D 视频和3D手部姿态标注的第一人称手部动作基准。在 IEEE/CVF 计算机视觉与模式识别会议 (IEEE/CVF Conf. Comput. Vis. Pattern Recog.),2018。URL https://doi.org/10.1109/cvpr.2018.00050。

[111] Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf 等。在 Veo 世界模拟器中评估 Gemini 机器人策略。arXiv 预印本 arXiv:2512.10675,2025。URL https://arxiv.org/abs/2512.10675。

[112] Genesis-Embodied-AI。Genesis:一种用于机器人及更广泛领域的生成式通用物理引擎。https://github.com/Genesis-Embodied-AI/Genesis,2024。URL https://genesis-embodied-ai.github.io/。

52

第 53 页

[113] Haoran Geng, Feishi Wang, Songlin Wei, Yuyang Li, Bangjun Wang, Boshi An, Charlie Tianyue Cheng, Haozhe Lou, 等。RoboVerse:迈向可扩展且可泛化的机器人学习的统一平台、数据集与基准。In Robot. Sci. Syst., 2025. URL https://doi.org/10.48550/arXiv.2504.18904.

[114] GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, 等。GigaWorld-0:作为数据引擎的世界模型以赋能具身智能。arXiv preprint arXiv:2511.19861, 2025. URL https://arxiv.org/abs/2511.19861.

[115] Ran Gong, Jiangyong Huang, Yizhou Zhao, Haoran Geng, Xiaofeng Gao, Qingyang Wu, Wensi Ai, Ziheng Zhou, Demetri Terzopoulos, Song-Chun Zhu, Baoxiong Jia, 和 Siyuan Huang。ARNOLD:面向现实 3D 场景中连续状态的语言 grounded 任务学习的基准。In IEEE/CVF Int. Conf. Comput. Vis., 2023. URL https://arxiv.org/abs/2304.04321.

[116] Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, 和 Junwei Liang。通往成功之路:通过 LLM 驱动的由粗到细探索的在线地板感知零样本物体目标导航框架。IEEE Robot. Autom. Lett., 2026. URL https://arxiv.org/abs/2505.23019.

[117] Google DeepMind。Genie 3:世界模型的新前沿。https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/, 2025. URL https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/.

[118] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, 等。Ego4D:3000 小时第一人称视频环游世界。In IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2022. URL https://arxiv.org/abs/2110.07058.

[119] Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, Kumar Ashutosh, Vijay Baiyya, 等。Ego-Exo4D:从第一人称和第三人称视角理解熟练的人类活动。Int. J. Comput. Vis., 2025. URL https://arxiv.org/abs/2311.18259.

[120] Clemence Grislain, Hamed Rahimi, Olivier Sigaud, 和 Mohamed Chetouani。I-failsense:利用视觉-语言模型迈向通用机器人故障检测。In IEEE Int. Conf. Robot. Autom., 2026. URL https://arxiv.org/abs/2509.16072.

[121] Jiayuan Gu, Fanbo Xiang, Xuanlin Li, Zhan Ling, Xiqiang Liu, Tongzhou Mu, Yihe Tang, Stone Tao, 等。ManiSkill2:可泛化操作技能的统一基准。In Int. Conf. Learn. Represent., 2023. URL https://arxiv.org/abs/2302.04659.

[122] Abhishek Gupta, Vikash Kumar, Corey Lynch, Sergey Levine, 和 Karol Hausman。中继策略学习:通过模仿学习和强化学习解决长视界任务。In Conf. Robot Learn., 2019. URL http://arxiv.org/abs/1910.11956.

[123] Agrim Gupta, Piotr Dollar, 和 Ross Girshick。LVIS:用于大词汇量实例分割的数据集。In IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2019. URL https://arxiv.org/abs/1908.03195.

[124] David Ha 和 Jürgen Schmidhuber。循环世界模型促进策略进化。In Adv. Neural Inf. Process. Syst., 2018. URL https://worldmodels.github.io/.

[125] Huy Ha, Yihuai Gao, Zipeng Fu, Jie Tan, 和 Shuran Song。腿上的 UMI:通过以操作为中心的整体控制器使操作策略具备移动能力。In Conf. Robot Learn., 2024. URL https://arxiv.org/abs/2407.10353.

[126] Danijar Hafner, Timothy Lillicrap, Ian Fischer, Ruben Villegas, David Ha, Honglak Lee, 和 James Davidson。从像素中学习潜在动态以进行规划。In Int. Conf. Mach. Learn., 2019. URL https://arxiv.org/abs/1811.04551.

[127] Danijar Hafner, Timothy Lillicrap, Jimmy Ba, 和 Mohammad Norouzi。梦想控制:通过潜在想象学习行为。In Int. Conf. Learn. Represent., 2020. URL https://arxiv.org/abs/1912.01603.

[128] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, 和 Timothy Lillicrap。通过世界模型掌握多样化的控制任务。Nature, 2025. URL https://arxiv.org/abs/2301.04104.

[129] Songhao Han, Boxiang Qiu, Yue Liao, Siyuan Huang, Chen Gao, Shuicheng Yan, 和 Si Liu。RoboCerebra:面向长视界机器人操作评估的大规模基准。In Adv. Neural Inf. Process. Syst., 2025. URL https://doi.org/10.48550/arXiv.2506.06677.

53

第 54 页

[130] Ankur Handa, Karl Van Wyk, Wei Yang, Jacky Liang, Yu-Wei Chao, Qian Wan, Stan Birchfield, Nathan Ratliff, 以及 Dieter Fox。DexPilot:基于视觉的灵巧机械手-臂系统遥操作。在 IEEE 国际机器人与自动化会议 (IEEE Int. Conf. Robot. Autom.) 上,2020。URL https://arxiv.org/abs/1910.03135。

[131] Xiaoshuai Hao, Yingbo Tang, Lingfeng Zhang, Yanbiao Ma, Yunfeng Diao, Ziyu Jia, Wenbo Ding, Hangjun Ye, 以及 Long Chen。RoboAfford++:一种由生成式 AI 增强的数据集,用于机器人操作和导航中的多模态功能学习。arXiv 预印本 arXiv:2511.12436,2025。URL https://arxiv.org/abs/2511.12436。

[132] Tairan He, Zhengyi Luo, Xialin He, Wenli Xiao, Chong Zhang, Weinan Zhang, Kris Kitani, Changliu Liu,以及 Guanya Shi。OmniH2O:通用且灵巧的人到人形机器人全身遥操作与学习。在机器人学习会议 (Conf. Robot Learn.) 上,2024。URL https://arxiv.org/abs/2406.08858。

[133] Lisa Anne Hendricks, Oliver Wang, Eli Shechtman, Josef Sivic, Trevor Darrell,以及 Bryan Russell。使用自然语言定位视频中的时刻。在 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF Int. Conf. Comput. Vis.) 上,2017。URL https://doi.org/ 10.1109/iccv.2017.618。

[134] Minho Heo, Youngwoon Lee, Doohyun Lee,以及 Joseph J Lim。FurnitureBench:用于长周期复杂操作的可复现现实世界基准。国际机器人研究杂志 (Int. J. Robot. Res.),2025。URL https://arxiv.org/abs/2305. 12821。

[135] Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S Brown,以及 Ken Goldberg。 Thriftydagger:用于交互式模仿学习的预算感知新颖性与风险门控。在机器人学习会议 (Conf. Robot Learn.) 上, 2021。URL https://arxiv.org/abs/2109.08273。

[136] Ryan Hoque, Lawrence Yunliang Chen, Satvik Sharma, Karthik Dharmarajan, Brijen Thananjeyan, Pieter Abbeel,以及 Ken Goldberg。Fleet-DAgger:具有可扩展人类监督的交互式机器人集群学习。在机器人学习会议 (Conf. Robot Learn.) 上,2022。URL https://arxiv.org/abs/2206.14349。

[137] Ryan Hoque, Ajay Mandlekar, Caelan Garrett, Ken Goldberg,以及 Dieter Fox。IntervenGen:用于鲁棒且数据高效的机器人模仿学习的干预式数据生成。在 IEEE/RSJ 智能机器人与系统国际会议 (IEEE/RSJ Int. Conf. Intell. Robots Syst.) 上, 2024。URL https://arxiv.org/abs/2405.01472。

[138] Ryan Hoque, Peide Huang, David J. Yoon, Mouli Sivapurapu,以及 Jian Zhang。Egodex:从大规模第一人称视频学习灵巧操作。在国际学习表征会议 (Int. Conf. Learn. Represent.) 上,2026。URL https://arxiv.org/ abs/2505.11709。

[139] Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu,以及 Xiangyu Zhao。Fire: 通过细粒度上下文学习增强多模态大语言模型 (MLLMs) 以进行复杂图像检索。在 ACM SIGIR 研究与开发国际会议 (Int. ACM SIGIR Conf. Res. Dev. Inf. Retr.) 上,2025。URL https://doi.org/10.1145/3726302.3729979。

[140] Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song,以及 Jianfei Yang。 Interlv-search:基准测试交错式多模态智能体搜索。arXiv 预印本 arXiv:2605.07510,2026。 URL https://arxiv.org/abs/2605.07510。

[141] Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr 等人。机器人学习的世界模型:综合综述。arXiv 预印本 arXiv:2605.00080, 2026。URL https://arxiv.org/abs/2605.00080。

[142] Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin 等人。RoboMind 2.0:用于泛化具身智能的多模态、双臂移动操作数据集。arXiv 预印本 arXiv:2512.24653,2025。URL https://arxiv.org/abs/2512.24653。

[143] Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton,以及 Gianluca Corrado。GAIA-1:用于自动驾驶的生成式世界模型。arXiv 预印本 arXiv:2309.17080, 2023。URL https://arxiv.org/abs/2309.17080。

[144] Pu Hua, Minghuan Liu, Annabella Macaluso, Yunfeng Lin, Weinan Zhang, Huazhe Xu,以及 Lirui Wang。 GenSim2:利用多模态和推理大语言模型扩展机器人数据生成。在机器人学习会议 (Conf. Robot Learn.) 上,2024。 URL https://arxiv.org/abs/2410.03645。

[145] Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li,以及 Yufei Liu。VTouch++:一种具有基于视觉的触觉增强的多模态数据集,用于双臂操作。arXiv 预印本 arXiv:2604.20444, 2026。URL https://arxiv.org/abs/2604.20444。

[146] Siyuan Huang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Zhengkai Jiang, Yue Hu, Yue Liao, Peng Gao, Hongsheng Li, Maoqing Yao,以及 Guanghui Ren。EnerVerse:为机器人操作构想具身未来空间。在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.) 上,2025。URL https://doi.org/10.48550/arXiv.2501.01895。

54

第 55 页

[147] Weikai Huang, Jieyu Zhang, Sijun Li, Taoyang Jia, Jiafei Duan, Yunqian Cheng, Jaemin Cho, Matthew Wallingford, Rustin Soraki, Chris Dongjoo Kim, Shuo Liu, 等。Wilddet3d:扩展野外可提示的 3D 检测。arXiv 预印本 arXiv:2604.08626,2026。URL https://arxiv.org/abs/2604.08626。

[148] Yifei Huang, Guo Chen, Jilan Xu, Mingfang Zhang, Lijin Yang, Baoqi Pei, Hongjie Zhang, Lu Dong, Yali Wang, Limin Wang, 和 Yu Qiao。EgoExoLearn:一个弥合现实世界中程序性活动异步自我中心与外部中心视角的数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2024。URL https://arxiv.org/abs/2403.16182。

[149] Zhiao Huang, Yuanming Hu, Tao Du, Siyuan Zhou, Hao Su, Joshua B. Tenenbaum, 和 Chuang Gan。Plasticinelab:具有可微物理的软体操作基准。在国际学习表征会议 (ICLR) 上,2021。URL https://arxiv.org/abs/2104.03311W。

[150] Physical Intelligence, Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, 等。π0.5:具有开放世界泛化能力的视觉-语言-动作模型。在机器人学习会议 (CoRL) 上,2025。URL https://arxiv.org/abs/2504.16054。

[151] Physical Intelligence, Bo Ai, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Greg Balke, Kevin Black, George Bokinsky, 等。π0.7:具有涌现能力的可操控通用机器人基础模型。arXiv 预印本 arXiv:2604.15483,2026。URL https://arxiv.org/abs/2604.15483。

[152] Stephen James, Marc Freese, 和 Andrew J. Davison。PyRep:将 V-REP 引入深度机器人学习。arXiv 预印本 arXiv:1906.11176,2019。URL https://arxiv.org/abs/1906.11176。

[153] Stephen James, Zicong Ma, David Rovick Arrojo, 和 Andrew J. Davison。Rlbench:机器人学习基准与学习环境。IEEE 机器人与自动化快报,2020。URL http://arxiv.org/abs/1909.12271。

[154] Eric Jang, Alex Irpan, Mohi Khansari, Daniel Kappler, Frederik Ebert, Corey Lynch, Sergey Levine, 和 Chelsea Finn。BC-Z:通过机器人模仿学习实现零样本任务泛化。在机器人学习会议 (CoRL) 上,2022。URL https://arxiv.org/abs/2202.02005。

[155] Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, 等。Dreamgen:通过视频世界模型解锁机器人学习中的泛化能力。在机器人学习会议 (CoRL) 上, 2025。URL https://arxiv.org/abs/2505.12705。

[156] Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, 和 Katerina Fragkiadaki。Robotarena ∞:通过真实到仿真的转换实现可扩展的机器人基准测试。在国际学习表征会议 (ICLR) 上,2026。URL https://arxiv.org/abs/2510.23571。

[157] Ahad Jawaid 和 Yu Xiang。OpenEgo:用于灵巧操作的大规模多模态自我中心数据集。arXiv 预印本 arXiv:2509.05513,2025。URL https://arxiv.org/abs/2509.05513。

[158] Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang, Hengyuan Zhang, Pengwei Wang, Mengdi Zhao, 等。RoboBrain:从抽象到具体的机器人操作统一大脑模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2025。URL https://doi.org/10.1109/cvpr52734.2025.00168。

[159] Baoxiong Jia, Ting Lei, Song-Chun Zhu, 和 Siyuan Huang。EgoTaskQA:理解自我中心视频中的人类任务。在神经信息处理系统进展 (NeurIPS) 上,2022。URL https://arxiv.org/abs/2210.03929。

[160] Chenxi Jiang, Chuhao Zhou, 和 Jianfei Yang。REI-Bench:具身智能体能在任务规划中理解模糊的人类指令吗?在国际学习表征会议 (ICLR) 上,2026。URL https://arxiv.org/abs/2505.10872。

[161] Feng Jiang, Yang Chen, Kyle Xu, Yuchen Liu, Haifeng Wang, Zhenhao Shen, Jasper Lu, Shengze Huang, Yuanfei Wang, Chen Xie, 和 Ruihai Wu。RoboWM-Bench:用于评估机器人操作中世界模型的基准。arXiv 预印本 arXiv:2604.19092,2026。URL https://arxiv.org/abs/2604.19092。

[162] Tao Jiang, Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Jianning Cui, Xiao Liu, Shuiqi Cheng, Jiyang Gao, Huazhe Xu, 和 Hang Zhao。Galaxea 开放世界数据集与 G0 双系统 VLA 模型。arXiv 预印本 arXiv:2509.00576,2025。URL https://arxiv.org/abs/2509.00576。

[163] Yuming Jiang, Siteng Huang, Shengke Xue, Yaxi Zhao, Jun Cen, Sicong Leng, Kehan Li, Jiayan Guo, 等。 RynnVLA-001:利用人类演示改进机器人操作。在 IEEE 机器人与自动化国际会议 (ICRA) 上, 2026。URL https://arxiv.org/abs/2509.15212。

[164] Yunfan Jiang, Agrim Gupta, Zichen Zhang, Guanzhi Wang, Yongqiang Dou, Yanjun Chen, Li Fei-Fei, Anima Anandkumar, Yuke Zhu, 和 Linxi Fan。VIMA:通过多模态提示实现通用机器人操作。在国际机器学习会议 (ICML) 上,2023。URL https://arxiv.org/abs/2210.03094。

55

第 56 页

[165] Zhennan Jiang, Kai Liu, Yuxin Qin, Shuai Tian, Yupeng Zheng, Mingcai Zhou, Chao Yu, Haoran Li, 和 Dongbin Zhao。World4RL:用于机器人操作策略精炼的扩散世界模型与强化学习。arXiv 预印本 arXiv:2509.19080,2025。URL https://arxiv.org/abs/2509.19080。

[166] Zhenyu Jiang, Yuqi Xie, Kevin Lin, Zhenjia Xu, Weikang Wan, Ajay Mandlekar, Linxi Fan, 和 Yuke Zhu。DexMimicGen:通过模仿学习自动生成双臂灵巧操作数据。IEEE 国际机器人与自动化会议,2025。URL https://arxiv.org/abs/2410.24185。

[167] Tobias Juelg, Seongjin Bien, Simon Hilber, Yannik Blei, Pierre Krack, Maximilian Li, Sven Parusel, Rudolf Lioutikov, Florian Walter, 和 Wolfram Burgard。Duobench:仿真与现实世界中双臂操作的可复现基准测试。arXiv 预印本 arXiv:2606.11901,2026。URL https://arxiv.org/abs/2606.11901。

[168] Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu 等。Kairos:一种具有后悔感知能力的物理 AI 原生世界-动作模型栈。arXiv 预印本 arXiv:2606.16533,2026。URL https://arxiv.org/abs/2606.16533。

[169] Dmitry Kalashnikov, Alex Irpan, Peter Pastor, Julian Ibarz, Alexander Herzog, Eric Jang, Deirdre Quillen, Ethan Holly, Mrinal Kalakrishnan, Vincent Vanhoucke 等。QT-Opt:基于视觉的机器人操作的可扩展深度强化学习。机器人学习会议,2018。URL https://arxiv.org/abs/1806.10293。

[170] Dmitry Kalashnikov, Jacob Varley, Yevgen Chebotar, Benjamin Swanson, Rico Jonschkowski, Chelsea Finn, Sergey Levine, 和 Karol Hausman。Mt-opt:大规模连续多任务机器人强化学习。arXiv 预印本 arXiv:2104.08212,2021。URL https://arxiv.org/abs/2104.08212。

[171] Simar Kareer, Dhruv Patel, Ryan Punamiya, Pranay Mathur, Shuo Cheng, Chen Wang, Judy Hoffman, 和 Danfei Xu。EgoMimic:通过第一人称视频扩展模仿学习。IEEE 国际机器人与自动化会议,2025。URL https://arxiv.org/abs/2410.24221。

[172] Mukul Khanna, Yongsen Mao, Hanxiao Jiang, Sanjay Haresh, Brennan Shacklett, Dhruv Batra, Alexander Clegg, Eric Undersander, Angel X. Chang, 和 Manolis Savva。Habitat 合成场景数据集 (hssd-200):针对目标导航的 3D 场景规模与真实性权衡分析。IEEE/CVF 计算机视觉与模式识别会议,2024。URL https://doi.org/10.1109/cvpr52733.2024.01550。

[173] Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, Siddharth Karamcheti, Soroush Nasiriany, Mohan Kumar Srirama, Lawrence Yunliang Chen, Kirsty Ellis 等。DROID:大规模野外机器人操作数据集。机器人科学与系统会议,2024。URL https://arxiv.org/abs/2403.12945。

[174] Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi 等。OpenVLA:开源视觉-语言-动作模型。机器人学习会议,2024。URL https://arxiv.org/abs/2406.09246。

[175] Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, 和 Jinwei Gu。Cosmos policy:微调视频模型以进行视觉运动控制与规划。国际学习表征会议,2026。URL https://arxiv.org/abs/2601.16163。

[176] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollar, 和 Ross Girshick。Segment anything。IEEE/CVF 国际计算机视觉会议,2023。URL https://arxiv.org/abs/2304.02643。

[177] Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin 等。3D 和 4D 世界建模:综述。arXiv 预印本 arXiv:2509.07996,2025。URL https://arxiv.org/abs/2509.07996。

[178] Ziyi Kou, Ankit Kumar, Mia Huang, Taylor Niehues, Vatsal Mehta, Ergys Ristani, 和 Li Guan。Avi-ht:用于 3D 手部跟踪的自适应视觉-惯性融合。arXiv 预印本 arXiv:2605.21714,2026。URL https://arxiv.org/abs/2605.21714。

[179] Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein, 和 Li Fei-Fei。Visual Genome:利用众包密集图像注释连接语言与视觉。国际计算机视觉杂志,2017。URL https://arxiv.org/abs/1602.07332。

[180] Vikash Kumar, Rutav Shah, Gaoyue Zhou, Vincent Moens, Vittorio Caggiano, Jay Vakil, Abhishek Gupta, 和 Aravind Rajeswaran。RoboHive:机器人学习的统一框架。神经信息处理系统进展,2023。URL https://arxiv.org/abs/2310.06828。

56

第 57 页

[181] Taein Kwon, Bugra Tekin, Jan Stuhmer, Federica Bogo, 和 Marc Pollefeys。H2O:用于第一人称交互识别的双手操作物体。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2021。URL https://arxiv.org/abs/2104.11181。

[182] Geonhyup Lee, Yeongjin Lee, Kangmin Kim, Seongju Lee, Sangjun Noh, Seunghyeok Back, 和 Kyoobin Lee。ManipForce:具有频率感知表示的力引导策略学习,用于接触丰富的操作。在 IEEE 国际机器人与自动化会议 (ICRA) 上,2026。URL https://arxiv.org/abs/2509.19047。

[183] Jae Yong Lee, Daniel Scharstein, Akash Bapat, Hao Hu, Andrew Fu, Haoru Zhao, Paul Sammut, Xiang Li 等。Ego-1K:用于自我中心视觉的大规模多视角视频数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/2603.13741。

[184] Jason Lee, Jiafei Duan, Haoquan Fang, Yuquan Deng, Shuo Liu, Boyang Li, Bohan Fang, Jieyu Zhang, Yi Ru Wang, Sangho Lee 等。MolmoAct:能够在空间中推理的动作推理模型。arXiv 预印本 arXiv:2508.07917,2025。URL https://arxiv.org/abs/2508.07917。

[185] Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding 等。RoboMemArena:一个全面且具有挑战性的机器人记忆基准测试。arXiv 预印本 arXiv:2605.10921,2026。URL https://arxiv.org/abs/2605.10921。

[186] Leju Robotics。Let-base-dataset:LET 基本操作数据集。https://www.modelscope.cn/datasets/lejurobot/LET-Base-Dataset,2026。URL https://huggingface.co/datasets/LejuRobotics/LET-Base-Dataset。

[187] Ian Lenz, Honglak Lee, 和 Ashutosh Saxena。用于检测机器人抓取深度的深度学习。国际机器人研究杂志 (IJRR),2015。URL https://doi.org/10.1177/0278364914549607。

[188] Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Peiyuan Zhang, Yanwei Li, Ziwei Liu, 和 Chunyuan Li。LLaVA-OneVision:轻松的视觉任务迁移。机器学习研究汇刊 (TMLR),2024。URL https://arxiv.org/abs/2408.03326。

[189] Chengshu Li, Ruohan Zhang, Josiah Wong, Cem Gokmen, Sanjana Srivastava, Roberto Martín-Martín, Chen Wang, Gabrael Levine 等。BEHAVIOR-1K:一个以人为中心的具身 AI 基准测试,包含 1,000 项日常活动和逼真的仿真。在机器人学习会议 (CoRL) 上,2022。URL https://arxiv.org/abs/2403.09227。

[190] Chuanyu Li, Renjun Dang, Xiang Li, Zhiyuan Wu, Jing Xu, Hamidreza Kasaei, Roberto Calandra, Nathan Lepora, Shan Luo, Hao Su, 和 Rui Chen。ManiSkill-vitac 2025:视觉与触觉感知下的操作技能学习挑战赛。arXiv 预印本 arXiv:2411.12503,2024。URL https://arxiv.org/abs/2411.12503。

[191] Chuanyu Li, Chaoyi Liu, Daotan Wang, Shuyu Zhang, Lusong Li, Zecui Zeng, Fangchen Liu, Jing Xu, 和 Rui Chen。ViTaMIn-b:一种可靠且高效的视觉-触觉双手机器人操作接口。arXiv 预印本 arXiv:2511.05858,2025。URL https://arxiv.org/abs/2511.05858。

[192] Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, 和 Shanghang Zhang。H2r:一种基于视频进行机器人预训练的人到机器人数据增强方法。arXiv 预印本 arXiv:2505.11920,2025。URL https://arxiv.org/abs/2505.11920。

[193] Hengtao Li, Pengxiang Ding, Runze Suo, Yihao Wang, Zirui Ge, Dongyuan Zang, Kexian Yu, Mingyang Sun, Hongyin Zhang, Donglin Wang 等。VLA-RFT:在世界模拟器中使用验证奖励进行视觉-语言-动作强化微调。arXiv 预印本 arXiv:2510.00406,2025。URL https://arxiv.org/abs/2510.00406。

[194] Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu 等。Efficient-WAM:一种具有低成本未来想象能力的 10 亿参数世界-动作模型 (WAM)。arXiv 预印本 arXiv:2606.10040,2026。

[195] Jinming Li, Yichen Zhu, Zhibin Tang, Junjie Wen, Minjie Zhu, Xiaoyu Liu, Chengmeng Li, Ran Cheng, Yaxin Peng, Yan Peng 等。Coa-VLA:通过视觉-文本链式可用性 (affordance) 改进视觉-语言-动作模型 (VLA)。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2025。URL https://arxiv.org/abs/2412.20451。

[196] Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, 和 Yinghao Xu。用于机器人控制的因果世界建模。在机器人科学与系统会议 (RSS) 上,2026。URL https://arxiv.org/abs/2601.21998。

[197] Linfei Li, Lin Zhang, 和 Ying Shen。RealVLG-R1:用于机器人感知和操作的大规模真实世界视觉-语言定位基准测试。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/2603.14880。

57

第 58 页

[198] 李启秀, 梁亚博, 王泽宇, 罗林, 陈曦, 廖莫正, 魏方云, 邓宇, 等. CogACT: 一种用于协同机器人操作中认知与动作的基础视觉-语言-动作模型. arXiv 预印本 arXiv:2411.19650, 2024. URL https://arxiv.org/abs/2411.19650.

[199] 李启秀, 邓宇, 梁亚博, 罗林, 周磊, 姚成唐, 曾令奇, 冯志远, 等. 利用真实人类活动视频进行可扩展的视觉-语言-动作模型预训练以用于机器人操作. 在 IEEE 国际机器人与自动化会议 (IEEE Int. Conf. Robot. Autom.) 上, 2025. URL https://arxiv.org/abs/2510.21571.

[200] 李沙丰, 维克多·姚, 查尔斯·杨, 特鲁斯·屈, 雷吉斯·程, 瑞安·于, 霍华德·卢, 牛顿·冯, 等. WALL-WM: 在事件关节处雕刻世界动作建模. arXiv 预印本 arXiv:2606.01955, 2026. URL https://arxiv.org/abs/2606.01955.

[201] 李兴航, 郭军, 李启伟, 钱龙, 赖航, 王悦泽, 严洪宇, 曹家航, 陈曦, 曲金根, 等. Xiaomi-Robotics-U0: 基于世界基础模型的统一具身合成. arXiv 预印本 arXiv:2607.11643, 2026. URL https://arxiv.org/abs/2607.11643.

[202] 李轩林, 凯尔·许, 顾家元, 卡尔·佩尔茨, 奥耶·米斯, 霍默·里奇·沃尔克, 傅春元, 伊什卡·卢纳瓦特, 等. 在仿真中评估现实世界机器人操作策略. 在机器人学习会议 (Conf. Robot Learn.) 上, 2024. URL https://arxiv.org/abs/2405.05941.

[203] 李旭坤, 孙宇, 张磊, 黄博生, 彭一博, 孟源, 蒋浩军, 谢少轩, 姚国才, 阿洛伊斯·诺尔, 等. DECO: 用于双灵巧操作且带有插件式触觉适配器的解耦多模态扩散变换器. 在国际机器学习会议 (Int. Conf. Mach. Learn.) 上, 2026. URL https://arxiv.org/abs/2602.05513.

[204] 李亚轩, 朱一辰, 文俊杰, 沈朝敏, 徐毅. WorldEval: 作为现实世界机器人策略评估器的世界模型. arXiv 预印本 arXiv:2505.19017, 2025. URL https://arxiv.org/abs/2505.19017.

[205] 李一航, 魏学龙, 罗景州, 肖颖静, 白一博, 周广源, 邹腾, 桂晨光, 等. Egolive: 来自真实人类任务的大规模第一人称数据集. arXiv 预印本 arXiv:2604.23570, 2026. URL https://arxiv.org/abs/2604.23570.

[206] 李寅, 刘淼, 詹姆斯·M·雷格. 在观察者眼中:第一人称视频中的注视与动作. IEEE 模式分析与机器智能汇刊 (IEEE Trans. Pattern Anal. Mach. Intell.), 2023. URL https://www.computer.org/csdl/journal/tp/2023/06/09325929/1qpv4fOGLEA.

[207] 李明远, 黄伟进, 王安兰, 曾令安, 孟静科, 郑伟石. EgoExo-Fitness: 迈向第一人称与第三人称全身动作理解. 在欧洲计算机视觉会议 (Eur. Conf. Comput. Vis.) 上, 2024. URL https://arxiv.org/abs/2406.08877.

[208] 李宇阳, 杜文鑫, 于畅, 李普浩, 赵子航, 刘腾宇, 蒋晨凡, 朱一欣, 黄思远. Taccel: 通过高性能 GPU 仿真扩展基于视觉的触觉机器人技术. 在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.) 上, 2025. URL https://doi.org/10.48550/arXiv.2504.12908.

[209] 李志硕, 杨博文, 苗长涛, 朱凯, 陈浩, 关庆泽, 吴正兴, 战万科, 孙阳, 黄志一, 等. Open-aoe: 用于具身学习的开放第一人称操作数据集和工具链. arXiv 预印本 arXiv:2607.14183, 2026. URL https://arxiv.org/abs/2607.14183.

[210] 廖悦, 周鹏飞, 黄思远, 杨冬林, 陈圣聪, 蒋雨欣, 胡悦, 蔡景斌, 等. Genie envisioner: 用于机器人操作的统一世界基础平台. 在表示学习国际会议 (Int. Conf. Learn. Represent.) 上, 2026. URL https://arxiv.org/abs/2508.05635.

[211] 林凡奇, 胡英东, 盛平月, 文川, 尤家诚, 高扬. 机器人操作模仿学习中的数据缩放定律. 在表示学习国际会议 (Int. Conf. Learn. Represent.) 上, 2025. URL https://arxiv.org/abs/2410.18647.

[212] 林通一, 迈克尔·米尔, 塞尔日·别林杰, 詹姆斯·海斯, 皮耶特罗·佩罗纳, 德瓦·拉南南, 彼得·多拉尔, C. 劳伦斯·齐特尼克. Microsoft COCO: 上下文中的常见对象. 在欧洲计算机视觉会议 (Eur. Conf. Comput. Vis.) 上, 2014. URL https://arxiv.org/abs/1405.0312.

[213] 林兴宇, 王雨飞, 杰克·奥尔金, 大卫·赫尔德. SoftGym: 用于可变形物体操作深度强化学习的基准测试. 在机器人学习会议 (Conf. Robot Learn.) 上, 2020. URL https://arxiv.org/abs/2011.07215.

[214] 林一炯, 约翰·劳埃德, 亚历克斯·丘奇, 内森·F·莱普拉. Tactile Gym 2.0: 用于比较低成本高分辨率机器人触觉的仿真到现实深度强化学习. IEEE 机器人与自动化快报 (IEEE Robot. Autom. Lett.), 2022. URL https://arxiv.org/abs/2207.10763.

58

第 59 页

[215] Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, and Bihan Wen. Failsafe: reasoning and recovery from failures in vision-language-action models. arXiv preprint arXiv:2510.01642, 2025. URL https://arxiv.org/abs/2510.01642.

[216] Linux Foundation and NVIDIA and Google DeepMind and Disney Research. Newton: an open-source, GPU- accelerated physics engine for robotics. https://github.com/newton-physics/newton, 2025. URL https:// developer.nvidia.com/blog/announcing-newton-an-open-source-physics-engine-for-robotics-simulation/.

[217] Bo Liu, Yifeng Zhu, Chongkai Gao, Yihao Feng, Qiang Liu, Yuke Zhu, and Peter Stone. LIBERO: benchmarking knowledge transfer for lifelong robot learning. In Adv. Neural Inf. Process. Syst., 2023. URL https://arxiv.org/ abs/2306.03310.

[218] Fangchen Liu, Chuanyu Li, Yihua Qin, Ankit Shaw, Jing Xu, Pieter Abbeel, and Rui Chen. ViTaMIn: learning contact-rich tasks through robot-free visuo-tactile manipulation interface. arXiv preprint arXiv:2504.06156, 2025. URL https://arxiv.org/abs/2504.06156.

[219] Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. Visual instruction tuning. In Adv. Neural Inf. Process. Syst., 2023. URL https://doi.org/10.52202/075280-1516.

[220] Huihan Liu, Soroush Nasiriany, Lance Zhang, Zhiyao Bao, and Yuke Zhu. Robot learning on the job: human-in- the-loop autonomy and learning during deployment. Int. J. Robot. Res., 2025. URL https://arxiv.org/abs/2211. 08416.

[221] Jiaming Liu, Hao Chen, Pengju An, Zhuoyang Liu, Renrui Zhang, Chenyang Gu, Xiaoqi Li, Ziyu Guo, et al. HybridVLA: collaborative diffusion and autoregression in a unified vision-language-action model. In Int. Conf. Learn. Represent., 2026. URL https://arxiv.org/abs/2503.10631.

[222] Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, et al. LaST-HD: Learning latent physical reasoning from scalable human data for robot manipulation. arXiv preprint arXiv:2606.23685, 2026. URL https://arxiv.org/abs/2606.23685.

[223] Junpeng Liu, Tianyue Ou, Yifan Song, Yuxiao Qu, Wai Lam, Chenyan Xiong, Wenhu Chen, Graham Neubig, and Xiang Yue. Harnessing webpage UIs for text-rich visual understanding. In Int. Conf. Learn. Represent., 2025. URL https://arxiv.org/abs/2410.13824.

[224] Kehui Liu, Zhongjie Jia, Yang Li, Zhaxizhuoma, Pengan Chen, Song Liu, Xin Liu, Pingrui Zhang, Haoming Song, Xinyi Ye, et al. FastUMI-100k: advancing data-driven robotic manipulation with a large-scale UMI-style dataset. arXiv preprint arXiv:2510.08022, 2025. URL https://arxiv.org/abs/2510.08022.

[225] Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, and Jun Zhu. RDT-1b: a diffusion foundation model for bimanual manipulation. In Int. Conf. Learn. Represent., 2025. URL https://arxiv.org/abs/2410.07864.

[226] Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, and Jun Zhu. RDT2: Exploring the scaling limit of UMI data towards zero-shot cross-embodiment generalization. In ICML, 2026. URL https://arxiv.org/abs/2602.03310.

[227] Yunze Liu, Yun Liu, Che Jiang, Kangbo Lyu, Weikang Wan, Hao Shen, Boqiang Liang, Zhoujie Fu, He Wang, and Li Yi. HOI4D: a 4D egocentric dataset for category-level human-object interaction. In IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2022. URL https://arxiv.org/abs/2203.01577.

[228] Zeyi Liu, Arpit Bahety, and Shuran Song. Reflect: summarizing robot experiences for failure explanation and correction. In Conf. Robot Learn., 2023. URL https://arxiv.org/abs/2306.15724.

[229] Zeyi Liu, Cheng Chi, Eric Cousineau, Naveen Kuppuswamy, Benjamin Burchfiel, and Shuran Song. ManiWAV: learning robot manipulation from in-the-wild audio-visual data. In Conf. Robot Learn., 2024. URL https: //arxiv.org/abs/2406.19464.

[230] Zhuoyang Liu, Jiaming Liu, Hao Chen, Jiale Yu, Ziyu Guo, Chengkai Hou, Chenyang Gu, Xiangju Mi, et al. LaST0: Latent spatio-temporal chain-of-thought for robotic vision-language-action model. In Int. Conf. Mach. Learn., 2026. URL https://arxiv.org/abs/2601.05248.

[231] Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, and Shanghang Zhang. Predicting what matters: Robust generalist robot policy learning via future semantic mask. In Int. Conf. Mach. Learn., 2026. URL https: //arxiv.org/abs/2604.19683.

59

第 60 页

[232] Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, 和 Shanghang Zhang。Dream-Tac:一种用于接触丰富机器人操作的统一触觉世界动作模型,2026。URL https://arxiv.org/abs/2606.08737。

[233] Haoran Lu, Ruihai Wu, Yitong Li, Sijie Li, Ziyu Zhu, Chuanruo Ning, Yan Shen, Longzan Luo, Yuanpei Chen, 和 Hao Dong。GarmentLab:一种统一的服装操作仿真与基准测试。在 Adv. Neural Inf. Process. Syst. 中,2024。URL https://arxiv.org/abs/2411.01200。

[234] Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang 等。Xiaomi OneVL:基于视觉语言解释的一步潜在推理与规划。arXiv 预印本 arXiv:2604.18486,2026。URL https://arxiv.org/abs/2604.18486。

[235] Weifeng Lu, Minghao Ye, Zewei Ye, Ruihan Tao, Shuo Yang, 和 Bo Zhao。RoboFAC:一个全面的机器人故障分析与校正框架。arXiv 预印本 arXiv:2505.12224,2025。URL https://arxiv.org/abs/2505.12224。

[236] Yuhao Lu, Yixuan Fan, Beixing Deng, Fangfu Liu, Yali Li, 和 Shengjin Wang。VL-Grasp:面向杂乱室内场景中语言导向物体的 6-DoF 交互式抓取策略。在 IEEE/RSJ Int. Conf. Intell. Robots Syst. 中,2023。URL https://arxiv.org/abs/2308.00640。

[237] Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, 和 Zongqing Lu。Being-h0:基于大规模人类视频的视觉-语言-动作预训练。在 Int. Conf. Mach. Learn. 中,2026。URL https://arxiv.org/abs/2507.15597。

[238] Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, 和 Zongqing Lu。Being-h0.5:扩展以人为中心的机器人学习以实现跨具身形态泛化。arXiv 预印本 arXiv:2601.12993,2026。URL https://arxiv.org/abs/2601.12993。

[239] Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, 和 Zongqing Lu。Being-h0.7:一种源自第一人称视频的潜在世界-动作模型。arXiv 预印本 arXiv:2605.00078,2026。URL https://arxiv.org/abs/2605.00078。

[240] Jianlan Luo, Charles Xu, Fangchen Liu, Liam Tan, Zipeng Lin, Jeffrey Wu, Pieter Abbeel, 和 Sergey Levine。FMB:一个用于通用机器人学习的功能操作基准。Int. J. Robot. Res.,2024。URL https://arxiv.org/abs/2401.08553。

[241] Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen 等。LDA-1B:通过通用具身数据摄入扩展潜在动力学动作模型。在 Robot. Sci. Syst. 中,2026。URL https://arxiv.org/abs/2602.12215。

[242] Ruiyuan Lyu, Jingli Lin, Tai Wang, Shuai Yang, Xiaohan Mao, Yilun Chen, Runsen Xu, Haifeng Huang, Chenming Zhu, Dahua Lin, 和 Jiangmiao Pang。MMScan:一个具有分层接地语言注释的多模态 3D 场景数据集。在 Adv. Neural Inf. Process. Syst. 中,2024。URL https://arxiv.org/abs/2406.09401。

[243] Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu 等。InternVLA-A1.5:统一理解、潜在前瞻与动作以实现组合泛化。arXiv 预印本 arXiv:2607.04988,2026。URL https://arxiv.org/abs/2607.04988。

[244] Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong 等。HumanScale:第一人称人类视频在具身预训练中可以优于真实机器人数据。arXiv 预印本 arXiv:2606.20521,2026。URL https://arxiv.org/abs/2606.20521。

[245] Lingni Ma, Yuting Ye, Fangzhou Hong, Vladimir Guzov, Yifeng Jiang, Rowan Postyeni, Luis Pesqueira, Alexander Gamino 等。Nymeria:一个庞大的多模态第一人称日常运动野外数据集。在 Eur. Conf. Comput. Vis. 中,2024。URL https://arxiv.org/abs/2406.09905。

[246] Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, 和 Siyuan Huang。SQA3D:3D 场景中的情境问答。在 Int. Conf. Learn. Represent. 中,2023。URL https://arxiv.org/abs/2210.07474。

[247] Viktor Makoviychuk, Lukasz Wawrzyniak, Yunrong Guo, Michelle Lu, Kier Storey, Miles Macklin, David Hoeller, Nikita Rudin, Arthur Allshire, Ankur Handa, 和 Gavriel State。Isaac gym:用于机器人学习的高性能基于 GPU 的物理仿真。在 Adv. Neural Inf. Process. Syst. 中,2021。URL https://arxiv.org/abs/2108.10470。

[248] Ajay Mandlekar, Yuke Zhu, Animesh Garg, Jonathan Booher, Max Spero, Albert Tung, Julian Gao, John Emmons, Anchit Gupta, Emre Orbay 等。RoboTurk:一个通过模仿进行机器人技能学习的众包平台。在 Conf. Robot Learn. 中,2018。URL https://arxiv.org/abs/1811.02790。

60

第 61 页

[249] Ajay Mandlekar, Danfei Xu, Roberto Martín-Martín, Yuke Zhu, Li Fei-Fei, 和 Silvio Savarese。使用远程遥操作的人机回路模仿学习。arXiv 预印本 arXiv:2012.06733,2020。URL https://arxiv.org/abs/2012.06733。

[250] Ajay Mandlekar, Danfei Xu, Josiah Wong, Soroush Nasiriany, Chen Wang, Rohun Kulkarni, Li Fei-Fei, Silvio Savarese, Yuke Zhu, 和 Roberto Martín-Martín。对于机器人操作,从离线人类演示中学习时什么很重要。在机器人学习会议 (Conf. Robot Learn.) 上,2021。URL https://arxiv.org/abs/2108.03298。

[251] Ajay Mandlekar, Soroush Nasiriany, Bowen Wen, Iretiayo Akinola, Yashraj Narang, Linxi Fan, Yuke Zhu, 和 Dieter Fox。MimicGen:一种利用人类演示进行可扩展机器人学习的数据生成系统。在机器人学习会议 (Conf. Robot Learn.) 上,2023。URL https://arxiv.org/abs/2310.17596。

[252] Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, 和 Enamul Hoque。ChartQA:一个关于图表问答的基准,涉及视觉和逻辑推理。在年度计算语言学协会会议 (Annu. Meet. Assoc. Comput. Linguist.) 上,2022。URL https://arxiv.org/abs/2203.10244。

[253] Minesh Mathew, Dimosthenis Karatzas, 和 C. V. Jawahar。DocVQA:一个用于文档图像视觉问答 (VQA) 的数据集。在 IEEE/CVF 计算机视觉应用冬季会议 (IEEE/CVF Winter Conf. Appl. Comput. Vis.) 上,2021。URL https://arxiv.org/abs/2007.00398。

[254] Oier Mees, Lukas Hermann, Erick Rosete-Beas, 和 Wolfram Burgard。Calvin:一个用于长周期机器人操作任务的语言条件策略学习的基准。IEEE 机器人与自动化快报 (IEEE Robot. Autom. Lett.),2022。URL https://arxiv.org/abs/2112.03227。

[255] Anand Mishra, Shashank Shekhar, Ajeet Kumar Singh, 和 Anirban Chakraborty。OCR-VQA:通过阅读图像中的文本进行视觉问答。在国际文档分析与识别会议 (Int. Conf. Doc. Anal. Recognit.) 上,2019。URL https://doi.org/10.1109/icdar.2019.00156。

[256] Mayank Mittal, Calvin Yu, Qinxi Yu, Jingzhou Liu, Nikita Rudin, David Hoeller, Jia Lin Yuan, Ritvik Singh 等人。Orbit:一个用于交互式机器人学习环境的统一仿真框架。IEEE 机器人与自动化快报 (IEEE Robot. Autom. Lett.),2023。URL https://arxiv.org/abs/2301.04195。

[257] Tomohiro Motoda, Masaki Murooka, Ryoichi Nakajo, Muhammad A. Muttaqien, Koshi Makihara, Hanbit Oh, Keisuke Shirai, Floris Erich, Ryo Hanai, 和 Yukiyasu Domae。AIST双臂操作,2025。URL https://aistairc.github.io/aist_bimanip_site。

[258] Yao Mu, Qinglong Zhang, Mengkang Hu, Wenhai Wang, Mingyu Ding, Jun Jin, Bin Wang, Jifeng Dai, Yu Qiao, 和 Ping Luo。EmbodiedGPT:通过具身思维链进行视觉-语言预训练。在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.) 上,2023。URL https://arxiv.org/abs/2305.15021。

[259] Yao Mu, Tianxing Chen, Shijia Peng, Zanxin Chen, Zeyu Gao, Yude Zou, Lunkai Lin, Zhiqiang Xie, 和 Ping Luo。RoboTwin:具有生成式数字孪生的双臂机器人基准。arXiv 预印本 arXiv:2409.02920,2024。URL https://arxiv.org/abs/2409.02920。

[260] Raul Mur-Artal, J. M. M. Montiel, 和 Juan D. Tardos。ORB-SLAM:一种通用且准确的单目 SLAM 系统。IEEE 机器人汇刊 (IEEE Trans. Robot.),2015。URL https://doi.org/10.1109/tro.2015.2463671。

[261] Ruiqian Nai, Boyuan Zheng, Junming Zhao, Haodong Zhu, Sicong Dai, Zunhao Chen, Yihang Hu, Yingdong Hu, Tong Zhang, Chuan Wen 等人。人形操作接口:来自无机器人演示的人形全身操作。arXiv 预印本 arXiv:2602.06643,2026。URL https://arxiv.org/abs/2602.06643。

[262] Soroush Nasiriany, Abhiram Maddukuri, Lance Zhang, Adeet Parikh, Aaron Lo, Abhishek Joshi, Ajay Mandlekar, 和 Yuke Zhu。RoboCasa:面向通用机器人的日常任务大规模仿真。在机器人科学与系统会议 (Robot. Sci. Syst.) 上,2024。URL https://arxiv.org/abs/2406.02523。

[263] Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, 和 Yuke Zhu。RoboCasa365:用于训练和基准测试通用机器人的大规模仿真框架。在国际学习表征会议 (Int. Conf. Learn. Represent.) 上,2026。URL https://doi.org/10.48550/arXiv.2603.04356。

[264] Nigel Nelson, Juo-Tung Chen, Jesse Haworth, Xinhao Chen, Lukas Zbinden, Dianye Huang, Alaa Eldin Abdelaal, Alberto Arezzo, Ayberk Acar, Farshid Alambeigi 等人。Open-H-Embodiment:一个用于使医疗机器人基础模型得以实现的大规模数据集。arXiv 预印本 arXiv:2604.21017,2026。URL https://arxiv.org/abs/2604.21017。

[265] Duc Huy Nguyen, Tim Schneider, Guillaume Duret, Alap Kshirsagar, Boris Belousov, 和 Jan Peters。Tacex:Isaac Sim 中的 GelSight 触觉仿真——结合软体与视觉触觉仿真器。arXiv 预印本 arXiv:2411.04776,2024。URL https://arxiv.org/abs/2411.04776。

61

第 62 页

[266] Toan Nguyen, Minh Nhat Vu, Baoru Huang, An Vuong, Quan Vuong, Ngan Le, Thieu Vo, 和 Anh Nguyen。 基于语言驱动的 6-DoF 抓取检测:使用负向提示引导。在 Eur. Conf. Comput. Vis., 2024。 URL https://arxiv.org/abs/2407.13842。

[267] NVIDIA。Physicalai-robotics-GR00T-x-embodiment-sim。Hugging Face 数据集,2025。URL https://huggingface. co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim。用于 GR00T N1 后训练的合成跨具身形态轨迹数据集。

[268] NVIDIA。NVIDIA Isaac sim:机器人仿真与合成数据生成。https://developer.nvidia.com/ isaac/sim,2025。URL https://developer.nvidia.com/isaac/sim。

[269] NVIDIA, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, 等。Cosmos 3:面向物理 AI 的全模态世界模型。arXiv 预印本 arXiv:2606.02800,2026。URL https://arxiv.org/abs/2606.02800。

[270] Takehiko Ohkawa, Kun He, Fadime Sener, Tomas Hodan, Luan Tran, 和 Cem Keskin。Assemblyhands:通过 3D 手部姿态估计迈向自我中心活动理解。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2023。URL https://arxiv.org/abs/2304.12301。

[271] Paul Pacaud, Ricardo Garcia, Shizhe Chen, 和 Cordelia Schmid。扩展跨环境失败推理数据以用于视觉语言机器人操作。arXiv 预印本 arXiv:2512.01946,2025。URL https://arxiv.org/ abs/2512.01946。

[272] Rohith Peddi, Shivvrat Arya, Bharath Challa, Likhitha Pallapothula, Akshay Vyas, Bhavya Gouripeddi, Jikai Wang, Qifan Zhang, 等。CaptainCook4D:一个用于理解程序性活动中错误的基准数据集。在 Adv. Neural Inf. Process. Syst., 2024。URL https://arxiv.org/abs/2312.14556。

[273] Xingyu Peng, Chen Gao, Liankai Jin, Annan Li, 和 Si Liu。BiCoord:一个面向长时域时空协调的双臂操作基准。arXiv 预印本 arXiv:2604.05831,2026。URL https: //arxiv.org/abs/2604.05831。

[274] Toby Perrett, Ahmad Darkhalil, Saptarshi Sinha, Omar Emara, Sam Pollard, Kranti Parida, Kaiting Liu, Prajwal Gatti, 等。HD-EPIC:一个高细节的自我中心视频数据集。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2025。URL https://arxiv.org/abs/2502.04144。

[275] Lerrel Pinto 和 Abhinav Gupta。超大规模自监督学习:从 5 万次尝试和 700 小时机器人时间中学习抓取。在 IEEE Int. Conf. Robot. Autom., 2016。URL https://arxiv.org/abs/1509.06825。

[276] Xavier Puig, Eric Undersander, Andrew Szot, Mikael Dallaire Cote, Tsung-Yen Yang, Ruslan Partsey, Ruta Desai, Alexander William Clegg, 等。Habitat 3.0:人类、化身和机器人的共同栖息地。在 Int. Conf. Learn. Represent., 2024。URL https://arxiv.org/abs/2310.13724。

[277] Wilbert Pumacay, Ishika Singh, Jiafei Duan, Ranjay Krishna, Jesse Thomason, 和 Dieter Fox。THE COLOS- SEUM:一个用于评估机器人操作泛化能力的基准。在 Robot. Sci. Syst., 2024。URL https://arxiv.org/abs/2402.08191。

[278] Ryan Punamiya, Simar Kareer, Zeyi Liu, Josh Citron, Ri-Zhao Qiu, Xiongyi Cai, Alexey Gavryushin, Jiaqi Chen, 等。Egoverse:一个用于全球机器人学习的自我中心人类数据集。arXiv 预印本 arXiv:2604.07607,2026。URL https://arxiv.org/abs/2604.07607。

[279] Long Qian, Juncheng Li, Yu Wu, Yaobo Ye, Hao Fei, Tat-Seng Chua, Yueting Zhuang, 和 Siliang Tang。 Momentor:通过细粒度时间推理推进视频大语言模型。在 Int. Conf. Mach. Learn., 2024。URL https://arxiv.org/abs/2402.11435。

[280] Yuzhe Qin, Yueh-Hua Wu, Shaowei Liu, Hanwen Jiang, Ruihan Yang, Yang Fu, 和 Xiaolong Wang。DexMV: 从人类视频中通过模仿学习实现灵巧操作。在 Eur. Conf. Comput. Vis., 2022。URL https://arxiv.org/abs/2108.05877。

[281] Yuzhe Qin, Wei Yang, Binghao Huang, Karl Van Wyk, Hao Su, Xiaolong Wang, Yu-Wei Chao, 和 Dieter Fox。 AnyTeleop:一种通用的基于视觉的灵巧机器人臂手遥操作系统的。在 Robot. Sci. Syst., 2023。 URL https://arxiv.org/abs/2307.04577。

[282] Heqian Qiu, Zhaofeng Shi, Lanxiao Wang, Huiyu Xiong, Xiang Li, 和 Hongliang Li。Egome:一个新的数据集 和现实世界中通过自我中心视角“跟随我”的挑战。arXiv 预印本 arXiv:2501.19061,2025。URL https://arxiv.org/abs/2501.19061。

62

第 63 页

[283] Ri-Zhao Qiu, Shiqi Yang, Xuxin Cheng, Chaitanya Chawla, Jialong Li, Tairan He, Ge Yan, David J Yoon, Ryan Hoque, Lars Paulsen, 等。Humanoid policy˜ human policy。在 Conf. Robot Learn., 2025。URL https://arxiv.org/abs/2503.13441。

[284] Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, , Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Maoqing Yao, Bin Zhao, 等。EO-1: 一种用于通用机器人控制的开放统一具身基础模型。arXiv 预印本 arXiv:2508.21112, 2025。URL https://arxiv.org/abs/2508.21112。

[285] Delin Qu, Haoming Song, Qizhi Chen, Yuanqi Yao, Xinyi Ye, Yan Ding, Zhigang Wang, JiaYuan Gu, Bin Zhao, Dong Wang, 和 Xuelong Li。SpatialVLA: 探索视觉-语言-动作模型的空间表示。在 Robot. Sci. Syst., 2025。URL https://arxiv.org/abs/2501.15830。

[286] Julian Quevedo, Ansh Kumar Sharma, Yixiang Sun, Varad Suryavanshi, Percy Liang, 和 Sherry Yang。 WorldGym: 作为策略评估环境的 world model。arXiv 预印本 arXiv:2506.00613, 2025。URL https://arxiv.org/abs/2506.00613。

[287] Francesco Ragusa, Rosario Leonardi, Michele Mazzamuto, Claudia Bonanno, Rosario Scavo, Antonino Furnari, 和 Giovanni Maria Farinella。Enigma-51: 迈向对工业场景中人机物交互的细粒度理解。在 IEEE/CVF Winter Conf. Appl. Comput. Vis., 2024。URL https://arxiv.org/abs/2309. 14809。

[288] Aravind Rajeswaran, Vikash Kumar, Abhishek Gupta, Giulia Vezzani, John Schulman, Emanuel Todorov, 和 Sergey Levine。利用深度强化学习和演示学习复杂的灵巧操作。 在 Robot. Sci. Syst., 2018。URL http://arxiv.org/abs/1709.10087。

[289] Santhosh K. Ramakrishnan, Aaron Gokaslan, Erik Wijmans, Oleksandr Maksymets, Alex Clegg, John Turner, Eric Undersander, Wojciech Galuba, 等。Habitat-matterport 3D 数据集 (hm3d):1000 个用于具身 AI 的大规模 3D 环境。在 Adv. Neural Inf. Process. Syst., 2021。URL https://arxiv.org/abs/2109.08238。

[290] Vignesh Ramanathan, Anmol Kalia, Vladan Petrovic, Yi Wen, Baixue Zheng, Baishan Guo, Rui Wang, Aaron Marquez, Rama Kovvuri, Abhishek Kadian, Amir Mousavi, Yiwen Song, Abhimanyu Dubey, 和 Dhruv Mahajan。 PACo: 常见物体的部件和属性。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2023。URL https://arxiv.org/abs/2301.01795。

[291] Omar Rayyan, John Abanes, Mahmoud Hafez, Anthony Tzes, 和 Fares Abu-Dakka。MV-UMI: 一种可扩展的多视角接口,用于跨具身形态学习。arXiv 预印本 arXiv:2509.18757, 2025。URL https: //doi.org/10.48550/arXiv.2509.18757。

[292] RealSource。Realsource world: 一个大规模真实世界双臂操作数据集。https://huggingface.co/ datasets/RealSourceData/RealSource-World, 2025。URL https://huggingface.co/datasets/RealSourceData/ RealSource-World。

[293] Ronan Riochet, Mario Ynocente Castro, Mathieu Bernard, Adam Lerer, Rob Fergus, Véronique Izard, 和 Emmanuel Dupoux。IntPhys: 一个用于视觉直觉物理推理的框架和基准。IEEE Trans. Pattern Anal. Mach. Intell., 2018。URL https://arxiv.org/abs/1803.07616。

[294] Unitree Robotics。UniFoLM-WBT-Dataset。https://huggingface.co/collections/unitreerobotics/ unifolm-wbt-dataset, 2026。

[295] Eric Rohmer, Surya P. N. Singh, 和 Marc Freese。V-rep: 一个通用且可扩展的机器人仿真框架。 在 IEEE/RSJ Int. Conf. Intell. Robots Syst., 2013。URL https://doi.org/10.1109/iros.2013.6696520。

[296] Ropedia。Xperience-10M: 一个带有结构化 3D/4D 注释的大规模第一人称多模态数据集, 2026。 数据集。

[297] Stéphane Ross, Geoffrey Gordon, 和 Drew Bagnell。将模仿学习和结构化预测归约为无 regret 在线学习。在 Int. Conf. Artif. Intell. Stat., 2011。URL https://arxiv.org/abs/1011.0686。

[298] Johannes L. Schonberger 和 Jan-Michael Frahm。重新审视运动恢复结构。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2016。URL https://doi.org/10.1109/cvpr.2016.445。

[299] Tim J. Schoonbeek, Tim Houben, Hans Onvlee, Peter H. N. de With, 和 Fons van der Sommen。IndustReal: 一个用于在类工业环境中处理执行错误的第一人称视频中程序步骤识别的数据集。 在 IEEE/CVF Winter Conf. Appl. Comput. Vis., 2024。URL https://arxiv.org/abs/2310.17323。

63

第 64 页

[300] Dustin Schwenk, Apoorv Khandelwal, Christopher Clark, Kenneth Marino, 和 Roozbeh Mottaghi。A-OKVQA:利用世界知识进行视觉问答的基准测试。在 Eur. Conf. Comput. Vis., 2022. URL https://arxiv.org/abs/2206.01718.

[301] Martin Sedlacek, Pavlo Yefanov, Georgy Ponimatkin, Jai Bardhan, Simon Pilc, Mederic Fourmy, Evangelos Kazakos, Cees G. M. Snoek, Josef Sivic, 和 Vladimir Petrik。REALM:一个经真实到仿真验证的机器人操作泛化基准。IEEE Robot. Autom. Lett., 2026. URL https://arxiv.org/abs/2512.19562.

[302] Fadime Sener, Dibyadip Chatterjee, Daniel Shelepov, Kun He, Dipika Singhania, Robert Wang, 和 Angela Yao。Assembly101:用于理解程序性活动的大规模多视角视频数据集。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2022. URL https://arxiv.org/abs/2203.14712.

[303] Mingyo Seo, H. Andy Park, Shenli Yuan, Yuke Zhu, 和 Luis Sentis。LEGATO:使用抓取工具进行跨具身形态模仿。IEEE Robot. Autom. Lett., 2025. URL https://arxiv.org/abs/2411.03682.

[304] Pierre Sermanet, Tianli Ding, Jeffrey Zhao, Fei Xia, Debidatta Dwibedi, Keerthana Gopalakrishnan, Christine Chan, Gabriel Dulac-Arnold, 等。RoboVQA:机器人的多模态长程推理。在 IEEE Int. Conf. Robot. Autom., 2024. URL https://arxiv.org/abs/2311.00899.

[305] Carmelo Sferrazza, Dun-Ming Huang, Xingyu Lin, Youngwoon Lee, 和 Pieter Abbeel。HumanoidBench:用于全身运动和操作仿真的类人机器人基准。在 Robot. Sci. Syst., 2024. URL https://arxiv.org/abs/2403.10506.

[306] Shuai Shao, Zeming Li, Tianyuan Zhang, Chao Peng, Gang Yu, Xiangyu Zhang, Jing Li, 和 Jian Sun。Objects365:用于目标检测的大规模高质量数据集。在 IEEE/CVF Int. Conf. Comput. Vis., 2019. URL https://doi.org/10.1109/iccv.2019.00852.

[307] Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, 和 Sherry Yang。World-Gymnast:在世界模型中使用强化学习训练机器人。arXiv preprint arXiv:2602.02454, 2026. URL https://arxiv.org/abs/2602.02454.

[308] Pratyusha Sharma, Lekha Mohan, Lerrel Pinto, 和 Abhinav Gupta。Multiple interactions made easy (mime):用于模仿的大规模演示数据。在 Conf. Robot Learn., 2018. URL https://arxiv.org/abs/1810.07121.

[309] Kenneth Shaw, Shikhar Bahl, 和 Deepak Pathak。VideoDex:从互联网视频中学习灵巧性。在 Conf. Robot Learn., 2023. URL https://arxiv.org/abs/2212.04498.

[310] Kenneth Shaw, Shikhar Bahl, Aravind Sivakumar, Aditya Kannan, 和 Deepak Pathak。从互联网视频中的人类手部运动学习灵巧性。Int. J. Robot. Res., 2024. URL https://doi.org/10.1177/02783649241227559.

[311] Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, 和 Baining Guo。VideoVLA:视频生成器可以成为通用的机器人操作器。在 Adv. Neural Inf. Process. Syst., 2025. URL https://arxiv.org/abs/2512.06963.

[312] Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, 等。Halo:用于具身多模态思维链推理的统一视觉-语言-动作模型。在 Int. Conf. Mach. Learn., 2026. URL https://doi.org/10.48550/arXiv.2602.21157.

[313] Mohit Shridhar, Jesse Thomason, Daniel Gordon, Yonatan Bisk, Winson Han, Roozbeh Mottaghi, Luke Zettlemoyer, 和 Dieter Fox。ALFRED:解释日常任务接地指令的基准。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2020. URL https://arxiv.org/abs/1912.01734.

[314] Mohit Shridhar, Lucas Manuelli, 和 Dieter Fox。Perceiver-actor:用于机器人操作的多任务 Transformer。在 Conf. Robot Learn., 2022. URL https://arxiv.org/abs/2209.05451.

[315] Arth Shukla, Stone Tao, 和 Hao Su。ManiSkill-HAB:家庭重组任务中低级操作的基准。在 Int. Conf. Learn. Represent., 2025. URL https://arxiv.org/abs/2412.13211.

[316] Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, 等。SmolVLA:用于经济高效机器人的视觉-语言-动作模型。arXiv preprint arXiv:2506.01844, 2025. URL https://arxiv.org/abs/2506.01844.

[317] Zilin Si 和 Wenzhen Yuan。Taxim:基于示例的 Gelsight 触觉传感器仿真模型。IEEE Robot. Autom. Lett., 2022. URL https://arxiv.org/abs/2109.04027.

64

第 65 页

[318] Zilin Si, Gu Zhang, Qingwei Ben, Branden Romero, Zhou Xian, Chao Liu, 和 Chuang Gan。DIFFTACTILE: 一种用于接触丰富机器人操作的基于物理的可微触觉模拟器。在 Int. Conf. Learn. Represent., 2024. URL https://arxiv.org/abs/2403.08716.

[319] Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid, Ali Farhadi, 和 Karteek Alahari。Charades-ego: 一个大规模配对第三视角和第一视角视频数据集。arXiv preprint arXiv:1804.09626, 2018. URL https://arxiv.org/abs/1804.09626.

[320] Nathan Silberman, Derek Hoiem, Pushmeet Kohli, 和 Rob Fergus。基于 rgbd 图像的室内分割和支持推理。 在 Eur. Conf. Comput. Vis., 2012. URL https://doi.org/10.1007/978-3-642-33715-4_54.

[321] Amanpreet Singh, Guan Pang, Mandy Toh, Jing Huang, Wojciech Galuba, 和 Tal Hassner。TextOCR:迈向 任意形状场景文本的大规模端到端推理。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2021. URL https://arxiv.org/abs/2105.05486.

[322] Suriya Singh, Chetan Arora, 和 C. V. Jawahar。使用深度学习的描述符进行第一人称动作识别。 在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2016. URL https://doi.org/10.1109/cvpr.2016.287.

[323] Daniel Sliwowski, Shail Jadav, Sergej Stanovcic, Jedrzej Orbik, Johannes Heidersberger, 和 Dongheui Lee。 Reassemble:一个用于接触丰富机器人装配和拆卸的多模态数据集。在 Robot. Sci. Syst., 2025. URL https://arxiv.org/abs/2502.05086.

[324] Wenxuan Song, Ziyang Zhou, Han Zhao, Jiayi Chen, Pengxiang Ding, Haodong Yan, Yuxin Huang, Feilong Tang, Donglin Wang, 和 Haoang Li。ReconVLA:作为有效机器人感知器的重建型视觉-语言-动作模型。在 AAAI Conf. Artif. Intell., 2026. URL https://ojs.aaai.org/index.php/AAAI/article/view/38921.

[325] Mohan Kumar Srirama, Sudeep Dasari, Shikhar Bahl, 和 Abhinav Gupta。HRP:用于机器人预训练的人类可供性。 在 Robot. Sci. Syst., 2024. URL https://doi.org/10.15607/rss.2024.xx.068.

[326] Julian Straub, Thomas Whelan, Lingni Ma, Yufan Chen, Erik Wijmans, Simon Green, Jakob J. Engel, Raul Mur-Artal, 等。Replica 数据集:室内空间的数字副本。arXiv preprint arXiv:1906.05797, 2019. URL https://arxiv.org/abs/1906.05797.

[327] Nele-Pauline Suffo, Pierre-Etienne Martin, Anas Suffo, Daniel Haun, 和 Manuel Bohn。Childlens:一个用于儿童活动分析的第一人称视频数据集。Behavior Research Methods, 2026. URL https://doi.org/10.3758/ s13428-026-02982-6.

[328] Baoli Sun, Ning Wang, Xinzhu Ma, Anqi Zou, Yihang Lu, Chuixuan Fan, Zhihui Wang, Kun Lu, 和 Zhiyong Wang。RobAVA:面向基于视频的机械臂动作理解的大规模数据集和基线。在 IEEE/CVF Int. Conf. Comput. Vis., 2025. URL https://doi.org/10.1109/iccv51701.2025.01298.

[329] Andrew Szot, Alex Clegg, Eric Undersander, Erik Wijmans, Yili Zhao, John Turner, Noah Maestre, Mustafa Mukadam, 等。Habitat 2.0:训练家庭助手重新排列其 Habitat。在 Adv. Neural Inf. Process. Syst., 2021. URL https://arxiv.org/abs/2106.14405.

[330] Andrew Szot, Max Schwarzer, Harsh Agrawal, Bogdan Mazoure, Walter Talbott, Katherine Metcalf, Natalie Mackraz, Devon Hjelm, 和 Alexander Toshev。作为具身任务通用策略的大语言模型。在 Int. Conf. Learn. Represent., 2024. URL https://arxiv.org/abs/2310.17722.

[331] Yansong Tang, Dajun Ding, Yongming Rao, Yu Zheng, Danyang Zhang, Lili Zhao, Jiwen Lu, 和 Jie Zhou。 Coin:一个用于综合 instructional 视频分析的大规模数据集。在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2019. URL https://doi.org/10.1109/cvpr.2019.00130.

[332] Stone Tao, Fanbo Xiang, Arth Shukla, Yuzhe Qin, Xander Hinrichsen, Xiaodi Yuan, Chen Bao, Xinsong Lin, 等。ManiSkill3:用于通用具身 AI 的 GPU 并行化机器人仿真和渲染。在 Robot. Sci. Syst., 2025. URL https://arxiv.org/abs/2410.00425.

[333] Tony Tao, Mohan Kumar Srirama, Jason Jingzhou Liu, Kenneth Shaw, 和 Deepak Pathak。DexWild:用于野外机器人策略的灵巧人类交互。在 Robot. Sci. Syst., 2025. URL https://arxiv.org/abs/2505. 07813.

[334] ACE-Brain Team, Ziyang Gong, Haoming Gu, Zehang Luo, Tianyi Zhang, Tao Tao, Yixiao Chi, Zhe Liu, 等。 ACE-Brain-0.5:用于物理智能 AI 的统一具身基础模型。arXiv preprint arXiv:2607.04426, 2026. URL https://arxiv.org/abs/2607.04426.

[335] AgiBot World Team。AgiBot world 2026。https://huggingface.co/datasets/agibot-world/AgiBotWorld2026, 2026. URL https://huggingface.co/datasets/agibot-world/AgiBotWorld2026.

65

第 66 页

[336] GigaBrain 团队,王博远,李博涵,倪超骏,黄冠,赵国胜,李浩,李杰,吕锦迪,刘景宇,等。GigaBrain-0.5 M*:一种基于世界模型强化学习的 VLA。arXiv 预印本 arXiv:2602.12099,2026。URL https://arxiv.org/abs/2602.12099。

[337] GigaWorld 团队,叶安恩,马安远,王博远,倪超骏,叶方正,黄冠,李国,等。GigaWorld-Policy-0.5:由 AutoResearch 赋能的更快更强的 WAM。arXiv 预印本 arXiv:2607.13960,2026。URL https://arxiv.org/abs/2607.13960。

[338] Motubrain 团队,项晨东,包帆,刘海天,谭恒凯,毕宏哲,James Li,刘家宝,等。Motubrain:一种用于机器人控制的高级世界-动作模型。arXiv 预印本 arXiv:2604.27792,2026。URL https://arxiv.org/abs/2604.27792。

[339] Octo Model 团队,Dibya Ghosh,Homer Walke,Karl Pertsch,Kevin Black,Oier Mees,Sudeep Dasari,Joey Hejna,Tobias Kreiman,Charles Xu,等。Octo:一个开源通用机器人策略。In Robot. Sci. Syst.,2024。URL https://doi.org/10.15607/rss.2024.xx.090。

[340] Xiaomi Robotics 团队,郭军,金飘飘,Jason Li,李培岩,李颖燕,刘福腾,彭万里,Optimus Qin,苏一飞,等。Xiaomi-Robotics-1:利用超过 10 万小时真实轨迹扩展视觉-语言-动作模型。arXiv 预印本 arXiv:2607.15330,2026。URL https://arxiv.org/abs/2607.15330。

[341] 田阳,杨雨音,谢一曼,蔡泽涛,石旭,高宁,刘航旭,蒋学坤,等。InternData-A1:开创用于预训练通用策略的高保真合成数据。In IEEE/CVF Conf. Comput. Vis. Pattern Recog.,2026。URL https://doi.org/10.48550/arXiv.2511.16651。

[342] Emanuel Todorov,Tom Erez,Yuval Tassa。MuJoCo:一种用于基于模型的控制的物理引擎。In IEEE/RSJ Int. Conf. Intell. Robots Syst.,2012。URL https://doi.org/10.1109/IROS.2012.6386109。

[343] Brian VanVoorst,Nicholas Walczak,Christopher Gilleo,Charles Meissner,Fabio Felix,Iran Roman,Bea Steers,Claudio Silva,Yuhan Shen,Zijia Lu,Shih-Po Lee,Ehsan Elhamifar。Egomagic:用于训练感知算法的第一人称视频医疗数据集。arXiv 预印本 arXiv:2604.22036,2026。URL https://arxiv.org/abs/2604.22036。

[344] An Dinh Vuong,Minh Nhat Vu,Hieu Le,Baoru Huang,Binh Huynh,Thieu Vo,Andreas Kugi,Anh Nguyen。Grasp-anything:来自基础模型的大规模抓取数据集。In IEEE Int. Conf. Robot. Autom.,2024。URL https://doi.org/10.1109/icra57147.2024.10611277。

[345] Johanna Wald,Armen Avetisyan,Nassir Navab,Federico Tombari,Matthias Nießner。RIO:在变化的室内环境中进行 3D 物体实例重定位。In IEEE/CVF Int. Conf. Comput. Vis.,2019。URL https://arxiv.org/abs/1908.06109。

[346] Johanna Wald,Helisa Dhamo,Nassir Navab,Federico Tombari。从 3D 室内重建中学习 3D 语义场景图。In IEEE/CVF Conf. Comput. Vis. Pattern Recog.,2020。URL https://doi.org/10.1109/cvpr42600.2020.00402。

[347] Homer Rich Walke,Kevin Black,Tony Z Zhao,Quan Vuong,Chongyi Zheng,Philippe Hansen-Estruch,Andre Wang He,Vivek Myers,Moo Jin Kim,Max Du,等。BridgeData v2:一个用于规模化机器人学习的数据集。In Conf. Robot Learn.,2023。URL https://arxiv.org/abs/2308.12952。

[348] Chen Wang,Haochen Shi,Weizhuo Wang,Ruohan Zhang,Li Fei-Fei,C Karen Liu。DexCap:用于灵巧操作的可扩展且便携的动作捕捉数据采集系统。In Robot. Sci. Syst.,2024。URL https://arxiv.org/abs/2403.07788。

[349] 王凯轩,陈天行,刘家伟,苏宏浩,朱少龙,王敏轩,李梓轩,陈悦,等。ManiTwin:将面向数据生成的数字物体数据集扩展至 10 万。arXiv 预印本 arXiv:2603.16866,2026。URL https://arxiv.org/abs/2603.16866。

[350] Lirui Wang,Ling Yiyang,Yuan Zhecheng,Mohit Shridhar,Chen Bao,Qin Yuzhe,Wang Bailin,Xu Huazhe,Wang Xiaolong。GenSim:通过大语言模型生成机器人仿真任务。In Int. Conf. Learn. Represent.,2024。URL https://arxiv.org/abs/2310.01361。

[351] Luming Wang,Hao Shi,Jiajun Zhai,Kailun Yang,Kaiwei Wang。EgoEV-HandPose:使用立体事件相机进行第一人称 3D 手部姿态估计和手势识别。arXiv 预印本 arXiv:2605.12297,2026。URL https://arxiv.org/abs/2605.12297。

[352] Qiuyue Wang,Mingsheng Li,Jian Guan,Jinhui Ye,Sicheng Xie,Yitao Liu,Junhao Chen,Zhixuan Liang,等。Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模。arXiv 预印本 arXiv:2605.30280,2026。URL https://arxiv.org/abs/2605.30280。

66

第 67 页

[353] Ruicheng Wang, Jialiang Zhang, Jiayi Chen, Yinzhen Xu, Puhao Li, Tengyu Liu, 和 He Wang。DexGraspNet:基于仿真的大规模通用物体机器人灵巧抓取数据集。在 IEEE 国际机器人与自动化会议 (IEEE Int. Conf. Robot. Autom.) 上,2023。URL https://arxiv.org/abs/2210.02697。

[354] Shaoxiong Wang, Mike Lambeta, Po-Wei Chou, 和 Roberto Calandra。Tacto:一种快速、灵活且开源的高分辨率基于视觉的触觉传感器模拟器。IEEE 机器人与自动化快报 (IEEE Robot. Autom. Lett.),2022。URL https://doi.org/10.1109/LRA.2022.3146945。

[355] Wenhao Wang, Kehe Ye, Xinyu Zhou, Tianxing Chen, Cao Min, Qiaoming Zhu, Xiaokang Yang, Ping Luo, Yongjian Shen, Yang Yang 等。Fieldgen:从遥操作预操作轨迹到场引导的数据生成。arXiv 预印本 arXiv:2510.20774,2025。

[356] Xin Wang, Taein Kwon, Mahdi Rad, Bowen Pan, Ishani Chakraborty, Sean Andrist, Dan Bohus, Ashley Feniello, Bugra Tekin, Felipe Vieira Frujeri, Neel Joshi, 和 Marc Pollefeys。Holoassist:面向现实世界中交互式 AI 助手的以人为中心的交互数据集。在 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF Int. Conf. Comput. Vis.) 上,2023。URL https://arxiv.org/abs/2309.17024。

[357] Ye Wang, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Haoqi Yuan, Chaoyi Xu, Haiweng Xu, Yicheng Feng, Mingyang Yu, Zhiyu Kang 等。重新思考视觉-语言-动作模型 (VLA) 的扩展:对齐、混合与正则化。arXiv 预印本 arXiv:2602.09722,2026。URL https://arxiv.org/abs/2602.09722。

[358] Yi Ru Wang, Carter Ung, Christopher Tan, Grant Tannert, Jiafei Duan, Josephine Li, Anh Le, Rishabh Oswal, Markus Grotz, Wilbert Pumacay, Yuquan Deng, Ranjay Krishna, Dieter Fox, 和 Siddhartha Srinivasa。RoboEval:机器人操作与结构化可扩展评估的交汇点。arXiv 预印本 arXiv:2507.00435,2025。URL https://arxiv.org/abs/2507.00435。

[359] Yufei Wang, Zhou Xian, Feng Chen, Tsun-Hsuan Wang, Yian Wang, Katerina Fragkiadaki, Zackory Erickson, David Held, 和 Chuang Gan。RoboGen:通过生成式仿真释放无限数据以实现自动化机器人学习。在国际机器学习会议 (Int. Conf. Mach. Learn.) 上,2024。URL https://arxiv.org/abs/2311.01455。

[360] Yuran Wang, Ruihai Wu, Yue Chen, Jiarui Wang, Jiaqi Liang, Ziyu Zhu, Haoran Geng, Jitendra Malik, Pieter Abbeel, 和 Hao Dong。Dexgarmentlab:具有可泛化策略的灵巧服装操作环境。在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.) 上,2025。URL https://arxiv.org/abs/2505.11032。

[361] Zihan Wang, Xiangyang Li, Jiahao Yang, Yeqi Liu, 和 Shuqiang Jiang。通过 3D 特征场实现视觉与语言导航的仿真到现实迁移。在机器人学习会议 (Conf. Robot Learn.) 上,2024。URL https://doi.org/10.48550/arXiv.2406.09798。

[362] Ziming Wang。UMI-3D:将通用操作接口 (UMI) 从视觉受限扩展到 3D 空间感知。arXiv 预印本 arXiv:2604.14089,2026。URL https://arxiv.org/abs/2604.14089。

[363] Luca Weihs, Amanda Rose Yuile, Renée Baillargeon, Cynthia Fisher, Gary Marcus, Roozbeh Mottaghi, 和 Aniruddha Kembhavi。基准测试 AI 达到婴儿级物理推理的进展。机器学习研究汇刊 (Trans. Mach. Learn. Res.),2022。URL https://openreview.net/forum?id=9NjqD9i48M。

[364] Junjie Wen, Yichen Zhu, Minjie Zhu, Zhibin Tang, Jinming Li, Zhongyi Zhou, Xiaoyu Liu, Chaomin Shen, Yaxin Peng, 和 Feifei Feng。Diffusion-VLA:通过统一扩散和自回归扩展机器人基础模型。在国际机器学习会议 (Int. Conf. Mach. Learn.) 上,2025。URL https://arxiv.org/abs/2412.03293。

[365] Hongtao Wu, Ya Jing, Chi-Lam Cheang, Guangzeng Chen, Jiafeng Xu, Xinghang Li, Minghuan Liu, Hang Li, 和 Tao Kong。释放大规模视频生成预训练以用于视觉机器人操作。在表示学习国际会议 (Int. Conf. Learn. Represent.) 上,2024。URL https://arxiv.org/abs/2312.13139。

[366] Kun Wu, Chengkai Hou, Jiaming Liu, Zhengping Che, Xiaozhu Ju, Zhuqin Yang, Meng Li, Yinuo Zhao 等。RoboMIND:机器人操作多具身智能规范数据基准。在机器人科学与系统 (Robot. Sci. Syst.) 上,2025。URL https://doi.org/10.48550/arXiv.2412.13877。

[367] Kun Wu, Ning Liu, Zhen Zhao, Di Qiu, Jinming Li, Zhengping Che, Zhiyuan Xu, Qinru Qiu, 和 Jian Tang。利用自监督从不完美的演示中学习以进行机器人操作。在 IEEE 国际机器人与自动化会议 (IEEE Int. Conf. Robot. Autom.) 上,2025。URL https://doi.org/10.1109/icra55743.2025.11127918。

[368] Longyan Wu, Jieji Ren, Chenghang Jiang, Junxi Zhou, Shijia Peng, Ran Huang, Guoying Gu, Li Chen, 和 Hongyang Li。TAMEn:面向接触丰富任务闭环数据收集的触觉感知操作引擎。arXiv 预印本 arXiv:2604.07335,2026。URL https://arxiv.org/abs/2604.07335。

67

第 68 页

[369] 龙岩吴,余成成,任杰吉,陈丽,蒋雨飞,黄然,顾国英,李宏阳。 FreeTacMan:用于接触丰富操作的免机器人视觉-触觉数据采集系统。在 IEEE 国际机器人与自动化会议,2026。URL https://arxiv.org/abs/2506.01941。

[370] 菲尔普·吴,亚历杭德罗·埃斯孔特雷拉,达尼贾尔·哈夫纳,皮特·阿布贝尔,肯·戈德堡。Daydreamer:用于物理机器人学习的世界模型。在机器人学习会议,2023。URL https://arxiv.org/abs/2206.14176。

[371] 菲尔普·吴,申德义,易中科,林兴宇,皮特·阿布贝尔。GELLO:一种通用、低成本且直观的机器人机械臂遥操作框架。在 IEEE/RSJ 智能机器人与系统国际会议,2024。URL https://arxiv.org/abs/2309.13037。

[372] 吴诗涵,刘学成,谢少轩,王鹏伟,李兴航,杨博文,李哲,朱凯,吴洪宇,刘一恒,等。RoboCoin:用于集成操作的开源双臂机器人数据采集。arXiv 预印本 arXiv:2511.17441,2025。URL https://arxiv.org/abs/2511.17441。

[373] 吴涛,周楚浩,曹浩志,黄彦恒,顾林,杨建飞。NoisyEQA:使用非专家用户的不完美查询来评估具身问答的基准。机器人学习,2026。URL https://arxiv.org/abs/2412.10726。

[374] 吴涛,周楚浩,赵光宇,曹浩志,蒲文燕,杨建飞。当机器人应该说“我不知道”时:评估具身问答中的弃权行为。在 IEEE/CVF 计算机视觉与模式识别会议,2026。URL https://arxiv.org/abs/2512.04597。

[375] 吴彤,张嘉瑞,付晓,王宇鑫,任家伟,潘亮,吴伟,杨磊,王家齐,钱晨,林达华,刘子伟。OmniObject3D:用于真实感知、重建和生成的词汇量大的 3D 物体数据集。在 IEEE/CVF 计算机视觉与模式识别会议,2023。URL https://arxiv.org/abs/2301.07525。

[376] 吴伟,陆帆,王云南,杨帅,刘石,王芳静,朱倩,孙贺,等。一种实用的 VLA 基础模型。arXiv 预印本 arXiv:2601.18692,2026。URL https://arxiv.org/abs/2601.18692。

[377] 吴伟,王芳静,陆帆,孙贺,刘石,王云南,严一斌,王永,等。从基础到应用:在实践中改进 VLA 模型。arXiv 预印本 arXiv:2607.06403,2026。URL https://arxiv.org/abs/2607.06403。

[378] 奚子恒,余嘉怡,王一涛,段彦博,冯建江,周杰。EgoEMG:一种用于手部姿态估计的双侧肌电图与视觉多模态第一人称数据集。arXiv 预印本 arXiv:2605.05712,2026。URL https://arxiv.org/abs/2605.05712。

[379] 向凡博,秦宇哲,莫凯春,夏一宽,朱浩,刘方晨,刘明华,蒋汉霄,等。 Sapien:一种基于部件的模拟交互环境。在 IEEE/CVF 计算机视觉与模式识别会议,2020。 URL https://arxiv.org/abs/2003.08515。

[380] 肖俊杰,杨彦丹,常新源,陈荣瀚,熊峰,徐穆,郑伟石,张清。World-Env:利用世界模型作为 VLA 后训练的虚拟环境。arXiv 预印本 arXiv:2509.24948,2025。URL https://arxiv.org/abs/2509.24948。

[381] 肖俊杰,杨彦丹,常新源,陈荣瀚,熊峰,徐穆,郑伟石,张清。RehearseVLA:使用物理一致的世界模型对 VLA 进行模拟后训练。在 IEEE/CVF 计算机视觉与模式识别会议,2026。URL https://arxiv.org/abs/2509.24948v4。

[382] 谢思成,孟令辰,刁子杰,曹海栋,杜志英,涂书元,冷家齐,王秋月,李明生,白帅,等。统一相机帧中的机器人动作。arXiv 预印本 arXiv:2511.17001,2025。 URL https://arxiv.org/abs/2511.17001。

[383] 徐超一,蒋一轩,环家辉,付雨辉,周浩宇,袁伟田,余嘉怡,张万鹏,袁浩奇,吕宗青。RealDexUMI:一种用于灵巧机器人学习的可穿戴通用操作接口。 arXiv 预印本 arXiv:2606.06033,2026。URL https://arxiv.org/abs/2606.06033。

[384] 徐梦达,张涵,侯一凡,徐振佳,范林,曼努埃拉·维洛索,宋舒然。DexUMI:使用人手作为灵巧操作的通用操作接口。在机器人学习会议,2025。 URL https://arxiv.org/abs/2505.21864。

[385] 徐晓萌,侯一凡,辛晨东,刘泽毅,宋舒然。合规残差 DAgger:通过人类纠正改善现实世界中接触丰富的操作。在神经信息处理系统进展,2025。URL https://arxiv.org/abs/2506.16685。

68

第 69 页

[386] 徐悦, 魏立涛, 安彭宇, 张庆宇, 李永禄. Exumi: 具有动作感知任务无关触觉表示的可扩展机器人教学系统. 在机器人学习会议 (Conf. Robot Learn.), 2025. URL https://doi.org/10.48550/arXiv.2509.14688.

[387] 闫宁宇, 王帅, 沈兴, 王辉, 王汉卿, 杨翔, 庞剑淼. Tac2Real: 用于在线强化学习和零样本现实部署的可靠且基于 GPU 的视觉触觉仿真. arXiv 预印本 arXiv:2603.28475, 2026. URL https://arxiv.org/abs/2603.28475.

[388] 杨丰宇, 马晨阳, 张家诚, 朱静, 袁文臻, Andrew Owens. Touch and go: 从人类收集的视觉和触觉中学习. 在神经信息处理系统进展 (Adv. Neural Inf. Process. Syst.), 2022. URL https://arxiv.org/abs/2211.12498.

[389] 杨嘉志, 林昆阳, 李金伟, 张文聪, 林天伟, 吴龙岩, 苏志忠, 赵浩, 张亚勤, 陈力, 等. RISE: 具有组合世界模型的自我改进机器人策略. arXiv 预印本 arXiv:2602.11075, 2026. URL https://arxiv.org/abs/2602.11075.

[390] 杨景康, 刘帅, 郭洪明, 董耀, 张夏梦微, 张思成, 王鹏云, 周子唐, 等. EgoLife: 迈向第一人称生活助手. 在 IEEE/CVF 计算机视觉与模式识别会议 (IEEE/CVF Conf. Comput. Vis. Pattern Recog.), 2025. URL https://arxiv.org/abs/2503.03803.

[391] 杨瑞涵, 于钦熙, 吴业诚, 闫瑞, 李博瑞, 程安杰, 邹雪岩, 方云浩, 程旭旭, 邱日昭, 等. EgoVLA: 从第一人称人类视频中学习视觉-语言-动作模型. arXiv 预印本 arXiv:2507.12440, 2025. URL https://arxiv.org/abs/2507.12440.

[392] 杨雪, 杜一伦, Kamyar Ghasemipour, Jonathan Tompson, Leslie Kaelbling, Dale Schuurmans, Pieter Abbeel. 学习交互式现实世界仿真器. 在国际学习表征会议 (Int. Conf. Learn. Represent.), 2024. URL https://openreview.net/forum?id=sFyTZEqmUY.

[393] 杨亚丹, 曾双, 林通, 常新远, 齐德康, 肖俊杰, 刘浩云, 陈荣瀚, 等. ABot-M0: 基于动作流形学习的机器人操作 VLA 基础模型. arXiv 预印本 arXiv:2602.11236, 2026. URL https://arxiv.org/abs/2602.11236.

[394] 叶安根, 王博远, 倪超军, 黄冠, 赵国胜, 李浩, 李恒涛, 李杰, 等. GigaWorld-Policy: 一种高效的动作中心型世界-动作模型. arXiv 预印本 arXiv:2603.17240, 2026. URL https://arxiv.org/abs/2603.17240.

[395] 叶江龙, 王可毅, 袁成静, 杨瑞涵, 李一泉, 朱一越, 秦玉哲, 邹雪岩, 王小龙. Dex1b: 利用 10 亿次演示学习灵巧操作. 在机器人科学与系统会议 (Robot. Sci. Syst.), 2025. URL https://doi.org/10.48550/arXiv.2506.17198.

[396] 杨成铉, 姜哲, 全炳国, 赵世俊, 杨建伟, 彭宝林, Ajay Mandlekar, Reuben Tan, 赵宇伟, Bill Yuchen Lin, 等. 基于视频的潜在动作预训练. 在国际学习表征会议 (Int. Conf. Learn. Represent.), 2025. URL https://arxiv.org/abs/2410.11758.

[397] 杨成铉, 葛云浩, 郑凯元, 高申元, 余思宏, George Kurian, Suneel Indupuru, Tan You Liang, 等. 世界动作模型是零样本策略. arXiv 预印本 arXiv:2602.15922, 2026. URL https://arxiv.org/abs/2602.15922.

[398] 叶一凡, 陈军, 陈静, 卢志和. 仿真世界中的自我演化模仿学习. IEEE 机器人与自动化快报, 11(6):6967–6974, 2026. doi: 10.1109/LRA.2026.3683594. URL https://doi.org/10.1109/LRA.2026.3683594.

[399] Chandan Yeshwanth, 刘岳成, Matthias Nießner, Angela Dai. ScanNet++: 高保真 3D 室内场景数据集. 在 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF Int. Conf. Comput. Vis.), 2023. URL https://doi.org/10.1109/iccv51070.2023.00008.

[400] 杨可欣, 甘闯, 李云竹, Pushmeet Kohli, 吴佳骏, Antonio Torralba, Joshua B. Tenenbaum. CLEVRER: 用于视频表示和推理的碰撞事件. 在国际学习表征会议 (Int. Conf. Learn. Represent.), 2020. URL https://arxiv.org/abs/1910.01442.

[401] 尹成浩, 黄达, 杨迪, 王纪超, 赵南舒, 徐晨, 孙文俊, 侯林杰, 等. Genie sim 3.0: 人形机器人高保真综合仿真平台. arXiv 预印本 arXiv:2601.02078, 2026. URL https://arxiv.org/abs/2601.02078.

[402] Tenny Yin, 梅志廷, 郑中和, 山根美由, David Wang, Jade Sceats, Samuel M. Bateman, 赵立涵, Apurva Badithela, Ola Shorinwa, 等. PlayWorld: 从自主玩耍中学习机器人世界模型. arXiv 预印本 arXiv:2603.09030, 2026. URL https://arxiv.org/abs/2603.09030.

69

第 70 页

[403] 余恩, 吕浩然, 孙建建, 林康恒, 张瑞涛, 史玉康, 陈宇阳, 陈泽, 等. DM0: 迈向物理智能的具身原生视觉-语言-动作模型. arXiv 预印本 arXiv:2602.14974, 2026. URL https://arxiv.org/abs/2602.14974.

[404] Licheng Yu, Patrick Poirson, Shan Yang, Alexander C. Berg, 和 Tamara L. Berg. 建模指代表达中的上下文. 在 Eur. Conf. Comput. Vis., 2016. URL https://arxiv.org/abs/1608.00272.

[405] 余齐, 尤继迪, 王雨然, 梁家祺, 平博文, 田阳, 陈悦, 蔡明宏, 龚泽颖, 吴瑞海, 等. AffordanceVLA: 一种通过感知可用性理解赋能动作生成的视觉-语言-动作模型. arXiv 预印本 arXiv:2606.06155, 2026. URL https://arxiv.org/abs/2606.06155.

[406] Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, 等. Wall-OSS-0.5 技术报告. arXiv 预印本 arXiv:2605.30877, 2026. URL https://arxiv.org/abs/2605.30877.

[407] Tianhe Yu, Chelsea Finn, Annie Xie, Sudeep Dasari, Tianhao Zhang, Pieter Abbeel, 和 Sergey Levine. 通过领域自适应元学习从观察人类中进行单样本模仿. 在 Robot. Sci. Syst., 2018. URL https://arxiv.org/abs/1802.01557.

[408] Tianhe Yu, Deirdre Quillen, Zhanpeng He, Ryan Julian, Avnish Narayan, Hayden Shively, Adithya Bellathur, Karol Hausman, Chelsea Finn, 和 Sergey Levine. Meta-world: 多任务和元强化学习的基准与评估. 在 Conf. Robot Learn., 2019. URL http://arxiv.org/abs/1910.10897.

[409] 余旭民, 刘祖岩, 王紫怡, 张赫, 饶永明, 刘方福, 张亚妮, 赵若文, 等. HY-Embodied-0.5: 面向现实世界智能体的具身基础模型. arXiv 预印本 arXiv:2604.07430, 2026. URL https://arxiv.org/abs/2604.07430.

[410] 袁成博, 文川, 张彤, 和高阳. 通用流作为可扩展机器人学习的基础可用性. 在 Conf. Robot Learn., 2024. URL https://arxiv.org/abs/2401.11439.

[411] 袁成博, 周瑞, 刘梦真, 胡英东, 王圣杰, 李毅, 文川, 张尚航, 和高阳. MotionTrans: 人类 VR 数据实现机器人操作策略的运动级学习. arXiv 预印本 arXiv:2509.17759, 2025. URL https://arxiv.org/abs/2509.17759.

[412] 袁浩奇, 梁志轩, 陈安哲, 王晔, 李浩阳, 林沛, 黄一阳, 雷子兴, 张彤, 张佳钊, 等. Qwen-robotmanip 技术报告: 对齐解锁机器人操作基础模型的规模. arXiv 预印本 arXiv:2606.17846, 2026. URL https://arxiv.org/abs/2606.17846.

[413] Wentao Yuan, Jiafei Duan, Valts Blukis, Wilbert Pumacay, Ranjay Krishna, Adithyavairavan Murali, Arsalan Mousavian, 和 Dieter Fox. RoboPoint: 一种用于机器人空间可用性预测的视觉-语言模型. 在 Conf. Robot Learn., 2024. URL https://arxiv.org/abs/2406.10721.

[414] Kevin Zakka, Baruch Tabanpour, Qiayuan Liao, Mustafa Haiderbhai, Samuel Holt, Jing Yuan Luo, Arthur Allshire, Erik Frey, 等. MuJoCo playground. 在 Robot. Sci. Syst., 2025. URL https://doi.org/10.48550/arXiv.2502.08844. 演示论文.

[415] Abhay Zala, Jaemin Cho, Satwik Kottur, Xilun Chen, Barlas Oguz, Yashar Mehdad, 和 Mohit Bansal. 分层视频片段检索与步骤描述. 在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2023. URL https://arxiv.org/abs/2303.16406.

[416] 曾宪超, 周新宇, 李友成, 施家佑, 李天乐, 陈良明, 任磊, 和 李永禄. 通过视觉符号诊断、纠正并从操作失败中学习. 在 IEEE/CVF Conf. Comput. Vis. Pattern Recog., 2026. URL https://arxiv.org/abs/2512.02787.

[417] Anran Zhang, Hanzhi Chen, Yannick Burkhardt, Yao Zhong, Johannes Betz, Helen Oleynikova, 和 Stefan Leutenegger. Actron3d: 从视频中学习可操作神经函数以实现可迁移的机器人操作. 在 IEEE Int. Conf. Robot. Autom., 2026. URL https://arxiv.org/abs/2510.12971.

[418] Chaofan Zhang, Shaowei Cui, Jingyi Hu, Tianyu Jiang, Tiandong Zhang, Rui Wang, 和 Shuo Wang. TacFlex: 具有涂层图案的视觉触觉传感器的多模式触觉印记仿真. IEEE Trans. Robot., 2025. URL https://doi.org/10.1109/TRO.2025.3576970.

[419] Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, 和 Yansong Tang. Clap: 用于从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练. arXiv 预印本 arXiv:2601.04061, 2026. URL https://arxiv.org/abs/2601.04061.

70

第 71 页

[420] Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, 等. UniDex:一种用于从第一人称人类视频中实现通用灵巧手控制的机器人基础套件。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。URL https://arxiv.org/abs/arXiv.2603.22264。

[421] Han Zhang, Songbo Hu, Zhecheng Yuan, 和 Huazhe Xu. DOGlove:使用低成本开源触觉力反馈手套进行灵巧操作。在机器人科学与系统会议 (RSS) 上,2025。URL https://arxiv.org/abs/2502.07730。

[422] He Zhang, Lingzhu Xiang, Haitao Lin, Zeyu Huang, Minghui Wang, Dingyan Zhong, Yubo Dong, Yihao Wu, 等. Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到现实世界机器人学习栈。arXiv 预印本 arXiv:2606.14409,2026。URL https://arxiv.org/abs/2606.14409。

[423] Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, 和 Li Zhang. 通过预言强化动作策略。arXiv 预印本 arXiv:2511.20633,2025。URL https://arxiv.org/abs/2511.20633。

[424] Jialiang Zhang, Haoran Liu, Danshi Li, Xinqiang Yu, Haoran Geng, Yufei Ding, Jiayi Chen, 和 He Wang. DexGraspNet 2.0:在大规模合成杂乱场景中学习生成式灵巧抓取。在机器人学习会议 (CoRL) 上,2024。URL https://arxiv.org/abs/2410.23004。

[425] Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, 和 Jianyu Chen. Up-vla:一种用于具身代理的统一理解与预测模型。在第 42 届国际机器学习会议 (ICML) 论文集上,2025。

[426] Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, 等. 用于泛化机器人控制的本地视频-动作预训练。arXiv 预印本 arXiv:2607.08639,2026。URL https://arxiv.org/abs/2607.08639。

[427] Shiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li, Qinghui Gao, Zhaoye Fei, Zhangyue Yin, Zuxuan Wu, Yu-Gang Jiang, 和 Xipeng Qiu. VLABench:一个用于具有长程推理任务的语言条件机器人操作的大规模基准测试。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2025。URL https://arxiv.org/abs/2412.18194。

[428] Tianle Zhang, Zhihao Yuan, Dafeng Chi, Peidong Liu, Dongwei Li, Kejun Hu, Likui Zhang, Junnan Nie, 等. JoyAI-RA 0.1:一种用于机器人自主性的基础模型。arXiv 预印本 arXiv:2604.20100,2026。URL https://arxiv.org/abs/2604.20100。

[429] Tianyi Zhang, Haonan Duan, Haoran Hao, Yu Qiao, Jifeng Dai, 和 Zhi Hou. 在相机空间中 grounding 动作:以观察为中心的视觉-语言-动作策略。在 AAAI 人工智能会议论文集,第 40 卷,第 18782–18790 页,2026。

[430] Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, 等. DreamVLA:一个由综合世界知识“梦想”而成的视觉-语言-动作模型。在神经信息处理系统进展 (NeurIPS) 上,2025。URL https://arxiv.org/abs/2507.04447。

[431] Yi Zhang, Che Liu, Xiancong Ren, Hanchu Ni, Shuai Zhang, Zeyuan Ding, Jiayu Hu, Hanzhe Shan, 等. Pelican-VL 1.0:一种用于具身智能的基础大脑模型。arXiv 预印本 arXiv:2511.00108,2025。URL https://arxiv.org/abs/2511.00108。

[432] Yi Zhang, Yinda Chen, Che Liu, Zeyuan Ding, Jin Xu, Shilong Zou, Junwei Liao, Jiayu Hu, 等. Pelican-Unify 1.0:一种用于理解、推理、想象和动作的统一具身智能模型。arXiv 预印本 arXiv:2605.15153,2026。URL https://arxiv.org/abs/2605.15153。

[433] Yuan Zhang, Chenyu Xue, Wenjie Xu, Chao Ji, Jiajia Wu, 和 Jia Pan. iFlyBot-VLA 技术报告。arXiv 预印本 arXiv:2511.01914,2025。URL https://arxiv.org/abs/2511.01914。

[434] Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, 和 Chunyuan Li. LLaVA-Video:使用合成数据进行视频指令微调。机器学习研究汇刊 (TMLR),2025。URL https://arxiv.org/abs/2410.02713。

[435] Zongzheng Zhang, Jingrui Pang, Zhuo Yang, Kun Li, Minwen Liao, Saining Zhang, Guoxuan Chi, Jinbang Guo, Huan-ang Gao, Modi Shi, 等. Dexora:用于高自由度双臂灵巧操作开源的 VLA。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2026。URL https://arxiv.org/abs/2605.18722。

[436] Hongxiang Zhao, Xingchen Liu, Mutian Xu, Yiming Hao, Weikai Chen, 和 Xiaoguang Han. TASTE-Rob:推进面向任务的手-物交互视频生成以实现泛化机器人操作。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2025。URL https://arxiv.org/abs/2503.11423。

71

第 72 页

[437] 赵青青, 姚路, Moo Jin Kim, 傅子鹏, 张卓阳, 吴业成, 李昭硕, 马千里, 韩松, Chelsea Finn 等. CoT-VLA: 视觉-语言-动作模型的视觉思维链推理. 在 IEEE/CVF 计算机视觉与模式识别会议, 2025. URL https://doi.org/10.1109/cvpr52734.2025.00166.

[438] Tony Z Zhao, Vikash Kumar, Sergey Levine, 和 Chelsea Finn. 使用低成本硬件学习细粒度双臂操作. 在机器人科学与系统会议, 2023. URL https://arxiv.org/abs/2304.13705.

[439] Tony Z Zhao, Jonathan Tompson, Danny Driess, Pete Florence, Kamyar Ghasemipour, Chelsea Finn, 和 Ayzaan Wahid. ALOHA unleashed: 机器人灵巧性的简单配方. 在机器人学习会议, 2024. URL https://arxiv.org/abs/2410.13126.

[440] 赵振宇, 景宏毅, 刘夏伟, 毛家庚, Abha Jha, 杨汉文, 薛荣, Sergey Zakharov, Vitor Guizilini, 和王越. Humanoid everyday: 面向开放世界人形操作的综合机器人数据集. 在 IEEE 机器人与自动化国际会议, 2026. URL https://arxiv.org/abs/2510.08807.

[441] Zhaxizhuoma, 刘科辉, 关楚月, 贾中杰, 吴子牛, 刘欣, 王天宇, 梁帅 等. FastUMI: 具有数据集的可扩展且硬件无关的通用操作接口 (UMI). 在机器人学习会议, 2025. URL https://arxiv.org/abs/2409.19499.

[442] 郑金良, 李建雄, 王志浩, 刘冬秀, 康希瑞, 冯玉春, 郑一南, 邹佳音 等. X-VLA: 作为可扩展跨具身形态视觉-语言-动作模型的软提示 Transformer. 在国际学习表征会议, 2026. URL https://arxiv.org/abs/2510.10274.

[443] 郑锐杰, 牛丹彤, 谢宇奇, 王静, 徐梦达, 蒋云帆, Fernando Castañeda, 胡凤源, Tan You Liang, Fu Letian 等. EgoScale: 利用多样化第一人称人类数据扩展灵巧操作. arXiv 预印本 arXiv:2602.16710, 2026. URL https://arxiv.org/abs/2602.16710.

[444] 郑宇航, 顾松恩, 李伟泽, 郑宇鹏, 臧雨杰, 田帅, 李翔, 何策, 高晨, 刘思 等. OmniVTA: 用于接触丰富机器人操作的视觉-触觉世界建模. arXiv 预印本 arXiv:2603.19201, 2026. URL https://arxiv.org/abs/2603.19201.

[445] 钟林庆, 刘毅, 魏一飞, 熊子玉, 姚茂庆, 刘思, 任光辉. Acot-VLA: 视觉-语言-动作模型的动作思维链. 在 IEEE/CVF 计算机视觉与模式识别会议, 2026. URL https://doi.org/10.48550/arXiv.2601.11404.

[446] 钟一凡, 白丰硕, 蔡少飞 等. 视觉-语言-动作模型综述: 一种动作标记化视角. arXiv 预印本 arXiv:2507.01925, 2025. URL https://arxiv.org/abs/2507.01925.

[447] 钟志德, 李俊峰, 何俊杰, 严浩东, 龚欣, 赵冠宇, 蔡英杰, 高建涛, 颜旭, 刘冰冰 等. Dualcot-VLA: 通过并行推理实现视觉-语言思维链的视觉-语言-动作模型. arXiv 预印本 arXiv:2603.22280, 2026. URL https://arxiv.org/abs/2603.22280.

[448] 周博磊, 赵航, Xavier Puig, Tete Xiao, Sanja Fidler, Adela Barriuso, 和 Antonio Torralba. 通过 ADE20K 数据集实现场景的语义理解. 国际计算机视觉杂志, 2019. URL https://arxiv.org/abs/1608.05442.

[449] 周建一, 高子腾, 洪飞扬, 刘子瑞, 张国安, 戴伟胜, 甄瑞晨, 吕楚乔 等. Touchanything: 基于第一人称视频的双臂触觉估计数据集与框架. arXiv 预印本 arXiv:2605.13083, 2026. URL https://arxiv.org/abs/2605.13083.

[450] 朱春宁, Raymond Yu, 冯思远, Benjamin Burchfiel, Paarth Shah, 和 Abhishek Gupta. 统一世界模型: 耦合视频与动作扩散以在大型机器人数据集上进行预训练. 在机器人科学与系统会议, 2025. URL https://arxiv.org/abs/2504.02792.

[451] 朱方奇, 吴宏涛, 郭松, 刘宇晓, Chilam Cheang, 和 Kong Tao. IRASim: 用于机器人操作的细粒度世界模型. 在 IEEE/CVF 计算机视觉国际会议, 2025. URL https://arxiv.org/abs/2406.14540.

[452] 朱方奇, 严正阳, 洪子聪, 寿全鑫, 马晓, 和郭松. WMPO: 基于世界模型的视觉-语言-动作模型策略优化. 在国际学习表征会议, 2026. URL https://arxiv.org/abs/2511.09515.

[453] 朱欣悦, 黄炳浩, 和 Li Yunzhu. 野外触觉: 使用便携式视觉-触觉夹爪学习细粒度操作. 在神经信息处理系统进展会议, 2025. URL https://arxiv.org/abs/2507.15062.

72

发表评论