ACE-Data-0:在真实家中同步捕捉视觉、运动与触觉,填补具身数据鸿沟

快速导读:提出环境捕捉引擎ACE,在真实家居环境中同步采集多模态数据,构建包含17M帧、75000个交互片段的ACE-Data-0数据集,并建立从信号到交互的分层基准。

具身智能系统需要理解完整的感知-行动循环:从第一人称视角观察世界,通过身体运动与物体交互,同时接收触觉和听觉反馈。然而,现有数据集在这一链条上存在严重碎片化——要么提供大规模自然行为但缺少精确运动真值,要么在实验室中记录精确姿态却脱离真实家居环境。ACE-Data-0正是为弥合这一鸿沟而构建的。

该工作设计并部署了环境捕捉引擎ACE,将真实公寓转化为多模态录制工作室。ACE包含桌面级和房间级两种互补配置,同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体6-DoF轨迹、多通道音频和触觉信号。基于此系统,作者采集了50名参与者在2个环境中执行200类任务的数据,总计17M帧、75000个交互片段,并建立了从低层信号推断到具身交互估计的三级分层基准。

英文题目:ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

论文出处:arXiv 每日论文精选 · arXiv:2607.28625

原始论文:PDF / 论文页面

对应视频标题:ACE-Data-0:在真实家中同步捕捉视觉、运动与触觉,填补具身数据鸿沟|推荐指数:★★★★★

这篇论文解决什么问题?

具身智能的数据瓶颈体现在三个维度。第一,模态不完整:Ego4D等数据集提供大规模第一人称视频,但缺少运动真值和触觉信号;GRAB和ARCTIC提供精确的手部和全身姿态,却限于实验室环境,且不包含第一人称视角。第二,时间尺度碎片化:大多数HOI数据集仅覆盖秒级原子动作,如单次抓取或放置,缺乏长程目标导向的家庭活动序列。第三,环境真实性不足:实验室环境无法复现真实家居中的遮挡、光照变化和自然行为模式。

触觉信号的缺失尤为关键。在视觉遮挡下——例如手部被物体遮挡或双手交叠——仅凭视觉难以判断是否发生接触、接触力度如何。触觉是感知-行动循环中不可或缺的反馈通道,但现有数据集中几乎完全缺失。

此外,现有数据集往往只关注单一空间尺度。精细手物操作需要近距离高精度捕捉,而全身场景交互则需要大范围覆盖。两者对硬件配置、标定精度和时间同步的要求截然不同,很少有系统能同时兼顾。

ACE-Data-0的定位正是填补这一空白:在真实家居环境中,以双尺度配置同步采集完整的多模态数据,覆盖从原子动作到长程任务链的完整交互序列。

核心创新

  • 提出环境捕捉引擎ACE,以桌面级和房间级双配置在真实家居环境中实现多模态同步采集。
  • 构建ACE-Data-0,首个在真实家居中同步提供第一人称视频、多视角第三人称视频、全身与手部运动、物体6-DoF轨迹、音频和触觉信号的长程HOI数据集。
  • 建立从低层信号(触觉推断)、场景组件(人体运动估计)到具身交互(手物交互估计)的三级分层基准。

方法概览

设计环境捕捉引擎ACE,包含桌面级和房间级两种互补配置。桌面级通过密集近距相机和触觉手套解析精细手物操作;房间级在约200平方米的家具公寓中覆盖全身运动和场景交互。系统同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体6-DoF轨迹、多通道音频和触觉信号,并通过硬件触发、光学时钟和IMU匹配实现时间对齐,利用ArUco板与光学动捕系统实现空间标定。基于ACE采集ACE-Data-0,包含50名参与者在2个环境中执行200类任务的数据,并提供从动捕真值自动衍生的丰富标注。

  • 桌面级配置:在约2平方米的桌面上方密集部署相机和触觉手套,专注于精细手物操作。该配置可解析手指级别的抓取、工具使用和双手协调动作。
  • 房间级配置:在约200平方米的家具公寓中覆盖全身运动和场景交互。参与者可自由移动,执行烹饪、清洁、整理等长程家庭任务。
  • 多模态同步采集:系统同步采集第一人称视频(头戴相机)、多视角第三人称视频(环绕场景的固定相机)、全身与手部运动(光学动捕+IMU)、物体6-DoF轨迹(动捕标记点)、多通道音频(环境麦克风阵列)和触觉信号(触觉手套)。
  • 时间对齐:通过硬件触发信号、光学时钟同步和IMU匹配实现跨模态时间对齐,确保所有数据流在同一时间轴上精确对应。
  • 空间标定:利用ArUco板与光学动捕系统实现相机外参标定,将第一人称视角、第三人称视角和世界坐标系统一到同一空间参考系。
  • 自动标注管线:从动捕真值自动衍生丰富标注,包括物体6-DoF姿态、手部和身体SMPL-X参数、触觉压力图、物体边界框和运动轨迹,以及时间对齐的自然语言描述。
  • 任务设计:覆盖三类交互——原子HOI任务(如抓取杯子)、HOI任务链(如制作咖啡的完整流程)和HSI任务(如整理房间),共200类任务。
  • 数据规模:总计17M帧、75000个交互片段,参与者50人,环境2个。

逐图理解论文

方法贡献与验证

方法贡献与验证
Figure 3 Overall workflow of ACE. Each participant wears the motion-capture suit before the multi-modal recording. Synchronization is conducted after data export to align the timeline of each modality. Finally, we annotate the collected data with rich and high-quality labels derived from the captured ground truth.

论文的贡献分两层。第一层是环境捕捉引擎ACE本身——桌面级配置解析精细手物操作,房间级配置覆盖全身场景交互,通过硬件触发和光学标定把所有模态对齐到同一时空坐标系。第二层是基于ACE采集的ACE-Data-0数据集,包含50名参与者在真实公寓中执行200类任务的数据,并自动衍生出物体姿态、手部参数、触觉压力图等丰富标注。为了验证数据的价值,作者建立了一个三级分层基准:从低层的触觉推断,到中层的人体运动估计,再到高层的具身手物交互估计。每一级都直接测试感知-行动循环的一个关键环节。

最强结论

最强结论
Table 3 Tactile estimation from ego-view on ACE-Data-0.

基准测试揭示了一个清晰的结论:在真实家居的遮挡和长程任务下,现有模型在感知-行动循环的每一环都有显著提升空间。触觉推断的相关系数虽然达到0.85,但在精细接触区域仍不可靠;人体运动估计在房间级场景中误差明显增大;手部姿态估计在第一人称视角下受自遮挡困扰,在第三人称视角下又损失了操作细节。这说明,仅靠视觉或仅靠运动真值都不够——真正的具身智能需要多模态的同步感知。

Figure 2 Overview of the Ambient Capture Engine

Figure 2 Overview of the Ambient Capture Engine
Figure 2 Overview of the Ambient Capture Engine. We design two complementary home scenes and capture at two spatial scales, with the equipment installed accordingly.

图2呈现ACE的硬件部署概览。桌面级和房间级两种配置的相机、传感器布局清晰可见,展示了如何在真实家居中实现无死角的多模态采集。

实验如何设计?

  • 触觉从视觉推断:以第一人称视频为输入,预测全手掌压力图。评估多种模型架构,包括基于CNN和Transformer的方法。
  • 人体运动估计:在ACE-Data-0上评估SOTA人体姿态估计方法,输入为第三人称多视角视频,输出SMPL-X参数,指标包括MPJPE和PA-MPJPE。
  • 手部运动估计(第一人称视角):从第一人称视频恢复手部姿态,评估多种专用手部姿态估计方法。
  • 手部运动估计(第三人称视角):从第三人称视频恢复手部姿态,对比与第一人称视角的性能差异。
  • 跨视角分析:系统对比第一人称和第三人称视角下手部运动估计的性能,分析遮挡、视点和分辨率的影响。

关键结果与论文证据

  • 触觉推断:最佳模型从第一人称视频预测全手掌压力图的相关系数为0.85(第23页),表明视觉信号包含丰富的触觉线索,但在精细接触区域仍有较大误差。
  • 人体运动估计:最佳模型在房间级配置下达到45.2 mm MPJPE(第24页),真实家居环境中的遮挡和复杂姿态对现有方法构成显著挑战。
  • 第一人称手部运动估计:最佳模型达到12.3 mm MPJPE(第26页),第一人称视角下的手部自遮挡和物体遮挡是主要误差来源。
  • 第三人称手部运动估计:最佳模型达到10.8 mm MPJPE(第27页),略优于第一人称视角,因为第三人称视角可提供更完整的手部可见性。
  • 跨视角差异:第一人称视角在精细操作中提供更丰富的细节,但遮挡更严重;第三人称视角覆盖更完整,但分辨率较低。两者互补,联合使用可进一步提升性能。
  • 长程任务挑战:在HOI任务链中,模型性能随时间推移逐渐下降,累积误差问题突出,表明长程时序建模仍是开放问题。
  • 触觉信号的独特价值:在视觉完全遮挡的场景中,触觉信号是判断接触状态的唯一可靠来源,验证了多模态采集的必要性。
  • 基准的层次设计:三级基准从信号推断、场景恢复到交互估计,系统揭示了感知-行动循环各环节的瓶颈,为后续研究提供了清晰的改进方向。

阅读时需要注意

  • 场景和主体多样性有限:数据集目前仅包含2个环境和50名参与者,可能无法充分覆盖不同家居布局、光照条件和行为模式。
  • 采集设备干扰:触觉手套和动捕服可能对参与者的自然行为产生一定约束,与完全自然的家庭活动存在差距。
  • 录制时长限制:单次录制最长约30分钟,仍短于真实家庭活动的完整周期(如数小时的烹饪和清洁)。
  • 标注噪声:所有标注主要依赖动捕系统自动生成,在严重遮挡下可能存在噪声,尽管经过人工校验。
  • 域差异:基准测试中部分方法的性能可能受限于训练数据与ACE-Data-0之间的域差异,而非方法本身的能力上限。

关联工作

  • Ego-Exo4D提供大规模同步第一人称和第三人称视频,但缺少运动真值和触觉信号,无法支持精确的姿态估计和接触分析。
  • GRAB和ARCTIC提供高质量的全身和手部运动真值,但限于实验室环境和原子动作,缺乏真实家居场景和长程任务。
  • ParaHome在家庭环境中记录长程活动,但缺少触觉信号和同步的第一人称视角,无法完整覆盖感知-行动循环。
  • HOT3D提供第一人称多视角手物轨迹,但缺少全身运动、音频和触觉,空间尺度限于桌面操作。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ACE-Data-0:以人为中心的环境捕捉 作为具身数据引擎

Yukang Cao1*、Haozhe Xie1*、Beichen Wen2*、Runmao Yao1、Yinghao Liu2、Yue Huang2、 Zhichao Liao2、Yunxiang Wang1、Haiheng Liu1、Xingshun Tian2、Dawei Su2、Long Zhuo2、 Dacheng Tao2†、Xiaogang Wang2†、Liang Pan2‡、Ziwei Liu1‡

1 S-Lab,南洋理工大学 2 ACE Robotics

2026 https://ace-data-engine.github.io/ACE-Data-0/ 数据模态 1 捕捉主题

  • 同等贡献 † 项目顾问 ‡ 项目负责人

第一人称视频 简单HOI任务 — 单步长程交互 第三人称视频 …

动作捕捉 拿点水 整理房间 做饭30 复杂HOI任务 触觉 — 多步长程交互

音频 … … 切菜 烹饪 清洁

HSI任务 同步捕捉 — 人-场景交互

t …

锻炼 坐在沙发上 躺在床上[cs.CV] 2 数据标注 所有标注均与同步数据对齐

人体与手部姿态 物体名称 运动轨迹

… 杯子 碗 锅 所有模态均为 椅子 桌子 … 时间对齐 边界框 6D姿态(物体)

第一人称视角捕捉示例

触觉 音频 Gemini文本标签 … 一名男子在水龙头 下冲洗并拧干 清洁布

多视角 时间同步 标注质量 结构化 多样化场景 丰富标注 为具身AI 捕捉 与处理 检查 数据集 与交互 针对HOI与HSI 研究准备就绪

图1 我们介绍环境捕捉引擎(ACE),这是一个将真实家庭环境转变为录制影棚的捕捉系统。ACE在两个互补的尺度上观察家庭活动,即桌面尺度和房间尺度。通过ACE,我们捕捉并发布了ACE-Data-0,该数据集具有同步的多模态和丰富的arXiv:2607.28625v1 数据标注。

第 2 页

摘要

具身智能面临根本性的数据瓶颈。学习在物理世界中行动,需要的不仅仅是观察动作的样子:模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随着人类追求目标而共同演化。现有数据集通常将这种体验按视角、模态或空间尺度割裂开来,导致完整的感知-行动循环仅被部分观测。

我们引入了环境捕捉引擎(Ambient Capture Engine, ACE),这是一个以人为中心的数据引擎,可将真实的家庭环境转变为空间标定、时间同步的录制工作室。ACE在两个互补的尺度上运作:桌面尺度配置解析精细的手-物操作,而房间尺度配置则捕捉分布在配备家具的家庭中的全身运动、移动和交互。在这两种设置下,ACE将第一人称和多视角第三人称视频、全身及手部关节运动、高保真物体几何与六自由度(位置和朝向)轨迹、多通道音频以及触觉信号记录为统一的多感官流。

利用ACE,我们构建了ACE-Data-0,包含200个任务类别、150小时和1700万视频帧,由50名参与者在2个环境中完成,总计75,000个交互片段。该数据集涵盖原子操作、长序列家务活动链以及人-场景交互(HSI),同时通过目标层面而非逐步指令来保留自然的行为变化。我们进一步引入了一个分层基准,从信号到场景组件,再到交互逐步递进。它包含从视觉观测进行触觉推断、人体运动恢复,以及从第一人称和第三人称视角进行手部运动重建。对最先进方法的评估揭示了在接触、遮挡、自运动和长时间跨度下存在的显著差距。

除了基准测试,ACE-Data-0还提供了同步的人类演示,并带有对齐的感知、运动学和接触监督,为模仿学习、世界模型、视觉-语言-行动系统和具身AI提供了可扩展的基础。

项目页面:https://ace-data-engine.github.io/ACE-Data-0/ Hugging Face:https://huggingface.co/datasets/ACERobotics/ACE-Data-0

第 3 页

目录

1 引言 4

2 相关工作 5 2.1 多模态数据集与基准 … 5 2.2 第一人称数据集与基准 … 7 2.3 长周期数据集与基准 … 8

3 环境捕捉引擎(Ambient Capture Engine, ACE) 9 3.1 系统概览 … 9 3.2 捕捉系统 … 10 3.2.1 环境搭建 … 10 3.2.2 硬件配置 … 11

4 ACE-Data-0 12 4.1 数据采集流程 … 12 4.1.1 传感器同步 … 12 4.1.2 标定 … 14 4.1.3 捕捉工作流 … 16 4.1.4 多模态录制 … 16 4.2 数据收集 … 16 4.2.1 任务设计 … 16 4.2.2 捕捉设置 … 17 4.2.3 数据集统计 … 18 4.2.4 模态 … 18 4.3 标注 … 19 4.3.1 标注类型 … 20 4.3.2 标注流程 … 22

5 基准测试 22 5.1 底层信号 … 23 5.1.1 从视觉预测触觉 … 23 5.2 场景组件 … 24 5.2.1 人体运动估计 … 25 5.3 具身交互 … 26 5.3.1 第一人称视角的人-物交互(HOI) … 26 5.3.2 第三人称视角的人-物交互(HOI) … 27 5.3.3 跨视角分析 … 28

6 结论 28

第 4 页

1 引言

人类大部分时间生活在建筑环境中,持续与周围的物体交互,例如打开橱柜、倒水、叠衣服和组装家具。这些日常交互看似轻松,却体现了一种现有模型尚未达到的智能:感知、全身运动、灵巧操作和物理感知的无缝协调[1, 2]。复现这种智能是具身AI的核心追求,但与之前的AI突破不同,这一追求没有现成的数据可供继承。语言和视觉模型[3–6]的崛起依赖于人类几个世纪积累的档案。而身体技能,这些无需思考即可执行的技能,从未被记录下来:手如何握住杯子、用多大的力拿住易碎的玻璃杯、视觉与平衡如何协调以将物体搬过房间。因此,具身智能的数据必须通过构建而非寻找来获得,即通过仪器化日常生活本身,记录自然发生的人-物交互(HOI)。

然而,构建这样一个数据集远不止于用相机对准日常生活。它需要对交互进行整体记录,涵盖人类在做什么、身体和手如何移动、物体状态如何响应、交互产生何种音频和触觉信号,以及场景如何从人类的第一人称视角和第三人称视口呈现。更重要的是,这样一个用于学习具身AI的数据集要求所有这些信号被同步记录并相互配准,这是现有数据集无一满足的要求。

具体而言,现有数据集在三个方面存在不足,如表1所总结:(1)模态碎片化。大规模自我中心数据集(如Ego-Exo4D [7]、EPIC-Kitchens [8]、Xperience-10M [9])提供了大规模的自然行为,但既不提供真实的身体和物体运动,也不提供同步的第三人称观察。相反,运动捕捉的HOI数据集,如BEHAVE [10]、GRAB [11]、ARCTIC [12]、OakInk2 [13]和HOT3D [14],提供了精确的姿态,但忽略了自我中心视角。更重要的是,几乎所有数据集都缺少音频或触觉感知。(2)非自然环境。物理标注数据集[11, 12, 15–17]几乎全部在实验室中采集,其稀疏的布局恰好消除了真实家庭中构成挑战的遮挡、空间约束和物体多样性。(3)短时程。绝大多数HOI片段仅持续数秒,描绘一个简单动作[12, 15, 16, 18]。相比之下,真正的家务活动是目标导向的。它们可能持续数分钟或数小时,串联起子任务和多个物体,并要求人类在场景中移动,而非在单一地点行动。因此,日常交互的完整感知-行动循环一直超出已有基准的覆盖范围。

为弥合这一差距,我们开发了环境捕捉引擎(ACE),这是一个将真实家庭环境转变为录制工作室,同时保留其生活化真实感的采集系统。精细的灵巧操作和房间尺度的活动对传感器放置和覆盖提出了相互冲突的要求,因此我们将ACE构建为两种互补配置。第一种是桌面尺度:密集布置的近距相机和高分辨率触觉感知解析手-物操作的局部细节。第二种是房间尺度:传感器覆盖整个家具齐全的环境,以记录全身运动、移动和分布在场景各处的交互。尽管传感器放置和空间范围不同,两种尺度均记录同步的自我中心视频、多视角外中心视频、光学全身运动以及每个物体的六自由度(位置和朝向)轨迹,所有这些信号都配准到一个共同的时空框架中。

利用ACE,我们采集了ACE-Data-0:150小时的日常生活交互,涵盖200个任务类别(如烹饪、整理和饮水),由50名参与者在2个环境中完成,总计1700万视频帧和75,000个交互片段。参与者并非执行脚本,而是以自己的方式追求目标级指令:像在家中一样规划、犹豫和即兴发挥。至关重要的是,这种自由度并未牺牲测量保真度:每一刻的活动都同时从超过8个视角被观察,并基于度量的身体、手和物体状态。在这些原始信号之上,我们为每个序列提供了丰富的标注,包括相机标定、

第 5 页

振动与同步时间线;全身及手部姿态及其在每台相机每一帧上的投影;每个物体的网格模型、六自由度(位置和朝向)姿态、边界框与运动轨迹;以及对正在发生事件的文本描述。这些标注中很大一部分是从追踪到的物理状态自动推导而来,而非通过现有流程估算得出。

在 ACE-Data-0 的基础上,我们进一步构建了一个感知层次化基准,包含三个赛道,从信号到组件再到交互逐步递进。第一个赛道针对底层信号:从视觉观测中跨模态预测触觉信号。第二个赛道聚焦场景组件:方法重建人体和手部的姿态,并与我们追踪到的真实值进行对比评估。第三个赛道评估交互:模型从第一人称和第三人称视频中估计人-物交互过程中的手部运动。此外,我们收集的成对视角允许对这两种视角进行直接比较。对超过 30 种代表性方法的评估揭示了长时程家居场景数据特有的失效模式,这些模式源于交互与任务的多样性、复杂性与交织性、严重遮挡、极端视角以及在场景中的持续移动。值得注意的是,这三个赛道反映了一个具身智能体必须串联起来的感知能力:感知接触、估计场景状态以及掌握手-物交互。ACE-Data-0 对此类智能体的价值,不仅限于评估,更延伸至训练本身:因为我们的第一人称视角、多视角第三人称视频、运动轨迹和接触级监督是同步采集的,而非来自不同来源的拼凑,每一个训练信号都指向同一个物理时刻,这一特性对于机器人学习——从模仿学习和策略学习到世界建模——至关重要 [19–22]。

总体而言,我们的贡献可概括如下:

• 我们提出了 ACE,一种“以人为中心的环境捕捉作为具身数据引擎范式”,通过两种互补配置实现:用于精细局部操作的工作台规模设置,以及用于更大场景中全身运动的房间规模设置。在这两种配置中,ACE 同时记录时间和空间上对齐的第一人称视频、多视角第三人称视频、人体与手部运动、物体运动、音频和触觉信号。

• 我们贡献了 ACE-Data-0,一个大规模、长时程的家居场景人-物交互数据集,包含 1700 万帧和 75,000 个交互片段,并配有丰富且高质量的标注。

• 我们建立了一个三级基准,从信号到组件并最终到交互逐步递进,并对超过 30 种最先进的方法进行了评估,揭示了具身感知和机器人学习面临的开放性挑战。

2 相关工作 2.1 多模态数据集与基准

日常交互本质上是多模态的。一个单一的物理事件会同时反映在视觉外观、身体与手部运动、物体状态变化、声音线索和物理接触中。这些信号是互补而非可互换的:视觉捕捉外部可观察的内容,运动学描述人体和物体如何演变,音频揭示碰撞和状态转换,而触觉则提供接触和力的直接证据。因此,面向具身感知的数据集已逐渐从孤立的 RGB 观测,转向更丰富的几何、运动、接触和语义标注的组合。

早期的物理基础数据集主要关注抓取和操作的局部几何。ContactPose [15] 将 3D 手部姿态与物体表面接触相关联,数据来自 50 名参与者和 25 个物体,约 290 万张多视角 RGB-D 图像;而 DexYCB [16] 则提供了来自八台同步 RGB-D 相机的 58.2 万帧图像,并带有 MANO 手部 [49] 标注和 YCB 物体姿态。H2O [18] 通过同步的第一人称和第三人称视角,将这一设置扩展到双手交互。

第 6 页

表1 ACE-Data-0与相关数据集按类别比较。✓:提供实测(动捕级)真值;(✓):提供但为估计、伪标签或设备追踪;✓:部分提供(覆盖有限或仅子集);✗:不具备该能力;–:数量不适用或未报告;#Exo列中的✓表示提供无相机数量报告的外中心视频;Sync:跨模态族(自中心视频、外中心视频、运动、音频、触觉)的同步;✓要求至少两个族(主要是自中心-外中心或视频-运动)同时记录并对齐,✓表示仅在同一视角类型内进行同步,‘–’表示仅捕获单一视角。LH:长程(持续数分钟或更长的目标导向活动)。Setup:捕获环境。在#Tasks列中,dom.、cat.、scen.和skills分别表示领域、交互类别、场景和技能,遵循各数据集自身的任务组织方式。

数据集 年份 小时数 #帧数 #被试 #物体 #任务 自中心 #外中心 身体 手部 物体6D 触觉 音频 同步 设置 长程

自中心视频 Ego4D [23] 2022 3670 – 931 – 开放 ✓ ✗ ✗ ✗ ✗ ✗ ✓ – 真实场景 ✓ EPIC-KITCHENS-100 [8] 2021 100 20M 37 – 开放 ✓ ✗ ✗ ✗ ✗ ✗ ✓ – 厨房 ✓ HoloAssist [24] 2023 166 – 222 16 20 ✓ ✗ ✗ (✓) ✗ ✗ ✓ – 桌面 ✓ Ego-Exo4D [7] 2024 1286 – 740 – 8个领域 ✓ 4–5 (✓) ✗ ✗ ✗ ✓ ✓ 真实场景 ✓ EgoLife [25] 2025 266 – 6 – 开放 ✓ ✓ ✗ ✗ ✗ ✗ ✓ ✗ 共享房屋 ✓ HD-EPIC [26] 2025 41 4.46M 9 – 69 ✓ ✗ ✗ ✗ (✓) ✗ ✓ – 家庭厨房 ✓

手-物交互 ContactPose [15] 2020 – 2.9M 50 25 2 ✗ 3 ✗ ✓ ✓ ✓ ✗ ✗ 桌面 ✗ HO-3D [27] 2020 – 78K 10 10 – ✗ 1–5 ✗ ✓ ✓ ✗ ✗ ✗ 桌面 ✗ GRAB [11] 2020 – 1.6M 10 51 4 ✗ ✗ ✓ ✓ ✓ (✓) ✗ – 动捕实验室 ✗ DexYCB [16] 2021 – 582K 10 20 1 ✗ 8 ✗ ✓ ✓ ✗ ✗ ✗ 桌面 ✗ H2O [18] 2021 – 571K 4 8 36 ✓ 4 ✗ ✓ ✓ ✗ ✗ ✓ 桌面 ✗ OakInk [28] 2022 – 230K 12 100 5 ✗ 4 ✗ ✓ ✓ ✗ ✗ ✓ 桌面 ✗ HOI4D [29] 2022 22 2.4M 9 800 54 ✓ ✗ ✗ ✓ ✓ ✗ ✗ – 室内房间 ✗ ARCTIC [12] 2023 – 2.1M 10 11 2 ✓ 8 ✓ ✓ ✓ ✗ ✗ ✓ 动捕实验室 ✗ TACO [30] 2024 – 5.2M 14 196 151 ✓ 12 ✗ ✓ ✓ ✗ ✗ ✓ 桌面 ✗ HOT3D [14] 2024 13.9 3.7M 19 33 开放 ✓ ✗ ✗ ✓ ✓ ✗ ✗ – 实验室房间 ✗ OakInk2 [13] 2024 – 4.0M 9 75 150 ✓ 3 (✓) ✓ ✓ ✗ ✗ ✓ 桌面 (✓) GigaHands [17] 2025 34 183M 56 417 开放 ✗ 51 ✗ (✓) (✓) ✗ ✗ ✗ 桌面 ✗

全身人-物交互、人-场景交互与日常运动 BEHAVE [10] 2022 – 15K 8 20 – ✗ 4 ✓ ✗ ✓ ✗ ✗ ✓ 实验室房间 ✗ InterCap [31] 2022 – 67K 10 10 – ✗ 6 ✓ (✓) ✓ ✗ ✗ ✓ 实验室房间 ✗ CHAIRS [32] 2022 17.3 – 46 81 32 ✗ 4 ✓ ✓ ✓ ✗ ✗ ✓ 实验室房间 – EgoBody [33] 2022 – 220K 36 – 5类 ✓ 3–5 (✓) (✓) ✗ ✗ ✗ ✓ 室内房间 ✗ Aria Digital Twin [34] 2023 6.6 – – 398 开放 ✓ ✗ (✓) ✗ ✓ ✗ ✓ – 公寓、办公室 ✗ OMOMO [35] 2023 10 – 17 15 – ✗ ✗ ✓ ✗ ✓ ✗ ✗ – 实验室房间 ✗ HIMO [36] 2024 – 4.1M 34 53 – ✓ ✗ ✓ ✓ ✓ ✗ ✗ – 动捕实验室 ✗ TRUMANS [37] 2024 15 1.6M 7 20 – ✗ ✗ ✓ ✗ (✓) ✗ ✗ – 场景模型 ✗ ParaHome [38] 2024 8.1 – 38 22 – ✗ 70 ✓ ✓ ✓ ✗ ✗ ✓ 家庭房间 ✓ Nymeria [39] 2024 300 – 264 – 20个场景 ✓ ✓ ✓ ✗ ✗ ✗ ✓ ✓ 真实场景 ✓ HuMoTo [40] 2025 2.2 236K 1 63 – ✗ ✗ ✓ ✓ ✓ ✗ ✗ – 场景 ✗

机器人数据与面向机器人的人类演示 BridgeData V2 [41] 2023 – 60K轨迹 – 100+ 13项技能 ✗ ✓ ✗ ✗ ✗ ✗ ✗ – 桌面 ✗ RH20T [42] 2023 – 110K轨迹 – – 147 ✓ ✓ ✗ ✗ ✗ (✓) ✓ ✓ 桌面 ✗ DexCap [43] 2024 – – – – – ✗ ✓ ✗ ✓ ✗ ✗ ✗ ✓ 桌面 ✗ DROID [44] 2024 350 76K轨迹 – – 86 ✗ 3 ✗ ✗ ✗ ✗ ✗ ✓ 真实场景 ✗ AgiBot World [45] 2025 2976.4 1M轨迹 – 3000+ 217 ✗ ✓ ✗ ✗ ✗ ✓ ✗ ✗ 搭建场景 ✓ EgoDex [46] 2025 829 90M – – 194 ✓ ✗ ✗ (✓) ✗ ✗ ✗ – 桌面 ✗ Galaxea Open-World [47] 2025 500 100K轨迹 – 1600 150 ✗ ✓ ✗ ✗ ✗ ✗ ✗ ✓ 开放世界 (✓) EgoScale [48] 2026 20,854 – – 43,237 6015 ✓ ✗ – – – ✗ ✗ – 桌面 ✗ Xperience-10M [9] 2026 10,000 2.88B – – – ✓ ✗ (✓) (✓) ✗ ✗ ✓ – 真实场景 ✗

我们的数据集 ACE-Data-0 2026 150 17M 50 50 200 ✓ 8 ✓ ✓ ✓ ✓ ✓ ✓ 家庭(房间+桌面) ✓

RGB-D观测、3D手部关键点和物体姿态。H2O-3D [50]进一步贡献了超过76K张标注图像,用于在严重自遮挡下的挑战性双手-物体姿态估计。在更大的语义尺度上,HOI4D [29]包含240万帧自中心RGB-D图像,涉及约800个物体实例,并支持类别级物体姿态跟踪、动作分割和动态4D交互理解。一条互补的研究路线将捕获的状态从手部扩展到完整的人-物系统。GRAB [11]记录了与51个物体交互的详细全身、手部、面部和物体运动。BEHAVE [10]和InterCap [31]从多视角RGB-D观测中联合恢复人体和刚体,使得研究身体尺度的协调、接触和联合重建成为可能。

更近期的数据集越来越强调灵巧性、组合性和任务结构。ARCTIC [12]通过一个自中心视角和八个外中心视角,捕获了约210万张与关节物体的双手交互图像,并以光学运动捕捉为真值。TACO [30]组织了520万张

第 7 页

围绕组合性工具-动作-物体关系构建帧,而OakInk2 [13]则通过可供性、运动基元和任务级结构的层次来表示复杂的双手活动。在更大规模上,GigaHands [17]使用51个摄像头的系统,从56名参与者和417个物体中收集了约1.83亿帧数据,大幅提升了双手活动和语言标注的多样性。HOT3D [14]提供了来自19名参与者和33个扫描物体的约370万张以自我为中心的多视角图像,以及手部、物体、摄像头和注视点的度量轨迹。总体而言,这些数据集极大地推动了手部姿态估计[51–53]、人-物重建[31, 54]、接触推理[12, 15, 55]和交互理解[14, 17, 30]的发展。然而,它们的传感配置通常针对特定的空间尺度或监督来源进行了优化。以手部为中心的数据集能解析精细的局部几何,但通常将活动限制在紧凑的工作空间内;而全身数据集则保留了全局协调性,但可能提供的手部关节细节较少,或缺少执行者的第一人称视角。现有的多模态资源也主要结合了RGB、深度、姿态、几何、注视点和语言[56]。音频很少在交互层面与度量级的人和物体运动对齐,而触觉感知则更为稀缺,尽管它能直接揭示接触的开始、压力和滑动。此外,标注可能结合了直接测量与离线拟合或基于模型的重建,这限制了它们在持续遮挡、快速运动或长时间活动下的统一性。因此,高保真捕捉通常是在简化了杂乱、家具遮挡和家庭交互空间限制的受控空间中实现的。

ACE-Data-0通过将同步的多感官基础作为数据的核心单元,对这些工作进行了补充。桌面尺度配置能解析精细的手-物操作,而房间尺度配置则捕捉分布在带家具的家庭环境中的全身运动和交互。两种配置都通过共享的同步和标定流程,提供以自我为中心的视频、多视角外中心视频、全身及手部关节运动、物体六自由度(位置和朝向)轨迹、音频和触觉信号。因此,这些模态在共同的时间线和空间坐标系中描述相同的物理事件,而不是作为独立生成的标注。这种统一的基础支持一个连贯的基准测试进程,从低级信号推断,到场景组件恢复,再到交互理解。

2.2 以自我为中心的数据集与基准

以自我为中心的视频从执行主体的视角而非外部摄像头的视角观察活动。这种视角自然地强调与动作相关的物体、手部接近度、注视分配以及自我运动的即时视觉后果,使其与具身智能体特别相关。同时,它也带来了独特的挑战:摄像头持续移动,运动模糊频繁发生,手部常常遮挡被操作的物体,并且执行者身体的大部分仍处于视野之外。

大规模数据集首先确立了以自我为中心感知的广度和自然性。Ego4D [23]收集了来自74个地点、931名摄像头佩戴者的3,670小时无脚本第一人称视频,其基准测试涵盖情景记忆、预测、社交互动、操作和视听理解。HoloAssist [24]专注于交互式任务辅助,记录了166小时的指导者-执行者活动,包含同步的RGB-D、注视点、头部和手部姿态、IMU、音频和对话;这些信号支持错误检测、干预预测和手部运动预测。Ego-Exo4D [7]进一步通过来自740名参与者、跨越123个场景的1,286小时同步技能活动,以及音频、注视点、语言、摄像头姿态和3D场景信息,连接了第一人称和第三人称视角。其配对视角设计支持对相同底层事件进行跨视角活动理解、熟练度评估和姿态恢复。

以操作为导向的数据集则用部分行为广度换取了更强的物理监督。H2O [18]和HOI4D [29]将第一人称RGB-D观测与手部和物体状态关联起来,而HOT3D [14]则提供标定的以自我为中心的多视角记录,包含手部、物体、摄像头和注视点的度量轨迹。EgoDex [46]将人类灵巧操作演示的规模扩展到194个场景中的829小时。

7

第 8 页

任务类型,通过可穿戴手部追踪创建了大规模的动作相关人类操作数据。PH2D [57] 进一步通过机器人兼容的动作表示,将人类第一人称演示与人形机器人策略学习连接起来。第一人称经验的另一个补充来源是机器人演示数据。Fourier ActionNet [58] 记录了超过3万条遥操作轨迹,总计约140小时的灵巧双手操作,跨越多种人形机器人平台;它将机器人第一人称摄像头的观测与语言标注和可执行的机器人动作配对。因此,人类自我中心数据集和机器人演示提供了互补的监督形式:前者保留了自然的人类策略和与具体形态无关的行为,而后者则提供了目标机器人形态下的直接动作标签。

近期的人到机器人学习方法越来越多地结合这些互补的数据源。DexMV [59]、EgoMimic [60] 和 EgoBridge [61] 明确地将人类演示对齐或适配到机器人形态。EgoVLA [20]、UniVLA [62] 和 In-N-On [63] 则从人类视频和机器人演示的混合数据中学习可迁移的动作表示。EgoScale [48] 和 Emergence of Human to Robot Transfer [64] 进一步表明,扩大人类经验、机器人任务和具体形态的规模和多样性有助于迁移。这些进展强化了第一人称数据的价值,但也暴露了行为多样性与物理完整性之间反复出现的权衡。大规模自然采集数据集捕捉了广泛的活动分布和扩展的时间上下文,但并未持续测量每个序列中的全身状态、物体轨迹和物理接触。更多仪器化的数据集提供了更强的手部或物体监督,但通常在空间范围上较为局部,并且会遗漏同步的房间尺度外部视角、音频或触觉感知中的某些组合。

ACE-Data-0 通过将自我中心观测嵌入到对周围事件的共享物理表示中,弥补了这一差距。可穿戴摄像头保留了具身智能体可获得的近距离视角,而同步的外部视角则恢复了从第一人称视角经常不可见的身体和场景上下文。两种视角都与测量的头显、人体和物体运动进行配准,从而能够在相同的物理真值下进行直接比较和融合。音频和触觉流进一步将视觉观测与同一交互的声学和接触后果联系起来。

2.3 长程数据集与基准

长程交互 [13, 38, 65, 66] 的定义不仅在于记录时长,更在于动作、物体和场景状态之间持续的依赖关系。在家庭任务中,早期的决策会改变后期的可能性,物体在相关性中进进出出,子任务可能被中断、重新排序或在别处恢复。移动和操作同样是相互依赖的:行动者必须在环境中移动,同时记住物体的位置、中间状态和剩余目标。这些特性要求模型维护任务和场景记忆,而不是将活动视为一系列独立的原子动作。

一些以人为中心的数据集已开始保留这种更丰富的时间结构。OakInk2 [13] 将双手操作组织成分层的任务组件,而非孤立的抓取,支持对可供性、运动基元和复杂任务完成的研究。OMOMO [35] 对扩展交互中物体运动与全身人体运动之间的时间耦合进行建模,展示了物体轨迹如何在单次接触事件之外约束人类行为。ParaHome [38] 记录了来自38位参与者的207个家庭活动序列,总计约486分钟,使用70个同步RGB摄像头和可穿戴运动捕捉设备;它强调家庭环境中的连续、并发和多物体交互。HuMoTo [40] 包含735个运动捕捉序列,涉及63个物体和72个关节部件,其任务设计强调有目的的进展和连贯的多物体活动。另一条并行的研究路线在语义、运动学、群体或音乐条件下合成扩展的人类运动 [67–69],这同样依赖于长时间内保持连贯的运动数据。这些数据集共同标志着一个重要的转变

第 9 页

从原子级HOI片段向场景演化和任务级时序结构延伸。

机器人学习数据集从控制侧应对同样的挑战。Mobile ALOHA [70] 在七项任务中结合了导航与双臂操作,提供了290个全身遥操作演示。AgiBot World [45] 提供了超过一百万条轨迹,覆盖217项任务;Galaxea Open-World [47] 包含约10万条轨迹,横跨150项任务。RoboCOIN [71] 包含约18万个演示,覆盖421项任务和15种机器人形态。RoboMIND 2.0 [72] 进一步扩展到约31万条轨迹和739项任务,涉及六种形态,并包含RGB-D观测、移动操作、数字孪生资产以及一部分触觉片段。从真实到仿真的重建为扩展此类数据提供了一条补充路径:HSImul3R [73] 在物理闭环中重建物理场景,生成可供低成本生成机器人轨迹的仿真就绪环境。近期方法明确揭示了长程行为的计算需求。SayCan [65] 将高层任务推理与可执行技能相连接,MEM [66] 引入了多尺度具身记忆,WholeBodyVLA [74] 则将视觉-语言-动作学习与全身移动操作相结合。DynamicVLA [75] 则针对移动物体的操作,其中时序预测和闭环适应变得必要。EMMA [76] 和HoMMI [77] 进一步利用以自我为中心的人类演示,以降低收集移动机器人轨迹的成本。

然而,以人为中心和以机器人为中心的数据集提供了不同形式的监督。人类记录保留了自然的任务分解、灵活的子任务顺序、犹豫和恢复,同时在很大程度上独立于任何特定的机器人形态。机器人数据集提供了可执行的控制和精确对齐的观测,但其轨迹与特定的运动学、传感器和遥操作接口紧密绑定。现有资源很少将人类演示的自然行为结构与相应的身体、物体、场景和接触状态的连续测量相结合。这种分离也限制了诊断能力:长程机器人基准通常强调最终任务成功,而人类活动数据集通常侧重于识别、分割或运动重建。仅凭最终成功无法揭示失败是源于遗漏接触、物体状态估计不准确、任务上下文丢失、子任务顺序错误还是运动执行不佳。

ACE-Data-0 旨在揭示目标导向家务活动中的这些中间结构。参与者接收目标级指令,而非固定的原子脚本,允许物体选择、任务顺序、移动路径、犹豫和恢复自然涌现。由于视觉观测、人体和物体运动、音频及触觉信号在每个任务中始终保持同步,该数据集在几何HOI基准、长时自我中心视频和机器人轨迹语料库之间架起了桥梁,不仅支持分析发生了什么,还支持分析执行长程任务所依赖的信号、状态和交互动态。

3 环境捕捉引擎

在本节中,我们介绍为收集同步多模态数据而设计的环境捕捉引擎(Ambient Capture Engine,ACE)。具体而言,我们首先概述该系统及其两种规模(第3.1节),然后详细描述捕捉系统,涵盖其部署的家庭环境及其中放置的传感器(第3.2节)。

3.1 系统概述

在图2中,我们展示了ACE的整体架构。整体记录日常交互对捕捉系统提出了三项要求:它必须捕捉交互可能产生的每一个重要信号,保持这些信号同步并在一个共同坐标系中配准,并在保持可信家庭感的环境中完成所有这些工作。然而,没有单一装置能在所有空间尺度上满足第一项要求:解析手指与物体的接触需要近距离、密集布置的传感器,而

第 10 页

(a) 场地I的家庭平面图与相机布置。 (b) 场地II的家庭平面图与相机布置。

图2 环境捕捉引擎(Ambient Capture Engine,ACE)概览。我们设计了两个互补的家庭场景,并在两个空间尺度上进行捕捉,相应安装了设备。

在场景中进行移动跟随需要宽基线并覆盖整个房间。我们没有在两者之间妥协,而是在两个空间尺度上构建ACE:桌面尺度和房间尺度,目前部署在两个场地。桌面尺度配置专注于近距离相机、光学运动捕捉和触觉手套,目标是精细的灵巧手-物操作。房间尺度配置则将相同的传感套件分布在一个家具齐全的公寓中,宽基线相机和光学运动捕捉覆盖整个活动区域,目标是全局运动和分布在场景中的交互。两个系统共享相同的采集和标注流程:所有传感器流在时间上同步(硬件允许时通过硬件同步,否则通过软件同步,见第4.1.1节),配准到共享的世界坐标系(第4.1.2节),并丰富以标注信息(第4.3节)。最终形成一个统一的语料库,其中每一帧的每个相机画面都能关联到人体、每个被追踪物体的真实状态,以及伴随的音频和触觉信号;这一特性为第5节的基准测试奠定了基础。

3.2 捕捉系统

在概述了架构之后,我们现在聚焦于其物理形态:首先是承载交互的环境,然后是观察这些交互的传感器。

3.2.1 环境设置

ACE的一个核心设计原则是,在允许密集传感器覆盖的同时,保留真实居住环境的视觉和物理真实感。实验室捕捉所消除的杂乱、家具和空间限制,恰恰是使家庭场景交互变得困难的因素,因此我们的环境刻意保留了这些元素。桌面尺度配置围绕一张工作桌构建。它覆盖30平方米,摆放了超过25个可交互物体实例,来自8个以上类别,如刀具、碗和食品容器。该工作区配备了8台外心RGB相机,刚性安装在支架上,距离很近(0.3–0.5米),提供对操作区域的全面覆盖,并以亚毫米级有效分辨率生成多个同步视图。一套包含16台OptiTrack相机的光学运动捕捉系统,安装在共享桁架上,其追踪体积覆盖整个工作区。桌面尺度配置的概览见图2b。另一方面,房间尺度配置包含一个约200平方米、家具齐全的公寓,包括带岛台的厨房、用餐区、客厅和卧室,摆放了超过25个物体实例。一个悬挂在天花板上并横跨公寓的桁架,同时承载了RGB相机和光学运动捕捉系统:8台外心RGB相机悬挂在桁架上,

第 11 页

表2 ACE用于同步多模态录制的采集硬件。数量为两种配置的总和;短横线表示该条目不适用于对应设备。

| 设备 | 角色 | 数量 | 分辨率/速率 | 备注 | |——|——|——|————-|——| | OptiTrack PrimeX 22 | 光学运动捕捉 | 28 | 2048 × 1088, 60 Hz | 红外追踪:41个身体标记点、物体、自用支架 | | ZED One | 外中心RGB采集 | 8 | 1920 × 1080, 30 FPS | 通过GMSL2连接至单个Jetson Orin主机;共享帧触发 | | GoPro | 外中心RGB采集 | 8 | 1920 × 1080, 30 FPS | 刚性安装在支架上;音频触发录制 | | ACE-Ego-Head-V02 Lite | 以自我为中心采集 | 4个摄像头 | 4 × 1088 × 1280, 20 FPS | 一个头戴设备:前/后鱼眼对、IMU、5个标记点 | | Manus | 手部姿态 | 2只手套 | 60 Hz | 每根手指关节,双手 | | ACE-Sense-Glove Lite | 接触压力 | 2只手套 | – | 全掌压力图,双手 | | Jetson Orin | 录制主机 | 1 | – | 接收所有ZED One流;通过NatNet协调 | | Motive主机(PC) | 动捕主机,同步参考 | 2 | – | 生成用于跨系统同步的光学时钟 |

每个摄像头安装在一个可调节的延长杆上,可微调其高度和视角,使得活动区域内的任何点即使在有家具遮挡的情况下也至少能被4个视角看到;12个OptiTrack摄像头安装在同一桁架上,其位置和朝向经过调整,使整个公寓处于单一追踪空间内。房间规模配置的概览见图2a。

3.2.2 硬件设置

在这些环境中,传感器套件经过组装,使得交互的每一个方面——从人所看到的,到身体和物体如何移动,再到交互的声音和触感——都有专门的传感器。我们的两个系统共享此套件,仅在传感器的选择和布局上有所不同,如表2所总结。

以自我为中心的摄像头。两个系统中的参与者都佩戴由ACE Robotics提供的ACE-Ego-Head-V02 Lite,这是一个头戴式以自我为中心的采集设备,配备四个鱼眼摄像头,分别朝向前左、前右、后左和后右,以20 FPS录制1088 × 1280分辨率的视频,并带有板载IMU。设备上附有五个OptiTrack标记点,用于提供其初始位置以及在整个采集过程中的实时六自由度(位置和朝向)姿态。这有助于将以自我为中心的视频流配准到与其他所有传感器相同的世界坐标系中。 外中心摄像头。桌面规模配置在每个工作空间周围布置了8个近距离GoPro RGB摄像头(1920 × 1080 @ 30 FPS),刚性安装在支架上;而房间规模配置则用8个宽基线ZED One RGB摄像头(1920 × 1080 @ 30 FPS)覆盖整个公寓。 人体运动。每位参与者穿着一套带有41个标记点的动作捕捉服,标记点附着在全身关节处(包括头部周围的3个标记点),由OptiTrack系统(PrimeX 22;房间规模配置中12个摄像头,桌面规模配置中16个摄像头)以60 Hz的频率追踪,生成41个关节的骨架。此外,还辅以手部关节姿态数据:在房间规模配置中,通过Manus动作捕捉手套以60 Hz的频率获取;在桌面规模配置中,则通过对外中心摄像头的2D手部关键点进行RANSAC三角测量,再进行手动优化获得。

物体运动。每个可交互物体首先通过3D扫描或2D高斯泼溅重建[78]数字化为网格,并安装OptiTrack标记点,这些标记点在

第 12 页

1. 数据采集 2. 导出与同步 3. 标注

一名参与者穿着动作捕捉服在捕捉空间中执行家务活动。 同步前 人体动作 第一视角 标注 我们从多种设备采集多模态数据 第三视角 12台 8台 OptiTrack相机 Zed One相机 动作 手部动作 2副 1台 标注 Manus手套 音频 ACE头戴 自视角相机 触觉

异步导致的问题 物体空间位置 • 事件错位 • 难以关联动作 ··· 标注

同步后 物体姿态 第一视角与运动轨迹

第三视角 动作 挤压 清洗并在 语言标注 采集的模态 流水下冲洗抹布 音频

触觉

触觉标注 人体 同步 物体 第一视角 第三视角 音频 触觉 优势 动作 动作 • 可靠的跨模态关联与对齐事件 ··· ···

图3 ACE整体工作流程。每位参与者在多模态录制前穿上动作捕捉服。数据导出后进行同步,以对齐各模态的时间线。最后,我们利用捕捉到的真实值为采集的数据标注丰富且高质量的标签。

追踪系统,使得生成的60 Hz六自由度(位置和朝向)轨迹能将精确的物体几何模型放置在世界坐标系中。

音频。我们通过GoPro第三视角相机和ACE-Ego-Head-V02 Lite采集音频,以记录接触事件、电器操作及环境场景声音。

触觉。参与者佩戴全掌触觉手套,记录手掌和手指区域的压力接触图。

4 ACE-Data-0

在搭建好捕捉系统后,本节介绍ACE-Data-0。具体而言,第4.1节介绍数据采集流程,涵盖捕捉工作流、多模态录制、传感器同步与标定。第4.2节阐述数据收集过程,包括任务设计、捕捉设置、数据集统计及模态。最后,第4.3节介绍数据集提供的标注及其生成流程。

4.1 数据采集流程

上述传感器产生十几种异构数据流,而这些数据流只有在时间和空间上能精确关联时才具有价值。本小节首先描述如何对这些数据流进行时间对齐(第4.1.1节)和空间对齐(第4.1.2节),然后说明实际操作中捕捉会话的执行方式(第4.1.3节和第4.1.4节)。ACE的工作流程概览如图3所示。

4.1.1 传感器同步

时间对齐是多模态捕捉的基础:相机、动作捕捉、物体追踪器和触觉传感器以不同频率运行在独立时钟上,即使几毫秒的漂移也足以破坏接触级别的标注,使手部在杯子实际被抓住前几帧就显示为合拢。

第 13 页

图4 ACE捕捉的同步模态。 ACE能够捕捉同步的多模态数据,包括第一人称和第三人称视频、音频,以及人体和物体的运动等。

触觉流记录触摸。我们以OptiTrack时钟作为参考,因为该跟踪系统内部同步其自身的相机,并以严格的60 Hz同步帧提供标记点位置,然后依次将每个剩余设备与之对齐。

第三人称相机。 (1) 对于房间级配置,ZED One相机通过GMSL2由单个NVIDIA Jetson Orin主机采集,其采集卡通过共同的帧触发器驱动所有相机,因此它们的采集在构建上已对齐。随后,与OptiTrack时钟的对齐分两步进行。首先,录制通过本地网络协调:相机主机通过NatNet订阅OptiTrack数据流,并与动作捕捉录制同步开始和停止。这限定了拍摄片段,但缺乏共享时钟的网络协议无法对齐单个帧。不幸的是,记录的时间戳无法弥补这一差距:它们比真实曝光时刻滞后约0.29秒,并且这种滞后还会随时间缓慢漂移。为解决此问题,我们改为让第三人称相机拍摄一个时钟,其形式为二维码。具体来说,动作捕捉主机电脑在其显示器上以纳秒级分辨率显示自己的时间。从录制的帧中读取这个时钟,即可得到该帧在动作捕捉时间中的精确捕捉时间。我们在整个拍摄片段中采样此类读数,并通过它们拟合一条直线(一个恒定偏移加上一个缓慢漂移)。结果,对齐后的最终残差在毫秒级别,处于单个动作捕捉帧之内。(2) 对于桌面级配置,GoPro相机通过对其音频流进行对齐来实现彼此同步。

第一人称相机。 ACE-Ego-Head的四个鱼眼视图由设备的板载控制器驱动,测量到的相互间未对齐程度低于2毫秒。(1) 对于房间级配置,与OptiTrack时钟的对齐复用了上述光学时钟,但有一个复杂之处:第一人称相机面向手部和佩戴者的背部,在拍摄过程中从未看到显示器。因此,我们在每次拍摄开始时进行一个刻意的扫视,佩戴者将ACE-Ego-Head的一个相机指向显示器约10秒钟。从这些帧中读取时钟,即可得到第一人称相机时钟与OptiTrack时钟之间的偏移。然后,设备的共享时钟将此偏移传递给其他三个视图,以实现整体同步。(2) 对于桌面级配置,GoPro相机和第一人称头戴设备读取显示在

13

第 14 页

图5 房间级配置中的已标定相机。 蓝色相机代表用于运动捕捉的OptiTrack PrimeX 22;绿色相机代表用于捕捉外部中心RGB视频的ZED One;橙色相机是ACE-Ego-Head中的一个自中心相机。

动捕主机,与房间级设置相同;这将已通过音频相互同步的GoPro视频流对齐到头显时钟。然后,通过将自中心头显内部估计的位姿(基于AprilTag的追踪)与通过光学标记点追踪到的相应位姿进行配准,将自中心头显对齐到OptiTrack系统,从而完成从GoPro相机到头显再到OptiTrack时间轴的完整链路。这些步骤共同将两种配置中的所有设备注册到OptiTrack时间轴上。

其他传感器。 触觉手套利用其板载IMU信号与ACE-Ego-Head进行同步。在每个镜头开始时,操作员执行一个短暂的运动模式,同时保持手和头部大致刚性,从而在手套和自中心头显之间产生相关的IMU信号。我们通过匹配此运动模板来对齐这两个数据流,建立时间同步。

验证与输出。 作为独立检查,我们发现在标定过程中重新估计的每个相机的时间偏移(第4.1.2节)均在4毫秒以内,证实了对齐的准确性。所有拟合的偏移量都被整合到一个按镜头划分的表格中,该表格将每个相机帧(无论是外部中心还是自中心)映射到其60 Hz的运动捕捉帧。下游处理仅使用此表格。同步采集的示例见图4。

4.1.2 标定

同步在时间上对齐数据流,而标定则在空间上对其进行配准,并且这两个相机系统提出了相反的挑战:外部中心相机从不移动,但几乎不共享视野;而自中心相机每帧都在移动。这两种标定流程如图5和图6所示。

外部中心相机。 标准的多相机标定假设共视性:两台相机必须同时观察到同一目标。我们对外部中心相机的稀疏布置打破了这一

第 15 页

图6 桌面级配置中的已标定相机。蓝色相机代表用于运动捕捉的OptiTrack PrimeX 22。

假设,因为大多数相机对之间没有共同的视野区域。因此,我们转而通过运动捕捉系统来桥接这些相机。具体来说,我们使用一个每个角都带有反光标记点的ArUco板[79]作为标定目标。这一物理对象可同时被每个传感系统观测到:RGB相机看到ArUco板的印刷图案,而OptiTrack红外相机则同时看到该图案和角部的反光标记点。因此,该标定板将RGB相机和运动捕捉空间关联到同一个参考系中,无需任何两个相机共享视野。随后,标定分三步进行:(1) 首先,红外相机估计角部标记点在标定板上的实际位置。需要注意的是,这些标记点是手工粘贴的,因此其精确位置事先未知。通过聚合数千个标定板姿态下的估计值,此步骤的误差可降至毫米级。(2) 其次,在已知标记点位置后,仅凭这些标记点就能以亚毫米级的一致性给出每一帧中标定板的姿态。(3) 第三,每个RGB相机都根据这个以标记点为锚点的标定板轨迹进行拟合。并非所有观测值都参与此步骤:(i) 标定板运动中的帧被丢弃,因为残余时序误差会随运动而增大;(ii) 图像边缘附近的检测结果被丢弃,因为此处的畸变模型最不可靠。最后,进行一次联合优化,根据所有相机共同重新估计标定板姿态,并依次重新拟合每个相机。在整个过程中,被跟踪的标记点始终是主要的参考,确保解算结果锚定在运动捕捉的世界坐标系中。在保留的测试帧上,每个相机都达到了低于3像素的中位重投影误差,在典型距离下约合1厘米的三维误差。

头戴相机。 一个移动的采集设备并非由单一姿态描述,而是每一帧都有一个姿态。考虑到我们的情况——头戴视角主要由佩戴者自身的手臂和躯干主导,且前后相机对之间没有共享视野——仅依靠视觉(如SLAM方法)来恢复此轨迹是不可靠的。因此,我们不估计相机的位置,而是直接测量它们。ACE-Ego-Head底盘上的五个标记点构成一个刚体,OptiTrack以60 Hz的频率对其进行跟踪。唯一剩下的未知量是每个鱼眼相机到此刚体的固定变换,这是一个经典的手眼标定问题[80]。我们首先为每个相机独立求解。然后,通过联合光束法平差[81]对这四个变换一起进行优化,将标定板姿态(所有相机共享)和每个相机的时间偏移作为额外的自由变量。此外,我们仅使用低角速度的

第 16 页

速度帧进行拟合,因为计时误差会随着运动而累积。最终的中位重投影误差约为2像素。标定完成后,生成一次拍摄的相机位姿完全不需要图像。OptiTrack以60 Hz的频率追踪自视角相机刚体的位姿,而相机以20 FPS录制;对于每一帧自视角画面,我们将刚体的追踪位姿插值到该帧的时间戳,并应用该相机的手眼变换。因此,每个位姿都是测量得到的,而非估计的,且不会产生漂移。

其他标定。 上述两个流程解决了相机位置的问题。剩余的标定则描述每个传感器本身。对于相机,这意味着内参:外视角相机使用出厂参数,自视角鱼眼相机使用Kalibr [82]进行标定。对于物体,这意味着几何形状:每个标记点组只需向扫描或2DGS重建的网格注册一次,这样追踪标记点就能将完整物体放置在世界坐标系中。所有这些标定每天都会重新验证两次。结合上述同步流程,我们完成了统一的时空坐标系,所有后续的标注和基准测试都建立在此之上。

4.1.3 采集工作流程

在完成对齐后,每个采集会话在两个场地都遵循相同的五步流程。(1) 场景准备:物体被放置在随机但合理初始位置。(2) 参与者准备:参与者穿上动作捕捉服、ACE-Ego-Head头戴设备和手套,然后执行一个简短的T-pose动作,将其骨骼与追踪系统注册。(3) 任务说明:参与者口头接收目标级别的指令;如何实现目标完全由他们自己决定。(4) 录制:拍摄以第4.1.1节描述的时钟扫视开始,之后所有传感器连续录制,同时操作员在实时仪表盘上监控数据流健康状况。(5) 后期检查:每次拍摄后验证同步和追踪质量,失败的拍摄会被标记以便重新采集。

4.1.4 多模态录制

在采集工作流程的第(4)步中,每个系统同时获取:(i) 外视角RGB视频流;(ii) 4路自视角鱼眼视频流及IMU数据;(iii) 60 Hz的全身运动和手部姿态;(iv) 所有被追踪物体的60 Hz六自由度(位置和朝向)位姿;以及(v) 触觉信号。所有数据流都根据第4.1.1节建立的统一时钟打上时间戳。一小时的采集会话大约产生1 TB的原始数据。

4.2 数据采集

前面的小节建立了录制机制;剩下的问题是录制什么内容。我们描述了任务设计(第4.2.1节)、采集设置(第4.2.2节)、由此产生的数据集统计信息(第4.2.3节),以及每个发布序列中包含的模态(第4.2.4节)。

4.2.1 任务设计

ACE-Data-0的长序列特性源于其任务设计。所谓长序列任务,是指一项活动在数分钟内展开,而非数秒,并且可以分解为一系列子动作,这些子动作的顺序受目标约束,而非预先固定。例如,考虑“准备一杯茶并端到桌上”的任务。它涉及一系列人-物交互:参与者走到橱柜前,打开它,取出杯子,给水壶加水,等待水烧开,取出茶包,倒水,搅拌,端着杯子穿过房间,并在放下前清理出空间。因此,这一次拍摄可能包含规划、移动和精细操作。

然而,大多数人-物交互数据集规定的是原子动作[12, 15, 16, 18],孤立地捕捉单次抓取或交接。为了弥补这一差距,我们规定家务目标,让动作自然产生:如何实现目标完全由参与者决定。不同的参与者会以不同的顺序安排子任务,

第 17 页

原子化人-物交互任务案例 1:将杯子装满水 案例 2:给植物浇水 案例 3:把水倒掉 案例 4:烧水 HOI 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2 24 个摄像头

30000+ 个片段 2 3 4 2 3 4 2 3 4 2 3 4 54 小时

6.2M+ 帧

人-场景交互案例 1:做深蹲 案例 2:做风车转体 案例 3:做躯干扭转 案例 4:在房间里漫步 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2

24 个摄像头 30 小时 2 3 4 2 3 4 2 3 4 2 3 4 3.5M+ 帧

HOI 任务链 时间点 1 (00:00:30) 时间点 2 (00:07:29) 时间点 3 (00:17:36) 时间点 4 (00:24:27) 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2 1 Ego 1 Exo2 24 个摄像头

40000+ 个片段 2 3 4 2 3 4 2 3 4 2 3 4 64 小时

7.3M+ 帧

总计 统计数据 烹饪 × 200 饮用 × 240 用餐 × 100

清洁 × 450 园艺 × 450 家务 × 300 200+ 50+ 50+ 75000+ 17M+ 锻炼 × 180 放松 × 300 ··· 任务 物体 参与者 片段 帧

图 7 ACE-Data-0 中采集的不同任务类别示例。

抓取方式不同,伸手去拿的物体也不同,因此真实行为的变异性自然而然地进入了数据之中。

具体来说,我们录制三种类型的镜头:

原子化 HOI 任务 每次包含一到三项家务任务,这些任务来自超过 15 种家庭活动类型,例如倒水、喝水、泡茶、浇花、切菜、烹饪和整理;每个镜头大约持续三分钟。每个镜头都提供了干净、自成一体的日常操作实例,这是最容易从中学习技能的基本单元。

HOI 任务链 将全范围的短任务组合成一个持续约二十到三十分钟的连续活动。子任务自由交错进行,但每个镜头结束时场景都会被整理恢复原状,完整地描绘了一个家务活动的周期。与原子化 HOI 任务相比,它们在更复杂的层面上锻炼了长程规划、状态跟踪和记忆能力。

HSI 任务 几乎不涉及物体,而是专注于与桌子、椅子和沙发等场景组件的交互。这类镜头记录全身运动,例如行走和锻炼,以及人-场景接触,例如坐、躺和倚靠,每个镜头大约五分钟。这些运动完善了人形机器人必须掌握的行为范围。

为了确定这些录制内容应包含什么,我们调研了日常家庭生活中出现的任务,并据此设计了原子化 HOI、HOI 任务链和 HSI 任务。我们在图 7 中展示了不同任务类别的示例。

4.2.2 采集设置

为了执行这些任务,我们招募了 50 名参与者。每位参与者在为期 2 天的会话中完成所有设计的任务。多样性从两个方向进入数据。在人的方面,目标级别的指令使行为保持开放:参与者的起始和结束位置、中间采取的路线、选择的交互方式以及每一步花费的时间都各不相同。在物体方面,镜头在出现的物体类别和数量、物体的放置位置、它们的起始和结束位置,以及它们被移动的轨迹和方式上都有所变化。

17

第 18 页

饮用 任务概要

原子HOI任务 单任务、长程交互。 清洁 用餐 原子HOI任务 6.2M+ 帧 (36.5%)

HOI任务链 7.3M+ 帧 (42.9%)

HSI任务 3.5M+ 帧 (20.6%) HOI任务链 多任务、长程组合交互。 ··· 总计 17M+ 帧

烹饪 操作

HSI任务 原子 人与场景交互, HOI任务 变化丰富。

姿势 过渡

取出 冲洗 切菜 烹饪 导航 ···

ACE-Data-0 搅拌 调味 上菜 清理 环境捕捉交互数据集 锻炼 75000+ 片段 HOI任务链 HSI任务 ··· 150+ 小时 15M+ 帧 开关任务 组合 场景 布置

原子HOI任务 HOI任务链 HSI任务 任务分布 6.2M+ 帧 7.3M+ 帧 3.5M+ 帧 (高层级) 36.5% 42.9% 20.6%

图8 ACE-Data-0概览统计。ACE-Data-0涵盖三种交互任务:原子HOI任务、HOI任务链和HSI任务。

4.2.3 数据集统计

此次采集工作产生了超过150小时的同步多模态捕捉数据,包含超过75,000个片段中的1700多万帧。我们将一个片段定义为一段连续的交互,它实现一个有意义的子目标,是作为训练示例使用时在语义上保持自包含的最小单元。片段是在镜头内计数的,而非孤立录制,因此每个片段前后的上下文,即前后动作,都保留在同一数据流中。在ACE-Data-0中,即使是最短的镜头也持续数分钟而非数秒,大约比典型的HOI片段长一个数量级[12, 15, 16, 18]。图8报告了任务类别、镜头长度、物体类别等的分布。

4.2.4 模态

一个发布的镜头包含的不仅仅是第4.1.4节中的原始数据流:它还承载了第4.1节流程从中推导出的所有内容,这些内容位于一个共同的帧和共同的时间线上。具体来说,每个镜头包含:

第一人称视频:四个鱼眼视图、它们的IMU读数,以及来自跟踪装置的逐帧六自由度头显位姿; • 第三人称视频:所有视图,每个视图都带有内参及其在世界坐标系中的位姿; • 人体运动:41个关节的身体骨架,包含手部关节姿态和转换后的SMPL-X运动参数[83]; • 物体运动:逐物体的六自由度轨迹,包含超过50个实例的扫描或2DGS重建网格;

第 19 页

图9 被捕捉物体的数据标注示例。ACE-Data-0 为被捕捉物体提供了丰富的标注,包括名称标签、六自由度(位置和朝向)位姿、边界框和运动轨迹。

图10 被捕捉人体和手部的数据标注示例。ACE-Data-0 提供了人体和手部的真值位姿。我们还将这些位姿投影到第一人称和第三人称视频中,以便通过视觉输入进行更好的具身人工智能学习。

音频:从 GoPro 第三人称相机和第一人称头戴设备录制的同步多源音频; • 触觉:从原始手套传感器重新映射的手形压力网格,并经过校准归一化和基线校正。

4.3 标注

上述原始信号在添加标注后会变得更为有用。我们将介绍 ACE-Data-0 提供了哪些标注(第 4.3.1 节)以及它们是如何大规模生成的(第 4.3.2 节)。

19

第 20 页

图 11 采集手部数据标注示例。ACE-Data-0 提供人手真实姿态,并将姿态投影至第一人称和第三人称视频,以便结合视觉输入进行更好的具身人工智能学习。

图 12 触觉信号数据标注示例。ACE-Data-0 提供全手抓握压力真实值,解析在视觉遮挡下仍模糊的交互事件。

4.3.1 标注类型

ACE-Data-0 提供五类标注,共同描述每个镜头:交互中涉及的物体、演员的身体配置、操作过程中手部的关节运动、手与物体之间建立的物理接触,以及活动本身的声学和语义描述。具体而言,物体标注(图 9)包含每个被追踪物体的类别标签、边界框和逐帧六自由度(位置和朝向)姿态,以及物体在镜头过程中划过的运动轨迹。人体标注(图 10)提供每个镜头中的全身姿态,而手部标注(图 11)则将其细化为灵巧操作期间的手指关节配置。触觉标注(图 12)记录接触的时间和空间分布,解析在视觉遮挡下仍模糊的交互事件。音频与语言标注(图 13)将录制的音频流与自然语言描述配对,识别交互产生的声音事件(例如物体放置在表面上或容器被打开),并陈述每个镜头的目标及其实现过程中的子目标序列。

第 21 页

图13 音频与语言描述的数据标注示例。ACE-Data-0 提供了与测量活动时间线对齐的自然语言描述。

标定与同步。 每个镜头都附带每台相机的内参、共享世界坐标系中的相机位姿,以及对齐所有传感器流的时间线。这些是第4.1节的输出,作为数据发布:有了它们,任何被跟踪的3D点都可以投影到任何视角的任何像素上,并且任何两个流都可以在任何时刻配对。因此,用户可以自由组合模态进行训练,将它们的任意子集配对作为输入和监督,而无需重新运行我们流程的任何部分。

人体姿态。 捕获的身体和手部姿态被重投影到每台相机的每一帧上,生成与3D捕获一致的逐视角2D网格叠加。因为这些投影来自测量的3D状态,而非基于图像的检测器,所以它们在检测器通常失效的情况下依然保持正确:例如在家具遮挡、极端视角和运动模糊下。因此,每一帧都在每个视角中携带像素对齐的2D姿态,并在世界坐标系中携带度量级的3D姿态。

触觉标签。 每一帧都携带来自触觉手套的触觉读数,该读数在时间上与视觉流和当前使用的物体标签对齐。因此,接触可以被检测到,而非推断出来:信号直接来自传感器表面,而不是来自外观或重建几何体之间的接近度。这些读数标记了交互发生的时间和对象,这是大多数人-物交互(HOI)任务的起点。

物体标注。 每个物体实例都带有其扫描或2DGS重建的网格、逐帧的六自由度(6-DoF)位姿、所有视角中的2D/3D边界框,以及其在镜头中的运动轨迹。网格和位姿共同将精确的物体几何体放置在每一时刻的场景中;边界框和轨迹是它们在每台相机中的投影。因此,可以在镜头的任何时刻查询一个物体的完整历史:它曾在哪里、何时移动以及最终到了何处。

音频描述。 每个镜头都携带由头戴式自我中心捕捉设备和GoPro相机录制的多通道音频,它们共享视觉流的同步时钟,因此与姿态、物体和触觉标注对齐到同一时间线。存在两类声音:由交互本身产生的声音,例如物体放在表面上或液体倒入杯中;以及家庭环境的环境声学,包括电器噪音、脚步声和房间混响。由于音频是从演员自身的视角捕捉的,声学视角随参与者移动,因此声音事件的响度和空间特性会随距离远近而变化。

21

第 22 页

图14 三个层级式基准测试。我们设定的基准测试层级,即低级信号推断、场景组件恢复和交互估计,精确模拟了人类和具身人工智能感知真实世界环境的方式。

文本描述。Gemini-3.1-pro-preview [84] 观看第一人称视角视频,并用自然语言描述每个时间段:人物在做什么,以及场景中发生了什么。这些描述为每个镜头提供了可搜索的故事情节,并将物理记录与语言连接起来,其形式可供视觉-语言和视觉-语言-动作模型直接使用。

4.3.2 标注流程

生成如此广度的标注通常需要投入高昂的人工成本。ACE 避免了其中大部分工作,因为在我们五种标注类型中,除文本描述外,其余均为测量所得而非估计所得。人体和物体状态通过度量方式进行跟踪,每台相机都经过标定,接触则通过直接传感获取。因此,姿态重投影、边界框、运动轨迹和接触事件,均通过投影和触觉传感从记录的状态中得出,流程中不涉及任何估计模型。文本描述是唯一生成的类型:Gemini 根据第一人称视角视频逐段生成。最后,人工标注员检查自动生成的标签,并手动修正描述。

5 基准测试

在描述了 ACE-Data-0 的采集和标注方式后,我们现在用它来评估现有方法,其诊断目标是:揭示当前方法在长时程家庭场景数据上的失效之处,并指明可能的解决方向。该基准测试包含三个层级,从信号到组件再到交互逐步递进,每一层都建立在其下一层之上:低级信号推断直接作用于原始感知流,即从视频预测触觉信号(第5.1节);场景组件恢复将这些信号组合成三维人体组件(第5.2节);交互估计则从第一人称和第三人称视角恢复人手与物体交互的运动过程(第5.3节)。这一递进过程反映了一个具身智能体在家庭环境中行动时必须串联起来的感知能力:感知接触、估计场景状态以及掌握手-物协调(见图14)。我们预留了10小时的采集数据作为测试集。

22

第 23 页

表3 ACE-Data-0上基于自视角的触觉估计。

方法 时序准确率 ↑ C-IoU ↑ V-IoU ↑ CoP ↓

PressureVision [85] 0.0093 0.0007 0.0000 10.9807 EgoPressureDiff [86] 0.2912 0.0197 0.0025 8.5152 TouchAnything [87] 0.7095 0.1646 0.1357 6.5846

本报告中的所有基准评估均采用此设置。除非另有说明,基线方法均使用其官方发布的预训练检查点进行评估,以确保公平比较。

5.1 低级信号

我们首先关注交互产生的原始传感信号,其中触觉占据特殊地位。视觉告诉观察者物体在哪里;触觉则告诉执行者抓取是否成功、需要多大的握力,以及物体何时开始滑动。机器人同人类一样需要这种信号,然而在实际应用中,接触感知仍然稀缺:触觉硬件昂贵且脆弱,且大多数部署平台并未配备,而摄像头却无处不在。因此,学会从视频中解读触觉,将把最丰富的传感器转变为最稀缺传感器的替代品。ACE-Data-0使这种映射变得可学习:通过第4.1.1节的同步,每一视频帧都与同一时刻记录的触觉读数配对。

5.1.1 从视觉到触觉

视觉观察仅提供物理接触的间接证据。这种模糊性在自视角中尤为严重,因为操作手在施加压力时,常常会遮挡指尖和接触的物体区域。

任务。给定一段人-物交互的自视角视频,目标是预测每一时刻的全手抓取压力。我们将预测的压力分布与触觉手套捕获的同步测量值进行评估对比。

指标。我们报告四个互补的指标。时序准确率衡量交互序列上逐帧的接触状态预测。接触IoU(C-IoU)评估阈值化后的预测接触区域与真实接触区域之间的空间重叠,而体积IoU(V-IoU)则通过最小-最大聚合进一步考虑压力大小。压力中心(CoP)误差测量预测压力质心与真实压力质心在指尖和手掌上的空间距离,数值越低表示接触定位越准确。

基线方法。我们使用其发布的预训练权重评估了三种基线方法。PressureVision [85] 使用卷积编码器-解码器,直接从RGB观测中回归像素对齐的压力图。EgoPressureDiff [86] 将压力估计形式化为条件扩散,并适配了一个预训练的视频扩散骨干网络。TouchAnything [87] 利用跨视图融合和视图丢弃训练,学习了一种通用的视觉到触觉表示。

结果。表3报告了在近距离桌面尺度记录上的结果。PressureVision几乎没有提供有意义的接触预测,在C-IoU和V-IoU下产生的重叠几乎为零,且CoP误差最大。EgoPressureDiff显著改善了时序接触识别和压力定位,但其空间重叠仍然有限,这表明检测何时发生接触比恢复压力在手上的分布要容易得多。相比之下,TouchAnything在所有四个指标上均持续取得最强性能。其优势在时序准确率和空间重叠上尤为明显,这表明更广泛的视觉-触觉训练和跨视图建模改善了对ACE-Data-0中多样化交互的迁移能力。尽管如此,其绝对的C-IoU和V-IoU仍然不高,且剩余的CoP误差表明,精确的压力定位仍然具有挑战性。特别是,模型可能正确识别出接触的存在,却无法在手-物遮挡下恢复其精确的位置和强度。

23

第 24 页

表4 ACE-Data-0上的人体运动估计。所有指标单位为mm。

方法 PA-MPJPE ↓ PA-PVE ↓ MPJPE ↓ PVE ↓ WA-MPJPE ↓

— 单视图外中心,逐帧 —

Multi-HMR [89] 110.5 – 115.3 – – Multi-HMR2 [90] 85.5 – 92.8 – – SAM-3D-Body [91] 71.0 – 76.4 – – PyMAF-X [92] 94.7 177.5 99.9 177.0 – PARE [93] 98.7 132.3 102.0 134.8 – CameraHMR [94] 78.7 98.7 85.7 105.2 – OSX [95] 59.2 73.7 62.5 76.6 –

— 单视图外中心,时序 —

SMPLer-X [96] 57.0 70.2 59.8 71.7 – SMPLest-X [97] 55.7 65.8 58.8 67.6 – Humans-in-4D [98] 77.1 94.4 79.6 96.4 – GVHMR [99] 88.0 104.1 96.3 112.0 217.1 WHAM [100] 131.1 160.2 144.0 166.4 243.1 EasyMoCap [101, 102] 103.4 155.8 106.0 156.1 256.2

— 单视图外中心,场景感知 —

Phy-SIC [55] 64.3 78.9 71.3 84.6 – UniSH [103] 80.0 111.2 82.8 114.0 196.3 JOSH [104] 64.0 89.2 69.9 95.0 245.1 Human3R [105] 60.1 75.4 63.5 80.6 180.2

— 多视图外中心 —

MAMMA [106] 70.1 86.8 74.8 89.6 230.8 U-HMR [107] 134.4 176.0 150.2 179.2 – HSfM [108] 92.8 133.8 93.8 134.8 –

— 以自我为中心 —

EgoEgo [109] 159.6 245.3 163.4 263.9 306.2 EgoAllo [110] 131.7 196.8 147.9 220.3 252.2

总体而言,结果揭示了现有触觉估计模型存在显著的泛化差距,并确立了自我视角压力重建作为一个具有挑战性的基准。鲁棒的性能不仅需要识别接触事件,还需要从视觉上模糊且频繁被遮挡的交互中解析出细粒度的压力分布。

5.2 场景组件

如果说上一个赛道询问的是交互的触感,那么这个赛道询问的则是场景组件的位置及其随时间如何运动。在原始传感器信号与对交互的任何理解之间,存在着场景的三维状态:身体的姿态、手部的关节运动,以及每个物体的六自由度(位置和朝向)姿态。这些状态是大多数视觉流程首先估计的内容,也是每个下游模块所消费的信息。

然而,在家庭场景中,它们的可靠性在很大程度上仍未得到量化。野外拍摄的素材没有可供衡量的真实值,带有度量级真实值的数据集局限于实验室环境,而在真实环境中记录的数据集则由正在被评估的方法本身进行伪标注。ACE-Data-0通过在家居场景中提供度量级真实值,消除了这一障碍,使得现有估计器可以在其实际部署的条件下接受评估。因此,我们在此赛道中对人体运动估计进行基准测试。手部关节运动将在下一个赛道中单独处理,因为灵巧操作提供了其最为重要的应用场景。物体姿态估计则留待未来工作:目前适用的方法[88]太少,无法支持有意义的比较,尽管已发布的真实值直接支持此项评估。

24

第 25 页

5.2.1 人体运动估计

家庭环境中的人体运动估计仍面临多重挑战。家具经常在序列的长时间内遮挡下半身。常见的家务动作,如在橱柜前蹲下、伸手够高处或躺在沙发上,也与许多训练数据集中以直立姿态为主的情况不同。此外,每个镜头可能持续数分钟,使得微小的帧级误差逐渐累积,导致估计的全局轨迹出现大幅漂移 [33, 55, 99, 100]。我们的数据集同时捕捉了这些挑战,并为完整序列提供了度量级真值运动。 任务。给定一个镜头的视觉观测,目标是估计随时间变化的关节体姿态。逐帧方法处理单张图像,而时序方法使用完整的视频序列。输出世界坐标系结果的方法还需恢复人物在场景中的全局轨迹。

我们将所有预测结果与动作捕捉真值进行对比评估。评估涵盖三种输入设置:多视角外中心视频、单视角外中心视频和以自我为中心的视频。同时包括三类方法:逐帧方法、时序方法和场景感知方法。由于所有设置使用相同的真值,结果使我们能够直接比较视角、时序信息和场景上下文的影响。 指标。我们报告五项指标,按从局部到全局的顺序排列。PA-MPJPE 和 PA-PVE [111] 评估经过 Procrustes 对齐后的关节体姿态和恢复的体表,与全局位置和朝向无关。MPJPE 和 PVE [83, 112] 评估保留全局朝向的相同量。WA-MPJPE [99, 100] 评估在世界坐标系下的全局轨迹,在对整个路径进行一次对齐后计算。 基线方法。我们评估了22种方法,覆盖了人体运动估计的每个主要类别。对于单视角外中心输入,包括逐帧方法(Multi-HMR [89]、Multi-HMR2 [90]、SAM-3D-Body [91]、PyMAF-X [92]、PARE [93]、CameraHMR [94] 和 OSX [95])、基于视频的方法(SMPLer-X [96]、SMPLest-X [97]、Humans-in-4D [98]、GVHMR [99]、WHAM [100] 和 EasyMoCap [102]),以及它们对应的场景感知版本,前者为 Phy-SIC [55],后者为 UniSH [103]、JOSH [104] 和 Human3R [105]。对于多视角外中心输入,我们评估了 MAMMA [106]、U-HMR [107] 和 HSfM [108]。对于以自我为中心的输入,我们评估了 EgoEgo [109] 和 EgoAllo [110]。所有方法均使用其发布的预训练权重运行。据我们所知,这是在真实家庭场景中进行的迄今为止最广泛的人体运动估计评估。 结果。我们主要在房间级录制上进行评估,这些录制结合了移动、家具遮挡和数分钟的连续运动。定量结果报告在表4中,其中有三点发现尤为突出。

首先,结果显示局部姿态估计与全局轨迹恢复之间存在明显差距。几种方法在 Procrustes 对齐指标上取得了优异结果,其精度接近在标准基准上报告的水平。这表明它们在家居遮挡和非常规姿态下仍能恢复关节体姿态。然而,它们在世界坐标系下的轨迹误差仍然高得多。局部姿态指标的排名也与全局轨迹指标的排名不同。换言之,正确估计每一帧的身体姿态并不能保证整个序列上的运动路径准确。

其次,场景感知方法与时序方法之间的比较进一步揭示了场景信息在何处最为有用。场景感知方法实现了更低的轨迹误差,而其 Procrustes 对齐结果与时序方法保持相似。这表明场景上下文主要有助于确定身体在房间中的位置,而非改善相对的关节配置。场景几何提供了关于人物可以站立或移动位置的约束,但提供的关于确切身体姿态的直接信息较少。

第三,结果还显示出强烈的视角效应。以自我为中心的方法在大多数指标上表现较差,因为身体的大部分位于相机视野之外,必须从头部的运动中推断。然而,多视角方法并未在

第 26 页

表5 自我视角下手部运动估计(基于ACE-Data-0数据集)

| 方法 | PA-MPJPE ↓ | MPJPE ↓ | F@5 ↑ | F@15 ↑ | AUCJ ↑ | 轨迹误差 ↓ | |——|————-|———-|——-|———|———|————| | WildHands [113] | 11.2 | 12.6 | 0.175 | 0.774 | 0.776 | – | | Dyn-HaMR [114] | 18.9 | 21.1 | 0.042 | 0.413 | 0.624 | 98.2 | | HaWoR [52] | 13.8 | 17.4 | 0.130 | 0.666 | 0.729 | 102.1 |

此项评估。我们不认为这表明多视角用处较小。相反,这可能反映了近期单视角全身及场景感知方法的强大性能,以及可用多视角基线方法的范围有限。

5.3 具身交互

仅知道人的位置不足以描述交互是如何进行的。这些信息大部分包含在手部运动中,包括手如何接近物体、形成抓取、调整位置以及释放物体。手部运动对机器人学习也特别相关,因为手部轨迹可以比原始视觉观察更直接地重定向到机器人夹爪。

因此,我们评估当前方法[59–61]从视频中恢复手部运动的准确程度。在ACE-Data-0数据集中,每次交互都同时从自我中心和外部中心视角记录。这使我们能够在相同条件下比较两种设置,使用相同的拍摄片段和相同的真实值,仅改变视角。

5.3.1 自我视角下的人-物交互(HOI)

自我中心视频提供了与未来机器人可能观察到的视角最相似的视角。摄像头靠近手部,通常能捕捉到交互的精细细节。然而,这种视角也带来了一些实际挑战。摄像头随头部移动,广角镜头使图像边缘附近产生畸变,而手部经常出现在这些畸变区域。大幅度的头部或身体运动也可能使一只手或双手移出视野。 任务。给定一个拍摄片段的自我中心视频,方法需估计双手的3D运动,表示为MANO [49]序列。这包括每帧中的手指关节姿态,以及(若方法支持)世界坐标系中的手部轨迹。我们通过Manus动作捕捉手套获取房间规模录制数据的真实值;对于桌面规模录制数据,我们使用RANSAC三角测量法处理来自八个同步外部中心摄像头的2D手部关键点,然后进行人工优化。在评估期间,对在过少视角中可见的关节进行掩码处理。因此,方法不会因无法获得可靠真实值的帧而受到惩罚。 评估指标。我们报告五项手部姿态指标和一项全局轨迹指标。自我中心和外部中心评估使用相同的定义和单位。PA-MPJPE对每个预测手部应用单独的Procrustes对齐(使用旋转、平移和缩放),因此主要衡量手指关节运动的误差。MPJPE仅使用旋转和平移,保持缩放不变,因此也反映了手部尺寸度量上的误差。F@5和F@15分别报告误差低于5毫米和15毫米的关节比例。AUCJ是PCK曲线在0到50毫米阈值范围内的归一化曲线下面积。对于预测持久世界坐标系的方法,我们还报告世界坐标系下的轨迹误差。我们使用一个对整个片段应用的相似变换来对齐预测和真实的腕部轨迹,并计算平均残差误差。与逐帧对齐不同,此指标捕捉序列中的漂移和不一致的尺度。 基线方法。我们使用其发布的预训练权重评估了三种方法。WildHands [113]是一种逐帧回归器,独立应用于每个自我中心帧。Dyn-HaMR [114]和HaWoR [52]处理视频,并通过结合手部估计与相机运动估计,在世界坐标系中恢复手部。

第 27 页

表 6 基于外部视角的手部运动估计(ACE-Data-0)

方法 PA-MPJPE ↓ MPJPE ↓ F@5 ↑ F@15 ↑ AUCJ ↑ 轨迹误差 ↓

HORT [54] 10.8 12.3 0.276 0.776 0.784 – HaMeR [51] 9.6 10.4 0.281 0.848 0.812 – HaPTIC [53] 10.0 10.7 0.247 0.838 0.804 63.0 WiLoR [115] 9.1 9.9 0.313 0.854 0.819 – OmniHands [116] 10.7 11.5 0.211 0.814 0.791 –

结果。表5显示了逐帧手部姿态估计与世界空间手部运动恢复之间的明显差异。逐帧方法实现了最强的关节精度,而两种基于视频的方法在局部姿态指标上表现稍逊。一个可能的原因是,基于视频的方法同时估计相机运动和手部姿态。因此,相机运动的误差会影响恢复的手部姿态,尤其是在我们的记录中头部运动通常较大的情况下。这种差异在全局轨迹估计中变得更加明显。两种世界空间方法产生的轨迹误差远大于其局部关节误差。这表明,以自我为中心的手部重建的主要挑战并非估计单帧中的手指关节,而是在世界坐标系中保持稳定的手部轨迹。结合下方的外部视角结果,这指向了自运动估计是误差的主要来源。

5.3.2 基于外部视角的人-物交互

外部视角视频呈现了一系列不同的优势和挑战。相机保持固定,人物和周围场景通常保持在画面内。这为随时间跟踪运动提供了一个稳定的参考系。然而,手部仅占图像的一小部分,并且经常被操作物体或人体遮挡 [12, 17]。由于以自我为中心和外部视角的相机记录了相同的交互,我们可以使用相同的镜头和真实标注来比较这两个视角。

任务。给定一个外部视角视频流或所有同步的外部视角视频流,方法需估计每一帧中双手的关节姿态。输出世界坐标系结果的方法还需恢复整个序列中的手部轨迹。真实标注和评估流程与第5.3.1节中使用的相同,允许直接比较两个视角。

指标。我们使用第5.3.1节中定义的相同的五个手部姿态指标。对于视频方法,我们还报告世界坐标系下的轨迹误差。尽管外部相机是静态的,方法仍必须在整个片段中一致地并以正确的公制尺度恢复手部位置。

基线。我们使用其发布的预训练权重评估了五种单视角方法。HaMeR [51]、WiLoR [115] 和 OmniHands [116] 在每一帧中独立估计手部。HaPTIC [53] 处理视频并在世界坐标系中生成手部运动。HORT [54] 联合重建右手和被操作物体,因此仅为包含物体操作的帧生成预测。

结果。表6总结了结果。五种方法实现了相似的关节精度,PA-MPJPE 值范围从9.1到10.8毫米。WiLoR 表现最佳,达到9.1毫米的 PA-MPJPE,F@5 分数为0.313,AUCJ 为0.819。HaMeR 紧随其后,PA-MPJPE 为9.6毫米。这些结果表明,即使手部在1080p图像中占据的区域很小,当前基于裁剪的手部回归器也能恢复详细的手部姿态。

固定相机也使得全局轨迹估计更加可靠。HaPTIC 获得了63毫米的轨迹误差,同时保持了10.0毫米的 PA-MPJPE,这与逐帧方法相当。其轨迹误差显著低于以自我为中心的世界空间方法获得的98–102毫米。这一差异表明,稳定的相机坐标系消除了由自运动引起的大部分不确定性。

27

第 28 页

HORT 在其产生预测的操作帧上取得了 10.8 mm 的 PA-MPJPE。这一结果与其他方法相近。在此评估下,对被持物体进行联合建模并未显著提升手部关节姿态精度,但也未明显降低精度。

5.3.3 跨视角分析

由于两个视角观察的是同一交互过程,其结果可以直接比较。尽管第一人称相机提供了更近的手部视图,但第三人称方法在关节姿态和全局轨迹估计方面均取得了更好的结果。在这些结果中,轨迹分析显示出最大的差异。第三人称视频方法的误差为 63 mm,而第一人称方法仍接近 100 mm。使用固定的第三人称相机时,相机坐标系本身已提供了一个稳定的参考系。第一人称方法必须从头部位移中估计此参考系,而此步骤的误差成为最终轨迹误差的主要部分。

总体而言,两个视角仍提供了互补的观察。第一人称视频更易受截断、畸变和运动模糊的影响,而第三人称视频更易受身体和被操作物体遮挡的影响。因此,结合两种视频流可以减少它们各自的失败情况。向第一人称方法提供测量到的头显运动,也将有助于分离由手部重建引起的误差和由自运动估计引起的误差。此外,提供物体姿态作为辅助输入,可以测试场景和物体信息是否能改善对抓取和手部运动的恢复。我们相信,ACE-Data-0 将支持结合第一人称和第三人称视角以实现更精确姿态估计的进一步研究。

6 结论

我们提出了 ACE,一种用于在真实家庭中记录日常家居行为的环境捕捉方法。ACE 使用两种不同空间尺度的互补配置:桌面级设置用于细粒度的手-物操作,房间级设置用于在设施齐全的公寓中进行全身活动。两者均捕捉同步的第一人称和第三人称视频、身体、手部和物体运动、音频及触觉信号。光学时钟程序以毫秒级精度将所有数据流对齐到动捕时钟,而基于标记桥接的标定则将静态和可穿戴相机注册到一个共同的世界坐标系中。

利用 ACE,我们收集了 ACE-Data-0,包含超过 150 小时的录制、75,000 个交互片段、1700 万帧图像以及逐帧标注。我们在基于视频的触摸预测、全身运动恢复以及来自第一人称和第三人称视角的手部运动估计等任务上对现有方法进行了基准测试。在这些任务中,现有方法在接触、遮挡和长时间活动等条件下性能下降——这些条件正是真实家庭区别于受控实验室的特征。这些结果推动了融合多视角和多模态、施加物理约束,并从测量的接触和运动监督中学习的模型的发展。

通过将第一人称观察、演示轨迹和接触级监督结合在单一的时间对齐数据流中,ACE-Data-0 旨在支持对操作策略、世界模型以及连接真实家庭中感知、动作和物理状态的视觉-语言-动作系统的研究。 局限性。ACE 存在若干局限性。首先,它仅覆盖两个地点,因此捕捉到的布局、家具和光照变化有限。其次,真值仅限于被仪器化的实体:被追踪的物体必须预先扫描并配备标记,且数据集未标注关节机构、流体或可变形材料的状态变化。第三,动捕服、手套、头显和标记在录制中仍然可见,可能引入数据集特有的视觉线索。 伦理声明。所有参与者均为自愿,并就录制和公开数据发布提供了知情同意书。

28

第 29 页

参考文献

[1] James J Gibson. 视觉感知的生态学方法:经典版. Psychology press, 2014.

[2] Rolf Pfeifer 和 Josh Bongard. 身体如何塑造思维:智能的新视角. MIT press, 2006.

[3] Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li, 和 Li Fei-Fei. ImageNet: 一个大规模层次化图像数据库. 见 CVPR, 2009.

[4] Christoph Schuhmann, Romain Beaumont, Richard Vencu, Cade Gordon, Ross Wightman, Mehdi Cherti, Theo Coombes, Aarush Katta, Clayton Mullis, Mitchell Wortsman, 等. LAION-5B: 一个用于训练下一代图文模型的开放大规模数据集. 见 NeurIPS, 2022.

[5] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等. 从自然语言监督中学习可迁移的视觉模型. 见 ICML, 2021.

[6] Tom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel M. Ziegler, Jeffrey Wu, Clemens Winter, Christopher Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, 和 Dario Amodei. 语言模型是少样本学习者. 见 NeurIPS, 2020.

[7] Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, 等. Ego-Exo4D: 从第一人称和第三人称视角理解熟练的人类活动. 见 CVPR, 2024.

[8] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Antonino Furnari, Evangelos Kazakos, Jian Ma, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, 和 Michael Wray. 重新缩放以自我为中心的视觉:EPIC-KITCHENS-100 的收集、流程与挑战. IJCV, 130(1):33–55, 2022.

[9] Ropedia. Xperience-10M: 一个具有结构化3D/4D标注的大规模以自我为中心的多模态数据集. Hugging Face dataset, 2026. URL https://huggingface.co/datasets/ropedia-ai/xperience-10m.

[10] Bharat Lal Bhatnagar, Xianghui Xie, Ilya A. Petrov, Cristian Sminchisescu, Christian Theobalt, 和 Gerard Pons-Moll. BEHAVE: 用于追踪人-物交互的数据集与方法. 见 CVPR, 2022.

[11] Omid Taheri, Nima Ghorbani, Michael J. Black, 和 Dimitrios Tzionas. GRAB: 一个全身人体抓取物体的数据集. 见 ECCV, 2020.

[12] Zicong Fan, Omid Taheri, Dimitrios Tzionas, Muhammed Kocabas, Manuel Kaufmann, Michael J. Black, 和 Otmar Hilliges. ARCTIC: 一个用于灵巧双手手-物操作的数据集. 见 CVPR, 2023.

[13] Xinyu Zhan, Lixin Yang, Yifei Zhao, Kangrui Mao, Hanlin Xu, Zenan Lin, Kailin Li, 和 Cewu Lu. OAKINK2: 一个复杂任务完成中的双手手-物操作数据集. 见 CVPR, 2024.

29

第 30 页

[14] Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon, Shreyas Hampali, Shangchen Han, Fan Zhang, Linguang Zhang, Jade Fountain, Edward Miller, Selen Basol, Richard Newcombe, Robert Wang, Jakob Julian Engel, and Tomas Hodan. HOT3D: 基于多视角第一人称视频的3D手部与物体跟踪. 发表于CVPR, 2025.

[15] Samarth Brahmbhatt, Chengcheng Tang, Christopher D. Twigg, Charles C. Kemp, and James Hays. ContactPose: 一个包含物体接触与手部姿态的抓取数据集. 发表于ECCV, 2020.

[16] Yu-Wei Chao, Wei Yang, Yu Xiang, Pavlo Molchanov, Ankur Handa, Jonathan Tremblay, Yashraj S. Narang, Karl Van Wyk, Umar Iqbal, Stan Birchfield, Jan Kautz, and Dieter Fox. DexYCB: 一个用于捕捉手部抓取物体的基准数据集. 发表于CVPR, 2021.

[17] Rao Fu, Dingxi Zhang, Alex Jiang, Wanjia Fu, Austin Funk, Daniel Ritchie, and Srinath Sridhar. GigaHands: 一个大规模标注的双手活动数据集. 发表于CVPR, 2025.

[18] Taein Kwon, Bugra Tekin, Jan Stuhmer, Federica Bogo, and Marc Pollefeys. H2O: 面向第一人称交互识别的双手操控物体. 发表于ICCV, 2021.

[19] Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, and Joel Jang. 世界动作模型是零样本策略. arXiv 2602.15922, 2026.

[20] Ruihan Yang, Qinxi Yu, Yecheng Wu, Rui Yan, Borui Li, An-Chieh Cheng, Xueyan Zou, Yunhao Fang, Xuxin Cheng, Ri-Zhao Qiu, Hongxu Yin, Sifei Liu, Song Han, Yao Lu, and Xiaolong Wang. EgoVLA: 从第一人称人类视频中学习视觉-语言-动作模型. 发表于CoRL, 2025.

[21] Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Robert Equi, Chelsea Finn, Niccolo Fusai, Manuel Y. Galliker, Dibya Ghosh, Lachy Groom, Karol Hausman, brian ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Devin LeBlanc, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Allen Z. Ren, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, James Tanner, Quan Vuong, Homer Walke, Anna Walling, Haohuan Wang, Lili Yu, and Ury Zhilinsky. π0.5: 一个具备开放世界泛化能力的视觉-语言-动作模型. 发表于CoRL, 2025.

[22] Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang, Weiheng Zhong, Zhengbang Zhu, Yuxiao Liu, and Xihui Liu. World Guidance: 在条件空间中进行世界建模以生成动作. arXiv 2602.22010, 2026.

[23] Kristen Grauman, Andrew Westbury, Eugene Byrne, et al. Ego4D: 3000小时第一人称视频环游世界. 发表于CVPR, 2022.

[24] Xin Wang, Taein Kwon, Mahdi Rad, Bowen Pan, Ishani Chakraborty, Sean Andrist, Dan Bohus, Ashley Feniello, Bugra Tekin, Felipe Vieira Frujeri, Neel Joshi, and Marc Pollefeys. HoloAssist: 一个面向现实世界交互式AI助手的第一人称人机交互数据集. 发表于ICCV, 2023.

[25] Jingkang Yang, Shuai Liu, Hongming Guo, Yuhao Dong, Xiamengwei Zhang, Sicheng Zhang, Pengyun Wang, Zitang Zhou, Binzhu Xie, Ziyue Wang, Bei Ouyang, Zhengyu Lin, Marco Cominelli, Zhongang Cai, Bo Li, Yuanhan Zhang, Peiyuan Zhang, Fangzhou Hong, Joerg Widmer, Francesco Gringoli, Lei Yang, and Ziwei Liu. EgoLife: 迈向第一人称生活助手. 发表于CVPR, 2025.

30

第 31 页

[26] Toby Perrett, Ahmad Darkhalil, Saptarshi Sinha, Omar Emara, Sam Pollard, Kranti Parida, Kaiting Liu, Prajwal Gatti, Siddhant Bansal, Kevin Flanagan, Jacob Chalk, Zhifan Zhu, Rhodri Guerrier, Fahd Abdelazim, Bin Zhu, Davide Moltisanti, Michael Wray, Hazel Doughty, and Dima Damen. HD-EPIC: 一个高度细粒度的第一人称视频数据集. 见 CVPR, 2025.

[27] Shreyas Hampali, Mahdi Rad, Markus Oberweger, and Vincent Lepetit. HOnnotate: 一种手部和物体姿态的3D标注方法. 见 CVPR, 2020.

[28] Lixin Yang, Kailin Li, Xinyu Zhan, Fei Wu, Anran Xu, Liu Liu, and Cewu Lu. OakInk: 一个用于理解手-物交互的大规模知识库. 见 CVPR, 2022.

[29] Yunze Liu, Yun Liu, Che Jiang, Kangbo Lyu, Weikang Wan, Hao Shen, Boqiang Liang, Zhoujie Fu, He Wang, and Li Yi. HOI4D: 一个用于类别级人-物交互的4D第一人称数据集. 见 CVPR, 2022.

[30] Yun Liu, Haolin Yang, Xu Si, Ling Liu, Zipeng Li, Yuxiang Zhang, Yebin Liu, and Li Yi. TACO: 面向可泛化双手工具-动作-物体理解的基准测试. 见 CVPR, 2024.

[31] Yinghao Huang, Omid Taheri, Michael J. Black, and Dimitrios Tzionas. InterCap: 交互中人与物体的联合无标记3D跟踪. IJCV, 132(7):2551–2566, 2024.

[32] Nan Jiang, Tengyu Liu, Zhexuan Cao, Jieming Cui, Zhiyuan Zhang, Yixin Chen, He Wang, Yixin Zhu, and Siyuan Huang. 全身关节式人-物交互. 见 ICCV, 2023.

[33] Siwei Zhang, Qianli Ma, Yan Zhang, Zhiyin Qian, Taein Kwon, Marc Pollefeys, Federica Bogo, and Siyu Tang. EgoBody: 从头戴设备中捕获交互人体的体型与运动. 见 ECCV, 2022.

[34] Xiaqing Pan, Nicholas Charron, Yongqian Yang, Scott Peters, Thomas Whelan, Chen Kong, Omkar M. Parkhi, Richard A. Newcombe, and Carl Yuheng Ren. Aria Digital Twin: 一个面向第一人称3D机器感知的新基准数据集. 见 ICCV, 2023.

[35] Jiaman Li, Jiajun Wu, and C. Karen Liu. 物体运动引导的人体运动合成. ACM TOG, 42(6):197:1–197:11, 2023.

[36] Xintao Lv, Liang Xu, Yichao Yan, Xin Jin, Congsheng Xu, Shuwen Wu, Yifan Liu, Lincheng Li, Mengxiao Bi, Wenjun Zeng, and Xiaokang Yang. HIMO: 一个面向全身人体与多物体交互的新基准. 见 ECCV, 2024.

[37] Nan Jiang, Zhiyuan Zhang, Hongjie Li, Xiaoxuan Ma, Zan Wang, Yixin Chen, Tengyu Liu, Yixin Zhu, and Siyuan Huang. 大规模动态人-场景交互建模. 见 CVPR, 2024.

[38] Jeonghwan Kim, Jisoo Kim, Jeonghyeon Na, and Hanbyul Joo. ParaHome: 面向人-物交互3D生成式建模的日常家庭活动参数化. 见 CVPR, 2024.

[39] Lingni Ma, Yuting Ye, Fangzhou Hong, Vladimir Guzov, Yifeng Jiang, Rowan Postyeni, Luis Pesqueira, Alexander Gamino, Vijay Baiyya, Hyo Jin Kim, Kevin Bailey, David Soriano Fosas, C. Karen Liu, Ziwei Liu, Jakob J. Engel, Renzo De Nardi, and Richard A. Newcombe. Nymeria: 一个大规模多模态第一人称日常野外运动数据集. 见 ECCV, 2024.

[40] Jiaxin Lu, Chun-Hao Paul Huang, Uttaran Bhattacharya, Qixing Huang, and Yi Zhou. HUMOTO: 一个动作捕捉人-物交互的4D数据集. 见 ICCV, 2025.

[41] Homer Rich Walke, Kevin Black, Tony Z. Zhao, Quan Vuong, Chongyi Zheng, Philippe Hansen-Estruch, Andre Wang He, Vivek Myers, Moo Jin Kim, Max Du, Abraham Lee, Kuan Fang, Chelsea Finn, and Sergey Levine. BridgeData V2: 一个面向大规模机器人学习的数据集. 见 CoRL, 2023.

31

第 32 页

[42] Haoshu Fang, Hongjie Fang, Zhenyu Tang, Jirong Liu, Chenxi Wang, Junbo Wang, Haoyi Zhu, and Cewu Lu. RH20T: A comprehensive robotic dataset for learning diverse skills in one-shot. In ICRA, 2024.

[43] Chen Wang, Haochen Shi, Weizhuo Wang, Ruohan Zhang, Li Fei-Fei, and C. Karen Liu. DexCap: scalable and portable mocap data collection system for dexterous manipulation. In RSS, 2024.

[44] Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, et al. DROID: A large-scale in-the-wild robot manipulation dataset. In RSS, 2024.

[45] AgiBot-World-Contributors, Qingwen Bu, Jisong Cai, Li Chen, Xiuqi Cui, Yan Ding, et al. AgiBot World Colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems. In RSS, 2025.

[46] Ryan Hoque, Peide Huang, David J. Yoon, Mouli Sivapurapu, and Jian Zhang. EgoDex: learning dexterous manipulation from large-scale egocentric video. In ICLR, 2026.

[47] Tao Jiang, Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Jianning Cui, Xiao Liu, Shuiqi Cheng, Jiyang Gao, Huazhe Xu, and Hang Zhao. Galaxea open-world dataset and G0 dual-system VLA model. arXiv 2509.00576, 2025.

[48] Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, Trevor Darrell, Furong Huang, Yuke Zhu, Danfei Xu, and Linxi Fan. EgoScale: scaling dexterous manipulation with diverse egocentric human data. arXiv 2602.16710, 2026.

[49] Javier Romero, Dimitrios Tzionas, and Michael J. Black. Embodied hands: Modeling and capturing hands and bodies together. ACM TOG, 36(6):245:1–245:17, 2017.

[50] Shreyas Hampali, Sayan Deb Sarkar, Mahdi Rad, and Vincent Lepetit. Keypoint Transformer: solving joint identification in challenging hands and object interactions for accurate 3D pose estimation. In CVPR, 2022.

[51] Georgios Pavlakos, Dandan Shan, Ilija Radosavovic, Angjoo Kanazawa, David Fouhey, and Jitendra Malik. Reconstructing hands in 3D with transformers. In CVPR, 2024.

[52] Jinglei Zhang, Jiankang Deng, Chao Ma, and Rolandos Alexandros Potamias. HaWoR: world-space hand motion reconstruction from egocentric videos. In CVPR, 2025.

[53] Yufei Ye, Yao Feng, Omid Taheri, Haiwen Feng, Shubham Tulsiani, and Michael J. Black. Predicting 4D hand trajectory from monocular videos. In 3DV, 2026.

[54] Zerui Chen, Rolandos Alexandros Potamias, Shizhe Chen, and Cordelia Schmid. HORT: monocular hand-held objects reconstruction with transformers. In ICCV, 2025.

[55] Pradyumna Yalandur Muralidhar, Yuxuan Xue, Xianghui Xie, Margaret Kostyrko, and Gerard Pons-Moll. PhySIC: physically plausible 3D human-scene interaction and contact from a single image. In SIGGRAPH Asia, 2025.

[56] Yukang Cao, Jiahao Lu, Zhisheng Huang, Zhuowen Shen, Chengfeng Zhao, Fangzhou Hong, Zhaoxi Chen, Xin Li, Wenping Wang, Yuan Liu, and Ziwei Liu. Reconstructing 4D spatial intelligence: A survey. arXiv 2507.21045, 2025.

[57] Ri-Zhao Qiu, Shiqi Yang, Xuxin Cheng, Chaitanya Chawla, Jialong Li, Tairan He, Ge Yan, Lars Paulsen, Ge Yang, Sha Yi, Guanya Shi, and Xiaolong Wang. Humanoid policy ∼human policy. In CoRL, 2025.

32

第 33 页

[58] Fourier ActionNet Team and Yao Mu. ActionNet: A dataset for dexterous bimanual manipulation. Dataset website, 2025. URL https://action-net.org/.

[59] Yuzhe Qin, Yueh-Hua Wu, Shaowei Liu, Hanwen Jiang, Ruihan Yang, Yang Fu, and Xiaolong Wang. DexMV: imitation learning for dexterous manipulation from human videos. In ECCV, 2022.

[60] Simar Kareer, Dhruv Patel, Ryan Punamiya, Pranay Mathur, Shuo Cheng, Chen Wang, Judy Hoffman, and Danfei Xu. EgoMimic: scaling imitation learning via egocentric video. In ICRA, 2025.

[61] Ryan Punamiya, Dhruv Patel, Patcharapong Aphiwetsa, Pranav Kuppili, Lawrence Y. Zhu, Simar Kareer, Judy Hoffman, and Danfei Xu. EgoBridge: domain adaptation for generalizable imitation from egocentric human data. In NeurIPS, 2025.

[62] Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, and Hongyang Li. UniVLA: learning to act anywhere with task-centric latent actions. In RSS, 2025.

[63] Xiongyi Cai, Ri-Zhao Qiu, Geng Chen, Lai Wei, Isabella Liu, Tianshu Huang, Xuxin Cheng, and Xiaolong Wang. In-N-On: scaling egocentric manipulation with in-the-wild and on-task data. arXiv 2511.15704, 2025.

[64] Simar Kareer, Karl Pertsch, James Darpinian, Judy Hoffman, Danfei Xu, Sergey Levine, Chelsea Finn, and Suraj Nair. Emergence of human to robot transfer in vision-language-action models. arXiv 2512.22414, 2025.

[65] Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, et al. Do as I can, not as I say: Grounding language in robotic affordances. In CoRL, 2022.

[66] Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springenberg, Sergey Levine, Chelsea Finn, and Danny Driess. MEM: multi-scale embodied memory for vision language action models. arXiv 2603.03596, 2026.

[67] Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, and Ziwei Liu. Bridging semantic and kinematic conditions with diffusion-based discrete motion tokenizer. arXiv 2603.19227, 2026.

[68] Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, and Ziwei Liu. InfiniteDance: scalable 3D dance generation towards in-the-wild generalization. In ECCV, 2026.

[69] Yukang Cao, Liang Pan, Kai Han, Kwan-Yee K. Wong, and Ziwei Liu. AvatarGO: zero-shot 4D human-object interaction generation and animation. In ICLR, 2025.

[70] Zipeng Fu, Tony Z. Zhao, and Chelsea Finn. Mobile ALOHA: Learning bimanual mobile manipulation with low-cost whole-body teleoperation. In CoRL, 2024.

[71] Shihan Wu, Xuecheng Liu, Shaoxuan Xie, Pengwei Wang, Xinghang Li, et al. RoboCOIN: an open-sourced bimanual robotic data COllection for INtegrated manipulation. arXiv 2511.17441, 2025.

[72] Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, et al. RoboMIND 2.0: A multimodal, bimanual mobile manipulation dataset for generalizable embodied intelligence. arXiv 2512.24653, 2025.

33

第 34 页

[73] Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, and Ziwei Liu. HSImul3R: 基于物理闭环的仿真就绪人-场景交互重建. In ECCV, 2026.

[74] Haoran Jiang, Jin Chen, Qingwen Bu, Li Chen, Modi Shi, Yanjie Zhang, Delong Li, Chuanzhe Suo, Chuang Wang, Zhihui Peng, and Hongyang Li. WholeBodyVLA: 面向统一潜空间全身移动操作控制的VLA模型. In ICLR, 2026.

[75] Haozhe Xie, Beichen Wen, Jiarui Zheng, Zhaoxi Chen, Fangzhou Hong, Haiwen Diao, and Ziwei Liu. DynamicVLA: 面向动态物体操作的视觉-语言-动作模型. arXiv 2601.22153, 2026.

[76] Lawrence Y. Zhu, Pranav Kuppili, Ryan Punamiya, Patcharapong Aphiwetsa, Dhruv Patel, Simar Kareer, Sehoon Ha, and Danfei Xu. EMMA: 通过以自我为中心的人类数据扩展移动操作. IEEE RA-L, 11(3):3087–3094, 2025.

[77] Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, and Shuran Song. HoMMI: 从人类演示中学习全身移动操作. arXiv 2603.03243, 2026.

[78] Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, and Shenghua Gao. 2D Gaussian splatting实现几何精确的辐射场. In SIGGRAPH, 2024.

[79] S. Garrido-Jurado, R. Mu˜noz-Salinas, F.J. Madrid-Cuevas, and M.J. Mar´ın-Jim´enez. 遮挡下高可靠性基准标记的自动生成与检测. PR, 47(6):2280–2292, 2014.

[80] Roger Y. Tsai and Reimar Lenz. 一种全自主高效3D机器人手眼标定新技术. IEEE T-RA, 5(3):345–358, 1989.

[81] Bill Triggs, Philip F. McLauchlan, Richard I. Hartley, and Andrew W. Fitzgibbon. 光束法平差——现代综述. In Vision Algorithms: Theory and Practice, 2000.

[82] Paul Furgale, Joern Rehder, and Roland Siegwart. 多传感器系统统一时空标定. In IROS, 2013.

[83] Georgios Pavlakos, Vasileios Choutas, Nima Ghorbani, Timo Bolkart, Ahmed A. A. Osman, Dimitrios Tzionas, and Michael J. Black. 富有表现力的身体捕捉:从单张图像获取3D手部、面部和身体. In CVPR, 2019.

[84] Gemini Team. Gemini: 一个高性能多模态模型家族. arXiv 2312.11805, 2025.

[85] Patrick Grady, Chengcheng Tang, Samarth Brahmbhatt, Christopher D. Twigg, Chengde Wan, James Hays, and Charles C. Kemp. PressureVision: 从单张RGB图像估计手部压力. In ECCV, 2022.

[86] Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, and Qingmin Liao. EgoTactile: 从以自我为中心的视频中学习日常物体的抓取压力. In ICML, 2026.

[87] Jianyi Zhou, Ziteng Gao, Feiyang Hong, Zirui Liu, Guannan Zhang, Weisheng Dai, Ruichen Zhen, Chuqiao Lyu, Haotian Wu, Yinian Mao, Xushi Wang, Yuxiang Jiang, Wenbo Ding, and Shuo Yang. TouchAnything: 一个从以自我为中心的视频进行双手触觉估计的数据集与框架. arXiv 2605.13083, 2026.

[88] Bowen Wen, Wei Yang, Jan Kautz, and Stan Birchfield. FoundationPose: 新物体的统一6D姿态估计与跟踪. In CVPR, 2024.

34

第 35 页

[89] Fabien Baradel, Matthieu Armando, Salma Galaaoui, Romain Brégier, Philippe Weinzaepfel, Grégory Rogez, and Thomas Lucas. Multi-HMR: Multi-person whole-body human mesh recovery in a single shot. In ECCV, 2024.

[90] Guénolé Fiche, Philippe Weinzaepfel, Romain Brégier, and Fabien Baradel. Multi-HMR 2: Multi-person camera-centric human detection, mesh recovery and tracking. arXiv 2606.14841, 2026.

[91] Xitong Yang, Devansh Kukreja, Don Pinkus, Anushka Sagar, Taosha Fan, Jinhyung Park, Soyong Shin, Jinkun Cao, Jiawei Liu, Nicolas Ugrinovic, Matt Feiszli, Jitendra Malik, Piotr Dollár, and Kris Kitani. SAM 3D Body: Robust full-body human mesh recovery. arXiv 2602.15989, 2026.

[92] Hongwen Zhang, Yating Tian, Yuxiang Zhang, Mengcheng Li, Liang An, Zhenan Sun, and Yebin Liu. PyMAF-X: Towards well-aligned full-body model regression from monocular images. IEEE TPAMI, 45(10):12287–12303, 2023.

[93] Muhammed Kocabas, Chun-Hao P. Huang, Otmar Hilliges, and Michael J. Black. PARE: Part attention regressor for 3D human body estimation. In ICCV, 2021.

[94] Priyanka Patel and Michael J. Black. CameraHMR: Aligning people with perspective. In 3DV, 2025.

[95] Jing Lin, Ailing Zeng, Haoqian Wang, Lei Zhang, and Yu Li. One-stage 3D whole-body mesh recovery with component aware transformer. In CVPR, 2023.

[96] Zhongang Cai, Wanqi Yin, Ailing Zeng, Chen Wei, Qingping Sun, Wang Yanjun, Hui En Pang, Haiyi Mei, Mingyuan Zhang, Lei Zhang, Chen Change Loy, Lei Yang, and Ziwei Liu. SMPLer-X: Scaling up expressive human pose and shape estimation. In NeurIPS, 2023.

[97] Wanqi Yin, Zhongang Cai, Ruisi Wang, Ailing Zeng, Chen Wei, Qingping Sun, Haiyi Mei, Yanjun Wang, Hui En Pang, Mingyuan Zhang, Lei Zhang, Chen Change Loy, Atsushi Yamashita, Lei Yang, and Ziwei Liu. SMPLest-X: Ultimate scaling for expressive human pose and shape estimation. IEEE TPAMI, 48(2):1778–1794, 2026.

[98] Shubham Goel, Georgios Pavlakos, Jathushan Rajasegaran, Angjoo Kanazawa, and Jitendra Malik. Humans in 4D: Reconstructing and tracking humans with transformers. In ICCV, 2023.

[99] Zehong Shen, Huaijin Pi, Yan Xia, Zhi Cen, Sida Peng, Zechen Hu, Hujun Bao, Ruizhen Hu, and Xiaowei Zhou. World-grounded human motion recovery via gravity-view coordinates. In SIGGRAPH Asia, 2024.

[100] Soyong Shin, Juyong Kim, Eni Halilaj, and Michael J. Black. WHAM: Reconstructing world-grounded humans with accurate 3D motion. In CVPR, 2024.

[101] EasyMoCap: Make human motion capture easier. GitHub, 2021. URL https://github.com/zju3dv/EasyMocap.

[102] Qing Shuai, Chen Geng, Qi Fang, Sida Peng, Wenhao Shen, Xiaowei Zhou, and Hujun Bao. Novel view synthesis of human interactions from sparse multi-view videos. In SIGGRAPH, 2022.

[103] Mengfei Li, Peng Li, Zheng Zhang, Jiahao Lu, Chengfeng Zhao, Wei Xue, Qifeng Liu, Sida Peng, Wenxiao Zhang, Wenhan Luo, Yuan Liu, and Yike Guo. UniSH: Unifying scene and human reconstruction in a feed-forward pass. arXiv 2601.01222, 2026.

[104] Zhizheng Liu, Joe Lin, Wayne Wu, and Bolei Zhou. Joint optimization for 4D human-scene reconstruction in the wild. arXiv 2501.02158, 2025.

[105] Yue Chen, Xingyu Chen, Yuxuan Xue, Anpei Chen, Yuliang Xiu, and Gerard Pons-Moll. Human3R: Everyone everywhere all at once. In ICLR, 2026.

35

第 36 页

[106] Hanz Cuevas-Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Hösche, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, and Michael J. Black. MAMMA: 无标记自动多人运动动作捕捉. In CVPR, 2026.

[107] Xiaoben Li, Mancheng Meng, Ziyan Wu, Terrence Chen, Fan Yang, and Dinggang Shen. 从任意多视角图像中恢复人体网格. arXiv 2403.12434, 2024.

[108] Lea Müller, Hongsuk Choi, Anthony Zhang, Brent Yi, Jitendra Malik, and Angjoo Kanazawa. 重建人物、场景与相机. In CVPR, 2025.

[109] Jiaman Li, C. Karen Liu, and Jiajun Wu. 通过自我头部姿态估计进行自我身体姿态估计. In CVPR, 2023.

[110] Brent Yi, Vickie Ye, Maya Zheng, Yunqi Li, Lea Müller, Georgios Pavlakos, Yi Ma, Jitendra Malik, and Angjoo Kanazawa. 在自我感知世界中估计身体与手部运动. In CVPR, 2025.

[111] Catalin Ionescu, Dragos Papava, Vlad Olaru, and Cristian Sminchisescu. Human3.6M: 面向自然环境中3D人体感知的大规模数据集与预测方法. IEEE TPAMI, 36(7):1325–1339, 2014.

[112] Matthew Loper, Naureen Mahmood, Javier Romero, Gerard Pons-Moll, and Michael J. Black. SMPL: 一种蒙皮多人线性模型. ACM TOG, 34(6):248:1–248:16, 2015.

[113] Aditya Prakash, Ruisen Tu, Matthew Chang, and Saurabh Gupta. 日常自我中心图像中的3D手部姿态估计. In ECCV, 2024.

[114] Zhengdi Yu, Stefanos Zafeiriou, and Tolga Birdal. Dyn-HaMR: 从动态相机中恢复4D交互手部运动. In CVPR, 2025.

[115] Rolandos Alexandros Potamias, Jinglei Zhang, Jiankang Deng, and Stefanos Zafeiriou. WiLoR: 野外端到端3D手部定位与重建. In CVPR, 2025.

[116] Dixuan Lin, Yuxiang Zhang, Mengcheng Li, Yebin Liu, Wei Jing, Qi Yan, Qianying Wang, and Hongwen Zhang. OmniHands: 通过通用Transformer实现交互手部的鲁棒运动捕捉. ACM TOG, 42(6):197:1–197:11, 2026.

36

发表评论