Exo2EgoPose:利用外心演示突破自心3D手部姿态预测瓶颈

三分钟导读:本文提出Exo2EgoPose框架,通过双重心外心重建模块(DERM)和全局到局部调制模块(GLMM),利用外心视频指导自心视角下的3D手部姿态预测,有效克服了视野受限和动态运动挑战。

英文题目:Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

论文出处:arXiv 每日论文精选 · arXiv:2607.15890

原始论文:PDF / 论文页面

对应视频标题:Exo2EgoPose:利用外心演示突破自心3D手部姿态预测瓶颈|推荐指数:★★★★★

这篇论文解决什么问题?

自心(Ego)视角下的3D手部姿态预测面临视野受限、动态运动剧烈导致线索不足,且现有基于VRM/VLA范式的方法受限于机器人数据稀缺及人机具身差异。

核心创新

  • 提出VL-EHPF任务,利用外心演示补偿自心视角的局部和动态线索。
  • 设计双重心外心重建模块(DERM),在训练阶段重构视频级和分块帧级外心表示,建模空间上下文和时间动态。
  • 开发全局到局部调制模块(GLMM),通过注意力机制和自适应调制单元(AMU)进行特征对齐和分布校准。
  • 构建新的EgoMe-pose基准,并验证了从人类自心姿态到机器人操作任务的有效迁移能力。

方法概览

提出Exo2EgoPose框架,输入包括视觉观察、语言指令和姿态状态。首先通过多模态编码器提取特征,利用双重心外心重建模块(DERM)重构视频级和分块帧级的外心表示以建立跨视角对应关系。随后,全局到局部调制模块(GLMM)利用重构的外心表示进行渐进式特征细化,最终预测未来3D手部姿态。

逐图理解论文

VL-EHPF任务定义

VL-EHPF任务定义
Figure 1: Schematic of the VL-EHPF task and ideology of the proposed Exo2EgoPose Framework.

为此,本文提出VL-EHPF任务,即视觉语言引导的自心3D手部姿态预测。该任务的核心思想是利用外心视频提供的稳定、全局场景上下文,来补偿自心视角下的局部和动态线索不足,从而提升预测精度。

Exo2EgoPose框架概览

Exo2EgoPose框架概览
Figure 2: Overview of our Exo2EgoPose framework. First, we adopt multiple modality-specific encoders to extract features, which are then tokenized and fed into a multimodal Transformer with initialized queries. Then, the DERM reconstructs the representations of the whole video clip and future chunked frames from the Exo perspective during training to construct Ego-Exo cross-view correspondence. Next, the GLMM utilizes the reconstructed Exo knowledge as guidance and performs comprehensive global-to-local feature refinement, which facilitates accurate prediction for the future Ego 3D hand poses.

我们提出Exo2EgoPose框架,输入包括视觉观察、语言指令和姿态状态。首先通过多模态编码器提取特征并Tokenize,随后利用双重心外心重建模块DERM重构外心表示,最后通过全局到局部调制模块GLMM进行特征细化,预测未来3D手部姿态。

全局到局部调制模块

全局到局部调制模块
Figure 3: Illustration of the Global-to-Local Modulation Mod- ule (GLMM). Given the reconstructed Exo representations, it performs feature refinement from global to local levels via cross attention and adaptive modulation units (AMU).

GLMM模块利用重构的外心表示进行渐进式特征细化。通过交叉注意力机制和自适应调制单元AMU,该模块实现了从全局到局部的特征对齐和分布校准,有效融合了外心知识以增强自心特征的判别力。

定量评估结果

定量评估结果
Table 1: Quantitative results on the test set of the AssemblyHands, Ego-Exo4D, and novel EgoMe-pose benchmarks.

在AssemblyHands、Ego-Exo4D和EgoMe-pose基准上的定量评估显示,Exo2EgoPose表现优异。在AssemblyHands上MPJPE为25.83,优于AR-VRM的33.39;在Ego-Exo4D上为36.44,优于AR-VRM的44.46;在EgoMe-pose上为49.44,优于AR-VRM的56.06。

消融实验分析

消融实验分析
Table 2: Ablation results on the val set of the AssemblyHands dataset. “VER" and “CFER" denote the video-level and chun- ked frame-level Exo reconstruction, respectively. “T" denotes replacing GMM and LMM with vanilla Transformer layers.

消融实验验证了DERM和GLMM各组件的有效性。视频级和分块帧级外心重建均对性能提升有贡献。替换为普通Transformer层会导致性能下降,表明GLMM中的自适应调制机制对于特征对齐至关重要。

实验与关键结果

  • 在AssemblyHands、Ego-Exo4D和EgoMe-pose基准上进行定量评估。
  • 在CALVIN机器人基准上进行人类到机器人的迁移能力分析。
  • 进行消融实验以验证DERM和GLMM各组件的有效性。
  • 进行超参数敏感性分析和特征调制可视化分析。
  • 在AssemblyHands、Ego-Exo4D和EgoMe-pose基准上进行定量评估。
  • 在CALVIN机器人基准上进行人类到机器人的迁移能力分析。
  • 进行消融实验以验证DERM和GLMM各组件的有效性。
  • 进行超参数敏感性分析和特征调制可视化分析。

阅读时需要注意

  • 依赖配对的外心视频作为监督信号,这在某些场景下可能难以获取。
  • 自动标注的EgoMe-pose基准可能存在噪声,尽管进行了过滤。
  • 模型性能依赖于外心视频与自心视频的时间对齐或相对位置计算。
  • 在CALVIN上的迁移实验基于蒸馏,具体迁移细节需参考原文。

关联工作

  • GR-1:基线方法,利用大规模视频进行生成式预训练,本文方法在精度上显著超越。(第 6 页)
  • AR-VRM:基线方法,结合外心数据进行类比推理,本文方法在多个基准上均优于该方法。(第 6 页)
  • Ego-Exo4D:使用的基准数据集之一,包含同步的自心和外心视频对。(第 6 页)
  • AssemblyHands:使用的基准数据集之一,提供高质量的3D手部标注。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, 和 Hongliang Li 电子科技大学 中国四川成都

高度动态的运动 有限的视野 外心演示 摘要 … 感知多模态线索并预测细粒度动作 从自心(Ego)视角感知多模态线索并预测细粒度动作 配对 对于机器人操作等应用至关重要。然而,先前的研究要么主要依赖 用你的右手, 信息不足的视觉输入来预测粗糙的人类运动,要么遵循 VRM/VLA 取出三件挂着的 范式,后者受限于机器人数据不足以及人类与机器人具身之间的 并叠放在衣架上的 差距。我们观察到,3D手部姿态自然地充当了连接人机动作 衣服 的统一表征。因此,我们研究了一个尚未充分探索的视觉语言 重建 … 视频 引导的自心3D手部姿态预测(VL-EHPF)任务,该任务旨在从视觉观察、 语言指令和姿态状态中预测未来的自心3D手部姿态。为了克服 Exo2EgoPose 框架 调制 自心视角视野有限和高度动态运动的限制,我们提出了一个名为 未来自心3D手部姿态预测 Exo2EgoPose 的框架,该框架创新性地利用整体且稳定的外心 … 帧 (Exo)演示作为指导,以补偿部分且动态的自心视角线索。 全局 具体而言,我们引入了一个双重心外心重建模块(DERM),该 局部 模块将配对外心视频作为监督信号,以重建其视频级和分块 图1:VL-EHPF任务的示意图以及本文提出的 帧级表征,从而建模空间上下文和时间动态。然后,全局到 Exo2EgoPose 框架的理念。 局部调制模块(GLMM)利用重建的分层外心表征,通过注意力 机制和自适应调制进行渐进式特征细化,从而实现全面的外心 2026年7月17日 指导,以准确预测自心手部姿态。在 AssemblyHands、Ego-Exo4D 和我们新构建的 EgoMe-pose 基准上的大量实验表明了我们 手是人类与物理世界互动的主要媒介。这激发了人们对 方法的优越性,其性能大幅优于最先进的方法。此外,它还 自心手部姿态的广泛兴趣,该姿态提供了人类活动的显式 展示了有效的人机迁移能力,并在 CALVIN 数据集上取得了 表征,并自然地充当了人类与机器人动作之间的桥梁。 改进。代码将会发布。 许多工作致力于从给定的自心图像或视频中估计2D/3D手部姿态 [14, 36, 47, 50, 53, 56, 71],以解释当前的动作状态。为了推断解码 人类意图所必需的下一步动作,研究人员向前迈出了一步, 预测未来的手部运动 [4, 37, 42]。例如,开创性的 OCT [37] 联合预测2D手部运动和交互热点。 USST [4] 通过不确定状态空间模型预测自心3D手部轨迹。 MADiff[42] 通过采用基于扩散的策略 [18] 进行了改进。 然而,这些方法主要依赖视觉模态预测粗糙级别的轨迹或 热点,而在缺乏明确且完整的任务上下文(如详细姿态状态 和文本指令)的情况下,视觉模态是信息不足的,因此难以 预测细粒度的关节级动态。最近,许多研究 [5, 24, 40, 41, 45, 89] 考虑遵循流行的视觉机器人操作(VRM)或视觉语言动作(VLA) 范式预测机器人的末端执行器运动,这些范式将多种模态信号 作为输入并输出特定的机器人任务执行。尽管取得了令人印象 深刻的成就,但它们受到机器人数据规模有限的阻碍 [49, 84]。 尽管一些工作 [76, 82, 83] 试图结合人类数据以缓解这一问题, 但由于人类与机器人具身之间的巨大差距 [28, 88],它们仍然 产生次优的结果。为此,我们研究了一个尚未充分探索的视觉 语言引导的自心3D手部姿态预测(VL-EHPF)任务,该任务旨在 基于输入的视觉观察、语言指令和姿态状态来预测未来的自心 3D手部姿态。尽管最近

CCS 概念 • 计算方法 → 确定性动作规划;• 以人为中心的计算;

关键词 自心3D手部姿态预测,外心到自心知识迁移,视觉-语言-姿态多模态学习

1 引言 在具身空间中感知当前状态并从自心(Ego)视角预测细粒度的未来动作 在多媒体AI系统中起着至关重要的作用,该系统可以扩展到 各种应用,如增强现实(AR)[10, 55, 58, 68] 和智能机器人操作 [11, 21, 23, 87]。这种 非凡的能力不仅为理解人类意图背后的认知过程提供了深刻的见解 [25, 44, 69],而且 也有潜力将知识从高层人类活动转移到下游机器人执行任务 [9, 27, 29]。

arXiv:2607.15890v1

第 2 页

会议缩写 ’XX,2018年6月3日–5日,纽约伍德斯托克 赵峰石,何谦秋,兰晓王,祥李,宏亮李

AR-VRM [81] 和并行的 SFHand [35] 针对相关任务提出了基于预训练和基于流式处理的方法,但它们忽视了自心视角(Ego view)中独特的挑战(即有限的视野和如图1所示的高度动态运动)。具体而言,一方面,自心视频由头戴式设备录制,仅覆盖主体前方的有限区域,导致上下文线索不足,如截断的手部或物体外观,这显著影响了对人手-物体交互的理解以及手部关键点的预测。另一方面,自由移动自心相机与快速手部操作相结合,导致高度动态的背景和复杂的手-背景相对运动。这种动态性使得准确捕捉当前和即将发生的手部运动模式变得困难。

受先前利用互补信息跨越外心(Exocentric, Exo)和自心(Egocentric, Ego)视角的适应 [36, 51, 60, 66] 或迁移 [20, 65, 67, 85] 工作的启发,我们提出了一个名为 Exo2EgoPose 的新颖框架来解决上述问题,如图1所示。这是首次利用整体且稳定的外心演示视频,其中包含绝对位置和运动动态,作为关键指导,以补偿3D手部姿态预测中部分且动态的自心线索。具体而言,为了构建自心-外心跨视角对应关系,我们引入了双重心外心重建模块(Dual-level Exocentric Reconstruction Module, DERM)。它在训练期间将配对的外心演示视频作为监督信号,旨在重建由基于多模态自心输入的 MAE [17] 编码器提取的视频级和分块帧级外心表示,从而有助于建模自心视角中复杂的时空上下文和动态。随后,我们通过全局到局部调制模块(Global-to-Local Modulation Module, GLMM)将重建的分层外心表示注入到学习到的自心特征中。该模块通过注意力机制和自适应调制单元(Adaptive Modulation Units, AMU)[54] 执行渐进式特征对齐和分布校准,从而充分利用外心视角的指导以实现准确的自心3D手部姿态预测。为了进行全面评估,我们不仅在现有的已处理 AssemblyHands 和 Ego-Exo4D 基准上评估我们的 Exo2EgoPose,还在我们基于 EgoMe 数据集 [59] 新构建的 EgoMe-pose 基准上进行评估,该基准包含来自真实场景中观察者和跟随者视角的配对视频。此外,我们还在具有挑战性的机器人 CALVIN 数据集上评估了人机知识迁移能力,我们的方法取得了令人印象深刻的性能提升。

主要贡献总结如下:

• 我们调查了一个尚未充分探索的视觉语言引导的自心3D手部姿态预测(Vision-Language guided Egocentric 3D Hand Pose Forecasting, VL-EHPF)任务,并提出了一种新颖的 Exo2EgoPose 框架,该框架利用整体且稳定的外心演示来补偿3D手部姿态预测中部分且动态的自心线索。

• 我们开发了一种双重心外心重建模块(Dual-level Exocentric Reconstruction Module, DERM),通过在训练期间重建不同级别的外心表示来建模时空上下文。此外,全局到局部调制模块(Global-to-Local Modulation Module, GLMM)利用分层外心表示,通过注意力和自适应调制单元(AMU)执行渐进式特征细化,以实现准确的自心3D手部姿态预测。

• 我们构建了一个新颖的 EgoMe-pose 基准。实验不仅表明我们的 Exo2EgoPose 在 AssemblyHands、Ego-Exo4D 和 EgoMe-pose 基准上大幅优于最先进的方法,还表明了其在 CALVIN 数据集上的人到机器人迁移能力。

2 相关工作

2.1 自心-外心跨视角理解

随着自心数据集 [3, 7, 8, 13, 57, 70] 的介绍,研究人员越来越关注结合外心视频以克服自心视角中固有的挑战。近年来,许多自心-外心数据集 [14, 20, 22, 26, 31, 50, 59, 63] 已被提出。H2O [26] 是一个用于分析交接过程的多视角数据集。EgoExoLearn [20] 旨在弥合语义层面上异步程序性活动之间的差距。EgoExo-Fitness [31] 是为全身理解而构建的。Assembly101 [63] 是一个用于组装玩具的多视角数据集,而 AssemblyHands [50] 进一步改进了其姿态标注。Ego-Exo4D [14] 是目前最大的具有多视角视频和多样化标注的数据集。EgoMe [59] 包含从观察者和跟随者视角记录的自心和外心视频。基于 EgoMe,我们执行自动3D手部标注并构建了一个全新的 EgoMe-pose 基准。

同时,许多工作 [2, 30, 39, 65, 66, 80] 已被提出以建模各种任务中的自心-外心相关性。这些任务可以概括为三个级别:用于学习全局统一表示的视频级任务,如跨视角关联 [19, 39, 80] 和视频描述 [78, 86];用于理解程序性活动(如动作规划 [20, 85])和细粒度视频理解的片段级任务 [60, 66];以及用于解析像素级模式的帧级任务,如新视角合成 [33, 34] 和姿态估计 [14, 36]。与上述任务不同,我们调查了尚未充分探索的 VL-EHPF 任务,并创新性地利用外心演示来补偿部分且动态的自心线索。

2.2 人体/机器人姿态预测

早期工作主要从外心视角估计人体姿态 [15, 43, 72, 77, 79]。最近,自心姿态因其与人体/机器人中心感知更好地对齐而受到越来越多的关注 [4, 14, 32, 36, 42, 50, 56]。一些工作 [1, 36, 50, 56, 75] 旨在从自心图像或视频中估计当前手部姿态。WildHands [56] 在日常自心图像中执行3D手部姿态估计。S2DHand [36] 为此任务进行了视角适应。同时,其他研究 [4, 16, 37, 42] 旨在预测未来的姿态意图。USST [4] 采用状态空间模型来预测3D手部轨迹。MADiff [42] 使用基于扩散 [18] 的策略来建模自心运动。尽管取得了成就,但它们主要依赖单一视觉模态进行人体姿态估计或粗略轨迹预测。

为了实现从感知到执行的飞跃,视觉机器人操作(Visual Robot Manipulation, VRM)[40, 41, 45, 76, 81] 和视觉语言动作(Vision-Language-Action, VLA)[5, 24, 82, 89] 已成为热门话题。GCBC [40] 首次探索了从不同视觉条件下学习动作。MCIL [41] 将视觉和语言模态作为条件集成,而 HULC [45] 提出了更稳健执行的层次化语言架构。RT-1 [5] 是开创性的 VLA 工作,提出了基于 Transformer [74] 的框架,而 RT-2 [89] 通过利用网络知识进行了扩展。由于

第 3 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克

LE 未来 语言指令 自心观测帧 手部姿态状态 手部姿态 … … … [FRA] 将右手移到蓝色背包的右侧 … [VID] [FRA] 蓝色背包的右侧, … … 折叠蓝色背包 的上层并用双手打开 时间 … 全局到局部调制模块 (GLMM) 它。 t  t  T   1 t t  3 t t  2 t t  1 t  t

… … … [FRA] [VID] … [FRA] 文本 DINO MAE 姿态 编码器 编码器 编码器 编码器 全局调制 局部调制

Exo 查询 姿态查询 Ego 查询 文本 DINO [CLS] … [CLS] … 令牌MAE 令牌状态 t  T   1 : t … … … 令牌 令牌 [VID] [FRA] [FRA]

多模态因果Transformer架构

双重心外心重建模块 (DERM) 解码 解码 解码 冻结 外心演示视频 可训练 LV … … … [FRA] [VID] [FRA] [CLS] 类别令牌 … … … … 编码器 [VID] 视频级 时间 MAE 姿态解码查询 Ego解码查询 t  t  T   1 t t  1 t  t t t  1 t t  2 t  t  T  1 t  t  T LF [FRA] 帧级 分块Exo帧 Transformer输出

图2:我们的Exo2EgoPose框架概述。首先,我们采用多种特定模态的编码器来提取特征, 然后将这些特征标记化并馈入具有初始化查询的多模态Transformer中。接着,DERM在训练期间从Exo视角重建整个视频片段和未来分块帧的表示,以构建 Ego-Exo跨视图对应关系。接下来,GLMM利用重建的Exo知识作为指导,并执行全面的全局到局部特征细化,从而促进对未来Ego 3D手部姿态的准确预测。

机器人数据的规模有限,许多研究 [76, 81–83] 试图 利用现成的人类数据,这已经取得了 显著进展。在本文中,我们利用多模态线索来 预测Ego视角下的细粒度3D手部姿态,并创新性地 整合整体且稳定的Exo演示,从而促进弥合人类和机器人载体之间的差距。 3 方法 执行多模态标记化并初始化不同种类的 查询,这些查询被馈入基于Transformer的模型中, 3.1 任务定义与方法概述 用于后续预测的因果注意力机制。然后,我们引入 视觉语言引导的自心3D手部姿态预测 (VL-EHPF) 任务旨在基于多模态 输入预测交互手部(们)来自Ego视角的未来3D关键点。 具体来说,在任意时间戳 𝑡,模型 M 接收一个序列 的Ego观测帧 𝑂𝑡−𝑇′+1:𝑡= {𝑜𝑡−𝑇′+1,𝑜𝑡−𝑇′+2, · · ·𝑜𝑡} ∈ R𝑇′×𝐻×𝑊×3,一个语言指令𝑙,以及手部姿态状态𝑆𝑡−𝑇′+1:𝑡= {𝑠𝑡−𝑇′+1,𝑠𝑡−𝑇′+2, · · ·𝑠𝑡} ∈R𝑇′×42×3 作为多模态输入,以预测 未来 ¯𝑇步中的3D手部关键点 ˆ𝑆𝑡+1:𝑡+¯𝑇= {ˆ𝑠𝑡+1, ˆ𝑠𝑡+2, · · · ˆ𝑠𝑡+¯𝑇} ∈R¯𝑇×42×3。 注意,42表示两只手的关节总数(每只手21个关键点),3表示 每个关节的3D坐标。该过程公式化如下:

ˆ𝑆𝑡+1:𝑡+¯𝑇= M(𝑙,𝑂𝑡−𝑇′+1:𝑡,𝑆𝑡−𝑇′+1:𝑡) (1) 3.2 多模态标记化 其中 ¯𝑇表示未来预测的长度,𝑇′ 表示观测窗口的长度,其范围在1到 𝑇′max之间。实际上,对于仅有一只交互手或 缺失关节的情况,我们还预测关节有效性 ˆ𝑉𝑡+1:𝑡+¯𝑇∈{0, 1}¯𝑇×42 以及预测的3D手部姿态 ˆ𝑆𝑡+1:𝑡+¯𝑇。 为了解决VL-EHPF任务,我们提出了一个新的Exo2EgoPose 框架,如图2所示。首先,我们采用特定模态的编码器来提取输入语言指 令𝑙、Ego观测帧 𝑂𝑡−𝑇′+1:𝑡 和手部姿态状态 𝑆𝑡−𝑇′+1:𝑡在时间戳 𝑡 处的特征。此外,我们通过执行多模态标记化并初始化不同种类的 查询,将其组织起来,这些查询被馈入具有 因果注意力的基于Transformer的模型中,用于后续预测。然后,我们引入 双重心外心重建模块 (DERM),它在训练期间利用额外的配对Exo视频作为监督。 它旨在在视频和分块帧级别重建Exo表示,赋予Ego-Exo跨视图能力, 从而促进建模空间上下文和时间动态。 接下来,我们开发了全局到局部调制模块 (GLMM)。它 将重建的不同级别Exo表示作为指导,并采用注意力机制和自适应调制 单元 (AMU) 以全局到局部的方式细化学习到的Ego特征,以实现准确的Ego 3D手部姿态预测。最后,采用MLP层 用于最终预测3D手部姿态。

给定语言指令 𝑙、Ego观测帧 𝑂𝑡−𝑇′+1:𝑡 和手部姿态状态 𝑆𝑡−𝑇′+1:𝑡,我们首先采用特定模态的 编码器来提取特征,然后将这些特征标记化为统一的

第 4 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦邱,兰晓王,祥李,和宏亮李

表示空间,用于后续的推理和预测。 总共。然后,我们在视频 我们将文本编码器和姿态编码器分别记为 E𝐿(·) 和 E𝑃(·)。 级别和分块帧级别定义双重心外心(Dual Exo)演示。具体而言,我们选择与过去观察结果和后续预测 对于视觉输入,我们采用 MAE [17] 编码器 E𝑀(·) 和 DINOv2 [52] 编码器 E𝐷(·) 以分别获取像素级和语义级 窗口的自心(Ego)视频对齐的外心视频片段(即时间戳范围从 𝑡−𝑇′+1 到 𝑡+¯𝑇) 特征。特征提取过程如下: 作为视频级外心演示,记为 𝑂𝑒𝑥𝑜 𝑡−𝑇′+1:𝑡+¯𝑇。我们 𝑓𝐿= E𝐿(𝑙) (2) 使用冻结的 MAE 编码器 E𝑀(·) 和感知机重采样器 (PR)提取其特征,并对每帧的 [CLS] token 取平均以获得视频级外心表示,如下所示: 𝐹𝑀= {𝐹𝑀,𝑖}𝑡𝑖=𝑡−𝑇′+1 = E𝑀(𝑂𝑡−𝑇′+1:𝑡) (3) 𝑡+¯𝑇 𝐹𝐷= {𝐹𝐷,𝑖}𝑡𝑖=𝑡−𝑇′+1 = E𝐷(𝑂𝑡−𝑇′+1:𝑡) (4) 𝑉𝑡−𝑇′+1:𝑡+¯𝑇= 𝑣CLS𝑖 , 𝑣1𝑖, · · · 𝑣𝑁𝑖 𝑖=𝑡−𝑇′+1 = PR(E𝑀(𝑂𝑒𝑥𝑜𝑡−𝑇′+1:𝑡+¯𝑇)) 𝐹𝑃= {𝑓𝑃,𝑖}𝑡𝑖=𝑡−𝑇′+1 = E𝑃(𝑆𝑡−𝑇′+1:𝑡) (5) (10) 其中 𝐹𝑀,𝑖= {𝑓CLS𝑀,𝑖, 𝑓1𝑀,𝑖, · · · , 𝑓𝑁𝑀𝑀,𝑖} ∈R(𝑁𝑀+1)×𝐶𝑣(DINOv2 特征 𝐹𝐷,𝑖 类似),且 𝑓𝑃,𝑖∈R𝐶𝑝。 𝑡+¯𝑇 (11)接下来,我们通过多层感知机(MLP)层对提取的 𝑣CLS𝑖 多模态特征进行标记。以时间戳 𝑡 为例: 𝑡+¯𝑇 𝑤= MLP(𝑓𝐿) 𝑝𝑡= MLP(𝑓𝑃,𝑡) (6) 𝑣𝑒𝑥𝑜= 𝑇′ 1+ ¯𝑇 ∑︁ 𝑖=𝑡−𝑇′+1 𝐷𝑡= 𝑑CLS𝑡 ,𝑑1𝑡, · · · ,𝑑𝑁𝑡 = MLP(PR(𝐹𝐷,𝑡)) (8) 其中 𝑣𝑒𝑥𝑜∈R1×𝐶𝑣 是视频级外心表示,它 其中 PR 表示感知机重采样器,用于将视觉 token 数量下采样至 𝑁,并且所有 token 都被投影到隐藏 指示了整个活动期间的时间运动动态。 大小维度 𝐶。最后,我们沿时间维度添加时间嵌入 𝑒𝑡 以保留输入的顺序。 此外,我们还构建了分块帧级外心引导 𝑂𝑒𝑥𝑜 𝑡+1:𝑡+¯𝑇,方法是获取与自心(Ego)中待预测的分块序列相对应的外心帧(即时间戳范围从 𝑡+1 到 𝑡+¯𝑇)。注意,对于自心和外心视频不同步的情况(例如在 EgoMe [59] 数据集中),我们计算每个自心片段在整个视频中的相对时间位置,并进行线性对齐以确定外心视频中对应的时间戳范围。我们提取分块内每帧的 [CLS] token 作为帧级外心表示,记为 𝑓𝑒𝑥𝑜= {𝑣CLS𝑖 }¯𝑇𝑖=𝑡+1 ∈R¯𝑇×𝐶𝑣,其主要集中在未来分块帧内的详细空间上下文信息。接下来,我们将解码后的视频级和帧级查询 𝑞′𝑣 和 𝑞′𝑓 投影到与外心表示一致的维度 𝐶𝑣,并结合视频级和分块帧级重建损失 𝐿𝑉 和 𝐿𝐹 以实现全面的自心到外心重建,其公式如下: 𝑞′′𝑣= MLP(𝑞′𝑣) 𝑞′′𝑓= MLP(𝑞′𝑓) (12) 3.3 双重心外心重建 自心视频通常聚焦于主体前方有限的视野,且具有高度动态的自心运动。受先前自心-外心工作 [14, 20, 66, 67] 的启发,我们引入了与给定自心观察视频配对的整体且稳定的外心演示,作为训练期间的监督信号,作为必要的指导以补偿部分和动态的自心线索。为此,我们首先开发了一种新颖的双重心外心重建模块(DERM),如图 2 底部所示。旨在基于多模态自心输入重建视频级和分块帧级外心表示,以构建自心-外心跨视图对应关系,从而促进对自心视图中复杂空间上下文和时间动态的全面建模。 在提取元组 {𝑤; 𝑀𝑡−𝑇′+1:𝑡; 𝐷𝑡−𝑇′+1:𝑡;𝑝𝑡−𝑇′+1:𝑡} 的多模态 token 后,我们进一步随机初始化一系列可学习查询 𝑄= {𝑞𝑝;𝑞𝑣;𝑞𝑓;𝑞𝑒},作为 Transformer 预测的占位符。具体而言,𝑞𝑝∈R¯𝑇×𝐶 表示姿态查询,𝑞𝑣∈R1×𝐶 表示视频级外心查询,𝑞𝑓∈R¯𝑇×𝐶 表示帧级外心查询。此外,遵循开创性方法 GR-1 [76],我们还引入了自心查询 𝑞𝑒∈R(𝑁+1)×𝐶 用于自心帧重建。上述 token 和查询随后被输入到一个多模态 Transformer 架构 T(·) 中,其公式如下: n𝑞′𝑝,𝑞′𝑣,𝑞′𝑓,𝑞′𝑒 o = T 𝑤, 𝑀𝑡−𝑇′+1, 𝐷𝑡−𝑇′+1, 𝑃𝑡−𝑇′+1, · · · , (9) · · · ,𝑤, 𝑀𝑡, 𝐷𝑡, 𝑃𝑡 , 𝑞𝑝,𝑞𝑣,𝑞𝑓,𝑞𝑒 其中 𝑞′𝑝, 𝑞′𝑣, 𝑞′𝑓, 和 𝑞′𝑒 表示解码后的查询序列。 此外,我们引入了与当前自心观察视频 𝑂 配对的非修剪外心(Exo)视频。该视频由稳定相机记录,提供了整体的全局场景上下文。外心观察视频记为 𝑂𝑒𝑥𝑜= {𝑜𝑒𝑥𝑜1 ,𝑜𝑒𝑥𝑜2 , · · ·𝑜𝑒𝑥𝑜𝑇𝑣𝑖𝑑},包含 episode 的整个活动过程,共 𝑇𝑣𝑖𝑑 帧。 𝑀𝑡= 𝑚CLS𝑡 ,𝑚1𝑡, · · · ,𝑚𝑁𝑡 = MLP(PR(𝐹𝑀,𝑡)) (7) 上述重建损失有效地约束了解码后的查询,使其与来自配对的整体且稳定的外心演示视频的视频级和分块帧级表示对齐,从而促进对自心场景中空间上下文和时间动态的建模。 此外,我们执行自心帧重建。具体而言,我们将解码后的自心查询输入到一个多块 MAE 风格解码器 𝐸𝐸 中,以重建相对于当前时间步的未来第三自心帧,相应的损失记为 𝐿𝐸。整体重建损失可公式化如下: 𝐿𝑟𝑒𝑐𝑜𝑛= 𝜆𝑉𝐿𝑉+ 𝜆𝐹𝐿𝐹+ 𝜆𝐸𝐿𝐸 (15) 其中 𝜆𝑉, 𝜆𝐹, 和 𝜆𝐸 是用于平衡多种损失的系数。

第 5 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 会议缩写 ’XX,2018年6月03–05日,纽约伍德斯托克

姿态查询 视频外心表示  帧外心表示  接下来,我们将全局调制特征 $\bar{q}_{gm}$ 和局部 外心引导 $q''_f$ 输入到局部调制模块(LMM)中,该 LayerNorm 全局AMU LayerNorm 模块的结构与上述GMM不同。具体而言,由于    1(  1 ) 1 调制 参数 多头交叉注意力 特征 $q''_f$ 表示局部分块帧的外心特征,其内容  缩放 和 平移 1 1 1 2 2 2 投影 矩阵乘法 投影 特征 可能与学习到的特征 $\bar{q}_{gm}$ 在时间上不同步,因此 多头交叉注意力 投影 矩阵乘法 投影 MHA 矩阵乘法 投影 调制后 LMM 首先执行带门控残差连接的多头交叉注意力 调制后 以实现帧级自心-外心软特征对齐,随 MHA 矩阵乘法 投影  g 局部 & 局部 AMU 后通过局部AMU计算调制参数,  全局  其公式可表述如下: 调制参数 {$g', \alpha'_1, \beta'_1,\gamma'_ 1}$, \alpha1 LayerNorm LayerNorm 全局 $\alpha'$ g' 1 $\beta'_1$ 1$\gamma'$    1(  1( $\beta_2$  $\gamma_2$ )  1$\gamma'$ ) $\beta'_1$ (LN($\bar{q}_{gm}$)$W_{lq}$)($q''_f W_{lk}$) ⊤ 缩放 和 平移 缩放 和 平移 前馈网络 \alpha2 前馈网络 \alpha'_1 $A_l= \text{Softmax}(\frac{(LN(\bar{q}_{gm})W_{lq})(q''_f W_{lk})^\top}{\sqrt{d_k}}) q''_f W_{lv}$ (20) 全局调制模块(GMM) 局部调制模块(LMM) ©­ √$d_k$ ª® « ¬ 图3:全局到局部调制模块(GLMM)的示意图。给定重建的外心表示,它 $g' = \text{Sigmoid}(\text{MLP}(A_l))$ $\alpha'_1, \beta'_1, \gamma'_1 = \text{MLP}(\text{SiLU}(A_l))$ (21) 通过交叉注意力和自适应调制单元(AMU)执行从全局到局部级别的特征细化。 $\bar{q}_{lm} = \alpha'_1 \odot \text{MLP}(\text{AdaLN}(g' \odot A_l + \bar{q}_{gm}, \gamma'_1, \beta'_1))$ (22) 其中 $g' \in \mathbb{R}^C$ 表示可学习的门控参数,$\bar{q}_{lm} \in \mathbb{R}^{\bar{T} \times C}$ 表示最终的全局和局部调制特征。 最后,未来的自心3D手部姿态 $\hat{S}_{t+1:t+\bar{T}}$ 和关节有效性 3.4 全局到局部调制模块 掩码 $\hat{V}_{t+1:t+\bar{T}}$ 由一个MLP层联合预测,并使用标准的 在重建双重心外心演示后,我们开发了如图3所示的全局到局部调制模块(GLMM),以 smoothL1和BCE损失进行监督,分别记为 $L_P$ 和 $L_{va}$。总体损失如下: 将不同级别的外心视角引导全面注入到学习到的自心姿态特征中。具体而言,GLMM利用重建的 分层外心表示,以从全局到局部的方式逐步细化学习到的自心特征,并采用 注意力机制和自适应调制单元(AMU)分别进行特征对齐和分布校准。 4 实验 在上述DERM中,我们获得了解码后的姿态查询 $q'_p \in \mathbb{R}^{\bar{T} \times C}$ 以及重建的视频级和分块帧级 4.1 实验设置 外心表示,分别记为 $q''_v \in \mathbb{R}^{1 \times C_v}$ 和 $q''_f \in \mathbb{R}^{\bar{T} \times C_v}$。 首先,我们将 $q''_v$ 视为全局外心引导,它指示整个活动的视频级时间 4.1.1 基准测试。我们在现有的AssemblyHands和Ego-Exo4D基准上评估我们的方法,并进一步构建一个 全新的EgoMe-pose基准进行全面评估。 运动模式。$q''_f$ 包含详细的逐帧空间上下文信息,作为局部外心引导。然后将姿态 查询 $q'_p$ 和全局外心引导 $q''_v$ 输入到全局调制模块(GMM)中。由于 $q''_v$ 是跨 所有帧的聚合表示,GMM直接基于 $q''_v$ 通过自适应 装配Hands [50] 提供了高质量的3D手部注释,基于Assembly101 [63]构建。它包含同步的自心-外心 自适应调制单元(AMU)计算调制参数,通过自适应层归一化(AdaLN)[54]校准特征分布。此外,我们还 多视图视频,并提供3.0M帧(包括490K自心帧)的3D手部姿态注释。此外,我们将注释的视频片段与Assembly101中的文本动作注释相关联,以匹配我们的VL-EHPF任务。最后,我们整理出6120/355/355个活动片段用于训练/验证/测试集。 在AdaLN层中插入一个多头交叉注意力块,以使学习到的自心姿态特征能够关注全局外心 引导,从而捕捉完整活动的长程时间动态。该过程可表述如下: {$\alpha_1, \beta_1, \gamma_1, \alpha_2, \beta_2, \gamma_2$} = GlobalAMU($q''_v$) = MLP(SiLU($q''_v$)) (16) EgoMe-pose 是我们基于最近的EgoMe [59]数据集提出的全新基准。EgoMe包含配对但异步的 $q_{gm} = \text{AdaLN}(q'_p, \gamma_1, \beta_1) = (1 + \gamma_1) \odot \text{LN}(q'_p) + \beta_1$ (17) Exo观察者视频和Ego跟随者视频,时长超过82小时,并带有详细的文本和时间注释。由于缺乏姿态 $(q_{gm} W_{gq})(q''_v W_{gk})^\top$ ! 注释,我们应用自动标注和过滤管道来构建EgoMe-pose基准: $A_g = \alpha_1 \odot \text{Softmax}(\frac{(q_{gm} W_{gq})(q''_v W_{gk})^\top}{\sqrt{d_k}}) q''_v W_{gv} + q'_p$ (18) (1) 数据选择:我们保留正确跟随的自心-外心 $\bar{q}_{gm} = \alpha_2 \odot \text{MLP}(\text{AdaLN}(A_g, \gamma_2, \beta_2))$ (19) 视频对,并排除EgoMe数据集中的错误模仿案例。 其中 $\alpha_1, \beta_1, \gamma_1, \alpha_2, \beta_2, \gamma_2 \in \mathbb{R}^C$ 表示六个调制向量,$\odot$ 表示哈达玛积(Hadamard product),$W_{gq} \in \mathbb{R}^{C \times C}$,$W_{gk} \in \mathbb{R}^{C_v \times C}$,$W_{gv} \in \mathbb{R}^{C_v \times C}$。 (2) 手部检测:在3D手部姿态标注之前,我们首先

表示注意力块中的可学习参数,$d_k$ 是隐藏层大小,$\bar{q}_{gm} \in \mathbb{R}^{\bar{T} \times C}$ 表示全局调制特征。利用现成的手部检测器,设置阈值 $\sigma_d \ge 0.5$,以提取视频帧中手部(或双手)的边界框。

第 6 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦秋,兰晓王,祥李,宏亮李

表1:在AssemblyHands、Ego-Exo4D和新颖的EgoMe-pose基准测试集上的定量结果。

AssemblyHands (15 fps) Ego-Exo4D (30 fps) EgoMe-pose (15 fps) 方法 MPJPE ↓ MPJVE ↓ MPJPE ↓ MPJVE ↓ MPJPE ↓ MPJVE ↓

随机预测 745.35 383.80 736.80 393.63 794.00 397.77 USST [4] 52.58 19.75 63.07 22.99 71.93 73.67 GCBC [40] 45.38 12.13 49.97 21.86 63.43 71.45 MCIL [41] 42.58 11.05 47.17 17.53 62.81 70.48 HULC [45] 41.88 9.75 46.73 17.34 60.81 69.83 GR-1 [76] 40.03 8.69 44.29 16.44 59.10 69.03 AR-VRM [81] 33.39 7.86 44.46 16.33 56.06 67.66 我们的Exo2EgoPose 25.83 6.35 36.44 16.06 49.44 61.03

(3) 手部姿态标注:我们采用InterHand [47] 来估计相对3D手部姿态。然后,我们采用RootNet [46] 来预测手部根节点的绝对深度。此外,我们利用估计的根节点深度和相机焦距对坐标系进行相对到绝对的仿射变换。 (4) 标注过滤:为了确保自动标注的准确性,我们对获得的手部姿态标注进行过滤。具体而言,我们仅保留手部置信度分数 𝜎𝑑≥0.6 且片段中超过95%的帧被有效标注的情况。 我们为训练/验证/测试集精心整理了6067/1344/2648个片段。 随机预测基线(第一行)相比,所有其他方法都实现了更低的误差值,显示出它们适用于VL-EHPF任务。值得注意的是,我们的Exo2EgoPose框架在所有基准测试上都显著优于其他相关方法。具体而言,与USST [4]、GCBC [40]、MCIL [41] 和 HULC [45] 方法相比,我们的方法在MPJPE上实现了超过10的显著降低。GR-1 [76] 是一种开创性方法,它利用Ego4D [13] 数据集中的大规模视频进行生成式预训练。然而,与GR-1相比,我们的方法在AssemblyHands上将MPJPE/MPJVE降低了14.20/2.34,在Ego-Exo4D上降低了7.85/0.38,在EgoMe-pose上降低了9.66/8.00。此外,我们还通过引入外心(Exo)数据进行后续的类比推理来扩展AR-VRM [81],从而实现了高性能。尽管如此,Exo2EgoPose在AssemblyHands上以7.56 MPJPE和1.51 MPJVE的优势超越它,在Ego-Exo4D上以8.02 MPJPE和0.27 MPJVE的优势超越它,在我们的EgoMe-pose上以6.62 MPJPE和6.63 MPJVE的优势超越它。上述结果证明了我们的Exo2EgoPose的有效性,它执行双重心外心重建,并从全局到局部水平调制学习到的自心(Ego)特征。

4.1.2 评估指标。遵循常见设置 [6, 16],我们采用平均每关节位置误差(MPJPE)和平均每关节速度误差(MPJVE)指标,单位为毫米(mm)。具体而言,MPJPE计算根对齐后每个预测关节与真实关节之间的欧几里得距离(ED),这衡量了根相对关节位置的准确性。MPJVE通过评估关节速度来衡量手部运动的时间特性。它计算预测关节位移与真实关节位移之间的ED。

4.1.3 实现细节。我们使用预训练CLIP (ViT-B/32) [61] 的文本分支作为文本编码器,并采用双编码器(即预训练的MAE [17] 和 DINOv2 [52])处理输入帧。对于手部姿态状态,我们采用可训练的手部编码器HandFormer [64]。此外,我们使用随机初始化的12层Transformer,具有因果注意力机制 [62] 作为我们的多模态Transformer架构,dropout设置为0.1。特征维度 𝐶𝑣、𝐶𝑙 和 𝐶𝑝 分别为768、512和384。隐藏层大小 𝐶 设置为384。视频和手部姿态的采样率对于AssemblyHand和EgoMe-pose为15 fps,对于Ego-Exo4D为30 fps,视觉帧被调整为224 × 224。视觉令牌的数量为 𝑁𝑀=𝑁𝐷=196,重采样为 𝑁=9。序列长度 𝑇′max 和 ¯𝑇 均设置为10。平衡系数 𝜆𝑃、𝜆𝑣𝑎、𝜆𝐸、𝜆𝑉 和 𝜆𝐹 分别设置为3e3、1.0、1.0、1.0和0.1。对于训练,参数由AdamW [38] 优化,权重衰减为1e-4,批量大小设置为48。 epoch数量设置为20,包含预热epoch,并应用从1e-4到5e-6的余弦学习率衰减策略。

4.2 与最先进方法的比较 由于VL-EHPF任务侧重于基于多模态输入推断未来的细粒度动作,因此它比单模态粗粒度自心(Ego)运动预测更好地与VRM/VLA范式对齐。因此,我们主要将我们的Exo2EgoPose与最先进的VRM/VLA方法(即GCBC [40]、MCIL [41]、HULC [45]、GR-1 [76]、AR-VRM [81])进行比较,并额外包括一种代表性的3D手部轨迹预测方法(即USST [4]),以便在表1中进行全面比较。我们基于官方发布的代码重新实现了这些方法,并应用与我们方法相同的骨干网络 [17, 52, 61, 62, 64] 以确保公平比较。我们在AssemblyHands、Ego-Exo4D和我们新构建的EgoMe-pose基准测试上评估了上述方法,并在表1中报告了MPJPE和MPJVE指标。

4.3 消融实验 在表2中,我们进行了详细的消融实验,以分析我们Exo2EgoPose框架中关键组件的有效性。在第二行中,我们将提出的GMM和LMM替换为普通的Transformer层,导致MPJPE上升1.07,MPJVE增加0.28,这显示了基于交叉注意力和自适应调制设计的GMM和LMM的优势。在第三行中,我们移除了全局调制模块(GMM),导致性能下降1.66 MPJPE和0.27 MPJVE。我们在第四行中移除了局部调制模块(LMM),导致1.89 MPJPE和0.19 MPJVE的性能退化。上述结果展示了GMM和LMM各自的有效性,并进一步验证了GMM在捕捉

第 7 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 会议缩写 ’XX,2018年6月03–05日,纽约伍德斯托克

指令:用右手拉开背包的拉链。 指令:用双手拿起绿色桌子上白色的手表。

GR-1 GR-1

AR-VRM AR-VRM

Ours Ours

GT GT

图4:我们提出的Exo2EgoPose及对比方法预测的自心3D手部姿态结果(为简洁起见进行了下采样)。

表2:AssemblyHands数据集验证集上的消融实验结果。“VER”和“CFER”分别表示视频级和分块帧级的外心重建。“T”表示用普通Transformer层替换GMM和LMM。

GMM LMM VER CFER MPJPE ↓ MPJVE ↓ ✓ ✓ ✓ ✓ 25.37 6.29 T T ✓ ✓ 26.44 6.57 ✓ ✓ ✓ 27.03 6.56 ✓ ✓ ✓ 27.26 6.48 图5:超参数 𝜆𝑉 和 𝜆𝐹 的敏感性分析。 ✓ ✓ 30.11 7.76 ✓ 32.94 8.07 ✓ 33.22 8.06 39.70 8.87 关节投影到2D帧中,并执行线性缩放和对齐,时间步长为2,以便更好地可视化。在左侧示例中, 主体正准备“用右手拉开背包的拉链”。第一行的GR-1未能生成合理的手 temporal motion trends (evidenced by MPJVE), while LMM yields 部结构。在第二行中,虽然AR-VRM大致建模了手部结构,但手部朝向和细节 greater improvements in the spatial absolute positions (evidenced 姿态存在严重错误,表明它未能理解“拉 by MPJPE). Then, we remove the GMM and LMM simultaneously 拉链”这一过程。相比之下,我们的Exo2EgoPose正确理解了这一 (i.e., the entire GLMM) in the fifth row, which causes a remarkable 过程,并精确预测了细粒度的手部动作。右侧示例更具挑战性,需要 performance decline of 4.74 MPJPE and 1.47 MPJVE, demonstrating 双手抓取桌上的手表。尽管GR-1区分了左手和 the effectiveness of the proposed GLMM in feature alignment and 右手,但它仍难以建模各自的手部结构。AR-VRM显示出轻微改进,形成了基本的手 distribution calibration to progressively inject the Exo guidance 部形状。然而,其预测的关节位置和运动仍然 into the learned Ego features for accurate hand pose forecasting. 与真实值存在显著偏差。最后,我们的方法准确预测了手部姿态,包括 Next, we disable the video-level Exo reconstruction in the sixth 抓取过程中右手的收缩过程。上述定性结果进一步 row, and the corresponding errors rise significantly by 2.83 MPJPE 验证了我们方法的有效性,该方法结合了 and 0.31 MPJVE compared with those in the fifth row. Meanwhile, 外心演示视频,并利用重建的外心表示作为指导来调制学习到的自心特征。 in the seventh row, we discard the chunked frame-level Exo recon- 4.4.2 超参数敏感性分析。在图5中,我们在AssemblyHands上对 𝜆𝑉 和 𝜆𝐹 进行了 struction, leading to a performance drop of 3.11 MPJPE and 0.30 敏感性分析,以评估DERM的鲁棒性。具体而言,我们将 𝜆𝑉 设置在0.5到2.5之间,而 𝜆𝐹 从0.05到0.25。结果表明,模型对 𝜆𝑉 和 𝜆𝐹 的变化具有鲁棒性,即MPJPE和MPJVE指标仅在1.26和0.27的小范围内波动。最后,当 𝜆𝑉 = 1.0 且 𝜆𝐹 = 0.1 时,我们的方法产生了最低的MPJPE 25.37和MPJVE 6.29。这些结果验证了 MPJVE. The above results indicate the effectiveness of reconstruct- 上述定性结果进一步验证了我们方法的有效性,该方法结合了 ing Exo demonstrations at video- and chunked frame-level, even 外心演示视频,并利用重建的外心表示作为指导来调制学习到的自心特征。 though the Exo information does not serve as guidance for feature 4.4.2 超参数敏感性分析。在图5中,我们在AssemblyHands上对 𝜆𝑉 和 𝜆𝐹 进行了 modulation. Moreover, we completely remove Exo demonstrations 敏感性分析,以评估DERM的鲁棒性。具体而言,我们将 𝜆𝑉 设置在0.5到2.5之间,而 𝜆𝐹 从0.05到0.25。结果表明,模型对 𝜆𝑉 和 𝜆𝐹 的变化具有鲁棒性,即MPJPE和MPJVE指标仅在1.26和0.27的小范围内波动。最后,当 𝜆𝑉 = 1.0 且 𝜆𝐹 = 0.1 时,我们的方法产生了最低的MPJPE 25.37和MPJVE 6.29。这些结果验证了 in the last row, which causes severe performance degradation of 9.59 in MPJPE and 1.11 in MPJVE. It further emphasizes the neces- 4.4.2 超参数敏感性分析。在图5中,我们在AssemblyHands上对 𝜆𝑉 和 𝜆𝐹 进行了 sity of introducing Exo demonstrations, which facilitate modeling 敏感性分析,以评估DERM的鲁棒性。具体而言,我们将 𝜆𝑉 设置在0.5到2.5之间,而 𝜆𝐹 从0.05到0.25。结果表明,模型对 𝜆𝑉 和 𝜆𝐹 的变化具有鲁棒性,即MPJPE和MPJVE指标仅在1.26和0.27的小范围内波动。最后,当 𝜆𝑉 = 1.0 且 𝜆𝐹 = 0.1 时,我们的方法产生了最低的MPJPE 25.37和MPJVE 6.29。这些结果验证了 complex spatial contexts and temporal dynamics for the Ego cues. 了我们的方法的有效性,该方法结合了外心演示视频,并利用重建的外心表示作为指导来调制学习到的自心特征。 4.4 深入分析 4.4.1 定性结果分析。在图4中,我们展示了两个示例,包括我们提出的Exo2EgoPose以及两种近期方法[76, 81]预测的自心3D手部姿态。具体而言,我们将3D手部

第 8 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦秋,兰晓王,祥李,和宏亮李

初始特征 全局调制 全局与局部调制 表4:在CALVIN基准测试的ABC→D设置下,分析人类到机器人的迁移能力。 “Avg.L.”表示序列中成功完成任务的平均长度, “Avg.R.”代表平均成功率。

连续完成的任务数 方法 Avg.L. Avg.R. 1 2 3 4 5

MCIL [41] 0.304 0.013 0.002 0.000 0.000 0.31 6.4% RT-1 [5] 0.533 0.222 0.094 0.038 0.013 0.90 18.0%图6:不同阶段解码的姿态查询的表示分布可视化, HULC [45] 0.418 0.165 0.057 0.019 0.011 0.67 13.4% 全局Exo引导, MT-R3M [48] 0.529 0.234 0.105 0.043 0.018 0.93 18.6% 以及局部Exo引导(建议以彩色查看)。 GR-1 [76] 0.854 0.712 0.596 0.497 0.401 3.06 61.2% AR-VRM [81] 0.901 0.759 0.642 0.531 0.461 3.29 65.9% 表3:基线模型及我们Exo2EgoPose关键组件的推理FLOPs和参数量。

基线 GMM LMM VER CFER 第二和第三列,我们报告了GMM和LMM的计算复 杂度和参数量,它们主要由MLP、AdaLN和交叉注意力层组成,仅 FLOPs (G) 802.100 0.254 0.354 0.006 0.062 引入0.254和0.354 GFLOPs以及2.069和1.774 M参 #Params (M) 236.678 2.069 1.774 0.296 0.296 数。此外,对于视频级和分块帧级Exo重建(VER和CFER),我们只需 在推理期间为Transformer推理初始化额外的查询序列和投影层。因此,它们引入了 我们DERM的有效性,它在广泛的超参数设置下始终保持高性能。 可忽略的计算复杂度和参数开销(即VER为0.006 GFLOPs和0.296 M参数,CFER为0.062 GFLOPs 4.4.3 特征调制分析。为了直观地可视化渐进式全局到局部特征调制过程,我们使用t- 和0.296 M参数)。考虑到显著的性能提升,关键组件引入的额外计算和参数 SNE [73] 将不同阶段的解码姿态查询、全局和局部级别的Exo表示投影到图6中的2D平面上。 开销是微不足道的。 在第一列中,我们可视化了初始解码姿态查询、全局和局部Exo引导的表示,以及t-SNE 4.4.5 人类到机器人迁移分析。我们观察到,Ego 结果显示初始表示呈现出显著不同的分布。在第二列中,我们可视化了经过全局级别特征调制后的姿态 3D手部姿态可以作为连接人类动作和机器人操作的天然且显式的统一表示。因此, 查询。结果显示,姿态查询的特征簇与全局Exo 我们在具有挑战性的ABC→D(即模型在A、B和C场景上训练,并在未见过的场景D上评估) 引导紧密融合,这表明全局级别调制(即GMM)有效地根据重建的 设置在机器人CALVIN基准测试上评估了我们Exo2EgoPose的人类 视频级Exo表示调整了学习到的姿态特征的分布。最后,在第三列中,我们 到机器人的能力。具体而言,我们利用预训练的Exo2EgoPose模型作为教师网络,并通过在 可视化了经过全局和局部调制的特征。结果显示,这三个组件的特征簇紧密 多模态Transformer的表示上引入蒸馏损失来微调学生策略网络[76],从而将知识从人类Ego姿态转移到机器人任务执行中。 融合,这表明局部级别调制(即LMM)进一步将细粒度的分块帧级Exo引导 如表4所示,我们的方法在机器人任务中表现出令人印象深刻的 知识注入到经过全局调制的姿态查询中。这些 能力。具体而言,与其他的 可视化结果验证了所提出的GLMM(包括 最先进方法相比,我们的方法在长度为2到5的任务序列上实现了更高的成功率,证明了其长视域任务完 GMM和LMM)有效地对基于重建的分层Exo表示的学习到的Ego姿态特征进行特征对齐和分 成能力。此外,我们的方法产生了最高的平均成功长度和成功率,优于排名第二的AR- 布校准,从而促进后续的Ego 3D手部姿态预测。 1.6%的成功率和0.09的成功完成任务长度。上述结果验证了利用Exo-view演示进行准确的Ego 3D人类手部姿态 4.4.4 模型复杂度分析。我们在表3中进行实验以评估基线模型及我们Exo2EgoPose关键组件的计算复杂度和参数开销。我们将所有新提出的模块从Exo2EgoPose中移除作为基线模型,其推理计算复杂度为802.100 GFLOPs,参数量为236.678 M。相比之下,提出的关键组件(即GMM、LMM、VER和CFER)表现出显著的效率。详细来说,在预测提供了高度信息丰富且可迁移的表示,这些表示在零样本和长视域设置下有效地促进了下游机器人操作任务。

5 结论 在本文中,我们研究了尚未充分探索的视觉语言引导的自心3D手部姿态预测(VL-EHPF)任务,该

第 9 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 Conference acronym ’XX, June 03–05, 2018, Woodstock, NY

旨在基于多模态线索(即视觉观察、语言指令和姿态状态)预测自心(Ego)视角下的3D手部姿态。为了克服视野有限和动态运动带来的挑战,我们创新性地引入了外心(Exo)视角演示,并提出了 Exo2EgoPose 框架。该框架首先通过双重心外心重建模块(DERM)在视频和帧级别重建外心表示,从而对空间上下文和时间动态进行建模。此外,全局到局部调制模块(GLMM)利用这些重建的表示进行渐进式特征细化,为准确预测提供全面的外心引导。在 AssemblyHands、Ego-Exo4D、全新的 EgoMe-pose 以及机器人 CALVIN 基准上的大量实验证明了我们要方法的优越性。

参考文献 [1] Hiroyasu Akada, Jian Wang, Vladislav Golyanik, and Christian Theobalt. 2025. Bring your rear cameras for egocentric 3d human pose estimation. In Proceedings of the IEEE/CVF International Conference on Computer Vision. 9497–9507. [2] Shervin Ardeshir and Ali Borji. 2018. An exocentric look at egocentric actions and vice versa. Computer Vision and Image Understanding 171 (2018), 61–68. [3] Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon, Shreyas Hampali, Shangchen Han, Fan Zhang, Linguang Zhang, Jade Fountain, Edward Miller, Selen Basol, et al. 2025. Hot3d: Hand and object tracking in 3d from egocentric multi-view videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 7061–7071. [4] Wentao Bao, Lele Chen, Libing Zeng, Zhong Li, Yi Xu, Junsong Yuan, and Yu Kong. 2023. Uncertainty-aware state space transformer for egocentric 3d hand trajectory forecasting. In Proceedings of the IEEE/CVF international conference on computer vision. 13702–13711. [5] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, et al. 2022. Rt-1: Robotics transformer for real-world control at scale. arXiv preprint arXiv:2212.06817 (2022). [6] Lu Chen, Yizhou Wang, Shixiang Tang, Qianhong Ma, Tong He, Wanli Ouyang, Xiaowei Zhou, Hujun Bao, and Sida Peng. 2025. EgoAgent: a joint predictive agent model in egocentric worlds. In Proceedings of the IEEE/CVF International Conference on Computer Vision. 6970–6980. [7] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Antonino Furnari, Evangelos Kazakos, Jian Ma, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, et al. 2022. Rescaling egocentric vision: Collection, pipeline and challenges for epic-kitchens-100. International Journal of Computer Vision 130, 1 (2022), 33–55. [8] Fernando De la Torre, Jessica Hodgins, Adam Bargteil, Xavier Martin, Justin Macey, Alex Collado, and Pep Beltran. 2009. Guide to the carnegie mellon university multimodal activity (cmu-mmac) database. (2009). [9] Jiale Dong, Weiyong Si, and Chenguang Yang. 2023. A novel human-robot skill transfer method for contact-rich manipulation task. Robotic Intelligence and Automation 43, 3 (2023), 327–337. [10] Huiyu Duan, Wei Shen, Xiongkuo Min, Danyang Tu, Jing Li, and Guangtao Zhai. 2022. Saliency in augmented reality. In Proceedings of the 30th ACM international conference on multimedia. 6549–6558. [11] Jiafei Duan, Samson Yu, Hui Li Tan, Hongyuan Zhu, and Cheston Tan. 2022. A survey of embodied ai: From simulators to research tasks. IEEE Transactions on Emerging Topics in Computational Intelligence 6, 2 (2022), 230–244. [12] Jakob Engel, Kiran Somasundaram, Michael Goesele, Albert Sun, Alexander Gamino, Andrew Turner, Arjang Talattof, Arnie Yuan, Bilal Souti, Brighid Meredith, et al. 2023. Project aria: A new tool for egocentric multi-modal ai research. arXiv preprint arXiv:2308.13561 (2023). [13] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, et al. 2022. Ego4d: Around the world in 3,000 hours of egocentric video. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 18995–19012. [14] Kristen Grauman, Andrew Westbury, Lorenzo Torresani, Kris Kitani, Jitendra Malik, Triantafyllos Afouras, Kumar Ashutosh, Vijay Baiyya, Siddhant Bansal, Bikram Boote, et al. 2024. Ego-exo4d: Understanding skilled human activity from first- and third-person perspectives. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 19383–19400. [16] Masashi Hatano, Zhifan Zhu, Hideo Saito, and Dima Damen. 2025. The invisible egohand: 3d hand forecasting through egobody pose estimation. arXiv preprint arXiv:2504.08654 (2025). [17] Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, and Ross Girshick. 2022. Masked autoencoders are scalable vision learners. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 16000–16009. [18] Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in neural information processing systems 33 (2020), 6840–6851. [19] Sihong Huang, Jiaxin Wu, Xiaoyong Wei, Yi Cai, Dongmei Jiang, and Yaowei Wang. 2025. Sound Bridge: Associating Egocentric and Exocentric Videos via Audio Cues. In Proceedings of the Computer Vision and Pattern Recognition Conference. 28942–28951. [20] Yifei Huang, Guo Chen, Jilan Xu, Mingfang Zhang, Lijin Yang, Baoqi Pei, Hongjie Zhang, Lu Dong, Yali Wang, Limin Wang, et al. 2024. Egoexolearn: A dataset for bridging asynchronous ego-and exo-centric view of procedural activities in real world. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 22072–22086. [21] Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang, Hengyuan Zhang, Pengwei Wang, Mengdi Zhao, Yao Mu, Pengju An, et al. 2025. Robobrain: A unified brain of the model for robotic manipulation from abstract to concrete. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 1724–1734. [22] Baoxiong Jia, Yixin Chen, Siyuan Huang, Yixin Zhu, and Song-Chun Zhu. 2020. Lemma: A multi-view dataset for learning multi-agent multi-task activities. In European Conference on Computer Vision. Springer, 767–786. [23] Suhas Kadalagere Sampath, Ning Wang, Hao Wu, and Chenguang Yang. 2023. Review on human-like robot manipulation using dexterous hands. Cognitive Computation and Systems 5, 1 (2023), 14–29. [24] Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, et al. 2024. Openvla: An open-source vision-language-action model. arXiv preprint arXiv:2406.09246 (2024). [25] Thomas Kosch, Jakob Karolus, Johannes Zagermann, Harald Reiterer, Albrecht Schmidt, and Paweł W Woźniak. 2023. A survey on measuring cognitive workload in human-computer interaction. Comput. Surveys 55, 13s (2023), 1–39. [26] Taein Kwon, Bugra Tekin, Jan Stühmer, Federica Bogo, and Marc Pollefeys. 2021. H2o: Two hands manipulating objects for first person interaction recognition. In Proceedings of the IEEE/CVF international conference on computer vision. 10138–10148. [27] Regina Kyung-Jin Lee, Hao Zheng, and Yuqian Lu. 2024. Human-robot shared assembly taxonomy: A step toward seamless human-robot knowledge transfer. Robotics and Computer-Integrated Manufacturing 86 (2024), 102686. [28] Gaofeng Li, Ruize Wang, Peisen Xu, Qi Ye, and Jiming Chen. 2025. The developments and challenges towards dexterous and embodied robotic manipulation: A survey. arXiv preprint arXiv:2507.11840 (2025). [29] Jiehao Li, Junzheng Wang, Shoukun Wang, and Chenguang Yang. 2023. Human–robot skill transmission for mobile robot via learning by demonstration. Neural Computing and Applications 35, 32 (2023), 23441–23451. [30] Yanghao Li, Tushar Nagarajan, Bo Xiong, and Kristen Grauman. 2021. Ego-exo: Transferring visual representations from third-person to first-person videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 6943–6953. [31] Yuan-Ming Li, Wei-Jin Huang, An-Lan Wang, Ling-An Zeng, Jing-Ke Meng, and Wei-Shi Zheng. 2024. Egoexo-fitness: Towards egocentric and exocentric full-body action understanding. In European Conference on Computer Vision. Springer, 363–382. [32] Nie Lin, Takehiko Ohkawa, Yifei Huang, Mingfang Zhang, Minjie Cai, Ming Li, Ryosuke Furuta, and Yoichi Sato. 2025. Simhand: Mining similar hands for large-scale 3d hand pose pre-training. arXiv preprint arXiv:2502.15251 (2025). [33] Gaowen Liu, Hao Tang, Hugo Latapie, and Yan Yan. 2020. Exocentric to egocentric image generation via parallel generative adversarial network. In ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 1843–1847. [34] Jia-Wei Liu, Weijia Mao, Zhongcong Xu, Jussi Keppo, and Mike Zheng Shou. 2024. Exocentric-to-egocentric video generation. Advances in Neural Information Processing Systems 37 (2024), 136149–136172. [35] Ruicong Liu, Yifei Huang, Liangyang Ouyang, Caixin Kang, and Yoichi Sato. 2025. SFHand: A Streaming Framework for Language-guided 3D Hand Forecasting and Embodied Manipulation. arXiv preprint arXiv:2511.18127 (2025). [36] Ruicong Liu, Takehiko Ohkawa, Mingfang Zhang, and Yoichi Sato. 2024. Single-to-dual-view adaptation for egocentric 3d hand pose estimation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 677–686. [37] Shaowei Liu, Subarna Tripathi, Somdeb Majumdar, and Xiaolong Wang. 2022. Joint hand motion and interaction hotspots prediction from egocentric videos. In

[15] Wen Guo, Yuming Du, Xi Shen, Vincent Lepetit, Xavier Alameda-Pineda, Francesc Moreno-Noguer. 2023. Back to mlp: A simple baseline for human motion prediction. In Proceedings of the IEEE/CVF winter conference on applications of computer vision. 4809–4819.

[38] Ilya Loshchilov and Frank Hutter. 2017. Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017).

第 10 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,秋鹤千,王兰晓,李翔,李宏亮

[39] Mi Luo, Zihui Xue, Alex Dimakis, 和 Kristen Grauman。2025。视角罗塞塔石碑:解锁非配对自心-外心视频以实现视角不变表示学习。在计算机视觉与模式识别会议论文集。15802–15812。 [40] Corey Lynch, Mohi Khansari, Ted Xiao, Vikash Kumar, Jonathan Tompson, Sergey Levine, 和 Pierre Sermanet。2020。从玩耍中学习潜在计划。在机器人学习会议论文集。Pmlr, 1113–1132。 [41] Corey Lynch 和 Pierre Sermanet。2020。基于非结构化数据的语言条件模仿学习。arXiv 预印本 arXiv:2005.07648 (2020)。 [42] Junyi Ma, Xieyuanli Chen, Wentao Bao, Jingyi Xu, 和 Hesheng Wang。2025。Madiff:用于自心视频手部轨迹预测的运动感知 Mamba 扩散模型。IEEE 模式分析与机器智能汇刊 (2025)。 [43] Debapriya Maji, Soyeb Nagori, Manu Mathew, 和 Deepak Poddar。2022。Yolo-pose:利用对象关键点相似度损失增强 YOLO 以进行多人姿态估计。在 IEEE/CVF 计算机视觉与模式识别会议论文集。2637–2646。 [44] James L McClelland。2022。使用深度神经网络捕捉高级人类认知能力。认知科学趋势 26, 12 (2022), 1047–1050。 [45] Oier Mees, Lukas Hermann, 和 Wolfram Burgard。2022。在非结构化数据的语言条件机器人模仿学习中什么很重要。IEEE 机器人与自动化快报 7, 4 (2022), 11205–11212。 [46] Gyeongsik Moon, Juyong Chang, 和 Kyoung Mu Lee。2019。基于单张 RGB 图像的 3D 多人姿态估计的相机距离感知自顶向下方法。在 IEEE 国际计算机视觉会议 (ICCV) 论文集。 [47] Gyeongsik Moon, Shoou-I Yu, He Wen, Takaaki Shiratori, 和 Kyoung Mu Lee。2020。Interhand2.6m:来自单张 RGB 图像的 3D 交互手部姿态估计的数据集与基线。在欧洲计算机视觉会议论文集。Springer, 548–564。 [48] Suraj Nair, Aravind Rajeswaran, Vikash Kumar, Chelsea Finn, 和 Abhinav Gupta。2022。R3m:用于机器人操作的通用视觉表示。arXiv 预印本 arXiv:2203.12601 (2022)。 [49] Dantong Niu, Yuvan Sharma, Haoru Xue, Giscard Biamby, Junyi Zhang, Ziteng Ji, Trevor Darrell, 和 Roei Herzig。2025。使用 4D 表示预训练自回归机器人模型。arXiv 预印本 arXiv:2502.13142 (2025)。 [50] Takehiko Ohkawa, Kun He, Fadime Sener, Tomas Hodan, Luan Tran, 和 Cem Keskin。2023。Assemblyhands:通过 3D 手部姿态估计实现自心活动理解。在 IEEE/CVF 计算机视觉与模式识别会议论文集。12999–13008。 [51] Takehiko Ohkawa, Takuma Yagi, Taichi Nishimura, Ryosuke Furuta, Atsushi Hashimoto, Yoshitaka Ushiku, 和 Yoichi Sato。2025。Exo2egodvc:使用网络教学视频对自心程序性活动进行密集视频描述。在 2025 IEEE/CVF 计算机视觉应用冬季会议 (WACV) 论文集。IEEE, 8324–8335。 [52] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, 等。2023。Dinov2:无监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193 (2023)。 [53] Georgios Pavlakos, Dandan Shan, Ilija Radosavovic, Angjoo Kanazawa, David Fouhey, 和 Jitendra Malik。2024。使用变换器重建 3D 手部。在 IEEE/CVF 计算机视觉与模式识别会议论文集。9826–9836。 [54] William Peebles 和 Saining Xie。2023。可扩展的基于变换器的扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集。4195–4205。 [55] Siyou Pei, Alexander Chen, Jaewook Lee, 和 Yang Zhang。2022。手部接口:在 AR/VR 中使用手部模仿物体以实现表达性交互。在 2022 CHI 人机因素会议论文集。1–16。 [56] Aditya Prakash, Ruisen Tu, Matthew Chang, 和 Saurabh Gupta。2024。日常自心图像中的 3D 手部姿态估计。在欧洲计算机视觉会议论文集。Springer, 183–202。 [57] Chenghao Qi, Heqian Qiu, Zhaofeng Shi, Lanxiao Wang, Hanwen Zhang, Xinyu Chen, 和 Hongliang Li。2025。D3Net:用于持续自心学习中自适应融合的双路径解耦-蒸馏。在 2025 IEEE 多媒体信号处理国际研讨会 (MMSP) 论文集。IEEE, 156–161。 [58] Xun Qian, Fengming He, Xiyun Hu, Tianyi Wang, 和 Karthik Ramani。2022。Arnnotate:一种增强现实界面,用于收集自定义 3D 手-物交互姿态估计数据集。在 ACM 用户界面软件与技术年度研讨会论文集。1–14。 [59] (注:原文此处缺失编号59,直接跳至60或为排版错误,按原文顺序翻译) [60] (注:原文此处缺失编号60,直接跳至61或为排版错误,按原文顺序翻译) [61] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等。2021。从自然语言监督中学习可迁移视觉模型。在国际机器学习会议论文集。PmLR, 8748–8763。 [62] Alec Radford, Jeffrey Wu, Rewon Child, David Luan, Dario Amodei, Ilya Sutskever, 等。2019。语言模型是无监督的多任务学习者。OpenAI 博客 1, 8 (2019), 9。 [63] Fadime Sener, Dibyadip Chatterjee, Daniel Shelepov, Kun He, Dipika Singhania, Robert Wang, 和 Angela Yao。2022。Assembly101:用于理解程序性活动的大规模多视图视频数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集。21096–21106。 [64] Md Salman Shamil, Dibyadip Chatterjee, Fadime Sener, Shugao Ma, 和 Angela Yao。2024。关于 3D 手部姿态在动作识别中效用性的研究。在欧洲计算机视觉会议论文集。Springer, 436–454。 [65] Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Fanman Meng, Qingbo Wu, 和 Hongliang Li。2024。用于文本监督自心语义分割的认知转移与解耦。IEEE 电路与系统视频技术汇刊 (2024)。 [66] Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, 和 Hongliang Li。2025。通过注视共识自适应实现无监督自心与外心密集程序性活动描述。在 ACM 第33届国际多媒体会议论文集。3731–3740。 [67] Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, Lili Pan, 和 Hongliang Li。2026。通过多标签原型生长与双线索一致性实现测试时自心-外心动作 anticipation 适应。arXiv 预印本 arXiv:2603.09798 (2026)。 [68] Zhaofeng Shi, Qingbo Wu, Hongliang Li, Fanman Meng, 和 King Ngi Ngan。2023。用于指代图像分割的双图层次交互网络。Displays 80 (2023), 102575。 [69] Zhaofeng Shi, Qingbo Wu, Fanman Meng, Linfeng Xu, 和 Hongliang Li。2024。跨模态认知共识引导的音频-视觉分割。IEEE 多媒体汇刊 27 (2024), 209–223。 [70] Gunnar A Sigurdsson, Abhinav Gupta, Cordelia Schmid, Ali Farhadi, 和 Karteek Alahari。2018。Charades-ego:大规模配对第三视角与第一视角视频数据集。arXiv 预印本 arXiv:1804.09626 (2018)。 [71] Tomas Simon, Hanbyul Joo, Iain Matthews, 和 Yaser Sheikh。2017。使用多视图引导在单张图像中进行手部关键点检测。在 IEEE 计算机视觉与模式识别会议论文集。1145–1153。 [72] Ke Sun, Bin Xiao, Dong Liu, 和 Jingdong Wang。2019。用于人体姿态估计的深度高分辨率表示学习。在 IEEE/CVF 计算机视觉与模式识别会议论文集。5693–5703。 [73] Laurens Van der Maaten 和 Geoffrey Hinton。2008。使用 t-SNE 可视化数据。机器学习研究期刊 9, 11 (2008)。 [74] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, 和 Illia Polosukhin。2017。注意力即所需。神经信息处理系统进展 30 (2017)。 [75] Jian Wang, Diogo Luvizon, Weipeng Xu, Lingjie Liu, Kripasindhu Sarkar, 和 Christian Theobalt。2023。场景感知的自心 3D 人体姿态估计。在 IEEE/CVF 计算机视觉与模式识别会议论文集。13031–13040。 [76] Hongtao Wu, Ya Jing, Chilam Cheang, Guangzeng Chen, Jiafeng Xu, Xinghang Li, Minghuan Liu, Hang Li, 和 Tao Kong。[n. d.]。释放大规模视频生成预训练以用于视觉机器人操作。在第十二届国际学习表征会议论文集。 [77] Bin Xiao, Haiping Wu, 和 Yichen Wei。2018。人体姿态估计与跟踪的简单基线。在欧洲计算机视觉会议 (ECCV) 论文集。466–481。 [78] Jilan Xu, Yifei Huang, Junlin Hou, Guo Chen, Yuejie Zhang, Rui Feng, 和 Weidi Xie。2024。检索增强的自心视频描述。在 IEEE/CVF 计算机视觉与模式识别会议论文集。13525–13536。 [79] Yufei Xu, Jing Zhang, Qiming Zhang, 和 Dacheng Tao。2022。Vitpose:用于人体姿态估计的简单视觉 Transformer 基线。神经信息处理系统进展 35 (2022), 38571–38584。 [80] Zihui Sherry Xue 和 Kristen Grauman。2023。通过时间对齐从非配对自心-外心视频中学习细粒度视角不变表示。神经信息处理系统进展 36 (2023), 53688–53710。 [81] Dejie Yang, Zijing Zhao, 和 Yang Liu。2025。Ar-vrm:通过类比推理模仿人类动作以进行视觉机器人操作。在 IEEE/CVF 国际计算机视觉会议论文集。6818–6827。 [82] Ruihan Yang, Qinxi Yu, Yecheng Wu, Rui Yan, Borui Li, An-Chieh Cheng, Xueyan

[59] Heqian Qiu, Zhaofeng Shi, Lanxiao Wang, Huiyu Xiong, Xiang Li, Hongliang Zou, Yunhao Fang, Xuxin Cheng, Ri-Zhao Qiu, et al. 2025. Egovla: Learning vision-language-action models from egocentric human videos. arXiv preprint arXiv:2501.19061 (2025).

[60] Camillo Quattrocchi, Antonino Furnari, Daniele Di Mauro, Mario Valerio Giuffrida, and Giovanni Maria Farinella. 2024. Synchronization is all you need: Exocentric-to-egocentric transfer for temporal action segmentation with unlabeled synchronized video pairs. In European Conference on Computer Vision. Springer, 253–270.

[83] Tomoya Yoshida, Shuhei Kurita, Taichi Nishimura, and Shinsuke Mori. 2025. Developing vision-language-action model from egocentric videos. arXiv preprint arXiv:2509.21986 (2025).

[84] Yifu Yuan, Haiqin Cui, Yaoting Huang, Yibin Chen, Fei Ni, Zibin Dong, Pengyi Li, Yan Zheng, and Jianye Hao. 2025. Embodied-r1: Reinforced embodied reasoning

第 11 页

用于通用机器人操作。arXiv 预印本 arXiv:2508.13998 (2025)。

[85] Haoyu Zhang, Qiaohui Chu, Meng Liu, Yunxiao Wang, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Yaowei Wang, 和 Liqiang Nie。2025。Exo2ego:由外心知识引导的多模态大语言模型用于自心视频理解。arXiv 预印本 arXiv:2503.09143 (2025)。

[86] Zhipeng Zhang, Zhimin Wei, Guolei Sun, Peng Wang, 和 Luc Van Gool。2024。基于具身描述的自解释性功能学习。arXiv 预印本 arXiv:2404.05603 (2024)。

[87] Ruijie Zheng, Dantong Niu, Yuqi Xie, Jing Wang, Mengda Xu, Yunfan Jiang, Fernando Castañeda, Fengyuan Hu, You Liang Tan, Letian Fu, 等人。2026。EgoScale:利用多样化的自心人类数据扩展灵巧操作。arXiv 预印本 arXiv:2602.16710 (2026)。

[88] Jiaming Zhou, Teli Ma, Kun-Yu Lin, Zifan Wang, Ronghe Qiu, 和 Junwei Liang。2025。缓解机器人操作中视觉预训练的人机领域差异。在计算机视觉与模式识别会议论文集 (Proceedings of the computer vision and pattern recognition conference) 中。22551–22561。

[89] Brianna Zitkovich, Tianhe Yu, Sichun Xu, Peng Xu, Ted Xiao, Fei Xia, Jialin Wu, Paul Wohlhart, Stefan Welker, Ayzaan Wahid, 等人。2023。Rt-2:视觉-语言-动作模型将网络知识迁移至机器人控制。在机器人学习会议 (Conference on Robot Learning) 中。PMLR,2165–2183。

第 12 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦邱,兰晓王,祥李,宏亮李

A 最先进方法的详细信息 该任务的高级策略。我们在提议分布和识别分布之间应用KL散度,以将当前观测映射到未来动作。具体而言,我们将计划提议和识别模块的隐藏层大小设置为2048,并将KL损失的平衡系数设置为0.8。

A.1 USST USST [4] 是自心3D手部轨迹预测的代表性工作。它以自心(Ego)帧和历史手部轨迹作为输入,以预测未来的粗略自心3D手部轨迹。然而,它并未利用详细的手部姿态状态和语言指令。USST为此任务引入了一个状态空间模型和一个基于注意力的状态转换模块,并带有发射模块。在本文中,我们首先修改USST中的预测头,以使其能够预测未来的3D手部关节。然后,我们通过迁移其关键组件(如不确定性估计和不确定性感知损失)来重新实现该方法,并将不确定性感知损失的平衡系数设置为3e-3。在预测过程中,模型以自心观测帧和先验手部状态作为输入,不包含语言指令,这与原始USST的设置一致。最后,由于缺乏显式的语言指令,重新实现的USST在我们提出的任务中表现较低,这证明了手部轨迹预测任务与我们的视觉语言引导的自心3D手部姿态预测(VL-EHPF)任务之间存在显著差异。

A.2 GCBC GCBC [40] 是视觉机器人操作(VRM)任务的开创性工作。它首次探索了以自监督方式从人类遥操作玩耍数据中学习细粒度的机器人控制潜在变量。具体而言,它以玩耍数据(即低级视觉观测和细粒度动作的连续日志)作为输入来学习潜在空间,该空间在测试时被重用以执行特定目标。为了在我们的VL-EHPF任务中重新实现该方法,我们实际上采用视觉观测、语言指令和手部姿态状态作为多模态输入,这与主流VRM/VLA工作中的常见设置一致。然后,我们引入一个额外的令牌作为动作潜在空间,并将其纳入自回归Transformer中,以便从多模态先验学习到未来的自心3D手部姿态。

A.3 MCIL MCIL [41] 是一项重要的VRM/VLA工作,它首次探索了将自由形式的自然语言条件纳入机器人任务执行中。具体而言,该方法从自然语言指令、密集视觉帧像素、连续控制和复杂任务中学习感知。为了重新实现MCIL,我们基于其官方发布的代码集成了其核心组件(即连续潜在计划、计划提议模块和计划识别模块)。具体而言,计划识别模块基于Bi-LSTM层,作为后验编码器,在训练期间总结整体意图。相比之下,计划提议模块作为先验网络,仅根据当前视觉观测和语言指令预测该潜在分布。连续潜在计划是从这些分布中采样的向量,代表整体意图。

A.4 HULC HULC [45] 对机器人操作任务中的关键挑战进行了广泛研究,并与上述MCIL相比做出了几项改进。首先,它学习离散表示而不是连续向量,以便更好地适应复杂的推理、规划和预测学习。然后,它通过利用Transformer [74] 架构来建模长程和分层机器人控制,从而改进了计划提议和计划识别网络。具体而言,我们初始化一个32×32的离散空间以模拟人类活动期间的分层意图。然后,我们采用基于Transformer的计划提议和计划识别网络来建模长程依赖关系,相应的隐藏层大小设置为2048。最后,我们利用MLP层对学到的离散计划表示进行标记化,以便进行后续的推理和预测。与MCIL方法一样,也在提议分布和识别分布之间执行KL散度,平衡系数设置为0.8。

A.5 GR-1 GR-1 [76] 是一项代表性的VRM(也称为视觉语言动作VLA)工作,它利用人类数据来促进下游机器人操作。GR-1的框架是一个GPT风格模型,首先在Ego4D [13] 中的人类自心视频上进行预训练,目标是逐帧生成。然后,它在下游机器人数据上进行微调,并在机器人操作任务中取得了令人印象深刻的性能。在本文中,GR-1以多模态线索(即自心视觉观测、语言指令和手部姿态状态)作为输入,具有两个主要的训练目标。一方面,该框架通过标准的smoothL1和BCE损失进行优化,以预测具有有效性掩码的3D手部关节位置。另一方面,我们将解码后的查询输入到多块MAE [17] 解码器中,以MSE损失相对于当前时间步重建未来的第三自心帧。MAE解码器的深度设置为2,重建损失的平衡系数设置为1.0。

A.6 AR-VRM AR-VRM [81] 是一种基于预训练-微调范式的最新方法。为了解决从人类到机器人隐式转移知识的问题,它首先通过预测Ego视角中的人体关键点进行预训练。然后,它在机器人数据上进行微调,并采用检索和类比推理策略进行人-机转移,取得了显著的性能。在本文中,我们重新实现了该方法,并通过在我们的Exo2EgoPose中结合配对的外心(Exo)演示视频以进行跨视图推理,进一步改进了该方法。具体而言,遵循官方发布的代码,我们通过采用具有交叉注意力块的多头Transformer来实现类比推理。然后,我们将学到的自心姿态特征视为查询,将额外提取的外心特征视为记忆,并将它们输入到

第 13 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克

[原始 AssemblyHands 数据集] [原始 Ego-Exo4D 数据集]

过滤不可靠样本 自心帧去畸变

世界到相机变换 世界到相机变换

关联动作标注 标准化标注格式

构建自心-外心视频对 关联原子动作描述

组织活动片段 构建自心-外心视频对 [处理后的 AssemblyHands 基准] 组织活动片段 图 A1:AssemblyHands 基准的数据预处理流程。 [处理后的 Ego-Exo4D 基准]

图 A2:Ego-Exo4D 基准的数据预处理流程。多头类比推理 Transformer。最后,我们设置一个可学习的平衡参数来控制类比推理预测的权重。具体而言,类比推理 Transformer 的深度设置为 2,隐藏层大小设置为 384。 可学习的平衡参数根据官方发布的代码初始化为 1.0。 基于两个数据集共享的统一帧 ID,[构建] 自心视频帧、3D 手部姿态标注和语言指令。 可学习的平衡参数根据官方发布的代码初始化为 1.0。 (4) 构建自心-外心视频对:我们进一步构建自心-外心视频对以训练我们的 Exo2EgoPose 框架。得益于 AssemblyHands 数据集,该数据集提供了同步的多视角外心演示的自心视频,我们随机选择一个外心视角以形成自心-外心视频对。

B 数据集预处理细节 (5) 组织活动片段:最后,我们将多模态数据组织成活动片段。每个片段包含整个活动的所有自心视频帧、对应的 3D 手部姿态和语言指令。由于原始数据集未提供公开的测试集,我们从验证集中随机采样 50% 的片段以构建测试集。

我们在正文第 4.1.1 节中介绍了我们 EgoMe-pose 基准的详细构建流程。在本节中,我们展示另外两个基准(即 AssemblyHands [50] 和 Ego-Exo4D [14])的详细数据集预处理流程。

B.1 AssemblyHands 基准 AssemblyHands [50] 数据集基于 Assembly101 [63] 数据集提供了精确的 3D 手部姿态标注,该数据集专为玩具组装场景设计。为了将该数据集适配到我们的 VL-EHPF 任务,我们进行了彻底的数据预处理,以构建如图 A1 所示的多模态 AssemblyHands 基准。详细的数据预处理流程如下: (1) 过滤不可靠样本:我们观察到原始 AssemblyHands 数据集中的一些标注案例存在手部关节缺失的问题。因此,我们通过保留每个手包含超过 10 个有效关节且根关节有效的帧的标注来过滤不可靠样本。否则,当前帧的手部姿态标注将被丢弃。 (2) 世界到相机变换:AssemblyHands 中的初始 3D 手部姿态标注是在世界坐标系中标记的,而我们的任务是在自心相机坐标系中预测手部姿态。因此,我们执行世界到相机坐标系的变换。具体而言,我们使用官方的外参,包括旋转矩阵 $R$ 和平移向量 $T$,将每个 3D 关节从世界坐标系转换到自心相机坐标系。 (3) 关联动作标注:由于原始 AssemblyHands 数据集缺乏语言标注,我们利用 Assembly101 数据集中的文本细粒度动作标注作为语言指令。具体而言,我们将自心视频

B.2 Ego-Exo4D 基准 Ego-Exo4D [14] 数据集是最大的自心-外心数据集,拥有多样化的标注,如 3D 手部姿态、原子动作描述、专家评论等。为了构建适合我们 VL-EHPF 任务的 Ego-Exo4D 基准,我们执行如图 A2 所示的数据预处理。详细流程如下: (1) 自心帧去畸变:Ego-Exo4D 数据集中的自心视频是由开源 Aria 眼镜 [12] 捕获的,存在固有的图像畸变。得益于数据集提供了包含自心相机参数的 .vrs 文件,我们根据官方相机参数和去畸变工具箱对所有涉及的自心视频帧进行图像去畸变。 (2) 世界到相机变换:与 AssemblyHands 基准类似,我们对 Ego-Exo4D 数据集中的自心 3D 手部姿态标注执行世界到相机变换。我们利用官方相机外参进行上述每个手部关节的坐标系变换。 (3) 标准化标注格式:由于 Ego-Exo4D 数据集中姿态标注的手部关节索引规则与通用关节索引规则 [47, 50] 不一致,我们

第 14 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦秋,兰晓王,祥李,和宏亮李

语言指令:用螺丝刀拧紧前保险杠。

GR-1 …

AR-VRM …

ours …

GT …

语言指令:定位后车门。

GR-1 …

AR-VRM …

Ours …

GT …

图 A3:我们的 Exo2EgoPose 和对比方法在 AssemblyHands 基准测试上对接下来 10 帧连续预测的自心 3D 手部姿态的可视化结果。(由于原始自心帧中手部尺度较小,建议放大以更好地观察姿态细节)。

通过将所有手部姿态注释映射到确保与广泛使用的手部关节协议一致的注释标准,执行注释标准化。 (4) 关联原子动作描述:为了将语言指令分配给带有姿态的视频片段,我们利用数据集中的文本注释。我们在预定义的时间窗口内,将自心片段和姿态与 Ego-Exo4D 中的原子动作描述注释相关联。具体而言,我们将窗口定义为原子动作时间戳前 0.5 秒到后 1.0 秒的时间间隔,并要求该窗口内的每一帧都具有有效的姿态注释。 (5) 构建自心-外心视频对:与 AssemblyHands 基准测试类似,我们随机选择一个同步的外心视角作为配对的外心演示视频,以构建自心-外心视频对来训练我们的 Exo2EgoPose 框架。 (6) 组织活动片段:最后,我们将上述数据组织成“视频-语言-姿态”三元组。由于 Ego-Exo4D 手部姿态基准测试的公开测试集缺失,我们随机采样验证集(val split)中 50% 的片段,以构建我们处理后的 Ego-Exo4D 基准测试的测试集。

C 更多可视化结果 在本节中,我们展示了我们的 Exo2EgoPose 和两个近期对比方法(即 GR-1 [76] 和 AR-VRM [81])在现有的 AssemblyHands [50]、Ego-Exo4D [14] 基准测试以及我们基于 EgoMe [59] 数据集新构建的 EgoMe-pose 基准测试上,对接下来 10 帧连续预测的自心 3D 手部姿态的更多可视化结果。这些可视化结果全面且直观地证明了所提出的 Exo2EgoPose 方法的有效性。

C.1 AssemblyHands 上的定性结果 在图 A3 中,我们展示了在 AssemblyHands [50] 基准测试上,由我们的 Exo2EgoPose 和其他对比方法 [76, 81] 预测的接下来 10 个连续帧的自心 3D 手部姿态的两个可视化示例。AssemblyHands 是一个广泛使用的基准测试,主要包含组装玩具车的活动。在该基准测试中,手部通常只占据帧中的小区域,这需要细粒度的手-物交互理解和建模。在上方的示例中,语言指令是“用螺丝刀拧紧前保险杠”,这要求左手握住玩具车,右手操作螺丝刀。在第一行中,GR-1 输出并区分了左右手。然而,手部结构杂乱,无法呈现拧紧过程。在第二行中,AR-VRM 预测了粗糙的手部结构,而关节与真实值不一致。此外,右手的姿态在几帧中缺失。相比之下,在第三行中,我们的

第 15 页

Exo2EgoPose:利用外心演示进行视觉语言引导的自心3D手部姿态预测 会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克

语言指令:用右手触摸自行车前叉。

GR-1 …

AR-VRM …

本文方法 …

GT …

语言指令:用右手从桌上拿起鼻拭子包装。

GR-1 …

AR-VRM …

本文方法 …

GT …

图 A4:我们的 Exo2EgoPose 及对比方法在 Ego-Exo4D 基准测试上对接下来 10 帧连续预测的自心 3D 手部姿态的可视化结果。(由于原始自心帧中手部尺度极小,建议放大以更好地观察姿态细节)。

Exo2EgoPose 方法生成了精确的手部姿态,其中左手握住物体,右手缓慢旋转螺丝刀。这表明我们的方法准确理解了该活动并预测了细粒度的手部动作。

请放大图 A4 以更好地可视化手部姿态。在上例中,受试者在接下来几个时间戳即将“用右手触摸自行车前叉”。第一行中的 GR-1 预测出杂乱的手部关节位置。在第二行中,AR-VRM 能够为双手形成完整的结构。然而,预测手部的整体方向与真实值(ground-truths)存在显著差异。最后,尽管真实姿态标注中缺失了一些无效关节,我们的方法在触摸自行车的过程中仍生成了精确的自心手部姿态。

在下例中,受试者的目标是“放置后车门”,其中左手举起玩具车,右手调整其手势以准备放置后车门。在第一行中,GR-1 未能生成合理的结构,因为某些骨骼异常拉长。在第二行中,AR-VRM 粗略预测了看似合理但大致粗糙的手部结构,这些结构与真实值仍有较大偏差。具体而言,手部姿态在许多帧中发生扭曲,未能充分反映所指的动作。在第三行中,提出的 Exo2EgoPose 方法输出了具有合理手部结构的精确手部姿态,并准确反映了当前细粒度的原子动作。

在底部案例中,给定的语言指令是“用右手从桌上拿起鼻拭子包装”。在第一行中,GR-1 错误地生成了左手的假阳性杂乱关节,而左手并未参与整个活动过程。在第二行中,AR-VRM 未能理解“拿起鼻拭子包装”的动作,生成的手部姿态与真实姿态显著不同。相反,在第三行中,我们的 Exo2EgoPose 准确理解了这一过程,并在自心视角下输出了正确的手部姿态,其中右手逐渐收缩以抓取目标物体。上述可视化结果进一步证明了我们理念的有效性,即在不同级别重建外心演示,然后利用外心引导进行全局到局部的特征调制,以实现精确的自心 3D 手部姿态预测。

C.2 Ego-Exo4D 上的定性结果

在图 A4 中,我们可视化了 Ego-Exo4D [14] 基准测试上接下来 10 个连续自心 3D 手部姿态的两个示例,这些姿态由 GR-1 [76]、AR-VRM [81] 以及我们的 Exo2EgoPose 预测得出。Ego-Exo4D 是目前最大的多视角自心-外心数据集,拥有详细的标注,涵盖了多样化的现实世界活动。由于 Ego-Exo4D 中的视频是通过鱼眼 Project Aria 眼镜 [12] 捕获的,因此在图像去畸变后,手部区域变得非常小。

第 16 页

会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 赵峰石,何谦秋,兰晓王,祥李,和宏亮李

语言指令:用右手拿起深色袜子并挂在晾衣杆上。

GR-1 …

AR-VRM …

本文方法 (Ours) …

真实值 (GT) …

语言指令:将篮球举过头顶。

GR-1 …

AR-VRM …

本文方法 (Ours) …

真实值 (GT) …

图 A5:我们的 Exo2EgoPose 及对比方法在 EgoMe-pose 基准测试上,对未来 10 帧连续预测的自心 (Ego) 3D 手部姿态的可视化结果。

C.3 EgoMe-pose 上的定性结果 在打篮球时的动态动作,GR-1 在图 A5 中,我们展示了由提出的 和 AR-VRM 在第一行和第二行中均难以理解 Exo2EgoPose 及其他对比方法(即 GR-1 [76] 和 投篮过程中的手部状态(即手部关节需要环绕篮球)。因此,它们都预 AR-VRM [81])在我们新构建的 EgoMe-pose 基准测试上,对未来 10 帧连续 测出了错误的手部关节位置,这些位置与 自心 (Ego) 3D 手部姿态的两个可视化示例。 真实手部姿态不一致。相反,在第三行中,我们的 EgoMe-pose 是基于最近的 EgoMe [59] 数据集构建的, Exo2EgoPose 结合了整体且稳定的外心 (Exo) 演示 该数据集包含由观察者和跟随者在动态相机运动下捕获的配对但非同步的自心 (Ego) 和外心 (Exo) 视频, 视频作为指导,以实现渐进式的全局到局部特征调制, 场景多样。可视化策略与正文中应用的策略一致。在上方的示例中,需要预测 从而准确预测出所参考的未来动作的自心 (Ego) 3D 手部姿态。 “用右手拿起深色袜子并挂在晾衣杆上”的手部姿态。在第一行中, GR-1 预测出了杂乱的手部姿态以及无关的左手的假阳性关节。这表明 GR-1 未能理解 在整体悬挂活动中“用右手拿起袜子”的过程。在第二行中, AR-VRM 预测的手部姿态大致形成了手部结构并捕捉到了拿起袜子的姿势。然而,每个手部关节的精确位置 与真实值存在显著偏差。 相比之下,我们在第三行中的 Exo2EgoPose 生成了合理的手部结构和手势,具有精确的手部关节位置和 合理的动态特性。 下方的示例侧重于打篮球的场景,主体正准备“将篮球举过头顶”并准备投篮。由于视野有限且高度

发表评论