EgoPHI:从第一视角图像重建三维手物接触与力

快速导读:EgoPHI 是首个从单张第一视角 RGB 图像和物体几何出发,联合估计手部与物体网格上稠密接触图和三维力分布的视觉模型。

EgoPHI 解决的是一个看似简单却长期被回避的问题:从单张第一视角 RGB 图像出发,同时估计手部与物体网格上的稠密接触图和三维力分布。此前接触检测已有成熟方法,但接触本身只是几何事实,不携带物理动力学信息;力估计则局限于图像空间或平面表面,无法推广到弯曲刚体和关节物体。EgoPHI 的核心主张是:只要把稠密力监督从人工标注转移到物理仿真,再配合显式建模手物空间关系的图网络,三维接触与力的联合估计就可以实现。

论文的贡献可以概括为三点。第一,提出首个从单目第一视角图像联合估计手物网格稠密接触与三维力的视觉模型;第二,用 SOFA 物理仿真为 ARCTIC 数据集自动生成每顶点力监督,解决了标注不可扩展的问题;第三,设计 Graph-Based Interaction Blocks 与迭代位姿细化模块,在遮挡严重的第一视角下保证空间配置的准确性。真实世界评估进一步表明,仿真训练的模型可以迁移到带力测量的真实物体上。

英文题目:EgoPHI: Estimating 3D Hand-Object Contact and Force from Egocentric Vision

论文出处:arXiv 每日论文精选 · arXiv:2608.13014

原始论文:PDF / 论文页面

这篇论文解决什么问题?

接触检测领域已有 HACO 等成熟方法,它们通过 Balanced Contact Sampling 和 Vertex-Level Class-Balanced loss 缓解接触类别与空间不平衡,在多个数据集上取得了不错的召回率。但接触检测回答的是『哪里碰到了』,而不是『用了多大的力』。同一个接触点,可以是轻触也可以是强力抓握,接触标签无法区分这两种物理状态。

力估计的已有工作同样存在根本局限。PressureVision 系列从单张 RGB 图像估计平面手部压力热图,本质上是二维图像空间的方法;EgoPressure 虽然迁移到第一视角并在三维手部网格上预测压力,但代码未公开,且仍然只处理手部,不涉及物体表面。对于非平面刚体和关节物体,这些方法在几何上就无法定义力的作用面。

更深层的障碍在于监督信号。稠密的三维力真值无法靠人工标注获得,力传感器只能覆盖稀疏的接触点,而网格上每个顶点都需要力的大小和方向。这个标注瓶颈直接导致此前没有人能在手部和物体网格上同时训练力估计模型。EgoPHI 的突破点正在于此:它不试图标注真实力,而是用物理仿真生成力标签。

核心创新

  • 首个从单目第一视角 RGB 图像联合估计手部和物体网格上稠密接触与三维力分布的视觉模型
  • 基于 SOFA 的物理仿真管线,为现有手-物数据集(ARCTIC)自动生成稠密每顶点力监督
  • Graph-Based Interaction Blocks:结合网格内 GAT 与网格间跨注意力,显式建模手-物空间邻近关系
  • 迭代位姿细化模块(IRM),在遮挡严重的第一视角下逐步修正物体位姿
  • 构建了基于 FTIR 原理的带力测量真实物体(立方体和圆柱体),采集 8 名参与者的真实接触与力数据集用于验证 sim-to-real 迁移

方法概览

EgoPHI 采用三阶段流水线:(1) 视觉与几何特征提取,用 ViT 骨干对投影顶点采样视觉特征并与几何特征融合;(2) 迭代位姿细化(IRM),通过图注意力网络(GAT)建模网格内结构、跨注意力建模手-物网格间关系,迭代预测物体旋转和平移增量;(3) 力估计阶段,基于最终位姿用独立的图交互模块预测每顶点接触概率、力大小和方向,并将预测力乘以接触概率以保持物理一致性。训练监督来自 SOFA 物理仿真生成的稠密每顶点接触与力标注。

  • EgoPHI 采用三阶段流水线。第一阶段提取视觉与几何特征:用 ViT 骨干对投影顶点采样视觉特征,与几何特征做跨模态融合,使每个顶点同时携带外观信息和空间信息。
  • 第二阶段是迭代位姿细化(IRM)。第一视角下物体位姿估计往往偏差很大,IRM 通过图注意力网络编码网格内结构,通过跨注意力建模手物网格间关系,迭代预测物体旋转和平移增量,逐步修正位姿。
  • 第三阶段是接触与力估计。基于最终位姿,独立的图交互模块预测每个顶点的接触概率、力大小和力方向。预测力会乘以接触概率,保证非接触区域的力被抑制,维持物理一致性。
  • Graph-Based Interaction Blocks 是贯穿第二、三阶段的核心模块。它显式编码网格内结构和网格间关系,让模型知道手和物体在三维空间中的相对位置与邻近程度,这对推断物理上合理的力至关重要。
  • 训练监督来自 SOFA 物理仿真。仿真采用 penalty-based formulation,用虚拟弹簧模拟接触恢复力,在 ARCTIC 数据集的手物交互序列上生成稠密每顶点接触与力标签。
  • 推理时手部位姿由 HAMER 估计,物体模板网格作为输入。模型在共享相机坐标系中配准手部网格并细化物体位姿,最终输出手部和物体网格上的稠密接触与力分布。

逐图理解论文

方法贡献:图交互与位姿细化

方法贡献:图交互与位姿细化
Fig. 2: EgoPHI’s 3-stage pipeline: (1) visual & geometric feature extraction with cross- modal fusion, (2) object pose estimation, and (3) contact and force estimation. Our novel Graph-Based Interaction Blocks perform the core 3D reasoning by encoding intra- mesh structure and inter-mesh relationships between the hands and object. These blocks represent the 3D pose and spatial configuration of each mesh relative to the others. We thus explicitly model proximity and geometric interaction, which is critical for inferring physically grounded forces.

三阶段流水线图是理解方法的关键。重点观察 Graph-Based Interaction Blocks 在第二阶段和第三阶段中的位置:它既参与位姿细化,又参与接触与力估计,说明空间关系建模贯穿了整个推理过程。

Fig

Fig
Fig. 1: EgoPHI is the first vision-based model that estimates 3D forces and contact during interaction with articulated rigid objects. Given a single egocentric monocular RGB image and the object geometry, EgoPHI registers hand meshes to refine the object pose in a shared camera coordinate frame, and predicts dense per-vertex contact and force distributions over all meshes for physically grounded interaction reasoning.

这张图展示了 EgoPHI 的整体能力:从单张第一视角图像和物体几何出发,同时输出手部与物体网格上的稠密接触图和三维力分布。注意观察力方向箭头的空间分布,它体现了模型对三维力方向的推理能力,而非仅仅输出标量大小。

Fig

Fig
Fig. 3: (a) Activation of collision detection: pink lines show line-line contact, blue lines show point-line contact, yellow lines show point-point contact, and red lines represent constraints. (b) Simulated forces before and after applying contact masks.

这张图展示了 SOFA 仿真中的碰撞检测激活情况。不同颜色的线代表不同类型的接触约束,右侧对比了施加接触掩码前后的仿真力分布。它说明了仿真监督如何生成物理上合理的力标签。

实验如何设计?

  • 在 ARCTIC 数据集(分布内)和 H2O 数据集(分布外)上评估,对比 HACO 和 PressureVision 基线。HACO 在 14 个数据集上预训练(含 ARCTIC 和 H2O),而 EgoPHI 仅在 ARCTIC 训练集上训练,接触召回率对比不完全公平。
  • 消融实验移除迭代细化模块(IRM),评估其对接触与力估计的贡献。
  • 误差隔离分析使用真值手部和物体位姿绕过位姿估计,验证误差来源是位姿估计还是力估计本身。
  • 手部位姿域差距实验用 HAMER 估计位姿微调模型,检验训练时使用真值位姿、推理时使用估计位姿造成的域差距影响。
  • 真实世界评估:8 名参与者在两个基于 FTIR 原理的仪器化物体(立方体和圆柱体)上进行触摸和抓握,物体表面力对应手指上的光强。
  • SOFA 仿真力与真实 FTIR 测量力的对比验证,评估仿真监督的物理真实性。

关键结果与论文证据

  • 在 ARCTIC 上,EgoPHI 的手部力 MAE 为 4.03 N,RMSE 为 5.06 N,vIoU 为 2.2;HACO 基线为 MAE 6.62 N,RMSE 7.29 N,vIoU 1.0(第 10 页)。
  • 在 H2O 分布外数据上,EgoPHI 完整模型的物体力 MAE 为 3.88 N,RMSE 为 4.18 N(第 10 页),表明模型具有一定泛化能力。
  • 二维力对比中,EgoPHI 的 IoU 为 0.157,Vol. IoU 为 15.4;PressureVision 的 IoU 为 0.068,Vol. IoU 为 6.6(第 9 页),说明三维推理优于图像空间方法。
  • IRM 消融显示,移除迭代细化后 ARCTIC 上 IoU 从 0.157 降至 0.021,vIoU 从 15.4 降至 1.6(第 11 页),位姿细化对力估计至关重要。
  • 位姿细化使 MPV 误差下降超过 70%:ARCTIC 从 64 cm 降至 19 cm,H2O 从 48 cm 降至 10 cm(第 11 页)。
  • 真实世界评估中,圆柱体物体力 MAE 为 1.35 N,RMSE 为 3.24 N;立方体 MAE 为 0.48 N,RMSE 为 1.54 N(第 14 页),验证了 sim-to-real 迁移的可行性。
  • SOFA 仿真验证显示,圆柱体每帧 MAE 为 0.36±0.18 N,Spearman ρ=0.760;立方体 MAE 为 0.25±0.16 N,ρ=0.604(第 14 页),仿真力与真实测量力具有中等以上相关性。
  • 用 HAMER 位姿微调后手部接触预测反而下降,F1 从 0.190 降至 0.128(第 12 页),说明几何依赖的接触监督与噪声位姿不匹配。

阅读时需要注意

  • 逐帧独立处理,丢弃时间结构,无法保证力的时序一致性,可能产生帧间跳变。
  • 需要物体模板网格作为输入,无法直接处理完全无约束的第一视角视频。
  • 仿真采用统一刚度常数,对异质或柔性材料物体的精度受限。
  • 仅预测法向接触力,未建模切向力,无法完整刻画摩擦等切向交互。
  • 缺乏物体属性(如质量),无法施加全局力平衡约束。
  • 真实世界评估仅覆盖立方体(分片平面)和圆柱体(可展曲面),未验证真正弯曲的三维物体。

关联工作

  • HACO 是手部稠密接触估计的 SOTA 基线,引入 Balanced Contact Sampling 和 VCB loss 解决类别与空间不平衡,但只做接触检测,不涉及力。
  • PressureVision 系列从单张 RGB 图像估计平面手部压力热图,是图像空间力估计的代表,但无法处理三维曲面。
  • EgoPressure 将压力估计迁移到第一视角并在三维手部网格上预测压力分布,但代码未公开,且不涉及物体表面。
  • DECO、PICO、GRACE 等方法基于参数化人体模型做全身稠密三维接触估计,为接触检测提供了技术背景,但同样不涉及力。
  • FORCE 数据集强调物理引导的人物交互理解,ViTaM-D 以力感知接触表示约束手物交互重建,说明领域正在向物理层面推进,EgoPHI 是这一趋势的直接延续。

发表评论