HandsOnWorld:相机解耦手部控制的非受限第一人称视频生成

快速导读:提出EgoVid-Pro数据集与Plücker Hand Map表示,实现从非受限单目视频训练、相机与手部运动解耦的3D手部控制第一人称视频生成。

HandsOnWorld 解决的核心问题是:如何在不依赖多视角动捕或实验室桌面标注的前提下,实现精确的 3D 手部控制第一人称视频生成。现有方法要么受限于 ARCTIC 这类桌面动捕数据的场景单一性,要么在 in-the-wild 数据上缺乏手指级 3D 标注。本文的答案是双管齐下:用 protagonist-centered 标注管线从大规模第一人称视频中提取干净的主角手部轨迹,再用 Plücker Hand Map 在表示层面解耦相机自运动与手部运动。

论文的论证结构清晰:先指出数据规模与标注质量之间的 tradeoff,再揭示相机空间控制信号的根本缺陷——相机自运动与手部运动纠缠,最后用数据集与表示两个贡献共同解决。实验在 EgoVid-Pro 上全面超越基线,在 ARCTIC 上与最强基线竞争,验证了方法的有效性。

英文题目:HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

论文出处:arXiv 每日论文精选 · arXiv:2607.02075

原始论文:PDF / 论文页面

这篇论文解决什么问题?

第一人称手部控制视频生成面临一个数据金字塔困境。金字塔顶端是 ARCTIC 这类多视角动捕数据,手部标注精度高,但场景局限于桌面交互,训练出的模型容易漂移到实验室风格。金字塔底端是 EgoVid-5M 这类大规模 in-the-wild 数据,场景丰富但缺乏手指级 3D 标注。现有方法不得不在规模与质量之间二选一。

更深层的问题在于控制信号的表示。现有方法大多在相机空间编码手部姿态,例如投影 MANO 网格或 tokenize 3D 骨架。当相机自运动显著时,相机空间中的手部运动是相机运动与手部运动的混合,模型无法区分'手在动'还是'头在动'。这在桌面场景中不明显,因为相机几乎静止,但在日常第一人称视频中相机自运动无处不在。

单目 3D 重建的进展为突破这一困境提供了可能。HaWoR 等工具可以从普通第一人称视频中恢复世界坐标系下的手部轨迹,这意味着理论上可以从 in-the-wild 数据中提取 3D 手部标注。但直接应用面临一个关键挑战:如何区分画面中的主角手部与旁观者手部。

论文用一个具体案例说明了 naive 过滤的失败:基于相机空间朝向的启发式规则(例如期望主角手部朝上或朝向光轴)会同时产生两类错误——误拒绝主角手部(例如手部侧向伸展时)和误保留旁观者手部(例如旁观者手部恰好朝向相机)。图 5 的统计进一步证实,保留与拒绝的 tracklet 在相机空间朝向分布上高度重叠,不存在固定阈值可以分离两者。

核心创新

  • 提出protagonist-centered三级过滤标注管线(语义、图像、3D几何),从in-the-wild视频中提取干净的主角手部轨迹
  • 构建EgoVid-Pro数据集:103K片段、约12M帧,规模匹配最大现有3D手部标注第一人称数据集,场景多样性远超桌面捕获
  • 提出Plücker Hand Map:将Plücker射线从相机几何扩展到手部表面,以世界系射线表示手部运动,在表示层面解耦相机自运动与手部运动
  • 实现不依赖多视角或动捕的3D手部控制第一人称视频生成框架,可泛化到日常场景

方法概览

构建protagonist-centered标注管线,对EgoVid-5M依次进行语义级(16动词过滤)、图像级(HaWoR检测置信度阈值0.4、保留≥80/120帧)、3D几何级(SMPL身体拟合+VPoser先验,拒绝不可达tracklet)过滤,得到EgoVid-Pro。提出Plücker Hand Map:将相机Plücker射线与手部表面法线射线拼接为12通道控制图,经轻量卷积编码器以ControlNet方式注入扩散模型,在表示层面解耦相机自运动与手部运动。

  • protagonist-centered 标注管线分三级过滤 EgoVid-5M。第一级语义过滤:仅保留 16 个第一人称交互动词相关的片段。第二级图像质量过滤:用 HaWoR 检测手部,置信度阈值 0.4,要求片段中至少 80/120 帧有有效检测。第三级 3D 几何过滤:用 SMPL 身体拟合加 VPoser 先验,拒绝身体姿态与手部轨迹不可达的 tracklet,从而排除旁观者手部。
  • 3D 几何过滤的核心思想是:主角的手部必须与主角的身体姿态在物理上可达。旁观者的手部虽然可能出现在画面中,但其 3D 位置与主角身体的关系通常不满足可达性约束。这一过滤不依赖相机空间朝向,因此避免了 naive 启发式的两类错误。
  • Plücker Hand Map 的构建:对每个手部表面点,计算其世界系法线射线,与相机 Plücker 射线拼接,形成 12 通道控制图。相机 Plücker 射线编码了相机在世界系中的位置与朝向,手部法线射线编码了手部在世界系中的绝对 3D 姿态。两者拼接后,模型可以独立读取相机运动与手部运动。
  • 控制信号通过轻量卷积编码器以 ControlNet 风格注入扩散模型。编码器将 12 通道 Plücker Hand Map 转换为与扩散模型中间特征对齐的残差信号,以加法方式注入。这种注入方式保持了预训练视频模型的生成能力,同时引入精确的 3D 控制。
  • 与 CameraCtrl 的关系:Plücker Hand Map 是将 Plücker 射线表示从相机控制扩展到手的控制。关键创新在于将射线从相机几何推广到手部表面法线,使手部运动以世界系射线表示,与相机射线在表示层面并列而非混合。
  • 训练数据条件对比揭示了数据与表示的协同作用:仅用 ARCTIC 训练会漂移到实验室风格,仅用 raw EgoVid 缺乏 3D 标注,而 EgoVid-Pro 的干净标注使 Plücker Hand Map 的优势得以充分发挥。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 4. Failure cases of naive camera-space heuristics. We illustrate two vanilla rules based on the hand orientation. (top) Image-plane orientation, expecting the protagonist’s hand to point upward. (bottom) Camera-facing direction, expecting alignment with the optical axis. Two columns show false rejections of pro- tagonist hands and false retention of bystander hands, respectively.

观察 naive 启发式的两类失败:误拒绝主角手部(手部侧向伸展时)和误保留旁观者手部(旁观者手部朝向相机时)。这直接论证了 3D 过滤的必要性。

研究缺口

研究缺口
Figure 5. Camera-space hand orientation statistics for track- lets retained and rejected by our 3D-geometry filter. Azimuth and elevation are the horizontal and vertical angles of the hand ori- entation in the camera frame. Although retained hands follow the expected egocentric bias, rejected tracklets overlap these regions, confirming that fixed camera-space thresholds are insufficient for robust identification.

观察保留与拒绝 tracklet 的朝向分布重叠:如果存在固定阈值可以分离两者,分布应该明显分开。重叠说明相机空间朝向不是可靠的主角判别特征。

方法贡献

方法贡献
Figure 3. Overview of the protagonist-centered annotation pipeline. Starting from EgoVid-5M, we progressively discard clips that fail semantic, image-quality, or 3D-geometry criteria, yielding clean (video, text, human pose) tuples for training.

观察三级过滤的递进关系:语义过滤缩小范围,图像质量过滤保证检测可靠性,3D 几何过滤排除旁观者手部。注意每级过滤丢弃的片段类型。

验证与证据

验证与证据
Table 2. Quantitative comparison with recent SOTA methods. We achieve competitive performance against the baselines on ARCTIC. EgoVid-Pro brings out the full advantage of our representation, where we surpass all baselines on every metric. Bold marks the best per column and underline marks the second-best.

实验验证了这个组合的有效性。在 EgoVid-Pro 上,Ours 在视觉质量和手部控制精度上全面超越所有基线。有意思的是在 ARCTIC 上,Ours 只是与最强基线竞争,并没有全面领先。论文的解释很关键:桌面场景相机自运动极小,相机空间和世界空间编码几乎等价,表示优势根本显现不出来。只有当相机大幅运动时,Plücker Hand Map 的解耦优势才真正发挥作用。OOD 评估也支持这一点:在 H2O 数据集上直接测试,Ours 的平移误差和相对轨迹误差优于多数基线。

结论与意义

结论与意义
Figure 2. HandsOnWorld: Unconstrained 3D hand-controlled egocentric video generation. Given the first frame and a target 3D camera and hand trajectory, our method synthesizes temporally coherent egocentric interactions across diverse everyday scenes, objects, and actions, generalizing far beyond the controlled tabletop settings of prior work. The first frames are generated with GPT-Image-2, and input text prompts are augmented before being passed to the video model.

观察生成结果的场景多样性:从桌面到厨房、户外等日常场景。注意手部与物体的接触是否自然,以及相机运动与手部运动是否协调。

实验如何设计?

  • 训练数据条件对比(表 1,第 7 页):比较 Wan2.2-I2V-14B 基线、ARCTIC-only、ARCTIC+EgoVid(raw)、Ours(EgoVid-Pro) 四种条件,在 EgoVid-Pro 测试集上评估视觉质量与手部控制精度。
  • SOTA 对比(表 2,第 8 页):与 Hand2World、Generated Reality、FMC*、JointControl* 在 ARCTIC 和 EgoVid-Pro 两个数据集上对比。FMC* 和 JointControl* 是作者适配或增强的版本。
  • 过滤策略消融(表 3,第 9 页):比较 camera-outward heuristic、MCP-up heuristic、EgoSim 与 Ours 的主角过滤效果。
  • OOD 泛化评估(表 A,第 15 页):在 H2O 数据集上直接评估,不进行任何微调,检验跨数据集泛化能力。
  • 评估指标包括 PSNR、SSIM、LPIPS、FVD 等视觉质量指标,以及 RotErr、TransErr、PA-JPE、W-JPE、RTE 等手部姿态精度指标。评估依赖 HaWoR 重建生成视频的手部与相机轨迹。

关键结果与论文证据

  • 训练数据条件对比中,Ours (EgoVid-Pro) 在 EgoVid-Pro 上 PSNR 17.42、SSIM 0.5367、LPIPS 0.2923、FVD 274.51,全面超越所有基线(表 1,第 7 页)。
  • 手部控制精度方面,Ours 在 EgoVid-Pro 上 RotErr 3.75、TransErr 3.33、PA-JPE 6.37、RTE 4.12,同样全面领先(表 1,第 7 页)。
  • ARCTIC 上 Ours PA-JPE 9.34、W-JPE 114.00、RTE 7.68,与最强基线竞争但未全面超越(表 2,第 8 页)。论文解释:桌面场景相机自运动极小,相机空间与世界空间编码几乎等价,表示优势无法显现。
  • EgoVid-Pro 上 Ours 超越所有基线,验证了 Plücker Hand Map 在大幅自运动场景下的独特优势(表 2,第 8 页)。
  • H2O OOD 评估中 Ours TransErr 1.80、RTE 4.87,优于多数基线,显示跨数据集泛化能力(表 A,第 15 页)。
  • 定性对比(图 6,第 7 页)显示 ARCTIC-trained 基线漂移到实验室风格,甚至在合成手上出现动捕标记点;Ours 保持原始场景外观。
  • 过滤策略消融(图 8,第 9 页)显示 naive 过滤引入主角与旁观者的歧义,EgoSim 的静态场景表示抑制了环境动态,Ours 在跟随主角手部轨迹的同时保持自然环境动态。
  • 图 5(第 6 页)的统计证实保留与拒绝的 tracklet 在相机空间朝向分布上高度重叠,证明 3D 几何过滤的必要性。

阅读时需要注意

  • Plücker Hand Map 在法线方向与视线方向近平行的 grazing 配置下数值敏感,论文称实践中罕见但未给出定量分析。
  • 训练依赖 HaWoR 单目重建质量,检测失败或遮挡严重时标注可能退化,误差会传导到生成模型。
  • 评估指标依赖 HaWoR 重建生成视频的手部与相机轨迹,存在重建误差传导,可能高估或低估真实控制精度。
  • EgoVid-Pro 训练子集仅 34,078 个视频(完整双标注前 81 帧),非全部 103K 片段,实际训练规模小于数据集名义规模。

关联工作

  • Hand2World 是第一人称手部控制视频生成的早期工作,投影 MANO 网格作为控制信号,但局限于桌面场景。Generated Reality 将 3D 骨架 tokenize 后控制生成,同样受限于动捕数据。
  • FMC 提出自由形式 6D 相机与物体姿态控制,作者将其适配为手部控制基线 FMC*。JointControl 处理遮挡感知的稀疏 3D 手关节控制,作者增强相机控制分支后对比。
  • EgoSim 是大规模第一人称数据标注与静态场景表示的代表,作为过滤策略消融基线。HaWoR 是标注管线的前端与评估工具,从第一人称视频重建世界系手部运动。
  • CameraCtrl 提出 Plücker 射线相机控制表示,是 Plücker Hand Map 的表示基础。本文的贡献在于将这一表示从相机扩展到手的表面法线。

发表评论