快速导读:提出EgoVid-Pro数据集与Plücker Hand Map表示,实现从非受限单目视频训练、相机与手部运动解耦的3D手部控制第一人称视频生成。
HandsOnWorld 解决的核心问题是:如何在不依赖多视角动捕或实验室桌面标注的前提下,实现精确的 3D 手部控制第一人称视频生成。现有方法要么受限于 ARCTIC 这类桌面动捕数据的场景单一性,要么在 in-the-wild 数据上缺乏手指级 3D 标注。本文的答案是双管齐下:用 protagonist-centered 标注管线从大规模第一人称视频中提取干净的主角手部轨迹,再用 Plücker Hand Map 在表示层面解耦相机自运动与手部运动。
论文的论证结构清晰:先指出数据规模与标注质量之间的 tradeoff,再揭示相机空间控制信号的根本缺陷——相机自运动与手部运动纠缠,最后用数据集与表示两个贡献共同解决。实验在 EgoVid-Pro 上全面超越基线,在 ARCTIC 上与最强基线竞争,验证了方法的有效性。
英文题目:HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control
论文出处:arXiv 每日论文精选 · arXiv:2607.02075
原始论文:PDF / 论文页面
这篇论文解决什么问题?
第一人称手部控制视频生成面临一个数据金字塔困境。金字塔顶端是 ARCTIC 这类多视角动捕数据,手部标注精度高,但场景局限于桌面交互,训练出的模型容易漂移到实验室风格。金字塔底端是 EgoVid-5M 这类大规模 in-the-wild 数据,场景丰富但缺乏手指级 3D 标注。现有方法不得不在规模与质量之间二选一。
更深层的问题在于控制信号的表示。现有方法大多在相机空间编码手部姿态,例如投影 MANO 网格或 tokenize 3D 骨架。当相机自运动显著时,相机空间中的手部运动是相机运动与手部运动的混合,模型无法区分'手在动'还是'头在动'。这在桌面场景中不明显,因为相机几乎静止,但在日常第一人称视频中相机自运动无处不在。
单目 3D 重建的进展为突破这一困境提供了可能。HaWoR 等工具可以从普通第一人称视频中恢复世界坐标系下的手部轨迹,这意味着理论上可以从 in-the-wild 数据中提取 3D 手部标注。但直接应用面临一个关键挑战:如何区分画面中的主角手部与旁观者手部。
论文用一个具体案例说明了 naive 过滤的失败:基于相机空间朝向的启发式规则(例如期望主角手部朝上或朝向光轴)会同时产生两类错误——误拒绝主角手部(例如手部侧向伸展时)和误保留旁观者手部(例如旁观者手部恰好朝向相机)。图 5 的统计进一步证实,保留与拒绝的 tracklet 在相机空间朝向分布上高度重叠,不存在固定阈值可以分离两者。
核心创新
- 提出protagonist-centered三级过滤标注管线(语义、图像、3D几何),从in-the-wild视频中提取干净的主角手部轨迹
- 构建EgoVid-Pro数据集:103K片段、约12M帧,规模匹配最大现有3D手部标注第一人称数据集,场景多样性远超桌面捕获
- 提出Plücker Hand Map:将Plücker射线从相机几何扩展到手部表面,以世界系射线表示手部运动,在表示层面解耦相机自运动与手部运动
- 实现不依赖多视角或动捕的3D手部控制第一人称视频生成框架,可泛化到日常场景
方法概览
构建protagonist-centered标注管线,对EgoVid-5M依次进行语义级(16动词过滤)、图像级(HaWoR检测置信度阈值0.4、保留≥80/120帧)、3D几何级(SMPL身体拟合+VPoser先验,拒绝不可达tracklet)过滤,得到EgoVid-Pro。提出Plücker Hand Map:将相机Plücker射线与手部表面法线射线拼接为12通道控制图,经轻量卷积编码器以ControlNet方式注入扩散模型,在表示层面解耦相机自运动与手部运动。
- protagonist-centered 标注管线分三级过滤 EgoVid-5M。第一级语义过滤:仅保留 16 个第一人称交互动词相关的片段。第二级图像质量过滤:用 HaWoR 检测手部,置信度阈值 0.4,要求片段中至少 80/120 帧有有效检测。第三级 3D 几何过滤:用 SMPL 身体拟合加 VPoser 先验,拒绝身体姿态与手部轨迹不可达的 tracklet,从而排除旁观者手部。
- 3D 几何过滤的核心思想是:主角的手部必须与主角的身体姿态在物理上可达。旁观者的手部虽然可能出现在画面中,但其 3D 位置与主角身体的关系通常不满足可达性约束。这一过滤不依赖相机空间朝向,因此避免了 naive 启发式的两类错误。
- Plücker Hand Map 的构建:对每个手部表面点,计算其世界系法线射线,与相机 Plücker 射线拼接,形成 12 通道控制图。相机 Plücker 射线编码了相机在世界系中的位置与朝向,手部法线射线编码了手部在世界系中的绝对 3D 姿态。两者拼接后,模型可以独立读取相机运动与手部运动。
- 控制信号通过轻量卷积编码器以 ControlNet 风格注入扩散模型。编码器将 12 通道 Plücker Hand Map 转换为与扩散模型中间特征对齐的残差信号,以加法方式注入。这种注入方式保持了预训练视频模型的生成能力,同时引入精确的 3D 控制。
- 与 CameraCtrl 的关系:Plücker Hand Map 是将 Plücker 射线表示从相机控制扩展到手的控制。关键创新在于将射线从相机几何推广到手部表面法线,使手部运动以世界系射线表示,与相机射线在表示层面并列而非混合。
- 训练数据条件对比揭示了数据与表示的协同作用:仅用 ARCTIC 训练会漂移到实验室风格,仅用 raw EgoVid 缺乏 3D 标注,而 EgoVid-Pro 的干净标注使 Plücker Hand Map 的优势得以充分发挥。
逐图理解论文
失败案例与直觉

观察 naive 启发式的两类失败:误拒绝主角手部(手部侧向伸展时)和误保留旁观者手部(旁观者手部朝向相机时)。这直接论证了 3D 过滤的必要性。
研究缺口

观察保留与拒绝 tracklet 的朝向分布重叠:如果存在固定阈值可以分离两者,分布应该明显分开。重叠说明相机空间朝向不是可靠的主角判别特征。
方法贡献

观察三级过滤的递进关系:语义过滤缩小范围,图像质量过滤保证检测可靠性,3D 几何过滤排除旁观者手部。注意每级过滤丢弃的片段类型。
验证与证据

实验验证了这个组合的有效性。在 EgoVid-Pro 上,Ours 在视觉质量和手部控制精度上全面超越所有基线。有意思的是在 ARCTIC 上,Ours 只是与最强基线竞争,并没有全面领先。论文的解释很关键:桌面场景相机自运动极小,相机空间和世界空间编码几乎等价,表示优势根本显现不出来。只有当相机大幅运动时,Plücker Hand Map 的解耦优势才真正发挥作用。OOD 评估也支持这一点:在 H2O 数据集上直接测试,Ours 的平移误差和相对轨迹误差优于多数基线。
结论与意义

观察生成结果的场景多样性:从桌面到厨房、户外等日常场景。注意手部与物体的接触是否自然,以及相机运动与手部运动是否协调。
实验如何设计?
- 训练数据条件对比(表 1,第 7 页):比较 Wan2.2-I2V-14B 基线、ARCTIC-only、ARCTIC+EgoVid(raw)、Ours(EgoVid-Pro) 四种条件,在 EgoVid-Pro 测试集上评估视觉质量与手部控制精度。
- SOTA 对比(表 2,第 8 页):与 Hand2World、Generated Reality、FMC*、JointControl* 在 ARCTIC 和 EgoVid-Pro 两个数据集上对比。FMC* 和 JointControl* 是作者适配或增强的版本。
- 过滤策略消融(表 3,第 9 页):比较 camera-outward heuristic、MCP-up heuristic、EgoSim 与 Ours 的主角过滤效果。
- OOD 泛化评估(表 A,第 15 页):在 H2O 数据集上直接评估,不进行任何微调,检验跨数据集泛化能力。
- 评估指标包括 PSNR、SSIM、LPIPS、FVD 等视觉质量指标,以及 RotErr、TransErr、PA-JPE、W-JPE、RTE 等手部姿态精度指标。评估依赖 HaWoR 重建生成视频的手部与相机轨迹。
关键结果与论文证据
- 训练数据条件对比中,Ours (EgoVid-Pro) 在 EgoVid-Pro 上 PSNR 17.42、SSIM 0.5367、LPIPS 0.2923、FVD 274.51,全面超越所有基线(表 1,第 7 页)。
- 手部控制精度方面,Ours 在 EgoVid-Pro 上 RotErr 3.75、TransErr 3.33、PA-JPE 6.37、RTE 4.12,同样全面领先(表 1,第 7 页)。
- ARCTIC 上 Ours PA-JPE 9.34、W-JPE 114.00、RTE 7.68,与最强基线竞争但未全面超越(表 2,第 8 页)。论文解释:桌面场景相机自运动极小,相机空间与世界空间编码几乎等价,表示优势无法显现。
- EgoVid-Pro 上 Ours 超越所有基线,验证了 Plücker Hand Map 在大幅自运动场景下的独特优势(表 2,第 8 页)。
- H2O OOD 评估中 Ours TransErr 1.80、RTE 4.87,优于多数基线,显示跨数据集泛化能力(表 A,第 15 页)。
- 定性对比(图 6,第 7 页)显示 ARCTIC-trained 基线漂移到实验室风格,甚至在合成手上出现动捕标记点;Ours 保持原始场景外观。
- 过滤策略消融(图 8,第 9 页)显示 naive 过滤引入主角与旁观者的歧义,EgoSim 的静态场景表示抑制了环境动态,Ours 在跟随主角手部轨迹的同时保持自然环境动态。
- 图 5(第 6 页)的统计证实保留与拒绝的 tracklet 在相机空间朝向分布上高度重叠,证明 3D 几何过滤的必要性。
阅读时需要注意
- Plücker Hand Map 在法线方向与视线方向近平行的 grazing 配置下数值敏感,论文称实践中罕见但未给出定量分析。
- 训练依赖 HaWoR 单目重建质量,检测失败或遮挡严重时标注可能退化,误差会传导到生成模型。
- 评估指标依赖 HaWoR 重建生成视频的手部与相机轨迹,存在重建误差传导,可能高估或低估真实控制精度。
- EgoVid-Pro 训练子集仅 34,078 个视频(完整双标注前 81 帧),非全部 103K 片段,实际训练规模小于数据集名义规模。
关联工作
- Hand2World 是第一人称手部控制视频生成的早期工作,投影 MANO 网格作为控制信号,但局限于桌面场景。Generated Reality 将 3D 骨架 tokenize 后控制生成,同样受限于动捕数据。
- FMC 提出自由形式 6D 相机与物体姿态控制,作者将其适配为手部控制基线 FMC*。JointControl 处理遮挡感知的稀疏 3D 手关节控制,作者增强相机控制分支后对比。
- EgoSim 是大规模第一人称数据标注与静态场景表示的代表,作为过滤策略消融基线。HaWoR 是标注管线的前端与评估工具,从第一人称视频重建世界系手部运动。
- CameraCtrl 提出 Plücker 射线相机控制表示,是 Plücker Hand Map 的表示基础。本文的贡献在于将这一表示从相机扩展到手的表面法线。