三分钟导读:HandFlow提出了一种基于流匹配(Flow Matching)的完全生成式框架,通过双流Transformer和置信度感知连续掩码,从单目视频中重建具有时间连贯性的4D手部运动,显著优于现有的确定性回归方法。
英文题目:HandFlow: Fully Generative 4D Hand Recovery with Flow Matching
论文出处:arXiv 每日论文精选 · arXiv:2607.11221
原始论文:PDF / 论文页面
对应视频标题:HandFlow:基于流匹配的完全生成式4D手部重建|推荐指数:★★★★★
这篇论文解决什么问题?
单目4D手部重建面临遮挡、运动模糊和视角变化导致的视觉歧义;现有确定性回归方法缺乏时间上下文,易产生抖动,且在模糊观测下无法表示多模态后验分布,导致姿态不准确或运动不连贯。
核心创新
- 完全生成式流匹配框架:将单目4D手部重建表述为MANO参数空间中的条件生成,而非确定性回归。
- 双流Transformer:联合建模手部参数(z-stream)和视觉-骨骼条件(c-stream),无需自回归解码即可捕获长程依赖。
- 置信度感知连续掩码(cmask):根据检测置信度在观测特征和可学习掩码token之间插值,增强对遮挡和模糊的鲁棒性。
- 速度混合重叠窗口推理:在ODE集成期间融合重叠窗口的预测,消除边界伪影并实现长视频的高效重建。
方法概览
HandFlow将重建建模为MANO参数空间中的条件生成任务。使用冻结的HaMeR前端提取视觉token和2D骨架,并通过置信度感知连续掩码(cmask)处理不可靠观测。核心是一个Flux风格的双流Transformer,在全时间窗口上联合注意力机制去噪MANO参数。推理时通过单次ODE积分采样,并采用速度混合(velocity blending)的重叠窗口策略以处理长视频。
逐图理解论文
方法概览:完全生成式流匹配

HandFlow将重建建模为MANO参数空间中的条件生成任务。通过冻结的HaMeR前端提取视觉token和2D骨架,并利用置信度感知连续掩码(cmask)处理不可靠观测。核心是一个Flux风格的双流Transformer,在全时间窗口上联合注意力机制去噪MANO参数。
实验设置:数据集与基线对比

HandFlow在DexYCB (s0)和HOT3D (val)数据集上进行评估,与HaMeR, WiLoR, Deformer, HaWoR, UniHand, Dyn-HaMR等基线方法进行对比。消融研究分析了条件模态、连续掩码、去噪器架构和重叠推理策略的影响。
效率分析:速度提升12倍

在计算效率方面,HandFlow在150帧序列上重建速度为47 fps,比最快的视频基线快12倍。尽管VRAM占用较高,但通过并行去噪所有时间窗口最大化吞吐量,其在保持高精度的同时实现了极高的推理效率。
消融实验:关键组件验证

消融实验验证了各组件的有效性。移除连续掩码或改变去噪器架构均导致性能下降。重叠推理策略中的速度混合显著减少了边界伪影,提升了重建准确性,证明了其在长视频处理中的必要性。
可视化分析:遮挡与模糊场景

可视化对比显示,在严重遮挡和模糊场景下,HandFlow能恢复更平滑、更准确的手部轨迹。相比HaWoR的时间漂移和HaMeR的姿态错位,HandFlow通过生成先验有效推断出不可见部分的合理姿态。
实验与关键结果
- 在DexYCB (s0)和HOT3D (val)数据集上进行评估。
- 与HaMeR, WiLoR, Deformer, HaWoR, UniHand, Dyn-HaMR等基线方法进行对比。
- 消融研究:分析条件模态、连续掩码、去噪器架构和重叠推理策略的影响。
- 计算效率评估:在NVIDIA H100 GPU上测量重建时间和内存占用。
- DexYCB RA-MPJPE 8.12 mm (SOTA)(第 6 页)
- HOT3D WA-MPJPE 16.17 mm (SOTA)(第 6 页)
- HOT3D Accel 4.18 m/s2 (SOTA)(第 6 页)
- HOT3D RTE 2.32% (SOTA)(第 6 页)
- 150帧序列重建速度47 fps,比最快视频基线快12倍(第 1 页)
阅读时需要注意
- 依赖前端检测器(如HaMeR)的质量,若前端失效,生成模型难以纠正严重错误。
- VRAM占用较高,因为并行去噪所有时间窗口以最大化吞吐量(可通过减少窗口并行度缓解)。
- 世界空间精度受限于SLAM相机位姿恢复的误差。
- 消融实验中的指标是在合并的DexYCB和HOT3D测试集上计算的,绝对值与主表不可直接比较,但相对排序有效。
- HOT3D基准没有公开的ground truth,使用从训练集划分的验证集进行评估。
- UniHand的HOT3D结果引用自原论文,因为其代码和数据集划分未公开。
关联工作
- HaWoR:基线方法,展示明显的时间漂移和姿态错位,HandFlow在速度和精度上均优于它。(第 1 页)
- HaMeR:使用冻结的HaMeR作为前端提取视觉特征和骨架。(第 4 页)
- UniHand:最相关的生成式基线,HandFlow在世界空间精度和轨迹指标上显著优于它。(第 5 页)
- Dyn-HaMR:动态相机下的多阶段优化基线,HandFlow在速度和世界空间精度上更优。(第 6 页)
- Flux:HandFlow的双流Transformer架构受Flux启发。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HandFlow:基于流匹配的全生成式4D手部重建
徐明曦∗,中国香港科技大学(广州) 段博文∗,中国香港科技大学(广州) 顾毅,中国香港科技大学(广州) 沈正阳,美国谷歌公司 徐仁景,中国香港科技大学(广州) 岳玉涛†,中国香港科技大学(广州)
输入视频 1 输入视频 2
2026年 7月 13日 [cs.CV]
图 1. 给定单目 RGB 视频,HandFlow 通过全生成式流匹配框架重建时间连贯的 4D 手部运动。 与 HaWoR [Zhang et al. 2025](橙色)相比,后者显示出明显的时间漂移和手部姿态错位,HandFlow(蓝色)在涉及快速运动和大幅视角变化的具有挑战性的序列中,恢复了更平滑、更准确对齐的手部轨迹。它重建每个窗口的速度也比 HaWoR 快一个数量级以上。真实手部运动以绿色显示。
准确的单目 4D 手部重建仍然具有挑战性。逐帧判别性回归器缺乏时间上下文,经常产生抖动预测。时间模型通过聚合帧间信息来提高一致性,但它们通常是确定性回归器,因此容易受到遮挡和运动模糊引起的模糊观测的影响。生成式建模通过学习合理手部运动序列的先验,提供了一种自然的替代方案,当视觉证据不完整或不可靠时,能够实现连贯的手部状态恢复。
受此观察的启发,我们提出了 HandFlow,这是一个用于时间连贯的 3D 手部姿态和形状估计的全生成式流匹配框架。给定视觉和骨骼观测,HandFlow 通过单次常微分方程(ODE)积分去噪整个时间窗口的 MANO 参数。为此,我们使用了一个 Flux 风格的双流 Transformer,它跨整个序列进行注意力计算以捕获长程依赖关系,而无需自回归解码,以及一个置信度感知连续掩码(cmask)机制,该机制将观测特征与可学习的掩码标记混合,以处理噪声或缺失的观测。在 DexYCB 和 HOT3D 上的实验表明,HandFlow 达到了最先进(state-of-the-art)的性能,在世界空间精度和时间平滑度方面取得了特别显著的增益。与最强的基线相比,它将世界空间姿态误差降低了 30% 以上,并在所有评估方法中实现了最低的加速度误差,同时在逐帧姿态精度方面保持竞争力。此外,在单个 GPU 上,HandFlow 以 47 fps 的速度重建 150 帧序列,比最快的先前基于视频的方法快约 12 倍,且重建本身仅占端到端延迟的一小部分。我们的模型和代码公开在 https://mxxu00.github.io/HandFlow/。
∗ 这些作者对本工作贡献相同。 † 通讯作者。
第 2 页
2 • Xu 等人
附加关键词和短语:4D 手部重建,运动捕捉,流匹配 • 我们将单目 4D 手部重建表述为 MANO 参数空间中的条件生成问题,并引入 HandFlow,这是一个完全生成的流匹配框架,用于从单目视频中重建时间连贯的运动序列。 • 我们设计了一个双流 Transformer,它在整个时间窗口内联合建模手部参数和视觉-骨骼条件,无需自回归解码。 • 我们引入了置信度感知连续掩码(cmask),它根据每帧的检测置信度在观测到的条件特征和可学习的掩码标记之间进行插值,提高了对遮挡和不可靠观测的鲁棒性。 • 我们提出了速度混合的重叠窗口推理方法,其可并行的窗口分解提供了高吞吐量的重建,同时具有可调节的内存吞吐量预算。
1 引言 准确的单目 4D 手部重建旨在从单个 RGB 视频中恢复时间连贯的 3D 手部网格,在增强现实/虚拟现实 [Wang 等人 2020]、机器人 [Christen 等人 2024; Pan 等人 2025] 和人机交互 [Liu 等人 2022] 中具有广泛应用。尽管在手部网格恢复方面取得了显著进展,但在长视频上实现稳定且准确的重建仍然具有挑战性。这种困难主要源于单目观测固有的歧义性。手部通常移动迅速,会发生自遮挡,与物体交互,并部分或完全离开相机视野。在这种情况下,单张图像甚至短视频片段可能对应多个合理的 3D 手部状态。
大多数现有方法将手部重建表述为确定性回归问题。逐帧方法 [Chen 等人 2025; Pavlakos 等人 2024; Potamias 等人 2025] 独立估计每一帧,在手部清晰可见时表现良好。然而,缺乏时间推理会导致它们的预测在帧间波动。时序方法 [Fu 等人 2023; Ye 等人 2026; Yu 等人 2025; Zhang 等人 2025] 通过聚合时间信息来缓解这种抖动。尽管如此,它们通常仍为给定的输入视频产生单一的点估计。当视觉证据模糊时,这种确定性映射无法表示合理手部运动的多模态后验分布,往往导致不准确、过度平滑或运动学上不可预测的预测,如图 1 所示。
这激发了对单目 4D 手部重建的生成式视角。我们将视频到运动的映射视为确定性回归问题,而是将其表述为 MANO 参数空间 [Romero 等人 2017] 中的条件生成。核心思想是恢复一条能够解释可用视觉证据并保持在合理手部运动流形上的轨迹。
基于这一视角,我们提出了 HandFlow,这是一个基于整流流 [Liu 等人 2023] 的框架,用于从单目视频中进行时间连贯的 4D 手部重建。HandFlow 不回归单一输出,而是学习在观测到的视觉和骨骼证据条件下合理的 MANO 运动序列的分布,并通过单次 ODE 积分采样一条连贯的轨迹。两个结构性挑战塑造了其设计。第一个挑战是建模整个时间窗口内的长程依赖关系,这通过一种 Flux 风格的双流 Transformer 来解决,该 Transformer 在整个序列上联合关注手部参数和视觉-骨骼条件,无需自回归解码。第二个挑战是遮挡和运动模糊下的不可靠观测,这通过 cmask 来解决,这是一种置信度感知连续掩码策略,根据每帧的检测置信度在观测特征和可学习的掩码标记之间进行插值。带有速度混合的重叠窗口方案进一步将重建扩展到长视频,同时保持了效率。
总之,我们的主要贡献如下:
2 相关工作 单图像 3D 手部重建。早期方法通过逆运动学从 2D 关键点估计 3D 手部姿态,但受限于关键点检测的准确性。MANO 参数化手部模型 [Romero 等人 2017] 的引入通过提供可微的手部表示实现了端到端训练。最近的基于 Transformer 的方法显著推进了单图像重建。HaMeR [Pavlakos 等人 2024] 使用 ViT-Huge 主干网络扩大了数据和模型规模,实现了鲁棒的野外性能。WiLoR [Potamias 等人 2025] 通过结合卷积手部检测器和 Transformer 回归器进一步提高了定位和重建精度。HandOS [Chen 等人 2025] 在一阶段框架中统一了检测和重建。虽然这些方法实现了强大的逐帧精度,但它们独立处理每张图像,并在应用于视频时产生时间不一致的输出。
基于视频的四维手部重建。已经提出了一些方法来利用时间信息以获得更一致的手部运动估计。Deformer [Fu 等人 2023] 引入了一个动态融合模块,该模块扭曲相邻帧的预测以支持当前帧,并结合了专注于易出错关节的 maxMSE 损失。TCMR [Choi 等人 2021] 通过平衡过去和未来帧信息来解决人体重建中的时间不一致性问题。HaWoR [Zhang 等人 2025] 通过解耦基于 SLAM 的相机轨迹恢复中的相机空间手部估计,从第一人称视频重建世界空间手部运动。Dyn-HaMR [Yu 等人 2025] 通过多阶段优化管道解决了动态相机这一具有挑战性的设置。HaPTIC [Ye 等人 2026] 在基于图像的 Transformer 之上使用跨视图和全局跨注意力层来预测 4D 手部轨迹。尽管这些方法建模了时间依赖关系,但它们存在一个根本性的局限性:它们是确定性回归器,将观测映射到单一输出,这使得它们在存在多个同样合理的手部状态的模糊输入面前变得脆弱。
第 3 页
HandFlow: 基于流匹配的完全生成式4D手部重建 • 3
用于姿态和运动的生成模型。扩散模型在图像 [Xu et al. 2024] 和运动领域已展现出生成多样化且高质量输出的显著成功。在人体运动生成方面,MDM [Tevet et al. 2023] 及类似方法应用扩散模型从文本或动作条件生成运动序列。最近,UniHand [Sun et al. 2026] 提出了一种统一的基于扩散的框架,将估计和生成都表述为条件运动合成,使用变分自编码器(VAE)将结构化信号压缩到共享潜在空间中。HandDiff [Cheng et al. 2024] 将扩散应用于从图像-点云进行3D手部姿态估计,但仅作用于单帧。MaskHand [Saleem et al. 2025] 使用带有置信度引导采样的掩码建模与 VQ-MANO 令牌进行单图像重建。与我们的公式最相关的是 FMPose3D [Wang et al. 2026b],它应用流匹配进行单目3D姿态估计,但其目标是从2D关键点生成单帧身体姿态,而 HandFlow 从多模态视觉-骨骼条件中生成 MANO 参数空间中时间连贯的4D手部运动。DuoMo [Wang et al. 2026a] 通过双重扩散设计重建世界空间人体运动;而 HandFlow 则通过单次流匹配传递后接基于 SLAM 的相机姿态估计来恢复世界空间手部轨迹。相比之下,HandFlow 直接在原始 MANO 参数上运行,无需潜在压缩(保留完整的表示能力),并使用需要比扩散采样少得多的积分步数的整流流公式 [Liu et al. 2023]。
3 方法
给定一个包含 $T$ 帧的单目视频片段,我们的目标是通过整流流 [Liu et al. 2023] 在 MANO 参数空间 [Romero et al. 2017] 中恢复时间连贯的3D手部网格序列。如图2所示,我们的流水线包含三个阶段:(1) 从输入视频中提取视觉和骨骼条件,并使用连续掩码机制处理不可靠的观察;(2) 通过单次 ODE 积分,使用双流 Transformer 从噪声到信号去噪打包的 MANO 参数序列;(3) 结合流匹配与几何和时间约束的复合训练目标。
每个手部状态由共享的形状系数 $\boldsymbol{\beta} \in \mathbb{R}^{10}$、每帧关节姿态 $\boldsymbol{\theta}_i \in \mathbb{R}^{48}$(轴角格式)以及全局平移 $\boldsymbol{\tau}_i \in \mathbb{R}^3$ 表示。我们将时间窗口内的参数打包成单个扁平向量,并对每个维度独立应用每组件标准化,即减去数据集均值并除以标准差:
$$ \bar{x}_1 = \text{normalize}([\boldsymbol{\beta} | \boldsymbol{\theta}_1, \dots, \boldsymbol{\theta}_T | \boldsymbol{\tau}_1, \dots, \boldsymbol{\tau}_T]) \in \mathbb{R}^d, \quad d = 10 + 51T. \quad (1) $$
所有流匹配操作均在此归一化空间中执行。我们在计算几何辅助损失和应用 MANO 前向运动学之前对预测进行去归一化。
3.1 整流流公式
我们采用整流流框架 [Lipman et al. 2023; Liu et al. 2023],这是流匹配的一种特殊情况,它通过直线(线性)插值路径连接噪声和数据,因其少步采样效率而被选用。在训练时,我们采样时间步 $t \sim p(t)$ 并在高斯噪声与归一化的 MANO 目标之间构建中间状态:
$$ \bar{x}_t = (1 – t) \bar{x}_0 + t \bar{x}_1, \quad (2) $$
其中 $\bar{x}_0 \sim \mathcal{N}(0, I)$ 表示标准高斯噪声。在此线性路径下,目标速度由 $v^* = \bar{x}_1 – \bar{x}_0$ 给出。去噪器 $f_\phi$ 被训练以从噪声状态 $\bar{x}_t$、时间步 $t$ 和条件信号 $c$ 中预测该速度 $v^*$:
$$ \mathcal{L}_{fm} = \| f_\phi(\bar{x}_t, t, c) – v^* \|^2. \quad (3) $$
遵循 [Black Forest Labs 2024],我们从对数正态分布中采样 $t$ 并应用时间移位映射,将训练密度集中在中间时间步,以提高序列级生成的采样效率。
在推理时,我们从 $t=0$ 到 $t=1$ 使用欧拉积分求解 ODE,步数为3(精度平台上的稳定操作点;见附录C),从随机噪声开始,到达去噪后的 MANO 参数序列 $\hat{\bar{x}}_1$,然后对其进行去归一化以恢复最终预测。
3.2 条件表示
条件信号 $c$ 由两种互补模态构建:密集视觉特征和稀疏骨骼线索。两者均使用冻结的 HaMeR 检测器 [Pavlakos et al. 2024] 逐帧提取。给定输入图像,HaMeR 定位手部,裁剪 $256 \times 256$ 的手部区域,并预测21个2D关键点及其检测置信度分数。
视觉特征。对于每个裁剪的手部图像,我们使用冻结的 HaMeR ViT-Huge 主干网络 [Pavlakos et al. 2024] 提取补丁级特征,轻量级帧压缩器将其蒸馏为单个图像令牌 $c_{img}^i \in \mathbb{R}^D$。该压缩器由8个交叉注意力池化层组成。
骨骼特征。HaMeR 预测的2D关键点提供稀疏几何引导。对于21个关键点中的每一个,我们使用裁剪相机的内参 $(f_x, f_y, c_x, c_y)$ 将其图像坐标反投影到相机归一化的3D射线中:
$$ r_{i,j} = \left[ \frac{u_{i,j} – c_x}{f_x}, \frac{v_{i,j} – c_y}{f_y}, 1 \right], \quad (4) $$
其中 $(u_{i,j}, v_{i,j})$ 表示第 $i$ 帧中第 $j$ 个关键点的2D坐标。每条射线进一步使用6个频率带进行正弦位置编码 [Mildenhall et al. 2021] 进行编码。这种基于射线的表示将相机内参纳入骨骼条件中,这已被证明对于准确的3D重建至关重要 [Baradel et al. 2024; Feng et al. 2025; Li et al. 2022; Wang et al. 2026a]。所有21个关键点的编码射线被展平,并通过两层 MLP 投影以获得每帧骨骼令牌 $c_{skel}^i \in \mathbb{R}^D$。
连续掩码。当手部严重遮挡、模糊或位于相机视野之外时,HaMeR 通常会产生低置信度的检测结果,使得视觉和骨骼观察都不可靠。为了处理这种情况,我们引入了 cmask(置信度感知连续掩码),这是一种将每个条件令牌与可学习掩码令牌插值的连续掩码机制(公式5)。令 $c_k^i \in \mathbb{R}^D$ 表示第 $i$ 帧的条件令牌
第 4 页
4 • Xu et al.
1. 输入视频 2. 预处理 3. HandFlow 去噪器 4. 输出 序列 手部 Ƹ𝑐𝑖= 𝑚𝑖𝑐𝑖+ (1 −𝑚𝑖)𝑐𝑚𝑎𝑠𝑘 双流 Transformer × L 检测 置信度 连续掩码 c-stream 单流 ODE 流 求解器 交叉 注意力 压缩器 帧 𝑐𝑡 块 速度 × M 混合 手部 Patch tokens 图像 tokens 编码器 RoPE 内参 Skel-Ray 1 编码器 窗口 ⋮ 2 ⋮ 2D 关键点 骨架 tokens Seq z-stream ⋮ 窗口 全
𝑥0~𝑁(0, 𝐼) 线性 SLAM ··· 𝑥𝑡 𝑧𝑡 输出投影 T 帧 相机到世界 T 帧
图 2. HandFlow 概述。冻结的 HaMeR [Pavlakos et al. 2024] 前端提取视觉 tokens、2D 骨架和置信度,并通过置信度感知的连续掩码将其压缩为条件 tokens。随后,双流流匹配 Transformer 在整个时间窗口内从噪声中对 MANO 姿态、平移和形状 tokens 进行去噪;对于长视频,在 ODE 积分期间通过速度混合合并重叠窗口。
𝑖,其中 𝑘∈{img, skel}。掩码条件 token 定义为 根据时间对齐分配索引:形状 token 被分配 位置 0;对于每一帧 𝑖,姿态 token z𝜃𝑖和平移 token ˆc𝑘𝑖= 𝑚𝑖c𝑘𝑖+ (1 −𝑚𝑖)c𝑘mask, (5) z𝜏𝑖均被分配位置 𝑖;c-stream 中对应的图像和 骨架 tokens 也被分配位置 𝑖。其中 𝑚𝑖∈[0, 1] 是 HaMeR 检测置信度,c𝑘mask ∈ R𝐷是模态 𝑘 的可学习掩码 token。在训练过程中,我们 单流块。在双流块之后,z- 和 c-tokens 被连接起来,并通过遵循 DiT 架构 [Peebles and 额外对约 20% 的帧应用随机掩码作为正则化。 Xie 2023] 的单流自注意力块进一步处理,使用相同的自适应调制方案。 最终的条件序列是通过连接所有帧的掩码图像和骨架 tokens 构建的: 输出投影。最后,z-stream tokens 通过专用的线性层投影回 c = [ˆcimg1 , ˆcskel1 , . . . , ˆcimg𝑇 , ˆcskel𝑇 ] ∈R2𝑇×𝐷. (6) 其原始维度并解包,以重建预测的干净状态 ˆ¯x1 ∈R𝑑。
3.3 双流 Transformer 3.4 训练目标 去噪器采用受 Flux [Black 模型采用复合损失进行训练。主要项是流匹配损失 Lfm(公式 3)。我们进一步引入对一步干净预测 ˆ¯x1 = ¯x𝑡+ (1 −𝑡) ˆv 的辅助监督,该预测是通过对去噪器预测的速度 ˆv = 𝑓𝜙(¯x𝑡,𝑡, c) 沿流积分一步获得的。然后,我们将 ˆ¯x1 反归一化回原始 Forest Labs 2024] 启发的双流架构。它联合处理潜在手部参数, MANO 参数空间,然后计算损失。具体而言, 称为 z-stream,以及条件 tokens,称为 c-stream。架构概述如图 2 所示。 Tokenization。z-stream 将噪声状态 ¯x𝑡 划分为 1+2𝑇 L𝛽是形状系数的 ℓ1 损失;Lvel 和 Lacc 是打包后的 tokens:一个形状 token z𝛽,𝑇个姿态 tokens {z𝜃𝑖}𝑇𝑖=1 和𝑇个平移 MANO 参数(关节姿态和全局平移联合)上的一阶和二阶时间有限差分损失(ℓ1),直接在参数空间中监督运动平滑性;Lreproj 是预测的 21 个 MANO 关节与真实值之间的 ℓ1 误差,每个关节都通过裁剪相机内参 (𝑓𝑥, 𝑓𝑦,𝑐𝑥,𝑐𝑦) 投影到 256×256 的裁剪图像平面上;Lj3d 是绝对全局 3D 关节位置的毫米级 ℓ1 误差。所有辅助损失均乘以平均采样时间步长 ¯𝑡。所有损失项中均屏蔽无效填充帧。损失权重和训练超参数见附录 B。 tokens {z𝜏𝑖}𝑇𝑖=1。每个组件通过专用的线性层从其原始维度投影到隐藏维度 𝐷。c-stream 采用第 3.2 节中描述的 2𝑇 个条件 tokens。 双流块。每个双流块对 z- 和 c-stream 应用联合注意力。流时间步 𝑡首先通过正弦嵌入进行编码,然后经过 MLP 以产生自适应 LayerNorm 调制参数 (𝛾, 𝛽, 𝛼)。在每个块内,z-stream 和 c-stream 的 QKV 投影分别计算。然后将得到的查询、键和值连接起来并输入到共享的注意力操作中,使潜在手部 tokens 能够同时关注其他潜在 tokens 和条件上下文。注意力输出随后被拆分回两个流,并由流特定的前馈网络处理。 旋转位置编码 (RoPE) [Su et al. 2024] 应用于 QK 归一化后的查询和键。我们分配位置
3.5 重叠窗口推理 对于长度超过 𝑇 帧的视频推理,非重叠窗口会在窗口边缘留下边界帧,其中有限的
第 5 页
HandFlow: 基于流匹配的完全生成式 4D 手部重建 • 5
时间上下文会导致速度发生突变,从而降低轨迹质量。因此,我们采用重叠的滑动窗口。长度为 $N$ 的完整序列被划分为长度为 $T$ 的窗口,其中每个窗口与前一个窗口共享 $o$ 帧,对应的步长为 $s = T – o$。所有窗口使用相同的逐帧初始噪声:无论全局帧 $g$ 出现在哪些窗口中,它都被分配相同的高斯噪声向量。这确保了 ODE 积分从全局一致的噪声状态开始。
关键问题是如何合并出现在多个窗口中的帧的预测。一种简单的策略,我们称之为事后平均(post-hoc averaging),即为每个窗口运行独立的 ODE,并对重叠帧的最终去噪状态 $\hat{x}_1$ 进行平均。然而,由于不同的窗口遵循不同的 ODE 轨迹,它们在归一化参数空间中可能对同一个物理帧产生不一致的预测。对这些发散端点进行平均会引入不自然的速度不连续性,特别是在重叠边界附近(见附录 F)。
相反,我们执行速度混合(velocity blending),通过在 ODE 积分期间融合预测,并为每个全局帧维护一个共享状态。具体而言,设全局帧 $g$ 被窗口 $w_1, \dots, w_k$ 覆盖,并设 $\ell_i$ 表示 $g$ 在窗口 $w_i$ 内的局部帧索引。我们分配一个中心距离权重:
$$ \omega(w_i, \ell_i) = \max \left( 0.01, 1 – \frac{|\ell_i – c|}{c} \right), \quad c = \frac{T-1}{2}, \quad (7) $$
该权重给予靠近窗口中心的预测更大的权重,因为那里的时间上下文更加平衡。在每个 ODE 步骤中,帧 $g$ 的混合速度计算如下:
$$ \tilde{v}_g = \frac{\sum_{i=1}^k \omega(w_i, \ell_i) \hat{v}_{w_i, \ell_i}}{\sum_{i=1}^k \omega(w_i, \ell_i)}, \quad (8) $$
权重 $\omega$ 控制逐帧的姿态和平移速度;序列共享的形状 $\boldsymbol{\beta}$ 没有逐帧索引,因此我们通过所有窗口的无加权平均来混合其速度,$\tilde{v}_\beta = \frac{1}{k} \sum_{i=1}^k \hat{v}_{\beta, w_i}$。共享状态通过以下方式更新:
$$ x_g \leftarrow x_g + \tilde{v}_g \Delta t, \quad (9) $$
其中 $\Delta t$ 表示 ODE 步长。
由于所有窗口速度都是从相同的逐帧状态评估得出的, resulting 轨迹遵循单一连续积分路径。重叠帧也从互补的视觉-骨骼观察中受益:当一帧位于一个窗口的边界附近并受到遮挡或运动模糊的影响时,相邻窗口可能将同一帧置于更靠近其中心的位置,并提供更可靠的条件上下文。值得注意的是,每个 ODE 步骤中的所有窗口都可以作为单个批次并行处理。因此,速度混合仅引入微小的额外推理开销,同时显著改善轨迹连续性,如附录 F 中分析所示。
4 实验
4.1 数据集
我们在两个基准上评估我们的方法,涵盖受控和野外场景。DexYCB [Chao et al. 2021] 包含 1,000 个视频序列,展示受试者抓取 YCB 物体,由多个校准相机拍摄。我们使用标准评估协议,并在默认相机视图的右手裁剪图像上进行评估。HOT3D [Banerjee et al. 2025] 是一个最近的基准,具有用于桌面交互的多样化 3D 手部标注,由自视多视角相机捕捉。其官方验证剪辑没有公开的真实值,因此,正如该基准的常见做法一样,我们从官方训练集中保留每个参与者的验证分割,并在主视图的裁剪图像上进行评估。这两个数据集都提供 MANO 真实值标注。所有公开代码的方法都使用其原生管道进行端到端评估。我们还报告了早期的基线 [Chen et al. 2023, 2021; Duran et al. 2024; Kocabas et al. 2020; Lin et al. 2021; Park et al. 2022; Valassakis and Garcia-Hernando 2024]。UniHand [Sun et al. 2026] 是最密切相关的生成式基线,也被包含在内;其代码和 HOT3D 分割未记录文档(我们发布了两者),因此我们引用其原始论文中的数字。HandFlow 在两个基准的大部分指标上均优于它。指标定义见附录 A。
4.2 相机空间评估
我们在 DexYCB(表 1)上评估相机空间姿态准确性和遮挡鲁棒性;世界空间和轨迹指标在 4.3 节中对 HOT3D 进行评估。
姿态准确性。在完整测试集(All)上,HandFlow 在每个指标上都是最佳方法,其中 RA-MPJPE 的差距最大:8.12 mm,而次优的 Deformer 为 13.64 mm,相对减少 41%。该差距在误差分布中保持一致:$AUC_{RA}$ 达到 0.839,而 HaWoR 为 0.779,因此增益并非集中在简单案例上。
遮挡分析。我们根据不可见手部顶点的比例将测试集分为 25%–50%、50%–75% 和 75%–100% 遮挡。HandFlow 在完整集(3.88 mm)和轻度遮挡(25%–50%:4.21 mm)上领先,而 UniHand(也是一种生成式方法)在重度遮挡下略微领先(50%–75%:4.25 vs. 4.35;75%–100%:4.26 vs. 4.85)。关键在于,两种生成式方法在最难的 75%–100% 区间内均保持在 5 mm 以下,而单帧回归器则上升至 5.68 mm(WiLoR)和 7.37 mm(HandOccNet),证实了生成式建模而非特定架构驱动了重度遮挡下的鲁棒性。确定性回归器在重度遮挡下倾向于对模糊观察进行平均,而我们的生成式公式恢复了连贯的手部补全,如图 4 所示:即使手部大部分不可见,HandFlow 也能保持合理且运动学一致的姿态。
图 3 进一步对比了 HandFlow 与基线在重度遮挡帧上的表现:侧面和俯视图揭示了叠加视图所隐藏的深度误差。
4.3 世界空间评估
HOT3D 是更具挑战性的基准:自视、多视角捕捉,频繁出现自遮挡和物体遮挡,我们在此额外评估世界坐标系中的全局手部轨迹。表 2 报告了逐帧姿态准确性(MPJPE, PA-MPJPE)、世界空间轨迹和形状准确性(W-MPJPE, WA-MPJPE)、时间平滑度(Accel)和根平移误差(RTE)。所有方法的全球相机姿态均通过 SLAM 恢复:HandFlow、Dyn-HaMR 和基于图像的基线(标记为 +SLAM)使用
第 6 页
6 • Xu 等人
表 1. DexYCB (s0) 上的遮挡鲁棒性评估。RA-MPJPE 和 PA-MPJPE 单位为毫米;$AUC_{RA}$ 和 $AUC_{PA}$ 归一化至 [0, 1]。最佳结果加粗,次佳结果下划线。其他基线结果取自 [Fu et al. 2023; Sun et al. 2026; Zhang et al. 2025]。
全部 遮挡 (25%–50%) 遮挡 (50%–75%) 遮挡 (75%–100%) 方法 RA-MPJPE ↓ $AUC_{RA}$↑ PA-MPJPE ↓ $AUC_{PA}$↑ PA-MPJPE ↓ $AUC_{PA}$↑ PA-MPJPE ↓ $AUC_{PA}$↑ PA-MPJPE ↓ $AUC_{PA}$↑
MeshGraphormer 16.21 0.691 6.41 0.872 6.85 0.863 7.22 0.856 7.76 0.845 SemiHandObj – – 6.33 0.874 6.70 0.866 7.17 0.857 8.96 0.821 HandOccNet – – 5.80 0.884 6.22 0.876 6.43 0.872 7.37 0.853 WiLoR – – 5.01 0.900 – – 5.42 0.892 5.68 0.887
S2HAND(V) 19.67 0.625 7.27 0.855 7.74 0.845 7.71 0.846 7.87 0.843 VIBE 16.95 0.675 6.43 0.871 6.72 0.865 6.84 0.864 7.06 0.858 TCMR 16.03 0.701 6.28 0.875 6.56 0.869 6.58 0.868 6.95 0.861 Deformer 13.64 0.740 5.22 0.896 5.22 0.886 5.70 0.886 6.34 0.873 HaWoR 14.22 0.779 4.76 0.905 – – 5.03 0.899 5.07 0.899 UniHand – – 4.08 0.918 4.22 0.913 4.25 0.912 4.26 0.912
HandFlow 8.12 0.839 3.88 0.922 4.21 0.916 4.35 0.913 4.85 0.903
表 2. HOT3D (val) 上的综合评估。世界空间精度单位为毫米,加速度误差单位为 m/s²,RTE 单位为 %。基于图像的方法 (HaMeR, WiLoR) 使用 ViPE-SLAM [Huang et al. 2025] 进行相机位姿恢复。最佳结果加粗,次佳结果下划线。M.S. Opt. 是多阶段优化的缩写。其他基线结果取自 [Sun et al. 2026; Zhang et al. 2025]。 表 3. 在 150 帧 HOT3D 序列上(批量大小为 1,在单个 NVIDIA H100-80 GB GPU 上测量)的计算效率比较。我们报告相机空间 MPJPE(无世界坐标对齐;世界空间结果见表 2)、重建时间、SLAM 预处理时间、总运行时间和峰值 GPU 内存。HandFlow 和 Dyn-HaMR 共享相同的 ViPE-SLAM [Huang et al. 2025] 前端(因此 SLAM 时间相同);HaWoR 使用其原生 SLAM,因此重建列隔离了方法的核心差异。
Method 范式 MPJPE ↓ PA-MPJPE ↓ W-MPJPE ↓ WA-MPJPE ↓ Accel ↓ RTE ↓ SLAM 时间 HaMeR + SLAM 回归 – 9.39 156.03 43.37 19.25 4.77 隔离方法的核心差异。 HandDGP + SLAM 回归 – 17.88 154.30 42.93 20.17 3.18 WiLoR + SLAM 回归 – 6.00 151.67 39.49 8.02 2.99 HMP + SLAM 回归 – 10.51 119.41 39.46 5.50 2.79 2.44 方法 MPJPE ↓ 重建 (s) SLAM (s) 总时间 (s) VRAM (GB) Dyn-HaMR M.S. Opt. 82.08 8.22 69.11 31.01 4.77 HaWoR 回归 77.97 6.32 73.88 27.37 11.57 5.74 UniHand 去噪 – 4.76 63.97 25.24 4.93 – Dyn-HaMR 58.12 288.58 16.21 304.79 1.1 HandFlow 去噪 72.00 5.49 43.00 16.17 4.18 2.32 HaWoR 68.11 38.13 15.78 53.91 6.9 HandFlow 23.79 3.19 16.21 19.40 13.1
ViPE-SLAM [Huang et al. 2025],而 HaWoR 使用其自身的 SLAM。 我们依次讨论世界空间精度和时间平滑性。 世界空间精度。HandFlow 在所有世界空间和轨迹指标上均领先:W-MPJPE、WA-MPJPE 和 RTE,其中相机空间位姿误差会随相机位姿漂移而累积。优势在世界空间中最为显著:WA-MPJPE 为 16.17 mm,而 UniHand 为 25.24,HaWoR 为 27.37,Dyn-HaMR 为 31.01;RTE 为 2.32%,而最接近的竞争者为 2.44%。仅每帧精度的优势并不能转化为更好的全局运动:UniHand 在表中获得了最低的每帧 PA-MPJPE(4.76 mm),但其世界空间误差比 HandFlow 高出约 50%(W-MPJPE 63.97 对比 43.00;WA-MPJPE 25.24 对比 16.17)。这种脱节表明,准确的全局运动依赖于时间连贯性,而不仅仅是单帧精度。图 5 从共享的 3D 视角渲染了完整序列,其中 HandFlow 在完整性和准确性方面最接近真实值。 时间平滑性。HandFlow 还实现了最低的加速度误差(Accel 4.18 m/s²),表明重建具有时间连贯性,而非简单拼接的每帧估计。Dyn-HaMR 达到第二低的 Accel(4.77 m/s²),但其世界空间误差仍远高于 HandFlow(WA-MPJPE 31.01 对比 16.17),因此其平滑性是以轨迹保真度为代价换来的。图 6 展示了原因:Dyn-HaMR 的手腕加速度曲线在快速手势期间相位滞后于真实值,并平滑了真实的高频运动,而 HandFlow 则跟踪真实值,既不失真也不牺牲保真度,保持平滑。
4.4 计算效率 实用的手部姿态估计器必须提供准确且及时的重建。表 3 报告了所有基于视频的方法在 150 帧 HOT3D 序列(批量大小为 1,单个 NVIDIA H100-80 GB GPU)上的推理时间和资源消耗。在重建时间方面,HandFlow 比先前的基于视频的方法快一个数量级以上,同时实现了所有比较方法中最佳的精度。运行时间分解揭示了一种结构性转变:重建仅占总延迟的一小部分,而 SLAM 占主导地位(84%)。相比之下,重建(无论是迭代优化还是多阶段处理)主导了先前方法的延迟。关键在于,HandFlow 和 Dyn-HaMR 共享相同的 ViPE-SLAM 前端,这使得它们 16 倍的总运行时间差距成为重建速度的清晰比较。这种反转意味着 HandFlow 直接受益于未来的 SLAM 加速,而基线方法则受限于其自身管道。
第 7 页
HandFlow: 基于流匹配的完全生成式4D手部重建 • 7
HandFlow 较高的显存占用源于对所有时间窗口进行并行去噪,以实现最大吞吐量。在显存受限的情况下,可以通过牺牲适度的吞吐量来降低窗口并行度。我们在附录 C 中进一步分析了 ODE 步数的影响,并在附录 E 中展示了该框架对前端选择的鲁棒性。
表 4. 消融研究。所有指标均在相机空间中计算,并在完整的组合 DexYCB (s0) 和 HOT3D (val) 测试集上进行聚合(表 7 中的重叠消融为了可行性使用了其随机子集)。 所有变体及完整模型均使用 200 个 epoch 的检查点,与主模型的训练预算相匹配。架构变体在参数量上与完整模型匹配,误差在 ±5% 以内。粗体表示我们的完整模型。M. 是 MPJPE 的缩写。$p$ 表示训练时的掩码比率(完整模型使用 $p=0.2$);w/o conf. 表示禁用推理时的置信度加权。
| 设置 | M. ↓ | PA-M. ↓ | W-M. ↓ | WA-M. ↓ | Accel ↓ | AUC ↑ | F@5 ↑ | | :— | :— | :— | :— | :— | :— | :— | :— | | HandFlow (full) | 18.73 | 4.75 | 38.44 | 13.60 | 4.08 | 0.9111 | 66.63 | | 条件模态 | | | | | | | | | 仅图像 | 22.86 | 4.82 | 45.61 | 16.07 | 4.61 | 0.9098 | 65.67 | | 仅骨架 | 26.66 | 8.47 | 61.78 | 21.31 | 7.08 | 0.8288 | 13.42 | | 连续掩码 | | | | | | | | | $p=0$ | 18.37 | 4.74 | 40.71 | 14.40 | 6.06 | 0.9113 | 66.39 | | $p=0.5$ | 19.19 | 4.78 | 39.08 | 13.50 | 4.04 | 0.9105 | 66.83 | | w/o conf. | 34.80 | 4.84 | 61.69 | 18.21 | 8.00 | 0.9091 | 64.84 | | 去噪器架构 | | | | | | | | | 朴素交叉注意力 | 22.04 | 6.03 | 50.69 | 16.58 | 6.12 | 0.8777 | 46.70 | | 仅双流 | 21.12 | 5.09 | 46.04 | 15.38 | 5.54 | 0.8932 | 55.95 | | 仅单流 | 19.80 | 4.92 | 39.31 | 14.71 | 4.69 | 0.9036 | 61.14 |
4.5 消融研究
我们对 HandFlow 中的关键设计选择进行了消融实验。所有变体均训练 200 个 epoch,与完整模型保持一致。指标在组合的 DexYCB (s0) 和 HOT3D (val) 测试集上进行聚合,其中重叠消融为了可行性使用了随机子集。由于这个合并集与主表中的各基准单独划分的测试集不同,跨表的绝对值不可比,但变体之间的相对排序仍具有信息量。
条件模态。 表 4(顶部)依次移除了每种条件信号。丢弃视觉特征会导致灾难性的性能下降(F@5 从 66.63% 降至 13.42%,PA-MPJPE 从 4.75 mm 升至 8.47 mm),这证实了密集视觉特征至关重要。丢弃骨架则更温和地降低了平移和平滑性(MPJPE 从 18.73 mm 升至 22.86 mm),表明稀疏的骨架线索充当了互补的几何锚点,而非精度的主要来源。
连续掩码。 对于 cmask(公式 5),训练期间的随机掩码(以概率 $p$ 将 $m_i$ 置零)作为一种时间正则化器,其效果因指标类型而异(表 4,中部)。逐帧精度倾向于无掩码($p=0$ 给出最低的 MPJPE),而时间和全局一致性指标则倾向于掩码:如果没有掩码,每一帧仅从其自身的观测中进行预测,没有压力去利用时间上下文,从而产生锯齿状的轨迹。这导致了逐帧精度与一致性之间的权衡,由 $p$ 控制:将 $p$ 从 0 提高到 0.2 仅导致 MPJPE 增加 0.36 mm,但加速度误差降低了 33%,W-MPJPE 降低了 2.28 mm,而 $p=0.5$ 则进一步损害了准确性,且没有带来平滑性的提升。我们采用 $p=0.2$。在推理时禁用置信度加权(w/o conf.)的影响要大得多:MPJPE 上升了 86%,而 PA-MPJPE 基本保持不变,这表明置信度加权条件主要在低置信度帧上稳定全局平移,以对抗噪声的位置线索。
去噪器架构。 表 4(底部)将双流去噪器与三个参数量匹配的变体进行了比较。用朴素交叉注意力替换双流模块,其中条件令牌仅被读取而不能与潜在令牌交换信息,导致所有指标显著下降(MPJPE 从 18.73 mm 升至 22.04 mm;加速度从 4.08 m/s² 升至 6.12 m/s²):单向读取条件信息是不够的,双流之间的双向交换至关重要。在保留双向融合的变体中,仅单流在每项指标上都最接近完整模型(MPJPE 19.80 mm 对比 仅双流的 21.12 mm),表明单流自注意力已经有效地融合了条件和潜在令牌。结合两个阶段的完整模型仍然是最好的,但它与仅单流的差距很小:主要的增益在于朴素交叉注意力所缺乏的双向融合,而非单流阶段的添加。
重叠推理。 我们在所有长视频实验中采用速度混合的重叠窗口(第 3.5 节),重叠度 $o=2$。速度混合在 ODE 积分期间融合预测,消除了后平均引入的边界速度跳跃(在 $o=2$ 时,$c_{>1}=18.9$ 对比 $c_1=4.46$),并提高了相对于无重叠基线的准确性。完整的融合策略比较见附录 F。
5 结论
我们提出了 HandFlow,这是一种用于单目 4D 手部重建的完全生成式流匹配框架。通过将重建表述为 MANO 参数空间中的条件生成,HandFlow 超越了确定性回归,学习在模糊或不可靠的观测下恢复合理且时间连贯的手部运动。HandFlow 在一次 ODE 积分中重建每个窗口,在保持推理效率的同时不牺牲准确性或平滑性。在 DexYCB 和 HOT3D 上的实验表明,HandFlow 在准确性、时间平滑性和推理速度方面均优于先前的基于图像和视频的方法,表明生成式运动先验是稳健 4D 手部重建的有前途的基础。
支撑这一行为的三个设计选择是:一个双流 Transformer,它在整个窗口上联合关注潜在手部参数和视觉-骨骼条件;置信度感知的 cmask,当观测不可靠时回退到学习到的运动先验;以及速度混合的重叠窗口推理,它将重建扩展到沿单一连续轨迹的长视频。我们的结果还表明,准确的全局运动源于时间一致性,而非单帧精度。
参考文献
Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon, Shreyas Hampali, Shangchen Han, Fan Zhang, Linguang Zhang, Jade Fountain, Edward Miller, Selen Basol, Richard Newcombe, Robert Wang, Jakob Julian Engel, and Tomas Hodan. 2025. HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 7061–7071.
Fabien Baradel, Matthieu Armando, Salma Galaaoui, Romain Brégier, Philippe Weinzaepfel, Grégory Rogez, and Thomas Lucas. 2024. Multi-hmr: Multi-person whole-body
第 8 页
8 • Xu 等人
单次完成人体网格重建。在计算机视觉欧洲会议。 Georgios Pavlakos, Dandan Shan, Ilija Radosavovic, Angjoo Kanazawa, David Fouhey, Springer, 202–218. 和 Jitendra Malik。2024。使用 Transformer 重建 3D 手部。在 IEEE/CVF Black Forest Labs。2024。Flux。 https://blackforestlabs.ai/announcing-black-forest-labs/ 计算机视觉与模式识别会议论文集。 Yu-Wei Chao, Wei Yang, Yu Xiang, Pavlo Molchanov, Ankur Handa, Jonathan Tremblay, 9826–9836。doi:10.1109/CVPR52733.2024.00938 Yashraj S. Narang, Karl Van Wyk, Umar Iqbal, Stan Birchfield, Jan Kautz, 和 Dieter William Peebles 和 Saining Xie。2023。可扩展的 Transformer 扩散模型。 Fox。2021。DexYCB:用于捕捉物体手部抓取的基准测试。在 IEEE/CVF 国际计算机视觉会议论文集。4195–4205。 http://arxiv. IEEE/CVF 计算机视觉与模式识别会议论文集。 org/abs/2212.09748 arXiv:2212.09748 [cs]。 9044–9053。 Rolandos Alexandros Potamias, Jinglei Zhang, Jiankang Deng, 和 Stefanos Zafeiriou。 Xingyu Chen, Zhuheng Song, Xiaoke Jiang, Yaoqing Hu, Junzhi Yu, 和 Lei Zhang。 2025。WiLoR:端到端的野外 3D 手部定位与重建。在 2025。HandOS:单阶段 3D 手部重建。在 IEEE/CVF IEEE/CVF 计算机视觉与模式识别会议论文集。 计算机视觉与模式识别会议论文集。17304–17314。 12242–12254。doi:10.1109/CVPR52734.2025.01143 Yufei Chen 等人。2023。SemiHandObj:来自 RGB 视频的半监督 3D 手-物重建 Javier Romero, Dimitrios Tzionas, 和 Michael J. Black。2017。具身双手:建模 与捕获双手和身体。ACM 图形学报 36, 6 (2017), 从 RGB 视频。在 IEEE/CVF 计算机视觉与模式识别会议 245:1–245:17。doi:10.1145/3130800.3130883 (CVPR)。 Yujin Chen, Zhigang Tu, Liuhao Ge, Dejun Zhang, Ruizhi Chen, 和 Junsong Yuan。 Muhammad Usama Saleem, Ekkasit Pinyoanuntapong, Mayur Jagdishbhai Patel, 2021。S2HAND:从单张 RGB 图像进行自监督 3D 手部姿态和网格重建。在 IEEE/CVF 国际计算机视觉会议 (ICCV)。 Hongfei Xue, Ahmed Helmy, Srijan Das, 和 Pu Wang。2025。MaskHand:生成式 Wencan Cheng, Hao Tang, Luc Van Gool, 和 Jong Hwan Ko。2024。HandDiff:基于图像-点云扩散的 3D 掩码建模用于野外鲁棒手部网格重建。在 手部姿态估计。在 IEEE/CVF 计算机视觉与模式识别会议论文集。2274–2284。 IEEE/CVF 国际计算机视觉会议论文集。8372–8383。 Hongsuk Choi, Gyeongsik Moon, Ju Yong Chang, 和 Kyoung Mu Lee。2021。超越 Oriane Siméoni, Huy V. Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, 静态特征以实现来自视频的时间一致 3D 人体姿态和形状。 Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Michaël Ramamonjisoa, 在 IEEE/CVF 计算机视觉与模式识别会议论文集。 Francisco Massa, Daniel Haziza, Luca Wehrstedt, Jianyuan Wang, Timothée Darcet, 1964–1973。doi:10.1109/CVPR46437.2021.00200 Théo Moutakanni, Leonel Sentana, Claire Roberts, Andrea Vedaldi, Jamie Tolan, Sammy Christen, Lan Feng, Wei Yang, Yu-Wei Chao, Otmar Hilliges, 和 Jie Song。2024。 John Brandt, Camille Couprie, Julien Mairal, Hervé Jégou, Patrick Labatut, 和 Piotr Synh2r:合成手-物运动以学习人-机器人交接。 Bojanowski。2025。DINOv3。(2025 年 8 月)。doi:10.48550/arXiv:2508.10104 在 2024 IEEE 国际机器人与自动化会议 (ICRA)。IEEE, Jianlin Su, Lu Yu, Shengfeng Pan, Ahmed Murtadha, Bo Wen, 和 Yunfeng Liu。2024。Ro- 3168–3175。 Former:增强型旋转位置嵌入 Transformer。神经计算 Enes Duran, Muhammed Kocabas, Vasileios Choutas, Zicong Fan, 和 Michael J. Black。 568 (2024), 127063。 http://arxiv.org/abs/2104.09864 arXiv:2104.09864 [cs]。 2024。HMP:用于从视频进行姿态和形状估计的手部运动先验。在 Zhihao Sun, Tong Wu, Ruirui Tu, Daoguo Dong, 和 Zuxuan Wu。2026。UniHand:一个 IEEE/CVF 计算机视觉应用冬季会议 (WACV)。 用于多样化受控 4D 手部运动建模的统一模型。在第十四届 Qiao Feng, Yiming Huang, Yufu Wang, Jiatao Gu, 和 Lingjie Liu。2025。PhysHMR: 国际学习表征会议。 https://openreview.net/forum? 从视觉学习人体控制策略以实现物理上合理的人体 id=upUl6hMYwy 运动重建。在 SIGGRAPH Asia 2025 会议论文集。 Guy Tevet, Sigal Raab, Brian Gordon, Yoni Shafir, Daniel Cohen-Or, 和 Amit H. 1–10。 Bermano。2023。人体运动扩散模型。在国际学习表征会议。 Qichen Fu, Xingyu Liu, Ran Xu, Juan Carlos Niebles, 和 Kris M. Kitani。2023。Deformer: http://arxiv.org/abs/2209.14916 arXiv:2209.14916 [cs]。 用于鲁棒手部姿态估计的动态融合 Transformer。在 Eugene Valassakis 和 Guillermo Garcia-Hernando。2024。HandDGP:基于可微全局定位的 IEEE/CVF 国际计算机视觉会议论文集。23543–23554。doi:10. 相机空间手部网格预测。在计算机视觉欧洲 1109/ICCV51070.2023.02157 会议 (ECCV)。 Jiahui Huang, Qunjie Zhou, Hesam Rabeti, Aleksandr Korovko, Huan Ling, Xuanchi Ren, Jiayi Wang, Franziska Mueller, Florian Bernard, Suzanne Sorli, Oleksandr Sotnychenko, Tianchang Shen, Jun Gao, Dmitry Slepichev, Chen-Hsuan Lin, Jiawei Ren, Kevin Xie, Neng Qian, Miguel A Otaduy, Dan Casas, 和 Christian Theobalt。2020。Rgb2hands: Joydeep Biswas, Laura Leal-Taixe, 和 Sanja Fidler。2025。ViPE:用于 3D 从单目 RGB 视频实时跟踪 3D 手部交互。ACM 图形 几何感知的视频姿态引擎。doi:10.48550/arXiv:2508.10934 arXiv:2508.10934 [cs]。 学报 (ToG) 39, 6 (2020), 1–16。 Muhammed Kocabas, Nikos Athanasiou, 和 Michael J. Black。2020。VIBE:视频 Ti Wang, Xiaohang Yu, 和 Mackenzie Weygandt Mathis。2026b。 FMPose3D: 人体姿态和形状估计推理。在 IEEE/CVF 计算机视觉与 通过流匹配进行单目 3D 姿态估计。doi:10.48550/arXiv:2602.05755 模式识别会议 (CVPR)。 arXiv:2602.05755 [cs]。 Zhihao Li, Jianzhuang Liu, Zhensong Zhang, Songcen Xu, 和 Youliang Yan。2022。Cliff: Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jin- 将全帧位置信息带入人体姿态和形状估计。 hyung Park, Kris Kitani, Alexander Richard, Fabian Prada, 和 Michael Zollhofer。 在计算机视觉欧洲会议。Springer, 590–606。 2026a。DuoMo:用于世界空间人体重建的双运动扩散。 Kevin Lin, Lijuan Wang, 和 Zicheng Liu。2021。MeshGraphormer:用于手部 doi:10.48550/arXiv:2603.03265 arXiv:2603.03265 [cs]。 和身体 3D 重建的关键点 Transformer。在 IEEE/CVF 国际 Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, 计算机视觉会议 (ICCV)。 Jiashi Feng, 和 Mike Zheng Shou。2024。MagicAnimate:使用扩散模型实现时间一致 Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。2023。 的人体图像动画。在 IEEE/CVF 用于生成建模的流匹配。在第十一届国际学习表征会议。 https://openreview.net/forum?id=PqvMRDCJTuz 计算机视觉与模式识别会议论文集。1481–1490。 Xingchao Liu, Chengyue Gong, 和 Qiang Liu。2023。流直线且快速:学习使用整流流 Yufei Ye, Yao Feng, Omid Taheri, Haiwen Feng, Michael J. Black, 和 Shubham Tulsiani。 生成和传输数据。在第十一届国际学习表征会议。 https://openreview.net/forum?id=XVjTT1nw5z 2026。从单目视频预测 4D 手部轨迹。在第十三届 Yunze Liu, Yun Liu, Che Jiang, Kangbo Lyu, Weikang Wan, Hao Shen, Boqiang Liang, 国际 3D 视觉会议。 https://openreview.net/forum?id=qGVr6yvNX8 Zhoujie Fu, He Wang, 和 Li Yi。2022。Hoi4d:用于类别级 Zhengdi Yu, Stefanos Zafeiriou, 和 Tolga Birdal。2025。Dyn-HaMR:从动态相机恢复 人-物交互的 4D 第一人称数据集。在 IEEE/CVF 计算机视觉与 4D 交互手部运动。在 IEEE/CVF 模式识别会议论文集。21013–21022。 计算机视觉与模式识别会议论文集。27716–27726。doi:10.1109/ Camillo Lugaresi, Jiuqiang Tang, Hadon Nash, Chris McClanahan, Esha Uboweja, CVPR52734.2025.02581 Michael Hays, Fan Zhang, Chuo-Ling Chang, Ming Guang Yong, 和 Juhyun Lee。 Jinglei Zhang, Jiankang Deng, Chao Ma, 和 Rolandos Alexandros Potamias。2025。 2019。Mediapipe:构建感知管道的框架。arXiv 预印本 HaWoR:从第一人称视频进行世界空间手部运动重建。在 arXiv:1906.08172 (2019)。 IEEE/CVF 计算机视觉与模式识别会议论文集。 Ben Mildenhall, Pratul P Srinivasan, Matthew Tancik, Jonathan T Barron, Ravi Ra- 1805–1815。 mamoorthi, 和 Ren Ng。2021。Nerf:将场景表示为神经辐射场 用于视图合成。Commun. ACM 65, 1 (2021), 99–106。 Chaoyi Pan, Changhao Wang, Haozhi Qi, Zixi Liu, Homanga Bharadhwaj, Akash Sharma, Tingfan Wu, Guanya Shi, Jitendra Malik, 和 Francois Hogan。2025。Spider: 可扩展的物理知情灵巧重定向。arXiv 预印本 arXiv:2511.09484 (2025)。 Jihyun Park, Youngtaek Oh, Gyeongsik Moon, Hongsuk Choi, 和 Kyoung Mu Lee。 2022。HandOccNet:抗遮挡 3D 手部网格重建。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。
第 9 页
HandFlow: 基于流匹配的完全生成式4D手部重建 • 9
相机叠加 相机 自上而下 侧面 真实值 HandFlow (本文) HaWoR HaMeR
图 3. 在重度遮挡的 DexYCB 帧上的比较:真实值 (GT) 与 HaMeR、HaWoR 和 HandFlow。每种方法展示四列(从左到右:叠加在输入图像上的网格、仅相机空间中的网格、自上而下的视图以及侧面视图);最后三列揭示了叠加视图所隐藏的深度误差。颜色:绿色为真实值 (GT),蓝色为 HandFlow,橙色为 HaWoR,红色为 HaMeR。
图 4. HandFlow 在 DexYCB 和 HOT3D 重度遮挡片段上的跟踪结果(每个序列采样八帧,叠加在输入视图上),在大部分不可见的手部区域推断出合理的姿态。
第 10 页
10 • Xu 等人
图 5. 从共享的 3D 视角渲染的 HOT3D 序列,展示 HaMeR、HaWoR、HandFlow 和 GT(真实值)。HandFlow 在完整性和准确性方面最接近 GT。绿色表示 GT,蓝色表示 HandFlow,橙色表示 HaWoR,红色表示 HaMeR。
[图表区域:包含多个子图,横轴为时间 (s),纵轴为加速度大小 |a| (m/s²),展示不同方法(GT, HandFlow, HaWoR, HaMeR)在不同质心(Centroid)下的加速度随时间变化曲线]
图 6. 对于每个序列,展示四个采样帧的手腕加速度箭头(长度编码大小),并在下方展示 GT 和所有方法的加速度大小时间序列图。HandFlow 在大小和方向上最接近 GT。绿色表示 GT,蓝色表示 HandFlow,橙色表示 HaWoR,红色表示 HaMeR。
第 11 页
HandFlow: 基于流匹配的完全生成式4D手部重建 • 11
A 评估指标
我们采用以下评估指标:
- MPJPE 衡量以毫米为单位的平均每关节位置误差,不进行任何几何对齐。它在相机空间(表3)和基于SLAM的相机位姿恢复后的世界空间(表2)中进行报告;这两个值不可直接比较,因为后者还反映了相机位姿误差。
- PA-MPJPE 在计算误差之前应用 Procrustes 对齐(平移、旋转和缩放)。
- RA-MPJPE 仅对齐根节点方向。
- W-MPJPE 和 WA-MPJPE 与 MPJPE 的区别仅在于对齐方式。W-MPJPE 仅对齐前两帧,因此轨迹漂移会在序列的其余部分累积,该指标直接反映全局轨迹精度。WA-MPJPE 将整个序列视为单个点云,并在所有帧上应用 Procrustes 对齐,从而消除漂移并更好地反映序列级的形状一致性。
- RTE(根平移误差)衡量刚性对齐后手部轨迹总位移归一化的全局平移误差,按照 [Zhang et al. 2025] 以百分比报告。
- AUC 是 MPJPE-阈值曲线下的面积;我们报告 $AUC_{RA}$ 和 $AUC_{PA}$,分别基于 RA-MPJPE 和 PA-MPJPE 计算。
- F@v 报告 MPJPE 低于 $v$ 毫米的帧的比例(我们使用 $v=5$ 和 $v=15$)。
对于 DexYCB,我们报告 RA-MPJPE、PA-MPJPE 及其对应的 AUC 值(表1);消融实验中额外使用了 F@5,在前端泛化性分析中同时使用了 F@5 和 F@15。 对于 HOT3D,我们报告 MPJPE、PA-MPJPE、W-MPJPE、WA-MPJPE、加速度误差和 RTE,其中 W-MPJPE 和 WA-MPJPE 衡量世界空间精度。
B 实现细节
我们使用隐藏层大小 $D=512$,16 个注意力头,8 个双流块后接 16 个单流块,窗口大小为 $T=16$ 帧。模型使用 AdamW 进行训练($\beta_1=0.9, \beta_2=0.999$,权重衰减 $10^{-4}$),学习率为 $10^{-4}$,经过 5,000 步预热后采用余弦退火,每 GPU 批次大小为 16(4 张 GPU 上的有效批次大小为 64),共训练 200 个 epoch。所有辅助损失均按平均采样时间步 $\bar{t}$ 缩放。辅助损失权重为:$L_\beta=1.0, L_{vel}=0.5, L_{acc}=0.5, L_{reproj}=0.5, L_{j3d}=0.05$。
训练数据。HandFlow 在 DexYCB 和 HOT3D 的训练集上进行训练,这两个基准测试也用于评估,但评估序列被排除在外。对于 DexYCB,我们采用标准的 s0 协议:训练使用所有 10 名受试者和 8 个相机视角,涵盖 80% 的序列,而 s0 评估集(受试者 1–2,每第 5 个序列)被排除在训练之外。对于 HOT3D,由于其官方验证剪辑缺乏公开的真实标签,我们自行划分训练集:在每个受试者内部,序列按字母顺序排列,每第七个序列被保留用于验证(13 个序列,169 个剪辑,约占训练剪辑的 11%),剩余的 1,347 个剪辑用于训练。所有重新评估的基线方法均使用此划分。遵循先前的工作 [Pavlakos et al. 2024],每只手均由 HaMeR 检测并裁剪为 $256 \times 256$ 的右手区域;MANO 参数以轴角形式存储,并分组为 $T=16$ 帧的窗口,丢弃有效帧少于 50% 的窗口。完整的数据集构建和预处理脚本将予以发布。
所有模型均在 4 块 NVIDIA H100-80 GB GPU 上训练。HandFlow 训练 200 个 epoch 大约需要 24 小时。对于计算效率评估(表3),由于基线方法的推理成本较高,我们平均计算 50 个验证序列的结果。
C ODE 步数扫描分析
我们分析了推理过程中 ODE 积分步数变化的影响。使用固定的模型检查点和欧拉求解器,我们在整个验证集(DexYCB s0 + HOT3D 验证剪辑,共 42,384 帧)上扫描从 1 到 10 的步数。图 7 报告了不同步数下的五种 MPJPE 变体。与 MPJPE 一样,这些指标也可以在相机空间或世界空间中进行报告。
- 加速度误差 衡量预测关节加速度与真实关节加速度之间差异的平均幅度(m/s²),反映时间平滑性。
![图7:ODE步数与MPJPE的关系。五种MPJPE变体(M, PA-M, RA-M, W-M, WA-M)在1-10个欧拉积分步数下的表现。]
关键观察。(1)在步数为 1 时,由于欧拉截断误差,性能崩溃(MPJPE ≈ 43 mm),因为单步积分无法解析连续流轨迹。(2)从第 2 步开始,性能达到稳定平台:MPJPE 从第 1 步的 ≈ 43 mm 急剧下降到第 2 步的 ≈ 27 mm,然后基本保持平坦。PA-MPJPE 在整个扫描过程中几乎保持不变(4.83–5.21 mm),证实每帧姿态质量在很大程度上与步数无关。我们采用第 3 步而不是第 2 步,因为后者位于平台的边缘,对分布偏移的安全边际较窄。
D 噪声敏感性分析
HandFlow 是完全生成式的:在推理时,它从随机初始噪声 $\bar{x}_0 \sim \mathcal{N}(0, I)$ 开始,并使用欧拉求解器(第 3.1 节)确定性地积分流 ODE。给定 $\bar{x}_0$,整个积分过程是固定的,因此推理中唯一的随机成分是初始噪声本身。一个自然的担忧是恢复的手部状态是否依赖于这种随机抽取。为了量化这一点,我们运行
第 12 页
12 • Xu et al.
10次独立推理,使用不同的初始噪声样本(随机种子 0–9)在完整的组合 DexYCB (s0) 和 HOT3D (val) 验证集(482 个序列,42,384 帧)上进行,使用与我们报告结果相同的固定检查点和 3 步欧拉设置(参见第 C 节)。表 5 报告了这 10 次运行中每个指标的平均值、标准差、范围和变异系数 (CV)。
表 6. 前端通用性。当 HaMeR 前端被替换为通用的 DINOv3-Base 骨干网络和 MediaPipe 骨骼检测器时,HandFlow 的准确性(参见表 2 和表 1 中的专用基线)。
| Frontend | Params | M↓ | PA↓ | HOT3D W-M↓ | Accel↓ | PA↓ | AUC↑ | DexYCB F@5↑(s0) | F@15↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | HaMeR (ViT-H) + HaMeR Skel. | ∼600M | 72.00 | 5.49 | 43.00 | 4.18 | 3.88 | 0.922 | 80.30 | 99.82 | | DINOv3-Base + MediaPipe | ∼88M | 85.35 | 6.37 | 57.28 | 5.61 | 4.46 | 0.917 | 75.81 | 97.20 |
表 5. 对初始噪声的敏感性。我们在完整的组合 DexYCB (s0) 和 HOT3D (val) 验证集(482 个序列,42,384 帧)上运行了 10 次独立推理,使用不同的初始噪声样本(随机种子 0–9),使用与我们报告结果相同的固定检查点和 3 步欧拉设置。对于每个指标,我们报告了这 10 次运行中的平均值、标准差、范围(最大值–最小值)和变异系数 (CV = std/mean,以 % 为单位)。MPJPE 变体单位为 mm,加速度误差单位为 m/s²。组合平均值不能直接与表 1 和表 2 中的每个基准进行比较;这里的分散度(标准差、范围、CV)才有意义。行按 CV 排序;较低的 CV 表示对随机初始噪声的敏感性较低。
| Metric | mean | std | range | CV (%) ↓ | | :— | :— | :— | :— | :— | | PA-MPJPE | 4.76 | 0.008 | 0.025 | 0.16 | | RA-MPJPE | 10.30 | 0.032 | 0.104 | 0.31 | | WA-MPJPE | 13.46 | 0.072 | 0.222 | 0.53 | | MPJPE | 18.51 | 0.133 | 0.382 | 0.72 | | Accel | 3.98 | 0.045 | 0.148 | 1.12 | | W-MPJPE | 38.02 | 0.312 | 0.779 | 0.82 |
姿态准确性本质上与噪声无关。PA-MPJPE 在 10 个噪声样本之间仅变化 0.025 mm(CV 0.16%),RA-MPJPE 变化 0.104 mm(CV 0.31%)。不同的初始噪声样本收敛到几乎相同的解,表明整流流轨迹足够直,使得最终预测仅微弱依赖于初始噪声。这从经验上证实了整流流 [Liu et al. 2023] underlying 的直线路径假设。
全局平移稍敏感,但在 1% 以内。包含全局平移的指标,MPJPE(CV 0.72%)和 W-MPJPE(CV 0.82%),其变化幅度比姿态对齐的 PA-MPJPE 大约一个数量级。这反映了绝对全局定位比关节姿态更难确定,这与平移是 MANO 状态中约束最少的组件是一致的。尽管如此,每个空间 CV 仍保持在 1% 以下。
时间指标 CV 因分母较小而膨胀。加速度误差显示出较高的 CV(1.12%),RTE(1.75%,未列入表格)更高,但其绝对范围非常小(0.15 m/s² 和 0.09%);大的 CV 是将较小的标准差除以更小的均值所产生的统计伪影。一个实际的后果是,表 1 和表 2 中报告的相对于基线的改进(数量级为毫米)比种子引起的散布大几个数量级,因此反映了真正的方法差异,而不是随机初始化中的噪声。
与 ODE 步长扫描(第 C 节)一起,该分析表明 HandFlow 的推理在两个独立的轴上是稳健的:求解器预算和随机起点。
E 前端通用性分析
默认情况下,HandFlow 以 HaMeR [Pavlakos et al. 2024] 为条件,这是一个单一的手部专用网络(ViT-Huge 骨干网络,∼600M 参数,在大规模手部数据上预训练),它同时提供密集视觉特征和 21 个 2D 关键点。为了探测对前端的鲁棒性,我们将整个模块替换为非手部专用且在每个方面都严格较弱的现成组件:DINOv3-Base [Siméoni et al. 2025](∼86M,一种在自然图像上自监督的通用 ViT,没有手部特定的预训练)提供视觉特征,而 MediaPipe [Lugaresi et al. 2019] 手部检测器(∼2M)提供 2D 关键点。组合前端约为 88M 参数(约为 HaMeR 的 1/7),其两个组件是独立训练的,而不是联合训练。所有其他组件(帧压缩器、骨骼投影、cmask 机制、双流去噪器和损失函数)保持不变。
表 6 报告了两个基准上的结果。尽管前端严格较弱,HandFlow 的降级是渐进的:下降幅度适中且在所有指标上一致(PA-MPJPE 在 DexYCB 上增加 15%,在 HOT3D 上增加 16%,MPJPE 在 HOT3D 上增加 18%)。更重要的是,即使使用这种通用前端,HandFlow 仍然优于强大的基于视频的基线(参见表 2 和表 1):在 DexYCB 上,PA-MPJPE 4.46 mm 对比 HaWoR 4.76 mm;在 HOT3D 上,W-MPJPE 57.28 mm 对比 Dyn-HaMR 69.11 mm。由于 HaMeR 将其骨干网络和关键点头耦合在单个网络中,我们将前端视为一个可替换的模块,并不进一步分解剩余的下降。这些结果表明,HandFlow 的准确性并不依赖于手部专用的 600M 骨干网络:整流流公式和双流条件提供了大部分性能,并且在应用通用前端时,框架仅适度降级,该前端不仅小约 7 倍,而且没有手部特定的预训练。
F 重叠推理分析
我们分析第 3.5 节中的重叠窗口推理策略,比较不同重叠大小 $o \in \{0, 1, 2, 4\}$ 的融合方法,在组合 DexYCB (s0) 和 HOT3D (val) 测试集的随机子集上。我们将加速度误差分解为 $c_1$(被单个窗口覆盖的帧)和 $c_{>1}$(重叠区域中的帧);表 7 报告了结果。
事后平均引入边界伪影。对每个窗口运行独立的 ODE 并平均重叠帧的最终状态会将误差集中在重叠边界($o=2$ 时 $c_{>1}=18.9$ 对比 $c_1=4.46$):独立演化的 ODE 轨迹发散,平均它们的端点会引入非物理的速度跳跃。
速度融合在积分期间进行融合。通过为每个全局帧维护单个共享状态,并在每个 ODE 步(第 3.5 节)融合速度,速度融合实现了最低的整体
第 13 页
HandFlow: 基于流匹配的完全生成式4D手部重建 • 13
表 7. 重叠推理分析。我们在 DexYCB (s0) 和 HOT3D (val) 测试集的随机子集上,针对重叠大小 $o \in \{0, 1, 2, 4\}$ 比较了不同的融合策略;所有指标均基于该混合子集计算。$c_1$ 和 $c_{>1}$ 分别表示被一个窗口覆盖和多个窗口覆盖的帧的加速度误差。绝对值不能直接与单基准的表 1 和表 2 进行比较,但不同融合策略之间的比较是公平的。速度混合消除了边界伪影($c_1 \approx c_{>1}$),并提高了相对于无重叠基线的重建精度。每列最佳值以粗体显示。所选配置($o=2$)以浅绿色高亮显示。
| 设置 | $o$ | 加速度误差 $\downarrow$ | $c_1$ | $c_{>1}$ | RA-MPJPE $\downarrow$ | WA-MPJPE $\downarrow$ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | 无重叠 | 0 | 4.49 | 4.49 | – | 8.24 | 12.76 | | | 1 | 5.23 | 4.48 | 12.8 | 8.28 | 13.37 | | 事后平均 | 2 | 6.74 | 4.46 | 18.9 | 8.38 | 13.59 | | | 4 | 9.12 | 4.45 | 26.1 | 8.55 | 17.19 | | 速度混合( ours) | 1 | 4.35 | 4.30 | 5.18 | 8.19 | 13.23 | | | 2 | 4.26 | 4.19 | 5.43 | 8.13 | 12.30 | | | 4 | 4.18 | 4.08 | 5.86 | 8.16 | 11.97 |
在加速度误差方面,重叠观察提供了互补信息:靠近窗口边缘的帧受益于相邻窗口更丰富的时间上下文。我们采用 $o=2$,它以较低窗口计数开销捕获了更大重叠的大部分收益。
加速度误差,并使边界帧误差接近内部帧水平($c_1 \approx c_{>1}$),证实了逐步混合防止了轨迹发散,而不是平滑其后续影响。$o>0$ 的速度混合进一步优于无重叠基线。
G 局限性
首先,cmask 机制将手部遮挡与手部离开相机视野混淆,因为两者都表现为低 HaMeR 检测置信度。这些场景在根本上是不同的:在部分遮挡下,生成先验可以合理地补全缺失信息,但当手部完全在帧外时,没有视觉证据可供条件约束,预测会显著退化,然而模型无法检测或标记这种故障模式。其次,重建质量取决于相机内参的准确性。当内参不是先验已知,而是必须通过 ViPE 在线估计时,相机运动有限的序列提供的几何约束不足,导致估计不准确,从而引起重建质量的显著下降。
第三,因为 HandFlow 仅在 MANO 参数空间中运行,而不是在密集表面表示中,其精度既受限于 MANO 模型有限的表达能力,也受限于 MANO 格式标注的精度,而后者本身是对真实手部几何形状的有损近似。