快速导读:提出OASIS,一个面向单张图像的手部化身重建框架,通过几何对齐的视觉证据令牌和可见性条件注意力解决自遮挡问题,并利用Mesh特征表示提升非刚性变形下的渲染质量。
从单张RGB图像重建可驱动的3D手部化身,是虚拟交互、远程呈现和数字人领域的核心需求。然而,手部高度关节化的结构导致严重的自遮挡——手指相互遮挡、手掌被手指遮盖——使得单视角下的几何和纹理推断极为困难。现有方法多基于隐式神经辐射场(NeRF),虽然能生成连续体积表示,但渲染速度慢、高频细节恢复不足,难以满足实时交互需求。
OASIS(Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting)提出了一个基于3D高斯泼溅(3DGS)的单样本手部化身重建框架。它通过三个核心设计——几何对齐的视觉证据令牌(VETs)、可见性条件点-图像注意力(VPIA)和网格上特征表示(FoM)——系统性地解决了自遮挡下的外观推断和非刚性变形问题。在InterHand2.6M数据集上,OASIS的单样本重建PSNR达到27.38,同时仅需约5分钟适配即可实现390 FPS的实时渲染。
英文题目:OASIS: Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting
论文出处:arXiv 每日论文精选 · arXiv:2607.29633
原始论文:PDF / 论文页面
这篇论文解决什么问题?
手部化身重建的难度远超身体或头部。手部拥有超过20个自由度,姿态空间极大,且手指的细长结构使得自遮挡几乎无处不在。从单张图像重建时,可见区域仅占手部表面的一小部分,被遮挡区域的外观必须从稀疏线索中推断。这要求模型同时具备强大的几何先验和外观补全能力。
现有方法大致分为两类。隐式方法如OHTA首次探索了单图手部化身重建,采用NeRF表示,但渲染一帧需要数秒,且对皱纹、指甲等高频细节恢复不足。另一类基于3DGS的方法如LHM和SplattingAvatar,虽然渲染效率高,但主要针对人体设计,未针对手部的严重自遮挡和精细几何进行优化。OASIS正是在这一研究空白中提出:如何让3DGS框架有效处理手部自遮挡,同时保持实时渲染的优势?
手部重建还面临一个关键挑战:非刚性变形。手指弯曲时,皮肤表面会发生拉伸和压缩,简单的线性混合蒙皮(LBS)无法完全捕捉这种局部变形。SplattingAvatar提出将高斯嵌入网格面片来驱动变形,OASIS借鉴这一思想并针对手部进行了专门设计。
此外,单样本重建的另一个难点是纹理泛化。训练时模型见过大量手部纹理,但测试时面对全新的肤色、纹路甚至指甲油,需要快速适配。OASIS采用颜色校准加LoRA微调的策略,在约5分钟内完成个性化适配,平衡了效率和质量。
核心创新
- 提出几何对齐的视觉证据令牌(VETs),通过显式2D-3D对齐和可学习令牌化保留稀疏图像外观线索。
- 设计可见性条件点-图像注意力(VPIA),利用Z-buffer估计可见性并调制注意力偏置,使遮挡点依赖全局上下文,可见点关注局部证据。
- 引入Feature-on-Mesh (FoM)表示,将特征组织在网格面片上,使高斯变形受局部表面拉伸引导,提升非刚性动画一致性。
- 构建基于3DGS的单样本手部化身重建流程,结合颜色校准和LoRA微调,实现约5分钟快速适配和390 FPS实时渲染。
方法概览
OASIS采用3DGS框架:1) 利用MANO-HD先验初始化3D点,通过DINOv2提取图像特征并投影对齐,经可学习令牌化构建几何对齐的视觉证据令牌(VETs);2) 通过可见性条件点-图像交叉注意力(VPIA)将视觉证据可靠地传递给几何令牌,生成遮挡感知高斯特征(OGF);3) 引入Feature-on-Mesh (FoM)表示,将特征提升至网格面片以驱动高斯变形;4) 解码为规范空间高斯属性并通过LBS驱动;5) 采用单样本适配策略,先进行颜色校准,再用LoRA微调解码器以捕获目标纹理。
- 几何对齐的视觉证据令牌(VETs):OASIS首先用DINOv2从输入图像提取特征图,然后利用MANO-HD参数化模型估计手部姿态,将3D高斯点投影到图像平面,通过双线性插值获取每个点的特征向量。这些特征经过可学习的令牌化处理,形成VETs。与直接将图像特征池化不同,VETs保留了显式的2D-3D对应关系,使模型知道每个视觉线索来自手部的哪个位置。
- 可见性条件点-图像注意力(VPIA):这是OASIS解决自遮挡的核心模块。VPIA利用Z-buffer渲染估计每个3D点的可见性,然后据此调制交叉注意力的偏置项。可见点获得较大的注意力偏置,倾向于关注其投影位置附近的图像特征;被遮挡点则获得较小的偏置,被迫依赖全局上下文和其他可见点的信息来推断外观。这种设计使模型能够自适应地处理不同程度的遮挡。
- 遮挡感知高斯特征(OGF):VPIA的输出是融合了视觉证据的3D点特征,称为OGF。这些特征经过自注意力层进一步精炼,使各点之间能够交换信息,增强全局一致性。OGF随后被送入解码器,预测规范空间下的高斯属性(位置、协方差、颜色、不透明度)。
- 网格上特征表示(FoM):为了处理非刚性变形,OASIS将OGF提升到MANO网格的面片上。每个面片承载一个特征向量,当手部姿态变化时,面片的拉伸和旋转自然引导特征的变形。这种设计比直接在3D点上定义特征更能保持表面连续性,减少动画过程中的撕裂和伪影。
- 单样本适配策略:OASIS的通用模型在大量手部数据上预训练,但面对新纹理时需要快速适配。适配分两步:首先进行颜色校准,调整全局颜色映射以匹配输入图像的色调;然后用LoRA微调解码器的部分参数,学习目标纹理的细节。这种策略在约5分钟内完成,且只需单张图像。
- 训练与推理:OASIS在InterHand2.6M数据集上训练,采用与LHM类似的训练策略以确保公平比较。推理时,给定单张图像,模型先估计MANO参数,然后通过VETs提取特征,经VPIA和FoM生成高斯属性,最后通过LBS驱动到目标姿态进行渲染。渲染在NVIDIA A100上达到390 FPS。
逐图理解论文
失败案例与直觉

图12展示了失败案例。在严重遮挡(如手指完全重叠)或极端侧面视角下,重建结果出现手指融合、纹理模糊等问题。这些案例揭示了当前方法在极端几何推理上的局限。
研究空白与核心思路

图2是OASIS的完整架构图。从左到右依次为:输入图像经DINOv2提取特征并构建VETs,VPIA将视觉证据传递给几何令牌生成OGF,FoM将特征提升到网格面片,最后解码为高斯属性并通过LBS驱动。重点关注VPIA模块中可见性估计如何调制注意力。
核心结论

图4是InterHand2.6M上的定性比较。白色框为输入图像,右侧为各方法渲染的新视角。OASIS在手指细节、纹理清晰度和几何准确性上均优于OHTA和HandAvatar,同时渲染速度远超隐式方法。
实验如何设计?
- 主要定量评估在InterHand2.6M测试集上进行,采用单样本重建设定:给定一张输入视图,重建手部化身并渲染其他视角,计算PSNR、SSIM和LPIPS。
- 对比方法包括HandAvatar(基于NeRF,需多视角视频)、OHTA(隐式单图方法)、LHM(3DGS人体方法)等。无微调变体OASIS§与LHM§在相同设定下训练以公平比较。
- 在HanCo、COCO-Hand、WHIM等in-the-wild数据集上验证泛化性,这些数据包含不同光照、背景和肤色。
- 消融实验分别移除VETs、VPIA和FoM,评估各组件的贡献。还进行了适配策略的消融(颜色校准、LoRA微调)。
- 下游应用评估包括纹理编辑和文本到手部化身生成,展示方法的灵活性。
关键结果与论文证据
- 单样本重建性能:OASIS在InterHand2.6M上达到PSNR 27.38、SSIM 0.956、LPIPS* 11.45(Table 1, p.7),显著优于OHTA(PSNR 26.11、SSIM 0.864、LPIPS* 12.93)。无微调变体OASIS§也达到PSNR 26.48,超过LHM§。
- 渲染效率:OASIS在A100上达到390 FPS,而OHTA等隐式方法通常低于1 FPS(Figure 4, p.7)。这使得OASIS适用于实时交互应用。
- VETs的作用:移除VETs后PSNR降至26.97,LPIPS*升至12.11(Table 2, p.8),表明显式2D-3D对齐对保留外观细节至关重要。
- VPIA的作用:移除VPIA(使用标准交叉注意力)后PSNR降至27.10,LPIPS*升至12.09。可视化显示VPIA使可见点关注局部区域、遮挡点关注全局上下文(Figure 9, p.13)。
- FoM的作用:移除FoM后PSNR降至27.13,LPIPS*升至12.35,且动画中出现更多撕裂伪影(Table 2, p.8)。FoM对非刚性变形的质量影响最大。
- 泛化能力:在HanCo等in-the-wild数据上,OASIS展现出对多样肤色、光照和背景的鲁棒性(Figure 6, p.11)。与OHTA的逐图比较显示OASIS在不同姿态和视角下均保持优势(Figure 10, p.13)。
- 适配策略:颜色校准加LoRA微调的组合效果最佳(Table 4, p.13),单独使用颜色校准或LoRA均不如组合。适配时间约5分钟,适合实际部署。
- 失败案例:在严重遮挡或极端视角下(如手指完全重叠、侧面视角),OASIS可能出现手指融合或纹理模糊(Figure 12, p.14)。这提示未来需要更强的几何推理能力。
阅读时需要注意
- 严重遮挡或极端视角下仍可能出现重建伪影,如手指融合或纹理模糊(Figure 12, p.14)。
- 依赖现成的MANO参数估计器,其误差可能传播至重建结果,尤其在in-the-wild场景中。
- 单样本适配虽快,但纹理细节学习对输入图像质量敏感,低分辨率或模糊图像可能导致纹理退化。
- 当前方法主要针对单手重建,未涉及手-物交互或双手场景。
关联工作
- OHTA是首个探索单图手部化身重建的工作,基于隐式体积表示,OASIS在其设定下进行比较并实现更优质量和效率。
- LHM是大型可动画人体重建模型,OASIS参考其训练策略并作为3DGS先验驱动方法的代表进行对比。
- SplattingAvatar提出网格嵌入高斯泼溅的变形方案,OASIS借鉴其网格驱动变形思想设计FoM。
- HandAvatar基于NeRF,需要多视角视频,OASIS在单图设定下与其比较,展示3DGS在效率和质量上的优势。