ReViV:从单目第一人称视频重建4D视角与场景

三分钟导读:ReViV提出了一种统一的生成式框架,通过掩码生成Transformer从单目第一人称RGB视频中联合重建人体(身体、手、视线)和场景(相机轨迹、深度)的4D表示。

英文题目:ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

论文出处:arXiv 每日论文精选 · arXiv:2607.17790

原始论文:PDF / 论文页面

对应视频标题:ReViV:从单目第一人称视频重建4D视角与场景|推荐指数:★★★★★

这篇论文解决什么问题?

现有第一人称视觉方法通常将场景感知与人体运动建模分离,依赖辅助输入(如SLAM轨迹),且推理速度慢,缺乏统一的4D重建框架。

核心创新

  • 首个统一的第一人称4D重建框架,同时处理身体、手、视线、相机轨迹和深度。
  • 构建7B token的大规模多模态预训练数据集,整合伪标签深度和运动数据。
  • 引入MGET架构,通过随机掩码预测学习跨模态关联和时序动力学。
  • 无需显式相机跟踪或专用硬件,仅凭单目视频实现实时推理。

方法概览

提出ReViV框架,使用模态特定的VQ-VAE将连续信号离散化为统一token序列,并通过Masked Generative Egocentric Transformer (MGET) 学习多模态联合概率分布。推理时基于RGB条件迭代解码缺失模态,并通过Floor Fitting进行度量对齐。

逐图理解论文

ReViV统一框架概述

ReViV统一框架概述
Fig. 1: We present ReViV, a unified framework for holistic egocentric 4D reconstruc- tion. Given a monocular egocentric RGB video, our method jointly estimates human- centric modalities, including body, hand pose, and gaze, alongside scene-aware cam- era trajectory and depth estimation. These predictions are integrated into a tem- porally consistent viewer–view reconstruction from a monocular egocentric video.

ReViV提出了一种统一的生成式框架,从单目第一人称RGB视频中联合重建人体(身体、手、视线)和场景(相机轨迹、深度)的4D表示。该方法无需显式相机跟踪,通过迭代解码缺失模态,实现观察者与视角的时空一致重建。

大规模多模态数据集构建

大规模多模态数据集构建
Table 1: Large-Scale Multi-Modal Pretraining Dataset. Building upon the scene-centric foundation of EgoM2P [22], our dataset includes dense hand and full-body kinematics to capture holistic human-scene interactions. By scaling the total pretrain- ing corpus from 4B to 7B unique tokens, ReViV establishes a new data foundation for egocentric 4D understanding. (Note: ✓: available, ×: unavailable. ✓*: our generated pseudo-labels. Grey: baseline usage. Color: newly integrated datasets/modalities.

ReViV构建了7B token的大规模多模态预训练数据集,整合了伪标签深度和运动数据。相比EgoM2P,该数据集扩展了密集手部和全身运动学信息,为第一人称4D理解提供了新的数据基础,确保模型能捕捉全面的人-场景交互。

MGET架构与离散化策略

MGET架构与离散化策略
Fig. 2: ReViV Architecture. (Left) Modality-specific VQ-VAEs discretize heteroge- neous viewer (gaze, hand, body) and view (RGB, depth, camera) continuous modalities into a unified token sequence. (Middle) A Masked Generative Egocentric Transformer (MGET) learns the joint probability distribution by predicting randomly masked to- kens (grey blocks), capturing both intra- and cross-modal dynamics. (Right) During inference, MGET conditions on available observed tokens (e.g., RGB) to iteratively decode and reconstruct the unobserved human and scene states. Floor fitting aligns the reconstruction to a metric 4D coordinate system.

方法核心是模态特定的VQ-VAE,将连续信号离散化为统一token序列。Masked Generative Egocentric Transformer (MGET) 通过随机掩码预测学习跨模态关联和时序动力学。推理时,模型基于观测到的RGB token迭代解码未观测的人体和场景状态。

身体运动重建SOTA性能

身体运动重建SOTA性能
Table 2: Egocentric Body Motion Reconstruction on ADT [34]. ReViV achieves SOTA performance and efficiency purely from monocular video. Even without explicit camera tracking, ReViV yields superior motion quality (FID), pose accuracy (PA-MPJPE), and pose similarity compared to baselines utilizing either estimated (VIPE) or ground-truth camera trajectories. ↓: lower is better; ↑: higher is better.

在ADT基准上,ReViV在身体重建上达到SOTA。PA-MPJPE为88.6,FID为0.442,推理时间仅0.7秒。值得注意的是,ReViV未使用显式相机跟踪,却优于使用估计或GT相机轨迹的基线方法,证明了其联合建模的有效性。

手部重建与效率优势

手部重建与效率优势
Table 3: Quantitative Comparison of Egocentric Hand Motion Reconstruc- tion. ReViV achieves state-of-the-art accuracy across four benchmarks while operating orders of magnitude faster than continuous optimization baselines (e.g., Dyn-HaMR). Metrics evaluated include Global-Aligned (GA-MPJPE), Root-Aligned (RA-MPJPE), and Procrustes-Aligned (PA-MPJPE) errors. ↓indicates lower is better.

手部重建方面,ReViV在HoloAssist基准上PA-MPJPE为10.5,推理时间0.7秒。相比基于连续优化的Dyn-HaMR,ReViV速度快400倍。尽管存在严重遮挡,模型仍能生成合理的手部运动,展现了强大的时空运动先验学习能力。

实验与关键结果

  • 在ADT、HoloAssist、HOT3D、ARCTIC和TACO基准上进行身体、手部、视线、相机跟踪和深度估计评估。
  • 与EgoAllo, UniEgoMotion, HaMeR, Dyn-HaMR, EgoM2P, VIPE等SOTA方法进行对比。
  • 进行消融实验验证数据规模、掩码策略、ViT分支及VQ-VAE设计的影响。
  • ADT身体重建: PA-MPJPE 88.6, FID 0.442, 推理时间 0.7s (SOTA)(第 10 页)
  • 手部重建 (HoloAssist): PA-MPJPE 10.5, 推理时间 0.7s (比Dyn-HaMR快400倍)(第 11 页)
  • 相机跟踪 (ADT): ATE 0.015, RTE 0.009, RRE 1.279(第 12 页)
  • 视线估计 (ADT): MSE 0.0211(第 12 页)
  • 深度估计 (ADT): Abs Rel 0.265, δ1.25 56.5%(第 12 页)

阅读时需要注意

  • 离散化tokenization导致高频空间细节丢失,限制了深度估计的精细度。
  • 对于不可见地板的场景,依赖VIPE作为几何锚点可能引入误差。
  • 模型参数量较大,虽然推理快但训练成本高。
  • 基准测试中部分基线方法使用了Ground-Truth相机轨迹,而ReViV未使用,比较时需考虑此优势差异。
  • 深度估计性能略低于专门针对深度优化的方法(如EgoMono4D),因其未使用深度专家先验。

关联工作

  • EgoM2P:基础数据集构建和模态tokenization参考,ReViV扩展了其数据规模和模态。(第 5 页)
  • VIPE:作为相机跟踪基线,并在无地板场景下作为深度锚点使用。(第 10 页)
  • EgoAllo:身体运动重建SOTA基线,依赖扩散模型和辅助输入。(第 10 页)
  • Dyn-HaMR:手部运动重建SOTA基线,基于连续优化,推理极慢。(第 11 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ReViV:从单目第一人称视频中重建观看者与视角的4D表示

吕晓钟1⋆,李根1⋆,钱志银1, 张旭聪1,2,Marc Pollefeys1,3,以及唐思宇1

1 瑞士苏黎世联邦理工学院 2 荷兰代尔夫特理工大学 3 瑞士微软研究院

摘要。第一人称设备(如可穿戴前置摄像头)为捕捉人类观看者与周围环境之间的持续交互提供了独特的视角。因此,一种能够重建这种4D表示的整体且高效的多模态模型极具吸引力。然而,现有方法通常依赖预计算的相机轨迹等辅助输入,尽管场景感知与人类自我运动建模之间存在强烈的相互依赖性,却将其视为独立问题处理,并且推理速度缓慢。为了解决这些局限性,我们提出了 ReViV,这是首个从单目RGB视频中提取并重建整体动态第一人称4D表示的统一框架。我们将该任务表述为学习多模态信号(包括RGB视频、相机轨迹、注视方向、全身运动、手部运动和深度)的完整联合概率分布。借助掩码生成第一人称Transformer(Masked Generative Egocentric Transformer, MGET),ReViV 在单一的前馈架构内运行,以快速推理速度同时重建观看者与视角在时间上一致的4D表示。在 HoloAssist、HOT3D、ARCTIC、Aria Digital Twin 和 TACO 等多个基准上的广泛实验表明,ReViV 在全局自我身体、手部和注视重建、相机跟踪方面实现了最先进的准确性和效率,同时保持了极具竞争力的第一人称深度估计,且无需依赖繁重的任务特定先验。代码和模型已完全开源:https://reviv4d.github.io/。

关键词:第一人称视觉 · 4D重建 · 人体运动

1 引言

第一人称视觉是具身智能的核心,因为它通过人类感知、行动和交互的第一人称视角直接捕捉世界 [16,42]。随着智能眼镜、身体佩戴式摄像头和头戴式显示器等可穿戴设备的迅速普及,第一人称

第 2 页

2 X. Lyu 等人

第一人称 RGB 视频输入

ReViV

整体第一人称身体、手部、注视、深度、相机重建

图 1:我们提出了 ReViV,这是一个用于整体第一人称 4D 重建的统一框架。给定单目第一人称 RGB 视频,我们的方法联合估计以人为中心的模态,包括身体、手部姿态和注视,以及场景感知的相机轨迹和深度估计。这些预测被整合成一个从单目第一人称视频中生成的、在时间上一致的观看者-视角重建。

视频在增强现实和虚拟现实 [44]、辅助机器人 [53] 以及人机交互中变得越来越普遍。在这些场景中,系统不仅要理解周围的环境,还要实时解释佩戴者自身的动作、手势和意图 [14,18,33]。 尽管第一人称视觉提供了独特的视角,但对观看者动作和场景的重建仍未得到充分探索 [8,13]。现有的第一人称方法通常要么专注于环境重建 [22,60,63],要么专注于人体姿态估计 [15,23,24,31,36,57,61]。因此,场景动态和人体运动是独立推断的,忽略了自然地将观察者和被观察世界耦合在一起的时间约束。此外,许多第一人称人体姿态估计方法依赖于辅助输入,例如设备上的 SLAM 轨迹 [36,57]、预计算的 3D 点云 [57] 或专用的手部追踪模块 [57],这限制了它们对专用硬件设置的适用性。通过将场景理解和人体重建孤立处理,当前的方法往往导致观看者几何形状和观看者运动在时间上不一致 [10,56]。因此,一个整体的框架,能够从单目第一人称视频中重建观看者的人体运动,同时联合建模上下文 4D 重建(如深度序列、注视和相机轨迹),仍然是一个开放且具有挑战性的问题。 4D 重建的最新进展在第三人称或多视角设置中取得了令人印象深刻的结果,能够从多个同步相机中重建动态场景和人体运动 [10,56]。Shape of Motion [47] 等方法通过用持久 3D 高斯和运动基表示场景,实现了长距离动态重建,而前馈架构通过避免昂贵的测试时优化,进一步提高了效率和泛化能力 [6,12,52,55]。然而,这些进展依赖于第三人称视角

第 3 页

ReViV:从第一人称视频中重建观看者与视图的4D表示 3

或采用多视角捕获,使得在单目第一人称设置下重建佩戴者自身身体动态的问题在很大程度上仍未得到解决。

为应对这一挑战,我们提出了 ReViV(见图 1),这是一个统一的框架,旨在从单个单目第一人称 RGB 视频中重建观看者与视图。ReViV 并未将身体运动、手部动态、注视、相机轨迹和深度视为独立的预测任务,而是将第一人称重建表述为针对多模态信号的掩码生成建模。在推理阶段,ReViV 以 RGB 观测值为条件,通过单次前向传播预测缺失的以观看者为中心和以场景为中心的多模态信号。由于单目深度在尺度上本质上具有歧义性,ReViV 预测时间上一致的仿射不变场景深度,并在具备合适的几何锚点时,使用一个轻量级的对齐步骤,将重建的观看者和视图放置到度量 4D 坐标系中。

我们框架的核心是掩码生成第一人称 Transformer(MGET)。为了建模观看者复杂且部分未观测到的运动学特征,我们引入了一种统一的标记化方案,将来自不同模态的时空信号编码为紧凑的潜在表示。MGET 采用统一的多元任务目标进行训练,通过预测随机掩码的标记(以可用上下文为条件),学习内在的人类运动动态以及跨模态相关性。通过在训练期间掩码多模态标记的子集,该模型学习从可见线索中推断缺失的运动学和场景几何结构,从而捕捉跨模态的潜在联合分布。

在多个基准上的广泛实验表明,ReViV 在全息身体、手部和注视重建方面达到了最先进(state-of-the-art)的性能,同时在深度估计和相机跟踪方面保持了具有竞争力的准确性。通过将我们的多模态数据集扩展至 70 亿个唯一标记,并在超过 5000 亿个训练标记上进行优化,该模型学习了鲁棒的跨模态依赖关系,从而产生时间上一致的观看者-视图动态。ReViV 的前向传播架构使其推理速度显著快于基于优化的方法 [17,60]。我们的贡献如下:

– 一种从单个单目 RGB 视频进行第一人称 4D 重建的统一框架,对场景、身体、手部和注视进行整体建模。 – 一个大规模的前向传播预训练模型,显式地对人类运动进行建模,提高了第一人称设置下的可扩展性和泛化能力。 – 对下游第一人称任务进行了全面的基准测试,证明 ReViV 在人体、手部和注视重建方面达到了最先进的精度,同时在深度估计方面具有极高的竞争力。

2 相关工作

2.1 4D 重建

动态 4D 重建旨在随时间恢复动态场景的时间一致 3D 结构。早期工作主要关注捕获物体的 3D 运动轨迹 [29,48]。这些方法已从静态 3D 场景

第 4 页

4 X. Lyu 等

利用同步的多视角视频输入进行动态场景建模的重建 [10,30,51,56]。最近的进展进一步放宽了多视角要求,通过从单目视频进行 4D 重建 [7,21,26,43,49]。 为了建模长期动态,[47] 将动态场景表示为具有紧凑运动基底的持久 3D 高斯分布,实现了高效的长程重建。然而,基于高斯的表示仍然依赖于每场景的测试时优化,限制了其泛化能力。为了解决这一问题,最近的前馈方法联合重建和跟踪动态场景,提供了快速且通用的解决方案,无需在推理时进行优化 [12,52,55]。尽管取得了这些进展,现有的 4D 重建方法主要针对第三人称或多视角设置,使得第一人称领域在很大程度上仍未被探索。

2.2 来自第一人称视频的场景重建

来自第一人称视角的场景重建由于视野有限、相机运动频繁以及强烈的遮挡而面临独特的挑战。EgoM2P [22] 引入了一种用于第一人称视觉的多任务预训练框架,该框架联合建模 RGB、深度、注视点和相机轨迹,从而实现多模态场景理解。EgoGaussian [63] 通过直接从单目第一人称 RGB 输入中同时重建 3D 场景和动态跟踪物体运动,扩展了这一思想。EgoMono4D [60] 将自监督学习应用于点云序列重建,以解决第一人称领域标注稀缺的问题。这些工作展示了第一人称视频在全局场景建模方面的潜力,但它们主要关注场景或物体级别的几何结构,没有显式地重建完整的人体运动和交互动态。

2.3 来自第一人称视频的人体运动估计

从第一人称视频估计人体运动已在几个方向上进行了探索。一些工作使用鱼眼相机来预测全身姿态 [9,19,25, 45,46,54],尽管图像畸变和自遮挡仍然是主要挑战。EgoEgo [24] 通过首先从第一人称视频中预测头部运动,然后从中推断全身运动来估计 3D 人体运动,然而,它无法恢复手部姿态。Ego-Pose [61] 使用强化学习从第一人称输入中估计和预测人的姿态序列,而 [31] 引入了一种感知物体的 3D 第一人称姿态估计框架。最近,生成模型显著推进了第一人称姿态估计。HMD2 [15] 和 EgoAllo [57] 采用条件扩散模型来生成全身运动学;此外,EgoAllo 通过扩散引导集成现成的手部先验 [38] 来估计手部运动。同样,UniEgoMotion [36] 提出了一种用于运动重建和预测的统一扩散框架。虽然这些方法实现了令人印象深刻的运动学精度,但它们根本依赖于补充输入,例如预计算的 SLAM 轨迹、3D 点云或外部手部追踪器。这种对专用硬件的依赖限制了它们在随意的、野外单目视频中的适用性。

第 5 页

ReViV:从第一人称视频中重建观看者与视角 4D 表示 5

表 1:大规模多模态预训练数据集。在 EgoM2P [22] 以场景为中心的基础之上,我们的数据集包含了密集的手部和全身运动学数据,以捕捉整体的人-场景交互。通过将总预训练语料库从 40 亿(4B)唯一 token 扩展至 70 亿(7B)唯一 token,ReViV 为第一人称 4D 理解建立了新的数据基础。(注:✓:可用,×:不可用。✓*:我们生成的伪标签。灰色:基线使用。彩色:新整合的数据集/模态。

模态 RGB 深度 注视 相机 手部 身体 数据集

EgoExo4D [14] ✓ × ✓ ✓ × × HoloAssist [50] ✓ ✓* ✓ ✓ ✓ × HOT3D (Aria) [3] ✓ ✓* ✓ ✓ ✓ × HOT3D (Quest) [3] ✓ ✓* × ✓ ✓ × ARCTIC [11] ✓ ✓* × ✓ ✓ × TACO [27] ✓ ✓* × ✓ ✓ × H2O [20] ✓ ✓ × ✓ ✓ × EgoGen [23] ✓ ✓ × ✓ × × Nymeria [32] ✓ ✓* ✓ ✓ × ✓

此外,注视线索已被整合到第一人称运动理解中。[62] 从 2D 视觉输入中预测 3D 场景中的未来注视,而 [35] 提出了一种注视正则化注意力机制,增强了视觉-语言模型(VLMs)在第一人称行为理解方面的能力,特别是在活动识别和未来预测方面。 这些努力共同凸显了对第一人称人类运动和场景建模日益增长的兴趣,然而,一种能够联合建模人体、手部和注视动态以及场景几何的 4D 重建统一方法仍然是一个开放挑战。在本工作中,我们提出了 ReViV,这是第一个针对第一人称领域的 4D 重建统一生成框架。

3 数据引擎

先前工作的一个主要局限在于缺乏用于多模态预训练的统一数据组织,这阻碍了在异构的第一人称数据集上训练单一框架。为了大规模训练 ReViV(第 4 节),我们构建了一个自动化的多模态数据引擎,该引擎协调不同数据集之间的空间表示并补偿缺失的模态(表 1)。在 EgoM2P [22] 以场景为中心的基础之上,我们扩展了语料库,加入了密集的手部和全身运动学数据,将预训练集从 40 亿扩展为一个统一的 70 亿 token 数据集,专为整体第一人称 4D 建模而定制。

3.1 时间一致的几何伪标签生成

许多第一人称数据集由于硬件限制或不完整的传感器流而缺乏密集的 3D 几何信息。为了解决这个问题,我们使用 Video Depth Anything [5] 生成了高质量、时间一致的视频深度伪标签。这

第 6 页

6 X. Lyu 等

自动化流水线使我们能够将几何监督的范围从 EgoM2P [22] 中受限的手-物交互扩展到多样化、无约束的真实世界环境。由此产生的大规模深度注释提供了随时间一致的几何信号,使 ReViV 能够学习鲁棒的 4D 结构先验。正如我们的评估所示,与现有基线相比,这种大规模几何预训练提高了复杂场景中的视频深度预测性能。

3.2 统一运动学表示

第一人称数据集在坐标约定和传感器设置方面存在显著差异,导致运动学注释不一致。为了实现统一建模,我们将所有运动信号标准化为两个互补的参考系,以解耦局部操作和全局导航。

相机空间手部运动学。我们将手部关节投影到其当前各自帧的相机空间中。虽然这依赖于即时相机位姿,但它提供了相对于用户视角的轨迹不变表示,鼓励模型学习独立于全局身体平移的交互先验。

重力对齐的全局身体运动学。将轨迹锚定到原始初始相机位姿会引入俯仰和翻滚伪影。相反,我们通过取第一帧的相机位姿并将其向上向量投影以与重力相反方向对齐,从而建立一个稳定的世界参考系。这创建了一个与地面平行的参考系,将真实的全局导航与相机的初始倾斜隔离开来。

4 方法

我们提出了一种统一框架,用于从单目第一人称视频中联合重建以人为中心(注视、身体、手部运动)和以场景为中心(相机轨迹、深度图)的特征(图 2)。由于在第一人称视角中观察者的身体被严重遮挡,确定性估计本质上是不明确的。为了解决这个问题,我们将任务表述为生成建模问题,并通过掩码标记预测来近似多模态联合分布。

4.1 问题表述

令 $X = \{x_{\text{rgb}}\}$ 表示观察到的第一人称视频上下文,$Y = \{y_{\text{hand}}, y_{\text{body}}, y_{\text{gaze}}, y_{\text{depth}}, y_{\text{cam}}\}$ 表示要重建的人类和场景动态状态。由于自我身体的严重遮挡,直接学习确定性映射 $f : X \rightarrow Y$ 是不适定的,这使得潜在解空间具有高度多模态性。为了解决这个问题,我们将问题表述为学习所有观察和未观察模态之间的联合概率分布:

$p(\mathcal{X}, \mathcal{Y}) = p(\mathbf{x}_{\text{hand}},\mathbf{y}_{\text{body}},\mathbf{y}_{\text{gaze}},\mathbf{y}_{\text{depth}},\mathbf{y}_{\text{cam}})$. (1)

第 7 页

ReViV:从第一人称视频中重建观看者与视角的4D表示 7

观看者 视角 可选观测模态 … 注视 RGB 第一人称视频 手 深度

身体 相机 掩码生成第一人称Transformer

编码器 掩码生成第一人称Transformer 观看者 视角 VQ Transformer 编码器

Transformer 解码器

解码器

观看者 视角 度量对齐的4D重建 注视 RGB 身体-地板层级 手 深度 平均(最低50%脚部z坐标) 最小二乘法地板拟合

身体 相机 场景地板层级 最低5% 3D场景点

图 2:ReViV 架构。(左)模态特定的 VQ-VAE 将异质的观看者(注视、手、身体)和视角(RGB、深度、相机)连续模态离散化为统一的标记序列。(中)掩码生成第一人称 Transformer(MGET)通过预测随机掩码标记(灰色块)来学习联合概率分布,捕捉模态内和跨模态的动态关系。(右)在推理过程中,MGET 以可用的观测标记(例如 RGB)为条件,迭代解码并重建未观测到的人体和场景状态。地板拟合将重建结果对齐到度量 4D 坐标系中。

在实践中,我们通过掩码多模态标记预测来近似这一联合分布,这使得模型能够学习模态内的时间动态和跨模态相关性。在推理期间,这使我们能够灵活地从条件分布 $p(Y | X)$ 中采样,以重建人体和场景状态。 4D 重建的度量对齐。为了实现度量对齐的 4D 重建,我们引入一个轻量级的对齐步骤,将相对场景深度映射到度量域。具体而言,我们从重建的场景几何中拟合一个稳定的地板平面,并利用它来正则化度量尺度,详细信息见补充材料第 D 节。对于不包含可见地板的 RGB 输入,我们利用 VIPE [17] 现成的度量深度预测作为可选的几何锚点。这些对齐步骤使得重建的观看者和视角能够放置在共享的、度量对齐的 4D 坐标系中。

4.2 统一离散表示

在连续域中对联合分布 $p(X, Y)$ 进行建模具有挑战性,因为模态具有异质性,从密集的像素阵列到稀疏的运动学向量不等。因此,我们利用统一的离散潜在接口来使模态同质化。 对于每个具有连续输入维度 $D_m$ 的模态 $m \in X \cup Y$,我们采用模态特定的向量量化变分自编码器(VQ-VAE)来学习量化函数 $Q_m : \mathbb{R}^{D_m} \rightarrow Z_m$。该函数将连续信号映射为 $L_m$ 个离散标记的序列 $z_m = (z_{m,1}, \dots, z_{m,L_m})$。这些

第 8 页

8 X. Lyu 等

token 是从学习到的码本 $C_m \in \mathbb{R}^{K_m \times d}$ 中抽取的索引,其中 $K_m$ 表示模态 $m$ 的词表大小,$d$ 是潜在特征维度。完整的多模态状态表示为统一的 token 序列 $Z$:

$$ \mathbf{Z} = [\mathbf{z}_{\text{rgb}}, \mathbf{z}_{\text{gaze}}, \mathbf{z}_{\text{body}}] \quad (2) $$

针对人体和手部 token 化,为了解决高质量、统一全身数据集的严重匮乏问题,我们设计了一种解耦的双流 token 化框架,能够利用仅包含身体或仅包含手部的独立动作捕捉数据。给定输入 3D 关节序列 $y_m \in \mathbb{R}^{N \times J \times 3}$,$m \in \{\text{hand, body}\}$,由 $N$ 帧和 $J$ 个关节组成,我们的身体和手部 token 化器独立应用 2D 卷积以提取局部运动学先验。这些特征随后由 12 层 Transformer 编码器处理,将原始运动学投影到 210 维嵌入的密集连续潜在空间中。为了在高度多样的数据集上确保高字典利用率的同时对这些表示进行量化,我们利用了球形量化码本。通过将连续嵌入投影到单位球面上,并结合指数移动平均(EMA)码本更新策略,我们有效地防止了码本坍塌,并为全身和细粒度手部领域保持了表达力丰富的离散潜在空间。对称的 12 层 Transformer 解码器随后重构连续序列,通过标准的 L2 重构损失和码本承诺损失进行优化。对于密集视觉模态,我们使用 Cosmos Tokenizers [1] 对 RGB 和深度视频进行量化。此外,为了捕捉更广泛的自我中心状态动态分布,我们在我们扩展至 7B token 的数据集上(表 1)重新训练了来自 EgoM2P [22] 的注视和相机轨迹 token 化器。这种离散化将连续回归问题转化为定义在特定模态离散词表($C_m$)上的序列建模任务,确保每个模态的预测都限制在其各自的码本空间内。

4.3 掩码生成第一人称 Transformer

我们使用由参数 $\theta$ 参数化的掩码生成第一人称 Transformer (MGET) 来近似联合分布 $p(Z)$。具体而言,我们基于 T5 [41] 调整了一种编码器-解码器架构,其编码器和解码器均包含 12 个 Transformer 块,隐藏维度为 768。由于统一序列 $Z$ 包含高度异构的数据,我们首先通过特定模态的嵌入层将离散 token 映射为连续特征向量。为了显式注入结构和语义上下文,我们在处理前向序列中添加可学习的模态类型嵌入和固定的正弦时空位置编码。为了补偿离散量化过程中不可避免地丢失的细粒度像素细节,我们引入了一个额外的可训练视觉 Transformer (ViT),它直接将原始第一人称视频编码为具有连续空间细节的特征 $x_{\text{ViT}}$。这些特征作为额外的视觉上下文被整合,得到 $X = \{x_{\text{rgb}}, x_{\text{ViT}}\}$。

遵循掩码建模范式 [4,58],我们定义了一个训练目标,以学习统一 token 序列 across 模态间的依赖关系

第 9 页

ReViV:从第一人称视频中重建观看者与视角的4D表示 9

$Z$ 表示完整状态 $X \cup Y$。在训练过程中,我们随机采样一个二进制掩码 $M \in \{0, 1\}^{|Z|}$,将序列划分为掩码标记 $Z_M$ 和可见标记 $Z_V$。通过在所有模态上随机采样掩码 $M$ [2, 22],网络被迫学习任意条件分布的集合 $p(Z_M \mid Z_V)$。由于联合分布可以分解为一系列条件分布,优化所有可能的掩码配置使得该目标能够作为学习潜在联合分布 $p(Z) \approx p(X, Y)$ 的高效代理:

$$ \mathcal{L}(\theta) = \mathbb{E}_{\mathbf{z}_i \notin \mathbf{Z}_{\text{mask}}} \left[ -\log p_\theta(z_i \mid \mathbf{Z}_{\mathcal{V}}) \right] \quad (3) $$

关键在于,尽管使用单个交叉熵损失进行优化,但这种随机多模态掩码策略充当了多任务训练目标。首先,通过对单个模态内的部分序列进行掩码,网络学习模态内运动动态(例如,$p(z_{\text{body},M} \mid z_{\text{body},V})$,$p(z_{\text{hand},M} \mid z_{\text{hand},V})$)。这迫使模型编码强大的时序运动学先验,使其能够在不依赖显式解剖学或平滑正则化的情况下生成连续且合理的运动。其次,通过跨不同模态进行掩码,网络学习鲁棒的多模态相关性(例如,从可见上下文中推断未观察到的运动学,$p(z_{\text{body},M} \mid z_{\text{rgb}})$)。这两种隐式任务共同使 MGET 能够直接从多模态训练分布中捕捉人类运动学和受环境条件影响的交互模式。

Transformer 处理输入序列以捕捉时空依赖关系,从而输出潜在表示。这些特征通过特定模态的线性头投影,以预测其各自词汇表 $C_m$ 上的概率分布。在推理阶段,我们通过制定特定的掩码条件来实现主要重建目标,该条件将观察到的第一人称视频上下文作为可见标记($Z_V = Z_X$),并将人类和场景状态模态视为完全掩码($Z_M = Z_Y$)。然后,我们采用迭代并行解码策略,从这些分布中逐步采样掩码标记,重建完整且时序连贯的4D状态。更多实现细节见补充材料第 B 和 C 节。

5 实验

评估细节。对于所有实验,我们将每个序列拆分为2秒的片段。对于视频模态(RGB 和深度),我们将原始30 FPS下采样至8 FPS,并将空间分辨率调整为256×256。对于非视频模态,包括相机、注视、身体和手部,我们保留原始30 FPS。

5.1 第一人称身体运动重建

基线。我们将 ReViV 与 EgoAllo [57] 和 UniEgoMotion [36] 进行比较,这是两个最近基于扩散模型的第一人称全身运动恢复最先进(SOTA)模型。

第 10 页

10 X. Lyu 等

表 2:ADT [34] 上的第一人称身体运动重建。ReViV 仅通过单目视频即实现了 SOTA 的性能和效率。即使没有显式相机跟踪,ReViV 产生的运动质量(FID)、姿态精度(PA-MPJPE)和姿态相似性均优于利用估计(VIPE)或真实相机轨迹的基线方法。↓:越低越好;↑:越高越好。

方法 输入 相机轨迹 GA-MPJPE ↓ PA-MPJPE ↓ 相似性 ↑ FID ↓ 时间 (s) ↓

无 – – – – – EgoAllo [57] VIPE [17] 227.6 167.5 0.529 1.069 101.0 真实相机 198.4 136.8 0.556 1.160 72.5 无 – – – – – UniEgoMotion [36] VIPE [17] 130.5 98.4 0.572 1.087 37.6 真实相机 105.8 88.7 0.591 1.098 9.1 本文方法 无 111.5 88.6 0.751 0.442 0.7

评估协议。由于我们的大规模预训练语料库缺乏真实 SMPL(-X) [28,37] 标注,我们无法在相同的监督条件下重新训练基线模型。为了确保公平比较并评估对未见领域的泛化能力,我们在 Aria Digital Twin 数据集 [34] 上进行了所有定量评估,该数据集被严格排除在我们的训练数据之外。具体而言,我们使用了 3,185 个视频片段及其对应的 3D 身体标注。与 ReViV 不同,现有的基线方法无法仅通过单目 RGB 运行,需要显式的相机轨迹。为了确保在缺乏真实轨迹时的公平比较,我们为这些基线方法提供了使用最先进的相机跟踪方法 VIPE [17] 估计的一致相机位姿。 指标。绝对关节位置误差可能会受到全局平移偏移的严重影响,这些偏移既来自单目相机跟踪的模糊性,也来自头戴式相机与身体根关节之间的动态关联。为了隔离真实的姿态精度,我们报告了两种对齐后的平均关节位置误差(MPJPE)变体。GA-MPJPE 对整个运动序列应用单次 Procrustes 对齐(优化旋转、平移和缩放)。相比之下,PA-MPJPE 在逐帧基础上独立应用此对齐,以捕捉严格的局部姿态精度。 除了逐关节误差外,我们还评估了运动的真实感和分布相似性。遵循先前的生成运动模型,我们使用预训练的 TMR 运动编码器 [39] 将序列投影到潜在空间。从这些嵌入中,我们计算 Fréchet Inception Distance (FID) 以测量分布对齐程度,并计算成对嵌入之间的余弦相似性以量化运动级别的对应关系。 结果。如表 2 所示,ReViV 建立了单目第一人称身体运动重建的新 SOTA。与使用来自 VIPE [17] 的估计相机轨迹的基线方法相比,我们的方法在所有指标上均占主导地位,且在推理过程中比 EgoAllo 快 100 倍,比 UniEgoMotion 快 10 倍以上。我们将此归因于我们的统一框架:与受累积相机跟踪误差影响的基线方法不同,ReViV 直接建模联合分布 p(X, Y),完全绕过了容易出错的中间跟踪步骤。

第 11 页

ReViV:从第一人称视频中重建观看者与视角的4D表示 11

表 3:第一人称手部运动重建的定量比较。ReViV 在四个基准测试中均实现了最先进的精度,同时其运行速度比连续优化基线方法(例如 Dyn-HaMR)快几个数量级。评估的指标包括全局对齐(GA-MPJPE)、根对齐(RA-MPJPE)和 Procrustes 对齐(PA-MPJPE)误差。↓表示越低越好。

方法 时间 (s) ↓ HoloAssist [50] HOT3D [3] GA-MPJPE ↓ RA-MPJPE ↓ PA-MPJPE ↓ GA-MPJPE ↓ RA-MPJPE ↓ PA-MPJPE ↓

HaMeR [38] 72 59.5 57.9 32.9 94.4 74.1 48.1 Dyn-HaMR [59] 280 49.6 31.5 23.0 107.7 46.9 32.0 本文方法 0.7 23.5 29.7 10.5 38.2 48.1 13.6

方法 时间 (s) ↓ ARCTIC [11] TACO [27] GA-MPJPE ↓ RA-MPJPE ↓ PA-MPJPE ↓ GA-MPJPE ↓ RA-MPJPE ↓ PA-MPJPE ↓

HaMeR [38] 72 95.9 39.2 28.6 52.0 39.3 29.1 Dyn-HaMR [59] 280 76.9 33.3 22.4 48.0 32.5 23.5 本文方法 0.7 35.1 33.0 13.7 20.3 25.2 9.4

值得注意的是,即使在没有相机轨迹作为输入的情况下,ReViV 在局部姿态精度(PA-MPJPE)、语义对应关系(Similarity)和运动真实性(FID)方面均优于依赖真实相机轨迹的基线方法。这一优势源于我们的离散标记化和多模态掩码目标,它迫使模型学习鲁棒的、符合生物力学合理性的运动学先验,而不是过度依赖刚性的轨迹输入。虽然配备了完美外部跟踪的基线方法在全局对齐(GA-MPJPE)方面略好,但 ReViV 仍然具有极高的竞争力,证明了仅从纯单目视频中就可以有效地隐式学习全局自我运动。请参阅补充材料第 E.2 节中的其他定性可视化结果。

5.2 第一人称手部运动重建

基线方法。我们将 ReViV 与两种最近的第一人称手部运动重建最先进(SOTA)方法进行比较:HaMeR [38] 和 Dyn-HaMR [59]。我们使用这两种方法的官方实现,并在适用时遵循其推荐的评估设置。

评估协议。我们在四个公开的第一人称手部运动基准测试上评估我们的方法:HoloAssist [50](27,910 个验证片段)、HOT3D [3](1,519 个片段)、ARCTIC [11](449 个片段)和 TACO [27](998 个片段)。除了我们的身体运动评估外,我们还报告全局对齐 MPJPE 和 Procrustes 对齐 MPJPE,以及根对齐 MPJPE(RA-MPJPE),后者在计算每关节平均误差之前,通过每帧根关节位置对手部关节进行偏移。为了评估计算效率,我们记录了每个片段的平均推理时间。由于 Dyn-HaMR 基线方法依赖于计算密集型的测试时优化,在庞大的 HoloAssist 数据集上对其进行评估的成本过高。因此,为了确保公平且可行的比较,我们从 HoloAssist [50] 验证集中随机采样了 3,000 个片段,并报告该代表性子集上的准确性和运行时统计信息。

结果。表 3 显示,ReViV 在四个多样化的数据集上均优于基于帧的(HaMeR)和动态的(Dyn-HaMR)基线方法。值得注意的是,ReViV

第 12 页

12 X. Lyu 等人

真实值

HaMeR

Dyn-HaMR

本文方法

图 3: 第一人称手部重建的定性结果。ReViV 学习鲁棒的时空运动先验,即使在严重遮挡或手部不可见的情况下,也能生成合理的手部运动。我们可视化了两个不同序列中采样的非连续帧,以展示时间稳定性。

表 4: 在 ADT 数据集上进行的第一人称相机跟踪、视线估计和深度估计。我们还报告了每种方法在相机跟踪任务上的每个片段的平均运行时间,其中 EgoM2P 和我们的方法实现了实时性能。

相机 视线 深度 方法 时间 (s) ↓ ATE ↓ RTE ↓ RRE ↓ MSE ↓ Abs Rel ↓ δ1.25 ↑

EgoM2P [22] 0.7 0.030 0.009 1.290 0.0311 0.458 30.3 EgoMono4D [60] 14.2 0.051 0.015 1.307 – 0.150 83.9 VIPE [17] 25.8 0.005 0.009 1.307 – – – 本文方法 0.7 0.015 0.009 1.279 0.0211 0.265 56.5

实现了最先进的局部姿态精度 (PA-MPJPE) 和全局对齐 (GA-MPJPE),且速度比 HaMeR 快 100 倍,比 Dyn-HaMR 快 400 倍以上。

此外,图 3 中的定性可视化突出了 ReViV 对第一人称视觉中常见的严重遮挡的鲁棒性。在这些条件下,基线方法通常会崩溃或预测出断裂的运动学结构,而 ReViV 利用从联合分布中学习到的强大时空先验。这使得 ReViV 即使在从第一人称视角完全无法观察到手部的情况下,也能在时间间隙(例如左侧序列中第 4 帧和第 10 帧之间,以及右侧序列中第 2 帧和第 6 帧之间)产生符合生物力学原理且时间一致的手部运动。

第 13 页

ReViV:从第一人称视频中重建观看者与视角的4D表示 13

5.3 第一人称相机跟踪

基线方法。我们将 ReViV 与专注于第一人称的 4D 重建方法(EgoM2P [22] 和 EgoMono4D [60])以及最先进的通用场景 4D 重建方法 VIPE [17] 进行比较。EgoMono4D 依赖于现成的光流预测,并将相机跟踪重新表述为跨置信度感知对应点的深度对齐。类似地,VIPE 对现成的密集光流、稀疏轨迹和度量深度的预测执行密集束调整。相比之下,ReViV 不依赖显式的几何约束,而是直接从第一人称 RGB 输入端到端地预测相机位姿。

评估协议。我们在未见过的 ADT 数据集的所有序列上进行评估。对于相机跟踪,我们报告标准误差指标,包括绝对平移误差(ATE)、相对平移误差(RTE)和相对旋转误差(RRE)。所有预测的相机轨迹都使用在整个片段上估计的 Sim(3) 变换与真实值对齐。

结果。定量结果见表 4。除了 ATE 指标外,我们的方法优于所有基线方法,同时在所有方法中实现了最低的 RTE 和 RRE。与 VIPE 在 ATE 上的性能差距可归因于其对整个输入片段进行密集束调整,而我们的方法在没有几何后处理的情况下,通过单次前向传播预测相机位姿。定性结果见补充材料第 E 节。

5.4 第一人称视线估计

我们将 ReViV 与 EgoM2P [22] 在 ADT 数据集上进行比较,以从第一人称视频中预测 2D 视线位置。预测的视线位置和真实值均相对于输入分辨率归一化到 [0, 1]。我们报告均方误差(MSE)作为评估指标。如表 4 所示,与 EgoM2P 相比,我们的方法在未见数据上实现了显著更低的误差。定性结果见补充材料第 E 节。

5.5 第一人称视频深度估计

基线方法。我们将 ReViV 与专注于第一人称的 4D 重建方法 EgoM2P [22] 和 EgoMono4D [60] 在深度估计方面进行比较。EgoMono4D 利用 UniDepth [40](一种专门的单目深度估计模型),通过在第一人称数据上进行微调来实现。相比之下,我们的方法是从头开始训练的,不依赖专家先验。

评估协议。我们使用 ADT [34] 上所有带有深度注释的序列,并过滤掉 RGB 帧和深度帧之间时间戳差异超过 10 毫秒的片段,以避免不对齐。对于所有方法,预测值都通过片段级的缩放和平移因子与真实值对齐。然后,我们报告相对指标,包括绝对相对误差(Abs Rel)以及预测深度在真实值 1.25 倍范围内的百分比(δ1.25)。

结果。定量结果见表 4。ReViV 在未见数据集上显著优于 EgoM2P,但在

第 14 页

14 X. Lyu 等

表 5:关于自我身体运动、相机跟踪与深度的消融实验。

身体运动 相机 深度

方法 GA ↓ PA ↓ Sim ↑ FID ↓ ATE ↓ RRE ↓ Rel ↓ δ1.25 ↑

ReViV 111.5 88.6 0.751 0.442 0.015 1.279 0.265 56.5 ReViV-BodyData 134.0 109.3 0.645 0.478 – – – – ReViV-BodySpec. 200.3 139.9 0.545 0.623 – – – – ReViV-w/oNy – – – – 0.031 1.293 0.432 32.0 ReViV-w/oNy&Holo – – – – 0.032 1.335 0.452 30.1 ReViV-1to1Mask 158.3 120.6 0.615 0.548 0.036 1.267 0.401 36.8 ReViV-Uniform 172.7 119.8 0.598 0.665 0.053 1.529 0.494 26.7 ReViV-Tiny 143.1 116.7 0.634 0.486 0.026 1.269 0.337 44.7

两项指标。我们将这一差距归因于两个主要因素:(1) EgoMono4D 受益于从预训练的 UniDepth 权重继承的强大深度特定先验,而我们的方法是在没有深度专家初始化的情况下训练的;(2) Cosmos tokenizer [1] 的离散标记化引入了量化误差,这可能会影响细粒度的深度预测。尽管存在差距,但我们的方法效率显著更高,推理速度比 EgoMono4D 快 20 倍以上。

5.6 消融实验

我们进行了系统的消融实验,以验证 ReViV 的每个核心设计选择,如表 5 所示。补充的手部重建消融实验见补充材料第 F 节。 任务特定模型与统一模型。仅使用 RGB 输入训练任务特定的身体专家模型 (ReViV-BodySpec.) 导致所有指标上的准确率大幅下降,与 ReViV 相比。孤立的单模态训练未能利用联合公式捕获的丰富跨模态监督信号。 模型容量。轻量级变体 (ReViV-Tiny,约 1.27 亿参数) 在身体运动、相机跟踪和深度估计方面表现出明显退化的性能。这证实了更多的参数对于近似我们大规模多模态数据集背后复杂的联合分布至关重要,且重建质量随模型容量增加而提升。 掩码策略。我们通过将 Dirichlet α 设置为 0.001 训练了独立的 1 对 1 模态掩码 (ReViV-1to1Mask),导致深层跨模态信息缺失。另一种在所有模态上使用均匀采样的消融实验 (ReViV-Uniform),导致身体标记稀疏而密集视频标记不平衡,从而造成准确率崩溃。我们的采样策略通过为任意条件分布的集成生成所有可能的掩码排列,缓解了上述两个问题。 数据扩展。为了分离数据量的影响,我们逐步移除了训练数据集 (Nymeria,以及 Nymeria + HoloAssist),从而得到 ReViV-w/oNy 和 ReViV-w/oNy&Holo。实验结果证实性能随数据量增加而提升。仅使用带有身体标注的数据集训练的模型 (ReViV-BodyData) 相比我们的完整模型准确率下降。这表明,即使没有显式标注,在大规模数据集上进行联合训练也能通过丰富泛化的跨模态先验显著提升重建效果。

第 15 页

ReViV:从第一人称视频中重建观察者和视图的4D表示 15

6 结论

在本工作中,我们提出了 ReViV,这是首个统一的生成式框架,旨在弥合第一人称场景重建与未观察到的人体运动学之间长期存在的差距。通过将本质上模糊的自我身体估计任务转化为联合概率学习问题,我们证明了仅凭单目 RGB 视频就足以重建动态的 4D 环境以及佩戴者的全身、手部行为和注视行为。我们方法的核心是掩码生成第一人称 Transformer(MGET),它成功地将这些异构模态对齐到一个共享的、时间连贯的潜在空间中。通过大规模预训练,ReViV 为整体第一人称感知建立了新的基础基线,在无需依赖专用硬件或预计算 SLAM 的情况下实现了最先进的性能。最终,通过将观察者和视图统一在单一的馈送前架构中,这项工作为下一代具备自然、以人类为中心的推理能力的具身 AI 系统铺平了道路。

局限性与未来方向。我们利用 VQ-VAE 来解决第一人称多模态数据的异构性问题。通过将这些多样的连续信号映射到统一的离散标记空间,我们使得单个 Transformer 能够联合建模观察者和视图,从而受益于驱动现代基础模型的稳定缩放定律。然而,这种统一的离散表示为密集回归任务引入了固有的权衡。具体而言,量化过程不可避免地会丢弃一些高频空间细节,这略微限制了模型在深度估计方面的能力,相较于针对特定任务的连续回归方法。探索将连续生成先验(如条件扩散模型)集成到解码阶段可能是一个未来的方向。这将使我们的框架在保持其强大的多模态推理能力的同时,有效地恢复高保真 4D 场景重建所需的高细粒度几何细节。

致谢。吕晓钟和李根对本工作贡献相当。李根提出了核心思想,开发了主要代码库,实现了手部标记器,训练了主模型(不含身体组件),并主导了论文撰写。吕晓钟通过将多模态数据集扩展至 70 亿标记,开发了身体标记器,重新训练了注视和相机标记器,训练了最终的全规模主模型,进行了实验并创建了可视化内容,从而推动了系统的规模扩展和最终定型。吕晓钟得到了苏黎世联邦理工学院(ETH Zurich)研究资助的支持。李根得到了微软苏黎世空间 AI 实验室博士奖学金的支持。这项工作还作为瑞士 AI 倡议的一部分,获得了瑞士国家超级计算中心(CSCS)在 Alps 项目下(项目 ID 为 a143, a144)的资助。我们要感谢 Zinuo You 和 Malte Prinzler 进行的校对工作。

第 16 页

16 X. Lyu 等

参考文献

1. Agarwal, N., Ali, A., Bala, M., Balaji, Y., Barker, E., Cai, T., Chattopadhyay, P., Chen, Y., Cui, Y., Ding, Y., 等: Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575 (2025) 2. Bachmann, R., Kar, O.F., Mizrahi, D., Garjani, A., Gao, M., Griffiths, D., Hu, J., Dehghan, A., Zamir, A.: 4m-21: 面向数十项任务和模态的任意到任意视觉模型。神经信息处理系统进展 37, 61872–61911 (2024) 3. Banerjee, P., Shkodrani, S., Moulon, P., Hampali, S., Han, S., Zhang, F., Zhang, L., Fountain, J., Miller, E., Basol, S., Newcombe, R., Wang, R., Engel, J.J., Hodan, T.: HOT3D: 基于第一人称多视角视频的手部和物体3D跟踪。CVPR (2025) 4. Chang, H., Zhang, H., Jiang, L., Liu, C., Freeman, W.T.: Maskgit: 掩码生成式图像 Transformer。在: IEEE 计算机视觉与模式识别会议 (CVPR) (2022年6月) 5. Chen, S., Guo, H., Zhu, S., Zhang, F., Huang, Z., Feng, J., Kang, B: Video depth anything: 超长视频的一致性深度估计。在: CVPR (2025) 6. Chen, Y., Chen, X., Xue, Y., Chen, A., Xiu, Y., Pons-Moll, G.: Human3r: 随时随地每个人。arXiv 预印本 arXiv:2510.06219 (2025) 7. Chu, W.H., Ke, L., Fragkiadaki, K.: Dreamscene4d: 从单目视频生成动态多物体场景。NeurIPS 37, 96181–96206 (2024) 8. Damen, D., Doughty, H., Farinella, G.M., Fidler, S., Furnari, A., Kazakos, E., Molti- santi, D., Munro, J., Perrett, T., Price, W., 等: Epic-kitchens 数据集: 收集、挑战与基线。IEEE TPAMI 43(11), 4125–4141 (2020) 9. Deshmukh, M., Akada, H., Rhodin, H., Theobalt, C., Golyanik, V.: E-3dpsm: 用于基于事件的自我中心3D人体姿态估计的状态机。在: IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 14017–14026 (2026) 10. Duan, Y., Wei, F., Dai, Q., He, Y., Chen, W., Chen, B.: 4d-rotor gaussian splatting: 迈向动态场景的高效新视角合成。在: ACM SIGGRAPH 2024 会议论文集。pp. 1–11 (2024) 11. Fan, Z., Taheri, O., Tzionas, D., Kocabas, M., Kaufmann, M., Black, M.J., Hilliges, O.: ARCTIC: 灵巧双手操作物体的数据集。在: IEEE 计算机视觉与模式识别会议论文集 (CVPR) (2023) 12. Feng, H., Zhang, J., Wang, Q., Ye, Y., Yu, P., Black, M.J., Darrell, T., Kanazawa, A.: St4rtrack: 世界中的同时4D重建与跟踪。在: IEEE/CVF 国际计算机视觉会议论文集。pp. 8503– 8513 (2025) 13. Grauman, K., Westbury, A., Byrne, E., Chavis, Z., Furnari, A., Girdhar, R., Ham- burger, J., Jiang, H., Liu, M., Liu, X., 等: Ego4d: 3000小时自我中心视频环游世界。在: CVPR。pp. 18995–19012 (2022) 14. Grauman, K., Westbury, A., Torresani, L., Kitani, K., Malik, J., Afouras, 等: Ego-exo4d: 从第一人称和第三人称视角理解熟练人类活动。在: IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)。pp. 19383–19400 (2024年6月) 15. Guzov, V., Jiang, Y., Hong, F., Pons-Moll, G., Newcombe, R., Liu, C.K., Ye, Y., Ma, L.: Hmd 2: 基于单目自我中心头戴式设备的环境感知运动生成。在: 2025 国际3D视觉会议 (3DV)。pp. 1394–1405. IEEE (2025)

第 17 页

ReViV:从第一人称视频中重建观看者与视角的 4D 表示 17

16. He, Y., Huang, Y., Chen, G., Lu, L., Pei, B., Xu, J., Lu, T., Sato, Y.: Bridg- ing perspectives: A survey on cross-view collaborative intelligence with egocentric- exocentric vision. International Journal of Computer Vision 134(2), 62 (2026) 17. Huang, J., Zhou, Q., Rabeti, H., Korovko, A., Ling, H., Ren, X., Shen, T., Gao, J., Slepichev, D., Lin, C.H., Ren, J., Xie, K., Biswas, J., Leal-Taixe, L., Fidler, S.: Vipe: Video pose engine for 3d geometric perception. In: NVIDIA Research Whitepapers arXiv:2508.10934 (2025) 18. Jiang, H., Grauman, K.: Seeing invisible poses: Estimating 3d body pose from egocentric video. In: CVPR. pp. 3501–3509. IEEE (2017) 19. Jiang, H., Ithapu, V.K.: Egocentric pose estimation from human vision span. In: ICCV. pp. 10986–10994. IEEE (2021) 20. Kwon, T., Tekin, B., Stühmer, J., Bogo, F., Pollefeys, M.: H2o: Two hands ma- nipulating objects for first person interaction recognition. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 10138–10148 (October 2021) 21. Lei, J., Weng, Y., Harley, A.W., Guibas, L., Daniilidis, K.: Mosca: Dynamic gaus- sian fusion from casual videos via 4d motion scaffolds. In: CVPR. pp. 6165–6177 (2025) 22. Li, G., Chen, Y., Wu, Y., Zhao, K., Pollefeys, M., Tang, S.: Egom2p: Egocentric multimodal multitask pretraining. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 10830–10843 (October 2025) 23. Li, G., Zhao, K., Zhang, S., Lyu, X., Dusmanu, M., Zhang, Y., Pollefeys, M., Tang, S.: Egogen: An egocentric synthetic data generator. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 14497–14509 (June 2024) 24. Li, J., Liu, K., Wu, J.: Ego-body pose estimation via ego-head pose estimation. In: CVPR. pp. 17142–17151 (2023) 25. Li, Z., Dwivedi, S.K., Maric, F., Chacon, C., Bertsch, N., Arcadu, F., Hodan, T., Ramamonjisoa, M., Wonka, P., Zhao, A., et al.: Egoposeformer v2: Accurate egocentric human motion estimation for ar/vr. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21121–21131 (2026) 26. LIU, Q., Liu, Y., Wang, J., Lyu, X., Wang, P., Wang, W., Hou, J.: MoDGS: Dynamic gaussian splatting from casually-captured monocular videos with depth priors. In: The Thirteenth International Conference on Learning Representations (2025) 27. Liu, Y., Yang, H., Si, X., Liu, L., Li, Z., Zhang, Y., Liu, Y., Yi, L.: Taco: Bench- marking generalizable bimanual tool-action-object understanding. arXiv preprint arXiv:2401.08399 (2024) 28. Loper, M., Mahmood, N., Romero, J., Pons-Moll, G., Black, M.J.: SMPL: A skinned multi-person linear model. ACM Trans. Graphics (Proc. SIGGRAPH Asia) 34(6), 248:1–248:16 (Oct 2015) 29. Lu, J., Huang, T., Li, P., Dou, Z., Lin, C., Cui, Z., Dong, Z., Yeung, S.K., Wang, W., Liu, Y.: Align3r: Aligned monocular depth estimation for dynamic videos. In: CVPR. pp. 22820–22830 (2025) 30. Luiten, J., Kopanas, G., Leibe, B., Ramanan, D.: Dynamic 3d gaussians: Track- ing by persistent dynamic view synthesis. In: 2024 International Conference on 3D Vision (3DV). pp. 800–809. IEEE (2024) 31. Luo, Z., Hachiuma, R., Yuan, Y., Kitani, K.: Dynamics-regulated kinematic policy for egocentric pose estimation. NeurIPS 34, 25019–25032 (2021)

第 18 页

18 X. Lyu 等

32. Ma, L., Ye, Y., Hong, F., Guzov, V., Jiang, Y., Postyeni, R., Pesqueira, L., Gamino, A., Baiyya, V., Kim, H.J., 等:Nymeria:大规模多模态野外第一人称日常动作数据集。在:ECCV。页码 445–465。Springer (2024) 33. Ng, E., Xiang, D., Joo, H., Grauman, K.:You2me:通过第一人称和第二人称交互推断第一人称视频中的身体姿态。在:CVPR。页码 9890–9900 (2020) 34. Pan, X., Charron, N., Yang, Y., Peters, S., Whelan, T., Kong, C., Parkhi, O., Newcombe, R., Ren, Y.C.:Aria Digital Twin:面向第一人称 3D 机器感知的新基准数据集。在:IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集。页码 20133–20143 (2023 年 10 月) 35. Pani, A., Yang, Y.:Gaze-vlm:通过注意力正则化弥合注视与视觉语言模型之间的差距以实现第一人称理解。在:NeurIPS (2025) 36. Patel, C., Nakamura, H., Kyuragi, Y., Kozuka, K., Niebles, J.C., Adeli, E.:Uniego- motion:用于第一人称动作重建、预测和生成的统一模型。在:IEEE/CVF 国际计算机视觉会议论文集。页码 10318–10329 (2025) 37. Pavlakos, G., Choutas, V., Ghorbani, N., Bolkart, T., Osman, A.A.A., Tzionas, D., Black, M.J.:Expressive body capture:从单张图像中获取 3D 手部、面部和身体。在:IEEE 计算机视觉与模式识别会议 (CVPR) 论文集。页码 10975–10985 (2019) 38. Pavlakos, G., Shan, D., Radosavovic, I., Kanazawa, A., Fouhey, D., Malik, J.: 使用 Transformer 重建 3D 手部。在:CVPR (2024) 39. Petrovich, M., Black, M.J., Varol, G.:Tmr:使用对比式 3D 人体动作合成进行文本到动作检索。在:IEEE/CVF 国际计算机视觉会议论文集。页码 9488–9497 (2023) 40. Piccinelli, L., Yang, Y.H., Sakaridis, C., Segu, M., Li, S., Van Gool, L., Yu, F.: UniDepth:通用单目度量深度估计。在:IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) (2024) 41. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., Liu, P.J.:探索统一文本到文本 Transformer 的迁移学习极限。Journal of Machine Learning Research 21(140),1–67 (2020) 42. Rodin, I., Furnari, A., Mavroeidis, D., Farinella, G.M.:从第一人称(第一人称视角)视觉预测未来:一项综述。Computer Vision and Image Understand- ing 211,103252 (2021) 43. Stearns, C., Harley, A., Uy, M., Dubost, F., Tombari, F., Wetzstein, G., Guibas, L.:Dynamic gaussian marbles:用于随意单目视频的新视角合成。在:SIGGRAPH Asia。页码 1–11 (2024) 44. Tome, D., Alldieck, T., Peluse, P., Pons-Moll, G., Agapito, L., Badino, H., De la Torre, F.:Selfpose:从头戴式相机进行 3D 第一人称姿态估计。IEEE 模式分析与机器智能汇刊 45(6),6794–6806 (2020) 45. Tome, D., Peluse, P., Agapito, L., Badino, H.:xr-egopose:来自 HMD 摄像头的 3D 第一人称人体姿态。在:ICCV。页码 7728–7738 (2019) 46. Wang, J., Liu, L., Xu, W., Sarkar, K., Theobalt, C.:估计全局空间中的第一人称 3D 人体姿态。在:ICCV。页码 11500–11509 (2021) 47. Wang, Q., Ye, V., Gao, H., Zeng, W., Austin, J., Li, Z., Kanazawa, A.:Shape of motion:从单个视频进行 4D 重建。在:ICCV。页码 9660–9672 (2025) 48. Wang, Q., Zhang, Y., Holynski, A., Efros, A.A., Kanazawa, A.:具有持久状态的连续 3D 感知模型。在:CVPR。页码 10510–10522 (2025)

第 19 页

ReViV:从第一人称视频中重建观看者与视角 19

49. Wang, S., Yang, X., Shen, Q., Jiang, Z., Wang, X.: Gflow: 从单目视频中恢复 4D 世界。在:第三十九届人工智能 AAAI 会议、第三十七届人工智能创新应用会议及第十五届人工智能教育进展研讨会论文集。pp. 7862–7870 (2025) 50. Wang, X., Kwon, T., Rad, M., Pan, B., Chakraborty, I., Andrist, S., Bohus, D., Feniel lo, A., Tekin, B., Frujeri, F.V., Joshi, N., Pollefeys, M.: Holoassist: 用于现实世界交互式 AI 助手的自我中心人类交互数据集。在:IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集。pp. 20270–20281 (2023 年 10 月) 51. Wu, G., Yi, T., Fang, J., Xie, L., Zhang, X., Wei, W., Liu, W., Tian, Q., Wang, X.: 用于实时动态场景渲染的 4D 高斯溅射。在:CVPR。pp. 20310–20320 (2024) 52. Xiao, Y., Wang, J., Xue, N., Karaev, N., Makarov, Y., Kang, B., Zhu, X., Bao, H., Shen, Y., Zhou, X.: Spatialtrackerv2: 简化 3D 点跟踪。arXiv 预印本 arXiv:2507.12462 (2025) 53. Xin, J., Wang, L., Xu, K., Yang, C., Yin, B.: 从自我中心演示视频中同时学习交互区域和运动轨迹。IEEE 机器人与自动化快报 8(10), 6635–6642 (2023) 54. Xu, W., Chatterjee, A., Zollhoefer, M., Rhodin, H., Fua, P., Seidel, H.P., Theobalt, C.: Mo 2 cap 2: 使用帽载鱼眼相机进行实时移动 3D 动作捕捉。IEEE 可视化与计算机图形学汇刊 25(5), 2093–2101 (2019) 55. Xu, Z., Li, Z., Dong, Z., Zhou, X., Newcombe, R., Lv, Z.: 4dgt: 使用真实世界单目视频学习 4D 高斯 Transformer。arXiv 预印本 arXiv:2506.08015 (2025) 56. Yang, Z., Gao, X., Zhou, W., Jiao, S., Zhang, Y., Jin, X.: 用于高保真单目动态场景重建的可变形 3D 高斯。在:CVPR。pp. 20331–20341 (2024) 57. Yi, B., Ye, V., Zheng, M., Li, Y., Müller, L., Pavlakos, G., Ma, Y., Malik, J., Kanazawa, A.: 估计自我感知世界中的身体和手部运动。在:计算机视觉与模式识别会议论文集。pp. 7072–7084 (2025) 58. Yu, L., Cheng, Y., Sohn, K., Lezama, J., Zhang, H., Chang, H., Hauptmann, A.G., Yang, M.H., Hao, Y., Essa, I., Jiang, L.: MAGVIT: 掩码生成视频 Transformer。在:IEEE/CVF 计算机视觉与模式识别会议论文集 (2023) 59. Yu, Z., Zafeiriou, S., Birdal, T.: Dyn-hamr: 从动态相机恢复 4D 交互手部运动。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集 (2025 年 6 月) 60. Yuan, C., Chen, G., Yi, L., Gao, Y.: 自我中心视频的自我监督单目 4D 场景重建。arXiv 预印本 arXiv:2411.09145 (2024) 61. Yuan, Y., Kitani, K.: 将自我中心姿态估计与预测作为实时 PD 控制。在:ICCV。pp. 10082–10092 (2019) 62. Yun, H., Na, J., Kim, J., Murdock, C., Kim, G.: 超越框架的凝视:预测自我中心 3D 视觉范围。在:NeurIPS (2025) 63. Zhang, D., Li, G., Li, J., Bressieux, M., Hilliges, O., Pollefeys, M., Van Gool, L., Wang, X.: Egogaussian: 使用 3D 高斯溅射从自我中心视频进行动态场景理解。在:2025 国际 3D 视觉会议 (3DV)。pp. 1091–1102. IEEE (2025)

第 20 页

ReViV:从单目第一人称视频中重建观看者与视图的4D表示 –补充材料–

Xiaozhong Lyu1⋆, Gen Li1⋆, Zhiyin Qian1 , Xucong Zhang1,2 , Marc Pollefeys1,3 , and Siyu Tang1

1 苏黎世联邦理工学院,瑞士 2 代尔夫特理工大学,荷兰 3 微软,瑞士

A 分词器细节

我们通过将连续的时空多模态数据分词化为离散表示空间来实现统一。对于RGB和深度视频,我们遵循EgoM2P [2] 建立的流程,并采用Cosmos分词器(码本大小为64,000)来提取视觉token。对于包括相机轨迹、注视动态以及身体/手部运动在内的低维模态,我们设计并训练了模态特定的向量量化变分自编码器(VQ-VAE)。这些分词器的详细超参数总结在表1中。

我们采用EgoM2P [2] 中的VQ-VAE架构用于相机轨迹(ycam)和注视动态(ygaze)。然而,为了确保在各种空间环境和人类行为中具有鲁棒的泛化能力,我们通过在本文第3节中新构建的大规模数据库上从头重新训练这两个分词器,显著扩大了模型规模。对于这两种模态,输入序列通过一个核大小为2的时间1D卷积,在将通道维度映射到768的同时,以因子2对序列进行时间下采样。随后,特征由一个12层的Transformer编码器(ViT-B)处理。遵循EgoM2P的做法,我们通过应用二进制掩码并计算掩码均方误差(MSE)重建损失来处理注视信号中的无效值(例如硬件遮挡或跟踪丢失),从而允许网络的深层平滑性自然地插补缺失值。我们将注视的码本大小设置为512,相机轨迹的码本大小设置为256。

为了有效捕捉人体全身姿态复杂的时空关节运动,我们引入了专门设计用于身体和手部运动学的专用分词器。鉴于人类运动在时间域和空间骨骼拓扑结构上表现出强烈的相关性,我们没有单纯依赖时间卷积,而是对连续姿态序列应用2D卷积。该操作以因子2的时间下采样和因子3的空间(关节)压缩联合压缩数据,

第 21 页

ReViV:从第一人称视频中重建观看者与视角的4D表示 21

配置 身体 手部 注视 相机

码本大小 2048 1024 512 256 时间压缩 2 2 2 2 空间压缩 3 3 – – 码潜在维度 32 32 32 32 EMA死码阈值 2 2 2 2 码本EMA 0.99 0.99 0.99 0.99 归一化码 [6] ✓ ✓ ✓ ✓ 码本权重 1.0 1.0 1.0 1.0 承诺权重 β 1.0 1.0 1.0 1.0

损失函数 MSE MSE 掩码MSE MSE 基础学习率 5e-6 5e-6 5e-5 2.5e-5 学习率 2e-5 2e-5 1e-4 5e-5 批次大小 64 64 128 128

编码器架构 ViT-B 解码器架构 ViT-B 优化器 AdamW [3] 优化器动量 β1, β2 = 0.9, 0.95 权重衰减 0.05 最大梯度范数 1 学习率调度 余弦衰减 训练轮数 200 预热轮数 5 数据类型 float32 表 1:Tokenizer 训练设置。

将复杂的骨骼结构投影到统一的768维潜在空间中。这些表示随后使用具有自注意力的12层Transformer(ViT-B)进行编码。对于重建,我们计算标准的MSE损失。为了捕捉人类骨骼运动固有的更高自由度,我们通过将身体运动的码本大小设置为2048、手部运动的码本大小设置为1024来扩展这些Tokenizer的表示能力。为了利用人类手部的双侧对称性,我们使用增强数据集分别训练左手和右手的Tokenizer。具体而言,我们通过引入来自另一只手的镜像运动,有效地将每个Tokenizer的训练量增加了一倍——用镜像的右手轨迹补充左手数据,反之亦然。每个Tokenizer在4块NVIDIA H100 GPU上训练约72小时。如表1所示,我们通过训练多个版本的Tokenizer并选择验证损失最低的最佳模型来选择超参数。

B 掩码生成第一人称Transformer(MGET)详情

我们提供了掩码生成第一人称Transformer(MGET)的训练算法,如算法1所示。请注意,在算法1中,“rgb”表示离散视频Token,而“ViT”表示连续视频嵌入。 我们使用AdamW优化器在涵盖所有模态的统一离散Token序列上训练MGET模型,基础学习率为1 × 10−4,全局批次大小为1024。总共,训练过程消耗了约5000亿个Token。我们在前10个轮次中采用预热调度

第 22 页

22 X. Lyu 等人

算法 1 MGET 的多模态掩码预训练

1: 输入: 数据集 {D1, . . . , DN}, 训练模态 M = {rgb, ViT, depth, cam, gaze, hand, body}, 最大序列长度 Lmax = 2048 2: 输出: 优化后的 MGET 参数 θ 3: /* 数据集与 Token 比例采样 */ 4: i ∼Categorical(p1, . . . , pN) \triangleright 按总大小比例采样数据集 5: α ∼Uniform({(0.01, . . . ), (0.1, . . . ), (1, . . . ), (10, . . . )}) \triangleright 采样 Dirichlet 浓度参数 6: π ∼Dirichlet(α′) \triangleright 采样跨模态的 Token 分配比例 7: ZV ←∅, ZM ←∅ \triangleright 初始化可见输入和掩码目标 Token 的集合 8: /* Token 分配与掩码 */ 9: for j ∈M do 10: Tj ←Lmax × πj \triangleright 模态 j 的最大可见 Token 数 11: zj,V ←Sample(Di,j, Tj) \triangleright 采样可见输入 Token 12: zj,M ←Sample(Di,j \ zj,V, Tj) \triangleright 采样互斥的目标 13: ZV ←ZV ∪zj,V 14: ZM ←ZM ∪zj,M 15: end for 16: /* 模态特定嵌入与上下文注入 */ 17: Zemb ←Embed(ZV ∪ZM) + PosTypeEncodings() 18: /* MGET 前向传播 */ 19: Cenc ←Encoderθ(Zemb[ZV]) \triangleright 对输入进行无限制的全局自注意力 20: ˆP ←Decoderθ(Zemb[ZM], Cenc) \triangleright 模态内自注意力 & 模态间交叉注意力 21: /* 优化 */ 22: Lmask ←CrossEntropyLoss(ˆP, ZM) 23: θ ←AdamW(θ, ∇θLmask) \triangleright 更新模型权重 24: 返回: θ

稳定优化所需的轮数。完整模型训练在 256 块 NVIDIA H100 GPU 上大约需要 24 小时。

C 推理细节

遵循 EgoM2P [2] 的与顺序无关的多步并行解码方法,我们在 s = 3 步中迭代重建所有 n 个掩码的人体和场景状态 Token (ZM)。在每一步中,我们均匀采样 n/s 个未预测的目标 Token,并使用两次前向传播来估计它们的分布:一次条件传播(以可见视频上下文 ZV 和任何先前预测的状态 Token 为条件)和一次无条件传播(掩码视频上下文但保留先前预测的状态)。最后,使用无分类器引导 (w = 2) 和核采样 (top-p = 0.8) 从这些组合的对数几率中抽取最终的 Token。

第 23 页

ReViV:从第一人称视频中重建观看者与视角的4D内容 23

输入 本文方法 EgoM2P [2] EgoMono4D [7] VIPE [1]

05 帧

25 帧

45 帧

输入 本文方法 EgoM2P [2] EgoMono4D [7] VIPE [1]

05 帧

25 帧

45 帧

图 1:第一人称相机跟踪结果的定性可视化。 真实值与预测值分别以黑色和彩色线框显示。

D 以身体为锚点的深度尺度优化

我们详细阐述了一种简单但有效的公式,用于估计预测相对深度的度量尺度。该方法显式地将场景深度尺度与重建的人体尺度对齐,从而在第一人称设置中提供具有物理依据的度量重建。 给定预测的第一人称身体在世界空间中的运动,我们可以大致近似地面平面位置。具体而言,我们提取视频序列中预测的脚部关节的 z 坐标,并计算这些 z 值中最小 50% 的平均值,以代表第一人称身体的地板水平面。 同时,我们将相对深度预测提升为未缩放的 3D 场景点云。假设场景中可见的最低点也位于地板上,

第 24 页

24 X. Lyu 等

图 2:投影到 2D 平面上的相机轨迹对比。 图 3:第一人称视线估计结果的定性可视化。

我们从未缩放的场景点云中隔离出对应于 z 值最小 5% 的点。 为了将场景对齐到度量级的自我身体空间(metric ego-body space),我们应用最小二乘对齐来求解缩放因子 s(以及标准的平移偏移 t),通过最小化场景点云中最低的 5% 的点与估计的自我身体地板平面之间的平方距离来实现。 对于地板不可见的序列,我们额外考虑了一个现成的度量深度锚点。我们利用从 VIPE [1] 获得的度量深度预测 dvipe 作为几何锚点。对于每个视频,我们通过最小化重建的相对深度 ydepth 与度量锚点 dvipe 之间的差异来估计全局缩放因子 s 和平移偏移 t。 总之,这些轻量级的对齐策略提供了互补的方法,将重建的观看者和视角映射到度量一致的 4D 坐标系中。

E 附加实验结果

E.1 第一人称相机跟踪

如图 2 所示,ReViV 产生了平滑且准确的相机轨迹,紧密跟随真实值,即使在具有快速头部运动和有限相机视差的挑战性第一人称场景中也是如此。相比之下,基线方法通常表现出漂移、轨迹偏差或时间抖动。 在图 1 中,我们使用 3D 相机视锥提供了我们第一人称相机跟踪性能随时间变化的额外定性可视化。真实相机位姿由黑色线框表示,而预测位姿以颜色显示(我们的方法 ReViV 为红色)。如在不同室内序列的不同时间步(第 05、25 和 45 帧)中所示,ReViV 产生的相机位姿在整个时间窗口内都与真实值保持紧密对齐。相比之下,基线方法(EgoM2P、EgoMono4D 和 VIPE)难以保持空间一致性。随着序列的进展,这些基线方法越来越明显地表现出与黑色真实值线框的平移漂移和旋转错位,而我们的方法成功地保持了准确的跟踪。

第 25 页

ReViV:从第一人称视频中重建观察者与视角的4D表示 25

E.2 第一人称视线估计

定性而言,图3展示了ReViV产生了更准确的视线预测,表明其从第一人称观测中推断人类意图的能力更强。

E.3 第一人称身体运动重建

在图4中,我们展示了在未见过的Aria Digital Twin (ADT) 数据集上,第一人称身体运动重建的详细逐帧定性比较。我们将我们的方法与以真实相机轨迹为条件的近期基线方法进行了比较,而我们的模型仅使用单目第一人称RGB输入。如图所示,跨越多个时间步(第05、30和55帧),涵盖了多种室内日常活动,ReViV重建的人类运动更忠实于输入帧中的视觉证据。例如,在第一个序列中,我们的方法准确地捕捉了向右转并在桌子前停止的动作,而在第二个序列中,它正确地重建了向左转并伸手拿取物品的动作。 值得注意的是,与UniEgoMotion [4] 相比,ReViV 对该未见数据集表现出显著更强的泛化能力,我们将其归因于我们的大规模多模态预训练。相比之下,EgoAllo [5] 等基线方法通常表现出与输入第一人称视频语义的结构偏差。这一局限性很大程度上是因为EgoAllo依赖于受限的视觉信号,主要利用现成的先验知识进行局部手部引导,而不是对整体场景上下文进行建模。相反,ReViV 直接从原始第一人称视频中利用全图像语义,并隐式地学习身体运动与视觉观测的联合分布,从而实现了具有强语义对齐的第一人称身体运动重建的最先进精度。

F 其他消融实验

F.1 第一人称手部运动重建消融

表2将主论文中的身体消融实验扩展到了四个基准测试上的第一人称手部运动重建:HoloAssist、HOT3D、ARCTIC 和 TACO。 手部重建结果反映了主论文中身体消融的趋势。特定任务的手部专家模型(ReViV-HandSpec.)在所有四个基准测试中均表现严重不佳,这凸显了联合学习相对于孤立单模态训练的重要性。仅限制在手部标注数据上进行训练(ReViV-HandData)会导致轻微的性能下降,这证实了即使没有手部标注的大规模数据集,通过联合分布学习仍能提供有用的跨模态先验。两种掩码消融实验(ReViV-1to1Mask、ReViV-Uniform)以及轻量级变体(ReViV-Tiny)在所有数据集上均持续低于 ReViV 的性能,这进一步证实了主论文中的发现。

第 26 页

26 X. Lyu 等

UniEgoMotion EgoAllo [5] 搭配 [4] 搭配 VIPE 输入 真值 ours VIPE 相机 相机

05 帧

30 帧

55 帧

EgoAllo [5] 搭配 UniEgoMotion 输入 真值 ours 真值相机 [4] 搭配 真值相机

05 帧

30 帧

55 帧

图 4: 第一人称身体运动重建的定性可视化。 ReViV 仅使用单目第一人称视频输入,即可实现最先进的重建精度和语义对齐。与最近的基线方法不同,当最先进的相机位姿估计(VIPE)失败时,这些基线方法会产生不真实的第一人称身体运动(上图),而我们的方法隐式地学习联合分布,不依赖于显式的相机跟踪。这使得我们的模型能够生成高保真度的运动,即使在与基线方法相比处于拥有真值相机轨迹优势的情况下(下图),其表现也优于最近的基线方法。

第 27 页

ReViV:从第一人称视频中重建4D视角与视图 27

表 2:多个基准上的手部重建消融实验。GA/RA/PA 分别表示全局/相对/Procrustes 对齐的 MPJPE(毫米);越低越好。

HoloAssist HOT3D

Methods GA ↓ RA ↓ PA ↓ GA ↓ RA ↓ PA ↓

ReViV 23.5 29.7 10.5 38.2 48.1 13.6 ReViV-HandData 26.4 28.6 10.5 39.1 48.3 14.4 ReViV-HandSpec. 38.7 48.7 15.7 82.0 73.9 21.7 ReViV-1to1Mask 34.9 43.9 13.7 60.9 58.6 16.1 ReViV-Uniform 37.7 41.2 13.2 70.1 65.0 17.8 ReViV-Tiny 33.8 42.1 14.0 54.2 59.9 16.9

ARCTIC TACO

ReViV 35.1 33.0 13.7 20.3 25.2 9.4 ReViV-HandData 42.2 39.2 15.5 32.8 36.9 13.0 ReViV-HandSpec. 75.8 77.2 22.6 53.2 52.1 17.9 ReViV-1to1Mask 55.0 49.0 16.4 34.9 39.7 13.1 ReViV-Uniform 67.0 60.5 19.5 42.8 48.3 15.3 ReViV-Tiny 50.8 45.6 15.8 30.0 35.8 12.1

F.2 视觉 Transformer 编码分支

对高频视觉输入进行量化会破坏准确感知和重建所需的细粒度像素细节。我们的完整模型通过连续视觉 Transformer 分支(xViT)处理原始 RGB 上下文,从而绕过离散标记化的瓶颈。表 3 评估了移除该分支(w/o xViT)对所有预测模态的影响。

表 3:ViT 编码分支的消融实验。移除连续的 xViT 分支会导致所有模态性能一致下降,证实了其在保留离散标记无法捕捉的高频空间上下文方面的作用。

Camera Gaze Depth Hand (TACO)

Variant ATE ↓ RTE ↓ RRE ↓ MSE ↓ Abs Rel ↓ δ1.25 ↑ GA ↓ RA ↓ PA ↓

w/o xViT 0.018 0.009 1.258 0.0233 0.296 51.7 22.0 27.0 9.6 Full Model 0.015 0.009 1.279 0.0211 0.265 56.5 20.3 25.2 9.4

– 深度:未量化的 RGB 上下文对于解析细粒度 3D 几何结构至关重要,显著提高了绝对相对误差(Absolute Relative Error)和内点准确率(δ1.25)。 – 注视动态:视觉目标的精确定位依赖于细微的像素纹理。通过连续 ViT 保留这些细节可显著降低注视 MSE。 – 相机轨迹:高保真视觉特征提高了全局自我中心运动的一致性,从而降低了绝对轨迹误差(ATE)。 – 手部重建:移除连续 ViT 会导致 TACO 基准上的所有三项指标性能下降,证实了未量化视觉特征对于细粒度 3D 手部姿态恢复的必要性。

第 28 页

28 X. Lyu 等

总体而言,连续的 xViT 流成功绕过了量化瓶颈,保留了跨所有模态所需的关键高频空间上下文。

F.3 VQ-VAE 消融实验

我们以身体模块为例,展示 VQ-VAE 的选择。增加代码本大小(512、1024、2048)逐步降低了重建误差(11.06、8.67、8.26 毫米),而扩展到 4096 由于代码本利用率低导致精度下降(9.02 毫米)。对于时空卷积,我们的 [2, 3] 配置(8.26 毫米)优于更激进的时空([2, 7],15.47 毫米)或时间([4, 3],13.05 毫米)压缩,在重建保真度和泛化能力之间实现了最佳平衡。

补充参考文献

1. Huang, J., Zhou, Q., Rabeti, H., Korovko, A., Ling, H., Ren, X., Shen, T., Gao, J., Slepichev, D., Lin, C.H., Ren, J., Xie, K., Biswas, J., Leal-Taixe, L., Fidler, S.: Vipe: Video pose engine for 3d geometric perception. In: NVIDIA Research Whitepapers arXiv:2508.10934 (2025) 2. Li, G., Chen, Y., Wu, Y., Zhao, K., Pollefeys, M., Tang, S.: Egom2p: Egocentric multimodal multitask pretraining. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 10830–10843 (October 2025) 3. Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: International Conference on Learning Representations (2019) 4. Patel, C., Nakamura, H., Kyuragi, Y., Kozuka, K., Niebles, J.C., Adeli, E.: Uniego- motion: A unified model for egocentric motion reconstruction, forecasting, and gen- eration. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 10318–10329 (2025) 5. Yi, B., Ye, V., Zheng, M., Li, Y., Müller, L., Pavlakos, G., Ma, Y., Malik, J., Kanazawa, A.: Estimating body and hand motion in an ego-sensed world. In: Pro- ceedings of the Computer Vision and Pattern Recognition Conference. pp. 7072– 7084 (2025) 6. Yu, J., Li, X., Koh, J.Y., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y., Baldridge, J., Wu, Y.: Vector-quantized image modeling with improved VQGAN. In: Interna- tional Conference on Learning Representations (2022) 7. Yuan, C., Chen, G., Yi, L., Gao, Y.: Self-supervised monocular 4d scene recon- struction for egocentric videos. arXiv preprint arXiv:2411.09145 (2024)

发表评论