ReViV:从单目第一人称视频重建4D视角与场景
本文介绍ReViV框架,旨在解决第一人称视觉中人体运动与场景几何重建分离、依赖辅助输入及推理慢的问题。方法通过模态特定VQ-VAE将连续信号离散化为统一token序列,利用Masked Generative Egocentric Transformer (MGET) 学习多模态联合分布,并在推理时基于RGB条件迭代解码。实验显示,在ADT、HoloAssist等基准上,ReViV在身体、手部、视线、相机跟踪和深度估计上达到SOTA性能,且推理速度显著提升。需注意,离散化可能丢失高频细节,且部分基线使用了GT相机轨迹,比较时需考虑此差异。