IGGT4D:流式4D实例化几何Transformer,解决在线场景理解中的身份一致性与显存瓶颈

方法概览:因果流式架构

本文提出IGGT4D,针对现有流式3D重建缺乏物体身份时间一致性的问题,构建了一种因果时空建模框架。通过Tri-DPT头联合解码几何与实例特征,并结合流式聚类算法,实现了常数时间复杂度的4D实例分割。在ScanNet++和HOI4D等数据集上,该方法在相机位姿估计、3D重建和实例跟踪任务上均优于Stream3R和CUT3R等基线。同时,论文构建了InsScene4D-147K大规模数据集。需注意,模型在因果约束下位姿精度略低于全注意力离线模型,且长序列推理需避免显存溢出。

ReViV:从单目第一人称视频重建4D视角与场景

ReViV统一框架概述

本文介绍ReViV框架,旨在解决第一人称视觉中人体运动与场景几何重建分离、依赖辅助输入及推理慢的问题。方法通过模态特定VQ-VAE将连续信号离散化为统一token序列,利用Masked Generative Egocentric Transformer (MGET) 学习多模态联合分布,并在推理时基于RGB条件迭代解码。实验显示,在ADT、HoloAssist等基准上,ReViV在身体、手部、视线、相机跟踪和深度估计上达到SOTA性能,且推理速度显著提升。需注意,离散化可能丢失高频细节,且部分基线使用了GT相机轨迹,比较时需考虑此差异。

HandFlow:基于流匹配的完全生成式4D手部重建

方法概览:完全生成式流匹配

本文介绍HandFlow,一种用于单目4D手部重建的完全生成式框架。针对现有确定性回归方法在遮挡和模糊下易产生抖动和姿态错误的问题,HandFlow利用流匹配(Flow Matching)在MANO参数空间进行条件生成。核心创新包括双流Transformer架构和置信度感知连续掩码(cmask),有效处理视觉歧义。实验显示,该方法在DexYCB和HOT3D数据集上达到SOTA精度,且推理速度显著优于基线。需注意,模型性能依赖前端检测器质量,且VRAM占用较高。