IGGT4D:流式4D实例化几何Transformer,解决在线场景理解中的身份一致性与显存瓶颈
本文提出IGGT4D,针对现有流式3D重建缺乏物体身份时间一致性的问题,构建了一种因果时空建模框架。通过Tri-DPT头联合解码几何与实例特征,并结合流式聚类算法,实现了常数时间复杂度的4D实例分割。在ScanNet++和HOI4D等数据集上,该方法在相机位姿估计、3D重建和实例跟踪任务上均优于Stream3R和CUT3R等基线。同时,论文构建了InsScene4D-147K大规模数据集。需注意,模型在因果约束下位姿精度略低于全注意力离线模型,且长序列推理需避免显存溢出。