三分钟导读:本文提出IGGT4D,一种用于在线4D场景理解的流式实例化几何Transformer,通过因果时空建模和流式聚类实现相机位姿、3D几何与实例特征的统一增量预测,并构建了InsScene4D-147K数据集以解决大规模4D监督缺失问题。
英文题目:IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer
论文出处:arXiv 每日论文精选 · arXiv:2607.19228
原始论文:PDF / 论文页面
对应视频标题:IGGT4D:流式4D实例化几何Transformer,解决在线场景理解中的身份一致性与显存瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
现有流式3D重建方法主要关注几何一致性,缺乏对动态场景中物体身份的时间一致性理解;同时,缺乏大规模、具有度量几何和一致实例标签的4D监督数据。
核心创新
- 将在线4D场景理解形式化为因果流式几何-实例预测问题。
- 提出Tri-DPT头,通过几何感知注意力实现几何与实例特征的紧密耦合。
- 设计高效的流式聚类策略,实现O(1)内存复杂度的4D一致实例分割。
- 构建InsScene4D-147K大规模数据集,包含147K视频序列及自动化几何引导的实例标注。
方法概览
1. 架构:基于DA3改进的因果空间Transformer,使用交叉视图KV缓存复用历史上下文,避免冗余计算。2. 解码器:Tri-DPT头联合解码深度、射线图和实例特征,通过几何感知注意力(Geo-Attn)将几何先验注入实例分支。3. 聚类:提出流式聚类算法,维护轻量级全局实例码本,通过余弦相似度匹配和面积加权融合实现常数时间的实例ID继承与更新。4. 训练:引入第一帧几何归一化(FF-Norm)解决流式重建中的尺度歧义问题。
逐图理解论文
方法概览:因果流式架构

IGGT4D将在线4D场景理解形式化为因果流式几何-实例预测问题。其架构基于DA3改进,采用因果空间Transformer,通过交叉视图KV缓存复用历史上下文,避免冗余计算。给定动态视频序列,模型增量提取时空一致表示,并通过Tri-DPT头联合解码深度、射线图和实例特征,最终由流式聚类算法生成实例掩码。
核心创新:Tri-DPT头与几何感知注意力

传统方法中几何与实例特征往往解耦。IGGT4D提出Tri-DPT头,引入几何感知注意力(Geo-Attn),将深度和射线先验注入实例分支。这种紧密耦合机制使实例特征具备3D一致性,有效区分重叠或相似外观的物体。此外,第一帧几何归一化(FF-Norm)解决了流式重建中的尺度歧义问题,确保增量预测的稳定性。
高效聚类:O(1)内存的实例ID管理

为实现常数时间复杂度的4D一致实例分割,IGGT4D设计了流式聚类算法。该算法维护一个轻量级全局实例码本,通过余弦相似度匹配和面积加权融合,实现实例ID的继承与更新。相比HDBSCAN,流式聚类在100帧时显存仅约0.7 GB,而HDBSCAN在长序列下易发生显存溢出,无法进行公平对比。
数据基石:InsScene4D-147K数据集

针对4D监督缺失,论文构建了InsScene4D-147K数据集,包含147K视频序列及自动化几何引导的实例标注。数据涵盖真实与合成、静态与动态场景,通过3D重建、投影ID继承和分割全局ID refinement流程生成。该数据集显著改善了传统标注中的过分割、身份切换和背景泄漏问题,为大规模4D训练提供了坚实基础。
实验结果:相机位姿与3D重建

在HiRoom、ETH3D、7Scenes和ScanNet++上评估几何性能。在ScanNet++上,IGGT4D的3D重建F1-score(含GT位姿)达到0.7236,优于所有流式基线。相机位姿估计AUC@3达到0.5467,显著高于Stream3R的0.2041和LingBot-Map的0.4419。Chamfer Distance(CD w/ p.)为0.0740,优于Stream3R和LingBot-Map,证明了几何建模的有效性。
实验与关键结果
- 相机位姿估计与3D重建:在HiRoom, ETH3D, 7Scenes, ScanNet++上评估AUC和F1-score。
- 实例空间跟踪:在HOI4D, Waymo, ScanNet++, PointOdyssey上评估长/短序列的T-mIoU和T-SR。
- 开放词汇语义分割:在Waymo和ScanNet++上评估mIoU和mAcc。
- 消融实验:验证Geo-Attn和FF-Norm的有效性。
- 聚类效率对比:对比流式聚类与HDBSCAN的时间和显存开销。
- 4D QA场景定位:结合LMM验证4D一致实例特征对空间推理的提升。
- 在ScanNet++上,3D重建F1-score (w/ p.)达到0.7236,优于所有流式基线。(第 7 页)
- 在ScanNet++上,相机位姿估计AUC@3达到0.5467,优于Stream3R (0.2041)和LingBot-Map (0.4419)。(第 7 页)
- 在HOI4D长序列跟踪中,T-mIoU达到78.44,T-SR达到95.60,显著优于SAM2和SpaTrackerV2+SAM。(第 8 页)
- 在Waymo开放词汇分割中,mIoU达到41.63,mAcc达到78.07,优于IGGT (OOM)和Feature-3DGS。(第 9 页)
- 流式聚类显存保持~0.7 GB,而HDBSCAN在100帧时OOM。(第 9 页)
- 在ScanNet++上,3D重建Chamfer Distance (CD w/ p.)为0.0740,优于Stream3R (0.1217)和LingBot-Map (0.0860)。(第 17 页)
阅读时需要注意
- InsScene4D-147K的数据覆盖范围仍需扩大以增强鲁棒性和泛化能力。
- 模型主要依赖监督学习,未来需探索自监督学习。
- 评估主要集中在感知层面,尚未整合具身交互反馈。
- IGGT基线模型在处理长序列时会出现显存溢出(OOM),无法进行公平的长度对比。
- 流式模型在因果约束下,位姿估计精度略低于全注意力离线模型(如DA3),但差距显著缩小。
关联工作
- DA3:基础架构来源,IGGT4D基于DA3的几何Transformer进行因果流式改造。(第 4 页)
- IGGT:前置工作,提供实例感知几何预测,但为离线全注意力模型,存在OOM问题。(第 3 页)
- Stream3R:流式3D重建基线,仅关注几何,缺乏实例一致性。(第 3 页)
- CUT3R:流式3D重建基线,性能低于IGGT4D。(第 7 页)
- SAM2:2D分割基线,用于实例跟踪对比。(第 8 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
IGGT4D:流式4D实例化几何Transformer
邹正宇1,†,李浩2,焦奎轩1,†,刘柳1,‡,肖廷阳1, 周晓琳1,洪方洲2,苏志忠1,张定文3,B,刘子维2 1 地平线机器人 2 南洋理工大学 S-Lab 3 合肥综合性国家科学中心人工智能研究院
2026
流式4D重建 4D一致性实例特征Jul 21 InsScene4D-147K 数据集 各种下游应用 “Building” “Car” 手-物交互 分割.
RoboTwin HOI4D RE10K 全局ID图 手 (红色) 物体 (绿色)[cs.CV] 实例空间 开放词汇 场景 跟踪 分割 定位 147K 场景 60M 掩码
图 1:IGGT4D 的在线几何-实例预测。IGGT4D 逐帧处理动态视频流,以增量方式构建统一的 4D 表示,该表示共同捕获相机运动、3D 几何以及时间一致的实例特征。此表示支持多种下游应用。我们还构建了 InsScene4D-147K,这是一个带有几何引导实例掩码的大规模数据集,以支持训练和评估。
摘要
现实世界的空间智能要求Agent 能够从连续的视频流中理解场景,其中物体随时间移动、持久存在、消失并重新出现。虽然最近的空间基础模型实现了可泛化的前馈 3D 重建,但大多数流式方法仍以几何为中心,缺乏时间一致的对象级理解。与此同时,现有的语义重建和 3D 感知视觉-语言方法主要依赖外部提取的 2D 语义线索或松散耦合的几何输入,限制了长动态场景中统一的几何-实例学习。在本文中,我们提出了 IGGT4D,这是一种用于在线 4D 场景理解的流式实例化几何 Transformer。IGGT4D 按顺序处理视频帧,通过因果时空建模重用历史上下文,并增量更新相机运动、几何和对象身份的统一表示。这实现了长序列前馈重建,并在几何与实例之间保持一致性。
预印本。
† 地平线机器人实习生 ‡ 项目负责人 B 通讯作者
第 2 页
动态环境。为了解决高质量4D监督数据缺乏的问题,我们进一步构建了InsScene4D-147K,这是一个涵盖真实/合成场景以及静态/动态场景的大规模数据集,包含由自动化几何引导标注流水线生成的RGB图像、深度图、位姿以及时间一致的实例掩码。在3D重建、位姿估计、实例空间跟踪和开放词汇分割上的实验表明,IGGT4D优于现有的流式基线方法,同时能够针对长动态序列保持可扩展的在线推理能力。
1 引言
现实世界的空间智能本质上是在线且动态的。具身Agent 接收连续的视频流,其中物体移动、被遮挡、离开视野,并在随后重新出现。在这样的环境中行动,不仅需要估计相机运动和场景几何结构,还需要维持时间一致的物体身份。因此,我们将4D场景理解表述为流式几何-实例预测,其中场景几何和物体身份从长动态视频流中联合更新。
空间重建和场景理解正经历从基于优化的流水线向数据驱动的直通式预测的转变。传统的几何流水线,从离体的SfM [1, 2] 到在线和神经SLAM [3–7],都依赖于每场景的迭代优化。同样,语义重建系统,从离体的场景图 [8] 到在线语义映射 [9],通常通过单独的模块构建几何和物体级别的线索。这些系统是有效的,但它们的场景特定优化限制了长序列的效率,而其模块化设计使得在动态场景中进行时间一致的实例推理变得困难。
最近的空间基础模型 [10–13] 通过学习可从图像直接进行3D预测的可泛化先验来解决这些局限性。对于在线长序列感知,这一范式正进一步从全局固定集推理转向流式重建 [14–16]。然而,仅靠流式3D预测对于具身Agent 来说是不够的。当前的流式模型仍然主要关注几何:它们估计深度、位姿和点图,但不维持时间一致的物体身份。缺失的能力是一种直通式流式模型,它将物体身份作为与几何并列的一等预测目标。
为什么流式几何-实例理解仍未得到充分探索?一个关键原因是缺乏合适的监督。2D视觉-语言模型 [17–20] 提供了可扩展的开放词汇线索,但它们的预测是视图相关的,且缺乏度量3D基础。语义重建方法 [21–25] 通过将2D语义提升为3D来改善空间一致性,但其语义保真度仍受限于外部2D预测器的能力。3D感知的视觉-语言模型 [26–29] 结合了用于空间推理的几何结构,但未提供用于训练流式模型的密集、时间一致的几何-实例监督。缺失的是大规模的4D监督,它以统一的形式提供度量几何、相机运动和时间一致的实例标签。
为了解决这些差距,我们提出了IGGT4D,这是一种用于在线4D场景理解的流式实例引导几何Transformer。IGGT4D将几何-实例重建从全序列离线问题转变为因果流式预测问题。它按顺序处理帧,通过因果时空建模重用历史上下文,并在统一表示中增量更新相机运动、场景几何和实例嵌入。通过将实例关联建立在重建的几何结构上,IGGT4D在视角变化、遮挡和重新出现的情况下维持物体身份。
我们进一步构建了InsScene4D-147K,这是一个用于4D场景中几何-实例学习的大规模数据集。它涵盖真实/合成和静态/动态来源,提供RGB图像、深度图、相机位姿、点云以及序列级一致的实例掩码。为了降低标注成本,我们设计了一种自动化的几何引导标注流水线,以大规模生成多视图一致的几何和实例标签。我们的贡献有三方面:
• 流式几何-实例预测。我们将在线4D场景理解表述为从连续视频流中对相机运动、场景几何和持久物体身份进行因果预测。
2
第 3 页
• 对象一致的流式重建。我们提出 IGGT4D,这是一种前馈流式 Transformer,它将因果几何建模与基于几何的实例预测及在线聚类相结合,在不进行全序列推理的情况下保持对象身份的一致性。 • 可扩展的 4D 实例监督。我们构建了 InsScene4D-147K,这是一个大规模真实/合成且静态/动态的数据集,其几何一致的实例标注由可扩展的重建、投影和掩码细化流水线生成。
2 相关工作
流式空间基础模型 前馈空间基础模型学习可泛化的 3D 先验,用于直接从图像进行重建 [10–13, 30–32]。DUSt3R [30] 将密集 3D 预测公式化为点图回归 [30, 31],而 VGGT 风格模型则将这一范式扩展至大规模和模态增强的视觉几何估计 [10, 32]。然而,这些模型是为固定图像集设计的;将其应用于不断增长的视频流需要重新处理整个历史序列或使用滑动窗口,这会导致冗余计算并削弱长程一致性。最近的流式变体,包括 Spann3R [14]、MUSt3R [33]、CUT3R [15] 和 Stream3R [16],通过维护在线场景状态而非重新运行全局推理来解决这一效率瓶颈。虽然这减少了增量重建的开销,但维护的状态仍主要针对几何一致性进行优化,而非对象持久性。因此,它缺乏显式的对象身份、实例掩码和跨帧关联——这些元素对于长时长动态视频中的 4D 场景理解是不可或缺的。
实例感知的 3D 场景理解 对象级场景理解也已从 2D 开放词汇感知和逐场景语义提升发展到统一的 3D 预测。LangSplat [34] 和 LangSurf [35] 将语言特征附加到优化的 3D 表示中以进行开放词汇查询,而语言驱动的分割模型如 LSeg [18] 直接从图像预测语义区域。这些方法提高了语义可访问性,但它们通常依赖外部 2D 线索、逐场景优化或视图无关预测,使得难以随时间保持连贯的 3D 对象身份。更新的前馈场景理解模型旨在将重建与语义或实例耦合:LSM [36] 从未位姿图像预测语义辐射场,Uni3R [24] 从任意多视图输入预测语义 3D 高斯,而 IGGT [37] 引入了具有 3D 一致性特征聚类的实例感知几何预测。这些模型更接近联合几何-实例学习,但它们仍然是围绕固定图像集和全局跨视图注意力构建的。对于长视频流,每次更新都必须关注或重新计算历史帧,这使得在线推理成本高昂并阻碍了因果实例更新。IGGT4D 瞄准了这两条路线的交汇点:它保留了因果空间基础模型的流式效率,同时联合预测几何和时序一致的实例特征,以用于在线 4D 场景理解。
3 方法
我们提出 IGGT4D,一种流式实例接地几何 Transformer。第 3.1 节形式化了顺序前馈预测。第 3.2 节介绍了流式架构,第 3.3 节展示了高效的流式聚类策略。第 3.4 节描述了下游 4D 场景理解应用,随后是第 3.5 节中的训练目标。
3.1 问题表述与符号
给定 RGB 图像序列 $\{I_t\}_{t=1}^N$,其中每张图像 $I_t \in \mathbb{R}^{H \times W \times 3}$ 以及可选相机参数 $\{\tilde{\pi}_t\}_{t=1}^N$ 且 $\tilde{\pi}_t \in \mathbb{R}^9$,IGGT4D(记为 $F_\theta$)执行前馈顺序推理以进行流式 4D 几何和实例重建:
$$ F_\theta : (I_t, \tilde{\pi}_t) \mapsto (\pi_t, R_t, D_t, S_t), \quad t = 1, \dots, N. \quad (1) $$
对于每一帧,IGGT4D 输出相机参数 $\pi_t = [t_t, q_t, f_t] \in \mathbb{R}^9$、射线图 $R_t = [O_t, V_t] \in \mathbb{R}^{H_r \times W_r \times 6}$、深度图 $D_t \in \mathbb{R}^{H \times W}$ 以及实例特征图 $S_t \in \mathbb{R}^{H \times W \times 8}$。其中,$t_t \in \mathbb{R}^3$、$q_t \in \mathbb{R}^4$、$f_t \in \mathbb{R}^2$ 分别表示平移、旋转和视场,而 $O_t \in \mathbb{R}^{H_r \times W_r \times 3}$、$V_t \in \mathbb{R}^{H_r \times W_r \times 3}$ 表示射线原点和方向。由于图像是
第 4 页
流式输入 流式推理 流式聚类 流式重建 深度 (第 N 帧) 实例码本 第 1 帧 注意力 注意力 实例 头 嵌入 聚类 & 射线 实例关联 几何 第 N 帧 视图内 视图间 Tri-DPT 图块 第 2 帧
视图间缓存 掩码 第 N 帧 相机缓存 加载 更新实例码本 相机位姿(可选) 更新 实例 否则为可学习 token
图 2:IGGT4D 概述。给定动态视频序列和可选的相机位姿, IGGT4D 提取时空一致表示。Tri-DPT 头增量式 预测几何和实例特征,流式聚类算法推导实例掩码 用于在线 4D 场景理解。
依次流式输入,逐帧预测被整合到时空一致的 场景表示中,从而实现在线 4D 重建和理解。
3.2 流式实例感知几何 Transformer
因果几何-实例 Transformer。我们将 DA3 [13] 的统一几何 Transformer 从固定集合 3D 预测适应于因果流式 4D 理解。每张图像被编码为 图像 token,并与相机 token 拼接,相机 token 在相机参数可用时 从 $E_{cam}$ 获取,否则从共享的可学习 token 获取。生成的帧级 token 由 40 个 Transformer 块处理,这些块具有交错的视图内和视图间注意力,产生多尺度 特征 $\{F^{(l)}_t\}_{l=1}^4$。与 DA3 的双向固定视角推理不同,IGGT4D 对跨相机和 跨视图注意力施加因果掩码,因此每帧仅关注当前和过去的观测。 相同的约束也用于训练期间以模拟流式推理。在推理时,帧 按顺序处理,相机和视图间 KV 缓存复用历史上下文而无需 冗余重新计算。生成的表示支持可扩展的长序列几何 和实例预测。
Tri-DPT 几何-实例头。我们设计了一个 Tri-DPT 头,用于联合解码深度 $D_t$、射线 图 $R_t$ 和实例特征图 $S_t$,输入来自流式多尺度 token $\{F^{(l)}_t\}_{l=1}^4$。所有分支 逐步恢复空间分辨率,而实例分支通过几何感知注意力与几何分支耦合。通过使用深度和射线特征作为结构先验,该头 将实例嵌入锚定在 3D 几何中,并提高跨时间的物体身份一致性。
3.3 高效流式实例聚类
离线聚类,如 IGGT [37] 中使用的 HDBSCAN [38],在长序列上会产生高昂的二次复杂度。 为了实现在线推理,我们引入了一种两阶段流式聚类 策略,该策略维护一个轻量级的全局实例码本 $C_t = \{(c_k, a_k)\}_{k=1}^{K_t}$,其中 $c_k$ 是 实例 $k$ 的特征中心,$a_k$ 是其累积像素计数。
首先,帧内聚类提取局部掩码 $M_{t,i}$ 和中心 $c_{t,i}$。对于未分配的像素 $p$, 我们将具有高余弦相似度的像素($\alpha_q = s_p^\top s_q \ge \tau_s$)分组为核心区域,然后通过较宽松阈值($\tau_l$)上的连通分量扩展它,形成 $M_{t,i}$。接下来,我们将这些局部 中心与全局码本进行匹配。未匹配的实例成为新的全局条目,而未匹配的背景区域作为不同的静态实体被自然忽略,隐式地解耦了动态前景和静态背景。对于匹配项,$M_{t,i}$ 继承全局 ID $k$ 作为 4D 一致掩码 $M_{t,k}$,其中心通过面积加权融合更新:
$$ c_k \leftarrow \text{norm} \left( \frac{a_k c_k + |M_{t,k}| c_{t,i}}{a_k + |M_{t,k}|} \right), \quad a_k \leftarrow a_k + |M_{t,k}|. \quad (2) $$
这种常数时间的中心更新将 4D 一致的实例特征转化为高质量的跟踪掩码(图 3),提供了一种轻量级机制,用于在物体运动和局部遮挡下保持实例一致性,而无需显式的运动建模。
4
第 5 页
RGB 图像 实例 PCA 实例掩码 RGB 图像 实例 PCA 实例掩码 RGB 图像 实例 PCA 实例掩码
图 3:实例特征与掩码可视化。我们可视化了 3D 一致的实例特征 PCA 结果,以及由我们的流式聚类生成的相应实例掩码。
3.4 4D 场景理解
4D 一致的掩码 $M_{t,k}$ 和时序关联的实例特征 $c_k$ 为下游场景理解任务提供了可复用的对象级表示。首先,跨帧的持久实例对应关系使得无需额外的关联启发式方法即可实现稳定的空间跟踪。其次,通过使用 $M_{t,k}$ 聚合每帧的 2D 视觉-语言特征 [17, 19],我们获得了空间和时间上一致的语义特征 $f_{t,k}^{\text{lang}}$,用于开放词汇语义分割。最后,这些 4D 一致的掩码和特征可以提供给大型多模态模型 (LMM) [39, 40],以支持 4D 场景定位,包括动态对象分割和视外对象推理等任务。更多的实现细节和定性结果见补充材料。
3.5 训练目标
第一帧几何归一化。在流式重建中,像离线设置那样从整个序列估计尺度可能会引入尺度歧义。为了避免这种歧义并促进时空一致性,我们在训练期间应用基于第一帧的几何归一化:所有位姿都对齐到第一帧相机坐标系,并使用第一帧点云 $P_1$ 计算序列级尺度 $s = \frac{1}{|P_1|} \sum_{p \in P_1} \|p\|_2$,然后将其应用于序列中的所有几何真值。
几何目标。我们使用深度、射线、点和相机损失对几何进行监督:$L_{\text{geo}} = L_D + L_R + L_P + L_\pi$。深度损失 $L_D$ 结合了 $L_1$ 回归、置信度 $C_t$ 正则化以及在有效像素 $V$ 上的空间梯度 $L_{\text{grad}}$ 一致性:
$$ L_D = \frac{1}{|V|} \sum_{p \in V} |D_t(p) – D^*_t(p)|_1 + \lambda_{\text{conf}} C_t(p) – \lambda_{\text{conf}} \alpha \log C_t(p) + \lambda_{\text{grad}} L_{\text{grad}}, \quad (3) $$
其中 $L_{\text{grad}} = \|\nabla D_t – \nabla D^*_t\|_1$ 是空间邻域上的 $L_1$ 梯度损失,$V$ 是有效像素集合,$\alpha$ 是缩放因子。对于射线图 $R_t = [O_t, V_t]$,我们对原点和方向应用 $L_1$ 损失:$L_R = \|O_t – O^*_t\|_1 + \|V_t – V^*_t\|_1$。我们进一步通过重建 3D 点 $P_t = O_t + D_t V_t$ 并最小化 $L_P = \|P_t – P^*_t\|_1$ 来耦合深度和射线。相机损失为 $L_\pi = \|\pi_t – \pi^*_t\|_1$。
实例目标。我们使用多视图对比损失优化 $L_2$ 归一化的实例特征。对于每个标注掩码,我们将其原型 $\mu$ 定义为平均像素特征。该目标强制执行视图内 ($u = v$) 约束,将像素 $f_p$ 聚集到其实例中心 $\mu_{vk}$ 并排斥不同的中心。它还应用视图间 ($u \neq v$) 约束,以拉近跨帧的匹配中心并推开不同的中心:
$$ \begin{aligned} L_{\text{ins}} = & \sum_{v} \lambda_{\text{inpull}} \sum_{p \in M_{kv}} [\|\mathbf{f}_p – \mu_{vk}\|_2 – \delta_{\text{inpull}}]_+ + \lambda_{\text{inpush}} \sum_{k \neq j} [\delta_{\text{inpush}} – \|\mu_{vk} – \mu_{vj}\|_2]_+ \\ & + \sum_{u \neq v} \lambda_{\text{crpull}} \sum_{k} [\|\mu_{uk} – \mu_{vk}\|_2 – \delta_{\text{crpull}}]_+ + \lambda_{\text{crpush}} \sum_{k \neq j} [\delta_{\text{crpush}} – \|\mu_{uk} – \mu_{vj}\|_2]_+ \quad , \end{aligned} \quad (4) $$
其中 $[\cdot]_+ = \max(0, \cdot)$,$\delta$ 是各自的边界。最终目标为 $L = L_{\text{geo}} + \lambda_{\text{ins}} L_{\text{ins}}$。
5
第 6 页
步骤 1. 几何重建 步骤 2. 投影与继承 数据集统计
静态 场景 动态 场景 2A. 网格投影与可见性 2B. 继承图构建 (Re10K) (HOI4D)
3D 网格 帧 t 投影 2D 点 全局 ID ID-可见投影
深度图 深度一致性检查 可见 2D 点 2D 边界框 凸包
2个数据集·10.2K静态·真实 4个数据集·120.0K静态·合成 动态·合成5个数据集·10.2K 动态·真实3个数据集·6.41K
步骤 3. 分割与后处理 输出数据
3A. 分割 3B. 后处理 静态场景 动态场景 (Re10K) (HOI4D) 自动分割 动态区域更新(仅限 HOI4D) 空间 静态场景 基础 模型 深度图 (Re10K)
帧 t 自动分割 真实标注 更新后的标注
TSDF 重建 Re10K 提示分割 全局更新 掩码匹配 与融合
HOI4D 动态 掩码 过滤 2D 边界框 提示分割 分割最终 点全局云ID 静态 3D 网格 (HOI4D 仅)
图 4: InsScene4D-147K 数据策展流程。真实/合成和静态/动态源通过 3D 重建、基于投影的 ID 继承和基于分割的全局 ID 细化进行处理。右侧面板总结了数据集划分。
4 InsScene4D-147K 数据集
我们构建了 InsScene4D-147K,这是一个用于在线 4D 场景理解的大规模数据集,包含 147K 个策展视频序列。该数据集涵盖四个领域:静态-真实、静态-合成、动态-真实和动态-合成。具体而言,静态-真实划分包括 RealEstate10K [41] 和 ScanNet++ [42];静态-合成划分包括 Aria Synthetic Environments [43]、SceneNet [44]、Infinigen [45] 和 Hypersim [46];动态-真实划分包括 HOI4D [47]、Waymo [48] 和 Aria Digital Twin [43];动态-合成划分包括 RoboTwin 2.0 [49]、Kubric [50]、Dynamic Replica [51]、PointOdyssey [52] 和 VKITTI2 [53]。每个序列提供 RGB 图像、深度图、相机位姿、点云以及跨帧具有持久对象身份的一致性 4D 实例掩码。图 4 说明了我们的几何引导标注流程,用于大规模生成时间一致的实例监督。
对于静态捕获,我们设计了一个策展流程,将离线几何转换为时间一致的实例监督。我们首先使用 DA3 [13] 估计多视图一致深度,以离线真实相机位姿为条件,以避免长序列位姿漂移。然后通过 TSDF 融合 [54] 重建静态 3D 网格,该过程聚合跨视图的深度预测以减少估计方差并抑制异常值噪声。此过程为后续的实例标注提供了高质量、多视图一致的几何伪标签。
对于每一帧,我们将网格顶点投影到图像平面上,通过深度一致性保留可见顶点,并将其全局 ID 反向映射以形成继承图。SAM2 [55] 提供类别无关掩码,这些掩码经过过滤、去重叠,并通过 IoU 与继承区域匹配。高置信度的匹配继承现有 ID,模糊匹配使用最佳重叠 ID,未匹配的掩码初始化为新实例。为了防止陈旧 ID 的传播,如果某对象的投影面积在 N=5 个连续帧内急剧下降,则将其标记为消失。
对于 HOI4D 等动态场景,我们使用 DA3 估计深度和相机位姿,使用提供的掩码去除动态区域,并从剩余区域重建静态 3D 网格。然后我们应用相同的标注流程,同时使用可用的动态对象标注来覆盖动态区域中的投影伪标签。对于仿真数据,源数据集提供具有实例一致性掩码的 RGB-D 序列,我们将其纳入合成划分中。
5 实验
我们在多项任务上评估我们的方法,并与广泛的最先进基线模型进行对比。所有实验均在配备 32 GB 内存的 NVIDIA RTX 5090 GPU 上进行。
6
第 7 页
表 1:HiRoom、ETH3D、7Scenes 和 ScanNet++ 上的几何基准测试。(a) 相机位姿估计 (AUC@3, AUC@30)。(b) 3D 重建 (F1-score),包括无 (w/o p.) 和有 (w/ p.) 真实相机位姿的情况。方法分为全注意力(离线)和流式(在线)两类。最佳和次佳结果分别以粗体和下划线突出显示。
方法 平均 HiRoom ETH3D 7Scenes ScanNet++
(a) 相机位姿估计 AUC@3↑ AUC@30↑ AUC@3↑ AUC@30↑ AUC@3↑ AUC@30↑ AUC@3↑ AUC@30↑ AUC@3↑ AUC@30↑
全注意力(离线) VGGT 0.4001 0.8725 0.4927 0.8840 0.2895 0.8166 0.2293 0.8465 0.5890 0.9429 MapAnything 0.2436 0.8569 0.3069 0.8806 0.2347 0.8250 0.1683 0.8256 0.2646 0.8966 Pi3X 0.4683 0.9096 0.6662 0.9476 0.3453 0.8749 0.2526 0.8607 0.6090 0.9552 DA3 0.6046 0.9352 0.8465 0.9735 0.4541 0.9184 0.2780 0.8671 0.8397 0.9818
流式(在线) CUT3R 0.1022 0.6977 0.1752 0.7438 0.1187 0.6611 0.0654 0.7177 0.0494 0.6683 StreamVGGT 0.1606 0.7579 0.1686 0.7330 0.1300 0.6866 0.1354 0.8136 0.2085 0.7985 Wint3R 0.1133 0.6937 0.2522 0.7998 0.1219 0.6693 0.0251 0.6929 0.0541 0.6129 Stream3R 0.1871 0.7947 0.2510 0.8183 0.1621 0.7143 0.1313 0.8209 0.2041 0.8252 LingBot-Map 0.3060 0.8647 0.3388 0.8727 0.2796 0.8417 0.1636 0.8257 0.4419 0.9188 本文方法 0.4464 0.8924 0.7223 0.9533 0.2734 0.8242 0.2435 0.8534 0.5467 0.9389
(b) 3D 重建 F1(w/o p.)↑ F1(w/ p.)↑ F1(w/o p.)↑ F1(w/ p.)↑ F1(w/o p.)↑ F1(w/ p.)↑ F1(w/o p.)↑ F1(w/ p.)↑ F1(w/o p.)↑ F1(w/ p.)↑
全注意力(离线) VGGT 0.5775 0.6477 0.5549 0.6676 0.6249 0.7198 0.4640 0.5048 0.6662 0.6985 MapAnything 0.4526 0.6407 0.4726 0.5904 0.5722 0.7596 0.4647 0.5016 0.3007 0.7112 Pi3X 0.6740 0.7756 0.7780 0.8969 0.7014 0.8331 0.4742 0.5740 0.7424 0.7986 DA3 0.7430 0.7980 0.8819 0.9563 0.8098 0.8689 0.5005 0.5653 0.7796 0.8015
流式(在线) CUT3R 0.3644 0.4060 0.2795 0.1993 0.5941 0.6467 0.3221 0.3711 0.2621 0.4071 StreamVGGT 0.2703 0.3377 0.1162 0.2179 0.3730 0.4275 0.3119 0.3567 0.2800 0.3486 Wint3R 0.4260 0.4550 0.4853 0.2969 0.6167 0.7447 0.3090 0.3901 0.2929 0.3885 Stream3R 0.4551 0.5504 0.4359 0.6435 0.5432 0.6400 0.4426 0.4739 0.3986 0.4443 LingBot-Map 0.5228 0.6082 0.4749 0.5973 0.6615 0.7394 0.3794 0.4726 0.5756 0.6236 本文方法 0.6678 0.7225 0.8015 0.8501 0.7186 0.7724 0.4975 0.5441 0.6535 0.7236
5.1 相机位姿估计与 3D 重建评估
遵循 DA3 [13] 的评估协议,我们在 HiRoom、ETH3D [56]、7Scenes [57] 和 ScanNet++ [42] 上进行评估。这些评估序列在场景/序列级别上从训练中排除。我们将方法与离线全注意力模型(VGGT [10]、MapAnything [11]、Pi3X [12]、DA3)和在线流式模型(CUT3R [15]、StreamVGGT [58]、Wint3R [59]、Stream3R [16]、LingBot-Map [60])进行比较。我们采用 DA3 的评估协议,并使用 TSDF 融合 [54] 进行 3D 一致性处理。我们报告用于位姿精度的 AUC@3/AUC@30 和用于 3D 重建质量的 F1-score。
相机位姿估计。如表 1(a) 所示,我们的方法在流式模型中实现了最佳平均性能,表明它可以可靠地从顺序输入中恢复相机运动。虽然像 DA3 这样的全注意力模型仍然受益于对整个序列的双向推理,但我们的方法在因果流式设置下显著缩小了差距,甚至优于几种全注意力基线。
真实值 本文方法 LingBot-Map Stream3R
图 5:在 7Scenes 和 ETH3D 数据集上的 3D 重建定性比较。
3D 重建。表 1(b) 报告了使用预测位姿 (w/o p.) 和真实位姿 (w/ p.) 的 3D 重建 F1 分数。MapAnything、Pi3X、DA3 和我们的方法在推理期间接受真实位姿,而其他方法仅在评估时融合中使用它们。在这两种设置下,我们的方法均优于所有流式基线,显示出在顺序推理下强大的 3D 一致性。使用真实位姿时,它进一步提高了重建质量,表明模型可以有效地利用流式相机输入。图 5 展示了与
第 8 页
表 2:在 HOI4D、Waymo、ScanNet++ 和 PointOdyssey 上的实例空间跟踪性能。在两种设置下进行评估:(a) 长序列和 (b) 短序列。最佳和次佳结果分别以粗体和下划线突出显示。
| 方法 | 平均 | HOI4D | Waymo | ScanNet++ | PointOdyssey | | :— | :— | :— | :— | :— | :— | | | Avg | T-mIoU↑ | T-SR↑ | T-mIoU↑ | T-SR↑ | T-mIoU↑ | T-SR↑ | T-mIoU↑ | T-SR↑ | T-mIoU↑ | T-SR↑ | | (a) 长序列 (∼100 帧, HOI4D: 40 帧) | | | | | | | | | | | | | SpaTrackerV2+SAM | 43.73 | 59.28 | 64.40 | 74.89 | 42.13 | 53.04 | 21.86 | 39.49 | 46.52 | 69.68 | | SAM2 | 45.38 | 58.65 | 65.41 | 78.34 | 47.62 | 56.93 | 12.88 | 23.24 | 55.62 | 76.07 | | IGGT | OOM | OOM | OOM | OOM | OOM | OOM | OOM | OOM | OOM | OOM | | 本文方法 | 58.84 | 85.41 | 78.44 | 95.60 | 59.35 | 88.04 | 33.19 | 61.35 | 64.36 | 96.65 | | (b) 短序列 (∼16 帧) | | | | | | | | | | | | | SpaTrackerV2+SAM | 46.84 | 63.19 | 61.94 | 71.20 | 47.57 | 57.92 | 33.73 | 59.47 | 44.12 | 64.17 | | SAM2 | 51.75 | 66.03 | 65.87 | 78.11 | 60.65 | 71.37 | 21.25 | 35.08 | 59.21 | 79.57 | | IGGT | 51.68 | 84.65 | 63.02 | 87.14 | 49.59 | 88.56 | 32.97 | 68.07 | 61.13 | 94.83 | | 本文方法 | 59.25 | 86.28 | 78.27 | 95.42 | 61.08 | 89.34 | 34.18 | 63.47 | 63.45 | 96.88 |
图 6:实例空间跟踪的定性可视化结果。
LingBot-Map 和 Stream3R 使用 TSDF 融合的点云,并掩蔽掉无效的真实深度区域。
5.2 实例空间跟踪评估
对于实例空间跟踪和开放词汇语义分割,所有评估序列均从与训练数据在场景或序列级别上不相交 held-out 划分中采样。我们在三个动态数据集(HOI4D [47]、Waymo [48] 和 PointOdyssey [52])和一个静态数据集(ScanNet++)上进行了评估。遵循 IGGT [37] 中的协议,我们将方法与 SpaTrackerV2 [61]+SAM [20]、SAM2 [55] 以及 IGGT 本身进行比较,并报告时间平均交并比 (T-mIoU) 和时间成功率 (T-SR)。我们在长序列和短序列设置下评估了这些方法。对于长序列,所有数据集均由 100 帧组成,HOI4D 除外,其使用 40 帧。如表 2 所示,IGGT 在处理长序列时面临内存溢出 (OOM) 问题。相比之下,得益于所提出的流式推理和聚类机制,我们的方法可以扩展到 4D 长序列。我们在图 6 中展示了实例空间跟踪的定性可视化结果。
5.3 开放词汇语义分割评估
我们在 Waymo 和 ScanNet++ 上进行评估。基线包括 2D 视觉语言模型(OpenSeg [19]、LSeg [18])和 3D 语义重建方法(逐场景 Feature-3DGS [25] 和前馈 IGGT [37])。如表 3 所示,我们的方法实现了最高的 mIoU 和 mAcc,证明了在动态户外和复杂静态室内场景的长序列和短序列设置下,具有更强的语义分割性能。图 7 展示了定性可视化结果。
8
第 9 页
表 3:Waymo 和 ScanNet++ 上的开放词汇语义分割评估。在两种设置下进行评估:(a) 长序列和 (b) 短序列。最佳和次佳结果分别以粗体和下划线突出显示。
| Methods | \multicolumn{6}{c}{(a) Long sequences ($\sim$100 frames)} | \multicolumn{6}{c}{(b) Short sequences ($\sim$16 frames)} | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | Avg | | Waymo | | ScanNet++ | | Avg | | Waymo | | ScanNet++ | | | | mIoU$\uparrow$ | mAcc$\uparrow$ | mIoU$\uparrow$ | mAcc$\uparrow$ | mIoU$\uparrow$ | mAcc$\uparrow$ | mIoU$\uparrow$ | mAcc$\uparrow$ | mIoU$\uparrow$ | mAcc$\uparrow$ | mIoU$\uparrow$ | mAcc$\uparrow$ | | OpenSeg | 19.16 | 45.77 | 15.14 | 44.10 | 23.17 | 47.43 | 19.41 | 46.80 | 15.03 | 43.87 | 23.78 | 49.73 | | LSeg | 31.95 | 48.23 | 35.52 | 56.55 | 28.37 | 39.90 | 32.06 | 50.54 | 34.82 | 57.04 | 29.29 | 44.03 | | Feature-3DGS | 31.94 | 48.15 | 35.51 | 56.49 | 28.37 | 39.81 | 26.47 | 44.32 | 34.81 | 56.88 | 17.80 | 32.90 | | IGGT | OOM | OOM | OOM | OOM | OOM | OOM | 31.16 | 61.90 | 29.44 | 62.42 | 32.88 | 61.38 | | Ours | 40.08 | 73.84 | 41.63 | 78.07 | 38.52 | 69.61 | 39.11 | 72.25 | 40.68 | 75.51 | 37.53 | 68.98 |
图 7:开放词汇语义分割的定性可视化结果。
5.4 消融研究与流式聚类效率
我们在 ScanNet++ 上使用轻量级模型进行了消融研究,如表 4 所示。移除几何感知注意力(Geo-Attn)会降低实例和语义性能,这表明实例特征受益于几何先验。此外,如果没有第一帧几何归一化(FF-Norm),流式重建过程中会出现严重的尺度歧义。这会破坏统一的几何-实例表示,导致所有指标下降。
流式聚类效率。表 5 比较了我们的流式聚类与 IGGT 中使用的离线 HDBSCAN [38] 在 504 $\times$ 336 分辨率下的时间和 GPU 内存消耗。得益于轻量级的聚类代码本和逐帧余弦聚类,我们的方法保持了恒定的内存占用($\sim$0.7 GB)且时间呈线性扩展。
表 4:ScanNet++ 上的消融研究。Geo-Attn:几何感知注意力。FF-Norm:第一帧几何归一化。
| Model | \multicolumn{3}{c}{Geometry} | \multicolumn{3}{c}{Instance} | \multicolumn{6}{c}{Semantic} | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | AUC@3$\uparrow$ | F1-score $\uparrow$ | mIoU $\uparrow$ | Match Rate $\uparrow$ | mIoU $\uparrow$ | mAcc $\uparrow$ | \multicolumn{2}{c}{Method} | \multicolumn{2}{c}{N = 8} | \multicolumn{2}{c}{N = 16} | \multicolumn{2}{c}{N = 32} | \multicolumn{2}{c}{N = 100} | | | | | | | | | | | Time(s) | Mem(GB) | Time(s) | Mem(GB) | Time(s) | Mem(GB) | Time(s) | Mem(GB) | | Full model | 0.2984 | 0.4790 | 0.3098 | 0.6271 | 0.3666 | 0.6853 | Ours | | 0.78 | 0.7 | 1.60 | 0.7 | 2.98 | 0.7 | 7.43 | 0.7 | | w/o Geo-Attn | 0.2902 | 0.4778 | 0.2970 | 0.6074 | 0.3559 | 0.6796 | IGGT | | 105.8 | 13.2 | 418.3 | 25.85 | OOM | OOM | OOM | OOM | | w/o FF-Norm | 0.2334 | 0.3542 | 0.2873 | 0.6019 | 0.3480 | 0.6768 | | | | | | | | | | |
表 5:聚类效率比较。Ours:流式聚类。IGGT:HDBSCAN。N 表示帧数。
6 结论
我们提出了 IGGT4D,这是一种用于在线 4D 场景理解的流式几何-实例框架。IGGT4D 通过因果时空建模和基于几何的实例预测,联合预测相机运动、场景几何和时序一致的实例特征。我们还引入了 InsScene4D-147K,这是一个大规模数据集,包含跨真实/合成和静态/动态场景的几何一致实例标注。在重建、位姿估计、实例跟踪和开放词汇分割上的实验表明,IGGT4D 在保持可扩展流式推理的同时,提高了对象级的一致性。
局限性。InsScene4D-147K 扩展了 4D 实例监督,但需要更广泛的数据覆盖以实现更强的鲁棒性和泛化能力。IGGT4D 仍然主要依赖于监督学习,这激励了未来在自监督学习和更大规模的精心策划监督方面的工作。我们的评估也侧重于感知;整合具身动作和交互反馈是实现具身场景理解的关键步骤。
9
第 10 页
参考文献
[1] Johannes L Schonberger 和 Jan-Michael Frahm. Structure-from-motion revisited. In 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE conference on computer vision and pattern recognition), 第 4104–4113 页, 2016.
[2] Johannes L Schönberger, Enliang Zheng, Jan-Michael Frahm, 和 Marc Pollefeys. Pixelwise view selection for unstructured multi-view stereo. In 欧洲计算机视觉会议 (European conference on computer vision), 第 501–518 页. Springer, 2016.
[3] Carlos Campos, Richard Elvira, Juan J Gómez Rodríguez, José MM Montiel, 和 Juan D Tardós. Orb-slam3: An accurate open-source library for visual, visual–inertial, and multimap slam. IEEE 机器人学汇刊 (IEEE transactions on robotics), 37(6):1874–1890, 2021.
[4] Tingyang Xiao, Xiaolin Zhou, Liu Liu, Wei Sui, Wei Feng, Jiaxiong Qiu, Xinjie Wang, 和 Zhizhong Su. Geoflow-slam: A robust tightly-coupled rgbd-inertial and legged odometry fusion slam for dynamic legged robotics, 2025.
[5] Zachary Teed 和 Jia Deng. Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras. 神经信息处理系统进展 (Advances in neural information processing systems), 34:16558–16569, 2021.
[6] Zihan Zhu, Songyou Peng, Viktor Larsson, Weiwei Xu, Hujun Bao, Zhaopeng Cui, Martin R Oswald, 和 Marc Pollefeys. Nice-slam: Neural implicit scalable encoding for slam. In 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition), 第 12786–12796 页, 2022.
[7] Tingyang Xiao, Liu Liu, Wei Feng, Zhengyu Zou, Xiaolin Zhou, Wei Sui, Hao Li, Dingwen Zhang, 和 Zhizhong Su. Iris-slam: Unified geo-instance representations for robust semantic localization and mapping, 2026.
[8] Abdelrhman Werby, Chenguang Huang, Martin Büchner, Abhinav Valada, 和 Wolfram Burgard. Hierarchical open-vocabulary 3d scene graphs for language-grounded robot navigation. In ICRA 2024 导航与操作视觉-语言模型研讨会 (First Workshop on Vision-Language Models for Navigation and Manipulation at ICRA 2024), 2024.
[9] Qiao Gu, Ali Kuwajerwala, Sacha Morin, Krishna Murthy Jatavallabhula, Bipasha Sen, Aditya Agarwal, Corban Rivera, William Paul, Kirsty Ellis, Rama Chellappa 等. Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning. In 2024 IEEE 国际机器人与自动化会议 (ICRA), 第 5021–5028 页. IEEE, 2024.
[10] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny. Vggt: Visual geometry grounded transformer. In 计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference), 第 5294–5306 页, 2025.
[11] Nikhil Keetha, Norman Müller, Johannes Schönberger, Lorenzo Porzi, Yuchen Zhang, Tobias Fischer, Arno Knapitsch, Duncan Zauss, Ethan Weber, Nelson Antunes 等. Mapanything: Universal feed-forward metric 3d reconstruction. arXiv 预印本 arXiv:2509.13414, 2025.
[12] Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, 和 Tong He. π3: Permutation-equivariant visual geometry learning. arXiv 预印本 arXiv:2507.13347, 2025.
[13] Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, Jiashi Feng, 和 Bingyi Kang. Depth anything 3: Recovering the visual space from any views. arXiv 预印本 arXiv:2511.10647, 2025.
[14] Hengyi Wang 和 Lourdes Agapito. 3d reconstruction with spatial memory. In 2025 国际三维视觉会议 (3DV), 第 78–89 页. IEEE, 2025.
[15] Qianqian Wang, Yifei Zhang, Aleksander Holynski, Alexei A Efros, 和 Angjoo Kanazawa. Continuous 3d perception model with persistent state. In 计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference), 第 10510–10522 页, 2025.
[16] Yushi Lan, Yihang Luo, Fangzhou Hong, Shangchen Zhou, Honghua Chen, Zhaoyang Lyu, Shuai Yang, Bo Dai, Chen Change Loy, 和 Xingang Pan. Stream3r: Scalable sequential 3d reconstruction with causal transformer. arXiv 预印本 arXiv:2508.10893, 2025.
10
第 11 页
[17] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等。从自然语言监督中学习可迁移的视觉模型。在《国际机器学习会议论文集》中,第 8748–8763 页。PmLR,2021 年。
[18] Boyi Li, Kilian Q Weinberger, Serge Belongie, Vladlen Koltun, 和 René Ranftl。语言驱动的语义分割。arXiv 预印本 arXiv:2201.03546,2022 年。
[19] Golnaz Ghiasi, Xiuye Gu, Yin Cui, 和 Tsung-Yi Lin。利用图像级标签扩展开放词汇图像分割。在《欧洲计算机视觉会议论文集》中,第 540–557 页。Springer,2022 年。
[20] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C Berg, Wan-Yen Lo, 等。Segment Anything。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 4015–4026 页,2023 年。
[21] Justin Kerr, Chung Min Kim, Ken Goldberg, Angjoo Kanazawa, 和 Matthew Tancik。Lerf:语言嵌入辐射场。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 19729–19739 页,2023 年。
[22] Songyou Peng, Kyle Genova, Chiyu Jiang, Andrea Tagliasacchi, Marc Pollefeys, Thomas Funkhouser, 等。Openscene:使用开放词汇进行 3D 场景理解。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 815–824 页,2023 年。
[23] Ayça Takmaz, Elisabetta Fedele, Robert W Sumner, Marc Pollefeys, Federico Tombari, 和 Francis Engelmann。Openmask3d:开放词汇 3D 实例分割。arXiv 预印本 arXiv:2306.13631,2023 年。
[24] Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang, 等。Uni3r:通过未标定多视图图像的通用高斯溅射实现统一的 3D 重建与语义理解。arXiv 预印本 arXiv:2508.03643,2025 年。
[25] Shijie Zhou, Haoran Chang, Sicheng Jiang, Zhiwen Fan, Zehao Zhu, Dejia Xu, Pradyumna Chari, Suya You, Zhangyang Wang, 和 Achuta Kadambi。Feature 3dgs:增强 3D 高斯溅射以启用蒸馏特征场。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 21676–21685 页,2024 年。
[26] Yining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng, Yilun Du, Zhenfang Chen, 和 Chuang Gan。3d-llm:将 3D 世界注入大型语言模型。《神经信息处理系统进展》,36:20482–20494,2023 年。
[27] Chenming Zhu, Tai Wang, Wenwei Zhang, Jiangmiao Pang, 和 Xihui Liu。Llava-3d:一种简单而有效的方法,赋予 LMM 3D 感知能力。arXiv 预印本 arXiv:2409.18125,2024 年。
[28] Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, 和 Rakesh Ranjan。Vlm-3r:增强指令对齐 3D 重建的视觉-语言模型,2025 年。
[29] Haoyi Jiang, Liu Liu, Xinjie Wang, Yonghao He, Wei Sui, Zhizhong Su, Wenyu Liu, 和 Xinggang Wang。Spa3r:用于 3D 视觉推理的预测性空间场建模,2026 年。
[30] Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris Chidlovskii, 和 Jerome Revaud。Dust3r:让几何 3D 视觉变得简单。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 20697–20709 页,2024 年。
[31] Vincent Leroy, Yohann Cabon, 和 Jérôme Revaud。通过 Mast3r 将图像匹配锚定于 3D。在《欧洲计算机视觉会议论文集》中,第 71–91 页。Springer,2024 年。
11
第 12 页
[32] Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, 和 Ziwei Liu。Omnivggt:全模态驱动的视觉几何接地 Transformer。arXiv 预印本 arXiv:2511.10560,2025。
[33] Yohann Cabon, Lucas Stoffl, Leonid Antsfeld, Gabriela Csurka, Boris Chidlovskii, Jerome Revaud, 和 Vincent Leroy。Must3r:用于立体 3D 重建的多视图网络。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 1050–1060 页,2025。
[34] Minghan Qin, Wanhua Li, Jiawei Zhou, Haoqian Wang, 和 Hanspeter Pfister。Langsplat:3D 语言高斯溅射。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 20051–20060 页,2024。
[35] Hao Li, Minghan Qin, Zhengyu Zou, Diqi He, Xinhao Ji, Bohan Li, Bingquan Dai, Dingewn Zhang, 和 Junwei Han。Langsurf:用于 3D 场景理解的语言嵌入表面高斯,2026。
[36] Zhiwen Fan, Jian Zhang, Wenyan Cong, Peihao Wang, Renjie Li, Kairun Wen, Shijie Zhou, Achuta Kadambi, Zhangyang Wang, Danfei Xu 等人。Large spatial model:从无序图像端到端生成语义 3D。神经信息处理系统进展 (Advances in neural information processing systems),37:40212–40229,2024。
[37] Hao Li, Zhengyu Zou, Fangfu Liu, Xuanyang Zhang, Fangzhou Hong, Yukang Cao, Yushi Lan, Manyuan Zhang, Gang Yu, Dingwen Zhang 等人。IGGT:用于语义 3D 重建的实例接地几何 Transformer。arXiv 预印本 arXiv:2510.22706,2025。
[38] Leland McInnes, John Healy, Steve Astels 等人。HDBSCAN:基于层次密度的聚类。开源软件期刊 (J. Open Source Softw.),2(11):205,2017。
[39] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv 等人。Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388,2025。
[40] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge 等人。Qwen3-VL 技术报告。arXiv 预印本 arXiv:2511.21631,2025。
[41] Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, 和 Noah Snavely。立体放大:使用多平面图像学习视图合成。arXiv 预印本 arXiv:1805.09817,2018。
[42] Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner, 和 Angela Dai。ScanNet++:高保真 3D 室内场景数据集。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,第 12–22 页,2023。
[43] Xiaqing Pan, Nicholas Charron, Yongqian Yang, Scott Peters, Thomas Whelan, Chen Kong, Omkar Parkhi, Richard Newcombe, 和 Yuheng Carl Ren。Aria digital twin:用于自我中心 3D 机器感知的新基准数据集。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,第 20133–20143 页,2023。
[44] John McCormac, Ankur Handa, Stefan Leutenegger, 和 Andrew J Davison。SceneNet RGB-D:500 万张合成图像能在室内分割任务中击败通用的 ImageNet 预训练吗?在 IEEE 国际计算机视觉会议论文集 (Proceedings of the IEEE international conference on computer vision) 中,第 2678–2687 页,2017。
[45] Alexander Raistrick, Lingjie Mei, Karhan Kayan, David Yan, Yiming Zuo, Beining Han, Hongyu Wen, Meenal Parakh, Stamatis Alexandropoulos, Lahav Lipson 等人。Infinigen indoors:使用程序化生成的照片级真实室内场景。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 21783–21794 页,2024。
[46] Mike Roberts, Jason Ramapuram, Anurag Ranjan, Atulit Kumar, Miguel Angel Bautista, Nathan Paczan, Russ Webb, 和 Joshua M Susskind。Hypersim:用于整体室内场景理解的照片级真实合成数据集。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision) 中,第 10912–10922 页,2021。
12
第 13 页
[47] Yunze Liu, Yun Liu, Che Jiang, Kangbo Lyu, Weikang Wan, Hao Shen, Boqiang Liang, Zhoujie Fu, He Wang, and Li Yi. Hoi4d: A 4d egocentric dataset for category-level human-object interaction. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 21013–21022, 2022.
[48] Jieru Mei, Alex Zihao Zhu, Xinchen Yan, Hang Yan, Siyuan Qiao, Liang-Chieh Chen, and Henrik Kretzschmar. Waymo open dataset: Panoramic video panoptic segmentation. In European Conference on Computer Vision, pages 53–72. Springer, 2022.
[49] Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, et al. Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation. arXiv preprint arXiv:2506.18088, 2025.
[50] Klaus Greff, Francois Belletti, Lucas Beyer, Carl Doersch, Yilun Du, Daniel Duckworth, David J Fleet, Dan Gnanapragasam, Florian Golemo, Charles Herrmann, et al. Kubric: A scalable dataset generator. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 3749–3761, 2022.
[51] Nikita Karaev, Ignacio Rocco, Benjamin Graham, Natalia Neverova, Andrea Vedaldi, and Christian Rupprecht. Dynamicstereo: Consistent dynamic depth from stereo videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 13229–13239, 2023.
[52] Yang Zheng, Adam W Harley, Bokui Shen, Gordon Wetzstein, and Leonidas J Guibas. Pointodyssey: A large-scale synthetic dataset for long-term point tracking. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 19855–19865, 2023.
[53] Yohann Cabon, Naila Murray, and Martin Humenberger. Virtual kitti 2. arXiv preprint arXiv:2001.10773, 2020.
[54] Brian Curless and Marc Levoy. A volumetric method for building complex models from range images. In Proceedings of the 23rd annual conference on Computer graphics and interactive techniques, pages 303–312, 1996.
[55] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson, et al. Sam 2: Segment anything in images and videos. arXiv preprint arXiv:2408.00714, 2024.
[56] Thomas Schops, Johannes L Schonberger, Silvano Galliani, Torsten Sattler, Konrad Schindler, Marc Pollefeys, and Andreas Geiger. A multi-view stereo benchmark with high-resolution images and multi-camera videos. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 3260–3269, 2017.
[57] Jamie Shotton, Ben Glocker, Christopher Zach, Shahram Izadi, Antonio Criminisi, and Andrew Fitzgibbon. Scene coordinate regression forests for camera relocalization in rgb-d images. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 2930–2937, 2013.
[58] Dong Zhuo, Wenzhao Zheng, Jiahe Guo, Yuqi Wu, Jie Zhou, and Jiwen Lu. Streaming 4d visual geometry transformer. arXiv preprint arXiv:2507.11539, 2025.
[59] Zizun Li, Jianjun Zhou, Yifan Wang, Haoyu Guo, Wenzheng Chang, Yang Zhou, Haoyi Zhu, Junyi Chen, Chunhua Shen, and Tong He. Wint3r: Window-based streaming reconstruction with camera token pool. arXiv preprint arXiv:2509.05296, 2025.
[60] Lin-Zhuo Chen, Jian Gao, Yihang Chen, Ka Leong Cheng, Yipengjing Sun, Liangxiao Hu, Nan Xue, Xing Zhu, Yujun Shen, Yao Yao, et al. Geometric context transformer for streaming 3d reconstruction. arXiv preprint arXiv:2604.14141, 2026.
[61] Yuxi Xiao, Jianyuan Wang, Nan Xue, Nikita Karaev, Yuri Makarov, Bingyi Kang, Xing Zhu, Hujun Bao, Yujun Shen, and Xiaowei Zhou. Spatialtrackerv2: 3d point tracking made easy. arXiv preprint arXiv:2507.12462, 2025.
13
第 14 页
A 技术附录与补充材料
A.1 自动化几何引导标注流程的可视化
为了展示我们提出的自动化几何引导标注流程的有效性, 图 8 可视化了跨三种不同数据源生成的标注。此外,对于 RealEstate10K (Re10K) 场景,我们提供了我们精炼后的标注与 InsScene-15K [37] 之前的原始标注之间的定性比较。
RGB 图像 实例掩码 RGB 图像 InsScene-15K 我们精炼的 RGB 图像 生成掩码
C C D D
A A
B B
C C
D D A B A B
C D C D A A
B B
(a) HOI4D (b) Re10K (c) Robotwin
图 8: 跨三种不同来源(HOI4D、Re10K 和 RoboTwin)的自动化几何引导标注流程的定性评估。对于 Re10K 场景,该比较展示了我们的方法如何克服原始 InsScene-15K 标注中常见的失败模式:(a) 过分割,(b) 假阳性分割,(c) 身份切换,以及 (d) 背景泄漏。
A.2 4D 问答场景定位
为了展示 IGGT4D 在支持复杂时空推理方面的能力,我们 使用大型多模态模型 (LMMs) [39, 40] 评估 4D 问答场景定位。当仅提供 RGB 视频流时,LMMs 通常在具有挑战性的视觉条件下难以跟踪移动物体。例如,如图 9 所示,当被拿起的瓶子从左向右移动时,其 外观与背景紧密融合。因此,LMMs 错误地推断 瓶子已根据其运动轨迹移出视野。然而,当增强 我们 4D 一致的实例特征或掩码时,LMMs 能够稳健地跟踪物体,正确 确定它仍在视野内,并准确分割瓶子。
瓶子是否完全离开了视野?回答“是”或“否”。 如果“否”,圈出可见部分并用其实例颜色高亮显示。
仅 RGB 输入 是
RGB + 4D 一致实例图 否
图 9: 4D 问答场景定位。使用 LMMs 进行时空推理能力的比较。仅给定 RGB 帧(顶部),LMM 无法跟踪融入背景的移动瓶子,错误地得出结论认为它已离开视野。相比之下,通过结合我们 4D 一致的实例特征(底部),LMM 成功跨帧跟踪物体, 准确定位其位置,并在具有挑战性的视觉条件下正确回答 4D 语义查询。
14
第 15 页
A.3 第一帧几何归一化说明
在我们的流式训练框架中,我们利用第一帧点云对整个序列的几何真值进行归一化。这一设计对于防止尺度歧义至关重要。考虑一种极端情况,即采用全局序列级归一化。假设模型处理两个共享相同第一帧的不同序列。在第一个序列中,第二帧捕捉的是地面的特写;而在第二个序列中,它捕捉的是一个广阔的开放广场。在全局归一化下,这两个序列的整体几何尺度将截然不同。 因此,当流式模型在这两种情况下处理相同的第一帧时,它被迫回归完全不同的尺度值。从模型的角度来看,仅观察第一帧提供的信息不足以正确推断尚未看到的未来帧的全局尺度。这从根本上导致了尺度歧义和优化冲突。通过将几何归一化严格锚定在第一帧,我们确保尺度由初始观测唯一且一致地确定,从而完全消除这种歧义并确保稳定的因果流式训练。图 10 比较了有无第一帧几何归一化(FF-Norm)的流式预测结果。
无 FF-Norm 有 FF-Norm 无 FF-Norm 有 FF-Norm
图 10:第一帧几何归一化(FF-Norm)。我们比较了有无第一帧几何归一化的流式预测结果。
A.4 流式聚类掩码可视化
我们进一步可视化了实例感知表示以及由我们高效的流式聚类生成的实例掩码。图 11 展示了预测实例特征的 PCA 投影以及相应的时序一致掩码,说明了在没有显式运动建模的情况下跨帧的稳定身份跟踪。 RGB 图像 实例 PCA 实例掩码 RGB 图像 实例 PCA 实例掩码 RGB 图像 实例 PCA 实例掩码
图 11:流式聚类掩码。实例特征的 PCA 可视化以及通过我们的流式聚类获得的掩码,展示了动态序列中 4D 一致的实例分割。
15
第 16 页
A.5 训练细节
我们的模型基于 DA3-Giant [13] 架构进行初始化。我们在构建的 InsScene4D-147K 数据集上,使用 16 块 NVIDIA H20 GPU 训练 IGGT4D。训练过程分为两个阶段:前 6 个 epoch 专门用于优化流式几何,随后的 9 个 epoch 联合优化几何和实例分支。在训练期间,输入图像分辨率在 504 × 504 到 504 × 280 之间变化。为了模拟不同长度的流式序列,每次迭代的总帧数固定为 24,序列长度和批次大小动态调整(B ∈{12, 8, 6, 4, 3, 2})。实例分支的初始学习率设置为 2 × 10−4,几何分支为 1 × 10−5。两个学习率均遵循余弦退火调度进行衰减。此外,我们在训练过程中以 20% 的概率注入真实相机位姿。对于所有消融实验,我们采用 DA3-Large 架构,并使用 16 块 NVIDIA RTX 5090 GPU 训练模型。
A.6 实验细节
对于实例空间跟踪,我们将方法与 SpaTrackerV2 [61]+SAM [20]、SAM2 [55] 和 IGGT [37] 进行比较。遵循 IGGT 中的协议,我们通过利用跟踪点作为密集分割的提示,将 SAM 集成到 SpaTrackerV2 中,并修改 SAM2 以支持多视图密集分割和跟踪。我们使用 HOI4D [47]、Waymo [48]、ScanNet++ [42] 和 PointOdyssey [52]。HOI4D 每个场景包含约 40 帧,并由我们手动标注。Waymo 和 ScanNet++ 每个场景各包含约 100 帧;我们使用官方实例标注,并手动移除了一些小物体。对于 PointOdyssey,我们使用官方测试集中约 100 帧的场景,手动选择掩码子集,并在需要时进行合并。
对于相机位姿估计和 3D 重建,我们将我们的方法与离线全注意力模型(VGGT [10]、MapAnything [11]、Pi3X [12]、DA3 [13])和在线流式模型(CUT3R [15]、StreamVGGT [58]、Wint3R [59]、Stream3R [16]、LingBot-Map [60])进行比较。其中,MapAnything、Pi3X、DA3 和我们的方法支持注入真实相机位姿。在流式方法中,我们的方法、CUT3R、StreamVGGT 和 Stream3R 执行逐帧推理;Wint3R 使用重叠滑动窗口,窗口大小为 4,步长为 2;LingBot-Map 首先对前 8 帧应用全注意力,随后以流式方式重建剩余帧。
我们的评估数据集(HiRoom、ETH3D [56]、7Scenes [57] 和 ScanNet++ [42])及协议遵循 DA3 基准。为了实现流式推理,我们重新排序每个序列,以确保每一帧都与至少一个前序帧共享视觉重叠。我们采用来自 DA3 的鲁棒评估流程:使用基于 RANSAC 的 evo 对齐将预测位姿与真实位姿对齐,并将对齐后的位姿与预测深度通过 TSDF 融合进行整合,以评估 3D 一致性。对于相机位姿估计,我们报告误差阈值为 3◦ (AUC@3) 和 30◦ (AUC@30) 下的曲线下面积 (AUC),其中精度由相对旋转精度 (RRA) 和相对平移精度 (RTA) 的最小值确定。对于 3D 重建,我们评估 Chamfer 距离 (CD) 和 F1 分数。令 Ppred 和 Pgt 分别表示预测和真实点云:
d(x, S) = min ∥x −y∥2, y∈S
1 1 Accuracy = X d(p, Pgt), Completeness = X d(g, Ppred), |Ppred| |Pgt| p∈Ppred g∈Pgt
1 1 Precision = X [d(p, Pgt) < τ] , Recall = X [d(g, Ppred) < τ] , |Ppred| |Pgt| p∈Ppred g∈Pgt
Accuracy + Completeness 2 Precision Recall CD = , F1-score = 2 Precision + Recall.
我们在表 6 中报告了 3D 重建的 Chamfer 距离 (CD)。我们的方法仍然取得了最佳的平均性能。
16
第 17 页
表 6:在 HiRoom、ETH3D、7Scenes 和 ScanNet++ 数据集上的 3D 重建 Chamfer 距离 (CD)。分别评估了无 (w/o p.) 和有 (w/ p.) 真实相机位姿的情况。越低越好。方法分为全注意力(离线)和流式(在线)两类。最佳和次佳结果分别以粗体和下划线突出显示。
方法 平均 HiRoom ETH3D 7Scenes ScanNet++
CD(w/o p.)↓ CD(w/ p.)↓ CD(w/o p.)↓ CD(w/ p.)↓ CD(w/o p.)↓ CD(w/ p.)↓ CD(w/o p.)↓ CD(w/ p.)↓ CD(w/o p.)↓ CD(w/ p.)↓
全注意力(离线) VGGT 0.2220 0.1838 0.0968 0.0646 0.5669 0.4664 0.1446 0.1269 0.0798 0.0771 MapAnything 0.2472 0.1883 0.0863 0.0750 0.6478 0.4919 0.1263 0.1111 0.1283 0.0754 Pi3X 0.1889 0.1458 0.0449 0.0307 0.5326 0.3990 0.1078 0.0897 0.0702 0.0640 DA3 0.1688 0.1457 0.0355 0.0202 0.4499 0.3893 0.1216 0.1080 0.0680 0.0651
流式(在线) CUT3R 0.4691 0.4235 0.7885 0.7858 0.7618 0.6409 0.1586 0.1454 0.1674 0.1219 StreamVGGT 0.3827 0.3410 0.2806 0.2036 0.9274 0.8623 0.1573 0.1574 0.1655 0.1407 Wint3R 0.3131 0.2629 0.2644 0.2410 0.6525 0.5368 0.1675 0.1413 0.1680 0.1328 Stream3R 0.3223 0.2569 0.1278 0.0911 0.7271 0.5542 0.3046 0.2609 0.1298 0.1217 LingBot-Map 0.2431 0.2158 0.1019 0.0796 0.6451 0.5772 0.1352 0.1203 0.0904 0.0860 本文方法 0.1852 0.1556 0.0403 0.0354 0.4822 0.3976 0.1370 0.1154 0.0814 0.0740
A.7 Tri-DPT 几何-实例头
深度 实例 射线
L1-L3 (×3) 融合
融合 Geo-Attn 融合
L4 融合
融合 Geo-Attn 融合
Ins-Attn
图 12:Tri-DPT 头。该头联合解码深度、射线和实例特征,其中几何感知注意力将深度和射线先验注入到实例分支中。
我们设计了一个 Tri-DPT 头,以从流式多尺度令牌 $\{F^{(l)}_t\}_{l=1}^4$ 中联合解码几何和实例表示。Tri-DPT 并未将实例预测视为独立的附加模块,而是使用统一的 DPT 风格解码器,包含三个协调的输出分支,分别用于深度图 $D_t$、射线图 $R_t$ 和实例特征图 $S_t$。多尺度令牌被重新组装并逐步融合以恢复空间分辨率,从而允许在同一空间对齐的表示中生成密集的几何预测和实例嵌入。
如图 12 所示,实例分支并非简单地附加一个独立的实例头,而是显式地利用了来自深度和射线分支的多尺度几何特征。在四个融合阶段,深度特征和射线特征作为几何先验进行融合,并通过几何感知注意力注入到实例分支中。在最后阶段,进一步引入实例注意力以细化实例特征。因此,预测的实例特征不仅由外观线索驱动,还与底层几何结构紧密耦合。这种设计使得实例特征即使在逐帧流式输入下,也能受益于时空一致的几何约束,从而实现稳定的 4D 场景级实例感知。
17