三分钟导读:本文提出MAGiSt3R,首个用于单目RGB视频的多代理前馈3D重建框架,通过MAGMA模块实现子图聚合,在保持约10 FPS速度的同时实现了高精度的全局重建与位姿估计。
英文题目:MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos
论文出处:arXiv 每日论文精选 · arXiv:2607.15211
原始论文:PDF / 论文页面
对应视频标题:MAGiSt3R:首个多代理前馈3D重建框架,突破单目视频全局一致性难题|推荐指数:★★★★★
这篇论文解决什么问题?
现有的多代理SLAM系统(如基于NeRF/3DGS的方法)依赖场景特定的迭代优化,计算开销大且难以实时运行;而现有的前馈3R模型虽快但缺乏全局优化机制,易产生累积漂移,且目前尚无支持多代理协作的前馈重建系统。
核心创新
- 提出首个多代理前馈3D重建框架,无需已知相机参数即可增量重建全局点图。
- 设计MAGMA (Multi-Agent Global Map Aggregation) 模块,适用于代理内和代理间的子图融合,利用几何与外观token建立跨坐标系对应关系。
- 将现有前馈3D重建模型提升至多代理设置,并在重建精度和相机跟踪方面达到SOTA。
方法概览
MAGiSt3R包含三个主要步骤:1) 代理内重建:每个代理使用VGGT模型将RGB序列增量生成为局部子图;2) 代理间对齐:利用MAGMA模块,在检测到环路后,将不同代理的局部子图融合到全局坐标系中;3) 位姿图优化 (PGO):通过经典优化技术减少累积漂移。核心组件MAGMA通过检索相关帧,结合几何、视觉和空间token进行子图融合。
逐图理解论文
方法:MAGiSt3R框架概览

MAGiSt3R是首个多代理前馈3D重建框架。它包含三个核心步骤:首先,每个代理使用VGGT模型将RGB序列增量生成为局部子图;其次,利用MAGMA模块在检测到环路后,将不同代理的局部子图融合到全局坐标系;最后,通过位姿图优化PGO进一步减少累积漂移。
核心创新:MAGMA模块

MAGMA模块是多代理全局地图聚合的核心。它通过检索相关帧,结合几何、视觉和空间Token,建立跨坐标系的对应关系。该模块既用于代理内的子图融合,也用于代理间的地图对齐,无需已知相机参数即可实现增量重建,显著提升了全局一致性。
结果:重建精度SOTA

在ReplicaMultiagent多代理设置下,MAGiSt3R的平均Accuracy为5.37,Completeness为3.36,优于所有前馈基线。这表明MAGMA模块能有效融合多代理信息,生成更精确和一致的全局点云,解决了前馈模型全局一致性差的问题。
结果:轨迹跟踪精度提升

在轨迹跟踪方面,MAGiSt3R在ReplicaMultiagent上的平均ATE RMSE为3.87,优于MA-MASt3R-SLAM的4.43。在AriaMultiagent上,ATE RMSE降至3.52,显著优于其他前馈方法。PGO的结合有效抑制了累积漂移,提升了位姿估计的准确性。
效率:实时性保障

MAGiSt3R的推理速度约为9到10 FPS,保持了前馈模型的高效性。尽管引入了多代理协作和MAGMA模块,但通过前馈架构避免了迭代优化,使其在保持高精度的同时,仍能满足实时应用的需求,优于依赖每场景优化的传统SLAM方法。
实验与关键结果
- 在合成数据集ReplicaMultiagent和真实世界数据集AriaMultiagent上进行评估。
- 与单代理及多代理设置下的SOTA前馈方法(如VGGT-SLAM, SLAM3R, MASt3R-SLAM)及RGB-D SLAM系统进行对比。
- 进行消融实验,分析MAGMA策略、骨干网络、PGO及损失函数的影响。
- 在自收集的低重叠率真实场景中进行定性实验。
- 在ReplicaMultiagent多代理设置下,平均Accuracy为5.37,Completeness为3.36,ATE RMSE为3.87 (Page 11, Table 1)(第 11 页)
- 在ReplicaMultiagent多代理设置下,MAGiSt3R平均Accuracy为5.37,Completeness为3.36,优于所有前馈基线 (Page 12, Table 3)(第 12 页)
- 在ReplicaMultiagent多代理跟踪中,平均ATE RMSE为3.87,优于MA-MASt3R-SLAM (4.43) (Page 13, Table 5)(第 13 页)
- 在AriaMultiagent多代理跟踪中,平均ATE RMSE为3.52,显著优于其他前馈方法 (Page 14, Table 7)(第 14 页)
- 推理速度约为9-10 FPS (Page 14, Table 8)(第 14 页)
阅读时需要注意
- 当前框架未针对极端条件(如昼夜变化、恶劣天气)进行优化。
- 实验规模限于3个代理,未来需评估更大规模的多代理系统。
- 自收集场景实验显示在极低重叠率(~15%)下仍有效,但可能面临挑战。
- 部分RGB-D SLAM基线(如CP-SLAM, MAGiC-SLAM)使用RGB-D输入,与MAGiSt3R的单目RGB输入不完全公平,文中将其作为参考上限。
- 单代理独立运行的结果与多代理整体运行的结果不可直接比较,因为覆盖的场景部分不同。
关联工作
- VGGT-SLAM:作为单代理前馈SLAM基线,并在多代理设置下通过RICP进行融合对比。(第 4 页)
- SLAM3R:单代理前馈SLAM基线,其L2W模块被用于消融实验对比。(第 4 页)
- MAGiC-SLAM:多代理3DGS SLAM系统,使用RICP作为多代理前馈基线的融合策略参考。(第 4 页)
- MA-MASt3R-SLAM:并发工作,将MASt3R-SLAM提升至多代理设置,用于跟踪精度对比。(第 10 页)
- DUSt3R / MASt3R:3R基础模型,作为单代理前馈重建的基线方法。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
MAGiSt3R:基于多代理的单体 RGB 视频前馈 3D 重建
Ziren Gong1 Xiaohan Li2 Fabio Tosi1 Ninghui Xu3 Stefano Mattoccia1 Jianfei Cai4 Matteo Poggi1
1 意大利博洛尼亚大学 2 中国香港大学牙医学院 3 中国东南大学仪器科学与工程学院 4 澳大利亚莫纳什大学 项目页面:https://zorangong.github.io/magist3r_page/
2026 7月 16日 VGGT-SLAM [30] + RICP MAGiSt3R (本文方法) 图 1:MAGiSt3R – 多代理 3D 重建的实际应用。我们在 ReplicaMultiagent Apart 2 数据集上展示了我们的方法与 VGGT-SLAM [30]+RICP (RANSAC+ICP) 的建图和跟踪结果。我们的框架产生了更准确且一致的重建结果,以及更精确的相机轨迹。[cs.CV]
摘要。本文提出了 MAGiSt3R,这是一个多代理 3D 重建框架,能够以接近 10 FPS 的速度对单体 RGB 视频进行重建和相机跟踪。MAGiSt3R 依赖于来自 3R 家族的前馈模型来处理 RGB 视频并回归局部点图,并依赖于一个合并模型 MAGMA,该模型在代理内和代理间层面结合局部地图以获得最终的全球点图。此外,MAGiSt3R 执行位姿图优化(PGO)以减轻沿前馈管道发生的累积相机漂移。我们在合成和真实世界数据集上评估了 MAGiSt3R,证明了其相比最先进的基于前馈的方法在重建和相机跟踪精度方面的优越性。
1 引言
多代理系统已成为人工智能广阔领域中的一个强大范式,使多个自主实体能够协作以实现复杂目标。近期在代理式人工智能(agentic AI)方面的进展进一步强调了那些除了感知和推理之外还具备…的系统的重要性。
第 2 页
2 Gong 等人
观察环境,还可以主动协调、共享信息,并朝着共同目标行动。这一范式也已触及机器人技术与计算机视觉的交叉领域,其中作为自主导航及其他更高级应用核心的 3D 重建任务,已被提升为一种协作过程:多个代理在环境中独立导航,并为建图任务做出贡献 [10,17,52]。
数十年来,3D 重建一直采用不同的方法,主要可分为两大类:离线方法,如运动恢复结构(Structure-from-Motion, SfM)[27, 28, 38, 39] 和多视图立体视觉(Multi-View Stereo, MVS),假设在事先已完全获取待处理的图像;以及在线方法,如同时定位与建图(Simultaneous Localization and Mapping, SLAM)系统 [3, 11, 42],假设输入为图像流。后者最适合实际系统,因为一旦收集到新图像,就需要即时响应。
SLAM 范式近期经历了一场革命 [43]。事实上,神经辐射场(NeRF [32])最初以及随后的 3D 高斯溅射(3D Gaussian Splatting, 3DGS [22])作为建图过程的主要引擎被引入,赋予了 SLAM 系统生成密集 3D 重建结果的能力,并可能从新的任意视角渲染场景。然而,由于需要在部署时执行逐场景优化,这带来了显著的内存需求和运行时限制。在此基础上,多代理 SLAM 系统 [10, 52] 为空间 AI 应用开辟了新的可能性,可能加速重建过程,同时对协作重建的全局地图施加几何一致性约束。具体而言,已分别提出了基于 NeRF [10] 和 3DGS [52] 引擎构建的多代理系统,但它们继承了 NeRF 和 3DGS 的主要局限性,即 i) 场景特定,因为需要直接在导航过程中进行优化;ii) 由于迭代参数更新,往往无法在实时约束下处理。
相比之下,3D 视觉基础模型(通常称为“3R”模型 [48])的出现,激发了开发前馈式 3D 重建系统 [12, 29, 30] 的新兴趣,从而补充了最新的基于 NeRF/3DGS 的 SLAM 流水线。一方面,这些模型可以在任何无约束的 RGB 视频上运行,不需要深度等额外信息——即使相机参数未知——且不再针对单个序列进行优化,从而允许更快的推理速度。另一方面,处理视频流的 3R 模型通常缺乏全局优化,因此容易受到轨迹漂移的影响。鉴于此,将 3R 模型部署在多代理框架中,有可能最大限度地发挥其优势,同时克服其在长视频序列中相机漂移的主要弱点。然而,迄今为止,尚未开发出多代理前馈式 3D 重建系统。
受这些论点驱动,我们引入了 MAGiSt3R,这是首个用于单目 RGB 视频的多代理前馈式 3D 重建框架。基于 3R 模型的最新进展,MAGiSt3R 全局且增量地重建多个代理并发导航的场景。这是通过以下三个主要步骤实现的:i) 代理内重建:每个
第 3 页
MAGiSt3R 3
智能体通过 3R 骨干网络在子地图中处理输入的 RGB 序列,然后将子地图增量式地合并为几何一致的地图;ii) 智能体间对齐:MAGiSt3R 利用回环检测机制来检测多个智能体之间的重叠区域。一旦检测到回环,来自多个智能体的点云地图将被合并为最终的全局地图;iii) 位姿图优化(Pose Graph Optimization, PGO):在智能体内或智能体间层级合并子地图后,对跟踪得到的位姿进行优化,以减轻先前步骤中累积漂移的影响。在这三者的交汇处,一种新颖的前馈模型——多代理全局地图聚合模块(Multi-Agent Global Map Aggregation, MAGMA)——负责在智能体内和智能体间层级合并子地图。
我们通过大量实验证明,如图 1 所示,MAGiSt3R 实现了更高质量的场景重建,并在接近 10 FPS 的速度下实现了准确的位姿估计。我们的贡献总结如下:
– 我们提出了首个用于 RGB 视频的多代理、前馈式密集场景重建框架,该框架能够在统一坐标系中增量式地重建 3D 点云地图,且无需已知相机参数。 – 我们提出了一种定制的多代理全局地图聚合模块,适用于智能体内和智能体间层级的子地图合并,从而生成全局点云地图和准确的相机位姿。 – 我们将几种现有的前馈式 3D 重建模型提升到了多代理设置中。与它们相比,MAGiSt3R 在 3D 重建和相机跟踪方面均取得了最先进的结果。
2 相关工作
我们简要回顾关于 3D 重建的文献,将现有方法分类为离线方法、SLAM、基于 3R 的系统以及多代理 SLAM。 离线 3D 重建。属于这一类别的方法假设事先可以获取完整的图像集 [27, 28, 38, 39]。如果仅有图像可用,则可以通过运动恢复结构(Structure from Motion, SfM)[1] 算法估计相机参数和 3D 点。相反,如果事先已知相机参数,则通过多视图立体视觉(Multi-View Stereo, MVS)[44] 进行 3D 重建。针对这两种设置,人们提出了更现代的方法,后者包括实现类似 NeRF [32] 或 3DGS [22] 的框架以进行 3D 表面重建 [4–6, 15, 26],前者则涉及训练大型基础模型 [47]。然而,对于导航并与环境交互的智能体而言,离线处理通常在实际系统中并不可行。 在线 SLAM 系统。传统的 SLAM 系统如 ORB-SLAM [3] 依赖于稀疏特征匹配,而 DROID-SLAM [42] 等深度学习方法则使用学习到的特征和密集光束法平差。然而,这些方法仅能生成稀疏或半稠密地图,缺乏 photorealistic(照片级真实感)重建的能力。神经隐式表示最近彻底改变了密集 SLAM 系统 [13,14,43]。基于 NeRF 的方法如 iMap
第 4 页
4 Gong 等人
[40] 率先使用多层感知机(MLPs)进行联合建图和跟踪,而 NICE-SLAM [56] 引入了分层特征网格以提高可扩展性。随后的工作如 Vox-Fusion [50]、Point-SLAM [36] 和 Co-SLAM [46] 通过自适应体素分配、神经点云和混合坐标编码进一步提升了重建质量。GO-SLAM [53] 集成了回环检测和束调整(bundle adjustment)以实现全局优化并提高一致性。另一方面,3DGS 已成为该领域中一种替代的显式表示方法。GS-SLAM [49]、Photo-SLAM [18]、SplaTAM [21] 和 MonoGS [31] 在保持高照片级真实感质量的同时展示了实时渲染能力。后续工作改进了这些方法,以提高跟踪精度 [16,25,55]、映射效率 [34],并利用多模态输入 [41]。尽管取得了这些进展,辐射场表示仍然是帧到模型(frame-to-model)的方法,主要在 RGB-D 设置下运行,需要迭代参数更新和逐场景优化,这限制了它们在实时应用中的速度。
在线 3R 模型。最近的 3D Reconstruction foundation models(3D重建基础模型)绕过了特定场景的训练,提供直接 3D 重建 [9]。这始于 DUSt3R [48] 以端到端的方式从图像对中预测点图,MASt3R [24] 通过密集特征匹配对此进行了改进。最近,VGGT [47] 通过在单次前向传播中从任意图像序列联合预测点云、位姿和内参,推动了该领域的发展。基于这些工作,新的 SLAM 系统应运而生。MASt3R-SLAM [33] 利用 MASt3R 进行实时单目 SLAM,无需相机标定,采用高效的点图匹配和 Sim(3) 优化。SLAM3R [29] 引入了一个端到端系统,包含图像到点(Image-to-Points, I2P)和局部到世界(Local-to-World, L2W)模块,用于渐进式对齐。VGGT-SLAM [30] 采用了功能更强大的 VGGT 变换器,在 SL(4) 流形上进行优化,以处理未标定设置下的射影歧义。Spann3R [45] 则使用空间内存来在增量重建过程中保持全局一致性,SLAM3R [29] 实现了局部到全局对齐模块,而 Ov3R [12] 则致力于开放词汇 3D 语义重建。虽然这些方法比基于 NeRF/3DGS 的 SLAM 系统更快,并且可能是多代理设置下的理想候选方案,但现有框架仅在单代理设置下运行,缺乏用于多代理协作和全局地图一致性的鲁棒机制。
多代理 SLAM。多代理 SLAM 可分为集中式和分布式架构。传统的集中式系统如 CCM-SLAM [37] 和 CVI-SLAM [20] 使用中央服务器进行地图融合和全局优化,而分布式方法如 Swarm-SLAM [23] 支持点对点通信以及鲁棒的代理间回环检测。最近的多代理框架如 CP-SLAM [17](分布式到集中式)和 MNE-SLAM [10](点对点)集成了神经表示;然而,两者都遭受隐式神经方法固有的计算开销影响。MAGiC-SLAM [52] 利用 3DGS 实现更快的渲染,并通过集中式协调支持多代理,通过回环检测机制实现了改进的跟踪。然而,这些方法本质上是 RGB-D SLAM 系统,需要
第 5 页
MAGiSt3R 5
代理 1 服务器
VGGT MAGMA
RGB … 代理 N MAGMA
VGGT MAGMA 位姿图 回环检测 优化
RGB 全局地图
图 2: MAGiSt3R 概述。给定来自多个代理的 RGB 序列, 我们的方法同时预测局部点图和相机位姿。然后, MAGMA 模型在代理内部层级合并子图。在服务器端,当 检测到代理之间的回环时,相同的 MAGMA 模块将多个代理的局部地图融合 为全局地图。最后,位姿图优化进一步减轻累积漂移。
需要已知的相机参数,执行缓慢的场景特定优化,并 侧重于视图合成而非 3D 重建。相比之下,我们的 MAG- iSt3R 基于前馈式 3R 模型,首次实现了无需神经表示优化 的多代理协作。这使得通过直接预测点图来处理未知相机参数成为可能, 速度接近 10 FPS,从而将适用范围扩展到仅 RGB 的在线 3D 重建。
3 方法
我们现在介绍 MAGiSt3R,其架构如图 2 所示。
3.1 代理内部重建
我们首先描述每个代理如何独立处理其 RGB 序列 以生成本地子图。 增量子图生成。遵循基于 3R 的系统,MAGiSt3R 中的每个代理 通过预测多个子图(例如 n 个),在其统一的坐标系中增量重建场景。 具体而言,对于任意一组新的 Ii = {Ii1, …, Iim} m 张连续 RGB 图像,创建一个子图 Si,同时 中间帧 Iim 被标记为关键帧并添加到关键帧集合中 Ikey = {I1m, …, Inm},用于后续支持子图合并为单个子图。 特意地,我们使用 3R 模型 VGGT [47] 将 Ii 编码为相机令牌 ti = {ti1, …, tim},然后预测密集深度图 Di = {Di1, …, Dim}、置信度 分数图 Ci = {Ci1, …, Cim} 以及相机内参和外参 Pi = {P1,i, …, Pmi}: \bm{t}_{i},\bm{D}_{i},\bm{C}_{i},\bm{P}_{i}=\Phi_{VGGT}(\bm{I}_i) (1)
遵循 [47],我们通过根据相机参数 Pi 对深度图 Di 进行逆投影, 获得 Ii 中帧的点图 Xi,在参考系统中
第 6 页
6 Gong 等人
第一台相机。随后,我们根据 $C_i$ 对 $X_i$ 进行过滤,移除任何置信度低于 $\tau_{conf}$ 的 3D 点。
同时,对于 $I_i$ 中的帧,我们使用 ViT 编码器 $E_{\text{ViT}}$ 提取视觉 token $\upsilon_i = \{\upsilon_{i1}, …, \upsilon_{im}\}$,并使用 DINOv2 SALAD [19] 提取空间 token $\vartheta_i = \{\vartheta_{i1}, …, \vartheta_{im}\}$ 和全局描述符 $\delta_i = \{\delta_{i1}, …, \delta_{im}\}$:
$$ \bm{\upsilon}_i = E_{\text{ViT}}(\bm{I}_i), \quad \bm{\delta}_i, \bm{\vartheta}_i = \text{SALAD}(\bm{I}_i) \quad (2) $$
这些 token 对于正确检测回环并将子地图合并到最终地图中至关重要,我们将在下文详述。因此,我们将单个子地图定义为 $S_i = \{t_i, X_i, P_i, \upsilon_i, \delta_i, \vartheta_i\}$,并通过保留从 $I_{\text{key}}$ 中的帧获得的预测,同时定义 $S_{\text{key}} = \{t_{\text{key}}, X_{\text{key}}, P_{\text{key}}, \upsilon_{\text{key}}, \delta_{\text{key}}, \vartheta_{\text{key}}\}$。后者将在执行子地图合并和回环闭合时发挥重要作用。
根据此方案,单个代理沿场景提取 $n$ 个子地图。然而,这些子地图具有不同的参考系——即每个子地图都位于其第一帧 $I_{i1}$ 的参考系中。为了将这些子地图合并到共享参考系中的单个地图中,我们引入了 MAGMA 模型。
3.2 MAGMA 模型
图 3 说明了 MAGMA(多代理全局地图聚合模块),它通过将新子地图增量对齐到全局坐标系中。它处理一个参考集 $S_{\text{ref}}$ 和一个配准集 $S_{\text{reg}}$,分别代表全局地图和需要合并的新预测子地图。这些输入被转发到一个几何编码器 $E_{\text{geo}}$ 和两个解码器:一个配准解码器 $D_{\text{reg}}$,用于预测与参考集对齐的点图和位姿;以及一个参考解码器 $D_{\text{ref}}$,用于细化原始参考集。
参考集检索。输入到 MAGMA 的 $S_{\text{reg}}$ 和 $S_{\text{ref}}$ 分别从需要合并的局部子地图 $S_l$ 和全局集 $\{S_g, S_{\text{key}}\}$ 中检索得到。在单个代理处理完 $I_i$ 中的图像后,要合并的局部子地图 $S_l$ 即为 $S_i$,全局地图 $S_g$ 包含先前合并的子地图 $\{S_{i-1}, S_{i-2}, …\}$,而关键帧集 $S_{\text{key}}$ 提供历史观测数据。
为了仅保留最相关的视图,我们从 $\{S_g, S_{\text{key}}\}$ 中选择相关性最高的前 N 个视图作为子地图合并的参考集。具体而言,我们测量 $\delta_l$ 中的描述符与 $\delta_g$ 和 $\delta_{\text{key}}$ 中的描述符之间的视觉相似度以获得相关性得分。基于这些得分,我们从 $\{S_g, S_{\text{key}}\}$ 中选择最相关的 N 个视图作为 $S_{\text{ref}}$,同时保留 $S_l$ 作为配准集 $S_{\text{reg}}$。
MAGMA 编码器。MAGMA 将参考和配准点图 $X_{\text{ref}}, X_{\text{reg}}$ 编码为几何 token $\gamma_{\text{ref}} = \{\gamma_1, …, \gamma_N\}_{\text{ref}}$ 和 $\gamma_{\text{reg}} = \{\gamma_1, …, \gamma_m\}_{\text{reg}}$
$$ \bm{\gamma}_{\text{ref}} = E_{\text{geo}}(\bm{X}_{\text{ref}}), \quad \bm{\gamma}_{\text{reg}} = E_{\text{geo}}(\bm{X}_{\text{reg}}) \quad (3) $$
$E_{\text{geo}}}$ 包含一个卷积核大小为 16、步长为 16 的 2D 卷积层,类似于 ViT 的 patch embedding 过程,使得几何 token $\gamma_i$ 在空间上与视觉 token $\upsilon_i$ 对齐,从而捕捉结构几何基元。然而,几何
第 7 页
MAGiSt3R 7
视觉 Token 空间 Token 注意力掩码
注意力 相机 Token
+ 优化后的位姿 全局子图 + 位姿头
参考集 解码器 DPT 优化后的点 注意力 关键帧 检索 编码器 + DPT
+ 配准后的点
局部子图 配准集 解码器 配准后的位姿
图 3: MAGMA 模型概览。给定全局子图、关键帧集合和局部子图,MAGMA 模块将局部子图合并到统一坐标系下的全局地图中。首先,我们利用检索获取最相关的帧以形成输入,即参考集(reference set)和配准集(registering set)。接着,我们对它们的点图进行编码,并将这些几何特征与视觉 token、空间 token 和相机 token 进行聚合。然后,我们进行解码并预测全局点图。
仅凭几何特征可能不足以完成合并,因为点图中存在重复结构且缺乏纹理。 为了解决这个问题,我们为参考集引入外观 token $\alpha_{ref} = \{\alpha_1, …, \alpha_N\}_{ref}$ 以增强几何 token 并建立不同坐标系之间的对应关系。这些 token 是通过注意力模块从前文引入的视觉和空间 token 中推导得出的:
\bm{\alpha}_{ref} = \bm{\upsilon}_{ref} \text{softmax}(\frac{\bm{\upsilon}_{ref}\bm{\vartheta}_{ref}^{T}}{\sqrt{d}})\bm{\vartheta}_{ref} (4) \
其中 $d$ 表示特征维度。我们应用相同的过程以获得 $\alpha_{reg}$。外观 token 建立了不同坐标系之间的对应关系,并缓解了仅依赖几何 token 所固有的歧义性。 随后,将几何 token 和外观 token 组合,并与相机 token 拼接成集成特征 $F_{ref} = \{F_1, …, F_N\}_{ref}$:
\bm{F}_{ref} = [\bm{t}_{ref}; \bm{\alpha}_{ref} + \bm{\gamma}_{ref}] (5)
我们应用相同的过程以获得 $F_{reg}$。 MAGMA 解码器。配准解码器和参考解码器 $D_{reg}, D_{ref}$ 分别处理 $F_{ref}, F_{reg}$。每个解码器块包含自注意力层和多视图交叉注意力层,后接一个多层感知机(MLP)。配准解码器首先对 $F_{reg}$ 应用自注意力,然后以 $F_{reg}$ 作为查询,以 $F_{ref}$ 作为键和值执行交叉注意力。最后,经过最大池化后,我们得到配准 token $G_{reg} = \{G_1, …, G_m\}_{reg}$ 和参考 token $G_{ref} = \{G_1, …, G_N\}_{ref}$:
\bm{G}_{reg} = D_{reg}(\bm{F}_{reg}, \bm{F}_{ref}), \bm{G}_{ref} = D_{ref}(\bm{F}_{reg}) (6)
第 8 页
8 Gong 等人
MAGMA 头。最后,DPT 头 [35] $H_{pts}$ 回归细化点图 $\bm{X'}_{ref}$、配准点图 $\bm{X'}_{reg}$ 以及置信度图 $\bm{C}_{ref}, \bm{C}_{reg}$
$$ \bm{X'}_{ref}, \bm{C}_{ref} = H_{pts}(\bm{G}_{ref}), \bm{X'}_{reg}, \bm{C}_{reg} = H_{pts}(\bm{G}_{reg}) \quad (7) $$
通过从 $\bm{G}_{ref}, \bm{G}_{reg}$ 中检索位姿嵌入 $\bm{t}_{ref}, \bm{t}_{reg}$,我们使用由四个自注意力层后接一个线性层组成的位姿头 $H_{pose}$ 来预测细化相机参数 $\bm{P}_{ref}$ 和配准相机参数 $\bm{P}_{reg}$,其中后者被转换到全局坐标系中。具体而言,我们将位姿嵌入拼接为 $(\bm{t}_{ref}, \bm{t}_{reg})$。然后,我们在位姿头中使用注意力掩码来引导信息交换:$\bm{t}_{ref}$ 关注其所有 token,而 $\bm{t}_{reg}$ 仅关注 $\bm{t}_{ref}$ 中的 token。
$$ \bm{P}_{ref}, \bm{P}_{reg} = H_{pose}(\bm{t}_{ref}, \bm{t}_{reg}) \quad (8) $$
随后,全局地图的点图和位姿相应地进行更新。
训练损失。我们通过监督子图融合来端到端地训练 MAGMA。遵循 DUSt3R [48],我们在全局坐标系中的预测点图 $\bm{X}_g$ 与真实点图 $\hat{\bm{X}}_g$ 之间计算置信度感知的配准损失,该损失由有效点的平均欧几里得距离进行归一化:
$$ \mathcal{L}_{reg} = \frac{1}{|\mathcal{M}|} \sum_{i \in \mathcal{M}} \frac{1}{\beta} \left\| \hat{z} \bm{X}_g – z \hat{\bm{X}}_g \right\|_2 \quad (9) $$
其中 $\mathcal{M}$ 是真实值中有效点的掩码,$z$ 和 $\hat{z}$ 是缩放因子,$\beta$ 是用于正则化的超参数。我们还对相机参数 $\bm{P}_g$ 与真实值 $\hat{\bm{P}}_g$ 之间施加相机损失:
$$ \mathcal{L}_{pose} = \left\| \bm{P}_g – \hat{\bm{P}}_g \right\|_2 \quad (10) $$
其中 $\hat{\bm{P}}_g = [q, b, f]$ 包含四元数 $q \in \mathbb{R}^4$、平移向量 $b \in \mathbb{R}^3$ 和视场 $f \in \mathbb{R}^2$,假设主点位于图像中心。最后,为了确保配准的子图与全局场景保持一致对齐,我们添加了几何一致性项。通过随机选择预测子图中的两个视图 $j, k$,我们使用真实深度图 $\hat{D}_j, \hat{D}_k$ 和内参 $\hat{K}_j, \hat{K}_k$,以及从 $\bm{P}_g$ 导出的预测相机位姿 $\bm{T}_j, \bm{T}_k$,将视图 $j$ 中的像素重投影到视图 $k$。然后,我们测量全局坐标系中投影点图 $\tilde{\bm{X}}_j$ 和 $\tilde{\bm{X}}_k$ 之间的距离:
$$ \mathcal{L}_{geo} = \frac{1}{|\mathcal{M}|} \sum_{i \in \mathcal{M}} \left\| \tilde{\bm{X}}_j – \tilde{\bm{X}}_k \right\|_2 \quad (11) $$
其中 $\mathcal{M}$ 是有效像素的掩码。总训练损失 $\mathcal{L}$ 定义如下:
$$ \mathcal{L} = \lambda_{reg} \mathcal{L}_{reg} + \lambda_{pose} \mathcal{L}_{pose} + \lambda_{geo} \mathcal{L}_{geo} \quad (12) $$
第 9 页
MAGiSt3R 9
3.3 代理间重建
我们现在介绍 MAGMA 模型如何将单个代理的努力结合起来,形成全局 3D 重建。 环路检测。为了实现多个代理之间的全局且一致的重建,我们需要检测不同代理轨迹重叠的区域。我们将第一个代理 A1 的第一个相机设置为全局坐标系。然后,当另一个代理(例如 A2)创建新的子地图时,我们通过计算 δA2i 和 δA1key 之间的相关性,在该子地图与来自 A1 的关键帧 SA1key 之间寻找环路。当最大相关性得分超过阈值 τloop 时,检测到代理间的环路。 代理间子地图融合。一旦检测到环路,我们选取包含具有最大相关性得分的关键帧的来自第一个代理 A1 的子地图作为全局子地图 SA1g,并将其与局部子地图 SA2l(由另一个代理 A2 重建的最新子地图)以及关键帧集合 SA2key 一起转发给 MAGMA。我们从 nSA2l, SA2key o 中检索出相关性最高的前 N 个视图作为注册集合 Sreg,其中 SA2key 作为提供全局线索的历史观测。同时,我们将 SA1g 保留为参考集合 Sref。然后,如第 3.2 节所述,MAGMA 预测代理 A2 的注册点云图和位姿,这些结果进一步用于计算局部坐标与全局坐标之间的相对变换,并更新全局地图。
3.4 后端位姿图优化
我们通过经典的优化技术 [52] 进一步细化预测的位姿。 图构建。为了减轻增量过程中的累积误差,我们在子地图融合后执行位姿图优化(PGO),以减少漂移并强制全局一致性。代理创建的每个子地图对应于图中的节点 ni ∈SE(3)。相邻节点之间的边 eij 表示在代理内阶段由提出的 MAGMA 模型计算的相对变换。 环路闭合。我们计算每个代理中提取的全局描述符 δi 之间的视觉相似度,以检索新子地图的潜在环路候选项。如果发现高于 τloop 的相关性得分,则检测到环路。环路边是在代理间阶段由 MAGMA 估计的。 优化。我们利用 Levenberg-Marquardt 算法最小化目标函数来获得优化后的相机位姿:
(13) \sum_{i,j\in repsilon} \left\| e_{ij}^{-1}(n_{i}^{-1}n_{j}) \right\|_{\Omega_{ij}}^{2} \sum_{i,j\in repsilon}
其中 ε 表示节点的索引。ni 和 nj 是节点位姿,log 是从 SE(3) 到 se(3) 的对数映射。Ωij 是反映边上不确定性的信息矩阵——得分越高,权重越大。
第 10 页
10 Gong 等人
位姿更新集成。在执行位姿图优化后,我们获得了每个代理的每个子地图的位姿修正量 $n'_i$。每个子地图中的所有相机位姿 $T_i = T_{1,i}, …, T_{m_i}$ 更新为: $$ T_i \leftarrow T_i n'_i \quad (14) $$
4 实验
我们现在对 MAGiSt3R 进行全面评估,包括实现细节、消融实验以及与最先进方法的比较。 数据集。我们在多个数据集的混合数据上训练我们的多代理全局地图聚合(MAGMA)模块:ScanNet [7]、ScanNet++ [51] 和 Aria Synthetic Environment [2]。ScanNet 和 ScanNet++ 提供了真实世界的多样化室内环境,从小型房间到大规模室内场景。Aria Synthetic Environment 提供了照片级真实的多人间场景。为了有效地学习如何在代理内和代理间层面合并点地图,MAGMA 通过将训练集中的多样化场景进行分区来模拟多代理系统——因为没有任何训练数据集原生支持这种设置。具体而言,从场景的第一帧和最后一帧开始创建两条轨迹,每条轨迹每隔 2 帧采样一帧。在评估阶段,我们在 ReplicaMultiagent [17] 和 AriaMultiagent [52] 数据集上进行 3D 重建和相机跟踪。前者提供了合成单人和多人房间,其中 2 个代理独立导航,专门针对 3D 重建进行了定制;后者提供了由 3 个代理探索的真实世界室内环境,拥有用于评估的真实相机信息和深度数据,但没有真实重建结果。 实现细节。我们在 PyTorch 中实现了 MAGiSt3R。具体而言,我们在 4 块 A100 GPU 上以批量大小 5 和学习率 $1.5 \times 10^{-5}$ 训练 MAGMA 200 个 epoch。我们将 VGGT 处理的输入图像数量设置为 $m = 10$,步长 $s = 5$,置信度阈值 $\tau_{conf} = 0.25$,相关性阈值 $\tau_{loop} = 0.6$,顶部相关样本数 $N = 10$,正则化项 $\beta = 1$,以及损失权重 $\lambda_{reg} = 1$、$\lambda_{pose} = 1$、$\lambda_{geo} = 0.8$。遵循多代理 SLAM 文献 [10, 52],我们在多代理设置下运行我们的评估,同时报告独立运行的单个代理所取得的结果。 基线方法。对于单代理评估,我们将 MAGiSt3R 与最先进的前馈框架进行比较:DUSt3R [48] 和 MASt3R [24] 每次顺序处理两个视图,SLAM3R [29]、MASt3R-SLAM [33] 和 VGGT-SLAM [30] 作为增量式多视图 3D 重建方法。对于多代理设置,现有的神经 SLAM 系统 [10, 17, 52] 需要 RGB-D 输入;因此,在评估跟踪精度时,我们将它们作为参考而非公平基线进行报告。相反,我们通过独立处理每个代理的视频并使用 RANSAC+ICP 对齐(RICP)合并生成的点地图,将 [24, 29, 30, 48] 调整为多代理操作,提供可比的前馈基线,并与一项并发工作进行比较,该工作通过全局图优化将 MASt3R-SLAM [33] 提升到多代理设置——称为 MA-MASt3R-SLAM [54]。
第 11 页
MAGiSt3R 11
指标。为了进行定量评估,我们遵循 [29] 的做法,通过利用真实深度和相机参数将像素投影为 3D 点来构建真实点云。重建质量通过准确性和完整性进行评估,跟踪准确性则使用绝对轨迹误差 (ATE) 的均方根误差 (RMSE) 来衡量。
4.1 消融实验
我们首先在 ReplicaMultiagent 数据集上运行消融实验以开始我们的评估。
MAGMA 的影响。表 1 展示了 MAGMA 在结合来自不同代理的子图方面的有效性,方法是将它与 Replica-Multiagent 数据集上不同的融合策略进行比较。在本实验中,我们报告了多代理设置下的重建和相机跟踪指标。我们选择了三种典型的融合策略作为基线,包括:(A) MAGiC-SLAM [52] 使用的 RANSAC+ICP (RICP),(B) VGGT-SLAM [30] 使用的在 SL(4) 流形上的优化,以及 (C) SLAM3R [29] 中提出的 L2W 模块。最后,(D) 我们还评估了 MAGMA 在多代理设置下的有效性,但其仅在单代理模式下进行训练。所有变体均使用 VGGT 作为单代理骨干网络。我们可以注意到,MAGMA 始终优于现有的替代方案,即使在没有针对多代理进行训练的情况下 (D)——而在多代理假设下进行适当训练则能释放其全部潜力 (E)。我们观察到,RICP (A) 和 SL(4) (B) 严重依赖于两个融合子图的相似性:两个子集越不相似,合并时获得的对齐效果越差。这使得它们非常适合增量式代理内对齐,但在代理间层面却无效。相比之下,我们的 MAGMA 模块利用跨子集的几何特征学习对应匹配,即使在重叠度较低的情况下也能保持有效。SLAM3R [29] 中的 L2W 分支由于处理的几何和视觉信息较差,在此任务上也表现不佳。顺便一提,RICP 在其他方法中取得了最佳结果,这促使我们在后续实验中选择使用它来构建多代理前馈基线。最后,我们分别报告了通过移除 Lgeo 损失和空间令牌 (spatial tokens) 得到的 MAGMA 消融版本 (F) 和 (G) 的结果,证实了这两者都起着重要作用。
骨干网络的影响。我们将使用 VGGT 与另一种替代骨干网络——最近的先进模型 SAIL-Recon [8]——进行比较。该实验结果报告在表 2 的第 (H) 行。我们原始框架 (E) 所示的结果表明,选择 VGGT 能产生更好的结果。
表 1:消融实验——代理间融合策略的影响。结果在多代理设置下。
| 方法 | 训练设置 | Acc. | Comp. | RMSE | | :— | :— | :— | :— | :— | | (A) w/ RICP | × | 8.89 | 6.47 | 7.66 | | (B) w/ SL(4) | × | 13.66 | 11.67 | 18.94 | | (C) w/ L2W | Multi Agent | 9.71 | 7.16 | 9.19 | | (D) w/ MAGMA | Single Agent | 6.89 | 4.93 | 5.35 | | (E) MAGiSt3R | Multi Agent | 5.37 | 3.36 | 3.87 | | (F) w/o Lgeo | Multi Agent | 5.88 | 3.60 | 3.97 | | (G) w/o Spatial Tokens | Multi Agent | 6.04 | 3.71 | 4.19 |
表 2:消融实验——骨干网络和 PGO 的影响。结果在多代理设置下。
| 方法 | Acc. | Comp. | RMSE | | :— | :— | :— | :— | | (E) MAGiSt3R | 5.37 | 3.36 | 3.87 | | (H) w/ SAIL-Recon [8] | 5.97 | 3.88 | 4.06 | | (I) w/ PGO | 6.18 | 4.11 | 5.65 |
第 12 页
12 龚等人
表 3:ReplicaMultiagent 上的重建结果。⨿表示在代理间级别使用 RICP。最佳结果以粗体显示,分别为第一、第二和第三名。
| Methods | Setting | Apart 0 Acc. | Apart 0 Comp. | Apart 1 Acc. | Apart 1 Comp. | Apart 2 Acc. | Apart 2 Comp. | Office 0 Acc. | Office 0 Comp. | Avg. Acc. | Avg. Comp. | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | DUSt3R [48] | | 6.95 | 3.85 | 15.78 | 12.29 | 10.15 | 9.17 | 12.63 | 12.43 | 11.38 | 9.44 | | MASt3R [24] | | 5.01 | 3.00 | 9.51 | 3.98 | 7.32 | 3.91 | 6.14 | 5.30 | 7.00 | 4.05 | | SLAM3R [29] | Agent 1 | 5.17 | 4.03 | 9.18 | 6.91 | 4.97 | 4.94 | 10.18 | 7.10 | 7.38 | 5.75 | | MASt3R-SLAM [33] | | 10.91 | 6.35 | 10.38 | 3.24 | 9.68 | 3.28 | 7.58 | 6.91 | 9.64 | 4.94 | | VGGT-SLAM [30] | | 4.59 | 2.89 | 15.64 | 9.66 | 9.87 | 4.15 | 6.06 | 4.80 | 9.04 | 5.38 | | MAGiSt3R (ours) | | 4.07 | 2.56 | 5.57 | 3.05 | 3.96 | 3.35 | 5.01 | 2.95 | 4.65 | 2.98 | | DUSt3R [48] | | 6.87 | 4.69 | 14.14 | 11.82 | 7.88 | 5.02 | 6.98 | 6.26 | 8.97 | 6.95 | | MASt3R [24] | | 4.95 | 2.48 | 15.78 | 12.87 | 10.87 | 12.39 | 7.66 | 7.68 | 9.82 | 8.86 | | SLAM3R [29] | Agent 2 | 7.24 | 7.68 | 15.18 | 14.80 | 8.73 | 8.73 | 5.98 | 4.36 | 9.28 | 8.89 | | MASt3R-SLAM [33] | | 13.09 | 4.66 | 21.57 | 23.93 | 13.19 | 14.91 | 8.06 | 8.31 | 13.98 | 12.95 | | VGGT-SLAM [30] | | 4.29 | 2.37 | 14.41 | 11.95 | 6.99 | 6.15 | 7.45 | 6.78 | 8.29 | 6.81 | | MAGiSt3R (ours) | | 3.43 | 1.79 | 9.26 | 8.94 | 6.89 | 5.72 | 5.26 | 4.57 | 6.21 | 5.26 |
DUSt3R [48] ⨿ 11.79 8.72 15.21 11.71 11.24 10.24 11.80 9.03 12.51 9.92 MASt3R [24] ⨿ 6.29 4.83 12.97 9.31 12.03 10.48 9.18 8.01 10.12 8.16 SLAM3R [29] ⨿ Multi-Agent 18.09 10.79 16.57 15.25 14.38 6.44 8.11 3.75 14.29 9.06 MASt3R-SLAM [33] ⨿ 15.76 6.52 16.26 10.81 12.69 10.97 10.59 9.16 13.83 9.37 VGGT-SLAM [30] ⨿ 8.60 5.92 15.97 13.00 10.23 6.86 10.65 7.97 11.36 8.44 MAGiSt3R (ours) 4.20 2.57 8.32 4.26 5.79 4.61 3.18 2.01 5.37 3.36
VGGT-SLAM [30] + RICP MASt3R [24] + RICP Ground Truth
SLAM3R [29] + RICP DUSt3R [48] + RICP MAGiSt3R (Ours) 图 4:定性结果——ReplicaMultiagent 上的稠密点云图。 我们在 Apart 0 序列上展示了多代理设置下的重建结果。 我们的方法生成了更准确且一致的全局点云图。
PGO 的影响。最后,我们测量了位姿图优化(PGO)对我们 SLAM 系统的影响。如表 2 第 (I) 行所示,移除该组件会导致精度显著下降,其影响比主干网络的选择更大。然而,通过比较表 1 中的 (I) 与 (A)、(B) 和 (C) 项,我们可以看出,即使没有 PGO,MAGMA 仍然优于现有的融合策略。
4.2 与最先进方法的比较
我们现在将 MAGiSt3R 与现有的前馈模型进行比较。 ReplicaMultiagent 上的 3D 重建。在表 3 中,我们比较了我们的方法与最先进的前馈方法在 ReplicaMultiagent 数据集上的 3D 重建质量,该数据集包含单房间和
第 13 页
MAGiSt3R 13
表 4:ReplicaMultiagent(单代理)上的跟踪结果。
代理 1 代理 2 方法 Apart 0 Apart 1 Apart 2 Office 0 平均 Apart 0 Apart 1 Apart 2 Office 0 平均
DUSt3R [48] 6.76 8.87 7.30 21.04 10.99 8.18 9.93 10.97 4.31 8.35 MASt3R [24] 2.52 4.46 3.62 9.56 5.04 3.58 3.10 3.45 2.08 3.05 SLAM3R [29] 7.25 30.62 8.77 18.43 16.27 14.12 27.94 11.35 18.65 18.02 MASt3R-SLAM [33] 4.19 3.79 6.04 10.57 6.15 7.90 9.29 5.02 5.40 6.90 VGGT-SLAM [30] 2.96 8.90 5.77 9.07 6.68 2.64 7.86 5.89 3.63 5.01 MAGiSt3R (ours) 2.54 6.99 3.88 2.69 4.03 1.87 4.06 3.23 2.48 2.91
多房间环境。在上半部分,我们报告了独立运行的单代理所实现的重建精度和完整性——即没有任何代理间通信——下半部分则展示了在多代理设置下取得的结果。值得注意的是,单代理单独取得的结果与多代理系统整体取得的结果并不直接可比,因为它们覆盖了整个场景的不同部分。专注于单代理时,MAGiSt3R 在代理 1 和代理 2 的轨迹中均优于任何前馈模型,仅有少数例外——Apart 2 和 Office 0 的完整性,这支持了 MAGMA 在代理内层级聚合子地图的优越能力。此外,当转向多代理设置时,我们的框架表现出色,大幅优于所有提出的基线方法,证实了我们的 MAGMA 模型在代理间层级同样有效,从而确立了其作为单代理和多代理系统关键组件的地位。这一事实通过图 4 得到了定性确认:与其他方法相比,MAGiSt3R 的重建暴露出显著更少的伪影;相反,其他方法在正确对齐 Apart 0 序列中探索的两个房间时遇到困难,经常重建出场景的重复部分,或者某些部分相对于全局点云地图发生显著漂移。
ReplicaMultiagent 上的跟踪。 表 5:Replica- 表 4 报告了跟踪精度 Multiagent(多代理)上的跟踪结果。*表示平均 ReplicaMultiagent,由相同的方法 值,排除 Apart 2 以与 [54] 进行比较。 在单代理设置下部署时。尽管 MAGiSt3R 在个别场景上 多代理 取得了混合结果,但我们的方法在两个代理上仍实现了平均 Apart 0 Apart 1 Apart 2 Office 0 平均 最佳性能。此外,表 5 扩展到了 RGB-D (校准) 多代理设置,还报告了现有的 RGB-D SLAM Swarm-SLAM [23] 1.80 5.56 5.61 1.42 3.60 系统,这些系统是为该特定设置设计的 [17,23,52] CP-SLAM [17] 0.95 1.42 1.91 0.65 1.23 作为上限。在这种情况下,MAG- MAGiC-SLAM [52] RGB0.16(未校准)0.26 0.32 0.27 0.25 iSt3R 一致地优于所有其他多代理前馈基线,证实了 MAGMA 有效 DUSt3R [48] ⨿ 8.35 12.27 11.43 14.28 11.58 改善了代理间聚合。平均而言,MAGiSt3R 也优于 MASt3RSLAM3R [24][29] ⨿⨿ 11.724.02 31.926.58 11.745.66 20.407.69 18.945.99 同期的 MA-MASt3R-SLAM [54],非常接近 RGB-D 系统。 MASt3R-SLAMVGGT-SLAM [30][33]⨿ ⨿ 6.963.42 10.348.85 7.397.46 7.469.44 7.158.17 MA-MASt3R-SLAM [54] 5.24 5.48 – 2.57 – /4.43* MAGiSt3R (ours) 2.75 5.81 3.84 3.09 3.87/3.88*
第 14 页
14 Gong 等人
表 6:AriaMultiagent 上的跟踪结果(单代理)。
代理 1 代理 2 代理 3 方法 房间 0 房间 1 平均 房间 0 房间 1 平均 房间 0 房间 1 平均
DUSt3R [48] 3.90 24.21 14.06 12.19 19.97 16.08 26.46 17.78 22.12 MASt3R [24] 2.95 29.12 16.04 8.47 16.12 12.30 8.82 14.69 11.76 SLAM3R [29] 4.16 10.17 7.17 7.10 3.72 5.41 6.65 3.36 5.01 MASt3R-SLAM [33] 3.92 15.31 9.62 9.28 47.65 28.47 9.87 15.22 12.55 VGGT-SLAM [30] 3.78 9.30 6.54 11.55 9.15 10.35 11.01 5.66 8.34 MAGiSt3R (ours) 2.89 2.88 2.89 6.11 1.86 3.99 4.26 1.65 2.96
AriaMultiagent。我们将评估扩展至 AriaMultiagent,这是一个支持多达 3 个代理实验的真实世界第一人称数据集。在表 6 中,我们报告了在单代理设置下独立运行的前馈方法所实现的跟踪精度。与 ReplicaMultiagent 实验不同,在这种情况下,MAGiSt3R 在房间 0 和房间 1 场景中,以及任何单代理轨迹上,均一致优于其他前馈方法。 在表 7 中,我们通过收集多代理设置的结果来完善我们的评估。 表 7:Aria- 再次,我们在顶部报告 RGB-D 系 Multiagent 上的跟踪结果(多代理)。 统作为参考。我们可以看出, 多代理 MAGiSt3R 一致优于任何其他多代理前 方法 房间 0 房间 1 平均 馈方法,且优势显著, RGB-D (已校准) 特别是与 MA-MASt3R-SLAM [54] 相比, Swarm-SLAM [17] CP-SLAM [23] 6.45 3.03 2.87 4.78 2.95 5.62 差距尤为明显。这进一步证实了 MAGiC-SLAM [52] 1.15 0.65 0.90 MAGMA 所发挥的关键作用,其表现 RGB (未校准) 优于先前框架和当前多代理系统 DUSt3R [48] ⨿ 所部署的融合策略。 MASt3R [24] ⨿ 15.46 7.80 20.68 21.36 14.24 18.41 SLAM3R [29] ⨿ MASt3R-SLAM [33] ⨿ 6.97 9.13 29.34 6.31 19.24 6.64 VGGT-SLAM [30] ⨿ 9.59 8.47 9.03 MA-MASt3R-SLAM [54] 7.59 31.15 19.37 MAGiSt3R (ours) 4.68 2.36 3.52
补充材料。请参阅补充材料以获取更多实验和见解。
4.3 与 RGB-D 系统的运行时比较
表 8:运行时分析。在表 8 中,我们在双代理设置下对 ReplicaMultiagent 进行了运行时分析。 方法 FPS RGB-D SLAM 系统实现了更高的跟踪 CP-SLAM [17]* < 1 精度,但现有解决方案的 FPS 非常低。 MAGiC-SLAM [52]* 2 相比之下,VGGT-SLAM [30] 展示了前馈 DUSt3R [48] ⨿ < 1 模型的完整速度潜力,尽管在精度上稍显不足。 MASt3R [24] ⨿ < 1 ⨿ SLAM3R [29] 3 MASt3R-SLAM [33] ⨿ 9 最后,MA-MASt3R-SLAM [54] 和 VGGT-SLAM [30] ⨿ 23 MAGiSt3R 均以约 10 FPS 运行,尽管我们的 MA-MASt3R-SLAM* [54] 11 框架在 AriaMultiagent 上检索到显著更准确的轨迹。 MAGiSt3R (ours) 9
第 15 页
MAGiSt3R 15
- *
*
* (俯视图)
代理间存在重叠区域
代理 1 代理 2 起点 终点
- 包含移动目标
图 5:在重叠区域有限的自采集场景上的实验。MAGiSt3R 能够有效实现全局一致的场景重建。
5 自定义序列的定性结果
我们以真实视频序列的定性结果作为结尾,这些序列由 2 个代理在低重叠度(约 15%)且场景中存在移动目标的情况下采集,从而构成了一个极具挑战性的场景,考验了标准多代理重建管道的极限。图 5 展示了 MAGiSt3R 的结果,尽管面临上述挑战,其结果在定性上仍保持一致。
6 结论
在本文中,我们提出了首个多代理前馈式 RGB 3D 重建系统 MAGiSt3R,在室内场景中实现了高质量的协作场景重建和相机跟踪。我们的前馈式框架使系统能够以接近 10 FPS 的速度重建场景,所提出的 MAGMA 模型使 MAGiSt3R 能够合并代理内和代理间的子地图。我们的实验表明,MAGiSt3R 实现了精确的重建和相机跟踪。 局限性与未来工作。我们当前的框架以及基线方法并非旨在应对代理面临截然不同的条件——例如,白天与夜晚、恶劣天气。我们计划扩展这一方面,可能通过引入新的基准测试,并在更大规模(> 3 个代理)下评估多代理系统。
第 16 页
16 龚等人
参考文献
1. Arrigoni, F.: A taxonomy of structure from motion methods. arXiv preprint arXiv:2505.15814 (2025) 3 2. Avetisyan, A., Xie, C., Howard-Jenkins, H., Yang, T.Y., Aroudj, S., Patra, S., Zhang, F., Frost, D., Holland, L., Orme, C., et al.: Scenescript: Reconstructing scenes with an autoregressive structured language model. In: European Conference on Computer Vision. pp. 247–263. Springer (2024) 10 3. Campos, C., Elvira, R., Rodríguez, J.J.G., Montiel, J.M., Tardós, J.D.: Orb-slam3: An accurate open-source library for visual, visual–inertial, and multimap slam. IEEE transactions on robotics 37(6), 1874–1890 (2021) 2, 3 4. Chen, D., Li, H., Ye, W., Wang, Y., Xie, W., Zhai, S., Wang, N., Liu, H., Bao, H., Zhang, G.: Pgsr: Planar-based gaussian splatting for efficient and high-fidelity surface reconstruction. arXiv preprint arXiv:2406.06521 (2024) 3 5. Chen, Y., Xu, H., Zheng, C., Zhuang, B., Pollefeys, M., Geiger, A., Cham, T.J., Cai, J.: Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images. In: European Conference on Computer Vision. pp. 370–386. Springer (2024) 3 6. Chen, Y., Zheng, C., Xu, H., Zhuang, B., Vedaldi, A., Cham, T.J., Cai, J.: Mvs- plat360: Feed-forward 360 scene synthesis from sparse views. Advances in Neural Information Processing Systems 37, 107064–107086 (2024) 3 7. Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nießner, M.: Scannet: Richly-annotated 3d reconstructions of indoor scenes. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 5828–5839 (2017) 10 8. Deng, J., Li, H., Xie, T., Ren, W., Zhang, Q., Tan, P., Guo, X.: Sail-recon: Large sfm by augmenting scene regression with localization. arXiv preprint arXiv:2508.17972 (2025) 11 9. Deng, T., Pan, Y., Yuan, S., Li, D., Wang, C., Li, M., Chen, L., Xie, L., Wang, D., Wang, J., Civera, J., Wang, H., Chen, W.: What is the best 3d scene rep- resentation for robotics? from geometric to foundation models. arXiv preprint arXiv:2512.03422 (2025) 4 10. Deng, T., Shen, G., Xun, C., Yuan, S., Jin, T., Shen, H., Wang, Y., Wang, J., Wang, H., Wang, D., et al.: Mne-slam: Multi-agent neural slam for mobile robots. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 1485–1494 (2025) 2, 4, 10 11. Engel, J., Schöps, T., Cremers, D.: Lsd-slam: Large-scale direct monocular slam. In: European conference on computer vision. pp. 834–849. Springer (2014) 2 12. Gong, Z., Li, X., Tosi, F., Han, J., Mattoccia, S., Cai, J., Poggi, M.: Ov3r: Open- vocabulary semantic 3d reconstruction from rgb videos. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 34206– 34216 (2026) 2, 4 13. Gong, Z., Li, X., Tosi, F., Zhang, Y., Mattoccia, S., Wu, J., Poggi, M.: Dino- slam: Dino-informed rgb-d slam for neural implicit and explicit representations. In: European Conference on Computer Vision (2026) 3 14. Gong, Z., Tosi, F., Zhang, Y., Mattoccia, S., Poggi, M.: Hs-slam: Hybrid rep- resentation with structural supervision for improved dense slam. In: 2025 IEEE International Conference on Robotics and Automation (ICRA). pp. 8464–8470. IEEE (2025) 3 15. Guédon, A., Lepetit, V.: Sugar: Surface-aligned gaussian splatting for efficient 3d mesh reconstruction and high-quality mesh rendering. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 5354– 5363 (2024) 3
第 17 页
MAGiSt3R 17
16. Ha, S., Yeon, J., Yu, H.: Rgbd gs-icp slam. In: European Conference on Computer Vision. pp. 180–197. Springer (2024) 4 17. Hu, J., Mao, M., Bao, H., Zhang, G., Cui, Z.: Cp-slam: Collaborative neural point- based slam system. Advances in Neural Information Processing Systems 36, 39429– 39442 (2023) 2, 4, 10, 13, 14 18. Huang, H., Li, L., Cheng, H., Yeung, S.K.: Photo-slam: Real-time simultaneous localization and photorealistic mapping for monocular stereo and rgb-d cameras. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21584–21593 (2024) 4 19. Izquierdo, S., Civera, J.: Optimal transport aggregation for visual place recogni- tion. In: Proceedings of the ieee/cvf conference on computer vision and pattern recognition. pp. 17658–17668 (2024) 6 20. Karrer, M., Schmuck, P., Chli, M.: Cvi-slam—collaborative visual-inertial slam. IEEE Robotics and Automation Letters 3(4), 2762–2769 (2018) 4 21. Keetha, N., Karhade, J., Jatavallabhula, K.M., Yang, G., Scherer, S., Ramanan, D., Luiten, J.: Splatam: Splat track & map 3d Gaussians for dense rgb-d slam. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21357–21366 (2024) 4 22. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G.: 3d gaussian splatting for real-time radiance field rendering. ACM Transactions on Graphics 42(4), 1–14 (2023) 2, 3 23. Lajoie, P.Y., Beltrame, G.: Swarm-slam: Sparse decentralized collaborative si- multaneous localization and mapping framework for multi-robot systems. IEEE Robotics and Automation Letters 9(1), 475–482 (2023) 4, 13, 14 24. Leroy, V., Cabon, Y., Revaud, J.: Grounding image matching in 3d with mast3r. In: European Conference on Computer Vision. pp. 71–91. Springer (2024) 4, 10, 12, 13, 14 25. Li, X., Gong, Z., Tosi, F., Poggi, M., Mattoccia, S., Liu, D., Wu, J.: Stereo 3d gaussian splatting slam for outdoor urban scenes. arXiv preprint arXiv:2507.23677 (2025) 4 26. Li, Z., Müller, T., Evans, A., Taylor, R.H., Unberath, M., Liu, M.Y., Lin, C.H.: Neuralangelo: High-fidelity neural surface reconstruction. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 8456– 8465 (2023) 3 27. Lindenberger, P., Sarlin, P.E., Larsson, V., Pollefeys, M.: Pixel-perfect structure- from-motion with featuremetric refinement. In: Proceedings of the IEEE/CVF in- ternational conference on computer vision. pp. 5987–5997 (2021) 2, 3 28. Liu, S., Yu, Y., Pautrat, R., Pollefeys, M., Larsson, V.: 3d line mapping revisited. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21445–21455 (2023) 2, 3 29. Liu, Y., Dong, S., Wang, S., Yin, Y., Yang, Y., Fan, Q., Chen, B.: Slam3r: Real- time dense scene reconstruction from monocular rgb videos. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 16651–16662 (2025) 2, 4, 10, 11, 12, 13, 14 30. Maggio, D., Lim, H., Carlone, L.: Vggt-slam: Dense rgb slam optimized on the sl (4) manifold. arXiv preprint arXiv:2505.12549 (2025) 1, 2, 4, 10, 11, 12, 13, 14 31. Matsuki, H., Murai, R., Kelly, P.H., Davison, A.J.: Gaussian splatting slam. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recog- nition. pp. 18039–18048 (2024) 4
第 18 页
18 Gong 等人
32. Mildenhall, B., Srinivasan, P.P., Tancik, M., Barron, J.T., Ramamoorthi, R., Ng, R.: Nerf: Representing scenes as neural radiance fields for view synthesis. In: Eu- ropean Conference on Computer Vision. pp. 405–421. Springer (2020) 2, 3 33. Murai, R., Dexheimer, E., Davison, A.J.: Mast3r-slam: Real-time dense slam with 3d reconstruction priors. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 16695–16705 (2025) 4, 10, 12, 13, 14 34. Peng, Z., Shao, T., Liu, Y., Zhou, J., Yang, Y., Wang, J., Zhou, K.: Rtg-slam: Real- time 3d reconstruction at scale using gaussian splatting. In: ACM SIGGRAPH 2024 Conference Papers. pp. 1–11 (2024) 4 35. Ranftl, R., Bochkovskiy, A., Koltun, V.: Vision transformers for dense prediction. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 12179–12188 (2021) 8 36. Sandström, E., Li, Y., Van Gool, L., Oswald, M.R.: Point-slam: Dense neural point cloud-based slam. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 18433–18444 (2023) 4 37. Schmuck, P., Chli, M.: Ccm-slam: Robust and efficient centralized collaborative monocular simultaneous localization and mapping for robotic teams. Journal of Field Robotics 36(4), 763–781 (2019) 4 38. Schonberger, J.L., Frahm, J.M.: Structure-from-motion revisited. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 4104–4113 (2016) 2, 3 39. Snavely, N., Seitz, S.M., Szeliski, R.: Photo tourism: exploring photo collections in 3d. In: ACM siggraph 2006 papers, pp. 835–846 (2006) 2, 3 40. Sucar, E., Liu, S., Ortiz, J., Davison, A.J.: imap: Implicit mapping and position- ing in real-time. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 6229–6238 (2021) 4 41. Sun, L.C., Bhatt, N.P., Liu, J.C., Fan, Z., Wang, Z., Humphreys, T.E., Topcu, U.: Mm3dgs slam: Multi-modal 3d gaussian splatting for slam using vision, depth, and inertial measurements. In: 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). pp. 10159–10166. IEEE (2024) 4 42. Teed, Z., Deng, J.: Droid-slam: Deep visual slam for monocular, stereo, and rgb- d cameras. Advances in neural information processing systems 34, 16558–16569 (2021) 2, 3 43. Tosi, F., Zhang, Y., Gong, Z., Sandström, E., Mattoccia, S., Oswald, M.R., Poggi, M.: How nerfs and 3d gaussian splatting are reshaping slam: a survey. arXiv preprint arXiv:2402.13255 4, 1 (2024) 2, 3 44. Wang, F., Zhu, Q., Chang, D., Gao, Q., Han, J., Zhang, T., Hartley, R., Pollefeys, M.: Learning-based multi-view stereo: A survey. arXiv preprint arXiv:2408.15235 (2024) 3 45. Wang, H., Agapito, L.: 3d reconstruction with spatial memory. In: 2025 Interna- tional Conference on 3D Vision (3DV). pp. 78–89. IEEE (2025) 4 46. Wang, H., Wang, J., Agapito, L.: Co-slam: Joint coordinate and sparse parametric encodings for neural real-time slam. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 13293–13302 (2023) 4 47. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: Visual geometry grounded transformer. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 5294–5306 (2025) 3, 4, 5 48. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r: Geometric 3d vision made easy. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 20697–20709 (2024) 2, 4, 8, 10, 12, 13, 14
第 19 页
MAGiSt3R 19
49. Yan, C., Qu, D., Xu, D., Zhao, B., Wang, Z., Wang, D., Li, X.: Gs-slam: Dense vi- sual slam with 3d gaussian splatting. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 19595–19604 (2024) 4 50. Yang, X., Li, H., Zhai, H., Ming, Y., Liu, Y., Zhang, G.: Vox-fusion: Dense tracking and mapping with voxel-based neural implicit representation. In: 2022 IEEE In- ternational Symposium on Mixed and Augmented Reality (ISMAR). pp. 499–507. IEEE (2022) 4 51. Yeshwanth, C., Liu, Y.C., Nießner, M., Dai, A.: Scannet++: A high-fidelity dataset of 3d indoor scenes. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 12–22 (2023) 10 52. Yugay, V., Gevers, T., Oswald, M.R.: Magic-slam: Multi-agent gaussian globally consistent slam. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 6741–6750 (2025) 2, 4, 9, 10, 11, 13, 14 53. Zhang, Y., Tosi, F., Mattoccia, S., Poggi, M.: Go-slam: Global optimization for con- sistent 3d instant reconstruction. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 3727–3737 (2023) 4 54. Zhou, Y., Wu, H.: Multi-agent monocular dense slam with 3d reconstruction priors. arXiv preprint arXiv:2511.19031 (2025) 10, 13, 14 55. Zhu, L., Li, Y., Sandström, E., Huang, S., Schindler, K., Armeni, I.: Loopsplat: Loop closure by registering 3d gaussian splats. In: 2025 International Conference on 3D Vision (3DV). pp. 156–167. IEEE (2025) 4 56. Zhu, Z., Peng, S., Larsson, V., Xu, W., Bao, H., Cui, Z., Oswald, M.R., Pollefeys, M.: Nice-slam: Neural implicit scalable encoding for slam. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 12786– 12796 (2022) 4