GLAM-SLAM:解耦架构如何突破3DGS长序列建图的内存瓶颈

快速导读:GLAM-SLAM提出了一种解耦的3DGS SLAM系统,通过光流引导的锚点稠密化和局部MLP空间分解,实现了长序列户外场景的实时、低内存占用且高保真的三维重建。

在三维视觉领域,3D Gaussian Splatting (3DGS) 因其卓越的渲染质量和速度而备受瞩目。然而,将其应用于单目SLAM系统时,长序列户外场景的内存爆炸和追踪鲁棒性问题成为主要瓶颈。GLAM-SLAM提出了一种解耦架构,旨在解决这些挑战。

该系统通过前端ORB-SLAM2进行实时追踪,后端独立线程进行高斯映射。引入Flow-Guided Densification和Localized MLP Initialization,GLAM-SLAM在保持实时性的同时,显著降低了内存占用,实现了高保真的长序列重建。

英文题目:GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition

论文出处:arXiv 每日论文精选 · arXiv:2607.21416

原始论文:PDF / 论文页面

对应视频标题:GLAM-SLAM:解耦架构如何突破3DGS长序列建图的内存瓶颈|推荐指数:★★★★★

这篇论文解决什么问题?

传统稀疏SLAM系统如ORB-SLAM2,虽然追踪稳健,但生成的地图缺乏纹理细节。而基于NeRF或早期3DGS的方法,虽然能生成高质量渲染,但计算昂贵且内存占用高,难以处理长轨迹中的光照变化和大规模场景。

现有3DGS SLAM方法如PhotoSLAM和GigaSLAM,在长序列上常因内存耗尽而终止。MonoGS等早期方法在长序列上表现不佳。因此,如何在保持实时性的同时,实现低内存占用和高保真的长序列重建,是一个亟待解决的问题。

GLAM-SLAM的核心挑战在于如何有效地初始化高斯锚点,并管理大规模场景中的内存占用。稀疏特征初始化导致的几何密度不匹配,以及大范围场景的多样性,都是需要克服的难点。

核心创新

  • Flow-Guided Densification Module:利用光流恢复极线一致的对应关系,解决稀疏SLAM特征导致的3DGS初始化偏差。
  • Localized MLP Initialization:通过空间分解策略,为不同区域分配独立的MLP参数集,缓解灾难性遗忘并适应户外光照变化。
  • Decoupled Architecture:追踪与建图完全解耦,确保前端追踪的实时性和鲁棒性,同时允许后端在专用GPU上进行高保真重建。

方法概览

采用解耦架构:前端使用ORB-SLAM2进行实时追踪,后端使用独立的Gaussian Mapper线程。引入Flow-Guided Densification模块利用光流和极线约束稠密化初始锚点,并采用Localized MLP Initialization策略,将场景划分为多个区域,每个区域使用独立的MLP预测高斯参数,以应对大范围场景的多样性。

  • Decoupled Architecture:系统采用解耦设计,前端ORB-SLAM2负责实时追踪,后端Gaussian Mapper线程独立进行高斯映射。这种设计确保了前端追踪的实时性和鲁棒性,同时允许后端在专用GPU上进行高保真重建。
  • Flow-Guided Densification:该模块利用光流和极线约束,稠密化初始锚点。通过恢复极线一致的对应关系,解决了稀疏SLAM特征导致的3DGS初始化偏差,提高了地图的几何密度。
  • Localized MLP Initialization:将场景划分为多个区域,每个区域使用独立的MLP预测高斯参数。这种空间分解策略缓解了灾难性遗忘,并适应了户外场景的光照变化。
  • Anchor Grid Integration:后端线程将稀疏ORB-SLAM2点与光流稠密化点整合,构建锚点网格。这种整合方式提高了地图的完整性和一致性。

逐图理解论文

失败案例

失败案例
Fig. 4. Qualitative rendering comparison on KITTI Odometry Seq. 08: Rows correspond to frames 500, 2000, and 4000. PhotoSLAM (a) exhibits significant rendering degradation over time. PhotoSLAM (a) and GigaSLAM (b) terminate due to memory exhaustion after 2000 and 3200 frames, respectively. MonoGS fails on this sequence and is not included. In contrast, our method maintains consistent rendering quality throughout all 4071 frames.

图4展示了KITTI Odometry Seq. 08上的定性渲染比较。PhotoSLAM和GigaSLAM因内存耗尽而终止,而GLAM-SLAM在整个4071帧序列中保持了稳定的渲染质量。

核心贡献

核心贡献
Fig. 2. GLAM (Gaussian LArge-scale Mapping)-SLAM system overview: Our system follows a decoupled design with an ORB-SLAM2 thread serving as the real-time front-end and a Gaussian Mapper thread that constructs its anchor grid by integrating sparse ORB-SLAM2 points with flow-densified points.

图2概述了GLAM-SLAM系统架构。前端ORB-SLAM2线程负责实时追踪,后端Gaussian Mapper线程通过整合稀疏ORB-SLAM2点和光流稠密化点构建锚点网格。

最强结论

最强结论
Fig. 5. Trajectory comparison on KITTI Seqs. 00, 05: GLAM-SLAM is the only method that completes the entire 4541 and 2761-frame sequences.

图5展示了KITTI Seqs. 00和05上的轨迹比较。GLAM-SLAM是唯一完成整个4541和2761帧序列的方法,证明了其在长序列上的鲁棒性。

实验如何设计?

  • 数据集:在KITTI Odometry、Oxford RobotCar和Málaga数据集上进行评估。
  • 对比方法:包括PhotoSLAM、GigaSLAM和MonoGS。
  • 评估指标:PSNR、SSIM、LPIPS、FPS、峰值GPU内存占用及轨迹误差(ATE)。
  • 硬件环境:评估硬件为RTX 5090 (32GB VRAM)。

关键结果与论文证据

  • 在KITTI Odometry Seq. 08上,GLAM-SLAM全程渲染4071帧,而PhotoSLAM和GigaSLAM分别在2000和3200帧因内存耗尽终止。这表明GLAM-SLAM在长序列上的内存效率显著优于现有方法。
  • KITTI平均PSNR为17.307,优于GigaSLAM (pre-opt) 的15.507,提升约11.6%。Oxford RobotCar平均PSNR为23.108,优于GigaSLAM (pre-opt) 的19.973,提升约26.6%。
  • KITTI平均峰值GPU内存为11.6 GiB,低于GigaSLAM (pre-opt) 的18.7 GiB。这表明GLAM-SLAM在保持高质量渲染的同时,显著降低了内存占用。
  • KITTI平均FPS约10,实现实时运行。这表明GLAM-SLAM在保持实时性的同时,实现了高保真的重建。

阅读时需要注意

  • 光流模块占用约3 GiB固定显存,增加了基础内存开销。
  • 在极端长序列或剧烈光照变化下,局部MLP的划分策略可能仍需优化。
  • 依赖ORB-SLAM2前端,在纹理缺失区域可能面临追踪丢失风险。

关联工作

  • PhotoSLAM:实时但内存占用高,长序列易崩溃。
  • GigaSLAM:长序列支持好但非实时,内存占用极高。
  • MonoGS:早期3DGS SLAM方法,长序列表现差。
  • Scaffold-GS:方法基础,采用锚点网格表示以节省内存。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

已获 2026 年 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 录用。 © 2026 IEEE。允许个人使用本材料。对于任何其他用途,包括在任何当前或未来的媒体中重新印刷/重新出版本材料用于广告或促销目的、创建新的集体作品、用于转售或向服务器或列表重新分发,或在其他作品中重用本作品的任何受版权保护的组件,必须获得 IEEE 的许可。

GLAM-SLAM:通过流稠密化与空间分解实现实时高斯大规模建图

Panagiotis Mermigkas1,2,3, Argyris Manetas2 和 Petros Maragos1,2,3

摘要— 现有的基于高斯泼溅(Gaussian Splatting)的单目同时定位与建图(SLAM)系统要么针对短序列定制,要么无法实时运行,要么存在令人望而却步的 GPU 内存需求,限制了其在现实长时场景中的适用性。为解决这一问题,我们提出了 GLAM-SLAM,这是一种面向大规模户外场景的实时、解耦式高斯泼溅 SLAM 系统。我们采用鲁棒的基于特征的 SLAM 前端以确保轻量级跟踪,而在建图方面,我们采用结构化的稀疏锚点网格(Anchor Grid)表示,以确保可扩展的操作并在长序列中保持场景的一致性。为了满足 3D高斯泼溅 (3DGS) 对密集初始化的要求,我们引入了一种基于几何的流稠密化(Flow Densification)锚定策略,利用对极约束。此外,通过将建图视为多场景问题,我们提出了一种场景分区策略,该策略通过多层感知机(MLP)初始化引入强大的空间归纳偏置,以生成分布式的高斯分布。我们在具有挑战性的长序列 KITTI Odometry、Oxford RobotCar 和 M´alaga 数据集上评估了我们的系统。广泛的消融实验和比较表明,与表现第二好的方法相比,重建质量提高了 15%,同时保持了实时性能并能够扩展到更长的序列。代码已公开提供,以造福社区*。

图 1. 从未见轨迹进行新视角合成:这些渲染图由 KITTI(顶部)和 Oxford RobotCar(底部)数据集中不存在的相机姿态生成,展示了我们基于 3DGS 的地图在任何后优化情况下均具有强大的泛化能力和几何一致性。

I. 引言

视觉 SLAM 系统在定位精度、跟踪速度和鲁棒性方面取得了显著改进,同时保持了实时执行的要求。除了这些改进之外,地图可表示性的演变,从稀疏和半密集表示 [1]、[2],到基于 NeRF 的方法 [3]、[4],并最终发展到 3DGS SLAM 系统 [5]、[6]、[7],使得 3D 地图的质量越来越高。然而,有效扩展 3DGS 以用于长持续时间序列的 photorealistic(照片级真实感)重建仍然是一个未被充分探索的领域。

历史上,早期系统优先考虑计算效率、准确的自运动估计以及通过稀疏、基于特征的表示 [1] 实现的鲁棒性。然而,它们在需要密集几何或语义理解的任务中的局限性,催了半密集点云 [8] 和连续表面 [2] 方法的发展,以利用直接光度重建环境。

尽管在地图质量方面取得了这些进展,但密集 SLAM 系统仍然以资源密集型著称,即使仅用于跟踪,也需要大量的内存和 GPU 计算,这通常将它们限制在强大的硬件上。它们在动态环境中也极易失败,移动物体可能会引入严重的伪影并破坏地图。此外,它们对光度一致性的依赖使其容易受到过曝和运动模糊的影响。因此,虽然稀疏方法在轨迹精度和长期稳定性方面表现出色,但其地图通常无法用于交互;与此同时,密集方法提供了无与伦比的场景表示能力,但运营成本高昂且跟踪鲁棒性降低。

为了利用这两种范式的最佳属性,我们提出的系统建立在基于特征的 ORB-SLAM2 [1] 之上,并通过将并行化的 3DGS 重建模块锚定在这个鲁棒的稀疏支架上,从而区别于传统建图——该模块在专用 GPU 上运行,同时构建照片级真实感的密集地图,而不损害实时跟踪性能。

然而,经典的 3DGS 实现在应用于长序列、稀疏、基于特征的 SLAM 时存在两个固有的局限性。首先,稀疏跟踪中地标密度的缺乏为 3DGS 造成了几何密度不匹配,而 3DGS 传统上依赖于密集的初始点云

1 HERON – 希腊卓越机器人中心,阿瑞斯研究中心,希腊。 2 机器人研究所,阿瑞斯研究中心,希腊马里乌西。 3 电气与计算机工程,雅典国立技术大学,希腊雅典 15780 佐格拉夫。 pmermigkas@central.ntua.gr, a.manetas@athenarc.gr, maragos@cs.ntua.gr

  • 本项目由欧盟地平线欧洲(Horizon Europe)资助(资助号 101136568 – HERON)。

第 2 页

为了实现更快、更稳定的高斯优化,这是此前在 [9]、[10] 中观察到的一个挑战。其次,传统 3D高斯泼溅 (3DGS) 巨大的内存占用有效地将重建限制在单一、孤立的环境中。虽然像 Scaffold-GS [11] 这样的基于锚点的方法试图通过用一个全局 MLP 集合来表示多个高斯参数来解决这个问题,但它们往往难以应对长序列数据中固有的环境和光照变化。

在本工作中,我们首先提出了一种 Flow-Guided Densification 模块,该模块利用光流来恢复极线一致的相关性,从而解决初始化偏差问题。该模块在稀疏区域提供几何先验,确保对场景流形的均匀覆盖。此外,我们将长序列重建视为多场景挑战,并提出了一种空间条件策略,该策略将环境分区并为局部 MLP 集合分配任务以估计高斯参数,从而显著提高了跨各种大规模轨迹的重建保真度。我们的主要贡献如下:

  • 一种用于实时照片级真实感 SLAM 的解耦架构,具有可扩展且降低的 GPU 内存占用。
  • 一种用于高斯锚点初始化的 Flow-Guided Densification 模块,以及一种用于捕捉变化局部地图条件的区域自适应策略。
  • 对我们贡献的详细消融研究。
  • 在具有挑战性的户外长序列数据集上进行的广泛光度测量和计算评估。

实时生成精确且有意义的场景表示,同时不损害相机跟踪的准确性,仍然是视觉 SLAM 的核心焦点。为了克服稀疏地图的局限性,该领域深入研究了密集点云架构 [8]、[12] 和体积 TSDF 表示 [2]、[13]——这些方法独特地允许提取连贯的几何表面。虽然这两种范式都显著提高了整体场景的理解能力,但它们本质上难以捕捉细微的纹理和细节,导致重建结果缺乏照片级真实感。

神经辐射场 NeRF [14] 的开创性工作标志着迈向照片级真实感地图的一步,它证明了多层感知机 (MLP) 可以有效近似辐射场函数,在无需显式几何结构的情况下实现照片级真实感的新视角合成。由于其表示能力,后续的 SLAM 系统采用了这种方法 [15]、[3]、[4]、[16],以产生能够进行细粒度渲染、跟踪和照片级真实感场景重建的在线算法。尽管这些基于 NeRF 的方法在建模场景方面表现出令人印象深刻的性能,但由于需要对每条反投影射线进行网络推理,它们在渲染时计算成本高昂,并且缺乏可编辑性,因为场景修改需要重新训练整个模型。

最近的研究表明,人们对显式辐射场表示越来越感兴趣,其中最著名的是 [17] 开创性工作中的 3D高斯泼溅 (3DGS)。这种方法用一组可编辑的 3D 高斯来表示场景,每个高斯都具有空间、颜色和透明度信息,并使用可微分的基于瓦片的光栅化器来实现比神经网络等效方法更快的渲染和训练。这一发展引发了一系列后续工作 [18];2D-GS [19] 用其 2D 等效基元替换 3D 高斯以提高表面保真度,而 [11] 则用锚点替换它们,这些锚点生成多个高斯以减少内存使用、捕捉更精细的细节并加速收敛。具体而言,它引入了一个锚点的稀疏体素网格,其中包含编码局部辐射信息的描述符(类似于 [3]、[4]),用于通过全局 MLP 规定局部高斯特征。由于其效率,3D-GS 已被采用于具有早期耦合实现的 SLAM 系统中,这些系统绕过外部视觉里程计,直接针对不断演变的 Gaussian 映射执行基于渲染的跟踪优化,例如基于 3DGS 的 MonoGS [5] 和 SplaTAM [6] 以及基于 2DGS 的方法 [20]。

相比之下,解耦方法通过采用独立的跟踪模块来保持可靠的跟踪性能,并将 Gaussian 映射视为并行重建后端,从而减轻场景表示不完善带来的性能下降。这些方法包括:(i) 基于神经网络的模型,用于通过密集束调整 (DBA) 进行相关性匹配和相机跟踪,如 VINGS-Mono [21],或使用视差、尺度和姿态优化 (DSPO) 层,如 Splat-SLAM [22];(ii) 基于 ICP 的前端,如 RTG-SLAM [23];(iii) 基于 TSDF 融合的前端,如 GS-Fusion [24];以及 (iv) 基于稀疏特征的 SLAM 系统,如实时 PhotoSLAM [7]。

在本工作中,我们采用了解耦范式,这保留了跟踪的鲁棒性,防止映射误差降低定位精度,并增强了我们系统的整体模块化和灵活性,以应对无界场景中长期运行的需求。

尽管在高保真场景重建方面取得了显著进展,但大多数单目方法仍然局限于受限的室内环境。将这些方法扩展到无界、长期的序列(如驾驶场景)仍然是一个未被充分探索的领域,因为关键帧共视性的严重减少会放大跟踪漂移并损害全局地图的一致性。例如,VGGT-Long [25] 通过在关键帧的滑动窗口上应用 Sim(3) 变换来依次合并由视觉基础模型生成的相机姿态和点云,从而解决长户外序列中的 SLAM 问题;然而,这种离散表示本质上缺乏照片级真实感渲染的能力。另一种方法 GigaSLAM [26] 调整了细节层次 (LoD) 体素映射策略,以构建大规模场景的照片级真实感表示。然而,其对前端任务(如特征提取、匹配、深度估计和姿态估计)的重度 GPU 依赖,使得在线高斯优化的计算时间所剩无几,迫使其在终止时进行漫长的颜色细化阶段,这限制了其在在线场景中的应用。

第 3 页

我们的实时框架利用轻量级 SLAM 前端 ORB-SLAM2 为后端 Gaussian Mapper 提供高质量的结构性锚点,该后端在专用 GPU 上异步运行。此外,为了满足 3D-GS [9], [10] 的初始化要求,我们采用了一种几何可验证的方法,利用光流和对极约束来稠密化初始点云。这提供了高精度的几何先验,从根本上改进了 PhotoSLAM [7] 等噪声初始化方法,后者通过利用邻居的平均深度反投影未跟踪特征来解决稀疏性问题。最后,受用于捕捉高频细节 [27] 和扩展到大场景 [28] 的 NeRF 分区策略启发,我们通过为特定区域专用的多个 MLP 来仅控制局部高斯属性,从而缓解灾难性遗忘,确保在不覆盖先前映射区域的情况下对变化的户外条件进行建模。

\begin{figure}[h] \centering \includegraphics[width=\textwidth]{placeholder_fig2.png} \caption{GLAM (Gaussian LArge-scale Mapping)-SLAM 系统概览:我们的系统采用解耦设计,其中 ORB-SLAM2 线程作为实时前端,Gaussian Mapper 线程通过整合稀疏的 ORB-SLAM2 点与流稠密化点来构建其锚点网格。} \end{figure}

训练由 [17] 中定义的结合光度与结构相似性的目标函数引导:

$$ L = \lambda L_1 + (1 – \lambda) L_{SSIM} \quad (3) $$

该函数平衡了逐像素精度与结构一致性。

III. 方法论
A. 预备知识

根据 3D Gaussian Splatting (3DGS) 表示方法,场景被建模为一组各向异性 3D 高斯分布,具有位置 $\mu_i$、协方差矩阵 $\Sigma_i$、不透明度 $\alpha_i$,以及通过球谐函数 (SH) 系数表达的视图相关颜色。利用高效的微分光栅化过程,这些 3D 高斯被投影到 2D 图像平面上,从而实现高度并行的渲染和快速的光度损失优化。高斯可以通过自适应密度机制在训练过程中动态生成或剪枝。像素 $p$ 处的渲染颜色 $C(p)$ 是通过 $n$ 个投影的 2D 高斯进行 alpha 混合获得的:

$$ C(p) = \sum_{i=1}^{n} c_i \alpha_i(p) \prod_{j=1}^{i-1} (1 – \alpha_j(p)) \quad (1) $$

其中 $c_i$ 表示第 $i$ 个高斯的颜色,$\alpha_i(p)$ 表示其在像素 $p$ 处的不透明度,通过将投影的 2D 高斯与其对应的学习到的不透明度进行缩放来评估。

结构化高斯场景表示: 我们的 Gaussian Mapper 模块采用了 Scaffold-GS [11] 中引入的基于稀疏的方法,该方法将场景表示为锚点网格,在保持低内存需求的同时保留了潜在的几何完整性。每个锚点编码局部信息,包括一个可学习的特征描述符 $f_a \in \mathbb{R}^8$、一个缩放参数 $l_y$ 和 $k$ 个可训练的偏移向量,用于生成其关联的 $k$ 个高斯。所有高斯属性均由一组轻量级多层感知机 (MLP) 隐式预测,这些 MLP 以锚点特征描述符、锚点到相机的距离 $\delta_{ac}$ 和观察方向向量 $d_{ac}$ 为条件。对于位于 $x_c$ 的相机和位于 $x_a$ 的锚点,这些量定义为:

$$ \delta_{ac} = ||x_a – x_c||_2, \quad d_{ac} = \frac{x_a – x_c}{||x_a – x_c||_2} \quad (2) $$

B. 系统概览

我们的系统概览如图 2 所示。我们采用解耦设计,其中基于 GPU 的高斯映射模块独立于跟踪子系统运行,后者仅在 CPU 上运行。该系统依赖于多线程 ORB-SLAM2 框架,其跟踪、局部映射和回环检测线程并行运行。同时,Gaussian Mapping 线程维护体素化的高斯模型,并使用 Scaffold-GS [11] 的增量变体对其进行扩展。这种扩展是通过在每个关键帧整合 ORB-SLAM2 跟踪点 $P_1 \in \mathbb{R}^{M_1 \times 3}$,并补充通过轻量级光流模型定期提取的几何对应点 $P_2 \in \mathbb{R}^{M_2 \times 3}$ 来驱动的。融合后的点云通过以下方程离散化到具有中心 $V \in \mathbb{R}^{N \times 3}$ 的体素网格上,称为锚点:

$$ V = \left\{ \frac{P_1 \cup P_2}{\epsilon} \right\} \cdot \epsilon, \quad (4) $$

其中 $\{\cdot\}$ 表示仅保留唯一条目的操作,$\epsilon$ 指定体素大小。此外,遵循重大旋转变化,引入新的 MLP 以预测生成的高斯的参数,直到发生另一个主要视角变化。ORB-SLAM2 的局部束调整模块不断细化关键帧位姿,导致存储在高斯地图中的相应位姿更新。相比之下,一旦初始化,锚点不受跟踪器的局部操作直接修改,仅在回环期间进行调整以校正累积的全局漂移。高斯优化过程独立运行,执行细化、稠密化和剪枝以最小化 (3)。

第 4 页

(a) 真实图像 (Ground Truth) (b) ORB-SLAM2 跟踪特征 (c) 渲染图像 (基线), PSNR = 15.80

(d) 渲染图像 (光流, OF), PSNR = 17.64 (e) 渲染图像 (MLP), PSNR = 17.37 (f) 渲染图像 (光流 + MLP), PSNR = 18.37

图 3. 我们在 KITTI 里程计序列 00 上对各项贡献的定性渲染对比:由于场景左侧缺乏源自 ORB-SLAM2 特征的结构性锚点,导致我们的基线实现中出现局部模糊的渲染结果 (c)。在使用我们单独的各项贡献 (d, e) 及其组合 (f) 时,该区域的视觉保真度得到了极大改善。

C. 流稠密化 (Flow Densification) 计算效率,极线约束残差是在 N 个随机采样的齐次对应点对 $x \leftrightarrow x'$ 上评估的: 3D高斯泼溅 (3DGS) 的稀疏初始化严重损害了 s 视觉保真度以及实时执行所需的快速收敛速度,正如近期文献 [9], [10] 所示。事实上,作为我们 Gaussian Mapper 锚点初始化器的 ORB-SLAM2,尽管提供了强大的结构,但仅保留最可靠的三角测量结果——即那些产生最小 2D 重投影误差的结果。这种选择性过程通常导致内点特征在空间分布上不均匀,某些区域过度代表,而其他区域覆盖不足。由于 3DGS 优化在这些稀疏区域难以收敛,它们表现出降低的几何和光度保真度,在渲染输出中显得模糊,并产生较低的 PSNR 值(图 3)。 密集光流 (Dense Flow)。为了缓解这些问题,我们使用密集光流网络 [29] 获得的几何一致匹配来增强高斯地图点。该网络用于建立密集对应关系 $x \leftrightarrow x'$(在连续关键帧之间),以齐次坐标表示为 $x' = x + u$,其中 $x = [x, y, 1]^\top$,$u = [u_x, u_y, 0]^\top$,$u_x$ 和 $u_y$ 分别代表密集光流向量的水平和垂直分量。 对应关系过滤 (Correspondence Filtering)。令 $P_i = K[R_i | t_i]$ 表示关键帧 $i$ 处的校准投影矩阵,其中相机位姿 $(R_i, t_i)$ 由 ORB-SLAM2 提供。为了评估计算效率,极线约束残差是在 N 个随机采样的齐次对应点对 $x \leftrightarrow x'$ 上评估的: residual = $x'^\top F x < \tau$ (5) 其中基本矩阵 $F = [e_2]_\times P_2 P_1^+$ 是使用第二幅图像中的已知极心 $e_2 = P_2 C_1$ 计算得出的,$C_1$ 是第一幅视图($P_1$ 的零空间)的相机中心。这里,$P_1^+$ 表示 $P_1$ 的伪逆,$[\cdot]_\times$ 表示反对称矩阵算子。满足 residual $< \tau$ 的对应关系被保留为鲁棒匹配,并通过已知的相机位姿进行三角测量,从而为高斯地图生成补充几何锚点。

D. 局部 MLP 初始化 (Localized MLP Initialization) 通常,高斯泼溅 SLAM 方法的评价局限于有界场景(如室内房间、车辆和植物)以及受限的户外区域(如花园或建筑物的远处视角),在这些场景中,单个网络能够提供对整个空间充分且计算高效的建模 [11], [31]。然而,在大规模户外数据集中,光照可能会发生显著变化,物体可能出现在非常不同的距离和尺度上,并且表面属性(如反射率和颜色)可能会在整个场景中发生变化。许多现有框架依赖光流进行逐帧跟踪 [22], [30],这违反了严格的实时约束。相反,为了克服这一关键瓶颈,我们完全将跟踪与光流解耦,仅将光流提取保留用于高斯映射。我们稀疏地应用此光流以防止收益递减,因为连续执行会减少总的高斯优化迭代次数,并冗余地将新点折叠到已填充的锚点中。除了计算效率之外,这种跟踪-光流解耦还防止了由深度光流网络的域偏差引起的严重零射退化,即使它们偶尔能改善特定的域内轨迹(例如 KITTI)。这种架构分离非常有效,因为跟踪需要鲁棒且精确的对应关系,而映射可以成功利用稍微带有噪声的光流对应关系来填充稀疏初始化的区域。 为了解决这个问题,我们将映射环境划分为一组动态的 M 个不同区域,记为 $R = \{R_1, R_2, \dots, R_M\}$,并配备一组独立的参数集 $\Theta = \{\theta_1, \theta_2, \dots, \theta_M\}$。因此,包含 $C$ 的空间域 $R_m$ 显式地对所有 $k$ 个高斯属性的解码进行条件约束: $G = \sum_{m=1}^{M} \mathbb{1}(C \in R_m) \cdot \Phi_{\theta_m}(f_a, \delta_{ac}, d_{ac})$ (6) 其中指示函数 $\mathbb{1}(\cdot)$ 仅在分配给区域 $R_m$ 的局部 MLP 激活时生效。由于我们的空间分解框架对特定的初始化触发器是不敏感的,

第 5 页

表 I KITTI 里程计数据集上的光度重建质量指标(PSNR、SSIM、LPIPS)。×:由于内存限制,PhotoSLAM 仅报告了 2000 帧的结果,GigaSLAM 仅报告了 3200 帧的结果。

| 方法 | 序列 → | 00 | 01 | 02 | 03 | 04 | 05 | 06 | 07 | 08 | 09 | 10 | 平均 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 总帧数 | | 4541 | 1101 | 4661 | 801 | 271 | 2761 | 1101 | 1101 | 4071 | 1591 | 1201 | | | PhotoSLAM | PSNR ↑ | 11.161× | 18.336 | 13.613× | 15.604 | 15.660 | 12.661× | 12.169 | 9.497 | 13.374× | 10.139 | 15.003 | 13.383 | | | SSIM ↑ | 0.433× | 0.624 | 0.420× | 0.453 | 0.516 | 0.447× | 0.438 | 0.376 | 0.446× | 0.358 | 0.490 | 0.455 | | | LPIPS ↓ | 0.821× | 0.702 | 0.816× | 0.777 | 0.792 | 0.819× | 0.825 | 0.826 | 0.809× | 0.853 | 0.781 | 0.802 | | GigaSLAM<br>(预优化) | PSNR ↑ | 15.674× | 15.647 | 15.542× | 16.258 | 15.854 | 14.736 | 14.983 | 14.583 | 16.071× | 15.569 | 15.665 | 15.507 | | | SSIM ↑ | 0.808× | 0.801 | 0.777× | 0.763 | 0.709 | 0.758 | 0.785 | 0.712 | 0.801× | 0.751 | 0.736 | 0.764 | | | LPIPS ↓ | 0.786× | 0.770 | 0.781× | 0.818 | 0.718 | 0.833 | 0.790 | 0.779 | 0.786× | 0.793 | 0.808 | 0.787 | | MonoGS | PSNR ↑ | | 13.914 | | | 14.670 | | 8.141 | | | | | – | | | SSIM ↑ | 失败 | 0.523 | 失败 | 失败 | 0.450 | 失败 | 0.184 | 失败 | 失败 | 失败 | 失败 | – | | | LPIPS ↓ | | 0.702 | | | 0.691 | | 0.918 | | | | | – | | Ours | PSNR ↑ | 15.096 | 20.152 | 13.351 | 20.254 | 21.509 | 14.889 | 16.405 | 13.624 | 17.158 | 19.185 | 18.754 | 17.307 | | | SSIM ↑ | 0.802 | 0.909 | 0.715 | 0.889 | 0.922 | 0.789 | 0.831 | 0.721 | 0.831 | 0.885 | 0.875 | 0.834 | | | LPIPS ↓ | 0.725 | 0.552 | 0.770 | 0.404 | 0.416 | 0.632 | 0.601 | 0.590 | 0.556 | 0.482 | 0.512 | 0.567 | | GigaSLAM<br>(后优化) | PSNR ↑ | 9.768 | 25.909 | 21.393 | 24.109 | 25.188 | 22.114 | 23.874 | 23.904 | 22.706 | 22.924 | 23.357 | 22.295 | | | SSIM ↑ | 0.583 | 0.967 | 0.930 | 0.949 | 0.959 | 0.934 | 0.954 | 0.957 | 0.940 | 0.941 | 0.948 | 0.915 | | | LPIPS ↓ | 0.816 | 0.336 | 0.412 | 0.367 | 0.305 | 0.404 | 0.358 | 0.304 | 0.367 | 0.367 | 0.364 | 0.400 |

表 II Oxford(左)和 Malaga(右)数据集上的光度重建质量指标(PSNR、SSIM、LPIPS)。

| 方法 | 总帧数 | 序列 →<br>2014-05-14<br>13-53-47 | 2014-08-11<br>10-22-21 | 2015-11-02<br>10-45-59 | 02 | 06 | 平均 | 08 | 平均 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | PhotoSLAM | 3032 | PSNR ↑<br>13.749 | 3003<br>14.087 | 3601<br>11.068 | 1855<br>12.968 | 1118<br>17.440 | 1201<br>21.106 | | 19.968 | 19.504 | | | | SSIM ↑<br>0.529 | 0.554 | 0.311 | 0.465 | 0.667 | 0.740 | | 0.705 | 0.704 | | | | LPIPS ↓<br>0.817 | 0.802 | 0.849 | 0.823 | 0.735 | 0.699 | | 0.713 | 0.716 | | GigaSLAM<br>(预优化) | | PSNR ↑<br>14.880 | 15.958 | 16.064 | 15.634 | 19.257 | 20.684 | | 19.979 | 19.973 | | | | SSIM ↑<br>0.644 | 0.652 | 0.698 | 0.665 | 0.666 | 0.639 | | 0.667 | 0.657 | | | | LPIPS ↓<br>0.769 | 0.734 | 0.853 | 0.785 | 0.926 | 0.868 | | 0.882 | 0.892 | | MonoGS | | PSNR ↑<br>7.009 | 10.194 | 7.145 | 8.116 | 15.424 | 17.447 | | 16.986 | 16.619 | | | | SSIM ↑<br>0.875 | 0.788 | 0.864 | 0.842 | 0.711 | 0.741 | | 0.750 | 0.734 | | | | LPIPS ↓<br>0.198 | 0.410 | 0.343 | 0.317 | 0.634 | 0.672 | | 0.650 | 0.652 | | Ours | | PSNR ↑<br>17.838 | 20.827 | 20.719 | 19.795 | 22.332 | 23.812 | | 23.180 | 23.108 | | | | SSIM ↑<br>0.883 | 0.903 | 0.938 | 0.908 | 0.961 | 0.942 | | 0.941 | 0.948 | | | | LPIPS ↓<br>0.527 | 0.382 | 0.382 | 0.430 | 0.533 | 0.492 | | 0.509 | 0.511 |

E. 闭环检测 当 ORB-SLAM2 的跟踪模块检测到闭环时,通过将校正传播到高斯地图来优化受影响的帧位姿。具体而言,对于每个位姿更新为 $^w T_{new,i,c}$ 的关键帧 $i$,我们计算相对变换: $$ \Delta T_i = (^w T_{new,i})^{-1} \, ^w T_{old,i} \quad (7) $$ 每个变换 $\Delta T_i$ 随后应用于该关键帧局部视锥内的所有锚点,导致网格发生非刚性变换。这种变形对于保持重建一致性和约束长期漂移至关重要。

IV. 结果

A. 实验设置 我们在来自 KITTI Odometry [32]、Oxford RobotCar [33] 和 Málaga [34] 数据集的大规模真实世界户外驾驶序列上评估我们的框架。其多样化的环境——涵盖城市街道、高速公路和乡村道路——为验证 3DGS 重建的可扩展性、鲁棒性和准确性提供了全面的基准。我们将系统与三种最先进的 Gaussian Splatting SLAM 方法进行了比较,硬件平台为配备 NVIDIA RTX 5090(32 GB 显存)的 Intel Core Ultra 9 285K:PhotoSLAM [7],一个主要针对受限场景评估的实时高质量重建系统;GigaSLAM [26],一个长轨迹系统,我们既在有又无其昂贵的后处理细化情况下对其进行评估以确保公平性;以及 MonoGS [5],一个开创性的 Gaussian Splatting SLAM 基线。渲染质量使用峰值信噪比(PSNR)、结构相似性指数(SSIM)和感知图像块相似度(LPIPS)进行评估,系统性能使用 FPS、峰值 GPU 内存使用量和高斯基元数量进行评估。

B. 实现细节 锚点体素大小在所有序列中均设置为默认大小 0.001 [11];较大的尺寸会导致多个初始化点坍缩为单个锚点,从而严重削弱我们基于光流的稠密化的结构优势。对于密集光流估计,我们采用 LiteFlowNet3 [29],这是一种超轻量级深度神经网络,固定步长为 7 个关键帧。最后,在高斯模型的每个训练迭代期间,我们以 0.7 的高均匀概率从最近的 $k=25$ 个关键帧中进行采样,以 0.3 的概率从较旧的关键帧中采样,以减轻遗忘现象。

C. 光度评估 我们在多个数据集序列上评估系统的光度性能:来自 KITTI Odometry [32] 的 11 个序列,以及来自 Oxford RobotCar [33] 和 Málaga [34] 的各 3 个序列,定量结果报告在表 I 和表 II 中,渲染比较见图 4。总体而言,我们的方法明显优于 PhotoSLAM 和 GigaSLAM (pre-opt),在所有指标上实现了显著更高的重建质量。与表现次优的 GigaSLAM 相比,我们的方法在 KITTI 数据集上的平均提升分别为 (PSNR, SSIM, LPIPS) (11.6%, 9.2%, 28.0%),在

第 6 页

内存溢出 内存溢出

(a) PhotoSLAM (b) GigaSLAM (c) 本文方法 (d) 真实值

图 4. KITTI 里程计序列 08 上的定性渲染对比:行分别对应第 500、2000 和 4000 帧。PhotoSLAM (a) 随时间推移表现出显著的渲染质量下降。PhotoSLAM (a) 和 GigaSLAM (b) 分别在 2000 帧和 3200 帧后因内存耗尽而终止。MonoGS 在该序列上失败,未包含在内。相比之下,我们的方法在所有 4071 帧中保持了稳定的渲染质量。

表 III KITTI 里程计数据集上的性能指标(FPS、峰值 GPU 内存分配、场景基元数量)。对于 PhotoSLAM,场景基元为高斯球;对于其他方法,场景基元为锚点。×:由于内存溢出限制,PhotoSLAM 的报告结果仅包含前 2000 帧,GigaSLAM 仅包含前 3200 帧。

方法 序列 → 00 01 02 03 04 05 06 07 08 09 10 平均 总帧数 4541 1101 4661 801 271 2761 1101 1101 4071 1591 1201 FPS ~10× ~10 ~10× ~10 ~10 ~10× ~10 ~10 ~10× ~10 ~10 ~10 PhotoSLAM GPU (GiB) 25.0× 8.2 29.1× 6.3 2.8 23.2× 9.7 9.8 30.9× 17.9 11.0 15.8 基元 907k× 347k 820k× 371k 101k 718k× 308k 496k 877k× 620k 455k 547k FPS 2.89× 4.84 2.65× 3.76 3.39 2.69 2.76 3.21 2.94× 2.73 3.02 3.17 GigaSLAM GPU (GiB) 31.1× 12.2 29.0× 12.8 9.9 23.8 14.4 14.4 26.4× 16.8 14.9 18.7 (预优化) 基元 2811k× 550k 3075k× 548k 223k 2249k 925k 849k 2531k× 1638k 991k 1490k FPS 1.81 1.45 4.49 – 图 5. KITTI 序列 00、05 上的轨迹对比:GLAM-SLAM 7.3 失败 失败 4.4 失败 9.9 失败 失败 失败 失败 -MonoGS GPU (GiB) 失败 基元 36k 23k 22k – 是唯一完成全部 4541 帧和 2761 帧序列的方法。

FPS ~10 ~10 ~10 ~10 ~10 ~10 ~10 ~10 ~10 ~10 ~10 ~10 本文方法 GPU (GiB) 17.6 7.2 15.6 7.8 5.6 15.2 8.1 8.8 21.8 11.4 8.1 11.6 基元 1388k 112k 995k 547k 130k 1029k 422k 787k 1681k 751k 443k 753k

FPS 0.32 1.08 0.28 0.79 0.99 0.36 0.54 0.58 0.36 0.39 0.54 0.57 GigaSLAM GPU (GiB) 31.2 12.3 29.1 12.8 10.0 23.9 14.6 14.5 26.6 16.8 15.0 18.8 表 IV (后优化) 基元 2811k 550k 3076k 561k 223k 2247k 925k 849k 2531k 1638k 991k 1491k KITTI 里程计数据集上的绝对轨迹误差 (ATE RMSE [m])。×:由于内存溢出限制,PhotoSLAM 的报告结果仅包含前 2000 帧,GigaSLAM 仅包含前 3200 帧。 数据集。 35.3%) on Oxford RobotCar, and (15.7%, 6.3%, 10.5%) on M´alaga. While GigaSLAM’s post-optimization boosts pho- 总帧数 4541 00 1101 01 4661 02 801 03 271 04 2761 05 1101 06 1101 07 4071 08 1591 09 1201 10 tometric scores, this strictly offline refinement sacrifices real- PhotoSLAM 8.98× 518.51 10.57× 0.76 1.43 14.48× 16.48 2.50 44.78× 6.90 6.68 GigaSLAM 5.20× 189.10 6.75× 1.29 1.59 5.03 1.37 3.00 3.89× 3.85 2.28 time capability and can unpredictably fail, notably degrading MonoGS 失败 402.64 失败 失败 16.19 失败 57.24 失败 失败 失败 失败 sequence 00 with needle-like Gaussians that sharply reduce 本文方法 5.81 364.20 17.61 1.00 1.27 4.21 15.76 2.19 46.07 8.39 5.64 all quality metrics.

D. 计算性能评估 E. ATE 评估 Our system and PhotoSLAM consistently operate in real- time across all evaluated datasets (KITTI: 10 FPS, Oxford 定量结果(表 IV)显示,由于共享基于 ORB-SLAM 的前端, RobotCar: 16 FPS, M´alaga: 20 FPS). In contrast, GigaSLAM 我们的系统与 PhotoSLAM 实现了可比的实时跟踪性能。然而,Photo- (pre-opt) fails to operate in real time, bottlenecked by heavy SLAM 和 GigaSLAM 都面临严重的可扩展性限制,在序列超过 2000 和 neural networks for depth and feature matching, as well as 3200 帧时分别耗尽 GPU 内存。MonoGS 在大多数序列的前几百帧后崩溃。 costly loop closures (3x slower on KITTI; see Table III). 虽然 GigaSLAM 实现了更低的平均 ATE(排除序列 01 中的相互灾难性失败后,3.4m vs 10.8m),但这以非实时性能(~3 FPS)和消耗 32GB VRAM 的重型后端为代价。相比之下,我们的轻量级系统保持了可接受的跟踪性能,并能稳健地扩展到无界、长序列的户外轨迹,而不会耗尽资源。图 5 对比了序列 00 和 05 上的轨迹,其中我们的方法保持了稳定的估计,而 PhotoSLAM 和 GigaSLAM 因内存溢出错误而提前终止。 In terms of memory, our system exhibits the lowest peak GPU memory usage, scaling efficiently despite the constant 3 GiB allocated on the GPU for loading the optical flow model. This efficiency enables processing of long sequences without interruption, while the other methods encounter Out- of-Memory failures on our hardware (Seq. 00, 02, 05, 08), requiring sequence truncation for evaluation. GigaSLAM’s high memory footprint stems from loading multiple networks and maintaining a large number of anchors. Our approach, despite using more primitives than PhotoSLAM, still shows lower GPU memory consumption, which is primarily due to the more compact representation of the structured anchors.

第 7 页

图 6. 沿 X–Z 轨迹的逐关键帧质量分析:我们可视化了 KITTI Seq. 00(前 1000 帧)消融实验中的绝对 PSNR(第一个图)和相对提升 ∆PSNR(其余图)。报告的 PSNR 和 ∆PSNR 平均值与表 V 中呈现的一致。

表 V 光度重建质量(PSNR、SSIM、LPIPS)和性能指标(FPS、峰值 GPU 内存分配、场景基元数量)在 KITTI Odometry 数据集上的消融研究。 F: ORB-SLAM2 跟踪失败。

方法 序列 → 00 01F 02 03 04 05 06 07 08 09 10 平均 总帧数 PSNR ↑ 15.06 1000 — 15.03 1000 19.04 801 20.85 1271 19.02 1000 18.61 1000 18.85 1000 15.95 1000 18.88 1000 16.37 1000 17.77

LPIPS ↓ 0.671 – 0.751 0.483 0.451 0.443 0.539 0.434 0.640 0.539 0.642 0.559 基线 SSIM ↑ 0.816 – 0.785 0.877 0.907 0.882 0.867 0.881 0.798 0.876 0.825 0.851

0.920 光流 SSIM ↑ 0.826 – 0.794 0.912 0.884 0.879 0.894 0.811 0.884 0.830 0.863

PSNR ↑ 15.48 – 15.21 20.84 21.39 19.20 19.23 19.51 16.45 19.34 16.51 18.32 LPIPS ↓ 0.646 – 0.728 0.376 0.433 0.496 0.391 0.608 0.512 0.638 0.524

F. 消融研究 我们通过详细分析 KITTI 每个序列(除 Seq. 00 外,因为 ORB-SLAM2 丢失跟踪)的前 1000 帧,对我们的主要贡献进行了消融研究,如表 V 所示。

流稠密化(Flow Densification):结合基于光流的对应关系,在所有 KITTI 序列的光度重建指标上带来了显著改进,

与渲染图像的定性增强一起,特别是在稀疏跟踪区域中,如图 3 所示。这导致高斯基元的表示更加丰富(32%),使得平均内存占用量达到

MLP PSNR SSIM ↑↑ 15.70 0.837 — 15.59 0.811 19.96 0.896 20.85 0.907 19.18 0.887 20.26 0.905 19.52 0.896 16.71 0.823 19.42 0.886 16.65 0.833 18.38 0.868

↑ 15.874 20.870 21.390 19.613 20.756 19.925 16.881 19.772 17.115 18.800 PSNR – 15.806 0.817 0.913 0.920 0.895 0.913 0.904 0.829 0.890 0.845 0.876 Optical Flow + LPIPS ↓ 0.641 – 0.720 0.437 0.451 0.441 0.453 0.412 0.599 0.524 0.636 0.531 SSIM ↑ 0.838 – MLP LPIPS ↓ 0.632 – 0.701 0.373 0.411 0.416 0.416 0.371 0.587 0.497 0.608 0.501 Method Sequences → 00 01F 02 03 04 05 06 07 08 09 10 Avg.

6.5 GiB(从 1.8 GiB 增加),其中光流模型本身占用了约 3 GiB 的总量。

| Total frames | GPU (GiB) | 1000 | 1.9 | — | 1000 | 1.3 | 80 | 11.7 | 27 | 11.4 | 1000 | 1.8 | 1000 | 1.8 | 1000 | 2.3 | 1000 | 1.7 | 1000 | 2.6 | 1000 | 1.5 | 1.8 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Iterations | | 11.7k | | | 14.8k | | | | | | 13.7k | | | 11.1k | | | 3.8k | | | 12.3k | | | 8.8k | | | 12.2k | | | 12.4k | | | 13.3k | | | 14.8k | | | | Baseline | GPU (GiB) | 259k | | | 117k | | 311k | | 105k | | 431k | | 204k | | 514k | | 215k | | 254k | | 217k | | 263k | | | | | 6.8 | | | 5.9 | | 6.7 | | 5.7 | | 6.8 | | 6.2 | | 7.4 | | 6.3 | | 6.8 | | 6.4 | | 6.5 |

如表 V 所示,将计算资源转移到光流上会导致原始高斯优化迭代次数略有减少(10.6k 对比 11.7k)。这是一个非常有利的权衡:从光流估计中整合几何先验可以加速收敛,从而在更少的迭代次数下产生更高质量的结果,同时严格保持实时操作。

局部 MLP:同样,在不同区域引入局部 MLP 会显著提高光度重建指标(参见图 6 中的 $\Delta$PSNR 改进),并导致高斯基元数量大幅增加(约 30%)。值得注意的是,在六

序列中,孤立使用多个多层感知机(MLP)的性能优于光流模块,如 Fig. 7(b,c) 的细节所示,在保持与基线相同的显存占用量的同时实现了这一性能提升。我们注意到,尽管未强制执行显式的跨分区一致性,但在空间边界处产生的光度波动并未在感知上降低渲染质量。

V. 结论

本文提出了一种用于大规模操作的实时单目高斯泼溅 SLAM 系统,利用鲁棒的基于特征的 ORB-SLAM2 前端为我们的结构化高斯锚点表示建立几何先验。为了弥合稀疏跟踪前端与高斯优化所需的密集播种之间的差距,我们制定了一种由光流驱动的稠密化方案,该方案利用对极几何推导密集的结构先验。此外,为了处理长期室外序列中的环境变化,我们引入了一种场景分区策略,以高效地对不同的局部区域进行建模。消融研究验证了我们贡献的有效性,并且在具有挑战性的室外数据集上进行了全面评估。

G. 停车序列

为了在真实世界环境中评估我们的贡献,我们部署了一辆配备 Viewpro Z10TIR RGB 传感器的地面车辆机器人,以捕捉城市停车场的室外序列。Fig. 7(a) 展示了该平台。

值得注意的是,尽管未强制执行显式的跨分区一致性,但在空间边界处产生的光度波动并未在感知上降低渲染质量。

应强调的是,这些改进是互补的:同时启用两者会带来进一步的提升,如 Table V 所示。我们在 Table I 和 III 的所有实验中均启用了这两种增强功能。

此外,为了处理长期室外序列中的环境变化,我们引入了一种场景分区策略,以高效地对不同的局部区域进行建模。消融研究验证了我们贡献的有效性,并且在具有挑战性的室外数据集上进行了全面评估。

第 8 页

[13] T. Whelan, J. McDonald, M. Kaess, M. Fallon, H. Johannsson, and J. J. Leonard, “Kintinuous: Spatially Extended KinectFusion,” in Proc. RSS Workshop on RGB-D: Advanced Reasoning with Depth Cameras, 2012. [14] B. Mildenhall, P. P. Srinivasan, M. Tancik, J. T. Barron, R. Ramamoor- (a) Ground vehicle (b) Ours (baseline) (c) Ours (OF+MLP) thi, and R. Ng, “NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis,” Communications of the ACM, vol. 65, no. 1, pp. 99–106, Dec. 2021. [15] E. Sucar, S. Liu, J. Ortiz, and A. J. Davison, “iMAP: Implicit Mapping and Positioning in Real-Time,” in Proc. IEEE/CVF Int. Conf. on Computer Vision, 2021. [16] T. Deng, G. Shen, T. Qin, J. Wang, W. Zhao, J. Wang, D. Wang, and (d) GigaSLAM (e) PhotoSLAM (f) MonoGS W. Chen, “PLGSLAM: Progressive Neural Scene Represenation with Fig. 7. Parking序列上的定性评估:(a) 数据采集无人地面车辆 (UGV)。(b)–(f) 对比渲染结果。 Local to Global Bundle Adjustment,” in Proc. IEEE/CVF Conf. on Computer Vision and Pattern Recognition, 2024. [17] B. Kerbl, G. Kopanas, T. Leimkuehler, and G. Drettakis, “3D Gaussian TABLE VI Splatting for Real-Time Radiance Field Rendering,” ACM Transac- tions on Graphics, vol. 42, no. 4, Jul. 2023. Parking序列上的光度重建质量结果。 [18] G. Chen and W. Wang, “A Survey on 3D Gaussian Splatting,” Ablations → Baseline OF MLP OF+MLP GigaSLAM PhotoSLAM MonoGS arXiv:2401.03890, 2024. Total frames 2200 2200 2200 2200 2200 2200 2200 [19] B. Huang, Z. Yu, A. Chen, A. Geiger, and S. Gao, “2D Gaussian PSNR ↑ 23.428 23.648 23.459 23.719 19.149 21.066 13.351 SSIM ↑ 0.963 0.964 0.963 0.964 0.911 0.612 0.492 Splatting for Geometrically Accurate Radiance Fields,” in Proc. ACM LPIPS ↓ 0.384 0.362 0.384 0.359 0.719 0.659 0.750 SIGGRAPH Conf., 2024. [20] X. Zhong, Y. Pan, L. Jin, M. Popovi´c, J. Behley, and C. Stachniss, “Globally Consistent RGB-D SLAM with 2D Gaussian Splatting,” 展示了我们提出的系统的性能。我们的系统提升了最先进的重建质量,同时 IEEE Transactions on Robotics, vol. 42, pp. 2360–2380, May 2026. 实现了实时性能并具备可扩展的 GPU 内存使用量,解决了限制高斯泼溅 [21] K. Wu, Z. Zhang, M. Tie, Z. Ai, Z. Gan, and W. Ding, “VINGS- SLAM 系统实际部署的两大瓶颈。 Mono: Visual-Inertial Gaussian Splatting Monocular SLAM in Large Scenes,” IEEE Transactions on Robotics, vol. 41, pp. 5912–5931, Sep. SLAM: Globally Optimized RGB-only SLAM with 3D Gaussians,” in REFERENCES Proc. IEEE/CVF Conf. on Computer Vision and Pattern Recognition, 2025. [1] R. Mur-Artal and J. D. Tard´os, “ORB-SLAM2: an Open-Source [23] Z. Peng, T. Shao, Y. Liu, J. Zhou, Y. Yang, J. Wang, and K. Zhou, SLAM System for Monocular, Stereo and RGB-D Cameras,” IEEE “RTG-SLAM: Real-time 3D Reconstruction at Scale using Gaussian Transactions on Robotics, vol. 33, no. 5, pp. 1255–1262, Oct. 2017. Splatting,” in Proc. ACM SIGGRAPH Conf., 2024. [2] R. A. Newcombe, S. Izadi, O. Hilliges, D. Molyneaux, D. Kim, [24] J. Wei and S. Leutenegger, “GSFusion: Online RGB-D Mapping A. J. Davison, P. Kohi, J. Shotton, S. Hodges, and A. Fitzgibbon, Where Gaussian Splatting Meets TSDF Fusion,” IEEE Robotics and “KinectFusion: Real-Time Dense Surface Mapping and Tracking,” in Automation Letters, vol. 9, no. 12, pp. 11 865–11 872, Dec. 2024. Proc. IEEE Int. Symp. on Mixed and Augmented Reality, 2011. [25] K. Deng, Z. Ti, J. Xu, J. Yang, and J. Xie, “VGGT-Long: Chunk it, [3] Z. Zhu, S. Peng, V. Larsson, W. Xu, H. Bao, Z. Cui, M. R. Oswald, Loop it, Align it–Pushing VGGT’s Limits on Kilometer-scale Long and M. Pollefeys, “NICE-SLAM: Neural Implicit Scalable Encoding RGB Sequences,” arXiv:2507.16443, 2025. for SLAM,” in Proc. IEEE/CVF Conf. on Computer Vision and Pattern [26] K. Deng, Y. Zhang, J. Yang, and J. Xie, “GigaSLAM: Large-Scale Recognition, 2022. Monocular SLAM with Hierarchical Gaussian Splats,” in Proc. ACM [4] E. Sandstr¨om, Y. Li, L. Van Gool, and M. R. Oswald, “Point-SLAM: SIGGRAPH Asia Conf., 2025. Dense Neural Point Cloud-based SLAM,” in Proc. IEEE/CVF Int. [27] D. Rebain, W. Jiang, S. Yazdani, K. Li, K. M. Yi, and A. Tagliasacchi, Conf. on Computer Vision, 2023. “DeRF: Decomposed Radiance Fields,” in Proc. IEEE/CVF Conf. on [5] H. Matsuki, R. Murai, P. H. Kelly, and A. J. Davison, “Gaussian Computer Vision and Pattern Recognition, 2021. Splatting SLAM,” in Proc. IEEE/CVF Conf. on Computer Vision and [28] M. Tancik, V. Casser, X. Yan, S. Pradhan, B. Mildenhall, P. P. Pattern Recognition, 2024. Srinivasan, J. T. Barron, and H. Kretzschmar, “Block-NeRF: Scalable [6] N. Keetha, J. Karhade, K. M. Jatavallabhula, G. Yang, S. Scherer, Large Scene Neural View Synthesis,” in Proc. IEEE/CVF Conf. on D. Ramanan, and J. Luiten, “SplaTAM: Splat Track & Map 3D Computer Vision and Pattern Recognition, 2022. Gaussians for Dense RGB-D SLAM,” in Proc. IEEE/CVF Conf. on [29] T.-W. Hui and C. C. Loy, “LiteFlowNet3: Resolving Correspondence Computer Vision and Pattern Recognition, 2024. Ambiguity for More Accurate Optical Flow Estimation,” in Proc. [7] H. Huang, L. Li, H. Cheng, and S.-K. Yeung, “Photo-SLAM: European Conf. on Computer Vision, 2020. Real-time Simultaneous Localization and Photorealistic Mapping for [30] Z. Zhu, W. Zhang, M. Li, N. Haala, M. Pollefeys, and D. Barath, Monocular Stereo and RGB-D Cameras,” in Proc. IEEE/CVF Conf. “VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM,” in Proc. on Computer Vision and Pattern Recognition, 2024. European Conf. on Computer Vision, 2026. [8] J. Engel, T. Sch¨ops, and D. Cremers, “LSD-SLAM: Large-Scale Direct [31] T. Wen, Z. Liu, and Y. Fang, “SEGS-SLAM: Structure-enhanced 3D Monocular SLAM,” in Proc. European Conf. on Computer Vision, Gaussian Splatting SLAM with Appearance Embedding,” in Proc. 2014. IEEE/CVF Int. Conf. on Computer Vision, 2025. [9] J. Jung, J. Han, H. An, J. Kang, S. Park, and S. Kim, “Relax- [32] A. Geiger, P. Lenz, C. Stiller, and R. Urtasun, “Vision meets Robotics: ing Accurate Initialization Constraint for 3D Gaussian Splatting,” The KITTI Dataset,” Int. Journal of Robotics Research, vol. 32, no. 11, arXiv:2403.09413, 2024. pp. 1231–1237, Sep. 2013. [10] W. Pan, X. Zhang, H. Zhai, X. Xiang, H. Jiang, and G. Zhang, [33] W. Maddern, G. Pascoe, C. Linegar, and P. Newman, “1 Year, 1000km: “Liberated-GS: 3D Gaussian Splatting Independent from SfM Point The Oxford RobotCar Dataset,” Int. Journal of Robotics Research, Clouds,” in Proc. IEEE/CVF Int. Conf. on Computer Vision, 2025. vol. 36, no. 1, pp. 3–15, Jan. 2017.

[11] T. Lu, M. Yu, L. Xu, Y. Xiangli, L. Wang, D. Lin, 和 B. Dai,“Scaffold-GS:用于视图自适应渲染的结构化 3D 高斯泼溅(3DGS)”,载于 IEEE/CVF 计算机视觉与模式识别会议论文集,2024 年。 [12] T. Whelan, S. Leutenegger, R. F. Salas-Moreno, B. Glocker, 和 A. J. Davison,“ElasticFusion:无需位姿图的密集 SLAM”,载于机器人:科学与系统会议论文集,2015 年。

发表评论