SLAMFormer-∞:用记忆条件突破Transformer SLAM的序列长度边界

快速导读:提出首个支持无界长序列前端跟踪与后端联合位姿-几何优化的几何Transformer SLAM系统,通过记忆条件设计实现17km级城市重建。

SLAMFormer-∞ 是首个将前端跟踪与后端联合位姿-几何优化统一于单一Transformer的SLAM系统,其核心突破在于通过记忆条件机制突破了训练数据分布对序列长度的限制。与现有方法将位姿优化与几何重建解耦不同,SLAMFormer-∞ 在前端进行因果增量跟踪,在后端通过位姿-几何图优化(PGGO)迭代精化轨迹与稠密点图,实现了从室内桌面到17km城市驾驶的无界泛化。

该工作的关键洞察是:Transformer的全局注意力本身具备联合优化的潜力,但序列级状态增长使其无法处理超长序列。SLAMFormer-∞ 通过引入记忆条件帧定义局部参考坐标系,将全局一致性问题转化为条件坐标系下的局部优化问题,从而在有限上下文窗口内保持长程信息。

英文题目:SLAMFormer-∞: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing

论文出处:arXiv 每日论文精选 · arXiv:2608.03429

原始论文:PDF / 论文页面

这篇论文解决什么问题?

单目SLAM是自主系统的核心能力。近年来,基于几何基础模型的方法在深度和位姿预测上取得了显著进展,但其长程一致性仍依赖外部优化。VGGT-Long通过分块处理、回环检测和位姿对齐实现了长序列全局位姿优化,但几何重建仅做拼接,位姿与几何优化完全解耦。MASt3R-SLAM利用稠密匹配构建点图,但全局一致性依赖外部配准。

SLAM-Former首次将前后端统一为单一Transformer,证明了端到端联合优化的可行性。然而,其全局注意力机制导致序列级状态随帧数线性增长,在长序列上遭遇显存溢出,性能受限于训练时的序列长度分布。这一根本矛盾——Transformer的全局建模能力与序列长度的可扩展性——构成了本文的核心研究问题。

更本质地看,问题不在于Transformer能否建模长序列,而在于如何让模型在有限上下文内保持对无限序列的全局一致性感知。这需要一个机制来定义"什么是全局",而不是简单地扩大上下文窗口。

SLAMFormer-∞ 的回答是:通过记忆条件帧定义局部坐标系,将全局一致性问题转化为条件坐标系下的局部优化问题。这使得同一Transformer可以在任意长度的序列上运行,无需显式的距离边界或子图划分。

核心创新

  • 提出记忆条件机制,使Transformer在局部坐标系下处理无界长序列,突破训练分布限制。
  • 设计位姿-几何图优化(PGGO),在Transformer内联合迭代优化长程轨迹与稠密几何。
  • 统一的前后端架构,支持在线增量跟踪与全局一致性精化,无需显式距离边界。

方法概览

提出SLAMFormer-∞,通过记忆条件(IC, XC)定义局部坐标系,使Transformer在有限上下文内保持长程信息。前端进行因果增量跟踪,后端通过位姿-几何图优化(PGGO)迭代联合优化轨迹与稠密点图。训练采用四种共享权重的模式,匹配测试时的前端、后端及精化阶段。

  • 记忆条件机制:系统维护两类记忆条件帧——IC(Identity Condition)定义参考坐标系,XC(Cross Condition)定义尺度和对齐。前端跟踪时,每帧的位姿和深度在条件帧定义的局部坐标系下预测,使得Transformer的输入始终保持在有限窗口内,无论序列多长。
  • 前端因果增量跟踪:新帧到达时,系统以滑动窗口方式选取最近的记忆条件帧和关键帧,通过Transformer预测当前帧的位姿和稠密点图。该过程是因果的,不依赖未来信息,适合在线部署。
  • 后端位姿-几何图优化(PGGO):当回环检测触发或序列结束时,系统构建一个包含关键帧节点和回环边的图结构。PGGO将图结构展开为Transformer的输入序列,通过帧间注意力在条件坐标系下迭代优化所有节点的位姿和点图,实现联合精化。
  • 四种训练模式共享权重:训练时,模型在四种模式下学习——单帧深度预测、相邻帧位姿预测、局部窗口精化、全局图优化。四种模式共享同一个Transformer骨干网络,使模型在测试时能无缝切换前端跟踪、局部精化和全局PGGO。
  • 局部窗口精化:在前端运行固定帧数后,系统对最近的局部窗口执行一次轻量精化,改善短程位姿和几何一致性。该步骤使用与PGGO相同的Transformer函数,但图结构仅包含局部连接。
  • 帧间注意力设计:Transformer包含帧内注意力和多种帧间注意力模式,包括相邻帧注意力、条件帧注意力和图边注意力。这些注意力模式在训练时通过不同的掩码矩阵实现,测试时根据当前阶段动态选择。
  • 点图表示:每帧的几何信息表示为稠密点图,而非深度图。点图在条件坐标系下定义,直接编码了三维结构,便于多帧融合和联合优化。
  • 回环检测与图构建:系统使用NetVLAD进行回环检测,检测到的回环边被加入PGGO的图结构。图连接质量直接影响PGGO的优化效果,这是论文明确指出的一个局限性。

逐图理解论文

失败的直觉

失败的直觉
Figure 2: SLAM Transformer Comparison. (a) Single-model SLAM-Former for global consistent pose and map. (b) VGGT-Long with optimized long-range poses and stitched maps. (c) Ours retains the single-model while obtains long-range global consistent pose and map with a conditional design.

图2对比了三种SLAM Transformer架构。SLAM-Former(a)是单模型全局优化但受限于序列长度;VGGT-Long(b)优化位姿但几何仅拼接;SLAMFormer-∞(c)通过条件设计在单模型内实现长程全局一致的位姿和地图。注意条件帧在架构中的核心角色。

核心洞察:记忆条件

核心洞察:记忆条件
Figure 3: The SLAM pipeline. Frontend detects keyframes and provides online track. After a fixed number of keyframes, we refine the most recent local window to improve short-range pose and geometry consistency. When loop detection is triggered or at sequence end, PGGO is applied with the same transformer function.

图3展示了完整的SLAM流水线。前端检测关键帧并提供在线跟踪;固定帧数后执行局部窗口精化;回环检测触发或序列结束时应用PGGO。注意三个阶段使用相同的Transformer函数,体现了统一架构的设计理念。

统一架构与联合优化

统一架构与联合优化
Figure 4: Four training modes of SLAMFormer-∞. and represent the image tokens fed into the frontend and backend. represents the image tokens injected with pose. represents the map tokens of a frame. and represent the layer intermediate and final output. In each mode, , and are fed into the transformer backbone fθ, with L layers of frame attention and various inter-frame attentions. Pose and pointmap are regressed by the heads fψ.

图4展示了四种训练模式。每种模式下,图像token、位姿注入token和地图token以不同方式输入Transformer骨干网络,通过不同的帧间注意力掩码实现功能分化。四种模式共享权重,使模型在测试时能无缝切换。

最有力的证据

最有力的证据
Figure 1: City-scale reconstruction visualization. VGGT-Long performs global pose alignment but leaves local geometry largely unrefined, while SLAMFormer-∞jointly optimizes pose and dense geometry. On a self-collected 17 km urban drive, SLAMFormer-∞further maintains a con- sistent large-scale map where VGGT-Long collapses.

图1展示了17km城市驾驶序列的重建对比。VGGT-Long在此超长序列上崩溃,而SLAMFormer-∞ 成功维护了一致的大规模地图。注意观察VGGT-Long重建中的断裂和漂移,以及SLAMFormer-∞ 重建的全局连贯性。这是验证记忆条件机制突破序列长度边界的最直接证据。

结论与局限

结论与局限
Figure 5: Qualitative effect of the fine stage (PGGO) on Replica. Compared with the coarse predic- tion, the fine-stage output produces cleaner local surfaces and more stable alignment.

图5展示了Replica数据集上精化阶段的定性效果。对比粗预测和精化后的点云,精化阶段产生了更干净的局部表面和更稳定的对齐。注意观察墙面和物体边缘的改善,这些定性改善比数值增益更直观地展示了PGGO的作用。

实验如何设计?

  • 室外数据集:KITTI Odometry(序列00-10)和Waymo Open Dataset用于评估长序列跟踪与重建。KITTI包含城市、乡村和高速公路场景,Waymo提供更丰富的城市驾驶数据。
  • 室内数据集:Replica、TUM RGB-D和7-Scenes用于评估短序列性能。这些数据集提供真值轨迹和稠密重建,便于定量对比。
  • 自采集17km城市驾驶序列:用于验证超长距离泛化能力,远超训练数据的序列长度分布。
  • 基线方法:包括VGGT-Long(长序列位姿优化)、MASt3R-SLAM(稠密匹配SLAM)、DROID-SLAM(经典学习型SLAM)和SLAM-Former(统一Transformer SLAM)。
  • 评估指标:跟踪使用ATE RMSE,重建使用Accuracy、Completeness和Chamfer distance。
  • 硬件配置:所有实验在单张RTX 4090上运行,部分基线方法因显存不足标记为OOM。

关键结果与论文证据

  • KITTI Odometry跟踪:SLAMFormer-∞ 平均ATE RMSE为23.011m,优于VGGT-Long的26.358m(第6页表1)。排除高速Seq.01后,优势更明显(15.653m vs 19.298m)。值得注意的是,MASt3R-SLAM在多个序列上跟踪丢失(TL),而SLAMFormer-∞ 在所有序列上均完成跟踪。
  • Waymo跟踪:SLAMFormer-∞ 平均ATE RMSE为1.813m,优于VGGT-Long的1.996m(第7页)。Waymo场景比KITTI更复杂,包含更多动态物体和城市交叉口,SLAMFormer-∞ 的优势表明其联合优化在处理复杂场景时更具鲁棒性。
  • Waymo稠密重建:SLAMFormer-∞ 在Accuracy(0.949 vs 1.182)、Completeness(2.777 vs 2.860)和Chamfer distance(1.863 vs 2.021)上全面优于VGGT-Long(第7页)。这验证了联合位姿-几何优化相比位姿优化后拼接几何的显著优势。
  • 7-Scenes室内跟踪与重建:SLAMFormer-∞ 的ATE RMSE为0.046m,优于VGGT-SLAM的0.068m;重建指标Accuracy/Completeness/Chamfer为0.029/0.049/0.039,优于0.054/0.060/0.057(第7页表4)。
  • Replica精化阶段消融:PGGO使ATE RMSE从0.061m降至0.052m,Accuracy/Completeness从6.11/3.39改善至6.00/3.33(第8页表4)。数值增益有限,但定性改善明显——图5显示精化后点云表面更干净、局部对齐更稳定。
  • 17km城市驾驶泛化:SLAMFormer-∞ 成功完成17km序列的联合位姿-几何优化,而VGGT-Long在此序列上崩溃(第1页图1)。这是论文最有力的证据,证明记忆条件机制确实突破了训练分布的长度限制。
  • 室内短序列对比SLAM-Former:SLAMFormer-∞ 在室内短序列上的性能不及完全端到端学习的SLAM-Former,因为其全局优化依赖于预定义的图结构而非端到端学习(第8页)。这是论文明确指出的局限性。
  • 定性对比:图6(第13页)展示了KITTI序列上的重建对比。VGGT-Long的局部几何存在碎片化和不对齐,而SLAMFormer-∞ 产生更连贯的大规模重建,局部表面连续且融合良好。

阅读时需要注意

  • PGGO依赖预定义的图结构(来自前端和回环检测),图连接质量直接影响优化效果。该图结构非数据驱动学习,可能遗漏潜在的长程约束。
  • 室内短序列上性能不及完全端到端学习的SLAM-Former,因为记忆条件机制引入了归纳偏置,在短序列上反而限制了端到端学习的灵活性。
  • 回环检测依赖外部模块(NetVLAD),非系统内学习,检测失败会直接影响PGGO的图结构质量。
  • 论文中KITTI平均指标排除高速Seq.01,可能影响整体性能解读的完整性。

关联工作

  • SLAM-Former(第2页):首个将SLAM前后端统一为单一Transformer的工作,证明了联合优化的可行性,但长程性能受限于序列级状态增长。SLAMFormer-∞ 通过记忆条件机制解决了这一根本问题。
  • VGGT-Long(第2页):通过分块、回环检测和位姿对齐实现长序列全局位姿优化,但几何仅做拼接。SLAMFormer-∞ 的PGGO实现了真正的联合位姿-几何优化。
  • MASt3R-SLAM(第3页):利用MASt3R匹配和点图预测构建稠密SLAM,但全局一致性依赖外部配准。SLAMFormer-∞ 将全局优化内化于Transformer。
  • DROID-SLAM(第6页):基于稠密光流的经典学习型SLAM,作为室外跟踪基线。其BA层设计启发了后续学习型SLAM的优化思路。

发表评论