快速导读:VidMap 提出一种结合SLAM时序约束与SfM全局优化的非因果重建框架,通过区分顺序跟踪与回环观测并注入度量深度先验,在长视频、无约束运动及视觉对称场景下显著优于现有方法。
VidMap提出了一种全新的视频重建范式:放弃SLAM的因果增量式架构,也拒绝SfM将视频视为无序图像集的简化假设,而是在全局SfM框架中显式保留并利用视频的时序结构。其核心思想是“来源感知”——系统记录每条观测来自顺序跟踪还是回环匹配,并在后续优化中区别对待。
该方法包含视频感知提取和全局建图两个阶段。提取阶段通过稠密匹配进行运动感知关键帧选择、多流漂移校正的稀疏轨迹传播、保留来源标签的回环闭合,并估计单目深度先验。建图阶段在全局SfM中引入来源感知鲁棒损失和带逐图尺度优化的度量深度先验,联合优化位姿、内参和深度尺度。在LaMAR、CroCoDL、ETH3D-SLAM和EuRoC四个数据集上,VidMap在未标定和已标定设置下均显著优于现有SLAM、SfM和端到端方法。
英文题目:VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion
论文出处:arXiv 每日论文精选 · arXiv:2607.27194
原始论文:PDF / 论文页面
对应视频标题:VidMap:放弃因果性,视频重建才能走得更远|推荐指数:★★★★★
这篇论文解决什么问题?
现有视频三维重建方法主要分为两大阵营:SLAM和SfM。SLAM采用因果增量式架构,逐帧处理并实时输出位姿,但其根本缺陷在于无法从严重漂移和跟踪失败中恢复——一旦丢失,后续所有帧都受影响。此外,多数SLAM系统需要已知相机内参,限制了其在无约束视频上的应用。
SfM则将视频视为无序图像集,通过特征匹配和全局优化估计相机位姿和三维结构。这种做法完全忽略了视频的时序结构,将连续帧间的可靠顺序观测与跨场景的回环匹配等同对待。在视觉对称场景中,不同位置的相似外观会产生大量错误回环,SfM无法区分这些观测的来源,导致重建崩溃。
视频中还存在大量退化运动(如纯旋转)、纹理缺失和视觉混叠等挑战。纯旋转下三角测量退化,纹理缺失区域特征点稀疏,视觉混叠则产生欺骗性的匹配。现有方法在这些场景下鲁棒性极差,亟需一种能同时利用时序约束和全局优化的新范式。
VidMap的出发点正是填补这一空白:能否设计一种非因果框架,既保留SLAM的时序跟踪能力,又具备SfM的全局优化优势,同时显式建模观测来源以对抗视觉混叠?
核心创新
- 提出非因果视频重建范式,结合SLAM时序跟踪与SfM全局优化,避免过早固化增量解。
- 设计来源感知轨迹构建与鲁棒优化,区分顺序边和回环边,有效抑制视觉混叠导致的错误回环。
- 将度量单目深度先验与逐图尺度估计融入全局定位和光束平差,解决退化运动和尺度漂移。
- 基于稠密匹配的多流漂移校正轨迹传播,在纹理缺失区域保持长程对应。
方法概览
VidMap 包含视频感知提取和全局建图两阶段。提取阶段利用稠密匹配进行运动感知关键帧选择、多流漂移校正的稀疏轨迹传播、保留来源标签的回环闭合,并估计单目深度先验。建图阶段在全局SfM中引入来源感知鲁棒损失(顺序边用Huber,回环边用Cauchy)和带逐图尺度优化的度量深度先验,通过旋转平均、全局定位和光束平差联合优化位姿、内参和深度尺度。
- 运动感知关键帧选择:VidMap基于稠密光流选择关键帧,当帧间运动超过阈值时触发新关键帧。这比固定间隔采样更适应运动速度变化,避免前向运动时关键帧过少的问题。
- 多流漂移校正轨迹传播:对于每个新关键帧,系统通过最新匹配传播顺序轨迹,同时利用多个历史匹配进行漂移校正。具体而言,将当前预测与多个历史流的投影求加权平均,有效抑制长程传播中的累积误差。在纹理缺失区域,稠密匹配比稀疏关键点更可靠。
- 来源感知轨迹构建与回环闭合:VidMap将回环匹配视为顺序轨迹间的“软链接”,而非直接合并。当回环正确时,链接提供额外约束;当回环因视觉混叠而错误时,顺序轨迹本身仍保持完整,不会被污染。这与GLOMAP通过传递性合并所有匹配的做法形成鲜明对比。
- 来源感知旋转平均:在全局旋转平均阶段,VidMap对顺序边使用Huber损失(假设大部分内点),对回环边使用Cauchy损失(更宽容的尾部,容忍更多外点)。这使得系统能自动降权视觉对称导致的错误回环约束。
- 带深度先验的全局定位:VidMap将度量单目深度先验注入全局定位阶段,为每个相机-点观测添加深度约束。关键创新在于为每张图像估计独立的深度尺度因子,而非假设全局一致尺度,这适应了单目深度估计的尺度漂移特性。
- 深度正则化相对位姿估计:对于纯旋转等退化运动,传统对极几何无法可靠估计相对位姿。VidMap利用深度先验将2D匹配提升为3D-2D对应,通过PnP求解相对位姿,有效约束退化自由度。
- 渐进非凸性优化策略:在光束平差中,VidMap采用渐进非凸性策略,逐步收紧鲁棒损失阈值。初期宽容的阈值允许大误差观测参与优化,后期收紧以精化结果,避免过早陷入局部最优。
- 内参估计:VidMap结合视图图标定和单目内参先验估计初始内参,并在全局优化中进一步精化。这使其能处理未标定视频,而多数SLAM方法需要已知内参。
逐图理解论文
失败案例与直觉

图1对比了SLAM、SfM和VidMap三种范式在视觉对称场景下的表现。SLAM因因果性无法从跟踪失败恢复,SfM因忽略时序而混淆视觉对称,VidMap通过来源感知和全局优化成功重建。这是理解论文核心动机的关键图。
核心区分与研究空白

图4对比VidMap与GLOMAP的轨迹构建策略。左侧VidMap将回环作为软链接,错误回环不影响顺序轨迹;右侧GLOMAP通过传递性合并,一次错误回环污染整条轨迹。这是来源感知的核心机制。
方法贡献与验证

图2展示VidMap完整系统流程。从关键帧选择、深度估计、轨迹传播到来源感知建图,清晰呈现两阶段架构。注意回环闭合如何作为软链接而非直接合并进入建图阶段。
最强结论

图8视觉消融直观展示来源感知损失和深度先验的作用。左列无来源感知时红色错误回环边未被抑制,重建崩溃;右列无深度先验时退化运动导致全局定位失败。
价值与局限

图12展示三个视觉对称场景的对比。标准SfM因传递性合并所有对应,错误回环(红色边)导致重建坍塌;VidMap的时序轨迹传播使来源依赖鲁棒损失能有效抑制错误回环。
实验如何设计?
- 数据集:LaMAR(长轨迹室内外,含手持和头戴设备)、CroCoDL(灾难响应环境,iOS手机和四足机器人)、ETH3D-SLAM(小范围手持)、EuRoC(微型飞行器灰度视频)。四个数据集覆盖了从厘米级精度到长距离漂移、从室内到灾难现场的多场景。
- 对比方法:SLAM类包括DPV-SLAM、DROID-W、MegaSaM、ViPE;SfM类包括GLOMAP(多种变体)、COLMAP;端到端类包括DA3-Long、VGGT-SLAM2。全面覆盖现有主流方案。
- 评估指标:主要使用平移误差的AUC(曲线下面积),按不同窗口长度或误差阈值报告。LaMAR和CroCoDL使用W-AUC(窗口AUC),ETH3D和EuRoC使用AUC@阈值。
- 消融实验:逐一移除深度先验、来源感知损失、回环闭合、多流校正、渐进BA等组件,量化各模块贡献。
- 运行时间分析:测量各组件耗时随关键帧数量的增长,对比总运行时间与现有方法,分析关键帧策略对速度-精度权衡的影响。
- 轨迹质量分析:通过极线误差CDF和跟踪召回率评估不同匹配骨干和传播策略的轨迹质量。
关键结果与论文证据
- LaMAR未标定全窗口W-AUC:VidMap 88.5,远超ViPE 76.6、DA3-Long 76.5和GLOMAP-LG 62.3(第10页表1)。在已标定设置下优势同样显著。
- CroCoDL手机序列未标定全窗口W-AUC:VidMap 95.5,DA3-Long 88.9,ViPE 71.4,GLOMAP-LG 76.4(第12页表2)。机器人序列上VidMap 80.3,GLOMAP-LG仅19.2,差距巨大。
- ETH3D-SLAM未标定AUC@5cm:VidMap 51.4,ViPE 38.7,MegaSaM 38.4,GLOMAP-RoMA 27.7(第13页表3)。短序列上深度先验增益较小,但来源感知仍带来提升。
- EuRoC未标定AUC@5cm:VidMap 11.5,其他方法均低于1.5(第13页表3)。该数据集极具挑战性,VidMap是唯一能产生有意义结果的方法。
- 消融实验揭示深度先验最关键:移除全局定位中的深度先验,LaMAR 100m窗口W-AUC从89.3骤降至13.6(第15页表4)。来源感知损失移除后,全窗口W-AUC从88.5降至79.9。
- 视觉消融(第16页图8)直观展示:无来源感知损失时,视觉对称导致大量错误回环边被当作内点,重建崩溃;无深度先验时,退化运动使全局定位失败,轨迹漂移。
- 退化运动场景(第17页图9):纯旋转序列中,VidMap借助深度先验恢复完整房间几何,GLOMAP碎片化,COLMAP仅注册少量相机,DPV-SLAM严重漂移。
- 轨迹质量分析(第22页图16):RoMa稠密匹配配合多流传播,在长程跟踪召回率上显著优于所有光流方法,且多流校正的贡献超越匹配骨干本身。
阅读时需要注意
- 前向运动时运动感知关键帧选择可能过于保守,导致全局定位欠约束。
- 弱几何与视觉混叠共同作用时,大量错误回环可能压倒顺序约束,来源感知损失无法完全挽救。
- 严重模糊、遮挡或低纹理可导致轨迹断裂,全局优化无法恢复缺失的对应关系。
- 无可靠回环时,极长序列仍会累积漂移,系统退化为开环SLAM。
- 依赖学习的单目深度和内参先验,对分布外数据可能不可靠,深度先验在短序列上可能引入噪声。
- 系统为离线设计,不适用于实时应用,匹配阶段耗时最长。
关联工作
- GLOMAP:VidMap基于其全局SfM框架构建,扩展了来源感知损失和深度先验。GLOMAP的全局定位和旋转平均被直接修改以支持来源区分。
- ParticleSfM:利用光流链式传播轨迹,但无回环闭合,漂移校正限于局部平滑。VidMap的多流校正借鉴其思想但扩展到回环场景。
- MP-SfM:将单目深度融入增量SfM,但固定深度尺度且来源不可知。VidMap的逐图尺度优化解决了尺度不一致问题。
- ViPE和DA3-Long:作为主要对比基线,分别代表结合深度先验的SLAM和端到端长序列方法。VidMap在几乎所有指标上显著超越两者。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
VidMap:利用时序结构实现基于视频的运动恢复结构
Zador Pataki1 Paul-Edouard Sarlin2 Marc Pollefeys1,3
1苏黎世联邦理工学院 2谷歌 3微软空间人工智能实验室
摘要。精确恢复任意无约束视频的相机标定和度量位姿,将为导航和场景理解解锁大规模训练数据。针对这一问题的主流方法存在严重局限:同时定位与建图(SLAM)因其因果、增量的特性,对初始化和瞬时故障敏感;它通常为实时操作过度优化,且一般需要已知的相机标定;而运动恢复结构(SfM)通常忽略图像顺序,能够实现最优初始化和全局优化,但缺乏对视觉对称性和极端运动的鲁棒性。为弥合这一差距,我们引入了一个系统,该系统结合了SLAM强大的序列约束与离线SfM的灵活性和全局优化,能够对任意长序列、未标定的视频进行度量重建。该系统利用宽基线稠密图像匹配的最新进展,将时序顺序作为可靠回环闭合的一等公民,并通过度量单目深度先验增强全局优化。因此,在展现极端运动和视觉对称性的多样化、具有挑战性的数据集上的全面评估表明,我们的方法在给定或未知相机标定的情况下,均比最先进的SLAM和SfM(无论是经典方法还是基于学习的方法)显著更鲁棒、更精确。代码已公开发布于https://github.com/cvg/vidmap。
1 引言
视频如今已成为世界上生成和消费的主导媒介,在线平台上有数十亿视频可用。机器人技术和可穿戴系统也通过不间断的视频流感知世界。为充分利用这些数据,许多计算机视觉应用需要相机位姿和标定。这些信息无法由现有系统可靠地估计,这些系统主要针对专家用户采集的数据而设计,因此无法应对任意视频的挑战:退化且快速的运动、视觉对称性、无纹理环境或未知标定。这些系统通常属于SLAM或SfM的范畴。 SLAM [6, 11, 21, 29, 34, 39, 55] 专为实时操作设计,因此以因果和增量的方式,在每张新图像可用时即对其进行注册。系统在每个时间点仅采用单一解,
第 2 页
2 Pataki 等
SLAM VidMap 增量式/因果性 ✅ 全局式/非因果性 无法从大漂移中恢复 预先进行回环闭合 防止漂移
挑战性运动 漂移
SfM 无时序约束 ✅ 有时序约束 对称性失效 拒绝视觉混叠
图 1: VidMap 重建具有复杂运动和视觉歧义的长序列、无约束视频。SLAM 因其因果性,无法从严重的跟踪失败和漂移中恢复。SfM 将视频视为无序图像集,因此无法利用时序线索来消除视觉对称性的歧义。VidMap 预先使用回环闭合等全局线索来防止漂移,同时保留时序来源以拒绝视觉混叠。此外,通过在全局定位中注入度量深度约束,VidMap 对尺度漂移和退化运动保持鲁棒。
仅依赖过去的信息,即使在环境或运动部分可观测的情况下也是如此。因此,SLAM 对弱初始化敏感,因为早期引入的误差会传播到整个序列并随时间累积。大多数系统因此需要精确估计相机内参 [6,39,55]。由退化运动引起的瞬时故障会导致跟踪丢失,且通常无法恢复。在实践中,学术界的 SLAM 系统针对速度进行了优化,并紧密耦合所有组件,这使得探索替代设计和利用计算机视觉的进步变得困难。
相比之下,SfM 专为离线操作设计,在确定解之前会考虑所有可用信息,从而最大化精度。此过程要么是全局式的 [38,42,64],即一次性求解所有位姿;要么是增量式的 [35, 45, 48, 51],即以最优顺序配准图像,并且可以联合优化相机标定。SfM 忽略视频的序列结构,因此同样可以处理无序图像集 [42, 48, 51],使其应用更广泛。然而,这意味着 SfM 无法利用视频的时序连续性:它同等对待所有图像对,因此对视觉对称性的鲁棒性较差。此外,由于 SfM 在运动估计之前完成所有数据关联,它无法根据运动动态调整其计算和关键帧选择。
总的来说,经典 SfM 和 SLAM 通常对无纹理环境、光照不佳、模糊和退化运动缺乏鲁棒性。用于图像匹配与跟踪 [26, 33, 46, 54, 70]、标定 [22, 57]、度量深度 [3, 24, 44, 61]、三维表面估计 [16, 31, 40, 43] 以及对称性歧义消除 [5, 65] 的数据驱动先验提高了它们的鲁棒性,但并未解决上述问题。
第 3 页
VidMap 3
上述结构性局限。端到端学习模型[58, 62]更为鲁棒高效,但缺乏精度、可扩展性和长期一致性。 为弥合这一差距,我们提出VidMap,一个融合SLAM与SfM互补优势的新系统。VidMap利用视频固有的时序顺序来处理极端运动,同时避免因视觉对称性导致的数据关联错误。这种顺序性使得利用稠密的像素级匹配更加容易,而这类匹配历来与SfM所需的离散轨迹不兼容。受SLAM启发,我们在SfM的全局优化中将局部跟踪与长期回环闭合分离,从而在最大化局部一致性的同时减少长期漂移。我们通过度量单目深度先验来增强此优化,以减轻尺度漂移并处理多视图约束本身不足的退化配置。 我们的系统效率极高,利用了SLAM中基于运动的关键帧选择,同时在长序列上易于并行化。 我们在新的基准测试[2,47]上评估VidMap,这些基准包含由机器人和非专业用户拍摄的长视频,因此呈现出极端运动、视角和对称性。实验表明,无论相机内参已知还是未知,VidMap的性能都大幅超越所有现有方法——从经典方法到端到端学习方法,涵盖SLAM和SfM,同时在已饱和的既有基准[4,49]上保持相似性能。
2 相关工作
视觉SLAM通过跨连续帧跟踪特征、基于运动选择关键帧以及闭合回环来减少漂移,从而利用视频的序列结构。经典系统[6, 20, 27]在内参已知且场景纹理丰富时表现良好,但在重复结构下性能下降,且需要仔细标定。学习型SLAM方法[10, 14, 34, 55, 56]用学习得到的替代方案替换手工设计的组件(如跟踪),在挑战性条件下提高了精度,同时保留了相同的增量式架构。后续研究将稠密几何预测和单目深度集成到SLAM中[25,31,37,40,69],但其底层处理仍是因果性的,即在观测整个序列之前估计几何。这种因果性承诺是结构性的瓶颈:来自退化配置(前向运动、低视差、局部对称性)的位姿和标定误差,在使用条件良好的观测之前就被锁定。回环闭合能校正位姿漂移,但无法撤销已嵌入地图的决策,且跟踪失败不可恢复。相比之下,我们的方法利用SfM的全局优化和自标定,以最大化鲁棒性并最佳利用多视图约束。
运动恢复结构对所有观测进行联合优化。增量式方法[35,45,48,51]通过重复的后方交会和光束平差逐帧配准图像;全局方法[9,38,42,64]则同时求解所有相机参数。然而,SfM的优化与来源无关:它等同对待所有对应关系,无论其来自
第 4 页
4 Pataki 等人
顺序重叠或回环闭合,使其容易受到重复结构引起的视觉混叠影响 [5, 65]。学习式图像匹配 [13, 17, 19, 33, 46, 52] 提升了前端鲁棒性,但并未解决这一结构性的局限。学习式表征已被集成到 SfM 中 [16, 59],用稠密点图或学习式轨迹替代几何基元,但在长序列上牺牲了几何精度。ParticleSfM [70] 将光流中的稠密点轨迹集成到全局 SfM 中,改善了无纹理区域的覆盖度,但仅通过链式连续流构建对应关系,缺乏回环闭合,导致漂移校正仅限于局部平滑。FlowMap [50] 通过光流上的梯度下降从视频中恢复位姿和深度,但受限于短序列且缺乏几何验证。将单目深度集成到经典 SfM 中的方法 [36, 43] 保留了几何精度,但继承了来源无关的匹配。我们的方法则通过视频感知的跟踪和单目深度先验来增强全局 SfM。区分顺序边与回环闭合边对应关系,在保留时序信任的同时缓解视觉混叠;带逐图像尺度估计的度量深度,则对多视图约束单独不足以应对的退化配置进行正则化。
前馈学习算法 [28,32,58,62,63,67] 以端到端的方式从多张图像中联合预测相机位姿、标定和稠密三维结构,无需任何显式的几何优化。通过学习到的先验,它们在稀疏视角和低视觉重叠的场景中实现了令人印象深刻的鲁棒性。然而,当图像具有足够重叠时,其精度仍然较低,并且在长序列、高频视频序列中表现出显著更多的漂移和不一致性。由于记忆和上下文窗口有限,要扩展到训练分布之外,就需要分块对齐 [12] 或流式融合 [37],这会在块之间重新引入增量漂移,且无法跨块传播不确定性。其他针对视频定制的方法 [8,60] 通过压缩记忆顺序处理帧,利用循环或测试时训练扩展有效上下文,但会在其训练分布的运动、环境和视频长度之外出现性能退化。核心的权衡是结构性的:学习模型以牺牲几何精度、可扩展性和零样本泛化能力为代价,换取了鲁棒性和速度。相比之下,我们在学习模型擅长的方面——图像匹配和度量深度估计——使用它们,但在精度和可扩展性上依赖显式的几何优化。
3 方法
问题形式化。给定一段视频 I = {I1, . . . , IN},其相机内参未知,我们为一组选定的关键帧 K ⊂{1, . . . , N} 估计相机位姿 Ti ∈SE(3)、内参 Ki,以及稀疏三维点云 X = {Xk}。
概述。首先,视频感知提取(第 3.1 和 3.2 节)将 SLAM 中的顺序跟踪和关键帧选择概念适配到一个离线稠密匹配流程中:从连续视频流中选择关键帧,构建长
第 5 页
VidMap 5
视频特征匹配 回环闭合 相机标定 关键帧 时间 顺序 对 … … … 视图图 标定 无约束 稠密 {"!%} 稀疏轨迹 ! 视频匹配传播 错误回环初始化 "#
视频提取 闭合
旋转平均 全局定位 度量深度 时间 提取的 正则化 边深度 回环闭合 边 外点 ⍴ 外点 ⍴ BBB BBB 回环闭合 观测
来源感知建图
图 2: 系统概览。我们利用光流选择关键帧,并为每个关键帧提取单目深度。通过稠密匹配在关键帧之间,以及通过图像检索检测到的回环闭合之间,采样并传播稀疏轨迹。我们使用视图图标定和单目标定先验估计初始相机内参。建图过程保留成对相对位姿和轨迹观测的来源信息:我们记录哪些边是顺序边或回环闭合边,以便区别对待。因此,鲁棒优化在旋转平均阶段将错误的回环闭合图像对视为外点,并在全局定位阶段剔除由视觉混叠引起的回环闭合观测。通过注入度量深度先验,全局定位对退化运动和尺度漂移保持鲁棒。
通过稠密变形链式传播获得带协方差的稀疏轨迹,将回环闭合(LC)观测与顺序观测分离,并为每个关键帧提取单目深度和焦距先验。尽管提取过程遵循时间顺序以利用视频结构,但它是非因果的:多次遍历会重新访问数据(低分辨率匹配、关键帧检测、高分辨率细化、轨迹传播),并且在观察到整个序列之前不会做出任何决策。其次,全局建图(第 3.4 节)将新的优化机制引入全局 SfM [42]:在全局定位(GP)中引入带逐图像尺度估计的单目深度先验,以及区分顺序边和 LC 边的来源依赖鲁棒损失。
3.1 视频特征匹配
在大规模数据上训练的稠密匹配器对表观变化、视角变化和无纹理表面已变得高度鲁棒。我们利用这种鲁棒性来提取具有亚像素精度和定位协方差的稀疏特征轨迹,这些特性是稀疏匹配在低纹理区域无法提供的。我们的方法将 SLAM 中的顺序跟踪概念(关键帧选择、滑动窗口传播、光流链式传播)适配到稠密匹配设定中,摆脱了实时约束。关键的结构特性是连续视频帧在局部上是无歧义的:相邻视图具有高重叠度,并且
第 6 页
6 Pataki 等
稠密匹配利用整个图像的上下文信息来解决局部歧义,这些歧义会困扰稀疏或无顺序的匹配。通过沿时间链式连接稠密对应关系,这种保证可以扩展到整个视频,生成对视觉混叠具有鲁棒性的长轨迹,而视觉混叠正是图像检索失败的原因。
跟踪。 我们基于一个由粗到精的稠密匹配器 [18] 进行构建。给定图像 \(I_a\) 和 \(I_b\),该匹配器会生成一个稠密光流场 \(W_{a \to b} : \mathbb{R}^2 \to \mathbb{R}^2\)、逐像素的确定性 \(c_{a \to b} \in [0, 1]\) 以及逐像素的定位协方差 \(\Sigma_{a \to b} \in \mathbb{R}^{2 \times 2}\)。与依赖可重复关键点检测器的经典 SfM 不同,稠密匹配器为每个像素预测精确的光流,从而可以在任何位置采样对应关系,即使在无纹理区域也是如此。给定图像 \(I_a\) 中的稀疏关键点,每个点 \(x\) 通过光流传播到 \(I_b\):\(\hat{x}_b = W_{a \to b}(x_a)\),其协方差 \(\Sigma_{a \to b}\) 由匹配器预测。在连续帧之间链式连接这种传播可以生成长轨迹。在每对位移误差独立的加性模型下,定位协方差会沿着轨迹的连续帧对逐渐增长,即 \(\Sigma^{\text{seq}}_i = \Sigma^{\text{seq}}_{i-1} + \Sigma_{(i-1) \to i}\)。
关键帧检测。 我们不需要所有视频帧来进行重建。我们根据观测到的运动自适应地选择关键帧,基于跟踪到的图像位移而非固定的时间间隔来触发。对于每一对连续帧,我们使用低分辨率光流场估计帧间运动。从每个关键帧采样的稀疏关键点开始,我们通过光流场将它们传播到后续帧。当足够大比例的关键点移动超过限制距离或丢失跟踪(例如由于遮挡)时,我们插入一个新的关键帧。
轨迹构建。 对于每个选定的关键帧 \(K_i\),我们将每条轨迹从其在前一关键帧 \(K_{i-1}\) 中的位置 \(x_{i-1}\) 传播到其在 \(K_i\) 中的对应位置 \(x_i\)。然而,通过连续关键帧的重复传播会累积跟踪漂移。基于 [41],我们通过同时使用从 \(W\) 个先前关键帧窗口到 \(K_i\) 的直接光流来减少这种漂移。我们将这些先前关键帧的索引记为 \(J_i := \{k \in \mathbb{N} \mid i – W \leq k < i\}\)。对于每个 \(j \in J_i\),将 \(W_{j \to i}\) 应用于轨迹位置 \(x_j\) 会生成候选预测 \(\hat{x}^{(j)}_i = W_{j \to i}(x_j)\)。对于每个候选预测 \(\hat{x}^{(j)}_i\),我们计算传播后的定位协方差:\(\Sigma^{(j)}_i = \Sigma^{\text{seq}}_j + \Sigma_{j \to i}\)。我们选择协方差迹最小的候选,其索引为 \(j^* = \arg\min_{j \in J_i} \operatorname{tr}(\Sigma^{(j)}_i)\)。然而,来自非相邻关键帧的预测比顺序预测 \(\hat{x}^{\text{seq}}_i := \hat{x}^{(i-1)}_i\) 更容易受到视觉混叠的影响。因此,我们仅在所选候选与顺序预测足够一致时才接受它:
\[ \mathbf{x}_i = \begin{cases} \hat{\mathbf{x}}_i^{(j^*)}, & \text{if } \left\|\hat{\mathbf{x}}_i^{(j^*)} – \hat{\mathbf{x}}_i^{\text{seq}}\right\| < \tau \operatorname{tr}\!\left(\Sigma_i^{(j^*)}\right) \\ \hat{\mathbf{x}}_i^{\text{seq}}, & \text{otherwise}. \end{cases} \]
其中 \(\tau\) 是一个固定的容差因子。
轨迹过滤。 我们移除会损害优化的轨迹。当轨迹的确定性低于可见性阈值时,轨迹被终止。对于每条
第 7 页
VidMap 7
! i-4→i
下一轨迹: seq ! ! +! i-n→i i-n i-3→i !i-2→i argminn !seq i-1 ! !seq i-1→i !seqi 无支持轨迹 i-3 !seq 拒绝 i-2 轨迹来源 !!
图 3: 多流漂移校正。对于每个新关键帧 Ki,顺序轨迹通过最新匹配 Ki−1 →Ki 进行传播,产生带有累积协方差 Σseqi 的预测 ˆxseqi。为减少漂移,VidMap 还评估来自更早锚点 Ki−n →Ki 的直接预测,产生带有协方差 Σ(i−n)i 的 ˆx(i−n)i。我们选择协方差迹最小的直接候选,仅当其与 ˆxseqi 一致时才接受;否则,拒绝 ˆx(i−n∗)i 并保留顺序预测。
对 (Kj, Ki)(其中 j ∈Ji),我们估计一个基础矩阵并移除具有较大极线误差的轨迹,捕捉跨越深度边界的漂移以及因遮挡产生的虚假对应,否则这些会在三角化中引入系统误差。最后,我们以概率方式对空间聚集的轨迹进行稀疏化,以保持均匀覆盖(见附录 E.1)。
深度估计。对于每个选定的关键帧 i,我们估计一个单目深度图 [32],为每个观测像素 k 产生深度先验 mik 和不确定性 σik。这些先验在全局定位和光束平差期间用于正则化退化几何和尺度漂移。
3.2 回环闭合
顺序跟踪(第 3.1 节)在连续关键帧之间产生可靠的轨迹,但无法恢复同一场景在时间上相隔较远的视图之间的约束。回环闭合添加了此类约束,但可能不正确,从而破坏重建。
检索与匹配。我们使用 MegaLoc [1] 为每个关键帧提取全局描述子,并为每个查询检索超过检索相似度阈值的前 k 个候选,排除已被顺序重叠覆盖的对。检索到的对在现有关键点位置使用稠密匹配器进行匹配,并通过几何验证进行校验。
轨迹建立。标准全局 SfM 通过传递性将所有对应合并为轨迹,使得顺序观测和回环闭合观测无法区分。我们改为仅从顺序边构建轨迹。当回环闭合匹配连接到一个已属于顺序轨迹的关键点时,我们不通过传递性将其合并;相反,该对应作为带有来源标签 lik = lc 的单独观测附加,而顺序观测则带有 lik = seq,从而保留链式顺序轨迹。这种分离使得全局建图(第 3.4 节)中能够采用依赖于来源的鲁棒损失:顺序边比回环闭合边受到更严格的信任,因为后者可能源于视觉混叠(见图 4)。
第 8 页
8 Pataki 等
VidMap 轨迹构建 GLOMAP 轨迹构建 回环 传递闭包 链式连接
⍴
t t
鲁棒 退化 来源感知轨迹 残差 GLOMAP 轨迹残差
图 4: 来源感知轨迹建立。左:VidMap 从顺序匹配构建轨迹,并将回环闭合(LC)视为顺序轨迹之间的软连接,当 LC 错误时轨迹仍保持可靠。右:GLOMAP 通过传递性合并 LC 匹配,因此来源信息丢失,一个错误的闭合可能将独立的顺序链合并为不可分割的轨迹。
旋转平均输出 全局定位输出 来源 感知 轨迹
⍴ 错误 鲁棒 退化 回环 ⍴ 残差 轨迹 闭合 参考 GLOMAP VidMap GLOMAP VidMap
图 5: 来源感知旋转平均与全局定位。在视觉对称性下,GLOMAP 将错误的回环闭合(LC)约束视为普通边和观测,破坏了旋转平均并在全局定位中产生退化轨迹。VidMap 保留来源信息并鲁棒地降低 LC 离群值的权重,恢复正确的朝向和位置。
3.3 未标定视频
当相机内参未知时,我们在全局建图之前分两个阶段估计并优化焦距。
焦距估计。GeoCalib [57] 预测每张图像的稠密透视场,通过 Levenberg-Marquardt 优化从中恢复焦距。我们首先独立估计每个关键帧的焦距,然后选择置信度最高的 top-k 个关键帧,并以共享内参约束重新运行,在所有 k 个视图上联合优化单一焦距。
内参优化。共享内参通过视图图标定 [42, 53] 进行优化,该方法从具有大基线和良好三角化角度 [48] 的良态图像对的基础矩阵中估计焦距。当良态图像对不足时,我们回退到 GeoCalib 的估计值。优化后的内参作为光束平差的初始化,光束平差将内参与位姿和结构联合优化。
3.4 全局建图
我们基于 GLOMAP [42] 重建框架,该框架通过四个阶段估计相机位姿:视图图构建、旋转平均、全局定位和光束平差。我们通过两种对全局 SfM 而言全新的机制扩展了该框架。首先,具有逐图像尺度估计的单目深度先验
第 9 页
VidMap 9
在全局定位中引入度量深度先验,能够实现度量尺度重建,并正则化多视图几何本身约束不足的视频序列中固有的退化问题。其次,在旋转平均和全局定位过程中,基于来源的鲁棒损失函数会区分顺序边和回环闭合边。
旋转平均。对于每对关键帧,我们根据深度和对应关系估计成对相对旋转 ˜Rij [15]。旋转平均 [42] 随后通过在所有边上最小化测地距离 ∥log(R⊤j ˜RijRi)∥ 来估计全局朝向 {Ri}。我们分配基于来源的损失函数:顺序边采用 Huber 损失,以信任跟踪得到的边;而回环闭合边采用 Cauchy 损失,以降低错误闭合的权重。
带深度先验的全局定位。GLOMAP 的全局定位根据方位约束估计相机中心和三维点 [72]。对于每个观测 (i, k),令 mik 为轨迹位置处的单目深度先验,σik 为其不确定性。在旋转 {Ri} 由上一步固定后,我们联合优化相机中心 {ci}、三维点 {Xk} 以及每张图像的深度尺度因子 {si},其中 si 对图像 i 的单目深度先验进行重缩放。全局定位的目标函数结合了方位残差 eGPik、将优化深度与 si · mik 进行比较的深度残差 rdepthik,以及带有尺度不确定性 σs,i 的尺度正则化项 rscalei = log si:
![\left( lbearing{depth}}\!\left{scale}}\!\left{eq:gp} _ {l_{ik}} te x t {GP}}\ E _ { {GP}} = \sum _{(i ,k)}\l e f tho[ \r ^{\ \co \text (1)
每个观测都带有来源标签 lik ∈{seq, lc}(第 3.2 节),鲁棒损失函数 ρlik 根据来源进行选择。下面我们定义这些残差。
方位残差。该项惩罚观测相机射线 vik 与指向三维点方向之间的角度偏差:
\ l bea r ing {\ m athbf{e}_{ik}^{\text=\mathbf{v}_{ik}d_{ik}(X_kc_i)\label{eq:geomresidual} (2) co
其中,vik 是从 ci 出发经过观测 xik 的全局旋转后的相机射线,dik ≥0 是归一化因子。在光束平差中,由于旋转是自由的,该项被替换为像素空间中的标准重投影误差 eBAik = π(Ki, Ti, Xk) − xik。
协方差加权。每个观测都带有来自轨迹提取的二维像素协方差 Σik ∈ R2×2。在光束平差中,这直接对重投影误差进行加权。在全局定位中,残差存在于三维方位空间中。我们通过反投影和旋转将 Σik 传播到三维方位协方差 Σvik = Ji Σik J⊤i ∈ R3×3,其中 Ji 是相机坐标系方位关于像素坐标的雅可比矩阵。我们在补充材料中提供了完整的推导。
深度残差。对于每个观测 (i, k),在考虑每张图像的尺度 si 后,相机坐标系深度 zik 应与单目预测 mik 一致。位于相机前方的点使用对数空间残差;位于后方的点
第 10 页
10 Pataki 等人
表1:在LaMAR数据集[47]上的评估。我们报告了不同长度窗口下平移误差的AUC(以%计,越高越好)。VidMap在校准和未校准设置下均优于所有现有方法。
未校准 校准
W-AUC → 10 m 25 m 50 m 100 m full 10 m 25 m 50 m 100 m full
LoGeR 65.9 64.5 60.3 60.1 59.8 无法使用校准 VGGT-SLAM2 74.0 69.2 60.3 49.4 56.9 无法使用校准 Lingbot-Map 69.2 75.6 75.0 72.7 69.62 无法使用校准 DA3-Long 86.7 86.7 84.6 78.1 76.5 无法使用校准 DPV-SLAM 需要校准 53.1 39.0 25.1 14.9 38.2 DROID-W 需要校准 88.0 84.7 80.2 79.5 76.2 MP-SfM 需要校准 88.6 83.7 74.5 60.2 60.6 GLOMAP-LG 76.4 69.4 60.1 53.6 62.3 77.3 70.4 61.6 48.4 63.0 GLOMAP-RoMA 71.0 66.0 58.4 46.7 59.4 75.7 69.0 59.2 42.1 60.1 MASt3R-SLAM 60.8 63.6 55.6 47.3 51.5 69.3 68.8 65.0 58.1 57.7 MegaSaM 77.5 68.4 59.9 51.4 52.7 78.1 69.2 58.3 52.1 55.6 ViPE 86.6 83.8 80.2 78.1 76.6 87.3 84.9 80.4 79.5 78.8 VidMap 91.9 92.3 89.9 89.3 88.5 93.2 93.0 90.5 89.9 89.7
相机回退到线性:
\[ r_{\text{depth}} = \begin{cases} \log\!\left(\dfrac{z_{ik}}{s_i \cdot m_{ik}}\right) & z_{ik} > 0 \\[6pt] z_{ik} – s_i \cdot m_{ik} & z_{ik} \leq 0 \end{cases} \quad \text{其中} \quad z_{ik} = \mathbf{e}_3^\top R_i (X_k – c_i) \label{eq:depthresidual} (3) \]
光束平差。该步骤优化位姿{Ti}、三维点{Xk}、内参{Ki}以及每张图像的深度尺度{si}。与MP-SfM[43]在增量式重建后固定深度尺度不同,我们也对它们进行优化:
\[ E_{\text{BA}} = \sum_{(i,k)} \left( \rho\!\left( \| e_{\text{BA}}^{ik} \|_{\Sigma_{ik}}^2 \right) + \rho\!\left( r_{\text{depth}} \right) \right) \label{eq:ba} (4) \]
其中 eBAik = π(Ki, Ti, Xk) − xik 是以像素为单位的重投影误差,由轨迹提取得到的二维像素协方差 Σik 加权。到光束平差阶段,重建已接近正确解,且几何验证已滤除了不一致的回环闭合观测,因此我们对所有观测(无论其来源)应用统一的鲁棒损失。
鲁棒优化。受渐进非凸性[66]启发,我们在全局定位和光束平差的迭代过程中逐步收紧鲁棒损失。遵循MP-SfM[43]的做法,深度残差的Cauchy尺度随着几何结构稳定而退火。此外,我们通过将单目深度投影到成对相对位姿来标记深度匹配不一致的情况,并在深度比值超过阈值时将相应的深度残差切换为Cauchy损失。
第 11 页
VidMap 11
4 实验
4.1 数据集
我们使用四个数据集评估视频相机位姿估计的精度。整个系统中使用的所有超参数在所有数据集上均保持固定,并在单独的验证序列上进行了调优。
LaMAR [47] 是一个由手机和AR设备在三个大型室内场景(CAB、HGE、LIN)中录制的视频集合,包含真值位姿和标定信息。我们从建图划分中选取了50个手机视频,其真值位姿已公开。该数据集展现了具有复杂运动、视觉混叠(不同位置视觉相似导致的错误匹配)、无纹理表面以及退化视角的长轨迹,这些都对数据关联和轨迹优化构成了压力。
CroCoDL [2] 是一个由手机(62个)和机器人(26个)在4个灾难现场建筑中录制的序列集合,其图像具有复杂运动和非结构化的建筑环境特征。该数据集适用于评估学习方法在其训练分布之外的泛化能力。
ETH3D-SLAM [49] 包含55个使用手持相机录制的室内外序列,具有高精度的真值位姿和标定,以及变化的场景复杂度和相机运动。
EuRoC [4] 包含11个由无人机捕获的序列,具有灰度立体鱼眼相机和带有模糊的快速六自由度运动,这对基于学习的计算机视觉模型均构成挑战。
4.2 基线方法与评估指标
基线方法。我们评估了属于三个类别的现有方法。 SLAM与视觉里程计:DPV-SLAM [34] 基于学习的补丁跟踪与优化;MegaSaM [31] 和 ViPE [25] 将学习的光流与现成的单目深度和标定先验相结合;DROID-W [30] 还会掩蔽动态物体;MASt3R-SLAM [40] 依赖于稠密点图的两视图预测;端到端深度模型:DA3-Long [12, 32] 对齐使用 Depth Anything 3 [32] 重建的重叠子序列。LoGeR [68] 和 LingBot-Map [7] 利用了长上下文机制。全局SfM:我们评估了使用 SuperPoint+LightGlue [13,33] 和 SuperPoint+RoMA v2 [13, 18] 的 GLOMAP [42]。我们评估了两种标定设置:已标定使用真值内参;未标定则在没有先验的情况下从视频中估计内参。
评估指标。对于 ETH3D 和 EuRoC,我们报告全局对齐后平移误差的召回率曲线下面积(AUC,%)。由于对齐容易受漂移主导并忽略细粒度的局部精度,我们对展现更长序列的 LaMAR 和 CroCoDL 采用不同处理方式:我们计算每个轨迹局部窗口上的窗口化 AUC(W-AUC,%),其中我们将误差阈值调整为窗口大小的5%——详见补充材料。
第 12 页
12 Pataki 等人
表 2:在 CroCoDL 数据集 [2] 上的评估。我们报告了不同长度窗口下平移误差的 AUC(百分比,越高越好)。VidMap 在标定和未标定设置下均大幅优于所有现有方法,尤其是在具有挑战性的机器人序列上。
手机 机器人
窗口-AUC → 10 米 25 米 50 米 100 米 全长 10 米 25 米 50 米 全长
VGGT-SLAM2 62.8 64.3 66.0 62.5 74.9 34.1 31.9 33.1 52.8 Lingbot-Map 54.4 66.3 69.9 72.2 72.0 60.9 40.6 63.0 61.6 LoGeR 50.0 56.7 57.9 63.7 63.8 47.4 55.8 62.3 65.5 DA3-Long 86.2 88.1 88.5 88.8 88.9 79.5 82.4 82.0 78.3 GLOMAP-LG 77.8 66.6 60.0 65.9 76.4 10.2 7.4 10.3 19.2 GLOMAP-RoMA 66.2 57.8 53.5 56.3 74.8 12.7 10.0 10.3 20.3 未标定 MASt3R-SLAM 51.8 57.3 60.2 65.2 70.0 25.8 30.4 32.2 46.1 MegaSaM 50.2 50.2 43.5 35.2 50.1 41.9 39.5 32.4 45.5 ViPE 66.7 68.2 68.6 70.7 71.4 59.5 61.4 66.2 71.0 VidMap 94.0 95.0 95.3 93.0 95.5 91.4 85.7 82.5 80.3
DPV-SLAM 19.8 15.6 14.9 19.7 31.8 66.1 68.3 73.0 77.0 DROID-W 71.8 70.4 67.9 70.6 72.7 71.9 72.7 71.0 67.8 GLOMAP-LG 73.9 66.8 62.0 57.9 72.2 42.7 38.9 34.1 42.4 标定 GLOMAP-RoMAMASt3R-SLAM 77.350.1 65.252.6 57.243.8 60.638.6 75.363.6 45.929.8 42.529.5 37.727.1 45.045.4 MegaSaM 68.1 59.8 51.0 50.3 52.3 74.5 59.8 43.0 45.7 ViPE 70.0 71.6 71.0 71.1 74.3 62.1 64.5 68.9 72.2 VidMap 94.7 95.8 96.3 95.6 96.6 91.5 85.2 80.6 78.2
4.3 结果
LaMAR – 表 1,图 6。长序列表现出几何退化,例如基线窄、前向运动或无纹理表面,这对经典方法构成了挑战:仅依赖多视图几何的 GLOMAP 和 DPV-SLAM,其漂移比 VidMap 大一个数量级。利用度量深度先验的方法,如 ViPE 和 MegaSaM,对这些退化更鲁棒,能保持有限的漂移,但在精度上仍有不足。在给定真值标定的情况下,VidMap 同样优于所有现有方法,这证实了并非单一组件,而是视频感知提取与深度增强全局优化的协同作用弥补了差距。VidMap 在未标定和真值标定设置下的精度几乎相同,证实了 VidMap 能估计出准确的标定参数。
CroCoDL – 表 2,图 6。CroCoDL 评估了对灾难现场建筑中捕获的域外视频的泛化能力。DA3-Long 的深度模型在标准室内/室外场景上训练,在此分布外数据上性能显著下降。GLOMAP 的纯几何方法受限于缺乏视频感知提取。VidMap 在手机和机器人序列上均大幅优于所有基线方法,且无需重新训练或进行领域特定适配。
ETH3D-SLAM 和 EuRoC – 表 3。由于这些序列较短且条件良好,仅靠多视图几何就已足够,几何先验
第 13 页
VidMap 13
表3:ETH3D-SLAM与EuRoC数据集评估。我们报告不同误差阈值下平移误差的AUC(%,越高越好)。
| | ETH3D-SLAM | | | | | EuRoC | | | | | |———————-|——-|——-|——-|——|——|——|——|——|——|——| | AUC@Xm → | 5 cm | 10 cm | 50 cm | 1 m | 10 m | 5 cm | 10 cm | 50 cm | 1 m | 10 m | | GLOMAP-LG | 20.4 | 30.9 | 58.7 | 67.4 | 77.8 | 0.4 | 1.8 | 16.1 | 29.7 | 70.7 | | GLOMAP-RoMA | 27.7 | 39.3 | 56.8 | 60.8 | 65.5 | 0.0 | 0.2 | 12.3 | 27.9 | 64.8 | | LoGeR | 6.4 | 16.9 | 57.7 | 73.8 | 95.9 | 0.1 | 0.5 | 18.2 | 45.1 | 92.6 | | Lingbot-Map | 13.1 | 27.8 | 68.3 | 81.3 | 97.2 | 0.1 | 0.7 | 32.0 | 55.5 | 91.7 | | DA3-Long | 19.0 | 37.2 | 73.6 | 84.4 | 98.0 | 0.1 | 0.8 | 31.4 | 57.6 | 95.4 | | VGGT-SLAM2 | 26.4 | 44.1 | 75.7 | 84.3 | 97.1 | 1.3 | 7.8 | 55.4 | 74.2 | 96.9 | | 未标定 MASt3R-SLAM | 8.9 | 21.6 | 65.3 | 77.0 | 96.4 | 1.6 | 5.6 | 51.0 | 71.9 | 97.0 | | MegaSaM | 38.4 | 53.9 | 79.2 | 86.7 | 98.0 | 0.8 | 5.7 | 50.3 | 73.2 | 97.3 | | ViPE | 38.7 | 54.9 | 78.3 | 85.7 | 97.6 | 1.3 | 6.2 | 55.4 | 75.0 | 94.0 | | VidMap | 51.4 | 68.3 | 90.1 | 94.0 | 99.0 | 11.5 | 31.6 | 79.1 | 89.4 | 99.0 | | GLOMAP-LG | 27.9 | 38.6 | 64.6 | 72.3 | 80.9 | 12.8 | 35.3 | 72.4 | 79.8 | 91.8 | | GLOMAP-RoMA | 37.8 | 47.2 | 59.6 | 63.0 | 67.0 | 18.0 | 43.2 | 79.0 | 85.1 | 90.9 | | MASt3R-SLAM | 22.7 | 37.5 | 70.2 | 78.5 | 96.8 | 5.6 | 18.3 | 68.1 | 83.2 | 98.3 | | MegaSaM | 53.8 | 62.9 | 80.4 | 87.4 | 98.0 | 15.6 | 35.4 | 84.1 | 92.1 | 99.2 | | ViPE | 54.4 | 64.9 | 82.2 | 88.4 | 98.2 | 5.5 | 26.4 | 79.9 | 89.9 | 99.0 | | 已标定 DROID-W | 63.8 | 72.4 | 86.2 | 91.0 | 98.6 | 20.9 | 51.0 | 90.1 | 95.0 | 99.5 | | DPV-SLAM | 62.3 | 72.5 | 87.4 | 91.8 | 98.4 | 22.5 | 53.5 | 90.6 | 95.3 | 99.5 | | VidMap | 69.4 | 79.2 | 92.2 | 95.0 | 99.1 | 23.0 | 54.6 | 90.9 | 95.4 | 99.6 |
在已标定设置中,里程计主要引入噪声,使得DPV-SLAM成为最强基线。VidMap在ETH3D的所有阈值上均以显著优势超越它,在EuRoC上表现持平——后者使用灰度鱼眼相机且存在运动模糊,导致学习到的深度和标定先验可靠性及帮助性降低。
在未标定设置中,VidMap显著优于所有基线(包括经典方法和端到端学习方法),与最接近的基线ViPE和MegaSaM的差距更大。VidMap已标定与未标定结果之间18个点的差距证实,当运动较简单时,标定仍是精度的主要瓶颈。
4.4 详细分析
消融研究。表4衡量了关键设计决策的影响,并表明VidMap的所有组件对其高鲁棒性和精度至关重要。在全局定位或光束平差中移除深度先验会导致精度下降,因为这些先验添加了几何约束,可防止在复杂运动下产生退化估计。无尺度优化依赖单目度量尺度,并阻止逐图像细化。无度量尺度则丢弃度量先验,仅基于多视图约束优化逐图像尺度。两种变体均削弱了在LaMAR上更长时序的鲁棒性。因此,VidMap将度量单目深度用作软先验,而非刚性约束。总体而言,深度和度量尺度的优势在ETH3D-SLAM上较小,该数据集序列
第 14 页
14 Pataki 等人
VidMap DA3-Long VIPE GLOMAP
图 6: 在 LaMAR(上)和 CroCoDL(下)上与现有方法的定性比较。每行比较 VidMap 与 DA3-Long、ViPE 和 GLOMAP 在一个场景上的结果,并展示代表性的输入图像。VidMap 重建场景无漂移,而其他方法则出现漂移或丢失跟踪。
总时间 深度提取 160 我们的方法 VIPe 光束平差 回环闭合 DA3-Long COLMAP (1/2) 40 全局定位 跟踪 DPV-SLAM GLOMAP 提出的方法 140 相对位姿 关键帧选择 GeoCalib 120 30 100 (分钟) 80 时间 20 60 10 40 20
0 0 200 300 400 500 600 700 800 211-445 475-534 538-630 631-780 关键帧数量 关键帧区间数量 90 我们的方法 COLMAP 88 1/2 GLOMAP GLOMAP+RoMa 18 85 我们的方法 1/3 我们的方法 固定关键帧 (%) 17 80 1/4
1/6 内存 16 100m@5m 70 (GB)
全部 1/2 峰值 1/3 全部 (245分钟) 1/4 15 全部 (99分钟) WATE-AUC 6050 40 1/6 1/3 1/2 1/2 30 20 1/6 1/4 1/6 1/3 14 0 10 20 30 40 50 60 227-511 518-569 587-661 671-828 运行时间 (分钟) 关键帧数量
图 7: 运行时间分析。左上:各组件耗时随关键帧数量增加的变化。匹配是最昂贵的步骤。右上:总运行时间与现有方法的比较。左下:关键帧选择对速度和精度的影响。运动感知关键帧选择以更低成本保持了稠密关键帧选择的精度,而激进的关键帧选择以精度为代价减少了运行时间。右下:峰值内存使用量在更长视频下仍保持实用。
第 15 页
VidMap 15
表4:在LaMAR和ETH3D-SLAM数据集上的消融研究。度量深度先验对远距离精度最为关键,而来源感知损失和回环闭合则提升了对错误多视图观测的鲁棒性。
| | LaMAR (窗口AUC ↑) | | | | | ETH3D-SLAM (AUC ↑) | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 10 m | 25 m | 50 m | 100 m | 完整 | 5 cm | 10 cm | 50 cm | 1 m | 10 m | | VidMap | 91.9 | 92.3 | 89.9 | 89.3 | 88.5 | 51.4 | 68.3 | 90.1 | 94.0 | 99.0 | | 深度先验 | | | | | | | | | | | | 全局定位中无深度 | 67.6 | 42.8 | 24.9 | 13.6 | 37.7 | 50.5 | 66.5 | 87.3 | 91.9 | 98.7 | | 光束平差中无深度 | 91.5 | 91.1 | 88.0 | 86.5 | 85.5 | 44.5 | 60.6 | 86.0 | 91.9 | 98.8 | | 无尺度优化 | 69.3 | 44.7 | 25.6 | 13.9 | 39.7 | 50.2 | 65.9 | 87.4 | 92.4 | 98.8 | | 无度量尺度 | 90.2 | 88.0 | 81.9 | 71.7 | 74.1 | 52.2 | 68.8 | 90.1 | 94.0 | 99.0 | | 时序结构 | | | | | | | | | | | | 无回环闭合边 | 90.8 | 90.3 | 87.6 | 86.6 | 85.5 | 32.9 | 47.4 | 77.5 | 85.9 | 97.9 | | 无来源损失 | 88.4 | 85.7 | 80.2 | 77.0 | 79.9 | 50.6 | 66.1 | 87.1 | 91.5 | 98.4 |
更短且运动约束更好。移除回环闭合边,即仅依赖顺序约束,会在ETH3D-SLAM上导致较大漂移。平等对待顺序边和回环闭合边(无来源损失)容易受到视觉混叠的影响,并在LaMAR上导致灾难性失败。
运行时间。我们在图7中分析了VidMap的速度和内存需求。VidMap是一个离线系统,但能高效处理长视频,因为时间随关键帧线性增长,且所需内存保持在实用水平。VidMap的效率与GLOMAP相当,且显著快于COLMAP。
5 结论
本文提出了VidMap,一个重建框架,它弥合了因果SLAM的时序感知与离线SfM的鲁棒全局优化之间的根本鸿沟。通过显式区分顺序跟踪与回环闭合观测,并将度量深度先验集成到全局优化中,我们构建了一种非因果范式,该范式保留了时序信任,而无需过早地固化为增量式几何解。因此,我们的方法估计出的轨迹显著更准确,在具有复杂运动和严重视觉混叠特征的、未经标定的挑战性数据集上,以大幅优势超越了现有方法。 尽管VidMap代表了单目重建领域的一次显著飞跃,但其几何精度尚未达到视觉惯性系统的严格容差。在越来越长的序列上减轻远距离漂移仍然是一个艰巨的挑战,这为将世界上丰富的视频流转化为用于空间计算和生成式场景建模的高精度3D模型开辟了激动人心的前景。
致谢:本工作由DSO国家实验室资助,项目号DSOCO24035。我们感谢Xudong Jiang、Tobias Fischer、Shaohui Liu和Haofei Xu对本课题早期探索的贡献。
第 16 页
16 Pataki 等人
VidMap
俯视图 侧视图
消融实验
俯视图 侧视图 无来源感知损失 全局定位中无深度
图 8: 可视化消融实验。每列上方为轨迹图像,下方为对应的重建结果,分别展示 VidMap(上)和消融实验(下);GT 轨迹为黄色,估计轨迹为蓝色。左图:红色回环闭合边被作为外点剔除,绿色边则作为内点保留。若无来源感知损失,VidMap 无法降低对称结构的权重,导致重建崩溃。右图:若全局定位中缺少深度先验,挑战性运动和退化几何会破坏全局定位并导致漂移。
A 定性结果
无约束视频中的挑战。无约束视频为 SfM 带来了若干反复出现的挑战。退化几何:纯旋转使三角测量无法进行;深度先验解决了这一问题(图 9)。无纹理区域:稀疏匹配器缺乏覆盖;稠密轨迹传播可在无特征片段中维持对应关系(图 10 和 11)。局部对称性:顺序匹配会混淆相同结构;时序轨迹排序可防止在不同实例间跳跃(图 12)。全局对称性:在建筑尺度上,基于检索的回环闭合可能会在视觉相似的位置之间提出错误的闭合;来源依赖的鲁棒损失会相对于顺序证据降低回环闭合匹配的权重。轨迹尺度:在较长轨迹中,这些挑战会叠加;全局优化可分散误差,而因果方法则会累积漂移。VidMap 的主要失效模式将在第 A.1 节中讨论。
第 17 页
VidMap 17
图 9:几何先验解决退化相机运动。纯旋转在无约束视频中频繁出现,导致三角测量无法进行。深度先验约束了退化的自由度:VidMap 恢复了房间几何结构,而 GLOMAP 出现碎片化,COLMAP 仅注册了少量相机,DPV-SLAM 则发生漂移。
图 10:在无纹理区域建立轨迹。无纹理和特征稀疏的场景在无约束视频中大量存在。左图:相机经过一面无纹理的墙壁;仅依赖显著关键点(VidMap-ALIKED+LG [71])使得该片段约束不足。通过稠密匹配进行轨迹传播,在整个过程中保持了对应关系。右图:一个黑暗、特征稀疏的房间,VidMap-ALIKED+LG 无法建立足够的匹配;得益于回环闭合,尽管丢失了一些帧,重建仍然得以恢复。
第 18 页
图 11:困难过渡。相机穿过门口进入走廊,结合了纯旋转与短轨迹。左:我们的方法恢复了轨迹。中:没有几何先验,退化段导致跟踪丢失和尺度崩溃。右:VidMap-ALIKED+LG 创建了两个不相交的重建。两个组件都是必需的:仅靠几何先验无法补偿缺失的轨迹,而仅靠稠密匹配无法解决退化几何。
图 12:局部对称性的挑战。对于三个序列,我们展示了具有对称性的代表性图像,并可视化了由标准 SfM(左)和我们的方法(右)估计的相机位姿和三维点云。SfM 通过传递性平等对待所有对应关系,不区分顺序边和回环闭合观测。因此,错误的回环闭合(在视图图中可视化为红色边)会导致重建崩溃(左)。我们的时序轨迹传播支持依赖于来源的鲁棒损失,从而抑制错误闭合(右)。
第 19 页
VidMap 19
A.1 局限性
– 前向运动关键帧选择。在前向运动过程中,许多轨迹保持在极点附近,图像位移很小。因此,当需要额外的几何支撑时,关键帧选择准则可能会选取过少的视图,导致全局定位约束不足。 – 弱几何与视觉混叠的相互作用。近前向运动且远离极点的轨迹很少时,对平移和深度的约束较弱。如果视觉混叠产生许多相互一致的错误回环闭合,它们的聚合影响可能会压倒顺序约束:Cauchy损失会降低每条边的权重,但不会消除其梯度。全局定位随后可能收敛到一个错误的解。 – 跟踪失败。严重的模糊、遮挡、视角突变或低纹理区域可能导致轨迹中断。由于全局优化无法恢复丢失的对应关系,大范围的轨迹丢失可能导致漂移或完全重建失败。 – 长距离漂移。在没有可靠回环闭合的情况下,尽管进行了全局优化,微小的局部误差仍可能在非常长的序列中累积。 – 对学习先验的依赖。对于分布外图像或相机,单目深度和标定先验可能变得不可靠,从而限制重建的精度。
视觉对比。图13至图15将VidMap与现有方法在LaMAR和CroCoDL数据集上进行了比较。在LaMAR上,因果方法(DA3-Long, ViPE)在较长轨迹上会累积漂移,而VidMap保持了尺度一致性和拓扑结构(图14)。在CroCoDL上,VidMap能泛化到大多数基线方法失败的分布外灾难响应环境中(图13和图15)。
B 跟踪器消融实验
B.1 轨迹质量(对极误差)
使用真值位姿评估跨关键帧跳数的对极误差。每个跟踪器利用中间帧在关键帧之间传播ALIKED关键点;然后在关键帧位置根据真值对极几何评估轨迹。ETH3D SLAM提供亚毫米级的运动捕捉真值,但LaMAR的位姿源自激光雷达对齐的运动恢复结构(约厘米级精度)。这种真值噪声会同等程度地放大所有方法的对极误差,在LaMAR上建立了一个共享的噪声基底。
讨论。在所有跳数距离下,RoMa在两个数据集上均持续优于所有基于光流的跟踪器[41]。随着跳数增加,漂移加剧,多流传播进一步拉大了这一差距。CoTracker3在合成数据上训练以建模动态物体,未能准确跟踪刚性三维结构;像AllTracker [23]这样的现代深度跟踪器相比两视图RAFT有所改进,但显著的
第 20 页
20 Pataki 等
图 13: 在 CroCoDL 上的分布外泛化。三个灾难响应场景。左:所有基线方法的 iOS 序列轨迹,与真值(虚线)对齐。右:相应的场景图像,显示碎石、倒塌结构和变化的光照。上行:iOS 视频;下行:四足机器人采集。VidMap 保持精确,而其他方法难以泛化到这些分布外环境。
与全局匹配的精度差距仍然存在。这些平均值低估了问题:在无约束视频中,相机可能经历快速的视角变化(例如头戴设备的头部旋转),在连续关键帧之间产生大的场景空间位移。基于光流的方法局部传播匹配,无法从此类位移中恢复,而 RoMa 为每对图像从头建立对应关系。端到端比较(第 B.2 节)证实了这一点:用跟踪器替换 RoMa 会降低重建质量,尤其是在视角突变序列上。VidMap-ALIKED+LG 则遭遇互补性失败:稀疏关键点检测器
第 21 页
VidMap 21
我们的方法 DA3-Long ViPE
图 14:LaMAR 上的定性比较。三个场景(CAB、HGE、LIN) 包含样本帧和鸟瞰轨迹图(左)以及叠加轨迹的三维重建(右;红色:真值,蓝色:估计值)。VidMap 保持了尺度一致性和拓扑结构;DA3-Long 和 ViPE 由于在较长序列上的累积误差而表现出渐进式漂移。
在无纹理区域缺乏可重复性,产生很少甚至没有匹配,而稠密传播则能保持覆盖。我们的完整流程结合了全局匹配的鲁棒性与稠密跟踪的覆盖能力。
B.2 跟踪器主干比较
跟踪器变体。对于 RAFT、AllTracker 和 CoTracker3,我们仅替换了轨迹传播主干:每个跟踪器通过中间帧,使用滑动窗口提取的方式在关键帧之间传播 ALIKED 关键点,而关键帧选择、回环闭合匹配、深度提取和全局建图均与 VidMap 保持一致。VidMap(等效)使用 RoMa 作为链式跟踪器(逐帧传播,无多流校正),仅采样 ALIKED 关键点,以将主干作为唯一变量进行隔离。
VidMap-ALIKED+LG。此变体全程用稀疏特征匹配替代稠密跟踪。在每个关键帧提取 ALIKED 特征,并
第 22 页
22 Pataki 等人
我们的方法 DA3-Long
图 15:CroCoDL 上的定性对比。两个灾难响应场景(iOS 手机和四足机器人)。鸟瞰轨迹图(左)对比所有基线方法;俯视和侧视的三维重建结果(右;红色:真值,蓝色:估计值)。VidMap 能够泛化到这些分布外环境,而基线方法则出现显著漂移或重建失败。
ETH3D SLAM LaMAR 85 75
80 70 75 65 70 召回率@5px 65 召回率@5px 60 60 55 1 2 3 4 5 1 2 3 跳数 真值关键帧距离 RoMa 链式 RoMa + 多流(我们的方法) AllTracker CoTracker3 RAFT
图 16:跨关键帧跳数的轨迹质量。ETH3D SLAM(左,按跳数)和 LaMAR(右,按真值关键帧距离)上的召回率@5px。RoMa 作为简单的链式匹配器使用时,已优于所有基于光流的轨迹器;多流传播进一步拉大了差距,证实校正步骤带来的增益超越了主干网络的选择。
在连续帧对上使用 LightGlue 进行匹配;轨迹通过传递性链接,累积漂移的方式类似于基于光流的传播。窗口匹配提供了几何验证和回环闭合对应关系。
第 23 页
VidMap 23
ETH3D SLAM,ALIKED 关键点
跳数 1 跳数 3 跳数 5 90 90 90
80 80 80
70 70 70 阈值 60 60 60
50 50 50以下 % 40 40 40
30 30 30 2 4 6 2 4 6 2 4 6 对极误差 (px) 对极误差 (px) 对极误差 (px)
RoMa 链式 RoMa + 多流(本文) AllTracker CoTracker3 RAFT
LaMAR,ALIKED 关键点
距离 1 距离 2 距离 3 90 90 90
80 80 80
70 70 70 阈值 60 60 60
50 50 50以下 % 40 40 40
30 30 30 2 4 6 8 10 2 4 6 8 10 2 4 6 8 10 对极误差 (px) 对极误差 (px) 对极误差 (px)
RoMa 链式 RoMa + 多流(本文) AllTracker CoTracker3
图 17: 各数据集的对极误差累积分布函数。ALIKED 关键点的对极误差累积分布。上:ETH3D SLAM,按关键帧跳数分组。下:LaMAR,按真值关键帧距离区间(距离 1–3,位移递增)分组。所有方法在短距离下表现相当;随着跳数或距离增加,基于流的跟踪器因漂移累积而右移,而结合多流的 RoMa 保持了最紧致的分布。LaMAR 上较高的噪声基底反映了其厘米级真值精度。
C 数据集细节
C.1 数据集设置
我们评估了四个基准,涵盖不同的采集设备、环境和运动模式。表 5 总结了关键属性。
表 5: 评估数据集概览。四个基准涵盖长距离室内外轨迹上的复杂相机运动(LaMAR)、使用 iOS 和四足机器人采集的分布外灾难响应环境(CroCoDL)、精确的小尺度运动(ETH3D)以及灰度微型飞行器飞行(EuRoC)。
LaMAR ETH3D-SLAM EuRoC CroCoDL
场景/地点 3(CAB, HGE, LIN) 55 个序列 11 个序列 4 个地点 设备 iOS(iPhone/iPad) 全局快门 RGB 灰度立体微型飞行器 iOS + 四足机器人 分辨率 1920×1440 ∼740×460 752×480 1440×1920 / 640×480 色彩 RGB RGB 灰度 RGB / 灰度 真值 LiDAR 对齐 运动捕捉 Vicon + Leica LiDAR 对齐 评估序列数 50 55 11 88
第 24 页
24 Pataki 等
跟踪器主干对比(LaMAR,CAB/HGE/LIN 场景平均) 10.0 VidMap(本文) VidMap(等效配置) VidMap-ALIKED+LG AllTracker RAFT CoTracker3
(m) 1.0 中位 WATE
0.1
10m 25m 50m 100m 完整 轨迹长度窗口
图 18:LaMAR 上的跟踪器主干对比。在不同轨迹长度窗口下,各场景平均的中位 WTE(米)。将 RoMa 替换为基于光流的跟踪器会降低所有尺度下的重建质量。VidMap-ALIKED+LG 依赖关键点可重复性,在无纹理区域丢失覆盖,而稠密传播在这些区域能保持对应关系。
LaMAR [47]。苏黎世的三个场景(CAB、HGE:室内+室外;LIN:室外),使用 iOS 设备采集,共 50 个序列,带有真值位姿(CAB 12 个,HGE 17 个,LIN 21 个)。真值来自 NavVis LiDAR 扫描和 SfM 光束平差,精度约厘米级,但仅存在于每个序列的稀疏关键帧子集上,且不覆盖完整视频。LaMAR 真值关键帧的间距比典型 SLAM 关键帧更大,导致两者无法直接比较。为进行平衡评估,我们采样了每个包含 300 个真值关键帧的轨迹。
ETH3D-SLAM [49]。评估了 61 个序列中的 55 个;排除了 6 个因图像近乎全黑而无法使用的暗光序列。
EuRoC [4]。11 个灰度 MAV 序列,分辨率 752×480,以单目方式评估(仅使用左相机)。灰度图像对在彩色图像上训练的深度模型构成挑战。
CroCoDL [2]。四个灾难响应站点,包含 62 个 iOS 会话和 14 个四足机器人会话。真值来自 LaMAR 流程 [47],精度约 10 厘米。四足机器人序列使用 rosbag 中朝左的相机;排除了存在严重缓冲伪影的会话。
D 评估细节
D.1 评估协议
AUC。在 ETH3D-SLAM 和 EuRoC 上,我们报告平移误差曲线下面积(AUC),阈值设为 {0.05, 0.1, 0.5, 1.0, 10} 米(越高越好)。位姿使用 COLMAP 的鲁棒 Sim(3) 对齐器与真值进行全局对齐。在
第 25 页
VidMap 25
阈值 τ: t { A \te x C}@\tau = \frac{1}{\tau\int_0^\tau\text{recall}(t)\,dt\label{eq:auc} (5) U
其中 recall(t) = |{i : TEi ≤t}|/N 是平移误差 ≤t 的位姿所占比例。
W-AUC。在 LaMAR 和 CroCoDL 上,我们首先计算逐帧窗口化平移误差(WTE):对每一帧,以它为中心取一个 W 米的窗口,在窗口内计算局部 Sim(3) 对齐,并记录中心帧的平移误差。然后 W-AUC 对这些逐帧平移误差应用相同的 AUC 计算,窗口大小 W ∈{10, 25, 50, 100} 米以及完整轨迹,误差阈值取各窗口长度的 5%。
为何使用 W-AUC 而非 AUC。全局 Sim(3) 对齐在长轨迹上受远距离漂移主导,可能掩盖局部重建质量。W-AUC 在局部窗口对齐后评估平移误差,使其更适合长视频。
D.2 基线方法细节
除特别说明外,我们均使用官方实现。由于 SLAM 方法通常假设每段视频具有固定的内参,在校准设定下,我们向它们提供逐帧的真值内参,这通常会改善其结果。 COLMAP / GLOMAP。我们使用两种匹配变体评估这两个系统:SuperPoint+LightGlue(COLMAP/GLOMAP-LG)和 SuperPoint+RoMA v2(COLMAP/GLOMAP-RoMA),均采用局部窗口内的顺序匹配以及通过 MegaLoc [1] 检索的回环闭合进行匹配。我们使用来自 MP-SfM [43] 的调优 COLMAP 配置,该配置对低三角化角度更宽容,使其能在 LaMAR 数据集中重建更大比例的轨迹。 MP-SfM。我们采用与上述 COLMAP 和 GLOMAP 相同的匹配策略。 MegaSaM。在校准设定下,我们在 SLAM 后端以及使用 UniDepth 估计单目深度图时,利用逐帧的真值内参。 MASt3R-SLAM。我们对 MASt3R-SLAM 进行了两项修改,显著提升了其结果:(i) MASt3R-SLAM 的关键帧选择阈值可能在复杂序列上过长时间拒绝帧,最终导致跟踪丢失且系统无法恢复。我们改为在跟踪失败前将最后一帧追溯注册为关键帧。(ii) 由于 LaMAR 上并非每个关键帧都有真值位姿,我们额外在恰好具有真值位姿的时间戳注册帧,以确保公平的评估覆盖。
第 26 页
26 Pataki 等
E 实现细节
E.1 推导
方向空间中的观测协方差。 各向同性的像素噪声协方差 σ²I₂ 通过反投影及随后的归一化至单位方向向量传播,在方向空间中产生各向异性的协方差。针孔反投影雅可比矩阵 D 及所得的图像空间协方差为
\[ D = \operatorname{diag}(1/f_x,\ 1/f_y),\quad \Sigma_{\text{img}} = \sigma \operatorname{diag}\!\left(\frac{1}{f_x^2},\,\frac{1}{f_y^2}\right) \tag{6} \]
将 p 归一化为单位方向向量 b = p/∥p∥,得到雅可比矩阵
\[ J = \frac{b_z}{\|p\|} \left(I_3 – \mathbf{b}\,\mathbf{b}^\top\right) \tag{7} \]
其中 b_z 表示 b 的 z 分量。令 J₂ ∈ ℝ³ˣ² 包含 J 的前两列。所得的方向协方差为
\[ \Sigma^v_{ik} = J_2\,\Sigma_{\text{img}}\,J_2^\top \in \mathbb{R}^{3\times 3} \tag{8} \]
该协方差的秩为 2,零空间方向为 b;它与方向相关,且随 b_z² 缩放。对于 GP,我们使用该协方差的对角近似,并将第三个标准差设为前两个的均值,即 σ_z = (σ_x + σ_y)/2。
密度加权关键点采样。 我们将 RoMaV2 [18] 中使用的密度均衡采样适配到传播关键点与候选关键点的合并集合上,计算带宽为 h 的高斯核密度估计 δ(x):
\[ \delta(\mathbf{x}) = \sum_{j} \phi_h(\mathbf{x} – \mathbf{p}_j) + \sum_{l} \phi_h(\mathbf{x} – \mathbf{q}_l),\quad \phi_h(\mathbf{y}) = \exp\!\left(-\frac{\|\mathbf{y}\|^2}{2h^2}\right) \tag{9} \]
相应的接受概率为
\[ p(\mathbf{x}) \propto \frac{1}{\delta(\mathbf{x})} \tag{10} \]
轨迹密度细化。 在对极滤波之后,我们在存留的观测上重新计算 δ(x),并以概率保留每个观测
\[ p_{\text{survive}}(\mathbf{x}) = \exp\!\left(-\beta \cdot \left(\delta(\mathbf{x}) – 1\right)\right) \tag{11} \]
其中 β > 0 控制细化强度,减去 1 移除了观测自身的贡献。这会优先移除密集区域中的观测。
第 27 页
VidMap 27
表 6:关键帧选择与轨迹提取参数。
参数 符号 值 作用
置信度阈值 τc 0.01 计入跟踪的最小 RoMa 匹配置信度 位移阈值 τ0 0.12 触发新关键帧的最小运动量 目标覆盖率 τf 0.4 当跟踪比例低于此值时插入关键帧 每图像最大关键点数 N 1200 每关键帧的跟踪预算 低分辨率 RoMa 输入 – 560×560 粗匹配与关键帧选择 顺序 RoMa 输入 – 1200 轨迹传播的最长边 回环闭合 RoMa 输入 – 800 回环闭合匹配的最长边 滑动窗口 W 9 轨迹传播所跨越的关键帧数 窗口步长 – 2 每隔一帧匹配前一关键帧
E.2 关键帧选择
当置信度高于 τc 且累积位移低于 τ0 的像素比例降至目标覆盖率 τf 以下时,插入新关键帧。ALIKED 关键点在 W 个关键帧的滑动窗口内传播,每图像最多 N 个。匹配分辨率与窗口参数列于表 6。
E.3 深度正则化相对位姿(MDRP)
每对关键帧的相对位姿通过 PoseLib 的 estimate_monodepth_pose 求解。该方法从对应关系与单目深度中联合求解旋转、平移和度量尺度。MDRP 能处理五点算法失效的退化构型(平面场景、纯旋转、前向运动)。在已为鲁棒性设计的流程中,其对聚合指标的边际提升较小。
表 7:LaMAR-HGE 上的 MDRP 消融实验。使用与不使用深度正则化相对位姿估计的中位 WTE(米,↓)。MDRP 能鲁棒地处理退化几何,但在完整流程中的提升有限。
10 米 25 米 50 米 100 米 全部
本文方法 0.03 0.06 0.14 0.38 0.43 本文方法(无 MDRP) 0.03 0.06 0.17 0.39 0.45
E.4 全局定位损失调度
全局定位从随机初始化开始联合求解所有相机,此时位姿是任意的,三维点可能位于相机后方。过早应用鲁棒损失会抑制这种随机初始化带来的大残差:序列中的退化部分因所有观测最初都是外点而无法从匹配中获得梯度,几何先验同样被置零。在早期全局定位阶段,成对深度一致性检查首先将深度/匹配不一致标记为外点,防止后续 L2 深度损失引入有害梯度。随后 L2 确保所有剩余观测贡献梯度。当几何收敛后,后期全局定位阶段用鲁棒损失替换 L2,在抑制真正外点的同时更紧密地信任正确匹配。
第 28 页
28 Pataki 等
表 8:渐进 BA 细化消融实验。不同阈值下的 AUC(↑)。第二轮细化将 ETH3D(5 cm)上的严格阈值精度提升了 +8.2,EuRoC 上提升了 +10.0;在 LaMAR 上,增益出现在较粗的窗口,此时提高的精度减少了漂移。
| LaMAR (sample-300) | ETH3D | EuRoC | |—|—|—| | .05 .1 .5 1 10 | .05 .1 .5 1 10 | .05 .1 .5 1 10 | | Ours 3.7 7.9 35.3 57.0 93.3 | 67.5 76.8 89.7 93.1 99.1 | 22.2 53.8 90.7 95.4 99.6 | | Ours (no graduated BA) 3.5 7.0 29.2 50.8 91.8 | 59.3 71.5 89.5 93.7 98.9 | 12.2 41.4 87.5 93.8 99.4 |
E.5 采用渐进非凸性的光束平差
全局定位产生的绝对位姿估计不如增量式 SfM 精确,因此早期的光束平差遵循 GLOMAP 的做法,采用适度的重投影滤波和宽松的鲁棒损失;在此阶段,严格的阈值会丢弃有效观测。一旦几何结构稳定,第二轮光束平差会收紧重投影误差滤波,并应用渐进非凸性:鲁棒损失阈值逐步收紧,随着重建的成熟,对内点匹配的信任度逐渐增加。跳过此细化步骤会降低严格阈值下的性能,因为亚厘米级精度需要精确的点滤波和严格的鲁棒损失。
参考文献
1. Berton, G., Masone, C.: MegaLoc: One Retrieval to Place Them All. In: CVPRW (2025) 2. Blum, H., Mercurio, A., O’Reilly, J., Engelbracht, T., Dusmanu, M., Pollefeys, M., Bauer, Z.: CroCoDL: Cross-device Collaborative Dataset for Localization. In: CVPR (2025) 3. Bochkovskiy, A., Delaunoy, A., Germain, H., Santos, M., Zhou, Y., Richter, S., Koltun, V.: Depth Pro: Sharp Monocular Metric Depth in Less Than a Second. In: ICLR (2025) 4. Burri, M., Nikolic, J., Gohl, P., Schneider, T., Rehder, J., Omari, S., Achtelik, M.W., Siegwart, R.: The EuRoC micro aerial vehicle datasets. IJRR (2016) 5. Cai, R., Tung, J., Wang, Q., Averbuch-Elor, H., Hariharan, B., Snavely, N.: Doppelgangers: Learning to Disambiguate Images of Similar Structures. In: ICCV (2023) 6. Campos, C., Elvira, R., Rodríguez, J.J.G., Montiel, J.M.M., Tardós, J.D.: ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial, and Multimap SLAM. IEEE TRO (2021) 7. Chen, L.Z., Gao, J., Chen, Y., Cheng, K.L., Sun, Y., Hu, L., Xue, N., Zhu, X., Shen, Y., Yao, Y., Xu, Y.: Geometric Context Transformer for Streaming 3D Reconstruction. arXiv preprint arXiv:2604.14141 (2026) 8. Chen, X., Chen, Y., Xiu, Y., Geiger, A., Chen, A.: TTT3R: 3D Reconstruction as Test-Time Training. In: ICLR (2026) 9. Crandall, D., Owens, A., Snavely, N., Huttenlocher, D.: Discrete-Continuous Optimization for Large-Scale Structure from Motion. In: CVPR (2011) 10. Czarnowski, J., Laidlow, T., Clark, R., Davison, A.J.: DeepFactors: Real-Time Probabilistic Dense Monocular SLAM. IEEE RAL 5(2), 721–728 (2020) 11. Davison, A.J., Reid, I.D., Molton, N.D., Stasse, O.: MonoSLAM: Real-Time Single Camera SLAM. IEEE TPAMI (2007)
第 29 页
VidMap 29
12. Deng, K., Ti, Z., Xu, J., Yang, J., Xie, J.: VGGT-Long: 分块、回环、对齐——将VGGT推向公里级长RGB序列的极限。arXiv:2507.16443 (2025) 13. DeTone, D., Malisiewicz, T., Rabinovich, A.: SuperPoint: 自监督兴趣点检测与描述。In: CVPRW (2018) 14. Dexheimer, E., Davison, A.J.: COMO: 紧凑建图与里程计。In: ECCV (2024) 15. Ding, Y., Kocur, V., Vávra, V., Berger Haladóvá, Z., Yang, J., Sattler, T., Kukelova, Z.: RePoseD: 利用已知深度信息的高效相对位姿估计。In: ICCV (2025) 16. Duisterhof, B.P., Zust, L., Weinzaepfel, P., Leroy, V., Cabon, Y., Revaud, J.: MASt3R-SfM: 面向无约束运动恢复结构的全集成解决方案。In: 3DV (2025) 17. Edstedt, J., Athanasiadis, I., Wadenbäck, M., Felsberg, M.: DKM: 面向几何估计的稠密核化特征匹配。In: CVPR (2023) 18. Edstedt, J., Nordström, D., Zhang, Y., Bökman, G., Astermark, J., Larsson, V., Heyden, A., Kahl, F., Wadenbäck, M., Felsberg, M.: RoMa v2: 更困难、更优、更快、更稠密的特征匹配。arXiv:2511.15706 (2025) 19. Edstedt, J., Sun, Q., Bökman, G., Wadenbäck, M., Felsberg, M.: RoMa: 鲁棒稠密特征匹配。In: CVPR (2024) 20. Engel, J., Koltun, V., Cremers, D.: 直接稀疏里程计。IEEE TPAMI (2018) 21. Engel, J., Schöps, T., Cremers, D.: LSD-SLAM: 大规模直接单目SLAM。In: ECCV (2014) 22. Hagemann, A., Knorr, M., Stiller, C.: 基于视频的深度几何感知相机自标定。In: ICCV (2023) 23. Harley, A.W., You, Y., Sun, X., Zheng, Y., Raghuraman, N., Gu, Y., Liang, S., Chu, W.H., Dave, A., You, S., Ambrus, R., Fragkiadaki, K., Guibas, L.: AllTracker: 高分辨率高效稠密点跟踪。In: ICCV (2025) 24. Hu, M., Yin, W., Zhang, C., Cai, Z., Long, X., Wang, K., Chen, H., Yu, G., Shen, C., Shen, S.: Metric3D v2: 面向零样本度量深度与表面法向估计的通用单目几何基础模型。IEEE TPAMI (2024) 25. Huang, J., Zhou, Q., Rabeti, H., Korovko, A., Ling, H., Ren, X., Shen, T., Gao, J., Slepichev, D., Lin, C.H., Ren, J., Xie, K., Biswas, J., Leal-Taixé, L., Fidler, S.: ViPE: 面向三维几何感知的视频位姿引擎。arXiv:2508.10934 (2025) 26. Karaev, N., Rocco, I., Graham, B., Neverova, N., Vedaldi, A., Rupprecht, C.: CoTracker: 联合跟踪效果更优。In: ECCV (2024) 27. Klein, G., Murray, D.: 面向小型AR工作空间的并行跟踪与建图。In: IEEE Int. Symp. Mixed and Augmented Reality. pp. 225–234 (2007) 28. Leroy, V., Cabon, Y., Revaud, J.: 利用MASt3R将图像匹配锚定于三维空间。In: ECCV (2024) 29. Leutenegger, S.: OKVIS2: 具备回环闭合的实时可扩展视觉-惯性SLAM。arXiv preprint arXiv:2202.09199 (2022) 30. Li, M., Zhu, Z., Pollefeys, M., Barath, D.: 真实场景下的DROID-SLAM。In: CVPR (2026) 31. Li, Z., Tucker, R., Cole, F., Wang, Q., Jin, L., Ye, V., Kanazawa, A., Holynski, A., Snavely, N.: MegaSaM: 面向日常动态视频的精确、快速且鲁棒的结构与运动恢复。In: CVPR (2025) 32. Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B.: Depth Anything 3: 从任意视角恢复视觉空间。arXiv preprint arXiv:2511.10647 (2025)
第 30 页
30 Pataki 等
33. Lindenberger, P., Sarlin, P.E., Pollefeys, M.: LightGlue: 轻量级局部特征匹配。见: ICCV (2023) 34. Lipson, L., Teed, Z., Deng, J.: 深度图像块视觉SLAM。见: ECCV (2024) 35. Liu, S., Gao, Y., Zhang, T., Pautrat, R., Schönberger, J.L., Larsson, V., Pollefeys, M.: 基于混合特征的鲁棒增量式运动恢复结构。见: ECCV (2024) 36. Liu, S., Nie, X., Hamid, R.: 面向影视作品的深度引导稀疏运动恢复结构。见: CVPR (2022) 37. Maggio, D., Lim, H., Carlone, L.: VGGT-SLAM: 在SL(4)流形上优化的稠密RGB SLAM。见: NeurIPS (2025) 38. Moulon, P., Monasse, P., Marlet, R.: 面向鲁棒、精确且可扩展的运动恢复结构的相对运动全局融合。见: ICCV (2013) 39. Mur-Artal, R., Montiel, J.M.M., Tardós, J.D.: ORB-SLAM: 一种通用且精确的单目SLAM系统。IEEE TRO (2015) 40. Murai, R., Dexheimer, E., Davison, A.J.: MASt3R-SLAM: 具有三维重建先验的实时稠密SLAM。见: CVPR (2025) 41. Neoral, M., Šerých, J., Matas, J.: MFT: 每个像素的长期跟踪。见: WACV (2024) 42. Pan, L., Barath, D., Pollefeys, M., Schönberger, J.L.: 全局运动恢复结构再探。见: ECCV (2024) 43. Pataki, Z., Sarlin, P.E., Schönberger, J.L., Pollefeys, M.: MP-SfM: 面向鲁棒运动恢复结构的单目表面先验。见: CVPR (2025) 44. Piccinelli, L., Yang, Y.H., Sakaridis, C., Segu, M., Li, S., Van Gool, L., Yu, F.: UniDepth: 通用单目度量深度估计。见: CVPR (2024) 45. Pollefeys, M., Van Gool, L., Vergauwen, M., Verbiest, F., Cornelis, K., Tops, J., Koch, R.: 手持相机的视觉建模。IJCV (2004) 46. Sarlin, P.E., DeTone, D., Malisiewicz, T., Rabinovich, A.: SuperGlue: 基于图神经网络的特征匹配学习。见: CVPR (2020) 47. Sarlin, P.E., Dusmanu, M., Schönberger, J.L., Speciale, P., Gruber, L., Larsson, V., Miksik, O., Pollefeys, M.: LaMAR: 增强现实定位与建图基准测试。见: ECCV (2022) 48. Schönberger, J.L., Frahm, J.M.: 运动恢复结构再探。见: CVPR (2016) 49. Schöps, T., Sattler, T., Pollefeys, M.: BAD SLAM: 光束平差直接法RGB-D SLAM。见: CVPR (2019) 50. Smith, C., Charatan, D., Tewari, A., Sitzmann, V.: FlowMap: 通过梯度下降获取高质量相机位姿、内参和深度。见: 3DV (2025) 51. Snavely, N., Seitz, S.M., Szeliski, R.: 照片旅游: 三维探索照片集。见: ACM SIGGRAPH (2006) 52. Sun, J., Shen, Z., Wang, Y., Bao, H., Zhou, X.: LoFTR: 基于Transformer的无检测器局部特征匹配。见: CVPR (2021) 53. Sweeney, C., Sattler, T., Hollerer, T., Turk, M., Pollefeys, M.: 面向运动恢复结构的观测图优化。见: ICCV (2015) 54. Teed, Z., Deng, J.: RAFT: 用于光流的循环全对场变换。见: ECCV (2020) 55. Teed, Z., Deng, J.: DROID-SLAM: 面向单目、立体和RGB-D相机的深度视觉SLAM。见: NeurIPS (2021) 56. Teed, Z., Lipson, L., Deng, J.: 深度图像块视觉里程计。见: NeurIPS (2023) 57. Veicht, A., Sarlin, P.E., Lindenberger, P., Pollefeys, M.: GeoCalib: 基于几何优化的单图像标定学习。见: ECCV (2024)
第 31 页
VidMap 31
58. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: VGGT: 视觉几何基座Transformer。载于:CVPR (2025) 59. Wang, J., Karaev, N., Rupprecht, C., Novotny, D.: VGGSfM: 视觉几何基座深度运动恢复结构。载于:CVPR (2024) 60. Wang, Q., Zhang, Y., Holynski, A., Efros, A.A., Kanazawa, A.: 具有持久状态的连续3D感知模型。载于:CVPR (2025) 61. Wang, R., Xu, S., Dai, C., Xiang, J., Deng, Y., Tong, X., Yang, J.: MoGe: 通过最优训练监督解锁开放域图像的精确单目几何估计。载于:CVPR (2025) 62. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: DUSt3R: 化繁为简的几何3D视觉。载于:CVPR (2024) 63. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: π3: 置换等变视觉几何学习。arXiv预印本 arXiv:2507.13347 (2025) 64. Wilson, K., Snavely, N.: 基于1DSfM的鲁棒全局平移估计。载于:ECCV (2014) 65. Xiangli, Y., Cai, R., Chen, H., Byrne, J., Snavely, N.: Doppelgangers++: 利用几何3D特征改进视觉歧义消除。载于:CVPR (2025) 66. Yang, H., Antonante, P., Tzoumas, V., Carlone, L.: 面向鲁棒空间感知的渐进非凸性:从非最小求解器到全局外点剔除。IEEE RAL 5(2), 1127–1134 (2020) 67. Yang, J., Sax, A., Liang, K.J., Henaff, M., Tang, H., Cao, A., Chai, J., Meier, F., Feiszli, M.: Fast3R: 单次前向传播实现1000+图像的3D重建。载于:CVPR (2025) 68. Zhang, J., Herrmann, C., Hur, J., Sun, C., Yang, M.H., Cole, F., Darrell, T., Sun, D.: LoGeR: 基于混合记忆的长上下文几何重建。arXiv预印本 arXiv:2603.03269 (2026) 69. Zhang, Y., Tosi, F., Mattoccia, S., Poggi, M.: GO-SLAM: 面向一致性3D即时重建的全局优化。载于:ICCV. pp. 3727–3737 (2023) 70. Zhao, W., Liu, S., Guo, H., Wang, W., Liu, Y.J.: ParticleSfM: 利用稠密点轨迹定位野外运动相机。载于:ECCV (2022) 71. Zhao, X., Wu, X., Chen, W., Chen, P.C.Y., Xu, Q., Li, Z.: ALIKED: 通过可变形变换实现的轻量级关键点与描述子提取网络。IEEE Transactions on Instrumentation and Measurement 72, 1–16 (2023) 72. Zhuang, B., Cheong, L.F., Lee, G.H.: 平移平均中的基线去敏化。载于:CVPR (2018)