DGSfM:深度引导的尺度感知全局SfM,解决传统方法尺度模糊与初始化敏感问题

三分钟导读:DGSfM通过将单目深度估计集成到全局SfM中,利用深度感知相对位姿求解、视图图过滤和深度引导初始化来解决尺度歧义和初始化敏感性问题,显著提升了相机位姿估计精度。

英文题目:DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion

论文出处:arXiv 每日论文精选 · arXiv:2607.09507

原始论文:PDF / 论文页面

对应视频标题:DGSfM:深度引导的尺度感知全局SfM,解决传统方法尺度模糊与初始化敏感问题|推荐指数:★★★★★

这篇论文解决什么问题?

传统全局SfM依赖尺度模糊的对极几何,导致全局定位对噪声基线估计和弱视图图约束敏感,且视觉模糊对产生的错误边会进一步降低重建质量。

核心创新

  • 提出深度感知全局SfM流水线,将学习到的单目几何集成到相对位姿估计、过滤、尺度对齐和全局初始化中。
  • 提出尺度感知视图图和对应关系过滤,在优化前移除视觉模糊边和深度不一致匹配。
  • 开发全局尺度平均和深度引导的位姿-点初始化,为GLOMAP风格的全局定位提供稳定的度量初始化。

方法概览

DGSfM使用单目深度图作为度量几何先验,通过深度感知相对位姿求解器将尺度模糊约束转化为尺度感知约束;利用Doppelgangers++和三元组引导进行视图图过滤;通过缩放深度一致性过滤匹配;最后通过全局尺度平均和基于深度的位姿-点初始化进行全局优化。

逐图理解论文

背景:全局SfM的局限

背景:全局SfM的局限
Fig. 2: Overview of DGSfM. Given unordered images, we extract sparse or dense matches, monocular depth, and compute depth-aware relative poses and pairwise focals to construct an initial view graph, which is refined through pairwise and triplet-guided edge pruning, and scaled depth consistency checks. Mapping is done with rotation av- eraging, focal and scale averaging, global positioning with depth-scaled initialization, and bundle adjustment, producing camera poses and sparse or semi-dense 3D points.

全局SfM通过联合估计视图图中的相机位姿,避免增量式优化的顺序注册。但通常仅依赖对极几何,缺乏尺度信息,且易受重复结构和弱重叠影响。这限制了其在复杂场景中的鲁棒性,亟需引入额外的几何先验以增强约束。

实验设置:数据集与评估

实验设置:数据集与评估
Fig. 3: Qualitative comparison on ETH3D [48]. Compared with GLOMAP [35], our method produces more stable camera pose estimates with LoMa [34] matches, while using dense RoMa v1 [14] matches leads to more complete 3D structure.

在ETH3D和IMC2021数据集上进行多视图相机位姿估计评估,并在LaMAR数据集上进行大规模AR场景评估。使用LoMa和RoMa等不同稀疏/密集匹配前端进行消融研究和对比实验。评估指标包括AUC@1°、AUC@3°、AUC@5°等,全面衡量位姿估计精度和点云完整性。

结果:ETH3D与IMC2021

结果:ETH3D与IMC2021
Table 1: Multi-View Camera Pose Estimation on ETH-3D [48] and IMC-2021 [20]. We compare DGSfM (Ours) with traditional SfM pipelines (incremental (I) and global (G)), feature refinement and dense-matching-based methods (R), monocular depth map-based approaches (D), and feed-forward 3D reconstruction approaches (F) across different feature and matching front-ends. Ours† denotes our method without the Dop- pelgangers++ [62] module. Best , Second , and Third results are highlighted.

在ETH3D上,使用LoMa-B匹配时,AUC@1°为51.60,AUC@3°为78.25,AUC@5°为85.43。使用RoMa v1时,AUC@1°提升至61.00,AUC@3°为82.63,AUC@5°为88.33。在IMC2021上,使用RoMa v1时,AUC@3°为50.66,AUC@5°为63.03,AUC@10°为76.30,显著优于传统SfM基线。

结果:LaMAR大规模场景

结果:LaMAR大规模场景
Table 2: Multi-view Camera Pose Estimation on LaMAR [44]. Best and Second-best results are highlighted.

在LaMAR数据集上,DGSfM同样表现优异。使用LoMa-B匹配时,LIN场景下AUC@5°为32.45,AUC@10°为45.58,AUC@30°为63.74。HGE场景下,AUC@5°为10.49,AUC@10°为15.37,AUC@30°为23.49。这些结果证明该方法在大规模AR场景中具有强大的鲁棒性和泛化能力。

消融实验:深度模型影响

消融实验:深度模型影响
Table 4: Ablation with different depth models.

消融实验显示,不同深度模型对性能有影响,但即使使用较差的深度模型(如UniDepthV2),DGSfM仍优于传统SfM基线。这表明深度引导机制具有鲁棒性,不依赖单一高精度深度估计器。同时,移除Doppelgangers++模块会导致性能下降,验证了视图图过滤的重要性。

实验与关键结果

  • 在ETH3D和IMC2021数据集上进行多视图相机位姿估计评估。
  • 在LaMAR数据集上进行大规模AR场景评估。
  • 使用LoMa和RoMa等不同稀疏/密集匹配前端进行消融研究和对比实验。
  • 评估点云精度和完整性。
  • 在ETH3D和IMC2021数据集上进行多视图相机位姿估计评估。
  • 在LaMAR数据集上进行大规模AR场景评估。
  • 使用LoMa和RoMa等不同稀疏/密集匹配前端进行消融研究和对比实验。
  • 评估点云精度和完整性。

阅读时需要注意

  • 依赖单目深度估计器,若深度估计不准确可能引入误差。
  • 在ETH3D上使用LoMa匹配时,由于严格的深度一致性过滤,点云完整性略低于某些密集匹配方法。
  • 方法性能受单目深度模型质量影响,但即使使用较差的深度模型(如UniDepthV2)仍优于传统SfM基线。
  • 在IMC2021评估中,小图像袋(5张)可能偏向于前馈重建方法,需注意评估协议的影响。

关联工作

  • GLOMAP:作为全局SfM基线,DGSfM在其基础上引入深度引导初始化。(第 6 页)
  • MP-SfM:使用单目先验的增量SfM,DGSfM专注于全局SfM且无需已知内参。(第 5 页)
  • MASt3R-SfM:类似地结合相对位姿和深度,但DGSfM使用深度图增强位姿估计而非联合预测。(第 5 页)
  • DF-SfM / Dense-SfM:密集匹配SfM基线,DGSfM在密集匹配设置下表现相当。(第 12 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

DGSfM:深度引导的尺度感知全局运动恢复结构

Sithu Aung1, Viktor Kocur2, Yaqing Ding3, Torsten Sattler4, 和 Zuzana Kukelova1

1 捷克布拉格捷克理工大学,电气工程学院,视觉与机器人组 (VRG, FEE) 2 斯洛伐克布拉迪斯拉发康斯坦丁哲学者大学,数学与物理学院 (FMPH, Comenius University in Bratislava) 3 东南大学 4 捷克布拉格捷克理工大学,计算机视觉与机器人研究中心 (CIIRC, Czech Technical University in Prague)

摘要。全局运动恢复结构(Global SfM)是一种从无序图像中恢复相机位姿和稀疏3D结构的高效范式。然而,其对尺度模糊的对极几何的依赖,使得全局定位对基线估计噪声和弱视图图约束敏感,而来自视觉歧义对的错误边会进一步降低重建质量。我们提出了 DGSfM,这是一种深度感知的全局 SfM 流水线,它使用多视图单目深度图进行显式优化。对于每个图像对,我们首先使用深度感知相对位姿求解器(RePoseD),将尺度模糊的对极几何约束转换为尺度感知的相对位姿约束。我们进一步通过视图图滤波和基于深度一致性的对应点剪枝来提高鲁棒性,从而抑制那些仅在对极几何下看似合理的错误边和匹配点。最后,全局尺度平均和深度引导的位姿-点初始化将单目深度图对齐到共同的重建尺度,并为全局定位和光束法平差提供稳定的初始化。在 ETH3D 和 IMC2021 上的实验表明,DGSfM 在稀疏和密集匹配前端方面均一致地优于强大的全局 SfM 基线方法,在位姿精度方面取得了显著提升。代码可在 https://github.com/sithu31296/DGSfM 获取。

关键词:运动恢复结构 · 全局 SfM · 单目深度

1 引言

运动恢复结构(SfM)是从图像中恢复相机位姿和稀疏3D结构的核心工具,应用于3D重建、定位、视觉建图和空间数据生成等领域。在 SfM 范式 [1, 33, 49, 61] 中,全局 SfM [7, 60] 因其通过视图图联合估计相机位姿而特别引人注目,它避免了增量式流水线中的顺序注册和重复局部优化。最近的工作如 GLOMAP [35] 表明,当输入视图图可靠时,全局 SfM 既具有可扩展性又具有高精度。然而,全局 SfM 仍然在很大程度上依赖于成对的对极几何,其中相对平移仅在尺度上已知,并且

第 2 页

2 S. Aung 等人

图 1:DGSfM 使用 RoMa [14] 匹配在 IMC2021 [20] 数据集的完整图像集上的重建结果。DGSfM 将单目深度集成到全局 SfM 中,以改善尺度估计、视图图鲁棒性以及位姿-点初始化,从而生成全局一致的相机位姿和稀疏/半稠密 3D 结构。

其中,视觉上合理但不正确的图像对可能通过几何验证。这使得全局定位容易受到噪声基线估计、模糊匹配和不一致局部几何的影响,特别是在具有重复结构、弱重叠或有限视差的无序图像集合中。 最近的学习方法提供了强大的几何线索,但它们本身并不能消除对显式多视图优化的需求。密集匹配器 [13,14,68] 和无检测器 SfM 方法 [18,23,24] 提高了低纹理或大基线设置下的对应覆盖率和鲁棒性,然而随后的 SfM 优化通常仍受尺度模糊的相对位姿和轨迹一致性的支配。前馈重建模型 [21,26,53,55,59] 可以直接从图像预测相机和稠密结构,但与基于经典特征的 SfM 方法 [32,36] 相比,对于大型无序集合或超出其训练分布的场景,其准确性、可扩展性和全局一致性可能会下降。单目深度估计器 [5,19,56,57,64] 提供了另一种互补的信息源:它们提供每幅图像的几何信息,通常具有度量或近度量尺度,可以正则化退化的多视图配置。因此,关键问题不在于学习几何是否应该取代 SfM,而在于如何将其注入全局 SfM,使得尺度、过滤和初始化更加可靠,同时最终重建仍受多视图几何约束。 我们提出了 DGSfM,这是一种深度感知全局 SfM 框架,将单目深度估计集成到全局重建的主要阶段。我们的起点是观察到单目深度可以将全局 SfM 使用的成对约束从尺度模糊的关系转变为尺度感知的几何约束。对于每个验证过的图像对,我们使用深度感知相对位姿求解器 [11] 来估计相对旋转、缩放相对平移、相对深度尺度因子和相机内参。这些成对估计为全局流水线提供了比仅对极几何更强的输入,因为它们在全局优化之前暴露了两个视图之间的度量兼容性。

第 3 页

DGSfM 3

定位。同时,我们并不将单目预测视为最终的几何结构;相反,我们将其作为先验,用于在标准多视图优化细化位姿和点之前,指导鲁棒的滤波和初始化过程。

DGSfM 通过利用尺度感知的深度一致性对视图图和匹配点进行双重滤波,从而提高了鲁棒性。在图级别,我们将成对视觉歧义消除 [62] 与三元组引导的边剪枝 [31] 相结合,以剔除那些在视觉上相似或局部合理但与相邻视图不一致的图像对。在对应关系级别,我们利用单目深度对匹配点进行反向投影,将其转移到缩放后的相对位姿上,并仅保留那些在重投影和目标视图深度上均一致的匹配点。这能够剔除那些可能满足弱对极几何约束但与估计的 3D 几何结构不兼容的匹配点,从而为全局定位和光束法平差提供更干净的轨迹。

DGSfM 进一步利用单目几何结构,以统一的尺度初始化全局重建。由于单目深度预测可能存在图像间的尺度漂移,我们首先在被过滤的视图图上求解一个鲁棒的全局尺度平均问题。恢复出的图像级尺度因子将所有深度图对齐到共享的重建尺度中。随后,我们通过最大生成树上的缩放相对平移链式连接来初始化相机中心,并通过缩放深度图提升多视图轨迹观测值来初始化稀疏 3D 点。这些由深度引导的相机和点估计被传递到 GLOMAP 风格的全局定位阶段 [35],随后进行光束法平差,因此最终解仍由显式的多视图一致性决定。

在 ETH3D [48] 和 IMC2021 [20] 上的实验表明,所提出的深度感知全局 SfM 流程在多种特征和匹配前端下均提高了相机位姿精度。使用稀疏特征时,DGSfM 始终优于 COLMAP [45] 和 GLOMAP [35]。使用密集的 RoMa [14] 匹配时,其性能与密集 SfM 基线 [18,23,24] 相比表现强劲。图 1 展示了一些示例重建结果。这些结果支持了我们方法的核心设计原则:当将学习的单目几何结构用作度量先验,以增强全局 SfM 流程中的尺度估计、异常值剔除和初始化,同时最终重建由显式的多视图几何优化决定时,其效果最为显著。我们的贡献如下:

– 我们引入了一种深度感知的全局 SfM 流程,将学习的单目几何估计集成到相对位姿估计、滤波、尺度对齐和全局初始化中。 – 我们提出了尺度感知的视图图和对应关系滤波,在全局优化之前剔除视觉歧义的边和深度不一致的匹配点。 – 我们开发了全局尺度平均和深度引导的位姿-点初始化,为 GLOMAP 风格的全局定位和光束法平差提供稳定的度量初始化。 – 我们在稀疏和密集匹配设置下的 ETH3D 和 IMC2021 数据集上展示了持续的性能提升,表明单目几何结构可以稳健地增强全局 SfM,同时保留显式的多视图优化。

第 4 页

4 S. Aung 等

2 相关工作

传统 SfM。传统的运动恢复结构(SfM)管线 [1,45,49,61] 通过特征匹配 [10,29,43]、几何验证 [45]、三角测量 [17] 和光束法平差 [51] 来恢复相机位姿和稀疏 3D 结构。增量式系统(如 COLMAP [45, 46])因其鲁棒性和准确性而被广泛使用,但由于相机是顺序注册并通过光束法平差反复优化,其计算成本可能很高。全局 SfM 方法 [2,8,33,60] 通过从视图图中联合估计相机位姿来提高可扩展性。最近的系统(如 GLOMAP [35])表明,全局重建可以在保持具有竞争力的精度的同时实现高效的计算速度。然而,大多数全局 SfM 方法仍然主要依赖对极几何 [16],其中成对平移仅能恢复到一个未知的尺度。因此,全局定位和点初始化依赖于有噪声的轨迹约束和间接尺度估计。此外,异常图像对和不一致的对应关系会严重影响全局解。相比之下,我们的工作通过将单目几何引入重建过程来改进全局 SfM,从而减少尺度模糊性并提高位姿和结构初始化的可靠性。

基于特征细化与密集匹配 SfM。最近的工作通过细化稀疏特征或用密集且无需检测器的对应关系替换稀疏关键点匹配 [28,43] 来改进 SfM [13, 14, 50, 68]。PixSfM [27] 引入了特征度量细化,通过在多个视图间对齐学习到的密集特征来细化关键点位置、相机位姿和 3D 点。Detector-Free SfM [18] 进一步探索了在 SfM 中使用无需检测器的匹配器。它首先获取密集或半密集匹配,然后构建用于重建的多视图轨迹。Dense-SfM [24] 通过多视图细化和基于高斯泼溅的轨迹扩展来提高轨迹一致性。MV-RoMa [23] 通过将从一个源视图到多个共视目标视图的成对密集匹配转化为多视图轨迹重建,扩展了这一方向,并联合细化对应关系。这些方法表明,密集和多视图感知的对应关系可以显著提高重建密度和准确性。它们专注于改进特征匹配和轨迹生成,而不修改其余(全局)SfM 管线。与设计新的多视图匹配器或使用额外的对应关系模型细化密集轨迹不同,我们专注于利用单目几何估计来改进全局 SfM。因此,我们的工作与这些方法是互补的。

前馈 3D 重建。最近的前馈 3D 重建方法旨在利用大型神经网络直接从图像中恢复 3D 几何和相机信息。DUSt3R [58] 预测密集点图,并能够在没有传统 SfM 管线的情况下进行相对位姿估计和重建。后续方法(如 MASt3R [25]、VGGT [53]、Pi3 [59]、DepthAnything3 [26] 和 VGGT-Omega [54])进一步改进了密集对应关系、相机预测和多视图重建。这些方法表明,强大的学习几何先验可以在稀疏特征

第 5 页

DGSfM 5

特征匹配困难。尽管取得了令人印象深刻的进展,前馈方法在准确性 [26, 54]、可扩展性以及基于优化的 SfM 所具备的全局一致性方面仍可能存在不足,尤其是在处理大规模无序图像集合时 [9, 30, 52]。它们通常还依赖于可能无法完美泛化到未见场景的学习先验。最近,GLUEMAP [36] 结合了前馈重建和全局 SfM 流程,在利用学习到的局部几何结构的同时,保留了基于优化的重建的可扩展性和全局一致性。我们的工作具有互补性,但侧重点不同:我们并非依赖前馈重建骨干网络,而是利用学习到的单目几何来增强全局 SfM 框架,同时保持显式多视图几何一致性。

用于 SfM 的单目几何先验。单目深度估计最近在不同场景中显示出强大的泛化能力。相对深度模型如 MiDaS [4,42] 和 DPT [41],以及最近的基座模型如 Depth Anything V1/V2 [63, 64]、MoGe1 [56],提供了鲁棒的单张图像几何线索。度量深度模型,包括 Metric3D [19,65]、UniDepth [39,40]、DepthPro [5] 和 MoGe2 [57],进一步旨在恢复真实世界尺度下的深度。然而,仅靠单目深度仍存在歧义,并受到尺度不一致、域偏移和局部预测误差的影响。最近的相对位姿求解器如 RePoseD [11] 和 MADPose [66] 将单目深度融入双视图几何中,实现了感知尺度的相对位姿估计以及对深度尺度误差的校正。另一类工作将单目几何作为 SfM 中的先验,在此过程中,多视图约束可以校正单视图误差。MP-SfM [37] 是最接近的工作,它将单目深度和表面法线先验纳入增量 SfM 流程,以处理低重叠、低视差和高对称性的场景。然而,它假设相机内参已知,并且主要将单目先验用作局部几何正则化。相比之下,我们的工作专注于全局 SfM。我们利用单目深度,通过感知深度的相对位姿估计、尺度平均和初始化来解决全局重建中的尺度歧义和不稳定性。我们的流程还通过感知深度的相对位姿进行焦距平均来估计内参,从而减少了对已知标定参数的依赖。MASt3R-SfM [12] 与我们的方法类似,两者都首先估计相对位姿和深度图,计算一致的深度图缩放因子,对齐成对重建结果,最后细化初始位姿估计。MASt3R-SfM 使用前馈网络联合预测相对位姿和深度图,而我们的方法利用深度图来使相对位姿估计过程更加鲁棒。MASt3R-SfM 依赖于估计相似变换以获得初始位姿集合,而我们的方法使用旋转平均和定位。我们的结果表明,我们的方法明显优于 MASt3R-SfM。

3 方法

给定无序图像集合 $\mathcal{I} = \{I_i\}_{i=1}^N$,我们的目标是恢复全局一致的相机位姿 $\{(R_i, t_i)\}_{i=1}^N$、稀疏 3D 场景点 $X_p$ 以及相机标定参数 $K_i$。我们基于全局 SfM 范式,特别是 GLOMAP [35],其中初始视图图是从几何

第 6 页

6 S. Aung 等

输入图像 成对几何 视图图过滤 全局优化 输出重建

相机相机位姿位姿 && 成对 特征 检测与 3D3D 点集点集 边 剪枝 旋转平均 稀疏/半密集稀疏/半密集 匹配 (稀疏/密集)

焦距平均

单目 三元组引导 深度 估计 边剪枝 全局尺度平均 远

深度缩放位姿-点初始化 近 MSTMST 相机相机 链接链接 位姿初始化初始化ose 和点P

深度感知 缩放深度 相对位姿 (RePoseD) 一致性过滤

初始视图图 过滤后的视图图 全局定位

光束法平差

图 2: DGSfM 概述。给定无序图像,我们提取稀疏或密集匹配、单目深度,并计算深度感知的相对位姿和成对焦距,以构建初始视图图,该视图图通过成对和三元组引导的边剪枝以及缩放深度一致性检查进行细化。映射通过旋转平均、焦距和尺度平均、使用深度缩放初始化的全局定位以及光束法平差完成,从而生成相机位姿和稀疏或半密集 3D 点。

已验证的图像对,随后进行全局旋转平均、全局定位,最后进行光束法平差。与主要依赖尺度模糊的对极几何的传统全局 SfM 流水线不同,我们的方法引入单目深度作为度量几何先验。该先验用于改进相对位姿估计、过滤不可靠的视图图边、剪枝不一致的对应关系,并以深度感知的方式初始化相机位姿和 3D 点。整体流水线如图 2 所示。

3.1 预备知识

GLOMAP。设 $G = (V, E)$ 为视图图,其中每个节点 $i \in V$ 代表一张图像,每条边 $((i, j) \in E)$ 对应一个几何上已验证的图像对 [45]。对于每条边,双视图几何 [16] 提供相对旋转 $R_{ij}$ 和平移方向 $\bar{t}_{ij}$。GLOMAP [35] 首先通过旋转平均 (RA) [6] 估计全局一致的相机旋转 $R_i$,使得 $R_{ij} = R_j R_i^\top$。在 RA 之后,经典的全局 SfM 流水线 [2,8,33] 通过平移平均 [60,71] 估计相机中心。然而,从对极几何恢复的平移仅在尺度上是已知的,这使得平移平均对噪声平移方向估计和异常边敏感。GLOMAP 通过直接求解全局定位问题来避免这种单独的平移平均阶段,其中相机中心和 3D 点是联合估计的。虽然这避免了显式的平移平均,但优化可能会在不同运行中收敛到略有不同的解。在我们的方法中,我们保持相同的 GLOMAP 风格

第 7 页

DGSfM 7

全局定位目标,但使用源自缩放单目深度和尺度感知成对几何的确定性深度引导初始化。

深度感知相对位姿求解器。从对极几何 [16] 恢复的相对平移仅定义在未知尺度上。为了减少这种歧义,我们使用单目深度为每对图像估计缩放相对位姿。对于每幅图像 $I_i$,单目深度预测器 [56, 57] 提供深度图 $D_i$,其可能是度量尺度的,也可能定义在未知尺度上。给定 $I_i$ 和 $I_j$ 之间的特征对应关系,我们遵循 RePoseD [11] 的深度感知相对位姿公式来估计:

\mathbf{T}_{ij} = [(\mathbf{R}_{ij},\mathbf{t}_{ij}),s_{ij},\mathbf{K}_i,\mathbf{K}_j\enspace\label{eqn:solver} (1)

其中 $(\mathbf{R}_{ij}, \mathbf{t}_{ij})$ 是相对旋转和缩放相对平移,$(\mathbf{K}_i, \mathbf{K}_j)$ 是从求解器估计的内参。令 $s_i$ 表示图像 $i$ 的全局深度尺度,$s_{ij} = s_j/s_i$ 表示两个视图之间的相对深度尺度因子。缩放相对平移是相对于 $s_i$ 定义的,即 $\mathbf{t}_{ij} = \mathbf{t}_{gt}/s_i$,其中 $\mathbf{t}_{gt}$ 是具有真实尺度的平移。这将每对图像从尺度模糊的对极约束转换为尺度感知的相对位姿约束,为后续的旋转平均和全局定位提供更强的成对几何约束。

3.2 鲁棒视图图过滤

全局 SfM 的鲁棒性在很大程度上取决于输入视图图的质量。由重复结构、对称立面、视觉相似区域或偶然特征匹配引起的错误边会引入不一致的相对位姿,并严重降低全局位姿估计。尽管标准的几何验证可以去除许多错误的匹配,但视觉模糊的图像对可能仍然满足对极约束并保留在图中。因此,我们在全局优化之前应用鲁棒视图图过滤,以去除不可靠的图像对并提高重建的一致性。

成对和三元组引导的边剪枝。我们首先采用 Doppelgangers++ [62] 的成对视觉消歧方法。对于每个候选边 $(i, j)$,模型预测一个置信度分数 $c_{ij}^{DG} \in [0, 1]$,指示两幅图像是否观察到相同的物理表面。仅当 $c_{ij}^{DG} > \tau_{DG}$ 时保留该边,其中 $\tau_{DG}$ 是置信度阈值。此步骤在错误边影响全局位姿估计之前将其去除。 我们进一步利用三元组一致性,遵循基于相机三元组的 SfM 过滤方法 [31]。令 $\mathcal{T}$ 表示包含边 $(i, j)$ 的有效三元组集合。三元组 $t \in \mathcal{T}$ 中边 $(i, j)$ 的支持分数可以计算为

q_{ij}^t = \frac{n_{ij}}{\max\int n_{kl}}\enspace(2) ^t = \frac {n

第 8 页

8 S. Aung 等

其中 $n_{ij}$ 是边 $(i, j)$ 的内点数量。视图图中所有三元组中每条边的平均得分可计算为:

$$ q_{ij} = \frac{\sum_{t \in \mathcal{T}} q_{ij}^t}{|\mathcal{T}|} \quad (3) $$

仅当 $q_{ij} > \tau_{\text{tri}}$ 时保留该边,其中 $\tau_{\text{tri}}$ 是三元组支持阈值 [31]。这抑制了孤立看来合理但与相邻视图不一致的图像对。所得的过滤图在减少三元组不一致的异常边同时,保留了支持良好的连通性。

缩放深度一致性过滤。即使经过几何验证和视图图过滤,保留的图像对仍可能包含错误的特征对应关系。传统的 SfM 流水线主要使用对极误差和视差测试来拒绝此类匹配。然而,这些标准在重复区域或低视差图像对中仍可能接受模糊匹配。由于我们的流水线提供感知尺度的相对位姿和单目深度估计,我们进一步使用跨视图缩放深度一致性来过滤对应关系。

给定图像 $I_i$ 和 $I_j$ 之间的对应关系 $(\mathbf{x}_i, \mathbf{x}_j)$,我们首先使用其单目深度将 $\mathbf{x}_i$ 反投影到图像 $i$ 的坐标系中:

$$ \mathbf{X}_i = \Pi_i^{-1}\bigl(\mathbf{x}_i, D_i(\mathbf{x}_i)\bigr) \quad (4) $$

其中 $\Pi_i^{-1}(\cdot)$ 表示使用相机内参 $K_i$(从公式 1 估计)和预测的单目深度 $D_i(\mathbf{x}_i)$ 进行反投影。然后,我们使用缩放相对位姿 $(\mathbf{R}_{ij}, \mathbf{t}_{ij})$ 将该点变换到图像 $j$ 的坐标系中:

$$ \tilde{\mathbf{X}}_j = \mathbf{R}_{ij}\mathbf{X}_i + \mathbf{t}_{ij} \quad (5) $$

仅当变换后的点与目标视图中的匹配位置和深度一致时,才认为该对应关系可靠。因此,我们计算重投影误差

$$ e_{ij}^{\pi} = \left\| \pi\bigl(\mathbf{K}_j, \tilde{\mathbf{X}}_j\bigr) – \mathbf{x}_j \right\| \quad (6) $$

以及缩放深度一致性误差

$$ e_{ij}^{d} = \frac{\left| [\tilde{\mathbf{X}}_j]_z – s_{ij}D_j(\mathbf{x}_j) \right|}{s_{ij}D_j(\mathbf{x}_j)} \quad (7) $$

其中 $[\cdot]_z$ 表示目标相机帧中的深度值,$s_{ij}$ 是来自公式 1 的相对深度缩放因子。仅当

$$ e_{ij}^{\pi} < \tau_{\pi} \quad \text{且} \quad e_{ij}^{d} < \tau_{d} \quad (8) $$

时保留该对应关系,其中 $\tau_{\pi}$ 和 $\tau_{d}$ 是重投影和深度一致性误差阈值。相同的检查也对称地应用于从图像 $j$ 到图像 $i$。此过滤步骤移除了可能满足对极约束但与估计的单目几何不一致的匹配。剩余的匹配为全局定位和光束法平差提供了更干净的特征轨迹。

第 9 页

DGSfM 9

3.3 深度引导的全局优化

在视图图和对应关系过滤之后,剩余的图像对提供了可靠的、感知尺度的相对位姿和深度一致的特征轨迹。我们利用这些约束来初始化全局重建。

焦距平均。深度感知的相对位姿求解器为匹配的图像对提供成对内参估计 $(K_i, K_j)$(公式 1)。假设像素为正方形且主点与图像中心重合 [15,58],因此只需估计焦距。由于图像噪声和单目深度估计的不准确性,连接到相机 $I_i$ 的每条边都会产生该相机焦距的不同估计值。因此,我们将成对焦距估计聚合为每个图像的一个鲁棒焦距。

对于每个验证过的边 $(i, j) \in \mathcal{E}$,令 $\hat{f}_i^{ij}$ 和 $\hat{f}_j^{ij}$ 表示从深度感知相对位姿求解器估计出的图像 $I_i$ 和 $I_j$ 的焦距。对于每个图像 $I_i$,我们收集其关联边上的所有焦距估计值: $$ \mathcal{F}_i = \{ \hat{f}_i^{ij} \mid (i,j) \in \mathcal{E} \} \cup \{ \hat{f}_i^{ji} \mid (j,i) \in \mathcal{E} \} \quad (9) $$

然后,我们计算最终焦距,作为后续全局优化和光束法平差(Bundle Adjustment)的稳定初始化,使用中值估计器: $$ f_i = \text{median}(\mathcal{F}_i) \ . $$

全局尺度平均。从公式 1 的深度感知相对位姿求解器 [11] 中,每条保留的边提供一个缩放后的相对位姿 $(R_{ij}, t_{ij})$ 以及一个成对深度尺度比 $s_{ij}$。由于单目深度预测可能仍包含图像间的尺度不一致性,我们在过滤后的视图图上恢复全局一致的尺度因子。对于每条保留的边 $(i, j)$,成对尺度比提供约束 $s_{ij} = s_j/s_i$。取对数后,在对数尺度空间中给出线性关系: $$ \log s_{ij} = \log s_j – \log s_i \quad (10) $$

为简化表示,令 $\ell_i = \log s_i$。全局图像尺度通过求解鲁棒尺度平均问题来估计: $$ \ell_i^\star = \arg \min_{\ell_i} \sum_{(i,j) \in \mathcal{E}} \rho_s(\ell_j – \ell_i – \ell_{ij}) \quad (11) $$

其中 $\rho_s(\cdot)$ 是鲁棒损失函数。尺度规范通过设置 $\ell_1 = 0$(或等价地 $s_1 = 1$)来固定。每个图像的最终全局深度尺度获得为 $s_i = \exp(\ell_i^\star)$。估计出的尺度随后用于将所有单目深度图对齐到共同的重建尺度,$\tilde{D}_i(x) = s_i D_i(x)$。这些尺度一致的深度图为后续相机位置和 3D 点初始化提供度量几何先验。

深度缩放位姿-点初始化。在全局尺度平均之后,我们使用缩放后的相对位姿和缩放后的单目深度在 GLOMAP [35] 全局定位之前初始化相机和 3D 点。我们从过滤后的视图图和初始数据构建最大生成树(MST)[22],并通过沿树链式连接缩放后的相对平移来初始化相机中心。令

第 10 页

10 S. Aung et al.

$M \subset E$ 表示最小生成树(MST),其中边的权重为其内点数量。 我们选择一个根图像 $I_r$ 并将其相机中心固定为 $\mathbf{c}_r^0 = 0$。对于每条树边 $(i, j) \in M$,我们使用全局图像尺度 $s_i$ 将成对缩放相对平移 $\mathbf{t}_{ij}$ 转换为共同重建尺度:

$$ \tilde{\mathbf{t}}_{ij} = s_i \mathbf{t}_{ij} \quad (12) $$

给定来自旋转平均的全局旋转 $R_i$,相机中心与相对平移之间的关系为 $\tilde{\mathbf{t}}_{ij} = R_j(\mathbf{c}_i – \mathbf{c}_j)$。因此,如果图像 $i$ 是 MST 中图像 $j$ 的父节点,则子相机中心初始化为:

$$ \mathbf{c}_j^0 = \mathbf{c}_i^0 R_j^\top \tilde{\mathbf{t}}_{ij} \quad (13) $$

通过从根节点递归地将此更新应用到 MST 中的所有节点,我们获得初始相机中心 $\{\mathbf{c}_i^0\}_{i=1}^N$。 然后,我们利用全局缩放的单目深度图提升特征观测值来初始化稀疏 3D 点。对于在图像 $i$ 中观测到的轨迹 $p$,其具有齐次坐标 $\bar{\mathbf{x}}_{(i,p)}$ 的 2D 特征 $\mathbf{x}_{(i,p)}$ 可以使用全局平均焦距 $f_i$ 如下提升:

$$ \mathbf{u}_{(i,p)} = \frac{K_i^{-1} \bar{\mathbf{x}}_{(i,p)}}{\| K_i^{-1} \bar{\mathbf{x}}_{(i,p)} \|} \quad (14) $$

该观测值被变换到世界坐标系中,如下所示:

$$ \mathbf{X}_{(i,p)}^w = \mathbf{c}_i^0 + R_i^\top \tilde{D}_i(\mathbf{x}_{(i,p)}) \mathbf{u}_{(i,p)} \quad (15) $$

对于在多个图像中观测到的轨迹 $p$,我们通过聚合其提升的观测值来初始化 3D 点:

$$ \mathbf{X}_p^0 = \operatorname{median} \{ \mathbf{X}_{(i,p)}^w \mid i \in \mathcal{I}(p) \} \quad (16) $$

其中 $\mathcal{I}(p)$ 是观测到轨迹 $p$ 的图像集合。 初始化的相机中心 $\mathbf{c}_i^0$ 和深度提升点 $\mathbf{X}_p^0$ 随后被传递到标准的 GLOMAP 全局定位阶段,该阶段利用多视图射线一致性联合优化相机中心和 3D 点:

$$ \min_{\{\mathbf{c}_i\}, \{\mathbf{X}_p\}} \sum_{(i,p) \in \mathcal{O}} \alpha_{(i,p)} \rho \left( (\mathbf{X}_p – \mathbf{c}_i) R_i^\top \mathbf{u}_{(i,p)} \right) \quad (17) $$

其中 $\mathcal{O}$ 是特征观测集合,$\alpha$ 是归一化因子,$\rho$ 是鲁棒损失函数。最终重建仍通过全局光束法平差进行细化。

4 实验

实现细节。我们使用纯 Python 结合 Numpy 和 PyTorch 实现了整个全局 SfM 流水线。对于主要实验,我们使用

第 11 页

DGSfM 11

GT GLOMAP Ours Ours Images (LoMa) (LoMa) (RoMa v1)

图 3:在 ETH3D [48] 上的定性比较。与 GLOMAP [35] 相比,我们的方法在使用 LoMa [34] 匹配时能产生更稳定的相机位姿估计,而使用密集 RoMa v1 [14] 匹配则能生成更完整的 3D 结构。

MoGe2 [57] 以提取度量深度图。我们的旋转平均模块遵循 InstantSfM [70] 的实现,而基于 GPU 加速的稀疏优化则基于 BAE [67]。我们分别对全局尺度平均、全局定位和光束法平差进行 30、100 和 100 次迭代。光束法平差重复三次,以进一步细化相机参数和 3D 结构。对于轨迹构建,稀疏特征检测器所需的轨迹最小视图数设置为 3 个视图,密集匹配器设置为 2 个视图。更多实现细节,包括误差阈值和过滤参数,请参见附录。

稀疏检测与匹配。我们实验了几种稀疏特征检测与匹配方法,包括使用最近邻匹配的 SIFT [29]、使用 LightGlue [28] 匹配的 ALIKED [69],以及最近的 LoMa [34] 检测与匹配。SIFT、ALIKED 和 LoMa 提取特征的最大数量分别设置为 8192、2048 和 4096。

密集匹配器。我们还实验了密集匹配方法,包括 RoMa v1 [14] 和 RoMa v2 [13]。对于每对图像,我们从密集匹配中采样 10,000 个对应点。与之前的密集特征细化方法 [18,24] 不同,我们没有应用匹配量化 [18] 或非极大值抑制 [10,24],后者在选择密集对应点时会移动匹配点。相反,我们依赖我们提出的过滤策略,在轨迹构建和重建之前移除不可靠的匹配。

第 12 页

12 S. Aung 等

表 1:ETH-3D [48] 和 IMC-2021 [20] 上的多视图相机位姿估计。 我们将 DGSfM(本文方法)与传统 SfM 流水线(增量式 (I) 和全局式 (G))、基于特征优化和密集匹配的方法 (R)、基于单目深度图的方法 (D) 以及前馈式 3D 重建方法 (F) 在不同特征和匹配前端下的表现进行了比较。Ours† 表示未使用 Doppelgangers++ [62] 模块的本文方法。最佳、次佳和第三佳结果已高亮显示。

ETH-3D [48] IMC-2021 [20] Method Type Feature Matching AUC@1° AUC@3° AUC@5° AUC@3° AUC@5° AUC@10°

COLMAP [45] I 31.58 45.65 49.18 27.56 37.10 48.55 GLOMAP [35] G 41.22 56.56 60.58 33.79 44.48 57.38 SIFT [29] NN InstantSfM [70] G 18.95 33.27 39.11 – – – Ours† D+G 38.88 61.67 70.12 35.55 48.29 64.87

COLMAP [45] I 35.50 53.77 58.68 38.89 50.83 64.40 GLOMAP [35] G ALIKED [69] LightGlue [28] 36.23 50.97 55.21 41.31 53.56 67.37 Ours† D+G 37.19 59.43 66.96 43.43 56.45 71.54

COLMAP [45] I 43.45 61.66 66.32 42.40 54.27 67.36 GLOMAP [35] G 43.74 60.19 64.84 45.91 58.29 71.81 InstantSfM [70] G LoMa-B [34] LoMa-B [34] 23.44 34.64 36.78 – – – Ours† D+G 46.87 71.92 78.78 46.62 60.84 73.80 Ours D+G 51.60 78.25 85.43 46.59 59.91 75.59

COLMAP [45] I 48.19 65.61 71.12 44.58 56.18 68.73 GLOMAP [35] G 46.01 61.70 66.37 46.75 59.32 72.36 InstantSfM [70] G LoMa-G [34] LoMa-G [34] 29.72 38.83 42.75 – – – Ours† D+G 49.01 72.97 79.31 46.75 60.16 74.75 Ours D+G 53.58 79.11 86.04 47.74 61.12 75.65

MP-SfM [37] D+I SuperPoint [10] RoMa v1 [14] 5.64 22.44 34.16 19.43 29.13 40.87 PixSfM [27] I+R SIFT [29] 的特征度量优化 26.94 39.01 42.19 25.54 34.80 46.73 MASt3R-SfM [12] D+G MASt3R [25] MASt3R [25] 27.05 45.84 52.61 31.77 46.36 64.37 DF-SfM [18] I+R 59.12 75.59 79.53 47.43 59.84 73.19 Dense-SfM [24] I+R 60.92 78.41 82.63 48.48 60.79 73.90 RoMa v1 [14] RoMa v1 [14] MV-RoMa [23] I+R – – – 51.31 62.92 75.92 Ours D+G 61.00 82.63 88.33 50.66 63.03 76.30

VGGT [53] F 0.65 8.37 17.76 41.15 55.52 71.73 Pi3 [59] F – – 14.31 38.63 51.25 43.34 57.57 73.35 DepthAnything3 [26] F 15.53 46.27 58.63 44.15 58.54 74.21 VGGT [53]+BA F ALIKED [69]+SP [10] VGGSfM [55] 18.23 38.49 46.98 44.96 58.08 73.52 Pi3 [59]+BA F SIFT [29]+Deep VGGSfM [55]+Deep 32.84 58.51 68.19 55.30 66.43 78.67 VGGSfM [55] F+G SP [10]+SIFT [29] Deep 28.09 44.41 49.91 45.23 58.89 73.92 Ours (Best) D+G RoMa v1 [14] RoMa v1 [14] 61.00 82.63 88.33 50.66 63.03 76.30

4.1 多视图相机位姿估计

我们将本文方法与三组基线方法进行比较。1) 传统 SfM 流水线 [35, 45, 70]。2) 基于特征优化 [27] 和密集匹配 [18,23,24] 的 SfM 方法。3) 前馈式 3D 重建方法 [12,26,53,55,59]。 我们还与 MP-SfM [37] 进行了比较,该方法使用单目先验但需要输入内参。对于所有方法,我们假设相机内参未作为输入提供。由于 MP-SfM 假设相机内参已知,我们改为向其提供由单目深度模型 MoGe2 [57](也用于获取单目深度和表面法线先验)估计的焦距,以便与其他方法进行公平比较。我们使用姿态误差曲线下的面积 (AUC) [20] 来评估相机位姿精度,该指标根据数据集采用多个阈值,遵循标准做法 [18, 24, 27]。我们在下方展示主要基准测试结果,更多结果见附录。

第 13 页

DGSfM 13

表 2:LaMAR [44] 上的多视图相机位姿估计。最佳和次佳结果已高亮显示。

LIN HGE Method Type Feature Matching AUC@5° AUC@10° AUC@30° AUC@5° AUC@10° AUC@30°

COLMAP [45] I 10.69 11.62 12.66 5.34 5.65 5.92 GLOMAP [35] G SIFT [29] NN 5.11 7.19 11.09 1.33 1.71 2.96 Ours D+G 14.48 24.78 31.42 9.32 12.43 20.64

COLMAP [45] I 24.76 32.81 49.07 4.80 5.43 7.30 GLOMAP [35] G LoMa-B [34] LoMa-B [34] 21.18 29.93 43.65 1.07 1.51 3.49 Ours D+G 32.45 45.58 63.74 10.49 15.37 23.49

ETH3D 和 IMC2021。表 1 报告了 ETH3D [48] 和 IMC2021 Phototourism [20] 数据集上的结果。ETH3D 包含使用稀疏高分辨率图像捕获的室内和室外场景,并提供与 LiDAR 对齐的准确相机位姿作为真实值。IMC2021 由大规模室外场景组成,并使用不同大小的图像包进行评估,包括 5、10 和 25 张图像,而不是完整的图像集合。两个数据集的评估均遵循与 [18,24] 相同的协议。为了与传统 SfM 方法进行公平比较,标记为 Ours† 的行禁用了 Doppelgangers++ [62] 模块。 与传统 SfM 流水线相比,我们的方法在最严格的阈值(AUC@1°)下实现了相当或更好的性能,同时在更宽松的 AUC 阈值(AUC@3° 和 AUC@5°)下提供了显著改进,如图 3 中的定性结果进一步所示。在稀疏特征提取和匹配方法中,我们的方法与 LoMa [34] 匹配取得了最佳性能,与密集特征细化方法相当:DF-SfM [18] 和 Dense-SfM [24]。使用密集匹配时,我们的方法在所有阈值下的精度也与密集特征细化方法相当,而无需额外的匹配细化架构。前馈重建方法在 ETH3D 上表现不佳,但在 IMC2021 上由于图像集合较小且重叠度高,与基于稀疏特征的 SfM 方法相比取得了具有竞争力的结果。

LaMAR 上的结果。我们进一步在大规模 LaMAR [44] 数据集上评估我们的方法。我们报告了两个场景的结果:LIN,一个室外场景,以及 HGE,一个混合室内-室外场景。每个场景包含由不同 AR 设备和智能手机捕获的数万个图像,导致具有不同视角和具有挑战性的外观变化的大规模图像集合。从每个场景中,我们选择由 NavVis 设备捕获的前向图像进行评估,导致 LIN 有 993 张图像,HGE 有 1,072 张图像。表 2 报告了结果。对于 SIFT-NN 匹配,我们使用 COLMAPv4.0 中的默认 vocab_tree_matcher 生成图像对。对于 LoMa 匹配,我们使用 MegaLoc [3] 检索,并为每个图像保留检索到的前 50 个图像对。 我们的方法在两个场景和两种匹配前端上均持续优于 COLMAP 和 GLOMAP。在 LIN 上,增益尤为显著,其中室外场景提供了更稳定的视觉重叠和长距离

第 14 页

14 S. Aung 等

表 3:运行时间对比。 表 4:不同深度模型的消融实验。

方法 时间 (秒) 方法 AUC@1° AUC@3° AUC@5°

COLMAP [45] 12.70 MoGe2 [57] 51.60 78.25 85.43 GLOMAP [35] 16.40 MoGe1 [56] 52.47 78.34 85.53 MP-SfM [37] 110.58+3.35 UniK3D [38] 49.00 75.70 83.23 ours 13.99+3.35 UniDepthV2 [39] 48.17 73.99 81.29

连通性。所有方法在 HGE 上的整体性能较低,反映了这一混合室内-外场景具有更高的难度,其中外观变化和较弱的全局连通性使得可靠的图像检索和视图图构建更具挑战性。尽管如此,我们的方法仍然提供了明显的改进。

运行时间。表 3 比较了 ETH3D 数据集上的运行时间。我们的方法运行时间与 GLOMAP 相当,但比 MP-SfM 快得多。对于依赖单目深度估计的方法,报告的运行时间被拆分为 SfM 运行时间和获取所有图像的单目深度估计所需的处理时间。后者在 ETH3D 上耗时 3.35 秒。

4.2 消融实验

表 4 和表 5 展示了我们在 ETH3D [48] 数据集上使用 LoMa-B [34] 匹配进行的流水线消融实验。 表 5:主要模块的消融实验。 视图图过滤。如表 1 和表 5 所示,移除 方法 AUC@1° AUC@3° AUC@5° Doppelgangers++ [62] 阶段会导致 Full 51.60 78.25 85.43 明显的性能下降,特别是在 ETH3D 上 w/o doppelgangers++ 46.87 71.92 78.78 放宽阈值时,这表明视觉模糊的图像 w/o triplet-edge prune 49.54 76.22 83.41 对仍然可以通过几何验证,并对全 w/o scaled-depth filter 48.61 74.46 81.73 局重建产生负面影响。三元组引导 w/o global positioning 40.70 63.40 70.64 的边剪枝也提高了性能,证实了局 w/o scale averaging 47.54 72.98 80.16 部三视图一致性有助于移除仅靠 w/o depth pose init. 48.81±(0.84) 74.03±(1.04) 81.18±(0.97) 成对检查难以检测到的不可靠视图图边。如果没有缩放深度一致性过滤器,AUC 也会下降,表明仅靠对极验证不足以移除所有错误匹配。

全局优化。表 5 还通过直接在深度缩放位姿-点初始化后应用光束法平差(BA)来消融全局定位阶段。这导致性能大幅下降,表明仅靠初始化是不够的,全局定位对于在最终 BA 之前利用多视图射线一致性共同优化相机中心和 3D 点至关重要。在深度相关组件中,全局尺度平均也至关重要。移除它会使 AUC@5 从 85.43 降至 80.16,表明成对深度尺度估计必须在提供可靠

第 15 页

深度提升与初始化。将我们的深度缩放位姿-点初始化替换为随机初始化也会降低性能,并且重要的是,如报告的标准化差所示,会引入运行间的变化。

对单目深度质量的敏感性。表 4 展示了在我们的方法中使用不同单目深度估计器所得到的结果。正如预期的那样,深度预测精度会影响 SfM 性能,其中 MoGe1 和 MoGe2 取得了最佳结果。尽管如此,即使是“最差”的预测器(UniDepthV2)与 COLMAP、GLOMAP 和 InstantSfM 相比也提升了性能(这可以通过将表 4 与表 1 中使用 LoMa-B 获得的结果进行比较来证明)。

5 结论

本文提出了 DGSfM,这是一种深度引导的全局 SfM 流水线,它在保持显式多视图优化的同时,将单目几何融入全局重建中。通过估计感知尺度的相对位姿、利用深度一致性过滤视图图边和对应关系、平均图像级深度尺度,以及从缩放的单目深度初始化相机和 3D 点,DGSfM 减少了传统全局 SfM 的尺度模糊性和初始化敏感性。在 ETH3D 和 IMC2021 上的实验表明,在稀疏和密集匹配前端方面,DGSfM 均相对于强大的 SfM 基线方法获得了一致的提升,这表明单目几何可以在保持显式几何优化准确性和可扩展性的同时,提供有用的度量约束。

6 局限性与未来工作

与使用深度图的其他 SfM 方法 [12, 37] 类似,我们对单目深度估计器的依赖引入了一个潜在的误差源(例如,不准确或错误的深度估计)。在实践中,这似乎并不是一个关键的限制,因为单目深度估计器正在不断改进。通过在相对位姿估计和过滤过程中考虑深度预测的不确定性,可以进一步缓解这一问题,我们将此留作未来工作。在此背景下,联合优化 3D-2D 重投影误差和 2D-2D 对极误差也有助于处理深度图中的不准确之处。我们的方法目前利用深度图来改进 SfM 过程。因此,未来工作的一个有趣方向是利用 SfM 过程的结果来改进深度图,从而获得更准确的密集重建。

第 16 页

16 S. Aung 等人

附录

在本附录中,我们提供额外的细节和结果以支持主论文。我们首先在 A1 节中描述了我们方法的实验设置以及用于公平比较的基线方法。随后,我们在 A2 节中展示了额外的实验。最后,我们在 A3 节中提供了与现有方法的进一步定性比较。

A1 实验设置

超参数。对于使用 RePoseD [11] 的深度感知相对位姿估计,我们将 Sampson 误差阈值设置为 1.0,重投影误差阈值设置为 16.0,RANSAC 迭代次数设置为 1000。对于使用 Doppelgangers++ [62] 的成对边剪枝,我们使用置信度阈值 $\tau_{DG} = 0.8$。对于三元组引导的边剪枝,我们将三元组支持阈值设置为 $\tau_{tri} = 0.6$。在缩放深度一致性过滤阶段,重投影误差阈值 $\tau_{\pi}$ 和深度一致性阈值 $\tau_{d}$ 分别设置为 12.0 和 0.3。我们进一步要求每个保留的图像对至少拥有 15 个内点,且内点比率至少为 0.25。

数据集与评估细节。我们遵循 DF-SfM [18] 和 Dense-SfM [24] 的做法,在 ETH3D [48] 和 IMC-2021 [20] Phototourism 基准测试上进行评估。对于 ETH3D,我们使用 22 个室内和室外场景,图像分辨率调整为 1600×1056。对于 IMC2021,总共有 9 个场景,但评估是在重叠的图像子集上进行的,而非完整的图像集合。具体而言,每个场景使用包含 5 张、10 张和 25 张图像的图像包进行评估,分别对应 100、50 和 25 种不同的子集变体。因此,整体性能受到 5 张图像图像包的强烈影响,这些图像包倾向于有利于具有多视图监督的前馈重建方法,这些方法在小局部视图图上表现有效。对于所有场景,我们使用穷举匹配来构建初始图像对。

A2 实验评估

使用真实内参。表 A1 强调了相机标定对于基于单目先验的 SfM 的重要性。当未提供真实内参时,MP-SfM [37] 表现出有限的性能,尤其是在 ETH3D 上,这表明其增量重建流程对精确标定高度敏感。相比之下,我们的方法通过使用深度感知相对位姿求解器 [11] 和焦距平均法估计的内参保持了鲁棒性,在 ETH3D 和 IMC2021 上均取得了强劲的性能。 当提供真实内参时,MP-SfM 的性能显著提升,证实了精确标定对于其两视图初始化、下一视图注册以及光束法平差至关重要。我们的方法也从真实内参中受益,并在两种情况下均取得了最佳的整体性能

第 17 页

DGSfM 17

表 A1:在 ETH-3D [48] 和 IMC-2021 [20] 上使用估计内参和真实内参的多视图相机位姿估计。我们的方法使用焦距平均得到的内参,MP-SfM 使用 MoGe2 [57] 估计的内参作为输入。Ours⋆ 和 MP-SfM⋆ 使用真实内参。最佳和次佳结果已高亮显示。

ETH-3D [48] IMC-2021 [20] Method Type Feature Matching AUC@1° AUC@3° AUC@5° AUC@3° AUC@5° AUC@10°

MP-SfM [37] D+I SuperPoint [10] RoMa v1 [14] 5.64 22.44 34.16 19.43 29.13 40.87 Ours D+G LoMa-B [34] LoMa-B [34] 51.60 78.25 85.43 46.59 59.91 75.59 Ours D+G RoMa v1 [14] RoMa v1 [14] 61.00 82.63 88.33 50.66 63.03 76.30

MP-SfM⋆[37] D+I SuperPoint [10] RoMa v1 [14] 58.63 78.87 84.34 56.27 62.78 70.54 Ours⋆ D+G LoMa-B [34] LoMa-B [34] 56.74 81.16 87.71 50.77 63.85 77.68 Ours⋆ D+G RoMa v1 [14] RoMa v1 [14] 64.69 85.20 90.50 55.28 68.71 82.36

表 A2:ETH-3D [48] 上的点云精度。我们将 DGSfM(我们的方法)与传统 SfM 流水线(增量式 (I) 和全局式 (G))、基于特征优化和密集匹配的方法 (R)、基于单目深度图的方法 (D) 以及前馈 3D 重建方法 (F) 在不同特征和匹配前端下的表现进行了比较。最佳、次佳和第三佳结果已高亮显示。

精度 (%) 完整性 (%) Method Type Feature Matching 1 cm 2 cm 5 cm 1 cm 2 cm 5 cm

COLMAP [45] I 31.84 43.21 58.66 0.66 2.93 13.28 GLOMAP [35] G LoMa-B [34] LoMa-B [34] 31.65 45.82 65.07 0.27 1.50 9.14 Ours D+G 45.28 61.25 79.76 0.26 1.32 7.49

DepthAnything3 [26] F 13.62 23.96 44.44 8.08 16.24 27.12 PixSfM [27] I+R featuremetric refinement of SIFT [29] 76.18 85.60 93.16 0.17 0.71 3.29 VGGSfM [55] F+G SP [10]+SIFT [29] Deep 80.62 89.49 96.52 4.52 13.11 33.96 MASt3R-SfM [12] D+G MASt3R [25] MASt3R [25] 27.34 43.90 69.50 14.86 34.81 68.72 MP-SfM [37] D+I SuperPoint [10] RoMa v1 [14] 3.64 6.63 12.91 0.26 1.42 7.21 MP-SfM⋆[37] D+I SuperPoint [10] RoMa v1 [14] 42.17 60.42 81.38 3.22 12.2 40.29 DF-SfM [18] I+R 79.32 88.42 95.82 3.13 9.79 29.10 Dense-SfM [24] I+R 84.79 92.62 97.77 7.38 17.06 36.35 RoMa v1 [14] RoMa v1 [14] MV-RoMa [23] I+R 85.88 92.99 98.05 3.95 9.94 23.81 Ours D+G 60.12 74.90 90.17 20.28 47.53 74.58

LoMa 和 RoMa 匹配。在密集 RoMa 匹配的情况下,我们的方法在几乎所有阈值下均优于 MP-SfM。这表明更好的校准进一步加强了深度引导的全局优化。

点云精度。遵循密集特征优化方法 [18, 23, 24],我们还评估了重建点云的精度和完整性。我们使用 ETH3D 训练集,其中包含 13 个具有毫米级精度真实点云的场景。与先前使用固定相机位姿和内参进行三角测量的点的方法不同,我们的方法直接使用光束法平差后产生的优化 3D 点进行评估。我们使用官方 ETH3D 评估工具 [48],并报告在 1 cm、2 cm 和 5 cm 阈值下的精度和完整性。结果在表 A2 中报告。

第 18 页

18 S. Aung 等人

在使用相同的 LoMa-B 前端时,我们的方法在点精度方面大幅优于 COLMAP 和 GLOMAP,但由于严格的深度一致性过滤,导致完整性较低。当使用 RoMa 匹配时,我们的方法生成了完整性高得多的重建结果。它在所有阈值下均实现了最佳的完整性,在 5 cm 阈值下达到 74.58,优于前馈和密集重建基线。然而,诸如 Dense-SfM 和 MV-RoMa 等专门的特征细化方法,通过依赖额外的多视图匹配或匹配细化模块,实现了更高的点精度。这些方法与我们关注于改进 SfM 流程的贡献正交。由于我们的方法可以直接受益于更强的对应关系或细化后的轨迹,这些细化模块可以无需任何更改地轻松集成到我们的流程中,我们预计性能将进一步提升。

A3 附加可视化

ETH3D。 图 A1 和图 A2 提供了 ETH3D [48] 室内和室外场景的定性比较。我们将真实重建结果与 GLOMAP [35]、使用 LoMa [34] 匹配的我们方法、使用 RoMa v1 [14] 匹配的我们方法、MP-SfM [37]、VGGT+BA [53] 以及 DepthAnything3 [26] 进行了比较。 在使用相同的 LoMa 匹配时,我们的方法产生的相机位姿比 GLOMAP 更准确,但点数较少,这些点更干净且更准确,这也得到了表 A2 中三角测量结果的支持。当使用密集的 RoMa 匹配时,我们的方法重建了完整性高得多的 3D 结构,同时保持了稳定的相机位姿,这表明所提出的流程可以从密集对应关系中受益,而无需依赖额外的密集特征细化模块。与 MP-SfM 相比,我们的方法在评估的场景中获得了更干净的点云和更一致的相机位姿。前馈方法如 DepthAnything3 产生了更密集的几何结构,但其相机位姿准确率低得多,且重建的点云在不同视图间可能存在错位(Playground 场景)。总体而言,这些定性结果表明,我们的方法在位姿准确性、点云干净程度和重建完整性之间取得了良好的平衡。

IMC2021。 图 A3 展示了 IMC2021 [20] 不同图像组场景的定性比较。IMC2021 提供了从 COLMAP [45,47] MVS 重建的全图像组中获得的伪真实相机位姿,这些位姿通常包含比 ETH3D 中传感器测量的真实位姿更密集的场景几何结构。我们观察到了与 ETH3D 相似的趋势;在使用相同的 LoMa 匹配时,我们的方法产生的相机位姿比 GLOMAP 略准确,且稀疏点轨迹更干净。与 MP-SfM 相比,我们的方法在林肯雕像和大英博物馆等场景中产生了更稳定的相机位姿,而在这些场景中,MP-SfM 产生了噪声更大且完整性较低点云。使用 RoMa 匹配的我们方法进一步提高了重建完整性,在少量相机的情况下获得了显著更丰富的 3D 结构,同时保持了全局一致的相机位姿。

第 19 页

DGSfM 19

旧计算机 地形 展览厅 休息室 图像

GT

(LoMa) GLOMAP

(LoMa) 本文方法

(RoMa) 本文方法

(RoMa) MP-SfM VGGT+BA DepthAnything3

图 A1:在 ETH3D [48] 室内场景上的定性比较。

第 20 页

20 S. Aung 等.

建筑立面 游乐场 电器 攀岩墙 图像

GT

(LoMa) GLOMAP

(LoMa) 本文方法

(RoMa) 本文方法

(RoMa) MP-SfM VGGT+BA DepthAnything3

图 A2:在 ETH3D [48] 室外场景上的定性比较。

第 21 页

DGSfM 21

GT GLOMAP MP-SfM Ours Ours Images (LoMa) (RoMa) (LoMa) (RoMa)

Statue Lincoln

Cathedral Florence Museum British

Bridge London

Rushmore Mount

图 A3:在不同图像集合下,IMC-2021 [20] 场景上的定性比较。

第 22 页

22 S. Aung 等人

参考文献

1. Agarwal, S., Furukawa, Y., Snavely, N., Simon, I., Curless, B., Seitz, S.M., Szeliski, R.: Building rome in a day. Communications of the ACM 54(10), 105–112 (2011) 2. Baid, A., Lambert, J., Driver, T., Krishnan, A., Stepanyan, H., Dellaert, F.: 基于深度前端的分布式全局运动恢复结构。arXiv 预印本 arXiv:2311.18801 (2023) 3. Berton, G., Masone, C.: Megaloc: One retrieval to place them all. In: IEEE/CVF 计算机视觉与模式识别会议研讨会。pp. 2886– 2892 (2025年6月) 4. Birkl, R., Wofk, D., Müller, M.: Midas v3.1 – a model zoo for robust monocular relative depth estimation. arXiv 预印本 arXiv:2307.14460 (2023) 5. Bochkovskii, A., Delaunoy, A., Germain, H., Santos, M., Zhou, Y., Richter, S.R., Koltun, V.: Depth pro: Sharp monocular metric depth in less than a second. In: 国际学习表征会议 (2025), https://arxiv. org/abs/2410.02073 6. Chatterjee, A., Govindu, V.M.: Efficient and robust large-scale rotation averaging. In: IEEE国际计算机视觉会议论文集。pp. 521– 528 (2013) 7. Crandall, D., Owens, A., Snavely, N., Huttenlocher, D.: Discrete-continuous op- timization for large-scale structure from motion. In: CVPR 2011. pp. 3001–3008. IEEE (2011) 8. Cui, Z., Tan, P.: Global structure-from-motion by similarity averaging. In: Proceed- ings of the IEEE International Conference on Computer Vision (ICCV) (December 2015) 9. Deng, K., Ti, Z., Xu, J., Yang, J., Xie, J.: Vggt-long: Chunk it, loop it, align it–pushing vggt’s limits on kilometer-scale long rgb sequences. arXiv 预印本 arXiv:2507.16443 (2025) 10. DeTone, D., Malisiewicz, T., Rabinovich, A.: Superpoint: Self-supervised interest point detection and description. In: Proceedings of the IEEE conference on com- puter vision and pattern recognition workshops. pp. 224–236 (2018) 11. Ding, Y., Kocur, V., Vávra, V., Haladová, Z.B., Yang, J., Sattler, T., Kukelova, Z.: Reposed: Efficient relative pose estimation with known depth information. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 14876–14886 (2025) 12. Duisterhof, B.P., Zust, L., Weinzaepfel, P., Leroy, V., Cabon, Y., Revaud, J.: Mast3r-sfm: a fully-integrated solution for unconstrained structure-from-motion. In: 2025 International Conference on 3D Vision (3DV). pp. 1–10. IEEE (2025) 13. Edstedt, J., Nordström, D., Zhang, Y., Bökman, G., Astermark, J., Larsson, V., Heyden, A., Kahl, F., Wadenbäck, M., Felsberg, M.: Roma v2: Harder better faster denser feature matching. arXiv 预印本 arXiv:2511.15706 (2025) 14. Edstedt, J., Sun, Q., Bökman, G., Wadenbäck, M., Felsberg, M.: Roma: Robust dense feature matching. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 19790–19800 (2024) 15. Hartley, R., Li, H.: An efficient hidden variable approach to minimal-case camera motion estimation. IEEE transactions on pattern analysis and machine intelligence 34(12), 2303–2314 (2012) 16. Hartley, R., Zisserman, A.: Multiple view geometry in computer vision. Cambridge university press (2003)

第 23 页

DGSfM 23

17. Hartley, R.I., Sturm, P.: 三角化。计算机视觉与图像理解 68(2), 146–157 (1997) 18. He, X., Sun, J., Wang, Y., Peng, S., Huang, Q., Bao, H., Zhou, X.: 无检测器的运动恢复结构。在:IEEE/CVF计算机视觉与模式识别会议论文集。第21594–21603页 (2024) 19. Hu, M., Yin, W., Zhang, C., Cai, Z., Long, X., Chen, H., Wang, K., Yu, G., Shen, C., Shen, S.: Metric3d v2:用于零样本度量深度和表面法线估计的多功能单目几何基础模型。IEEE模式分析与机器智能汇刊 (2024) 20. Jin, Y., Mishkin, D., Mishchuk, A., Matas, J., Fua, P., Yi, K.M., Trulls, E.: 宽基线图像匹配:从论文到实践。国际计算机视觉杂志 129(2), 517–547 (2021) 21. Keetha, N., Müller, N., Schönberger, J., Porzi, L., Zhang, Y., Fischer, T., Knapitsch, A., Zauss, D., Weber, E., Antunes, N., 等:Mapanything:通用前馈度量3D重建;map-anything。github.io。在:2026年第三届国际3D视觉会议 (3DV)。第499–509页。IEEE (2026) 22. Kruskal, J.B.: 关于图的最短生成树和旅行商问题。美国数学学会汇刊 7(1), 48–50 (1956) 23. Lee, J., Kang, S., Yoo, S.: Mv-roma:从成对匹配到多视图轨迹重建。在:IEEE/CVF计算机视觉与模式识别会议 (CVPR) 论文集。第7446–7456页 (2026年6月) 24. Lee, J., Yoo, S.: Dense-sfm:具有密集一致匹配的运动恢复结构。在:计算机视觉与模式识别会议论文集。第6404–6414页 (2025) 25. Leroy, V., Cabon, Y., Revaud, J.: 借助Mast3r将图像匹配锚定于3D。在:欧洲计算机视觉会议。第71–91页。Springer (2024) 26. Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B.: Depth anything 3:从任意视角恢复视觉空间。arXiv预印本 arXiv:2511.10647 (2025) 27. Lindenberger, P., Sarlin, P.E., Larsson, V., Pollefeys, M.: 具有特征度量精化的像素级运动恢复结构。在:IEEE/CVF国际计算机视觉会议论文集。第5987–5997页 (2021) 28. Lindenberger, P., Sarlin, P.E., Pollefeys, M.: Lightglue:光速局部特征匹配。在:IEEE/CVF国际计算机视觉会议论文集。第17627–17638页 (2023) 29. Lowe, D.G.: 来自尺度不变关键点的独特图像特征。国际计算机视觉杂志 60(2), 91–110 (2004) 30. Maggio, D., Lim, H., Carlone, L.: Vggt-slam:在SL(4)流形上优化的密集RGB SLAM。神经信息处理系统进展 38, 129839–129867 (2026) 31. Manam, L., Govindu, V.M.: 利用相机三元组实现高效准确的运动恢复结构。在:IEEE/CVF计算机视觉与模式识别会议论文集。第4959–4968页 (2024) 32. Meza, J., Oswald, M.R., Sattler, T.: 基准测试新颖视图合成的高效且有效的相机位姿估计策略。arXiv预印本 arXiv:2603.20428 (2026) 33. Moulon, P., Monasse, P., Perrot, R., Marlet, R.: OpenMVG:开放多视图几何。在:模式识别可重复研究国际研讨会。第60–74页。Springer (2016)

第 24 页

24 S. Aung 等人

34. Nordström, D., Edstedt, J., Bökman, G., Astermark, J., Heyden, A., Larsson, V., Wadenbäck, M., Felsberg, M., Kahl, F.: Loma: Local feature matching revisited. arXiv 预印本 arXiv:2604.04931 (2026) 35. Pan, L., Baráth, D., Pollefeys, M., Schönberger, J.L.: Global structure-from-motion revisited. In: European Conference on Computer Vision. pp. 58–77. Springer (2024) 36. Pan, L., Schönberger, J., Pollefeys, M.: Global structure-from-motion meets feed- forward reconstruction. In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition. pp. 21880–21890 (2026) 37. Pataki, Z., Sarlin, P.E., Schönberger, J.L., Pollefeys, M.: Mp-sfm: Monocular sur- face priors for robust structure-from-motion. In: Proceedings of the Computer Vi- sion and Pattern Recognition Conference. pp. 21891–21901 (2025) 38. Piccinelli, L., Sakaridis, C., Segu, M., Yang, Y.H., Li, S., Abbeloos, W., Van Gool, L.: UniK3D: Universal camera monocular 3d estimation. In: IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition (CVPR) (2025) 39. Piccinelli, L., Sakaridis, C., Yang, Y.H., Segu, M., Li, S., Abbeloos, W., Gool, L.V.: UniDepthV2: Universal monocular metric depth estimation made simpler (2025), https://arxiv.org/abs/2502.20110 40. Piccinelli, L., Yang, Y.H., Sakaridis, C., Segu, M., Li, S., Van Gool, L., Yu, F.: UniDepth: Universal monocular metric depth estimation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024) 41. Ranftl, R., Bochkovskiy, A., Koltun, V.: Vision transformers for dense prediction. ICCV (2021) 42. Ranftl, R., Lasinger, K., Hafner, D., Schindler, K., Koltun, V.: Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer. IEEE Transactions on Pattern Analysis and Machine Intelligence 44(3) (2022) 43. Sarlin, P.E., DeTone, D., Malisiewicz, T., Rabinovich, A.: Superglue: Learning feature matching with graph neural networks. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 4938–4947 (2020) 44. Sarlin, P.E., Dusmanu, M., Schönberger, J.L., Speciale, P., Gruber, L., Larsson, V., Miksik, O., Pollefeys, M.: LaMAR: Benchmarking Localization and Mapping for Augmented Reality. In: ECCV (2022) 45. Schonberger, J.L., Frahm, J.M.: Structure-from-motion revisited. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 4104–4113 (2016) 46. Schonberger, J.L., Zheng, E., Frahm, J.M., Pollefeys, M.: Pixelwise view selection for unstructured multi-view stereo. In: European conference on computer vision. pp. 501–518. Springer (2016) 47. Schönberger, J.L., Zheng, E., Pollefeys, M., Frahm, J.M.: Pixelwise view selection for unstructured multi-view stereo. In: European Conference on Computer Vision (ECCV) (2016) 48. Schops, T., Schonberger, J.L., Galliani, S., Sattler, T., Schindler, K., Pollefeys, M., Geiger, A.: A multi-view stereo benchmark with high-resolution images and multi-camera videos. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 3260–3269 (2017) 49. Snavely, N., Seitz, S.M., Szeliski, R.: Photo tourism: exploring photo collections in 3d. In: ACM siggraph 2006 papers, pp. 835–846. Association for Computing Machinery (2006) 50. Sun, J., Shen, Z., Wang, Y., Bao, H., Zhou, X.: Loftr: Detector-free local fea- ture matching with transformers. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 8922–8931 (2021)

第 25 页

DGSfM 25

51. Triggs, B., McLauchlan, P.F., Hartley, R.I., Fitzgibbon, A.W.: 光束法平差——一种现代综合。在:国际视觉算法研讨会。第 298–372 页。Springer (1999) 52. Wang, H., Agapito, L.: 具有空间记忆的 3D 重建。在:2025 国际 3D 视觉会议 (3DV)。第 78–89 页。IEEE (2025) 53. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt:视觉几何基础 Transformer。在:计算机视觉与模式识别会议论文集。第 5294–5306 页 (2025) 54. Wang, J., Chen, M., Zhang, S., Karaev, N., Schönberger, J., Labatut, P., Bojanowski, P., Novotny, D., Vedaldi, A., Rupprecht, C.: Vggt-omage。arXiv 预印本 arXiv:2605.15195 (2026) 55. Wang, J., Karaev, N., Rupprecht, C., Novotny, D.: Vggsfm:视觉几何基础的深度运动恢复结构。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 21686–21697 页 (2024) 56. Wang, R., Xu, S., Dai, C., Xiang, J., Deng, Y., Tong, X., Yang, J.: Moge:通过最优训练监督解锁开放域图像的单目几何估计。在:计算机视觉与模式识别会议论文集。第 5261–5271 页 (2025) 57. Wang, R., Xu, S., Dong, Y., Deng, Y., Xiang, J., Lv, Z., Sun, G., Tong, X., Yang, J.: Moge-2:具有度量尺度和清晰细节的准确单目几何估计 (2025),https://arxiv.org/abs/2507.02546 58. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r:简化几何 3D 视觉。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 20697–20709 页 (2024) 59. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: pi3:置换等变视觉几何学习。arXiv 预印本 arXiv:2507.13347 (2025) 60. Wilson, K., Snavely, N.: 基于 1dsfm 的鲁棒全局平移。在:欧洲计算机视觉会议。第 61–75 页。Springer (2014) 61. Wu, C.: 迈向线性时间增量运动恢复结构。在:2013 国际 3D 视觉会议-3DV 2013。第 127–134 页。IEEE (2013) 62. Xiangli, Y., Cai, R., Chen, H., Byrne, J., Snavely, N.: Doppelgangers++:利用几何 3D 特征改进视觉歧义消除。在:计算机视觉与模式识别会议论文集。第 27166–27175 页 (2025) 63. Yang, L., Kang, B., Huang, Z., Xu, X., Feng, J., Zhao, H.: Depth anything:释放大规模无标签数据的潜力。在:CVPR (2024) 64. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2。arXiv:2406.09414 (2024) 65. Yin, W., Zhang, C., Chen, H., Cai, Z., Yu, G., Wang, K., Chen, X., Shen, C.: Metric3d:迈向从单张图像进行零样本度量 3D 预测。在:IEEE/CVF 国际计算机视觉会议论文集。第 9043–9053 页 (2023) 66. Yu, Y., Liu, S., Pautrat, R., Pollefeys, M., Larsson, V.: 通过对单目深度先验的仿射校正进行相对位姿估计。在:计算机视觉与模式识别会议论文集。第 16706–16716 页 (2025) 67. Zhan, Z., Xu, H., Fang, Z., Wei, X., Hu, Y., Wang, C.: 急切模式下的光束法平差。IEEE 机器人汇刊 (2026),https://arxiv.org/abs/2409.12190 68. Zhang, Y., Keetha, N., Lyu, C., Jhamb, B., Chen, Y., Qiu, Y., Karhade, J., Jha, S., Hu, Y., Ramanan, D., 等:Ufm:通过流实现统一密集对应关系的简单路径。arXiv 预印本 arXiv:2506.09278 (2025)

第 26 页

26 S. Aung 等人

69. Zhao, X., Wu, X., Chen, W., Chen, P.C., Xu, Q., Li, Z.: Aliked: A lighter keypoint and descriptor extraction network via deformable transformation. IEEE Transac- tions on Instrumentation and Measurement 72, 1–16 (2023) 70. Zhong, J., Zhan, Z., Gao, Q., Chen, Z., Lou, H., Mao, J., Neumann, U., Wang, Y.: Instantsfm: Fully sparse and parallel Structure-from-Motion. arXiv preprint (2025) 71. Zhuang, B., Cheong, L.F., Lee, G.H.: Baseline desensitizing in translation aver- aging. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 4539–4547 (2018)

发表评论