三分钟导读:HETA++提出了一种混合显式平移平均框架,通过结合相对平移和特征轨迹,利用凸距离目标函数初始化并结合非双线性角度目标函数进行精炼,显著提升了全局SfM的精度、鲁棒性和效率。
英文题目:HETA++: Global Structure-from-Motion with Hybrid Explicit Translation Averaging
论文出处:arXiv 每日论文精选 · arXiv:2607.15912
原始论文:PDF / 论文页面
对应视频标题:HETA++:混合显式平移平均提升全局SfM精度与效率|推荐指数:★★★★★
这篇论文解决什么问题?
现有的全局平移平均方法仅依赖相对平移或特征轨迹,前者在共线相机运动下易退化,后者易受异常值影响;且现有显式方法(如GLOMAP)使用双线性目标函数和随机初始化,导致鲁棒性不足和计算成本高。
核心创新
- 提出混合显式平移平均初始化策略,结合凸距离目标函数和非双线性角度目标函数,提高收敛性和鲁棒性。
- 引入基于全局一致性的相对平移过滤机制,利用特征视差角和极平面法向量分布计算置信度,有效去除异常值。
- 设计联合优化模块,通过选择空间平衡的特征轨迹进行选择性角度精炼和束调整,减少对初始旋转精度的依赖并提高优化效率。
- 采用非双线性角度目标函数替代双线性函数,避免优化冗余尺度变量,降低内存和时间成本。
方法概览
1. 视图-轨迹图构建:构建包含相机和3D点的图结构。2. 相对平移精炼:利用全局旋转重新估计相对平移,基于特征视差角和极平面分布计算置信度,并过滤全局不一致的平移。3. 混合显式初始化:先用凸距离目标函数(L1范数)通过平移平均初始化相机位置,再通过交替三角测量估计3D点和相机位置,最后用非双线性角度目标函数精炼。4. 联合优化:选择空间平衡的特征轨迹进行选择性角度精炼和束调整,最后使用所有可靠轨迹进行完整束调整。
逐图理解论文
方法概览:视图-轨迹图与流程

HETA++的整体流程如图2所示。首先,给定一组图像,构建视图-轨迹图,其中节点代表图像或3D点,边编码相机到相机及相机到点的约束。接着,基于全局一致性对相对平移进行局部精炼和过滤。随后,引入混合显式初始化模块估计初始相机位置和3D点。最后,通过联合优化逐步精炼相机参数和3D点,获得包含相机内参、位姿和3D场景的重建结果。
相对平移精炼:全局一致性过滤

相对平移精炼是提升鲁棒性的关键。利用全局旋转重新估计相对平移,基于特征视差角和极平面分布计算置信度。如图4所示,特征射线中的角度误差会影响极平面法向量,进而影响平移估计。通过计算特征视差角和极平面法向量分布,我们可以量化相对平移的可靠性,并过滤掉全局不一致的平移,有效去除异常值,特别是在共线运动场景下。
置信度计算与异常值剔除

为了量化相对平移的质量,我们分析了相对平移角度误差与特征值比率log(Ra)的关系。如图6所示,在KITTI-05数据集中,较大的特征值比率通常对应较低的相对平移角度误差。通过映射log(Ra)到置信度分数,我们可以设定阈值剔除低置信度的相对平移。这种基于全局一致性的过滤机制,显著提高了平移平均的准确性,特别是在存在大量异常值的场景中。
混合显式初始化策略

初始化策略直接影响优化的收敛性。HETA++提出混合显式初始化,首先使用凸距离目标函数(L1范数)通过平移平均初始化相机位置,这比双线性目标函数更具鲁棒性。随后,通过交替三角测量估计3D点和相机位置。最后,使用非双线性角度目标函数进行精炼。非双线性角度目标函数避免了优化冗余尺度变量,降低了内存和时间成本,同时提高了精度。
1DSfM数据集精度评估

在1DSfM大规模无序场景重建实验中,HETA++展现了卓越的精度。如表1所示,在平均AUC@3°、5°、10°指标上,HETA++优于HETA和GLOMAP。特别是在PIC场景中,HETA++的AUC@3°达到46.3,优于GLOMAP和HETA的44.2。这表明混合显式平移平均框架在处理复杂场景时,具有更强的鲁棒性和准确性。
实验与关键结果
- 在1DSfM数据集上进行大规模无序场景重建实验,评估相机姿态精度和运行时间。
- 在ETH3D MVS (DSLR)和ETH3D MVS (rig)数据集上进行小规模和序列场景实验。
- 在KITTI和LaMAR序列数据集上进行评估,特别是在近共线运动场景下的表现。
- 进行消融实验,分析相对平移精炼、初始化策略和联合优化模块的贡献。
- 在1DSfM数据集上,HETA++在平均AUC@3°、5°、10°指标上优于HETA和GLOMAP,且运行时间比HETA快2倍,比GLOMAP快3倍。(第 3 页)
- 在1DSfM数据集上,HETA++在PIC场景的AUC@3°达到46.3,优于GLOMAP的44.2和HETA的44.2。(第 14 页)
- 在1DSfM数据集上,HETA++在TFG场景的运行时间为64656秒,显著低于GLOMAP的203537秒和HETA的138640秒。(第 15 页)
- 在KITTI数据集上,HETA++在序列02和08上的相机轨迹与地面真值吻合度高,优于COLMAP、CReTA、LiGT、HETA和GLOMAP。(第 17 页)
阅读时需要注意
- 方法依赖于准确的初始全局旋转估计,若旋转平均结果误差较大,可能影响后续平移平均的精度。
- 在极低纹理或特征匹配极少的场景下,视图-轨迹图的构建可能不完整,影响整体重建效果。
- 对于超大规模场景,尽管效率提升,但完整的束调整阶段仍可能消耗较多计算资源。
- 实验结果基于特定的视图-轨迹图构建和特征匹配参数,不同数据集可能需要调整阈值(如视差角阈值Tα)。
- 与增量式方法COLMAP相比,全局方法在注册图像数量上可能略少,但在大规模场景下效率更高。
- HETA++的性能依赖于特征轨迹的质量,异常值较多的场景需要更严格的过滤策略。
关联工作
- HETA:本文是HETA的升级版,改进了初始化策略和精炼模块。(第 3 页)
- GLOMAP:作为对比的显式全局SfM方法,使用双线性角度目标函数和随机初始化。(第 3 页)
- 1DSfM:经典的显式全局SfM方法,使用非凸角度目标函数,本文借鉴其角度残差概念。(第 3 页)
- LiGT:隐式全局SfM方法,仅使用特征射线约束,对异常值敏感。(第 4 页)
- CReTA:仅使用相对平移的相机姿态估计方法,在共线运动下表现不佳。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HETA++:基于混合显式平移平均的全局运动恢复结构
陶培林1,2,崔海南1,2*,荣梦琪1,2,沈舒涵1,2*
1中国科学院自动化研究所,中国北京,100190。 2中国科学院大学人工智能学院,中国北京,100049。
*通讯作者。邮箱:hncui@nlpr.ia.ac.cn; shshen@nlpr.ia.ac.cn;
摘要
全局运动恢复结构(SfM)在效率和误差分布方面优于增量式方法。然而,平移平均任务仍然具有挑战性。许多现有方法仅依赖相对平移或特征轨迹,这在相机运动共线时会性能下降,或者容易受到异常值的影响。在本文中,我们提出了一种新颖的混合显式平移平均框架,该框架同时结合了相对平移和特征轨迹。具体而言,我们首先利用全局相机旋转对相对平移进行精炼,并剔除全局不一致的相对相机平移。接着,我们采用基于距离的非双线性目标函数和基于角度的目标函数来估计初始相机位置和3D点。此外,由于在平移平均期间相机旋转是固定的,不准确的相机旋转会严重限制相机位置的精度。为了解决这个问题,我们通过有界的基于角度的精炼以及随后的基于重投影的束调整(Bundle Adjustment),利用选定的特征轨迹对相机旋转和相机位置进行鲁棒精炼。在此步骤中,选择特征轨迹以保持平衡的空间分布并提高优化效率。最后,我们使用所有可靠的特征轨迹执行完整的束调整,以精炼相机参数和3D点。在各种顺序和无序的真实世界数据集上的大量实验证明了我们方法的优越准确性、鲁棒性和可扩展性,其在准确性和计算效率方面均优于最先进的方法。
关键词:全局运动恢复结构,平移平均,特征轨迹,3D重建
1 引言
从图像集合中恢复相机运动和3D结构是计算机视觉中的一个基本问题,在导航(Campos et al. 2021; Mur-Artal et al. 2015)、增强现实(Liu et al. 2019; Peng et al. 2022; Quesada and Demiris 2023)、多视图立体视觉(MVS)(Peng et al. 2022; Sch¨onberger et al. 2016)以及新视角合成(Barron et al. 2022; Kerbl et al. 2023)等领域有着广泛的应用。运动恢复结构(SfM)是解决此问题的常见且有效的方法。它始于特征提取、图像检索和特征匹配,以建立图像对之间的对应关系并构建视图图(View-Track Graph)。基于得到的多视图特征对应关系,相机参数和3D场景结构随后通过最小化重投影误差,利用束调整(BA)(Triggs
第 2 页
et al. 2000; Ren et al. 2022)。然而,在显著的光照变化、遮挡和重复结构等条件下,2D 图像特征点经常匹配错误。束调整(Bundle Adjustment)的高度非凸性质使其对异常特征轨迹(outlier feature tracks)敏感。因此,在保持效率的同时提高鲁棒性和准确性,仍然是运动恢复结构(Structure-from-Motion, SfM)技术中长期存在的挑战。
运动恢复结构的主要范式是增量式的,COLMAP(Sch¨onberger and Frahm 2016)即为此类方法的典范。该方法首先仔细选择一对图像以创建初始模型。接下来,使用透视-n-点(Perspective-n-Point, PnP)求解器(Gao et al. 2003; Ding et al. 2023)以及 RANSAC 来拒绝异常对应关系,从而注册具有足够 2D-3D 对应关系的图像。随后,通过重复的相机注册、三角测量和束调整,逐步优化场景结构和相机位姿。尽管增量式方法(Snavely et al. 2006; Sweeney 2019; Sch¨onberger and Frahm 2016)实现了高重建精度和对异常值强大的鲁棒性,但其结果可能依赖于图像注册顺序,从而导致误差累积和漂移(Holynski et al. 2020)。此外,重复的非凸束调整显著阻碍了效率,使其不适合大规模场景。
作为一种替代范式,全局方法首先通过旋转平均(rotation averaging)(Chatterjee and Govindu 2017; Zhang et al. 2023)同时估计所有全局相机旋转,然后通过平移平均(translation averaging)(Zhu et al. 2018; Liu et al. 2019; Cai et al. 2021; Manam and Govindu 2022)和三角测量(Sch¨onberger and Frahm 2016)估计全局相机位置和 3D 点,从而显著提高了效率并实现了均匀的误差分布。随后,通过束调整对所有相机参数和结构进行优化。因此,全局方法的关键问题是从视图图(view graph)中的相对相机位姿和特征对应关系中,鲁棒且准确地估计初始相机位姿和 3D 点。对于全局旋转估计,给定视图图中的相对旋转,基于李代数结构的现有方法(Govindu 2004; Chatterjee and Govindu 2013)已得到广泛研究。相比之下,从两视图几何估计的相对平移存在尺度不确定性,并且在低视差条件(Liu et al. 2019; Concha et al. 2021)和异常特征匹配(Olsson et al. 2010; Sim and Hartley 2006b)下更为敏感,从而使得全局平移估计问题复杂化。
经典的全球平移估计方法(Ozyesil and Singer 2015; Zhuang et al. 2018; Manam and Govindu 2022)完全依赖于相对平移。尽管这些方法效率极高,但当相机运动轨迹共线时(Cui and Tan 2015),它们会遇到退化问题。在更常见的情况下,相机运动轨迹几乎共线,且相机三元组通常形成斜三角形(Manam and Govindu 2023),相对平移的微小扰动会导致估计相机位置的巨大变化,从而导致估计过程的不稳定。此外,仅依赖相对平移的方法需要足够约束的相机方向图(camera-direction graph),当该图缺乏平行刚性(parallel rigidity)时(Arrigoni et al. 2021),可能会发生退化。
为了缓解这些局限性,一些方法将来自特征轨迹(Feature Tracks)的额外相机到点约束纳入其目标函数。每个特征轨迹由观察同一 3D 点的相机和对应的特征射线组成。根据特征轨迹对应的 3D 点是否在优化过程中被估计,这些方法可分为隐式或显式两类。在大多数隐式方法中,3D 点由特征射线及其对应特征轨迹中相机之间的相对平移表示。使用隐式 3D 点,相机基线尺度是基于特征射线的深度一致性(Jiang et al. 2013; Cui and Tan 2015; Cui et al. 2016)估计的,或者将额外的相机到相机约束纳入目标函数(Cui et al. 2015; Liu et al. 2019; Cai et al. 2021)。尽管隐式方法避免了显式的 3D 点优化,但它们产生的表示鲁棒性和准确性较低。
对于显式方法,3D 点表示为三维向量,并在全局平移估计过程中显式估计。一种典型的显式方法是 1DSfM(Wilson and Snavely 2014),它将相机到相机和相机到点的约束纳入一个非凸的、基于角度(Angle-based)的目标函数中,以使用 Levenberg–Marquardt 算法通过随机初始化直接优化相机位置和 3D 点。
第 3 页
我们引入了一种混合显式平移平均方法用于初始化,其中相机位置和3D点首先使用基于凸叉积形式距离的目标函数进行估计,然后使用紧凑的非双线性基于角度的目标函数进行精炼。这种基于角度的精炼通过专注于相机位置和3D点,最小化了未知参数的数量,从而提高了效率并减少了内存使用。其次,由于平移平均对相对平移的质量敏感,我们使用全局相机旋转重新估计相对平移,并在初始化之前移除全局不一致的相对平移。第三,我们提出了一种联合优化模块,用于在初始化后精炼相机参数和3D点。由于相机旋转在初始化期间是固定的,其精度不足会严重限制初始化的准确性。为了减少对初始相机旋转精度的依赖,我们首先通过基于角度的精炼利用选定的特征轨迹改进相机位姿,随后进行基于重投影的束调整。在此步骤中,选择空间平衡的特征轨迹子集以提高效率。最后,我们使用所有可靠的特征轨迹执行完整的束调整,以精炼相机参数和3D点。
我们在四个方面改进了HETA:1) 在重新估计相对平移后,我们根据全局一致性进一步过滤相对平移,以减少异常值对平移平均的影响。2) 与HETA (Tao et al. 2024) 中联合估计初始相机位置和3D点不同,我们首先仅使用相对平移通过平移平均估计相机位置,然后应用交替三角测量并行估计所有特征轨迹的相机位置和3D点,从而提高了初始化的效率。3) 为了避免在BCD优化器的每次迭代中估计冗余的尺度变量,我们采用LM优化器处理非双线性基于角度的目标函数,以提高收敛性和效率。4) 在最终束调整之前,我们在联合优化模块中使用选定的特征轨迹进一步精炼相机位姿。图1展示了在Trafalgar (Wilson and Snavely 2014) 上的大规模重建,证明了我们方法的鲁棒性、准确性和可扩展性。
Fig. 1 Trafalgar (Wilson and Snavely 2014) 上的重建,包含超过5,000张图像。我们的方法比HETA (Tao et al. 2024) 和GLOMAP (Pan et al. 2025) 获得更准确的相机位置,同时运行速度是HETA的两倍,是GLOMAP的三倍。然而,在处理特征轨迹中的异常特征点时,它通常会产生噪声解。同样,最近的方法GLOMAP (Pan et al. 2025) 也利用LM方法优化相机位置和3D点,并采用随机初始化。它通过为每条特征射线引入额外变量,利用双线性基于角度的目标函数 (Zhuang et al. 2018)。这种方法达到了与增量方法相当的精度,证明了基于角度的目标函数的显式方法的鲁棒性和准确性。尽管双线性目标函数提供了更好的收敛性,但该非凸问题的随机初始化破坏了鲁棒性。双线性目标函数联合估计相机位置、3D点以及相对平移或特征射线的尺度。一旦优化相机位置和3D点,这些尺度变量就是冗余的,增加了时间和内存成本并限制了可扩展性。我们之前的工作HETA (Tao et al. 2024) 首先使用基于凸L1距离的目标函数,从精炼的相对平移和选定的特征轨迹中联合初始化相机位置和3D点。然后应用基于L2的角度目标函数,结合相机到相机和相机到点的约束。然而,其块坐标下降优化器限制了这种精炼的有效性。
在本文中,我们提出了HETA的升级版,称为HETA++。与传统的显式方法(如1DSfM (Wilson and Snavely 2014) 和GLOMAP (Pan et al. 2025))相比,我们的方法提供了三个关键贡献。
第 4 页
2 相关工作
2.1 全局旋转平均
全局旋转平均从成对相对旋转中估计绝对相机旋转 (Hartley et al. 2013),并得到了广泛研究。Chatterjee 和 Govindu (2017) 在李代数中表述该问题,而在弦距离下的谱松弛和半定松弛提供了强有力的恢复保证 (Arie-Nachimson et al. 2012; Rosen et al. 2019)。Eriksson 等人 (2018) 利用谱图理论分析其拉格朗日对偶,Dellaert 等人 (2020) 则通过一系列高维提升寻求全局最优解。层次化初始化 (Lee and Civera 2022)、端到端估计 (Yang et al. 2021) 以及相对旋转的可靠加权 (Zhang et al. 2023; Sidhartha and Govindu 2021) 也已被探索。在本工作中,我们采用 Chatterjee 和 Govindu (2017) 的鲁棒方法。
2.2 全局平移平均
给定全局相机旋转,平移平均方法仅从相对平移中或结合特征轨迹来估计相机位置。后者可根据是否直接优化关联的 3D 点进一步分为隐式或显式两类。
纯平移平均。Govindu (2001) 提出了全局平移估计的最小二乘解,并通过迭代权重细化平移。几项工作 (Sim and Hartley 2006a; Ke and Kanade 2007; Kahl and Hartley 2008; Moulon et al. 2013) 使用基于 $L_\infty$ 范数的拟凸优化来估计相机平移。然而,这些方法需要仔细处理异常值 (Ozyesil and Singer 2015; Wilson and Snavely 2014)。Ozyesil 和 Singer (2015) 提出了最小未平方偏差 (LUD) 公式以增强鲁棒性。Goldstein 等人 (2016) 提出通过交替方向乘子法 (ADMM) 最小化 $t_i – t_j$ 在 $v_{ij}$ 的正交补空间上的投影,采用 $L_1$ 范数。Zhuang 等人 (2018) 提出了一种基于角度的公式,采用迭代重加权最小二乘 (IRLS) 方案以减轻不同相机基线的影响。Zhu 等人 (2018) 引入了一种分布式框架,以提高大规模场景重建的系统效率。Manam 和 Govindu (2022) 提出了一种迭代平均方案,以过滤异常值并使用重新加权的特征匹配细化相对平移。虽然高效,但此类方法对异常值敏感,并在低视差场景或共线相机运动中产生不准确的结果。
隐式特征轨迹。对于隐式方法,不估计 3D 点,而是用特征射线表示。一类方法 (Jiang et al. 2013; Cui and Tan 2015; Cui et al. 2016) 利用特征点的深度一致性来计算相机基线尺度。Jiang 等人 (2013) 使用来自相机三元组共面性的约束来估计基线比率,以解决共线运动问题。Cui 和 Tan (2015) 基于卫星图估计相机基线尺度,然后通过相似性平均计算相机运动。类似地,基于特征轨迹中的相邻三角形,Cui 等人 (2016) 利用正弦定律来估计相机基线的尺度。然而,这些方法在低视差场景中高度敏感。在这些场景中,相对平移估计不准确,导致相对平移与特征射线之间的角度错误。另一方面,低视差角在估计相机三元组中的相对基线比率时会导致数值不稳定。
另一类方法 (Cui et al. 2015; Liu et al. 2019; Cai et al. 2021) 用特征轨迹表示 3D 点,并基于这些表示的 3D 点及其对应的特征射线约束相机。Cui 等人 (2015) 提出基于旋转技巧 (Jiang et al. 2013) 用相对平移和特征射线表示 3D 点。然后,为看到共同 3D 点的相机导出线性约束。然而,在低视差场景中,表示的 3D 点不稳定,且相对平移容易出错。为了增强表示的稳定性,Liu 等人 (2019) 提出用具有足够视差角的两个相机表示每个 3D 点。然后,在表示的 3D 点和特征轨迹中的其余相机之间构建线性约束。然而,(Cui et al. 2015) 和 (Liu et al. 2019) 中 3D 点的表示仍然依赖于相对平移,其误差会累积到表示的 3D 点中。为了解决这些问题,Cai 等人 (2021) 提出了一种线性全局平移 (LiGT) 约束,其中 3D 点仅由
第 5 页
结合特征射线,旨在避免排列等变公式对相对平移误差的影响。
使用显式特征轨迹。对于显式方法,相机平移和3D点是同时估计的。由于相机到相机约束和相机到点约束的数学表达式是等价的,其核心思想是使用与估计相机平移相同的目标函数来估计3D点。与低视差场景中容易出错的相对平移相比,作为从图像中直接提取的原始信息的特征射线,自然表现出更高的精度。因此,在显式方法中使用特征射线,理论上可以提供优于仅依赖相对平移的方法的性能。例如,Crandall 等人 (2012) 采用离散马尔可夫随机场公式来估计相机和3D点。Wilson 和 Snavely (2014) 提出首先通过多个一维投影消除相对平移异常值,然后将相对平移和特征轨迹整合到一个非凸目标函数中。Pan 等人 (2025) 利用来自特征轨迹的相机到点约束来构建一个基于角度的双线性目标函数,该函数可以通过随机初始化进行优化,并为束调整(Bundle Adjustment)提供良好的场景结构和相机姿态。
在鲁棒性和准确性方面,显式方法通常优于隐式方法,因为在显式方法中,每个特征轨迹的3D点是通过最小化基于角度的几何误差,利用所有特征射线进行估计和精炼的;而在隐式方法中,3D点通常仅由来自基础相机的两条特征射线线性编码。
2.3 前馈3D重建
最近的前馈方法直接从图像预测相机姿态和场景几何,无需完整的几何运动恢复结构(Structure-from-Motion, SfM)流水线,即可实现高效且鲁棒的重建。DUSt3R (Wang et al. 2024) 在公共坐标系中预测成对点图,而 MASt3R (Leroy et al. 2024) 进一步引入了密集描述子以进行准确的对应估计。VGGT (Wang et al. 2025) 联合预测相机参数、深度、点图和轨迹。$\pi^3$ (Wang et al. 2025) 采用排列等变公式以减少对图像顺序和参考视图选择的依赖。MapAnything (Keetha et al. 2026) 支持图像和几何先验的灵活组合,而 Depth Anything 3 (Lin et al. 2025) 提供了深度和多视图重建的统一框架。这些方法高效、可泛化且鲁棒,但与基于几何的 SfM 相比,它们缺乏显式的多视图几何优化,限制了重建精度和全局一致性。
3 混合显式平移平均
给定一组图像,我们首先构建视图-轨迹图(View-Track Graph),这涉及视图图构建、全局旋转平均和特征轨迹生成。为了更好地解释我们全局平移估计中使用的目标函数,我们比较了几种与相机到相机约束和相机到点约束相关的凸和非凸目标函数。接下来,我们介绍一种用于精炼相对平移的局部到全局策略。结合精炼后的相对平移和特征轨迹等混合输入,我们提出了一种用于初始化相机位置和3D点的两步方案。第一步涉及在 $L_1$ 范数下使用平移平均(Translation Averaging)和交替三角测量进行鲁棒的凸初始化,随后在 $L_2$ 范数下使用相机到相机和相机到点约束进行非双线性(Non-bilinear)基于角度的精炼(Angle-based Refinement)。最后,为了为完整的束调整(Bundle Adjustment)提供良好的起点,我们为每幅图像选择一个空间平衡的可靠特征轨迹子集,以通过基于角度的精炼和束调整来改善相机姿态,其中所选的特征轨迹确保了误差分布的平衡并提高了优化效率。我们框架的概述如图2所示。
3.1 视图-轨迹图构建
给定图像集合 $\mathcal{I} = \{I_1, \dots, I_N\}$,我们首先提取特征点(例如 SIFT (Lowe 2004)),并使用 NetVLAD (Arandjelovic et al. 2016) 方法检索每幅图像最相似的 Top-K 幅图像。接下来,我们通过执行暴力特征匹配,然后使用 RANSAC 算法通过两视图几何来识别内点特征匹配,从而评估每个潜在的图像对。
第 6 页
几何验证。当相机内参近似已知时,相对旋转是通过两视图几何从基础矩阵、本质矩阵或单应性矩阵中估计得到的。仅保留具有足够平移和视差的图像对的相对平移方向,而在平移平均之前丢弃不可靠的平移约束。
给定匹配的图像对,构建视图图 $G_c = \{V_c, E_c\}$,其中 $V_c$ 中的每个节点代表一张图像或其对应的相机,而每条边 $ij \in E_c$ 代表两个匹配图像 $i, j \in V_c$ 之间的相对位姿 $(R_{ij}, t_{ij})$ 和相应的特征匹配。全局相机位姿 $(R_i, t_i)$ 和相对相机位姿 $(R_{ij}, t_{ij})$ 满足以下方程:
$$ R_j R_i^T = R_{ij}, \quad \frac{t_i – t_j}{\|t_i – t_j\|_2} = R_j^T t_{ij} = v_{ij}. \quad (1) $$
这里 $v_{ij}$ 表示全局坐标系中的相对平移。
给定 $E_c$ 中的相对旋转,通过旋转平均方法估计全局相机旋转。目标函数通常表述如下:
$$ \{\tilde{R}_i\}_{i \in V_c} = \arg \min_{R_i, i \in V_c} \sum_{ij \in E_c} \rho(d(R_{ij}, R_j R_i^T)), \quad (2) $$
其中 $\rho(\cdot)$ 表示鲁棒估计器函数,$d(\cdot)$ 表示距离度量,如测地线距离、弦距离或四元数距离。在本文中,我们使用 Chatterjee 和 Govindu (2017) 提出的方法来估计全局相机旋转。该方法首先初始化旋转,然后利用测地线距离进行迭代加权最小二乘法(IRLS)方法精炼几个迭代。
给定估计出的全局相机旋转,我们计算全局一致的相对旋转为 $\tilde{R}_{ij} = \tilde{R}_j \tilde{R}_i^T$。如果其原始两视图相对旋转 $R_{ij}$ 与全局一致相对旋转 $\tilde{R}_{ij}$ 之间的角度差超过 $10^\circ$,则丢弃该图像对。接下来,基于过滤后的视图图中的特征对应关系,我们利用并查集算法(Moulon and Monasse 2012)构建视图-轨迹图 $G = \{V_c \cup V_p, E_c \cup E_p\}$,其中 $V_p$ 中的每个节点代表一个 3D 点,而每条边 $ik \in E_p$ 表示相机 $i \in V_c$ 观测到 3D 点 $k \in V_p$。我们将 3D 点 $k$ 和相机 $i$ 的全局位置坐标分别记为 $P_k$ 和 $t_i$,并将图像 $i$ 中观测 3D 点 $k$ 的特征点像素坐标记为 $x_{ki} = (u_{ki}, v_{ki})^T$。归一化相机坐标系中的特征点由下式给出:$X_{ki} = \pi_i^{-1}(u_{ki}, v_{ki}, 1)^T$,其中 $\pi_i$ 表示相机内参。3D 点 $k$ 和相机 $i$ 之间的关系由下式给出:
$$ \frac{P_k – t_i}{\|P_k – t_i\|_2} = \frac{X_{ki}}{\|X_{ki}\|_2} = R_i^T \hat{X}_{ki} = f_{ki}. \quad (3) $$
这里 $f_{ki}$ 表示从相机 $i$ 到 3D 点 $k$ 的归一化特征射线。相机到相机和相机到点的关系都是两个未知 3D 位置之间的有向 bearing 约束。尽管它们在几何角色和观测特性上有所不同,但它们具有相同的归一化位移形式。因此,同一类基于方向的目标函数可以应用于这两种约束。
第 7 页
为了保持每个方向观测的方向性,我们在叉积形式下施加 $\mathbf{s}_{ij}^T(\mathbf{s}_i – \mathbf{s}_j) \ge \frac{1}{\|\mathbf{s}_i – \mathbf{s}_j\|^2}$,在尺度形式下施加 $d_{ij} \ge 1$。
$$ \begin{aligned} &= \frac{\mathbf{s}_{ij} \times (\mathbf{s}_i – \mathbf{s}_j)}{\|\mathbf{s}_i – \mathbf{s}_j\|^2 \sin \theta} & \lambda_{ij} &= \frac{\mathbf{s}_{ij} \cdot (\mathbf{s}_i – \mathbf{s}_j)}{\|\mathbf{s}_i – \mathbf{s}_j\|^2 \cos \theta} \\ &= \frac{\mathbf{s}_{ij} \times (\mathbf{s}_i – \mathbf{s}_j)}{\|\mathbf{s}_i – \mathbf{s}_j\|^2 \sin \theta} & \lambda_{ij} &= 1 \end{aligned} $$
尽管 $d_{ij}$ 与位置联合优化,但通过考虑其在固定 $\mathbf{s}_i$ 和 $\mathbf{s}_j$ 下的条件最优解,可以理解其作用。具体而言,对应的一维子问题为 $\min_{d_{ij} \ge 1} \|\mathbf{s}_i – \mathbf{s}_j – d_{ij}\mathbf{s}_{ij}\|^2$。由于 $\mathbf{s}_{ij}$ 是归一化的,其解为 $d^*_{ij} = \max\left(1, \mathbf{s}_{ij}^T(\mathbf{s}_i – \mathbf{s}_j)\right)$。因此,当 $\mathbf{s}_{ij}^T(\mathbf{s}_i – \mathbf{s}_j) \ge 1$ 时,最优尺度等于估计位移在观测方向上的投影长度。这种条件解表明,$d_{ij}$ 并不编码额外的独立几何量,尽管它在联合优化中仍作为一个显式变量存在。
当观测方向存在严重误差并指向真实位移的相反半球时,无约束投影变为负值。在尺度形式中,正性约束防止辅助尺度反转观测方向,其条件最优解达到下界 $d^*_{ij} = 1$。因此,错误的观测由有限的残差表示,而不是对估计位置施加硬的方向约束。相比之下,叉积形式的不等式约束直接将位移限制在由错误观测方向定义的半空间内,这可能会使可行解产生偏差。
自 Govindu (2001) 等早期工作以来,叉积方向约束已广泛用于全局运动和平移估计。与尺度形式相比,叉积形式避免了为每个方向观测显式优化一个辅助尺度变量,并提供了更直接的不等式约束。
当观测尺度变化显著时,例如涉及不同的相机基线或特征射线深度的情况,尺度形式更难高效优化,而叉积形式通常表现出更好的收敛性和更低的计算成本,正如 Tao 等人 (2024) 所证明的那样。然而,当观测包含严重方向误差时,其不等式约束可能会引入偏差。由于此类错误的相对平移通过局部重估计和全局一致性过滤已大幅减少,我们采用叉积形式来消除平凡零尺度解,并
图 3 两种线性目标函数在不同情况下的残差:$\|\mathbf{s}_{ij} \times (\mathbf{s}_i – \mathbf{s}_j)\|^2$ 和 $\|\mathbf{s}_i – \mathbf{s}_j – \lambda_{ij}\mathbf{s}_{ij}\|^2$
(a) $\mathbf{s}_i – \mathbf{s}_j \cdot \mathbf{s}_{ij} \ge 0$ (b) $\mathbf{s}_i – \mathbf{s}_j \cdot \mathbf{s}_{ij} < 0$
3.2 目标函数的定义
对于公式 (1) 和公式 (3),在已知全局相机旋转的情况下,相机到相机以及相机到点的约束都可以用以下公式表示:
$$ \mathbf{s}_i – \mathbf{s}_j = \|\mathbf{s}_i – \mathbf{s}_j\|_2 \cdot \mathbf{s}_{ij}, \quad (4) $$
其中 $\mathbf{s}_i, \mathbf{s}_j$ 代表相机位置或 3D 点,$\mathbf{s}_{ij}$ 是从 $\mathbf{s}_j$ 到 $\mathbf{s}_i$ 的已知归一化观测向量,例如特征射线或相对平移。基于凸距离的目标函数,如 LUD (Ozyesil and Singer 2015),具有良好的收敛特性,但更强调具有大尺度的观测,例如相对平移的长基线或特征射线的大深度。相比之下,非凸基于角度的目标函数,如 1DSfM (Wilson and Snavely 2014),对异常特征匹配敏感,并且经常遭受收敛性差的问题;然而,它们平等对待所有不同尺度的观测。因此,我们使用凸目标函数初始化解,然后采用基于角度的目标函数进行精炼。下面,我们在第 3.2.1 节中比较几种基于凸距离的目标函数,并在第 3.2.2 节中比较几种非凸基于角度的目标函数。
3.2.1 基于凸距离的目标函数
我们比较两种基于凸距离的目标函数:叉积形式 $\|\mathbf{s}_{ij} \times (\mathbf{s}_i – \mathbf{s}_j)\|^2$ 和尺度形式 $\|\mathbf{s}_i – \mathbf{s}_j – d_{ij}\mathbf{s}_{ij}\|^2$,其中 $\mathbf{s}_{ij}$ 是已知的单位观测方向,而 $\mathbf{s}_i, \mathbf{s}_j$ 和辅助尺度 $d_{ij}$ 是联合估计的。辅助尺度代表与方向观测相关的未知位移幅度。
第 8 页
通过保留的相对平移来初始化相机位置。 由位置变量确定: ( I −ˆsij ˆsTij sij 2 , 0 ≤θ < π2 , O(sij, ˆsij) =3.2.2 非凸基于角度的 π 1, 2 ≤θ ≤π. 目标函数 (7) 与凸的基于距离的目标函数相比,非凸的基于角度的目标 对于 θ < π/2,公式 (7) 测量观测方向与预测方向之间的正交 函数是无偏的 (Zhuang et al. 2018) 并且 距离。对于 θ ≥π/2,残差饱和 有界 (Pan et al. 2025),使其适合 为 1,这与非负 过滤异常值并稳健地提供基于重投影的 尺度约束下的双线性公式的最优解一致。使用提出的初始化方法, 束调整的良好起点。 这种紧凑的非双线性公式提供了 我们记 ˆsij = ||si−sj||2si−sj 和 θ = 具有竞争力的结果,而无需显式优化 每个观测的尺度变量。arccos (sij · ˆsij)。开创性方法 1DSfM (Wil- son and Snavely 2014) 通过直接计算 目标函数由 之间的弦距离来制定 sij 和 ˆsij: C(sij, ˆsij) = ||sij −ˆsij||2 = 2 sin (θ/2). (5) 相对平移细化 然而,这种基于弦距离的目标函数, 与原始特征射线相比,相对平移在相机之间提供了更直接和更鲁棒的 当随机初始化时,容易因异常值而收敛 约束。这些约束可用于高效地 到局部最优解。为了解决 初始化相机位置并提高后续优化期间的收敛性。 这个问题,双线性基于角度的目标函数 经过旋转平均后,优化的全局旋转促进了对相对 (Zhuang et al. 2018; Pan et al. 2025) 通过 平移的更准确重新估计,方法是整合基于两 集成一个附加变量 λij 来制定: 视图几何的特征匹配的原始相机到点约束。然而,必须解决两个重大挑战。首先,使用共面性约束 ||sij −λij(si −sj)||2, s.t. λij ≥0. (6) 在两视图几何中估计相对平移会遭遇退化,特别是在 基线较短或纯旋转的情况下。其次,由于缺乏来自多个视图的约束, 当 θ ∈[0, π/2) 时,对于最优解,公式 (6) 等价于计算 仅使用两个视图的局部估计对错误的特征匹配高度 从 sij 到 si −sj 的正交距离。在这种情况下,λij = ||si−sj||2 敏感。 残差大小等于 sin θ。当 θ ∈[π/2, π] 时,对于最优解,λij = 0 且 为了解决这些问题,我们分两步进行。 残差大小始终等于 1,这使得 在局部相对平移重新估计期间,我们 公式 (6) 比公式 (5) 更鲁棒。虽然 更强调具有较大视差角的特征匹配,因为这些提供了更可靠的 双线性公式 (6) 中冗余的尺度变量 λij 共面性约束,如第 3.3.1 节所述。此外,特征匹配的极平面分布 提高了收敛性和鲁棒性,但为每个项优化 也会影响相对平移估计中的不确定性。因此, 附加变量既耗时又占用内存。 我们首先利用来自法向量的优化矩阵的特征值比来建模这种 为了消除辅助尺度变量 λij, 分布,如第 3.3.2 节所述。最后, 我们制定了一个类似于公式 (6) 的非双线性正交距离 我们评估每个相对平移的启发式置信度分数,并采用计算的置信 目标函数,但不显式优化尺度变量。这里,sij 是 度分数通过确保所有相对平移的全局 已知的单位观测方向,而 ˆsij = (si −sj)/ ∥si −sj∥2 是预测方向 方向一致性来过滤异常值, 如第 3.3.3 节所述。
8
第 9 页
𝒇𝒌𝒋 𝑪 从点 A 到 fki 的垂线,与其交于 𝜸 𝑩 点 B。随后,我们从点 B 向 fkj 延伸另一条 𝒇𝒌𝒊 𝜶 垂线,与其交于 𝑷𝒌 𝜽 ′ 𝑨 点 C。由于角误差 θ 沿 𝒇𝒌𝒊 法线方向,直线 AB 垂直于平面 {Pk −B −C}。因此,直线 PkC 垂直于平面 {A −B −C},这意味着 AC 与 BC 之间的角度 γ 等于法向量的角误差。根据图 4 中的几何关系,极平面法线的角度偏差 γ 满足 Fig. 4 一个示例,展示特征射线中的角误差如何影响极平面的法向量 ∥AB∥2 ∥PkB∥2 tan θ tan θ 3.3.1 局部相对平移 因此,AC 与 BC 之间的角度 γ 等于法向量的角误差。根据图 4 中的几何关系,极平面法线的角度偏差 γ 满足 重新估计 tan γ = = = . (9) ∥BC∥2 ∥PkB∥2 sin α sin α 在双视图对极几何中,共面约束定义为:Xkj · (tij × RijXki) = 0。 给定全局相机旋转,该约束重写为: 对于固定的特征射线扰动 θ,公式 (9) 表明,随着视差角 α 的增加,角度偏差 γ 减小。因此,具有较大视差角的特征匹配提供更稳定的极平面法向量,而小视差匹配对特征射线中的扰动更敏感。因此,与 Ozyesil 和 Singer (2015) 使用的归一化法向量不同, ⇔(RijXki × Xkj)T tij = 0 ⇔(RTj (RijXki × Xkj))T RTj tij = 0 我们在估计过程中为每个特征匹配保留合理的权重 ||fki × fkj||2 = sin α,以应对相机内参和全局旋转中的不准确导致的法向量估计误差。 ⇔(RTi Xki × RTj Xkj) · RTj tij = 0 (8) ⇔(fki × fkj) · vij = 0, 接下来,使用 IRLS 方案 (Holland and Welsch 1977) 估计相对平移,如下所示: 其中 vij 与公式 (1) 中定义相同。 对于公式 (8),每个相对平移可以使用极平面的法向量重新估计,这些法向量由 fki × fkj 计算得出。由于相机内参和全局旋转中的不准确,从特征射线估计的法向量不可避免地存在角误差。Ozyesil 和 Singer (2015) 提出的方法通过最小化相对平移与法向量之间角度的余弦值,使用所有归一化法向量重新估计相对平移,这等效于平均法向量中角误差的正弦值。然而,由于法向量的准确性也受视差角的影响,在估计过程中对每个法向量应用相同的权重是不合理的。 为了研究特征射线中的角误差如何影响不同视差角下的法向量,我们将这些误差分解为沿法线方向和对极平面方向的成分。由于沿对极平面方向的误差不影响法向量的方向,为简化起见,我们仅关注沿法线方向的误差。 如图 4 所示,两条特征射线 fki, fkj 三角测量出一个视差角为 α 的 3D 点 Pk。fki 中沿法线方向发生的微小角误差 θ 导致 fki 偏离到 f ki'。我们在 fki 上标记一个点 A,并从 A 向 fki 延伸一条垂线,与其交于点 B。随后,我们从点 B 向 fkj 延伸另一条垂线,与其交于点 C。由于角误差 θ 沿法线方向,直线 AB 垂直于平面 {Pk −B −C}。因此,直线 PkC 垂直于平面 {A −B −C},这意味着 AC 与 BC 之间的角度 γ 等于法向量的角误差。根据图 4 中的几何关系,极平面法线的角度偏差 γ 满足 min X ρ (|(fki × fkj) · vij|) s.t. ||vij||2 = 1. k (10) vij 鲁棒估计函数是 Cauchy 损失函数 ρ(ε) = log(β2 + ε2),权重函数为 ϕ(ε) = β2/(β2+ε2),其中 ε 表示每个观测值的残差,β 是损失宽度。在每次迭代中,归一化相对平移是对称矩阵 AT WA 的最小特征值对应的特征向量,其中矩阵 A 的每一行对应一个法向量 fki × fkj,W 是 Cauchy 损失的加权对角矩阵。此外,当由于低视差角导致法向量中的误差显著增大时,基于共面一致性估计相对平移或验证特征匹配变得无效。因此,在估计相对平移之前,我们首先过滤掉视差角低于预定义阈值 Tα 的特征匹配。局部相对平移重新估计的完整算法如算法 1 所示。
9
第 10 页
算法 1 图像对 $ij \in E_c$ 的局部重估计 要求:图像 $i$ 和 $j$ 的相机旋转 $R_i$ 和 $R_j$, 特征匹配集合 $M_{ij} = \{(X_{ki}, X_{kj}), \cdots \}$,最小视差角阈值 $T_\alpha$,最大共面性 角度残差阈值 $T_\beta$,以及最小子集特征匹配数 $N_m$。 确保:重估计的相对平移 $v_{ij}$ 和过滤后的 特征匹配 $M'_{ij}$。 1: 初始化空集用于法向量 $N_{ij} = \emptyset$ 以及空集用于子集特征匹配 $M'_{ij} = \emptyset$; 2: for $(X_{ki}, X_{kj})$ in $M_{ij}$ do 3: 利用式 (3) 估计的全局相机旋转计算特征射线 $f_{ki}, f_{kj}$; 4: $n_k \leftarrow f_{ki} \times f_{kj}$ 5: $\alpha_k \leftarrow \arccos(f_{ki} \cdot f_{kj})$; 6: if $\alpha_k > T_\alpha$ then 顶部图像对具有少量均匀分布的 7: 将 $(n_k, X_{ki}, X_{kj})$ 插入 $N_{ij}$; 特征匹配,而底部图像 8: end if 9: end for 对具有大量集中的特征 10: 利用 $N_{ij}$ 中的所有法向量通过式 (10) 估计 $\tilde{v}_{ij}$; 匹配。尽管底部图像对拥有更多内点, 11: for $(n_k, X_{ki}, X_{kj})$ in $N_{ij}$ do 但由于极平面分布较窄,其相对平移精度较低。 12: if $\frac{v_{\tilde{ij}}^T n_k}{\|n_k\|_2} < \sin(T_\beta)$ then 13: 将 $(X_{ki}, X_{kj})$ 插入 $M'_{ij}$ 14: end if 15: end for 16: 选择 $\tilde{v}_{ij}$ 的方向,并基于视差约束过滤 $M'_{ij}$ 中的异常特征匹配; 17: if $|M'_{ij}| \ge N_m$ then 18: $v_{ij} \leftarrow \tilde{v}_{ij}$; 重估计后,我们使用过滤后的特征匹配 $M'_{ij}$ 中的未归一化极平面法向量 $f_{ki} \times f_{kj}$ 构建法矩阵 $A$,并利用 $A^T A$ 的特征值评估每个相对平移的可靠性。每个法向量的大小 $\|f_{ki} \times f_{kj}\|_2 = \sin \alpha_k$ 自然地融入了相应特征匹配的视差依赖权重。我们将 $A^T A$ 的特征值按升序记为 $(e_1, e_2, 1)$,其中最大特征值归一化为 1。最小特征值 $e_1$ 衡量沿估计相对平移方向的法向量残差一致性,而 $e_2$ 反映了垂直于相对平移的平面中第二个约束方向的强度。较大的 $e_2$ 因此表明更宽且 图 5 该图展示了两个重叠图像对的示例极线。尽管相对旋转精度相似,但底部图像对由于极线分布较窄,其相对平移误差大于顶部图像对,即使其内点匹配更多。
3.3.2 相对平移置信度 在相对平移估计过程中,不仅视差角,而且图像平面中特征匹配的分布(可解释为 3D 空间中极平面的分布)也会影响精度。图 5 展示了两种经典的极平面分布类型。为方便起见,我们将 3D 空间中极平面的分布近似为图像平面中极线的分布。在过滤掉视差角低于 $T_\alpha$ 的特征匹配后,
图 6 对于 KITTI-05 视图图(Geiger et al. 2013),其包含 177k 条边,我们展示了相对平移误差相对于 $\log(R_a)$(左图),$\log(R_a)$ 的分布和四分位数(中图),以及其到置信度分数的映射(右图)。
我们将特征值比率 $R_a = e_2/e_1$ 定义为谱置信度度量。较大的 $R_a$ 表明较弱的残差一致性和较强的估计平移方向与剩余特征空间之间的分离,因此通常对应于更稳定且可识别的相对平移估计。 图 6 说明了 KITTI-05(Geiger et al. 2013)上相对平移角度误差与 $\log(R_a)$ 之间的关系,该数据集包含 177k 个图像对。较大的特征值比率通常对应于较小的角度误差,前 25% 组中的大多数相对平移满足 $\log(R_a) > \log(R_{a,0.75})$,误差低于 $5^\circ$。
第 11 页
3.3.3 基于置信度的全局过滤 初始化分为两个阶段:首先,我们仅使用相对平移量估计初始相机位姿,然后交替进行三角测量以优化三维点云和相机位姿。最后,我们采用一种非双线性基于角度的目标函数,结合相机-相机和相机-点约束,以高效地同时优化相机位姿和三维点云。
为了基于全局一致性过滤相对平移量,我们将特征值比率映射为每对图像 $ij \in E_c$ 的置信度分数 $C_{ij} \in (0, 1)$。由于特征值比率排名前 25% 的相对平移量通常表现出较低的角误差,我们将第 75 百分位数 $R_{a0.75}$ 用作参考值,并将其映射为 0.5 的置信度分数:
$$ C_{ij} = \frac{1}{1 + 10^2 (\log(R_{a0.75}) – \log(R_a))} = \frac{1}{1 + (\frac{R_a}{R_{a0.75}})^2} \quad (11) $$
公式 (11) 的映射曲线如图 6(右)所示。接下来,我们利用全局方向一致性,通过优化带有置信度分数的基于角度的目标函数,计算图像 $i \in V_c$ 的粗略相机位姿 $\tilde{t}_i$:
$$ \min_{\tilde{t}_i, i \in V_c} \sum_{ij \in E_c} C_{ij} \cdot \rho\left(O\left(v_{ij}, \frac{\tilde{t}_i – \tilde{t}_j}{\|\tilde{t}_i – \tilde{t}_j\|_2}\right)\right), \quad (12) $$
其中鲁棒估计函数 $\rho(\cdot)$ 为 Cauchy 损失函数,LM (Levenberg 1944) 求解器用作优化器。
最后,基于置信度分数和粗略相机位姿,我们在保持视图图连通性的同时移除全局不一致的相对平移量。我们首先根据每条边的置信度分数从剩余的视图图中提取最大生成树,并将所有树边保留为连通性主干。对于每条非树边 $ij \in E_c$,我们计算临时相对平移量 $\tilde{v}_{ij} = (\tilde{t}_i – \tilde{t}_j) / \|\tilde{t}_i – \tilde{t}_j\|_2$,如果 $v_{ij}$ 与 $\tilde{v}_{ij}$ 之间的角差超过 $10^\circ$,或其特征匹配的视差角中位数低于 $0.5^\circ$,则丢弃该边。虽然可能会残留少量噪声树边,但基于置信度的树构建倾向于可靠的连接。它们的影响通过鲁棒的 $L_1$ 初始化得到缓解,并在后续的非双线性基于角度的精炼过程中通过置信度加权进一步降低。
3.4 混合显式初始化 与 Pan 等人 (2025) 直接使用随机初始化的双线性基于角度的优化不同,我们首先使用凸距离型目标函数来初始化相机位姿和三维点云。为了提高效率,我们将相机位姿和三维点云的初始化解耦为两个阶段:首先,我们仅使用相对平移量估计初始相机位姿,然后交替进行三角测量以优化三维点云和相机位姿。最后,我们采用一种非双线性基于角度的目标函数,结合相机-相机和相机-点约束,以高效地同时优化相机位姿和三维点云。
3.4.1 相机位姿初始化 在优化相对平移量后,我们在 $L_1$ 范数下采用叉积形式目标函数,并使用 ADMM 优化器 (Boyd et al. 2011; Lorenz and Tran-Dinh 2019) 来鲁棒地估计初始相机位姿:
$$ \min_{t_i, i \in V_c} \sum_{ij \in E_c} \| v_{ij} \times (t_i – t_j) \|_1, \quad (13) $$
$$ \text{s.t. } \sum_{i \in V_c} t_i = 0, \quad v_{ij} \cdot (t_i – t_j) \ge 1, \quad \forall ij \in E_c, $$
其中等式约束 $\sum_{i \in V_c} t_i = 0$ 用于消除固有的位置歧义,不等式约束 $v_{ij} \cdot (t_i – t_j) \ge 1, \forall ij \in E_c$ 用于解决尺度歧义并限制每项的方向。这一仅涉及相机的阶段旨在提供非退化且方向一致的初始化,而非精确的最终解。尽管在退化运动配置下,方向相机图可能变得弱约束,但后续的交替三角测量和混合基于角度的精炼引入了来自特征轨迹的额外相机-点约束,从而显著提高了实际视图-轨迹图中初始化的鲁棒性。
3.4.2 交替三角测量 执行平移平均后,我们首先使用固定的相机位姿对三维点进行三角测量。由于相机位姿固定,不存在位置或尺度歧义。无约束的凸叉积形式目标函数表述如下:
$$ \min_{P_k, k \in V_p} \sum_{ki \in E_p} \| f_{ki} \times (P_k – t_i) \|_1. \quad (14) $$
此处使用 $L_1$ 范数以保持对特征轨迹中异常特征点的鲁棒性。
第 12 页
然而,由于相机到点的约束是无界的且高度非凸,在平移平均过程中忽略了这些约束,导致相机参数初始化对异常特征轨迹不敏感且不准确,使得相机间约束不足的相机精度较低。为了确保相机与3D点之间在后续基于角度的精炼中具有更一致拓扑结构,通过固定3D点反三角测量相机来重新估计相机位置:
$$ \min_{t_i, i \in V_c} \sum_{k_i \in E_p} ||f_{k_i} \times (P_k – t_i)||_1. \quad (15) $$
最后,使用式 (14) 中的目标函数,利用重新估计的相机位置重新三角测量3D点。由于相机位置固定,式 (14) 中不同的3D点可以独立且并行地优化。同样,由于3D点固定,式 (15) 中不同的相机可以独立更新。ADMM优化器 (Boyd et al. 2011) 用于求解这些最小绝对偏差子问题。
3.4.3 非双线性基于角度的精炼
在凸初始化之后,我们首先过滤掉对应3D点位于图像平面后的每个图像的特征点。然后利用非双线性基于角度的目标函数来精炼相机和3D点的位置。为了增强鲁棒性,除了依赖特征轨迹中的相机到点约束(如 (Liu et al. 2019; Cai et al. 2021; Pan et al. 2025) 所做的那样),我们还引入了加权置信度分数的相对平移,以直接约束相机之间的关系。令 $\hat{t}_{ij} = (t_i – t_j) / ||t_i – t_j||_2$ 和 $\hat{f}_{k_i} = (P_k – t_i) / ||P_k – t_i||_2$。基于式 (7),我们的目标函数表述为:
$$ \min_{t_i, P_k} \sum_{i \in V_c, k \in V_p} \sum_{k_i \in E_p} \rho(O(f_{k_i}, \hat{f}_{k_i})) + \sum_{ij \in E_c} C_{ij} \rho(O(v_{ij}, \hat{t}_{ij})), \quad (16) $$
其中 $\rho(\cdot)$ 是柯西损失函数,LM方法 (Levenberg 1944) 用于优化。
3.5 联合优化
给定相机姿态和3D点的初始化,我们执行联合优化以精炼相机参数和3D点。然而,基于重投影的束调整计算量大且高度非凸,使得该过程对异常特征轨迹和不准确的相机参数初始化敏感。现有方法 (Pan et al. 2025; Sweeney 2019) 首先基于角度误差过滤掉初始相机姿态下的特征点,以在束调整之前增强鲁棒性。然而,当旋转平均得到的初始相机旋转精度不足时,初始化期间固定的相机旋转会限制估计相机位置的精度,导致许多内点特征轨迹被错误过滤。因此,直接过滤特征轨迹并进行束调整容易陷入局部最优。此外,由于不同图像中的特征点数量差异显著,优化往往倾向于拥有更多特征点的图像,导致误差分布不均和局部最优。为了减少对初始相机旋转精度的依赖,并为最终束调整获得更准确的相机姿态和特征轨迹,我们首先为每个图像选择一个空间平衡的可靠特征轨迹子集,然后通过基于角度的精炼和随后的束调整来改进相机姿态。我们的联合优化由以下三个步骤组成:
a) 选择性基于角度的精炼:我们首先利用这些选定的特征轨迹构建一个基于角度的目标函数,以鲁棒地精炼相机姿态。
b) 选择性束调整:使用选定的特征轨迹,相机姿态、相机内参和3D点通过束调整进一步同时精炼。
c) 完整束调整:随着相机姿态的改进,我们重新过滤特征轨迹,并使用所有可靠的特征轨迹通过束调整精炼相机参数和3D点。
接下来,我们将详细描述每个步骤。
3.5.1 覆盖平衡的特征轨迹选择
为了在相机姿态精炼期间提高效率并平衡相机和图像平面的覆盖范围,我们选择一组可靠的特征轨迹子集。由于较长的轨迹通常提供更强的约束,
第 13 页
相机-点约束,我们首先按长度降序对所有轨迹进行排序,并迭代选择一个轨迹,如果该轨迹包含的图像其当前覆盖率低于 $S_1$。此过程持续进行,直到每张图像至少被 $S_1$ 个选定的轨迹覆盖。
由于长轨迹通常集中在高纹理区域,我们将每张图像划分为边长为 $\sqrt{\frac{H \times W}{S_2}}$ 的正方形网格,其中 $H$ 和 $W$ 分别是图像的高度和宽度,$S_2$ 是预期的网格数量。对于每个未覆盖的网格,我们选择属于最长轨迹的特征点。在本文中,我们设置 $S_1 = 100$ 和 $S_2 = 50$,并将选定的特征轨迹记为 $\{V_{sp}, E_{sp}\}$。
3.5.2 选择性基于角度的精炼
给定相机位姿和3D点的初始化,其中相机旋转是通过旋转平均获得的,通常使用一个较小的角度阈值 $T_\gamma$ 来根据观测特征射线与从相机到3D点的方向之间的角度过滤掉特征轨迹中的异常值特征点。然而,当全局相机旋转的精度不足时,直接应用小阈值来过滤特征点可能会丢弃许多内点特征点,可能导致后续的束调整收敛到错误的局部最优解。为了解决这个问题,我们首先应用一个相对较大的阈值进行特征点过滤。然后,我们使用有界的基于角度的目标函数联合精炼相机旋转、位置和3D点。与无界的重投影误差不同,角度残差具有固定的上界,因此限制了具有较大几何误差的特征点的影响,为后续的束调整提供了鲁棒的初始化。遵循1DSfM (Wilkinson and Snavely 2014) 中使用的弦角残差,目标函数表述如下:
$$ \min_{t_i, R_i, P_k} \sum_{k \in V_{sp}, i \in V_c; k_i \in E_{sp}} \rho \left( \left\| R_i^T \hat{x}_{k_i} – \frac{P_k – t_i}{\|P_k – t_i\|} \right\|^2 \right), \quad (17) $$
其中鲁棒化函数 $\rho(\cdot)$ 是 Huber 损失,进一步减少了剩余异常值特征点的影响,并使用 LM 方法 (Levenberg 1944) 进行优化。与 Pan 等人 (2025); Moulon 等人 (2017) 类似,相机旋转首先固定,然后与相机内参和3D点联合优化,以提高收敛速度。
3.5.3 选择性束调整
由于角度误差度量未考虑特征点在图像平面上的空间分布,我们采用束调整来利用选定的特征轨迹进一步精炼相机内参和位姿。目标函数表述如下:
$$ \min_{t_i, R_i, \pi_i, P_k} \sum_{k \in V_{sp}, i \in V_c; k_i \in E_{sp}} \rho \left( \| \pi_i (R_i (P_k – t_i)) – x_{k_i} \|^2 \right), \quad (18) $$
其中鲁棒估计器 $\rho(\cdot)$ 是 Huber 损失函数,并使用 LM (Levenberg 1944) 方法作为优化器。相机旋转也首先固定,然后与相机内参和3D点联合优化,以改善收敛性。
3.5.4 完整束调整
随着相机位姿的改进,我们利用基于 RANSAC 的方案 (Schönberger and Frahm 2016) 来过滤特征轨迹中的异常值特征点并三角化所有3D点。最后,通过包含所有可靠的相机-点约束的完整束调整来精炼相机参数和3D点。基于重投影的目标函数表述如下:
$$ \min_{t_i, R_i, \pi_i, P_k} \sum_{k \in V_p, i \in V_c; k_i \in E_p} \rho \left( \| \pi_i (R_i (P_k – t_i)) – x_{k_i} \|^2 \right), \quad (19) $$
其中鲁棒估计器和优化方法与公式 (18) 中使用的相同。
4 实验
实验在 Ubuntu 20.04.5 LTS 平台上进行,配备 64 GB 内存和 12代 Intel(R) Core(TM) i7-12700 CPU @ 2.10 GHz,共20个核心。为了展示我们称为 HETA++ 的流水线性能,我们进行了
13
第 14 页
表 1 1DSfM (Wilson and Snavely 2014) 数据集上的相机位姿 AUC。Nt 和 Nc 分别表示输入图像和注册图像的数量。对于全局方法,最佳结果以粗体显示,次佳结果以下划线标记。CReTA (Manam and Govindu 2022) 在场景 ROF 中失败。
| method | COLMAP | CReTA | LiGT | HETA | GLOMAP | HETA++ | | :— | :— | :— | :— | :— | :— | :— | | | AUC@ | AUC@ | AUC@ | AUC@ | AUC@ | AUC@ | | Data | Nt | Nc ↑ | Nc ↑ | Nc ↑ | Nc ↑ | Nc ↑ | | | | 3◦↑5◦ | 3◦↑5◦↑10◦ | 3◦↑5◦↑10◦ | 3◦↑5◦↑10◦ | 3◦↑5◦↑10◦ | | ALM | 577 | 44.3 58.0 73.1 | 501 39.3 52.2 66.9 | 567 21.8 32.7 48.1 | 547 39.7 52.6 67.3 | 567 39.9 52.7 67.4 | 567 39.8 52.8 67.6 | | ELS | 227 | 48.6 62.7 77.1 | 217 45.2 58.9 73.2 | 226 44.0 57.2 71.7 | 215 45.6 59.3 73.0 | 226 45.2 58.8 72.5 | 226 45.8 59.8 73.7 | | GDM | 677 | 17.7 25.7 35.2 | 590 15.5 22.9 32.2 | 673 5.0 7.2 10.8 | 645 15.8 23.4 32.9 | 671 15.6 22.9 32.3 | 673 15.9 23.5 33.0 | | MDR | 341 | 29.7 44.3 62.1 | 178 26.9 39.1 54.5 | 340 21.6 31.7 45.4 | 316 27.5 40.3 56.4 | 340 26.8 39.1 54.8 | 340 27.3 39.8 55.7 | | MND | 450 | 52.4 64.4 76.9 | 403 46.9 58.6 71.6 | 449 41.1 51.1 62.3 | 438 47.4 59.3 72.1 | 448 47.2 59.1 71.9 | 449 47.6 59.5 72.5 | | ND | 553 | 50.2 62.8 75.6 | 479 47.2 59.5 72.4 | 552 30.1 42.0 56.0 | 535 47.1 59.5 72.5 | 552 47.4 59.9 72.9 | 552 47.8 60.2 73.0 | | NYC | 332 | 48.2 60.1 73.9 | 296 39.8 52.0 66.9 | 329 0.1 0.2 1.0 | 316 43.4 54.3 67.4 | 329 43.3 54.4 67.8 | 329 43.8 55.0 68.2 | | PDP | 338 | 48.4 62.7 76.9 | 295 44.2 57.4 71.3 | 337 34.5 46.6 59.9 | 312 44.6 58.2 72.6 | 336 44.6 58.1 72.4 | 337 45.1 58.4 72.8 | | PIC | 2152 | 52.5 64.2 76.7 | 1838 44.5 56.0 69.1 | 2146 3.8 9.4 22.0 | 216 44.2 56.3 69.8 | 2145 44.2 56.2 69.6 | 2146 46.3 58.1 71.3 | | ROF | 1084 | 73.8 81.4 88.5 | 918 – – – | – 14.3 23.0 38.9 | 1043 49.5 61.8 75.5 | 1082 67.8 75.9 84.1 | 1082 68.4 76.2 84.4 | | TFG | 5058 | 44.9 57.9 72.3 | 3989 36.6 49.3 64.4 | 5050 0.8 2.8 9.4 | 4715 30.8 42.1 59.9 | 5048 38.2 50.4 65.2 | 5050 39.1 51.4 66.2 | | TOL | 472 | 56.0 68.9 81.1 | 396 46.0 58.4 71.2 | 472 0.4 1.2 4.3 | 444 45.2 57.7 71.2 | 472 45.5 57.7 70.9 | 472 47.5 60.3 73.2 | | USQ | 789 | 19.3 31.6 48.6 | 637 13.7 24.2 38.7 | 784 9.4 15.6 25.1 | 681 14.3 25.3 40.1 | 784 14.4 25.2 40.0 | 784 14.6 25.6 40.5 | | VNC | 836 | 40.7 55.7 71.4 | 713 35.3 49.5 64.6 | 834 37.7 51.5 66.6 | 754 35.4 49.7 65.1 | 834 35.1 49.9 65.9 | 834 35.4 50.3 66.5 | | YKM | 437 | 56.5 69.5 80.9 | 337 43.9 55.6 66.7 | 434 38.8 48.7 58.5 | 401 45.5 57.4 69.1 | 434 43.8 55.9 67.6 | 434 45.1 57.1 68.5 | | Average | 954.9 | 45.5 58.0 71.4 | 785.8 37.5 49.5 63.1 | 942.4 20.2 28.1 38.7 | 771.9 38.4 50.5 64.3 | 951.2 39.9 51.7 65.0 | 951.7 40.6 52.5 65.8 |
在各种顺序和无序数据集上进行了大量实验。我们还进行了消融实验,以研究我们系统中三个关键组件的性能。
基线。为了证明我们方法的优越性,我们将 HETA++ 与鲁棒的增量方法 COLMAP (Sch¨onberger and Frahm 2016) 以及几种最先进的全局方法进行了比较。这些方法包括仅相机平移平均方法 CReTA (Manam and Govindu 2022)、隐式方法 LiGT (Cai et al. 2021)、显式方法 GLOMAP (Pan et al. 2025) 以及我们之前的工作 HETA (Tao et al. 2024)。所有基于几何的方法都使用相同的视图-轨迹图作为输入。全局方法共享相同的图像匹配、相对位姿和全局旋转。图像匹配和相对位姿使用 COLMAP (Sch¨onberger and Frahm 2016) 计算,并使用 PoseLib (Larsson and contributors 2020) 进行精炼,而全局旋转使用 Chatjee 和 Govindu (2017) 的方法进行估计。由于 CReTA-BATA (Manam and Govindu 2022) 通过基于对应关系的相对平移精炼扩展了 BATA,并且通常优于 CReTA-RLUD,因此我们将其作为代表性的仅相机基线。由于 CReTA、LiGT 和 HETA 专注于平移平均,它们的 3D 点在使用束调整联合精炼相机参数和场景结构之前,使用 RANSAC 进行三角测量。为了公平起见,我们将 GLOMAP 束调整模块 (Pan et al. 2025) 应用于这三种方法,默认情况下使用三轮,随后是 Pan 等人 (2025) 的结构精炼。我们还包含了最先进的前馈方法 π3+BA (Wang et al. 2025),该方法直接在束调整之前预测相机位姿和场景几何。
数据集。对于顺序评估,我们使用 KITTI (Geiger et al. 2013)、ETH3D MVS (rig) (Sch¨ops et al. 2017) 和 LaMAR (Sarlin et al. 2022)。KITTI 由安装在行驶车辆上的两个相机捕获,相机轨迹主要近乎共线。两个相机都被使用,但在所有比较方法中均被视为独立。ETH3D MVS (rig) 包含室内和室外场景,由多相机云台捕获了大约 1,000 帧;对于任何方法,云台位姿都不是固定的。LaMAR 是一个大规模的室内-室外基准,包含由各种 AR 设备和智能手机捕获的数万个图像。
对于无序评估,我们使用 1DSfM (Wilson and Snavely 2014) 和 ETH3D MVS (DSLR) (Sch¨ops et al. 2017)。1DSfM 数据集包含由不同相机捕获的中等到大规模互联网图像集合。遵循标准协议,我们使用发布视图图的最大连通分量以及提供的 Bundler 重建作为参考,以便与之前的平移平均方法进行直接比较。ETH3D MVS (DSLR) 包含几个高分辨率图像的中小型室内和室外场景。LaMAR 的图像匹配使用其推荐的管道 (Sarlin et al. 2022) 计算,而其他数据集的图像匹配则使用
第 15 页
表 2 在 1DSfM 数据集(Wilson and Snavely 2014)上的重建运行时间(秒),不包括常见的视图-轨迹图构建阶段。最佳和次佳结果分别以粗体和下划线标出。
方法 COLMAP CReTA LiGT HETA GLOMAP HETA++
ALM 6028 1271 2400 1229 1606 953 (a) 罗马广场 (b) 皮卡迪利 ELS 566 121 113 97 184 102 GDM 4952 478 560 660 816 550 MDR 1563 252 282 309 307 189 MND 3693 356 868 417 455 299 ND 9890 1269 1174 1338 1199 894 NYC 1285 82 42 283 325 229 PDP 1353 152 148 192 256 231 PIC 25319 42868 6732 32095 28951 16020 ROF 11054 – 580 1010 3791 2990 TFG 74544 164906 51516 138640 203537 64656 TOL 3695 739 59 693 671 320 USQ 3170 865 885 669 894 466 VNC 17735 1672 1968 1992 1587 1446 YKM 3748 463 421 595 504 332
图 7 我们的 HETA++ 生成的样本结果
由 Chatterjee 和 Govindu (2017) 估计的全局相机旋转的精度相对较低。该数据集呈现出特定的挑战,包括特征轨迹中存在大量异常值特征匹配以及相机旋转精度较低。
束调整后的重建结果如表 1 所示,所有方法的相应运行时间如表 2 所示。由于所有方法都使用相同的视图轨迹图,因此相关的时间成本被排除在运行时间比较之外。
与全局方法相比,COLMAP 未能注册许多图像。因此,我们比较全局方法之间的 AUC 分数。其中,我们的方法 HETA++ 在精度方面取得了最佳性能。在注册图像数量方面,CReTA、GLOMAP 和我们的方法表现相当。随后,我们比较了这些方法的效率,我们的方法优于其他方法。LiGT 方法对特征轨迹中的异常值敏感,因为它依赖于隐式 3D 点,这导致它丢失了许多图像,从而产生相对较低的 AUC 分数。
将隐式方法 LiGT 与显式方法(如 HETA、GLOMAP 和 HETA++)进行比较表明,显式 3D 点优化提高了全局平移估计。CReTA 表现较差,因为它在平移平均后缺乏基于角度的点精炼。通过在束调整之前引入这种精炼并选择可靠的特征轨迹,HETA++ 比 HETA 和 GLOMAP 实现了更高的精度和效率。
总之,对于 1DSfM 数据集,我们的方法表现最佳,我们在图 7 中展示了两个重建结果。
4.1 无序数据上的评估
4.1.1 1DSfM 数据集
由于 1DSfM 数据集中提供的相机内参精度有限,且存在大量异常值特征匹配,估计的相对位姿存在较大误差。因此,使用 COLMAP (Schönberger and Frahm 2016) 获得的重建结果中,全局相机旋转的估计精度相对较低。该数据集呈现出特定的挑战,包括特征轨迹中存在大量异常值特征匹配以及相机旋转精度较低。
指标。对于大多数数据集,我们报告召回率曲线下的面积(AUC)分数,该分数基于所有图像对的最大相对旋转和平移误差计算,类似于 Pan 等人 (2025)、He 等人 (2024) 和 Lindenberger 等人 (2021) 使用的指标。对于 KITTI (Geiger et al. 2013) 和 LaMAR (Sarlin et al. 2022) 等大规模顺序数据集,由于大多数相机轨迹几乎共线,相对误差在捕捉尺度漂移方面无效。对于 KITTI 数据集,我们报告使用基于鲁棒 RANSAC (Chum et al. 2003) 的相似性变换 (Umeyama 1991) 将重建与真实值进行全局对齐后的中位数和平均距离误差,遵循 Zhuang 等人 (2018)、Wilson 和 Snavely (2014)、Ozyesil 和 Singer (2015) 以及 Manam 和 Govindu (2022) 的评估协议。对于 LaMAR 数据集,特征轨迹稀疏的相机往往被优化到远离场景的位置,导致许多方法出现显著的平均位置误差。因此,我们比较中位数位置误差和 AUC 分数。
4.1.2 ETH3D MVS (DSLR) 数据集
对于这个小型无序数据集,所有比较方法的成本相似;因此,我们主要关注比较它们的精度,如表 3 所示。所有全局方法的表现
第 16 页
表 3 ETH3D MVS (DSLR) (Sch¨ops et al. 2017) 数据集上的相机姿态 AUC。Nt 和 Nc 分别表示输入图像和已注册图像的数量。最佳结果以粗体显示。对于平均精度,次佳结果以下划线标示。
方法 COLMAP CReTA LiGT HETA GLOMAP HETA++ π3+BA AUC@ AUC@ AUC@ AUC@ AUC@ AUC@ AUC@ 数据 Nt 3◦↑ 5◦ 10◦ Nc ↑ 3◦↑5◦↑10◦↑ Nc ↑ 3◦↑5◦↑10◦↑ Nc ↑ 3◦↑5◦↑10◦↑ Nc ↑ 3◦↑5◦↑10◦↑ Nc ↑ 3◦↑5◦↑10◦↑ Nc ↑ 3◦↑5◦↑ Nc ↑ 植物 30 88.4 96.1 97.7 17 42.7 50.1 56.5 30 32.1 38.3 40.2 30 84.5 94.7 96.8 30 84.5 94.7 96.8 30 84.5 94.7 96.8 30 6.6 14.8 30 岩石 26 89.9 96.6 98.0 26 89.9 96.6 98.0 26 90.0 96.7 98.0 26 89.9 96.6 98.0 26 89.9 96.6 98.0 26 89.9 96.6 98.0 26 70.1 78.9 26 桥梁 110 91.5 97.2 98.3 110 91.2 96.9 98.1 110 91.7 97.2 98.3 110 91.7 97.2 98.3 110 91.7 97.2 98.3 110 91.7 97.2 98.3 110 11.3 25.4 110 庭院 38 88.3 96.1 97.7 38 87.7 95.9 97.5 38 87.1 95.7 97.4 38 87.0 95.7 97.4 38 87.0 95.7 97.4 38 87.0 95.7 97.4 38 73.6 83.7 38 送货 44 92.3 97.4 98.5 44 92.5 97.5 98.5 44 92.5 97.5 98.5 44 92.5 97.5 98.5 44 92.5 97.5 98.5 44 92.5 97.5 98.5 44 34.4 47.5 44 门 7 92.4 97.5 98.5 7 91.4 97.1 98.3 7 91.4 97.1 98.3 7 91.4 97.1 98.3 7 91.4 97.1 98.3 7 91.4 97.1 98.3 7 78.7 85.6 7 电子 45 88.5 96.0 97.5 41 80.1 86.8 88.8 45 86.9 95.0 96.9 42 83.9 92.8 95.4 45 83.1 90.9 92.6 45 83.9 92.4 95.1 45 44.2 60.3 45 展览 68 84.9 94.3 96.4 68 85.1 94.2 96.5 68 85.1 94.2 96.5 68 85.1 94.2 96.5 68 85.1 94.2 96.5 68 85.1 94.2 96.5 68 1.9 2.6 68 立面 76 90.1 96.7 98.0 76 90.4 96.8 98.1 76 66.2 70.5 71.5 76 90.4 96.8 98.1 76 90.4 96.8 98.1 76 90.4 96.8 98.1 76 53.7 67.4 76 踢球者 31 91.8 97.3 98.4 30 85.8 91.1 92.2 31 91.9 97.3 98.4 30 85.8 90.9 93.8 31 85.8 90.9 93.8 31 85.8 90.9 93.8 31 85.2 90.9 31 讲座 23 91.5 93.6 96.1 23 82.1 93.8 96.3 23 82.3 93.9 96.3 23 82.2 93.8 96.3 23 82.2 93.8 96.3 23 82.2 93.8 96.3 23 76.3 84.2 23 客厅 65 87.7 95.7 97.4 65 87.5 95.6 97.3 65 87.4 95.6 97.3 65 87.5 95.6 97.3 65 87.5 95.6 97.3 65 87.5 95.6 97.3 65 50.1 64.9 65 休息室 10 90.6 96.9 98.1 6 91.0 97.0 98.2 6 90.7 96.9 98.1 6 91.1 97.0 98.2 6 91.1 97.0 98.2 6 91.1 97.0 98.2 6 66.3 76.7 10 草地 15 59.1 83.3 89.1 14 13.7 29.7 40.8 15 11.1 16.3 17.5 13 59.3 75.8 79.9 15 66.8 87.2 92.4 15 75.0 91.5 94.9 15 74.8 84.2 15 天文台 27 63.1 86.0 91.5 27 64.0 86.5 91.8 27 64.0 86.5 91.8 27 64.0 86.5 91.8 27 64.0 86.5 91.8 27 64.0 86.5 91.8 27 64.2 76.2 27 办公室 26 59.8 81.9 88.4 26 61.2 82.7 89.0 26 59.5 81.6 88.0 26 61.3 82.7 89.0 26 61.2 82.7 89.0 26 61.3 82.7 89.0 26 41.6 51.5 26 旧电脑 54 81.6 93.6 96.2 54 49.2 56.4 57.9 54 23.1 28.1 29.3 54 49.2 56.4 57.9 54 49.2 56.4 57.9 54 49.3 56.4 57.9 54 54.8 69.2 54 管道 14 89.8 96.6 98.0 14 90.4 96.8 98.1 14 90.2 96.7 98.0 14 90.4 96.8 98.1 14 90.4 96.8 98.1 14 90.4 96.8 98.1 14 80.8 88.1 14 游乐场 38 89.4 96.4 97.8 38 79.2 92.4 95.5 38 42.7 51.1 56.1 38 90.0 96.6 98.0 38 90.0 96.5 98.0 38 89.8 96.5 97.9 38 53.0 66.9 38 浮雕 31 93.8 97.9 98.8 31 93.8 97.9 98.8 31 93.9 98.0 98.8 31 93.8 97.9 98.8 31 93.8 97.9 98.8 31 93.8 97.9 98.8 31 12.0 26.0 31 浮雕 2 31 93.7 97.9 98.7 31 93.6 97.9 98.7 31 93.6 97.9 98.7 31 93.6 97.9 98.7 31 93.6 97.9 98.7 31 93.6 97.9 98.7 31 13.6 24.3 31 雕像 11 97.2 99.1 99.4 11 97.1 99.0 99.4 11 97.1 99.0 99.4 11 97.1 99.0 99.4 11 97.2 99.1 99.4 11 97.1 99.1 99.4 11 87.0 92.2 11 露台 23 90.0 96.7 98.0 23 91.3 97.1 98.3 23 90.5 96.8 98.1 23 90.6 96.9 98.1 23 90.6 96.9 98.1 23 90.6 96.9 98.1 23 80.8 88.2 23 露台 2 13 89.5 96.5 97.9 13 89.8 96.6 98.0 13 89.8 96.6 98.0 13 89.8 96.6 98.0 13 89.8 96.6 98.0 13 89.8 96.6 98.0 13 84.1 90.4 13 地形 42 79.5 92.7 95.6 42 78.6 89.4 91.7 42 83.2 94.1 96.4 42 83.2 94.1 96.4 42 83.2 94.1 96.4 42 83.2 94.1 96.4 42 78.0 86.5 42 平均 35.9 86.2 94.8 96.8 35.0 80.0 88.5 90.9 35.8 76.6 84.3 86.2 35.5 84.2 92.7 94.7 35.8 84.5 93.1 95.1 35.8 84.8 93.3 95.3 35.8 55.1 65.1 35.9
表 4 KITTI (Geiger et al. 2013) 数据集上的相机位置精度。Nt 和 Nc 分别表示输入图像和已注册图像的数量;˜e 和 ¯e 分别表示以米为单位的相机位置误差的中位数和均值;T 表示以秒为单位的运行时间。最佳结果以粗体显示,次佳结果以下划线标示。
方法 COLMAP CReTA LiGT HETA GLOMAP HETA++ 数据 Nt ˜e ↓¯e ↓ Nc ↑ T ↓ ˜e ↓¯e ↓ Nc ↑ T ↓ ˜e ↓ ¯e ↓ Nc ↑ T ↓ ˜e ↓¯e ↓ Nc ↑ T ↓ ˜e ↓¯e ↓ Nc ↑ T ↓ ˜e ↓¯e ↓ Nc ↑ T ↓ 00 9082 0.9 3.7 9082 1.5e5 1.2 2.0 9082 2809 33.6 69.1 9082 10220 0.7 0.9 9082 3353 0.7 0.8 9082 4035 0.6 0.8 9082 2394 01 2202 1.5 3.0 2202 1.2e4 1.0 5.7 2202 1006 1.6 5e2 2202 1984 0.5 6.2 2202 1016 1.3 73.4 2202 1503 0.5 2.6 2202 763 02 9322 4.0 12.3 9322 1.8e5 5.1 9.0 9322 2978 2e2 5e2 9322 3998 4.6 8.2 9322 3419 5.4 1e3 9322 6472 2.1 2.9 9322 2666 03 1602 0.2 0.8 1602 1.8e4 0.2 0.2 1602 470 0.3 0.6 1602 818 0.2 0.2 1602 500 0.3 0.5 1602 850 0.2 0.2 1602 397 04 542 0.1 0.2 542 1526 0.1 0.2 542 77 0.1 0.2 542 149 0.1 0.2 542 98 0.1 0.2 542 178 0.1 0.2 542 75 05 5522 0.8 2.1 5522 4.9e4 0.1 2.3 5522 2456 0.4 99.2 5522 6501 0.1 0.4 5522 2548 0.1 0.4 5522 3251 0.1 0.4 5522 2269 06 2202 0.2 1.5 2202 2.1e4 0.1 0.5 2202 574 0.1 2e3 2202 1188 0.1 0.2 2202 624 0.1 0.5 2202 890 0.1 0.2 2202 508 07 2202 0.5 2.1 2202 1.7e4 0.1 0.2 2202 561 0.3 15.6 2202 1352 0.1 0.2 2202 674 0.1 0.2 2202 910 0.1 0.2 2202 522 08 8142 6.0 11.5 8142 1.0e5 3.7 8.1 8142 2531 1e2 6e2 8142 2975 2.0 3.0 8142 3759 3.0 4.4 8142 5345 2.3 2.7 8142 2102 09 3182 1.1 3.4 3182 2.0e4 0.8 1.3 3182 581 56.3 4e2 3182 1479 0.8 1.6 3182 703 0.8 1.3 3182 1284 0.5 1.1 3182 522 10 2402 2.4 4.2 2402 1.3e4 0.5 2.6 2402 660 6.8 1e2 2402 898 0.5 2.7 2402 675 0.6 2.0 2402 1124 0.5 2.6 2402 496 平均 4218.4 1.6 4.1 4218.4 5e4 1.2 2.9 4218.4 1337 36.3 3e2 4218.4 2869 0.9 2.2 4218.4 1579 1.1 98.5 4218.4 2349 0.6 1.3 4218.4 1156
与增量式 COLMAP 相比,在大多数场景中表现相当,除了“旧电脑”数据集。“旧电脑”场景包含许多对称纹理,导致视图-轨迹图中出现大量错误边。因此,全局旋转平均模块产生了不准确的相机旋转,导致所有全局方法失败。我们提出的 HETA++ 在弱纹理场景“草地”中优于其他方法,证明了我们的系统在处理特征轨迹较少的场景时的鲁棒性。尽管 π3+BA 注册了所有输入图像,但其平均精度仍明显低于基于几何的方法,表明 BA 无法完全补偿不准确的馈送前初始化。
4.2 序列数据上的评估
4.2.1 KITTI 数据集
定量重建结果如表 4 所示,其中 HETA++ 在比较的所有方法中通常实现了最高的精度和效率。图 8 显示了两个最大数据集 02 和 08 的相机轨迹计算结果。我们的结果更接近真实相机运动轨迹。
由于 KITTI 数据集中的大多数相机轨迹是共线的,纯平移平均方法 CReTA 由于仅依赖相机到相机的约束,遇到了退化情况,导致相机姿态初始化较差
第 17 页
图 8 KITTI (Geiger et al. 2013) 里程计基准中序列 02 和序列 08 上的相机运动轨迹对比。示例中的最先进 SfM 方法包括 COLMAP (Sch¨onberger et al. 2016)、CReTA (Manam and Govindu 2022)、LiGT (Cai et al. 2021)、HETA (Tao et al. 2024)、GLOMAP (Pan et al. 2025) 以及我们的方法 HETA++。
表 5 ETH3D MVS (rig) (Sch¨ops et al. 2017) 数据集上的相机位姿 AUC。$N_t$ 和 $N_c$ 分别表示输入图像和已注册图像的数量。最佳结果以粗体显示,次佳结果以下划线标示。
方法 COLMAP CReTA LiGT HETA GLOMAP HETA++ AUC@ AUC@ AUC@ AUC@ AUC@ AUC@ 数据 $N_t$ $N_c \uparrow$ $N_c \uparrow$ $N_c \uparrow$ $N_c \uparrow$ $N_c \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ $1^\circ \uparrow 3^\circ \uparrow 5^\circ \uparrow$ delivery area 948 71.3 89.2 93.3 948 76.6 91.4 94.7 948 77.2 91.6 94.8 948 77.4 91.7 94.8 948 76.6 91.4 94.7 948 76.9 91.5 94.7 948 electro 1200 36.4 64.9 74.9 1200 48.3 74.6 83.4 1200 24.5 64.4 77.1 1200 49.5 75.3 83.9 1200 48.0 74.2 83.2 1200 49.0 74.8 83.6 1200 forest 1028 0 0 0 1027 70.4 89.1 93.3 1022 56.7 69.8 74.1 999 70.2 89.0 93.3 1022 70.3 89.0 93.3 1022 70.3 89.0 93.3 1022 playground 960 0.3 6.6 12.1 954 37.4 71.0 80.9 954 11.0 23.0 32.4 953 36.9 70.5 80.6 954 38.0 71.6 81.1 954 38.7 72.2 81.5 954 terrains 660 46.3 76.7 84.7 660 47.4 77.1 84.9 660 49.2 78.1 85.6 660 48.0 77.5 85.1 660 47.5 77.2 84.9 660 48.5 77.6 85.0 660 Average 959.2 30.9 47.5 53.0 957.8 56.0 80.6 87.4 956.8 43.7 65.4 72.8 952 56.4 80.8 87.5 956.8 56.1 80.7 87.4 956.8 56.7 81.0 87.6 956.8
用于束调整。隐式全局平移估计方法 LiGT 基于矩阵分解估计相机位置,这提高了效率,但牺牲了准确性和鲁棒性。在合理的初始化下,HETA 在场景 01 和 02 中在鲁棒性方面优于 GLOMAP,这些场景的特征轨迹中存在大量异常值特征匹配。通过选择可靠特征轨迹,我们的方法提高了准确性和效率,特别是在最大的场景 02 中。
因此,这些重建结果证明了 HETA++ 在准确性和效率方面的优越性。与 GLOMAP 相比,HETA++ 提供了更合理的初始化,具有更强的鲁棒性。
4.2.2 ETH3D MVS (rig) 数据集
与 GLOMAP (Pan et al. 2025) 类似,我们比较了所有方法的 AUC 分数,并将结果展示在表 5 中。对于该数据集,所有全局方法的准确性相当,HETA++ 平均实现了最佳准确性。由于缺乏相机运动闭环,COLMAP 的表现略差于全局方法。值得注意的是,COLMAP 在所有方法中注册了最多的图像,却在场景“forest”中重建出了错误的结果。图 9 展示了由 COLMAP 和 HETA++ 生成的相应重建结果。
4.2.3 LaMAR 数据集
定量重建结果如表 6 所示。所有方法在场景
17
第 18 页
表 6 LaMAR (Sarlin et al. 2022) 数据集上的相机位姿精度。$N_t$ 和 $N_c$ 分别表示输入图像和注册图像的数量。$\tilde{e}$ 表示以米为单位的相机位置误差中位数。$T$ 表示以秒为单位的运行时间。最佳结果以粗体显示,次佳结果以下划线标示。
| method | COLMAP | | | CReTA | | | HETA | | | GLOMAP | | | HETA++ | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | AUC@ | | | AUC@ | | | AUC@ | | | AUC@ | | | AUC@ | | | | Data | $N_t$ | $\tilde{e} \downarrow$ | $N_c \uparrow$ | $T \downarrow$ | $\tilde{e} \downarrow$ | $N_c \uparrow$ | $T \downarrow$ | $\tilde{e} \downarrow$ | $N_c \uparrow$ | $T \downarrow$ | $\tilde{e} \downarrow$ | $N_c \uparrow$ | $T \downarrow$ | $\tilde{e} \downarrow$ | $N_c \uparrow$ | $T \downarrow$ | | | | | | | | | | | | | | | | $5^\circ \uparrow$ | $10^\circ \uparrow$ | | CAB | 33587 | 7.8 | 4.7 | 14.0 | 26635 | 302199 | 15.5 | 2.6 | 5.4 | 30914 | 5694 | 7.2 | 4.8 | 12.0 | 30897 | 8163 | 13.2 | 3.9 | 9.6 | 30914 | 7832 | 7.5 | 4.7 | 14.6 | 30914 | 8001 | | HGE | 25881 | 3.7 | 19.5 | 28.1 | 24254 | 331921 | 1.8 | 27.8 | 42.2 | 24770 | 8697 | 1.0 | 34.3 | 53.6 | 24765 | 9333 | 1.8 | 32.0 | 50.8 | 24770 | 8733 | 1.0 | 41.9 | 56.3 | 24770 | 7827 | | LIN | 37677 | 1.6 | 45.2 | 64.3 | 35927 | 658440 | 0.4 | 73.8 | 85.5 | 36418 | 12639 | 0.3 | 78.9 | 88.5 | 36434 | 15368 | 0.3 | 78.2 | 87.9 | 36437 | 14922 | 0.2 | 82.3 | 90.3 | 36437 | 14823 |
(a) CAB (b) HGE (c) LIN 图 10 该图展示了由 HETA++ 重建的 LaMAR 数据集 (Sarlin et al. 2022) 的定性结果
CAB 由于剧烈的光照变化和重复立面,导致视图图中出现大量异常特征匹配,且视差依赖的法线幅度进一步影响了结果。对于像 KITTI-06 这样密集连接的视图图,提出的精炼步骤消除了大多数具有较大角度误差的相对平移,使得叉积形式的更严格方向约束适用于相机位置初始化。
HGE。在场景 LIN 中,HETA++ 提供了更准确的重建,实现了最高的 AUC 分数和最低的相机位置误差中位数。GLOMAP 和 HETA++ 注册了相同数量的图像,但在效率方面,我们的方法优于 GLOMAP。我们方法产生的重建结果如图 10 所示,展示了我们的混合显式全局 SfM 系统在大尺度数据集上的可扩展性。
4.3 消融实验 4.3.1 相对平移精炼
算法 1 中的超参数设置为 $\beta = \sin(1^\circ) \sin(5^\circ)$,$T_\alpha = 0.5^\circ$,$T_\beta = 1^\circ$,且 $N_m = 20$,在所有实验中均如此。我们进行了实验以评估局部和全局精炼的影响,包括有和没有合理权重的情况。我们选择了四个数据集来展示我们相对平移精炼的有效性,包括 1DSfM (Wilson and Snavely 2014) 中的两个大规模无序图像数据集,KITTI (Geiger et al. 2013) 中的一个序列数据集,以及 LaMAR (Sarlin et al. 2022) 中的一个大规模数据集。相对平移误差的累积分布函数如图 11 所示。局部重新估计和全局一致性滤波均提高了相对平移精度,同时保留了…
4.3.2 混合显式初始化
与联合估计初始相机位置和 3D 点以及选定特征轨迹的 HETA (Tao et al. 2024) 相比,HETA++ 使用所有特征轨迹并将此步骤解耦以提高效率。它首先使用平移平均初始化相机位置,然后通过交替三角测量估计相机位置和 3D 点。这些估计值进一步通过非双线性基于角度的目标函数进行精炼。相比之下,GLOMAP (Pan et al. 2025) 直接使用随机初始化的双线性目标函数估计相机位置和 3D 点。
我们比较了来自 GLOMAP (Pan et al. 2025)、HETA (Tao et al. 2024) 和 HETA++ 的这三种初始化模块的精度和效率。来自 1DSfM (Wilson and Snavely 2014) 的四个大规模无序图像数据集和来自 KITTI (Geiger et al. 2013) 的四个大规模序列图像数据集用于证明我们方法的有效性。为了公平比较,我们使用了来自 GLOMAP (Pan et al. 2025) 的相同视图-轨迹图和束调整模块,仅更改初始化模块。
18
第 19 页
图 11 该图展示了 1DSfM-PIC、1DSfM-ROF、KITTI-06 和 LaMAR-LIN 在经过带权重或不带权重的局部和全局精炼后的相对平移角度误差的累积分布函数。
表 7 三种初始化方法与来自 GLOMAP (Pan et al. 2025) 的相同束调整 (BA) 模块的比较,前三列包括 GLOMAP (Pan et al. 2025)、HETA (Tao et al. 2024) 和 HETA++。三种精炼方案与来自 HETA++ 的相同初始化方法的比较,后三列包括 GLOMAP 中的 BA、HETA++ 中不带特征轨迹选择的联合优化 (JO) 以及带特征轨迹选择的 JO。$\tilde{e}$ 和 $\bar{e}$ 分别表示中位数和平均相机位置误差(以米为单位)。$T_1$ 是初始化的运行时间(以秒为单位),$T_2$ 是 BA 或 JO 的运行时间(以秒为单位)。
| 方法 | GLOMAPinit + BA | | | | HETAinit + BA | | | | HETA++init + BA | | | | HETA++init + JO w/o S | | | | HETA++init + JO w/ S | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | $\tilde{e} \downarrow$ | $\bar{e} \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $\tilde{e} \downarrow$ | $\bar{e} \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $\tilde{e} \downarrow$ | $\bar{e} \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $\tilde{e} \downarrow$ | $\bar{e} \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $\tilde{e} \downarrow$ | $\bar{e} \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | | KITTI | | | | | | | | | | | | | | | | | | | | | | 00 | 0.7 | 0.8 | 1586 | 1207 | 0.7 | 0.9 | 735 | 1360 | 0.7 | 0.8 | 280 | 1115 | 0.7 | 0.8 | 280 | 1284 | 0.6 | 0.8 | 280 | 901 | | 02 | 5.4 | 1e3 | 3163 | 2281 | 4.6 | 8.2 | 586 | 1898 | 3.8 | 8.1 | 417 | 1616 | 3.2 | 6.0 | 417 | 2102 | 2.1 | 2.9 | 417 | 1221 | | 05 | 0.1 | 0.4 | 1020 | 1031 | 0.1 | 0.4 | 387 | 968 | 0.1 | 0.4 | 197 | 861 | 0.1 | 0.4 | 197 | 1470 | 0.1 | 0.4 | 197 | 915 | | 08 | 3.0 | 4.4 | 2085 | 2239 | 2.0 | 3.0 | 619 | 1927 | 1.9 | 2.8 | 250 | 1513 | 2.4 | 3.3 | 250 | 1415 | 2.3 | 2.7 | 250 | 810 | | 平均 | 2.3 | 2e2 | 1963 | 1689 | 1.9 | 3.1 | 582 | 1538 | 1.6 | 3.0 | 286 | 1276 | 1.6 | 2.6 | 286 | 1735 | 1.3 | 1.7 | 286 | 962 | | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | AUC@ | | | 1DSfM | $T_1 \downarrow$ | $T_2 \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $T_1 \downarrow$ | $T_2 \downarrow$ | $3^\circ \uparrow$ | $5^\circ \uparrow$ | $3^\circ \uparrow$ | $5^\circ \uparrow$ | $3^\circ \uparrow$ | $5^\circ \uparrow$ | $3^\circ \uparrow$ | $5^\circ \uparrow$ | | PIC | 44.2 | 56.2 | 455 | 25737 | 44.2 | 56.3 | 150 | 29392 | 46.1 | 57.9 | 192 | 29897 | 46.8 | 58.6 | 192 | 18674 | 46.3 | 58.1 | 192 | 13708 | | ROF | 67.8 | 75.9 | 357 | 3791 | 49.5 | 61.8 | 99 | 336 | 67.9 | 75.9 | 54 | 3953 | 68.6 | 76.6 | 54 | 3705 | 68.4 | 76.2 | 54 | 2693 | | TFG | 38.2 | 50.4 | 1451 | 203537 | 32.8 | 44.8 | 736 | 138640 | 38.7 | 50.9 | 705 | 124088 | 39.0 | 51.3 | 705 | 74135 | 39.1 | 51.4 | 705 | 55350 | | VNC | 35.1 | 49.9 | 231 | 1587 | 35.4 | 49.7 | 39 | 1547 | 35.3 | 49.8 | 33 | 1290 | 35.7 | 50.6 | 33 | 1185 | 35.4 | 50.3 | 33 | 1064 | | 平均 | 46.3 | 58.1 | 624 | 58663 | 40.5 | 53.2 | 256 | 42479 | 47.0 | 58.6 | 246 | 39807 | 47.5 | 59.3 | 246 | 24425 | 47.3 | 59.0 | 246 | 18204 |
全局SfM系统,如表7的前三列所示。与采用随机初始化的GLOMAP (Pan et al. 2025) 相比,HETA++ 实现了更优越的鲁棒性、准确性和效率。与 HETA (Tao et al. 2024) 相比,我们的解耦方法在大多数测试案例中提高了准确性和效率,这表明我们升级方法的有效性。
总体而言,通过提供可靠的初始化,并避免对数百万个特征-射线观测的辅助尺度变量进行显式优化,所提出的解耦混合显式初始化大幅减少了优化变量数量和峰值内存消耗。它还提高了优化效率,同时产生了更准确的相机位姿。
4.3.3 联合优化
我们提出了一种联合优化框架,以逐步提高相机位姿和3D点的精度。在最终束调整(Bundle Adjustment)之前,我们首先通过基于角度的精炼(angle-based refinement)利用选定的特征轨迹(Feature Tracks)来精炼相机位姿,随后进行基于重投影误差的束调整。选择特征轨迹是为了平衡误差分布并提高效率。在相同的 HETA++ 初始化条件下,我们比较了三种精炼方案:直接束调整(BA)、无特征轨迹选择的联合优化(JO w/o Selection),以及有特征轨迹选择的联合优化(JO w/ Selection)。结果报告在表7的最后三列中。比较 “HETA++init + BA” 与 “HETA++init + JO w/o Selection” 证明了在束调整之前进行有界基于角度的精炼的好处。与 “HETA++init + JO w/ Selection” 的进一步比较表明,感知覆盖范围的轨迹选择在保持 1DSfM 上相当精度的同时,大幅提高了效率和 KITTI 精度。
19
第 20 页
(a) 旧电脑 (b) COLMAP (c) GLOMAP (d) HETA++ (e) HETA++ 结合基于相机三元组的滤波
(f) 天坛 (g) COLMAP (h) GLOMAP (i) HETA++ (j) HETA++ 结合基于相机三元组的滤波 图 12 两个结构模糊场景的重建结果:(a)–(e) 来自 ETH3D MVS (Sch¨ops et al. 2017) 的“旧电脑”场景,以及 (f)–(j) 天坛场景 (Yan et al. 2017)。(a) 和 (f) 展示了代表性的输入图像;(b) 和 (g) 展示了由 COLMAP 产生的重建结果;(c) 和 (h) 展示了由 GLOMAP 产生的结果;(d) 和 (i) 展示了由 HETA++ 产生的结果;(e) 和 (j) 展示了结合 Manam 和 Govindu (2024) 的滤波方法的 HETA++ 结果。
对于 KITTI 数据集,经过平移平均后的相机旋转在基于角度的精炼后表现出相对较高的精度。通过选择可靠的特征点,我们的方法在数据 02 上实现了更好的收敛性,并在数据 08 上提高了效率。相比之下,对于 1DSfM 数据集,由于视图图中存在大量异常相对旋转,相机旋转的精度较低。使用有界基于角度的目标函数精炼相机位姿可以提高精度,为后续的束调整提供坚实的起点,从而同时提升效率和精度。即使不进行特征轨迹选择,我们的联合优化在大多数情况下仍优于 GLOMAP (Pan et al. 2025),这凸显了基于角度的相机位姿精炼步骤的必要性。
最后,在完整的束调整之前,我们利用选定的特征轨迹对相机旋转和位置进行稳健精炼,以减少对初始相机旋转精度的依赖。该步骤包括有界基于角度的精炼,随后是基于重投影的束调整。各种现实世界的实验证明了我们的方法的效率、精度和鲁棒性。
尽管我们的方法在许多数据集上表现出鲁棒性,但它仍然难以处理包含模糊结构的场景,例如对称性和重复立面,因为异常特征匹配无法通过局部几何一致性进行过滤。如图 12 所示,GLOMAP 和 HETA++ 均未能重建 ETH3D MVS (Sch¨ops et al. 2017) 中的“旧电脑”场景以及天坛数据集 (Yan et al. 2017)。通过整合最先进的消歧模块 (Manam and Govindu 2024) 以在视图图构建阶段过滤不可靠的图像匹配,我们的方法成功重建了这些场景,如图 12e 和图 12j 所示。
对于模糊数据,增量式 SfM 系统有时能够处理它们,如表 3 中“旧电脑”数据集所示。这是因为在增量重建过程中,异常值会被反复过滤,并且在相机注册过程中应用了 RANSAC 方案。未来,我们将专注于这一消歧任务,具体解决视图-轨迹图中的错误边,这将有助于全局旋转平均和全局平移平均。
5 结论与讨论
在本文中,我们提出了一种具有混合显式全局平移平均的全局运动恢复结构方法,其中“显式”指的是对 3D 点的直接优化,“混合” signifies 使用混合输入和求解器,以及混合误差度量。其核心思想是为束调整提供一个坚实的起点,以实现稳健且精确的重建。我们首先采用一种从局部到全局的方案,基于几何一致性精炼相对平移。然后,给定混合精炼后的相对平移和特征轨迹,我们提出了一种混合显式方法,利用基于距离的方法初始化相机位置和 3D 点。
20
第 21 页
声明与声明 基于点匹配的运动估计。在:2012 第三届三维成像、 资助 建模、处理、可视化与传输 国际会议,第 81–88 页 (2012)。IEEE 本研究得到了国家自然科学基金(项目编号: Barron, J.T., Mildenhall, B., Verbin, D., Srinivasan, U23A20386, 62572470 和 62402494)的资助。 P.P., Hedman, P.: Mip-nerf 360: Unbounded anti- aliased neural radiance fields. In: IEEE/CVF 利益冲突 计算机视觉与模式认 作者声明不存在利益冲突。 知会议 (CVPR),第 5460–5469 页 (2022)。https://doi.org/10.1109/CVPR52688. 2022.00539数据可用性
本研究未生成新数据集。本研究中分析的 Boyd, S., Parkeh, N., Chu, E., Peleato, B., Eckstein, KITTI、ETH3D、LaMAR 和 1DSfM 数据集 J., et al.: Distributed optimization and statisti- 可从其官方存储库公开获取,这些存储库在 cal learning via the alternating direction method 手稿中均有引用。 of multipliers. Foundations and Trends® in 机器学习 3(1),1–122 (2011)
代码可用性 Concha, A., Burri, M., Briales, J., Forster, C., 代码将在发表后公开提供。 Oth, L.: Instant visual odometry initialization for mobile ar. IEEE Transactions on Visualiza- 作者贡献 tion and Computer Graphics 27(11), 4226–4235 Campos, C., Elvira, R., G´omez, J.J., Montiel, Peilin Tao 构思了研究,开发了方法和软件, J.M.M., Tard´os, J.D.: ORB-SLAM3: An accu- 进行了实验,分析了结果,并起草了手稿。 rate open-source library for visual, visual-inertial Hainan Cui 参与了实验设计、结果分析和 and multi-map SLAM. IEEE Transactions on 手稿修订。Mengqi Rong 参与了数据处理和 Robotics 37(6), 1874–1890 (2021) 结果分析。Shuhan Shen 监督了项目并修订 Chatterjee, A., Govindu, V.M.: Efficient and robust 了手稿。所有作者均审阅并批准了最终手稿。 large-scale rotation averaging. In: IEEE Interna- tional Conference on Computer Vision (ICCV), 参考文献 pp. 521–528 (2013) Arrigoni, F., Fusiello, A., Ricci, E., Pajdla, T.: Chatterjee, A., Govindu, V.M.: Robust relative 通过循环一致性查看图的可解性。 rotation averaging. IEEE Transactions on Pat- 在:IEEE 计算机视觉国际会议 tern Analysis and Machine Intelligence 40(4), Cui, Z., Jiang, N., Tang, C., Tan, P.: 基于特征轨迹的线性全局 958–972 (2017) 平移估计。在:英国机器视觉会议 (BMVC),卷 Arandjelovic, R., Gronat, P., Torii, A., Pajdla, abs/1503.01832,第 46–14613 页 (2015) T., Sivic, J.: NetVLAD: 用于 Chum, O., Matas, J., Kittler, J.: Locally optimized 弱监督场景识别的 CNN 架构。在:IEEE ransac. 在:模式识别:第 25 届 DAGM 计算机视觉与模式 Symposium,德国马格德堡,2003 年 9 月 Recognition (CVPR),第 5297–5307 页 (2016) 10-12 日,2003。第 25 卷论文集,第 236–243 页 (2003)。 Arie-Nachimson, M., Kovalsky, S.Z., Kemelmacher- Springer Shlizerman, I., Singer, A., Basri, R.: 全局
21
第 22 页
Crandall, D.J., Owens, A., Snavely, N., Hut- meets robotics: The kitti dataset. The Inter- tenlocher, D.P.: Sfm with MRFs: Discrete- national Journal of Robotics Research 32(11), continuous optimization for large-scale structure 1231–1237 (2013) from motion. IEEE Transactions on Pattern Analysis and Machine Intelligence 35(12), 2841– Govindu, V.M.: Combining two-view constraints 2853 (2012) for motion estimation. In: IEEE Conference on Computer Vision and Pattern Recognition Cui, H., Shen, S., Hu, Z.: Robust global trans- (CVPR), vol. 2, p. (2001) lation averaging with feature tracks. In: IEEE International Conference on Pattern Recognition Govindu, V.M.: Lie-algebraic averaging for glob- (ICPR), pp. 3727–3732 (2016) ally consistent motion estimation. In: IEEE Conference on Computer Vision and Pattern Cui, Z., Tan, P.: Global structure-from-motion Recognition (CVPR), vol. 1, p. (2004) by similarity averaging. In: IEEE International Conference on Computer Vision (ICCV), pp. Holynski, A., Geraghty, D., Frahm, J.-M., Sweeney, 864–872 (2015) C., Szeliski, R.: Reducing drift in structure from motion using extended features. In: IEEE Inter- Cai, Q., Zhang, L., Wu, Y., Yu, W., Hu, D.: national Conference on 3D Vision (3DV), pp. A pose-only solution to visual reconstruction 51–60 (2020) and navigation. IEEE Transactions on Pattern Analysis and Machine Intelligence 45(1), 73–86 He, X., Sun, J., Wang, Y., Peng, S., Huang, (2021) Q., Bao, H., Zhou, X.: Detector-free structure from motion. In: Proceedings of the IEEE/CVF Dellaert, F., Rosen, D.M., Wu, J., Mahony, R., Conference on Computer Vision and Pattern Carlone, L.: Shonan rotation averaging: Global Recognition (CVPR), pp. 21594–21603 (2024) optimality by surfing SO(p)n. In: European Conference on Computer Vision (ECCV), pp. Hartley, R., Trumpf, J., Dai, Y., Li, H.: Rotation 292–308 (2020). Springer averaging. International Journal of Computer Vision 103, 267–305 (2013) Ding, Y., Yang, J., Larsson, V., Olsson, C., ˚Astr¨om, K.: Revisiting the p3p problem. In: IEEE Holland, P.W., Welsch, R.E.: Robust regression Conference on Computer Vision and Pattern using iteratively reweighted least-squares. Com- Recognition (CVPR), pp. 4872–4880 (2023) munications in Statistics-theory and Methods 6(9), 813–827 (1977) Eriksson, A., Olsson, C., Kahl, F., Chin, T.-J.: Rotation averaging and strong duality. In: IEEE Jiang, N., Cui, Z., Tan, P.: A global linear method Conference on Computer Vision and Pattern for camera pose registration. In: IEEE Interna- Recognition (CVPR), pp. 127–135 (2018) tional Conference on Computer Vision (ICCV), pp. 481–488 (2013) Goldstein, T., Hand, P., Lee, C., Voroninski, V., Soatto, S.: Shapefit and shapekick for robust, Kahl, F., Hartley, R.: Multiple-View Geometry scalable structure from motion. In: European Under the L∞-Norm. IEEE Transactions on Pat- Conference on Computer Vision (ECCV), pp. tern Analysis and Machine Intelligence 30(9), 289–304 (2016). Springer 1603–1617 (2008)
Gao, X.-S., Hou, X.-R., Tang, J., Cheng, H.- Ke, Q., Kanade, T.: Quasiconvex optimization for F.: Complete solution classification for the robust geometric reconstruction. IEEE Transac- perspective-three-point problem. IEEE Transac- tions on Pattern Analysis and Machine Intelli- tions on Pattern Analysis and Machine Intelli- gence 29(10), 1834–1847 (2007) gence 25(8), 930–943 (2003) Kerbl, B., Kopanas, G., Leimk¨uhler, T., Drettakis, Geiger, A., Lenz, P., Stiller, C., Urtasun, R.: Vision G.: 3d gaussian splatting for real-time radiance
22
第 23 页
场渲染。ACM 图形学汇刊 42(4) (2023)
Keetha, N., Müller, N., Schönberger, J., Porzi, L., Zhang, Y., Fischer, T., Knapitsch, A., Zauss, D., Weber, E., Antunes, N., 等:Mapanything:通用前馈度量 3D 重建。在:2026 年国际 3D 视觉会议 (3DV),第 499–509 页 (2026)。IEEE
Larsson, V., 贡献者:PoseLib – 相机位姿估计的最小求解器 (2020)。https://github.com/vlarsson/PoseLib
Lee, S.H., Civera, J.:HARA:一种用于鲁棒旋转平均的层次化方法。在:IEEE 计算机视觉与模式识别会议 (CVPR),第 15777–15786 页 (2022)
Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B.:Depth anything 3:从任意视图恢复视觉空间。arXiv 预印本 arXiv:2511.10647 (2025)
Leroy, V., Cabon, Y., Revaud, J.:使用 mast3r 将图像匹配锚定到 3D。在:欧洲计算机视觉会议 (ECCV),第 71–91 页 (2024)。Springer
Levenberg, K.:求解最小二乘中某些非线性问题的方法。应用数学季刊 2(2),164–168 (1944)
Lowe, D.G.:来自尺度不变关键点的独特图像特征。国际计算机视觉杂志 60,91–110 (2004)
Lindenberger, P., Sarlin, P.-E., Larsson, V., Pollefeys, M.:具有特征度量精炼的像素级运动恢复结构。在:国际计算机视觉会议 (ICCV),第 5987–5997 页 (2021)
Lorenz, D.A., Tran-Dinh, Q.:非平稳 Douglas-Rachford 和乘子交替方向法:自适应步长和收敛性。计算优化与应用 74,67–92 (2019)
Liu, W., Wang, C., Zang, Y., Lai, S.-H., Weng D., Bian, X., Lin, X., Shen, X., Li, J.:地面相机图像与无人机 3D 模型配准以用于户外增强现实。在:IEEE 虚拟现实与三维用户界面会议 (VR),第 1050–1051 页 (2019)。https://doi.org/10.1109/VR.2019.8797821
Liu, L., Zhang, T., Leighton, B., Zhao, L., Huang S., Dissanayake, G.:具有流形上视差的全局鲁棒运动恢复结构流水线,采用束调整和初始化。IEEE 机器人与自动化快报 4(2),2164–2171 (2019)
Mur-Artal, R., Montiel, J.M.M., Tardós, J.D.:ORB-SLAM:一种通用且精确的单目 SLAM 系统。IEEE 机器人学汇刊 31(5),1147–1163 (2015) https://doi.org/10.1109/TRO.2015.2463671
Manam, L., Govindu, V.M.:对应关系重加权平移平均。在:欧洲计算机视觉会议 (ECCV),第 56–72 页 (2022)。Springer
Manam, L., Govindu, V.M.:平移平均中的敏感性。神经信息处理系统进展 36,62740–62763 (2023)
Manam, L., Govindu, V.M.:利用相机三元组进行高效且精确的运动恢复结构。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR),第 4959–4968 页 (2024)
Moulon, P., Monasse, P.:快速简便的无序特征轨迹。在:欧洲视觉媒体制作会议,第 1 页 (2012)
Moulon, P., Monasse, P., Marlet, R.:相对运动的全球融合以实现鲁棒、精确且可扩展的运动恢复结构。在:IEEE 国际计算机视觉会议 (ICCV),第 3248–3255 页 (2013)
Moulon, P., Monasse, P., Perrot, R., Marlet, R.:OpenMVG:开放多视图几何。在:模式识别中的可重复研究:第一届国际研讨会,第 60–74 页 (2017)。Springer
Olsson, C., Eriksson, A., Hartley, R.:使用对偶性去除异常值。在:IEEE 计算机学会计算机视觉与模式识别会议
23
第 24 页
Recognition (CVPR), pp. 1450–1457 (2010) Sch¨onberger, J.L., Frahm, J.-M.: Structure-from- motion revisited. In: IEEE Conference on Com- Ozyesil, O., Singer, A.: Robust camera location puter Vision and Pattern Recognition (CVPR), estimation by convex programming. In: IEEE pp. 4104–4113 (2016) Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2674–2683 (2015) Sidhartha, C., Govindu, V.M.: It is all in the weights: Robust rotation averaging revisited. In: Pan, L., Barath, D., Pollefeys, M., Sch¨onberger, IEEE International Conference on 3D Vision J.L.: Global Structure-from-Motion Revisited. (3DV), pp. 1134–1143 (2021) In: European Conference on Computer Vision (ECCV), pp. 58–77 (2025). Springer Sim, K., Hartley, R.: Recovering camera motion using L∞minimization. In: IEEE Computer Peng, Z., Hou, S., Yuan, Y.: Epar: An efficient and Society Conference on Computer Vision and Pat- privacy-aware augmented reality framework for tern Recognition (CVPR), vol. 1, pp. 1230–1237 indoor location-based services. In: IEEE/RSJ (2006) International Conference on Intelligent Robots and Systems, pp. 8948–8955 (2022) Sim, K., Hartley, R.: Removing outliers using the l∞norm. In: IEEE Computer Society Conference Peng, R., Wang, R., Wang, Z., Lai, Y., Wang, on Computer Vision and Pattern Recognition R.: Rethinking depth estimation for multi- (CVPR), vol. 1, pp. 485–494 (2006). IEEE view stereo: A unified representation. In: IEEE Conference on Computer Vision and Pattern Sch¨ops, T., Sch¨onberger, J.L., Galliani, S., Sat- Recognition (CVPR), pp. 8645–8654 (2022) tler, T., Schindler, K., Pollefeys, M., Geiger, A.: A multi-view stereo benchmark with high- Quesada, R.C., Demiris, Y.: Design and evalu- resolution images and multi-camera videos. In: ation of an augmented reality head-mounted IEEE Conference on Computer Vision and Pat- display user interface for controlling legged tern Recognition (CVPR), pp. 2538–2547 (2017). manipulators. In: IEEE International Confer- https://doi.org/10.1109/CVPR.2017.272 ence on Robotics and Automation (ICRA), pp. 11950–11956 (2023) Snavely, N., Seitz, S.M., Szeliski, R.: Photo tourism: exploring photo collections in 3d. In: ACM Rosen, D.M., Carlone, L., Bandeira, A.S., Leonard, Siggraph Papers, pp. 835–846 (2006) J.J.: Se-sync: A certifiably correct algorithm for synchronization over the special euclidean group. Sweeney, C.: Theia Multiview Geometry Library: The International Journal of Robotics Research Tutorial & Reference. http://theia-sfm.org 38(2-3), 95–125 (2019) (2019)
Ren, J., Liang, W., Yan, R., Mai, L., Liu, S., Liu, Sch¨onberger, J.L., Zheng, E., Pollefeys, M., Frahm, X.: MegBA: A gpu-based distributed library J.-M.: Pixelwise view selection for unstructured for large-scale bundle adjustment. In: European multi-view stereo. In: European Conference on Conference on Computer Vision (ECCV), pp. Computer Vision (ECCV), pp. 501–518 (2016). 715–731 (2022). Springer Springer
Sarlin, P.-E., Dusmanu, M., Sch¨onberger, J.L., Spe- Tao, P., Cui, H., Rong, M., Shen, S.: Revisiting ciale, P., Gruber, L., Larsson, V., Miksik, O., global translation estimation with feature tracks. Pollefeys, M.: LaMAR: Benchmarking Local- In: Proceedings of the IEEE/CVF Conference ization and Mapping for Augmented Reality. on Computer Vision and Pattern Recognition In: European Conference on Computer Vision (CVPR), pp. 20686–20696 (2024) (ECCV), pp. 686–704 (2022). Springer Triggs, B., McLauchlan, P.F., Hartley, R.I., Fitzgib- bon, A.W.: Bundle adjustment—a modern synthesis. In: Vision Algorithms: Theory and
24
第 25 页
实践:国际视觉研讨会(2023) 算法,第 298–372 页(2000)。Springer
Umeyama, S.: 两点模式间平移参数的最小二乘估计。IEEE 模式分析与机器智能汇刊 13(4), 376–380 (1991) https://doi.org/10.1109/34.88573
Zhu, S., Zhang, R., Zhou, L., Shen, T., Fang, T., Tan, P., Quan, L.: 通过分布式平移平均实现超大规模运动恢复结构。在:IEEE 计算机视觉与模式识别会议 (CVPR), 第 4568–4577 页 (2018)
Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: 视觉几何基础 Transformer。在:计算机视觉与模式识别会议论文集, 第 5294–5306 页 (2025)
Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r: 轻松实现几何 3D 视觉。在:IEEE/CVF 计算机视觉与模式识别会议论文集, 第 20697–20709 页 (2024)
Wilson, K., Snavely, N.: 使用 1dsfm 进行鲁棒的全局平移估计。在:欧洲计算机视觉会议, 第 61–75 页 (2014)。Springer
Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: π3: 置换等变视觉几何学习。arXiv 预印本 arXiv:2507.13347 (2025)
Yang, L., Li, H., Rahim, J.A., Cui, Z., Tan, P.: 具有多源传播的端到端旋转平均。在:IEEE 计算机视觉与模式识别会议 (CVPR), 第 11774–11783 页 (2021)
Yan, Q., Yang, L., Zhang, L., Xiao, C.: 区分不可区分者:通过测地线上下文探索结构歧义。在:IEEE 计算机视觉与模式识别会议 (CVPR), 第 3836–3844 页 (2017)
Zhuang, B., Cheong, L.-F., Lee, G.H.: 平移平均中的基线去敏化。在:IEEE 计算机视觉与模式识别会议 (CVPR), 第 4539–4547 页 (2018)
Zhang, G., Larsson, V., Barath, D.: 重新审视旋转平均:不确定性与鲁棒损失。在:IEEE 计算机视觉与模式识别会议 (CVPR), 第 17215–17224 页
25