FoundationGeo:通过空间尺度场与射线校正实现单目度量几何

三分钟导读:FoundationGeo通过两阶段框架,利用像素级尺度场和射线方向校正场,将高保真相对几何转化为一致的度量3D点云,并通过合成数据增强解决焦距分布不匹配问题。

英文题目:FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry

论文出处:arXiv 每日论文精选 · arXiv:2607.11588

原始论文:PDF / 论文页面

对应视频标题:FoundationGeo:通过空间尺度场与射线校正实现单目度量几何|推荐指数:★★★★★

这篇论文解决什么问题?

单目度量深度估计面临尺度歧义、空间尺度漂移、射线方向偏差以及训练数据中相机内参(特别是焦距)分布与测试数据不匹配导致的零样本泛化性能下降。

核心创新

  • 提出像素级尺度场,替代全局缩放以处理空间变化的尺度漂移。
  • 引入射线方向校正场,显式修正点云中的射线方向偏差,提升3D一致性。
  • 发现并解决焦距分布不匹配问题,通过Blender合成多样化焦距数据增强模型鲁棒性。
  • 设计解耦的损失函数,分别监督尺度场和射线校正场,防止几何预测与校准模块混淆。

方法概览

两阶段框架:Stage 1使用DINOv3初始化的ViT编码器训练高保真仿射不变相对几何模型;Stage 2引入像素级尺度场(Spatial Scale Field)进行空间变化的度量校准,以及射线方向校正场(Ray-Direction Correction Field)修正3D不一致性,并结合合成数据增强焦距覆盖。

逐图理解论文

问题背景:相对到度量的鸿沟

问题背景:相对到度量的鸿沟
Fig. 2: Observations on the relative to metric gap under point map supervision. (a) Scale misalignment is strongly spatially varying: as local scale alignment becomes in- creasingly patchified from coarse regions to finer patches, errors are corrected more effectively, and the global AbsRel (%) decreases monotonically toward the per pixel limit, indicating the need for pixel wise calibration rather than a single global scale. (b) Beyond scale, metric errors also contain ray direction bias: even after scale is well aligned, residual directional error leads to unavoidable 3D inconsistency in the pre- dicted point map, motivating an explicit ray direction correction field in addition to a pixel wise scale field.

如图2所示,相对几何到度量几何的转换存在显著鸿沟。尺度误差具有强烈的空间变化特性,全局缩放无法有效校正局部尺度偏差。此外,即使尺度对齐,射线方向偏差仍会导致3D点云的不一致,这要求模型同时校正尺度和方向。

方法概览:两阶段框架

方法概览:两阶段框架
Fig. 3: A ViT encoder with a lightweight up-sampling convolutional decoder first learns a high-fidelity relative geometry branch, predicting a validity mask ˆ M and an affine- invariant point map ˆP. In the second stage, we first apply a ray-direction correction field ˆ∆to ˆP to obtain a direction-refined relative point map, and then use a spatial scale field ˆS to perform spatially varying rescaling, producing a metric point map ˜P. Metric depth and surface normals are subsequently derived from ˜P.

FoundationGeo采用两阶段框架。第一阶段,使用DINOv3初始化的ViT编码器,结合轻量级上采样卷积解码器,学习高保真仿射不变相对几何,预测有效性掩码和相对点云。第二阶段,先通过射线方向校正场修正相对点云的射线方向,再通过空间尺度场进行空间变化的尺度校准,最终生成度量点云。

创新二:射线方向校正场

创新二:射线方向校正场
Fig. 6: Illustration of the proposed ray-direction correction. (a) The predicted ray direction may deviate from the target direction, producing a directional error. (b) A stable reference axis is selected to construct the first tangent direction b1. (c) The second tangent direction b2 is then obtained to form a local orthonormal basis on the tangent plane. (d) Bounded 2D offsets are applied in the tangent plane to correct the ray direction, while preserving the original range ˆd.

为修正3D点云的射线方向偏差,模型引入射线方向校正场(Ray-Direction Correction Field)。如图6所示,该场在切平面上应用有界2D偏移,校正预测射线方向,同时保持原始深度范围。这一机制显著提升了点云的3D一致性,特别是在复杂几何结构中。

创新三:焦距分布不匹配与合成数据

创新三:焦距分布不匹配与合成数据
Fig. 4: (a) Training focal distribution (top-50 frequent values) vs. benchmark perfor- mance. (b)(c) Controlled Blender fine-tuning with Single-Focal vs. Diverse-Focal for (b) our base model and (c) a pre-trained metric model.

研究发现,训练数据中的焦距分布与基准测试数据存在不匹配,导致零样本泛化性能下降。为此,作者使用Blender合成多样化焦距数据,覆盖单焦距和多焦距场景。图4显示,使用多样化焦距数据微调模型,显著提升了在基准数据集上的性能,解决了域偏移问题。

损失函数设计

损失函数设计
Table 7: Stage-II loss configuration for different supervision sources.

模型采用解耦的损失函数,分别监督尺度场和射线校正场,防止几何预测与校准模块混淆。表7展示了不同监督源下的第二阶段损失配置。通过分别优化尺度和方向,模型能够更稳定地收敛,并生成高质量的度量点云。

实验与关键结果

  • 在7个基准数据集上进行零样本度量深度估计评估。
  • 在8个基准数据集上进行相对深度估计评估。
  • 边界锐度(Boundary F1)评估。
  • 消融实验验证两阶段训练、空间场、射线校正及合成数据的有效性。
  • 平均AbsRel 14.8%,平均δ1 80.8%,平均Rank 2.32(第 11 页)
  • 相对深度平均AbsRel 4.87%,平均δ1 96.0%,平均Rank 2.56(第 11 页)
  • 边界F1在iBims-1上为15.7%,HAMMER上为5.78%,Sintel上为36.0%(第 12 页)

阅读时需要注意

  • 依赖高质量的相对几何先验,若Stage 1表现不佳可能影响Stage 2。
  • 合成数据生成需要Blender引擎,计算成本较高。
  • 射线方向校正可能受到共享骨干网络优化的干扰,导致部分数据集δ1提升不明显。
  • Metric3D V2需要GT内参,在排名中被排除。
  • 部分基线模型针对室内/室外分别训练,比较时取最佳结果。

关联工作

  • MoGe-2:主要对比基线,使用全局缩放,FoundationGeo通过空间场超越其性能。(第 2 页)
  • Depth Anything V2:相对深度估计强基线,FoundationGeo Base模型在相对深度上表现相当或更优。(第 4 页)
  • UniDepth V2:度量深度估计基线,FoundationGeo在跨域鲁棒性上优于UniDepth V2。(第 4 页)
  • DepthPro:度量深度估计基线,FoundationGeo在边界锐度和平均性能上更具竞争力。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

FoundationGeo:学习用于单目度量几何的空间逐像素场

刘慕新1,2∗,吕晓阳1∗,任天鹤1,戴鹏1, 吴晓山1,张志悦1,张家祺1,林杰宏1, 史少帅2✉,祁晓娟1✉

1 香港大学 2 滴滴出行 Voyager Research ∗共同一作 ✉通讯作者 {mxliu,shawlyu}@connect.hku.hk, shaoshuaics@gmail.com, xjqi@eee.hku.hk

度量深度 !! 性能(7个数据集的平均值) 数据驱动相机模型多样性

ZoeDepth * 49.9

DepthPro 54.4

Metric3D V2 * 73.9

UniDepthV2 75.32026 MoGe-2 76.8

FoundationGeo-ours 80.8Jul 13 室内 室外/驾驶 操作

20.6cm[cs.CV] 40.1cm

图 1:给定输入图像,我们的方法恢复场景的度量 3D 几何结构, 生成高质量的重建结果,并能很好地泛化到开放域数据。

摘要。我们提出了 FoundationGeo,这是一个两阶段框架,通过空间校准和 principled 数据设计显式地桥接相对深度和度量深度预测。第一阶段以 DINOv3 初始化, 并在精心策划的 1020 万样本多领域语料库上进行训练,辅以互补的局部-细节监督, 从而获得清晰的边界和强大的跨域泛化能力。第二阶段通过引入轻量级的 逐像素校准场来超越全局缩放,用于度量估计:一个用于空间变化度量对齐的 空间尺度场,以及一个用于缓解点图几何中方向偏差的射线方向校正场, 共同生成度量一致的 3D 点图。除了模型设计,我们还发现相机内参覆盖范围, 特别是训练数据和测试数据之间焦距分布的不匹配,是零样本度量泛化的关键瓶颈: 当测试内参落在

第 2 页

2 M. Liu 等

超出训练分布。为了解决这一问题,我们使用基于 Blender 的数据引擎, 在不同焦距下合成额外的训练数据,修复覆盖不足的焦距区域,并提高在 内参偏移下的鲁棒性。在七个基准测试上进行的广泛零样本评估表明, FoundationGeo 显著增强了跨域鲁棒性,在各种域中保持接近顶尖水平,同时 避免了其他方法中观察到的剧烈跨域性能下降。这种一致性带来了最佳的 整体性能,平均比更重的基线方法高出 5.2% 以上。项目页面: https://mx-liu6.github.io/FoundationGeo-web/

关键词:度量几何 · 基础模型 · 3D 视觉

1 引言

从单张 RGB 图像进行深度估计 [6, 29] 是计算机视觉中的一个长期存在的问题, 支撑着 3D 重建、机器人技术和 AR/VR 等多样化应用。根据输出表示形式的不同,现有 方法大致可分为相对深度估计和度量深度估计。 相对方法 [14, 38, 44, 45] 预测几何结构时存在仿射模糊性,有效地恢复出准确的局部形状和顺序,而不涉及物理尺度。相比之下,度量深度估计 [2, 3, 10, 23, 24, 39, 47] 旨在推断与真实世界单位一致的尺度感知几何结构,这对于需要测量、交互或物理推理的任务至关重要。然而,由于透视投影的模糊性、对相机内参和场景先验的依赖,从单目输入中恢复度量尺度本质上是病态的(ill-posed)。因此,相对深度模型已经实现了更高的准确性和泛化能力,而单目度量深度估计仍然远远落后。

现有的度量解决方案大致分为两类。(1)基于相机模型的方法 [3,10,23,24,47] 通过显式建模相机内参来恢复度量尺度,要么将其归一化到标准空间 [10, 47],要么预测焦距 [3]。虽然这提高了对相机的感知能力,但在内参标定不准的情况下性能可能很脆弱,并且对跨相机模型的域偏移敏感。(2)相对到度量方法 [2,39] 通过轻量级的度量校准模块重用强大的相对预测器。一个典型的例子是 MoGe-2 [39],它使用单个全局尺度将高质量的相对预测转换为度量估计,从而继承相对分支的强大先验并保留细节。这一方向具有吸引力,因为它利用了鲁棒的相对几何结构,同时比从头训练度量模型所需的度量监督少得多。

受此现状的启发,我们重新审视相对到度量的迁移,并探讨其潜力有多大以缩小剩余的差距。具体而言,我们研究三个问题。(a)相对预训练在促进度量深度方面能走多远?如果相对主干网络变得足够强大和多样化,度量校准是否成为主要的瓶颈,或者是否有其他因素限制了性能?(b)学习尺度的正确方法是什么

第 3 页

FoundationGeo 3

度量预测?MoGe-2 表明,单一的全局尺度已经能够产生较强的度量输出,但我们的观察揭示了两个根本性的局限性。 首先,图 2(a) 显示,随着尺度对齐变得越来越局部化(从粗糙的块到更精细的块),AbsRel 单调递减至逐像素极限,这表明需要空间变化的校准。其次,图 2(b) 在点图监督下暴露了一个正交的误差源:即使尺度对齐良好,射线方向偏差仍然会导致 3D 不一致。(c) 数据方面剩余的差距是什么,我们应如何有效地收集度量监督?除了模型设计,我们假设数据仍然是一个主要瓶颈;缩小差距需要对度量学习中哪些分布至关重要有更清晰的实证理解,并基于原则性地指导如何收集或合成度量监督以有效覆盖这些分布。

输入 预测的相对深度 真实深度 (GT depth) 3.0

(%) 误差 1.5 AbsRel

0.0 256 64 16 4 1 块大小 对齐的深度(每个块使用一个尺度) & 误差图 不同块大小下的误差

(a) 尺度场观察 (b) 射线方向观察

图 2: 在点图监督下关于相对到度量差距的观察。(a) 尺度失配具有强烈的空间变化性:随着局部尺度对齐从粗糙区域到更精细的块变得越来越块状化,误差得到更有效的校正,全局 AbsRel (%) 单调递减至逐像素极限,这表明需要逐像素校准而不是单一的全局尺度。 (b) 除了尺度之外,度量误差还包含射线方向偏差:即使在尺度对齐良好之后,残留的方向误差会导致预测点图中不可避免的 3D 不一致,这促使我们在逐像素尺度场之外引入显式的射线方向校正场。

基于这些发现,我们提出了 FoundationGeo,旨在通过加强相对基础模型并在基于原则的数据收集指南下重新设计度量校准,来缩小相对-度量差距。首先,我们通过 DINOv3 初始化 [32]、在精心策划的 1020 万样本多域语料库上进行大规模训练,以及具有多尺度特征融合的互补局部-细节监督,升级了相对骨干网络,从而产生了强大的细粒度保真度和鲁棒的跨域泛化能力。其次,我们通过显式的度量校准模块超越全局缩放:我们学习一个逐像素尺度场,采用改进的尺度图公式和射线方向校正分支,并结合定制的损失函数以解耦并稳定这些度量组件的学习。在此阶段,我们优化一个联合目标,该目标保留相对几何损失作为结构正则化器,同时从有限但信息丰富的度量监督中学习度量校准。第三,我们系统地分析了训练数据覆盖范围如何影响度量鲁棒性(图 4)。通过量化误差

第 4 页

4 M. Liu 等

在不同相机内参条件下,我们表明当测试内参超出训练分布时,性能会急剧下降,从而确定内参多样性是度量泛化的关键驱动因素。这促使我们利用内参线索(如焦距和位姿),通过内参条件采样作为数据设计和增强的原则性维度,明确针对覆盖不足相机区域,而非依赖无差别的数据集混合。具体而言,我们构建了一个基于 Blender 的数据引擎,以渲染具有多样化焦距设置的合成图像,修复相机覆盖范围并提高鲁棒性。 在七个数据集上的广泛零样本评估表明,FoundationGeo 显著提高了跨域鲁棒性,在不同领域中始终保持竞争力,并在域和相机模型偏移下保持稳定。这种稳定性转化为最强的整体度量深度性能。与先前方法相比,FoundationGeo 将 AbsRel 的平均结果从 15.7 提高到 14.8(5.7%),将 δ1 从 76.8 提高到 80.8(5.2%)。此外,我们的第一阶段 FoundationGeo 基础模型在相对深度精度和边界 F1 上也取得了优异性能,表明它学习到了具有细节忠实结构和清晰边界的鲁棒仿射不变几何先验,这反过来使得后续的度量校准更容易优化且更稳定。

2 相关工作

相对深度估计。相对深度估计的最新进展 [20, 36] 主要由更具表达力的架构和大规模监督驱动。DPT [27] 利用 Transformer 骨干网络更有效地捕捉全局上下文,而 Depth Anything [44] 和 Depth Anything V2 [45] 将训练扩展到数百万张多样化图像,实现了强大的零样本泛化能力。Marigold [14] 表明扩散模型包含强大的几何先验,可用于深度预测,而 Moge [38] 通过显式的几何感知约束提高了结构一致性。这些进展导致了高度准确且鲁棒的相对深度估计。

度量深度估计。度量深度估计专注于解决单目预测中固有的尺度模糊问题。Metric3D [47] 和 Metric3D v2 [10] 通过显式建模相机内参并引入几何约束来解决这一问题,从而实现更稳定和准确的绝对深度恢复。ZoeDepth [2] 通过使用共享编码器和轻量级特定领域的度量头,提供了从相对深度到度量深度的实用路径。

度量几何估计。MoGe-2 [39] 通过减轻尺度偏移模糊性并强制全局 3D 一致性来改进单图像几何估计。DepthPro [3] 利用预训练先验和由粗到细的结构,结合预测的焦距,以恢复不同场景中的细粒度结构。UniDepth [24] 和 UniDepth V2 [23] 在单一框架内统一了深度和相机参数估计,实现了无需特定数据集校准的相机无关度量重建。

第 5 页

FoundationGeo 5

Mask Head ViT Conv Mask $% Encoder Dec. Relative Depth Point Head 1 Stage-1: Upgrade Relative Base Model >> >> Point Map !" Relative%& ⊙'(Points Normal > > > Copy Weights > > > > > 291cm > > Mask Head Mask $%

ViT Conv Point Metric Depth Encoder Dec. Head Point Map !" Fields Head !∆ !" ⊙ %& ⊙'( 2 Stage-2: Joint Learning Relative Branch and Dense Spatial Field Spatial Fields &', $∆ Metric-scale Points Normal

图 3: 具有轻量级上采样卷积解码器的 ViT 编码器首先学习高保真相对几何分支,预测有效性掩码 $\hat{M}$ 和仿射不变点图 $\hat{P}$。在第二阶段,我们首先将射线方向校正场 $\hat{\Delta}$ 应用于 $\hat{P}$ 以获得方向优化的相对点图,然后使用空间尺度场 $\hat{S}$ 进行空间变化的缩放,生成度量点图 $\tilde{P}$。随后从 $\tilde{P}$ 导出度量深度和表面法线。

3 FoundationGeo

我们介绍 FoundationGeo,这是一个两阶段框架,将仿射不变几何转化为基于物理度量的 3D 理解。我们首先训练一个高保真相对基础模型,该模型预测具有强几何结构的仿射不变点图(第 3.1 节)。然后,我们使用空间校准场将此相对几何提升到度量空间:可学习的射线方向校正场 $\hat{\Delta}$ 优化相对点图射线,以产生方向校正后的仿射不变点图 $\hat{P}$,而可学习的逐像素尺度场 $\hat{S} \in \mathbb{R}^{H \times W}$ 通过 $\tilde{P} = \hat{S} \odot \hat{P}$ 执行空间变化的度量校准,从而产生度量一致的 3D 点 $\tilde{P}$(第 3.2 节)。最后,我们将相机模型不匹配诊断为零样本度量迁移的剩余瓶颈,并表明通过针对性渲染数据提高焦距覆盖率有助于减小相对于度量差距的残差(第 3.3 节)。我们方法的概述如图 3 所示。

3.1 升级相对基础模型

高质量的仿射不变相对基础模型对于可靠的度量校准至关重要。因此,我们首先训练一个全局一致且局部细节丰富的强相对基础模型。如图 3 阶段 1 所示,我们采用基于 DINOv3 初始化的 [32] ViT 编码器来提取全局、富含上下文的 token,并附加一个轻量级上采样 CNN 解码器 [38],用于对仿射不变点图 $\hat{P}$ 和可靠性掩码 $\hat{M}$ 进行密集回归。 该网络通过全局和局部监督进行优化,以捕捉大规模布局和精细结构,此阶段的损失包括 $L_{relative}$:(i) 一种全局对齐损失,在尺度-平移歧义下使 $\hat{P}$ 拟合真实点,(ii) 在逐渐更细分辨率下的多尺度局部块损失,以

第 6 页

6 M. Liu 等

保留边缘和高频细节 [38],(iii) 表面法向一致性损失,以鼓励分段平滑且保留细节的表面 [25,26],(iv) 边缘损失,仅在具有丰富细粒度细节的数据集上启用,以及 (v) 掩码损失,用于训练 ˆM 以降低不可靠区域的权重。我们进一步通过逐元素求和融合编码器多尺度特征图来利用这些特征。这种轻量级的融合使解码器能够接触到不同语义层面的互补线索,从而显著增强我们预测的相对几何中细粒度细节的保真度。 为了支持鲁棒的泛化能力,我们精心构建了一个包含 10.2M 张图像的语料库,涵盖室内、室外、驾驶、合成和真实场景领域(表 1)。我们应用针对性的数据过滤以优先选择高质量的训练数据:(i) 丢弃具有极端运动模糊或过/欠曝光的帧;(ii) 排除缺乏近-远顺序的俯视/顶视视角;(iii) 裁剪或使超出数据集特定物理范围的深度无效。总体而言,这一阶段产生了一个高保真的相对骨干网络,为后续的空间场学习设定了上限。其他实现细节请参阅补充材料。

3.2 用于度量几何的空间场

先前的相对到度量方法通常依赖于单个全局尺度因子 [39],这在空间变化的尺度漂移和射线方向偏差下会失效。因此,我们在相对骨干网络之上引入了两个轻量级的空间场:一个射线方向校正场 ˆ∆ 用于细化相对点图,以及一个逐像素尺度场 ˆS ∈RH×W 用于空间变化的度量校准。

射线方向校正。令 ˆpi ∈R3 为像素 i 处预测的仿射不变点。我们将其分解为范围项和单位射线方向,其中 ˆdi = ∥ˆpi∥2 且 ˆri = ˆpi/∥ˆpi∥2。我们的目标是校正 ˆri 同时保持 ˆdi 不变,从而使校正是尺度不变的,并且不会干扰后续的度量缩放。为此,我们构建两个正切方向 (b1,i, b2,i),它们张成与 ˆri 正交的平面(即 b1,i ⊥ˆri, b2,i ⊥ˆri,且 b1,i ⊥b2,i)。在实践中,我们通过选择一个与 ˆri 几乎不平行的参考轴来稳健地构建切线基,并通过叉积后归一化获得 b1,i, b2,i(详见补充材料)。 射线场头预测 ˆ∆i = (∆1,i, ˆ∆2,i),它在切线基上参数化有界的角扰动,其中 δ1,i = δmax tanh(∆1,i) 和 δ2,i = δmax tanh(ˆ∆2,i),δmax 是一个用于稳定训练的小边界。然后我们更新射线方向为 ˆr′i = (ˆri+δ1,ib1,i+δ2,ib2,i)/∥ˆri+δ1,ib1,i+δ2,ib2,i∥2,并通过恢复原始范围来重建方向校正后的相对点,ˆp′i = ˆdiˆr′i。

闭式度量校准。给定方向校正后的仿射不变点预测 ˆpi′ ∈R3,我们通过预测固有的缩放因子来恢复度量几何。如图 2 所示,单一的全局尺度通常会导致次优结果;相反,我们提出预测逐像素尺度,以更好地解释预测点图中的空间变化。具体而言,我们使用一个

第 7 页

FoundationGeo 7

可学习的输出模块,以共享点图分支的特征作为输入, 用于预测逐像素尺度场 $\hat{s}_i$,最终度量几何通过应用 $\tilde{\mathbf{p}}_i = \hat{\mathbf{p}}_i' \cdot \hat{s}_i$ 获得。

训练目标。为了联合优化方向精炼的点预测 $\hat{\mathbf{p}}_i'$ 和空间场预测 $\hat{s}_i, \hat{\Delta}_i$,我们使用耦合的度量 L1 损失: \begin{equation} \mathcal{L}_{\rm metric} = \sum_{i \in \mathcal{M}} \frac{1}{z_i} \left\| \tilde{\mathbf{p}}_i – \mathbf{p}_i \right\| \tag{1} \end{equation} 其中 $\tilde{\mathbf{p}}_i = \hat{\mathbf{p}}_i' \cdot \hat{s}_i$ 是预测的度量点,$\mathbf{p}_i$ 是真实 3D 点,$\mathcal{M}$ 是具有度量监督的有效像素集合,$z_i$ 是用于加权近程准确性的真实点的深度。 我们将有效像素上的归一化加权平均定义为 $\langle f_i \rangle_{\mathcal{M}} = \frac{\sum_{i \in \mathcal{M}} w_i f_i}{\sum_{i \in \mathcal{M}} w_i}$,其中 $w_i = 1/z_i$。我们通过强制预测度量射线与真实射线之间的角度一致性来监督射线校正: \begin{equation} \mathcal{L}_{\rm ray} = \left\langle \angle (\tilde{\mathbf{r}}_i, \mathbf{r}_i) \right\rangle_{\mathcal{M}, \beta_{\rm ray}} \tag{2} \end{equation} 其中 $\tilde{\mathbf{r}}_i = \tilde{\mathbf{p}}_i / \|\tilde{\mathbf{p}}_i\|_2$ 和 $\mathbf{r}_i = \mathbf{p}_i / \|\mathbf{p}_i\|_2$ 是单位射线方向,$\angle (\cdot, \cdot)$ 表示角度差,$|\cdot|_{\beta_{\rm ray}}$ 是阈值为 $\beta_{\rm ray}$ 的 Huber 惩罚。为了防止不必要的射线漂移,我们对有界校正的幅度进行正则化。 回想一下,应用的角偏移量由 $\delta_{k,i} = \delta_{\max} \tanh(\hat{\Delta}_{k,i})$ 限制。 我们对有界校正进行惩罚: \begin{equation} \mathcal{L}_{\Delta} = \left\langle \left| \tanh(\hat{\Delta}_{1,i}) \right|^q \left| \tanh(\hat{\Delta}_{2,i}) \right|^q \right\rangle_{\mathcal{M}} \tag{3} \end{equation} 其中 $\hat{\Delta}_i = (\hat{\Delta}_{1,i}, \hat{\Delta}_{2,i})$ 是预测的校正场。在所有实验中,我们设置 $q=2$,这鼓励较小的校正,除非有监督信号的支持。 虽然端到端的度量监督可以联合学习 $\hat{\mathbf{p}}_i'$ 和 $\hat{s}_i$,但这可能会纠缠它们的角色,并模糊几何预测与尺度校正之间的区别。为了为尺度场提供直接且稳定的监督信号,我们通过将真实点投影到方向精炼的仿射不变预测 $\hat{\mathbf{p}}_i'$ 上,以闭式计算目标尺度 $s_i^*$: $s_i^* = \frac{(\hat{\mathbf{p}}_i')^\top \mathbf{p}_i}{\|\hat{\mathbf{p}}_i'\|_2^2}$。 这是关于标量 $s$ 最小化 $\|\hat{\mathbf{p}}_i' \cdot s – \mathbf{p}_i\|_2^2$ 的最小二乘解。为了直接监督尺度场并将其与点图头解耦,我们定义尺度场损失为: \begin{equation} \mathcal{L}_{\rm scalefield} = \left\langle \left| \hat{s}_i – s_i^* \right|_\beta \right\rangle_{\mathcal{M}} \tag{4} \end{equation} 其中 $\langle \cdot \rangle_{\mathcal{M}}$ 表示有效像素上的归一化加权平均,$|x|_\beta$ 是阈值为 $\beta$ 的 Huber 惩罚。我们将目标尺度限制在有界的物理范围内,并在对数域中进行监督,其中 $\log s_i^* = \log \text{clamp}(s_i^*, s_{\min}, s_{\max})$。

总体而言,我们通过一个统一的目标函数优化 FoundationGeo,该目标函数结合了来自第一阶段(Stage I)的相对几何监督和来自第二阶段(Stage II)的度量校准损失:

\begin{equation} \mathcal{L}_{\rm FoundationGeo} = \mathcal{L}_{\rm relative} + \mathcal{L}_{\rm metric} + \mathcal{L}_{\rm scalefield} + \mathcal{L}_{\rm ray} + \mathcal{L}_{\Delta} \tag{5} \end{equation}

第 8 页

8 M. Liu 等

其中 $L_{\text{metric}}$ 是公式 (1) 中的耦合度量回归损失,$L_{\text{scalefield}}$、$L_{\text{ray}}$ 和 $L_{\Delta}$ 分别是公式 (4)、(2) 和 (3) 中定义的解耦空间场监督项。后三个损失项分别由 $\gamma_s$、$\gamma_r$ 和 $\gamma_{\Delta}$ 加权,以确保尺度场和射线校正场作为轻量级校准模块发挥作用,而不是冗余地吸收几何预测信息。我们在整个训练过程中保持 $L_{\text{relative}}$ 处于激活状态,以便样本仍能有助于鲁棒的表示学习和泛化。详细的加权策略和超参数设置见补充材料。

3.3 焦距覆盖分析与合成增强

尽管我们的空间场有效地将相对预测校准为度量几何(第 3.1–3.2 节),但我们仍然观察到零样本迁移中存在残余差距,这表明度量精度还受到训练数据覆盖范围和相机模型多样性的限制。因此,我们对相机内参的分布不匹配进行了诊断研究,重点关注七个评估基准中的焦距统计信息。

如图 4(a) 所示,单目度量预测本质上与焦距耦合 [10, 47]。当训练仅覆盖有限的相机模型时,网络可能会内化有偏的隐式焦距先验,导致在未见光学设备上出现系统性的过度或欠缩放。为了量化这种影响,我们分析并可视化了 1020 万张图像训练语料库中出现频率最高的前 50 个焦距值,并将它们与零样本基准中的焦距值进行比较。

\begin{center} \includegraphics[width=\textwidth]{placeholder_fig4.png} \end{center}

图 4: (a) 训练焦距分布(前 50 个高频值)与基准性能对比。(b)(c) 针对 (b) 我们的基础模型和 (c) 预训练度量模型,使用 Single-Focal(单焦距)与 Diverse-Focal(多焦距)进行的受控 Blender 微调。

有趣的是,我们观察到分布重叠与度量精度之间存在明显的相关性。焦距与我们的训练分布紧密对齐的数据集(例如 NYUv2、KITTI、iBims-1)表现出较高的精度,且尺度漂移极小;而相机不匹配的基准(例如 DDAD、ETH3D、HAMMER、DIODE)则集中在一个狭窄的焦距带(约 1000–1373)内,该区域在我们的训练数据中覆盖不足,导致性能下降。这些结果证实,剩余的性能差距主要源于分布外(out-of-distribution)的焦距,此时模型的隐式尺度先验变得不可靠。

第 9 页

FoundationGeo 9

与显式输入焦距或将其作为辅助变量进行预测 [3,23,24] 不同,我们探索了一种纯粹的数据驱动策略,通过扩展焦距覆盖范围,使模型能够直接从成对监督中学习图像-深度-相机耦合关系。具体而言,我们渲染了两个具有相同场景和相机轨迹的匹配合成数据集:Single-Focal(单焦距),使用固定焦距渲染;以及 Diverse-Focal(多焦距),使用跨越广泛范围的多焦距值渲染。在相同的训练配置下,分别微调我们的基础模型(Base Model)和预训练度量模型的结果表明,与 Single-Focal 相比,Diverse-Focal 带来了更一致且更强的跨数据集零样本性能(图 4(b,c)),这支持了焦距多样性作为提升鲁棒性的实用手段。

受此诊断性实验的启发,我们使用基于 Blender 的数据引擎,在 7 个多样化的室内和室外场景中合成了 23,700 张额外的训练图像(图 1),旨在覆盖之前未被充分涵盖的焦距区间。该数据集不仅仅是对数据量的简单扩充,而是对相机内参的一种受控干预,旨在鼓励模型在点图(pointmap)监督下更好地捕捉深度-焦距耦合关系。具体而言,我们渲染了均匀覆盖缺失区间的不同焦距,并将这些样本注入到度量训练阶段。这种有针对性的覆盖有助于缓解有偏见的隐式焦距先验,从而避免模型在未见光学设备上出现系统性的过度或欠缩放。重要的是,该效果与我们空间校准字段的作用互补:尺度和射线方向字段解决的是图像内的空间漂移和方向偏差,而针对性的焦距覆盖则通过对齐模型的隐式内参先验,提升了跨相机的泛化能力。因此,度量预测对内参变化变得不那么敏感,进一步缩小了在相机不匹配基准测试上的残差差距(详见补充材料)。

4 实验

实现细节。我们的 FoundationGeo 模型分两个阶段进行训练。在第一阶段,我们使用经过 DINOv3 [32] 预训练的改进版 ViT-Large [5] 编码器训练一个相对深度估计模型。在训练过程中,编码器和解码器的初始学习率分别设置为 $1 \times 10^{-5}$ 和 $1 \times 10^{-4}$,并且每 20K 次迭代学习率减半。在第二阶段,我们进一步微调相对深度估计模型以生成度量深度(Metric Depth)。具体而言,我们将 $\gamma_s$、$\gamma_r$ 和 $\gamma_\Delta$ 分别设置为 0.2、0.1 和 0.05;并以 $1 \times 10^{-6}$ 和 $1 \times 10^{-5}$ 的学习率微调 ViT 主干网络和解码器头。为了确保鲁棒性,两个训练阶段均采用了图像增强技术,包括颜色抖动、高斯模糊、JPEG 压缩-解压以及随机裁剪。整个模型在 32 块 NVIDIA H20 GPU 上共训练了 55K(第一阶段)+ 20K(第二阶段)次迭代。

数据集。如表 1 所示,在训练阶段,我们在 19 个数据集上训练我们的模型,总帧数达到 1020 万帧。这些训练数据集涵盖了广泛的情景,并包含异构的真实值(Ground Truth, GT)来源(例如合成渲染、激光雷达、RGB-D 传感器以及 SfM 重建)。此外,为了获得

第 10 页

10 M. Liu et al.

表 1:用于训练的数据集摘要。

名称 领域 帧数 合成 度量 名称 领域 帧数 合成 度量 Argoverse2 [42] 室外/驾驶 150万 否 ✓ MatrixCity [18] 室外/驾驶 35.4万 是 ✓ ARKitScenes [1] 室内 44.1万 否 ✓ MidAir [7] 室外/野外 42.3万 是 ✓ BlendedMVS [46] 野外 10.9万 否 ✓ MVS-Synth [11] 室外/驾驶 1.2万 是 ✓ Taskonomy [48] 室内 460万 否 ✓ Spring [21] 野外 5000 是 Waymo [33] 室外/驾驶 79万 否 ✓ Structured3D [49] 室内 7.6万 是 Voyager 室外/驾驶 22.1万 否 ✓ TartanAir [40] 野外 25.9万 是 ✓ FSD [41] 室外/野外 104万 是 UrbanSyn [8] 室外/驾驶 7000 是 ✓ Hypersim [28] 室内 6.4万 是 ✓ Dynamic-Replica [13] 室内 14.3万 是 ✓ IRS [37] 室内 9.4万 是 ✓ FoundationGeo 室内/室外 2.3万 是 ✓ KenBurns [22] 野外 7.2万 是 总计 1020万

高质量训练数据,我们按照第 3.1 节所述进行数据过滤。 在测试阶段,我们在 8 个数据集(即 NYUv2 [31]、KITTI [34]、ETH3D [30]、iBims-1 [15, 16]、Sintel [4]、DDAD [9]、 DIODE [35] 和 HAMMER [12])上评估深度估计的准确性,这些数据集未参与训练,以 展示我们方法的优越性和零样本泛化能力。

评估指标。我们测量估计深度的准确性(AbsRel 和 δ1)和质量 (边界 F1)。AbsRel 反映了尺度敏感深度误差的大小,而 δ1 通过计算相对误差阈值内的像素比例来衡量内点一致性。对于度量深度,我们报告绝对相对误差 AbsRel,即 |˜d −d|/d,以及满足 max(d/˜d, ˜d/d) < 1.25 的内点百分比 δ1。对于相对深度,我们报告仿射不变 AbsRel,即 |ˆd −d|/d,以及满足 max(d/ˆd, ˆd/d) < 1.25 的内点百分比 δ1。对于边界清晰度,我们遵循 Depth Pro [3] 报告边界 F1。

基线。除非另有说明,我们主要遵循 MoGe-2 [39] 的评估协议。1) 度量深度比较。我们评估 Depth Anything v1 [44] 和 v2 [45] 的官方度量变体。由于这些模型作为单独的室内/室外变体发布,我们在所有基准测试上运行这两种变体,并将表现更好的结果报告为基线分数。对于 Metric3D v2 [10],该模型需要真实相机内参作为输入;因此我们将其包含在参考中,但明确标注并排除在聚合排名之外。所有其他基线提供原生度量深度输出,我们直接在相应的评估协议下使用它们的预测结果。2) 相对深度比较。除了原生预测相对深度的方法外,我们还报告从度量模型导出的相对深度结果。具体而言,我们在计算相对深度分数之前,使用单个全局尺度和偏移将每种方法的预测深度与真实值对齐,以确保一致的比较。在此设置下,我们使用其官方单目变体评估 Depth Anything v3 [19]。我们还额外包括多视图方法 VGGT [36] 的单帧性能。

4.1 主要结果

我们评估了框架的零样本性能,并将其与几种最先进的方法在单目度量深度估计、仿射不变深度估计和边界清晰度方面进行比较。

第 11 页

FoundationGeo 11

表 2:度量深度和相对深度估计的定量结果。AbsRel 和 δ1 以百分比表示。最佳值以粗体高亮显示,次佳值以下划线标示。* 表示模型需要真实内参(GT intrinsic)作为输入。灰色数字表示在相应基准上训练的模型或需要真实内参,因此不参与排名。

方法 NYUv2 KITTI ETH3D iBims-1 Sintel DDAD DIODE HAMMER 平均 AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ 排名↓

度量深度估计

ZoeDepth [2] 11.0 91.9 17.0 85.4 57.1 33.7 17.4 67.2 – – 38.9 38.6 39.3 29.3 94.3 3.23 39.3 49.9 6.90

MASt3R [17] 10.8 89.7 56.7 9.84 47.2 20.1 18.7 61.5 – – 62.4 5.51 54.9 19.0 97.2 6.74 49.7 30.3 7.71

DA V1 [44] 10.5 94.9 11.6 94.5 40.2 24.0 12.9 81.8 – – 34.5 44.7 58.0 16.2 54.8 27.3 31.8 54.8 6.50

DA V2 [45] 16.4 80.9 10.6 88.6 36.1 36.3 11.1 91.7 – – 41.7 37.5 41.2 22.1 52.1 38.9 29.9 56.6 5.36

UniDepth V1 [24] 7.59 97.6 4.69 98.4 56.9 14.9 23.8 57.6 – – 13.8 85.1 17.1 71.9 38.2 46.7 23.2 67.5 3.75

UniDepth V2 [23] 10.6 92.8 8.58 95.4 20.7 69.5 9.52 93.2 – – 18.4 77.6 43.0 51.8 38.2 46.8 21.3 75.3 3.25

DepthPro [3] 10.7 91.9 23.5 38.3 38.5 32.8 15.9 81.5 – – 33.4 35.3 31.9 37.7 39.1 63.0 27.6 54.4 5.36

Metric3D V2* [10] 7.16 96.5 5.25 98.0 11.8 88.8 9.96 94.1 – – 9.21 93.7 49.1 1.98 35.7 44.3 18.3 73.9 –

MoGe-2 [39] 7.33 96.1 18.1 62.9 10.4 90.8 13.6 83.0 – – 15.8 73.0 17.5 66.4 26.9 65.6 15.7 76.8 2.82

FoundationGeo 10.2 93.0 7.86 94.9 17.8 74.0 10.4 90.0 – – 17.6 74.7 17.5 69.7 22.4 69.6 14.8 80.8 2.32

相对深度估计

ZoeDepth [2] 4.76 97.3 5.59 95.1 7.27 94.2 5.85 95.7 21.8 69.2 14.2 80.1 7.80 90.9 6.65 95.7 9.24 89.8 13.08

PPD [43] 5.16 97.0 11.5 83.0 7.98 91.1 5.34 95.9 18.8 74.4 18.8 70.3 7.68 90.5 3.77 99.2 9.88 87.7 11.66

MASt3R [17] 4.67 96.7 5.79 95.1 4.64 97.0 4.62 95.6 21.3 70.3 12.5 83.4 5.79 94.1 4.21 96.8 7.94 91.1 10.78

VGGT [36] 3.01 98.4 5.34 95.1 3.47 97.7 3.64 96.9 18.1 76.2 14.0 81.1 5.15 94.6 3.60 97.5 7.04 92.2 8.59

DA V1 [44] 3.82 98.3 5.04 96.4 6.23 95.2 4.23 97.3 20.1 71.8 11.3 86.1 6.75 92.6 5.77 97.3 7.91 91.9 10.58

DA V2 [45] 4.16 97.9 6.77 94.3 4.63 97.2 3.44 98.3 17.1 76.6 13.4 81.8 5.41 94.6 4.73 98.9 7.46 92.4 8.94

DA V3 [19] 3.39 98.4 4.80 97.1 4.37 96.9 2.96 98.6 17.4 75.8 11.4 86.7 4.85 95.5 3.30 99.4 6.56 93.6 6.50

Metric3D V2 [10] 3.94 97.6 3.50 98.4 3.24 99.0 3.28 98.3 26.6 71.7 7.15 94.8 2.75 98.7 3.02 99.0 6.69 94.7 5.86

UniDepth V1 [24] 3.40 98.6 3.55 98.7 4.92 97.5 3.76 98.2 24.9 64.1 9.46 90.8 4.90 96.2 3.55 98.9 7.31 92.9 7.19

UniDepth V2 [23] 2.96 98.6 3.85 98.1 2.95 98.5 2.64 98.4 13.3 83.2 10.5 90.9 4.05 96.5 2.48 99.6 5.34 95.5 3.50

DepthPro [3] 3.67 98.2 5.12 96.8 4.97 96.4 3.23 98.3 15.8 80.1 12.6 84.1 4.66 95.6 3.30 99.6 6.67 93.6 7.12

MoGe-1 [38] 2.92 98.6 3.94 98.0 2.69 99.2 2.74 97.9 13.0 83.2 8.40 92.1 3.16 97.5 3.00 98.3 4.98 95.6 3.91

MoGe-2 [39] 2.89 98.6 3.75 98.1 2.80 98.1 2.36 98.8 13.3 82.5 8.26 92.5 3.14 97.4 2.85 99.3 4.92 95.7 2.88

FoundationGeo-Base 2.97 98.7 3.96 98.1 2.85 99.3 2.66 98.9 12.7 83.3 7.73 92.9 3.43 97.5 2.65 99.2 4.87 96.0 2.56

度量深度估计的定量结果:表 2 显示,尽管最佳方法因数据集而异,但 FoundationGeo 整体最为均衡,实现了最低的平均 AbsRel 和最高的平均 δ1,因此在七个基准测试中获得了最佳平均排名(2.32)。关键结论在于其对域和相机模型偏移的鲁棒性:某些方法在狭窄的范围内表现出色,但在特定域上性能急剧下降。例如,UniDepth 在 ETH3D 上几乎失败(56.9 AbsRel,14.9 δ1),而 MoGe-2 在 KITTI 上大幅下降(18.1 AbsRel,62.9 δ1),相比之下,FoundationGeo 在室内/驾驶场景以及具有挑战性的数据集上均保持 consistently competitive(持续具有竞争力)。我们将这种稳定性归因于我们的数据和训练设计:具有更广泛相机模型覆盖范围的更强相对深度估计骨干网络,结合空间校准场以确保准确性。值得注意的是,FoundationGeo 在 HAMMER(22.4 AbsRel,69.6 δ1)上取得了最佳性能,这是一个具有复杂场景构成的以物体为中心的基准测试。

相对深度估计的定量结果。虽然我们的重点是度量尺度几何,但我们还评估了仿射不变深度,以评估微调在改善无尺度预测方面的有效性。表 2 显示,我们的 FoundationGeo-Base 在八个基准测试中实现了最佳的整体相对性能,具有最低的平均 AbsRel、最高的平均 δ1 和最佳平均排名。除了平均值之外,跨域基准测试上的提升最为明显:我们的基础模型在 ETH3D(2.85 AbsRel,99.3 δ1)、iBims-1(2.66,98.9)和 Sintel(12.7,83.3)上领先,并且在驾驶尺度的 DDAD(7.73,92.9)上也表现强劲,表明具有更可迁移的仿射不变几何

第 12 页

12 M. Liu et al.

表 3:使用 F1 分数(↑,百分比)评估边界锐度。

| 方法 | 参数量 | iBims-1 | HAMMER | Sintel | 平均排名 ↓ | | :— | :— | :— | :— | :— | :— | | ZoeDepth [2] | 345M | 2.47 | 0.17 | 2.30 | 9.00 | | DA V1 [44] | 335M | 3.68 | 0.76 | 5.64 | 8.00 | | DA V2 [45] | 335M | 13.9 | 4.74 | 32.5 | 4.33 | | Metric3D V2 [10] | 412M | 7.36 | 1.40 | 25.3 | 7.00 | | MASt3R [17] | ~700M | 1.24 | 0.05 | 1.72 | 10.67 | | UniDepth V1 [24] | 347M | 2.35 | 0.06 | 0.73 | 10.33 | | UniDepth V2 [23] | 354M | 11.2 | 4.40 | 39.7 | 4.33 | | Depth Pro [3] | 504M | 14.3 | 5.36 | 41.6 | 2.00 | | MoGe [38] | 314M | 11.4 | 3.89 | 26.3 | 5.67 | | Ours-3600tokens | 313M | 15.2 | 4.93 | 33.4 | 3.00 | | Ours-6000tokens | 313M | 15.7 | 5.78 | 36.0 | 1.67 |

先验。我们将此归因于我们升级的训练方案:DINOv3 初始化、大规模多域训练、详细的损失函数设计以及多尺度特征融合,这些改进提高了细粒度细节的保真度并减少了特定领域的失效模式,为后续的度量校准提供了更坚实的基础。

边界锐度的定量测量。我们在 Sintel [4]、iBims-1 [15, 16] 和 HAMMER [12] 上使用边界 F1 [3] 评估边界锐度。如表 3 所示,我们的基础模型在使用 3.6k 令牌输入时,其表现已与 Depth Pro 相当;将令牌预算增加到 6k 持续提高了边界 F1 分数,尽管 Depth Pro 在更高的原生分辨率(1536×1536)下运行,但我们的方法在比较的方法中实现了最佳的整体锐度。重要的是,与我们遵循的 MoGe 风格基线相比,我们的基础模型产生了明显更锐利的边界,我们将此归因于我们相对分支的升级,包括多尺度特征融合和细节感知边缘监督,这些增强了高频几何保真度。

定性比较。我们将方法与领先的方法进行比较,包括 MoGe-2 [39]、UniDepthV2 [23] 和 DepthPro [3]。图 5 显示,FoundationGeo 在户外驾驶和室内场景中均产生了准确且几何一致的度量结果,涵盖了从米到厘米的深度量级。这种定性稳定性支持了我们的空间场设计和针对性的焦距增强能够在域和深度尺度偏移下实现可靠的度量迁移。

RGB 输入 真实值 我们的方法 MoGe-2 UniDepthV2 DepthPro

5.83m 5.96m 5.11m 4.92m 5.46m

89.3cm 87.9cm 91.6cm 94.2cm 87.1cm

图 5:户外驾驶和室内场景上的定性度量点图结果,深度量级从米到厘米。我们的模型在保持细粒度几何结构和锐利细节的同时,提供了一致的度量精度。

第 13 页

FoundationGeo 13

表 4:组件消融实验,在 7 个数据集上平均,使用 ViT-L 编码器 和 5% 的分层训练子集。 表 5:全数据消融实验,在 7 个数据集上平均, FGD 表示我们渲染的 FoundationGeo 数据集。

Average 消融变体 Average DDAD DIODE 消融变体 AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ AbsRel↓ δ1↑ 从头训练 15.2 78.2 – – – – 单阶段直接预测 22.4 57.7 两阶段训练( ours) 14.8 80.8 – – – – 两阶段直接预测 19.6 65.9 MoGe-2 15.7 76.8 15.8 73.0 17.5 66.4 两阶段 + 全局尺度 20.1 66.8 MoGe-2 + FGD 15.1 79.0 15.8 73.8 16.2 72.1 两阶段 + 空间场 19.3 68.0 无 FGD 15.0 79.5 20.0 69.6 20.5 55.2 + 固定焦距 FGD 15.3 78.9 19.2 71.7 18.5 63.9 两阶段 + 空间场 + 场损失 18.8 69.7 + FGD( ours) 14.8 80.8 17.6 74.7 17.5 69.7

表 6:度量深度和射线方向估计的逐数据集消融结果。 对于每个数据集,我们报告 δ1 ↑、MaeDeg↓ 和 Pct3◦↑。MaeDeg 衡量预测射线与真实射线之间的平均 角度误差(以度为单位),Pct3◦ 表示射线方向误差在 3◦ 以内的像素百分比。δ1 和 Pct3◦ 以百分比形式报告。

NYUv2 DIODE DDAD HAMMER 平均 消融变体 δ1 ↑MaeDeg↓Pct3◦↑δ1 ↑MaeDeg↓Pct3◦↑δ1 ↑MaeDeg↓Pct3◦↑δ1 ↑MaeDeg↓Pct3◦↑δ1 ↑MaeDeg↓Pct3◦↑

无射线方向校正 92.7 1.715 86.8 52.6 4.232 32.8 72.8 2.799 61.1 72.9 2.810 61.3 72.8 2.889 60.5 ours 93.0 1.484 90.2 69.7 2.658 64.0 74.7 2.769 61.5 69.6 2.510 68.2 76.8 2.355 71.0

4.2 消融实验

我们进行消融实验以验证我们的关键设计选择和训练策略, 包括两阶段训练的必要性、用于度量校准的空间场、 特定于场的监督、焦距多样的渲染数据以及射线方向校正的影响。对于表 4 中的受控组件研究,所有变体 均使用 ViT-Large 编码器和相同的训练数据集的 ~5% 分层子集。单阶段基线直接优化度量几何结构 40K 次迭代,而两阶段变体首先训练相对基础模型 20K 次迭代,然后优化度量校准另外 20K 次迭代。 所有受控实验均使用 8× NVIDIA H20 GPU 进行。 我们进一步在表 5 的全数据设置中评估,通过比较从头训练与我们两阶段策略、将我们渲染的数据迁移到 MoGe- 2 [39],以及解耦固定焦距和多样焦距渲染数据的影响。 最后,我们通过逐数据集实验(表 6)隔离射线方向校正的效果。总体而言,结果表明两阶段训练始终 优于直接单阶段优化,空间场比全局尺度提供更有效的校准,特定于场的损失进一步稳定了度量 学习,多样焦距渲染数据提高了在相机内参变化下的鲁棒性,射线方向校正始终提高了角度精度,同时 也产生了更好的平均度量深度性能。

空间场的有效性(表 4,第 2 行与第 4 行):从相同的两阶段直接预测基线开始,引入空间场将平均 AbsRel 从 19.6 提高到 19.3,δ1 从 65.9 提高到 68.0。这表明 直接使用度量监督微调点图头仍然

第 14 页

14 M. Liu 等

有限。通过显式建模逐像素的尺度和方向校正,空间场提供了专用的校准路径,从而更有效地弥合仿射不变几何与度量预测之间的差距。

空间场与全局尺度(表 4,第 3 行与第 4 行对比):在相同的两阶段设置下,将 MoGe-2 风格的图像级全局尺度替换为空间场,使平均 AbsRel 从 20.1 提升至 19.3,δ1 从 66.8 提升至 68.0。虽然单个全局因子可以校正主导的图像级尺度模糊性,但它无法解释跨像素的空间变化尺度漂移或射线方向不一致性。相比之下,所提出的空间场提供局部自适应的尺度和方向校准,使得从相对到度量的转换比全局缩放更准确。

场损失设计的有效性(表 4,第 4 行与第 5 行对比):添加特定于场的目标使平均 AbsRel 从 19.3 提升至 18.8,δ1 从 68.0 提升至 69.7。这表明,仅靠耦合的度量损失会导致几何预测与基于场的校准之间的分解约束不足,因为点图头和场头可能会吸收重叠的残差误差。对尺度和射线方向场进行直接监督能更好地锚定它们各自的角色,促使它们充当轻量级校准模块,而不是冗余的几何预测器,从而提高度量校准的稳定性和准确性。

两阶段训练策略(表 4,第 1 行与第 2 行对比;表 5,第 1 行与第 2 行对比):在两阶段训练中,无论是在受控数据规模还是全数据规模下,其表现均优于直接度量学习。在全数据训练下,从第一阶段相对基础模型初始化,相较于从头训练度量模型,进一步将 AbsRel/δ1 从 15.2/78.2 提升至 14.8/80.8。这些结果表明,将仿射不变几何学习与度量校准分离提供了更强的初始化:第一阶段建立稳定的结构先验,使第二阶段能够专注于轻量级度量校准,同时保持几何保真度。

渲染数据的有效性(表 5,第 3–7 行):渲染数据在相机和域偏移下提供了针对性的适应信号。使用我们的渲染数据微调现成的度量模型提高了鲁棒性,表明合成集有效地减少了内在不匹配,而不仅仅是增加了更多样本。为了将焦距多样性与合成数据规模扩大分离开来,我们使用相同的场景和相机轨迹构建了固定焦距 FGD,焦距固定为 1320 像素。虽然固定焦距数据改善了 DDAD 和 DIODE 上的性能,但略微降低了整体平均值。相比之下,多焦距 FGD 在多个数据集上提供了更一致的增益,并进一步改善了相机敏感基准测试。这些结果表明,仅添加来自单一相机模式的渲染数据不足以实现广泛的泛化,而多样化的焦距覆盖能更有效地提高在相机内参偏移下的鲁棒性。

射线方向校正的有效性(表 6,第 1 行与第 2 行对比):射线方向校正在所有基于射线的指标上持续改善

第 15 页

评估数据集表明,方向偏差是点图误差的一个独立来源,仅靠尺度校准无法解决这一问题。在相机和域偏移较强的情况下,这种增益尤为明显,因为即使深度尺度经过合理校准,不准确的光线方向仍会导致显著的三维不一致性。平均 δ1 的显著提升进一步表明,更精确的光线几何结构通常有助于度量深度预测。尽管各数据集的 δ1 并非均有所提升,但光线指标始终更优;这种差异可能部分源于共享主干网络与多个预测头之间的优化干扰。

5 结论

我们提出了 FoundationGeo,这是一个两阶段框架,旨在桥接仿射不变的相对几何与单目度量预测。在第一阶段,使用 DINOv3 初始化的主干网络在精心整理的 1020 万张图像语料库上进行训练,以学习全局一致且保留细节的相对几何结构。在第二阶段,轻量级的逐像素校准场用于校正光线方向偏差和空间变化的尺度漂移,将相对点图转换为度量一致的三维几何结构。我们进一步发现,相机内参覆盖范围,特别是焦距分布的不匹配,是零样本度量泛化的主要瓶颈,并通过基于 Blender 的针对性增强(包含 23,700 张覆盖不足焦距范围的图像)解决了这一问题。广泛的零样本评估表明,FoundationGeo 在七个基准测试中实现了最佳的总体度量深度性能,且在推理过程中无需真实相机内参。同时,第一阶段模型提供了强大的仿射不变几何先验,实现了最佳的总体相对深度性能以及具有竞争力的边界清晰度。这些结果表明,鲁棒的单目度量几何不仅依赖于更强的相对表示,还依赖于局部自适应校准和原则性的相机分布覆盖。未来的工作可能将此框架扩展到时序或多视图观测,其中跨帧的几何一致性可以进一步减少单目歧义,并在未见过的相机模型下提高鲁棒性。

6 致谢

本研究在 Voyager Research(滴滴出行)实习期间完成。本研究得到了香港研究资助局(RGC)通过一般研究资助计划(资助编号:17202422、17212923 和 17215025)、主题研究计划(资助编号:T45-701/22-R)以及策略性主题资助计划(资助编号:STG3/E-605/25-N)的支持。此外,本研究的部分工作是在香港赛马会慈善信托基金资助的软材料机器人 JC STEM 实验室进行的。

第 16 页

16 M. Liu 等

参考文献

1. Baruch, G., Chen, Z., Dehghan, A., Dimry, T., Feigin, Y., Fu, P., Gebauer, T., Joffe, B., Kurz, D., Schwartz, A., Shulman, E.: ARKitscenes – 一个用于使用移动 RGB-D 数据进行 3D 室内场景理解的多样化真实世界数据集。在:第三十五届神经信息处理系统会议数据集与基准测试轨道(第一轮)(2021) 10 2. Bhat, S.F., Birkl, R., Wofk, D., Wonka, P., Müller, M.: Zoedepth: 通过结合相对深度和度量深度实现零样本迁移。arXiv 预印本 arXiv:2302.12288 (2023) 2, 4, 11, 12 3. Bochkovskii, A., Delaunoy, A., Germain, H., Santos, M., Zhou, Y., Richter, S., Koltun, V.: Depth pro: 不到一秒钟的锐利单目度量深度。在:国际学习表征会议 (2025) 2, 4, 9, 10, 11, 12 4. Butler, D.J., Wulff, J., Stanley, G.B., Black, M.J.: 用于光流评估的自然主义开源电影。在:欧洲计算机视觉会议。页码 611– 625。Springer (2012) 10, 12, 6 5. Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: 一张图像胜过 16×16 个单词:用于大规模图像识别的 Transformer。在: 国际学习表征会议 (2021) 9 6. Eigen, D., Puhrsch, C., Fergus, R.: 使用多尺度深度网络从单张图像预测深度图。神经信息处理系统进展 27 (2014) 2 7. Fonder, M., Van Droogenbroeck, M.: Mid-air: 用于极低空无人机飞行的多模态数据集。在:IEEE/CVF 计算机视觉与模式识别会议论文集研讨会 (2019) 10 8. Gómez, J.L., Silva, M., Seoane, A., Borrás, A., Noriega, M., Ros, G., Iglesias- Guitian, J.A., López, A.M.: 众人拾柴火焰高:Urbansyn 数据集,合成驾驶场景的第三位火枪手。神经计算 637, 130038 (2025) 10 9. Guizilini, V., Ambrus, R., Pillai, S., Raventos, A., Gaidon, A.: 用于自监督单目深度估计的 3D 打包。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 2485–2494 (2020) 10, 6 10. Hu, M., Yin, W., Zhang, C., Cai, Z., Long, X., Chen, H., Wang, K., Yu, G., Shen, C., Shen, S.: Metric3d v2: 用于零样本度量深度和表面法线估计的多功能单目几何基础模型。IEEE 模式分析与机器智能汇刊 46(12), 10579–10596 (2024) 2, 4, 8, 10, 11, 12 11. Huang, P.H., Matzen, K., Kopf, J., Ahuja, N., Huang, J.B.: Deepmvs: 学习多视图立体视觉。在:IEEE 计算机视觉与模式识别会议论文集。页码 2821–2830 (2018) 10 12. Jung, H., Ruhkamp, P., Zhai, G., Brasch, N., Li, Y., Verdie, Y., Song, J., Zhou, Y., Armagan, A., Ilic, S., et al.: 论精确几何数据对密集 3D 视觉任务的重要性。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 780–791 (2023) 10, 12, 6 13. Karaev, N., Rocco, I., Graham, B., Neverova, N., Vedaldi, A., Rupprecht, C.: Dy- namicstereo: 来自立体视频的一致动态深度。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 13229– 13239 (2023) 10

第 17 页

FoundationGeo 17

14. Ke, B., Qu, K., Wang, T., Metzger, N., Huang, S., Li, B., Obukhov, A., Schindler, K.: Marigold: Affordable adaptation of diffusion-based image generators for image analysis. IEEE Transactions on Pattern Analysis and Machine Intelligence (2025) 2, 4 15. Koch, T., Liebel, L., Fraundorfer, F., Korner, M.: Evaluation of cnn-based single- image depth estimation methods. In: Proceedings of the European Conference on Computer Vision (ECCV) Workshops (2018) 10, 12, 6 16. Koch, T., Liebel, L., Körner, M., Fraundorfer, F.: Comparison of monocular depth estimation methods using geometrically relevant metrics on the ibims-1 dataset. Computer Vision and Image Understanding 191, 102877 (2020) 10, 12, 6 17. Leroy, V., Cabon, Y., Revaud, J.: Grounding image matching in 3d with mast3r. In: European Conference on Computer Vision. pp. 71–91. Springer (2024) 11, 12 18. Li, Y., Jiang, L., Xu, L., Xiangli, Y., Wang, Z., Lin, D., Dai, B.: Matrixcity: A large-scale city dataset for city-scale neural rendering and beyond. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 3205–3215 (2023) 10 19. Lin, H., Chen, S., Liew, J.H., Chen, D.Y., Li, Z., Zhao, Y., Peng, S., Guo, H., Zhou, X., Shi, G., Feng, J., Kang, B.: Depth anything 3: Recovering the visual space from any views. In: International Conference on Learning Representations (2026) 10, 11 20. Lyu, X., Liu, M., Wu, X., Wang, R., Huang, Y.H., Sun, Y.T., Shi, S., Qi, X.: Stabi- lizing streaming video geometry via dynamic feature normalization. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 7577–7587 (2026) 4 21. Mehl, L., Schmalfuss, J., Jahedi, A., Nalivayko, Y., Bruhn, A.: Spring: A high- resolution high-detail dataset and benchmark for scene flow, optical flow and stereo. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 4981–4991 (2023) 10, 6 22. Niklaus, S., Mai, L., Yang, J., Liu, F.: 3d ken burns effect from a single image. ACM Transactions on Graphics (ToG) 38(6), 1–15 (2019) 10 23. Piccinelli, L., Sakaridis, C., Yang, Y.H., Segu, M., Li, S., Abbeloos, W., Van Gool, L.: Unidepthv2: Universal monocular metric depth estimation made simpler. IEEE Transactions on Pattern Analysis and Machine Intelligence (2025) 2, 4, 9, 11, 12 24. Piccinelli, L., Yang, Y.H., Sakaridis, C., Segu, M., Li, S., Van Gool, L., Yu, F.: Unidepth: Universal monocular metric depth estimation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 10106– 10116 (2024) 2, 4, 9, 11, 12 25. Qi, X., Liao, R., Liu, Z., Urtasun, R., Jia, J.: Geonet: Geometric neural network for joint depth and surface normal estimation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 283–291 (2018) 6 26. Qi, X., Liu, Z., Liao, R., Torr, P.H., Urtasun, R., Jia, J.: Geonet++: Iterative geometric neural network with edge-aware refinement for joint depth and surface normal estimation. IEEE Transactions on Pattern Analysis and Machine Intelli- gence 44(2), 969–984 (2020) 6 27. Ranftl, R., Bochkovskiy, A., Koltun, V.: Vision transformers for dense prediction. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 12179–12188 (2021) 4 28. Roberts, M., Ramapuram, J., Ranjan, A., Kumar, A., Bautista, M.A., Paczan, N., Webb, R., Susskind, J.M.: Hypersim: A photorealistic synthetic dataset for holis- tic indoor scene understanding. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 10912–10922 (2021) 10

第 18 页

18 M. Liu 等

29. Saxena, A., Sun, M., Ng, A.Y.: Make3d: Depth perception from a single still image. In: Aaai. vol. 3, pp. 1571–1576 (2008) 2 30. Schops, T., Sattler, T., Pollefeys, M.: Bad slam: Bundle adjusted direct rgb-d slam. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 134–144 (2019) 10, 6 31. Silberman, N., Hoiem, D., Kohli, P., Fergus, R.: Indoor segmentation and support inference from rgbd images. In: European conference on computer vision. pp. 746– 760. Springer (2012) 10, 6 32. Siméoni, O., Vo, H.V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khali- dov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., et al.: Dinov3. arXiv preprint arXiv:2508.10104 (2025) 3, 5, 9 33. Sun, P., Kretzschmar, H., Dotiwalla, X., Chouard, A., Patnaik, V., Tsui, P., Guo, J., Zhou, Y., Chai, Y., Caine, B., et al.: Scalability in perception for autonomous driving: Waymo open dataset. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 2446–2454 (2020) 10 34. Uhrig, J., Schneider, N., Schneider, L., Franke, U., Brox, T., Geiger, A.: Sparsity invariant cnns. In: 2017 international conference on 3D Vision (3DV). pp. 11–20. IEEE (2017) 10, 6 35. Vasiljevic, I., Kolkin, N., Zhang, S., Luo, R., Wang, H., Dai, F.Z., Daniele, A.F., Mostajabi, M., Basart, S., Walter, M.R., et al.: Diode: A dense indoor and outdoor depth dataset. arXiv preprint arXiv:1908.00463 (2019) 10, 6 36. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: Visual geometry grounded transformer. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 5294–5306 (2025) 4, 10, 11 37. Wang, Q., Zheng, S., Yan, Q., Deng, F., Zhao, K., Chu, X.: Irs: A large naturalistic indoor robotics stereo dataset to train deep models for disparity and surface nor- mal estimation. In: 2021 IEEE International Conference on Multimedia and Expo (ICME). pp. 1–6. IEEE (2021) 10 38. Wang, R., Xu, S., Dai, C., Xiang, J., Deng, Y., Tong, X., Yang, J.: Moge: Unlock- ing accurate monocular geometry estimation for open-domain images with optimal training supervision. In: Proceedings of the Computer Vision and Pattern Recog- nition Conference. pp. 5261–5271 (2025) 2, 4, 5, 6, 11, 12, 8 39. Wang, R., Xu, S., Dong, Y., Deng, Y., Xiang, J., Lv, Z., Sun, G., Tong, X., Yang, J.: Moge-2: Accurate monocular geometry with metric scale and sharp details. Advances in Neural Information Processing Systems 38, 35928–35959 (2025) 2, 4, 6, 10, 11, 12, 13 40. Wang, W., Zhu, D., Wang, X., Hu, Y., Qiu, Y., Wang, C., Hu, Y., Kapoor, A., Scherer, S.: Tartanair: A dataset to push the limits of visual slam. In: 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). pp. 4909–4916. IEEE (2020) 10 41. Wen, B., Trepte, M., Aribido, J., Kautz, J., Gallo, O., Birchfield, S.: Foundation- stereo: Zero-shot stereo matching. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 5249–5260 (2025) 10 42. Wilson, B., Qi, W., Agarwal, T., Lambert, J., Singh, J., Khandelwal, S., Pan, B., Kumar, R., Hartnett, A., Pontes, J.K., Ramanan, D., Carr, P., Hays, J.: Argo- verse 2: Next generation datasets for self-driving perception and forecasting. In: Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks (NeurIPS Datasets and Benchmarks 2021) (2021) 10 43. Xu, G., Lin, H., Luo, H., Wang, X., Yao, J., Zhu, L., Pu, Y., Chi, C., Sun, H., Wang, B., et al.: Pixel-perfect depth with semantics-prompted diffusion transform-

第 19 页

FoundationGeo 19

ers. Advances in Neural Information Processing Systems 38, 174731–174755 (2025) 11 44. Yang, L., Kang, B., Huang, Z., Xu, X., Feng, J., Zhao, H.: Depth anything: Un- leashing the power of large-scale unlabeled data. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 10371–10381 (2024) 2, 4, 10, 11, 12 45. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2. Advances in Neural Information Processing Systems 37, 21875–21911 (2024) 2, 4, 10, 11, 12 46. Yao, Y., Luo, Z., Li, S., Zhang, J., Ren, Y., Zhou, L., Fang, T., Quan, L.: Blended- mvs: A large-scale dataset for generalized multi-view stereo networks. In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 1790–1799 (2020) 10 47. Yin, W., Zhang, C., Chen, H., Cai, Z., Yu, G., Wang, K., Chen, X., Shen, C.: Metric3d: Towards zero-shot metric 3d prediction from a single image. In: Proceed- ings of the IEEE/CVF international conference on computer vision. pp. 9043–9053 (2023) 2, 4, 8 48. Zamir, A.R., Sax, A., Shen, W., Guibas, L.J., Malik, J., Savarese, S.: Taskonomy: Disentangling task transfer learning. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 3712–3722 (2018) 10 49. Zheng, J., Zhang, J., Li, J., Tang, R., Gao, S., Zhou, Z.: Structured3d: A large photo-realistic dataset for structured 3d modeling. In: European Conference on Computer Vision. pp. 519–535. Springer (2020) 10

第 20 页

FoundationGeo 1

补充材料

本补充材料提供了额外的实现细节、算法解释和数据集描述,以补充主论文。第 A 节详细说明了两个阶段使用的训练目标,包括仿射不变相对几何损失以及用于度量校准的第二阶段超参数设置。第 B 节展示了射线方向校正的详细算法,阐明了局部切线基是如何构建的,以及在实际应用中如何应用有界的角偏移量。第 C 节介绍了 FoundationGeo 数据集以及基于 Blender 的数据引擎,包括场景组成、相机配置和手动设计的轨迹布局。第 D 节提供了额外的实验细节,包括统一的评估协议和训练数据过滤的代表性示例。最后,第 E 节讨论了当前的局限性,并概述了几个有前景的未来工作方向。

A 详细的损失设计

A.1 第一阶段:相对几何目标

我们采用一组仿射不变且感知几何的损失来训练一个强大的相对几何基础模型。在第一阶段,网络预测一个仿射不变点图 $\hat{\mathbf{P}} \in \mathbb{R}^{H \times W \times 3}$ 和一个可靠性掩码 $\hat{\mathbf{M}} \in [0, 1]^{H \times W}$,并通过互补的全局、局部、法线、边缘和掩码监督进行优化。

全局对齐损失。全局对齐损失在存在全局尺度-平移歧义的情况下,使 $\hat{\mathbf{P}}$ 拟合真实 3D 点。令 $\hat{\mathbf{p}}_i$ 表示第 $i$ 个像素的预测 3D 点,$\mathbf{p}_i$ 为其对应的真实值。全局仿射不变损失定义为

$$ \mathcal{L}_{\text{global}} = \sum_{i \in \mathcal{M}} \frac{1}{z_i} \left\| s^* \hat{\mathbf{p}}_i + \mathbf{t}^* – \mathbf{p}_i \right\| \quad (6) $$

其中 $(s^*, \mathbf{t}^*)$ 是将预测的仿射不变点图变换到真实相机空间的对齐参数,$\mathcal{M}$ 是有效的监督掩码。在实际操作中,$(s^*, \mathbf{t}^*)$ 是通过求解预测值与真实值之间的全局对齐来估计的。加权项 $1/z_i$,其中 $z_i$ 是 $\mathbf{p}_i$ 的 z 坐标,用于平衡大深度范围内的监督强度。

该目标鼓励模型恢复全局一致的仿射不变几何结构,同时对绝对度量尺度保持不敏感。当与下面的局部损失结合使用时,它为相对几何学习提供了由粗到细的训练信号。

多尺度局部块损失。为了保留局部结构和高频细节,我们额外应用多尺度局部块监督。整体局部目标为

$$ \mathcal{L}_{\text{local}} = \sum_{s \in \mathcal{S}} \mathcal{L}_{\text{local}}^{(s)} \quad (7) $$

第 21 页

2 M. Liu 等

其中 $\mathcal{A}$ 是邻域尺度的集合。 对于每个尺度 $\alpha$,我们首先在锚点 $p_j$ 周围构建一个局部球形邻域: $$ \mathcal{S}_j = \left\{ i \mid \|p_i – p_j\| \le r_j, i \in \mathcal{H}_\alpha \right\} \quad (8) $$

半径为 $$ r_j = \alpha \cdot z_j \cdot \frac{\sqrt{W^2+H^2}}{2f} \quad (9) $$

其中 $z_j$ 是 $p_j$ 的深度,$f$ 是真实焦距,$(W, H)$ 是图像分辨率。这种设计使得邻域大小能够同时适应场景深度和相机内参。 随后,在每个球形补丁内使用尺度和平移参数 $(s^*_j, t^*_j)$ 求解局部仿射对齐,并定义补丁损失为

$$ \mathcal{L}_{\text{local}} = \sum_{j \in \mathcal{H}_\alpha} \sum_{i \in \mathcal{S}_j} \frac{1}{z_i} \left\| s^*_j \hat{p}_i + t^*_j – p_i \right\|^2 \quad (10) $$

其中 $\mathcal{H}_\alpha$ 表示在尺度 $\alpha$ 下采样的锚点集合。 在实践中,我们对不同的监督源使用不同的局部尺度。合成数据使用三个层级 $A_{\text{syn}} = \{ \frac{1}{4}, \frac{1}{8}, \frac{1}{16} \}$,SfM 数据使用 $A_{\text{sfm}} = \{ \frac{1}{4}, \frac{1}{8} \}$,而 LiDAR 数据仅使用 $A_{\text{lidar}} = \{ \frac{1}{4} \}$。

表面法线一致性损失。为了鼓励分段平滑且保留细节的几何结构,我们施加表面法线一致性损失:

$$ \mathcal{L}_{\text{normal}} = \sum_{i \in \mathcal{H}_\alpha} \angle(\hat{n}_i, n_i) \quad (11) $$

其中 $\hat{n}_i$ 和 $n_i$ 分别表示预测和真实的表面法线,$\angle(\cdot, \cdot)$ 衡量它们的角差异。

边缘损失。为了更好地保留几何不连续性和局部结构,我们进一步监督相邻 3D 点差异的方向。令

$$ \Delta_x \hat{p}_{u,v} = \hat{p}_{u+1,v} – \hat{p}_{u,v}, \quad \Delta_y \hat{p}_{u,v} = \hat{p}_{u,v+1} – \hat{p}_{u,v} \quad (12) $$

表示预测点图的水平和垂直边缘向量,并类似地定义真实值的 $\Delta_x p_{u,v}$ 和 $\Delta_y p_{u,v}$。然后我们惩罚它们的角差异:

$$ \mathcal{L}_{\text{edge}} = \sum_{(u,v) \in \mathcal{M}_x} \angle(\Delta_x \hat{p}_{u,v}, \Delta_x p_{u,v}) + \sum_{(u,v) \in \mathcal{M}_y} \angle(\Delta_y \hat{p}_{u,v}, \Delta_y p_{u,v}) \quad (13) $$

其中 $\mathcal{M}_x$ 和 $\mathcal{M}_y$ 分别表示水平和垂直方向上的有效相邻像素对。该损失鼓励预测点图保留局部边缘方向和尖锐的几何过渡。

掩码监督损失。为了抑制不可靠区域,我们使用以下公式监督预测的可靠性掩码:

$$ \mathcal{L}_{\text{mask}} = \sum_{i \in \mathcal{H}_\alpha} \left\| \hat{m}_i – m_{\text{inf}} \right\|^2 \quad (14) $$

第 22 页

FoundationGeo 3

其中 $M_{\text{inf}}$ 表示从真实标签推导出的无效区域指示器。 总体第一阶段目标。最终第一阶段损失依赖于标签类型:

$$ \mathcal{L}_{\text{Stage-I}} = \lambda_{\text{g}}^{(t)}\mathcal{L}_{\text{global}} + \sum_{n \in \mathcal{A}_t} \lambda_{\text{n}}^{(t)}\mathcal{L}_{\text{normal}} + \lambda_{\text{e}}^{(t)}\mathcal{L}_{\text{edge}} + \lambda_{\text{m}}^{(t)}\mathcal{L}_{\text{mask}}, \quad (15) $$

其中 $t \in \{\text{synthetic, sfm, lidar}\}$ 表示标签类型。 在所有实验中,我们将损失权重设置为如下:

$$ (\lambda_{\text{g}}, \lambda_{\text{n}}, \lambda_{\text{e}}, \lambda_{\text{m}}) = \begin{cases} (1/16, 1/64, 1/64, 1/64), & t=\texttt{synthetic}, \\ (1/4, 1/16, 1/16, 1/16), & t=\texttt{sfm}, \\ (1/2, 1/4, 1/4, 1/4), & t=\texttt{lidar}. \end{cases} \quad (16) $$

除非另有说明,全局和局部对齐项均使用单位权重。 在实现中,全局损失使用的对齐分辨率为 48,而层级 $\{4, 16, 64\}$ 的局部块损失使用的对齐分辨率分别为 $\{24, 12, 6\}$,采样块的数量分别为 $\{16, 256, 4096\}$。

A.2 第二阶段训练细节

如主论文所述,第二阶段保留了第一阶段中的相对几何监督,并进一步引入了耦合度量回归,以及对射线方向校正场和逐像素尺度场的解耦监督。此处我们仅提供训练过程中使用的实现细节和超参数设置。

总体第二阶段目标。遵循主论文中的公式,总体第二阶段训练目标为

$$ \mathcal{L}_{\text{FoundationGeo}} = \mathcal{L}_{\text{relative}} + \gamma_s \mathcal{L}_{\text{metric}} + \gamma_r \mathcal{L}_{\text{scalefield}} + \gamma_\Delta \mathcal{L}_{\text{ray}}, \quad (17) $$

其中 $\mathcal{L}_{\text{relative}}$ 表示从第一阶段继承的、依赖于源的结构化监督,包括针对每个监督源启用的全局、局部、法线和掩码项。在我们的实现中,我们设置 $\gamma_s = 0.2$,$\gamma_r = 0.1$,以及 $\gamma_\Delta = 0.05$。 对于合成数据,我们使用完整的第一阶段结构正则化,包括全局损失、层级 $\{4, 16, 64\}$ 的局部块损失、法线损失和掩码损失,并将它们与第二阶段的度量校准项相结合。对于 SfM 数据,我们使用全局损失、层级 $\{4, 16\}$ 的局部块损失、法线损失和掩码损失。 对于 LiDAR 数据,我们仅使用全局损失、层级 4 的局部块损失以及度量校准项。 度量损失使用单位权重,而额外的校准项由 $\gamma_s = 0.2$,$\gamma_r = 0.1$ 和 $\gamma_\Delta = 0.05$ 加权。当通过 $\mathcal{L}_{\text{relative}}$ 启用时,法线损失和掩码损失的权重分别为 1.0 和 0.1。 对于尺度场监督,我们在对数域中应用损失,并将目标尺度限制在 $[0.05, 20.0]$ 范围内。鲁棒惩罚使用 $\beta = \log(1.25)$,

第 23 页

4 M. Liu 等

对应于线性尺度上大约 ±25% 的容差。对于射线方向损失,我们使用具有 β = 3◦ 的鲁棒角度惩罚,并将角度误差截断至 [0.05◦, 30◦] 范围内。对于校正场正则化,我们使用 q = 2。

表 7:不同监督源下的第二阶段损失配置。

类型 全局 Patch-4 Patch-16 Patch-64 法线 度量 项 掩码 合成数据 ✓ ✓ ✓ ✓ ✓ ✓ ✓ SfM ✓ ✓ ✓ ✓ ✓ ✓ LiDAR ✓ ✓ ✓ ✓

总体而言,该设计保留了第一阶段强大的仿射不变监督,同时明确地将度量校准解耦为逐像素尺度场和射线方向细化场。

B 射线方向校正细节

我们在算法 1 中提供了所提出的射线方向校正的详细过程,并在图 6 中说明了其几何直观性。给定预测的仿射不变点图 $\hat{P}$,我们将每个点 $\hat{p}_i$ 分解为其范围 $\hat{d}_i = \|\hat{p}_i\|_2$ 和单位射线方向 $\hat{r}_i = \hat{p}_i / \hat{d}_i$。如图 6 所示,我们通过选择一个与当前射线方向几乎不平行的参考轴,构建与 $\hat{r}_i$ 正交的稳定局部切线基 $(b_{1,i}, b_{2,i})$。预测的 2D 校正被映射到该切平面上,通过 tanh 参数化进行有界处理,并应用于更新射线方向。最后,校正后的射线被重新归一化并乘以原始范围,以获得方向校正后的点 $\hat{p}'_i$。该设计使校正显式地具有角度特性并保持尺度不变,这有助于将方向偏差与逐像素度量缩放解耦。 算法 1 和图 6 总结了第二阶段使用的射线方向校正过程。关键思想是仅修改射线方向而保持预测的范围不变,从而使校正专注于方向偏差,而不是吸收度量尺度。切线空间参数化也使更新具有几何可解释性,因为两个预测的偏移量对应于局部切平面上两个正交方向上的小角度扰动。该设计具有三个理想的特性:它是尺度保持的,因为原始范围保持不变;它是几何可解释的,因为校正显式地表示为切平面内的有界 2D 偏移;它是数值稳定的,因为动态参考轴选择在射线接近固定规范轴时避免了退化的叉积。此外,有界的 tanh 参数化可防止训练过程中出现过大校正。

第 24 页

FoundationGeo 5

[0,1,0]

r̂ "̂ " ! #$ 射线方向误差 b2 b2 #$

O O O O

b1 b1 b1

(a) 原始射线不匹配 (b) 构建 b1 (c) 构建 b2 (d) 应用有界校正

图 6: 所提出的射线方向校正示意图。(a) 预测的射线方向可能偏离目标方向,产生方向误差。(b) 选择稳定的参考轴以构建第一个切线方向 b1。(c) 进而获得第二个切线方向 b2,从而在切平面上形成局部标准正交基。(d) 在切平面上应用有界的二维偏移量来校正射线方向,同时保持原始范围 ˆd 不变。

算法 1 射线方向校正 输入: 相对点图 ˆP, 校正场 ∆=ˆ (∆1,ˆ ∆2)ˆ 输出: 校正后的点图 ˆP′ 函数 ApplyDeltaToRay(ˆP, ∆,ˆ δmax) 对于每个像素 i 执行: ˆdi ←∥ˆpi∥2, ˆri ←ˆpi/ˆdi 设置候选轴 a1 = (0, 1, 0) 和 a2 = (0, 0, 1) 如果 |ˆr⊤i a1| > 0.95 则: ai ←a2 否则: ai ←a1 结束如果 b1,i ←norm(ai × ˆri) b2,i ←norm(ˆri × b1,i) d1,i ←δmax tanh(∆1,i),ˆ d2,i ←δmax tanh(∆2,i)ˆ ˜ri ←ˆri + d1,ib1,i + d2,ib2,i ˆr′i ←norm(˜ri) ˆp′i ←ˆdiˆr′i 结束循环 返回 ˆP′ 结束函数

C FoundationGeo 数据集

为了提高度量训练中的相机模型多样性,我们在 Blender 中构建了一个目标合成数据集,称为 FoundationGeo 数据集。其主要目的是用可控的渲染数据补充原始训练语料库的内参分布,特别是在覆盖不足的焦距范围内。与从现有数据集中被动聚合不同,我们的数据引擎允许在保持准确几何监督的同时,联合控制场景布局、相机轨迹和焦距设置。总共,渲染池包含 23,700 张图像,其中包括 22,900 张主要训练图像,涵盖七个场景,以及 400 张

第 25 页

6 M. Liu et al.

来自一个室内场景的以对象为中心的子集;另外 400 张渲染图像未用于训练。 工具与资产。FoundationGeo 数据集基于基于 Blender 的数据引擎构建,共包含七个场景,包括五个室内场景和两个室外场景,涵盖房间尺度、建筑尺度和开放环境布局。对于每一帧,我们导出对齐的 RGB 图像、深度图、焦距元数据和相机位姿,所有数据均保持一致的索引以便直接对应,并易于集成到度量训练流程中。相机位姿存储为绝对相机到世界(camera-to-world)的变换。图 7 展示了来自这七个场景的代表性 RGB 和深度示例,说明了渲染数据引擎所覆盖的场景结构、尺度和几何多样性。 相机配置。所有图像均以 1024 × 768 的分辨率渲染,具有标准的 4:3 宽高比。我们没有固定单一的内在参数设置,而是以变化的焦距渲染数据集,以增加相机多样性并更好地覆盖代表性不足的内在参数域。这使得该数据集成为有针对性的度量阶段补充,而非通用的合成增强数据。 布局配置。这七个场景旨在覆盖室内和室外的几何分布。各场景的图像数量分别为:场景 1(室内,3,300)、场景 2(室内,1,500)、场景 3(室外,8,700)、场景 4(室内,3,000)、场景 5(室内,1,000)、场景 6(室外,3,000)和场景 7(室内,2,400)。此外,其中一个室内场景包含一个 400 张图像的以对象为中心的子集,用于受控的渲染分析。 所有相机轨迹均由人工标注。我们不依赖完全随机的相机采样,而是显式设计轨迹并选择有效的视点,以确保有用的几何覆盖、稳定的透视变化以及具有视觉意义的观察结果。这通过避免退化视图和无效的场景配置来提高监督质量,同时产生有利于度量校准的透视变化和结构深度过渡。总体而言,尽管与完整的多源语料库相比规模适中,但 FoundationGeo 数据集被有意设计为一种有针对性的补充,它在原始训练分布中缺失的受控相机设置下注入干净的几何监督信号。

D 实验细节

D.1 评估协议细节

在单目深度估计中,广泛使用的基准数据集如 NYUv2 和 KITTI 通常在异构的预处理协议下进行评估,这使得不同工作之间的公平比较变得困难。特别是,同一模型根据每篇论文如何裁剪、下采样或过滤数据,可能会产生显著不同的结果。为了缓解这一问题,我们采用 MoGe [38] 的统一评估协议,并遵循其基准数据集:NYUv2 [31]、KITTI [34]、ETH3D [30]、iBims-1 [15, 16]、Sintel [4]、DDAD [9]、DIODE [35]、Spring [21] 和 HAMMER [12]。其中,Spring 因用于训练而被排除在评估之外,Sintel 仅用于相对深度

第 26 页

FoundationGeo 7

图 7:FoundationGeo 数据集概览。我们构建了一个基于 Blender 的合成数据引擎,包含七个场景,其中五个为室内场景,两个为室外场景。该图展示了每个场景中具有代表性的 RGB 图像及其对应的深度图,说明了数据集所涵盖的布局、视角和几何结构的多样性。

由于缺乏度量尺度,因此无法进行度量深度评估。因此,我们在八个数据集上报告相对深度,并在具有可靠度量标注的七个数据集上报告度量深度。 所有数据集均经过特定于数据集的预处理,以确保持久且稳健的评估设置。典型步骤包括分辨率归一化,例如将 KITTI 和 Sintel 中心裁剪为固定宽高比,或对高分辨率的 ETH3D 图像进行下采样,以及系统性的数据清洗以减轻传感器噪声和真实值伪影。对于 NYUv2 和 DIODE,未

第 27 页

8 M. Liu 等

使用基于边缘的滤波移除不可靠的边界区域;特别是对于 NYUv2,丢弃超过 5 米的深度,并手动掩蔽反射表面。合成数据集和视频数据集需要额外的处理:在 Sintel 中掩蔽天空区域,并对 DDAD 图像进行裁剪以移除自车的可见部分。总体而言,这种标准化的预处理减少了评估的歧义性,确保了不同方法之间更公平的比较;更多的实现细节可在 MoGe [38] 的补充材料中找到。

D.2 训练数据过滤

我们收集了一个包含 1020 万个样本的大规模多源训练集。由于并非所有收集的样本都适合训练,我们应用过滤过程来移除存在严重域不匹配、几何线索微弱或标注不可靠的图像。整体过滤策略在第 3.1 节中描述;此处我们提供几个代表性示例。 如图 8 所示,我们丢弃那些远离目标域或包含不一致几何标签的样本,并保留具有可靠透视和深度结构的样本。特别是,鸟瞰图或遥感风格的样本(如图 8(a) 所示的示例)被移除,因为它们的成像几何结构与模型的目標分布存在显著差异。相比之下,如图 8(b) 所示的样本被保留,因为它们表现出清晰的近-远深度顺序和丰富的透视线索。我们还移除了如图 8(c) 所示的错误标注样本,其中相机超出了场景边界,且无效的越界区域未正确掩蔽,导致 RGB 内容与深度标注之间出现明显不匹配。

(a)

(b)

(c)

图 8: 数据过滤的代表性示例。(a) 由于严重的域不匹配,移除鸟瞰图或遥感风格的样本。(b) 保留具有清晰透视和近-远深度顺序的样本。(c) 过滤掉存在场景边界违规和深度标注不一致的错误标注样本。

第 28 页

FoundationGeo 9

E 局限性与未来工作

超出焦距范围的相机模型覆盖。我们的研究将焦距分布不匹配确定为零样本度量泛化的主要瓶颈,并表明针对性的渲染数据可以有效提升在此类内参偏移下的鲁棒性。然而,当前的干预措施主要集中于焦距覆盖范围,并未完全涵盖真实应用中遇到的更广泛的相机模型空间,例如主点、纵横比、传感器尺寸、畸变或其他成像特性的变化。扩展当前的数据引擎和训练策略以覆盖更丰富的内参因素,是未来工作的重要方向。

轻量级空间校准场的容量。我们的射线方向校正场和逐像素尺度场被有意设计为建立在强大的相对深度骨干网络之上的轻量级校准模块。这种设计有效且稳定,但也限制了在更极端的分布外设置下的校正能力,例如严重的相机偏移、高度异常的场景几何结构或强烈的外观退化。在未来的工作中,探索更具表现力但仍受良好约束的校准设计将是一个有趣的课题,例如分层空间场、不确定性感知校准,或全局相机线索与局部几何细化之间的更强耦合。

合成数据引擎的规模与多样性。尽管 FoundationGeo 数据集为覆盖不足的相机模式提供了有用的针对性补充,但与真实世界开放域数据的复杂性相比,其在场景规模和资产多样性方面仍然相对有限。特别是,我们当前的渲染集由七个场景和手动设计的有效轨迹构建而成,虽然提供了干净的监督信号,但尚未涵盖实践中看到的布局、物体、材质和运动模式的多样性。一个有前景的未来方向是构建一个规模更大、自动化程度更高的数据引擎,具备更广泛的场景覆盖范围、更丰富的可控相机参数以及更具可扩展性的轨迹生成能力,从而使合成数据成为度量几何泛化更强、更系统的工具。

发表评论