ZipDepth:6.1M参数实现零样本单目深度估计的实时部署

三分钟导读:ZipDepth 是一个仅含 6.1M 参数的轻量级单目深度估计网络,通过从 Foundation Model 进行大规模知识蒸馏和硬件自适应架构设计,在嵌入式设备上实现了实时推理与卓越的零样本泛化能力。

英文题目:ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

论文出处:arXiv 每日论文精选 · arXiv:2607.08771

原始论文:PDF / 论文页面

对应视频标题:ZipDepth:6.1M参数实现零样本单目深度估计的实时部署|推荐指数:★★★★★

这篇论文解决什么问题?

现有的单目深度估计方法存在两极分化:Foundation Models 具备强大的零样本泛化能力但计算量巨大,无法在嵌入式设备上实时运行;而轻量级模型虽然高效,但通常基于单域自监督训练,在跨域场景下泛化能力严重不足。

核心创新

  • Reparameterizable Encoder: 训练时多分支,推理时融合为单卷积,无需图手术即可导出至 TensorRT/CoreML/ONNX。
  • Hardware-adaptive Convex Upsampling: 提供 GPU 路径 (基于 unfold/softmax) 和 NPU 路径 (基于双线性/最近邻混合),在保持边界精度的同时适配不同硬件算子支持。
  • Large-scale Distillation: 利用 14.1M 张多域图像进行蒸馏,解决了轻量级模型泛化能力差的问题。

方法概览

ZipDepth 采用 Reparameterizable Encoder-Decoder 架构。训练阶段使用 Depth Anything v2-Large 作为 Teacher,在 14.1M 张多域图像上进行知识蒸馏。推理阶段通过分支融合将参数量压缩至 6.1M。解码器采用硬件自适应凸上采样 (Hardware-adaptive convex upsampling),针对 GPU/NPU 提供不同路径以平衡精度与速度。

逐图理解论文

Problem: 现有方法的局限

Problem: 现有方法的局限
Fig. 2: Energy–Accuracy Trade-off. Zero-shot depth models on NVIDIA Jetson Orin NX (15W). Energy per frame (FP32 inference) vs. mean AbsRel (over 5 datasets); bubble size indicates FPS. ZipDepth bridges the gap between lightweight and founda- tion models, tending toward their accuracy under a < 400 mJ/frame budget. † denotes lightweight baselines retrained on our multi-domain training set for a fair comparison.

现有方法如 Depth Anything v2 依赖大型 ViT,参数量达数亿,推理能耗高。而 Lite-Mono 等轻量模型虽高效,但受限于单域自监督训练,跨域性能严重不足。

Method: ZipDepth 架构概览

Method: ZipDepth 架构概览
Fig. 3: Overview of the ZipDepth architecture. The encoder (top, left→right) progressively downsamples the input through four reparameterizable stages; the de- coder (bottom, right→left) fuses multi-scale features coarse-to-fine and produces a full-resolution inverse-depth map via hardware-adaptive convex upsampling.

ZipDepth 采用 Reparameterizable Encoder-Decoder 架构。训练时使用 Depth Anything v2-Large 作为 Teacher,在 14.1M 张多域图像上进行知识蒸馏。推理时通过分支融合压缩至 6.1M 参数。

Innovation 1: 可重参数化编码器

Innovation 1: 可重参数化编码器
Table 1: ZipDepth network breakdown. We compare training parameters (in- cluding reparameterizable branches) vs. inference parameters (fused). Stride indicates spatial downsampling (H/S).

编码器在训练阶段使用多分支结构,推理时融合为单卷积。这种设计无需图手术即可导出至 TensorRT、CoreML 或 ONNX,极大简化了部署流程。

Innovation 2: 硬件自适应上采样

Innovation 2: 硬件自适应上采样
Table 5: Comparison – Full-resolution Upsampling Strategies. Accuracy on NYUv2 and KITTI. Boundary F1 (SI-BF1) evaluated on 1000 synthetic images from UnrealStereo4K [77] using the scale-invariant boundary metric from [8]. Higher is bet- ter. ⋆ONNX Runtime, Intel Core i7-11800H (8-core, 45W). †Jetson Orin NX 16GB (15W), PyTorch Fused FP32. ♢CoreML, iPhone 12 ANE (6W).

解码器采用硬件自适应凸上采样。GPU 路径基于 unfold/softmax,NPU 路径基于双线性/最近邻混合。这种设计在保持边界精度的同时,适配不同硬件的算子支持。

Innovation 3: 大规模知识蒸馏

Innovation 3: 大规模知识蒸馏
Table 4: Data scale ablation (AbsRel↓/ δ1 ↑). Same model and training setup; only the fraction of the 14.1M-image training set varies.

通过在 14.1M 张多域图像上进行蒸馏,ZipDepth 有效解决了轻量级模型泛化能力差的问题。这种大规模蒸馏策略使其在零样本场景下表现优异。

实验与关键结果

  • 在 NYUv2, KITTI, ETH3D, ScanNet, DIODE 五个零样本基准上进行评估。
  • 在 NVIDIA Jetson Orin NX (15W) 上测试能效与速度。
  • 在 9 种硬件平台 (Server GPU/CPU, Embedded GPU, Mobile NPU/GPU) 上进行部署测试。
  • 消融实验验证了 SE/GC Attention, SPPF, 半分辨率跳跃连接及数据规模的影响。
  • 在 NYUv2, KITTI, ETH3D, ScanNet, DIODE 五个零样本基准上进行评估。
  • 在 NVIDIA Jetson Orin NX (15W) 上测试能效与速度。
  • 在 9 种硬件平台 (Server GPU/CPU, Embedded GPU, Mobile NPU/GPU) 上进行部署测试。
  • 消融实验验证了 SE/GC Attention, SPPF, 半分辨率跳跃连接及数据规模的影响。

阅读时需要注意

  • 精度仍低于大型 Foundation Models (如 DA-V2-Large)。
  • 视频推理存在时间闪烁 (Temporal flickering),缺乏帧间一致性。
  • 输出为仿射不变深度 (Affine-invariant),非绝对度量深度。
  • 轻量级基线模型 (Lite-Mono, GuideDepth 等) 在对比实验中均使用 ZipDepth 的训练数据重新训练,以确保公平性,这可能与原始发布的自监督权重表现不同。
  • NPU 路径的上采样策略在边界精度上略低于 GPU 路径,但在移动设备上速度更快。

关联工作


展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ZipDepth:将轻量级零样本单目深度估计带到任何地方、任何设备上

Fabio Tosi, Luca Bartolomei, Matteo Poggi, 和 Stefano Mattoccia

博洛尼亚大学,意大利博洛尼亚 {fabio.tosi5, luca.bartolomei5, m.poggi, stefano.mattoccia}@unibo.it https://zipdepth.github.io/

2026年7月9日

图 1:ZipDepth 在多样且具有挑战性的场景中实现了零样本泛化。第一行:输入 RGB 图像;第二行:预测深度。即使在功耗仅为 15 W 的 Jetson Orin NX 上也能达到实时速率(使用 PyTorch Eager FP32 为 34 FPS,使用 TensorRT FP16 可达 77 FPS)。

摘要。单目深度估计通过实现鲁棒零样本泛化的基础模型取得了显著进展,然而其计算需求使得这些模型远远超出了嵌入式和移动平台的承受能力。尽管存在轻量级替代方案,但它们几乎 exclusively 在单一域、自监督范式中开发,在域偏移(domain shift)下表现不佳。我们提出了 ZipDepth,这是一种紧凑的单目深度网络,通过结合高效的可重参数化编码器-解码器,并在大规模多域训练集上从基础模型进行大规模知识蒸馏,从而填补了这一空白。ZipDepth 仅包含 610 万个参数,从服务器 GPU 到功耗受限设备均能以实时速率运行,在五个基准测试中实现了轻量级模型在零样本精度与部署效率之间的最佳权衡,朝着拥有 50 倍更多参数的基础模型的精度迈出了重要一步。

1 引言

单目深度估计长期以来一直被认为是计算机视觉中最病态(ill-posed)的问题之一:单个 2D 图像可能对应无限多种 3D 场景,仅靠几何推理不足以解决这种歧义。然而,它仍然是许多现实世界应用中的一项关键能力。

第 2 页

2 F. Tosi 等人

大型基础模型 更好 20 嵌入式 (< 2.5J / 帧) 领域 轻量级ZipDepth ( ours )模型 是

18 推理速度

5 FPS → 更低 16 20 FPS (%) 14 35 FPS 误差 12

10 更好的效率 AbsRel 和 精度

8 平均 103 104 105 每帧能耗 (mJ) → 越低越好 图 2: 能量–精度权衡。NVIDIA Jetson Orin NX (15W) 上的零样本深度模型。每帧能耗 (FP32 推理) 与平均 AbsRel (跨越 5 个数据集);气泡大小表示 FPS。ZipDepth 弥合了轻量级模型与基础模型之间的差距,在 < 400 mJ/帧 的预算下趋向于其精度。† 表示在我们的多域训练集上重新训练的轻量级基线,以进行公平比较。

系统,包括自动驾驶汽车、机器人操作、增强现实和场景重建,这些场景需要准确、密集的深度信息,而无需承担主动感知的成本或复杂性。 早期的基于学习的方法彻底改变了这一问题。监督方法 [5,18,20] 证明了仅凭外观线索,CNN 就能恢复出合理的深度,而自监督公式 [22, 26, 106] 通过在训练时利用视图间的光度一致性,消除了对真实标注的依赖。然而,这两种范式都局限于特定的训练分布,通常是单个数据集、传感器或场景类别,而在其训练域之外使用时表现不佳。 最近基础模型的涌现从根本上改变了这一局面。通过利用强大的预训练编码器,如 DINOv2 [48] 和大型 Vision Transformers [16],或在数十亿图像上预训练的扩散骨干网络 [63],诸如 Depth Anything v2 [94]、Marigold [38] 和 Metric3D [33] 等方法,在室内、室外和合成场景中都实现了鲁棒的零样本泛化。然而,这种泛化带来了巨大的成本,不仅限于推理时间:这些模型需要数十个高端 GPU 和数周的训练才能构建,包含 3–9 亿参数,并且每次前向传播需要数百至数千 GFLOPs。在部署时,这些模型对于资源受限的硬件来说根本不切实际:作为一个代表性例子,Depth Anything v2-Large 在 15W 的 Jetson Orin NX 上仅能以 0.3 FPS 运行,并且在智能手机硬件上完全不可用。这并不是例外,因为此类中的所有基础模型都共享相同的基本约束,使其无法用于在严格能量预算下要求实时推理的应用,例如无人机导航、移动 AR、边缘监控以及嵌入式系统上的 SLAM。有趣的是,正是

第 3 页

ZipDepth 3

其准确性和广泛的知识使其成为蒸馏框架中训练更小、更易于部署的网络的理想教师。轻量级深度网络 [53, 88, 102] 代表了该谱系的另一端。这些网络仅包含 100 万至 800 万个参数,并采用优化的卷积架构,能够在 CPU 和嵌入式加速器上实现实时推理。然而,它们的关键局限性在于,它们几乎完全是在单一领域的自监督范式下开发的——仅在 KITTI [23] 或 NYUv2 [69] 上进行训练和评估——并且在域偏移(domain shift)下表现出严重的精度下降。因此,在现有文献中,效率和零样本泛化(Zero-Shot Generalization)在很大程度上仍是不兼容的特性。

我们认为,弥合这一差距需要同时在训练数据和架构两个方面取得进展。让紧凑的网络接触到来自强大教师的大量多样化监督是必要的,但还不够。架构设计也必须能够在严格的参数和延迟预算内提取最大量的语义内容。这有助于保留细粒度的结构,如深度不连续性和物体边界,而这些结构在过度压缩的表示中容易丢失。这两个要素都至关重要,但它们的组合却得到了令人惊讶的少关注。

为了解决这一问题,我们提出了 ZipDepth,这是一种轻量级单目深度网络,专为在嵌入式部署约束下实现零样本跨域泛化而设计。ZipDepth 使用来自 Depth Anything v2-Large [94] 的大规模知识蒸馏(Knowledge Distillation)进行训练,训练数据涵盖 1410 万张图像,跨越 17 个异构领域。其训练设置仅需两台 NVIDIA RTX 3090 GPU 运行三天,这与训练基础模型通常需要的数十台高端 GPU 形成鲜明对比。 resulting 的 610 万参数网络结合了硬件自适应凸上采样(Convex Upsampling),以在全分辨率下保留精确的深度边界,如图 1 所示,并且可以直接导出到 TensorRT、CoreML 和 ONNX Runtime,无需进行图手术(graph surgery)。在推理阶段,ZipDepth 在从服务器 GPU 到嵌入式设备和手机的广泛硬件平台上均能实时运行,在轻量级模型中实现了零样本精度与部署效率之间最佳的整体权衡(见图 2),同时缩小了与基础模型之间的差距。

总之,我们做出了以下贡献:

– 我们识别并解决了轻量级单目深度估计中的零样本泛化(Zero-Shot Generalization)问题,证明了当仔细考虑训练数据的多样性和架构设计时,效率和跨域精度并非互斥。 – 我们提出了 ZipDepth,这是一种紧凑的编码器-解码器架构,结合了可重参数化(Reparameterizable)卷积块与硬件自适应凸上采样,在 610 万参数的推理就绪预算内生成全分辨率深度图。 – 通过在五个零样本基准测试和九个硬件平台上的广泛评估,我们证明 ZipDepth 的统一设计在轻量级模型中实现了最佳的精度-效率权衡,尽管它仅使用两台消费级 GPU 进行训练。

第 4 页

4 F. Tosi 等

2 相关工作

2.1 单目深度估计

早期的单目深度估计工作依赖于小规模、特定领域数据集上的监督学习。Eigen 等人 [18] 提出了第一种基于 CNN 的方法,采用由粗到细的架构,并在 NYU Depth v2 [69] 上进行训练。随后的方法通过结构化预测(使用 CRFs [44, 98])、基于分类的公式化方法 [4, 5, 20] 以及定制化的损失函数(包括基于梯度的 [42, 81] 和仿射不变目标 [61])改进了这一范式,但仍受限于其训练集有限的多样性。

为了克服真实深度标注的成本高昂和稀缺问题,自监督方法将深度估计重构为图像重建任务,利用更广泛可用的立体图像对 [22,25,56,57] 或单目视频序列 [106],无需深度标签。这一范式通过特征级重建 [1, 70, 101]、代理深度监督 [2,75,86]、几何约束 [7,100] 以及通过不确定性 [54]、运动掩码 [26,76] 和光流 [62,96] 处理动态物体的策略得到了逐步完善。虽然自监督解锁了对更大且更多样化训练语料库的访问权限,但这一时期的监督方法和自监督方法仍然在单一领域上进行训练和评估,限制了它们在无约束场景下的泛化能力。

2.2 零样本泛化与基础模型

下一个范式转变来自于扩展数据和架构以实现跨域泛化。开创性工作 [42, 61] 从异构来源聚合深度标签——激光雷达 [23]、RGB-D 传感器 [69]、运动恢复结构 [42]、立体匹配 [61,89] 和众包标注 [11]——使用仿射不变损失进行训练,以调和它们不同的深度尺度和分布。采用基于 Transformer 的编码器(如 MiDaS v3 / DPT [60] 和 Omnidata [17])进一步提升了零样本性能。

这一方向最终体现在基于海量数据训练的基础模型上:Depth Anything [93] 利用 DINOv2 [48] 编码器,通过扩展训练过程至约 6200 万张无标签图像来实现;其继任者 Depth Anything v2 [94] 则通过合成到真实的蒸馏优化了协议。与此同时,生成式方法将扩散模型 [30,63] 重新用于密集预测:Marigold [38] 针对深度估计微调了 Stable Diffusion,GeoWizard [21] 将其扩展至联合深度-法线估计,后续工作探索了基于扩散的细化 [103]、激光雷达引导的去噪 [80]、对具有挑战性的分布外条件的鲁棒性 [41,58,59,78,99] 以及简化的密集预测协议 [28,45]。视频一致性深度估计也日益受到关注 [10,34,37,67]。

一个紧密相关的方向致力于度量深度恢复,即预测绝对单位下的深度,而非仅预测到未知的尺度和平移。ZoeDepth [6] 引入了一个结合相对和度量头的两阶段框架,而 Metric3D [95] 及其继任者 [33] 则根据相机内参对预测进行条件约束,以解决不同数据集之间的尺度歧义。UniDepth [51,52] 联合

第 5 页

ZipDepth 5

从单张图像中预测深度和相机参数,而 DepthPro [8] 实现了高分辨率下清晰且度量准确的深度图。其他工作将问题框架为单目点云图估计,直接恢复每个像素的 3D 坐标 [82–84]。

然而,相对深度和度量深度基础模型均存在根本性的部署限制。它们依赖于庞大的预训练视觉 Transformer 骨干网络:Depth Anything v2-Large 拥有约 3.35 亿参数,DepthPro 约 9.33 亿参数,Metric3D v2 约 3.06 亿参数,而基于扩散的方法通过 U-Net 上的迭代去噪进一步增加了成本,其参数量约为 8.6 亿。即使是最小的可用变体(例如,约 2500 万参数的 ViT-Small)也超出了 CPU 和低功耗嵌入式平台的计算预算。此外,这些架构针对高端 GPU 上的吞吐量进行了优化,而对延迟、内存占用或硬件可移植性关注甚少,而这些正是边缘部署的关键要求。

2.3 轻量级深度估计

准确深度网络的计算需求促使人们开展了一条专注于高效架构的独立研究路线,该路线几乎完全在自监督框架内进行。早期的工作通过紧凑的编码器-解码器设计 [53, 88] 和网络剪枝,证明了在嵌入式硬件上进行深度推理的可行性,在树莓派 [53] 或 NVIDIA Jetson TX2 [88] 等受限平台上实现了实时推理。后续工作继续通过更小的骨干网络 [12, 49, 50]、边缘引导注意力模块 [64] 以及平衡局部和全局特征提取且开销有限的混合 CNN-Transformer 架构 [102, 104] 来减少参数量。与此同时,几项研究调查了此类轻量级网络在消费级设备上的部署,证实了它们在手持硬件上实时运行的能力 [3, 55]。尽管在效率方面取得了这些进展,但存在一个根本性的限制:轻量级模型仅在单一域(通常是 KITTI [23])上通过自监督损失进行训练,这使得学习到的表示与特定的相机设置和场景分布紧密绑定。跨域评估一致表明,当这些网络部署到其训练分布之外时,精度会出现严重下降 [47, 71–73]。因此,该领域呈现出鲜明的两极分化:零样本泛化需要大规模模型,而实时部署需要小模型,且目前没有现有方法能同时满足这两项要求。

ZipDepth 旨在解决这一张力。我们并未扩大架构或训练数据,而是通过教师-学生协议,将基础模型(Depth Anything v2-Large [94])所捕获的跨域知识蒸馏到一个紧凑的、可重参数化 (训练多分支,推理融合) 的 CNN 中。这将泛化能力与模型容量解耦,产生了一个网络,它在各种基准测试中保持了零样本泛化 (Zero-Shot Generalization) 精度,同时能够在 GPU、CPU 和嵌入式系统上实现实时推理。

第 6 页

6 F. Tosi 等

编码器流 RGB 图像 Rep 骨干网络 上下文聚合

分裂主干 阶段 1 阶段 2 阶段 3 阶段 4 SPPF 跨 尺度 ConvBN x2 2𝗑QARepBlock ↓2+2𝗑QARepBlock ↓2+6𝗑QARepBlock ↓2+2𝗑QARepBlock 3𝗑Pool5𝗑5 S1/2: 24ch H/2 C=48 H/4 C=48 H/8 C=192 H/16 C=384 H/16 btlnk C/4 S3 ↔S4 S1/4: 48ch H/4 多尺度 StripPool SE 注意力 GCBlock

3 𝗑H 𝗑W S1/2 S1 S2 S3 f4

深度图 凸上采样 融合 融合 融合 融合 卷积 头 融合 f3 f4 f1/2 f2 f1 S=2 𝗑feat:f1/2 卷积 投影→288ch S3+↑f4→192ch S1+↑f2→96ch 3𝗑3 S1/2+↑f1→32ch S2+↑f3→144ch 11 Mobile GPU/TRT H/16 H/4 H/2 H/8 H/32 d1/2 H/2 α∙nn + 9S2 ∙softmax + unfold (1- α)∙双线性 H 𝗑W 渐进式解码器 解码器流

图 3: ZipDepth 架构概述。编码器(顶部,左→右)通过四个可重参数化阶段对输入进行逐步下采样;解码器(底部,右→左)自粗到细融合多尺度特征,并通过硬件自适应凸上采样生成全分辨率逆深度图。

3 方法

如图 3 所示,ZipDepth 旨在在严格的延迟和硬件约束下最大化深度精度。所有架构选择均限制为在 TensorRT、CoreML 和 NNAPI 运行时中具有原生支持的算子,导出时不需要自定义算子。给定 RGB 图像 $x \in \mathbb{R}^{3 \times H \times W}$,网络通过两个联合优化的组件生成全分辨率仿射不变逆深度图 $\hat{d} \in \mathbb{R}^{H \times W}$:(i) 一个四阶段分层编码器,优先在逐步降低的空间分辨率下进行鲁棒的特征提取;(ii) 一个精简的解码器,采用硬件自适应凸上采样,在全分辨率下保持深度边界。经过 Conv-BN 融合后,模型在推理时的参数量仅为 6.1M。

3.1 编码器

分裂主干。标准轻量级骨干网络通常在第一个阶段之前应用两个连续的步长为 2 的卷积,将空间分辨率降低至 H/4,且不保留任何中间表示。我们将中间 2 倍分辨率的激活保留为到解码器的专用跳跃连接:

\m a thbf {s}_{1/ 2} = \ oper a torname {ConvBN }_{s=2}(\mathbf

其中 $C_1 = 48$。$s_{1/2}$ 为解码器提供边界线索,而无需在编码器内部维护全分辨率特征图的成本;$s_{1/4}$ 进入阶段 1。

可重参数化骨干网络。编码器产生步长为 $\{4, 8, 16, 32\}$ 的特征图。基本构建块是一个可重参数化单元 [15],它在训练期间维护三个并行分支:

h B { \sigma \!\ igl(1) \m a t bf {f } _\ t ext o ut } =

第 7 页

ZipDepth 7

其中 $W_3$ 和 $W_1$ 分别为 $3\times3$ 和 $1\times1$ 卷积核,BN 表示批量归一化,$\sigma$ 为 ReLU 激活函数,$\mathbb{I}[C_{in}=C_{out}]$ 为恒等快捷连接(identity shortcut),仅当输入和输出通道数匹配时激活。在推理阶段,这三个分支通过代数融合合并为单个带有吸收偏置的 $3\times3$ 卷积,这是一种无损操作,适用于网络中的每一个 ConvBN 层。融合后,模型主要由普通卷积、池化和逐元素操作组成,使其能够直接导出至 TensorRT、CoreML 和 ONNX Runtime,而无需进行图结构修改。第 1 阶段完全由这些可重参数化块组成,步长为 4;后续阶段在此基础上通过添加下文描述的额外模块来增强设计。

多尺度上下文(第 2 阶段)。为了在不使用标准空洞卷积的情况下扩大感受野(大多数移动 NPU 对于非单位步长的空洞卷积缺乏高效的融合内核),第 2 阶段附加了一个仅使用深度可分离卷积的轻量级并行空洞模块:

$$ \mathbf{f} \leftarrow \mathbf{f} + \sum_{r \in \{1, 2\}} \text{DWConv}_r(\mathbf{f}) \quad (2) $$

其中 $r$ 表示空洞率。融合后的 $r=1$ 和 $r=2$ 深度可分离卷积核在几乎不增加参数量的情况下,覆盖了高达 $5\times5$ 的有效感受野。

条带池化注意力(第 2 阶段)。条带池化层 [31] 捕获长程水平和垂直上下文。原始公式使用限制在 $[1, 2]$ 范围内的加法门控来调制特征,这只能起到放大作用。我们将其替换为对称的 Sigmoid 门控:

$$ \mathbf{f} \leftarrow \mathbf{f} \odot \sigma(W_g \cdot [\bar{\mathbf{f}}_H, \bar{\mathbf{f}}_W]) \quad (3) $$

其中 $\bar{\mathbf{f}}_H \in \mathbb{R}^{B \times C \times H \times 1}$ 和 $\bar{\mathbf{f}}_W \in \mathbb{R}^{B \times C \times 1 \times W}$ 分别是水平和垂直条带平均值,并广播至完整的空间维度,$W_g$ 为深度可分离的 $1\times1$ 投影。该模块具有 $O(N)$ 复杂度,仅使用池化和深度可分离卷积,映射到所有目标运行时原生支持的算子。

通道和全局上下文(第 3 阶段)。第 3 阶段在最后的可重参数化块之后附加了两个互补的注意力模块。首先,Squeeze-and-Excitation [32] 通道注意力根据全局平均池化统计信息重新校准特征通道。其次,Global Context 块 [9] 通过 softmax 加权的空间池化聚合单个场景级上下文向量:

$$ \mathbf{c} = \text{Transform}\left( \sum_{i} \frac{\exp(\mathbf{q}^T \mathbf{k}_i)}{\sum_{j} \exp(\mathbf{q}^T \mathbf{k}_j)} \mathbf{v}_i \right) \quad (4) $$

其中 Transform 是一个缩减率为 4 的轻量级瓶颈结构。与全自注意力不同(在嵌入式硬件上处理此分辨率时计算量过大),GC 块具有 $O(N)$ 复杂度。

第 4 阶段。第 4 阶段应用两个可重参数化块(公式 (1)),步长为 32,生成最粗糙的特征图 $\mathbf{f}_4 \in \mathbb{R}^{B \times C_4 \times H/32 \times W/32}$。

第 8 页

8 F. Tosi 等

表 1:ZipDepth 网络结构分解。我们比较训练参数(包括可重参数化分支)与推理参数(融合后)。Stride 表示空间下采样(H/S)。

组件(机制) Stride 参数 (训练 → 推理) 占比

编码器 Stem + 阶段 1 (RepVGG) 4 58 K → 53 K 0.9% 阶段 2 (+SPA) 8 234 K → 210 K 3.4% 阶段 3 (+SE, GCB) 16 2.43 M → 2.19 M 35.6% 阶段 4 32 3.69 M → 3.32 M 54.0% SPPF + 跨尺度 – 222 K → 222 K 3.6%

解码器 FPN 融合 (轻量级) 4-32 150 K → 150 K 2.4% 头部 + 凸上采样 1 3 K → 3 K 0.1%

总模型 6.79 M → 6.14 M 100%

SPPF 和跨尺度细化。在编码器之后,一个轻量级的空间金字塔池化-快速(SPPF)[29,36] 模块在 C4/4 通道瓶颈投影上级联三个 5×5 最大池化操作,以在最低分辨率表示中捕获多尺度上下文。随后的双向跨尺度模块通过分组 1×1 卷积在阶段 3 和阶段 4 之间交换信息,使最粗糙的语义能够细化中层特征,反之亦然。

3.2 解码器

渐进式多尺度融合。解码器通过级联的轻量级融合模块,从粗到细地融合编码器特征。每个模块通过分组 1×1 卷积对高分辨率编码器跳跃连接和上采样的较粗糙特征进行投影,并将它们相加: \ mathb f {f} _ l = \ op eratorn ame(5) 其中组数选择为输入和输出通道数共同的最大除数(最大为 4),从而减少内存带宽。通道宽度从 stride 32 处的 3Cdec 减少到 stride 4 处的 Cdec,使解码器保持在总模型参数的 3% 以下(详见表 1)。

高分辨率跳跃连接。在四级融合降至 stride 4 后,分割的 stem 跳跃连接 s1/2 通过专用的融合模块在 stride 2 处进行融合:

a \m a thbf {f}_{ 1/2} = \o per to r name {ReLU}\!\bigl(6) 其中 Chalf = 32。随后,一个 3×3 卷积头部预测半分辨率的中间深度图: \ha t {d}_{1/2} = \operatorname(7) 最终的 full-resolution 图通过单次 2× 上采样步骤生成,从而产生有效输出 stride 为 1 的流水线。

第 9 页

ZipDepth 9

硬件自适应凸上采样。全分辨率深度是通过仅对 $f_{1/2}$ 进行条件约束的上采样获得的。我们提供了两条计算路径,在训练前根据目标硬件进行选择。

GPU/TensorRT 路径。我们采用文献 [74] 中的凸上采样方法,并针对单目深度进行了适配。卷积头预测一个邻域内的逐像素掩码 $M \in \mathbb{R}^{B \times 9 \times S^2 \times H \times W}$,并通过沿邻域维度进行归一化:$M = \text{softmax}(M/\tau)$。邻域 $N_k(\hat{d}_{1/2})$ 是通过带有复制填充(replicate padding)的 unfold 操作提取的,上采样后的深度为:

$$ \hat{d} = \text{ReLU} \left( \sum_{k} M_k \cdot N_k(\hat{d}_{1/2}) \right) \quad (8) $$

Softmax 保证了凸组合,使每个输出值限制在其局部邻域内。该路径依赖于 unfold、softmax 和 PixelShuffle 算子,这些算子在 GPU 运行时得到了良好优化,但在移动 NPU 和 DSP 上并不总是作为融合原语得到支持。

NPU/移动端路径。我们提供了一种仅使用标准 Conv2D 和插值算子的硬件友好替代方案。一个可学习的门控机制混合了最近邻和双线性上采样:

$$ \alpha = \sigma(g_\alpha) \quad (10) $$

其中 $g_\alpha$ 通过一个 $1\times1$ 通道缩减、一个深度可分离的 $5\times5$ 卷积以及一个投影到单通道的 $1\times1$ 卷积来预测门控值,前两个操作后均跟随 BN 和 ReLU。门控 $\alpha$ 在边缘不连续处倾向于最近邻插值,而在平滑区域倾向于双线性插值。在两条路径中,最终的 ReLU 在推理时都会融合到前一个卷积操作中。

3.3 训练目标

我们采用 MiDaS [61] 和 Depth Anything v2 [94] 的尺度与平移不变(SSI)目标。在计算任何损失之前,预测值和目标值通过有效像素上的逐图像中位数和中位数绝对偏差(MAD)归一化进行对齐,从而消除单目深度监督中固有的仿射歧义。

总损失为:

$$ \mathcal{L} = \lambda_{\text{ssi}} \mathcal{L}_{\text{ssi}} + \lambda_{\text{grad}} \mathcal{L}_{\text{grad}} \quad (11) $$

其中 $\mathcal{L}_{\text{ssi}}$ 是归一化预测值与目标值之间的平均绝对误差,$\mathcal{L}_{\text{grad}}$ 是多尺度梯度损失。权重 $\lambda_{\text{ssi}} = 1.0$ 和 $\lambda_{\text{grad}} = 2.0$ 遵循 Depth Anything v2 的配置。

4 实验

我们首先描述训练和评估协议,在五个零样本基准测试中将 ZipDepth 与大型和轻量级模型进行比较,对关键组件进行消融实验,分析在九个硬件平台上的部署性能,并展示在挑战性场景下的定性结果。更多细节见补充材料。

第 10 页

10 F. Tosi 等

4.1 实现细节与协议

训练数据。我们在涵盖多样化场景类别的 17 个真实世界图像数据集集合上进行训练:Object365 [68]、ADE20K [105]、COCO [43]、SA-1B [39]、OpenImages v7 [40]、Google Landmarks [87]、MegaDepth [42]、Mapillary [46]、Cityscapes [13]、BDD100K [97]、DrivingStereo [92]、Gated2Depth [27]、Trans10K [91]、Flickr1024 [85]、HRWSI [90]、HoloPix50K [35] 和 ACDC [65]。对于最大的数据源,我们使用了子集;总训练池包含约 1410 万张图像。深度伪标签使用 Depth Anything v2-Large [94] 作为教师模型离线生成。为了抵消数据集规模的不平衡,我们采用温度缩放的域平衡采样器(见补充材料)。

训练计划。我们在 PyTorch 中实现 ZipDepth,并遵循三阶段渐进式分辨率协议。模型首先在 256×256 分辨率下训练 10 个 epoch,每张 GPU 的批量大小为 192,峰值学习率为 2×10⁻³。随后在 384×384 分辨率下微调 5 个 epoch(每张 GPU 批量大小为 128,峰值学习率为 5×10⁻⁴),最后在 512×512 分辨率下训练 3 个 epoch(每张 GPU 批量大小为 96,峰值学习率为 2.5×10⁻⁴)。每个阶段均从前一个阶段的检查点初始化。学习率在前半个 epoch 内线性预热,随后余弦退火至峰值的 1%。遵循 [61,94] 的做法,每张训练图像首先被调整大小,使其最短边匹配目标分辨率,然后提取随机方形裁剪。以 0.5 的概率应用水平翻转。未使用其他数据增强技术。在推理时,最短边被调整大小为 384 像素,同时保持原始纵横比。所有训练均在两台 NVIDIA RTX 3090 GPU 上进行。

评估协议。我们遵循 Marigold [38] 的评估方法。我们在训练期间未见过的五个真实世界数据集上进行测试:NYUv2 [69](654 张室内图像)、ScanNet [14](来自验证场景的 800 个样本)、KITTI [24](来自 Eigen 分割 [19] 的 652 张街景图像)、ETH3D [66](454 个高分辨率样本)和 DIODE [79](325 个室内和 446 个室外样本)。由于我们的模型生成仿射不变深度,预测值首先通过最小二乘拟合与真实值对齐。随后我们报告两个标准指标:绝对平均相对误差(AbsRel/AR)和 δ1 精度(满足 max(ai/di, di/ai) < 1.25 的像素百分比)。所有评估分割和代码均取自 [38]。

基线。我们考虑了四个具有代表性的轻量级基线:LiteMono [102]、GuideDepth [64]、FastDepth [88] 和 PyDNet [53]。由于这些网络最初是在单个域(例如 KITTI)上以自监督方式训练的,直接评估其发布的权重无法反映跨域泛化能力。为了提供公平评估,从而将架构差异与训练数据隔离开来,只要可能,我们就使用与 ZipDepth 相同的训练协议和计划在我们的训练集上重新训练所有这些模型。由于架构限制导致无法精确复制时,我们通过匹配批量大小和总训练迭代次数来近似该协议。相比之下,基础预训练模型使用其官方权重进行零样本泛化评估。

第 11 页

ZipDepth 11

表 2:零样本深度估计:在 Jetson Orin NX (15W 模式) 上的精度和嵌入式效率。大型基础模型使用官方预训练权重。轻量级模型在相同的训练数据上从头重新训练,不使用预训练编码器,以便在等效监督下进行公平比较。AbsRel 越低越好,δ1 越高越好。每类别最佳:第 1 名、第 2 名、第 3 名。下划线加粗:总体最佳。我们的 ZipDepth 架构使用 GPU 上采样路径进行测试和性能分析。

| Model | Efficiency | NYUv2 | KITTI | ETH3D | ScanNet | DIODE | | :— | :— | :— | :— | :— | :— | :— | | | Param MACs FPS E/frame AR δ1 AR δ1 AR δ1 AR δ1 AR δ1 | | | | | | | | (M) (G) Orin (mJ) ↓ ↑ ↓ ↑ ↓ ↑ ↓ ↑ ↓ ↑ | | | | | |

Large Pretrained Models

DPT-Hybrid [60] 122.4 128.01 1.7 8187.5 9.3 91.5 13.2 84.2 9.6 92.6 8.9 92.5 21.8 73.7 DPT-Large [60] 343.0 258.5 0.7 19950.6 9.1 91.9 11.0 88.2 9.0 92.8 8.4 93.1 21.6 74.4 Omnidata-v2 [17] 123.1 121.9 1.7 8330.4 6.7 95.7 14.3 81.0 6.8 95.7 6.4 95.5 27.3 77.6 Marigold [38] 899.2 6205.0 – – 6.6 95.3 11.5 87.0 6.4 96.1 6.8 94.9 25.7 79.7 DA-V2-Small [94] 24.8 57.8 2.2 6740.3 6.1 96.2 8.4 93.4 6.3 96.7 5.2 97.2 21.4 75.9 DA-V2-Base [94] 97.5 190.6 0.8 17556.2 5.4 96.7 8.2 93.9 5.4 97.6 4.5 97.7 21.3 76.5 DA-V2-Large [94] 335 652.7 0.3 54457.1 5.1 97.1 7.7 94.9 5.1 97.8 4.2 98.0 21.0 76.7

Lightweight Embedded Models († retrained)

Lite-Mono [102] † 8.3 13.5 7.3 1883.5 8.7 92.7 10.9 89.5 8.7 93.6 9.6 90.2 22.4 72.9 MiDaS-Small [61] 21.3 4.6 20.1 683.8 11.5 86.8 25.9 54.3 13.4 83.7 10.8 87.9 24.2 71.1 GuideDepth [64] † 5.8 5.1 16.6 860.0 9.2 91.8 14.9 80.6 10.2 91.9 9.6 90.5 22.7 72.4 FastDepth [88] † 4.0 2.2 28.9 483.2 10.3 89.8 16.8 74.3 12.3 87.2 11.0 87.6 23.4 71.0 PyDNet [53] † 1.9 5.5 34.8 398.0 11.4 87.1 12.9 84.9 10.4 90.6 11.7 85.8 23.4 70.8

ZipDepth (ours) 6.1 3.0 34.4 396.6 8.4 93.3 12.3 86.4 10.0 92.2 8.8 92.1 22.6 73.9

4.2 与最先进方法的比较

表 2 将 ZipDepth 与大型预训练模型和轻量级架构在五个零样本基准测试上进行了比较。对于精度评估,使用原始基准图像;效率指标在固定的 384×384 输入下测量。每个模型在内部将输入调整为其原生分辨率(例如,DA-V2 为 518,MiDaS-Small 为 256)。所有模型均在 FP32 精度下进行评估。

精度。 在轻量级模型中,ZipDepth 在每个基准测试中均排名第一或第二,在 NYUv2 (8.4) 和 ScanNet (8.8) 上取得了最佳的 AR,并在 DIODE 上取得了最高的 δ1 (73.9)。最强的轻量级竞争对手 Lite-Mono 在 KITTI 和 ETH3D 上超过了 ZipDepth,但其 GMACs 高出 4.5 倍,吞吐量低 4.7 倍。图 4 证实了这一分析,突显了与其他轻量级模型相比,ZipDepth 揭示了更精细的细节和更少的伪影。与教师模型 [94] 相比,ZipDepth 自然无法达到其精度。具体而言,差距范围从 DIODE 上的 ~1.6 AR 到 KITTI 上的 ~4.6,但其参数量减少了 55 倍,计算量减少了 200 倍以上。

效率。 表 2 还报告了在 15 W 功耗模式下的 Jetson Orin NX 上每个模型的效率,这是电池或热受限平台的典型设置。仅 6.1M 参数和 3.0 GMACs,ZipDepth 就达到了 34.4 FPS 和每帧 ~397 mJ 的能耗,比 DA-V2-Small (6.7 J, 57.8 GMACs) 少 17 倍以上,比 DA-V2-Large (54.5 J, 652.7 GMACs) 少 137 倍,这使得基础模型在能量是硬性约束的场景中不切实际。在轻量级模型中,只有 PyDNet 实现了相当的吞吐量,但

第 12 页

12 F. Tosi 等

输入 DA-V2-L [94] Lite-Mono [102] FastDepth [88] PyDNet [53] 本文方法 NYUv2

KITTI ETH3D ScanNet

DIODE

图 4:定性比较。各方法在五个未见基准测试集上预测的深度图。所有轻量级模型均在相同数据上重新训练。DA-V2-Large 教师模型作为大模型参考展示。

表 3:消融实验。所有变体均使用相同的训练计划和数据进行训练。运行时间在 Jetson Orin NX (15 W 模式) 下,分辨率为 384 × 384 时测量。

NYUv2 KITTI ETH3D ScanNet DIODE 配置 FPS↑ mJ↓ AR↓ δ1↑ AR↓ δ1↑ AR↓ δ1↑ AR↓ δ1↑ AR↓ δ1↑

完整模型 (本文) 8.4 93.3 12.3 86.4 10.0 92.2 8.8 92.1 22.6 73.9 34.4 396.6

无 SE + GCBlock 8.7 92.9 12.6 86.1 10.3 91.8 9.2 91.8 22.8 73.5 36.2 377.2 无 SPPF + 跨尺度 9.0 92.4 13.1 84.8 10.6 91.4 9.0 91.5 23.0 73.1 36.5 375.8 无半分辨率路径 9.1 91.5 13.8 85.6 11.2 90.1 10.3 90.4 23.8 71.6 48.9 271.8

精度显著降低。因此,ZipDepth 在此类方法中提供了最佳的精度-效率权衡,结合了实时推理以及在多样室内和室外场景下具有竞争力的零样本泛化能力。

4.3 消融实验

我们现在对 ZipDepth 的架构组件、上采样策略以及训练数据的规模进行消融分析。

架构组件。表 3 隔离了各架构组件在全部五个基准测试集上的贡献。从 Stage 3 中移除 SE 和 GC 注意力机制会导致精度轻微下降,但带来的加速效果微乎其微,这证实了这些模块提供了有利的每 FLOP 精度权衡。禁用 SPPF 和跨尺度细化会产生更大的影响,特别是在

第 13 页

ZipDepth 13

表 4:数据规模消融实验(AbsRel↓ / δ1 ↑)。相同的模型和训练设置;仅改变 1410 万张图像训练集的比例。

数据量 NYUv2 KITTI ETH3D ScanNet DIODE

1% (∼0.1M) 12.2 / 84.9 12.1 / 86.6 12.2 / 87.9 13.2 / 82.4 24.7 / 69.1 10% (∼1.4M) 10.0 / 89.8 12.1 / 86.9 11.0 / 90.0 10.9 / 87.6 23.9 / 70.9 25% (∼3.5M) 9.9 / 90.0 12.4 / 86.6 10.6 / 90.1 10.8 / 88.2 23.7 / 71.3 50% (∼7.0M) 9.6 / 90.6 12.6 / 85.6 10.7 / 90.4 10.5 / 88.4 23.6 / 71.5 100% (∼14.1M) 8.4 / 93.3 12.3 / 86.4 10.0 / 92.2 8.8 / 92.1 22.6 / 73.9

KITTI 数据集,其中多尺度上下文对于具有大深度范围的场景至关重要。 半分辨率跳跃路径贡献最大:如果没有它,所有基准测试的精度都会下降,因为全分辨率预测恢复了由步长为 4 的解码器输出所丢失的更精细的空间细节。该变体也是最快的(48.9 FPS,能耗降低 32%),突显了步长为 2 的融合阶段和凸上采样的成本,这种权衡在极端功耗受限的场景中可能是可以接受的。

上采样策略。表 5 将提出的凸上采样(GPU 和 NPU 路径)与简单的双线性插值进行了比较。在 NYUv2 和 KITTI 上的标准指标几乎相同,因为深度边界仅占像素的一小部分,并且在真实世界的地面真值中经常缺失或不准确。为了隔离对边缘的影响,我们评估了来自 [8] 的尺度不变边界 F1 指标(SI-BF1),测试对象是来自 UnrealStereo4K [77] 的 1000 张合成图像,该数据集提供了密集且像素级准确的地面真值。GPU 路径得分为 0.120,而双线性插值为 0.088(+36%),证实了更好的深度不连续性(定性差异可见于图 5);NPU 路径(0.105)恢复了大部分增益,同时保持与移动加速器的兼容性。在 CPU 上,基于 unfold 的 GPU 路径显著更慢(25.6 对比 44.6 FPS),而在 iPhone ANE 上,NPU 路径快 1.56 倍(375 对比 240 FPS),这证明了硬件自适应设计的动机。

数据规模。为了隔离数据规模的贡献,我们在完整的 1410 万张图像集的不同比例(从 1% (∼0.1M) 到 100% (∼14.1M))上训练 ZipDepth,保持架构、教师模型和训练协议固定。表 4 报告了所有五个基准测试的精度。在五个基准测试中的四个中,性能随数据规模增加而一致提升,其中 NYUv2 和 ScanNet 的提升最大,证实了紧凑的架构有效地利用了大规模知识蒸馏,而不是在小数据范围内饱和。KITTI 是例外:超过 10% 的子集后,其 AbsRel 在狭窄的 ∼0.5 范围内波动(12.1–12.6),这与噪声而非系统性趋势一致,因为其驾驶场景领域已经由较小比例的数据池充分覆盖。这些结果支持我们的核心假设,即仅靠架构效率不足以实现强大的零样本泛化性能,广泛的跨领域监督对于缩小零样本差距至关重要。

第 14 页

14 F. Tosi 等

表 5:对比——全分辨率上采样策略。NYUv2 和 KITTI 上的精度。边界 F1 (SI-BF1) 基于 UnrealStereo4K [77] 中的 1000 张合成图像进行评估,使用 [8] 中的尺度不变边界度量。越高越好。⋆ONNX Runtime,Intel Core i7-11800H(8 核,45W)。†Jetson Orin NX 16GB(15W),PyTorch 融合 FP32。♢CoreML,iPhone 12 ANE(6W)。

NYUv2 KITTI Unreal4K FPS↑ 上采样 AR↓ δ1↑ AR↓ δ1↑ SI-BF1↑(%) CPU⋆ GPU† NPU♢

双线性 8.3 93.2 12.2 86.5 0.088 47.4 40.3 415 凸上采样 – NPU 路径 8.3 93.2 12.2 86.5 0.105 44.6 34.1 375 凸上采样 – GPU 路径 8.4 93.3 12.3 86.4 0.120 25.6 34.8 240

(a) RGB 输入 (b) 双线性上采样 (c) 凸上采样 图 5:上采样策略的定性对比。双线性插值会使边界过度平滑并去除细微结构。相比之下,凸上采样保留了更清晰的轮廓和更好的边缘定位,且无振铃伪影。

4.4 部署效率

表 6 对 ZipDepth 在九个硬件平台上的性能进行了剖析,这些平台的功耗跨度达两个数量级,从 350 W 的服务器 GPU 到 5 W 的智能手机。基础列报告了每个平台最简单的后端,优化列报告了测试中最快的配置(完整剖析见补充材料)。经过 Conv-BN 和可重参数化分支融合后,ZipDepth 在 PyTorch 中已在所有 GPU 平台上实现实时运行;TensorRT FP16 带来了高达 5 倍的速度提升,在服务器硬件上达到超过 1300 FPS,在嵌入式 Jetson 上达到 77 FPS。在 Apple 设备上,Neural Engine 上的 CoreML 达到 240–360 FPS,而面向 NPU 的变体(第 3.2 节)将其几乎翻倍,在 iPhone 12 上达到 375 FPS,在 iPad Pro M4 上达到 715 FPS,验证了硬件自适应设计的有效性。同一路径将服务器 CPU 上的吞吐量从 50 提升至 75 FPS,而在低端 Xiaomi 设备上,通过 TFLite GPU,ZipDepth 在 Android 上达到 16 FPS,证实了即使在没有专用 NPU 加速的情况下也具有可行性。

4.5 挑战性场景的定性结果

我们进一步在单目深度估计中 notoriously difficult(臭名昭著地困难)的不利条件下对 ZipDepth 进行了定性评估。图 6 展示了来自 DA-2K [94] 的恶劣天气、航拍、透明/反射以及水下场景的预测结果。尽管其预算紧凑,ZipDepth 即使在极端条件下也能恢复出连贯的结构。补充材料中提供了更多定性结果。

第 15 页

ZipDepth 15

表 6:ZipDepth(6.1M 参数)在 384×384 分辨率下的运行时间。∗PyTorch 融合 FP32,在 Conv-BN 和可重参数化分支融合后(针对 CPU 设备的 CPU 推理)。‡ TensorRT FP16。▲ONNX Runtime 配合对 NPU 友好的上采样路径。∥CoreML ANE。♢CoreML ANE 配合对 NPU 友好的上采样路径。⊛TFLite GPU FP16。所有测量值均为 20 次预热迭代后 200 次前向传播的中位延迟。

设备 (TDP) 类别 FPS (基础) FPS (优化)

NVIDIA RTX 3090 (350 W) 服务器 GPU 389∗ 1317‡ NVIDIA RTX 3070 Laptop (140 W) 笔记本 GPU 351∗ 773‡ Jetson Orin NX (50 W) 嵌入式 GPU 118∗ 196‡ Jetson Orin NX (15 W) 嵌入式 GPU 34∗ 77‡ AMD EPYC 7443 (200 W) 服务器 CPU 50∗ 75▲ Intel i7-11800H (45 W) 笔记本 CPU 40∗ 45▲ iPad Pro M4 (10 W) 移动 NPU 360∥ 715♢ iPhone 12 A14 (6 W) 移动 NPU 240∥ 375♢ Xiaomi Poco X3 NFC (5 W) 移动 GPU 16⊛ –

恶劣天气 航拍 反光 水下

图 6:野外零样本深度估计。ZipDepth 在具有挑战性的 DA-2K [94] 场景上的表现,其泛化能力远超其评估领域。无真实值可用。

5 结论

我们提出了 ZipDepth,这是一种轻量级单目深度网络,它结合了基础模型的零样本泛化能力与嵌入式部署的效率需求。通过结合可重参数化编码器、硬件自适应凸上采样以及在多域数据集上的大规模知识蒸馏,ZipDepth 在轻量级模型中实现了最佳的精度-效率权衡,能够从服务器 GPU 到手机实现实时运行。

局限性与未来工作。尽管结果具有竞争力,但 ZipDepth 无法匹敌那些利用数量级更多参数和计算量的基础模型的精度。在视频处理中,由于缺乏帧间一致性,它会出现时间闪烁,这是单图像模型中常见的问题。通过改进蒸馏、添加轻量级时间模块以及扩展到度量深度或点图预测来缩小精度差距,是自然的下一步工作。

致谢。作者感谢 ISCRA 倡议下的 CINECA 奖项,为其提供高性能计算资源的访问权限。

第 16 页

16 F. Tosi 等人

参考文献

1. Aleotti, F., Tosi, F., Poggi, M., Mattoccia, S.: 用于无监督单目深度预测的生成对抗网络。在:欧洲计算机视觉会议 (ECCV) 研讨会论文集。第 0–0 页 (2018) 4 2. Aleotti, F., Tosi, F., Zhang, L., Poggi, M., Mattoccia, S.: 逆转循环:通过增强单目蒸馏实现自监督深度立体视觉。在:欧洲计算机视觉会议。第 614–632 页。Springer (2020) 4 3. Aleotti, F., Zaccaroni, G., Bartolomei, L., Poggi, M., Tosi, F., Mattoccia, S.: 使用手持设备在野外实现实时单目深度感知。Sensors 21(1), 15 (2020) 5 4. Bhat, S.F., Alhashim, I., Wonka, P.: Adabins:使用自适应二值进行深度估计。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 4009–4018 页 (2021) 4 5. Bhat, S.F., Alhashim, I., Wonka, P.: Localbins:通过学习局部分布改进深度估计。在:计算机视觉–ECCV 2022:第 17 届欧洲会议,以色列特拉维夫,2022 年 10 月 23–27 日,论文集,第一部分。第 480–496 页。Springer (2022) 2, 4 6. Bhat, S.F., Birkl, R., Wofk, D., Wonka, P., Müller, M.: Zoedepth:通过结合相对深度和度量深度实现零样本迁移。arXiv 预印本 arXiv:2302.12288 (2023) 4 7. Bian, J., Li, Z., Wang, N., Zhan, H., Shen, C., Cheng, M.M., Reid, I.: 从单目视频中进行无监督尺度一致性深度和自运动学习。在:神经信息处理系统进展。第 32 卷 (2019) 4 8. Bochkovskii, A., Delaunoy, A., Germain, H., Santos, M., Zhou, Y., Richter, S.R., Koltun, V.: Depth pro:不到一秒钟的锐利单目度量深度。arXiv 预印本 arXiv:2410.02073 (2024) 5, 13, 14 9. Cao, Y., Xu, J., Lin, S., Wei, F., Hu, H.: Gcnet:非局部网络与挤压激励网络及 beyond。在:IEEE/CVF 国际计算机视觉研讨会论文集。第 0–0 页 (2019) 7 10. Chen, S., Guo, H., Zhu, S., Zhang, F., Huang, Z., Feng, J., Kang, B.: Video depth anything:超长视频的一致性深度估计。在:计算机视觉与模式识别会议论文集。第 22831–22840 页 (2025) 4 11. Chen, W., Fu, Z., Yang, D., Deng, J.: 野外单目深度感知。神经信息处理系统进展 29 (2016) 4 12. Cipolletta, A., Peluso, V., Calimera, A., Poggi, M., Tosi, F., Aleotti, F., Mattoccia, S.: 低功耗 CPU 上的能量-质量可扩展单目深度估计。IEEE 物联网期刊 9(1), 25–36 (2021) 5 13. Cordts, M., Omran, M., Ramos, S., Rehfeld, T., Enzweiler, M., Benenson, R., Franke, U., Roth, S., Schiele, B.: 用于语义城市场景理解的城市景观数据集。在:IEEE 计算机视觉与模式识别会议论文集 (CVPR) (2016) 10 14. Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nießner, M.: Scan-net:富含注释的室内场景 3D 重建。在:IEEE 计算机视觉与模式识别会议论文集。第 5828–5839 页 (2017) 10 15. Ding, X., Zhang, X., Ma, N., Han, J., Ding, G., Sun, J.: Repvgg:让 VGG 风格的卷积神经网络再次伟大。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 13733–13742 页 (2021) 6

第 17 页

ZipDepth 17

16. Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., 等:An image is worth 16×16 words: Transformers for image recognition at scale. arXiv 预印本 arXiv:2010.11929 (2020) 2 17. Eftekhar, A., Sax, A., Malik, J., Zamir, A.: Omnidata: A scalable pipeline for making multi-task mid-level vision datasets from 3d scans. 在:IEEE/CVF 国际计算机视觉会议论文集。第 10786–10796 页 (2021) 4, 11 18. Eigen, D., Fergus, R.: Predicting Depth, Surface Normals and Semantic Labels with a Common Multi-scale Convolutional Architecture. 在:国际计算机视觉会议。第 2650–2658 页 (2015)。https://doi.org/10.1109/ICCV.2015.304 2, 4 19. Eigen, D., Puhrsch, C., Fergus, R.: Depth map prediction from a single image using a multi-scale deep network. 神经信息处理系统进展 27 (2014) 10 20. Fu, H., Gong, M., Wang, C., Batmanghelich, K., Tao, D.: Deep ordinal regression network for monocular depth estimation. 在:IEEE 计算机视觉与模式识别会议论文集。第 2002–2011 页 (2018) 2, 4 21. Fu, X., Yin, W., Hu, M., Wang, K., Ma, Y., Tan, P., Shen, S., Lin, D., Long, X.: Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image. 在:欧洲计算机视觉会议。第 241–258 页。Springer (2024) 4 22. Garg, R., Kumar, V., Carneiro, G., Reid, I.: Unsupervised CNN for Single View Depth Estimation: Geometry to the Rescue. 在:欧洲计算机视觉会议。第 740–756 页 (2016) 2, 4 23. Geiger, A., Lenz, P., Stiller, C., Urtasun, R.: Vision meets robotics: The KITTI dataset. 国际机器人研究杂志 32(11), 1231–1237 (2013)。https://doi.org/10.1177/0278364913491297 3, 4, 5 24. Geiger, A., Lenz, P., Stiller, C., Urtasun, R.: Vision meets robotics: The kitti dataset. 国际机器人研究杂志 32(11), 1231–1237 (2013) 10 25. Godard, C., Aodha, O.M., Brostow, G.J.: Unsupervised Monocular Depth Estimation with Left-Right Consistency. 计算机视觉与模式识别会议第 6602–6611 页 (2017)。https://doi.org/10.1109/CVPR.2017.699 4 26. Godard, C., Aodha, O.M., Firman, M., Brostow, G.: Digging Into Self-Supervised Monocular Depth Estimation. 国际计算机视觉会议 2019-Octob, 3827–3837 (2019)。https://doi.org/10.1109/ICCV.2019.00393 2, 4 27. Gruber, T., Julca-Aguilar, F., Bijelic, M., Heide, F.: Gated2depth: Real-time dense lidar from gated images. 在:IEEE 国际计算机视觉会议 (ICCV) (2019) 10 28. He, J., Li, H., Yin, W., Liang, Y., Li, L., Zhou, K., Liu, H., Liu, B., Chen, Y.C.: Lotus: Diffusion-based visual foundation model for high-quality dense prediction. arXiv 预印本 arXiv:2409.18124 (2024) 4 29. He, K., Zhang, X., Ren, S., Sun, J.: Spatial pyramid pooling in deep convolutional networks for visual recognition. IEEE 模式分析与机器智能汇刊 37(9), 1904–1916 (2015) 8 30. Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models (2020) 4 31. Hou, Q., Zhang, L., Cheng, M.M., Feng, J.: Strip pooling: Rethinking spatial pooling for scene parsing. 在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 4003–4012 页 (2020) 7

第 18 页

18 F. Tosi 等

32. Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 7132–7141 (2018) 7 33. Hu, M., Yin, W., Zhang, C., Cai, Z., Long, X., Chen, H., Wang, K., Yu, G., Shen, C., Shen, S.: Metric3d v2: A versatile monocular geometric foundation model for zero-shot metric depth and surface normal estimation. IEEE Transactions on Pattern Analysis and Machine Intelligence 46(12), 10579–10596 (2024) 2, 4 34. Hu, W., Gao, X., Li, X., Zhao, S., Cun, X., Zhang, Y., Quan, L., Shan, Y.: Depthcrafter: Generating consistent long depth sequences for open-world videos. arXiv preprint arXiv:2409.02095 (2024) 4 35. Hua, Y., Kohli, P., Uplavikar, P., Ravi, A., Gunaseelan, S., Orozco, J., Li, E.: Holopix50k: A large-scale in-the-wild stereo image dataset. arXiv preprint arXiv:2003.11172 (2020) 10 36. Jocher, G.: Ultralytics yolov5 (2020). https://doi.org/10.5281/zenodo. 3908559, https://github.com/ultralytics/yolov5 8 37. Ke, B., Narnhofer, D., Huang, S., Ke, L., Peters, T., Fragkiadaki, K., Obukhov, A., Schindler, K.: Video depth without video models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025) 4 38. Ke, B., Obukhov, A., Huang, S., Metzger, N., Daudt, R.C., Schindler, K.: Repur- posing diffusion-based image generators for monocular depth estimation. In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recog- nition (CVPR) (2024) 2, 4, 10, 11 39. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., et al.: Segment anything. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 4015–4026 (2023) 10 40. Kuznetsova, A., Rom, H., Alldrin, N., Uijlings, J., Krasin, I., Pont-Tuset, J., Kamali, S., Popov, S., Malloci, M., Kolesnikov, A., Duerig, T., Ferrari, V.: The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale. IJCV (2020) 10 41. Li, W., Huang, J., Jung, H., Zhai, G., Ramirez, P.Z., Costanzino, A., Tosi, F., Poggi, M., Di Stefano, L., Weibel, J.B., et al.: Tricky 2025 housecat6d object pose estimation challenge with specular and transparent surfaces. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 3292–3302 (2025) 4 42. Li, Z., Snavely, N.: Megadepth: Learning single-view depth prediction from in- ternet photos. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 2041–2050 (2018) 4, 10 43. Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollár, P., Zitnick, C.L.: Microsoft coco: Common objects in context. In: European confer- ence on computer vision. pp. 740–755. Springer (2014) 10 44. Liu, F., Shen, C., Lin, G.: Deep convolutional neural fields for depth estimation from a single image. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 5162–5170 (2015) 4 45. Martin Garcia, G., Abou Zeid, K., Schmidt, C., de Geus, D., Hermans, A., Leibe, B.: Fine-tuning image-conditional diffusion models is easier than you think. In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) (2025) 4

第 19 页

ZipDepth 19

46. Neuhold, G., Ollmann, T., Rota Bulo, S., Kontschieder, P.: The mapillary vistas dataset for semantic understanding of street scenes. In: Proceedings of the IEEE international conference on computer vision. pp. 4990–4999 (2017) 10 47. Obukhov, A., Poggi, M., Tosi, F., Arora, R.S., Spencer, J., Russel, C., Hadfield, S., Bowden, R., Wang, S., Ma, Z., et al.: The fourth monocular depth estima- tion challenge. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 6182–6195 (2025) 5 48. Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., et al.: Dinov2: Learning robust visual features without supervision. arXiv preprint arXiv:2304.07193 (2023) 2, 4 49. Peluso, V., Cipolletta, A., Calimera, A., Poggi, M., Tosi, F., Aleotti, F., Mattoccia, S.: Monocular depth perception on microcontrollers for edge applications. IEEE Transactions on Circuits and Systems for Video Technology 32(3), 1524–1536 (2021) 5 50. Peluso, V., Cipolletta, A., Calimera, A., Poggi, M., Tosi, F., Mattoccia, S.: En- abling energy-efficient unsupervised monocular depth estimation on armv7-based platforms. In: 2019 Design, Automation & Test in Europe Conference & Exhibi- tion (DATE). pp. 1703–1708. IEEE (2019) 5 51. Piccinelli, L., Sakaridis, C., Yang, Y.H., Segu, M., Li, S., Abbeloos, W., Van Gool, L.: Unidepthv2: Universal monocular metric depth estimation made simpler. arXiv preprint arXiv:2502.20110 (2025) 4 52. Piccinelli, L., Yang, Y.H., Sakaridis, C., Segu, M., Li, S., Van Gool, L., Yu, F.: Unidepth: Universal monocular metric depth estimation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 10106– 10116 (2024) 4 53. Poggi, M., Aleotti, F., Tosi, F., Mattoccia, S.: Towards real-time unsupervised monocular depth estimation on cpu. In: 2018 IEEE/RSJ international conference on intelligent robots and systems (IROS). pp. 5848–5854. IEEE (2018) 3, 5, 10, 11, 12 54. Poggi, M., Aleotti, F., Tosi, F., Mattoccia, S.: On the Uncertainty of Self- Supervised Monocular Depth Estimation. In: Conference on Computer Vision and Pattern Recognition. pp. 3224–3234 (2020). https://doi.org/10.1109/ CVPR42600.2020.00329 4 55. Poggi, M., Tosi, F., Aleotti, F., Mattoccia, S.: Real-time self-supervised monocular depth estimation without gpu. IEEE Transactions on Intelligent Transportation Systems 23(10), 17342–17353 (2022) 5 56. Poggi, M., Tosi, F., Batsos, K., Mordohai, P., Mattoccia, S.: On the synergies between machine learning and binocular stereo for depth estimation from images: a survey. IEEE Transactions on Pattern Analysis and Machine Intelligence 44(9), 5314–5334 (2021) 4 57. Poggi, M., Tosi, F., Mattoccia, S.: Learning monocular depth estimation with un- supervised trinocular assumptions. In: 2018 International conference on 3d vision (3DV). pp. 324–333. IEEE (2018) 4 58. Ramirez, P.Z., Tosi, F., Di Stefano, L., Timofte, R., Costanzino, A., Poggi, M., Salti, S., Mattoccia, S., Min, J., Tu, J., et al.: Ntire 2026 challenge on high- resolution depth of non-lambertian surfaces. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 2786–2801 (2026) 4 59. Ramirez, P.Z., Tosi, F., Di Stefano, L., Timofte, R., Costanzino, A., Poggi, M., Salti, S., Mattoccia, S., Zhang, Z., Yang, Y., et al.: Ntire 2025 challenge on hr

第 20 页

20 F. Tosi 等

来自镜面和透明表面图像的深度估计。见:计算机视觉与模式识别会议论文集。页码 987–1001 (2025) 4 60. Ranftl, R., Bochkovskiy, A., Koltun, V.: 用于密集预测的视觉变换器。 见:IEEE/CVF 国际计算机视觉会议论文集。 页码 12179–12188 (2021) 4, 11 61. Ranftl, R., Lasinger, K., Hafner, D., Schindler, K., Koltun, V.: 迈向鲁棒的单目深度估计:混合数据集以实现零样本跨数据集迁移。 IEEE 模式分析与机器智能汇刊 44(3), 1623–1637 (2020) 4, 9, 10, 11 62. Ranjan, A., Jampani, V., Balles, L., Kim, K., Sun, D., Wulff, J., Black, M.J.: 竞争协作:深度、相机运动、光流和运动分割的联合无监督学习。见:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 12240–12249 (2019) 4 63. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: 使用潜在扩散模型进行高分辨率图像合成。见:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 10684–10695 (2022) 2, 4 64. Rudolph, M., Dawoud, Y., Güldenring, R., Nalpantidis, L., Belagiannis, V.: 通过引导解码实现轻量级单目深度估计。见:2022 年机器人与自动化国际会议 (ICRA)。页码 2344–2350。IEEE (2022) 5, 10, 11 65. Sakaridis, C., Dai, D., Van Gool, L.: Acdc:具有语义驾驶场景理解对应关系的恶劣条件数据集。见:IEEE/CVF 国际计算机视觉会议论文集。页码 10765–10775 (2021) 10 66. Schops, T., Schonberger, J.L., Galliani, S., Sattler, T., Schindler, K., Pollefeys, M., Geiger, A.: 一个具有高分辨率图像和多相机视频的多视图立体基准。见:IEEE 计算机视觉与模式识别会议 (CVPR) 论文集 (2017 年 7 月) 10 67. Shao, J., Yang, Y., Zhou, H., Zhang, Y., Shen, Y., Guizilini, V., Wang, Y., Poggi, M., Liao, Y.: 从视频扩散先验中学习时序一致的视频深度。见:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集 (2025) 4 68. Shao, S., Li, Z., Zhang, T., Peng, C., Yu, G., Zhang, X., Li, J., Sun, J.: Objects365:一个大规模、高质量的目标检测数据集。见:IEEE/CVF 国际计算机视觉会议论文集。页码 8430–8439 (2019) 10 69. Silberman, N., Hoiem, D., Kohli, P., Fergus, R.: 从 RGBD 图像进行室内分割和支持推理。见:欧洲计算机视觉会议。页码 746– 760。Springer (2012) 3, 4, 10 70. Spencer, J., Bowden, R., Hadfield, S.: DeFeat-Net:通过同时无监督表示学习实现通用单目深度估计。见:计算机视觉与模式识别会议。页码 14390–14401 (2020)。https://doi.org/10. 1109/CVPR42600.2020.01441 4 71. Spencer, J., Qian, C.S., Russell, C., Hadfield, S., Graf, E., Adams, W., Schofield, A.J., Elder, J.H., Bowden, R., Cong, H., 等:单目深度估计挑战赛。见:IEEE/CVF 计算机视觉应用冬季会议论文集。页码 623–632 (2023) 5 72. Spencer, J., Qian, C.S., Trescakova, M., Russell, C., Hadfield, S., Graf, E.W., Adams, W.J., Schofield, A.J., Elder, J., Bowden, R., 等:第二届单目

第 21 页

ZipDepth 21

深度估计挑战。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 3064–3076 页 (2023) 5 73. Spencer, J., Tosi, F., Poggi, M., Arora, R.S., Russell, C., Hadfield, S., Bowden, R., Zhou, G., Li, Z., Rao, Q., 等:第三届单目深度估计挑战。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 1–14 页 (2024) 5 74. Teed, Z., Deng, J.: Raft: 用于光流的循环全对场变换。在: 欧洲计算机视觉会议。第 402–419 页。Springer (2020) 9 75. Tosi, F., Aleotti, F., Poggi, M., Mattoccia, S.: 注入传统立体知识以学习单目深度估计。计算机视觉与 模式识别会议 2019 年 6 月,第 9791–9801 页 (2019)。https://doi.org/10.1109/ CVPR.2019.01003 4 76. Tosi, F., Aleotti, F., Ramirez, P.Z., Poggi, M., Salti, S., Stefano, L.D., Mattoc- cia, S.: 用于从视频进行综合场景理解的蒸馏语义。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 4654–4665 页 (2020) 4 77. Tosi, F., Liao, Y., Schmitt, C., Geiger, A.: Smd-nets: 立体混合密度网络。在:IEEE/CVF 计算机视觉与 模式识别会议论文集。第 8942–8952 页 (2021) 13, 14 78. Tosi, F., Ramirez, P.Z., Poggi, M.: 用于单目深度估计的扩散模型:克服挑战性条件。在:欧洲计算机视觉 会议。第 236–257 页。Springer (2024) 4 79. Vasiljevic, I., Kolkin, N., Zhang, S., Luo, R., Wang, H., Dai, F.Z., Daniele, A.F., Mostajabi, M., Basart, S., Walter, M.R., 等:Diode: 一个密集的室内和室外深度数据集。arXiv 预印本 arXiv:1908.00463 (2019) 10 80. Viola, M., Qu, K., Metzger, N., Ke, B., Becker, A., Schindler, K., Obukhov, A.: Marigold-dc: 带有引导扩散的零样本单目深度补全 (2024) 4 81. Wang, C., Lucey, S., Perazzi, F., Wang, O.: 用于从动态场景进行深度预测的网络立体视频监督。在:2019 年国际 3D 视觉会议 (3DV)。第 348–357 页。IEEE (2019) 4 82. Wang, R., Xu, S., Dai, C., Xiang, J., Deng, Y., Tong, X., Yang, J.: Moge: 通过最佳训练监督解锁开放域图像 的准确单目几何估计。arXiv 预印本 arXiv:2410.19115 (2024) 5 83. Wang, R., Xu, S., Dong, Y., Deng, Y., Xiang, J., Lv, Z., Sun, G., Tong, X., Yang, J.: Moge-2: 具有度量尺度和清晰细节的准确单目几何估计。 arXiv 预印本 arXiv:2507.02546 (2025) 5 84. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r: 简化几何 3D 视觉。在:IEEE/CVF 计算机视觉与模式识别会议论文集。 第 20697–20709 页 (2024) 5 85. Wang, Y., Wang, L., Yang, J., An, W., Guo, Y.: Flickr1024: 一个用于立体图像超分辨率的大规模数据集。在:IEEE/CVF 国际 计算机视觉研讨会论文集。第 0–0 页 (2019) 10 86. Watson, J., Firman, M., Brostow, G., Turmukhambetov, D.: 自监督单目深度提示。在:2019 IEEE/CVF 国际计算机视觉会议 (ICCV)。第 2162–2171 页 (2019)。https://doi.org/10.1109/ICCV. 2019.00225 4 87. Weyand, T., Araujo, A., Cao, B., Sim, J.: Google Landmarks Dataset v2 – 用于实例级识别和检索的大规模基准。在:Proc. CVPR (2020) 10

第 22 页

22 F. Tosi 等

88. Wofk, D., Ma, F., Yang, T.J., Karaman, S., Sze, V.: Fastdepth: 嵌入式系统上的快速单目深度估计。在:2019 年国际机器人与自动化会议 (ICRA)。页码 6101–6108。IEEE (2019) 3, 5, 10, 11, 12 89. Xian, K., Shen, C., Cao, Z., Lu, H., Xiao, Y., Li, R., Luo, Z.: 基于网络立体数据监督的单目相对深度感知。在:IEEE 计算机视觉与模式识别会议论文集。页码 311–320 (2018) 4 90. Xian, K., Zhang, J., Wang, O., Mai, L., Lin, Z., Cao, Z.: 用于单图像深度预测的结构引导排序损失。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 611–620 (2020) 10 91. Xie, E., Wang, W., Wang, W., Ding, M., Shen, C., Luo, P.: 分割野外透明物体。arXiv 预印本 arXiv:2003.13948 (2020) 10 92. Yang, G., Song, X., Huang, C., Deng, Z., Shi, J., Zhou, B.: Drivingstereo: 自动驾驶场景中立体匹配的大规模数据集。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 899–908 (2019) 10 93. Yang, L., Kang, B., Huang, Z., Xu, X., Feng, J., Zhao, H.: Depth anything: 释放大规模无标签数据的潜力。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 10371–10381 (2024) 4 94. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2。神经信息处理系统进展 37, 21875–21911 (2024) 2, 3, 4, 5, 9, 10, 11, 12, 14, 15 95. Yin, W., Zhang, C., Chen, H., Cai, Z., Yu, G., Wang, K., Chen, X., Shen, C.: Metric3d: 迈向从单张图像进行零样本度量 3D 预测。在:IEEE/CVF 国际计算机视觉会议论文集。页码 9043–9053 (2023) 4 96. Yin, Z., Shi, J.: Geonet: 密集深度、光流和相机姿态的无监督学习。在:IEEE 计算机视觉与模式识别会议论文集。页码 1983–1992 (2018) 4 97. Yu, F., Chen, H., Wang, X., Xian, W., Chen, Y., Liu, F., Madhavan, V., Darrell, T.: Bdd100k: 用于异构多任务学习的多样化驾驶数据集。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 2636–2645 (2020) 10 98. Yuan, W., Gu, X., Dai, Z., Zhu, S., Tan, P.: 用于单目深度估计的神经窗口全连接 CRFs。在:2022 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。页码 3906–3915 (2022)。https://doi.org/10.1109/CVPR52688.2022.00389 4 99. Zama Ramirez, P., Costanzino, A., Tosi, F., Poggi, M., Di Stefano, L., Weibel, J.B., Bauer, D., Antensteiner, D., Vincze, M., Li, J., 等:Tricky 2024 镜面和透明表面图像单目深度挑战。在:欧洲计算机视觉会议。页码 248–266。Springer (2024) 4 100. Zama Ramirez, P., Poggi, M., Tosi, F., Mattoccia, S., Di Stefano, L.: 几何与语义结合用于半监督单目深度估计。在:亚洲计算机视觉会议。页码 298–313。Springer (2018) 4 101. Zhan, H., Garg, R., Weerasekera, C.S., Li, K., Agarwal, H., Reid, I.M.: 基于深度特征重建的单目深度估计和视觉里程计的无监督学习。计算机视觉与模式识别会议 页码 340–349 (2018)。https://doi.org/10.1109/CVPR.2018.00043 4 102. Zhang, N., Nex, F., Vosselman, G., Kerle, N.: Lite-mono: 用于自监督单目深度估计的轻量级 CNN 和 Transformer 架构。在:

第 23 页

ZipDepth 23

计算机视觉与模式识别 IEEE/CVF 会议论文集。页码 18537–18546 (2023) 3, 5, 10, 11, 12 103. Zhang, X., Ke, B., Riemenschneider, H., Metzger, N., Obukhov, A., Gross, M., Schindler, K., Schroers, C.: Betterdepth: 用于零样本单目深度估计的即插即用扩散细化器。arXiv 预印本 arXiv:2407.17952 (2024) 4 104. Zhao, C., Zhang, Y., Poggi, M., Tosi, F., Guo, X., Zhu, Z., Huang, G., Tang, Y., Mattoccia, S.: Monovit: 基于视觉变换器的自监督单目深度估计。在:2022 年国际 3D 视觉会议 (3DV)。页码 668–678。 IEEE (2022) 5 105. Zhou, B., Zhao, H., Puig, X., Xiao, T., Fidler, S., Barriuso, A., Torralba, A.: 通过 ADE20K 数据集理解场景语义。国际计算机视觉杂志 127(3), 302–321 (2019) 10 106. Zhou, T., Brown, M., Snavely, N., Lowe, D.G.: 从视频中无监督学习深度和自运动。计算机视觉与模式识别会议 页码 6612–6619 (2017)。https://doi.org/10.1109/CVPR.2017.700 2, 4

发表评论