三分钟导读:Wat3R提出了一种跨域半监督学习框架,利用合成数据和未标注真实视频,无需水下3D标注即可将VGGT适配至水下场景,并引入跨视图一致性损失以应对水体退化。
英文题目:Wat3R: Underwater 3D Geometry Learning without Annotations
论文出处:arXiv 每日论文精选 · arXiv:2607.08772
原始论文:PDF / 论文页面
对应视频标题:Wat3R:无标注水下3D重建,VGGT水下适配新范式|推荐指数:★★★★★
这篇论文解决什么问题?
水下环境存在光衰减、散射及视图依赖退化,且缺乏大规模高质量3D标注,导致现有基于陆地数据的Feed-forward 3D重建模型泛化能力差。
核心创新
- 首个无需水下3D标注的半监督VGGT适配框架,仅利用未标注真实视频实现领域适应。
- 提出Cross-View Consistent Loss,利用其他视图的几何线索补偿当前视图因水体退化导致的信息丢失。
- 构建Water3D数据集,包含42个场景,提供深度和位姿标注,覆盖多样水下条件。
方法概览
基于Mean Teacher半监督范式,使用物理渲染合成水下数据作为有标签数据,真实水下视频作为无标签数据。教师网络生成伪标签监督学生网络,结合序列级增强和跨视图一致性损失进行训练。
逐图理解论文
Wat3R核心方法

Wat3R提出一种跨域半监督学习框架,基于Mean Teacher范式。它使用物理渲染合成水下数据作为有标签数据,真实水下视频作为无标签数据。教师网络生成伪标签监督学生网络,结合序列级增强和跨视图一致性损失进行训练,无需任何水下3D标注即可实现领域适应。
Water3D数据集

为支持研究,作者构建了Water3D数据集,包含42个场景,提供深度和位姿标注,覆盖多样水下条件。与现有水下数据集相比,Water3D在场景规模和标注完整性上具有显著优势,为水下3D重建研究提供了新的基准。
多视图深度估计性能

在Sea-thru数据集上,Wat3R的相对误差为0.167,优于VGGT的0.190,提升12.1%。在FLSea Stereo上,相对误差为0.119,优于VGGT的0.137,提升13.1%。这些结果表明,Wat3R在多视图深度估计任务上显著优于现有基线方法。
Water3D数据集评估

在Water3D数据集上,Wat3R的整体平均误差为0.427,显著优于VGGT的0.624,提升31.6%。这一结果验证了Wat3R在真实水下场景中的泛化能力,以及半监督学习框架在缺乏标注情况下的有效性。
位姿估计与单目深度

在SeaThru-NeRF上,Wat3R的AUC@5°为0.540,优于VGGT的0.392,提升37.8%。在SQUID数据集上,相对误差为0.107,优于VGGT的0.194,提升44.8%。这些指标表明,Wat3R在位姿估计和单目深度估计任务上均具有显著优势。
实验与关键结果
- 在Sea-thru, FLSea Stereo, SQUID, SeaThru-NeRF及Water3D上进行多视图深度估计、点云重建、位姿估计和单目深度估计评估。
- 对比基线包括VGGT, DA3, MapAnything, π3, Fast3r及水下专用方法(WaterSplatting, Udepth等)。
- 消融实验验证了合成数据、真实视频、序列增强、跨视图损失及静态掩码的有效性。
- 在Sea-thru, FLSea Stereo, SQUID, SeaThru-NeRF及Water3D上进行多视图深度估计、点云重建、位姿估计和单目深度估计评估。
- 对比基线包括VGGT, DA3, MapAnything, π3, Fast3r及水下专用方法(WaterSplatting, Udepth等)。
- 消融实验验证了合成数据、真实视频、序列增强、跨视图损失及静态掩码的有效性。
阅读时需要注意
- 处理高动态元素(如移动海洋生物、潜水员)能力有限,需额外建模时间动态。
- 在开阔水域、高浑浊度或极深场景中,可靠匹配结构稀疏,静态掩码抑制不可靠区域但也减少了学习信号,限制性能。
- 水下图像增强(UIE)作为预处理步骤并未带来显著几何估计提升,甚至可能引入信息损失或视图不一致性。
- 模型在极端退化条件下性能下降,尽管比基线更鲁棒,但仍受限于可见性。
关联工作
- VGGT:基础模型,提供陆地几何先验(第 5 页)
- DA3:强基线,具有深度-射线表示(第 13 页)
- WaterSplatting:水下专用Splatting方法,依赖初始化点云(第 11 页)
- COLMAP:经典SfM管线,水下鲁棒性差(第 22 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Wat3R:无需标注的水下3D几何学习
任江伟,姜星宇†,宋子杰,徐伟,林宏凯, 梁丁康,白翔
华中科技大学 {jwren,jiangxy998,dkliang,xbai}@hust.edu.cn
摘要。由于光线衰减、散射以及缺乏大规模高质量3D标注,在水下环境中估计3D几何结构面临着独特的挑战。开创性的方法依赖于大量密集标注,这在水下环境中是不切实际的。在本文中,我们提出了Wat3R,这是一种跨域半监督学习框架,旨在将前馈式3D重建模型从空中场景适应到水下场景。独特的是,我们的方法采用教师-学生架构,消除了对任何标注水下数据的需求,未标注的真实视频片段仅用于学习鲁棒的水下几何表示。我们还设计了一种跨视图一致性损失,利用来自其他视图的几何线索来补偿由水体衰减和散射引起的当前视图中的信息退化。此外,考虑到缺乏全面的评价基准,我们构建了Water3D,这是一个涵盖各种水体和水下场景的多样化数据集,专为几何任务评估而设计。实验结果表明,Wat3R在水下多视图深度估计和点云重建方面优于当前的最先进方法。数据集和代码可在 https://github.com/LSXI7/Wat3R 获取。
关键词:水下视觉,几何估计,VGGT,跨域半监督学习
1 引言
水下视觉几何估计旨在从多视角水下图像中恢复3D结构,包括相机位姿、深度和点云。这种能力支撑着从水下机器人导航和避障到海洋测绘、地形建模以及水下考古等实际应用 [18,25]。与陆地场景不同,水下环境由于光的吸收和散射以及视图相关的退化而呈现出独特的挑战。这些物理困难进一步导致该领域大规模高质量3D标注的严重稀缺 [29],给训练高性能模型带来了巨大挑战。
† 通讯作者。
第 2 页
2 J. Ren 等
单目深度估计 点云图
era m 位姿 Water3D 多视图 Ca De 深 E 度 VI 估 计 模 型 FLSea Sea-thru n 参考图像 Wat3R
SQUID 单目深度估计 模型
Wat3R 𝜋3 DA3 VGGT VGGT DA3 (本文方法) (ICLR'26) (ICLR'26) (CVPR'25)
多视图 3D 重建
6 个视图
Wat3R VGGT DA3 … 50 个视图
Wat3R VGGT DA3
图 1: Wat3R 以前馈式方式从开放域水下图像中进行重建,无需任何水下 3D 标注。我们的 Wat3R 在单视图和多视图任务中均实现了显著的性能提升。统计结果也表明,Wat3R 的性能优于当前最先进方法 (SOTA)。
近年来,3D 视觉经历了从经典多视图几何管线到前馈式神经重建模型的范式转变。DUSt3R [41]、VGGT [40] 及其后续方法 [6, 19, 39, 47] 等先进方法在单次前向传播中恢复 3D 几何结构方面展现了卓越的性能。这些模型从包含密集 3D 真实标签(即相机位姿和深度)的海量陆地数据集中学到了强大的几何先验。然而,由于存在显著的域偏移,直接将这些强大的模型部署到水下场景中会导致泛化能力较差。此外,难以获取真实水下数据的密集 3D 标签,也阻碍了针对水下环境定制的有效且可泛化模型的直接训练。 为了解决上述困境,我们提出了 Wat3R,这是一种半监督框架,无需任何水下 3D 标注即可将 VGGT 适配到水下领域。如图 1 所示,我们的方法能够在具有复杂水况的水下场景中实现前馈式重建。遵循教师-学生 (Teacher-Student) 学习范式,我们首先模拟各种水下退化
第 3 页
Wat3R 3
标注 数据集 场景数 深度 位姿
SeaThru [3] 5 ✓ – SQUID [4] 4 ✓ – FLSea VI [29] 12 ✓ – FLSea Stereo [29] 5 ✓ – 背景颜色 SeaThru-NeRF [20] 4 – ✓ 分布 Water3D (Ours) 42 ✓ ✓
图 2:我们构建的 Water3D 数据集概览。左侧:Water3D 的点云可视化及背景颜色分布。右侧:现有水下数据集在场景规模和可用标注方面的对比。我们的 Water3D 包含各种水下条件,并具备深度和位姿标注。
利用现有的带标注陆地数据集(VGGT 的原始训练集)作为所需的标注数据,这有助于为水下环境初始化强大的几何先验。为了进一步微调并将模型泛化到真实水下领域,我们还收集了大量真实水下视频片段作为无标签训练集。此外,为了解决由水体衰减和散射引起的视觉退化问题,我们引入了 Cross-view Consistent Loss(跨视图一致性损失),该损失利用来自其他视图的几何线索来补偿当前视图中的信息退化。考虑到现有水下基准测试中标注不完整且覆盖范围不足,我们构建了 Water3D,其中包含广泛的水下条件和场景,并具备正确的相机位姿和深度信息,如图 2 所示。在公共数据集和我们构建的 Water3D 上的大量实验表明,我们的 Wat3R 显著优于强大的基线方法和最近的前馈式替代方案,即使在能见度较差的水下区域也能提供鲁棒的性能。 总之,我们的贡献如下:
– 我们提出了 Wat3R,这是第一个基于 VGGT 的半监督框架,能够在不需要水下 3D 标注的情况下泛化到多样化的水下场景。它提供了一种实用的范式,仅利用无标签的真实视频即可在其他复杂环境中进行几何学习。 – 我们引入了 Cross-View Consistent Loss(跨视图一致性损失),通过聚合来自其他相关视图的信息作为补偿,使得从严重退化区域学习几何线索变得容易。 – 我们构建了 Water3D,这是一个具有全面 3D 标注的水下多视图数据集。它包含多样化的水下条件。
2 相关工作
2.1 前馈式 3D 重建模型
经典的 3D 重建建立在多视图几何和优化管道之上。其中,相机位姿和场景结构是通过特征匹配、对极几何和全局细化来恢复的 [1, 9–11,
第 4 页
4 J. Ren 等
14, 32, 33]。这些系统实现了高精度和可扩展性。然而,它们依赖于复杂的多阶段流程和迭代优化,导致计算成本高,且在水下场景等具有挑战性的成像条件下鲁棒性有限。最近的工作将 3D 重建转向前馈式推理。DUSt3R [41] 开创了这一范式,直接从图像对中回归密集几何结构,无需已知的相机位姿。MASt3R [19] 增强了用于对应和配准的 3D 先验。后续方法 [6, 28, 39, 42, 47] 逐步将该框架扩展至多视图推理、更高效率以及面向 SLAM 的应用。VGGT [40] 通过大规模训练和多任务联合优化进一步提高了重建精度。最近,MapAnything [17] 通过整合多种几何输入扩展了输入空间,而 Depth Anything 3 (DA3) [22] 则通过统一的深度-射线建模推动了大规模泛化能力。然而,这些模型的成功严重依赖于海量的标注 3D 数据集。在水下场景中,由于能见度差且水下成像机制未知,获取这些几何标注十分困难,这从根本上限制了数据饥渴型重建模型的适用性。
2.2 水下视觉与几何感知
水下视觉感知受到物理图像形成过程的强烈影响,其中光衰减和散射显著降低了视觉信号。大量工作 [3,15,26] 专注于水下图像复原与增强,旨在消除颜色失真和散射效应以提升视觉质量。因此,基于物理的水下成像模型 [2] 在表征水下视觉环境方面起着核心作用。几个重建与感知框架 [20,37,49] 明确整合了这些模型,以联合推理场景几何结构和水下光传输。最近的工作 [45] 进一步表明,整合水下成像先验可以提升大型多模态模型(LMMs)对水下场景的理解能力。 由于缺乏带有准确 3D 标注的大规模水下数据集,几项研究探索了使用基于物理的渲染引擎 [27,43] 或生成模型 [23,50] 进行合成数据生成。然而,这些方法通常是为立体或单目感知任务设计的,在迁移到真实水下环境时往往表现出域差异。NeRF [20,34,52] 和 3D Gaussian Splatting 方法 [21,38,46] 也被应用于水下场景重建。这些方法得益于体积渲染公式与水下成像模型之间的兼容性,能够联合建模场景几何结构和光传输。尽管如此,它们通常依赖于已知的相机位姿或稀疏几何先验,并需要基于优化的重建。相比之下,我们的工作专注于水下场景中的前馈式多视图几何学习,无需水下 3D 标注。为此,我们引入了一种跨域半监督学习框架以及 Cross-view Consistent Loss(跨视图一致性损失),以解决水下退化问题从而更好地进行训练。
第 5 页
Wat3R 5
Weak Aug. Teacher VGGT
Real Video Data Depth𝐷Maps Cameras𝑔 Point𝑃Maps Static Mask 3D Labeled Data 𝑦1𝑡 𝑦𝑛𝑡 𝐷1𝑡 … 𝐷𝑛𝑡 EMA 𝑉𝑖𝑒𝑤𝑖𝑂𝑢𝑡: ℒper−view ℒcross−view 𝑦𝑖= 𝑔𝑖, 𝐷𝑖, 𝑃𝑖 𝑦1s 𝑦𝑛𝑠 𝐷1𝑠 𝐷𝑛𝑠 Physics-based Underwater Rendering
Student Strong Aug. VGGT ℒsupervised
Fig. 3: Overview of our Wat3R framework. Our pipeline follows a Mean Teacher semi-supervised paradigm, where the teacher network produces pseudo-labels for depth, camera parameters, and point maps to supervise the student network. Training lever- ages labeled synthetic underwater data together with unlabeled real underwater videos, enabling adaptation without underwater 3D annotations. Additional per-view and cross-view consistency losses enforce multi-view geometric coherence.
3 Method
本文旨在通过单次前馈式(Feed-forward)传播,从采集的水下视图中恢复相机位姿、深度和点云。为实现这一目标,我们面临几个关键挑战:(i) 如何在缺乏或没有水下场景 3D 标注的情况下训练模型。(ii) 如何抑制由未知水下退化引起的信息损失。在下文中,我们将通过将跨域半监督学习应用于先进的预训练视觉几何模型来缓解这些问题。具体而言,我们首先介绍基础模型 VGGT [40] 的问题定义和符号表示,然后描述整体框架和训练策略,最后详细说明我们的一致性感知损失。
3.1 问题定义与符号
给定一系列水下 RGB 帧 $(I_i)_{i=1}^{N}$,我们模型的目标是为每个视图 $i$ 预测一组几何属性 $y_i$,公式如下:
(y_i)_{i=1}^{N} = f\!\left((I_i)_{i=1}^{N}\right) \quad (1)
其中 $y_i = (g_i, D_i, P_i)$ 表示视图 $i$ 的预测几何属性,分别对应相机参数、深度图和点图。$g_i \in \mathbb{R}^9$ 编码了视图 $i$ 与第一个相机之间的相机位姿,包含旋转四元数、平移向量和视场角。$D_i \in \mathbb{R}^{H \times W}$ 表示深度图;$P_i \in \mathbb{R}^{3 \times H \times W}$ 是在第一个相机坐标系下表示的预测 3D 点图。遵循这种前馈式框架,VGGT [40] 作为开创性工作,是在大规模 3D 标注的陆地数据集上训练的,并表现出卓越的性能。因此,我们选择 VGGT 作为基础模型,以便在适应水下环境时提供强大的几何先验。然而,
第 6 页
6 J. Ren 等
由于缺乏 3D 标注训练集,直接训练 VGGT 以适应水下环境是不切实际的。
3.2 跨域半监督学习
考虑到水下 3D 标注的缺失,我们研究了一种半监督学习框架,将预训练的多视图几何模型从陆地环境迁移至水下环境。我们的核心思想是通过一致性驱动的师生训练将几何先验迁移至水下场景。如图 3 所示,该框架遵循 Mean Teacher [35] 设计,其中教师提供稳定的伪几何监督,而学生从有标签和无标签数据中学习。 具体而言,我们首先在现有的标注陆地数据集(VGGT 的原始训练集)上模拟各种水下退化,作为所需的有标签数据,这有助于为水下环境初始化强大的几何先验。随后,我们收集大量真实水下视频片段作为无标签训练集,这有助于进一步微调并将模型泛化至真实水下领域。在训练过程中,学生网络通过反向传播进行更新,而教师则遵循学生参数的指数移动平均 (EMA),其更新规则为:
\theta_t^k = (1-\lambda)\theta_t^{k-1} + \lambda\theta_s^k,\label{eq:ema} (2)
其中 $\theta_s^k$ 和 $\theta_t^k$ 分别是第 $k$ 次迭代中的学生参数和教师参数。$\lambda$ 是平滑系数。 合成水下数据(有标签)。我们使用简化版的修订水下成像模型 [2] 生成水下风格的训练图像。图像形成过程建模为:
I = J e^{-\beta^{D}z} + B^{\infty}(1-e^{-\beta^{B}z}), (3)
其中 $J$ 和 $I$ 分别表示清晰图像及其水下退化,$z$ 是场景深度。$B^{\infty} \in \mathbb{R}^3$ 表示背景光,而 $\beta^D \in \mathbb{R}^3$ 和 $\beta^B \in \mathbb{R}^3$ 分别建模直射传输和反向散射的衰减。所有三个参数均在 $[0, 1]$ 范围内随机采样。多视图数据集通常包含不完整或有噪声的深度标注,如果直接用于图像形成模型,可能会产生部分水渲染伪影。因此,我们使用单目深度模型 DA3MONO-LARGE [22] 估计密集深度图以渲染水下外观,同时保留原始几何标注作为监督目标。为了控制每个场景的可见范围,深度图被线性重缩放至随机物理范围。在采样衰减系数时,我们强制执行红光比绿光和蓝光衰减更快的物理约束 [3]。为了模拟空间变化的衰减,采样的系数由通过反复平滑高斯噪声获得的平滑随机空间图进行调制。合成水下的几个视觉结果如图 3 左下角所示,展示了不同水下退化的良好模拟效果。
第 7 页
Wat3R 7
真实水下视频数据(无标签)。为了捕捉真实水下环境的多样化视觉条件,我们构建了一个大规模的视频集合,结合了精心策划的科学数据集和野外拍摄的视频片段。我们从公开来源收集了大约 10,000 个原始水下视频,但经过人工筛选后仅剩下 5,504 个片段。我们保留了具有连续镜头、可见静态结构、合理相机运动、足够视角重叠以及可用图像质量的片段。我们移除了水面或空中视频、频繁剪辑的编辑片段、近重复片段、严重模糊或压缩、主导覆盖层以及主要由开放水域或移动物体主导的片段。为了减少时间冗余,每十个帧采样一帧,最终得到 359k 训练图像。
序列级训练增强。作为半监督学习框架,数据增强对于稳定训练至关重要。遵循基于单图像的任务 [7,51],教师模型和学生模型分别接收同一帧的弱增强和强增强。然而,在无标签视频数据上的无监督训练往往导致有限的视角变化。因此,序列级增强对于增加几何多样性并防止模型崩溃是必要的。具体来说,我们首先采样 24−36 帧并打乱顺序,然后将其输入教师模型。对于学生分支,相同的帧被随机子采样为 2−12 张图像,再次打乱,并且每张图像旋转 0◦、90◦、180◦ 或 270◦ 以避免姿态崩溃。我们还额外应用了颜色抖动、灰度转换和高斯模糊。
3.3 一致性感知训练目标
由 SfM 管线或渲染引擎生成的 3D 重建数据天然满足强多视图几何一致性。为了在训练过程中保留这一结构特性,我们引入了额外的一致性目标,以鼓励一致的几何预测。我们的训练目标由三个部分组成:遵循 VGGT 的监督损失、使用教师预测作为伪标签的逐视图一致性损失,以及强制多视图几何一致性的跨视图一致性损失。整体训练目标定义为:
\mat h cal {L}_{\m a thrm {total } } = \mathcal {L}_{\mathrm{supervised}}{per\text{-}view}}{cross\text{-}view}}. (4)
监督损失。监督损失应用于使用有标签的合成数据进行训练时,计算学生预测与真实标注 {ggt, Dgt, P gt} 之间的差异。这里我们直接使用 VGGT [40] 中的损失:
\mathcal { L}_{\mathrm {su p ervised}} = \m a thcal {L }_ { \mathrm{camera}}(g^{s},g^{gt}){depth}}(D^{s},D^{gt}){point}}(P^{s},P^{gt}), (5)
其中深度损失包括回归、置信度和梯度项;点损失由回归、置信度和法线项组成;相机损失使用 Huber 损失计算。详细信息可参考 VGGT [40]。
逐视图几何一致性损失。我们在使用无标签真实数据进行学习时使用此损失。它与监督损失具有相同的公式,即将教师模型的预测 {gt, Dt, P t} 视为伪真实
第 8 页
8 J. Ren 等.
真实值。值得注意的是,点云图由深度图和相机参数投影得到,以提供更稳定的几何监督 [40]。单视图损失定义为:
$$ \mathcal{L}_{\text{per-view}} = \mathcal{L}_{\text{camera}}(g^s, g^t) + \mathcal{L}_{\text{depth}}(D^s, D^t) + \mathcal{L}_{\text{point}}(P^s, P^t). \quad (6) $$
跨视图几何一致性损失。水下散射和衰减通常导致能见度差和几何信息有限。为了解决这一挑战,我们引入了一种跨视图几何一致性损失,该损失显式地整合来自其他视图的几何线索,以补偿当前视图中的信息退化。给定 $N$ 个教师帧,我们首先对每帧 $i$ 的深度图使用简单的双聚类 K-means 算法获得粗略的前景掩码 $M^{\text{fg}}_i$,将较近的聚类保留为前景。对于每一帧 $i$,我们将有效的教师像素反投影到 3D 空间,并重新投影到所有其他教师视图中。定义投影像素和可见性指示符为:
$$ \begin{aligned} V_{i \rightarrow j}(x) &= \mathbb{1}\left( |D^t_j(u_{i\rightarrow j}(x)) – D^t_{i\rightarrow j}(x)| < \delta \;\land\; u_{i\rightarrow j}(x) \in \Omega_j \right) \\ u_{i\rightarrow j}(x) &= \pi_j\!\left(\pi^{-1}_i(x, D^t_i(x))\right) \end{aligned} \quad (7) $$
这里,$V_{i\rightarrow j}(x)$ 表示帧 $i$ 中的像素 $x$ 在投影到帧 $j$ 后是否保持可见且深度一致。$\mathbb{1}(\cdot)$ 在条件为真时返回 1。$D^t_i$ 表示视图 $i$ 的教师深度。$\Omega_j$ 是视图 $j$ 的图像域。$u_{i\rightarrow j}(x)$ 表示从视图 $i$ 到视图 $j$ 的投影。其中 $\pi_j$ 是使用相机位姿将视图 $j$ 的深度投影到世界坐标系的投影算子,而 $\pi^{-1}_i$ 是反投影算子。然后,视图 $i$ 的统计区域计算为其前景掩码中深度一致的部分:
$$ M^{\text{static}}_i(x) = \mathbb{1}\left( \sum_{j \neq i} V_{i\rightarrow j}(x) \ge k \right) M^{\text{fg}}_i(x). \quad (8) $$
在我们的实验中,我们使用保守设置 $k = N – 2$,其中 $N$ 表示用于构建掩码的教师帧数量。该掩码不是额外的监督源;它仅选择可靠的像素以应用跨视图监督。前景项抑制了远处的背景水域,而多视图一致性项去除了动态或几何不稳定的区域。当场景主要包含开阔水域、严重浑浊或强烈的物体运动时,掩码自然变得稀疏,从而防止模型施加不可靠的跨视图约束。
在学生训练期间,我们从同一序列中随机选择 $n$ 帧(任意顺序),形成索引集 $S$。对于任意对 $(i, j) \in S$,教师帧 $i$ 的深度被投影到视图 $j$:
$$ D^t_{i \rightarrow j}(x) = \pi_j\!\left(\pi^{-1}_i(x, D^t_i(x))\right) \quad (9) $$
并在静态掩码 $M^{\text{static}}_j$ 下与学生深度 $D^s_j$ 进行比较。几何一致性损失对所有有序对取平均:
$$ \mathcal{L}_{\text{cross-view}} = \frac{1}{|S|(|S|-1)} \sum_{i \in S} \sum_{j \in S, j \neq i} \mathcal{L}_1\left(D^s_j, D^t_{i\rightarrow j}, M^{\text{static}}_j\right) \quad (10) $$
第 9 页
Wat3R 9
表 1:多视图深度估计。我们在两种评估协议下报告结果:(1) Shuffle 10-view 评估,以及 (2) 完整子序列评估(100 帧,有序)。每类的最佳和次佳结果分别以粗体和下划线标记。阴影行表示两阶段流水线,其中输入图像首先由相应的水下图像增强方法增强,然后输入 VGGT 模型。红色括号中的数值表示相对于 VGGT 的百分比提升。
Sea-thru [3] FLSea Stereo [29] Methods Rel↓ δ1 ↑ log10 ↓ RMSE↓ Rel↓ δ1 ↑ log10 ↓ RMSE↓
Shuffle 10-view Evaluation (stride=10)
WaterSplatting [21] 3DV'25 – – – – 0.427 0.415 0.157 1.476 Fast3r [47] CVPR'25 0.277 0.713 0.083 0.631 0.290 0.529 0.141 1.355 MapAnything [17] 3DV'26 0.216 0.800 0.060 0.454 0.146 0.841 0.061 0.798 π3 [42] ICLR'26 0.185 0.909 0.044 0.358 0.139 0.856 0.053 0.837 DA3 [22] ICLR'26 0.187 0.892 0.046 0.333 0.141 0.851 0.056 0.872 VGGT [40] CVPR'25 0.190 0.891 0.047 0.380 0.137 0.849 0.059 0.760 + Semi-UIR [15] CVPR'23 0.201 0.846 0.052 0.387 0.136 0.861 0.056 0.784 + PSPL [26] TIP'25 0.209 0.836 0.055 0.419 0.160 0.817 0.063 0.911 0.167 0.946 0.038 0.290 0.119 0.885 0.048 0.720 Wat3R (+12.1%) (+6.2%) (+19.1%) (+23.7%) (+13.1%) (+4.2%) (+18.6%) (+5.3%)
Full Subsequence Evaluation (100 frames, ordered)
Fast3r [47] CVPR'25 0.274 0.711 0.081 0.622 0.299 0.521 0.146 1.363 MapAnything [17] 3DV'26 0.227 0.788 0.063 0.488 0.147 0.841 0.062 0.795 π3 [42] ICLR'26 0.187 0.923 0.041 0.358 0.139 0.856 0.053 0.836 DA3 [22] ICLR'26 0.183 0.922 0.040 0.311 0.139 0.855 0.055 0.861 VGGT [40] CVPR'25 0.193 0.900 0.045 0.373 0.136 0.851 0.058 0.759 0.170 0.953 0.036 0.294 0.120 0.884 0.048 0.715 Wat3R (+11.9%) (+5.9%) (+20.0%) (+21.2%) (+11.8%) (+3.9%) (+17.2%) (+5.8%)
至此,我们介绍了所提出的 Wat3R 的主要流程,这是一个跨域半监督学习框架,旨在泛化 VGGT 到具有挑战性的水下领域,而无需任何水下标注。
4 实验
接下来,我们在四个水下任务上评估我们的 Wat3R:多视图深度估计(第 4.2 节)、点图估计(第 4.3 节)、相机位姿估计(第 4.4 节)和单目深度估计(第 4.5 节)。
4.1 实现细节
我们在 4 块 NVIDIA RTX 4090 GPU 上训练模型 19,200 步,从 1,000 步的线性预热开始。ViT 主干网络的峰值学习率设置为 5×10−6,下游头部的峰值学习率设置为 5×10−5。为了提高训练效率并减少 GPU 内存消耗,我们采用梯度检查点(gradient checkpointing)和 bfloat16 混合精度训练。未标记样本与标记样本的比例设置为 1:3。在前 6,400 步中,训练仅在标记数据上进行。随后,无监督损失权重 λu 逐渐增加,在第 12,800 步达到其峰值 0.5。在训练过程中,我们随机采样 2 到 12 张图像,并将每张图像的最长边调整为 518 像素。 数据集。为了确保适用于水下视觉场景,我们在五个公共数据集以及我们自行构建的 Water3D 数据集上进行了实验:
第 10 页
10 J. Ren 等
输入图像 真值 (GT) 本文方法 (Ours) DA3ICLR'26 MapAnything3DV’26 VGGTCVPR'25
图 4: 在我们构建的 Water3D 数据集上的 3D 重建结果。使用 DA3 [22]、MapAnything [17]、VGGT [40] 以及我们的 Wat3R 进行对比。Wat3R 获得了更完整且物理一致的重建结果,并减少了伪影。
– FLSea-VI [29] 包含在浅层地中海和红海环境中捕获的前视单目水下序列。我们在 Coral Table Loop 和 U-Canyon 序列上进行了评估。 – FLSea-Stereo [29] 由来自 5 个浅水场景的 7,341 对同步立体图像组成,包括峡谷和平坦的沙质海底环境,这些数据是从 FLSea-VI 数据集中不同潜水和场景收集的。 – SQUID [4] 提供了一个定量的水下立体数据集,由 57 对立体图像组成,具有基于立体视觉推导的真值深度,这些数据是在自然海洋环境的不同季节、深度和水体类型中收集的。 – Sea-thru [3] 是一个水下 RGBD 数据集,由来自 5 个自然场景的 1,205 张图像组成,这些图像是在自然光照下,于两个光学特性不同的水体中采集的,涵盖了不同的深度、水体类型和场景结构。 – SeaThru-NeRF [20] 由 5 个真实水下场景组成,仅标注了相机位姿。该数据集最初用于 NeRF 评估。 – Water3D 包含 42 个真实水下场景,其中 20 个来自 UVEB [44],另外 22 个场景是与我们的训练数据一起收集的(但未用于训练)。相机位姿和深度是使用 COLMAP [32] 重建的,其中匹配器被替换为先进的 MINIMA [30],并使用我们合成的水下数据进一步微调。最终结果经过人工检查,以确保标注的正确性,仅保留注册稳定且无明显坍塌或严重异常值的场景。更多细节见补充材料。
4.2 多视图深度估计
我们首先评估从多视图输入进行的深度估计。使用了两个带有深度标注的视频数据集,即 Sea-thru [3] 和 FLSea-Stereo [29]。我们将我们的 Wat3R 与在大规模标注数据上训练的先进模型进行了比较。此外,还评估了水下 Splatting 方法 [21]。为了
第 11 页
Wat3R 11
输入图像 我们的方法 DA3ICLR26 MapAnythingarXiv25 VGGTCVPR25
图 5:在自然场景图像上与 Wat3R、DA3 [22]、MapAnything [17] 和 VGGT [40] 的定性比较。为了公平比较,所有方法采用相同的输入。未应用后处理,从而可以可视化完整的点云。
为了验证水下图像增强(UIE)方法对 3D 几何估计的有效性,我们将两种增强方法纳入两阶段流水线中。该方法首先增强水下图像,使其更接近陆地领域,然后将其输入到 3D 模型中。遵循 [40,41,47] 的做法,长序列被划分为多个子场景,每个子场景包含最多 100 张图像。我们从每个序列中均匀采样 10 张图像,并随机打乱其顺序进行测试。此外,我们遵循 [8] 的基于视频的深度评估协议来评估完整的子序列。我们通过最小二乘法估计尺度和偏移,将预测的深度图与真实深度的尺度对齐,从而评估度量深度。性能使用标准的深度指标进行衡量,结果报告在表 1 中。我们报告绝对相对误差(Rel)、对数尺度的绝对误差(log10)、均方根误差(RMSE)以及在 1.25i 阈值下的内点像素百分比 δi,以评估整体深度精度。由于输入视频帧的顺序在训练期间被随机打乱,因此模型不依赖于时间连续性或视频特定的监督信号。
表 1 显示,与原始 VGGT [40] 相比,我们的模型取得了清晰且一致的改进。具体而言,WaterSplatting [21] 是一种专为水下场景设计的 Splatting 方法。但它依赖于初始化的点云,在 FLSea-Stereo 上产生较大误差,甚至在具有挑战性的 Sea-thru 数据集上失败。π3 [42] 和 DA3 [22] 凭借其改进的 3D 表示获得了具有竞争力的结果,且其大型训练集包含一些水下场景。阴影行显示,UIE 几乎未能为多视图深度估计带来改进。增强过程可能容易引入信息丢失或视图不一致的变化,无法恢复新的结构线索。相比之下,Wat3R 在训练期间直接学习水下感知的几何结构,从而在具有挑战性的水下场景中实现更可靠的 3D 感知。这些结果突显了我们的方法在实现更高精度和鲁棒性方面的能力,特别是在具有挑战性的水下多视图场景中。这些高保真结果在图 4 和图 5 中得到了直观展示。
第 12 页
12 J. Ren 等
表 2:在 Water3D 数据集上的性能对比。每类的最佳和次佳结果分别以粗体和<u>下划线</u>标记。(红色) 中的数值表示相对于 VGGT [40] 的百分比提升。
精度 ↓ 完整性 ↓ 综合 ↓ 方法 均值 中位数 均值 中位数 均值 中位数
Fast3r [47] CVPR'25 1.216 0.531 2.444 0.784 1.830 0.658 MapAnything [17] 3DV'26 0.643 0.284 0.666 0.277 0.655 0.281 π3 [42] ICLR'26 0.491 0.168 0.413 0.184 0.452 0.176 DA3 [22] ICLR'26 0.679 0.187 0.528 0.160 0.604 0.174
VGGT [40] CVPR'25 0.486 0.193 0.762 0.191 0.624 0.192 0.444 0.148 0.409 0.165 0.427 0.157 Wat3R (Point) (+8.6%) (+23.3%) (+46.3%) (+13.6%) (+31.6%) (+18.2%) 0.446 0.162 0.366 0.143 0.406 0.153 Wat3R (Depth+Cam) (+8.2%) (+16.1%) (+52.0%) (+25.1%) (+34.9%) (+20.3%)
4.3 点图估计
我们进一步使用水下数据集 Water3D 评估重建的多视图点图的质量。对于每个序列,均匀采样 20 张图像进行评估。遵循 [40, 42, 47] 的做法,我们首先使用 Umeyama 算法 [36] 进行粗略的 Sim(3) 对齐,随后使用迭代最近点 (ICP) 算法进行细化。我们在表 2 中报告精度 (Accuracy)、完整性 (Completeness) 及其综合平均值作为指标。直接输出的点图和由预测深度与相机推导出的重建结果均取得了优异的性能。它们一致的结果表明,适配过程保持了点、深度和相机头之间的几何一致性。这得益于我们的一致性感知目标,即使在没有真实水下视频地面真值标注的情况下,这些目标也能耦合跨头和跨视图的预测。
4.4 相机位姿估计
现在我们评估 SeaThru-NeRF [20] 上的相机位姿估计。遵循先前的工作 [40,41],性能通过不同角阈值下的 AUC 进行衡量,其中 AUC 是根据相对平移精度 (RTA) 和相对旋转精度 (RRA) 的最小值计算得出的。 如表 3 所示,DA3 [22] 在所有阈值下均取得了最佳的整体性能。这主要归功于其深度-射线表示 (depth-ray representation),它为联合建模场景几何和相机运动提供了极简且充分的公式化。几何驱动的位姿推断在水下环境中表现出天然的鲁棒性。我们的跨视图一致性学习使模型能够提取跨视图的互补几何线索,降低其对水致退化的敏感性,从而产生更稳定的位姿估计。
4.5 单目深度估计
我们评估单目深度估计,以评估模型对水下退化的理解。在此设置下,没有来自其他视图的互补线索。遵循 [23,50] 的做法,我们在四个数据集上评估性能:
第 13 页
Wat3R 13
表 3:在 SeaThru-NeRF [20] 上不同阈值下的位姿估计 AUC。每类中的最佳和次佳结果分别以粗体和<u>下划线</u>标记。红色括号内的数值表示相对于 VGGT [40] 的提升百分比。
方法 AUC@5◦ AUC@15◦ AUC@30◦
Fast3r [47] CVPR'25 0.040 0.239 0.498 π3 [42] ICLR'26 0.216 0.635 0.809 DA3 [22] ICLR'26 0.731 0.901 0.950 MapAnything [17] 3DV'26 0.074 0.458 0.707
VGGT [40] CVPR'25 0.392 0.707 0.843 Wat3R 0.540(+37.8%) 0.820(+16.0%) 0.906(+7.5%)
表 4:单目深度估计。每类中的最佳和次佳结果分别以粗体和<u>下划线</u>标记。前三项方法(Udepth [49]、UW-Depth [13]、WaterMono [12])是专为水下场景设计的模型。WaterMono [12] 在 FLSea VI [29] 上训练;其结果以灰色显示。红色括号内的数值表示相对于 VGGT [40] 的提升百分比。
FLSea VI [29] FLSea Stereo [29] SQUID [4] Sea-thru [3] 方法 Rel↓ δ1 ↑ Rel↓ δ1 ↑ Rel↓ δ1 ↑ Rel↓ δ1 ↑
Udepth [49] ICRA'23 0.212 0.683 0.279 0.550 0.312 0.547 0.166 0.832 UW-Depth [13] ICRA'24 0.330 0.447 0.400 0.427 0.491 0.343 0.184 0.792 WaterMono [12] TIM'25 0.074 0.949 0.206 0.684 0.261 0.544 0.145 0.829
DAv2 [48] NeurIPS'24 0.069 0.958 0.134 0.849 0.099 0.900 0.089 0.940 Fast3r [47] CVPR'25 0.198 0.720 0.213 0.679 0.368 0.522 0.125 0.911 MapAnything [17] 3DV'26 0.086 0.951 0.146 0.837 0.104 0.898 0.104 0.960 π3 [42] ICLR'26 0.081 0.944 0.148 0.831 0.234 0.640 0.113 0.949 DA3 [22] ICLR'26 0.090 0.936 0.154 0.824 0.151 0.802 0.111 0.950
VGGT [40] CVPR'25 0.107 0.888 0.159 0.809 0.194 0.703 0.113 0.942 0.061 0.971 0.120 0.886 0.107 0.893 0.090 0.976 Wat3R (+43.0%)(+9.3%)(+24.5%) (+9.5%) (+44.8%)(+27.0%)(+20.4%)(+3.6%)
FLSea-VI [29]、FLSea-Stereo [29]、SQUID [4] 和 Sea-thru [3],使用绝对相对误差 (Rel) 和 δ1 作为评估指标。结果汇总于表 4。尽管我们的模型未使用单图像监督进行训练,但在四个数据集上均取得了最佳性能。跨视图监督有助于将水下退化与场景几何结构分离。学习到的几何先验随后被迁移到单视图输入中。图 6 展示了定性的单目结果。
4.6 消融实验
表 5 展示了消融实验,以分析我们框架中各个组件的贡献。从预训练的 VGGT 模型作为基线开始,我们逐步引入我们方法的关键要素,包括真实水下视频数据、序列级增强、提出的跨视图一致性损失 $L_{cross-view}$ 以及静态掩码 $M_{static}$。作为参考,我们包含了一个仅在合成水下数据上训练的有监督变体,以突出未标记的真实水下视频和所提出的一致性约束的效果。 结果显示了三个明显的趋势。(1) 使用合成水下渲染进行训练已经通过部分
第 14 页
14 J. Ren 等
图像 真值 (GT) 本文方法 VGGTCVPR'25 DA3ICLR'26
图 6: 使用 Wat3R、DA3 [22] 和 VGGT [40] 进行单目深度估计。 前两行采样自 SQUID [4] 数据集,第三行来自 FLSea-Stereo [29],第四行来自 FLSea-VI [29]。
表 5: 消融实验。评估多视图深度估计。每类的最佳结果和第二佳结果分别以粗体和下划线标记。
合成 真实 强增强 静态 Sea-thru FLSea Stereo Lcross-view M 水下 视频 增强 Rel↓ δ1 ↑ Rel↓ δ1 ↑
VGGT 0.190 0.891 0.137 0.849 ✓ 0.173 0.920 0.135 0.860 ✓ ✓ 0.181 0.906 0.165 0.793 ✓ ✓ ✓ 0.172 0.936 0.126 0.871 ✓ ✓ ✓ ✓ 0.167 0.949 0.126 0.869 ✓ ✓ ✓ ✓ 0.174 0.929 0.130 0.871 Wat3R ✓ ✓ ✓ ✓ ✓ 0.167 0.946 0.119 0.885
弥合陆地与水下图像之间的域差异。(2) 结合真实水下视频数据与强增强策略一致地提升了性能,表明大规模无标签视频为几何模型适应水下场景提供了有效的监督信号。(3) 提出的跨视图一致性损失 (Cross-view Consistent Loss) 和静态掩码通过强制多视图几何一致性并抑制由散射或动态内容引起的不稳定区域,进一步提升了性能。请注意,我们的掩码策略主要应对严重的水下退化及动态物体。对于像 Sea-thru 这样简单且静态的场景,提升并不显著。
4.7 鲁棒性分析与失败案例
为了评估模型在极端条件下的鲁棒性,我们在图 7 中报告了在合成和真实场景下,随着水下退化程度逐渐增强时的结果。在合成退化的 DTU [16] 数据集上,所有方法的点图误差随着衰减和散射的加剧而增加,然而
第 15 页
Wat3R 15
DA3 DA3 20 MapAnything MapAnything VGGT 3 VGGT Wat3R Wat3R 15 Mild Mild 2 10 Accuracy↓ Accuracy↓ 1 5
0 0 Severe Increasing synthetic degradation on DTU Severe Increasing real degradation severity on Water3D
图 7:鲁棒性与失败案例分析。左图:随着视觉损坏程度增加,合成水下退化效果。右图:按难度分组的真实水下场景。Wat3R 对中度退化表现出更强的鲁棒性。
Wat3R 的退化过程更为平缓,并在竞争方法中保持了明显的优势区间。这一优势也延伸至真实的 Water3D 场景。严重的能见度损失减少了用于几何恢复的稳定视觉证据。尽管如此,Wat3R 的性能下降速度更慢。其鲁棒性源于在多样化合成和真实水下条件下的训练,以及旨在促使几何结构在外观变化下保持稳定的一致性目标。
4.8 关于潜在局限性的讨论
尽管 Wat3R 旨在进行无需水下标注的水下几何重建,但仍存在若干局限性。处理高度动态的元素(如移动的海洋生物或潜水员)可能需要对时间动态和运动线索进行额外建模。在开阔水域、高浑浊度或极深场景中,可靠的匹配结构可能变得稀疏。我们的保守静态掩码随后会抑制不可靠区域,但这也会削弱跨视图学习信号,从而限制此类极端情况下的性能。
5 结论
在本文中,我们介绍了 Wat3R,这是一种用于水下几何学习的首个半监督 VGGT 框架。Wat3R 仅利用未标注的真实水下视频学习鲁棒的几何表示,无需任何标注的水下数据。此外,我们设计了跨视图一致性损失(Cross-view Consistent Loss)以应对水下退化,从而提升训练效果。另外,我们构建了 Water3D,这是首个包含多样化水下条件的综合评估基准。实验结果表明,Wat3R 在水下多视图几何估计方面显著优于最先进方法。
致谢
本研究得到国家自然科学基金(Grant U2341227, 62406117, and U25B2078)的支持。
第 16 页
16 J. Ren 等
参考文献
1. Agarwal, S., Furukawa, Y., Snavely, N., Simon, I., Curless, B., Seitz, S.M., Szeliski, R.: Building rome in a day. CACM 54(10), 105–112 (2011) 2. Akkaynak, D., Treibitz, T.: A revised underwater image formation model. In: CVPR. pp. 6723–6732 (2018) 3. Akkaynak, D., Treibitz, T.: Sea-thru: A method for removing water from under- water images. In: CVPR. pp. 1682–1691 (2019) 4. Berman, D., Levy, D., Avidan, S., Treibitz, T.: Underwater single image color restoration using haze-lines and a new quantitative dataset. IEEE TPAMI (2020) 5. Bleyer, M., Rhemann, C., Rother, C.: Patchmatch stereo-stereo matching with slanted support windows. In: BMVC. vol. 11, pp. 1–11 (2011) 6. Cabon, Y., Stoffl, L., Antsfeld, L., Csurka, G., Chidlovskii, B., Revaud, J., Leroy, V.: Must3r: Multi-view network for stereo 3d reconstruction. In: CVPR. pp. 1050– 1060 (2025) 7. Chen, D., Liu, Z., Yang, C., Wang, D., Yan, Y., Xu, Y., Ji, X.: Conformalsam: Un- locking the potential of foundational segmentation models in semi-supervised se- mantic segmentation with conformal prediction. In: ICCV. pp. 24045–24055 (2025) 8. Chen, S., Guo, H., Zhu, S., Zhang, F., Huang, Z., Feng, J., Kang, B.: Video depth anything: Consistent depth estimation for super-long videos. In: CVPR. pp. 22831– 22840 (2025) 9. Crandall, D., Owens, A., Snavely, N., Huttenlocher, D.: Discrete-continuous opti- mization for large-scale structure from motion. In: CVPR. pp. 3001–3008 (2011) 10. Crandall, D.J., Owens, A., Snavely, N., Huttenlocher, D.P.: Sfm with mrfs: Discrete-continuous optimization for large-scale structure from motion. IEEE TPAMI 35(12), 2841–2853 (2012) 11. Cui, H., Gao, X., Shen, S., Hu, Z.: Hsfm: Hybrid structure-from-motion. In: CVPR. pp. 1212–1221 (2017) 12. Ding, Y., Li, K., Mei, H., Liu, S., Hou, G.: Watermono: Teacher-guided anomaly masking and enhancement boosting for robust underwater self-supervised monoc- ular depth estimation. IEEE TIM (2025) 13. Ebner, L., Billings, G., Williams, S.: Metrically scaled monocular depth estimation through sparse priors for underwater robots. In: ICRA. pp. 3751–3757 (2024) 14. Hartley, R., Zisserman, A.: Multiple view geometry in computer vision. Cambridge university press (2003) 15. Huang, S., Wang, K., Liu, H., Chen, J., Li, Y.: Contrastive semi-supervised learning for underwater image restoration via reliable bank. In: CVPR. pp. 18145–18155 (2023) 16. Jensen, R., Dahl, A., Vogiatzis, G., Tola, E., Aanæs, H.: Large scale multi-view stereopsis evaluation. In: CVPR. pp. 406–413 (2014) 17. Keetha, N., Müller, N., Schönberger, J., Porzi, L., Zhang, Y., Fischer, T., Knapitsch, A., Zauss, D., Weber, E., Antunes, N., et al.: Mapanything: Univer- sal feed-forward metric 3d reconstruction. In: 3DV (2026) 18. Kim, A., Eustice, R.: Pose-graph visual slam with geometric model selection for autonomous underwater ship hull inspection. In: IROS. pp. 1559–1565 (2009) 19. Leroy, V., Cabon, Y., Revaud, J.: Grounding image matching in 3d with mast3r. In: ECCV. pp. 71–91. Springer (2024) 20. Levy, D., Peleg, A., Pearl, N., Rosenbaum, D., Akkaynak, D., Korman, S., Treibitz, T.: Seathru-nerf: Neural radiance fields in scattering media. In: CVPR. pp. 56–65 (2023)
第 17 页
Wat3R 17
21. Li, H., Song, W., Xu, T., Elsig, A., Kulhanek, J.: Watersplatting: Fast underwater 3d scene reconstruction using gaussian splatting. In: 3DV. pp. 969–978 (2025) 22. Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B.: Depth anything 3: Recovering the visual space from any views. In: ICLR (2026) 23. Lin, H., Liang, D., Qi, Z., Bai, X.: A unified image-dense annotation generation model for underwater scenes. In: CVPR. pp. 961–970 (2025) 24. Lindenberger, P., Sarlin, P.E., Pollefeys, M.: Lightglue: Local feature matching at light speed. In: ICCV. pp. 17627–17638 (2023) 25. Liu, R., Fan, S., Wang, W., Yang, Y.: Underwater visual slam with depth uncer- tainty and medium modeling. In: ICCV. pp. 970–980 (2025) 26. Liu, Y., Jiang, Q., Li, X., Luo, T., Ren, W.: Toward better than pseudo-reference in underwater image enhancement. IEEE TIP (2025) 27. Lv, Q., Dong, J., Li, Y., Chen, S., Yu, H., Zhang, S., Wang, W.: Uwstereo: A large synthetic dataset for underwater stereo matching. IEEE TCSVT (2025) 28. Maggio, D., Lim, H., Carlone, L.: VGGT-SLAM: Dense rgb slam optimized on the sl (4) manifold. In: NeurIPS (2025) 29. Randall, Y.: Flsea: Underwater visual-inertial and stereo-vision forward-looking datasets. Master’s thesis, University of Haifa (Israel) (2023) 30. Ren, J., Jiang, X., Li, Z., Liang, D., Zhou, X., Bai, X.: Minima: Modality invariant image matching. In: CVPR. pp. 23059–23068 (2025) 31. Sarlin, P.E., Cadena, C., Siegwart, R., Dymczyk, M.: From coarse to fine: Robust hierarchical localization at large scale. In: CVPR. pp. 12716–12725 (2019) 32. Schonberger, J.L., Frahm, J.M.: Structure-from-motion revisited. In: CVPR. pp. 4104–4113 (2016) 33. Snavely, N., Seitz, S.M., Szeliski, R.: Photo tourism: exploring photo collections in 3d. ACM TOG pp. 835–846 (2006) 34. Tang, Y., Zhu, C., Wan, R., Xu, C., Shi, B.: Neural underwater scene representa- tion. In: CVPR. pp. 11780–11789 (2024) 35. Tarvainen, A., Valpola, H.: Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results. In: NeurIPS. vol. 30 (2017) 36. Umeyama, S.: Least-squares estimation of transformation parameters between two point patterns. IEEE TPAMI (1991) 37. Wang, C., Xu, H., Jiang, G., Yu, M., Luo, T., Chen, Y.: Underwater monocular depth estimation based on physical-guided transformer. IEEE TGRS 62, 1–16 (2024) 38. Wang, H., Anantrasirichai, N., Zhang, F., Bull, D.: Uw-gs: Distractor-aware 3d gaussian splatting for enhanced underwater scene reconstruction. In: WACV. pp. 3280–3289 (2025) 39. Wang, H., Agapito, L.: 3d reconstruction with spatial memory. In: 3DV. pp. 78–89 (2025) 40. Wang, J., Chen, M., Karaev, N., Vedaldi, A., Rupprecht, C., Novotny, D.: Vggt: Visual geometry grounded transformer. In: CVPR. pp. 5294–5306 (2025) 41. Wang, S., Leroy, V., Cabon, Y., Chidlovskii, B., Revaud, J.: Dust3r: Geometric 3d vision made easy. In: CVPR. pp. 20697–20709 (2024) 42. Wang, Y., Zhou, J., Zhu, H., Chang, W., Zhou, Y., Li, Z., Chen, J., Pang, J., Shen, C., He, T.: π3: Permutation-equivariant visual geometry learning. In: ICLR (2026) 43. Wu, Z., Wang, Y., Wen, Y., Zhang, Z., Wu, B., Tang, H.: Stereoadapter: Adapting stereo depth estimation to underwater scenes. In: ICRA (2026)
第 18 页
18 J. Ren 等
44. Xie, Y., Kong, L., Chen, K., Zheng, Z., Yu, X., Yu, Z., Zheng, B.: Uveb: A large-scale benchmark and baseline towards real-world underwater video enhancement. In: CVPR. pp. 22358–22367 (2024) 45. Xu, W., Wang, C., Liang, D., Zhao, Z., Jiang, X., Zhang, P., Bai, X.: Nautilus: A large multimodal model for underwater scene understanding. In: NeurIPS (2025) 46. Yang, D., Leonard, J.J., Girdhar, Y.: Seasplat: Representing underwater scenes with 3d gaussian splatting and a physically grounded image formation model. In: ICRA. pp. 7632–7638 (2025) 47. Yang, J., Sax, A., Liang, K.J., Henaff, M., Tang, H., Cao, A., Chai, J., Meier, F., Feiszli, M.: Fast3r: Towards 3d reconstruction of 1000+ images in one forward pass. In: CVPR. pp. 21924–21935 (2025) 48. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2. In: NeurIPS. vol. 37, pp. 21875–21911 (2024) 49. Yu, B., Wu, J., Islam, M.J.: Udepth: Fast monocular depth estimation for visually-guided underwater robots. In: ICRA (2023) 50. Zhang, F., You, S., Li, Y., Fu, Y.: Atlantis: Enabling underwater depth estimation with stable diffusion. In: CVPR. pp. 11852–11861 (2024) 51. Zhao, Z., Yang, L., Long, S., Pi, J., Zhou, L., Wang, J.: Augmentation matters: A simple-yet-effective approach to semi-supervised semantic segmentation. In: CVPR. pp. 11350–11359 (2023) 52. Zhou, J., Liang, T., Zhang, D., Liu, S., Wang, J., Wu, E.Q.: Waterhe-nerf: Water-ray matching neural radiance fields for underwater scene reconstruction. Information Fusion 115, 102770 (2025)
第 19 页
Wat3R 19
“Wat3R: 无标注水下 3D 几何学习”的补充材料
在本附录中,我们提供了我们方法的额外分析和实现细节:
– 附录 A 中对跨视图监督机制的分析; – 附录 B 中 Water3D 数据集的构建流程; – 附录 C 中提出的基于物理的合成水下渲染过程的可视化; – 附录 D 中对 Wat3R 的进一步分析,包括按条件划分的结果、与特定于水下的 3DGS 和经典 SfM 流程的比较,以及额外的消融实验; – 附录 E 中水下图像增强对 3D 重建的影响; – 附录 F 中单目深度估计和多视图 3D 重建的额外定性结果。
A 跨视图监督分析
为了更好地理解跨视图监督,我们在图 A1 中展示了其流程以及静态掩码在动态场景中的作用。我们在表 A1 中比较了跨视图对齐的不同监督来源。第一行完全移除了跨视图损失,作为基线。第二行通过利用学生预测本身构建跨视图约束来应用自监督。第三行使用教师预测作为监督目标。结果表明,与没有损失的基线相比,引入跨视图监督提高了性能。然而,由于训练期间预测的不稳定性,使用学生预测作为目标带来的提升有限。这表明 EMA 教师产生了更可靠的几何目标,以强制跨视图一致性。
B Water3D 数据集构建细节
在本节中,我们介绍 Water3D 的构建流程,从原始视频流到重建的点云。首先,以每秒 10 帧的速度从原始视频中提取图像。我们使用 hloc 工具箱 [31] 构建 COLMAP [32] 重建流程。为了提高 hloc 的准确性,我们采用了使用我们合成的水下数据微调过的 MINIMALightGlue [24,30] 模型。得到的对应关系被传递给 COLMAP 以执行运动恢复结构(SfM)重建,生成相机内参、外参和稀疏点云。对于密集重建,我们采用 COLMAP 的 PatchMatch Stereo [5] 算法。调整参数以更好地处理水下环境中的弱纹理区域。在深度估计期间强制执行多视图几何一致性,并基于光度约束和几何约束过滤不可靠的深度预测。
第 20 页
20 J. Ren 等
输入图像 预测深度 𝑀 static 𝑥 (随 𝑘 增加)
𝑉𝑖𝑒𝑤𝑖 … … … …
𝑉𝑖𝑒𝑤𝑗 𝑘= 1 𝑘= 5 𝑘= 15
ℒ1 + +
教师深度 𝑀 static 相机 重投影深度 学生深度
图 A1:具有静态区域过滤的跨视图几何监督。 教师深度从视图 𝑖 重投影到视图 𝑗 以监督学生预测。使用一致性阈值 𝑘 构建多视图静态掩码 𝑀 static,以过滤动态或不一致区域。底行展示了一个动态场景的示例,其中移动物体被静态掩码过滤。
由于水下场景中存在悬浮颗粒,原始深度图通常包含大量异常值。我们将深度图投影到 3D 空间,并使用 KD-tree 进行最近邻分析,以去除局部密度低的异常值。然后,将过滤后的点重新投影以细化深度图。
C 合成水下渲染的可视化
为了更好地说明我们基于物理的水下渲染过程的行为,我们在图 A2 中可视化了在不同参数设置下生成的几个示例。合成的图像鼓励模型学习几何结构与水下水光衰减之间的关系。
D 对 Wat3R 和 Water3D 的更多理解
在本节中,我们呈现额外的分析以更好地理解 Wat3R 的行为。首先,我们报告 Water3D 上的条件结果,以评估我们方法在不同水下环境下的表现。然后,我们将我们的方法与
第 21 页
Wat3R 21
表 A1:不同监督源对跨视图损失的影响。 我们在 FLSea Stereo [29] 上报告了多视图深度估计和单目深度估计的绝对相对误差 (Rel↓) 和 δ1 ↑。
多视图深度 单目深度 跨视图监督 Rel↓ δ1 ↑ Rel↓ δ1 ↑
无 0.126 0.871 0.127 0.871 学生预测 0.122 0.881 0.123 0.880 教师预测 0.119 0.885 0.120 0.886
RGB 深度
能见度降低
颜色 水体 变化
图 A2:合成水下渲染示例。从陆地 RGB 图像和深度图开始,我们使用基于物理的渲染模型生成水下图像。垂直轴变化模拟的水体颜色,代表不同的水下环境,而水平轴显示由增加衰减和散射引起的能见度降低。
与经典 SfM 管线进行比较,以说明在水下环境中可靠重建的难度。
D.1 Water3D 上的条件结果
我们还在表 A2 中报告了 Water3D 上的条件结果。场景根据主要捕获条件分为浅海、深海、湖泊和河流环境。Wat3R 在所有组别中始终实现了最低的整体平均和中位数误差。河流场景仍然最具挑战性,因为它们通常包含更强的浊度、更不稳定的纹理和更窄的可见范围。
D.2 与基于优化的水下管线的比较
为了验证这种改进是否不仅限于前馈式基线,我们进一步与 WaterSplatting [21] 和基于 COLMAP 的 SfM/MVS 管线进行了比较
第 22 页
22 J. Ren 等
表 A2:Water3D 上按条件划分的重建误差。最佳结果加粗。
总体均值/中值误差 ↓ 方法 浅海 深海 湖泊 河流
DA3 (ICLR'26) 0.852 / 0.254 0.924 / 0.167 0.863 / 0.056 3.645 / 3.033 VGGT (CVPR'25) 0.857 / 0.226 1.690 / 0.223 0.877 / 0.079 3.650 / 2.440 Wat3R (ours) 0.489 / 0.177 0.283 / 0.101 0.084 / 0.046 0.703 / 0.513
在表 A3 的 FLSea Stereo 上。对于 COLMAP,我们测试了 SuperPoint+LightGlue (SPLG) 和 MINIMA 匹配器。COLMAP 变体在成功重建的场景上能获得较低的误差,尤其是使用 MINIMA 时,但它们在大多数 10 视角测试序列上失败,因此在稀疏水下输入下缺乏鲁棒性。WaterSplatting 也受限于不准确的初始化和稀疏视角重建失败。相比之下,Wat3R 对所有场景都能产生有效的预测,并实现了最佳的总体鲁棒性。
表 A3:FLSea Stereo 上与水下专用和经典重建流水线的比较。我们在与主论文相同的 10 视角设置下评估多视角深度。
方法 相对误差↓ δ1 ↑ RMSE↓ 失败率↓
Wat3R (ours) 0.119 0.885 0.720 0/152 WaterSplatting (3DV'25) 0.427 0.415 1.476 99/152 COLMAP+SPLG 0.129 0.847 0.584 91/152 COLMAP+MINIMA 0.105 0.896 0.456 99/152
D.3 其他消融实验
表 A4 进一步隔离了序列级强增强的影响。仅对合成数据应用强增强并不能优于仅使用合成数据的监督训练,这表明增强主要有利于视角多样性有限的半监督真实视频分支。为了验证我们的适应策略并不依赖于 VGGT,我们还将相同的框架应用于 π3 [42]。如表 A5 所示,适配后的模型在 Sea-thru 和 FLSea Stereo 上均有所提升,表明所提出的跨域半监督训练可以迁移到其他前馈式几何骨干网络。
D.4 Wat3R 与 Colmap
我们分析了不同重建方法在具有挑战性的水下环境中的鲁棒性。在构建 Water3D 期间,我们收集了近 100 个水下视频场景,并尝试使用一个
第 23 页
Wat3R 23
表 A4:在 FLSea Stereo 上针对合成数据和强增强的额外消融实验 我们报告多视图深度指标,以隔离合成水下数据、序列级强增强(SA)和无标签真实视频的影响。
方法 VGGT +syn +syn+SA +syn+real+SA
Rel↓ 0.136 0.131 0.132 0.126 δ1 ↑ 0.851 0.868 0.864 0.873
表 A5:将提出的自适应框架应用于 π3 [42]。我们将 VGGT 替换为 π3 作为基础前馈几何模型,并在 Sea-thru 和 FLSea Stereo 上评估多视图深度。
Sea-thru FLSea Stereo 方法 Rel↓ δ1 ↑ RMSE↓ Rel↓ δ1 ↑ RMSE↓
π3 (ICLR'26) 0.185 0.909 0.358 0.139 0.856 0.837 Wat3R (π3 作为基础模型) 0.169 0.933 0.310 0.117 0.899 0.763
改进的 COLMAP [32] 流水线来获取真实几何结构。然而,尽管经过仔细调优并使用了密集的多视图输入,经过人工检查后仅能获得 42 个场景的可靠重建结果,这些场景最终被保留在数据集中。图 A3 展示了一些代表性示例。 这些示例突显了将经典 SfM 流水线应用于水下图像的困难。在图 A3 的上部示例中,COLMAP 仅重建了船体表面的一小部分,而剩余结构变得支离破碎并伴有分散的异常值。此外,左上角可见的潜水员氧气瓶被错误地重建在船体后方,表明存在显著的几何不一致性。另一个示例显示在底部行。尽管图像在视觉上看起来清晰,但序列中的相机运动有限。在这种较小的相机基线下,COLMAP 产生了退化重建,恢复的点云坍缩为近乎平面的结构,无法恢复真实的场景几何结构。 相比之下,基于学习的方法在这些场景中显示出显著更强的鲁棒性。即使 COLMAP 无法产生有效的重建,我们的方法仍能生成连贯且结构一致的点云,更好地反映潜在的场景几何结构。
E 使用与不使用水下图像增强
许多近期的水下视觉工作 [15,26] 致力于恢复水下图像,使其 resemble 陆地场景。这种恢复旨在减少水引起的干扰,并为下游任务提供高质量的输入。因此,我们进一步研究了水下图像增强(UIE)在 3D 重建中的作用。我们使用最新的水下
第 24 页
24 J. Ren 等
输入图像 COLMAP ours VGGTCVPR'25 DA3ICLR’26 … 124 视图
… 87 视图
图 A3:Water3D 中具有挑战性的场景示例。在数据集构建过程中,我们使用改进的 COLMAP [32] 流水线从原始水下视频中重建点云。然而,由于散射效应、低纹理和有限的相机运动,许多场景仍然导致不稳定或退化的重建结果。为了进行比较,我们还展示了 Wat3R、VGGT [40] 和 DA3 [22] 的结果。虽然 COLMAP 在这些情况下无法产生可靠的重建结果,但我们的方法能够生成更连贯且几何一致的点云。
图像恢复方法以及在不同场景上训练的模型,如表 A6 所示。 然而,这种两阶段流水线并不一定有利于 3D 重建。大多数 UIE 方法旨在提高视觉清晰度,而非几何一致性,并且它们通常独立于下游几何任务进行训练。因此,增强后的图像可能无法为多视图几何估计提供可靠的线索。与其显式地去除水下效应,我们在训练期间通过将水下效应添加到陆地图像上来模拟水下条件。这种策略使模型能够在理解水下几何结构的同时隐式地学习去水效果。
表 A6:水下图像增强带来的性能变化。我们报告多视图深度估计的绝对相对误差 (Rel↓)。将 UIE 作为预处理步骤并未带来几何估计的明显改进。
Sea-thru [3] (Rel↓) FLSea Stereo [29] (Rel↓) 方法 VGGT MapAnything DA3 VGGT MapAnything DA3
原始图像 0.190 0.216 0.187 0.137 0.146 0.141 Semi-UIR [15] CVPR'23 0.201 0.218 0.195 0.136 0.148 0.147 PSPL [26] TIP'25 0.209 0.230 0.207 0.160 0.151 0.149
F 额外可视化
我们在图 A4 中提供了针对野外多视图输入的额外几何预测结果,在图 A5 中提供了我们 Water3D 数据集上的多视图输入结果,以及单目
第 25 页
Wat3R 25
输入图像 本文方法 DA3ICLR'26 MapAnything3DV’26 VGGTCVPR'25
图 A4:野外多视角 3D 重建的定性比较。我们在具有挑战性的水下场景中,将 Wat3R 与 DA3 [22]、MapAnything [17] 和 VGGT [40] 进行了比较。我们的方法生成了更连贯且完整的 3D 结构,而竞争方法则存在几何结构破碎或缺失结构的问题。
图 A6 中的输入。可以看出,我们的模型在多种场景下均实现了鲁棒且高质量的几何预测。
第 26 页
26 J. Ren 等
输入图像 真值 (GT) 本文方法 (Ours) VGGTCVPR'25 … 25 视角
… 78 视角
… 105 视角
… 58 视角
… 60 视角
… 57 视角
… 151 视角
… 48 视角
图 A5:Water3D 中不同水下场景的定性结果。 这些示例展示了我们数据集中水下环境的多样性。与 VGGT [40] 相比,Wat3R 产生了更完整且连贯的重建结果,甚至恢复了一些基于 COLMAP 的真值中缺失的结构。
第 27 页
Wat3R 27
图像 真值 本文方法 VGGTCVPR'25 DA3ICLR’26
图 A6:使用 Wat3R、DA3 [22] 和 VGGT [40] 进行单目深度估计的定性结果。第 1–2 行:SQUID [4];第 3–4 行:SeaThru [3](仅为了可视化增加了亮度);第 5–6 行:FLSea Stereo [29];第 7–8 行:FLSea VI [29]。