快速导读:WAT3R提出了一种基于物理引导的两阶段自适应前馈框架,通过神经退化适应模块和自监督学习,直接从退化水下图像中高效估计相机位姿和密集3D几何结构。
水下三维重建长期受限于成像环境的复杂性。光线的指数级衰减和背散射不仅降低了图像对比度,更破坏了跨视图的特征一致性,使得依赖精确特征匹配的传统SfM方法计算成本高昂且鲁棒性不足。尽管近期陆地场景的前馈ViT模型(如VGGT, Pi3)展示了高效的单次前向传递重建能力,但直接将其应用于水下场景时,由于严重的光学畸变域间隙,其性能急剧下降。
WAT3R提出了一种全新的解决方案:基于物理引导的两阶段自适应前馈框架。该方法不依赖耗时的逐场景优化,而是通过引入神经退化适应模块(NDAM)和自监督学习策略,直接从退化的水下图像中估计相机位姿和密集3D几何。其核心思想是利用水下图像形成模型(UIFM)作为物理先验,在合成数据上进行有监督适应以学习退化特性,进而在真实数据上通过跨视图光度一致性进行自监督微调,从而桥接陆地预训练模型与水下真实环境之间的鸿沟。
英文题目:WAT3R: Feedforward Underwater 3D Reconstruction
论文出处:arXiv 每日论文精选 · arXiv:2607.21023
原始论文:PDF / 论文页面
对应视频标题:WAT3R:如何用前馈网络解决水下三维重建的光学畸变难题|推荐指数:★★★★★
这篇论文解决什么问题?
传统水下重建方法主要依赖SfM和逐场景优化,这些方法需要大量的迭代计算来对齐特征,不仅效率低下,而且在特征稀疏或纹理重复的水下环境中极易失败。此外,水下数据缺乏真实的几何标注,限制了监督微调的应用。
近期兴起的前馈3D重建模型,如VGGT和Pi3,虽然在陆地场景中实现了实时重建,但它们假设输入图像具有清晰的纹理和一致的光照。水下环境中的颜色偏移、模糊和噪声严重违反了这些假设,导致特征提取器失效,进而产生错误的深度估计和位姿漂移。
现有的水下增强方法往往独立于重建过程,无法保证增强后的图像在几何上的一致性。而直接应用陆地模型则忽略了水下光传输的物理特性,导致模型无法适应特定的退化模式。因此,需要一种能够同时处理图像退化和几何估计的联合框架。
WAT3R旨在解决这一核心矛盾:如何在保持前馈模型高效性的同时,适应水下特有的光学畸变。其关键在于将物理模型融入神经网络,使模型能够理解并补偿水下成像过程中的退化效应。
核心创新
- 提出神经退化适应模块(NDAM),通过预测残差图恢复清洁图像,提供自监督几何约束信号。
- 设计物理引导的两阶段自适应框架,结合合成数据的全监督学习和真实数据的自监督多视图一致性学习。
- 将前馈3D重建扩展至水下场景,无需逐场景优化,实现单次前向传递的高效重建。
方法概览
WAT3R采用基于水下图像形成模型(UIFM)的两阶段训练策略:1)利用合成数据(基于Jerlov水类型)进行有监督适应,联合预测深度、清洁图像和水参数;2)在真实水下数据上进行自监督微调,通过跨视图光度一致性优化相机位姿和几何。架构包含共享骨干、神经退化适应模块(NDAM)和水参数估计头。
- WAT3R采用两阶段训练策略。第一阶段利用基于Jerlov水类型的合成数据进行有监督适应。通过水下图像形成模型(UIFM)生成具有已知几何和退化参数的合成图像,模型联合预测深度、清洁图像和水参数,从而学习水下退化的物理特性。
- 第二阶段在真实水下数据上进行自监督微调。由于缺乏真实几何标注,WAT3R利用跨视图光度一致性作为监督信号。通过优化相机位姿和几何结构,使得从不同视角重建的图像在光度上保持一致,从而适应真实环境中的复杂退化。
- 架构核心是神经退化适应模块(NDAM)。该模块预测残差图以恢复清洁图像,不仅改善了视觉质量,更为几何估计提供了自监督约束信号。NDAM与共享骨干网络协同工作,确保特征提取器能够适应水下特有的纹理和光照变化。
- WAT3R包含一个水参数估计头,用于预测水下图像形成模型中的关键参数,如衰减系数和背散射强度。这些参数不仅有助于图像恢复,还为几何估计提供了额外的物理先验,提高了模型在复杂环境中的鲁棒性。
- 与前馈基线VGGT和Pi3不同,WAT3R不直接输出几何,而是通过NDAM隐式地精炼深度估计。这种设计使得模型能够利用图像恢复过程中的中间特征,从而在特征稀疏区域也能保持几何的一致性。
- 自监督损失函数结合了光度误差和几何一致性约束。通过最小化跨视图的重投影误差,WAT3R能够同时优化相机位姿和深度图,确保重建结果在物理上是合理的。
逐图理解论文
失败直觉

直接应用陆地预训练的VGGT或Pi3模型,会因背散射和光衰减导致的特征断裂,产生严重的几何伪影和位姿漂移。
核心贡献

图2是WAT3R框架概览。重点关注NDAM模块如何与3D重建管道集成,以及UIFM如何提供物理先验。注意NDAM输出的残差图如何辅助深度估计。
最强结论

表1列出了多视图深度估计结果。重点关注WAT3R在FLSea-Canyons和SQUID数据集上的Abs Rel和δ<1.25指标,其显著优于VGGT和Pi3,证明了其有效性。
实验如何设计?
- 在FLSea-Canyons和SQUID数据集上进行多视图深度估计评估,使用Abs Rel和δ<1.25作为主要指标。
- 在USOD10K数据集上进行单目深度估计评估,注意该数据集的深度图为DPT生成的伪深度。
- 在自采集的真实水下数据集上进行相机位姿估计评估,使用ATE、RPEtrans和RPErot作为指标。
- 进行组件消融实验,包括移除NDAM和重建损失,以验证各模块的有效性。
- 分析自监督适应阶段对域间隙的缓解作用,比较有和无自监督微调的性能差异。
关键结果与论文证据
- 在FLSea-Canyons数据集上,WAT3R在Scale-only Abs Rel指标上达到0.0725,显著优于VGGT和Pi3等基线方法(第7页)。
- 在SQUID数据集上,WAT3R的Scale-only Abs Rel为0.1486,展示了其在不同水下环境中的泛化能力(第7页)。
- 在USOD10K数据集上,WAT3R的Abs Rel为0.9046,优于其他单目深度估计方法(第8页)。
- 在自采集的真实水下数据集上,WAT3R的RPErot为0.2777,比Pi3提高了21.2%,证明了其在相机位姿估计上的优越性(第8页)。
- 消融实验表明,移除NDAM会导致性能显著下降,验证了其在退化适应中的关键作用(第9页)。
- 自监督微调显著改善了模型在真实数据上的表现,特别是在特征稀疏区域(第9页)。
阅读时需要注意
- 在能见度极低的极度浑浊水下环境中,几何预测性能可能下降,因为特征信息严重不足。
- 自监督适应阶段优先优化旋转动态以最小化光度误差,可能导致特征稀疏环境下的细微尺度漂移。
- UIQM等无参考指标可能与人类感知不一致,倾向于奖励过度增强,可能影响图像恢复的视觉质量。
关联工作
- VGGT和Pi3是陆地场景前馈重建的代表性工作,WAT3R在其基础上进行了水下适应。
- SeaVGGT是另一项水下前馈重建工作,使用原型图调制,但WAT3R通过物理引导的适应策略取得了更好的效果。
- WaterSplatting是基于3DGS的水下重建方法,需要逐场景优化,而WAT3R实现了单次前向传递的高效重建。
- UIFM是WAT3R的物理基础,描述了水下光传输过程,为合成数据生成和退化适应提供了理论支持。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
WAT3R:前馈式水下三维重建
Jiayi Xu1, Jiahao Lu1, Ziqiang Zheng1, Yihao Tan2, Yaolong Zhu3 Yuan Liu1, Sai-Kit Yeung1 1香港科技大学 2香港中文大学 3北京大学
https://xujiayi777.github.io/WAT3R.github.io/
输入图像 相机位姿 清晰图像 深度图
WAT3R
…2026
世界点 Jul 23 图 1:给定退化的水下图像(左侧),WAT3R 通过单次前向传递直接估计场景几何结构,从而在退化条件下执行可靠的三维重建(中间)。它利用自监督几何驱动的退化适应来实现一致的特征匹配,生成具有更高视觉质量的准确三维场景(右侧)。
摘要 [cs.CV] 由于严重的光线衰减和后向散射,可靠的前馈式水下三维重建仍然具有挑战性,这会降低视觉质量并破坏视图间的特征一致性,导致多视图几何结构不准确。为解决这一问题,我们提出了 WAT3R,这是一种用于直接从水下图像重建三维场景的前馈框架。通过利用作为几何约束过程的退化适应,WAT3R 集成了一个轻量级的神经适应模块,以灵活地处理这些水下成像效应,从而提高多视图重建质量。WAT3R 在单次前向传递中实现,直接从水下视频中高效地输出像素对齐的三维点图和相机位姿,从而实现高质量的水下三维重建。在 FLSea、SQUID 和 USOD10K 数据集上进行的实验表明,我们的方法在三维重建任务(包括多视图/单目深度估计和相机位姿估计)上始终优于最先进的方法。arXiv:2607.21023v1 1 引言
准确的水下三维重建是自主水下系统的一项基本能力,支持导航 [1] 和检测 [2] 等应用。尽管陆地环境中的三维重建近期取得了进展,但由于水的独特光学特性,实现可靠的水下三维重建仍然具有挑战性。特别是,水下成像受波长相关的衰减和后向散射 [3] 支配,而这些效应本质上依赖于几何结构。退化的程度由光程长度、表面方向决定,
预印本。
第 2 页
以及观察方向,使得观测到的辐射亮度成为光传输与场景几何相互作用的直接结果。因此,跨视角的特征匹配和几何一致性的可靠性显著降低,使得准确的几何估计成为水下三维重建中的核心挑战。
现有的水下三维重建方法 [4, 5, 6, 7, 8, 9] 通常速度慢且不可靠,而最近的前馈式三维重建方法 [10, 11, 12, 13] 因其高效性和高质量而展现出前景。大多数现有的水下处理流程遵循两阶段范式:首先使用传统的运动恢复结构(Structure-from-Motion, SfM)估计相机位姿,然后针对每个场景进行密集三维重建优化。SfM 需要高质量的图像匹配,这对于图像质量退化的水下环境来说极具挑战性。此外,针对每个场景的密集三维优化计算密集,限制了其实时适用性和可扩展性。最近为陆地场景开发的基于前馈式视觉Transformer(ViT)的方法 [10, 11, 13, 12] 能够实现高效、场景无关的重建,无需迭代优化。例如,VGGT [10] 和 Pi3 [11] 给定一组 RGB 图像即可直接推断场景的所有关键三维属性。这些进展表明了一个有前景的方向:将前馈框架扩展至水下场景,从而可能克服传统流程的局限性。
受此启发,我们在本文中设计了 WAT3R,一种用于水下三维重建的前馈式框架。WAT3R 使我们能够以前馈方式直接从水下视频中估计相机位姿和密集三维点,这比之前的基于优化的方法高效得多。同时,通过隐式学习水下场景的三维先验,WAT3R 克服了图像质量退化,从而实现了更好的三维重建质量。
然而,开发针对水下场景的这种前馈框架并非易事。直接将陆地预训练模型应用于水下视频不可避免地会遭受严重的领域差异。这些模型无法泛化到由波长依赖性衰减和反向散射引起的复杂光学畸变,导致重建精度显著下降。一个直接的解决方案是对这些模型进行微调;然而,这揭示了水下三维视觉中最显著的瓶颈:带有真实几何信息的训练数据极度稀缺。在水下环境中获取准确的大规模三维真实值成本高昂且在实际中不可行。因此,必须探索自监督学习策略,这些策略可以在不依赖无法获取的真实值标注的情况下,将强大的陆地预训练模型适应到水下领域。
为了克服这些挑战,我们提出了一种用于水下几何估计的物理引导两阶段适应框架。我们的核心思想是利用水下图像形成模型(UIFM)[14] 的物理见解来弥合陆地和水下图像之间的领域差异。在第一阶段,我们通过将基于 UIFM 的光学退化(如波长依赖性衰减和反向散射)应用于具有可用真实几何信息的大规模陆地数据集,合成伪水下数据。这使得网络能够学习水下特定的视觉特征,同时仍然由准确的几何标签进行监督。此外,我们在这一阶段引入了基于 UIFM 的自监督重建约束:网络联合预测深度和清晰图像,并训练其满足由 UIFM 定义的物理成像关系。在第二阶段,我们使用纯自监督学习策略进一步将模型适应到真实水下数据。为了稳健地处理遮挡和静态场景假设的违反,我们采用了受 [15] 启发的带有自动掩码的最小重投影损失。具体而言,模型在清晰图像中强制跨多个视角的光度一致性,同时忽略不满足几何一致性的像素。这一阶段直接在真实水下输入上细化网络的预测,无需真实深度,从而在复杂水下环境中提高了泛化能力和重建精度。
我们在多个水下数据集上进行了广泛实验,以评估 WAT3R 的有效性,包括多视图、单目深度估计和相机位姿估计。结果表明,我们的方法始终优于最近的前馈式水下三维重建方法,同时在水下场景下保持了优越的几何保真度。
2 相关工作
基于优化的重建。水下场景重建已朝着物理信息神经渲染 [16] 发展,该方向统一了光学建模 [17] 和三维估计 [9],
2
第 3 页
清晰图像 J 原始图像 I
退化 适应模块 监督信号
水 MLP 参数 水下图像形成模型 估计 头 注册令牌
点 解码器 解码器相机 相机头 深度 z
点 DPT 局部点 共享特征 解码器 头 骨干网络
x N
图 2:WAT3R 框架概览。我们的方法将退化适应模块与 3D 重建流水线相结合。通过结合水下图像形成模型,WAT3R 利用感知退化的适应机制,从原始图像中隐式地细化深度估计和 3D 点云估计。
通过结合光传输物理模型,以在各种水下条件下实现更鲁棒和一致的结果。基于 NeRF 的方法 [17, 4, 5, 6] 在场景重建过程中对波长依赖的后向散射和衰减进行建模。WaterHE-NeRF [6] 使用直方图均衡化的伪真值预测光照衰减,而 SeaThru-NeRF [4] 将直接传输与后向散射分离。这些方法虽然准确,但计算量大且针对特定场景。基于 3DGS 的方法效率更高。WaterSplatting [7] 用体积水属性增强高斯基元,SeaSplat [8] 预测单独的后向散射和衰减图,WaterClear-GS [9] 采用双分支设计以联合实现光度一致性和无水外观恢复。然而,这些方法仍然需要逐场景优化,限制了场景无关的推理和重建精度。
前馈式重建。最近,前馈式模型已成为基于优化流水线的一种强大替代方案,能够在单次前向传递中直接从多张图像预测场景几何结构。早期方法 [18, 19, 20] 如 DUSt3R [18] 在参考相机帧中估计成对的 3D 点云,但对于大规模场景需要额外的全局对齐阶段,这既昂贵又不稳定。后续工作通过提高可扩展性和简化重建过程来解决这些限制:Fast3R [21] 能够在无需显式对齐的情况下对数千张图像进行联合推理,而 FLARE [22] 通过首先估计相机位姿然后重建场景几何来分解问题。在此基础上,最近基于前馈式 Transformer 的模型进一步推动了泛化能力和效率的极限,其中 ViT 风格架构 [10, 11, 12, 13] 利用大规模训练和多任务学习,在各种空中场景中实现场景无关的 3D 重建和实时推理。然而,由于波长依赖的后向散射和衰减导致的严重图像退化,直接将这些模型应用于水下环境仍然具有挑战性。为了解决这个问题,SeaVGGT [23] 引入了一种自监督框架,通过可学习原型的图来建模深度依赖的衰减,从而在无需标注的情况下实现鲁棒的几何估计。尽管取得了这些进展,但利用退化适应信号隐式增强 3D 几何结构的前馈式框架仍未得到充分探索。
3 方法
概览。给定 $N$ 张水下图像序列 $\{I_i \in \mathbb{R}^{H \times W \times 3} \mid i = 1, \dots, N\}$,我们的目标是联合估计:(1) 相机坐标系中的像素对齐 3D 点图 $\{P_i \in \mathbb{R}^{H \times W \times 3}\}_{i=1}^N$;(2) 相对相机位姿 $\{T_i \in SE(3)\}_{i=1}^N$。 为此,我们提出了一种通过显式利用 UIFM 过程来估计场景几何的框架,如图 2 所示。基于物理成像模型(第 3.1 节),我们的方法将前馈式重建流水线扩展至水下环境。具体而言,架构(第 3.2 节)由三个关键组件组成:用于密集几何和相机位姿估计的 3D 重建分支,用于辐射度
第 4 页
监督适应 自监督训练
模型输出 预测 真实深度 生成器 预测深度 图像 WAT3R 效果 WAT3R 扭曲 水 原始图像 水下图像 重建图像
图 3:所提出的学习流程概述。左侧:带有物理水效生成器的监督适应。右侧:通过跨视图光度一致性进行的自监督训练。
校正,以及用于建模全局物理效应的水参数估计头。在训练方面,我们首先利用基于物理原理的合成数据进行全监督训练(第 3.3 节),然后通过自监督多视图一致性将模型适应到真实世界数据(图 3)。这种设计使得辐射恢复能够有效提高重建的准确性和鲁棒性。
3.1 预备知识
水下图像形成模型 (UIFM)。它通过依赖于深度的光衰减和后向散射效应与场景几何紧密耦合,我们利用这一点来实现对前馈式重建模型在水下环境中的自监督。遵循 [14],颜色通道 $c \in \{R, G, B\}$ 的观测强度 $I_c$ 为:
$I_c = J_c \cdot e^{-\beta_{att}^c z} + B_\infty^c \cdot (1 – e^{-\beta_{bs}^c z})$ (1)
其中 $J_c$ 是真实辐射亮度,$z$ 是场景深度,$\beta_{att}^c, \beta_{bs}^c, B_\infty^c$ 分别表示全局参数 $\beta_{att}, \beta_{bs}, B_\infty \in \mathbb{R}^3$ 的第 $c$ 个分量。第一项建模直射传输,随深度衰减并降低亮度和对比度;第二项捕捉后向散射。它们对深度和波长的依赖性解释了在更深区域中严重的色偏和对比度退化。
受此模型启发,我们的框架以两种方式利用几何与辐射亮度之间的强关系。在方法上,我们首先利用公式 (1) 构建一个具有可控退化的大规模合成数据集,其中真实深度和相机参数使我们能够在物理一致的水下条件下对模型进行全监督适应。在架构上,我们随后引入了来自退化适应模块 (NDAM) 的辅助监督信号,使得辐射校正能够提供互补线索,从而通过自监督学习进一步改善水下场景中的几何估计。
讨论。公式 (1) 是一个简化且不完美水下成像模型。因此,我们的方法并不将公式 (1) 作为几何估计中的硬性约束。相反,我们将其应用于构建用于域适应的伪数据集。然后,我们基于该方程构建损失函数,它起到软正则化的作用,引导我们的模型提高几何估计质量。
3.2 模型结构
为了有效建模如第 3.1 节所述在辐射亮度变化下的场景几何,我们构建了一个共享特征提取骨干网络,该网络为 3D 重建产生丰富的多尺度表示。此外,我们引入了一个神经退化适应模块 (NDAM) 和一个水参数估计头,以建模特定场景的辐射效应。退化适应模块 (NDAM) 预测在不同水下条件下的退化感知干净图像,提供辅助自监督信号,鼓励退化不变的几何特征。同时,水参数估计头捕捉水介质的场景依赖光学特性。这些组件共同提高了对视觉损坏的鲁棒性,并实现了更准确的几何估计。
3D 重建分支。我们的 3D 重建分支遵循 [11] 中提出的架构。具体而言,输入 RGB 图像首先由编码器处理以产生图块令牌 (patch tokens)。这些
4
第 5 页
patch tokens 与一组 register tokens 一起被输入到解码器中,以获得精炼的表示,随后这些表示被传递到下游预测分支。通过一项关键修改,我们将它们原始的逐点预测头替换为密集预测 Transformer (DPT) 头 [24]。这一调整旨在消除通常由依赖像素重排操作的原始上采样 MLP 引入的网格状伪影,从而产生更平滑且几何上更一致的深度预测。
神经退化适应模块 (NDAM)。该模块预测一个感知退化的清晰图像,以在不同的水下条件下提供自监督引导。它利用从编码器第 $l$ 阶段提取的中间编码器特征 $X_{li} \in \mathbb{R}^{C_l \times H_l \times W_l}$(针对视图 $i$),这些特征捕捉了丰富的分层图像纹理。这些多尺度特征首先被投影到共同的维度空间,然后通过聚合器处理以融合不同尺度的信息: $$ F_i = \mathcal{A} \left( \sum_{l=1}^{L} \text{Proj}(X_{li}) \right), \quad (2) $$ 其中 $\text{Proj}(\cdot)$ 表示投影操作,$\mathcal{A}(\cdot)$ 代表聚合器模块。融合后的特征 $F_i$ 随后通过上采样块传递,以逐步恢复空间分辨率,生成估计底层退化的残差图 $R_i$。最终的清晰图像是通过将此残差添加到原始输入中获得的: $$ J_i = \text{clip}(I_i + R_i, 0, 1). \quad (3) $$ 将退化预测为残差可以稳定训练过程,迫使网络专注于建模损坏模式,同时有效保留原始图像的高频细节。
水参数估计头。为了预测场景级的水参数,该头利用解码器的 register tokens $r_i$,这些 tokens 封装了场景的全局上下文。参数通过一个轻量级多层感知机 (MLP) $f$ 进行回归: $$ w_i = f(r_i), \quad (4) $$ 其中 $w_i = \{\beta_{att}, \beta_{bs}, B_\infty\}$ 表示估计的全局物理参数。这种架构设计明确地将全局物理环境的估计与退化适应过程解耦,使模型能够有效利用全局上下文信息。
3.3 训练策略
合成数据生成。为了克服现实世界水下数据集中高质量几何标注稀缺的问题,我们利用大规模陆地 RGB-D 数据集,这些数据集提供度量准确的深度图和相机位姿,作为预训练前馈式 (Feedforward) 模型水下适应的全几何监督。使用空中图像及其对应的深度图,我们基于公式 (1) 中表述的水下图像形成模型 (UIFM) 合成物理上合理的水下观测结果。
为了确保严格的物理真实性,衰减和后向散射系数 ($\beta_{att}^c, \beta_{bs}^c$) 严格从 Jerlov 水类型的测量固有光学特性 (IOPs) 中采样 [25]。具体而言,衰减和后向散射系数源自一个综合的海洋光学数据库,该数据库涵盖了六种代表性的水体条件,从光学清澈 (Jerlov IB) 到高度浑浊 (Jerlov 5C) 的水域。图 4 说明了这些模拟水类型之间的视觉变化。此外,全局背景光 $B_\infty^c$ 遵循 ULAP 模型 [26] 进行估计,利用 UVEB 数据集 [27] 中的不同背景光样本模拟多样化的水下光照条件。
合成数据上的监督适应。我们以端到端的方式将网络适应到水下领域: $$ \mathcal{L} = \lambda_J \mathcal{L}_J + \lambda_{recon} \mathcal{L}_{recon} + \lambda_{water} \mathcal{L}_{water} + \lambda_{points} \mathcal{L}_{points} + \lambda_{cam} \mathcal{L}_{cam}. \quad (5) $$
第 6 页
此处,$L_J$ 为退化适应损失,它结合了 L1 重建损失、感知损失和 SSIM 损失,以确保清晰图像的光度保真度和结构保真度。$L_{recon}$ 通过使输入水下图像与水下成像模型生成的重渲染图像相匹配来强制执行物理一致性。$L_{water}$ 是用于监督全局水体参数估计的 L2 回归损失。对于几何学习,$L_{points}$ 是在尺度对齐后应用于像素对齐的 3D 点预测的深度加权 L1 损失,而 $L_{cam}$ 使用旋转距离和平移误差的 Huber 损失来监督相对相机位姿。使用合成数据提供了对所有组件的完整监督,使得在陆地图像上预训练的模型首先适应水下数据。然后,我们将进一步在水下数据上应用自监督损失。
真实数据上的自监督训练。 为了弥合合成陆地训练数据与真实水下环境之间的域差异,WAT3R 随后通过一种自监督学习方法适应未标记的真实世界水下序列,该方法受 [15] 启发。该方法利用相邻帧之间的一致性,根据深度估计将相邻帧相互扭曲,然后强制执行一致性。
具体而言,预测的清晰图像 $\hat{J}$ 充当跨多个视图严格一致的无水印场景表示。对于给定的源视图 $i$ 和目标视图 $j$,我们利用预测的源深度 $\hat{D}_i$、相对相机位姿 $\hat{T}_{i \to j}$ 和相机内参 $K$,通过可微逆扭曲合成源坐标系中的相应清晰图像:
$$ \hat{J}_{j \to i} = \text{Warp}(\hat{J}_j, \hat{D}_i, \hat{T}_{i \to j}, K) \quad . \quad (6) $$
自监督目标强制合成清晰视图与预测源清晰视图之间的光度一致性。为了稳健地处理遮挡和动态移动物体,我们应用自动掩码机制 $M_i$ 以过滤掉不可靠区域:
$$ L_{self} = L_{photo}(\hat{J}_{j \to i}, \hat{J}_i \odot M_i) \quad . \quad (7) $$
经验表明,虽然形成模型(公式 (1))稳健地约束了深度估计,但从合成数据到真实数据的域偏移不成比例地降低了相机位姿预测的准确性。这种不准确性在视图合成过程中级联到深度图中,导致几何重建不稳定。因此,在自监督训练阶段,我们专注于使用清晰图像优化相机位姿。通过最小化无水印表示之间的差异,我们有效地稳定了位姿估计,并确保真实世界序列之间具有优越的几何一致性。
4 实验
4.1 多视图深度估计
基准和指标。 我们在两个水下基准上评估我们的模型:FLSea-Canyons [28] 和 SQUID [29]。这两个数据集都提供了具有不同浑浊度和结构复杂性的水下场景的真实深度标注。遵循先前的工作 [10, 11],我们在两种对齐协议下报告结果:(1) 仅尺度对齐和 (2) 尺度和平移对齐,确保在不同归一化设置下的公平比较。对于定量评估,我们采用两个标准的深度估计指标:绝对相对误差 (Abs Rel) 和阈值 $\delta < 1.25$ 下的准确率。Abs Rel 值越低表示深度准确性越好,而较高的准确率反映了更可靠的像素级深度预测。
与现有方法的比较。 定量比较总结在表 1 中。在两个数据集和对齐设置下,WAT3R 始终取得最佳或极具竞争力的性能。在 FLSea-Canyons 上,我们的方法在两种对齐策略下均获得了最低的 Abs Rel,同时也实现了最高的 $\delta < 1.25$ 准确率。在 SQUID 数据集上,WAT3R 实现了最低的 Abs Rel 并保持具有竞争力的准确率,表现出强大的鲁棒性和跨数据集泛化能力。
图 5 展示了在代表性水下场景的 2D 深度图方面的比较。现有方法往往遭受物体边界模糊或碎片化伪影的影响:MapAnything [13] 表现出明显的块状不连续性,而 VGGT [10] 和 Pi3 [11] 在鱼和珊瑚等细结构周围显示出深度渗漏。相比之下,WAT3R 保留了更清晰的轮廓和更清晰的前景-背景分离。此外,如图 6 所示,我们的方法有效地
6
第 7 页
序列 图像
图像 单张
原始图像 VGGT Pi3 DA3 MapAnything WAT3R (Ours)
图 5:水下场景深度估计结果的定性比较。颜色表示从近(蓝色)到远(红色)的相对深度。
表 1:FLSea-Canyons [28] 和 SQUID [29] 数据集上的多视图深度估计。我们报告了仅尺度对齐和尺度-平移对齐下的误差指标(Abs Rel, δ < 1.25)。最佳结果以深蓝色高亮显示,次佳结果以浅蓝色高亮显示。
FLSea-Canyons SQUID 方法 Abs Rel ↓ δ < 1.25 ↑ Abs Rel ↓ δ < 1.25 ↑
对齐方式:仅尺度
UDepth[30] 0.3068 0.3918 0.4152 0.2744 TRUDepth [31] 0.0728 0.9490 0.2917 0.4764 VGGT [10] 0.1263 0.8712 0.1632 0.8215 Pi3 [11] 0.0891 0.9613 0.1959 0.7740 DA3 [12] 0.0943 0.9345 0.1570 0.7753 MapAnything [13] 0.1251 0.8566 0.1585 0.7880
WAT3R (Ours) 0.0725 0.9726 0.1486 0.8501
对齐方式:尺度和平移
UDepth[30] 0.3296 0.5277 0.4555 0.4905 TRUDepth [31] 0.0698 0.9518 0.2465 0.5395 VGGT [10] 0.1209 0.8700 0.1501 0.8575 Pi3 [11] 0.0819 0.9660 0.1832 0.8994 DA3 [12] 0.0929 0.9282 0.1384 0.8356 MapAnything [13] 0.1147 0.8757 0.1332 0.8380
WAT3R (Ours) 0.0693 0.9728 0.1369 0.8964
避免了 DA3 [12] 和其他基线方法中常见的几何畸变和“漂浮像素”问题,保持了更优越的结构一致性和真实的表面几何形状。这些定性改进与表 1 中报告的定量提升相一致。
4.2 单目深度估计
基准和指标。我们在 USOD10K [32] 基准上评估单目深度估计。需要注意的是,USOD10K [32] 数据集中的深度图是由 DPT [24] 方法生成的伪深度图,而非由硬件传感器测量的真实深度值。因此,与真实的物理深度相比,它们可能包含不准确之处,尤其是在复杂的水下环境中。尽管如此,我们仍将其作为几何参考,以比较不同模型的性能。对于指标,我们继续使用两个标准的深度估计指标来
7
第 8 页
原始图像 VGGT Pi3
DA3 MapAnything WAT3R (Ours)
原始图像 VGGT Pi3
DA3 MapAnything WAT3R (Ours)
图 6:水下场景 3D 点云重建的定性比较。与现有方法相比,我们提出的 WAT3R 实现了更完整的几何结构和更精细的细节,特别是在红色虚线框标出的区域。
评估我们的单目方法:绝对相对误差 (Abs Rel),以及阈值 δ < 1.25 下的准确率。
与现有方法的比较。如表 2 所示,我们在 USOD10K 数据集上将 WAT3R 与先前方法进行了比较。UDepth 和 TRUDepth 是单目深度模型,而其他方法使用前馈式重建。尽管如此,WAT3R 取得了最佳的 Abs Rel (0.9046),表现出更强的全局深度鲁棒性,并明显优于 UDepth 和 TRUDepth。虽然 DA3 在 δ < 1.25 上略胜一筹,但 WAT3R 在各项指标上保持了更好的整体平衡,表明其在复杂水下场景中具有更稳定的性能。
表 2:USOD10K [32] 数据集上的单目深度估计。我们报告误差指标 (Abs Rel, δ < 1.25)。最佳结果以深蓝色高亮显示,次佳结果以浅蓝色高亮显示。 方法 Abs Rel ↓ δ < 1.25 ↑ UDepth [30] 0.9250 0.3310 TRUDepth [31] 1.3036 0.4413 VGGT [10] 0.9851 0.4720 Pi3 [11] 0.9851 0.4720 DA3 [12] 1.1322 0.5330 MapAnything [13] 1.0013 0.4702
WAT3R (Ours) 0.9046 0.4916
表 3:在我们自收集的真实水下数据集上的相机位姿估计。我们报告标准评估指标,包括 ATE、RPEtrans 和 RPErot。深蓝色和浅蓝色分别表示最佳和次佳结果。 模型 ATE ↓ RPEtrans ↓ RPErot ↓ VGGT [10] 1.2612 0.4700 0.4181 Pi3 [11] 0.2353 0.0680 0.3525 DA3 [12] 0.2025 0.0856 0.4133 MapAnything [13] 0.2965 0.1148 0.6570
WAT3R (Ours) 0.2321 0.0721 0.2777
8
第 9 页
4.3 相机位姿估计
基准与指标。我们在自然海洋环境中采集的自收集真实水下数据集上评估相机位姿估计。该数据集包含由水流引起的具有挑战性的运动模式、动态光照变化以及特征稀疏区域,使得准确的位姿恢复尤为困难。对于定量评估,我们采用标准的轨迹评估指标,包括绝对轨迹误差(ATE)、相对平移误差(RPEtrans)和相对旋转误差(RPErot)。较低的值表示更好的位姿精度和轨迹一致性。
与现有方法的比较。表3总结了不同模型在相机位姿估计上的定量评估结果。虽然我们的WAT3R在旋转稳定性方面取得了重大突破,与Pi3 [11]相比将RPErot降低了21.2%,但我们观察到ATE和RPEtrans略有下降。这种现象主要归因于在真实水下序列上进行自监督适应期间的优化优先级转移。具体而言,自监督目标倾向于优先捕捉由水流引起的复杂角度动态以最小化光度误差,这可能会在特征稀疏的水下环境中引入细微的尺度漂移。
4.4 消融实验
不同组件的消融。为了评估我们提出的框架中每个组件的贡献,我们进行了全面的消融研究。具体而言,不同的配置如下:(1) 无神经退化适应模块(w/o NDAM):我们直接从退化的水下图像中预测深度和相机位姿,并仅由真实标签进行监督。(2) 无重建损失(w/o Lrecon):在此设置中,我们采用两阶段方法:图像首先输入神经退化适应模块,且不允许梯度反向传播,从而防止联合优化。(3) 含重建损失(ours):引入Lrecon使得退化适应过程能够提供显式的几何约束,有效地引导模型学习符合物理规律的特征以进行重建。
表4: FLsea-canyons数据集上的消融研究。深蓝色表示最佳性能,浅蓝色表示第二佳性能。 表5: 自监督适应与域间隙分析上的消融。我们比较了有无自监督微调的相机位姿估计。深蓝色表示最佳性能。
| Method | Abs Rel ↓ | δ < 1.25 ↑ | | :— | :— | :— | | (1) w/o NDAM | 0.0773 | 0.9526 | | (2) w/o Lrecon | 0.0704 | 0.9722 | | (3) Ours | 0.0692 | 0.9728 |
| Setting | ATE ↓ | RPEtrans ↓ | RPErot ↓ | | :— | :— | :— | :— | | w/o SSA | 0.2332 | 0.0784 | 0.3982 | | w/ SSA | 0.2321 | 0.0721 | 0.2777 |
自监督适应(SSA)与域间隙分析的消融。我们进一步评估了我们的框架对真实水下数据集的适应性,在这些数据集中无法获得真实干净的图像。在此设置下,预训练模型仅使用自监督信号(如多视图几何扭曲损失)进行微调。表5显示,与预训练模型相比,自监督训练进一步提高了旋转和平移精度,证明了该框架仅利用几何和光度线索适应新水下环境的能力。
观察。除了重建任务外,我们观察到尽管我们的适应模块并非专门为此目的设计,但它本质上表现出强大的恢复能力。重建的图像表现出高视觉保真度,表明该模块隐式地优先考虑了水下光退化的底层物理规律。由于篇幅限制,我们在补充材料中提供了广泛的定性和定量分析。
5 结论
在本文中,我们介绍了WAT3R,这是一种前馈式水下3D重建框架,它显式地对水下图像形成中依赖于几何的特性进行建模。通过利用带有重建分支的神经退化适应模块,并结合物理引导的水下图像形成模型,WAT3R将其作为辅助监督信号
第 10 页
以提升三维重建精度。与解耦流水线或基于优化的神经渲染方法不同,我们的方法以场景无关且计算高效的方式实现了物理一致的重建。此外,我们的混合训练策略将大规模合成监督与真实数据的自监督适应相结合,显著提高了在各种水下条件下的鲁棒性。我们相信,这项工作代表了向物理基础水下场景重建迈出的有意义一步。
参考文献
[1] Sharmin Rahman, Alberto Quattrini Li, 和 Ioannis M. Rekleitis. Svin2: 用于水下导航的具有回环检测的声纳视觉惯性 SLAM. CoRR, 2018.
[2] Pengyu Wang, Hin Wang Lin, Jialu Li, Jiankun Wang, Ling Shi, 和 Max Q.-H. Meng. Pierguard: 用于水下机器人检查海岸码头的规划框架. IEEE Trans Autom. Sci. Eng., 22:15941–15952, 2025.
[3] Derya Akkaynak, Tali Treibitz, Tom Shlesinger, Yossi Loya, Raz Tamir, 和 David Iluz. 水下计算机视觉中衰减系数的空间是什么?在 2017 IEEE 计算机视觉与模式识别会议, CVPR 2017, 美国夏威夷州檀香山, 2017 年 7 月 21-26 日, 第 568–577 页. IEEE Computer Society, 2017.
[4] Deborah Levy, Amit Peleg, Naama Pearl, Dan Rosenbaum, Derya Akkaynak, Simon Korman, 和 Tali Treibitz. Seathru-nerf: 散射介质中的神经辐射场. 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 56–65 页, 2023.
[5] Advaith Venkatramanan Sethuraman, Manikandasriram Srinivasan Ramanagopal, 和 Katherine A Skinner. Waternerf: 用于水下场景的神经辐射场. 在 OCEANS 2023-MTS/IEEE 美国墨西哥湾沿岸, 第 1–7 页. IEEE, 2023.
[6] Jingchun Zhou, Tianyu Liang, Dehuan Zhang, 和 Zongxin He. Waterhe-nerf: 用于水下场景重建的水射线追踪神经辐射场, 2024.
[7] Huapeng Li, Wenxuan Song, Tianao Xu, Alexandre Elsig, 和 Jonas Kulhanek. Watersplatting: 使用高斯泼溅进行快速水下三维场景重建. 在 2025 国际三维视觉会议 (3DV), 第 969–978 页. IEEE, 2025.
[8] Daniel Yang, John J Leonard, 和 Yogesh Girdhar. Seasplat: 使用 3D 高斯泼溅和物理基础图像形成模型表示水下场景. 在 2025 IEEE 机器人与自动化国际会议 (ICRA), 第 7632–7638 页. IEEE, 2025.
[9] Xinrui Zhang, Yufeng Wang, Shuangkang Fang, Zesheng Wang, Dacheng Qi, 和 Wenrui Ding. Waterclear-gs: 用于水下重建和恢复的光学感知高斯泼溅, 2026.
[10] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny. Vggt: 视觉几何基础 Transformer. 在计算机视觉与模式识别会议论文集, 第 5294–5306 页, 2025.
[11] Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, 和 Tong He. pi3: 置换等变视觉几何学习. arXiv 预印本 arXiv:2507.13347, 2025.
[12] Haotong Lin, Sili Chen, Junhao Liew, Donny Y. Chen, Zhenyu Li, Guang Shi, Jiashi Feng, 和 Bingyi Kang. Depth anything 3: 从任意视角恢复视觉空间, 2025.
[13] Nikhil Keetha, Norman Müller, Johannes Schönberger, Lorenzo Porzi, Yuchen Zhang, Tobias Fischer, Arno Knapitsch, Duncan Zauss, Ethan Weber, Nelson Antunes, Jonathon Luiten, Manuel Lopez-Antequera, Samuel Rota Bulò, Christian Richardt, Deva Ramanan, Sebastian Scherer, 和 Peter Kontschieder. Mapanything: 通用前馈式度量三维重建, 2026.
[14] Derya Akkaynak 和 Tali Treibitz. 修订后的水下图像形成模型. 在 2018 IEEE/CVF 计算机视觉与模式识别会议, 第 6723–6732 页, 2018.
10
第 11 页
[15] Clément Godard, Oisin Mac Aodha, Michael Firman, 和 Gabriel J. Brostow。深入探讨自监督单目深度预测。2019年10月。
[16] Derya Akkaynak 和 Tali Treibitz。Sea-thru:一种从水下图像中去除水干扰的方法。在 2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 1682–1691 页,2019 年。
[17] Yunkai Tang, Chengxuan Zhu, Renjie Wan, Chao Xu, 和 Boxin Shi。神经水下场景表示。在 2024 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 11780–11789 页,2024 年。
[18] Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris Chidlovskii, 和 Jérôme Revaud。Dust3r:让几何 3D 视觉变得简单。在 IEEE/CVF 计算机视觉与模式识别会议,CVPR 2024,美国华盛顿州西雅图,2024 年 6 月 16-22 日,第 20697–20709 页。IEEE,2024 年。
[19] Junyi Zhang, Charles Herrmann, Junhwa Hur, Varun Jampani, Trevor Darrell, Forrester Cole, Deqing Sun, 和 Ming-Hsuan Yang。Monst3r:一种在存在运动的情况下估计几何结构的简单方法。arXiv 预印本 arXiv:2410.03825,2024 年。
[20] Jiahao Lu, Tianyu Huang, Peng Li, Zhiyang Dou, Cheng Lin, Zhiming Cui, Zhen Dong, Sai-Kit Yeung, Wenping Wang, 和 Yuan Liu。Align3r:用于动态视频的对齐单目深度估计。在计算机视觉与模式识别会议论文集,第 22820–22830 页,2025 年。
[21] Jianing Yang, Alexander Sax, Kevin J Liang, Mikael Henaff, Hao Tang, Ang Cao, Joyce Chai, Franziska Meier, 和 Matt Feiszli。Fast3r:迈向单次前向传递中 1000+ 张图像的 3D 重建。在计算机视觉与模式识别会议论文集,第 21924–21935 页,2025 年。
[22] Shangzhan Zhang, Jianyuan Wang, Yinghao Xu, Nan Xue, Christian Rupprecht, Xiaowei Zhou, Yujun Shen, 和 Gordon Wetzstein。Flare:基于未校准稀疏视图的前馈式几何、外观和相机估计。在计算机视觉与模式识别会议论文集,第 21936–21947 页,2025 年。
[23] Linqing Zhao, Wenzhao Zheng, Zelan Zhu, Haibin Yan, 和 Jiwen Lu。基于自监督原型图调制的 underwater 视觉几何估计,2026 年。
[24] René Ranftl, Alexey Bochkovskiy, 和 Vladlen Koltun。用于密集预测的视觉变换器。CoRR,2021 年。
[25] Craig A. Williamson 和 Richard C. Hollins。测量 Jerlov 水类型的 IOPs。应用光学,61(33):9951–9961,2022 年 11 月。
[26] Wei Song, Yan Wang, Dongmei Huang, 和 Dian Tjondronegoro。基于水下光衰减先验的快速场景深度估计模型用于水下图像复原。在多媒体信息处理进展 – PCM 2018:第 19 届太平洋地区多媒体会议,中国合肥,2018 年 9 月 21-22 日,论文集,第一部分,第 678–688 页,柏林,海德堡,2018 年。Springer-Verlag。
[27] Yaofeng Xie, Lingwei Kong, Kai Chen, Ziqiang Zheng, Xiao Yu, Zhibin Yu, 和 Bing Zheng。Uveb:面向真实世界水下视频增强的基准和基线。在 2024 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 22358–22367 页,2024 年。
[28] Yelena Randall 和 Tali Treibitz。Flsea:水下视觉-惯性及立体视觉前视数据集,2023 年。
[29] Dana Berman, Deborah Levy, Shai Avidan, 和 Tali Treibitz。利用雾线和新的定量数据集进行水下单图像颜色复原。IEEE 模式分析与机器智能汇刊,2020 年。
11
第 12 页
[30] Boxiao Yu, Jiayi Wu, 和 Md Jahidul Islam。Udepth: 面向视觉引导水下机器人的快速单目深度估计。在 IEEE 国际机器人与自动化会议 (ICRA) 上。IEEE, 2023。
[31] Luca Ebner, Gideon Billings, 和 Stefan Williams。通过稀疏先验实现水下机器人的度量尺度单目深度估计, 2023。
[32] Lin Hong, Xin Wang, Gan Zhang, 和 Ming Zhao。Usod10k: 水下显著目标检测的新基准数据集。IEEE 图像处理汇刊, 34:1602–1615, 2025。
[33] Yohann Cabon, Naila Murray, 和 Martin Humenberger。Virtual kitti 2, 2020。
[34] Wenshan Wang, Delong Zhu, Xiangwei Wang, Yaoyu Hu, Yuheng Qiu, Chen Wang, Yafei Hu, Ashish Kapoor, 和 Sebastian Scherer。Tartanair: 推动视觉 SLAM 极限的数据集。2020。
[35] Po-Han Huang, Kevin Matzen, Johannes Kopf, Narendra Ahuja, 和 Jia-Bin Huang。Deep-mvs: 学习多视图立体视觉。在 IEEE 计算机视觉与模式识别会议 (CVPR) 上, 2018。
[36] Nisha Varghese, Ashish Kumar, 和 A. N. Rajagopalan。自监督单目水下深度恢复、图像恢复及真实海洋视频数据集。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 12248–12258 页, 2023 年 10 月。
[37] Opher Bar Nathan, Deborah Levy, Tali Treibitz, 和 Dan Rosenbaum。Osmosis: 用于水下图像恢复的 RGBD 扩散先验。在计算机视觉 – ECCV 2024 – 第 18 届欧洲会议, 意大利米兰, 2024 年 9 月 29 日至 10 月 4 日, 论文集, 第 LXII 部分, Lecture Notes in Computer Science 第 15120 卷, 第 302–319 页。Springer, 2024。
[38] Pushmeet Kohli, Nathan Silberman, Derek Hoiem 和 Rob Fergus。基于 RGBD 图像的室内分割与支持推断。在 ECCV 上, 2012。
[39] Chongyi Li, Chunle Guo, Wenqi Ren, Runmin Cong, Junhui Hou, Sam Kwong, 和 Dacheng Tao。水下图像增强基准数据集及 beyond, 2019。
[40] Karen Panetta, Chen Gao, 和 Sos Agaian。受人类视觉系统启发的水下图像质量度量。IEEE 海洋工程汇刊, 41(3):541–551, 2016。
[41] Junjie Ke, Qifei Wang, Yilin Wang, Peyman Milanfar, 和 Feng Yang。Musiq: 多尺度图像质量变换器, 2021。
[42] Jiayi Wu, Tianfu Wang, Md Abu Bakr Siddique, Md Jahidul Islam, Cornelia Fermuller, Yiannis Aloimonos, 和 Christopher A. Metzler。用于水下图像恢复的单步潜在扩散模型, 2025。
[43] Yan-Tsung Peng, Yen-Rong Chen, Guan-Rong Chen, 和 Chun-Jung Liao。Histoformer: 用于高效水下图像增强的基于直方图的变换器。IEEE 海洋工程汇刊, 50(1):164–177, 2025。
[44] Zhenqi Fu, Huangxing Lin, Yan Yang, Shu Chai, Liyan Sun, Yue Huang, 和 Xinghao Ding。无监督水下图像恢复:从同源性视角。在第三十六届人工智能协会年会 (AAAI 2022), 第三十四届人工智能创新应用会议 (IAAI 2022), 第十二届人工智能教育进展研讨会 (EAAI 2022) 虚拟会议, 2022 年 2 月 22 日至 3 月 1 日, 第 643–651 页。AAAI 出版社, 2022。
[45] Lintao Peng, Chunli Zhu, 和 Liheng Bian。用于水下图像增强的 U 形变换器。IEEE 图像处理汇刊, 32:3066–3079, 2023。
[46] Song Zhang, Shili Zhao, Dong An, Daoliang Li, 和 Ran Zhao。Liteenhancenet: 用于实时单幅水下图像增强的轻量级网络。Expert Systems with Applications, 240:122546, 2024。
12
第 13 页
[47] Johannes Lutz Schönberger, Enliang Zheng, Marc Pollefeys, 和 Jan-Michael Frahm. 非结构化多视图立体视觉中的逐像素视图选择。在欧洲计算机视觉会议 (ECCV) 上,2016 年。
[48] Johannes Lutz Schönberger 和 Jan-Michael Frahm. 重新审视运动恢复结构。在计算机视觉与模式识别会议 (CVPR) 上,2016 年。
[49] Carlos Campos, Richard Elvira, Juan J. Gómez, José M. M. Montiel, 和 Juan D. Tardós. ORB-SLAM3:一种用于视觉、视觉-惯性及多地图 SLAM 的精确开源库。《IEEE 机器人汇刊》,37(6):1874–1890,2021 年。
13
第 14 页
A 概述
本补充材料提供了我们 WAT3R 框架的更多细节。第 B 节介绍了其实现细节。第 C 节展示了水下图像恢复的额外定性及定量分析。第 D 节描述了基于测量的固有光学特性 (IOPs) 和 Jerlov Water Types 的合成数据生成流程细节。第 E 节介绍了我们的真实水下数据集,并评估了我们的位姿估计方法相对于视觉里程计基线的性能。最后,第 F 节讨论了在极浑浊水体中的当前局限性,并概述了可能的未来改进方向。
B 实现细节
我们的模型分两个阶段进行训练。在第一阶段,我们专注于监督适应以优化基础几何模型,利用 VKITTI [33]、Tartanair [34] 和 MVS-Synth [35] 等提供高质量真实标签监督的数据集。在第二阶段,我们在 FLSea-RedSea [28] 和 DRUVA [36] 数据集上进行自监督训练,以使框架适应复杂的真实水下环境。我们采用 AdamW 优化器,基础学习率为 $5 \times 10^{-6}$,权重衰减为 0.05。为了提高训练效率,我们使用动态分辨率缩放,像素数量范围为 $[100,000, 255,000]$,块大小为 14。所有实验均使用八块 NVIDIA RTX 4090 GPU 进行,并以 Pi3 [11] 作为骨干网络的初始化。
B.1 神经退化适应模块
这是一个辅助模块,旨在通过聚合多尺度潜在特征并强制空间一致性来减轻水下退化。
特征投影与聚合 给定从 DINOv2 编码器的第 $l$ 层提取的视图 $i$ 的一组中间特征图 $\{X_{li}\}_{l \in L}$(其中 $L$ 表示选定的层索引),我们首先将每个特征图投影到公共嵌入空间中:
$$ \hat{X}_{li} = \text{Proj}(X_{li}) = \text{Conv}^{(l)}_{1 \times 1}(X_{li}) \in \mathbb{R}^{d_{\text{proj}} \times h \times w}, \quad (8) $$
其中 $h = H/14$ 和 $w = W/14$ 表示块级分辨率。这些多尺度特征被聚合和融合以形成初始潜在表示 $F_i$:
$$ F_i = \mathcal{A} \left( \{ \hat{X}_{li} \}_{l \in L} \right) \in \mathbb{R}^{2d_{\text{proj}} \times h \times w}, \quad (9) $$
其中 $\mathcal{A}(\cdot)$ 表示由 $1 \times 1$ 卷积、GroupNorm 和 GELU 激活组成的聚合器模块。
迭代条件上采样 为了逐步恢复高频空间细节,我们采用一系列 $K=4$ 个条件上采样块 $\Phi_k$。令 $x_k$ 为第 $k$ 阶段的特征图,初始状态为 $x_0 = F_i$。在每个阶段,特征与归一化的 UV 坐标网格 $G_k$ 以及下采样的原始图像 $I_i^{(k)}$ 进行拼接,以提供空间和外观先验:
$$ z_k = \text{Concat}(x_{k-1}, G_k, I_i^{(k)}) \in \mathbb{R}^{(C_k+2+3) \times H_k \times W_k}. \quad (10) $$
然后,潜在特征通过块 $\Phi_k$ 进行更新和上采样:
$$ x_k = \Phi_k(z_k) = \text{Block}(\text{Upsample}_{2 \times}(\text{Block}(z_k))), \quad (11) $$
其中每个 $\text{Block}(\cdot)$ 表示 $3 \times 3$ 卷积、GroupNorm 和 GELU 激活的序列。
残差重建 最终残差图 $R_i$,用于估计底层退化模式,通过在原始分辨率 $H \times W$ 上将最终上采样特征与全分辨率坐标及输入图像融合来预测:
$$ R_i = \text{Conv}_{\text{out}}(\text{Concat}(\text{Interp}(x_K), G_{\text{full}}, I_i)). \quad (12) $$
14
第 15 页
最终恢复的清晰图像 $\hat{J}_i$ 通过以下公式获得: $\hat{J}_i = \text{clip}(I_i + R_i, 0, 1)$. (13)
通过将退化建模为残差 $R_i$,网络在通过图像重建的辅助监督稳定训练过程的同时,有效地保留了原始场景的精细纹理。
B.2 监督适应
训练目标定义为
$L = \lambda_J L_J + \lambda_{\text{recon}} L_{\text{recon}} + \lambda_{\text{water}} L_{\text{water}} + \lambda_{\text{points}} L_{\text{points}} + \lambda_{\text{cam}} L_{\text{cam}}$, (14)
其中我们设置 $\lambda_J = 0.5$,$\lambda_{\text{recon}} = 0.3$,$\lambda_{\text{points}} = 1.0$,$\lambda_{\text{cam}} = 0.2$,以及 $\lambda_{\text{water}} = 0.3$。
恢复监督损失定义为
$L_J = \lambda_{L1} L_{L1} + \lambda_{\text{perc}} L_{\text{perc}} + \lambda_{\text{ssim}} L_{\text{ssim}}$ (15)
该损失强制预测结果与真实值(ground truth)之间的像素保真度、感知相似性和结构一致性。我们设置 $\lambda_{L1} = 0.8$,$\lambda_{\text{perc}} = 0.1$,以及 $\lambda_{\text{ssim}} = 0.2$。
水参数监督使用均方误差定义: $L_{\text{water}} = \|w_{\text{pred}} – w_{\text{gt}}\|_2^2$. (16)
额外的几何损失遵循 [11],网络为每个输入图像预测一个像素对齐的 3D 点图 $\hat{X}_i$。为了解决单目尺度模糊问题,预测的点使用全局尺度因子 $\hat{s}$ 与真实值对齐。损失定义为深度加权的 L1 距离:
$\sum_{i=1}^{N} \sum_{j=1}^{H \times W} \frac{1}{z_{i,j}} \|\hat{s}\hat{x}_{i,j} – x_{i,j}\|_1$. (17)
网络还预测相机位姿 $\hat{T}_i$。使用相同的尺度因子 $\hat{s}$,我们通过旋转和平移损失监督视图之间的相对位姿:
$\frac{1}{N(N -1)} \sum_{i \neq j} L_{\text{rot}}(i, j) + \lambda L_{\text{trans}}(i, j)$ , (18)
其中 $L_{\text{rot}}$ 测量旋转距离,$L_{\text{trans}}$ 是相对平移上的 Huber 损失。
B.3 无监督训练
为了稳健地处理遮挡和静止像素,我们采用了受 [15] 启发的最小重投影损失和自动掩码策略。对于每个源视图 $i$ 和目标视图 $j$,清洁(恢复)图像的光度损失计算如下:
$L_{\text{photo}} = \min_{j \neq i} \lambda_{\text{ssim}} \cdot \text{SSIM}(\hat{I}_{j \to i}, \hat{I}_i) + \lambda_{L1} \cdot L_1(\hat{I}_{j \to i}, \hat{I}_i)$ , (19)
其中 $\hat{I}_{j \to i}$ 是源坐标系中的合成图像,$\lambda_{\text{ssim}} = 0.85$ 且 $\lambda_{L1} = 0.15$。 为了忽略违反运动假设的像素(例如静止物体),我们计算恒等重投影损失: $L_{\text{id}} = \min_{j \neq i} L_1(\hat{I}_j, \hat{I}_i)$, (20) 并构建自动掩码: $M_i = \mathbb{1}(L_{\text{photo}} < L_{\text{id}})$ , (21)
其中 $\mathbb{1}(\cdot)$ 是指示函数。最终的自监督损失 $L_{\text{self}}$ 定义为掩码后的光度损失: $L_{\text{self}} = M_i \odot L_{\text{photo}}$. (22)
15
第 16 页
C 水下图像复原
基准与指标。我们在合成和真实世界的水下基准数据集上进行了全面评估。对于定量全参考评估,我们采用了由 [37] 引入的合成水下数据集,该数据集构建自 NYUv2 [38] 室内 RGB-D 图像,并配有高质量的真值深度图。对于真实世界评估,我们进一步使用了两个广泛采用的基准数据集 USOD10k [32] 和 UIEB [39],其中包含具有不同级别颜色失真、雾度和对比度退化的多样化水下场景。
对于拥有真值清晰图像的合成数据,我们遵循标准的全分辨率评估协议,并报告全参考指标,包括峰值信噪比 (PSNR) 和结构相似性指数 (SSIM)。对于没有参考图像的真实世界数据集,我们遵循 [42] 的做法,采用了两个无参考图像质量指标 UIQM [40] 和 MUSIQ [41]。分数越高表示感知质量越好。
图 C.1: 水下图像复原方法的定性比较。从左到右,视觉质量和颜色恢复效果逐渐提升,我们的方法(最右侧)实现了最自然的结果。
表 C.1: 在合成数据集 [37]、USOD10k [32] 和 UIEB [39] 上的定量结果。深蓝色表示最佳性能,浅蓝色表示次佳性能。
| Method | Synthetic Dataset | | USOD10k | | UIEB | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | | PSNR ↑ | SSIM ↑ | UIQM ↑ | MUSIQ ↑ | UIQM ↑ | MUSIQ ↑ | | Histoformer [43] | 16.15 | 0.773 | 2.645 | 42.23 | 2.908 | 52.34 | | USUIR [44] | 16.76 | 0.801 | 2.609 | 42.18 | 3.039 | 51.21 | | U-Shape [45] | 17.56 | 0.746 | 2.435 | 37.38 | 2.768 | 40.19 | | LiteEnhanceNet [46] | 17.88 | 0.835 | 2.377 | 36.33 | 2.641 | 37.41 | | Osmosis [37] | 22.12 | 0.890 | 2.397 | 38.68 | 2.659 | 41.30 | | SLURPP [42] | 24.89 | 0.922 | 2.280 | 40.67 | 2.751 | 45.82 | | WAT3R (Ours) | 26.81 | 0.917 | 2.343 | 44.02 | 2.727 | 52.29 |
与现有方法的比较。如表 C.1 所示,WAT3R 在合成数据上始终优于现有方法,实现了 26.81 dB 的最高 PSNR,同时保持了具有竞争力的 SSIM 0.917。这证明了其在模拟水下退化条件下保持像素级保真度和恢复结构细节的强大能力。在真实世界基准测试中,WAT3R 与 Histoformer [43] 等最先进的专用模型相比具有竞争力的性能,特别是在两个数据集上均获得了最高的 MUSIQ 分数。这表明即使没有专门针对复原任务的设计,该方法也具有卓越的感知质量和强大的跨任务泛化能力。关于 UIQM,我们观察到它并不总是与人类感知一致,
16
第 17 页
图 C.2:UIQM 鲁棒性分析。极端的增强处理会人为地抬高 UIQM 分数,尽管它们引入了严重的视觉伪影,如色调分离(posterization)和光晕。
往往倾向于过饱和或过度锐化的结果。如图 C.1 所示,尽管 WAT3R 的 UIQM 分数较低,但其产生的结果在视觉上始终比 Histoformer 更令人愉悦。
总体而言,在合成数据上领先的定量性能、在真实世界基准测试中优越的感知质量,以及高效的前馈式架构,表明 WAT3R 在保真度、感知质量和计算效率之间实现了良好的平衡,优于迭代基线方法 [37, 42]。
UIQM 指标分析。虽然 UIQM 是广泛使用的水下图像质量无参考指标,但我们的实验揭示了其数值分数与实际感知质量之间存在显著差异。理论上,UIQM 定义为三个特定属性分量的线性组合: UIQM = c1 · UICM + c2 · UISM + c3 · UIConM (23) 其中 c1 = 0.0282,c2 = 0.2953,c3 = 3.5753。如图 C.2 所示,该指标表现出对高频噪声和极端像素分布的病态偏差。例如,“对比度拉伸”版本尽管遭受严重的色调分离和自然纹理丢失,却获得了最高的 UIQM 分数(1.932)。这主要是因为夸张的动态范围极大地放大了 UIConM 分量,而该分量具有最大的权重系数(c3)。同样,“过度锐化”伪影产生的分数(1.337)高于原始图像,尽管它们引入了令人分心的光晕。这些结果表明,UIQM 对统计颜色和梯度分布的依赖使其成为评估恢复性能的不可靠代理,因为它倾向于“奖励”那些在视觉上对人类观察者缺乏吸引力的不自然增强。
D 合成数据生成
合成数据生成流程依赖于对 Jerlov 水类型 [25] 的测量固有光学特性(IOPs)的分析。具体而言,使用全球海洋光学数据库(WOOD)获取标准 Jerlov 水类型的衰减系数 a 和后向散射系数 b。该过程涉及严格的数据清洗和过滤,以聚焦于水柱的上层 10 米,随后根据空间和时间上的邻近性,将超过 1350 万个数据点分组为“考察活动”(campaigns)。通过将测量的下行漫衰减系数与标准 Jerlov 光谱剖面进行比较,并使用最小平均绝对百分比误差(MAPE)拟合方法,为每个考察活动分配一个 Jerlov 水类型。
尽管 Jerlov 定义了十种水类型,但该方法侧重于六种稳健类型(IB、II、III、1C、3C 和 5C),因为它们提供了足够的同步测量数据 a 和 b,以满足至少五个独立条目的统计阈值。为了从 300 到 800 nm 创建连续的光谱数据,将离散的测量点拟合到既定的生物光学模型中,以优化叶绿素和颗粒物浓度的参数。通过在红色(630–745 nm)、绿色(500–575 nm)和蓝色(460–495 nm)波长范围内以 10 nm 的步长对这些经过验证的剖面进行采样,该流程确保合成数据集建立在物理现实基础之上,而非纯粹的理论假设。
这种方法为水下成像提供了显著优势,因为它提供了物理上一致的参数,纠正了先前模型中发现的差异,例如那些预测吸收过少或散射过多的模型。虽然源数据具有一定的地理局限性——大多数考察活动位于北纬 20° 至 45° 之间——但这代表了首个全面的努力,旨在
第 18 页
将 Jerlov 分类与大规模测量的固有光学特性(IOP)数据相关联。通过利用这些经过实验验证的系数,合成数据集在模拟从清澈开阔海洋到浑浊沿海水域等不同海洋环境的独特光学行为方面实现了更高的保真度。
进一步的考虑是,底层图像形成假设在空间变化的水体条件下的适用性。所提出的流水线假设固有光学特性(IOPs),即衰减系数 $a(\lambda)$ 和后向散射系数 $b(\lambda)$,在每个由考察得出的水类型内是局部均匀的。这一近似是合理的,因为构建考察时使用的时空聚合有效地平均了细尺度的波动,同时保留了与每个 Jerlov 类别相关的主导光学特征。
在自然海洋环境中,由于浮游生物斑块、沉积物再悬浮或垂直分层等过程,IOPs 仍可能表现出局部异质性。在这种情况下,有效的光学响应可能偏离严格的均匀介质,从而在观察到的图像形成过程中引入额外的变异性,超出了简单的深度依赖衰减模型。然而,在实践中,由于水下成像中的主导图像退化机制仍然由整体衰减和后向散射行为控制,这些影响得到了一定程度的缓解。
重要的是,我们的评估是在多个真实世界的水下数据集上进行的,这些数据集本质上包含了这种不均匀且不受控制的环境条件。在这些数据集上观察到的 3D 重建质量的提升表明,即使在实际的水体变异性下,所提出的合成数据生成流水线仍然有效,并提供了超越数据构建中使用的简化均匀假设的有意义泛化。
E 相机位姿估计
E.1 自收集的真实水下数据集
我们构建了一个由 10 个视频序列组成的真实世界水下数据集,所有序列均源自公开可用的水下视频。每个序列捕捉了具有不同光照、浑浊度和相机运动的多样化水下场景,如图 E.1 所示。
对于每个序列,我们首先提取帧,并使用 COLMAP [47, 48] 获取密集相机位姿,同时以步长为 2 对帧进行采样。该数据集为评估我们的相机位姿估计框架在真实世界水下条件下的性能提供了现实的基准。
E.2 与视觉里程计的对比
我们通过将我们的方法与代表性的视觉里程计(VO)基线 ORB-SLAM3 [49] 进行比较,来评估我们方法的相机位姿估计性能。尽管 ORB-SLAM3 [49] 被设计为一个完整的 SLAM 系统,但在不考虑全局回环检测和地图复用的情况下,它也可以以视觉里程计模式运行。在这种配置下,系统基于连续帧之间的特征提取、特征匹配和运动优化来增量式地估计相机轨迹。
表 E.1 报告了使用标准轨迹评估指标进行的定量比较,包括绝对轨迹误差(ATE)和平移及旋转方向的相对位姿误差(RPE)。如结果所示,我们的方法显著优于经典的 VO 流水线。特别是,WAT3R 实现了显著更低的 ATE 和 RPE,表明其相机位姿估计更加准确和稳定。
18
第 19 页
表 E.1:与最先进 SLAM 系统的位姿估计精度对比。 方法 ATE ↓ RPEtrans ↓ RPErot ↓
ORB-SLAM3 [49] 0.8735 0.2703 12.4685 WAT3R (Ours) 0.2321 0.0721 0.2777
F 局限性讨论
尽管 WAT3R 在具有挑战性的水下条件下展示了可靠的 3D 重建能力,但如图 F.1 所示,它存在一个主要局限性:在能见度极低的极度浑浊环境中,重建仍然具有挑战性,尽管集成了退化适应信号,仍可能导致几何预测性能下降。未来,我们旨在扩展我们的框架,以进一步提高在高度退化水下条件下的鲁棒性。
图 F.1:WAT3R 在能见度极低的高度浑浊水下条件下的失败案例。
19