RealDefocus:为何真实数据能解锁高容量模型的散焦去模糊潜力?

快速导读:缺乏大规模、高分辨率、多光圈的真实散焦图像对,以及统一的评估协议,阻碍了高容量模型的潜力释放。

单图像散焦去模糊(Single-Image Defocus Deblurring, SIDD)是计算摄影中的经典难题。由于散焦模糊具有空间变化特性,且受光学几何约束,传统方法难以处理复杂场景。长期以来,该领域缺乏大规模、高分辨率且包含真实光学模糊的数据集,导致模型泛化能力受限。

本文提出 RealDefocus 基准,旨在解决这一数据瓶颈。通过反转 RealBokeh 数据集的角色,作者构建了包含 23,000 对图像的大规模真实世界数据集,并建立了统一的评估协议。研究表明,真实数据的规模与多样性是释放 Transformer 和 State Space Models (SSM) 等高容量模型潜力的关键。

英文题目:THE REALDEFOCUS BENCHMARK FOR DEFOCUS DEBLURRING

论文出处:arXiv 每日论文精选 · arXiv:2607.21078

原始论文:PDF / 论文页面

对应视频标题:RealDefocus:为何真实数据能解锁高容量模型的散焦去模糊潜力?|推荐指数:★★★★★

这篇论文解决什么问题?

现有的 SIDD 数据集存在显著局限。例如,DPDDS 数据集规模较小且仅包含固定光圈设置,无法覆盖真实世界中多变的光圈条件。LFDOF 数据集虽然提供了多视角信息,但其模糊是通过光场相机合成生成的,导致合成数据与真实世界之间存在明显的域差异(Domain Gap)。

这种数据稀缺和合成偏差使得模型在真实场景下的表现大打折扣。特别是在大光圈(如 f/2.0)导致的强模糊情况下,现有模型往往难以恢复细节,甚至产生伪影。因此,建立一个包含广泛光圈范围、高分辨率且真实对齐的数据集至关重要。

此外,缺乏统一的评估协议使得不同架构之间的比较变得困难。专用 SIDD 模型、运动去模糊模型和通用复原架构在各自的数据集上训练,难以直接对比其在真实散焦任务上的性能。

核心创新

方法概览

缺乏大规模、高分辨率、多光圈的真实散焦图像对,以及统一的评估协议,阻碍了高容量模型的潜力释放。

  • RealDefocus 数据集源自 RealBokeh 数据集,通过反转输入和 Ground Truth 的角色,提供了真实的散焦/清晰图像对。数据集包含 4,400 个独立场景,覆盖 f/2.0 到 f/20.0 的广泛光圈范围,图像分辨率高达 6000×4000。
  • 作者建立了统一的基准协议,评估四类方法:专用 SIDD 模型、运动去模糊模型、通用复原架构(如 Restormer)和 Bokeh Rendering 模型。所有模型均在 RealDefocus 上训练,并在 RealDefocus 和 RealDOF 测试集上进行验证。
  • 为了公平比较,报告了 PSNR、SSIM 和 LPIPS 指标,以及计算成本(GMACs)和推理时间。特别关注了不同光圈设置下的性能变化,以评估模型对模糊强度的鲁棒性。
  • 实验还探讨了高容量模型(如 FFTFormer)在真实数据上的表现,验证了数据规模对模型容量的解锁作用。

逐图理解论文

现有困境

现有困境
Table 1. Comparison of representative training datasets for SIDD. RealDefocus [1] provides the largest scale in terms of total samples and unique scenes, with substantially more images than prior datasets. It also features a wide aperture range and high-resolution images, whereas DPDDS [10] of- fers only a fixed aperture setting while the multi aperture views of LFDOF [12] are synthetically generated.

表 1 对比了代表性 SIDD 训练数据集。注意 RealDefocus 在样本总数和独立场景数上的巨大优势,以及其覆盖的宽光圈范围。相比之下,DPDDS 仅固定光圈,LFDOF 为合成模糊。这解释了为何 RealDefocus 能提供更真实的训练分布。

核心贡献

核心贡献
Table 2. Quantitative results on the RealDefocus [1] SIDD benchmark. Columns labeled by f-stop values report perfor- mance when the input is restricted to the corresponding aperture setting; smaller f-stop values indicate stronger defocus blur. The last column shows the average performance over the entire RealDefocus dataset. The best, second-best, and third-best re- sults are highlighted in bold, underline, and italic, respectively. Computational cost in Giga-Multiply-Accumulate-Operations (GMACs) is reported at 256×256 resolution, and inference time is measured at 1024×1024 on an NVIDIA L40 GPU.

表 2 展示了 RealDefocus 基准上的定量结果。观察不同光圈(f/2.0, f/4.0, f/8.0)下的性能变化,f/2.0 代表最强模糊,最具挑战性。注意 FFTFormer 和 Bokehlicious 在不同指标上的优势,以及 GMACs 和推理时间的权衡。

关键证据

关键证据
Table 3. Quantitative results on the RealDOF dataset [19] when trained on DPDDS [10] and on RealDefocus [1]. We additionally report the performance change with respect to models trained on DPDDS. Some DPDDS-trained RealDOF results are taken from [14, 22, 29]. The best, second-best, and third-best results are indicated in bold, underline, and italic, respectively.

表 3 展示了在 RealDOF 测试集上的跨数据集泛化结果。对比在 DPDDS 和 RealDefocus 上训练的模型,可见 RealDefocus 训练模型在 PSNR 和 SSIM 上均有系统性提升,LPIPS 降低,证明真实数据对泛化的关键作用。

实验如何设计?

  • 训练集:RealDefocus 训练集,包含 23,000 对图像。
  • 测试集:RealDefocus 测试集(按光圈分组)和 RealDOF 测试集(用于跨数据集泛化评估)。
  • 对比基线:DPDDS 训练模型、LFDOF 训练模型、以及各类 SOTA 复原模型。
  • 评估指标:PSNR, SSIM, LPIPS, GMACs, 推理时间。

关键结果与论文证据

  • 在 RealDefocus 测试集上,FFTFormer 取得了最高的平均 PSNR (30.206) 和 SSIM (0.8837),表明高容量模型在真实数据上具有显著优势。
  • Bokehlicious 在 LPIPS 指标上表现最佳 (0.1125),特别是在 f/2.0 强模糊情况下,PSNR 达到 24.546,显示出其在感知质量上的优越性。
  • 跨数据集泛化实验显示,在 RealDefocus 上训练的 Bokehlicious 模型在 RealDOF 上的 PSNR 比在 DPDDS 上训练的模型高出 1.402,证明真实数据能显著提升泛化能力。
  • 随着光圈值增大(模糊减弱),所有模型的性能均有所提升,但在强模糊区域(f/2.0)的性能差距最为明显。

阅读时需要注意

  • 光圈堆叠生成的 Ground Truth 在深户外场景中可能存在残留模糊,影响评估准确性。
  • 高容量模型(如 FFTFormer)的计算成本(GMACs)和推理时间显著高于传统方法,限制了其实时应用。
  • 数据集虽然规模大,但仍可能无法覆盖所有极端光学条件。

关联工作

  • DPDDS [10]:早期真实世界数据集,但规模小且光圈固定。
  • LFDOF [12]:光场数据集,合成模糊导致域差异。
  • RealDOF [19]:高质量评估集,用于验证泛化能力。
  • Bokehlicious [1]:Bokeh Rendering 模型,作为逆任务基线。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

散焦去模糊的 RealDefocus 基准

Tim Seizinger, Zhuyun Zhou∗, Radu Timofte

德国维尔茨堡大学计算机视觉实验室,CAIDAS & IFI

摘要 早期的散焦去模糊方法依赖于显式模糊核估计,随后进行非盲反卷积 [8, 9]。单图像散焦去模糊 (SIDD) 旨在从单个散焦观测中恢复全清晰图像,但由于缺乏具有良好对齐的散焦/清晰对以及标准化协议的真实高分辨率数据集,严格且可重复的评估仍然具有挑战性。我们基于 RealDefocus 构建了一个基准,该基准源自最初为散景渲染 (Bokeh Rendering) 提出的真实世界 RealBokeh 数据集。RealDefocus 提供了配对的散焦输入和清晰的地面真实图像、预定义的训练/验证/测试划分,以及一个用于比较图像恢复和神经渲染方法的统一评估框架。我们进一步概述了一个基准测试协议,包括跨数据集验证,以评估重建质量和泛化能力。项目页面公开可用:www.github.com/TimSeizinger/RealDefocus-Benchmark。

索引术语——散焦去模糊,基准,神经渲染

1. 引言

当使用有限景深拍摄场景时,焦平面外的物体由于光学散焦而显得模糊。这种现象在使用大光圈设置或拍摄具有显著深度变化的场景时很常见,通常与散景效果 [1] 相关。虽然浅景深可以有意用于艺术目的 [2],但意外的散焦或失焦经常降低图像质量并阻碍下游视觉任务,如文本识别 [3, 4]、目标检测 [5, 6] 和图像分类 [7]。

单图像散焦去模糊 (SIDD) 旨在从单个散焦观测中恢复全清晰图像(见图 1)。该问题本质上是病态的:散焦模糊是空间变化的,并取决于场景深度以及镜头特性。每个观测像素可以解释为相邻潜在像素的加权聚合,其中权重由未知的、空间变化的点扩散函数 (PSF) 控制。准确估计和反转这些模糊核仍然是一个核心挑战。

*通讯作者 这项工作得到了洪堡基金会的资助。

最近,基于深度学习的方法 [10, 11, 12, 13, 14] 通过从模糊图像到清晰图像学习端到端映射,展示了实质性的改进。对于这些数据驱动的方法,底层训练数据的质量、多样性和真实性至关重要。因此,引入了几个数据集 [12, 10, 15] 以支持散焦去模糊的监督学习,每个数据集在规模、真实性和模糊多样性方面都有不同的权衡。

散焦去模糊与运动去模糊密切相关,但在根本上是不同的。虽然运动模糊源于曝光期间相机或物体的运动,通常导致复杂的、依赖于轨迹的核,但散焦模糊主要受光学几何和场景深度的控制,通常表现出盘状或近圆形的 PSF,并具有空间变化。同时,散焦去模糊与散景渲染 [1] 有着强烈的概念联系,后者可以解释为逆任务:散景渲染旨在从清晰图像中合成真实的浅景深效果,而不是去除光学模糊。

在这项工作中,我们基于最近引入的 RealBokeh/RealDefocus 数据收集范式 [1],该范式提供了大规模、高分辨率且良好对齐的真实世界光圈对(见图 1)。与之前的数据集相比,它提供了显著更多的场景多样性、更宽的光圈覆盖和更强的散焦,从而能够对现代高容量架构进行更真实和具有挑战性的评估。

2. 相关工作

2.1. 散焦去模糊数据集

第一个使定量评估成为可能的数据集是 RTF [9],它是使用 Lytro 光场相机 [16] 捕获的。虽然具有创新性,但 RTF 仅包含 22 张低空间分辨率 (360 × 360) 的图像,其散焦模糊是从光场数据中合成渲染的。因此,其规模和真实性限制了其在训练现代深度神经网络中的适用性。

DPDD [10] 迈出了重要的一步,成为第一个专门用于训练深度散焦去模糊模型的数据集。它使用 Canon EOS 5D Mark IV 捕获,利用双像素 (DP) 视图以促进模糊估计。然而,DP 数据需要专门的传感器硬件,并且

第 2 页

清晰真值 f/22.0 模糊输入 f/8.0 模糊输入 f/4.0 模糊输入 f/3.2 模糊输入 f/2.0 61mm 镜头:

70mm 镜头:

清晰真值 f/22.0 模糊输入 f/7.1 模糊输入 f/4.0 模糊输入 f/2.8 模糊输入 f/2.0 图 1. RealDefocus [1] 数据集中具有代表性的样本,展示了随着光圈值减小,散焦模糊程度逐渐增加的情况。对于每个场景,在 f/22.0 下拍摄的图像作为清晰的地面真值,而 progressively 较小的 f 值(例如 f/8.0、f/4.0 和 f/2.0)会产生更强的散焦模糊效果。展示了两个示例场景(室外和室内),焦距分别为 61 和 70 毫米,突出了场景内容、焦距和模糊强度的多样性。

RealDefocus [1] DPDDS [10] LFDOF [12] 在规模、多样性和光圈覆盖范围方面。它源自用于景深渲染的 RealBokeh 数据集,该数据集

样本数 23,000 500 12,600

捕捉了每个场景的多个光圈设置。通过反转 # 场景数 4,400 500 805 输入和地面真值的角色,即使用浅 # 训练集 20,500 350 11,850

验证集 1,250 74 750 景深图像作为输入,并在

测试集 1,250 76 – f/22.0 下拍摄的图像作为清晰参考,RealDefocus 自然地形成了

光圈 f/2.0 – f/20.0 f/4.0 3 用于单图像散焦去模糊 (SIDD) 的配对数据, 焦距 28-70mm 24-105mm ∼50mm 如图 1 所示。 分辨率 6000×4000 6720×4480 1008×688 如表 1 总结,RealDefocus 包含 23,000 散焦模糊 真实 真实 合成 个图像对,跨越 4,400 个独特场景,在规模上显著超越 表 1. SIDD 代表性训练数据集的比较。RealDefocus [1] 提供了最大的总样本数和独特场景数,拥有比先前数据集更多的图像。它还具备宽光圈范围和高分辨率图像,而 DPDDS [10] 仅提供固定光圈设置,LFDOF [12] 的多光圈视图是合成生成的。 了先前的真实世界 SIDD 数据集。图像以 6000 × 4000 的高分辨率捕捉,并涵盖从 f/2.0 到 f/20.0 的宽光圈范围,从而能够在不同的模糊强度下进行评估。 该数据集包括多样的室内和室外环境、具有复杂高光结构的受控工作室场景、人像以及具有挑战性的夜间场景,这些条件在早期数据集中代表性不足。重要的是,f/2.0 的最大光圈产生的散焦模糊程度远大于 DPDDS 中使用的 f/4.0 设置,从而形成了更具挑战性和真实性的基准。通过结合大规模、高分辨率、宽光圈可变性和真实光学模糊,RealDefocus 为训练和评估现代 SIDD 方法建立了新的基础。

3. 基准方法论

3.1. 模型选择

为了提供全面且具有代表性的基准,我们从四个互补的类别中评估方法:(i) 专用的散焦去模糊方法,(ii) 运动去模糊方法,(iii) 通用图像修复架构,以及 (iv) 景深渲染模型。这一选择既反映了散焦去模糊领域的历史发展,也反映了近期向跨修复任务泛化的大型、多功能骨干网络的趋势。

2.2. RealDefocus

由 Seizinger 等人最初提出的 RealDefocus 数据集 [1] 解决了先前数据集的局限性。

第 3 页

参数量 MACs 时间 f/2.0 f/4.0 f/8.0 所有光圈 方法 M.↓ G.↓ sec↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓

输入 – – – 19.666 0.6434 0.3238 21.324 0.7137 0.4028 25.780 0.8084 0.2403 24.422 0.7668 0.3237

DPDNetS [10] 31.38 55.92 0.043 21.112 0.6643 0.4584 23.947 0.7626 0.3359 28.332 0.8601 0.1705 25.887 0.7946 0.2768 GKMNet [13] 1.41 20.05 0.135 21.946 0.6821 0.4220 25.523 0.7951 0.2748 29.400 0.8769 0.1438 27.166 0.8157 0.2393 DRBNet [18] 11.69 44.47 0.068 22.162 0.7011 0.3626 26.193 0.8220 0.2126 30.639 0.9010 0.1016 28.022 0.8374 0.1910 NRKNet [14] 6.09 61.81 0.096 22.581 0.7160 0.4042 26.542 0.8332 0.2450 30.702 0.9075 0.1218 28.211 0.8461 0.2195 Restormer [20] 26.13 141.24 0.758 21.947 0.7033 0.3500 27.226 0.8483 0.1986 31.726 0.9211 0.0942 28.844 0.8538 0.1802 EVSSM [21] 17.13 122.30 1.398 22.891 0.7276 0.3771 27.096 0.8466 0.2137 31.761 0.9214 0.0985 29.052 0.8592 0.1934 LAKDNet [22] 17.73 86.52 0.803 23.182 0.7360 0.2860 27.348 0.8478 0.1598 31.858 0.9201 0.0774 29.156 0.8611 0.1474 EAMamba [23] 25.30 84.29 1.216 23.552 0.7460 0.3240 27.694 0.8543 0.1898 32.080 0.9239 0.0908 29.475 0.8672 0.1695 Bokehlicious [1] 13.96 60.55 0.523 24.546 0.7732 0.2043 28.141 0.8607 0.1275 31.975 0.9219 0.0676 29.752 0.8751 0.1125 FFTFormer [24] 16.56 131.75 2.232 24.522 0.7799 0.2991 28.459 0.8719 0.1670 32.818 0.9331 0.0810 30.206 0.8837 0.1544

表 2. RealDefocus [1] SIDD 基准上的定量结果。按光圈值标记的列报告了当输入限制为相应光圈设置时的性能;较小的光圈值表示更强的散焦模糊。最后一列显示了在整个 RealDefocus 数据集上的平均性能。最佳、次佳和第三佳结果分别以粗体、下划线和斜体突出显示。计算成本以十亿次乘加运算(GMACs)为单位报告,分辨率为 256×256,推理时间在 NVIDIA L40 GPU 上以 1024×1024 分辨率测量。

对于 (i) 专用的散焦去模糊方法,我们采用纯卷积框架。这些方法 [18, 22] 通常是在合成数据上预训练,随后在真实数据集上进行微调,以缓解域差异。早期的散焦去模糊方法主要是基于模型的,并遵循两阶段流程:首先为每个像素估计空间变化的模糊核,随后进行非盲反卷积 [8]。核估计通常依赖于简化的参数假设,例如高斯 [25] 或圆盘状点扩散函数 [9],这反映了相机镜头的光圈几何形状。虽然这些方法原理严谨,但受限于核估计的准确性以及对噪声和模型失配的敏感性。

随着深度学习的发展,基于端到端 CNN 的方法通过直接从模糊图像学习到清晰图像的映射,取代了显式的核估计。早期的例子包括 AIFNet [12] 和 DPDNet [10]。特别是 DPDNet,利用特殊的双像素 (DP) 子孔径视图来更好地约束病态逆问题,代表了首个专门为散焦去模糊设计的神经网络框架之一。后续工作重新在深度架构中引入了显式的模糊建模:GKMNet [13] 使用紧凑的线性参数形式显式建模空间变化的散焦模糊核,并采用轻量级的多尺度监督尺度循环架构;NRKNet [14] 进一步结合了受截断 Neumann 级数近似模糊算子逆运算启发的可学习递归核表示,并结合了跨尺度融合和重模糊损失进行正则化。另一条工作路线专注于数据驱动的架构设计而非显式的核公式化:DRBNet [18] 采用了针对散焦特性定制的动态滤波机制 [19],而 LAKDNet [22] 则利用大核逐层卷积和空间-通道混合,在卷积架构内模拟了 Transformer [26] 的大有效感受野。

对于 (ii) 运动去模糊方法,我们包括了最近展示强大泛化能力的最新架构。EVSSM [21] 通过在状态空间建模之前引入几何变换来增强基于状态空间模型 [27] (SSM) 的恢复能力,以更好地捕捉局部结构,并辅以高效的频域前馈网络以提高判别能力。FFTFormer [24] 在 Transformer 框架内集成了频域处理,使得在保持高重建保真度的同时,能够有效建模全局模糊模式。

对于 (iii) 通用恢复架构,我们包括了 Restormer [20] 和 EAMamba [23]。Restormer 是一种基于 Transformer 的 U-Net 架构,广泛用于包括运动和散焦去模糊、去噪和去雨在内的各种恢复任务。EAMamba 建立在 SSM 之上,并引入了针对图像恢复量身定制的增强型视觉 Mamba [28] 架构。通过利用长程依赖建模,它在运动去模糊、去雾和超分辨率方面表现出了强大的性能。

对于 (iv) 散景渲染,我们包括了 Bokehlicious [1],它构建于一种物理启发的 Transformer 架构之上,该架构模拟了真实相机镜头中光圈机制的行为。

3.2. 训练协议

所有方法均尽可能遵循其各自的原始实现进行训练,特别是在优化器选择、学习率调度以及架构细节方面。训练在 RealDefocus 上进行

第 4 页

f/2.0 输入 真值: PSNR (dB) DRBNet: 25.28 NRKNet: 25.47 Restormer: 24.79 EVSSM: 25.90

f/2.0 输入: 21.81 LAKDNet: 26.46 EAMamba: 26.85 Bokehlicious: 27.24 FFTFormer: 27.69 f/2.8 输入 真值: PSNR (dB) DRBNet: 24.11 NRKNet: 24.16 Restormer: 24.34 EVSSM: 24.51

f/2.8 输入: 16.34 LAKDNet: 25.11 EAMamba: 25.25 Bokehlicious: 25.87 FFTFormer: 26.06

图 2. 在 RealDefocus [1] 测试集上针对两种光圈设置(f/2.0 和 f/2.8)的定性比较。对于每个示例, 我们报告相对于清晰真值(f/22.0)的 PSNR (dB)。视觉结果突出了代表性散焦专用方法、通用恢复方法和基于渲染的方法在细节恢复 和纹理保真度方面的差异。建议放大以更好地观察精细结构和重建质量。

在 2000×1500 分辨率下,使用 512 × 512 的补丁,并包 置下,实现了最高的 PSNR (24.546) 和最低的 含翻转和旋转进行数据增强。重要的是, LPIPS (0.2043),表明在严重散焦模糊下具有强大的鲁棒性。 每种方法均使用其原始实现中指定的损失函数进行优化。这对于 对于中等和轻度模糊(f/4.0 和 依赖专门目标的方法也是必要的,例如 GKMNet [13] 和 NRKNet [14] f/8.0),其他高容量基于 Transformer 和 SSM 的模 中的多尺度监督,或 NRKNet [14] 中的重模糊正则化。 型如 FFTFormer [24]、EAMamba [23] 和 LAKD- 一个重要的观察结果是性能 Net [22] 也始终名列前茅。 趋势与早期基准相比发生了变化。随着 RealDefo- 4. 基准测试与结果分析 cus [1] 的规模、多样性和质量的大幅增加,大型且表达能力强的架构,如 Bokehli- 总体而言,该基准旨在确保公平性,同时尊 cious [1]、SSM (EAMamba [23]) 和 Transformer 方法 重每种方法的设计原则。通过结合 (FFTFormer [24]) 能够有效训练并超越 物理驱动的散焦模型、运动去模糊最先进架构、通用恢复骨干网络 更传统的设计。这表明数据规模和 以及 Bokeh 渲染模型,我们在统一的实验 覆盖范围在解锁现代高参数网络在真实世界 SIDD 中的潜力方面起着决定性作用。 设置下对当前方法进行了广泛且平衡的评估。 从效率角度来看,轻量级模型如 4.1. RealDefocus 基准 GKMNet [13] 在参数量 (1.41 M) 和 MACs (20.05 G) 方面仍然具有竞争力,但与表现最好的大型模型相比,存在明显的性能差距。 表 2 总结了近期 SIDD 方法在 RealDefocus [1] 基准上不同 相反,高容量方法(例如 FFTFormer [24]、 光圈设置下的性能。正如预期的那样,较小的 f 值(例如 Restormer [20]、EVSSM [21])以显著更高的计算代 f/2.0)对应于显著更强的模糊,因此代表了最具挑战性的情况,而较大的 f 值(例如 价和推理时间实现了卓越的重建质量。Bokehlicious [1] 提供了有利的 f/8.0)则相对容易。定性上,如图 2 所示, 权衡,结合了具有竞争力的复杂度(13.96 M 参 在 RealDefocus 上训练的高容量模型的优势体现在 数,60.55 GMACs)和最先进的质量。 更锐利的边缘重建、精细纹理的改善恢复以及减少振铃或过度平滑伪影, 特别是在具有强深度不连续性和复杂散焦图案的区域。

第 5 页

在 DPDDS [10] 上训练 在 RealDefocus [1] 上训练 方法 PSNR↑ SSIM↑ LPIPS↓ PSNR↑(变化) SSIM↑(变化) LPIPS↓(变化)

DPDNetS [10] 22.870 0.670 0.425 23.934 (+1.064) 0.714 (+0.044) 0.418 (−0.007) GKMNet [13] 24.254 0.732 0.392 25.014 (+0.760) 0.755 (+0.023) 0.335 (−0.057) DRBNet [18] 24.884 0.751 0.376 25.283 (+0.399) 0.774 (+0.023) 0.272 (−0.104) Restormer [20] 25.080 0.769 0.289 25.382 (+0.302) 0.797 (+0.028) 0.268 (−0.021) NRKNet [14] 25.148 0.768 0.338 25.397 (+0.249) 0.784 (+0.016) 0.313 (−0.025) LAKDNet [22] 25.080 0.762 0.267 25.413 (+0.333) 0.787 (+0.025) 0.242 (−0.025) EAMamba [23] 24.685 0.755 0.354 25.656 (+0.971) 0.801 (+0.046) 0.263 (−0.091) FFTFormer [24] 24.938 0.764 0.353 25.710 (+0.772) 0.804 (+0.040) 0.252 (−0.101) EVSSM [21] 25.087 0.765 0.340 25.798 (+0.711) 0.800 (+0.035) 0.279 (−0.061) Bokehlicious [1] 24.456 0.754 0.249 25.858 (+1.402) 0.797 (+0.043) 0.205 (−0.044)

表 3. 在 DPDDS [10] 和 RealDefocus [1] 上训练时,在 RealDOF 数据集 [19] 上的定量结果。 我们还报告了与在 DPDDS 上训练的模型相比的性能变化。部分在 DPDDS 上训练的 RealDOF 结果取自 [14, 22, 29]。最佳、次佳和第三佳结果分别以粗体、下划线和斜体表示。

输入 GT: PSNR (dB) EAMamba: 22.45 FFTFormer: 24.41 EVSSM: 24.74 Bokehlicious: 23.67 DPDDS RealDefocus 输入: 21.57 EAMamba: 24.45 FFTFormer: 25.15 EVSSM: 25.54 Bokehlicious: 24.62 图 3. RealDOF [19] 数据集上的定性比较。对于每个示例,顶行显示在 DPDDS [10] 上训练的模型结果,而底行展示在 RealDefocus [1] 上训练的相同架构。在 RealDefocus 上训练一致地提高了重建质量,产生了更清晰的细节,这反映在各方法中更高的 PSNR 分数上。建议放大以检查精细结构和纹理恢复。

4.2. RealDOF 上的跨数据集验证 5. 讨论

当前的真实世界数据集,包括 RealDefocus [1], 表 3 报告了在 DPDDS [10] 和 RealDefocus [1] 上训练时, 仍受限于基于光圈捕获协议,这 在 RealDOF [19] 上的定量结果。 在地面真值中留下残余散焦,而光场 在所有评估的架构中,在 RealDefocus 上训练 相机的空间分辨率有限 [16]。由于存在主要差距,使用合成散焦模糊进行训练会导致在真实世界条件下结果令人不满意 [31]。 一致地提高了跨数据集泛化能力。我们观察到 PSNR 和 SSIM 的系统性提升,同时 LPIPS 降低,表明感知保真度提高。 为了改进散焦去模糊数据集,可以采用焦点堆叠方法,将不同对焦距离的照片融合成清晰图像 [32]。虽然当前方法是为具有固定主体的微距摄影设计的,但值得研究这是否可以应用于深户外场景以锐化地面真值。 改进通常是显著的。例如,Bokehlicious [1] 在 PSNR 上获得 +1.402 的提升,并在 LPIPS 上减少 0.044,当在 RealDefocus 上训练而不是 DPDDS 时。同样,FFTFormer [24] 和 EAMamba [23] 分别受益于 +0.772 和 +0.971 的大幅 PSNR 提升。即使是从 DPDDS 泛化相对较好的方法,如 Restormer [20] 和 LAKDNet [22],在所有三个指标上也一致地得到改善。图 3 中的定性比较同样显示出恢复图像保真度的可见改善。 总体而言,这些结果突出了 RealDefocus [1] 带来的卓越跨数据集可迁移性。不同架构的一致性能提升表明,其增加的规模、场景多样性和光圈覆盖范围使模型能够更好地泛化到由 RealDOF [19] 代表的未见真实世界散焦分布。

6. 结论

在本工作中,我们引入了一个用于 RealDefocus 的基准协议,这是一个用于 SIDD 的大规模真实世界数据集,具有标准化的划分和评估协议。我们的结果表明,与先前的数据集相比,在 RealDefocus 上训练提高了跨数据集泛化能力,同时实现了针对特定任务和通用恢复架构的统一比较,强调了标准化评估设置的需求。

第 6 页

7. 参考文献 [16] Ren Ng, 《数字光场摄影》, 斯坦福大学, 2006. [1] Tim Seizinger, Florin-Alexandru Vasluianu, Marcos Conde, Zongwei Wu, 和 Radu Timofte, “Bokehlicious: 具有可控光圈的逼真散景渲染,” 发表于 ICCV, 2025. [2] John Kennerdell, “什么是‘散景’?,” 《Photo Techniques》杂志, 5月/6月刊, 第28页, 1997. [3] Tao Wang, David J Wu, Adam Coates, 和 Andrew Y Ng, “基于卷积神经网络的端到端文本识别,” 发表于 ICPR. IEEE, 2012. [4] Xiaoxue Chen, Lianwen Jin, Yuanzhi Zhu, Canjie Luo, 和 Tianwei Wang, “野外文本识别:一项综述,” 《ACM Computing Surveys (CSUR)》, 第54卷, 第2期, 第1–35页, 2021. [5] Joseph Redmon, Santosh Divvala, Ross Girshick, 和 Ali Farhadi, “You Only Look Once: 统一的实时目标检测,” 发表于 CVPR, 2016. [6] Dara Molloy, Patrick Müller, Brian Deegan, Darragh Mullins, Jonathan Horgan, Enda Ward, Edward Jones, Alexander Braun, 和 Martin Glavin, “重新审视基于高效卷积神经网络的去模糊,” arXiv预印本 arXiv:2302.02234, 2023. [7] Yiren Zhou, Sibo Song, 和 Ngai-Man Cheung, “关于使用深度卷积神经网络对失真图像进行分类,” 发表于 2017 IEEE国际声学、语音和信号处理会议 (ICASSP). IEEE, 2017, 第1213–1217页. [8] Anat Levin, Rob Fergus, Frédo Durand, 和 William T Freeman, “具有编码光圈的常规相机的图像与深度,” 《ACM Transactions on Graphics (TOG)》, 第26卷, 第3期, 第70–es页, 2007. [9] Laurent D’Andrès, Jordi Salvador, Axel Kochale, 和 Sabine Süsstrunk, “用于扩展景深的非参数模糊图回归,” 《IEEE Transactions on Image Processing》, 第25卷, 第4期, 第1660–1673页, 2016. [10] Abdullah Abuolaim 和 Michael S Brown, “使用双像素数据进行散焦去模糊,” 发表于 ECCV, 2020. [11] Abdullah Abuolaim, Mauricio Delbracio, Damien Kelly, Michael S Brown, 和 Peyman Milanfar, “通过逼真建模双像素数据学习减少散焦模糊,” 发表于 ICCV, 2021. [12] Lingyan Ruan, Bin Chen, Jizhou Li, 和 Miu-Ling Lam, “Aifnet: 使用基于光场的数据集的全聚焦图像恢复网络,” 《IEEE Transactions on Computational Imaging》, 第7卷, 第675–688页, 2021. [13] Yuhui Quan, Zicong Wu, 和 Hui Ji, “用于单图像散焦去模糊的高斯核混合网络,” 《Advances in Neural Information Processing Systems》, 第34卷, 第20812–20824页, 2021. [14] Yuhui Quan, Zicong Wu, 和 Hui Ji, “用于单图像散焦去模糊的具有递归核的Neumann网络,” 发表于 CVPR, 2023. [15] Hang Chen, Yin Xie, Xiaoxiu Peng, Lihu Sun, Wenkai Su, Xiaodong Yang, 和 Chengming Liu, “四像素图像散焦去模糊:新基准与模型,” 发表于 CVPR, 2025. [16] Donald G Dansereau, Bernd Girod, 和 Gordon Wetzstein, “Liff: 尺度与深度上的光场特征,” 发表于 CVPR, 2019. [17] Lingyan Ruan, Bin Chen, Jizhou Li, 和 Miuling Lam, “使用光场生成和真实散焦图像学习去模糊,” 发表于 CVPR, 2022. [18] Junyong Lee, Hyeongseok Son, Jaesung Rim, Sunghyun Cho, 和 Seungyong Lee, “用于单图像散焦去模糊的迭代滤波器自适应网络,” 发表于 CVPR, 2021. [19] Syed Waqas Zamir, Aditya Arora, Salman Khan, Munawar Hayat, Fahad Shahbaz Khan, 和 Ming-Hsuan Yang, “Restormer: 用于高分辨率图像恢复的高效Transformer,” 发表于 CVPR, 2022. [20] Lingshun Kong, Jiangxin Dong, Jinhui Tang, Ming-Hsuan Yang, 和 Jinshan Pan, “Efficient visual state space model for image deblurring,” 发表于 CVPR, 2025. [21] Lingyan Ruan, Mojtaba Bemana, Hans-peter Seidel, Karol Myszkowski, 和 Bin Chen, “分析镜头模糊对安全关键型汽车目标检测的影响,” 《IEEE Access》, 第12卷, 第3554–3569页, 2024. [22] Yu-Cheng Lin, Yu-Syuan Xu, Hao-Wei Chen, Hsien-Kai Kuo, 和 Chun-Yi Lee, “Eamamba: 用于图像恢复的高效全方位视觉状态空间模型,” ICCV, 2025. [23] Lingshun Kong, Jiangxin Dong, Jianjun Ge, Mingqiang Li, 和 Jinshan Pan, “用于高质量图像去模糊的高效基于频域的Transformer,” 发表于 CVPR, 2023. [24] Ali Karaali 和 Claudio Rosito Jung, “基于边缘的散焦模糊估计与自适应尺度选择,” 《IEEE Transactions on Image Processing》, 第27卷, 第3期, 第1126–1137页, 2017. [25] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, 和 Illia Polosukhin, “Attention is all you need,” 《Advances in Neural Information Processing Systems》, 第30卷, 2017. [26] Albert Gu, Karan Goel, 和 Christopher Ré, “使用结构化状态空间高效建模长序列,” 发表于 The International Conference on Learning Representations (ICLR), 2022. [27] Albert Gu 和 Tri Dao, “Mamba: 使用选择性状态空间的线性时间序列建模,” arXiv预印本 arXiv:2312.00752, 2023. [28] Yuhui Quan, Xin Yao, 和 Hui Ji, “通过隐式神经逆核进行单图像散焦去模糊,” 发表于 ICCV, 2023. [29] Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang, “深度特征作为感知度量的不合理有效性,” 发表于 CVPR, 2018. [30] Juewen Peng, Zhiguo Cao, Xianrui Luo, Hao Lu, Ke Xian, 和 Jianming Zhang, “Bokehme: 当神经渲染遇见经典渲染,” 发表于 CVPR, 2022. [31] Chao Zhang, John Bastian, Chunhua Shen, Anton van den Hengel, 和 Tingzhi Shen, “通过焦点堆叠和图割扩展景深,” 发表于 2013 IEEE国际图像处理会议, 2013, 第1272–1276页.

发表评论