三分钟导读:RealVDeblur通过结合基于3DGS的大规模物理真实数据合成、帧级VAE编码以保留模糊变化、以及通过DMD蒸馏和Temporal Window Mask实现的高效单步推理,解决了现实世界视频去模糊中的泛化性和长视频推理稳定性问题。
英文题目:RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring
论文出处:arXiv 每日论文精选 · arXiv:2607.20628
原始论文:PDF / 论文页面
对应视频标题:RealVDeblur:利用单步扩散与3DGS数据合成实现泛化现实视频去模糊|推荐指数:★★★★★
这篇论文解决什么问题?
现实世界视频去模糊面临运动模式多样、复杂退化以及真实训练数据稀缺的挑战;现有方法在合成数据上表现良好,但在真实场景中泛化能力差,且扩散模型在长视频推理中存在RoPE外推不稳定和高计算成本的问题。
核心创新
- 提出基于3D Gaussian Splatting (3DGS)和高帧率视频的大规模物理真实模糊合成管线(OmniBlur),涵盖相机运动、物体运动和离焦模糊。
- 设计Frame-wise VAE编码,解决传统3D VAE在剧烈模糊变化下的信息丢失问题。
- 结合DMD蒸馏与无需训练的Temporal Window Mask,实现稳定、高效的长视频单步去模糊推理。
方法概览
提出RealVDeblur框架,复用预训练的Video Diffusion Model (VDM);(1) 采用Frame-wise VAE编码方案,禁用时间压缩以保留帧级模糊变化;(2) 使用Distribution Matching Distillation (DMD)将多步扩散蒸馏为单步生成器,并引入像素空间监督;(3) 引入无需训练的Temporal Window Mask (TWM),限制自注意力范围为局部窗口,消除RoPE外推不稳定性,实现恒定内存的长视频推理。
逐图理解论文
RealVDeblur框架概览

RealVDeblur复用预训练的Video Diffusion Model (VDM) backbone,如Wan2.1。其核心包含三个关键组件:一是帧级VAE编码方案,禁用时间压缩以保留帧级模糊变化;二是利用Distribution Matching Distillation (DMD)将多步扩散蒸馏为单步生成器,并引入像素空间监督;三是引入无需训练的Temporal Window Mask (TWM),限制自注意力范围为局部窗口,消除RoPE外推不稳定性。
帧级VAE编码设计

传统3D VAE通过时间压缩编码视频,导致帧间模糊幅度剧烈变化时的信息丢失。RealVDeblur设计Frame-wise VAE编码,独立编码每一帧。消融实验显示,移除Frame-wise VAE会导致PSNR大幅下降4.87 dB,表明其对处理剧烈模糊变化至关重要,能有效保留高频细节。
Temporal Window Mask机制

长视频推理中,RoPE外推会导致注意力机制不稳定。RealVDeblur引入无需训练的Temporal Window Mask (TWM),将自注意力限制在局部时间窗口内。消融实验表明,全局注意力会导致严重的RoPE外推伪影,而过小的窗口会限制时间聚合。默认窗口大小W=20在稳定性和恢复质量间取得最佳平衡。
基准测试定量结果

在BSD基准上,RealVDeblur取得PSNR 28.76,SSIM 0.884,LPIPS 0.118。在RealBlur上,PSNR为27.55,SSIM 0.852。在RSBlur上,PSNR达到32.70,SSIM 0.915。在FEVD基准上,PSNR为28.90,SSIM 0.886。这些结果优于现有最先进方法,证明了其在不同退化类型下的鲁棒性。
无参考基准与3DGS重建

在无参考基准RWBI上,RealVDeblur的MUSIQ得分为63.50,CLIP-IQA为0.510。此外,评估了去模糊结果作为预处理步骤对3D Gaussian Splatting (3DGS)重建质量的影响。在Real Camera Motion场景下,重建PSNR为25.41,SSIM 0.8095,LPIPS 0.1628,显著优于基线方法。
实验与关键结果
- 在BSD, RealBlur, RSBlur, FEVD, RWBI等真实世界基准上进行定量和定性评估。
- 评估去模糊结果作为预处理步骤对3D Gaussian Splatting (3DGS)重建质量的影响。
- 进行消融实验,验证Frame-wise VAE, 3DGS数据, DMD蒸馏, 和TWM的有效性。
- BSD: PSNR 28.76, SSIM 0.884, LPIPS 0.118, FID 9.1, MUSIQ 52.49, NIQE 4.583, tOF 1.974(第 9 页)
- RealBlur: PSNR 27.55, SSIM 0.852, LPIPS 0.100, FID 11.3, MUSIQ 57.01, NIQE 4.433, tOF 1.827(第 9 页)
- RSBlur: PSNR 32.70, SSIM 0.915, LPIPS 0.142, FID 5.8, MUSIQ 52.01, NIQE 4.884, tOF 1.301(第 9 页)
- FEVD: PSNR 28.90, SSIM 0.886, LPIPS 0.137, FID 12.4, MUSIQ 40.25, NIQE 6.058, tOF 3.978(第 9 页)
- RWBI: MUSIQ 63.50, CLIP-IQA 0.510, NIQE 4.250(第 10 页)
- 3DGS重建 (Real Camera Motion): PSNR 25.41, SSIM 0.8095, LPIPS 0.1628(第 11 页)
阅读时需要注意
- 对于小尺寸结构化图案(如文本),重建结果可能出现结构失真。
- 在极端模糊条件下,高频细节(如复杂植被)的结构保真度有限。
- 消融实验显示,移除Frame-wise VAE会导致PSNR大幅下降4.87 dB,表明其对处理剧烈模糊变化至关重要。
- 全局注意力(无TWM)会导致严重的RoPE外推伪影,而过小的窗口(W=5)会限制时间聚合。
关联工作
- Wan2.1:作为基础Video Diffusion Model (VDM) backbone。(第 5 页)
- DMD:用于将多步扩散过程蒸馏为单步生成器。(第 7 页)
- 3DGS:用于生成包含相机运动和离焦模糊的大规模训练数据。(第 3 页)
- RoPE:其外推不稳定性通过Temporal Window Mask解决。(第 7 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
RealVDeblur:面向可泛化真实世界视频去模糊的单步扩散模型
Jin Renbiao1,2,∗, Yang Mingxin1,2,∗, Chen Yutian2,3, Zhuang Junhao5, Cai Xin2,3, Yu Mulin2, Xu Linning3, Yu Wenxian1, Zou Danping1,†, Guo Shi2,†, 以及 Xue Tianfan3,2,4
1上海交通大学 2上海人工智能实验室 3香港中文大学多媒体实验室 4InnoHK下的CPII 5清华大学
摘要。由于运动模式多样、退化复杂以及真实训练数据的稀缺,真实世界视频去模糊仍然具有挑战性,然而稳健的复原对于移动成像和3D重建等下游管线至关重要。本文提出了 RealVDeblur,这是一种高效的生成式框架,旨在提升在多样化真实拍摄条件下的野外鲁棒性。首先,基于场景级3D高斯溅射 (3DGS) 资产和高帧率视频构建了一个大规模、物理基础的去模糊合成管线,以提供逼真的物体运动去模糊。其次,利用覆盖相机诱导去模糊的视频数据对扩散先验进行训练,以进行复原;为了更好地适应帧相关的去模糊变化,VAE中的时间压缩被禁用,并采用了帧级编码方案。为了在长视频上进行实际部署,多步扩散采样被蒸馏为一个高效的单步生成器,并且一种无需训练的 Temporal Window Mask (TWM) 能够在恒定内存使用量的情况下稳定训练范围之外的推理。在多样化真实世界基准上的大量实验表明,该模型在未见视频上具有强大的感知质量、语义保真度和时间一致性,并且在严重运动模糊下提高了下游3D重建的鲁棒性。项目页面:https://rbjin.github.io/RealVDeblur/
关键词:真实世界视频去模糊 · 视频扩散
1 引言
真实世界视频去模糊是计算机视觉中的一个重要问题,因为由于相机抖动、动态场景和长曝光,运动模糊在实际视频拍摄中经常发生。该任务旨在从模糊退化的序列中恢复清晰帧。视频去模糊在下游应用中发挥着关键作用。例如,现代移动成像和视频增强管线依赖于稳定的清晰帧,而3D重建对运动模糊特别敏感,这会显著降低几何精度。
- 表示同等贡献,† 表示通讯作者。
第 2 页
2 R. Jin 等
输入\Ours 输入 ESTRNN RVRT Ours
输入\Ours 输入 ESTRNN RVRT Ours
图 1: 我们在真实场景下提出的 RealVDeblur 与最先进视频去模糊方法的视觉对比。虽然传统的基于回归的方法在处理野外复杂运动模糊时遇到困难,并产生过度平滑的结果,但我们的生成式框架忠实地恢复了清晰的结构和高频细节。
视频去模糊方法已从显式运动对齐 [26, 38] 发展到隐式对应关系学习 [33,50],最近又发展到基于 Transformer 的时空聚合 [14,16,45]。尽管这些方法在合成基准测试中取得了强劲的结果,但它们在真实视频上的性能往往会下降,表现出泛化能力有限和去模糊质量令人不满意。这种局限性主要由两个因素引起。(1) 训练数据:可用的训练数据规模有限,且通常与真实运动模糊不匹配。现有模型通常是在从少量场景捕获的数据集上训练的(例如,GoPro 仅包含 20 个场景),为学习鲁棒的运动统计提供了不足多样性。此外,模糊通常通过在 RGB 域中进行帧平均来合成,这与真实运动模糊的物理形成过程存在差异。(2) 缺乏视频先验:大多数现有方法采用确定性回归公式,因此缺乏对清晰视频序列的真实先验。没有这种先验,当应用于训练分布之外的视频时,恢复的帧可能会表现出残留模糊和过度平滑的纹理。
因此,开发一种能够泛化到多样化野外视频的实时视频去模糊方法仍然是一个开放且具有挑战性的问题。
在本文中,我们提出了 RealVDeblur,这是一种用于真实世界视频去模糊的高效生成式框架,旨在提高在各种捕获条件下的鲁棒性。我们的框架从数据和建模两个方面解决了真实世界的泛化问题。通过结合精心构建的大规模训练数据、视频扩散先验以及高效的推理设计,RealVDeblur 能够在严重模糊和多样化的真实捕获条件下实现鲁棒的恢复。
现有的视频去模糊数据集在规模和场景多样性方面有限(例如,GoPro 仅包含 20 个训练场景,BSD 提供约 60 个训练场景),这限制了鲁棒的运动建模。为了解决这一局限性,我们受到真实世界图像模糊模拟 [11,30] 的启发,构建了一个大规模真实数据生成流水线。我们从场景级 3D 渲染合成序列
第 3 页
RealVDeblur 3
Gaussian Splatting (3DGS) 资产 [34,43],并通过 ISP 感知过程直接在 RAW 域中模拟相机引起的运动模糊和散焦模糊,从而实现物理一致的退化建模。此外,我们整合了大规模高帧率视频 [23–25],以更好地捕捉物体运动模糊。总体而言,我们整理了约 2,000 个 3DGS 场景和约 3,000 个高帧率视频,以生成多样化的训练数据,显著增强了对真实世界拍摄条件的泛化能力。
在模型方面,为了更好地建模时间动态并为清晰视频序列提供合理的先验,我们利用了视频扩散模型(Video Diffusion Model, VDM)的最新进展。尽管 VD-Diff [29] 和 DIVD [20] 等先前工作在合成基准上表现出强大的性能,但直接将预训练的扩散模型应用于真实世界模糊仍然具有挑战性。大多数视频扩散骨干网络依赖于时间压缩的 VAE 潜在变量,这些潜在变量假设帧间过渡是平滑的——这一假设在具有不同模糊程度的真实世界模糊序列中往往不成立。此外,多步推理计算成本高,且难以扩展到长视频。特别是,3D RoPE 等位置编码会引入长度外推问题,导致测试序列超过训练范围时推理不稳定。为了解决这些局限性,我们引入了两项关键修改。首先,我们禁用了 VAE 中的时间压缩,并采用帧级 2D 编码方案,从而更忠实地建模帧级模糊变化。其次,我们将原始的多步扩散过程蒸馏为一个高效的一步生成器,并引入了一种无需训练的 Temporal Window Mask (TWM),将 3D RoPE 的有效范围限制在局部时间窗口内。
这种设计缓解了长度外推问题,并实现了跨长序列的内存高效推理,使得基于扩散模型的修复在长真实世界视频中变得实用。
大量实验表明,所提出的 RealVDeblur 在多种真实世界基准上均具有良好的泛化能力,在未见过数据集上实现了出色的感知质量、语义保真度和时间一致性。此外,我们的方法有效缓解了下游 3D 重建场景中的运动和散焦模糊,特别是在大规模场景拍摄下。
贡献。我们的贡献总结如下。 – 我们将预训练的基于 DiT 的视频生成模型重新用于视频去模糊的生成式时空先验,采用帧级潜在编码来建模帧依赖的模糊变化,使统一模型能够处理相机运动、物体运动和散焦模糊。 – 我们开发了一种实用的推理流水线,结合了单步分布匹配蒸馏(Distribution Matching Distillation, DMD)和无需训练的时间窗口策略,消除了 RoPE 外推伪影,使得在超出训练范围的长视频上能够进行稳定且高效的推理。 – 我们在多种真实世界基准上提供了广泛的多维度评估,明确表征了生成式视频修复中固有的感知-保真度权衡,并为基于 VDM 的视频去模糊建立了强有力的基线。
第 4 页
4 R. Jin 等
2 相关工作
2.1 视频去模糊网络
基于学习的视频去模糊方法通过显式或隐式对齐,从相邻帧中聚合互补的清晰证据。显式方法估计光流以进行特征扭曲 [26,38],而隐式方法采用滤波器自适应卷积 [50] 或具有模糊鲁棒补偿的循环传播 [33,48],以避免在严重模糊下脆弱的运动估计。最近,基于 Transformer 的架构,如 VRT [14]、RVRT [16] 和 BSSTNet [45],改进了长程时空建模。尽管这些特定于任务的网络在失真指标上表现强劲,但它们是在有限的配对数据上从头训练的,并且在复杂的真实世界模糊中往往产生过度平滑的纹理。相比之下,我们重新利用预训练的视频生成模型作为生成性时空先验,以恢复超出传统骨干网络回归能力的细节。
2.2 模糊合成与现实世界基准
去模糊进展与数据集的真实性密切相关。带有专用设备的真实世界配对数据集已针对图像 [31] 和视频 [49] 收集。为了缩小合成到真实的差距,RSBlur [30] 提出了更逼真的合成流程,而 RAW-Blur [49] 主张在 RAW 空间中合成模糊。事件辅助 [8] 和基于几何的基准,如 GS-Blur [11],进一步丰富了评估范围。顺应这一趋势,我们整理了涵盖相机运动、物体运动和散焦模糊的训练数据,并在多种现实世界基准上进行了多维评估。
2.3 用于去模糊的扩散先验和视频基础模型
扩散模型越来越多地被用作低层视觉的生成先验。对于图像,DiffBIR [18] 利用潜在扩散进行细节再生,DeblurDiff [9] 为真实世界去模糊定制了扩散模型。对于视频,VD-Diff [29] 将扩散集成到 Transformer 骨干网络中以进行恢复,DIVD [20] 则通过时间注意力调整视频扩散模型以处理帧间依赖。即插即用方法应用扩散先验而无需特定任务训练,但往往存在时间不一致性和高昂的成本 [13, 40,42]。 大规模视频扩散模型 [27, 37] 编码了丰富的统计信息,但由于迭代采样而成本高昂。参数高效适配 [4] 在保留先验的同时实现任务引导,而 DMD [44] 和渐进式蒸馏 [32] 等蒸馏技术将采样减少到几步或单步。对于长序列,现有框架依赖于窗口处理或稀疏注意力 [1,14,16]。我们的方法结合条件注入与 LoRA 来重新利用视频基础模型,通过 DMD 将多步采样蒸馏为单步推理,并引入免训练的时间窗口掩码以实现稳定的长视频推理。
第 5 页
RealVDeblur 5
Diffusion Transformer (×N) Noise Latents Self-attention with Temporal Window Mask Decoder Cross-attention Encoder Video Latents (null text) Frame-wise VAE Frame-wise VAE Feed-Forward Network
One-Step Distillation Temporal Window Mask
Noise Attend(Attend+extrapolation(𝑖−𝑗≤𝑊) 𝑖−𝑗≤𝑊) MaskedAttend Latents 1 1 RoPE ℒ𝐿𝑃𝐼𝑃𝑆 extrapolation Student Video zone 5 5 ℒ𝐿1 Video (One step) Latents Latents Frame-wise DecoderVAE 9 Frame 9 Add Noise Frame 𝑖−𝑗≤𝑊 Query 𝑊(=training length) Query 13 (trained) 13 Teacher Critic ℒ𝐹𝑀 16 16 1 5 9 13 16 1 5 9 13 16 Key Frame Key Frame ℒ𝐷𝑀𝐷 Global Attention Temporal Window Mask
图 2: RealVDeblur 框架概述。我们的方法通过三个关键组件,将预训练的 Video Diffusion Model (VDM) 重新用于视频去模糊:(1) 一种保留帧相关模糊变化的帧级变分自编码器 (Frame-wise VAE) 编码方案;(2) 通过分布匹配蒸馏 (Distribution Matching Distillation, DMD) 结合像素空间监督实现的一步推理;以及 (3) 一种无需训练的 Temporal Window Mask (TWM),它将自注意力限制在局部窗口内,消除了 RoPE 外推的不稳定性,并支持在任意长视频上进行恒定内存推理。
3 方法
我们提出了 RealVDeblur,这是一个基于预训练 Video Diffusion Model (VDM) 构建的生成式视频去模糊框架,并结合精心设计的训练数据,以在各种真实拍摄条件下实现鲁棒的野外去模糊。整体流程如图 2 所示。 我们的框架通过将模糊观测作为条件信号注入,将预训练的 VDM 重新用于视频去模糊。为了处理破坏时间压缩 VAE 潜在变量平滑过渡假设的帧相关模糊幅度,它禁用了时间压缩,并采用帧级编码以实现忠实的帧级条件控制(第 3.1 节)。为了高效部署,多步采样通过分布匹配蒸馏为一步模型。一种无需训练的时间窗口策略进一步稳定了在超出训练范围任意长视频上的推理(第 3.2 节)。最后,全面的数据策展和模糊合成管道提供了跨越多种模糊类型的多样化训练样本,提高了野外泛化能力(第 3.3 节)。
3.1 适配用于去模糊的视频扩散模型
我们基于 Wan2.1 [37] 构建,这是一个在大规模图像和视频数据集上通过 Flow Matching [19] 训练的大规模 Diffusion Transformer (DiT) [27]。该模型操
第 6 页
6 R. Jin 等
基于由因果 3D 变分自编码器(Causal 3D Variational Autoencoder, Wan-VAE)[37] 产生的潜在表示。给定视频 $V \in \mathbb{R}^{T \times 3 \times H \times W}$,首先将其编码为紧凑的潜在表示 $z$,然后将其分块化为潜在标记序列。DiT 通过一组 Transformer 块处理这些标记,每个块包含时空自注意力、用于文本条件的交叉注意力以及前馈网络。在本工作中,我们将此预训练架构适配用于视频去模糊任务。
条件与参数高效微调。为了实现条件视频去模糊,模糊潜在表示 $z_{\text{blur}}$ 使用 3D 卷积网络投影到潜在特征空间。生成的嵌入被添加到噪声潜在表示 $x_\tau$ 中,然后输入到 DiT。参数高效微调使用附加到 Transformer 块的 LoRA 模块执行,而预训练的 VAE 保持冻结。通过空文本嵌入禁用文本引导。训练遵循流匹配目标: $$ \mathcal{L}_{\mathrm{FM}} = \mathbb{E}_{\tau, x_0, \epsilon} \left\| v_\theta(x_\tau, \tau, z_{\mathrm{blur}}) – u_\tau \right\|^2 \quad (1) $$ 其中 $x_\tau = (1 – \tau)x_0 + \tau\epsilon$ 是时间 $\tau \in [0, 1]$ 处的插值潜在表示,$u_\tau = \epsilon – x_0$ 是目标速度。
帧级潜在编码。现代视频扩散模型通常采用 3D VAE 在空间和时间维度上联合压缩视频,以提高效率。例如,Wan-VAE 执行时间下采样(例如 $\times 4$)以获得紧凑的时空潜在表示用于扩散建模 [37]。然而,这种时间压缩不太适合视频恢复,特别是运动去模糊。运动模糊将场景内容在时间上积分,导致相邻帧之间存在巨大差异,使得 VAE 中的时间压缩容易丢失信息。
为了解决这个问题,我们移除了 VAE 中的时间压缩,转而采用帧级 2D 编码器。对于输入视频 $V = \{y_t\}_{t=1}^T$,我们独立编码每一帧,并将生成的潜在表示沿时间维度拼接: $$ z_{\mathrm{blur}} = \mathrm{concat}\big(E(y_1), \ldots, E(y_T)\big) \in \mathbb{R}^{T \times C \times H' \times W'}, \quad (2) $$ 其中 $E$ 表示帧级 2D VAE 编码器。尽管 VAE 经过修改以移除时间压缩,但这一变化并未为预训练的 DiT 引入潜在分布不匹配。Wan2.1 在图像和视频数据集上进行训练,其中图像可视为时间长度为 1 的视频。因此,预训练的 DiT 天然支持帧级潜在表示。
3.2 高效视频去模糊推理
部署多步 VDM 用于实际视频去模糊面临两个效率挑战:迭代采样的高延迟(例如 50 个去噪步骤)以及 RoPE 外推在长序列上全局注意力的可扩展性差。我们通过一步蒸馏和无训练时间窗口掩码来解决这些问题。
第 7 页
RealVDeblur 7
一步蒸馏。为了降低迭代采样的延迟,我们采用分布匹配蒸馏(DMD)[44] 将多步扩散过程(例如 50 步)蒸馏为一个单步生成器。DMD 训练一个学生模型,通过教师模型与学习到的评论家(Critic)之间的分数差异来匹配冻结的教师模型的输出分布。在我们的实现中,学生模型、教师模型和评论家共享相同的冻结 DiT 主干网络,仅在各自独立可训练的 LoRA 参数上有所不同。从纯噪声 $z$ 开始,学生模型在单步内直接预测干净潜在变量 $\hat{x}_0$。学生模型使用 DMD 目标函数以及基于 VAE 解码帧计算的像素空间 $\ell_1$ 和 LPIPS [47] 损失进行训练:$L_{student} = L_{DMD} + \lambda_{L1} L_{L1} + \lambda_{LPIPS} L_{LPIPS}$。评论家使用标准流匹配目标函数在学生模型的分离输出上进行训练。经验上,我们观察到蒸馏过程中引入的额外像素空间监督也能提高去模糊性能,如第 4.4 节所示。
免训练时间窗口掩码。对于视频去模糊,每帧的恢复主要依赖于邻近帧的时间冗余,而非整个序列的全局上下文。然而,直接将视频扩散模型(VDM)应用于长视频序列会导致两个主要挑战:(1) 全局自注意力的二次方内存成本,以及 (2) 在处理比训练期间更长的序列时,旋转位置编码(RoPE)的外推性能下降 [35,39]。我们通过时间窗口掩码(TWM)来解决这些挑战。在推理过程中,我们将全局自注意力替换为局部窗口注意力:对于每一帧 $t$,注意力被限制在一个大小为 $W$ 的时间窗口内:
$$ \text{Attn}(Q_t, K, V) = \text{Softmax}\left( \frac{Q_t K_{[t-W/2, t+W/2]}^T}{\sqrt{m}} \right) V_{[t-W/2, t+W/2]} \quad (3) $$
通过将注意力约束在与训练序列长度匹配的固定窗口 $W$ 内,我们确保推理期间帧之间的相对距离严格保持在旋转嵌入的良好训练流形内。这种推理与训练位置分布之间的一致性有效地消除了由 RoPE 外推引起的不稳定性。因此,模型可以通过仅关注最相关的局部时间上下文,在扩展序列上保持一致的恢复质量,而不会遭受长程全局注意力中通常观察到的累积误差。
3.3 大规模真实模糊合成
现实世界中的视频模糊源于三种物理机制:相机抖动、物体运动和光学离焦。然而,现有的训练数据集仅涵盖这些退化现象的子集,且来自有限数量的场景(例如 GoPro 有 20 个,BSD 有 60 个),限制了可用于训练的运动模式和场景内容的多样性。为了解决这个问题,我们通过合成来自两个互补数据源的真实模糊,构建了一个大规模训练集,称为 OmniBlur:(1) 3D 高斯溅射(3DGS)重建 [6]
第 8 页
8 R. Jin 等
用于相机运动模糊和散焦模糊,以及(2)高帧率视频 [23–25] 用于物体运动模糊。 来自 3DGS 的相机运动模糊与散焦模糊。遵循 GS-Blur [11] 的思路,该研究表明在 3DGS 场景中沿扰动相机姿态渲染可以产生逼真的图像级运动模糊,我们利用大规模 3DGS 场景 [34,43] 将此思想扩展至视频设置。对于相机运动模糊,我们在每个场景中生成平滑的相机轨迹,并通过贝塞尔曲线添加随机的 6-DoF 扰动以模拟手持抖动;渲染 K 个子帧并在线性空间中进行平均以生成模糊帧。对于散焦模糊,我们使用薄透镜相机模型,并结合来自 3DGS 渲染的逐像素深度:在围绕随机选择的焦平面的圆形孔径盘上采样 N 个视图,从而产生逼真的深度依赖散景。由于在实际情况中相机抖动和散焦经常同时出现,我们还通过结合这两种机制(每帧 K×N 次渲染)生成复合模糊。 来自动态视频的物体运动模糊。相机运动模糊和散焦模糊可以从静态 3DGS 场景中渲染,但物体运动模糊需要真实的动态内容。我们引入了三个高帧率数据集(GoPro [24]、REDS [23] 和 SloMo [25]),以覆盖大幅度的物体位移和非刚性运动。 ISP 感知增强与数据组合。渲染的图像是无噪声的,且跳过了相机 ISP 处理,这与真实拍摄存在差距。遵循 RSBlur [30] 的做法,我们在 RAW 域中注入泊松-高斯噪声并模拟 ISP(马赛克化、白平衡、去马赛克化),以生成逼真的训练对。我们生成的 OmniBlur 包含约 2,000 个 3DGS 场景和约 3,000 个高帧率视频。为了提高在不同拍摄条件下的鲁棒性,我们在训练过程中采用混合训练策略,结合了不同的序列长度、多种空间分辨率以及各种模糊类型(相机运动、物体运动和散焦)。数据集的详细信息见补充材料。
4 实验
4.1 实验设置
基准测试。为了评估 RealVDeblur 在现实世界中的泛化能力,我们关注多样化的真实世界基准测试,而非像 GoPro [24] 和 DVD [36] 这样的合成基准。具体而言,我们在 BSD [49]、RealBlur [31]、RSBlur [30]、FEVD [8] 和 RWBI [46] 上进行评估。我们从 RealBlur 和 RSBlur 的测试集中分别提取了 50 和 165 个序列,每个序列平均长度为 20 帧。对于 BSD,我们使用 3ms–24ms 测试子集,包含 20 个序列,每个序列 150 帧。对于 FEVD,我们采用 8 个测试视频中每个 150 帧的 RGB 序列;对于 RWBI,我们使用 43 个重组序列,长度范围从 10 到 100 帧。 评估指标。我们采用一套全面的指标来评估恢复保真度、感知质量、语义真实性和时间一致性。
第 9 页
RealVDeblur 9
度。具体而言,PSNR 和 SSIM 衡量失真级别的重建准确性,而 LPIPS [47] 和 FID [3] 评估感知相似性和分布对齐。我们进一步报告无参考质量指标,包括 MUSIQ [5] 和 NIQE [22],以反映高层视觉质量。时间一致性使用时序光流误差 (tOF [2]) 进行评估。
基线。我们将 RealVDeblur 与基于循环的方法(ESTRNN [48]、RNN-MBP [51])、基于对齐的 CNN 方法(ShiftNet [12])以及基于 Transformer 的模型(VRT [15]、RVRT [16]、BSSTNet [45])进行比较。其中,ESTRNN 在真实世界 BSD 数据集上训练,而其余方法在 GoPro 和 REDS 等合成数据集上训练。对于 VRT,我们采用在 REDS 上训练的模型,因为其性能优于在 GoPro 上训练的对应模型。
实现细节。我们在 32 块 A100 GPU 上使用 AdamW(学习率 5e-5)配合 LoRA(秩 64)对 Wan2.1-1.3B 进行微调。DMD 蒸馏使用 $\lambda_{L1} = \lambda_{LPIPS} = 2$。TWM 窗口大小设置为 $W = 20$,与训练序列长度匹配。完整细节见补充材料。
表 1:在真实世界视频去模糊基准上的定量比较。最佳和次佳结果分别加粗和下划线。
训练 失真 感知 语义 时序 基准 方法 数据集 PSNR↑ SSIM↑ LPIPS↓ FID↓ MUSIQ↑ NIQE↓ tOF↓
ESTRNN [48] BSD 31.39 0.936 0.114 10.8 43.88 5.793 2.146 RNN-MBP [51] GoPro 22.84 0.726 0.320 69.6 33.05 5.426 6.639 ShiftNet [12] GoPro 24.98 0.816 0.221 36.6 39.21 5.770 4.452 BSD [49] VRT [15] REDS 26.72 0.850 0.199 33.5 39.34 5.605 2.583 RVRT [16] GoPro 26.06 0.849 0.196 28.6 39.72 5.563 3.725 BSSTNet [45] GoPro 20.90 0.707 0.320 60.5 38.16 7.370 6.532 RealVDeblur OmniBlur 28.76 0.884 0.118 9.1 52.49 4.583 1.974
ESTRNN [48] BSD 26.90 0.825 0.207 32.3 41.64 6.050 2.469 RNN-MBP [51] GoPro 24.43 0.775 0.258 59.9 40.36 6.164 3.274 ShiftNet [12] GoPro 23.95 0.762 0.198 33.7 49.44 5.408 4.423 RealBlur [31] VRT [15] REDS 26.54 0.838 0.153 20.9 51.09 4.938 2.338 RVRT [16] GoPro 26.00 0.839 0.134 14.8 53.02 4.906 2.206 BSSTNet [45] GoPro 25.09 0.807 0.184 28.1 48.12 5.407 3.092 RealVDeblur OmniBlur 27.55 0.852 0.100 11.3 57.01 4.433 1.827
ESTRNN [48] BSD 30.26 0.868 0.290 20.9 34.70 6.448 3.240 RNN-MBP [51] GoPro 25.79 0.768 0.352 60.5 29.59 6.492 9.605 ShiftNet [12] GoPro 25.75 0.766 0.326 48.7 39.10 5.151 14.59 RSBlur [30] VRT [15] REDS 26.46 0.824 0.306 48.0 34.00 5.674 5.285 RVRT [16] GoPro 28.53 0.854 0.244 27.7 38.72 5.444 4.766 BSSTNet [45] GoPro 28.03 0.830 0.277 35.2 34.61 6.024 8.043 RealVDeblur OmniBlur 32.70 0.915 0.142 5.8 52.01 4.884 1.301
ESTRNN [48] BSD 28.76 0.896 0.219 39.0 29.57 8.076 7.630 RNN-MBP [51] GoPro 25.75 0.843 0.302 89.0 26.58 7.611 16.14 ShiftNet [12] GoPro 25.50 0.846 0.317 94.6 26.56 7.274 21.68 FEVD [8] VRT [15] REDS 27.01 0.875 0.265 83.3 28.54 6.840 11.85 RVRT [16] GoPro 27.65 0.881 0.247 76.7 28.97 7.475 13.48 BSSTNet [45] GoPro 25.43 0.846 0.269 77.4 28.41 7.465 15.83 RealVDeblur OmniBlur 28.90 0.886 0.137 12.4 40.25 6.058 3.978
第 10 页
10 R. Jin 等
4.2 真实世界视频去模糊评估
定量分析。表 1 总结了在四个真实世界基准测试(BSD、RealBlur、RSBlur 和 FEVD)上的定量比较结果。RealVDeblur 在几乎所有基准测试的几乎所有指标上均取得了最佳或次佳结果,展现了强大的跨数据集泛化能力。我们强调三个关键发现,这些发现证实了我们的设计动机。(1) 在合成数据集上训练的方法(例如,在 GoPro 上训练的 BSSTNet、RNN-MBP)在真实世界基准测试中出现了显著的退化。这证实了合成帧平均模糊与真实运动模糊之间的域差异,验证了我们基于物理的数据构建流程。(2) 在真实世界 BSD 数据集上训练的 ESTRNN 在 BSD 上取得了最高的 PSNR(31.39),但在感知指标上表现持续不佳(例如,MUSIQ 43.88 vs. 我们的 52.49)。这表明,缺乏视频先验的确定性回归往往会产生过度平滑的纹理,支持了我们采用基于扩散的生成框架。(3) RealVDeblur 在所有四个基准测试上均取得了最佳的时间一致性(tOF),表明我们的带有时间窗口掩码的一步蒸馏推理有效地保持了帧间连贯性。在 RWBI 基准测试(表 2)上,RealVDeblur 以显著优势超越所有基线方法(MUSIQ: 63.50 vs. 47.85, CLIP-IQA: 0.510 vs. 0.356),进一步证实了由我们的大规模训练数据和生成先验所实现的真实世界泛化能力。
定性分析。如图 3 所示,我们展示了在具有挑战性的真实世界条件下的定性比较,包括低光和过曝环境中的严重运动模糊。现有的基线方法难以重建精细的结构细节;例如,在严重退化的 FEVD 示例中,由于过曝和严重模糊,背景建筑细节完全丢失,所有基线方法都产生了严重平滑或扭曲的输出。相比之下,RealVDeblur 有效地利用其学习到的生成先验和时间建模,恢复了模糊输入中缺失的高频细节。此外,我们的方法忠实地恢复了直线几何结构(例如 RSBlur 中的玻璃墙),而先前的方法产生了明显的结构失真,证明了我们在保持几何一致性方面基于扩散的方法的优势。
表 2: 在无参考 RWBI 基准测试 [46] 上的定量评估。
方法 数据 MUSIQ↑ CLIP-IQA↑ NIQE↓
ESTRNN [48] BSD 47.85 0.356 5.759 RNN-MBP [51] GoPro 38.48 0.207 5.553 ShiftNet [12] GoPro 44.14 0.244 5.837 VRT [15] REDS 45.87 0.250 4.913 RVRT [16] GoPro 45.59 0.257 5.356 BSSTNet [45] GoPro 43.58 0.215 5.774 RealVDeblur OmniBlur 63.50 0.510 4.250
第 11 页
RealVDeblur 11
4.3 在 3DGS 重建上的评估
为了验证视频去模糊对下游 3D 视觉任务的实用价值,我们将其作为 3D Gaussian Splatting (3DGS [6]) 重建预处理步骤的影响进行评估。我们将我们的方法与两种端到端的去模糊-3DGS 方法——BAGS [28] 和 Deblurring-3DGS [10] 进行了比较,这些方法联合优化模糊建模和场景表示;同时也与级联基线方法进行了比较,这些基线方法在标准 3DGS 训练之前应用 VRT [14] 进行多视图图像恢复。详细的实验设置见补充材料。 总体而言,这些结果表明,RealVDeblur 作为 3DGS 流水线中强大的通用预处理模块,在相机运动模糊方面持续优于端到端替代方案,并且在无需任何任务特定联合优化的情况下,在散焦模糊方面取得了具有竞争力的性能。
表 3:在 DeblurNeRF [21] 数据集上,针对真实相机运动模糊和散焦模糊的 3DGS 重建质量的定量比较。最佳和次佳结果分别以粗体和下划线标出。
真实相机运动 真实散焦 方法 PSNR ↑ SSIM ↑ LPIPS ↓ PSNR ↑ SSIM ↑ LPIPS ↓
BAGS [28] 24.98 0.7458 0.2310 23.32 0.7242 0.1846 Deblurring-3DGS [10] 25.67 0.7695 0.2231 22.81 0.6997 0.2236
VRT [15] + 3DGS 22.56 0.7220 0.3225 21.85 0.7873 0.2741 RealVDeblur + 3DGS 25.41 0.8095 0.1628 22.87 0.8335 0.1798
4.4 消融研究
我们在 BSD 基准上进行了消融研究,以验证每个关键设计选择。结果总结在表 4 中。 帧级 VAE 编码。用默认的因果 3D VAE 替换我们的帧级编码器会导致所有消融实验中最大的性能下降(PSNR 降低 4.87 dB)。3D VAE 将相邻帧压缩到共享的时间潜在空间中,假设帧间过渡是平滑的——这一假设被帧间变化的模糊程度所违背。这种差异在 BSD 数据集中被进一步放大,因为长曝光和快速运动引入了极端的时序不对齐。由此产生的信息损失阻止了 DiT 对每帧退化进行建模,导致严重的重建伪影和时间不一致性。图 5 可视化了在不同 VAE 下,在具有大运动的序列中的去模糊性能。 3DGS 渲染的训练数据。移除 3DGS 渲染数据并仅在高分辨率视频上训练会导致 PSNR 下降 2.30 dB。高分辨率数据集主要涵盖物体运动模糊,但缺乏相机自运动和散焦模糊,而这些在真实世界拍摄中很常见。我们的 3DGS 流水线通过 ISP 感知的噪声增强,提供了对这些退化类型的互补覆盖,显著提高了泛化能力。
第 12 页
12 R. Jin 等.
输入 ESTRNN ShiftNet BSSTNet
FEVD VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
BSD VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
RSBlur VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
RealBlur VRT RVRT 本文方法 GT
图 3: 在多个真实世界评估数据集上的定性比较。在包括严重运动模糊、低光照和过曝在内的挑战性条件下,基线模型通常会产生过度平滑的输出或结构失真。相比之下,RealVDeblur(本文方法)在保持几何保真度的同时,有效地恢复了清晰的高频细节。GT 表示真实值(Ground Truth)。
第 13 页
RealVDeblur 13
新视角真值 BAGS Deblurring-3DGS VRT+3DGS Ours+3DGS
新视角真值 BAGS Deblurring-3DGS VRT+3DGS Ours+3DGS
图 4:真实世界相机运动模糊(第一行)和散焦模糊(第二行)下 3DGS 重建的视觉评估。与端到端方法(BAGS、Deblurring-3DGS)及级联基线(VRT + 3DGS)相比,使用 RealVDeblur 作为预处理步骤显著提高了重建场景的几何精度和纹理清晰度。
单步蒸馏(DMD)。反直觉地,蒸馏后的单步模型略优于 50 步教师模型。我们将此归因于蒸馏过程中引入的像素空间监督(ℓ1 和 LPIPS 损失),这提供了原始潜在空间流匹配训练中缺失的直接图像域梯度。因此,蒸馏后的模型在质量和推理速度上均表现更佳。
时间窗口掩码(TWM)。如图 6 所示,我们在一个 150 帧的视频上对 TWM 进行了定性评估。全局注意力(无 TWM)由于 RoPE 超出训练范围进行外推,导致严重的伪影。窄窗口(W = 5)避免了外推,但限制了时间聚合,留下了残余模糊。我们的默认窗口(W = 20)与训练长度匹配,在稳定的位置编码与高保真恢复所需的充足时间上下文之间取得了平衡。
表 4:所提出组件的消融实验。我们通过替换或移除完整流水线(最后一行)中的各个组件来评估其贡献。所有实验均在 BSD 基准上进行评估。
变体 PSNR ↑ SSIM ↑ LPIPS ↓ tOF ↓ 时间(秒/帧) ↓
无帧级 VAE (因果 3D VAE) 23.89 0.748 0.262 9.106 – 无 3DGS 渲染数据 26.46 0.810 0.188 2.782 – 无 DMD (50 步教师) 28.02 0.873 0.135 2.097 3.53 无 TWM (全局注意力) 27.20 0.845 0.165 3.786 0.29
RealVDeblur (完整模型) 28.76 0.884 0.118 1.974 0.15
第 14 页
14 R. Jin 等
输入
因果 3D VAE
帧级 VAE
第 27 帧 第 28 帧 第 29 帧 第 30 帧 第 31 帧 第 32 帧
图 5:因果 3D VAE 与帧级 VAE 的对比。在快速运动序列中(例如,第 27-32 帧),因果 3D VAE 表现出显著的伪影和时间不一致性,而帧级 VAE 则保持了清晰的细节和高保真重建。
输入 无 TWM 有 TWM (W=5) 有 TWM (W=20)
图 6:时间窗口掩码(TWM)在 150 帧视频上的定性消融实验,涵盖三种注意力配置:全局注意力(无 TWM)、窄窗口(W = 5)以及我们的默认窗口(W = 20)。全局注意力由于 RoPE 外推导致严重伪影;窄窗口避免了外推但限制了时间聚合;我们的默认窗口在稳定性和恢复质量之间取得了最佳平衡。
5 结论
本文提出了 RealVDeblur,这是一种基于扩散的高效框架,用于具有强大跨数据集泛化能力的真实世界视频去模糊。RealVDeblur 通过将大规模、基于物理的模糊合成流水线与预训练的视频扩散先验相结合,解决了野外去模糊的两大主要瓶颈——训练数据不匹配和缺乏真实的视频先验。为了更好地适应依赖于帧的模糊变化,我们禁用了 VAE 中的时间压缩并采用帧级编码。为了实际部署,我们将多步扩散采样蒸馏为单步生成器,并引入了一种无需训练的 Temporal Window Mask(时间窗口掩码),从而在恒定内存使用量的情况下,实现超出训练时间跨度的稳定长视频推理。广泛的实验证明了在多种真实世界基准测试中感知质量和时间一致性的提升,并进一步验证了我们的去模糊结果在严重运动模糊下的下游 3D 重建任务中的益处。
第 15 页
RealVDeblur 15
参考文献
1. Chen, Y., Guo, S., Jin, R., Yang, T., Cai, X., Luo, Y., Yang, M., Yu, M., Xu, L., Xue, T.: Anyrecon: Arbitrary-view 3d reconstruction with video diffusion model. arXiv preprint arXiv:2604.19747 (2026) 4 2. Chu, M., Xie, Y., Mayer, J., Leal-Taixé, L., Thuerey, N.: Learning temporal co- herence via self-supervision for gan-based video generation. ACM Transactions on Graphics (TOG) 39(4), 75–1 (2020) 9 3. Heusel, M., Ramsauer, H., Unterthiner, T., Nessler, B., Hochreiter, S.: Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems 30 (2017) 9 4. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., et al.: Lora: Low-rank adaptation of large language models. Iclr 1(2), 3 (2022) 4 5. Ke, J., Wang, Q., Wang, Y., Milanfar, P., Yang, F.: Musiq: Multi-scale image quality transformer. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 5148–5157 (2021) 9 6. Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G., et al.: 3d gaussian splatting for real-time radiance field rendering. ACM Trans. Graph. 42(4), 139–1 (2023) 7, 11 7. Kheradmand, S., Rebain, D., Sharma, G., Sun, W., Tseng, Y.C., Isack, H., Kar, A., Tagliasacchi, A., Yi, K.M.: 3d gaussian splatting as markov chain monte carlo. Advances in Neural Information Processing Systems 37, 80965–80986 (2024) 21 8. Kim, T., Cho, H., Yoon, K.J.: Frequency-aware event-based video deblurring for real-world motion blur. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 24966–24976 (2024) 4, 8, 9 9. Kong, L., Zou, D., Wang, F.L., Ren, J., Wu, X., Dong, J., Pan, J., et al.: Deblurdiff: Real-word image deblurring with generative diffusion models. In: The Thirty-ninth Annual Conference on Neural Information Processing Systems (2025) 4 10. Lee, B., Lee, H., Sun, X., Ali, U., Park, E.: Deblurring 3d gaussian splatting. In: European Conference on Computer Vision. pp. 127–143. Springer (2024) 11, 22 11. Lee, D., Park, J., Lee, K.M.: Gs-blur: A 3d scene-based dataset for realistic image deblurring. Advances in Neural Information Processing Systems 37, 125394–125415 (2024) 2, 4, 8 12. Li, D., Shi, X., Zhang, Y., Cheung, K.C., See, S., Wang, X., Qin, H., Li, H.: A simple baseline for video restoration with grouped spatial-temporal shift. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 9822–9832 (2023) 9, 10 13. Li, Y., Liu, Z., Monno, Y., Okutomi, M.: Tdm: Temporally-consistent diffusion model for all-in-one real-world video restoration. In: International Conference on Multimedia Modeling. pp. 155–169. Springer (2025) 4 14. Liang, J., Cao, J., Fan, Y., Zhang, K., Ranjan, R., Li, Y., Timofte, R., Van Gool, L.: Vrt: A video restoration transformer. IEEE Transactions on Image Processing 33, 2171–2182 (2024) 2, 4, 11, 21 15. Liang, J., Cao, J., Fan, Y., Zhang, K., Ranjan, R., Li, Y., Timofte, R., Van Gool, L.: Vrt: A video restoration transformer. IEEE Transactions on Image Processing 33, 2171–2182 (2024) 9, 10, 11 16. Liang, J., Fan, Y., Xiang, X., Ranjan, R., Ilg, E., Green, S., Cao, J., Zhang, K., Timofte, R., Gool, L.V.: Recurrent video restoration transformer with guided de- formable attention. Advances in Neural Information Processing Systems 35, 378– 393 (2022) 2, 4, 9, 10
第 16 页
16 R. Jin 等
17. Lin, H., Chen, S., Liew, J., Chen, D.Y., Li, Z., Shi, G., Feng, J., Kang, B.: Depth anything 3: 从任意视角恢复视觉空间。arXiv 预印本 arXiv:2511.10647 (2025) 22 18. Lin, X., He, J., Chen, Z., Lyu, Z., Dai, B., Yu, F., Qiao, Y., Ouyang, W., Dong, C.: Diffbir: 基于生成扩散先验的盲图像恢复。在: 欧洲计算机视觉会议。页码 430–448。Springer (2024) 4 19. Lipman, Y., Chen, R.T., Ben-Hamu, H., Nickel, M., Le, M.: Flow matching for generative modeling. arXiv 预印本 arXiv:2210.02747 (2022) 5 20. Long, H., Wang, Y., Wang, W.: Divd: 使用改进的视频扩散模型进行去模糊。arXiv 预印本 arXiv:2412.00773 (2024) 3, 4 21. Ma, L., Li, X., Liao, J., Zhang, Q., Wang, X., Wang, J., Sander, P.V.: Deblur- nerf: 来自模糊图像的神经辐射场。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 12861–12870 (2022) 11, 21 22. Mittal, A., Soundararajan, R., Bovik, A.C.: Making a “completely blind” image quality analyzer. IEEE Signal processing letters 20(3), 209–212 (2012) 9 23. Nah, S., Baik, S., Hong, S., Moon, G., Son, S., Timofte, R., Lee, K.M.: Ntire 2019 challenge on video deblurring and super-resolution: Dataset and study. 在:CVPR 研讨会 (2019年6月) 3, 8, 20 24. Nah, S., Hyun Kim, T., Mu Lee, K.: Deep multi-scale convolutional neural network for dynamic scene deblurring. 在:IEEE 计算机 视觉与模式识别会议论文集。页码 3883–3891 (2017) 3, 8, 20 25. Noki, M.M.H., Mahmud, S.M., Majumder, P.S., Al Radi, A.M., Ali, M.H., Khan, M.M.: Deblurring in the wild: A real-world dataset from smartphone high-speed videos. arXiv 预印本 arXiv:2506.19445 (2025) 3, 8, 20 26. Pan, J., Bai, H., Tang, J.: Cascaded deep video deblurring using temporal sharpness prior. 在:IEEE/CVF 计算机 视觉与模式识别会议论文集。页码 3043–3051 (2020) 2, 4 27. Peebles, W., Xie, S.: Scalable diffusion models with transformers. 在:IEEE/CVF 国际 计算机视觉会议论文集。页码 4195–4205 (2023) 4, 5 28. Peng, C., Tang, Y., Zhou, Y., Wang, N., Liu, X., Li, D., Chellappa, R.: Bags: Blur agnostic gaussian splatting through multi-scale kernel modeling. 在:欧洲 计算机视觉会议。页码 293–310。Springer (2024) 11, 22 29. Rao, C., Li, G., Lan, Z., Sun, J., Luan, J., Xing, W., Zhao, L., Lin, H., Dong, J., Zhang, D.: Rethinking video deblurring with wavelet-aware dynamic transformer and diffusion model. 在:欧洲计算机视觉会议。页码 421–437。 Springer (2024) 3, 4 30. Rim, J., Kim, G., Kim, J., Lee, J., Lee, S., Cho, S.: Realistic blur synthesis for learning image deblurring. 在:欧洲计算机视觉会议。页码 487– 503。Springer (2022) 2, 4, 8, 9, 21 31. Rim, J., Lee, H., Won, J., Cho, S.: Real-world blur dataset for learning and bench- marking deblurring algorithms. 在:欧洲计算机视觉会议。页码 184–201。Springer (2020) 4, 8, 9 32. Salimans, T., Ho, J.: Progressive distillation for fast sampling of diffusion models. arXiv 预印本 arXiv:2202.00512 (2022) 4 33. Son, H., Lee, J., Lee, J., Cho, S., Lee, S.: Recurrent video deblurring with blur- invariant motion estimation and pixel volumes. ACM Transactions on Graphics (TOG) 40(5), 1–18 (2021) 2, 4
第 17 页
RealVDeblur 17
34. SpatialVerse 研究团队,M.T.I.:Interiorgs:一个带有语义标注的室内场景的 3D 高斯溅射数据集。https://huggingface.co/datasets/spatialverse/InteriorGS (2025) 3, 8, 19 35. Su, J., Ahmed, M., Lu, Y., Pan, S., Bo, W., Liu, Y.:Roformer:带有旋转位置编码的增强型 Transformer。Neurocomputing 568, 127063 (2024) 7 36. Su, S., Delbracio, M., Wang, J., Sapiro, G., Heidrich, W., Wang, O.:面向手持相机的深度视频去模糊。在:IEEE 计算机视觉与模式识别会议论文集。pp. 1279–1288 (2017) 8 37. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J. 等:Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314 (2025) 4, 5, 6 38. Wang, X., Chan, K.C., Yu, K., Dong, C., Change Loy, C.:Edvr:利用增强型可变形卷积网络进行视频修复。在:IEEE/CVF 计算机视觉与模式识别会议研讨会论文集。pp. 0–0 (2019) 2, 4 39. Wei, X., Liu, X., Zang, Y., Dong, X., Zhang, P., Cao, Y., Tong, J., Duan, H., Guo, Q., Wang, J. 等:Videorope:什么构成了优秀的视频旋转位置编码?arXiv 预印本 arXiv:2502.05173 (2025) 7 40. Yang, Q., Chen, H., Zhang, Y., Xia, M., Cun, X., Su, Z., Shan, Y.:噪声校准:利用预训练视频扩散模型进行即插即用、内容保留的视频增强。在:欧洲计算机视觉会议。pp. 307–326。Springer (2024) 4 41. Ye, V., Li, R., Kerr, J., Turkulainen, M., Yi, B., Pan, Z., Seiskari, O., Ye, J., Hu, J., Tancik, M. 等:gsplat:一个开源的高斯溅射库。Journal of Machine Learning Research 26(34), 1–17 (2025) 21 42. Yeh, C.H., Shiu, H.S., Lin, C.Y., Wang, Z., Hsiao, C.W., Chen, T.H., Liu, Y.L.:Diffir2vr-zero:基于扩散图像修复模型的零样本视频修复。arXiv 预印本 arXiv:2407.01519 (2024) 4 43. Yeshwanth, C., Liu, Y.C., Nießner, M., Dai, A.:Scannet++:一个高保真室内场景数据集。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 12–22 (2023) 3, 8, 19, 22 44. Yin, T., Gharbi, M., Zhang, R., Shechtman, E., Durand, F., Freeman, W.T., Park, T.:通过分布匹配蒸馏实现单步扩散。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 6613–6623 (2024) 4, 7 45. Zhang, H., Xie, H., Yao, H.:用于视频去模糊的模糊感知时空稀疏 Transformer。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2673–2681 (2024) 2, 4, 9, 10 46. Zhang, K., Luo, W., Zhong, Y., Ma, L., Stenger, B., Liu, W., Li, H.:通过真实模糊进行去模糊。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2737–2746 (2020) 8, 10 47. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.:深度特征作为感知度量的不合理有效性。在:IEEE 计算机视觉与模式识别会议论文集。pp. 586–595 (2018) 7, 9 48. Zhong, Z., Gao, Y., Zheng, Y., Zheng, B.:用于视频去模糊的高效时空循环神经网络。在:欧洲计算机视觉会议。pp. 191–207。Springer (2020) 4, 9, 10 49. Zhong, Z., Gao, Y., Zheng, Y., Zheng, B., Sato, I.:真实世界视频去模糊:基准数据集与高效循环神经网络。International Journal of Computer Vision 131(1), 284–301 (2023) 4, 8, 9
第 18 页
18 R. Jin 等
50. Zhou, S., Zhang, J., Pan, J., Xie, H., Zuo, W., Ren, J.: 用于视频去模糊的空时滤波器自适应网络。在:IEEE/CVF 国际计算机视觉会议论文集。第 2482–2491 页 (2019) 2, 4 51. Zhu, C., Dong, H., Pan, J., Liang, B., Huang, Y., Fu, L., Wang, F.: 用于视频去模糊的多尺度双向传播深度循环神经网络。在:AAAI 人工智能会议论文集。第 36 卷,第 3598–3607 页 (2022) 9, 10
第 19 页
RealVDeblur:补充材料
S1 实现细节
帧级 VAE 编码。Wan-VAE 采用因果时间压缩架构,沿时间维度将输入序列下采样 4 倍,将 (1+T) 个输入帧映射为 (1+T/4) 个潜在变量。值得注意的是,第一帧是独立编码的,不进行时间下采样。当输入缩减为单张图像(T=0)时,VAE 自然退化为纯 2D 编码器。利用这一特性,我们将每个视频帧视为独立图像并分别进行编码,从而得到 T 帧输入、T 帧输出的潜在变量,避免了由时间压缩引入的跨帧纠缠。
条件注入。给定模糊输入帧,冻结的帧级 VAE 编码器首先生成模糊潜在变量 $z_{blur}$。随后,我们应用一个轻量级 3D 卷积补丁嵌入层(通道数 16→1536,核大小 1×2×2,步长 1×2×2),将模糊潜在变量转换为条件张量,其空间分辨率与 DiT 使用的补丁化噪声嵌入相匹配。所得条件张量在送入 Transformer 块处理之前,直接加到噪声嵌入上。
训练配置。我们在 OmniBlur 数据集上,使用 32 块 A100 GPU,总批量大小为 32,对 LoRA 参数(秩为 64)和条件注入网络进行微调,共 5,000 次迭代。我们采用混合分辨率训练策略,在每个批次中结合不同的序列长度和空间分辨率。具体而言,我们使用 1280×720 分辨率下的 10 帧序列和 960×544 分辨率下的 20 帧序列。对于单步蒸馏,学生和评论家(Critic)的 LoRA 均从教师(Teacher)LoRA 初始化,同时保持 DiT 主干网络冻结。由于 GPU 内存限制,在计算像素空间监督信号时,VAE 解码器仅应用于每个批次中随机选取的 5 个帧。
S2 OmniBlur 数据集详情
S2.1 数据集统计
我们的 OmniBlur 训练数据集由两个互补来源构建:3DGS 渲染场景和高帧率视频。
对于 3DGS 渲染数据,我们使用了来自 ScanNet++ [43] 的 956 个场景和来自 InteriorGS [34] 的 1,000 个场景。这些场景涵盖了相机运动模糊、散焦模糊及其组合。从中,我们渲染并采样了约 53,000 个训练片段(每个片段 20 帧)。在 3DGS 渲染数据中,相机运动模糊约占 40%,散焦模糊约占 40%,组合模糊约占 20%。对于高帧率视频数据,我们采样了 3,000 个短
第 20 页
20
来自 20 个 GoPro [24]、240 个 REDS [23] 和 734 个 SloMoDeblur [25] 场景的视频(每个视频 20 帧),以覆盖物体运动模糊。总体而言,OmniBlur 包含约 2,000 个 3DGS 场景和约 3,000 个高帧率视频,生成了约 56,000 个训练片段,总计约 110 万帧。
图 S1:OmniBlur 数据集中合成模糊的示例。顶部:相机运动模糊的示例。底部:使用薄透镜模型生成的散焦模糊示例。在每个示例中,对角线左侧显示清晰渲染,右侧显示合成模糊。
S2.2 模糊合成参数
整体合成流程见主论文第 3.3 节。此处我们提供具体的参数设置。 相机运动模糊。对于生成的相机轨迹中的每一帧,我们使用贝塞尔曲线引入平滑的 6 自由度扰动,贝塞尔曲线的阶数随机采样(1–4 阶),以模拟手持相机抖动。运动幅度通过缩放原始轨迹中的平均帧间相机位移来适应每个场景。在每个曝光间隔内,沿扰动轨迹渲染 K=121 个子帧,并在线性 RGB 空间中进行平均以生成模糊帧。对应的清晰帧定义为中心子帧 $I_{(K/2)}$。 散焦模糊。我们遵循薄透镜相机模型。对于每个序列,随机采样一个焦点,其深度从 3DGS 渲染的深度图中获取。在围绕中心相机的圆形孔径盘上采样多个视点(N=32),并将它们重定向到同一个焦点。渲染的视图在线性 RGB 空间中进行平均,以生成依赖于深度的散焦模糊。 复合模糊。同时应用相机运动模糊和散焦模糊。为了平衡渲染成本,复合模糊的相机运动子帧数量减少至 K=61,散焦采样数量减少至 N=16,导致每帧产生 K×N=61×16=976 次子渲染。
第 21 页
RealVDeblur:补充材料 21
ISP 感知增强。来自 3DGS 的渲染图像是无噪声的,并且绕过了相机图像信号处理(ISP),从而与真实相机拍摄图像之间产生了域差异。遵循 RSBlur [30] 的做法,我们模拟了一个简化的 RAW 成像流程。具体而言,首先将渲染的 sRGB 图像转换到线性域并映射到相机 RGB 空间。然后,将这些图像以随机选择的布局马赛克化为 Bayer 模式。应用逆白平衡以模拟场景光照,随后在 RAW 域中注入泊松-高斯噪声,并采用随机缩放的噪声水平以模拟不同的传感器 ISO 设置。最后,应用正向 ISP(白平衡、去马赛克、色彩校正和 sRGB 编码)以生成逼真的训练图像。
输入 3DGS BAGS Ours+3DGS
输入 3DGS BAGS Ours+3DGS
输入 3DGS BAGS Ours+3DGS
图 S2:大规模真实场景上 3DGS 重建的视觉比较。直接在模糊输入上训练或使用联合优化(BAGS)会产生严重的悬浮物(floaters)和过度平滑的纹理。使用 RealVDeblur(Ours)进行预处理可产生显著更清晰的重建结果。红色方框突出了代表性区域。
S3 下游任务评估
S3.1 3DGS 重建设置
我们在 DeblurNeRF [21] 数据集上进行评估,该数据集包含 10 个具有真实相机运动模糊的场景和 10 个具有真实散焦模糊的场景。所有实验均在 1200 × 800 的分辨率下进行。对于级联管道(VRT [14] + 3DGS,RealVDeblur + 3DGS),我们首先将多视图训练图像视为连续帧,并对所有视图应用去模糊模型。然后,我们在去模糊后的图像上运行 COLMAP 以估计相机位姿并初始化点云。随后,使用 gsplat [41] 实现,结合 MCMC [7] 密度增加策略和默认超参数,对 3DGS 模型进行 20,000 次迭代的训练。对于端到端基线,我们使用官方实现
第 22 页
22
使用 BAGS [28] 和 Deblurring-3DGS [10] 的默认设置。使用 Deblur-NeRF 数据集提供的相机位姿和初始点云进行初始化,这些点云是从原始模糊图像中重建得到的。
S3.2 大规模真实场景下的鲁棒性
为了进一步评估 RealVDeblur 在实际应用中的鲁棒性,我们在没有真实标签(ground truth)的大规模真实场景上执行了 3DGS 重建。具体而言,我们从 ScanNet++ iPhone 测试集 [43] 中选择了三个场景,并提取了使用手持移动设备拍摄的局部模糊视频序列。与包含相对较小前向相机运动的 Deblur-NeRF 数据集不同,这些序列涵盖了房间尺度的环境,具有更复杂的相机轨迹和自然运动模糊。 我们在相同的设置下将我们的方法与 3DGS 和 BAGS 进行了比较。如图 S2 所示,直接在模糊输入上训练 3DGS 会产生显著的悬浮伪影(floater artifacts)和模糊纹理。经过 RealVDeblur 预处理后,重建的场景呈现出明显更清晰的纹理,并且悬浮伪影大幅减少,证明了其在真实拍摄场景中的强大鲁棒性。相比之下,联合优化方法对模糊特别敏感,因为由模糊输入导出的不准确位姿估计通常会导致次优的初始化。此外,除了初始化困难之外,这些方法由于处理房间尺度环境增加的优化复杂度的能力有限,本质上难以扩展到大规模场景。
S3.3 深度估计
运动模糊严重破坏了边缘和结构信息,直接损害了下游的深度估计。我们评估了视频去模糊作为 DepthAnythingV3 [17] 深度估计预处理步骤的影响。如图 S3 所示,从模糊输入估计的深度图存在深度边界模糊和几何不准确的问题。经过 RealVDeblur 去模糊后,估计的深度图呈现出明显更清晰的边缘、改进的结构完整性以及平面区域内更一致深度,证明了高质量的去模糊对于可靠的下游 3D 感知至关重要。
S4 额外的定性结果
我们在图 S4–S7 中提供了每个评估基准上的额外定性比较。对于每个示例,我们展示了模糊输入、代表性基线以及我们的 RealVDeblur 结果,并通过放大裁剪突出了细节恢复。
S5 失败案例与局限性
我们展示了典型的失败案例,以说明我们方法的局限性。 文本恢复中的结构敏感性。虽然 RealVDeblur 在
第 23 页
RealVDeblur: 补充材料 23
输入 ours
输入 ours
图 S3:视频去模糊对下游深度估计的影响。从原始模糊输入(第二列)估计的深度图表现出边界扭曲和几何不一致。通过使用 RealVDeblur(ours)作为预处理步骤,深度图(第四列)表现出显著更清晰的边缘和改进的结构完整性。红色箭头突出了我们的方法有效恢复细微结构和清晰深度不连续性的区域,而这些区域在模糊中通常会丢失。
在恢复自然纹理方面,它面临着小而结构化图案(如文本)的挑战。如图 S8 的顶行所示,即使运动模糊不是主要的退化因素,重建的字符仍可能表现出结构失真。这突显了基于潜在空间的生成模型中已知的权衡:虽然潜在空间为自然场景合成提供了强大的先验,但它可能缺乏满足排版刚性约束所需的极端像素级几何精度。 极端模糊下高频细节恢复有限。 当运动模糊过度时,模型无法忠实地恢复高频区域,如图 S8 底行所示的复杂树叶。虽然生成先验有助于产生视觉上清晰的结果,但重建的纹理往往缺乏与真实值(ground truth)的结构保真度。
第 24 页
24
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
图 S4:在 BSD 基准测试上的额外视觉对比结果。
第 25 页
RealVDeblur: 补充材料 25
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
图 S5:在 RealBlur 基准测试上的额外视觉对比结果。
第 26 页
26
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
图 S6:在 RSBlur 基准上的额外视觉对比。
第 27 页
RealVDeblur:补充材料 27
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
输入 ESTRNN ShiftNet BSSTNet
VRT RVRT 本文方法 GT
图 S7:在 FEVD 基准测试上的额外视觉对比结果。
第 28 页
28
输入 ours 真值
输入 ours 真值
图 S8: 代表性失败案例。(a) 在中等模糊下,小文本恢复中的结构失真。(b) 在极端运动模糊下,高频区域中精细结构细节的恢复有限。