快速导读:DART通过直接监督的连续缺陷掩码预测和AdaLN-Zero条件调制,实现了比现有方法更高质量且高效的档案胶片修复。
档案胶片修复是计算机视觉中极具挑战的任务,主要难点在于复合退化(划痕、灰尘、模糊、噪声)与缺乏干净参考图像。传统方法往往依赖重建损失隐式学习退化特征,导致模型难以区分真实的场景结构与胶片损伤。
DART(Degradation-Aware Recurrent Transformer)提出了一种新的解决方案:通过显式预测连续软缺陷掩码,并结合AdaLN-Zero条件调制,实现更高质量的修复。该方法不仅提升了修复效果,还保持了较高的计算效率。
英文题目:DART: A Degradation-Aware Recurrent Transformer for Archival Film Restoration
论文出处:arXiv 每日论文精选 · arXiv:2607.21219
原始论文:PDF / 论文页面
对应视频标题:档案胶片修复:DART如何用显式掩码避免误删场景结构|推荐指数:★★★★★
这篇论文解决什么问题?
现有视频修复方法如BasicVSR、RTN等,主要依赖时间对齐和循环传播。然而,在档案胶片修复中,这些方法往往无法有效处理多样化的伪影。例如,RTN和MambaOFR在处理具有狭窄高对比度轮廓的场景结构(如船甲板栏杆)时,容易将其误认为机械划痕并抹除。
这种误删现象源于隐式学习机制的局限性:模型仅通过重建损失推断损伤,缺乏对退化类型的显式理解。此外,严重缺陷(如化学裂纹)往往被忽略,导致修复不完整。
因此,核心问题在于如何显式感知退化类型与严重程度,并在时间维度上保持一致性,同时避免误删真实场景内容。
核心创新
方法概览
核心缺口在于缺乏对退化类型的显式感知,导致模型无法自适应退化严重程度或区分损伤与内容。
- DART采用双向循环网络架构,核心创新在于显式退化感知。首先,使用Dilation Pyramid MaskNet预测软缺陷掩码,该网络通过多尺度膨胀卷积区分狭窄高对比度的场景结构与胶片划痕。
- 其次,预测的掩码通过光流(RAFT)在时间维度上传播,确保缺陷定位的时间一致性。这一机制避免了逐帧独立预测导致的不稳定。
- 第三,引入AdaLN-Zero条件调制机制。该机制根据掩码和残差证据计算全局退化严重程度,并动态调制Swin Transformer骨干网络的特征表示,使模型能够自适应不同退化强度的帧。
- 最后,DART使用直接监督的连续软缺陷掩码进行训练,而非依赖隐式重建损失。这一设计显著提升了模型对退化类型的判别能力。
逐图理解论文
失败案例:栏杆被误删

图5隔离了船甲板上的对角栏杆,这是具有划痕轮廓的真实场景结构。注意RTN和MambaOFR部分擦除了它,而DART的宽感受野掩码识别其为场景内容并完整恢复。
DART方案:显式掩码与条件调制

图2展示了DART架构在一个循环前向步骤中的概览。注意上半部分的特征对齐与融合流程,以及掩码如何引导时间融合。
结论:显式感知优于隐式学习

图6展示了严重化学裂纹的掩码激活(上)和修复裁剪(下)。注意RTN和MambaOFR的无监督掩码几乎平坦,未能定位缺陷,而DART的监督掩码精确激活并显著衰减缺陷。
实验如何设计?
- 实验在AbsoluteDegradation和SRWOV数据集上进行评估,使用无参考指标(CLIP-IQA+、MUSIQ、MANIQA)衡量修复质量。
- 消融研究在AbsoluteDegradation和合成数据集上进行,验证各组件的贡献。
- 定性比较使用档案片段,展示场景结构保留与缺陷去除效果。
- 计算成本分析对比参数、FLOPs、内存和FPS,评估效率。
关键结果与论文证据
- 在AbsoluteDegradation数据集上,DART的MUSIQ得分为51.2304,MANIQA得分为0.3011,优于现有方法(第9页)。
- 在SRWOV数据集上,DART的MUSIQ得分为59.4263,进一步验证其泛化能力(第9页)。
- 定性结果显示,DART能有效保留场景结构(如栏杆)并去除划痕,而RTN和MambaOFR常误删结构(第10-11页)。
- 计算成本方面,DART仅含6.6M参数(1.3M可训练),在NVIDIA A100上达到29.5 FPS,兼顾质量与效率(第12页)。
阅读时需要注意
- 目前仅针对黑白 footage,未扩展到彩色胶片。
- 高度依赖光流准确性,极端遮挡或持久性缺陷仍具挑战。
- 无参考指标无法完全替代人工评估。
关联工作
- RTN是旧胶片修复的循环Transformer基线,DART共享骨干但增加显式掩码监督与条件调制(第3页)。
- MambaOFR使用状态空间模型,DART在质量与效率上均优于其(第3页)。
- BasicVSR++是标准视频修复基线,DART针对档案 footage 进行了改进(第3页)。
- DeepRemaster使用参考注意力,DART更高效且准确(第3页)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
DART:一种用于档案胶片修复的退化感知循环Transformer
Mikołaj Jastrzębski, Wojciech Kozłowski, 和 Kamil Adamczewski
弗罗茨瓦夫科技大学
0.32 DART ( ours) 0.30 MambaOFR BasicVSR (CVPR25) 0.28 (CVPR21) ShiftNet DeepRemaster (CVPR23) (SGA19) RTN (CVPR22) MANIQA 0.26
#Params 0.24
BasicVSR++ (CVPR22) 1M 5M 10M 15M2026 0.34 0.36 0.38 0.40 0.42 0.44 0.46 CLIP-IQA+ (a) 顶部:原始视频帧。底部:修复后的帧。 (b) 性能增益 Jul Fig. 1: (a) 我们方法修复的真实老电影 (b) DART 在保持高效的同时优于先前的最先进方法。
摘要。档案胶片修复是一个具有挑战性的问题,因为历史影像包含划痕、灰尘、模糊、噪声、闪烁和光度老化等复合退化,且缺乏干净的参考视频。现有的视频修复方法大多隐式地处理这些退化,在不知道损坏位置或严重程度的情况下重建帧。我们提出了 DART,一种用于档案胶片修复的退化感知循环 Transformer。DART 预测并随时间传播软缺陷掩码,利用它来指导时间融合,并根据损坏位置和严重程度对修复网络进行条件化。这使得修复过程明确感知胶片伪影,而不是仅依赖重建损失。在真实档案基准上的实验表明,DART 在保持紧凑和高效的同时,提高了相对于先前修复架构的无参考感知质量,产生了更干净且时间上更一致的结构性胶片损坏修复结果。
关键词:老电影修复 · 视频修复 · 退化感知 · 循环 Transformer · 掩码监督
1 引言 arXiv:2607.21219v1
档案胶片是文化、历史和艺术记忆不可替代的视觉记录。然而,许多此类影像仅以退化形式幸存下来。
第 2 页
2 Jastrzębski 等人
老式胶片通常包含结构缺陷(如划痕、灰尘、裂纹和污渍)与光度退化(如模糊、闪烁、曝光不稳定以及数字化过程中引入的伪影)的混合体。因此,修复此类材料并非标准的去噪或增强问题。模型必须能够区分真实的场景内容与损坏区域,保持时间一致性,并在真实档案影像缺乏干净参考视频的情况下运行。
近期的视频修复方法通过利用帧间的时间信息(如对齐、循环传播和基于 Transformer 的重建)取得了显著进展 [1, 2, 13, 15]。这些思想也被应用于老式胶片修复,其中模型必须处理比标准视频增强更强烈且更多样的伪影 [8, 16, 19, 27]。然而,大多数现有的修复器仍然仅隐式地处理退化,在未被告知损坏位置或严重程度的情况下重建干净帧,因此缺陷定位仅通过重建损失间接学习,而非作为监督信号。近期的监督检测方法解决了部分这一问题,但仅限于结构损伤,且通常与修复模型本身分离 [18]。这限制了模型区分真实胶片损伤与有效场景结构的能力,并促使我们提出一种显式感知退化的修复框架。
这种缺乏显式损伤感知的问题对于档案影像尤为严重。划痕、栅栏柱、树枝和细物体边界都可能产生相似的高对比度模式,但需要不同的修复行为。相反,严重的局部退化可能要求模型更依赖来自相邻帧的时间证据。因此,修复模型应显式地推理影像受损的位置以及干预的强度,而不仅仅是重建看似合理的图像。
我们提出了 DART(Degradation-Aware Recurrent Transformer,感知退化的循环 Transformer),用于档案胶片修复。它预测连续的软缺陷掩码(Soft Defect Mask),随时间传播该掩码,并利用其引导当前观测与对齐的时间状态之间的循环融合。关键在于,与那些也依赖缺陷掩码但仅通过重建损失隐式学习掩码的先前修复器不同,DART 直接针对真实缺陷位置对该掩码进行监督,因此损伤定位在训练期间被显式优化,而非作为重建的副产品出现。此外,DART 将预测的掩码和残差证据总结为全局退化条件,使修复 Transformer 能够根据当前帧的退化严重程度调整其行为。总之,我们的主要贡献如下:
– 我们引入了 DART,这是一种用于复合档案胶片退化的感知退化的循环修复框架,将老式胶片修复从被动重建转变为显式的损伤感知处理。 – 我们提出了一种多尺度膨胀金字塔掩码网络(Dilation Pyramid MaskNet),采用直接连续掩码监督进行训练,使模型能够定位胶片伪影的位置和严重程度。
第 3 页
DART:退化感知循环Transformer 3
– 我们利用由预测掩码和残差证据驱动的 AdaLN-Zero 调制,将退化条件注入复原主干网络,使网络能够根据每帧的退化严重程度自适应其复原行为。 – 我们在真实档案胶片基准测试中取得了最先进(SOTA)的结果,同时保持了紧凑的模型规模。
2 相关工作
时序建模架构。视频复原中的一个核心挑战是在保持帧间一致性的同时生成细节。早期方法通过聚合相邻帧来引入时序信息。FastDVDnet [24] 和 UDVD [23] 拼接相邻帧以增强目标帧,而 Lei 等人 [12] 引入时序一致性约束以减少帧间变化。后来的方法通过对齐和传播机制对帧间对应关系进行建模。EDVR [30] 和 TDAN [26] 引入了可变形对齐模块,以在不依赖显式光流 [6] 的情况下处理复杂运动。循环架构通过在序列中传播特征来改善时序信息交换。BasicVSR 和 BasicVSR++ [1,2] 展示了双向特征传播,而后续工作探索了在潜在表示中的传播 [16, 28]。RVRT [15] 将循环传播与引导式可变形注意力相结合,以捕捉长程依赖关系和空间对应关系。与我们的设定更接近的是,RTN [27] 将循环-Transformer 范式应用于老电影复原,通过传播隐藏状态在受损帧之间携带干净内容。为了降低循环方法的延迟,最近的方法研究了更高效的时序融合。DeepRemaster [8] 在自编码器的瓶颈处引入了基于参考的注意力机制,实现了多输入帧的联合处理。最近,Mao 等人 [19] 采用基于 Mamba 的状态空间建模 [4] 作为自注意力的高效替代方案,并沿空间维度应用。尽管这些方法具有强大的时序建模能力,但它们对退化情况 unaware(无感知):它们在从未被告知帧何处受损或受损多严重的情况下重建干净帧,且没有任何方法将复原过程显式地基于退化本身进行条件控制。要使复原显式地感知损伤,首先需要对损伤进行定位。
退化分割。显式掩码预测是复原中的一项关键策略,用于隔离损坏区域并防止干净纹理模糊。历史上,掩码在去雾领域 [17, 21] 中非常常见,用于估计指出雾气集中位置的空间密度图。同样,它也被直观地用于分割出明显的伪影,如雨痕 [5],或在低光图像增强中标记极暗、信息稀疏的区域 [7]。虽然这些空间先验对于静态场景有效,但掩码对于老视频增强 [16, 19] 同样有用。历史胶片遭受非结构化、时间上随机的缺陷,如划痕和灰尘。为了保持时序一致性和结构保真度,现代架构使用退化掩码来隔离这些伪影。诸如
第 4 页
4 Jastrzębski 等人
如 [16, 19, 27] 依赖特征图差异来估计这些掩码。然而,由于自然场景的动态变化也会改变这些特征,网络经常将相机或物体运动误识别为真实的胶片退化。最近的检测器 [18] 改为直接监督损伤分割,从而避免了这种混淆,但它仅针对二元结构缺陷,并作为与恢复网络解耦的独立检测阶段运行。DART 则在恢复网络内端到端地监督连续缺陷掩码,不仅捕捉损伤发生的位置,还捕捉其严重程度,涵盖整个复合胶片退化范围,而不仅仅是二元结构损伤。通过将掩码生成锚定在真实缺陷上,我们的方法仅针对实际伪影,将其与场景运动解耦。
3 方法
3.1 概述
DART 使用双向循环网络恢复 T 帧片段 $\{x_1, \dots, x_T\}$。每个片段正向处理一次 $x_1 \rightarrow x_T$,反向处理一次 $x_T \rightarrow x_1$;产生的隐藏状态 $\overrightarrow{s}_t$ 和 $\overleftarrow{s}_t$ 通过最终的融合卷积合并为恢复帧 $\tilde{x}_t$。图 2 描绘了单个前向步骤;反向传递以相反的时间顺序重复相同的计算。
共享编码器 $E$ 将当前帧映射为特征 $E(x_t)$,冻结的 RAFT [25] 模块估计 $x_{t-1}$ 和 $x_t$ 之间的光流 $f_{t-1 \rightarrow t}$。Warp 算子 $W(\cdot, \cdot)$ 沿给定流场重采样其第一个参数;将其与 $f_{t-1 \rightarrow t}$ 应用于前一个隐藏状态 $s_{t-1}$、前一个软缺陷掩码 $M_{t-1}$ 和前一帧 $x_{t-1}$,可将这三者对齐到当前坐标系,产生 $s^{\text{align}}_{t-1}$、$M^{\text{align}}_{t-1}$ 和扭曲的前一帧。将扭曲的前一帧与 $x_t$ 进行比较,得到残差指示器 $R_t$,用于估计帧发生变化的位置或被遮挡的位置,
\begin{equation} \mathbf{R}_t = \left| W(\mathbf{x}_{t-1}, \mathbf{f}_{t-1 \rightarrow t}) – \mathbf{x}_t \right| \tag{1} \end{equation}
接下来介绍的 MaskNet 产生的软掩码 $M_t$,随后对编码的当前帧与对齐的隐藏状态的时间融合进行门控,生成传递给恢复主干网络的表示 $F_t$,
\begin{equation} \mathbf{F}_t = E(\mathbf{x}_t) \odot (1 – \mathbf{M}_t) + \mathbf{s}^{\text{align}}_{t-1} \odot \mathbf{M}_t; \label{eq:fusion} \tag{2} \end{equation}
当 $M_t$ 接近 1 时,网络倾向于选择历史(假设未受损)状态,而非当前可能受损的观测值。随后三个阶段将此信号转化为恢复帧:MaskNet 定位损伤(第 3.2 节),条件编码器将掩码和残差提炼为退化严重性信号(第 3.4 节),Swin 主干网络在该信号的指导下重建帧(第 3.4 节),所有模块均通过显式的掩码监督目标端到端训练(第 3.5 节)。
第 5 页
DART:退化感知循环Transformer 5
输入帧:𝒙𝑡 编码帧 𝑬(𝒙𝑡) 𝑴𝑡 修复帧:𝒙𝑡 MaskNet 𝑴𝑡 𝒙𝑡 E 𝑬(𝒙𝑡) C 膨胀 𝐬𝑡−1𝑎𝑙𝑖𝑔𝑛, 𝑬(𝒙𝑡) 掩码(Eq.Gate2) 金字塔
输入帧:𝒙𝑡, 𝒙𝑡−1 残差 𝑹𝑡(𝒙𝑡, 𝒙𝑡−1) 𝑴𝑡 𝐅t 融合 𝒔𝑡 反向状态 残差 𝑹𝑡 C 𝒔𝑡 正向状态 𝒔𝑡 𝐾×
→𝑡 𝑎𝑙𝑖𝑔𝑛 𝑴𝑡−1 𝑎𝑙𝑖𝑔𝑛𝒔𝑡−1 𝑁× 光流 𝒇𝑡−1 →𝑡 𝒇𝑡−1 Swin
+ + AdaLN 块 卷积 嵌入 解嵌入 𝒙𝑡, 𝒙𝑡−1 光流 扭曲 条件 AdaLN Transformer 𝑨(𝑴𝑡, 𝑹𝑡) 编码器 𝑴𝑡−1 𝒔𝑡−1 Swin 修复 Transformer
(a) MaskNet 膨胀金字塔 (b) AdaLN 条件编码器 (c) AdaLN Swin Transformer 块 1 𝑨∗= 𝑨(𝑴𝑡, 𝑹𝑡) 膨胀 LReLU 𝒛𝒍 + + 𝒛𝒍+𝟏 门控 MLP 门控 池化 输入 输入 LayerNorm 调制 (S)W-MSA LayerNorm 调制 卷积 SiLU 卷积 SiLU 卷积 SiLU 平均 线性 SiLU 线性 𝑨(∗) 卷积 LReLU 2Dil LReLU C 卷积 LReLU 卷积 Sigmoid 𝑴𝑡 𝛽1 𝛽2 拼接 𝛼2 拼接 全局 3 𝛾1, 𝛼1 𝛾2, 𝑨(∗) SiLU 线性 膨胀 LReLU 𝐬𝑡−1𝑎𝑙𝑖𝑔𝑛, 𝑬(𝒙𝑡) 𝐶ℎ× 𝐻× 全局 𝑊→均值(dim=(2,平均池化 3)) →𝐶ℎ
图 2:提出的 DART 架构在一个循环前向步骤中的概述。 C 表示拼接操作。图的上半部分说明了框架的一般流程,即特征对齐与融合。
3.2 膨胀金字塔掩码网络
MaskNet 是决定在每个时间步信任当前帧的哪些区域,以及应从对齐的隐藏状态 𝒔𝑎𝑙𝑖𝑔𝑛𝑡−1 填充哪些区域的组件。RTN [27] 使用的浅层直接连接预测器,以及 MambaOFR [19] 中架构未变的预测器,其感受野太小,无法区分真正的划痕与细薄的场景结构(如栅栏柱、树枝或飘动的烟雾):在像素级别,两者都会产生相似狭窄、高对比度的响应,因此仅查看小局部窗口的预测器无法区分它们。 DART 用多尺度膨胀金字塔掩码网络(图 2 (a) 底部)替换了该浅层预测器。共享的卷积主干分支为三个具有膨胀率 d ∈{1, 2, 3} 的并行路径;它们的输出被拼接并通过融合头合并。由于三个分支以三种不同的有效感受野观察相同的输入,网络可以在做出承诺之前,利用更宽的空间上下文来确认候选缺陷,而不是孤立地对单个狭窄窗口做出反应。第 3.3 节给出了金字塔的完整输入和生成的掩码 𝑴𝑡;结合第 3.5 节引入的直接监督,这种更宽的感受野使得 DART 的掩码能够跟踪真正的胶片损伤而非场景几何结构,正如第 4.3 节在真实档案影像中所展示的那样。
3.3 循环软掩码传播
像 RTN 那样在每个时间步从头预测 𝑴𝑡,意味着对于持久性缺陷(如垂直划痕),必须独立地重新发现
第 6 页
6 Jastrzębski 等人
在每一帧中,都会出现一种形式的“时间性失忆”,这不仅浪费了模型容量,还产生了闪烁且时间上不一致的掩码预测。遵循 MambaOFR [19] 中引入的传播机制,DART 改为将上一帧的软掩码流式扭曲(flow-warp)到当前坐标系中,并将其与编码后的当前帧、对齐的隐藏状态以及残差指示器一起反馈到膨胀金字塔中:
$$ \mathbf{M}_t = \mathcal{M}\!\left(E\left(\mathbf{W}\left(\mathbf{s}_{t-1}, f_{t-1\to t}\right), \mathbf{W}\left(\mathbf{M}_{t-1}, f_{t-1\to t}\right)\right)\right) \quad (3) $$
其中 $\|$ 表示通道维度的拼接,$\mathcal{M}$ 为第 3.2 节中的膨胀金字塔。这种时间反馈允许 DART 跟踪片段中持续存在的缺陷。因此,掩码监督(第 3.5 节)作用于时间连贯的序列,而不是依赖于独立的逐帧估计。
3.4 AdaLN-Zero 退化条件
公式 (2) 中的掩码门控融合在空间上运行:逐像素地决定是信任当前帧还是历史状态。该操作本身并未告知恢复主干网络当前帧整体受损的严重程度,因此轻微斑点帧和严重裂纹帧若无此机制,将被相同的 Transformer 权重处理。DART 通过全局退化条件填补了这一空白。
条件编码器首先将新预测的掩码 $\mathbf{M}_t$ 与残差指示器 $\mathbf{R}_t$ 拼接,并将结果通过三个交替的 Conv/SiLU 层、全局平均池化和一个两层 MLP,将空间退化证据压缩为单个条件向量:
$$ \mathbf{A}^{(*)} = \text{CondEncoder}(\mathbf{M}_t \| \mathbf{R}_t) \quad (4) $$
该向量随后调制 Swin 恢复主干网络的每个块。每个 AdaLN Swin Transformer 块通过将 $\mathbf{A}^{(*)}$ 通过共享的 SiLU-Linear 层投影到每块的调制参数 $(\gamma_1, \beta_1, \gamma_2, \beta_2)$ 和门控标量 $(\alpha_1, \alpha_2)$,从而将输入特征 $\mathbf{z}_l$ 映射为 $\mathbf{z}_{l+1}$。归一化特征 $\mathbf{x}$ 通过以下方式进行缩放和平移:
$$ \text{Modulate}(\mathbf{x}) = \mathbf{x} \odot \gamma + \beta \quad (5) $$
然后,该块的两个分支(窗口自注意力和 MLP)各自被其门控调制、应用并重新缩放,最后加回到残差流中:
$$ \begin{aligned} \mathbf{z}^l_{in} &= \mathbf{z}^l + \alpha_1 \odot \text{(S)W-MSA}\left(\text{Modulate}(\text{LayerNorm}(\mathbf{z}^l))\right) \\ \mathbf{z}^{l+1} &= \mathbf{z}^l_{in} + \alpha_2 \odot \text{MLP}\left(\text{Modulate}(\text{LayerNorm}(\mathbf{z}^l_{in}))\right) \end{aligned} \quad (6) $$
这里 (S)W-MSA 表示(偏移)窗口多头自注意力,这是标准的 Swin 构建块 [14],其窗口分区在连续块之间发生偏移,以便在窗口边界之间交换信息;MLP 是一个两层前馈网络。遵循 AdaLN-Zero 初始化
第 7 页
DART:退化感知循环Transformer 7
[22]的策略,产生 $(\gamma, \beta, \alpha)$ 的最终线性层初始化为零,因此每个模块在训练开始时作为恒等映射,仅随着 $A(*)$ 变得具有信息量而逐渐学习调制其特征,我们发现这极大地稳定了早期训练。实际上,相同的修复权重在整个片段中重用,但网络可以根据当前帧实际受损的程度自由分配其注意力。这一机制使 DART 的修复核心(而不仅仅是其掩码)具备退化感知能力。
3.5 训练目标与掩码监督
DART 通过结合目标进行端到端优化,该目标在忠实重建与缺陷掩码的直接监督之间取得平衡。
重建与对抗项。像素级 L1 项惩罚与干净真实帧 $y_t$ 的偏差,在时间窗口上平均,以及基于 VGG19 的感知项 $L_{perc}$ [10] 增强纹理;它们共同构成 $L_{rec} = L_1 + \lambda_{perc}L_{perc}$。基于 3D 卷积构建的 Temporal-PatchGAN 判别器 [3] 使用 hinge 损失进行训练,以区分修复片段与干净片段,DART 通过对抗项 $L_{adv}$ 训练以欺骗它。
掩码监督。仅靠重建给 MaskNet 提供的训练信号间接且微弱,因为即使掩码存在显著错误,重建帧看起来仍然可以接受。DART 改为针对连续真实掩码 $M_{gt}$ 直接监督掩码,该掩码与合成训练对一起导出(第 4.1 节),应用于前向和反向传播过程中的原始预 sigmoid MaskNet logits $Z$;对于尚不存在时间门控的头帧,予以排除。由于缺陷像素稀疏,二元交叉熵项通过正权重 $w_{pos} = \text{clamp}(N_{neg}/N_{pos}, w_{min}, w_{max})$ 进行类别平衡,其中 $N_{pos}$ 和 $N_{neg}$ 统计正负真实像素的数量:
$$ \mathcal{L}_{BCE}^{(p)} = \text{BCEWithLogits}\!\left(\mathbf{Z}^{(p)},\,\mathbf{M}^{gt,(p)},\,w_{pos}\right) \quad (7) $$
可微分的 Dice 项进一步奖励预测软掩码 $M = \sigma(Z^{(p)})$ 与真实值之间的结构重叠:
$$ \mathcal{L}_{Dice}^{(p)} = 1 – \frac{2(\mathbf{M}\odot\mathbf{M}^{gt,(p)}) + \epsilon}{\sum \mathbf{M} + \sum \mathbf{M}^{gt,(p)} + \epsilon} \quad (8) $$
这两项结合并在两个传播方向 $p \in \{\leftarrow, \rightarrow\}$ 上平均:
$$ \mathcal{L}_{mask} = \frac{1}{2}\sum_{p\in\{\leftarrow,\rightarrow\}}\left(\mathcal{L}_{BCE}^{(p)} + \lambda_{dice}\,\mathcal{L}_{Dice}^{(p)}\right) \quad (9) $$
与通过重建间接推断缺陷位置的前人方法不同,这种显式公式迫使 MaskNet 直接从真实值中学习退化的确切位置和严重程度。
总目标。这三项结合为:
$$ \mathcal{L}_{total} = \lambda_{rec}\mathcal{L}_{rec} + \lambda_{adv}\mathcal{L}_{adv} + \mathcal{L}_{mask} \quad (10) $$
第 8 页
8 Jastrzębski 等人
表 1:DART 的训练设置与损失权重。
设置 值
优化器 Adam (β1=0.9, β2=0.99) 学习率 2 × 10−4 (线性衰减) 轮数 20 窗口/裁剪/批次 7 帧 / 256×256 / 1 个片段 精度 FP16 (混合精度) λrec, λadv, λmask, λdice 1.0, 0.01, 0.5, 0.5
损失权重 λrec, λadv, λmask, λdice 与其他训练设置一同列于表 1 中。
4 实验
4.1 数据集、指标与实现
训练数据。DART 在 REDS [20] train_sharp (720p, 24 fps) 上进行训练。 在训练过程中,源自 AbsoluteDegradation [9] 的合成退化流水线在线生成训练对,为每个 256 × 256 的裁剪区域提供:真实清晰的帧、其合成退化版本以及连续伪影掩码:该掩码精确勾勒出合成缺陷应用的位置,并经历与退化帧相同的退化过程。此掩码为 Lmask (公式 (9)) 提供监督目标。官方的 30 个 REDS val_sharp 片段被保留作为合成、全参考的代理测试集,仅用于第 4.4 节中的消融研究。 真实世界评估。对于真实的档案影像,不存在干净参考,因此对真实数据的评估必然是无参考的。AbsoluteDegradation [9] 是一个包含 13,252 帧、无损 PNG 格式的公共领域档案影像语料库 (1896–1918),是主要目标域;SRWOV [19] 包含 216 个低分辨率、JPEG 压缩的真实世界片段,作为次要基准。 指标。真实影像质量使用三个无参考指标进行评分:CLIP-IQA+ [29] 用于评估一般自然度和感知对齐,MUSIQ [11] 和 MANIQA [32] 与人类质量判断相关性最高,并在本节中显示出最宽、最一致的差距。在合成代理集上,报告标准的全参考 PSNR、SSIM [31] 和 LPIPS [33] 用于消融研究。 实现。DART 使用 PyTorch 实现,并在两块 NVIDIA A100 GPU 上使用 FP16 混合精度进行训练,采用冻结的 RAFT [25] 光流估计器。表 1 列出了其余训练设置和损失权重。第 4.2 节中的每个竞争架构均使用其各自发布的超参数在相同数据上从头重新训练,因此本节中的所有比较共享相同的训练来源和评估协议。
第 9 页
DART:退化感知循环Transformer 9
表2:恢复架构的定量比较,所有模型均在AbsoluteDegradation管道上训练,并在AbsoluteDegradation和SR-WOV [19]数据集上进行评估。粗体表示最佳分数,下划线表示次佳分数,位于每个指标列中。“输入帧”行表示未恢复的退化视频,作为参考基准。
AbsoluteDegradation数据集 SR-WOV数据集
模型 CLIPIQA+ ↑ MUSIQ ↑ MANIQA ↑ CLIPIQA+ ↑ MUSIQ ↑ MANIQA ↑
输入帧 0.2483 26.8418 0.1619 0.3890 42.8591 0.2307
BasicVSR [1] 0.4049 49.5797 0.2844 0.4086 57.6442 0.3104 BasicVSR++ [2] 0.3685 42.9144 0.2375 0.4428 58.0442 0.3231 ShiftNet [13] 0.4309 46.7724 0.2764 0.4578 57.9334 0.3336 DeepRemaster [8] 0.3574 44.7540 0.2542 0.3722 53.5473 0.2637 RTN [27] 0.4220 46.8737 0.2661 0.4441 58.4585 0.3321 MambaOFR [19] 0.4190 47.2436 0.2777 0.4402 57.3551 0.3210 DART (本文) 0.4334 51.2304 0.3011 0.4488 59.4263 0.3427
4.2 与最先进方法的比较
定量结果。表2将DART与BasicVSR [1]、BasicVSR++ [2]、ShiftNet [13]、DeepRemaster [8]、RTN [27]和MambaOFR [19]进行了比较,所有模型均在相同数据上重新训练。DART在AbsoluteDegradation上的所有指标上均优于所有基线。在SR-WOV上,它在MUSIQ和MANIQA上保持最佳,这两个指标与人类感知判断的相关性最高,仅在CLIPIQA+上略逊于ShiftNet(0.458对比0.449)。DART在两个数据集的所有指标上均优于RTN,后者与其共享Swin恢复主干;因此,这一一致的差距隔离了退化感知附加组件本身的贡献,而非反映更大或不同训练的网络。
定性结果。图3追踪了档案新闻短片片段中的三个连续帧。BasicVSR++和MambaOFR使乳剂层失焦,并让斑点在所有三帧中持续存在;RTN去除了一些噪声,但留下了微弱的垂直划痕;仅DART产生了稳定、清晰且时间上一致的重建。图4将比较扩展到另外三个片段:在所有片段中,DART抑制了结构化缺陷、划痕和灰尘,同时比通用视频恢复基线更忠实地保留了真实的场景纹理,后者要么对结构化损伤反应不足,要么将其过度锐化到场景中。
效率。表3显示,这种质量提升并非以更大的网络为代价。DART是评估中第二小的模型,拥有6.6M参数(除了共享且冻结的RAFT光流估计器外,仅1.3M可训练参数),并且是内存效率最高的模型之一,占用0.35 GB。它在每个方面都优于MambaOFR [19],并在参数、内存和速度上优于ShiftNet [13]。由于档案恢复是离线运行的,其适度的每帧延迟并非实际限制。
第 10 页
10 Jastrzębski 等人
第 0 帧 第 1 帧 第 2 帧
输入
BasicVSR++
ShiftNet
RTN
MambaOFR
DART
图 3:在档案片段连续三帧上的定性比较。竞争方法留下垂直划痕、过度锐化乳剂噪声,或使画面失焦;DART 在整个序列中产生更干净、更清晰且时间一致性更高的重建结果。
第 11 页
DART:退化感知循环Transformer 11
输入
BasicVSR++
ShiftNet
RTN
MambaOFR
DART
图 4:在档案片段上的定性比较。与通用视频修复基线相比,DART 在更忠实地保留场景纹理的同时,抑制了结构化缺陷和划痕;这些基线模型要么对结构化损伤反应不足,要么将其过度锐化并混入场景中。
第 12 页
12 Jastrzębski 等人
表 3:计算成本与恢复质量,以每帧为单位测量(1×7×3×256×256 片段,NVIDIA A100 GPU,fp32,5 次预热后 30 次计时迭代)。MUSIQ 来自表 2。参数量包括共享且冻结的 RAFT(5.3M);DART 增加 1.3M 可训练参数。粗体/下划线:最佳/次佳。
方法 参数量 (M) ↓ FLOPs (G) ↓ 显存 (GB) ↓ FPS ↑ MUSIQ ↑
BasicVSR [1] 9.9 910 0.34 27.6 49.6 BasicVSR++ [2] 13.6 381 0.36 30.6 42.9 ShiftNet [13] 13.0 316 1.06 21.4 46.8 DeepRemaster [8] 9.9 131 0.39 529.3 44.8 RTN [27] 6.2 349 0.35 33.8 46.9 MambaOFR [19] 8.7 442 0.64 14.5 47.2 DART (Ours) 6.6 372 0.35 29.5 51.2
4.3 真实影像上的掩码行为
由于 RTN 和 MambaOFR 中的缺陷掩码从未受到直接监督,因此无法仅从训练损失推断它们在真实档案影像上的准确性,因为这些影像不存在可用于检查的地面真实掩码。图 5 和图 6 展示了这种无监督设计的两种常见失败模式,而 DART 均不存在这些问题。
图 5 隔离了船上对角线排列的甲板栏杆,这是具有模拟划痕典型窄高对比度轮廓的真实场景结构。RTN 和 MambaOFR 都部分擦除了它,将栏杆误认为是机械损伤,并将其与对齐的历史状态混合在一起,而 DART 的宽感受野掩码将栏杆识别为场景内容并完整恢复。
图 6 展示了互补的失败情况。输入帧包含一条穿过乳剂层的严重且明确的化学裂纹。RTN 和 MambaOFR 的掩码激活(第一行)几乎均匀平坦:它们的无监督掩码根本未在此缺陷上激活,因此恢复骨干网络未收到任何定位信号,裂纹在两个恢复输出(最后一行)中基本保持不变。DART 的掩码精确地在裂纹处激活,相应的输出显著减弱了它。综合来看,这两张图表明无监督掩码不仅仅是不如监督掩码精确。没有地面真实目标作为锚点,无监督掩码可能会在两个方向上失败:在未受损结构上错误激活,或对真实且严重的损伤未能激活。任何一种失败都会使恢复骨干网络无法可靠地知道帧的何处受损,或受损程度如何。直接监督使 DART 的定位锚定在缺陷本身,而不是重建损失碰巧捕捉到的任何损伤相关性上。
4.4 消融实验
表 4 通过从完整模型中移除每个核心组件(标记为 − 的行)来隔离其贡献。每个组件都证明了其存在的价值:移除
第 13 页
DART:退化感知循环Transformer 13
输入 RTN MambaOFR DART( ours)
图 5:RTN 和 MambaOFR 将船甲板栏杆(具有划痕状轮廓的真实场景结构)误认为胶片损伤,并在时间融合过程中部分擦除它;DART 的掩码识别出该结构并完整恢复它。
输入 RTN MambaOFR DART( ours)
图 6:乳化层严重化学裂纹的掩码激活(顶部)和恢复后的裁剪区域(底部)。RTN 和 MambaOFR 的无监督掩码基本保持平坦,完全无法定位缺陷,因此缺陷在很大程度上未被恢复;DART 的监督掩码精确地在裂纹处激活,相应的输出显著减弱了它。
膨胀金字塔掩码网络、循环掩码传递或 AdaLN 条件化均降低了真实影像上的所有感知指标,其中 AdaLN 条件化是最具影响力的单一组件,仅移除它就会导致 MANIQA 从 0.301 降至 0.263。这种模式源于各组件之间的依赖关系:更锐利的监督掩码向条件编码器提供更丰富的信号,因此其生成的严重程度向量 A(∗) 能真实反映存在的损伤,进而恢复 Transformer 受到的是可信信号而非噪声的调制。削弱掩码,依赖于它的条件化也会随之退化。开发过程中探索的几种其他设计变体,包括可变形对齐、双向残差指示器、SPADE 风格的空间调制以及直接掩码拼接,以及时间窗口长度和光流主干网络的变体,均未在各项指标上持续优于该配置。 唯一看似反例的一行,即无掩码监督,实际上恰恰是这一观点的最清晰例证:它在合成代理集上产生了最佳的 PSNR、SSIM 和 LPIPS,但在真实
第 14 页
14 Jastrzębski 等人
表 4:在 AbsoluteDegradation(真实影像,无参考)和 Synthetic(全参考)数据集上的消融研究。− 表示从完整的 DART 模型中移除相应机制。最佳分数以粗体显示,次佳分数以下划线标记。
AbsoluteDegradation 数据集 Synthetic 数据集
消融 CLIPIQA+ ↑ MUSIQ ↑ MANIQA ↑ PSNR ↑ LPIPS ↓ SSIM ↑
输入帧 0.2483 26.842 0.1619 19.540 0.5421 0.5882
DART 0.4334 51.230 0.3011 23.665 0.1835 0.7294
- 先前掩码 0.4332 50.772 0.2927 23.815 0.1860 0.7326
- AdaLN 注入 0.4167 48.685 0.2629 23.622 0.1984 0.7295
- MaskNet 0.4321 49.815 0.2905 23.733 0.1852 0.7309
- 掩码监督 0.4173 49.451 0.2912 23.975 0.1787 0.7380
影像,因为全参考失真指标奖励了无监督掩码倾向于产生的安全、轻微过度平滑的重建,而无参考感知指标则正确地惩罚了由此导致的真实细节丢失。由于本工作的目标是忠实还原真实的档案胶片,而非合成代理上的失真分数,因此强大的合成分数并不能证明现实世界中的还原效果良好,监督配置仍然是原则性的选择。
5 结论与局限性
我们提出了 DART,这是一种感知退化的循环 Transformer,将档案胶片还原从被动重建转变为显式的损伤感知处理。DART 预测直接监督的连续软缺陷掩码,并在时间上传播它以连贯地跟踪伪影。该掩码具有双重用途:它指导循环时间融合,并通过 AdaLN-Zero 条件调节,根据局部退化严重程度调节还原主干。因此,DART 在两个真实世界基准测试中实现了最先进的感知质量,同时仅增加了 1.3M 可训练参数。关键在于,我们的直接掩码监督防止了常见的无监督故障模式,确保真实的划痕状场景结构得以保留,且严重损伤被正确定位。
然而,DART 目前仅针对单色影像,并且像所有基于光流的传播器一样,严重依赖光流准确性,这使得极端遮挡或高度持久的缺陷具有挑战性。此外,虽然我们依赖成熟的无参考指标,但它们不能完全替代人工评估。将此退化感知框架扩展到彩色还原,并通过正式的感知研究验证结果,是未来工作中有前景的方向。
第 15 页
DART:退化感知循环Transformer 15
参考文献
1. Chan, K.C., Wang, X., Yu, K., Dong, C., Loy, C.C.: BasicVSR:视频超分辨率及其扩展中基本组件的探索。在:CVPR (2021) 2. Chan, K.C., Zhou, S., Xu, X., Loy, C.C.: BasicVSR++:通过增强传播和对齐改进视频超分辨率。在:CVPR (2022) 3. Chang, Y.L., Liu, Z.Y., Lee, K.Y., Hsu, W.: 使用3D门控卷积和时间PatchGAN进行自由形式视频修复。在:ICCV (2019) 4. Gu, A., Dao, T.: Mamba:具有选择性状态空间的线性时间序列建模。arXiv预印本 arXiv:2312.00752 (2023) 5. Guan, C., Yoshie, O.: 驱动式雨感知:具有模式感知网络路由和掩码引导交叉注意力的自适应去雨。Pattern Recognition p. 112886 (2025) 6. Horn, B.K., Schunck, B.G.: 确定光流。Artificial intelligence 17(1-3), 185–203 (1981) 7. Hou, J., Zhu, Z., Hou, J., Liu, H., Zeng, H., Yuan, H.: 用于低光图像增强的全局结构感知扩散过程。Advances in Neural Information Processing Systems 36, 79734–79747 (2023) 8. Iizuka, S., Simo-Serra, E.: DeepRemaster:用于全面视频增强的时间源-参考注意力网络。在:ACM TOG (2019) 9. Jastrzębski, M., Glinkowski, D., Zieliński, D., Borkowski, D., Kozłowski, W.M., Adamczewski, K.: AbsoluteDegradation:一种受物理启发的合成胶片退化管道和档案胶片修复基准 (2026) 10. Johnson, J., Alahi, A., Fei-Fei, L.: 用于实时风格迁移和超分辨率的感知损失。在:ECCV (2016) 11. Ke, J., Wang, Q., Wang, Y., Milanfar, P., Yang, F.: MUSIQ:多尺度图像质量Transformer。在:ICCV (2021) 12. Lei, C., Chen, Q.: 具有自正则化和多样性的全自动视频上色。在:IEEE/CVF计算机视觉与模式识别会议论文集。pp. 3753–3761 (2019) 13. Li, D., Shi, X., Zhang, Y., Cheung, K.C., See, S., Wang, X., Qin, H., Li, H.: 具有分组时空偏移的视频修复简单基线。在:CVPR (2023) 14. Liang, J., Cao, J., Sun, G., Zhang, K., Van Gool, L., Timofte, R.: SwinIR:使用Swin Transformer进行图像修复。在:ICCV (2021) 15. Liang, J., Fan, Y., Xiang, X., Ranjan, R., Ilg, E., Green, S., Cao, J., Zhang, K., Timofte, R., Van Gool, L.: 具有引导可变形注意力的循环视频修复Transformer。NeurIPS (2022) 16. Lin, S., Simo-Serra, E.: 使用递归循环Transformer网络修复退化的老电影。在:WACV (2024) 17. Liu, Q., Song, T., Qin, A., Liu, Y., Yang, F., Gao, C.: Hdsa-net:用于高光谱图像去雾的雾密度与语义感知网络。IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing 18, 3989–4003 (2025) 18. Liu, Q., Liu, Y., Wang, L., Yan, F., Zhang, Q., Ju, H.: 具有大面积结构损坏的档案胶片修复。npj Heritage Science (2026) 19. Mao, Y., Luo, H., Zhong, Z., Chen, P., Zhang, Z., Wang, S.: 让老电影重现辉煌:用于老电影修复的退化感知状态空间模型。在:CVPR (2025)
第 16 页
16 Jastrzębski 等
20. Nah, S., Baik, S., Hong, S., Moon, G., Son, S., Timofte, R., Lee, K.M.: NTIRE 2019 视频去模糊与超分辨率挑战赛:数据集与研究。在:CVPRW (2019) 21. Ngo, D., Lee, G.D., Kang, B.: 雾度程度评估器:一种用于雾密度估计的知识驱动方法。Sensors 21(11), 3896 (2021) 22. Peebles, W., Xie, S.: 基于 Transformer 的可扩展扩散模型。在:ICCV (2023) 23. Sheth, D.Y., Mohan, S., Vincent, J.L., Manzorro, R., Crozier, P.A., Khapra, M.M., Simoncelli, E.P., Fernandez-Granda, C.: 无监督深度视频去噪。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 1759–1768 (2021) 24. Tassano, M., Delon, J., Veit, T.: Fastdvdnet:无需光流估计实现实时深度视频去噪。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 1354–1363 (2020) 25. Teed, Z., Deng, J.: RAFT:用于光流的循环全对场变换。在:ECCV (2020) 26. Tian, Y., Zhang, Y., Fu, Y., Xu, C.: Tdan:用于视频超分辨率的时变形对齐网络。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3360–3369 (2020) 27. Wan, Z., Zhang, B., Chen, D., Liao, J.: 让老电影重现生机。在:CVPR (2022) 28. Wan, Z., Zhang, B., Chen, D., Zhang, P., Chen, D., Liao, J., Wen, F.: 让老照片重现生机。在:CVPR (2020) 29. Wang, J., Chan, K.C., Loy, C.C.: 探索 CLIP 用于评估图像的观感。在:AAAI (2023) 30. Wang, X., Chan, K.C., Yu, K., Dong, C., Change Loy, C.: Edvr:通过增强可变形卷积网络进行视频修复。在:IEEE/CVF 计算机视觉与模式识别会议研讨会论文集。pp. 0–0 (2019) 31. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: 图像质量评估:从误差可见性到结构相似性。IEEE 图像处理汇刊 13(4), 600–612 (2004) 32. Yang, S., Wu, T., Shi, S., Lao, S., Gong, Y., Cao, M., Wang, J., Yang, Y.: MANIQA:用于无参考图像质量评估的多维度注意力网络。在:CVPRW (2022) 33. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.: 深度特征作为感知度量的不合理有效性。在:CVPR (2018)