三分钟导读:提出D2DF框架,通过特权一致性蒸馏(PPCD)和自引导快速植入(SGFP)模块,将多步扩散教师模型蒸馏为单步视频物体移除模型,实现了无需外部草稿的高保真、高效率生成。
英文题目:From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting
论文出处:arXiv 每日论文精选 · arXiv:2607.14976
原始论文:PDF / 论文页面
对应视频标题:D2DF:单步视频物体移除,无需草稿的高保真重建|推荐指数:★★★★★
这篇论文解决什么问题?
传统视频物体移除方法存在伪影和模糊问题,而基于扩散的方法虽然真实感强但推理速度慢且易产生幻觉,同时依赖外部草稿增加了推理开销。
核心创新
- 提出从草稿到无草稿(D2DF)的渐进式框架,解耦延迟和依赖性。
- 提出特权一致性蒸馏(PPCD),通过在蒸馏阶段注入GT作为特权先验,解决基于缺陷草稿蒸馏时的轨迹不稳定问题。
- 设计自引导快速植入(SGFP)模块,基于Temporal Masked Transformer在潜在空间自主生成伪草稿,实现端到端无草稿单步生成。
方法概览
提出三阶段D2DF框架:1) 训练基于草稿引导的多步扩散教师模型(D-LDM);2) 提出特权一致性蒸馏(PPCD),用真实标签(GT)作为教师模型的“特权”条件以生成稳定轨迹,蒸馏出单步草稿引导模型(D2DF-DG);3) 设计自引导快速植入(SGFP)模块在潜在空间生成伪草稿,结合PPCD蒸馏出完全无草稿的单步模型(D2DF-DF)。
逐图理解论文
方法:D2DF框架概述

为解决上述问题,我们提出D2DF框架。该框架分为三个阶段:首先训练基于草稿引导的多步扩散教师模型D-LDM;其次,通过特权一致性蒸馏PPCD,将教师模型蒸馏为单步草稿引导模型D2DF-DG;最后,设计自引导快速植入SGFP模块,生成伪草稿,蒸馏出完全无草稿的单步模型D2DF-DF。
创新一:特权一致性蒸馏PPCD

传统一致性蒸馏在处理有缺陷的草稿条件时,轨迹不稳定。我们提出PPCD,在蒸馏阶段注入真实标签GT作为教师模型的“特权”条件。这确保了蒸馏轨迹的稳定性,使单步模型能更准确地学习从草稿到无草稿的映射,即使草稿质量不佳也能保持鲁棒性。
创新二:自引导快速植入SGFP

为实现无草稿生成,我们设计SGFP模块。该模块在潜在空间利用Temporal Masked Transformer TMT,基于有效补丁和空间窗口约束,自主生成伪草稿。这些伪草稿在视觉上可能显得粗糙,但在潜在空间中包含有效的背景信息,支持端到端的单步生成。
实验设置与基准

我们在RORD、ROVI和VPLM数据集上进行定量和定性比较。此外,使用Camera-Bench评估零样本泛化能力。对比方法包括传统方法ProPainter和基于扩散的SOTA方法ROSE、DiffuEraser。评估指标包括PSNR、SSIM和LPIPS。
结果:效率与泛化能力

D2DF-DF的推理总时间约1.05秒,比ROSE快40倍以上。在Camera-Bench上,D2DF-DF的PSNR为26.57,Ewarp为0.27×10^-4,优于使用ProPainter草稿的D2DF-DG。这表明模型具有良好的零样本泛化能力,无需特定草稿源。
实验与关键结果
- 在RORD, ROVI, VPLM数据集上进行定量和定性比较。
- 在Camera-Bench上进行零样本泛化能力评估。
- 进行消融实验验证PPCD、SGFP模块及三阶段框架的有效性。
- 分析极端遮挡条件下的表现及失败案例。
- D2DF-DG在RORD数据集上PSNR为32.20, SSIM为0.9318, LPIPS为0.0902(第 10 页)
- D2DF-DF在RORD数据集上PSNR为31.56, SSIM为0.9202, LPIPS为0.1001(第 10 页)
- D2DF-DF推理总时间约1.05秒,比ROSE快40倍以上(第 10 页)
- D2DF-DG在Camera-Bench上使用ProPainter草稿时PSNR为26.96, Ewarp为0.93×10^-4(第 13 页)
- D2DF-DF在Camera-Bench上PSNR为26.57, Ewarp为0.27×10^-4(第 13 页)
阅读时需要注意
- 单步去噪在某些场景下仍存在模糊问题。
- 当视频中物体存在动态且复杂的相互遮挡关系时,模型无法完全重建被遮挡物体。
- SGFP模块生成的伪草稿在视觉上可能显得粗糙(块状填充),但在潜在空间中包含有效的背景信息。
- D2DF-DG的性能依赖于草稿的质量,尽管其具有跨草稿源的鲁棒性。
关联工作
- ProPainter:作为传统方法提供高质量草稿,用于训练D-LDM和评估基准。(第 6 页)
- ROSE:作为基于扩散的SOTA方法进行对比,D2DF在速度上显著优于它。(第 10 页)
- DiffuEraser:作为基于扩散的方法进行对比,D2DF-DG性能接近但速度更快。(第 10 页)
- Consistency Distillation:基础蒸馏方法,本文提出的PPCD对其进行了改进以解决草稿条件不稳定的问题。(第 4 页)
- Camera-Bench:用于评估模型零样本泛化能力的基准数据集。(第 12 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
从草稿到无草稿:通过特权蒸馏和快速植入实现单步视频对象移除
Zizhao Chen1, Ping Wei1†, Guang Dai2, Jingdong Wang4, 和 Mengmeng Wang3,2†
1 西安交通大学 人机混合增强智能全国重点实验室,人工智能与机器人研究所 2 国家电网有限公司 SGIT AI Lab 3 浙江工业大学 4 百度 https://github.com/bigD233/D2DF
传统方法 传统方法 基于扩散的方法
基于流的方法 最先进方法 速度快但仅能 经过细化,但难以 存在缺陷且模糊(草稿) 绘制草稿。 从头开始绘制。 基于扩散的方法 迭代×𝑵 Draft-GuidedDiffusionRefiner2026 大型视频 扩散模型 缓慢且产生幻觉 经过细化并减少幻觉,但成本高昂。Jul 从草稿到无草稿 (D2DF) 框架:加速并去除草稿 输入视频和掩码 Draft-GuidedDiffusionRefiner 50 步 基于流的方法 最先进 50秒 方法 TeacherModelDiffusion16 草稿(低质量) Draft-GuidedOne-StepRefiner PPCD 蒸馏 基于流的方法 学生模型 1 步 最先进方法 (D2DF-DG) 1秒 草稿(低质量) Draft-FreeOne-StepGenerator PPCD 蒸馏 1 步 1秒 SGFP 模块 学生 (D2DF-DF) 模型 (轻量级) 伪草稿潜在 [cs.CV]
(a) 真实标签 (b) ProPainter (c) DiffuEraser (d) ROSE (e) D2DF-DG ( ours) (f) D2DF-DF ( ours)
图 1: 我们三阶段 D2DF 框架的概述。为了解决传统 方法和基于扩散的方法的局限性,我们将它们结合为一个细化器。然而,这带来了显著的时间 成本并依赖外部草稿。通过 PPCD 蒸馏和 SGFP 模块,我们获得了单步视频对象移除模型 D2DF-DG 和 D2DF-DF。从 (a) 到 (f) 的视觉比较表明,无论是否使用草稿作为先验信息,D2DF 都展现出强大的背景重建能力。
摘要。视频对象移除是视频编辑中一个基础但具有挑战性的任务。 尽管最近取得了进展,但现有方法通常分为两类。基于光流或注意力机制的传统方法会引入明显的伪影并产生不自然的结果。相比之下,基于扩散的 方法提高了视觉真实感,但需要多个去噪步骤,限制
† 通讯作者。联系方式:pingwei@xjtu.edu.cn, mengmewang@gmail.com.
第 2 页
2 Z. Chen 等
限制其实际可用性。为了解决这些问题,我们提出了从草稿到无草稿(From-Draft-to-Draft-Free, D2DF)框架,该框架将把粗糙草稿转化为精细视频的能力蒸馏到一个单步视频生成模型中。在 D2DF 中,教师模型通过多步操作训练,将低质量的去除结果(“草稿”)细化为高保真视频。随后,通过特权一致性蒸馏(Prior-Privileged Consistency Distillation, PPCD),我们将这种能力蒸馏到一个学生模型中,该模型在给定草稿条件下执行单步去除。为了消除对草稿的依赖,我们引入了基于时间掩码 Transformer(Temporal Masked Transformer, TMT)的自引导快速植入(Self-Guided Fast Planting, SGFP)模块,该模块在潜在空间中自主生成场景一致性的伪草稿,从而实现完全无草稿的单步模型。大量实验表明,草稿条件版本和无草稿版本在多项指标上均达到了最先进(state-of-the-art)的性能,在质量和效率上均超越了传统方法和多步生成方法。单个视频的去噪过程仅需约 1 秒。
关键词:对象去除 · 视频修复 · 单步视频生成
1 引言
视频对象去除(Video Object Removal, VOR)旨在从视频中移除不需要的对象,并重建被遮挡区域的背景。作为视频修复 [8,46,63] 的一项基本任务,它具有广泛的应用。该挑战本质上非常困难,通常需要对无法从相邻帧传播的区域进行全局一致的空间-时间内容生成 [1,7,41]。 传统的 VOR 方法依赖于光流传播或浅层 Transformer 架构 [9, 21, 23, 59, 60, 65]。虽然它们能够传播背景纹理,但其有限的生成能力会导致结构失真和模糊的重建结果,尤其是在大面积遮挡的情况下(图 1(b))。这种“草稿”输出包含明显的缺陷。 大型视频扩散模型 [12,20,29,30,33,56] 的出现为解决这一“生成能力”瓶颈提供了一条路径,显著增强了真实感。然而,仍存在两个关键问题。首先,幻觉(Hallucination):弱先验导致扩散模型产生“幻觉”——生成看似合理但语义错误的内容(图 1(c)(d)),无法实现确定性重建。其次,速度慢:扩散推理本质上较慢(需要数十个 DDIM 步骤 [37]),阻碍了实际部署。 为了解决幻觉问题,我们观察到基于流的方法能够高效地在帧间传播可靠的像素信息。这一过程速度快,并用有效内容填充了掩码区域的部分。虽然其“草稿”输出可能模糊(图 1(b)),但它提供了一个强大且部分重建的起点。我们利用这个“草稿”来指导扩散“细化器”以避免幻觉。为了解决速度慢的问题,我们认为鉴于这个强大的“草稿”条件,完整的多步细化是不必要的。任务被简化到足以将“细化器”蒸馏为单个高效步骤的程度。然而,我们的最终目标是构建一个自主学习此范式但在推理时丢弃外部“草稿”先验的自主模型。 基于这一洞察,我们提出了“从草稿到无草稿”框架(D2DF),该框架逐步推导出草稿引导的单步细化器(D2DF-DG)和完全无草稿的单步生成器(D2DF-DF)。我们的框架(图 1)包含三个阶段:
第 3 页
从有草稿到无草稿 3
教师
掩码视频 草稿 条件:掩码视频 + 草稿 次优目标
教师
掩码视频 真值 条件:掩码视频 + 真值 “黄金”目标
图 2:不同条件下 D-LDM 输出的比较。中间列显示了教师网络通过 4 步 DDIM 去噪获得的结果。实红线表示真值去噪轨迹。虚线表示教师的解轨迹。短实线表示教师在当前时间步提供的目标。
阶段一:草稿引导的扩散教师模型。我们首先训练一个多步扩散教师模型(D-LDM),其条件为外部“草稿”(例如 ProPainter [65])。该教师模型通过 50 步迭代将存在缺陷的草稿细化为高质量的对象移除视频。
阶段二:草稿引导的一步细化器(D2DF-DG)。我们的目标是将 50 步教师模型蒸馏为 1 步学生模型(D2DF-DG)。由于当以有缺陷的草稿为条件时,教师模型必须从不同程度的损坏中进行重建,因此简单的 consistency distillation [26, 38, 39] 会失败。这迫使教师模型进入一条不稳定的解轨迹,该轨迹显著偏离通向真值(GT)的理想路径。如图 2 所示,这条 noisy 路径为学生提供了不一致且次优的目标,使得收敛变得困难。为了解决这个问题,我们引入了特权一致性蒸馏(PPCD)。我们将有缺陷的草稿替换为真值作为教师模型的条件。这种“注入真值”的策略迫使教师模型生成完全一致且稳定的轨迹。这条与真值保持一致的理想路径为学生提供了“黄金”目标,极大地提高了蒸馏效果。关键在于,学生模型(D2DF-DG)仍然接受草稿作为输入,但现在学习的是到这个“黄金”输出的干净的一步映射。
阶段三:无草稿的一步生成器(D2DF-DF)。尽管 D2DF-DG 表现出色,但它仍然依赖外部草稿。为了消除这种依赖,我们设计了自引导快速植入(SGFP)模块,这是一个基于时间掩码 Transformer(TMT)的轻量级网络,用于在潜在空间中构建“伪草稿”。这与典型方法(如 ProPainter [65])中显式像素空间的草稿有着根本区别。随后,我们再次使用 PPCD 将 D2DF-DG(作为教师)蒸馏为我们的最终学生模型 D2DF-DF。该模型继承了一步生成的速度,但现在完全自主,实现了无需外部先验的端到端生成。
我们的 D2DF-DF 在三个基准数据集 [34,51,57] 上取得了优越的性能,表现出强大的鲁棒性,尤其是在大掩码场景下。关键在于,我们的模型树立了效率的新标准:D2DF-DF 在达到最先进结果的同时,速度比 ROSE [29] 等竞争性的 SOTA 扩散方法快 40 倍以上。这种质量、速度和自主性的结合代表了视频编辑实用化的重要一步。
我们的贡献总结如下:
第 4 页
4 Z. Chen 等
• 我们提出了一种新颖的从草稿到无草稿(From-Draft-to-Draft-Free, D2DF)框架,这是一种渐进式方法,旨在解耦延迟与依赖关系,从而生成两个模型:一个高效的一步式细化器(D2DF-DG)和一个完全自主的一步式生成器(D2DF-DF)。 • 在 D2DF 中,我们引入了特权一致性蒸馏(Prior-Privileged Consistency Distillation, PPCD),这是一种新颖的“注入真实信息”的蒸馏方法,其中教师模型利用真实标签(GT)构建黄金目标。 • 我们设计了自引导快速植入(Self-Guided Fast Planting, SGFP)模块,这是一个轻量级的潜在空间先验生成器,结合 PPCD,构建了一个完全自主的端到端一步式模型。
2 相关工作
2.1 基于扩散的视频生成
扩散模型最近通过在视觉生成中迭代去噪噪声输入 [4, 6, 15, 32, 45, 49, 53] 取得了显著成功。继文本到图像扩散模型的进展之后,最近的工作将该范式扩展至视频生成。文本到视频(Text-to-Video, T2V)模型 [3, 13, 44, 48, 50, 56] 将时间模块集成到 2D UNet 架构中,而像 DynamiCrafter [52] 和 PixelDance [58] 这样的图像到视频(Image-to-Video, I2V)方法展示了强大的运动和场景建模能力。最近,基于 Transformer 的扩散模型(例如 DiT、类 SORA 模型 [5,30])进一步提升了时间推理能力和视觉保真度。
2.2 视频修复
大多数现有的视频修复方法采用两阶段框架。在第一阶段,从输入视频中提取先验信息,例如运动线索 [16, 41, 55]、单应性变换 [19] 或低分辨率重建 [42]。在第二阶段,基于这些先验,通过精心设计的生成网络填充缺失区域。典型的架构包括图像修复模型 [9, 55, 61]、3D 卷积网络 [16] 以及基于 Transformer 的框架 [60]。最近的研究结合了视频 Transformer [9, 21, 60, 65] 的时空建模优势,导致了一系列两阶段混合方法。最近,研究人员引入了视频扩散模型用于视频修复 [2,7,11,18,20,29]。这些模型显著提高了生成视频的真实性和连贯性,但在重建区域仍存在幻觉问题。为了解决这些问题,我们的工作引入了 SGFP 模块以提供强大的先验,并结合特权一致性蒸馏(PPCD)框架实现一步式视频生成,有效地平衡了质量与效率。
2.3 一致性模型
扩散模型实现了令人印象深刻的生成性能,但由于其多步采样过程,推理速度较慢。为了加速生成,人们提出了几种策略,例如改进的 ODE 求解器 [25]、神经算子 [64] 和模型蒸馏 [28, 35, 36]。其中,一致性蒸馏(consistency distillation)[39] 已成为一种有效的解决方案。它不依赖迭代去噪,而是训练一个学生一致性模型,直接从中间噪声状态预测干净样本,从而在保持样本质量的同时实现一步式生成。后续工作,例如
第 5 页
从草稿到无草稿 5
如潜在一致性模型(Latent Consistency Models, LCM)[26, 27] 所示,将该范式扩展至潜在空间,以实现更高的效率和更低的内存成本。最近的改进 [10,24,38] 进一步增强了稳定性和保真度,使得一致性蒸馏成为高效生成建模的一个有前景的框架。然而,一致性模型在适应特定任务应用方面仍面临挑战,尤其是在视频生成领域。为了解决这一问题,我们提出了特权一致性蒸馏(Prior-Privileged Consistency Distillation, PPCD),它为视频生成任务提供了更稳定且一致解轨迹。
3 方法
3.1 预备知识
潜在扩散模型(Latent Diffusion Models, LDM)[33] 在潜在空间中建立生成建模过程。其训练目标通过简化变分界,将预测的去噪样本 $x_0$ 与真实值进行匹配:
\mathcal{L}_{LDM} = \mathbb{E}_{x,t,\epsilon\sim\mathcal{N}(0,\mathbf{I})}\left[\|\boldsymbol{\epsilon}-\boldsymbol{\epsilon}_\theta(\mathbf{x}_t,t)\|_2^2\right]\label{eq:ddpm_loss} (1)
其中 $x_t$ 是通过具有时间步 $t$ 的前向扩散过程获得的带噪输入,$\epsilon_\theta$ 是一个预测噪声分量的神经网络。该目标有效地建立了一个渐进式去噪映射,通过 $T$ 步的马尔可夫链将纯噪声 $x_T$ 转换为干净数据 $x_0$。该映射可以表述为参数化的反向过程 $p_\theta : (x_t, t) \mapsto x_{t-1}$。然而,这需要迭代去噪过程。 一致性模型(Consistency Model)[39] 试图通过一致性函数建立映射,定义为 $f : (x_t, t) \mapsto x_\delta$,其中 $\delta$ 是一个固定的小正数。其一致性反映在该函数的一个关键属性中:
\mathbf{f}(\mathbf{x}_t,t)=\mathbf{f}(\mathbf{x}_{t'},t'),\quad\forall t,t'\in[\epsilon,T].\label{eq:self_consistency} (2)
理想情况下,通过可学习神经网络 $f_\theta$ 建立的一致性函数使得一致性模型能够从初始分布 $x_T \sim \mathcal{N}(0, T^2\mathbf{I})$ 中通过一步去噪恢复原始数据 $x_0$。可学习参数 $\theta$ 通过一致性蒸馏(Consistency Distillation)[10,38,39] 进行训练。蒸馏的目标是最小化随机相邻数据点之间的输出差异,从而在概率意义上确保自一致性。形式上,一致性损失定义如下:
\mathcal{L}(\boldsymbol{\theta}, \boldsymbol{\theta}^-;\Phi)=\mathbb{E}_{\boldsymbol{x},t}\left[d\left(\mathbf{f}_\boldsymbol{\theta}(\mathbf{x}_{t_{n+1}},t_{n+1}),\mathbf{f}_{\boldsymbol{\theta}^-}(\hat{\mathbf{x}}_{t_n},t_n)\right)\right]\label{eq:consistency_loss} (3)
其中 $0 = t_1 < t_2 < \cdots < t_N = T$,且 $n$ 在集合 $\{1, 2, \cdots, N-1\}$ 上均匀分布。$\Phi(\cdot)$ 表示应用于 PF-ODE [40] 的一步常微分方程(ODE)求解器 [25],模型参数 $\theta^-$ 是通过 $\theta$ 的指数移动平均(EMA)获得的,$d(\cdot, \cdot)$ 是用于测量两个样本之间距离的选定度量函数。$\hat{x}_{\phi}^{t_n}$ 使用方程 $\hat{x}_{\phi}^{t_n} := \Phi(x_{t_{n+1}}, t_{n+1}, t_n; \phi)$ 确定。在一致性蒸馏中,$\hat{x}_{\phi}^{t_n}$ 由带有 ODE 求解器的教师模型估计。
第 6 页
6 Z. Chen 等
阶段 Ⅰ:草稿引导扩散教师模型 特权一致性蒸馏 (PPCD)
𝒙𝒅𝒓𝒂𝒇𝒕 𝒙𝟎
𝐼𝑛𝑝𝑢𝑡 𝓛𝑳𝑫𝑴 𝒙𝒕 𝑰(𝒙𝒕) 教师 Diffusion 𝒙𝟎𝒑𝒓𝒆𝒅 𝒙𝟎 模型 (D-LDM) 𝒙𝒕𝒏+𝟏 𝒙𝟎𝑴 𝑰𝒑𝒑(𝒙𝒕𝒏+𝟏) 教师 𝝓 𝒙𝟎 𝑴 𝒙𝟎 阶段 Ⅱ:草稿引导单步细化器 (D2DF-DG) 𝒑𝒔𝒆𝒖𝒅𝒐 PPCD 蒸馏 𝒅𝒓𝒂𝒇𝒕 /𝒙𝒅𝒓𝒂𝒇𝒕 基于流的 SOTA 方法 教师 𝝓 𝓛𝟐 𝒙𝒅𝒓𝒂𝒇𝒕 D-LDM 𝓛𝒑𝒑𝒄𝒅 𝑰(𝒙ෝ𝒕𝒏𝝓) 目标 𝜽ି 𝒙ෝ𝟎𝝓 𝒙ෝ𝒕𝒏𝝓 𝒙𝟎𝑴 学生 𝜽 𝒙𝟎𝑴 D2DF-DG 𝒑𝒔𝒆𝒖𝒅𝒐 𝒅𝒓𝒂𝒇𝒕 /𝒙𝒅𝒓𝒂𝒇𝒕 EMA 𝓛𝟏 𝑴 𝒙𝟎 𝒙𝟎
阶段 Ⅲ:无草稿单步生成器 (D2DF-DF)
𝒑𝒔𝒆𝒖𝒅𝒐 𝑰(𝒙𝒕𝒏+𝟏) 学生 𝜽 𝒙ෝ𝟎𝝓 𝒙ෝ𝒕𝒏𝝓 𝒅𝒓𝒂𝒇𝒕 PPCD 蒸馏 𝒙𝟎𝑴 SGFP 教师 𝝓 D2DF-DG 编码 编码 𝓛𝒅𝒓𝒂𝒇𝒕 𝓛𝒑𝒑𝒄𝒅 𝒙𝟎𝑴 学生 𝜽 草稿 𝒙𝒅𝒓𝒂𝒇𝒕 掩码视频 𝒙𝟎𝑴 冻结 D2DF-DF 编码 时间步: 𝒕 / 𝒕𝒏+𝟏
训练 𝒙𝟎𝑴 𝒙𝟎 真实标签 𝒙𝟎 添加噪声 𝒙𝒕/𝒙𝒕𝒏+𝟏
图 3:D2DF 的流水线。左侧为我们框架的三个阶段,右侧为我们提出的 PPCD 蒸馏。
3.2 阶段 I:草稿引导扩散教师模型
我们的第一阶段将任务简化为细化过程。我们从现有方法(例如 ProPainter [65])中引入一个强条件先验(草稿)。该过程建立了一个足够强大的教师网络,以提供从草稿到细化视频的多步映射。因此,我们训练一个草稿引导扩散教师模型(Draft-Guided Diffusion Teacher Model,简称 D-LDM),记为 𝜙。该模型以草稿潜在变量 𝒙𝒅𝒓𝒂𝒇𝒕 和掩码视频潜在变量 𝒙𝟎𝑴 为条件。在时间步 𝑡,模型输入 𝑰(𝒙𝒕) 定义为噪声输入 𝒙𝒕 与条件信息的拼接:
𝑰(𝒙𝒕) = Cat(𝒙𝒕, 𝒙𝟎𝑴 + 𝒙𝒅𝒓𝒂𝒇𝒕), (4)
其中 𝒙𝒕 表示通过前向扩散过程得到的噪声输入,Cat(·) 表示潜在变量的拼接。 然后,通过将条件输入 𝑰(𝒙𝒕) 替换为 LDM 训练目标(公式 1)中的 𝒙𝒕,来训练 D-LDM 模型。教师网络 𝜖𝜙 的目标函数变为: 𝓛𝐷-𝐿𝐷𝑀 = 𝔼𝑥,𝑡,𝜖∼𝒩(0,𝐈)[‖𝜖𝜙(𝑰(𝒙𝒕), 𝑡)‖₂²] (5)
这种强草稿条件显著降低了映射复杂度,使得单步近似成为可能。由此产生的 D-LDM 𝜙 通过迭代(例如 50 步)DDIM 采样实现了强大的生成性能。
第 7 页
从有草稿到无草稿 7
3.3 第二阶段:用于草稿引导的一步细化器的特权一致性蒸馏 (PPCD)
在第二阶段,我们将 D-LDM 教师模型 ($\phi$) 蒸馏为一个一步、草稿引导的学生模型 D2DF-DG。虽然一致性蒸馏 (CD) 的理论前景广阔,但它容易受到来自教师模型的高采样方差的影响,特别是在以不完美的草稿为条件时,这会破坏蒸馏过程的稳定性。
为了克服这一问题,我们引入了特权一致性蒸馏 (PPCD)。以存在缺陷的草稿为条件对教师进行标准蒸馏,会导致不稳定且次优的轨迹。我们的核心思想是在蒸馏过程中仅向教师模型 $\phi$ 注入真实视频作为“特权”先验。这提供了一个理想的、“黄金”的目标轨迹,并确保映射锚定在一个收敛的求解空间中。
形式上,教师模型充当轨迹提供者。为了确保它提供稳定且可靠的一致性轨迹,我们用真实潜在变量 $x_0$ 替换草稿潜在变量 $x_{\text{draft}}$,如图 3 (PPCD) 所示。教师模型在时间步 $t$ 的特权输入变为: $$ \mathbf{I}^{pp}(\mathbf{x}_t) = \text{Cat}(\mathbf{x}_t, \mathbf{x}_0^M \mathbf{x}_0). \quad (6) $$ 给定此特权输入,教师网络沿扩散轨迹在下一个时间步产生去噪后的潜在变量 $\hat{\mathbf{x}}_{\phi}^{t_n} = \Phi(\mathbf{I}^{pp}(\mathbf{x}_{t_{n+1}}), t_{n+1}, t_n; \phi)$。
基于一致性蒸馏原理(公式 3),学生网络 $f_\theta$(及其指数移动平均目标网络 $f_{\theta^-}$)被训练以匹配一致性属性。然而,学生网络在推理时仍使用草稿作为输入,因此在训练时也使用草稿作为输入。我们获得目标潜在变量和预测潜在变量:
$$ \hat{\mathbf{x}}_{0}^{pred} = f_{\theta^-}(\mathbf{x}_{\text{draft}}, t_n), \quad \mathbf{x}_{0}^{pred} = f_{\theta}(\mathbf{x}_{\text{draft}}, t_{n+1}), \quad (8) $$
其中 $f_{\theta^-}$ 表示目标模型,$\theta^-$ 是学生网络 $\theta$ 的指数移动平均 (EMA) 版本。$t_n$ 和 $t_{n+1}$ 的含义与公式 3 中相同。最终,我们的 PPCD 利用以下目标来优化学生网络 $\theta$:
$$ \mathcal{L}_{pc} = \mathbb{E}_{\boldsymbol{x},t} \left[ d\left(\mathbf{x}_{0}^{pred}, \hat{\mathbf{x}}_{0}\right) \right] + \alpha \mathbb{E}_{\boldsymbol{x},t} \left[ d\left(\mathbf{x}_{0}^{pred}, \mathbf{x}_{0}\right) \right] \quad (9) $$
其中 $d(\cdot, \cdot)$ 是两个样本的均方误差,$\alpha$ 是超参数。第一项强制与特权轨迹保持一致,而第二项添加了直接的真实值约束。
使用训练好的 D-LDM 作为教师,我们应用 PPCD 获得 D2DF-DG,这是一个一步、草稿条件化的对象移除细化器模型。
3.4 第三阶段:用于无草稿一步生成器的自引导快速植入 (SGFP)
第二阶段的 D2DF-DG 模型速度很快,但仍然依赖于由外部方法生成的草稿,从而产生推理开销。在我们的最后阶段,我们通过提出自引导快速植入 (SGFP) 模块消除了这种依赖,从而得到最终的无草稿模型 D2DF-DF。
第 8 页
8 Z. Chen 等
SGFP 模块(图 4)利用未遮挡区域的时空信息,学习在潜在空间中直接重建“伪草稿”。该模块基于我们的时间掩码 Transformer(TMT)架构构建,旨在快速重建掩码区域。给定掩码草稿潜在变量 $x_{draft}^0 \in \mathbb{R}^{C \times T}$ 和二值掩码 $M \in \{0, 1\}^{1 \times T \times H \times W}$(其中 0 表示掩码区域,1 表示已知区域),SGFP 的目标是获得一个完整的潜在张量 $x_{recon}$。
为了在处理高维视频潜在变量的同时保持计算可行性,我们首先将空间维度 $(H, W)$ 划分为一系列大小为 $P \times P$ 的不重叠图块。这将输入重塑为 $N = T \times (H/P) \times (W/P)$ 个 token 的序列,其中每个 token 是维度为 $C \cdot P^2$ 的向量。每个图块向量 $p_i$ 随后通过线性层嵌入到较低维空间 $\mathbb{R}^{D_e}$ 中,并结合位置嵌入:$z_i = \text{Linear}(p_i) + e_{pos}(i)$,其中 $D_e$ 是嵌入维度,$z_i$ 是 TMT 层的输入。项 $e_{pos}(i)$ 是一个可学习的位置编码,由一个小型 MLP 从图块的归一化 3D 坐标 $(t, h, w)$ 生成,提供时空感知能力。
SGFP “自引导”特性的关键在于其自注意力机制的构建。计算必须完全依赖已知的、未掩码的信息。我们首先为每个图块计算掩码比率 $r_i = \text{Mean}(M_{patch,i})$。如果 $r_i$ 超过阈值 $\tau$,则该图块被视为“无效”。在自注意力计算中,所有图块 $z_i$ 均可作为查询(Queries),但只有“有效”图块(即 $r_j \le \tau$)才被允许作为键(Keys)和值(Values)。这通过注意力掩码 $A_{mask}$ 来强制执行:
$\begin{cases} 0 & \text{if } r_j \le \tau \text{ and } \text{dist}(i, j) \le R \\ -\infty & \text{otherwise} \end{cases}$
其中 $\text{dist}(i, j) \le R$ 是一个可选的空间窗口约束,它将注意力进一步限制在查询图块 $i$ 的 $(2R +1)\times(2R +1)$ 空间邻域内(跨越所有时间帧 $T$),从而降低复杂度并强化局部先验。经过 $L$ 个 Transformer 层后,输出序列 $z_i^{(L)}$ 被投影回原始图块维度 $\mathbb{R}^{C \cdot P^2}$ 并“展开”以重建潜在变量 $x_{recon} \in \mathbb{R}^{C \times T \times H \times W}$。最后,通过利用掩码 $M$ 组合重建结果和原始输入来生成伪草稿 $x_{pdraft}$,以确保未掩码区域的保真度:
$\mathbf{x}_{draft}^p = \mathbf{x}_{recon} \odot \mathbf{x}_{0}^M \odot (10)$
随后,我们将 D2DF-DG 模型(来自第二阶段)视为新的教师模型,并再次采用 PPCD 框架来蒸馏最终的无草稿学生模型 D2DF-DF,该模型现在
第 9 页
从草稿到无草稿 9
结合了 SGFP 模块。我们将 SGFP 与后续的生成模块一起进行训练,并引入了针对伪草稿的约束:
{ } ra \mat h cal L _{\text {d ft}}=\mathbb{E}_{\boldsymbol{x},t}\left[d\left(\mathbf{x}^{p}_{draft},\mathbf{x}_{0}\right)\right(11)
通过引入 SGFP,我们得到了 D2DF-DF,这是一个端到端的、无草稿的视频对象移除模型。整个渐进式流程总结在图 3 中。
4 实验
4.1 实验设置
实现细节。我们采用 CogVideoX-5B-I2V [56](480×720 分辨率)作为训练第一阶段 D-LDM 网络的预训练权重。D-LDM 模型的学习率设置为 5×10−5,推理时使用 50 个 DDIM 步数。“草稿”是使用 ProPainter [65] 获得的。在 PPCD 蒸馏中,超参数 α 设置为 1,批量大小为 4,学习率为 2 × 10−5。采样时间步 t1, t2, …, tN 在 1k 个时间步上以 50 步的间隔均匀进行。目标网络的 EMA 衰减率设置为 0.99。对于 SGFP 模块,层数 L 设置为 4,空间半径 R 为 2,补丁大小 P 为 10,嵌入维度 De 为 512,掩码阈值 τ 为 0.7。在第三阶段训练中,Ldraft 与 Lppcd 的比例为 1:5,SGFP 模块参数的学习率为 1 × 10−4。我们仅使用全参数 SFT 训练 DiT 组件。
数据集。DAVIS [31] 和 YouTube-VOS [54] 广泛用于带有静态随机掩码的视频修复,但它们不提供移除对象后的真实视频。因此,除非引入合成或主观协议,否则它们不太适合用于 VOR 评估。基于此,我们在三个数据集上评估我们的模型:RORD [34]、ROVI [51] 和 VPLM [57]。RORD 是一个专为对象移除设计的大规模真实世界数据集,包含 2,761 个不同的训练场景和 343 个测试场景。ROVI 包含 5,650 个视频,共有 9,091 个对象移除实例,其中 458 个视频(758 个对象)被保留用于测试。从 RORD 和 ROVI 的训练分割中,我们提取了 25 帧的视频片段以形成我们的训练集, resulting in 大约 30k 个样本。对于评估,我们采用 VPLM 数据集,该数据集提供了 60 个基于视频的对象移除任务。所有三个数据集都提供了原始视频、对象掩码和移除对象后的真实视频三元组。
指标。为了定量评估视频对象移除的性能,我们采用了四个成熟的指标:PSNR [14]、SSIM [47]、VFID [43] 和 LPIPS [62]。PSNR 和 SSIM 广泛用于衡量生成视频与真实视频之间低层像素级相似度。为了进一步评估感知质量,我们使用 LPIPS,它利用深度特征以更好地与人类感知保持一致。我们使用 VFID,即针对视频调整的 FID,来评估完成视频序列的整体时间一致性和视觉真实感。此外,我们还引入了光流扭曲误差 [17] 作为零样本验证中衡量时间一致性的指标。我们严格遵循 ProPainter [65] 的设置来计算指标。
第 10 页
10 Z. Chen 等
表 1:在 RORD、ROVI 和 VPLM 数据集上的定量比较。↑表示越高越好。↓表示越低越好。最佳和第二佳性能分别以粗体和下划线突出显示。
RORD ROVI VPLM 模型 PSNR ↑ SSIM ↑ VFID ↓ LPIPS ↓ PSNR ↑ SSIM ↑ VFID ↓ LPIPS ↓ PSNR ↑ SSIM ↑ VFID ↓ LPIPS ↓
FLoED [12] 26.06 0.8263 0.471 0.1557 34.42 0.9225 0.138 0.0763 34.85 0.9149 0.493 0.0816 E2FGVI [21] 26.95 0.8421 0.311 0.1340 38.01 0.9693 0.096 0.0337 38.29 0.9652 0.424 0.0390 ROSE [29] 27.94 0.8959 0.270 0.1105 35.72 0.9642 0.099 0.0379 36.19 0.9520 0.378 0.0473 FuseFormer [23] 27.99 0.8659 0.306 0.1431 41.21 0.9813 0.064 0.0292 41.24 0.9814 0.236 0.0364 DiffuEraser [20] 28.64 0.8865 0.268 0.1205 38.79 0.9769 0.093 0.0323 38.76 0.9719 0.298 0.0421 FGT [60] 30.13 0.8972 0.271 0.1042 37.80 0.9725 0.089 0.0325 38.51 0.9725 0.350 0.0368 ProPainter [65] 30.97 0.9132 0.230 0.1020 40.86 0.9759 0.069 0.0263 41.15 0.9808 0.241 0.0374 MiniMax-Remover [66] 30.60 0.9166 0.224 0.0947 38.65 0.9775 0.069 0.0318 39.47 0.9744 0.246 0.0381
D2DF-DG (Ours) 32.20 0.9318 0.251 0.0902 42.41 0.9888 0.062 0.0227 43.31 0.9877 0.191 0.0337 D2DF-DF (Ours) 31.56 0.9202 0.268 0.1001 42.25 0.9889 0.063 0.0282 43.05 0.9864 0.196 0.0348
表 2:基于扩散方法的效率比较。 “Prior”表示先验提取阶段的推理 时间。“Denoising”表示去噪时间。 “Step”表示去噪的迭代次数。
模型 Prior(s) Denoise(s) Steps Total Time(s) (a) PSNR (b) SSIM ROSE [29] – 45.76 50 45.76 FLoED [12] 2.66 31.49 25 34.15 图 5:不同模型在不同掩码比例下的比较。 DiffuEraser [20] 2.38 2.85 2 5.13 D2DF-DG 2.38 1.03 1 3.41 D2DF-DF 0.02 1.03 1 1.05
4.2 比较
定量评估。我们在三个数据集上报告了定量结果。我们将提出的 D2DF-DG 和 D2DF-DF 与之前的视频对象移除方法进行了比较,包括 FuseFormer [23]、FGT [60]、E2FGVI [21]、FLoED [12]、DiffuEraser [20]、ROSE [29] 和 ProPainter [65]。其中,FLoED、DiffuEraser 和 ROSE 是基于扩散模型的方法。如表 1 所示,D2DF-DG 在大多数指标上取得了最佳性能,并在所有三个基准测试中持续提供强劲的结果。虽然 D2DF-DF 的性能略低于 D2DF-DG,但它在 PSNR 方面仍领先于最先进的方法。这充分展示了我们方法在对象移除方面的强大能力。此外,我们观察到 RORD 数据集中存在大量大尺寸对象。因此,我们选择了基于扩散的方法(DiffuEraser)和传统方法(ProPainter)中的最佳模型,并比较了它们在不同掩码比例下的性能。如图 5 所示,在 0-20% 的掩码比例范围内,我们的模型仅比 ProPainter 和 DiffuEraser 具有微小的优势。然而,随着掩码比例的增加,我们的模型在 PSNR 和 SSIM 指标上显示出更明显的优势。这突显了我们模型的鲁棒性及其在大面积对象移除方面的优越性。
定性评估。对于定性评估,我们选择了基于扩散的方法 ROSE [29] 和 DiffuEraser [20],以及轻量级的基于 Transformer 的 ProPainter
第 11 页
从有草稿到无草稿 11
掩码视频 ProPainter DiffuEraser ROSE D2DF-DF( ours)
图 6:视频对象移除的定性比较。我们的 D2DF-DF 模型展示了极强的对象移除和背景重建能力。
[65] 进行比较。如图 6 所示,我们的方法 D2DF-DF 在重建背景区域方面表现出强大的能力。当在最后两行中从较大区域移除对象时,D2DF-DF 仍然提供高度稳定的性能。然而,其他方法存在纹理信息不一致、模糊和伪影等问题。这突显了我们的一步去噪模型在视频对象移除中的强大性能。D2DF-DG 提供了更强大的结果。由于篇幅限制,请参阅附录了解详情。 与基于扩散的方法的效率比较。表 2 比较了不同基于扩散的方法的推理时间。我们在 NVIDIA A100 GPU 上测试每个模型,生成 25 帧 480×720 的视频,测量先验提取和去噪所需的时间。结果表明,同样利用 ProPainter 的 DiffuEraser [20] 取得了与我们 D2DF-DG 极其接近的性能。然而,当切换到我们的 SGFP 模块进行先验提取时,我们观察到该模块仅需 0.02 秒即可完成任务。因此,D2DF-DF 在保持卓越性能的同时提供了最快的推理时间。包括编码和解码潜在变量的时间,我们完整的处理时间在 10 秒以内。 极端遮挡条件下的定性分析。在本节中,我们将讨论不同模型在极端遮挡条件下的表现。当视频中的对象运动范围有限或占据较大区域时,这些对象遮挡的背景区域无法通过帧传播获得。我们将此场景定义为极端遮挡。RORD [34] 采用多边形掩码标注方法,导致数据集中包含极多极端遮挡案例,极具挑战性。我们选择了基于光流和扩散模型的最先进方法 ProPainter [65] 和 MiniMax-Remover [66] 进行比较。如图 7 所示,对于信息无法传播
第 12 页
12 Z. Chen 等
(a) 第一帧 (b) 最后一帧 (c) ProPainter (d) MiniMax-Remover (e) D2DF-DF
图 7: 极端遮挡条件下的定性比较。我们的 DF 模型在一步内实现了卓越的结构一致性和生成性能。
帧间出现模糊,ProPainter 直接产生模糊的纹理,而 MiniMax-Remover(6 步)表现出噪声伪影。相比之下,我们的 D2DF-DF 模型仅需一步即可实现出色的背景还原。这证明了我们的模型在极端遮挡条件下的独特优势。
4.3 鲁棒性与泛化能力分析
在 Camera-Bench 上的零样本评估。为了进一步评估我们方法的泛化能力,我们在 Camera-Bench [22] 上进行了零样本实验,如表 3 所示。未经过该基准的训练,D2DF-DG 和 D2DF-DF 均与现有方法保持高度竞争力。值得注意的是,我们的框架本质上并不依赖于光流。是否涉及光流取决于 D2DF-DG 所使用的草稿来源。尽管 D2DF-DG 是使用 ProPainter 草稿训练的,但它仍能有效细化 FuseFormer 草稿,后者是在没有光流的情况下生成的。这表明我们方法的跨领域鲁棒性不仅限于数据集迁移,还扩展到了不同类型的草稿先验。此外,D2DF-DF 完全移除了外部草稿依赖,使得最终模型在推理过程中完全不受光流相关问题的影响。
第 13 页
从有草稿到无草稿 13
表 3:Camera-Bench [22] 上的零样本性能。“Draft”表示该方法在推理时是否需要外部草稿,“Flow”表示其推理流程中是否涉及光流。Ewarp 以 $10^{-4}$ 为单位报告。最佳结果以粗体高亮显示。
方法 Draft Flow PSNR↑ SSIM↑ LPIPS↓ Ewarp ↓ ($\times 10^{-4}$)
FuseFormer [23] – % 25.05 0.9155 0.2020 0.70 ProPainter [65] – ! 25.42 0.9203 0.1268 1.10 ROSE [29] – % 26.45 0.9286 0.0860 0.55 MiniMax-Remover [66] – % 26.63 0.9324 0.0854 0.37 D2DF-DG (Ours) FuseFormer % 27.08 0.9421 0.0831 0.41 D2DF-DG (Ours) ProPainter ! 26.96 0.9429 0.0884 0.93 D2DF-DF (Ours) – % 26.57 0.9365 0.0896 0.27
原始视频 DiffuEraser ProPainter FuseFormer
掩码 DG(DiffuEraser) DG(ProPainter) DG(FuseFormer)
图 8:在 DAVIS 样本上对草稿敏感性泛化能力的视觉验证。结果表明,我们的 DG 能够细化各种类型的草稿。
草稿源鲁棒性。我们进一步评估了 D2DF-DG 在不同来源草稿下的表现。如图 8 所示,尽管我们的模型是使用 ProPainter 草稿训练的,但它能够一致地细化由 DiffuEraser、ProPainter 和 FuseFormer 生成的草稿,产生同样高质量的去除结果。这表明 D2DF-DG 并未过拟合于特定的草稿分布,而是学会了在异构草稿先验下具有鲁棒的细化能力。值得注意的是,在 FuseFormer 草稿上的有效性也表明,我们的框架可以与无光流的草稿源配合使用,而 D2DF-DF 则完全消除了对草稿的依赖。
4.4 消融研究
特权一致性蒸馏研究。在表 4 中,当我们直接使用 LDM 方法训练时,模型表现为标准的 LDM 模型,在单步推理中产生次优结果。因此,采用一致性蒸馏(Consistency Distillation, CD)显著提升了性能。然而,引入特权先验知识(用真实标签替换草稿条件)进一步提升了结果。这表明我们的真实标签先验确实产生了更稳定的一致性轨迹。
自引导快速植入模块研究。为了探究我们提出的 SGFP 模块的有效性,我们在 RORD 数据集上进行了详细的消融实验。如表 5 所示,第一行代表基线模型,表示没有任何先验知识时的性能。添加 Transformer 层(Transformer Layer, TL)产生了初始
第 14 页
14 Z. Chen 等
表 4:提出的特权一致性蒸馏(PPCD)的消融研究。“D.T.”表示直接如公式 1 所示训练扩散模型,“CD”表示一致性蒸馏 [39]。
训练方法 指标
D.T. CD PPCD PSNR↑ SSIM↑ VFID↓ LPIPS↓ ✓ 31.54 0.9192 0.271 0.1014 ✓ 31.85 0.9296 0.257 0.1002 ✓ 32.20 0.9318 0.251 0.0902
表 5:我们 SGFP 模块的消融研究。第一行表示没有任何额外先验的基线模型。“TL”表示 Transformer 层,“VP”表示是否排除掩码补丁作为有效补丁,“SW”表示空间窗口约束,“MR”表示仅重构掩码区域。
组件 指标
TL VP SW MR PSNR↑ SSIM↑ LPIPS↓
29.36 0.8920 0.1426 ✓ 30.73 0.9171 0.1149 ✓ ✓ 30.78 0.9228 0.1093 ✓ ✓ ✓ 31.47 0.9197 0.1070 ✓ ✓ ✓ ✓ 31.56 0.9202 0.1001
模型性能的提升。排除掩码区域(VP)带来了轻微的进一步增强。引入空间窗口(SW)显著提升了模型的有效性。最后,仅重构掩码区域(MR)实现了最佳的模型性能。这些消融实验证明了每个设计步骤的合理性和有效性。为了验证 SGFP 生成的潜在变量确实包含有意义的背景信息,我们额外训练了一个诊断解码器。该解码器仅用于可视化。如图 9(c) 所示,我们的伪草稿呈现出块状填充,因为它们是从许多补丁潜在变量中学习得到的。尽管与图 9(b) 中的草稿相比视觉粗糙,但这一解码结果表明 SGFP 成功捕捉到了关键的背景色调和结构,这足以作为有效的先验信息。 三阶段蒸馏框架的研究。为了验证三阶段框架的有效性,我们进行了如表 6 所示的实验。如表所示,当教师网络为 LDM 时取得的性能不如以 D2DF-DG 为教师网络时获得的性能。这表明经过训练的 D2DF-DG 模型能够提供比扩散 D-LDM 更稳定且一致解轨迹。此外,CD 与 PPCD 之间的比较也证明了 PPCD 方法的优越性。
4.5 失败案例分析
在本节中,我们将讨论模型未能移除物体的案例,并分析这些失败的原因。我们观察到,当视频中存在多个物体且这些物体表现出动态且复杂的遮挡关系时,模型
第 15 页
从有草稿到无草稿 15
原始 ProPainter D2DF-DG( ours)
(a) 真实标签 (b) 草稿 (c) 伪草稿 掩码 Minimax-Remover D2DF-DF( ours)
图 10: 失败案例分析。图 9: 草稿与伪草稿的可视化。 当物体间存在复杂遮挡时,对物体移除模型在复杂遮挡情况下会失败。 移除模型会失败。(a) 真实标签。(b) 带有伪影的草稿。(c) 来自解码器的伪草稿。
表 6: 我们三阶段框架用于获得 D2DF-DF 的消融研究。“CD”表示一致性蒸馏 [39]。通过使用 PPCD 对 D2DF-DG 进行蒸馏,取得了最佳结果。
训练设置 指标
学生模型 教师模型 CD PPCD PSNR↑ SSIM↑ LPIPS↓ D-LDM ✓ 31.3268 0.9179 0.1025 D-LDM ✓ 31.4484 0.9197 0.1014 D2DF-DF D2DF-DG ✓ 31.3257 0.9173 0.1036 D2DF-DG ✓ 31.5646 0.9202 0.1001
无法完全重建被遮挡的物体。如图 10 所示,我们比较了最先进的基于光流的方法 ProPainter [65] 和基于扩散模型的最先进方法 MiniMax-Remover [66]。结果表明,在这一个例子中,这两种方法都无法完全恢复被遮挡的“海豚”。我们的两个模型 D2DF-DG 和 D2DF-DF 在单步推理设置下也产生了不完美的结果。然而,与 MiniMax-Remover 相比,它们保留了显著更多的上下文信息。这也证明了我们的方法的优越性。
5 结论
在本文中,我们提出了 D2DF,这是一个统一的框架,它从有草稿引导的扩散教师模型逐步演变为完全无草稿的单步视频物体移除模型。通过引入特权一致性蒸馏(PPCD),我们有效地稳定了蒸馏过程并实现了高质量的单步生成。此外,提出的自引导快速植入(SGFP)模块通过在潜在空间中直接生成场景一致的伪草稿,消除了对外部草稿输入的依赖。我们的方法不仅在视觉质量和时间一致性方面表现出色,而且实现了显著的效率提升。然而,单步去噪在某些场景中产生的模糊现象是未来工作中需要改进的地方。
致谢。Zizhao Chen 和 Ping Wei 感谢国家自然科学基金(No. U23B2060, No. 62495092)的支持。Mengmeng Wang 感谢国家自然科学基金(No. 62403429)的支持。我们还感谢中国国家电网 SGIT AI Lab 提供的计算资源。
第 16 页
16 Z. Chen 等
参考文献
1. Bertalmio, M., Bertozzi, A.L., Sapiro, G.: Navier-stokes, fluid dynamics, and image and video inpainting. In: Proceedings of the 2001 IEEE Computer Society Conference on Com- puter Vision and Pattern Recognition. CVPR 2001. vol. 1, pp. I–I. IEEE (2001) 2. Bian, Y., Zhang, Z., Ju, X., Cao, M., Xie, L., Shan, Y., Xu, Q.: Videopainter: Any-length video inpainting and editing with plug-and-play context control. In: Proceedings of the Spe- cial Interest Group on Computer Graphics and Interactive Techniques Conference Confer- ence Papers. pp. 1–12 (2025) 3. Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y., English, Z., Voleti, V., Letts, A., et al.: Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127 (2023) 4. Blattmann, A., Rombach, R., Ling, H., Dockhorn, T., Kim, S.W., Fidler, S., Kreis, K.: Align your latents: High-resolution video synthesis with latent diffusion models. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 22563–22575 (2023) 5. Brooks, T., Peebles, B., Holmes, C., DePue, W., Guo, Y., Jing, L., Schnurr, D., Taylor, J., Luhman, T., Luhman, E., et al.: Video generation models as world simulators. OpenAI Blog 1(8), 1 (2024) 6. Dhariwal, P., Nichol, A.: Diffusion models beat gans on image synthesis. Advances in neural information processing systems 34, 8780–8794 (2021) 7. Ding, D., Pan, Y., Feng, R., Dai, Q., Qiu, K., Bao, J., Luo, C., Chen, Z.: Homogen: Enhanced video inpainting via homography propagation and diffusion. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 22953–22962 (2025) 8. Ebdelli, M., Le Meur, O., Guillemot, C.: Video inpainting with short-term windows: appli- cation to object removal and error concealment. IEEE Transactions on Image Processing 24(10), 3034–3047 (2015) 9. Gao, C., Saraf, A., Huang, J.B., Kopf, J.: Flow-edge guided video completion. In: European Conference on Computer Vision. pp. 713–729. Springer (2020) 10. Geng, Z., Pokle, A., Luo, W., Lin, J., Kolter, J.Z.: Consistency models made easy. arXiv preprint arXiv:2406.14548 (2024) 11. Gu, B., Luo, H., Guo, S., Dong, P.: Advanced video inpainting using optical flow-guided efficient diffusion. arXiv e-prints pp. arXiv–2412 (2024) 12. Gu, B., Luo, H., Guo, S., Dong, P., Zhou, Q.: Coherent video inpainting using optical flow- guided efficient diffusion. arXiv preprint arXiv:2412.00857 (2024) 13. Ho, J., Chan, W., Saharia, C., Whang, J., Gao, R., Gritsenko, A., Kingma, D.P., Poole, B., Norouzi, M., Fleet, D.J., et al.: Imagen video: High definition video generation with diffusion models. arXiv preprint arXiv:2210.02303 (2022) 14. Hore, A., Ziou, D.: Image quality metrics: Psnr vs. ssim. In: 2010 20th international confer- ence on pattern recognition. pp. 2366–2369. IEEE (2010) 15. Jin, W., Dai, Q., Luo, C., Baek, S.H., Cho, S.: Flovd: Optical flow meets video diffusion model for enhanced camera-controlled video synthesis. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 2040–2049 (2025) 16. Kim, D., Woo, S., Lee, J.Y., Kweon, I.S.: Deep video inpainting. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 5792–5801 (2019) 17. Lai, W.S., Huang, J.B., Wang, O., Shechtman, E., Yumer, E., Yang, M.H.: Learning blind video temporal consistency. In: Proceedings of the European conference on computer vision (ECCV). pp. 170–185 (2018) 18. Lee, M., Cho, S., Shin, C., Lee, J., Yang, S., Lee, S.: Video diffusion models are strong video inpainter. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 39, pp. 4526–4533 (2025)
第 17 页
从草稿到无草稿 17
19. Lee, S., Oh, S.W., Won, D., Kim, S.J.: Copy-and-paste networks for deep video inpainting. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 4413– 4421 (2019) 20. Li, X., Xue, H., Ren, P., Bo, L.: Diffueraser: A diffusion model for video inpainting. arXiv preprint arXiv:2501.10018 (2025) 21. Li, Z., Lu, C.Z., Qin, J., Guo, C.L., Cheng, M.M.: Towards an end-to-end framework for flow-guided video inpainting. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 17562–17571 (2022) 22. Liu, D., Wang, W., Li, C., Lyu, J.: From understanding to erasing: Towards complete and stable video object removal. arXiv preprint arXiv:2604.01693 (2026) 23. Liu, R., Deng, H., Huang, Y., Shi, X., Lu, L., Sun, W., Wang, X., Dai, J., Li, H.: Fuseformer: Fusing fine-grained information in transformers for video inpainting. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 14040–14049 (2021) 24. Lu, C., Song, Y.: Simplifying, stabilizing and scaling continuous-time consistency models. arXiv preprint arXiv:2410.11081 (2024) 25. Lu, C., Zhou, Y., Bao, F., Chen, J., Li, C., Zhu, J.: Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps. Advances in neural information processing systems 35, 5775–5787 (2022) 26. Luo, S., Tan, Y., Huang, L., Li, J., Zhao, H.: Latent consistency models: Synthesizing high- resolution images with few-step inference. arXiv preprint arXiv:2310.04378 (2023) 27. Luo, S., Tan, Y., Patil, S., Gu, D., von Platen, P., Passos, A., Huang, L., Li, J., Zhao, H.: Lcm- lora: A universal stable-diffusion acceleration module. arXiv preprint arXiv:2311.05556 (2023) 28. Meng, C., Rombach, R., Gao, R., Kingma, D., Ermon, S., Ho, J., Salimans, T.: On distillation of guided diffusion models. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 14297–14306 (2023) 29. Miao, C., Feng, Y., Zeng, J., Gao, Z., Liu, H., Yan, Y., Qi, D., Chen, X., Wang, B., Zhao, H.: Rose: Remove objects with side effects in videos. arXiv preprint arXiv:2508.18633 (2025) 30. Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 4195–4205 (2023) 31. Perazzi, F., Pont-Tuset, J., McWilliams, B., Van Gool, L., Gross, M., Sorkine-Hornung, A.: A benchmark dataset and evaluation methodology for video object segmentation. In: Pro- ceedings of the IEEE conference on computer vision and pattern recognition. pp. 724–732 (2016) 32. Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., Müller, J., Penna, J., Rom- bach, R.: Sdxl: Improving latent diffusion models for high-resolution image synthesis. arXiv preprint arXiv:2307.01952 (2023) 33. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image syn- thesis with latent diffusion models. In: Proceedings of the IEEE/CVF conference on com- puter vision and pattern recognition. pp. 10684–10695 (2022) 34. Sagong, M.C., Yeo, Y.J., Jung, S.W., Ko, S.J.: Rord: A real-world object removal dataset. In: BMVC. p. 542 (2022) 35. Salimans, T., Ho, J.: Progressive distillation for fast sampling of diffusion models. arXiv preprint arXiv:2202.00512 (2022) 36. Sauer, A., Lorenz, D., Blattmann, A., Rombach, R.: Adversarial diffusion distillation. In: European Conference on Computer Vision. pp. 87–103. Springer (2024) 37. Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020) 38. Song, Y., Dhariwal, P.: Improved techniques for training consistency models. arXiv preprint arXiv:2310.14189 (2023)
第 18 页
18 Z. Chen 等
39. Song, Y., Dhariwal, P., Chen, M., Sutskever, I.: Consistency models. In: Proceedings of the 40th International Conference on Machine Learning. pp. 32211–32252 (2023) 40. Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., Poole, B.: Score- based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456 (2020) 41. Tang, N.C., Hsu, C.T., Su, C.W., Shih, T.K., Liao, H.Y.M.: Video inpainting on digitized vintage films via maintaining spatiotemporal continuity. IEEE Transactions on Multimedia 13(4), 602–614 (2011) 42. Wang, C., Huang, H., Han, X., Wang, J.: Video inpainting by jointly learning temporal struc- ture and spatial details. In: Proceedings of the AAAI conference on artificial intelligence. vol. 33, pp. 5232–5239 (2019) 43. Wang, T.C., Liu, M.Y., Zhu, J.Y., Liu, G., Tao, A., Kautz, J., Catanzaro, B.: Video-to-video synthesis. arXiv preprint arXiv:1808.06601 (2018) 44. Wang, X., Yuan, H., Zhang, S., Chen, D., Wang, J., Zhang, Y., Shen, Y., Zhao, D., Zhou, J.: Videocomposer: Compositional video synthesis with motion controllability. Advances in Neural Information Processing Systems 36, 7594–7611 (2023) 45. Wang, Y., Bao, J., Weng, W., Feng, R., Yin, D., Yang, T., Zhang, J., Dai, Q., Zhao, Z., Wang, C., et al.: Microcinema: A divide-and-conquer approach for text-to-video generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 8414–8424 (2024) 46. Wang, Z., Wang, J., Li, X., Li, Y.L., Lu, Y., Wang, S.: Unsupervised temporal correspondence learning for unified video object removal. IEEE Transactions on Image Processing (2023) 47. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: Image quality assessment: from er- ror visibility to structural similarity. IEEE transactions on image processing 13(4), 600–612 (2004) 48. Wei, Y., Zhang, S., Qing, Z., Yuan, H., Liu, Z., Liu, Y., Zhang, Y., Zhou, J., Shan, H.: Dreamvideo: Composing your dream videos with customized subject and motion. In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 6537–6549 (2024) 49. Weng, W., Feng, R., Wang, Y., Dai, Q., Wang, C., Yin, D., Zhao, Z., Qiu, K., Bao, J., Yuan, Y., et al.: Art-v: Auto-regressive text-to-video generation with diffusion models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 7395–7405 (2024) 50. Wu, J.Z., Ge, Y., Wang, X., Lei, S.W., Gu, Y., Shi, Y., Hsu, W., Shan, Y., Qie, X., Shou, M.Z.: Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 7623–7633 (2023) 51. Wu, J., Li, X., Si, C., Zhou, S., Yang, J., Zhang, J., Li, Y., Chen, K., Tong, Y., Liu, Z., et al.: Towards language-driven video inpainting via multimodal large language models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 12501–12511 (2024) 52. Xing, J., Xia, M., Zhang, Y., Chen, H., Yu, W., Liu, H., Liu, G., Wang, X., Shan, Y., Wong, T.T.: Dynamicrafter: Animating open-domain images with video diffusion priors. In: Euro- pean Conference on Computer Vision. pp. 399–417. Springer (2024) 53. Xing, Z., Dai, Q., Hu, H., Wu, Z., Jiang, Y.G.: Simda: Simple diffusion adapter for efficient video generation. In: Proceedings of the IEEE/CVF conference on computer vision and pat- tern recognition. pp. 7827–7839 (2024) 54. Xu, N., Yang, L., Fan, Y., Yang, J., Yue, D., Liang, Y., Price, B., Cohen, S., Huang, T.: Youtube-vos: Sequence-to-sequence video object segmentation. In: Proceedings of the Eu- ropean conference on computer vision (ECCV). pp. 585–601 (2018)
第 19 页
从有草稿到无草稿 19
55. Xu, R., Li, X., Zhou, B., Loy, C.C.: Deep flow-guided video inpainting. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 3723–3732 (2019) 56. Yang, Z., Teng, J., Zheng, W., Ding, M., Huang, S., Xu, J., Yang, Y., Hong, W., Zhang, X., Feng, G., et al.: Cogvideox: Text-to-video diffusion models with an expert transformer. arXiv preprint arXiv:2408.06072 (2024) 57. Yoon, J., Yu, S., Bansal, M.: RACCooN: Versatile instructional video editing with auto- generated narratives. In: Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. pp. 27960–27996. Association for Computational Linguistics (2025) 58. Zeng, Y., Wei, G., Zheng, J., Zou, J., Wei, Y., Zhang, Y., Li, H.: Make pixels dance: High- dynamic video generation. In: Proceedings of the IEEE/CVF Conference on Computer Vi- sion and Pattern Recognition. pp. 8850–8860 (2024) 59. Zeng, Y., Fu, J., Chao, H.: Learning joint spatial-temporal transformations for video inpaint- ing. In: European conference on computer vision. pp. 528–543. Springer (2020) 60. Zhang, K., Fu, J., Liu, D.: Flow-guided transformer for video inpainting. In: European con- ference on computer vision. pp. 74–90. Springer (2022) 61. Zhang, K., Fu, J., Liu, D.: Inertia-guided flow completion and style fusion for video inpaint- ing. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recogni- tion. pp. 5982–5991 (2022) 62. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.: The unreasonable effectiveness of deep features as a perceptual metric. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 586–595 (2018) 63. Zhang, R., Li, W., Wang, P., Guan, C., Fang, J., Song, Y., Yu, J., Chen, B., Xu, W., Yang, R.: Autoremover: Automatic object removal for autonomous driving videos. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 34, pp. 12853–12861 (2020) 64. Zheng, H., Nie, W., Vahdat, A., Azizzadenesheli, K., Anandkumar, A.: Fast sampling of diffusion models via operator learning. In: International conference on machine learning. pp. 42390–42402. PMLR (2023) 65. Zhou, S., Li, C., Chan, K.C., Loy, C.C.: Propainter: Improving propagation and transformer for video inpainting. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 10477–10486 (2023) 66. Zi, B., Peng, W., Qi, X., Wang, J., Zhao, S., Xiao, R., Wong, K.F.: Minimax-remover: Taming bad noise helps video object removal. arXiv preprint arXiv:2505.24873 (2025)