OSVE:基于单步扩散模型的一步视频编辑

三分钟导读:OSVE提出了一种针对单步扩散模型的视频编辑框架,通过可学习的单步反转编码器和统一帧编辑机制,解决了速度与质量难以兼得的难题,实现了比现有最快方法快155-171倍的实时编辑。

英文题目:OSVE: One Step Video Editing with One Step Diffusion Models

论文出处:arXiv 每日论文精选 · arXiv:2607.19895

原始论文:PDF / 论文页面

对应视频标题:OSVE:基于单步扩散模型的一步视频编辑|推荐指数:★★★★★

这篇论文解决什么问题?

现有文本引导视频编辑方法依赖多步采样和反转,计算成本极高,无法用于实时应用;直接应用单步模型会导致反转-生成不匹配、结构坍塌和时序不一致。

核心创新

  • 首个针对单步扩散模型设计的One-to-One视频编辑框架。
  • 提出结构感知编辑(SAE)损失,通过训练反转编码器在单步内保持结构完整性,解决“过度转向”问题。
  • 提出统一帧编辑(UFE),通过拼接帧潜在变量实现全局自注意力,确保时序一致性。
  • 基于DINO特征的锚点选择与滑动窗口策略,平衡长视频编辑的全局一致性与局部连贯性。

方法概览

OSVE采用One-to-One框架:(1) 训练一个可学习的反转编码器,使用结构感知编辑(SAE)损失和提示扰动数据集,将源视频结构编码到初始噪声中;(2) 提出统一帧编辑(UFE),将多帧潜在变量拼接以启用跨帧注意力;(3) 使用基于锚点的滑动窗口策略处理长视频。

逐图理解论文

方法概述:OSVE框架

方法概述:OSVE框架
Fig. 2: Overview of our OSVE framework for one-step video editing. (a) Training: We train an inversion encoder using a novel dataset of structurally aligned image pairs generated via Prompt Perturbation. The encoder learns to predict an ini- tial noise that supports both faithful reconstruction and structure-aware editing. (b) Inference: Our Unified-Frame Editing (UFE) method inverts all video frames, concate- nates their latents into a single map, and processes them in one pass. This enables cross-frame attention, ensuring temporal consistency. An anchor-based sliding window scales the approach to long videos while maintaining global coherence.

OSVE提出了一种One-to-One视频编辑框架,旨在通过单步推理实现快速且一致的视频编辑。该方法核心在于训练一个可学习的反转编码器,并结合统一帧编辑机制。通过这一设计,OSVE能够在保持源视频结构完整性的同时,高效执行文本引导的编辑任务。

核心创新:可学习反转编码器

核心创新:可学习反转编码器
Fig. 4: Comparison of structure-preserving methods for one-step editing. (a) Our method, trained with the proposed Lsae, maintains structural integrity. (d) With- out Lsae, our model fails, leading to structural collapse. (b, c, e, f) Similarly, existing control methods often produce degraded results, demonstrating their unsuitability for one-step generation. SA and CA denote the replacement of self-attention and cross- attention, respectively.

OSVE的关键创新之一是可学习的反转编码器。传统方法依赖预定义的反转过程,而OSVE通过结构感知编辑损失训练编码器,使其能将源视频结构编码到初始噪声中。这种设计有效解决了单步生成中的过度转向问题,确保编辑后的结构忠实于原视频。

机制详解:统一帧编辑

机制详解:统一帧编辑
Fig. 5: Mechanism of Unified-Frame Editing for Temporal Consistency. (a) Frame-Wise Editing: Processing frames individually restricts attention to within each frame, preventing information sharing and causing temporal incoherence. (b) Unified- Frame Editing (UFE): Our method concatenates all frame latents, allowing the atten- tion mechanism to operate globally. This enables features to be matched and aligned across all frames, enforcing temporal consistency throughout the edit.

为解决时序不一致问题,OSVE提出了统一帧编辑机制。该方法将所有帧的潜在变量拼接成一个单一映射,并在此全局映射上执行自注意力操作。通过跨帧信息交互,UFE确保了编辑过程中特征的对齐,从而在整段视频中维持严格的时序一致性。

实验设置与基线对比

实验设置与基线对比
Table 2: Performance comparison on short (20 frames) videos.

我们在20帧短视频和90帧长视频上评估了OSVE,对比了Multi-to-Multi如RAVE和TokenFlow,以及Multi-to-One基线。使用VBench指标进行定量评估,包括结构一致性、背景保留和时序流畅度等,并进行了包含26名参与者的用户研究。

用户研究与定性分析

用户研究与定性分析
Table 4: User study results. TC: Temporal Consistency, VQ: Visual Quality (higher is better).

用户研究中,OSVE在时序一致性和视觉质量上均获得最高分,TC为3.85,VQ为3.65。定性比较显示,OSVE能成功修改对象并保留其底层结构,而Multi-to-One基线常出现结构坍塌。OSVE在对象替换、身份修改和艺术风格迁移等任务中表现出色。

实验与关键结果

  • 在20帧短视频和90帧长视频上评估,对比Multi-to-Multi(如RAVE, TokenFlow)和Multi-to-One基线。
  • 使用VBench指标(SC, BC, TF, MS, AQ, IQ, BQS)进行定量评估。
  • 进行26名参与者的用户研究,评估时序一致性(TC)和视觉质量(VQ)。
  • 消融实验验证SAE损失、UFE机制、滑动窗口大小及锚点策略的有效性。
  • OSVE在20帧视频上达到BQS 0.679,FPS 15.625,比RAVE快约171倍(第 11 页)
  • OSVE在90帧视频上达到BQS 0.677,FPS 15.793,比RAVE快约155倍(第 11 页)
  • 用户研究中OSVE在TC (3.85) 和 VQ (3.65) 上均获得最高分(第 14 页)
  • 反转编码器在PIE-Bench上结构距离降至0.064,CLIP Edit得分提升至20.416(第 14 页)

阅读时需要注意

  • 当前基于单步T2I模型(DMD2),单步T2V模型质量尚不足以支持可靠编辑。
  • UFE处理长视频时显存需求随帧数增加,需依赖滑动窗口策略。
  • AQ指标在应用UFE时有轻微下降(约0.01),虽可接受但存在权衡。
  • 单步模型对控制信号敏感,传统多步控制方法(如ControlNet)在单步下易导致结构坍塌。
  • 反转编码器训练需确保目标图像与生成器分布对齐,否则会导致梯度不一致。

关联工作

  • RAVE:作为Multi-to-Multi基线,OSVE比其快155-171倍且质量相当或更优(第 11 页)
  • TokenFlow:作为Multi-to-Multi基线,OSVE在时序一致性和速度上显著优于它(第 11 页)
  • DMD2:作为OSVE使用的单步T2I骨干模型(第 2 页)
  • ControlNet:作为Multi-to-One基线,在单步设置下表现不佳,证明OSVE的必要性(第 11 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

OSVE:基于单步扩散模型的单步视频编辑

Habin Lim 和 Gyeong-Moon Park ⋆

韩国首尔高丽大学 {ha001211,gm-park}@korea.ac.kr

摘要。基于扩散模型的文本引导视频编辑因昂贵的多步采样和反演而变得不切实际地缓慢。我们提出了 OSVE,这是第一个成功将单步文本到图像(T2I)模型适配用于高质量视频编辑的框架,解决了反演、可编辑性和时间一致性这三个核心挑战。为了绕过缓慢的迭代反演,我们训练了一个可学习的编码器,它能在单次前向传播中预测每一帧的初始噪声。该编码器在一个精心构建的包含2026对结构对齐图像对的数据集上,通过一种新颖的结构感知编辑(SAE)损失进行训练,从而教导其保留源视频的几何结构并实现编辑。为了促进时间连贯性,我们引入了一种统一帧编辑(UFE)技术,它将帧潜变量连接起来,以便在单次生成步骤中实现跨帧注意力。此外,对于长视频,我们采用带有锚点帧的滑动窗口策略来维持全局一致性。我们广泛的实验表明,OSVE 在编辑质量上达到或优于最先进的多步方法,同时运行速度提高了约 155–171 倍。这一突破为实用、实时的视频编辑应用铺平了道路。代码可在 https://github.com/KU-VGI/OSVE 获取。[cs.CV]

1 引言

文本引导视频编辑,即根据自然语言指令修改源视频的视觉内容,在内容创作、电影制作和交互式媒体中日益重要。最近的生成式扩散模型,涵盖文本到图像(T2I)[13,45,52,55] 和文本到视频(T2V)[1,11,20,40,60] 架构,使得仅从文本生成照片级真实且时间连贯的视觉内容成为可能。在这些强大的骨干网络基础上,越来越多的工作通过在扩散过程中进行干预,执行免训练、零样本的视频编辑 [6,9,15,17,29,61–63]。这些方法通常遵循两阶段流水线:(i) 通过多步反演 [36,53] 反演源视频以恢复其潜变量轨迹,以及 (ii) 在修改后的文本提示下重新运行扩散过程以生成编辑后的帧,通常结合跨帧注意力控制 [12,59] 以保留空间结构和时间布局。arXiv:2607.19895v1 尽管这些方法实现了编辑质量,但它们继承了一个关键瓶颈:极高的计算成本。因为每一帧都必须被处理

⋆ 通讯作者。

第 2 页

2 H. Lim and G.-M. Park

图 1: 三种文本引导视频编辑框架。(a) 多对多 (Multi-to-Multi):标准方法能产生高质量编辑,但速度不切实际地慢。(b) 多对一 (Multi-to-One):朴素地采用单步扩散模型会产生退化、时间上不一致的输出。(c) 一对一 (One-to-One, 本文方法):我们提出的框架使用可学习的单步编码器,以实现快速、时间一致且高质量的视频编辑,从而解决了速度-质量权衡问题。

经过数十到数百个去噪步骤,实际运行时间(wall-clock time)与帧数和步骤数均成正比。例如,RAVE [17] 据报道是最快的基于文本到图像 (T2I) 的编辑方法之一,但仍需要约 24 小时来编辑一段 5 分钟、30 FPS 的视频¹。文本到视频 (T2V) 骨干网络集成了重量级的时间注意力模块,需要更多的资源。这种极端的延迟使得当前方法对于实时或流媒体风格的应用 [64] 来说不切实际。

为了克服这一瓶颈,我们转向单步生成范式。单步扩散模型 [7,31,39,68,69] 是从多步教师模型蒸馏而来的,在图像质量方面已达到具有竞争力甚至更优的水平,但其在视频编辑方面的潜力尚未得到探索。通过将这种超快模式适应到视频领域,我们构建了一个“一对一” (One-to-One) 编辑框架(单步反演后接单步生成),用单次前向传播替换了昂贵的迭代去噪循环。我们在公开发布的单步 T2I 骨干网络 (DMD2 [68]) 上实例化并验证了我们的框架,以证明其在当今最易获取的单步生成器上的有效性。

然而,直接将单步扩散模型应用于视频编辑面临三个关键挑战(见图 1(b)):

(i) 反演-生成不匹配 (Inversion–generation mismatch)。传统的多步反演 [53] 既耗时,又从根本上不适合单步生成器。由于反演遵循多步轨迹,而生成器执行直接映射,前向路径与反向路径之间的不匹配会导致严重的信息丢失,产生模糊和退化的结果。

(ii) 单步控制下的结构崩溃 (Structural collapse under single-step control)。在改变外观(例如变为熊)的同时保留源视频的空间结构(例如狼的旋转头部)对于忠实编辑至关重要。我们经验性地发现,现有的结构保持方法,如 Prompt-to-Prompt [12] 和 Con-

¹ 在单个 NVIDIA RTX 6000 Ada GPU 上,分辨率为 512 × 512 时测量。

第 3 页

OSVE:基于单步扩散模型的单步视频编辑 3

当被限制在单步操作时,ControlNet [73] 会失效。与多步过程不同,在多步过程中控制信号分布在各个步骤中并逐渐被吸收,单步模型将相同的信号集中到单次传递中,没有纠错的空间,导致信号主导而非引导输出,我们将这种现象称为“过度转向”(over-steering)。

(iii) 时间不一致性。单步文本到图像(T2I)扩散模型本身并不编码时间信息,导致应用于视频时出现闪烁或帧间不连续。现有的时间一致性技术,包括注意力微调 [63]、跨帧注意力控制 [6, 29, 42, 61] 以及跨采样步骤的噪声重排 [17],都依赖于多步结构,因此与单步模式不兼容。

为了解决这些挑战,我们提出了 OSVE(One-Step Video Editing,单步视频编辑),这是一个专为单步生成设计的“一对一”视频编辑框架。针对反演-生成不匹配问题,OSVE 的核心是一个可学习的视频编码器,它由预训练的 U-Net 初始化,以继承生成器潜在空间的强大先验,用单次前向传递取代缓慢的多步反演。针对结构坍塌问题,我们引入了结构感知编辑(Structure-Aware Editing, SAE)损失,训练编码器在修改后的文本提示下产生内在保持结构完整性的潜在变量,从而消除了在单步中失效的外部引导的需求。通过对多样化的编辑对进行训练,编码器学习了结构感知的潜在表示,在允许外观变化的同时保持源图像的布局(图 1(c))。针对时间不一致性,我们提出了统一帧编辑(Unified-Frame Editing, UFE),它将连续帧的反演潜在变量拼接成单个统一张量,使模型的自注意力能够在单次传递中对齐跨帧特征。结合用于局部一致性的滑动窗口策略和用于长期稳定性的锚点帧选择,UFE 确保了短期和长期的时间一致性。

总之,我们的主要贡献如下:

– 我们提出了 OSVE,这是第一个面向单步扩散模式的“一对一”视频编辑框架,用可学习的单次传递编码器取代了多步反演。

– 我们提出了一种结构感知编辑(SAE)损失,直接将结构保持注入到反演阶段,缓解了单步控制中固有的过度转向问题。

– 我们引入了统一帧编辑(UFE),通过带有滑动窗口和锚点帧的统一潜在处理来强制时间一致性,确保短期和长期的一致性。

– 大量实验表明,OSVE 实现了亚秒级延迟,比之前最快的方法快约 155–171 倍,同时提供相当或更优的视觉质量,实现了实用的实时视频编辑。

第 4 页

4 H. Lim 和 G.-M. Park

2 相关工作

基于扩散模型的文本引导视频编辑。建立在图像级生成编辑的进展之上,包括 GAN 反演 [37, 38, 44, 58] 和基于扩散的操控 [3,12,24,36],许多零样本技术被提出以将此类能力扩展到视频领域,同时保持时间一致性。这些技术包括融合注意力图 [41]、传播 token 特征 [9,61]、使用光流引导 [6] 以及打乱噪声 [17]。虽然这些方法显著提高了视频的一致性,但它们都在多步采样框架内运行。这种迭代性质意味着操作需要在众多步骤中对每一帧重复执行,导致运行时间过长,难以接受。这种计算成本仍然是一个关键障碍,这也激励了我们开展高质量单步视频编辑的研究。

单步扩散模型。为了克服迭代扩散采样的显著延迟,一条主要的研究路线专注于将多步教师模型蒸馏为高效的一步或几步生成器。Progressive Distillation(渐进式蒸馏)和 Consistency Models(一致性模型)等方法推进了这一范式,其潜在变量变体(LCM/LCM-LoRA)实现了针对 Stable Diffusion 的 2–8 步生成 [34,47,54]。后续工作进一步改进了这一方法。Rectified Flow(整流流)及其后继者 InstaFlow 通过基于重新采样的蒸馏(reflow-based distillation)拉直概率流轨迹,从而在单步内实现 SD 级别的生成质量 [30,31]。其他策略,如对抗性扩散蒸馏(例如 SDXL-Turbo、SDXL-Lightning)以及各种分布匹配技术(例如 DMD、SwiftBrush),将教师监督与 GAN 损失或新颖的蒸馏目标相结合,仅需 1–4 步即可实现高质量合成 [7,25,39,48,68,69]。这些单步模型彻底改变了图像生成的速度,但这一进展仅限于图像领域。这造成了一个关键缺口和重大机遇,因为视频编辑领域迫切需要此类加速。我们的工作首次填补了这一空白,引入了必要的机制以成功将这些快速生成器适配于视频任务,从而释放其在实际高速应用中的潜力。

3 OSVE:单步视频编辑

我们提出了 OSVE,这是一个基于两个核心思想的单步视频编辑框架:(i) 将源结构编码到初始噪声潜在变量中,使得单次前向传播的生成器无需迭代控制即可保留该结构;(ii) 通过让所有帧通过统一注意力机制共享上下文来强制时间一致性。第 3.1 节通过结构感知反演编码器(使用专用编辑损失进行训练)阐述了第一个思想。第 3.2 节介绍了用于第二个思想的统一帧编辑(UFE),以及将其扩展到长视频的滑动窗口和基于锚点的方案。图 2 展示了该框架的概览。

第 5 页

OSVE:基于单步扩散模型的单步视频编辑 5

(a) 结构感知单步反演(§3.1) (a.1) 数据集生成 (a.2) 训练反演编码器 DB 重建 重建损失 “一张照片 Gω

$$ \frac{a6fHJFLNRwYIlczM6tABkYRqcxvbHMFbXPkvNE5KXrlUrnFyiXMlIcDOIRj8OAUKnANVagDBYR7eIQn69Z6sJ6tl1lpzpr37MvWa/fKY2QLw=}{\text{latexit}} \quad \text{c} \quad \text{Generate} \quad \text{of} \quad \text{a} \quad \text{dog} \quad \text{”} \quad \frac{ANVagDBYR7eIQn69Z6sJ6tl1lpzpr37MvWa/fKY2QLw=}{\text{latexit}} \quad \text{c} \quad G_{\omega} \quad \text{Source} \quad \text{Image} $$

$$ \rightarrow N(0, 1) \quad \text{Source} \quad \text{Recon.} \quad \text{Recon.} \quad \text{Source} \quad \text{Target} \quad \text{Target} \quad \text{Reconstructed} $$

$$ \text{Input} \quad \xrightarrow{\text{Structurally Similar}} \quad I_{\omega} \quad \xrightarrow{\text{Inverted Sampling}} \quad \frac{kbc+Nns3gk5tUqfhLG2pZDM1N8TGY2MGUeB7YwoDs2iNxX/8zophld+JlSIldsvihMJcGYTJ8nfaE5Qzm2hDIt7K2EDamDG1ERuCt/jyMmeV7xqpXp/Ua5d53EU4BhO4Aw8uIQa3EdGsBAwjO8wpvz6Lw4787HvHXFyWeO4A+czx/xOY/t}{\text{latexit}} \quad G_{\omega} $$

ANVagDBYR7eIQn69Z6sJ6tl1lpzpr37MvWa/fKY2QLw=</latexit>c cedit Gω cedit Edited Image ANVagDBYR7eIQn69Z6sJ6tl1lpzpr37MvWa/fKY2QLw=</latexit>c Edited Edited EditEdit TargetTarget Structure-Aware Editing Loss ωnoiseω →N(0,· 1)ε (b) Unified-Frame Editing (§3.2) Input Video Structure-Aware Inversion ⚓ Inference with Sliding Window Attention Sharing Trimming Output Video K K padded 1 2 … K-1 K padded Gω ⚓ padded 1 2 K … ⃜⃜ 2 2 Inverse ⚓ w = 3 stride = 1 Tiger ⃜2 Concat. padded 11 22 …… K-1 K padded 1 1 Gω ⚓ 1 2 3 1 Iω Tiger Padding ⚓ V0K Select Anchor ˆVTK … padded 1 2 … K-1K-1 KK K-1paddedpadded Gω ⚓ … K padded ˆV0Kedit DINO ⚓ Anchor K Frames Tiger 1 2 … K

图 2:我们 OSVE 单步视频编辑框架的概览。(a) 训练:我们使用通过提示扰动(Prompt Perturbation)生成的结构对齐图像对的新颖数据集来训练反演编码器。该编码器学习预测初始噪声,以支持忠实重建和结构感知编辑。(b) 推理:我们的统一帧编辑(UFE)方法对所有视频帧进行反演,将其潜在变量拼接成单个映射,并一次性处理。这实现了跨帧注意力,确保了时间一致性。基于锚点的滑动窗口使该方法能够扩展到长视频,同时保持全局连贯性。

3.1 结构感知单步反演

最近的单步扩散模型极大地加速了图像和视频生成,但其在编辑领域的应用仍然受到严重限制。核心难点在于结构保持:编辑应在仅修改预期语义的同时,保持源图像的空间布局、物体姿态和几何关系。从最初开始,结构保持就是基于扩散模型的编辑中的核心关注点,因为诸如 Prompt-to-Prompt (P2P) [12]、ControlNet [73] 和 PnP [59] 等方法主要设计用于在语义修改期间保持源结构完整。如果没有结构保持,编辑会出现空间错位和时间不一致(图 1(b)),无论其语义质量如何,实际上都无法使用。虽然多步扩散模型主要通过迭代反演和控制在很大程度上解决了这一问题,但单步模型缺乏此类机制,使得结构保持成为在单步编辑变得实用之前必须解决的核心瓶颈。

为了理解为什么现有的解决方案无法迁移,让我们考虑它们如何在多步设置中工作。DDIM 反演 [53] 逆向追踪去噪轨迹以恢复近似重建源图像的潜在变量,上述编辑技术随后在此轨迹的选定步骤上进行干预。关键在于,这些方法依赖于过程的迭代性质:每个去噪步骤提供一个校正反馈回路,吸收由控制信号引入的小扰动,逐渐引导生成过程,同时保持结构完整。然而,单步模型将整个

第 6 页

6 H. Lim and G.-M. Park

轨迹整合为单次前向传播,这带来了两个耦合的困难。首先,不存在可逆向的多步轨迹,因此标准的 DDIM 风格反演方法不再适用。其次,更根本的是,迭代控制机制失去了其依赖的校正循环。在迭代生成中,控制信号分布在多个去噪步骤中,每一步仅施加微小的扰动,后续步骤可以吸收并校正这些扰动。当相同的控制被浓缩到单次前向传播中时,其全部影响会一次性施加,没有后续校正的机会,导致控制信号主导生成过程,而非温和地引导它。由此产生的“过度转向”伪影如图 4(b, c, e, f) 所示。

这一分析指向一个明确的设计原则:在单步设置中,结构保留不能在生成过程中强加,而应在生成开始前进行编码。如果初始噪声潜在变量本身已经携带了源帧的结构信息,那么单步生成器可以在其单次前向传播中保留该结构,而无需任何辅助控制机制。我们通过训练一个反演编码器 $I_\phi(\cdot)$ 来实现这一原则,该编码器直接将源帧映射到初始噪声潜在变量,该潜在变量编码了忠实重建和有意义编辑所需的空间结构。

具体而言,给定来自预训练自编码器 [19, 45] 的 VAE 编码潜在变量 $z_0$ 和给定文本提示 $y$ 的提示嵌入 $c = E(y)$(其中 $E$ 是冻结的文本编码器,例如 CLIP [43]),我们的编码器预测初始噪声潜在变量 $\hat{z}_T = I_\phi(z_0, c)$,其中 $T$ 表示终端扩散时间步(即 999)。遵循之前的反演方法 [12,36,44,53,58,59],我们的目标是预测一个噪声潜在变量 $\hat{z}_T$,该变量同时满足两个标准:重建性和可编辑性。为了赋予编码器结构感知的可编辑性,我们分两个阶段进行:1) 带有提示扰动的数据集生成:我们策划了一个结构相似图像对的数据集,这些图像对共享姿态和布局但在视觉上有所不同(图 2(a.1))。2) 使用结构感知编辑损失进行训练:我们使用新提出的结构感知编辑损失训练编码器,该损失模拟编辑过程并约束输出与配对目标对齐(图 2(a.2))。

带有提示扰动的数据集生成。训练反演编码器在生成之前编码结构,需要教导“语义变化下的结构保留”是什么样子的数据。具体而言,我们需要共享空间布局但外观不同的图像对,以便编码器学习产生捕获共享结构的潜在变量,同时对变化的语义保持无关。

为了生成这样的数据集 $D_B = \{ (z_0, z_0^{edit}, c, c^{edit}) \}$,一种自然的方法是对每个源图像应用现成的图像编辑器。然而,此类编辑器通常依赖于不同的生成骨干网络,其输出可能超出目标单步生成器 $G_\theta$ 的可达流形。在分布不匹配的目标上训练 $I_\phi$ 会导致不一致的梯度,因为编码器被要求预测 $G_\theta$ 根本无法生成的图像的潜在变量。表 1 证实了这一点:在

第 7 页

OSVE:利用单步扩散模型进行单步视频编辑 7

表 1:不同反演策略在重建质量上的定量比较。

PSNR↑ LPIPS↓ MSE↓ SSIM↑

DDIM [53] 13.87 0.525 0.045 0.446 现成模型2 17.54 0.400 0.032 0.543 图 3:随着 λnoise 变化,结构(DINO)和语义 本文方法 19.16 0.261 0.014 0.624 (CLIP)距离的变化情况。

在所有指标上,使用现成模型2编辑对得到的重建质量均显著低于本文方法,这表明不匹配的监督信号破坏了编码器整体潜在表示的质量。我们还报告了 DDIM 50步反演 [53] 作为基线,由于第 1 节中讨论的根本性的反演-生成不匹配问题,其表现最差。 为了避免这种不匹配,我们提出了一种简单而有效的替代方案,称为提示扰动(prompt perturbation),该方案确保每个目标图像都与生成器对齐,即通过构造使其位于 Gθ 的输出分布内。具体而言,我们首先从语料库(LAION [50]、JourneyDB [56])中采样一个文本提示,并采样一个随机噪声向量 zT ∼N(0, I)。令 c = E(y) 为采样提示 y 的文本嵌入。随后,我们构建一个扰动嵌入:

c_{ \ m a thrm { e di t } } = c , (1)

其中 λnoise 控制扰动强度。由于源图像 Gθ(zT , c) 和编辑后的图像 Gθ(zT , cedit) 均由同一个冻结的生成器从相同的初始噪声生成,因此生成的配对样本来自 Gθ 的可到达输出分布,并且倾向于共享相似的结构布局,主要在外观上有所不同。这种与生成器对齐的监督信号为 Iϕ 提供了适定的训练信号,Iϕ 必须预测那些 Gθ 能够忠实解码的潜在变量。 我们实证研究了 λnoise 对结构和语义的影响(图 3)。从基础提示“a photo of a dog”开始,我们改变 λnoise ∈ {0.0, 0.1, . . . , 0.5},并在每种设置下使用相同的初始噪声 zT 生成 100 对图像。对于每一对图像,我们测量 (i) 使用 DINO [4] 计算的结构距离,以及 (ii) 使用 CLIP [43] 计算的语义距离。随着 λnoise 的增加,语义距离增大,而对于适当小的噪声(例如,λnoise = 0.1),结构距离保持较低且稳定,这证实了微小的扰动在保留布局的同时引发了有意义的外观变化。受此分析指导,我们在所有实验中设置 λnoise = 0.1(其他参数的训练结果见补充材料 B 和 G)。

2 我们使用 Google Gemini 的 Nano Banana 作为代表性的现成图像编辑器,并采用默认推荐设置。

第 8 页

8 H. Lim and G.-M. Park

图 4:单步编辑中结构保持方法的比较。(a) 使用提出的 Lsae 训练的我们的方法保持了结构完整性。(d) 没有 Lsae,我们的模型失败,导致结构崩溃。(b, c, e, f) 类似地,现有的控制方法通常会产生退化的结果,证明了它们不适合单步生成。SA 和 CA 分别表示替换自注意力和交叉注意力。

给定 (c, cedit) 和共享的 zT,我们得到重建和编辑目标为

$$ \underbrace{z^0_c = G_\theta(z^T, c)}_{\text{Reconst.}} \quad \underbrace{z^0_{\mathrm{edit}} = G_\theta(z^T, c_{\mathrm{edit}})}_{\text{Editing Target}} \quad (2) $$

这一过程产生了一个大型数据集,其中大多数对表现出强烈的结构相似性但在外观上不同,有效地模拟了所需的编辑行为。

使用结构感知编辑损失进行训练。该数据集提供了共享结构但语义不同的对,每对都是从相同的噪声 zT 在原始和扰动提示下生成的。我们将此转化为一个训练目标,迫使反演编码器产生潜在变量 $\hat{z}_T = I_\phi(z^0, c)$,同时服务于重建和结构保持编辑。我们的损失函数为:

$$ \mathcal{L}_{\mathrm{total}} = \underbrace{\|z^0 – G_{\theta}(\mathcal{I}_{\phi}(z^0, c))\|_2^2}_{\mathcal{L}_{\mathrm{mse}}} + \lambda_{\mathrm{sae}} \underbrace{\|z^0_{\mathrm{edit}} – G_{\theta}(\mathcal{I}_{\phi}(z^0, c), c_{\mathrm{edit}})\|_2^2}_{\mathcal{L}_{\mathrm{sae}}} \quad (3) $$

其中 $\lambda_{\mathrm{sae}}$ 是权重参数(设置为 1.0),$z^0 = G_\theta(z^T, c)$,且 $z^0_{\mathrm{edit}} = G_\theta(z^T, c_{\mathrm{edit}})$。

第一项 $\mathcal{L}_{\mathrm{mse}}$ 确保反演后的潜在变量允许 $G_\theta$ 准确地重建原始图像 $z^0$。然而,仅靠重建并不能保证在提示改变时相同的潜在变量能保持结构。第二项,即结构感知编辑 (SAE) 损失 $\mathcal{L}_{\mathrm{sae}}$,直接解决了这个问题:它要求当使用扰动提示 $c_{\mathrm{edit}}$ 解码相同的反演潜在变量 $\hat{z}_T$ 时,产生的输出与预生成的目标 $z^0_{\mathrm{edit}}$ 匹配。因为 $z^0_{\mathrm{edit}}$ 是与 $z^0$ 相同的噪声 $z^T$ 生成的,所以它通过构造共享源结构,因此匹配它教导编码器产生其结构内容对提示变化不变的潜在变量。图 4

第 9 页

OSVE:基于单步扩散模型的单步视频编辑 9

图 5:统一帧编辑(Unified-Frame Editing)维持时间一致性的机制。(a) 逐帧编辑:单独处理每一帧会将注意力限制在帧内,阻碍信息共享并导致时间不一致。(b) 统一帧编辑 (UFE):我们的方法将所有帧的潜在变量拼接在一起,使注意力机制能够在全局范围内运作。这使得特征能够在所有帧之间进行匹配和对齐,从而在整个编辑过程中强制保持时间一致性。

验证了这一设计:没有 Lsae 时,模型会出现结构坍塌 (d),而现有的控制方法,如注意力注入 (b, c, e, f),同样失败,这证实了结构保持必须源自潜在变量本身,而非生成过程中的外部控制。 在实现方面,我们使用预训练的单步模型 Gθ 的组件初始化反演编码器 Iϕ,具体利用其 U-Net 中的组件。Iϕ 产生的潜在变量 ˆzT 的详细训练设置以及视觉和统计分析见补充材料 C。

3.2 统一帧编辑

虽然 3.1 节中的反演编码器对单张图像有效,但将其逐帧应用于视频时无法保持时间一致性。大多数先前的视频编辑方法通过在多步去噪过程中将引导信号注入中间特征或注意力图来强制一致性 [6,9,17,29,61, 63,65]。然而,正如 3.1 节所述,这种迭代引导机制在单步模式下不适用(图 4)。 这促使我们采取一种根本不同的策略:与其操纵内部注意力,我们通过仅修改输入潜在表示来促进帧间通信。我们提出了统一帧编辑 (UFE),这是一种输入级潜在变量统一方案,其中来自多帧的反演潜在变量在空间上拼接,并在单次前向传播中同时处理(图 2(b))。 K = (z00, . . . , z0K−1),每个 Concretely, given a video sequence of K frames V0 帧通过我们的编码器独立反演:

h \ a t {z}^T _k = \m a t h c a l . (4) K = (ˆzT0 , . . . , ˆzTK−1)。令 ˆzTk ∈RC×H×W我们将反演潜在变量的集合记为 ˆVT,并记 ˆzTk 为第 k 帧的反演潜在变量。统一潜在变量图 ZTUFE 是

第 10 页

10 H. Lim and G.-M. Park

通过将沿宽度维度拼接所有 K 个潜在变量形成:

Z^T _ {\mathrm{UFE}} = \mathrm{Concat}(\hat{z}_{t}^{(1)}, \dots, \hat{z}_{t}^{(K)}) \quad (5)

生成的地图 $Z^T_{\mathrm{UFE}}$ 具有维度 $RC \times H \times (W \cdot K)$,并连同编辑提示 $c_{\mathrm{edit}}$ 一起输入到单步生成器 $G_\theta(\cdot)$ 中。这是可行的,因为 U-Net 在空间特征上运行,并且自然接受任意大小的输入 [32, 45, 46]。关键在于,这种设计允许生成器的自注意力在所有帧上全局发挥作用,利用其对应对齐特征的能力 [57],从而在不使用任何外部引导模块的情况下强制实现时间一致性。图 5 可视化了这一效果:与帧级编辑中信息保持隔离不同,一帧中代表特定特征(例如老虎的鼻子)的 token 可以直接关注其他帧中的对应特征,确保编辑在整个序列中一致地应用。

带锚帧的滑动窗口。虽然 UFE 有效,但其显存需求和推理时间随帧数增加而扩展(见补充材料 H),这使得它在处理长视频时计算挑战巨大。为了解决这个问题,我们利用全局锚帧引导的滑动窗口机制扩展了 UFE。图 2(b) 说明了我们方法的流水线。核心思想是以可管理的块处理视频,同时确保局部和全局时间一致性。滑动窗口提供局部连贯性,而锚帧在所有窗口之间强制一致的全局风格和参考内容。首先,我们通过选择 DINO [4] 特征空间中的中位数(medoid)来识别代表性锚帧。其逆潜在变量 $\hat{z}^T_A$ 作为全局锚点。我们在补充材料 D 中针对替代策略验证了这一选择,包括在具有场景转换或动态内容变化的视频中使用多个锚点。

然后,我们使用重叠滑动窗口方法处理视频。对于每个包含 $w$ 个逆潜在变量的窗口,我们在将拼接地图输入生成器 $G_\theta$ 之前,在开头预置锚点潜在变量 $\hat{z}^T_A$。生成后,丢弃对应于锚点的输出,并仅从窗口的输出中提取中间的 $s$ 帧。然后将这些片段无缝拼接在一起形成最终编辑后的视频。这种基于锚点的滑动窗口策略通过确保每个片段在局部和全局上都连贯,有效地防止了时间漂移。我们通过消融实验将窗口大小设置为 $w = 7$,步幅设置为 $s = 5$(见补充材料 E)。该过程的详细逐步公式化见补充材料 F。

4 实验 4.1 实验设置

我们在三种视频编辑设置下评估我们的框架。第一种,多对多(Multi-to-Multi),使用多步扩散模型进行逆推和编辑。我们将五种基线方法进行比较:FLATTEN [6]、TokenFlow [42]、FRESCO [65]、RAVE [17] 和 COVE [61],它们均基于 Stable Diffusion 1.5 [45]。第二种,多对一(Multi-to-One),通过多步 DDIM 进行视频逆推,同时进行编辑

第 11 页

OSVE:基于单步扩散模型的一步视频编辑 11

表 2:在短视频(20 帧)上的性能比较。

框架 方法 SC BC TF MS AQ IQ BQS FPS

FLATTEN‡ 0.965 0.970 0.964 0.972 0.625 0.639 0.611 0.072 TokenFlow‡ 0.983 0.976 0.985 0.991 0.668 0.680 0.663 0.075 多对多 FRESCO‡ 0.978 0.974 0.973 0.991 0.649 0.729 0.674 0.078 RAVE‡ 0.982 0.976 0.975 0.986 0.637 0.695 0.653 0.091 COVE‡ 0.983 0.976 0.984 0.989 0.645 0.655 0.639 0.061 提示替换† 0.921 0.946 0.948 0.979 0.593 0.562 0.548 4.732 提示到提示† 0.915 0.945 0.965 0.978 0.587 0.566 0.548 0.898 多对一 ControlNet (深度)† 0.968 0.961 0.970 0.984 0.658 0.673 0.646 0.578 ControlNet (Canny)† 0.960 0.969 0.966 0.983 0.582 0.662 0.603 0.578 即插即用† 0.953 0.971 0.995 0.995 0.486 0.220 0.345 0.398 一对一 OSVE (本文)† 0.983 0.977 0.978 0.991 0.678 0.703 0.679 15.625 ‡ 多步扩散模型 (SD1.5)。 † 单步扩散模型 (DMD2)。

表 3:在长视频(90 帧)上的性能比较。

框架 方法 SC BC TF MS AQ IQ BQS FPS

FLATTEN‡ 0.933 0.960 0.965 0.975 0.648 0.636 0.615 0.052 TokenFlow‡ 0.974 0.975 0.986 0.990 0.622 0.668 0.633 0.084 多对多 FRESCO‡ 0.956 0.968 0.987 0.992 0.640 0.702 0.655 0.087 RAVE‡ 0.962 0.963 0.978 0.983 0.665 0.692 0.659 0.102 COVE‡ 0.955 0.964 0.985 0.988 0.651 0.650 0.633 0.041 提示替换† 0.841 0.912 0.970 0.975 0.561 0.528 0.503 4.732 提示到提示† 0.900 0.956 0.969 0.974 0.423 0.267 0.328 0.898 多对一 ControlNet (深度)† 0.945 0.944 0.971 0.978 0.626 0.652 0.613 0.578 ControlNet (Canny)† 0.934 0.952 0.967 0.976 0.590 0.660 0.598 0.578 即插即用† 0.841 0.912 0.994 0.995 0.561 0.528 0.509 0.398 一对一 OSVE (本文)† 0.958 0.965 0.978 0.989 0.670 0.723 0.677 15.793 ‡ 多步扩散模型 (SD1.5)。 † 单步扩散模型 (DMD2)。

在单步内完成。由于此前没有针对此配置的研究工作,我们通过改编图像编辑技术来构建基线:提示替换 (Prompt Replacement)、提示到提示 (Prompt-to-Prompt) [12]、带有深度和 Canny 引导的 ControlNet [73],以及即插即用 (Plug-and-Play) [59]。第三种是我们提出的一对一框架,它利用预训练编码器进行单步反演,并通过提示替换进行编辑。在多对一和一对一设置中,我们使用 DMD2 [68] 作为单步扩散骨干网络。更多细节见补充材料 A。

为了进行评估,我们从 Pixabay 等开放平台及先前工作中精选了 60 个视频,包括 51 个短视频(20 帧)和 9 个长视频(90 帧)。我们为每个视频设计了五个编辑提示——三个用于局部编辑(例如,物体更改、删除)和两个用于全局编辑(例如,风格迁移、背景修改)——从而产生了 255 个短视频和 45 个长视频评估对。短视频作为单个窗口处理,而长视频使用帧数为 7、步长为 5 的滑动窗口。所有实验均在单块 NVIDIA RTX 6000 Ada GPU 上进行。

第 12 页

12 H. Lim and G.-M. Park

Fig. 6: 与基线方法的定性比较。

4.2 定量比较

我们采用 VBench [14] 指标进行定量评估,这些指标分为两类。时间一致性指标包括:主体一致性(SC),通过 DINO [4] 特征衡量主体身份的保持情况;背景一致性(BC),通过 CLIP [43] 特征评估背景的稳定性;时间闪烁(TF),数值越高表示闪烁越少;以及运动平滑度(MS),使用预训练的视频插值模型 [23] 评估运动的流畅性。每帧质量指标包括:美学质量(AQ),由 LAION 美学预测器 [21] 评分,以及成像质量(IQ),使用 MUSIQ [18] 量化感知伪影。我们还引入了平衡

第 13 页

OSVE:基于单步扩散模型的单步视频编辑 13

图 7:OSVE 在各种编辑任务中的定性结果。

平衡质量得分(BQS):$BQS = \sqrt[4]{(SC+BC+TF+MS) \times (AQ+IQ)}$,该指标通过乘法平衡两个维度,对仅在一个维度上表现优异的方法进行惩罚。

表 2 和表 3 分别展示了短视频和长视频的结果。我们的方法 OSVE 在这两种设置下均取得了最高的 BQS,同时证明了其强大的时间一致性和单帧质量。在效率方面,与最快的 Multi-to-Multi 基线 RAVE 相比,OSVE 在短视频上快约 171 倍,在长视频上快 155 倍。有关速度比较的设置,请参见补充材料 A。

4.3 定性比较

图 6 提供了定性比较。OSVE 成功修改了对象,同时保留了其底层结构,而 Multi-to-One 基线(第 7–11 行)经常表现出结构崩溃或视觉退化。图 7 展示了 OSVE 在各种编辑任务中的多功能性,包括对象替换(第 1、3 和 5 列)、人类身份修改(第 2 列)、艺术风格迁移(第 3 和 4 列)以及提示引导的对象移除(第 4 列)。

4.4 用户研究

我们进行了包含 26 名参与者的用户研究。每位参与者观看了六种编辑方法应用于从我们数据集中随机采样的三个视频,并使用 5 点李克特量表对每个结果的时间一致性(TC)和视觉质量(VQ)进行评分。如表 4 所示,OSVE 在这两个维度上均获得了最高分,优于所有基线。

4.5 消融研究

反演编码器。表 5 在 PIE-Bench [16] 上验证了结构感知编辑损失(SAE Loss),使用了结构距离 [59] 和 CLIP 分数 [43]。虽然仅使用 SAE Loss 即可改善结构保留,但将其与重建损失($L_{mse}$)结合使用时,在结构完整性和可编辑性方面均取得了最佳性能,表明这两个目标之间存在协同效应。

第 14 页

14 H. Lim and G.-M. Park

表 4:用户研究结果。TC:时间一致性,VQ:视觉质量(越高越好)。 表 5:编码器训练上的消融研究。 我们在 PIE-Bench 上评估了每个损失组件的效果。

方法 TC VQ 结构 CLIP CLIP Lmse Lsae 距离 (↓) 整体 (↑) 编辑 (↑) FLATTEN 2.59 2.56 TokenFlow 3.68 3.08 ✓ – 0.087 21.797 19.884 FRESCO 3.02 2.76 RAVE 2.74 2.70 – ✓ 0.074 22.349 19.863 COVE 3.59 3.41 ✓ ✓ 0.064 22.329 20.416 OSVE (Ours) 3.85 3.65

表 6:UFE 在 90 帧视频上的消融研究。

滑动 锚点 SC BC TF MS AQ IQ BQS 窗口

– – 0.931 0.948 0.972 0.980 0.680 0.722 0.671 ✓ – 0.954 0.963 0.977 0.988 0.671 0.723 0.676 – ✓ 0.943 0.950 0.976 0.985 0.672 0.722 0.669 ✓ ✓ 0.958 0.965 0.978 0.989 0.670 0.723 0.677

统一帧编辑 (Unified Frame Editing)。表 6 展示了统一帧编辑 (UFE) 的消融研究。滑动窗口策略和锚点帧策略各自都能提升时间一致性 (SC, BC, TF, MS),而两者的结合产生了最强的结果。我们观察到应用 UFE 时 AQ 略有下降,这可能是由于处理扩展后的潜在表示所致。然而,与闪烁和不一致性的显著减少相比,这种微小的权衡在感知上是微不足道的。

5 讨论

我们基于单步文本到图像 (T2I) 骨干网络构建 OSVE,因为当前的单步文本到视频 (T2V) 生成器尽管在 T2V 蒸馏方面取得了最新进展 [26, 66, 75],但仍存在严重的时间伪影和模糊问题,使其不适合作为可靠的编辑骨干网络(见补充材料 G)。相比之下,成熟的单步 T2I 骨干网络已被报道在生成质量上甚至超越了其多步教师模型 [68],这提供了一个干净的测试平台,使我们能够独立于骨干网络的局限性来评估我们的核心贡献。 生成领域正迅速向 T2V、T2AV 和其他多模态架构扩展,这些模型的单步蒸馏是一个活跃的研究领域 [8,22,26,28,74]。随着保真度的提高,将这些单步编辑扩展至这些骨干网络将变得可行且重要。我们认为 OSVE 背后的核心原则,即将结构编码到初始潜在表示中,并在输入层面强制跨帧一致性,并不特定于 T2I,可以跨模态泛化。

第 15 页

OSVE:基于一步扩散模型的一步视频编辑 15

6 结论

本文提出了 OSVE,一个通过新型 One-to-One 流水线推进文本引导视频编辑的框架。OSVE 释放了一步扩散模型在该任务中的潜力,克服了传统多步方法的速度限制。我们的两项核心贡献——使用 SAE loss 训练、用于保持结构的快速可学习 inversion encoder,以及用于强化时间一致性的 UFE 机制——解决了此前阻碍这种方法的关键瓶颈。实验表明,OSVE 只需传统方法的一小部分计算成本,即可获得具有竞争力的质量和一致性,使实时视频编辑更具实用性和可及性。

致谢

本工作得到韩国政府科学技术信息通信部资助的韩国国家研究基金会项目(RS-2026-25480253)、韩国政府产业通商资源部资助的韩国工业技术企划评价院项目(RS-2024-00444344),以及大韩民国政府科学技术信息通信部资助的“Advanced GPU Utilization Support Program”支持。

目录

  • A. 实验细节
  • A.1 Multi-to-Multi(第 16 页)
  • A.2 Multi-to-One(第 17 页)
  • A.3 One-to-One(第 19 页)
  • A.4 速度比较(第 19 页)
  • B. Prompt 扰动消融(第 19 页)
  • C. Encoder 训练与 inversion latent 分析(第 20 页)
  • C.1 训练细节(第 20 页)
  • C.2 可视化与分析(第 20 页)
  • D. Anchor 消融(第 21 页)
  • D.1 Anchor 选择策略消融(第 21 页)
  • D.2 Multi-Anchor 消融(第 22 页)
  • E. Sliding Window 与 Anchor 消融(第 23 页)
  • F. Unified-Frame Editing(第 24 页)
  • G. 进一步分析(第 25 页)
  • G.1 关于 λnoise 的详细消融(第 25 页)
  • G.2 关于一步 T2V generator 质量的讨论(第 26 页)
  • H. GPU 显存分析(第 28 页)
  • I. 用户研究(第 29 页)

第 16 页

16 H. Lim 和 G.-M. Park

A 实验细节

在本节中,我们提供了论文中评估的所有方法的全面实现细节。所有训练和推理实验均在单张 NVIDIA RTX 6000 Ada 显卡(48 GB 显存)上进行。除非另有说明,我们遵循各自论文中报告的超参数设置。对于未明确声明特定超参数的情况,我们采用官方开源实现中提供的默认值。

为了确保所有方法之间的公平比较,我们在整个实验中保持输入视频分辨率和帧数一致。所有输入视频均调整为 512 × 512 分辨率。对于每种实验设置下的每种方法,我们使用相同的源视频集和编辑提示。

A.1 多对多(Multi-to-Multi)

多对多设置指的是传统的视频编辑流程,其中反转(inversion)和采样过程都需要多个扩散步骤。在此设置下,我们采用 Stable Diffusion v1-53 作为所有方法的预训练多步扩散模型。对于反转过程,我们在所有方法中统一应用 DDIM Inversion 调度器 [53],使用 50 个反转步骤,从而从每个源视频帧重建潜在噪声表示。下面描述每个基线方法的具体配置。

FLATTEN [6]。我们使用 FLATTEN 的官方 PyTorch 实现,该实现利用光流引导的注意力机制来提高视频编辑中的时间一致性。遵循原始论文中的设置,我们将无分类器引导比例(classifier-free guidance scale)设置为 20,并使用 50 个 DDIM 采样步骤进行去噪过程。FLATTEN 通过整合光流信息修改 U-Net 中的注意力机制,引导注意力图在帧间保持时间连贯性。我们使用官方仓库中提供的光流估计模型。

TokenFlow [9]。我们使用 TokenFlow 的官方 PyTorch 实现。TokenFlow 基于帧间对应关系传播扩散特征,从而强制时间一致性。遵循论文的方法论,我们利用即插即用(Plug-and-Play, PnP)编辑框架 [59] 作为底层编辑机制。无分类器引导比例设置为 7.5,并使用 50 个 DDIM 采样步骤。TokenFlow 首先识别关键帧,计算它们之间的最近邻对应关系,然后将编辑后的 token 传播到所有其他帧,以维持视觉连贯性。

FRESCO [65]。我们使用 FRESCO 的官方 PyTorch 实现,该实现引入了时空对应关系以实现零样本视频编辑。如

3 https://huggingface.co/runwayml/stable-diffusion-v1-5 4 https://github.com/yrcong/flatten 5 https://github.com/omerbt/TokenFlow 6 https://github.com/williamyang1991/FRESCO

第 17 页

OSVE:使用单步扩散模型进行单步视频编辑 17

如论文中所述,我们采用 ControlNet [73] 配合 HED(Holistically-Nested Edge Detection,全嵌套边缘检测)条件控制7,以在编辑过程中提供结构引导。我们使用 20 个 DDIM 采样步数,并将无分类器引导比例(classifier-free guidance scale)设置为 7.5。在编辑过程中,我们每隔 8 帧选取一帧作为关键帧。编辑完关键帧后,我们使用 EbSynth8(一种基于补丁的视频风格化工具)将编辑效果从关键帧传播到所有剩余帧,从而生成最终编辑后的视频。所有其他参数,包括时空注意力融合权重,均遵循官方实现中的默认设置。

RAVE [17]。我们使用 RAVE9 的官方 PyTorch 实现,该方法通过将视频帧重新排列成网格布局并同时处理它们来实现时间一致的编辑。遵循论文中描述的设置,我们采用以深度图为条件的 ControlNet 模型10 以保留源视频几何结构。网格大小设置为 3×3(即 9 帧排列在单个网格图像中),无分类器引导比例设置为 7.5,我们执行 50 个 DDIM 采样步数。深度图是使用仓库中提供的默认深度估计模型从源视频帧中估计得出的。

COVE [61]。我们使用 COVE11 的官方 PyTorch 实现,该方法利用视频级对应关系来引导扩散过程。遵循论文中的设置,我们将无分类器引导比例设置为 7.5,并将 DIFT(Diffusion Features,扩散特征)上采样块索引设置为 2,这控制了用于计算对应关系的提取扩散特征的粒度。计算帧间对应关系的滑动窗口大小设置为 7,对应关系引导比例(控制采样期间对应关系约束的强度)设置为 3,标记合并比例(token merging ratio)设置为 50%,这意味着根据对应关系相似度合并一半的标记,从而在保持时间一致性的同时降低计算成本。

A.2 多对一

多对一(Multi-to-One)设置代表一种混合方法,其中反演过程仍然需要多个扩散步数,但采样(生成)是使用蒸馏的单步扩散模型以单步完成的。在此设置中,我们使用 DMD2 [68] 作为我们的预训练单步扩散模型,这是一种分布匹配蒸馏模型,能够通过单次前向传播生成高质量图像。对于反演过程,我们应用 DDIM 反演调度器 [53],使用 50 个反演步数从每个源帧获取潜在噪声表示,这与多对多(Multi-to-Multi)设置相同。此设置中的所有推理均使用 DMD2 在单个去噪步数中完成。

7 https://huggingface.co/lllyasviel/sd-controlnet-hed 8 https://github.com/jamriska/ebsynth 9 https://github.com/RehgLab/RAVE 10 https://huggingface.co/lllyasviel/sd-controlnet-depth 11 https://github.com/wangjiangshan0725/COVE

第 18 页

18 H. Lim and G.-M. Park

下面,我们描述适配到该设置的每个基线方法的具体配置。

Prompt Replacement。这是最简单的基线方法,它在单步采样过程中通过直接将源文本提示替换为目标文本提示来实现编辑。例如,源提示“A photo of a dog”被替换为目标提示“A photo of a cat”,同时反转的潜在噪声保持不变。不应用额外的结构引导或注意力操作。该方法作为下界,用于评估更复杂编辑技术的有效性。

Prompt-to-Prompt [12]。我们使用 Prompt-to-Prompt 的官方 PyTorch 实现12,并适配到单步采样设置。Prompt-to-Prompt 通过在去噪过程中操作 U-Net 内的交叉注意力图来实现局部编辑。具体而言,与源提示词元对应的交叉注意力图被注入到带有目标提示的去噪过程中,使模型能够在应用所需编辑的同时保留源图像的空间布局。在我们的评估中,我们仅注入交叉注意力图,并有意排除自注意力图,因为我们经验性地观察到,将自注意力图注入单步生成管道会导致输出图像质量显著下降(见主论文中的图 4)。

ControlNet (Depth) [73]。我们采用基于深度图条件预训练的 ControlNet 模型13,在单步采样过程中提供结构引导。深度图是从每个源视频帧中提取的,并输入到 ControlNet 分支中,该分支将深度感知特征注入到 U-Net 中,以保留原始场景的空间结构。我们将 ControlNet 条件缩放(控制结构引导强度)设置为 0.8。选择该值是为了在保留源结构和允许目标提示充分发挥作用之间取得平衡。

ControlNet (Canny) [73]。类似地,我们使用基于 Canny 边缘图条件预训练的 ControlNet 模型14作为另一种结构引导基线。Canny 边缘是从每个源视频帧中检测出来的,并用作条件输入。ControlNet 条件缩放设置为 0.8,与基于深度的变体保持一致。与深度条件相比,Canny 边缘条件基于边缘边界提供更细粒度的结构约束,这有利于保留清晰的物体边界,但在某些情况下也可能限制编辑的灵活性。

Plug-and-Play [59]。我们使用 Plug-and-Play 的官方 PyTorch 实现15,并适配到单步生成设置。Plug-and-Play 通过注入源图像的中间空间特征来实现结构保留编辑。

12 https://github.com/google/prompt-to-prompt 13 https://huggingface.co/lllyasviel/sd-controlnet-depth 14 https://huggingface.co/lllyasviel/sd-controlnet-canny 15 https://github.com/MichalGeyer/plug-and-play

第 19 页

将源图像的降噪过程融入目标图像的生成过程。具体而言,我们在源图像重建期间从 U-Net 的卷积层中提取空间特征,并在目标图像生成期间将其注入到对应的层中,如原文所述。这种特征注入约束了编辑输出的空间布局和结构细节,使其与源图像保持一致,同时允许由目标提示词决定的语义变化。

A.3 一对一

一对一设置代表了最高效的流水线,其中反转和采样过程均在单步内完成。这完全消除了迭代 DDIM 反转的计算开销,实现了实时或近实时的视频编辑。

OSVE( ours)。在此设置中,我们使用训练好的 OSVE(单步视频编辑)编码器执行单步反转。给定一个源视频帧,OSVE 编码器在一次前向传播中预测相应的噪声潜变量,从而避免了迭代 DDIM 反转的需要。预测的噪声随后直接传递给 DMD2 [68] 单步扩散模型,结合目标文本提示词进行采样。由于我们的反转编码器是专门设计并训练用于在预测的噪声表示中保留源图像的结构和几何信息,因此在此设置中的编辑仅使用目标文本提示词,无需任何额外的结构引导(例如 ControlNet 或注意力注入)。这种设计选择导致了一个高度简化的编辑流水线,每帧仅需两次前向传播:一次通过 OSVE 编码器进行反转,另一次通过 DMD2 模型进行生成。

A.4 速度比较

为了对所有方法进行公平且准确的速度比较,我们仅测量 U-Net 的推理时间,排除 VAE 编码和解码操作所需的时间。这是因为 VAE 的计算成本在所有共享相同基础扩散模型的方法中是相同的,因此不会对计算效率的差异产生有意义的影响。报告的时间对应于给定视频片段中所有帧的总反转和推理时间。为了确保一致性,所有操作均按顺序执行,而非异步或并行执行,以便测量的时间能准确反映每种方法的每帧计算成本。我们将每次计时测量重复 10 次并报告平均值,以减轻 GPU 调度和内存缓存效应带来的方差。

B 提示词扰动的消融实验

表 A 展示了关于 SAE Loss 噪声注入参数的消融研究。结果表明,参数值为 0.1 时取得了最低的结

第 20 页

20 H. Lim and G.-M. Park

Structure CLIP CLIP λnoise Distance (↓) Whole (↑) Edit (↑)

0.0 0.087 21.797 19.884 0.1 0.064 22.329 20.416 0.2 0.068 22.314 20.406 0.3 0.075 22.449 20.422 0.4 0.085 22.531 20.402 0.5 0.101 22.641 20.424 表 A:噪声注入参数 λnoise 的消融实验。

结构距离,表明对源内容几何结构最好的保留。 相反,随着注入参数的增加,CLIP 分数也随之上升。 这表明存在权衡:较大的参数使反转潜在变量更具可编辑性,并与目标提示更好地对齐,但以牺牲结构保真度为代价。鉴于我们的主要目标是在忠实保留原始结构的同时执行编辑,我们将此参数设置为 0.1 用于我们的主要实验。 我们注意到,增加主要出现在 CLIP Whole 中,而 CLIP Edit 在所有 λnoise 值下(范围从 20.40 到 20.42)基本保持稳定。这是因为 CLIP Edit 仅测量编辑区域内的相似度,该区域在 λnoise=0.1 时已经与目标提示很好地对齐;进一步的噪声注入主要影响非编辑区域,这些区域由 CLIP Whole 捕获。

C 编码器训练与反转潜在变量分析

C.1 训练细节

我们使用大小为 6 的批次训练反转编码器 72 小时。训练的总样本数为 426,000。SAE Loss 的权重 λsae 设置为 1。对于优化,我们使用了 AdamW [33] 优化器,学习率为 1 × 10−5,betas 为 (0.9, 0.999),epsilon 为 1 × 10−8,权重衰减为 1 × 10−2。训练期间的损失曲线可视化于图 D 和 E 中。

C.2 反转潜在变量的可视化与分析

我们分析了由我们训练的 SAE 反转编码器产生的潜在变量的统计和频谱特性,并与纯高斯噪声 z ∼ N(0, I) 进行比较。

逐元素高斯性。表 B(顶部)报告了 1000 个反转潜在变量的正态性诊断。Q–Q R2 为 0.999,KS 统计量为 0.069,偏度和峰度接近零,证实边际分布几乎与 N(0, 1) 无法区分,验证了与扩散先验的兼容性。

第 21 页

OSVE:使用单步扩散模型进行单步视频编辑 21

表 B:反转潜变量的分析。上部分:逐元素高斯性。下部分:低/高比率,用于衡量功率谱中的空间结构(见 C.2 节)。

指标 高斯分布 ours

Q–Q R2 1.000 0.999 KS 统计量 0.000 0.069 偏度 0.000 −0.032 峰度 0.000 −0.083

低/高比率 – 7.145

图 A:我们编码器生成的反转潜变量的可视化。尽管在逐元素上符合高斯分布(见表 B),但这些潜变量表现出源自源图像的可见低频结构。

频谱分析。逐元素高斯性并不意味着空间独立性。我们计算每个潜变量的二维功率谱,对通道求平均,并提取径向剖面。我们将低/高比率定义为 r < 0.15R 的平均功率除以 r > 0.50R 的平均功率。对于空间独立的噪声,该比率约为 1。如表 B 所示,我们的潜变量比率为 7.145——低频能量约为高频能量的 7 倍,表明粗略的空间结构被隐式编码。这在图 A 中也直观可见,尽管反转潜变量整体看起来像噪声,但仍保留了源自源图像的可辨识低频模式。

解释。我们的反转潜变量在逐元素上符合高斯分布,但在空间上具有结构:它们对于去噪器而言表现为有效噪声,同时在其空间相关性中编码了特定于源内容的布局信息。这种双重特性引导去噪轨迹朝向忠实重建,且不违反扩散先验,这解释了主论文表 1 中报告的反转质量优于 DDIM 的原因。

D 锚点消融实验

D.1 锚点选择策略消融

为了确定最佳的锚点选择策略,我们进行了一项消融研究,将我们所选方法与六种替代方案进行了比较。评估的方法包括:1) 随机(Random),即随机选择一个帧;2) 第一帧(First),即

第 22 页

22 H. Lim and G.-M. Park

90 帧 锚点方法 SC BC MS AQ IQ BQS

随机 0.950 0.963 0.987 0.670 0.723 0.673 第一帧 0.958 0.962 0.988 0.670 0.723 0.675 像素质心 0.957 0.962 0.988 0.670 0.723 0.675 像素中位点 0.957 0.964 0.988 0.670 0.723 0.675 CLIP Top-1 0.957 0.963 0.988 0.670 0.723 0.675 DINO-Medoid 0.958 0.965 0.989 0.670 0.723 0.676 混合 0.956 0.962 0.988 0.670 0.723 0.675 表 C:锚点方法的消融实验(90 帧)。

始终使用初始帧;3) Pixel-Centroid(像素质心),选择与所有帧的逐像素均值最接近的帧;4) Pixel-Medoid(像素中位点),选择使到所有其他帧的逐像素距离之和最小的帧;5) DINO-Medoid,在 DINO [4] 特征空间中识别中位点;6) CLIP Top-1,选择与源提示具有最高 CLIP [43] 相似度的帧;以及 7) Hybrid(混合),同时考虑 DINO 和 CLIP 分数。该消融实验在 90 帧视频上进行,以捕捉锚点选择在长期效应上的影响。 如表 C 所示,DINO-Medoid 策略始终表现出最佳性能,在我们的各项指标中均取得了最高分数。值得注意的是,尽管 Hybrid 策略结合了更多信息,但其表现并未优于 DINO-Medoid。我们推测,聚合两种异构分数会引入权重歧义:所选帧成为一种折衷方案,无法最大化任一标准。鉴于所有非随机策略已经选择了具有合理代表性的帧,且绝对差异很小,单一的良好标准(DINO 特征相似度)已被证明是足够的,并避免了为平衡两个分数而进行额外超参数调优的需要。

D.2 多锚点消融

我们进一步证明,我们的单锚点框架可以自然地扩展为多锚点策略,以处理更复杂的视频场景。当视频仅包含单个对象或单个连贯场景时,单个锚点足以在整个编辑过程中保持时间一致性。 然而,对于由多个不同场景组成的视频——例如,一个从猫走路过渡到狗走路的视频(图 B(a))——依赖单个锚点会变得成问题。在这种情况下,从一个场景(例如,狗的场景)中选择的锚点无法为属于不同场景(例如,猫的场景)的帧提供有意义的对应关系,从而导致编辑质量出现明显下降(图 B(b))。为了解决这一局限性,我们引入了一种简单而有效的多锚点策略。我们首先应用现成的场景变化检测器(例如 PySceneDetect16)将输入视频分割为单独的场景。然后,我们独立地为

16 https://github.com/Breakthrough/PySceneDetect

第 23 页

OSVE:基于单步扩散模型的单步视频编辑 23

图 B:多锚点策略概览。(a) 多场景视频示例(狗变为猫)。(b) 当仅使用源自狗场景的单个锚点时,猫区域的编辑质量显著下降(见红色圆圈)。(c) 通过采用多个锚点,我们的方法在不同场景间保持了每个对象的视觉一致性。

每个检测到的场景。在推理过程中,锚点在场景边界处动态切换,以确保每个片段始终与其对应的锚点配对。如图 B(c) 所示,该策略使我们的方法能够在不损害场景过渡间编辑质量的前提下,保持每场景的一致性。

E 滑动窗口与锚点的消融实验

在本节中,我们对滑动窗口大小和步长进行消融研究,以在编辑质量和处理速度之间找到最佳平衡。如表 D 和表 E 所示,窗口大小为 7、步长为 5(带有一个锚点)提供了良好的权衡,我们在主实验中采用此设置。

我们注意到,随着窗口尺寸的增加,SC、BC 和 MS 指标持续改善,这证实了较大的窗口提供了更强的时间上下文。相比之下,AQ 指标略有下降(例如,在表 E 中,从 w=1 时的 0.680 降至 w=7 时的 0.670)。这是因为将更多帧拼贴到单个网格中会降低 UNet 看到的每帧有效分辨率,从而轻微影响每帧的美学质量。然而,这种下降幅度微不足道

第 24 页

24 H. Lim and G.-M. Park

窗口 步长 SC BC MS AQ IQ BQS FPS 大小 w

1 1 0.931 0.948 0.980 0.680 0.723 0.668 20.925

3 1 0.950 0.962 0.988 0.676 0.723 0.676 11.646

1 0.952 0.963 0.988 0.674 0.722 0.676 7.068 5 3 0.952 0.962 0.987 0.673 0.722 0.675 17.409

1 0.954 0.964 0.988 0.670 0.722 0.674 4.769 7 3 0.954 0.963 0.988 0.671 0.722 0.674 12.354 5 0.954 0.963 0.988 0.672 0.723 0.675 18.140

1 0.955 0.963 0.989 0.669 0.723 0.674 3.351 3 0.954 0.962 0.988 0.670 0.723 0.674 9.203 9 5 0.954 0.965 0.988 0.669 0.723 0.674 13.862 7 0.955 0.964 0.988 0.670 0.723 0.674 17.599

表 D:在90帧视频上,无锚点的统一帧编辑(UFE)消融实验。

窗口 步长 SC BC MS AQ IQ BQS FPS 大小 w

1 1 0.943 0.950 0.985 0.680 0.722 0.669 15.332

3 1 0.958 0.966 0.988 0.670 0.723 0.679 8.698

1 0.957 0.965 0.988 0.670 0.723 0.678 5.644 5 3 0.958 0.963 0.988 0.670 0.723 0.677 14.324

1 0.957 0.966 0.988 0.670 0.723 0.677 3.959 7 3 0.957 0.964 0.988 0.670 0.723 0.676 10.551 5 0.958 0.965 0.989 0.670 0.723 0.677 15.793

1 0.957 0.963 0.989 0.670 0.723 0.675 2.870 3 0.957 0.961 0.988 0.670 0.723 0.675 7.886 9 5 0.957 0.964 0.988 0.670 0.723 0.676 12.109 7 0.958 0.964 0.988 0.670 0.723 0.676 15.614

表 E:在90帧视频上,有锚点的统一帧编辑(UFE)消融实验。

(∼0.01),且时间一致性指标的大幅提升证明了这种权衡是合理的。 比较这两个表格,锚点始终能提升一致性指标(例如,当 w=1 时,SC 从 0.931 提升至 0.943),但会导致 FPS 下降(例如,当 w=1 时,从 20.9 降至 15.3)。这是预期的结果:添加锚点会将网格槽的数量从 w 增加到 w+r(参见第 H 节),而在窗口大小较小时,由于锚点占总网格的比例较大,相对开销最为显著。

F 统一帧编辑(UFE)细节

我们准备序列以进行滑动窗口处理。为了确保边界帧有足够的上下文,我们对反转后的序列应用反射填充

第 25 页

OSVE:基于单步扩散模型的单步视频编辑 25

潜在变量 $\hat{V}_T^{K} = (\hat{z}_T^0, \dots, \hat{z}_T^{K-1})$。设 $p = (w-1)/2$ 为填充大小(针对奇数 $w$)。构建的填充序列 $\hat{V}_T^{\text{pad}}$ 如下: $$ \hat{V}_T^{\text{pad}} = (\underbrace{\hat{z}_T^p, \dots, \hat{z}_T^1}_{\text{left reflection}}, \underbrace{\hat{z}_T^0, \dots, \hat{z}_T^{K-1}}_{\text{original}}, \underbrace{\hat{z}_T^{K-2}, \dots, \hat{z}_T^{K-1-p}}_{\text{right reflection}}) $$

对填充序列进行处理以生成一系列输出片段。片段总数 $N_w$ 由 $N_w = \lceil K/s \rceil$ 给出。对于每个片段索引 $i \in \{0, 1, \dots, N_w-1\}$,我们首先从填充序列中提取一个包含 $w$ 个潜在变量的窗口。将这些潜在变量沿轴 2 进行空间拼接,形成窗口图 $W_T^i$: $$ W_T^i = \text{Concat}(\hat{z}_T^{i \cdot s}, \dots, \hat{z}_T^{i \cdot s + w – 1}, \text{axis}=2) $$ 生成器的最终输入 $W_T^{\prime i}$ 是通过在该窗口图前添加锚点潜在变量 $\hat{z}_T^A$ 构建的: $$ W_T^{\prime i} = \text{Concat}(\hat{z}_T^A, W_T^i, \text{axis}=2) $$ 生成器处理此输入,产生统一输出图 $W_0^{\prime i} = G_\theta(W_T^{\prime i}, c_{\text{edit}})$。从该输出中,我们首先丢弃对应于锚点帧的初始部分,得到 $W_0^i$: $$ W_0^i = W_0^{\prime i}[:, :, W:] \quad (\text{维度}: R \times C \times (H \times (W \cdot w))) $$ 接下来,我们从 $W_0^i$ 中提取中间的 $s$ 帧以形成最终片段 $S_i$: $$ S_i = W_0^i[:, :, W \cdot \text{offset} : W \cdot (\text{offset} + s)] \quad (\text{其中 } \text{offset} = (w-s)/2) $$ 生成所有 $N_w$ 个片段后,将它们拼接起来。 resulting map 被截断为原始长度 $K$ 帧,以形成最终编辑后的潜在变量图 $Z_0^{\text{edit}}$: $$ Z_0^{\text{edit}} = \text{Truncate}(\text{Concat}(S_0, S_1, \dots, S_{N_w-1}, \text{axis}=2), K). $$ 最后,将此统一图重新划分为单个帧潜在变量的序列: $$ \hat{z}_k^{0\text{edit}} = Z_0^{\text{edit}}[:, :, k \cdot W : (k+1) \cdot W] \quad \text{对于 } k = 0, \dots, K-1. $$ 最终编辑后的视频 $V_0^{\text{edit}}$ 是这 $K$ 个潜在变量的序列: $$ \hat{V}_0^{\text{edit}} = (\hat{z}_0^{0\text{edit}}, \hat{z}_0^{1\text{edit}}, \dots, \hat{z}_0^{K-1\text{edit}}). $$

G 附加分析

G.1 噪声参数 $\lambda_{\text{noise}}$ 的详细消融实验

详细的定量结果报告在表 F 中。随着 $\lambda_{\text{noise}}$ 的增加,相对于原始图像的 CLIP [43] 距离(CLIP-D)和结构距离 [4] 均增加,且它们的标准差也随之增大。然而,对于中等大小的 $\lambda_{\text{noise}}$ 值(例如 $\lambda_{\text{noise}} = 0.1$),我们可以生成在语义上与原始图像略有不同但在结构上保持相似的图像,且样本间的变异性很小。

第 26 页

26 H. Lim and G.-M. Park

G.2 关于单步文本生成视频(T2V)生成器质量的讨论

正如主论文第5节(讨论)中所讨论的,我们在 OSVE 上构建了一个基于单步文本生成图像(T2I)骨干网络,因为单步文本生成视频(T2V)生成器的质量尚未达到足以支持可靠视频编辑应用的水平。在本节中,我们将回顾当前加速 T2V 生成的现状,并讨论为何单步 T2V 仍然是一个开放且具有挑战性的问题。

T2V 蒸馏的现状。最先进的 T2V 扩散模型,如 CogVideoX [67]、HunyuanVideo [20] 和 Wan2.1 [60],通常需要 30–50 个去噪步骤,即使在高端 GPU 上,生成时间也长达数分钟。虽然图像领域在蒸馏方面取得了显著进展——单步 T2I 生成器如 DMD2 [68] 和 SDXL-Turbo [49] 的质量已达到与其多步教师模型相当的水平——但将这些技术扩展到视频领域被证明要困难得多。最近的工作探索了基于轨迹的方法 [47,54]、分布匹配方法 [68,70] 以及它们的组合 [2,71,72,76],但视频蒸馏仍处于初级阶段,即使是少步(2–8 步)方法,在时间连贯性、运动动态、文本对齐和生成多样性方面,与其全步教师模型相比仍存在可测量的质量差距 [10,51,76]。

单步 T2V:根本性的质量限制。当被推向单个去噪步骤的极端时,质量下降变得非常严重。少数尝试单步 T2V 生成的工作一致报告了根本性的局限性。 APT [27] 提出了用于单步视频生成的对抗性后训练,能够实时生成 2 秒长的 720p 视频。然而,作者本人也承认存在显著的质量下降,并且该方法仅在分辨率有限的短片上进行了演示。POSE [5] 引入了用于单步视频蒸馏的分阶段对抗平衡,并指出了现有方法的三个根本性局限性:(i) 扩展到大型模型(>100 亿参数)时的效率瓶颈,(ii) 时间一致性下降,包括闪烁伪影和长程依赖关系的断裂,以及 (iii) 对条件下游任务的任务泛化能力有限。OSV [35] 将一致性蒸馏与 GAN 训练相结合用于单步图像到视频生成,但需要多步细化才能达到教师模型的质量。即使是迄今为止最强的蒸馏框架之一 rCM [76],也报告了其 1 步变体与在相同 Wan2.1 骨干网络上的 4 步变体之间存在约 2 分的 VBench 分数差距,并明确指出蒸馏模型在多样性和物理一致性方面并未超越教师模型。我们通过在一单步设置下运行 Wan-rCM 1.3B 进一步证实了这一观察结果;如图 C 所示,生成的帧存在严重的模糊和时间不连续性,这证实了单步 T2V 生成距离实用质量仍有很大差距。 这些局限性源于视频领域特有或被放大的挑战:

第 27 页

OSVE:基于单步扩散模型的单步视频编辑 27

图 C:使用 Wan-rCM 1.3B 进行单步生成的定性结果。输出结果表现出明显的质量下降,包括空间模糊、时间闪烁以及帧间运动不连续,这说明了本节所讨论的当前单步文本到视频(T2V)蒸馏方法的基本局限性。

第 28 页

28 H. Lim 和 G.-M. Park

– 时间一致性崩溃。单步生成器必须在单次前向传播中产生时间连贯的运动,这往往导致闪烁、抖动或静态输出 [5,71]。 – 时空模式平均。模式平均问题——即模型对冲突的去噪方向进行平均——在视频的极高维时空设置中被显著放大,且单步生成中没有迭代校正的机会。 – 训练不稳定性。POSE [5] 观察到,由于视频潜在变量的高维度性,来自高斯噪声的对抗性蒸馏在视频领域面临严重的训练不稳定性,通常导致模式崩溃或训练发散。

对我们方法的影响。T2I 与 T2V 蒸馏之间的对比十分鲜明:单步 T2I 生成器能够可靠地匹配其多步教师模型,而 T2V 蒸馏——无论步数多少——仍然存在显著的质量差距,其中单步 T2V 遭受了特别严重的退化。因此,我们的 OSVE 采用单步 T2I 骨干网络结合显式的时间一致性机制,这在保持时间连贯性的同时提供了精确的逐帧结构控制——这是当前 T2V 蒸馏方法无论步数多少都无法可靠提供的组合。随着 T2V 蒸馏技术的成熟,未来的工作可能会重新审视这一设计选择。

H GPU 显存分析

上述滑动窗口公式的一个关键优势在于,GPU 显存消耗仅由窗口大小 $w$ 决定,且与总序列长度 $K$ 无关,因为任意时刻 GPU 上仅驻留单个窗口。 具体而言,设 $r$ 和 $c$ 表示将窗口中的 $w$ 个潜在代码平铺到 2D 空间网格时使用的行数和列数,因此 $w = r \cdot c$。对于每个窗口,我们的实现构建一个形状为 $C \times (r H_\ell) \times (c' W_\ell)$ 的单个平铺潜在张量,其中 $H_\ell$ 和 $W_\ell$ 是单个潜在代码的空间维度,并将其送入去噪 UNet 和 VAE 解码器。 当不使用锚点时,我们有 $c' = c$,且网格中的潜在槽位数量等于窗口大小:

N_{\mathrm{eff}}(w) (6) 当预置锚点潜在变量 $\hat{z}_{TA}$ 时(参见 $W_{T}^{i'}$ 的构建),网格必须在 $r$ 行中容纳 $w + 1$ 个潜在代码,因此需要 $c' = \lceil(w + 1)/r\rceil$ 列。因此,有效的网格槽位数量变为

eq : n f \label { f}(7) e 由于构造上 $w = r \cdot c$,这简化为 $c' = c + 1$,从而 $N_{\mathrm{eff}}(w) = r(c + 1) = w + r$。

第 29 页

OSVE:基于单步扩散模型的单步视频编辑 29

峰值显存占用可近似为

\label { eq : v ram} M_{\mathrm{VRAM}} = M_0 + \alpha (w + r)

其中 $M_0$ 是常数开销(模型权重、优化器状态等),$\alpha$ 是每个槽位的成本,取决于潜在分辨率和 UNet 架构。代入锚点情况可得 $M_{\mathrm{VRAM}}(w) = M_0 + \alpha (w + r)$,证实显存需求随窗口大小线性增长,即 $M_{\mathrm{VRAM}} = O(w)$。

关键在于,总帧数 $K$ 仅影响窗口数量 $N_w = \lceil K/s \rceil$,从而影响处理时间,而不影响峰值显存。这使得我们的方法能够在不增加 GPU 显存的情况下扩展到任意长度的视频,如消融研究(表 D 和表 E)所验证的那样。

I 用户研究详情

我们通过社交媒体平台匿名招募了 26 名参与者。未对专业背景设置任何限制,且参与者未获知哪种方法对应哪种结果,从而确保评估的无偏性。

在每次试验中,参与者并排观看源视频以及由六种方法生成的编辑结果。六种方法的展示顺序在每次试验和每位参与者中均独立随机化,以消除位置偏差。每位参与者评估了我们数据集中随机采样的三个视频,每个标准产生 $26 \times 3 \times 6 = 468$ 个独立评分。

要求参与者使用 5 点李克特量表(1 = 严重问题,5 = 无问题)根据两个标准对每个结果进行评分:

– 时间一致性 (TC):编辑后的视频是否保持平滑连贯的运动,且帧间无闪烁或突变。 – 视觉质量 (VQ):编辑后的帧是否在视觉上令人愉悦且无明显伪影。

呈现给参与者的调查界面示例如图 F 所示。

第 30 页

30 H. Lim 和 G.-M. Park

图 D:训练过程中的 MSE 损失图。

图 E:训练过程中的 SAE 损失图。

第 31 页

OSVE:基于单步扩散模型的单步视频编辑 31

图 F:向参与者展示的调查界面截图。

第 32 页

32 H. Lim 和 G.-M. Park

| | CLIP | Structure | | :— | :—: | :—: | | | $\lambda_{\text{noise}}$ | 距离 (CLIP-D) | 距离 | | | 均值 | 标准差 | 均值 | 标准差 | | 0.000 | 1.00 | 0.000 | 0.000 | 0.000 | | 0.0100 | 0.994 | 0.00778 | 0.00230 | 0.00324 | | 0.0200 | 0.987 | 0.0139 | 0.00660 | 0.00779 | | 0.0300 | 0.981 | 0.0197 | 0.0106 | 0.0138 | | 0.0400 | 0.970 | 0.0321 | 0.0163 | 0.0206 | | 0.0500 | 0.968 | 0.0337 | 0.0227 | 0.0337 | | 0.0600 | 0.956 | 0.0392 | 0.0305 | 0.0393 | | 0.0700 | 0.958 | 0.0353 | 0.0301 | 0.0384 | | 0.0800 | 0.949 | 0.0439 | 0.0359 | 0.0358 | | 0.0900 | 0.944 | 0.0413 | 0.0374 | 0.0332 | | 0.100 | 0.944 | 0.0409 | 0.0415 | 0.0329 | | 0.110 | 0.936 | 0.0450 | 0.0414 | 0.0312 | | 0.120 | 0.931 | 0.0479 | 0.0501 | 0.0378 | | 0.130 | 0.925 | 0.0513 | 0.0533 | 0.0406 | | 0.140 | 0.921 | 0.0560 | 0.0554 | 0.0426 | | 0.150 | 0.915 | 0.0533 | 0.0601 | 0.0496 | | 0.160 | 0.911 | 0.0594 | 0.0711 | 0.0677 | | 0.170 | 0.909 | 0.0574 | 0.0714 | 0.0566 | | 0.180 | 0.903 | 0.0576 | 0.0713 | 0.0647 | | 0.190 | 0.898 | 0.0595 | 0.0856 | 0.0775 | | 0.200 | 0.897 | 0.0613 | 0.0803 | 0.0704 | | 0.210 | 0.886 | 0.0684 | 0.0839 | 0.0664 | | 0.220 | 0.891 | 0.0648 | 0.0885 | 0.0682 | | 0.230 | 0.882 | 0.0651 | 0.0831 | 0.0692 | | 0.240 | 0.866 | 0.0651 | 0.102 | 0.0762 | | 0.250 | 0.870 | 0.0701 | 0.0924 | 0.0783 | | 0.260 | 0.866 | 0.0704 | 0.102 | 0.0878 | | 0.270 | 0.862 | 0.0607 | 0.101 | 0.0770 | | 0.280 | 0.856 | 0.0721 | 0.107 | 0.0867 | | 0.290 | 0.852 | 0.0695 | 0.106 | 0.0764 | | 0.300 | 0.854 | 0.0690 | 0.111 | 0.0829 | | 0.310 | 0.840 | 0.0738 | 0.115 | 0.0843 | | 0.320 | 0.839 | 0.0710 | 0.112 | 0.0762 | | 0.330 | 0.829 | 0.0707 | 0.114 | 0.0855 | | 0.340 | 0.827 | 0.0729 | 0.117 | 0.0918 | | 0.350 | 0.818 | 0.0838 | 0.124 | 0.0911 | | 0.360 | 0.822 | 0.0786 | 0.111 | 0.0752 | | 0.370 | 0.817 | 0.0817 | 0.125 | 0.102 | | 0.380 | 0.809 | 0.0709 | 0.122 | 0.0868 | | 0.390 | 0.808 | 0.0824 | 0.128 | 0.0979 | | 0.400 | 0.778 | 0.0913 | 0.129 | 0.0839 | | 0.410 | 0.784 | 0.0818 | 0.140 | 0.114 | | 0.420 | 0.778 | 0.0889 | 0.141 | 0.109 | | 0.430 | 0.772 | 0.0815 | 0.135 | 0.0894 | | 0.440 | 0.772 | 0.0716 | 0.141 | 0.108 | | 0.450 | 0.763 | 0.0818 | 0.145 | 0.103 | | 0.460 | 0.752 | 0.0902 | 0.137 | 0.102 | | 0.470 | 0.767 | 0.0821 | 0.145 | 0.123 | | 0.480 | 0.744 | 0.0846 | 0.151 | 0.123 | | 0.490 | 0.726 | 0.0921 | 0.151 | 0.117 | | 0.500 | 0.734 | 0.0705 | 0.147 | 0.123 |

表 F:对噪声参数 $\lambda_{\text{noise}}$ 的消融实验。我们报告了 CLIP 距离 (CLIP-D,越低越好) 和结构距离的均值和标准差。

第 33 页

OSVE:基于单步扩散模型的单步视频编辑 33

参考文献

1. Bar-Tal, O., Chefer, H., Tov, O., Herrmann, C., Paiss, R., Zada, S., Ephrat, A., Hur, J., Liu, G., Raj, A., Li, Y., Rubinstein, M., Michaeli, T., Wang, O., Sun, D., Dekel, T., Mosseri, I.: Lumiere: A space-time diffusion model for video genera- tion. arXiv preprint arXiv:2401.12945 (2024). https://doi.org/10.48550/arXiv. 2401.12945 2. Berner, J., et al.: Transition matching distillation for fast video generation. arXiv preprint arXiv:2601.09881 (2026) 3. Brooks, T., Holynski, A., Efros, A.A.: InstructPix2Pix: Learning to follow image editing instructions. arXiv preprint arXiv:2211.09800 (2022) 4. Caron, M., Touvron, H., Misra, I., Jégou, H., Mairal, J., Bojanowski, P., Joulin, A.: Emerging properties in self-supervised vision transformers. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 9650–9660 (2021) 5. Cheng, o.: POSE: Phased one-step adversarial equilibrium for video diffusion mod- els. arXiv preprint arXiv:2508.21019 (2025) 6. Cong, Y., Xu, M., Simon, C., Chen, S., Ren, J., Xie, Y., Perez-Rua, J.M., Rosen- hahn, B., Xiang, T., He, S.: Flatten: optical flow-guided attention for consistent text-to-video editing (2024), https://arxiv.org/abs/2310.05922 7. Dao, T., Nguyen, T.H., Le, T., Vu, D., Nguyen, K., Pham, C., Tran, A.: Swift- brush v2: Make your one-step diffusion model better than its teacher. In: European Conference on Computer Vision. pp. 176–192. Springer (2024) 8. Ding, Z., Jin, C., Liu, D., Zheng, H., Singh, K.K., Zhang, Q., Kang, Y., Lin, Z., Liu, Y.: Dollar: Few-step video generation via distillation and latent reward optimiza- tion. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2025) 9. Geyer, M., Bar-Tal, O., Bagon, S., Dekel, T.: Tokenflow: Consistent diffusion fea- tures for consistent video editing. arXiv preprint arXiv:2307.10373 (2023) 10. GPD Authors: GPD: Guided progressive distillation for fast and high-quality video generation. arXiv preprint arXiv:2602.01814 (2025) 11. HaCohen, Y., Chiprut, N., Brazowski, B., Shalem, D., Moshe, D., Richardson, E., Levin, E., Shiran, G., Zabari, N., Gordon, O., Panet, P., Weissbuch, S., Kulikov, V., Bitterman, Y., Melumian, Z., Bibi, O.: Ltx-video: Realtime video latent diffusion (2024), https://arxiv.org/abs/2501.00103 12. Hertz, A., Mokady, R., Tenenbaum, J., Aberman, K., Pritch, Y., Cohen-or, D.: Prompt-to-prompt image editing with cross-attention control. In: The Eleventh In- ternational Conference on Learning Representations (2023), https://openreview. net/forum?id=_CDixzkzeyb 13. Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. NeurIPS pp. 6840–6851 (2020) 14. Huang, Z., He, Y., Yu, J., Zhang, F., Si, C., Jiang, Y., Zhang, Y., Wu, T., Jin, Q., Chanpaisit, N., et al.: Vbench: Comprehensive benchmark suite for video gener- ative models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21807–21818 (2024) 15. Jiang, Z., et al.: Vace: All-in-one video creation and editing. arXiv preprint arXiv:2503.07598 (2025). https://doi.org/10.48550/arXiv.2503.07598 16. Ju, X., Zeng, A., Bian, Y., Liu, S., Xu, Q.: Pnp inversion: Boosting diffusion-based editing with 3 lines of code. In: The Twelfth International Conference on Learning Representations (2024), https://openreview.net/forum?id=FoMZ4ljhVw

第 34 页

34 H. Lim 和 G.-M. Park

17. Kara, O., Kurtkaya, B., Yesiltepe, H., Rehg, J.M., Yanardag, P.: Rave: Random- ized noise shuffling for fast and consistent video editing with diffusion models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 6507–6516 (2024) 18. Ke, J., Wang, Q., Wang, Y., Milanfar, P., Yang, F.: Musiq: Multi-scale image quality transformer. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 5148–5157 (2021) 19. Kingma, D.P., Welling, M.: Auto-encoding variational bayes. In: International Con- ference on Learning Representations (ICLR) (2014) 20. Kong, W., Tian, Q., Zhang, Z., Min, R., Dai, Z., Zhou, J., Xiong, J., Li, X., Wu, B., Zhang, J., Wu, K., Lin, Q., Yuan, J., Long, Y., Wang, A., Wang, A., Li, C., Huang, D., Yang, F., Tan, H., Wang, H., Song, J., Bai, J., Wu, J., Xue, J., Wang, J., Wang, K., Liu, M., Li, P., Li, S., Wang, W., Yu, W., Deng, X., Li, Y., Chen, Y., Cui, Y., Peng, Y., Yu, Z., He, Z., Xu, Z., Zhou, Z., Xu, Z., Tao, Y., Lu, Q., Liu, S., Zhou, D., Wang, H., Yang, Y., Wang, D., Liu, Y., Jiang, J., Zhong, C.: Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:2412.03603 (2024). https://doi.org/10.48550/arXiv.2412.03603 21. LAION-AI: aesthetic-predictor. https://github.com/LAION- AI/aesthetic- predictor (2022), accessed: 2025-09-25 22. Li, J., Feng, W., Fu, T.J., Wang, X., Basu, S., Chen, W., Wang, W.Y.: T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback. In: Advances in Neural Information Processing Systems (2024) 23. Li, Z., Zhu, Z.L., Han, L.H., Hou, Q., Guo, C.L., Cheng, M.M.: Amt: All-pairs multi-field transforms for efficient frame interpolation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 9801– 9810 (2023) 24. Lim, H., Won, Y., Seo, J., Park, G.M.: Conceptsplit: Decoupled multi-concept per- sonalization of diffusion models via token-wise adaptation and attention disentan- glement. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) (2025) 25. Lin, S., Wang, A., Yang, X.: Sdxl-lightning: Progressive adversarial diffusion dis- tillation. arXiv preprint arXiv:2402.13929 (2024) 26. Lin, S., Xia, X., Ren, Y., Yang, C., Xiao, X., Jiang, L.: Diffusion adversarial post- training for one-step video generation. arXiv preprint arXiv:2501.08316 (2025) 27. Lin, S., Xia, X., Ren, Y., Yang, C., Xiao, X., Jiang, L.: Diffusion adversarial post- training for one-step video generation. arXiv preprint arXiv:2501.08316 (2025) 28. Lin, S., Yang, X.: Animatediff-lightning: Cross-model diffusion distillation. arXiv preprint arXiv:2403.12706 (2024) 29. Liu, S., Zhang, Y., Li, W., Lin, Z., Jia, J.: Video-p2p: Video editing with cross- attention control. In: Proceedings of the IEEE/CVF Conference on Computer Vi- sion and Pattern Recognition. pp. 8599–8608 (2024) 30. Liu, X., Gong, C., Liu, Q.: Flow straight and fast: Learning to generate and transfer data with rectified flow. In: The Eleventh International Conference on Learning Representations (ICLR) (2023) 31. Liu, X., Zhang, X., Ma, J., Peng, J., et al.: Instaflow: One step is enough for high-quality diffusion-based text-to-image generation. In: The Twelfth Interna- tional Conference on Learning Representations (2023) 32. Long, J., Shelhamer, E., Darrell, T.: Fully convolutional networks for semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 3431–3440 (2015)

第 35 页

OSVE:基于单步扩散模型的单步视频编辑 35

33. Loshchilov, I., Hutter, F.: 解耦权重衰减正则化。在:国际学习表征会议 34. Luo, S., Tan, Y., Huang, L., Li, J., Zhao, H.: 潜在一致性模型:通过少步推理合成高分辨率图像。arXiv 预印本 arXiv:2310.04378 (2023) 35. Mao, X., 等: OSV:一步足矣实现高质量图像到视频生成。在:CVPR (2025) 36. Mokady, R., Hertz, A., Aberman, K., Pritch, Y., Cohen-Or, D.: 使用引导扩散模型编辑真实图像的零文本反转。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 6038–6047 (2023) 37. Moon, S.J., Kim, C., Park, G.M.: WINE:用于高保真度细化的小波引导 GAN 反转与编辑。在:IEEE/CVF 计算机视觉应用冬季会议 (WACV) 论文集 (2025) 38. Moon, S.J., Park, G.M.: Interestyle:编码兴趣区域以实现鲁棒的 StyleGAN 反转。在:欧洲计算机视觉会议 (ECCV)。pp. 460–476。Springer (2022) 39. Nguyen, T.H., Tran, A.: Swiftbrush:具有变分分数蒸馏的单步文本到图像扩散模型。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 7807–7816 (2024) 40. OpenAI:视频生成模型作为世界模拟器。技术报告,OpenAI (2024年2月) 41. Qi, C., Cun, X., Zhang, Y., Lei, C., Wang, X., Shan, Y., Chen, Q.: Fatezero:融合注意力以实现零样本基于文本的视频编辑。ICCV (2023) 42. Qu, L., Zhang, H., Liu, Y., Wang, X., Jiang, Y., Gao, Y., Ye, H., Du, D.K., Yuan, Z., Wu, X.: Tokenflow:用于多模态理解与生成的统一图像标记器 (2024),https://arxiv.org/abs/2412.03069 43. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., 等: 从自然语言监督中学习可迁移视觉模型。在:国际机器学习会议。pp. 8748–8763。PMLR (2021) 44. Roich, D., Mokady, R., Bermano, A.H., Cohen-Or, D.: 基于潜空间的真实图像编辑的关键调优。ACM 图形学汇刊 (TOG) 42(1), 1–13 (2022) 45. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: 使用潜在扩散模型进行高分辨率图像合成。在:CVPR。pp. 10684–10695 (2022) 46. Ronneberger, O., Fischer, P., Brox, T.: U-net:用于生物医学图像分割的卷积网络。在:国际医学图像计算与计算机辅助干预会议。pp. 234–241。Springer (2015) 47. Salimans, T., Ho, J.: 渐进式蒸馏用于扩散模型的快速采样。arXiv 预印本 arXiv:2202.00512 (2022) 48. Sauer, A., Lorenz, D., Blattmann, A., Rombach, R.: 对抗性扩散蒸馏。在:欧洲计算机视觉会议。pp. 87–103。Springer (2024) 49. Sauer, A., Lorenz, D., Blattmann, A., Rombach, R.: 对抗性扩散蒸馏。在:ECCV (2025) 50. Schuhmann, C., Vencu, R., Beaumont, R., Kaczmarczyk, R., Mullis, C., Katta, A., Coombes, T., Jitsev, J., Komatsuzaki, A.: Laion-400m:包含 4 亿个经 CLIP 过滤的图像-文本对的开放数据集。arXiv 预印本 arXiv:2111.02114 (2021) 51. Self-Forcing++ Authors: Self-forcing++:迈向分钟级高质量视频生成。arXiv 预印本 arXiv:2510.02283 (2025)

第 36 页

36 H. Lim 和 G.-M. Park

52. Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N., Ganguli, S.: 使用非平衡热力学的深度无监督学习。在:Bach, F., Blei, D.(编)第32届国际机器学习会议论文集。机器学习研究论文集,第37卷,第2256–2265页。PMLR,法国里尔(2015年7月7–9日),https://proceedings.mlr.press/v37/sohl-dickstein15.html 53. Song, J., Meng, C., Ermon, S.: 去噪扩散隐式模型。arXiv预印本 arXiv:2010.02502 (2020) 54. Song, Y., Dhariwal, P., Chen, M., Sutskever, I.: 一致性模型 (2023) 55. Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., Poole, B.: 通过随机微分方程进行基于分数的生成建模。arXiv预印本 arXiv:2011.13456 (2020) 56. Sun, K., Pan, J., Ge, Y., Li, H., Duan, H., Wu, X., Zhang, R., Zhou, A., Qin, Z., Wang, Y., 等:Journeydb:一个用于生成式图像理解的基准。神经信息处理系统进展 36, 49659–49678 (2023) 57. Tang, L., Jia, M., Wang, Q., Phoo, C.P., Hariharan, B.: 从图像扩散中涌现的对应关系。神经信息处理系统进展 36, 1363–1389 (2023) 58. Tov, O., Alaluf, Y., Nitzan, Y., Patashnik, O., Cohen-Or, D.: 为 StyleGAN 图像操纵设计编码器。ACM 图形学汇刊 (TOG) 40(4), 1–14 (2021) 59. Tumanyan, N., Geyer, M., Bagon, S., Dekel, T.: 用于文本驱动图像到图像转换的即插即用扩散特征。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第1921–1930页 (2023) 60. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J., Zeng, J., Wang, J., Zhang, J., Zhou, J., Wang, J., Chen, J., Zhu, K., Zhao, K., Yan, K., Huang, L., Feng, M., Zhang, N., Li, P., Wu, P., Chu, R., Feng, R., Zhang, S., Sun, S., Fang, T., Wang, T., Gui, T., Weng, T., Shen, T., Lin, W., Wang, W., Wang, W., Zhou, W., Wang, W., Shen, W., Yu, W., Shi, X., Huang, X., Xu, X., Kou, Y., Lv, Y., Li, Y., Liu, Y., Wang, Y., Zhang, Y., Huang, Y., Li, Y., Wu, Y., Liu, Y., Pan, Y., Zheng, Y., Hong, Y., Shi, Y., Feng, Y., Jiang, Z., Han, Z., Wu, Z.F., Liu, Z.: Wan:开放且先进的规模化视频生成模型 (2025),https://arxiv.org/abs/2503.20314 61. Wang, J., Ma, Y., Guo, J., Xiao, Y., Huang, G., Li, X.: Cove:释放扩散特征对应关系以实现一致的视频编辑。神经信息处理系统进展 37, 96541–96565 (2024) 62. Wang, Y., 等:VideoDirector:通过文本到视频模型实现精确视频编辑。在:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集 (2025) 63. Wu, J.Z., Ge, Y., Wang, X., Lei, W., Gu, Y., Shi, Y., Hsu, W., Shan, Y., Qie, X., Shou, M.Z.: Tune-a-video:针对文本到视频生成的图像扩散模型的一次性微调 (2023),https://arxiv.org/abs/2212.11565 64. Xing, Z., Feng, Q., Chen, H., Dai, Q., Hu, H., Xu, H., Wu, Z., Jiang, Y.G.: 视频扩散模型综述。ACM 计算调查 57(2), 1–42 (2024) 65. Yang, S., Zhou, Y., Liu, Z., Loy, C.C.: Fresco:用于零样本视频翻译的空间-时间对应关系 (2024),https://arxiv.org/abs/2403.12962 66. Yang, Y., Li, X., Zhang, H., Li, Z., Shechtman, E., Li, Y.: 通过对抗性自蒸馏迈向一步因果视频生成。arXiv预印本 arXiv:2511.01419 (2025)

第 37 页

OSVE:基于单步扩散模型的单步视频编辑 37

67. Yang, Z., Teng, J., Zheng, W., Ding, M., Huang, S., Xu, J., Yang, Y., Hong, W., Zhang, X., Feng, G., Yin, D., Zhang, Y., Wang, W., Cheng, Y., Xu, B., Gu, X., Dong, Y., Tang, J.: Cogvideox: Text-to-video diffusion models with an expert transformer. arXiv preprint arXiv:2408.06072 (2024) 68. Yin, T., Gharbi, M., Park, T., Zhang, R., Shechtman, E., Durand, F., Freeman, B.: Improved distribution matching distillation for fast image synthesis. Advances in neural information processing systems 37, 47455–47487 (2024) 69. Yin, T., Gharbi, M., Zhang, R., Shechtman, E., Durand, F., Freeman, W.T., Park, T.: One-step diffusion with distribution matching distillation. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 6613– 6623 (2024) 70. Yin, T., Gharbi, M., Zhang, R., Shechtman, E., Durand, F., Freeman, W.T., Park, T.: One-step diffusion with distribution matching distillation. In: CVPR (2024) 71. Yin, T., Zhang, Q., Zhang, R., Freeman, W.T., Durand, F., Shechtman, E., Huang, X.: From slow bidirectional to fast autoregressive video diffusion models. In: CVPR (2025) 72. Zhang, J., Zheng, K., Jiang, K., Wang, H., Stoica, I., Gonzalez, J.E., Chen, J., Zhu, J.: Turbodiffusion: Accelerating video diffusion models by 100-200 times. arXiv preprint arXiv:2512.16093 (2025) 73. Zhang, L., Agrawala, M.: Adding conditional control to text-to-image diffusion models. arXiv preprint arXiv:2302.05543 (2023) 74. Zhang, Z., Li, Y., Wu, Y., Xu, Y., Kag, A., Skorokhodov, I., Menapace, W., Siaro- hin, A., Cao, J., Metaxas, D., Tulyakov, S., Ren, J.: Sf-v: Single forward video generation model. In: Advances in Neural Information Processing Systems (2024) 75. Zheng, K., Wang, Y., Ma, Q., Chen, H., Zhang, J., Balaji, Y., Chen, J., Liu, M.Y., Zhu, J., Zhang, Q.: Large scale diffusion distillation via score-regularized continuous-time consistency. arXiv preprint arXiv:2510.08431 (2025) 76. Zheng, K., Wang, Y., Ma, Q., Chen, H., Zhang, J., Balaji, Y., Chen, J., Liu, M.Y., Zhu, J., Zhang, Q.: Large scale diffusion distillation via score-regularized continuous-time consistency. arXiv preprint arXiv:2510.08431 (2025)

发表评论