FlowMimic:基于像素对扭曲流场的无掩码视频编辑与模态统一

三分钟导读:FlowMimic通过像素对时间扭曲流场从图像编辑样本实时生成视频编辑数据,并利用模态模仿损失对齐图像与视频模态,实现了无需外部掩码或大型多模态模型的统一视频编辑与生成。

英文题目:FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

论文出处:arXiv 每日论文精选 · https://huggingface.co/datasets/FlowMimic/Uncompressed/resolve/main/main.pdf

原始论文:PDF / 论文页面

对应视频标题:FlowMimic:基于像素对扭曲流场的无掩码视频编辑与模态统一|推荐指数:★★★★★

这篇论文解决什么问题?

现有视频编辑数据收集依赖劳动密集型的流程(如对象掩码标注、I2V模型合成及VLM过滤),任务可扩展性有限,且视频编辑训练样本通常需符合人类感知的时序连贯性,限制了模型学习效率和任务多样性。

核心创新

  • 提出像素对时间扭曲流场,从单一图像编辑样本实时生成视频编辑训练数据,无需人工标注或复杂的视频合成管线。
  • 提出模态模仿生成损失和编辑损失,将图像和视频模态统一,通过相互模仿对齐输出分布,提升T2I的电影真实感和编辑一致性。
  • 通过感知相关任务(如指代表达分割)和区域感知损失,使模型内化编辑区域定位能力,摆脱对辅助掩码序列或大型MLLM的依赖。
  • 证明模型仅使用在线生成的视频样本(源自图像样本)即可学习广泛的视频编辑任务,包括非刚性替换、刚性替换、颜色修改等。

方法概览

1. 像素对时间扭曲流场 (Pixel-pair Temporal Warped Flow Field): 将图像编辑样本视为空间对应像素点的集合,通过构建4D时间扭曲流场,将相同的时空变换应用于源图像和目标图像,实时生成保持像素级编辑对应关系的视频编辑样本。2. 模态模仿损失 (Modality Mimic Loss): 设计模态模仿生成损失和模态模仿编辑损失,将图像视为视频的特例(单帧),对齐T2I与T2V、I2I与V2V的输出分布。3. 感知相关任务 (Sense-related Tasks): 引入指代表达分割等任务及对应的潜层和注意力层损失,使模型内化对编辑指令和参考内容的理解及区域定位能力,无需外部掩码。

逐图理解论文

像素对时间扭曲流场

像素对时间扭曲流场
Figure 1. Overview of the video editing pair generation paradigm with pixel-pair temporal warped flow field. For any given image editing training sample of a task, we can obtain video editing samples in real time via this field that enable the model to learn the video editing capability for this task. Such video editing samples align with the model’s cognitive patterns, eliminating the need to adapt them to conform to human perception. In this paper, all video editing tasks of interest are trained jointly only with our online generated video samples; the bottom-right corner illustrates an editing result for object insertion. Please refer to Sec. 4.3 for more results.

FlowMimic提出像素对时间扭曲流场,将图像编辑样本视为空间对应像素点的集合。通过构建4D时间扭曲流场,将相同的时空变换应用于源图像和目标图像,实时生成保持像素级编辑对应关系的视频编辑样本。这种方法消除了对人工标注或复杂视频合成管线的依赖,使模型能够学习视频编辑能力。

模态模仿生成损失

模态模仿生成损失
Figure 2. Overview of the pretrained T2IV model [18] and our modality mimic generation loss. The area to the left of the grey dashed line provides a schematic overview of our adopted pretrained T2IV model, while the area to the right introduces the modality mimic generation loss used in our generation training step. The DiT blocks are shared components across both sides of the dashed line. In the schematic illustrating the modality mimic generation loss, for better clarity, we present the newly created T2I sample as the (M + 1)-th sample in the current training batch. In our implementation, this new sample replaces the first T2I sample in the current training batch. The flame symbol denotes that

为了统一图像和视频模态,FlowMimic设计了模态模仿生成损失。该方法将图像视为视频的特例(单帧),通过共享DiT块,将T2I和T2V的输出分布对齐。在训练过程中,新创建的T2I样本替换当前批次中的第一个T2I样本,使模型在生成训练阶段能够相互模仿,提升T2I的电影真实感。

模态模仿编辑损失

模态模仿编辑损失
Figure 4. Overview of the modality mimic editing loss in editing training step and our model architecture adaptations to editing task, including reference-inject self-attention mask, separate 3D rope with frame correspondence, and element identity encoding. In the schematic illustrating the modality mimic editing loss, for better clarity, we present the newly created I2I sample as the (M + 1)-th sample in the current training batch. In our implementation, this new sample replaces the first I2I sample in the current training batch. Please refer to Sec. 3.3 and Sec. 3.5 for details, respectively.

在编辑训练阶段,FlowMimic引入模态模仿编辑损失,对齐I2I和V2V的输出分布。模型架构进行了适配,包括参考注入自注意力掩码、独立的3D rope以处理帧对应关系,以及元素身份编码。新创建的I2I样本同样替换当前批次中的第一个I2I样本,确保图像和视频编辑任务在潜层和注意力层的一致性。

感知相关任务

感知相关任务
Figure 6. Overview of sense-related tasks and losses. Additionally, the reference position select task is introduced in the bottom-right corner. Please refer to Sec. 3.4 and Sec. 3.5 for details, respectively.

为了使模型内化对编辑指令和参考内容的理解及区域定位能力,FlowMimic引入感知相关任务,如指代表达分割。通过潜层和注意力层损失,模型能够准确聚焦于参考视频中指代表达对应的视觉区域,无需外部掩码。这种方法使模型摆脱了对辅助掩码序列或大型MLLM的依赖,提升了编辑的精确性。

实验设置与基准

实验设置与基准
Figure 5. Convergence speed comparision between I2I and V2V. Given a reference video, I2I inference is applied to its first frame, while V2V inference is conducted on the complete video. A comparison is then performed between the first frames of the I2I and V2V inference outputs. The leftmost column presents the first frames of videos from FiVE-Bench [52]. The two central columns respectively exhibit the first frame comparative results between I2I and V2V inference at identical training steps during the nascent training phase; conversely, the two rightmost columns display analogous comparisons at the same training steps during the advanced training phase. It is discernible that during the early training stage, I2I exhibits faster convergence relative to V2V.

FlowMimic在Wan2.1-T2V-1.3B模型上进行后训练,使用在线生成的视频编辑数据和图像编辑数据进行联合训练。评估任务包括对象插入、虚拟试穿、风格化、头部替换、重光照、去模糊、视频扩展、对象移除、多参考替换、表情改变、发型改变和视频上色等。测试在FiVE-Bench和UNIC-Bench基准上进行,并与主流视频编辑方法进行比较。

实验与关键结果

  • 在Wan2.1-T2V-1.3B模型上进行后训练,使用在线生成的视频编辑数据和图像编辑数据进行联合训练。
  • 评估任务包括:对象插入、虚拟试穿、风格化、头部替换、重光照、去模糊、视频扩展、对象移除、多参考替换、表情改变、发型改变、视频上色等。
  • 使用FiVE-Bench和UNIC-Bench基准进行测试,并与主流视频编辑方法进行比较。
  • 分析交叉注意力图以验证模型对指代表达的视觉区域定位能力。
  • 测试模型在未见过的条件输入任务(如法线图到视频)和更长推理帧数上的泛化能力。
  • 在少量训练步骤(几千步)后,模型开始表现出对视频编辑任务的响应能力。(第 2 页)
  • 与预训练T2IV模型相比,FlowMimic生成的T2I结果具有更强的电影真实感(图27)。(第 3 页)
  • 在早期训练阶段,I2I推理比V2V推理收敛更快(图5)。(第 13 页)
  • 模型能够准确聚焦于参考视频中指代表达对应的视觉区域(图28)。(第 40 页)

阅读时需要注意

  • 训练数据中若存在源图像和目标图像之间的显著全局颜色差异,编辑输出可能会继承这些颜色漂移(图19)。
  • 在线生成视频编辑数据需要消耗CPU和GPU内存,限制了训练时的视频帧数(平均37帧,最大61帧)。
  • 对于某些复杂的非刚性视频编辑任务,仅使用少量权重的图像和视频编辑任务训练,模型能力有限(图22)。
  • 模型生成的视频编辑样本虽然保持了像素级对应关系,但后续帧中的对象变形可能不自然,这不影响模型学习帧间一致的像素对齐编辑关系。
  • 在推理时,模型依赖于编辑指令和参考图像(可选)来定位和修改区域,其性能受限于模型对自然语言和视觉内容的理解能力。
  • 颜色漂移问题可能源于训练数据的质量,建议实施更严格的数据收集和过滤程序。

关联工作

  • Wan2.1-T2V-1.3B:作为FlowMimic的基础预训练T2IV模型。(第 4 页)
  • Flow Matching:FlowMimic采用的流匹配框架用于视频生成训练。(第 6 页)
  • FiVE-Bench:用于评估视频编辑性能的基准数据集之一。(第 13 页)
  • UNIC-Bench:用于评估视频编辑性能的基准数据集之一。(第 24 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成与模态模仿

Dingyun Zhang1,† Lixue Gong1 Wei Liu1,§,† 1 ByteDance

从单张图像生成的规范3D网格 带有网格逆采样的像素对4D时间扭曲流场 (用于形状或运动学习的模仿可缩放相机视频运动、编辑时间对、主体变化、像素对对应关系等……)

源 帧 = t 帧 = F 像素级基础网格 帧 = 1 归一化

参考 (可选)

目标

运动 帧 = t 帧 = F … 不同类型和 强度 归一化像素级基础网格 帧 = 1

不同任务的图像编辑训练样本

重光照 风格化 头部替换 源视频

源 目标 源 目标 源 参考 目标 “给这位女士加上一顶白色花环” 物体插入 虚拟试穿 🌟 像素跟踪 编辑后的视频 时间编辑 🪄

源 参考 目标 源 参考 目标 预训练 T2IV 模型 (可选) (可选)

图 1. 基于像素对时间扭曲流场的视频编辑对生成范式概述。对于任何给定的任务图像编辑训练样本,我们可以通过该流场实时获得视频编辑样本,使模型能够学习该任务的视频编辑能力。此类视频编辑样本与模型的认知模式保持一致,无需对其进行适配以符合人类感知。在本文中,所有感兴趣的视频编辑任务仅使用我们在线生成的视频样本进行联合训练;右下角展示了物体插入的编辑结果。更多结果请参阅第 4.3 节。

摘要 目前收集视频编辑数据的方法通常 依赖于劳动密集且耗时的精心策划流程 顺应视觉研究的主流方向,我们 ——涉及物体掩码标注、通过 I2V 模型 探索在单个模型中整合视频和图像模态的生成与编辑能 进行易出错的成对合成以及基于 ControlNet 力。 的引导,以及基于 VLM 的质量过滤或精 炼——并表现出有限的任务可扩展性。因此, §项目负责人。 †通讯作者。 编辑任务的多样性仍然显著狭窄

第 2 页

像素对时间扭曲流场可以直接从图像编辑样本中实时生成相应的视频编辑样本,我们展示了在多个级别的视频编辑任务中,仅使用此类数据模型即可学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。因此,我们设计了模态模仿生成损失和模态模仿编辑损失,通过相互模仿来相对地对齐这两种模态的能力——从而对齐其输出分布。此外,基于语言的视觉编辑细化了对编辑指令的理解以及对参考视觉内容的理解,定位了参考视觉内容中对应于该指令的区域,并仅对该区域进行修改。现有方法主要依赖外部辅助,例如微调额外的多模态大语言模型(MLLM),或在推理过程中显式提供掩码序列作为辅助输入。相比之下,我们期望模型内化这种能力。为此,我们引入了感知相关任务——例如指代表达分割——以及相应的编辑区域感知的潜在级损失和注意力级损失。由于文件大小限制,arXiv 文件中的图片经过重度有损压缩。请访问未压缩文件:https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf。

1. 引言

“他们为什么没问埃文斯?” —— 阿加莎·克里斯蒂,《马普尔小姐》

视频编辑数据集的构建 [1–6] 目前依赖于劳动密集型流程,例如通过多模态大语言模型(MLLMs)[7] 标注对象掩码,包括视觉-语言模型(VLM)[8, 9] 如 SAM [10, 11]、DINO [12] 和 Qwen-VL [13–15],或者以引入错误的方式使用带有控制信号 [16] 的图像到视频(I2V)模型生成图像对的视频序列。这些范式通常依赖于特定任务,生成的视频编辑样本需要通过手动、VLM 驱动或强化学习驱动 [17] 的过程进行筛选和细化。这引发了两个关键问题:(1) 我们能否在不依赖这些繁琐且可扩展性差的流程的情况下获取视频编辑表示?(2) 视频编辑训练样本是否必须由人类可理解的时间内容组成,以便模型学习如何根据文本指令执行时间编辑?

正如阿加莎·克里斯蒂的《他们为什么没问埃文斯?》1 中的原理一样,我们主张一种更简单、更以模型为中心的方法:一种可扩展的范式,仅利用现有的多样化图像编辑样本,实时生成适合模型学习的视频编辑样本。

核心问题在于模型如何发展时间编辑能力。我们假设模型不需要符合现实世界连贯性的视频对;相反,像素级编辑对应关系的时间一致性——锚定在输入视频和编辑视频的第一帧——就足够了。即使对象在后续帧中变形不自然,模型仍然可以学习帧一致的像素对齐编辑关系。因此,在推理时,给定真实源视频和可选的参考图像,模型会产生自然连贯的编辑效果。

如图 1 所示,我们以多参考风格化编辑任务为例,其中参考图像的风格被转移到源图像的内容中。通过将输入图像和目标图像视为点(像素)的集合,我们的目标是在时间上保持一致的像素级编辑对应关系。我们朴素的动机是让每个空间对应的像素对“自由”或“随机游走”地同步穿越时间,同时在每个到达的帧平面中保持其空间对应关系。一旦模型学习了这种时间关系,在推理期间对人类可理解的视频进行编辑就成为自然的结果。我们为输入图像和目标图像构建 3D 网格,将每个视为规范图像,并通过网格逆采样构建像素对 4D 时间扭曲流场。我们的基本直觉是向模型暴露对应点流的簇,从而使时间注意力组件能够感知从第一帧对——图像模态——开始的编辑效果如何在整个视频序列中保持。具体细节推迟到第 3.2 节的方法部分。第 4 节的实验证实了这一方法,展示了基于预训练的 Text-to-Image-Video (T2IV) 模型 [18] 的多样化混合编辑任务的泛化编辑性能。我们的实验表明,通过将学习率从 5×10−6 预热到 1 × 10−5 并进行修补,精心策划视频片段以形成响应编辑对,或者使用图像对生成视频序列,模型仅在几千个训练步骤内就开始表现出对这些视频编辑任务的初步响应性。

当前用于联合视频和图像建模的方法在生成和编辑中通常依赖于两阶段训练范式:首先在图像模态上训练,然后整合视频数据 [18],或者在现有的 T2IV 模型上进行后训练,使用额外的视频和图像编辑数据 [19, 20]。处理这两种模态的关键区别在于时间注意力的存在。一个有趣的观察结果是,某些 T2IV 模型生成的图像的合成感知外观往往比生成视频的第一帧更明显,如图 3 所示。换句话说,多帧生成视频的第一帧通常表现出更好的照片

1 https://www.imdb.com/title/tt1276406/

第 3 页

与单帧生成的图像相比的真实感。事实上,我们将图像概念化为一种特殊的单帧视频模态。因此,我们旨在对齐视频和图像模态在生成和编辑任务中的输出分布。也就是说,使文本到图像(T2I)的分布尽可能接近文本到视频(T2V)的分布,同样,使图像到图像(I2I)的分布尽可能接近视频到视频(V2V)。换言之,我们旨在将图像和视频模态视为输出分布上的统一模态。为了实现这种对齐,我们设计了两种损失函数:首帧模态模仿生成损失和首帧模态模仿编辑损失。前者鼓励模型的 T2I 生成能力模仿其具有照片级真实感的 T2V 对应能力,而后者鼓励模型的 V2V 编辑响应模仿其 I2I 对应能力,后者是一个更简单的任务,因此收敛速度更快,如图 5 所示。

我们的模型 FlowMimic 在混合编辑任务训练后,展示了跨多个类别的有效编辑能力,这在第 4.3 节中进行了说明。在实践中,基于这些实验,当源编辑图像和目标编辑图像之间存在松散的布局对应关系时,用于特定视频编辑任务的像素对时间扭曲流场数据使模型能够学习相关的视频编辑能力。我们在第 4 节的实验还表明,与预训练的 T2IV 模型相比,FlowMimic 在图像模态下产生了更具相机真实感的 T2I 结果,并且其视频编辑和图像编辑结果的输出分布相对对齐。图 28 中的交叉注意力图分析显示,模型能够可靠地将文本短语定位到参考输入中的相应视觉区域。它在各种编辑任务上的表现进一步证实了它只能识别并编辑预期的编辑区域。也就是说,模型在一定程度上已经内化了编辑区域感知的编辑能力,这建立在准确理解编辑指令和参考视觉输入、在视觉输入中精确定位所述主体以及仅对该区域进行规范修改的基础之上。此外,如图 21 所示,结合在线生成的参考表达分割图像编辑样本及其对应的视频样本,FlowMimic 实现了类似 SAM3 的能力,能够对视频中语言描述的对象(如“穿黄色衣服的女孩”)进行分割和时间跟踪,这体现了我们像素对齐数据范式在高级视频任务(如参考表达分割和语义分割)中的优势。主要贡献总结如下:

• 我们将视频编辑学习的本质抽象为像素级编辑效果的时间保持,提出并建模了一个时间点流扭曲场,以从图像编辑样本中实时可扩展地生成视频编辑数据,证明了这种像素对齐范式在学习跨不同级别编辑任务的视频编辑方面的有效性,并揭示了其在分割相关任务、视频去模糊等低级视频任务以及条件图到视频等可控视频生成方面的高级视频任务中的广阔扩展性。

• 我们假设,同时在图像和视频模态上进行生成和编辑任务训练的模型,应在两种模态之间产生相对对齐的输出分布,因为图像模态本质上是视频模态的一种特殊情况。因此,我们设计了模态模仿生成损失和模态模仿编辑损失。

• 基于语言的视觉编辑能力从根本上要求模型理解指令和参考视觉输入,定位相应的

当代视觉编辑方法通常包含增强视觉认知理解的机制。一些方法 [21–23] 在推理期间提供显式掩码以区分编辑区域,而一些基于传播的方法 [24] 在训练期间引入辅助编辑区域掩码预测模块。许多主流工作 [19, 20, 25] 将 MLLMs 与连接器(无论是冻结还是微调)集成,以细化视觉和文本令牌,利用 MLLMs 的能力来定位编辑区域。在本工作中,我们旨在增强模型在自然语言理解、视觉理解、文本与视觉区域之间的跨模态匹配以及编辑区域感知编辑方面的能力。这使得模型能够基于编辑指令在参考视频或图像中定位预期的编辑区域,并仅修改该特定区域。与那些在推理期间依赖辅助编辑区域掩码序列作为输入,或利用 MLLMs 先验但需承担大量模型参数代价的方法相比,我们旨在让模型内化这些能力。为此,我们引入了感知相关任务,包括参考表达分割任务和感知选择任务,以及相应的编辑区域感知潜在级和注意力级损失。

为了验证我们的数据范式和算法的可行性,我们采用了一个轻量级模型和一种在线生成视频编辑样本的方式。具体而言,我们在预训练的 T2IV 模型 Wan2.1-T2V-1.3B [18] 上进行后训练,并调整模型架构以适用于编辑任务,包括引入参考注入自注意力掩码。为了验证我们的数据范式,我们仅使用图像编辑样本以及通过像素对时间扭曲流场从图像编辑样本在线生成的视频编辑样本进行训练。换言之,我们没有使用任何其他专门策划的视频编辑数据。

第 4 页

参考视觉输入中的区域,并对其进行修改。我们并不依赖微调额外的模块(例如带有连接器适配或辅助掩码序列输入的视觉语言模型),而是通过引入感知相关任务以及相应的编辑区域感知潜在层和注意力层损失,赋予模型这种内化的能力。

2. 相关工作

2.1. 丰富的图像编辑数据集

近年来,公开可用的图像编辑数据集规模持续扩大,不同数据集在不同方面表现出色。我们在下面简要介绍几个例子。MagicBrush [26] 是一个用于基于指令的真实图像编辑的手动标注数据集。它包含超过 10K 组的源图像、编辑指令和目标图像三元组。Pico-Banana-400K [27] 是一个用于基于指令的图像编辑的 400K 图像数据集。它是利用 Nano Banana2 从真实照片中生成编辑对构建而成的。它通过基于多模态大语言模型(MLLM)的质量评分和筛选来保持内容保留和指令忠实度。此外,GPT-IMAGE-EDIT-1.5M [28] 包含超过 150 万高质量编辑三元组。它利用 GPT-4o3 统一并精炼了三个现有的图像编辑数据集。ImgEdit [29] 包含 100 万精心策划的编辑对,其中包含新颖且复杂的编辑任务。

2.2. 视频编辑数据策展范式

近年来,为了推动视频编辑领域的发展,研究人员也投入了大量精力来创建视频编辑训练数据。InsV2V [1] 构建了一个合成视频编辑数据集,以克服自然配对视频稀缺的问题。该方法在视频扩散模型上应用了 Prompt-to-Prompt [2] 方法,同时利用来自图像描述和视频描述的配对文本提示。生成的 16 帧视频样本随后使用基于 CLIP 的指标 [30] 进行过滤。Se˜norita-2M [3] 在线收集视频。其数据集是通过编排一系列专门的编辑专家管道创建的——包括局部和全局风格化器、移除器和修复器——应用于源视频。生成的视频对随后使用基于 CLIP 的指标和训练好的分类器进行过滤,以确保质量。此外,Ditto [4] 利用编辑后的关键帧和深度图生成编辑视频。另外,InsViE-1M [5] 利用两阶段编辑-过滤流水线从真实视频中生成三元组。在第一阶段,它编辑每个视频的第一帧并筛选出最佳编辑样本。在第二阶段,它通过噪声反转和 I2V 模型编辑视频,并使用视觉语言模型(VLMs)进行过滤。OpenVE-3M [6] 是通过多阶段流水线构建的,该流水线依赖于编排视觉语言模型(例如 GPT-4o)和 I2V 模型(例如 Wan2.1-I2V [18])来合成编辑对。这一过程涉及复杂的、特定于类别的生成工作流,随后是基于 VLM 的过滤。使用渲染数据也是特定子任务的可行方法。在 2024 年初的实习期间,Dingyun Zhang 提出使用 3D 游戏引擎和 Mixamo4 构建相机可控的身体动画视频训练数据。这种方法后来被用于构建视频重光照 [31] 或重新相机 [32] 任务的训练数据集。

2.3. 视频编辑范式

最近的视频编辑范式大致可分为免训练(training-free)和基于训练(training-based)的方法。对于免训练方法,通常的前提是通过反转技术将源视频映射到预训练视频模型的初始噪声。后续编辑过程的成功在很大程度上取决于这个初始噪声潜在的质量,因此对所使用的反转方法提出了严格要求。AnyV2V [33] 将现有的图像编辑方法应用于第一个源帧,将源视频反转为 I2V 模型的初始噪声,并在 DDIM [34] 采样期间将源视频分支的空间卷积、空间注意力和时间注意力特征注入到编辑视频分支中。Videoshop [35] 引入了带有噪声外推的反转,以提高从初始噪声重建源视频的质量。此外,ContextFlow [36] 提出了针对对象相关视频编辑的整流流 [37] 反转。它使用现成的图像编辑工具编辑第一个源帧,并通过双路径采样过程解耦重建和编辑。

基于训练的视频编辑范式旨在通过微调视频模型的参数或引入可学习的 LoRA [38] 参数来提升编辑能力。I2VEdit [39] 和 GenProp [24] 通过添加 LoRA 微调 I2V 模型,并在推理期间像 AnyV2V 一样将现成的第一帧编辑结果传播到视频的其余部分。VACE [40] 训练了一个即插即用的上下文适配器,以将任务概念注入到预训练的 T2V 模型中。VideoPainter [21] 引入了 ID 适配器以增强时间身份一致性。此外,UNIC [22] 微调了基于 DiT [41] 的预训练视频模型并采用上下文学习。它引入了任务相关的 RoPE [42] 和条件偏差以区分编辑任务。具体而言,GenProp 训练了一个掩码预测器来识别编辑区域。VACE、VideoPainter 和 UNIC 在推理期间利用提供的编辑区域掩码序列来定位编辑区域。

2 https://gemini.google/overview/image-generation/ 3 https://openai.com/index/hello-gpt-4o/ 4 https://www.mixamo.com

第 5 页

T2V 和 T2I 样本 T2V 和 T2I 样本 (T2I 样本数量 = M) (T2I 样本数量 = M) 🎞 🎞 🖼

其他 T2V / T2I 样本 🖼 T2I 样本 1 T2V 样本 1 (4N + 1 帧) T2I 样本 1 T2V 样本 1 (4N + 1 帧) Wan2.1 T2IV 概述📎 FlowMimic 📎 T2IV 概述 3D VAE 编码器 首帧潜在表示 3D VAE 编码器 带有模仿策略 🧊 🧊 … …

T2V 样本 1 视频潜在表示 ([N+1, :, :, :]) T2I 样本 1 图像潜在表示 T2V 样本 1 视频潜在表示 ([N+1, :, :, :]) T2I 样本 1 图像潜在表示

添加噪声 复制噪声、时间步、加噪潜在表示、文本嵌入 添加噪声 … …

T2V 样本 1 视频加噪潜在表示 ([N+1, :, :, :]) T2I 样本 1 加噪潜在表示 T2V 样本 1 视频加噪潜在表示 ([N+1, :, :, :]) T2I 样本 M + 1 图像加噪潜在表示 T2I 样本 1 图像加噪潜在表示

展平、分块 预训练 T2IV DiT 模块 3D 时空自注意力 ⇥ Nb

交叉注意力 🔥 去块、去展平 损失模块 损失模块 gen 流匹配损失 … Lmimic, 流匹配损失 单步反向 单步反向 … T2V 样本 1 视频去噪潜在表示 T2I 样本 M + 1 图像去噪潜在表示

3D VAE 解码器 可视化 🧊 图像空间 Ezp,✏,t ku✓(˜zp,t, cp, t) , 8 zp h −vtk2i ⇠⇡1, I),I MimicI ✏⇠N(0, LFM = >>>>>>>>>< t ⇠pt, = ˜zp,t tzp + (1 −t)✏, 单步 反向 单步 反向 = vt zp M + 1 去噪图像 ✏ T2V 样本 1 视频去噪 首帧 T2I 样本 −✏. >>>>>>>>>: 图 2. 预训练 T2IV 模型 [18] 和我们提出的模态模仿生成损失的概述。灰色虚线左侧的区域提供了我们采用的预训练 T2IV 模型的示意图,而右侧区域介绍了我们在生成训练步骤中使用的模态模仿生成损失。DiT 模块是虚线两侧共享的组件。在说明模态模仿生成损失的示意图中,为了更清晰起见,我们将新创建的 T2I 样本表示为当前训练批次中的第 (M + 1) 个样本。在我们的实现中,这个新样本替换了当前训练批次中的第一个 T2I 样本。火焰符号表示这些部分的参数在训练过程中被优化,而冰块符号表示这些部分的参数保持冻结。详细信息请分别参见第 3.1 节和第 3.3 节。

2.4. 任务特定的编辑模型 验。KeyTailor [45] 提出了一种基于关键帧的细节注入策略用于视频虚拟试穿。它还引入了一个涵盖多种服装风格的高清视频试穿数据集。一些方法采用额外的条件信号以实现可控编辑,通常基于 ControlNet 类 [16] 或适配器类模块。例如,人像动画方法 Rig-Your-Portrait [46] 首次将显式 3D 引导(例如,个性化网格和法线图)与身份-表情-光照解耦策略相结合,并应用于视频生成模型,从而实现了面部表情、

第 6 页

头部姿态或光照从驱动图像或视频中解耦地迁移到参考肖像的训练数据,从而使模型能够学习风格化的文本到视频(T2V)生成。

2.5. 统一的图像到视频(IV)编辑与生成方法

3.1. Wan2.1 与流匹配损失(Flow Matching Loss)预备知识

如图 2 左侧所示,Wan2.1 是一个基于扩散 Transformer(DiT)[41] 构建的 T2IV 模型。以视频输入为例,视频样本 $S_V \in \mathbb{R}^{(4N+1)\times H \times W \times C}$ 由 3D 时空变分自编码器(VAE)编码为潜在表示 $z_p \in \mathbb{R}^{(N+1)\times \lfloor H/8 \rfloor \times \lfloor W/8 \rfloor \times 16}$,随后被展平并分块化为视觉 token $z_p$。第一帧仅由 VAE 编码器进行空间压缩。在训练过程中,给定从对数正态分布 $p_t$ 采样的时间步 $t$,潜在变量被高斯噪声 $\epsilon$ 扰动,产生带噪视觉 token $\tilde{z}_{p,t}$,并经过 3D 时空全自注意力层 [50]。同时,文本描述 $c_p$ 由 T5 [51] 分词器进行 tokenization,并由 T5 文本编码器编码为文本嵌入。带噪视觉 token $\tilde{z}_{p,t}$ 随后在文本嵌入的交叉注意力指导下进行去噪。

遵循流匹配 [37] 框架,DiT 骨干网络学习预测速度场 $\hat{v}_t$,该速度场逐步引导噪声样本趋向于干净数据流形。其核心目标是建模一个定义直线轨迹的向量场——即从简单噪声分布 $\pi_0$(例如 $\mathcal{N}(0, I)$)到目标数据分布 $\pi_1$ 的最短且最高效的路径。与随机扩散路径相比,这种公式提供了更稳定且高效的训练目标。实际上,对于给定的数据样本(即视频潜在变量)$z_p$、噪声潜在变量 $\epsilon \sim \mathcal{N}(0, I)$ 以及时间步 $t \in [0, 1]$,基于流匹配假设,在线性插值约束下构建它们之间的直线路径:

$$ \tilde{z}_{p,t} = (1-t)z_p + t\epsilon \quad (1) $$

该路径的导数定义了目标速度:

$$ v_t = \epsilon – z_p \quad (2) $$

条件于文本描述 $c_p$ 的 T2IV 模型 $u_\theta$ 被训练以预测此速度:

$$ \hat{v}_t = u_\theta \quad (3) $$

其中 $\theta$ 表示模型参数。训练目标最小化数学期望:

$$ \mathcal{L}_{\text{FM}} = \mathbb{E}_{z_p, \epsilon, t} \left[ \| \hat{v}_t – v_t \|^2 \right] \quad (4) $$

关键在于,对于任何 $t$,$v_t = \epsilon – z_p$ 是常数,这提供了一个简单且时间不变的学习信号,鼓励更好的收敛性和更高的采样质量。

3. 方法论

FlowMimic 建立在公开可用的 Wan2.1-T2V-1.3B 模型 [18] 之上,这是一个具有出色基础视频生成能力的预训练 T2IV 模型。我们采用这个相对轻量的模型进行实验。本节详细介绍我们的方法。我们首先在 3.1 节简要概述 Wan2.1 的核心架构及其流匹配损失 [37]。接着在 3.2 节详细介绍以像素对时间扭曲流场(Pixel-pair temporal warped flow field)为中心的数据范式。随后在 3.3 节介绍第一帧模态模仿损失(Modality mimic losses),该损失将视频和图像模态视为统一形式,并通过模态模仿生成损失(Modality mimic generation loss)和模态模仿编辑损失(Modality mimic editing loss)促进相互模仿。为了增强模型对编辑指令中指定的编辑区域与参考视觉区域之间跨模态对应关系的认知理解,并提高其编辑区域感知能力,我们在 3.4 节引入了指代表达分割 [49] 任务及其相应的潜在级编辑区域感知和注意力级损失。在 3.5 节,我们提出了针对编辑任务对模型架构所做的调整。此外,我们在 3.6 节提供了有关编辑任务的更多细节。最后,在 3.7 节,我们简要介绍了使用风格化 T2I 进行头部姿态或光照从驱动图像或视频中解耦地迁移到参考肖像的训练数据,从而使模型能够学习风格化的 T2V 生成。

第 7 页

3.2. 像素对时间扭曲流场

如图 1 所示,我们引入了一种可扩展的范式,用于从单个图像编辑样本生成视频编辑训练样本。核心思想是,图像编辑对 $G_{\text{pair}}$(包括源图像和目标图像)可以被视为两组空间对应的点集(即像素),而视频编辑对则是这两组点集(即点流)沿时间轴的“同步行走”。无论时间平面如何,同一空间位置的点都保持编辑对应关系。对于模型而言,视频编辑的学习本质在于实现并维持跨时间轴的像素级编辑对应关系。为此,我们定义了一个共享的、时变的变形场——像素对时间扭曲流场(Pixel-pair temporal warped flow field)——它对源图像和目标图像应用相同的空间变换,从而产生一个时间连贯的视频对,其中每一帧都保持相同的像素级编辑关系。

我们在训练过程中在线构建视频编辑对。我们首先收集感兴趣任务的图像编辑对,例如重光照、风格化、头部交换、物体插入、虚拟试穿等。在训练期间,我们从这些对中随机采样,例如,选择一个带有参考图像的风格化样本。

令 $(I_{\text{ref}_1}, I_{\text{ref}_2}, \dots, I_{\text{ref}_n}, I_{\text{tar}})$ 表示归一化的图像编辑样本。具体而言,$I_{\text{ref}_1}$ 是源图像,$I_{\text{ref}_2}, \dots, I_{\text{ref}_n}$ 是可选的参考图像,$I_{\text{tar}}$ 是目标图像。在图 1 的例子中,这是一张年轻男子的照片,$I_{\text{ref}_1}$ 是一张 3D 动画风格的参考图像,$I_{\text{tar}}$ 是参考自 $I_{\text{ref}_1}$ 的年轻男子的 3D 动画风格照片。

我们首先构建规范采样网格 $G_{\text{ref}_1}^{\text{base}}, G_{\text{tar}}^{\text{base}} \in [-1, 1]^{H \times W \times 2}$,它们分别表示图像编辑对 $(I_{\text{ref}_1}, I_{\text{tar}})$ 在归一化坐标空间中的网格。如图 1 所示,我们以源图像的规范基础网格和目标图像的规范基础网格中的三个空间对应像素对为例,即蓝色、绿色和紫色像素对。我们的目标是确保在随后的每个时间帧平面上,这些像素对轨迹与该平面的交点保持同步并对齐。为此,对于给定的视频长度 $F$,我们通过应用随机化、依赖于时间的几何变换的组合,生成 4D 时间变形网格 $G_{\text{ref}_1}, G_{\text{tar}} \in [-1, 1]^{F \times H \times W \times 2}$,其中 $G_{\text{ref}_1}^t = G_{\text{ref}_1}[t]$ 且 $G_{\text{tar}}^t = G_{\text{tar}}[t]$,$t \in \{0, 1, \dots, F-1\}$。关键在于,相同的变形序列被应用于源图像和目标图像,从而保证第一帧建立的像素级编辑映射在整个序列中得以保留。

给定基础网格 $G_{\text{base}}$、特定运动类型 $M$、帧号 $t$、运动强度超参数 $\alpha$ 以及依赖于样本的随机种子 $S$,帧号 $t$ 处的变形网格定义为:

$$ G_t = \mathcal{W}(G_{\text{base}}, M, t, \alpha, S) \quad (5) $$

$G_{\text{pair}}$ 依赖于随机种子 $S$,因为某些参数在由 $f_\alpha(M)$ 定义的预定区间内进行样本级均匀采样,从而增强生成视频在运动强度方面的多样性。此外,我们确保为给定样本的源图像和目标图像提供相同的随机种子 $S$,从而保证对这对图像应用相同的变形序列。我们使用“正向运动类型”一词来表示从原始图像对开始构建视频编辑对,使用“反向运动类型”来表示生成的序列以原始图像对结束。形式上,令 $d(\mathcal{C})$ 为一个方向函数,指示运动类型是正向 ($d=0$) 还是反向 ($d=1$),则:

$$ \begin{cases} G_0 = G_{\text{base}} & \text{if } d=0 \\ G_{F-1} = G_{\text{base}} & \text{if } d=1 \end{cases} \quad (6) $$

随后,给定 $F$ 帧网格序列,我们通过双线性网格逆采样操作生成对应的 $F$ 个归一化视频帧。形式上,对于每个帧索引 $t$,源帧和目标帧计算如下:

$$ \begin{cases} I_{\text{ref}_1}^t = \mathcal{W}(I_{\text{ref}_1}, G_{\text{ref}_1}^t) \\ I_{\text{tar}}^t = \mathcal{W}(I_{\text{tar}}, G_{\text{tar}}^t) \end{cases} \quad (7) $$

其中 $G$ 表示双线性网格逆采样算子。该操作在由变形网格指定的坐标处对输入图像进行采样,产生具有相同空间维度的输出帧。当采样坐标落在区间 $[-1, 1]$ 之外时,我们将边界外的网格位置的值反射到边界内。

我们在以下段落中简要介绍一组运动类型及其组合的扭曲函数 $\mathcal{W}$;事实上,运动类型是完全可定制的,可以自由指定或组合。直观地说,我们使用基于平移、基于缩放和基于旋转的运动来模拟相机运动,而拉伸型和弹性型变形则模拟编辑对象或整个场景的随机形状、布局或运动变化。

平移运动类型。如图 1 右侧所示,平移运动变换沿指定方向平移点集。对于给定的基础网格 $G_{\text{base}} \in [-1, 1]^{H \times W \times 2}$、平移距离 $\alpha > 0$ 以及归一化时间混合因子 $u_t = \frac{t}{F-1} \in [0, 1]$,向右平移的扭曲函数定义为:

$$ G_t = \mathcal{W}(G_{\text{base}}, t, \alpha, u_t) \quad (8) $$

第 8 页

具体而言,对于网格中的每个空间位置 $(h, w)$:

均匀旋转定义为:

$$ G_t[h, w] = \mathcal{G}_{\text{base}}[h, w] \tag{9} $$

其中时间相关的旋转角度(以弧度为单位)为:

$$ \theta_t = \theta_{\max} \cdot \tau \tag{14} $$

混合因子 $\tau$ 从第一帧 ($t=0$) 的 0 线性增加到最后一帧 ($t=F-1$) 的 1,从而在整个序列中产生平滑的变化。类似地,其他三个基本平移方向可以表述为:

$$ \mathcal{G}_t[h, w] = \mathcal{G}_{\text{base}}[h, w] + \mathbf{W} \tag{10} $$

其中 $R(\theta)$ 表示标准的 2D 旋转矩阵:

$$ R(\theta) = \begin{bmatrix} \cos \theta & -\sin \theta \\ \sin \theta & \cos \theta \end{bmatrix} \tag{15} $$

具体而言,对于网格中的每个空间位置 $(h, w)$,变换后的坐标通过矩阵-向量乘法获得:

$$ G_t[h, w] = R(\theta_t) \mathcal{G}_{\text{base}}[h, w] \tag{16} $$

其他基于平移的运动类型可以类似地定义。反向运动类型是通过反转生成的网格序列获得的。特别是,对于平移运动类型,当采样坐标位于 $[-1, 1]$ 之外时,我们使用边界值来处理越界的网格位置,这旨在处理编辑区域在第一参考帧中尚未完全可见的情况。

缩放运动类型。 缩放运动变换随时间均匀缩放点集,模拟相机变焦(放大或缩小)效果。给定基础网格 $G_{\text{base}} \in [-1, 1]^{H \times W \times 2}$,缩放边界 $\alpha = [s_{\min}, s_{\max}]$ 以及归一化混合因子 $\tau$,均匀缩放的扭曲函数定义为:

$$ G_t[h, w] = \mathcal{G}_{\text{base}}[h, w] \cdot s(t) \tag{11} $$

其中时间相关的缩放因子 $s(t)$ 由下式给出:

$$ s(t) = \begin{cases} s_{\min} + \tau \cdot (s_{\max} – s_{\min}), & \text{if } \tau \in [0, 1] \\ \end{cases} \tag{12} $$

因此,放大运动使缩放比例从 $s_{\min}$ 线性增加到 $s_{\max}$,随着坐标被越来越大的数除,有效地放大了图像内容。相反,缩小运动使缩放比例从 $s_{\max}$ 减小到 $s_{\min}$,缩小了表观内容。在本文中,逆时针旋转使角度从 0 线性增加到 $\theta_{\max}$(转换为弧度),而顺时针旋转使角度从 0 减小到 $-\theta_{\max}$。旋转均匀应用于所有点,保持图像平面内的相对距离和方向。

拉伸运动类型。 拉伸局部运动变换在空间上应用随时间变化的变形,以模拟编辑区域的形状或布局变化。给定基础网格 $G_{\text{base}} \in [-1, 1]^{H \times W \times 2}$,我们采样一组 $k$ 个变形中心,其中每个中心 $j$ 由其采样位置 $\mathbf{p}_j = (x_j, y_j)$、影响半径 $\rho_j \in [\rho_{\min}, \rho_{\max}]$ 和强度 $\sigma_j \in [\sigma_{\min}, \sigma_{\max}]$ 定义;$\rho_{\min}, \rho_{\max}, \sigma_{\min}, \sigma_{\max}$ 是从超参数预定义区间中抽取的。令 $\tau$ 为归一化混合因子。对于空间索引为 $(h, w)$ 且坐标为 $\mathbf{p}$ 的网格点,由第 $j$ 个中心引起的位移为:

$$ D_j(\mathbf{p}) = \begin{pmatrix} \dots \end{pmatrix} \tag{17} $$

我们将 $s_{\min} = 1.0$。相同的缩放因子应用于两个空间维度,从而保持纵横比。其中 $r_j = \sqrt{p – c_j}$ 且 $\gamma_j(r_j) = \dots$ 是一个线性衰减因子,当超出半径 $\rho_j$ 时该因子消失。$(h, w)$ 处的总位移是所有中心贡献的总和,因此第 $t$ 帧的变形网格为:

$$ G_t[h, w] = G_{\text{base}}[h,w] + \sum \dots \quad (18) $$

旋转运动类型。旋转运动变换随时间围绕原点旋转点集,模拟相机旋转效果。给定基础网格 $G_{\text{base}} \in [-1, 1]^{H \times W \times 2}$,从 $f_{\dots}$ 获得的最大旋转角度 $\alpha = \theta_{\max} > 0$(以度为单位)以及归一化混合因子 $\tau = \frac{1}{\dots}$,对于 $\dots$ 的扭曲函数为

第 9 页

将整体变换写为扭曲函数 相同的分段线性缩放轨迹被应用于 给出了: 源图像和目标图像,因此,像素 级的编辑对应关系在整个 \ b gin {a ligned} G_t & = \m a 生成的视频序列中也得以保留。 } e t h cal { W l (G_{\text(19) big 弹性运动类型。弹性运动变换 \ 生成一系列随时间随机演化的非刚性、流体状位移 where Dj denotes the pointwise displacement field gener- 场,产生动态的视频失真。给定基础网格 Gbase ∈平滑、径向衰减的形变,模拟自然 ated by the j-th centre. This stretch-local function produces [−1, 1]H×W ×2,对于每个(t)帧索引 t,我们×2 采样一个独 shape changes; because the identical centres, radii, strengths, 立的噪声场 N ∈[−1, 1]H×W 具有独立且均匀分布的随机值,通过种子 S。一个 images, the pixel-wise editing correspondence is preserved ×2 exactly throughout the generated video sequence. 平滑位移场 D(t) ∈RH×W 对于(t) 帧 t 然后通过对 N 的每个通道进行 2D 卷积获得 The stretch-global motion transformation applies a 标准差为 σ 的高斯核 Gσ:分段线性、各向异性缩放整个图像 平面随时间变化,从而模拟场景整体布局的平滑变化。给定基础网格 Gbase ∈ ) p 1]H×W ×2,我们首先将时间序列长度为 F 划分为 m 个连续段,其中 m 是随机 max(H,W ) 以与图像大小成反比的方式缩放位移幅度 drawn from the interval [mmin, mmax], where mmin, mmax 从区间 [mmin, mmax] 中选取,其中 mmin, mmax 由函数 fα(M) 确定的超参数。σ 和 α0 是从 are obtained from the hyperparameter 函数 每个 卷积 施加空间 连贯性 fα(M)。从 fα(M) 中选取。每个段 帧, i (for i = 1, . . . , m) 包含 fi 与 within each frame, 确保相邻点 以 i=1 fi = F. 相关的方式移动,而每个帧的独立噪声产生随时间变化的失真模式。 For every segment i, we independently sample 令 τ = F −1t 1] 为归一化混合因子。 ∈[0,sx,i [sx,min, sx,max] 和 sy,i [sy,min, sy,max]. 变形网格在帧 t 处通过添加帧特定的位移场的缩放版本到sx,min, sx,max, sy,min, sy,max 是从 fα(M) 中获取的。 基础网格获得: Let s0 = (1, 1) denote the initial (identity) stretch fac- 因子。在段 i 内,缩放因子线性演化 to For inside that segment the j-th framefrom si−1 si. \ b gin {a ligned} G_ t &= \m a (25) the intra-segment progress is defined as:(0 < fi), ≤j h cale { W } bigl t \ = { c as 显式地,对于每个空间位置 (h, w), \ eg in (20) \ b taes } \d f rac G_t [h , w] = G_{ \t e x {base} }[h,w](26) t 该帧处的当前缩放因子为: u 因此,对于每一帧,生成独立的随机位移 \beg 场,然后从第一帧(τ = 0)时的零线性缩放到最后一帧 \ [4pt](21) a trix } _x ( t) 时的全幅度(τ = 1),产生平滑、全局连贯但随时间变化的弹性失真。由于源图像和目标图像使用相同的随机 The deformation grid at the corresponding global frame 种子 S,因此位移场序列 {D(t)}F index t 是通过在两个空间维度上独立缩放基础网格坐标获得的: −1 t=0 被完全保留,保证在整个生成的视频序列中像素级编辑对应关系得以精确保留。 G_t [h , ] = \ b e trix}(22) 组合运动类型。组合运动类型可以通过将两个或更多基本运动类型的扭曲函数组合到每一帧索引 t 的基础网格上来构建。我们使用两个基本运动类型的最简单情况来说明这一点。给定基础网格 Gbase \ bigl (G_{\ te c ∈[−1, 1]H×W ×2 和两个扭曲函数 W1 和 W2,分别对应于运动类型 a 和 b, where (x, y)⊤= Gbase[h, w]. Writing the whole transforma- 将整体变换写为扭曲函数可得: tion as a warping function yields: 在每一帧索引 t 处对基础网格应用。 \ b gin {a ligned} G_t &= \ ma t le {W} h (23) \ bigl (G_{\ te c a xt {b se}}, \mat hr m

第 10 页

类型分别为 M1 和 M2,运动类型的复合变形类型被附加到原始源和目标中,定义为:

$$ G_t = \mathcal{W}_2 \left( \mathcal{W}_1 \right) \quad (27) $$

其中 $\alpha_1, \alpha_2$ 是各自运动类型的超参数集,$S$ 是依赖于样本的随机种子。由于每个单独的变换在时间上是连续的,复合扭曲也是连续的,从而产生结合了两个分量效果的时序平滑运动。

作为一个具体示例,考虑由向右平移与局部拉伸效应组合而成的复合运动。给定基础网格 $G_{\text{base}} \in [-1, 1]^{H \times W_{\text{local}} \times 2}$,我们首先通过拉伸局部扭曲函数 $\mathcal{W}_{\text{stretch}}$ 及其对应的超参数生成拉伸网格序列 $\{G_{\text{stretch}}^t\}_{t=0}^T$。令 $\alpha_p > 0$ 为平移距离,$\tau = t/T \in [0, 1]$ 为时间混合因子。则帧 $t$ 处的复合变形网格通过在线性平移位移上加上拉伸网格获得:

$$ \begin{aligned} G_t &= \mathcal{W} \left( G_{\text{base}}, \alpha_p, \alpha_s \right) \quad (28) \end{aligned} $$

其中 $\alpha_s$ 表示拉伸局部分量的超参数。显式地,对于每个空间位置 $(h, w)$,

$$ G_t[h, w]_x = G_{\text{stretch}}^t[h, w] \quad (29) $$

且线性平移项在 $t$ 上是连续的,因此复合扭曲也是连续的,产生平滑的复合运动,同时表现出局部形状变形和全局平移。

我们可以自由定义单个运动类型,然后任意组合它们。每种运动类型的参数可以自由配置;例如,平移的方向可以是任意的。运动类型可以通过如上所述组合选定的子集以同时应用,或者通过将序列在时间上划分为多个段,每段采用不同的运动类型来进行组合,例如,“随机缩放”由从“放大”和“缩小”运动类型中随机采样的段组成。对于后续段,初始缩放比例设置为前一段的最终缩放比例,这确保了整个视频序列的时间平滑过渡。在实践中,我们发现即使仅对这些运动类型中的子集进行两两组合,也能使模型学习视频编辑。

视频编辑样本的文本描述。对于从图像编辑样本的源图像和目标图像派生的视频编辑对,使用与图像编辑样本相关的相同描述。例如,对应于“向左平移”的运动描述包括“摄像机向左平移”,而对应于“随机缩放”的描述包括“摄像机随机缩放”,从而将运动描述纳入最终描述中。在推理过程中,原始源和目标描述不使用此类运动类型附加内容。关于编辑描述,除了第 3.6 节介绍的第一帧传播任务外,所有其他任务都保留图像编辑描述;也就是说,我们并未在编辑描述中刻意区分“视频”和“图像”。此外,关于交叉注意力过程,对应于目标元素的输出描述由编辑描述和目标描述的字符串连接形成。

运动强度的影响。由 $f_\alpha(M)$ 映射的运动强度超参数可以自由调整。当运动强度温和时,生成的视频表现出非常平滑的帧间过渡,类似于高帧率效果。相反,当运动强度增加时,帧间运动变化变得更加明显,类似于低帧率效果。我们发现运动参数的强度既影响收敛速度,也影响编辑效果。具体而言,当强度增加时,模型收敛更快,并倾向于执行刚性编辑,例如外观编辑;相反,当强度降低时,模型在物体形状上进行非刚性编辑的能力更强。在本文中,运动强度参数设置为中等水平。

模型看到了什么?当视频像素在扩散训练空间中被展平为视觉令牌时,模型观察到源视频和目标视频在时间上保持像素级编辑对应关系,这是一种易于察觉的规律性。我们在第 4 节中证实了模型因此能够学习像素跟踪时间编辑的假设。

3.3. 第一帧模态模仿损失

图像和视频模态可以被视为单一模态,其中图像是单帧视频的特例。预训练的 T2IV 模型 Wan2.1 是在视频和图像数据的混合体上训练的。自然地,我们期望 T2I 的生成质量与 T2V 紧密匹配,例如其第一帧的分布,因为前者可以被视为后者的一个特例。如图 3 所示,我们在相同的描述和种子下,分别对 1、25、49 和 61 帧进行推理,分辨率为 832 × 480,并观察到单帧结果表现出明显更合成的外观,这比多帧输出更为显著。这表明简单地混合

第 11 页

x t { t2 i, t}}16}, T2V Prompt 1 with Same Seed of this noisy latent, \protec t \tilde {z }^ 1 _{\t e is then treated as a new noisy T2I sample. Correspondingly, the first frame original latent z1t2i = z1t2v[: 1], the first frame T2V Prompt 2 with Same Seed noise ϵ1t2i = ϵ1t2v[: 1], the same timestep t, and the original first frame caption’s text embeddings c1t2v-f are assigned to this newly constructed T2I sample, which is then added to T2V Prompt 3 with Same Seed the training batch. We also use the original first frame cap- tion’s text embeddings as the text embeddings for this T2V First Frame of 1-frame Video (i.e., T2I) First Frame of 25-frame Video First Frame of 49-frame Video First Frame of 61-frame Video sample. In this way, the newly added T2I sample and the first frame of the T2V sample share identical configurations Figure 3. T2V first frame results from the pretrained T2IV model under increasing before entering the DiT blocks, the sole distinction being inference frame counts, using identical prompts and random seeds, at a resolution of 832 × 480. When the inference frame count is 1, the output corresponds to the T2I that the latter is not an independent sample but is denoised result. It can be observed that the T2I result exhibits a stronger synthetic or artificial jointly with the subsequent frames as a temporal sequence. appearance, with weaker cinematic realism compared to the first frame result from temporal multi-frame inference. Both ˜z1t2v, t and ˜z1t2i, t are then flattened and patchified before being passed through Nb identical DiT blocks that perform 3D spatial-temporal self-attention and cross-attention, fol- data during training is insufficient to align the generative lowed by an unpatchify and unflatten operation to recover distributions of the image and video modalities closely. the original latent space shape: Some research [53] analyzes that 3D self-attention heads \b \ha t { v}^1_{\t ein diffusion transformers naturally specialize, with some fo- \left \ { e gin { l i gned} (30)cusing on spatial relations and others on temporal coherence. {t2v}, t } &= a {F}^{-1} \c irc \mat h xtl h a lConsequently, a key difference between single-frame T2I where ˆvt denotes the\matpredictedc velocity field at timestepca t,and multi-frame T2V is that the latter, by virtue of its tempo- F flattening, patchification, the stack of DiT blocks,ral dimension, is inherently more suited to such an entangled, P D P−1 and the corresponding inverse operations, andspatio-temporal full self-attention architecture; whereas the F−1 ◦the composition function operator. Indeed, the order of noisingformer may exhibit unnatural, synthetic artifacts due to the and flattening can be interchanged arbitrarily, and whetherpresence of temporal attention heads. flattening or not does not affect the computation of the loss A natural idea is to make the distribution of the model’s in this paper. denoising outcome for the first frame of a T2V sam- The subsequent one-step reverse computation to obtain ple—when treated as a non-temporal image sample—closely the estimated original latents, ˆz1t2v,0 and ˆz1t2i,0, is based on thematch the distribution when that same frame is denoised flow matching assumption. The linear diffusion schedule is as the first frame of a multi-frame video sequence. In other defined as x_ t = A(t ) x_0T , with the velocity definedwords, the T2I capability is encouraged to mimic the T2V as the straight-line displacement vt = xT where x0capability. This imitation of denoising outcome distributions −x0, denotes the clean data, and xT represents the noise. Givenserves to unify the generative distributions of the two tempo- the noisy latent xt at timestep t and the model’s predictedrally distinct modalities. velocity ˆvt, the estimate for the original latent ˆx0 is derived. Specifically, substituting xT = vt + x0 into the forward Modality Mimic Generation Loss. Our training proce- equation yields: dure is divided into generation steps and editing steps, the \ begin { aligned } x_latter distinguished by the inclusion of reference images or videos in their training samples. We first introduce the mimic t &= A ( t) x_0 + B(t)(31) strategy and mimic latent generation loss applied at regular Solving for x0 gives the reverse formula: intervals during generation steps. Specifically, as shown on the right of Fig. 2, on a generation step divisible by nmimic,gen at {x}_ = \ h 0 t(32) (e.g., 5), we take a single T2V sample from the current batch, \fra c {x_ t2v is We employ a linear interpolation schedule configured with adenoted as s^1_{ \ text {t2v}} \in3}. The sample s1subsequently encoded into the latent space by the 3D VAE maximum discrete timestep of In this schedule, T = 1000. h cal { E}(s^1_{\text16}, where the coefficients are A(t) = B(t)encoder E: z^ 1_{ \ text{t2 v }} = \ma t 1 and = . Letthe 4N frames after the first frame are rank-reduced along t τ = T 1], then we have A(\t a u )and B(\t a u,the temporal dimension to N frames. A Gaussian noise la- ∈[0, and their sum A(\t a u ) +1. This simplification leads t2v is sampled, and to the efficient one-step reverse formula:tent \epsi l on ^ 1_{\text) of the same shape as z1 a timestep t \sim) is drawn. The noisy latent ˜z1t2v, t is then obtained via the forward diffusion process. The first frame \ h at { x }_0 (33)

第 12 页

视频到视频(V2V)和图像到图像(I2I)样本(I2I 样本数量 = M) 上下文内 V2V 样本 1 上下文内 I2I 样本 1 🎞 🖼

参考 视频 参考图像(s) 目标 视频 参考图像(s) 目标图像 其他样本 (4N + 1 帧) (4N + 1 帧)

第一帧潜在表示 第一帧潜在表示 3D VAE 编码器 🧊 … …

V2V 样本 1 潜在表示 I2I 样本 1 潜在表示

仅向目标添加噪声 参考时间步固定为 0 … …

加噪 V2V 样本 1 潜在表示 加噪 I2I 样本 M + 1 潜在表示 加噪 I2I 样本 1 潜在表示

复制第一帧噪声、时间步、(加噪)潜在表示、文本嵌入

展平、分块

分块化 V2V 样本 1 视觉令牌 分块化 I2I 样本 M + 1 视觉令牌

参考视频令牌 参考图像(s) 令牌 加噪目标视频令牌 参考图像(s) 令牌 加噪目标图像令牌

元素身份编码,分离式 3D 旋转位置编码 预训练 T2IV DiT 模块 3D 时空自注意力 ⇥ vQ3v4AGXplTI=</latexit>Nb

交叉注意力 反分块、反展平 🔥 损失模块 参考注入自注意力掩码 编辑 Q 流匹配损失 … Lmimic, K 单步反向 单步反向 … V2V 样本 1 目标视频去噪潜在表示 I2I 样本 M + 1 目标图像去噪潜在表示

元素身份编码 1 2 (, 3, 4, …) 0

参考视频令牌 参考图像(s) 令牌 加噪目标视频令牌

带帧对应关系的分离式 3D 旋转位置编码

高度 高度 高度

宽度 宽度 宽度

帧 帧 帧 O O O

图 4. 编辑训练步骤中模态模仿编辑损失的概览,以及我们的模型架构针对编辑任务的适配,包括参考注入自注意力掩码、带帧对应关系的分离式 3D 旋转位置编码,以及元素身份编码。在说明模态模仿编辑损失的示意图中,为了更清晰起见,我们将新创建的 I2I 样本表示为当前训练批次中的第 (M + 1) 个样本。在我们的实现中,这个新样本替换了当前训练批次中的第一个 I2I 样本。详细信息请分别参见第 3.3 节和第 3.5 节。

类似地,求解 $x_T$ 可得: $$ \hat{z}^1_{\text{t2v-f},0} \text{ 和 } \hat{z}^1_{\text{t2i},0} \text{ 是在相同条件下从单帧视觉令牌推导出的估计值——} \tag{34} $$ 唯一的区别在于前者是在时间上下文(与后续帧一起经历时间注意力)中处理的,而后者是作为独立图像处理的。为了鼓励 T2I 能力模仿 T2V 能力,我们首先计算这两个估计值的概率分布。每个展平的潜在表示 $x$ 均 $\in \mathbb{R}^D$ 通过 softmax 转换为概率分布: $$ \left\{ \begin{aligned} \tilde{z}^1_{\text{t2v},0} \end{aligned} \right. \} &= \tilde{z}^1_{\text{t2v},0} \tag{35} $$ 令 $\hat{z}^1_{\text{t2v-f},0} = \hat{z}^1_{\text{t2v},0}[:1]$ 表示我们选择的 T2V 样本第一帧的估计原始潜在表示。事实上,

第 13 页

“将演奏小提琴的音乐家替换为机器人”

“将有轨电车替换为宇宙飞船”

“将奶牛改为黏土奶牛”

I2I 和 V2V 首帧参考图像 I2I 结果(早期训练步骤) V2V 结果(早期训练步骤) I2I 结果 V2V 结果

图 5. I2I 与 V2V 之间的收敛速度比较。给定一个参考视频,I2I 推理应用于其第一帧,而 V2V 推理则在完整视频上进行。随后对 I2I 和 V2V 推理输出的第一帧进行比较。最左侧一列展示了来自 FiVE-Bench [52] 的视频第一帧。中间两列分别展示了在初始训练阶段的相同训练步骤下,I2I 与 V2V 推理的第一帧比较结果;相反,最右侧两列展示了在高级训练阶段相同训练步骤下的类似比较。可以看出,在早期训练阶段,I2I 相对于 V2V 表现出更快的收敛速度。

函数,针对第 $j$ 个元素定义为:

$$ \operatorname{ame}_{\max} \{ \operatorname{softmax} \} _ {j} = \frac { \exp(36) } { \sum_{t=1}^{T} \exp(36) } (x)_j $$

其中 $D = \lfloor H \rfloor \times \lfloor W \rfloor \times 16$。将其应用于各自的潜在变量,得到离散概率分布:

$$ p^1 \{ \tex {me} \} = \operatorname{softmax} \bigl ( \dots \bigr ) \quad (37) $$

当它作为时间序列的一部分被处理时,对应帧的分布,从而直接实现使 T2I 能力模仿 T2I 能力的目标。这种估计原始潜在变量之间的分布对齐损失被添加到整体训练目标中,引导模型参数朝着两种模态的统一生成分布发展。

如图 2 右侧所示,我们在训练刚开始时通过 3D VAE 解码器将估计的原始潜在变量 $\hat{z}^{t2v-f,0}_{1}$ 和 $\hat{z}^{t2i,0}_{1}$ 解码回图像空间。可以看出,由此产生的度量明显更清晰且更连贯。然后计算两个结果概率分布之间的 Kullback-Leibler (KL) 散度 [54]。该值证实了我们模仿 T2V 能力的动机是有意义的。

从图像分布 $p^{t2i,0}_{1}$ 到目标视频第一帧分布 $p^{t2v-f,0}_{1}$ 的 KL 散度定义为:

$$ D_{\text{KL}} \bigl ( p^{t2v-f,0}_{1} \parallel p^{t2i,0}_{1} \bigr ) = \sum_{d=1}^{D} p^{t2v-f,0}_{1,d} \log \frac { p^{t2v-f,0}_{1,d} } { p^{t2i,0}_{1,d} } \quad (38) $$

其中求和遍历所有 $D$ 个特征维度。如果两个分布几乎处处相同,则该非负度量为零。第一帧模态模仿生成损失 $L_{\text{mimic, gen}}$ 定义为此 KL 散度:

$$ L_{\text{mimic, gen}} \quad (39) $$

我们认为分布形状 $p^{t2v-f,0}_{1}$ 和 $p^{t2i,0}_{1}$ 分别反映了估计的原始潜在变量 $\hat{z}^{t2v-f,0}_{1}$ 和 $\hat{z}^{t2i,0}_{1}$ 的视觉感知特征。最小化 $L_{\text{mimic, gen}}$ 鼓励标准图像的降噪结果在统计上与目标分布不可区分。

模态模仿编辑损失。如图 4 所示,在编辑步骤期间,我们也旨在通过相互模仿统一两种模态的编辑能力,因此我们施加了类似动机的模态模仿编辑损失。经验上,如图 5 所示,I2I 的收敛通常早于 V2V。一旦在同一任务上收敛,V2V 通常能实现更好的编辑质量。因此,我们鼓励 V2V 模仿 I2I 以加速其收敛,并鼓励 I2I 模仿 V2V 以获得更高质量的结果。

遵循采用视觉上下文学习的现有图像编辑 [55, 56] 和视频编辑 [19, 20, 22, 25] 模型,这些模型受到大语言模型中对应方法的启发,我们的编辑样本以视觉上下文学习的方式排列:参考输入和目标沿时间维度连接并展平为单个 token。

第 14 页

学习区域感知的编辑与视觉和文本输入的类多模态大语言模型跨模态感知

指代表达分割 I2I 样本 1 指代表达分割 V2V 样本 1 图像对 真实实例掩码 视频对 真实实例掩码 指代表达 指代表达

“一块 银质叉子 放置 在 toDownsampleLatent Size “男人” toDownsampleLatent Size 一个 对折 桃子 餐巾” [1, ⌊H/8⌋, ⌊W/8⌋] 相同 运动 类型和 🎞 参考图像 目标图像 [1, H, W] 运动 强度 🖼 [4N + 1, H, W] [N + 1, ⌊H/8⌋, ⌊W/8⌋] 编辑说明 目标说明 参考视频 目标视频 编辑说明 目标说明 其他样本 “用浅橙色在图像中绘制{指代表达}。 ” “在明亮的包含阳光的食物户外,以及饮料……”一个木箱 “用深紫色在图像中绘制{指代表达}。 ” “全景镜头显示一个年轻的白人男孩在他的客厅里打电话,……”

3D VAE 编码器 文本分词器 以 RES 视频样本 1 作为通用示例📎 🧊 指代表达🔍 在目标文本分词中查找文本分词的位置

分块化 RES V2V 样本 1 视觉令牌 RES V2V 样本 1 文本令牌 分块化 RES I2I 🖼 🎞 样本 1…文本令牌 其他 样本的文本 令牌 参考视频令牌 加噪目标视频令牌 来自参考说明的参考文本令牌 来自编辑和目标说明的目标文本令牌

分块化 RES I2I 文本编码器 分块化 🖼 RES V2V 样本 1 文本嵌入 RES I2I 样本 1 🧊 文本嵌入 🎞 样本 1…视觉令牌 其他 样本的视觉 令牌 … 🎞 🖼 参考文本嵌入 目标文本嵌入 其他样本的文本嵌入

预训练 T2IV DiT 模块 3D 时空自注意力

$$ \frac{1}{N_b} \sum_{i=1}^{N_b} \left\| \text{Cross-Attention}_{\text{edit}}^{(i)} – \text{Cross-Attention}_{\text{sense}}^{(i)} \right\|_2^2 $$

Editing-region-aware Sense Contour Loss

Sense Text Cross Attention Map Loss

described region “man”? 🌿 Where is the “man” 🍃 Which region should be edited?

Q Unflatten、Upsample LFM,editing ( i.e. Sense )

$$ \frac{1}{N_b} \sum_{i=1}^{N_b} \left\| \text{Cross-Attention}_{\text{edit}}^{(i)} – \text{Cross-Attention}_{\text{whole}}^{(i)} \right\|_2^2 $$

( i.e. Contour: Implictly Learn to Predict and

First Frame Cross-Attention Score Map Latent Space GT Latent Mask Only Modify the Editing Region) 🤔 LFM,SC

像素对时间扭曲流场 + ↵SCLFM|region=editing 非编辑区域 注意力 感知损失, = mean( ) ⊙ 感知轮廓与编辑区域 块平均交叉注意力得分图 👀 −mean(

感知选择任务 参考位置选择任务 🎲 🤏 🎲 🤏

图像 3 图像 4 图像 5

随机 组合 参考 图像 目标图像 带有参考 带有参考 随机 组合参考图像 目标图像 图像 1 图像 2 带有 参考标题被丢弃 标题被丢弃 编辑标题 “重建图像 3。” “重建最匹配描述‘{目标标题}’的图像。” 🎲 图像 3

图 6. 感知相关任务及损失的概览。此外,右下角介绍了参考位置选择任务。详细信息请分别参见第 3.4 节和第 3.5 节。

序列输入到 DiT 模块中。需要注意的是,我们将参考元素视为条件输入,它们与标题文本嵌入类似,应在整个去噪过程中提供指导,因此不受噪声影响。相应地,噪声仅应用于目标元素,而所有参考元素的时间步长均固定为零。流匹配损失仅针对目标元素计算。

在可被 $n_{mimic,editing}$ 整除的编辑步骤(例如,3),我们从当前批次中取一个 V2V 样本,记为 $s^1_{v2v} = \{V^{ref1}_1, \{I^{ref1}_i\}_{i=2,3,…,n}, V^{tar}_1\}$,其中 $V^{ref1}_1 \in \mathbb{R}^{(4N+1)\times H \times W}$ 和 $V^{tar}_1 \in \mathbb{R}^{(4N+1)\times H \times W}$ 分别是源视频和编辑后的视频,$\{I^{ref1}_i\}_{i=2,3,…,n}$ 是可选的参考图像。样本元素随后由 3D VAE 编码器 $E$ 编码到潜在空间:$\{E(V^{ref1}_1), E(I^{ref1}_2), \dots, E(V^{tar}_1)\} = \{z^{ref1}_1, z^{ref1}_2, \dots, z^{tar}_1\}$。所有样本元素的编码潜在变量随后沿时间维度展平并按顺序拼接,得到:$z^{1}_{v2v,F} = z^{ref1}_{1,F} \oplus z^{ref1}_{2,F} \oplus \dots \oplus z^{tar}_{1,F}$,其中 $\oplus$ 表示拼接操作。

采样一个与 $z^{tar}_1$ 形状相同的高斯噪声潜在变量 $\epsilon^{tar}_1 \sim \mathcal{N}(0, I)$ 并展平,同时从 $p(t)$ 中抽取时间步 $t \sim p(t)$。通过前向扩散过程获得带噪目标潜在变量 $\tilde{z}^{1}_{tar,t}$。在破坏噪声后,我们得到带噪样本潜在变量 $\tilde{z}^{1}_{v2v,t,Flat} = z^{ref1}_{1,F} \oplus z^{ref1}_{2,F} \oplus \dots \oplus \tilde{z}^{tar}_{t,F}$。

第 15 页

一个新的 I2I 样本噪声潜在变量: 事实上,由同一模型的不同路径产生。 因此,最小化该损失并非简单地驱动 \ tilde al {F}} = \mathcal(40) 一个分布去匹配固定目标;相反,它促进了 { z }^1_{\text {i 2 i},\ text { t}, \ mathc 双向分布对齐,鼓励两个分布在训练期间相互 相应地,第一帧原始潜在变量: 模仿。事实上,在早期 聚焦探索阶段,我们引入了附加 z1i2i,F = F(z1ref1[: 1]) ⊕F(z1ref2[: 1]) · · · ⊕F(ztar1[: 1]), 措施——Jensen-Shannon (JS) 散度和 Hellinger 距离——作为损失函数,并观察到收敛速度和性能的适度提升。在0 表示参考元素的零噪声,目标部分的时间步 骤为 t(参考部分的时间步 长为 t,参考部分固定为零),以及原始标题的文本嵌入 长固定为零),且不含运动描述的 c1v2v,ori 被分配给 这个新构建的 I2I 样本,然后将其添加到 训练批次中。 从不同角度来看,模态模仿部分的动机和方法可以推广到不同的范式,我们在附录 B 中讨论。 通过这种方式,新添加的 I2I 样本与 V2V 样本中对应元素的第一 帧在进入 DiT 块之前具有相同的配置。 唯一的区别是后者的第一个目标帧 在 3D 时空自注意力机制中, 与具有完整时间结构的参考和目标元素进行交互。我们假设目标元素的第一帧 更专注于编辑参考元素的第一帧——即更集中于 空间注意力。为此,模型在 V2V 任务中对参考元素第一帧的编辑 能力应该模仿其在 I2I 任务中的能力。 ˜z1v2v,t 和 ˜z1i2i,t 都经过 DiT 块处理以 获得预测的目标速度场。遵循生成损失部分中详述的 相同的流匹配推导和单步反向计算,并应用归一化 时间步长 τ = Tt ,我们得到目标元素的估计原始 潜在变量: 类似于模态模仿生成损失,我们提取 目标元素的第一帧。令 ˆz1v2v,tar-f,0 = ˆz1v2v,tar,0[: 1] 表示来自 V2V 样本的第一个目标帧的估计原始潜在变量,我们计算 ˆz1v2v,tar-f,0 和 ˆz1i2i,tar,0 估计值的概率分布。应用 softmax 函数得到离散概率分布: begin {cases} p^1_{\t {v2v,tar-f,0}} = \ e operatorn a me {sof max}\bigl (\mat cal 模态模仿编辑损失 divergence 然后定义为这两个分布之间的 KL \math cal {L} _ {\t xt{mimic, ed ing}} = D_{ text(43) 指代表达式分割。我们首先简要介绍指代表达式分割任务。多 模态指代表达式分割解决的任务

第 16 页

对视觉输入(图像或视频)中的目标对象进行分割——由自然语言指代表达式引导。如图 6 所示,给定指代表达式“一把银叉放在对折的桃红色餐巾上”,模型需要生成像素级掩码,以分割图像中描述的物体。形式上,指代表达式分割(Referring Expression Segmentation, RES)以图像 $I \in \mathbb{R}^{H \times W}$ 和指代表达式 $R$ 作为输入。其输出是一组二值掩码 $\{M^{(k)}\}$,其中每个 $M^{(k)} \in \{0, 1\}^{H \times W}$,共同且精确地标记出 $I$ 中与 $R$ 中目标对象对应的所有区域;此处 $K$ 为目标对象的数量。这种表述提出了多模态理解中的一个核心挑战,要求语言表示与视觉表示之间紧密对齐。与在固定类别集合上操作的常规语义分割或实例分割不同,RES 需要对 $R$ 中的语言细微差别有更深的理解,并具备推理场景中物体之间的空间、属性和关系线索的能力。

指代视频对象分割(Referring Video Object Segmentation, RVOS)[57, 58] 将此设置扩展到了视频领域。给定视频序列 $V = \{V_t\}_{t=1}^F$(每帧 $V_t \in \mathbb{R}^{H \times W \times 3}$)和一个指代表达式,模型需要生成与视频中描述对象对应的时序掩码。

我们将 RES V2V 样本作为示例包含在训练批次中。此处以 RES V2V 样本为例;RES I2I 样本被视为其单帧特例,且感知损失以相同方式计算。

给定一个 RES V2V 样本 $s_{v2v} = \{V_{ref1}, V_{tar}\}$,其中 $V_{ref1} \in \mathbb{R}^{(4N+1) \times H \times W}$ 和 $V_{tar} \in \mathbb{R}^{(4N+1) \times H \times W}$ 分别为源视频和编辑后的视频,样本元素通过 3D VAE 编码器 $E$ 编码到潜在空间:$z_{v2v} = \{E(V_{ref1}), E(V_{tar})\} = \{z_{ref1}, z_{tar}\}$。

为了与预训练的 T2IV 模型保持一致,编辑样本中的每个参考元素都被分配了一个对应的文本描述。具体而言,目标元素的描述由编辑指令与目标对象的原始文本描述拼接而成。在交叉注意力层中,每个元素的视觉 token 仅关注源自其自身描述的文本嵌入。通常,我们将 V2V 样本的描述集记为 $c_{p,v2v} = \{c_{p,ref1}, c_{p,ref2}, \dots, c_{p,refn}, c_{p,output}\}$,其中每个 $c_{p,refj}$ 是第 $j$ 个参考元素对应的文本描述,且 $c_{p,output} = c_{p,editing} \cup c_{p,tar}$。$c_{p,editing}$ 是编辑指令,$c_{p,tar}$ 是目标的原始描述

指向性表达 $R$,目标是生成一组在时间上完全一致的掩码序列 $\{M^{(k)}_t\}_{t=1}^{F}$,其中 $M^{(k)}_t$ 表示第 $k$ 个指向帧 $V_t$ 中对象的分割。

在 RES 任务中,我们对所有参考标题 $j=1, \dots, n$ 应用丢弃(dropout),得到 $\{c_{p,ref_j}\}_{j=1}^n$ 并采用基于模板的指令形式 $c_{p,editing} = \text{“Paint } J \cdot K \text{ to } K \text{ in the image within the editing region.”}$(以及类似变体),其中 $R$ 表示指向性表达,$K$ 指定目标颜色。分隔符 $J \cdot K$ 在此处未包含在标题中,仅用于标记短语的位置。除了随时间变化的指向对象以及在整个视频中鲁棒地跟踪它们之外,RES 还面临挑战,而 RVOS 引入了额外的困难,例如保持每个对象掩码序列的时间一致性、处理外观插入以及对象随时间的变化。

$cv2v$ 表示与 $sv2v$ 中每个元素对应的标题的连接文本嵌入。

当从其对应的 RES I2I 样本生成 RES V2V 样本时,相关的真实指向性表达分割掩码同样通过像素对时间扭曲流场进行处理。

编辑区域感知的感知轮廓损失。我们使用指向性表达数据集,包括单目标数据集 RefCOCO [59]、RefCOCOg [59]、RefCOCO+ [59]。

以及 RefClef [60],以及 gRefCOCO [61] 数据集中指定图像中多个对象的多目标(即表达)部分。具体而言,RefCOCO 的表达式允许基于位置和基于外观的参考,RefCOCO+ 的表达式侧重于基于外观的表达式,RefCOCOg 的表达式包含更长且更复杂的表达式,而 RefClef 的表达式简单且侧重于现实世界的表达式。

我们将指代表达式分割任务适应为一种更利于上下文视觉学习的区域着色公式:编辑任务是用指定的均匀颜色覆盖与文本表达式对应的源视觉输入中的子区域。利用我们的时间像素对扭曲流范式以及 RES 图像编辑数据,我们还执行 RVOS 视频编辑数据的在线生成。

生成一个在时间上连贯的掩码序列,该序列与源和目标视频 Vref1 和 Vtar 具有相同的帧数、运动类型、运动强度和随机种子,从而确保 {mtar,j} 作为 V2V 样本的像素对齐时间真实对象掩码序列。该掩码序列随后下采样以匹配潜在表示的大小,以获得潜在空间真实编辑 ztar。

具体而言,{mtar,j} 的第一帧通过双线性插值在空间上下采样至 ct \mathbb{R}^{(N+1)16},而随后的 4N 帧通过三线性插值在时空上下采样至 ct \mathbb{R}^{N\frac\frac}。这些组件随后沿时间维度连接、二值化、unsqueeze 并广播,以形成最终的潜在空间掩码序列 M = {Mtar,j}。

如图 6 所示,在编辑步骤期间,固定比例的 RES I2I 和 RES V2V(即 RVOS)样本被采样。样本潜在 zv2v = [zref1, ztar] 随后

第 17 页

被高斯噪声扰动,得到噪声潜在变量 $\tilde{z}_{v2v,t} = [z_{ref1}, \tilde{z}_{tar,t}]$,其中 $t$ 表示采样的时间步。该噪声潜在变量随后由 DiT 块处理,以预测目标速度场:$\hat{v}_{v2v, tar,t} = F^{-1} \circ P^{-1} D P \circ F(\tilde{z}_{v2v, t}, c_{v2v, t})$。原始流匹配损失可表述为:

\begin{aligned} \mathcal{L}_{\text{FM, global}} &= \mathbb{E} \left[ \mathcal{L}_{\text{FM}} \big|_{\text{region=whole video}} \right] \tag{44} \end{aligned}

其中 $\hat{z}_{v2v,tar,T}$ 和 $\hat{z}_{v2v,tar,0}$ 可分别通过公式 (33) 和公式 (34) 获得,$\epsilon_{tar}$ 是添加的目标高斯噪声。

编辑区域感知的感知轮廓损失(Sense contour loss)的动机在于引导模型定位对应于文本指令的区域,并仅在该区域内应用更改。因此,我们仅在由潜在编辑区域掩码 $M$ 定义的区域上计算区域感知的局部流匹配损失:

\begin{aligned} \mathcal{L}_{\text{FM, SC}} &= \mathbb{E} \left[ \mathcal{L}_{\text{FM}} \big|_{\text{region=editing region}} \right] \tag{45} \end{aligned}

其中 “SC” 代表 “Sense Contour”(感知轮廓),$\odot$ 为哈达玛积(Hadamard product)。因此,编辑步骤的完整流匹配损失可表示为整个区域上的原始损失与编辑区域感知的感知轮廓损失之和:

\begin{equation} \mathcal{L}_{\text{FM, editing}} \tag{46} \end{equation}

其中 $\alpha_{SC}$ 是加权超参数。

感知文本交叉注意力图损失(Sense Text Cross Attention Map Loss)。感知轮廓损失 $\mathcal{L}_{\text{FM, SC}}$ 显式地引导模型学习编辑区域感知的编辑能力,而指代表达式分割任务(Referring Expression Segmentation, RES)则隐式地促进了语言表示与视觉表示之间的对齐。为了进一步显式地正则化后者的学习,我们在交叉注意力过程中引入了一种更直接的监督形式,即感知文本交叉注意力图损失。我们首先简要讨论交叉注意力图的含义,这自然引出了该损失的动机。

交叉注意力根据文本嵌入对视觉标记的去噪进行条件约束。具体而言,在每一层交叉注意力中,我们利用元素级的交叉注意力掩码,分别对样本中每个元素的视觉标记与其对应的文本嵌入执行交叉注意力过程。输出随后被连接起来,形成样本的最终交叉注意力输出。对于每个元素,交叉注意力过程首先将视觉标记和文本嵌入投影到多头 Query、Key 和 Value 矩阵中。

设展平并分块的视觉标记为 $z_p \in \mathbb{R}^{l_z \times d_z}$,文本嵌入为 $c_f \in \mathbb{R}^{l_t \times d_c}$,其中 $l_z = h_p \cdot w_p$ 是视觉标记的数量,$l_t$ 是文本嵌入的长度,$d_z$ 和 $d_c$ 是它们各自的特征维度。对于我们的预训练 T2IV 模型,$d_z = d_c = n_h d_h$。$n_h$ 是注意力头的数量,$d_h$ 是每个头的维度。线性投影产生:

\begin{equation} Q = z_p W^q, \quad (47) \end{equation}

其中 $W^q \in \mathbb{R}^{d_z \times d_z}$,$W^k, W^v \in \mathbb{R}^{d_z \times d_z}$。投影后的输出随后被重塑,并将头维度分离,得到 $Q_r, K_r, V_r \in \mathbb{R}^{n_h \times L \times d_h}$,其中对于 $Q_r$,$L = h_p \cdot w_p$,而对于 $K_r$ 和 $V_r$,$L = l_t$。交叉注意力层计算缩放点积注意力分数:

\begin{equation} A = \text{Softmax}\left( \frac{Q_r K_r^T}{\sqrt{d_h}} \right) \tag{48} \end{equation}

对 Value 矩阵的加权和给出了交叉注意力输出 $O_{\text{text}}$。在此过程中,交叉注意力机制将文本信息“分散”到视觉标记上。换句话说,正如文献 [62] 所述,注意力图 $A$ 将每个视觉标记连接到每一层的每个条件嵌入,其中 $A[a_h, i, k]$ 量化了从第 $k$ 个文本嵌入到第 $i$ 个视觉标记的信息流,$a_h$ 表示第 $a_h$ 个注意力头。基于交叉注意力分数图的这一语义含义,在 RES 任务中,当源视觉标记关注对应于输出标题的文本嵌入时,与指代表达式相关的交叉注意力图应在真实目标掩码内表现出最高的响应(因此是最强的信息流),而在掩码外表现出明显较弱的响应。因此,我们采用一种损失函数,衰减潜在掩码外部的平均注意力分数,同时鼓励内部较高的平均分数,从而引导模型的注意力更精确地聚焦于编辑指令所描述的视觉区域。

具体而言,如图 6 所示,每个样本元素的标题 $c_{p, v2v} = \{c_{p, ref1}, c_{p, ref2}, \dots, c_{p, refn}, c_{p, output}\}$ 首先由 T5 [51] 分词器进行分词:$tok_{v2v} = \{tok_{ref1}, tok_{ref2}, \dots, tok_{refn}, tok_{output}\}$。此过程将每个组成部分字符串转换为子词标记序列。在 RES 任务中,我们识别出对应于指代表达式的 $tok_{output}$ 子序列。随后,每个元素的文本标记通过 T5 文本编码器以及额外的

第 18 页

第一帧传播任务的外扩子任务及视频修复任务的时序掩码类型示意图

保留视频内部区域的随机时序掩码类型 保留视频边界区域的随机时序掩码类型

视频修复任务的时序掩码类型示意图

第1帧 第10帧 第30帧

掩码内部或边界区域的随机时序固定掩码类型 可从或离开帧边界的时序平滑移动掩码类型

视频扩展任务的时序潜在空间裁剪类型示意图

参考视频 VAE 潜在表示

I I

固定宽度裁剪模式 随机裁剪模式 原始视频 VAE 潜在表示 固定高度裁剪模式 目标视频 VAE 潜在表示

图 7. 分别展示了第一帧传播任务的外扩子任务和视频修复任务的时序掩码类型示意图,以及视频扩展任务的时序潜在空间裁剪类型示意图。浅色区域表示被掩码的原始视频帧部分。对于外扩子任务、视频修复任务的时序固定掩码类型以及视频扩展任务的时序潜在空间裁剪类型,此处使用第1帧进行说明。被掩码或裁剪的区域在所有帧中保持一致。对于视频修复任务的时序平滑移动掩码类型,我们展示了部分帧对应的掩码。详细信息请参阅第 3.6 节。

嵌入 MLP [18];对于输出标题,这会产生 $Q_r^{(\ell)}$ 和 $K_r^{(\ell)}$,其中 $l_{\text{output}}$ 是输出标题序列的长度,$d_c$ 是嵌入维度。对于 $K_r^{(\ell)} \in \mathbb{R}^{l_{\text{output}} \times d_c}$ 和 $Q_r^{(\ell)} \in \mathbb{R}^{l_{\text{v2v}} \times d_c}$,其中 $l_{\text{v2v}} = 2f_p \cdot 2h_p \cdot 2w_p$ 是参考补丁化视觉标记的长度,$d_z$ 和 $d_c$ 分别是视觉和文本特征维度。对应于指代表达式的嵌入保持其在 $t_{\text{output}}$ 中的原始顺序位置。

在第 $\ell$ 个 DiT 块的交叉注意力层中,其中 $\ell = 2, \dots, N_b$,$N_b$ 是 DiT 块的总数,$o \in \{1, \dots, N_b\}$,我们首先计算 RES 参考元素的第1帧视觉标记与输出标题的文本嵌入之间的交叉注意力得分图。设样本视觉标记为 $z_p \in \mathbb{R}^{l_{\text{v2v}} \times d_z}$,拼接后的样本标题文本嵌入为 $c_{\text{text}} \in \mathbb{R}^{l_{\text{v2v}} \times d_c}$,其中 $f_p, h_p$ 和 $w_p$ 是参考补丁化视觉标记的维度,$d_z$ 和 $d_c$ 分别是视觉和文本特征维度,$l_{\text{v2v}}$ 是拼接文本嵌入的长度。投影层将它们投影到多头 Query、Key 和 Value 矩阵:

$$ \begin{aligned} Q^{(\ell)} &= z_p \, W_q^{(\ell)} \\ K^{(\ell)} &= c_{\text{text}} \, W_k^{(\ell)} \\ V^{(\ell)} &= c_{\text{text}} \, W_v^{(\ell)} \end{aligned} \quad (49) $$

其中 $W_q^{(\ell)} \in \mathbb{R}^{d_z \times d_h}$,$W_k^{(\ell)} \in \mathbb{R}^{d_c \times d_h}$,$W_v^{(\ell)} \in \mathbb{R}^{d_c \times d_h}$ 是第 $\ell$ 块的投影权重。如上所述,投影后的输出被重塑,且头维度被分离,得到 $Q_r^{(\ell)}$ 和 $K_r^{(\ell)}$,其中 $l_{\text{output}}$ 是输出标题文本嵌入的长度。然后计算缩放点积注意力得分:

$$ A_{\text{ref}_1\text{-f}}^{(\ell)} = \operatorname{Softmax}\!\left( \frac{Q_r^{(\ell)} K_r^{(\ell)\top}}{\sqrt{d_h}} \right) \quad (50) $$

得到的 $A_{\text{ref}_1\text{-f}}^{(\ell)}$ 是第 $\ell$ 块的交叉注意力得分图;它量化了每个注意力头下,参考第1帧的每个空间位置与输出标题中每个文本嵌入之间的关联强度。设指代表达式在输出标题嵌入中的起始和结束索引分别为 $s_{\text{ref}}$ 和 $e_{\text{ref}}$。通过取对应于指代表达式的平均交叉注意力得分图,可获得第 $\ell$ 块和第 $j$ 个头的得分图:

第 19 页

非刚性元素替换

“将船替换为天鹅”

“将女人替换为狮子”

“将乌鸦替换为无人机,并将叫声从呱呱声改为嗡嗡声”

“将熊替换为恐龙”

“将男子替换为熊猫”

“将音乐家替换为一只老虎和一个机器人”

图 8. 在 FiVE-Bench [52] 上的单参考非刚性元素替换结果。我们的方法产生了自然的替换,同时生成了相应的运动和物理效果,例如第二个例子中狮子的行走动作和第四个例子中恐龙尾巴的影子。第六个例子展示了多目标编辑。

对该特定文本嵌入跨度进行平均:

在 DiT 块和头维度上进行平均:

$$ \bar{A}_{t, (\ell, j)} = \frac{1}{N_b} \sum_{k=1}^{N_b} A_{t, (\ell, j)}^{(k)} \quad (51) $$

如先前研究 [36, 63] 所述,Transformer 架构中的早期块通常处理空间和结构信息,而更深的块则处理更抽象的语义概念。因此,为了获得一个单一的、整合的空间注意力图,该图聚合了所有块和头的信息,我们进一步计算所有块的平均注意力分数,以纳入注意力

第 20 页

刚性元素替换

“将速滑运动员替换为蜘蛛侠”

“将男孩改为女孩”

“将足球改为篮球”

“将有轨电车改为公共汽车”

“将马改为斑马”

“将山羊改为岩羊”

图 9. 在 FiVE-Bench [52] 上的单参考刚性元素替换结果。我们的编辑仅修改与编辑指令对应的参考区域,且编辑结果与参考对象表现出刚性对应关系,如第三个示例中的篮球所示。

来自不同语义层级的信息。由此产生的 2D 块平均交叉注意力得分图 $\bar{A}_{\text{ref1-f}}$ 量化了平均注意力强度,该强度在整个扩散过程中,从指代表达式到参考第一帧的每个空间位置进行聚合。

交叉注意力得分图 $\bar{A}_{\text{ref1-f}}$ 随后被展平并通过双线性插值上采样至潜在尺寸,得到 $\bar{A}_{\text{ref1-f}}^{\text{up}} \in [0, 1]^{h_l \times w_l}$,其中 $h_l = 2h_p$ 且 $w_l = 2w_p$ 表示上采样后的空间尺寸。使用

第 21 页

背景与前景中的注意力分数:与参考元素和目标元素的排列方式具有上下文关系。自注意力机制 $\text{attn}$ 的目的是促进 V2V 样本中视觉 token 之间的信息交换。一种简单的方法是保留与预训练 T2IV 模型 3D 全自注意力相同的样本内视觉 token 交互,即允许对应于每个元素的视觉 token 既关注自身的视觉 token,也关注所有其他元素的视觉 token。然而,每个参考元素的视觉 token 作为视觉条件上下文,应在整个扩散过程中保持独立且不受其他元素干扰,从而为目标元素的学习提供一致且正确的指导。为此,如第 3.3 节所述,我们不向参考视觉 token 添加噪声,并将其时间步固定为零。此外,在自注意力机制中,我们约束每个参考元素的视觉 token 仅关注其自身,确保呈现给模型的参考信息在去噪过程中保持完整且未受污染。

对于目标元素的视觉 token,它们需要从参考视觉 token 中学习视觉参考信息,自注意力机制应确保样本中每个元素的视觉信息都流向目标视觉 token。换言之,目标视觉 token 需要关注样本中的全部视觉 token。如图 4 所示,我们采用参考注入自注意力掩码(reference-inject self-attention mask)来引导参考信息流向目标。形式上,令展平并分块的参考信息和目标视觉 token 的完整样本表示为 $z_p = z_{p,\text{ref}_1} \oplus \cdots \oplus z_{p,\text{ref}_n} \oplus z_{p,\text{tar}} \in \mathbb{R}^{l_z \times d_z}$,其中 $l_z$ 是总序列长度,计算为所有元素 token 长度之和。令查询、键和值投影矩阵为 $W_Q, W_K, W_V \in \mathbb{R}^{d_z \times d_z}$。整个序列的投影为 $Q = z_p W_Q, K = z_p W_K, V = z_p W_V$,其中 $Q_{\text{ref}_i}, K_{\text{ref}_i}, V_{\text{ref}_i}$ 和 $Q_{\text{tar}}, K_{\text{tar}}, V_{\text{tar}}$ 分别对应第 $i$ 个参考元素和目标元素。带有参考注入注意力掩码的自注意力定义如下操作:

\begin{align} \mathcal{L}_{\text{total, gen}} &= \mathcal{L}_{\text{FM,global}} + \alpha_{\text{mimic,gen}} \mathcal{L}_{\text{mimic,gen}} \tag{54} \end{align}

其中 $\alpha_{\text{mimic,gen}}$ 表示加权系数。编辑步骤的总目标公式化为:

\begin{align} \mathcal{L}_{\text{total, editing}} &= \mathcal{L}_{\text{FM,global}} + \alpha_{\text{mimic,editing}} \mathcal{L}_{\text{mimic,editing}} + \alpha_{\text{FM,SC}} \mathcal{L}_{\text{FM,SC}} + \alpha_{\text{sense,attn}} \mathcal{L}_{\text{sense,attn}} \tag{55} \end{align}

其中 $\alpha_{\text{mimic,editing}}, \alpha_{\text{FM,SC}}$ 和 $\alpha_{\text{sense,attn}}$ 是相应的损失权重。我们为每个训练样本分配一个任务 ID 编号。RES 样本被赋予一个独特的编号,而其他所有样本接收默认值。这使我们能够在训练期间区分 RES 样本,并仅为它们计算损失 $\mathcal{L}_{\text{FM,SC}}$ 和 $\mathcal{L}_{\text{sense,attn}}$。

3.5. 模型架构对编辑任务的适配

参考注入自注意力掩码。如图 4 所示,在编辑步骤中,对应于参考元素的视觉 token 作为视觉条件上下文,应独立于其他元素。

\begin{align} O_{\text{ref}_i} &= \text{Softmax}\left(\frac{Q_{\text{ref}_i} K_{\text{ref}_i}^T}{\sqrt{d_h}}\right) V_{\text{ref}_i} \tag{56} \end{align}

其中 $O_{\text{ref}_i}$ 和 $O_{\text{tar}}$ 分别是第 $i$ 个参考元素和目标元素的自注意力输出,$d_h$ 是头维度。完整序列的最终自注意力输出 $O_{\text{self}}$ 是所有参考元素和目标元素输出的拼接:

\begin{align} O_{\text{self}} &= O_{\text{ref}_1} \oplus \cdots \oplus O_{\text{ref}_n} \oplus O_{\text{tar}} \tag{57} \end{align}

第 22 页

色彩修改

“将直升机的颜色改为紫红色”

“将黄色衬衫改为红色衬衫”

“将巴士的颜色改为淡紫色”

物体添加

“在银色SUV的车顶上添加一个巨大的充气火烈鸟”

“给奶牛添加一个花环”

“给第一只骆驼添加一个大篮子”

图10. 在FiVE-Bench [52]上的单参考色彩修改和物体添加结果。我们的编辑结果始终包含相应的物理效果,例如阴影。第二个示例表明,我们的模型能够识别具有遮挡(例如背包)的编辑区域,并仅对其进行修改。

其中 ⊕ 表示沿序列长度维度的拼接操作。 一种相对位置编码,用于告知模型其在样本中的时空位置。预训练 T2IV 模型为此目的使用 3D 旋转位置编码(3D RoPE)。 具体而言,3D RoPE 扩展了标准的 分离 3D RoPE 与帧对应关系。 对于 RoPE [42] 以在时间、高度和 每个训练样本,在自注意力过程中,在 宽度维度上编码位置。视觉 token 的特征通道 将分块化的视觉 token 投影为查询、键和 被划分为三组。为每个维度计算一组专用的旋转 值特征后,并在计算缩放点积注意力 角度,包括帧 分数之前,每个 token 都应配备

第 23 页

材料修改

“将霹雳舞者改为全息霹雳舞者”

“将真马替换为木马”

“将蝴蝶的材质从生物改为玻璃”

“将鹰改为金属鹰”

“将鹰替换为玻璃鹰”

“将女性改为瓷质女性”

图 11. 在 FiVE-Bench [52] 上的单参考材料修改结果。我们的方法保持了跨帧的像素对齐编辑结果。

索引 $t_x$、高度 $h_x$ 和宽度 $w_x$。这些角度集随后通过复平面旋转应用于它们各自的通道组。形式上,对于视觉 token $x$,编码输出 $\dot{x}$ 由下式获得:

\begin{align} \dot{x} &= \operatorname{RoPE}\{x(t), x(h), x(w)\} \quad (58) \end{align}

其中 $x(t)$、$x(h)$、$x(w)$ 分别表示对应于时间、高度和宽度维度的通道组。$\Theta_t, \Theta_h, \Theta_w$ 是从 token 的坐标 $(t_x, h_x, w_x)$ 导出的旋转角度,$\odot$ 表示逐元素乘法,$\langle \cdot \rangle$ 表示沿通道维度的拼接。这种分组应用旋转的方式确保了位置信息在每个维度上被 distinctly 编码。

对于 V2V 样本,在编辑步骤中,它是通过展平后沿时间维度拼接其组成元素形成的;一种直接的方法是将 3D RoPE 应用于整个拼接后的序列,将其视为单个视频。然而,我们认为源

第 24 页

物体移除

“移除长长的灰色栏杆”

“移除中间的高个子男人”

“移除右边的牛”

“移除白色显示器”

“移除牛”

“移除左上角的圆形时钟”

图 12. UNIC-Bench [22] 上的物体移除结果。与依赖物体掩码序列来帮助模型定位待移除区域的主流方法 [21, 64] 不同,我们采用感知相关任务和损失函数,使模型能够通过自然语言删除指定物体。第五个示例表明,我们的模型能够感知并移除与删除物体相关的物理效应(例如阴影),而我们的物体移除图像编辑训练数据缺乏这一特性。

视频和编辑后的视频共享逐帧空间对应关系。因此,如图 4 所示,我们改为在原始对齐的 3D 坐标系中分别对源视频 token 和目标视频 token 进行 3D RoPE 编码。对于其他参考图像,我们采用先前工作 [66] 中提出的视角,即视频模型隐式地将初始帧视为概念记忆缓冲区,用于在生成过程中存储视觉实体以供后续重用;因此,我们也将这些参考图像作为源视频在原始对齐的 3D 坐标系中的辅助第一帧进行编码。对于其他样本类型,我们将 T2V 样本视为无参考元素的 V2V 样本,并将 T2I 和 I2I 样本分别视为 T2V 和 V2V 样本的单帧情况。此外,T2V 和 T2I 样本的旋转位置编码应与

第 25 页

ID 插入

🤏

🤏

🤏

🤏

🤏

🤏

图 13. 在 UNIC-Bench [22] 上的多参考对象插入结果。给定一个编辑提示词和一张参考图像,FlowMimic 能够以自然且遵循提示词的方式,将参考图像中的对象放置到参考视频的指定区域,同时生成相应的运动。需要注意的是,在整个训练过程中,我们并未使用任何专门构建的视频编辑数据。我们认为,模型基于字幕为主体生成时间上自然的运动的能力,可能源于 FlowMimic 隐式地将通过 T2V 和 I2V 任务训练获得的运动生成能力迁移到了多参考视频编辑等编辑任务中。此外,我们的像素级时间扭曲流场使模型能够学习如何将参考图像中的主体放置到源图像中,并随时间保持一致。结合这两种能力,模型能够准确地将参考图像中的主体插入到源视频中,同时为主体生成自然且合理的动作。

预训练的 T2IV 模型;因此,独立的 3D RoPE 也应用于这些样本。

元素身份编码。3D RoPE 有助于 DiT 架构感知每个元素内 3D 空间中视觉标记的相对位置。我们还需要使模型能够区分不同元素的视觉标记,特别是在多参考编辑任务中。在探索阶段,我们研究了应用于 3D RoPE 之后附加的元素维度的 1D RoPE,以及用于表示元素身份的传统绝对位置编码;后者在下面简要描述。

第 26 页

ID 替换

✏ 🤏

✏ 🤏

✏ 🤏

✏ 🤏

🤏 ✏

✏ 🤏

图 14. 在 UNIC-Bench [22] 上的多参考对象替换结果。给定指定要替换的主体和参考图像的编辑指令,FlowMimic 可以将参考视频中的主体替换为参考图像中的对象。当参考视频中的主体处于运动状态时,如第一和第四个示例所示,编辑后的视频自然地保留了相应的运动。第二个示例表明,我们的模型在交换头部时保留了原始的面部表情。最后一个示例表明,在更改背景时,我们的方法也为剩余区域生成了适当的光照效果。铅笔符号指向要编辑的对象,该对象在编辑说明中指定。

如图 4 所示,我们在应用 3D RoPE 之前,将具有可忽略参数的可学习嵌入表添加到展平的视觉标记中,记为 $E_{elem} \in \mathbb{R}^{C_{max} \times d_z}$,其中 $C_{max}$ 是样本可以包含的最大元素数量。该表初始化为零权重,以适配预训练的 T2IV 模型。对于包含 $n_s$ 个元素的给定样本 $s$,我们根据固定惯例为每个元素分配连续的索引:目标元素始终被分配索引 0,而参考元素被分配索引 $1, 2, \dots, n_s-1$。然后通过查找嵌入表来获取整个样本的对应顺序索引嵌入。随后,每个检索到的嵌入向量 $\hat{E}_s^{(k)}$ 被加到属于样本第 $k$ 个元素的视觉标记上。

第 27 页

视频风格化

“将风格改为水彩风格”

首帧传播

图15. 在 UNIC-Bench [22] 上的风格化和首帧传播结果。风格化结果展示了模型的像素级编辑能力,而首帧传播结果表明,应用于初始帧的编辑可以以自然且符合物理规律的方式传播到后续帧。

参考位置选择任务。在多参考编辑任务中,编辑指令通常包含位置描述符,如“图像 1”或“图像 2”,以指定参考元素的顺序,例如“将图像 2 中的眼镜添加到图像 1 中的男子身上”。因此,有必要协助模型建立文本中的序数词与元素的视觉标记之间的对应关系。为此,我们引入了一个参考位置选择任务。具体而言,如图 6 所示,令 $\mathcal{R}$ 表示当前编辑参考图像的缓存。我们首先从 $\mathcal{R}$ 中随机采样一组 $n$ 个参考元素,记为 $\{I_{ref1}, I_{ref2}, \dots, I_{refn}\} \subseteq \mathcal{R}$。从该集合中均匀采样一个元素作为目标图像,即 $I_{tar} = I_{refk}$,其中 $k \sim \mathcal{U}(\{1, \dots, n\})$。编辑指令通过模板生成,例如“重构图像 $J_{Ind}$”,其中 $Ind$ 是序数索引(例如,“1”,“2”)。

第 28 页

黑白视频上色

视频去模糊

视频扩展

图 16. 单参考黑白视频上色、视频去模糊和视频扩展结果。去模糊的参考视频来自 GOPRO Large [65] 数据集的测试集。

所选目标图像集合中的帧。最终样本因此表示为元组 $(\{I_{\text{ref}_1}, \dots, I_{\text{ref}_n}\}, I_{\text{tar}})$,并附带相应的说明文本,用于引导模型根据位置提示从视觉上下文中感知并重建描述的目标。

3.6. 其他编辑任务的具体细节

首帧传播。首帧传播(First Frame Propagation, FFP)[33] 指的是一种视频编辑范式,其中仅应用于视频序列第一帧的修改会自动且连贯地扩展到所有后续帧。其核心目标是保持严格的时间一致性——确保视觉变化随时间真实地传播——同时保留源视频中未编辑区域和原始运动动态。该方法有效地将复杂的视频编辑任务重构为更简单的两阶段过程:(1) 使用图像编辑工具对单张图像(即第一帧)执行所需的编辑;(2) 利用模型以修改后的第一帧和原始视频的上下文信息为条件,生成完整的编辑视频。

我们还生成首帧传播训练样本

第 29 页

视频重光照

“将光照改为夕阳斜射光”

“将光照改为从上方聚焦的舞台聚光灯”

改变色调

“将色调改为怀旧的棕褐色”

🤏

视频背景替换

“将背景改为 夏日沙滩”

🤏

图 17. 视频重光照、改变色调和视频背景替换结果。FlowMimic 可以根据编辑指令改变原始场景的光照,并生成合理的物理效应。在改变色调时,模型忠实地保留了原始帧的布局。在背景替换中,模型还根据编辑指令或可选的参考图像产生自然的物理效应,例如第五个示例中人物的阴影,以及第六个示例中营火的闪烁以及相应的人物光照变化。与特定任务的方法 [23] 不同,我们的模型不依赖前景掩码序列来区分前景和背景;相反,它天生具备这种语义能力。

通过像素对时间扭曲流场从图像编辑数据对中学习。具体而言,令 $(I_{\text{ref}_1}, I_{\text{tar}})$ 表示图像编辑样本的图像编辑对,其中 $I_{\text{ref}_1}$ 是源图像,$I_{\text{tar}}$ 是编辑后的目标图像。在我们的构建中,源图像 $I_{\text{ref}_1}$ 被保留为源视频的第一帧,即 $V_{\text{ref}_1}^{(0)} = I_{\text{ref}_1}$。目标图像 $I_{\text{tar}}$ 扮演两个角色:作为条件参考图像(样本中的第二个元素)以及作为目标视频的第一帧,即 $V_{\text{tar}}^{(0)} = I_{\text{tar}}$。相应的标题分配如下:源视频关联原始源标题 $cp_{\text{ref}_1}$;第二个参考图像关联原始输出标题 $cp_{\text{output}}$;

第 30 页

表情变化

“将女孩的表情改为悲伤”

“将女性的表情改为微笑”

发型变化

“将女性的发型改为长卷发,薰衣草色”

“将女性的发型改为浅蓝色的法式短发”

视频虚拟试穿

🤏

🤏

图 18. 表情变化、发型变化以及视频虚拟试穿结果。示例三表明,即使主体运动幅度较大,我们的编辑效果在时间上仍保持一致。

以及目标视频接收由在原始输出 字幕前添加模板指令构建的输出字幕。模板指令采用如下形式:“参考图像 2 中视频 1 第一帧的编辑结果,以图像 2 作为第一帧生成视频,并对视频 1 进行完整编辑”。源视频和目标视频的剩余帧 $$ \{V_{\text{tar}}^{(t)}\}_{t=1}^{F-1} $$ 和 $$ \{V_{\text{ref}_1}^{(t)}\}_{t=1}^{F-1} $$ 是通过对源视频和目标视频第一帧应用时间扭曲流场合成的。

此外,UNIC-Bench [22] 的传播测试集包含一个外推任务,该任务涉及从给定的第一帧开始生成完整的视频,并以部分区域被掩码的参考视频为条件。受此启发,我们在训练过程中融入了少量此类外推任务。我们通过向 T2V

第 31 页

视频面部美化

“美化女性的面部”

“美化女性的面部”

改变形状

“让男性看起来更年轻”

“让女性看起来更瘦”

风格化视频到真人视频

“转换为真人风格”

“转换为真人风格”

图 19. 视频面部美化、改变形状以及风格化视频到真人视频的结果。此处,“改变形状”指改变物体的客观形态,例如其外部年龄状态或身体轮廓。风格化视频到真人视频的结果展示了模型理解非写实视频语义的能力,以及保持像素级编辑效果的时间一致性。我们的一些图像编辑样本在源图像和目标图像之间表现出显著的全球颜色差异,因此,由于训练数据的限制,编辑后的输出继承了来自参考输入的颜色漂移。我们认为,实施更严格的数据收集和过滤程序以排除存在颜色差异的样本,将有助于缓解这一现象。

样本。具体而言,在预定义的掩码比例范围内,例如从 0.8 到 0.83,我们应用随机掩码,这些掩码要么通过掩蔽外部区域来保留视频的内部区域,要么保留视频的边界区域(即最左侧、底部、最右侧或顶部区域)。掩码区域在每个帧中保持相同。图 7 说明了应用于整个视频序列的掩码类型。被掩蔽的 T2V 视频用作源视频,原始 T2V 视频的第一帧作为第二个参考元素,而原始视频被视为目标视频。此过程不需要额外数据,并且在线执行。需要注意的是,第一个

第 32 页

水印去除

“去除水印”

“去除水印”

多参考素材修改 ✏ 🤏

✏ 🤏

添加视觉效果

“将男孩的姿势改为双手缓慢举起两个火球, 添加羽毛翅膀,并在其头顶上方添加发光的光环”

“将女孩的姿势改为 举起双手释放闪电”

图 20. 水印去除、多参考素材修改和添加视觉效果的结果。在第三和第四个示例中,编辑提示分别指定面包和女孩为编辑对象,女孩手中持有的刀和杯子保持不变。这展示了模型的跨模态语义理解能力和区域感知编辑能力。生成视觉效果构成了视频编辑的一个有趣应用;尽管训练集中缺乏专门的运动编辑数据,但该模型表现出了一定的泛化能力。

帧传播任务,随后介绍的 I2V I2V 任务。在多图像编辑任务中,例如从第二张参考图像中插入 任务,视频修复任务和视频扩展任务 对象到源视频中, 不包括在对应于 模态模仿编辑损失的采样过程中。 必须保留编辑输出中参考 对象的外观,并确保其表现出 自然运动。为了增强这种能力,我们引入了 图像到视频(I2V)任务。具体而言,我们通过采用 T2V 训练样本 V = 来构建 I2V

第 33 页

视频换脸

🤏

🤏

SAM3 风格的视频指代表达分割

“将穿黄色衣服的女孩涂成浅粉色”

“将穿着棕色上衣和蓝色牛仔裤的舞者涂成浅粉色”

“将头盔涂成浅粉色”

“将红色双层巴士涂成浅粉色”

图 21. 视频换脸和 SAM3 风格的视频指代表达分割结果。我们的换脸和换头图像编辑样本仅包含几千个实例,且质量相对较低。例如,交换前后的表情、嘴唇运动、注视方向和头部姿态往往不一致;尽管如此,该模型在保持嘴唇运动和头部姿态方面表现出了一定的泛化能力。此外,我们的训练数据中没有专门的视频编辑数据;因此,我们没有视频指代表达分割数据,更广泛地说,没有视频分割数据。仅通过我们的像素对时间扭曲流场、感知相关任务以及损失函数,我们的模型就实现了视觉和语言理解能力,以及时间跟踪能力。第三个例子表明,我们的模型能够识别指定物体的物理效应,例如阴影。事实上,我们的指代表达分割图像编辑样本源自 RefCOCO 系列数据集,导致掩码轮廓粗糙,并包含带有错误掩码注释的噪声数据。我们相信,更高质量的训练数据(例如具有更精细轮廓的掩码注释)将带来更好的性能。

以 $t=0$ 的 $V_t$ 作为目标视频,并使用其第一帧作为源图像。形式上,相应的 I2V 样本被定义为对 $(I, V)$,其中 $I = V_0$。相应的样本元素注释分别为第一帧注释和视频注释,其中后者包含第一帧注释以及描述主体运动和摄像机运动的运动注释。类似地,人们可以从 T2V 训练样本中构建首尾帧到视频(FLF2V)样本。由于该任务的动机与 I2V 任务类似,

第 34 页

改变单词

“将大写英文单词“WINE”替换为大写英文单词“PEACE””

泛化至未见任务——字幕去除

“去除字幕”

多主体与多任务编辑

“将最左边的女孩替换为白色毛绒泰迪熊,在最右边的男人身上添加淡紫色烟雾”

“给左边的老年女性添加一条米色围巾,去除右边女性戴的帽子”

“将身穿白色短袖上衣的女孩的发型改为长发和浅红色,给身穿黑色服装的女孩添加一个发光皇冠,给身穿长裙的女孩头部添加火焰”

“在左侧草地上添加一座大型希腊罗马大理石天使雕塑,在右侧草地上添加一个池塘,将光照更改为夜光月光”

图 22. 多主体和多任务编辑结果。尽管每个编辑训练样本仅包含单对象、单任务编辑,但在推理时,当编辑指令包含多个对象和各种编辑任务时,我们的模型也能够识别每个需要编辑的对象,并相应地执行各自的编辑效果。这表明我们的模型从根本上获得了真正的视觉编辑能力。我们还展示了改变单词和去除字幕的结果。仅使用对应图像和视频编辑任务的极小权重,该模型就表现出了一定程度的处理这种相对复杂、非刚性视频编辑任务的能力。此外,尽管我们的训练样本中没有任何对应于字幕去除任务的样本,但该模型展示了去除字幕的能力。

我们仅保留 I2V 任务。视频修复任务。对于视频对象去除任务 [67],一旦模型感知到对应于编辑指令的视觉区域,它就应该具备

第 35 页

由轨迹引导的条件输入编辑

“在紫色色块位置生成一个面包”

“在浅粉色圆形色块位置生成一个发光魔法球”

图 23. 由轨迹引导的条件输入编辑。我们的图像编辑任务包括条件图到图像及其逆操作,其中约有 3K 个图像编辑对——从 RefCOCO 数据集中随机采样——涉及从标注有颜色涂抹块的图像中生成指定对象。我们认识到,对于视频编辑任务,这种相应的能力可以产生轨迹条件编辑。例如,在第一和第二示例中,我们随机插入在参考视频中遍历的色块;这使得编辑区域的初始位置和轨迹能够被精确且额外地指定。

被移除的静态或动态物体遮挡的内容的“想象”和生成能力。为了增强这种能力,我们引入了一种通用的视频修复任务。具体而言,如图 7 所示,对于原始像素空间中的 T2V 视频样本,我们使用固定掩码或随时间随机移动的掩码对视频进行遮挡以创建参考视频,并使用原始 T2V 样本作为目标视频。形式上,令 $V \in \mathbb{R}^{F \times H \times W \times 3}$ 表示原始视频。我们定义一个二值遮挡掩码 $M \in \{0, 1\}^{F \times H \times W}$,在需要修复的区域中为零。然后,参考视频构建为 $V \odot M$,其中 $\odot$ 表示逐元素乘法。模型被训练以从被遮挡的区域生成内容,从而学习自然地、合理地“想象”缺失的时空区域。

我们举两种掩码策略为例:固定随机矩形掩码和移动随机矩形掩码。对于旨在模拟静态物体的固定随机矩形掩码,在每一帧中随机选择的一个矩形区域被设为零(黑色)。该矩形具有相同的宽度 $w$ 和高度 $h$。因此,掩码在时间上是静态的:

$$ M_t(i, j) = \begin{cases} 0 & \text{if } i < x + w \text{ and } j < y + h, \\ 1 & \text{otherwise.} \end{cases} \quad (1) $$

其中 $t \in \{0, \dots, F-1\}$。对于旨在模拟移动物体(如行走的狮子)的运动随机矩形掩码,一个随机宽度和高度 $(w, h)$ 的矩形在随机起始位置 $(x_0, y_0)$ 初始化。然后为其分配恒定速度 $(v_x, v_y)$。第 $t$ 帧中矩形的位置为 $(x_t, y_t) = (x_0 + t \cdot v_x, y_0 + t \cdot v_y)$。移动矩形内的每个帧的掩码为零:

$$ M_t(i, j) = \begin{cases} 0 & \text{if } x_t < i < x_t + w \text{ and } y_t < j < y_t + h, \\ 1 & \text{otherwise.} \end{cases} $$

在实践中,掩码可以任意定位,例如静态遮挡帧边缘的边界掩码,或者仅在第一帧中部分可见的移动掩码。然后,训练对被模板指令(如“生成视频中不可见的黑色块区域”)所描述,类似于 $V \odot M$。与传统的视频修复任务定义相比,我们的掩码是随机生成的。实际上,从随机掩码视频输入 $\tilde{V}$ 中生成内容,从而学习在遮挡区域中生成内容。因此,它无需对旨在移除的特定对象进行掩码标注的额外成本。

视频扩展任务。视频外绘 [68] 通过合成缺失的区域来将视频序列扩展到其原始空间边界之外。例如,它可以将从智能手机拍摄的社会媒体片段(例如 9:16)转换为宽屏电影(例如 16:9)宽高比。我们认为,该任务也增强了模型在自然生成上下文连贯扩展(一种想象性合成)的同时保留现有视觉标记的能力,因此我们将其纳入训练任务。现有方法通常在训练期间将视频样本的边界区域掩码作为源视频,如第一帧传播的外绘任务中所述。我们探索了一种通过应用于 T2V 样本的 VAE 潜变量的随机裁剪操作来构建视频外绘训练样本的直接方法。我们将此视频外绘任务称为

第 36 页

泛化至未见过的条件输入任务——无法线图到肖像或肖像动画训练数据

“基于法线图,生成一个穿着西装的金发白人在夜间街灯下跳舞” 🤏

“基于法线图,让图像中的女性跳舞”

“基于法线图,生成一个正在说话的金发白人女性,背景为浅灰色”

🤏

“基于法线图,让图像中的女性说话”

图 24. 泛化至未见过的条件输入任务结果。我们的训练数据仅包含少量与法线图相关的样本,且全部为场景的全局法线图,没有任何涉及人体或肖像的数据。然而,对于仅涉及前景的法线图到图像任务,模型表现出了一定的泛化能力。如第二行所示,在提供人体法线图序列及相应的编辑说明的情况下,我们能够生成展示相应动作的人体舞蹈视频。此外,对于包含参考图像的法线图到视频编辑任务——该任务在训练期间完全未见——模型也表现出了一定程度的泛化能力。

这与视频扩展的传统定义不同。裁剪遵循三种模式之一。对于随机裁剪模式,裁剪高度 $h'_l$ 和宽度 $w'_l$ 均匀采样为: $$ h'_l = \lfloor \eta_h h_l \rfloor, \quad w'_l = \lfloor \eta_w w_l \rfloor \quad (59) $$ 其中 $\eta_{\min}, \eta_{\max}$ 为默认值。左上角 $(i, j)$ 均匀选择,使得 $i \in \{0, 1, \dots, h_l – h'_l\}$ 且 $j \in \{0, 1, \dots, w_l – w'_l\}$。随后,裁剪后的潜在变量为 $z_{l,\text{crop}} = z_l[:, i : i + h'_l, j : j + w'_l, :]$。

具体而言,如图 7 所示,对于给定的 T2V 样本,我们首先提取其 VAE 潜在表示。令原始潜在变量为 $z_l \in \mathbb{R}^{f_l \times h_l \times w_l \times C}$,其中 $f_l$ 表示潜在帧数,$h_l$ 和 $w_l$ 是潜在空间维度的高度和宽度,$C$ 是通道数。我们定义一个随机裁剪函数 $\text{crop}$,从 $z_l$ 中提取子区域以产生裁剪后的潜在变量 $z_{l,\text{crop}} \in \mathbb{R}^{f_l \times h'_l \times w'_l \times C}$,其中 $h'_l \le h_l$ 且 $w'_l \le w_l$。对于固定高度裁剪模式,裁剪宽度 $w'_l$

第 37 页

121 推理帧数:高于训练平均值的 3 倍

“给这两个男人戴上水晶高顶礼帽”

“将光照改为秋日午后的样子”

“将金发女子改为黏土质感的金发女子”

“给这位女士加一条白色围巾”

图 25. 推理期间向更多视频帧的时间泛化。在训练期间,为了节省因在线生成视频编辑数据而产生的 CPU 和 GPU 内存,我们生成平均帧数为 37 帧、最大帧数为 61 帧的视频。在推理阶段,我们考察模型是否对更长的序列表现出时间泛化能力。在 121 帧上进行测试——这在中等配置 GPU 上的推理时间内是可接受的——结果表明,模型对于超出训练分布长度的推理长度仍保留了一定程度的泛化能力。

采样方式如下: 彩色版本。该技术的一个相关且引人注目的应用 是将无声电影时代及之后的早期黑白 电影片段,例如 w ' l = \ b i g \lflo or \xi(60) 查理·卓别林的《舞台之光》,转换为色彩鲜艳的电影。并且裁剪在水平方向上居中,即 对于图像着色任务,我们构建了一个训练 = \bi 样本如下。设 Icol ∈RH×W ×3 为彩色图像 \lfloor(61) g 从其他编辑任务训练集中随机采样的 j 任务;这作为目标图像。对应的 垂直范围覆盖整个高度,因此 zl,crop = zl[:, : ×3 源 灰度 图像 是通过 Igray ∈RH×W, j : j + w′l, :]。对于固定宽度裁剪模式,裁剪 应用标准 亮度 转换公式 到每个 高度 h′ 采样为: 像素。将 Icol 的红、绿、蓝通道 记为 R, G, B ,亮度(灰度)值 Y h = \ b \lflo or \zeta(62) ∈RH×W i g 对于每个空间位置计算如下:Y = 0.299 R + ·并且裁剪在垂直方向上居中,即 0.587 G + 0.114 B。三通道灰度图像随后通过沿通道维度复制 Y 形成: = \bi Igray = [Y, Y, Y ]⊤。编辑指令通过模板句子提供,例如 \lfloor(63) g “为图像 1 添加适当的颜色”。对于视频着色任务,我们也通过静态图像着色数据生成视频编辑样本,使用像素对时间扭曲流场。裁剪后的潜在变量 zl,crop 作为参考元素,而原始完整潜在变量 zl 保留为目标。此外,模板编辑标题采用如下形式:“扩展图像 1,保持图像 1 的内容不变”。因此,模型被训练从部分观察区域生成完整的视频内容。

图像和视频着色任务。单色图像的着色任务 [69, 70] 指的是将灰度图像或视频序列转换为合理的彩色版本。该技术的一个相关且引人注目的应用是将无声电影时代及之后的早期黑白电影片段,例如查理·卓别林的《舞台之光》,转换为色彩鲜艳的电影。对于图像着色任务,我们构建了一个训练样本,从其他编辑任务的训练集中随机采样;这作为目标图像。对应的源灰度图像是通过将标准亮度转换公式应用于每个像素获得的。将 Icol 的红、绿、蓝通道记为 R, G, B,每个空间位置的亮度(灰度)值 Y ∈RH×W 计算如下:Y = 0.299 R + 0.587 G + 0.114 B。三通道灰度图像随后通过沿通道维度复制 Y 形成:Igray = [Y, Y, Y ]⊤。编辑指令通过模板句子提供,例如,“为图像 1 添加适当的颜色”。对于视频着色任务,我们也通过像素对时间扭曲流场从静态图像着色数据生成视频编辑样本。裁剪后的潜在变量 zl,crop 作为参考元素,而原始完整潜在变量 zl 保留为目标。此外,模板编辑标题采用如下形式:“扩展图像 1,保持图像 1 的内容不变”。因此,模型被训练从部分观察区域生成完整的视频内容。

3.7. 从风格化 T2I 到风格化 T2V

我们考察预训练 T2IV 模型的风格化视频生成能力——例如,在印象派和巴洛克绘画风格中——并注意生成的视频通常为写实风格。同样,我们的大多数 T2V 训练视频也来自写实电影和电视剧。由于我们的 T2I 数据包含这些艺术风格的一部分训练示例,一个自然的扩展

第 38 页

第一帧图像到图像(First Frame I2I) 视频到视频 – 风格化(V2V – Stylization)

“将风格改为莫奈印象派油画”

第一帧图像到图像(First Frame I2I) 视频到视频 – 头部替换(V2V – Head Swapping) 🤏

第一帧图像到图像(First Frame I2I) 视频到视频 – 重光照(V2V – Relighting)

“将光照改为夜间室内吊灯”

第一帧图像到图像(First Frame I2I) 视频到视频 – 虚拟试穿(V2V – Virtual Try-on)

“让该男子穿上浅紫色西装外套”

第一帧图像到图像(First Frame I2I) 视频到视频 – 元素替换(V2V – Element Replacement)

“将面包替换为巧克力蛋糕”

图 26. 在相同参考第一帧下,视频编辑与图像编辑任务的视觉输出分布对比。模态模仿编辑损失(Modality mimic editing loss)旨在对齐 V2V 和 I2I 之间的编辑能力。给定一个参考视频和编辑指令,我们执行视频编辑,同时对参考视频的第一帧应用图像编辑。对于不同的任务,紫色矩形内的第一列和第二列分别显示图像编辑结果和视频编辑的第一帧。可以观察到,模型对视频和图像模态的编辑输出分布相对对齐。

是为了使 T2V 仅利用图像编辑数据和视频编辑数据获得与 T2I 相当的风格化生成能力。遵循常见做法,我们将 T2I 训练图像临时复制为多帧视频用于 T2V 训练;这些静态视频包含从风格化图像生成的子集。我们在原始 T2I 提示词后附加句子“摄像机保持静止”(“The camera remains still.”),作为此类静态视频的 T2V 提示词。具体而言,在模态模仿生成步骤中,帧数 $F_{static}$ 从集合 $\{13, 25, 37, 49, 61\}$ 中随机采样。当前训练批次中的第一个 T2I 样本被重复 $F_{static}$ 次以形成静态视频序列,该序列替换了训练批次中的第二个 T2V 样本。此外,在第 4.4 节中,我们定性讨论了包括模态模仿损失(modality mimic losses)和感知相关任务(sense-related tasks)及其相应损失的方法。最后,我们在第 4.5 节中展示了风格化的 T2V 结果。

4.1. 实现细节

我们在第 4.1 节中介绍了 FlowMimic 的实现细节。实验中使用的基准数据集在第 4.2 节中描述。然后,在第 4.3 节中,我们定性展示了 FlowMimic 的编辑结果。

我们使用公开的 Wan2.1-T2V-1.3B 模型 [18] 作为预训练的 T2IV 模型。实验在 32 张中高端 80GB GPU 上进行。我们采用编程函数 torch.nn.functional.kl_div 来实现公式 (39) 中的 $L_{mimic, gen}$,其中“target”、“input”和“reduction”参数分别设置为 $p_{t2v-f,0}$、$\log(p_{t2i,0})$ 和“batchmean”。学习率在 5000 个预热步骤中从 $5 \times 10^{-6}$ 线性增加到 $1 \times 10^{-5}$,然后保持恒定。生成训练步骤与编辑训练步骤的比例为 4:1。以下损失系数

第 39 页

预训练 T2IV 模型

ours

图 27. 在相同的电影提示下,预训练 T2IV 模型与我们模型的 T2I 结果对比。模态模仿生成损失旨在对齐 T2V 和 T2I 之间的生成分布,使后者在电影真实感方面更接近前者。结果表明,与预训练 T2IV 模型相比,我们的模型在 T2I 生成中产生了更好的电影真实感。

被应用:$n_{\text{mimic,gen}} = 5$, $n_{\text{mimic,editing}} = 3$, $\alpha_{\text{mimic,gen}} = 0.1$, $\alpha_{\text{mimic,editing}} = 0.1$, $\alpha_{\text{FM,SC}} = 0.5$, $\alpha_{\text{sense,attn}} = 1.0$。具体而言,为了防止内存溢出,在线生成的视频编辑样本中的帧数是从 13、25、37、49 和 61 中均匀采样的。每个编辑步骤的总训练批次包括 28 个图像编辑样本和 12 个视频编辑样本。

对于第 3.6 节中引入的超参数,我们设置:$\eta_{\min} = 0.5$, $\eta_{\max} = 0.95$, $\xi_{\min} = 0.2$, $\xi_{\max} = 0.33$, $\zeta_{\min} = 0.2$, $\zeta_{\max} = 0.33$。与当前的大参数模型不同,我们的模型旨在验证流场范式以及具有相对较少参数和有限训练样本的算法的可行性。

此外,鉴于在我们的多参考图像编辑样本中,一些参考元素具有相同的分辨率并表现出一定程度的内容耦合,我们也提出了

第 40 页

“长灰色栏杆” 将其与通过以一定概率应用基于缩放的运动类型在线生成的 25 帧视频的最后一帧进行替换。最后,我们对这些参考图像的边界应用轻微的居中聚焦分辨率裁剪,裁剪比例在 0.05 到 0.1 之间随机采样。

“深红色佛像” 此外,除了指代表达分割任务外,我们还引入了指代表达对象移除任务。具体而言,我们使用 RefCOCO [59]、RefCOCOg [59]、RefCOCO+ [59] 和 gRe- fCOCO [61] 生成指代表达对象移除任务的图像编辑数据。我们将原始图像和真实实例掩码输入到掩码引导的图像对象移除模型 ObjectClear [71] 中,并将生成的编辑图像作为指代表达对象移除样本的目标图像,原始图像作为源图像。同样,我们使用像素对时间扭曲流场生成指代表达对象移除的视频编辑样本。编辑标题是一个模板句子,例如“Remove the referring expression. R is JRK.”,其中 “云” 对于多参考可穿戴对象插入任务,我们从现有数据集 AnyInsertion [72] 中构建了约 5K 个图像编辑样本。每个原始数据样本提供:可穿戴对象的参考图像、对象类型文本标签(例如,“项链”)、包含佩戴参考对象的人的目标图像,以及指示参考对象在其中位置的目标图像对应掩码。我们使用参考对象类型文本标签属于“眼镜”、“围巾”、“项链”、“鞋子”、“手镯”、“戒指”和“手表”的子集。以类似的方式,我们将 ObjectClear 应用于目标图像及其掩码以生成修复图像;这成为可穿戴插入任务的源图像。随后,采用原始参考图像作为额外参考,并保持原始目标图像作为真实输出。我们还采用我们的流场范式生成相应的视频编辑样本。编辑指令遵循模板句子,例如“Add the 2 to the person in image 1.”,其中 表示图像标签中的文本。 “戴帽子的中间男子” “打开的笔记本电脑” 参考视频的第一帧 预训练 T2IV 模型 我们的方法 除了上述公开可用的图像编辑数据集外,T2V、T2I 图 28. UNIC-Bench 上指代表达对应文本嵌入与参考视频第一帧之间的交叉注意力图可视化比较。为了增强模型对自然语言和视觉内容的理解能力,以及其跨模态匹配能力,我们设计了感知相关任务和损失。结果表明,与预训练 T2IV 模型相比,我们的模型能够更准确地聚焦于参考视频中与指代表达对应的视觉区域。详细信息请参阅第 4.4 节。 和 I2I 任务的剩余训练数据是内部的。我们的一些 I2I 训练样本在源图像和目标图像之间表现出明显的整体颜色差异。因此,在某些情况下,推理结果可能会从参考输入中显示出类似的整体颜色差异。我们可用的 T2V 训练视频分辨率约为 832 × 480,并表现出一定的局限性:它们可能包含字幕、水印和黑边。此外,由于这些视频是从原始素材中每 12 帧采样一帧获得的,帧间平滑度有时次优。详细信息请参阅第 5 节。利用这些资源可以在数据处理方面获得一些效率提升。在实践中,T2V、T2I 和 I2I 的训练数据

第 41 页

风格化文本到视频生成(Stylized T2V)——“克劳德·莫奈的印象派油画风格”

预训练文本到图像到视频(T2IV)模型

本文方法

预训练文本到图像到视频(T2IV)模型

本文方法

风格化文本到视频生成(Stylized T2V)——“约翰·辛格·萨金特的肖像油画风格”

预训练文本到图像到视频(T2IV)模型

本文方法

预训练文本到图像到视频(T2IV)模型

本文方法

风格化文本到视频生成(Stylized T2V)——“巴洛克油画风格”

预训练文本到图像到视频(T2IV)模型

本文方法

预训练文本到图像到视频(T2IV)模型

本文方法

图 29. 风格化提示词下文本到视频(T2V)结果的对比。针对三种常见的油画风格,我们采用相同的风格化提示词和随机种子进行 T2V 生成。 从结果可以看出,与预训练文本到图像到视频(T2IV)模型相比,我们的模型表现出更好的风格响应能力。

任务可以从现有的公开在线视频(例如来自 YouTube)中大量获取, 公开数据集。 后者涵盖了标准基准测试未涵盖的任务。 FiVE-Bench [52] 包含 420 个源-目标提示词 4.2. 基准测试 对,涵盖六种视频编辑任务:刚性物体替换、 非刚性物体替换、颜色更改、材质 我们展示了 FlowMimic 在公共 视频编辑基准测试 FiVE-Bench [52] 和 UNIC- UNIC-Bench [22] 包含单参考物体移除 Bench [22] 上的定性结果,以及使用额外任务的结果

第 42 页

任务以及包括对象插入、进一步探索编辑能力。图 22、 对象替换、视频风格化和首帧属性保 图 23、图 24 和图 25 从不同角度讨论了模型的编辑能力。 留。具体而言,对于视频去模糊任务,我们采用 响应涉及多个对象和多个任务的编辑指令的能力是编辑模型 GOPRO Large [65] 数据集的测试集。对于所有参考 必须具备的能力。尽管 视频,除了用于时间泛化实验的视频外,我们保留其原始帧率, 我们的训练数据仅包含单对象和单任务 并将前 25 帧作为最终参考视频。用于时间泛化实验 编辑样本,但我们的模型从根本上获得了 的参考视频也保持其原始帧率,并包含 121 真正的视觉编辑能力,并能将其应用于多 帧。我们在中端 GPU 上进行推理。 对象和多任务场景。相关示例展示 在图 22 中。 4.3. 定性视频编辑结果 条件引导编辑是一种流行的应用 场景,最近的工作通过控制网络将轨迹、显式 理论上,只要图像编辑任务在源图像和目标 2D 或显式 3D 信号注入视频模型,以完成轨迹 图像之间满足一定的布局对应关系——无需严格,例如骨架 定制视频编辑、身体动画 [73] 或肖像动 与人体,反之亦然——这种编辑能力也可以通过我们的像素对时间 画 [46] 等任务。我们的图像编辑数据包含适量 扭曲流场扩展到视频。此类编辑任务允许大量的 的条件图到图像对及其逆过程——如法线、骨架和深度图——从而赋予 定义自由,并可根据需要设计;我们 模型一定程度的条件视频生成能力、从图像估计 3D 图(如法线和 在此选择一些经典或有趣的任务进行演示。 深度)的能力,以及从视频估计 2D 图 在训练过程中,每个编辑任务对应的样本权重按 (如参考表达分割和语义分割图)的能力。除了这些常用的 规定比例分配,在实际操作中可以根据需要调整,以优先 条件信号外,我们还探索了一种与 特定任务。 轨迹定制相关的视频编辑任务。具体而言,我们的 图像编辑对包括来自 RefCOCO 数据集的大约 3K 个反向 样本,其中在指定的颜色块区域内生成指定对象。在视频 经典视频编辑任务。 图 8、图 9、图 10、 编辑场景中,这种能力对应于在规定的颜色块轨迹内生成 图 11、图 12、图 13、图 14 和图 15 展示了 指定对象。 在两个常见基准测试 FiVE-Bench 和 UNIC-Bench 如图 23 所示,模型确实表现出这种能力,并能产生相应的物理效果, 上的经典任务的编辑结果。经验上,多 例如水的飞溅。 任务训练并没有构成显著的学习挑战, 法线图到图像数据包含少于 2K 个 但它确实减慢了收敛速度。我们将此视为 样本,所有样本均为场景的全局法线图—— 增强模型综合编辑能力的权衡。对于训练,我们仅使用 即它们不包含任何关于人体或肖像的数据。图 24 基于像素对时间扭曲流场的在线构建 的第二行展示了模型的泛化能力,其中身体动画的条件序列 视频编辑数据。结果表明,这足以使模型 通常由前景身体法线图组成。此外,图 24 说明,对于 掌握多任务编辑,而感知相关任务和 使用条件图对参考图像进行动画制作这一未见任务, 损失使模型摆脱了对编辑区域掩码 模型也表现出一定程度的泛化能力。 序列的依赖。 推理帧数能否超过训练帧数的 更实用和有趣的视频编辑任务。 平均值或最大值是一个值得关注的问题。图 25 中的结果表明, 图 16、图 17、图 18、图 19、图 20、图 21 和图 22 我们模型的编辑能力并不局限于训练 展示了模型在更广泛任务上的表现。 帧分布;相反,它表现出一定程度的时间 我们的训练数据还包括此处未展示的任务, 泛化能力。 例如图像到法线图、深度图到图像、骨架 图到图像、草图到图像编辑——刚性和非刚性—— 每个都分配了适度的权重。事实上,我们的 4.4. 方法定性讨论 视频编辑结果证明了编辑任务的定义具有高度灵活性:只要图像对 在布局上具有松散的对应关系,模型就可以 模态模仿损失。 模态模仿损失旨在对齐模型的生成分布 通过我们的数据范式和算法学习相应的视频编辑任务。

第 43 页

跨越视频和图像模态。具体而言,我们分别引入了一种编辑损失和一种生成损失。如图 26 所示,无论提供完整的参考视频还是仅其第一帧,编辑结果都表现出紧密的分布相似性。模态模仿生成损失旨在使 T2I 生成分布的电影真实感更接近模型 T2V 能力的分布。在图 27 中,可以观察到,与预训练的 T2IV 模型相比,我们的模型在电影提示下产生了更好的电影真实感。此处的 T2I 分辨率为 832 × 480。

为了对齐视频和图像模态的生成能力,并允许每种模态从对方的优势中学习,我们设计了模态模仿生成损失和模态模仿编辑损失。这些损失鼓励 T2I 输出接近 T2V 输出的电影真实感,并将视频编辑输出分布引导至图像编辑分布,后者收敛速度更快,并且受益于每步更多的训练样本。

编辑的基础在于模型对编辑指令和参考视觉内容的正确理解,其准确定位参考视频或图像中由文本指定的主体所对应的视觉区域的能力,以及仅修改该特定区域的能力。现有方法通常通过以下方式简化这一过程:要么通过连接器连接多模态大语言模型(MLLM),然后进行多阶段微调以识别目标区域;要么直接输入掩码序列以明确指示编辑区域。我们的目标是让模型本身内化这种能力,同时减少参数量和训练阶段数量。因此,我们设计了感知相关任务以及相应的区域感知潜在级和注意力级损失。交叉注意力图的可视化表明,我们的模型能够基于文本中的特定短语,相对准确地关注参考视觉输入中的相应区域。此外,跨多个任务的编辑结果表明,模型能够正确定位并仅修改预期的编辑区域。这 collectively 表明,模型在很大程度上已经内化了这种能力。

4.5. 风格化 T2V 结果

我们采用的策略——从 T2I 训练图像生成静态视频序列作为 T2V 训练样本——旨在使视频模态获得接近图像模态的风格化生成能力。如图 29 所示,结果表明,与预训练的 T2IV 模型相比,我们的模型实现了更好的风格响应性。

5. 结论

在本文中,我们旨在联合建模视频和图像模态,用于生成和可选参考图像的语言引导编辑。具体而言,我们提出了一种像素级时间扭曲流场,这是一种在线、实时的数据生成范式,仅从图像编辑数据中即可实现可扩展的视频编辑数据获取——这些数据对模型而言是可理解且可学习的。该范式可应用于自由定义的编辑任务,前提是源图像和目标图像之间存在松散的空间对应关系。

感知相关任务和损失。感知相关任务和损失,特别是感知文本交叉注意力图损失,旨在加强模型对自然语言和视觉模态的理解能力,以及它们在两者之间执行跨模态匹配的能力。为了检验模型在此方面的能力,我们可视化了对应指定短语的交叉注意力图。具体而言,如图 28 所示,我们重建了 UNIC-Bench 中参考视频的前 25 帧,即输出字幕与参考字幕匹配的视频。对于前七个示例,指代表达式是对象移除任务中要移除的对象;对于最后一个风格化示例,我们使用“打开的笔记本电脑”作为指代表达式。在推理期间,对于最后的采样步骤,我们首先计算参考视频第一帧的视觉令牌与指代表达式对应的文本嵌入之间的交叉注意力图,然后在 DiT 注意力头数量和 DiT 块数量上对它们进行平均,最后上采样并将结果可视化为热力图。从结果中可以观察到,与预训练的 T2IV 模型相比,我们的模型能够为给定的特定表达式关注更准确的视觉区域。

未来工作。像素对时间扭曲流场实现了像素级的保留以及从条件图到图像和图像到估计图数据中相应视频对的实时合成。即使图像训练样本的质量和数量有限,结果也表明这种能力可以泛化到高级视频理解任务(例如,语义分割、指代表达式分割)、低级视频处理任务(例如,视频去模糊)和可控视频生成,这代表了一个有前景的研究方向。因此,提高这些图像训练样本的质量和数量为进一步改进提供了可行的途径。例如,目前感知相关任务的数据仅由 RefCOCO 系列数据集组成。这些数据包含的指代表达式种类相对有限,且实例掩码通常由相对粗糙的轮廓勾勒;这可以通过补充来自更广泛类别的数据来改善

第 44 页

类别,以及提供具有更精细轮廓的实例掩码。或者生成或编辑诽谤性视频内容。我们坚决反对此类行为,并认为随着视觉模型的进步,相关的法律框架和伦理准则应逐步完善。

此外,我们可用的大多数 T2V 训练数据由画质中等、帧率较低的昏暗电影和电视片段组成——这是从原始素材中进一步进行帧下采样的结果,导致明显的帧间运动差异和时间平滑度下降。这些片段还经常带有字幕、水印或上下黑边。因此,我们可能会尝试获取更高质量、更干净的数据以提高训练性能。此外,对于我们许多任务而言,相应的图像编辑样本数量相当有限。可用数据还包括受污染或低质量的样本。例如,人脸交换和头部交换任务的训练数据不仅稀缺,而且精度较低。例如,在人脸交换或头部交换前后,表情、嘴唇运动、视线方向和头部姿态缺乏一致性。尽管 ObjectClear 是目前令人印象深刻的掩码引导图像物体移除模型,但其在 RefCOCO 系列数据集上的修复结果往往模糊不清,无法用合理且清晰的内容填充掩码区域。这一问题在 gRefCOCO 数据集上尤为明显,该数据集的实例掩码包含多个物体。因此,当我们使用此类编辑结果作为指代表达物体移除样本的目标图像时,模型的有效性在一定程度上受到影响,表现为输出清晰度降低和合理的修复能力减弱。我们相信,随着图像修复领域的快速发展,将出现更合适的图像物体移除模型来解决此类第三方工具带来的局限性。此外,我们的一些 I2I 训练样本中,源图像和目标图像之间存在明显的全局颜色差异。这可能导致推理结果与参考输入之间出现相应的颜色偏移。我们认为,通过使用更高质量的训练数据并实施过滤器以排除具有显著全局颜色差异的样本,可以缓解这种现象。

此外,我们尚未针对各个任务的权重进行专门的超参数调优。在实践中,对于更感兴趣的任务,增加其相应的数据权重可以加速这些领域的收敛,从而使模型在这些任务上的表现更加熟练。本文提出的一些编辑任务被分配了极小的权重;然而,任务聚焦训练下的探索阶段实验结果表明,每个编辑任务在专注训练下的性能上限相对较高。

伦理考量。AI 视觉模型绝不得在任何情境下被恶意使用,例如用于攻击个人以生成或编辑诽谤性视频内容。我们坚决反对此类行为,并认为随着视觉模型的进步,相关的法律框架和伦理准则应逐步完善。

致谢与时间线。该项目最初启动是为了验证跨图像和视频模态的混合训练是否能使两种模态在生成和编辑任务中相互受益。这一探索催生了本文中包含的数据范式和算法——例如,数据范式将图像编辑能力转移到了视频编辑对应部分。本文所述的方法、动机以及探索性尝试,均在带时间戳的周报中详细记录,并附有指向结果可视化的相关带时间戳的网页链接(例如,不同视频编辑任务的结果、图像编辑结果、使用第 C.8 节介绍的方法进行的参考到视频任务的结果、带有编辑指令的更广泛意义上的 I2V 结果,以及在各种探索的模态模仿损失和策略下的 T2I 和 I2I 结果)。每种方法的实现和实验日志,以及本研究撰写过程,均使用 Git 记录。

Wei Liu 领导了该项目。Dingyun Zhang 提出并实现了 FlowMimic 的核心算法。这包括第 3 节中详述的方法(不包括带有绝对位置编码的元素身份编码)、第 A 节提供的色块抽象方法、第 B 节中的模态模仿范式,以及第 C 节探索阶段的其他尝试。其中,模态模仿生成损失于 2025 年 4 月提出并实现,相关的探索性实验在同一时期完成;第 3.7 节中的策略于 2025 年 6 月探索;第 3.5 节中描述的针对编辑任务的模型架构调整——包括对每个样本元素在 3D RoPE 之后添加带有 1D RoPE 的元素维度元素身份编码——于 2025 年 8 月提出并实现;像素对时间扭曲流场和模态模仿编辑损失于 2025 年 9 月中旬提出并实现;第 3.6 节中的编辑任务细节于 2025 年 9 月和 10 月探索;感知相关任务及其相应的损失于 2025 年 11 月和 12 月提出并实现。在 2025 年 9 月至 12 月初期间,她验证了,当同时在视频和图像模态上进行生成和编辑任务训练时,像素对时间扭曲流场使 FlowMimic 能够掌握本文提出的所有编辑任务乃至更广泛的视频编辑能力,而无需专门构建或收集视频编辑训练样本。这一现象在专注

第 45 页

在单个编辑任务上进行训练,并在所有编辑任务上进行混合训练。她撰写了本文并于 2026 年 5 月中旬完成(未经修订的手稿于 2026 年 4 月完成;论文按原定计划于 2026 年 5 月 22 日内部公开,并上传至出版审查平台等待批准;本论文的 PDF 文件获得了可信的时间戳认证 5,日期为 2026 年 5 月 20 日),对本文提出的模型进行了训练,集成了 Wan2.1 训练框架,并处理了离线 T2V 样本 VAE 潜变量的处理。

Lixue Gong 提出了将元素身份编码应用于具有绝对位置编码的参考元素,以替代 1D RoPE,并实现了该功能。她对原始 T2V 数据进行了帧重采样和标题标注,并在 Wan2.1 框架内集成了 T2I 和上下文 I2I 数据加载器。Dingyun Zhang 于 2025 年 9 月将元素身份编码应用于索引为零的目标元素,而参考元素则被分配从 1 开始的索引。我们还要感谢 Zixuan Zhang 获取 T2V 电影数据并构建内部编译的评估集。我们要感谢参与构建本研究中使用内部 T2I 和 I2I 数据的人员。

参考文献

[1] Jiaxin Cheng, Tianjun Xiao, and Tong He. Consistent video-to-video transfer using synthetic dataset. In ICLR, 2026. 2, 4

[2] Amir Hertz, Ron Mokady, Jay Tenenbaum, Kfir Aberman, Yael Pritch, and Daniel Cohen-Or. Prompt-to-prompt image editing with cross attention control. In ICLR, 2023. 4

[3] Bojia Zi, Penghui Ruan, Marco Chen, Xianbiao Qi, Shaozhe Hao, Shihao Zhao, Youze Huang, Bin Liang, Rong Xiao, and Kam-Fai Wong. Señorita-2m: A high-quality instruction-based dataset for general video editing by video specialists. In NeurIPS, 2025. 4

[4] Qingyan Bai, Qiuyu Wang, Hao Ouyang, Yue Yu, Hanlin Wang, Wen Wang, Ka Leong Cheng, Shuailei Ma, Yanhong Zeng, Zichen Liu, et al. Scaling instruction-based video editing with a high-quality synthetic dataset. In arXiv preprint:2510.15742, 2025. 4

[5] Yuhui Wu, Liyi Chen, Ruibin Li, Shihao Wang, Chenxi Xie, and Lei Zhang. Insvie-1m: Effective instruction-based video editing with elaborate dataset construction. In CVPR, 2025. 4

[6] Haoyang He, Jie Wang, Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, and Lei Xie. Openve-3m: A large-scale high-quality dataset for instruction-guided video editing. In arXiv preprint:2512.07826, 2025. 2, 4

[7] Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke Li, Xing Sun, Tong Xu, and Enhong Chen. A survey on multimodal large language models. In National Science Review, 2024. 2

5 https://ipr.tsa.cn/

[8] Jingyi Zhang, Jiaxing Huang, Sheng Jin, and Shijian Lu. Vision-language models for vision tasks: A survey. In TPAMI, 2024. 2

[9] Zongxia Li, Xiyang Wu, Hongyang Du, Fuxiao Liu, Huy Nghiem, and Guangyao Shi. A survey of state of the art large vision language models: Benchmark evaluations and challenges. In CVPR, 2025. 2

[10] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman R¨adle, Chloe Rolland, Laura Gustafson, et al. Sam 2: Segment anything in images and videos. In ICLR, 2025. 2, 15

[11] Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, et al. Sam 3: Segment anything with concepts. In arXiv preprint:2511.16719, 2025. 2, 15

[12] Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, et al. Grounding dino: Marrying dino with grounded pre-training for open-set object detection. In ECCV, 2024. 2

[13] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, et al. Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution. In arXiv preprint:2409.12191, 2024. 2, 15

[14] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, et al. Qwen2. 5-vl technical report. In arXiv preprint:2502.13923, 2025.

[15] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al. Qwen3-vl technical report. In arXiv preprint:2511.21631, 2025. 2, 15

[16] Lvmin Zhang, Anyi Rao, and Maneesh Agrawala. Adding conditional control to text-to-image diffusion models. In ICCV, 2023. 2, 5

[17] Rui Yu, Shenghua Wan, Yucen Wang, Chen-Xiao Gao, Le Gan, Zongzhang Zhang, and De-Chuan Zhan. Reward models in deep reinforcement learning: A survey. In IJCAI, 2025. 2

[18] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. In arXiv preprint:2503.20314, 2025. 2, 3, 4, 5, 6, 18, 38

[19] Chong Mou, Qichao Sun, Yanze Wu, Pengze Zhang, Xinghui Li, Fulong Ye, Songtao Zhao, and Qian He. Instructx: Towards unified visual editing with mllm guidance. In arXiv preprint:2510.08485, 2025. 2, 3, 6, 13

[20] Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, and Weicai Ye. Vino: A unified visual generator with interleaved omnimodal context. In arXiv preprint:2601.02358, 2026. 2, 3, 6, 13

[21] Yuxuan Bian, Zhaoyang Zhang, Xuan Ju, Mingdeng Cao, Liangbin Xie, Ying Shan, and Qiang Xu. Videopainter: Any-length video inpainting and editing with plug-and-play context control. In SIGGRAPH, 2025. 3, 4, 24

第 46 页

[22] Zixuan Ye, Xuanhua He, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qifeng Chen, and Wenhan Luo. Unic: Unified in-context video editing. In arXiv preprint:2506.04216, 2025. 4, 13, 24, 25, 26, 27, 30, 41, 49

[23] Wenshuo Gao, Xicheng Lan, and Shuai Yang. Anyportal: Zero-shot consistent video background replacement. In ICCV, 2025. 3, 5, 29

[24] Shaoteng Liu, Tianyu Wang, Jui-Hsien Wang, Qing Liu, Zhifei Zhang, Joon-Young Lee, Yijun Li, Bei Yu, Zhe Lin, Soo Ye Kim, et al. Generative video propagation. In CVPR, 2025. 3, 4

[25] Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, and Wenhu Chen. Univideo: Unified understanding, generation, and editing for videos. In ICLR, 2026. 3, 6, 13

[26] Kai Zhang, Lingbo Mo, Wenhu Chen, Huan Sun, and Yu Su. Magicbrush: A manually annotated dataset for instruction- guided image editing. In NeurIPS, 2023. 4

[27] Yusu Qian, Eli Bocek-Rivele, Liangchen Song, Jialing Tong, 400k: A large-scale dataset for text-guided image editing. arXiv preprint:2510.19808, 2025. 4

[28] Yuhan Wang, Siwei Yang, Bingchen Zhao, Letian Zhang, Qing Liu, Yuyin Zhou, and Cihang Xie. Gpt-image-edit-1.5 m: A million-scale, gpt-generated image dataset. In arXiv preprint:2507.21033, 2025. 4

[29] Yang Ye, Xianyi He, Zongjian Li, Bin Lin, Shenghai Yuan, Zhiyuan Yan, Bohan Hou, and Li Yuan. Imgedit: A unified image editing dataset and benchmark. In arXiv preprint:2505.20275, 2025. 4

[30] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. Learning transferable visual models from natural language supervision. In ICML, 2021. 4, 54

[31] Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, and Hongsheng Li. Relightmaster: Precise video relighting with multi-plane light images. In arXiv preprint:2511.06271, 2025. 4

[32] Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, et al. Recammaster: Camera-controlled generative ren- dering from a single video. In ICLR, 2026. 4

[33] Max Ku, Cong Wei, Weiming Ren, Harry Yang, and Wenhu Chen. Anyv2v: A tuning-free framework for any video-to- video editing tasks. In TMLR, 2024. 4, 28

[34] Jiaming Song, Chenlin Meng, and Stefano Ermon. Denoising diffusion implicit models. In ICLR, 2021. 4

[35] Xiang Fan, Anand Bhattad, and Ranjay Krishna. Videoshop: Localized semantic video editing with noise-extrapolated dif- fusion inversion. In ECCV, 2024. 4

[36] Yiyang Chen, Xuanhua He, Xiujun Ma, and Jack Ma. Con- textflow: Training-free video object editing via adaptive con- text enrichment. In AAAI, 2026. 4, 19

[37] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, and Matt Le. Flow matching for generative modeling. In ICLR, 2023. 4, 6

[38] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Liang Wang, Weizhu Chen, et al. Lora: Low-rank adaptation of large language models. In ICLR, 2022. 4

[39] Wenqi Ouyang, Yi Dong, Lei Yang, Jianlou Si, and Xingang Pan. I2vedit: First-frame-guided video editing via image-to- video diffusion models. In SIGGRAPH Asia, 2024. 4

[40] Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, and Yu Liu. Vace: All-in-one video creation and editing. In ICCV, 2025. 4

[41] William Peebles and Saining Xie. Scalable diffusion models with transformers. In ICCV, 2023. 4, 6

[42] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, and Yunfeng Liu. Roformer: Enhanced transformer with rotary position embedding. In Neurocomputing, 2024. 4, 22

[43] Yujie Zhou, Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Qidong Huang, Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, et al. Light-a-video: Training-free video relight- ing via progressive light fusion. In ICCV, 2025. 5

[44] Sanoojan Baliah, Yohan Abeysinghe, Rusiru Thushara, Khan Muhammad, Abhinav Dhall, Karthik Nandakumar, and Muhammad Haris Khan. Vface: A training-free approach for diffusion-based video face swapping. In WACV, 2026. 5

[45] Qingdong He, Xueqin Chen, Yanjie Pan, Peng Tang, Pengcheng Xu, Zhenye Gan, Chengjie Wang, Xiaobin Hu, Jiangning Zhang, and Yabiao Wang. The devil is in the details: Enhancing video virtual try-on via keyframe-driven details injection. In arXiv preprint:2512.20340, 2025. 5

[46] Dingyun Zhang. Rig-your-portrait: Controllable and re- lightable portrait video generation with explicit 3d guidance. https://rigyourportrait.github.io, 2025. 5, 42

[47] Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, et al. Editverse: Unifying image and video editing and generation with in-context learning. In arXiv preprint:2509.20360, 2025. 6

[48] Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, and Hao Li. Omni-video 2: Scaling MLLM-conditioned dif- fusion for unified video generation and editing. In arXiv preprint:2602.08820, 2026. 6

[49] Henghui Ding, Song Tang, Shuting He, Chang Liu, Zuxuan Wu, and Yu-Gang Jiang. Multimodal referring segmentation: A survey. In arXiv preprint:2508.00265, 2025. 6

[50] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszko- reit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin. Attention is all you need. In NIPS, 2017. 6

[51] Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu. Exploring the limits of transfer learning with a unified text-to-text transformer. In JMLR, 2020. 6, 17

[52] Minghan Li, Chenxi Xie, Yichen Wu, Lei Zhang, and Mengyu Wang. Five-bench: A fine-grained video editing benchmark for evaluating emerging diffusion and rectified flow models. In ICCV, 2025. 13, 19, 20, 22, 23, 41

第 47 页

[53] Haocheng Xi, Shuo Yang, Yilong Zhao, Chenfeng Xu, [69] Bingchen Li, Zhixin Wang, Fan Li, Jiaqi Xu, Jiaming Guo, Muyang Li, Xiuyu Li, Yujun Lin, Han Cai, Jintao Zhang, Renjing Pei, Xin Li, and Zhibo Chen. Colorflux: A structure- Dacheng Li, et al. Sparse videogen: Accelerating video dif- color decoupling framework for old photo colorization. In fusion transformers with spatial-temporal sparsity. In ICML, arXiv preprint:2603.28162, 2026. 37 2025. 11 [70] Hongbo Zhao, Jiaxing Li, Peiyi Zhang, Peng Xiao, Jianxin [54] James M Joyce. Kullback-leibler divergence. In International Lin, and Yijun Wang. Colorsurge: Bringing vibrancy and encyclopedia of statistical science, 2025. 13 efficiency to automatic video colorization via dual-branch [55] Xi Chen, Zhifei Zhang, He Zhang, Yuqian Zhou, Soo Ye Kim, fusion. In SIGGRAPH, 2025. 37 Qing Liu, Yijun Li, Jianming Zhang, Nanxuan Zhao, Yilin [71] Jixin Zhao, Shangchen Zhou, Zhouxia Wang, Peiqing Yang, Wang, et al. Unireal: Universal image generation and editing and Chen Change Loy. Objectclear: Complete object removal via learning real-world dynamics. In CVPR, 2025. 13 via object-effect attention. In CVPR, 2026. 40 [56] Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xin- [72] Wensong Song, Hong Jiang, Zongxin Yang, Zheqiao Cheng, grun Xing, Ruiran Yan, Chaofan Li, Shuting Wang, Tiejun Ruijie Quan, and Yi Yang. Insert anything: Image insertion Huang, and Zheng Liu. Omnigen: Unified image generation. via in-context editing in dit. In AAAI, 2026. 40 In CVPR, 2025. 13, 50 [73] Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, Zilong Dong, [57] Jiannan Wu, Yi Jiang, Peize Sun, Zehuan Yuan, and Ping Luo. Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, and Siyu Zhu. Language as queries for referring video object segmentation. Champ: Controllable and consistent human image animation In CVPR, 2022. 16 with 3d parametric guidance. In ECCV, 2024. 42 [74] Zhuowei Chen, Bingchuan Li, Tianxiang Ma, Lijie Liu, Ming-[58] Feiyu Pan, Hao Fang, Fangkai Li, Yanyu Xu, Yawei Li, Luca cong Liu, Yi Zhang, Gen Li, Xinghui Li, Siyu Zhou, Qian Benini, and Xiankai Lu. Semantic and sequential alignment He, et al. Phantom-data: Towards a general subject-consistent for referring video object segmentation. In CVPR, 2025. 16 video generation dataset. In arXiv preprint:2506.18851, 2025. [59] Licheng Yu, Patrick Poirson, Shan Yang, Alexander C Berg, 50 and Tamara L Berg. Modeling context in referring expressions. [75] Lijie Liu, Tianxiang Ma, Bingchuan Li, Zhuowei Chen, Jiawei In ECCV, 2016. 16, 40 Liu, Gen Li, Siyu Zhou, Qian He, and Xinglong Wu. Phan- [60] Sahar Kazemzadeh, Vicente Ordonez, Mark Matten, and tom: Subject-consistent video generation via cross-modal Tamara Berg. Referitgame: Referring to objects in pho- alignment. In ICCV, 2025. 50, 54 tographs of natural scenes. In EMNLP, 2014. 16 [76] Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan [61] Chang Liu, Henghui Ding, and Xudong Jiang. Gres: General- Pang, Feiyu Chen, and Aditya Grover. Self-distilled reasoner: ized referring expression segmentation. In CVPR, 2023. 16, On-policy self-distillation for large language models. In arXiv 40 preprint:2601.18734, 2026. 50 [62] Guangxuan Xiao, Tianwei Yin, William T Freeman, Fr´edo [77] Mingyang Song and Mao Zheng. A survey of on- Durand, and Song Han. Fastcomposer: Tuning-free multi- policy distillation for large language models. In arXiv subject image generation with localized attention. In IJCV, preprint:2604.00626, 2026. 2025. 17 [78] Leslie Pack Kaelbling, Michael L Littman, and Andrew W [63] Maithra Raghu, Thomas Unterthiner, Simon Kornblith, Moore. Reinforcement learning: A survey. In JAIR, 1996. 50 Chiyuan Zhang, and Alexey Dosovitskiy. Do vision trans- [79] Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Steven formers see like convolutional neural networks? In NeurIPS, Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Xin Jin, 2021. 19 Liangchen Li, et al. Z-image: An efficient image generation [64] Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, foundation model with single-stream diffusion transformer. Daiguo Zhou, and Jian Luan. From ideal to real: Stable arXiv preprint:2511.22699, 2025. 50 video object removal under imperfect conditions. In arXiv [80] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim En- preprint:2603.09283, 2026. 24 tezari, Jonas M¨uller, Harry Saini, Yam Levi, Dominik Lorenz, [65] Seungjun Nah, Tae Hyun Kim, and Kyoung Mu Lee. Deep Axel Sauer, Frederic Boesel, et al. Scaling rectified flow trans- multi-scale convolutional neural network for dynamic scene formers for high-resolution image synthesis. In ICML, 2024. deblurring. In CVPR, 2017. 28, 42 50 [66] Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang [81] Huang Chen and MingJun Dai. Enhancing robustness in Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y Feng, and multi-agent reinforcement learning via temporal consistency Yiannis Aloimonos. First frame is the place to go for video regularization: A self-distillation framework. In Knowledge- content customization. In arXiv preprint:2511.15700, 2025. Based Systems, 2026. 50 24 [82] Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi [67] Weize Quan, Jiaxi Chen, Yanli Liu, Dong-Ming Yan, and Pe- Luo, Haoxin Liu, B Aditya Prakash, Josiah Hester, Jindong ter Wonka. Deep learning-based image and video inpainting: Wang, and Srijan Kumar. Unisd: Towards a unified self- A survey. In IJCV, 2024. 34 distillation framework for large language models. In arXiv [68] Zhongrui Yu, Martina Megaro-Boldini, Robert W Sumner, preprint:2605.06597, 2026. 50 and Abdelaziz Djelouah. Unboxed: Geometrically and tem- [83] Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng porally consistent video outpainting. In CVPR, 2025. 35 Hou, Anxiang Zeng, and Jianqiang Huang. Cccaption: Dual-

第 48 页

用于完整且准确图像描述的奖励强化学习。在 CVPR,2026。51 [84] Bernhard Kerbl, Georgios Kopanas, Thomas Leimk¨uhler, George Drettakis, 等人。3d gaussian splatting for real-time radiance field rendering。在 ACM Trans. Graph.,2023。51 [85] Xiaoshi Wu, Yiming Hao, Keqiang Sun, Yixiong Chen, Feng Zhu, Rui Zhao, 和 Hongsheng Li。Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis。在 arXiv preprint:2306.09341,2023。 52 [86] Yuval Kirstain, Adam Polyak, Uriel Singer, Shahbuland Ma- tiana, Joe Penna, 和 Omer Levy。Pick-a-pic: An open dataset of user preferences for text-to-image generation。在 NeurIPS, 2023。52 [87] Masud An Nur Islam Fahim, Nazmus Saqib, 和 Jani Boutel- lier。Stam: Zero-shot style transfer using diffusion model via attention modulation。在 CVPR,2025。52 [88] Gowthami Somepalli, Anubhav Gupta, Kamal Gupta, Shra- may Palta, Micah Goldblum, Jonas Geiping, Abhinav Shri- vastava, 和 Tom Goldstein。Measuring style similarity in diffusion models。arXiv preprint:2404.01292,2024。53 [89] Maxime Oquab, Timoth´ee Darcet, Th´eo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, 等人。Dinov2: Learning robust visual features without supervision。在 ICLR, 2025。54 [90] Jonathan Ho 和 Tim Salimans。Classifier-free diffusion guidance。在 NeurIPS,2021。54 [91] Joseph Redmon, Santosh Divvala, Ross Girshick, 和 Ali Farhadi。You only look once: Unified, real-time object detec- tion。在 CVPR,2016。54 [92] Yufan Deng, Xun Guo, Yizhi Wang, Jacob Zhiyuan Fang, Angtian Wang, Shenghai Yuan, Yiding Yang, Bo Liu, Haibin Huang, 和 Chongyang Ma。Cinema: Coherent multi- subject video generation via mllm-based guidance。在 arXiv preprint:2503.10391,2025。54

第 49 页

A. FFP 细节与色块抽象

图30. 在 UNIC-Bench [22] 的首帧传播测试样本中,观察到由第三方工具对源视频第一帧中的指定对象进行替换编辑后,结果对象与原始对象之间存在显著的空间漂移。例如,在输入视频描绘一只行走的棕熊的场景中,对第一帧应用的编辑将其变为一只行走的山羊。山羊本应出现在棕熊的位置;然而,可视化结果显示山羊与熊之间存在明显空间漂移。这种差异在像素层面更为明显,例如踏步动作中四条腿的精确位置无法对齐。

图31. 色块抽象方法的示意图。我们使用色块来抽象地表示对象,其中原始色块与替换色块在颜色、形状和位置上存在显著差异。这种方法模拟了传播帧中的编辑结果相对于源视频第一帧中的原始对象表现出显著定位漂移的场景。

本文在训练任务的多样性与收敛速度之间取得平衡,以验证我们的数据范式和算法的有效性。因此,对于首帧传播任务,我们主要在对象添加、对象移除和向外绘制(outpainting)等子任务上进行训练,同时也包含极小比例的样式化、对象替换和背景替换等子任务。所有这些任务的训练数据均从单参考图像编辑样本中在线生成。实际上,在我们对首帧传播任务的专注探索中,我们还从多参考图像编辑样本中的相应图像对在线生成这些任务的训练数据。在线生成的具体方法详见第 3.6 节。

在 UNIC-Bench [22] 的首帧传播对象替换测试样本中,我们观察到第三方图像编辑工具对源视频第一帧中的指定对象进行替换时,偶尔会导致替换对象与原始对象之间出现显著的空间漂移,如图 30 所示。因此,在专注实验中,我们于 2025 年 10 月设计了一种针对性方法,以解决此类第三方工具错误导致的替换结果中的显著空间漂移问题。自然,我们旨在在训练过程中让模型接触到类似情况,即替换结果与原始对象之间存在 substantial 空间漂移。我们没有收集符合要求的额外图像编辑数据,而是采用基于抽象的方法并验证其有效性。具体而言,我们采用“色块抽象”来模拟这一场景,假设从模型的角度来看,这两种情况是相似的,因此是可学习的。特别是,遵循像素对时间扭曲流场背后的动机,我们假设从模型的角度来看,两个空间漂移的对象可以由两个颜色不同、形状不同且在空间上也存在漂移的色块来表示。这种方法有助于模型学习当两个对象的像素仅粗略对应时的对象替换编辑。

如图 31 所示,对于包含主体的图像,如果主体是一个人,或者是没有主体的纯背景图像,我们将其复制为三份。在第一张图像中,我们在随机位置添加一个随机颜色的矩形,代表原始主体。在第二张图像中,我们添加一个不同颜色的随机矩形,其大小和位置相对于第一个矩形在一定阈值内变化。位置关系进一步分为三种情况:完全包含在第一个矩形内、与第一个矩形部分重叠或完全不重叠。第二张图像中的矩形代表对象替换的编辑结果,与原始对象存在显著的位置漂移。第三张图像与包含矩形的第二张图像相同,作为目标图像。

基于此图像样本,我们在线生成视频编辑样本,其中第一张和第三张图像构成获取视频对的图像对,第二张图像作为参考传播首帧。通过这种方法,如图 32 所示,首帧传播结果中的替换对象表现出与原始对象一致的自然运动。即使由于第三方工具引入的编辑伪影导致背景不一致,这一结论依然成立。

图32. 使用色块抽象方法的首帧传播结果。可以观察到,尽管传播帧中的替换对象与源视频第一帧中的原始对象之间存在显著的空间差异和动作不对齐,模型仍能为替换对象生成合理的运动。即使存在因第三方工具引入的编辑伪影而导致的背景不一致,情况也是如此。

色块抽象方法还包含几种变体。例如,可以首先从图像对在线生成视频对,然后将满足上述条件的两个矩形分别添加到源视频和目标视频的首帧中,

第 50 页

并允许它们随时间进行平滑、单向的运动。在物体移除任务的背景下,我们还探索了在包含主体的参考视频中添加时间上静止或移动的颜色块,目标视频保持为原始参考视频,从而模拟遮挡场景下的视频修复数据。颜色块的形状不限于矩形;例如,它可能会随时间变形,或被替换为颜色实例掩码。颜色块抽象是我们探索过程中验证为有效的一种方法;然而,本文呈现的结果并未包含该策略,因为我们希望模型学习在物体替换过程中保持像素级编辑效果,因此我们不考虑此类第三方工具引入的显著编辑误差。

B. 模态模仿范式

我们认为,第 3.3 节中模态模仿部分的动机和方法可以从不同角度概括为不同的范式,并可能应用于相应的合适场景。本文提出的具体实现,以及第 C 节后续介绍的探索阶段中探索的方法,可能可以适应这些特定场景。以下列出两个示例。

B.1. 流匹配模型的在线策略自蒸馏

随着本文接近完成,在线策略自蒸馏(On-policy Self-distillation, OPSD)[76–78] 这一术语已获得广泛关注。我们认为,从 OPSD 的角度来看,我们于去年四月探索的模态模仿范式背后的模仿过程,本质上构成了流匹配模型的一种 OPSD。学生在任意状态下生成自己的“错误”,并由同样源自该模型的教师模型进行实时校正。模态模仿范式是在早期探索阶段构思的,基于图 3 所示的观察结果;因此,本文的模态模仿部分并未使用 OPSD 这一术语。然而,从 OPSD 的角度来看,图 26 和图 27 中模态模仿的编辑和生成结果证明,流匹配模型的 OPSD 确实是可行的。

第 3.3 节和第 C 节中描述的模仿方法——例如第 C.2 节中的模态模仿生成特征分数损失或特征损失——也可以应用于图像或视频流匹配模型的 OPSD,例如 Z-image [79] 和 Stable Diffusion 3.5 Medium [80]。

此外,我们认为这种模态模仿范式也可以应用于其他更有利的条件(例如,更详细的描述、额外的参考图像、图像质量更好的参考图像,或可见部分更大的视角),从而增强模型与这些条件相关的性能或能力。例如,考虑一个同时具备 T2I 和 I2I 能力的预训练模型。更有利的条件可能涉及相对于原始描述提供更详细的输出描述,相应的能力则是更细粒度的生成或编辑质量。理想情况下,通过第 3.3 节和第 C 节中描述的模仿方法,模型可以在简单描述下实现比通过原始监督微调(SFT)所能达到的更细粒度的生成或编辑。特别是,一些自蒸馏方法 [81, 82] 使用当前训练步骤中学生模型权重的指数移动平均(EMA)作为更新后的教师模型权重,以稳定训练过程,而我们的模态模仿方法无需采用此策略即可稳定收敛。

模态模仿范式可以概括如下:给定两个配置相同的样本,其中一个样本享有更有利的条件,模型在该有利条件样本上的表现更好。通过应用适当的损失或策略,我们鼓励模型在朴素样本上的性能模仿其在有利条件对应样本上的性能。通过这种能力模仿,模型在推理时表现出与是否存在有利条件无关的可比性能。也就是说,原本与有利条件相关联的能力被提升为一种永久能力,即使在该条件缺失时也能持续存在。

在本文中,以模态模仿生成为例,其他配置对应于原始潜在变量、噪声、时间步、噪声潜在变量和条件文本嵌入,而有利条件则涉及随时间以及后续帧进行时间注意力机制。多帧 T2V 凭借其时间维度,本质上更适合纠缠时空全自注意力架构。因此,鼓励模型的 T2I 生成能力模仿其更逼真、更具生命力的 T2V 对应物。同样,对于使用专门构建的主体到视频(Subject-to-Video, S2V)[74] 和主体到图像(Subject-to-Image, S2I)[56] 数据训练的模型——例如一个吸引人的模型,Phantom [75]——在 S2I 和 S2V 之间也观察到了电影真实感和身份保持方面的差距。因此,人们还可以利用模态模仿编辑损失来鼓励模型的 S2I 能力模仿其更逼真、更具生命力的 S2V 对应物。此外,我们在参考视频到视频任务上基于预训练 T2IV 模型的尝试在第 C.8 节中简要描述。

FlowMimic-OPSD。随着本文接近完成,在线策略自蒸馏(OPSD)[76–78] 这一术语已获得广泛关注。我们认为,从 OPSD 的角度来看,我们于去年四月探索的模态模仿范式背后的模仿过程,本质上构成了流匹配模型的一种 OPSD。学生在任意状态下生成自己的“错误”,并由同样源自该模型的教师模型进行实时校正。模态模仿范式是在早期探索阶段构思的,基于图 3 所示的观察结果;因此,本文的模态模仿部分并未使用 OPSD 这一术语。然而,从 OPSD 的角度来看,图 26 和图 27 中模态模仿的编辑和生成结果证明,流匹配模型的 OPSD 确实是可行的。

第 3.3 节和第 C 节中描述的模仿方法——例如第 C.2 节中的模态模仿生成特征分数损失或特征损失——也可以应用于图像或视频流匹配模型的 OPSD,例如 Z-image [79] 和 Stable Diffusion 3.5 Medium [80]。

此外,我们认为这种模态模仿范式也可以应用于其他更有利的条件(例如,更详细的描述、额外的参考图像、图像质量更好的参考图像,或可见部分更大的视角),从而增强模型与这些条件相关的性能或能力。例如,考虑一个同时具备 T2I 和 I2I 能力的预训练模型。更有利的条件可能涉及相对于原始描述提供更详细的输出描述,相应的能力则是更细粒度的生成或编辑质量。理想情况下,通过第 3.3 节和第 C 节中描述的模仿方法,模型可以在简单描述下实现比通过原始监督微调(SFT)所能达到的更细粒度的生成或编辑。特别是,一些自蒸馏方法 [81, 82] 使用当前训练步骤中学生模型权重的指数移动平均(EMA)作为更新后的教师模型权重,以稳定训练过程,而我们的模态模仿方法无需采用此策略即可稳定收敛。

模态模仿范式可以概括如下:给定两个配置相同的样本,其中一个样本享有更有利的条件,模型在该有利条件样本上的表现更好。通过应用适当的损失或策略,我们鼓励模型在朴素样本上的性能模仿其在有利条件对应样本上的性能。通过这种能力模仿,模型在推理时表现出与是否存在有利条件无关的可比性能。也就是说,原本与有利条件相关联的能力被提升为一种永久能力,即使在该条件缺失时也能持续存在。

在本文中,以模态模仿生成为例,其他配置对应于原始潜在变量、噪声、时间步、噪声潜在变量和条件文本嵌入,而有利条件则涉及随时间以及后续帧进行时间注意力机制。多帧 T2V 凭借其时间维度,本质上更适合纠缠时空全自注意力架构。因此,鼓励模型的 T2I 生成能力模仿其更逼真、更具生命力的 T2V 对应物。同样,对于使用专门构建的主体到视频(Subject-to-Video, S2V)[74] 和主体到图像(Subject-to-Image, S2I)[56] 数据训练的模型——例如一个吸引人的模型,Phantom [75]——在 S2I 和 S2V 之间也观察到了电影真实感和身份保持方面的差距。因此,人们还可以利用模态模仿编辑损失来鼓励模型的 S2I 能力模仿其更逼真、更具生命力的 S2V 对应物。此外,我们在参考视频到视频任务上基于预训练 T2IV 模型的尝试在第 C.8 节中简要描述。

B.2. 多任务模型的模态自对齐

在第 B.1 节中,我们将模态模仿的动机和方法概括为一个范式,该范式可以从

第 51 页

一种蒸馏视角。从分布对齐的角度来看,模态模仿的动机和方法也可以推广到另一种范式。具体而言,对于相互关联的任务,同时训练它们有望相互提升彼此的性能,这是一个普遍的观点。特别地,考虑两个同构或互逆的任务,其输入模态可以用共享的输入特征空间来表示,而其输出模态可以用共享的输出特征空间来表示。我们认为,当输入在推理时也在共享的输入特征表示空间中接近时,期望由统一模型生成的两个输出模态的分布在共享的输出特征表示空间中是对齐的,这是很自然的——即模态自对齐。然而,以同时训练 T2I 和 T2V 任务为例,图 3 中展示的结果表明,在某些场景下,简单地一起训练多个任务是不够的。因此,我们采用第 3.3 节和第 C 节中描述的模仿方法,在训练期间显式地约束这种自对齐,其中损失函数可以是分布对齐损失、特征得分损失或特征距离损失,从而使 T2I 生成分布的电影真实感更接近于模型的 T2V 能力。这种结合了模态自对齐视角和方法的自监督范式,如果被认为可能显式或隐式地提高跨任务的性能,也可以应用于其他多任务训练场景。

例如,考虑一个预训练的多模态模型,该模型既具备根据图像生成描述的能力(图像描述能力),又具备根据文本提示合成图像的能力(图像生成能力)。在推理时,如果输入一个图像和一个文本提示,它们的特征在共享的 CLIP 双模态特征空间中彼此接近,分别对应于 Image-to-Text (I2T) [83] 和 T2I 任务——例如,一个匹配的文本-图像对——那么,理想情况下,生成的文本描述和图像的 CLIP 特征在该特征空间中也应保持接近。因此,可以在后训练期间进行相应的训练。具体而言,在后训练过程中,I2T 和 T2I 任务仍然同时训练,相同的匹配文本-图像对可以在同一个训练步骤中同时作为 I2T 和 T2I 的训练样本。I2T 分支可以在自回归下一个 token 预测的交叉熵损失下进行训练,而 T2I 分支可以在流匹配损失下进行训练。类似于第 C.2 节中描述的方法,对于这样的 I2T 和 T2I 样本对,可以在训练期间对预测的文本描述和解码的图像(在非高噪声时间步采样)计算 CLIP 特征损失。这可能会隐式地提高 I2T 的图像-文本对齐度和提示忠实度。

C. 探索期间的其他尝试

我们在此简要描述在探索阶段探索的其他方法和任务的一个子集,特别是与模态模仿方法相关的部分。如果读者感兴趣,我们可能会补充更多在探索阶段探索的方法和任务。

C.1. 模态模仿的度量

2025 年 4 月,我们还尝试使用均方误差 (MSE) 作为模态模仿生成损失的度量,应用于展平的估计原始潜在变量 $\mathcal{L}_{\text{mimic, gen, mse}} = \|\mathcal{L}_{\text{orig}} – \mathcal{L}_{\text{prot}}\|^2$ (64) 在模态模仿生成步骤期间。直观地说,MSE 度量在模态模仿的学习过程中提供的灵活性较少,使其更接近于潜在空间重建损失,而不是分布对齐损失——后者鼓励模型进一步学习抽象视觉感知特征的分布。因此,进行了这项实验,以实证验证后者确实更合适。基于我们当时的比较观察,$L_{\text{mimic, gen, mse}}$ 在模态模仿中的收敛速度明显较慢,且性能较差——这可以通过 T2I 输出与 long-clip T2V 长序列的第一帧推理结果之间的视觉感知差异来解释,与本文采用的 $L_{\text{mimic, gen}}$ 相比。类似的发现也在 2025 年 9 月对模态模仿编辑损失的验证中得到证实,其中 MSE 度量偶尔会导致 V2V 推理输出中出现异常的全球颜色闪烁伪影。

C.2. 基于视觉感知特征分数的模仿

虽然 $L_{\text{mimic, gen}}$ 作用于估计的原始潜在变量的分布,但在 2025 年 4 月,我们还尝试调查是否通过估计视觉感知特征

第 52 页

图像空间中解码潜变量的得分,并计算估计的电影美学特征得分与绝对得分损失(例如 L1 或 L2 损失)之间的差异,T2I 生成分布同样可以在电影美学层面模仿 T2V 生成分布。具体而言,遵循与第 3.3 节介绍的模态模仿生成损失相同的样本构建过程和配置,我们使用内部电影美学特征得分模型从图像空间中估计的原始图像 $\hat{z}^{t2v-f,0}_1$ 和 $\hat{z}^{t2i,0}_1$ 中获取电影美学特征得分,并计算得分损失。估计的得分值越高,表示电影美学效果越好。为了避免由得分模型(在某些语境下也称为“奖励模型”)引起的潜在估计误差,当前者得分不高于后者得分时,模态模仿生成特征得分损失设为零。如果得分对的数量不改变方法的核心性质——那么可以将视频和图像模态的得分向量视为两个独立的得分特征,计算它们经过 softmax 变换后的分布之间的分布损失,从而获得辅助得分分布损失。此外,如果有可以估计图像得分分布的得分模型可用,KL 散度等分布度量也可用于计算模态模仿生成特征得分损失,并且温度参数可用于缩放 softmax 函数的 logit 输入。

同样,可以使用感知特征估计模型从图像空间中解码的估计原始潜变量 $\hat{z}^{t2v-f,0}_1$ 和 $\hat{z}^{t2i,0}_1$ 中提取视觉感知特征(例如,由特征得分模型本身提取的特征),并计算对应的模态模仿生成特征损失 $L^{gen}_{mimic}$。为了确保图像空间中估计原始图像的充分清晰度,我们将时间步采样限制在非高噪声区域,具体在时间步区间 $[15, 860)$ 内。

令 $sc^{t2v-f,0}_1 = S(\hat{z}^{t2v-f,0}_1)$ 和 $sc^{t2i,0}_1 = S(\hat{z}^{t2i,0}_1)$ 分别表示估计的电影美学特征得分,其中 $S$ 表示特征得分模型。我们采用 L1 损失来计算特征得分损失。模态模仿生成特征得分损失公式化为:

$$ L^{gen}_{mimic, \text{score}} = \begin{cases} |sc^{t2v-f,0}_1 – sc^{t2i,0}_1|, & \text{if } sc^{t2v-f,0}_1 > sc^{t2i,0}_1 \\ 0, & \text{otherwise} \end{cases} $$

经验上,T2I 输出的电影美学有所改善;然而,其收敛速度和整体性能都明显弱于 $L^{gen}_{mimic}$,后者为视觉模型提供了更直接的学习信号,且不受第三方特征提取器容量的瓶颈限制。

我们还尝试使用 HPSv2 模型 [85] 通过同时将 $\hat{z}^{t2v-f,0}_1$ 对应的第一帧字幕输入 HPSv2 模型来估计视觉感知特征得分,但其性能低于电影美学特征估计模型。在此,我们将时间步采样限制在低噪声区域,具体在时间步区间 $[80, 390)$ 内。此处使用的特征得分模型也可以替换为任何对应于感兴趣特征级别的特征得分模型,例如 PickScore 模型 [86] 和 CLIPScore 模型。如果在当前训练批次中构建了多个模态模仿样本对——注意,在 2025 年 4 月,对于模态模仿生成损失 $L^{gen}_{mimic}$,如果使用 KL 散度或 MSE 作为损失度量,我们观察到这种做法(以批量方式计算构建的模态模仿样本对的损失)在一定程度上加速了收敛,但与本文采用的原始损失 $L^{gen}_{mimic}$ 相比,无论是收敛还是性能都表现出相对明显的差距。尽管如此,它也可以作为辅助损失。在本文中,为了简化损失函数,我们不使用此损失。

C.3. 注意力特征上的模仿

先前的研究 [87] 认为,自注意力层的键(key)和值(value)特征主要决定了扩散模型生成分布的视觉感知特征,例如风格。因此,在 2025 年 7 月,我们也尝试使用自注意力的键和值特征作为模态模仿的媒介。以模态模仿生成为例,遵循与第 3.3 节介绍的模态模仿生成损失相同的样本构建过程和配置,我们从对应于估计原始潜变量 $\hat{z}^{t2v-f,0}_1$ 和 $\hat{z}^{t2i,0}_1$ 的最后一个 DiT 块中提取自注意力键和值特征。令对应于所选 T2V 样本第一帧的自注意力特征为 $K^{t2v-f,0}_1, V^{t2v-f,0}_1$,对应于新添加的 T2I 样本的特征为 $K^{t2i,0}_1, V^{t2i,0}_1$。那么,带有注意力特征的模态模仿生成损失可以公式化为:

$$ \mathcal{L}^{gen}_{mimic, \text{attn}} = \| K^{t2v-f,0}_1 – K^{t2i,0}_1 \| + \| V^{t2v-f,0}_1 – V^{t2i,0}_1 \| $$

基于我们当时的比较观察,无论是收敛还是性能,$L^{gen}_{mimic, \text{attn}}$ 单独使用都与本文采用的原始损失 $L^{gen}_{mimic}$ 存在相对明显的差距。尽管如此,它也可以作为辅助损失。在本文中,为了简化损失函数,我们不使用此损失。

C.4. 无损失模态模仿

在 2025 年 7 月,我们还研究了一种不依赖专用损失函数的自动驾驶式模态模仿。以模态模仿生成为例,遵循与第 3.3 节介绍的模态模仿生成损失相同的样本构建过程和配置

第 53 页

在第 3.3 节中,我们将所选 T2V 样本的第一帧的估计原始潜在变量与新增 T2I 样本对应的潜在变量进行交换。形式上,交换过程可以表示为:$\hat{z}^{t2v-f,0}_1 \leftrightarrow \hat{z}^{t2i,0}_1$。我们还交换了相应的估计噪声潜在变量:$\hat{z}^{t2v-f,T}_1 \leftrightarrow \hat{z}^{t2i,T}_1$。这两个样本随后仅用于计算其各自的流匹配损失(flow matching losses),方式与其他样本相同,且不施加专用的模态模仿生成损失(modality mimic generation loss)。值得注意的是,在我们的实现中,公式 (3) 中的 $\hat{v}_t$ 计算为 $\hat{z}_T – \hat{z}_0$,这直接遵循公式 (33) 和公式 (34);因此,流匹配损失本质上与 $\hat{z}_0$ 和 $\hat{z}_T$ 相关联。公式 (54) 中生成步骤的整体训练目标随后简化为:$L_{\text{total, gen}} = L_{\text{FM, global}}$。这种方法背后的动机是鼓励模型以自驱动的方式,在相同配置下对来自两个模态的样本实现相似的性能,从而鼓励模型的 T2I 生成能力模仿其照片级真实的 T2V 对应模型。根据我们当时的比较观察,该方法的有效性可与 $L_{\text{mimic, gen, attn}}$ 相媲美,作为一种辅助训练策略。

C.5. 基于在线策略蒸馏的模态模仿

2025 年 4 月,在探索模态模仿的均方误差(MSE)度量时,我们还尝试调查预训练 T2IV 模型的原始 T2V 生成能力是否比在后训练过程中获得的更新能力更适合作为 T2I 生成能力的参考。为此,除了对预训练 T2IV 模型进行后训练外,我们还引入了一个额外的固定权重预训练 T2IV 模型作为教师模型。具体而言,2025 年 4 月,遵循与第 3.3 节中介绍的模态模仿生成损失相同的样本构建过程和配置,我们额外复制了预训练 T2IV 模型的 DiT 块,冻结其参数并在训练期间停止其梯度,从而充当教师模型。公式 (30) 中的项 $P \circ F(\tilde{z}^{t2v, t}_1, c^{t2v-f, t})$ 被输入到 $D_{\text{teacher}}$ 中,随后使用 MSE 度量计算模态模仿生成损失:

$$ L_{\text{mimic, gen, frozen}} = \text{MSE}(\hat{z}^{t2v-f,0}_1, \hat{z}^{t2i,0}_1) \quad (66) $$

其中 $\hat{z}^{t2v-f,0}_1$ 是从 $D_{\text{teacher}}$ 获得的估计原始图像的图像空间中的第一个帧潜在变量。根据我们与当时也使用 MSE 度量的纯自蒸馏消融实验的比较观察,这种方法在收敛性和性能方面与原始方法相比仍存在一定的差距。

受本文采用的第一种自蒸馏范式启发,同样地,在基于原始自蒸馏范式的验证实验中——我们通过停止 $p^{t2i}_T$ 的梯度来修改公式 (39)——我们当时的比较观察也表明,与原始方法相比,模态模仿在收敛速度和性能方面均出现了显著退化。

从最近突出的在线策略蒸馏(on-policy distillation)文献的角度来看,一方面,第一个实验证明了在线策略蒸馏用于流匹配模型的可行性;另一方面,这两个实验也表明,本文采用的范式——即在训练期间两种模态的生成分布相互模仿——是我们场景的更合适选择。同样,第 B.2 节中的示例以及第 C.1、C.2、C.3、C.4 节中尝试的方法可以调整为在线策略蒸馏的后训练场景。例如,可以使用冻结的多模态模型作为 I2T 教师,以增强 T2I 任务在其可训练对应模型中的提示忠实度(prompt faithfulness)。

C.6. 来自干净图像的感知引导

如前所述,第 C.1、C.2、C.3 和 C.4 节中介绍的方法也可以应用于流匹配模型的 OPSD,以提高模型的性能。

2025 年 7 月,我们尝试在第 3.7 节所述方法的基础上,进一步增强模型在视频和图像模态上的风格化生成能力。为此,类似于第 C.2 节背后的动机,我们采用了在图像空间中计算的样式感知特征损失(style perceptual feature loss)。

具体而言,在后训练过程中,我们将每个 T2I 训练图像临时复制为多帧视频,用于 T2V 训练。对于每个这样的图像-视频样本对,令 $I$ 和 $V$ 表示图像空间中的 T2I 和 T2V 样本,令 $\hat{z}^{t2i,0}_1$ 和 $\hat{z}^{t2v,0}_1$ 分别表示图像空间中对应的解码估计原始潜在变量。我们从 $\hat{z}^{t2v,0}_1$ 的前四帧中随机采样一帧,记为第 $i$ 帧观测帧。使用样式感知特征估计模型 $D$(例如 CSD [88]),我们估计 $I$、$\hat{z}^{t2i,0}_1$ 和 $\hat{z}^{t2v,0}_1$ 的样式感知特征。然后,样式感知特征损失定义为干净图像的特征与两个解码潜在变量之一的特征之间的余弦相似度损失:

$$ \mathcal{L}_{\text{gui, style}} = 1 – \frac{\phi(\hat{z}^{t2i,0}_1) \cdot \phi(\hat{z}^{t2v,0}_1)}{|\phi(\hat{z}^{t2i,0}_1)| |\phi(\hat{z}^{t2v,0}_1)|} \quad (67) $$

其中 $\phi$ 表示 CSD 模型。

为了确保估计的原始图像在图像空间中的充分清晰度,我们将时间步采样限制在非高噪声区域,具体在时间步区间 $[0, 900)$ 内。

根据我们当时的比较观察,这种损失加速了风格响应能力的收敛

第 54 页

泛化至未见任务——参考视频

🤏

“生成一个场景,其中图1中的女性在花园中行走,身穿白色短袖上衣并佩戴太阳镜,头发颜色调整为更偏金色的色调”

🤏 🤏

“生成一个场景,其中图1中的女性在日落时的海边沙滩上行走,戴着图2中的太阳帽”

图 33. 推理时生成的 61 帧、分辨率为 832 × 480 的参考视频(Reference-to-Video, R2V)结果。给定编辑提示词和参考图像,我们的模型展示了以自然、遵循提示词的方式生成相应视频的能力,该能力以编辑提示词和参考图像提供的视觉信息为条件。需要注意的是,本文展示的模型的训练数据中不包含任何 R2V 样本或全局 R2I 样本。我们认为,模型根据参考视觉信息和给定文本提示生成视频的能力,可能源于 FlowMimic 隐式地将从 T2V 和 I2V 任务训练中获得的生成遵循提示词运动的能力,迁移到了未见过的 R2V 任务中。此外,我们的像素对时间扭曲流场(Pixel-pair temporal warped flow field)使模型能够从在线生成的多参考视频编辑样本中学习如何随时间保持一致地保留参考视觉信息。这两种能力的结合,使得模型能够在遵循提示词的方式下生成自然且合理的动作的同时,在生成的视频帧之间保持对参考视觉信息的保留。此外,第一个示例表明,模型已隐式地学会将其视觉编辑能力应用于未见过的 R2V 任务,例如改变主体的服装并为参考视觉信息中出现的主体添加太阳镜。

对于风格化 T2V。在 T2I 性能方面,它在一定程度上增强了风格准确性(即生成图像的视觉风格与提示词中指定的风格关键词的匹配程度)以及风格响应的美学表现,同时,有些出乎意料地,在非风格化提示词下也提升了生成结果的美学性和提示词忠实度。我们认为该方法也可以泛化到其他感兴趣的特征层级。此外,出于方法论上的简洁性,我们没有采用这种增量方法。

C.7. 额外的参考注入

在 2025 年 8 月,除了第 3.5 节中描述的参考注入自注意力掩码外,我们还尝试了另一种通过交叉注意力(cross-attention)加强参考信息注入的方法。以下简要介绍。对于每个参考元素,我们通过取其第一帧并使用两个预训练编码器进行编码来提取每参考视觉表示:Dinov2-giant [89] 和 OpenCLIP-xlm-roberta-large-vit-huge [30],将它们的输出拼接以形成单个参考视觉特征。对于目标元素,其对应特征被设置为与参考视觉特征形状相同的零值特征。然后,每个元素的视觉特征通过一个参数可忽略的零初始化 MLP 映射到预训练 T2IV 模型的交叉注意力嵌入维度。随后,对应于视觉特征的额外投影层将它们分别投影为查询(query)和键(key)特征。逐元素交叉注意力掩码限制注意力,使得每个元素只能关注其自身的视觉特征;得到的交叉注意力输出随后被添加到原始文本条件交叉注意力输出中,以产生该元素的最终交叉注意力流。在训练过程中,我们以较小的概率丢弃每个参考视觉特征。在推理时,我们将视觉无分类器引导(classifier-free guidance, CFG)[90] 添加到原始文本 CFG 中。尽管这种交叉注意力注入提高了参考信息的保留程度,但我们认为它偏离了我们保持模型架构简洁的设计原则。因此,本文中的模型不包含此设计。

C.8. 参考视频任务

在 2025 年 9 月和 10 月,我们尝试了参考视频(Reference-to-Video, R2V)任务,并使模型展现出相应的能力。具体而言,对于全局参考图像(Reference-to-Image, R2I)图像样本,我们采用像素对时间扭曲流场从目标图像生成具有静态或动态相机运动的视频。该视频作为 R2V 视频样本的目标元素,运动描述被合并到原始目标描述中。此处,全局 R2I 任务指的是根据参考图像和全局编辑指令生成目标图像——例如,“将图1中的女性和图2中的儿童放在一起”,“将图1的相机角度更改为俯视视角”或“生成图1中玩具模型的爆炸视图”。遵循与第 3.3 节介绍的模态模仿编辑损失相同的样本构建过程和配置,我们还将模态模仿编辑损失应用于 R2V 样本和相应新添加的 R2I 样本。

同时,对于 T2V 样本,我们在训练期间使用基于 YOLO [91] 的检测模型在线检测第一帧中的主体,裁剪相应的边界框区域,然后对其进行旋转或翻转。处理后的结果用作主体到视频(Subject-to-Video, S2V)[75, 92] 样本的参考元素——这是一种特殊的 R2V 样本形式——而后续五个潜在帧的潜在帧则用作目标元素。

值得注意的是,在探索阶段,我们观察到无论是否排除 R2V 任务和全局 R2I 任务(即不使用 S2V 样本),模型都表现出了一定程度的 R2V 能力

第 55 页

由 T2V 样本构建而成。例如,图 33 中的结果表明,当未包含 R2V 和全局 R2I 训练样本时,模型仍表现出一定程度的 R2V 能力。这表明我们的像素对时间扭曲流场不仅使模型能够从图像编辑样本中习得视频编辑能力,还能通过与 T2V 任务联合训练,泛化至需要同时具备时间和空间生成能力的 R2V 等任务。此外,在未使用由 T2V 样本构建的 S2V 样本,且包含 R2V 任务和全局 R2I 任务的条件下,我们对视频编辑样本、R2V 样本以及模态模仿编辑损失进行了消融实验。观察发现,它们提升了编辑质量——例如风格化、重光照和色调调整的审美效果,以及参考图像中主体身份的保持——从而改善了模型在推理时的图像编辑性能。

在本文中,为了验证像素对时间扭曲流场使模型仅从图像编辑样本中学习视频编辑能力的有效性,训练过程中未包含 R2V 任务。这是为了防止部分由 T2V 样本构建的 R2V 样本潜在地赋予模型视频编辑能力,从而引入混淆因素。同时,我们观察到在全局 R2I 样本中,编辑指令与目标图像之间偶尔会出现混淆——例如,编辑指令指定的是局部编辑,而目标图像对应的是全局编辑效果。因此,为了保持数据清洁,本文展示的模型未采用全局 R2I 训练样本。

C.9. 解决过度模仿参数

2025 年 4 月,我们通过多种方式加强了模态模仿生成损失的影响,以观察在极端超参数设置下的现象——例如,将模态模仿生成损失权重增加几个数量级,将 $n_{mimic,gen}$ 设置为 1,引入额外的分布度量——即 Jensen-Shannon (JS) 散度和 Hellinger 距离——作为损失函数,并在每次模态模仿生成步骤中大幅增加构建的模态模仿样本对的数量,随后在分别对应视频和图像模态的两组样本对之间以批处理方式计算模态模仿生成损失。为简洁起见,在本小节的后续内容中,我们仍假设在每次模态模仿步骤中仅构建单个模态模仿样本对。当所有示例的极端超参数设置就位,且模态模仿生成损失权重超过极端阈值时,尽管收敛速度和模态模仿性能有所提升,但 softmax 函数 $F(\hat{z}^{1}_{t2v-f,0})$ 和 $F(\hat{z}^{1}_{t2i,0})$ 在公式 (37) 中的 logit 输入偶尔会在同一个特定的 logit 条目位置(例如,均在第五个 logit 条目位置)表现出一个值,该值远大于所有其他 logit 条目位置的值,且这两个值在数值上也彼此接近。

从模型的角度来看,这降低了 $L_{mimic,editing}$ 和公式 (39) 中的 $L_{mimic,gen}$,因为它导致公式 (37) 中的 $p^{1}_{t2v-f,0}$ 和 $p^{1}_{t2i,0}$ 都在同一个特定的 logit 条目位置成为尖峰分布,使得两个分布彼此相似,从而产生相对较小的 $L_{mimic,gen}$ 值;然而,这并不是期望的自然学习过程。

我们首先介绍几种常见方法,例如对 logit 输入应用温度缩放、对 logit 输入进行归一化、使用正则化损失平滑 logit 输入,以及对概率分布 $p^{1}_{t2v-f,0}$ 施加熵最大化损失。

$$ F(\hat{z}^{1}_{t2v-f,0}) = \frac{\hat{z}^{1}_{t2v-f,0}}{\tau}, \quad F(\hat{z}^{1}_{t2i,0}) = \frac{\hat{z}^{1}_{t2i,0}}{\tau} $$ 然后进一步乘以 $\tau$ 以保持尺度。

  • 温度缩放。将 logit 输入除以一个温度参数 $\tau$,该参数保持恒定,或根据线性或余弦调度从初始值 $\tau_s$ 退火至最终值 $\tau_e$(其中 $\tau_s > \tau_e$):

$$ \tilde{F}(\hat{z}^{1}_{t2v-f,0}) = \frac{F(\hat{z}^{1}_{t2v-f,0}) – \mu}{\sigma + \epsilon_{pert}} $$ 其中 $\epsilon_{pert} = 1 \times 10^{-8}$ 是一个小的扰动项。对 $F(\hat{z}^{1}_{t2i,0})$ 同理。

  • 对 logit 输入进行归一化。令 $\mu$ 和 $\sigma$ 表示 $F(\hat{z}^{1}_{t2v-f,0})$ 的均值和标准差。则:

$$ L_{mimic, gen, reg, t2v-f} = \max_j |F(\hat{z}^{1}_{t2v-f,0})_j|^2 $$ 其中 $j$ 索引展平后的特征维度。对 $L_{mimic, gen, reg, t2i}$ 同理。

  • 用于平滑 logit 输入的正则化损失。该正则化损失定义为:
  • 熵最大化损失。通过 $L_{mimic, gen, entropy} = -\alpha_{adaptive} \cdot H(p^{1}_{t2v-f,0})$ 最大化分布 $p^{1}_{t2v-f,0}$ 的熵,其中 $H(p^{1}_{t2v-f,0}) = -\sum p^{1}_{t2v-f,0} \log p^{1}_{t2v-f,0}$,$\alpha_{adaptive}$ 是一个自适应权重,与 $H(p^{1}_{t2v-f,0}) \cdot \tau$ 成反比,$\tau$ 是温度缩放中描述的温度。

上述策略主要旨在防止 logit 输入的概率分布趋向于尖锐的单点分布,但在我们的实验中均未产生明显效果。例如,较大的恒定温度可以避免上述现象,但会导致推理期间生成结果模糊;相反,较小的温度未能产生明显的缓解效果。在对分布度量——即 KL 散度、JS 散度和 Hellinger 距离——以及与 softmax 函数相关的操作进行实验和分析后,我们设计了加性维度策略,该策略可以在消除这种现象的同时保留原始

第 56 页

最终的模态模仿效应,并在推理过程中不引入任何不利的副作用。

具体而言,我们在 $F(\hat{z}^{t2v-f}_{1,0})$ 和 $F(\hat{z}^{t2i}_{1,0})$ 中均附加了一个额外的维度,将其值设置为观测最大值的 $k$ 倍,记为 $c_{add}$,并在整个训练过程中保持该值固定。$k$ 的值取决于训练场景:如果从已经表现出所述现象的模型继续训练,则 $k=1.3$;如果直接从预训练的 T2IV 模型开始进行后训练,则 $k=1.1$。形式上,我们定义:

$$ l_{de} = \begin{cases} \text{identity} & \text{if } x_t^{t2v-f}, \dots \\ \text{begin at } z & \dots \end{cases} \quad (68) $$

随后,$F(\hat{z}^{t2v-f}_{1,0})$ 和 $F(\hat{z}^{t2i}_{1,0})$ 用于根据公式 (37)、公式 (38) 和公式 (39) 计算 $L_{mimic}$。因此,JS 散度和海林格距离度量的输入也被替换为 $F(\hat{z}^{t2v-f}_{1,0})$ 和 $F(\hat{z}^{t2i}_{1,0})$。在应用加性维度策略后,$F(\hat{z}^{t2v-f}_{1,0})$ 和 $F(\hat{z}^{t2i}_{1,0})$ 中描述的尖锐值配对逐渐减弱,直至完全消失(如果从已经表现出该现象的模型继续训练),或者根本不会出现(如果从预训练的 T2IV 模型进行后训练);也就是说,常数 $c_{add}$ 使得 softmax 函数从一开始就能定位到具有极高概率的对数几率(logit)条目位置,确保损失值保持相对较小,从而允许其他对数几率标记在即使损失权重极大的情况下也能温和地学习,而不会承受不当的压力。尽管此类极端设置在实践中很少受到关注,且所述现象可能仅在这些极端条件下发生,但我们在此简要描述该方法,因为我们认为它具有一定的概率学意义。

最后,我们恳请读者理解任何可能引起混淆的描述不够详细、描述性错误或符号错误之处。欢迎感兴趣的读者分享他们的宝贵修正意见。

发表评论