PDD:用并行解码蒸馏打破视频生成的多样性瓶颈

快速导读:PDD提出了一种基于轨迹的蒸馏方法,通过并行预测多个时间步的平均速度,在避免JVP和对抗损失的同时,实现了高质量且高多样性的少步生成。

视频与图像生成模型的计算成本长期制约其实际应用。主流加速方法如VSD或对抗蒸馏虽能减少NFE,却常导致模式崩溃、多样性下降及运动缺失。PDD(Parallel Decoding Distillation)提出了一种基于轨迹的蒸馏新范式,旨在不牺牲生成质量的前提下实现高效少步生成。

该方法的核心在于将时间离散化为区间并分组为块,训练学生模型在单次前向传播中预测块内所有区间的平均速度。通过复用教师Backbone并引入Layer Fusion,PDD不仅简化了训练流程,还支持可变NFE生成。实验表明,PDD在ImageNet、Qwen-Image及Wan2.1等大规模模型上均取得SOTA性能,尤其在视频多样性上优势显著。

英文题目:Parallel Decoding Distillation for Fast Image and Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.26004

原始论文:PDF / 论文页面

对应视频标题:PDD:用并行解码蒸馏打破视频生成的多样性瓶颈|推荐指数:★★★★★

这篇论文解决什么问题?

现有扩散与流匹配模型需数百次网络评估,计算开销巨大。主流加速方法分为基于轨迹(如Pi-Flow)与基于分布(如DMD2、AnyFlow)两类。前者在视频生成中质量下降明显,后者易导致模式崩溃,生成内容趋于单一。

此外,现有方法常依赖复杂的优化技巧,如JVP计算或对抗损失,训练不稳定且难以扩展至大规模模型。如何在保持生成质量与多样性的同时,实现高效、稳定的少步生成,仍是亟待解决的关键问题。

PDD针对上述痛点,提出一种无需JVP或对抗损失的蒸馏方案。通过预测多步平均速度,PDD在单次评估中捕获更丰富的轨迹信息,从而在加速的同时保留生成内容的多样性与动态细节。

核心创新

  • 提出并行解码蒸馏(PDD),通过单次评估预测多步平均速度,无需JVP或有限差分。
  • 设计简单的回归损失(PD Loss),避免VSD、GAN损失及多阶段训练,训练更稳定。
  • 架构复用教师Backbone,通过线性层融合(Layer Fusion)实现可变NFE生成,无需额外时间条件。
  • 在大规模视频模型(Wan2.1, LTX-2.3)上实现SOTA少步生成,并显著改善生成多样性。

方法概览

PDD将时间离散化为N个区间并分组为块(Block),训练并行解码器在单次前向传播中预测块内所有区间的平均速度,利用Runge-Kutta近似教师模型速度进行回归训练,支持可变NFE。

  • PDD将采样轨迹离散化为N个区间,并分组为大小为L的块。学生模型在单次前向传播中预测块内所有区间的平均速度,利用Runge-Kutta近似教师模型速度进行回归训练。
  • 架构上,PDD复用教师Backbone,仅扩展最终线性层以输出多步速度。通过Layer Fusion,生成时可灵活调整NFE,无需额外时间条件或策略头。
  • 损失函数采用简单的PD Loss,避免VSD或GAN损失的复杂性。训练过程稳定,支持Data-free设置,便于大规模模型蒸馏。
  • PDD支持Euler与Midpoint两种速度近似方法,Midpoint在多数实验中表现更优。该方法无需多阶段训练,可直接应用于预训练流模型。

逐图理解论文

失败案例:DMD2的多样性陷阱

失败案例:DMD2的多样性陷阱
Figure 5: PDD – Midpoint (ours) vs. DMD2, and AnyFlow on the Wan Text-to-Video 14B model. The three methods use 4 NFE. Notably, PDD achieves high-quality video while preserving better diversity.

Wan2.1 14B模型4 NFE生成对比。PDD在质量与多样性上均优于DMD2与AnyFlow,体现其视频生成优势。

研究缺口:轨迹蒸馏的复杂性

研究缺口:轨迹蒸馏的复杂性
Table 1: High-level differences between flow-map distillation methods, Pi-Flow, and our PDD.

现有轨迹蒸馏依赖JVP或对抗损失,训练不稳定,难以扩展至大规模视频模型。

PDD方案:并行预测平均速度

PDD方案:并行预测平均速度
Figure 2: The sampling trajectory is discretized into 𝑁 intervals, which are grouped into blocks of size 𝐿. The parallel decoder predicts the mean velocities for all intervals within a block using a single evaluation.

展示采样轨迹离散化与块分组机制。单次评估预测多步平均速度,是PDD加速的核心设计。

架构创新:复用Backbone与Layer Fusion

架构创新:复用Backbone与Layer Fusion
Figure 4: Architecture of the parallel decoder (b) vs. the pre-trained flow model (a). Notably, the parallel decoder utilizes the same backbone, but with 𝑁times the final linear layer. (c) At generation, instead of applying a linear layer per intra-block step (9), we can fuse the layers into a single linear layer that outputs the block’s average velocity, which advances the state across the entire block (14).

对比教师与PDD架构。PDD复用Backbone,通过扩展线性层与Layer Fusion实现可变NFE,架构极简。

实验证据:Wan2.1上的多样性优势

实验证据:Wan2.1上的多样性优势
Table 5: Wan Text-to-Video 1.3B and 14B models performance and diversity metrics on VBench [24] with Self-Forcing prompt set. Diversity is measured as mean pairwise V-JEPA 2/VideoMAE V2 feature distance across 5 generated videos per prompt. * Our re-evaluation of the official checkpoint. ** Our re-implementation. † Reported numbers on proprietary prompts without diversity evaluation, since rCM [70] did not release checkpoints.

在Wan2.1 1.3B上,PDD以4 NFE实现VBench 84.94,多样性分数0.1032,显著优于DMD2。

实验如何设计?

  • 图像生成实验在ImageNet-256与Qwen-Image上进行,评估FID、OneIG、DPG-Bench等指标,对比Pi-Flow、FreeFlow、DMD2等基线。
  • 视频生成实验使用Wan2.1 1.3B/14B与LTX-2.3模型,评估VBench质量、语义、动态度及多样性(V-JEPA 2/VideoMAE V2),对比rCM、AnyFlow、DMD2等。
  • 所有实验均采用Data-free训练设置,教师模型为预训练流模型。NFE设置为1至8,覆盖单步至少步生成场景。
  • 评估指标包括FID、HPSv2、PickScore、VBench Overall及多样性分数,全面反映生成质量与多样性。

关键结果与论文证据

  • 在ImageNet-256 NFE=1设置下,PDD-Midpoint FID为2.69,接近FreeFlow的1.45,且架构更简单(第8页)。
  • Qwen-Image NFE=4时,PDD-Midpoint在OneIG-EN得0.538,DPG-Bench得88.66,均为SOTA(第8页)。
  • Wan2.1 1.3B NFE=4时,PDD-Midpoint VBench Overall为84.94,V-JEPA 2多样性分数0.1032,显著优于DMD2(第9页)。
  • LTX-2.3 NFE=8时,Gemini偏好评估显示PDD胜142次,平35次,负123次,优于官方蒸馏模型(第30页)。

阅读时需要注意

  • 大规模实验依赖Data-free训练,在数据依赖设置下的泛化性需进一步验证。
  • NFE=8时ImageNet FID略有上升,需降低Guidance Scale权衡质量与速度。
  • Wan2.1 14B长训练迭代后VBench分数略降,但动态度增加,反映质量与动态的权衡。

关联工作

  • Pi-Flow概念相关,但PDD简化训练,无需策略头,支持可变NFE(第6页)。
  • DMD2与AnyFlow为基于分布的SOTA基线,PDD在多样性与运动上优于它们(第7页)。
  • FreeFlow为单步生成SOTA,PDD在NFE=1时FID接近且架构更简单(第8页)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

2026-7-29

并行解码蒸馏 用于快速图像和视频生成

Neta Shaul2, Chao Liu1, Arash Vahdat1,†, Julius Berner1,†

1NVIDIA, 2魏茨曼科学研究所, †共同指导

视频扩散或流模型的生成因缓慢且迭代的采样过程而计算昂贵。当前最先进(SOTA)的加速方法严重依赖变分分数蒸馏(VSD)和对抗损失,将扩散模型蒸馏为少步生成器。尽管实现了高质量的视频生成,但这些训练损失 notoriously 难以优化,并存在模式崩溃问题,导致视频多样性丧失和运动缺失。在本文中,我们引入并行解码蒸馏(Parallel Decoding Distillation, PDD),这是一种简化的、基于轨迹的可扩展蒸馏方法,用于扩散和流匹配模型的快速推理。我们的架构和训练过程与任何预训练模型兼容,并支持使用不同数量的函数评估次数(Number of Function Evaluations, NFE)进行采样。PDD 通过每次网络评估预测多个去噪步骤来加速生成。从概念上讲,它学习平均速度(Mean Velocity)的表示,而无需使用雅可比-向量积(Jacobian-Vector Products, JVPs)或有限差分近似来回归其导数。我们的方法在 LTX-2.3 文本到视频/音频、Wan 14B 文本到视频和 Qwen-Image 文本到图像上,以 4-8 NFE 实现了 SOTA 性能。此外,PDD 在生成的视频多样性方面取得了显著改进。 项目页面:https://research.nvidia.com/labs/genair/pdd2026

Jul 𝑡=0s 𝑡=2.5s 𝑡=5s 𝑡=7.5s 𝑡=10s 教师模型 28

PDD [cs.CV] 蒸馏后

“一个孤独的行者在一个广阔、干旱的沙漠景观中行走,烈日当空,干燥而有节奏的靴子踩在流动沙子上的声音在开阔、广阔的空间中回荡。行者穿着一件破烂的米色夹克和宽松的裤子,每走一步都会发出沙沙声,宽边帽遮住他们的脸,免受强烈阳光的照射。他们以一种坚定但疲惫的姿态行走,偶尔环顾四周广阔沙丘和岩石露头,一阵低沉、哀伤的呼啸声扫过这片贫瘠的地形。背景中,远处的沙丘向地平线无尽延伸,营造出一种孤立和广阔的感觉。场景在中等镜头和特写之间转换,行者艰难地向前跋涉,沉重的喘息声在寂静中清晰可闻,强调了恶劣、荒凉的环境。”

噪声种子 1 噪声种子 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2arXiv:2607.26004v1 AnyFlow

“两名骑自行车的人,一男一女,正从相反的方向接近十字路口的停车标志。男性骑自行车者戴着红色头盔,穿着黑色骑行装备,而女性骑自行车者戴着蓝色头盔,穿着白色骑行服。他们都在向停车标志蹬车,随着接近路口逐渐减速。男性骑自行车者向左看,检查交通情况,而女性骑自行车者专注于前方。背景显示一条安静的郊区街道,有绿树和停放的汽车。视频以跟踪镜头捕捉他们的接近过程,随着他们减速停下,逐渐放大每个骑自行车者的画面,保持平视视角。”

图 1:(顶部) 来自 LTX-2.3 教师模型(4 × 30 NFE)、并行解码蒸馏(Parallel Decoding Distillation, PDD)(8 NFE)和官方蒸馏模型(8 NFE)的 10 秒 720p 视频(含音频)。PDD 能更紧密地跟随教师模型。(底部) PDD 与 DMD2 和 AnyFlow 在 Wan2.1 文本到视频 14B 模型上的对比。所有方法均使用 4 NFE。值得注意的是,与基线方法相比,PDD 在保持较高视频质量的同时,在不同初始噪声下展现了更好的生成多样性。

© 2026 NVIDIA. 保留所有权利。

第 2 页

用于图像和视频生成的并行解码蒸馏

1. 引言 ¯X4

大规模扩散和流模型 [21, 51, 29, 30, 1] 已实现了卓越的内容生成能力,包括文生图 [61, 26]、文生 ¯X0 视频 [25, 56, 40] 以及多模态生成 [19]。 然而,生成成本依然高昂,因为其固有的迭代采样算法通常需要数百次网络评估。由此产生的计算 N = 12 成本和延迟是许多应用(如内容编辑、实时视频生成和交互式世界建模)的主要瓶颈之一。 因此,开发用于少步媒体生成模型的蒸馏方法已成为一个活跃的研究领域 [47, 66, 64, 32, 27, 7, 41, 70, 55, 39, 17, 63]。 蒸馏扩散和流模型的方法大致分为两类:i) 基于轨迹的方法 [45, 52, 12, 44, 14, 7],其中学生模型将预训练 L = 4 教师的许多步顺序采样过程蒸馏为少步过程;ii) 基于分布的方法 [46, 59, 67, 64],它们放宽了遵循教师轨迹 的约束,转而仅对齐学生和教师过程的边缘分布。基于轨迹的方法在快速图像生成方面显示出有希望的 结果。然而,当应用于视频模型时,它们通常受限于视频质量下降和昂贵的训练算法。因此,目前视频模型 蒸馏的主导方法是基于分布的 [11, 39]。虽然最近的工作通过额外结合基于轨迹的蒸馏损失来正则化训练动态 [70, 17], 但它们仍然面临交替训练目标、高内存需求和模式崩溃的问题,导致多样性降低且视频往往静止。 在本文中,我们引入并行解码蒸馏(PDD),这是一种用于扩散和流模型快速推理的基于轨迹的蒸馏方法。 与将多个去噪步骤合并为单个较大步骤 [45, 12, 32, 72] 不同,我们学习一个并行解码器,它在一个网络评估中 预测多个去噪步骤。具体而言,PDD 将流的时间域离散化为固定数量的 𝑁 个区间,这些区间被分组为大小为 𝐿 的块。 在训练期间,并行解码器使用单次前向传播学习预测块内所有区间的平均速度,如图 2 所示。 目标平均速度是使用应用于预训练教师模型的龙格-库塔求解器(例如欧拉法或中点法)进行近似。 在生成时,通过预测 𝐿 个区间的速度,我们获得具有 𝑁/𝐿 步的样本。通过在训练期间改变块大小,PDD 支持使用不同

DecoderParallel DecoderParallel ¯X0 ¯X4 图 2:采样轨迹被离散化为 𝑁 个区间,这些区间被分组为大小为 𝐿 的块。并行解码器使用单次评估预测块内所有区间的平均速度。 推理期间的函数评估次数(NFEs)。PDD 在概念上与 Pi-Flow [7] 相关,但提供了一个简化的训练算法,消除了对额外策略头的需求, 并支持在生成时具有可变 NFE。此外,我们的公式阐明了与流映射蒸馏方法(特别是拉格朗日公式 [72, 4])的联系。 通过避免雅可比-向量积(JVPs)和有限差分,我们获得了最小成本的训练算法。 我们在 Wan2.1 [56] 1.3B 和 14B 模型上的文生视频任务中展示了我们方法的有效性, 在 VBench [24] 上以 4 个 NFE 实现了 SOTA 视频质量生成,同时保持了比基于分布的基线更好的视频多样性。 此外,我们在 Qwen-Image 20B 模型上的文生图任务中测试了 PDD, 在 OneIG [6]、GenEval [16] 和 DPG-Bench [22] 基准测试中以 4 到 8 个 NFE 实现了 SOTA 分数。 总之,我们的主要贡献如下: 1. formulate 并行解码蒸馏(Parallel Decoding Distillation),这是一种用于流匹配和扩散模型快速推理的可扩展基于轨迹的蒸馏方法。 2. 开发单一、基于回归的训练目标,避免了对 JVPs、有限差分或多阶段训练过程的需求,并生成高质量且多样化的样本,无需 VSD 或 GAN 损失。 3. 提出一种简单的架构和训练算法,支持任何预训练模型,并允许在不增加额外时间条件编码的情况下以可变 NFE 进行生成。 4. 在 ImageNet-256、Qwen-Image、Wan2.1 1.3B/14B 和 LTX-2.3 上验证我们的方法,实现了具有改进多样性的 SOTA 性能。

2

第 3 页

图像与视频生成的并行解码蒸馏

2. 生成流模型,其中使用简化符号 $X_n := X_{t_n}$,且 $u_n$ 表示第 $n$ 个区间的平均速度

符号表示 状态空间记为 $\mathcal{X}$,其中 $\mathcal{X}= \mathbb{R}^{c \times h \times w}$ 用于图像,$\mathcal{X}= \mathbb{R}^{f \times c \times h \times w}$ 用于视频。取值于 $\mathcal{X}$ 的随机变量用大写字母 $X$ 表示,$\mathcal{X}$ 中的状态用小写字母 $x$ 表示。固定整数用大写字母 $N, L \in \mathbb{N}$ 表示,而运行索引或整数值随机变量用小写字母 $n, k$ 表示。

流匹配与扩散模型 目前训练生成流模型的主流方法是流匹配 [29, 30, 1] 和扩散模型 [49, 21, 51]。由于我们仅对确定性过程感兴趣,为简化起见,我们将两者均视为流(1)。

取值于 $\mathcal{X}$ 的流过程 $(X_t)_{0 \le t \le 1}$ 由速度场 $v: \mathcal{X} \times [0, 1] \to \mathcal{X}$ 和源分布 $p_0 : \mathcal{X} \to \mathbb{R}_{\ge 0}$ 定义,后者作为边界条件设定过程在 $t= 0$ 时的边缘分布: $$ \frac{d}{dt}X_t = v_t(X_t), \quad X_0 \sim p_0. \quad (1) $$

过程的边缘分布,称为概率路径,是一个依赖于时间的密度 $p: \mathcal{X} \times [0, 1] \to \mathbb{R}_{\ge 0}$,使得对于所有 $t \in [0, 1]$,有 $X_t \sim p_t$。

假设数据集包含来自目标分布 $p_1$ 的独立同分布样本,以及来自易于采样的源分布 $p_0$ 的样本。流匹配提供了一个框架,用于学习模型 $v_t$,使得由方程 1 定义的流 $(X_t)_{0 \le t \le 1}$ 将来自源 $X_0 \sim p_0$ 的样本映射到来自目标 $X_1 \sim p_1$ 的样本。

重要的是,在训练期间,流匹配模型的边缘分布 $p_t$ 可以使用插值过程高效采样。虽然我们的方法对所选的插值过程无关,但本工作中使用的所有预训练模型均使用线性调度器训练: $$ X_t = (1 – t)X_0 + tX_1, \quad (2) $$ 其中 $X_0 \sim p_0, X_1 \sim p_1$,且 $t \in [0, 1]$。

使用流进行采样 从训练好的流模型 $v_t$ 获取样本 $X_1 \sim p_1$ 是通过求解方程 1 中的常微分方程完成的。一种通用的数值方法将时间区间 $[0, 1]$ 离散化为 $N$ 个较小的区间序列,$0 = t_0 < t_1 < \dots < t_N = 1$。然后,每个区间上的精确解为 $$ X_{n+1} = X_n + (t_{n+1} – t_n) u_n(X_n), \quad (3) $$ 其中 $[t_n, t_{n+1}]$ 定义为 $$ u_n(X_n) = \frac{1}{t_{n+1} – t_n} \int_{t_n}^{t_{n+1}} v_t(X_t) dt. \quad (4) $$

该解通过顺序近似方程 4 中的积分获得。最简单的数值方法是欧拉求解器,它近似认为速度 $v_t$ 在区间 $t \in [t_n, t_{n+1}]$ 上保持恒定,从而得到平均速度 $$ u_n(X_n) \approx v_{t_n}(X_n). \quad (5) $$

Runge-Kutta 方法是一族高阶求解器,它们利用在区间 $[t_n, t_{n+1}]$ 内对速度 $v_t$ 的额外评估来实现高阶近似。我们使用中点法, $$ u_n(X_n) \approx v_{t_{mid}}(X_{mid}), \quad (6) $$ 其中 $X_{mid}$ 和 $t_{mid}$ 分别是中点状态和时间, $$ X_{mid} = X_n + \frac{t_{n+1} – t_n}{2} v_{t_n}(X_n), \quad t_{mid} = \frac{t_{n+1} + t_n}{2}. $$

3. 并行解码蒸馏

为了加速从流模型中采样,我们提出学习一个并行解码模型,该模型在一次网络评估中预测多个积分步骤(3),而不是一次一个步骤地近似它们。图 2 说明了我们的方法。

并行解码器。假设有一个预训练的流模型 $v_t$,其流过程 $(X_t)_{0 \le t \le 1}$ 由方程 1 定义,边缘分布为 $p_t$。固定长度为 $N \in \mathbb{N}$ 的时间离散化, $$ 0 = t_0 < t_1 < \dots < t_N = 1. \quad (7) $$ 那么,从步骤 $n$ 开始的大小为 $L$ 的块是索引集合 $\{n, \dots, n+ L-1\}$。

对于时间步 $t_n$ 的状态 $X_n \sim p_{t_n}$,并行解码器 $\bar{u}_{\theta_n}(\cdot | X_n) \in \mathcal{X}^L$,其块大小 $L \in \mathbb{N}$,旨在通过单次网络评估预测下一个块中所有区间的平均速度: $$ \bar{u}_{\theta_n}(k| X_n) \approx u_k(X_k), \quad k = n, \dots, n+ L-1. \quad (8) $$

重要的是,我们的并行解码器(8)是定义良好的,因为该块中的离散流过程,即 $X_k, k \in \{n, \dots, n+ L-1\}$,完全由精确解(3)和初始状态 $X_n \sim p_{t_n}$ 指定。

第 4 页

图像与视频生成的并行解码蒸馏

图3:(左)PDD 学生模型在一次评估中近似多个连续区间的平均速度。预训练的流模型(教师)使用 ODE 求解器步骤提供单个区间的平均速度。(右)说明给定初始状态 $X_n \sim p_{t_n}$ 和块大小 $L=4$ 时 PD 损失的估计过程;i) 学生预测平均速度 $\bar{u}_{\theta_n}(\cdot|X_n) \in \mathcal{X}_L$;ii) 遵循学生速度得到块内状态 $X_k$,其中 $k \in \{n, \dots, n+L-1\}$;iii) 随机选择其中一个状态,并使用 PD 损失(11)将学生的输出速度与对应区间内教师的平均速度进行匹配。

并行化过程 在训练期间,我们采用一种策略优化算法,该算法依赖于由并行解码模型给出的块内过程。对于时间步 $t_n$ 的状态 $X_n \sim p_{t_n}$,并行化过程定义为 $$ \bar{X}_{k+1} = \bar{X}_k + (t_{k+1} – t_k)\bar{u}_{\theta_n}(k| X_n), \quad (9) $$ 其中块索引 $k \in \{n, \dots, n+L-1\}$,初始条件为 $\bar{X}_n = X_n$。

通过用并行解码器替换精确解(3)的更新规则,可获得并行化过程。值得注意的是,$\bar{u}_{\theta_n}(\cdot | X_n) \in \mathcal{X}_L$ 仅依赖于初始状态 $X_n$。因此,并行化过程 $(\bar{X}_k)_{n \le k \le n+L}$ 仅通过一次并行解码器的评估即可模拟。

采样 虽然经典算法在每个 ODE 步骤中使用递归规则(3)推进单个区间,但使用并行解码器我们可以同时推进 $L$ 个区间。对于当前状态 $X_n \sim p_{t_n}$,我们使用并行化过程(9)近似块 $\{n, \dots, n+L-1\}$ 中的精确解(3)。然后,对块内索引 $k$ 求解递归,得到块步长规则 $$ \bar{X}_{n+L} = X_n + \sum_{k=n}^{n+L-1} (t_{k+1} – t_k)\bar{u}_{\theta_n}(k|X_n). \quad (10) $$ 通过重复递归块步长规则(10)$N/L$ 次,在每一步近似 $\bar{X}_n \approx X_n$,我们从模型中获得干净样本 $\bar{X}_N$。我们在算法 1 中提供了 PyTorch 伪代码,其中维度 0 索引并行预测 $k=0, \dots, N-1$。

算法 1 并行解码采样

# student - parallel decoder model
# t - time discretization
# L - block size
# shape - data shape
# init noise
x_n = randn(*shape)
# step sizes
h = diff(t, dim=0)
for n in range(0, len(t)-1, step=L):
    # parallel predictions
    u = student(x_n, t[n])
    # slice current block
    u_n, h_n = u[n:n+L], h[n:n+L]
    # block step
    x_n = x_n + einsum('k,k...', h_n, u_n)
return x_n

训练 并行解码器通过回归预训练教师流模型的平均速度(8)的 Runge-Kutta 近似值来进行训练。在实践中,我们使用单个 Euler 或 Midpoint 步骤。为了获得可处理的损失,我们采用策略训练,根据(9)中定义的 student 输出 $\bar{X}_k$ 估计教师的平均速度。

对于时间离散化 $t_0 < \dots < t_N$ 和块大小 $L$,我们的训练目标为 $$ \mathcal{L}_{PD}(\theta) = \mathbb{E} \left[ \left\| \bar{u}_{\theta_n}(k|X_n) – u_k \left( \text{sg} \left( \bar{X}_k \right) \right) \right\|^2 \right], \quad (11) $$ 其中块起始索引 $n \in \{0, L, \dots, N-L\}$ 和块内索引 $k \in \{n, \dots, n+L-1\}$ 均匀采样,$X_n \sim p_{t_n}$ 使用插值过程(2)采样,$\bar{X}_k$ 是块内的并行化过程(9),$\text{sg}(\cdot)$ 表示停止梯度算子,教师平均速度 $u_k$ 使用 Runge-Kutta 步骤近似。

4

第 5 页

图像与视频生成的并行解码蒸馏

$$ \bar{u}_n(0 | x_n) + \bar{u}_n(N-1 | x_n) + \Delta_n \bar{u}_n(n | X_n) + \Delta_n + L – 1 \bar{u}_n(n + L – 1 | X_n) $$

线性 线性 $W_0$ 线性 $W_{N-1}$ 线性 $W_n$ : $n + L$

主干网络

$x_n \ t_n \ x_n \ t_n \ x_n \ t_n$

(a) 教师模型 (b) 学生模型训练 (c) 学生模型生成

图 4:并行解码器 (b) 与预训练流模型 (a) 的架构对比。值得注意的是,并行解码器使用相同的主干网络,但最终的线性层重复了 $N$ 次。(c) 在生成阶段,我们不再对每个块内步骤应用线性层(公式 9),而是将层融合为单个线性层,该层输出块的平均速度,从而将状态推进整个块(公式 14)。

重要的是,$\bar{u}_{\theta n}(k|X_n)$ 和 $\bar{X}_k$ 均通过单次评估并行解码器 $\bar{u}_{\theta n}$ 获得。用单次欧拉(公式 5)或中点(公式 6)步骤近似平均速度 $u_k$ 需要 1-2 次教师模型 $v$(分别)的评估。这使得并行解码(PD)损失(公式 11)即使在大规模下也可行。图 3 说明了 PD 损失的评估,我们在算法 2 中提供了 PyTorch 伪代码。为简洁起见,我们忽略了批次维度,但所有操作均可进行批次处理。

命题 1 表明,PD 损失是学习公式 (8) 中定义的并行解码器的有效目标函数。具体而言,在可控的龙格-库塔近似误差范围内,PD 损失的最小化器精确采样教师轨迹,即 $\bar{X}_n = X_n$,对于 $n = 0, \dots, N$。证明见附录 D。

命题 1。并行解码损失(公式 11)的最小化器满足并行解码器条件(公式 8)。

无数据训练 在数据不可用的情况下,我们提出了一种在线策略训练方案,避免了对插值过程(公式 2)采样 $X_n \sim p_{t_n}$ 的需求。相反,我们遵循采样算法 1,同时交替进行求解器和训练步骤。如图 4 所示,我们利用预训练流模型相同的主干架构,但最终的线性层重复 $N$ 次,即对应网格(公式 7)中的每个时间步。形式上,我们假设教师架构的形式为

$$ v_t(x) = W H_t(x), \quad (12) $$

其中 $H_t$ 是输出最终隐藏状态的主干网络,$W$ 是最终的线性层。然后我们学习 $N$ 个线性层 $W_{\theta 0}, \dots, W_{\theta N-1}$,并且对于 $k \ge n$,并行解码器的架构由下式给出:

$$ \bar{u}_{\theta n}(k|x_n) = W_{\theta k} H_{\theta t_n}(x_n). \quad (13) $$

我们的要求是一个能预测 $L$ 个平均速度 $\bar{u}_{\theta n}(\cdot|X_n) \in \mathcal{X}^L$ 的架构,即块中每个时间步一个速度,而不是预训练模型 $v_{t_n}(X_{t_n}) \in \mathcal{X}$ 的单个瞬时速度预测。

5

第 6 页

图像与视频生成的并行解码蒸馏

这使得模型能够从预训练流模型(见表1:流映射蒸馏方法、Pi-Flow 与我们的 PDD 之间的高层差异)的最后一层进行初始化。此外,使用 $N$(网格大小)而非恰好 $L$(块大小)个线性层的好处在于,它允许我们学习一个单一模型,该模型可以预测任意块大小,而无需引入第二个时间坐标(例如流映射 [14, 44, 4] 所需的时间坐标)。

| | Eulerian/Lagrangian Flow Maps | Pi-Flow | PDD (Ours) | | :— | :— | :— | :— | | NFE | Variable | Fixed | Variable | | JVP/finite-diff. | Required | Free | Free | | Head at inference | Linear | Gaussian mixture | Fused-linear |

在实践中,我们并不对所有可能的块大小感兴趣,而是对某些块大小子集感兴趣。因此,我们定义最小和最大块大小 $L_{\min} \le L_{\max} \in \mathbb{N}$。然后,在训练期间,我们考虑 $L_{\min}$ 的倍数作为初始状态的索引 $n$,并在每个块内采样 $k \in \{n, \dots, n + L_{\max} – 1\}$。

3.1. 层融合及其与流映射的联系

比较 PDD 的训练与生成过程时,出现了一个重要的观察结果。对于块大小 $L$ 和起始步骤 $n$,估计 PD 损失 (11) 需要并行化过程 (9) 的块内步骤,因此使用了所有不同的学生输出方向 $W_{\theta k} H_{\theta t_n}(X_n)$,其中 $k = n, \dots, n + L – 1$。相比之下,在生成期间,我们使用块步骤 (10) 跳过 $L$ 个间隔。这只需要加权平均方向,对于我们的架构 (13),这产生:

$$ \bar{X}_{n+L} = \bar{X}_n + (t_{n+L} – t_n) W_{\theta n:n+L} H_{\theta t_n}(\bar{X}_n) \quad (14) $$

其中 $W_{\theta n:n+L}$ 是一个融合线性层,定义为:

$$ W_{\theta n:n+L} = \sum_{k=n}^{n+L-1} \Delta_k W_{\theta k}, \quad \Delta_k = \frac{t_{k+1} – t_k}{t_{n+L} – t_n} \quad (15) $$

因此,我们共享的主干网络 $H_{\theta t_n}$ 学习区间 $[t_n, t_{n+L}]$ 上的平均速度表示。然而,我们没有使用 JVP [44, 14, 4, 72] 或有限差分 [35],而是使用可学习的线性映射 $W_{\theta k}$,其中 $k = n, \dots, n + L – 1$,将平均速度预测分解为并行子区间预测。然后,在训练期间,通过共享主干网络的梯度在期望上恢复用于学习全区间平均速度的训练信号。关于与流映射的确切联系的讨论见附录 C。我们通过比较图 17(附录中)中其轨迹与教师轨迹的曲率,验证了并行解码器能够学习非平凡轨迹。

另一个实际影响是,在推理期间,我们可以避免扩展最后一层所需的额外计算,并且我们只需要在内存中保留每个块的一个融合线性层。

4. 相关工作

基于轨迹的蒸馏 第一种成功蒸馏流 JVP 轨迹的方法是 Progressive Distillation [45]。它们通过多阶段训练逐渐增加学生的步长。一致性模型 [52, 34, 50, 32, 13] 从教师初始化学生,然后直接蒸馏从轨迹上任何中间状态到干净状态的映射,使用自一致性条件。最近的工作 [54, 3, 44, 55, 23, 27, 53, 5] 蒸馏轨迹上任意两个状态之间的平均速度。这些方法在图像生成上展示了有希望的结果。然而,在大规模视频模型上,它们未能实现高质量的少步生成。此外,它们通常依赖 JVP 或有限差分,这些在大规模模型上评估昂贵或导致不稳定的训练动态。

与我们的方法最相关的是 Pi-Flow [7]。与我们类似,他们观察到给定预训练流模型,区间 $[t_n, t_{n+L}]$ 内的轨迹完全由初始状态指定,并使用它将该区间内的积分委托给一个小的可学习策略头。相比之下,我们利用它来启发我们的并行预测范式,简化训练和推理,并将重点从表达性参数化(如高斯混合)转向改进的监督。虽然 Pi-Flow 蒸馏连续时间瞬时速度 (1) $v$,但我们通过离散化时间并蒸馏平均速度 (4) $u$ 的数值近似来超越这一点。此外,使用层融合 (14),我们在生成期间避免了任何额外成本。最后,我们的训练算法自然支持使用不同 NFE 进行采样,而 Pi-Flow 仅限于固定 NFE。高层差异总结在表 1 中。我们验证了并行解码器可以学习非平凡轨迹,方法是比较其轨迹与教师轨迹的曲率(见图 17,附录)。

从头开始训练 越来越多的努力 [12, 14, 4, 60, 71, 72] 致力于开发少步生成模型的端到端训练方法。这些方法直接学习流映射,并通过将流匹配目标 [29, 30] 与基于轨迹的蒸馏目标相结合,避免了单独的预训练和蒸馏阶段。它们不使用单独的学生-教师方案,而是使用模型的当前状态作为教师。这一研究方向衍生出多种后续方法,旨在改善收敛性 [69, 15, 18, 33, 37] 或用有限差分近似替换 JVP [35, 41]。

第 7 页

并行解码蒸馏用于图像和视频生成

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“白色纸张折纸舞者的3D渲染图,在纯白背景的演播室环境中表演现代舞蹈。每位舞者都有精致的折叠和褶皱,捕捉光线,增强其空灵的外观。他们以同步的动作优雅地移动,通过姿态表达流畅性和优雅感。场景聚焦于中近景,以捕捉舞者动作的复杂细节和柔和干净的背景。”

PDD

DMD2

AnyFlow

“艺术家使用大号圆刷在画布上作画的特写。艺术家留着中长发,松散地扎成马尾辫,身上穿着白色围裙。他们全神贯注,手在画布上平滑移动。笔触清晰可见,以流畅的动作混合颜色。背景显示了艺术家工作区的一部分,附近有其他画笔和颜料管。场景强调笔触与颜料和画布交互时的复杂细节和流动感。”

图 5:PDD – Midpoint( ours)与 DMD2 和 AnyFlow 在 Wan Text-to-Video 14B 模型上的对比。这三种方法均使用 4 NFE。值得注意的是,PDD 在保持更好多样性的同时实现了高质量视频生成。

虽然 PDD 理论上可以扩展到可训练参数的自蒸馏框架,但这类方法需要完全不同的流水线,包括更大的数据集和显著更多的计算资源。相比之下,我们发现内存高效的简单 PD 损失对超参数选择更具鲁棒性,并在训练迭代中呈现一致的生成效果。

基于分布的蒸馏 与其让学生模型蒸馏教师模型的轨迹,对于几步生成模型而言,对齐边缘分布 𝑝𝑡 是一个更灵活且充分的条件。二、ADD [46]、LADD [47] 和 APT [28] 使用 GAN 损失对预训练的扩散模型进行微调,将其转化为几步生成模型。DMD [67, 66] 整合了用于蒸馏的 VSD 损失 [59]。𝑓-distill [64] 将 VSD 损失推广到 𝑓-散度,而 SiD 及其扩展 [74, 73, 36] 使用费雪散度的变体。基于分布的方法已确立为大规模视频模型蒸馏的主导方法 [39, 70, 17, 11, 28]。然而,它们容易受到模式崩溃的影响,导致生成多样性和运动性的缺乏。最近的工作试图通过基于轨迹的目标正则化损失来缓解这一问题 [8, 70, 17]。

此外,基于分布的方法已知对超参数敏感,需要额外的推理时间来确定可用的 NFE 集合。对于每个任务,我们训练了两个 PDD

7

第 8 页

图像与视频生成的并行解码蒸馏

表 3:Qwen-Image 在 OneIG-EN、DPG-Bench、PDD – Euler 和 GenEval 上的表现。* 表示我们对官方 PDD – Midpoint 2.6 检查点的重新评估。该表报告了整体指标。三个基准测试的完整维度见附录 B.2 中的表 6、7、2.4 和 8。

FID 方法 NFE OneIG-EN↑ DPG-Bench↑ GenEval↑ 2.2 Euler* 50×2 0.537 88.30 0.86 TwinFlow* [8] 0.493 86.67 0.82 PDD – Euler (Ours) 2 0.508 88.04 0.86 2.0 PDD – Midpoint (Ours) 0.516 88.10 0.86 DMD2* (Lightning-step4-v2) [9] 0.524 88.25 0.85 1.8 TwinFlow* [8] 0.502 86.18 0.82 1 2 4 8 Pi-Flow* [7] 4 0.533 88.11 0.85 函数评估次数 PDD – Euler (Ours) 0.535 88.45 0.86 PDD – Midpoint (Ours) 0.538 88.66 0.86 图 6:PDD 使用 Euler 和 DMD2*Pi-Flow*(Lightning-step8-v2)[7] [9] 0.5260.536 88.2087.90 0.840.84 Midpoint 方法在 ImageNet-256 上使用 SiT-XL+REPA PDD – Euler (Ours) 8 0.538 88.51 0.86 模型作为教师,指导尺度为 2.9,用于近似平均 PDD – Midpoint (Ours) 0.541 88.46 0.85 速度 (4)。

表 4:Qwen-Image 在 HPSv2、PickScore 和 OneIG 多样性上的表现。* 表示我们对官方 模型(每个模型具有不同的网格大小、Runge-Kutta 方法、块大小范围)的重新评估。其他训练 细节见附录 B。

方法 NFE HPSv2↑ PickScore↑ OneIG diversity↑ Euler* 50×2 30.83 22.78 0.200 TwinFlow* [8] 29.86 22.26 0.131 PDD – Euler (Ours) 2 29.59 22.47 0.197 PDD – Midpoint (Ours) 30.15 22.66 0.177 DMD2* (Lightning-step4-v2) [9] 32.34 22.98 0.095 TwinFlow* [8] 30.01 22.26 0.150 Pi-Flow* [7] 4 30.94 22.67 0.182 PDDPDD — EulerMidpoint(Ours)(Ours) 31.0531.33 22.7222.86 0.1920.174 DMD2* (Lightning-step8-v2) [9] 32.35 22.95 0.109 Pi-Flow* [7] 31.09 22.55 0.186 PDD – Euler (Ours) 8 31.34 22.73 0.198 PDD – Midpoint (Ours) 31.56 22.86 0.181

对于类别条件图像生成,我们将 Euler 方法的 𝑁 设为 128,将 Midpoint 方法的 𝑁 设为 64。对于这两个模型,我们使用均匀时间离散化 (7),𝑡𝑛= 𝑛/𝑁,并选择块大小 𝐿min 和 𝐿max,使得推理时的可用 NFE 为 1、2、4、8。

对于文本到图像和文本到视频生成,我们将 Euler 方法的 𝑁 设为 256,将 Midpoint 方法的 𝑁 设为 128。所有模型都使用时间离散化的移位变换 [10, 48]:

𝑡𝑛= shift(𝑛/𝑠𝑡) shift𝑠(𝑡) = (1 + (1/𝑠−1) 𝑡). (16)

由于缺乏高质量的图像和视频数据集,我们如算法 3 所述应用无数据训练。最小和最大块大小 𝐿min 和 𝐿max 的选择使得 Qwen-Image 和 Wan2.1 在推理时的可用 NFE 为 2、4、8,LTX-2.3 为 4、8。指导尺度 𝑤= 2.9。

表 2:在 ImageNet-256 上使用 SOTA FreeFlow 方法 [55] 作为教师,NFE= 1 时的 FID。

方法 FID Pi-Flow [7] 2.85 FreeFlow [55] 1.45 PDD – Euler 2.73 PDD – Midpoint 2.69

如表 2 所示,我们的 PDD 方法与相关的 Pi-Flow 方法 [7] 以及 SiT-XL+REPA 教师进行了比较。由于 Midpoint 方法需要两次教师评估,为了公平比较,我们在每个块内的两个区间内累积 Euler 损失。此外,关于无分类器指导的细节见附录 B。

虽然 PDD 在超参数方面表现出稳定的收敛性,但我们发现两个最重要的训练超参数是时间重参数化和批量大小,较大的批量大小能带来更好的性能。此外,如表 3、4、5 所示,与 Euler 近似相比,Midpoint 近似一致地提高了性能。

文本到图像 Qwen-Image 我们在三个主要基准测试上评估了我们的 PDD 蒸馏 Qwen-Image 模型:OneIG [6]、DPG-Bench [22] 和 GenEval [16],NFE = 2、4、8。对于 SOTA 基

第 9 页

图像与视频生成的并行解码蒸馏

表 5:Wan Text-to-Video 1.3B 和 14B 模型在 VBench [24] 上的性能与多样性指标,使用 Self-Forcing 提示集。多样性通过每个提示生成的 5 个视频之间的平均成对 V-JEPA 2/VideoMAE V2 特征距离来衡量。* 我们对官方检查点的重新评估。** 我们的重新实现。† 报告的是专有提示上的数字,未进行多样性评估,因为 rCM [70] 未发布检查点。

VBench V-JEPA 2 VideoMAE V2 模型 方法 NFE 总体 ↑ 质量 ↑ 语义 ↑ 余弦 ↑ L2 ↑ 余弦 ↑ L2 ↑ UniPC* (教师) 50×2 83.77 84.90 79.22 0.1254 27.07 0.02681 2.922 rCM† [70] 84.43 85.38 80.63 – – – – AnyFlow* [17] 84.45 85.22 81.34 0.0704 19.88 0.01029 1.807 1.3B DMD2** (FastGen [38]) 4 84.69 86.14 78.87 0.0833 21.83 0.01646 2.278 PDD – Euler ( ours) 84.44 85.99 78.22 0.1018 24.54 0.01901 2.489 PDD – Midpoint ( ours) 84.94 86.45 78.91 0.1032 24.63 0.02054 2.548 UniPC* (教师) 50×2 83.90 84.56 81.24 0.1263 27.27 0.02497 2.824 rCM† [70] 84.92 85.43 82.88 – – – – AnyFlow* [17] 84.95 85.70 81.92 0.0786 20.99 0.01297 1.992 DMD2** (FastGen [38]) 4 84.40 85.16 81.34 0.0568 17.67 0.00945 1.710 14B PDDshort – Midpoint ( ours) 84.92 85.71 81.77 0.0791 21.27 0.01247 2.027 PDDlong – Midpoint ( ours) 84.69 85.69 80.71 0.0846 22.13 0.01264 2.058 AnyFlow* [17] 85.08 85.78 82.28 0.0765 20.67 0.01278 1.974 PDDshort – Midpoint ( ours) 8 84.96 85.83 81.44 0.0816 21.63 0.01276 2.054 PDDlong – Midpoint ( ours) 84.70 85.77 80.41 0.0868 22.43 0.01314 2.097

行中,我们考虑 QwenLightning-v2 [9],它采用 DMD2 [66] 蒸馏、Pi-Flow 和 Twin-Flow [8]。对于所有三个基线,我们报告了对官方检查点的重新评估。表 3 显示 PDD 在三个基准测试的总体指标上取得了最佳性能。完整维度见附录中的表 6、7 和 8。此外,我们在 HPSv2 [62] 基准上评估了模型,并在相同的生成图像上测量了 PickScore [62]。表 4 显示,在这些人类偏好指标方面,我们的 PDD 仅次于 DMD2 (Lightning-v2) 模型。然而,DMD2 suffers from mode collapse(模式崩溃),导致多样性显著降低。这在表 4 的 OneIG 多样性指标以及图 11 至 16 中的许多示例中得到了观察。相比之下,我们的 PDD 显示出具有竞争力的结果,同时更好地保留了多样性,并更紧密地跟随教师生成。

文本到视频 Wan2.1 我们在文本到视频任务上的结果提供了强有力的证据,表明 PDD 在大规模上是有效的。我们在 VBench 基准 [24] 上评估了我们的蒸馏模型,并与 SOTA 基线 rCM [70]、AnyFlow [17] 和 DMD2(在 FastGen [38] 中实现)进行了比较,这些基线都结合了 VSD 损失。此外,我们通过使用 V-JEPA 2 [2] 和 VideoMAE V2 [57] 模型对生成的视频进行编码来测量多样性,并报告每个提示的 5 个样本之间的平均成对余弦和 L2 距离。我们发现,在 CFG (17) 的无条件项中跳过骨干网络中的一层可以提高 PDD 的性能。对于 Wan2.1 1.3B 模型,我们跳过第 10 层;对于 14B 模型,我们跳过第 12 层。

如表 5 所示,在 Wan2.1 1.3B 模型上,PDD 在视频质量、总体评分以及多样性方面排名第一。在 Wan2.1 14B 模型上,我们报告了两个检查点的结果,short 代表 200 次训练迭代,long 代表 3k 次迭代。我们发现 PDD (short) 取得了最佳的视频质量,并且在 4 和 8 NFE 下,总体指标仅次于 AnyFlow。我们发现,总体而言,PDD 生成的视频表现出比基线更高的运动程度(见图 5 以及图 19 至 21)。特别是,虽然 PDD (long) 获得了较低的 VBench 分数,但我们发现随着训练的进行,生成视频中的运动增加,这在附录图 18 的 VBench 动态度评分中也尤为明显。此外,表 5 显示 PDD 获得了比基线更高的多样性分数。这在图 19 至 21 中显示的许多示例中也很明显,这些示例是从最佳 VBench 检查点生成的。

文本到视频/音频 LTX-2.3 为了进一步展示 PDD 的可扩展性,我们蒸馏了 22B LTX-2.3 模型,展示了在 720p 分辨率下用 72 步生成 10 秒视频和音频的多模态少步生成。作为基线,我们考虑官方的 LTX-2.3 蒸馏 8 步模型 [19]。我们将 PD 损失分别应用于音频和视频潜在变量,并平均两种模态的损失。遵循标准指南,我们对教师应用三种引导方法,即标准 CFG(视频缩放 4.5,音频缩放 7)、跨模态引导(缩放 3)以及时空跳过引导(第 29 层缩放 2)。由于计算成本较高,我们仅考虑欧拉方法(N=256)在单个区间内

第 10 页

图像与视频生成的并行解码蒸馏

$𝑡=0\text{s}$ $𝑡=2.5\text{s}$ $𝑡=5\text{s}$ $𝑡=7.5\text{s}$ $𝑡=10\text{s}$

教师模型

PDD

蒸馏模型

“在一片迷人的森林中,翠绿的枝叶繁茂,斑驳的阳光透过树梢洒下。一位身着飘逸白裙的年轻女子踏上了一段神秘的旅程,她轻柔的脚步踩在潮湿的苔藓和野花上,发出沉闷的声响。她头戴一顶散发空灵光芒的神奇皇冠,周围投射出闪烁的光芒,伴随着空气中回荡的微弱、清脆的叮当声。她眼中充满惊奇与坚定,自信地行走着,双臂轻轻摆动,裙摆与灌木丛轻轻摩擦发出沙沙声。随着她向前移动,镜头以平滑的跟踪镜头跟随她,捕捉她在森林鸟类轻柔、有节奏的鸣叫以及背景中空灵弦乐微妙、旋律般的起伏中的每一步。整个场景沐浴在温暖、神奇的光芒中,营造出一种迷人而冒险的氛围,伴随着微风穿过树叶时轻盈、空灵的耳语。4K分辨率,16:9画幅。”

$𝑡=0\text{s}$ $𝑡=2.5\text{s}$ $𝑡=5\text{s}$ $𝑡=7.5\text{s}$ $𝑡=10\text{s}$

教师模型

PDD

蒸馏模型

“一部设定在茂密森林中的异想天开的儿童动画故事,讲述了一只狡猾的狐狸和一只狡诈的狼经常互相欺骗的故事,伴随着树叶轻柔的沙沙声和林鸟柔和的鸣叫。在这一场景中,狐狸有着蓬松的尾巴和淘气的眼睛,蹲在一棵树后,用沙哑、 playful 的语气低声说:‘我有完美的计划。’狼则高高站立,脸上带着怀疑的表情,耳朵抽动,咕哝着回应:‘我怀疑。’这两种动物都以儿童书籍典型的明亮、欢快的色彩绘制,表情生动,姿态动态。森林背景充满了翠绿的枝叶和透过树木洒下的斑驳阳光,而微风穿过树枝的柔和呼啸声构成了环境音。镜头拉近捕捉他们的互动,记录下狐狸发出轻柔、密谋般的咯咯笑声时,他们既顽皮又算计的表情。”

图 7:具有 4 × 30 NFE 的 LTX-2.3 教师模型与 PDD( ours )以及官方蒸馏的 LTX-2.3 模型(均使用 8 NFE)的对比。

在每个块内。对于教师模型,这导致每次生成需要 4×30 次函数评估次数(NFE)。图 7 以及附录中的图 22 至 25 中的比较显示,PDD 能够在仅 250 次训练迭代后,以仅 8 次 NFE 提供高质量的生成,其性能与官方蒸馏模型相当或更优,且无需访问任何训练数据。在 Qwen-Image、Wan2.1 和 LTX-2.3 等大型模型上,PDD 实现了强大的少步性能,同时在样本多样性和运动方面优于基于分布的基线。这使得 PDD 成为首个用于少步、高分辨率视频生成的纯轨迹蒸馏方法。

6. 结论

在本工作中,我们引入了并行解码蒸馏(PDD),这是一种用于加速扩散模型和流模型的简单基于轨迹的蒸馏方法。PDD 并非将许多去噪步骤坍缩为单个大型更新,而是训练一个并行解码器,在一次网络评估中预测多个连续区间的平均速度。这种公式化导致了一个实用的训练目标,避免了变分分数蒸馏(VSD)和对抗性损失,以及雅可比-向量积(JVPs)、有限差分和多阶段蒸馏过程。

由于我们的大规模文本到图像和视频实验依赖于无数据训练,在 ImageNet-256 之外的数据依赖设置中研究 PDD 将是未来的工作。此外,PDD 引入了一个灵活的推理时设计选择:块大小可以在评估并行解码器后选择。这表明存在自适应块大小选择的可能性,其中验证器或置信度准则决定在生成过程中如何激进地跳过区间。最后,将并行解码原理推广到离散自回归模型可能会将 PDD 的适用范围扩展到扩散和基于流的生成之外。

10

第 11 页

图像与视频生成的并行解码蒸馏

参考文献

[9] LightX2V Contributors. Lightx2v: Light video generation inference framework. https://github.com/ModelTC/lightx2v, 2025.

[1] Michael S. Albergo, Nicholas M. Boffi, and Eric Vanden-Eijnden. Stochastic interpolants: A unifying framework for flows and diffusions, 2025. URL https://arxiv.org/abs/2303.08797.

[2] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Mojtaba Komeili, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, Sergio Arnaud, Abha Gejji, Ada Martin, Francois Robert Hogan, Daniel Dugas, Piotr Bojanowski, Vasil Khaldov, Patrick Labatut, Francisco Massa, Marc Szafraniec, Kapil Krishnakumar, Yong Li, Xiaodong Ma, Sarath Chandar, Franziska Meier, Yann LeCun, Michael Rabbat, and Nicolas Ballas. V-jepa 2: Self-supervised video models enable understanding, prediction and planning, 2025. URL https://arxiv.org/abs/2506.09985.

[3] Nicholas M. Boffi, Michael S. Albergo, and Eric Vanden-Eijnden. Flow map matching with stochastic interpolants: A mathematical framework for consistency models, 2025. URL https://arxiv.org/abs/2406.07507.

[4] Nicholas M. Boffi, Michael S. Albergo, and Eric Vanden-Eijnden. How to build a consistency model: Learning flow maps via self-distillation, 2025. URL https://arxiv.org/abs/2505.18825.

[5] Xu Cai, Yang Wu, Qianli Chen, Haoran Wu, Lichuan Xiang, and Hongkai Wen. Shortcutting pre-trained flow matching diffusion models is almost free lunch, 2025. URL https://arxiv.org/abs/2510.17858.

[6] Jingjing Chang, Yixiao Fang, Peng Xing, Shuhan Wu, Wei Cheng, Rui Wang, Xianfang Zeng, Gang Yu, and Hai-Bao Chen. Oneig-bench: Omni-dimensional nuanced evaluation for image generation, 2025. URL https://arxiv.org/abs/2506.07977.

[7] Hansheng Chen, Kai Zhang, Hao Tan, Leonidas Guibas, Gordon Wetzstein, and Sai Bi. pi-flow: Policy-based few-step generation via imitation distillation, 2025. URL https://arxiv.org/abs/2510.14974.

[8] Zhenglin Cheng, Peng Sun, Jianguo Li, and Tao Lin. Twinflow: Realizing one-step generation on large models with self-adversarial flows, 2026. URL https://arxiv.org/abs/2512.05150.

[10] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, Kyle Lacey, Alex Goodwin, Yannik Marek, Robin Rombach. Scaling rectified flow transformers for high-resolution image synthesis, 2024. URL https://arxiv.org/abs/2403.03206.

[11] Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu, Fanzhou Wang, Zhiqian Lin, Tianxiang Ren, Dahua Lin, Ruihao Gong, and Lei Yang. Phased dmd: Few-step distribution matching distillation via score matching within subintervals, 2026. URL https://arxiv.org/abs/2510.27684.

[12] Kevin Frans, Danijar Hafner, Sergey Levine, and Pieter Abbeel. One step diffusion via short-cut models, 2025. URL https://arxiv.org/abs/2410.12557.

[13] Zhengyang Geng, Ashwini Pokle, William Luo, Justin Lin, and J. Zico Kolter. Consistency models made easy, 2024. URL https://arxiv.org/abs/2406.14548.

[14] Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, and Kaiming He. Mean flows for one-step generative modeling, 2025. URL https://arxiv.org/abs/2505.13447.

[15] Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, and Kaiming He. Improved mean flows: On the challenges of fast-forward generative models, 2025. URL https://arxiv.org/abs/2512.02012.

[16] Dhruba Ghosh, Hanna Hajishirzi, and Ludwig Schmidt. Geneval: An object-focused framework for evaluating text-to-image alignment, 2023. URL https://arxiv.org/abs/2310.11513.

[17] Yuchao Gu, Guian Fang, Yuxin Jiang, Weijia Mao, Song Han, Han Cai, and Mike Zheng Shou. Anyflow: Any-step video diffusion model with on-policy flow map distillation, 2026. URL https://arxiv.org/abs/2605.13724.

[18] Yi Guo, Wei Wang, Zhihang Yuan, Rong Cao, Kuan Chen, Zhengyang Chen, Yuanyuan Huo, Yang Zhang, Yuping Wang, Shouda Liu, and Yuxuan Wang. Splitmeanflow: Interval splitting consistency in few-step generative modeling, 2025. URL https://arxiv.org/abs/2512.05150.

11

第 12 页

图像与视频生成的并行解码蒸馏

2025. URL https://arxiv.org/abs/2507. Di Wang, Yuhong Liu, Jie Jiang, and Caesar 16884. Zhong. Hunyuanvideo: A systematic framework for large video generative models, 2025. URL [19] Yoav HaCohen, Benny Brazowski, Nisan Chiprut, https://arxiv.org/abs/2412.03603. Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, [26] Black Forest Labs. FLUX.2: Frontier Visual In- Dudu Moshe, Eitan Porat, Eitan Richardson, telligence. https://bfl.ai/blog/flux-2, Guy Shiran, Itay Chachy, Jonathan Chetboun, 2025. Michael Finkelson, Michael Kupchick, Nir Zabari, [27] Kyungmin Lee, Sihyun Yu, and Jinwoo Shin. Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gor- Decoupled meanflow: Turning flow models into don, Poriya Panet, Roi Benita, Shahar Armon, flow maps for accelerated sampling, 2025. URL Victor Kulikov, Yaron Inger, Yonatan Shiftan, https://arxiv.org/abs/2510.24474. Zeev Melumian, and Zeev Farbman. Ltx-2: Efficient joint audio-visual foundation model, [28] Shanchuan Lin, Xin Xia, Yuxi Ren, Ceyuan Yang, 2026. URL https://arxiv.org/abs/2601. Xuefeng Xiao, and Lu Jiang. Diffusion adversar- 03233. ial post-training for one-step video generation, [20] Jonathan Ho and Tim Salimans. Classifier- 2025. URL https://arxiv.org/abs/2501. free diffusion guidance, 2022. URL https: 08316. //arxiv.org/abs/2207.12598. [29] Yaron Lipman, Ricky T. Q. Chen, Heli Ben- [21] Jonathan Ho, Ajay Jain, and Pieter Abbeel. De- Hamu, Maximilian Nickel, and Matt Le. Flow noising diffusion probabilistic models, 2020. URL matching for generative modeling, 2023. URL https://arxiv.org/abs/2006.11239. https://arxiv.org/abs/2210.02747.

[22] Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei [30] Xingchao Liu, Chengyue Gong, and Qiang Liu. Cheng, and Gang Yu. Ella: Equip diffusion Flow straight and fast: Learning to generate models with llm for enhanced semantic alignment, and transfer data with rectified flow, 2022. URL 2024. URL https://arxiv.org/abs/2403. https://arxiv.org/abs/2209.03003. 05135. [31] Ilya Loshchilov and Frank Hutter. Decoupled [23] Zheyuan Hu, Chieh-Hsin Lai, Yuki Mitsufuji, weight decay regularization, 2019. URL https: and Stefano Ermon. Cmt: Mid-training for ef- //arxiv.org/abs/1711.05101. ficient learning of consistency, mean flow, and [32] Cheng Lu and Yang Song. Simplifying, stabiliz- flow map models, 2026. URL https://arxiv. ing and scaling continuous-time consistency mod- org/abs/2509.24526. els, 2025. URL https://arxiv.org/abs/ [24] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, 2410.11081. Chenyang Si, Yuming Jiang, Yuanhan Zhang, [33] Yiyang Lu, Susie Lu, Qiao Sun, Hanhong Zhao, Tianxing Wu, Qingyang Jin, Nattapol Chan- paisit, Yaohui Wang, Xinyuan Chen, Limin Zhicheng Jiang, Xianbang Wang, Tianhong Li, Wang, Dahua Lin, Yu Qiao, and Ziwei Liu. Zhengyang Geng, and Kaiming He. One-step Vbench: Comprehensive benchmark suite for latent-free image generation with pixel mean video generative models, 2023. URL https: flows, 2026. URL https://arxiv.org/abs/ //arxiv.org/abs/2311.17982. 2601.22158.

[34] Simian Luo, Yiqin Tan, Longbo Huang, Jian[25] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Li, and Hang Zhao. Latent consistency models: Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Synthesizing high-resolution images with few- Bo Wu, Jianwei Zhang, Kathrina Wu, Qin Lin, step inference, 2023. URL https://arxiv. Junkun Yuan, Yanxin Long, Aladdin Wang, An- org/abs/2310.04378. dong Wang, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Hongmei Wang, Jacob Song, Ji- [35] Tianze Luo, Haotian Yuan, and Zhuang Liu. awang Bai, Jianbing Wu, Jinbao Xue, Joey Wang, Soflow: Solution flow models for one-step gen- Kai Wang, Mengyang Liu, Pengyu Li, Shuai Li, erative modeling, 2026. URL https://arxiv. Weiyan Wang, Wenqing Yu, Xinchi Deng, Yang org/abs/2512.15657. Li, Yi Chen, Yutao Cui, Yuanbo Peng, Zhen- tao Yu, Zhiyu He, Zhiyong Xu, Zixiang Zhou, [36] Weijian Luo, Zemin Huang, Zhengyang Geng, Zunnan Xu, Yangyu Tao, Qinglin Lu, Song- J. Zico Kolter, and Guo jun Qi. One-step diffu- tao Liu, Dax Zhou, Hongfa Wang, Yong Yang, sion distillation through score implicit matching,

12

第 13 页

图像与视频生成的并行解码蒸馏

2024. URL https://arxiv.org/abs/2410. [47] Axel Sauer, Frederic Boesel, Tim Dockhorn, 16794. Andreas Blattmann, Patrick Esser, and Robin Rombach. 使用潜在对抗扩散蒸馏实现快速高分辨率图像合成, [37] Anh Nguyen, Viet Nguyen, Duc Vu, Trung 2024. URL https://arxiv.org/abs/2403. Dao, Chi Tran, Toan Tran, and Anh Tran. 改进 12015. 捷径模型的训练技术, 2025. URL https://arxiv.org/abs/2510. [48] Neta Shaul, Uriel Singer, Ricky T. Q. Chen, 21250. Matthew Le, Ali Thabet, Albert Pumarola, and Yaron Lipman. 针对扩散和流模型快速采样的定制非平稳求解器, [38] Weili Nie, Julius Berner, Chao Liu, and 2024. URL https://arxiv.org/abs/2403. Arash Vahdat. Nvidia fastgen:从扩散模型快速生成, 01329. 2026. URL https://github. com/NVlabs/FastGen. [49] Jascha Sohl-Dickstein, Eric A. Weiss, Niru Mah- eswaranathan, and Surya Ganguli. 使用非平衡热力学的深度无监督学习, [39] Weili Nie, Julius Berner, Nanye Ma, Chao Liu, 2015. URL https://arxiv.org/ Saining Xie, and Arash Vahdat. 转换匹配蒸馏用于快速视频生成, 09881. 2026. URL https://arxiv.org/abs/2601. [50] Yang Song and Prafulla Dhariwal. 改进的一致性模型训练技术, [40] NVIDIA. Cosmos 3:面向物理 AI 的全模态世界模型, 2023. URL https://arxiv.org/abs/2310. 2026. URL https://arxiv. 14189. org/abs/2606.02800. [51] Yang Song, Jascha Sohl-Dickstein, Diederik P. [41] Dogyun Park, Yanyu Li, Sergey Tulyakov, and Kingma, Abhishek Kumar, Stefano Ermon, Anil Kag. Eflow:通过高效求解器从头开始训练快速少步视频生成器, and Ben Poole. 基于分数的生成模型通过随机微分方程, 2026. URL https://arxiv.org/abs/2603. 2021. URL https://arxiv.org/abs/2011. 27086. [42] Robin Rombach, Andreas Blattmann, Dominik 13456. Lorenz, Patrick Esser, and Björn Ommer. 使用潜在扩散模型进行高分辨率图像合成, [52] Yang Song, Prafulla Dhariwal, Mark Chen, and 2022. URL https://arxiv.org/ Ilya Sutskever. 一致性模型,2023. URL abs/2112.10752. https://arxiv.org/abs/2303.01469.

[43] Olga Russakovsky, Jia Deng, Hao Su, Jonathan [53] Peng Sun and Tao Lin. 通过 n 阶递归一致速度场估计实现任意步生成。在第十四届 Krause, Sanjeev Satheesh, Sean Ma, Zhi- 国际学习代表会议上,2026. URL https://openreview. heng Huang, Andrej Karpathy, Aditya Khosla, net/forum?id=GnawtLKGkP. Michael Bernstein, Alexander C. Berg, and Li Fei- Fei. ImageNet 大规模视觉识别挑战赛。国际计算机视觉杂志 (IJCV),115(3):211–252, 2015. doi: [54] Joshua Tian Jin Tee, Kang Zhang, Hee Suk 10.1007/s11263-015-0816-y. Yoon, Dhananjaya Nagaraja Gowda, Chanwoo Kim, and Chang D. Yoo. 面向扩散模型的物理信息蒸馏,2024. URL [44] Amirmojtaba Sabour, Sanja Fidler, and Karsten https://arxiv.org/abs/2411.08378. Kreis. 对齐你的流:扩展连续时间流映射蒸馏,2025. URL https:// arxiv.org/abs/2506.14603. [55] Shangyuan Tong, Nanye Ma, Saining Xie, and Tommi Jaakkola. 无数据流映射蒸馏,2025. URL https://arxiv.org/abs/ [45] Tim Salimans and Jonathan Ho. 扩散模型快速采样的渐进式蒸馏, 2511.19428. 2022. URL https://arxiv.org/abs/2202. 00512. [56] Team Wan, Ang Wang, Baole Ai, Bin Wen, [46] Axel Sauer, Dominik Lorenz, Andreas Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Blattmann, and Robin Rombach. 对抗扩散蒸馏,2023. URL Yu, Haiming Zhao, Jianxiao Yang, Jianyuan https://arxiv.org/abs/2311.17042. Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao,

13

第 14 页

用于图像和视频生成的并行解码蒸馏

Keyu Yan, Lianghua Huang, Mengyang Feng, 来自文本到图像合成领域,2023。URL https: Ningyi Zhang, Pandeng Li, Pingyu Wu, Rui- //arxiv.org/abs/2306.09341. hang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu [63] Howard Xiao, Brian Chao, Lior Yariv, 和 Gor- Weng, Tong Shen, Wei Lin, Wei Wang, Wei don Wetzstein。用于高效图像和视频生成的谱渐进扩散,2026。URL Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming https://arxiv.org/abs/2605.18736. Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yi- [64] Yilun Xu, Weili Nie, 和 Arash Vahdat。具有 𝑓-散度分布匹配的单步 tong Huang, Yong Li, You Wu, Yu Liu, Yulin 扩散模型,2025。URL https://arxiv.org/ Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yu- abs/2502.15681. tong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, 和 Ziyu Liu。Wan:开放且先进的 大规模视频生成模型,2025。URL [65] Timing Yang, Sucheng Ren, Alan Yuille, 和 https://arxiv.org/abs/2503.20314. Feng Wang。Vimix-14m:一个精心策划的多源 视频-文本数据集,包含长篇、高质量 [57] Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan 的标题和无爬取访问权限,2025。URL Tong, Yinan He, Yi Wang, Yali Wang, 和 https://arxiv.org/abs/2511.18382. Yu Qiao。Videomae v2:通过双重掩码扩展视频掩码 自编码器,2023。URL [66] Tianwei Yin, Michaël Gharbi, Taesung Park, https://arxiv.org/abs/2303.16727. Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T. Freeman。改进的分布 [58] Wenhao Wang 和 Yi Yang。VidProM:一个百万级匹配蒸馏用于快速图像合成, 规模的真实提示画廊数据集,用于文本到 2024。URL https://arxiv.org/abs/2405. 视频扩散模型,2024。URL https: 14867. //arxiv.org/abs/2403.06098. [67] Tianwei Yin, Michaël Gharbi, Richard Zhang, [59] Zhengyi Wang, Cheng Lu, Yikai Wang, Fan Bao, Eli Shechtman, Fredo Durand, William T. Free- Chongxuan Li, Hang Su, 和 Jun Zhu。Pro- man, 和 Taesung Park。具有分布匹配蒸馏的单步扩散, lificdreamer:具有变分分数蒸馏的高保真度和多样性文本到 2024。URL https://arxiv.org/abs/2311.18828. 3D 生成,2023。URL https://arxiv.org/abs/2305. 16213. [68] Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang, Jinwoo Shin, [60] Zidong Wang, Yiyuan Zhang, Xiaoyu Yue, Xi- 和 Saining Xie。生成中的表示对齐:训练扩散 yangyu Yue, Yangguang Li, Wanli Ouyang, 和 Transformer 比你想象的更容易,2025。URL https: Lei Bai。Transition models:重新思考生成 //arxiv.org/abs/2410.06940. 学习目标,2025。URL https: //arxiv.org/abs/2509.04394.

[61] Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang [69] Huijie Zhang, Aliaksandr Siarohin, Willi Mena- Lin, Kaiyuan Gao, Kun Yan, Sheng ming Yin, pace, Michael Vasilkovsky, Sergey Tulyakov, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Qing Qu, 和 Ivan Skorokhodov。Alphaflow: Zecheng Tang, Zekai Zhang, Zhengyi Wang, 理解和改进 Meanflow 模型, An Yang, Bowen Yu, Chen Cheng, Dayiheng 2025。URL https://arxiv.org/abs/2510. Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, 20771. Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting [70] Kaiwen Zheng, Yuji Wang, Qianli Ma, Huayu Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Chen, Jintao Zhang, Yogesh Balaji, Jianfei Yi Wang, Yichang Zhang, Yongqiang Zhu, Yu- Chen, Ming-Yu Liu, Jun Zhu, 和 Qinsheng jia Wu, Yuxuan Cai, 和 Zenan Liu。Qwen- Zhang。通过分数正则化的连续时间一致性进行大规模扩散蒸馏, image 技术报告,2025。URL https: 2025。URL https://arxiv.org/abs/2510. //arxiv.org/abs/2508.02324. 08431. [62] Xiaoshi Wu, Yiming Hao, Keqiang Sun, Yix- iong Chen, Feng Zhu, Rui Zhao, 和 Hong- [71] Linqi Zhou, Stefano Ermon, 和 Jiaming Song。 sheng Li。Human preference score v2:一个用于评估人类偏好的坚实 归纳矩匹配,2025。URL https: 基准,2025。URL https: //arxiv.org/abs/2503.07565.

14

第 15 页

用于图像和视频生成的并行解码蒸馏

[72] Linqi Zhou, Mathias Parger, Ayaan Haque, 和 Jiaming Song。终端速度匹配,2026。URL https://arxiv.org/abs/2511.19797。

[73] Mingyuan Zhou, Huangjie Zheng, Yi Gu, Zhen-dong Wang, 和 Hai Huang。对抗性分数身份蒸馏:一步超越教师模型,2024。URL https://arxiv.org/abs/2410.14919。

[74] Mingyuan Zhou, Huangjie Zheng, Zhendong Wang, Mingzhang Yin, 和 Hai Huang。分数身份蒸馏:预训练扩散模型的一步生成指数级快速蒸馏,2024。URL https://arxiv.org/abs/2404.04057。

15

第 16 页

用于图像和视频生成的并行解码蒸馏

A. 算法

算法 3 无数据并行解码损失

student – 并行解码器模型

teacher – 预训练流模型

runge_kutta – 近似教师的平均速度

t – 时间离散化

L_min – 最小块大小

L_max – 最大块大小

x_n – 从前一次迭代携带的状态

n – 从前一次迭代携带的时间索引

网格大小

N = len(t) – 1

重置状态和时间索引

if n==N: x_n = randn_like(x_n) n=0

并行预测

u = student(x_n, t[n])

步长

h = diff(t, dim=0)

块中的采样索引

k = randint(n, clip(n+L_max, max=N))

从 n 到 k 的步骤

x_k = x_n + einsum(’l,l…’, h[n:k], u[n:k])

教师平均速度

u_k = runge_kutta(teacher, x_k, t[k], h[k])

mse 损失

loss = mse_loss(u[k], u_k.detach())

推进下一次迭代的状态

x_n = x_n + einsum(’l,l…’, h[n:n+L_min], u[n:n+L_min])

推进下一次迭代的时间索引

n = n + L_min

return loss, x_n.detach(), n

B. 实验

数据集 我们为 PDD 训练对每个模型使用不同的数据集和 VAE。对于 Repa-ImageNet-256,我们使用 ImageNet [43] 数据集和 Stable Diffusion VAE [42]。对于 Qwen-Image,我们使用 Pi-Flow [7] 提供的文本提示集进行无数据 PDD 训练,并使用原生 Qwen-Image VAE,分辨率为 1024 × 1024。类似地,对于 Wan2.1 和 LTX-2.3 模型,我们使用其原生 VAE 和无数据 PDD 训练。对于 Wan2.1 模型,我们使用从重新打乱的 ViMix-14M [65] 中提取的一组提示,分辨率为 480 × 832,时长为 5𝑠,帧率为 16 FPS。对于 LTX-2.3,我们使用来自 ViMix-14M [65] 和 VidProm [58] 的提示混合体,并增强以包含音频描述,分辨率为 704 × 1280,时长为 10𝑠,帧率为 24 FPS。

架构 对于所有 PDD 模型,我们使用与教师模型完全相同的骨干网络。此外,如第 3 节和图 4 所述,我们通过将通道维度重复 𝑁 次(即网格大小)来扩大最终的线性层。重要的是,重复操作必须应用于正确重塑的权重,使得最终的线性层等效于使用预训练模型的最后一层初始化所有并行步骤。对于 LTX-2.3,我们将此思想应用于视频和音频塔的最终线性层。

无分类器引导 (CFG) 遵循之前的工作 [67, 7],我们通过用引导速度替换教师速度 (4) 来引入引导。给定条件 𝑐,CFG 速度 [20] 为

𝑣𝑤𝑡(𝑥|𝑐) = 𝑣𝑡(𝑥) + 𝑤(𝑣𝑡(𝑥|𝑐) −𝑣𝑡(𝑥)) . (17)

我们以类似的方式处理 LTX-2.3 的跨模态引导和时空跳跃引导。因此,我们的方法减轻了不同引导方法所需的额外网络评估需求。

16

第 17 页

用于图像和视频生成的并行解码蒸馏

B.1. ImageNet

训练细节 我们使用 AdamW 优化器 [31],恒定学习率为 5e−5,权重衰减为 0。此外,我们使用批量大小 2048,EMA 常数为 0.99995。我们训练 300k 次迭代。

无分类器引导 对于每种 Runge-Kutta 方法:Euler、Midpoint,我们训练三个 PDD 模型,每个模型具有不同的引导尺度 (17):𝑤= 2.7, 2.9, 3.2。如图 8 所示,我们发现推理时不同的 NFE 受益于不同的引导尺度。在主论文中,我们选择展示 𝑤= 2.9,因为它给出了最平衡的结果。

3.0 PDD – Euler 引导尺度 PDD – Midpoint 2.7 2.8 2.9 3.2 2.6

FID 2.4

2.2

2.0

1.8

1.6 1 函数评估次数 4 8

图 8:在 Repa-ImageNet-256 上使用 Euler 和 Midpoint 方法近似平均速度 (4) 的 PDD 的 FID 与 NFE 的关系。

FID 与训练迭代次数 我们每 10K 次训练迭代评估一次 FID,NFE= 1, 2, 4, 8,并在图 9 中报告结果。我们观察到训练期间 FID 呈稳定下降趋势。

NFE= 1 NFE= 2 5.0 5.0 PDD – Euler 引导尺度 PDD – Euler 引导尺度 4.5 PDD – Midpoint 2.7 4.5 PDD – Midpoint 2.7 2.9 2.9 4.0 3.2 4.0 3.2

3.5 3.5 FID FID 3.0 3.0

2.5 2.5

2.0 2.0

1.5 1.5 0 50000 100000 训练迭代次数 150000 200000 250000 300000 0 50000 100000 训练迭代次数 150000 200000 250000 300000 NFE= 4 NFE= 8 5.0 5.0 PDD – Euler 引导尺度 PDD – Euler 引导尺度 4.5 PDD – Midpoint 2.7 4.5 PDD – Midpoint 2.7 2.9 2.9 4.0 3.2 4.0 3.2

3.5 3.5 FID FID 3.0 3.0

2.5 2.5

2.0 2.0

1.5 1.5 0 50000 100000 训练迭代次数 150000 200000 250000 300000 0 50000 100000 训练迭代次数 150000 200000 250000 300000

图 9:在 Repa-ImageNet-256 上使用 Euler 和 Midpoint 方法近似平均速度 (4) 的 PDD 的 FID 与训练迭代次数的关系。

17

第 18 页

用于图像和视频生成的并行解码蒸馏

B.2. Qwen-Image

训练细节 我们使用 AdamW 优化器,恒定学习率为 1e−5,权重衰减为 0。此外,我们使用批量大小 2048,不使用指数移动平均(EMA)。我们训练 3k 次迭代,每 250 次迭代评估三个基准测试,即 OneIG、DPG-Bench 和 GenEval,并报告在三个基准测试上取得最佳平均值的迭代结果。图 10 提供了每个基准测试的整体指标随训练迭代的变化情况。对于使用欧拉近似训练的模型,我们选择第 1250 次迭代;对于使用中点近似训练的模型,我们选择第 2250 次迭代。两个模型均使用带有缩放系数 𝑠= 5 的移位变换 (16) 以及带有缩放系数 𝑤= 4 的分类器自由引导 (17)(包括对引导预测进行原生的逐令牌重新缩放,以匹配原始条件预测的幅度)。

基准测试 NFE=2 NFE=4 NFE=8

0.54 PDD – Euler 0.54 0.54 0.53 PDD – Midpoint 0.53 0.53 OneIG 0.52 OneIG 0.52 OneIG 0.52

0.51 0.51 0.51 OneIG 整体 0.50 整体 0.50 整体 PDD – Euler 0.50 PDD – Euler 0.49 0.49 PDD – Midpoint 0.49 PDD – Midpoint 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000

0.886 PDD – Euler 0.886 0.886 PDD – Midpoint 0.884 0.884 0.884

0.882 0.882 0.882 DPG-Bench 0.880 DPG-Bench 0.880 DPG-Bench 0.880 DPG-Bench 0.878 0.878 0.878 整体 0.876 整体 0.876 PDD – Euler 整体 0.876 PDD – Euler 0.874 0.874 PDD – Midpoint 0.874 PDD – Midpoint 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000

0.865 PDD – Euler 0.865 0.865 PDD – Euler 0.860 PDD – Midpoint 0.860 0.860 PDD – Midpoint

0.855 0.855 0.855 GenEval 0.850 GenEval 0.850 GenEval 0.850 GenEval 整体 0.845 0.840 整体 0.845 0.840 整体 0.845 0.840 PDD – Euler 0.835 0.835 PDD – Midpoint 0.835 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000 500 1000训练 1500 迭代 2000 2500 3000

图 10:Qwen-Image PDD 模型的整体指标(OneIG、DPG-Bench 和 GenEval)随训练迭代的变化情况。

附加结果 我们在表 6、7 和 8 中提供了所考虑基准测试的所有维度。此外,我们在图 11 至 16 中提供了 Qwen-Image 教师模型、PDD 和 DMD2 (Lightning-v2) 之间的额外比较。

18

第 19 页

用于图像和视频生成的并行解码蒸馏

表 6:Qwen-Image 在 OneIG-EN [6] 上的表现。总分是五个维度的平均值。* 表示我们对官方检查点的重新评估。

方法 NFE 总分↑ 对齐 文本推理 风格 多样性

UniPC – 0.539 0.882 0.891 0.306 0.418 0.197 TwinFlow* 0.493 0.863 0.840 0.268 0.363 0.131 PDD – Euler (Ours) 2 0.508 0.867 0.796 0.279 0.400 0.197 PDD – Midpoint (Ours) 0.516 0.874 0.834 0.284 0.410 0.177 DMD2* (Lightning-step4-v2) 0.524 0.887 0.954 0.284 0.398 0.095 TwinFlow* 0.502 0.857 0.881 0.265 0.355 0.150 Pi-Flow* 4 0.533 0.877 0.886 0.294 0.427 0.182 PDD – Euler (Ours) 0.535 0.879 0.897 0.292 0.417 0.192 PDD – Midpoint (Ours) 0.538 0.883 0.911 0.296 0.427 0.174 DMD2* (Lightning-step8-v2) 0.526 0.888 0.945 0.287 0.403 0.109 Pi-Flow* 0.536 0.870 0.907 0.302 0.419 0.186 8 PDD – Euler (Ours) 0.538 0.877 0.892 0.298 0.422 0.198 PDD – Midpoint (Ours) 0.541 0.881 0.913 0.300 0.429 0.180

表 7:Qwen-Image 在 DPG-Bench [22] 上的表现。* 表示我们对官方检查点的重新评估。

方法 NFE 总分↑ 全局实体 属性 关系 其他

UniPC – 88.32 91.32 91.56 92.02 94.31 92.73 TwinFlow* 86.67 91.81 93.24 91.19 87.39 91.14 PDD – Euler (Ours) 2 88.04 92.65 92.00 92.65 92.06 91.40 PDD – Midpoint (Ours) 88.10 92.50 92.93 91.55 92.01 93.04 DMD2* (Lightning-step4-v2) 88.25 93.28 90.04 92.97 92.49 93.08 TwinFlow* 86.18 90.48 92.78 91.16 89.37 91.46 Pi-Flow* 4 88.11 91.06 91.56 92.88 93.48 92.61 PDD – Euler (Ours) 88.45 93.18 91.87 93.21 92.04 91.16 PDD – Midpoint (Ours) 88.66 93.19 93.25 92.27 92.04 93.35 DMD2* (Lightning-step8-v2) 88.20 90.13 92.92 92.17 93.39 91.94 Pi-Flow* 8 87.90 88.05 91.96 93.25 93.33 89.93 PDD – Euler (Ours) 88.51 94.14 93.87 90.50 92.15 93.16 PDD – Midpoint (Ours) 88.46 93.36 92.74 92.90 91.87 91.37

表 8:Qwen-Image 在 GenEval [16] 基准上的评估。* 表示我们对官方检查点的重新评估。

模型 NFE 总分↑ 单对象 双对象 计数 颜色 位置 属性绑定

UniPC – 0.87 0.99 0.92 0.89 0.88 0.76 0.77 TwinFlow* 0.82 0.98 0.91 0.75 0.90 0.68 0.72 PDD – Euler (Ours) 2 0.86 0.98 0.95 0.89 0.86 0.76 0.72 PDD – Midpoint (Ours) 0.86 0.99 0.94 0.90 0.88 0.71 0.71 DMD2* (Lightning-step4-v2) 0.85 0.99 0.95 0.85 0.87 0.72 0.74 TwinFlow* 0.82 0.98 0.92 0.76 0.87 0.70 0.68 Pi-Flow* 4 0.85 0.98 0.94 0.87 0.89 0.72 0.73 PDD – Euler (Ours) 0.86 0.99 0.94 0.89 0.86 0.76 0.74 PDD – Midpoint (Ours) 0.86 0.99 0.95 0.90 0.88 0.68 0.74 DMD2* (Lightning-step8-v2) 0.84 0.99 0.95 0.84 0.84 0.76 0.68 Pi-Flow* 0.84 0.98 0.93 0.87 0.88 0.69 0.71 8 PDD – Euler (Ours) 0.86 0.98 0.94 0.89 0.86 0.73 0.74 PDD – Midpoint (Ours) 0.85 0.99 0.93 0.88 0.88 0.67 0.73

19

第 20 页

用于图像和视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一只拥有鲜艳绿色、红色和蓝色羽毛的雄伟鹦鹉,在明亮的蓝天中轻松滑翔。它令人印象深刻的翼展完全展开,在树线之上高飞时捕捉着温暖的阳光。下方,景观呈现出起伏的山丘和茂密森林的斑块。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“三艘光滑的深色木船停泊在宁静、蔚蓝的湖泊岸边。平滑的水面反射着上方清澈的天空和环绕湖岸的郁郁葱葱的绿植。船只彼此靠近,船桨整齐地收在船内,暗示着近期或即将在平静水面上进行的旅程。”

图 11:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

20

第 21 页

用于图像和视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一片鲜红多汁的西瓜切片,露出绿色的瓜皮,作为盛放一只橙色熟虾的盘子。虾的曲线顺应西瓜的月牙形状,在颜色和质感上形成对比。西瓜旁边有水珠,暗示着水果的多汁新鲜。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一面内墙上安装了四个方形电源插座,整齐地水平排列在一个红宝石色的圆形凳子正上方。墙壁的油漆是柔和的奶油色,与凳子的鲜艳红色形成对比。凳子光滑的质地和光泽的表面反射着环境光,在原本中性色调的房间中突显其大胆的色彩。”

图 12:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

21

第 22 页

用于图像和视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一幅充满活力的抽象画,描绘了三个几何形状:一个大的蓝色三角形、一个较小的黄色三角形和一个红色三角形,所有形状都置于白色背景之上。蓝色三角形具有光滑的纹理,而黄色和红色三角形则呈现出更具质感、近乎笔触的外观。这些形状的排列方式暗示了构图中的动态运动和平衡。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“在图像中,一个流线型的金属人形机器人站在一块布满灰尘的黑板前,黑板上用优雅的草书仔细写着‘表示学习’。围绕中心文本的是几个复杂的数学公式和错综复杂的图表,每一部分都为关于机器学习高级概念的讲座做出了贡献。机器人灵活的手指握着一块白色粉笔,随着它继续书写,留下了一串细尘。”

图 13:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

22

第 23 页

面向图像和视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一幅动画图像,描绘了一只表情困惑的绿色海龟。海龟直立着,用两条腿站立,头顶上方有一个巨大的透明思维气泡,里面填满了那个悖论式的问题:‘如果根本不存在思维气泡会怎样?’海龟周围是简单的草地和花朵的简笔画,强调了图像的卡通风格。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一尊由白色大理石雕刻而成的经典希腊雕像,描绘了一位表情严肃的肌肉男,他正温柔地安抚着一只头部异常巨大的猫。这只同样由大理石雕刻而成的猫似乎很放松地待在男人有力的臂弯中。雕像矗立在石制底座上,男人卷曲的头发和猫毛发的纹理细节清晰可见,突显了雕塑家精湛的工艺。”

图 14:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

23

第 24 页

图像与视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一名男子站在摆有色彩缤纷生日蛋糕的桌子旁,蛋糕上插着点燃的蜡烛。他正小心翼翼地用一把长刀切蛋糕,准备招待客人。桌上铺着节日桌布,并散落着其他派对用品。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一张细节丰富的照片捕捉到一尊古埃及法老雕像的形象,其头顶意外地戴着一副青铜蒸汽朋克护目镜。雕像身着不合时宜的服饰,内穿挺括的白色T恤,外搭紧身黑色皮夹克,与传统头饰形成鲜明对比。背景为简单的纯色,凸显了雕像非传统的着装以及蒸汽朋克眼镜的复杂细节。”

图 15:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

24

第 25 页

用于图像和视频生成的并行解码蒸馏

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“俯瞰视角展示了一辆红色皮卡车,配有银色平板,上面整齐地堆放着棕色纸箱。 卡车停在灰色的混凝土车道上,旁边是修剪整齐的绿色草坪。车辆周围放置了几个 橙色交通锥,表明这是一个临时工作区或移动区域。”

噪声 1 噪声 2 噪声 3 噪声 4

教师模型

PDD

DMD2

“一幅动漫风格的插图描绘了一个充满奇思妙想的场景:一只袋鼠,呈现出鲜艳的棕色和棕褐色, 紧紧抱着一个矩形牌子,上面用大胆、奇异的字体写着“Starry Night”(星空)。袋鼠舒适地坐在 标志性的悉尼歌剧院前,其独特的白色帆状结构与深蓝色的夜空形成鲜明对比。在袋鼠的一侧, 埃菲尔铁塔耸立,其铁制网格剪影增添了超现实的构图。天空中充满了动态的蓝色漩涡和耀眼的黄色 星星爆发,捕捉到了梦幻般宇宙事件的本质。”

图 16:教师模型使用欧拉方法,NFE 为 2×50;PDD 和 DMD2 (Lightning-v2) 使用 4 NFE。

25

第 26 页

用于图像和视频生成的并行解码蒸馏

B.3. Wan 文本到视频

训练细节 在 Wan2.1 1.3B 和 14B 模型上,我们使用 AdamW 优化器,恒定学习率为 1e−5,权重衰减为 0,批量大小为 256。此外,对于平移变换 (16),𝑠= 6;对于 CFG,我们使用引导尺度 𝑤= 5,并在无条件评估的前向传播中跳过单个层。在 1.3B 模型上我们跳过第 10 层,在 14B 模型上我们跳过第 12 层。

在 Wan2.1 1.3B 模型上,使用中点法和欧拉法近似,我们在不使用 EMA 的情况下训练 250 次迭代。我们每 25 次迭代评估一次 VBench,并在欧拉法的第 25 次迭代和中点法的第 225 次迭代获得最佳总体得分。

在 Wan2.1 14B 模型上,由于中点法近似在较小模型上产生了更好的结果,我们仅使用中点法进行训练。短检查点在不使用 EMA 的情况下训练 250 次迭代,我们每 25 次迭代评估一次 VBench,并在第 200 次迭代获得最佳总体得分。对于长检查点,我们使用 EMA 和 0.99 的恒定系数训练 3.5k 次迭代。我们每 250 次迭代评估一次 VBench,并在 3k 次迭代时取得最佳得分。

附加结果 我们在图 17 中将 PDD 的曲率与 Wan2.1 14B 教师模型进行了比较。此外,我们在图 18 中提供了所有 VBench 维度。最后,我们在图 19 至 21 中展示了 PDD、DMD2 (FastGen) 和 AnyFlow 之间的其他比较。

PDD – 中点法 教师 0.08

0.06 曲率 平均 0.04 0.02

0.00 0.0 0.2 0.4 0.6 0.8 1.0 时间

图 17:Wan2.1 14B 模型上 PDD 与教师的曲率。我们报告了 10 条轨迹的平均曲率。重要的是,我们感兴趣的是验证 PDD 确实能够学习每个块内非平凡的轨迹。因此,对于 PDD,我们仅报告块内曲率。

一致性总体一致性主体一致性背景一致性总体一致性主体一致性背景一致性总体一致性主体一致性背景 风格闪烁时间时间风格闪烁时间时间时间风格闪烁时间

风格风格平滑度运动外观风格平滑度运动外观外观平滑度运动

动态程度 0.2 0.4 0.6 0.8 1.0 场景 0.2 0.4 0.6 0.8 1.0 动态程度 场景 场景 0.2 0.4 0.6 0.8 1.0 动态程度 质量关系空间美学关系空间美学空间美学质量质量关系 颜色成像质量颜色成像质量颜色成像质量 对象类别 多对象动作人类多对象对象类别动作人类动作人类多对象对象类别 PDD – 中点法 (84.94) DMD2 (84.69) PDDshort – 中点法 (84.92) DMD2 (84.40) PDD – 欧拉法 (84.44) AnyFlow (84.45) PDDlong – 中点法 (84.69) AnyFlow (84.95) PDDshort – 中点法 (84.96) PDDlong – 中点法 (84.70) AnyFlow (85.09)

(a) Wan2.1 1.3B 上的 4-NFE (b) Wan2.1 14B 上的 4-NFE (c) Wan2.1 14B 上的 8-NFE

图 18:Wan2.1 1.3B 和 14B 模型上的完整 VBench 维度。

26

第 27 页

用于图像和视频生成的并行解码蒸馏

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一只丰满、毛茸茸的兔子身穿宽大的紫色长袍,优雅地穿行在充满活力的奇幻景观中。兔子有着大而富有表现力的眼睛,表情温和且充满好奇。它的毛发柔软厚实,长袍优雅地披在身上。景观包括覆盖着茂盛绿草的连绵山丘、色彩斑斓的野花以及长着闪烁叶片的参天魔法树。远处有闪闪发光的瀑布和神秘的城堡。整个场景沐浴在温暖的金黄色阳光中。中景镜头,聚焦于兔子在如画环境中的行走。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“节日庆典的无人机航拍视角,画面中心是一棵灯火辉煌的圣诞树,周围环绕着欢乐的人群。场景中,五彩缤纷的烟花在树后的星空夜空中绽放。人们面带微笑并挥手致意,增添了热闹的氛围。背景是清晰闪烁、繁星点点的夜空。摄像机保持稳定的广角镜头,从上方捕捉整个场景。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“在纽约时代广场充满活力的场景中,一只体型庞大、友好的泰迪熊正在与一套完整的架子鼓 playful 地互动。这只泰迪熊有着柔软的棕色皮毛和大大的、富有表现力的黑色眼睛,它坐在凳子上,用玩具大小的鼓棒充满活力地敲击着鼓点。它的手臂有节奏地摆动,营造出一种顽皮而奇异的氛围。背景展示了时代广场繁忙的活力,包括明亮的灯光、广告牌以及过往的行人。场景采用特写视角,聚焦于泰迪熊生动的表演和多彩的环境。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个人正在风景优美的公园小径上慢跑,周围环绕着郁郁葱葱的树木和盛开的花朵。他们穿着带有反光安全元素的鲜艳运动服,面部表情专注而坚定,脸上混合着汗水和努力。慢跑者步伐稳健,手臂自然摆动。背景是清澈的蓝天和透过树叶洒下的斑驳阳光。场景从中等距离捕捉慢跑者,提供了环境和人物的平衡视角。”

图 19:Wan2.1 14B:PDD – Midpoint( ours)与 DMD2(FastGen)及具有 4 次 NFE 的 AnyFlow 对比。

27

第 28 页

图像与视频生成的并行解码蒸馏

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个人在阳光明媚的乡村田野里挖掘。他穿着一件棕色工作服夹克、蓝色牛仔裤和一顶草帽以防晒。他的脸上满是汗水,神情坚定,全神贯注于手中的工作。这个人用铲子做出有力且重复的动作,将泥土抛到一旁。田野背景中长满高高的草和散落的野花。画面采用中景镜头,聚焦于人物的上半身及其挖掘的即时区域。摄像机保持静止,以突出挖掘的连续动作。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个人在晴朗的冬日天空下,在平滑的冰面上滑冰。他戴着黑色头盔,穿着鲜红色的派克大衣,以及配套的红色手套和冰鞋。人物在冰面上优雅地滑行,双臂略微伸展以保持平衡。雪花轻轻飘落在他周围,营造出宁静而充满冬日气息的氛围。画面采用静态机位的中等镜头拍摄,强调滑冰者流畅的动作。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个充满活力的酒吧场景,设定在夜间,灯光温暖柔和。室内装饰着昏暗的霓虹灯招牌、木桌和椅子,以及一个长长的抛光吧台,吧台后面整齐地摆放着各种酒瓶。顾客们正在交谈,有的开怀大笑,有的安静地小口喝着饮料。酒保是一位面带友好微笑的中年男子,正专注地为顾客服务。场景中包含了不同种族和年龄的顾客,营造出多元化的氛围。采用静态视角的中景镜头捕捉繁忙的环境。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一只快乐、顽皮的柯基犬在日落时分的公园里奔跑嬉戏,灵感源自葛饰北斋的浮世绘风格。柯基犬摇着尾巴,表情欢快,在草丛中跳跃。背景展示了一幅宁静的风景,盛开的樱花、远处的山脉和一条宁静的河流。天空被橙色和粉色的鲜艳色调所渲染,映照出日本日落的美丽。构图遵循传统浮世绘美学,具有粗犷的轮廓和平涂的色彩。中景镜头捕捉柯基犬在如画风景中充满活力的能量。”

图 20:Wan2.1 14B:PDD – 中点( ours)与 DMD2(FastGen)及具有 4 次 NFE 的 AnyFlow 对比。

28

第 29 页

图像与视频生成的并行解码蒸馏

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个逼真、宁静的场景,一匹雄伟的棕色马正弯下身子从平静的河流中饮水。马拥有飘逸的鬃毛和尾巴,其肌肉发达的身体清晰可见。它站在河岸附近,前腿微微弯曲,口鼻部接触水面。河流反射着柔和的阳光,营造出宁静的氛围。背景展示了河岸两旁郁郁葱葱的绿草和树木,为场景增添了深度。镜头聚焦于马饮水时面部和颈部的特写,以静态镜头捕捉这一宁静时刻。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“一个人正在从高高的平台上进行惊险的蹦极跳。该人站在边缘,带着兴奋和期待的神情向下看。他们穿着全身式安全带和头盔,蹦极绳牢固地连接着。平台位于一条被茂密绿色森林环绕的河流上方,形成了戏剧性的背景。当人跳下时,镜头捕捉其下落过程,聚焦于其面部表情和周围景观。场景包括初始跳跃和随后的反弹,展示了令人兴奋的体验。先是大远景,随后在跳跃过程中转为特写。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“尤达大师(Yoda),这位标志性的绿色绝地武士,正在舞台上弹吉他的 CGI 动画。尤达身着传统的绝地长袍,表情顽皮而专注地拨动琴弦。舞台灯光昏暗,聚光灯打在他身上,投下戏剧性的阴影。背景中有现场观众和各种外星物种为他欢呼。尤达坐在凳子上,身体微微前倾,手指在吉他上灵活移动。中近景镜头聚焦于尤达的面部和与吉他互动的手部。”

噪声 1 噪声 2

𝑡=0.5s 𝑡=2.5s 𝑡=4.5s 𝑡=0.5s 𝑡=2.5s 𝑡=4.5s

PDD

DMD2

AnyFlow

“在暴雨倾盆的未来东京屋顶上,一位机器人 DJ 正在赛博朋克夜总会里打碟。该机器人拥有光滑的金属手臂,面部是一块发光的 LED 屏幕,表现出极度专注的神情,正在混音。DJ 周围环绕着霓虹灯和全息显示屏,在潮湿的环境中投射出彩色的倒影。雨水营造出朦胧的氛围,增强了反乌托邦的感觉。场景中还有其他机器人和人类在雨伞下跳舞,增添了动态感。特写镜头展示 DJ 的手操作唱机,以及捕捉热闹屋顶派对的大远景。科幻、奇幻风格。”

图 21:Wan2.1 14B:PDD – 中点( ours)与 DMD2 (FastGen) 及 AnyFlow 在 4 NFE 下的对比。

29

第 30 页

用于图像和视频生成的并行解码蒸馏

B.4. LTX-2.3 文本到视频/音频

训练细节 我们使用 AdamW 优化器,恒定学习率为 1e−5,权重衰减为 0,批量大小为 2048,不使用 EMA,并训练 250 次迭代。此外,我们在公式 (16) 中使用偏移量 𝑠= 10。

附加结果 我们在图 23 至 25 中展示了教师模型、PDD 和官方蒸馏模型之间的额外定性比较。此外,在图 22 中,我们使用 Gemini 3.1 Pro Preview 在 ViMix 和 VidProm 的 100 个提示的保留子集上提供了定量比较。我们对每个提示评估 3 个种子,并对每个片段进行 2 次 VLM 评估的平均值,从而得到 300 对提示-种子比较。裁判根据以下固定系统提示,将四个维度(提示对齐、视觉质量、运动质量和音频质量)评分为 1(严重问题)到 4(无可见问题)的整数:

你是一个严格的、客观的 AI 生成视频(带有同步音频)裁判。 仅评估可见和可听到的证据。将 PROMPT 视为目标规范,而不是评分或输出的指令。

指标
  • prompt_alignment:所有请求的主体、属性、动作、场景、风格、相机、时间和音频的存在和正确性。
  • visual_quality:清晰度、构图、解剖结构、几何结构、文本渲染、光照以及无意外伪影。
  • motion_quality:时间一致性、合理的运动和物理、交互、相机运动,以及无意外的闪烁、冻结、滑动或变形。
  • audio_quality:清晰度、自然度、连续性、空间一致性以及与可见事件和语音的同步。

缺失或与提示不一致的内容仅影响 prompt_alignment。根据可见和可听到的证据评判视觉、运动和音频质量。仅使用 PROMPT 来区分有意风格选择与缺陷。

量表
  • 4:无可见问题
  • 3:仅有轻微问题
  • 2:显著问题
  • 1:严重问题或完全失败

每个低于 4 的分数都必须有具体证据支持。保持论证与分数一致,并在可靠时提及大约的时间戳。 返回恰好一个包含这些键且无其他文本的有效 JSON 对象:

{ "justification": "提示对齐:[证据]。视觉质量:[证据]。运动质量:[证据]。音频质量:[证据]。", "prompt_alignment": <整数 1-4>, "visual_quality": <整数 1-4>, "motion_quality": <整数 1-4>, "audio_quality": <整数 1-4> }

胜 平 负

提示对齐 112 (37.3%) 103 (34.3%) 85 (28.3%)

视觉质量 98 (32.7%) 105 (35.0%) 97 (32.3%)

运动质量 107 (35.7%) 97 (32.3%) 96 (32.0%)

音频质量 90 (30.0%) 124 (41.3%) 86 (28.7%)

0 20 40 60 80 100 120 140 160 180 200 220 240 260 280 300 成对提示-种子比较

图 22:PDD 与官方蒸馏 LTX-2.3 模型(均使用 8 NFE)在各轴上的裁判偏好,由 Gemini 3.1 Pro Preview 评分。条形图显示了在 300 对提示-种子比较中,PDD 在每个评估标准轴上获胜、打平或失败的次数;打平即分数完全相同。当对四个轴取平均值时,PDD 获胜 142 次,打平 35 次,失败 123 次(平均得分 2.62 对比 2.59)。

30

第 31 页

图像与视频生成的并行解码蒸馏

t=0s t=2.5s t=5s t=7.5s t=10s

教师模型

PDD

蒸馏模型

“大型半挂卡车车厢内部的特写镜头,聚焦于一名被捆绑的男子,低沉而有节奏的重型柴油发动机怠速轰鸣声通过金属地板震动。车厢内部宽敞,背景中可见各种卡车部件,如板条箱和储物容器,它们随着车厢墙壁轻微晃动而发出嘎吱声。光线昏暗,投射出阴影以增强紧张的氛围,伴随着货舱沉闷、空洞的声学空间。该男子表情担忧,被绳索紧紧捆绑,强调了他无助的状态,呼吸急促且在安静的空间中清晰可闻。他的双手被绑在身后,坐在地板上,粗糙的麻绳在他挣扎时摩擦着他的衣物。摄像机缓慢环绕他移动,捕捉他焦虑的眼神和捆绑细节,他发出一声尖锐颤抖的呼气,然后在空旷的回声中低声问道:‘有人吗?’”

t=0s t=2.5s t=5s t=7.5s t=10s

教师模型

PDD

蒸馏模型

“一名酷似布拉德·皮特装扮成小丑的男子,面色苍白,嘴唇血红,黑发凌乱,坐在一个光线昏暗的房间里,唯一的声音是漏水管道有节奏的空洞滴水声回荡在冰冷的石墙上。他眼下有黑眼圈,露出令人畏惧的笑容,身穿紫色西装,搭配高领衬衫和领结,布料随着他姿态的变换发出轻微的沙沙声,他佝偻的姿态传达出疯狂与魅力的混合感。随着摄像机从他的脸部缓慢平移以展示周围环境,他发出一声低沉沙哑的轻笑,声音带有沙砾般令人不安的音调,然后低声问道:‘你想想知道我是怎么得到这些伤疤的吗?’他的声音在停滞的空气中显得单薄而尖锐。场景以特写到中景镜头捕捉了他目光的强度和不祥的环境,伴随着头顶老旧闪烁灯具发出的微弱低频嗡嗡声。”

t=0s t=2.5s t=5s t=7.5s t=10s

教师模型

PDD

蒸馏模型

“一名二十出头的年轻白人男子,身穿休闲T恤和牛仔裤,在公园户外开怀大笑,他响亮而真诚的笑声回荡在开阔的空气中。他双臂张开,向后倚靠,享受着阳光,微风中树叶的轻柔沙沙声伴随着他充满喜悦的喘息声。他的面部表情生动,眼角皱纹,笑容灿烂,传达出真正的快乐,他发出一声明亮而自发的‘哈!太棒了!’。背景包括绿草、树木和清澈的蓝天,远处微弱的鸟鸣声融入了公园的环境氛围中。摄像机从展示公园环境的大远景开始,然后推近聚焦于该男子富有表现力的面部,捕捉他笑声的节奏韵律,中景镜头动态地框住了他极具感染力的欢乐。”

图 23:LTX-2.3 教师模型(4×30 NFE)与 PDD(8 NFE)与官方蒸馏模型(8 NFE)的对比。

31

第 32 页

图像与视频生成的并行解码蒸馏

t=0s t=2.5s t=5s t=7.5s t=10s

教师

PDD

蒸馏模型

“一个充满活力的水下场景,色彩斑斓的鱼在水中优雅地舞动,伴随着沉闷而有节奏的水流置换声和它们运动时微弱的、气泡般的咕噜声。鱼身上闪烁着光泽的鳞片和有表现力的鳍,表演着同步的舞蹈动作,游泳时发出柔和的水流声。它们的动作流畅而动态,偶尔的翻转和旋转增添了活泼的氛围,其间点缀着光线穿过波浪时折射出的清脆叮当声。背景展示了珊瑚礁,柔软的流动海藻和远处游动的明亮热带鱼,背景是低频的宁静水下嗡嗡声。摄像机以平滑的跟踪镜头跟随鱼,从不同角度捕捉它们优雅的舞蹈,包括展示喜悦和兴奋表情的面部特写,而声学空间依然广阔且身临其境,充满了深海中空灵、共鸣的寂静。”

t=0s t=2.5s t=5s t=7.5s t=10s

教师

PDD

蒸馏模型

“在一个充满活力和色彩的演播室环境中,主持人是一位快乐且精力充沛的成年人,站在一个色彩缤纷的背景前,背景上有各种形状和原色物体,伴随着儿童节目明亮、轻快的背景音乐在背景中轻柔播放。主持人穿着一件明亮、有趣的主题T恤,脸上洋溢着热情的笑容,随着他们的动作,衣服发出轻微的沙沙声。他们兴奋地对镜头说话,充满活力地挥手,手掌拍击的声音在演播室明亮的声学空间中回荡。主持人用温暖、高能量的语气说:“你好,孩子们!”他们短暂地停顿,露出灿烂的笑容,然后继续说:“欢迎来到另一期精彩的‘趣味学习’节目。今天,我们将探索令人惊叹的色彩世界!”摄像机推近主持人的面部,捕捉他们生动的表情和手势,通过动态的手势和俏皮的面部表情与观众互动。随着背景从静态图像平滑过渡到代表不同颜色的动画元素,每个新图形都伴随着微妙的、魔法般的“砰”和“呼啸”音效,增强了教育 yet 有趣的氛围。”

t=0s t=2.5s t=5s t=7.5s t=10s

教师

PDD

蒸馏模型

“在《超凡蜘蛛侠》的这个场景中,标志性的超级英雄蜘蛛侠正在与一名女子交谈。蜘蛛侠身穿标志性的红蓝战衣,面向那名有着金色长发的女子,而远处城市交通的低频嗡嗡声从下方的街道升起,由于他们位于屋顶的高度而被隔绝。场景设定在城市屋顶,天空多云,风在他们周围轻柔地呼啸,女子抬头看着他,声音清晰而诚恳地说:“你不必独自承担这一切。”随后是一阵短暂而沉重的沉默。蜘蛛侠调整重心,随着他的叹息,战衣面料细微而有节奏的吱嘎声清晰可闻,然后他以低沉、沙哑且略带紧张的声音回答:“……我必须这么做。”光线暗示是下午晚些时候,声学空间感觉广阔而开放,承载着远处城市微弱、回荡的警笛声,当他们站在这一 intense、重要的交流时刻时。”

图 24:LTX-2.3 教师模型(4×30 NFE)与 PDD(8 NFE)与官方蒸馏模型(8 NFE)的对比。

32

第 33 页

用于图像和视频生成的并行解码蒸馏

𝑡=0s 𝑡=2.5s 𝑡=5s 𝑡=7.5s 𝑡=10s

教师模型

PDD

蒸馏模型

“超写实的电影镜头,白天一只外星UFO飞过纽约市,伴随着低频、有节奏的嗡嗡声在空气中震动,以及它排开风时发出的尖锐、金属般的呼啸声。UFO发出动态的光效,投射出戏剧性的阴影,并以Summilux镜头效果照亮建筑物,而远处沉闷的城市交通和警笛声则逐渐被飞行器强大、汹涌的推进噪音所掩盖。摄像机以平滑的跟踪镜头跟随UFO,捕捉其光滑的金属表面和鲜艳的霓虹光泽,当它快速经过帝国大厦和中央公园等标志性地标时,伴随着微弱的高频电子嗡嗡声。视频以25fps拍摄,提供流畅且身临其境的体验,特写和中景角度展示了UFO在繁忙的城市景观中导航时的复杂细节,随着飞行器从头顶飞过,城市的环境音在广阔的空间声学中回响并发生变化。”

𝑔=0s 𝑡=2.5s 𝑡=5s 𝑡=7.5s 𝑡=10s

教师模型

PDD

蒸馏模型

“一位面带微笑的年轻女子自信地站在茂密的森林中,空气中充满了树叶轻柔、有节奏的沙沙声,以及远处鸣禽悦耳的啁啾声在开阔的林地中回荡。她皮肤白皙,绿眼睛,长长的波浪金发自由飘逸,随着她深吸一口新鲜空气而捕捉光线。她穿着休闲装,包括一件浅绿色衬衫和橄榄绿工装裤,当她双臂轻轻摆动时,布料轻轻飘动。森林里长满了高大的树木,斑驳的阳光透过树冠过滤下来,她的脚步在长满苔藓的地面上发出柔和、沉闷的嘎吱声。摄像机以中近景角度捕捉她,聚焦于她快乐的表情,当她发出一声满足、轻盈的叹息时,宁静的环境充满了微风穿过树枝的和平、身临其境的声音。”

𝑡=0s 𝑡=2.5s 𝑡=5s 𝑡=7.5s 𝑡=10s

教师模型

PDD

蒸馏模型

“手绘动画,采用梵高风格,主角是一只表情丰富、笑容灿烂的绿色青蛙,伴随着蟋蟀轻柔、有节奏的鸣叫声,以及微风拂过向日葵叶片时发出的微弱、空灵的嗡嗡声。青蛙坐在一片鲜艳的向日葵田中,头顶是充满星星的旋转天空,其皮肤显示出纹理笔触效果,似乎随着远处独奏大提琴演奏的忧郁而宁静的旋律的柔和、悦耳的起伏而振动。背景展示了夜空,蓝色和紫色的旋转图案与金色的向日葵田无缝融合,而摄像机则放大青蛙生动的面部,它直视观众并发出一声柔和、低沉、共鸣的呱呱声,在繁星之夜广阔、开放的空间声学中略有回响。”

图25:LTX-2.3教师模型(4×30 NFE)与 PDD(8 NFE)与官方蒸馏模型(8 NFE)的对比。

33

第 34 页

用于图像和视频生成的并行解码蒸馏

C. 与流映射的联系

与 PDD 不同,流映射 [44, 14, 4, 72] 使用连续时间。它们通过在流过程 (1) 的任意两个时间点 $t$ 和 $s$ 上进行条件设定,来定义平均速度 (4)。对于时间 $t \in [0, 1]$ 的状态 $X_t = x_t$,到达时间 $s > t$ 的平均速度为

$$ u_{t,s}(x_t) = \frac{1}{s-t} \int_t^s v_r(x_r) dr. \quad (18) $$

流映射 [4, 72] 的拉格朗日表述与我们的 PDD 相似,因为它在训练期间也采用近策略近似。然而,为了学习固定区间 $[t_n, t_{n+L}]$ 的平均速度,我们将其离散化为 $L$ 个区间(一个块)$t_n < \dots < t_{n+L}$,并直接对每个区间内的速度数值积分进行回归,而拉格朗日流映射则是将位移的导数回归到速度上。

$$ \mathcal{L}(\theta) = \mathbb{E} \left[ \left\| (s-t_n)u_{\theta, t_n, s}(X_{t_n}) – v_s \left( \text{sg} \left( X_{t_n} + (s-t_n)u_{\theta, t_n, s}(X_{t_n}) \right) \right) \right\|^2 \right], \quad s \sim U[t_n, t_{n+L}]. \quad (19) $$

事实上,对公式 19 中范数内的表达式关于 $s$ 进行积分,会得到连续时间下的类 PDD 目标函数 (11)。

重要的是,公式 19 是固定区间上的一个示例。在实践中,流映射使用训练目标函数来学习任意区间 $[t, s] \subseteq [0, 1]$ 的平均速度:

$$ \mathcal{L}(\theta) = \mathbb{E} \left[ \left\| (s-t)u_{\theta, t, s}(X_t) – v_s \left( \text{sg} \left( X_t + (s-t)u_{\theta, t, s}(X_t) \right) \right) \right\|^2 \right]. \quad (20) $$

D. 证明

命题 1 的证明。考虑从步骤 $n \le N-L$ 开始的块,并令 $X_n \sim p_{t_n}$。假设 PD 目标函数是可实现的,即其全局最小值为零,并令 $\theta^\star$ 为 PD 损失 (11) 的全局最小值点。那么,对于每个 $k \in \{n, \dots, n+L-1\}$,我们有:

$$ \left\| \bar{u}_{\theta^\star, n}(k | X_n) – u_k (\bar{X}_k) \right\|^2 = 0. \quad (21) $$

因此,

$$ \bar{u}_{\theta^\star, n}(k | X_n) = u_k (\bar{X}_k). \quad (22) $$

并行解码条件 (8) 要求沿由精确解 (3) 定义的教师轨迹 $X_k$ 相等。我们证明公式 22 意味着在整个块 $k = n, \dots, n+L-1$ 中 $\bar{X}_k = X_k$。

将公式 22 代入并行化过程 (9) 中得到:

$$ \bar{X}_{k+1} = \bar{X}_k + (t_{k+1} – t_k)u_k (\bar{X}_k), \quad \bar{X}_n = X_n. \quad (23) $$

基本情况为 $\bar{X}_n = X_n$。假设对于某个 $k \in \{n, \dots, n+L-2\}$,有 $\bar{X}_k = X_k$。那么

$$ \bar{X}_{k+1} = X_k + (t_{k+1} – t_k)u_k(X_k) \quad (24) $$ $$ = X_{k+1}, \quad (25) $$

其中最后一个等式源于精确解 (3)。通过归纳法,对于所有 $k \in \{n, \dots, n+L-1\}$,有 $\bar{X}_k = X_k$。

34

发表评论