流模型OPD为何失效?FLOWCTS揭示时序监督错配与连续轨迹解法

快速导读:提出FLOWCTS方法,通过匹配从相同学生访问状态出发的学生与参考轨迹,解决流模型中基于KL散度的在线蒸馏(OPD)存在的时序监督错配问题,在GenEval、OCR和PickScore指标上均优于基线。

流模型(Flow Models)已成为文本到图像生成的主流范式,但在后训练阶段,如何高效地将专家模型的知识蒸馏给学生模型仍是一个挑战。传统的在线蒸馏(On-Policy Distillation, OPD)在自回归模型中表现优异,但直接迁移到流模型时,基于KL散度的目标函数暴露出严重的时序监督错配问题。

FLOWCTS(Flow Continuous Trajectory Supervision)提出了一种新的视角:不再关注单步的分布差异,而是从连续轨迹监督的角度出发,匹配从相同学生访问状态出发的学生与参考轨迹。该方法通过积分关系推导速度匹配上界,并离散化为可训练的目标,显著提升了生成质量。

英文题目:FLOWCTS: On-Policy Continuous Trajectory Supervision of Flow Models

论文出处:arXiv 每日论文精选 · arXiv:2607.24522

原始论文:PDF / 论文页面

对应视频标题:流模型OPD为何失效?FLOWCTS揭示时序监督错配与连续轨迹解法|推荐指数:★★★★★

这篇论文解决什么问题?

在自回归模型中,OPD利用链式法则将序列级KL散度分解为下一步条件分布的监督,这天然契合自回归的生成过程。然而,流模型通过连续速度场建模从噪声到数据的轨迹,缺乏自然的‘下一步’因子分解。

现有工作如Flow-OPD尝试通过辅助SDE转换核来构建KL目标,但这导致了时序权重偏差。分析显示,KL损失强烈集中在去噪过程的末端(接近图像生成完成时),而学生模型与参考专家模型之间最大的速度场差异实际上发生在去噪的早期阶段。这种错配导致早期关键的结构信息未能得到充分校正。

此外,早期去噪阶段的扰动对最终生成结果的全局结构影响更大,正如TempFlow-GRPO所指出的。因此,忽略早期监督信号会限制模型在形状、空间关系等结构性任务上的表现。

核心创新

  • 从连续轨迹监督视角提出FLOWCTS,解决了流模型OPD中缺乏自然下一步分布的问题。
  • 推导了基于轨迹的速度匹配上界,并离散化为可训练的离散目标,引入监督步数K作为新的缩放维度。
  • 揭示了基于KL的OPD存在时序监督错配,即KL损失集中在去噪末端,而最大速度差异出现在早期去噪阶段。
  • 将FLOWCTS扩展至在线蒸馏(OPD)和离线监督微调(SFT)两种设置,并验证了其有效性。

方法概览

提出Flow Continuous Trajectory Supervision (FLOWCTS),从连续轨迹监督视角重新定义OPD。通过积分关系推导轨迹差异的速度匹配上界,并离散化为由监督步数K参数化的实际目标。该方法匹配从同一学生访问状态出发的学生和参考轨迹,涵盖单状态速度匹配(K=1)和多步轨迹监督(K>1)。

  • FLOWCTS的核心思想是连续轨迹监督。它不直接最小化单步KL散度,而是考虑从同一学生访问状态(Student-Visited State)出发的学生轨迹与参考轨迹之间的差异。
  • 通过积分关系,论文推导了轨迹差异的速度匹配上界。这一上界在时间上是加权的,能够更均匀地分配监督信号,避免KL目标在时间末端的过度集中。
  • 为了实际训练,该上界被离散化为由监督步数K参数化的目标。当K=1时,退化为单状态速度匹配;当K>1时,涵盖多步轨迹监督,允许模型利用更长的轨迹信息。
  • 该方法不仅适用于在线蒸馏(OPD),还扩展到了离线监督微调(SFT)设置,展示了其通用性。在构建在线状态时,使用SDE采样而非ODE采样被证明更有效,特别是在训练早期,因为随机探索有助于覆盖更广泛的状态分布。

逐图理解论文

直觉与失效

直觉与失效
Figure 4: Temporal signal allocation in KL-based OPD. Both horizontal axes denote normalized denoising progress from noise to image. The two quantities are computed from the same student- visited states and training observations. (a) Effective per-step KL loss: wKL(t)∥vθ(xt, t, c) − vref(xt, t, c)∥2

图4揭示了KL-based OPD的时序信号分配错配。左图显示KL损失集中在去噪末端,而右图显示最大速度场差异发生在早期去噪阶段。这种错配导致早期关键结构信息未能得到充分校正,是FLOWCTS旨在解决的核心问题。

核心区分

核心区分
Figure 2: Autoregressive OPD and trajectory-level supervision for flow models. In autoregres- sive models, sequence-level reverse KL decomposes by the chain rule into next-token supervision at student-generated prefixes. Since flow models do not naturally admit an analogous next-step fac- torization, FlowCTS instead matches student and reference trajectories initialized from the same student-visited state. Using the integral relation between trajectories and velocity fields, we derive a temporally weighted velocity-matching upper bound and discretize it into practical objectives pa- rameterized by the supervision steps K, with K=1 recovering single-state velocity matching.

图2对比了自回归OPD与流模型的轨迹级监督。注意自回归模型通过链式法则分解为下一步监督,而流模型缺乏自然因子分解。FLOWCTS通过匹配从相同学生访问状态出发的轨迹,利用积分关系推导速度匹配上界,并离散化为由K参数化的目标。

最强结论

最强结论
Table 1: Main results for multi-reference on-policy distillation and its off-policy supervision ex- tension. Higher values are better for all metrics. Bold and underlined values indicate the best and second-best results within each supervision setting, respectively.

表1展示了多参考在线蒸馏的主要结果。FLOWCTS-OPD在GenEval、OCR和PickScore上均优于Vanilla OPD,表明轨迹监督能更好地平衡多目标对齐,避免专家模型间的性能权衡。

实验如何设计?

  • 实验主要在SD3.5-Medium基础上进行,对比Vanilla OPD(基于KL)和Flow-GRPO基线。
  • 评估指标包括GenEval(生成评估)、OCR(光学字符识别)和PickScore(人类偏好评分),以全面衡量结构对齐、文本准确性和视觉质量。
  • 在T2I-CompBench上评估分布外组合生成能力,特别关注形状、空间关系、数值能力、颜色和纹理。
  • 分析监督步数K对性能的影响,以及时序信号分配的差异,揭示不同时间步的监督权重变化。

关键结果与论文证据

  • 在GenEval上,FLOWCTS-OPD达到0.93,优于Vanilla OPD的0.90(第6页)。这表明轨迹监督能更好地对齐生成内容与提示。
  • 在OCR任务上,FLOWCTS-OPD达到0.92,同样优于Vanilla OPD的0.90(第6页)。这得益于早期去噪阶段对文本结构的更好校正。
  • 在T2I-CompBench上,FLOWCTS-OPD在形状(0.6285 vs 0.6211)和数值能力(0.6909 vs 0.6840)上显著提升,但在颜色和纹理上提升有限(第8页)。这与时序分析一致:早期监督主要影响全局结构。
  • 监督步数K=2时性能最佳,K>2后性能波动或下降。这表明轨迹信息丰富度与优化难度之间存在权衡,并非K越大越好。

阅读时需要注意

  • 增加监督步数K并不带来一致的性能提升,K=2后性能出现波动,需仔细调参。
  • 在颜色和纹理等视觉属性上,FLOWCTS的优势不明显,可能因为早期去噪对全局结构的影响大于局部细节。
  • 较长的监督视界可能抑制细粒度细节,导致感知偏好(如PickScore)略有下降,需平衡结构一致性与细节保留。

关联工作

  • Flow-OPD是基于KL散度的流模型在线蒸馏基线,存在时序监督错配问题。
  • Flow-GRPO是基于在线策略梯度优化的流模型基线,提供任务特定的参考模型。
  • DanceOPD是同期工作,采用直接速度匹配,但FLOWCTS从连续轨迹差异推导目标族并深入分析时序错配。
  • TempFlow-GRPO指出早期去噪扰动对最终生成结果影响更大,支持FLOWCTS的时序分析结论。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

预印本

FLOWCTS:流模型的在线连续轨迹监督

Kaiyang Ye1∗, Yuan Ge1∗, Junxiang Zhang1, Bei Li1, Ziming Zhu1, Haishu Zhao1, Xiaoqian Liu1, Chenglong Wang1,2, Jingbo Zhu1,2, Zhengtao Yu3, Tong Xiao1,2† 1 东北大学 2 NiuTrans 研究 3 昆明理工大学

摘要

尽管在线蒸馏(OPD)有效解决了大语言模型后训练中的稀疏奖励和暴露偏差问题,但其向流模型的扩展仍未得到充分探索。为此,我们提出了流连续轨迹监督(FLOWCTS),该方法匹配从同一学生访问状态初始化的后续学生轨迹和参考轨迹。利用轨迹与速度场之间的积分关系,我们推导出了时间加权的速度匹配上界,并将其离散化为由监督步数参数化的实际目标。在多参考设置下,单状态 FLOWCTS-OPD 比传统的基于 KL 的 OPD 具有更快的收敛速度。FLOWCTS-OCR 在 OCR 任务上从 0.90 提升至 0.92,在 GenEval 上从 0.90 提升至 0.93,在 PickScore 上从 22.75 提升至 23.06,同时在所有目标指标上优于混合奖励强化学习基线。进一步分析揭示了传统基于 KL 的 OPD 中由于辅助 SDE 转移核引起的明显时序监督错配。特别是在 OCR 设置上,虽然 FLOWCTS 随着监督步数的增加持续优于基线,但也表现出更丰富的轨迹信息与更大的优化难度之间的权衡。

1 引言 [cs.LG]

Qwen3、MiMo-v2 和 GLM-5 最近将其部分后训练增益归因于一种新兴范式:在线蒸馏(OPD)(Yang et al., 2025; Xiao et al., 2026; Zeng et al., 2026)。如图 2 (a) 所示,这种方法结合了在线训练与密集的参考监督 (Agarwal et al., 2024; Gu et al., 2024)。尽管其训练动力学尚未完全被理解,但这些成功凸显了 OPD 对未来生成模型开发的价值 (Li et al., 2026c; Hou et al., 2026)。在模仿学习中,众所周知,学习到的策略从其诱导的状态分布下进行训练,而非从专家遇到的分布下进行训练,从而受益 (Ross & Bagnell, 2010; Ross et al., 2011)。这有助于从错误中恢复并帮助减少累积误差。此外,OPD 通过在学生的 rollout 分布上进行训练并提供密集的令牌级参考监督,从而减少对稀疏结果奖励的依赖,提供了此类益处 (Lu & Lab, 2025; Ma et al., 2026a; Yang et al., 2026)。受此启发,本研究探讨如何为流模型有效地制定密集的 OPD 监督。

为此,我们首先回顾基于令牌自回归语言模型中的监督形式 (Gu et al., 2024; Li et al., 2026c),其原始目标最小化给定提示下学生与参考的输出序列分布之间的序列级反向 KL 散度。语言建模的链式法则分解将此目标精确分解为学生生成前缀上有限词汇表的下一个令牌监督 (Agarwal et al., 2024; Wen et al., 2023)。然而,流模型参数化连续速度场以建模从噪声到数据的连续状态轨迹,缺乏自然的下一步条件分布 (Lipman et al., 2022; Liu et al., 2022; Tong et al., 2023; Liu et al., 2023; Kornilov et al., 2024; Frans et al., 2025; Geng et al., 2026)。这促使我们重新审视 OPD 中序列监督的本质,将监督目标从下一步分布转移到轨迹本身。

∗ 同等贡献。 † 通讯作者。

1

第 2 页

预印本

Vanilla Geneval OCR Pickscore FLOWCTS SD-3.5-M OPD Expert OPD

一张斑马和 床的照片

一辆现代赛车, 拥有光泽的黑色 外观,引擎盖上 有醒目的红白 贴纸,上面写着 “Speed Demon 5000”。

月球上的袋鼠, 未来主义,外星, 好奇,科幻插画, 大胆,动态,霓虹 色彩,数字艺术

一张西兰花和 花瓶的照片

一颗金橡果 旁边是一棵橡 树,位于一个巨 大的六边形内

图 1:生成图像的定性比较。与之前的方法相比,我们的方法 FLOWCTS-OPD 生成了具有更好对齐性和视觉质量的图像。

因此,我们提出了 Flow Continuous Trajectory Supervision (FLOWCTS),它监督从同一共享状态演化的学生与参考连续轨迹之间的差异。FLOWCTS-OPD 在在线策略设置中实例化了这一目标,其中共享起始状态是从当前学生的 rollout 中采样的。我们进一步将连续轨迹监督的上界推导为可处理的优化目标,并将其离散化为有限数量的优化步骤。离散化的目标由监督步骤数 K 参数化,涵盖了单状态速度匹配和多步轨迹监督。在在线策略设置中,单状态 FLOWCTS-OPD 比传统的基于 KL 的 OPD 具有更快的收敛速度。具体而言,它将 GenEval 从 0.90 提高到 0.93,OCR 从 0.90 提高到 0.92,PickScore 从 22.75 提高到 23.06,同时显示出更好的分布外泛化能力。定性示例如图 1 所示。进一步分析揭示了传统基于 KL 的 Flow-OPD 中存在明显的时序监督错配,该方法通过辅助 SDE 构建转移核。

更广泛地说,FLOWCTS 并不限制共享起始状态的采样方式。当起始状态由离线策略数据轨迹构建时,相同的公式扩展到 FLOWCTS-SFT。实验表明,FLOWCTS-SFT 在总分上始终优于传统 SFT,其中 OCR 的提升最为显著。虽然增加监督步骤并未带来一致的提升,但 FLOWCTS 为流模型提供了一种新的缩放定律维度,以丰富的轨迹信息换取更大的优化难度。总之,我们的贡献如下:

• 我们率先探索了流模型的密集在线策略监督。重新审视语言建模中 OPD 序列监督的本质,我们从连续轨迹监督的角度提出了 FLOWCTS。

• FLOWCTS 的离散化目标涵盖了单状态和多步监督,将监督步骤作为流模型的新缩放维度引入。

• 我们将 FLOWCTS 扩展到在线策略蒸馏和离线 SFT 设置,实验验证了其在两种设置中的有效性。

2

第 3 页

预印本

• 我们将 FLOWCTS 的优势归因于早期去噪阶段中的密集监督,此时学生模型与参考模型之间的差异最大。相比之下,基于 KL 散度的 FlowOPD 将监督集中在后期阶段,并因此受到时序监督错配的影响。

2 预备知识

在本节中,我们首先回顾流匹配和标准的在线蒸馏(On-Policy Distillation, OPD),这两者共同激发了我们基于轨迹的 OPD 公式化方法。

流匹配。流匹配通过常微分方程(ODE)定义数据分布与噪声分布之间的传输轨迹。形式上,令 $x_0 \sim p_{\text{data}}$ 为数据样本,$x_1 \sim p_{\text{noise}} = \mathcal{N}(0, I)$ 为噪声样本。传输轨迹通常由线性插值定义 (Liu et al., 2022):

$$x_t = (1 – t)x_0 + tx_1, \quad t \in [0, 1]. \quad (1)$$

该轨迹满足 ODE $dx_t = v_t(x_t, t)dt$,在线性路径下,条件目标速度为 $u_t(x_t | x_0, x_1) = dx_t/dt = x_1 – x_0$。流匹配通过最小化以下损失来训练神经速度场 $v_\theta(x_t, t)$:

$$\mathcal{L}_{\text{FM}}(\theta) = \mathbb{E}_{t, x_0, x_1} \|v_\theta(x_t, t) – (x_1 – x_0)\|^2. \quad (2)$$

在线蒸馏。OPD 对由当前学生模型生成的样本提供参考监督。给定提示 $x \sim \mathcal{D}_x$,学生模型采样响应 $\hat{y}_{1:T} \sim \pi_\theta(\cdot | x)$。在每个学生生成的前缀 $(x, \hat{y}_{<t})$ 处,学生模型和参考模型定义了下个 token 的分布 $p_t^\theta(\cdot) = \pi_\theta(\cdot | x, \hat{y}_{<t})$ 和 $p_t^T(\cdot) = \pi_T(\cdot | x, \hat{y}_{<t})$。

标准的 OPD 目标最小化学生模型与参考模型之间的序列级反向 KL 散度:

$$\mathcal{L}_{\text{OPD}}(\theta) = \mathbb{E}_{x \sim \mathcal{D}_x} [D_{\text{KL}} (\pi_\theta(\cdot | x) \| \pi_T(\cdot | x))]. \quad (3)$$

通过自回归分解,该目标可以写为学生生成前缀上 token 级 KL 散度项之和:

$$\mathcal{L}_{\text{OPD}}(\theta) = \mathbb{E}_{x \sim \mathcal{D}_x, \hat{y}_{1:T} \sim \pi_\theta(\cdot|x)} \sum_{t=1}^T D_{\text{KL}} (p_t^\theta \| p_t^T). \quad (4)$$

与自回归模型不同,自回归模型的序列分解自然产生用于局部匹配的下个 token 条件分布;而流模型通过从噪声到数据的连续状态轨迹生成样本,并不原生提供这种下一步分布。然而,给定相同的访问状态,学生模型和参考模型定义了不同的后续轨迹。这一观察结果促使我们通过匹配它们在有限时间区间内的后续演化,在轨迹层面公式化 OPD。

3 流模型 OPD 的连续轨迹视角

在本节中,我们从连续轨迹的视角研究如何为流匹配模型公式化 OPD,如图 2 所示。在 OPD 下,我们首先沿当前学生模型的生成轨迹采样一个学生访问状态 $x_t$。从该状态出发,学生和参考速度场诱导两条后续轨迹。我们公式化它们的差异,推导一个可处理的基于速度的上界,并将其离散化为一族实用的训练目标。我们进一步讨论相同的公式化方法如何扩展到非策略起始状态。

3.1 轨迹层面的公式化

我们从反向时间区间的轨迹层面公式化开始。令 $0 \le t_e \le t_s \le 1$,其中 $t_s$ 和 $t_e$ 分别表示该区间的开始和结束时间。令 $\Phi_\theta^{t_s \to t}$ 和 $\Phi_{\text{ref}}^{t_s \to t}$ 分别表示由学生模型和参考速度场诱导的流映射。给定一个

3

第 4 页

预印本

序列级目标:$KL(\pi_{\theta}^{y|x} \| \pi_{T}^{y|x})$ 轨迹级目标:$-\int_{t_e}^{t_s} \|x_t^\theta – x_t^{ref}\|^2 dt$

$y = (y_1, y_2, \dots, y_T)$ $x_t^\theta$ 提示轨迹 学生 学生 $y_1$ $y_2$ $y_3$ ••• $y_T$ $x_t^s$ 差异

学生访问 噪声状态 $x_t^{ref}$ $x_t^s$ 参考 $\pi_{\theta}^{y|x}$ KL $\pi_{T}^{y|x}$ 链 法则 $x_1$ $x_0$ 积分 ODE

在学生前缀处的下一个词元监督 从同一学生状态出发的轨迹匹配 前缀 前缀 K=1 K=2,3,… 提示 $x$ $y_1$ 提示 $x$ $y_1$ $y_2$ 速度匹配(单状态) 多步监督 预测 预测 $x_t^s$ $x_t^s$ 学生 $\pi_\theta$ 教师 $\pi_T$ $y_2$ 学生 $\pi_\theta$ 教师 $\pi_T$ $y_3$ $V_\theta(x_t^s, t_s)$

KL ••• KL $\| V_\theta – V_{ref} \|^2$ •••

$V_{ref}(x_t^s, t_s)$

(a) 自回归语言模型 (b) 流模型

图 2:自回归 OPD 和流模型的轨迹级监督。在自回归模型中,序列级反向 KL 散度通过链式法则分解为学生生成前缀处的下一个词元监督。由于流模型本身不具备类似的下一步分解,FlowCTS 改为匹配从同一学生访问状态初始化的学生和参考轨迹。利用轨迹与速度场之间的积分关系,我们推导出了时间加权的速度匹配上界,并将其离散化为由监督步数 $K$ 参数化的实际目标,其中 $K=1$ 恢复为单状态速度匹配。

起始状态 $x_{ts}$ 和条件 $c$,对应的轨迹为 $x_t^\theta = \Phi_{t_s \to t}^\theta(x_{ts}, c)$ 和 $x_t^{ref} = \Phi_{t_s \to t}^{ref}(x_{ts}, c)$。它们的差异定义为:

$$ L_{CTS}(\theta) = \mathbb{E}_{x_{ts}, c} \int_{t_e}^{t_s} \|x_t^\theta – x_t^{ref}\|^2 dt. \quad (5) $$

我们将这种轨迹级公式称为连续轨迹监督(Continuous Trajectory Supervision, CTS)。当起始状态 $x_{ts}$ 从当前学生 rollout 中采样时,它定义了一个在线蒸馏(On-Policy Distillation, OPD)目标;当它由离线数据轨迹构建时,它定义了一个离线监督目标。

3.2 基于速度的上界

流轨迹是通过积分依赖于时间的速度场生成的 (Lipman et al., 2022; Liu et al., 2022)。因此,学生轨迹与参考轨迹之间的差异由它们速度之间累积的不匹配决定。基于这种关系,我们推导出了轨迹损失的加权速度匹配上界,从而得到一个直接定义在模型输出上的可处理目标。

具体而言,由于两条轨迹都从同一状态 $x_{ts}$ 开始,它们在任意 $t \in [t_e, t_s]$ 的状态是通过积分相应的速度场获得的: $$ x_t^\theta = x_{ts} – \int_{t}^{t_s} v_\theta(x_r^\theta, r, c) dr, \quad x_t^{ref} = x_{ts} – \int_{t}^{t_s} v_{ref}(x_r^{ref}, r, c) dr. \quad (6) $$

将两个方程相减得到: $$ x_t^\theta – x_t^{ref} = – \int_{t}^{t_s} v_\theta(x_r^\theta, r, c) – v_{ref}(x_r^{ref}, r, c) dr. \quad (7) $$

该恒等式表明,轨迹差异源于积分路径上累积的速度不匹配。这导致了以下加权速度匹配上界,我们称之为速度上界(Velocity Upper Bound, VUB): $$ L_{CTS}(\theta) \le L_{VUB}(\theta) = \mathbb{E}_{x_{ts}, c} \int_{t_e}^{t_s} w(r) \| v_\theta(x_r^\theta, r, c) – v_{ref}(x_r^{ref}, r, c) \|^2 dr, \quad (8) $$

4

第 5 页

预印本

$dt = (t_s – t_e)^2 – (t_s – r)^2 / 2$。其中轨迹衍生权重为 $w(r) = \frac{1}{R} \int_{t_s}^{t_e} \frac{t_s – t}{t_s – r} dt$。该权重源于轨迹界限而非人工设计。它从段尾 $t_e$ 处的零值增加到段首 $t_s$ 处的最大值,为更接近 $t_s$ 的速度误差分配更大的权重,因为它们影响更长的后续轨迹。完整推导见附录 A。

3.3 离散训练目标

我们现在将反向时间区间 $[t_e, t_s]$ 离散化为 $K$ 个欧拉步。令 $h = (t_s – t_e)/K$,并定义 $t_i = t_s – ih$,其中 $i = 0, \dots, K$。从相同的状态 $x_{\theta 0} = x_{\text{ref } 0} = x_{t_s}$ 开始,学生和参考 rollout 分别为

$$x_{\theta i+1} = x_{\theta i} – h v_\theta(x_{\theta i}, t_i, c), \quad x_{\text{ref } i+1} = x_{\text{ref } i} – h v_{\text{ref}}(x_{\text{ref } i}, t_i, c), \quad (9)$$

其中 $i = 0, \dots, K-1$。将相同的误差累积论证应用于离散轨迹,得出以下实际目标:

$$L_{\text{CTS}}^{(K)}(\theta) = \mathbb{E}_X \sum_{i=0}^{K-1} \alpha_i \| v_\theta(x_{\theta i}, t_i, c) – v_{\text{ref}}(x_{\text{ref } i}, t_i, c) \|^2, \quad (10)$$

其中 $\alpha_i = [K(K+1) – i(i+1)]/2$,$i = 0, \dots, K-1$ 是轨迹衍生的离散权重。它反映了第 $i$ 步的速度失配在后续轨迹中的累积情况。我们提供未归一化的权重以明确其相对权重,并在实现中将其归一化为总和为一。完整推导见附录 B。

当起始状态从当前学生的 rollout 中采样时,所得公式定义了一族由监督步数 $K$ 参数化的 OPD 目标。对于 $K=1$,我们有 $\alpha_0 = 1$,目标简化为在单个学生访问状态处的速度匹配。对于 $K > 1$,监督扩展到学生和参考轨迹上的多个后续状态。因此,$K$ 显式地控制监督沿轨迹延伸的距离,我们在第 4.3 节中通过实验研究其影响。当起始状态由离策略数据轨迹构建时,相同的公式产生相应的离策略监督目标。

4 实验

4.1 实验设置

在线策略设置。我们基于 SD3.5-Medium (Esser et al., 2024) 在多参考 OPD 设置中评估 FlowCTS。我们将 GenEval、OCR 和 PickScore 视为目标能力,并使用相应的官方发布的任务特定 Flow-GRPO 检查点作为参考 (Liu et al., 2026a),无需额外模型。对于每个小批量,提示从特定目标的提示集中采样并路由到相应的参考模型,而学生访问状态使用 Flow-GRPO 中采用的 SDE rollout 过程生成。所有 OPD 变体共享相同的提示混合、rollout 过程、参考路由、优化超参数和推理配置。我们在附录 C.3 中比较了 SDE 和 ODE rollout。

离策略 SFT 设置。我们进一步在离策略设置中评估 FlowCTS。起始状态和目标轨迹由从 Fine-T2I (Ma et al., 2026b) 采样的 50K 图像-文本对构建。我们使用 SD3.5-Medium 作为基础模型,并在相同的优化设置下使用 LoRA 训练 Vanilla SFT 和所有离策略变体。

基线。对于在线策略设置,我们报告预训练的 SD3.5-Medium,并将 FLOWCTS-OPD 与三组竞争性基线进行比较:(1) 单任务参考,包括针对 GenEval、OCR 和 PickScore 专门化的任务特定 Flow-GRPO 模型;(2) 多目标强化学习,由 Flow-GRPO-Mix 代表,它联合优化三个目标能力;(3) 基于 KL 的 OPD,按照 Flow-OPD (Fang et al., 2026) 的转换核 KL 目标实现为 Vanilla OPD。对于离策略设置,具有单状态速度监督的 Vanilla SFT 作为基线。

5

第 6 页

预印本

表 1:多参考在线蒸馏及其离线监督扩展的主要结果。所有指标均为越高越好。加粗和下划线值分别表示每种监督设置内的最佳和次佳结果。

方法 GenEval ↑ OCR ↑ PickScore ↑ Overall ↑

I. 在线多目标对齐 预训练模型 SD3.5-Medium 0.63 0.59 21.72 0.685

强化学习基线 FlowGRPO (GenEval) 0.93 0.65 21.60 0.804 FlowGRPO (OCR) 0.66 0.92 21.74 0.805 FlowGRPO (PickScore) 0.51 0.70 23.25 0.701 FlowGRPO (混合奖励) 0.73 0.83 21.84 0.800

基于 KL 的在线蒸馏 Vanilla OPD w/ KL (K = 1) 0.90 0.90 22.75 0.890

单步速度监督 FLOWCTS-OPD (K = 1) 0.93 0.92 23.06 0.912

多步轨迹监督 FlowCTS-OPD (K = 2) 0.94 0.92 22.96 0.914 FlowCTS-OPD (K = 3) 0.93 0.92 22.60 0.906

II. 离线轨迹监督 单步监督微调 Vanilla SFT 0.71 0.70 21.68 0.747

多步轨迹监督 FlowCTS-SFT (K = 2) 0.72 0.73 21.66 0.761 FlowCTS-SFT (K = 3) 0.71 0.75 21.71 0.763 FlowCTS-SFT (K = 4) 0.70 0.74 21.63 0.756

评估。遵循 Flow-GRPO 的评估协议,我们在 GenEval、OCR 和 PickScore 上评估域内性能。我们进一步在 T2I-CompBench (Huang et al., 2023) 上评估分布外组合泛化能力,并使用 ImageReward、Aesthetic Score、UnifiedReward 和 HPS-v2.1 在 DrawBench (Saharia et al., 2022) 上评估通用图像质量和人类偏好。完整的训练和评估细节见附录 C 和 D。

4.2 主要结果

表 1 报告了在线和离线设置下的主要结果,我们首先检查在线设置中的多目标对齐。特定任务的 Flow-GRPO 模型在其各自的目标上表现强劲,但在其他目标上表现出显著的权衡。Flow-GRPO-Mix 改善了目标间的平衡,但未能匹配各个专家的专业能力。相比之下,FLOWCTS-OPD 在所有三个目标上实现了平衡的性能,在保持具有竞争力的 PickScore 性能的同时,达到了与 GenEval 和 OCR 专家相当的水平。这些结果证明了用于多参考在线蒸馏的基于轨迹的公式的有效性。

为了隔离基于轨迹的目标的影响,我们在相同的在线蒸馏流水线中将 FLOWCTS-OPD 与 Vanilla OPD 进行比较。FLOWCTS-OPD 将 GenEval 从 0.90 提高到 0.93,OCR 从 0.90 提高到 0.92,PickScore 从 22.75 提高到 23.06。图 3 进一步显示,FLOWCTS-OPD 收敛更快,并在所有三个指标上达到更高的性能,比 Vanilla OPD 更早地大幅接近相应的 GenEval 和 OCR 专家水平。由于这两种方法仅在监督目标上有所不同,这些受控结果表明,基于轨迹的速度匹配目标比 Vanilla OPD 更有效。

离线结果在不同的初始状态分布下提供了补充证据。与 Vanilla SFT 相比,FlowCTS-SFT 目标主要提高了 OCR 性能,同时保持了相当的 GenEval 和 PickScore 性能,这表明相同的基于轨迹的公式在离线设置下也提供了有用的监督。两种设置中监督步数的影响将在第 4.3 节中分析。

6

第 7 页

预印本

基础专家 朴素OPD FLOWCTS-OPD

0.9 0.9 23

0.8 分数 0.8 22.5 0.7 0.7 22 0.6 0.6 21.5 0 0.5k 1.0k 1.5k 0 0.5k 1.0k 1.5k 0 0.5k 1.0k 1.5k

(a) GenEval (b) OCR (c) PickScore

图3:朴素OPD和FLOWCTS-OPD在三个任务特定指标上的训练动态。下方的点状水平线表示基础模型的性能,上方的虚线水平线表示相应的专家性能。带圆形标记的蓝线代表OPD-KL,带方形标记的红线代表CTS。

4.3 OPD中监督步长的影响

接下来我们研究FLOWCTS-OPD中的参考监督应超出学生访问状态多远。如表1所示,我们在在线和离线设置下比较了不同的监督步长。步长K的范围从K=1时当前状态的速度匹配,到K>1时对学生-参考轨迹片段的监督。

在在线设置下,将监督视界从K=1扩展到K=2,GenEval从0.93略微提升至0.94,性能超越了参考模型,同时OCR分数保持不变,PickScore仅有轻微下降。将视界进一步扩展到K=3并未带来额外收益,且导致PickScore出现更大降幅。这些结果表明,监督视界应谨慎选择:短视界目标已能捕捉轨迹中的主要训练信号,而进一步扩展视界会导致指标间改善不一致。为控制训练时长,我们还在双倍训练步长预算下比较了K=1和K=2。K=1的表现仍不及K=2,表明这种提升不能仅归因于更长的优化过程。见附录E。

离线设置显示出类似的模式。与朴素SFT相比,将监督步长扩展到K=2和K=3提升了所有三项指标,其中OCR的提升最为显著,分别从0.70增至0.73和0.75。然而,将其进一步增加到K=4会导致所有三项指标相对于K=3下降,表明在较大的K值下,扩展监督视界带来的收益无法持续。

我们将这种非单调行为归因于更丰富的轨迹监督与增加的优化难度之间的权衡。较大的K值在更多未来状态提供参考信号,促进结构上的一致性演化,并改善组合和空间正确性。然而,更长的学生-参考 rollout 会放大早期预测错误的影响,使得后续监督更难优化。更强的跨步约束也可能抑制细粒度细节,削弱感知偏好。因此,监督视界应被视为一种显式的设计选择,而非简单地最大化。

4.4 KL监督的时序错配

接下来我们分析为何FLOWCTS-OPD比朴素OPD优化得更有效。在朴素OPD中,确定性ODE动力学首先被重构为随机SDE转移,所得转移核之间的KL散度简化为带时间依赖权重的速度回归,其中wKL(t)由辅助SDE转移方差诱导。

$$ D_{KL} (\pi_\theta(\cdot | x_t)\|\pi_{ref}(\cdot | x_t)) = w_{KL}(t) \|v_\theta(x_t, t, c) – v_{ref}(x_t, t, c)\|_2^2, \quad (11) $$

图4揭示了时序信号分配存在明显错配。KL损失高度集中在图像终点附近,而预训练模型与三个参考专家之间的速度场最大差异始终出现在早期去噪阶段。这一观察结果与TempFlow-GRPO (He et al., 2025)一致,后者表明早期阶段的扰动

7

第 8 页

预印本

GenEval OCR PickScore

0.8 2 MSE 0.6 1.5 (×10−3) 0.4 1 速度损失 KL 0.5 均值 0.2 0 0 0 0.25 0.50 0.75 1.00 0 0.25 0.50 0.75 1.00

(a) 每步 KL 损失 (b) 速度 MSE 差距

图 4:基于 KL 的在线蒸馏(OPD)中的时序信号分配。两个横轴均表示从噪声到图像的归一化去噪进度。这两个量是从相同的学生访问状态和训练观测值中计算得出的。(a) 有效的每步 KL 损失:$w_{KL}(t)\|v_\theta(x_t, t, c) – v_{ref}(x_t, t, c)\|_2^2$。(b) 去除额外的 KL 诱导权重后的均方速度差距:$\|v_\theta(x_t, t, c) – v_{ref}(x_t, t, c)\|_2^2$。KL 目标将其有效监督集中在图像端点附近,而底层的学生-参考速度错配在早期去噪阶段最大。

表 2:T2I-CompBench 上的结果。OPD 组内最佳和次佳结果分别以粗体和下划线显示。

模型 颜色 形状 纹理 复杂 3D-空间 数值 非空间

预训练模型 SD3.5-M 0.7994 0.5669 0.7338 0.3800 0.3739 0.5927 0.3146

强化学习 GRPO-Mix 0.7966 0.5803 0.7392 0.3677 0.3681 0.6388 0.3130

在线蒸馏 Vanilla OPD 0.8350 0.6211 0.7508 0.3834 0.4411 0.6840 0.3135 FLOWCTS-OPD 0.8295 0.6285 0.7414 0.3839 0.4433 0.6909 0.3096

结构阶段对最终生成结果的影响远大于后期细化阶段。

因此,SDE 诱导的 KL 权重强调了后期时间步,而低估了参考模型引入最大修正的阶段。相比之下,我们的 $K=1$ 目标直接匹配学生访问状态处的速度,而没有这种时序加权。这种差异解释了其在图 3 中更快的收敛速度和更强的最终性能。

4.5 能力与泛化分析

我们进一步考察 FLOWCTS-OPD 目标是否超越了三个训练指标进行泛化。如表 3 所示,FLOWCTS-OPD 在 ImageReward、Aesthetic Score、UnifiedReward 和 HPS-v2.1 上均持续优于 Vanilla OPD。这些结果表明,其改进不仅限于训练目标,还扩展到更广泛的视觉质量和人类偏好度量。

表 2 进一步评估了 T2I-CompBench 上的分布外组合能力。与 Vanilla OPD 相比,FLOWCTS-OPD 在形状、空间关系和数值方面表现更好,而在颜色和纹理方面的差异仍然有限。这种模式与第 4.4 节的时序分析一致:由于早期去噪阶段在建立全局结构方面发挥更大作用,纠正这些阶段监督分配不足的情况,预计将比视觉属性更有益于结构和关系能力。这些结果表明,跨时间步的监督分配在有效的后训练中起着重要作用。

5 相关工作

流模型的后训练。后训练已成为将预训练视觉生成模型适应下游目标的重要方法。早期方法如 DDPO

8

第 9 页

预印本

表 3:通用图像质量和人类偏好指标上的比较。OPD 组内最佳和次佳结果分别以粗体和下划线标示。‡ 在 1024 × 1024 分辨率下评估。

模型 ImageReward Aesthetic UnifiedReward HPS-v2.1

预训练模型 SD-XL‡ 0.76 5.60 2.93 0.28 SD3.5-L‡ 0.96 5.50 3.25 0.29 FLUX.1-Dev 0.96 5.71 3.27 0.27 SD3.5-M 0.82 5.37 3.00 0.28

在线蒸馏 Vanilla OPD 1.21 5.46 3.28 0.30 FLOWCTS-OPD 1.27 5.64 3.32 0.31

以及 DPOK 利用终端奖励通过策略梯度更新优化扩散模型,ReFL 直接反向传播可微奖励反馈,而 Diffusion-DPO 从离线偏好对中进行对齐 (Black et al., 2024; Fan et al., 2023; Xu et al., 2023; Wallace et al., 2024; Clark et al., 2024; Liu et al., 2026b)。在此基础上,更近期的工作引入了针对现代扩散和整流流生成器的 GRPO 风格在线优化。Dance-GRPO (Xue et al., 2025) 在扩散和整流流生成器之间开发了统一的 GRPO 框架,而 Flow-GRPO 通过随机采样轨迹实现了流模型的在线策略梯度优化 (Liu et al., 2026a)。TempFlow-GRPO (He et al., 2025) 进一步引入了对时间敏感的信用分配以优化流模型,而 DiffusionNFT (Zheng et al., 2025) 将在线奖励反馈纳入前向过程流匹配。与这些基于奖励和偏好的方法互补,我们的工作研究了参考引导的在线蒸馏,并专注于如何为流模型构建密集监督。

流模型的在线蒸馏。在线蒸馏最初是为自回归语言模型开发的,其中学生生成自己的序列并在访问的前缀处接收密集的参考监督。MiniLLM 在学生 rollout 上优化反向 KL 目标,而 GKD 将此范式推广到不同的散度目标和采样策略 (Gu et al., 2024; Agarwal et al., 2024)。最近的研究进一步使用 OPD 将来自多个专用参考的能力整合到一个统一的学生中 (Yang et al., 2026; Ma et al., 2026a; Zeng et al., 2026; Yang et al., 2025; Xiao et al., 2026; Li et al., 2026a)。最近的工作将此思想扩展到流模型。Flow-OPD 和 DiffusionOPD 在学生生成的状态上构建逐步 KL 目标 (Fang et al., 2026; Li et al., 2026b)。与我们的工作同时,DanceOPD 独立采用了在学生访问状态下的直接速度匹配,并将其动机化为局部场回归目标 (Zhou et al., 2026)。FlowCTS 则从连续的学生-参考轨迹差异中推导出一系列目标。它进一步分析了相对于参考-学生速度误差的转移核 KL 的时序错配,研究了不同的监督步数,并将相同的公式扩展到离线监督。

流模型的轨迹蒸馏。大多数扩散蒸馏方法专注于步数减少,将多步参考压缩为几步学生以实现高效推理 (Salimans & Ho, 2022; Liu et al., 2023)。基于轨迹的方法模仿中间转换或强制跨时间步的一致性 (Song et al., 2023; Kim et al., 2024; Boffi et al., 2024),而 DMD 方法在不要求逐轨迹对应的情况下对齐学生和参考分布 (Yin et al., 2024a;b)。相比之下,FLOWCTS-OPD 并不学习捷径生成器。它使用有限轨迹段作为监督单元,用于对原始时间依赖速度场进行后训练,并研究监督视界如何影响最终模型。

6 结论

我们研究了流匹配模型的在线蒸馏,并从在共享学生访问状态初始化的连续学生和参考轨迹中推导出 FLOWCTS-OPD。所得目标涵盖了局部速度匹配和短视界监督。在受控的多参考设置中,FLOWCTS-OPD 收敛更快且优于转移核 KL。更长的

9

第 10 页

预印本

视野范围带来非单调的收益提升,反映了额外轨迹信息与优化难度之间的权衡。时序分析进一步揭示,尽管参考场的校正主要发生在早期阶段,但 KL 监督集中在去噪的后期阶段。综上所述,这些结果确定了时序权重和监督视野范围是连续时间生成模型中在线蒸馏(OPD)的两个关键设计选择。

参考文献

Rishabh Agarwal, Nino Vieillard, Yongchao Zhou, Piotr Stanczyk, Sabela Ramos Garea, Matthieu Geist, 和 Olivier Bachem。语言模型的在线蒸馏:从自生成的错误中学习。在《国际学习表征会议》,卷 2024,页码 21246–21263,2024。

Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, 和 Sergey Levine。使用强化学习训练扩散模型。在《国际学习表征会议》,卷 2024,页码 4965–4987,2024。

Nicholas M Boffi, Michael S Albergo, 和 Eric Vanden-Eijnden。具有随机插值子的流映射匹配:一致性模型的数学框架。arXiv 预印本 arXiv:2406.07507,2024。

Kevin Clark, Paul Vicol, Kevin Swersky, 和 David Fleet。直接在可微奖励上微调扩散模型。在《国际学习表征会议》,卷 2024,页码 4793–4822,2024。

Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel 等人。扩展整流流 Transformer 以实现高分辨率图像合成。在第四十一届国际机器学习会议,2024。

Ying Fan, Olivia Watkins, Yuqing Du, Hao Liu, Moonkyung Ryu, Craig Boutilier, Pieter Abbeel, Mohammad Ghavamzadeh, Kangwook Lee, 和 Kimin Lee。Dpok:用于微调文本到图像扩散模型的强化学习。《神经信息处理系统进展》,36:79858–79885,2023。

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao 等人。Flow-opd:面向流匹配模型的在线蒸馏。arXiv 预印本 arXiv:2605.08063,2026。

Kevin Frans, Danijar Hafner, Sergey Levine, 和 Pieter Abbeel。通过捷径模型实现单步扩散。在《国际学习表征会议》,卷 2025,页码 34668–34684,2025。

Zhengyang Geng, Mingyang Deng, Xingjian Bai, Zico Kolter, 和 Kaiming He。用于单步生成建模的平均流。《神经信息处理系统进展》,38:75460–75482,2026。

Yuxian Gu, Li Dong, Furu Wei, 和 Minlie Huang。Minillm:大型语言模型的知识蒸馏。在《国际学习表征会议》,卷 2024,页码 32694–32717,2024。

Xiaoxuan He, Siming Fu, Yuke Zhao, Wanli Li, Jian Yang, Dacheng Yin, Fengyun Rao, 和 Bo Zhang。Temporalflow-grpo:当时机对 Flow 模型中的 GRPO 至关重要时。arXiv 预印本 arXiv:2508.04324,2025。

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang 等人。Uni-opd:统一在线蒸馏的双视角配方。arXiv 预印本 arXiv:2605.03677,2026。

Kaiyi Huang, Kaiyue Sun, Enze Xie, Zhenguo Li, 和 Xihui Liu。T2I-CompBench:面向开放世界组合文本到图像生成的综合基准。《神经信息处理系统进展》,36:78723–78747,2023。

10

第 11 页

预印本

Dongjun Kim, Chieh-Hsin Lai, WeiHsiang Liao, Naoki Murata, Yuhta Takida, Toshimitsu Uesaka, Yutong He, Yuki Mitsufuji, 和 Stefano Ermon。一致性轨迹模型:学习扩散的概率流常微分方程轨迹。在《表示学习国际会议》中, 卷 2024,页码 44493–44525,2024。

Nikita Kornilov, Petr Mokrov, Alexander Gasnikov, 和 Alexander Korotin。最优流匹配: 仅用一步学习直线轨迹。arXiv 预印本 arXiv:2403.13117,2024。

Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, Wenhao Zhuang 等。Kat-coder-v2 技术报告。arXiv 预印本 arXiv:2603.27703,2026a。

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, 和 Zuxuan Wu。DiffusionOPD:扩散模型中在线蒸馏的统一视角。arXiv 预印本 arXiv:2605.15055,2026b。

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan- ang Gao, Wenkai Yang, Zhiyuan Liu 等。重新思考大语言模型的在线蒸馏:现象学、机制与配方。arXiv 预印本 arXiv:2604.13016,2026c。

Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。用于生成建模的 流匹配。arXiv 预印本 arXiv:2210.02747,2022。

Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Wanli Ouyang。Flow-GRPO:通过在线强化训练流匹配模型。《神经信息处理系统进展》,38:40783–40818,2026a。

Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Menghan Xia, Xintao Wang 等。利用人类反馈改进视频生成。《神经信息处理系统进展》,38:82155–82192,2026b。

Xingchao Liu, Chengyue Gong, 和 Qiang Liu。流直线且快速:学习使用整流流生成和 传输数据。arXiv 预印本 arXiv:2209.03003,2022。

Xingchao Liu, Xiwen Zhang, Jianzhu Ma, Jian Peng 等。Instaflow:一步即可实现高质量的基于扩散的文本到图像生成。在《第十二届表示学习国际会议》中,2023。

Kevin Lu 和 Thinking Machines Lab。在线蒸馏。Thinking Machines Lab:联结主义,2025。doi: 10.64434/tml.20251026。https://thinkingmachines.ai/blog/on-policy-distillation。

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li 等。MOPD:用于大语言模型后训练能力集成的多教师在线蒸馏。arXiv 预印本 arXiv:2606.30406,2026a。

Xu Ma, Yitian Zhang, Qihua Dong, 和 Yun Fu。FineT2I:一个开放、大规模且多样化的数据集,用于高质量文本到图像微调。arXiv 预印本 arXiv:2602.09439,2026b。

Stéphane Ross 和 Drew Bagnell。模仿学习的高效归约。在《第十三届人工智能与统计国际会议论文集》中,页码 661–668。JMLR 研讨会和会议论文集,2010。

Stéphane Ross, Geoffrey Gordon, 和 Drew Bagnell。将模仿学习和结构化预测归约为无 regret 在线学习。在《第十四届人工智能与统计国际会议论文集》中,页码 627–635。JMLR 研讨会和会议论文集,2011。

Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L Denton, Kamyar Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans 等。具有深度语言理解的 photorealistic 文本到图像扩散模型。《神经信息处理系统进展》,35:36479–36494,2022。

Tim Salimans 和 Jonathan Ho。用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512,2022。

11

第 12 页

预印本

Yang Song, Prafulla Dhariwal, Mark Chen, 和 Ilya Sutskever。一致性模型。2023年。

Alexander Tong, Kilian Fatras, Nikolay Malkin, Guillaume Huguet, Yanlei Zhang, Jarrid Rector-Brooks, Guy Wolf, 和 Yoshua Bengio。利用小批量最优传输改进和推广基于流的生成模型。arXiv预印本 arXiv:2302.00482,2023年。

Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shafiq Joty, 和 Nikhil Naik。使用直接偏好优化进行扩散模型对齐。在IEEE/CVF计算机视觉与模式识别会议论文集,第8228–8238页,2024年。

Yuqiao Wen, Zichao Li, Wenyu Du, 和 Lili Mou。序列级知识蒸馏的F散度最小化。在第61届计算语言学协会年度会议论文集(第1卷:长论文),第10817–10834页,2023年。

Bangjun Xiao, Bingquan Xia, Bo Yang, Bofei Gao, Bowen Shen, Chen Zhang, Chenhong He, Chiheng Lou, Fuli Luo, Gang Wang 等。Mimo-v2-flash 技术报告。arXiv预印本 arXiv:2601.02780,2026年。

Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, 和 Yuxiao Dong。Imagereward:学习和评估文本到图像生成的人类偏好。神经信息处理系统进展,36:15903–15935,2023年。

Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang 等。Dancegrpo:释放GRPO在视觉生成中的潜力。arXiv预印本 arXiv:2505.07818,2025年。

An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv 等。Qwen3 技术报告。arXiv预印本 arXiv:2505.09388,2025年。

Wenkai Yang, Weijie Liu, Ruobing Xie, Kai Yang, Saiyong Yang, 和 Yankai Lin。超越教师学习:具有奖励外推的广义在线蒸馏。arXiv预印本 arXiv:2602.12125,2026年。

Tianwei Yin, Micha¨el Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T Freeman。改进分布匹配蒸馏以实现快速图像合成。神经信息处理系统进展,37:47455–47487,2024a。

Tianwei Yin, Micha¨el Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T Freeman, 和 Taesung Park。具有分布匹配蒸馏的一步扩散。在IEEE/CVF计算机视觉与模式识别会议论文集,第6613–6623页,2024b。

Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang, Chengxing Xie 等。GLM-5:从氛围编码到智能体工程。arXiv预印本 arXiv:2602.15763,2026年。

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, 和 Ming-Yu Liu。DiffusionNFT:具有前向过程的在线扩散强化学习。arXiv预印本 arXiv:2509.16117,2025年。

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu 等。DanceOPD:在线生成场蒸馏。arXiv预印本 arXiv:2606.27377,2026年。

A 速度上界的推导

我们提供第3.2节中使用的速度上界的推导。考虑反向时间区间 $[t_e, t_s]$,其中 $0 \le t_e < t_s \le 1$。学生和参考轨迹从相同的状态 $x_{t_s}$ 开始,定义为 $$ x_{\theta t} = x_{t_s} – \int_{t}^{t_s} v_\theta(x_{\theta r}, r, c) dr, \quad x_{ref t} = x_{t_s} – \int_{t}^{t_s} v_{ref}(x_{ref r}, r, c) dr. \quad (12) $$

12

第 13 页

预印本

将两条轨迹相减可得

$$x_{\theta}^{t_s} – x_{\text{ref}}^{t_s} = -\int_{t}^{t_s} v_{\theta}(x_{\theta}^r, r, c) – v_{\text{ref}}(x_{\text{ref}}^r, r, c) \, dr. \quad (13)$$

为简化表述,定义两条轨迹上的速度失配为 $$\Delta v^r = v_{\theta}(x_{\theta}^r, r, c) – v_{\text{ref}}(x_{\text{ref}}^r, r, c). \quad (14)$$

则有 $$x_{\theta}^{t_s} – x_{\text{ref}}^{t_s} = -\int_{t}^{t_s} \Delta v^r \, dr. \quad (15)$$

连续轨迹目标函数为

$$L_{\text{CTS}}(\theta) = \mathbb{E}_{x_{\text{ts}}, c} \left[ \left\| x_{\theta}^{t_s} – x_{\text{ref}}^{t_s} \right\|^2 \right]. \quad (16)$$

代入状态差异的积分形式可得 $$L_{\text{CTS}}(\theta) = \mathbb{E}_{x_{\text{ts}}, c} \left[ \left\| \int_{t}^{t_s} \Delta v^r \, dr \right\|^2 \right]$$ $$\le \mathbb{E}_{x_{\text{ts}}, c} \left[ (t_s – t) \int_{t}^{t_s} \|\Delta v^r\|^2 \, dr \right] \quad (17)$$ $$= \mathbb{E}_{x_{\text{ts}}, c} \left[ \int_{t_e}^{t_s} (t_s – t) \, dt \int_{t_e}^{r} \|\Delta v^r\|^2 \, dr \right].$$

首先利用柯西-施瓦茨不等式对内部轨迹积分进行界定,随后重排所得的双重积分。轨迹导出的权重为 $$w(r) = \int_{t_e}^{r} (t_s – t) \, dt = \frac{(t_s – t_e)^2 – (t_s – r)^2}{2}. \quad (18)$$

代回 $\Delta v^r$ 可得速度上界目标函数 $$L_{\text{CTS}}(\theta) \le L_{\text{VUB}}(\theta) = \mathbb{E}_{x_{\text{ts}}, c} \left[ \int_{t_e}^{t_s} w(r) \left\| v_{\theta}(x_{\theta}^r, r, c) – v_{\text{ref}}(x_{\text{ref}}^r, r, c) \right\|^2 \, dr \right]. \quad (19)$$

B 离散训练目标的推导

我们推导轨迹目标的离散形式。我们将反向时间区间 $[t_e, t_s]$ 离散化为 $K$ 个均匀欧拉步。令 $$h = \frac{t_s – t_e}{K}, \quad t_i = t_s – ih, \quad i = 0, \dots, K. \quad (20)$$

学生模型和参考模型的 rollout 从相同状态开始: $$x_{\theta}^0 = x_{\text{ref}}^0 = x_{\text{ts}}. \quad (21)$$

利用欧拉离散化,两条 rollout 轨迹为 $$x_{\theta}^{i+1} = x_{\theta}^i – h v_{\theta}(x_{\theta}^i, t_i, c), \quad x_{\text{ref}}^{i+1} = x_{\text{ref}}^i – h v_{\text{ref}}(x_{\text{ref}}^i, t_i, c), \quad (22)$$

其中 $i = 0, \dots, K-1$。

定义第 $i$ 步的速度失配为 $$\delta_i = v_{\theta}(x_{\theta}^i, t_i, c) – v_{\text{ref}}(x_{\text{ref}}^i, t_i, c). \quad (23)$$

则状态差异遵循 $$x_{\theta}^{i+1} – x_{\text{ref}}^{i+1} = x_{\theta}^i – x_{\text{ref}}^i – h \delta_i. \quad (24)$$

13

第 14 页

预印本

由于 $x_{\theta 0} – x_{\text{ref } 0} = 0$,我们有

$$ x_{\theta i} – x_{\text{ref } i} = -h \sum_{j=0}^{i-1} \delta_j, \quad i = 1, \dots, K. \quad (25) $$

离散状态空间轨迹损失可写为

$$ L_{\text{state, disc}} = h \sum_{i=1}^{K} \| x_{\theta i} – x_{\text{ref } i} \|^2. \quad (26) $$

代入累积误差形式可得

$$ L_{\text{state, disc}} = h^3 \sum_{i=1}^{K} \left\| \sum_{j=0}^{i-1} \delta_j \right\|^2. \quad (27) $$

由离散柯西-施瓦茨不等式,

$$ \left\| \sum_{j=0}^{i-1} \delta_j \right\|^2 \le i \sum_{j=0}^{i-1} \| \delta_j \|^2. \quad (28) $$

因此,

$$ L_{\text{state, disc}} \le h^3 \sum_{i=1}^{K} i \sum_{j=0}^{i-1} \| \delta_j \|^2. \quad (29) $$

交换求和顺序,我们得到

$$ L_{\text{state, disc}} \le h^3 \sum_{j=0}^{K-1} \left( \sum_{i=j+1}^{K} i \right) \| \delta_j \|^2. \quad (30) $$

内部求和具有闭式解

$$ \sum_{i=j+1}^{K} i = \frac{K(K + 1) – j(j + 1)}{2}. \quad (31) $$

因此,

$$ L_{\text{state, disc}} \le h^3 \sum_{j=0}^{K-1} \frac{K(K + 1) – j(j + 1)}{2} \| \delta_j \|^2. \quad (32) $$

离散上界确定了在每个监督状态处速度失配的相对贡献。对于固定的监督视界 $K$ 和轨迹段,$h^3$ 是一个与 $\theta$ 无关的正常数。因此,它不影响最小化器或跨时间步的相对权重,可以吸收到整体损失系数中。我们定义未归一化的轨迹衍生权重为

$$ \alpha_j = \frac{K(K + 1) – j(j + 1)}{2}, \quad j = 0, \dots, K – 1. \quad (33) $$

对于训练,我们将这些系数归一化为

$$ \bar{\alpha}_j = \frac{\alpha_j}{\sum_{i=0}^{K-1} \alpha_i}, \quad \sum_{i=0}^{K-1} \bar{\alpha}_i = \frac{K(K + 1)(2K + 1)}{6}, \quad (34) $$

这保留了轨迹衍生的时间分布,同时保持不同 $K$ 值下的整体损失尺度相当。因此,实际目标为

$$ L_{\text{CTS}}^{(K)}(\theta) = \mathbb{E} \left[ \sum_{j=0}^{K-1} \bar{\alpha}_j \| v_\theta(x_{\theta j}, t_j, c) – v_{\text{ref}}(x_{\text{ref } j}, t_j, c) \|^2 \right]. \quad (35) $$

当 $K = 1$ 时,$\bar{\alpha}_0 = 1$,该目标简化为在段起始状态处的速度匹配。

14

第 15 页

预印本

C 训练细节

C.1 在线多参考蒸馏

实现细节。我们使用 Stable Diffusion 3.5 Medium 作为基础模型,并从平均化的多任务 Flow-GRPO LoRA 检查点初始化学生模型。所有模型均使用 LoRA 进行微调,应用于 SD3 变换器的注意力投影,包括查询、键、值、输出以及附加条件投影。我们将 LoRA 秩设置为 32,LoRA alpha 设置为 64。训练在四块 H200 GPU 上进行。

学生轨迹生成分辨率为 512 × 512,使用 10 个采样步数和 4.5 的分类器自由引导尺度。使用 0.99 的时间步分数,导致九个去噪转换用于优化。每个 GPU 的采样批次大小为 16,每个 epoch 有四个采样批次,并在两个步骤上进行梯度累积。我们使用 AdamW 优化学生模型,学习率为 1×10−4,权重衰减为 1×10−4,最大梯度范数为 1.0。我们维护可训练参数的指数移动平均,衰减率为 0.9,每八个优化步骤更新一次。

提示路由和参考模型。我们使用 Flow-GRPO 发布的 OCR、GenEval 和 PickScore 提示集。每个小批次从一个提示集中抽取,并路由到其对应的特定任务参考模型:文本渲染、GenEval 或 PickScore Flow-GRPO 专家。这三个数据集以 1:3:1 的循环比例交替采样,分别对应 OCR、GenEval 和 PickScore。未引入额外的辅助损失。

OPD 目标。Vanilla OPD 和 FLOWCTS-OPD 使用相同的初始化、提示混合、学生轨迹、参考路由、批次构建和优化超参数。Vanilla OPD 使用逐步转换核 KL 作为蒸馏目标。

对于 FLOWCTS-OPD,我们用公式 10 中的轨迹派生速度目标替换转换核策略目标。当 K = 1 时,目标简化为学生访问状态处学生与路由参考模型之间的均方速度匹配。对于 K > 1,学生和参考模型在后续轨迹段上进行轨迹生成,每步损失根据公式 33 加权。

C.2 离线扩展

对于离线实验,我们从 Fine-T2I 中采样 50K 图像-文本对构建训练轨迹,并使用 SD3.5-Medium 作为基础模型。Vanilla SFT 和所有 FLOWCTS-SFT 变体均在相同数据和优化配置下使用 LoRA 进行训练。Vanilla SFT 对应于单状态速度监督,而 FLOWCTS-SFT 使用轨迹派生权重将目标扩展到 K ∈{2, 3, 4} 个后续状态。所有离线实验均在四块 A800 GPU 上进行。

C.3 SDE 和 ODE 采样的影响

我们比较了 SDE 和 ODE 采样在在线蒸馏期间构建学生访问状态的效果。这两种变体使用相同的速度目标和训练配置,仅在用于获取在线状态的轨迹生成过程上有所不同。

如图 5 所示,SDE 采样在整个训练过程中始终优于确定性 ODE 采样。这种差异在早期检查点最为明显,其中 SDE 将 GenEval 从 0.80 提高到 0.84。优势在训练结束时仍然存在,SDE 达到 0.93,而 ODE 采样达到 0.92,并接近相应的参考性能。这些结果表明,随机探索改善了在线蒸馏期间遇到的状态,特别是在早期优化阶段。

D 评估

除非另有说明,我们使用 40 个推理步骤、4.5 的分类器自由引导尺度和随机种子 42 生成分辨率为 512×512 的图像。所有比较方法均使用相同的

15

第 16 页

预印本

基础教师 ODE SDE 0.95

0.90 得分 0.85 0.80

0.75 GenEval 0.70

0.65

40 160 320

训练检查点

图 5:在线蒸馏期间构建学生访问状态时,SDE 与 ODE 采样的对比。两种变体均使用相同的速度匹配目标和训练配置,仅在用于生成在线状态的 rollout 过程上有所不同。SDE 采样在训练检查点中始终获得更高的 GenEval 性能,且在早期优化阶段优势更大。水平虚线表示预训练基础模型和相应的特定任务参考。

表 4:训练预算控制。扩展的 K = 1 运行与 K = 2 使用的监督状态评估数量相匹配。

方法 训练步数 GenEval ↑ OCR ↑ PickScore ↑

FLOWCTS-OPD (K = 1) N 0.91 0.89 22.93 FLOWCTS-OPD (K = 1) 2N 0.92 0.91 23.01 FLOWCTS-OPD (K = 2) N 0.93 0.91 22.80

提示词、生成设置和评估器实现。表 3 中标记为 ‡ 的模型在 1024 × 1024 分辨率下进行评估。

遵循 Flow-GRPO (Liu et al., 2026a),我们在其对应的测试集上评估 GenEval、OCR 和 PickScore。组合泛化能力在 T2I-CompBench (Huang et al., 2023) 的验证集上进行评估,每个提示词使用官方评估实现生成十张图像。遵循 Flow-GRPO 评估协议,我们使用 ImageReward、Aesthetic Score、UnifiedReward 和 HPS-v2.1 在 DrawBench 上评估通用图像质量和偏好对齐。所有对比方法均使用相同的生成和评估器设置。

E 控制训练预算

由于 FLOWCTS-OPD (K = 2) 在每个优化步骤中评估两个监督状态,我们进行了一项小规模辅助研究,以高效控制监督预算。具体而言,我们比较了训练 N 步的 K = 2 与训练 N 步和 2N 步的 K = 1,其中后者匹配了总的监督状态评估数量。本研究中的所有运行均使用相同的缩减训练配置,旨在为表 4 中的受控比较提供依据。

如表 4 所示,将 K = 1 的训练步数加倍在所有三个指标上产生了适度的提升,但并未复现 K = 2 的行为。K = 2 实现了更高的 GenEval 得分和相当的 OCR 性能,同时产生了较低的 PickScore。这种独特的指标分布表明,K = 2 的效果不能仅由监督状态评估的数量来解释。相反,在后续 rollout 状态下的监督对样本沿轨迹的演化方式施加了额外的约束,这特别有利于组合和结构正确性。同时,定性检查表明,这种更强的轨迹约束可能会抑制一些细粒度细节,导致图像略微平滑且偏好得分较低。因此,我们将此结果视为由监督跨度引入的权衡,而非从更大训练预算中获得的统一提升。

16

发表评论