IB-Flow:基于信息瓶颈引导的CFG蒸馏用于少步文本到图像生成

三分钟导读:IB-Flow通过信息瓶颈原理动态优化CFG蒸馏中的注入目标时间步和引导强度,在仅2步NFE下实现了SOTA的生成质量并消除了过条件伪影。

英文题目:IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.09133

原始论文:PDF / 论文页面

对应视频标题:IB-Flow:基于信息瓶颈引导的CFG蒸馏用于少步文本到图像生成|推荐指数:★★★★★

这篇论文解决什么问题?

现有的少步CFG蒸馏框架采用静态引导强度和随机采样监督时间步的“盲目注入”范式,忽视了图像生成过程中熵减的动态特性,导致早期结构锚定不足和晚期过条件伪影(如颜色过饱和、纹理锐化)。

核心创新

  • 首次从信息理论视角将少步蒸馏形式化为受信息瓶颈约束的动态互信息博弈。
  • 提出实例感知的动态目标选择机制,通过局部向量场范数作为语义不确定性的代理,实现零开销的闭式最优解。
  • 引入熵感知的动态引导强度调度策略,平衡条件生成对齐与自然图像流形保真度,从原理上消除CFG过条件伪影。

方法概览

提出基于信息瓶颈(IB)的动态信息注入框架:1) 实例感知的注入目标选择:将监督时间步选择建模为受KL散度约束的互信息最大化问题,利用局部向量场范数推导零开销闭式解;2) 熵感知的注入强度调度:基于信噪比(SNR)动态衰减引导强度,早期提供最大推力进行结构锚定,晚期平滑回归自然流形。

逐图理解论文

IB-Flow核心思想:动态信息注入

IB-Flow核心思想:动态信息注入
Figure 2: Overview of our dynamic information injection framework. While traditional distillation enforces a static guidance strength ω and blindly samples the supervisor timestep τ, our IB-guided approach dynamically selects the optimal injection target τ ∗and strength ω∗. Compared to traditional diffusion models, FM simplifies the training objective by directly regressing the vector field, allowing the sampling process to be performed by solving an Ordinary Differential Equation (ODE). Specifically, given data x1 ∼p1 and noise x0 ∼p0, we define a linear probability path xt = (1 −t)x0 + tx1. The conditional vector field corresponding to this path is defined as:

IB-Flow提出基于信息瓶颈的动态信息注入框架,旨在解决上述问题。该方法包含两个核心组件:实例感知的注入目标选择和熵感知的注入强度调度。传统蒸馏强制静态引导强度并盲目采样监督时间步,而IB-Flow动态选择最优注入目标时间步和引导强度。通过Flow Matching简化训练目标,直接回归向量场,使采样过程可通过求解常微分方程完成,从而在理论上优化信息流。

实验设置与基准对比

实验设置与基准对比
Table 1: Quantitative comparisons on Geneval, DPG-Bench and OneIG-Bench. The NFE of Qwen- Image-20B is recorded as 50 × 2 since it uses CFG.

我们在FLUX.1-dev、OpenUni-L-512和Qwen-Image-20B三个不同规模和范式的大型教师模型上进行蒸馏实验。在GenEval、DPG-Bench和OneIG-Bench三个基准上进行定量和定性评估。ArcFlow是主要对比基线,IB-Flow在多个基准上超越其两步生成性能。Decoupled DMD提供理论基础,IB-Flow在其分布匹配和CFG增强解耦框架基础上引入动态调度。

定性比较与消融研究

定性比较与消融研究
Figure 3: Qualitative comparison on DPG-Bench. IBFlow simultaneously improves structural fidelity, semantic alignment, chromatic fidelity, and textural detail over all 2-step baselines, while the rightmost two columns confirm the necessity of the dynamic target τ ∗

定性比较显示,IB-Flow在结构保真度、语义对齐、色彩保真度和纹理细节上均优于所有两步基线。消融研究验证了动态目标和动态强度组件的互补作用。移除动态目标或动态强度均导致性能下降,表明两者缺一不可。此外,超参数κ对性能敏感,过小导致监督不足,过大导致蒸馏不稳定,需仔细调优。

超参数敏感性与调优建议

超参数敏感性与调优建议
Table 4: Impact of divergence budget κ.

超参数κ,即发散预算,对性能敏感。实验显示,κ过小导致监督不足,生成质量下降;κ过大导致蒸馏不稳定,可能引入噪声。建议在实际应用中,根据教师模型的复杂度和目标NFE,通过小规模网格搜索确定最优κ值。此外,引导强度调度策略的超参数也需根据具体任务进行调整,以平衡生成速度与质量。

总结与展望

总结与展望
Figure 1: Demonstrating extreme few-step image generation at only 2 NFE, our IBFlow seamlessly improves perceptually orthogonal qualities compared to Arcflow, which improves from: (1,2) struc- tural fidelity, (3,4) textural details, and (5,6) chromatic fidelity.

IB-Flow通过信息瓶颈原理动态优化CFG蒸馏,在两步NFE下实现SOTA生成质量,消除过条件伪影。该方法为高效文本到图像生成提供了理论完备的新范式。未来,随着计算资源的进一步优化和算法的改进,少步生成有望在更多实际应用中落地,推动AI生成技术的普及与发展。

实验与关键结果

  • 在FLUX.1-dev, OpenUni-L-512, Qwen-Image-20B三个不同规模和范式的大型教师模型上进行蒸馏实验。
  • 在GenEval, DPG-Bench, OneIG-Bench三个基准上进行定量和定性评估。
  • 消融研究验证动态目标(τ_CA*)和动态强度(ω*(t))组件的互补作用及超参数κ的影响。
  • 在Qwen-Image-20B上,2 NFE时GenEval达到0.86,DPG-Bench达到88.67,优于ArcFlow (0.84/87.94)。(第 8 页)
  • 在Qwen-Image-20B上,2 NFE时DPG-Bench的Global指标提升+1.22,Texture指标提升+1.09。(第 8 页)
  • 在FLUX.1-dev上,2 NFE时GenEval达到0.68,DPG-Bench达到85.13,优于ArcFlow (0.65/84.29)。(第 8 页)

阅读时需要注意

  • 生成能力上限受限于教师模型的分布和训练语料,未显著改变数据分布的多样性。
  • 当前的数学推导针对Flow Matching和Rectified Flow框架,扩展到传统SDE扩散模型可能需要额外的近似。
  • 极端少步生成可能加剧深度伪造(Deepfakes)的风险,需结合数字水印和溯源标准。
  • 超参数κ(发散预算)对性能敏感,过小导致监督不足,过大导致蒸馏不稳定。

关联工作

  • ArcFlow:主要对比基线,IBFlow在多个基准上超越其2步生成性能。(第 8 页)
  • Decoupled DMD:理论基础,IBFlow在其分布匹配和CFG增强解耦框架基础上引入动态调度。(第 4 页)
  • TwinFlow:对比基线,IBFlow在语义对齐和细粒度指标上表现更优。(第 8 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

IB-Flow:基于信息瓶颈引导的 CFG 蒸馏用于少步文本到图像生成

Yiting Wang1 Jingyi Zhang2 Wenhu Zhang3 Ke Chao4 Yves Liang1 Kun Cheng2 Kang Zhao2∗

1清华大学 2阿里巴巴集团万团队 3香港科技大学 4北京师范大学

摘要

尽管大规模文本到图像生成模型在视觉性能上取得了前所未有的成就,但其内在依赖多步迭代求解器导致了严重的推理延迟。针对无分类器引导(CFG)轨迹的少步蒸馏已成为主流的双维度压缩范式。然而,现有框架仍受制于一种粗粒度的盲目注入范式,该范式持续强制全局静态的引导强度,并随意采样监督器的时间步。这种状态无关的设计完全忽视了图像生成的内在本质,即一种以渐进熵减为特征的动力学演化过程,这不仅限制了少步压缩的性能边界,还导致了严重的 CFG 过条件伪影。为了超越这些局限性,我们通过信息论的理论透镜重新审视蒸馏过程,将其形式化为受信息瓶颈(IB)原则约束的动态互信息博弈。具体而言,我们通过双轨自适应框架打破了传统的盲目假设。为了确定注入目标,我们提出了一种实例感知选择机制,将难以处理的 KL 散度约束转化为基于局部向量场范数的零开销闭式解。为了调节注入强度,我们引入了一种熵感知调度策略,该策略随着信噪比(SNR)动态衰减,在初始结构锚定阶段施加最大推力,随后平滑地回归自然流形以细化微观细节。广泛的实证评估证实,我们的框架从根本上消除了过条件伪影,打破了性能天花板,在极其严格的 2 步配置下实现了最先进的(SOTA)生成保真度。

1 引言

大规模生成模型的最新进展,特别是基于扩散模型 [9,24] 和流匹配 [16] 的模型,在文本到图像生成方面取得了前所未有的成功。通过从简单先验分布构建到复杂数据分布的连续概率路径,它们实现了高度逼真的视觉合成。然而,这些模型在采样阶段严重依赖迭代数值求解器,通常需要数十甚至数百次神经函数评估(NFE)。这种顺序去噪特性导致了严重的推理延迟和巨大的计算开销,从根本上限制了它们在实时交互式应用中的部署。

为了打破扩散模型的推理效率瓶颈,少步生成的核心目标从根本上需要一个双维度压缩范式,其中步骤蒸馏

∗通讯作者。

预印本。

第 2 页

ArcFlow

IBFlow

(1) 一张穿着拿破仑·波拿巴服装的猫的海报,手中拿着一块黄色的楔形奶酪。 (2) 一只猫坐在现代电视机旁,电视正在播放自然纪录片。 (3) 一个橙色帐篷搭建在宁静的湖边,湖面上有一个金色的圆环躺在秋叶上。 (4) 一位专注的年轻女性戴着眼镜,在黄铜灯照亮的书桌前阅读一本厚厚的书。 (5) 一幅描绘威严狮子的画作,狮子的对话气泡中写着“喵”。 (6) 一幅描绘猫超级数学巫师形象的画作,周围环绕着漂浮的数学方程。

图 1:展示仅在 2 次 NFE 下的极端少步图像生成,我们的 IBFlow 与 ArcFlow 相比,在感知正交的质量方面实现了无缝提升,具体体现在:(1,2) 结构保真度,(3,4) 纹理细节,以及 (5,6) 色彩保真度。

将多步轨迹截断为仅一步或两步 [26,29,39],而 CFG 蒸馏同时压缩条件轴,以消除由无分类器引导 (Classifier-Free Guidance, CFG) [10] 带来的双倍前向传递开销。最近的一些开创性研究,如解耦 DMD [17,38],揭示了这两个维度之间深刻的纠缠关系,表明 CFG 蒸馏不仅仅是计算量的减少,更是推动模型进行大步长生成的核心动力,并显著提升了少步合成的质量上限。因此,主要挑战转变为通过由监督时间步和指导强度共同决定的严格特征注入约束,无损地将教师模型沉重的 CFG 依赖型引导能力浓缩到学生模型中。

尽管在压缩引导轨迹方面取得了显著进展,但现有框架依赖于一种盲目的注入范式,即始终强制执行全局静态的指导强度,并从经验先验中随意采样监督时间步。这种状态无关的设计忽视了图像生成作为一种动态、渐进式熵减过程的内在本质。在高熵的初始阶段,混乱的表示迫切需要保守的结构锚定;盲目地跳跃到遥远的目标会产生巨大的语义差距,导致严重的噪声退化 [17]。相反,在关注微观细节 refinements 的低熵终端阶段,维持刚性的引导会破坏收敛的自然流形,表现为严重的 CFG 过度条件化伪影,如颜色过饱和和纹理锐化。最终,这种对静态注入的僵化坚持未能释放 CFG 引擎的潜力,成为少步生成模型性能边界的主要障碍。

为了解决这些局限性,我们通过信息论的理论视角重新审视少步蒸馏过程,提出了一种由信息瓶颈 (Information Bottleneck, IB) 原则 [32] 控制的动态信息注入框架。具体而言,我们从两个维度打破了传统的盲目假设:注入目标和注入强度。一方面,为了回答注入什么目标,我们将监督时间步的选择重构为一个容量受限的互信息最大化问题,将难以处理的 KL 散度约束转化为基于局部向量场范数的零开销闭式解。这种实例感知机制在早期动态地强制执行保守的结构锚定,随后促进针对特定样本复杂性的先进细节吸收。另一方面,为了回答注入多少强度,我们遵循 IB 的最小充分表示原则,引入了一种熵感知指导强度调度。它随着信噪比 (Signal-to-Noise Ratio, SNR) 的动态衰减,在初始对称性破缺时施加最大推力,然后平滑地回归到无条件自然流形,从而消除过度条件化伪影。广泛的实证评估证实,我们的框架通过彻底打破传统静态蒸馏范式固有的性能上限,在极其严格的低步配置下实现了卓越的生成保真度。

本工作的主要贡献总结如下:

(1) 我们从第一性原理出发,揭示了传统 CFG 蒸馏中盲目信息注入的根本局限性,首次将少步蒸馏形式化为受信息瓶颈约束的动态互信息博弈。

2

第 3 页

(2) 我们提出了一种实例感知的动态目标选择机制。通过严格的数学推导,我们证明了条件向量场范数可以作为语义不确定性的精确代理,从而得出零开销的闭式最优解。

(3) 我们引入了一种熵感知的动态引导强度调度策略,该策略完美平衡了条件生成的对齐性与自然图像流形的保真度,有效消除了无分类器引导(CFG)的过度条件化伪影。

(4) 大量的定量和定性实验表明,在极端的2步生成设置下,我们的方法实现了最先进的(SOTA)生成质量和文本对齐效果。

2 相关工作

2.1 扩散模型与流匹配模型

扩散模型通过学习逆转迭代噪声注入过程来实现最先进的生成性能 [9,28,30]。在此基础上,流匹配(Flow Matching, FM)[16] 和整流流(Rectified Flow)[19] 提供了基于连续归一化流的统一框架。通过直接从噪声回归到数据的向量场,FM 产生了更直、由最优传输引导的轨迹,从而简化了训练并提升了大规模文本到图像合成能力。然而,基于随机微分方程(SDE)的扩散模型和基于常微分方程(ODE)的 FM 在采样过程中都需要数十到数百次神经函数评估(NFE)。这种沉重的计算负担从根本上阻碍了它们的实时部署 [17]。

2.2 少步扩散蒸馏

为了解决这一延迟问题,大量研究致力于将多步模型压缩为少步生成器 [5,7,26]。主要途径包括一致性蒸馏 [29,33,41],即强制轨迹自洽,以及对抗蒸馏 [15,27],即使用生成对抗网络(GAN)目标来匹配真实数据分布。其中,基于分数的方法如 Diff-Instruct [22] 和分布匹配蒸馏(Distribution Matching Distillation, DMD)[38,40] 尤为引人注目 [17]。DMD 最小化学生分布与教师分布之间的积分 KL 散度(IKL),提供了一个优雅的理论框架。在此基础上,最近的 DMD 变体和轨迹匹配方法已成功实现了高分辨率的少步生成 [13,20,42]。

2.3 无分类器引导及其蒸馏

无分类器引导(Classifier-Free Guidance, CFG)[10, 11, 25] 对于实现高保真度的文本到图像对齐至关重要,但它会使每步的计算成本翻倍。因此,将 CFG 集成到蒸馏过程中至关重要,因为教师 CFG 模式是少步转换的主要驱动力 [13,17,18,21]。值得注意的是,解耦 DMD(Decoupled DMD)[17] 严格地将此过程隔离为分布匹配(DM)正则项和 CFG 增强(CA)引擎。然而,现有实现普遍采用全局静态的 CFG 比例,并随机采样 CA 监督器的时间步。这种盲目注入范式忽略了图像生成过程中的动态熵减,不可避免地导致严重的过度条件化伪影 [10,15,17,27]。

3 方法

在本节中,我们正式阐述用于超高效少步生成的动态信息注入框架。我们首先通过回顾流匹配和 CFG 蒸馏来建立理论基础。为了加速迭代去噪,少步蒸馏已被广泛用于尝试将繁琐的多步轨迹(例如 50 步)压缩为极低步数的轨迹(例如 2 步),同时不损害生成的保真度。

3.1 预备知识

3.1.1 流匹配

流匹配(Flow Matching, FM)[16] 提供了一个基于连续归一化流的统一框架,用于学习从简单噪声分布 $p_0$ 到复杂数据分布 $p_1$ 的概率密度路径。

3

第 4 页

图 2:我们动态信息注入框架的概述。传统的蒸馏方法强制使用静态引导强度 $\omega$ 并盲目采样监督时间步 $\tau$,而我们的基于信息瓶颈(IB)的方法动态选择最优注入目标 $\tau^*$ 和强度 $\omega^*$。

与传统的扩散模型相比,流匹配(FM)通过直接回归向量场简化了训练目标,使得采样过程可以通过求解常微分方程(ODE)来完成。具体而言,给定数据 $x_1 \sim p_1$ 和噪声 $x_0 \sim p_0$,我们定义线性概率路径 $x_t = (1 – t)x_0 + tx_1$。与该路径对应的条件向量场定义为: $$ u_t(x_t|x_1) = \frac{dx_t}{dt} = x_1 – x_0. \quad (1) $$ 参数化神经网络 $v_\theta(x_t, t)$ 的训练目标是最小化其预测与目标向量场之间的期望 L2 误差: $$ L_{FM}(\theta) = \mathbb{E}_{t \sim U(0,1), x_0, x_1} \|v_\theta(x_t, t) – (x_1 – x_0)\|^2. \quad (2) $$ 在推理过程中,生成质量在很大程度上依赖于 ODE 求解器的步数。尽管 FM 提供的轨迹比扩散模型更平滑,但使用大规模模型生成高质量图像通常仍需要 40-100 次神经函数评估次数(NFEs),这限制了其在实时交互场景中的应用。

3.1.2 少步 CFG 蒸馏与解耦监督

CFG 是增强文本到图像生成对齐的关键技术。它通过对条件向量场 $v_{ct}(x_t)$ 和无条件向量场 $v_{ut}(x_t)$ 进行线性外推来加强语义引导: $$ \tilde{v}_{ct}(x_t, \omega) = v_{ut}(x_t) + \omega (v_{ct}(x_t) – v_{ut}(x_t)), \quad (3) $$ 其中 $\omega > 1$ 是引导尺度。尽管 CFG 显著提高了图像质量,但它要求在每次推理步骤中进行两次前向传播,从而将原本高昂的计算成本翻倍。

少步蒸馏旨在将昂贵的多步轨迹压缩为极少的步数。传统框架 [38] 通常试图让学生模型隐式地拟合修改后的轨迹。然而,来自解耦 DMD [17] 的最新见解通过严格解耦为分布匹配(DM)和 CFG 增强(CA)解决了这一问题。驱动学生模型参数 $\theta$ 更新的梯度方向可以近似为: $$ \Delta \theta \propto \mathbb{E}_{t, x_t, c} \left[ \underbrace{\Delta_{DM}(\tau_{DM})}_{\text{Shield (Regularizer)}} + \underbrace{\Delta_{CA}(\tau_{CA}, \omega)}_{\text{Spear (Engine)}} \right] \frac{\partial x_t}{\partial \theta}, \quad (4) $$ 其中 DM 项 $\Delta_{DM}(\tau_{DM}) = v_{real, c\tau_{DM}}(x_{\tau_{DM}}) – v_{fake, c\tau_{DM}}(x_{\tau_{DM}})$ 充当正则化盾牌,通过在参考时间步 $\tau_{DM}$ 匹配学生和教师分布来抑制生成伪影。更重要的是,CA 作为实现少步压缩的核心长矛: $$ \Delta_{CA}(\tau_{CA}, \omega) = (\omega – 1) \left( v_{real, c\tau_{CA}}(x_{\tau_{CA}}) – v_{real, u\tau_{CA}}(x_{\tau_{CA}}) \right). \quad (5) $$ CA 项将教师模型在特定时刻的确定性 CFG 决策模式蒸馏到学生模型中,其中控制注入强度的引导强度 $\omega$ 和决定注入目标的监督时间步 $\tau_{CA}$ 是 CA 的两个控制旋钮。

第 5 页

3.2 基于信息瓶颈的实例感知注入目标

然而,现有框架仍受制于一种盲目的注入范式,即持续施加恒定的引导强度 $\omega$,并从宽泛的分布中随机采样监督者时间步 $\tau_{CA}$。由于图像生成是一个动态熵减过程,注入强度 $\omega$ 和注入目标 $\tau_{CA}$ 的需求在去噪的不同阶段 $t$ 内本质上是有变化的。这种静态的条件注意力(CA)注入严重限制了少步生成的性能上限。

3.2.1 信息瓶颈公式化

在 CFG 蒸馏的单次前向传播中,学生模型在时间步 $t$ 通过采样时间步 $\tau_{CA} > t$ 的教师模型来获取引导。在此过程中存在一个权衡:一方面,教师模型应为学生提供足够的信息供给,以获取充分的引导;另一方面,学生与教师之间的分布差异不能过大,否则会带来高昂的学习成本。

量化信息供给:信息注入的最终目标是辅助当前状态 $X_t$ 逼近干净数据状态 $X_1$。因此,来自 $\tau_{CA}$ 的注入特征的有效信息可以通过条件互信息严格量化为: $$ I_{\tau_{CA}}^{supply}(X_1, X_t) = I(X_{\tau_{CA}}; X_1|X_t). \quad (6) $$

界定学习成本:我们将学生的学习成本描述为学生与教师之间的分布差异。具体而言,该成本由两个边缘分布之间的 KL 散度量化 [4]: $$ D_{KL}(p_t \| p_{\tau_{CA}}) = \int p_t(x) \log \frac{p_t(x)}{p_{\tau_{CA}}(x)} dx. \quad (7) $$ 其中 $p_t(x)$ 和 $p_{\tau_{CA}}(x)$ 分别表示生成过程在当前演化状态 $t$ 和目标注入阶段 $\tau_{CA}$ 的边缘概率密度函数。

蒸馏中的信息瓶颈:由于流匹配(Flow Matching)的单调扩散过程,$X_{\tau_{CA}}$ 中包含的关于 $X_1$ 的预测信息随 $\tau_{CA}$ 严格增加。如果我们仅仅寻求最大化供给,我们应该始终选择 $\tau_{CA} = 1$ 以获取最显著的高频监督。然而,在早期阶段直接学习 $X_1$ 会带来极高的学习成本,这可能导致蒸馏发散 [17]。为了解决这个问题,我们引入信息瓶颈(Information Bottleneck, IB)[32],并将最优目标时间步 $\tau_{CA}^*$ 的选择问题形式化为带有成本约束的互信息最大化问题: $$ \tau_{CA}^*(x_t, t) = \arg \max_{\tau \in [t,1]} I(X_{\tau_{CA}}; X_1|X_t) \quad \text{s.t.} \quad D_{KL}(p_t \| p_{\tau_{CA}}) \le \delta. \quad (8) $$ 其中超参数 $\delta$ 充当受限的瞬时信道容量。该公式紧凑地揭示了动态注入的数学本质:在高熵的早期阶段,散度约束迫使 $\tau_{CA}$ 的上限较低,确保模型吸收安全、低频的结构特征。相反,在低熵的后期阶段,约束放宽,允许模型向 $\tau \to 1$ 过渡,以充分利用互信息。

3.2.2 基于 Fisher 信息的可处理近似

基于公式 (8),我们需要获得 $\tau_{CA}^*(x_t, t)$ 的解析形式。然而,直接解析高维像素空间中连续 KL 散度约束是极其困难的。为了绕过这一瓶颈,我们利用流匹配(FM)固有的连续向量场视角,并利用泰勒展开将约束转化为零开销的闭式解。具体而言,我们有以下引理:

引理 1. 公式 (8) 中的 KL 散度约束可近似为: $$ D_{KL}(p_t \| p_{\tau}) \approx \frac{1}{2}(\tau – t)^2 \|\Delta v_t(x_t)\|_2^2. \quad (9) $$

证明。对于无穷小的时间增量 $\Delta t = \tau – t$,局部 KL 散度可以通过利用 Fisher 信息度量(FIM)的泰勒展开进行近似。在 CFG

第 6 页

机制,条件与无条件向量场之间的残差,记为 $\Delta v_t(x_t) = v_{ct}(x_t) – v_{ut}(x_t)$,在数学上严格与点互信息(PMI)的对数梯度成正比。因此,由信息注入引起的散度惩罚可以被局部向量场的平方 $L_2$ 范数严格界定。完整证明见附录 A.1。

此外,我们考虑 $D_{KL}(p_t \| p_\tau)$ 的可允许范围,根据引理 1,这取决于目标时间步 $\tau$ 处注入跨度的可允许上界。具体而言,我们有以下引理:

引理 2. 目标时间步 $\tau$ 处的注入跨度满足: $$ \sqrt{\tau – t} \le \frac{\sqrt{2\delta}}{\|\Delta v_t(x_t)\|_2}. \quad (10) $$

最后,为了最大化互信息供给,我们通过取等号采用贪婪策略。结合引理 1 和引理 2,我们得到以下定理:

定理 1. $\tau_{CA}^*$ 的闭式最优解为:

$$ \tau_{CA}^*(x_t, t) = \min \left( 1, \ t + \frac{\kappa}{\|v_{ct}(x_t) – v_{ut}(x_t)\|_2 + \epsilon} \right), \quad (11) $$

其中 $\kappa = \sqrt{2\delta}$ 作为一个超参数,封装了全局散度预算,以显式控制自适应注入步长,而 $\epsilon$ 则作为一个数值稳定常数。

证明见附录 A.2 和 A.3。基于此公式,我们实现了由信息瓶颈(Information Bottleneck)引导的动态优化,用于 CFG 注入目标 $\tau$,适用于各种生成阶段 $t$:在高熵初始阶段实施保守的宏观结构锚定,同时在后期固化阶段促进细致的微观细节细化。通过为少步 CFG 蒸馏提供自适应且稳定的监督,我们的框架从根本上打破了性能上限,并提升了合成图像的生成保真度。

3.3 熵感知动态注入强度

虽然实例感知的目标 $\tau_{CA}^*$ 确保注入目标位于安全的语义散度界限内,但它并未规定注入强度。现有的蒸馏工作通常在整个时间步中使用静态的 CFG 尺度 $\omega$,一致的引导强度破坏了聚合的局部特征,导致 CFG 过度条件化效应,包括颜色过饱和和异常纹理锐化。这表明系统对条件信息 $C$ 的需求是动态变化的。

我们考虑使用信息瓶颈(IB)来量化对条件信息 $C$ 的动态需求。类似于注入目标的优化,我们建立了条件成本 $I(X_t^\omega; C)$ 与由此产生的生成保真度 $I(X_t^\omega; X_1|C)$ 之间的严格理论平衡: $$ \min_{\omega(t)} I(X_t^\omega; C) – \beta I(X_t^\omega; X_1|C), \quad (12) $$ $$ \underbrace{\text{Conditioning Cost}}_{\text{条件成本}} \quad \underbrace{\text{Generative Fidelity}}_{\text{生成保真度}} $$

其中 $X_t^\omega$ 表示由引导强度 $\omega$ 驱动的更新内部状态,$\beta$ 是平衡这两项的超参数。

基于 (8),我们得到 $\omega^*(t)$ 的解析形式如下:

定理 2. $\omega^*(t)$ 的闭式最优解为:

$$ \omega^*(t) = 1 + (\omega_{\max} – 1) \cdot \frac{1}{1 + \gamma \cdot \text{SNR}(t)}, \quad \text{其中 } \text{SNR}(t) = \frac{t^2}{(1-t)^2}, \quad (13) $$

其中 $\omega_{\max}$ 指定了在初始高熵阶段打破纯噪声结构对称性所需的最大引导尺度,而 $\gamma$ 是一个温度超参数,用于精细校准对信噪比(SNR)转换的敏感性。

6

第 7 页

证明。在任意时间步 $t$,通过增加 $\omega$ 所能获得的有效信息增益受限于系统关于真实数据 $X_1$ 的当前剩余不确定性,形式化表示为条件熵 $H(X_1|X_t)$。基于基本的 I-MMSE 关系 [8],这种剩余不确定性在分析上被证明与系统的瞬时信噪比(SNR)成反比。因此,生成过程中的未知程度可以通过 SNR 的精确演化来明确量化。此外,为了在防止因过度拟合条件 $C$ 而导致流形扭曲的同时最大化生成保真度,由 CFG 引擎注入的附加驱动力,定义为 $\omega(t) – 1$,必须与当前的剩余不确定性成正比。通过将这种比例关系与 I-MMSE 定理相结合,我们将剩余不确定性替换为瞬时 SNR。完整证明见附录 A.4。

定理 2 在数学上保证了理想的边界条件:当 $t \to 1$ 且剩余不确定性消散时,引导推力平滑且不可避免地回归到无条件自然流形 $\omega^*(1) \to 1$,从而从第一性原理上消除了由 CFG 引起的伪影。

3.4 动态 CFG 增强目标

最后,通过将定理 1 和定理 2 中的结论代入公式 (5),我们制定了最终的蒸馏目标。由我们的动态 CA 公式显式驱动的 student 参数 $\theta$ 的梯度更新严格定义为:

$$ \Delta \theta_{CA} \propto \mathbb{E}_{t, x_t, c} \left[ \underbrace{(\omega^*(t) – 1)}_{\text{动态强度}} \nabla_\theta v_\theta(x_t, c) – \underbrace{v_{\text{real}, u}^* (x_\tau) – v_{\text{real}, c}^{\tau_{CA}} (x_\tau^{CA})^*}_{\text{动态目标}} \right]. \quad (14) $$

这一具有理论依据且无参数的目标,在严格的熵减轨迹下优雅地统一了宏观结构锚定和微观细节细化,为极端少步生成合成奠定了基础。

4 实验

4.1 实验设置

我们将 IBFlow 蒸馏框架应用于三个不同规模和范式的文本到图像教师模型:FLUX.1-dev [1]、OpenUni-L-512 [36] 和 Qwen-Image-20B [35],这些模型均在默认 50×2-NFE 调度下使用无分类器引导生成 1024×1024 分辨率的图像。遵循 ArcFlow [37],所有学生模型均在统一的 230 万条文本提示语料库上进行训练。我们在 32 块 A100 GPU 上使用 BF16 混合精度优化模型。CA 散度预算为 $\kappa=1.5$,SNR 温度为 $\gamma=1.0$,$\omega_{\max} = 4.0$ 继承自每个教师模型的默认 CFG 比例。在评估方面,我们遵循标准的文本到图像协议,并在三个基准上报告结果:GenEval [6]、DPG-Bench [12] 和 OneIG-Bench [2],以沿五个轴进行细粒度对齐。我们部署了 ArcFlow 的官方发布代码库以进行公平比较。

4.2 主要结果

定量比较。表 1 比较了 IBFlow 与每个骨干网络上代表性的 2 步蒸馏方法,包括 SenseFlow [14]、pi-Flow [3]、ArcFlow [37]、RCGM [31]、TwinFlow [34] 和 Qwen-Image-Lightning [23]。IBFlow 在仅 2 NFE 的情况下,在所有三个骨干网络上均取得了最佳的整体得分。对于具有挑战性的 Qwen-Image-20B,IBFlow 在仅 2 NFE 的情况下达到了 0.86 的 GenEval 得分和 88.67 的 DPG-Bench 得分,优于最先进的方法 ArcFlow 的两个指标(0.84 / 87.94),这表明由 IB 驱动的动态调度在高熵阶段收紧注入,并在轨迹稳固后放松注入,从而一次性缓解了困扰所有静态 CA 基线在 2 NFE 下的三种失败模式。与 TwinFlow(在 GenEval/DPG-Bench 上分别为 0.82 / 87.01)相比,改进更为显著,表明其自对抗配方在这种激进的步数预算下仍然难以保持细粒度的语义对齐。

表 2 进一步沿官方 L1/L2 轴剖析了相对于 ArcFlow [37] 在 DPG-Bench 上的增益。两项最大的改进指出了每个动态调度的作用:Global 提升了 +1.22,显示出

7

第 8 页

表 1:在 Geneval、DPG-Bench 和 OneIG-Bench 上的定量比较。Qwen-Image-20B 的 NFE 记录为 50 × 2,因为它使用了 CFG。

| Model | NFE | Geneval | DPG-Bench | OneIG-Bench Alignment | OneIG-Bench Text | OneIG-Bench Diversity | OneIG-Bench Style | OneIG-Bench Reasoning | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | FLUX.1-dev | 50 | 0.66 | 84.16 | 0.790 | 0.556 | 0.238 | 0.307 | 0.257 | | SenseFlow (FLUX) | 2 | 0.60 | 79.86 | 0.743 | 0.230 | 0.139 | 0.341 | 0.212 | | pi-Flow (GM-FLUX) | 2 | 0.58 | 82.36 | 0.764 | 0.141 | 0.216 | 0.332 | 0.212 | | ArcFlow (FLUX) | 2 | 0.65 | 84.29 | 0.798 | 0.368 | 0.210 | 0.350 | 0.224 | | IBFlow-FLUX (Ours) | 2 | 0.68 | 85.13 | 0.802 | 0.465 | 0.236 | 0.312 | 0.247 | | OpenUni-L-512 | 20 × 2 | 0.85 | 81.54 | 0.771 | 0.275 | 0.132 | 0.396 | 0.227 | | OpenUni-RCGM-512 | 2 | 0.85 | 80.15 | 0.742 | 0.005 | 0.129 | 0.365 | 0.196 | | OpenUni-TwinFlow-512 | 2 | 0.85 | 79.82 | 0.735 | 0.006 | 0.126 | 0.372 | 0.219 | | OpenUni-IBFlow-512 (Ours) | 2 | 0.86 | 81.15 | 0.756 | 0.089 | 0.231 | 0.385 | 0.231 | | Qwen-Image-20B | 50 × 2 | 0.87 | 88.32 | 0.880 | 0.888 | 0.194 | 0.427 | 0.306 | | Qwen-Image-Lightning | 2 | 0.85 | 86.47 | 0.875 | 0.879 | 0.098 | 0.415 | 0.292 | | TwinFlow (Qwen) | 2 | 0.82 | 87.01 | 0.862 | 0.825 | 0.130 | 0.364 | 0.267 | | pi-Flow (GM-Qwen) [3] | 2 | 0.83 | 86.45 | 0.837 | 0.634 | 0.176 | 0.382 | 0.259 | | ArcFlow (Qwen) | 2 | 0.84 | 87.94 | 0.868 | 0.789 | 0.182 | 0.418 | 0.283 | | IBFlow-Qwen (Ours) | 2 | 0.86 | 88.67 | 0.877 | 0.863 | 0.180 | 0.425 | 0.301 |

表 2:在 2 NFE 下 Qwen-Image-20B 的 DPG-Bench 细粒度分解。我们报告了 DPG 总分、四个 L1 轴(全局、实体、关系、属性)以及涵盖结构、关系、颜色和细节的最具信息量的 L2 轴。

| Method | NFE | DPG total | L1 axes Global | L1 axes Entity | L1 axes Relation | L1 axes Attribute | L2 axes Whole | L2 axes Spatial | L2 axes Color | L2 axes Texture | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | ArcFlow [37] | 2 | 87.94 | 83.89 | 93.09 | 94.58 | 90.02 | 94.86 | 94.93 | 94.28 | 90.08 | | IBFlow-Qwen (Ours) | 2 | 88.68 | 85.11 | 93.59 | 95.20 | 90.76 | 95.56 | 95.59 | 94.93 | 91.17 | | Improvement (∆) | – | +0.74 | +1.22 | +0.50 | +0.62 | +0.74 | +0.70 | +0.66 | +0.65 | +1.09 |

这表明 IB 有界监督器 $\tau_{CA^*}$ 在高熵的早期阶段将学生模型锚定在安全的低频布局上;纹理(Texture)提升了 +1.09,反映了边界行为 $\omega^*(t) \to 1$,该行为撤回了后期阶段的引导并消除了过度锐化。其余轴(实体、关系、颜色)也得到了改善,证实了这两个互补的 IB 驱动调度共同提升了整个熵减轨迹上的保真度,而非仅沿单一维度提升。

定性比较。图 3 比较了来自 Qwen-image-Lightning、ArcFlow、TwinFlow 和 IBFlow 的样本,其中右侧两列对 $\tau_{CA^*}$ 和 $\omega^*(t)$ 进行了消融实验。静态 CA 基线在四个正交维度上失败:结构保真度坍塌、语义对齐断裂、色彩保真度失真以及纹理细节退化。IBFlow 同时改善了所有这四个维度,在结构、语义、颜色和纹理方面与多步教师模型相匹配。移除 $\tau_{CA^*}$ 主要损害结构保真度和语义对齐,而移除 $\omega^*(t)$ 主要损害色彩保真度和纹理细节,这为我们动态注入目标和强度的互补角色提供了直观的视觉确认。

4.3 消融研究

两个动态调度是互补的。表 3 在相同的训练预算和超参数下,隔离了每个动态组件对 Qwen-Image-20B 的影响。仅添加动态注入目标 $\tau_{CA^*}$ 可将 ArcFlow 从 0.84 / 87.94 提升至 0.85 / 88.37;仅添加动态注入强度 $\omega^*(t)$ 可将其提升至 0.86 / 88.50;两者结合则达到最佳的 0.86 / 88.67。因此,这两个调度解决了互补的失败模式:$\tau_{CA^*}$ 防止学生模型在早期阶段跨越过大的语义差距并恢复高频保真度,而 $\omega^*(t)$ 则消除了定理 2 所预测的过度条件化伪影。

8

第 9 页

闪电 ArcFlow TwinFlow ours 无动态 $\tau_{CA^*}$ 无动态 $\omega^*(t)$

图 3:在 DPG-Bench 上的定性比较。IBFlow 在所有 2 步基线之上同时提升了结构保真度、语义对齐、色彩保真度和纹理细节,而最右侧两列证实了动态目标 $\tau_{CA^*}$ 和动态强度 $\omega^*(t)$ 的必要性。

表 3:Qwen-Image 上的组件分解 表 4:散度预算 $\kappa$ 的影响 表 5:$\omega$ 调度策略的比较

方法 Geneval DPG 预算 ($\kappa$) Geneval DPG 调度策略 ($\omega$) Geneval DPG

ArcFlow 0.84 87.94 $\kappa = 0.5$ 0.85 88.16 恒定 0.85 88.37 + 动态 $\tau_{CA^*}$ 0.85 88.37 $\kappa = 1.0$ 0.86 88.32 线性衰减 0.85 87.82 + 动态 $\omega^*(t)$ 0.86 88.50 $\kappa = 1.5$ 0.86 88.67 余弦衰减 0.86 88.16 IBFlow 0.86 88.67 $\kappa = 3.0$ 0.84 86.13 SNR-解析解 0.86 88.67

散度预算 $\kappa$ 的选择。表 4 扫描了 IB 预算 $\kappa$,它控制当前状态与监督者之间的最大允许 KL 散度。较小的 $\kappa$ 会过度限制注入目标,导致学生模型缺乏有用的监督;而过大的 $\kappa$ 则违反了引理 1 中的局部 Fisher 信息近似,并重新引入蒸馏不稳定性。闭式调度在 $\kappa=1.5$ 时达到峰值,此时 IBFlow 恢复了完整的 0.86 / 88.67。

5 结论

在本文中,我们提出了 IB-Flow,这是一种新颖的信息瓶颈引导的动态无分类器引导(CFG)蒸馏框架,显著提升了少步文本到图像生成的性能上限。现有框架依赖于盲目注入范式,即强制使用静态引导强度并不加区分地采样监督者目标。为了克服这些瓶颈,我们引入了一种双轨自适应机制:一种实例感知的目标选择策略,确保在高熵的早期阶段进行保守的宏观结构锚定;以及一种熵感知的引导强度调度策略,平滑地衰减至自然流形,以消除 CFG 过度条件化伪影。在多个大型骨干网络上的广泛实证评估表明,IB-Flow 在极端的 2 步配置下实现了最先进的生成保真度,有效地恢复了结构和色彩保真度。

9

第 10 页

参考文献

[1] Black Forest Labs. FLUX.1: Open-weights state-of-the-art text-to-image generation. https://github. com/black-forest-labs/flux, 2024. FLUX.1-dev 模型发布。 [2] J. Chang 等. OneIG-Bench: A comprehensive benchmark for fine-grained text-to-image generation. arXiv preprint, 2025. 五轴基准测试:对齐、文本、多样性、风格、推理。 [3] H. Chen, Y. Zhang, H. Tan, L. Guibas, G. Wetzstein, 和 S. Bi. pi-flow: Policy-based few-step generation via imitation distillation. In ICLR, 2026. [4] T. M. Cover 和 J. A. Thomas. Elements of Information Theory. Wiley-Interscience, 第2版, 2006. [5] Z. Geng, M. Deng, X. Bai, J. Z. Kolter, 和 K. He. Mean flows for one-step generative modeling. arXiv preprint arXiv:2505.13447, 2025. [6] D. Ghosh, H. Hajishirzi, 和 L. Schmidt. GenEval: An object-focused framework for evaluating text-to- image alignment. In NeurIPS, 2023. [7] J. Gu, T. Chen, D. Berthelot, H. Zheng, Y. Wang, R. Zhang, L. Dinh, M. A. Bautista, J. Susskind, 和 S. Zhai. Starflow: Scaling latent normalizing flows for high-resolution image synthesis. arXiv preprint arXiv:2506.06276, 2025. [8] D. Guo, S. Shamai, 和 S. Verdú. Mutual information and minimum mean-square error in gaussian channels. IEEE Transactions on Information Theory, 51(4):1261–1282, 2005. [9] J. Ho, A. Jain, 和 P. Abbeel. Denoising diffusion probabilistic models. Advances in neural information processing systems, 33:6840–6851, 2020. [10] J. Ho 和 T. Salimans. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598, 2022. [11] J. Ho, T. Salimans, A. Gritsenko, W. Chan, M. Norouzi, 和 D. J. Fleet. Video diffusion models. Advances in neural information processing systems, 35:8633–8646, 2022. [12] X. Hu, R. Wang, Y. Fang, B. Fu, P. Cheng, 和 G. Yu. ELLA: Equip diffusion models with LLM for enhanced semantic alignment. arXiv preprint arXiv:2403.05135, 2024. 引入了 DPG-Bench 基准测试。 [13] B. Kim, Y.-G. Hsieh, M. Klein, M. Cuturi, J. C. Ye, B. Kawar, 和 J. Thornton. Simple reflow: Improved techniques for fast flow models. arXiv preprint arXiv:2410.07815, 2024. [14] A. Lee 等. SenseFlow: Scaling distribution matching for flow-based text-to-image distillation. arXiv preprint arXiv:2506.00523, 2025. [15] S. Lin, A. Wang, 和 X. Yang. Sdxl-lightning: Progressive adversarial diffusion distillation. arXiv preprint arXiv:2402.13929, 2024. [16] Y. Lipman, R. T. Chen, H. Ben-Hamu, M. Nickel, 和 M. Le. Flow matching for generative modeling. In The Eleventh International Conference on Learning Representations, 2023. [17] D. Liu, P. Gao, D. Liu, R. Du, Z. Li, Q. Wu, X. Jin, S. Cao, S. Zhang, H. Li, 和 S. Hoi. Decoupled dmd: Cfg augmentation as the spear, distribution matching as the shield. arXiv preprint arXiv:2511.22677, 2024. [18] D. Liu, P. Sun, Y. Han, Z. Cheng, C. Chen, 和 T. Lin. Self-adversarial one step generation via condition shifting. arXiv preprint arXiv:2604.12322, 2026. [19] X. Liu, C. Gong, 和 Q. Liu. Flow straight and fast: Learning to generate and transfer data with rectified flow. In The Eleventh International Conference on Learning Representations, 2023. [20] X. Liu, X. Zhang, J. Ma, J. Peng, 等. Instaflow: One step is enough for high-quality diffusion-based text-to-image generation. In The Twelfth International Conference on Learning Representations, 2023. [21] E. Luhman 和 T. Luhman. Knowledge distillation in iterative generative models for improved sampling speed. arXiv preprint arXiv:2101.02388, 2021. [22] W. Luo, T. Hu, S. Zhang, J. Sun, Z. Li, 和 Z. Zhang. Diff-instruct: A universal approach for transferring knowledge from pre-trained diffusion models. In Advances in Neural Information Processing Systems, volume 36, 2024. [23] ModelTC Team. Qwen-Image-Lightning: Few-step distillation of qwen-image. https://github.com/ ModelTC/Qwen-Image-Lightning, 2025. Qwen-Image 的 8 步蒸馏。 [24] R. Rombach, A. Blattmann, D. Lorenz, P. Esser, 和 B. Ommer. High-resolution image synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 10684–10695, 2022. [25] C. Saharia, W. Chan, S. Saxena, L. Li, J. Whang, E. L. Denton, K. Ghasemipour, R. Gontijo Lopes, B. Karagol Ayan, T. Salimans, 等. Photorealistic text-to-image diffusion models with deep language understanding. Advances in neural information processing systems, 35:36479–36494, 2022. [26] T. Salimans 和 J. Ho. Progressive distillation for fast sampling of diffusion models. arXiv preprint arXiv:2202.00512, 2022. [27] A. Sauer, D. Lorenz, A. Blattmann, 和 R. Rombach. Adversarial diffusion distillation. In European Conference on Computer Vision, pages 87–103. Springer, 2024. [28] J. Sohl-Dickstein, E. Weiss, N. Maheswaranathan, 和 S. Ganguli. Deep unsupervised learning using nonequilibrium thermodynamics. In International conference on machine learning, pages 2256–2265. pmlr, 2015.

10

第 11 页

[29] Y. Song, P. Dhariwal, M. Chen, 和 I. Sutskever。一致性模型。2023年。 [30] Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, 和 B. Poole。通过随机微分方程进行基于分数的生成建模。在《国际学习表征会议》中,2021年。 [31] P. Sun 和 T. Lin。通过第N阶递归一致速度场估计实现任意步生成。在《国际学习表征会议》中,2026年。RCGM。 [32] N. Tishby, F. C. Pereira, 和 W. Bialek。信息瓶颈方法。在《第37届通信、控制和计算年度Allerton会议》中,第368–377页,1999年。 [33] F.-Y. Wang, Z. Huang, A. Bergman, D. Shen, P. Gao, M. Lingelbach, K. Sun, W. Bian, G. Song, Y. Liu 等。阶段性一致性模型。在《神经信息处理系统进展》中,2024年。 [34] A. Wu 等。TwinFlow:利用自对抗流在大型模型上实现单步生成。arXiv预印本 arXiv:2512.05150,2025年。 [35] C. Wu, P. Zheng, R. Yan, S. Xiao, X. Luo, Y. Wang 等。Qwen-Image 技术报告。arXiv预印本 arXiv:2508.02324,2025年。 [36] S. Wu, Z. Wu, Z. Gong, Q. Tao, S. Jin, Q. Li, W. Li, 和 C. C. Loy。OpenUni:统一多模态理解与生成的简单基线。arXiv预印本 arXiv:2505.23661,2025年。 [37] A. Yang 等。ArcFlow:通过高精度非线性流蒸馏释放两步文本到图像生成能力。arXiv预印本 arXiv:2602.09014,2026年。 [38] T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, 和 B. Freeman。改进的分布匹配蒸馏以实现快速图像合成。《神经信息处理系统进展》,37:47455–47487,2024年。 [39] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park。基于分布匹配蒸馏的单步扩散。在《IEEE/CVF计算机视觉与模式识别会议论文集》中,第6613–6623页,2024年。 [40] T. Yin, M. Gharbi, R. Zhang, E. Shechtman, F. Durand, W. T. Freeman, 和 T. Park。基于分布匹配蒸馏的单步扩散。在《IEEE/CVF计算机视觉与模式识别会议论文集》中,第6613–6623页,2024年。 [41] K. Zheng, Y. Wang, Q. Ma, H. Chen, J. Zhang, Y. Balaji, J. Chen, M.-Y. Liu, J. Zhu, 和 Q. Zhang。通过分数正则化连续时间一致性进行大规模扩散蒸馏。arXiv预印本 arXiv:2510.08431,2025年。 [42] Y. Zhu, X. Liu, 和 Q. Liu。Slimflow:利用整流流训练更小的单步扩散模型。在《欧洲计算机视觉会议》中,第342–359页。Springer,2024年。

11

第 12 页

A 信息瓶颈公式的证明

本附录提供了正文中引理 1、引理 2、定理 1 和定理 2 的完整证明。论述严格遵循第 3 节使用的顺序:每个子章节对应一个陈述,且标签与正文中引用的标签相匹配。

A.1 引理 1 的证明(基于费雪信息的局部 KL 界)

我们证明,在流匹配(Flow Matching)框架下,$t$ 和 $\tau = t + \Delta t$ 处边缘分布之间的局部 KL 散度可近似为

$$ D_{KL}(p_t \| p_\tau) \approx \frac{1}{2} (\tau – t)^2 \|\Delta v_t(x_t)\|_2^2. $$

对于连续归一化流,边缘密度 $p_t(x_t)$ 满足连续性方程

$$ \partial_t p_t + \nabla \cdot (p_t v_t) = 0. \quad (15) $$

对于 FM 中使用的概率路径(例如 OT-Flow 或 VP-Flow),预测向量场 $v_t$ 通过时间相关的标量权重 $\sigma_t$ 与 Stein 得分 $\nabla_{x_t} \log p_t$ 内在耦合:

$$ v_t(x_t) \propto \mathbb{E}[X_1 | X_t = x_t] – x_t \propto \sigma_t^2 \nabla_{x_t} \log p_t(x_t). \quad (16) $$

CFG 残差为 $\Delta v_t = v_t(x_t, c) – v_t(x_t, \emptyset)$。代入 (16),

$$ \Delta v_t(x_t) \propto \nabla_{x_t} \log p_t(x_t | c) – \nabla_{x_t} \log p_t(x_t) = \nabla_{x_t} \log \frac{p_t(x_t, c)}{p_t(x_t) p(c)} = \nabla_{x_t} PMI_t(x_t; c), \quad (17) $$

因此 $\|\Delta v_t\|_2$ 与由条件 $c$ 注入的点互信息(pointwise mutual information)的空间梯度成正比。

通过对 $\Delta t$ 进行二阶泰勒展开,同一参数路径上两个无限接近分布之间的 KL 散度满足

$$ D_{KL}(p_t \| p_{t+\Delta t}) \approx \frac{1}{2}(\Delta t)^2 IF(t), \quad IF(t) = \mathbb{E}_{p_t} \left[ \left( \partial_t \log p_t \right)^2 \right]. \quad (18) $$

对于由 CFG 驱动的转换,时间得分变化的主要贡献是由 $\Delta v_t$ 引起的条件偏移。将此时间变化转化为空间 PMI 梯度可得

$$ D_{KL}^{CA}(p_t \| p_\tau) \approx \frac{1}{2}(\tau – t)^2 \|\nabla_{x_t} PMI_t(x_t; c)\|_2^2 \propto \frac{1}{2}(\tau – t)^2 \|\Delta v_t(x_t)\|_2^2, \quad (19) $$

从而确立了引理 1。

A.2 引理 2 的证明(允许注入跨度)

给定 IB 预算 $D_{KL}(p_t \| p_\tau) \le \delta$,我们将引理 1(在附录 A.1 中证明)中的近似值代入约束条件:

$$ \frac{1}{2}(\tau – t)^2 \|\Delta v_t(x_t)\|_2^2 \le \delta. \quad (20) $$

由于 $(\tau – t) \ge 0$ 且 $\|\Delta v_t(x_t)\|_2 \ge 0$,取平方根并重新排列可得

$$ \tau – t \le \sqrt{\frac{2\delta}{\|\Delta v_t(x_t)\|_2^2}}, \quad (21) $$

这正是引理 2 中所述的允许注入跨度。该界限是实例感知的:较大的 CFG 残差(尖锐的局部条件梯度)会收紧允许的注入范围,而较小的残差则允许看得更远。

12

第 13 页

A.3 定理1的证明(闭式最优注入目标)

我们证明闭式解 $$ \tau_{CA}^*(x_t, t) = \min \left( 1, t + \frac{\kappa}{\sqrt{\|v_{ct}(x_t) – v_{ut}(x_t)\|_2^2 + \epsilon}} \right), \quad \kappa = \sqrt{2\delta}. $$

在流匹配(Flow Matching)下,前向过程 $\{X_\tau\}$ 是从 $X_t$ 到 $X_1$ 的单调信息通道,因此 $$ \tau_1 \le \tau_2 \implies I(X_{\tau_1}; X_1 \mid X_t) \le I(X_{\tau_2}; X_1 \mid X_t). \quad (22) $$ 因此,信息瓶颈(IB)目标函数 (8) 关于 $\tau$ 是非递减的,其最优值在约束允许的最大 $\tau$ 处取得。

结合引理2中的单调性以及允许的时间跨度,得到不受终端约束的最优解: $$ \tau^\diamond = t + \frac{\sqrt{2\delta}}{\|\Delta v_t(x_t)\|_2}. \quad (23) $$

由于 $X_1$ 是干净数据状态,监督器时间步 $\tau$ 的上界为终端时间 $\tau \le 1$。通过对 $\tau^\diamond$ 进行上界截断,并在分母中添加一个小量 $\epsilon > 0$ 以防止除以零,我们得到 $$ \tau_{CA}^*(x_t, t) = \min \left( 1, t + \frac{\kappa}{\|v_{ct}(x_t) – v_{ut}(x_t)\|_2 + \epsilon} \right), \quad (24) $$ 其中 $\kappa = \sqrt{2\delta}$,从而证明了定理1。

A.4 定理2的证明(闭式最优注入强度)

我们证明由信噪比(SNR)驱动的调度策略

$$ \omega^*(t) = 1 + (\omega_{\max} – 1) \cdot \frac{1}{\text{SNR}(t)} = \frac{t^2}{(1-t)^2} \cdot \frac{1}{1 + \gamma \text{SNR}(t)}. \quad (1-t)^2 $$ *(注:原文公式排版较为混乱,此处根据上下文逻辑还原,通常 $\omega(t)$ 与 SNR 成反比或相关,原文公式部分可能存在排版错误,但此处忠实翻译原文结构)*

IB 条件注入目标函数 (12) 包含生成保真度项 $I(X_{\omega t}; X_1 \mid C)$。根据条件互信息的链式法则, $$ I(X_{\omega t}; X_1 \mid C) = H(X_1 \mid C) – H(X_1 \mid X_{\omega t}, C). \quad (25) $$

第一项 $H(X_1 \mid C)$ 是数据-条件联合分布的固有属性,因此与引导调度 $\omega$ 无关。 consequently,保真度项中唯一的 $\omega$ 依赖分量是负残差熵 $-H(X_1 \mid X_{\omega t}, C)$,这意味着通过提高 $\omega$ 获得的可达保真度增益,受限于在观测到 $X_{\omega t}$ 和 $C$ 后关于 $X_1$ 剩余的残差不确定性: $$ \Delta I(X_{\omega t}; X_1 \mid C) \le H(X_1 \mid X_{\omega t}, C) \le H(X_1 \mid X_t), \quad (26) $$ 其中第二个不等式成立是因为在 $X_t$ 基础上附加额外信息(条件 $C$)不能增加熵。方程 (26) 表明,$\omega$ 带来的边际保真度增益由 $H(X_1 \mid X_t)$ 决定,即在给定当前状态下关于干净数据的残差不确定性。

根据 I-MMSE 关系 [8],当正向轨迹被局部建模为加性高斯噪声通道时,从 $X_t$ 估计 $X_1$ 的后验方差与瞬时信噪比成反比。忽略对数因子,

$$ H(X_1 \mid X_t) \propto \frac{1}{1 + \text{SNR}(t)}. \quad (27) $$

在 Rectified Flow 路径 $X_t = tX_1 + (1-t)X_0$ 下,其中 $X_0 \sim \mathcal{N}(0, I)$,信号幅度恰好为 $t$,噪声幅度为 $1-t$,因此

$$ \text{SNR}(t) = \frac{\|tX_1\|_2^2}{\|(1-t)X_0\|_2^2} = \frac{t^2}{(1-t)^2}. \quad (28) $$

13

第 14 页

为了在不通过过度条件化导致流形失真的情况下最小化信息瓶颈(Information Bottleneck)成本,补充的无分类器引导(Classifier-Free Guidance)驱动 $\Delta\omega(t) = \omega(t) – 1$ 应与公式 (27) 中的剩余不确定性成比例缩放。通过在具有高熵的初始阶段将最大驱动锚定为 $\omega(0) = \omega_{\text{max}}$ 并代入公式 (28),我们得到

$$ \omega^*(t) = 1 + (\omega_{\text{max}} – 1) \cdot \frac{1}{1 + \gamma \text{SNR}(t)}, \quad (29) $$

其中 $\gamma > 0$ 控制信噪比(SNR)的敏感性。当 $t \to 1$ 时,$\text{SNR}(t) \to \infty$ 且 $\omega^*(t) \to 1$,因此引导平滑地撤回至无条件流形,从而从源头上消除了无分类器引导(CFG)过度条件化产生的伪影。这证明了定理 2。

B 计算资源

手稿中的每次主要训练均在 32 块配备 80GB 显存的 NVIDIA A100 GPU 上进行,耗时约 1.5 天。我们报告了论文中实验的计算配置,而额外的探索性运行可能需要超出最终报告设置的额外计算资源。

C 局限性

尽管 IB-Flow 实现了卓越的效率和保真度,但仍有若干局限性需要在未来工作中解决:

教师分布的上限。作为一种基于蒸馏的框架,IB-Flow 主要关注压缩预训练教师模型的迭代采样轨迹。虽然我们的信息论动态调度显著减少了过度条件化伪影并弥合了语义差距,但其根本的生成能力仍受限于教师分布和训练语料库。由于我们保持与教师相同的数据集以确保公平比较,该模型在多样性或底层数据分布方面并未表现出超出教师已掌握范围的剧烈变化。

针对基于流的轨迹。我们目前针对动态注入目标 $\tau_{CA}^*$ 和强度 $\omega^*$ 的数学推导是针对流匹配(Flow Matching)和校正流(Rectified Flow)框架优化的。虽然信息瓶颈(Information Bottleneck)原理具有普适性,但将这些闭式解扩展到传统的基于随机微分方程(SDE)的扩散模型,可能需要对非线性方差调度进行额外的近似处理。

D 更广泛的影响

IB-Flow 的发展既带来积极的社会效益,也存在潜在的伦理风险:

积极影响。通过将高质量图像生成的计算成本降低 25 倍至 50 倍,我们的框架使最先进的 AI 技术得以普及。这显著降低了创作者和研究人员的硬件门槛,减少了大规模推理相关的碳足迹,并使得在边缘设备上实现实时交互式应用成为可能。

消极影响。与任何先进的生成技术一样,IB-Flow 的高保真度和极快速度可能被滥用于快速创建欺骗性合成媒体或“深度伪造”(Deepfakes)。仅需两步即可生成接近照片真实感的图像,这增加了实时检测的难度,并可能被用于虚假信息运动。我们鼓励社区整合稳健的数字水印和来源标准(例如 C2PA)以减轻这些风险。

14

发表评论