三分钟导读:关键创新在于使用Real-ESRGAN在像素空间进行超分。相比Latent插值,GAN能保留结构并添加高频细节,有效避免了Latent上采样带来的模糊和伪影问题,为后续微调提供高质量基础。
英文题目:Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
论文出处:arXiv 每日论文精选 · arXiv:2607.01642
原始论文:PDF / 论文页面
对应视频标题:免训练让Flow Matching加速10倍:MrFlow做对了什么?|推荐指数:★★★★★
这篇论文解决什么问题?
Flow Matching已成为图像生成主流,但推理成本高。现有免训练加速方法如Feature Caching仅提速4-8倍,而Latent Space上采样方法常导致模糊和伪影,难以兼顾速度与质量。
核心创新
方法概览
关键创新在于使用Real-ESRGAN在像素空间进行超分。相比Latent插值,GAN能保留结构并添加高频细节,有效避免了Latent上采样带来的模糊和伪影问题,为后续微调提供高质量基础。
逐图理解论文
MrFlow核心思路

MrFlow提出分阶段采样策略:先在低分辨率Latent空间生成全局结构,解码至像素空间后,利用预训练GAN进行超分辨率,再编码回Latent空间,最后进行高分辨率微调。全程无需训练。
创新点一:像素空间超分

关键创新在于使用Real-ESRGAN在像素空间进行超分。相比Latent插值,GAN能保留结构并添加高频细节,有效避免了Latent上采样带来的模糊和伪影问题,为后续微调提供高质量基础。
实验结果:Qwen-Image

在Qwen-Image上,MrFlow实现10.3倍加速,GenEval得分0.86,仅比原生0.88略低。OneIG-Bench损失控制在1%以内,证明了其在保持生成质量方面的优越性,远超TeaCache等缓存方法。
组合加速:MrFlow†

MrFlow可与Timestep Distillation模型如Pi-Flow正交结合。在Qwen-Image上,组合方案MrFlow†实现25.1倍加速,GenEval保持0.85。这种无需联合微调的兼容性,极大提升了部署灵活性。
总结

MrFlow通过像素空间超分与低强度噪声注入,实现了免训练的高效多分辨率生成。它在FLUX和Qwen-Image上均取得>10倍加速且质量损失极小,为Flow Matching模型的实时应用提供了新范式。
实验与关键结果
- 在Qwen-Image上,MrFlow实现10.3倍加速,GenEval得分0.86,仅比原生0.88略低。OneIG-Bench损失控制在1%以内,证明了其在保持生成质量方面的优越性,远超TeaCache等缓存方法。
- 在FLUX.1-dev上,MrFlow实现8.25倍加速,GenEval得分0.63,接近原生0.66。相比LSSGen和RALU等Latent上采样方法,MrFlow在同等加速比下显著减少了伪影,提升了视觉质量。
- 在Qwen-Image上,MrFlow实现10.3倍加速,GenEval得分0.86,仅比原生0.88略低。OneIG-Bench损失控制在1%以内,证明了其在保持生成质量方面的优越性,远超TeaCache等缓存方法。
- 在FLUX.1-dev上,MrFlow实现8.25倍加速,GenEval得分0.63,接近原生0.66。相比LSSGen和RALU等Latent上采样方法,MrFlow在同等加速比下显著减少了伪影,提升了视觉质量。
阅读时需要注意
- 需注意,MrFlow包含VAE编解码和SR网络开销,端到端加速比可能低于仅计算Latent步数的基准。此外,若SR模型引入低频偏差,低强度噪声假设可能失效,导致细节丢失。
- Speedup measurements are end-to-end, including text encoding, VAE, and SR, making them more realistic but potentially lower than latent-only benchmarks.
- The method assumes the SR output preserves coarse layout; if SR introduces diffuse blur or low-frequency shifts, the low-strength noise assumption fails.
- Combination with timestep distillation (MrFlow†) uses pre-trained weights without joint fine-tuning, which may not be optimal for all distillation models.
关联工作
- Flow Matching已成为图像生成主流,但推理成本高。现有免训练加速方法如Feature Caching仅提速4-8倍,而Latent Space上采样方法常导致模糊和伪影,难以兼顾速度与质量。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
多分辨率流匹配:通过分阶段采样实现无需训练的扩散模型加速
郑兴宇1,2 刘祥龙1,2∗ 丁一夫1,2,3 冯伟伦4,5 林俊青6 郭金阳1,7 秦浩通8 1 复杂环境与软件国家重点实验室,北京航空航天大学 2 计算机科学与工程学院,北京航空航天大学 3 南洋理工大学 4 中国科学院计算技术研究所 人工智能安全国家重点实验室 5 中国科学院大学 6 中国科学技术大学 7 人工智能学院,北京航空航天大学 8 苏黎世联邦理工学院 2026 7月 2 [cs.CV] Qwen-Image ToMA 1.01x DB-Taylor 4.13x SPEED 8.61x RALU 8.79x MrFlow 10.3x Pi-Flow 19.6x MrFlow† 25.1x
图 1:MrFlow 与 Qwen-Image 上各种方法的定性比较。虚线分隔了预训练模型、无需训练的策略以及依赖或利用时间步蒸馏(Timestep Distillation)的策略。
摘要
硬件无关的文本到图像扩散加速策略,如时间步蒸馏(Timestep Distillation)和特征缓存(Feature Caching),可以在无需自定义内核或系统级优化的情况下减少推理时间。其中,多分辨率生成策略最近受到了广泛关注,在无需任何训练的情况下实现了超过 5 倍的加速。然而,在潜在空间(latent space)中进行上采样以及选择性修改部分区域的设计,导致这些方法表现出明显的模糊或伪影。为此,我们提出了 MrFlow,这是一种针对预训练流匹配(Flow Matching)模型的无需训练的多分辨率加速策略,其构建于分阶段的低分辨率到高分辨率流水线之上。MrFlow 首先在低分辨率下快速生成主要结构,然后使用轻量级预训练的基于 GAN 的模型在像素空间(pixel space)中进行超分辨率(Super-Resolution, SR),随后注入低强度噪声以启用高频重采样,最后在高分辨率下细化细节。在 FLUX.1-dev 和 Qwen-Image 上的定性和定量结果表明,MrFlow 利用低分辨率采样的二次方令牌(token)减少和降低的步骤需求,实现了 10 倍的端到端加速,同时保持 OneIG-Bench 得分相对于加速前仅在 1% 的差距内,显著超越了其他无需训练的加速策略,且完全不需要训练或运行时动态识别。MrFlow 还可以进一步与预训练的时间步蒸馏策略正交组合,实现高达 25 倍的生成加速。
∗ 通讯作者:刘祥龙 <xlliu@buaa.edu.cn>。
1
第 2 页
原生 潜在空间上采样 扩散去噪
低分辨率 高分辨率 VAE VAE 表示空间 解码器 解码器 潜在空间 HR HR 像素空间
MrFlow 解码器VAE GANSR VAE编码器 解码器VAE LR 12步 HR 单步 HR
图 2:MrFlow 的框架。对比策略包括原生推理方案以及在潜在空间执行上采样的方法,如 LSSGen、RALU 和 SPEED。
1 引言
以 Transformer 为主要架构(Peebles & Xie, 2023)并以流匹配(Flow Matching)(Lipman et al., 2022; Liu et al., 2022)为范式的扩散模型已成为图像生成任务的主流。然而,随着生成质量的提升,模型的计算成本也随之增加。以 Qwen-Image-20B(Wu et al., 2025a)为例,在 Nvidia A100 上执行 1024 × 1024 的文生图任务时,扩散采样最多需要 47 秒。因此,许多工作致力于加速基于采样的扩散生成。除了依赖硬件或系统实现加速的策略(如量化(Li et al., 2023)和高效注意力机制(Dao et al., 2022))外,研究人员发现,在扩散模型中可以通过减少计算 token 的数量来实现直接加速。时间步蒸馏(Timestep Distillation)(Salimans & Ho, 2022; Luo et al., 2023)是最有效的加速策略之一,能够将函数评估次数(NFEs)从 50-100 次减少到 1-4 次。特征缓存(Feature Caching)(Liu et al., 2025a)旨在利用相邻时间步之间的相似性,重用历史特征以跳过部分层或结构的计算。然而,这些方法要么严重依赖训练,要么只能实现不到 4 倍的有限加速。一些构建多分辨率级别的工作(Tang et al., 2025; Jeong et al., 2026)利用了图像模态的空间特性,并成功以无训练方式实现了超过 5 倍的加速,但大多数仍依赖于运行时对图像区域的动态识别,且在潜在空间执行上采样的操作会导致不可避免的人工伪影或模糊。
在本文中,我们设计了 MrFlow,这是一种面向现代扩散的多分辨率采样策略。它在低分辨率(LR)下从随机噪声开始生成主要图像结构后,通过超分辨率(SR)网络在原始像素空间中放大图像,然后将低强度噪声注入到 VAE 重新编码的潜在空间中以实现高频重采样,最后在高分辨率(HR)潜在空间中执行快速采样以细化图像细节。MrFlow 利用了图像在不同分辨率下自然拥有的结构保持性和细节差异性,实现了高效由粗到细的生成。该方法:(1) 充分利用了预训练扩散模型在低分辨率下快速生成结构的能力,不仅每步执行时间可加速约 4 倍,而且所需的时间步也更少;(2) 在像素空间中采用预训练的轻量级基于 GAN 的超分辨率网络,在保留低分辨率结构信息的同时添加高频信号;(3) 低强度噪声削弱了超分辨率可能引入的错误高频细节,使得高分辨率流先验能够重新采样并纠正这些细节;(4) 在高分辨率下细化超分辨率难以完全实现的图像细节,且靠近干净图像端的采样轨迹更加自然笔直,使得重采样也能快速完成。MrFlow 的整体框架如图 2 所示。
在 OneIG-Bench 等评估指标以及真实样本生成方面的广泛实验表明,MrFlow 不仅能以超过 10 倍的加速比实现与原生轨迹流生成结果相差不到 1% 的生成效果,而且无需训练或运行时动态统计与识别,显著超越了各种其他无训练加速方法。
2
第 3 页
在生成质量和加速效果两方面均具有优势。MrFlow 还可以与预训练的时间步蒸馏策略直接正交组合,实现高达 25 倍以上的更高生成加速。
总之,我们的贡献如下:
- 多分辨率加速流水线:整体流程包括低分辨率潜在空间采样、VAE 解码、像素空间超分辨率、VAE 编码、噪声注入、高分辨率潜在空间采样以及 VAE 解码。该范式旨在利用低分辨率高效的图像结构生成能力以及高分辨率独特的细节语义处理能力,并明确像素空间超分辨率保留结构,而潜在空间噪声注入可在最终细化之前进行高频重采样。
- 各阶段的原理创新与分析:我们不仅从加速角度阐明了多分辨率流水线,还详细分析了所设计方案在各阶段加速方面的优势。在低分辨率阶段,我们指出不仅每步生成效率自然享有二次方级别的加速,而且其高效的语义生成能力使得时间步自然可以设置得更少;在超分辨率阶段,我们明确指出应在像素空间中使用预训练的基于 GAN 的超分辨率网络以最大程度保留语义信息;在噪声注入阶段,我们指出噪声注入的目的是减少潜在错误的 SR 高频细节的影响,从而使高分辨率流先验能够以较低的强度对其进行重采样;在高分辨率阶段,我们指出可以利用流轨迹在图像侧附近更直这一特性,用极少的步数完成采样。
- 结合操作灵活性与简洁性、高加速比、良好的生成质量以及强大的泛化能力。无需任何训练、特定硬件、复杂的代码适配或额外的运行时统计,即可在保持生成质量的同时实现 10 倍以上的加速。MrFlow 可以自由设置不同的配置,灵活实现加速与生成质量之间的权衡,不仅优于各种免训练加速策略,还可以直接与现有的时间步蒸馏模型正交组合,实现超过 25 倍的更高加速。
2 相关工作
流匹配。流匹配 (Lipman et al., 2022) 和整流流 (Rectified Flow, Liu et al., 2022) 将扩散训练重构为学习数据与噪声之间线性插值上的速度场。对于数据样本 $x_0$ 和噪声 $\epsilon \sim \mathcal{N}(0, I)$,前向过程为: $$ x_t = (1 – \sigma_t)x_0 + \sigma_t\epsilon, \quad (1) $$ 模型学习: $$ v_\theta(x_t, t) \approx \mathbb{E}[\epsilon – x_0 | x_t], \quad (2) $$ 采样过程从 $t=1$ 到 $t=0$ 积分 $\dot{x}_t = v_\theta$。自 SD3 (Esser et al., 2024) 以来的扩散模型,包括典型的先进模型如 FLUX (Black Forest Labs, 2024) 和 Qwen-Image (Wu et al., 2025a),几乎都采用了这种公式。
扩散生成的加速。量化 (Li et al., 2023) 和高效注意力 (Dao et al., 2022) 是依赖硬件或系统实现的通用压缩和加速策略,它们在扩散模型上的加速收益相对有限。扩散特定的加速方法主要是时间步减少 (Salimans & Ho, 2022; Song et al., 2023)、特征缓存 (Liu et al., 2025a; DefTruth, 2025) 和 Token 剪枝 (Lu et al., 2025),这些方法都可以在不依赖硬件的情况下提高采样效率。伴随 10 倍以上的加速,以时间步蒸馏 (Timestep Distillation) (Luo et al., 2023; Ge et al., 2025; Chen et al., 2025) 为代表的策略通常依赖于成本不可忽视的微调训练。特征缓存通常可以在无需训练的情况下实现约 4 倍的推理加速。现有的 Token 压缩工作通常只能实现不到 1.5 倍的推理加速。
多分辨率生成。利用图像在不同分辨率下自然具有的特征信息分布特性,许多工作探索了多阶段生成
第 4 页
从低分辨率到高分辨率 (Saharia et al., 2022b; Ho et al., 2022; Saharia et al., 2022a)。 一类工作旨在扩展可实现的分辨率 (Du et al., 2024; Wu et al., 2025b)。这类工作的目标是生成超出原生分辨率的更大图像,并且它们不关注在原生分辨率下的加速收益。第二类工作将多分辨率视为一种加速手段 (Tang et al., 2025; Jeong et al., 2026; Tian et al., 2025; Xiao et al., 2026);它们旨在将生成重点放在低分辨率上,仅在高分辨率下推断少数步骤以实现加速,并且它们都在潜在空间或频率域内完成上采样。
超分辨率和图像重绘。像素空间中的图像超分辨率长期以来分为三类:以 SwinIR (Liang et al., 2021) 为代表的基于回归的方法,以 Real-ESRGAN (Wang et al., 2021) 为代表的基于生成对抗网络的方法,以及以 OSEDiff (Wu et al., 2024) 为代表的基于扩散模型的方法。图像重绘是另一条与我们相关的工作线。诸如 SDEdit (Meng et al., 2021) 之类的方法在现有图像上添加噪声,然后执行反向去噪,以便在保持语义的同时完成图像编辑;这类方法将加噪-去噪视为图像编辑的基本工具。
3 方法
我们提出了 MrFlow,这是一种从加速角度设计的多分辨率生成策略。其核心理念是首先在低分辨率阶段快速生成整体图像结构,然后映射回像素空间进行超分辨率,随后注入低强度噪声以进行高频重采样,最后在高分辨率阶段对图像进行少量的细节细化。具体而言,MrFlow 包含以下过程:低分辨率潜在空间采样、VAE 解码、像素空间超分辨率、VAE 编码、噪声注入、高分辨率潜在空间采样以及 VAE 解码。作为一种典型配置,MrFlow 在低分辨率阶段仅需 12 个采样步骤,超分辨率后注入的噪声强度通常仅为 0.1,随后在高分辨率阶段只需一个去噪步骤即可。整个流水线的设计基于一个普遍观察:低分辨率阶段决定了图像的全局结构和语义布局,而高分辨率阶段仅需细化上述阶段中超分辨率图像的细粒度细节。本章详细阐述 MrFlow 各阶段的设计;定量分析和消融实验统一放置在第 4.2 节和附录 C 中。
3.1 低分辨率结构生成
公式化。该阶段首先在低分辨率潜在空间中采样初始噪声:
zLR1 ∼N(0, I), zLR1 ∈RC×HL×WL, (3)
其中 C 是潜在通道数,HL × WL 由目标输出尺寸通过预训练 VAE 的下采样因子确定。
然后,它以流匹配形式执行 ODE 采样以获得干净潜在变量:
zLR0 = ΦKLvθ, c zLR1 , (4)
其中 vθ 是预训练的流匹配速度网络,c 是文本条件嵌入,ΦKvθ,c 表示通过 K 步欧拉离散化获得的整流流 ODE 流映射,迭代规则为 zt−h = zt −h vθ(zt, t, c)。该工作通常取 KL = 12。
最后,通过预训练的 VAE 解码器 D 将干净潜在变量映射回像素空间: L ×W Lpx , (5) xLR = D zLR0 , xLR ∈R3×Hpx 其中 HpxL × W Lpx 是低分辨率像素空间尺寸。 在此阶段生成的低分辨率图像几乎已经拥有完整的整体结构和与提示匹配的语义特征。然而,在相同的显示尺寸下,与直接在高分辨率下生成的常规图像相比,它通常显得更模糊,并且文本和符号等局部细粒度语义难以稳定生成。
4
第 5 页
超分辨率
细化
低分辨率 高分辨率 高
插值 SwinIR OSEDiff Real-ESRGAN
图 3: MrFlow 在 Qwen-Image 上采用不同超分辨率策略的示例对比,其中“低分辨率”表示经过低分辨率生成后通过 VAE 解码至像素空间的图像,分辨率为 512×512。“超分辨率”和“高分辨率细化”行分别是超分辨率后的图像和高分辨率细化后的最终图像,分辨率为 1024 × 1024。
分析。低分辨率阶段的加速来自两个相互独立的来源。第一,单步推理的整体成本被测量为几乎随图像 token 数量线性缩放,当每一侧缩小 2 倍时,可实现约 4 倍的综合加速。第二,低分辨率下所需的采样步数本身更少:在相等的步数预算下,以低分辨率为主的两阶段调度仅需 10 步低分辨率加 1 步高分辨率,即可达到比直接使用 11 步高分辨率生成更好的视觉质量,且相对于后者延迟减少了一半以上,同时 CLIP 一致性反而更高。我们将这种少步收敛现象归因于两个互补的原因:低分辨率下更高的文本到图像语义利用率,以及对应低频骨架的更短 ODE 路径;定量分解及相应证据见附录 C.1。附录 C.5 进一步描述了该阶段在建立生成图像全局结构中的作用。
3.2 像素空间超分辨率
公式化。对于经过低分辨率采样和 VAE 解码后获得的图像,我们在像素空间中应用超分辨率: H ×W Hpx , (6) xSR ←U xLR , xSR ∈R3×Hpx
其中 U 是预训练的超分辨率网络,将像素空间图像从低分辨率尺寸 HpxL × WLpx 上采样至高分辨率尺寸 HpxH × W Hpx,本工作中通常选择 ×2 上采样。具体而言,我们直接采用预训练的 Real-ESRGAN (Wang et al., 2021) 作为 U,而非简单的插值或如 SwinIR (Liang et al., 2021) 等基于 L2 监督的超分辨率模型。
在放大分辨率的同时,超分辨率网络既完全保留了低分辨率阶段生成的整体图像结构,又补充了部分高频信息。然而,由于预训练的超分辨率网络不包含提示中的语义信息,且仅源自一般场景下不同分辨率之间分布匹配的预训练知识,此阶段的高分辨率图像仍可能表现出局部结构混乱,如伪影和笔画偏移。
分析。该阶段涉及两个关键设计选择:在像素空间进行上采样,以及采用基于 GAN 的预训练超分辨率模型。首先,像素空间是一个更稳健的上采样域:自然图像的边缘、纹理和功率谱先验均建立在像素之上,且预训练的先验超分辨率文献知识只能在像素域中复用;同时,VAE 编码器自然地衰减了高频分量
5
第 6 页
在像素域中超出训练分布的部分,对超分辨率输出执行轻量级正则化;此外,额外的 VAE 编解码成本相对于扩散模型的推理成本来说非常小。其次,下游细化仅在超分辨率输出保持粗略布局并主要保留局部高频残差时才有效。基于 GAN 的超分辨率通过产生锐利、类似自然图像的细节更好地匹配这一机制,而基于插值或回归的超分辨率虽然保留了布局,但会留下持续的高频衰减和弥散模糊。附录 C.2 给出了相应的经验比较。
3.3 用于高频重采样的低强度噪声
公式化。在像素空间超分辨率之后,通过预训练的 VAE 编码器 $E$ 进行重新编码,得到高分辨率潜在变量:
$$ z_{SR}^0 = E x_{SR}, \quad z_{SR}^0 \in \mathbb{R}^{C \times H_H \times W_H}. \quad (7) $$
与直接从噪声中采样获得的高分辨率干净潜在变量不同,$z_{SR}^0$ 可能包含由 GAN 超分辨率引入的伪影和字符笔画偏移。这些误差主要局限于高频方向,而低频结构已由低分辨率阶段确定,应当予以保留。
为此,在进入高分辨率细化之前,我们以流匹配的形式注入低强度噪声,以获得加噪的 SR 潜在变量:
$$ z_{HR}^t = (1 – \sigma_t) z_{SR}^0 + \sigma_t \epsilon, \quad \epsilon \sim \mathcal{N}(0, I), \quad (8) $$
其中 $\sigma_t \in (0, 1)$ 是与细化时间步匹配的流噪声水平,本文通常取 $\sigma_t \in [0.1, 0.15]$。此步骤在保持高信噪比(SNR)的同时保留低频结构,同时降低高频方向的信噪比,以便后续的降噪步骤能够根据高分辨率流先验对其进行重采样。
分析。$z_{SR}^0$ 的全局结构和低频内容很大程度上继承自低分辨率阶段,应当予以保留,而剩余的 uncertainty 主要在于由 GAN 超分辨率引入的高频细节。因此,注入的噪声只需将高频信噪比降低到足以使降噪过程根据数据先验对该频段进行重采样并纠正 SR 潜在错误的程度即可。设 $\lambda_{hf}$ 为干净潜在变量高频频带的功率(即方差);信噪比条件给出了噪声水平的下界:
$$ \sigma_t \ge \sigma_t^\star = \frac{\sqrt{\lambda_{hf}}}{1 + \sqrt{\lambda_{hf}}}. \quad (9) $$
该下界是根据可测量的干净数据的高频功率计算得出的,而非基于未知的 SR 误差范数。因此,它表征了低强度加噪有效的频率机制:一旦 SR 输出在局部上是合理的,且其残差误差主要是高频的,干净潜在变量的高频功率较小使得 $\sigma_t \in [0.1, 0.15]$ 足以进行重采样。如果 SR 输出包含弥散模糊或低频偏差,则此前提不再成立,需要显著更强的加噪,这将抹去有用的 SR 细节并需要更多的步骤。完整的后验均值推导、上述不等式的推导、补充的分布级视角以及功率谱测量均在附录 C.3 中给出。
3.4 高分辨率细节细化
公式化。在完成高分辨率潜在变量的低强度加噪后,我们将加噪的高分辨率潜在变量 $z_{HR}^t$ 作为初始值,并在相同的速度估计网络上沿高分辨率应用流映射:
$$ z_{HR}^0 = \Phi_{K_H}^{v_\theta, c} z_{HR}^t, \quad (10) $$
其中 $c$ 是文本条件嵌入,与低分辨率阶段完全相同,$K_H$ 是高分辨率阶段的欧拉步数。在实践中,我们从噪声水平与前述加噪阶段匹配的时间步开始高分辨率流,并使用
6
第 7 页
默认情况下 $K_H = 1$;在此低强度设置下,增加高分辨率步骤仅带来边际变化。最后,通过 VAE 解码器 $D$ 将干净潜在变量映射回像素空间以获得最终输出: $$ x_{HR} = D(z_{HR}^0), \quad x_{HR} \in \mathbb{R}^{3 \times H_{px}}. \quad (11) $$ 该阶段对超分辨率(SR)输出引入的局部伪影执行最终的一步细节细化,此时整个流水线输出目标分辨率的高质量图像。
分析。高分辨率细化阶段能够仅用一步完成的原因是,加噪的 SR 潜在变量已经接近干净端点。在低强度加噪下,速度场的幅度较为平缓,相邻步骤之间的差异较小,因此单步欧拉离散化误差相应降低;在度量上,当 $s=0.1$ 时,单步去噪相对于 8 步参考的 CLIP 一致性已达到 0.9974,仅比 5 步去噪的 0.9999 低 0.0025。这一现象与 SD3 (Esser et al., 2024) 中关于时间步偏移(timestep shift)的观察一致,即靠近干净端点的时间步段成本较低,这可以视为该原理在 SR 后接低强度噪声注入这一特殊情况下的外推。关于这种单步行为的速度场表征以及调度形状消融实验见附录 C.4;附录 C.5 进一步将该阶段表征为保留已建立结构的细节细化步骤。
4 实证结果
我们主要在文生图任务上进行实验。第 4.1 节回顾实验设置,第 4.2 节主要展示在各种加速策略上的定量指标广泛对比,第 4.3 节是 MrFlow 的整体消融实验。MrFlow 各阶段的进一步分析详见附录 C,更多可视化示例详见附录 F。
4.1 实现细节
我们的主要加速实验在 FLUX.1-dev (Black Forest Labs, 2024) 和 Qwen-Image-20B (Wu et al., 2025a) 上进行,定量评估统一设置为 1024 × 1024 分辨率,评估指标采用三类:GenEval (Ghosh et al., 2023)、DPG-Bench (Hu et al., 2024) 和 OneIG-Bench (Chang et al., 2026)。所选对比方法包括各类典型的免训练加速策略,涵盖基于特征缓存的 Teacache (Liu et al., 2025a) 和 DB-Taylor(Cache-Dit (DefTruth, 2025) 中融合 DBCache 和 TaylorSeer (Liu et al., 2025b) 的综合版本,我们简称为 DB-Taylor),基于 Token 融合的 ToMA (Lu et al., 2025),以及同样基于多分辨率的 LSSGen (Tang et al., 2025)、RALU (Jeong et al., 2026) 和 SPEED (Xiao et al., 2026)。对于加速比大于 8× 的极端高速场景,鉴于上述免训练方法本质上都会面临崩溃,我们额外对比了最先进的依赖训练的时间步蒸馏方法 SenseFlow (Ge et al., 2025) 和 Pi-Flow (Chen et al., 2025),统一设置为 4 步推理版本。对于需要训练的策略,包括所有时间步蒸馏方法和 LSSGen,我们直接加载其官方仓库提供的参数权重,无需重新训练。当 MrFlow 与时间步蒸馏预训练权重结合时,我们将其记为 MrFlow†;该策略在低分辨率和高分辨率阶段直接加载蒸馏模型,无需与多分辨率流水线进行任何额外训练。每个实验均在单块 Nvidia A100 GPU 上运行。报告的加速比均为端到端的实际加速,包括文本编码、随机噪声生成、VAE 编码/解码、SR 以及所有扩散前向传播。所有详细配置均在附录 B 中给出。
第 8 页
表 1:在 FLUX.1-dev 和 Qwen-Image 上各种免训练加速方法的比较,生成分辨率为 1024 × 1024。
| 方法 | 免训练 | NFEs | 加速比 ↑ | Geneval ↑ | DPG ↑ | OneIG-En ↑ | OneIG-Zh ↑ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | FLUX.1-dev | – | 50 | 1x | 0.66 | 84.07 | 0.44 | – | | ToMA | √ | 50 | 1.05x | 0.66 | 83.99 | 0.42 | – | | ToMA | √ | 50 | 1.13x | 0.66 | 83.78 | 0.21 | – | | Teacache | √ | 50 | 4.47x | 0.63 | 82.62 | 0.36 | – | | DB-Taylor | √ | 50 | 4.63x | 0.64 | 83.78 | 0.40 | – | | RALU | √ | 4, 5, 6 | 4.33x | 0.62 | 82.83 | 0.32 | – | | SPEED | √ | 3, 2, 7 | 5.71x | 0.62 | 83.55 | 0.37 | – | | MrFlow | √ | 20, 1 | 5.78x | 0.65 | 82.19 | 0.39 | – | | Teacache | √ | 50 | 7.57x | 0.45 | 70.79 | 0.28 | – | | DB-Taylor | √ | 50 | 7.86x | 0.46 | 74.23 | 0.28 | – | | RALU | √ | 1, 2, 3 | 8.21x | 0.53 | 77.11 | 0.30 | – | | SPEED | √ | 2, 1, 5 | 8.01x | 0.62 | 83.43 | 0.36 | – | | MrFlow | √ | 12, 1 | 8.25x | 0.63 | 81.65 | 0.36 | – | | Qwen-Image | – | 50×2 | 1x | 0.88 | 88.67 | 0.53 | 0.53 | | Teacache | √ | 50×2 | 4.61x | 0.81 | 84.46 | 0.42 | 0.45 | | DB-Taylor | √ | 50×2 | 4.13x | 0.86 | 86.81 | 0.50 | 0.50 | | RALU | √ | (4, 5, 5)x2 | 5.85x | 0.85 | 87.07 | 0.46 | 0.48 | | SPEED | √ | (2, 1, 7)x2 | 6.29x | 0.79 | 87.50 | 0.47 | 0.51 | | MrFlow | √ | (20, 1)x2 | 6.98x | 0.87 | 88.00 | 0.54 | 0.52 | | Teacache | √ | 50×2 | 8.93x | 0.26 | 32.51 | 0.16 | 0.19 | | DB-Taylor | √ | 50×2 | 9.34x | 0.09 | 17.43 | 0.09 | 0.12 | | RALU | √ | (1, 2, 4)x2 | 9.51x | 0.84 | 82.60 | 0.44 | 0.46 | | SPEED | √ | (1, 1, 5)x2 | 8.61x | 0.74 | 84.93 | 0.44 | 0.46 | | MrFlow | √ | (12, 1)x2 | 10.3x | 0.86 | 87.10 | 0.52 | 0.51 |
4.2 主要结果
在本节中,我们对具有不同特性的各种加速策略进行了定量测试。
免训练加速。所有方法原生支持 FLUX.1-dev,而 Qwen-Image 的原生版本未采用蒸馏的单分支 CFG,因此每一步都需要两次前向传播。我们标记了每种方法是否需要训练,并使用虚线分隔不同级别的加速比。表 1 列出了各种免训练方法在两个骨干网络上的结果。作为基于 token 剪枝和合并的代表性方法,ToMA 在测量中仅能获得不到 1.1× 的非常有限的加速比。尽管其指标下降不明显,但生成的图像实际上已经严重崩溃。另一种基于多分辨率的方法 RALU 在 FLUX 上加速比约为 5× 时已表现出一定的精度下降,而当加速比进一步提高到约 8× 时,生成质量下降得更加明显;虽然 RALU 在 Qwen-Image 的高加速比下能更好地保持精度,但当加速比接近 10× 时,其指标也出现明显下降,且视觉检查下的实际图像质量更差。SPEED 提供了比早期潜在上采样策略更强的频域多分辨率基线,但当其被推至与 MrFlow 相同的加速范围时,其在 Qwen-Image 上的精度急剧下降。Teacache 和 DB-Taylor 在加速比约为 4× 时同样能保持较好的生成结果,但当加速比进一步提高到 8× 时,两者均表现出显著崩溃;在更新、更大规模且能力更强的 Qwen-Image 上,基于特征缓存的方法表现出更大的损失,在加速比为 4-5× 时差距已超过 3%,而在更具侵略性的 9× 加速比下直接崩溃。然而,MrFlow 展示了更大的优势:在 20 步低分辨率和 1 步高分辨率的配置下,它保持了良好的精度,相对于原生 50 步,Geneval 的差距仅为约 2%。当设置为 12 步低分辨率和 1 步高分辨率时,在 FLUX 上的加速比提高到 8.25×,在 Qwen-Image 上提高到 10.3×,而 Geneval 分别保持在 0.63 和 0.86,显著超越了基于特征缓存的方法。
8
第 9 页
表 2:在 FLUX.1-dev 和 Qwen-Image 上与依赖训练的加速方法的比较,生成分辨率为 1024 × 1024。
| 方法 | 免训练 | NFEs | 加速比 ↑ | Geneval ↑ | DPG ↑ | OneIG-En ↑ | OneIG-Zh ↑ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | FLUX.1-dev | – | 50 | 1x | 0.66 | 84.07 | 0.44 | – | | LSSGen | × | 25, 25 | 1.49x | 0.65 | 83.51 | 0.40 | – | | LSSGen | × | 25, 4 | 3.93x | 0.64 | 82.77 | 0.40 | √ | | MrFlow | | 12, 1 | 8.25x | 0.63 | 81.08 | 0.36 | – | | SenseFlow | × | 4 | 11.1x | 0.63 | 82.42 | 0.37 | – | | Pi-Flow | × | 4 | 9.49x | 0.68 | 84.40 | 0.41 | – | | MrFlow† | † | 4, 1 | 11.3x | 0.69 | 83.26 | 0.39 | – | | FLUX-schnell | × | 2 | 20.4x | 0.69 | 85.03 | 0.41 | – | | MrFlow‡ | ‡ | 1, 1 | 19.5x | 0.71 | 85.10 | 0.35 | – | | Qwen-Image | – | 50×2 | 1x | 0.88 | 88.67 | 0.53 | 0.53 | | Pi-Flow | × | 4 | 19.6x | 0.85 | 88.10 | 0.53 | 0.52 | | MrFlow† | † | 4, 1 | 25.1x | 0.85 | 87.52 | 0.52 | 0.51 |
基于缓存的方法(如 DB-Taylor)以及基于多分辨率的策略(如 RALU 和 SPEED)在激进配置下的表现。
依赖训练的方法。表 2 进一步比较了 MrFlow 与两种骨干网络上依赖训练的加速方法,包括最先进的时间步蒸馏方法以及多分辨率方法 LSSGen。LSSGen 需要训练一个轻量级潜在上采样器,因此被归类为依赖训练的策略,而非免训练策略。在官方建议的默认配置(噪声强度为 0.75)下,LSSGen 实现了 1.5 倍的加速同时保持了准确性;然而,当噪声强度降低至 0.2 以实现 3.9 倍的加速时,实际生成图像的质量已大幅下降,详见附录 F.1。此处 † 或 ‡ 均表示 MrFlow 与蒸馏方法的组合直接利用了预训练的蒸馏权重,无需与 MrFlow 结合时进行额外训练;两者分别表示 MrFlow 与 Pi-Flow 以及 FLUX-schnell (Black Forest Labs, 2024) 的组合。在 FLUX 上,MrFlow 在免训练的 12+1 步设置下已达到接近 4 步 SenseFlow 的准确性,而 MrFlow+Pi-Flow 在保持可比 Geneval 得分的同时,实现了比原生 4 步 Pi-Flow 更高的加速比。当 MrFlow 与 FLUX-schnell 结合时,尽管由于 VAE 等额外开销,加速比与原生 2 步 FLUX-schnell 相当,但 DPG 也略高于原生 FLUX-schnell。由于时间步蒸馏类方法可以直接将 Qwen-Image 的双分支 CFG 机制融合为单次前向传播,它们本身自然具有更高的加速比;在 Qwen-Image 上,MrFlow 与 Pi-Flow 的结合遵循与 FLUX 相同的趋势,最高可达 25 倍加速,且 OneIG-Bench 损失不超过 1%。这些结果表明,MrFlow 在免训练设置下已达到与依赖训练的时间步蒸馏策略相当的准确性和效率,并且与时间步蒸馏策略具有良好的可组合性。
4.3 消融研究
不同的步数配置。在 Qwen-Image 上,我们对所有免训练方法以及 MrFlow 配置进行了组合实验,其中低分辨率阶段设置为 10、12、16、20 步,高分辨率阶段设置为 1、2、3 步;Geneval 与加速比之间的权衡结果如图 5 所示。显然,MrFlow 是唯一一种在不同模型上持续优于直接将不同时间步配置应用于原生模型的朴素加速策略的方法,并且可以灵活配置以追求更好的准确性或更激进的加速比。请注意,MrFlow 在测试指标上的性能随着低分辨率步数的增加而显著提高,但与高分辨率步数配置没有明显关联。视觉比较也得出了相同的结论。如图 4 所示,增加一个高分辨率细化步骤即可使文本笔画清晰,并消除无细化输出中观察到的模糊现象,而使用两个细化步骤则会产生
第 10 页
FLUX.1-dev Qwen-Image
0.65 0.85
0.80 0.60 Native Native Native Steps 0.75 Native Steps TeaCache 0.55 ToMA DB-Taylor TeaCache Geneval RALU DB-Taylor Geneval0.70 SPEED RALU 0.50 SPEED MrFlow (+3) MrFlow (+3) 0.65 MrFlow (+2) MrFlow (+1) MrFlow (+2) 0.45 MrFlow (+1) 0.25 0.00 1 2 4 6 8 10 1 2 4 6 8 10 12 Speedup Ratio Speedup Ratio
图 5:FLUX.1-dev 和 Qwen-Image 上各种免训练方法的 GenEval 得分与加速比之间的权衡曲线。MrFlow 的不同阴影对应于高分辨率细化阶段使用的不同步数。
表 3:在 Qwen-Image 上生成的 1024 × 1024 分辨率下,不同超分辨率方法选择的比较。
SR method NFEs Speedup ↑ Geneval DPG ↑ OneIG-En ↑ OneIG-Zh ↑
Interpolate (12, 1)x2 10.7x 0.87 87.00 0.52 0.51 SwinIR (12, 1)x2 4.67x 0.86 86.97 0.52 0.51 OSEDiff (12, 1)x2 9.45x 0.85 87.25 0.51 0.49 Real-ESRGAN (12, 1)x2 10.3x 0.86 87.10 0.52 0.51 Real-ESRGAN 12×2 14.0x 0.87 87.45 0.52 0.51
高度相似的结果。这与第 3.4 节的分析一致:在低强度加噪后,靠近干净图像端点的轨迹段足够直,因此单个高分辨率步骤是细节细化的有效默认选择。
超分辨率网络。在 Qwen-Image 上,我们比较了几种超分辨率选择:直接插值、SwinIR、OSEDiff、Real-ESRGAN 以及没有高分辨率细化的仅超分辨率输出。如表 3 所示,大多数超分辨率选择在自动指标上保持接近,而 OSEDiff 略低于 Real-ESRGAN。然而,图 3 中使用 12 个低分辨率步长和 1 个高分辨率步长生成的视觉比较显示,这些指标并不总是对局部高频超分辨率缺陷敏感:高分辨率细化纠正了诸如字符笔画和类文本细节等局部偏差,同时保留了全局结构。Interpolate 和 SwinIR 仍然模糊,OSEDiff 在放大后引入了字符不准确,而基于 GAN 的 Real-ESRGAN 在清晰度、语义准确性和效率之间提供了最佳平衡。
5 结论
我们提出了 MrFlow,一种用于加速预训练流匹配模型的免训练多分辨率策略。MrFlow 结合了快速低分辨率结构生成、基于轻量级 GAN 网络的像素空间超分辨率、低强度潜在加噪和单步高分辨率细化。无需任何训练或运行时动态统计,这种分阶段流水线实现了超过 10 倍的端到端加速,同时保持 OneIG-Bench 损失相对于原生推理在 1% 以内,并且与其他免训练扩散加速策略相比,提供了更好的质量、效率、灵活性和简洁性。MrFlow 还可以直接与时间步蒸馏结合,无需额外训练,从而实现 25 倍的进一步复合加速。
10
第 11 页
参考文献
AUTOMATIC1111。Stable Diffusion Web UI。https://github.com/AUTOMATIC1111/ stable-diffusion-webui,2022。高分辨率修复(Hires.fix)功能。
Christopher M Bishop 和 Nasser M Nasrabadi。模式识别与机器学习,第 4 卷。Springer,2006。
Black Forest Labs。Flux。https://github.com/black-forest-labs/flux,2024。
Black Forest Labs。FLUX.2:前沿视觉智能。https://bfl.ai/blog/flux-2, 2025。
Tim Brooks,Aleksander Holynski 和 Alexei A Efros。Instructpix2pix:学习遵循图像 编辑指令。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 18392–18402 页,2023。
Jingjing Chang,Yixiao Fang,Peng Xing,Shuhan Wu,Wei Cheng,Rui Wang,Xianfang Zeng, Gang Yu 和 Hai-Bao Chen。OneIG-Bench:面向图像生成的全维度细微评估。神经信息处理系统进展,38,2026。
Hansheng Chen,Kai Zhang,Hao Tan,Leonidas Guibas,Gordon Wetzstein 和 Sai Bi。Pi-Flow: 基于策略的通过模仿蒸馏实现少步生成。arXiv 预印本 arXiv:2510.14974, 2025。
Tri Dao,Dan Fu,Stefano Ermon,Atri Rudra 和 Christopher R´e。FlashAttention:具有 I/O 感知能力的快速且内存高效的精确注意力机制。神经信息处理系统进展, 35:16344–16359,2022。
等等。DefTruth,vipshop.com。Cache-DiT:一个具有缓存、并行化、量化和 CPU 卸载功能的 PyTorch 原生推理引擎,用于 DiTs。,2025。URL https://github.com/vipshop/ cache-dit.git。开源软件可在 https://github.com/vipshop/cache-dit.git 获取。
Ruoyi Du,Dongliang Chang,Timothy Hospedales,Yi-Zhe Song 和 Zhanyu Ma。DemoFusion: 以零成本民主化高分辨率图像生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 6159–6168 页,2024。
Bradley Efron。Tweedie 公式与选择偏差。美国统计协会杂志,106(496):1602–1614,2011。
Patrick Esser,Sumith Kulal,Andreas Blattmann,Rahim Entezari,Jonas M¨uller,Harry Saini,Yam Levi,Dominik Lorenz,Axel Sauer,Frederic Boesel 等人。扩展整流流 Transformer 以实现高分辨率图像合成。在第四十一届国际机器学习会议, 2024。
Weilun Feng,Guoxin Fan,Haotong Qin,Chuanguang Yang,Mingqiang Wu,Yuqi Li,Xiangqi Li, Zhulin An,Libo Huang,Dingrui Wang 等人。WorldCache:通过异构令牌缓存免费加速世界模型。arXiv 预印本 arXiv:2603.06331,2026。
Xingtong Ge,Xin Zhang,Tongda Xu,Yi Zhang,Xinjie Zhang,Yan Wang 和 Jun Zhang。Sense- Flow:扩展基于流的文本到图像蒸馏中的分布匹配。arXiv 预印本 arXiv:2506.00523,2025。
Dhruba Ghosh,Hannaneh Hajishirzi 和 Ludwig Schmidt。GenEval:一个以对象为重点的评估文本到图像对齐的框架。神经信息处理系统进展,36: 52132–52152,2023。
Amir Hertz,Ron Mokady,Jay Tenenbaum,Kfir Aberman,Yael Pritch 和 Daniel Cohen-Or。 使用交叉注意力控制进行提示到提示的图像编辑。arXiv 预印本 arXiv:2208.01626, 2022。
Jonathan Ho,Chitwan Saharia,William Chan,David J Fleet,Mohammad Norouzi 和 Tim Sali- mans。级联扩散模型用于高保真图像生成。机器学习研究杂志,23(47):1–33,2022。
11
第 12 页
Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, 和 Gang Yu。Ella:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135,2024。
Wongi Jeong, Kyungryeol Lee, Hoigi Seo, 和 Se Young Chun。用于空间加速扩散 Transformer 的训练无关混合分辨率潜在上采样。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 18673–18682 页,2026。
Tero Karras, Miika Aittala, Timo Aila, 和 Samuli Laine。阐明基于扩散的生成模型的设计空间。神经信息处理系统进展,35:26565–26577,2022。
Bahjat Kawar, Shiran Zada, Oran Lang, Omer Tov, Huiwen Chang, Tali Dekel, Inbar Mosseri, 和 Michal Irani。Imagic:基于文本的真实图像编辑与扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 6007–6017 页,2023。
Xiuyu Li, Yijiang Liu, Long Lian, Huanrui Yang, Zhen Dong, Daniel Kang, Shanghang Zhang, 和 Kurt Keutzer。Q-diffusion:量化扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集,第 17535–17545 页,2023。
Jingyun Liang, Jiezhang Cao, Guolei Sun, Kai Zhang, Luc Van Gool, 和 Radu Timofte。Swinir:使用 Swin Transformer 进行图像恢复。在 IEEE/CVF 国际计算机视觉会议论文集,第 1833–1844 页,2021。
Junqing Lin, Xingyu Zheng, Pei Cheng, Bin Fu, Jingwei Sun, 和 Guangzhong Sun。扩散 Transformer 中上下文生成的令牌剪枝。arXiv 预印本 arXiv:2602.01609,2026。
Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747,2022。
Feng Liu, Shiwei Zhang, Xiaofeng Wang, Yujie Wei, Haonan Qiu, Yuzhong Zhao, Yingya Zhang, Qixiang Ye, 和 Fang Wan。时间步嵌入告知:视频扩散模型缓存之时。在计算机视觉与模式识别会议论文集,第 7353–7363 页,2025a。
Jiacheng Liu, Chang Zou, Yuanhuiyi Lyu, Junjie Chen, 和 Linfeng Zhang。从重用到预测:使用 Taylorseers 加速扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集,第 15853–15863 页,2025b。
Xingchao Liu, Chengyue Gong, 和 Qiang Liu。流直且快:学习使用整流流生成和传输数据。arXiv 预印本 arXiv:2209.03003,2022。
Ze Liu, Yutong Lin, Yue Cao, Han Hu, Yixuan Wei, Zheng Zhang, Stephen Lin, 和 Baining Guo。Swin Transformer:使用移位窗口的分层视觉 Transformer。在 IEEE/CVF 国际计算机视觉会议论文集,第 10012–10022 页,2021。
Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, 和 Jun Zhu。Dpm-solver:一种用于在约 10 步内对扩散概率模型采样的快速常微分方程求解器。神经信息处理系统进展,35:5775–5787,2022。
Wenbo Lu, Shaoyi Zheng, Yuxuan Xia, 和 Shengjie Wang。Toma:用于扩散模型的注意力令牌合并。arXiv 预印本 arXiv:2509.10918,2025。
Simian Luo, Yiqin Tan, Longbo Huang, Jian Li, 和 Hang Zhao。潜在一致性模型:使用少步推理合成高分辨率图像。arXiv 预印本 arXiv:2310.04378,2023。
Chenlin Meng, Yutong He, Yang Song, Jiaming Song, Jiajun Wu, Jun-Yan Zhu, 和 Stefano Ermon。Sdedit:使用随机微分方程进行引导图像合成与编辑。arXiv 预印本 arXiv:2108.01073,2021。
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby 等人。Dinov2:无监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193,2023。
12
第 13 页
William Peebles 和 Saining Xie。具有 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集,第 4195–4205 页,2023。
Yury Polyanskiy 和 Yihong Wu。熵的 Wasserstein 连续性及干扰信道的外界界。IEEE 信息论汇刊,62(7):3992–4002,2016。
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark 等人。从自然语言监督中学习可迁移视觉模型。在国际机器学习会议论文集,第 8748–8763 页。PmLR,2021。
Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L Denton, Kamyar Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans 等人。具有深度语言理解的 photorealistic 文本到图像扩散模型。神经信息处理系统进展,35:36479–36494,2022a。
Chitwan Saharia, Jonathan Ho, William Chan, Tim Salimans, David J Fleet, 和 Mohammad Norouzi。通过迭代细化进行图像超分辨率。IEEE 模式分析与机器智能汇刊,45(4):4713–4726,2022b。
Tim Salimans 和 Jonathan Ho。用于扩散模型快速采样的渐进式蒸馏。arXiv 预印本 arXiv:2202.00512,2022。
Jiaming Song, Chenlin Meng, 和 Stefano Ermon。去噪扩散隐式模型。arXiv 预印本 arXiv:2010.02502,2020。
Yang Song, Prafulla Dhariwal, Mark Chen, 和 Ilya Sutskever。一致性模型。在国际机器学习会议论文集,第 32211–32252 页。PMLR,2023。
Jyun-Ze Tang, Chih-Fan Hsu, Jeng-Lin Li, Ming-Ching Chang, 和 Wei-Chao Chen。Lssgen:利用流和扩散中的潜在空间缩放以实现高效的文本到图像生成。在 IEEE/CVF 国际计算机视觉会议论文集,第 5048–5057 页,2025。
Ye Tian, Xin Xia, Yuxi Ren, Shanchuan Lin, Xing Wang, Xuefeng Xiao, Yunhai Tong, Ling Yang, 和 Bin Cui。无需训练的瓶颈采样扩散加速。arXiv 预印本 arXiv:2503.18940,2025。
Pascal Vincent。得分匹配与去噪自编码器之间的联系。神经计算,23(7):1661–1674,2011。
Xintao Wang, Ke Yu, Shixiang Wu, Jinjin Gu, Yihao Liu, Chao Dong, Yu Qiao, 和 Chen Change Loy。ESRGAN:增强型超分辨率生成对抗网络。在欧洲计算机视觉会议(ECCV)研讨会论文集,第 0–0 页,2018。
Xintao Wang, Liangbin Xie, Chao Dong, 和 Ying Shan。Real-ESRGAN:使用纯合成数据训练真实世界盲超分辨率。在 IEEE/CVF 国际计算机视觉会议论文集,第 1905–1914 页,2021。
Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen 等人。Qwen-image 技术报告。arXiv 预印本 arXiv:2508.02324,2025a。
Haoning Wu, Shaocheng Shen, Qiang Hu, Xiaoyun Zhang, Ya Zhang, 和 Yanfeng Wang。Megafusion:无需进一步调整即可将扩散模型扩展至更高分辨率图像生成。在 2025 IEEE/CVF 计算机视觉应用冬季会议(WACV),第 3944–3953 页。IEEE,2025b。
Rongyuan Wu, Lingchen Sun, Zhiyuan Ma, 和 Lei Zhang。用于真实世界图像超分辨率的一步高效扩散网络。神经信息处理系统进展,37:92529–92553,2024。
Howard Xiao, Brian Chao, Lior Yariv, 和 Gordon Wetzstein。用于高效图像和视频生成的谱渐进扩散。arXiv 预印本 arXiv:2605.18736,2026。
13
第 14 页
Z-Image 团队。Z-image:一种基于单流扩散变换器的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699,2025。
郑思康,陈冠涛,Landis He,刘嘉诚,林宇琦,邹畅,张林峰。从草图到壁画:具有渐进分辨率的高效扩散变换器。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 18714–18723,2026a。
郑兴宇,刘祥龙,秦浩通,马旭东,张明远,郝豪杰,王佳凯,赵子翔,郭金阳,Michele Magno。Binarydm:用于高效扩散模型的精确权重二值化。在国际学习表征会议,卷 2025,页码 70892–70913,2025。
郑兴宇,秦浩通,李业烨,楚浩然,王佳凯,郭金阳,Michele Magno,刘祥龙。一阶误差至关重要:量化大语言模型的精确补偿。在 AAAI 人工智能会议论文集,卷 40,页码 28883–28891,2026b。
14
第 15 页
A 背景
扩散生成的加速。量化(Li 等,2023;Zheng 等,2025;2026b)和高效注意力(Dao 等,2022)是针对通用结构的压缩和加速策略,其加速通常依赖于硬件或系统来实现。扩散特定的加速方法主要是时间步蒸馏、特征缓存和令牌剪枝,这些方法都可以在不依赖硬件的情况下提高采样效率。加速扩散模型的一个主要方向是减少去噪步数。现有方法使用改进的采样器(Song 等,2020;Lu 等,2022)或蒸馏技术(Salimans & Ho,2022;Song 等,2023;Luo 等,2023)将多步教师模型压缩为几步甚至一步生成器。伴随 10 倍及以上的加速,以时间步蒸馏(Timestep Distillation)为代表的策略(Ge 等,2025;Chen 等,2025)通常依赖于成本不可忽视的微调训练,且轨迹可能会逐渐收敛,导致不同随机种子间的多样性丧失。另一条工作线通过特征缓存(Feature Caching)加速扩散模型(Liu 等,2025a;DefTruth,2025;Liu 等,2025b;Feng 等,2026)。这些方法基于扩散特征随时间变化缓慢的观察,在相邻去噪步之间重用中间特征,从而避免在 U-Net 或 DiT 主干网络中进行重复计算。这些方法通常实现约 2 倍到 4 倍的推理加速,且质量下降相对较小。令牌压缩(Token Compression)(Lu 等,2025;Lin 等,2026)通过在去噪过程中根据估计的重要性动态移除或融合空间令牌来减少计算量。现有方法通常仅实现不到 1.5 倍的推理加速。这些扩散加速策略要么依赖于成本不可忽视的微调训练,要么只能获得有限的加速效果。
多分辨率生成。利用图像在不同分辨率下自然具有的特征信息分布,许多工作探索了从低分辨率到高分辨率的阶段性生成。这一方向大致可分为两类。第一类旨在扩展可实现的分辨率。早期工作如 SR3(Saharia 等,2022b)、级联扩散模型(Cascaded Diffusion Models)(Ho 等,2022)和 Imagen(Saharia 等,2022a)采用级联扩散或基于扩散的超分辨率(Super-Resolution, SR),在低分辨率下生成主要结构,然后逐步放大并补充细节;Hires. fix(AUTOMATIC1111,2022)在社区实践中进一步验证了“低分辨率生成 + 高分辨率重绘”的可行性;DemoFusion(Du 等,2024)和 MegaFusion(Wu 等,2025b)等工作通过渐进式去噪和多尺度潜在融合突破了预训练分辨率的上限。这类工作的目标是生成超出原生分辨率的更大图像,它们并不关注原生分辨率下的加速收益。第二类将多分辨率视为一种加速手段。LSSGen(Tang 等,2025)训练了一个轻量级潜在上采样器,并提倡在潜在空间中直接上采样,以避免像素空间上采样后由 VAE(Variational Autoencoder)重新编码引入的伪影。Bottleneck Sampling(Tian 等,2025)在潜在空间中采用 Lanczos 等插值算子,并结合“高-低-高”U 形调度以及时间步重调度实现无需训练的加速。RALU(Jeong 等,2026)同样在潜在空间中进行最近邻插值,但通过区域自适应早期边缘上采样和噪声-时间步分布匹配来抑制混叠伪影。Fresco(Zheng 等,2026a)使用 Hadamard 正交变换将单个父令牌扩展为四个子令牌,并通过全局噪声场保持跨分辨率阶段的一致性。SPD(Xiao 等,2026)将上采样空间从空间域改为频域,沿去噪轨迹按频带逐步扩展。上述加速类工作均在潜在空间或频域内完成上采样。
超分辨率与图像重绘。像素空间中的图像超分辨率长期以来分为三类:基于回归的方法、基于生成对抗的方法以及基于扩散的方法。SwinIR(Liang 等,2021)等方法基于 Swin Transformer(Liu 等,2021)或卷积主干,以 L1/L2 重建损失为主要训练目标,对给定低分辨率输入的高分辨率图像的条件均值进行建模。Real-ESRGAN(Wang 等,2021)在 ESRGAN(Wang 等,2018)的基础上,引入了二阶退化建模,并用判别器损失和感知损失取代纯像素回归,从而在判别意义上使输出分布与自然图像分布对齐。基于扩散的超分辨率以 OSEDiff(Wu 等,2024)为代表,它在预训练扩散模型上进行单步蒸馏,并将超分辨率输入作为条件。图像重绘是另一条相关工作线。SDEdit(Meng 等,2021)提出在现有图像上添加噪声,然后执行反向去噪,以完成
15
第 16 页
在保持语义不变的情况下进行局部编辑;后续工作如 InstructPix2Pix (Brooks et al., 2023)、Imagic (Kawar et al., 2023) 和 Prompt-to-Prompt (Hertz et al., 2022) 将条件引导扩展到了不同程度的应用。这类方法将加噪-去噪过程视为图像编辑的基本工具。与这些编辑方法不同,MrFlow 并不使用加噪-去噪来保留和编辑现有图像;相反,它利用低强度噪声作为一种频率选择机制,在保留生成的低频结构的同时,实现高频重采样。
B 详细实验设置
我们的主要加速实验在 FLUX.1-dev (Black Forest Labs, 2024) 和 Qwen-Image-20B (Wu et al., 2025a) 上进行,并在 FLUX.2 Klein (Black Forest Labs, 2025)、Z-Image 和 Z-Image-Turbo (Z-Image Team, 2025) 上进行了部分扩展实验。对比方法涵盖了各类典型的加速策略:基于特征缓存的 TeaCache (Liu et al., 2025a) 和 DB-Taylor(Cache-Dit (DefTruth, 2025) 中融合 DBCache 和 TaylorSeer (Liu et al., 2025b) 的综合版本),基于 Token 融合的 ToMA (Lu et al., 2025),以及多分辨率的 LSSGen (Tang et al., 2025)、RALU (Jeong et al., 2026) 和 SPEED (Xiao et al., 2026)。对于超过 8 倍的极端加速场景,由于免训练方法基本都会失效,我们额外对比了最先进的 Timestep Distillation 方法 SenseFlow (Ge et al., 2025) 和 Pi-Flow (Chen et al., 2025),均使用其发布的 4 步设置。对于所有依赖训练的策略,即 Timestep Distillation 方法和 LSSGen,我们直接加载官方预训练权重,无需重新训练。原生模型使用其默认参数运行,例如 FLUX.1-dev 的引导尺度为 3.5,Qwen-Image 使用引导尺度为 4.0 的 CFG。对于每个基线,我们报告了两个运行点,选择这些点是为了让 TeaCache、DB-Taylor、RALU 和 SPEED 覆盖可比的加速区间;每个方法在各运行点的超参数列于表 4 和表 5 中。当 MrFlow 与 Timestep Distillation 权重结合时,记为 MrFlow†,它在两个阶段直接加载蒸馏后的模型,无需任何额外训练。
在定量评估中,我们将分辨率统一设置为 1024 × 1024,因为这是文献中最常见的分辨率设置。评估指标采用三类:GenEval、DPG-Bench 和 OneIG-Bench,分别从三个角度表征文本到图像的质量:组合语义、长提示下的密集对齐,以及中英文双语环境下的多维属性,包括字符渲染和风格一致性。对于某些分析性实验,我们还按照模型官方建议的分辨率生成图像,如 1328 × 1328 和 1584 × 1056。实验在 Nvidia A100 GPU 上进行,每个实验在单张 GPU 上运行。报告的加速比均为端到端的实际加速,包括文本编码、随机噪声生成、VAE 编码/解码、Super-Resolution (SR) 以及所有扩散前向传播过程。这意味着某些方法的加速比可能低于其原始论文中的数值,因为后者报告的耗时通常仅关注潜在空间扩散,而忽略了方法特定的过渡开销,例如 RALU 中的区域选择、Token 重排和分阶段重加噪,或 SPEED 中的频谱扩展与时间步重新对齐。
C 分阶段分析
本附录按照第 3 节中 MrFlow 的各个阶段顺序展开,为主文中的设计选择补充完整的实验证据和理论表征。C.1 至 C.4 节分别对应第 3.1 至 3.4 节,而 C.5 节单独讨论了普遍存在的分工机制,即低分辨率阶段决定结构,高分辨率阶段细化细节。为了避免打断主文的叙述,正式命题及其推导也集中安排在本附录中。
C.1 低分辨率阶段的加速来源
本节为第 3.1 节中“低分辨率阶段是 MrFlow 的主要加速来源”这一主张提供定量依据。低分辨率带来的好处可以分解为两个相互独立的方面:一是每个采样步骤本身更节省时间,二是达到结构不可区分所需
第 17 页
表 4:主比较表中使用的 FLUX.1-dev 参数设置。NLR 和 Nref 分别表示 MrFlow 的低分辨率去噪和高分辨率细化步骤。
| 方法 | NFEs | 参数设置 | | :— | :— | :— | | FLUX.1-dev — 免训练加速 | | | | ToMA | 50 | Token 合并率 $r \in \{0.5, 0.8\}$;$M=256$ 个局部图块的目的地预算,每 $\Delta t=3$ 步合并一次。 | | TeaCache | 50 | 由累积相对 $\ell_1$ 变化准则触发;两个速度模式的阈值 $\tau \in \{1.0, 2.5\}$。 | | DB-Taylor | 50 | DBCache 阈值 $\delta \in \{0.30, 0.60\}$,预热 $K \in \{4, 1\}$;TaylorSeer 阶数 $p=1$,$(F_n, B_n)=(1, 0)$。 | | RALU | 4, 5, 6 / 1, 2, 3 | 三阶段调度 $N=(4, 5, 6)$ 或 $(1, 2, 3)$;转换点 $e=(0.30, 0.45, 1.0)$ 或 $(0.20, 0.30, 1.0)$;HR 比率 $\rho=0.20$ 或 $0.075$。 | | SPEED | 3, 2, 7 / 2, 1, 5 | 官方 s3 设置,总步数 12/8,缩放比例 $(0.25, 0.5, 1.0)$,且 $\delta=0.01$;离散调度由功率谱转换推导得出。 | | MrFlow | 20, 1 / 12, 1 | 像素空间分阶段采样,$(N_{LR}, N_{ref})=(20, 1)$ 或 $(12, 1)$;细化前使用 Real-ESRGAN $\times 2$。 | | FLUX.1-dev — 依赖训练的加速 | | | | LSSGen | 25, 25 / 25, 4 | 训练的潜在上采样器;LR 阶段 25 步,HR 阶段从噪声水平 $\sigma_s \in \{0.75, 0.2\}$ 开始,分别对应 25 和 4 个 HR 步。 | | SenseFlow | 4 | 发布的 4 步 FLUX 学生模型。 | | Pi-Flow | 4 | 发布的 pi-FLUX 4 步策略模型,FlowMap 调度如官方适配器所示。 | | MrFlow + Pi-Flow | 4, 1 | LR Pi-Flow 4 步,然后 Real-ESRGAN $\times 2$ 和一个 HR 细化步骤。 | | FLUX-schnell | 2 | 发布的 FLUX.1-schnell 2 步模型。 | | MrFlow + FLUX-schnell | 1, 1 | LR FLUX-schnell 1 步,然后 Real-ESRGAN $\times 2$ 和一个 HR FLUX-schnell 步骤。 |
可从高分辨率中区分开来。我们在 Qwen-Image 上分别对第 3 节描述的提示集进行了考察。
单步推理加速。 当图像的每边缩小 2 倍时,图像 token 的数量减少 4 倍。考虑到扩散推理期间文本 token 的数量远小于图像 token 的数量,且自注意力机制的计算量与图像 token 的数量呈二次方关系,测量的单步推理综合加速比约为 4 倍;自注意力部分的理论上限可达 16 倍,但由于前馈层等线性算子的存在,整体加速比被稀释至这一量级。
少步收敛。 与直接节省单步成本相比,为什么低分辨率能在更少的时间内锁定结构更为微妙。我们从两个互补的角度来理解这一现象:低分辨率阶段更充分地利用了文本条件,且其需要遍历的 ODE 路径更短。
首先,在低分辨率下,图像 token 对文本条件的依赖性更强,因此能更快地将提示语义传播到整体结构中。为了表征这一点,对于第 $\ell$ 个 Transformer 层的注意力分布 $A^{(\ell)} \in [0, 1]^{N \times N}$,将图像查询集记为 $Q_{img}$,文本键集记为 $K_{txt}$,我们定义该层的文本到图像交互强度为图像查询投射到文本键上的注意力质量:
$$ T^{(\ell)} \triangleq \frac{1}{|Q_{img}|} \sum_{q \in Q_{img}} \sum_{k \in K_{txt}} A^{(\ell)}_{q,k}. \quad (12) $$
该值越大,该层的图像 token 越倾向于通过文本条件而非其自身邻域获取信息。表 6 给出了平均测量结果。
第 18 页
表 5:主比较表中使用的 Qwen-Image 参数设置。“×2”表示对正负分支进行真 CFG(true-CFG)评估。
| 方法 | NFEs | 参数设置 | | :— | :— | :— | | Qwen-Image — 免训练加速 | | | | TeaCache | 50 × 2 | 累积相对 $\ell_1$ 变化准则;两个速度区间的阈值 $\tau \in \{0.75, 12.0\}$。 | | DB-Taylor | 50 × 2 | DBCache 阈值 $\delta \in \{0.35, 1.0\}$,预热 $K \in \{2, 0\}$;TaylorSeer $p=1$,$(F_n, B_n)=(1, 0)$ 或 $(5, 0)$,分离 CFG 分支。 | | RALU | $(4, 5, 5) \times 2$ / $(1, 2, 4) \times 2$ | 三阶段调度 $N=(4, 5, 5)$ 或 $(1, 2, 4)$;转换点 $e=(0.30, 0.45, 1.0)$ 或 $(0.20, 0.30, 1.0)$;高分辨率比例 $\rho=0.20$ 或 $0.10$。 | | SPEED | $(2, 1, 7) \times 2$ / $(1, 1, 5) \times 2$ | S3 设置,总步数 10/7,缩放比例 $(0.25, 0.5, 1.0)$,且 $\delta=0.01$;离散调度源自 Qwen 移位调度器。 | | MrFlow | $(20, 1) \times 2$ / $(12, 1) \times 2$ | 像素空间分阶段真 CFG 采样,$(N_{LR}, N_{ref})=(20, 1)$ 或 $(12, 1)$;细化前使用 Real-ESRGAN ×2。 | | Qwen-Image — 依赖训练的加速 | | | | Pi-Flow | 4 | 发布的 pi-Qwen-Image 4 步策略模型,FlowMap 调度如官方适配器所示。 | | MrFlow + Pi-Flow | 4, 1 | 低分辨率 Pi-Flow 4 步,然后 Real-ESRGAN ×2 和一个高分辨率细化步骤。 |
表 6:在 10 步纯文本到图像生成下,Qwen-Image 的逐层文本到图像注意力质量 $T(\ell)$。
| 层 $\ell$ | $T_{R=512}(\ell)$ | $T_{R=1024}(\ell)$ | | :— | :— | :— | | 15 | 0.342 | 0.261 | | 30 | 0.378 | 0.356 | | 45 | 0.198 | 0.174 |
在 3 个提示词和 20 条生成轨迹上平均。在所有测量的层,即 $\ell \in \{15, 30, 45\}$,低分辨率的 $T(\ell)$ 高于高分辨率,且差距在浅层和中间层尤为显著,这表明在低分辨率阶段,每个推理步骤将更高比例的注意力质量分配给文本条件。
这种注意力层面的差异在最终生成质量中得到了证实。我们采用生成图像与提示词之间的 CLIP 相似度: $$ \text{CLIP}(x, c) \triangleq \cos \langle \phi_I(x), \phi_T(c) \rangle, \quad (13) $$ 作为语义一致性的下游指标,其中 $\phi_I$ 和 $\phi_T$ 分别是 CLIP (Radford et al., 2021) 的图像和文本编码器。表 7 比较了在相等步数预算下,直接在高分辨率生成的基线 HR11 与以低分辨率为主的两阶段调度 LR10 HR1,其中 $\text{CLIP}_{\text{ref}}$ 是生成结果与 28 步高分辨率参考图像之间的 CLIP 图像相似度。两阶段调度在延迟减半的同时获得了更高的 CLIP 分数,这与表 6 中更强的文本交互相呼应,共同表明低分辨率阶段能更快地描绘与文本对齐的整体结构。
其次,低分辨率需要遍历的 ODE 路径更短。对于由采样产生的潜在轨迹 $\{z^t_k\}_{k=0}^K$,定义其路径长度为: $$ L \{z^t_k\} \triangleq \sum_{k=0}^{K-1} \| z^t_{k+1} – z^t_k \|_2, \quad (14) $$
18
第 19 页
表 7:在总步数预算相等的情况下,Qwen-Image 的 CLIP 评估结果,基于 3 个提示词 × 3 个随机种子的平均值。
| 调度策略 | 延迟 / s | CLIPref ↑ | CLIPtxt ↑ | | :— | :— | :— | :— | | HR11 | 10.96 | 0.897 | 0.359 | | LR10 HR1 | 5.08 | 0.935 | 0.360 |
表 8:Qwen-Image 的 30 步纯文本到图像(txt2img)轨迹的路径长度,基于 3 个提示词 × 4 个随机种子的平均值。
| 分辨率 | $L \{z_{tk}\}$ | $L \{P_{low}z_{tk}\}$ | 比率 | | :— | :— | :— | :— | | 512 | 270.64 | 154.84 | 57.2% | | 768 | 404.56 | 232.78 | 57.5% | | 1024 | 539.52 | 311.37 | 57.7% |
即潜在空间中 ODE 折线的累积位移。为了分离出描绘全局骨架所需的部分,我们对每个采样的潜在变量应用一次频域低通算子 $P_{low}$,从而获得仅携带低频信息的轨迹 $\{P_{low}z_{tk}\}$。具体而言,$P_{low}$ 是通过对每个潜在通道执行 2D 离散傅里叶变换(DFT),保留径向频率不超过 $\rho_c = 0.35 \rho_{max}$ 的分量,然后应用逆变换得到的。表 8 比较了原始轨迹与低通轨迹的路径长度;在每个分辨率下,低通轨迹稳定地保持在原始轨迹的约 58%,这意味着在完整的 ODE 轨迹中,约有 42% 的位移用于描绘高频细节。
低分辨率推理的目标分布在带宽上等效于对高分辨率分布应用一次低通滤波,因此低分辨率推理只需遍历路径长度中的低频部分即可到达目标,这与上表中的分解一致,其中低频位移仅占 58%,表明低分辨率可以通过更短的 ODE 路径锁定全局骨架。因此,我们使用这种频域表征作为 ODE 轨迹成本的上界估计;结合前述关于文本利用的观察,这解释了为什么低分辨率阶段可以用更少的步数收敛。
C.2 像素空间超分辨率的两个设计选择
本节分别支持第 3.2 节中超分辨率阶段的两个设计选择,即在像素空间而非潜在空间进行上采样,以及选择 GAN 类而非 L2 类超分辨率模型。
以像素空间作为上采样域。第 3.2 节主张在像素空间而非潜在空间执行上采样。直接在潜在空间中放大特征图会破坏 VAE 解码器所依赖的局部空间统计特性,导致解码结果出现规则的网格状伪影,这一现象在附录 F.1 中 MrFlow 和 LSSGen 的并排对比中清晰可见。相比之下,像素空间是各种超分辨率模型原生工作的域;当超分辨率输出通过 VAE 重新编码回潜在空间时,编码器会衰减像素域中超出训练分布的高频分量,从而使生成的潜在变量保留低频结构,同时为后续的低强度加噪和高频重采样提供稳健的起点。这一设计的有效性进一步得到了下文频带消融实验和第 C.3 节形式分析的支持。
GAN 损失的频带对齐。选择 GAN 类超分辨率的原因在于其引入的偏差能否被下游的细化阶段消除。由于细化阶段工作在接近干净图像的一侧,其对噪声的校正能力
第 20 页
表 9:在 Qwen-Image 上,不同前向噪声分量下,细化输出在 DINOv2 空间中到高分辨率(HR)云团的 kNN 距离,平均自 3 个提示词 × 3 个种子。
| 噪声分量 | s = 0.2 | s = 0.3 | | :— | :— | :— | | SR 输入(无细化) | 0.155 | 0.155 | | 高斯噪声 | 0.154 | 0.155 | | 高频 | 0.150 | 0.187 | | 通道相关 | 0.164 | 0.180 | | 低频 | 0.252 | 0.498 |
不同频带的噪声本身具有不对称性,因此我们设计了以下消融实验来直接测量这一能力边界:在潜在空间中添加前向噪声时,我们将原始高斯噪声替换为三类结构化噪声,即高频带通、低频带通和通道相关噪声,然后观察细化后的输出是否能返回到 HR 干净云团附近。如果某频带的噪声在细化后距离基本不变,表明该频带的偏差处于细化的可校正范围内;反之,如果距离显著扩大,则表明该频带的偏差无法被校正。我们测量了细化输出在 DINOv2 (Oquab et al., 2023) 特征空间中到 HR 云团的 kNN 距离,结果汇总于表 9。
细化后高斯噪声和高频噪声的距离与默认 SR 起点几乎相同,而低频噪声在强度为 0.3 时上升至 0.498,相对于默认值扩大了 200% 以上。这表明在细化阶段学习的速度场主要承担高频方向的重新采样,对于落入低频的偏差无能为力。这种不对称性解释了第 3.2 节对超分辨率模型的偏好。插值和 L2 训练的超分辨率可以保留粗略布局,但其主要缺陷是高频衰减和弥散模糊,而非局部合理的高频残差。相比之下,GAN 损失以放弃像素级的最小均方误差为代价,换取清晰且结构合理的细节,使得剩余的偏差更集中于细化有效的频带。结合第 C.1 节发现的低通轨迹仅占总路径长度的 58%,细化速度场的工作能量确实集中在高频,因此 GAN 类超分辨率在最终质量上优于 L2 类超分辨率和简单插值的优势,与第 4.3 节中这三者的视觉排名一致。
C.3 高频重新采样的形式化表征
本节对第 3.3 节中由低强度加噪引起的高频重新采样提供形式化表征。回顾一下,$x_{SR}$ 表示像素空间的 SR 输出,$z_{SR0} = E(x_{SR})$ 表示其 VAE 重新编码的潜在变量,而 $z_{HRt} = (1 – \sigma_t)z_{SR0} + \sigma_t \epsilon$ 是送入高分辨率细化阶段的实际加噪高分辨率潜在变量。在以下分析中,$z_0$ 表示从模型原生潜在分布 $p_0$ 中抽取的干净高分辨率潜在变量,而 $Z_0$ 和 $Z_t$ 表示在标准流加噪模型 $Z_t = aZ_0 + b\epsilon$ 下对应的随机变量,其中 $a = 1 – \sigma_t$ 且 $b = \sigma_t$。核心是一个指导加噪水平选择的下界不等式;它源自单步去噪的后验均值,即 Tweedie/Wiener 估计,并使用可测量的干净潜在变量的高频功率作为重新采样的局部尺度。我们首先给出后验均值的按方向分解,从中推导下界,然后将其专门应用于功率谱并在本文骨干网络上进行测量,最后从分布层面视角作为补充观点。
后验均值的加权分解。我们首先建立单步去噪计算的对象。对于加噪观测值,由流匹配速度网络预测的干净潜在变量估计值在 MMSE 意义上等于以该观测值为条件的干净潜在变量的后验均值,这一等价性称为 Tweedie 公式 (Efron, 2011; Vincent, 2011; Karras et al., 2022)。因此,要表征去噪如何处理 SR 输出,只需表征由实际加噪高分辨率潜在变量 $z_{HRt}$ 诱导的后验均值 $E[Z_0 \mid Z_t = z_{HRt}]$。
第 21 页
为了获得该后验均值的闭式解,我们需要对干净潜变量 $z_{SR0}$ 的先验 $p_0$ 进行局部建模。$z_{SR0}$ 已经携带了正确的全局结构,真正未确定的是其邻域内的局部偏差,因此我们在 $z_{SR0}$ 的邻域内将 $p_0$ 近似为各向异性高斯分布 $\mathcal{N}(\mu, \Lambda)$。此处各向异性是必要的:自然图像的能量在不同空间频率上的分布极不均匀,低频结构方向的方差远大于高频细节方向的方差,而单一的各向同性协方差无法反映这种差异。我们进一步在 $\Lambda$ 的特征基下展开,记 $\Lambda = \text{diag}(\lambda_i)$,其中 $\lambda_i$ 是沿特征方向 $i$ 的干净数据的方差。采用特征基的作用是对协方差进行对角化,使得各方向在统计上不相关,从而将高维后验均值沿每个方向解耦为一组独立的标量问题,进而可以分别求解每个方向 $i$。
方向wise 问题的解依赖于联合高斯变量的条件期望公式。设标量 $X$ 和 $Y$ 联合高斯分布;那么在观测到 $Y = y$ 的条件下,$X$ 的条件期望为 (Bishop & Nasrabadi, 2006, Eq. (2.81)):
$$ E[X | Y = y] = E[X] + \frac{\text{Cov}(X, Y)}{\text{Var}(Y)} (y – E[Y]) \quad . \quad (15) $$
其结构是以先验均值 $E[X]$ 为基线,并通过回归系数 $\text{Cov}(X, Y)/\text{Var}(Y)$ 对观测偏差 $y – E[Y]$ 进行线性修正,修正幅度随着两者相关性的增强以及观测自身方差的减小而增加。命题 1 正是该公式在通过对 SR 潜变量加噪获得的高分辨率潜变量上的特化。
命题 1(高分辨率细化的加权形式)。在上述局部高斯模型下,将实际加噪的高分辨率潜变量 $z_{HRt,i} = a z_{SR0,i} + b \epsilon_i$ 作为观测值,沿方向 $i$ 的后验均值为:
$$ \hat{z}_{0,i} = \kappa_i z_{SR0,i} + (1 – \kappa_i) \mu_i + \eta_i \epsilon_i, \quad \kappa_i = \frac{a^2 \lambda_i}{a^2 \lambda_i + b^2} = \frac{\text{SNR}_i}{1 + \text{SNR}_i}, \quad \eta_i = \frac{b}{a} \kappa_i, \quad (16) $$
其中 $\text{SNR}_i = a^2 \lambda_i / b^2$。
证明。在标准加噪模型下,取 $X = Z_{0,i}$ 和 $Y = Z_{t,i} = a Z_{0,i} + b \epsilon_i$。两者均为高斯变量 $Z_{0,i}$ 和高斯噪声 $\epsilon_i$ 的线性组合,因此联合高斯分布,上述条件期望公式适用。其三个统计量依次计算如下。通过注意到 $E[\epsilon_i] = 0$ 和 $E[Z_{0,i}] = \mu_i$,得到观测均值 $E[Z_{t,i}] = a \mu_i$。利用 $Z_{0,i}$ 和 $\epsilon_i$ 的独立性及其各自的方差 $\lambda_i$ 和 $1$,得到观测方差:
$$ \text{Var}(Z_{t,i}) = a^2 \lambda_i + b^2. \quad (17) $$
由于独立性,协方差中的噪声项被消除,仅保留信号项:
$$ \text{Cov}(Z_{0,i}, Z_{t,i}) = \text{Cov}(Z_{0,i}, a Z_{0,i}) = a \lambda_i. \quad (18) $$
代入条件期望公式得到:
$$ E[Z_{0,i} | Z_{t,i} = z_{HRt,i}] = \mu_i + \frac{a \lambda_i}{a^2 \lambda_i + b^2} (z_{HRt,i} – a \mu_i). \quad (19) $$
最后,代入实际加噪的高分辨率观测值 $z_{HRt,i} = a z_{SR0,i} + b \epsilon_i$。记 $\kappa_i = a^2 \lambda_i / (a^2 \lambda_i + b^2)$,则回归系数 $a \lambda_i / (a^2 \lambda_i + b^2) = \kappa_i / a$,因此
$$ \hat{z}_{0,i} = \mu_i + \frac{\kappa_i}{a} (a z_{SR0,i} + b \epsilon_i – a \mu_i) = \mu_i + \kappa_i z_{SR0,i} – \mu_i + \frac{b}{a} \kappa_i \epsilon_i. \quad (20) $$
整理后得到 SR 估计系数 $\kappa_i$、先验均值系数 $1 – \kappa_i$ 以及噪声系数 $\eta_i = \frac{b}{a} \kappa_i$。
$\kappa_i$ 是经典的维纳增益(Wiener gain),表征了 SR 估计值在沿方向 $i$ 的重建中所占的权重。将其重写为 $\kappa_i = \text{SNR}_i / (1 + \text{SNR}_i)$ 后,其行为一目了然:当 $\lambda_i$ 较大时,对应低频结构,信噪比高,$\kappa_i \to 1$,SR 值得以保留;当 $\lambda_i$ 较小时,对应高频细节,
21
第 22 页
当信噪比低时,$\kappa_i \to 0$,重建结果回归到先验分布,该方向上的细节将被重新采样。增益 $\kappa_i$ 由干净数据的方差和注入的噪声水平控制,而 $z_{SR0,i}$ 与相应干净潜在变量之间的实际差异会影响重建后的残差以及局部近似的有效性。因此,下述下界不应被解释为用于修正任意超分辨率(SR)误差;它表征的是在 SR 输出已经局部合理的情况下,使先验分布接管高频频段所需的噪声尺度。
这也阐明了 SR 模块在理论中的作用。该下界并非根据平均失真对 SR 方法进行排名;它识别了低强度加噪有效的频率区间。基于插值和回归的 SR 方法可以保留粗略的低频布局,但其残差主要由缺失或被平均化的高频内容以及通常扩散到中间频率的模糊所主导。这类误差并非简单的局部高频样本以供重新采样。相比之下,基于生成对抗网络(GAN)的 SR 使输出更接近自然高分辨率图像的流形,并提供锐利的高频内容,即使某些局部细节在语义上并不完美。因此,其剩余的不确定性更好地匹配了低方差的高频方向,在这些方向上,较小的 $\sigma_t$ 可以使高分辨率先验分布接管。理论下界与经验 SR 比较通过这种残差-频率条件联系起来。
噪声水平下界。我们现在将上述分解专门应用于 MrFlow 针对的操作 regime:SR 潜在变量在很大程度上继承了来自低分辨率阶段的低频布局,且剩余不确定性集中在高频方向上。假设此类残差集中在特征方向集合 $H$ 上,其中干净数据的方差记为 $\lambda_{hf} = \max_{i \in H} \lambda_i$,取上确界以覆盖该频段内最坏的方向。命题 1 表明,方向 $i$ 是由 SR 主导还是回归到先验分布,取决于注入噪声与干净信号在该方向上的相对幅度:为了使数据先验具备覆盖和修正 SR 在 $H$ 上潜在误差的能力,一个充分条件是注入噪声的幅度不低于该频段内干净信号的幅度。根据命题 1 中加噪 SR 潜在变量的组成,沿方向 $i$ 的干净信号的标准差为 $a\sqrt{\lambda_i}$,注入噪声的标准差为 $b$,因此该条件写作 $b \ge a\sqrt{\lambda_{hf}}$。这等价于信噪比 $\text{SNR}_{hf} = a^2\lambda_{hf}/b^2 \le 1$,即 Wiener 增益 $\kappa_{hf} \le 1/2$,意味着在高频部分,SR 的话语权最多与先验分布相当。
命题 2(重采样噪声水平下界)。在命题 1 的设定下,高频误差方向上注入噪声的幅度不低于这些方向上干净信号的幅度,即 $\text{SNR}_{hf} \le 1$ 且 $\kappa_{hf} \le 1/2$,当且仅当: $$ \frac{\sigma_t}{\sqrt{\lambda_{hf}}} \ge \sqrt{\frac{\lambda_{hf}}{1 – \sigma_t}} \iff \sigma_t \ge \sigma_t^\star = \frac{\sqrt{\lambda_{hf}}}{1 + \sqrt{\lambda_{hf}}}. \quad (21) $$ 等价地,就整流流(rectified-flow)等效信噪比而言,$\text{SNR}(t) \le 1/\lambda_{hf}$。 将 $a = 1 – \sigma_t$ 和 $b = \sigma_t$ 代入幅度条件 $b \ge a\sqrt{\lambda_{hf}}$ 得到 $\sigma_t \ge (1 – \sigma_t)\sqrt{\lambda_{hf}}$,对两边进行整理得到 $\sigma_t/(1 – \sigma_t) \ge \sqrt{\lambda_{hf}}$,求解 $\sigma_t$ 得到 $\sigma_t \ge \sqrt{\lambda_{hf}}/(1 + \sqrt{\lambda_{hf}}) = \sigma_t^\star$。$\sigma_t^\star$ 仅取决于可测量的干净数据方差 $\lambda_{hf}$。该下界是一个充分但非必要的条件:$\sigma_t \ge \sigma_t^\star$ 保证先验分布具备覆盖高频并因此修正 SR 潜在误差的能力;当 SR 的高频部分本身可靠时,较小的 $\sigma_t$(对应于 $\kappa_{hf}$ 接近 1 并保留更多 SR 内容)也是可行的。因此,$\kappa_{hf} = 1/2$ 并非强制值,而是噪声与信号功率相等的物理上非任意的参考点。另一个极端 $\kappa_{hf} \to 0$ 需要 $\sigma_t \to 1$,对应于丢弃所有 SR 信息的重新生成,即真实性-忠实度权衡中的保真度零端点。结合观察到的过大的噪声水平会洗去 SR 的正确细节并增加所需步数的现象,$\sigma_t$ 构成了一个双向工作区间,其实际值落在 $\sigma_t^\star$ 的数量级附近,略高于它以保证修正能力,同时又足够接近它以保留 SR 细节。
频谱专门化与测量。命题 2 中的方向 $H$ 和方差 $\lambda_i$ 是先验协方差 $\Lambda$ 的特征量,无法从 $D \sim 10^5$ 维的少量样本中可靠地估计。我们利用潜在变量的近似空间平稳性来规避这一困难。当随机场的统计特性在空间平移下不变时,其协方差在结构上是循环的,而循环矩阵的特征向量恰好是傅里叶基。因此,在空间平稳性近似下,$\Lambda$ 的特征向量
第 23 页
表 10:本文骨干网络潜在变量的各频段功率谱及对应的噪声水平下界。
| 频段 | $\sqrt{\lambda(k)}$ | $\sigma^\star_t = \sqrt{\lambda/(1 + \lambda)}$ | | :— | :— | :— | | 低频 $k < 0.10$ | 0.32 | 0.24 | | 中频 $0.10 \le k < 0.25$ | 0.18 | 0.16 | | 高频 $k \ge 0.25$ | 0.08 | 0.075 |
退化至空间频率模式,且特征值 $\lambda_i$ 退化为按频率索引的径向功率谱 $\lambda(k)$。这种退化将高维协方差谱的估计转化为功率谱的估计,后者可从单个潜在变量的 $H_H \times W_H$ 空间样本中稳定地获得。超分辨率(SR)误差所在的集合 $H$ 对应于高频带,因此 $\lambda_{hf} = \lambda(k_{high})$,命题 2 的下界相应地特化为各频段的 $\sigma^\star_t(k) = \sqrt{\lambda(k)/(1 + \sqrt{\lambda(k)})}$。
我们通过带通 FFT 测量 $\lambda(k)$,使用的是从第 4.2 节主实验中提取的 18 个形状为 $16 \times 128 \times 128$ 的干净高分辨率潜在变量。每个频带的方差被反投影回空间域以保证绝对尺度,且帕塞瓦尔校验 $\sum_k \lambda(k) = \text{Var}(z_0)$ 的比率为 1.000;结果如下表所示。
干净的功率谱强烈集中在低频,低频带的标准差约为高频带的四倍,这证实了高频带 $\lambda_{hf}$ 较小的前提。对于高频残差,命题 2 给出 $\sigma^\star_t \approx 0.075$,这与正文中略高于下界的经验值 $\sigma_t \in [0.1, 0.15]$ 一致。该值由测得的干净高频功率决定,并在 SR 残差被限制在该频带时作为局部重采样的尺度。如果残差落入中频或低频带,测得的下界分别增加至 0.16 或 0.24,且该量级的细化强度开始接近部分重生成。这就是为什么双三次或 L2 上采样尽管保留了粗略布局,但与 MrFlow 不匹配的原因:它们的主要误差不是局部合理的高频样本,而是衰减和模糊。这也划定了“像素空间重缩放必然引入持续模糊”这一主张的适用范围:它适用于低频或弥散模糊,但不适用于残差更接近低方差高频带的 GAN 超分辨率。
补充分布级视角。命题 1 和 2 是单点、方向性的表征。作为补充视角,加噪也以可量化的速率在整体分布层面使 SR 输出分布更接近目标分布。为了将此视角与第 3.3 节中的流加噪形式对齐,考虑缩放后的观测值 $\tilde{z}^{HR}_t = z^{HR}_t / (1 – \sigma_t) = z^{SR}_0 + \frac{1-\sigma_t}{\sigma_t} \epsilon$。令 $\hat{p}_0$ 和 $p_0$ 分别为 SR 潜在变量 $z^{SR}_0$ 和干净潜在变量 $z_0$ 的分布;在此加噪视角下,相应的边缘分布为 $\hat{p}_t = \hat{p}_0 * \mathcal{N}(0, (\frac{1-\sigma_t}{\sigma_t})^2 I)$ 和 $p_t = p_0 * \mathcal{N}(0, (\frac{1-\sigma_t}{\sigma_t})^2 I)$。
命题 3(加噪后的分布级平滑)。在上述设定下:
$$ \text{KL}(\hat{p}_t \| p_t) \le (1 – \sigma_t)^2 W^2_2(\hat{p}_0, p_0). \quad (22) $$
根据高斯平滑不等式(Polyanskiy & Wu, 2016, Thm. 1),对于任意 $\mu, \nu$,我们有 $\text{KL}(\mu * \gamma_s \| \nu * \gamma_s) \le \frac{1}{2s^2} W^2_2(\mu, \nu)$;代入 $\hat{p}_0, p_0$ 和 $s = \sigma_t/(1 – \sigma_t)$ 即可得到该结果。当 $\text{KL} = O(1)$ 时,该界限要求 $\sigma_t/(1 – \sigma_t) \gtrsim W_2(\hat{p}_0, p_0)$,这是一个比命题 2 更强的整体对齐充分条件,对应于将两个分布卷积至其支撑集重叠的尺度。相比之下,命题 2 的方向性下界利用了结构信息,即 SR 的全局结构已经正确,仅需对高频进行重采样,因此所需的 $\sigma_t$ 远小于命题 3 的整体对齐尺度,这再次证实了低强度加噪之所以足够,正是因为 SR 仅在高频上存在误差。
23
第 24 页
表 11:Qwen-Image 高分辨率细化结果与 8 步参考结果在 3 个提示词下的 CLIP 相似度。
强度 s KH = 1 KH = 2 KH = 3 KH = 5
0.1 0.9974 0.9995 0.9997 0.9999 0.3 0.9902 0.9957 0.9962 0.9996
C.4 高分辨率细节细化的单步充分性
本节探讨为何在推荐的低强度设置下,高分辨率细化阶段可以使用单个去噪步。我们首先通过与多步参考结果进行数值比较来证实这一点,然后从去噪轨迹上速度场的时间变化特性进行解释,最后说明为何将有限的步数预算放在调度末尾是最具成本效益的。
数值单步充分性。以相同的 SR 起始点和相同的细化噪声种子下的 8 步去噪结果为参考,我们扫描 KH ∈ {1, 2, 3, 5} 和 σt ∈ {0.1, 0.3} 的组合,其中 σt = 0.3 作为较大噪声的诊断设置被包含在内,并记录细化图像与参考图像之间的 CLIP 图像相似度: CLIPref(ˆx(KH)0 , ˆx(8)0 ) = cos ϕI(ˆx(KH)0 ), ϕI(ˆx(8)0 ) . (23) 结果总结在表 11 中。在 s = 0.1 时,单步去噪已达到 0.9974,仅比 5 步去噪的 0.9999 低 0.0025,使得在推荐设置下额外的细化步骤效果微乎其微。相比之下,较大的诊断强度 s = 0.3 需要更多步骤才能接近相同的参考结果。这在数值上与命题 2 给出的强度双边工作区间一致:当加噪 SR 潜在变量保持在接近干净端点时,高分辨率细化对 KH 的依赖性较弱,因此在我们默认配置中 KH = 1 就足够了。
速度场的时间变化特性。上述单步充分性可以通过去噪轨迹上速度场的直线性来解释。一个欧拉步长的局部截断误差约为: e(t, h) ≈ 12 h2 ˙vθ(xt, t) , (24) 其中 ˙vθ 是速度场关于状态的总微分;其范数越小且轨迹越直,单步欧拉误差就越小。直接计算 ˙vθ 成本高昂,因此我们改为在相邻去噪步骤 tk → tk+1 的原始速度序列 {vk} 上测量三个互补的量。第一个是速度幅度: ∥v∥= K1 X∥vk∥2; (25) k 第二个是相邻步骤之间的速度变化,作为 ∥˙vθ∥ 的差异代理: ∆∥v∥= K−11 X∥vk+1 −vk∥2; (26) k 第三个是相邻速度方向之间的转角,表征轨迹弯曲的程度: ⟨vk+1, vk⟩ θ = K−11 X arccos ∥vk+1∥∥vk∥. (27) k 我们记录了 Qwen-Image 去噪 Transformer 在高分辨率细化期间的原始速度预测的上述三个量,结果总结在表 12 中。随着强度增加,这三个量均单调上升;强度越小,起点越接近 t = 0,速度场越平坦,轨迹弯曲越弱,单步欧拉误差越小。这正好解释了表 11 的数值结果:在低强度下,细化从速度场最平坦的段开始,因此第一个欧拉步已经涵盖了主要的修正。
24
第 25 页
表 12:Qwen-Image 高分辨率细化阶段的原始速度时变统计,3 个提示词 × 2 个种子。
强度 s ∥vθ∥ ∆∥vθ∥ 转向角 / rad
0.05 0.924 0.095 0.087 0.1 0.970 0.119 0.107 0.2 1.002 0.140 0.126 0.3 1.017 0.151 0.136 0.5 1.025 0.170 0.157
表 13:MrFlow 在 Qwen-Image 上两个阶段的种子敏感性实验,3 个提示词 × 18 对,频域成对均方误差。
控制变量 低频 MSE 高频 MSE 全图 MSE 高/低比率 变化 LR 1.087 × 10−2 3.054 × 10−2 4.842 × 10−2 7.4 变化 HR 1.298 × 10−6 2.584 × 10−5 2.575 × 10−5 19.8
由于轨迹在接近 t = 0 时变得更直,有限的步数预算应优先分配给该段。为了验证这一点,我们固定相同的超分辨率(SR)起始点的总步数 KH = 6,并比较三种步长分布:均匀调度(均匀分布采样步骤)、前端密集调度(将大部分步骤集中在高噪声起始段)和后端密集调度(将大部分步骤集中在低噪声末端)。三种情况下的轨迹路径长度 L 分别为:均匀调度为 215.82,前端密集为 251.23,后端密集为 157.29,后端密集相比前端密集节省了约 37% 的总位移。这与本节之前的两个观察结果一致:细化阶段的有效工作集中在低噪声末端,且将步数预算集中于此同样能以最少的步骤完成细节细化。这种后端密集调度与 SD3 的时间步偏移一致,可以视为在 SR 加上低强度加噪条件下,将其外推至极端的特例。
C.5 结构-细节解耦
前四节分别考察了 MrFlow 各阶段的特性,本节回到贯穿整个流水线的设计前提:低分辨率阶段决定图像的全局结构,而高分辨率阶段仅在此基础上细化细节。如果这一前提成立,那么扰动两个阶段各自的随机性应在不同频带上留下截然不同的印记,我们通过一组控制变量的种子敏感性实验直接验证了这一推断。
我们固定提示词集,并分别向 MrFlow 的两个阶段引入随机性。vary LR 固定高分辨率细化的随机种子,仅改变低分辨率阶段的种子;vary HR 固定低分辨率阶段的种子,即固定 SR 之前的整个 LR 和 SR 过程,仅改变高分辨率细化的种子。每个类别运行 4 个种子以获得 4 个输出,并在 3 个提示词内,对组内所有 4^2 = 6 对图像逐对计算成对均方误差(MSE)。为了分离结构和细节的差异,我们首先通过高斯低通滤波器将每张图像分解为低频和高频分量,然后分别对这两个分量重复计算,并补充全图 MSE 以及高频/低频 MSE 比率,前者反映综合差异,后者反映差异主要落在哪个频带。结果总结在表 13 中。
两个控制变量之间的差异极为显著。在低频尺度上,改变低分辨率种子引入的差异是改变高分辨率种子的约 8000 倍,在全图尺度上约为 1900 倍。这种显著的不对称性表明,MrFlow 最终输出的结构内容几乎完全由
第 26 页
表 14:FLUX.2 Klein 变体在 1024 × 1024 分辨率下的扩展结果。非基础变体的加速比是相对于具有相同模型规模的 Klein Base 50 步模型测量的。此处“×2”表示有效的正/负 CFG 分支。
| Model variant | Method | Training-free | NFEs | Speedup ↑ | Geneval ↑ | DPG ↑ | OneIG-En ↑ | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | FLUX.2-klein-base-4B | Native | – | 50×2 | 1x | 0.78 | 83.05 | 0.49 | √ | | FLUX.2-klein-base-4B | MrFlow | (20, 1)×2 | 5.16x | 0.75 | 83.24 | 0.49 | √ | | FLUX.2-klein-base-4B | MrFlow | (12, 1)×2 | 8.03x | 0.74 | 82.63 | 0.48 | | | FLUX.2-klein-4B | Native | – | 4 | 20.5x | 0.84 | 85.78 | 0.49 | | | FLUX.2-klein-4B | MrFlow‡ | ‡ | 4, 1 | 20.1x | 0.83 | 85.17 | 0.50 | | | FLUX.2-klein-base-9B | Native | – | 50×2 | 1x | 0.83 | 85.84 | 0.54 | √ | | FLUX.2-klein-base-9B | MrFlow | (20, 1)×2 | 5.40x | 0.79 | 85.09 | 0.54 | √ | | FLUX.2-klein-base-9B | MrFlow | (12, 1)×2 | 8.79x | 0.77 | 84.62 | 0.54 | | | FLUX.2-klein-9B | Native | – | 4 | 22.5x | 0.84 | 86.31 | 0.54 | | | FLUX.2-klein-9B | MrFlow‡ | ‡ | 4, 1 | 26.9x | 0.87 | 85.92 | 0.54 | |
表 15:Z-Image 和 Z-Image-Turbo 在 1024 × 1024 分辨率下的扩展结果。Z-Image-Turbo 变体的加速比是相对于标准 50 步设置下的 Z-Image Base 测量的。NFEs 遵循有效的 DiT 前向计数;对于 Z-Image-Turbo,官方的 9 步设置执行 8 次 DiT 前向传播。此处“×2”表示有效的正/负 CFG 分支。
| Model variant | Method | Training-free | NFEs | Speedup↑ | Geneval↑ | DPG↑ | OneIG-En↑ | OneIG-Zh↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Z-Image | Native | – | 50×2 | 1x | 0.75 | 86.90 | 0.56 | 0.52 | √ | | Z-Image | MrFlow | (20, 1)×2 | 6.66x | 0.68 | 85.67 | 0.55 | 0.51 | √ | | Z-Image | MrFlow | (12, 1)×2 | 10.8x | 0.66 | 84.97 | 0.51 | 0.46 | | | Z-Image-Turbo | Native | – | 8 | 10.3x | 0.76 | 85.05 | 0.52 | 0.49 | | Z-Image-Turbo | MrFlow‡ | ‡ | 8, 1 | 21.0x | 0.75 | 84.37 | 0.52 | 0.49 | |
低分辨率阶段,而高分辨率阶段仅在固定的低分辨率起点上引入较小的局部扰动。此外,两个扰动在频带上的分布也不同:vary HR 的高频/低频比为 19.8,明显高于 vary LR 的 7.4,这表明一旦结构由低分辨率阶段固定,高分辨率细化引入的残差变化集中在高频部分,恰好落在细节细化应有的边界内。这组结果为第 3 节中描述的流水线分工提供了直接证据,也呼应了 C.4 节的结论,即细化速度场仅在低噪声端的小强度区间内起作用。
D 最近开源模型上的 MRFLOW
为了进一步检验相同的分阶段设计是否超越两个主要骨干网络,我们还在两个最近的开源模型系列 FLUX.2 Klein (Black Forest Labs, 2025) 和 Z-Image (Z-Image Team, 2025) 上评估了 MrFlow。结果总结在表 14 和表 15 中。对于已经使用减少步数生成机制的非基础 FLUX.2 Klein 变体和 Z-Image-Turbo,我们报告相对于标准 50 步设置下相应基础模型的加速比,以便该数值反映与同一系列中完整模型相比的实际加速极限。
在 FLUX.2 Klein Base 上,MrFlow 保持了在 FLUX.1-dev 和 Qwen-Image 上观察到的相同行为。使用 20 个低分辨率步和 1 个高分辨率步,它在 4B 和 9B 变体上分别达到了 5.16× 和 5.40× 的加速比,同时保持 OneIG-En 分数在一个非常小的差距内。更激进的 12, 1 配置进一步将加速比提高到 8.03× 和 8.79×,伴随适度的指标下降。蒸馏后的 Klein 变体也与多…
26
第 27 页
LR采样 超分辨率 HR采样 VAE编码/解码 原生 49.32s MrFlow 4.77s 快10.35倍!
0 10 20 30 40 50 运行时间 (s)
图 6: 原生 Qwen-Image 和 MrFlow-12, 1 的分阶段运行时间分解。
表 16: Qwen-Image 在 1024 × 1024 分辨率下的分阶段运行时间分解。时间以秒为单位报告。空白条目表示相应流水线中不存在的阶段。
方法 NFE 文本编码 LR噪声 LR采样 中间 VAE解码 SR VAE编码 HR噪声 HR采样 最终 VAE解码 总计
原生 50×2 0.067 – – – – – 0.0025 49 0.14 49 MrFlow(12, 1)×2 0.067 0.00012 3.2 0.035 0.18 0.083 0.0025 1.0 0.14 4.8
分辨率流水线:在 4 步模型中添加一个高分辨率细化步骤,相对于其基础模型,在 4B 上达到 20.10×,在 9B 上达到 26.92×,表中记为 MrFlow‡。
在 Z-Image 上得出的结论类似。在基础模型上,20, 1 配置实现了 6.66× 的加速,同时保持 OneIG-En 为 0.55,OneIG-Zh 为 0.51,接近原生模型。即使是 12, 1 配置也达到了 10.8× 的加速,同时保持了可用的指标性能。当与 Z-Image-Turbo 结合时,MrFlow 在 8, 1 有效 DiT 前向设置下进一步将有效加速推高至 21.0×。这些结果表明,MrFlow 并不绑定于特定的架构或模型版本,可以直接应用于新的流匹配骨干网络及其蒸馏变体。
E 效率分析
我们将 MrFlow 的端到端运行时间分解,以阐明加速来自何处。 以 Qwen-Image 上的 12+1 配置为例,我们测量推理路径中的所有阶段,包括文本编码、低分辨率初始噪声生成、低分辨率去噪、VAE 解码、像素空间超分辨率、VAE 编码、高分辨率噪声生成和加噪、高分辨率去噪以及最终的 VAE 解码。该配置的平均端到端延迟为 4.77s,而原生 50 步 Qwen-Image 为 49.32s,对应实际加速比为 10.35×。
图 6 以左对齐的水平运行时间分解图可视化了相同的测量结果。MrFlow 的主要成本在于低分辨率采样和高分辨率细化,分别耗时 3.24s 和 1.03s。相比之下,去噪之外的固定开销很小:低分辨率初始噪声生成、中间 VAE 解码、Real-ESRGAN 超分辨率和 VAE 编码合计仅约 0.30s。因此,效率提升主要源于两个因素。首先,每个低分辨率去噪步骤仅处理约 1/4 的图像 token。其次,低分辨率阶段可以用显著更少的步骤建立全局结构。由于像素空间超分辨率和额外的 VAE 变换仅引入较小的固定成本,MrFlow 将大量昂贵的高分辨率采样转换为成本较低的低分辨率采样,同时保留一个高分辨率细化步骤以保留局部细节。
F 更多生成示例
为了保持提交的 PDF 紧凑且便于下载和检查,本文中的光栅化图像均以超过 90% 的压缩率进行了压缩。因此,一些细粒度的视觉细节在 PDF 中可能看起来不够清晰,尤其是在密集排列的比较图中。这种压缩伪影仅在文档准备过程中引入,不应被解释为生成图像或所提出方法的局限性。
27
第 28 页
FLUX.1-dev ToMA 1.13x LSSGen 3.93x DB-Taylor 7.86x SPEED 8.00x RALU 8.21x MrFlow 8.25x Pi-Flow 9.49x SenseFlow 11.1x MrFlow† 11.3x
图 7:各种方法对 FLUX.1-dev 的影响对比。虚线分隔了预训练模型、免训练策略以及依赖或利用时间步蒸馏(Timestep Distillation)的策略。
LSSGen 3.93x SPEED 8.00x RALU 8.21x MrFlow 8.25x
图 8:FLUX.1-dev 上多分辨率加速方法的详细对比。
F.1 与各种最先进(SOTA)策略的对比
除了正文第 4.2 节中的定量指标外,我们观察到,在直接检查生成示例时,方法之间的差距更加明显。
基准样本。除了在第 4.2 节定量评估中的优势外,MrFlow 在实际生成的图像上也表现更好。图 7 直接从 FLUX.1-dev 上的 DPG-Bench 任务中提取了生成示例。MrFlow 在生成质量和效率方面均显著优于其他现有的免训练策略,而无需额外训练即可融合时间步蒸馏的 MrFlow† 进一步获得了更高的加速比。
多分辨率策略对比。图 8 进一步将 MrFlow 与其他多分辨率加速策略进行了对比,包括 LSSGen、RALU 和 SPEED。LSSGen 即使在适度的加速比下也表现出密集的伪影,而 RALU 和 SPEED 在加速比超过 8× 时仍能在 FLUX.1-dev 上获得具有竞争力的定量分数,其中 SPEED 在表 1 的某些指标上甚至部分超过了 MrFlow。然而,生成的样本揭示了感知保真度方面的明显差距:这些基线方法表现出严重的局部退化,包括模糊的细节、不稳定的纹理或坍塌的结构。相比之下,MrFlow 在相当或更高的加速水平下保持了清晰且连贯的细节,这表明像素空间超分辨率后跟随低强度高分辨率重采样比潜在空间或频域扩展更可靠。
更多场景。我们还在 Qwen-Image 上测试了一些更多样化的提示词,以进一步检验每种方法的加速生成能力。图 1 展示了一些示例。与在 FLUX.1-dev 上的观察结果一致,MrFlow 不仅能显著优于其他各种先进的免训练策略,还能直接与依赖训练的时间步蒸馏策略相结合,以实现更高的加速比。
F.2 MrFlow 的更多示例
在图 9 和图 10 中,我们展示了 MrFlow 在 FLUX.1-dev 和 Qwen-Image 上分别配置为 12 个低分辨率步骤和 1 个高分辨率步骤时的加速生成效果。在 8-10× 的加速比下,MrFlow 在任意宽高比和分辨率下均展现出卓越的生成效果。
28
第 29 页
图 9:MrFlow 在 Qwen-Image 上的生成示例。配置为低分辨率阶段 12 步,高分辨率阶段 1 步,加速比均超过 10 倍。
F.3 论文中图像对应的提示词
为了便于复现和更轻松地检查定性示例,我们在下列列出了论文中展示图像所使用的文本提示词。对于包含多个样本的图像,提示词按与相应图像相同的顺序列出。
图 1 的提示词。
1. 春日牧场中一匹白马的特写,阳光洒在鬃毛上,眼睛反射清晰,野花点缀,空气感写实摄影。
2. 火星水稻温室,浅水床,外部红色沙丘,农学家,机器人,暖色灯具,详细的科幻现实主义风格。
图 2 的提示词。
1. 趴在针织毯子上的胖乎乎的金毛英国短毛猫特写,小耳朵,毛绒脸颊,明亮温馨的卧室灯光。
图 3 的提示词。
1. 黄昏时分一个舒适的角落书店,挂着一块大型木制招牌,上面用手工绘制的衬线字体写着“THE WANDERING PAGE”,下方是一块较小的黑板,写着“Est. 1987 — Open 9am to 9pm”。温暖的琥珀色窗光,雨水打湿的鹅卵石街道,秋叶,浅景深,35mm 胶片摄影。
图 4 的提示词。
1. 钟表匠工作台的俯视图,展示了一块拆解的机械腕表,微小的齿轮、宝石、螺丝和弹簧整齐地摆放在绿色毛毡垫上。旁边放着一个放大镜、镊子和一套黄铜螺丝刀,以及一本皮革封面的笔记本,上面手写标题为“Caliber 2824-2 — Service Log”。温暖的钨丝台灯,硬阴影,f/5.6 光圈下的微距摄影,整个场景焦点锐利。
图 7 的提示词。
29
第 30 页
图 10:MrFlow 在 FLUX 上的生成示例。配置为低分辨率阶段 12 步,高分辨率阶段 1 步,加速比均超过 8 倍。
1. 一片广阔的田野,被清晨柔和的光线笼罩,怀抱着一丛卷心菜,它们的绿色菜头圆润饱满。这些蔬菜 nestled 在肥沃土壤的行间,点缀着晶莹剔透的露珠,这些露珠附着在它们褶皱的叶片上。随着薄雾开始散去,卷心菜静置其中,准备迎接当天即将到来的收获。
图 8 的提示词。
1. 一张一尘不染的白色梳妆台,上面陈列着各种美容产品,其中包括一把软毛化妆刷和一支时尚的黑色眼线笔,摆放得整整齐齐。在一旁,一个突兀且不协调的元素——一把金属手枪,躺在灰色混凝土地板的纹理表面上,与精致的化妆工具形成了强烈的对比。梳妆台本身靠在一面白墙上,由从附近窗户射入的自然光照亮。
图 9 的提示词。标记为 † 的项目最初是用中文编写的;此处显示为英文翻译或英文描述,以保持与 pdfLaTeX 的兼容性。
1. (†) 垂直方向的 AI 艺术节日海报,一个友好的 AI 机器人正在白天独自绘制一幅发光的壁画,机械臂握着画笔,色彩鲜艳,构图干净的宣传封面,没有人类画家;仅包含可读文本:“AI DREAM”和一个意为“AI 绘画”的中文短语;严格禁止其他任何字母、额外文字、标志、签名、标题或水印。
30
第 31 页
2. 一位专注的年轻厨师,袖子卷起,在阳光充足的开放式厨房中,小心翼翼地将可食用花卉摆放在摆盘精致的菜肴上,闪闪发光的不锈钢台面,背景中的香草和香料罐柔和虚化,35mm 纪实摄影风格。 3. (†) 黄山主峰在日出时分,沐浴在金色的晨光中,古老的松树从陡峭的花岗岩悬崖上探出,翻滚的云海染成淡橙色和玫瑰色,远处的山峦渐变为冷蓝色,超广角全景视角,自然光下细节清晰。 4. (†) 一面写有书法的庭院墙壁,唯一可读的文字为“MrFlow”,周围环绕着毛笔、墨碗、石阶和竹影,没有其他可读文字。 5. 明亮的科幻电影海报,三名宇航员面对一艘金色的太阳能帆飞船,地球辉光,英雄式构图,唯一可读文字:“SOLAR VOYAGE”。 6. 一棵巨大的古树,盘根错节的根系在日出时穿透层层云层,微小的浮岛悬浮在树枝周围,阳光透过树叶洒在蜿蜒的天桥上,具有温暖饱和色调的绘画风格奇幻概念艺术。 7. 吉卜力工作室插画风格的舒适山坡村庄,手绘云朵漂浮在起伏的绿色山丘上,带有烟囱冒烟的小红顶小屋,蜿蜒的鹅卵石小径通向石桥,温暖的午后光线,柔和的水彩纹理。 8. 雪豹面部的极端特写,胡须上有霜,琥珀色的眼睛,湿润的鼻子纹理,背景是模糊的雪岩,写实野生动物照片。 9. 苔藓树枝上小熊猫的特写,湿润的皮毛,微小的爪子,圆圆的眼睛,竹林雨景模糊,详细的野生动物写实风格。 10. 浪漫剧情片海报,雨后两人在透明雨伞下,温暖的城市灯光,柔和的电影感散景,唯一可读文字:“AFTER RAIN”。 11. 编织分辨率挂毯,粗糙的线团变成精细的图像细节,木制织布机,彩色纱线,触觉宏观场景。 12. 日出时的杭州西湖,木船,荷叶,石桥,雾中山丘,岸边的骑行者,柔和写实的光线。
图 10 的提示词。
1. 轨道灯塔阵列,巨大的镜子,维修飞船,地球辉光,宇航员,硬科幻全景。 2. 陶瓷餐桌布置,青瓷碗,茶,湿茶叶,亚麻布,青铜勺,窗光,宏观材质细节。 3. 一只雄伟的雪豹休息在喜马拉雅悬崖边缘覆盖着苔藓的岩石上,柔和的高山阳光洒在它厚实的斑点皮毛上,背景是遥远的雪山峰顶,锐利的金色眼睛,200mm 焦距带有变形宽银幕景深的野生动物摄影。 4. 一只 Morpho 蝴蝶虹彩蓝色翅膀的极端宏观照片,可见的鳞片瓦片结构,微小的露珠附着在几片鳞片上充当天然透镜,柔和的绿色植物作为冷色调模糊背景,1:2 放大倍率。 5. 红色高山火车穿越松林上方的石制高架桥,瀑布,雾中山峰,微小的徒步旅行者,清晰的晨光。 6. 漂浮在云海之上的玉宫,仙鹤,瀑布,瓦片屋顶,发光的桥梁,明亮的中国风奇幻绘画。 7. 河流救援训练演习,充气艇,绳索,头盔,湍急的水流,指挥帐篷,写实纪录片动作风格。 8. 一位专注的年轻厨师,袖子卷起,在阳光充足的开放式厨房中,小心翼翼地将可食用花卉摆放在摆盘精致的菜肴上,闪闪发光的不锈钢台面,背景中的香草和香料罐柔和虚化,35mm 纪实摄影风格。 9. 地铁信号维修,隧道中的工人,橙色灯光,电缆,工具,列车模糊,写实的基础设施动作场景。 10. AI 芯片晶圆厂车间,晶圆载体,机械臂,无尘服,琥珀色反光,精确的工业摄影。
31
第 32 页
11. 阿尔卑斯种子采集、植物学家、微小花朵、岩石斜坡、云朵、标本盒、清晰逼真的微距景观。
12. 一位白发、戴着圆形金属框眼镜的日本老工匠,正专注地在阳光充足的车间里雕刻一个小木盒,温暖的灯光中漂浮着细碎的木屑,工作台上整齐摆放着手工具,穿着带有细微磨损痕迹的传统靛蓝色围裙,50mm 镜头拍摄,浅景深效果。
13. 无文字科学惊悚电影海报,位于活跃火山边缘的研究实验室,橙色熔岩光芒,白色蒸汽,身穿西装的科学家,无文字,无标志。
14. 宣传活动封面,明亮的户外科技博览会,机器人,图像屏幕,家庭,干净的日光,仅包含可读文字:“FUTURE FAIR”。
15. 仅由云朵雕刻而成的单词“MrFlow”悬浮在绿色山丘之上,气球,阳光,无其他可读文字。
16. 冒险海报,巨大的居中标题“DRIFT”,由风吹动的白色字母组成,巨云下的一艘小帆船,绿松石色的海洋,阳光明媚的电影海报风格,无其他文字。
17. 地中海船只维修码头,涂漆的船体,绳索,海鸥,水桶,阳光照射下的水面倒影,繁忙逼真的场景。
18. 海岸剧情片海报,巨大的顶部标题“TIDE”,白色手绘字母,古老的灯塔, crashing 的波浪,穿着黄色雨衣的人物,电影感云层,无其他文字。
19. 一只红喉蜂鸟在明亮的喇叭花前悬停,翅膀快速运动产生模糊效果,空中捕捉到的花蜜液滴,背景是柔和失焦的茂密绿植,1/4000秒快门速度,生动的微距摄影。
20. 无文字太空大片海报,宇航员伸手触碰地球上方的受损卫星,金色阳光,碎片场,英雄式构图,无文字,无标志。
21. 充满希望的科幻封面,巨大的居中标题“HALO”,柔和发光的字母,孩子和服务机器人位于环形天空空间站下,干净的日光,无其他文字。
22. 身穿红色汉服的中国小女孩特写肖像,柔和的庭院阳光,精致的刺绣,温暖的电影感散景。
23. 动作海报,巨大的居中标题“BLAZE”,火焰般的橙色字母,红色跑车和沙漠道路上的火花,戏剧性的日落,无其他文字。
32