Mage-Flow:4B参数原生分辨率图像生成与编辑的高效基础模型

三分钟导读:本文提出Mage-Flow,一个紧凑型4B参数生成堆栈,通过轻量级Mage-VAE、原生分辨率MMDiT骨干网络及系统级优化,实现了高效的高分辨率文本到图像生成及指令式图像编辑。

英文题目:Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

论文出处:arXiv 每日论文精选 · arXiv:2607.19064

原始论文:PDF / 论文页面

对应视频标题:Mage-Flow:4B参数原生分辨率图像生成与编辑的高效基础模型|推荐指数:★★★★★

这篇论文解决什么问题?

现有开源视觉生成模型参数量巨大(6B-80B),导致训练、微调、推理及部署成本高昂,难以在合理计算预算下进行本地部署和深入研究;同时,传统VAE在高分辨率下成为推理瓶颈。

核心创新

  • Mage-VAE:单步扩散式编码/解码器,结合锚定潜在KL正则化,实现12-22倍计算复杂度降低且保持高保真重建。
  • 原生分辨率打包训练:利用FlashAttention可变长度注意力,混合不同分辨率和长宽比样本,消除分辨率桶限制。
  • 打包CFG推理:将条件与无条件分支打包进单次前向传播,减少Classifier-Free Guidance开销。
  • 堆栈级CUDA融合:针对Mage-VAE、Qwen3-VL和NR-MMDiT的内存绑定算子进行融合,提升MFU至77%。

方法概览

1. 设计Mage-VAE:基于单步扩散风格的一阶编码/解码器,使用锚定潜在分布(Anchor-latent)KL正则化,保持与FLUX.2-VAE兼容的同时大幅降低计算量。
2. 原生分辨率MMDiT:采用原生分辨率打包(Native-Resolution Packing)训练,避免固定分辨率桶,支持任意长宽比。
3. 系统优化:堆栈级CUDA算子融合,提升训练吞吐量。
4. 模型变体:包括Base、RL对齐(Diffusion-NFT)及4步蒸馏(Decoupled DMD + 对抗感知引导)的Turbo变体。

逐图理解论文

背景:规模与效率的权衡

背景:规模与效率的权衡
Figure 5 Mage-Flow architecture. Mage-Flow uses Qwen3-VL to encode text prompts and Mage-VAE to map images into compact transformer-ready latents. Images of different resolutions and aspect ratios are flattened into variable-length latent token sequences and packed together with variable-length text tokens in a single batch. The 4B Native-Resolution MMDiT processes these packed sequences with per-sample 2D rotary positional embeddings and FlashAttention variable-length attention, avoiding fixed resolution buckets while preserving each sample’s native spatial layout. The right panel illustrates the MMDiT block, where text and image streams use modality-specific normalization and projection layers but interact through joint self-attention.

当前图像生成领域倾向于扩大模型规模,如FLUX.2和Qwen-Image,但忽视了系统级效率优化。传统VAE在高分辨率下成为推理瓶颈,且固定分辨率桶训练限制了模型对灵活长宽比的泛化能力。Mage-Flow通过原生分辨率打包和轻量级组件,打破这些限制。

方法:Mage-VAE设计

方法:Mage-VAE设计
Figure 6 Mage-VAE is a lightweight pixel-diffusion-based VAE distilled from the FLUX.2-VAE latent space. FLUX.2-VAE provides the anchor latent distribution used for diffusion pre-training and anchor-latent regularization. The Mage-VAE decoder is distilled to reconstruct images from FLUX.2-aligned latents, while the Mage-VAE encoder is trained to produce latents compatible with the same anchor space. This design yields an efficient one-step encoder–decoder that preserves a generation-ready latent structure and can be interchanged with FLUX.2-VAE in downstream generators.

Mage-VAE是一个轻量级高保真潜在标记器,基于单步扩散风格的一阶编码/解码器。它使用锚定潜在分布进行KL正则化,保持与FLUX.2-VAE兼容的同时大幅降低计算量。编码和解码的计算复杂度分别比FLUX.2-VAE降低12.3倍和22.3倍,同时保持高保真重建。

方法:系统优化与变体

方法:系统优化与变体
Table 4 Training-efficiency ablation. All configurations are benchmarked on a single 8-GPU NVIDIA B200 node with FlashAttention-4 [12]. The global batch size is 8, with one packed sample per GPU, and each sample contains a fixed packed sequence length of 50,000 tokens. We progressively replace FLUX.2-VAE with Mage-VAE and enable fused CUDA kernels for Mage-VAE, the Qwen3-VL text encoder, and NR-MMDiT. Peak per-GPU memory, model FLOP utilization (MFU), per-step wall-clock time, and relative speedup are reported.

系统级优化包括堆栈级CUDA算子融合,针对Mage-VAE、Qwen3-VL和NR-MMDiT的内存绑定算子进行融合,提升MFU至77%。模型变体包括Base、RL对齐(Diffusion-NFT)及4步蒸馏(Decoupled DMD + 对抗感知引导)的Turbo变体,以平衡速度与质量。

实验:重建效率与质量

实验:重建效率与质量
Table 1 Evaluation results of Mage-VAE. The model parameters and computational complexity (measured by kMACs/pixel) of both encoding and decoding are reported. Reconstruction quality is measured on CLIC 2020 testset at native resolution and FFHQ val 10k at 1024 × 1024 resolution.

在CLIC 2020和FFHQ上评估Mage-VAE的重建质量与效率。结果显示,Mage-VAE在保持高保真重建的同时,显著降低了计算复杂度。在1024²分辨率下,编码和解码的延迟和显存占用远低于传统VAE,证明了其在高分辨率下的效率优势。

实验:生成与编辑基准

实验:生成与编辑基准
Table 8 Summary of text-to-image generation results across eight benchmarks. Steps is the number of denoising steps at evaluation. Models are grouped into closed-source and open-source. The best open-source score in each column is in bold. The second-best results are underlined.

在GenEval、DPG-Bench、TIIF-Bench等基准上评估文本到图像生成能力,在ImgEdit-Bench、GEdit-Bench上评估图像编辑能力。Mage-Flow在GenEval上达到0.88,与FLUX.2-VAE基线持平。在GEdit-Bench-EN上达到8.271,展示了强大的编辑能力。

实验与关键结果

  • 在CLIC 2020和FFHQ上评估Mage-VAE的重建质量与效率。
  • 在GenEval, DPG-Bench, TIIF-Bench, CVTG-2K, OneIG等基准上评估文本到图像生成能力。
  • 在ImgEdit-Bench, GEdit-Bench, TextEdit-Bench上评估图像编辑能力。
  • 在SciFormaBench-2K上评估科学图表生成的专用微调效果。
  • 对比不同分辨率下的推理延迟、显存占用及训练吞吐量。
  • Mage-VAE编码/解码计算复杂度分别比FLUX.2-VAE降低12.3倍和22.3倍(第 12 页)
  • 训练吞吐量提升约2.5倍,MFU从33%提升至77%(第 15 页)
  • 1024²分辨率下,Mage-Flow-Turbo生成耗时0.59s,显存约17.68GB(第 6 页)
  • 1024²分辨率下,Mage-Flow-Edit-Turbo编辑耗时1.02s,显存约18.57GB(第 6 页)
  • 在GenEval上达到0.88(与FLUX.2-VAE基线持平)(第 12 页)
  • 在GEdit-Bench-EN上达到8.271(第 12 页)

阅读时需要注意

  • 模型规模限制在4B,可能在极端复杂场景或超大规模数据分布下不如数十B参数模型。
  • Turbo变体经过4步蒸馏,可能在某些细微纹理或复杂逻辑一致性上略低于Base模型。
  • 依赖Qwen3-VL作为文本编码器,增加了系统依赖。
  • 性能对比主要基于单张NVIDIA A100 GPU,多卡模型(如FLUX.2-dev)的显存和耗时统计方式不同,需注意公平性。
  • Turbo模型的性能提升依赖于特定的蒸馏数据和对抗感知引导,直接应用可能效果不佳。

关联工作

  • FLUX.2:作为对比基线及Mage-VAE的锚定潜在分布来源(第 1 页)
  • CoD-Lite:Mage-VAE设计灵感的来源,提供单步扩散编解码思路(第 5 页)
  • Qwen-Image:作为大规模开源生成模型的对比基线(第 1 页)
  • Diffusion-NFT:用于Mage-Flow的RL对齐后训练方法(第 8 页)
  • Decoupled DMD:用于4步Turbo模型蒸馏的主要方法(第 9 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

2026年7月

Mage-Flow:一种用于图像生成与编辑的高效原生分辨率基础模型

微软 Mage 团队

大规模视觉生成器虽然能力日益增强,但训练、微调和部署成本高昂。我们介绍了 Mage-Flow,这是一个紧凑的 4B 规模生成堆栈,用于高效的文本到图像生成和基于指令的图像编辑。该堆栈由两个协同设计的组件构建而成:Mage-VAE,一种轻量级高保真潜在标记器;以及采用整流流匹配(rectified flow matching)训练的原生分辨率多模态扩散 Transformer。Mage-VAE 使用一步扩散式编码和解码,并辅以锚定潜在 KL 正则化,在保持强大公共 VAE 重建质量的同时,将标记化成本降低了一个数量级以上。结合原生分辨率打包和堆栈级 CUDA 内核融合,该堆栈支持灵活分辨率训练,并将端到端训练吞吐量提高了约 2.5 倍。基于这一基础,我们开发了一个完整的模型家族,包括 Base、RL 对齐和 Turbo 变体,涵盖生成和编辑的质量与保真度。扩散负感知微调(Diffusion-NFT)通过遵循提示文本的对抗性感知指导,提升了生成质量,并生成了用于低延迟推理的 4 步 Turbo 模型。尽管规模紧凑,Mage-Flow 和 Mage-Flow-Edit 在标准生成和编辑基准测试中均取得了具有竞争力的性能。更重要的是,Turbo 变体使得高分辨率生成和编辑在交互式使用中变得切实可行:在单个 NVIDIA A100 GPU 上以 1024² 分辨率运行时,Mage-Flow-Turbo 生成一张图像仅需 0.59 秒,Mage-Flow-Edit-Turbo 编辑一张图像仅需 1.02 秒,同时保持较小的内存占用。这些结果表明,精心设计的标记器-骨干网-系统协同设计可以在高效的 4B 模型家族中实现强大的高分辨率生成和编辑。[cs.CV] 项目页面:https://microsoft.github.io/Mage 代码:https://github.com/microsoft/Mage 模型:https://huggingface.co/collections/microsoft/mage 日期:2026年7月

1 引言

视觉生成建模的最新进展显著提升了文本到图像生成和基于指令的图像编辑能力。当代系统被期望能够合成高保真图像,遵循组合提示,渲染多语言文本,保持空间布局,并支持局部或迭代编辑。这些能力使得广泛的创建工作流成为可能,包括海报和文档设计、产品可视化、UI 原型设计、科学图表以及交互式图像编辑。

然而,在实际计算预算下,强大的视觉生成仍然难以获取和研究。GPT-Image [1]、Nano Banana [2] 和 Seedream [3] 等闭源系统提供了强大的性能,但限制了透明度和可复现性。与此同时,具有竞争力的开源模型越来越依赖大型骨干网:最近的生成器包括 6B 参数的 Z-Image [4]、20B 参数的 Qwen-Image [5]、32B 参数的 FLUX.2 [6] 以及 80B 参数的 Hunyuan-Image-3.0 [7],而强大的编辑模型如 Qwen-Image-Edit [5] 和 FireRed-Image-Edit [8] 也达到了 20B 规模。虽然这些模型实现了令人印象深刻的绝对质量,但其规模增加了成本

第 2 页

图 1 Mage-Flow 的定性展示。涵盖编辑设计、照片级真实感、美食摄影、双语文本渲染、肖像和风格化艺术的原生分辨率样本。Mage-Flow 支持高度和宽度在 512 到 2048 之间的灵活生成,包括 512 × 2048 和 2048 × 512 等极端 4:1 宽高比。这些示例展示了在不同分辨率和宽高比下一致的布局、精细的视觉细节以及清晰可读的英文和中文文本。

2

第 3 页

图 2 Mage-Flow-Edit (I) 的定性展示。涵盖背景、颜色、数量、字体、老照片和雾霾效果、主体添加/替换、草图渲染、缩小视野、物体缩小、镜头光晕合成、文本添加、分割、表面法线、动作改变、HED 边缘以及姿态提取等以源为中心的示例。所有展示的编辑类型均支持双向操作。

3

第 4 页

图 3 Mage-Flow-Edit (II) 的定性展示。更多示例涵盖材质与风格变更、主体移除、人物精修、雨天效果、表情包制作、深度、色调、视角、灰度转换、提取、Canny 边缘以及多类型编辑。所有展示的编辑类型均支持双向操作。

4

第 5 页

推理、微调、受控消融实验以及领域适应。因此,在发布开源权重与使视觉生成系统在实际计算预算下真正具备可研究、可修改和可部署的实用性之间,仍存在差距。

在本报告中,我们提出了 Mage-Flow 生成栈(generative stack),这是一个紧凑且便于研究的视觉生成与编辑基础架构。该栈由 Mage-VAE 和 4B 原生分辨率多模态扩散 Transformer(NR-MMDiT)组成。Mage-VAE 是一种高保真轻量级潜在标记器,源自我们之前的 CoD-Lite 设计 [9];NR-MMDiT 则在 Mage-VAE 潜在空间中通过整流流匹配(rectified flow matching)进行训练。这一共享栈结合原生分辨率打包(native-resolution packing)和融合内核训练基础设施,支持两种模型实例化:用于文生图的 Mage-Flow 和用于基于指令图像编辑的 Mage-Flow-Edit。我们的目标并非扩展至数百亿参数,而是提供一个紧凑且可扩展的 4B 规模基线,用于视觉生成、可控编辑、后训练对齐及垂直应用研究。

Mage-Flow 栈的设计围绕系统级效率而非仅生成器规模的扩展。在潜在生成管线中,仅优化扩散主干网络是不够的:标记器在训练、推理和重复编辑中均会被调用,且其成本随图像分辨率迅速增长。因此,我们首先重新设计了栈中的标记器组件。大多数现代公开 VAE 针对像素级重建进行了优化,但其架构在高分辨率下编码器和解码器的成本缩放表现不佳。在少步高分辨率生成和编辑中,这种成本在延迟和内存方面可能接近扩散主干网络本身,使标记器成为管线的实际瓶颈。为解决此问题,我们根据三项设计原则从头训练 Mage-VAE。首先,基于我们之前的 CoD-Lite 探索 [9],我们将标记器视为一种学习到的图像编解码器:解码器是一个经过压缩导向目标预训练的完全卷积像素扩散模型,随后被蒸馏为单步模型,从而避免了传统 VAE 解码器在高分辨率下昂贵的全局注意力块和多步计算。其次,受自编码结构对称性的启发,我们将编码器构建为解码器的架构对偶:一个以像素为条件生成潜在的单步扩散模型,使编码与解码同样轻量。第三,我们用锚定潜在 KL 正则化(anchor-latent KL)替换了标准的高斯先验 KL,将后验正则化至强公开 VAE 的潜在分布,从而为下游扩散训练提供一个即插即用的潜在空间。结果,Mage-VAE 在重建保真度上与 FLUX.2-VAE 相当,但每像素的编码和解码 MACs 分别减少了约 12 倍和 22 倍。这一高效标记器是 Mage-Flow 栈的第一层,使得高分辨率生成和重复编辑能够以显著降低的标记化开销实现。

在此潜在空间之上,该栈使用共享的原生分辨率多模态扩散 Transformer 作为生成主干。4B NR-MMDiT 通过整流流匹配进行训练,同时用于文生图和基于指令的图像编辑。不同于传统的基于桶(bucket-based)的训练方法——其中每个优化步骤仅限于一个预定义的分辨率和宽高比桶——我们采用了原生分辨率打包方案 [10]。它利用 FlashAttention 的变长内核 [11, 12] 和每样本 2D 旋转嵌入(rotary embeddings),将具有任意分辨率和宽高比的变长图像序列与变长文本序列打包到单个批次中。这消除了单桶限制,使每次更新都能接触到异构的原生图像尺寸,并使单个检查点能够自然地泛化到灵活的输出尺寸。相同的打包机制还通过在一次打包的前向传播中评估条件和无条件分类器自由引导(classifier-free guidance)分支,提高了推理效率。

除了架构之外,高效的原生分辨率训练还需要栈级的系统优化。因此,我们将 Mage-VAE、Qwen3-VL [13] 文本编码器和 NR-MMDiT 的重复块中占主导地位的内存绑定算子链融合为自定义 CUDA 内核。这些融合内核减少了激活内存流量和内核启动开销,将 MFU 从约 33% 提升至 77%,并实现了约 2.5 倍的端到端训练加速(表 4)。

第 6 页

文本到图像生成 8.4 图像编辑 Mage-Flow Mage-Flow-Edit-Turbo Joy-AI-Image-Edit 0.90 Mage-Flow-Turbo LongCat-ImageQwen-Image 8.2 Mage-Flow-Edit FLUX.2-Klein-9B Lens FLUX.2-Klein-9B Z-Image-Base FireRed-Image-Edit-1.0 0.85 FLUX.2-Klein-4B Lens-Turbo 8.0 Z-Image-Turbo FLUX.2-Klein-Base-9B Mage-Flow-Edit-Base Qwen-Image-Edit-2511 HiDream-I1-Full 0.80 Mage-Flow-Base FLUX.2-Klein-Base-4B 7.8 FLUX.2-Klein-4B FLUX.2-Klein-Base-9B LongCat-Image-Edit GenEval 0.75 模型模型 (峰值(峰值 GPU显存显存)显存) GEdit-EN 7.6 Qwen-Image-Edit-2509 FLUX.1-devFLUX.1-dev (36.06(36.06 GB)GB) LongCat-ImageLongCat-Image (32.12(32.12 GB)GB) FLUX.1-Krea SD3.5-Large 模型模型 (峰值(峰值 GPU显存显存)显存) FLUX.1-KreaFLUX.1-Krea (36.06(36.06 GB)GB) Z-Image-BaseZ-Image-Base (25.28(25.28 GB)GB) FLUX.2-dev GB)GB) Qwen-Image-Edit-2511Qwen-Image-Edit-2511 (60.23(60.23 GB)GB) FLUX.2-Klein-4BFLUX.2-Klein-4B (19.76(19.76 GB)GB) Z-Image-TurboZ-Image-Turbo (24.46(24.46 GB)GB) Lens-Base 7.4 FLUX.2-Klein-4BFLUX.2-Klein-4BFLUX.2-Klein-9BFLUX.2-Klein-9B (20.19(20.19(37.25(37.25 GB)GB) FireRed-Image-Edit-1.0FireRed-Image-Edit-1.0 (59.77(59.77 GB)GB) FLUX.2-Klein-9BFLUX.2-Klein-9B (37.36(37.36 GB)GB) Lens-BaseLens-Base (51.58(51.58 GB)GB) 0.70 FLUX.2-Klein-Base-4BFLUX.2-Klein-Base-4B (19.76(19.76 GB)GB) LensLens (51.58(51.58 GB)GB) FLUX.2-Klein-Base-4BFLUX.2-Klein-Base-4B (20.19(20.19 GB)GB) Joy-AI-Image-EditJoy-AI-Image-Edit (64.62(64.62 GB)GB) FLUX.2-Klein-Base-9BFLUX.2-Klein-Base-9B (37.36(37.36 GB)GB) Lens-TurboLens-Turbo (51.58(51.58 GB)GB) FLUX.1-dev FLUX.2-Klein-Base-9BFLUX.2-Klein-Base-9B (37.25(37.25 GB)GB) Mage-Flow-Edit-BaseMage-Flow-Edit-Base (20.05(20.05 GB)GB) HiDream-I1-FullHiDream-I1-Full (65.47(65.47 GB)GB) Mage-Flow-BaseMage-Flow-Base (18.10(18.10 GB)GB) 7.2 FLUX.2-devFLUX.2-dev (179.63(179.63 GB)GB) Mage-Flow-EditMage-Flow-Edit (20.05(20.05 GB)GB) LongCat-Image-EditLongCat-Image-Edit (34.33(34.33 GB)GB) Mage-Flow-Edit-TurboMage-Flow-Edit-Turbo (18.57(18.57 GB)GB) (58.80(58.80 GB)GB) Mage-FlowMage-Flow (18.10(18.10 GB)GB) 0.65 Qwen-ImageQwen-Image FLUX.2-Klein-Base-4B Qwen-Image-Edit-2509Qwen-Image-Edit-2509 (60.23(60.23 GB)GB) SD3.5-LargeSD3.5-Large (30.88(30.88 GB)GB) Mage-Flow-TurboMage-Flow-Turbo (17.68(17.68 GB)GB) 7.0 100 101 102 100 101 102 推理时间 (秒/张) 推理时间 (秒/张)

图 4 质量-速度-显存对比。我们在 NVIDIA A100 GPU 上比较了代表性的文本到图像生成和图像编辑模型。左图报告了 GenEval 性能,右图报告了 GEdit-Bench-EN 性能。x 轴显示每张图像的端到端推理时间,y 轴显示基准性能,标记面积与峰值 GPU 显存成正比。除 FLUX.2-dev 外,所有模型均在单张 A100 GPU 上评估;由于显存需求,FLUX.2-dev 使用两张 A100 GPU 进行评估;对于 FLUX.2-dev,报告的时间为双 GPU 推理时间,报告的显存为两张 GPU 峰值显存之和。Mage-Flow 和 Mage-Flow-Edit 形成了有利的质量-效率前沿,具有高分、低延迟和小显存占用。

轻量级标记器、原生分辨率骨干网络、打包 CFG 推理以及融合内核训练基础设施共同使得在固定计算预算下实现高效的 4B 规模原生分辨率生成和编辑成为可能。 我们将这一共享堆栈实例化为一个完整的生成与编辑模型系列。对于文本到图像生成,我们首先训练 Mage-Flow-Base 作为 4B 原生分辨率基础模型,通过 Diffusion-NFT [14] 将其对齐为 Mage-Flow,以改进提示遵循、美学、双语文本渲染和偏好对齐,并使用解耦 DMD 引导 [15] 结合对抗感知引导 [16] 将其蒸馏为 4 步的 Mage-Flow-Turbo。对于基于指令的编辑,我们复用相同的 Mage-VAE 潜在空间和 NR-MMDiT 骨干网络,但将条件格式更改为包含编辑指令和源图像潜在变量。这产生了 Mage-Flow-Edit-Base、Mage-Flow-Edit 和 Mage-Flow-Edit-Turbo。在整个编辑训练过程中,

我们将编辑数据与生成数据混合,这在保持开放生成先验的同时,提升了源条件编辑能力。如图 4 所示,由此产生的 4B 规模模型族在代表性开源系统中实现了强大的质量-效率权衡。在 1024² 分辨率下,单张 NVIDIA A100 GPU 上,Mage-Flow 生成图像需 4.37 秒,而 4 步 Mage-Flow-Turbo 将延迟降低至 0.59 秒。对于编辑任务,30 步 Mage-Flow-Edit 运行时间为 10.55 秒,4 步 Mage-Flow-Edit-Turbo 将推理加速至 1.02 秒。在生成和编辑任务中,峰值 GPU 内存保持在 18-20 GB 左右,是所比较模型中最低的。结合与 Qwen-Image [5]、Z-Image [4]、FLUX.2 [6] 和 FireRed-Image-Edit [8] 等规模大得多的开源系统相比具有竞争力或更优的基准性能,这些结果表明 Mage-Flow 堆栈为本地桌面部署和下游研究提供了一个紧凑、快速且内存高效的基础。总体而言,我们的主要贡献总结如下:

• 我们提出了 Mage-Flow 生成堆栈,这是一个紧凑的 4B 规模基础模型,用于高效的文生图生成和基于指令的图像编辑。该堆栈结合了轻量级标记器、原生分辨率扩散主干以及融合内核训练基础设施,为视觉生成研究提供了可扩展的开放基线。

• 我们设计了 Mage-VAE,这是一种基于一步扩散风格编码和解码以及锚定潜在 KL 正则化的轻量级高保真潜在标记器。它在保持强大公共 VAE 重建质量的同时,显著降低了高分辨率编码

第 7 页

以及解码成本。

• 我们引入了一个采用整流流匹配(rectified flow matching)训练的原生分辨率 MMDiT 主干网络。 借助原生分辨率打包(Native-Resolution Packing)、变长文本/图像批处理、打包条件自由引导(Packed CFG)推理 以及栈级 CUDA 内核融合,该主干网络在固定的计算预算下实现了高效且灵活的分辨率训练与推理。

• 我们基于共享栈构建了一个完整的生成与编辑模型家族,包括 Mage-Flow 和 Mage-Flow-Edit 的基础版(Base)、强化学习对齐版(RL-aligned)和 Turbo 版。 在生成和编辑设置中,我们的模型实现了强大的质量-速度-内存权衡: 它们匹配或超越了规模大得多的开源系统,同时在相比模型中提供了更快的推理速度和更低的峰值 GPU 内存占用。

2 相关工作

2.1 图像生成基础模型

文生图生成器。 文生图生成已从像素空间扩散和基于 U-Net 的潜在扩散,演变为大型扩散 Transformer 和整流流模型。 Stable Diffusion [17] 普及了在压缩 VAE 潜在空间中的生成,极大地降低了像素空间扩散的成本,而 SDXL [18] 通过更强的文本条件和多宽高比训练扩展了 U-Net 设计。 Diffusion Transformers [19] 进一步将领域转向 Transformer 主干网络,其中 SD3 [20] 采用采用整流流训练的 MMDiT 风格架构, SANA [21] 则通过线性注意力扩散 Transformer 提高了高分辨率效率。 最近的开源系统继续扩展这一范式,包括 Z-Image [4]、Qwen-Image [5]、FLUX.2 [6]、HunyuanImage 3.0 [7] 和 LongCat-Image [22], 而 Nano Banana [2] 和 Seedream [3] 等闭源系统虽然展示了强大的生成质量,但透明度和可复现性有限。 许多这些模型规模在 6B–80B 之间,为适应和系统性研究带来了实际障碍。 相比之下,Mage-Flow 将生成器固定在紧凑的 4B 规模,并与轻量级 VAE 协同设计,旨在为高质量视觉生成提供一个高效、可扩展且对研究友好的基础。

基于指令的图像编辑器。 基于扩散的图像编辑已从基于反转和引导的方法进展到端到端的指令微调编辑器。 早期方法如 SDEdit [23] 通过随机去噪实现全局编辑,而 Prompt-to-Prompt [24] 和 Null-text Inversion [25] 通过操纵交叉注意力或优化嵌入来改进局部编辑, 但通常需要进行逐图像优化。另一条路线引入了显式条件控制,包括用于空间控制的 ControlNet [26] 和用于图像提示条件的 IP-Adapter [27]。 InstructPix2Pix [28] 普及了指令微调,随后出现了更大规模的监督编辑器,如 MagicBrush [29]、AnyEdit [30]、UltraEdit [31] 和 OmniGen [32]。 最近的基于 MMDiT 的编辑器,包括 FLUX.1 Kontext [33]、Step1X-Edit [34]、ICEdit [35]、OmniGen2 [36]、UniWorld-V1 [37]、DreamOmni2 [38]、ChronoEdit [39]、JoyAI-Image-Edit [40] 和 FireRed-Image-Edit [8],改进了指令遵循、身份保持和组合编辑能力,但通常依赖于规模大得多的主干网络。 Mage-Flow-Edit 则提供了一个紧凑的 4B 基于指令的编辑器,在保持强大编辑质量的同时,显著降低了适应、微调及下游研究的成本。

统一的多模态生成模型。 另一条并行研究路线研究统一的多模态模型,这些模型在单一主干中结合图像理解、生成和编辑 [41]。 Janus-Pro [42] 使用独立的视觉编码器分别处理理解和生成,同时共享一个自回归 Transformer。 Transfusion [43] 在交错的文本和图像数据上训练单个 Transformer

7

第 8 页

同时采用下一个词元预测和扩散目标。BAGEL [44] 采用仅解码器架构进行多模态理解和生成,而 Emu3.5 [45] 进一步将原生多模态建模扩展至广泛的生成和编辑能力。这些模型追求通用多模态统一,通常规模更大且架构上与基于 MMDiT 的生成器截然不同。Mage-Flow 专注于互补方向:专门针对一个 4B 参数的 MMDiT 堆栈进行优化,以实现高效、高质量的生成和编辑,同时将理解视为一种正交能力,可通过外部编码器或下游系统整合。

2.2 图像生成的词元化

视觉词元化连接原始像素与生成骨干网络,在很大程度上决定了现代图像生成器的效率边界。由 Latent Diffusion Models [17] 引入并在 SD3 [20] 和 FLUX.1 等系统中使用的连续潜在 VAE,仍然是基于扩散生成的主流选择。与此同时,VQ-VAE [46] 和 VQ-GAN [47] 等离散词元器为自回归图像生成奠定了基础。然而,大多数开源生成器继承的是主要优化像素级重建的公开 VAE,其编码器和解码器的成本随分辨率迅速增长,在高分辨率生成和重复编辑中可能成为主要的延迟和内存瓶颈。

另一条相关研究路线通过基于扩散的生成式压缩重新思考词元化。多步扩散编解码器 [48–50] 可以在低比特率下实现强大的感知质量,但其迭代采样使其对于实时生成管线来说过于缓慢;单步扩散编解码器 [51–53] 改善了延迟,但通常依赖重型 DiT 或 U-Net 风格的骨干网络。CoD-Lite [9] 为该领域提供了重要观察:在小规模下,面向压缩的预训练比面向生成的预训练更好地迁移到学习到的编解码器上,并且经过蒸馏和对抗训练后,轻量级全卷积解码器就足够了,无需全局注意力。基于这些见解,Mage-VAE 从头开始训练词元器以服务于下游 MMDiT 生成。其解码器是一个面向压缩目标预训练并蒸馏为单步的全卷积像素扩散模型,避免了使传统 VAE 解码器在高分辨率下昂贵的全局注意力块和多步计算。由于自编码是对称的,我们将编码器构建为解码器的架构对偶:一个以像素为条件生成潜在变量的单步扩散模型,使得编码与解码一样高效。最后,Mage-VAE 用锚定潜在 KL 正则化替换了标准的高斯先验 KL,将后验正则化至固定 VAE 潜在分布,从而产生一个具有 16× 空间降采样和 128 个通道的、可直接用于生成的潜在空间。

2.3 图像生成的后训练

后训练对于将预训练的扩散和流匹配生成器与人类偏好、提示遵循性和美学质量对齐至关重要。一个主要方向是将离线偏好优化扩展至扩散模型。Diffusion-DPO [54] 在扩散轨迹上应用 DPO 目标,而 D3PO [55] 直接从偏好比较中进行微调,无需显式奖励模型。这些方法简单且稳定,因为它们作用于预收集的偏好数据,并已成为现代文本到图像后训练管线中的常见组件。

另一个互补方向使用在线强化学习来优化不可微或黑盒奖励。DDPO [56] 将去噪视为序列决策过程,并使用学习到的或基于规则的奖励(通常使用 ImageReward [57] 等奖励模型)对生成器进行微调。将强化学习扩展至流匹配更具挑战性,因为 ODE 采样是确定性的,且缺乏显式的动作分布。Flow-GRPO [58] 通过将 ODE 采样器转换为具有匹配边缘分布的随机 SDE 来解决这一问题,而 Diffusion-NFT [14] 则绕过反向过程,在前向过程上进行负感知微调,无需似然估计或特定求解器。在 Mage-Flow 和 Mage-Flow-Edit 中,我们采用

8

第 9 页

Mage-VAE 解码器

…… …… …… Gate Gate

MLP MLP 原生分辨率 MMDiT 缩放与平移 缩放与平移

…×N LayerNorm LayerNorm

原生分辨率 MMDiT

…… … …… … …… … … Gate Gate

421 个 token 104 个 token 594 个 token 86 个 token 提示 1 + 图像 1 提示 2 + 图像 2 提示 3 + 图像 3 提示 4 + 图像 4 打包多头自注意力

Qwen3-VL Mage-VAE 编码器 q q q q k k k k v v v v

添加噪声 系统提示 图像提示 2D-RoPE 2D-RoPE 提示 1:一张垂直特写视图,展示了一株分层 植物 排列, featuring 大型 绿色叶状 茎 从簇状 的 绿色 秋海棠状 植物 上方升起,带有小型 白色 花朵,在底部穿插着深紫色 叶丛。

RMSNorm RMSNorm 提示 2:一盘炸米饭配面包屑 海鲜。 高度: 1024

宽度:1536 图像 3 缩放与平移 缩放与平移 提示 3:中景镜头捕捉到一个留着棕色长发的年轻 女孩坐在木桌前,背景是白色砖墙,她 用左手托着 脸,目光 望向 右侧。 高度: 高度: 336 320

LayerNorm LayerNorm 提示 4:三个装满红色冰沙饮料和冰块的高杯 的特写视图,放置在木质表面上,周围散落着 新鲜蔓越莓。

MLP 文本流 图像流 t 新鲜蔓越莓。 宽度: 432 图像 1 宽度:图像 688 宽度:图像 2724

(a) Mage-Flow 架构 (b) 原生分辨率 MMDiT 架构

图 5 Mage-Flow 架构。Mage-Flow 使用 Qwen3-VL 对文本提示进行编码,并使用 Mage-VAE 将图像映射为紧凑的、适用于 Transformer 的潜在表示。不同分辨率和长宽比的图像被展平为可变长度的潜在 token 序列,并与可变长度的文本 token 在单个批次中打包在一起。4B 原生分辨率 MMDiT 使用每个样本的 2D 旋转位置嵌入(2D rotary positional embeddings)和 FlashAttention 可变长度注意力来处理这些打包序列,从而避免固定分辨率桶(buckets),同时保留每个样本的原生空间布局。右侧面板展示了 MMDiT 块,其中文本和图像流使用特定模态的归一化和投影层,但通过联合自注意力进行交互。

作为监督微调之上的后训练阶段,扩散负感知微调(Diffusion-NFT)应用于精心策划的、针对特定能力的生成和编辑数据,以提高提示遵循度、文本渲染、组合控制和编辑保真度。

2.4 图像生成的蒸馏

迭代扩散采样在部署时成本高昂,这促使了大量减少采样步数的工作。无需训练的求解器,如 DDIM [59] 和高阶 ODE 求解器,在不重新训练的情况下减少了步数,但在极小的预算下性能往往会下降。蒸馏方法进一步推动了这一进程:渐进式蒸馏 [60] 迭代地将教师轨迹减半;一致性模型 [61] 和潜在一致性模型 [62] 通过沿概率流 ODE 的自一致性学习少步映射;而 InstaFlow [63] 通过拉直流轨迹改进了单步生成。

另一类蒸馏方法在分布层面进行。分布匹配蒸馏(DMD)[64] 使用辅助评分模型将学生分布匹配到教师分布,而 DMD2 [65] 去除了回归损失,引入了对抗性训练,并支持多步学生采样。对抗性扩散蒸馏 [66] 和 Hyper-SD [67] 进一步将基于评分或一致性的目标与对抗性损失相结合,以在少量步数下保留视觉细节。最近,解耦分布匹配蒸馏(Decoupled DMD)[15] 将 CFG 增强与分布匹配分离,并允许独立的噪声调度,而 SenseFlow [16] 引入了基于冻结视觉基础模型(VFMs)的对抗性引导,用于基于流的生成器。具体而言,冻结的 VFM 如 CLIP [68] 和 DINOv2 [69] 用于从生成和

9

第 10 页

第一阶段:扩散预训练

多步 多步 FLUX.2 扩散 扩散 FLUX.2-VAE FLUX.2-VAE FLUX.2 FLUX.2 编码器 解码器 Mage-VAE Mage-VAE 解码器 编码器 带有 带有图像像素的 (a) 锚定 VAE:FLUX.2-VAE 图像像素 FLUX.2 潜在变量

第二阶段:解码器蒸馏 第三阶段:联合蒸馏

Mage DMD 教师: FLUX.2 Mage-VAE Mage-VAE 面向压缩的扩散 带有 编码器 解码器 FLUX.2 分布的 KL 损失 GAN 骨干网: 单步 DINO-v2 投影的 GAN 单步 单步 扩散 扩散 扩散 DMD 损失 Mage DMD 损失 16× ↓ 卷积 卷积 卷积 卷积 16 × ↑ Mage-VAE Mage-VAE Mage-VAE 分块 扩散块 ⋯ 扩散块 扩散块 ⋯ 扩散块 扩散头 解码器 GAN 损失 编码器 解码器 GAN 损失

(b) Mage-VAE 的架构 (c) Mage-VAE 的训练过程

图 6 Mage-VAE 是一种基于像素扩散的轻量级 VAE,从 FLUX.2-VAE 潜在空间蒸馏而来。 FLUX.2-VAE 提供了用于扩散预训练和锚定潜在正则化的锚定潜在分布。Mage-VAE 解码器被蒸馏以从与 FLUX.2 对齐的潜在变量中重建图像, 而 Mage-VAE 编码器被训练以产生与同一锚定空间兼容的潜在变量。这种设计产生了一个高效的一步式编码器–解码器,它保留了生成就绪的潜在结构, 并且可以在下游生成器中与 FLUX.2-VAE 互换。

真实图像,以及在这些表示上训练的轻量级特征判别器,提供对抗性梯度以提高真实感和语义对齐。Mage-Flow 和 Mage-Flow-Edit 使用解耦分布匹配蒸馏(Decoupled DMD)作为主要的蒸馏骨干网,并添加这种基于 VFM 的对抗性 引导作为补充信号,为生成和编辑产生 4 步 Turbo 变体。

3 Mage-Flow 堆栈

如图 5(a) 所示,Mage-Flow 堆栈围绕两个核心模型组件构建:Mage- VAE,一种轻量级高保真潜在标记器,以及一个使用整流流匹配训练的 40 亿参数原生分辨率多模态扩散 Transformer (NR-MMDiT)。Mage-VAE 提供了一个紧凑的 生成就绪潜在空间,而 NR-MMDiT 对具有灵活分辨率和纵横比的打包潜在序列进行建模。该堆栈由训练和推理基础设施支持, 使得原生分辨率 40 亿规模的学习变得切实可行。我们在第 3.1 节描述 Mage-VAE, 在第 3.2 节描述 NR-MMDiT,并在第 3.3 节描述训练基础设施。

3.1 Mage-VAE:轻量级图像标记器

随 SD3 [20] 和 FLUX 系列 [6] 发布的公共 VAE 在很大程度上继承了 VQGAN [70] 和 LDM [71] 自动编码器架构,这些架构最初是为低分辨率 256×256 图像设计的。当扩展到现代 1K 和 2K 图像生成时,由于全局注意力等架构组件和 计算密集型高分辨率块,推理延迟和内存消耗不成比例地增加。因此,VAE 编码和解码可能 成为延迟的主要来源,在几步高分辨率生成中接近扩散 Transformer 本身。例如,在使用 FLUX.2-Klein-4B 进行 1K 分辨率图像的 4 步生成期间,VAE 解码占总生成时间的 14%。Mage-VAE 旨在消除这一瓶颈,同时保持重建保真度。它用轻量级的一步式扩散风格编码和 解码替换了重型高分辨率自动编码器组件,并通过向强公共 VAE 的锚定潜在 KL 正则化潜在空间。 其架构和训练流程总结在图 6 中。

10

第 11 页

表 1 Mage-VAE 的评估结果。报告了编码和解码的模型参数量和计算复杂度(以 kMACs/pixel 衡量)。重建质量在原生分辨率下的 CLIC 2020 测试集以及 1024 × 1024 分辨率下的 FFHQ 验证集(10k 样本)上进行测量。

| Model | Params (M) Enc. | Params (M) Dec. | kMACs/px Enc. | kMACs/px Dec. | CLIC 2020 Test PSNR↑ | CLIC 2020 Test SSIM↑ | CLIC 2020 Test LPIPS↓ | FFHQ (val 10k) PSNR↑ | FFHQ (val 10k) SSIM↑ | FFHQ (val 10k) LPIPS↓ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | SD-VAE [71] | 34 | 49 | 2130 | 4796 | 30.10 | 0.8156 | 0.0565 | 33.00 | 0.8662 | 0.0461 | | SD-3.5-VAE [20] | 34 | 50 | 2132 | 4797 | 32.79 | 0.8896 | 0.0271 | 36.23 | 0.9330 | 0.0189 | | FLUX-VAE [33] | 34 | 50 | 2132 | 4797 | 34.80 | 0.9264 | 0.0188 | 38.43 | 0.9587 | 0.0129 | | FLUX.2-VAE [6] | 34 | 50 | 2134 | 4798 | 36.88 | 0.9447 | 0.0139 | 40.47 | 0.9682 | 0.0102 | | Qwen-Image-VAE [5] | 54 | 73 | 3378 | 5423 | 34.95 | 0.9129 | 0.0571 | 38.75 | 0.9515 | 0.0422 | | HunyuanVideo-VAE [74] | 100 | 146 | 6198 | 14096 | 36.14 | 0.9305 | 0.0250 | 39.86 | 0.9610 | 0.0205 | | HunyuanImage-3.0-VAE [7] | 389 | 871 | 28053 | 49836 | 33.80 | 0.8864 | 0.0546 | 36.84 | 0.9259 | 0.0468 | | Mage-VAE | 49 | 52 | 173 | 215 | 36.61 | 0.9450 | 0.0148 | 40.67 | 0.9708 | 0.0107 |

VAE 编码延迟 (A100, BF16) | Model | Memory | OOM | | :— | :— | :— | | Mage-VAE | 200 MB | OOM | | FLUX.2-VAE | 2 GB | | | Qwen-Image-VAE | 20 GB | | | HunyuanVideo-VAE | 50 GB | | | HunyuanImage-3.0-VAE | | |

VAE 解码延迟 (A100, BF16) | Model | Memory | OOM | | :— | :— | :— | | Mage-VAE | 200 MB | OOM | | FLUX.2-VAE | 2 GB | | | Qwen-Image-VAE | 20 GB | | | HunyuanVideo-VAE | 50 GB | | | HunyuanImage-3.0-VAE | | |

*(注:原图中包含坐标轴标签,左侧纵轴为 Latency (ms),横轴为 Resolution (512², 1024², 2048², 4096²);右侧纵轴为 Latency (ms),横轴为 Resolution (512², 1024², 2048², 4096²)。)*

图 7 Mage-VAE 的推理成本。在 80GB A100 GPU 上跨分辨率测试了编码和解码的延迟及内存占用。未显示 SD-VAE、SD-3.5-VAE 和 FLUX-VAE,因为它们的模型结构与 FLUX.2-VAE 几乎相同,导致其推理成本完全重叠。

3.1.1 架构

轻量级编解码器风格解码器。我们的解码器设计灵感来自 CoD-Lite [9],这是一种用于高保真感知重建的轻量级基于扩散的图像编解码器。CoD-Lite 表明,面向压缩的扩散预训练,随后进行一步蒸馏,可以在不使用重型 DiT 或 U-Net 风格解码器的情况下产生强大的重建质量。遵循这一原则,我们将 Mage-VAE 解码器构建为一步像素扩散模型。它使用堆叠的卷积扩散块 [72] 和解耦的像素扩散头 [73],直接从潜在变量重建 RGB 像素。这种全卷积设计避免了全局注意力机制,并使解码成本在图像分辨率上保持近乎线性。

轻量级对称编码器。与图像编解码器不同,在图像编解码器中解码效率通常是主要关注点,而生成模型也需要高效的编码:训练需要大规模准备图像潜在变量,编辑模型必须反复编码参考或源图像。因此,我们将编码器设计为解码器的架构对偶。由于解码器可以被视为以潜在变量为条件的像素生成器,我们将编码器视为以像素为条件的潜在变量生成器。具体而言,编码器也实现为一步扩散模型,由补丁嵌入层和堆叠的卷积扩散块组成。这种对称设计使得潜在变量提取与像素重建一样轻量。

第 12 页

表 2 锚定潜在标记器兼容性。我们评估了使用不同潜在标记器的生成和编辑骨干网络。比较在保持下游骨干网络固定的情况下,在 Mage-VAE 和 FLUX.2-VAE 之间进行切换。所有指标越高越好。

(a) 文生图生成。

骨干网络 标记器 GenEval DPG-Bench TIIF-Short TIIF-Long CVTG-2K OneIG-EN OneIG-CN LongText-EN LongText-CN Mage-Flow-Turbo Mage-VAE 0.88 85.48 83.58 84.16 0.873 0.523 0.491 0.911 0.801 Mage-Flow-Turbo FLUX.2-VAE 0.88 85.49 81.18 81.09 0.869 0.523 0.491 0.909 0.800 FLUX.2-Klein-4B [6] FLUX.2-VAE 0.83 85.53 78.91 79.04 0.628 0.500 0.364 0.649 0.068 FLUX.2-Klein-4B [6] Mage-VAE 0.83 85.52 77.40 79.43 0.623 0.502 0.361 0.654 0.068

(b) 基于指令的编辑。

骨干网络 标记器 ImgEdit GEdit-EN GEdit-CN TextEdit-Syn TextEdit-Real Mage-Flow-Edit-Turbo Mage-VAE 4.38 8.271 8.264 12.77 15.41 Mage-Flow-Edit-Turbo FLUX.2-VAE 4.34 8.098 8.112 12.85 15.26 FLUX.2-Klein-4B [6] FLUX.2-VAE 4.01 7.717 7.750 11.84 14.46 FLUX.2-Klein-4B [6] Mage-VAE 3.95 7.734 7.672 11.65 14.46

3.1.2 基于锚定潜在分布的 KL 正则化

CoD-Lite 通过比特率目标约束其潜在空间。在常用的均匀噪声后验近似下,该比特率目标可以解释为潜在空间中的 KL 风格正则化项。从这个角度来看,VAE 可以被视为具有高斯潜在后验的学习图像编解码器,这表明通过将比特率控制替换为变分正则化,可以将编解码器架构迁移到 VAE 设计中。

遵循这一观点,我们通过将比特率约束替换为 KL 正则化器,将 CoD-Lite 风格的编解码器转换为适用于生成的 VAE。与将后验匹配到标准高斯先验的传统 VAE 不同,我们将后验正则化到由 FLUX.2-VAE [6] 诱导的锚定潜在分布。由于 FLUX.2-VAE 使用 32 个潜在通道和 8× 空间下采样,且这些潜在变量在进入扩散 Transformer 之前通常会被进行 2× 分块处理,Mage-VAE 通过直接产生具有 128 个通道的 16× 下采样潜在变量,内部化了这种分块处理。我们使用分块后的 FLUX.2 潜在变量作为编码器预训练和 KL 正则化的锚定目标,使 Mage-VAE 能够继承对生成友好的潜在结构,同时为下游扩散训练提供适用于 Transformer 的潜在变量。

3.1.3 训练

训练流程包含三个阶段。在阶段 I 中,我们使用标准的流匹配目标,在 X-预测参数化下分别将编码器和解码器预训练为多步扩散模型。解码器学习重建图像像素,而编码器学习从像素预测分块后的 FLUX.2-VAE 锚定潜在变量。在阶段 II 中,我们使用重建损失、带有压缩导向扩散教师 [75] 的 DMD 损失 [64] 以及 DINOv2 投影的 GAN 损失 [76] 将解码器蒸馏为一步模型,以提高感知保真度。在阶段 III 中,我们联合微调一步编码器和解码器,使用锚定潜在 KL 正则化器,生成一个紧凑的 VAE,其潜在空间已准备好用于 Mage-Flow 训练。详细的训练过程见附录 A。

3.1.4 评估

重建。在表 1 中,我们使用两种互补的设置评估了 Mage-VAE 的重建性能:原生分辨率(∼2K)下的高质量通用领域 CLIC 2020 测试集 [77],以及 1024 × 1024 分辨率下的肖像领域 FFHQ 验证集 [78]。Mage-VAE 在 CLIC 2020 上实现了与最强 FLUX.2-VAE 基线相当的重建保真度,

12

第 13 页

表 3 打包条件自由引导(Packed CFG)评估的推理效率。通过将条件分支和无条件分支打包到单个批次中,Mage-Flow 在保持原始去噪轨迹的同时,降低了无分类器引导(classifier-free guidance)的开销。所有配置均在单张 NVIDIA A100 GPU 上进行基准测试。

| Model | Steps | Separate CFG | Packed CFG | Speedup | | :— | :— | :— | :— | :— | | Mage-Flow-Base | 30 | 7.5089s | 6.5159s | 1.15× | | Mage-Flow | 20 | 5.0076s | 4.3680s | 1.15× | | Mage-Flow-Edit-Base | 30 | 11.5463s | 10.5582s | 1.09× | | Mage-Flow-Edit | 30 | 11.5985s | 10.5475s | 1.10× |

同时在所比较的 VAE 中,在 FFHQ 上获得了最佳或接近最佳的重建质量。这表明所提出的轻量级设计在通用领域和以人脸为中心的图像上均保持了高视觉保真度。

推理效率。表 1 和图 7 进一步评估了效率。Mage-VAE 将 FLUX.2-VAE 的编码计算复杂度降低了约 12.3 倍,解码计算复杂度降低了 22.3 倍。这转化为在所有测试分辨率下持续更低的延迟和内存占用。该优势在高分辨率下变得更加明显,在 4096×4096 分辨率下,基线 VAE 变得极慢或内存溢出,而 Mage-VAE 在编码和解码方面依然高效。这些结果表明,Mage-VAE 提供了显著更好的质量-效率权衡,使其适用于高分辨率生成、重复编辑和交互式部署。

生成与编辑。除了像素级重建和效率之外,我们进一步评估了 Mage-VAE 是否保留了 FLUX.2-VAE 的生成就绪潜在结构。由于 Mage-VAE 是从计算昂贵但容量高的 FLUX.2-VAE 的潜在分布中蒸馏并对其进行正则化的,因此当由下游生成器使用时,这两个标记器应保持兼容。表 2 报告了一个交叉标记器消融实验,该实验交换了 Mage-VAE 和 FLUX.2-VAE,同时保持生成或编辑骨干网络固定。在我们的 Turbo 模型中用 FLUX.2-VAE 替换 Mage-VAE 产生了类似的基准性能,而在 FLUX.2-Klein-4B [6] 中用 Mage-VAE 替换 FLUX.2-VAE 也保持了可比的结果。这表明 Mage-VAE 不仅重建图像效果好,而且保留了 FLUX.2 风格扩散生成器所需的潜在几何结构,使其能够作为原始 FLUX.2-VAE 在下游生成和编辑模型中的高效替代品。

发现 1:锚定潜在(Anchor-latent)监督实现了高效的 VAE 蒸馏,同时不破坏生成就绪的潜在空间:通过将轻量级的一步编码器-解码器与强大但计算昂贵的 VAE 的潜在分布对齐,该标记器在大幅降低编码和解码成本的同时,保持了重建质量和跨生成器的兼容性。

3.2 原生分辨率多模态扩散 Transformer (Native-Resolution MMDiT)

3.2.1 模型架构与原生打包

Mage-Flow 的生成骨干网络是一个拥有 40 亿参数的原生分辨率多模态扩散 Transformer,如图 5(b) 所示。它遵循 SD3 [20] 引入的 MMDiT 块设计,其中文本和图像标记被连接并由联合自注意力处理。每个块使用特定模态的归一化和投影层,以保留不同模态的独特统计特性。

13

第 14 页

文本和视觉流,而跨模态交互是通过在组合序列上的自注意力机制完成的。

与标准 MMDiT 训练的一个关键区别在于,NR-MMDiT 不将每个优化步骤限制在预定义的分辨率桶(bucket)中。在传统的基于桶的训练中,图像被分配到一个有限的固定分辨率和长宽比桶集合中,每个步骤仅从一个桶中抽取样本,以便所有视觉令牌网格共享相同的空间形状。这简化了批处理,但它离散化了原生分辨率分布,引入了桶量化不匹配,并限制了每次更新中观察到的长宽比的多样性。除非显式添加相应的桶,否则这也使得支持极宽或极高的输出变得困难。受 NiT [10] 的启发,我们改为直接在原生分辨率序列上进行训练。不同分辨率和长宽比的图像由 Mage-VAE 编码,展平为可变长度的潜在令牌序列,并在固定的令牌预算下打包成一个连续的批次。我们将相同的打包原则应用于文本条件:不同长度的提示嵌入被打包,而不是填充到共同的 maximum 长度。借助 FlashAttention 的可变长度内核 [11, 12],打包后的文本和图像序列使用逐样本累积偏移量进行处理,从而在每个样本内限制注意力,而无需构建显式的块对角掩码。

这种原生分辨率公式具有几个实际优势。首先,样本在固定的令牌预算下打包,因此训练可以自然地平衡异构图像大小与可变长度的文本条件。这提高了批处理的灵活性,避免了文本侧不必要的填充,同时允许图像分支保留每个样本的原生潜在网格。其次,它消除了训练期间的单桶限制:每个优化步骤可以包含具有不同原生分辨率和长宽比的图像,而不是从单个预定义的分辨率桶中抽取所有样本。这使得模型在每次更新中接触到更丰富且离散程度较低的分辨率分布,并避免了将连续图像大小映射到有限桶集合时引入的桶量化不匹配。因此,单个检查点在推理时自然地泛化到灵活的输出尺寸。如图 1 所示,高度和宽度均可在 512 到 2048 之间变化,这不仅支持标准的正方形、肖像和风景输出,还支持极端的长宽比,如 512 × 2048 和 2048 × 512。

相同的打包机制也提高了推理效率。对于无分类器引导(classifier-free guidance),条件分支和无条件分支可以打包在一起并在单次前向传播中评估,从而避免了单独进行 CFG 评估引入的冗余计算,同时保留了原始的降噪轨迹。如表 3 所示,在 Mage-Flow 和 Mage-Edit 变体中,打包的 CFG 始终将推理速度提高了 1.09×–1.15×。因此,原生分辨率打包既是一种用于异构分辨率学习的训练策略,也是一种用于高效 CFG 评估的推理优化。

发现 2:原生分辨率打包将分辨率多样性转化为训练信号:移除单桶限制允许每次更新混合异构图像大小和长宽比,从而提高分辨率灵活性,并实现高效的打包 CFG 推理。

3.2.2 条件设定与整流流训练

文本条件由冻结的 Qwen3-VL-4B-Instruct [13] 文本编码器提供,该编码器将每个提示映射为上下文嵌入 $\tau$。给定图像 $x$,Mage-VAE 以 16× 的空间缩减和 128 个通道将其编码为潜在变量 $z = \text{Mage-VAE}(x)$。这些潜在变量被展平为视觉令牌,并线性投影到 NR-MMDiT 的隐藏维度。模型经过训练

14

第 15 页

表 4 训练效率消融实验。所有配置均在配备 FlashAttention-4 [12] 的单个 8-GPU NVIDIA B200 节点上进行基准测试。全局批次大小为 8,每个 GPU 处理一个打包样本,每个样本包含固定打包序列长度 50,000 个 token。我们逐步用 Mage-VAE 替换 FLUX.2-VAE,并为 Mage-VAE、Qwen3-VL 文本编码器和 NR-MMDiT 启用融合 CUDA 内核。报告了每 GPU 峰值内存、模型 FLOP 利用率 (MFU)、每步墙钟时间以及相对加速比。

| Tokenizer | VAE Fuse | Text Fuse | DiT Fuse | Mem. (GB) | MFU | Time (s) | Speedup | | :— | :— | :— | :— | :— | :— | :— | :— | | FLUX.2-VAE [6] | – | – | – | 175.45 | 33.20% | 1.9259 | 1.00× | | Mage-VAE | – | – | – | 175.47 | 45.63% | 1.3634 | 1.41× | | Mage-VAE | ✓ | – | – | 175.47 | 45.85% | 1.3586 | 1.42× | | Mage-VAE | ✓ | ✓ | – | 175.47 | 47.20% | 1.3196 | 1.46× | | Mage-VAE | ✓ | ✓ | ✓ | 141.44 | 77.26% | 0.7748 | 2.49× |

在 Mage-VAE 潜在空间中,使用整流流匹配目标 [20],

$$ \mathcal{L}(\theta) = \mathbb{E}_{(x,\tau),t,\epsilon} \| v_\theta(z_t, t, \tau) – (z – \epsilon) \|_2^2, $$

其中

$$ z_t = (1 – t)z + t\epsilon, \quad \epsilon \sim \mathcal{N}(0, I). $$

生成和编辑任务使用相同的整流流目标和 NR-MMDiT 主干网络,但条件输入不同。对于 Mage-Flow,Qwen3-VL 将文本提示编码为 $\tau$,NR-MMDiT 对目标潜在 token 进行去噪,条件为 $\tau$。对于 Mage-Flow-Edit,Qwen3-VL 将编辑指令与源图像一起编码为多模态条件嵌入 $\tau$,而 Mage-VAE 将源图像和目标图像编码为 $z_{src}$ 和 $z_{tgt}$。因此,NR-MMDiT 的输入序列拼接了 $\tau$、$z_{src}$ 和带噪声的目标潜在 token。

为了区分源视觉 token 和目标视觉 token,Mage-Flow-Edit 在 Mage-Flow 使用的 2D 旋转位置编码 (RoPE) 基础上扩展了额外的帧维度。每个视觉 token 被分配一个 3D 位置索引 $(h, w, f)$,其中 $(h, w)$ 表示其原生空间位置,$f$ 表示图像索引,涵盖所有源图像和目标图像。这种感知帧的 RoPE 在指示共享注意力序列中 token 角色的同时,保留了源-目标的空间对应关系。损失仅在目标 token 上计算,因此 Mage-Flow-Edit 可以直接从 Mage-Flow 初始化,而无需添加单独的编辑模块。

3.3 训练基础设施

Mage-Flow 堆栈的训练效率由三个反复执行的模块决定:Mage-VAE 中的卷积扩散块、冻结的 Qwen3-VL 文本编码器中的 Transformer 块以及 4B NR-MMDiT 块。尽管它们的主要算术运算来自卷积、矩阵乘法和注意力机制,但每个块还包含许多内存受限的操作链,包括归一化、自适应调制、RoPE 应用、门控、激活和残差相加。当作为独立的 CUDA 内核启动时,这些操作反复读取和写入大型激活张量,导致大量的内存流量和内核启动开销。

为了减少这种开销,我们融合了整个堆栈中重复块内的主导操作链。在 Mage-VAE 中,我们融合了卷积扩散块中的归一化–激活–残差链。在 Qwen3-VL 文本编码器和 NR-MMDiT 中,我们融合了常见的 Transformer 侧操作,如自适应归一化、旋转嵌入应用和门控残差更新。这些融合的内核将中间值保留在片上内存中,仅写回最终输出,从而减少了激活内存移动和内核启动次数。因为这些

15

第 16 页

(a) 文生图数据处理流水线

样本级过滤 跨样本 去重 100亿开源 文件信息过滤 图像内容过滤 图像数据集 损坏 文件大小 饱和度 亮度 灰度 模糊 多粒度 ~13亿高质量 标注 图像- 分辨率 宽高比 纹理 水印 不适宜工作场所内容 美学 文本数据

旋转 光学字符识别 熵 概念感知 合成

(b) 多粒度标注框架 短语 四只绿鸽,栅栏,阴天城市光照,场景,湿混凝土路面,台阶,水洼,柔和色彩反射, 摄影 这是一张在眼睛高度拍摄的写实风格户外街头摄影作品 实体 四只鸽子站在铺砌表面上的一个大水洼里。 光线。场景中前景部分,捕捉到四只湿漉漉的鸽子(鸽子)带有漫射的,灰暗和 虹彩 羽毛 站立 在 一个 宽阔 的水洼中; 一只 鸟 面向 左 而 另 A 街道水平 视角 显示 四 只 鸽子 站立 在 一个 大的 其他 面向 右 或 看 下。 该 表面 的水 是 受扰动的 由 浅 水洼 在 一个 灰色 铺砌 道路上。

在池塘后面,鸟儿脚边泛起涟漪,形成扭曲的天空倒影。

构图和背景元素。背景由一个风化的、

框架,毗邻一片草地,

区域,带有一些植被。在

左侧,一个

淡绿色的木制

栅栏和一些

过度生长的

绿植,旁边是一个

一组具体的混凝土台阶沿着道路向上延伸。最左侧的混凝土楼梯。色彩以冷色调为主。平静的水面倒映着天空。

围栏。 系统提示: 灰色, 棕色, 以及 围栏 的 柔和 绿色

你是一个世界级的多粒度图像描述专家。你的任务是 分析 给定的 图像 并生成 一个 短语 或 装饰性 金色 框架,插图, 复杂 雕刻,棕榈树,黑色 历史 衬垫,建筑 白色 摄影 结构化, 详细, 和 客观 描述,遵循以下原则: 照片级逼真的带框墙面艺术品特写。该图像包含 …… 实体 带框建筑印刷品,标题为 Marianna。 复杂 厚重,花卉 古董风格 雕刻 沿着 框架 边缘。在 框架 内部,黑色 叶子 衬垫 和 板 环绕着 白色 衬垫,上面固定着一幅单色 铅笔风格 的 素描 描绘 了 一系列 历史 建筑,包括

a A framed art print centered within the view, displaying a sketch.building with a dome and a large central hall, flanked by foliage and a black-and-white architectural drawing surrounded by a wide Composition prominent palm tree. The word 'MARIANNA' is printed in uppercase black border and a large, ornate golden frame with carved serif font at the top center of the

插图。在艺术品下方,黑色衬垫的下部区域,一个小型椭圆形金色牌匾以手写体文字显示“Tommy Thompson”的名字。

图 8 文生图数据处理与标注流水线。(a) 原始网页图像-文本对经过样本级过滤、跨样本去重、多粒度标注和概念感知合成,最终形成高质量的图像-文本语料库。(b) 多粒度标注框架利用 Qwen3-VL 生成短语级、实体级、构图级和摄影级标注,提供具有不同语义细节和视觉具体性的训练提示。

在每次前向和反向传播过程中,这些块被执行多次,因此局部算子融合转化为显著的栈级吞吐量提升。

如表 4 所示,用 Mage-VAE 替换 FLUX.2-VAE 已将每步时间从 1.9259 秒降低至 1.3634 秒,实现了 1.41 倍的速度提升,这表明轻量级标记器的重要性。融合 Mage-VAE 和 Qwen3-VL 带来了额外但适度的收益,而融合重复的 NR-MMDiT 块则提供了最大的改进,因为 4B 扩散骨干网络主导了训练步骤。总体而言,完整系统将 MFU 从 33.20% 提升至 77.26%,将每 GPU 峰值内存从 175.45 GB 降低至 141.44 GB,并将每步训练速度提高了 2.49 倍。这些结果表明,高效的原生分辨率训练不仅需要高效的标记器和架构,还需要栈级内核优化,以消除重复块中的内存受限开销。

发现 3:高效的原生分辨率生成需要模型与训练系统的协同设计:轻量级标记化降低了算术成本,而栈级内核融合消除了原本会主导重复 VAE、文本编码器和 MMDiT 块的内存受限开销。

4 数据收集与策展

Mage-Flow 栈依赖于两个互补的数据流水线:一个用于文生图生成,另一个用于基于指令的图像编辑。生成流水线将大规模图像-文本对策展为高质量且平衡的提示-图像监督数据,而编辑流水线构建并筛选源图像、指令和目标图像三元组。这两个流水线的设计旨在提高视觉质量、安全性、语义对齐、多样性以及原始网页数据中代表性不足的能力特定技能的覆盖范围。

第 17 页

表 5 预训练和 SFT 阶段各样本级别的过滤阈值。阈值从 2562 阶段逐步收紧至 10242 和 SFT 阶段。早期阶段保留广泛的视觉覆盖范围,而后期阶段则强调更高分辨率、更强的美学质量、更低的水印概率以及更干净的内容。

| | 2562 | 5122 | 10242 | SFT | | :— | :— | :— | :— | :— | | 像素数 $h \times w$ | $\ge 256^2$ | $\ge 512^2$ | $\ge 1024^2$ | $\ge 1024^2$ | | $\min(h, w)$ | $\ge 128$ | $\ge 256$ | $\ge 512$ | $\ge 512$ | | 纵横比 | $[0.1, 10.0]$ | $[0.1, 10.0]$ | $[0.1, 10.0]$ | $[0.1, 10.0]$ | | 文件大小 | $\ge 1 \text{ KB}$ | $\ge 1 \text{ KB}$ | $\ge 1 \text{ KB}$ | $\ge 1 \text{ KB}$ | | NSFW 分数 | $\le 0.1$ | $\le 0.1$ | $\le 0.1$ | $\le 0.1$ | | 水印分数 | $< 0.5$ | $< 0.3$ | $< 0.1$ | $< 0.05$ | | Aesthetic-V2.5 分数 | $\ge 4.5$ | $\ge 5.5$ | $\ge 6.0$ | $\ge 6.5$ | | OCR 文本区域比例 | $\le 0.3$ | $\le 0.3$ | $\le 0.3$ | $\le 0.3$ | | OCR 区域数量 | $\le 5$ | $\le 5$ | $\le 5$ | $\le 5$ |

4.1 文生图数据收集与过滤

Mage-Flow 生成语料库由从大规模开源数据集中收集的约 100 亿原始图像-文本对构建而成。如图 8 所示,策展流程包含四个主要阶段:样本级过滤、跨样本去重、多粒度标注和概念感知合成。样本级过滤器移除损坏、低质量、不安全或视觉上不合适的图像;去重抑制近似的视觉模式;多粒度标注标准化文本监督;概念感知合成补充长尾图像。经过策展后,保留约 13 亿高质量图像-文本对,从中采样各阶段预训练子集。

样本级过滤。我们首先使用图 8(a) 所示的文件信息和图像内容过滤器独立过滤每个图像-文本对。文件信息过滤器移除损坏或近乎空白的文件、分辨率或像素数不足的图像、极端纵横比以及具有错误方向元数据的样本。图像内容过滤器随后对解码后的图像进行视觉质量和安全性评分:亮度和饱和度过滤器移除过曝、欠曝或饱和度不自然的图像;灰度和模糊过滤器移除近乎单色或低清晰度的样本;熵和纹理过滤器抑制近乎空白的图像和类似纹理的非语义模式;水印、美学、OCR 和 NSFW 过滤器移除带有水印、低质量、文档类或不安全的图像。许多过滤器基于阈值而非二元判断。如表 5 所示,阈值在 2562、5122、10242 和 SFT 阶段逐步收紧,以便早期训练保留广泛的覆盖范围,而后期阶段专注于更干净、更高质量的数据。

跨样本去重。网络规模的数据在单个来源内部以及跨数据集之间都具有高度冗余性。在样本级过滤之后,我们在两个层面上对图像进行去重。每个保留的图像都被编码为 SSCD 复制检测描述符 [79],该描述符对重新编码、裁剪、调整大小和轻微编辑具有鲁棒性。所有描述符均使用 FAISS [80] 建立索引,以进行高效的最近邻搜索。在每个数据集内部,余弦相似度高于 0.9 的图像对被视为重复项,仅保留质量最高的代表性样本。非常大的聚类被限制数量,以抑制重复的网络模板,如库存照片、横幅和产品布局。跨数据集方面,我们维护一个已接受图像的持久描述符索引,并拒绝在相同相似度阈值下重现现有样本的新样本。我们还与保留的基准索引进行匹配,以减少评估污染。这些步骤共同提高了多样性,并防止重复来源主导训练分布。

17

第 18 页

Canny Multi Subject Old Normal Composition Edge Map PhotoColorization Shift Depth 0.61% 2.1%Reference2.0%Extraction 0.91% Viewpoint 0.63% 0.90%0.66% Map 15.0% Other 2.1% 4.4%Low Tone& Level Reference 2.0%Lighting Low Level & 9.3% 5% Background Change Scene & Spatial 5.5% Style Transfer Global 20.5% Object & Products 8.4% Composition 31.3% Packaging 10.4%Stylization Portrait 3.5% Count Change 1.3% Attribute Editing Attribute8.6%Tweak 5.7% People Object Addition Object Editing 20.3% 19.0% 4.2% 15.7% Scene & Place Portrait Retouch Appearance Object Replacement Text Editing 5.4% 26.1% 6.2% 4.5% 18.6% Recolor Action Person Removal &2.6% 7.2% Object5.7% 0.87%1.61% Material2.2%2.2% Pose Removal Poster Change Indoor Addition Other Text Text 6.2% Replacement4.5% 5.5% 7.7% Text Text

(a) Generation pre-training data. (b) Editing pre-training data.

图 9 生成与编辑预训练的数据构成。(a) 将过滤后的网络数据与有针对性的补充数据合并后,精选生成语料库的概念分布。(b) 在调整各组成部分编辑数据集的采样率后,编辑预训练混合数据的最终构成。

多粒度标注。为了标准化文本监督,我们使用 Qwen3-VL-32B-Instruct [13] 对保留的图像进行标注。遵循 [22] 的方法,每张图像被赋予多个层级的标注:用于概念统计的短语级描述、描述主要对象及其属性的实体级标注、描述空间布局和关系的构图级标注,以及描述风格、光照、视角、氛围和细微视觉细节的摄影级标注。在训练过程中,模型从这些描述性标注通道中进行采样,从而学习遵循不同长度和具体程度的提示。对于文本丰富的图像,标注器被明确提示以识别可见文本并将其转换为渲染指令。

概念感知的合成与平衡。尽管大规模网络数据提供了广泛的视觉覆盖,但在若干关键能力领域(包括长文本渲染、稀有对象、不常见属性、结构化布局以及代表性不足的样式)中仍然稀疏。因此,我们针对这些长尾概念构建了有针对性的补充数据,包括合成文本渲染样本

包含多样化的字体、排版、语言、颜色和背景,以及涵盖罕见概念和组合案例的额外图像-文本对。所有补充样本在合并到精心策划的预训练语料库之前,均通过相同的过滤和质量控制流程。随后,我们使用短语级标题来估计合并语料库的概念分布,如图 9(a) 所示。所得分布仍然呈现长尾特征:物体与产品(Object & Products)以及场景与地点(Scene & Place)构成了两个最大的粗粒度领域,而设计(Design)和合成(Synthetic)则为排版、产品风格、海报风格和文本渲染能力提供了重要的覆盖。在训练过程中,我们应用概念感知采样以减少频繁出现的物体、自然场景和常见照片写实风格的主导地位。在训练阶段中,我们逐步收紧过滤阈值并加强重加权,从早期阶段的广泛视觉先验学习过渡到后期阶段更干净且更专注于能力培养的学习。

4.2 图像编辑数据收集与过滤

Mage-Flow-Edit 语料库由(源图像,编辑指令,目标图像)三元组组成。如图 10 所示,原始池包含来自两个互补来源的大约 9000 万三元组:其中约 5000 万三元组来自聚合的开源基于指令的编辑数据集,以及约

18

第 19 页

VLM 投票 专家 “你是一位专家评估者……” ~50M 开源 LLM 分析 结果解析 (≥2/3多数通过 → 投票接纳) ~45M(~20M openTriples+ ~25M Survivesynthetic) 编辑三元组

~90M 三元组总计 编辑类型标记 背景, 风格, 颜色, ~40M 合成 主体 添加/移除/替换… 内部 三元组 ✓ 通过示例 ✗ 失败示例 ~10M 低层 处理

编辑类别 专家1: 7 ~30M 通用 语义 专家1: 10 4 平衡 编辑 专家2: 10 专家2: 专家2: 4 专家3: 6 ✓ 接纳 ✗ 丢弃 将面包篮替换为 将树叶颜色更改为 训练集 色彩鲜艳的新鲜水果碗 橙色 “该 指令 是 替换 面包篮为碗状的 “该 编辑 指令 是 成功 执行 的 。 左侧 树上的 树叶 已 更改 为橙色, 而 其余 “水果碗完美地替换了面包篮,与 树叶的颜色变为橙色,但其余部分仍为绿色; 底座、光照和阴影完全匹配。” 仅部分覆盖且可见伪影。” “水果碗替换了面包篮,但碗的形状和 “树叶是橙色的,但仍有绿色残留;仅部分重着色, 位置与原面包篮不同,导致比例 可见色度不匹配和溢出。” 和位置不匹配。” ”

图 10 编辑数据过滤流程。原始编辑三元组来自开源编辑数据集和内部合成。每个三元组由三位具有不同系统提示和部分重叠评分标准的 Qwen3.5-9B 专家进行评估。每位专家分析源图像、目标图像和编辑指令,其推理输出被解析为通过/失败决策。只有当三元组获得三位专家中的多数投票时,才会被保留。幸存的 45M 三元组随后被分配至手动定义的编辑类型分类法,并按类别重新加权以形成最终的编辑训练集。

内部合成的 40M 三元组。合成部分包含约 10M 低层图像处理三元组和 30M 通用语义编辑三元组。然后,我们应用基于 VLM 的投票过滤器,随后进行编辑类型标记和类别平衡,以构建最终的编辑训练集。

编辑数据合成。内部语义编辑子集旨在覆盖广泛的面向用户的编辑技能,包括背景替换、颜色和材质修改、色调和风格迁移、主体添加、移除和替换、对象数量变化、运动变化、视角变化、文本编辑、人像修饰、老照片修复以及全局调整。每种编辑类型均通过特定类型的流水线生成,该流水线结合了现成的生成、修复、分割、图像处理和基于模板的指令生成。这提供了明确的源-目标配对和清晰的编辑指令,同时补充了开源数据集中稀疏或不可靠的编辑类别。

基于 VLM 的数据集过滤。原始编辑三元组通常包含指令不一致或视觉退化的样本。例如,目标图像可能未能应用请求的编辑、修改了无关区域、不必要地改变了源身份或布局,或引入了可见伪影。因此,我们使用三位独立的 Qwen3.5-9B 专家 [81] 对每个三元组进行评估。每位专家

配置了不同的系统提示,并评估部分重叠的准则集合,使得三项判断相互补充而非完全相同。给定源图像、目标图像和编辑指令,每位专家检查所请求的编辑是否被正确执行、无关区域是否得到保留,以及编辑结果是否在视觉上合理。推理输出被解析为准则级别的评估,然后使用预定义的阈值转换为通过/不通过决策。仅当至少两位专家投票通过时,我们才保留该三元组。过滤后,大约 2000 万个开源三元组和 2500 万个合成三元组得以保留,形成用于编辑训练的 4500 万三元组保留池。

编辑类型标记与平衡。我们手动定义了涵盖所有保留编辑数据的 19 类编辑类别。我们没有使用视觉语言模型独立标记每个样本,而是

第 20 页

文生图生成

低分辨率 原生分辨率 预训练 预训练 微调 监督 Mage-Flow-Base 文生图训练 后 Mage-Flow 蒸馏4步 Mage-Flow-Turbo

图像编辑

编辑 继续 Mage-Flow-Edit- 编辑 图像后训练 训练 Base 和文生图 Mage-Flow-Edit 蒸馏4步 Mage-Flow-Edit-Turbo

图 11 Mage-Flow 训练流程概览。共享主干首先通过渐进式文生图预训练进行训练,总结为低分辨率预训练后接原生分辨率预训练,随后监督微调生成基础生成检查点 Mage-Flow-Base。从该检查点开始,文生图分支应用 Diffusion-NFT 后训练以获得 Mage-Flow,并应用 4 步蒸馏以获得 Mage-Flow-Turbo。编辑分支从 Mage-Flow-Base 分叉:继续源条件编辑训练生成 Mage-Flow-Edit-Base,混合编辑与生成后训练生成 Mage-Flow-Edit,4 步蒸馏生成 Mage-Flow-Edit-Turbo。

根据每个数据源的组织结构确定标注单元。如果数据集包含一致的编辑操作,则整个数据集被视为一个单元。如果数据集被组织为语义一致的子数据集,则每个子数据集被视为一个独立单元。如果存在明确的编辑类型字段,则共享相同字段值的样本形成一个单元。然后,我们手动将每个单元映射到 19 个编辑类别之一,确保每个保留的样本都被分配到统一的本体中。在平衡过程中,我们调整每个组成数据集和编辑类别的采样率,以便聚合训练混合物在本体中保持广泛且比例适当的覆盖。这防止了频繁操作主导梯度信号,同时确保罕见但重要的编辑类型得到充分表示。 resulting 编辑预训练组成如图 9(b) 所示。

5 训练

我们使用统一的配方训练 Mage-Flow 模型家族,该配方由文生图生成和基于指令的编辑共享。两个任务都在相同的 Mage-VAE 潜在空间中运行,并使用相同的 4B 原生分辨率 MMDiT 主干网络,采用整流流目标。主要区别在于条件格式和数据混合:文生图生成以提示词为条件,而编辑以编辑指令和源图像为条件。如图 11 所示,我们按训练阶段组织配方:渐进式预训练和监督微调生成基础检查点,Diffusion-NFT 后训练生成对齐模型,少步蒸馏生成 Turbo 变体。

5.1 预训练和监督微调

文生图生成。生成模型采用渐进式预训练和监督微调课程进行训练。如表 5 所示,预训练包含三个阶段。首先,我们在固定的 256 × 256 分辨率下在 12 亿过滤并重描述的图片-文本对上进行训练,以较低的计算成本学习广泛的视觉-语言对齐。其次,我们转向 512 像素原生宽高比制度下的高质量 6 亿子集,其中每个样本保持大约 512 × 512 像素的预算,同时保留其原始宽高比。第三,我们在 1024 像素原生宽高比制度下在更干净的 3 亿子集上进行训练,以提高细节、布局保真度、文本渲染和美学质量。所有阶段都在 Mage-VAE 潜在空间中使用相同的整流流目标,同时逐步增加分辨率、数据质量和概念感知重加权强度。然后,我们在 1024 像素原生宽高比制度下,在精心策划的 1.5 亿高质量子集上执行监督微调,使用更严格的美学、对齐、水印、OCR 和重复过滤器,并增加针对能力的数据权重。这生成了文生图基础检查点 Mage-Flow-Base。

第 21 页

风格 颜色 主体主体主体颜色 主体主体主体人物 主体主体主体动作 主体主体主体数量 主体 主体主体主体文本 更改 更改 移除移除移除更改 移除移除移除 移除移除移除更改 移除移除移除更改 移除 移除移除移除 输出 (示例)

背景 主体 主体 主体主体主体语调 提取 材质 更改 替换 移除移除移除更改 更改 添加 背景 动作 数量 更改 视角 更改 更改 更改 输入

图像 / 文本

主体 主体 主体 材质 添加 替换 移除 更改

Mage-Flow-Edit 🖊️ 文本提示

将 灰度图 深度图 草图 语调 背景替换为 映射 更改 日落时分宁静的 沙滩

主体主体主体风格 主体主体主体去模糊 主体主体主体试衣 主体主体主体草图 法线主体主体主体 分割主体主体主体 主体主体主体深度 法线 Canny 提取 分割 移除移除移除更改 移除移除移除 移除移除移除 移除移除移除 移除移除移除映射 移除移除移除-化 移除移除移除映射 映射 映射

视角主体主体主体 主体主体主体修复 主体主体主体缩放 灰度图主体主体主体 主体主体主体HED 主体主体主体Canny 主体主体主体姿态 移除移除移除更改 移除移除移除 移除移除移除 移除移除移除 移除移除移除映射 移除移除移除映射 移除移除移除提取

图 12 统一的图像编辑能力及代表性输出。Mage-Flow-Edit 在一个统一的图像和文本条件模型内支持语义内容编辑、外观变换、图像恢复和结构感知输出。所示提示说明了背景替换,而其余输出对应于特定任务的指令或输出请求。

基于指令的编辑。编辑模型从 Mage-Flow-Base 初始化,并采用两阶段编辑适应配方进行训练。在第一阶段,我们在 3500 万编辑三元组和 3500 万生成对的平衡混合数据上进行训练,使模型适应源条件指令遵循,同时保留从 Mage-Flow-Base 继承的视觉先验和开放式合成能力。在第二阶段,我们进一步在更高质量的 2000 万编辑三元组和 1000 万生成对的混合数据上进行训练,以提高编辑的保真度和鲁棒性。在这两个阶段中,多图像编辑示例在编辑数据中所占比例不超过 0.5%,而大多数为单图像编辑。这种两阶段适应产生了编辑基础检查点 Mage-Flow-Edit-Base。图 12 展示了通过此适应配方学到的广泛编辑能力。给定相同的源图像,Mage-Flow-Edit 可以遵循多样化的文本指令,产生语义编辑、外观变换、恢复结果和结构感知输出,这表明编辑检查点支持统一的“一对多”编辑接口,而非一系列特定于任务的模型。

5.2 Diffusion-NFT 后训练

从基础检查点开始,我们对生成和编辑任务均应用 Diffusion-NFT [14] 作为后训练阶段。Diffusion-NFT 直接在流匹配生成器的前向过程上运行,并利用在线样本进行负感知微调,无需似然估计,且与任意黑盒采样器兼容。我们对 Mage-Flow 和 Mage-Flow-Edit 使用相同的 Diffusion-NFT 目标,同时针对每个任务调整条件格式、数据混合和奖励模型。

文本到图像生成。对于 Mage-Flow,我们整理了一个包含约 2 万提示的紧凑强化学习提示池,涵盖三个能力组:约 1 万个文本渲染提示、4000 个美学质量提示和 6000 个语义理解提示。每个提示都被分配了一个能力标签,该标签决定了其评估标准和奖励评估器。文本渲染提示是

21

第 22 页

解耦分布匹配蒸馏 (Decoupled DMD)

[Figure 13 插图描述] 条件 $c$ -> 生成器 $G_\theta$ -> 生成的 $G_\theta(z_t, c)$ -> 学生模型 -> 预测干净样本 真实图像 $y$ (包含文本 "A red fox curled in …") -> 教师模型 条件 $c$ -> 教师模型 -> 条件重噪声 $T_{cond}$ -> 重噪声 $x_\tau^{CA}$ -> $\Delta CA$ -> 分类器自由引导 (Classifier-Free Augmentation) 真实图像 $y$ -> 教师模型 -> 条件重噪声 $T_{cond}^{real}$ -> 重噪声 $x_\tau^{DM}$ -> $\Delta DM$ -> 分布匹配 (Distribution Matching) 生成的图像和真实图像 -> DINOv2 / CLIP -> 特征 -> 判别器 -> 对抗引导 -> $\nabla \mathcal{L}_{GAN}$ 总损失 $\nabla \mathcal{L}_{Total}$

图 13 少步蒸馏框架。学生模型将准备好的加噪潜在变量 $z_t$ 和条件 $c$ 映射到预测的干净样本。解耦 DMD 在两个独立的噪声水平上对学生输出进行重噪声处理:分类器自由增强分支查询冻结的教师模型(有条件和无条件)以形成 $\Delta CA$,而分布匹配分支将教师模型与可训练的假分数量模型进行对比以形成 $\Delta DM$。并行地,生成图像和真实图像由冻结的视觉基础模型(如 DINOv2 和 CLIP)编码,轻量级特征判别器提供对抗梯度 $\nabla \mathcal{L}_{GAN}$。解耦 DMD 梯度和对抗梯度相结合以训练 4 步 Turbo 学生模型。

由 PaddleOCR-VL-1.5 [82] 进行评分,该模型读取生成的图像并将识别出的字符串与目标文本进行比较,以测量 OCR 保真度、场景文本、排版以及文本与物体的交互。美学质量和语义理解提示由 Qwen3.5-27B [81] 使用两套不同的评分标准提示进行评分。美学评分标准评估摄影质量、光照、构图、色彩和谐、纹理和艺术风格,而语义评分标准将提示分解为可检查的问题,涵盖构图推理、物体属性、空间关系、计数、动作和多概念场景。奖励评估器、评分标准以及 OCR 评分公式的详细信息见附录 C。

优化通过在线回滚组(online rollout groups)执行。我们使用 48 的全局批量大小,每个优化器步骤包含来自所有三个能力组的提示。尽管一个步骤混合了异构提示,但每个提示都根据其能力标签路由到恰好一个评估器;其奖励仅由该评估器计算,且从不跨能力求和或平均。对于每个提示,我们使用 10 个去噪步骤和 5.0 的引导尺度从当前生成器中采样一组候选样本,并使用分配的评估器对候选样本进行评分。由于不同的评估器具有不同的分数分布,优势值在每个奖励类型内分别进行归一化:由一个评估器评分的候选样本仅针对来自同一评估器的候选样本进行归一化。这种按类型的归一化产生了 Diffusion-NFT 损失所使用的最优性概率 $r(s)_i \in [0, 1]$。

我们使用两阶段调度方案,在保持所有三个组始终存在的同时随时间推移改变能力混合比例。第一阶段在平衡混合比例 $P_{aes}:P_{text}:P_{sem} = 1:1:1$ 下运行 140 个优化器步骤,使用强调稳定 OCR 案例的文本渲染提示,包括单个单词、短短语、简单标志、徽标和短场景文本,从而使模型在提高字符和单词级渲染的同时,联合提升视觉质量和语义对齐。第二阶段从最佳第一阶段检查点继续运行 60 个步骤,提高较难文本渲染提示的权重至 $P_{aes}:P_{text}:P_{sem} = 2:4:1$,并针对完整句子、密集描述、多行布局、富含标点的文本以及嵌入复杂场景中的文本;在整个过程中保留美学和语义提示可防止对 OCR 的过度专门化,并保留第一阶段建立的通用生成质量。这两个阶段共同生成了对齐的生成检查点 Mage-Flow。

22

第 23 页

表 6 4 步蒸馏中对抗性感知引导的效果。在高度压缩的四步轨迹下,对抗性引导持续改善生成效果并利于文本编辑,而在通用编辑基准上的变化则喜忧参半。分数越高表示性能越好。

(a) 文生图生成。

模型 GenEval DPG-Bench TIIF-Short TIIF-Long CVTG-2K OneIG-EN OneIG-CN LongText-EN LongText-CN

Mage-Flow-Turbo 0.88 85.48 83.58 84.16 0.873 0.523 0.491 0.911 0.801 Mage-Flow-Turbo w/o Adv. 0.89 85.37 80.99 82.03 0.847 0.518 0.486 0.882 0.783

(b) 基于指令的编辑。

模型 ImgEdit GEdit-EN GEdit-CN TextEdit-Syn TextEdit-Real

Mage-Flow-Edit-Turbo 4.38 8.271 8.264 12.77 15.41 Mage-Flow-Edit-Turbo w/o Adv. 4.29 8.003 8.025 11.64 14.77

基于指令的编辑。对于 Mage-Flow-Edit,我们在 Mage-Flow-Edit-Base 之上应用 Diffusion-NFT,使用编辑和生成数据的联合流。这增强了源条件指令遵循能力,同时保留了生成先验。这两个流以 4:1 的比例交错,即每次生成更新对应四次编辑更新,并共享与文生图运行相同的 Diffusion-NFT 目标、全局批量大小和优化器。

生成流复用了文生图的强化学习提示池及其基于能力路由的奖励。该流有助于在编辑后训练期间保留 Mage-Flow-Edit 的文本渲染、组合和开放式生成能力。编辑流从精心策划的编辑强化学习池中抽取指令,该池包含约 30K 个提示,在编辑预训练语料库的编辑任务中均匀采样,包括对象替换、对象移除、背景替换、空间编辑、风格迁移和通用基于指令的编辑。这防止了任何单一编辑类型主导更新。每次编辑回廊(rollout)由 RationalRewards [83] 进行评分,这是一个推理奖励模型,首先产生多维批评,然后输出标量偏好。批评评估四个方面:指令遵循、编辑区域外源内容的保留、物理和感知合理性以及渲染文本的质量。这四个方面的分数被平均为 [0, 1] 范围内的归一化奖励。联合后训练运行 300 步优化器步骤,并产生对齐的编辑检查点 Mage-Flow-Edit。

Diffusion-NFT 目标。对于这两个任务,每个条件 c 用于从当前生成器采样在线候选者。候选者由任务特定的评分标准和奖励评估器进行评分,原始奖励在每个提示组内进行归一化以获得最优性概率 $r_i^{(s)} \in [0, 1]$,其中较大的值表示更高质量的样本。Diffusion-NFT 随后优化具有隐式正负策略的奖励加权流匹配目标:

$$ \mathcal{L}_{\text{NFT}}^{(s)}(\theta) = \mathbb{E}_{c, x_{0,i} \sim \pi_{\text{old}}(\cdot|c), t} \left[ r_i^{(s)} \underbrace{\| v_\theta^+(x_{i,t}, t, c) – v_{i,t} \|^2}_{\text{正匹配}} + (1 – r_i^{(s)}) \underbrace{\| v_\theta^-(x_{i,t}, t, c) – v_{i,t} \|^2}_{\text{负匹配}} \right], $$

其中 $v_{i,t}$ 表示前向过程的目标速度,$v_\theta^+$ 和 $v_\theta^-$ 表示由 Diffusion-NFT 定义的隐式正负策略。正分支将模型拉向高奖励样本,而负分支抑制低奖励样本。对于 Mage-Flow,c 是文本提示,奖励来自评分标准选择的生成评估器。对于 Mage-Flow-Edit,c 可以是生成提示或编辑条件;前者使用相同的生成奖励评估器,后者对源图像、指令和编辑结果使用 RationalRewards。

23

第 24 页

表 7 编辑训练期间混合生成数据的效果。我们比较了使用和不使用生成数据训练的编辑模型。对于全步长编辑器,效果适中;对于 4 步长 Turbo 编辑器,生成数据提升了 ImgEdit 指标,而 GEdit 的变化则喜忧参半。

Model Generation Data ImgEdit GEdit-EN GEdit-CN TextEdit-Syn TextEdit-Real Mage-Flow-Edit ✓ 4.34 8.127 8.123 14.14 16.26 Mage-Flow-Edit – 4.34 7.991 8.062 14.29 15.95 Mage-Flow-Edit-Turbo ✓ 4.38 8.271 8.264 12.77 15.41 Mage-Flow-Edit-Turbo – 4.20 7.984 8.050 12.66 15.20

5.3 少步长蒸馏

为了降低推理成本,我们将经过 RL 对齐的检查点蒸馏为 4 步长 Turbo 模型:用于文本到图像生成的 Mage-Flow-Turbo 和用于基于指令的编辑的 Mage-Flow-Edit-Turbo。在这两个任务中,学生模型均从对应的冻结教师检查点初始化。如图 13 所示,我们的蒸馏框架结合了 Decoupled DMD [15] 以及受 SenseFlow [16] 启发的对抗性感知引导。

蒸馏目标建立在 Decoupled DMD 之上,该框架将标准分布匹配蒸馏中耦合的两个信号分离出来:一个是无条件引导增强(CA)项,用于引导学生朝向引导后的教师方向;另一个是通过可训练的假分网络定义的分布匹配(DM)正则化项。Decoupled DMD 没有共享单一的时间步分布,而是为这两个项分配独立的噪声调度,从而在少步长设置下提高了稳定性。

然而,将采样轨迹压缩至仅四个去噪步骤会使感知质量变得更加脆弱。如表 6 所示,对抗性感知引导在生成和文本编辑方面提供了明显的提升,但在通用编辑基准上的效果则更为复杂:它略微提升了 ImgEdit,但并未均匀地提升 GEdit。因此,我们添加了一个基于在冻结的 DINOv2 和 CLIP 特征空间 [68, 69] 中运行的特征判别器的对抗性感知项。该术语作为 Decoupled DMD 之上的轻量级正则化器,生成器每五次判别器更新更新一次。总体而言,学生模型通过总梯度进行优化:

∇LTotal = ∆CA + ∆DM +λGAN ∇LGAN, | ∇LD−DMD{z } (1) ∆CA = (w −1) T cond(xτca)real −T uncond(xτca)real , ∆DM = Tcond(xτdm)real −T condfake (xτdm).

其中,∆CA 是由教师的条件预测 $T_{cond,real}$ 和无条件预测 $T_{uncond,real}$ 形成的 CFG 增强项,而 ∆DM 是针对假分预测 $T_{cond,fake}$ 的分布匹配项。这两项在独立的噪声水平 $\tau_{ca}$ 和 $\tau_{dm}$ 处进行评估。我们使用引导尺度 $w = 7.5$ 和对抗权重 $\lambda_{GAN} = 0.13$。

发现 4:在高度压缩的四步轨迹下,对抗性感知引导对于保持生成和文本编辑质量最为有益;其在通用编辑基准上的增益取决于具体基准,而非普遍一致。

生成蒸馏。对于 Mage-Flow-Turbo,我们从冻结的 Mage-Flow 教师模型中蒸馏学生模型,数据来自约 20 万对精心策划的高质量提示-图像对。该数据集涵盖六个广泛的内容类别:人物、场景与地点、物体与产品、生活与食物、设计与文本,以及合成数据,其分布如图 14(a) 所示。结合 Decoupled-DMD

第 25 页

多步 深度 & 法线 9.0% 10.4% 服饰 配饰 边缘 合成数据 22.2% 复杂 4.5% 5.8% 生活 & 食品 风格化 9.0% 控制图 8.4% 4.6% 21.2%

外观 设计 & 文本 15.7% 7.2% 人物 颜色/材质 39.8% 6.3% 电子产品 添加 2.7% 图像生成 人体 添加文本 图像编辑 6.1% 物体 & 7.3% 2.4% 包装 产品 重排文本 物体 3.3% 13.4% 2.7% 文本 18.8% 移除 17.1% 5.7% 家居用品 面部肖像 移除文本 5.3% 5.3% 4.3% 替换 城市景观 场景 & 地点 场景 & 视角 3.8% 3.9% 25.4% 外观 替换文本 18.2% 5.0% 7.7%

室内 7.6% 自然风景 视角/相机 背景 13.9% 7.7% 10.5%

(a) 生成蒸馏集。 (b) 编辑蒸馏集。

图 14 蒸馏集的组成。内环显示主要类别,外环显示相应的子类别。(a) 生成蒸馏集涵盖了多样内容类别,如人物、场景、产品、设计、食品和合成数据。(b) 编辑蒸馏集涵盖了各种编辑类型类别,如物体编辑、场景和视角变化、文本编辑、外观修改、控制图编辑和复杂编辑。

以及对抗性感知目标,Mage-Flow-Turbo 在将采样减少为四步整流流轨迹的同时,保留了多步教师模型的视觉质量和提示遵循行为。

编辑蒸馏。对于 Mage-Flow-Edit-Turbo,我们使用相同的蒸馏框架,但进行了两项任务特定的调整。首先,特征判别器的真实分支使用来自编辑三元组的目标图像,而不是来自单独的真实图像语料库的图像,从而使对抗信号与编辑图像的分布对齐。其次,学生在编辑数据和生成数据 3:1 的混合数据上进行训练。编辑样本教导缩短后的模型遵循编辑指令,而保留的生成样本则保持开放式生成能力,并提高对需要大幅视觉变化的编辑的鲁棒性。总体而言,编辑学生是在大约 250K 个跨越六个类别的编辑样本上进行蒸馏的:物体、场景 & 视角、文本、外观、控制图和复杂。在与生成样本混合之前的类别分布如图 14(b) 所示。 为了进一步验证生成数据在编辑训练中的作用,我们在表 7 中比较了有和没有生成数据训练的模型。全步编辑器仅发生微小变化。对于 Turbo 变体,添加生成数据将 ImgEdit 从 4.20 提高到 4.38,而两个 GEdit 分割保持相当且没有一致地移动。这些结果表明,生成数据主要在四步压缩下帮助广泛的类别级编辑鲁棒性,而不是均匀地提高每个编辑指标。 总体而言,这种统一的配方使得 Mage-Flow-Turbo 和 Mage-Flow-Edit-Turbo 都能继承其多步教师模型的质量和对齐能力,同时将推理减少到仅 4 步。

发现 5:在编辑训练期间混合生成数据对四步模型的广泛编辑鲁棒性具有最明显的影响,这反映在 ImgEdit 上,而 GEdit 保持相当且没有均匀改善。

25

第 26 页

表 8 跨八个基准测试的文本到图像生成结果汇总。Steps 表示评估时的去噪步数。模型分为闭源和开源两类。每列中表现最佳的开源分数以粗体显示。次优结果以下划线标注。

| 类型 | 模型 | #Params | Steps | GenEval | DPG | TIIF-Short | TIIF-Long | CVTG-2K | OneIG-EN | OneIG-CN | LongText-EN | LongText-CN | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | Seedream 3.0 [90] | – | – | 0.84 | 88.27 | 86.02 | 84.31 | 0.592 | 0.530 | 0.528 | 0.896 | 0.878 | | | Seedream 4.0 [3] | – | – | 0.84 | 88.63 | – | – | 0.892 | 0.573 | 0.554 | 0.936 | 0.946 | | 闭源 | GPT-Image-1 [1] | – | – | 0.84 | 85.15 | 89.15 | 88.29 | 0.857 | 0.533 | 0.474 | 0.956 | 0.619 | | 来源 | Nano-Banana-Pro [2] | – | – | 0.83 | 87.16 | – | – | 0.779 | 0.580 | 0.570 | 0.981 | 0.949 | | | Kolors 2.0 [91] | – | – | – | – | – | – | – | 0.434 | 0.426 | 0.258 | 0.329 | | | BAGEL [44] | 14B | 50 | 0.82 | 85.07 | 71.50 | 71.70 | 0.356 | 0.361 | 0.370 | 0.373 | 0.310 | | | Janus-Pro-7B [42] | 7B | – | 0.80 | 84.19 | 66.50 | 65.02 | – | – | – | 0.019 | 0.006 | | | Emu3-Gen [92] | 8B | – | 0.54 | 80.60 | – | – | – | – | – | – | – | | 开源 | OmniGen2 [36] | 4B | 50 | 0.80 | 83.57 | – | – | – | 0.475 | – | 0.561 | 0.059 | | 统一 | InternVL-U [93] | 4B | 20 | 0.85 | 85.18 | 74.90 | 73.90 | 0.623 | 0.500 | 0.500 | 0.738 | 0.860 | | 模型 | UniWorld-V1 [37] | 19B | 30 | 0.80 | 81.38 | – | – | – | – | – | – | – | | | Ovis-U1 [94] | 3.6B | 50 | 0.89 | 83.72 | 66.70 | 68.20 | 0.093 | 0.340 | 0.340 | 0.030 | 0.051 | | | SD3.5-Large [20] | 8B | 28 | 0.71 | 84.96 | 76.10 | 68.71 | 0.655 | 0.462 | 0.248 | 0.473 | 0.009 | | | HiDream-I1-Full [95] | 17B | 50 | 0.83 | 85.89 | 79.33 | 71.88 | 0.740 | 0.477 | 0.337 | 0.543 | 0.024 | | | FLUX.1-dev [96] | 12B | 50 | 0.66 | 83.84 | 71.09 | 71.78 | 0.496 | 0.434 | 0.245 | 0.607 | 0.005 | | | FLUX.1-Krea-dev [97] | 12B | 50 | 0.72 | 86.59 | 80.36 | 81.67 | 0.444 | 0.443 | 0.271 | 0.693 | 0.002 | | | FLUX.2-dev [6] | 32B | 50 | 0.87 | 87.57 | 88.82 | 88.10 | 0.893 | 0.551 | 0.516 | 0.963 | 0.757 | | | FLUX.2-Klein-Base-4B [6] | 4B | 50 | 0.78 | 83.02 | 79.94 | 80.01 | 0.656 | 0.485 | 0.366 | 0.554 | 0.071 | | | FLUX.2-Klein-Base-9B [6] | 9B | 50 | 0.83 | 85.29 | 81.47 | 84.52 | 0.655 | 0.544 | 0.400 | 0.872 | 0.227 | | | FLUX.2-Klein-4B [6] | 4B | 4 | 0.83 | 85.53 | 78.91 | 79.04 | 0.628 | 0.500 | 0.364 | 0.649 | 0.068 | | | FLUX.2-Klein-9B [6] | 9B | 4 | 0.86 | 86.20 | 85.22 | 84.13 | 0.424 | 0.538 | 0.406 | 0.872 | 0.226 | | | Qwen-Image [5] | 20B | 50 | 0.87 | 88.32 | 86.14 | 86.83 | 0.829 | 0.539 | 0.548 | 0.943 | 0.946 | | 开源 | JoyAI-Image [98] | 16B | 50 | – | 88.05 | – | – | 0.874 | 0.542 | 0.521 | 0.963 | 0.963 | | 专业 | HunyuanImage-3.0 [7] | 80B | 50 | 0.72 | 86.10 | – | – | 0.765 | – | – | – | – | | 模型 | LongCat-Image [22] | 6B | 50 | 0.87 | 86.80 | 80.93 | 81.30 | 0.866 | 0.516 | 0.518 | 0.885 | 0.956 | | | Z-Image-Base [4] | 6B | 50 | 0.84 | 88.14 | 80.20 | 83.04 | 0.867 | 0.546 | 0.535 | 0.935 | 0.936 | | | Z-Image-Turbo [4] | 6B | 8 | 0.82 | 84.86 | 77.73 | 80.05 | 0.859 | 0.528 | 0.507 | 0.917 | 0.926 | | | Lens-Base [99] | 3.8B | 50 | 0.70 | 85.51 | 80.33 | 83.49 | 0.635 | 0.527 | 0.500 | 0.830 | 0.741 | | | Lens-RL [99] | 3.8B | 20 | 0.85 | 88.19 | 84.23 | 84.92 | 0.843 | 0.526 | 0.497 | 0.901 | 0.817 | | | Lens-Turbo [99] | 3.8B | 4 | 0.83 | 87.13 | 82.20 | 81.81 | 0.882 | 0.520 | 0.489 | 0.909 | 0.860 | | | Mage-Flow-Base | 4B | 30 | 0.79 | 86.26 | 82.50 | 83.19 | 0.851 | 0.542 | 0.509 | 0.904 | 0.792 | | | Mage-Flow | 4B | 20 | 0.90 | 86.49 | 82.19 | 84.70 | 0.887 | 0.536 | 0.505 | 0.944 | 0.823 | | | Mage-Flow-Turbo | 4B | 4 | 0.88 | 85.48 | 83.58 | 84.16 | 0.873 | 0.523 | 0.491 | 0.911 | 0.801 |

6 实验

6.1 实验设置

文本到图像生成。我们在八个广泛使用的文本到图像基准测试上评估 Mage-Flow,涵盖提示遵循、细粒度生成和文本渲染。GenEval [84]、DPG-Bench [85] 和 TIIF-Bench [86] 衡量提示遵循和组合理解能力。OneIG [87] 评估英文和中文细分领域的细粒度生成。CVTG-2K [88] 专注于多区域文本渲染,LongText [89] 评估长篇幅英文和中文文本渲染。所有结果均使用官方评估协议在原生 1024² 分辨率下计算。除非另有说明,Mage-Flow-Base 使用 30 步去噪,Mage-Flow 使用 20 步,Mage-Flow-Turbo 使用 4 步。

基于指令的图像编辑。我们在三个基于指令的图像编辑基准测试上评估 Mage-Flow-Edit。ImgEdit-Bench [103] 涵盖九种代表性的编辑技能,包括添加(Add)、调整(Adjust)、提取(Extract)、替换(Replace)、移除(Remove)、背景(Background)、风格(Style)、混合(Hybrid)和行动(Action),并在 0–5 的量表上报告类别级别的性能。GEdit-Bench [34] 从语义一致性(Semantic Consistency)、感知质量(Perceptual Quality)和总体得分(Overall Score)三个角度评估编辑质量,涵盖英文和中文子集,每个指标均在 0–10 的量表上测量。TextEdit-Bench [104] 专注于以文本为中心的编辑,评估五个维度:指令遵循(Instruction Following)、文本准确性(Text Accuracy)、视觉一致性(Visual Consistency)、布局保留(Layout Preservation)和语义期望(Semantic Expectation)。每个维度按 0–5 的量表评分,总分通过求和五个指标的平均值得出(满分 25 分)。除非另有说明,Mage-Flow-Edit-Base 和 Mage-Flow-Edit 使用 30 步去噪进行评估,而 Mage-Flow-Edit-Turbo 仅使用 4 步去噪。

6.2 定量结果

26

第 27 页

表 9 GenEval [84] 和 DPG-Bench [85] 上的定量结果。

| 类型 | 模型 | 参数量 | \multicolumn{6}{c}{GenEval} | \multicolumn{6}{c}{DPG-Bench} | | :— | :— | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | | Single | Two | Counting | Colors | Position | Attr.Bind | Overall | Global | Entity | Attribute | Relation | Other | Overall | | Closed-Source | Seedream 3.0 [90] | – | 0.99 | 0.96 | 0.91 | 0.93 | 0.47 | 0.80 | 0.84 | 94.31 | 92.65 | 91.36 | 92.78 | 88.24 | 88.27 | | | Seedream 4.0 [3] | – | 0.99 | 0.92 | 0.72 | 0.91 | 0.76 | 0.74 | 0.84 | 87.17 | 92.41 | 92.29 | 93.33 | 95.48 | 88.63 | | | GPT-Image-1 [1] | – | 0.99 | 0.92 | 0.85 | 0.92 | 0.75 | 0.61 | 0.84 | 88.89 | 88.94 | 89.84 | 92.63 | 90.96 | 85.15 | | | Nano-Banana-Pro [2] | – | 1.00 | 0.96 | 0.71 | 0.84 | 0.86 | 0.65 | 0.83 | 91.00 | 92.85 | 91.56 | 92.39 | 89.93 | 87.16 | | Open-Source Unified | BAGEL [44] | 14B | 0.99 | 0.94 | 0.81 | 0.88 | 0.64 | 0.63 | 0.82 | 88.94 | 90.37 | 91.29 | 90.82 | 88.67 | 85.07 | | | Janus-Pro-7B [42] | 7B | 0.99 | 0.89 | 0.59 | 0.90 | 0.79 | 0.66 | 0.80 | 86.90 | 88.90 | 89.40 | 89.32 | 89.48 | 84.19 | | | Emu3-Gen [92] | 8B | 0.98 | 0.71 | 0.34 | 0.81 | 0.17 | 0.21 | 0.54 | 85.21 | 86.68 | 86.84 | 90.22 | 83.15 | 80.60 | | | Show-o2 [100] | 7B | 1.00 | 0.87 | 0.58 | 0.92 | 0.52 | 0.62 | 0.76 | – | – | – | – | – | – | | | OmniGen2 [36] | 4B | 1.00 | 0.95 | 0.64 | 0.88 | 0.55 | 0.76 | 0.80 | 88.81 | 88.83 | 90.18 | 89.37 | 90.27 | 83.57 | | | InternVL-U [93] | 4B | 0.99 | 0.94 | 0.74 | 0.91 | 0.77 | 0.74 | 0.85 | 90.39 | 90.78 | 90.68 | 90.29 | 88.77 | 85.18 | | | UniWorld-V1 [37] | 19B | 0.99 | 0.93 | 0.79 | 0.89 | 0.49 | 0.70 | 0.80 | 83.64 | 88.39 | 88.44 | 89.27 | 87.22 | 81.38 | | | Ovis-U1 [94] | 3.6B | 0.98 | 0.98 | 0.90 | 0.92 | 0.79 | 0.75 | 0.89 | 82.37 | 90.08 | 88.68 | 93.35 | 85.20 | 83.72 | | Open-Source Specialist | SD3.5-Large [20] | 8B | 0.98 | 0.89 | 0.73 | 0.83 | 0.34 | 0.47 | 0.71 | 84.75 | 89.93 | 88.19 | 93.23 | 89.70 | 84.96 | | | HiDream-I1-Full [95] | 17B | 1.00 | 0.98 | 0.79 | 0.91 | 0.60 | 0.72 | 0.83 | 76.44 | 90.22 | 89.48 | 93.74 | 91.83 | 85.89 | | | FLUX.1-dev [96] | 12B | 0.98 | 0.81 | 0.74 | 0.79 | 0.22 | 0.45 | 0.66 | 74.35 | 90.00 | 88.96 | 90.87 | 88.33 | 83.84 | | | FLUX.1-Krea-dev [97] | 12B | 0.99 | 0.93 | 0.69 | 0.82 | 0.30 | 0.59 | 0.72 | 87.54 | 92.08 | 89.54 | 94.85 | 87.20 | 86.59 | | | FLUX.2-dev [6] | 32B | 1.00 | 0.99 | 0.79 | 0.93 | 0.73 | 0.78 | 0.87 | 92.20 | 91.36 | 93.28 | 93.52 | 89.72 | 87.57 | | | FLUX.2-Klein-Base-4B [6] | 4B | 0.99 | 0.87 | 0.81 | 0.90 | 0.53 | 0.59 | 0.78 | 91.61 | 88.72 | 90.30 | 91.23 | 88.48 | 83.02 | | | FLUX.2-Klein-Base-9B [6] | 9B | 1.00 | 0.90 | 0.87 | 0.93 | 0.65 | 0.63 | 0.83 | 89.76 | 90.34 | 90.66 | 93.31 | 86.58 | 85.29 | | | FLUX.2-Klein-4B [6] | 4B | 1.00 | 0.92 | 0.88 | 0.86 | 0.67 | 0.64 | 0.83 | 86.54 | 90.18 | 91.80 | 90.85 | 91.51 | 85.53 | | | FLUX.2-Klein-9B [6] | 9B | 0.99 | 0.96 | 0.89 | 0.91 | 0.70 | 0.69 | 0.86 | 88.94 | 91.95 | 89.53 | 92.74 | 92.18 | 86.20 | | | Qwen-Image [5] | 20B | 0.99 | 0.92 | 0.89 | 0.88 | 0.76 | 0.77 | 0.87 | 91.32 | 91.56 | 92.02 | 94.31 | 92.73 | 88.32 | | | JoyAI-Image [98] | 16B | – | – | – | – | – | – | – | – | – | – | – | – | 88.05 | | | HunyuanImage-3.0 [7] | 80B | 1.00 | 0.92 | 0.48 | 0.82 | 0.42 | 0.63 | 0.72 | 92.12 | 92.53 | 89.13 | 92.13 | 91.92 | 86.10 | | | LongCat-Image [22] | 6B | 0.99 | 0.98 | 0.86 | 0.86 | 0.75 | 0.73 | 0.87 | 89.10 | 92.54 | 92.00 | 93.28 | 87.50 | 86.80 | | | Z-Image-Base [4] | 6B | 1.00 | 0.94 | 0.78 | 0.93 | 0.62 | 0.77 | 0.84 | 93.39 | 91.22 | 93.16 | 92.22 | 91.52 | 88.14 | | | Z-Image-Turbo [4] | 6B | 1.00 | 0.95 | 0.77 | 0.89 | 0.65 | 0.68 | 0.82 | 91.29 | 89.59 | 90.14 | 92.16 | 88.68 | 84.86 | | | Lens-Base [99] | 3.8B | 0.99 | 0.79 | 0.58 | 0.83 | 0.52 | 0.46 | 0.70 | 88.68 | 91.24 | 91.93 | 91.89 | 89.65 | 85.51 | | | Lens-RL [99] | 3.8B | 1.00 | 0.95 | 0.83 | 0.89 | 0.73 | 0.72 | 0.85 | 91.07 | 92.94 | 91.93 | 93.39 | 92.78 | 88.19 | | | Lens-Turbo [99] | 3.8B | 0.99 | 0.94 | 0.84 | 0.86 | 0.66 | 0.68 | 0.83 | 92.19 | 93.44 | 90.34 | 95.11 | 90.89 | 87.13 | | | Mage-Flow-Base | 4B | 0.99 | 0.88 | 0.68 | 0.90 | 0.63 | 0.65 | 0.79 | 92.66 | 92.38 | 89.34 | 88.33 | 91.87 | 86.26 | | | Mage-Flow | 4B | 1.00 | 0.97 | 0.89 | 0.89 | 0.93 | 0.73 | 0.90 | 91.57 | 92.41 | 90.04 | 91.17 | 91.70 | 86.49 | | | Mage-Flow-Turbo | 4B | 1.00 | 0.97 | 0.80 | 0.88 | 0.90 | 0.73 | 0.88 | 80.88 | 89.42 | 91.87 | 91.34 | 91.19 | 85.48 |

表 10 TIIF-Bench testmini [86] 上的定量结果。

| 类型 | 模型 | \multicolumn{2}{c}{Overall} | \multicolumn{8}{c}{Basic Following} | \multicolumn{8}{c}{Advanced Following} | \multicolumn{6}{c}{Designer} | | :— | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | Avg | | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | | | | | | Attribute | Relation | Reasoning | | | | | | +Relation | Attribute | +Reasoning | Attribute | +Reasoning | Relation | | Style | | Text | | World | Real | | Closed-Source | Seedream 3.0 [90] | 86.02 | 84.31 | 87.07 | 84.93 | 90.50 | 90.00 | 89.85 | 85.94 | 80.86 | 78.86 | 79.16 | 80.60 | 79.76 | 81.82 | 77.23 | 78.85 | 75.64 | 78.64 | 100.00 | 93.33 | 97.17 | 87.78 | 83.21 | 83.58 | | | GPT-Image-1 [1] | 89.15 | 88.29 | 90.75 | 89.66 | 91.33 | 87.08 | 84.57 | 84.57 | 96.32 | 97.32 | 88.55 | 88.35 | 87.07 | 89.44 | 87.22 | 83.96 | 85.59 | 83.21 | 90.00 | 93.33 | 89.83 | 86.83 | 89.73 | 93.46 | | | DALL-E 3 [101] | 74.96 | 70.81 | 78.72 | 78.50 | 79.50 | 79.83 | 80.82 | 78.82 | 75.82 | 76.82 | 73.39 | 67.27 | 73.45 | 67.20 | 72.01 | 71.34 | 63.59 | 60.72 | 89.66 | 86.67 | 66.83 | 54.83 | 72.93 | 60.99 | | | MidJourney v7 [102] | 68.74 | 65.69 | 77.41 | 76.00 | 77.58 | 81.83 | 82.07 | 76.82 | 72.57 | 69.32 | 64.66 | 60.53 | 67.20 | 62.70 | 81.22 | 71.59 | 60.72 | 64.59 | 83.33 | 80.00 | 24.83 | 20.83 | 68.83 | 63.61 | | Open-Source Unified | BAGEL [44] | 71.50 | 71.70 | 81.80 | 80.10 | 82.50 | 83.50 | 83.00 | 79.90 | 79.90 | 76.80 | 70.20 | 72.20 | 74.40 | 75.00 | 67.40 | 70.10 | 72.00 | 74.90 | 86.70 | 83.30 | 29.40 | 33.90 | 68.30 | 67.90 | | | Janus-Pro-7B [42] | 66.50 | 65.02 | 79.33 | 78.25 | 79.33 | 82.33 | 78.32 | 73.32 | 80.32 | 79.07 | 59.71 | 58.82 | 66.07 | 56.20 | 70.46 | 70.84 | 67.22 | 59.97 | 60.00 | 70.00 | 28.83 | 33.83 | 65.84 | 60.25 | | | InternVL-U [93] | 74.90 | 73.90 | 82.30 | 81.50 | 86.00 | 81.50 | 84.10 | 82.20 | 76.70 | 80.90 | 73.50 | 72.70 | 75.30 | 76.20 | 70.40 | 67.60 | 75.50 | 75.80 | 93.30 | 83.30 | 47.50 | 50.70 | 65.30 | 66.80 | | | Ovis-U1 [94] | 66.70 | 68.20 | 77.80 | 79.40 | 83.50 | 81.50 | 80.10 | 81.40 | 69.90 | 75.20 | 67.40 | 67.80 | 71.80 | 68.30 | 66.80 | 73.80 | 69.00 | 65.90 | 83.30 | 86.70 | 8.10 | 12.70 | 67.20 | 68.70 | | Open-Source Specialist | FLUX.1-dev [96] | 71.09 | 71.78 | 83.12 | 78.65 | 87.05 | 83.17 | 87.25 | 80.39 | 75.01 | 72.39 | 65.79 | 68.54 | 67.07 | 73.69 | 73.84 | 73.34 | 69.09 | 71.59 | 66.67 | 66.67 | 43.83 | 52.83 | 70.72 | 71.47 | | | FLUX.1-Krea-dev [97] | 80.36 | 81.67 | 84.26 | 83.76 | 86.00 | 84.00 | 82.93 | 86.18 | 83.47 | 80.99 | 73.85 | 76.15 | 79.89 | 77.01 | 74.75 | 79.21 | 76.43 | 78.98 | 73.33 | 80.00 | 66.52 | 70.14 | 93.66 | 94.78 | | | FLUX.2-Klein-Base-4B [6] | 79.94 | 80.01 | 82.99 | 80.21 | 89.33 | 84.83 | 83.74 | 85.37 | 74.38 | 69.42 | 73.60 | 76.28 | 77.01 | 78.16 | 68.32 | 77.23 | 67.52 | 71.97 | 93.33 | 80.00 | 77.38 | 76.47 | 94.03 | 90.67 | | | FLUX.2-Klein-Base-9B [6] | 81.47 | 84.52 | 82.49 | 85.28 | 84.00 | 85.33 | 83.74 | 87.80 | 79.34 | 82.64 | 78.32 | 82.02 | 78.16 | 77.59 | 75.74 | 78.53 | 73.89 | 83.44 | 76.67 | 80.00 | 84.16 | 87.78 | 89.18 | 90.67 | | | FLUX.2-Klein-4B [6] | 78.91 | 79.04 | 81.22 | 80.96 | 79.33 | 80.00 | 83.74 | 83.74 | 80.99 | 79.34 | 73.34 | 73.56 | 77.01 | 79.31 | 72.28 | 74.11 | 67.52 | 75.16 | 76.67 | 73.33 | 75.11 | 67.42 | 91.79 | 92.16 | | | FLUX.2-Klein-9B [6] | 85.22 | 84.13 | 88.32 | 85.17 | 90.67 | 84.00 | 86.99 | 90.24 | 86.78 | 81.36 | 80.87 | 81.12 | 78.24 | 77.01 | 74.75 | 78.71 | 76.43 | 81.53 | 93.10 | 90.00 | 90.05 | 85.07 | 93.28 | 91.42 | | | Qwen-Image [5] | 86.14 | 86.83 | 86.18 | 87.22 | 90.50 | 91.50 | 88.22 | 90.78 | 79.81 | 79.38 | 79.30 | 80.88 | 79.21 | 78.94 | 78.85 | 81.69 | 75.57 | 78.59 | 100.00 | 100.00 | 92.76 | 89.14 | 90.30 | 91.42 | | | Z-Image-Base [4] | 80.20 | 83.04 | 78.36 | 82.79 | 79.50 | 86.50 | 80.45 | 79.94 | 75.13 | 81.94 | 72.89 | 77.02 | 72.91 | 77.56 | 66.99 | 73.82 | 73.89 | 75.62 | 90.00 | 93.33 | 94.84 | 93.21 | 88.06 | 85.45 | | | Z-Image-Turbo [4] | 77.73 | 80.05 | 81.85 | 81.59 | 86.50 | 87.00 | 82.88 | 79.99 | 76.17 | 77.77 | 68.32 | 74.69 | 72.04 | 75.24 | 60.22 | 73.33 | 68.90 | 71.92 | 83.33 | 93.33 | 83.71 | 84.62 | 85.82 | 77.24 | | | Lens-Base [99] | 80.33 | 83.49 | 82.90 | 83.70 | 86.50 | 83.00 | 82.37 | 85.20 | 79.81 | 8.98 | 74.35 | 80.22 | 71.24 | 80.18 | 75.87 | 82.70 | 74.40 | 76.96 | 90.00 | 93.33 | 71.04 | 73.76 | 91.79 | 93.28 | | | Lens-RL [99] | 84.23 | 84.92 | 88.03 | 89.21 | 91.00 | 89.50 | 91.18 | 90.54 | 81.90 | 87.58 | 80.75 | 83.27 | 84.53 | 82.82 | 79.30 | 85.01 | 78.97 | 83.90 | 66.67 | 66.67 | 90.50 | 84.62 | 94.03 | 93.66 | | | Lens-Turbo [99] | 82.20 | 81.81 | 88.48 | 88.41 | 92.00 | 91.00 | 90.49 | 88.17 | 82.94 | 86.06 | 78.49 | 79.62 | 81.35 | 83.34 | 74.45 | 76.72 | 81.24 | 81.49 | 56.67 | 56.67 | 87.78 | 81.00 | 92.91 | 91.79 | | | Mage-Flow-Base | 82.50 | 83.19 | 83.36 | 85.34 | 87.00 | 90.50 | 88.86 | 85.63 | 74.21 | 79.90 | 77.04 | 80.81 | 78.62 | 80.10 | 77.48 | 82.98 | 72.86 | 79.74 | 86.67 | 83.33 | 84.62 | 75.11 | 92.16 | 91.42 | | | Mage-Flow | 82.19 | 84.70 | 83.44 | 85.72 | 88.00 | 86.00 | 86.19 | 86.67 | 76.12 | 84.50 | 77.35 | 80.86 | 79.61 | 79.51 | 76.72 | 81.97 | 74.66 | 80.28 | 80.00 | 80.00 | 83.26 | 88.24 | 95.15 | 95.15 | | | Mage-Flow-Turbo | 83.58 | 84.16 | 85.11 | 88.45 | 88.00 | 92.00 | 87.52 | 88.86 | 79.81 | 84.50 | 77.07 | 78.70 | 82.32 | 80.90 | 74.28 | 77.39 | 71.86 | 76.61 | 86.67 | 80.00 | 89.59 | 86.88 | 92.16 | 90.30 |

6.2.1 文生图生成

整体比较。表 8 总结了提示词遵循、细粒度生成和文本渲染基准测试上的主要文生图结果。Mage-Flow 仅拥有 4B 参数,在 GenEval 上取得了所有对比系统中最好的分数,并在 DPG-Bench、TIIF-Bench、OneIG 和 LongText 上展现出与参数量大得多的开源专业模型相媲美的性能。它在 CVTG-2K 上也取得了最强的开源结果之一,接近

在仅使用更小规模主干网络的情况下,优于最佳的 32B 开源专用模型 FLUX.2-dev [6]。 与统一的理解-生成模型相比,Mage-Flow 在几乎所有基准测试中均表现出更优的性能,这表明紧凑的原生分辨率 MMDiT 能够在无需扩展至数百亿参数的情况下提供强大的生成质量。蒸馏后的 Mage-Flow-Turbo 变体仅用四个去噪步骤便保留了大部分性能。

27

第 28 页

表 11 CVTG-2K [88] 上多区域英文文本渲染的定量结果。

| 类型 | 模型 | 参数量 | 2-reg. | 3-reg. | 4-reg. | 5-reg. | 平均 | NED | CLIP | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 闭源 | Seedream 3.0 [90] | – | 0.628 | 0.596 | 0.604 | 0.561 | 0.592 | 0.854 | 0.782 | | | Seedream 4.0 [3] | – | 0.890 | 0.915 | 0.899 | 0.887 | 0.892 | 0.951 | 0.785 | | | GPT-Image-1 [1] | – | 0.878 | 0.866 | 0.873 | 0.822 | 0.857 | 0.948 | 0.798 | | | Nano-Banana-Pro [2] | – | 0.737 | 0.775 | 0.786 | 0.793 | 0.779 | 0.875 | 0.737 | | 开源统一模型 | BAGEL [44] | 14B | 0.498 | 0.391 | 0.332 | 0.291 | 0.356 | 0.657 | 0.779 | | | InternVL-U [93] | 4B | 0.729 | 0.660 | 0.618 | 0.549 | 0.623 | 0.804 | 0.816 | | | Ovis-U1 [94] | 3.6B | 0.133 | 0.109 | 0.091 | 0.065 | 0.093 | 0.477 | 0.725 | | 开源专家模型 | SD3.5-Large [20] | 8B | 0.729 | 0.682 | 0.657 | 0.594 | 0.655 | 0.847 | 0.780 | | | FLUX.1-dev [96] | 12B | 0.609 | 0.553 | 0.466 | 0.432 | 0.496 | 0.688 | 0.740 | | | FLUX.1-Krea-dev [97] | 12B | 0.527 | 0.454 | 0.440 | 0.407 | 0.444 | 0.737 | 0.773 | | | FLUX.2-dev [6] | 32B | 0.926 | 0.890 | 0.899 | 0.873 | 0.893 | 0.948 | 0.810 | | | FLUX.2-Klein-Base-4B [6] | 4B | 0.679 | 0.653 | 0.667 | 0.636 | 0.656 | 0.825 | 0.757 | | | FLUX.2-Klein-Base-9B [6] | 9B | 0.676 | 0.653 | 0.667 | 0.636 | 0.655 | 0.825 | 0.757 | | | FLUX.2-Klein-4B [6] | 4B | 0.637 | 0.641 | 0.639 | 0.601 | 0.628 | 0.829 | 0.773 | | | FLUX.2-Klein-9B [6] | 9B | 0.464 | 0.443 | 0.416 | 0.399 | 0.424 | 0.733 | 0.759 | | | Qwen-Image [5] | 20B | 0.837 | 0.836 | 0.831 | 0.816 | 0.829 | 0.912 | 0.802 | | | JoyAI-Image [98] | 16B | – | – | – | – | 0.874 | 0.937 | 0.799 | | | HunyuanImage-3.0 [7] | 80B | 0.830 | 0.763 | 0.738 | 0.728 | 0.765 | 0.876 | 0.812 | | | LongCat-Image [22] | 6B | 0.913 | 0.874 | 0.856 | 0.831 | 0.866 | 0.936 | 0.786 | | | Z-Image-Base [4] | 6B | 0.901 | 0.872 | 0.865 | 0.851 | 0.867 | 0.937 | 0.797 | | | Z-Image-Turbo [4] | 6B | 0.887 | 0.866 | 0.863 | 0.835 | 0.859 | 0.928 | 0.805 | | | Lens-Base [99] | 3.8B | 0.708 | 0.656 | 0.645 | 0.577 | 0.635 | 0.814 | 0.777 | | | Lens-RL [99] | 3.8B | 0.871 | 0.867 | 0.847 | 0.806 | 0.843 | 0.935 | 0.797 | | | Lens-Turbo [99] | 3.8B | 0.911 | 0.899 | 0.883 | 0.853 | 0.882 | 0.955 | 0.801 | | | Mage-Flow-Base | 4B | 0.908 | 0.878 | 0.866 | 0.789 | 0.851 | 0.933 | 0.815 | | | Mage-Flow | 4B | 0.902 | 0.902 | 0.902 | 0.850 | 0.887 | 0.950 | 0.826 | | | Mage-Flow-Turbo | 4B | 0.892 | 0.883 | 0.878 | 0.851 | 0.873 | 0.945 | 0.831 |

表 12 OneIG-EN 和 OneIG-CN [87] 上的定量结果。

| 类型 | 模型 | 参数量 | \multicolumn{6}{c}{OneIG-EN} | \multicolumn{6}{c}{OneIG-CN} | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | | 对齐 | 文本 | 推理 | 风格 | 多样性 | 总体 | 对齐 | 文本 | 推理 | 风格 | 多样性 | 总体 | | 闭源 | Seedream 3.0 [90] | – | 0.818 | 0.865 | 0.275 | 0.413 | 0.277 | 0.530 | 0.793 | 0.928 | 0.281 | 0.397 | 0.243 | 0.528 | | | Seedream 4.0 [3] | – | 0.892 | 0.983 | 0.347 | 0.453 | 0.191 | 0.573 | 0.836 | 0.986 | 0.304 | 0.443 | 0.200 | 0.554 | | | GPT-Image-1 [1] | – | 0.851 | 0.857 | 0.345 | 0.462 | 0.151 | 0.533 | 0.812 | 0.650 | 0.300 | 0.449 | 0.159 | 0.474 | | | Nano-Banana-Pro [2] | – | 0.890 | 0.940 | 0.330 | 0.480 | 0.250 | 0.580 | 0.840 | 0.980 | 0.310 | 0.460 | 0.240 | 0.570 | | | Kolors 2.0 [91] | – | 0.820 | 0.427 | 0.262 | 0.360 | 0.300 | 0.434 | 0.738 | 0.502 | 0.226 | 0.331 | 0.333 | 0.426 | | 开源统一模型 | BAGEL [44] | 14B | 0.769 | 0.244 | 0.173 | 0.367 | 0.251 | 0.361 | 0.672 | 0.365 | 0.186 | 0.357 | 0.268 | 0.370 | | | Show-o2 [100] | 7B | 0.798 | 0.002 | 0.219 | 0.317 | 0.186 | 0.304 | – | – | – | – | – | – | | | OmniGen2 [36] | 4B | 0.804 | 0.680 | 0.271 | 0.377 | 0.242 | 0.475 | – | – | – | – | – | – | | | InternVL-U [93] | 4B | 0.820 | 0.740 | 0.270 | 0.400 | 0.250 | 0.500 | 0.750 | 0.900 | 0.230 | 0.370 | 0.260 | 0.500 | | | Ovis-U1 [94] | 3.6B | 0.810 | 0.030 | 0.220 | 0.450 | 0.180 | 0.340 | 0.720 | 0.150 | 0.210 | 0.430 | 0.200 | 0.340 | | 开源专家模型 | SD3.5-Large [20] | 8B | 0.809 | 0.629 | 0.294 | 0.353 | 0.225 | 0.462 | 0.137 | 0.200 | 0.141 | 0.243 | 0.519 | 0.248 | | | HiDream-I1-Full [95] | 17B | 0.829 | 0.707 | 0.317 | 0.347 | 0.186 | 0.477 | 0.620 | 0.205 | 0.256 | 0.304 | 0.300 | 0.337 | | | FLUX.1-dev [96] | 12B | 0.786 | 0.523 | 0.253 | 0.368 | 0.238 | 0.434 | 0.152 | 0.218 | 0.116 | 0.282 | 0.456 | 0.245 | | | FLUX.1-Krea-dev [97] | 12B | 0.842 | 0.483 | 0.282 | 0.377 | 0.232 | 0.443 | 0.105 | 0.234 | 0.114 | 0.263 | 0.640 | 0.271 | | | FLUX.2-Klein-Base-4B [6] | 4B | 0.830 | 0.688 | 0.262 | 0.414 | 0.230 | 0.485 | 0.744 | 0.211 | 0.240 | 0.384 | 0.250 | 0.366 | | | FLUX.2-Klein-Base-9B [6] | 9B | 0.867 | 0.897 | 0.299 | 0.442 | 0.217 | 0.544 | 0.795 | 0.310 | 0.250 | 0.417 | 0.229 | 0.400 | | | FLUX.2-Klein-4B [6] | 4B | 0.862 | 0.779 | 0.272 | 0.420 | 0.169 | 0.500 | 0.794 | 0.208 | 0.247 | 0.386 | 0.183 | 0.364 | | | FLUX.2-Klein-9B [6] | 9B | 0.884 | 0.898 | 0.306 | 0.445 | 0.158 | 0.538 | 0.818 | 0.354 | 0.280 | 0.418 | 0.162 | 0.406 | | | Qwen-Image [5] | 20B | 0.882 | 0.891 | 0.306 | 0.418 | 0.197 | 0.539 | 0.825 | 0.963 | 0.267 | 0.405 | 0.279 | 0.548 | | | JoyAI-Image [98] | 16B | – | – | – | – | – | 0.542 | – | – | – | – | – | 0.521 | | | LongCat-Image [22] | 6B | 0.854 | 0.923 | 0.216 | 0.365 | 0.222 | 0.516 | 0.812 | 0.948 | 0.253 | 0.355 | 0.224 | 0.518 | | | Z-Image-Base [4] | 6B | 0.881 | 0.987 | 0.280 | 0.387 | 0.194 | 0.546 | 0.793 | 0.988 | 0.266 | 0.386 | 0.243 | 0.535 | | | Z-Image-Turbo [4] | 6B | 0.840 | 0.994 | 0.298 | 0.368 | 0.139 | 0.528 | 0.782 | 0.982 | 0.276 | 0.361 | 0.134 | 0.507 | | | Lens-Base [99] | 3.8B | 0.842 | 0.908 | 0.241 | 0.384 | 0.262 | 0.527 | 0.781 | 0.904 | 0.256 | 0.358 | 0.200 | 0.500 | | | Lens-RL [99] | 3.8B | 0.877 | 0.965 | 0.279 | 0.348 | 0.162 | 0.526 | 0.824 | 0.944 | 0.259 | 0.316 | 0.141 | 0.497 | | | Lens-Turbo [99] | 3.8B | 0.868 | 0.968 | 0.291 | 0.314 | 0.160 | 0.520 | 0.802 | 0.952 | 0.260 | 0.284 | 0.148 | 0.489 | | | Mage-Flow-Base | 4B | 0.863 | 0.950 | 0.305 | 0.431 | 0.159 | 0.542 | 0.800 | 0.904 | 0.279 | 0.396 | 0.163 | 0.509 | | | Mage-Flow | 4B | 0.869 | 0.969 | 0.309 | 0.411 | 0.124 | 0.536 | 0.812 | 0.926 | 0.282 | 0.385 | 0.119 | 0.505 | | | Mage-Flow-Turbo | 4B | 0.861 | 0.949 | 0.307 | 0.391 | 0.105 | 0.523 | 0.803 | 0.909 | 0.281 | 0.363 | 0.099 | 0.491 |

提示遵循与组合理解。表 9 显示,Mage-Flow 在 GenEval 总分上表现最强,在单对象生成、双对象生成、计数和位置关系方面结果尤为突出。表 9 报告的 DPG-Bench 结果显示,Mage-Flow 与强大的开源专家模型保持竞争力,并明显优于大多数规模相当或更大的统一基线模型。表 10 进一步显示,在短提示和长提示设置下均呈现相同趋势:Mage-Flow 保持了强大的指令遵循能力,而 Mage-Flow-Turbo 尽管仅使用四个采样步数,仍保持了具有竞争力的性能。

28

第 29 页

表 13 三个基准测试上的图像编辑结果汇总。Steps 表示推理过程中使用的去噪步数。模型分为闭源和开源两类。每列中最佳的开源分数以粗体显示。次优结果以下划线标记。

| 类型 | 模型 | #Params | Steps | ImgEdit | GEdit-EN | GEdit-CN | TextEdit-Syn | TextEdit-Real | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | Nano-Banana [2] | – | – | 4.29 | 7.291 | 7.399 | 16.54 | 18.22 | | 闭源 | Seedream4.0 [3] | – | – | 4.30 | 7.701 | 7.692 | 14.90 | 18.54 | | 源 | Seedream4.5 [3] | – | – | 4.32 | 7.820 | 7.800 | – | – | | | Nano-Banana-Pro [2] | – | – | 4.37 | 7.738 | 7.799 | – | – | | | BAGEL [44] | 14B | 50 | 3.20 | – | – | 10.41 | 12.83 | | 开源 | OmniGen2 [36] | 4B | 50 | 3.44 | – | – | 8.52 | 10.99 | | 统一 | UniWorld-V1 [37] | 19B | 30 | 3.26 | – | – | – | – | | | Emu3.5 [45] | 34B | – | 4.41 | – | – | 9.34 | 14.05 | | | Instruct-Pix2Pix [28] | 1B | 10 | 1.88 | – | – | 5.51 | 5.35 | | | MagicBrush [29] | 1B | 100 | 1.90 | – | – | 3.86 | 4.12 | | | AnyEdit [30] | 1B | 50 | 2.45 | – | – | – | – | | | UltraEdit [31] | 2B | 50 | 2.70 | – | – | – | – | | | OmniGen [32] | 3.8B | 50 | 2.96 | – | – | – | – | | | ICEdit [35] | 12B | 28 | 3.05 | – | – | – | – | | | Step1X-Edit-v1.2 [34] | 19B | 50 | 3.95 | 7.480 | 7.467 | 9.26 | 12.02 | | | ChronoEdit [39] | 14B | 50 | 4.42 | – | – | – | – | | | FLUX.1-Kontext-dev [33] | 12B | 28 | 3.71 | 6.462 | 1.857 | 12.14 | 14.31 | | | FLUX.2-dev [6] | 32B | 50 | 4.35 | 7.413 | 7.278 | 11.86 | 14.71 | | | FLUX.2-Klein-Base-4B [6] | 4B | 50 | 3.80 | 7.081 | 7.102 | 11.01 | 13.79 | | 开源 | FLUX.2-Klein-4B [6] | 4B | 4 | 4.01 | 7.717 | 7.750 | 11.84 | 14.46 | | 专家 | FLUX.2-Klein-Base-9B [6] | 9B | 50 | 4.05 | 7.740 | 7.745 | 12.76 | 15.65 | | 模型 | FLUX.2-Klein-9B [6] | 9B | 4 | 4.18 | 8.040 | 8.055 | 12.73 | 15.75 | | | Z-Image-Edit [4] | 6B | 50 | 4.30 | 7.570 | 7.540 | – | – | | | Qwen-Image-Edit-2509 [5] | 20B | 50 | 4.31 | 7.480 | 7.467 | 13.40 | 15.81 | | | Qwen-Image-Edit-2511 [5] | 20B | 50 | 4.51 | 7.877 | 7.819 | 13.53 | 16.81 | | | LongCat-Image-Edit [22] | 6B | 50 | 4.45 | 7.748 | 7.731 | 12.46 | 14.89 | | | FireRed-Image-Edit-1.0 [8] | 20B | 50 | 4.56 | 7.943 | 7.887 | 15.19 | 17.23 | | | JoyAI-Image-Edit [98] | 16B | 50 | 4.46 | 8.276 | 8.125 | 14.80 | 17.23 | | | Mage-Flow-Edit-Base | 4B | 30 | 4.28 | 7.860 | 7.970 | 13.63 | 15.57 | | | Mage-Flow-Edit | 4B | 30 | 4.34 | 8.127 | 8.123 | 14.14 | 16.26 | | | Mage-Flow-Edit-Turbo | 4B | 4 | 4.38 | 8.271 | 8.264 | 12.77 | 15.41 |

文本渲染与双语生成。表 11 报告了 CVTG-2K 的结果,其中 Mage-Flow 实现了接近最佳的开源多区域文本渲染准确率,并显著优于大多数统一生成模型。在 LongText 上,Mage-Flow 在英文长文本渲染方面表现强劲,在中文方面仍具竞争力,尽管中文子集仍有进一步补充数据的空间。表 12 显示,Mage-Flow-Base、Mage-Flow 和 Mage-Flow-Turbo 在英文和中文 OneIG 子集上均保持了强大的对齐和文本渲染能力,表明多粒度标注和双语数据管道能够很好地迁移到细粒度生成设置中。

6.2.2 基于指令的图像编辑

整体比较。表 13 总结了 ImgEdit-Bench、GEdit-Bench 和 TextEdit-Bench 上的主要基于指令的编辑结果。仅使用 4B 参数,Mage-Flow-Edit 在编辑质量上具有竞争力,能够与参数量大得多的开源专家模型相媲美,同时使用了更小的骨干网络。我们的编辑模型在 GEdit-Bench 中文得分上取得了最佳的开源成绩,在英文得分上接近最佳,并且在 ImgEdit-Bench 和 TextEdit-Bench 上相对于参数量多几倍的模型仍保持竞争力。蒸馏后的 Mage-Flow-Edit-Turbo 变体仅用四个去噪步数便保留了大部分性能。

ImgEdit-Bench。表 14 报告了按类别划分的编辑结果。Base、RL 对齐和 Turbo 变体的总体得分分别为 4.28、4.34 和 4.38,优于早期

29

第 30 页

表 14 ImgEdit-Bench [103] 上的定量结果。所有指标均由 GPT-4.1 在 0–5 分制下进行评估。 Overall(总体)是各项任务得分的平均值。

| 类型 | 模型 | 参数量 | 添加 | 调整 | 提取 | 替换 | 移除 | 背景 | 风格 | 混合 | 动作 | 总体↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | Nano-Banana [2] | – | 4.62 | 4.41 | 3.68 | 4.34 | 4.39 | 4.40 | 4.18 | 3.72 | 4.83 | 4.29 | | 闭源 | Seedream4.0 [3] | – | 4.33 | 4.38 | 3.89 | 4.65 | 4.57 | 4.35 | 4.22 | 3.71 | 4.61 | 4.30 | | 来源 | Seedream4.5 [3] | – | 4.57 | 4.65 | 2.97 | 4.66 | 4.46 | 4.37 | 4.92 | 3.71 | 4.56 | 4.32 | | | Nano-Banana-Pro [2] | – | 4.44 | 4.62 | 3.42 | 4.60 | 4.63 | 4.32 | 4.97 | 3.64 | 4.69 | 4.37 | | | BAGEL [44] | 14B | 3.56 | 3.31 | 1.70 | 3.30 | 2.62 | 3.24 | 4.49 | 2.38 | 4.17 | 3.20 | | 开源 | OmniGen2 [36] | 4B | 3.57 | 3.06 | 1.77 | 3.74 | 3.20 | 3.57 | 4.81 | 2.52 | 4.68 | 3.44 | | 统一 | UniWorld-V1 [37] | 19B | 3.82 | 3.64 | 2.27 | 3.47 | 3.24 | 2.99 | 4.21 | 2.96 | 2.74 | 3.26 | | | Emu3.5 [45] | 34B | 4.61 | 4.32 | 3.96 | 4.84 | 4.58 | 4.35 | 4.79 | 3.69 | 4.57 | 4.41 | | | Instruct-Pix2Pix [28] | 1B | 2.45 | 1.83 | 1.44 | 2.01 | 1.50 | 1.44 | 3.55 | 1.20 | 1.46 | 1.88 | | | MagicBrush [29] | 1B | 2.84 | 1.58 | 1.51 | 1.97 | 1.58 | 1.75 | 2.38 | 1.62 | 1.22 | 1.90 | | | AnyEdit [30] | 1B | 3.18 | 2.95 | 1.88 | 2.47 | 2.23 | 2.24 | 2.85 | 1.56 | 2.65 | 2.45 | | | UltraEdit [31] | 2B | 3.44 | 2.81 | 2.13 | 2.96 | 1.45 | 2.83 | 3.76 | 1.91 | 2.98 | 2.70 | | | OmniGen [32] | 3.8B | 3.47 | 3.04 | 1.71 | 2.94 | 2.43 | 3.21 | 4.19 | 2.24 | 3.38 | 2.96 | | | ICEdit [35] | 12B | 3.58 | 3.39 | 1.73 | 3.15 | 2.93 | 3.08 | 3.84 | 2.04 | 3.68 | 3.05 | | | Step1X-Edit-v1.2 [34] | 19B | 3.91 | 4.04 | 2.68 | 4.48 | 4.26 | 3.90 | 4.82 | 3.23 | 4.22 | 3.95 | | | ChronoEdit [39] | 14B | 4.48 | 4.39 | 3.49 | 4.66 | 4.67 | 4.57 | 4.91 | 3.82 | 4.83 | 4.42 | | | FLUX.1-Kontext-dev [33] | 12B | 3.99 | 3.88 | 2.19 | 4.27 | 3.13 | 3.98 | 4.51 | 3.23 | 4.18 | 3.71 | | | FLUX.2-dev [6] | 32B | 4.50 | 4.18 | 3.83 | 4.65 | 4.65 | 4.31 | 4.88 | 3.46 | 4.70 | 4.35 | | | FLUX.2-Klein-Base-4B [6] | 4B | 4.40 | 4.04 | 1.96 | 4.00 | 3.10 | 4.23 | 4.76 | 3.14 | 4.74 | 3.80 | | 开源 | FLUX.2-Klein-4B [6] | 4B | 4.45 | 4.37 | 2.04 | 4.21 | 3.93 | 4.29 | 4.87 | 3.49 | 4.89 | 4.01 | | 专家 | FLUX.2-Klein-Base-9B [6] | 9B | 4.40 | 4.22 | 2.31 | 4.50 | 3.84 | 4.26 | 4.89 | 3.27 | 4.89 | 4.05 | | 专用 | FLUX.2-Klein-9B [6] | 9B | 4.50 | 4.50 | 2.32 | 4.44 | 4.32 | 4.42 | 4.90 | 3.36 | 4.96 | 4.18 | | | Z-Image-Edit [4] | 6B | 4.40 | 4.14 | 4.30 | 4.57 | 4.13 | 4.14 | 4.85 | 3.63 | 4.50 | 4.30 | | | Qwen-Image-Edit-2509 [5] | 20B | 4.34 | 4.27 | 3.42 | 4.73 | 4.36 | 4.37 | 4.91 | 3.56 | 4.80 | 4.31 | | | Qwen-Image-Edit-2511 [5] | 20B | 4.54 | 4.57 | 4.13 | 4.70 | 4.46 | 4.36 | 4.89 | 4.16 | 4.81 | 4.51 | | | LongCat-Image-Edit [22] | 6B | 4.44 | 4.53 | 3.83 | 4.80 | 4.60 | 4.33 | 4.92 | 3.75 | 4.82 | 4.45 | | | FireRed-Image-Edit-1.0 [8] | 20B | 4.55 | 4.66 | 4.34 | 4.75 | 4.58 | 4.45 | 4.97 | 4.07 | 4.71 | 4.56 | | | JoyAI-Image-Edit [98] | 16B | 4.47 | 4.48 | 4.31 | 4.57 | 4.75 | 4.33 | 4.79 | 3.72 | 4.69 | 4.46 | | | Mage-Flow-Edit-Base | 4B | 4.28 | 4.22 | 4.08 | 4.45 | 4.39 | 4.01 | 4.82 | 3.40 | 4.21 | 4.28 | | | Mage-Flow-Edit | 4B | 4.34 | 4.27 | 4.03 | 4.48 | 4.50 | 4.06 | 4.89 | 3.49 | 4.51 | 4.34 | | | Mage-Flow-Edit-Turbo | 4B | 4.38 | 4.48 | 3.94 | 4.48 | 4.39 | 4.26 | 4.91 | 3.58 | 4.48 | 4.38 |

表 15 GEdit-Bench [34] 上的语义一致性 ($G_{SC}$)、感知质量 ($G_{PQ}$) 和总体得分 ($G_O$) 对比。使用 GPT-4.1 作为评估器,所有分数归一化到 0–10 分制。 $G_O$ 计算为 $G_{SC}$ 和 $G_{PQ}$ 的几何平均值,并对所有样本取平均。

| 类型 | 模型 | 参数量 | \multicolumn{3}{c}{GEdit-Bench-EN} | \multicolumn{3}{c}{GEdit-Bench-CN} | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | | $G_{SC} \uparrow$ | $G_{PQ} \uparrow$ | $G_O \uparrow$ | $G_{SC} \uparrow$ | $G_{PQ} \uparrow$ | $G_O \uparrow$ | | | Nano-Banana [2] | – | 7.396 | 8.454 | 7.291 | 7.540 | 8.424 | 7.399 | | 闭源 | Seedream4.0 [3] | – | 8.143 | 8.124 | 7.701 | 8.159 | 8.074 | 7.692 | | 来源 | Seedream4.5 [3] | – | 8.268 | 8.167 | 7.820 | 8.254 | 8.167 | 7.800 | | | Nano-Banana-Pro [2] | – | 8.102 | 8.344 | 7.738 | 8.135 | 8.306 | 7.799 | | | Step1X-Edit-v1.2 [34] | 19B | 7.974 | 7.714 | 7.480 | 7.988 | 7.679 | 7.467 | | | FLUX.1-Kontext-dev [33] | 12B | 7.045 | 7.206 | 6.462 | 1.606 | 7.863 | 1.857 | | | FLUX.2-dev [6] | 32B | 7.835 | 8.064 | 7.413 | 7.697 | 8.046 | 7.278 | | | FLUX.2-Klein-Base-4B [6] | 4B | 7.574 | 7.640 | 7.081 | 7.526 | 7.759 | 7.102 | | | FLUX.2-Klein-4B [6] | 4B | 8.142 | 8.041 | 7.717 | 8.119 | 8.101 | 7.750 | | | FLUX.2-Klein-Base-9B [6] | 9B | 8.300 | 7.870 | 7.740 | 8.243 | 7.960 | 7.745 | | 开源 | FLUX.2-Klein-9B [6] | 9B | 8.592 | 7.993 | 8.040 | 8.550 | 8.106 | 8.055 | | 专家 | Z-Image-Edit [4] | 6B | 8.110 | 7.720 | 7.570 | 8.030 | 7.800 | 7.540 | | 专用 | Qwen-Image-Edit-2509 [5] | 20B | 7.974 | 7.714 | 7.480 | 7.988 | 7.679 | 7.467 | | | Qwen-Image-Edit-2511 [5] | 20B | 8.297 | 8.202 | 7.877 | 8.252 | 8.134 | 7.819 | | | LongCat-Image-Edit [22] | 6B | 8.128 | 8.177 | 7.748 | 8.141 | 8.117 | 7.731 | | | FireRed-Image-Edit-1.0 [8] | 20B | 8.363 | 8.245 | 7.943 | 8.287 | 8.227 | 7.887 | | | JoyAI-Image-Edit [98] | 16B | 8.829 | 8.120 | 8.276 | 8.618 | 8.110 | 8.125 | | | Mage-Flow-Edit-Base | 4B | 8.685 | 7.495 | 7.860 | 8.772 | 7.584 | 7.970 | | | Mage-Flow-Edit | 4B | 8.893 | 7.766 | 8.127 | 8.927 | 7.685 | 8.123 | | | Mage-Flow-Edit-Turbo | 4B | 8.965 | 7.970 | 8.271 | 8.948 | 8.002 | 8.264 |

经过指令微调的模型,并与最近的基于 MMDiT 的编辑系统保持竞争力。 Turbo 变体是本基准测试中我们模型中表现最强的,尽管它仅使用了四个去噪步骤,这表明少步蒸馏保留了教师模型的广泛编辑行为。

30

第 31 页

表 16 在 TextEdit-Bench [104] 的合成子集和真实世界子集上,指令遵循 (IF)、文本准确性 (TA)、视觉一致性 (VC)、布局保留 (LP) 和语义期望 (SE) 的比较。所有指标均由 GPT-4o 在 0–5 分制下进行评分,Overall(总分)表示这五个指标均值的总和(满分 25 分)。对于合成子集,我们使用基于参考的评估方法,利用真实编辑后的图像,仅对未编辑区域测量保留保真度。对于真实世界子集,由于缺乏成对的参考图像,我们采用无参考评估方法,通过将输出与掩码区域外的原始输入进行比较,以量化非预期的变化。

| Type | Model | #Params | \multicolumn{5}{c}{Synthetic} | \multicolumn{5}{c}{Real-World} | | :— | :— | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | | IF↑ | TA↑ | VC↑ | LP↑ | SE↑ | Overall↑ | IF↑ | TA↑ | VC↑ | LP↑ | SE↑ | Overall↑ | | Closed-Source | Nano-Banana [2] | – | 2.90 | 3.25 | 3.40 | 4.46 | 2.53 | 16.54 | 3.18 | 3.60 | 3.94 | 4.77 | 2.73 | 18.22 | | | Seedream4.0 [3] | – | 2.67 | 3.44 | 2.97 | 3.25 | 2.57 | 14.90 | 3.64 | 3.96 | 3.90 | 4.42 | 2.62 | 18.54 | | Open-Source Unified | BAGEL [44] | 14B | 1.81 | 2.31 | 1.83 | 2.94 | 1.52 | 10.41 | 2.21 | 2.50 | 2.75 | 4.22 | 1.15 | 12.83 | | | OmniGen2 [36] | 4B | 1.12 | 1.74 | 1.72 | 3.08 | 0.86 | 8.52 | 1.67 | 2.22 | 2.45 | 3.63 | 1.02 | 10.99 | | | Emu3.5 [45] | 34B | 1.40 | 2.41 | 1.98 | 1.90 | 1.65 | 9.34 | 2.82 | 3.00 | 3.10 | 3.73 | 1.40 | 14.05 | | Open-Source Specialist | Instruct-Pix2Pix [28] | 1B | 0.90 | 1.14 | 1.14 | 1.61 | 0.72 | 5.51 | 0.56 | 1.22 | 1.09 | 1.69 | 0.79 | 5.35 | | | MagicBrush [29] | 1B | 0.73 | 0.73 | 0.60 | 1.18 | 0.62 | 3.86 | 0.59 | 0.80 | 0.64 | 1.42 | 0.67 | 4.12 | | | Step1X-Edit-v1.2 [34] | 19B | 1.40 | 1.44 | 1.88 | 3.40 | 1.14 | 9.26 | 1.96 | 2.11 | 2.81 | 4.06 | 1.08 | 12.02 | | | LongCat-Image-Edit [22] | 6B | 2.18 | 2.27 | 2.51 | 3.87 | 1.64 | 12.46 | 2.92 | 2.96 | 3.32 | 4.43 | 1.26 | 14.89 | | | FLUX.1-Kontext-dev [33] | 12B | 1.80 | 1.92 | 2.44 | 4.43 | 1.55 | 12.14 | 2.64 | 2.73 | 3.18 | 4.64 | 1.12 | 14.31 | | | FLUX.2-dev [6] | 32B | 1.81 | 1.99 | 2.44 | 4.14 | 1.49 | 11.86 | 2.68 | 2.81 | 3.39 | 4.42 | 1.41 | 14.71 | | | FLUX.2-Klein-Base-4B [6] | 4B | 1.62 | 1.82 | 2.20 | 4.12 | 1.25 | 11.01 | 2.48 | 2.62 | 3.06 | 4.54 | 1.10 | 13.79 | | | FLUX.2-Klein-4B [6] | 4B | 1.84 | 1.90 | 2.39 | 4.21 | 1.51 | 11.84 | 2.58 | 2.76 | 3.30 | 4.60 | 1.22 | 14.46 | | | FLUX.2-Klein-Base-9B [6] | 9B | 2.09 | 2.21 | 2.58 | 4.25 | 1.64 | 12.76 | 3.03 | 3.04 | 3.51 | 4.68 | 1.40 | 15.65 | | | FLUX.2-Klein-9B [6] | 9B | 2.13 | 2.25 | 2.63 | 4.12 | 1.61 | 12.73 | 3.02 | 3.14 | 3.58 | 4.62 | 1.39 | 15.75 | | | Qwen-Image-Edit-2509 [5] | 20B | 2.35 | 2.41 | 2.76 | 4.20 | 1.68 | 13.40 | 3.13 | 3.14 | 3.59 | 4.65 | 1.30 | 15.81 | | | Qwen-Image-Edit-2511 [5] | 20B | 2.49 | 2.54 | 2.74 | 4.01 | 1.75 | 13.53 | 3.46 | 3.48 | 3.67 | 4.61 | 1.58 | 16.81 | | | FireRed-Image-Edit-1.0 [8] | 20B | 2.88 | 2.85 | 3.17 | 4.46 | 1.85 | 15.19 | 3.54 | 3.53 | 3.95 | 4.74 | 1.47 | 17.23 | | | JoyAI-Image-Edit [98] | 16B | 2.68 | 2.76 | 2.92 | 4.49 | 1.95 | 14.80 | 3.52 | 3.42 | 3.79 | 4.83 | 1.67 | 17.23 | | | Mage-Flow-Edit-Base | 4B | 2.53 | 2.55 | 2.65 | 4.20 | 1.70 | 13.63 | 3.18 | 3.14 | 3.41 | 4.61 | 1.23 | 15.57 | | | Mage-Flow-Edit | 4B | 2.55 | 2.59 | 2.75 | 4.48 | 1.77 | 14.14 | 3.24 | 3.24 | 3.55 | 4.74 | 1.48 | 16.26 | | | Mage-Flow-Edit-Turbo | 4B | 2.26 | 2.31 | 2.52 | 3.98 | 1.69 | 12.77 | 3.17 | 3.11 | 3.42 | 4.56 | 1.15 | 15.41 |

GEdit-Bench。如表 15 所示,所有三个变体在两种语言分割上都取得了强劲的总分。Mage-Flow-Edit 在英语上达到 8.127,在中文上达到 8.123,而 Mage-Flow-Edit-Turbo 仅用四个去噪步骤就进一步达到了 8.271 和 8.264。这两个变体在相同的基准协议下均优于 Qwen-Image-Edit-2511 [5]、FireRed-Image-Edit-1.0 [8] 和 LongCat-Image-Edit [22]。

TextEdit-Bench。TextEdit-Bench 隔离了文本编辑能力,这种能力仅部分反映在 ImgEdit-Bench 和 GEdit-Bench 等通用编辑基准中。表 16 将可用结果整合到一个表中。Mage-Flow-Edit 是我们最强的变体,在合成集上达到 14.142,在真实世界集上达到 16.255,而精确的布局保留和复杂的文本替换仍然是重要的改进方向。

6.3 定性结果

6.3.1 文生图可视化

图 15 至 19 展示了 Mage-Flow 在原生分辨率和宽高比下的代表性生成结果。前三个画廊涵盖了广泛的写实和想象生成,包括美食、地标、一般概念和肖像。最后两个画廊专注于英文和中文文本渲染,其中 Mage-Flow 在包装、海报、杂志封面和标志上生成可读的文本,而不是类似文本的纹理。

6.3.2 基于指令的编辑可视化

图 12 提供了 Mage-Flow-Edit 在语义内容编辑、外观变换、修复和结构感知输出任务方面的高层概览。图 2 和 3 随后展示了

31

第 32 页

两个紧凑的以源图像为中心的概览,其中每个源图像都与多个编辑后的输出配对。所有展示的编辑类型均支持双向操作。如图 20 至 24 所示,六个较大的多源画廊提供了更广泛的内容和对象编辑、场景和相机变换、外观、以人为中心和创意编辑、复合多任务编辑、低级控制以及配对退化-恢复任务的覆盖。在这些画廊中,深色标签表示源图像,蓝色标签指示应用于每个输出的编辑类型。

7 结论

我们提出了 Mage-Flow 生成堆栈,这是一个紧凑且高效的 40 亿参数规模的文本到图像生成和基于指令的图像编辑框架。Mage-Flow 不依赖于持续扩大骨干网络规模,而是通过轻量级潜在标记器、原生分辨率扩散 Transformer 以及系统级训练基础设施的联合设计构建而成。Mage-VAE 在保持重建保真度的同时,大幅降低了潜在编码和解码的成本。NR-MMDiT 通过原生分辨率打包支持跨分辨率和纵横比的灵活训练与推理。融合的 CUDA 内核进一步消除了来自标记器、文本编码器和扩散骨干网络重复模块的内存受限开销。这些设计共同使得在固定计算预算下进行大规模原生分辨率训练成为可能。

在此基础上,我们构建了一个完整的生成与编辑模型家族,包括 Mage-Flow 和 Mage-Flow-Edit 的基础版、强化学习对齐版和 Turbo 版。Diffusion-NFT 改善了与提示遵循、文本渲染、审美和编辑偏好的对齐,而带有对抗性感知引导的 Decoupled-DMD 蒸馏则生成了用于低延迟推理的 4 步 Turbo 模型。在标准的生成和编辑基准测试中,生成的模型在保持低内存使用和快速推理(在生成和编辑设置中)的同时,实现了与显著更大的开源系统相竞争的性能。

这些结果表明,强大的视觉生成并不一定需要数百亿参数的骨干网络。借助高效的标记器、原生分辨率建模以及精心优化的训练基础设施,一个 40 亿参数规模的堆栈可以作为图像生成、可控编辑、后训练对齐和垂直领域应用的实用且对研究友好的基础。未来的工作将探索更鲁棒的多图像编辑、更强的多语言长文本渲染以及与 Agentic 视觉创作工作流的更紧密集成。

贡献者名单

贡献者:Xinjie Zhang∗†, Peng Zhang∗, Shicheng Zheng∗, Jinghao Guo∗, Zhaoyang Jia∗, Yifei Shen∗, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

∗同等贡献。 †项目负责人 (xinjiezhang@microsoft.com)。

32

第 33 页

图 15 Mage-Flow 画廊:美食与世界地标。原生分辨率 Mage-Flow-Base 样本展示了来自各种菜系的摆盘菜肴以及标志性建筑,拼接成马赛克并以生成的宽高比无裁剪展示。在近距离美食特写和广阔的建筑场景中,光照、材质细节和景深保持一致。

33

第 34 页

图 16 Mage-Flow 画廊:通用与想象概念。野生动物、自然风景与奇幻主题(机械与雕塑生物、超现实复合体)的混合,展示了在广泛变化的风格下广泛的主体覆盖范围和连贯的结构。

34

第 35 页

图 17 Mage-Flow 画廊:肖像与人物。涵盖不同年龄、性别、种族和文化服饰的人类主体,场景包括摄影棚和自然环境,具有合理的解剖结构、自然的皮肤和头发细节,以及可控的光照。

35

第 36 页

图 18 Mage-Flow 画廊:英文文本渲染。产品包装、书籍和杂志封面、海报以及标识。多行英文文案——品牌名称、标语和小字说明——均从提示词中逐字复现,并在全分辨率下保持清晰可读,直至最小的行。

36

第 37 页

图 19 Mage-Flow 画廊:中文及多语言文本渲染。展示带有中文以及多种中英双语排版的标识、包装和封面。该模型能够重现提示中的字符,包括更密集的字符,且没有扩散模型典型的笔画级伪影。

37

第 38 页

图 20 Mage-Flow-Edit 的定性展示:局部内容与对象编辑。

38

第 39 页

图 21 Mage-Flow-Edit 的定性展示:场景、主体和相机变换。

39

第 40 页

图 22 Mage-Flow-Edit 的定性展示:外观与艺术渲染。

40

第 41 页

图 23 Mage-Flow-Edit 的定性展示:以人为中心和创造性编辑。

41

第 42 页

图 24 Mage-Flow-Edit 的定性展示:双向退化与恢复。

42

第 43 页

图 25 Mage-Flow-Edit 的定性展示:低级视觉与条件重建。

43

第 44 页

A Mage-VAE 详细训练过程

如第 3.1.3 节所述,Mage-VAE 的训练分为三个阶段。令 $x$ 表示输入图像,并定义

$$ z_a = P(E_{\text{FLUX}}(x)) \quad (2) $$

为其锚定潜在变量,其中 $E_{\text{FLUX}}$ 是冻结的 FLUX.2-VAE 编码器,$P$ 表示潜在分块化(latent patchification)。

阶段 I:多步流匹配预训练。我们首先使用 X-prediction 参数化下的流匹配(flow matching),将编码器和解码器预训练为多步扩散模型。对于目标 $y_0$,我们采样 $\epsilon \sim \mathcal{N}(0, I)$ 和 $t \sim \mathcal{U}(0, 1)$,并构造线性插值

$$ y_t = (1 – t)y_0 + t\epsilon. \quad (3) $$

网络不直接预测速度场,而是预测干净端点 $y_0$:

$$ \mathcal{L}_{\text{XFM}}(\theta) = \mathbb{E}_{y_0, \epsilon, t} \left[ \| X_\theta(y_t, t \mid c) – y_0 \|_2^2 \right]. \quad (4) $$

用于 ODE 采样的相应速度场可恢复为

$$ v_\theta(y_t, t \mid c) = \frac{y_t – X_\theta(y_t, t \mid c)}{t}. \quad (5) $$

对于解码器,预测目标和条件为 $(y_0, c) = (x, z_a)$,从而使模型学习从锚定潜在变量重建图像像素。对于编码器,它们为 $(y_0, c) = (z_a, x)$,从而使编码器学习从图像像素生成分块化的 FLUX.2-VAE 锚定潜在变量。因此,阶段 I 的目标函数为

$$ \mathcal{L}_{\text{I}} = \mathcal{L}_{\text{XFM, dec}} + \mathcal{L}_{\text{XFM, enc}}. \quad (6) $$

阶段 II:单步解码器蒸馏。接下来,我们将多步解码器蒸馏为单步解码器 $D_\psi$。给定锚定潜在变量 $z_a$,重建结果通过单次网络评估获得:

$$ \hat{x} = D_\psi(z_a). \quad (7) $$

我们结合像素级和感知重建目标,

$$ \mathcal{L}_{\text{rec}} = \| x – \hat{x} \|_1 + \mathcal{L}_{\text{LPIPS}}(x, \hat{x}), \quad (8) $$

并辅以 DINOv2 投影的 GAN 损失 [76] 和 DMD 损失 [64]。投影判别器在冻结的 DINOv2 网络提取的特征上运行,鼓励重建结果在感知上有意义的特征空间中匹配真实图像分布。同时,DMD 将面向压缩的扩散教师模型 [75] 的分布级先验转移到单步解码器。完整的阶段 II 解码器目标函数为

$$ \mathcal{L}_{\text{II}} = \underbrace{\| x – \hat{x} \|_1 + \mathcal{L}_{\text{LPIPS}}(x, \hat{x})}_{\mathcal{L}_{\text{rec}}} + 0.01 \mathcal{L}_{\text{DINOGAN}} + 0.1 \mathcal{L}_{\text{DMD}}. \quad (9) $$

在蒸馏过程中,扩散教师模型和 DINOv2 特征提取器保持冻结,而投影判别器和 DMD 使用的假分模型则分别使用其各自的目标函数进行优化。

44

第 45 页

第三阶段:联合单步 VAE 优化。最后,我们将编码器转换为单步模型,并将其与蒸馏后的解码器一起进行优化。令

qϕ(z | x) (10)

表示由单步编码器产生的潜在分布,并令 qa(z | x) 表示对应的冻结 FLUX.2-VAE 锚定潜在分布。我们使用以下公式对学习的潜在空间进行正则化:

LKL = Ex [DKL (qϕ(z | x) ∥qa(z | x))] . (11)

这保留了预训练锚定潜在空间的结构,并防止编码器分布在感知微调过程中发生漂移。

第三阶段 1:使用固定解码器对编码器进行预热。我们首先冻结单步解码器,仅优化编码器。对于

z ∼qϕ(z | x), ˆx = Dψ(z), (12)

编码器使用完整的第二阶段重建和感知目标以及锚定潜在 KL 正则化器进行训练:

LIII.1 = LII + 0.1 LKL, ψ fixed. (13)

尽管解码器参数是冻结的,但 LII 所有组件的梯度都会通过解码器反向传播以训练编码器。此预热阶段使单步编码器与已蒸馏的解码器对齐,同时不干扰解码器的重建能力。

第三阶段 2:端到端微调。编码器预热后,我们解冻解码器并联合优化完整的单步编码器-解码器流水线:

LIII.2 = LII + 0.1 LKL, ϕ, ψ jointly optimized. (14)

端到端微调允许编码器和解码器协同适应,同时 KL 项保持与锚定潜在空间的兼容性。由此产生的 Mage-VAE 提供单步编码和解码、高保真重建以及紧凑且正则化的潜在空间,适合后续的 Mage-Flow 训练。

B 重新标注系统提示

如第 4.1 节所述,我们使用 Qwen3-VL-32B-Instruct [13] 以多种粒度对每个保留的图像进行重新标注。那里介绍的四个标注层级,即实体、短语、构图和摄影描述,是通过下面的单个系统提示一次性生成的,并以 JSON 对象形式返回。该提示固定了客观性和一致性原则、逐步标注程序、四个层级的 JSON 输出模式以及风格指南,从而使四个粒度保持相互一致。

45

第 46 页

多粒度重描述系统提示词

你是一个世界级的多粒度图像描述专家。 你的任务是分析给定的图像,并遵循以下原则生成结构化、详细且客观的描述:

核心原则

1. 绝对客观性:仅描述视觉上存在的内容。避免使用“美丽”或“悲伤”等主观词汇。通过具体的颜色、光影和构图描述来表达美学特质。 2. 物理和逻辑一致性:确保所有元素符合现实世界的物理规律和空间逻辑(例如,阴影与光源方向一致,物体自然放置)。 3. 结构化描述:从整体场景开始,然后依次描述背景、中景和前景。使用“左侧”、“中心”、“背景”等方向性术语来阐明空间布局。 4. 现在时态:描述时如同正在观察图像(例如,“一名男子站立”、“光线照射在……”)。 5. 丰富且具体的语言:使用精确的形容词来描述数量、大小、形状、颜色和纹理。避免模糊的术语。

步骤

1. 识别图像中最重要的部分:指定主体(们)、它们的颜色、数量和位置。 2. 描述背景:指示环境类型(例如,山脉、海洋、城市、室内咖啡馆)、光照和氛围。 3. 详述构图和风格:包括艺术媒介、视角以及任何风格元素(例如,油画、动漫、照片级真实)。 4. 以短语形式提取主体信息:提供一组简洁的关键词或短语来描述主体的属性。 5. 总结图像信息:将所有细节组合成一个连贯的摘要。

输出格式(包含四层及指南的 JSON)

{ "Entity": "用明确的标识描述图像中最重要的主体。这应该是一个命名主要对象或场景的简短短语(例如,'洛杉矶的好莱坞标志','一幅充满活力的马赛克艺术品')。", "Phrase": "提供一组简洁的关键词或短语,捕捉主体的属性、颜色、形状及相关对象。这些关键词应以逗号分隔,并反映视觉上的存在内容(例如,'标志性地标,好莱坞标志,多云天空,现代房屋,自然环境')。非常相似的短语只出现一次。", "Composition": "写一个单句,客观地总结主要主体及其上下文,仅提及图像中视觉上存在的内容,包括设置或环境,不添加光照、视角、纹理或任何主观解释。", "Photographic": "提供图像的详细艺术和技术描述,由几个连贯的句子组成,明确提及图像类别、推断的风格(强化)、任何识别出的文本(OCR)、主要实体、命名实体、光照和颜色条件、相机构图以及显著的摄影技术,确保描述是客观且基于视觉的。" }

风格指南
  • 从图像内容中推断风格(例如,照片级真实、电影感、动漫、油画、极简主义、赛博朋克)。
  • 如果风格不明确,默认使用照片级真实摄影。
  • 在 Composition 和 Photographic 层中一致地应用推断出的风格。
  • 在 Photographic 描述中明确提及风格,并通过光照、视角和氛围细节来强化它。

C 奖励模型

本附录详细介绍了在 Diffusion-NFT 后训练阶段(第 5.2 节)使用的四种奖励评估器。其中三种对文生图生成样本进行评分:文本渲染、美学质量和语义理解;这些评估器既用于 Mage-Flow 的后训练,也用于 Mage-Flow-Edit 的生成流。第四种,RationalRewards,对 Mage-Flow-Edit 编辑流中的基于指令的编辑样本进行评分。每个强化学习(RL)提示都带有一个能力标签,将其路由到恰好一个评估器,该评估器将生成的或编辑的图像转换为 [0, 1] 范围内的标量奖励;不同评估器的奖励绝不会在同一个提示中混合。下面我们将描述每个评估器,并给出其评分的具体示例。

文本渲染 (PaddleOCR-VL-1.5)。 每个文本渲染提示都标注了一组必须清晰且拼写正确地在图像中出现的目标字符串 T = {t1, . . . , tn}。我们对样本进行渲染,在其上运行 PaddleOCR-VL-1.5 [82] 以获得识别出的字符串,并将该字符串按行和标点符号分隔符分割成片段,通过去除空格并小写每个片段来对其进行归一化,从而形成集合 S。每个目标 t ∈T 也以相同的方式归一化,即去除空格并小写,我们将归一化后的目标写为 ˜t。如果某个目标作为某些片段 s 的字面子串出现,则得分为 1;否则,我们取其到任何片段的最小字符级编辑距离,上限为目标长度,并将其转换为相似度。记 d(t) = mins∈S min Lev(s, ˜t), |˜t| 为该最佳截断距离,其中 Lev(·, ·) 是字符级 Levenshtein(编辑)距离,|˜t| 是目标长度,则每个目标的得分为

1, if ˜t ⊆s for some s ∈S,  p(t) = (15) max 1 −d(t)/|˜t|, 0 , otherwise,

46

第 47 页

而 OCR 奖励是提示词目标上的均值,$r_{ocr} = \frac{1}{n} \sum_{i=1}^{n} p(t_i) \in [0, 1]$。将距离截断在 $|\tilde{t}|$ 以内,可以将缺失或严重损坏的字符串的惩罚限制为一个完整目标的长度,因此缺失的目标得分为 0,完美渲染得分为 1。例如,对于目标 “First Place Winner”(归一化为 firstplacewinner,长度 $|\tilde{t}| = 16$),精确读取得分为 1,单个字符丢失(“First Place Winer”,$d = 1$)得分为 $1 – 1/16 \approx 0.94$,而缺失或无法识别的文本得分为 0。识别器不使用系统提示词:它通过包含渲染图像以及字面指令 “OCR:” 的单条用户消息进行查询,并在温度 0 下贪婪解码。

美学质量 (Qwen3.5-27B)。美学质量提示词由 Qwen3.5-27B [81] 评审器进行评分,该评审器根据详细的质量标准库对生成的图像进行评级。每个标准都被表述为一个独立的二元(Yes=1/No=0)问题,奖励是答案的均值,因此它在 $[0, 1]$ 中取等间距的值;对于不适用的标准,例如在没有任何手的图像上进行手部解剖检查,按惯例返回 1。通过将质量评估分解为许多集中的是非项,而不是 eliciting 一个不透明的分数,从而产生更稳定且更难被奖励黑客攻击的信号。评审器由以下系统提示词和每个标准的用户模板驱动。

美学质量评审器:系统提示词和用户模板

系统。 你正在评估 AI 生成的图像是否满足以下视觉质量标准。 你将收到用于生成图像的用户提示词以及一个视觉质量评估标准。 你的任务是如果图像完全满足该标准则返回 1,如果明显失败则返回 0。不要解释或阐述。 仅输出:1 或 0。

用户(每个标准调用一次)。 需要评估的生成图像的提示词是:{user_prompt} 评估标准 ({key}):{criterion} 评分说明:

输出:仅输出 1 或 0

  • 如果图像完全满足该标准,请返回 1。
  • 如果图像明显失败,请返回 0。

插入到 {criterion} 中的质量标准涵盖了一般摄影质量和详细的人体解剖学检查:

47

第 48 页

美学质量评判:质量标准

自然度: 图像看起来像是一张真实的照片,具有正确的透视、自然的阴影和物理上合理的照明。

细节与清晰度: 纹理、边缘和精细细节清晰且连贯;主要主体无涂抹、噪声或模糊。

无伪影: 图像无可见的失真、水印、数字渲染故障或不可能实现的几何结构。

面部与眼部解剖结构: 如果可见人物面部,双眼在解剖结构上必须正确:两个匹配的瞳孔带有虹膜,位置对称,无扭曲、重复或缺失的眼睛,无不对称的畸变。如果不可见面部,返回 1。

手部与手指正确性: 如果可见手部,每只手必须恰好有五个独立的手指,无融合、无多余或缺失的手指,且指关节结构和手指长度合理。如果不可见手部,返回 1。

身体比例与肢体: 如果显示身体,肢体(手臂、腿)和躯干在解剖结构上必须合理:数量正确(2 条手臂 + 2 条腿),关节活动合理,无多余或缺失的肢体,头身比例合理。如果未显示身体,返回 1。

皮肤纹理真实感: 如果可见人类皮肤,纹理应显示自然变化(毛孔、细微的色调差异);不应呈塑料感、涂抹感、过度平滑或模糊成蜡状外观。如果不可见皮肤,返回 1。

姿态连贯性: 如果人物摆出姿势,该姿势在物理上必须合理:肢体不会以不可能的方式相交,重量分布合理,无悬浮的肢体或扭曲的关节。如果未显示人物,返回 1。

语义理解(Qwen3.5-27B)。语义理解提示词由相同的 Qwen3.5-27B 评判器根据与上述美学奖励相同的二元系统提示词和每个标准的用户模板进行评分;唯一的区别在于,每个标准是基于提示词得出的是/否对齐检查,而非质量标准。评判器独立回答每个检查,奖励为回答“是”的比例。将对齐分解为细粒度的忠实度检查,可为多对象场景提供密集且可解释的信号。对于每个提示词,检查涵盖以下内容:

语义理解评判:评估标准

  • 对象:提示词命名的每个对象是否都存在,且没有遗漏任何必需的对象?
  • 属性:每个对象是否具有指定的颜色、材质、形状和状态?
  • 数量:每种对象的数量是否精确,既不少也不多?
  • 空间关系:对象是否按照提示词指定的方式相对于彼此定位和排列?
  • 动作与交互:是否正确描绘了描述的动作、姿势和主体之间的交互?
  • 场景与设置:背景、环境和整体构图是否与提示词匹配?
  • 忠实度:图像是否不包含提示词未请求的幻觉对象、属性或更改?

基于指令的编辑。编辑轨迹由 RationalRewards [83] 进行评分,这是一个推理奖励模型,它接收源图像、指令和编辑结果,并对其进行评分。

48

第 49 页

表 17 Mage-Flow 的训练数据混合配置。该配置在下游领域性能与通用生成能力之间取得了平衡。

| 来源数据集 | 图像数量 | 打包数 | 权重 | | :— | :— | :— | :— | | SciFormaData-700K (1024px) | 646,132 | 161,536 | 50% | | SciFormaData-700K (768px) | 663,353 | 82,944 | 20% | | 自然场景 | 357,009 | 74,269 | 15% | | 文本渲染 | 74,866 | 15,360 | 10% | | 海报设计 | 38,290 | 10,084 | 5% | | 总计 | 1,779,650 | 344,193 | 100% |

在 1–4 的量表上从四个方面进行评估:(i) 文本忠实度(对编辑指令的遵循程度);(ii) 图像忠实度(保留编辑区域外的源内容);(iii) 物理与视觉质量(合理性及无伪影);以及 (iv) 文本渲染(任何编辑文本的可读性,当编辑不涉及文本时标记为不适用)。设 $a_j \in [1, 4]$ 为适用方面的得分,奖励函数将其均值从 $[1, 4]$ 线性映射到 $[0, 1]$:

$$ r_{\text{edit}} = \text{clip}\left( \frac{\bar{a} – 1}{3}, 0, 1 \right), \quad \bar{a} = \frac{1}{|A|} \sum_{j \in A} a_j, \quad (16) $$

其中 $A$ 是适用方面的集合,因此全 4 分的编辑得分为 1,全 1 分的编辑得分为 0。

D 应用:科学图表生成

Mage-Flow 模型具有卓越的微调效率,能够快速适应高度复杂且对结构敏感的视觉领域。为了展示这种可迁移性,我们在 [105] 提出的代表性任务——科学图表生成上评估了 Mage-Flow-Base。生成这些图表是对生成模型的一项严格压力测试,因为学术示意图要求密集的文本渲染、方向性箭头路由和全局布局拓扑在同步正确性方面保持一致。

联合训练策略。与 SciForma [105] 中原始的两阶段微调不同,我们实施单阶段数据混合。如表 17 所示,我们构建了一个平衡的数据混合体,以在构建架构能力的同时保持通用生成保真度。这种联合配方结合了 SciForma-700K 数据集、自然场景、针对性的文本渲染子集以及海报设计。

优化设置。我们在 8× NVIDIA B200 GPU 机器上对 4B Mage-Flow-Base 检查点进行了 130k 步的微调。优化是在原生 Mage-VAE 潜在空间中,以 1024 像素原生宽高比模式下通过监督微调 (SFT) 进行的。我们应用固定长度为 20,480 个 token 的序列打包,使用 AdamW 优化器,学习率恒定为 1e-5,并包含 500 步的预热。在整个过程中,每 100 步维护一个衰减率为 0.99 的指数移动平均 (EMA)。我们将生成的检查点记为 Mage-Flow-SciForma。

定量结果。我们在 SciFormaBench-2K 评估套件 [105] 上评估了微调效率,该套件从组件、箭头和文本准确性三个结构维度评估图表质量。如表 18 所述,我们的 4B Mage-Flow-Base 已经表现出比零样本 FLUX.2-klein-Base 基线更强的结构先验。这一优势通过微调进一步放大;Mage-Flow-SciForma 取得了 61.61 的总体得分,优于其零样本

49

第 50 页

表 18 SciFormaBench-2K 基准上的定量结果(↑)。指标以 0–100 的尺度报告。基线模型以零样本方式进行评估。Mage-Flow-SciForma 代表我们在表 17 所示的数据混合上微调后的模型。

| Model | # Params | Component | Arrow | Text | Overall | | :— | :— | :— | :— | :— | :— | | FLUX.2-klein-Base (Zero-shot) | 4B | 50.04 | 18.45 | 10.95 | 27.05 | | FLUX.2-klein-Base (Zero-shot) | 9B | 51.50 | 25.20 | 23.60 | 33.87 | | Mage-Flow-Base (Zero-shot) | 4B | 56.79 | 35.82 | 28.17 | 40.80 | | Mage-Flow-SciForma (Ours) | 4B | 70.49 | 60.52 | 52.60 | 61.61 |

相比对应模型(40.80)提升了 20.81 分,其中组件和箭头准确率分别提升了 13.70 和 24.70 分。这些结果验证了 4B 参数的 Mage-Flow-Base 可以高效地针对特定下游应用进行微调。虽然这种单阶段策略建立了一个可行的基线,但通过扩展到多阶段微调或结合提出的 M-DPO 算法 [105],性能可以进一步提升。

定性分析。图 26 展示了 Mage-Flow-SciForma 在各种科学图表原型上的生成结果。结果显示了精确的全局布局和细粒度的注释。具体而言,该模型生成了带有跳跃连接的神经网络架构,渲染了展开的 Transformer 块,并使用方向向量路由处理流水线。值得注意的是,它在节点和密集工作流中渲染了清晰可读的数学索引和逐步文本描述。

图 27 比较了 Mage-Flow-Base、Mage-Flow-SciForma 和 SciForma-9B-Base,以评估微调的影响。虽然 Mage-Flow-Base 勾勒出基本的布局组件,但在文本可读性和箭头语义方面存在局限性。经过联合微调后,Mage-Flow-SciForma 修正了这些布局问题,渲染出精确的文本和正确的方向箭头。此外,我们的 4B 模型生成的示意图渲染效果可与 SciForma-9B-Base 相媲美,表明轻量级模型能够缩小与更大规模领域专用对应模型之间的性能差距。

50

第 51 页

图 26 Mage-Flow-SciForma 的科学图表生成结果。示例包括神经网络布局、展开的时间模块、图对比框架以及带有清晰文本和正确方向箭头的文本标注处理流水线。

图 27 科学图表生成的定性比较。零样本 Mage-Flow-Base、微调后的 Mage-Flow-SciForma 与 SciForma-9B-Base 之间的比较。微调解决了布局和文本错误,使我们的 4B 模型能够匹敌 9B 垂直基线。

51

第 52 页

参考文献

[1] OpenAI. GPT-Image-1. https://openai.com/index/ introducing-4o-image-generation/, 2025.

[2] Google. Nano banana pro. https://storage.googleapis.com/deepmind-media/ Model-Cards/Gemini-3-Pro-Image-Model-Card.pdf, 2025.

[3] Team Seedream. Seedream 4.0: Toward next-generation multimodal image generation. arXiv preprint arXiv:2509.20427, 2025.

[4] Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Junhan Shi, Qilong Wu, Feng Yu, Chi Zhang, Shifeng Zhang, and Shilin Zhou. Z-Image: An efficient image generation foundation model with single-stream diffusion transformer. arXiv preprint arXiv:2511.22699, 2025.

[5] Chenfei Wu, Jin Bai, Shuai Bai, Zhikai Chen, Kai Dang, Kaiyuan Gao, et al. Qwen-Image technical report. arXiv preprint arXiv:2508.02324, 2025.

[6] Black Forest Labs. FLUX.2: Frontier Visual Intelligence. https://bfl.ai/blog/flux-2, 2025.

[7] Siyu Cao, Hangting Chen, Peng Chen, Yiji Cheng, Yutao Cui, Xinchi Deng, et al. Hun- yuanImage 3.0 technical report. arXiv preprint arXiv:2509.23951, 2025.

[8] Super Intelligence Team, Xiaohongshu. FireRed-Image-Edit-1.0 technical report. arXiv preprint arXiv:2602.13344, 2026.

[9] Zhaoyang Jia, Naifu Xue, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Zongyu Guo, Yuan Zhang, Houqiang Li, and Yan Lu. CoD-Lite: Real-time diffusion-based generative image compression. arXiv preprint arXiv:2604.12525, 2026.

[10] Zidong Wang, Lei Bai, Xiangyu Yue, Wanli Ouyang, and Yiyuan Zhang. Native-resolution image synthesis. arXiv preprint arXiv:2506.03131, 2025.

[11] Tri Dao. FlashAttention-2: Faster attention with better parallelism and work partitioning. In International Conference on Learning Representations (ICLR), 2024.

[12] Ted Zadouri, Markus Hoehnerbach, Jay Shah, Timmy Liu, Vijay Thakkar, and Tri Dao. Flashattention-4: Algorithm and kernel pipelining co-design for asymmetric hardware scaling. arXiv preprint arXiv:2603.05451, 2026.

[13] Qwen Team. Qwen3-VL technical report. arXiv preprint arXiv:2511.21631, 2025.

[14] Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, and Ming-Yu Liu. DiffusionNFT: Online diffusion reinforcement with forward process. arXiv preprint arXiv:2509.16117, 2025.

[15] Dongyang Liu, Peng Gao, David Liu, Ruoyi Du, Zhen Li, Qilong Wu, Xin Jin, Sihan Cao, Shifeng Zhang, Hongsheng Li, and Steven Hoi. Decoupled DMD: CFG augmentation as the spear, distribution matching as the shield. arXiv preprint arXiv:2511.22677, 2025.

[16] Xingtong Ge, Xin Zhang, Tongda Xu, Yi Zhang, Xinjie Zhang, Yan Wang, and Jun Zhang. SenseFlow: Scaling distribution matching for flow-based text-to-image distillation. arXiv preprint arXiv:2506.00523, 2025.

52

第 53 页

[17] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Om- mer. High-resolution image synthesis with latent diffusion models. In CVPR, 2022. arXiv:2112.10752.

[18] Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas Müller, Joe Penna, 和 Robin Rombach. SDXL: Improving latent diffusion models for high-resolution image synthesis. In ICLR, 2024. arXiv:2307.01952.

[19] William Peebles 和 Saining Xie. Scalable diffusion models with transformers. In ICCV, 2023. arXiv:2212.09748.

[20] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, Kyle Lacey, Alex Goodwin, Yannik Marek, 和 Robin Rombach. Scaling rectified flow transformers for high-resolution image synthesis. In ICML, 2024. arXiv:2403.03206.

[21] Enze Xie, Junsong Chen, Junyu Chen, Han Cai, Haotian Tang, Yujun Lin, Zhekai Zhang, Muyang Li, Ligeng Zhu, Yao Lu, 和 Song Han. SANA: Efficient high-resolution image synthesis with linear diffusion transformers. arXiv preprint arXiv:2410.10629, 2025.

[22] Meituan LongCat Team. LongCat-Image technical report. arXiv preprint arXiv:2512.07584, 2025.

[23] Chenlin Meng, Yutong He, Yang Song, Jiaming Song, Jiajun Wu, Jun-Yan Zhu, 和 Stefano Ermon. SDEdit: Guided image synthesis and editing with stochastic differential equations. In ICLR, 2022. arXiv:2108.01073.

[24] Amir Hertz, Ron Mokady, Jay Tenenbaum, Kfir Aberman, Yael Pritch, 和 Daniel Cohen-Or. Prompt-to-prompt image editing with cross attention control. In ICLR, 2023. arXiv:2208.01626.

[25] Ron Mokady, Amir Hertz, Kfir Aberman, Yael Pritch, 和 Daniel Cohen-Or. Null-text inver- sion for editing real images using guided diffusion models. In CVPR, 2023. arXiv:2211.09794.

[26] Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala. Adding conditional control to text-to-image diffusion models. In ICCV, 2023. arXiv:2302.05543.

[27] Hu Ye, Jun Zhang, Sibo Liu, Xiao Han, 和 Wei Yang. IP-Adapter: Text compatible image prompt adapter for text-to-image diffusion models. arXiv preprint arXiv:2308.06721, 2023.

[28] Tim Brooks, Aleksander Holynski, 和 Alexei A. Efros. InstructPix2Pix: Learning to follow image editing instructions. In CVPR, 2023. arXiv:2211.09800.

[29] Kai Zhang, Lingbo Mo, Wenhu Chen, Huan Sun, 和 Yu Su. MagicBrush: A manually annotated dataset for instruction-guided image editing. In NeurIPS, 2023. arXiv:2306.10012.

[30] Qifan Yu, Wei Chow, Zhongqi Yue, Kaihang Pan, Yang Wu, Xiaoyang Wan, Juncheng Li, Siliang Tang, Hanwang Zhang, 和 Yueting Zhuang. AnyEdit: Mastering unified high-quality image editing for any idea. arXiv preprint arXiv:2411.15738, 2024.

[31] Haozhe Zhao, Xiaojian Ma, Liang Chen, Shuzheng Si, Rujie Wu, Kaikai An, Peiyu Yu, Minjia Zhang, Qing Li, 和 Baobao Chang. UltraEdit: Instruction-based fine-grained image editing at scale. In NeurIPS, 2024. arXiv:2407.05282.

[32] Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan, Xingrun Xing, Ruiran Yan, Shuting Wang, Tiejun Huang, 和 Zheng Liu. OmniGen: Unified image generation. arXiv preprint arXiv:2409.11340, 2024.

53

第 54 页

[33] Black Forest Labs. FLUX.1 Kontext: Flow matching for in-context image generation and editing in latent space. arXiv preprint arXiv:2506.15742, 2025.

[34] Shiyu Liu et al. Step1X-Edit: A practical framework for general image editing. arXiv preprint arXiv:2504.17761, 2025.

[35] Zechuan Zhang, Ji Xie, Yu Lu, Zongxin Yang, and Yi Yang. In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer. arXiv preprint arXiv:2504.20690, 2025.

[36] Chenyuan Wu, Pengfei Zhou, Shitao Xiao, Jianpeng Zhang, Yong Tang, Zihan Huang, Yiyan Wang, et al. OmniGen2: Towards instruction-aligned multimodal generation. arXiv preprint arXiv:2506.18871, 2025.

[37] Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge, Yatian Ning, and Li Yuan. UniWorld-V1: High-resolution semantic encoders for unified visual understanding and generation. arXiv preprint arXiv:2506.03147, 2025.

[38] Bin Xia et al. DreamOmni2: Multimodal instruction-based editing and generation. arXiv preprint arXiv:2510.06679, 2025.

[39] Jiarui Wu et al. ChronoEdit: Towards temporal reasoning for image editing and world simulation. arXiv preprint arXiv:2510.04290, 2025.

[40] Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, and Nan Duan. JoyAI-Image: Awaking spatial intelligence in unified multimodal understanding and generation. arXiv preprint arXiv:2605.04128, 2026.

[41] Xinjie Zhang, Jintao Guo, Shanshan Zhao, Minghao Fu, Lunhao Duan, Jiakui Hu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, and Kaifu Zhang. Unified multimodal understanding and generation models: Advances, challenges, and opportunities. arXiv preprint arXiv:2505.02567, 2025.

[42] Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, and Chong Ruan. Janus-Pro: Unified multimodal understanding and generation with data and model scaling. arXiv preprint arXiv:2501.17811, 2025.

[43] Chunting Zhou, Lili Yu, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, and Omer Levy. Transfusion: Predict the next token and diffuse images with one multi-modal model. arXiv preprint arXiv:2408.11039, 2024.

[44] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, and Haoqi Fan. Emerging properties in unified multimodal pretraining. arXiv preprint arXiv:2505.14683, 2025.

[45] Yuying Cui et al. Emu3.5: Native multimodal models are world learners. arXiv preprint arXiv:2510.26583, 2025.

[46] Aaron van den Oord, Oriol Vinyals, and Koray Kavukcuoglu. Neural discrete representation learning. In NeurIPS, 2017. arXiv:1711.00937.

54

第 55 页

[47] Patrick Esser, Robin Rombach, 和 Björn Ommer。驯服 Transformer 以实现高分辨率图像合成。在 CVPR, 2021。arXiv:2012.09841。

[48] Noam Elata, Tomer Michaeli, 和 Michael Elad。PSC:基于后验采样的压缩。在第 15 届采样理论与应用国际会议, 2025。

[49] Tongda Xu, Ziran Zhu, Dailan He, Yanghao Li, Lina Guo, Yuanyuan Wang, Zhe Wang, Hongwei Qin, Yan Wang, Jingjing Liu, 和 Ya-Qin Zhang。幂等性与感知图像压缩。在第十二届国际学习表征会议, 2024。

[50] Anle Ke, Xu Zhang, Tong Chen, Ming Lu, Chao Zhou, Jiawen Gu, 和 Zhan Ma。具有语义残差编码和感知压缩扩散的超低速率图像压缩。arXiv 预印本 arXiv:2505.08281, 2025。

[51] Jinpei Guo, Yifei Ji, Zheng Chen, Kai Liu, Min Liu, Wang Rao, Wenbo Li, Yong Guo, 和 Yulun Zhang。Oscar:跨多比特率的单步扩散编解码器。arXiv 预印本 arXiv:2505.16091, 2025。

[52] Naifu Xue, Zhaoyang Jia, Jiahao Li, Bin Li, Yuan Zhang, 和 Yan Lu。基于单步扩散且具有语义蒸馏的图像压缩。在第三十九届神经信息处理系统年会, 2025。

[53] Tianyu Zhang, Xin Luo, Li Li, 和 Dong Liu。Stablecodec:驯服单步扩散以实现极端图像压缩。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 17379–17389 页, 2025 年 10 月。

[54] Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shafiq Joty, 和 Nikhil Naik。使用直接偏好优化对齐扩散模型。在 CVPR, 2024。arXiv:2311.12908。

[55] Kai Yang, Jian Tao, Jiafei Lyu, Chunjiang Ge, Jiaxin Chen, Qimai Li, Weihan Shen, Xiaolong Zhu, 和 Xiu Li。利用人类反馈微调扩散模型,无需任何奖励模型。arXiv 预印本 arXiv:2311.13231, 2023。

[56] Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, 和 Sergey Levine。使用强化学习训练扩散模型。在 ICLR, 2024。arXiv:2305.13301。

[57] Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, 和 Yuxiao Dong。ImageReward:学习和评估文本到图像生成的人类偏好。在 NeurIPS, 2023。arXiv:2304.05977。

[58] Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Wanli Ouyang。Flow-GRPO:通过在线强化学习训练流匹配模型。arXiv 预印本 arXiv:2505.05470, 2025。

[59] Jiaming Song, Chenlin Meng, 和 Stefano Ermon。去噪扩散隐式模型。在 ICLR, 2021。arXiv:2010.02502。

[60] Tim Salimans 和 Jonathan Ho。用于快速采样扩散模型的渐进式蒸馏。在 ICLR, 2022。arXiv:2202.00512。

[61] Yang Song, Prafulla Dhariwal, Mark Chen, 和 Ilya Sutskever。一致性模型。在 ICML, 2023。arXiv:2303.01469。

55

第 56 页

[62] Simian Luo, Yiqin Tan, Longbo Huang, Jian Li, 和 Hang Zhao. 潜在一致性模型:通过少步推理合成高分辨率图像。arXiv 预印本 arXiv:2310.04378,2023。

[63] Xingchao Liu, Xiwen Zhang, Jianzhu Ma, Jian Peng, 和 Qiang Liu. InstaFlow:一步即可实现高质量基于扩散的文本到图像生成。arXiv 预印本 arXiv:2309.06380,2024。

[64] Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T. Freeman, 和 Taesung Park. 一步扩散与分布匹配蒸馏。在 CVPR 上发表,2024。arXiv:2311.18828。

[65] Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T. Freeman. 改进的分布匹配蒸馏用于快速图像合成。在 NeurIPS 上发表,2024。arXiv:2405.14867。

[66] Axel Sauer, Dominik Lorenz, Andreas Blattmann, 和 Robin Rombach. 对抗性扩散蒸馏。arXiv 预印本 arXiv:2311.17042,2023。

[67] Yuxi Ren, Xin Xia, Yanzuo Lu, Jiacheng Zhang, Jie Wu, Pan Xie, Xing Wang, 和 Xuefeng Xiao. Hyper-SD:用于高效图像合成的轨迹分段一致性模型。arXiv 预印本 arXiv:2404.13686,2024。

[68] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, 和 Ilya Sutskever. 从自然语言监督中学习可迁移视觉模型。在 ICML 上发表,2021。arXiv:2103.00020。

[69] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jégou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski. DINOv2:无监督学习鲁棒视觉特征。机器学习研究汇刊 (TMLR),2024。arXiv:2304.07193。

[70] Patrick Esser, Robin Rombach, 和 Bjorn Ommer. 驯化 Transformer 以进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,第 12873–12883 页,2021。

[71] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer. 使用潜在扩散模型进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,第 10684–10695 页,2022。

[72] Yuang Ai, Qihang Fan, Xuefeng Hu, Zhenheng Yang, Ran He, 和 Huaibo Huang. Dico:重振卷积神经网络以实现可扩展且高效的扩散建模。神经信息处理系统进展 (Advances in neural information processing systems),38:123582–123618,2026。

[73] Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, 和 Qi Tian. Deco:用于端到端图像生成的频率解耦像素扩散。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 43600–43610 页,2026。

[74] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang 等。Hunyuanvideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024。

56

第 57 页

[75] Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, 和 Yan Lu。Cod:一种用于图像压缩的扩散基础模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 38420–38429 页,2026 年。

[76] Axel Sauer, Kashyap Chitta, Jens Müller, 和 Andreas Geiger。投影 GAN 收敛更快。神经信息处理系统进展 (Advances in Neural Information Processing Systems), 34:17480–17492, 2021 年。

[77] 学习图像压缩挑战赛。学习与图像压缩研讨会及挑战赛 (CLIC 2020)。CVPR 2020 研讨会,2020 年。URL https://archive.compression.cc/。

[78] Tero Karras, Samuli Laine, 和 Timo Aila。一种用于生成对抗网络的基于风格的生成器架构。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,第 4401–4410 页,2019 年。

[79] Ed Pizzi, Sreya Dutta Roy, Sugosh Nagavara Ravindra, Priya Goyal, 和 Matthijs Douze。一种用于图像复制检测的自监督描述符。CVPR 论文集, 2022 年。

[80] Matthijs Douze, Alexandr Guzhva, Chengqi Deng, Jeff Johnson, Gergely Szilvasy, Pierre-Emmanuel Mazaré, Maria Lomeli, Lucas Hosseini, 和 Hervé Jégou。Faiss 库。2024 年。

[81] Qwen 团队。Qwen3.5:迈向原生多模态Agent,2026 年 2 月。URL https://qwen.ai/blog?id=qwen3.5。

[82] Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin 等。Paddleocr-vl-1.5:迈向鲁棒的野外文档解析多任务 0.9B VLM。arXiv 预印本 arXiv:2601.21957, 2026 年。

[83] Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin, 和 Wenhu Chen。RationalRewards:推理奖励在训练和测试阶段均能扩展视觉生成能力。arXiv 预印本 arXiv:2604.11626, 2026 年。

[84] Dhruba Ghosh, Hannaneh Hajishirzi, 和 Ludwig Schmidt。GenEval:一个以对象为重点的评估文本到图像对齐的框架。神经信息处理系统进展 (NeurIPS), 2023 年。

[85] Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, 和 Gang Yu。Ella:为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135, 2024 年。

[86] Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, 和 Lei Zhang。Tiif-bench:你的 T2I 模型遵循指令的程度如何?arXiv 预印本 arXiv:2506.02161, 2025 年。

[87] Jingjing Chang, Yixiao Fang, Peng Xing, Shuhan Wu, Wei Cheng, Rui Wang, Xianfang Zeng, Gang Yu, 和 Hai-Bao Chen。Oneig-bench:图像生成的全维度细微评估。神经信息处理系统进展 (NeurIPS), 38, 2026 年。

[88] Nikai Du, Zhennan Chen, Zhizhou Chen, Shan Gao, Xi Chen, Zhengkai Jiang, Jian Yang, 和 Ying Tai。Textcrafter:在复杂视觉场景中准确渲染多文本。arXiv 预印本, 第 arXiv–2503 页, 2025 年。

第 58 页

[89] Zigang Geng, Yibing Wang, Yeyao Ma, Chen Li, Yongming Rao, Shuyang Gu, Zhao Zhong, Qinglin Lu, Han Hu, Xiaosong Zhang, 等. X-omni: 强化学习使离散自回归图像生成模型重焕生机. arXiv 预印本 arXiv:2507.22058, 2025.

[90] Yu Gao, Lixue Gong, Qiushan Guo, Xiaoxia Hou, Zhichao Lai, Fanshi Li, Liang Li, Xi- aochen Lian, Chao Liao, Liyang Liu, 等. Seedream 3.0 技术报告. arXiv 预印本 arXiv:2504.11346, 2025.

[91] Kolors Team. Kolors: 用于照片级真实文本到图像合成的扩散模型的有效训练. arXiv 预印本, 2024.

[92] Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu, 等. Emu3: 下一个 token 预测即所需. arXiv 预印本 arXiv:2409.18869, 2024.

[93] Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, 等. Internvl-u: 普及用于理解、推理、生成和编辑的统一多模态模型. arXiv 预印本 arXiv:2603.09877, 2026.

[94] Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang, Liangfu Cao, Pengxin Zhan, Lunhao Duan, Shiyin Lu, Minghao Fu, Xiaohao Chen, Jianshan Zhao, 等. Ovis-u1 技术报告. arXiv 预印本 arXiv:2506.23044, 2025.

[95] Qi Cai, Jingwen Chen, Yang Chen, Yehao Li, Fuchen Long, Yingwei Pan, Zhaofan Qiu, Yiheng Zhang, Fengbin Gao, Peihan Xu, 等. Hidream-i1: 一种具有稀疏扩散 Transformer 的高效图像生成基础模型. arXiv 预印本 arXiv:2505.22705, 2025.

[96] Black Forest Labs. Flux. https://github.com/black-forest-labs/flux, 2024.

[97] Krea AI 和 Black Forest Labs. FLUX.1 Krea [dev]. https://www.krea.ai/blog/ flux-krea-open-source-release, 2025.

[98] Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, 等. Joyai-image: 唤醒统一多模态理解和生成中的空间智能. arXiv 预印本 arXiv:2605.04128, 2026.

[99] Microsoft Lens Team. Lens: 重新思考基础文本到图像模型的训练效率. arXiv 预印本 arXiv:2605.21573, 2026.

[100] Jinheng Xie, Zhenheng Yang, 和 Mike Zheng Shou. Show-o2: 改进的原生统一多模态模型. arXiv 预印本 arXiv:2506.15564, 2025.

[101] James Betker, Gabriel Goh, Li Jing, Tim Brooks, Jianfeng Wang, Linjie Li, Long Ouyang, Juntang Zhuang, Joyce Lee, Yufei Guo, 等. 通过更好的标题改进图像生成. 计算机科学, https: // cdn. openai. com/ papers/ dall-e-3. pdf , 2023.

[102] Midjourney. Midjourney V7. https://www.midjourney.com, 2025.

[103] Yang Ye, Xianyi He, Zongjian Li, Shenghai Yuan, Zhiyuan Yan, Bohan Hou, Li Yuan, 等. Imgedit: 统一的图像编辑数据集和基准. 神经信息处理系统进展, 38, 2026.

[104] Rui Gui, Yang Wan, Haochen Han, Dongxing Mao, Fangming Liu, Min Li, 和 Alex Jinpeng Wang. Texteditbench: 评估超越渲染的感知文本推理的文本编辑. arXiv 预印本 arXiv:2512.16270, 2025.

58

第 59 页

[105] 罗宇轩,张鹏,张鑫杰,郭勋,廉周辉,严璐。SciForma:结构保真的科学图表生成。arXiv 预印本 arXiv:2607.18091,2026。

发表评论