三分钟导读:本文提出SpectraReward,一种无需训练、利用预训练MLLM的图像条件提示词对数似然作为奖励信号的方法,并进一步提出Self-SpectraReward,利用统一多模态模型自身的理解分支作为奖励模型,显著提升了文本生成图像的性能。
英文题目:Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.11886
原始论文:PDF / 论文页面
对应视频标题:读回:利用预训练MLLM的零样本奖励模型提升文本生成图像性能|推荐指数:★★★★★
这篇论文解决什么问题?
现有的文本生成图像(T2I)强化学习依赖昂贵的人类偏好标注或复杂的MLLM奖励模型微调,且直接标量评分或VQA分解方法存在校准敏感、噪声大或工程复杂等问题。
核心创新
- 提出SpectraReward,一种无需偏好标签、无需奖励模型微调的零样本奖励函数,直接复用MLLM的预训练图文对齐能力。
- 提出Self-SpectraReward,利用统一多模态模型自身的理解分支作为奖励模型,消除了对外部奖励模型的依赖,并实现了奖励模型与策略模型之间的分布对齐。
- 揭示了奖励MLLM规模与性能之间的非线性关系,并证明良好的奖励-策略对齐比单纯扩大外部奖励模型规模更有效。
方法概览
SpectraReward通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。Self-SpectraReward是其在统一多模态模型(UMM)中的特例,使用模型自身的理解分支作为奖励模型,实现闭环自我改进。
逐图理解论文
背景:预训练MLLM的潜力

预训练多模态大语言模型(MLLM)具备强大的图文对齐能力,但如何将其转化为高效的零样本奖励信号尚需探索。本文旨在利用预训练MLLM的自然图文对齐能力,提出一种无需偏好标签、无需奖励模型微调的零样本奖励函数,直接复用其预训练能力。
方法:SpectraReward

SpectraReward通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。这种方法避免了直接标量评分的校准敏感性和VQA分解的两阶段管道复杂性。
结果:SpectraReward的性能提升

在512分辨率下,SpectraReward相比BAGEL基线在TIIF-Bench短/长提示词上分别提升+10.0/+6.2,在GenEval上提升+4.3。这表明SpectraReward能够有效利用预训练MLLM的图文对齐能力,显著提升T2I模型的性能。
分析:语义谱的敏感性

图3展示了SpectraReward的token级语义敏感性。对于属性不匹配(如计数错误),负样本主要降低了“Two”的似然;对于对象身份不匹配(如将吉他替换为椅子),负样本 sharply 降低了“guitar”的似然。这表明SpectraReward能够准确捕捉提示词中的显式语义对齐。
局限性:隐含视觉含义的捕捉

SpectraReward主要捕捉提示词中显式的语义对齐,可能低估未直接在文本中表达的隐含视觉含义(如物理常识或世界知识)。此外,它不直接优化美学或安全性等标准,需结合专门的奖励模型。计算奖励时应排除EOS token,以避免其对短提示词奖励的过度影响。
实验与关键结果
- 在两个生成器骨干网络(SD3.5-M, BAGEL)和三个RL算法(AWM, FlowGRPO, DiffusionNFT)上进行广泛实验。
- 测试了来自四个MLLM家族、参数规模从4B到235B的九个奖励MLLM骨干网络。
- 在五个分布外(OOD)文本生成图像基准测试上进行评估:GenEval, TIIF-Bench, DPG-Bench, GenEval2, WISE。
- 在512分辨率下,SpectraReward相比BAGEL基线在TIIF-Bench短/长提示词上分别提升+10.0/+6.2,在GenEval上提升+4.3。(第 7 页)
- Self-SpectraReward在GenEval上达到89.5(512分辨率)和89.8(1024分辨率),优于所有外部MLLM奖励模型及30倍参数量的Qwen3-VL-235B-A22B。(第 8 页)
- Self-SpectraReward在WISE基准上达到0.76(结合self-CoT),优于AlphaGRPO和BAGEL基线。(第 7 页)
- 在TIIF-Bench上,Self-SpectraReward在短提示词上达到85.1,长提示词上达到84.3,优于AlphaGRPO。(第 7 页)
阅读时需要注意
- SpectraReward主要捕捉提示词中显式的语义对齐,可能低估未直接在文本中表达的隐含视觉含义(如物理常识或世界知识)。
- 不直接优化美学或安全性等标准,需结合专门的奖励模型。
- 依赖所选奖励骨干MLLM的视觉理解和推理能力。
- 奖励MLLM的规模扩大并不总是带来单调的性能提升,30B左右的模型可能已足够。
- 预训练阶段的MLLM(如Gemma3-12B-Pretrain)可能比指令微调版本更适合SpectraReward,因为前者更侧重于图文对齐。
- 计算奖励时应排除EOS token,以避免其对短提示词奖励的过度影响。
关联工作
- AlphaGRPO:作为强RL基线进行比较,AlphaGRPO使用分解的可验证奖励(DVReward),而SpectraReward使用提示词似然。(第 7 页)
- BAGEL:作为主要的策略模型(Policy Model)和Self-SpectraReward的基础架构。(第 7 页)
- PromptEcho:并发工作,探索类似的概念,但评估局限于特定领域的T2I骨干网络。(第 3 页)
- SRUM:并发工作,探索UMM内部的自我奖励,但仅局限于UMM内部评估,未与外部奖励模型比较。(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
读回:预训练多模态大语言模型是文本到图像生成的零样本奖励模型
Runhui Huang1 Qihui Zhang3 Zhe Liu1 Yu Gao2 Jie Wu2 Hengshuang Zhao1 1香港大学,2字节跳动 Seed,3北京大学
摘要
在本文中,我们提出了 SpectraReward,这是一种无需训练的奖励函数, 将预训练 MLLM 转化为现成的图像生成强化学习奖励模型。SpectraReward 不要求 MLLM 对生成的图像进行评判或回答分解后的验证问题,而是通过单次图像条件化、教师强制的前向传播,衡量原始提示词从生成图像中恢复的程度。我们使用平均图像条件化提示词对数似然作为奖励,直接复用 MLLM 预训练的图像-文本对齐能力,无需偏好标签或奖励模型微调。我们进一步引入了 Self-SpectraReward,这是统一多模态模型的一个特例,其中策略自身的理解分支形成一个闭环自我改进框架,无需外部奖励模型或外部知识。广泛的实验通过涵盖两种扩散模型、三种强化学习算法、来自四个 MLLM 家族且参数量从 4B 到 235B 的九种奖励 MLLM 骨干网络,以及五个分布外文本到图像基准的广泛图像生成强化学习研究,验证了 SpectraReward 的有效性。结果表明,SpectraReward 和 Self-SpectraReward 均显著且一致地提升了生成性能,并优于先前的基于 MLLM 的奖励训练方法。进一步分析表明,更大的奖励 MLLM 并不总是更好,而 Self-SpectraReward 可以匹配或超越大得多的外部奖励模型,这表明奖励-策略对齐是有效图像生成强化学习的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/
1 引言
近年来,图像生成技术迅速发展,从专门的文本到图像模型 [10, 24] 演进为统一多模态模型 (UMM) [9, 41, 7, 46, 8, 16, 34],后者在单一架构内整合了视觉理解和生成。强化学习作为有效的后训练阶段 [28, 62, 61, 65] 也并行兴起,持续提升了组合保真度和指令遵循能力。然而,强化学习配方成功的关键在于两个互补的支柱。优化算法决定了长周期训练的稳定性,而奖励模型决定了训练策略最终能达到的上限。然而,设计一个既高效又可靠的实用奖励模型仍然具有挑战性。
最近的研究在图像生成的奖励建模方面取得了实质性进展。一条研究路线基于大规模人类偏好标注构建奖励模型,利用这些数据将视觉-文本表示或视觉语言模型与人类判断对齐 [22, 59, 54, 51, 47]。虽然有效,但这些方法依赖于昂贵的标注、困难的数据收集和高昂的迭代成本。另一条研究路线通过复用预训练 MLLM 作为零样本奖励源来绕过偏好训练 [23, 26, 17]。直接标量或基于 logit 的反馈无需训练,但对评判校准和评分噪声敏感 [23, 26]。问题分解流水线改进了
预印本。
第 2 页
(a) 基于语义谱的 SpectraReward (b) 训练动态 (c) 奖励 MLLM 对比
90 BAGEL 7B 89.5 Prompt: A wireless mouse on the bottom of the table is Gemma3 12B-PT Qwen3-VL88.330B-A3B 88.7 smaller than a crimson scarf basking in sunlight on the top. 8B 88 Qwen3-VL87.8 Qwen3-VL86.8235B-A22B Prompt 𝑥 ① ② ③ Gemma387.5 12B Semantic Spectrum GenEval 86 T2I Model InternVL3.584.9 14B InternVL3.584.5 8B BAGEL baseline 84.0 84 Gemma383.6 4B
4B 8B 12B 30B 235B ①Early ②Mid ③Late (d) 定量对比 Wireless mouse ✗ ✓ ✓ TIIFBenchShort Bottom of table ✗ △ ✓ WISE TIIFBenchLong Generated Image ③ 𝑦 ② ①
DPGBench SpectraReward = "#!! ∑"#!%(! 𝑙𝑜𝑔𝑃$(𝑥%&!|𝑥'%, 𝑦) GenEval2
Train Reward GenEval
Figure 1: SpectraReward 概述。(a) 预训练 MLLM 自然地诱导出一个语义谱,用于衡量生成图像与提示词的对齐程度。SpectraReward 将其聚合为 T2I RL 的奖励。(b) 在 RL 训练期间,SpectraReward 稳步增长,同时复杂场景生成出现可见的改进。(c) 我们研究了来自四个 MLLM 家族的九种奖励 MLLM 骨干网络,外部奖励 MLLM 涵盖三个家族,参数量从 4B 到 235B 不等。扩展奖励 MLLM 骨干网络带来非单调的收益。Qwen3-VL-30B-A3B 在外部 MLLM 中表现最佳,而 Self-SpectraReward 利用 BAGEL 自身的理解分支作为奖励模型,优于所有外部 MLLM。(d) 与基线相比,SpectraReward 和 Self-SpectraReward 在所有六个下游基准测试中都带来了显著且一致的改进。
通过逐一验证原子提示词要求来提高可靠性,但引入了巨大的工程复杂性 [17]。这使得为开源图像生成器设计一种高效、无需偏好标签且开箱即用的奖励模型成为未决问题。
我们提出了 SpectraReward,这是一种无需训练的奖励函数,通过复用预训练 MLLM 的图文对齐知识,将其转化为图像生成奖励模型,无需偏好标签或额外训练。给定一张生成图像,SpectraReward 以该图像为条件对冻结的 MLLM 进行推理,并对提示词执行单次教师强制前向传播,产生一个 token 级别的似然分布,反映图像中可读取的每个文本要求的符合程度。我们将此分布称为图文对的语义谱,并使用平均提示词-token 对数似然将其聚合为标量奖励。通过这种方式,SpectraReward 利用模型自身图像条件语言建模目标诱导的提示词似然谱作为确定性的、开箱即用的奖励信号,如图 1 (a) 所示,而不是要求 MLLM 对图像进行判断或回答分解后的问题。
我们进一步在统一多模态模型(UMM)中专门化 SpectraReward,产生了一个我们称为 Self-SpectraReward 的特例。由于 UMM 将图像理解和图像生成整合到单一框架中,其理解分支可以直接为其生成分支提供奖励信号。通过这种方式,模型利用自身的理解能力改进自身的生成,不依赖任何外部模型或外部知识,形成一个闭环自改进框架,其中策略通过利用其自身内在能力进行演化。除了消除外部依赖外,这种设计还具有结构优势。理解分支与生成分支共享相同的分词器、视觉编码器和预训练分布,
因此,其读取图像的方式与生成分支采样图像的分布自然对齐。我们因此假设,这种内在对齐使得策略自身的理解分支成为其自身生成的特别合适的奖励来源。
我们通过一项广泛的图像生成强化学习研究验证了 SpectraReward,该研究涵盖两种扩散模型、三种强化学习训练算法、来自四个 MLLM 家族且参数量从 4B 到 235B 不等的九个奖励 MLLM 骨干网络,并在五个分布外下游文本到图像生成基准上评估了实际泛化能力的提升。在 SD3.5-M [10] 和 BAGEL [9] 上,SpectraReward 在所有下游基准上均带来了显著改进,展示了所提出的提示词似然奖励的泛化能力。以 BAGEL 作为策略模型时,SpectraReward 和 Self-SpectraReward 分别在 TIIF-Bench [48] 上将 BAGEL 基线提升了 +10.0,在 GenEval [13] 上分别提升了 +4.3/5.5。SpectraReward 还
2
第 3 页
在 TIIF-Bench 和 GenEval 上分别取得了 6.3 和 2.1 的提升,优于强大的强化学习基线 AlphaGRPO [17]。此外,与具有相似规模 MLLM 骨干网络的 SpectraReward 相比,Self-SpectraReward 表现出更好的改进效果;与具有最佳 MLLM 骨干网络的 SpectraReward 相比,其性能相当甚至更优,例如在 GenEval 上提升 1.2,在 GenEval2 [21] 上提升 2.1,在 WISE [31] 上提升 2,尽管后者使用的 MLLM 规模分别是前者的 4 倍或 30 倍。这些结果支持了我们的假设:奖励模型与策略之间的分布对齐可能与奖励模型的规模同样重要。本文的贡献总结如下:
• 我们提出了 SpectraReward,这是一种无需训练且开箱即用的奖励函数,可将任何预训练的 MLLM 转化为用于文本到图像生成的奖励模型。通过计算图像条件提示词 token 的似然,SpectraReward 复用了预训练的图像-文本对齐能力,无需偏好标签、奖励模型微调、标量评判或问题分解。
• 我们引入了 Self-SpectraReward,这是一种特殊情况,其中统一多模态模型中策略自身的理解分支充当奖励模型。这形成了一个闭环自我改进框架,无需外部奖励模型或外部知识,模型利用自身的理解能力来提升生成性能。
• 我们进行了一项广泛的图像生成强化学习研究,涵盖两种生成器骨干网络、三种强化学习算法、来自四个 MLLM 家族且参数量在 4B–235B 之间的九种奖励 MLLM 骨干网络,以及五个下游基准测试。结果表明了 SpectraReward 和 Self-SpectraReward 的有效性,并揭示出扩大奖励模型规模带来的收益并非单调递增,且对齐良好的自奖励模型可以匹配甚至超越规模大得多的外部模型。
2 相关工作
图像生成的奖励模型。来自人类反馈的强化学习(RLHF)[32] 是对齐大语言模型(LLMs)[11, 38] 的标准范式,并已通过基于大量人类偏好或提示词-图像对齐数据训练的奖励模型 [59, 60, 22, 59, 30] 适配到文本到图像(T2I)模型 [4] 中。尽管这些奖励模型提供了关键的对齐信号,但其有效性从根本上受到针对独立于文本的美学细节的固有偏差 [1] 的限制。为了克服这些能力限制,第二条研究路线将奖励架构升级为微调的多模态大语言模型(MLLMs),成功提高了性能上限 [60, 51, 14]。然而,这需要大量的标注数据、巨大的训练开销,以及不可避免地偏离 MLLM 预训练知识的分布偏移。最近,一种新兴范式摒弃了偏好标签和奖励模型微调。该方法利用预训练的 MLLMs 作为零样本评判者,能够直接评估图像质量和美学推理 [18, 37]。这些方法通常通过输出直接标量分数,或将生成提示词分解为由 MLLM 回答的可验证原子问题来运作 [17]。虽然并发工作如 PromptEcho [29] 探索了此概念的交叉熵函数,但其评估仅限于特定领域的 T2I 骨干网络。
统一多模态模型中的自奖励机制。自奖励机制利用模型自身的评估来监督其训练,已在 LLM 对齐中显示出显著的有效性 [63, 53, 39]。这一范式自然地扩展到统一多模态模型(UMMs)[42, 58, 52, 64],后者本质上集成了理解和生成能力。随着利用自生成偏好数据和迭代自我进化来对齐多模态模型的更广泛努力 [40, 19],最近的并发研究探索了自奖励与 UMMs 的具体交叉领域:SRUM [20] 引入了来自 UMM 理解分支的全局和局部信号的聚合,而 GvU [33] 则利用理解分支的 token 级 logits 作为密集奖励信号。尽管这些研究与“策略的内部理解可以有效指导其自身生成”的直觉一致,但它们局限于 UMM 内部评估,未能研究这种奖励与外部奖励模型相比的效果。
3 方法
在本节中,我们首先在 3.1 节介绍 SpectraReward 奖励函数。然后在 3.2 节将其专门应用于统一多模态模型,得出 Self-SpectraReward。最后,3.3 节分析了奖励信号的判别特性。图 2 将 SpectraReward 与之前的基于 MLLM 的奖励函数进行了比较。
3
第 4 页
(a) 标量评分 (b) VQA分解 (c) SpectraReward (d) Self-SpectraReward 置信度评分 离散标量评分 平均提示词似然 平均提示词似然
验证器
MLLM UMM MLLM 问题
分解器
密集 似然 信号 ❌ 离散奖励 √ 连续 √ √ 奖励-策略对齐 单次前向 传播 √ 两阶段流水线 ◐ ❌ 强裁判依赖 免训练 √ √ 无需外部模型 分解 瓶颈 ◐ 支持多种 MLLMs √
图 2:基于 MLLM 的奖励函数对比。(a) 标量评分直接要求 MLLM 分配一个离散的图像-文本对齐分数,这使得奖励对裁判校准和评分噪声敏感。(b) VQA 分解将提示词转换为原子问题并聚合验证器置信度,但引入了两阶段流水线并依赖于问题分解的质量。(c) SpectraReward 通过单次教师强制前向传播计算图像条件提示词似然。生成的 token 级似然形成语义谱,其平均值用作标量奖励。(d) Self-SpectraReward 通过在统一多模态模型内使用策略自身的理解分支来实现相同的提示词似然奖励,消除了对外部奖励 MLLM 的需求,并提高了奖励-策略对齐程度。
3.1 SpectraReward
设 $G_\theta$ 为一个文本到图像策略,从提示词 $x = (x_1, \dots, x_T)$ 中采样图像 $y \sim G_\theta(\cdot \mid x)$,并设 $M$ 为冻结的预训练 MLLM。由于预训练 MLLM 已从大规模预训练中学习到强大的图像-文本对齐能力,我们的目标是从预训练 MLLM 中提取一个标量奖励 $R_M(x, y)$,以衡量生成的图像 $y$ 在多大程度上实现了提示词 $x$,同时无需偏好标签、奖励模型微调或其他辅助流水线。
SpectraReward 的核心思想是通过提出一个简单的逆向问题来评估生成的图像:从 $M$ 的角度来看,生成的图像 $y$ 能在多大程度上被翻译回提示词 $x$。为了计算这一点,我们将图像 $y$ 作为视觉条件输入 $M$,然后对提示词 token $x$ 执行单次教师强制前向传播。最终的奖励函数如下:
$$ R_M(x, y) = \frac{1}{T – 1} \sum_{t=1}^{T – 1} \log p_M(x_{t+1} \mid x_{\le t}, y). \quad (1) $$
该奖励是 $M$ 下图像条件提示词对数似然的均值。逐 token 的似然构成了图像-文本对的语义谱,描述了 $y$ 中的视觉证据如何在提示词 token 层面支持 $x$ 的语义。SpectraReward 将此语义谱聚合为一个标量奖励,其中较高的奖励 $R(x, y)$ 表明提示词更易于从图像中预测,且生成的图像更好地支持了提示词的语义内容。
其主要优势在于,该奖励函数直接调用了预训练 MLLM 最基本的功能,即理解图像并将其与相应的语言描述关联起来。因此,SpectraReward 并非训练单独的奖励模型或提示 MLLM 产生抽象的判断分数,而是复用了 MLLM 预训练期间已学到的基本视觉-语言接地能力。
3.2 Self-SpectraReward
当 $G_\theta$ 是一个统一多模态模型时,它包含一个生成分支 $G_{\text{gen}}^\theta$ 和一个理解分支 $G_{\text{und}}^\theta$。Self-SpectraReward 通过使用 $G_{\text{und}}^\theta$ 作为 $G_{\text{gen}}^\theta$ 采样图像的奖励 MLLM 来实例化 SpectraReward。换句话说,该模型通过测量原始提示词在其自身图像条件理解分支下的可能性,对其自身生成的图像进行评分。这形成了一个闭环自我改进框架,其中模型利用自身的理解能力来提高生成质量。此外,这种自我奖励设计消除了对
第 5 页
(a) 属性不匹配 正样本图像 负样本图像 对数似然
-1 𝒓𝒑𝒐𝒔= -1.932
-3 𝒓𝒏𝒆𝒈= -2.298
-5 -5.66
-7.44 -7 pos neg -9 两只猫坐在沙发上。 五只猫坐在沙发上。 两只 猫 坐着 在 一个 沙发上
(b) 物体身份
正样本图像 负样本图像 对数似然
-1.19 -1 𝒓𝒑𝒐𝒔= -2.822 𝒓𝒏𝒆𝒈= -3.891 -3
-5
-7 -9.61 -9 pos neg -11 一把木吉他靠在 一把木椅子靠在 一把 木吉他 靠在 对着 墙 墙上。 墙上。
图 3:SpectraReward 的 token 级语义敏感性。正样本和负样本图像使用相同的正样本提示词进行评估。对于属性不匹配(实例化为计数错误),负样本图像主要降低了“Two”(两)的似然;对于物体身份不匹配,将吉他替换为椅子会显著降低“guitar”(吉他)的似然。条形图显示了图像条件提示-token 的对数似然,误差条基于四对样本计算得出,虚线显示了由此产生的序列级奖励值,即 SpectraReward。
对于外部奖励模型,避免了使用额外的计算资源来服务大规模 MLLM,并简化了强化学习训练流程。
奖励-策略对齐。Self-SpectraReward 耦合了同一统一模型内的两种双重能力。生成分支将文本映射为图像,而奖励函数利用理解分支来衡量生成的图像在多大程度上可以被翻译回原始文本。由于这两个分支共享相同的分词器、视觉编码器和预训练分布,奖励信号与策略自身的生成知识是兼容的。这并不要求理解分支在通用视觉理解方面强于外部 MLLM。相反,它提供了一个与策略自身生成的图像分布更好地校准的奖励信号。因此,使用这种自奖励优化生成分支,鼓励文本到图像的策略与其自身的图像到文本理解能力保持一致。我们在第 4.3 节中进一步分析了奖励-策略对齐效应。
3.3 SpectraReward 分析
在本节中,我们分析三个问题:(1) 语言先验是否影响奖励信号的准确性;(2) token 级似然是否对视觉不对齐敏感;(3) 产生的标量奖励是否能可靠地区分同一提示组内的样本。
语言先验抵消。一个自然的担忧是,公式 1 包含了 MLLM 对提示词的语言先验,因为无论图像如何,某些单词更容易预测。一种可能的修正方法是减去一个仅文本的似然项,从而产生类似 PMI 的奖励 $\log p(x | y) – \log p(x)$。然而,由于我们专注于使用组相对强化学习方法,这种修正是不必要的。对于固定的提示词,仅文本的似然对于同一组中的所有生成图像是共享的,因此在计算组相对优势时会相互抵消。因此,PMI 归一化可能会影响跨提示词的绝对奖励校准,但它不会在每个提示词组内提供额外的优化信号。
Token 级语义敏感性。我们进一步检查语义谱是否响应局部视觉错误。我们为两种常见的提示遵循失败构建了正负样本图像对:属性不匹配和物体身份不匹配。属性不匹配实例化为计数错误,其中提示词要求两只猫,但负样本图像包含五只。对于每一对,我们使用原始正样本提示词评估两张图像。图 3 显示,似然下降集中在不匹配的语义词上。计数不匹配主要降低了“Two”(两)的似然,而将吉他替换为椅子则显著降低了“guitar”(吉他)的似然。
5
第 6 页
较低奖励 较高奖励 提示词
-3.490 -3.233 -3.166 -2.887
矩形吧台位于 三角形茂密 圣诞树的右侧。
-4.530 -4.480 -4.283 -4.089
一张摆拍照片,展示 天蓝色鸢尾花、深红色长号 和芥末色 trifle 碗。
一位身穿红色外套的 大胆乐高海盗 横跨风化木甲板 向远处延伸,在 一片翠绿草地旁投下 阴影,而一个蓝色乐高 人偶静止在架子上。
图 4:SpectraReward 的可视化解释。奖励排名与视觉质量排名一致。
由虚线表示的序列级奖励在正样本图像上也保持较高水平。这表明 token 级别的提示词似然对目标语义错误敏感,其平均值(即 SpectraReward 所使用的计算方式)仍能提供可靠的标量奖励。
奖励排名可靠性。对于基于组的强化学习而言,关键在于奖励是否能正确排序来自同一提示词的不同 rollout。如图 4 所示,SpectraReward 为更符合提示词的图像分配更高的奖励,而为缺失物体、属性错误或空间关系错误的图像分配较低的奖励。这表明图像条件提示词似然为文本到图像强化学习提供了可靠的组间排名信号。
4 实验
4.1 实验设置
我们使用 AWM 作为默认的强化学习算法,遵循第 4.4 节中的优化器消融实验,其中 AWM 在测试的强化学习算法中取得了最佳的整体性能。我们的策略模型是 BAGEL [9],这是一种原生自回归扩散(AR-Diffusion)统一多模态模型,预训练用于图像理解和图像生成。除非另有说明,SpectraReward 使用 Qwen3-VL-30B-A3B [2] 作为奖励 MLLM 骨干网络,而 Self-SpectraReward 使用 BAGEL 自身的理解分支进行奖励计算。
训练设置。我们在训练期间使用 T = 16 个采样步,并从前 10 个去噪步中随机采样 6 个步进行训练。每个训练步使用 32 个提示词,组大小为 G = 16。训练图像分辨率为 512 × 512。我们使用无条件引导尺度(classifier-free guidance scale)为 4,时间步偏移(timestep shift)为 3。学习率为 1e-4。我们在 32 块 A100 GPU 上进行训练,批量大小为 2,梯度累积为 8。总训练步数为 380。其他超参数遵循官方 AWM 实现。我们在 AlphaGRPO20k [17] 上进行训练。
4.2 主要结果
我们在训练过程中使用 SpectraReward 作为代理奖励,并在五个分布外(out-of-distribution)基准上评估生成性能的真实提升。所有下游基准使用不同的评估协议和分布外测试集:GenEval [13]、TIIF-Bench [48]、DPG-Bench [15]、Geneval2 [21] 和 WISE [31]。我们与最先进的仅生成模型(包括 SD3 Medium [10] 和 FLUX.1 dev [24])以及统一多模态模型(如
6
第 7 页
表 1:文本到图像基准上的结果。S 和 L 分别表示短提示词和长提示词。对于 WISE,第二个分数表示使用思维链(CoT)进行评估。AlphaGRPO 在推理文本到图像生成任务上进行训练。粗体表示最佳性能。BAGEL 的结果为复现结果。
| | TIIF Bench ↑ | | | | WISE ↑ | DPGBench ↑ | GenEval ↑ | GenEval2 ↑ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | Model | Basic | | Designer | | Overall | | Score | Soft TIFA | | | S | L | S | L | S | L | S | L | | Generation Only Models | | | | | | | | | | SD3 Medium [10] | 78.3 | 77.8 | 61.5 | 59.6 | 63.2 | 67.3 | 64.8 | 64.8 | 0.4 | 84.1 | 74.0 | 21.3 | | FLUX.1 dev [24] | 83.1 | 78.7 | 65.8 | 68.5 | 70.7 | 71.5 | 71.1 | 71.8 | 0.5 | 83.8 | 82.0 | 21.1 | | Unified Multimodal Models | | | | | | | | | | Show-o [57] | 73.1 | 75.8 | 55.0 | 50.9 | 53.7 | 50.4 | 59.7 | 58.9 | 0.35 | – | 69.0 | – | | JanusPro [7] | 79.3 | 78.3 | 59.7 | 58.8 | 65.8 | 60.3 | 66.5 | 65.0 | 0.35 | 84.2 | 80.0 | – | | Inference on 512 Resolution | | | | | | | | | | BAGEL | 81.7 | 86.1 | 73.7 | 77.6 | 84.7 | 82.1 | 75.2 | 78.6 | – | 85.0 | 84.0 | 23.6 | | AlphaGRPO [17] | 85.5 | 84.2 | 77.4 | 78.9 | 84.3 | 86.6 | 78.9 | 79.5 | – | 86.0 | 85.0 | – | | SpectraReward | 87.7 | 87.4 | 84.9 | 85.4 | 88.1 | 90.3 | 85.2 | 84.8 | – | 88.1 | 88.3 | 31.8 | | Self-SpectraReward | 89.7 | 87.6 | 83.7 | 85.7 | 90.3 | 86.2 | 85.1 | 84.3 | – | 87.7 | 89.5 | 33.9 | | Inference on 1024 Resolution | | | | | | | | | | BAGEL | 83.4 | 83.7 | 75.2 | 76.7 | 79.8 | 73.5 | 76.4 | 76.2 | 0.53/0.70 | 85.1 | 86.6 | 23.5 | | AlphaGRPO [17] | 84.8 | 85.9 | 79.9 | 78.4 | 80.2 | 80.2 | 78.7 | 79.5 | 0.50/0.69 | 85.9 | 87.4 | – | | SpectraReward | 88.4 | 87.3 | 83.2 | 81.8 | 82.5 | 81.0 | 83.3 | 81.7 | 0.53/0.74 | 86.5 | 88.3 | 32.6 | | Self-SpectraReward | 87.4 | 87.6 | 81.5 | 83.2 | 87.7 | 84.7 | 82.7 | 82.5 | 0.52/0.76 | 87.0 | 89.8 | 34.3 |
Show-o [57]、JanusPro [7] 以及我们的基线 BAGEL [9]。我们将方法与 AlphaGRPO [17] 进行比较,后者也使用提出的 MLLM 派生 DVReward 在 Bagel 上应用强化学习训练。
表 1 将 SpectraReward 和 Self-SpectraReward 与代表性的文本到图像生成器及先前的 MLLM 派生奖励训练方法进行了比较。总体而言,SpectraReward 和 Self-SpectraReward 均取得了相当的性能,并在所有评估基准上持续优于 BAGEL 基线和 AlphaGRPO。具体而言,在 512 分辨率下,SpectraReward 在 TIIF-Bench 的整体短/长提示词上分别提升了 +10.0/+6.2,而 Self-SpectraReward 达到了相当的 85.1/84.3,并在 GenEval 上进一步带来了 5.5 的提升。与 AlphaGRPO 相比,SpectraReward 在短/长提示词的 TIIF-Bench 上提升了 +6.3/+5.3,在 GenEval 上提升了 +3.3,而 Self-SpectraReward 分别提升了 +6.2/+4.8 和 +4.5。
与 AlphaGRPO [17] 一致,尽管训练是在 512 分辨率下进行的,但改进也迁移到了 1024 分辨率的推理中。具体而言,Self-SpectraReward 在 GenEval 上达到 89.8,在 GenEval2 上达到 34.3,优于 BAGEL 和 AlphaGRPO。更重要的是,Self-SpectraReward 在基于知识的基准 WISE 上达到了 0.76。这些结果表明,SpectraReward 为文本到图像强化学习提供了比分解式验证更有效的监督信号。
4.3 奖励 MLLM 主干网络的影响
接下来,我们研究 SpectraReward 中不同奖励 MLLM 主干网络的影响,涵盖了不同的家族和规模。表 2 报告了实验结果。
SpectraReward 在扩散模型和奖励 MLLM 家族中表现出一致的改进。在 SD3.5-M [10] 和 BAGEL 上,应用 SpectraReward 均提升了基线,突出了基于标题似然的奖励的架构无关性。在 BAGEL 上,来自不同家族的不同奖励 MLLM,包括 Gemma3 [43]、InternVL3.5 [45] 和 Qwen3-VL [2],均在 TIIF-Bench 上带来了相对于基线的提升。这表明 SpectraReward 可以从多样化的 MLLM 主干网络中提取有用的奖励信号。
Self-SpectraReward 表明奖励-策略对齐可以与外部规模相媲美。使用 BAGEL 自身的理解分支作为奖励 MLLM,Self-SpectraReward 在相似规模的奖励模型中取得了最佳结果,匹配了最强的 30B 级外部奖励,并优于大 30 倍的 MLLM,即 Qwen3-VL-235B-A22B [2]。这表明奖励质量
7
第 8 页
表 2:不同奖励 MLLM 骨干网络的影响。除非另有说明,奖励 MLLM 均使用指令微调模型。粗体表示最佳性能。下划线表示第二佳性能。
| Base Model | Reward MLLM | GenEval↑ | TIIF-Short↑ | TIIF-Long↑ | | :— | :— | :— | :— | :— | | SD3.5-M | – | 79.8 | 74.0 | 73.2 | | SD3.5-M | Qwen3-VL-8B | 85.7 | 84.4 | 84.6 | | BAGEL | – | 84.0 | 75.2 | 78.6 | | BAGEL | Gemma3-4B | 83.6 | 83.1 | 83.0 | | BAGEL | Gemma3-12B-Pretrain | 88.7 | 84.3 | 82.6 | | BAGEL | Gemma3-12B | 87.5 | 82.0 | 82.6 | | BAGEL | InternVL3.5-8B | 84.5 | 80.4 | 80.0 | | BAGEL | InternVL3.5-14B | 84.9 | 78.5 | 79.9 | | BAGEL | Qwen3-VL-8B | 87.8 | 85.0 | 83.8 | | BAGEL | Qwen3-VL-30B-A3B | 88.3 | 85.2 | 84.8 | | BAGEL | Qwen3-VL-235B-A22B | 86.8 | 84.3 | 83.4 | | BAGEL | BAGEL | 89.5 | 85.1 | 84.3 |
表 3:不同强化学习算法和奖励模型的比较。在使用 Self-SpectraReward 进行训练时,AWM 取得了最佳的下游性能。在可比的强化学习训练条件下,Self-SpectraReward 的表现优于先前的奖励模型。粗体表示最佳性能。
| RL Algorithm | Reward Model | GenEval↑ | TIIF-Short↑ | TIIF-Long↑ | | :— | :— | :— | :— | :— | | – | – | – | 84.0 | 75.2 | 78.6 | | AlphaGRPO | HPSv3 | 83.4 | 78.5 | 77.1 | | AlphaGRPO | UnifiedReward | 83.7 | 79.2 | 77.3 | | AlphaGRPO | VIEScore | 81.7 | 79.1 | 77.9 | | AlphaGRPO | DVReward | 85.0 | 78.9 | 79.5 | | AWM | DVReward | 88.0 | 83.3 | 83.7 | | FlowGRPO | Self-SpectraReward | 85.3 | 82.1 | 79.8 | | DiffusionNFT | Self-SpectraReward | 89.1 | 84.8 | 83.5 | | AWM | Self-SpectraReward | 89.5 | 85.1 | 84.3 |
并非仅由规模决定。我们将 Self-SpectraReward 的成功归因于其与策略的分布对齐:Self-SpectraReward 与生成器共享分词器、视觉编码器和预训练分布,因此它读取生成图像的方式与策略采样这些图像的分布自然匹配。
奖励 MLLM 的规模有帮助,但并非单调递增。在 Qwen3-VL 系列中,从 8B 扩展到 30B 改善了所有报告的指标,但进一步扩展到 235B 导致性能明显下降。在 Gemma3 系列中,从 4B 扩展到 12B 改善了 GenEval,但并未一致地改善 TIIF-Bench。我们假设,更大的 MLLM 可能会将更多容量用于高级视觉-语言推理和指令遵循任务,而 SpectraReward 所需的基础图像条件描述能力可能在中等规模下就已经饱和。这些结果表明,30B 的 MLLM 足以释放 SpectraReward 的大部分优势。
预训练阶段的 MLLM 可以作为 SpectraReward 更好的奖励骨干网络。Gemma3-12B-Pretrain 在三个评估基准上均持续优于 Gemma3-12B-Instruct。我们假设,预训练学习了与我们奖励函数紧密匹配的大规模图像-描述和图像-文本对齐目标,而指令微调则强调 SpectraReward 需求不那么直接的高级视觉任务和多任务指令遵循。
4.4 消融实验
强化学习算法的影响。我们在 Self-SpectraReward 设置下比较了三种图像生成强化学习方法:FlowGRPO [28]、AWM [61] 和 DiffusionNFT [65]。表 3 显示,AWM 取得了最佳的总体下游性能,优于基于 SDE 的 FlowGRPO 和 DiffusionNFT。因此,我们在主要实验中应用 AWM。
8
第 9 页
表 4:奖励函数的消融实验。标量评分要求 MLLM 对图像进行 1 到 5 的评分。VQA-Score 询问“该图是否展示了 {caption}?”并使用 P(yes) 作为奖励。
表 5:奖励粒度的消融实验。
Token 级奖励并未始终优于序列级奖励,因此我们默认使用序列级奖励。
| 奖励函数 | GenEval↑ | TIIF-S↑ | TIIF-L↑ | | :— | :— | :— | :— | | – | 84.0 | 75.2 | 78.6 | | 标量评分 (1-5) | 77.7 | 67.5 | 76.0 | | VQA-Score (P (yes)) | 83.1 | 77.4 | 78.9 | | 提示词似然 | 89.5 | 85.1 | 84.3 |
| 方法 | GenEval↑ | TIIF-S↑ | TIIF-L↑ | | :— | :— | :— | :— | | 序列级优势 | 89.5 | 85.1 | 84.3 | | Token 级优势 | 88.4 | 84.9 | 85.1 | | + 组标准差 | 88.5 | 84.0 | 84.8 | | + Token 级标准差 | 88.8 | 84.1 | 82.1 |
| 提示词 | BAGEL | Self-SpectraReward | | :— | :— | :— | | 在这幅展现自然艺术性的宁静画面中,一朵金属玫瑰,其花瓣仍带着盛放的期待,……,高于一朵织物玫瑰完全绽放的华丽姿态,后者虽位置较低,却依然充满活力,编织之美丰富浓郁。 | | 一只猫位于桌子的右侧。 | | 在温暖金色的阳光拥抱中,一个金属金字塔形镇纸,其反射表面投射出耀眼的光芒,在一丛短小的翠绿灌木旁熠熠生辉,…… | | 早期工业革命工厂中劳动者穿着的典型服装 |
图 5:定性比较。
奖励函数的讨论。我们将 SpectraReward 与两种基于 MLLM 的替代奖励函数进行比较,以衡量图像-文本对齐程度。如图 5 所示,第一种是标量评分,它直接要求 MLLM 对图像-文本对齐程度进行 1–5 分的评分。第二种是 VQA-Score,它提出一个是非问题,例如“该图是否展示了 {text}?”,并将“yes” token 的概率作为奖励。表 4 显示,奖励函数对强化学习(RL)性能有巨大影响。标量评分显著降低了所有基准测试的表现,与基线相比,GenEval 下降了 6.3,而 VQA-Score 仅在 TIIF-Bench 上带来轻微提升,未能改善 GenEval。相比之下,SpectraReward 使用的图像条件提示词似然在所有指标上均取得了最佳性能,表明基于似然的奖励是利用 MLLM 进行图像生成强化学习的一种更有效的方式。
序列级与 Token 级优势。我们将默认的序列级优势与 Token 级优势进行比较。前者首先将 Token 对数似然平均为一个序列级奖励,然后计算组相对优势;而后者将每个 Token 位置视为独立的奖励信号,计算 Token 级别的组优势,并将其平均为序列优势。我们测试了 Token 级标准差的三种归一化范围:全局标准差、组内所有文本 Token 的组标准差,以及每个 Token 的标准差。尽管 Token 级优势可以强调具有较大 rollout 差异的视觉 grounding Token,但表 5 显示其相比序列级优势并无明显提升。为了获得更稳定的训练,我们默认使用序列级奖励。
5 结论
我们引入了 SpectraReward,这是一种无需训练的奖励函数,通过测量图像条件提示词似然,将预训练的 MLLM 转化为现成的图像生成强化学习奖励模型。SpectraReward 不依赖大量的偏好标签或奖励模型微调,而是将 MLLM 诱导的 Token 级语义谱聚合为一个简单有效的奖励。针对统一多模态模型,我们进一步引入了 Self-SpectraReward,其中策略自身的理解分支作为其生成分支的奖励模型,形成了一个无需外部奖励模型的闭环自我改进框架。在生成器骨干网络、强化学习算法、奖励 MLLM 骨干网络以及分布外基准测试中,SpectraReward 显著且一致地提升了文本到图像的生成效果,并优于先前的基于 MLLM 的奖励训练方法。结果还表明,更大的奖励 MLLM 并不总是更好,而一个对齐良好的自奖励可以匹配甚至超越大得多的外部奖励模型。这些发现表明,奖励函数和奖励-策略对齐是统一多模态生成中强化学习的关键因素。
9
第 10 页
参考文献
[1] Ying Ba, Tianyu Zhang, Yalong Bai, Wenyi Mo, Tao Liang, Bing Su, 和 Ji-Rong Wen. 提升高质量图像生成的奖励模型:超越文本-图像对齐。 在 IEEE/CVF 国际计算机视觉会议论文集,第 19022– 19031 页,2025.
[2] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, 和 Ke Zhu。Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631,2025.
[3] James Betker, Gabriel Goh, Li Jing, Tim Brooks, Jianfeng Wang, Linjie Li, Long Ouyang, Juntang Zhuang, Joyce Lee, Yufei Guo, 等人。通过更好的描述提升图像生成质量。 OpenAI 博客,2023.
[4] Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, 和 Sergey Levine。使用强化学习训练扩散 模型。arXiv 预印本 arXiv:2305.13301,2023.
[5] Jiuhai Chen, Zhiyang Xu, Xichen Pan, Yushi Hu, Can Qin, Tom Goldstein, Lifu Huang, Tianyi Zhou, Saining Xie, Silvio Savarese, 等人。Blip3-o:一系列完全开放的统一多模态 模型——架构、训练和数据集。arXiv 预印本 arXiv:2505.09568,2025.
[6] Junsong Chen, Chongjian Ge, Enze Xie, Yue Wu, Lewei Yao, Xiaozhe Ren, Zhongdao Wang, Ping Luo, Huchuan Lu, 和 Zhenguo Li。Pixart-σ:用于 4k 文本到图像生成的扩散 变压器的弱到强训练。在欧洲计算机视觉会议, 第 74–91 页。Springer,2024.
[7] Xiaokang Chen, Zhiyu Wu, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, 和 Chong Ruan。Janus-pro:通过数据和模型扩展实现统一的多模态理解与生成。arXiv 预印本 arXiv:2501.17811,2025.
[8] Yufeng Cui, Honghao Chen, Haoge Deng, Xu Huang, Xinghang Li, Jirong Liu, Yang Liu, Zhuoyan Luo, Jinsheng Wang, Wenxuan Wang, 等人。Emu3.5:原生多模态模型是世界学习者。arXiv 预印本 arXiv:2510.26583,2025.
[9] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, 和 Haoqi Fan。统一多模态预训练中的 涌现属性。arXiv 预印本 arXiv:2505.14683,2025.
[10] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, 等人。扩展整流流变换器以实现 高分辨率图像合成。在第四十一届国际机器学习会议,2024.
[11] Chujie Gao, Siyuan Wu, Yue Huang, Dongping Chen, Qihui Zhang, Zhengyan Fu, Yao Wan, Lichao Sun, 和 Xiangliang Zhang。Honestllm:迈向诚实且乐于助人的大型语言 模型。arXiv 预印本 arXiv:2406.00380,2024.
[12] Yuying Ge, Sijie Zhao, Jinguo Zhu, Yixiao Ge, Kun Yi, Lin Song, Chen Li, Xiaohan Ding, 和 Ying Shan。Seed-x:具有统一多粒度理解和生成的多模态模型。arXiv 预印本 arXiv:2404.14396,2024.
[13] Dhruba Ghosh, Hannaneh Hajishirzi, 和 Ludwig Schmidt。Geneval:一个以对象为中心的 框架,用于评估文本到图像的对齐。在第 37 届神经信息处理系统国际会议论文集,第 52132–52152 页,2023.
10
第 11 页
[14] Yuan Gong, Xionghui Wang, Jie Wu, Shiyin Wang, Yitong Wang, 和 Xinglong Wu。Onereward: 通过多任务人类偏好学习实现统一的掩码引导图像生成。arXiv 预印本 arXiv:2508.21066, 2025.
[15] Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, 和 Gang Yu。Ella: 为扩散模型配备大语言模型以增强语义对齐。arXiv 预印本 arXiv:2403.05135, 2024.
[16] Runhui Huang, Chunwei Wang, Junwei Yang, Guansong Lu, Yunlong Yuan, Jianhua Han, Lu Hou, Wei Zhang, Lanqing Hong, Hengshuang Zhao 等人。Illume+: 通过双重视觉标记化和扩散细化照亮统一 MLLM。arXiv 预印本 arXiv:2504.01934, 2025.
[17] Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, 和 Hengshuang Zhao。Alphagrpo: 通过分解可验证奖励解锁统一多模态模型中的自反思多模态生成。在《第 43 届国际机器学习会议 (ICML) 论文集》中, 2026.
[18] Ruixiang Jiang 和 Chang Wen Chen。多模态 LLM 可以进行零样本美学推理。在《第 33 届 ACM 国际多媒体会议论文集》中, 第 6634–6643 页, 2025.
[19] Songtao Jiang, Yan Zhang, Ruizhe Chen, Tianxiang Hu, Yeying Jin, Qinglin He, Yang Feng, Jian Wu, 和 Zuozhu Liu。面向可信 MLLM 对齐的模态公平偏好优化。arXiv 预印本 arXiv:2410.15334, 2024.
[20] Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, 和 Xihui Liu。Srum: 统一多模态模型的细粒度自奖励。arXiv 预印本 arXiv:2510.12784, 2025.
[21] Amita Kamath, Kai-Wei Chang, Ranjay Krishna, Luke Zettlemoyer, Yushi Hu, 和 Marjan Ghazvininejad。Geneval 2: 解决文本到图像评估中的基准漂移。arXiv 预印本 arXiv:2512.16853, 2025.
[22] Yuval Kirstain, Adam Polyak, Uriel Singer, Shahbuland Matiana, Joe Penna, 和 Omer Levy。Pick-a-pic: 一个用于文本到图像生成的用户偏好开放数据集。《神经信息处理系统进展》, 36:36652–36663, 2023.
[23] Max Ku, Dongfu Jiang, Cong Wei, Xiang Yue, 和 Wenhu Chen。Viescore: 迈向条件图像合成评估的可解释指标。在《第 62 届计算语言学协会年会论文集(第 1 卷:长论文)》中, 第 12268–12290 页, 2024.
[24] Black Forest Labs。Flux, 2024。URL https://github.com/black-forest-labs/flux.
[25] Zhimin Li, Jianwei Zhang, Qin Lin, Jiangfeng Xiong, Yanxin Long, Xinchi Deng, Ying-fang Zhang, Xingchao Liu, Minbin Huang, Zedong Xiao 等人。Hunyuan-dit: 一款具有细粒度中文理解能力的强大多分辨率扩散 Transformer。arXiv 预印本 arXiv:2405.08748, 2024.
[26] Zongjian Li, Zheyuan Liu, Qihui Zhang, Bin Lin, Feize Wu, Shenghai Yuan, Zhiyuan Yan, Yang Ye, Wangbo Yu, Yuwei Niu 等人。Uniworld-v2: 通过扩散负感知微调和 MLLM 隐式反馈强化图像编辑。arXiv 预印本 arXiv:2510.16888, 2025.
[27] Bin Lin, Zongjian Li, Xinhua Cheng, Yuwei Niu, Yang Ye, Xianyi He, Shenghai Yuan, Wangbo Yu, Shaodong Wang, Yunyang Ge 等人。Uniworld: 用于统一视觉理解和生成的高分辨率语义编码器。arXiv 预印本 arXiv:2506.03147, 2025.
[28] Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Wanli Ouyang。Flow-grpo: 通过在线强化学习训练流匹配模型。arXiv 预印本 arXiv:2505.05470, 2025.
[29] Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, 和 Pipei Huang。Promptecho: 来自视觉语言模型的无注释奖励,用于文本到图像强化学习。arXiv 预印本 arXiv:2604.12652, 2026.
11
第 12 页
[30] Yuhang Ma, Xiaoshi Wu, Keqiang Sun, 和 Hongsheng Li。Hpsv3:迈向宽谱人类偏好评分。在 IEEE/CVF 国际计算机视觉会议论文集,第 15086–15095 页,2025 年。
[31] Yuwei Niu, Munan Ning, Mengren Zheng, Weiyang Jin, Bin Lin, Peng Jin, Jiaqi Liao, Kunpeng Ning, Chaoran Feng, Bin Zhu, 和 Li Yuan。Wise:面向文本生成图像的世界知识感知语义评估。arXiv 预印本 arXiv:2503.07265,2025 年。
[32] Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray 等。通过人类反馈训练遵循指令的语言模型。神经信息处理系统进展,35:27730–27744,2022 年。
[33] Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, 和 Haifeng Wang。通过理解进行生成:面向统一多模态模型的理解驱动内在奖励。arXiv 预印本 arXiv:2603.06043,2026 年。
[34] Xichen Pan, Satya Narayan Shukla, Aashu Singh, Zhuokai Zhao, Shlok Kumar Mishra, Jialiang Wang, Zhiyang Xu, Jiuhai Chen, Kunpeng Li, Felix Juefei-Xu 等。通过元查询进行模态间迁移。arXiv 预印本 arXiv:2504.06256,2025 年。
[35] Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas Müller, Joe Penna, 和 Robin Rombach。SDXL:改进潜在扩散模型以实现高分辨率图像合成。在 ICLR,2024 年。
[36] Liao Qu, Huichao Zhang, Yiheng Liu, Xu Wang, Yi Jiang, Yiming Gao, Hu Ye, Daniel K Du, Zehuan Yuan, 和 Xinglong Wu。Tokenflow:用于多模态理解与生成的统一图像标记器。在计算机视觉与模式识别会议论文集,第 2545–2555 页,2025 年。
[37] Sheila Schoepp, Masoud Jafaripour, Yingyue Cao, Tianpei Yang, Fatemeh Abdollahi, Shadan Golestan, Zahin Sufiyan, Osmar R Zaiane, 和 Matthew E Taylor。LLM 和 VLM 集成强化学习的演变格局。arXiv 预印本 arXiv:2502.15214,2025 年。
[38] Zhihong Shao 等。Deepseekmath:推动开放语言模型中数学推理的极限。arXiv 预印本 arXiv:2402.03300,2024 年。
[39] Zhiqing Sun, Yikang Shen, Hongxin Zhang, Qinhong Zhou, Zhenfang Chen, David Cox, Yiming Yang, 和 Chuang Gan。Salmon:使用可指令奖励模型进行自对齐。arXiv 预印本 arXiv:2310.05910,2023 年。
[40] Wentao Tan, Qiong Cao, Yibing Zhan, Chao Xue, 和 Changxing Ding。超越人类数据:通过迭代自进化对齐多模态大语言模型。在 AAAI 人工智能会议论文集,第 39 卷,第 7202–7210 页,2025 年。
[41] Chameleon Team。Chameleon:混合模态早期融合基础模型。arXiv 预印本 arXiv:2405.09818,2024 年。
[42] Chameleon Team。Chameleon:混合模态早期融合基础模型。arXiv 预印本 arXiv:2405.09818,2024 年。
[43] Gemma Team。Gemma 3 技术报告,2025 年。
[44] Chunwei Wang, Guansong Lu, Junwei Yang, Runhui Huang, Jianhua Han, Lu Hou, Wei Zhang, 和 Hang Xu。Illume:照亮你的 LLM 以看见、绘制和自我增强。在 IEEE/CVF 国际计算机视觉会议论文集,第 21612–21622 页,2025 年。
[45] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao 等。InternVL3.5:在多用途、推理和效率方面推进开源多模态模型。arXiv 预印本 arXiv:2508.18265,2025 年。
[46] Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu 等。Emu3:下一个标记预测即是你所需的一切。arXiv 预印本 arXiv:2409.18869,2024 年。
12
第 13 页
[47] 王一斌,臧宇航,李浩,金成,王嘉琦。统一的多模态理解与生成奖励模型。arXiv 预印本 arXiv:2503.05236,2025。
[48] 魏新宇,张锦瑞,王泽庆,魏宏阳,郭震,张磊。Tiif-bench:你的文本到图像模型如何遵循你的指令?arXiv 预印本 arXiv:2506.02161,2025。
[49] 吴成岳,陈小康,吴志宇,马一扬,刘兴超,潘子正,刘文,谢振达,于星凯,阮冲,等。Janus:解耦视觉编码以实现统一的多模态理解与生成。在计算机视觉与模式识别会议论文集,第 12966–12977 页,2025。
[50] 吴晨元,郑鹏飞,闫瑞然,肖诗涛,罗鑫,王跃泽,万里,蒋熙彦,刘叶欣,周俊杰,等。Omnigen2:探索高级多模态生成。arXiv 预印本 arXiv:2506.18871,2025。
[51] 吴杰,高宇,叶子路,李明,李亮,郭汉忠,刘杰,薛泽岳,侯晓霞,刘伟,等。Rewarddance:视觉生成中的奖励缩放。arXiv 预印本 arXiv:2509.08826,2025。
[52] 吴胜琼,费浩,屈立刚,纪伟,蔡德胜。Next-gpt:任意到任意的多模态大语言模型。在第四十一届国际机器学习会议,2024。
[53] 吴天浩,袁伟哲,奥尔加·戈洛韦娃,徐静,田远东,焦建涛,杰森·E·韦斯顿,赛恩拜尔·苏赫巴塔尔。元奖励语言模型:利用 LLM 作为元裁判实现自我改进的对齐。在 2025 年自然语言处理实证方法会议论文集,第 11548–11565 页,2025。
[54] 吴晓石,郝一鸣,孙克强,陈一雄,朱峰,赵瑞,李宏胜。Human preference score v2:评估文本到图像合成人类偏好的坚实基准。arXiv 预印本 arXiv:2306.09341,2023。
[55] 吴业成,张卓阳,陈俊宇,唐浩天,李大成,方云浩,朱立恒,谢泽,尹洪旭,李毅,韩松,卢尧。Vila-u:集成视觉理解与生成的统一基础模型。arXiv 预印本 arXiv:2409.04429,2024。URL https://arxiv.org/abs/2409.04429。
[56] 肖诗涛,王跃泽,周俊杰,华英,邢行润,闫瑞然,李超凡,王淑婷,黄铁军,刘正。Omnigen:统一图像生成。在计算机视觉与模式识别会议论文集,第 13294–13304 页,2025。
[57] 谢金恒,毛伟佳,白泽辰,张俊杰,王威浩,林庆宏,顾宇超,陈志杰,杨振恒,邵明正。Show-o:单个转换器统一多模态理解与生成。arXiv 预印本 arXiv:2408.12528,2024。
[58] 谢金恒,毛伟佳,白泽辰,张俊杰,王威浩,林庆宏,顾宇超,陈志杰,杨振恒,邵明正。Show-o:单个转换器统一多模态理解与生成。arXiv 预印本 arXiv:2408.12528,2024。
[59] 徐家祯,刘萧,吴雨辰,童宇轩,李钦凯,丁明,唐杰,董宇晓。Imagereward:学习和评估文本到图像生成的人类偏好。神经信息处理系统进展,36:15903–15935,2023。
[60] 徐家祯,黄宇,程家乐,杨元明,徐家俊,王源,段文博,杨申,金群林,李树润,等。Visionreward:面向图像和视频生成的细粒度多维人类偏好学习。arXiv 预印本 arXiv:2412.21059,2024。
[61] 薛淑辰,葛崇建,张世龙,李一辰,马志明。优势加权匹配:在扩散模型中将强化学习与预训练对齐。arXiv 预印本 arXiv:2509.25050,2025。
13
第 14 页
[62] Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang, 等. Dancegrpo: Unleashing grpo on visual generation. arXiv 预印本 arXiv:2505.07818, 2025.
[63] Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, 和 Jason Weston. Self-rewarding language models. arXiv 预印本 arXiv:2401.10020, 2024.
[64] Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, 等. Unified multimodal understanding and generation models: Advances, challenges, and opportunities. arXiv 预印本 arXiv:2505.02567, 2025.
[65] Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, 和 Ming-Yu Liu. Diffusionnft: Online diffusion reinforcement with forward process. arXiv 预印本 arXiv:2509.16117, 2025.
[66] Chunting Zhou, LILI YU, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, 和 Omer Levy. Transfusion: Predict the next token and diffuse images with one multi-modal model. In The Thirteenth International Conference on Learning Representations, 2024.
14
第 15 页
附录
附录的大纲如下。
• A 局限性与未来工作。我们讨论了基于提示词似然的奖励函数的局限性,包括对多模态大语言模型(MLLM)视觉推理的依赖、隐含的物理与常识含义,以及互补的奖励信号。 • B 其他实现细节,包括奖励提示词格式、[EOS] 掩码处理,以及在 BAGEL 上使用 Self-SpectraReward 时 VAE 特征的使用。 • C 其他实验结果,包括移除 [EOS] 标记的影响,以及在 BAGEL 上奖励计算中使用 VAE 特征的影响。 • D 详细的基准测试结果,包括 GenEval、TIIF-Bench、DPG-Bench 和 WISE 上的类别级结果。 • E 更多可视化结果,包括空间关系、计数、属性绑定、相对大小和长提示词组合方面的定性比较。 • F 更广泛的影响。
A 局限性与未来工作
SpectraReward 依赖于预训练 MLLM 的图像条件提示词似然,因此其奖励质量受限于所选奖励骨干网络的视觉理解和推理能力。由于似然仅针对输入提示词计算,该奖励主要捕捉生成图像与提示词之间的显式语义对齐,而可能低估未在文本中直接表达的隐含视觉含义。例如,“热咖啡”这样的提示词可能通过物理和常识推理暗示蒸汽的存在,但这种隐含含义在原提示词 token 的似然中反映较弱。通过使用拥有丰富世界知识的更强 MLLM 骨干网络,或将 SpectraReward 扩展至推理型文本到图像生成(其中中间推理过程可以使此类隐含需求显式化),可以缓解这一局限性。此外,SpectraReward 并未直接优化美学和安全等标准,这可以通过将其与互补的专业奖励模型相结合来解决。
B 其他实现细节
在使用 SpectraReward 时,我们将生成的图像作为视觉条件,并使用教师强制(teacher forcing)方式评估原始提示词。我们不会添加任何通用前缀来要求奖励 MLLM 描述图像。虽然此类前缀会改变绝对似然值,但它不会显著影响每个提示词组内的相对排名,而相对排名正是组相对强化学习(group-relative RL)所使用的量。因此,我们默认不对所有奖励 MLLM 使用前缀。唯一的例外是 InternVL3.5 系列,我们通过经验发现,添加前缀“Describe the image”能提供更稳定的奖励值。
我们从 SpectraReward 的计算中排除了 [EOS] 标记。[EOS] 的似然通常由序列终止主导,而非图像-文本对齐,并且由于它占平均 token 似然值的很大比例,因此会对短提示词产生不成比例的影响。附录 C 中的消融实验表明,掩码处理 [EOS] 能提高 GenEval 的性能,同时保持 TIIF-Bench 的性能相当。
对于 BAGEL 上的 Self-SpectraReward,我们使用模型自身的理解分支对生成的图像进行评分。BAGEL 包含语义视觉特征和 VAE 特征。默认情况下,我们在 Self-SpectraReward 中包含 VAE 特征,因为消融实验显示它能带来更好的平均性能。我们在附录 C 中讨论了 VAE 输入的影响。
C 其他实验结果
移除 [EOS] 标记的影响。在检查每个 token 的似然分布时,我们发现 [EOS] 标记通常获得的似然值远低于常规提示词 token。由于 SpectraReward 是对 token 对数似然求平均,这种异常低的似然标记会显著
1
第 16 页
表 6:在奖励计算中包含 EOS 标记的影响。
包含 EOS 标记 GenEval↑ TIIF-Short↑ TIIF-Long↑
是 88.5 85.5 84.3 否 89.5 85.1 84.3
表 7:Self-SpectraReward 奖励计算中 VAE 特征的影响。BAGEL 为其理解分支提供两个视觉输入,即来自语义编码器的 ViT 特征和来自生成编码器的 VAE 特征。同时使用这两个输入提高了 GenEval 和 TIIF-Short 的性能。
使用 VAE 输入 GenEval↑ TIIF-Short↑ TIIF-Long↑
否 87.8 83.6 84.7 是 89.5 85.1 84.3
移动最终奖励,尤其是对于短提示词。然而,EOS 仅表示序列终止,并不携带关于图像-文本对齐的语义信息。因此,我们在计算 SpectraReward 时对 EOS 标记进行掩码处理。
VAE 特征对 BAGEL 奖励计算的影响。BAGEL 使用单独的编码器进行生成和理解,即用于理解的 ViT 和用于生成的 VAE,并且可以在进行理解任务时选择性地包含 VAE 特征。在 Self-SpectraReward 中,我们使用 BAGEL 的理解主干网络为生成提供奖励信号。在此,我们对在 Self-SpectraReward 中使用 VAE 特征的效果进行消融实验。表 7 表明,包含 VAE 特征在平均情况下获得了更好的性能,且在 TIIF-Long 基准上的提升更为显著。
D 详细基准结果
本节提供了完整的类别级基准结果,以补充表 1 中的汇总数据。我们详细列出了 GenEval、TIIF-Bench、DPG-Bench 和 WISE 的分解结果,以考察 SpectraReward 带来的增益是集中在单一分数上,还是在不同类型的文本到图像需求中均保持一致。总体而言,详细结果表明,SpectraReward 和 Self-SpectraReward 均在组合生成、细粒度指令遵循和知识驱动生成方面改进了 BAGEL 基线。当在 1024 分辨率下评估同一模型(在 512 分辨率下训练)时,改进依然可见,这表明学到的奖励信号超越了训练采样分辨率。
GenEval。表 8 报告了完整的 GenEval 分解结果。与 BAGEL 和 AlphaGRPO 相比,SpectraReward 和 Self-SpectraReward 在 512 和 1024 推理分辨率下均提高了总体得分。最大的提升出现在更具组合性的类别中,包括计数、空间位置和颜色-属性绑定,其中成功的生成不仅需要物体存在,还需要正确的属性与物体绑定。Self-SpectraReward 在两种分辨率下均取得了最佳总体得分,这表明使用策略模型自身的理解分支作为奖励模型可以为结构化提示词遵循提供特别对齐良好的信号。
TIIF-Bench。表 9 给出了短提示词和长提示词上的完整 TIIF-Bench 结果。TIIF-Bench 将基本遵循、高级遵循和设计导向提示词分开,使其成为超越物体级匹配的任务忠实度压力测试的有效工具。SpectraReward 和 Self-SpectraReward 均在总体短提示词和长提示词得分上大幅改进了 BAGEL 基线和 AlphaGRPO。这种改进体现在基本属性和关系遵循、属性/关系/推理的高级组合以及设计导向的真实世界分割中。文本子类别在绝对数值上仍然具有挑战性,但两种方法相较于 BAGEL 均大幅提高了分数,这表明基于图像条件的提示词似然性即使在细粒度指令细节上也能提供有用的监督。
2
第 17 页
表 8:在 GenEval 基准上对文本到图像生成能力的评估。‘Gen. Only’ 代表图像生成模型,‘Unified’ 代表同时具备理解和生成能力的模型。† 指使用 LLM 重写器的方法。我们的模型结果和 BAGEL 均使用 LLM 重写器。
| Model | Single Obj. | Two Obj. | Counting | Colors | Position | Color Attri. | Overall↑ | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | Gen. Only Models | | | | | | | | | PixArt-α [6] | 98.0 | 50.0 | 44.0 | 80.0 | 8.0 | 7.0 | 48.0 | | Emu3-Gen [46] | 98.0 | 71.0 | 34.0 | 81.0 | 17.0 | 21.0 | 54.0 | | SDXL [35] | 98.0 | 74.0 | 39.0 | 85.0 | 15.0 | 23.0 | 55.0 | | DALL-E 3 [3] | 96.0 | 87.0 | 47.0 | 83.0 | 43.0 | 45.0 | 67.0 | | SD3-Medium [10] | 99.0 | 94.0 | 72.0 | 89.0 | 33.0 | 60.0 | 74.0 | | FLUX.1-dev† [24] | 98.0 | 93.0 | 75.0 | 93.0 | 68.0 | 65.0 | 82.0 | | Unified Models | | | | | | | | | SEED-X [12] | 97.0 | 58.0 | 26.0 | 80.0 | 19.0 | 14.0 | 49.0 | | TokenFlow-XL [36] | 95.0 | 60.0 | 41.0 | 81.0 | 16.0 | 24.0 | 55.0 | | ILLUME [44] | 99.0 | 86.0 | 45.0 | 71.0 | 39.0 | 28.0 | 61.0 | | Transfusion [66] | – | – | – | – | – | – | 63.0 | | Emu3-Gen† [46] | 99.0 | 81.0 | 42.0 | 80.0 | 49.0 | 45.0 | 66.0 | | Show-o [57] | 98.0 | 80.0 | 66.0 | 84.0 | 31.0 | 50.0 | 68.0 | | Janus-Pro-7B [7] | 99.0 | 89.0 | 59.0 | 90.0 | 79.0 | 66.0 | 80.0 | | MetaQuery-XL† [34] | – | – | – | – | – | – | 80.0 | | Inference on 512 resolution | | | | | | | | | BAGEL | 99.1 | 95.0 | 74.1 | 90.4 | 71.0 | 74.8 | 84.0 | | AlphaGRPO† (RT2I) | 98.1 | 95.7 | 82.5 | 91.0 | 74.3 | 68.8 | 85.1 | | AlphaGRPO† | 98.8 | 97.0 | 75.6 | 91.0 | 69.8 | 73.3 | 84.2 | | SpectraReward† | 98.4 | 96.0 | 83.1 | 93.4 | 79.8 | 79.0 | 88.3 | | Self-SpectraReward† | 98.4 | 97.7 | 84.4 | 93.6 | 81.5 | 81.5 | 89.5 | | Inference on 1024 resolution | | | | | | | | | BAGEL | 98.4 | 94.7 | 81.3 | 94.7 | 74.0 | 76.3 | 86.6 | | AlphaGRPO (RT2I) | 98.8 | 95.2 | 82.8 | 93.6 | 76.3 | 77.8 | 87.4 | | AlphaGRPO | 99.1 | 96.0 | 80.3 | 94.7 | 71.0 | 75.5 | 86.1 | | SpectraReward† | 98.1 | 96.2 | 86.2 | 94.2 | 78.5 | 76.8 | 88.3 | | Self-SpectraReward† | 98.4 | 95.2 | 88.8 | 95.7 | 82.3 | 78.3 | 89.8 |
DPG-Bench。表 10 进一步使用 DPG-Bench 的分解类别评估提示遵循能力。由于 BAGEL 在该基准上已经是强大的基线,因此其绝对差距小于 TIIF-Bench 上的差距。尽管如此,SpectraReward 获得了最佳的 512 分辨率总体得分,并改进了全局、关系和其他类别,而 Self-SpectraReward 给出了最强的属性得分。在 1024 分辨率下,Self-SpectraReward 在相比之下基于 BAGEL 的方法中取得了最佳总体得分。这些结果表明,从提示似然中学习到的奖励不仅有助于聚合指令遵循能力,还有助于提升 DPG-Bench 所测量的关系敏感和属性敏感子技能。
WISE。表 11 报告了 WISE 基准,该基准强调文本到图像生成中的世界知识和语义推理。然而,当结合自 CoT(Chain-of-Thought)时,两种方法均明显优于具有相同推理策略的 BAGEL 和 AlphaGRPO。带有自 CoT 的 Self-SpectraReward 达到了最佳的 WISE 总体得分,并改进了多个知识领域,包括空间、生物、物理和化学。这表明 SpectraReward 提升了提示遵循能力,并帮助模型更好地响应 CoT 文本。
E 更多可视化
图 6 提供了同一 rollout 组中奖励排序的更多示例。具有更高 SpectraReward 奖励的样本更好地满足了对象、属性和空间约束,这支持将图像条件提示似然用作组间排序信号。
图 7 提供了 BAGEL 基线与 Self-SpectraReward 之间更多的定性比较。红色文本标记了基线 BAGEL 与我们的模型之间的关键差异,涵盖空间关系、计数、属性绑定、相对大小和对象共存。
3
第 18 页
表 9:专有模型和最先进的开源模型在 TIIF-Bench testmini 子集上的性能。评估的系统分为 (i) 基于扩散的开源模型,(ii) 自回归开源模型,以及 (iii) 专有模型。SpectraReward 和 BAGEL 的结果由 GPT-4.1 进行评估。“Inf. SRR” 表示执行推理时的自我反思优化。
| Model | Overall Avg | Basic Following: Avg | Basic Following: Attribute | Basic Following: Relation | Basic Following: Reasoning | Advanced Following: Avg | Advanced Following: +Relation | Advanced Following: Attribute | Advanced Following: +Reasoning | Advanced Following: Attribute | Advanced Following: +Reasoning | Advanced Following: Relation | Designer: Style | Designer: Text | Designer: World | Designer: Real | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | short | long | | Diffusion based Open-Source Models | | | | | | | | | | | | | | | | | | | | | | | | | FLUX.1 dev | 71.09 | 71.78 | 83.12 | 78.65 | 87.05 | 83.17 | 87.25 | 80.39 | 75.01 | 72.39 | 65.79 | 68.54 | 67.07 | 73.69 | 73.84 | 73.34 | 69.09 | 71.59 | 66.67 | 66.67 | 43.83 | 52.83 | 70.72 | 71.47 | | SD XL | 54.96 | 42.13 | 65.72 | 53.28 | 59.33 | 50.83 | 77.57 | 62.57 | 60.32 | 46.57 | 49.73 | 36.22 | 47.82 | 35.57 | 56.22 | 45.34 | 52.59 | 36.09 | 73.33 | 60.00 | 16.83 | 0.83 | 50.92 | 41.59 | | SD 3 | 67.46 | 66.09 | 78.32 | 77.75 | 83.33 | 79.83 | 82.07 | 78.82 | 71.07 | 74.07 | 61.46 | 59.56 | 61.07 | 64.07 | 68.84 | 70.34 | 50.96 | 57.84 | 66.67 | 76.67 | 59.83 | 20.83 | 63.23 | 67.34 | | SD 3.5 L | 71.15 | 66.96 | 78.34 | 79.56 | 79.50 | 76.50 | 80.96 | 83.21 | 72.46 | 78.71 | 67.67 | 61.18 | 66.46 | 61.89 | 73.53 | 74.15 | 60.03 | 61.53 | 73.33 | 63.33 | 70.52 | 42.52 | 64.43 | 66.39 | | AR based Open-Source Models | | | | | | | | | | | | | | | | | | | | | | | | | Llamagen | 41.67 | 38.22 | 53.00 | 50.00 | 48.33 | 42.33 | 59.57 | 60.32 | 51.07 | 47.32 | 35.89 | 32.61 | 38.82 | 31.57 | 40.84 | 47.22 | 49.59 | 46.22 | 46.67 | 33.33 | 0.00 | 0.00 | 39.73 | 35.62 | | Show-o | 59.72 | 58.86 | 73.08 | 75.83 | 74.83 | 79.83 | 78.82 | 78.32 | 65.57 | 69.32 | 53.67 | 50.38 | 60.95 | 56.82 | 68.59 | 68.96 | 66.46 | 56.22 | 63.33 | 66.67 | 3.83 | 2.83 | 55.02 | 50.92 | | Infinity | 62.07 | 62.32 | 73.08 | 75.41 | 74.33 | 76.83 | 72.82 | 77.57 | 72.07 | 71.82 | 56.64 | 54.98 | 60.44 | 55.57 | 74.22 | 64.71 | 60.22 | 59.71 | 80.00 | 73.33 | 10.83 | 23.83 | 54.28 | 56.89 | | JanusPro | 66.50 | 65.02 | 79.33 | 78.25 | 79.33 | 82.33 | 78.32 | 73.32 | 80.32 | 79.07 | 59.71 | 58.82 | 66.07 | 56.20 | 70.46 | 70.84 | 67.22 | 59.97 | 60.00 | 70.00 | 28.83 | 33.83 | 65.84 | 60.25 | | Inference on 512 resolution | | | | | | | | | | | | | | | | | | | | | | | | | BAGEL | 75.21 | 78.56 | 81.73 | 86.11 | 85.50 | 88.00 | 84.99 | 85.39 | 74.69 | 84.94 | 73.66 | 77.61 | 77.68 | 81.55 | 67.77 | 76.48 | 78.58 | 77.86 | 90.00 | 90.00 | 33.03 | 40.72 | 84.70 | 82.09 | | AlphaGRPO (RT2I) | 78.92 | 79.48 | 85.46 | 84.15 | 88.50 | 85.50 | 88.12 | 86.56 | 79.77 | 80.38 | 77.41 | 78.85 | 81.05 | 82.77 | 74.38 | 80.52 | 79.30 | 75.83 | 90.00 | 83.33 | 44.80 | 53.85 | 84.33 | 86.57 | | AlphaGRPO | 79.05 | 79.50 | 85.56 | 83.32 | 89.50 | 85.50 | 85.34 | 83.60 | 81.86 | 80.86 | 77.12 | 79.87 | 78.59 | 83.95 | 71.81 | 78.94 | 83.02 | 79.36 | 86.67 | 93.33 | 51.13 | 45.25 | 83.58 | 84.70 | | SpectraReward | 85.23 | 84.81 | 87.67 | 87.44 | 90.00 | 90.50 | 88.12 | 89.45 | 84.90 | 82.38 | 84.85 | 85.39 | 84.34 | 87.52 | 84.99 | 84.95 | 86.41 | 86.02 | 93.33 | 93.33 | 66.97 | 58.82 | 88.06 | 90.30 | | Self-SpectraReward | 85.13 | 84.33 | 89.69 | 87.58 | 88.00 | 92.00 | 93.56 | 87.37 | 87.50 | 83.38 | 83.73 | 85.70 | 85.17 | 86.63 | 83.05 | 90.72 | 84.65 | 82.38 | 93.33 | 93.33 | 60.63 | 57.01 | 90.30 | 86.19 | | Inference on 1024 resolution | | | | | | | | | | | | | | | | | | | | | | | | | BAGEL | 76.42 | 76.15 | 83.44 | 83.72 | 87.50 | 89.00 | 86.03 | 84.35 | 76.77 | 77.81 | 75.16 | 76.68 | 79.34 | 83.12 | 70.38 | 74.58 | 78.36 | 75.58 | 93.33 | 86.67 | 36.20 | 40.72 | 79.85 | 73.51 | | AlphaGRPO (RT2I) | 78.70 | 79.48 | 84.83 | 85.92 | 89.00 | 89.50 | 88.81 | 88.36 | 76.69 | 79.89 | 78.42 | 79.21 | 79.38 | 84.09 | 77.48 | 77.37 | 81.05 | 78.84 | 90.00 | 90.00 | 45.70 | 47.06 | 80.22 | 80.22 | | AlphaGRPO | 77.74 | 78.09 | 85.39 | 82.90 | 89.00 | 89.50 | 87.31 | 82.96 | 79.85 | 76.25 | 75.62 | 77.49 | 79.46 | 83.32 | 73.28 | 76.13 | 76.48 | 75.56 | 90.00 | 90.00 | 42.53 | 44.80 | 81.72 | 84.33 | | SpectraReward | 83.31 | 81.71 | 88.44 | 87.26 | 91.50 | 92.00 | 88.81 | 88.81 | 85.02 | 80.98 | 83.18 | 81.83 | 87.89 | 85.41 | 81.67 | 82.23 | 81.97 | 80.23 | 86.67 | 90.00 | 63.80 | 54.75 | 82.46 | 80.97 | | Self-SpectraReward | 82.66 | 82.54 | 87.38 | 87.60 | 90.50 | 93.00 | 89.80 | 85.68 | 81.86 | 84.10 | 81.49 | 83.15 | 84.33 | 83.39 | 80.88 | 84.25 | 81.16 | 84.71 | 86.67 | 83.33 | 61.09 | 59.73 | 87.69 | 84.70 |
在长提示词的情况下,在这些案例中,Self-SpectraReward 更经常地保留对象之间请求的关系,同时保持主要视觉内容可识别。例如,它将玩具车放置在建模粘土上,并将笔与织物毯子分开。这些例子通过表明学习的奖励提高了细粒度提示词接地(prompt grounding)能力,而不仅仅是全局图像质量,从而支持了指令遵循基准中的定量增益。
F 更广泛的影响
SpectraReward 通过重用冻结的预训练 MLLM 来降低图像生成强化学习中奖励信号构建的成本,无需偏好标注或奖励模型微调。这可能使文本到图像生成的强化学习对标注或训练资源有限的研究人员更加容易获取,并支持关于提示词遵循、组合生成和统一多模态自我改进的研究。
同时,图像生成更容易的强化学习优化可能会放大文本到图像模型现有的风险。更强的提示词遵循能力可能被滥用于生成误导性视觉内容、模仿受保护的风格或产生不安全图像。由于 SpectraReward 从预训练 MLLM 派生奖励,它可能在策略优化过程中继承奖励 MLLM 主干的潜在偏见和视觉误判。对于 Self-SpectraReward,闭环奖励进一步鼓励模型与其自身的理解分支对齐,而这并不总是反映人类偏好或安全要求。因此,我们建议在部署或发布使用此奖励训练的模型时,将 SpectraReward 与标准安全过滤器、偏见审计和人工评估结合使用。
4
第 19 页
奖励较低 奖励较高 提示词
-3.490 -3.464 -3.314 -2.994 一个球形时钟位于 一个锥形时钟前方,部分 遮挡了它。一个立方体时钟位于 侧面且完全可见。
-3.362 -3.041 -2.780 -2.664
三只兔子,两顶草帽, 和四棵松树。
一颗深红色的泪滴无花果静置 -4.458 -4.403 -4.309 -4.281 在一个光滑的象牙色基座上,投射出 不显眼的阴影,落在正位于其 右侧的一条淡青色鱼身上,所有物体 都沐浴在透过大窗户射入的 金色午后阳光中,窗外是 柏树。
-3.314 -3.028 -2.823 -2.815 一个圆柱形笼子是红色的。 一个球形石头是灰色的。 一个矩形瓷砖是蓝色的。 一个锥形碎片是红色的。
图 6:额外的奖励排序示例。对于每个提示词,样本按从低到高的 SpectraReward 奖励进行排序。
5
第 20 页
表 10:在 DPG-Bench [15] 基准上对文本到图像生成能力的评估。* 表示我们复现的结果。
| 方法 | 全局↑ | 实体↑ | 属性↑ | 关系↑ | 其他↑ | 总体↑ | | :— | :— | :— | :— | :— | :— | :— | | 仅生成模型 | | | | | | | | Hunyuan-DiT [25] | 84.59 | 80.59 | 88.01 | 74.36 | 86.41 | 78.87 | | PixArt-Σ [6] | 86.89 | 82.89 | 88.94 | 86.59 | 87.68 | 80.54 | | DALLE3 [3] | 90.97 | 89.61 | 88.39 | 90.58 | 89.83 | 83.50 | | SD3-medium [10] | 87.90 | 91.01 | 88.83 | 80.70 | 88.68 | 84.08 | | FLUX.1-dev [24] | 82.10 | 89.50 | 88.70 | 91.10 | 89.40 | 84.00 | | OmniGen [56] | 87.90 | 88.97 | 88.47 | 87.95 | 83.56 | 81.16 | | 统一多模态模型 | | | | | | | | Show-o [57] | 79.33 | 75.44 | 78.02 | 84.45 | 60.80 | 67.27 | | EMU3 [46] | 85.21 | 86.68 | 86.84 | 90.22 | 83.15 | 80.60 | | TokenFlow-XL [36] | 78.72 | 79.22 | 81.29 | 85.22 | 71.20 | 73.38 | | Janus [49] | 82.33 | 87.38 | 87.70 | 85.46 | 86.41 | 79.68 | | Janus Pro [7] | 86.90 | 88.90 | 89.40 | 89.32 | 89.48 | 84.19 | | BLIP3-o 4B [5] | – | – | – | – | – | 79.36 | | BLIP3-o 8B [5] | – | – | – | – | – | 81.60 | | BAGEL [9] | 88.94 | 90.37 | 91.29 | 90.82 | 88.67 | 85.07 | | UniWorld-V1 [27] | 83.64 | 88.39 | 88.44 | 89.27 | 87.22 | 81.38 | | OmniGen2 [50] | 88.81 | 88.83 | 90.18 | 89.37 | 90.27 | 83.57 | | 在 512 分辨率下推理 | | | | | | | | BAGEL* | 88.94 | 90.37 | 91.29 | 90.82 | 88.67 | 85.07 | | AlphaGRPO (RT2I) | 89.99 | 92.20 | 88.49 | 90.89 | 89.12 | 85.98 | | AlphaGRPO | 84.99 | 90.93 | 91.22 | 92.51 | 90.11 | 86.25 | | SpectraReward | 93.80 | 92.17 | 90.78 | 92.95 | 93.08 | 88.08 | | Self-SpectraReward | 92.40 | 91.94 | 92.12 | 92.77 | 88.57 | 87.73 | | 在 1024 分辨率下推理 | | | | | | | | BAGEL* | 87.42 | 92.46 | 90.75 | 91.92 | 84.96 | 85.17 | | AlphaGRPO (RT2I) | 87.42 | 92.46 | 90.75 | 91.92 | 84.96 | 85.87 | | AlphaGRPO | 89.21 | 89.43 | 90.20 | 92.26 | 90.39 | 85.08 | | SpectraReward | 85.54 | 91.95 | 92.67 | 91.27 | 89.14 | 86.46 | | Self-SpectraReward | 85.33 | 91.23 | 93.14 | 89.97 | 92.06 | 86.97 |
6
第 21 页
表 11:WISE 上世界知识推理能力的对比。WISE 考察了文本到图像(T2I)生成中的复杂语义理解和世界知识。‘Gen. Only’ 代表图像生成模型,‘Unified’ 代表同时具备理解和生成能力的模型。
类型 模型 文化 时间 空间 生物 物理 化学 总体↑
SDXL [35] 0.43 0.48 0.47 0.44 0.45 0.27 0.43 仅生成 SD3.5-large [10] 0.44 0.50 0.58 0.44 0.52 0.31 0.46 生成 PixArt-Alpha [6] 0.45 0.50 0.48 0.49 0.56 0.34 0.47
FLUX.1-dev [24] 0.48 0.58 0.62 0.42 0.51 0.35 0.50
Janus [49] 0.16 0.26 0.35 0.28 0.30 0.14 0.23
VILA-U [55] 0.26 0.33 0.37 0.35 0.39 0.23 0.31
Show-o-512 [57] 0.28 0.40 0.48 0.30 0.46 0.30 0.35
Janus-Pro-7B [7] 0.30 0.37 0.49 0.36 0.42 0.26 0.35 统一 Emu3MetaQuery-XL[46] [34] 0.34 0.56 0.45 0.55 0.48 0.62 0.41 0.49 0.45 0.63 0.27 0.41 0.39 0.55
BAGEL [9] 0.44 0.55 0.68 0.44 0.60 0.39 0.52
BAGEL w/ Self-CoT [9] 0.76 0.69 0.75 0.65 0.75 0.58 0.70
AlphaGRPO 0.44 0.55 0.64 0.46 0.62 0.46 0.53
AlphaGRPO w/ Self-CoT 0.75 0.70 0.74 0.66 0.77 0.64 0.71
SpectraReward 0.42 0.51 0.67 0.48 0.65 0.47 0.53
SpectraReward w/ Self-CoT 0.76 0.70 0.80 0.72 0.80 0.65 0.74
Self-SpectraReward 0.40 0.53 0.67 0.43 0.64 0.45 0.52
Self-SpectraReward w/ Self-CoT 0.75 0.71 0.82 0.73 0.84 0.69 0.76
7
第 22 页
提示词 BAGEL Self-SpectraReward 提示词 BAGEL Self-SpectraReward
A minimalist 3D illustration of a featuring rounded edges smooth, soft forms with geometry. Thetoilet soft beige,and light gray, and orange,simplified with orange usedcolor focal includeselements. The consists of gradients with smoothwarm transitions, foravoidingpalette harsh shadows shadingor highlights. The warmsoftlighting soft and diffused, coming above slightly to
右侧,带有微妙的阴影。从光滑的哑光表面反射,避免光泽感。一只猴子在企鹅后面,没有阴影。呈现为单一表面,以隔离方式展示,带有充足的负空间,略微倾斜,以提供轻微的深度感,没有极端的深度。背景是柔和的纯色,三种颜色。
维度对象 互补 该 对象 而 不分散注意力。 极简主义, 无衬 线体 排版 放置 在 左下角 带有 小型、 文本 灰色, 低对比度 在 背景中。 该 风格 是 3D 渲染 带有 简化、 低多边形美学, 角落渲染 形式 和 颜色 微妙 纹理 或 专注于 复杂性。
一个带有坚固皮革背带的黑色背包放在木制长椅上。 背包略微打开,露出里面的一本红色笔记本。在背包下方,一只灰色的虎斑猫 一辆紫色汽车上有一只熊 坐在地上。阳光透过树叶洒下斑驳的光影。猫的尾巴卷曲在它的 五个条纹玩具的右侧 身体周围。长椅位于一个草地公园中, 附近树木间过滤下来的斑驳光线。场景以逼真的摄影风格渲染,捕捉 皮革、木材和毛皮的纹理,细节栩栩如生。
闪闪发光的金属叉子,其抛光的叉齿 捕捉环境光的闪烁,优雅地矗立 一把闪亮的椅子前面 在草丛中,其精致的触须 在
随着每一阵低语的微风轻轻摇曳,形成了 与餐具的僵硬刚性和闪烁魅力形成鲜明对比的 温柔背景。
一辆小玩具车坐在 金属笔位于织物毯子的右侧。 一块模型粘土上
一个极简风格的咖啡店标志,包含 新月 和 冒着热气的 咖啡 杯,整体风格 简洁、现代,采用柔和的大地色调,如 米色、暖棕色和深蓝色,单词 'Moonbrew' 清晰可见并融入 设计中,适合黑白印刷
右侧,一只兔子坐在树桩上,而另一只兔子 木花比木树更高 站在树桩外。
在画作所描绘的生动场景左侧, 两艘庄严的船只,风帆鼓胀,仿佛在低语 无尽海洋的故事,庄严地漂浮着;旁边, 两匹高贵的马站立着,带着 王室的优雅,肌肉紧绷,眼中 闪烁着无尽史诗旅程的故事。 与此同时,三只虾,装饰着随着 夕阳反射光线而闪烁的色彩,两只多汁的 梨,表皮闪烁着诱人的光泽,营造出 自然与人类的和谐平衡,共同 在这件艺术杰作中编织出一幅错综复杂的挂毯。
一台平板电视安装在纯白的墙上。电视 拥有时尚的黑色边框和光滑的屏幕,反射着柔和的
在一幅由两台相机精心捕捉的如画场景中,四只猫,放置在木质桌子上。电视右侧是一台打开的银色笔记本电脑,显示着一个带有中性背景的明亮屏幕。书桌表面光滑、抛光,笔记本电脑的键盘略微朝向观看者倾斜。场景由从附近窗户射入的自然光照亮,
投射 微妙的阴影。整体风格高度写实,在 纹理、光照和比例方面具有 摄影级的细节关注。
图 7:额外的定性比较。红色文本突出了对空间关系、计数、属性绑定或长提示词组合特别敏感的提示词约束。与 BAGEL 基线相比,Self-SpectraReward 更一致地满足了这些高亮显示的约束。
8