读回:利用预训练MLLM的零样本奖励模型提升文本生成图像性能

方法:SpectraReward

本文提出SpectraReward,一种无需训练、利用预训练多模态大语言模型(MLLM)的图像条件提示词对数似然作为奖励信号的方法。通过冻结的预训练MLLM对生成图像进行条件化,并执行单次教师强制前向传播计算提示词token级别的似然分布(语义谱),取其平均对数似然作为标量奖励。Self-SpectraReward是其在统一多模态模型(UMM)中的特例,使用模型自身的理解分支作为奖励模型,实现闭环自我改进。实验表明,该方法在GenEval、TIIF-Bench等基准上显著优于基线,且奖励MLLM的规模扩大并不总是带来单调的性能提升,30B左右的模型可能已足够。