探索还是收敛?SGPO如何用分阶段策略破解扩散模型RL微调的奖励黑客难题

快速导读:提出SGPO框架,通过感知扩散生成过程中的语义变化和信噪比,自适应地将RL优化划分为混沌逃离、带探索的偏好优化和稳定收敛三个阶段,以缓解奖励黑客问题并提升生成质量与多样性。

扩散模型在文本到图像生成中表现优异,但其最大似然训练目标难以直接对齐人类偏好。强化学习(RL)提供了一条有效的偏好对齐路径,然而扩散模型的去噪过程天然存在奖励稀疏问题——奖励信号只能在最终图像生成后获得。现有方法通常将最终奖励直接反向传播到所有去噪步骤,这一做法隐含地假设了每个去噪阶段在优化上是等价的。

本文提出的SGPO框架挑战了这一假设。作者通过实验观察到,扩散模型的去噪过程呈现出明显的阶段性动态:早期步骤处于混沌状态,语义结构尚未形成;中间阶段语义结构趋于稳定,是偏好优化的关键窗口;后期阶段结构已收敛,继续施加偏好优化反而容易导致过拟合。基于这一洞察,SGPO设计了三个差异化的优化目标,分别对应混沌逃离、带探索的偏好优化和稳定收敛,从而在提升偏好奖励的同时有效抑制了奖励黑客现象。

英文题目:Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

论文出处:arXiv 每日论文精选 · arXiv:2608.06768

原始论文:PDF / 论文页面

这篇论文解决什么问题?

奖励黑客是RL微调扩散模型的核心挑战之一。当优化目标仅为最终奖励分数时,模型可能通过非预期的捷径来最大化奖励,而非真正提升生成质量。例如,模型可能生成纹理过度复杂但语义空洞的图像来欺骗美学评分器,或者牺牲多样性来反复生成少数高分模式。

现有方法如DDPO将扩散去噪过程建模为马尔可夫决策过程(MDP),并使用PPO进行策略优化。DPOK和D3PO等后续工作在此基础上进行了改进,但都沿用了将最终奖励回填至所有时间步的策略。TDPO从归纳偏差和首因偏差的角度尝试解决过度优化问题,但本文的实验表明,TDPO在奖励提升过程中反而导致了严重的图文不对齐,即典型的奖励黑客表现。

问题的根源在于时序目标错配。扩散模型的早期去噪步骤主要负责从纯噪声中逐步构建语义结构,此时施加偏好奖励信号不仅无效,还可能干扰正常的生成动态。相反,后期步骤的语义结构已经高度确定,继续优化偏好奖励容易导致对奖励函数的过拟合。真正有效的偏好优化窗口应该位于语义结构稳定但尚未完全收敛的中间阶段。

本文通过可视化相邻潜变量间的语义变化(Δ CLIP)和信噪比(SNR)随去噪步骤的演变,清晰地揭示了这三个阶段的存在。这一观察构成了SGPO框架设计的经验基础。

核心创新

  • 提出一个阶段感知的RL框架,显式建模扩散模型的阶段式生成动态,打破了统一优化的范式。
  • 设计了一种基于语义变化(ΔE(t))和信噪比(SNR)二阶导数的自适应阶段切换机制。
  • 为不同生成阶段设计了差异化的优化目标,将偏好奖励优化限制在动作-奖励相关性强的中间阶段,并在早期和晚期分别采用逃离混沌和稳定收敛的策略。

方法概览

提出分阶段引导的逐步优化框架(SGPO)。通过实时监测相邻潜变量间的语义变化(Δ CLIP)和信噪比(SNR)来感知生成阶段,将去噪过程自适应地划分为三个阶段:混沌阶段(Stage I)、结构稳定阶段(Stage II)和结构收敛阶段(Stage III)。为每个阶段设计特定的优化目标:Stage I通过最大化与初始噪声的距离来加速逃离混沌;Stage II优化偏好奖励并引入由ΔE(t)调制的探索项以保持多样性;Stage III通过最小化与预训练模型输出的差异来鼓励稳定收敛,防止过拟合。

  • 阶段感知机制:SGPO通过实时监测相邻时间步潜变量之间的CLIP语义相似度变化量(Δ CLIP)和信噪比(SNR)来感知当前所处的生成阶段。当Δ CLIP较大时,表明语义结构正在快速演变;当Δ CLIP趋于平稳时,表明语义结构已基本稳定。
  • 三阶段划分策略:基于Δ CLIP和SNR的二阶导数,SGPO将去噪过程自适应地划分为三个阶段——Stage I(混沌阶段):语义结构尚未形成,Δ CLIP波动剧烈;Stage II(结构稳定阶段):语义结构基本确定,Δ CLIP趋于平稳但仍有小幅变化;Stage III(结构收敛阶段):语义结构高度收敛,Δ CLIP接近零。
  • Stage I优化目标——混沌逃离:在早期混沌阶段,SGPO不施加偏好奖励优化,而是通过最大化当前潜变量与初始噪声之间的距离来加速逃离混沌状态。这一设计避免了在语义结构尚未形成时引入无意义的奖励信号。
  • Stage II优化目标——带探索的偏好优化:在结构稳定的中间阶段,SGPO优化偏好奖励,同时引入由ΔE(t)调制的探索项。ΔE(t)反映了当前步骤的语义演变速率,当演变较快时给予更大的探索权重,以保持生成多样性。这一设计将偏好优化限制在动作-奖励相关性最强的窗口内。
  • Stage III优化目标——稳定收敛:在后期收敛阶段,SGPO通过最小化当前策略与预训练模型输出之间的KL散度来鼓励稳定收敛,防止对奖励函数的过度优化。这一设计有效抑制了后期阶段的奖励黑客行为。
  • 与统一优化范式的对比:传统方法将最终奖励回填至所有步骤,相当于对所有阶段施加相同的优化压力。SGPO的关键创新在于识别出不同阶段对偏好优化的敏感度不同,并据此设计了差异化的优化策略。
  • 框架的通用性:SGPO的阶段感知机制不依赖于特定的扩散模型架构或RL算法,可以灵活地与SDE-based扩散模型(如Stable Diffusion系列)和Flow-matching-based扩散模型(如SD3.5、FLUX)结合使用。
  • 实现细节:SGPO在单个节点上使用8块NVIDIA Tesla H20 GPU进行训练。阶段切换阈值通过Δ CLIP和SNR的统计特性自适应确定,无需手动调参。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 14: Visual Impression of Reward Hacking. With sim- ilar reward scores, the generated images can still be diver- sified and aligned (Ours), while the reward hacking leads to over-fitting and significantly undermines the semantic information and diversity (TDPO).

我们来看一个典型现象:用TDPO这类方法优化美学分数时,奖励确实在涨,但生成的图像却逐渐变得千篇一律,甚至出现图文完全不对齐的情况。这就是典型的奖励黑客——模型找到了欺骗评分器的捷径,却没有真正学会生成好图像。问题出在哪?扩散模型的去噪过程并不是均匀的。早期步骤还在混沌中摸索,语义结构根本没形成,这时候硬塞一个偏好奖励信号,不仅没用,反而会干扰正常的生成节奏。

核心洞察与研究空白

核心洞察与研究空白
Figure 1: Motivation. We visualize adaptive semantic changes (Δ CLIP) between adjacent latents and step-wise signal-to- noise ratio (SNR) during denoising, revealing three adaptive stages: chaotic, structure-stable, and structure-convergent.

该图可视化了去噪过程中相邻潜变量间的语义变化(Δ CLIP)和信噪比(SNR)随步骤的演变。可以清晰观察到三个阶段:早期Δ CLIP波动剧烈(混沌阶段),中期趋于平稳(结构稳定阶段),后期接近零(结构收敛阶段)。这一观察是SGPO阶段划分的经验基础。

方法贡献与验证思路

方法贡献与验证思路
Figure 2: Framework of SGPO. As illustrated, RL training is adaptively stage-scheduled via continuous sensing of stage-wise semantic evolution to align with diffusion generation requirements.

该图展示了SGPO的完整框架。RL训练通过持续感知阶段式语义演变来自适应调度,三个阶段的优化目标各不相同:Stage I加速逃离混沌,Stage II进行带探索的偏好优化,Stage III鼓励稳定收敛。

核心结论

核心结论
Table 1: Reward Hacking Evaluations with Fixed Target Reward and Multiple Cross-Metrics (12 in total). All metrics are obtained with Aesthetic Score (AES) as the targeted reward. Bold indicates the best performance, underlining indicates the second best, and gray entries denote the backbone references that are excluded from comparison. At matched AES, our method consistently outperforms others in Fidelity, Diversity, and Richness, indicating that it is not overly hacked by targeted reward.

该表展示了固定目标奖励(AES)下的多指标评估结果。在匹配的AES分数下,SGPO在FID、LPIPS、IS等12个指标中取得七项最优,表明其在保持偏好对齐的同时,并未牺牲生成质量和多样性,有效缓解了奖励黑客。

价值与局限

价值与局限
Figure 10: Evaluation on reward hacking with multi- intensities of Target Reward (AES).

SGPO的意义在于,它第一次把扩散模型的阶段性动态显式地纳入了RL优化框架,打破了所有步骤一视同仁的惯性思维。这对任何需要做偏好对齐的生成任务都有启发。不过也要诚实地说,当目标奖励被推到极高时,SGPO仍然会出现轻微的性能退化,说明阶段感知策略并不能完全消灭过度优化,只是大幅提高了它的阈值。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 数据集:在HPSv2、Pick-a-Pic、GenEval和Simple Animals四个数据集上进行偏好优化实验,覆盖了多样化的提示词分布和评估场景。
  • 基线方法:与DDPO、DPOK、D3PO、TDPO、DenseReward(DR)、B2DiffusionRL(B2Diff)等SDE-based扩散模型RL方法对比;同时与Flow-GRPO、DDPO、D3PO、Diffusion-DPO等Flow-matching-based方法对比。
  • 评估指标:采用固定目标奖励下的多指标评估体系,包括FID、LPIPS、IS、TCE、BRI、NIQE、SE等12个跨维度指标,全面衡量生成质量、多样性和语义丰富度。
  • 奖励黑客评估:通过固定目标奖励(AES)下的多指标对比,以及多强度目标奖励下的鲁棒性分析,系统验证SGPO缓解奖励黑客的效果。
  • 消融实验:对Stage I的混沌逃离、Stage II的探索项、Stage III的收敛约束等组件进行逐一消融,验证各阶段设计的必要性。
  • 用户研究:开展主观评估实验,收集用户对SGPO与基线方法生成图像的偏好判断。

关键结果与论文证据

  • 在匹配的AES分数(约6.0)下,SGPO在全部12个评估指标中均取得前两名表现,其中FID(49.36)、LPIPS(0.653)、IS(29.81)、TCE(40.14)、BRI(5.89)、NIQE(4.272)和SE(11.86)七项指标获得最优(第5页,Table 1)。
  • 消融实验表明,完整的SGPO模型在AES(5.808)、CLIP(0.244)、IS(23.92)、SE(11.97)四项指标上均优于各消融变体,且达到PS=22.2所需的训练时间最短(6.59小时)(第7页,Table 2)。
  • 在多目标奖励(PS+AES)和压缩性/不可压缩性等非常规奖励函数上,SGPO同样展现出稳定的优化能力,表明框架对不同奖励函数具有良好的泛化性(第7页,Figure 5)。
  • 在复杂提示词对齐和OCR生成任务上,SGPO显著优于基线方法,证明阶段感知优化有助于保持语义保真度(第7页,Figure 7)。
  • 在SD3.5和FLUX等Flow-matching-based扩散模型上,SGPO同样有效缓解了奖励黑客问题,验证了框架的架构通用性(第8页,Figure 12)。
  • 用户研究结果显示,SGPO生成的图像在视觉质量和提示词对齐度上均获得显著更高的用户偏好(第8页,Figure 13)。
  • 多样性对比实验表明,在相同训练轮数下,SGPO生成的图像在形状、朝向和颜色上均展现出比基线方法更高的多样性(第7页,Figure 8)。
  • 在极高目标奖励(AES>7)的后期优化阶段,SGPO仍会出现轻微的性能退化,作者将其归因于不可避免的过度优化(第7页)。

阅读时需要注意

  • 在极高目标奖励(如AES>7)的后期优化阶段,SGPO仍会出现轻微的性能退化,表明阶段感知策略无法完全消除过度优化的风险。
  • 方法在单个节点上使用8块NVIDIA Tesla H20 GPU进行实验,对计算资源有一定要求,可能限制其在资源受限场景下的应用。
  • SGPO的阶段感知机制依赖于CLIP模型计算语义相似度,其性能可能受限于CLIP模型本身的准确性和覆盖范围。

关联工作

  • DDPO(第1页):将扩散模型去噪过程建模为MDP并使用PPO进行RL微调的早期代表性工作,奠定了扩散模型RL微调的基本范式。
  • TDPO(第5页):从归纳和首因偏差角度解决扩散模型奖励过度优化问题的方法,但本文实验表明其反而导致了严重的奖励黑客。
  • Flow-GRPO(第6页):基于流匹配的扩散模型GRPO方法,本文将其作为Flow-matching-based扩散模型上的对比基线。

发表评论