探索还是收敛?SGPO如何用分阶段策略破解扩散模型RL微调的奖励黑客难题

方法贡献与验证思路

提出SGPO框架,通过感知扩散生成过程中的语义变化和信噪比,自适应地将RL优化划分为混沌逃离、带探索的偏好优化和稳定收敛三个阶段,以缓解奖励黑客问题并提升生成质量与多样性。