探索还是收敛?SGPO如何用分阶段策略破解扩散模型RL微调的奖励黑客难题

方法贡献与验证思路

提出SGPO框架,通过感知扩散生成过程中的语义变化和信噪比,自适应地将RL优化划分为混沌逃离、带探索的偏好优化和稳定收敛三个阶段,以缓解奖励黑客问题并提升生成质量与多样性。

DINOde:为何开放词汇分割需要连续对齐而非离散映射?

DINOde方案

现有开放词汇语义分割方法常因离散投影导致语义纠缠。DINOde引入ODE框架,通过Semantic Text Flow和Velocity Tangent Projection,在超球面上平滑演化文本嵌入。实验显示其几何保持能力优于MLP基线,并在多个基准上超越Talk2DINO。注意:性能依赖后处理,且ODE步数过多可能引入数值误差。