PAST:让扩散模型学会“适可而止”的高效强化学习微调
问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。
问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。