PAST:让扩散模型学会“适可而止”的高效强化学习微调

快速导读:问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。

扩散模型在图像生成领域取得了巨大成功,但其强化学习(RL)微调面临两大核心挑战:奖励信号仅在最终步出现导致的稀疏性,以及固定长度去噪轨迹带来的高昂计算成本。PAST(Prompt-Adaptive Sampling Termination)正是针对这两个问题提出的轻量级解决方案。

PAST 的核心思想是“适可而止”——并非所有提示都需要完整的去噪步数,简单的提示可以在较早的步数就达到满意质量。通过引入自适应回合终止、内在奖励和去噪感知模型三个组件,PAST 让扩散模型学会根据提示复杂度和去噪进度动态调整训练步数,从而在提升效率的同时保持生成质量。

英文题目:PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

论文出处:arXiv 每日论文精选 · arXiv:2608.06794

原始论文:PDF / 论文页面

这篇论文解决什么问题?

扩散模型的强化学习微调面临奖励稀疏性的根本困境。在标准的 RL 微调框架中,模型需要执行完整的去噪轨迹(通常 50 步)才能获得一个奖励信号。这意味着在绝大多数中间步骤上,模型缺乏有效的学习指导,导致训练效率低下。

固定长度的去噪回合还带来了计算成本问题。论文中的观察表明,图像质量在去噪后期阶段的提升变得微乎其微(Figure 2),但传统方法仍然强制模型走完所有步数。这种“一刀切”的策略浪费了大量计算资源,限制了 RL 微调在大规模场景下的可扩展性。

此外,奖励稀疏性还会加剧奖励黑客(Reward Hacking)问题。当模型只能从最终结果获得反馈时,它倾向于找到捷径来最大化奖励,例如生成风格单一但评分高的图像,从而丧失生成多样性。

现有的 RL 微调方法如 DDPO、DPOK 等虽然在优化特定奖励函数上取得进展,但都未能从根本上解决固定回合范式的效率瓶颈。PAST 的突破在于首次将“何时停止去噪”本身作为一个可学习的决策问题。

核心创新

方法概览

问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。

  • 内在奖励设计(第 3 页):PAST 引入基于当前潜在表示与初始噪声之间 L2 距离的内在奖励 R_int。直觉是:去噪越充分,潜在表示离初始噪声越远。这个中间信号为每一步提供学习指导,有效缓解奖励稀疏性。论文还提供了理论证明,表明该内在奖励与去噪进度正相关。
  • 去噪感知模型 DAM(第 4 页):DAM 是一个轻量级网络,输入当前潜在表示和时间步,预测去噪进度参数 alpha_t。它充当“进度评估器”,实时判断当前图像的去噪完成度。DAM 通过 KL 散度正则化来平衡内在与外在奖励的权重,以及探索与收敛的权衡。
  • 自适应回合终止策略(第 5 页):PAST 结合两个指标来决定何时终止去噪——基于 DAM 的“清洁度”指标和基于交叉注意力的语义对齐指标。当两者都趋于稳定时,系统提前终止当前回合。提示越简单,终止越早;复杂提示则允许更多步数。
  • 提示分解模块:PAST 使用 LLM 将提示分解为名词-属性组,以评估提示复杂度。论文指出这一步骤对现代 LLM 而言是轻量级的,且达到 100% 的一致性。
  • 即插即用集成:PAST 设计为可无缝集成到现有 RL 微调框架(如 DDPO、DPOK)的插件,无需修改基础模型架构或训练流程。
  • 双重动态协调机制:DAM 同时协调两个关键权衡——内在奖励与外在奖励的权重分配,以及策略探索与收敛的平衡。这使得训练过程能根据去噪阶段自适应调整优化目标。

逐图理解论文

失败的直觉

失败的直觉
Figure 2: Image quality during denoising. The quality improvement becomes marginal in the last segment of denoising steps [32]. Compared to traditional methods that go through the entire denoising process, our method adapts episode lengths to focus the training on the steps where image quality is significantly improving to enhance efficiency.

该图展示了去噪过程中图像质量的变化趋势。注意最后阶段的曲线趋于平缓,说明质量提升变得微乎其微。这直接支持了 PAST 的核心动机:在后期步数上继续去噪的边际收益很低,因此可以提前终止以节省计算。

核心洞察

核心洞察
Figure 1: Overview of PAST. Tackling the challenges of high computational cost and sparse rewards of existing RL fine-tuning methods, we introduce a) adaptive episode control based on prompt complexity and denoising progress, enabling a broader search range for high reward policy preserving real distribution. b) We design an intrinsic motivation based on fine-grained text- image alignment to alleviate reward sparsity. c) Both the intrinsic-extrinsic reward trade-off and the exploration-convergence trade-off are dynamically coordinated by a denoise evaluator.

问题的根源在于,现有方法把“去噪步数”当作一个固定常数,而不是一个应该根据提示复杂度动态调整的变量。简单的提示,比如“一只猫”,可能二十步就够了;复杂的提示,比如“一只戴着墨镜的橘猫坐在红色沙发上”,才需要更多步数。PAST的核心洞察就是:让模型学会“适可而止”,根据提示的复杂度和去噪的实时进度,自适应地决定何时终止当前回合。

结论与意义

结论与意义
Figure 3: Reward optimization results with two datasets (i.e., HPSv2 and Pick-a-pic) and two reward functions (i.e., Aesthetic Score and PickScore). Our method performs the most efficiently in optimizing the rewards.

该图对比了 PAST 与基线方法在 HPSv2 和 Pick-a-Pic 数据集上的奖励优化曲线。PAST 的曲线上升更快且更稳定,表明其在相同训练步数下能更高效地优化奖励函数。

实验如何设计?

  • 训练数据集:HPSv2 和 Pick-a-Pic 两个常用图像-文本对齐数据集。
  • 奖励函数:Aesthetic Score(美学评分)和 PickScore(偏好评分)两种主流奖励函数。
  • 基线方法:DDPO、DPOK、D3PO、TDPO 等多个代表性 RL 微调方法。
  • 骨干模型:SDv1.4、SDv2.1、SDXL、SD3.5 等多种 Stable Diffusion 变体,以及流匹配模型。
  • 评估维度:包括奖励优化效率、计算成本、生成质量、语义对齐、多样性、人类主观评分和 VLM 评分。

关键结果与论文证据

  • 计算成本大幅降低:PAST 使 DDPO 达到 Aesthetic Score=6 的时间从 6.67 小时降至 2.22 小时,节省约 66.7% 的计算成本(第 6 页,Figure 4)。
  • 奖励优化效率提升:在相同训练样本数下,PAST 将 Aesthetic Score 从 5.64 提升至 5.90(第 6 页,Table 1)。
  • 内在奖励加速去噪:可视化分析显示,使用内在奖励后,去噪过程达到相同潜在状态可提前 5 步(第 6 页,Figure 6)。
  • 即插即用有效性:将 PAST 集成到 DDPO 和 DPOK 后,两个框架均获得一致的效率提升(第 6 页,Table 1)。
  • 跨骨干迁移能力:PAST 在 SDv1.4、SDv2.1、SDXL 和 SD3.5 上均表现出一致的性能增益(第 7 页,Figure 8)。
  • 语义对齐改善:在未见过的提示上,PAST 在计数、颜色、组合和位置等语义维度上展现出更好的对齐能力(第 8 页,Figure 11)。
  • 主观评估优势:人类评分和 VLM 评分均显示 PAST 在图像质量、文本对齐和多样性方面优于基线(第 8 页,Figure 12)。
  • 缓解奖励黑客:仅使用内在奖励就能显著减少风格坍塌和背景同质化等奖励黑客现象(第 18 页,Figure 19)。

阅读时需要注意

  • 提示分解依赖 LLM,虽然论文声称轻量且一致,但在非英语提示或特殊领域提示上的鲁棒性有待验证。
  • 自适应终止策略涉及邻域范围等超参数,不同任务可能需要调整,增加了调参负担。
  • 实验主要在 Stable Diffusion 系列模型上进行,对其他扩散模型家族(如 DALL-E 系列)的泛化性尚不明确。

关联工作

  • DDPO 是扩散模型 RL 微调的代表性方法,PAST 在其基础上构建并对比,展示了自适应终止的显著优势。
  • DPOK 和 D3PO 分别从偏好优化和人类反馈角度改进 RL 微调,PAST 的即插即用实验表明其与这些方法兼容。
  • TDPO 关注奖励过优化问题,PAST 的内在奖励机制从不同角度缓解了这一问题。

发表评论