扩散模型推理加速:PSP如何通过剪枝超越BoN?

快速导读:PSP打破了恒定内存约束,初期引入大量种子,利用奖励模型评估中间状态,并渐进剪枝低奖励轨迹。这种变数量策略将计算资源集中在最有希望的候选者上。

扩散模型的推理时间扩展(Inference-Time Scaling)是提升生成质量的关键方向,但现有方法如Best-of-N(BoN)和重要性采样(FK-Steering)存在计算效率低下的问题。本文提出的Progressive Seed Pruning(PSP)通过放宽恒定内存约束,实现了更高效的搜索策略。

PSP的核心思想是在去噪初期引入大量种子,利用奖励模型(如ImageReward)评估中间状态,并渐进剪枝低奖励轨迹。这种方法将计算资源集中在最有希望的候选者上,从而在同等计算预算下显著提升提示对齐度和人类评估得分。

英文题目:Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

论文出处:arXiv 每日论文精选 · arXiv:2607.21591

原始论文:PDF / 论文页面

对应视频标题:扩散模型推理加速:PSP如何通过剪枝超越BoN?|推荐指数:★★★★★

这篇论文解决什么问题?

与大型语言模型(LLMs)相比,扩散模型的推理时间扩展研究相对滞后。传统方法通常通过增加去噪步数来提升质量,但这会导致计算成本急剧上升。初始噪声种子对生成质量有显著影响,因此种子搜索策略成为研究热点。

然而,现有的无梯度方法(如BoN)需要完整去噪所有候选者,导致大量计算浪费在无希望的轨迹上。重要性采样方法(如FK-Steering)虽然尝试优化,但仍受限于恒定粒子数,无法充分利用初期探索的广度。

此外,流匹配(Flow Matching)模型中的随机性问题使得重采样方法难以稳定应用。因此,需要一种既能保持探索广度,又能高效集中计算资源的新方法。

核心创新

方法概览

PSP打破了恒定内存约束,初期引入大量种子,利用奖励模型评估中间状态,并渐进剪枝低奖励轨迹。这种变数量策略将计算资源集中在最有希望的候选者上。

  • PSP从大量初始噪声种子($2\bar{N}$)开始,使用黑盒奖励模型(如ImageReward)对中间去噪估计进行评分。
  • 根据预定的调度策略,PSP逐步剪枝低奖励轨迹,从而减少后续去噪步数中的候选者数量。
  • 这种方法保持了总模型评估次数固定,但将剩余去噪预算集中在缩小的候选集上。
  • PSP使用确定性求解器,避免了流匹配模型中重采样方法带来的随机性问题。
  • 支持离线调度调优,通过在缓存的中间奖励上模拟剪枝决策,无需重新运行生成器。

逐图理解论文

PSP的核心创新

PSP的核心创新
Fig. 2: Compute allocation profiles for inference-time scaling. Top: example reward trajectories (ImageReward) over denoising progress for multiple candidates. Bottom: compute allocated per candidate as a function of progress. Left: BoN runs N full trajectories and selects the best final reward. Middle: importance-sampling-style methods (e.g., FK-Steering) maintain a constant particle count and periodically resam- ple based on intermediate rewards (red crosses indicate discarded samples). Right: PSP starts with more candidates and prunes low-reward trajectories early, concen- trating the remaining denoising budget on a shrinking survivor set. In this illustration, PSP considers twice as many initial seeds as the other methods under the same total number of denoising steps.

图2展示了计算分配配置文件。BoN运行N个完整轨迹,FK-Steering保持恒定粒子数并定期重采样,而PSP从更多候选者开始并早期剪枝低奖励轨迹,集中预算于幸存者。

实验验证

实验验证
Table 1: Main results under matched compute. We compare standard sam- pling ( ¯ N = 1), BoN, our main importance sampling (FK-Steering) and tree-search (DSearch) baselines, other relevant methods for inference-time compute scaling in dif- fusion (Noise Trajectory Search (NTS), Rollout Budget Forcing (RBF), Breadth-First Search (BFS), SVDD), and PSP. All results are from our experiments using the public implementation of those methods and selecting parameters to match computational budget and same reward guidance: ImageReward. We report the guidance reward (Im- ageReward), HPS, GenEval, and human evaluation scores on final images generated from GenEval prompts. PPS achieves the best results in prompt-alignment as mea- sured by automated scores (GenEval) and human evaluation

表1展示了匹配计算下的主要结果。PSP在ImageReward、HPS、GenEval和人类评估中均表现最佳,特别是在提示对齐方面。

结论与局限

结论与局限
Fig. 1: Examples of image generation improvement with PSP. SDXL genera- tions using a standard sampler and three gradient-free inference-time scaling strategies under a fixed compute multiplier ¯ N = 4: BoN, FK-Steering (importance-sampling based), and our PSP. We show examples from GenEval prompts in which PSP im- proves on BoN and FK-Steering, satisfying prompt constraints (full results in Tab. 1).

图1展示了PSP在SDXL生成中的改进。对比标准采样器、BoN、FK-Steering和PSP,PSP在GenEval提示词中更好地满足约束,如物体数量和属性。

实验如何设计?

  • 实验在Stable Diffusion v1.5、SDXL和SD 3.5(流匹配)上进行,使用GenEval提示词。
  • 对比基线包括BoN、FK-Steering、DSearch、NTS、RBF、BFS和SVDD,计算预算匹配($\bar{N}=4$)。
  • 评估指标包括ImageReward(IR)、HPSv2、GenEval(提示对齐)和人类评估。
  • 分析了计算倍数$\bar{N}$高达16时的缩放行为,以及计算开销(运行时间/VRAM)。

关键结果与论文证据

  • 在SDXL上,PSP在$\bar{N}=4$时取得最高GenEval(0.645)和人类评估(0.713)得分,优于BoN(0.629/0.682)和FK-Steering(0.627/0.676)(第9页)。
  • 在SD 3.5上,PSP取得GenEval 0.747和人类评估0.841,超越BoN(0.747/0.831)和FK-Steering(0.742/0.837)(第9页)。
  • PSP的运行时间开销极小:在SD v1.5上为2.99秒,而BoN为2.65秒,且比双倍计算($\bar{N}=8$)的BoN快近2倍(第11页)。
  • 相对于双倍计算BoN的遗憾(Regret)随$\bar{N}$增加而减少,表明在更大预算下剪枝更安全(第11页)。

阅读时需要注意

  • 假设标量奖励信号,难以优化多目标或难以量化的约束(如ControlNet中的严格空间一致性)。
  • 对于由轨迹后期生成的细粒度细节主导的目标(如美学质量/HPS),增益较小,因为早期种子选择对这些特征影响不大。
  • 需要奖励模型提供信息丰富的中间信号;性能取决于中间奖励与最终奖励之间的相关性。

关联工作

  • FK-Steering是保持恒定粒子数的重要性采样基线,PSP通过允许变数量和早期剪枝优于它(第4页)。
  • DSearch是树搜索基线,PSP在匹配计算下实现更好的提示对齐和人类得分(第4页)。
  • BoN是标准基线,完全去噪所有候选者,PSP通过早期剪枝无希望种子更计算高效(第2页)。
  • Rollover Budget Forcing (RBF)是早期节省预算的自适应采样器,PSP显示前期加载探索对提示对齐更有效(第4页)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展

Rogério Guimarães1 和 Pietro Perona1

美国加利福尼亚州帕萨迪纳加州理工学院,邮编 91125 {rogerio,perona}@caltech.edu https://vision.caltech.edu

摘要。扩散模型和流匹配模型主导了条件图像生成,然而,这些模型的推理时间扩展(Inference-Time Scaling)远不如自回归语言模型那样成熟。由于最终质量对初始噪声种子高度敏感,许多方法在黑色盒奖励下花费额外计算进行种子搜索或重采样,但通常在推理过程中保持恒定的内存占用。我们表明,放宽这一约束使得一个未被充分探索的推理时间扩展轴变得可行:通过早期激进地剪枝种子,我们可以更有效地利用固定计算预算进行评估。渐进式种子剪枝(Progressive Seed Pruning, PSP)对中间去噪估计进行评分,并逐步缩小候选集,使得只有有希望的轨迹被完全去噪,同时保持模型评估总数固定。在扩散模型和流匹配骨干网络上,PSP 一致地改进了奖励引导的选择,并在匹配计算量的情况下,相比 N 选最佳(Best-of-N, BoN)、重要性采样和树搜索基线,实现了更高的 GenEval(自动化)分数以及在提示对齐方面更好的人类评估结果。项目页面:vision.caltech.edu/psp。[cs.CV] 代码:github.com/rogerioagjr/psp

关键词:扩散模型 · 流匹配 · 推理时间扩展 · 奖励引导生成 · 提示对齐 · 粒子滤波

1 引言

扩散模型 [16, 38, 40] 和流匹配模型 [25, 26] 已成为条件图像和视频生成的默认引擎。与此同时,来自大型语言模型的一个核心教训是,推理时间扩展与训练时间扩展同样重要:通过搜索、采样和验证,测试时的额外计算可以带来巨大的质量提升 [2, 7, 42, 49, 50]。对于扩散式生成器,主要的调节手段是增加去噪步数,但这通常是花费额外计算的一种低效方式。arXiv:2607.21591v1

越来越多的工作指向了不同的杠杆:对于现代文生图系统,随机种子(初始噪声)可以强烈影响生成质量 [33, 47]。这激发了将生成视为搜索的推理时间策略

第 2 页

2 R. Guimarães 和 P. Perona

一张黄色 的照片 一把刀的照片 和四张 照片 一辆公交车的照片 在 一头奶牛 上方 一张 照片 一张 粉色 的 斑马 西兰花 一艘 船 一个 停车标志 狗

Stable Diffusion XL

Stable Diffusion XL +Best-of-N

Stable Diffusion XL +FK-Steering

Stable Diffusion XL +PSP ( ours )

图 1:PSP 提升图像生成效果的示例。SDXL 使用标准采样器以及三种在固定计算倍数 $\bar{N} = 4$ 下的无梯度推理时间扩展策略进行生成:BoN、基于重要性采样的 FK-Steering,以及我们的 PSP。我们展示了来自 GenEval 提示的示例,其中 PSP 优于 BoN 和 FK-Steering,满足了提示约束(完整结果见表 1)。

在由黑盒奖励模型引导的种子中。早期研究表明,N 选最佳 (BoN) 的扩展性优于使用更多时间步 [28],但它会完全去噪许多不太可能获胜的候选样本。 最近的方法利用中间奖励信号,通过重要性采样 [36] 或树搜索 [23, 30, 52] 更有效地分配计算资源。这些方法是无梯度的,且不需要对骨干网络进行微调,但通常在整个轨迹中强制执行固定数量的并行样本(恒定内存)。相比之下,粒子滤波长期以来一直研究可变粒子数量和早期剪枝 [13],但这一想法尚未在现代扩散式图像生成中得到充分的压力测试。 在本文中,我们重新审视一个简单的问题:如果我们放宽恒定内存约束,应如何在去噪过程中分配计算资源?中间奖励估计往往在相对早期就变得具有信息量。这表明了一种直接策略:从大量种子池开始,仅推进它们直到奖励信号变得有意义,然后逐步剪枝,并将剩余的去噪预算保留给一组不断缩小的有希望的候选样本。 我们研究了这一思想的一个简单实例,即渐进式种子剪枝 (PSP)。PSP 从大量噪声种子池开始,对中间去噪估计进行评分

第 3 页

渐进式种子剪枝(PSP)的推理时间扩展 3

估,并按预定计划进行剪枝,使得只有有希望的轨迹获得剩余的降噪预算。这种前置探索策略改进了基于奖励的引导选择,优于先前的推理时间扩展基线,同时保持模型评估总数固定。使用固定计划也与部署相一致:预定的剪枝点和幸存者数量使得每个区间的内存占用和运行时间可预测,便于在理想设置(如具有弹性能力的多 GPU 服务器)上进行分配。综上所述,我们的结果表明,可变粒子种群是现代生成模型推理时间扩展的一种简单、通用且易于部署的设计原则。

贡献。

1. 我们指出恒定内存推理是一种不必要的限制,并表明在黑色盒奖励下,时变粒子数量是扩散/流模型的一种强推理时间扩展原则,用于前置计算并考虑更大的初始噪声种子池。 2. 我们在扩散和流匹配骨干网络上,在匹配的算力下,展示了 PSP 相对于 N 选最佳(BoN)、重要性采样和树搜索基线在自动指标和人工评估上的一致增益,并表明性能随算力扩展。 3. 我们表明确定性使得离线计划搜索成为可能:剪枝计划可以从缓存的中间奖励中模拟,而无需重新运行生成器,从而实现快速的每任务适配。

2 相关工作

2.1 利用奖励引导扩散模型

使用奖励进行条件生成的常见方法是基于梯度的引导 [1, 6],它将可微目标的梯度反向传播,以将采样轨迹或初始噪声 [41] 偏向更高的奖励。虽然有效,但这需要可微奖励,并且由于梯度计算和额外评估增加了显著的推理开销,当奖励是黑色盒或昂贵时,其实用性较低。 另一种选择是直接微调生成骨干网络,以通过强化学习 [4, 48] 或偏好目标 [43] 最大化奖励。这可以在不需要推理时间搜索的情况下改进默认采样,但以大型生成模型的额外训练及相关工程开销为代价。相比之下,PSP 是无训练且无梯度的,使其能够 straightforwardly 跨奖励以及跨扩散和流匹配骨干网络应用现成方案。

2.2 使用无梯度奖励扩展推理算力

最近的方法利用黑色盒奖励函数的中间信号,通过并行运行多个样本来高效地扩展推理时的算力

第 4 页

4 R. Guimarães and P. Perona

将计算资源分配给最有希望的样本。FK-Steering [36] 通过 Feynman–Kac 相互作用粒子系统 [5, 8] 的视角审视扩散推理,并推广了如 TDS [44] 和 SVDD [24] 等重要性采样方法。它维护一个粒子群体,并利用源自中间奖励估计的势函数定期重新加权并重采样这些粒子。

另一条显著的研究路线将推理时的样本选择建模为对去噪轨迹的树搜索 [23,34,52]。在我们的每代固定预算设置中,我们选择 DSearch [23] 作为其主要代表。它在部分轨迹上执行束搜索(beam-style search),随着时间推移缩小束宽,同时增加分支(每个候选者有多个子节点),以便从中间状态更好地估计价值。

其他相关方法通过分配自适应的每提示计算资源、重新访问早期步骤进行细化,并扩展推理直到停止规则表明生成令人满意,从而追求不同的目标 [22,52]。FK-Steering 和 DSearch 的共同假设是推理期间内存预算恒定:每一步同时探索的样本最大数量大致保持固定。我们的工作通过放宽恒定内存约束并转而使用早期剪枝来在考虑更大初始种子集上花费更多计算,从而偏离了这一设计选择。

2.3 粒子滤波与剪枝中的自适应粒子数量

在经典粒子滤波和序贯蒙特卡洛方法中,即使在目标分布的复杂度随时间显著变化的情况下,通常也在每个时间步传播固定数量的粒子。因此,长期以来的研究工作致力于研究自适应粒子数量,以将计算资源分配在最需要的地方。KLD-sampling 通过满足通过 Kullback–Leibler 准则测量的预定近似质量界限来调整粒子数量,在模糊阶段使用更多粒子,而在后验集中后使用较少粒子 [13]。更近期的“自适应 N”粒子滤波器根据在线预测统计信息调整粒子数量,并提供保证,展示误差界限如何随时间跟踪这些更新 [10]。与此同时,多臂老虎机文献严重依赖 Successive Halving [17, 19],这是一种通过评估大量配置并迭代丢弃表现最差的半数来优化固定计算预算分布的算法。这类似于我们的默认剪枝策略(第 4.6 节),但 PSP 更加灵活,允许为给定任务、奖励和提示搜索最佳策略。

我们的工作可以看作是将这些自适应粒子和早期剪枝思想简单应用于扩散图像生成的奖励引导推理。尽管粒子滤波文献探索了更丰富的自适应策略,但我们表明,对于条件图像生成,固定的预定剪枝策略已经捕捉到了自适应粒子数量的大部分优势。

分配原则本身是经典的,但先前的奖励引导扩散方法在很大程度上固定了并行度。最接近的特例是 [20] 中的自适应采样器,称为 rollover budget forcing,它在推理过程中不均匀地分配计算资源。然而,他们的分配方向与我们相反:

第 5 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 5

提示词:“一张两张领带的照片” N选最佳 重要性采样 渐进式种子剪枝

1 1 1 (IR) 0 0 0 奖励 1 1 1

2 2 2 分配轨迹 每个计算 0 25 50 75 100 0 20 40 60 80 100 0 25 50 100 推理进度 (%) 推理进度 (%) 推理进度 (%)

图 2:推理时间扩展的计算分配概况。顶部:多个候选者在去噪进度上的示例奖励轨迹(ImageReward)。底部:每个候选者随进度分配的计算量。左侧:BoN 运行 N 条完整轨迹并选择最终奖励最佳者。中间:重要性采样类方法(例如 FK-Steering)保持恒定的粒子数量,并基于中间奖励定期重采样(红色叉号表示被丢弃的样本)。右侧:PSP 从更多的候选者开始,并早期剪枝低奖励轨迹,将剩余的去噪预算集中在不断缩小的幸存者集上。在此说明中,PSP 考虑的初始种子数量是其他方法在相同总去噪步数下的两倍。

而不是在早期考虑更大的种子池,它们早期节省预算,并在后期更重地重采样。对于提示词对齐等任务,这在不重要的地方错配了计算资源,因为重要特征是粗糙的,因此在生成过程的早期基本固定 [31],这一特性在用于感知任务的扩散骨干网络中已被利用 [15, 27]。因此,其自适应采样器相比其他采样和搜索方法优势甚微。相比之下,我们表明,放宽恒定内存限制以在早期扩展初始种子池并随时间进行剪枝,对于现代扩散和流匹配生成器来说是一个出人意料的强大基线。

3 渐进式种子剪枝

3.1 预备知识

扩散和流匹配模型 我们考虑条件生成模型,这些模型在条件 c(例如文本提示词)的指导下,通过一系列更新将噪声转换为样本。

扩散模型。在扩散 [16, 38, 40] 中,前向加噪过程定义了 $q(x_t | x_0)$,其中 $t \in \{1, \dots, T\}$,而学习到的模型参数化了反向过程 $p_\theta(x_{t-1} | x_t, t, c)$。在常见的 $\epsilon$-预测参数化中,网络

第 6 页

6 R. Guimarães 和 P. Perona

预测 $\epsilon_\theta(x_t, t, c)$,采样器(例如 DDIM [39])利用它生成 $x_{t-1}$。重要的是,相同的网络输出产生了对干净样本的去噪估计, \hat {x }_ 0 (x_t , t,c ) \;\approx\;\mathbb{E}[x_0\midx_t,t,c], (1) 该估计通常在采样器内部计算,并可重用用于中间评分。

流匹配模型。流匹配模型 [25, 26] 学习一个依赖于时间的速度场 $v_\theta(x, t, c)$,该速度场定义了一个常微分方程(或随机微分方程),将噪声传输到数据。采样通常使用数值求解器(例如 Euler Discrete [11, 12])从高噪声状态积分常微分方程到干净样本,从而在选定的噪声水平集上产生离散状态 $\{x_t\}$。使用实践中使用的标准参数化,相同的速度预测可以通过一步“外推”到零噪声端点形成干净估计,

\hat {x }_ 0 (x _ t, t,c) \ ;= \; x_t\sigma_t\,v_\theta(x_t,t,c), (2)

其中 $\sigma_t$ 表示求解器调度中的当前噪声尺度。与扩散模型类似,该估计已隐含在求解器更新中,并且可以以可忽略的额外模型成本提取出来。

设置与假设我们假设一个条件生成器,如扩散或流匹配 $p_\theta$,它通过从已知噪声分布迭代离散转换 $p_\theta(x_{t-1} | x_t, t, c)$(其中 $t \in \{T, \dots, 1\}$)来生成样本。(连续时间求解器通过离散化并在离散求解器步骤应用剪枝来处理。)我们还假设一个定义在干净样本上的黑盒奖励函数 $r(x, c)$(例如审美或偏好模型)。我们的目标是在固定的推理计算预算下最大化奖励。

中间奖励估计 PSP 依赖于最终样本的廉价中间代理。在每一步,我们计算去噪估计 $\hat{x}_0(x_t, t, c)$ 并对其进行评分: s _t\;=\; r( \hat {x }_0(x_t,t,c),c). (3) 关键在于,计算 $\hat{x}_0$ 重用了生成器已经产生的量(噪声预测或速度预测),因此除了用于去噪的前向传递外,PSP 不需要额外的生成器前向传递。不同时间步长和不同骨干网络中的这些去噪估计 $\hat{x}_0$ 示例可在第 S8 节中找到。

3.2 渐进式种子剪枝 (PSP) 算法 1 描述了 PSP。该方法从大量 $k^T$ 个独立同分布的噪声种子开始,并维护一个部分轨迹的幸存者集合 $S$。在每一步,PSP:(i) 为每个幸存者形成去噪估计 $\hat{x}_0$;(ii) 使用黑盒奖励对 $\hat{x}_0$ 上的幸存者进行评分;(iii) 剪枝至前 $k^{t-1}$ 个幸存者;以及 (iv) 仅将幸存者推进到下一步。通过早期剪枝,PSP 将其总预算的更多部分用于评估更多的初始种子,同时仍为最有希望的轨迹完成完整的去噪。

第 7 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 7

算法 1 渐进式种子剪枝 (PSP)

输入:生成器 $p_\theta$,奖励函数 $r(\cdot, c)$,条件 $c$,步数 $T$,调度 $\{k_t\}_{t=0}^T$,其中 $k_T$ 为初始候选者数量,$k_0$ 为最终幸存者数量。 返回:最终幸存者 $\{x_i^0\}_{i=1}^{k_0}$ 对 $i \in [k_T]$,采样 $x_i^T \sim \mathcal{N}(0, I)$ $S \leftarrow \{x_i^T\}_{i=1}^{k_T}$ for $t \in \{T, \dots, 1\}$ do 预测干净图像:对每个 $x_i^t \in S$,$\hat{x}_{i,t}^0 \leftarrow \hat{x}_0(x_i^t, t, c)$ 评分:$s_{i,t} \leftarrow r(\hat{x}_{i,t}^0, c)$ 剪枝:$S \leftarrow \text{TopK}(S, k_{t-1})$,基于分数 $\{s_{i,t}\}$ 去噪:对每个 $x_i^t \in S$,采样 $x_i^{t-1} \sim p_\theta(x_{t-1} | x_i^t, t, c)$ 更新:$S \leftarrow \{x_i^{t-1}\}$ end for 输出:return $S$

剪枝间隔。在实践中,我们仅在少量预定的步数进行剪枝,并在剪枝点之间保持批次大小不变。这基于以下动机:(a) 相邻步数之间中间奖励排名的平滑性,以及 (b) 系统考量:固定剪枝点和固定幸存者数量可产生可预测的内存使用和每间隔的运行时间,从而简化分布式推理中的调度。

3.3 计算预算与有效倍数

我们以去噪步数来衡量推理计算量。如果推理过程在第 $t$ 步传播 $k_t$ 个并发轨迹,则生成器更新的总次数为

$C = \sum_{t=1}^{T} k_t$. (4)

标准单次样本推理运行具有 $C = T$。因此,我们报告有效计算倍数 $\bar{N} = C/T$,这意味着推理过程的计算量等同于从常规采样器中采样 $\bar{N}$ 次。

在推理过程中,我们既要推进轨迹,又要计算中间分数。对于扩散和流匹配模型,生成器的前向传播已经产生了计算 $\hat{x}_0$ 所需的量,因此中间评分不会增加额外的生成器评估。此外,我们利用 ImageReward [46] 提供的引导实现了我们的结果,这是一个轻量级模型,FK-Steering [36] 已将其用作引导,为扩散推理增加的开销极小(见表 2)。

第 8 页

8 R. Guimarães 和 P. Perona

4 实验

4.1 骨干模型

我们以 Stable Diffusion v1.5 [35] 和 Stable Diffusion XL [32] 作为扩散模型,以 Stable Diffusion 3.5 (Large) [11] 作为流匹配模型进行评估。我们使用 HuggingFace 上广泛可用的实现,其中 SD v1.5/SDXL 采用 T = 64 步,SD 3.5 采用 T = 32 求解器步数。

对于 Best-of-N (BoN) 和渐进式种子剪枝 (PSP),我们使用确定性求解器:扩散模型使用 η = 0 的 DDIM [39],SD 3.5 使用 Euler Discrete [11, 12]。因此,所有随机性均源于初始噪声种子,这与将 PSP 用作种子搜索的预期用途相符。

FK-Steering 依赖于随机轨迹:在确定性设置下,重采样会产生相同的子代并浪费计算资源。对于 SD v1.5 和 SDXL,我们遵循 FK-Steering 作者的做法,使用 η = 1 的 DDIM 注入噪声 [36]。然而,对于 SD 3.5,强烈的随机性可能会在整流流训练下显著降低采样质量,且公共实现中的默认随机设置会导致 FK-Steering 性能较差。因此,我们使用受控噪声求解器(见补充材料 S4 节),该求解器注入具有可调尺度的高斯扰动,并将该尺度设置为不损害基线(非重采样)生成质量的最大值。

4.2 基线与主要比较

表 1 比较了在匹配计算量下的无梯度推理时间扩展策略。我们在 GenEval 提示 [14] 上进行评估,并报告:(i) 选定输出的引导奖励(ImageReward [46]),(ii) 作为人类偏好自动化指标的 HPSv2 [45],(iii) 使用基于检测器的检查作为奖励无关的提示对齐度量的 GenEval [14],以及 (iv) 提示对齐的人类评估。结果基于 3 个随机种子取平均。

Best-of-N (BoN) 运行 ¯N 个独立的完整轨迹,并选择奖励最高的结果(图 2,左侧)。作为重要性采样的基线,我们使用 FK-Steering [36](图 2,中间),采用作者推荐的超参数(λ = 10, K = 4)和重采样调度(推理进度的 20%、40%、60%、80% 和最后一步)。作为树搜索基线,我们使用 DSearch [23],将束宽和树宽设置为 2,以匹配其他方法的计算量。我们还使用匹配的计算预算运行了其他推理时间计算扩展方法的实验(噪声轨迹搜索 (NTS) [34]、溢出预算强制 (RBF) [20]、广度优先搜索 (BFS) [52] 和 SVDD [24]),但鉴于人类研究的成本,我们仅报告这些方法的自动化指标,并将人类评估保留给主要比较。对于渐进式种子剪枝 (PSP),我们使用简单的固定调度(图 2,右侧):从 2¯N 个种子开始,在 25% 进度时剪枝至 ¯N,并在 50% 进度时再次剪枝至 ¯N/2。

在所有骨干模型上,渐进式种子剪枝 (PSP) 优于标准推理,并在提示对齐方面(通过

第 9 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 9

表 1:匹配计算量下的主要结果。我们比较了标准采样($\bar{N}=1$)、N选最佳(BoN)、我们主要的基于重要性的采样方法(FK-Steering)和树搜索(DSearch)基线,以及其他在扩散模型推理时间计算扩展方面相关的方法(噪声轨迹搜索(NTS)、展开预算强制(RBF)、广度优先搜索(BFS)、SVDD)以及渐进式种子剪枝(PSP)。所有结果均基于我们使用这些方法的公开实现进行的实验,并选择参数以匹配计算预算和相同的奖励引导:ImageReward。我们报告了从 GenEval 提示生成的最终图像上的引导奖励(ImageReward)、HPS、GenEval 和人工评估分数。PPS 在提示对齐方面取得了最佳结果,如自动分数(GenEval)和人工评估所衡量。

模型 采样器 T $\bar{N}$ IR $\uparrow$ HPS $\uparrow$ GenEval $\uparrow$ Human $\uparrow$

SD v1.5 标准 64 1 -0.159 0.257 0.434 0.431 SD v1.5 N选最佳 64 4 0.655 0.273 0.542 0.594 SD v1.5 FK-Steering [36] 64 4 0.640 0.261 0.531 0.569 SD v1.5 DSearch [23] 64 4 0.783 0.275 0.506 0.514 SD v1.5 NTS [34] 64 4 0.485 0.272 0.478 – SD v1.5 RBF [20] 64 4 0.670 0.274 0.520 – SD v1.5 BFS [52] 64 4 0.820 0.263 0.564 – SD v1.5 SVDD [24] 64 4 0.731 0.272 0.489 – SD v1.5 PSP 64 4 0.827 0.278 0.574 0.624

SDXL 标准 64 1 0.431 0.275 0.529 0.531 SDXL N选最佳 64 4 1.098 0.290 0.629 0.682 SDXL FK-Steering [36] 64 4 1.189 0.284 0.627 0.676 SDXL DSearch [23] 64 4 1.186 0.301 0.589 0.649 SDXL NTS [34] 64 4 0.967 0.298 0.580 – SDXL RBF [20] 64 4 1.133 0.302 0.618 – SDXL BFS [52] 64 4 1.247 0.285 0.636 – SDXL SVDD [24] 64 4 0.682 0.287 0.556 – SDXL PSP 64 4 1.224 0.294 0.645 0.713

SD 3.5 标准 32 1 1.045 0.297 0.713 0.787 SD 3.5 N选最佳 32 4 1.336 0.304 0.747 0.831 SD 3.5 FK-Steering [36] 32 4 1.294 0.284 0.742 0.837 SD 3.5 DSearch [23] 32 4 1.144 0.297 0.704 0.824 SD 3.5 NTS [34] 32 4 1.086 0.295 0.699 – SD 3.5 RBF [20] 32 4 1.253 0.296 0.738 – SD 3.5 BFS [52] 32 4 1.343 0.285 0.747 – SD 3.5 SVDD [24] 32 4 1.113 0.294 0.719 – SD 3.5 PSP 32 4 1.380 0.306 0.747 0.841

GenEval 分数和人工评估。此外,尽管 BFS [52] 在使用 SDXL 骨干网时在奖励最大化方面优于 PSP,但 PSP 在 GenEval 和人工评分方面仍然优于 BFS 和所有其他方法。这表明 PSP 不太容易受到奖励黑客攻击 [37],因为它专注于种子选择

第 10 页

10 R. Guimarães and P. Perona

但在推理过程中不会干扰旨在提高奖励的重采样过程。使用 HPS 进行奖励指导的补充实验见 Tab. S1,但 IR 通常能更好地泛化到 GenEval,使其成为实践中最佳的奖励指导方法。 SD 3.5 的结果也凸显了重采样方法的一个实际弱点:它们需要随机性来生成多样化的子样本,但随机性可能会降低流匹配(Flow Matching)的生成质量,导致 N选最佳(Best-of-N, BoN)的表现优于 FK-Steering。相比之下,渐进式种子剪枝(Progressive Seed Pruning, PSP)在确定性求解器下依然有效,因为它将计算资源分配给种子探索和早期剔除,而非随机分支。

4.3 人工评估

Tab. 1 中的人工评估结果来自具有 AI 评估经验的 Prolific 在线标注员。他们针对由 GenEval 提示词生成的图像回答了“图像是否与提示词一致?”这一问题,这些图像也使用了自动化指标进行评估,但每个提示词/方法/骨干网络三元组仅使用一个种子。据我们所知,这是首次针对文本到图像任务的推理时间扩展(Inference-Time Scaling)方法进行人工评估。共有 249 名标注员评估了 8,295 张图像(每个方法/骨干网络对评估 553 张,即 GenEval 提示词的数量)。每张图像获得了 3 次评估(共 24,885 个评分),并采用多数投票法确定单张图像是否与提示词一致。标注员的一致性为 80.3%。在所有三个骨干网络上,PSP 都是评估最佳的方法。

我们紧密遵循了 [18] 的方案(详见 Sec. S10 中的研究细节),该方案中作者使用类似研究来评估人工评估与 GenEval 评估之间的差异。在他们的研究中,仅使用标准采样器,且他们在跨研究共享的骨干网络上获得的分数与我们高度吻合(SDXL: 0.531 vs. 0.566; SD 3.5: 0.787 vs. 0.770),复现了他们的结果,从而验证了该方案的有效性。

4.4 计算扩展

为了测试 PSP 利用额外计算资源的有效性,我们将计算倍数(Compute Multiplier, $\bar{N}$)扩展至 16,通过加倍初始种子数量和幸存者数量,同时保持相同的分数剪枝点。Fig. 3(左图)显示,随着 $\bar{N}$ 的增加,PSP 持续改进,并在匹配计算量的情况下始终优于 N选最佳(BoN)。 由于 PSP 从 $2\bar{N}$ 条确定性轨迹开始,其最佳输出上限受限于这 $2\bar{N}$ 个种子中最佳的全去噪样本。当最终的最佳种子被错误地早期剔除时,剪枝会相对于此上限产生遗憾(regret)。Fig. 3(中图)显示,随着计算量的增加,这种遗憾逐渐减少,表明中间排名对于剪枝而言已足够可靠,且 PSP 仅使用 $\bar{N}$ 条完整轨迹的计算量即可接近 $2\bar{N}$ 个种子的上限。 最后,Fig. 3(右图)说明了推理时间扩展可以改变模型与计算量的权衡:具有较大 $\bar{N}$ 的较小骨干网络可以超越较大的

第 11 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 11

IR 与有效 N 遗憾:BoN(2N) – PSP(N) IR 与总生成 FLOPs 1.50 1.50 0.150 1.25 1.25 0.125 1.00 1.00 (IR) 0.100 IR 0.75 IR 0.75 0.075 0.50 遗憾 0.50 0.050 0.25 0.25 0.00 0.025 0.00 0.000 1 2 4 8 16 2 4 8 16 10^14 10^15 10^16 有效 N 有效 N 总生成 FLOPs 线条颜色:SD v1.5 SDXL SD 3.5 线条样式:PSP BoN

图 3:PSP 的扩展行为。左图:最终引导奖励与计算倍数 $\bar{N}$ 的关系,比较了在匹配计算量下 PSP 与 BoN 的表现。中图:PSP 相对于 BoN 的遗憾值,后者使用双倍计算量,会在完整去噪后从所有 $2\bar{N}$ 个候选者中选择最佳种子;遗憾值随 $\bar{N}$ 减小,表明在更大预算下剪枝变得愈发安全。右图:奖励与近似 FLOPs 的关系,显示推理时间扩展允许具有较大 $\bar{N}$ 的较小模型在相似计算量下匹配或超越较大的骨干网络。

在可比总 FLOPs 下的模型,突显了 PSP 作为部署时质量扩展的实用调节手段。

4.5 计算开销

PSP 相比 BoN 增加了计算开销,因为其中间样本必须由 VAE 解码,且中间样本必须由奖励模型进行评分。我们在表 2 中量化了在单个 H200 上的此开销,比较了在表 1 相同设置下的 PSP、等效 BoN ($N=4$) 和双倍计算 BoN ($N=8$)。在所有骨干网络中,PSP 相比 BoN ($N=4$) 仅增加了极少的运行时间,且比 BoN ($N=8$) 快近 2 倍。相对开销也随模型尺寸增大而减小,因为每个扩散步骤变得相对更昂贵。关于峰值 VRAM 使用量,内置的 VAE 切片选项通过 VAE 顺序解码图像而非并行解码。这在表 2 中被使用,增加了不到 0.15 秒的运行时间,并使 PSP 在 SD v1.5 和 SD 3.5 上的峰值 VRAM 接近 BoN($N=4$)。SDXL 是唯一一个

表 2:PSP 相比 BoN 的计算开销。

运行时间 (s) 峰值 VRAM (GiB) 模型 BoN PSP BoN BoN PSP BoN ($\bar{N}=4$) ($\bar{N}=4$) ($\bar{N}=8$) ($\bar{N}=4$) ($\bar{N}=4$) ($\bar{N}=8$)

SD v1.5 2.65 2.99 4.70 4.29 5.30 5.31 SDXL 12.48 13.74 23.90 8.28 13.27 10.79 SD 3.5 35.97 37.59 71.71 29.85 34.85 33.86

第 12 页

12 R. 古马拉因斯和 P. 佩罗纳

调整剪枝计划对剪枝计划性能的影响

图 4:调整剪枝策略可改善 PSP。左图:我们将默认的现成计划(实线)与在相同计算预算下通过网格搜索找到的最佳计划(斜线)进行比较。我们在 IR 基准的提示词上进行搜索,并使用 IR 作为指导信号,在 GenEval 的提示词上报告结果。右图:网格搜索中所有计划的可视化,颜色表示其在 IR 基准上的性能。更好的计划位于上方,并添加了抖动以利于可视化,同时高亮显示了最佳计划和默认计划。

它仍然明显较高,因为其 VAE 按比例更大。实际上,PSP($\bar{N}=4$) 在接近 BoN($N=4$) 的成本下考虑了一个 BoN($N=8$) 大小的种子池。

4.6 调整 PSP 计划

到目前为止,我们使用了一个由计算匹配驱动的简单默认计划。对于足够大的 $T$,由于 $\sum_{i=0}^{k} 2^{-i} = 2 – 2^{-k}$,几何减半计划允许我们以有效计算倍数 $\bar{N} = 2$ 评估任意数量的初始种子。将计划按因子 $m$ 缩放(即每个阶段的粒子数乘以 $m$)会产生 $\bar{N} = 2^m$。具体而言,存在权衡关系,因为较大的 $k$ 需要在信息量较少的阶段更早开始剪枝,因此我们的默认计划(图 2,右侧)有两个剪支点,允许在计算倍数 $\bar{N}$ 下考虑 $2\bar{N}$ 个初始种子(是 BoN 种子数的两倍),并使用 $m = 2$(因此 $\bar{N} = 4$),这与 [36] 中使用的计算设置相匹配。这一选择使 PSP 可以立即作为现成方案使用,并使得在表 1 中进行公平的基线比较成为可能,而无需超参数调整。

然而,PSP 具有丰富的设计空间:初始候选者的数量、剪支点的时间以及幸存者数量都可以变化,同时保持相同的总预算。因此,我们对每个模型和奖励选择保持 $\bar{N} = 4$ 的计划进行网格搜索,选择在保留的提示词集(Benchmark IR;详见附录 S5)上最大化奖励的计划,并在 GenEval 的提示词上进行测试。图 4 的左图显示,与我们的默认计划相比,调整后的计划在指导奖励、HPS

第 13 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 13

表 3:PSP 补充基于奖励的微调。在非微调模型上应用 PSP 优于在 DPO 微调模型上进行的标准采样,而在 DPO 微调模型上应用 PSP 则比 N选最佳 (BoN) 带来进一步的提升。

Model DPO Sampler T N IR ↑ GenEval ↑ SD v1.5 ✓ Standard 64 1 -0.022 0.454 SD v1.5 ✓ Best-of-N 64 4 0.751 0.562 SD v1.5 × PSP 64 4 0.827 0.574 SD v1.5 ✓ PSP 64 4 0.907 0.593 SDXL ✓ Standard 64 1 0.894 0.581 SDXL ✓ Best-of-N 64 4 1.300 0.657 SDXL × PSP 64 4 1.224 0.645 SDXL ✓ PSP 64 4 1.365 0.667

以及该任务的 GenEval 分数。右面板显示了所有搜索到的调度策略,并根据其在 IR 基准上的性能进行着色,突出了所选的最佳调度策略以及我们在调优之前使用的默认调度策略。我们可以看到它们并没有显著差异,因此我们的默认减半策略可以被视为一种良好的现成配置。差异主要在于,调优后的策略倾向于在最后阶段放弃一个样本,以便在推理过程超过 50% 后发展出 3 个样本。 一个关键的实用优势是,当采样是确定性的时,这种调优可以低成本完成。我们为每个提示在初始种子池中预计算轨迹和中间奖励。由于 PSP 的结果完全由调度策略和预计算的轨迹决定,我们可以在不重新运行生成器的情况下模拟许多调度策略,从而在默认调度策略可能远非最优的领域中进行快速的每任务调优。 图 S2(左)显示了调优(Benchmark IR)与测试集(GenEval)性能之间的正相关关系,表明更好的调度策略倾向于在提示集之间泛化。对于我们的默认调度策略,两个数据集的最终 IR 分布也非常相似(图 S2,中间)。图 S2(右)显示了 IR 对 GenEval 的边际收益递减:在高 IR 区间之外,进一步的 IR 提升对 GenEval 的转化较弱,这解释了对于 SD 3.5 等强骨干模型,GenEval 的提升较小。PSP 优化所提供的任何引导信号,并随着更强奖励模型的可用而直接受益。

4.7 与微调模型的比较

奖励模型也可用于微调生成器,从而将奖励优化分摊到许多未来的推理调用中。我们将 DPO 微调骨干网络 [43] 与在 Pick-a-Pic 数据集 [21] 上训练的模型进行比较。表 3 显示了两个要点。首先,对非微调骨干网络应用 PSP,配合适度的

第 14 页

14 R. Guimarães 和 P. Perona

表 4:在固定初始种子下搜索不同提示词。PSP 可以针对任何离散的初始条件集合进行优化,包括一组提示词。

模型 采样器 T N IR ↑ GenEval ↑

SD v1.5 标准 64 1 -0.230 0.391 SD v1.5 N选最佳 64 4 0.641 0.512 SD v1.5 PSP 64 4 0.782 0.533

SDXL 标准 64 1 0.471 0.501 SDXL N选最佳 64 4 1.256 0.598 SDXL PSP 64 4 1.319 0.604

计算倍数 ($\bar{N}$) 在微调骨干网络上优于标准推理。其次,PSP 与微调是互补的:在微调骨干网络上应用 PSP 会带来进一步的改进,并在相似的计算量下优于 BoN。因此,只要有额外的推理时间计算资源可用,即使存在微调模型,PSP 仍然有益。

4.8 多提示词上的 PSP

尽管我们的主要焦点是种子搜索,但 PSP 适用于推理时可用的任何离散候选池。一个实际的例子是提示词选择:现代系统通常会重写用户提示词 [3, 9, 11] 以扩展它并添加细节,不同的重写方式会显著改变结果的质量。定量上,先前工作 [18] 的分析表明,提示词重写可以带来 GenEval 分数的巨大提升。因此,我们应用 PSP 在固定噪声种子下从多个提示词重写中进行选择。表 4 显示,在此设置下,PSP 在同等计算量下优于 BoN。

在我们的实现中,我们使用 ChatGPT 5.2 [29] 为每个提示词生成一次提示词重写(详见第 S6 节),并将其视为初始候选集。这突显了 PSP 相对于基于重采样的方法的另一个实际优势:对提示词进行重要性采样需要开发一个随机“提示词变异”核,在推理期间反复生成子提示词,并且还需要承担多次从大型语言模型采样的额外成本,而 PSP 只需在每次推理时提供一个固定的候选集。

5 讨论

我们研究了在黑盒奖励下扩散模型和流匹配模型的推理时间扩展。我们的主要贡献是表明,如果我们放宽推理期间恒定内存的限制,这对于当今托管大多数生成模型的分布式系统来说是自然的,那么即使是非常简单的早期剪枝策略也比更强的基线更具计算效率。跨越

第 15 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 15

在扩散和流匹配骨干网络中,PSP 始终改善基于奖励的选择,并在计算量匹配的情况下,其 GenEval 得分高于 BoN 树搜索和重要性采样方法,并且随着计算量的增加,其性能持续扩展。

该设计的一个实际影响是,PSP 不需要随机性。基于重采样的方法依赖随机采样器从相同的中间状态生成多样的子节点。如果没有随机性,重采样将退化为重复的子节点,这相比 BoN 没有任何优势。相比之下,PSP 利用计算量来考虑更多的初始种子,从而增加保留优质种子的机会。我们显著的结果表明,在某些任务中,这比通过重采样反复“改进”当前最佳候选者是一种更重要且计算高效的扩散推理杠杆。这种确定性也与流匹配逐渐取代扩散的趋势相契合,因为在流匹配中,确定性采样器是标准配置。此外,由于 PSP 在给定初始种子时是确定性的,中间分数可以预先计算一次,从而能够针对特定任务、奖励和提示分布,高效地进行离线搜索以优化剪枝调度,而无需为每个候选调度重新运行生成模型。

PSP 有两个主要局限性。首先,它假设存在标量奖励,因此多目标或难以量化的设置(例如 ControlNet 风格 [51] 的约束生成,其中信号必须同时平衡文本对齐与严格的空间一致性)难以自然地表达为 PSP 进行剪枝排序的单一流。在实践中,这通常是可以克服的:许多严格空间任务允许使用标量感知损失(如 IoU、OKS),PSP 可以直接对其排序,并且在计算量匹配的情况下,它仍可能优于其他搜索/重采样方法。此类选择方法的更深层次的共同局限性在于缺乏空间方向性指导,而替代方案只能通过权衡来提供:ControlNet 需要额外的训练,而基于梯度的指导则需要可微奖励以及反向传播带来的巨大推理成本。其次,PSP 的优势源于其目标特征被确定的时机。对于提示对齐,显著特征较为粗糙且在采样早期固定,因此结果取决于初始种子,提前投入更多种子池会带来回报。而对于由轨迹后期生成的细粒度细节主导的目标(如美学质量),早期种子选择的重要性较低,收益相应减少。这在表 1 中 SDXL 相对较低的 HPS(也反映美学)中可见。

我们的创新在于发现,在推理过程中维持可变粒子数量是扩散和流匹配生成器在常数内存约束不具约束力时的一种强大且未被充分探索的推理时间扩展杠杆,这在典型的生产部署中尤为常见,其中推理运行在多 GPU 服务器上,且内存是弹性分配的。经验上,这种分配在匹配生成器计算量的情况下,始终优于更强的常数内存基线,并支持在确定性采样下进行离线调度调优。综上所述,我们的结果为现代生成模型的推理时间扩展提供了一个简单但强大的设计原则。

第 16 页

16 R. 古马良斯和 P. 佩罗纳

致谢

本研究由技术创新研究所(TII)资助,项目为“赋予 AI 代理层级组合与空间推理能力”。

参考文献

1. Bansal, A., Chu, H.M., Schwarzschild, A., Sengupta, R., Goldblum, M., Geiping, J., Goldstein, T.: 扩散模型的通用引导。在:国际学习表征会议。卷 2024,页 51304–51323 (2024) 2. Besta, M., Blach, N., Kubicek, A., Gerstenberger, R., Podstawski, M., Giani- nazzi, L., Gajda, J., Lehmann, T., Niewiadomski, H., Nyczyk, P., 等:思维图:利用大型语言模型解决复杂问题。在:AAAI 人工智能会议论文集。卷 38,页 17682–17690 (2024) 3. Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., Manassra, W., Dhariwal, P., Chu, C., Jiao, Y., Ramesh, A.: 通过更好的描述改进图像生成 (2023), https://cdn.openai. com/papers/dall-e-3.pdf, 访问日期:2026 年 7 月 22 日 4. Black, K., Janner, M., Du, Y., Kostrikov, I., Levine, S.: 使用强化学习训练扩散模型。在:国际学习表征会议。卷 2024,页 4965–4987 (2024) 5. Carmona, R., Fouque, J.P., Vestal, D.: 用于计算罕见信贷组合损失的相互作用粒子系统。金融与随机过程 13(4), 613–633 (2009 年 9 月)。https://doi.org/10.1007/s00780-009-0098-8, http://link.springer. com/10.1007/s00780-009-0098-8 6. Chung, H., Kim, J., McCann, M.T., Klasky, M.L., Ye, J.C.: 用于一般噪声逆问题的扩散后验采样。在:第十一届国际学习表征会议,ICLR 2023,卢旺达基加利,2023 年 5 月 1-5 日。 OpenReview.net (2023), https://openreview.net/forum?id=OnD9zGAGT0k 7. Cobbe, K., Kosaraju, V., Bavarian, M., Chen, M., Jun, H., Kaiser, L., Plappert, M., Tworek, J., Hilton, J., Nakano, R., Hesse, C., Schulman, J.: 训练验证器以解决数学应用题。CoRR abs/2110.14168 (2021), https://arxiv. org/abs/2110.14168 8. Del Moral, P.: 费曼-卡克公式。概率及其应用,施普林格纽约,纽约,纽约 (2004)。https://doi.org/10.1007/978-1-4684-9393- 1, http://link.springer.com/10.1007/978-1-4684-9393-1 9. Deng, C., Zhu, D., Li, K., Gou, C., Li, F., Wang, Z., Zhong, S., Yu, W., Nie, X., Song, Z., Guang, S., Fan, H.: 统一多模态预训练中的涌现特性。CoRR abs/2505.14683 (2025)。https://doi.org/10.48550/ARXIV.2505. 14683, https://doi.org/10.48550/arXiv.2505.14683 10. Elvira, V., Miguez, J., Djurić, P.M.: 关于具有自适应粒子数量的粒子滤波器的性能。统计与计算 31(6), 81 (2021) 11. Esser, P., Kulal, S., Blattmann, A., Entezari, R., Müller, J., Saini, H., Levi, Y., Lorenz, D., Sauer, A., Boesel, F., 等:扩展整流流Transformer以实现高分辨率图像合成。在:第四十一届国际机器学习会议 (2024)

第 17 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 17

12. Euler, L.: Institutiones calculi integralis, vol. 1. impensis Academiae imperialis scientiarum (1792) 13. Fox, D.: KLD-sampling: Adaptive particle filters. Advances in neural information processing systems 14 (2001) 14. Ghosh, D., Hajishirzi, H., Schmidt, L.: GenEval: An object-focused framework for evaluating text-to-image alignment. Advances in Neural Information Processing Systems 36, 52132–52152 (2023) 15. Guimarães, R., Xiao, F., Perona, P., Marks, M.: Diffusion-based action recognition generalizes to untrained domains. In: IEEE/CVF Winter Conference on Appli- cations of Computer Vision, WACV 2026, Tucson, AZ, USA, March 6-10, 2026. pp. 5919–5933. IEEE (2026). https://doi.org/10.1109/WACV61042.2026.00573, https://doi.org/10.1109/WACV61042.2026.00573 16. Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. Advances in neural information processing systems 33, 6840–6851 (2020) 17. Jamieson, K., Talwalkar, A.: Non-stochastic best arm identification and hyperpa- rameter optimization. In: Artificial intelligence and statistics. pp. 240–248. PMLR (2016) 18. Kamath, A., Chang, K., Krishna, R., Zettlemoyer, L., Hu, Y., Ghazvinine- jad, M.: GenEval 2: Addressing benchmark drift in text-to-image evaluation. CoRR abs/2512.16853 (2025). https://doi.org/10.48550/ARXIV.2512.16853, https://doi.org/10.48550/arXiv.2512.16853 19. Karnin, Z., Koren, T., Somekh, O.: Almost optimal exploration in multi-armed bandits. In: Dasgupta, S., McAllester, D. (eds.) Proceedings of the 30th inter- national conference on machine learning. Proceedings of machine learning re- search, vol. 28, pp. 1238–1246. PMLR, Atlanta, Georgia, USA (Jun 2013), https: //proceedings.mlr.press/v28/karnin13.html, number: 3 20. Kim, J., Yoon, T., Hwang, J., Sung, M.: Inference-time scaling for flow models via stochastic generation and rollover budget forcing. Advances in Neural Information Processing Systems 38, 30830–30864 (2026) 21. Kirstain, Y., Polyak, A., Singer, U., Matiana, S., Penna, J., Levy, O.: Pick-a-pic: An open dataset of user preferences for text-to-image generation. Advances in neural information processing systems 36, 36652–36663 (2023) 22. Lee, G., Bao, T.N.N., Yoon, J., Lee, D., Kim, M., Bengio, Y., Ahn, S.: Adap- tive Inference-Time Scaling via Cyclic Diffusion Search (Oct 2025). https:// doi.org/10.48550/arXiv.2505.14036, http://arxiv.org/abs/2505.14036, arXiv:2505.14036 [cs] 23. Li, X., Uehara, M., Su, X., Scalia, G., Biancalani, T., Regev, A., Levine, S., Ji, S.: Dynamic search for inference-time alignment in diffusion models. CoRR abs/2503.02039 (2025). https://doi.org/10.48550/ARXIV.2503.02039, https://doi.org/10.48550/arXiv.2503.02039 24. Li, X., Zhao, Y., Wang, C., Scalia, G., Eraslan, G., Nair, S., Biancalani, T., Ji, S., Regev, A., Levine, S., Uehara, M.: Derivative-free guidance in continuous and discrete diffusion models with soft value-based decoding. In: Belgrave, D., Zhang, C., Montoya, L.N., Lin, H., Pascanu, R., Koniusz, P., Ghassemi, M., Chen, N., Ruíz, I.V.M., Loaiza-Bonilla, A. (eds.) Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diago, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 – December 5, 2025 (2025), http://papers.nips.cc/paper_files/ paper/2025/hash/899af0d66d8850318a20781484416152-Abstract-Conference. html

第 18 页

18 R. Guimarães 和 P. Perona

25. Lipman, Y., Chen, R.T.Q., Ben-Hamu, H., Nickel, M., Le, M.: 用于生成建模的流匹配 (Flow Matching for Generative Modeling)。在:第十一届国际学习表征会议,ICLR 2023,卢旺达基加利,2023年5月1-5日。OpenReview.net (2023),https://openreview.net/forum?id=PqvMRDCJT9t 26. Liu, X., Gong, C., Liu, Q.: 直线且快速:学习使用整流流 (Rectified Flow) 生成和转移数据。在:第十一届国际学习表征会议,ICLR 2023,卢旺达基加利,2023年5月1-5日。OpenReview.net (2023),https://openreview.net/forum?id=XVjTT1nw5z 27. Luo, G., Dunlap, L., Park, D.H., Holynski, A., Darrell, T.: 扩散超特征:在时间和空间中搜索语义对应关系。在:Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S. (编) 神经信息处理系统进展 36:第37届神经信息处理系统年度会议,NeurIPS 2023,美国新奥尔良,2023年12月10-16日 (2023),http://papers.nips.cc/paper_files/paper/2023/hash/942032b61720a3fd64897efe46237c81-Abstract-Conference.html 28. Ma, N., Tong, S., Jia, H., Hu, H., Su, Y., Zhang, M., Yang, X., Li, Y., Jaakkola, T.S., Jia, X., Xie, S.: 超越去噪步数扩展的扩散模型推理时间扩展 (Inference-Time Scaling for Diffusion Models Beyond Scaling Denoising Steps)。CoRR abs/2501.09732 (2025)。https://doi.org/10.48550/ARXIV.2501.09732, https://doi.org/10.48550/arXiv.2501.09732 29. OpenAI: OpenAI GPT-5 系统卡片。CoRR abs/2601.03267 (2026)。https://doi.org/10.48550/ARXIV.2601.03267, https://doi.org/10.48550/arXiv.2601.03267 30. Oshima, Y., Suzuki, M., Matsuo, Y., Furuta, H.: 基于扩散潜在束搜索的推理时间文本到视频对齐。神经信息处理系统进展 38, 13170–13216 (2026) 31. Park, Y., Kwon, M., Choi, J., Jo, J., Uh, Y.: 通过黎曼几何的视角理解扩散模型的潜在空间。在:Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S. (编) 神经信息处理系统进展 36:第37届神经信息处理系统年度会议,NeurIPS 2023,美国新奥尔良,2023年12月10-16日 (2023),http://papers.nips.cc/paper_files/paper/2023/hash/4bfcebedf7a2967c410b64670f27f904-Abstract-Conference.html 32. Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., Müller, J., Penna, J., Rombach, R.: SDXL:改进潜在扩散模型以实现高分辨率图像合成。在:第十二届国际学习表征会议,ICLR 2024,奥地利维也纳,2024年5月7-11日。OpenReview.net (2024),https://openreview.net/forum?id=di52zR8xgf 33. Qi, Z., Bai, L., Xiong, H., Xie, Z:并非所有噪声都同等生成:扩散噪声选择与优化。CoRR abs/2407.14041 (2024)。https://doi.org/10.48550/ARXIV.2407.14041, https://doi.org/10.48550/arXiv.2407.14041 34. Ramesh, V., Mardani, M.: 通过噪声轨迹搜索实现扩散模型的测试时间扩展。神经信息处理系统进展 38, 87284–87317 (2026) 35. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: 使用潜在扩散模型进行高分辨率图像合成。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 10684–10695 页 (2022) 36. Singhal, R., Horvitz, Z., Teehan, R., Ren, M., Yu, Z., Mckeown, K., Ranganath, R.: 扩散模型推理时间扩展与引导的通用框架。在:Singh, A., Fazel, M., Hsu, D., Lacoste-Julien, S., Berkenkamp, F., Maharaj, T., Wagstaff, K., Zhu, J. (编) 第42届国际会议论文集

第 19 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 19

机器学习。机器学习研究论文集,第 267 卷,第 55810–55827 页。PMLR(2025 年 7 月),https://proceedings.mlr.press/v267/singhal25b.html 37. Skalse, J., Howe, N., Krasheninnikov, D., Krueger, D.: 定义和表征奖励博弈。神经信息处理系统进展 35,第 9460–9471 页(2022) 38. Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N., Ganguli, S.: 利用非平衡热力学进行深度无监督学习。在:国际机器学习会议。第 2256–2265 页。pmlr(2015) 39. Song, J., Meng, C., Ermon, S.: 去噪扩散隐式模型。在:第 9 届国际学习表征会议,ICLR 2021,虚拟会议,奥地利,2021 年 5 月 3-7 日。OpenReview.net(2021),https://openreview.net/forum?id=St1giarCHLP 40. Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., Poole, B.: 通过随机微分方程进行基于分数的生成建模。在:第 9 届国际学习表征会议,ICLR 2021,虚拟会议,奥地利,2021 年 5 月 3-7 日。OpenReview.net(2021),https://openreview.net/forum?id=PxTIG12RRHS 41. Tang, Z., Peng, J., Tang, J., Hong, M., Wang, F., Chang, T.: 通过直接噪声优化对扩散模型进行推理时间对齐。在:Singh, A., Fazel, M., Hsu, D., Lacoste-Julien, S., Berkenkamp, F., Maharaj, T., Wagstaff, K., Zhu, J.(编)第四十二届国际机器学习会议,ICML 2025,加拿大不列颠哥伦比亚省温哥华,2025 年 7 月 13-19 日。机器学习研究论文集,第 267 卷。PMLR / OpenReview.net(2025),https://proceedings.mlr.press/v267/tang25h.html 42. Valmeekam, K., Marquez, M., Sreedharan, S., Kambhampati, S.: 关于大语言模型的规划能力——一项批判性调查。神经信息处理系统进展 36,第 75993–76005 页(2023) 43. Wallace, B., Dang, M., Rafailov, R., Zhou, L., Lou, A., Purushwalkam, S., Ermon, S., Xiong, C., Joty, S., Naik, N.: 使用直接偏好优化对扩散模型进行对齐。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 8228–8238 页(2024) 44. Wu, L., Trippe, B., Naesseth, C., Blei, D., Cunningham, J.P.: 扩散模型中实用且渐近精确的条件采样。神经信息处理系统进展 36,第 31372–31403 页(2023) 45. Wu, X., Hao, Y., Sun, K., Chen, Y., Zhu, F., Zhao, R., Li, H.: 人类偏好评分 v2:评估文本到图像合成人类偏好的坚实基准。CoRR abs/2306.09341(2023)。https://doi.org/10.48550/ARXIV.2306.09341, https://doi.org/10.48550/arXiv.2306.09341 46. Xu, J., Liu, X., Wu, Y., Tong, Y., Li, Q., Ding, M., Tang, J., Dong, Y.: ImageReward:学习和评估文本到图像生成的人类偏好。神经信息处理系统进展 36,第 15903–15935 页(2023) 47. Xu, K., Zhang, L., Shi, J.: 好的种子造就好的收成:发现文本到图像扩散模型中的秘密种子。在:2025 IEEE/CVF 计算机视觉应用冬季会议 (WACV)。第 3024–3034 页。IEEE(2025) 48. Yang, K., Tao, J., Lyu, J., Ge, C., Chen, J., Shen, W., Zhu, X., Li, X.: 使用人类反馈微调扩散模型,无需任何奖励模型。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 8941–8951 页(2024)

第 20 页

20 R. Guimarães 和 P. Perona

49. Yao, S., Chen, H., Yang, J., Narasimhan, K.: Webshop: Towards scalable real-world web interaction with grounded language agents. Advances in Neural Information Processing Systems 35, 20744–20757 (2022) 50. Yao, S., Yu, D., Zhao, J., Shafran, I., Griffiths, T., Cao, Y., Narasimhan, K.: Tree of thoughts: Deliberate problem solving with large language models. Advances in neural information processing systems 36, 11809–11822 (2023) 51. Zhang, L., Rao, A., Agrawala, M.: Adding conditional control to text-to-image diffusion models. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 3836–3847 (2023) 52. Zhang, X., Lin, H., Ye, H., Zou, J.Y., Ma, J., Liang, Y., Du, Y.: Inference-time scal- ing of diffusion models through classical search. CoRR abs/2505.23614 (2025). https://doi.org/10.48550/ARXIV.2505.23614, https://doi.org/10.48550/ arXiv.2505.23614

第 21 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 21

补充材料

S1 中间奖励分析

最终最佳样本与最终奖励的相关性 中间与最终存活率遗憾 上半部分剪枝 1.00 1.0 1.0 0.9 0.1 样本 v1.5 0.75 0.8 0.50 0.7 0.01 SD 0.25 最佳 0.6 0.00 0.5 遗憾 0.001 1.00 最终 1.0 1.0 0.75 的 0.9 0.1 剪枝 SDXL 0.50 0.80.7 0.01 0.25 0.6 0.001 0.00 存活 0.5 上半部分 1.0 1.00 的 1.0 0.9 0.75 0.1 平均 3.5 0.8 0.50 0.7 0.01 SD 0.25 0.6 0.001 0.00 概率 0.5 0 25 50 75 100 0 25 50 75 100 0 25 50 75 100 推理进度 (%) 推理进度 (%) 推理进度 (%) K=2 K=8 K=2 K=8 IR HPS K=4 K=16 K=4 K=16

图 S1:中间奖励的信息量如何?左图:三个骨干网络在推理进度中,中间奖励 $r(\hat{x}_0(x_t))$ 与最终奖励 $r(x_0)$ 之间的相关性;ImageReward 在大多数步骤中提供的比 HPS 更高的相关性。中图:当在给定进度点从 K 个候选者剪枝到 K/2 时,最终最佳样本(按最终奖励)保留下来的概率。右图:当从 K 个候选者剪枝到 K/2 时,遗憾值(最终最佳样本与保留的最佳样本之间的差异)

PSP 的有效性取决于中间奖励排名是否保留了最终的最佳种子。图 S1(左)显示中间奖励相对较早变得具有信息量:相关性迅速上升并在不同骨干网络中保持高位。值得注意的是,ImageReward 在大多数进度点表现出比 HPS 更强的相关性,这有助于解释为什么 IR 引导的选择对 PSP 更有效,并更可靠地转化为表 1 中 GenEval 的提升。然而,相关性并非全部:PSP 需要在剪枝下中间排名保留顶级候选者。图 S1(中)直接通过估计基于给定步骤的中间分数,从 K 剪枝到 K/2 后最终最佳样本保留在幸存者集中的概率来衡量这一点。对于我们默认调度中使用的剪枝,不同模型的存活率很高(在 25% 推理时从 8 剪枝的存活率为 80%,在 50% 推理时从 4 剪枝的存活率为 90%),这支持了 PSP 背后的核心假设。即使最佳种子没有保留,图 S1(右)显示了相同剪枝操作的平均遗憾值,即真正最佳种子的最终奖励与最佳保留种子的最终奖励之间的差异。我们默认的调度具有

第 22 页

22 R. Guimarães 和 P. Perona

遗憾值接近 0.01,在我们进行剪枝的两个时间点均如此,除了较弱的 SD v1.5 模型。

第 23 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 23

S2 调整后调度策略的泛化性与奖励饱和。

固定 PSP 策略 IR 分布 平均 GenEval 按 IR 分箱的 Soft Score 0.5 0.8 1.4 SD 1.5 0.4 0.6 1.5 SDXL 0.3 1.2 0.4 SD 0.2 SD 3.5 0.2 0.1 1.0 0.0 0.0 prompts 0.8 0.5 0.8 0.6 SDXL 0.3 0.2 0.4 GenEval 0.4 0.6 on 0.4 0.1 0.0 0.2 0.0 IR 1.0 0.2 GenEval prompts 0.8 0.8 Avg 0.6 3.5 IR prompts 0.6 0.0 0.4 SD 0.4 0.2 0.2 0.2 0.0 0.25 0.50 0.75 1.00 1.25 -2 -1.5 -1 -0.5 0 0.5 1 1.5 2 -2 -1.5 -1 -0.5 0 0.5 1 1.5 2 IR prompts 上的平均 IR ImageReward ImageReward

图 S2:调整后调度策略的泛化性与奖励饱和。左图:各调度策略在调优集与 GenEval 上获得的奖励,显示出正相关性,表明过拟合有限。中图:代表性调度策略的奖励分布在不同的 prompt 集之间保持相似。右图:GenEval 与奖励(按 IR 分箱)的关系,说明了在 IR 较高时存在收益递减现象,此时引导指标的进一步改善对 GenEval 的转化效果较弱。

第 24 页

24 R. Guimarães 和 P. Perona

S3 带有 HPS 引导的实验

表 S1:HPS 引导下的结果。当 HPS 用作引导信号时,在匹配的有效计算量下,引导奖励(HPS)和 GenEval 的结果。

模型 采样器 T N¯ HPS ↑ GenEval ↑

SD v1.5 标准 64 1 0.257 0.434 SD v1.5 N选最佳 64 4 0.282 0.525 SD v1.5 FK-Steering [36] 64 4 0.280 0.511 SD v1.5 DSearch [23] 64 4 0.293 0.505 SD v1.5 PSP 64 4 0.288 0.541

SDXL 标准 64 1 0.275 0.529 SDXL N选最佳 64 4 0.298 0.617 SDXL FK-Steering [36] 64 4 0.299 0.590 SDXL DSearch [23] 64 4 0.311 0.580 SDXL PSP 64 4 0.304 0.625

SD 3.5 标准 32 1 0.297 0.713 SD 3.5 N选最佳 32 4 0.312 0.748 SD 3.5 FK-Steering [36] 32 4 0.302 0.729 SD 3.5 PSP 32 4 0.316 0.753

第 25 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 25

S4 Stable Diffusion 3.5 的随机性

图 S3:SD3.5 在保留的 IR 基准上的随机性校准。我们比较了确定性(无)、包装器健全性检查($\gamma = 0$)以及递增的受控噪声水平($\gamma = 0.001, 0.005, 0.01, 0.01414$)。选定的工作点是 $\gamma=0.005$,这是在不降低最终奖励的前提下测试的最高随机性水平。

我们从 SD3.5 流匹配欧拉求解器开始。设 $x_i$ 为第 $i$ 步的潜在变量,$\sigma_i$ 为对应的噪声水平,$v_\theta(x_i, \sigma_i, c)$ 为模型预测。在确定性采样中,更新公式为

$x_{i+1} = x_i + (\sigma_{i+1}-\sigma_i)\,v_\theta(x_i,\sigma_i,c). \quad \text{(S1)}$

标准随机采样实现。在默认的 SD3.5 调度器实现中,启用 stochastic_sampling 会将步长规则切换为

\begin{align} \hat{x}_0 &= x_i – \sigma_i\,v_\theta(x_i,\sigma_i,c), \\ x_{i+1} &= (1-\sigma_{i+1})\,\hat{x}_0 + \sigma_{i+1}\,\epsilon_i, \quad \epsilon_i \sim \mathcal{N}(0,I). \quad \text{(S3)} \end{align}

这是一种二元开/关模式:噪声幅度由求解器本身隐式地绑定到 $\sigma_{i+1}$,除了切换标志外,用户无法直接控制强度(或调度)。在我们的实验中,这种缺乏控制的情况始终导致下游指标变差,因此我们不使用这种内置模式。

我们的受控随机性修改。相反,我们保留公式 (S1) 中的确定性 SD3.5 欧拉步,并在基础更新后注入噪声:

\begin{align} x_{i+1}^{\mathrm{det}} &= x_i + (\sigma_{i+1}-\sigma_i)\,v_\theta(x_i,\sigma_i,c), \\ x_{i+1} &= x_{i+1}^{\mathrm{det}} + \sigma_{\mathrm{noise},i}\,\epsilon_i, \quad \epsilon_i \sim \mathcal{N}(0,I). \quad \text{(S5)} \end{align}

其中

$\sigma_{\mathrm{noise},i} = \sigma_i\sqrt{(1+\gamma)^2-1}\,s_{\mathrm{noise}}. \quad \text{(S6)}$

我们设置 $s_{\mathrm{noise}} = 1$,$s_{t,\min} = 0$,$s_{t,\max} = +\infty$,并直接调整 $\gamma$。操作上,$\gamma$ 被钳位到 $\gamma \in [0, \sqrt{…}]$ (S7)

因此,与公式 (S3) 不同,我们的方法提供了显式且连续的随机性控制:$\gamma = 0$ 完全恢复确定性 SD3.5,而增加 $\gamma$ 会以可预测的方式增加探索。

第 26 页

26 R. Guimarães 和 P. Perona

在保留调优数据上的 Gamma 扫描。图 S3 总结了我们在保留的 IR 基准(仅用于超参数调优)上对 $\gamma \in \{\texttt{none}, 0, 0.001, 0.01, 0.414\}$ 的扫描。其中,none 表示完全确定性的 SD3.5 代码路径(无随机性),而 $\gamma = 0$ 是我们带有零注入噪声的随机包装器的健全性检查。这两个健全性检查在数值噪声范围内应保持一致。如扫描所示,$\gamma = 0.005$ 是不降低最终图像奖励性能的最大噪声水平,因此我们将其用作随机设置。

第 27 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 27

S5 PSP 调度网格搜索

表 S2:调优对 PSP 的影响,按算法(调度式与动态式)分开。 调优列使用针对 IR/GenEval (IR) 的 IR 调优变体,以及针对 HPS/GenEval (HPS) 的 HPS 调优变体。

IR HPS GenEval (IR) GenEval (HPS) 模型 PSP 调优 PSP 调优 PSP 调优 PSP 调优

SD v1.5 0.827 0.836 0.288 0.288 0.574 0.571 0.541 0.541 SDXL 1.224 1.205 0.304 0.305 0.645 0.641 0.625 0.646 SD3.5 1.380 1.380 0.316 0.316 0.747 0.753 0.753 0.751

我们通过在一个保留的调优集(IR 基准)上搜索剪枝调度,来调优标准的渐进式种子剪枝 (PSP)。对于每个模型(SD1.5、SDXL、SD3.5),我们运行两次独立的搜索:一次由 ImageReward 引导,另一次由 HumanPreference 引导。选定的调度随后被用作第 4.6 节中该模型/指标设置的 PSP 调优配置。

计算高效的搜索协议。为了使此搜索可行,我们将生成与调度评估分开。对于 IR 基准中的每个提示,我们运行 32 个种子,并将每步指标(例如 prompt_id、seed、step、image_reward、human_preference)存储在 CSV 文件中。然后,网格搜索通过在缓存的轨迹上回放剪枝决策来评估 PSP 候选项,而无需再次运行扩散模型。这使得我们能够在固定样本/轨迹下评估大量候选调度,同时将搜索限制为最多四次剪枝事件。

搜索内容。PSP 调度由以下参数化:

– 初始粒子数 $k_{\mathrm{init}}$, – 剪枝时间 $(t_1, \dots, t_m)$,其中 $m \le 4$, – 幸存者数量 $(k_1, \dots, k_m)$,其中 $k_j$ 是在 $t_j$ 剪枝后保留的粒子数量。

搜索强制执行:

– 严格递增的剪枝时间 $t_1 < \dots < t_m$, – 严格递减的粒子数量 $k_{\mathrm{init}} > k_1 > \dots > k_m$, – 总计算预算不超过 N选最佳 (BoN) 基线预算($N = 4$)。

预算约束。设总去噪长度为 $T$。 对于调度 $\mathrm{protect}\big(k_{\mathrm{init}}, (t_1, \dots, t_m), (k_1, \dots, k_m)\big)$,粒子-步成本为:

$$ C = k_{\mathrm{init}} t_1 + \sum_{j=1}^{m-1} k_j (t_{j+1} – t_j) + k_m (T – t_m). \quad (S8) $$

第 28 页

28 R. Guimarães 和 P. Perona

我们仅保留满足 $C \le 4T$ 的调度策略。(S9) 因此,所有 PSP 候选方案均在与 Best-of-4 相同的计算约束下进行对比。

我们脚本中使用的搜索网格。在所有六个基准-IR 调优运行(SD1.5/SDXL/SD3.5 $\times$ IR/HPS 引导)中,我们使用:

– 引导指标:image_reward 或 human_preference。 – 逻辑种子:$\{0,1\}$(报告的指标是这两个种子窗口的平均值)。 – 最大剪枝事件数:$m=4$。 – 候选幸存者数量:$\{16,12,8,4,3,2,1\}$(也为 $k_{\mathrm{init}}$ 提供候选)。 – 候选剪枝时间点: • SD1.5 / SDXL ($T = 64$):$\{4,8,12,16,20,24,28,32,36,40,44,48,52,56,60\}$, • SD3.5 ($T = 32$):$\{2,4,6,8,10,12,14,16,18,20,22,24,26,28,30\}$。

选择标准。对于每个有效的调度策略,我们针对每个提示模拟 PSP 选择,并保留步骤 $T$ 的最终样本。调度策略根据提示上的平均最终指标进行排名,并对两个逻辑种子取平均。排名最高的调度策略即为针对该模型/奖励设置、在 IR 基准数据集上调优的 PSP 调度策略。 为 SD 3.5 预计算所有中间奖励(IR 和 HPS)在 IR 基准的 100 个提示上需要 39 个 H200 小时,在 GenEval 基准的 553 个提示上需要 216 个 H200 小时(9 天)。基于缓存值的网格搜索耗时 40 分钟,无需任何 GPU。

第 29 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 29

S6 提示词重写

提示词重写用于在不变动底层 GenEval 约束的前提下增加语义多样性。下面的重写指令于 2026 年 2 月 28 日发送给 ChatGPT 5.2 Extended Thinking,其思考耗时 6 分 42 秒。生成的重写提示词集合作为固定的预处理工件使用。

重写在搜索中的用法。对于每个原始 GenEval 提示词 $p$,我们生成 24 个保持约束的重写版本 $\{p^{(0)},\dots,p^{(23)}\}$。在搜索/评估期间,我们对同一基础提示词的所有重写版本保持相同的初始噪声种子。这控制了来自噪声的随机变化,使得跨重写版本的比较主要反映提示词措辞/构成的影响,而非不同的随机初始化。

为何 GenEval 评分仍然有效。GenEval 指标以对象为中心(所需对象/数量/属性/关系)。由于重写被约束为精确保留这些语义约束,生成的图像与相同的 GenEval 检查保持兼容。换言之,重写改变了措辞/风格/上下文,但未改变可测量的任务要求(对象存在性、数量、颜色和空间关系)。

提示词:

你正在为 GenEval 生成提示词扩展,同时保留原始评分约束。

目标:

  • 对于每个原始 GenEval 提示词条目,创建恰好 24 个提示词扩展。
  • 扩展应在语义上等价且保持约束,但足够多样化,以鼓励在相同初始噪声下生成不同的图像。

输入文件:

  • geneval_metadata.jsonl(每行一个 JSON 对象)。

输出文件:

  • geneval_metadata_multiprompts.json
  • 必须是有效的 JSON 数组。

每个原始提示词条目的必需输出模式: { "prompt_id": <int>, "tag": <string>, "include": <原始 include 数组>, "exclude": <原始 exclude 数组,如果存在>,

第 30 页

30 R. Guimarães and P. Perona

"original_prompt": <string>, "expansions": [ {"prompt_expansion_id": 0, "prompt": <string>}, {"prompt_expansion_id": 1, "prompt": <string>}, … {"prompt_expansion_id": 23, "prompt": <string>} ] }

硬性要求: 1) 保持与原始条目相同的约束:

2) 为每个 prompt_id 创建恰好 24 个扩展。 3) 使用唯一的 prompt_expansion_id 值 0..23。 4) 使扩展彼此具有实质性差异:

场景背景、背景风格

5) 提示词长度:

6) 仅输出严格有效的 JSON(无 Markdown,无评论)。

  • 相同的对象类别
  • 相同的数量
  • 相同的颜色要求
  • 相同的空间关系(左/右/上/下)(如存在)
  • 绝不添加相互矛盾的约束
  • 变化构图、相机取景、距离、角度、光照、
  • 不要改变必需的语义约束
  • 目标 35-45 个单词
  • 每个扩展提示词硬性上限 50 个单词

多样性指导:

  • 混合特写、中景、全景镜头。
  • 在兼容的情况下变化环境(工作室、户外、室内、城市、自然)。
  • 变化光照(柔和日光、阴天、温暖室内、戏剧性侧光),不改变语义。
  • 变化描述风格,同时保留所有必需的对象/属性/关系。

最终输出前的验证清单:

  • JSON 可解析。
  • 条目数量等于输入提示词数量。
  • 每个条目有 24 个扩展。
  • 扩展 ID 恰好为 0..23。
  • 所有提示词 <= 50 个单词。
  • 每个 prompt_id 的约束得以保留。

第 31 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 31

S7 实验细节

所有确定性策略(常规推理、N选最佳和渐进式种子剪枝)的结果均基于预生成的奖励轨迹计算,以确保效率和可复现性。对于每个模型和提示词,我们缓存了多个初始噪声种子下的每步奖励。随后,我们使用逻辑种子来确定运行的初始噪声种子,并评估常规推理、N选最佳和渐进式种子剪枝所能实现的结果。对于渐进式种子剪枝,评估是通过在缓存的轨迹上重放剪枝/选择决策来完成的。这避免了为每种策略变体重新运行扩散采样,使得广泛的调度扫描变得可行,如第 S5 节所述。

基线与主要比较

模型与提示词。我们在 GenEval 提示词上评估 Stable Diffusion v1.5、SDXL 和 Stable Diffusion 3.5。表 1 报告了图像奖励模型 (IR) 引导的结果,表 S1 报告了人类偏好评分 (HPS) 引导的结果。

比较方法。我们比较了以下方法:

– 标准方法:单样本生成 (N = 1)。 – N选最佳:N = 4,选择具有最佳引导分数的最终样本。 – FK-Steering:使用 K = 4 个粒子和 \lambda= 10 的顺序蒙特卡洛方法,采用 potential_type=max 和非自适应重采样。对于 SD v1.5/SDXL (T = 64):在 t \ in [12, 48] 期间每 12 步重采样一次,\ e ta=1.0。对于 SD 3.5 (T = 32):在 t \ in24] 期间每 6 步重采样一次,采用随机步长包裹 \ g amma=0.005。 – BFS:BFS 是仅改变重采样方法和退火调度的 FK-Steering;顺序蒙特卡洛过程的其余部分保持不变。我们保留 K = 4 个粒子,\lambda = 10,potential_type=max,以及相同的重采样窗口(T = 64 时,t \ in [12, 48] 每 12 步;T = 32 时,t \ in24] 每 6 步),并修改两项设置。首先,重采样:FK-Steering 使用多项式重采样,它根据权重独立抽取每个存活粒子,因此引入了较高的采样方差(粒子可能会随机重复或丢失);BFS 使用 SSP 重采样(resampling=ssp,Srinivasan 采样过程),这是一种低方差的子代分配方案,其中子代数量更紧密地跟踪粒子权重,从而在有限 K 下提高种群多样性。其次,退火调度,它控制权重在轨迹上的退火强度:FK-Steering 保持其恒定(tempering_schedule=constant),无论时间步如何,每次重采样时都施加相同的选择压力;BFS 则使用递增调度(tempering_schedule=increase),因此早期(当 \protect\hat{x}_ 0 估计不太可靠时)选择较柔和,后期(当它们提供更多信息时)选择更尖锐。SD 3.5 (T = 32) 使用随机步长包裹 \ g amma=0.005。

第 32 页

32 R. Guimarães 和 P. Perona

– DSearch:针对 SD v1.5/SDXL(T = 64)和 SD 3.5(T = 32),引导采用 {IR, HPS},搜索超参数为: \protect \texttt{num\_images} = 1, \protect\texttt{bs} = 1, \protect \texttt{duplicate\_size} = 1, \protect\texttt{w} = 2, \protect \texttt{oversamplerate} = 2, \protect \textt t {search\_schudule}=\texttt{all}, \protect \tex t tt {drop\_schudule}=\texttt{exponential}, \protect \texttt{replacerate} = 0, \protec t \texttt{PM},{variant}=\texttt and \ e ta=1.0。SD 3.5 额外使用随机步长包裹 \ g amma=0.005。 – Noise Trajectory Search (NTS):由 ImageReward 引导的局部 \epsilon-greedy 噪声轨迹搜索,在 T -1 个转换中的每一个都进行 K = 2 轮细化,每轮有 N = 2 个候选者。我们使用 \ e psilon=0.4 和 \ l ambda=0.15。 对于 SD v1.5/SDXL:T = 64,引导尺度 7.5,\ e ta=1.0。对于 SD 3.5:T = 32, 引导尺度 7.0,随机步长包裹 \ g amma=0.005。 – Rollover Budget Forcing (RBF):基于粒子的采样,具有滚动每步 NFE 预算,上限为 \protect{max\_nfe},\texttt \protect \texttt{batch\_size} = 2,IR 奖励。SD v1.5/SDXL:\protect \texttt{init\_n\_particles} = 8, \protect\texttt{max\_nfe} = 256, T = 64,引导 尺度 7.5,在原生 VP 调度上使用 \ e ta=1.0 的随机 DDIM。SD 3.5: \protect \texttt{init\_n\_particles} = 4, \protect\texttt{max\_nfe} = 128, T = 32,引导 尺度 7.0,SDE 积分(\protect \texttt {di f fusion\_coefficient}=\texttt{square}, \protect \text t t{diffusion\_norm}=3.0) 在 VP 转换的流匹配调度上。 – SVDD:我们运行 SVDD-PM,\protect \texttt{duplicate\_size} = 4(每个提示 4 个候选者/粒子)并使用 ImageReward 引导。对于 SD v1.5(T = 64):引导 尺度 7.5,分辨率 512 \times 512,\ e ta=1.0,\protec t \texttt{PM}.{variant}=\texttt 对于 SDXL(T = 64): 引导尺度 7.5,分辨率 1024\times 1024,配置为 \protect \texttt{num\_particles} = 4, \lambda = 10, \protect \text t t {potential\_type}=\texttt{diff}, \protect \ t exttt {resampling}=\texttt{multinomial}, \protect \texttt {resample\_frequency} = 1,非自适应 重采样,\protect \texttt {resampling\_t\_start} = 0, \protect \texttt{resampling\_t\_end} = 64,最后是 \protect \texttt { tempering\_schedule}=\texttt{constant}。对于 SD 3.5(T = 32):引导尺度 7.0, 分辨率 1024 \times 1024,与之前相同的 SVDD 重采样配置(\protect \texttt{resampling\_t\_end} = 32),加上 \ g amma=0.005 的随机步长包裹。 – PSP( ours):默认调度为 • SD v1.5/SDXL:k_{\m a th r m {in it}} = 8 ,\;t=(16,32),\;k=(4,2),\;T=64 ; • SD 3.5:k_{\m a th r m {i nit} } = 8,\ ; t =(8,16),\;k=(4,2),\;T = 32。

评估协议。每种方法都在 GenEval 上进行评估,通过为每个提示选择一个最终样本(具有最高奖励引导的样本),然后聚合:

– 最终平均奖励引导(IR 或 HPS) – GenEval 总体得分(按任务划分的平均正确率)。

对于表 1 和表 S1 中的所有结果,我们报告了 3 次不同运行的平均结果。对于标准/BoN/PSP,我们为每个提示预计算 32 个初始噪声种子,并使用不同的不重叠初始噪声种子组来报告不同运行的平均结果。

随计算量扩展

目标和设置。我们在更大的计算预算下比较 BoN 和 PSP,有效 \p r ote ct \ barN\{2,4,8,16\}(可选地包括 N = 1 时的 BoN 作为参考点)。结果展示了 SD v1.5、SDXL 和 SD 3.5 的情况。

第 33 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 33

扩展策略。从基础 PSP 调度开始,我们按比例扩展 $k_{\mathrm{init}}$ 和幸存者数量以匹配 $N,\protect\bar$,强制执行成比例的剪枝约束,并通过在缓存轨迹上回放来评估每个扩展调度,用于 BoN 和 PSP。

绘图量。我们报告: – 分数与有效 $N\protect\bar$ 的关系(IR 或 GenEval), – 遗憾值与 $N,\protect\bar$ 的关系,定义为

\math rm { Regret}( \ bar N) =\mathrm{BoN}(2\barN)\mathrm{\PSP}(\barN),

– 分数与总生成 FLOPs 的关系。

FLOPs 核算。每步 FLOPs 通过基于分析器的 FLOPs 核算(SD v1.5/SDXL 使用 UNet,SD 3.5 使用扩散 Transformer)从一次去噪器前向传播中测量。总生成 FLOPs 随后计算为:

\mathrm { FL O Ps}_{\mat h rm{total}}=\barN\times\mathrm{FLOPs}_{\mathrm{step}}\timesT,

其中 SD v1.5/SDXL 的 $T = 64$,SD 3.5 的 $T = 32$。

中间奖励分析 我们利用每步缓存轨迹分析中间奖励对最终结果的 informative 程度。

中间-最终奖励相关性。每个提示使用 32 个种子。在每个去噪步骤 $t$,我们合并所有 $(\text { prompt},\text{seed})$ 对,并计算同一种子中间奖励与最终奖励之间的皮尔逊相关系数:

\ma thrm {c orr }\!\ lef t ( r _t^{\ mathr m { IR} }(p,s ),\ , r _T^{\mathrm{IR}}(p,s)\right\qquad\mathrm{corr}\!\left(r_t^{\mathrm{HPS}}(p,s),\,r_T^{\mathrm{HPS}}(p,s)\right

因此,该曲线展示了步骤 $t$ 的奖励对种子在 $T$ 时的最终奖励的预测能力,聚合了所有提示和所有 32 个种子。

剪枝下最终最佳样本的存活率。对于每个 $K \in \ {2 ,4,8,16\ }$ 和提示 $p$,我们形成一个包含 $K$ 个种子的固定种子包 $\prot e ct \ m a t h c al{S}_K(p)=\{0,\dots,K-1\}$。然后,令 s_{ K ,p} ^\s arg \ma x _{s\mathcal{S}_K(p)}r_T^{\mathrm{IR}}(p,s) tar = \

为 $\protect\mathcal{S}_K(p)$ 中原始 $K$ 个种子在步骤 $T$ 的最终最佳种子。在步骤 $t$,我们根据中间 IR 保留 $\protect\mathcal{S}_K(p)$ 的前半部分,并检查 $s_p^\star$ 是否存活。报告的曲线是每个时间步长下所有提示中此存活率的频率。

剪枝后的遗憾值。使用相同的固定包 $\protect\mathcal{S}_K(p)$,在步骤 $t$ 根据中间 IR 选择前半部分幸存者,并在最终 IR 空间中计算遗憾值:

\mathrm { Reg t)= \m ax _{s _K(p )} r_T^{\mathrm{IR}}(p,s)\max_{s\in\mathrm{TopHalf}_t(\mathcal{S}_K(p))}r_T^{\mathrm{IR}}(p,s). ret}_K( \in \mathcal {S}

绘制的值是该量在所有提示上的平均值。

第 34 页

34 R. Guimarães 和 P. Perona

调优的 PSP 调度 调优的 PSP 调度是通过第 S5 节描述的网格搜索过程选择的。我们报告使用两个逻辑种子(定义初始噪声种子组)的调优结果,这样,对于每个提示有 32 个预计算的初始噪声种子,即使对于最大的初始池 ($k_{\mathrm{init}} = 16$),我们也能始终形成两个不重叠的窗口。我们使用 Benchmark IR 中的提示进行搜索,并为每个模型/奖励对选择最佳的剪枝调度。

选定的调度(调优设置)。

– SD v1.5 (IR): $k_{\mathrm{init}}=8, \; t= (20,36,56),\;k=(3,2,1),\;T = 64$. – SD v1.5 (HPS): $k_{\mathrm{init}}=16,\;t=(4,8,20,28),\;k=(12,4,3,2),\;T=64$. – SDXL (IR): $k_{\mathrm{init}}=16,\;t=(4,8,24,40),\;k=(8,4,3,2),\;T=64$. – SDXL (HPS): $k_{\mathrm{init}}=12, \; t=(8,12,24),\;k=(8,4,2),\;T=64$. – SD 3.5 (IR): $k_{\mathrm{init}}=8,\;t=(8,12,22,30),\;k=(4,3,2,1),\;T=32$. – SD 3.5 (HPS): $k_{\mathrm{init}}=8,\;t=(8,12,22,30),\;k=(4,3,2,1),\;T=32$.

与微调模型的比较

模型。我们包括两个 DPO 微调生成器:

– 一个 DPO 微调的 SD v1.5 模型, – 一个 DPO 微调的 SDXL 模型。

协议。对于每个微调模型,我们运行与基础模型设置中相同的离线选择流程,基于预计算的推理轨迹,比较标准推理、BoN ($N = 4$) 和 PSP,并在匹配的逻辑种子窗口下进行。

引导和调度。在这些微调模型的比较中,引导基于 IR。PSP 使用 $k_{\mathrm{init}} = 8$、截止时间为 (16, 32)、幸存者 (4, 2) 和 $T = 64$ 进行评估。结果是对 3 个逻辑种子(生成 3 组不重叠的初始噪声种子)取平均。

第 35 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 35

S8 预测的干净图像 (ˆx0) 示例

为了具体说明现成奖励函数在中间步骤实际评分的内容,我们可视化了我们的方法在不同时间步和不同骨干网络中将预测的干净图像 ˆx0 输入奖励模型的情况。在每一步中,奖励并非基于噪声潜在变量 xt(第一行)计算,而是基于模型对干净图像的估计 ˆx0(第二行),并将其解码到像素空间。每个估计值的 ImageReward 报告在其下方。请注意,对于提示对齐至关重要的图像粗略特征在去噪过程的早期就已确定,因此即使是早期的 ˆx0 估计值也已经暴露出奖励函数可以作用的布局和对象组成。

“一个停车标志左侧有一头牛的照片”(SD 1.5,64 步)

第 0 步 第 16 步 第 32 步 第 64 步 纯噪声 (25% 去噪) (50% 去噪) (100% 去噪)

xt 图像 噪声

x0 估计值 干净

IR = -2.282 IR = -2.258 IR = -0.477 IR = -0.230

图 S4:Stable Diffusion v1.5(64 步)的预测干净图像 ˆx0。

第 36 页

36 R. Guimarães 和 P. Perona

“停车标志左侧的一头牛的”照片(SDXL,64 步)

第 0 步 第 16 步 第 32 步 第 64 步 纯噪声 (25% 去噪) (50% 去噪) (100% 去噪)

$x_t$ 图像 噪声

$x_0$ 估计 干净

IR = -2.286 IR = 1.104 IR = 1.664 IR = 1.576

图 S5:Stable Diffusion XL(64 步)预测的干净图像 $\hat{x}_0$。

“停车标志左侧的一头牛的”照片(SD 3.5,32 步)

第 0 步 第 8 步 第 16 步 第 32 步 纯噪声 (25% 去噪) (50% 去噪) (100% 去噪)

$x_t$ 图像 噪声

$x_0$ 估计 干净

IR = -2.284 IR = 0.807 IR = 1.536 IR = 1.470

图 S6:Stable Diffusion 3.5(32 步)预测的干净图像 $\hat{x}_0$。

第 37 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 37

S9 生成示例

GenEval(提示 ID 0、100、200、300、400)中性提示在不同模型和采样算法下的生成示例。

一张瓶子的照片 一张紫色冰箱的照片 一只鸟的照片 左侧 一张长凳的照片 一盆盆栽 三辆公交车的照片 一张沙发的照片

Stable Diffusion v1.5

Stable Diffusion v1.5 +DSearch

Stable Diffusion v1.5 +FK-Steering

Stable Diffusion v1.5 +PSP ( ours )

图 S7:Stable Diffusion v1.5 的生成示例。

第 38 页

38 R. Guimarães 和 P. Perona

一瓶子的照片 紫色的一张照片 一只鸟的照片 左侧 一张长椅的照片 一台冰箱 三辆公交车的照片 盆栽 沙发的照片

Stable Diffusion XL

Stable Diffusion XL +DSearch

Stable Diffusion XL +FK-Steering

Stable Diffusion XL +PSP ( ours )

图 S8:Stable Diffusion XL 的生成示例。

一瓶子的照片 紫色的一张照片 一只鸟的照片 左侧 一张长椅的照片 一台冰箱 三辆公交车的照片 盆栽 沙发的照片

Stable Diffusion 3.5

Stable Diffusion 3.5 +DSearch

Stable Diffusion 3.5 +FK-Steering

Stable Diffusion 3.5 +PSP ( ours )

图 S9:Stable Diffusion 3.5 的生成示例。

第 39 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 39

S10 人工评估

本节提供第 4.3 节中总结的人工评估的更多细节,包括招募、标注界面、质量控制机制、分配流程和分数聚合。我们采用了与 [18] 相同的标注员指令和评估标准,以便我们在共享的标准采样器条件下与他们的结果直接可比。因此,指令和评估问题完全相同;然而,在线平台和数据收集管道的细节(如下所述界面、分配逻辑和质量控制机制)是我们自己的,因为这些在该工作中并未公开发布。

招募与参与者。标注员通过 Prolific 招募,并经过预筛选,仅包括具有 AI 评估任务经验的工人。参与完全匿名:我们仅存储 Prolific 提供的用于管理提交的标识符,未收集任何个人身份信息。参与者可随时退出研究,并被告知若无法一次性完成则应退出。总计,249 名标注员贡献了评估。每位标注员被分配约 100 张图像的任务,根据我们的试点研究,包括指令在内,一次任务大约需要 25 分钟。

研究组织。我们将评估运行为由骨干网络(SD 1.5、SDXL 和 SD 3.5)组织的一系列独立研究。研究彼此完全隔离:标签可用性、覆盖要求和每位标注员的去重均在每个研究的基础上强制执行,因此一个研究中的任何标注都不会影响另一个研究的计数或分配。每幅图像(即每个提示/方法/骨干三元组,使用单个种子)配置为接收恰好 3 次独立评估。

标注任务与界面。界面遵循固定流程:(i) 同意屏幕,(ii) 多页指令集,以及 (iii) 标注任务。对于每幅图像,标注员回答两个强制性的二元(是/否)问题:

– Q1(对齐):“图像是否与提示对齐?” – Q2(质量):“图像质量好吗?(即物体是否结构良好?)”

提示显示在图像上方,示例标注屏幕如图 S11 所示。表 1 中报告的结果使用了对齐问题(Q1),这与自动化 GenEval 指标使用的标准一致。我们包括质量问题(Q2)以解耦感知图像质量与对齐:通过为标注员提供专门记录质量问题的地方,我们劝阻他们不要让图像质量影响其对对齐的判断。遵循 [18],质量响应本身不用于任何报告的分数,仅起到解耦作用。

第 40 页

40 R. Guimarães 和 P. Perona

质量控制。为了遏制仓促、低质量的回复,每张图像的“是/否”按钮被隐藏,仅在图像加载完成后经过短暂的强制审查延迟才会显示,并提示标注员在此期间仔细审查提示词和图像。类似地,为了鼓励标注员阅读说明页面,在每页上短暂锁定了页面跳转功能。会话受固定时间预算约束(从会话开始计时的非滚动过期机制);超时者将被强制退出,其未完成的工作不计入目标。每张图像的响应时间和说明/任务计时均作为遥测数据记录,用于审计。

分配与去重。分配通过服务器端基于预物化的基于槽位的方案计算得出。对于每项研究,我们预先计算了一组固定的“槽位”,每个槽位是一个图像束,大小适配单个会话(约 100 张图像),且所有槽位共同确保每个提示词/方法/骨干网络三元组恰好被覆盖 3 次。当标注员开始时,他们原子性地认领一个未被认领的槽位,从而保证 (a) 没有标注员会对同一个三元组进行多次标注,且 (b) 每张图像的评估总数上限为目标值。如果会话过期或被退回,其槽位会被释放并回收给新的标注员,且仅统计已完成槽位的响应,从而防止因部分完成的会话导致的重复计数。

聚合与一致性。对于每张图像,我们通过多数投票聚合 3 个对齐(Q1)判断,以获得二元的“对齐/不对齐”决策,而方法/骨干网络分数则是这些单图像决策的平均值。总计,8,295 张图像(553 个提示词 × 5 种方法 × 3 个骨干网络)获得了 24,885 次评分。作为可靠性的度量,我们报告了标注员间一致率,定义为至少获得一票且所有评分者给出相同答案的图像比例;在整个研究中,该一致率为 80.3%。

与先前工作的验证。如第 4.3 节所述,限制使用与 [18] 共享的骨干网络上的标准采样器,能够紧密复现其报告的人类评分(SDXL:0.531 对比 0.566;SD 3.5:0.787 对比 0.770),这验证了我们的招募、界面和聚合流程忠实地遵循了其协议。

第 41 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 41

图 S10:在线平台上呈现给标注员的一组完整指令(按顺序排列),涵盖任务描述、两个评估问题,以及对齐与不对齐、高质量与低质量生成的示例。这些指令遵循 [18] 中的内容。

第 42 页

42 R. Guimarães 和 P. Perona

第 43 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 43

第 44 页

44 R. Guimarães 和 P. Perona

第 45 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 45

第 46 页

46 R. Guimarães 和 P. Perona

第 47 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 47

第 48 页

48 R. Guimarães 和 P. Perona

第 49 页

通过渐进式种子剪枝实现扩散模型的推理时间扩展 49

图 S11:用于标注的图像示例,提示词显示在图像上方,以及两个二元(是/否)问题 Q1(对齐)和 Q2(质量)。答案按钮仅在短暂的强制审查延迟后出现。

发表评论