快速导读:提出BRACE,一种无需训练的基于重心有理外推的特征预测框架,通过直接聚合稀疏历史特征来替代导数驱动的多项式外推,以稳定处理DiT特征轨迹中的尖锐不规则性,实现高质量加速推理。
扩散Transformer(DiT)已成为高质量图像和视频生成的主流架构,但其巨大的计算开销严重制约了推理效率。特征缓存作为一种免训练加速策略,已从简单的直接复用演进到主动预测未来特征。然而,现有预测方法普遍采用导数驱动的多项式外推,在面对DiT特征轨迹中频繁出现的尖锐不规则性时,高阶导数爆炸导致预测发散,严重损害生成质量。
BRACE(Barycentric Rational Forecasting)提出了一种全新的特征预测范式。它不再依赖有限差分估计导数,而是通过重心有理函数直接聚合稀疏历史特征来合成未来特征。该方法的核心洞察在于:DiT特征轨迹虽然全局平滑,但局部存在剧烈的非线性变化,而有理函数基比多项式基更适合拟合这类轨迹。实验表明,BRACE在DiT-XL/2、FLUX.1-dev和HunyuanVideo上均取得了优于现有方法的加速效果。
英文题目:BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference
论文出处:arXiv 每日论文精选 · arXiv:2608.07572
原始论文:PDF / 论文页面
这篇论文解决什么问题?
DiT的去噪过程需要反复通过深层Transformer计算所有时间步的特征,计算量极大。特征缓存方法通过跳过部分Transformer层的计算来加速推理,其关键挑战在于如何准确地估计被跳过层的输出特征。早期的复用方法(如DeepCache、FORA)直接使用缓存中的历史特征作为近似,虽然简单但精度有限。
TaylorSeer等预测方法试图通过外推来提高精度:它们利用缓存特征的有限差分来估计各阶导数,然后构建泰勒多项式来预测未来特征。然而,这种方法存在根本性的数值缺陷。论文第2页的图1(a)显示,DiT特征轨迹在不同层中都呈现出尖锐的局部不规则性——这些剧烈的拐点使得高阶有限差分急剧放大,导致多项式预测在拐点处严重偏离真实轨迹。
图1(b)以第15层为例直观展示了这一问题:TaylorSeer在特征轨迹的拐点处出现明显的预测发散,而BRACE则能稳健地跟踪真实流形。图2(a)进一步从数值角度揭示了问题的根源:随着差分阶数增加,高阶差分的幅度呈爆炸式增长,这直接证明了导数驱动方法在DiT特征上的内在不稳定性。
图2(b)通过插值误差对比实验揭示了一个更深层的洞察:在相同的历史信息约束下,多项式基在局部奇异点附近会产生漂移,而有理函数基则能更好地适应这些局部不规则性。这为BRACE采用重心有理外推提供了理论动机。
核心创新
- 提出特征驱动的重心有理预测范式,替代导数驱动的多项式外推,从根本上避免因估计不稳定导数而导致的误差放大。
- 设计适配切比雪夫权重,并将其无缝集成到重心有理框架中,以增强长步外推的数值稳定性并适应DiT特征的非线性动态。
- 揭示了DiT特征演化具有全局平滑但频繁出现尖锐不规则性的双重几何特性,并从理论和实验上验证了有理基在拟合此类轨迹时优于多项式基。
方法概览
BRACE框架交替进行全计算和快速预测。在全计算步,将精确特征和时间步存入FIFO局部滑动窗口。在预测步,首先通过域映射将时间戳归一化到[-1,1]区间,然后利用适配的切比雪夫权重构建第二类重心有理函数,直接聚合缓存的历史特征来合成未来特征,从而绕过神经网络计算。
- 系统级流水线:BRACE交替执行全计算步和快速预测步。在全计算步,DiT正常计算所有层,并将精确特征连同时间步存入一个FIFO局部滑动窗口。在预测步,跳过Transformer计算,直接从滑动窗口中的稀疏历史缓存合成未来特征。
- 域映射:在进行外推之前,BRACE首先将时间步通过线性映射归一化到[-1, 1]区间。这一步的目的是避免因时间步数值范围变化导致的外推不稳定,为后续数值计算提供良好的条件数。
- 重心有理外推:这是BRACE的核心数学工具。给定滑动窗口中的C个历史特征-时间对,BRACE构建第二类重心有理函数。该函数以历史特征为节点值,通过有理插值的形式直接聚合这些节点来预测目标时间步的特征,完全绕过了导数估计。
- 适配切比雪夫权重:为了增强长步外推的数值稳定性,BRACE采用适配的切比雪夫权重方案。这些权重根据预测点与历史节点的距离自适应调整,使得外推函数在边界附近保持有界,避免传统有理外推在远距离预测时的震荡问题。
- 边界敏感系数γ:BRACE引入了一个关键超参数γ来控制外推函数对边界区域的敏感度。γ∈[0,1]调节了权重分布的集中程度,较小的γ使预测更依赖最近的历史点,较大的γ则赋予远端历史点更多影响。
- 计算开销:重心有理外推的计算仅涉及少量向量加权求和,相比完整的Transformer前向传播,其开销几乎可以忽略不计。这使得BRACE在保持高预测精度的同时实现了实质性的推理加速。
逐图理解论文
失败案例与直觉

图1展示了DiT特征轨迹的几何复杂性。子图(a)显示不同层的特征轨迹都包含尖锐的局部不规则性,这些拐点是导数驱动方法失效的根源。子图(b)以第15层为例,直观对比了TaylorSeer在拐点处的发散和BRACE对真实流形的稳健跟踪。
核心区分与研究空白

图2从数值角度揭示了问题的本质。子图(a)显示随着差分阶数增加,高阶差分的幅度急剧增长,证明了导数估计的内在数值不稳定性。子图(b)通过插值误差对比表明,在相同历史信息约束下,有理基比多项式基更适合拟合具有局部奇异性的轨迹。
BRACE的贡献与解决方案

图3展示了BRACE框架的完整架构。左侧为系统级流水线,管理FIFO滑动窗口以维护稀疏历史缓存。右侧为预测微架构,展示了域映射、重心有理外推和适配切比雪夫权重如何协同工作,以极小的计算开销合成高保真特征。
核心结论与意义

表1汇总了DiT-XL/2上类别条件图像生成的定量对比结果。在不同加速步长N下,BRACE的FID指标持续优于TaylorSeer和HiCache,验证了有理外推在中等规模模型上的有效性。
实验如何设计?
- 类别条件图像生成:在ImageNet-1K上使用DiT-XL/2模型,评估不同加速步长N下的FID指标,对比方法包括TaylorSeer、HiCache和FORA。
- 文本到图像生成:在DrawBench上使用FLUX.1-dev模型,评估ImageReward和CLIP Score,验证方法在更大规模模型上的泛化能力。
- 文本到视频生成:使用HunyuanVideo模型,评估VBench综合得分,验证方法在视频时序特征预测上的有效性。
- 消融实验:在FLUX.1-dev和DiT-XL/2上分别测试窗口容量C和边界敏感系数γ的影响,确定最优超参数配置。
- 外推方案对比:在FLUX.1-dev上对比不同重心形式(第一类/第二类)和不同权重方案(均匀权重、切比雪夫权重等)的性能差异。
关键结果与论文证据
- DiT-XL/2上N=6时,BRACE的FID达到3.06,优于TaylorSeer的3.17和HiCache的3.09,证明了有理外推在中等加速比下的质量优势(第6页表1)。
- FLUX.1-dev上N=7时,BRACE的ImageReward为0.9884,CLIP Score为27.7372,均达到或接近无加速基线水平,表明方法在大模型上同样有效(第7页表2)。
- HunyuanVideo上N=6时,BRACE的VBench得分为80.14,优于TaylorSeer的79.87和HiCache的79.93,验证了方法在视频生成任务上的泛化性(第8页表3)。
- 窗口容量消融显示C=3为最优设置,过小的窗口(C=2)信息不足,过大的窗口(C=4)引入冗余历史反而降低精度(第8页表4)。
- 边界敏感系数消融表明γ=0.7在多数指标上表现最佳,但重建指标(PSNR、SSIM)和感知指标(ImageReward)的最优γ值存在分歧(第8页表5)。
- 外推方案对比证实第二类重心形式配合适配切比雪夫权重的组合优于第一类重心形式和均匀权重方案,验证了方法设计的合理性。
- 定性可视化结果显示,BRACE生成的图像在细节保真度和语义一致性上均优于对比方法,尤其在复杂场景下优势更为明显(第6页图4、第7页图5)。
- 视频生成的可视化对比表明,BRACE在保持时序连贯性和运动自然度方面同样优于现有方法(第8页图6)。
阅读时需要注意
- 边界敏感系数γ的最优值在重建指标和感知指标之间存在分歧,其深层原因尚不明确,可能涉及两类指标对特征预测误差的不同敏感模式。
- 方法基于局部滑动窗口,超稀疏缓存容量(C≤3)限制了可利用的历史信息长度,在极端加速比下可能面临信息不足的问题。
- BRACE的性能依赖于DiT特征轨迹具有局部平滑性的假设,对于架构差异较大的非DiT模型,该假设的有效性需要进一步验证。
- 当前方法仅在单步预测场景下验证,对于多步连续预测的误差累积效应尚未系统研究。
关联工作
- TaylorSeer是BRACE最直接的对比方法,它采用导数驱动的泰勒多项式进行特征外推。BRACE通过揭示其数值不稳定性的根源,提出了根本性的改进方案。
- HiCache采用缩放Hermite系数的泰勒式预测方法,虽然在一定程度上缓解了导数爆炸问题,但仍受限于多项式基的表达能力。BRACE通过切换到有理基实现了更优的拟合效果。
- FORA和DeepCache代表了特征复用的缓存范式,它们直接使用历史特征而不进行外推。BRACE在实验中将其作为基线,证明了主动预测相比简单复用的优势。
- 重心有理插值在数值分析领域已有成熟的理论基础,BRACE的创新在于将其适配到DiT特征预测这一新场景,并通过切比雪夫权重和域映射解决了实际部署中的稳定性问题。