视频生成推理加速:Sol-Attn 如何在不牺牲质量的情况下实现 2x 加速?

论文代表图:figure-01-p001-01

Diffusion Transformers 在长序列视频生成中面临自注意力机制的二次复杂度瓶颈。Sol-Attn 提出了一种无需训练的动态稀疏注意力机制,通过在线 softmax 过程中的阈值路由和近似校正,在保持生成质量的同时显著加速推理。本文解析其核心机制、实验验证及局限性。