快速导读:Sol-Attn 提出了一种无需训练的动态稀疏注意力机制,通过在线 softmax 过程中的阈值路由和近似校正,在保持生成质量的同时显著加速视频生成推理。
视频生成模型,尤其是基于 Diffusion Transformers (DiTs) 的架构,正迅速成为高分辨率、长序列内容创作的主流选择。然而,自注意力机制的二次复杂度使得推理成本随序列长度急剧上升,成为制约其实用化的关键瓶颈。尽管 FlashAttention 等优化技术减少了 I/O 开销,但计算复杂度并未根本改变。
Sol-Attn 提出了一种新颖的即时注意力稀疏化方案,旨在不牺牲生成质量的前提下显著加速推理。该方法将动态稀疏化集成到 Online Softmax 过程中,通过查询依赖的阈值路由和代理分数复用,实现了高效且可控的稀疏计算。本文深入解析 Sol-Attn 的核心机制、实验验证及其在视频生成领域的应用价值。
英文题目:Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
论文出处:arXiv 每日论文精选 · arXiv:2607.24027
原始论文:PDF / 论文页面
对应视频标题:视频生成推理加速:Sol-Attn 如何在不牺牲质量的情况下实现 2x 加速?|推荐指数:★★★★★
这篇论文解决什么问题?
现有的动态稀疏注意力方法,如基于 Top-k 或 Top-p 的路由策略,存在显著局限。Top-k 方法在固定预算下可能忽略重要但分数略低的块,而 Top-p 方法对概率分布敏感,难以平衡稀疏性与精度。此外,这些方法通常需要物化完整的代理分数矩阵或路由索引,导致额外的内存开销和 HBM 流量。
在视频生成场景中,序列长度往往极长,且不同帧之间的相关性变化复杂。传统的“保留或丢弃”策略在激进稀疏下容易导致精度大幅下降,影响生成视频的质量和连贯性。因此,亟需一种能够动态适应查询内容、控制稀疏预算且内存高效的稀疏注意力机制。
Sol-Attn 针对上述问题,提出了一种基于阈值的动态稀疏化方案。该方法假设块代理对数几率近似服从高斯分布,利用查询块的均值和标准差动态确定阈值,从而实现可控的动态预算。同时,通过在线分块扫描和代理分数复用,避免了物化代理图,减少了内存开销。
核心创新
- Query-dependent thresholding: 基于近高斯分布假设,使用均值和标准差动态确定阈值,实现可控的动态预算。
- On-the-fly sparsification: 在在线 softmax 过程中即时进行块选择,避免物化代理分数图和路由索引,减少 HBM 流量。
- Proxy-score reuse: 复用低于阈值的代理分数进行近似校正,恢复被丢弃块的部分贡献,减少近似误差。
- Unified kernel: 将路由、稀疏计算和近似校正融合在单个在线 softmax 传递中,隐藏路由开销。
方法概览
Sol-Attn 将基于阈值的动态稀疏化集成到在线 softmax 中,并复用代理分数以近似未选中块。核心包括:1) 基于查询块均值和标准差的动态阈值路由;2) 在线分块扫描,无需物化完整代理图;3) 利用泰勒展开近似未选中块的贡献,统一路由、稀疏计算和校正于单一内核。
- Query-dependent thresholding:Sol-Attn 假设块代理对数几率近似服从高斯分布。对于每个查询块,计算其代理分数的均值和标准差,并基于标准化偏移 beta 动态确定阈值。高于阈值的块被选中进行精确计算,低于阈值的块被近似处理。
- On-the-fly sparsification:Sol-Attn 将稀疏化过程集成到 Online Softmax 中。在每次外循环迭代中,查询块与池化键块相乘得到 token-to-block 分数,平均后得到块代理分数。随后即时进行阈值比较和块选择,无需物化完整的代理图。
- Proxy-score reuse:对于未被选中的块,Sol-Attn 复用其代理分数进行近似校正。通过泰勒展开近似未选中块的贡献,并将其加到最终输出中。这种方法恢复了被丢弃块的部分信息,减少了近似误差。
- Unified kernel:Sol-Attn 将路由、稀疏计算和近似校正融合在单个 Online Softmax 传递中。这种统一内核设计隐藏了路由开销,提高了计算效率。
逐图理解论文
现有方法的局限

对比不同路由策略。注意 Sol-Attn 如何基于均值和标准差动态确定阈值,实现可控的动态预算,而 Top-k 和 Top-p 存在预算僵化或敏感性问题。
Sol-Attn 的核心创新

展示 Sol-Attn 执行流水线。关注查询块如何与池化键块相乘得到代理分数,以及选中块如何被调度到内循环,未选中块如何被近似处理。
实验验证

展示文本到视频生成的定量对比。关注 Sol-Attn 在 Wan2.1, HunyuanVideo, LTX 2.3 上的加速比和质量指标,确认其优越性。
结论与局限

展示 Sol-Attn 集成到 Sol-Engine 后的端到端加速效果。注意随着加速技术的逐步引入,延迟如何显著降低。
实验如何设计?
- 评估模型:在 Wan2.1, HunyuanVideo, LTX 2.3 等主流视频生成模型上进行文本到视频生成评估。
- 评估任务:包括文本到视频生成、视频到视频细化(SANA-WM)和编辑(Bernini),以及 2K 文本到图像生成(Ideogram 4)。
- 评估指标:使用 VBench 评估视频质量,使用相似度指标评估编辑和细化效果。
- 硬件环境:在 NVIDIA H100 和 RTX 5090 GPU 上进行内核效率分析,对比 FA3/FA4, XAttn, SVG2, PISA 等基线方法。
关键结果与论文证据
- 在 Wan2.1 上,Sol-Attn 实现端到端加速 2.02x,VBench AVG 76.13,与 FA3 的 75.90 相当。
- 在 HunyuanVideo 上,Sol-Attn 实现端到端加速 2.12x,VBench AVG 76.81,与 FA3 的 77.06 相当。
- 在 LTX 2.3 上,Sol-Attn 实现端到端加速 1.9x(第二阶段 2.4x),VBench AVG 74.69,与 FA3 的 74.59 相当。
- 在 SANA-WM 细化任务中,Sol-Attn 实现加速 3.04x,Pose Acc. R.Err. 8.781,表现最佳。
- 在 Bernini 编辑任务中,Sol-Attn 实现加速 2.34x,Bernini-Bench AVG 3.50,表现最佳。
- 在 Ideogram 4 上,Sol-Attn 实现加速 1.56x,Qwen-Image-Bench AVG 55.31,表现最佳。
- 集成 Sol-Engine 后,HunyuanVideo 端到端加速达 5.08x。
- 内核路由延迟比 Top-k 快 11.5x,比 Top-p 快 32.7x。
阅读时需要注意
- 当前 B200 内核未完全发挥 Blackwell 架构性能潜力。
- 仅支持前向推理,不支持反向传播(不可训练)。
- 评估局限于双向扩散视觉生成模型,未覆盖自回归视频生成模型。
关联工作
- FlashAttention:基础密集注意力优化,减少 I/O 但计算复杂度仍为二次方。
- XAttention:基于反对角线评分的块稀疏注意力,对比基线。
- SVG2:基于语义感知排列的稀疏视频生成,对比基线,内存开销较大。
- PISA:分段稀疏注意力,使用泰勒展开校正,对比基线。
- SpargeAttn:结合 Top-k 和置信度阈值的稀疏注意力。
- Sol-Engine:集成 Sol-Attn 的全栈推理加速框架。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
2026-7-28
Sol-Attn:通过在线注意力稀疏化加速视频生成推理
Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang
Zeke Xie, Enze Xie, Song Han
NVIDIA
扩散变换器(Diffusion Transformers)对于高保真视频生成至关重要,但长令牌序列使得注意力机制成为推理的主要瓶颈。无需训练的动态稀疏注意力通过仅计算选定的键值块来缓解这一瓶颈,然而现有方法难以在高效和准确两个方面同时实现注意力稀疏化,原因有二:(1) 僵化、不可预测且昂贵的路由:通过代理分数选择固定比例的顶级块会施加固定预算,而保留块以达到目标累积代理概率质量则会产生动态但可能不平衡的预算;两者都因计算和物化代理分数而产生不可忽视的开销。(2) 有损的保留或丢弃稀疏化:未选定的块被完全丢弃,在激进稀疏度下会降低准确性。这些局限性促使我们寻求更便宜的动态预算路由,同时限制准确性下降。在本文中,我们引入了无需训练的 Sol-Attn(Sparsifying online attention,即在线注意力稀疏化),它将动态路由、稀疏计算和近似校正统一在一次在线 Softmax 传递中,在稀疏注意力中实现了更好的准确性-效率权衡。Sol-Attn 的核心是带有代理分数复用的在线块阈值化,它通过在在线 Softmax 期间将块代理分数与阈值进行比较来选择关键块。这种设计使得无需物化代理图即可实现动态且可控的块预算,同时直接复用未选定块的代理分数以近似其贡献。跨图像和视频生成任务的实验表明,Sol-Attn 在视频生成和编辑方面分别实现了 2.1 倍和 2.3 倍的端到端加速,同时保持了视觉质量。此外,对于视频生成,将 Sol-Attn 与互补加速技术集成到 Sol-Engine 中,可提供高达 5 倍的端到端加速。
链接:GitHub 代码 | 项目页面
一位女性电影档案管理员转向温暖的投影仪光束,光线扫过她的脸庞。
密集注意力
Sol-Attn
(a) Sol-Attn 在不降低质量的情况下将 LTX 2.3 视频生成加速 1.9 倍。(b) Sol-Attn 加速富含文本的图像生成,且无文本失真。
源
目标
arXiv:2607.24027v1 密集注意力 Sol-Attn 密集注意力 Sol-Attn
密集注意力 Sol-Attn 密集注意力 Sol-Attn 密集注意力 Sol-Attn
(c) Sol-Attn 加速文生图生成,差异微小。(d) Sol-Attn 在不降低质量的情况下将 Bernini 视频编辑加速 2.3 倍。
图 1 | 密集注意力和 Sol-Attn 生成的样本对比概览。在各种生成任务中,Sol-Attn 显著加速了生成过程,且无明显质量下降。
© 2026 NVIDIA. 保留所有权利。
第 2 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
1. 引言
扩散变换器(DiTs)[1] 已成为视频生成 [2, 3, 4, 5, 6] 的基础。然而,追求更高分辨率和更长时间跨度的生成结果导致令牌序列越来越长,使得自注意力 [7] 的二次复杂度成为主要的推理瓶颈。无需训练的动态稀疏注意力是一种有吸引力的补救措施,因为它可以在不改变权重的情况下加速预训练模型 [8, 9, 10, 11]。然而,当前的块稀疏方法仍然严重依赖来自压缩注意力分数代理的离线路由以及保留/丢弃稀疏化,这暴露了两个明显的局限性。(L1)块路由是僵化的、难以控制且成本高昂。对于每个查询块,top-$k$ 选择具有最高代理分数的 $k$ 个键值块,从而在查询块之间强制执行统一的预算;top-$p$ 保留块直到其累积概率质量达到 $p$,当注意力模式弥散或受 sink 主导时,存在严重的预算不平衡风险。这两种策略都在稀疏注意力开始之前在 HBM 中物化代理分数图和路由索引,在长序列长度下产生不可忽视的内存流量。(L2)保留/丢弃稀疏化是有损的。未选中的块被完全丢弃,即使它们携带不可忽视的注意力质量,在激进稀疏度下会降低准确性。这些局限性指出了路由效率与稀疏注意力准确性之间的张力:我们能否以更低的成本实现动态预算路由,同时限制准确性下降?
我们提出了 Sol-Attn,这是一种无需训练的稀疏注意力方法,它将基于阈值的动态稀疏化融合到在线 Softmax 中,并复用代理分数来近似未选中的块,所有这些都在单个内核中完成,从而实现了更好的准确性-效率权衡。该设计通过以下三个步骤实现:
查询依赖的阈值化。我们观察到预训练视频模型中的注意力分数通常接近对称且类似正态分布,这表明可以通过基于阈值的过滤来执行块选择。基于这一见解,我们提出了一种从轻量级分数统计(如均值和标准差)估计的查询依赖阈值。该阈值在动态但可控的预算下选择块,而无需物化完整的代理图。
即时稀疏化。在在线 Softmax 期间,每个查询块逐块扫描池化键序列以生成代理分数。这些分数在芯片上与查询依赖阈值进行比较,高于阈值的块立即被分发到原始键值块上的嵌套稀疏注意力循环中。由于每个分数在生成时即被消耗,因此无需将完整的代理分数图或路由索引存储在 HBM 中。
代理分数复用。Sol-Attn 不像传统方法那样在路由后丢弃代理分数,而是在在线 Softmax 期间将它们保留在寄存器中,并复用低于阈值的分数来近似未选中的块。这恢复了被丢弃块的部分贡献,并减少了相对于密集近似的近似误差。精确分支和近似分支共享相同的在线 Softmax 状态,将路由、稀疏计算和校正统一在一个流式算子中。
在图像生成、视频生成、编辑和细化方面的实验表明,Sol-Attn 推进了无需训练的稀疏注意力的质量-效率前沿,同时保持了生成质量。它在视频任务中提供了 2.1×–3.0× 的端到端加速,并在与 Sol-Engine 中的互补优化集成时达到 5.1×。
2. 预备知识
注意力与在线 Softmax。给定查询、键和值矩阵 $Q, K, V \in \mathbb{R}^{L \times d}$,其中 $L$ 是序列长度,$d$ 是特征维度,softmax 注意力 [7] 计算输出 $O \in \mathbb{R}^{L \times d}$(省略缩放因子):
$O = \text{Softmax}(QK^\top)V$. (1)
FlashAttention [12] 引入了在线 Softmax,通过片上分块计算避免在 HBM 中物化完整的注意力矩阵 $\text{Softmax}(QK^\top) \in \mathbb{R}^{L \times L}$,从而减少 I/O 开销并消除 $\mathcal{O}(L^2)$ 的内存占用。然而,它仍然评估所有查询-键交互,因此保持了二次计算成本。
块稀疏注意力。为了降低 $\mathcal{O}(L^2)$ 的计算复杂度,稀疏注意力 [8, 9, 10, 11, 13, 14, 15] 仅为每个查询计算一部分关键的键值对。在数学上,它可以表述为:
$O = \text{Softmax}(QK^\top + M)V$, (2)
其中 $M \in \{0, -\infty\}^{L \times L}$ 是注意力掩码,$-\infty$ 条目被 softmax 忽略。为了使稀疏注意力与硬件友好的分块在线 Softmax 对齐,稀疏模式以块粒度组织,允许完全跳过掩码的键值块,并将稀疏性转化为计算节省。
2
第 3 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
原始 Top-k Top-p 本文方法
#1 稀疏度=70.3% 稀疏度=96.88% 稀疏度=75.0% 1概率. μ+βσlogits p=0.8 注意力累积 μ 0
#2 稀疏度=70.3% 稀疏度=21.9% 1概率. 稀疏度=67.2% μ+βσ logits p=0.8 μ 注意力累积 索引 0 索引 密度
图 2 | 路由策略对比。条形图表示预 Softmax 的块代理对数几率,选中的块以绿色高亮显示。Top-k 在固定预算下选择得分最高的块。Top-p 将 Softmax 概率累积至目标 p,产生对概率分布敏感且难以平衡的动态预算。Sol-Attn 则从块代理对数几率的均值 μ 和标准差 σ 推导阈值,通过 β 设置标准化偏移量,从而在不显式生成块代理图的情况下获得动态且可控的预算。
为了在此块结构下动态构建 M,标准方法通常依赖于块级代理注意力分数。设序列被划分为 N 个块,块大小为 B,第 i 个查询块记为 Qi ∈ R^(B×d),第 j 个键值块记为 Kj, Vj ∈ R^(B×d)。块分数由以下公式代理:
ŝij = Q̄i K̄j^⊤, p̂i = Softmax(ŝi), (3)
其中 Q̄i := Mean(Qi), K̄j := Mean(Kj) ∈ R^(1×d) 表示沿 token 维度的均值;ŝi = [ŝi1, …, ŝiN] 收集查询块 i 与所有键块之间的代理分数。标准路由对 ŝi 应用 top-k 或对 p̂i 应用 top-p 以选择键值块,随后在块稀疏掩码 M 中标记为激活。如第 1 节所述并在图 2 中说明,top-k 强制执行僵硬的固定预算,而 top-p 产生难以控制的动态预算;此外,两者在进行稀疏计算前均需遍历完整的代理行,产生不可忽视的路由开销。
3. 方法论
为了使动态稀疏注意力能够自适应地分配计算预算,以应对不同的 Softmax 分数分布,同时避免高昂的路由成本,我们提出了 Sol-Attn,这是一种用于视频扩散变换器(DiTs)的免训练稀疏注意力方法。该方法将代理路由、稀疏计算和近似校正统一在一次在线 Softmax 传递中,从而在提高近似精度的同时降低路由开销。我们首先推导查询依赖的阈值,然后将路由集成到分块在线 Softmax 中,最后重用分块路由分数进行近似校正。
3.1. 查询依赖的阈值化
结构化注意力对数几率。在不同模型中,我们对去噪步骤、层、注意力头和查询块聚合公式 (3) 中的行级预 Softmax 块代理对数几率 ŝij。如图 3 所示,每个模型内的这种聚合分布始终接近高斯分布。这种聚合结构提供了一个天然的路由坐标:对于高斯变量,高于均值 β 个标准差的截断对应于唯一的右尾密度。因此,共享的 β 可以控制模型的整体稀疏度水平,而每一行则通过其行级均值和标准差将此共同的标准化截断映射回其原始对数几率尺度,而非共享固定的原始分数截断。
图 3 | 高斯校准的密度控制。标准化块代理对数几率接近高斯分布(左);实证密度与截断 β 处的预测尾部匹配(右)。
第 4 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
基于阈值的路由。受此观察的启发,我们提出了查询依赖的阈值路由。对于查询块 $i$,令 $\mu_i$ 和 $\sigma_i$ 表示其代理分数 $\hat{s}_i$ 的均值和标准差。给定一个共享的标准截断值 $\beta > 0$,我们定义其路由阈值 $\tau_i$ 和选定的键块索引集 $\mathcal{S}_i$ 为
$\tau_i = \mu_i + \beta\sigma_i, \quad \mathcal{S}_i = \{j: \hat{s}_{ij} > \tau_i\}. \quad (4)$
令 $\Phi$ 表示标准高斯累积分布函数。在高斯参考下,$\beta$ 对应于选定密度 $\rho_G(\beta) := 1 – \Phi(\beta)$,而 $\mu_i$ 和 $\sigma_i$ 将共享的标准截断值映射到查询 $i$ 的原始分数尺度上。图 3 显示,经验平均密度在评估的模型中始终接近 $\rho_G(\beta)$,而阴影带跨越了每行密度的第 10 至 90 百分位数。因此,$\beta$ 校准了模型级别的平均密度,而 $|\mathcal{S}_i|$ 保持查询依赖性,而非像 top-$k$ 那样固定。Top-$p$ 也允许可变数量,但 $p$ 控制的是累积质量而非块密度:取决于 softmax 分数分布的集中程度,相同的 $p$ 可能保留从 1 到 $\lceil pN \rceil$ 个块。因此,阈值路由结合了动态预算和经验校准的密度尺度。
高效阈值计算。剩下的问题是如何在不物化完整代理分数 $\hat{s}_i$ 的情况下高效获得 $\tau_i$。由于 $\hat{s}_i$ 是通过使用 $\bar{Q}_i$ 对池化键进行线性投影获得的,其均值和方差可以直接从池化键的一阶和二阶矩计算得出(推导见附录 B):
$\mu_i = \frac{1}{N} \bar{Q}_i \sum_{j=1}^N \bar{K}_j^\top, \quad \sigma_i^2 = \frac{1}{N} \bar{Q}_i \sum_{j=1}^N \bar{K}_j \bar{K}_j^\top \bar{Q}_i^\top – \mu_i^2. \quad (5)$
因此,所有行级均值 $\mu_i$ 和方差 $\sigma_i^2$,以及查询依赖的阈值 $\tau_i$,都可以在 $\mathcal{O}(Ld + Nd^2)$ 时间内使用 $\mathcal{O}(d^2)$ 辅助存储计算得出,而无需物化 $N \times N$ 的代理分数图。
3.2. Sol-Attn:统一的即时稀疏化
分块即时阈值化。一旦获得第 $i$ 个查询块的阈值 $\tau_i$,每个键值块可以在其代理分数生成后立即被选中,而无需物化完整的代理分数行。这一特性允许块选择直接在 Online Softmax 中进行。我们将块级池化键 $\{\bar{K}_j^{(t)}\}_{j=1}^N$ 视为长度为 $N$ 的新键序列,并将其划分为大小为 $C$ 的 $T$ 个分块。对于分块 $t$,令 $\bar{K}^{(t)} = [\bar{K}_{tC+1}; \dots; \bar{K}_{(t+1)C}] \in \mathbb{R}^{C \times d}$。每个块 $Q_i$ 顺序扫描这些分块以生成分块代理分数:$\hat{s}_i^{(t)} = \bar{Q}_i (\bar{K}^{(t)})^\top \in \mathbb{R}^{1 \times C}. \quad (6)$
对每个分块应用公式 (4) 可得
$\mathcal{S}_i^{(t)} = \{ tC + r \mid r \in \{1, \dots, C\}, [\hat{s}_i^{(t)}]_r > \tau_i \}. \quad (7)$
由于 $\mathcal{S}_i = \bigcup_{t=0}^{T-1} \mathcal{S}_i^{(t)}$,分块流式阈值化恢复了与全行阈值化相同的块集。每个 $\mathcal{S}_i^{(t)}$ 中选定的块立即被稀疏注意力消耗,自然产生嵌套循环结构:
• 外层循环密集地逐分块扫描池化键序列以确定分块选定集。 • 内层循环稀疏遍历当前分块内选定的键值块以执行注意力计算。
这种嵌套循环结构实现了即时注意力稀疏化,其在数学上等价于离线全局阈值化,而无需物化完整的代理分数图或路由索引作为中间张量。
代理分数重用作为近似校正。代理分数低于阈值的块否则会被稀疏注意力丢弃。为了以低成本保留其贡献,我们近似其块级指数分数矩阵。具体而言,我们在每个键块内的行级平均分数周围应用泰勒展开:
$\exp(Q_i K_j^\top) = \exp(Q_i \bar{K}_j^\top) \odot \left[ 1 + Q_i(K_j – \bar{K}_j)^\top + \mathcal{O}\left( (Q_i(K_j – \bar{K}_j)^\top)^{\odot 2} \right) \right], \quad (8)$
其中 $\odot$ 表示逐元素乘法,且 $B \times 1$ 的中心沿键维度广播。仅保留零阶项可以使用池化键近似整个块级指数分数矩阵,从而保留被跳过块对 softmax 分子和分母的近似贡献。
4
第 5 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
外层循环(近似与路由)
图块 1 图块 2 内层循环(精确稀疏) 内层循环(精确稀疏) 池化键 池化键 查询 迭代 1 迭代 2 迭代 1 迭代 2 循环 跳过 跳过 网格
图块 i 均值 均值 键 键
图块 1 图块 2 图块 3 图块 4 图块 5 图块 6
1 1 0 1 0 1 阈值 i 代理分数 掩码 路由 代理分数 掩码 路由 迭代 1 迭代 2
图 4 | Sol-Attn 执行流水线。在每个外层循环迭代中,一个查询块与一个池化键图块(每个池化键由原始键图块池化而来)相乘,以生成令牌到块的分数;对每个列在查询令牌上求平均得到块代理分数。选定的图块被分发到精确内层循环,而令牌到块的分数被重用于近似计算,并对选定列进行掩码处理以避免重复计数。
对于每个图块 $j$,令 $\hat{V}_j \in \mathbb{R}^{1 \times d}$ 表示 $V_j$ 沿令牌维度的和,并令 $\mathcal{U}_i := \{1, \dots, N\} \setminus \mathcal{S}_i$ 表示未选定的图块集合。用零阶近似替换 $\mathcal{U}_i$ 中图块的指数分数,同时保留 $\mathcal{S}_i$ 中图块的精确计算,得到组合 Softmax 分母和分子: $$D_i := \underbrace{\sum_{j \in \mathcal{U}_i} \exp\left(\bar{Q}_i \bar{K}_j^\top\right)}_{\text{近似}} + \underbrace{\sum_{j \in \mathcal{S}_i} \exp\left(Q_i K_j^\top\right)}_{\text{精确}} \in \mathbb{R}^{B \times 1}. \quad (9)$$ $$N_i := \underbrace{\sum_{j \in \mathcal{U}_i} \frac{\exp\left(\bar{Q}_i \bar{K}_j^\top\right)}{\exp} \hat{V}_j}_{\text{近似}} + \underbrace{\sum_{j \in \mathcal{S}_i} \frac{\exp\left(Q_i K_j^\top\right)}{\exp} V_j}_{\text{精确}} \in \mathbb{R}^{B \times d}. \quad (10)$$ 通过将 $N_i$ 的每一行除以 $D_i$ 的对应条目,得到输出图块 $O_i \in \mathbb{R}^{B \times d}$。
在实践中,公式 (9) 和 (10) 近似项中的逐图块矩阵-向量乘法(GEMV)可以在 $C$ 个池化键的块上进行批处理,并作为高效的矩阵-矩阵乘法(GEMM)进行评估,产生一个 $B \times C$ 的令牌到块分数图块。这种分块计算也揭示了其与路由的直接计算重叠:对每列在查询令牌上求平均恰好恢复公式 (6) 中的分块路由分数: $$\tilde{S}_i^{(t)} := Q_i (\bar{K}^{(t)})^\top, \quad \text{Mean}(\tilde{S}_i^{(t)}) = \bar{Q}_i (\bar{K}^{(t)})^\top = \hat{s}_i^{(t)}. \quad (11)$$ 如图 4 所示,基于图块的近似和基于分块的路由在外层循环中自然统一。对于每个池化键分块,令牌到块分数图块的列均值决定图块选择;未选定的列提供近似校正,而选定的图块被分发到精确内层循环。以这种方式重用相同的分数图块,将路由、稀疏计算和近似校正融合在单次 Online Softmax 传递中。
硬件对齐的实现。我们使用图 4 所示的嵌套循环内核实现 Sol-Attn,并总结在算法 1 中。这里,$K_C[j]$ 和 $V_C[j]$ 分别对应于公式 (9) 和 (10) 近似项中使用的池化键 $\bar{K}_j$ 和求和值 $\hat{V}_j$。
算法 1:Sol-Attn 前向传播
def sol_attn(Q, K, V, O, KC, VC, tau, N, B, C):
for i in range(N):
Q_i = Q[i*B:(i+1)*B]
acc, l_i, m_i = 0, 0, -inf
# 外层循环:路由和近似
for j in range(0, N, C):
s_ij = QK_GEMM(Q_i, KC[j:j+C])
mask = s_ij.mean(axis=0) > tau[i]
s_ap = where(mask, -inf, s_ij)
p_ap = Softmax(s_ap, acc, l_i, m_i)
acc += PV_GEMM(p_ap, VC[j:j+C])
# 内层循环:精确稀疏注意力
for t in nonzero(mask):
s_ex = QK_GEMM(Q_i, K[(j+t)*B:(j+t+1)*B])
p_ex = Softmax(s_ex, acc, l_i, m_i)
acc += PV_GEMM(p_ex, V[(j+t)*B:(j+t+1)*B])
O[i*B:(i+1)*B] = acc / l_i[:, None]
return O
每个内核程序将 $Q_i$ 和 $\tau_i$ 暂存于共享内存中,并在寄存器中维护单个 Online Softmax 状态。外层循环流式传输 $K_C$ 和 $V_C$ 的分块,而内层循环仅为路由索引加载原始 $\langle K_j, V_j \rangle$ 图块。近似和精确路径都更新相同的 Online Softmax 统计信息。由于路由源自已为近似计算计算的分数图块,其开销主要被吸收进近似 Online Softmax 流水线中,无需在 HBM 中物化代理分数或路由索引。
5
第 6 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
4. 实验
4.1. 实验设置
模型。我们评估 Wan2.1-14B [2]、HunyuanVideo-13B [3] 和 LTX 2.3-22B [4, 5] 的文生视频生成,涵盖越来越长的时空序列。视频到视频评估涵盖使用 Bernini-14B [16] 进行编辑和使用 SANA-WM Refiner [17] 进行细化。我们还使用 Ideogram 4 [18] 评估原生 2K 文生图生成,以评估 Sol-Attn 在中等序列长度下的有效性。
指标。我们使用 VBench [19] 衡量文生视频生成的任务质量,使用姿态准确性衡量 SANA-WM 细化,使用 Bernini-Bench [16] 衡量 Bernini 编辑,使用 Qwen-Image-Bench [20] 衡量高分辨率文生图生成。在所有任务中,PSNR、SSIM 和 LPIPS 用于量化与密集注意力输出的保真度。由于理论 FLOPs 不一定反映实际效率,我们报告相对于密集注意力的端到端挂钟加速比。
基线。我们使用 FlashAttention-3 (FA3) [21] 作为密集注意力基线,并与最近的无训练稀疏注意力最先进方法进行比较:XAttention (XAttn) [10]、Sparse-VideoGen2 (SVG2) [8] 和 Piecewise Sparse Attention (PISA) [11]。对于 XAttn 和 SVG2,我们将它们官方推荐的配置适配到原始发布未涵盖的模型(如 LTX),并在方法间匹配稀疏度以进行公平比较。
实现细节。我们使用自定义 GPU 内核实现 Sol-Attn,并在 NVIDIA H100 GPU 上进行配置分析。精确注意力使用固定的 64×64 物理块。由于路由和近似块大小 $C$ 影响效率但不影响数学输出,我们不将其作为消融变量。遵循先前工作,对于 Wan2.1、HunyuanVideo、Bernini 和 Ideogram 4,我们在去噪步骤的前 20% 以及第一层中使用密集注意力作为预热。对于两阶段 LTX 管道,阶段 1 使用贯穿始终的密集注意力的 8 步 LoRA,而阶段 2 对所有步骤使用 Sol-Attn 且无预热。SANA-WM 细化器同样全程使用 Sol-Attn。
4.2. 内核效率评估
内核效率评估。图 5a 报告了 Sol-Attn 相对于 FlashAttention-3 在不同序列长度和稀疏度下的内核级加速比。加速比随序列长度和稀疏度的增加而一致增加,在 128K token 和 90% 稀疏度下达到 5.41×。这种一致的缩放趋势表明,Sol-Attn 的效率优势在 16K–128K 序列长度范围内持续存在。
高效的即时稀疏化。图 5b 和 5c 隔离了稀疏化的两个系统成本:选择延迟和中间内存。Top-$k$ 和 top-$p$ 物化并全局遍历代理图,其中 top-$p$ 还需要对排序后的分数进行累积选择。Sol-Attn 则在分数生成时即片上消费每个分数,使路由速度分别快 11.5× 和 32.7×。图块局部路由状态也使 Sol-Attn 在处理器内存中保持接近密集注意力,而 SVG2 的路由结构和置换缓冲区需要约 8× 更多的内存。在 LTX 2.3 和 Bernini 上的一致分离将这两项收益归因于即时稀疏化,而非特定模型的集成。
6 12 11.52 11.67 16K 32K 64K 128K Top-$p$ 10.8 ms SVG2Sol-AttnFA3 (GB) Dense 32.7× 8over 4 Top-$k$ 3.80 ms 7.9× 7.9× 5.4× Memory 11.5× 4 Speedup 1.45 1.42 1.48 1.46 Ours 0.33 ms Peak 2 0 70% 75% 80% 85% 90% 0.1 1 10 LTX 2.3 Bernini
稀疏度 延迟 (ms) 视频模型
(a) 加速比与稀疏度。(b) 路由延迟 (对数刻度)。(c) 注意力处理器内存。
图 5 | 在 NVIDIA H100 GPU 上配置的内核效率概况。(a) 相对于 FA3 的加速比随稀疏度和序列长度增加。(b) 阈值路由比 top-$k$ 和 top-$p$ 更快。(c) 注意力处理器的增量峰值内存。Sol-Attn 保持接近 Dense,而 SVG2 在这两种工作负载上需要约 8× 更多的内存。
6
第 7 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
表 1 | 文本到视频生成质量与效率的定量比较。LTX 2.3 使用由粗到细的两阶段流水线,Sol-Attn 仅应用于阶段 2;括号外(括号内)数值表示端到端(阶段 2)的加速比。
VBench↑ 相似度 效率 方法 SC BC TF MS AQ IQ DD OC AVG PSNR↑ SSIM↑ LPIPS↓ 稀疏度 加速比↑
Wan 2.1 (14B, 文本到视频, 720p, 81 帧)
FA3 95.59 96.75 98.75 97.86 63.17 68.88 61.11 25.08 75.90 – – – – 1.00× XAttn 93.71 95.43 97.94 97.12 60.56 66.12 62.50 25.37 74.84 18.62 0.5544 0.3226 85.60% 1.69× SVG2 94.85 96.05 98.59 97.68 62.26 67.40 59.72 25.19 75.22 20.71 0.6543 0.2498 83.66% 1.85× PISA 95.60 96.95 98.75 97.98 63.72 68.91 61.11 25.19 76.03 20.28 0.6775 0.2127 85.00% 1.86× Sol-Attn 95.54 97.02 98.76 98.01 63.35 68.64 62.50 25.26 76.13 20.59 0.6825 0.2086 85.12% 2.02×
HunyuanVideo (13B, 文本到视频, 720p, 129 帧)
FA3 93.87 96.60 98.97 99.11 61.54 67.87 72.22 26.28 77.06 – – – – 1.00× XAttn 93.76 95.57 99.05 98.76 60.10 66.38 51.39 26.16 73.90 22.90 0.6792 0.2511 85.60% 1.61× SVG2 92.22 95.63 99.01 98.95 58.01 61.81 63.89 26.08 74.45 25.64 0.7853 0.2354 83.15% 2.01× PISA 93.68 96.37 98.95 99.08 61.69 67.71 72.22 26.49 77.02 25.58 0.8164 0.1671 85.00% 1.88× Sol-Attn 93.62 96.49 98.95 99.05 61.52 67.55 70.83 26.50 76.81 25.21 0.8048 0.1777 85.80% 2.12×
LTX 2.3 (22B, 文本到视频, 1080p, 361 帧 → 721 帧)
FA3 90.78 95.53 99.31 99.33 62.59 69.89 56.94 22.38 74.59 – – – – 1.0× XAttn 90.04 95.17 98.86 98.99 62.56 70.21 58.33 22.55 74.59 21.77 0.7621 0.2175 90.17% 1.6 (1.9)× SVG2 90.70 95.46 99.28 99.06 59.74 64.86 44.44 22.28 71.98 21.94 0.7806 0.2874 89.35% 1.7 (2.1)× PISA 90.89 95.64 99.37 99.39 62.76 70.10 56.94 22.27 74.67 25.26 0.8630 0.1288 90.00% 1.8 (2.3)× Sol-Attn 90.85 95.67 99.36 99.39 62.92 70.16 56.94 22.24 74.69 25.69 0.8704 0.1197 89.83% 1.9 (2.4)×
表 2 | 不同注意力方法下 SANA-WM 细化器的 1 分钟视频细化比较 表 3 | 不同注意力方法下 Bernini-14B 的视频到视频编辑比较
姿态准确率↓ 相似度 效率 Bernini-Bench↑ 相似度 效率 方法 方法 R.Err. T.Err. CMC PSNR↑ SSIM↑ LPIPS↓ 稀疏度 加速比 IF VC GQ OS PSNR↑ SSIM↑ LPIPS↓ 稀疏度 加速比
FA3 7.133 1.167 1.216 – – – – 1.00× FA3 3.32 3.80 3.70 3.41 – – – – 1.00× XAttn 10.52 1.331 1.415 16.80 0.466 0.411 85.30% 2.17× XAttn 3.46 3.65 3.80 3.46 27.42 0.864 0.079 84.91% 1.64× SVG2 9.109 1.413 1.477 16.89 0.473 0.413 85.08% 2.08× SVG2 3.41 3.62 3.62 3.36 27.28 0.863 0.074 81.15% 2.04× PISA 8.822 1.237 1.299 17.65 0.506 0.351 84.96% 2.35× PISA 3.36 3.75 3.75 3.55 29.88 0.904 0.052 85.00% 2.17× Sol-Attn 8.781 1.233 1.296 17.72 0.507 0.343 85.11% 3.04× Sol-Attn 3.50 3.80 3.80 3.50 30.18 0.910 0.046 85.00% 2.34×
4.3. 视觉生成评估
文本到视频生成。我们在三个模型上评估文本到视频生成,涵盖从短 720p 视频到长 1080p 视频。表 1 将 Sol-Attn 与最近的免训练稀疏注意力方法在 VBench 质量和密集注意力输出的相似度方面进行了比较,加速比是相对于使用 FA3 后端的密集注意力测量的端到端加速比。在匹配的稀疏度下,Sol-Attn 在所有模型中实现了最先进的效率,达到高达 2.12× 的端到端加速比,同时在 VBench 质量和密集参考相似度方面整体优于其他方法。
视频到视频生成。我们进一步在视频到视频生成上评估 Sol-Attn,这是一个序列长度显著更长的更具挑战性的场景。我们考虑了两个 720p 设置:使用 SANA-WM Refiner 细化 1 分钟的草稿视频,以及使用 Bernini 编辑视频。表 2 和表 3 报告了在匹配稀疏度下的任务特定质量、密集参考相似度和端到端加速比。在 SANA-WM 上,Sol-Attn 在稀疏方法中实现了最佳姿态准确率和密集参考相似度,同时提供了 3.04× 的加速比。在 Bernini-Bench 上,它在稀疏方法中实现了最强的聚合生成质量和密集参考相似度,同时具有最高的加速比。
文本到图像生成。除了长序列视频生成外,我们还在原生 2K 文本到图像生成的中等序列长度下评估 Sol-Attn。表 4 显示,在 Ideogram 4 上,Sol-Attn 在 Qwen-Image-Bench 分数和密集参考相似度方面均优于其他稀疏注意力方法,同时实现了 1.56× 的加速比。
消费级 GPU 上的视频生成。我们进一步在消费级 NVIDIA RTX 5090 GPU 上评估 Sol-Attn。图 6 报告了相对于 FlashAttention-4 [22] 的内核加速比,而表 5 比较了 Wan2.1-1.3B 在 480p 视频生成方面的不同稀疏注意力方法。Sol-Attn 仍然实现了最佳的整体质量和效率。
7
第 8 页
Sol-Attn:通过在线注意力稀疏化加速视频生成推理
表 4 | Ideogram 4 上 2K 分辨率文本到图像生成的注意力方法对比。BSA 表示标准块稀疏注意力。表 5 | Wan2.1-1.3B 在 RTX 5090 上 480p 视频生成的对比。
Qwen-Image-Bench↑ 相似度 效率 相似度 效率 方法 方法 质量 美学 对齐 保真 创意 平均 PSNR SSIM LPIPS 稀疏度 加速比 PSNR SSIM LPIPS 稀疏度 加速比
FA3 56.10 60.88 59.74 56.40 64.95 59.24 – – – – 1.00× FA4 – – – – 1.00× BSA 50.04 52.28 52.63 51.40 53.08 51.96 15.99 0.565 0.427 90.00% 1.54× XAttn 15.16 0.41 0.554 86.09% 1.36× PISA 52.78 55.56 55.09 53.07 55.85 54.51 20.12 0.738 0.239 90.00% 1.47× SVG2 24.08 0.77 0.195 86.00% 1.41× Sol-Attn 52.77 56.12 56.61 53.33 57.71 55.31 21.26 0.764 0.210 90.16% 1.56× Sol-Attn 24.70 0.794 0.162 84.90% 1.71×
4.4. 与 Sol-Engine 的集成
由于 Sol-Attn 本身对注意力进行稀疏化,它与互补的免训练加速技术兼容,包括扩散步缓存 [23, 24, 25] 和内核融合。因此,我们将其集成到 Sol-Engine [26] 中,这是一个用于组合此类技术的端到端推理框架,并在 NVIDIA B200 GPU 上评估了 resulting 系统。图 7 显示,组合系统在 Wan2.1-14B 上实现了 3.48× 的端到端加速,在 HunyuanVideo 上实现了 5.08× 的加速,证明 Sol-Attn 是优化推理引擎中实用的即插即用组件。
8K 16K 32K 64K HunyuanVideo 866.9 s Wan2.1-14B 563.8 s FA4 10 + 内核融合与优化 1.11× + 内核融合与优化 1.21× over 8 781.0 s 464.9 s + 扩散步缓存 2.64× + 扩散步缓存 2.59× 328.4 s 217.6 s 6 + Sol-Attn 5.08× + Sol-Attn 3.48× 加速比 4 170.6 s 161.8 s
70% 75% 80% 85% 90% 0 300 600 900 0 200 400 600
稀疏度 端到端延迟 (s) 端到端延迟 (s)
图 6 | NVIDIA RTX 5090 上 FA4 的稀疏度与加速比关系。 图 7 | 将 Sol-Attn 集成到 Sol-Engine 中。随着加速技术逐步引入,端到端延迟的变化。
4.5. 消融研究
查询依赖阈值化的影响。图 8 比较了不同路由策略在相同平均密度 15% 下的每查询块密度分布。Top-𝑘 通过构造将每个查询块固定在目标密度,而 Top-𝑝 产生广泛变化的密度。相比之下,我们的方法在不同模型中保持紧密集中,表明它能够在保持稳定密度控制的同时启用动态块预算。
近似校正的影响。图 9 通过比较标准稀疏注意力(仅精确)和 Sol-Attn(精确或近似)在相同选定块索引下,随着稀疏度增加,测量相对于密集注意力输出的相对 ℓ2 误差和余弦相似度。标准稀疏注意力迅速累积误差,而近似校正持续降低相对 ℓ2 误差并保持更高的余弦相似度,且在较高稀疏度下优势扩大。这证实了保留未选中块的近似贡献能显著提高稀疏注意力的准确性。
Top-𝑘 Top-𝑝 ours 仅精确 精确或近似 仅精确 精确或近似 (%) 25 0.16 1.00 20 误差 0.96 ℓ2 0.12 密度 15 0.08 10 0.92 余弦 每查询 5 相对 0.04 0.88 Wan HY LTX 70% 75% 80% 85% 90% 70% 75% 80% 85% 90%
视频模型 稀疏度 稀疏度
图 8 | 不同模型的路由密度分布。 图 9 | 序列长度为 32K 时,不同稀疏度水平下的近似校正消融:相对 ℓ2 误差(左)和平均行余弦相似度(右)。
8
第 9 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
cuDNN BSA Sol-Attn 前置计算 cuDNN BSA Sol-Attn 前置计算 cuDNN BSA Sol-Attn 前置计算 8 10 12 10.18 7.91 10 9.15 9.29 (+1.6%) 9.52 (-6.6%) 7.42 (-6.2%) 8 5.77 6.94 7.21 (+3.9%) 5.17 (+9.4%) 8(ms) 6 4.72 5.41 (-6.2%) (ms) (ms) 6 4 6 4 4 延迟 2 延迟 延迟 2 2
0 0 0 注意力内核 端到端 注意力内核 端到端 注意力内核 端到端
(a) 90% 稀疏度。(b) 85% 稀疏度。(c) 80% 稀疏度。
图 10 | 序列长度为 32K 时的延迟分解。Attn Kernel 仅测量注意力算子,而 End-to-End 测量完整的 QKV 到输出路径。Sol-Attn 中的近似校正仅引入微小的内核开销。在端到端层面,Sol-Attn 更快,因为它仅计算轻量级阈值,并将路由开销隐藏在在线 Softmax 流水线中,而 BSA 在外部物化路由索引。
高效统一执行流水线。为了分解我们统一内核的延迟,我们将 Sol-Attn 与 cuDNN BSA 进行比较,cuDNN BSA 是 H100 GPU 上最先进的块稀疏注意力实现,在 10%、15% 和 20% 的精确密度下使用相同的块索引。由于 Sol-Attn 将路由和近似校正融合到稀疏注意力的在线 Softmax 流水线中,其内核执行的工作量多于 BSA。然而,图 10 显示内核级开销仅为 9.4%、3.9% 和 1.6%,证实了近似校正的轻量级特性。一旦包含 BSA 的独立路由阶段,端到端比较发生逆转:Sol-Attn 快 6.2%、6.2% 和 6.6%,因为只有阈值计算保留在其注意力内核之外,而路由工作大部分被在线 Softmax 流水线中的其他操作所隐藏。统一执行使得端到端流水线中的即时路由几乎免费。
5. 相关工作
块稀疏注意力。块稀疏注意力通过仅计算选定的键值块来降低二次注意力成本。早期方法通过结构化布局 [27, 28, 29] 或基于内容的分组 [30, 31] 来降低此成本。最近的工作学习块选择或在原生稀疏架构内结合压缩、选择和局部注意力 [32, 33, 34]。在视频生成中,现有方法以两种广泛的方式利用 DiTs 的空间-时间冗余。一条工作线从重复的空间或时间注意力模式构建结构化稀疏掩码 [35, 36, 37, 38];另一条工作线从轻量级块级代理分数 [8, 39, 40, 41] 在运行时派生内容自适应稀疏模式,实现更灵活的块选择。
路由策略。动态稀疏注意力依赖于高效选择信息性键值块。最直接的策略是对块代理分数应用 top-k 或 top-p。SpargeAttn 用置信度阈值增强 top-k 选择,然后应用在线 Softmax 感知阈值以跳过微不足道的更新 [9]。SpargeAttn2 [42] 取 top-k 和 top-p 掩码的并集以避免它们的互补失败模式 [42],而 Twilight [43] 首先形成保守的 top-k 候选集,然后用 top-p 对其进行剪枝 [43]。其他方法重新设计重要性度量或过滤原语:XAttention 通过反对角线和对块进行评分 [10],而 VecAttention 保留在运行行最大值固定范围内的分数,并将比较融合到分块分数计算中 [44]。相关系统通过查询感知页面选择 [45]、分层剪枝 [46]、上下文相关稀疏模式 [47] 或学习语义哈希 [48] 来降低搜索成本。Sol-Attn 改为对每个代理行计算查询依赖的阈值,并在生成分数时将其应用于分数,使路由能够在在线 Softmax 传递中在线进行。
带校正的稀疏注意力。基于校正的方法近似精确稀疏分支中省略的贡献。PISA 对未选定的块应用分块泰勒展开,并在相同的 Softmax 分子和分母中组合精确项和近似项 [11]。SVG-EAR 使用基于质心的线性补偿和误差感知路由 [49],BA-Att 引入协方差补偿的块近似 [50]。SLA 为稀疏注意力分配关键权重,为线性注意力分配边际权重 [51];SLA2 添加学习路由、加权稀疏-线性组合和量化感知训练 [52]。现有的校正方法要么遵循在独立路由阶段构建的稀疏模式,要么需要模型微调。Sol-Attn 改为在单个在线 Softmax 传递中从相同的令牌到块分数图块派生路由和校正。
9
第 10 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
6. 结论
我们提出了 Sol-Attn,这是一种无需训练的稀疏注意力机制,它在一个在线 Softmax 传递过程中结合了阈值路由和近似校正,而无需显式构建代理映射。更广泛地说,我们的研究探索了一种新的稀疏注意力形式,其中路由不再是单独的预置条件,且未被选中的块是通过近似而非丢弃来处理。这种统一的流式设计以极少的额外开销显著缩小了稀疏注意力与密集注意力之间的精度差距,在多种视觉生成任务中实现了有利的质量-效率权衡。
局限性与未来工作。尽管结果令人鼓舞,但 Sol-Attn 在其当前实现和应用范围上仍存在局限。B200 内核尚未充分利用 Blackwell 的性能潜力,目前仅支持前向推理,且我们的评估仅限于基于双向扩散的视觉生成,未涵盖自回归视频生成。未来的工作将通过进一步的内核优化、扩展到自回归模型以及支持反向传播的可训练实现来解决这些局限性。
10
第 11 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
A. 其他实验细节
生成配置。Wan2.1-14B 和 HunyuanVideo-13B 使用 50 个去噪步,前 10 步使用密集注意力,此后使用 Sol-Attn。Bernini-14B 遵循相同的策略,共 40 步,其中前八步为密集预热。Wan2.1 和 Bernini 保持交叉注意力为密集状态,而 HunyuanVideo 的 MMDiT 将文本键值令牌视为汇点(sinks),并在精确分支中保留它们。Ideogram 4 在其 48 步调度中使用八个密集步,同样在精确分支中保留文本键值令牌。对于 LTX 2.3,第一阶段的前八步保持密集,Sol-Attn 应用于剩余的三个步骤,同时交叉注意力保持密集。三步 SANA-WM 细化器全程使用 Sol-Attn 并保留密集交叉注意力。
B. 推导与误差分析
阈值方差推导。公式 (5) 中的精确方差直接源于代理行的方差。回顾公式 (3) 中的 $\hat{s}_{ij} = \bar{Q}_i \bar{K}_j^\top$。对应的行均值为 $\mu_i = \frac{1}{N} \sum_{j=1}^N \hat{s}_{ij}$,其方差展开为
$$ \sigma_i^2 = \frac{1}{N} \sum_{j=1}^N (\hat{s}_{ij} – \mu_i)^2 $$
$$ = \frac{1}{N} \sum_{j=1}^N (\hat{s}_{ij}^2 – 2\mu_i \hat{s}_{ij} + \mu_i^2) $$
$$ = \frac{1}{N} \sum_{j=1}^N \hat{s}_{ij}^2 – 2\mu_i \left(\frac{1}{N} \sum_{j=1}^N \hat{s}_{ij}\right) + \mu_i^2 $$
$$ = \frac{1}{N} \sum_{j=1}^N \hat{s}_{ij}^2 – \mu_i^2. \quad (12) $$
每个平方代理分数也可以表示为
$$ \hat{s}_{ij}^2 = (\bar{Q}_i \bar{K}_j^\top)(\bar{Q}_i \bar{K}_j^\top)^\top = \bar{Q}_i \bar{K}_j^\top \bar{K}_j \bar{Q}_i^\top. \quad (13) $$
由于 $\hat{s}_{ij}$ 是标量,第二个因子可以用其转置替换,以暴露池化键的二阶矩。将公式 (13) 代入公式 (12) 并收集与键相关的项,得到
$$ \sigma_i^2 = \bar{Q}_i \left(\frac{1}{N} \sum_{j=1}^N \bar{K}_j^\top \bar{K}_j\right) \bar{Q}_i^\top – \mu_i^2. \quad (14) $$
这恢复了公式 (5)。
对角阈值估计器。我们提供了公式 (5) 中精确估计器的实现,以及一种更高效的近似实现,该近似仅保留池化键协方差的对角线。令 $\mu_K := \mathbb{E}[\bar{K}]$ 并仅保留对角线 $v_K := \text{diag}(\text{Cov}[\bar{K}])$。得到的估计器为
$$ v_K = \frac{1}{N} \sum_{j=1}^N \bar{K}_j \odot \bar{K}_j – \mu_K \odot \mu_K, \quad \sigma_{i, \text{diag}}^2 = (\bar{Q}_i \odot \bar{Q}_i) v_K^\top. \quad (15) $$
它用逐元素二阶矩和每个查询块的 $O(d)$ 投影替换了密集的 $d \times d$ 协方差。
近似误差。零阶规则也给出了直接的误差表征。对于一个查询行,令 $a = q \bar{K}_j^\top$,$\delta_u = q(k_{j,u} – \bar{K}_j)^\top$,以及 $\eta = \max_u |\delta_u|$。令精确值和零阶值的 $\mathcal{D}_j, \tilde{\mathcal{D}}_j$ 和 $\mathcal{N}_j, \tilde{\mathcal{N}}_j$ 表示该行的分母和分子贡献。由于 $\sum_u \delta_u = 0$,泰勒定理给出
$$ 0 \le \mathcal{D}_j – \tilde{\mathcal{D}}_j \le \exp(a + \eta) \sum_{u=1}^B \frac{\delta_u^2}{2} \le \exp(a + \eta) \sum_{u=1}^B |\delta_u| \|v_{j,u}\|^2. \quad (16) $$
$$ 0 \le \mathcal{N}_j – \tilde{\mathcal{N}}_j \le \dots $$
因此,分母误差是中心分数分布的二阶量,而分子还取决于其与值的对齐程度。这些界限解释了平滑尾部块上的准确性以及异构块上的残余误差。该推导假设每个块内的键是密集且非因果的,正如所评估的扩散模型中那样;行相关的语义或因果掩码则需要对有效键进行中心化和多重性处理。
11
第 12 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
C. 其他定性结果
提示:一辆摩托车在沿海公路上巡航
密集
Sol-Attn
提示:一列火车在轨道上飞驰
密集
Sol-Attn (a) Wan 2.1
提示:一辆火星车在火星上移动
密集
Sol-Attn
提示:一列蒸汽火车在山坡上行驶
密集
Sol-Attn (b) HunyuanVideo
提示:室内。高窗旁的安静公寓——傍晚。明亮的电影感 85mm 特写镜头框住一位穿着米色毛衣的美丽女性,她站在白色窗帘和木制百叶窗旁。她的完整面部充满画面,皮肤纹理柔和,眼神清澈,表情平静自然;背景是温暖的模糊房间,有植物和书籍,非未来风格。她开始低头看向部分阴影处。随着风吹动窗帘,金色的阳光水平条带缓慢地掠过她的脸颊、嘴唇和眼睛。她抬起下巴,从左侧面转为清晰的四分之三侧面视角,然后露出微妙的沉思微笑。相机以眼部高度缓慢推进。优雅的自然肖像布光,温暖的高光,可见的头部运动,干净的主体与背景分离,面部附近无手,无文字,无标志。音频:窗帘布料移动声,远处的城市环境音,轻柔的呼吸声。
密集
Sol-Attn
提示:明亮的 65mm 驾驶舱特写镜头框住一位年轻的水上飞机飞行员,在上午晚些时候飞越绿松石色的热带群岛。阳光充满奶油色的机舱,清晰地照亮了她的脸、琥珀色飞行员眼镜、亚麻衬衫和磨损的皮革耳机。她从仪表盘瞥向地平线,微微一笑,并用一个流畅的动作使飞机倾斜。透过柔和模糊的侧窗,白色海滩、珊瑚礁湖和绿色小岛在下方以鲜艳的蓝色和翡翠色层漂移;一些高光在前景的拉丝铝制控制杆上移动。相机保持在乘客座位高度的近距离,具有强烈的主体分离度、自然反射、浅景深、明亮通透的色彩以及轻松的冒险电影氛围。音频:稳定的螺旋桨声、轻柔的机舱振动、耳机静电声以及浮筒周围的风声。
密集
Sol-Attn (c) LTX 2.3
图 11 | 不同模型下密集注意力与 Sol-Attn 的其他文本到视频对比。
12
第 13 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
编辑提示:将瓷狐狸变成透明的手工吹制玻璃,内部包含一场带有微小云朵和闪电的微型雷暴,同时保留其精确的运动、轮廓、画廊、底座、照明和相机路径。
源
密集
Sol-Attn
编辑提示:将红色雨衣变成由翡翠苔藓和小白花组成的活体服装,并使反射池显示繁星点点的夜空,同时保留女性、行走循环、建筑结构、构图和日光。
源
密集
Sol-Attn
(a) Bernini
提示:从一个严格静止的观察点出发的第一人称视角,观察点位于被低矮山脉环绕的巨大干盐湖对面。一辆黑色跑车占据前景中央,停在苍白、压实的表面上,朝向开阔的地平线,上方是广阔的蓝天。环境广阔而简约,拥有平坦的米色沙漠地壳、微弱的轮胎磨损纹理、远处的岩石山脊线,以及几缕横跨上空的薄云。明亮的正午阳光在车辆下方投下清晰的阴影,营造出速度、开放和孤立的高能见度氛围。观察者的视角保持固定,没有动态相机移动,记录者也没有采取任何行动。自主运动属于世界本身:尘迹在地面上低扫,地平线附近的热浪 shimmering,云朵缓慢漂移,汽车轮胎扬起细碎的沙漠尘土。
低分辨率。
密集
Sol-Attn
提示:第一人称视角,广阔的鹅卵石广场中心矗立着一座位于雕刻石基座上的华丽骑马雕像,两侧是对称的古典建筑,底层有拱门,屋顶下有统一的窗户。天空呈淡蓝色,点缀着散云,柔和的日光洒满整个场景。鸽子在前景的路面上休息,两名行人沿着雕像的铁栅栏漫步。纪念碑后方,一座带有柱子和雕塑浮雕的宏伟新古典主义建筑构成了背景。树木排列在广场两侧,其绿色树叶与米色石质建筑形成对比。氛围宁静而开阔,除了雕像的静止和远处人物的安静存在外,没有可见的运动。
低分辨率。
密集
Sol-Attn
(b) SANA-WM
图 12 | Bernini 和 SANA-WM 上的其他条件生成比较,每个子图包含两个案例。Bernini 行显示源视频、密集视频和 Sol-Attn 编辑后的视频;SANA-WM 行显示低分辨率阶段 1 视频以及两种细化输出。
13
第 14 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
参考文献
[1] William Peebles 和 Saining Xie。具有 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集,2023。
[2] Wan 团队,Ang Wang,Baole Ai,Bin Wen,Chaojie Mao,Chen-Wei Xie,Di Chen,Feiwu Yu,Haiming Zhao,Jianxiao Yang 等。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。
[3] Weijie Kong,Qi Tian,Zijian Zhang,Rox Min,Zuozhuo Dai,Jin Zhou,Jiangfeng Xiong,Xin Li,Bo Wu,Jianwei Zhang 等。HunyuanVideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024。
[4] Yoav HaCohen,Nisan Chiprut,Benny Brazowski,Daniel Shalem,Dudu Moshe,Eitan Richardson,Eran Levin,Guy Shiran,Nir Zabari,Ori Gordon,Poriya Panet,Sapir Weissbuch,Victor Kulikov,Yaki Bitterman,Zeev Melumian 和 Ofir Bibi。LTX-Video:实时视频潜在扩散。arXiv 预印本 arXiv:2501.00103,2024。
[5] Lightricks。LTX-2.3 模型卡。https://huggingface.co/Lightricks/LTX-2.3,2026。包括 ltx-2.3-22b-dev 及其蒸馏变体在内的模型检查点系列。
[6] Lichen Bai,Tianhao Zhang,Shitong Shao,Dingwei Tan,Qiyu Zhong,Zhengpeng Xie,Haopeng Li,Qinghao Huang,Dandan Shen,Tengjiao Ji 等。MaineCoon:追求实时视听社交世界模型。arXiv 预印本 arXiv:2606.17800,2026。
[7] Ashish Vaswani,Noam Shazeer,Niki Parmar,Jakob Uszkoreit,Llion Jones,Aidan N. Gomez,Lukasz Kaiser 和 Illia Polosukhin。注意力即所需。在神经信息处理系统进展 (NeurIPS),2017。
[8] Shuo Yang,Haocheng Xi,Yilong Zhao,Muyang Li,Jintao Zhang,Han Cai,Yujun Lin,Xiuyu Li,Chenfeng Xu,Kelly Peng,Jianfei Chen,Song Han,Kurt Keutzer 和 Ion Stoica。Sparse VideoGen2:通过语义感知排列利用稀疏注意力加速视频生成。在神经信息处理系统进展 (NeurIPS),2025。
[9] Jintao Zhang,Chendong Xiang,Haofeng Huang,Jia Wei,Haocheng Xi,Jun Zhu 和 Jianfei Chen。SpargeAttention:准确且无需训练的稀疏注意力,加速任何模型推理。在第 42 届国际机器学习会议 (ICML) 论文集,2025。
[10] Ruyi Xu,Guangxuan Xiao,Haofeng Huang,Junxian Guo 和 Song Han。XAttention:具有反对角线评分的块稀疏注意力。在第 42 届国际机器学习会议 (ICML) 论文集,2025。
[11] Haopeng Li,Shitong Shao,Wenliang Zhong,Zikai Zhou,Lichen Bai,Hui Xiong 和 Zeke Xie。PISA:分段稀疏注意力对于高效扩散变换器更为明智。arXiv 预印本 arXiv:2602.01077,2026。
[12] Tri Dao,Daniel Y. Fu,Stefano Ermon,Atri Rudra 和 Christopher Ré。FlashAttention:具有 IO 感知能力的快速且内存高效的精确注意力。在神经信息处理系统进展 (NeurIPS),2022。
[13] Shitong Shao,Zikai Zhou,Haopeng Li,Yingwei Song,Wenliang Zhong,Lichen Bai 和 Zeke Xie。LIVEditor-14B:通过上下文稀疏注意力实现闪电般统一的视频编辑。在第 43 届国际机器学习会议 (ICML) 论文集,2026。
[14] Huiqiang Jiang,Yucheng Li,Chengruidong Zhang,Qianhui Wu,Xufang Luo,Surin Ahn,Zhenhua Han,Amir H. Abdi,Dongsheng Li,Chin-Yew Lin,Yuqing Yang 和 Lili Qiu。MInference 1.0:通过动态稀疏注意力加速长上下文 LLM 的预填充。在神经信息处理系统进展 (NeurIPS),2024。
[15] Guangxuan Xiao,Junxian Guo,Kasra Mazaheri 和 Song Han。优化块注意力混合。arXiv 预印本 arXiv:2511.11571,2025。
[16] Chenchen Liu,Junyi Chen,Lei Li,Lu Chi,Mingzhen Sun,Zhuoying Li,Yi Fu,Ruoyu Guo,Yiheng Wu,Ge Bai 和 Zehuan Yuan。Bernini:视频扩散的潜在语义规划。arXiv 预印本 arXiv:2605.22344,2026。
[17] Haoyi Zhu,Haozhe Liu,Yuyang Zhao,Tian Ye,Junsong Chen,Jincheng Yu,Tong He,Song Han 和 Enze Xie。SANA-WM:使用混合线性扩散变换器进行高效分钟级世界建模。arXiv 预印本 arXiv:2605.15178,2026。
[18] Ideogram AI。Ideogram 4。https://ideogram.ai/blog/ideogram-4.0/,2026。
[19] Ziqi Huang,Yinan He,Jiashuo Yu,Fan Zhang,Chenyang Si,Yuming Jiang,Yuanhan Zhang,Tianxing Wu,Qingyang Jin,Nattapol Chanpaisit,Yaohui Wang,Xinyuan Chen,Limin Wang,Dahua Lin,Yu Qiao 和 Ziwei Liu。VBench:视频生成模型的全面基准套件。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,2024。
14
第 15 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
[20] Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, 等. Qwen-Image-Bench:从生成到创作的文生图评估基准. arXiv 预印本 arXiv:2605.28091, 2026.
[21] Jay Shah, Ganesh Bikshandi, Ying Zhang, Vijay Thakkar, Pradeep Ramani, 和 Tri Dao. FlashAttention-3:具有异步性和低精度的快速准确注意力机制. 在神经信息处理系统进展 (NeurIPS), 2024.
[22] Ted Zadouri, Markus Hoehnerbach, Jay Shah, Timmy Liu, Vijay Thakkar, 和 Tri Dao. FlashAttention-4:针对非对称硬件扩展的算法与内核流水线协同设计. arXiv 预印本 arXiv:2603.05451, 2026.
[23] Xin Zhou, Dingkang Liang, Kaijin Chen, Tianrui Feng, Xiwu Chen, Hongkai Lin, Yikang Ding, Feiyang Tan, Hengshuang Zhao, 和 Xiang Bai. 少即是多:通过运行时自适应缓存实现免训练的视频扩散加速. arXiv 预印本 arXiv:2507.02860, 2025.
[24] Feng Liu, Shiwei Zhang, Xiaofeng Wang, Yujie Wei, Haonan Qiu, Yuzhong Zhao, Yingya Zhang, Qixiang Ye, 和 Fang Wan. 时间步嵌入告知:是时候为视频扩散模型进行缓存了. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2025.
[25] Jiacheng Liu, Chang Zou, Yuanhuiyi Lyu, Junjie Chen, 和 Linfeng Zhang. 从复用到预测:使用 TaylorSeers 加速扩散模型. 在 IEEE/CVF 国际计算机视觉会议论文集 (ICCV), 2025.
[26] Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, 和 Enze Xie. Sol video 推理引擎:面向高效视频生成的代理原生全栈加速框架. arXiv 预印本 arXiv:2606.23743, 2026.
[27] Rewon Child, Scott Gray, Alec Radford, 和 Ilya Sutskever. 使用稀疏 Transformer 生成长序列. arXiv 预印本 arXiv:1904.10509, 2019.
[28] Iz Beltagy, Matthew E. Peters, 和 Arman Cohan. Longformer:长文档 Transformer. arXiv 预印本 arXiv:2004.05150, 2020.
[29] Manzil Zaheer, Guru Guruganesh, Avinava Dubey, Joshua Ainslie, Chris Alberti, Santiago Ontanon, Philip Pham, Anirudh Ravula, Qifan Wang, Li Yang, 和 Amr Ahmed. Big bird:用于更长序列的 Transformer. 在神经信息处理系统进展 (NeurIPS), 2020.
[30] Nikita Kitaev, Łukasz Kaiser, 和 Anselm Levskaya. Reformer:高效 Transformer. 在国际学习表征会议 (ICLR), 2020.
[31] Aurko Roy, Mohammad Saffar, Ashish Vaswani, 和 David Grangier. 具有路由 Transformer 的高效基于内容的稀疏注意力. 计算语言学协会汇刊, 9:53–68, 2021.
[32] Yizhao Gao, Zhichen Zeng, Dayou Du, Shijie Cao, Peiyuan Zhou, Jiaxing Qi, Junjie Lai, Hayden So, Ting Cao, Fan Yang, 和 Mao Yang. SeerAttention:用于高效长上下文预填充的自蒸馏注意力门控. 在神经信息处理系统进展 (NeurIPS), 2025.
[33] Jingyang Yuan, Huazuo Gao, Damai Dai, Junyu Luo, Liang Zhao, Zhengyan Zhang, Zhenda Xie, Yuxing Wei, Lean Wang, Zhiping Xiao, Yuqing Wang, Chong Ruan, Ming Zhang, Wenfeng Liang, 和 Wangding Zeng. 原生稀疏注意力:硬件对齐且原生可训练的稀疏注意力. 在计算语言学协会第 63 届年度会议论文集 (ACL), 第 1 卷:长论文, 2025.
[34] Enzhe Lu, Zhejun Jiang, Jingyuan Liu, Yulun Du, Tao Jiang, Chao Hong, Shaowei Liu, Weiran He, Enming Yuan, Yuzhi Wang, Zhiqi Huang, Huan Yuan, Suting Xu, Xinran Xu, Guokun Lai, Yanru Chen, Huabin Zheng, Junjie Yan, Jianlin Su, Yuxin Wu, Yutao Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, 和 Jiezhong Qiu. MoBA:用于长上下文 LLM 的块注意力混合模型. 在神经信息处理系统进展 (NeurIPS), 2025.
[35] Haocheng Xi, Shuo Yang, Yilong Zhao, Chenfeng Xu, Muyang Li, Xiuyu Li, Yujun Lin, Han Cai, Jintao Zhang, Dacheng Li, Jianfei Chen, Ion Stoica, Kurt Keutzer, 和 Song Han. Sparse video-gen:利用时空稀疏性加速视频扩散 Transformer. 在第 42 届国际机器学习会议论文集 (ICML), 2025.
[36] Xingyang Li, Muyang Li, Tianle Cai, Haocheng Xi, Shuo Yang, Yujun Lin, Lvmin Zhang, Songlin Yang, Jinbo Hu, Kelly Peng, Maneesh Agrawala, Ion Stoica, Kurt Keutzer, 和 Song Han. 径向注意力:具有能量衰减的 O(n log n) 稀疏注意力,用于长视频生成. 在神经信息处理系统进展 (NeurIPS), 2025.
[37] Peiyuan Zhang, Yongqi Chen, Runlong Su, Hangliang Ding, Ion Stoica, Zhengzhong Liu, 和 Hao Zhang. 使用滑动瓦片注意力实现快速视频生成. 在第 42 届国际机器学习会议论文集 (ICML), 2025.
15
第 16 页
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
[38] Pengtao Chen, Xianfang Zeng, Maosen Zhao, Mingzhu Shen, Wei Cheng, Gang Yu, and Tao Chen. Sparse-vDiT: Unleashing the power of sparse attention to accelerate video diffusion transformers. In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI), 2026.
[39] Peiyuan Zhang, Yongqi Chen, Haofeng Huang, Will Lin, Zhengzhong Liu, Ion Stoica, Eric P. Xing, and Hao Zhang. Faster video diffusion with trainable sparse attention. In Advances in Neural Information Processing Systems (NeurIPS), 2025.
[40] Jie Hu, Zixiang Gao, Yutong He, and Kun Yuan. DFSAttn: Dynamic fine-grained sparse attention for efficient video generation. In Proceedings of the 43rd International Conference on Machine Learning (ICML), 2026.
[41] Akide Liu, Zeyu Zhang, Zhexin Li, Xuehai Bai, Yuanjie Xing, Yizeng Han, Jiasheng Tang, Jichao Wu, Mingyang Yang, Weihua Chen, Jiahao He, Yuanyu He, Fan Wang, Reza Haffari, and Bohan Zhuang. FPSAttention: Training-aware FP8 and sparsity co-design for fast video diffusion. In Advances in Neural Information Processing Systems (NeurIPS), 2025.
[42] Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, and Jun Zhu. SpargeAttention2: Trainable sparse attention via hybrid top-k+top-p masking and distillation fine-tuning. arXiv preprint arXiv:2602.13515, 2026.
[43] Chaofan Lin, Jiaming Tang, Shuo Yang, Hanshuo Wang, Tian Tang, Boyu Tian, Ion Stoica, Song Han, and Mingyu Gao. Twilight: Adaptive attention sparsity with hierarchical top-p pruning. In Advances in Neural Information Processing Systems (NeurIPS), 2025.
[44] Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, and Tao Xie. VecAttention: Vector-wise sparse attention for accelerating long context inference. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026.
[45] Jiaming Tang, Yilong Zhao, Kan Zhu, Guangxuan Xiao, Baris Kasikci, and Song Han. QUEST: Query-aware sparsity for efficient long-context LLM inference. In Proceedings of the 41st International Conference on Machine Learning (ICML), 2024.
[46] Heejun Lee, Geon Park, Youngwan Lee, Jaduk Suh, Jina Kim, Wonyoung Jeong, Bumsik Kim, Hyemin Lee, Myeongjae Jeon, and Sung Ju Hwang. A training-free sub-quadratic cost transformer model serving framework with hierarchically pruned attention. In International Conference on Learning Representations (ICLR), 2025.
[47] Xunhao Lai, Jianqiao Lu, Yao Luo, Yiyuan Ma, and Xun Zhou. FlexPrefill: A context-aware sparse attention mechanism for efficient long-sequence inference. In International Conference on Learning Representations (ICLR), 2025.
[48] Aditya Desai, Shuo Yang, Alejandro Cuadron, Matei Zaharia, Joseph E. Gonzalez, and Ion Stoica. HashAttention: Semantic sparsity for faster inference. In Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025.
[49] Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, and Alvin Cheung. SVG-EAR: Parameter-free linear compensation for sparse video generation via error-aware routing. arXiv preprint arXiv:2603.08982, 2026.
[50] Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, and Jiaya Jia. Efficient long-context modeling in diffusion language models via block approximate sparse attention. arXiv preprint arXiv:2605.19726, 2026.
[51] Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jianfei Chen, and Jun Zhu. SLA: Beyond sparsity in diffusion transformers via fine-tunable sparse-linear attention. In International Conference on Learning Representations (ICLR), 2026.
[52] Jintao Zhang, Haoxu Wang, Kai Jiang, Kaiwen Zheng, Youhe Jiang, Ion Stoica, Jianfei Chen, Jun Zhu, and Joseph E. Gonzalez. SLA2: Sparse-linear attention with learnable routing and QAT. arXiv preprint arXiv:2602.12675, 2026.
16