FVAttn:解决视频生成稀疏注意力负载不均的运行时负载均衡方案

三分钟导读:FVAttn 是一种免训练的稀疏注意力系统,通过运行时负载均衡 (RLB) 和松弛感知稀疏增强 (SASA) 解决多 GPU 序列并行下 Top-p 路由导致的负载不均问题,显著加速视频生成。

英文题目:FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.16190

原始论文:PDF / 论文页面

对应视频标题:FVAttn:解决视频生成稀疏注意力负载不均的运行时负载均衡方案|推荐指数:★★★★★

这篇论文解决什么问题?

在视频扩散 Transformer (Video DiTs) 推理中,自适应稀疏注意力(如 Top-p 路由)虽然提高了掩码保真度,但导致头部级工作负载异构性,在多 GPU 序列并行下转化为等级级(rank-level)的长尾问题(straggler),抵消了稀疏性带来的效率增益。

核心创新

  • 提出 RLB 机制,基于实际观测到的头部工作负载进行轻量级 P2P 头部迁移,直接修复当前注意力调用的不平衡,而非依赖易过时的历史布局。
  • 提出 SASA 机制,将 RLB 后非关键等级的剩余松弛时间转化为额外的稀疏块计算,在不增加全局延迟的前提下提升视频质量。
  • 设计分段启用策略,根据负载不平衡因子动态选择仅启用 SASA 或同时启用 RLB+SASA,以平衡开销与收益。
  • 实现 CPU-GPU 重叠和计算-通信重叠,将运行时调度、迁移和增强的可见开销降至最低。

方法概览

FVAttn 在稀疏掩码材料化后执行两阶段运行时调度:1) 运行时负载均衡 (RLB):通过受限的点对点 (P2P) 头部迁移修复关键路径,减少长尾;2) 松弛感知稀疏增强 (SASA):利用非关键等级的剩余计算松弛时间,增加高价值稀疏块的计算,提升掩码覆盖率而不延长关键路径。结合重叠执行隐藏调度与通信开销。

逐图理解论文

动态稀疏导致的负载不均问题

动态稀疏导致的负载不均问题
Figure 2: Step-to-step workload variation in few- step video generation, with maximum adjacent- step changes of 97% at the head level and 44% at the rank level.

自适应稀疏注意力如 Top-p 路由提高了掩码保真度,但导致头部级工作负载异构性。在多 GPU 序列并行下,这种异构性转化为等级级的长尾问题。如图二所示,步间工作负载变化极大,头部级别最大相邻步变化达 97%,导致长尾节点抵消了稀疏性带来的效率增益。

FVAttn 系统架构概览

FVAttn 系统架构概览
Figure 3: Overview of FVAttn after sequence-to-head All-to-All, including mask routing, RLB with P2P head migration for load-imbalance reduction, slack-aware sparse augmentation for quality improvement, and block-sparse attention.

FVAttn 在稀疏掩码材料化后执行两阶段运行时调度。首先进行序列到头的 All-to-All 通信,随后通过掩码路由、运行时负载均衡、松弛感知稀疏增强,最终执行块稀疏注意力。该系统旨在通过运行时动态调整,解决静态布局无法适应动态稀疏模式的问题。

运行时负载均衡机制

运行时负载均衡机制
Figure 4: Load-imbalance factor under different RLB head-migration budgets.

运行时负载均衡通过受限的点对点头部迁移修复关键路径。它基于实际观测到的头部工作负载进行轻量级迁移,直接修复当前注意力调用的不平衡,而非依赖易过时的历史布局。如图四所示,随着迁移预算增加,负载不平衡因子显著降低,有效减少了长尾效应。

松弛感知稀疏增强机制

松弛感知稀疏增强机制
Figure 5: (a) Runtime mechanisms are enabled according to the observable load imbalance. (b) The SASA workflow.

松弛感知稀疏增强利用非关键等级的剩余计算松弛时间,增加高价值稀疏块的计算。如图五所示,该机制根据可观测的负载不平衡动态启用。它在 RLB 之后,将非关键等级的剩余时间转化为额外的稀疏块计算,在不增加全局延迟的前提下提升视频质量。

计算与通信重叠优化

计算与通信重叠优化
Figure 6: Overlapped execution schedule.

为了隐藏运行时调度、迁移和增强的可见开销,FVAttn 设计了分段启用策略和重叠执行。如图六所示,CPU-GPU 重叠和计算-通信重叠被精心安排。这种策略确保只有最必要的组件在关键路径上执行,从而将可见运行时开销降至最低,保持系统的高效性。

实验与关键结果

  • 在 Wan2.2 I2V, Wan2.2 Animate, 和 Wan2.1 T2V 上进行端到端评估,使用 8x NVIDIA H20 GPUs。
  • 与 FlashAttention, SageAttention, SpargeAttention, db-SP, Jenga, SVG2 等方法进行对比。
  • 进行消融实验,分别评估 RLB, SASA, 和 Overlap/Opt. 对延迟、负载不平衡因子和质量指标的影响。
  • 分析不同 GPU 数量下的负载均衡收益及初始不平衡度的影响。
  • 在 Wan2.2 I2V 上,FVAttn 相比 FlashAttention 实现 4.41x 注意力加速,DiT 推理加速 2.02-2.11x。(第 1 页)
  • 在 Wan2.2 I2V 上,RLB 将平均负载不平衡因子从 1.34 降低至 1.08。(第 1 页)
  • 在 Wan2.2 Animate 上,FVAttn (Top-p=0.95) 相比 FlashAttention 实现 2.43x DiT 加速,PSNR 为 22.640。(第 9 页)
  • 在 Wan2.1 T2V 上,FVAttn (Top-p=0.90) 相比 FlashAttention 实现 2.32x DiT 加速。(第 9 页)
  • 在 Wan2.2 I2V 上,完整 FVAttn 栈相比 FlashAttention 实现 4.41x 注意力加速,可见运行时开销仅 0.7 ms。(第 3 页)

阅读时需要注意

  • 主要针对长时空序列视频生成,对于短序列或注意力稀疏性弱的任务(如许多图像生成任务),收益降低。
  • 收益依赖于硬件的通信-计算比,在 PCIe 连接设备上,头部迁移的收益可能受限,需重新校准参数。
  • 主要在 Ulysses 风格序列并行和几步视频 DiT 推理下验证,未来需探索其在 Ring Attention 等其他并行策略下的适用性。
  • RLB 和 SASA 的效果高度依赖于初始负载不平衡程度,低不平衡时收益有限。
  • SASA 的增强预算需严格控制在剩余松弛时间内,否则可能创建新的长尾。
  • 参数(如迁移预算、触发阈值)需根据具体硬件拓扑和通信带宽进行调整。

关联工作

  • db-SP:对比基线,db-SP 使用历史布局进行全局重分区,在几步生成中可能过时,而 FVAttn 的 RLB 基于当前工作负载进行轻量级修复。(第 4 页)
  • SpargeAttention:对比基线,使用 Top-p 或 Top-k 路由,FVAttn 在其基础上增加了 RLB 和 SASA 以解决其引入的负载不均问题。(第 9 页)
  • FlashAttention:密集注意力基线,用于计算加速倍数和延迟基准。(第 9 页)
  • Ulysses:FVAttn 所基于的序列并行策略,将序列分片转换为头部分片。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

FVAttn: 面向视频生成的自适应稀疏注意力与运行时负载均衡

Hao Liu1,2 Chenghuan Huang2 Ye Huang4 Zhiying Wen1 Hao Liu3 Mohan Zhang3 Chen Li3 Ziyang Ma2 Jing Lyu3 Jiangsu Du1 1中山大学 2腾讯微信高性能计算部 3腾讯微信视觉部 4北京大学 {liuh393,wenzhy35}@mail2.sysu.edu.cn {dujiangsu}@mail.sysu.edu.cn {huangye26}@stu.pku.edu.cn {bighhliu,caderhuang,leweshaoliu,zeromhzhang,chaselli,ziyangma,eckolv}@tencent.com

摘要

视频扩散 Transformer(Video DiTs)处理长时空序列,使得自注意力成为高分辨率视频生成的主要瓶颈。训练无关的逐头稀疏注意力减少了这一成本,但自适应稀疏路由在多 GPU 序列并行下造成了不均匀的工作负载。这种负载异构性使稀疏注意力变成了一个等级层面的长尾节点(Straggler)问题。我们提出了 FVAttn,这是一种训练无关的稀疏注意力系统,旨在提高多 GPU 序列并行下自适应稀疏注意力的分布式执行效率。FVAttn 使用 Top-p 路由、Top-k 安全下限和视频感知的块组织作为稀疏路由前端,然后在运行时修复生成的掩码。运行时负载均衡(Runtime Load Balancing)通过 P2P 通信迁移少量重型头部,以缩短当前的关键路径。松弛感知稀疏增强(Slack-Aware Sparse Augmentation)利用非关键等级的剩余计算时间填充额外的低价值块,同时重叠技术将调度和迁移开销隐藏在现有计算之后。在 Wan2.2 I2V 的步骤蒸馏模型上,FVAttn 将平均负载不平衡因子从 1.34 降低到 1.08,相比 FlashAttention 实现了 4.41 倍的注意力加速,同时在保持具有竞争力的视频质量的同时,实现了 2.02–2.11 倍的 DiT 推理加速。

1 引言

最近,视频扩散 Transformer(Video DiTs)[14, 15, 18, 27, 1] 在视觉质量方面取得了显著进展。然而,其推理成本仍然高得令人望而却步。随着视频分辨率、帧数和持续时间的不断增加,Video DiTs 必须处理迅速增长的时空 token 序列,导致推理延迟大幅增加。例如,在单个 NVIDIA H20 GPU 上使用 Wan2.2-14B I2V 生成一段 5 秒的 720p 视频仍需要大约两个小时,其中注意力机制占总推理时间的 74.1%。为了提高部署效率,步骤蒸馏 [19–21] 已在工业界广泛采用,它减少了去噪步骤的数量,最多可提供 25 倍的推理加速。然而,步骤蒸馏并未改变每步的序列长度以及由此产生的二次方注意力成本。因此,即使在少步模式下,注意力仍然是主要的瓶颈,这促使在每个去噪步骤内进行互补优化。

稀疏注意力通过利用视频注意力中的大量冗余 [23, 16, 17, 26, 22] 提供了这种互补优化。对于查询 token 或查询块,只有少量关键块对输出有实质性贡献。训练无关的稀疏注意力方法通过在推理时构建块级掩码并跳过低价值的查询-键交互来利用这一特性。在这些方法中,Top-p 路由因其能够将保留的块数量自适应地调整到

第 2 页

图 1:FVAttn 将高效稀疏注意力与运行时负载均衡相结合,在保持视觉质量的同时加速视频生成。

每个注意力分布的集中度。一个集中的注意力头可以仅保留少数高质量块,而平坦或多模态的注意力头则可以保留更多的交互。与固定的 Top-k 预算相比,在类似的平均计算预算下,Top-p 能更好地保留注意力保真度。

然而,这种自适应能力引入了一个新的系统瓶颈。Top-p 路由导致不同注意力头和查询区域保留的块数量不同,在 Ulysses 风格的序列并行 [9] 下导致工作负载不平衡,其中序列到头的 All-to-All 操作将完整序列的注意力头分布在 GPU 等级之间。当多个高密度头映射到同一等级时,由此产生的工作负载偏斜会在同步注意力阶段导致长尾节点(stragglers),迫使其他等级在完成其分配的计算后保持空闲。因此,稀疏性带来的理论效率增益部分被分布式执行开销所抵消。这引出了本文解决的关键问题:如何在保持自适应稀疏注意力保真度优势的同时,实现平衡且高效的分布式执行?

现有的稀疏序列并行系统通常尝试在当前注意力计算之前,利用历史稀疏性、离线分析或近似相似度信号来选择头或块的布局 [2]。这种策略在少步视频生成中非常脆弱。如图 2 所示,在 4 步蒸馏设置中,相同头密度的最大相邻步变化达到 97%,相同等级负载的最大相邻步变化达到 44%。更根本的是,在 Ulysses 风格的序列并行下,当前稀疏注意力层的真实工作负载只有在序列到头的 All-to-All 完成且当前稀疏掩码具体化后才能被观察到。因此,预布局策略必须依赖过时或近似的信号。虽然完整的后掩码重新分区可以使用真实工作负载,但它需要另一次大规模数据移动,并且会抹去稀疏注意力的增益。

我们的关键观察是,Top-p 路由引入的工作负载不平衡高度局部化:大多数工作负载偏斜通常集中在少数几个重型头中。这一观察结果表明,消除注意力长尾节点不需要昂贵的全局重新分区或重新设计整个并行布局。相反,在实际稀疏模式具体化后,通过识别并迁移少量过载的头,我们可以在仅引入有界通信开销的情况下,恢复大部分关键路径效率。受此洞察的启发,FVAttn 引入了运行时负载均衡(Runtime Load Balancing, RLB),这是一种轻量级机制,可根据实现的工作负载调整分布式执行布局。在稀疏掩码具体化后,RLB 分析每个头的实际工作负载,并通过高效的点对点通信迁移选定的头。在默认的 8 GPU 设置中,每个等级发送和接收最多一个本地头,这仅相当于其分配的头集的大约 20%。因此,RLB 不是预测未来的最优分区,而是基于观察到的工作负载直接修复当前注意力调用的不平衡。

仅减少长尾等级不足以充分利用可用的计算能力。在有界迁移之后,一些非关键等级在全局关键路径下可能仍有剩余的松弛时间(slack)。FVAttn 通过松弛感知稀疏增强(Slack-Aware Sparse

2

第 3 页

增强。与全局提高 Top-p 阈值(这将增加所有等级的计算量并延长完工时间)不同,SASA 仅在有测量到松弛时间的等级上添加高价值块。这将同步空闲时间转化为额外的稀疏掩码覆盖范围,同时保持全局注意力延迟不变。

FVAttn 始于一个自适应稀疏路由阶段,该阶段构建初始掩码并生成两种形式的运行时元数据:每头工作负载和块重要性排名。RLB 利用前者在不改变稀疏计算本身的情况下,将选定的头重新分布到各个等级;而 SASA 利用后者将剩余的松弛时间用于计算额外的高价值块,且不延长注意力完工时间。因此,路由决定计算什么,RLB 决定在哪里计算,SAS 将原本空闲的计算能力转化为改进的稀疏掩码覆盖范围。

我们在 4 步蒸馏推理 [3] 下,在 Wan2.2 I2V、Wan2.2 Animate 和 Wan2.1 T2V 上评估了 FVAttn。在 Wan2.2 I2V 上,RLB 将平均负载不平衡因子从 1.34 降低到 1.08,而完整的 FVAttn 堆栈仅产生 0.7 ms 的可见运行时开销,便实现了相比 FlashAttention 4.41 倍的注意力加速。在所有评估的工作负载中,FVAttn 始终改进了现有免训练稀疏注意力的质量-效率帕累托前沿。我们的贡献如下。

• 我们识别出分布式视频 DiT 推理中自适应稀疏注意力的运行时系统瓶颈:旨在提升保真度的 Top-p 路由会导致头级工作负载异构性,这在序列并行下表现为等级级的长尾节点。 • 我们提出了 RLB,这是一种后路由运行时修复机制,它利用稀疏掩码实例化后实现的每头工作负载,并执行受通信预算限制的点对点头迁移,以缩短当前注意力的关键路径。 • 我们提出了 SASA,它将非关键等级剩余的松弛时间转化为额外的高价值稀疏块,在不全局提高 Top-p 阈值或延长注意力完工时间的情况下,提高稀疏掩码覆盖范围。 • 我们将 FVAttn 实现为一个重叠的稀疏注意力运行时,并在多个视频 DiT 工作负载上展示了在负载均衡、注意力延迟、DiT 延迟和视频质量指标方面的改进。

2 背景与相关工作

2.1 面向视频 DiT 的免训练稀疏注意力

面向视频 DiT 的免训练稀疏注意力大致可分为静态稀疏模式和动态稀疏路由。静态方法 [25, 11] 使用预定义或内容无关的结构,而动态方法 [23, 16, 17, 26] 则根据当前注意力特征构建输入依赖的掩码。FVAttn 采用动态块稀疏注意力。对于注意力头 $h$、查询块 $i$ 和键块 $j$,路由模块估计重要性得分 $s_{h,i,j}$ 并生成二元掩码 $M_{h,i,j} \in \{0, 1\}$,其中仅评估选定的查询-键块对。

稀疏路由策略的主要区别在于它们如何分配计算。Top-k 为每个查询块保留得分最高的 $k$ 个键块,产生固定且相对规律的工作负载。Top-p 则保留累积归一化重要性达到阈值 $p$ 的最小块集。因此,它平坦或多峰注意力分布分配更多计算,而集中分布分配较少计算,提高了适应性,但在查询块和头之间产生了异构工作负载。

FVAttn 将 Top-p 路由与 Top-k 安全下限相结合。Top-p 提供自适应计算预算,而 Top-k 下限则针对路由估计误差或过于激进的稀疏化保持最小预算。这种前端保留了注意力保真度,但引入了异构的每头工作负载。在固定的 Ulysses 头放置下,这些工作负载差异直接转化为等级级的运行时不平衡。

2.2 序列并行与负载不平衡

长序列视频 DiT 推理通常依赖于序列并行,包括 Ring Attention [13]、Ulysses [9] 以及 USP [5] 等统一序列并行策略。本工作主要基于 Ulysses 风格的序列并行。序列到头的 All-to-All 操作将序列

第 4 页

图 3:序列到头 All-to-All 之后 FVAttn 的概览,包括掩码路由、用于降低负载不平衡的带有 P2P 头部迁移的 RLB、用于质量提升的松弛感知稀疏增强,以及块稀疏注意力。

将序列分片为头部分片,因此每个 GPU 持有部分注意力头的完整序列,并独立计算局部注意力。在这种布局下,密集注意力天然平衡,因为所有头的计算量几乎相同。动态稀疏注意力破坏了这一特性,因为每个头的实际计算量由当前的稀疏掩码决定。

具体而言,头 $h$ 的实现工作负载和具有局部头集合 $H_r$ 的等级 $r$ 的工作负载定义为 $$ L_h = \text{mean}_i \sum_j M_{h,i,j}, \quad L_r = \sum_{h \in H_r} L_h. \quad (1) $$ 由于同步注意力阶段等待所有等级,延迟由 $\max_r L_r$ 决定。我们使用负载不平衡因子 $$ \rho = \frac{\max_r L_r}{\frac{1}{R} \sum_{r=1}^R L_r}, \quad (2) $$ 其中 $R$ 是等级数量。接近 1 的值表示执行平衡。大得多的值意味着许多 GPU 浪费时间等待最慢的等级。后面报告的从 1.34 到 1.08 的降低指的是这一指标。

现有的分布式稀疏注意力系统通过掩码感知的重新分区、基于配置文件的头放置或特定模式的并行执行来缓解工作负载不平衡 [2, 12, 10, 6]。例如,db-SP 在头和块级别全局重新分区稀疏工作负载,并通过跨步骤重用分摊规划成本,而 S-HPLB 从离线配置文件的稀疏特性中推导头放置。DSA 和 OSP-Next 则利用结构化稀疏模式构建专门的并行执行布局。相比之下,FVAttn 保留现有的 Ulysses 布局,等待当前自适应掩码具体化,并根据其实现的每头工作负载直接执行通信预算限制的 P2P 修复。

3 FVAttn 设计

3.1 概览

FVAttn 始于多 GPU 推理中动态稀疏注意力的系统瓶颈。Top-p 路由提高了掩码保真度,但在 Ulysses 风格的序列并行下,其头级稀疏性差异变为等级级实现的工作负载不平衡,并减慢了同步注意力阶段。因此,FVAttn 在当前稀疏掩码具体化后执行两阶段运行时调度。它首先使用 RLB 根据实现的每头工作负载修复关键路径。然后,它使用 SASA 将非关键等级上的剩余松弛时间转换为额外的高价值块。

4

第 5 页

具体而言,在 sequence-to-head All-to-All 之后,每个稀疏注意力层执行以下流水线。首先,FVAttn 构建自适应稀疏掩码。然后,FVAttn 测量实现的每头工作负载,并通过受限的 P2P 通信修复不平衡。接下来,FVAttn 将平衡后剩余的等级局部松弛(slack)转换为额外的掩码预算。然后,FVAttn 运行块稀疏注意力。最后,FVAttn 执行反向 All-to-All 并恢复头部顺序。第 3.2 节和第 3.3 节介绍了 FVAttn 的两个核心运行时机制。RLB 修复由 Top-p 路由引起的已实现工作负载不平衡,并缩短同步注意力阶段的关键路径。SASA 将负载均衡后暴露的剩余松弛转换为额外的高价值稀疏块计算,在不延长关键路径的情况下提高稀疏掩码覆盖率和视频质量。

在上述流水线中,稀疏路由前端是 RLB 和 SASA 的共享输入。为了提高路由阶段的相似度估计,FVAttn 沿希尔伯特曲线对块进行重排序,使得空间上相邻的 token 倾向于在不同尺度下落入邻近的块中。基于池化 Q/K 的块级相似度,FVAttn 主要使用 Top-p CDF 阈值,根据每个查询块的分布形状自适应地确定保留块的数量。FVAttn 还使用 Top-k 下限作为安全网,以防止在极端集中分布下出现过度的稀疏化。同一次路由过程也产生了 RLB 所需的每头密度和 SASA 所需的关键块重要性顺序。因此,这两个运行时机制不需要额外的路由计算。Top-p 自适应性是掩码保真度增益的来源,也是 RLB 在第 3.2 节中必须处理的工作负载异构性的来源。

3.2 运行时负载均衡

一旦动态稀疏掩码构建完成,每个头的已实现工作负载 $L_h$ 是完全可观测的。等级 $r$ 的工作负载随后固定为 $L_r = \sum_{h \in H_r} L_h$。Top-p 路由的自适应预算使得不同头保留不同数量的关键块,从而在 $L_h$ 中产生头级变化。这种变化进一步放大为等级级的负载不平衡,通常 $\rho \gg 1$。由于同步注意力阶段必须等待最慢的等级,其完成时间大致由 $\max_r L_r$ 决定。过载的等级成为长尾节点(Straggler),而其他等级产生空闲气泡,部分抵消了来自 Top-p 路由的算法计算节省。

为了缓解这些长尾节点和空闲气泡,FVAttn 使用头作为调度单元在等级间重新分配工作。我们将此负载均衡过程表述为显式的收益优化。调度方案在等级间重新分配头,并产生平衡后的工作负载 $L^{new}_r$。使用 $c$ 作为一个稀疏块的单位计算时间,该调度方案的关键路径收益为 $$ K = c (\max_r L_r – \max_r L^{new}_r). \quad (3) $$ 成本包括移动头状态带来的通信开销 $P$ 和求解迁移计划带来的调度开销 $C$。净收益为 $$ G = K – P – C. \quad (4) $$ 这种分解解释了为什么 FVAttn 必须在额外开销与负载均衡收益之间进行权衡,而不是简单地最大化 $K$。在 sequence-to-head All-to-All 之前进行预测性预调度可以将通信折叠到现有的集体操作中,因此 $P \approx 0$。然而,它依赖于预测而非当前的工作负载,而在步骤蒸馏视频 DiTs 中,相邻步骤间的 $L_h$ 可能会剧烈变化。因此,已实现的 $K$ 可能会大幅缩小,甚至变为负值。在掩码实例化后进行完整的掩码重新分区可以将负载驱动至接近完美平衡,并使 $K$ 接近其上界。然而,这需要另一次大规模集体数据移动,使得 $P$ 过大。因此,这两种替代方案都会使 $G$ 变小。FVAttn 采取了第三条路径:它在受限的 P2P 头迁移空间中搜索高收益调度方案。

我们观察到,由 Top-p 引入的负载偏斜集中在少数几个头上,而不是均匀分布在所有头上。这意味着从

第 6 页

将过载等级的负载迁移至具有剩余容量的等级,可以在不产生全局重排通信成本的情况下,消除大部分长尾节点时间。在 Wan2.2 I2V 中,仅迁移 20% 的本地头部(在 8 GPU 设置中即每个等级迁移一个头部),即可将平均不平衡度从 1.34 降低至 1.08。进一步增加迁移预算带来的收益显著减小。基于这一观察,FVAttn 将候选调度空间从全局重分区限制为轻量级的点对点(P2P)头部迁移。在默认配置下,这一约束意味着每个等级最多迁移一个本地头部,约占其本地头部的 20%。迁移计划可以表示为等级上的排列 $\sigma$,其中不动点 $\sigma(r) = r$ 表示无迁移。等级 $r$ 将本地头部 $h_r$ 发送给 $\sigma(r)$,并从 $\sigma^{-1}(r)$ 接收一个头部。平衡后的工作负载为 $$ L^{new}_r = L_r – L_{h_r} + L_{h_{\sigma^{-1}(r)}}. \quad (5) $$

这一约束并不能保证全局最优的负载均衡。它有意放弃了任意子集重分布的完整可行空间,以换取极小的单头部 P2P 流量和低廉的匹配开销。在此受限可行集内,RLB 联合搜索迁移元组 $(h, r_{src}, r_{dst})$,以最小化 $L^{new}_{max}$ 为主要目标,并以等级负载方差作为决胜条件: $$ \sigma^\star = \arg \min_{\sigma \in S_{20\%}} \left( \max_r L^{new}_r, \text{Var}_r(L^{new}_r) \right), \quad (6) $$ 其中 $S_{20\%}$ 表示满足“一发一收”约束且迁移不超过约 20% 本地头部的候选调度。换言之,RLB 并不追求在额外全局重排下的理论最优值。相反,它在通信和搜索成本受控的候选空间中,最小化关键路径上的工作负载。

为了降低 $C$,所有等级通过一次轻量级的 all-gather 操作收集全局密度信息。由于该信息在所有等级上相同,且受限搜索是确定性的,每个 GPU 独立运行相同的搜索并提取其自身的发送和接收伙伴。这避免了等级 0 求解并广播的同步开销。搜索策略取决于世界大小和通信约束。对于评估的 $R=8$ 设置,FVAttn 可以构建满足“一发一收”约束的配对拓扑,枚举 $S_{20\%}$ 中的候选匹配,并在上述字典序目标下选择最佳计划。对于更通用的世界大小,FVAttn 还可以构建单向环拓扑,使得每个等级参与一次发送和一次接收。这些受限搜索在数百微秒内产生确定性调度。因此,$C$ 相对于 $K$ 很小,可以直接嵌入到同步注意力前向路径中。

3.3 松弛感知稀疏增强 (SASA)

运行时负载均衡 (RLB) 修复了“最慢等级”问题,但受限于整体头部迁移和“一发一收”约束,RLB 后等级通常无法达到完美平衡。非关键等级可能仍在新最慢等级之前完成本地计算,这段等待时间构成了 RLB 后的剩余松弛时间。传统的稀疏注意力将掩码路由视为独立于推理环境的局部决策。其稀疏性主要由注意力分数分布和预设参数决定,而不考虑 RLB 后等级是否仍有空闲。对于这些等待中的非关键等级,只要额外计算量保持在剩余松弛时间内,就不会增加整体延迟。基于这一观察,FVAttn 提出 SASA,利用 RLB 后的剩余松弛时间来计算更多高价值的注意力块。

具体而言,SASA 将此过程表述为关键路径约束下的资源重新分配。在进入 SASA 阶段时,非关键等级 $r$ 到当前关键路径的剩余松弛时间为 $$ \Delta L_r = L^{new}_{max} – L^{new}_r, \quad L^{new}_{max} = \max_r L^{new}_r. \quad (7) $$ 此处,$L^{new}_r$ 表示 SASA 启动时的当前工作负载,可以是 RLB 后的工作负载,也可以是跳过 RLB 时的原始掩码后工作负载。对于具有足够大松弛时间的每个等级,SASA 并不直接填满整个松弛时间。相反,它分配一个额外的稀疏预算 $$ B_r = n_1 \Delta L_r, \quad (8) $$ 其中 $n_1$ 为增强系数。然后,SASA 遵循路由已生成的优先级顺序,并使用 $B_r$ 将额外的键块添加到掩码中,从而增加该等级上选中头部的密度。增强后的工作负载为 $$ L^{aug}_r = L^{new}_r + B_r. \quad (9) $$

第 7 页

图 5:(a) 根据可观测的负载不平衡情况启用运行时机制。(b) SASA 工作流程。

视频生成中的稀疏注意力质量与掩码密度密切相关。在 Top-p 路由下,保留更多的关键块可以覆盖更大比例的原始密集注意力质量,并在稀疏注意力过程中损失更少的信息。SASA 并不等同于全局提高 Top-p 阈值。全局阈值提高会增加所有等级的计算负载,并可能延长关键路径。相比之下,SASA 仅在负载均衡后仍有松弛时间的非关键等级上追加尚未选中的高价值块。因此,它将原本会因同步而浪费的空闲计算转化为更高的稀疏掩码覆盖率,而不会增加整体延迟。

这种增强本身并非没有代价。如果某个等级的增强预算 $B_r$ 超过其剩余松弛时间 $\Delta L_r$,$L_{aug}^r$ 可能会超过之前的最大负载 $L_{new}^{max}$ 并产生新的长尾节点(Straggler)。此外,候选扫描和调度会引入固定的开销 $S$。因此,SASA 的可见关键路径开销为

$$ A = \max \left( 0, \max_r L_{aug}^r – L_{new}^{max} \right) + S. \quad (10) $$

FVAttn 旨在通过满足两个条件使 $A \to 0$。首先,每个等级应将其增强预算保持在剩余松弛时间之内,即 $B_r \le \Delta L_r$,从而不产生新的长尾节点。其次,调度开销 $S$ 应最小化或被隐藏。

触发阈值和增强系数实现了第一个条件。触发阈值 $n_2$ 仅在 $\Delta L_r > n_2 L_{new}^{max}$ 时启动增强,从而避免对微小松弛时间进行不必要的调度工作。增强系数 $n_1$ 将 $\Delta L_r$ 折现为安全的稀疏预算 $B_r = n_1 \Delta L_r$,为内核粒度误差和估计误差留出余地,并防止 $B_r$ 有效地超过 $\Delta L_r$。在我们的 8×H20、世界规模 8 的设置中,我们设定 $n_2 = 0.07$ 和 $n_1 = 0.8$。这些值可以根据具有不同内核启动开销或通信-计算比的不同硬件进行重新校准。第二个条件通过重用路由输出和重叠调度来满足。额外的块从已排序的关键块顺序中选择,排除由当前 RLB 步骤迁移出去的头部,并在原处更新掩码。不需要额外的排序或 QK 评分。增强工作在发出 P2P 迁移之后、同步之前进行调度,因此其大部分开销被通信窗口隐藏。

这两个机制根据成本效益权衡启用。在全局负载已知后,如果负载不平衡因子满足 $\rho < k_1$,则负载接近平衡,系统跳过额外的运行时机制。如果 $k_1 \le \rho < k_2$,则不平衡在非关键等级上暴露了一些松弛时间,但不足以抵消 P2P 迁移的通信和调度成本。在这种情况下,FVAttn 仅启用低开销的 SASA,并利用当前后掩码工作负载中的松弛时间来增强高价值块。如果 $\rho \ge k_2$,则不平衡足够严重,FVAttn 首先启用 RLB 通过 P2P 头部迁移修复关键路径,然后在 RLB 后的剩余松弛时间上应用 SASA。此处 $k_2 \ge k_1$。这种分段行为反映了 FVAttn 的总体原则:在低不平衡下跳过额外机制,在中度不平衡下仅启用低开销的 SASA,在高不平衡下启用 RLB+SASA,从而使运行时机制根据可观测的负载状态逐步生效。

3.4 高效实现

借助 SASA,增强会在第 3.2 节所述的 RLB 成本之外引入额外的可见关键路径成本 $A$。联合净增益变为

$$ G = K – P – C – A, \quad (11) $$

7

第 8 页

图 6:重叠执行调度。

其中 P 表示 P2P 通信,C 表示运行时调度,A 表示松弛感知增强开销。算法目标是保持 K 较大;系统目标是使 P、C 和 A 尽可能不可见。

FVAttn 使用两条异步重叠路径。首先,它通过 CPU-GPU 重叠隐藏 C 的可见部分:CPU 搜索 RLB 计划并计算部分 SASA 预算,同时 GPU 执行必需的 V 量化。由于这些任务相互独立,调度和预算计算在很大程度上被量化窗口所吸收。

其次,它通过计算-通信重叠隐藏 P 和 A 的可见部分。在平衡计划就绪后,异步发起 P2P 头部迁移;随后,运行时继续对未迁移头部进行 V 量化和 SASA 增强,仅在迁移状态被消耗时进行同步。因此,通信使用网络资源,而有用的计算占用 GPU。对于 flash 回退分支,其中迁移负载较大且没有 SASA 工作可用,FVAttn 将注意力计算拆分为局部头部和迁移头部计算,并将局部头部路径与 P2P 传输重叠。

调度搜索、P2P 迁移和增强以非阻塞方式发起,仅在真正的数据依赖处同步。除了异步重叠外,Overlap/Opt. 消除了不必要的 CPU-GPU 同步,简化了运行时管理和内核启动,在保留 RLB 和 SASA 算法决策的同时降低了可见成本。表 5 显示,在 Overlap/Opt. 之后,增加的运行时组件仅暴露出 1.87% 的可见开销。完整的堆栈在不改变负载分布的情况下,将注意力延迟从 41.33 ms 降低到 37.54 ms。总之,RLB、SASA 和 Overlap/Opt. 共同修复了不平衡,将剩余松弛重新投资于掩码保真度,并最小化了可见的运行时成本。

4 实验

4.1 实验设置

模型和工作负载。我们在三个视频 DiT 工作负载上评估 FVAttn:Wan2.2 I2V 14B、Wan2.2 Animate 14B 和 Wan2.1 T2V 14B。所有工作负载均使用 LightX2V 4 步蒸馏 LoRA 配置 [3],代表了本工作针对的少步推理范式。除非另有说明,每个实验生成 720p 视频,包含 81 帧,对应 21 个潜在帧,每个潜在帧 3,600 个 token。对于 T2V 和 I2V,我们使用完整的 VBench [7, 8] 评估集,分别包含 946 和 1,118 个测试用例。对于 Animate,我们使用一个包含 20 个测试用例的内部评估集。所有对比方法使用相同的评估输入和推理配置。

指标和硬件。我们遵循官方评估协议,使用 VBench 来衡量整体视频生成质量。为了量化稀疏注意力在多大程度上保留了密集输出,我们还报告了在相同提示和种子下与 FlashAttention [4] 输出相比的 PSNR、SSIM、LPIPS 和 CLIP 相似度 (CLIP-Sim)。效率通过 8-GPU Ulysses 序列并行下的平均 DiT 延迟以及相对于 FlashAttention 的相应加速比来衡量。DiT 延迟测量所有采样步骤中完整的去噪变换器执行时间,不包括文本编码和 VAE 编码/解码,并涵盖了端到端生成延迟的主要部分。

8

第 9 页

表 1:I2V 和 T2V 端到端结果。 方法 配置 VBench↑ PSNR↑ SSIM↑ LPIPS↓ CLIP-Sim↑ DiT 延迟↓ 加速比↑

Wan2.2-14B-I2V 4 步 FlashAttention 稠密 88.7% – – – – 38.59s 1.00× SageAttention 稠密 88.7% 25.414 0.8420 0.0868 0.9922 21.20s 1.82× SVG2 Top-p=0.80 88.7% 22.967 0.7947 0.1160 0.9889 29.96s 1.29× SpargeAttention Top-p=0.95 88.3% 22.400 0.7728 0.1261 0.9880 19.92s 1.94× SpargeAttention Top-p=0.90 88.2% 21.477 0.7425 0.1472 0.9857 19.23s 2.01× SpargeAttention + db-SP Top-p=0.90 88.2% 21.477 0.7425 0.1472 0.9857 19.09s 2.02× SpargeAttention + RLB + SASA Top-p=0.90 88.3% 21.807 0.7513 0.1381 0.9865 18.84s 2.05× FVAttn Top-p=0.95 88.8% 23.801 0.8092 0.1045 0.9906 19.10s 2.02× FVAttn Top-p=0.90 88.8% 23.473 0.8024 0.1091 0.9903 18.30s 2.11×

Wan2.1-14B-T2V 4 步 FlashAttention 稠密 81.3% – – – – 34.70s 1.00× FVAttn Top-p=0.90 81.6% 19.585 0.7454 0.1411 0.9849 14.96s 2.32× SpargeAttention Top-p=0.90 80.9% 17.161 0.6438 0.2119 0.9746 15.69s 2.21× SpargeAttention + db-SP Top-p=0.90 80.9% 17.161 0.6438 0.2119 0.9746 15.47s 2.24× SpargeAttention + RLB + SASA Top-p=0.90 81.0% 18.571 0.6999 0.1700 0.9812 15.31s 2.27×

表 2:Wan2.2 Animate 端到端结果。 方法 PSNR↑ SSIM↑ LPIPS↓ CLIP-Sim↑ DiT 延迟↓ 加速比↑

FlashAttention – – – – 36.95s 1.00× SageAttention 22.259 0.8386 0.1131 0.9871 17.96s 2.06× FVAttn-Base (Top-p=0.95) 22.182 0.8343 0.1239 0.9848 16.40s 2.25× FVAttn (Top-p=0.95) 22.640 0.8488 0.1066 0.9873 15.21s 2.43× FVAttn-Base + db-SP 22.182 0.8343 0.1239 0.9848 15.51s 2.38× Jenga 21.534 0.8256 0.1314 0.9831 22.24s 1.66× FVAttn (Top-p=0.90) 21.512 0.8257 0.1291 0.9851 14.79s 2.50× SpargeAttention (Top-k=0.60) 21.188 0.8169 0.1400 0.9824 15.71s 2.35× SVG2 (Top-p=0.95) 21.002 0.8167 0.1389 0.9817 29.14s 1.27×

除非另有说明,注意力延迟涵盖通过反向头到序列 All-to-All 的序列到头 All-to-All,包括掩码路由、调度和稀疏注意力执行。所有实验均在配备 8×NVIDIA H20 GPU 并通过 NVLink 连接的服务器上运行,使用 CUDA 13.1。

基线与变体。FlashAttention 作为稠密基线。我们将其与用于视频生成的代表性免训练稀疏注意力方法进行比较,包括采用 Top-k 或 Top-p 选择的 SpargeAttention [23]、Jenga [26] 和 SVG2 [17],以及稠密量化版本的 SageAttention [24]。在负载均衡方面,我们在 SpargeAttention 和 FVAttn-Base 前端上分别对比了无负载均衡和 db-SP [2]。FVAttn-Base 表示我们不含 RLB 或 SASA 的自适应稀疏路由前端,而完整的 FVAttn 则是 FVAttn-Base 加上运行时负载均衡(Runtime Load Balancing)和松弛感知稀疏增强(Slack-Aware Sparse Augmentation)。我们在多种 Top-p 稀疏设置下评估 FVAttn,并将 Top-p = 0.95 和 Top-p = 0.90 分别作为以质量为导向和以速度为导向的主要运行点。所有稀疏注意力方法在前 25% 的去噪步骤中执行稠密注意力。对于 SVG2,我们使用其基于 FlashInfer 的原始动态块后端,并针对 4 步设置调整 k-means 初始化次数。

实现细节。分段阈值设置为 k1=1.05 和 k2=1.10:当 k1 ≤ρ < k2 时启用 SASA,当 ρ ≥k2 时启用 RLB+SASA。RLB 在每个等级(rank)上最多迁移一个本地头(约占 20%)。SASA 使用增强系数 n1=0.8 和触发阈值 n2=0.07。

评估路线图。实验分为三个部分进行。我们首先报告 I2V、Animate 和 T2V 工作负载下的端到端质量-效率结果。然后,通过端到端和注意力运行时的消融实验(包括扩展性和不平衡研究),隔离 RLB、SASA 和重叠的影响。最后,我们分解所添加机制的独立和可见运行时开销,并将测量结果与联合增益模型 G = K −P −C −A 联系起来。

4.2 整体性能

表 1 和表 2 显示,FVAttn 在 I2V、Animate 和 T2V 工作负载中一致地改善了端到端的质量-效率权衡。更具体地说,FVAttn 表现出“相同速度,

9

第 10 页

表 3:Wan2.2 Animate 上的端到端消融实验。RLB 仅改变头到等级的放置,而 SASA 将剩余松弛时间用于额外的关键稀疏块计算。 配置 PSNR↑ SSIM↑ LPIPS↓ CLIP-Sim↑ DiT 延迟↓ 加速比↑

FlashAttention – – – – 36.95s 1.00× FVAttn-Base (Top-p=0.95) 22.182 0.8343 0.1239 0.9848 16.40s 2.25× + RLB 22.182 0.8343 0.1239 0.9848 15.18s 2.43× + RLB + SASA 22.640 0.8488 0.1066 0.9873 15.21s 2.43× FVAttn-Base + db-SP 22.182 0.8343 0.1239 0.9848 15.51s 2.38×

表 4:Wan2.2 I2V 上的注意力运行时消融实验。 方法 注意力延迟↓ 最终不平衡度 ρ ↓ 相比 Flash 的加速比↑

FlashAttention 165.60 ms 1.00 1.00× FVAttn-Base (Top-p=0.95) 45.91 ms 1.34 3.61× + RLB 41.32 ms 1.08 4.01× + RLB + SASA 41.33 ms 1.01 4.00× + RLB + SASA + Overlap/Opt. 37.54 ms 1.01 4.41× FVAttn-Base + db-SP 44.17 ms 1.22 3.75×

“更高质量”和“相同质量,更高速度”的行为。在 I2V 上,FVAttn 在 Top-p=0.95 时的 DiT 延迟与 SpargeAttention 在 Top-p=0.95 时接近(19.10s vs. 19.92s),但显著提高了 PSNR/SSIM/LPIPS/CLIP-Sim(23.801/0.8092/0.1045/0.9906 vs. 22.400/0.7728/0.1261/0.9880)。在 Top-p=0.90 时,与 SpargeAttention 相比,FVAttn 将 DiT 延迟从 19.23s 降低至 18.30s,同时提高了 VBench(88.8% vs. 88.2%)和所有保真度指标。Animate 和 T2V 的结果遵循相同的趋势:FVAttn 在可比或更低的延迟下保持更高的保真度,并在质量相当时提供更高的加速比。综上所述,这些结果使 FVAttn 位于比现有免训练稀疏注意力基线更强的帕累托前沿上。

受控的 SpargeAttention 行进一步隔离了运行时调度的影响。在相同的 Top-p 稀疏路由前端下,db-SP 相比无负载均衡仅提供有限的加速,而 RLB+SASA 进一步降低了 DiT 延迟并提高了保真度。例如,在 I2V 上,SpargeAttention+RLB+SASA 相比 SpargeAttention+db-SP 将 DiT 延迟从 19.09s 降低至 18.84s,并将 PSNR 从 21.477 提高至 21.807。在 T2V 上,它将 DiT 延迟从 15.47s 降低至 15.31s,并将 PSNR/SSIM/LPIPS/CLIP-Sim 从 17.161/0.6438/0.2119/0.9746 提高至 18.571/0.6999/0.1700/0.9812。这表明,当前工作负载修复和剩余松弛时间复用比基于历史的布局复用更适合于少步视频 DiT 推理,且 RLB+SASA 可作为基于 Top-p 的稀疏注意力的即插即用运行时组件。

4.3 消融实验

我们从两个维度对 RLB、SASA 和重叠进行消融。表 3 测量了它们对 Wan2.2 Animate 的端到端影响,而表 4 隔离了 Wan2.2 I2V 上的注意力内核行为。这些实验共同将质量-延迟权衡与底层负载不平衡和关键路径成本联系起来。

端到端消融分离了两个运行时机制的作用。添加 RLB 后,PSNR、SSIM、LPIPS 和 CLIP-Sim 与 FVAttn-Base(22.182/0.8343/0.1239/0.9848)保持不变,证实了头迁移仅改变头的执行位置,而不改变所选的 QK 块。尽管具有这种保持质量的行为,它仍将 DiT 延迟从 16.40s 降低至 15.18s(7.4%),并将加速比从 2.25× 提高至 2.43×。在相同的稀疏路由质量下,RLB 也比 db-SP 快 2.2%(15.18s vs. 15.51s),这支持了修复当前已实现的工作负载而非复用历史布局的设计选择。

SASA 提供了互补的效果:它以可忽略的延迟成本提高了稀疏掩码覆盖率。在 RLB 的基础上,SASA 将 PSNR 提高了 0.458 dB(22.182→22.640),SSIM 提高了 1.7%(0.8343→0.8488),CLIP-Sim 从 0.9848 提高至 0.9873,同时将 LPIPS 降低了 13.9%(0.1239→0.1066)。DiT 延迟仅从 15.18s 变为 15.21s,表明增强预算保持在剩余松弛时间内,并未延长关键路径。

10

第 11 页

图 7:在 RLB 前后,各注意力调用中负载不平衡因子的分布。

图 8:在评估的 GPU 数量范围内,运行时负载均衡始终快于 db-SP,且在初始不平衡度较高时带来的增益更大。

表 4 为第 3.2–3.4 节中的三个设计目标提供了机制层面的证据:减少关键路径工作量、利用剩余松弛时间填充有用块,以及隐藏运行时修复的可见成本。仅使用自适应稀疏路由虽然速度快,但会导致等级间的偏斜:FVAttn-Base 相比 FlashAttention 实现了 3.61× 的注意力加速,但其最终不平衡度上升至 ρ = 1.34。RLB 将此不平衡度降低至 1.08,并将注意力延迟从 45.91 ms 降低至 41.32 ms,使加速比提升至 4.01×。这与增益模型 K = c(maxr Lr −maxr Lnewr) 相符:降低最大实现的等级负载可直接缩短关键路径。与 db-SP 相比,RLB 获得了更低的不平衡度(1.08 vs. 1.22)和更低的延迟(41.32 ms vs. 44.17 ms),表明每次调用的修复比复用的历史布局更能匹配当前少步视频 DiT 的工作负载。

SASA 的效果应被解释为松弛填充,而非另一种传统的负载均衡步骤。在 RLB 之后,SASA 通过将非关键等级剩余的松弛时间用于计算额外的高价值稀疏块,将最终的有效不平衡度从 1.08 降低至 1.01。注意力延迟基本保持不变(41.32 ms 至 41.33 ms),这与约束 Br ≤∆Lr 一致:增强操作应在不产生新的长尾节点的前提下提高有用工作的覆盖率。最后,Overlap/Opt. 将注意力延迟从 41.33 ms 降低至 37.54 ms,并将加速比从 4.00× 提升至 4.41×。由于 ρ 保持为 1.01,这一增益来自执行层面的优化,而非额外的负载均衡或稀疏增强。

图 8 进一步刻画了运行时负载均衡在何时最为有益。当初始不平衡度较低时,可消除的长尾节点时间很少,因此相对增益较小;这解释了在 2-GPU 设置下收益较小的原因。随着初始偏斜度的增加,RLB 带来的增益更大,因为它直接针对当前的关键路径。在评估的 GPU 数量和偏斜度范围内,RLB 始终优于 db-SP,因为 db-SP 的历史布局在少步生成和动态稀疏路由下可能变得过时。

4.4 开销分析

表 5 分解了在 Top-p=0.95 + RLB + SASA + Overlap/Opt. 配置下,新增运行时机制引入的增量开销。独立列(standalone column)测量每个新增组件的序列化成本,而可见列(visible column)测量在 Overlap/Opt. 之后残留在关键路径上的部分。为了将这些测量结果与联合增益模型 G = K −P −C −A 联系起来,密度交换和 P2P 头部迁移对应于通信成本

第 12 页

表 5:FVAttn 在 Wan2.2 I2V 上添加的运行时组件的增量开销。独立成本(Standalone cost)单独衡量每个组件,而可见成本(Visible cost)是重叠/优化(Overlap/Opt.)后剩余的部分。

| 组件 | 独立增加成本 | 相对于注意力的比率 | 重叠/优化后的可见增加成本 | 可见比率 | | :— | :— | :— | :— | :— | | 密度交换 | ∼0.3 ms | 0.72% | ∼0.1 ms | 0.27% | | 平衡计划搜索 | ∼0.5 ms | 1.21% | ∼0.1 ms | 0.27% | | P2P 头部迁移 | ∼0.6 ms | 1.45% | ∼0.1 ms | 0.27% | | 松弛感知增强 | ∼0.5 ms | 1.21% | ∼0.2 ms | 0.53% | | 头部顺序恢复 | ∼0.1 ms | 0.24% | ∼0.1 ms | 0.27% | | 其他开销(元数据、内核启动) | ∼0.6 ms | 1.45% | ∼0.1 ms | 0.27% | | 总开销 | ∼2.6 ms | 6.28% | ∼0.7 ms | 1.87% | | 参考注意力延迟 | 41.4 ms | 100% | 37.5 ms | 100% |

P、平衡计划搜索和头部顺序恢复对应于调度成本 $C$,松弛感知增强对应于增强成本 $A$。重要的是,表 5 仅分解了这些增量成本;它并未完全解释表 4 中从 41.33 ms 到 37.54 ms 的减少,因为重叠/优化(Overlap/Opt.)还消除了底层注意力路径中的同步和执行低效问题。

第 3.4 节中的两个重叠路径减少了这些增加成本的可见部分。CPU-GPU 重叠将平衡计划搜索和预算计算隐藏在 GPU 端的 V-量化窗口内,而计算-通信重叠将密度交换和 P2P 迁移隐藏在非迁移头部计算和增强工作之后。SASA 保留了最大的可见增加成本(∼0.2 ms,0.53%),因为其部分掩码更新和增强仍位于关键路径上;尽管如此,在松弛约束下,这种残余成本仍然很小。

重叠/优化(Overlap/Opt.)之后,增加的运行时组件仅暴露出 ∼0.7 ms 的可见关键路径开销,即最终 37.5 ms 注意力延迟的 1.87%。通过减少 $P+C+A$ 的可见部分同时保持工作负载分布,重叠/优化(Overlap/Opt.)进一步增加了净增益 $G$。

5 结论与局限性

结论。我们提出了 FVAttn,这是一种用于视频 DiT 推理的免训练稀疏注意力系统,它提高了多 GPU 序列并行下动态稀疏路由的分布式执行效率。自适应 Top-p 稀疏注意力可以根据每个注意力头的信息需求分配计算预算并提高掩码保真度,但这也会造成显著的头部级工作负载异构性,在多 GPU 执行中成为等级级长尾节点(Straggler)。为了解决这一张力,FVAttn 在当前稀疏掩码具体化后执行轻量级 P2P 头部迁移,利用运行时负载均衡(Runtime Load Balancing, RLB)修复当前注意力阶段的关键路径。在此基础上,松弛感知稀疏增强(Slack-Aware Sparse Augmentation, SASA)将非关键等级上的剩余松弛时间转换为额外的高价值稀疏块,在不显著增加全局注意力延迟的情况下提高稀疏掩码覆盖率。通过 CPU-GPU 重叠和计算-通信重叠,FVAttn 将调度、迁移和增强的可见开销保持在较低水平。在 Wan2.2 I2V、Wan2.2 Animate 和 Wan2.1 T2V 上的实验表明,FVAttn 同时改善了负载均衡、注意力延迟、DiT 延迟和视频质量指标,验证了 RLB 和 SASA 的有效性。

局限性。FVAttn 主要针对长时空序列视频生成。对于短序列或注意力稀疏性较弱的工作负载(如许多图像生成任务),稀疏注意力节省以及负载均衡或松弛复用的收益会相应减少。FVAttn 的收益也取决于硬件的计算与通信比率。在具有充足通信和内存带宽的 H20 级服务器上,轻量级 P2P 迁移和重叠可以有效隐藏运行时开销。在具有更强计算能力但更弱 GPU 间通信的 PCIe 连接设备上,头部迁移的收益可能有限,迁移预算、SASA 触发阈值和重叠策略可能需要重新校准。此外,本研究主要在 Ulysses 风格的序列并行和少步视频 DiT 推理下验证了 FVAttn。未来的工作可以探索其在 Ring Attention、USP、更多样化的硬件拓扑以及训练时稀疏注意力下的适用性。

12

第 13 页

参考文献

[1] Fan Bao, Chendong Xiang, Gang Yue, Guande He, Hongzhou Zhu, Kaiwen Zheng, Min Zhao, Shilong Liu, Yaole Wang, and Jun Zhu. Vidu: a highly consistent, dynamic and skilled text-to- video generator with diffusion models, 2024. URL https://arxiv.org/abs/2405.04233.

[2] Siqi Chen, Ke Hong, Tianchen Zhao, Ruiqi Xie, Zhenhua Zhu, Xudong Zhang, and Yu Wang. db-sp: Accelerating sparse attention for visual generative models with dual-balanced sequence parallelism. arXiv preprint arXiv:2511.23113, 2025.

[3] LightX2V Contributors. Lightx2v: Light video generation inference framework. https: //github.com/ModelTC/lightx2v, 2025.

[4] Tri Dao, Dan Fu, Stefano Ermon, Atri Rudra, and Christopher R´e. Flashattention: Fast and memory-efficient exact attention with io-awareness. Advances in neural information processing systems, 35:16344–16359, 2022.

[5] Jiarui Fang and Shangchun Zhao. Usp: A unified sequence parallelism approach for long context generative ai. arXiv preprint arXiv:2405.07719, 2024.

[6] Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, and Li Yuan. Osp- next: Efficient high-quality video generation with sparse sequence parallelism, hif8 quantization, and reinforcement learning. arXiv preprint arXiv:2605.28691, 2026.

[7] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, et al. Vbench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 21807–21818, 2024.

[8] Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nattapol Chanpaisit, Chenyang Si, Yuming Jiang, et al. Vbench++: Comprehensive and versatile benchmark suite for video generative models. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025.

[9] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, and Yuxiong He. Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models. arXiv preprint arXiv:2309.14509, 2023.

[10] Shenggui Li, Runyu Lu, Haiyan Yin, Yueming Lyu, Yonggang Wen, Ivor Tsang, Tianwei Zhang, et al. Dsa: Efficient inference for video generation models via distributed sparse attention. In The Fourteenth International Conference on Learning Representations.

[11] Xingyang Li, Muyang Li, Tianle Cai, Haocheng Xi, Shuo Yang, Yujun Lin, Lvmin Zhang, Songlin Yang, Jinbo Hu, Kelly Peng, et al. Radial attention: Sparse attention with energy decay for long video generation. Advances in Neural Information Processing Systems, 38: 16822–16852, 2026.

[12] Di Liu, Yifei Liu, Chen Chen, Zhibin Yu, Xiaoyi Fan, Quan Chen, and Minyi Guo. S-hplb: Efficient llm attention serving via sparsity-aware head parallelism load balance. arXiv preprint arXiv:2603.10353, 2026.

[13] Hao Liu, Matei Zaharia, and Pieter Abbeel. Ringattention with blockwise transformers for near-infinite context. In International Conference on Learning Representations, volume 2024, pages 3992–4008, 2024.

[14] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025.

[15] Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, et al. Hunyuanvideo 1.5 technical report. arXiv preprint arXiv:2511.18870, 2025.

13

第 14 页

[16] Haocheng Xi, Shuo Yang, Yilong Zhao, Chenfeng Xu, Muyang Li, Xiuyu Li, Yujun Lin, Han Cai, Jintao Zhang, Dacheng Li, 等. Sparse videogen: 利用时空稀疏性加速视频扩散 变换器. 在机器学习国际会议 (ICML) 上, 2025.

[17] Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Kelly Peng, 等. Sparse videogen2: 通过语义感知排列利用稀疏注意力加速视频生成. 神经信息处理系统进展, 38:96965–96991, 2026.

[18] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等. Cogvideox: 具有专家变换器的文本到视频扩散模型. 在表示学习国际会议 上, 卷 2025, 页码 83048–83077, 2025.

[19] Tianwei Yin, Micha¨el Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T Freeman. 改进的分布匹配蒸馏以实现快速图像合成. 神经信息处理系统进展, 37:47455–47487, 2024.

[20] Tianwei Yin, Micha¨el Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T Freeman, 和 Taesung Park. 具有分布匹配蒸馏的一步扩散. 在 IEEE/CVF 计算机视觉与模式识别会议 论文集上, 页码 6613–6623, 2024.

[21] Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang. 从缓慢的双向到快速的自回归视频扩散模型. 在 IEEE/CVF 计算机视觉与模式识别会议 论文集上, 页码 22963–22974, 2025.

[22] Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, 等. Sla: 通过可微调的稀疏线性注意力超越扩散变换器中的稀疏性. arXiv 预印本 arXiv:2509.24006, 2025.

[23] Jintao Zhang, Chendong Xiang, Haofeng Huang, Jia Wei, Haocheng Xi, Jun Zhu, 和 Jianfei Chen. Spargeattn: 精确的稀疏注意力加速任何模型推理. arXiv e-prints, 页码 arXiv–2502, 2025.

[24] Jintao Zhang, Pengle Zhang, Jun Zhu, Jianfei Chen, 等. Sageattention: 用于即插即用推理加速的精确 8 位 注意力. 在表示学习国际会议 上, 卷 2025, 页码 71566–71585, 2025.

[25] Peiyuan Zhang, Yongqi Chen, Runlong Su, Hangliang Ding, Ion Stoica, Zhengzhong Liu, 和 Hao Zhang. 使用滑动图块注意力实现快速视频生成. arXiv 预印本 arXiv:2502.04507, 2025.

[26] Yuechen Zhang, Jinbo Xing, Shaoteng Liu, Bohao PENG, Xin Tao, Pengfei Wan, Eric Lo, Jiaya Jia, 等. 通过动态令牌雕刻实现无需训练的高效视频生成. 神经信息处理系统进展, 38:81913–81946, 2026.

[27] Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, 和 Yang You. Open-sora: 让所有人都能享受高效的视频制作. arXiv 预印本 arXiv:2412.20404, 2024

14

发表评论