SANA-Video 2.0:混合线性注意力实现单卡高效长视频生成

三分钟导读:SANA-Video 2.0 提出了一种混合线性-softmax 视频扩散 Transformer,通过 25% 的 softmax 锚点和 Block AttnRes 机制,在保持线性注意力 O(N) 扩展性的同时恢复了 softmax 级别的生成质量,实现了单卡高效长视频生成。

英文题目:SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.21553

原始论文:PDF / 论文页面

对应视频标题:SANA-Video 2.0:混合线性注意力实现单卡高效长视频生成|推荐指数:★★★★★

这篇论文解决什么问题?

全 3D softmax 视频 DiT 在高分辨率和长视频场景下面临 O(N^2) 的计算复杂度瓶颈,导致推理延迟极高;而纯线性注意力虽然高效,但受限于固定状态矩阵的秩瓶颈,缺乏精确的 token-token 交互能力,导致生成质量下降。

核心创新

  • 提出 25% softmax 比例的混合注意力设计,在视频生成中找到了质量与效率的最佳权衡点(Pareto knee)。
  • 引入适配视频扩散的 Block AttnRes 机制,使用共享查询和块级摘要路由,提升深层有效秩约 12%。
  • 构建了完整的从头训练流水线,包括基于 TQD 的 timestep 感知数据选择和基于 ReFL 的在线强化学习对齐。
  • 证明了混合架构在长序列上的 O(N) 扩展性优势,且无需卷积适配器即可与标准内核高效融合。

方法概览

1. Hybrid Linear-Softmax Attention: 采用 3:1 比例(75% 线性, 25% softmax),线性层负责 O(N) 全局混合,周期性 softmax 锚点恢复低秩约束的精确交互。2. Block Attention Residuals (AttnRes): 将每 8 层分为一个 Block,通过共享查询的路由器将已完成 Block 的特征摘要路由到后续线性层,实现跨深度特征复用。3. 从头训练: 不依赖预训练模型线性化,而是通过多阶段课程学习(Pre-training, Continual, SFT, DPO/ReFL)直接训练混合架构。

逐图理解论文

方法:混合线性-Softmax 注意力

方法:混合线性-Softmax 注意力
Figure 2 | SANA-Video 2.0 overview. (a) Hybrid DiT layer. (b) Eight-layer blocks expose completed features across depth. (c) A shared-query AttnRes router aggregates the input and completed block features.

SANA-Video 2.0 提出了一种混合线性-Softmax 注意力机制。该设计采用 3:1 的比例,即 75% 的层使用线性注意力负责 O(N) 全局混合,25% 的层使用 Softmax 作为锚点。周期性插入的 Softmax 层恢复了低秩约束下的精确交互能力。这种设计在视频生成任务中找到了质量与效率的最佳权衡点,即 Pareto 前沿的膝点。

训练:从头训练与数据策略

训练:从头训练与数据策略
Figure 3 | Training and data pipeline for the 5B checkpoint. Curated in-house clips feed pre-training, continual training, SFT, and preference-based post-training (DPO + ReFL), with stage-specific data selection, video shapes, and training objectives per stage.

模型不依赖预训练模型的线性化,而是通过多阶段课程学习从头训练。流程包括 Pre-training、Continual、SFT 以及基于 DPO 和 ReFL 的对齐阶段。在数据选择上,采用基于 TQD 的 timestep 感知策略,针对不同阶段动态调整高质量和高运动分支的数据分布,确保模型在不同噪声水平下的收敛稳定性。

结果:质量与效率对比

结果:质量与效率对比
Table 2 | VBench quality comparison. Green intensity ranks the top three results per metric. Superscripts after method names denote score sources and are defined in Appendix D. Only the 81-frame SANA-Video 2.0 result is shown here; the appendix also provides the full protocols, extended baselines, and our 121- and 193-frame operating points.

在 VBench 基准测试中,SANA-Video 2.0 取得 84.30 的总分,其中质量得分为 85.61,优于 Wan 2.2 和 Cosmos-3 等主流模型。在效率方面,720p/60s 视频的 DiT Forward 延迟比全 Softmax 模型快 3.2 倍。结合 Sol-Engine 全栈加速后,单张 H100 生成 720p/5s 视频的延迟仅为 13.06 秒,比 Wan 2.2-A14B 快 120 倍。

实验:混合比例与 AttnRes 探针

实验:混合比例与 AttnRes 探针
Figure 4 | Reading loss by timestep, then the softmax-ratio proxy. (a) On a production checkpoint, validation loss spans a ∼3× range across the noise axis, so the scalar random-𝑡mean (dashed) hides structure. We therefore read every proxy comparison per timestep rather than as one scalar. (b,c) Fixed depth-28, width-3,072 architecture-search backbones (256p/81f): (b) 500-step mean training loss and (c) held-out normalized-latent velocity MSE at 10K (200 videos; pointwise 95% CIs) for five ratios.

通过代理研究验证了 Softmax 比例的有效性。固定深度和宽度下,25% 的混合比例在训练损失和验证 MSE 上均表现最佳。AttnRes 的设计探针显示,共享查询策略在不同时间步下保持特征自适应,且启用深度聚合后,深层线性层的表示秩显著恢复。路由机制也显示出对已完成 Block 特征的动态重用趋势。

扩展性:硬件与序列长度

扩展性:硬件与序列长度
Figure 5 | Hybrid-attention DiT-forward scaling (H100, bf16, batch 1; no AttnRes). (a) Compiled resolution scaling. (b) Compiled 720p/24fps duration scaling; its 121f point is shared with (a). (c) Full-softmax minus 25%-hybrid latency across model sizes at 720p/161f (19.3K tokens), with the same compiled backend in two run orders. Only (a,b) include 50% softmax; all are forward-latency profiles.

在 H100 和 B200/GB200 硬件上进行了 DiT Forward 延迟分析。随着序列长度增加,混合架构展现出 O(N) 的扩展性优势。在 720p/161f 场景下,绝对节省的时间从 128ms 增长至 948ms。GB200 相比 H100 进一步降低了 1.91 倍的延迟,证明了该长序列实现方案在不同硬件代际间的可迁移性。

实验与关键结果

  • 在 VBench 基准上与 Wan 2.2, Cosmos-3, LTX-2.3 等主流模型进行质量和延迟对比。
  • 通过代理研究(Proxy Studies)验证 Softmax 比例(0%-100%)和 AttnRes 设计(查询共享、块大小、时间步独立性)。
  • 在 H100 和 B200/GB200 硬件上进行 DiT Forward 延迟和扩展性分析。
  • 使用 Sol-Engine 进行全栈加速(内核融合、缓存、稀疏注意力)测试。
  • 量化感知训练(QAT)与 PTQ 的低精度推理效率评估。
  • VBench Total 84.30 (Quality 85.61)(第 7 页)
  • 480p/81f 生成延迟 13.2s (单 H100, 40-step)(第 1 页)
  • 720p/60s DiT Forward 比全 Softmax 快 3.2x(第 1 页)
  • Sol-Engine 加速后 720p/5s 延迟 13.06s (单 H100)(第 1 页)
  • 比 Wan 2.2-A14B 快 120x (单 H100)(第 1 页)
  • AttnRes 使深层有效秩提升 ~12%(第 1 页)
  • QAT (MXFP4-W/MXFP8-A) VBench 分数与 BF16 持平(第 12 页)

阅读时需要注意

  • 架构选择主要基于短序列、低分辨率的代理研究,长视频(>8s)的生成质量需进一步验证。
  • 当前算子为双向(Bidirectional),不支持因果生成,限制了其在流式世界模型中的直接应用。
  • 长视频(分钟级)的训练课程尚未完全展开,当前主要聚焦于 8s 以内的视频。
  • Sol-Engine 的 3.58x 加速包含近似操作(缓存和稀疏注意力),并非纯模型推理加速。
  • VBench 分数中 Bernini-R 14B 的 Total 和 Semantic 分数略高,但其推理成本远高于 SANA-Video 2.0。
  • QAT 仅对线性 GEMM 进行量化,线性注意力和 softmax 注意力仍保持 BF16。

关联工作

  • Wan 2.1/2.2, HunyuanVideo:主要对比基线,使用全 3D Softmax 注意力,计算成本高。(第 2 页)
  • SANA-Video (V1):前身工作,使用纯线性注意力,本文通过混合架构解决其秩不足问题。(第 3 页)
  • Qwen3-Next, Kimi-Linear, Kimi K3:语言模型中的混合注意力先驱,启发了本文的 3:1 比例和 AttnRes 设计。(第 3 页)
  • Diffusion-DPO, ReFL:用于后训练对齐的偏好优化和强化学习方法。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

2026-7-24

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

NVIDIA 项目页面 GitHub

摘要:我们介绍了 SANA-Video 2.0,这是一种在统一架构下实例化为 5B 和 14B 规模的混合视频扩散 Transformer。SANA-Video 2.0 旨在单 GPU 上生成高达 720p 的高质量视频,在保持线性注意力良好的长序列扩展能力的同时,其质量可与全 Softmax 视频 DiT 相媲美。为了避免全程二次复杂度注意力,混合线性-Softmax 注意力结合了门控线性注意力以实现 $O(N)$ 主导的混合,并以 3:1 的比例引入周期性门控 Softmax 锚点,恢复了纯线性注意力所缺乏的全秩令牌交互。为了将这些刷新后的表示跨深度传播,块注意力残差 (AttnRes) 将完成的块摘要路由到后续的线性层,实现了锚点特征的复用,并将深层有效秩提升了约 12%。通过从头训练,SANA-Video 2.0 学习了完整的混合架构,而不是对预训练模型进行线性化,低分辨率代理研究确立了 25% Softmax 作为最佳质量-效率权衡。在单张 H100 上,SANA-Video 2.0 在 480p 分辨率下以 40 步采样在 13.2 秒内达到了 VBench 分数 84.30,在延迟仅为极小一部分的情况下,与规模大得多的 Softmax 视频 DiT 保持竞争力。其编译后的 DiT 前向传播在 720p/60s 下比匹配的全 Softmax 基线快 3.2 倍,这一差距随着视频时长的增加而扩大。此外,全栈 Sol-Engine 优化(内核融合、缓存和稀疏注意力)进一步加速了这一硬件友好的骨干网络 3.58 倍,使 5B 管道在 720p/5s 下达到 13.06 秒,使其在单张 H100 上比 Wan 2.2-A14B 快 120 倍。总体而言,我们的混合设计以显著降低的成本恢复了 Softmax 级别的表达能力,解锁了可扩展的长时长、高分辨率视频生成。

[cs.CV]

(a) 文生视频示例,包括具身和遵循物理的场景;分组帧随时间展开一个片段。

(b) 生成流水线延迟 (秒),单张 H100 (720p, 5s)。(c) 5B DiT 前向传播 (秒) 与时长对比。

图 1 | SANA-Video 2.0 概览。(a) 文生视频示例,包括具身和遵循物理的场景。(b) 单张 H100 720p/5s 延迟,包括最终的 Sol-Engine 5B 和 40 层 14B 结果;VBench 标记了 5B 和 Wan 2.2 的质量点。(c) 5B DiT 前向传播随时长的加速比;14B 扩展见附录 G.2。

© 2026 NVIDIA。保留所有权利。

第 2 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

1. 引言

视频生成是一个快速发展的领域,为从创意内容制作到虚拟产品展示和直播等应用提供动力。最近的生成器,包括 Wan 2.1 [38] (14B)、HunyuanVideo [17] (13B)、Seedance 2.0 [32] 以及 Veo 3 和 Kling 等封闭系统,能够生成保真度极高的视频。在 Wan 2.1 和 HunyuanVideo 等开源 Video DiT [28] 基线中,完整的 3D Softmax 注意力会产生 $O(N^2)$ 的计算成本,这对视频生成来说代价高昂:经过 VAE 压缩后,单个 1080p 片段已经包含数万个潜在令牌(latent tokens),而在我们对生产规模进行的匹配分析中,在 1080p/121 帧下,使用最佳内核编译的完整 Softmax 主干网络比我们的 25% 混合模型慢 2.01 倍(图 5(a))。对于长视频(>10 秒),情况会进一步恶化,因为二次方注意力矩阵和激活工作区占据了主要成本;即使是专门针对长视频的努力,如 MAGI-1 [31],也受限于原始注意力机制。

线性注意力提供了一种原理性的解决方案。其 $O(N)$ 复杂度随序列长度优雅扩展,其状态空间视图为循环内核提供了清晰的接口,且 SANA-Video [6] 表明,纯线性 Video DiT 已经在具有竞争力的质量下实现了大幅加速。但是,纯线性注意力以表达能力换取效率:固定大小的状态矩阵 $S \in \mathbb{R}^{d \times d}$ 无法表示所有的令牌-令牌交互,这可能会削弱精确的时空对应关系和细节 [2, 7]。最近的大语言模型指出了一种修复方法:保留大部分线性注意力堆栈,但插入少量的 Softmax 锚点——即定期出现的完整注意力层,以在固定深度恢复精确且受秩约束较少的令牌交互——并以固定比例(Qwen3-Next [30]、Kimi-Linear [14])插入,并通过注意力残差 [16] 在深度间路由信息,最近的 Kimi K3 [15] 就在万亿参数规模下采用了这种组合。这引出了一个核心问题:一个以线性为主干能否在保持 $O(N)$ 扩展性的同时,恢复 Softmax 注意力的表达能力,从而适用于长分辨率视频?

本文通过 SANA-Video 2.0 给出了肯定的回答,这是一个在 5B 和 14B 规模下实例化的混合注意力视频扩散 Transformer。较大的模型是一个 40 层、宽度为 4,096 的主干网络,拥有 142.5 亿参数,在 384×B200 规模下训练。5B 运行点保持以线性为主干,但插入少量 Softmax 锚点,在质量上匹配强大的完整 Softmax Video DiT,同时在单 GPU 上保持高速(图 1):在单个 H100 上,使用 40 步采样,它在 480×832×81 分辨率下仅需 13.2 秒即可达到 VBench Total 84.30 的分数,与大得多的 Softmax 模型相比具有竞争力,且延迟仅为后者的几分之一;其 DiT 前向传播比在 720p/60s 形状下使用最佳内核编译的匹配完整 Softmax DiT 快 3.2 倍(图 1(c)),这一优势随持续时间增加而扩大。与预训练 Softmax 模型的后期线性化不同,我们直接训练混合主干。该设计基于三个关键组件。

混合线性-Softmax 注意力。我们保留门控双线性线性注意力作为核心令牌混合操作,因其 $O(N)$ 成本,并以固定的 3:1 比例(25% Softmax)交错插入门控 Softmax 锚点,放置在固定深度。这些锚点定期恢复纯线性注意力无法表达的受秩约束较少的令牌交互,而线性主体部分则保留了长序列的扩展性。文本通过交叉注意力进入,无卷积的 SwiGLU FFN 取代了 SANA-Video 的时间卷积 FFN,其测量的开销随持续时间增加(附录 G.4),使主干网络易于配置并与现成内核融合。

块注意力残差 (AttnRes)。仅靠加法残差会迫使后续层重新推导上游已计算的信息。AttnRes 不采用这种重新推导,而是将完成的块特征摘要在深度间进行路由,以便后续的线性层可以重用锚点更新的秩刷新。在受控的同检查点开/关探测中,启用 AttnRes 使深层状态的有效秩提高了约 12%。我们通过跨深度共享路由查询并移除显式的扩散时间步条件化(由 AdaLN 使其变得多余),将路由适应于双向视频扩散。

从头训练与设计。我们通过简短的、降低分辨率的代理研究选择架构,这些研究确定 25% 的 Softmax 锚点是质量-效率权衡的实用拐点。然后,通过完整、记录在案的多阶段管道从头训练完整模型,包括多源数据策展和过滤、低到高分辨率和持续时间的课程学习、结构化标题生成和自蒸馏,随后是基于偏好的后训练(DPO 和 ReFL),从而使混合模型学习运动和外观,而不依赖于预训练的 Softmax 或图像先验。我们将此训练和推理优化管道完整报告,作为核心、可复现的贡献。

总之,SANA-Video 2.0 以明显低于大型 Softmax Video DiT 的延迟达到了具有竞争力的 VBench 质量(84.30),其以 $O(N)$ 为主干的部分随持续时间扩展得更好。单独的 50 步 Sol-Engine 部署在 B200 上实现了 3.58 倍的端到端加速,且感知量化训练在 MXFP4 权重和 MXFP8 激活下匹配了 BF16 的质量(第 6 节)。秩和路由分析揭示出明确的分工,其中线性层提供廉价的全局混合,Softmax 锚点注入精确且受秩约束较少的交互,而 AttnRes 在深度间携带块级特征。我们希望 SANA-Video 2.0 能为研究人员和日常用户提供一种实用、高效的高质量视频生成基础,使其能够快速运行。

第 3 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

2. 预备知识

视频 DiT 与流匹配。视频扩散 Transformer [28] 可以使用条件最优传输流匹配 [23] 进行训练:它们构建潜在序列 $z_t = (1-t)z + t\epsilon$(其中 $\epsilon \sim \mathcal{N}(0, I)$,$t \sim \text{logit-normal}$),并预测条件速度 $\epsilon – z$,损失函数为 $\mathcal{L} = \mathbb{E}\|v_\theta – (\epsilon – z)\|^2$。此处 $t \in [0, 1]$ 表示归一化的流匹配时间步。每个块使用 AdaLN 风格的时间步调制、自注意力、文本交叉注意力和 FFN。在 1080p 分辨率下,长片段已经跨越数万个潜在位置,使得 Softmax 的 $O(N^2)$ 成本变得难以承受。

门控线性注意力。线性注意力将令牌交互压缩为固定大小的状态,以秩瓶颈为代价将序列复杂度降低至 $O(Nd^2)$。我们的双向算子是一个门控双线性形式,而非因果 Delta 规则递归;省略 Delta 规则更新也使其成为因果门控 DeltaNet 的自然初始化,这是我们留给未来工作的方向。对于归一化的查询和键,令 $q_{rj}, k_{rn}$ 表示它们的 RoPE 旋转形式,且 $\phi(\cdot) = \text{ReLU}(\cdot)$。每个头计算

$$ S = \sum_n v_n (\beta_n k_{rn})^\top, \quad o_j = W_o \text{RMSNorm} \left[ \frac{S q_{rj}}{\sum_n \phi(k_n)^\top \phi(q_j) + \epsilon} \odot \sigma(g_j) \right], \quad (1) $$

其中 $\beta$ 门控写入状态,$g$ 门控输出。周期性的 Softmax 层在选定的深度提供受秩约束较少的令牌混合,同时保持大部分序列计算为线性。这些锚点使用带有 QK 归一化、RoPE 以及 Qiu 等人 [29] 研究的 Sigmoid 输出门控的双向 SDPA。我们采用 Qwen3-Next [30] 的常规 3:1 混合布局;Kimi-Linear [14] 独立使用相同比例的不同线性算子。

注意力残差。标准加法残差 $h_l = h_{l-1} + f_l(h_{l-1})$ 通过每个中间深度传播信息。注意力残差 [16] 则使用学习到的逐深度聚合 $h_l = \sum_i \alpha_{i \to l} v_i$。其 Block AttnRes 变体保留已完成的块摘要和块内运行残差,并在注意力和 FFN 子层之前应用单独的路由。在我们的混合堆栈中,已完成的摘要包括 Softmax 锚点更新,并将它们暴露给后续主要为线性的层。原始方法为每个子层参数化路由查询。我们的视频适配改为在深度间共享它们。我们没有假设路由查询需要单独的扩散时间步输入,而是测试其是否有必要,发现其与 AdaLN 冗余。

3. SANA-Video 2.0

3.1. 概述

SANA-Video 2.0 是一种视频 DiT,它在深度上结合了混合序列注意力和块残差注意力。它在 LTX-VAE 2.3 [11] 的潜在空间上运行,并通过每一层的交叉注意力从 Gemma-2-2B-IT [8] 中提取文本特征。在每个深度,AttnRes 首先将表示路由到自/交叉注意力分支,然后在第二步中路由到 SwiGLU FFN,每个分支内部包含 AdaLN 风格的调制,最终聚合后接输出头。局部路径全程无卷积。附录 B 列出了完整配置。

3.2. 混合注意力设计

基于门控注意力原语(第 2 节),我们以 3:1 的比例交错双向门控线性注意力层和门控 Softmax 锚点,即 75% 线性,25% Softmax,每四层放置一个 Softmax 锚点。线性主体部分将令牌混合保持在 $O(N)$,而均匀分布的锚点定期刷新压缩线性状态无法表示的受秩约束较少的交互(第 5.5 节)。线性和 Softmax 头使用不同的头维度,在效率和每头容量之间进行权衡(附录 B)。这种常规布局遵循近期大语言模型(Qwen3-Next [30]、Kimi-Linear [14] 和万亿参数规模的 Kimi K3 [15])的混合线性注意力,并能干净地映射到融合线性注意力内核。我们通过从头开始扫描该比例,而非假设语言模型的值,确认 25% 的锚点比例是视频模式下的质量-效率拐点(第 5.3.1 节)。两条路径保留单独的 RoPE [34] 张量和门控参数化:线性层同时使用写门 $\beta$ 和输出门,而 Softmax 锚点使用 Qiu 等人 [29] 的 Sigmoid 输出门。

第 4 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

(a). 混合 DiT 模块 (b). 残差注意力聚合 (c). AttnRes 模块

图 2 | SANA-Video 2.0 概览。(a) 混合 DiT 层。(b) 八层块在深度方向上暴露已完成特征。(c) 共享查询的 AttnRes 路由器聚合输入和已完成块的特征。

3.3. 块注意力残差 (AttnRes)

图 2 总结了混合层及其块级深度路由。混合注意力仅在稀疏深度提供受秩约束较少的 token 混合;AttnRes 通过向后续层暴露包含这些更新的已完成块摘要来对其进行补充。我们基于 Block AttnRes [16] 构建,Kimi K3 [15] 在语言模型规模下将其与混合线性注意力配对,我们将其适应于双向视频扩散。层被分组为连续的块:每个在层 $l$ 完成的块留下一个单一的特征摘要,而仍在进行中的块携带一个运行中的部分和。因此,层 $l$ 的路由器从源集 $\mathcal{V}_l = \{b_0, b_1, \dots, p_l\}$ 中抽取,该源集由初始 token 嵌入 $b_0$、在层 $l$ 之前完成的块的已完成块摘要 $b_1, b_2, \dots$ 以及当前块内的部分和 $p_l$ 组成,$p_l$ 是在进行中的块中迄今为止的累积值(仅在块边界处缺失,此时它刚刚被冻结为新的摘要并重置)。对于每个视频 token $x$,在子层类型 $\tau$ 之前的路由表示为

$h_l(x) = \sum_{v_i \in \mathcal{V}_l} \alpha^{(\tau)}_{i \to l}(x) v_i(x), \quad \alpha^{(\tau)}_{i \to l}(x) = \text{softmax} \left( \left( w^{(\tau)} + \varphi_\tau(t) \right)^\top \text{RMSNorm}(v_i(x)) \right)$, (2)

其中 $v_i(x)$ 是源 $v_i \in \mathcal{V}_l$ 在 token 位置 $x$ 处持有的特征,$w^{(\tau)}$ 对于 $\tau \in \{\text{attn, ffn}\}$ 在所有深度间共享,$\varphi_\tau(t)$ 是可选的、初始化为零的时间步偏移。softmax 针对每个 token 独立地在深度源上进行。在最后一个块之后,第三个共享查询将初始嵌入和已完成块的和聚合到传递给输出头的最终表示中。

共享路由查询。原始的 AttnRes 为每个残差子层学习一个单独的路由查询,这是一种语言模型即使在大规模下也保留的每层设计(例如,Kimi K3 [15])。对于我们的视频模型,每个分支一个共享路由查询就足够了:一个注意力查询和一个 FFN 查询,在每个深度重复使用。这与损失中的每层路由相匹配,但内存占用仅为前者的几分之一(第 5.3.2 节)。共享查询并不会使路由变得均匀。源集 $\mathcal{V}_l$ 随深度变化,因此路由权重仍然逐层变化,并且由于每个源都按 token 进行归一化,它们也逐 token 变化。因此,共享减少了每深度查询参数,同时仍然以不同方式路由注意力分支和 FFN 分支。

块组织。我们将每 $S=8$ 个连续的 transformer 层分组为一个块。随着前向传播穿过一个块,每个注意力或 FFN 子层的输出,即它原本会添加到隐藏状态中的残差更新,被添加到运行中的部分和 $p_l$ 中,路由器也将其作为源读取(公式 2)。当块结束时,$p_l$ 被冻结为该块的已完成摘要 $b_k$,下一个块开始一个新的部分和。由于路由器仅保留每个已完成块的一个摘要,而不是每层一个特征,因此存储的历史记录从 $O(N L d)$ 缩减为 $O(N \lceil L/S \rceil d)$,其中 $N$ 为序列长度,大约减少了 $S$ 倍。$S=8$ 的范围覆盖了两个 softmax 锚点周期,同时保持此历史记录紧凑,消融实验将其视为工程默认值而非普遍最优值(第 5.3.2 节)。与 Block AttnRes 一样,注意力和 FFN 路由器学习不同的偏好(附录 F.5)。

4

第 5 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

内部数据处理

来源 镜头分割 清理 评分 字幕生成 池化 选择性递增 内部片段 单镜头 黑边·字幕 质量·运动 结构化文本 选择

训练课程 连续运行 · 分辨率 · 时长 · 质量 ↑

预训练 持续训练 SFT 后训练

480p · 5s · 16/24fps 480→720p · 5→8s 720p · 8s 混合 DiT 720p · 8s · 24fps FM + 自流 FM + 自流 DPO + ReFL FM; 关闭自流 分数感知 TQD TQD 关闭; token shift 奖励对齐

图 3 | 5B 检查点的训练和数据流水线。精心策划的内部片段用于预训练、持续训练、SFT 和基于偏好的后训练(DPO + ReFL),每个阶段具有特定阶段的数据选择、视频形状和训练目标。

与时间步无关的最终设计。尽管去噪时间步具有不同的语义角色,但学习到的偏移量几乎是恒定的,改变或打乱它对验证效果的影响微乎其微。因此,最终模型使用 𝜑𝜏≡0,同时在 DiT 块中保留时间步调制(第 5.3.2 节,附录 F.4)。

4. 训练配方

SANA-Video 2.0 使用具有相同混合设计的 5B 和 14B 模型。5B 生产配方涵盖数据策展、分辨率/时长课程以及基于偏好的后训练(图 3)。40 层的 14B 运行使用相同的流匹配和混合注意力公式,并在 384×B200 GPU 上使用特定规模的预训练设置。除了架构之外,该配方还指定了如何将语料库转化为逐步更干净的监督信号、如何采样噪声水平以及如何增加分辨率和时长。我们描述这些组件,因为它们是方法的一部分。该配方是联合选择的,而不是逐个组件进行消融实验。附录 B 列出了特定规模的架构和训练设置。

4.1. 数据策展与质量/运动漏斗

从原始视频语料库开始,我们应用统一的处理流水线:镜头分割、黑边和字幕清理、移除低分辨率/模糊/静态/曝光缺陷的片段,以及多轴评分而非单一的综合质量分数。保持轴分开是刻意为之:它防止选择退化为视觉上干净但几乎静态的片段,同时仍保留高质量低运动内容。附录 C 提供了完整的六阶段流水线和评分信号(表 7)。生成的片段形成了一个渐进的质量/运动漏斗:预训练在宽松阈值下使用广泛的池,持续训练提高了质量和运动下限,而 SFT 则集中在少量可信子集上。字幕从混合的短/长描述进展到密集的结构化描述,并在可用时附加量化运动描述符,将选择信号转化为条件提示。相同的质量和运动轴也驱动下面的预训练时间步策略,在早期建立广泛的覆盖范围,并在后期阶段专注于保真度和提示遵循。

4.2. 训练目标与时间步采样

训练使用带有对数正态时间步密度的流匹配。在后续的持续训练和 SFT 阶段中,我们对这种密度进行尾部地板处理(tail-floor),保留在纯噪声极端情况下纯对数正态分布采样不足的概率质量。这些情况分别对应最终细化全局结构。从持续训练阶段开始,我们使流偏移(flow-shift)感知 token 计数:而不是固定的每分辨率常数,我们在两个端点锚定偏移,并通过潜在 token 计数在对数偏移空间中进行插值,从 4,290 个潜在 token(480p,81 帧)时的 3 线性对数增加到 23,000 个 token(720p,193 帧)时的 6。每个偏移都是通过将对数正态均值(尾部地板处理,𝜎=0.95)偏移 log(shift) 来实现的,因此每个中间分辨率×时长都落在一个原则性的偏移上,并且随着片段变长,更多概率质量移动到高噪声区域(表 1)。由于课程联合变化分辨率和时长,token 计数跨越了一个离散每分辨率偏移所遗漏的连续范围。因此,每个秩直接根据其局部潜在形状计算其偏移;由于生产环境中每个秩使用批量大小 1,该映射是逐样本的。

第 6 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 1 | 生产训练课程。剪辑数量是在过滤后报告的,目标附加项是特定于阶段的;特定规模和特定模型的模型及优化器设置列于表 6 中。

| 阶段 | 剪辑数 | 分辨率 | 帧率 | 时长 | 流偏移 | 学习率 | 目标附加项 | | :— | :— | :— | :— | :— | :— | :— | :— | | 预训练 | ~30M | 480p | 16/24 | 5s | 1 (+TQD) | 10⁻⁴ | TQD + 自流 | | 持续训练 | ~10M | 480→720p | 16/24 | 5s→8s | 3–6 (按 token) | 10⁻⁴ | 自流 | | SFT | ~10⁴ | 720p | 24 | 8s | 3–6 (按 token) | 5×10⁻⁵ | 标准 FM |

内容感知的流偏移(TQD)。高质量视频数据稀缺,因此我们希望每个剪辑都能在其最擅长的领域做出贡献。这遇到了运动与质量的困境:运动丰富的剪辑通常带有降低其单帧美学质量的伪影,而最干净的剪辑往往几乎是静态的,因此单一的质量标准要么牺牲运动,要么牺牲保真度。TQD [26] 通过将每个剪辑路由到其内容重要且弱点不明显的噪声区域来解决这一问题:高噪声控制全局结构和运动并掩盖精细纹理,因此接收运动丰富的剪辑,而低噪声控制精细细节并接收美学干净、低运动的剪辑。在预训练阶段,仅通过高运动阈值的剪辑获得 +1.1 的 logit 偏移,仅通过高质量阈值的剪辑获得 -1.1 的偏移,而同时满足或均不满足的剪辑保持基础密度。从持续训练开始,TQD 偏移被禁用,由 token 计数偏移接管。其最小偏移量 3 大致匹配高运动 TQD 分支的中位数,但这种变化是阶段级别的替换,而非样本级别的连续交接。附录 B.3 给出了偏差幅度、阈值和完整的采样密度。

权重 EMA 和自流。我们在整个训练过程中(包括 SFT)保持模型权重的指数移动平均(EMA)处于激活状态。此外,预训练和持续训练还额外携带 Self-Flow [5],这是一种辅助特征蒸馏目标,具有剪辑内双时间步条件,我们将其用作训练辅助工具,而非被研究的组件。Self-Flow(附录 B.2)对每个潜在 token 进行监督,并在 SFT 期间关闭,而权重 EMA 保持开启。

4.3. 时间步分层验证

在训练期间,我们通过验证损失来跟踪检查点质量,但单一的随机 $t$ 均值是一个薄弱的监控指标:因为损失在噪声轴上变化数倍,单个标量模糊了哪些噪声区域得到改善或退化,并且具有高采样方差。因此,我们将验证分为十个相等的 100 步噪声桶,这揭示了均值所隐藏的结构性信息。在四个配对检查点中,桶宏观指标下降了 6.42%,但该净数值将 11.44% 的低噪声改善与 1.16% 的高噪声退化区分开来(图 11)。对固定的 100 次评估预算进行分层,相对于 IID 时间步抽取,将这一早期到最终的估计标准差降低了 2.27 倍,从而提供了更可靠的监控指标。VBench 总分从 82.68 上升到 83.29,与这一净改善一致,鉴于仅有四个数据点,可作描述性解读。附录 B.4 详细介绍了匹配样本协议和不确定性分析。

4.4. 后训练阶段

4.4.1. 直接偏好优化

我们采用 Diffusion-DPO [36] 作为视觉偏好对齐的标准后训练步骤。对于每个提示 $c$,Gemini 根据视觉保真度、提示对齐、运动质量和时间连贯性对使用不同随机种子采样的视频进行排名。在过滤掉不可靠的排名后,排名最高和最低的视频形成偏好-拒绝对 $(x_+, x_-, c)$。此排名是离线执行的;Gemini 不是训练循环的一部分。

我们将可训练策略 $\theta$ 和冻结的参考模型 $\theta_{\text{ref}}$ 均从 SFT 检查点初始化。在每个训练步骤中,一对中的两个视频共享相同的采样时间步 $t$ 和高斯噪声 $\epsilon$。令 $q_t$ 表示前向加噪算子,$v_\varphi$ 表示模型 $\varphi$ 的流速度预测。每个视频的流匹配误差为

$$ x_{\pm t} = q_t(x_\pm, \epsilon), \quad u_\pm = \epsilon – x_\pm, \quad e_{\pm \varphi} = \left\| v_\varphi(x_{\pm t}, t, c) – u_\pm \right\|_2^2, \quad (3) $$

其中 $D$ 是潜在元素的数量。共享 $t$ 和 $\epsilon$ 确保成对差异反映的是视频本身,而非不匹配的损坏程度。我们将偏好-拒绝误差间隙定义为 $\Delta_\varphi = e_{-\varphi} – e_{+\varphi}$ 并优化

$$ \mathcal{L} = -\mathbb{E}[w \log \sigma(\beta(\Delta_\theta – \Delta_{\theta_{\text{ref}})))] + \lambda \mathbb{E}[e_{+\theta}]. \quad (4) $$

第 7 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 2 | VBench 质量对比。绿色强度表示每项指标的前三名结果。方法名称后的上标表示分数来源,定义见附录 D。此处仅展示 81 帧的 SANA-Video 2.0 结果;附录还提供了完整的协议、扩展基线以及我们在 121 帧和 193 帧下的运行点。

| Model | Params | Attention | Frames | Total↑ | Quality↑ | Semantic↑ | | :— | :— | :— | :— | :— | :— | :— | | LTX-2.3 (base)† | 22B | Full 3D | 121 | 81.95 | 83.85 | 74.35 | | Cosmos-3 Nano† | 16B | Full 3D | 93 | 83.13 | 84.29 | 78.50 | | Lance† | 7.1B | MoT | 81 | 83.18 | 84.09 | 79.55 | | Wan 2.1 | 1.3B | Full 3D | 81 | 83.31 | 85.23 | 75.65 | | HunyuanVideo⋆ | 13B | Full 3D | 129 | 83.43 | 85.07 | 76.88 | | Wan 2.1 | 14B | Full 3D | 81 | 83.69 | 85.59 | 76.11 | | SANA-Video | 2B | Linear | 81 | 84.17 | 84.85 | 81.46 | | Wan 2.2⋆ | A14B | MoE | 81 | 84.23 | 85.42 | 79.50 | | Bernini-R‡ | 14B | MoE | 81 | 84.64 | 85.18 | 82.49 | | SANA-Video 2.0 | 5B | Hybrid | 81 | 84.30 | 85.61 | 79.05 |

第一项是 Diffusion-DPO 损失:$w$ 是从裁判分数差距中得出的成对权重,$\beta$ 控制偏好强度。第二项是优选样本的流匹配正则化器,用于稳定后训练。仅更新策略模型;参考模型在整个过程中保持固定。

4.4.2. 在线强化学习

我们进一步通过奖励反馈学习 (ReFL) [42] 利用在线奖励优化来对齐模型。对于每个文本提示,ReFL 首先将去噪轨迹无梯度地 rollout 到随机采样的更新步。在该状态下,我们的扩散模型预测干净潜在变量 $\hat{x}_0$,并将其解码为视频。我们选取解码视频的第一帧、中间帧和最后一帧,并使用冻结的图像奖励模型对其进行评估,利用产生的帧级反馈来优化视频。来自奖励的梯度通过解码器和模型评估进行传播,避免了对完整采样轨迹的反向传播。

我们的联合奖励结合了 HPSv3++ [24]、DeQA-Score [45] 和 UniPercept [4]。这三个模型提供了互补的监督。HPSv3++ 针对能力-迭代谱系上的广泛人类偏好对齐,特别强调文本保真度和美学质量。DeQA-Score 提供无参考的感知质量信号:它通过预测的分数分布对连续的人类质量判断进行建模,使其对保真度损失和可见的图像退化敏感。UniPercept 提供了更细粒度的感知概况,涵盖图像美学评估 (IAA)、图像质量评估 (IQA) 和图像结构与纹理评估 (ISTA)。经过归一化和截断后,我们将三个奖励信号以 HPSv3++:DeQA-Score:UniPercept 权重比 4:4:1 进行组合。此外,我们还应用了针对冻结基础模型的速度空间均方误差正则化器,以在偏好优化与保留预训练和监督微调期间获得的生成先验之间取得平衡。第 5.6 节评估了这一在线阶段。

5. 实验

5.1. 实现细节

SANA-Video 2.0 具有 5B 和 14B 两种配置的相同混合骨干网络。表 6 列出了这两种架构及其特定规模的训练设置。5B 配置使用 32 层,宽度为 2,560;14B 配置使用 40 层,宽度为 4,096(142.5 亿参数),并在 384×B200 规模下训练。两者均使用 LTX-VAE 2.3 潜在变量、Gemma 文本特征、流匹配、25% Softmax 锚点和 Block AttnRes。为了选择架构并诊断机制而非估计最终质量,我们使用了短小、低分辨率的研究:注意力比例和早期 AttnRes 扫描使用深度为 28、宽度为 3,072 的架构搜索骨干网络,分辨率为 256p;而查询/时间步消融实验和机制探针则使用 5B 架构系列的检查点(均在 8×H100 GPU 上运行)。

第 8 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

每桶损失 标量均值 0% (线性) 14% 25% ( ours ) 0% (线性) 14% 25% ( ours ) 100% (Softmax) 50% 100% (Softmax) 50% 1.0 均值) 2.00 MSE 0.8 1.75 1.1 MSE 范围 标量均值 0.486 1.50 1.0 0.6 (500步 2.9× 1.25 0.9 验证 0.4 损失 速度 1.00 0.8 最大间隙 0.0–0.1 0.1–0.2 0.2–0.3 0.3–0.4 0.4–0.5 0.5–0.6 0.6–0.7 0.7–0.8 0.8–0.9 0.9–1.0 训练 0.75 2000 4000 6000 8000 10000 0.0 0.2 0.4 0.6 0.8 1.0 时间步 / 噪声桶 训练步数 扩散时间步 t

(a) 损失随 𝑡 变化。 (b) 训练损失与步数。 (c) 验证损失与 𝑡。

图 4 | 按时间步读取损失,然后读取 Softmax 比率代理。(a) 在生产检查点上,验证损失在噪声轴上跨越了约 3× 的范围,因此标量随机 𝑡 均值(虚线)掩盖了结构。因此,我们按每个时间步读取每个代理比较,而不是作为一个标量。(b,c) 固定深度 28、宽度 3,072 的架构搜索骨干网络 (256p/81f):(b) 500 步平均训练损失和 (c) 在 10K (200 个视频;逐点 95% CI) 时的保留归一化潜在速度 MSE,针对五种比率。

5.2. 主要结果

表 2 将 SANA-Video 2.0 与 VBench [12] 上的最先进视频生成器进行了比较,而图 1(b) 比较了完整的单 H100 生成流水线延迟,包括在相同的 40 步配方下的我们的 5B 和 40 层 14B 配置。在 480×832×81 的操作点,SANA-Video 2.0 达到了 VBench Total 84.30,并在表 2 中拥有最佳质量 (85.61)。只有作者报告的 Bernini-R 14B [3] 在 Total 和 Semantic 上得分更高 (84.64/82.49 vs. 84.30/79.05),但在匹配的形状、步数和设备下,我们的 5B 模型运行成本低 31.8 倍 (单张 H100 上为 13.2 秒 vs. 421 秒)。其更长的 121 帧和 193 帧配置分别达到 Total 85.29 和 84.48 (附录表 8),在 720p 级形状下,其速度比 Cosmos-3 Nano 和 LTX-2.3 快 3–4 倍,比 Bernini-R 和 Wan 2.2-A14B 快约 50 倍。40 层、宽度 4,096 的 14B 配置在 480×832×81 下耗时 29.1 秒,比匹配的 Bernini-R 快 14.5 倍。完整的每形状计时和完整的 16 维分解见附录 D;受控的 14B 骨干网络扩展单独报告在附录 G.2 中。

5.3. 设计空间探索

我们首先使用深度 28、宽度 3,072 的架构搜索代理,在 256p/81 帧下从头开始训练,以探索序列注意力比率。该扫描固定了骨干网络维度、补丁大小、注意力头维度、数据、优化器设置、种子和训练配方,同时改变 Softmax 层的位置;我们报告了在 10K 步下对 200 个保留视频进行文本条件处理的训练曲线和验证损失。由于验证损失在噪声轴上表现出强烈的非均匀性(图 4a),我们按每个时间步读取每个代理比较,而不是作为一个单一标量。随后的 AttnRes 探针遵循表 3 中的每面板协议;比较仅在每个匹配的面板内进行。

5.3.1. Softmax 比率

我们训练了五种变体,涵盖 0% (全线性) 到 100% (全 Softmax),中间包含三种混合比率(图 4)。最低比率的混合体在 28 层代理中使用四个周期性 Softmax 锚点 (4/28=14.3%)。

发现:在此固定骨干网络维度的代理搜索中,混合比率的表现优于全线性和全 Softmax 端点。纯线性注意力是最弱的端点 (全线性验证损失 0.955),这与缺乏周期性 Softmax 校正一致。全 Softmax 也比混合体表现差 (0.945),两个端点接近,线性端点略差。在混合体中,50% 实现了最低损失 (0.897),但效率成本高昂 (在 1080p/121f 下,比 25% 混合体延迟高 1.29 倍;图 5(a)),而 25% (0.905) 和四锚点 (14.3%) 混合体 (0.914) 仅落后约 1%。图 4 和图 5(a) 共同表明,25% Softmax 是一个实用的帕累托膝点,而非最小损失点。逐时间步分析显示,混合体与端点的差异主要集中在中等噪声处 (𝑡≈0.2–0.5)。

锁定:25% Softmax (3:1 比率) 用于所有后续实验。这是测得的代理帕累托膝点,与 AttnRes 块边界 (𝑆=8) 一致,并与 Qwen3-Next 布局 [30] 匹配;Kimi-Linear [14] 独立使用了相同的比例,但采用了不同的算子。

从头训练稳定性。图 4b 中的所有曲线均从头开始训练;混合变体平滑收敛,无损失尖峰或崩溃,并继续进入生产训练课程。因此,3:1 比率是直接学习得到的,而不是通过事后线性化获得的。

第 9 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

5.3.2. 残差注意力

在固定 3:1 混合比例的情况下,我们研究 AttnRes 并选择其路由器设计(表 3)。

跨训练的路由器(表 3a,b)。在训练初期,短周期探针选择了路由器公式:移除其显式的时间步输入使损失从 0.962 降低至 0.920。在混合主干网络成熟后,持续训练的比较发现 AttnRes 及其移除版本达到了可比的保留均方误差(MSE)(0.4851 对比 0.4855,其中 20 个噪声桶中有 17 个略微偏向 AttnRes)。鉴于这一微小差距,我们认为不存在质量优势;我们采用 AttnRes 是因为它提供了跨深度的复用能力,并使用与时间步无关的路由器,通过图 6 中的秩和路由探针验证了其预期行为。

查询设计(表 3c)。逐层投影和共享投影的损失几乎相同(0.496 对比 0.495),但共享将内存开销减少了 4 倍(+4% 对比 +16%)。尽管跨深度共享查询,所选路由器仍保持特征依赖性:在五个去噪时间步中,其平均归一化路由熵变化是逐层设计的 2.15 倍(图 6a;协议见附录 F.3)。

块大小(表 3d)。$S \in \{4, 8, 16\}$ 产生的损失点估计相似(0.962–0.965),因此短扫描未能确定首选跨度。内存随块数量缩放:$S=4$ 使用 +2.9%,而 $S=16$ 仅使用 +1.6%。我们将 $S=8$ 保留为工程默认值,因为它在每个聚合块中提供两个规则的 3:1 注意力周期,比 $S=16$ 保留了更多的中间深度源,并将开销保持在接近 $S=16$ 的水平。

所选的共享路由器在没有显式时间步输入的情况下保持自适应:其路由熵通过时间步条件源特征在去噪阶段发生变化。直接扰动和权重空间分析提供了互补的解释。用其均值替换学习到的路由器偏移量,或在错误的时间步评估它,验证损失最多变化 0.0002,而偏移量的平均跨时间步余弦相似度为 0.979,且随时间变化的残差仅为其常数分量的 13%(附录 F.4)。

表 3 | AttnRes 训练和设计探针。(a) 后期阶段持续训练;(b–d) 早期短周期探针。Wins 计数表示改善的噪声桶数量;绿色阴影标记所选设计。

(a) 路由器效应 (b) 显式 $t$ 输入 (c) 查询共享 (d) 块跨度 ($S$)

设计 MSE↓ Wins 设置 损失↓ 设计 损失↓ 内存 $S$ 损失↓ 延迟 内存 4 0.965 +3.9% +2.9% 无 AttnRes 0.48547 7 — 带 $t$ 0.962 逐层 0.496 +16% 8 0.962 +3.1% +2.1% + AttnRes 0.48506 17/20 不带 $t$ 0.920 共享 0.495 +4% 16 0.962 +3.1% +1.6%

5.4. 效率扩展

分辨率和路由器扩展。代理研究选择了一个共享的、与时间步无关的路由器,且 $S=8$。我们在一个编译的、无 AttnRes 的协议下比较了 25%-softmax 主干网络与完整 softmax,其中每个变体都使用其最佳内核(融合线性注意力、所有 softmax 层的 FlashAttention)。这是本文所有 DiT 前向比较的标准协议。

序列和模型大小扩展。图 5(a) 比较了六种 480p–1080p 形状和三种注意力比例。在编译的最佳内核无 AttnRes 协议下,完整/25%-混合加速比从 1.16× 上升至 2.01×。在固定的 720p 和 24fps 下,它在 60s 张量形状(1,441 帧,图 5(b))下达到 3.17×。在相同协议下,面板 (c) 固定 720p/10s 形状,并将宽度和深度从 12 亿联合增长至 289 亿。混合模型在所有八个尺度下都更快,其绝对节省从 128 毫秒增长到 948 毫秒。受控分解显示这两个轴的作用不同:在固定宽度下,将深度从 16 层增长到 60 层使加速比几乎保持不变(1.41×),因为深度以相同方式倍增两种变体;而在固定深度下,将宽度增长使加速比从 1.45× 降至 1.33×,因为宽度绑定的 FFN 和投影成本超过了注意力(附录 G.1)。因此,混合优势由计算中有多少是序列绑定的决定,而这正是长视频所处的领域。

模型和硬件扩展。匹配的 H100/GB200 分析显示,14B 主干网络跨硬件代际扩展。在 736×1280×121 下,一次混合前向传播在 H100 上从 789.7 毫秒减少到 GB200 上的 398.3 毫秒(1.98×)。在通过 125.1K 潜在标记的完整形状扫描中,GB200 提供了 1.69–2.02× 的增益(附录 G.2)。架构优势在两种设备上均持续存在:将 10 锚点混合替换为完整 softmax,使 720p 持续时间的完整/混合加速比在 H100 上从 1.40× 增加到 2.73×,在 GB200 上从 1.58× 增加到 3.07×(附录 G.3)。

第 10 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

1080p/121帧 25% ( ours) 50% 完整 Softmax 1000 +948 ms 103 720p/121帧 104 (ms) (ms) (ms) 800 2.01£ 3.17£ 600 480p/121帧 saved 1.55£ 103 400 +279 ms 延迟 102 延迟 200 +128 ms 延迟 1.16£ 1.55£ 0 5K 10K 20K 30K 5s 15s 30s 45s 60s 1 3 10 30 序列长度 (tokens) 时长 (s) DiT 参数量 (B)

(a) 编译后的分辨率缩放。 (b) 编译后的 720p/24fps 缩放。 (c) 编译后的 720p/161帧 模型大小缩放。

图 5 | 混合注意力 DiT 前向传播缩放 (H100, bf16, batch 1; 无 AttnRes)。(a) 编译后的分辨率缩放。 (b) 编译后的 720p/24fps 时长缩放;其 121帧 点与 (a) 共享。(c) 在 720p/161帧 (19.3K tokens) 下,不同模型大小的完整 Softmax 减去 25%-混合延迟,使用两种运行顺序的相同编译后端。仅 (a,b) 包含 50% Softmax;所有均为前向延迟配置。

5.5. 机制分析

状态秩恢复。比率扫描表明,周期性 Softmax 锚点改善了代理质量-效率权衡。接下来,我们测试 AttnRes 是否实现了互补目标,即在深度间携带更丰富的表示。使用有效秩(线性状态奇异谱的指数熵),我们在匹配的提示和噪声种子下,对同一生产检查点开启和关闭深度聚合。在最大噪声下,启用 AttnRes 使更深层的平均有效秩增加了 11.7%,在 24 个线性层中有 22 个层的秩未减少(图 6b)。静态路由器增加了可忽略不计的参数成本(远低于模型参数的 0.001%)。

跨深度复用。在同一架构族检查点上,路由器并未坍缩到输入或当前部分和中:已完成块的权重随深度增加,并在最深块中达到注意力/FFN 的 56%/50%(图 6c)。这种复用是结构化的而非弥散的。在已完成块内,路由器倾向于最近完成的那个块,将注意力/FFN 权重的 26.0%/25.3% 分配给最近的已完成块,而分配给前两个块的权重分别为 15.5%/13.2% 和 14.5%/11.1%,这种近期梯度在深度间保持一致。在块入口移除已完成源会将有效秩降低 82–91%,而在块中间层进行相同的移除几乎不会改变有效秩(附录 F.6),这表明复用的信息局限于部分和刚刚重置的块边界。结合上述秩恢复,这证明了在表示层面存在跨深度复用,而不仅仅是在路由权重中。

逐层 共享 AttnRes 关闭 AttnRes 开启 注意力。 FFN (pp) 整体 2.15× 秩 15 层 ≥ 15: +12% 56% 50% 权重 0.50var. 4 10 37% 31% 2 5 0.25 27% 22% 有效 0 路由 熵 0 0.00 2 9 17 25 32 1–23–56–79–1011–1314–1517–1819–2122–2325–2627–2930–31 9–16 17–24 25–32 Transformer 层 线性注意力层对 层组

(a) 共享查询的适应性。 (b) 同检查点秩恢复。 (c) 跨块复用。

图 6 | 所选 AttnRes 设计的证据。(a) 共享查询在时间步长间保持特征适应性。 (b) 启用深度聚合可恢复更深层线性层的有效秩。(c) 学习到的路由越来越多地复用已完成块。

5.6. 在线强化学习后训练结果

我们通过跟踪训练过程中的三个冻结奖励信号,评估了第 4.4.2 节中描述的在线 ReFL 阶段。在报告的 400 次迭代运行中,平滑后的 HPSv3++、DeQA-Score 和 UniPercept 轨迹均同步上升(图 7),表明该运行改善了联合目标的所有三个记录组件,而不是以牺牲一个为代价换取另一个。附录 E.2 通过四个示例中 SFT 和 RL 检查点之间的匹配提示、匹配 CFG 比较,补充了这些曲线,为视觉质量和时间行为的变化提供了定性背景。

10

第 11 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

HPSv3++ DeQA UniPercept 16 70 14 4.4 reward reward 65 12 reward 4.2 10 DeQA 60 8 55 HPSv3++ 4.0 UniPercept 0 100 200 300 400 0 100 200 300 400 0 100 200 300 400 Training iteration Training iteration Training iteration

(a) HPSv3++ 偏好奖励。 (b) DeQA 感知质量。 (c) UniPercept 平均分。

图 7 | 所有三种奖励信号在在线强化学习训练期间稳步提升。在 400 次 ReFL 迭代过程中,HPSv3++、DeQA-Score 和 UniPercept 均表现出一致的上升趋势;淡色曲线显示每次迭代的得分,绿色曲线显示其平滑轨迹。

6. 部署与应用

基于 Sol-Engine 的内核友好型部署。主干网络保持接近标准注意力与前馈神经网络(FFN)原语:固定的 Softmax 锚点以及无卷积的 SwiGLU FFN,没有卷积适配器路径。移除 SANA-Video 的时间卷积 FFN 避免了在更大规模下测得的 20–29% 的开销(附录 G.4),并将注意力比率作为主要的序列缩放变量;因此,第 5.4 节中的 DiT 前向比较使用了同等优化的编译实现(Softmax 使用 FlashAttention,线性注意力使用融合线性注意力)。由于主干网络映射到这些标准且高度优化的内核,它可以直接与生产部署堆栈组合。我们在 NVIDIA B200 上通过三阶段 Sol-Engine 堆栈 [21] 对 SANA-Video 2.0 进行优化,分辨率为 736×1280×193(720p,8秒):首先进行内核和执行优化,将端到端延迟从 62.65 秒降低至 30.74 秒;随后通过残差复用评估 50 个去噪步骤中的 33 个,达到 20.89 秒;最后对主导长序列模块时间的 Softmax 锚点应用稀疏注意力(附录图 17),达到 17.52 秒,直接测得 3.58 倍的加速比(表 4)。这些是正交的部署改进,而非模型贡献:融合保留了计算量,而缓存和稀疏注意力引入了近似。图 8 展示了基线与完整加速管道在相同提示词下的匹配定性输出。

基线

Sol-Engine 3.58 倍加速

基线

Sol-Engine 3.58 倍加速

图 8 | Sol-Engine 加速前后的定性输出。两个匹配的提示词比较了基线与直接测得 3.58 倍加速的管道;每一行采样了片段中的匹配进度。

11

第 12 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 4 | Sol-Engine 在单张 B200 和单张 H100 上,720p 分辨率和 8 秒时长下的全栈加速效果。延迟包括去噪和 VAE 解码。加速比是相对于各 GPU 自身基线的。

| 阶段 | NFEs | B200 延迟 (s) | B200 加速比 | H100 延迟 (s) | H100 加速比 | | :— | :— | :— | :— | :— | :— | | 基线 | 50 | 62.65 | 1.00× | 95.08 | 1.00× | | + 内核优化 | 50 | 30.74 | 2.04× | 59.32 | 1.60× | | + 扩散缓存 | 33 | 20.89 | 3.00× | 40.07 | 2.37× | | + 稀疏注意力 | 33 | 17.52 | 3.58× | 33.43 | 2.84× |

使用 QAT 的低精度推理。我们使用 MXFP4 权重和 MXFP8 激活值对 SANA-Video 2.0 5B 主干网络进行量化(表 5)。QAT 在 VBench Total 上与 BF16 基线持平,而 PTQ 略低。在 NVIDIA GB200 上,针对 832×480 分辨率的 81 帧视频,一次 CFG-packed 主干前向传播的延迟从 203.08ms 降低至 191.30ms(5.8%);静态模型存储从 8.94GB 降低至 2.87GB(67.9%),峰值分配内存从 10.74GB 降低至 4.63GB(56.9%)。延迟增益较为有限,因为所选 GEMM 仅占 BF16 运行时间的 16.2%:W4A8 将其从 33.15ms 减少至 22.16ms,因此总共仅节省约 11ms。我们目前仅对线性 GEMM 进行量化;线性注意力和 softmax 注意力算子仍保持在 BF16。

表 5 | QAT 质量与低精度效率。在 NVIDIA GB200 上,针对 832×480 分辨率的 81 帧 CFG-packed 主干前向传播的 VBench 得分(%)和中位数系统测量值。QAT 与 BF16 基线持平,而 PTQ 略低;PTQ 和 QAT 共享低精度推理配置。内存使用十进制 GB。

| 方法 | 精度 | VBench 质量 | VBench 语义 | VBench Total | Δ | GB200 系统延迟 (ms) | GB200 静态 (GB) | GB200 峰值 (GB) | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | BF16 (基线) | BF16 | 83.98 | 80.14 | 83.22 | — | 203.08 | 8.94 | 10.74 | | PTQ | MXFP4-W/MXFP8-A | 83.53 | 80.23 | 82.87 | −0.35 | 191.30 | 2.87 | 4.63 | | QAT | MXFP4-W/MXFP8-A | 83.95 | 80.43 | 83.25 | +0.03 | | | |

物理 AI。SANA-Video 2.0 在物理 AI 场景中具有巨大潜力,特别是在对效率敏感的机器人和自动驾驶任务中。我们在约 5,000 小时的公开真实机器人和第一人称视频上对 SANA-Video 2.0 进行微调,迭代 100k 次,学习率为 1 × 10−4。如图 9 所示,SANA-Video 2.0 生成了逼真且符合物理规律的机器人操作视频。在所示对比中,它优于大小相似的 Cosmos3-Edge [1](4B),并与更大的模型(包括 Cosmos3-Nano [1](16B)和 Lingbot-Video [27](30B))相比提供了具有竞争力的结果。

7. 相关工作

大多数开源视频生成器使用具有二次方 softmax 令牌混合的扩散 Transformer,包括 Wan 2.1/2.2、HunyuanVideo、CogVideoX 和 Open-Sora [17, 38, 44, 50];MAGI-1 和 LTX-Video 则通过时间分块或更强的潜在压缩来降低有效序列成本 [11, 31]。高效的令牌混合器通过线性注意力 [2, 13, 43] 或状态空间模型 [10, 19, 25, 35] 用固定大小的状态替换 𝑁×𝑁 映射,尽管压缩状态可能会限制表示秩 [7]。在视觉生成领域,DiG 将门控线性注意力应用于图像 DiT,SANA-Video 开发了纯线性视频 DiT,而 SANA-WM/SANA-Streaming 将高效主干扩展到世界建模和流式编辑 [6, 49, 51, 52]。混合语言模型保留了周期性 softmax 层:Qwen3-Next 和 Kimi-Linear 使用 3:1 布局,Kimi K3 添加了跨层 Block Attention Residuals (AttnRes),而输出门控提供了一种兼容的 softmax 稳定机制 [14, 15, 16, 29, 30];Attention Surgery 研究了预训练视频 DiT 的事后线性化 [9]。Sparse-VideoGen、Radial Attention、SpargeAttn、PISA 和 Native Sparse Attention 则通过降低每个剩余 softmax 算子内的成本来减少开销 [18, 20, 40, 46, 48]。SANA-Video 2.0 将带有 AttnRes 的混合注意力引入双向视频扩散,从头开始训练它,为视频重新选择 softmax 比例,并适应基于时间步条件的特征。附录 A 按研究方向提供了完整的讨论。

第 13 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

Cosmos3-Edge (4B)

Cosmos3-Nano (16B)

Lingbot Video (30BA3B)

Ours (5B)

用右臂将提起来的药盒盖放到药盒上。

图 9 | 与物理 AI 模型的定性比较。在所示的比较中,SANA-Video 2.0 优于大小相似的 Cosmos3-Edge [1] (4B),并与 Cosmos3-Nano [1] (16B) 和 Lingbot-Video [27] (30B) 等更大规模的模型相比提供了具有竞争力的结果。

8. 结论

我们介绍了 SANA-Video 2.0,这是一种基于主要线性混合注意力主干的视频扩散 Transformer,并在 5B 和 14B 规模上实现。它并非在每一层使用二次方 Softmax,而是将 75% 的门控线性注意力与 25% 的周期性 Softmax 锚点相结合,同时通过深度共享的块注意力残差(Block AttnRes)将锚点刷新后的表示传播到后续的线性层。针对视频的代理研究确定 25% 的 Softmax 是一个实用的质量-效率拐点;较大的生产模型使用 40 层,宽度为 4,096,并在 384×B200 规模下进行训练。使用 40 步采样,5B 检查点在单个 H100 上以 480×832×81 分辨率在 13.2 秒内达到 VBench Total 84.30,并且在匹配的最佳内核编译下,其 DiT 前向传播在 720p/60s 张量形状下比完整 Softmax 快 3.2 倍。这种对硬件友好的主干可以清晰地映射到融合内核,并直接与 Sol-Engine 的执行、残差重用和稀疏锚点优化相结合,在 50 步 B200 部署中产生了单独测量的 3.58 倍端到端加速。同检查点分析显示,AttnRes 将深层有效秩提高了约 12%,并在深度范围内重用了已完成块的表示。尽管架构选择依赖于短期代理研究,且最长持续时间的结果是张量形状配置文件,但这些结果表明,主要线性的混合架构可以在以更高效率扩展到长、高分辨率视频的同时,保持具有竞争力的生成质量。

未来工作。两个方向直接源于此设计。由于主干是 $O(N)$ 主导的,其效率优势会随着持续时间而扩大(第 5.4 节),因此将课程扩展到当前 8 秒的时间范围之外,向分钟级训练迈进,将使配置文件的长序列扩展转化为真正的长视频生成,并考验锚点在更长上下文中保持全局一致性的能力。其次,我们的算子是双向的,而机器人、自动驾驶和世界模型需要流式、动作条件驱动的 rollout:正如第 2 节所述,去掉 delta 规则更新使其成为因果门控 DeltaNet 的自然初始化,因此将 Kimi-Linear [14] / Kimi K3 [15] 系列中的因果 delta 规则线性算子与相同的混合加 AttnRes 布局配对,可以将这种从头训练、对内核友好的配方带入因果生成和闭环世界模型,补充第 6 节中的物理 AI 研究。进一步的扩展包括特定锚点的稀疏内核、校准的低精度(NVFP4)格式、用于补充无训练部署缓存的少步蒸馏,以及学习的、内容自适应的锚点放置和 AttnRes 路由。

致谢。我们要向邓宇凡(北京大学)表达诚挚的感谢,感谢他在高效训练方面提供的宝贵讨论。他们的建设性反馈和合作对本工作的形成起到了至关重要的作用。

第 14 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

参考文献

[1] Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, 等。Cosmos 3:面向物理人工智能的全模态世界模型。arXiv 预印本 arXiv:2606.02800,2026。

[2] Simran Arora, Sabri Eyuboglu, Michael Zhang, Aman Timalsina, Silas Alberti, Dylan Zinsley, James Zou, Atri Rudra, 和 Christopher Ré。简单的线性注意力语言模型在召回率与吞吐量权衡之间取得平衡。 在 ICML,2024。

[3] Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, 和 Zehuan Yuan。Bernini:视频扩散的潜在语义规划。arXiv 预印本 arXiv:2605.22344,2026。

[4] Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, 和 Yihao Liu。UniPercept:迈向跨美学、质量、结构和纹理的统一感知级 图像理解。在 ICML,2026。

[5] Hila Chefer, Patrick Esser, Dominik Lorenz, Dustin Podell, Vikash Raja, Vinh Tong, Antonio Torralba, 和 Robin Rombach。用于可扩展多模态合成的自监督流匹配。arXiv 预印本 arXiv:2603.06507, 2026。

[6] Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, 和 Enze Xie。SANA-Video:基于块线性扩散 Transformer 的高效视频生成。arXiv 预印本 arXiv:2509.24695,2025。

[7] Qihang Fan, Huaibo Huang, 和 Ran He。打破线性注意力的低秩困境。在 CVPR,2025。

[8] Gemma Team。Gemma 2:在实用规模下改进开源语言模型。arXiv 预印本 arXiv:2408.00118, 2024。

[9] Mohsen Ghafoorian, Denis Korzhenkov, 和 Amirhossein Habibian。注意力手术:线性化视频扩散 Transformer 的高效配方。arXiv 预印本 arXiv:2509.24899,2025。

[10] Albert Gu 和 Tri Dao。Mamba:具有选择性状态空间的线性时间序列建模。在 语言建模会议 (COLM),2024。

[11] Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, 等。LTX-Video:实时视频潜在扩散。arXiv 预印本 arXiv:2501.00103,2025。

[12] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, Yaohui Wang, Xinyuan Chen, Limin Wang, Dahua Lin, Yu Qiao, 和 Ziwei Liu。VBench:视频生成模型的综合基准测试套件。在 CVPR,2024。

[13] Angelos Katharopoulos, Apoorv Vyas, Nikolaos Pappas, 和 François Fleuret。Transformer 是 RNN:具有线性注意力的快速自回归 Transformer。在 ICML,2020。

[14] Kimi Team。Kimi Linear:一种表达力强且高效的注意力架构。arXiv 预印本 arXiv:2510.26692,2025。

[15] Kimi Team。Kimi K3:开放前沿智能。Moonshot AI 技术博客,https://www.kimi.com/blog/ kimi-k3,2026。

[16] Kimi Team。注意力残差。arXiv 预印本 arXiv:2603.15031,2026。

[17] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, 等。HunyuanVideo:大型视频生成系统的系统性框架。arXiv 预印本 arXiv:2412.03603,2024。

[18] Haopeng Li, Shitong Shao, Wenliang Zhong, Zikai Zhou, Lichen Bai, Hui Xiong, 和 Zeke Xie。PISA:分段稀疏注意力对于高效扩散 Transformer 更为明智。arXiv 预印本 arXiv:2602.01077,2026。

[19] Kunchang Li, Xinhao Li, Yi Wang, Yinan He, Yali Wang, Limin Wang, 和 Yu Qiao。VideoMamba:用于高效视频理解的状态空间模型。在 ECCV,2024。

14

第 15 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

[20] Xingyang Li 等人。Radial Attention:用于长视频生成的具有能量衰减的 $O(n \log n)$ 稀疏注意力。 arXiv 预印本 arXiv:2506.19852,2025。

[21] Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, 和 Enze Xie。 Sol 视频推理引擎:面向高效视频生成的代理原生全栈加速框架。 arXiv 预印本 arXiv:2606.23743,2026。

[22] Zhi Li, Anne Aaron, Ioannis Katsavounidis, Anush Moorthy, 和 Megha Manohara。迈向实用的感知视频质量指标。 Netflix 技术博客,https://netflixtechblog.com/ toward-a-practical-perceptual-video-quality-metric-653f208b9652,2016。

[23] Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。用于生成建模的流匹配。在 ICLR,2023。

[24] Yijun Liu, Jie Huang, Zeyue Xue, Yuming Li, Ruizhe He, Haoran Li, Shijia Ge, 和 Siming Fu。HPSv3++:在扩散模型能力的整个光谱上扩展奖励模型。arXiv 预印本 arXiv:2606.14657, 2026。

[25] Yue Liu, Yunjie Tian, Yuzhong Zhao, Hongtian Yu, Lingxi Xie, Yaowei Wang, Qixiang Ye, Jianbin Jiao, 和 Yunfan Liu。VMamba:视觉状态空间模型。在 NeurIPS,2024。

[26] Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, 和 Shao-Lun Huang。超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境。在 CVPR,2026。

[27] Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, 等。扩展专家混合视频预训练以赋能具身智能。arXiv 预印本 arXiv:2607.07675,2026。

[28] William Peebles 和 Saining Xie。可扩展的 Transformer 扩散模型。在 ICCV,2023。

[29] Zihan Qiu, Zekun Wang, Bo Zheng, Zeyu Huang, Kaiyue Wen, Songlin Yang, Rui Men, Le Yu, Fei Huang, Suozhi Huang, Dayiheng Liu, 和 Junyang Lin。大语言模型的门控注意力:非线性、稀疏性和无注意力汇聚。arXiv 预印本 arXiv:2505.06708,2025。

[30] Qwen Team。Qwen3-Next:迈向终极训练与推理效率。Qwen Team 博客,https: //qwen.ai/blog?id=qwen3-next,2025。

[31] Sand.ai, Hansi Teng, Hongyu Jia, Lei Sun, Lingzhi Li, 等。MAGI-1:大规模自回归视频生成。 arXiv 预印本 arXiv:2505.13211,2025。

[32] Team Seedance 等人。Seedance 2.0:推进面向世界复杂性的视频生成。arXiv 预印本 arXiv:2604.14148,2026。

[33] Tomáš Souˇcek 和 Jakub Lokoˇc。TransNet V2:一种用于快速镜头转换检测的有效深度网络架构。arXiv 预印本 arXiv:2008.04838,2020。

[34] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。RoFormer:增强型 Transformer 与旋转位置嵌入。Neurocomputing, 568:127063,2024。

[35] Yao Teng, Yue Wu, Han Shi, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, 和 Xihui Liu。DiM:用于高效高分辨率图像合成的扩散 Mamba。arXiv 预印本 arXiv:2405.14224,2024。

[36] Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shafiq Joty, 和 Nikhil Naik。使用直接偏好优化进行扩散模型对齐。 在 CVPR,2024。

[37] Wan Team。Wan2.2:开放且先进的大规模视频生成模型。官方代码和模型发布, https://github.com/Wan-Video/Wan2.2,2025。

[38] Wan Team, Ang Wang, Baole Ai, Bin Wen, 等。Wan:开放且先进的大规模视频生成模型。 arXiv 预印本 arXiv:2503.20314,2025。

15

第 16 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

[39] Haoning Wu, Erli Zhang, Liang Liao, Chaofeng Chen, Jingwen Hou, Annan Wang, Wenxiu Sun, Qiong Yan, and Weisi Lin. Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical Perspectives. In ICCV, 2023.

[40] Haocheng Xi et al. Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity. In ICML, 2025. arXiv:2502.01776.

[41] Haofei Xu, Jing Zhang, Jianfei Cai, Hamid Rezatofighi, Fisher Yu, Dacheng Tao, and Andreas Geiger. Unifying Flow, Stereo and Depth Estimation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(11): 13941–13958, 2023.

[42] Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, and Yuxiao Dong. ImageRe- ward: Learning and Evaluating Human Preferences for Text-to-Image Generation. In NeurIPS, 2023.

[43] Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, and Yoon Kim. Gated Linear Attention Transformers with Hardware-Efficient Training. In ICML, 2024.

[44] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, et al. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. In ICLR, 2025.

[45] Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, and Chao Dong. Teaching Large Language Models to Regress Accurate Image Quality Scores Using Score Distribution. In CVPR, 2025.

[46] Jingyang Yuan et al. Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention. arXiv preprint arXiv:2502.11089, 2025.

[47] Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, and Lucas Beyer. Sigmoid Loss for Language Image Pre-Training. In ICCV, 2023.

[48] Jintao Zhang et al. SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference. In ICML, 2025. arXiv:2502.18137.

[49] Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, and Song Han. SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer. arXiv preprint arXiv:2605.30409, 2026.

[50] Zangwei Zheng, Xiangyu Peng, Chenhui Shen, et al. Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k. arXiv preprint arXiv:2503.09642, 2025.

[51] Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, and Enze Xie. SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer. arXiv preprint arXiv:2605.15178, 2026.

[52] Lianghui Zhu, Zilong Huang, Bencheng Liao, Jun Hao Liew, Hanshu Yan, Jiashi Feng, and Xinggang Wang. DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention. In CVPR, 2025

16

第 17 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

A. 相关工作

A.1. 视频扩散与高效序列建模

现代开源视频生成器主要基于具有完整均匀 Softmax 注意力的扩散 Transformer。Wan 2.1/2.2、HunyuanVideo、CogVideoX 和 Open-Sora 通过更大的骨干网络和改进的训练配方扩展了这一设计,其中 Wan 2.2 采用了混合专家去噪器 [17, 37, 38, 44, 50]。它们的全局令牌混合具有强大的表达能力,但随着分辨率和持续时间的增长,其二次方成本变得日益昂贵。其他系统则通过缩短序列长度来降低开销:MAGI-1 以时间块的形式自回归地生成视频 [31],而 LTX-Video 依赖于潜在压缩 [11]。

高效序列模型直接降低了骨干网络的开销。线性注意力用固定大小的状态替换了显式的 $N \times N$ 注意力图 [2, 13, 43],而状态空间模型则使用循环或选择性状态更新 [10, 19, 25, 35]。在视觉领域,DiG 将门控线性注意力应用于图像扩散 Transformer [52];SANA-Video 开发了一种带有时间卷积前馈网络 (FFN) 的纯线性视频 DiT [6];SANA-WM 和 SANA-Streaming 将高效的 SANA 系列骨干网络扩展至世界建模和流式视频编辑 [49, 51]。由于压缩状态可能会限制表示秩和直接令牌交互 [7],我们保留全序列生成,但定期恢复精确的 Softmax 交互,而不是依赖纯线性堆栈或额外的时间卷积路径。

A.2. 混合与稀疏注意力

混合语言模型将高效的状态层与少量精确 Softmax 层相结合。Qwen3-Next 和 Kimi-Linear 使用不同的线性算子,采用常规的 3:1 线性到 Softmax 布局 [14, 30],而注意力后输出门控为 Softmax 分支提供了兼容的稳定机制 [29]。Attention Surgery 则在训练后对预训练的视频 DiT 进行线性化 [9]。我们研究从头开始训练的混合布局在整个训练过程中保持固定的双向视频扩散 Transformer,并在视频领域重新选择 Softmax 的比例,而不是假设语言模型的比例可以直接迁移。

稀疏方法为减少剩余的 Softmax 开销提供了一种互补的方式。Sparse-VideoGen 和 Radial Attention 利用了视频注意力图中的结构,SpargeAttn 和 PISA 提供了无需训练的稀疏或近似核,而 Native Sparse Attention 为长上下文语言建模学习了与硬件对齐的稀疏模式 [18, 20, 40, 46, 48]。这些方法减少了每个 Softmax 层内的工作量,而我们的混合设计减少了调用 Softmax 的层数。在我们的部署研究中,稀疏性仅应用于固定的 Softmax 锚点,保持线性主体和训练好的架构不变(第 6 节)。

A.3. 跨层残差路由

标准 Transformer 残差流仅通过相邻层传递特征。注意力残差允许层从较早的深度检索已完成的块特征,Kimi K3 将这种机制与语言模型规模下的混合注意力相结合 [15, 16]。视频扩散引入了不同的要求:特征是双向的,每个块都受去噪时间步的调制,且时空令牌集要大得多。因此,我们在已完成的块摘要和当前部分块上进行路由,在深度上共享一个查询投影,并通过普通的 DiT 特征保留时间步信息,而不是使用单独的路由器-时间步投影。本文中的路由和秩分析旨在测试 AttnRes 路径是否复用了由 Softmax 锚点刷新的表示。

B. 模型与训练细节

B.1. 模型配置

SANA-Video 2.0 拥有 5B 和 14B 配置,它们共享所选的混合设计。表 6 记录了这两种架构及其特定规模的训练超参数。

第 18 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 6 | SANA-Video 2.0 的完整 5B 和 14B 配置。两者均采用相同的混合注意力设计;14B 设置已针对保存的 Poly 训练配置和运行时日志进行了验证。

| 设置 | 5B | 14B | | :— | :— | :— | | 骨干网络架构 | | | | 深度 (Depth) | 32 | 40 | | 隐藏层维度 (Hidden dimension) | 2,560 | 4,096 | | 线性注意力 (Linear attention) | 20 头 ($d_h=128$) | 32 头 ($d_h=128$) | | Softmax 注意力 (Softmax attention) | 10 头 ($d_h=256$) | 16 头 ($d_h=256$) | | 注意力算子 (Attention operators) | 门控双向线性 / 门控 Softmax;自注意力和交叉注意力的 QK 归一化 | | | Softmax 锚点 (Softmax anchors) | 8 层;25% (3:1) | 10 层;25% (3:1) | | AttnRes | $S=8$,共享投影,无时间条件 | $S=8$,共享投影,无时间条件 | | FFN | SwiGLU,比例 4.0 | SwiGLU,比例 4.0 | | 位置编码 (Position encoding) | Wan RoPE;线性/softmax 头维度分离 | | | 补丁大小 (Patch size) | (1, 1, 1) | (1, 1, 1) | | 参数量 (Parameters) | ~4.5B (5B 类) | 14.247B (14B 类) | | 训练配置 | | | | 分辨率 / 帧数 (Resolution / frames) | 480p–720p;81/121/193 | 480p;81/121 | | VAE | LTX-VAE 2.3,128 通道,因果编码 | | | VAE 步幅 (VAE stride) | 8×32×32 (时间 × 空间 × 空间) | | | 文本编码器 (Text encoder) | Gemma-2-2B-IT,300 个 token;归一化特征,缩放 0.01 | | | 目标函数 (Objective) | 流匹配;分阶段 TQD / Self-Flow | 流匹配 + Self-Flow | | Self-Flow | 学生/教师 9/25,权重 0.8,$R_M=0.1$ | 学生/教师 14/34,权重 0.8,$R_M=0.1$ | | 噪声分布 (Noise distribution) | shift 1 然后 token 感知 3–6,$\sigma=0.95$ | 尾部截断的对数正态分布,shift 3,$\sigma=0.95$ | | 优化器 (Optimizer) | AdamW,lr $10^{-4}$ / $5\times10^{-5}$ | AdamW,lr $10^{-4}$,$\beta=(0.9, 0.999)$,wd 0 | | 调度 / 裁剪 (Schedule / clipping) | 常数 + 500 步预热;裁剪 0.1 | 常数 + 500 配置预热步数;裁剪 0.1 | | 每秩批次大小 (Per-rank batch) | 1 个视频 | 1 个视频 / 4 个图像;无累积 | | 精度 / 分片 (Precision / sharding) | bf16,FSDP | bf16,FSDP + 激活检查点 | | 权重 EMA (Weight EMA) | 启用 | 0.9999 | | 训练硬件 (Training hardware) | 64×H100 | 384×B200 (Poly) |

B.2. Self-Flow 蒸馏与双时间步 Token

Self-Flow [5] 是一种辅助训练手段,仅应用于预训练和持续训练阶段(在 SFT 中禁用)。它添加了一个从浅层学生读取特征到更深层(或在后续持续训练中为 EMA)教师的特征蒸馏损失,以及一个双时间步调度,将一小部分 token 分区($R_M=0.1$)分配给第二个时间步。所有 token 仍保留在流匹配损失中,因此它改变的是条件而非减少骨干网络的计算量;具体的层索引和权重见表 6。

B.3. 内容感知的流偏移 (Content-aware Flow-Shift)

TQD [26] 使用策展分数(curation scores)在每个预训练片段最具信息量的位置放置监督信号。基于基础流偏移 1,高于 fps 归一化的 UniMatch 阈值 30 但未达到 DOVER 质量阈值的片段,会获得 +1.1 的高噪声 logits 偏差;高于 DOVER 阈值 0.91 但未达到运动阈值的片段,会获得 -1.1 的低噪声偏差;同时满足或均不满足这两个条件的片段则获得零偏差。这两个有偏差分支的中位时间步分别约为 0.75 和 0.25,对应的有效偏移量分别约为 3 和 1/3(图 10)。从持续训练开始,TQD 被禁用,并使用具有 shift 3–6 的尾部截断 token 感知密度。Shift 3 大致与高运动分支的中位数对齐,但由于分布和其他 TQD 分支存在差异,因此这不是逐样本的连续交接。

第 19 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

5 早期预训练 持续训练/SFT (关闭 TQD) base shift 1 token-shift 3 (最小 token 数) TQD 高质量 (−1.1) token-shift 6 (最大 token 数) TQD 高运动 (+1.1 ≈log 3) 4 density 3

2 采样

1

0 0.00 0.25 0.50 0.75 1.00 归一化时间步 t (0 = 干净 → 1 = 噪声)

图 10 | 连续阶段中使用的时间步密度。预训练 TQD 对互斥的高质量和高运动分支应用相反的偏移量。持续训练和 SFT 禁用 TQD,并使用跨度为 3–6 的尾部截断 token 计数偏移;偏移 3 大致与高运动分支的中位数对齐,但不是连续的逐样本交接。

B.4. 时间步分层检查点监控

随机时间步均值可能会掩盖一个噪声 regime 中的改进被另一个噪声 regime 中的退化所掩盖的情况。因此,我们将 1,000 步噪声轴划分为十个相等的桶,并比较来自同一连续轨迹的四个检查点。每个检查点重用相同的 100 个片段、文本特征、噪声张量和时间步分配,每个整数时间步恰好覆盖一次。等桶平均值是一种监控统计量,而非训练目标。

从第一个到最后一个检查点,宏观 MSE 下降了 6.4%,但桶视图揭示了有用的细节:低噪声 MSE 改善了多达 11.4%,而最高噪声桶退化了 1.2%(图 11)。分层还将变化估计的标准差相对于 IID 时间步采样减少了 2.3 倍。VBench Total 在这些检查点期间从 82.68 上升到 83.29;鉴于只有四个观测值,这属于背景信息而非相关性声明。

配对宏观损失变化 VBench 总分 高噪声 10 (%) 5 退化 顺序) Ckpt 1 0 0 0 0 0 0 0 0 0 0 (%) (%) 0 83.383.2 5 (%) 0 −2 83.1 Ckpt 2 -4.4 -4.3 -3.7 -3.0 -2.4 -1.8 -1.4 -0.9 -0.4+0.3 83.0 总分 变化 (训练 0 变化 变化 −5 Ckpt 3 -8.5 -9.0 -7.9 -6.4 -5.0 -3.7 -2.5 -1.3 -0.2+0.9 损失 损失

82.8 VBench −10 −6 Ckpt 4 -9.9-11.4-10.5-8.9 -7.2 -5.6 -3.9 -2.2 -0.5+1.2 标量宏观 -6.4% 每桶 −4 82.9 −5 桶 宏观 82.7 −10 检查点 0.0–0.10.1–0.20.2–0.30.3–0.40.4–0.50.5–0.60.6–0.70.7–0.80.8–0.90.9–1.0 0.0–0.10.1–0.20.2–0.30.3–0.40.4–0.50.5–0.60.6–0.70.7–0.80.8–0.90.9–1.0 Ckpt检查点 1 Ckpt 2(训练Ckpt 3 顺序)Ckpt 4 时间步 / 噪声桶 时间步 / 噪声桶

(a) 首次到末次每桶变化 (b) 跨检查点的每桶变化 (c) 描述性损失和 VBench 趋势

图 11 | 时间步分层检查点监控。来自同一运行的四个匹配检查点。(a,b) 桶级损失变化暴露出巨大的低噪声改进和微小的噪声退化,标量均值将其模糊在一起。(c) 配对宏观变化及 95% 区间和描述性 VBench 趋势。

C. 数据策展与渐进式选择

我们使用统一的六阶段流水线处理语料库。其目的不仅是移除有缺陷的片段,还要构建训练课程所使用的渐进式监督:预训练侧重于覆盖率,持续训练提高质量和运动一致性底线,而 SFT 使用最可信的子集。相同的处理逻辑用于这些池,但具有阶段相关的选择阈值。

19

第 20 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 7 | 内部质量/运动漏斗使用的信号。选择阈值在预训练、持续训练和 SFT 阶段逐渐收紧。

| 信号类别 | 示例 | 作用 | | :— | :— | :— | | 视觉质量 | DOVER、模糊/曝光统计量 | 保真度和美学 | | 运动 | 光流、VMAF 运动 | 丰富性和一致性 | | 颜色 | 饱和度和亮度统计量 | 自然外观 | | 一致性/对齐 | 图像-视频、视觉-语言相似度 | 条件可靠性 | | 镜头完整性 | 切割和伪影检测器 | 时间连续性 |

解码、分割和清洗。我们首先拒绝无法解码或尺寸过小的片段,规范化元数据,并使用 TransNetV2 [33] 将长视频分割为连贯的镜头。在可能的情况下,时间稳定的裁剪会去除黑边和字幕;由叠加层主导、切割不稳定、严重模糊、曝光损坏或存在时间伪影的片段会被丢弃。

评估互补属性。剩余的片段沿单独的质量、运动、颜色和一致性轴进行评估,而不是合并为一个分数(表 7)。DOVER 衡量视觉质量,UniMatch 和基于 VMAF 的特征描述运动,SigLIP 特征衡量视觉-文本一致性 [22, 39, 41, 47]。决策在时间上聚合,并且光流按帧率进行归一化,以免仅因速度慢而移除信息量低的低运动片段。

构建课程。逐渐严格的每轴阈值形成广泛的预训练池、更干净的持续训练池和小型可信的 SFT 子集。字幕遵循相同的进展,最终以结构化方式描述主体、动作、相机运动、场景、光照、交互和时间演变。当可用时,附加量化运动描述符,以便运动对文本条件器保持显式。

分辨率、FPS 和持续时间调度。运行同时推进分辨率(480𝑝→720𝑝)、帧率和持续时间,且 720p 的比例在后期阶段增加(表 1)。帧数的选择使得每个片段落在 LTX-VAE 潜在帧的整数数量上。由于 FSDP 以每秩批次大小 1 运行,采样器将每个秩在每一步桶化到单个(宽高比、帧数)层级中,因此分辨率/持续时间混合不会导致秩不同步。图像批次以固定间隔与视频交错,以向运动偏向的语料库注入外观质量。

D. 评估与测量协议

D.1. 采样与 VBench 评估

报告的 SANA-Video 2.0 运行点使用 40 步 flow-DPM-Solver、运动桶 30、种子 0 以及 Gemma-2-2B-IT 文本特征 [8]。81 帧、16 fps 设置使用无分类器引导 6.0 和 flow-shift 6.0;121/193 帧、24 fps 设置使用引导 8.0 和 flow-shift 12.0。81 帧结果来自一个后期生产检查点,而 121/193 帧结果共享第二个后期检查点。基线保持其默认设置。

我们使用官方提示在所有 16 个维度上评估完整的 VBench [12] 文本到视频套件。质量平均分为 7,语义为 9;总分使用默认的 4:1 质量-语义权重。表 8 将维度缩写为 SC/BC(主体/背景一致性)、TF(时间闪烁)、MS(运动平滑度)、DD(动态程度)、AQ/IQ(美学/成像质量)、OC(物体类别)、MO(多物体)、HA(人类动作)、CO(颜色)、SR(空间关系)、SE(场景)、AS/TS(外观/时间风格)和 OV(整体一致性)。

分数来源。所有基线分数要么是官方结果(⋆:官方 720p 排行榜,‡:作者报告),要么是我们使用每个模型的官方管道和默认推理设置测量的(†)。未标记的分数使用通用的 480×832×81 协议。表 2 显示了包含 81 帧 SANA-Video 2.0 结果的紧凑选择,表 8 添加了完整的基线集以及我们的 121-/193 帧运行点。Wan 2.2 是 A14B 激活(总计 27B)[37]。

第 21 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 8 | 所有 16 个维度的完整 VBench 比较(%)。绿色强度对每列的前三结果进行排名(最佳结果加粗);短横线标记仅报告聚合分数的模型。附录 D 定义了分数来源标记和协议。

模型 聚合指标 质量维度 语义维度

总分↑ 质量↑ 语义↑ SC BC TF MS DD AQ IQ OC MO HA CO SR SE AS TS OV LTX-2.3 (base)† 81.95 83.85 74.35 93.10 95.77 98.92 98.71 71.39 62.13 67.51 88.89 60.26 95.80 81.31 68.59 51.38 21.11 24.31 25.91 CogVideoX 1.5 82.17 82.78 79.76 96.87 97.35 98.88 98.31 50.93 62.79 65.02 87.47 69.65 97.20 87.55 80.25 52.91 24.89 25.19 27.30 Cosmos-3 Nano† 83.13 84.29 78.50 95.05 97.26 99.08 99.06 60.28 62.71 69.37 89.29 78.03 96.60 89.20 72.72 54.56 20.98 24.49 26.78 Lance† 83.18 84.09 79.55 94.68 94.95 98.34 98.92 71.11 63.71 67.71 94.18 76.69 97.60 81.33 79.56 52.83 23.12 24.58 26.89 Wan 2.1 (1.3B) 83.31 85.23 75.65 97.56 97.93 99.55 98.52 65.19 65.46 67.01 88.81 74.83 94.00 89.20 73.04 41.96 21.81 23.13 25.50 HunyuanVideo⋆ 83.43 85.07 76.88 97.22 97.60 99.39 99.05 71.94 60.28 67.24 83.48 66.71 94.40 89.79 72.13 54.46 22.21 24.52 26.95 Wan 2.1 (14B) 83.69 85.59 76.11 97.52 98.09 99.46 98.30 65.46 66.07 69.43 86.28 69.58 95.40 88.59 75.39 45.75 22.64 23.19 25.91 SANA-Video 84.17 84.85 81.46 97.13 97.71 98.37 98.20 69.17 68.27 64.82 95.39 85.05 95.40 89.43 78.00 57.83 22.43 24.31 27.04 Wan 2.2 (A14B)⋆ 84.23 85.42 79.50 97.29 97.39 99.22 98.16 61.02 67.22 71.75 94.06 82.10 96.40 87.43 78.39 56.80 20.39 23.64 26.12 Open-Sora 2.0 84.34 85.40 80.12 97.71 98.00 99.40 98.69 71.39 64.39 65.66 94.50 77.72 95.40 85.98 76.18 52.71 22.98 25.91 27.50 Bernini-R‡ 84.64 85.18 82.49 – – – – – – – – – – – – – – – –

SANA-Video 2.0 (81f) 84.30 85.61 79.05 97.34 97.33 97.84 98.31 78.89 67.99 66.51 92.80 76.75 94.40 88.05 71.85 59.88 21.35 24.05 26.93 SANA-Video 2.0 (121f) 85.29 86.98 78.51 97.44 97.09 97.58 98.40 92.50 68.85 68.39 92.39 74.38 95.00 89.17 69.34 58.81 21.26 24.46 26.64 SANA-Video 2.0 (193f) 84.48 86.51 76.37 98.00 96.94 97.94 98.52 88.33 68.10 66.31 91.76 72.39 92.60 88.21 65.32 54.68 21.27 23.48 26.08

延迟协议。端到端延迟涵盖批量大小为 1 时的文本编码、去噪和 VAE 解码,不包括检查点加载和视频写入。除非另有说明,我们在单个 H100 上进行一次完整预热后,报告三个稳态视频的平均值。基线使用其官方管道和本机 720p 级形状;在主要比较中,Wan 2.2-A14B、Bernini-R 和两个 SANA-Video 2.0 规模均使用 40 步。

在 736×1280×81 分辨率下,5B 和 14B 配置分别需要 30.9 秒和 69.3 秒。在匹配的 480×832×81 形状下,它们分别需要 13.2 秒和 29.1 秒,而 Bernini-R 需要 421 秒。作为参考,SANA-Video-2B 官方报告在 720p 下需要 36 秒 [6]。

D.2. 延迟与剖析协议

标准架构剖析使用一个 H100 80GB,bf16,批量大小为 1,八次预热,以及 20 次 CUDA 事件计时的前向传播(中位数)。每个注意力比率都使用其最佳实现:融合线性注意力、用于 Softmax 的 FlashAttention 和 torch.compile。图 5(a,b) 在禁用 AttnRes 的情况下变化分辨率和持续时间;面板 (c) 遵循相同的编译协议,同时在固定的 19.3K 令牌形状下扩展匹配的骨干网络。这些是 DiT 前向测量,不包括文本编码和 VAE 解码。

模块组成图是一个单独的急切诊断,启用了选定的共享路由器。它将非重叠的 CUDA 事件间隔归因于 22.1K 和 111.3K 令牌处的顶级模块;它仅用于识别瓶颈,不作为第二种加速协议或关于学习路由的证据。除非表格明确定义了组成,否则不同协议的结果从不相乘。

14B 跨硬件协议。H100 和 GB200 扫描使用相同的软件、固定的合成输入和编译内核。40 层、宽度 4,096 的混合模型有 30 个融合线性层和 10 个 Flash-SDPA 锚点;全 Softmax 控制将所有 40 层通过相同的 Flash-SDPA 实现。宽度、深度、输入和所有非注意力设置保持不变,两种变体中均禁用 AttnRes 以隔离注意力骨干网络,并且每个形状在隔离进程中运行。重复测量在两个设备上的一致性在 0.8% 以内。

E. 定性结果

E.1. 其他定性样本

图 18 显示了六个额外的 720p 文本到视频片段(1280×736,193 帧,24fps 下 8 秒),涵盖人物、野生动物、城市场景和风格化内容。每一行将一段片段展开为 0/2/4/6/8 秒处的五帧,使用与上述相同的 40 步 193 帧采样配方生成;生成提示词在每一行下方重复。来自相同批次的另外四个展示提示词(雨中拉小提琴的人、变色的章鱼、无人机灯光秀和沙漠闪电风暴)被保留用于下面的跨方法比较(图 20)。

第 22 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

E.2. 在线强化学习的定性影响

图 19 补充了图 7 中的训练时奖励轨迹,展示了 SFT 和 RL 检查点之间在四个匹配提示(matched-prompt)和匹配 CFG 条件下的对比。五个均匀分布的帧揭示了每个八秒片段中的变化;这些提示级示例提供了定性背景,并非聚合评估。

E.3. 与其他方法的定性比较

图 20 将 SANA-Video 2.0 与 Wan 2.2-A14B、Bernini-R 14B、Cosmos-3 Nano 和 LTX-2.3 进行了比较,使用了四个旨在揭示时间行为的提示:持续动作、颜色变化、形状变换和重复事件。每种方法均使用其官方管道、原生 720p 级形状以及在单张 H100 上的步数(种子 42);SANA-Video 2.0 使用 40 步和 193 帧。由于持续时间不同,我们在归一化的开始、中间和结束时刻展示每个输出,而非绝对时间戳。这些是定性示例,并非聚合排名。

图 21 和图 22 将比较扩展到了图像条件生成。每种方法接收来自 VBench-I2V 的相同第一帧和标题,每行显示在 0/25/50/100% 处的归一化进度。SANA-Video 2.0 使用其图像条件检查点生成 121 帧;LTX-2.3、Wan 2.2 TI2V-5B 和 Cosmos-3 使用其官方第一帧条件路径。Bernini-R 被省略,因为其公开管道没有相应的模式。所有方法均在单张 H100 上以原生 720p 级形状和种子 42 运行。这些示例说明了运动和构图保留方面的差异,但不能替代定量的 TI2V 基准测试。

F. AttnRes 路由与表示分析

本节解释所选路由器学到了什么,以及为什么其最终形式在没有显式时间步输入的情况下跨深度共享一个查询。除非另有说明,分析均使用 5B 架构系列的检查点;下面的持续训练比较使用成熟的 4.5B 生产祖先。

F.1. 晚期持续训练探针

为了在形成有用的视频表示后测试路由器,我们从与无路由器轨迹相同的成熟 4.5B 混合祖先继续运行块级 AttnRes。在相同的 100 个保留片段和 20 个噪声级别上评估近匹配的检查点。它们的平均 MSE 实际上持平(使用 AttnRes 为 0.4851,不使用为 0.4855),尽管 20 个桶中有 17 个略微偏向 AttnRes。我们仅使用此探针来排除退化;跨深度重用的证据来自下面的路由和表示干预,而非这一狭窄的损失差异。

F.2. 路由选择性指标

对于每一层 $l$,AttnRes 计算聚合权重 $\alpha_l = \text{softmax}(q_l \cdot K)$,覆盖 $N_l$ 个深度源(初始嵌入 $b_0$、完成的块摘要 $b_1, b_2, \dots$ 以及当前部分和 $p_l$)。我们通过归一化香农熵来衡量选择性: $$ \hat{H}_l = \frac{H(\alpha_l)}{\log N_l} = \frac{-\sum_{j=1}^{N_l} \alpha_{l,j} \log \alpha_{l,j}}{\log N_l} \quad (5) $$ 对于层 $l$,注意力分支有 $N_{\text{attn}}^l = \lceil l/S \rceil + 1[(l-1) \bmod S > 0]$ 个源,而 FFN 分支有 $N_{\text{ffn}}^l = \lceil l/S \rceil + 1$ 个源。我们从归一化熵摘要中省略第一个注意力路由站点($N=1$)。归一化使得不同大小的源集具有可比性:$\hat{H}_l = 1$ 表示均匀分布,$\hat{H}_l \to 0$ 表示选择性。

F.3. 时间步适应性

为了测试 AttnRes 中依赖于时间步的深度聚合,我们在五个时间步下对十个保留批次进行评估,并使用真实的文本条件。在按时间步平均后,我们计算每个路由站点 $s$ 的变化:

$$ \text{Adaptivity}_s = \sigma_t[\hat{H}_s]. \quad (6) $$

较高的值表示去噪阶段之间的变化更大。尽管跨深度使用一个查询投影,所选的共享路由器显示出比逐层替代方案多 2.15 倍的熵变化(图 6a)。这种变化来自普通 DiT 路径中的时间步条件特征;它不需要路由器时间步偏移。

第 23 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

F.4. 时间步条件探测

为了确定显式路由器时间步投影是否学习了特定于时间步的信息,还是仅仅学习了一个常数偏置,我们将行为探针与其学习到的偏移量 $\varphi_\tau(t)$ 的直接权重空间分析相结合。

行为探针。令 $q_0$ 为基础路由查询。我们在三种条件下评估消融检查点:正常(Normal),$q = q_0 + \varphi_\tau(t)$;均值(Mean),$q = q_0 + \bar{\varphi}_\tau$,其中 $\bar{\varphi}_\tau$ 对 21 个均匀分布的时间步取平均;以及乱序(Shuffle),对于 AttnRes,$q = q_0 + \varphi_\tau(1-t)$,而 AdaLN 仍接收正确的时间步 $t$。它们各自的聚合验证损失点估计值分别为 0.4905、0.4906 和 0.4907,在此探针中最大差异为 0.0002。

权重空间探针(图 12)。在 21 个时间步上,学习到的偏移量保持近乎恒定(平均余弦相似度 0.979),且其变化分量仅为常数分量范数的 13%。结合上述可忽略的行为变化,这促使我们移除显式路由器时间步投影,同时保留在每个 DiT 块内的时间步调制。

AttnRes 时间步查询偏移量 (t) = Linear(SiLU(temb)) 坍缩为近乎恒定的偏置

cos ( (t), (t′)) (逐层查询) 偏移量幅度及直流分量主导性 1.0 1.00 1.6 1.00 min = 0.902 1.4 mean = 0.979 0.98 0.99 0.8 1.2 mean t′ 0.96 ) 0.98 1.0 0.6 w( 0.94similarity / 0.8 0.97 constant (t) 到时间步 0.4 0.6 0.92 cosine 时变部分 = 常数直流的 13% 0.96 0.4 (t) / w( ) 0.2 0.90 0.95 0.2 cos( (t), ) 对齐 0.0 0.88 0.0 0.94 0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0 时间步 t 时间步 t

图 12 | 显式路由器偏移量几乎与时间步无关。在 21 个时间步上,$\varphi_\tau(t)$ 与其均值保持强对齐,且其时变分量较小。

F.5. 深度路由模式

图 6c 和图 13 对十个验证片段的平均路由进行了汇总。已完成的摘要在层 25–32 中接收大约一半的路由权重(注意力为 56%,FFN 为 50%),详细视图倾向于最近完成的块。块入口处的差异遵循操作顺序:注意力路由发生在新部分和尚未存在时,而 FFN 路由发生在之后。由于每个摘要都包含注意力、交叉注意力和 FFN 更新,这一证据支持跨深度特征重用,而不将其归因于单个算子。

F.6. 已完成块路由消融

我们将分配给已完成块和的路由权重置零,对剩余源进行重新归一化,并测量在 $t \in \{0.3, 0.5, 0.7\}$ 时相同输入下 $h_l$ 的有效秩(图 14a)。在块入口层(9、17、25),当前部分和已重置,因此移除操作会保留输入嵌入,并将秩降低 82–91%。当部分和在块内重建后,这种影响变得很小。这将已完成块的重用定位在其最需要的边界处,而不将恢复的秩归因于块内的某个特定算子。

F.7. 同一检查点秩探针

对于门控、RoPE 旋转的线性状态 $S = \sum_{n} v_n (\beta_n k r_n)^\top$,我们定义

$\left( \sum_i p_i \log p_i \right)$ $\sigma_i(S)$ $r_{\text{eff}}(S) = \exp – \sum_i p_i \log p_i \quad , \quad p_i = \frac{\sigma_i(S)}{\sum_j \sigma_j(S)}$ (7)

23

第 24 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

输入 已完成 活跃求和 60% 56% 1.0 B1 B2 B3 B4 B1 B2 B3 B4 50%

26% B3 质量 质量 40% B3 25% 0.5 B2 20% 16% B2 路由 路由 13% B1 B1 0.0 14% 11% 1 8 16 24 32 1 8 16 24 32 0% 注意力层 FFN 层 Attn FFN

(a) 逐层路由;B1–B4 标记 8 层块。 (b) 第 25–32 层中已完成源头的细节。

图 13 | AttnRes 路由-源头组成(十片段均值)。在 (a) 中,虚线标记块重置;第一个注意力层仅包含输入源头。

在实现中,我们首先跨注意力头对相应的奇异值进行平均,然后对平均后的谱进行归一化并计算 $r_{eff}$。我们在相同的生产检查点和提示下开启和关闭深度聚合,并在两种条件下配对噪声种子 0–3。图 6b 报告了每个线性层跨种子的均值和标准差,深层摘要对层 $\ge 15$ 进行平均。除了 AttnRes 路径外,未更改任何权重或激活值,从而隔离出训练路由器的表示层效应。作为背景(图 14b),我们将此结果与一个公开的 2B 纯线性模型和一个单独训练的无 AttnRes 模型并列放置。这些模型在宽度、训练周期和检查点上存在差异,因此该比较是背景性的,而非 AttnRes 效应的估计。

100 91% 91% 17.5 浅层第三部分 深层第三部分 (%) 82% 14.7 15.3 60 10.0 40 有效 7.5 6.8

5.0 20 状态 2.9 2.5 20 表示秩 0 0.0 第 9 层 第 17 层 第 25 层 纯线性 混合 混合 新块的开始 2B 无 AttnRes +AttnRes

(a) 早期块特征移除。 (b) 步骤不匹配的秩背景。

图 14 | 路由干预与秩背景。(a) 在块入口移除已完成块源头后的表示秩下降。(b) 在不同宽度、训练周期和检查点上单独训练的模型之间的描述性比较。

G. 效率与部署分析

本节通过受控分析补充主要效率图,以解释观察到的缩放现象,并提供直接的部署测量。附录 D.2 定义了协议;除非表格明确报告了组合测量,否则不同子部分的结果不组合。

G.1. 固定序列长度下的模型大小缩放

图 5(c) 固定 720p/10s 序列,同时增加宽度和深度。混合模式节省的绝对时间从 128ms 增加到 948ms,而 Full/Hybrid 加速比从 1.88× 缩小到 1.45×。受控分解解释了这一趋势:深度对两种布局的缩放几乎相等,而宽度将更多计算转移到共享

第 25 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

FFN/投影。这些匹配的向前配置隔离了系统的扩展性。

G.2. 14B 跨硬件扩展

图 15 比较了在 H100 和 GB200 上相同的 40 层、宽度 4,096 的 14B 混合实现。在测量的分辨率和持续时间范围内,GB200 将向前延迟降低了 1.69–2.02 倍(中位数为 1.91 倍),包括 125K 令牌端点。在这组扫描中,两个设备上的峰值分配内存均从约 27 GiB 上升至 44 GiB。这表明长序列实现跨硬件代际转移,而非依赖于特定设备的操作点。

H100 GB200 (B200 GPU) 1080p/121f 2.5 10 4 (ms) 10 3 720p/121f (ms) 2.0 2.02倍 中位数 1.91倍 GB200 / 1.69倍 480p/121f 延迟 延迟 10 3 H100 14B 14B 1.5

10 2 1.0 5K 10K 20K 30K 5s 15s 30s 45s 5K 10K 30K 100K 序列长度 (令牌) 720p 持续时间 (24fps) 序列长度 (令牌)

(a) 分辨率扩展。 (b) 720p/24fps 持续时间扩展。 (c) GB200 加速比。

图 15 | 匹配的 40 层 14B 跨硬件 DiT 向前配置分析(宽度 4,096;单 GPU,bf16,批次大小 1;AttnRes 关闭)。(a) 分辨率/帧扩展。(b) 720p 持续时间扩展。(c) H100/GB200 延迟比率。两个设备使用相同的输入和编译内核,直至 125.1K 令牌。

G.3. 14B 混合与全 Softmax 扩展比较

图 16 比较了 40 层 14B 主干网络的参数匹配的混合版本和全 Softmax 版本。随着持续时间从 5 秒增加到 45 秒,Full/Hybrid 加速比在 H100 上从 1.40 倍上升至 2.73 倍,在 GB200 上从 1.58 倍上升至 3.07 倍。结果证实,主要线性优势在更大的架构规模下持续存在,并随序列长度增强。

25% softmax 混合 全 Softmax 3.5 H100 GB200 (B200 GPU) H100 3.07倍 4 3.0 GB200 (B200 GPU) (ms) 4 (ms) 10 10 加速比 2.5 延迟 延迟 2.0 2.73倍 混合 3 /14B 14B 10 1.5 全 10 3 1.0

5s 15s 30s 45s 5s 15s 30s 45s 15K 30K 60K 120K 720p 持续时间 (24fps) 720p 持续时间 (24fps) 序列长度 (令牌)

(a) H100 延迟。 (b) GB200 延迟。 (c) 混合加速比。

图 16 | 匹配的 40 层 14B 混合与全 Softmax DiT 向前配置分析(宽度 4,096;单 GPU,bf16,批次大小 1;AttnRes 关闭)。(a,b) H100 和 GB200 上 720p/24fps 持续时间网格上的延迟。(c) 全/混合延迟比率。两种布局使用相同的宽度、深度、输入、用于 Softmax 的 Flash SDPA 实现以及编译协议。

G.4. 时间卷积 FFN 消融实验

SANA-Video 在其 FFN 内部使用额外的时间卷积路径,而 SANA-Video 2.0 依赖注意力进行时空混合,并保持标准的 SwiGLU FFN。为了衡量这一选择的成本,我们保持深度和宽度固定,仅更改 FFN 路径,并在两种模型规模下扫描 720p 持续时间(表 9)。变体如下

25

第 26 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

表 9 | 720p 下的受控 FFN 延迟交换(单张 H100;毫秒)。Δ 表示时间卷积开销;† 标记被排除的 60s 配对。

| Backbone | FFN | 5s | 15s | 20s | 30s | 45s | 60s | | :— | :— | :— | :— | :— | :— | :— | :— | | $L=20, d=2240$ | SwiGLU | 52 | 126 | 161 | 242 | 367 | 510 | | | Temporal-conv | 64 | 157 | 202 | 302 | 455 | 627 | | | $\Delta$ | +12 | +31 | +42 | +60 | +88 | +117 | | | | | | | 80 | 10.0% | 13.6% | | | | | | | 60 | 22.8% | 15.7% | | | | | | | 40 | 26.0% | | | $L=32, d=2560$ | Temporal-conv | 396 | 1141 | 1573 | 2499 | 4091 | 10043† | | | | | | | | | (192f) (961f) |

图 17 | 在受控前向配置协议下,22.1K/111.3K 令牌下的急切模块组合。

| Softmax | Linear | FFN | Cross-attn | Other | | :— | :— | :— | :— | :— | | (%) | | | | | | | | | | 100 | | | | | | 18.1% | | | | | | 10.6% | | | | | | 5.8% | | | | | | share | | | | | SwiGLU | 306 906 1258 2036 3416 4994† | | | | | | 54.4% | | | | | | 23.0% | | | | | $\Delta$ | +90 +236 +315 +463 +677 —† | | | | | | | | | | | Latency | 22.1K 111.3K |

架构匹配而非参数匹配,因为时序卷积会增加权重。其开销随持续时间增长,在较大规模下达到 20–29%。大规模 60 秒时序卷积计时是一个孤立的异常值,与其配对的基线一起被排除。移除时序路径简化了主干网络,并保留了所选注意力比例的缩放优势。

G.5. 模块级组合

图 17 报告了来自急切形状诊断(eager shape diagnostic)的互斥顶级模块占比(模块不重叠,因此占比可加)。从 22.1K 到 111.3K 个 token,八个 softmax 锚点在前向传播时间中的占比从 23.0% 增长到 54.4%,而线性自注意力则从 26.0% 下降到 15.7%,这为长序列特定的内核提供了动机。

G.6. 编译友好的 AttnRes

原始推理路径会变异源缓冲区并缩减不断增长的前缀,这使得 torch.compile 难以进行融合。我们改为将最多五个源暴露为静态列表,并在 fp32 中累积其加权和,而不堆叠所有源。与缓冲区路径相比,fp32 中的全前向漂移可忽略不计,bf16 中为 0.68%。该重写将 8 秒时的编译/急切加速比从 1.47× 提高到 2.11×,将 60 秒时的加速比从 1.21× 提高到 1.49×。这些数字比较的是路由器实现,而非完整的模型部署。

26

第 27 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

0s 2s 4s 6s 8s

一位戴着红色针织围巾的年轻女性的中近景,她正接住雪花,抬头看着周围飘落的雪,然后轻声微笑,雪花在寒冷的蓝色暮光中闪烁,背景是温暖的商店橱窗。电影般的冬日氛围。

野马在黎明时分奔腾穿过浅浅的雾河,水花四溅,鬃毛在金色的逆光飞溅中飞扬。慢动作侧面跟踪镜头,史诗般的自然摄影。

一位年长的木雕匠人在杂乱的工坊里雕刻一只木鸟,随着刀刃的运作,木屑卷曲落下,温暖的灯光照亮了他专注而饱经风霜的脸庞。特写镜头,工匠纪录片风格。

雨夜中涩谷十字路口的延时摄影,数百把发光的雨伞向各个方向流动,霓虹广告牌在湿漉漉的沥青路面上方闪烁。高角度广角镜头,赛博都市的能量。

中国传统水墨画风格:一只仙鹤缓缓飞过雾气缭绕的层峦叠嶂,墨色柔和地晕染,松树剪影在雾中浮现又消散。极简的水墨美学。

动漫风格:一个女孩和她的白猫坐在屋顶上,在夜晚观看远处城市绽放的烟花,她的头发在温暖的微风中飘动,色彩映照在她的眼中。手绘美学。

图 18 | 额外的 720p 文本到视频样本。每一行展开一个 8 秒 1280×736 的视频片段,展示 0/2/4/6/8 秒处的五帧画面;每行下方显示了生成提示词。

27

第 28 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

0秒 2秒 4秒 6秒 8秒

监督微调 (SFT)

强化学习 (RL)

黄昏,侧面和边缘光线,柔和,低对比度,中景,中心构图,温暖,高饱和度色调。一位身穿鲜艳绿色上衣和长刺绣裙的傣族少女正在表演优雅的孔雀舞。她头戴花饰,腰间系着带流苏的银腰带,脚穿绣花鞋。一只手模仿孔雀的头,另一只手像尾巴一样展开,动作细腻。背景:一个傣族村庄,阳光透过树叶洒下斑驳的阴影。干净,单一镜头。

监督微调 (SFT)

强化学习 (RL)

复古 60 年代彩色胶片,柔和的自然光透过森林树冠。一辆复古红色敞篷车在蜿蜒的山路上行驶,阳光在车身和路面上形成斑驳的光影。一位戴着太阳镜、笑容灿烂的年轻女司机的特写,她的头发自由飘逸,洋溢着喜悦。背景是连绵的青山和清澈的蓝天。中近景,略微俯视的角度。

监督微调 (SFT)

强化学习 (RL)

一个舒适的室内客厅,铺着波斯地毯,摆放着复古黄色沙发和亮着的台灯,被神奇地放置在黄昏时分被连绵森林山丘环绕的开阔草坪上。一位身穿白色长袍的女子静静地坐在沙发上,陷入沉思,而一台旧电视机独自立在草地上。中景,静态镜头与摇镜头的混合。

监督微调 (SFT)

强化学习 (RL)

特写,低角度镜头,一只金毛猎豹在狭窄的峡谷中全速奔跑,肌肉流畅,四肢有力地跨越岩石和泥土,扬起尘土。锐利的目光注视前方,每一次跳跃和转弯都展现出惊人的敏捷性,阳光在其皮毛和黑色泪痕上闪烁。紧张、狂野的追逐场景,突显了生存本能。

图 19 | 在线强化学习在四个提示词下的定性效果。每个区块使用相同的提示词和无分类器引导比例(CFG 8)比较来自监督微调 (SFT) 和强化学习 (RL) 检查点的生成结果。列显示了 0/2/4/6/8 秒的帧,每对提示词下方重放了完整的生成提示词。

28

第 29 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

Ours 5B Wan 2.2-A14B Bernini-R 14B Cosmos-3 Nano LTX-2.3 22B

一位小提琴手在夜间露天舞台上演奏,琴弓在琴弦上扫过,雨滴在她专注的面庞周围温暖的聚光灯下闪闪发光。缓慢推近镜头,充满情感的音乐会电影摄影。 Ours 5B Wan 2.2-A14B Bernini-R 14B Cosmos-3 Nano LTX-2.3 22B

一只章鱼在珊瑚头上蠕动,其皮肤颜色和纹理从沙色米色变为深红色,手臂卷曲并探索。微距水下镜头,令人着迷的细节。 Ours 5B Wan 2.2-A14B Bernini-R 14B Cosmos-3 Nano LTX-2.3 22B

夜间城市港口的无人机灯光秀,数百架发光的无人机升起,从鲸鱼形状变形为盛开的花朵,倒映在黑暗的水面上。广角镜头,未来主义的奇观。 Ours 5B Wan 2.2-A14B Bernini-R 14B Cosmos-3 Nano LTX-2.3 22B

夜间沙漠台地上空的雷暴延时摄影,紫色的闪电分支在翻滚的云层和繁星密布的天空下反复击中地平线。广角风暴摄影。

图 20 | 在四个保留提示上的跨方法 720p 文本到视频比较。列代表方法,行显示每个片段的 0/50/100%;提示出现在相应块下方。

29

第 30 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

0% (条件) 25% 50% 100%

5B 本文方法

22B LTX-2.3 2.2-TI2V-5B Wan Nano Cosmos-3

条件:一辆红色跑车在沙地中行驶,扬起大量尘土

0% (条件) 25% 50% 100%

5B 本文方法

22B LTX-2.3 2.2-TI2V-5B Wan Nano Cosmos-3

条件:两只天鹅在雾中的湖面上游泳

图 21 | 首帧条件视频对比,第 1–2 对。每一行展示一种方法在其视频片段 0/25/50/100% 处的效果;首帧是共享的。协议细节见附录 E.3。

30

第 31 页

SANA-Video 2.0:用于高效视频生成的混合线性注意力与注意力残差

0% (条件) 25% 50% 100%

5B 本文方法

22B LTX-2.3 2.2-TI2V-5B Wan Nano Cosmos-3

条件:一群热气球飞越田野

0% (条件) 25% 50% 100%

5B 本文方法

22B LTX-2.3 2.2-TI2V-5B Wan Nano Cosmos-3

条件:一个人正在往茶杯里倒水

图 22 | 首帧条件视频对比,第 3–4 对。协议与图 21 一致。

31

发表评论