三分钟导读:HeadCast是一种免训练的即插即用加速框架,通过一次性分类将预训练自回归视频模型中的注意力头划分为Sink、Dummy、Spatial和Global四种原型,并重构KV缓存以实现分辨率可扩展的推理加速。
英文题目:HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2607.20125
原始论文:PDF / 论文页面
对应视频标题:HeadCast:免训练注意力头路由,实现自回归视频生成的高效推理|推荐指数:★★★★★
这篇论文解决什么问题?
自回归(AR)视频扩散模型在生成长视频时,Key-Value (KV) 缓存无限增长导致注意力计算成本呈O(L^2)增加;现有的缓存压缩方法(如Dummy Forcing)通过粗暴驱逐缓存导致帧间闪烁和结构漂移,而基于训练的方法成本高昂。
核心创新
- 发现并分类了AR视频模型中四种稳定的注意力头原型:Sink, Dummy, Spatial, Global。
- 提出免训练的HeadCast框架,通过一次性分类重构KV缓存,显式保留Global头以维持时间一致性。
- Spatial路径使用固定大小网格,使得加速比随分辨率(KV缓存大小)增加而提升。
- 解决了Dummy Forcing等激进驱逐方法导致的帧间闪烁问题,在保持VBench质量的同时显著提升帧级保真度。
方法概览
HeadCast包含四个阶段:1) 全上下文Warm-up积累稳定上下文;2) 在最大噪声步(t=1000)进行一次性Online Classification,根据余弦相似度将头分类为Sink(锚定首帧)、Dummy(仅关注当前块)、Spatial(局部空间邻域)和Global(全历史);3) Heterogeneous Cache Management将单体KV缓存拆分为头特定缓冲区;4) Head-Specific Attention通过专用路径(如Spatial路径使用固定网格分解注意力)进行推理。
逐图理解论文
现有方法的局限与HeadCast动机

Dummy Forcing等激进驱逐方法通过粗暴驱逐缓存导致帧间闪烁和结构漂移,而基于训练的方法成本高昂。HeadCast旨在解决这一问题,通过免训练的一次性分类,将预训练模型中的注意力头划分为不同原型,重构KV缓存,在保持时间一致性的同时实现高效推理。
四种注意力头原型发现

HeadCast发现并分类了AR视频模型中四种稳定的注意力头原型。Sink头锚定首帧,Dummy头仅关注当前块,Spatial头关注局部空间邻域,Global头则覆盖全历史上下文。这一发现为异构缓存管理提供了理论基础,使得针对不同头特性进行优化成为可能。
HeadCast四阶段流程

HeadCast包含四个阶段:全上下文Warm-up积累稳定上下文;在最大噪声步t=1000进行一次性Online Classification,根据余弦相似度将头分类为四种原型;Heterogeneous Cache Management将单体KV缓存拆分为头特定缓冲区;Head-Specific Attention通过专用路径进行推理,如Spatial路径使用固定网格分解注意力。
Spatial路径与固定网格分解

Spatial路径使用固定大小网格,将每帧划分为不重叠的网格,Query仅关注其所在网格内的KV token across history。这种设计将密集注意力分解为独立的子矩阵,使得加速比随分辨率增加而提升,有效解决了高解析度下的计算瓶颈,同时保持了局部空间一致性。
主实验结果与质量保持

在Self-Forcing, LongLive等四个AR模型上评估,HeadCast在480P分辨率下VBench Total质量与Full Attention基线相差在0.15分以内。在Self-Forcing 5s 720P下,HeadCast PSNR为25.87 dB,LPIPS为0.0568,显著优于Dummy Forcing的PSNR 18.81 dB和LPIPS 0.2021,证明了其在保持高保真度方面的有效性。
实验与关键结果
- 在Self-Forcing, LongLive, Causal Forcing, Reward Forcing四个AR模型上评估。
- 在480P, 720P, 1080P分辨率下进行可扩展性测试。
- 进行用户研究(2AFC)比较HeadCast与Full Attention和Dummy Forcing。
- 消融实验分析头原型贡献、分类阈值、分类时间步t及分类稳定性。
- 在720P下加速1.62倍,1080P下加速1.95倍(第 1 页)
- 在480P分辨率下,HeadCast的VBench Total质量与Full Attention基线相差在0.15分以内(第 6 页)
- 在Self-Forcing 5s 720P下,HeadCast PSNR为25.87 dB,LPIPS为0.0568;Dummy Forcing PSNR为18.81 dB,LPIPS为0.2021(第 7 页)
- 在LongLive 30s 1080P下,HeadCast达到1.95倍加速,PSNR为14.35 dB(第 7 页)
- 用户研究中,HeadCast在90.9%的比较中优于Dummy Forcing(第 7 页)
- 分类开销在30秒视频生成中占比低于1.5%(第 5 页)
阅读时需要注意
- 分类仅在推理初期进行一次,若头行为随时间发生显著变化(尽管实验显示稳定性高),可能无法适应。
- Spatial路径的加速效果依赖于分辨率,在低分辨率(如480P)下KV缓存较小,加速效果有限(约1.05-1.08倍)。
- 在长视频(30秒)中,由于轨迹发散,基于Full Attention输出的PSNR/LPIPS指标会自然降低,尽管主观质量(VBench)保持。
- PSNR和LPIPS是相对于模型自身的Full Attention输出计算的,用于衡量保真度,而非绝对质量。
- Dynamic Degree指标在LongLive模型上HeadCast低于基线(29.84 vs 35.59),可能反映运动平滑度或动态特性的差异,需结合其他指标解读。
- 分类阈值(θ=0.95, θsc=0.755)是跨模型和分辨率通用的,未进行每模型微调。
关联工作
- Dummy Forcing:最直接的免训练基线,但通过激进驱逐导致闪烁和质量下降。(第 2 页)
- Sparse VideoGen:利用空间和时间稀疏性,但定义在双向注意力下,不直接适用于AR模型。(第 2 页)
- Head Forcing:并发工作,利用头异构性进行长时外推,而非分辨率可扩展加速。(第 2 页)
- Self-Forcing:使用的AR模型基线之一,解决训练-推理不匹配问题。(第 2 页)
- LongLive:使用的AR模型基线之一,引入KV重缓存以维持场景过渡连续性。(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HeadCast:为高效自回归视频生成而设计的注意力头映射
Jinliang Shen1∗, Lianghao Su2, Zheming Li2, Kang He2, Ziliang Lai2, Yanbing Jiang1†, Chengru Song2† 1 北京大学 2 KlingAI Research sjl@stu.pku.edu.cn, jyb@ss.pku.edu.cn, songchengru@klingai.com
摘要 自回归 (AR) 视频扩散模型已成为长视频和流式视频合成的有前景范式,但不断增长的 Key-Value (KV) 缓存使得注意力机制成为主要的推理成本,尤其是在高分辨率下,每一帧都会贡献大量 token。现有的补救措施要么使用粗糙启发式方法驱逐缓存,导致帧间闪烁,要么需要重新训练模型。我们提出了 HeadCast,这是一种免训练、即插即用的加速框架,其构建于以下观察之上:预训练的 AR 视频模型的注意力头表现出稳定且异质的结构偏好。我们发现注意力头呈现出稳定的、异质的结构偏好。我们识别出四种原型:锚定首帧的 Sink 头、仅关注最近块的 Dummy 头、关注历史中局部空间邻域的 Spatial 头,以及需要完整上下文的 Global 头。这些分配在整个生成过程中保持稳定,因此只需在早期进行一次分类即可。2026 年,AR 模型的注意力头表现出稳定的、异质的行为。在此基础上,我们提出了 HeadCast,这是一种免训练、即插即用的加速框架,它将每个预训练的注意力头映射到专用的计算路径上。经过短暂的完整上下文预热后,HeadCast 在最大噪声步(t = 1000)执行一次性分类,此时注意力反映的是结构偏好而非内容特定偏好,并将每个头路由到定制的路径:Sink 和 Dummy 头保留单个块,Spatial 头在固定网格内关注,Global 头保留完整的滑动窗口。相应的,单体 KV 缓存被拆分为紧凑的、针对每个头的缓冲区。保留 Global 头可以保持时间一致性,并避免过度激进驱逐带来的闪烁。因为 Spatial 路径局限于固定大小的网格,HeadCast 的加速效果随 KV 缓存大小而增长:在 720P 下最高加速 1.62 倍,在 1080P 下最高加速 1.95 倍,且无需任何训练。在 Self-Forcing (Huang et al. 2025)、LongLive (Yang et al. 2026)、Causal Forcing (Zhu et al. 2026) 和 Reward Forcing (Lu et al. 2026) 等多个 AR 模型上,HeadCast 在保持 VBench 质量和帧级保真度 (PSNR/LPIPS) 的同时,消除了激进驱逐引入的闪烁。代码:https://github.com/sjlgaga/HeadCast.[cs.CV]
1 引言 Diffusion Transformers (Peebles and Xie 2023) 推动了高保真视频生成 (Ho et al. 2022; Blattmann et al. 2023; Yang et al. 2025b; Kong et al. 2024; Wan Team 2025)。为了避免一次性生成所有帧,自回归 (AR) 模型通过块-by-块合成视频,支持长视域和流式生成,并通过 Key-Value (KV) 缓存复用历史状态。然而,随着生成的进行,KV 缓存无限增长,对其进行的注意力计算产生 O(L²) 的成本,这成为了主导推理成本的因素。滑动窗口可以限制这种增长,但对于高分辨率视频,窗口内的序列仍然很长——每一帧都贡献大量 token——因此推理仍然缓慢。激进地缩小缓存也不是解决办法:Dummy Forcing (Guo et al. 2026) 依赖于粗糙的头分类并驱逐某些头所依赖的长程上下文,导致帧间闪烁和结构漂移,而基于训练的稀疏注意力方法则需要昂贵的重新训练。
这引出了一个问题:是否每个注意力头都需要关注完整的上下文,还是说头之间在关注内容上存在差异?通过可视化预训练的 AR 视频模型,我们发现注意力头表现出稳定的、异质的结构偏好。我们识别出四种原型:锚定首帧的 Sink 头、仅关注最近块的 Dummy 头、关注历史中局部空间邻域的 Spatial 头,以及需要完整上下文的 Global 头。这些分配在整个生成过程中保持稳定,因此只需在早期进行一次分类即可。
在此基础上,我们提出了 HeadCast,这是一种免训练、即插即用的加速框架,它将每个预训练的注意力头映射到专用的计算路径上。经过短暂的完整上下文预热后,HeadCast 在最大噪声步(t = 1000)执行一次性分类,此时注意力反映的是结构偏好而非内容特定偏好,并将每个头路由到定制的路径:Sink 和 Dummy 头保留单个块,Spatial 头在固定网格内关注,Global 头保留完整的滑动窗口。相应的,单体 KV 缓存被拆分为紧凑的、针对每个头的缓冲区。保留 Global 头可以保持时间一致性,并避免过度激进驱逐带来的闪烁。因为 Spatial 路径局限于固定大小的网格,HeadCast 的加速效果随 KV 缓存大小而增长:在 720P 下最高加速 1.62 倍,在 1080P 下最高加速 1.95 倍,且无需任何训练。在 Self-Forcing (Huang et al. 2025)、LongLive (Yang et al. 2026)、Causal Forcing (Zhu et al. 2026) 和 Reward Forcing (Lu et al. 2026) 等多个 AR 模型上,HeadCast 在保持 VBench 质量和帧级保真度 (PSNR/LPIPS) 的同时,消除了激进驱逐引入的闪烁。
总之,我们的主要贡献如下:
- 我们识别并分类了预训练 AR 视频扩散模型中四种稳定、异质的注意力头原型——Sink、Dummy、Spatial 和 Global。arXiv:2607.20125v1
- 我们提出了 HeadCast,这是一种免训练框架,它一次性对头进行分类,并将 KV 缓存重构为针对每个头的计算路径,明确保留 Global 头以维持时间一致性。
- 在多个 AR 模型上,HeadCast 提供了随分辨率扩展的加速效果(720P 下最高 1.62 倍,1080P 下最高 1.95 倍),同时保持视觉保真度和时间一致性。
第 2 页
时间一致性。然而,这些方法并不直接适用于自回归(AR)模型因果的、动态增长的上下文。
2 相关工作
2.1 自回归视频扩散
扩散模型 (Ho, Jain, and Abbeel 2020; Song, Meng, and Ermon 2021; Rombach et al. 2022) 已成为高保真视觉合成的主导范式,而越来越多的工作 (Chen et al. 2024; Yin et al. 2025; Huang et al. 2025; Liu et al. 2026; Yang et al. 2026; Sand AI 2025) 将扩散建模与自回归 (AR) 预测相结合,以支持长视距、流式视频生成,通过因果建模和键值 (KV) 缓存降低成本。MAGI-1 (Sand AI 2025) 逐块生成视频,通过逐块渐进去噪实现流式合成。CausVid (Yin et al. 2025) 将预训练的双向扩散 Transformer 转换为带有 KV 缓存的因果 AR 生成器,而 Self-Forcing (Huang et al. 2025) 通过在模型自身生成的帧上进行条件约束来解决训练-推理不匹配问题。在此基础上,Rolling Forcing (Liu et al. 2026) 扩展扩散窗口以抑制误差累积,而 LongLive (Yang et al. 2026) 引入 KV 重新缓存以维持场景转换间的视觉连续性。许多这些 AR 生成器还通过扩散蒸馏 (Song et al. 2023; Yin et al. 2024; Salimans and Ho 2022) 压缩为少步采样器,从而减少去噪步数;HeadCast 正交且完全无需训练,而是通过利用这些预训练模型已经表现出的异构注意力行为来降低每步注意力成本。
2.2 KV 缓存压缩
注意力机制 (Vaswani et al. 2017) 是这些模型的基础,但其线性增长的内存占用促使了大量 KV 缓存压缩研究,主要面向大型语言模型 (LLMs)。基于 Token 的方法如 StreamingLLM (Xiao et al. 2024) 保留初始 Token 的“Sink”,而 H2O (Zhang et al. 2023) 和 SnapKV (Li et al. 2024) 根据其注意力分数保留关键 Token;基于 Head 的方法如 DuoAttention (Xiao et al. 2025) 和 FastGen (Ge et al. 2024) 为不同的 Head 分配不同的缓存预算。互补的方向则通过 IO 感知内核 (Dao et al. 2022) 在系统层面攻击成本,或通过低位宽量化 (Liu et al. 2024) 缩小缓存。这些方法针对文本的一维结构,并未利用视频的空间-时间冗余。HeadCast 将 Head 级别的缓存重构扩展到 AR 视频扩散,采用感知维度、每 Head 类型的策略。
2.3 高效视频生成
早期视频模型采用双向扩散 Transformer (DiT) (Peebles and Xie 2023),主要通过固定长度的稀疏注意力进行加速 (Zhang et al. 2025a,b)。Sparse VideoGen 系列 (Xi et al. 2025; Yang et al. 2025a) 识别出空间和时间 Head(以及在 SVG2 中聚类的 Token 块),以实现帧内和帧间稀疏性。这些模式是在双向 3D 全注意力下定义的,Dummy Forcing (Guo et al. 2026) 按以下方式管理缓存
然而,并不直接适用于自回归(AR)模型因果的、动态增长的上下文。
更接近我们设置的是,最近的方法直接加速 AR 视频模型。Light Forcing (Lv et al. 2026) 通过由粗到细的 top-k 选择分配块级稀疏性,但对所有 Head 应用一种方案;而 Sparse Forcing (Xu et al. 2026) 学习原生稀疏注意力——两者都需要额外的训练。另一条无需训练的思路是直接压缩 KV 缓存以提速:Dummy Forcing (Guo et al. 2026) 和并行的 Forcing-KV (Ji et al. 2026)。最接近我们的是 Dummy Forcing,它将许多具有轻微时间稀疏性的 Head 强制进入激进的“Dummy”模式,仅保留当前帧,过度丢弃它们所依赖的长程上下文,并且——正如我们的实验所示——降低了帧级保真度并引发帧间闪烁。(Deep Forcing (Yi et al. 2026) 也是无需训练的,但它针对的是长程生成质量和稳定性,而非分辨率缩放加速。)与我们的研究并行的是 Head Forcing (Tian et al. 2026),它同样利用注意力 Head 的异构性,但用于长程外推——通过分层记忆和 Head 级 RoPE 编码将生成延长至分钟级别——而不是我们旨在实现的分辨率缩放加速。HeadCast 也是无需训练的,但它增加了一种 Spatial 类型,以捕捉这些 Head 的空间局部性(在因果设置中恢复 SVG 的局部性),并显式保留 Global 类型用于其余部分,从而以微小的速度代价获得比 Dummy Forcing 高得多的保真度——实现了明显更好的速度-保真度权衡。
3 动机
3.1 预备知识:自回归视频扩散与 KV 缓存
自回归视频扩散模型逐块生成视频。给定一个包含 T 帧的视频 $X = \{x_1, x_2, \dots, x_T\}$,模型在因果因子化下学习联合分布:
$$ p(x_1, \dots, x_T) = \prod_{i=1}^{T} p(x_i | x_{<i}) \quad (1) $$
每个条件概率 $p(x_i | x_{<i})$ 都是一个去噪扩散模型 (Peebles and Xie 2023),它在先前生成的帧 $x_{<i}$ 的条件下,从高斯噪声中对当前内容进行去噪。每个自回归 (AR) 步骤在块因果掩码下生成一帧块,该掩码阻止来自未来帧的泄漏,因此历史帧的键和值 (KV) 可以缓存并重用,避免重新计算。
然而,累积的 KV 缓存随视频长度线性增长,导致 $O(L^2)$ 的注意力成本,这很快就会主导推理过程。使用最近帧的滑动窗口 (Huang et al. 2025) 可以控制这一成本,但暴露出一个张力:在高分辨率下,窗口内的序列仍然足够长,使得推理缓慢,而缩小窗口则会破坏长视频所需的长程上下文以维持时间一致性。保留第一帧作为固定的 Sink 可以稳定质量,暗示并非所有缓存内容都同等重要。
第 3 页
层 0 · 头 10 层 1 · 头 1 31% 33% 34% 100 66% 40 20注意力权重(%) 50 16% 注意力权重(%) 0 0 (当前) 1560 1.0 (当前) 1560 1.0 令牌 3119 0.5 令牌 3119 0.5 查询 4679 0.0 查询 4679 0.0 0 1 2 3 4 5 6 7 8 0 1 2 3 4 5 6 7 8 缓存帧索引 缓存帧索引
(a) Sink (b) Dummy
层 0 · 头 8 层 0 · 头 11 1.0 1.0 0 0 (当前) 1560 (当前) 1560 0.5注意力权重 0.5注意力权重令牌 令牌 3119 归一化 3119 归一化 查询 查询 4679 0.0 4679 0.0 0 519 1039 1559 0 4680 9359 14039 空间位置 (H×W=30×52) 键令牌 (缓存窗口)
(c) Spatial (d) Global
图 1:预训练自回归 (AR) 视频模型中的四种注意力头原型。(a) Sink 头和 (b) Dummy 头(逐帧视图) 分别关注第一帧块和最新的帧块;(c) Spatial 头(逐位置视图)关注每个查询的 局部邻域;(d) Global 头(原始图)覆盖整个历史。
头,但其驱逐过程过于粗糙,丢弃了头所依赖的上下文,导致质量下降和闪烁。因此,在无损质量的前提下提高效率,需要一种更精细的头分类方法,以匹配每个头的真实时间依赖关系。
3.2 视频中的异构注意力模式 DiT 在整个累积的历史上执行注意力机制。我们假设这是不必要的——头对历史上下文表现出内在不同的依赖关系——并通过可视化自回归基线(例如 Self-Forcing)在推理过程中的注意力图,来揭示其异构模式。
观察 1:注意力头在时间范围上表现出稀疏性。 受 Dummy Forcing (Guo et al. 2026) 的启发,我们首先研究不同的注意力头如何关注历史帧。在图 1(a)–(b) 中,对于每个查询令牌,我们将同一帧内所有键令牌的注意力分数进行聚合,以量化每个缓存帧的重要性。如图所示,许多注意力头在时间维度上表现出显著的稀疏性,分为两种不同的模式:
Sink Pattern:来自所有查询令牌的注意力权重强烈聚集在 KV 缓存的第一个块上。 Dummy Pattern:查询令牌的注意力权重几乎完全集中在当前的去噪块上。
观察 2:注意力头在空间范围上表现出稀疏性。 在当前 AR 视频扩散模型中,每个注意力头都关注整个累积的历史。对于没有极端时间稀疏性的头,我们通过将历史 KV 缓存投影到原始 2D 空间网格(高度和宽度)并聚合每个空间位置的注意力分数,来探测其空间维度,这揭示了每个查询的空间感受野。如图 1(c) 所示,一些头将查询的大部分注意力集中在其直接空间邻域内的键令牌上。
因此,我们将剩余的头分为两种进一步的模式: Spatial Pattern:查询令牌的注意力权重强烈聚集在历史帧中位于其局部空间邻域内的键令牌上。 Global Pattern:注意力权重散布在整个 KV 缓存中,因此这些头需要完整的历史上下文。图 1(d) 显示了此类全局头的原始注意力分数图,其注意力在时间和空间维度上均呈全局分布。
3
第 4 页
过去帧的缓存 被驱逐的缓存
预热阶段 头特定注意力
头 1 Sink头
头 2
Dummy头 头 3 输出 头 合并 .. .. .. .. Spatial头 注意力 在线分类 头 N-1
头 N Global头
统一的全 注意力
图 2:HeadCast 的四个阶段流水线:全上下文预热、在线分类、异构缓存管理和头特定注意力。
观察 3:不同的注意力头在推理步骤中表现出模式稳定性。 关键在于,大多数注意力头在自回归步骤、去噪时间步和文本提示中保持其原型不变。定量而言,超过 90% 的头在自回归步骤(第 12 帧与第 18 帧,相隔两个块)中接收相同的原型,且这种分配在去噪时间步和提示中也同样稳定(完整的逐轴一致性率出现在图 6 中)。这种稳定性使我们能够利用异构稀疏性,进行一次早期分类,且无重复成本。
4 HeadCast 当累积的 KV 缓存首次超过窗口大小 W 时。 4.1 概述 此时,预热阶段已累积了完整的上下文,作为分类的参考。 为了在不牺牲视觉保真度的情况下利用历史上下文稀疏性,我们提出了 HeadCast,这是一种无需训练的推理框架,为每个注意力头提供定制的计算路径和缓存管理策略。如图 2 所示,其流水线包含四个阶段。短暂的预热阶段运行全注意力以累积稳定的上下文;一旦缓存超过滑动窗口大小 W,一次性的在线分类便根据全上下文与受限上下文输出之间的余弦相似度,将每个头分类为四种原型之一——Sink、Dummy、Spatial 或 Global。异构缓存管理随后沿头维度将单体缓存拆分为特定类型的缓冲区,而头特定注意力则让每个头通过自己的路径,共同削减序列长度和注意力 FLOPs。下文将详细介绍每个阶段。
4.2 在线分类 分类指标与原型 给定查询张量 Q 和完整的歷史键值对 (K_full, V_full),在分类步骤中,我们首先为每个头 h 计算无约束的参考输出: 为了在不进行训练的情况下揭示每个头的依赖特征,我们引入了一次性的在线分类,该分类在累积的 KV 缓存首次超过窗口大小 W 时触发。此时,预热阶段已累积了完整的上下文,作为分类的参考。
分类指标与原型 给定查询张量 Q 和完整的歷史键值对 (K_full, V_full),在分类步骤中,我们首先为每个头 h 计算无约束的参考输出:
$$ O(h)_{ref} = \text{Attention}(Q, K^{(h)}_{full}, V^{(h)}_{full}) \quad (2) $$
为了探测每个头 h 在受限上下文下的行为,我们定义了三种受限注意力操作,每种操作针对历史的一个指定子集:
• Sink Proxy:注意力仅限于第一个时间块(语义锚点),产生 $O(h)_{sink}$。 • Dummy Proxy:注意力仅限于当前最近的局部块,产生 $O(h)_{dummy}$。 • Spatial Proxy:注意力覆盖所有历史块,但局限于以每个查询令牌为中心的局部 $(2r + 1) \times (2r + 1)$ 网格,产生 $O(h)_{spatial}$。
对于每个头 h,我们通过在所有 $L_q$ 查询令牌上平均余弦相似度,来量化受限输出与参考输出之间的对齐程度:
$$ \cos(h)_m = \frac{1}{L_q} \sum_{t=1}^{L_q} \cos(O(h)_m[t], O(h)_{ref}[t]), \quad m \in \{\text{sink, dummy, spatial}\}. \quad (3) $$
由于平均余弦相似度即使在头在少数边界令牌上失败时也可能保持较高——我们发现如果将这些头路由到 Spatial
第 5 页
宽度 • 空间缓存 (Kspatial, Vspatial):对于 Nspatial 个头,其时间布局与全局缓存相同,但在下一阶段使用局部空间掩码会显著降低其有效计算量。 宽度 高度 历史 当前帧 帧 将单体张量切片为这些异构缓存可最小化内存冗余,并为下游并行计算提供连续布局。 高度 宽度 宽度 4.4 头特定注意力 在每个自回归步骤中,轻量级内核沿头维度对查询进行切片,并将每组查询路由到其专用路径: 高度 高度 • Sink 和 Dummy 路径:查询从 Sink 缓存中获取。由于这两种类型都仅关注一个历史块——Sink 的初始锚点,Dummy 的最新块——它们的 KV 序列具有相同的形状。我们利用这种共享形状将这两种头类型融合到单个注意力内核中,消除了它们冗余的长程 token 匹配。 Dummy 缓存 Figure 3: 空间路径。每个帧被划分为非重叠网格;查询仅关注其自身网格内历史中的 KV token,将密集注意力分解为独立的子矩阵。 • 全局路径:查询从全局缓存中获取,并执行标准的滑动窗口注意力,将时间上下文长度限制为 W。 执行标准的滑动窗口注意力,将时间上下文长度限制为 W。 • 空间路径:查询在时间上访问完整的滑动窗口,但受块到块的空间约束:帧被划分为非重叠网格,查询仅关注窗口内所有帧中同一网格的 KV token(图 3)。这将全局注意力矩阵分解为许多小的独立子矩阵,我们将它们沿批次维度堆叠,并使用标准的 FlashAttention 内核进行计算。部署的网格有意不同于空间注意力的滑动 (2r+1) × (2r+1) 邻域代理:每个查询都需要一个滑动窗口,无法使用自定义 FlexAttention 内核,而非重叠网格产生独立的密集子矩阵,可批量处理到 FlashAttention——这是对相同局部性的硬件高效近似。 path——我们采用保守的最坏情况分数用于空间情况: 最后,路径输出沿头维度拼接回。通过让每个头遵循其专用路径,HeadCast 在保持视觉质量的同时大幅加速推理。 score(h) = P5 cos(h)spatial −γ · MSE O(h)spatial, O(h)ref (4) 其中 P5(·) 是 token 级余弦相似度的第 5 百分位数,γ 加权 MSE 惩罚。 互斥决策规则 为了将每个头分配给单一模式,我们应用具有经验阈值 (θs, θd, θsp, θsc) 的互斥决策层次结构: Sink if cos(h)sink ≥θs Dummy elif cos(h)dummy ≥θd Spatial elif cos(h)spatial ≥θsp and score(h) ≥θsc Global otherwise (5) 此分类仅在单个自回归块上运行一次,因此仅增加一次性开销——在 30 秒的 LongLive 上占生成时间的不到 1.5%,在 5 秒片段上占 ∼5–8%,且无稳态成本(完整分解见附录 D)。
4.3 异构缓存管理 一旦头被分类,单体 KV 缓存便沿头维度解耦为三个专用、独立的缓存。随着 H 个头被划分为 Nsink、Ndummy、Nspatial 和 Nglobal 子集,HeadCast 重构内存占用如下: • Sink-Dummy 缓存 (Ksd, Vsd):合并 Sink 和 Dummy 头以阻止时间增长:Nsink 头冻结初始块,而 Ndummy 头仅通过滚动覆盖保留最新块。 • 全局缓存 (Kglobal, Vglobal):为 Nglobal 头维护标准的滑动窗口布局,保留初始 sink token,同时驱逐窗口外的中间帧。
5 实验 5.1 实验设置 模型与基线。我们将 HeadCast 集成到四个最近的自回归视频扩散模型中:Self-Forcing (Huang et al. 2025)、LongLive (Yang et al. 2026)、Causal Forcing (Zhu et al. 2026) 和 Reward Forcing (Lu et al. 2026)。我们将 HeadCast 与每个模型的完整滑动窗口注意力以及 Dummy Forcing(最直接可比的免训练加速基线)进行比较。 评估指标。对于整体质量,我们在 5 秒片段(标准提示)上报告 VBench (Huang et al. 2024),在 30 秒片段上报告 VBench-Long(Self-Forcing++ (Cui et al. 2025) 的 128 个 MovieGen (Polyak et al. 2024) 提示,均使用 Qwen2.5-7B-Instruct (Yang et al. 2024) 进行优化,遵循 Self-Forcing (Huang
5
第 6 页
方法 FPS ↑ 加速比 ↑ 质量 ↑ 语义 ↑ 总分 ↑ 动态程度 PSNR ↑ LPIPS ↓
⋄自强制 (5s) 19.48 1.00× 84.60 80.77 83.84 64.72 — — • + Dummy 强制 20.30 1.04× 84.22 80.77 83.53 55.83 18.23 0.1919 • + HeadCast 20.38 1.05× 84.66 80.77 83.88 64.72 25.64 0.0469
⋄LongLive (30s) 16.06 1.00× 82.77 80.17 82.26 35.59 — — • + Dummy 强制 18.63 1.16× 82.93 80.69 82.48 34.81 10.27 0.6161 • + HeadCast 17.29 1.08× 82.42 80.93 82.12 29.84 11.02 0.5779
⋄因果强制 (5s) 20.08 1.00× 85.42 80.95 84.53 85.0 — — • + Dummy 强制 20.37 1.01× 84.58 80.86 83.83 94.6 15.96 0.2237 • + HeadCast 20.46 1.02× 85.37 81.01 84.50 95.2 22.42 0.0678
⋄奖励强制 (5s) 19.81 1.00× 84.94 80.88 84.13 68.33 — — • + Dummy 强制 20.17 1.02× 84.64 80.90 83.89 58.05 18.63 0.1507 • + HeadCast 20.14 1.02× 84.79 80.87 84.00 65.56 24.92 0.0449
表 1:在标准 480P 分辨率下(每个骨干网络显示的剪辑长度)四个自回归视频模型上的主要结果。 我们报告 VBench(质量、语义、总分)和动态程度,PSNR 和 LPIPS 是与每个模型的全注意力输出计算的(因此基线为“—”)。
第 127 帧 第 128 帧 第 129 帧 第 130 帧 第 131 帧
Dummy 强制
全注意力
HeadCast
图 4:自回归块边界处的帧间闪烁。在第 129 帧的块边缘处,Dummy 强制的驱逐操作弹出一个虚假结构(右侧的树,红框,第 130 帧),而全注意力和 HeadCast 保持时间一致性。
et al. 2025);每个 VBench 分数是对每个提示的 5 个种子取平均。由于文本到视频生成没有真实帧,我们使用每个模型自身的全注意力输出——作为加速模型的标准参考——并报告相对于它的 PSNR/LPIPS (Zhang et al. 2018) 作为补充 VBench 绝对质量轴的保真度轴。聚合后,VBench 对激进驱逐引起的闪烁和结构漂移相对不敏感,而保真度轴和我们的定性比较揭示了这一点。所有测量,包括 FPS 和加速比,均使用单 GPU。
实现细节。为了公平比较,全注意力基线和 HeadCast 共享相同的滑动窗口,每个块包含 3 帧:对于 5 秒剪辑,采用 4 块窗口(1 个固定 Sink 头加 3 个滚动块);对于 30 秒剪辑,采用 7 块窗口(1 个固定 Sink 头加 6 个滚动块)。在线分类在窗口首次填满时触发一次(例如,在 30 秒设置中,自回归步骤 Sstart = 7),在最大噪声去噪步骤 t = 1000。余弦阈值绑定到单个值 θs = θd = θsp = 0.95,空间分数阈值 θsc = 0.755,且空间分数中的 MSE 惩罚由 γ = 5 加权。在分类时,Spatial 头使用 (2r+1) × (2r+1) 邻域,其中 r = 2,而部署的 Spatial 路径将每个潜在帧划分为不重叠的 10 × 10 单元格(边界取整)。所有报告的加速比测量的是分类后、稳态阶段;一次性分类是单独的固定成本(在 30 秒剪辑上占总时间的不到 1.5%,在 5 秒剪辑上约占 5–8%;附录 D),因此将其包含在内几乎不会改变这些指标。
5.2 主要结果
表 1 比较了 HeadCast、Dummy 强制和全注意力基线在四个骨干网络上的表现。在 VBench 总分上,HeadCast 在每个骨干网络上都保持在距离全注意力基线 0.15 分以内,而 Dummy 强制则损失高达 0.7 分。动态程度是一个粗略的运动指标,两种方法随骨干网络变化:HeadCast 在 Self-Forcing 上与基线匹配(64.72),在 Reward Forcing 上保持接近,在 LongLive 上较低(29.84 vs. 35.59),以及在
第 7 页
因果强制(Causal Forcing)使两种方法的读取速度均高于基线(95.2/94.6 对比 85.0)。这两种方法在帧级保真度上的差异更为显著,而 VBench 对此有所低估:与每个模型的全注意力输出相比,HeadCast 在三个 5 秒骨干网络上的 PSNR 达到 22–26 dB,而 Dummy Forcing 仅为 16–19 dB,且 LPIPS 降低了 3–4 倍(0.045–0.068 对比 0.15–0.22)。这一差距正是 Dummy Forcing 的驱逐操作引入的帧间闪烁——结构在块边界处忽隐忽现(图 4)——而 HeadCast 通过保留 Global 头避免了这一问题。附录 E 中的块边界不连续性指标直接证实了这一点:在长片段中,Dummy Forcing 使块边缘的帧间跳跃比全注意力高出多达 36%,而 HeadCast 则与基线持平。
这些保真度的提升在速度上几乎没有任何代价。在标准分辨率(480P)下,KV 缓存较小,因此注意力计算尚未占主导地位,两种方法的速度提升较为温和(HeadCast 为 1.02–1.08×,Dummy Forcing 为 1.01–1.16×);仅在 LongLive(30 秒)上,Dummy Forcing 才获得有意义的 FPS 领先,但它仍牺牲了 0.75 dB 的 PSNR。真正的增益出现在高分辨率下(§5.3),此时 KV 缓存增大,HeadCast 的节省随之增加。
\begin{tabular}{l c c c c c} \hline Method & Res. & FPS↑ & Spd.↑ & Total↑ & PSNR↑ & LPIPS↓ \\ \hline Self-Forcing (5s) & 720P & 7.04 & 1.00× & 83.78 & $\infty$ & — \\ + Dummy Forcing & 720P & 9.60 & 1.36× & 83.91 & 18.81 & 0.2021 \\ + HeadCast & 720P & 9.21 & 1.31× & 83.83 & 25.87 & 0.0568 \\ LongLive (30s) & 720P & 4.83 & 1.00× & 79.07 & $\infty$ & — \\ + Dummy Forcing & 720P & 8.40 & 1.74× & 78.85 & 12.83 & 0.4554 \\ + HeadCast & 720P & 7.82 & 1.62× & 79.05 & 15.22 & 0.3357 \\ Self-Forcing (5s) & 1080P & 1.64 & 1.00× & 82.80 & $\infty$ & — \\ + Dummy Forcing & 1080P & 2.68 & 1.63× & 82.66 & 20.24 & 0.2059 \\ + HeadCast & 1080P & 2.40 & 1.46× & 82.90 & 27.17 & 0.0693 \\ LongLive (30s) & 1080P & 1.07 & 1.00× & 76.84 & $\infty$ & — \\ + Dummy Forcing & 1080P & 2.31 & 2.16× & 77.18 & 12.29 & 0.5394 \\ + HeadCast & 1080P & 2.09 & 1.95× & 77.26 & 14.35 & 0.4198 \\ \hline \end{tabular}
表 2:在 Self-Forcing(5 秒片段)和 LongLive(30 秒片段)上扩展到 720P 和 1080P 的可扩展性。PSNR 和 LPIPS 是相对于每个模型的全注意力输出计算的(因此基线为“$\infty$/—”)。
5.3 高分辨率的可扩展性
HeadCast 的节省随分辨率增加而增长,因为 Spatial 路径使用固定大小的网格:随着每帧产生的 token 增多,这些头访问的历史 KV 的比例减小(表 2)。在 Self-Forcing(5 秒片段)上,速度提升从标准分辨率下的接近 1× 增加到 720P 下的 1.31× 和 1080P 下的 1.46×;在 LongLive 上,由于其 30 秒的时间跨度进一步扩大了 KV 缓存,速度提升达到 1.62× 和 1.95×。
Dummy Forcing 在原始 FPS 上的扩展更为激进,但其驱逐操作在两种分辨率和骨干网络上都降低了保真度:在 LongLive 的 720P 上,它落后于 HeadCast 约 2.4 dB PSNR(12.83 对比 15.22)且 LPIPS 更高(0.455 对比 0.336),在 Self-Forcing 上差距更大(18.81 对比 25.87 dB)——即图 4 中明显的闪烁,而 HeadCast 在提供 1.62–1.95× 速度提升的同时避免了这一问题。HeadCast 还将 Self-Forcing 上的稳态 KV 缓存缩小了约 33%(附录 C)。
PSNR/LPIPS 是相对于全注意力输出测量的,在长视频 LongLive 上低于 5 秒骨干网络(720P 时为 15.22 对比 25.87 dB)——这是基于参考的指标的特性,而非质量损失:在 30 秒的 rollout 过程中,稀疏化模型与全注意力轨迹的差异更大,通常做出同样或更具语义忠实度的选择,而绝对质量得以保持(VBench Total 在 720P 时为 79.05 对比 79.07,在 1080P 时为 77.26 对比 76.84)。
5.4 用户研究
由于聚合 VBench 对驱逐引起的闪烁不敏感(§5.3),我们额外运行了一项盲法双盲强制选择(2AFC)人类研究(完整协议见附录 G):给定两个相同提示的视频,每位参与者做出单一的总体偏好选择,在两种设置下——HeadCast 对抗全注意力基线,以及对抗 Dummy Forcing。表 3 报告了每种方法在比较中的占比。
\begin{tabular}{l c c} \hline Comparison & HeadCast & Opponent \\ \hline vs. Full Attention & 39.6\% & 60.4\% \\ vs. Dummy Forcing & 90.9\% & 9.1\% \\ \hline \end{tabular}
表 3:用户研究。偏好每种方法的 2AFC 比较百分比(每行总和为 100%)。
结果对 Dummy Forcing 是决定性的:HeadCast 在 90.9% 的比较中更受青睐,反映了 VBench 单独未能捕捉到的无闪烁质量。与远强于全注意力基线相比,尽管运行速度快得多,HeadCast 仍在 39.6% 的比较中更受青睐,表明其加速成本仅带来微小、通常不可察觉的质量边际。
5.5 消融研究
除非另有说明,消融实验使用 Self-Forcing 在 5 秒片段、720P 分辨率下进行。我们研究了四个设计选择:每种头原型的贡献、两个分类阈值、去噪时间步 $t$,以及一次性分类的稳定性。
不同头原型的效用。我们消融了两种稀疏性来源,将 Sink 和 Dummy 头归为 Temporal Sparsity,将 Spatial 头归为 Spatial Sparsity,并在 All-Global 基线之上激活它们(表 4)。
Spatial Sparsity 是主要的速度杠杆(1.19×),它将密集注意力图分割为独立的局部子矩阵,但也承担了大部分保真度成本(25.04 dB PSNR);Temporal Sparsity(Sink+Dummy)对两个轴都更温和(1.04×,27.99 dB),仅通过限制注意力序列长度来实现。将它们结合可达到 1.31× 的速度提升且无显著质量损失——VBench Total 保持在 All-Global 基线 0.05 分以内。
分类阈值的影响。HeadCast 由两个阈值控制:余弦阈值 $\theta := \theta_s = \theta_d = \theta_{sp}$,用于门控 Sink/Dummy/Spatial 分配,以及
第 8 页
配置 时间 空间 速度↑ PSNR↑ VBench↑ 帧——这是 Dummy 原型的定义行为, 我们的决策层次结构赋予其最高优先级。全全局(基线) × × 1.00× — 83.78 + 仅空间 × ✓ 1.19× 25.04 83.76 Dummy 的数量因此随着 t 的减小而稳步增长, + Sink+Dummy 仅 ✓ × 1.04× 27.99 83.82 Sink 头的增长幅度较小,而 Global 头的数量——那些携带长程时间上下文的头—— 全 HeadCast ✓ ✓ 1.31× 25.87 83.83 急剧减少。真正需要全局历史的头 因此被错误地路由到固定大小的 Dummy/Sink 窗口 表 4:头原型消融实验。Temp. 将 Sink 中,并失去了时间一致性所需的键,引入 和 Dummy 头;Spat. 表示 Spatial 头。 帧间闪烁;随着 t 的降低,PSNR 和 LPIPS 单调下降。在最大噪声水平(t = 1000)进行分类, 此时大多数头仍暴露其完整的 空间分数阈值 θsc。我们独立扫描每个参数, 长程结构,因此产生了最佳的保真度, 测量 FPS 和 PSNR。 并支持我们的默认设置。 一次性分类的稳定性。HeadCast 空间 θsc(默认 0.755) 时间 θs = θd(默认 0.95) 26.4 FPS PSNR 10.0 FPS PSNR 27.0 对每个头仅分类一次,并在整个 rollout 9.6 26.1 9.5 26.5 中复用该分配,因此我们验证了该分配 在计算条件下的鲁棒性: 9.0 26.0 25.8(dB) (dB) 自回归 (AR) 步骤、去噪时间步以及FPS 9.3 FPS 8.5 25.5 25.5PSNR PSNR 文本提示。对于每个轴,我们沿该轴重新运行分类 8.0 9.0 25.0 360 个头中获得相同四向原型的比例 25.2 7.5 24.5 (图 6)。该分配在每个轴上都高度一致——在 AR 步骤 24.5 上为 90.3%(第 12 帧与第 18 帧,相隔两个块),在去噪 时间步上为 85.8%,在文本提示上为 79.8%——证实了 观察 3:在代表性 图 5:分类阈值消融。左:空 AR 步骤和最大噪声时间步进行一次分类就足够了, 间分数阈值 θsc。右:余弦阈值 θ。降低 无需在每一步重新分析。 任一阈值会将更多头路由到稀疏路径,以 换 PSNR 为 FPS;绿色虚线标记我们的默认 (θsc=0.755, θ=0.95)。 AR 步骤 90.3
如图 5 所示,将 θ 从 0.91 收紧到 0.99 会使 PSNR 从 24.51 提高到 26.64 dB,代价是帧率从 9.51 下降到 7.24,而 θsc 控制着较温和的 权衡(±0.52 FPS,∓0.79 dB)。两条曲线均平滑 且单调,我们的默认设置在保真度和速度之间取得了良好的平衡。由于阈值比较的是注意力模式的余弦相似度——这些量是 归一化的且很大程度上与架构无关——我们将这一组参数 (θ=0.95, θsc=0.755) 不变地应用于所有四个 骨干网络和所有分辨率,无需针对每个模型进行微调。 分类时间步的影响。我们考察一次性分类执行的去噪时间步 t(表 5)。
t Sink Dummy Spatial Global PSNR↑ LPIPS↓ 6 结论 1000 29.4 136.3 84.1 110.2 25.87 0.0568 750 41.3 149.4 81.7 87.7 25.19 0.0612 我们提出了 HeadCast,这是一个无需训练的框架, 500 48.1 166.3 69.3 76.2 24.79 0.0649 在最大噪声步骤中对每个注意力头进行分类—— 250 53.0 190.8 50.4 65.9 24.52 0.0674 将其分为四种原型之一(Sink、Dummy、Spatial、 Global),并将其路由到特定头的路径。由于 表 5:分类去噪时间步 t 的消融实验: Spatial 路径使用固定大小的网格,其节省随 较低的 t 将更多头路由到 Dummy,更少头路由到 Global,因此 分辨率增加而增加,在 720P 下达到 1.62×,在 1080P 下达到 1.95×, 保真度下降,t = 1000 效果最佳。头数量基于 360 个(均值;由于四舍五入,可能不完全加总为 360)。 而保留的 Global 头保留了激进驱逐所破坏的时间 一致性。在最新的 AR 模型上,它达到了全注意力的 VBench 随着去噪从 t = 1000 向较低噪声水平进行, 质量,同时具有比先前 模型专注于局部、高频细节,因此越来越多的头仅关注其自身的 无需训练的驱逐方法更高的帧级保真度——使得头级异构性成为 高效 AR 视频生成的实用杠杆。
8
第 9 页
参考文献
Blattmann, A.; Dockhorn, T.; Kulal, S.; Mendelevitch, D.; Kilian, M.; Lorenz, D.; Levi, Y.; English, Z.; Voleti, V.; Letts, A.; et al. 2023. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. arXiv 预印本 arXiv:2311.15127.
Chen, B.; and Hu, X. 2024. KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache. 在《国际机器学习会议论文集》(ICML) 中.
Cui, J.; Wu, J.; Li, M.; Yang, T.; Li, X.; Wang, R.; Bai, A.; Ban, Y.; and Hsieh, C.-J. 2025. Self-Forcing++: Towards Minute-Scale High-Quality Video Generation. arXiv 预印本 arXiv:2510.02283.
Dao, T.; Fu, D. Y.; Ermon, S.; Rudra, A.; and Ré, C. 2022. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. 在《神经信息处理系统进展》(NeurIPS) 中.
Ge, S.; Zhang, Y.; Liu, L.; Zhang, M.; Han, J.; and Gao, J. 2024. Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs. 在《学习表示国际会议》(ICLR) 中.
Guo, H.; Jia, Z.; Li, J.; Li, B.; Cai, Y.; Wang, J.; Li, Y.; and Salimans, T.; and Ho, J. 2022. Progressive Distillation for Fast Sampling of Diffusion Models. 在《学习表示国际会议》(ICLR) 中.
Ho, J.; Jain, A.; and Abbeel, P. 2020. Denoising Diffusion Probabilistic Models. 在《神经信息处理系统进展》(NeurIPS) 中.
Ho, J.; Salimans, T.; Gritsenko, A.; Chan, W.; Norouzi, M.; and Fleet, D. J. 2022. Video Diffusion Models. 在《神经信息处理系统进展》(NeurIPS) 中.
Huang, X.; Li, Z.; He, G.; Zhou, M.; and Shechtman, E. 2025. Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion. 在《神经信息处理系统进展》(NeurIPS) 中.
Huang, Z.; He, Y.; Yu, J.; Zhang, F.; Si, C.; Jiang, Y.; Zhang, Y.; Wu, T.; Jin, Q.; Chanpaisit, N.; Wang, Y.; Chen, X.; Wang, L.; Lin, D.; Qiao, Y.; and Liu, Z. 2024. VBench: Comprehensive Benchmark Suite for Video Generative Models. 在《IEEE/CVF计算机视觉与模式识别会议论文集》(CVPR) 中.
Ji, Y.; et al. 2026. Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models. arXiv 预印本 arXiv:2605.09681.
Kong, W.; Tian, Q.; Zhang, Z.; Min, R.; Dai, Z.; Zhou, J.; Xiong, J.; Li, X.; Wu, B.; Zhang, J.; et al. 2024. HunyuanVideo: A Systematic Framework For Large Video Generative Models. arXiv 预印本 arXiv:2412.03603.
Li, Y.; Huang, Y.; Yang, B.; Venkitesh, B.; Locatelli, A.; Ye, H.; Cai, T.; Lewis, P.; and Chen, D. 2024. SnapKV: LLM Knows What You Are Looking for Before Generation. 在《神经信息处理系统进展》(NeurIPS) 中.
Liu, K.; Hu, W.; Xu, J.; Shan, Y.; and Lu, S. 2026. Rolling Forcing: Autoregressive Long Video Diffusion in Real Time. 在《学习表示国际会议》(ICLR) 中.
Liu, Z.; Yuan, J.; Jin, H.; Zhong, S.; Xu, Z.; Braverman, V.;
Lu, Y. 2026. Efficient Autoregressive Video Diffusion with Dummy Head. arXiv 预印本 arXiv:2601.20499.
Lu, Y.; Zeng, Y.; Li, H.; Ouyang, H.; Wang, Q.; Cheng, K. L.; Zhu, J.; Cao, H.; Zhang, Z.; Zhu, X.; Shen, Y.; and Zhang, M. 2026. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation. 在《IEEE/CVF计算机视觉与模式识别会议论文集》(CVPR) 中.
Lv, C.; Shi, Y.; Huang, Y.; Gong, R.; Ren, S.; and Wang, W. 2026. Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention. arXiv 预印本 arXiv:2602.04789.
Peebles, W.; and Xie, S. 2023. Scalable Diffusion Models with Transformers. 在《IEEE/CVF国际计算机视觉会议论文集》(ICCV) 中.
Polyak, A.; et al. 2024. Movie Gen: A Cast of Media Foundation Models. arXiv 预印本 arXiv:2410.13720.
Rombach, R.; Blattmann, A.; Lorenz, D.; Esser, P.; and Ommer, B. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. 在《IEEE/CVF计算机视觉与模式识别会议论文集》(CVPR) 中.
Sand AI. 2025. MAGI-1: Autoregressive Video Generation at Scale. arXiv 预印本 arXiv:2505.13211.
Song, J.; Meng, C.; and Ermon, S. 2021. Denoising Diffusion Implicit Models. 在《学习表示国际会议》(ICLR) 中.
Song, Y.; Dhariwal, P.; Chen, M.; and Sutskever, I. 2023. Consistency Models. 在《国际机器学习会议论文集》(ICML) 中.
Tian, J.; Wang, Y.; Yu, G.; and Zhang, C. 2026. Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity. arXiv 预印本 arXiv:2605.14487.
Vaswani, A.; Shazeer, N.; Parmar, N.; Uszkoreit, J.; Jones, L.; Gomez, A. N.; Kaiser, Ł.; and Polosukhin, I. 2017. Attention Is All You Need. 在《神经信息处理系统进展》(NeurIPS) 中.
Wan Team. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv 预印本 arXiv:2503.20314.
Xi, H.; Yang, S.; Zhao, Y.; Xu, C.; Li, M.; Li, X.; Lin, Y.; Cai, H.; Zhang, J.; Li, D.; Chen, J.; Stoica, I.; Keutzer, K.; and Han, S. 2025. Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity. 在《国际机器学习会议论文集》(ICML) 中.
Xiao, G.; Tang, J.; Zuo, J.; Guo, J.; Yang, S.; Tang, H.; Fu, Y.; and Han, S. 2025. DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads. 在《学习表示国际会议》(ICLR) 中.
Xiao, G.; Tian, Y.; Chen, B.; Han, S.; and Lewis, M. 2024. Efficient Streaming Language Models with Attention Sinks.
9
第 10 页
在国际学习表征会议 (ICLR)。 在神经信息处理系统进展 (NeurIPS)。 Xu, B.; Du, Y.; Liu, Z.; Yang, S.; Jiang, Z.; Yan, S.; Saha, Zhu, H.; Zhao, M.; He, G.; Su, H.; Li, C.; 和 Zhu, J. 2026. R.; Pumarola, A.; Wang, W.; 和 Li, P. 2026. 稀疏强制:用于实时自回归的 因果强制:为高质量实时交互式视频生成正确执行自回归扩散蒸馏。 原生可训练稀疏注意力用于自回归扩散视频生成。 arXiv 预印本 在机器学习国际会议 (ICML) 论文集。 arXiv:2604.21221。 Yang, A.; 等. 2024. Qwen2.5 技术报告。 arXiv 预印本 arXiv:2412.15115。 Yang, S.; Huang, W.; Chu, R.; Xiao, Y.; Zhao, Y.; Wang, X.; Li, M.; Xie, E.; Chen, Y.; Lu, Y.; Han, S.; 和 Chen, Y. 2026. LongLive: 实时交互式长视频生成。 在国际学习表征会议 (ICLR)。 Yang, S.; Xi, H.; Zhao, Y.; Li, M.; Zhang, J.; Cai, H.; Lin, Y.; Li, X.; Xu, C.; Chen, J.; Han, S.; Keutzer, K.; 和 Sto- ica, I. 2025a. Sparse VideoGen2: 通过语义感知排列利用稀疏注意力加速视频生成。 在神经信息处理系统进展 (NeurIPS)。 Yang, Z.; Teng, J.; Zheng, W.; Ding, M.; Huang, S.; Xu, J.; Yang, Y.; Hong, W.; Zhang, X.; Feng, G.; 等. 2025b. CogVideoX: 具有专家 Transformer 的文生视频扩散模型。在国际学习表征会议 (ICLR)。 Yi, J.; Jang, W.; Cho, P. H.; Nam, J.; Yoon, H.; 和 Kim, S. 2026. Deep Forcing: 利用深度 Sink 头和参与式压缩进行免训练的长视频生成。在机器学 习国际会议 (ICML) 论文集。 Yin, T.; Gharbi, M.; Zhang, R.; Shechtman, E.; Durand, F.; Freeman, W. T.; 和 Park, T. 2024. 具有分布匹配蒸馏的单步扩散。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。 Yin, T.; Zhang, Q.; Zhang, R.; Freeman, W. T.; Durand, F.; Shechtman, E.; 和 Huang, X. 2025. 从缓慢的双向到快速的自回归视频扩散模型。 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。 Zhang, P.; Chen, Y.; Su, R.; Ding, H.; Stoica, I.; Liu, Z.; 和 Zhang, H. 2025a. 使用滑动图块注意力实现快速视频生成。在国际会议 机器学习 (ICML) 论文集。 Zhang, P.; Huang, H.; Chen, Y.; Su, R.; Liu, Z.; Stoica, I.; Xing, E.; 和 Zhang, H. 2025b. VSA: 使用可训练稀疏注意力实现更快的视频扩散。 在神经信息处理系统 进展 (NeurIPS)。 Zhang, R.; Isola, P.; Efros, A. A.; Shechtman, E.; 和 Wang, O. 2018. 深度特征作为感知度量的不合理有效性。 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。 Zhang, Z.; Sheng, Y.; Zhou, T.; Chen, T.; Zheng, L.; Cai, R.; Song, Z.; Tian, Y.; Ré, C.; Barrett, C.; Wang, Z.; 和 Chen, B. 2023. H2O: 用于高效生成性
10
第 11 页
附录 B 头原型分布与理论计算节省
在本附录中,我们提供额外的细节和结果,包括:
- 每个头的注意力模式可视化(附录 A)。
- 完整的头原型分布及理论 FLOPs 分析(附录 B)。
- 每种方法的 KV 缓存内存成本(附录 C)。
- 一次性分类开销(附录 D)。
- 块边界不连续性指标及进一步的帧间闪烁比较(附录 E)。
- 关于 Self-Forcing(5 秒)和 LongLive(30 秒)的额外定性结果(附录 F)。
- 用户研究协议(附录 G)。
A 每个头的注意力模式可视化
为了补充图 1 中的四种头原型,我们在图 7 和图 8 中放大了每种原型的一个代表性头——这些头与图 1 中的示例不同。每个头占据两行(上:解码第 6 帧;下:第 18 帧),以及三列:原始注意力图、其逐帧(时间)聚合和逐位置(空间)聚合,均在最大噪声步(t = 1000)下。比较这两行表明,每个头从第 6 帧到第 18 帧都保持其原型——这是图 6 中定量稳定性的视觉对应物,从而允许我们在单个去噪步骤中进行一次性分类。
Sink 头(图 7,顶部)将其不成比例的注意力质量集中在第一个缓存块上,而空间视图没有显示出连贯的局部结构——质量落在几个分散的空间位置上——因此这些头对当前步骤贡献的位置特定信息很少。对于所示的头(Layer 23, Head 2),该块的领先帧在第 6 帧解码时接收了 38% 的质量,并且在第 18 帧解码时仍然是主导帧(15%,大约是均匀份额的 3 倍)。
Dummy 头(图 7,中间)坍缩到当前块:几乎所有注意力质量都落在其帧上(每帧约 33%),每个查询几乎专门关注其自己的帧,而对较旧历史的权重可忽略不计,因此这些头仅读取缓存的恒定大小尾部,是服务成本最低的之一。
Spatial 头(图 7,底部)不锁定到单个帧;相反,原始图揭示了带状、近对角线结构,其中每个查询 token 关注跨缓存帧复制的固定局部邻域。逐位置(空间)视图使这种局部性显式化。
Global 头(图 8)在所有缓存帧和所有空间位置上广泛分散其注意力,没有任何单个帧超过总质量的约五分之一。这些头携带了 HeadCast 通过将其路由到全注意力路径而显式保留的长程时间上下文。
我们报告默认配置下的完整四向头分布,并利用它将 HeadCast 的加速归因于其组成的原型。与表 4 中合并的 Temp./Spat. 列(将 Sink 和 Dummy 折叠为单个时间组)不同,表 6 给出了在默认配置下 LongLive 在不同分辨率下的完整 Sink/Dummy/Spatial/Global 计数——这是下面 FLOPs 分析的运行示例;所有 30 × 12 = 360 个头都被计入。
| Resolution | Sink | Dummy | Spatial | Global | | :— | :— | :— | :— | :— | | 480P | 1.6 | 93.8 | 168.2 | 96.5 | | 720P | 1.9 | 98.2 | 167.2 | 92.7 | | 1080P | 1.5 | 91.7 | 203.2 | 63.7 |
表 6:头原型分布(LongLive,默认 t=1000)。计数基于 360 个头(30 层 × 12 个头);条目为均值,由于四舍五入,可能不完全加总为 360。
理论计算节省。单个头的注意力 FLOPs 由其两个矩阵乘法主导——$QK^\top$ 和 $\text{softmax} V$——总计 $4 B L_q L_k d_{\text{head}}$。因为下面的每个比较都是比率,这个常数因子会抵消,所以我们将其省略,并将成本写为 $B L_q L_k d_{\text{head}}$。在我们的推理配置中,每个块的序列长度为 $L$,因此查询块有 $L_q = L$ 并关注长度为 $L_k = WL$ 的窗口。以 LongLive 的 30 秒滑动窗口作为具体示例(W=8:7 个缓存块加上当前块),全注意力(Global)头的成本因此为 $8BL^2d$。每个原型以不同方式降低此成本:
- Sink 仅关注第一个(sink)块和当前块:$8BL^2d \rightarrow 2BL^2d$(减少 75%)。
- Dummy 仅关注前一个块和当前块:$8BL^2d \rightarrow 2BL^2d$(减少 75%)。
- Spatial 将每个查询限制为其自己的固定 $10 \times 10$ 单元格,在 480P(30 × 52 潜在网格)下覆盖帧的 $\approx 1/61$:$8BL^2d \rightarrow \frac{12}{61}BL^2d$(在 480P 下减少 $\approx 94\%$,在更高分辨率下减少更多,因为固定大小的单元格覆盖帧的较小比例)。
- Global 保持不变:$8BL^2d$(减少 0%)。
对测量的分布进行积分,注意力 FLOPs 比率为 $\frac{2N_s + 2N_d + 8N_{sp} + 8N_g}{8N_{\text{total}}}$,在 480P 下给出约 64% 的减少,且在更高分辨率下增加,因为固定大小的 Spatial 单元格覆盖每个帧的较小比例。
这超过了测量的每块加速(1.62–1.95 倍,即墙钟时间减少 38–49%),该加速是在后分类块上报告的,因此不包含分类成本。与理论 FLOPs 节省的差距有两个来源:注意力只是每块计算的一部分(扩散 MLP 和投影层不受影响),并且 HeadCast 通过单独的注意力内核分发其原型组——每个块大约三次启动,而不是
第 12 页
Sink 头
Layer 23 · Head 2 · temporal (per-frame) view Layer 23 · Head 2 · raw attention map Layer 23 · Head 2 · spatial-position view
Dummy 头
Layer 28 · Head 10 · temporal (per-frame) view Layer 28 · Head 10 · raw attention map Layer 28 · Head 10 · spatial-position view
0.5注意力 token token 3119 归一化 3119 归一化 token 0.5 查询 3119 查询 查询
4679 0.0 4679 0.0 4679 0.0 0 4680 9359 14039 0 1 2 3 4 5 6 7 8 0 519 1039 1559 键 token(缓存窗口) 缓存帧索引 空间位置 (H×W=30×52) 第28层 ⋅ 头10 ⋅ 时间(逐帧)视图 32% 0 第28层 ⋅ 头10 ⋅ 原始注意力图 1.0 0 第28层 ⋅ 头10 ⋅ 空间位置视图 1.0 注意力(%) 4020 32% 0 0 1.0 1560 1560 (当前) (当前) 0.5注意力 (当前) 1560 0.5注意力 token token 3119 归一化 3119 归一化 token 0.5 查询 3119 查询 查询
4679 0.0 4679 0.0 4679 0.0 0 10920 21839 32759 0 2 4 6 8 10 12 14 16 18 20 0 519 1039 1559 键 token(缓存窗口) 缓存帧索引 空间位置 (H×W=30×52)
空间头 第27层 ⋅ 头1 ⋅ 时间(逐帧) 视图18% 20% 0 第27层 ⋅ 头1 ⋅ 原始注意力图 1.0 0 第27层 ⋅ 头1 ⋅ 空间位置视图 1.0 注意力(%) 20 0 0 1.0 1560 1560 (当前) (当前) 0.5注意力 (当前) 1560 0.5注意力 token token 3119 归一化 3119 归一化 token 0.5 查询 3119 查询 查询
4679 0.0 4679 0.0 4679 0.0 0 4680 9359 14039 0 1 2 3 4 5 6 7 8 0 519 1039 1559 键 token(缓存窗口) 缓存帧索引 空间位置 (H×W=30×52) 第27层 ⋅ 头1 ⋅ 时间(逐帧)视图 17% 17% 0 第27层 ⋅ 头1 ⋅ 原始注意力图
1.0 0 Layer 27 ⋅ Head 1 ⋅ spatial-position view 1.0 Attn.(%) 20 0 0 1.0 1560 1560 (current) (current) 0.5attention (current) 1560 0.5attention token token 3119 Norm. 3119 Norm. token 0.5 Query 3119 Query Query
4679 0.0 4679 0.0 4679 0.0 0 10920 21839 32759 0 2 4 6 8 10 12 14 16 18 20 0 519 1039 1559 Key token (cache window) Cached frame index Spatial position (H×W=30×52)
图 7:Sink、Dummy 和 Spatial 头。每个原型各选取一个代表性头,每个头占据两行(第 6 帧,然后是第 18 帧)。列:原始图、逐帧(时间)聚合、逐位置(空间)聚合。Sink 头(第 23 层,头 2)集中于第一个缓存块;Dummy 头(第 28 层,头 10)坍缩到当前块;Spatial 头(第 27 层,头 1)关注固定的局部邻域。
12
第 13 页
全局头
Layer 18 · Head 9 · temporal21%(per-frame) view Layer 18 · Head 9 · raw attention map Layer 18 · Head 9 · spatial-position view Attn.(%) 20 17% 0 1.0 0 1.0 1560 1560 (current) (current) 0.5attention 0.5attention token token 3119 Norm. 3119 Norm. Query Query 4679 0.0 4679 0.0 4679 0.0 0 4680 9359 14039 0 1 2 3 4 5 6 7 8 Key token (cache window) Cached frame index Spatial position (H×W=30×52)
Layer 18 · Head 9 · temporal (per-frame) 11% 8% Layer 18 · Head 9 · raw attention map Layer 18 · Head 9 · spatial-position view Attn.(%) 10 0 1.0 0 1.0 1560 1560 (current) (current) 0.5attention 0.5attention token token 3119 Norm. 3119 Norm. Query Query 4679 0.0 4679 0.0 4679 0.0 0 10920 21839 32759 0 2 4 6 8 10 12 14 16 18 20 Key token (cache window) Cached frame index Spatial position (H×W=30×52)
图 8:全局头。一个代表性头占据两行(帧 6 然后帧 18)。列:原始图、逐帧(时间)聚合、逐位置(空间)聚合。全局头(Layer 18, Head 9)将其注意力广泛地分布在整个历史中。
——因此,增加的 kernel 启动开销抵消了部分 FLOPs 的减少。
C KV 缓存内存成本 KV 缓存压缩方法还应缩小内存占用,因此我们报告了全注意力基线、Dummy Forcing 和 HeadCast 的稳态 KV 缓存大小(图 9)。HeadCast 通过限制 Sink 和 Dummy 头保留的历史长度,始终比全注意力缓存更少——在 Self-Forcing 上少约 33%——同时仍保留比 Dummy Forcing 的激进驱逐策略多得多的上下文,这正是使其免于帧间闪烁的原因。
2L tokens(其锚定块加上当前块,减少了 75%),而 Spatial 和 Global 头仍然需要完整的窗口(Spatial 仅对空间维度进行分区,不丢弃任何帧)。因此,预期的稳态 KV 减少量为 $N_s + N_d / N_{total} \times 0.75$。对于 Self-Forcing 分布($N_s + N_d \approx 166/360 \approx 46\%$),这预测了约 34% 的减少,接近图 9 中测量的约 33%。LongLive 的 Sink+Dummy 占比更小,显示出相应较温和的减少。
D 分类开销
由此产生的驱逐效应。
HeadCast 唯一的特定额外成本是一次性分类开销,该开销仅作用于单个自回归块。我们报告的速度提升是在后分类(稳态)块上测量的,因此排除了这一一次性成本;表 7 将其单独量化为总扩散时间的一部分。该开销很小,并且关键在于它会随着 rollout 长度的增加而摊销:在 5 秒的 Self-Forcing 片段中,该开销约为 5–8%,但在旗舰级 30 秒的 LongLive 设置下,该开销降至 1.5% 以下——在 1080P 分辨率下仅为 0.6%。因此,将这一一次性分类纳入端到端指标中,仅会使速度提升略微降低,而在长 rollout 中则可忽略不计。
图 9:全注意力基线、Dummy Forcing 和 HeadCast 的稳态 KV 缓存大小(GB)。HeadCast 在所有设置下的缓存量均少于全注意力(在 Self-Forcing 设置下少约 33%),同时保留了比 Dummy Forcing 多得多的历史信息。
理论上的 KV 缓存缩减。使用 W 块窗口(W=8),全头缓存 WL 个 token。HeadCast 按原型保留 KV:Sink 头和 Dummy 头仅保留
13
第 14 页
E 帧间闪烁
一种块边界不连续性度量。由缓存驱逐引起的闪烁是局部的:它表现为在自回归块边界处内容的突然变化,此时滑动缓存被更新,过期的键被丢弃。我们直接对其进行测量。对于连续解码的帧,我们计算平均绝对像素差异 $d_t = \frac{1}{HW} \sum_{C} \sum_{P} |f_t – f_{t-1}|$,并将块边界不连续性(BBD)定义为块边界帧上的平均 $d_t$ 与块内平均 $d_t$ 的比率。时间上平滑的片段具有 BBD $\approx 1$;大于 1 的值意味着边界处的跳跃超过普通运动——即图 4 中所示的“弹出/弹出”伪影。由于该比率局限于边界,它精确地隔离了 VBench 等帧平均分数所稀释的故障模式。
\begin{tabular}{l c c c c} \hline Setting & Full & HeadCast & Dummy & $\Delta$Dummy \\ \hline Self-Forcing (5s), 480P & 1.192 & 1.192 & 1.323 & +0.131 \\ Self-Forcing (5s), 720P & 1.235 & 1.238 & 1.272 & +0.037 \\ Self-Forcing (5s), 1080P & 1.265 & 1.250 & 1.285 & +0.020 \\ LongLive (30s), 480P & 1.304 & 1.260 & 1.777 & +0.473 \\ LongLive (30s), 720P & 1.245 & 1.242 & 1.536 & +0.291 \\ LongLive (30s), 1080P & 1.232 & 1.166 & 1.395 & +0.163 \\ \hline \end{tabular}
表 8:块边界不连续性(BBD;1.0 表示无边界跳跃,越低越平滑)。HeadCast 在所有设置下均与全注意力基线相匹配,而 Dummy Forcing 的驱逐操作会加剧不连续性——在 30 秒的 LongLive 片段中最为严重。$\Delta$Dummy 是 Dummy 减去 Full 的结果,以全精度计算(因此可能与四舍五入条目之差相差 0.001)。
表 8 通过比较每种加速方法与全注意力,隔离了缓存驱逐的影响。HeadCast 几乎不增加边界不连续性:在 5 秒片段中,其 BBD 等于全注意力基线,而在 30 秒片段中甚至略低(HeadCast – Full $\le 0$ 始终成立)。相反,Dummy Forcing 会加剧这一现象,且加剧程度随 rollout 长度增加——这正是随着缓存被反复驱逐而累积的伪影所预期的结果。在 5 秒片段中,驱逐仅发生几次,超额部分很小(+0.02 至 +0.13);而在 30 秒的时间跨度内,它累积至 +0.16–+0.47(相对 13–36%),在旗舰级长视频 LongLive 设置中达到峰值。因此,闪烁本质上是一个长 rollout 问题,而正是在这里,HeadCast 的显式 Global 头发挥了作用。这一趋势与下面的定性示例以及表 1 中的 PSNR/LPIPS 差距相吻合——这是一种 VBench 聚合分数所稀释,但指标和图表所揭示的伪影。
为了补充图 4 中的示例,我们提供了另外两个并排比较,以隔离由激进缓存驱逐引起的帧间闪烁。每个示例涵盖一个以自回归块边界为中心的五行窗口,此时 Dummy Forcing 的粗粒度驱逐最容易导致结构幻觉或丢失。如前所述,所有三种方法(Dummy Forcing、Full Attention 和我们的 HeadCast)均在 LongLive 设置下从相同的提示运行,分辨率为 720P,且帧索引跨行共享,因此每列在每个方法下显示相同的时间戳。红色方框标记了 Dummy Forcing 行上的感兴趣区域。
在两个示例中,Full Attention 和 HeadCast 保持高亮结构在边界处时间稳定,而 Dummy Forcing 引入了突然的帧到帧变化——这正是降低其 PSNR/LPIPS 的伪影,然而,一旦 VBench 的时间子维度被汇总到聚合分数中,这种影响就被大大冲淡了。
F 额外定性结果
我们将 HeadCast 与全注意力模型逐帧进行比较:在每个块中,顶行是全注意力,底行是 HeadCast,以相等间隔采样五帧。所有提示均取自 MovieGen (Polyak et al. 2024) 提示集(与主论文中用于 VBench-Long 评估的套件相同)。在 5 秒的 Self-Forcing (720P; 图 11 和 12)——霓虹灯照亮的东京街道、咖啡杯中的船、雪中的小狗——尽管 HeadCast 的 KV 缓存小得多,但两行几乎完全相同。
更长的 30 秒 LongLive 设置 (720P; 图 13 和 14) 是一个更难的测试,但 HeadCast 在整个 rollout 过程中仍与基线相匹配。
G 用户研究协议
为了用人类判断补充自动指标,我们基于双择一强制选择(2AFC)协议运行用户研究。在每个问题中,参与者会看到两个由相同提示生成的视频,并回答一个问题——你更喜欢哪个视频?——选择看起来更真实、更自然、可见伪影更少的视频。我们故意收集整体偏好,而不是将判断分散到各个子维度:我们方法所针对的伪影——帧间闪烁和块边界处的结构漂移——会降低整体观看体验,而不是任何单一属性,因此强制性的整体选择是衡量观众更愿意观看哪个视频的最直接措施。
我们在两种直接对抗设置中评估 HeadCast:
- HeadCast vs. Full Attention,测试我们的加速是否保留了未修改模型的质量;
- HeadCast vs. Dummy Forcing,这是最直接的无训练基线,测试我们的头特定驱逐是否产生比激进驱逐更明显的视频。
对于每种设置,我们生成了 160 对相同提示的对,涵盖两种片段长度——128 个短片段(5 秒)和 32 个长片段(30 秒)——每对共享提示和种子,因此唯一的区别是注意力路径。提示是从 Movie Gen 提示套件中均匀随机采样的。然后,我们将 160 对按长度分层随机分配给 10 组,因此分组是无偏的,同时每组仍保持可比的混合(约 12–13 个短片段和 3–4 个长片段)。每组由两名不同的标注员在两轮独立评分中进行评分,每对给出两票(每种设置约 320 票),总共 20 名参与者。
第 15 页
第103帧 第104帧 第105帧 第106帧 第107帧
Dummy Forcing
Full Attention
HeadCast
(a) 山路场景:在Dummy Forcing下,右侧的松树(红框)在第105帧的块边界处突然闪烁出现和消失。
第79帧 第80帧 第81帧 第82帧 第83帧
Dummy Forcing
Full Attention
HeadCast
(b) 火车车窗场景:在Dummy Forcing下,透过车窗看到的樱花(红框)在第81帧的块边界处闪烁。
图10:AR块边界处的额外帧间闪烁示例(LongLive,30秒,720P)。每个五帧窗口以块边缘为中心。Dummy Forcing的激进缓存驱逐引入了框定区域内帧与帧之间的突然变化,而Full Attention和我们的HeadCast则保持了场景的时间一致性。
在每一对中,两个视频以随机顺序显示为视频1/视频2,槽位到方法的映射被隐藏并单独存储,因此研究是完全双盲的;每个问题都是严格的二选一强制选择,没有“平局”选项。我们报告优先选择HeadCast而非其对手投票的百分比(超过50% favor HeadCast);结果见第5.4节。
15
第 16 页
第 0 帧 第 20 帧 第 40 帧 第 60 帧 第 80 帧
全 注意力
HeadCast
(a) 一位时尚女性走在霓虹灯闪烁的东京街头。
第 0 帧 第 20 帧 第 40 帧 第 60 帧 第 80 帧
全 注意力
HeadCast
(b) 两艘海盗船在咖啡杯中激战。
图 11:Self-Forcing 5s (720P) 上的其他定性结果,第 1 部分。从上到下各行:全注意力 (Full Attention)、HeadCast。 在 5 秒片段中均匀采样五帧。
第 0 帧 第 20 帧 第 40 帧 第 60 帧 第 80 帧
全 注意力
HeadCast
(a) 无人机环绕阿马尔菲海岸一座历史悠久的教堂盘旋拍摄。
第 0 帧 第 20 帧 第 40 帧 第 60 帧 第 80 帧
全 注意力
HeadCast
(b) 金毛猎犬幼犬在雪中玩耍。
图 12:Self-Forcing 5s (720P) 上的其他定性结果,第 2 部分。从上到下各行:全注意力 (Full Attention)、HeadCast。 在 5 秒片段中均匀采样五帧。
16
第 17 页
第 0 帧 第 125 帧 第 250 帧 第 375 帧 第 500 帧
全 注意力
HeadCast
(a) 点燃的蜡烛旁的一只猫鼬小雕像。
第 0 帧 第 125 帧 第 250 帧 第 375 帧 第 500 帧
全 注意力
HeadCast
(b) 玻璃罩内的一个微型人偶。
图 13:LongLive 30s (720P) 上的其他定性结果,第 1 部分。从上到下的行:全注意力(Full Attention),HeadCast。在 30 秒的片段中均匀采样五帧。
第 0 帧 第 125 帧 第 250 帧 第 375 帧 第 500 帧
全 注意力
HeadCast
(a) 竹林生态箱中的小熊猫。
第 0 帧 第 125 帧 第 250 帧 第 375 帧 第 500 帧
全 注意力
HeadCast
(b) 一位老人在城市街道上行走。
图 14:LongLive 30s (720P) 上的其他定性结果,第 2 部分。从上到下的行:全注意力(Full Attention),HeadCast。在 30 秒的片段中均匀采样五帧。
17