快速导读:提出无需训练的FreqForcing框架,通过频谱自锚定(SSA)抑制自回归视频生成中的低频能量漂移,实现从5秒到2分钟的稳定长视频生成。
自回归视频扩散模型通过缓存历史帧的键值对(KV cache)实现流式长视频生成,但因果注意力机制将不完美的历史帧反复输入,导致误差累积,表现为颜色漂移、运动停滞和视觉崩溃。现有方法如attention sink通过保留初始token稳定注意力分布,可以缓解但无法根除这一问题。
FreqForcing从频域角度揭示了误差累积的本质——低频能量漂移。通过短时傅里叶变换(STFT)分析,论文发现自回归生成过程中,视频的直流分量和低频能量会随时间持续漂移,而attention sink仅能减缓漂移速度,无法完全抑制。基于这一洞察,FreqForcing提出频谱自锚定(SSA),通过双分支注意力与频域融合,显式校正频谱能量,实现从5秒到2分钟的稳定长视频生成。
英文题目:FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
论文出处:arXiv 每日论文精选 · arXiv:2607.27110
原始论文:PDF / 论文页面
对应视频标题:FreqForcing:用频谱自锚定根治自回归视频生成的色彩漂移|推荐指数:★★★★★
这篇论文解决什么问题?
自回归视频扩散模型(如Self-Forcing)通过自滚动训练缩小训练-测试差距,在推理时缓存历史帧的KV cache以支持因果注意力。然而,因果注意力将不完美的历史帧反复输入,导致误差在长时域中持续累积。
attention sink是一种常用的缓解策略,在KV cache中保留少量初始token以保持全局上下文,稳定注意力分布。论文通过频谱分析发现,attention sink可以减缓低频能量漂移,但无法完全消除。增大attention sink的尺寸(如从3增加到12)可以进一步缓解漂移,但仍存在残余漂移。
Deep Forcing等免训练方法采用深度汇和参与式KV缓存压缩,但存在频谱抖动问题,即频谱能量在生成过程中出现不稳定的波动。这表明现有方法在频域稳定性上仍有不足。
论文通过STFT分析,将自回归视频生成的误差累积问题形式化为频谱能量漂移问题。具体而言,生成视频的直流分量(DC component)和低频能量会随时间偏离初始帧的频谱分布,导致颜色漂移和视觉退化。这一频域视角为后续的SSA方法提供了理论基础。
核心创新
- 从频域角度揭示自回归视频生成中的误差累积表现为低频能量漂移,并分析注意力汇对频谱漂移的缓解作用及局限性。
- 提出频谱自锚定(SSA),通过双分支注意力与频域融合,显式校正自回归生成中的频谱能量漂移。
- 设计锚点缓存策略与时间RoPE对齐,在无需额外训练的情况下将5秒预训练模型外推至2分钟生成(24倍外推)。
方法概览
提出FreqForcing,一种无需训练的推理框架。核心为频谱自锚定(SSA):构建局部注意力分支(保留高频细节)和锚点注意力分支(提供稳定低频引导),在频域通过高斯低通滤波融合两者输出,抑制低频能量漂移。同时采用时间RoPE对齐和仅在早期去噪步应用SSA以控制开销。
- FreqForcing是一种无需训练的推理框架,核心为频谱自锚定(SSA)。SSA包含两个步骤:双分支注意力设计和频域融合。
- 双分支注意力设计:局部注意力分支遵循标准的滑动窗口因果注意力,并保留attention sink以稳定注意力分布,输出Aloc;锚点注意力分支使用高质量锚点帧(从初始生成片段中选取)计算注意力,输出Aanc。锚点帧通过锚点缓存策略选取,缓存容量Nanc=6。
- 频域融合:对Aloc和Aanc分别进行傅里叶变换,使用高斯低通滤波器提取Aanc的低频成分,使用高通滤波器提取Aloc的高频成分,在频域进行融合后逆变换得到Afused。融合权重由超参数λ控制,λ=0.6时在一致性与多样性间取得平衡。
- 高斯低通滤波器的标准差σ控制频域融合的平滑程度。σ=0.125时,Dynamic Degree为59.58,Overall Consistency为20.94,Repetitive Rate为0.749,在一致性与多样性间取得平衡。
- 时间RoPE对齐:在锚点注意力分支中,对锚点帧应用时间RoPE对齐,确保锚点帧的位置编码与当前生成帧的时间位置一致,避免位置编码不匹配导致的注意力偏差。
- SSA仅在早期去噪步(前两步)应用,以控制计算开销。在NVIDIA RTX A6000上,SSA仅增加约16.5%的推理延迟。
- FreqForcing基于Wan2.1-T2V-1.3B和Self-Forcing构建,通过替换推理时的注意力计算模块实现,无需修改模型权重或进行额外训练。
- 与FreeLong等利用频域融合改进双向长视频生成的方法不同,FreqForcing将频域融合思想迁移至自回归自滚动场景,通过双分支注意力设计实现频谱能量的显式校正。
逐图理解论文
失败案例与直觉

图5展示了消融实验的视觉对比。Self-Forcing出现严重的颜色漂移和视觉退化,attention sink(S=12)缓解了颜色漂移但仍不理想,FreqForcing通过保持频谱特征生成视觉稳定的视频。
核心洞察:频谱能量漂移

图3展示了60秒生成过程中潜空间和像素空间的相对频谱能量变化。Self-Forcing在无attention sink时频谱能量迅速崩溃,增大attention sink尺寸可缓解但无法消除漂移。Deep Forcing存在频谱抖动,而FreqForcing稳定了频谱能量。
方法:频谱自锚定

图2展示了FreqForcing的整体框架。SSA包含双分支注意力设计(局部注意力分支和锚点注意力分支)和频域融合两个步骤。重点关注频域融合中高斯低通滤波如何提取锚点注意力的低频成分。
结论与意义

表1展示了VBench-Long基准上60秒和120秒生成的定量对比。FreqForcing在Dynamic Degree和Overall Consistency上均取得最优结果,证明其在运动幅度和时序连贯性上的优势。
局限与结尾

表2展示了频谱锚定参数的消融研究。σ=0.125, λ=0.6时在一致性与多样性间取得最佳平衡,过大取值会增加重复率。
实验如何设计?
- 在VBench-Long基准上进行定量评估,生成60秒和120秒视频,对比训练基方法(Self-Forcing, Rolling Forcing, LongLive)和免训练方法(Infinity-RoPE, Deep Forcing)。
- 评估指标包括Dynamic Degree(衡量运动幅度)、Overall Consistency(衡量时序连贯性)等VBench-Long标准指标。
- 消融研究验证SSA、attention sink及各超参数(σ, λ)的作用,通过频谱能量曲线和视觉对比进行分析。
- 推理效率测试在NVIDIA RTX A6000上进行,报告SSA带来的额外延迟。
- 频谱能量分析基于MovieGen提示集,使用STFT分析生成视频在潜空间和像素空间的频谱能量变化。
- 锚点缓存容量Nanc=6,SSA应用步数为前两步去噪,这些设置为针对当前设置的经验选择。
关键结果与论文证据
- FreqForcing在60秒生成中Dynamic Degree达59.58,Overall Consistency达20.94,均优于所有对比方法(第4页,Table 1)。
- 在120秒生成中Dynamic Degree为58.97,Overall Consistency为20.98,保持最优,证明方法在更长时域上的稳定性(第4页,Table 1)。
- 消融实验中,FreqForcing(含SSA)在60秒的Dynamic Degree为59.58,Overall Consistency为20.94,显著优于无SSA变体(56.85/20.26)和无attention sink变体(44.18/20.00),验证了SSA和attention sink的各自贡献(第7页,Table 3)。
- 超参数消融显示,σ=0.125, λ=0.6时,Dynamic Degree为59.58,Overall Consistency为20.94,Repetitive Rate为0.749,在一致性与多样性间取得平衡(第7页,Table 2)。
- 频谱能量曲线显示,SSA不仅使相对频谱能量更接近初始帧的分布,还有效抑制了频谱能量的时间漂移(第6页,Figure 6)。
- 视觉对比显示,Self-Forcing出现严重的颜色漂移和视觉退化,attention sink(S=12)缓解了颜色漂移但仍不理想,FreqForcing通过保持频谱特征生成视觉稳定的视频(第5页,Figure 5)。
- 与Deep Forcing相比,FreqForcing避免了频谱抖动问题,在频域稳定性上表现更优(第3页,Figure 3)。
- SSA在NVIDIA RTX A6000上仅增加约16.5%的推理延迟,在计算开销可控的情况下实现了显著的生成质量提升(第6页)。
阅读时需要注意
- SSA引入锚点注意力计算,导致约16.5%的额外推理延迟,在实时应用场景中可能成为瓶颈。
- 频谱锚定超参数(σ, λ)需手动调节以平衡时间一致性与内容多样性,过大取值会增加重复率,缺乏自适应调节机制。
- 方法基于Wan2.1-T2V-1.3B和Self-Forcing验证,对其他基模型和自回归框架的泛化性未充分探讨。
- 锚点缓存容量(Nanc=6)和SSA应用步数(仅前两步去噪)为针对当前设置的经验选择,迁移至其他模型时可能需调整。
- 频谱能量分析基于特定提示集(MovieGen),不同数据分布下的频谱漂移模式可能存在差异。
关联工作
- Self-Forcing:基线自回归视频生成方法,通过自滚动训练缩小训练-测试差距,FreqForcing在其上构建并扩展生成时长(第1页)。
- Deep Forcing:免训练长视频生成方法,采用深度汇和参与式KV缓存压缩,但存在频谱抖动问题,FreqForcing在频域稳定性上优于它(第2页)。
- Rolling Forcing:训练基自回归方法,FreqForcing在动态程度和整体一致性上超越它(第4页)。
- LongLive:训练基实时交互长视频生成方法,FreqForcing在动态程度上更优,且无需额外训练(第4页)。
- Infinity-RoPE:免训练方法,通过改进RoPE实现无限视频生成,FreqForcing在动态程度和整体一致性上表现更好(第4页)。
- FreeLong:利用频域融合时间注意力改进双向长视频生成,FreqForcing将其思想迁移至自回归自滚动场景(第3页)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
FreqForcing:基于频谱自锚定的自回归长视频生成
李佳桐1,梁亮2,孔令和1∗,张宇伦1∗ 1上海交通大学,2腾讯混元团队
摘要 自回归视频扩散模型支持实时流式视频生成。然而,自滚动过程中引入的误差会随时间累积,表现为色彩漂移、运动停滞乃至视觉崩溃。本文从频域角度刻画了这一现象:误差累积表现为低频段显著的能量漂移。我们进一步研究了注意力汇在频域中的有效性,发现它通过在一定程度上缓解频谱能量漂移来改善视频质量,但无法完全解决该问题。受上述分析启发,我们提出FreqForcing,一种无需训练的框架,通过频谱自锚定(Spectral Self-Anchoring, SSA)解决长视频生成中的误差累积问题。所提出的SSA利用锚点注意力的低频成分维持长程视觉稳定性,同时通过局部注意力的高频成分保留动态运动。我们的FreqForcing将基于5秒片段预训练的Self-Forcing扩展至两分钟生成,实现了24倍外推。大量实验表明,FreqForcing在定量和定性上均优于现有免训练方法,同时与代表性的基于训练的方法相比仍具竞争力。
引言 视频扩散模型发展迅速,大规模扩散Transformer和视频基础模型如Sora(Brooks et al. 2024)、HunyuanVideo(Wu et al. 2025)和Wan(Wan et al. 2025)已能合成逼真、时序连贯且遵循指令的视频。然而,交互式世界模型(Bruce et al. 2024)和具身决策(Yang et al. 2023)等应用要求低延迟、高吞吐量和在线可控的流式帧生成。 自回归视频扩散模型(Yin et al. 2025;Huang et al. 2025)通过顺序生成帧并复用缓存的键值状态,提供了一种高效的替代方案。特别是,Self-Forcing(Huang et al. 2025)在训练期间执行自回归自滚动以弥合训练-测试差距,实现了具有竞争力的实时流式生成质量。然而,支持流式生成的因果注意力同样将每个片段条件化于不完美的历史,因此误差被反复反馈并随时间累积,表现为视觉崩溃。 现有解决方案分为两类。基于训练的方法(Liu et al. 2025;Zhu et al. 2026;Cui et al. 2026)通过更好的蒸馏策略提升长程稳定性,但计算成本高昂。免训练方法则在推理时进行干预,或改进RoPE(Yesiltepe et al. 2026;Yi et al. 2026;Li et al. 2026b),或采用更有效的KV cache管理策略(Yi et al. 2026;Li et al. 2026a)。然而,这些方法在生成长达数分钟的视频时,仍无法保证视觉质量。 为直观刻画自回归生成过程中的误差累积,我们在预训练Self-Forcing(Huang et al. 2025)的潜空间和像素空间中进行了频域分析。如图3(a)所示,误差累积表现为直流分量和低频段(色调、布局、身份)显著的能量漂移,而高频成分(局部运动、精细细节)则变得不稳定。此外,为进一步证明频谱能量与视觉质量之间的相关性,我们进行了额外实验。
图1:不同自回归视频生成范式对比。原始Self-Forcing(Huang et al. 2025)存在严重的误差累积,而注意力汇可在一定程度上缓解该问题。我们的FreqForcing通过频谱自锚定(SSA)对此进行校正。
第 2 页
频谱锚定 局部KV缓存 局部注意力 3D N-9 N-8 N-7 N-2 N-1 N FFT
注意力汇 锚点Token 当前块
近期Token 当前Token N N-2, N-1, N … 时序RoPE索引
锚点KV缓存 锚点注意力 3D N-6 N-5 N-4 N-3 N-2 N-1 N FFT
3D 融合输出 N 局部-锚点注意力 IFFT
图 2: FreqForcing 概览。FreqForcing 通过频谱自锚定 (Spectral Self-Anchoring, SSA) 消除自回归视频生成中的频谱能量漂移。SSA 包含两个步骤。首先,我们设计局部-锚点注意力分支。局部分支遵循标准的滑动窗口因果注意力,并引入注意力汇以生成 Aloc,而锚点分支则利用高质量锚点帧生成 Aanc。其次,我们采用频谱锚定将 Aloc 的高频成分与 Aanc 的低频成分融合,得到最终的融合输出 Afused。
具体而言,我们将注意力汇融入 KV 缓存融合推理中,并定性考察了推理过程中不同大小的注意力汇如何影响频谱能量漂移。注意力汇由少量初始 token 组成,用于保留全局上下文并稳定注意力分布。它已被证明在 LLM 推理 (Ghadia et al. 2025; Shi et al. 2025; Xiao et al. 2024) 和自回归视频生成 (Liu et al. 2025; Yang et al. 2026) 中均有效。Deep Forcing (Yi et al. 2026) 表明,更大的注意力汇能带来更好的视频质量。图 3 (b) 的结果显示,更大的注意力汇能减缓频谱能量漂移,从而生成更好的视频。然而,仅靠大的注意力汇无法解决能量漂移问题。
受先前工作 (Lu et al. 2024; Lu and Yang 2025; Chen et al. 2026) 及上述分析的启发,我们提出了 FreqForcing,一个无需训练即可通过频谱自锚定 (SSA) 从频谱层面解决长视频生成中误差累积问题的框架。我们的 SSA 在推理时运行两个注意力分支:局部分支保留高频细节和近期变化,而锚点分支提供稳定的低频引导。两个分支的输出在频域中融合,在抑制低频漂移的同时不牺牲动态视觉内容。如图 1 所示,我们的 FreqForcing 通过校正频谱漂移,将偏离的自回归轨迹引导回理想的分布。大量定量和定性结果表明,我们的 FreqForcing 将在 5 秒片段上预训练的 Self-Forcing (Huang et al. 2025) 扩展至稳定的两分钟生成(24 倍外推),并提升了视频一致性。
我们的贡献总结如下:
• 我们分析了自回归视频扩散过程中误差累积与频谱能量之间的关系。 • 我们提出了 FreqForcing,一个无需训练的框架,通过频谱自锚定 (SSA) 解决频谱能量漂移问题。我们的 SSA 在频域中融合局部和锚点注意力输出,以在自回归自展开过程中稳定视觉质量。 • 大量实验表明,FreqForcing 能够实现稳定的长视频生成,超越了最先进的免训练方法,同时与基于训练的方法相比仍具竞争力。
相关工作
自回归视频生成。原生自回归模型 (Teng et al. 2025; Chen et al. 2025; Ruhe et al. 2024; Deng et al. 2025) 在因果时序依赖下顺序生成帧或视频块,但通常需要大量计算资源进行训练。基于蒸馏的方法 (Yin et al. 2025; Huang et al. 2025; Yang et al. 2026; Liu et al. 2025; Zhu et al. 2026) 则将预训练的多步双向教师模型适配为少步因果学生模型,继承了强大的视觉先验,实现了实时流式生成,且所需训练开销更少。FreqForcing 无需额外训练即可增强自回归视频生成的能力。
语言与视频模型中的注意力汇。注意力汇 (Xiao et al. 2024; Gu et al. 2025) 首次在自回归语言模型中被发现,其中少量初始 token 被保留在滚动 KV 缓存中,以在长序列中保留全局上下文。近期关于自回归视频生成的研究
第 3 页
(a) 无 Attention Sink (b) 有 Attention Sink
崩塌!
漂移! 抖动!
图 3: 60秒生成过程中,潜在空间与像素空间中相对频谱能量变化的示意图,包括直流分量、低频能量和高频能量。(a) 当缺少 attention sink 时,Self-Forcing (Huang et al. 2025) 的相对频谱能量迅速崩塌。(b) 我们研究了不同 attention sink 大小 S ∈{3, 12} 下的 Self-Forcing。增大 S 在一定程度上缓解了时序漂移,但并未完全消除。此外,Deep Forcing (Yi et al. 2026) 存在频率抖动问题。我们的 FreqForcing 稳定了频谱能量,并生成了视觉上稳定的视频。
视频生成 (Li et al. 2026b; Yang et al. 2026; Yi et al. 2026) 同样观察到 attention sink 在稳定生成视频帧方面起着关键作用。本文通过频域能量分析,展示了 attention sink 的有效性,表明它通过缓解频谱能量漂移来保持视觉质量。
视频生成的频域引导。频域引导在视频生成中已被广泛探索。FreeU (Si et al. 2024) 在无需重新训练的情况下,重新平衡了去噪 U-Net 中的低频和高频特征。FreeInit (Wu et al. 2024) 通过保留初始噪声的低频成分并重采样高频成分,迭代地优化初始噪声,而 FreqPrior (Yuan et al. 2025) 改进了这种频率滤波噪声设计,以更好地保留细节并逼近标准高斯分布。FreeLong (Lu et al. 2024) 利用 SpectralBlend 时序注意力来改进长视频生成。然而,这些方法均作用于双向视频生成模型。相比之下,FreqForcing 在自回归自展开过程中执行频域融合,从而实现了无需训练的长视频生成。
预备知识
自回归视频扩散模型。自回归视频扩散模型基于先前生成的帧预测下一帧,每次预测都被形式化为一个扩散去噪过程。令 {t0, t1, . . . , tT } 表示去噪调度,其中 t0 = 0,tT = 1000。在 VAE 编码的潜在空间中,N 帧潜在视频的联合分布被分解为: N−1 pθ x[0,N)t0 | c = pθ x0t0 | c Y pθ xit0 | x[0,i)t0 , c , (1) i=1 其中 c 表示上下文。对于第 i 个潜在帧,从噪声水平 tj 到 tj−1 的转换由下式给出: xitj−1 = Ψ Gθ xitj, tj, x[0,i)t0 , c , tj−1 (2) ≈Ψ Gθ xitj, tj, Φswi , c , tj−1 , 其中 Gθ 是去噪模型,Ψ 表示前向扩散算子。在实践中,完整的生成历史 x[0,i)t0 由一个固定容量的滑动窗口 KV cache Φswi 来近似。
Self-Forcing。Teacher Forcing (Jin et al. 2025) 和 Diffusion Forcing (Chen et al. 2024) 在真实分布上训练模型,这导致了训练-测试差距。相比之下,Self-Forcing (Huang et al. 2025) 在训练期间用模型自身生成的帧填充 KV cache。这种设计缩小了训练-测试差距,并缓解了曝光偏差。Self-Forcing 进一步采用了四步去噪过程,显著降低了采样延迟,并实现了实时流式视频生成。
带 Attention Sink 的滑动窗口因果注意力。公式 (2) 中的缓存 Φswi 维护一个大小为 w 的局部窗口,当前块占据最新的 f 个位置。当使用 attention sink 时,我们将可见窗口的前 s 个位置保留给汇帧,可用的近期上下文被限制为前 w−f−s 帧。使用
第 4 页
动态程度↑ 运动平滑度↑ 整体一致性↑ 成像质量↑ 美学质量↑ 主体一致性↑ 背景一致性↑
基于训练的60秒生成
Self-Forcing 33.29 98.45 18.81 66.90 56.77 96.53 96.32 LongLive 41.96 98.77 20.89 69.25 61.23 97.78 96.69 Rolling Forcing 30.95 98.76 20.52 71.15 59.89 98.01 96.77
免训练
Infinity-RoPE 54.61 97.72 18.52 68.91 58.28 96.50 95.53 Deep Forcing 46.17 98.15 20.84 68.12 59.83 97.40 96.53 FreqForcing(本文) 59.58 98.07 20.94 69.52 60.91 97.27 96.47
基于训练的120秒生成
Self-Forcing 27.42 98.34 16.17 61.40 51.22 97.02 96.29 LongLive 41.91 98.79 20.75 68.84 61.47 97.83 96.66 Rolling Forcing 31.30 98.69 20.37 70.72 58.89 97.73 96.57
免训练
Infinity-RoPE 56.12 97.68 17.96 68.15 57.03 96.43 95.44 Deep Forcing 41.78 98.25 20.80 67.58 59.52 97.52 96.59 FreqForcing(本文) 58.97 98.22 20.98 68.89 60.68 97.38 96.47
表1:在VBench-Long(Huang et al. 2024)上的定量对比。所有指标均在60秒和120秒生成结果上报告。最佳结果以粗体高亮,次佳结果以下划线标示。
提示词:一段3D动画,描绘一只小巧、圆润、毛茸茸的生物,有着大大的、富有表现力的眼睛,正在探索一片生机勃勃的魔法森林…… 提示词:一幅迷人的漫画风格插画,描绘了舒适的客厅场景,其中一只毛茸茸的灰猫……
Self-Forcing Self-Forcing
LongLive LongLive
Rolling Forcing Rolling Forcing
Infinity-RoPE Infinity-RoPE
Deep Forcing Deep Forcing
FreqForcing(本文) FreqForcing(本文)
图4:120秒视频的定性对比。我们将FreqForcing与代表性的自回归视频生成方法进行比较。更多细节请参阅补充材料。
绝对帧索引n和汇集合S = {1, 2, . . . , s},第i个块的局部历史集合为: bi = max (s + 1, if − w + s + 1) , (3) Rlocali = {n | bi ≤ n ≤ (i − 1)f} . (4) 带有attention sink的最终上下文变为: Φswi = KV xn0 | n ∈ S ∪ Rlocali . (5) 在每一层计算注意力分数时,可见窗口可排序为: S , Rlocali , Ii , (6) 其中Ii = {(i − 1)f + 1, . . . , if}表示当前块。因此,attention sink被放置在每个局部窗口的最左侧位置,作为持久的锚点token。
方法概述 我们提出了一种新颖的免训练方法,从频域角度缓解自回归视频生成中的误差累积。我们首先将自回归视频生成中的视觉退化表征为频谱能量漂移,并进一步证明attention sink(Liu et al. 2025; Yi et al. 2026)通过部分解决该问题来提升视觉质量。基于上述观察,我们引入了频谱自锚定(Spectral Self-Anchoring, SSA),它利用高质量锚定帧抑制频谱能量漂移。我们的方法如图2所示。
频域中的误差累积 先前研究(Yi et al. 2026; Liu et al. 2025)已观察到流式视频生成容易随时间发生漂移,
第 5 页
(a) Self-Forcing 频谱坍塌 ☹︎
(b) 带 Attention Sink 的 Self-Forcing 频谱漂移 ☹︎
(c) FreqForcing(本文方法)频谱保持 ☺︎
图 5: 消融实验的可视化对比。(a) Self-Forcing (Huang et al. 2025) 存在严重的颜色漂移和视觉消退问题。 (b) 使用 attention sink 大小 S = 12 的 Self-Forcing 缓解了颜色漂移,但由于频谱漂移,结果仍不理想。 (c) 本文提出的 FreqForcing 通过保持频谱特征,生成了视觉上稳定的视频。
为了全面理解这一现象,我们从频域角度提供解释。遵循 Self-Forcing (Huang et al. 2025) 的方法,我们使用从 MovieGen (Polyak et al. 2024) 采样的提示词生成 60 秒视频。在生成过程中,我们记录每个 DiT (Peebles and Xie 2023) 层的 Self-Attention (Vaswani et al. 2017) 输出以及对应的像素帧。然后,我们对这些序列应用短时傅里叶变换 (STFT) (Allen 1977),以追踪频带能量随时间的变化。如图 3 (a) 所示,在频域中,误差累积表现为直流和低频波段能量的明显漂移。这是因为滚动 KV cache 仅保留近期的不完美帧,这些帧与最初生成的高质量帧偏差显著,这种机制最终导致了视觉坍塌。
先前工作已证明 attention sink 对自回归视频扩散有效 (Yang et al. 2026; Liu et al. 2025)。因此,我们分析了使用不同大小 attention sink 的 Self-Forcing 所生成视频的频谱能量。为与先前工作 (Liu et al. 2025) 在推理时保持一致,我们进一步调整了时间 RoPE (Su et al. 2024),以使 attention sink 与当前滑动窗口对齐。结果如图 3 (b) 所示,引入 attention sink 抑制了自注意力输出和像素空间帧中的频谱能量漂移。此外,更大的 attention sink 能更好地保持频谱能量,从而更显著地提升视频质量。图 5 中的定性结果证实,attention sink 明显改善了生成质量。
我们还在图 3 中额外比较了 Deep Forcing (Yi et al. 2026) 和我们的 FreqForcing。由于其参与式的 KV cache 压缩,Deep Forcing 在其注意力输出的频谱能量中表现出显著的抖动,这在像素空间帧中表现为突然的时序闪烁。这种现象严重降低了视频质量。相比之下,FreqForcing 在长时域推理过程中未表现出明显的频谱能量漂移,因此在像素空间中保持了更高的视觉质量和更好的时序一致性。
Spectral Self-Anchoring
动机。 虽然 attention sink 通过保留持久的锚点 token 缓解了上下文遗忘,但我们可以在图 5 (b) 中观察到,在生成长达一分钟的视频时,仍会出现不理想的细节退化。这是因为 attention sink 通过影响注意力来隐式引导模型输出。然而,一旦近期 token 被错误的模型输出破坏,它就无法有效纠正生成轨迹,最终导致频谱漂移。因此,需要更强的引导。基于上述观察,我们提出了频谱自锚定 (Spectral Self-Anchoring, SSA),它包含两个步骤:局部-锚点注意力分支和频谱锚定。我们的 SSA 不仅提供高质量的历史上下文,还能显式地稳定生成帧随时间的频谱能量。
局部-锚点注意力分支。 我们的方法采用双分支推理范式,由局部注意力和锚点注意力组成。局部注意力使用配备深度 attention sink 的滑动窗口执行注意力计算:
A_loc = Softmax(QK^⊤_loc / √d) V_loc. (7)
相比之下,当生成的视频长度未超过预训练范围时,不计算锚点注意力分支。相反,它维护一个锚点缓存,该缓存收集在预训练时域范围内生成的高质量帧,并在缓存填满后将其冻结。具体来说,锚点
第 6 页
缓存容量为 Nanc = 6。每生成三个潜变量帧,就有一个被追加到锚点缓存中。一旦缓存达到容量上限,更新即停止。当推理长度 Lgen 超过预训练长度 Lpre = 21 时,模型开始计算锚点注意力:
0, Lgen ≤Lpre, Aanc = QK⊤anc (8) Softmax √ Vanc, Lgen > Lpre. d
频谱锚定。在获得局部注意力 Aloc 和锚点注意力 Aanc 之后,我们通过频谱锚定修正局部注意力的低频成分,从而得到融合后的注意力输出 Afused。当推理长度超出预训练范围时,具体过程如下: 图 6:SSA 的有效性。SSA 不仅使相对频谱能量更接近初始帧的水平, ˆAloc = F3D(Aloc), ˆAanc = F3D(Aanc), (9) 还有效抑制了其时间漂移。 Hlp(kt, kxy) = exp −k2t −∥kxy∥2 , (10) 2σ2t 2σ2xy 首先,我们利用去噪过程由粗到精的特性。先前的研究(Balaji 等,2022;Cao 等,2023)观察到,潜变量扩散模型在去噪的不同阶段合成不同层次的视觉内容:全局场景布局和物体结构在早期的高噪声步骤中建立,而细粒度细节则在后续步骤中显现。由于低频锚定在全局布局形成时最为有益,因此在整个轨迹中全程应用 SSA 是不必要的。因此,我们将 SSA 限制在 Self-Forcing 的前两个去噪步骤(即 t4 = 1000 和 t3 = 937),这足以使整体布局和物体外观与锚定的低频引导对齐,从而保持长程时序一致性。其次,我们设置锚点缓存大小 Nanc = 6,这进一步减少了额外的注意力计算。
ˆAfused = (1 −λHlp)ˆAloc + λHlp ˆAanc (11) 通过上述设计,在 NVIDIA RTX A6000 GPU 上,SSA 相较于 Self-Forcing(Huang 等,2025)仅增加约 16.5% 的推理延迟,却成功地将基于 5 秒片段训练的 Self-Forcing 扩展到分钟级视频生成(即 24 倍外推)。 = ˆAloc + λHlp(ˆAanc −ˆAloc),
Afused = F−13D (ˆAfused), (12) 实验 其中,F3D 表示在空间和时间维度上的快速傅里叶变换,F−13D 是将融合特征从频域转换回来的快速傅里叶逆变换,Hlp 表示时空高斯低通滤波器,其中 σxy 和 σt 分别控制空间和时间滤波的频率范围。标量 λ ∈[0, 1] 是控制低频锚定强度的系数:正如公式 (11) 的第二行所明确表示的,λHlp 作为一个频率选择性门,将来自锚点注意力的低频残差 (ˆAanc −ˆAloc) 注入到局部注意力中。设置 λ = 0 将恢复原始的局部注意力 Aloc,而更大的 λ 则会将 Afused 的低频成分逐步拉向锚点注意力 Aanc 的低频成分,从而抑制频谱能量漂移。
时间 RoPE 对齐。现代视频扩散 DiT(Wan 等,2025)通常使用 3D RoPE 进行相对位置编码。随着生成帧的索引增加,它们与汇帧的距离最终会超出预训练范围,并产生不自然的伪影。为解决此问题,我们采用了与先前工作(Liu 等,2025)相同的处理方法。如图 2 所示,我们将局部 KV cache 中的注意力汇帧和锚点缓存中的锚点帧的时间索引都移动到当前窗口之前。此策略将相对时间位置保持在预训练范围内。
效率。我们的 SSA 从两个来源引入计算开销:(a) 锚点注意力计算和 (b) 频谱锚定。由于频谱锚定完全在潜变量空间中操作,其成本可忽略不计。因此,主要开销源于计算锚点注意力,我们通过两项设计选择来削减这部分开销。
实验设置 实现细节。我们采用分块式 Self-Forcing(Huang 等,2025)作为基础模型。遵循 Self-Forcing 的设置,局部注意力 KV cache 和窗口大小均设为 21,注意力汇大小 S = 12;锚点缓存大小设为 Nanc = 6。对于局部注意力和锚点注意力,我们均使用 Rolling Forcing 风格(Liu 等,2025)的时间 RoPE 对齐,以将相对位置保持在预训练范围内。对于频谱锚定,我们设置 σxy = σt = 0.125 和 λ = 0.6,以平衡视觉一致性与动态内容变化。
评估。为评估长视频生成的性能,我们使用 MovieGen(Polyak 等,2024)中的前 128 个提示词,并遵循与 Self-Forcing++(Cui 等,2026)相同的提示词选择协议,每个提示词均如 Self-Forcing(Huang 等,2025)中那样由 Qwen/Qwen2.5-7B-Instruct(Yang 等,2025)进行细化。我们报告
第 7 页
动态性 整体 重复性 方法 动态性↑ 整体↑ 主体↑ 背景↑ σ λ 程度↑ 一致性↑ 比率↓ 60秒生成 60秒生成 Self-Forcing 33.29 18.81 96.53 96.32 0.2 56.48 20.49 0.675 无SSA 56.85 20.26 96.88 96.19 0.4 57.38 20.75 0.714 无Attention Sink 44.18 20.00 97.16 96.38 0.125 0.6(本文) 59.58 20.94 0.749 FreqForcing(本文) 59.58 20.94 97.27 96.47 0.8 59.88 21.12 0.794 0.2 56.58 20.52 0.669 表3:对所提组件的消融研究。 0.4 57.84 20.78 0.717 0.25 0.6 60.17 20.82 0.795 消融研究 0.8 60.94 21.23 0.848 SSA的有效性。我们生成一组60秒视频,并通过定量 0.2 58.04 20.58 0.647 与定性评估验证所提方法的有效性。定量结果见表3。 0.4 59.98 20.92 0.741 0.5 0.6 62.68 21.22 0.841 如表中所示,FreqForcing持续提升整体性能。 0.8 61.64 21.38 0.877 图6显示,与仅使用attention sink相比,我们的SSA有效 表2:频谱锚定参数的消融。我们设σxy = σt = σ,并报告 抑制了生成视频的频谱能量漂移。我们观察到,仅靠 60秒视频上的Dynamic Degree、Overall Consistency和 attention sink无法阻止误差累积,直流能量仍会缓慢漂 Repetitive Rate。 移。我们的SSA有效纠正了自回归推理中的这一误差累 积过程。如图5所示,SSA抑制了局部色彩漂移,使高 质量分钟级视频生成成为可能。
七项VBench-Long(Huang等,2024)指标,以全面评估 我们的方法在60秒和120秒生成上的表现。 超参数消融。我们在表2中报告了超参数σ和λ的消融研 究。为进一步量化内容重复,我们引入了重复率,其值 对比 越高表示生成视频中视觉相似帧的比例越大,反之亦然。 作为参考,Deep Forcing的重复率为0.812。如表中所示, 我们将所提FreqForcing与几种最先进的自回归视频扩散 在特定范围内,增大σ和λ通常能提升动态程度和整体一 模型进行对比。具体而言,我们与基于训练的方法Self- 致性,表明时序连贯性更好。然而,这也会导致更高的 Forcing(Huang等,2025)、Rolling Forcing(Liu等, 重复率,说明在注意力输出中过度注入低频成分可能降 2025)和LongLive(Yang等,2026),以及免训练方法 低视觉多样性。为平衡一致性与多样性,我们在实验中 Infinity-RoPE(Yesiltepe等,2026)和Deep Forcing(Yi 设置σ = 0.125和λ = 0.6。更多消融研究、定性结果和实 等,2026)进行比较。所有方法均基于Wan2.1-T2V-1.3B 验细节见补充材料。 (Wan等,2025)基础模型构建。我们从定量和定性角 度分析结果。 结论
定量结果。如表1所示,FreqForcing在动态程度和整体 本文提出了FreqForcing,一个用于鲁棒自回归长视频生 一致性上取得了最佳性能,同时在其他指标上保持竞争 成的免训练框架。我们的研究揭示了自回归生成中的误 力。这证明了其在分钟级生成中保持长程时序一致性和 差累积在频域表现为能量漂移,并进一步表明attention 动态变化的卓越能力。与基于训练的方法相比,Freq- sink通过抑制这种漂移来提升视觉质量。基于此分析, Forcing无需额外训练即可达到相当或更优的性能。 我们提出频谱自锚定(Spectral Self-Anchoring,SSA), 以进一步缓解频谱能量漂移导致的视觉退化。SSA利用 定性结果。图4展示了不同方法生成的120秒视频的定性 高质量早期帧的低频成分,防止后续帧发生漂移。大量 对比。Self-Forcing(Huang等,2025)和Rolling Forcing 实验表明,我们的FreqForcing显著抑制了低频能量漂移, (Liu等,2025)出现视觉消退,而LongLive存在重复场 实现了免训练的分钟级视频生成(在我们的设置中为24 景。Infinity-RoPE(Yesiltepe等,2026)和Deep Forcing 倍外推)。FreqForcing在动态程度和整体一致性等指标 (Yi等,2026)在一定程度上缓解了漂移,但在运动动 上超越了现有的基于训练和免训练方法,同时在定性对 态和一致性方面仍表现出明显退化。相比之下,Freq- 比中提供了更优的视觉质量。 Forcing生成的视频视觉稳定,色彩一致,运动得以保留, 且伪影减少,证实了我们频谱自锚定的优势。更多视觉 对比见补充材料。
第 8 页
参考文献 Allen, J. B. 1977. Short term spectral analysis, synthesis, and modification by discrete Fourier transform. *IEEE Transactions on Acoustics, Speech, and Signal Processing*. 5 Balaji, Y.; Nah, S.; Huang, X.; Vahdat, A.; Song, J.; Zhang, Q.; Kreis, K.; Aittala, M.; Aila, T.; Laine, S.; et al. 2022. ediff-i: Text-to-image diffusion models with an ensemble of expert denoisers. *arXiv preprint arXiv:2211.01324*. 6 Brooks, T.; Peebles, B.; Holmes, C.; DePue, W.; Guo, Y.; Jing, L.; Schnurr, D.; Taylor, J.; Luhman, T.; Luhman, E.; Ng, C.; Wang, R.; and Ramesh, A. 2024. Video generation models as world simulators. 1 Bruce, J.; Dennis, M. D.; Edwards, A.; Parker-Holder, J.; Shi, Y.; Hughes, E.; Lai, M.; Mavalankar, A.; Steigerwald, R.; Apps, C.; et al. 2024. Genie: Generative interactive environments. In *ICML*. 1 Cao, M.; Wang, X.; Qi, Z.; Shan, Y.; Qie, X.; and Zheng, Y. 2023. Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing. In *ICCV*. 6 Chen, B.; Martí Monsó, D.; Du, Y.; Simchowitz, M.; Tedrake, R.; and Sitzmann, V. 2024. Diffusion forcing: Next-token prediction meets full-sequence diffusion. In *NeurIPS*. 3 Chen, F.; Zhao, S.; Yang, L.; Xu, C.; Luo, Z.; and Lan, L. 2026. FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction. *arXiv preprint arXiv:2605.06509*. 2 Chen, G.; Lin, D.; Yang, J.; Lin, C.; Zhu, J.; Fan, M.; Zhang, H.; Chen, S.; Chen, Z.; Ma, C.; et al. 2025. Skyreels-v2: Infinite-length film generative model. *arXiv preprint arXiv:2504.13074*. 2 Cui, J.; Wu, J.; Li, M.; Yang, T.; Li, X.; Wang, R.; Bai, A.; Ban, Y.; and Hsieh, C.-J. 2026. Self-forcing++: Towards minute-scale high-quality video generation. In *ICLR*. 1, 6 Deng, H.; Pan, T.; Diao, H.; Luo, Z.; Cui, Y.; Lu, H.; Shan, S.; Qi, Y.; and Wang, X. 2025. Autoregressive video generation without vector quantization. In *ICLR*. 2 Ghadia, R.; Kumar, A.; Jain, G.; Nair, P.; and Das, P. 2025. Dialogue without limits: Constant-sized KV caches for extended responses in LLMs. *arXiv preprint arXiv:2503.00979*. 2 Gu, X.; Pang, T.; Du, C.; Liu, Q.; Zhang, F.; Du, C.; Wang, Y.; and Lin, M. 2025. When attention sink emerges in language models: An empirical view. In *ICLR*. 2 Huang, X.; Li, Z.; He, G.; Zhou, M.; and Shechtman, E. 2025. Self forcing: Bridging the train-test gap in autoregressive video diffusion. In *NeurIPS*. 1, 2, 3, 5, 6, 7 Huang, Z.; He, Y.; Yu, J.; Zhang, F.; Si, C.; Jiang, Y.; Zhang, Y.; Wu, T.; Jin, Q.; Chanpaisit, N.; Wang, Y.; Chen, X.; Wang, L.; Lin, D.; Qiao, Y.; and Liu, Z. 2024. VBench: Comprehensive Benchmark Suite for Video Generative Models. In *CVPR*. 4, 7 Jin, Y.; Sun, Z.; Li, N.; Xu, K.; Xu, K.; Jiang, H.; Zhuang, N.; Huang, Q.; Song, Y.; Mu, Y.; and Lin, Z. 2025. Pyramidal Flow Matching for Efficient Video Generative Modeling. In *ICLR*. 3 Li, H.; Liu, S.; Lin, Z.; and Chandraker, M. 2026a. Rolling sink: Bridging limited-horizon training and open-ended testing in autoregressive video diffusion. *arXiv preprint arXiv:2602.07775*. 1 Li, J.; Fu, X.; Peng, X.; Chen, W.; Zheng, Y.; Zhao, T.; Wang, J.; Chen, F.; Wang, X.; and So, H. K.-H. 2026b. Train short, inference long: Training-free horizon extension for autoregressive video generation. *arXiv preprint arXiv:2602.14027*. 1, 3 Liu, K.; Hu, W.; Xu, J.; Shan, Y.; and Lu, S. 2025. Rolling Forcing: Autoregressive Long Video Diffusion in Real Time. *arXiv preprint arXiv:2509.25161*. 1, 2, 4, 5, 6, 7 Lu, Y.; Liang, Y.; Zhu, L.; and Yang, Y. 2024. Freelong: Training-free long video generation with spectralblend temporal attention. In *NeurIPS*. 2, 3 Lu, Y.; and Yang, Y. 2025. Freelong++: Training-free long video generation via multi-band spectralfusion. *arXiv preprint arXiv:2507.00162*. 2 Peebles, W.; and Xie, S. 2023. Scalable diffusion models with transformers. In *ICCV*. 5 Polyak, A.; Zohar, A.; Brown, A.; Tjandra, A.; Sinha, A.; Lee, A.; Vyas, A.; Shi, B.; Ma, C.-Y.; Chuang, C.-Y.; et al. 2024. Movie gen: A cast of media foundation models. *arXiv preprint arXiv:2410.13720*. 5, 6 Ruhe, D.; Heek, J.; Salimans, T.; and Hoogeboom, E. 2024. Rolling diffusion models. *arXiv preprint arXiv:2402.09470*. 2 Shi, D.; Fu, Y.; Yuan, X.; Yu, Z.; You, H.; Li, S.; Dong, X.; Kautz, J.; Molchanov, P.; and Lin, Y. C. 2025. La-Cache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models. In *ICML*. 2 Si, C.; Huang, Z.; Jiang, Y.; and Liu, Z. 2024. FreeU: Free Lunch in Diffusion U-Net. In *CVPR*. 3 Su, J.; Ahmed, M.; Lu, Y.; Pan, S.; Bo, W.; and Liu, Y. 2024. Roformer: Enhanced transformer with rotary position embedding. *Neurocomputing*. 5 Teng, H.; Jia, H.; Sun, L.; Li, L.; Li, M.; Tang, M.; Han, S.; Zhang, T.; Zhang, W.; Luo, W.; et al. 2025. Magi-1: Autoregressive video generation at scale. *arXiv preprint arXiv:2505.13211*. 2 Vaswani, A.; Shazeer, N.; Parmar, N.; Uszkoreit, J.; Jones, L.; Gomez, A. N.; Kaiser, Ł.; and Polosukhin, I. 2017. Attention is all you need. In *NeurIPS*. 5 Wan, T.; Wang, A.; Ai, B.; Wen, B.; Mao, C.; Xie, C.-W.; Chen, D.; Yu, F.; Zhao, H.; Yang, J.; et al. 2025. Wan: Open and advanced large-scale video generative models. *arXiv preprint arXiv:2503.20314*. 1, 6, 7 Wu, B.; Zou, C.; Li, C.; Huang, D.; Yang, F.; Tan, H.; Peng, J.; Wu, J.; Xiong, J.; Jiang, J.; et al. 2025. Hunyuanvideo 1.5 technical report. *arXiv preprint arXiv:2511.18870*. 1 Wu, T.; Si, C.; Jiang, Y.; Huang, Z.; and Liu, Z. 2024. Freeinit: Bridging initialization gap in video diffusion models. In *ECCV*. 3
第 9 页
Xiao, G.; Tian, Y.; Chen, B.; Han, S.; and Lewis, M. 2024. 基于注意力汇的高效流式语言模型。见 ICLR。2 Yang, A.; Li, A.; Yang, B.; Zhang, B.; Hui, B.; Zheng, B.; Yu, B.; Gao, C.; Huang, C.; Lv, C.; 等. 2025. Qwen3技术报告。arXiv预印本 arXiv:2505.09388。6 Yang, S.; Huang, W.; Chu, R.; Xiao, Y.; Zhao, Y.; Wang, X.; Li, M.; Xie, E.; Chen, Y.; Lu, Y.; 等. 2026. Longlive:实时交互式长视频生成。见 ICLR。2, 3, 5, 7 Yang, Z.; Chen, Y.; Wang, J.; Manivasagam, S.; Ma, W.-C.; Yang, A. J.; and Urtasun, R. 2023. Unisim:一种神经闭环传感器模拟器。见 CVPR。1 Yesiltepe, H.; Meral, T.; Akan, A. K.; Oktay, K.; and Yanardag, P. 2026. Infinity-rope:自回归自展开涌现的动作可控无限视频生成。见 CVPR。1, 7 Yi, J.; Jang, W.; Cho, P. H.; Nam, J.; Yoon, H.; and Kim, S. 2026. Deep forcing:基于深度汇与参与式压缩的无训练长视频生成。见 ICML。1, 2, 3, 4, 5, 7 Yin, T.; Zhang, Q.; Zhang, R.; Freeman, W. T.; Durand, F.; Shechtman, E.; and Huang, X. 2025. 从慢速双向到快速自回归视频扩散模型。见 CVPR。1, 2 Yuan, Y.; Guo, Y.; Wang, C.; Zhang, W.; Xu, H.; and Zhang, L. 2025. FreqPrior:利用频率滤波高斯噪声改进视频扩散模型。见 ICLR。3 Zhu, H.; Zhao, M.; He, G.; Su, H.; Li, C.; and Zhu, J. 2026. Causal Forcing:面向高质量实时交互式视频生成的自回归扩散蒸馏正确之道。arXiv预印本 arXiv:2602.02214。1, 2