HeadCast:免训练注意力头路由,实现自回归视频生成的高效推理
本文分析HeadCast框架,解决自回归(AR)视频生成中KV缓存无限增长导致的O(L^2)计算瓶颈。现有免训练方法如Dummy Forcing通过激进驱逐缓存导致帧间闪烁,而HeadCast通过一次性Online Classification将注意力头划分为Sink、Dummy、Spatial和Global四种原型,并重构异构KV缓存。实验显示,在Self-Forcing和LongLive模型上,HeadCast在720P下加速1.62倍,1080P下加速1.95倍,且VBench质量与Full Attention基线相差在0.15分以内,显著优于Dummy Forcing。注意PSNR/L