HeadCast:免训练注意力头路由,实现自回归视频生成的高效推理

HeadCast四阶段流程

本文分析HeadCast框架,解决自回归(AR)视频生成中KV缓存无限增长导致的O(L^2)计算瓶颈。现有免训练方法如Dummy Forcing通过激进驱逐缓存导致帧间闪烁,而HeadCast通过一次性Online Classification将注意力头划分为Sink、Dummy、Spatial和Global四种原型,并重构异构KV缓存。实验显示,在Self-Forcing和LongLive模型上,HeadCast在720P下加速1.62倍,1080P下加速1.95倍,且VBench质量与Full Attention基线相差在0.15分以内,显著优于Dummy Forcing。注意PSNR/L

TANGO:测试时噪声引导自适应,解决自回归视频生成的终端点崩溃问题

方法概述:TANGO噪声引导自适应

本文提出TANGO方法,针对自回归视频扩散模型在生成长视频时出现的“终端点”崩溃问题。该方法利用扩散模型作为评判者,通过预测下一步并检查噪声残差是否符合各向同性高斯分布来识别终端点,并在测试时通过约束优化更新参数以偏离终端点。实验显示,在VBench基准上总分提升3.1%,15秒视频平均FVD降低28.3%。需注意,该方法依赖预训练模型流形中存在有效解,且会增加推理时间。

FilmGPT:用自回归Transformer学习电影剪辑语法

方法:离散标记与自回归框架

本文提出FilmGPT,一种基于自回归Transformer的电影剪辑模型。它将电影表示为离散视频标记和显式⟨CUT⟩标记的序列,通过滑动窗口注意力和音频条件约束进行训练。推理时采用素材约束解码算法,确保生成的镜头严格来自输入素材。在AVE数据集上,Acc@1达到53.9%,优于SOTA方法UQNet。用户研究显示,FilmGPT在连贯性和电影感上优于Transcript2Video和EditDuet。模型存在上下文长度限制,且无法直接处理L-cut/J-cut等音频主导技巧。

Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积

方法概览:Cycle-World框架

自回归视频模型在长时域生成中面临严重的误差累积(Error Accumulation)和生成漂移(Generative Drift),导致结构崩塌和主体身份丢失。Cycle-World提出基于时间可逆性的框架,通过训练时的循环一致性学习(CCL)和推理时的循环引导推理(CGI)来抑制这些问题。实验显示,在VBench基准上,60秒生成的Total Score达到82.88,优于LongLive的82.62,且在VideoPhy物理一致性评估中表现最佳。需注意CGI策略可能增加推理延迟,且循环损失权重需仔细调优。

OPSD-V:自回归视频长程退化问题的策略内自蒸馏解决方案

论文代表图:figure-01-p002-01

自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。OPSD-V通过策略内自蒸馏,利用真实长视频数据作为特权上下文,对少步生成器进行后训练。实验显示,该方法在MovieGenBench和MeiBench上显著提升了质量分数和动态程度,用户研究也证实其在运动质量和视觉质量上的优势。需注意语义匹配可能略有下降,且依赖高质量长视频数据。