HeadCast:免训练注意力头路由,实现自回归视频生成的高效推理

HeadCast四阶段流程

本文分析HeadCast框架,解决自回归(AR)视频生成中KV缓存无限增长导致的O(L^2)计算瓶颈。现有免训练方法如Dummy Forcing通过激进驱逐缓存导致帧间闪烁,而HeadCast通过一次性Online Classification将注意力头划分为Sink、Dummy、Spatial和Global四种原型,并重构异构KV缓存。实验显示,在Self-Forcing和LongLive模型上,HeadCast在720P下加速1.62倍,1080P下加速1.95倍,且VBench质量与Full Attention基线相差在0.15分以内,显著优于Dummy Forcing。注意PSNR/L

FilmWorld:通过动态电影世界建模实现 Agentic 小说到电影的生成

FilmWorld核心架构

本文提出FilmWorld,一种将小说生成电影形式化为动态电影世界建模的端到端 Agent 系统。针对长视频生成中的语义漂移和因果不一致问题,FilmWorld采用解耦的构建与演化阶段,通过显式状态追踪和跨镜头动态状态传播,确保长叙事中的视觉连贯性。在FilmEval基准上,FilmWorld在叙事保真度和电影一致性方面全面优于SOTA,且并行执行实现5.62倍加速。需注意,当前系统仅针对1,000-5,000字的中长篇幅小说,且生成质量受限于底层骨干模型。

Surprise Forcing:长视频生成中的记忆保留与跳过策略

方法概览:Surprise Forcing

本文提出Surprise Forcing框架,解决流式自回归扩散模型在长视频生成中的上下文遗忘和计算分配不均问题。通过Surprise-Gated Memory Bank动态管理外部记忆,利用Intra-Chunk Surprise Predictor自适应调整去噪步数。在VBench-Long基准上达到SOTA,主体一致性63.98,FPS达17.18。该方法为免训练推理优化,依赖基础模型性能,适用于对长程一致性要求高的场景。

TANGO:测试时噪声引导自适应,解决自回归视频生成的终端点崩溃问题

方法概述:TANGO噪声引导自适应

本文提出TANGO方法,针对自回归视频扩散模型在生成长视频时出现的“终端点”崩溃问题。该方法利用扩散模型作为评判者,通过预测下一步并检查噪声残差是否符合各向同性高斯分布来识别终端点,并在测试时通过约束优化更新参数以偏离终端点。实验显示,在VBench基准上总分提升3.1%,15秒视频平均FVD降低28.3%。需注意,该方法依赖预训练模型流形中存在有效解,且会增加推理时间。

SlotMem:解决长视频角色漂移的角色可寻址记忆框架

SlotMem核心架构概览

本文介绍SlotMem,一种面向叙事长视频生成的角色可寻址内部记忆框架。针对现有方法在长时隙生成中角色身份漂移及背景纠缠问题,SlotMem基于Wan2.2-I2V-A14B骨干,利用Character-Semantic Probe从交叉注意力中定位角色token,经Memory Encoder压缩为紧凑槽位,并通过Memory Writer保守更新。实验显示其在VBench、ViStoryBench等基准上表现优异,人类偏好研究中主体一致性胜率86.1%。需注意该方法依赖提示词中角色名称的一致性,且在多相似角色同框时存在局限。

Cycle-World:通过反向预测循环一致性缓解长期视频世界模型中的误差累积

方法概览:Cycle-World框架

自回归视频模型在长时域生成中面临严重的误差累积(Error Accumulation)和生成漂移(Generative Drift),导致结构崩塌和主体身份丢失。Cycle-World提出基于时间可逆性的框架,通过训练时的循环一致性学习(CCL)和推理时的循环引导推理(CGI)来抑制这些问题。实验显示,在VBench基准上,60秒生成的Total Score达到82.88,优于LongLive的82.62,且在VideoPhy物理一致性评估中表现最佳。需注意CGI策略可能增加推理延迟,且循环损失权重需仔细调优。