流式视频生成提速秘诀:Ms. Forcing 如何用多尺度注意力打破延迟瓶颈

核心贡献

传统流式视频生成模型受限于嵌套去噪循环,导致高延迟和不稳定。Ms. Forcing 通过 Multi-Scale Patchification 和 Multi-Scale Self-Attention 适应噪声水平,减少冗余计算。结合 Homogeneous-Noise-Level DMD,解决训练推理失配问题。实验显示其在长视频生成中保持高质量,同时实现实时推理。注意:KV-cache 更新开销可能部分抵消计算增益。

流式HOI视频生成:解决长视频交互漂移的内存自适应方案

论文代表图:figure-01-p001-01

StreamHOI针对流式HOI视频生成中固定内存预算下的长期身份漂移与短期运动不连续问题,提出偏置引导的内存专业化训练(B-MST)与记忆距离缩放(MDS)。通过离线块分析将Transformer块分类,动态分配Sink/Local内存比例,并修正Temporal RoPE以增强早期交互状态访问。实验显示在GeoHOI和HOMA测试集上优于双向方法,FPS达17.6。需注意评估基于VLM多维二进制指标,且依赖离线预处理步骤。