FreqForcing:用频谱自锚定根治自回归视频生成的色彩漂移

方法:频谱自锚定

自回归视频扩散模型在长时域自滚动生成中,误差累积会导致颜色漂移、运动停滞和视觉崩溃。现有attention sink方法可以缓解但无法根除这一问题。FreqForcing从频域角度揭示了问题的本质——低频能量漂移,并提出频谱自锚定(SSA)技术,通过双分支注意力与频域融合显式校正频谱能量。在VBench-Long基准上,FreqForcing在60秒和120秒生成中均取得最优的动态程度和整体一致性,且仅增加约16.5%的推理延迟。需要注意的是,SSA的超参数需手动调节以平衡一致性与多样性,且方法目前仅在Wan2.1-T2V-1.3B和Self-Forcing上验证。

自梯度强制:解决自回归视频模型长视频生成中的身份漂移与上下文断裂

SGF:两阶段梯度恢复框架

本文提出Self Gradient Forcing (SGF),旨在解决自回归视频扩散模型在长视频生成中因KV缓存冻结导致的身份漂移和场景断裂问题。SGF通过两阶段训练策略,在Pass 1进行无梯度自回归Rollout,在Pass 2并行重建采样退出步的计算,使未来DMD损失能监督KV写入过程。实验显示,在60秒和240秒尺度上,Subject一致性分别提升至0.983和0.972,GSB偏好得分显著提升。该方法避免了全序列反向传播的内存溢出,仅用5秒训练窗口即可实现分钟级视频生成。