In-Context Forcing:用递减噪声上下文打破自回归视频扩散的细节复制陷阱

方法贡献与验证

提出一种渐进式自回归范式 In-Context Forcing,通过为历史帧施加递减的噪声水平提供自适应引导,解决现有少步自回归视频扩散模型中因依赖干净帧导致的局部细节泄露和时序动态退化问题。

自梯度强制:解决自回归视频模型长视频生成中的身份漂移与上下文断裂

SGF:两阶段梯度恢复框架

本文提出Self Gradient Forcing (SGF),旨在解决自回归视频扩散模型在长视频生成中因KV缓存冻结导致的身份漂移和场景断裂问题。SGF通过两阶段训练策略,在Pass 1进行无梯度自回归Rollout,在Pass 2并行重建采样退出步的计算,使未来DMD损失能监督KV写入过程。实验显示,在60秒和240秒尺度上,Subject一致性分别提升至0.983和0.972,GSB偏好得分显著提升。该方法避免了全序列反向传播的内存溢出,仅用5秒训练窗口即可实现分钟级视频生成。