FlowMimic:基于像素对扭曲流场的无掩码视频编辑与模态统一
本文介绍FlowMimic方法,通过像素对时间扭曲流场从图像编辑样本实时生成视频编辑数据,并利用模态模仿损失对齐图像与视频模态。该方法无需外部掩码或大型多模态模型,实现了统一的视频编辑与生成。实验表明,模型在Wan2.1-T2V-1.3B基础上后训练,在FiVE-Bench和UNIC-Bench上表现出良好的编辑能力,包括对象插入、风格化、头部替换等。但需注意颜色漂移和复杂非刚性编辑的局限性。
本文介绍FlowMimic方法,通过像素对时间扭曲流场从图像编辑样本实时生成视频编辑数据,并利用模态模仿损失对齐图像与视频模态。该方法无需外部掩码或大型多模态模型,实现了统一的视频编辑与生成。实验表明,模型在Wan2.1-T2V-1.3B基础上后训练,在FiVE-Bench和UNIC-Bench上表现出良好的编辑能力,包括对象插入、风格化、头部替换等。但需注意颜色漂移和复杂非刚性编辑的局限性。