视频编辑新范式:DBL-Diffusion 如何实现显式图层分解与对象插入

论文代表图:figure-01-p001-01

现有视频编辑方法缺乏对前景、背景及物理交互的显式分层表示,导致背景扭曲且难以后期调整。本文提出 TriLayer 数据集,提供包含阴影等视觉特效的三元组监督;并设计 DBL-Diffusion 双分支架构,联合生成 RGB 合成视频与 RGBA 前景层。实验表明该方法在对象插入与图层分解任务上均优于基线,但计算开销较大。

视频编辑为何失效?ElasticTTT解决先验崩溃问题

方法贡献

扩散模型在视频编辑中常因测试时微调(TTT)导致先验崩溃,表现为忽略指令或破坏未编辑区域。ElasticTTT通过TDR、Contrastive CFG和Async-NS三大机制,在保留源视频结构的同时实现精准编辑。实验显示其在VLM评估中表现最佳,但需注意超参数敏感性。

OSVE:基于单步扩散模型的一步视频编辑

方法概述:OSVE框架

本文介绍OSVE框架,旨在解决文本引导视频编辑中速度与质量的矛盾。传统多步方法计算昂贵,直接应用单步模型则导致结构坍塌。OSVE通过可学习的反转编码器和统一帧编辑机制,在单步内完成高质量编辑。实验显示,OSVE在20帧和90帧视频上分别比RAVE快171倍和155倍,且时序一致性显著优于基线。需注意单步模型对控制信号敏感,且长视频处理需依赖滑动窗口策略。

FlowMimic:基于像素对扭曲流场的无掩码视频编辑与模态统一

模态模仿编辑损失

本文介绍FlowMimic方法,通过像素对时间扭曲流场从图像编辑样本实时生成视频编辑数据,并利用模态模仿损失对齐图像与视频模态。该方法无需外部掩码或大型多模态模型,实现了统一的视频编辑与生成。实验表明,模型在Wan2.1-T2V-1.3B基础上后训练,在FiVE-Bench和UNIC-Bench上表现出良好的编辑能力,包括对象插入、风格化、头部替换等。但需注意颜色漂移和复杂非刚性编辑的局限性。