EffectLearner:让视频物体移除真正理解光影与因果

快速导读:提出EffectLearner框架,结合VLM语义推理与DiT视频修复,并构建包含复杂物理效应的EffectWorld数据集,实现视频中目标物体及其诱发效应的完整、时空一致移除。

视频物体移除(Video Object Removal, VOR)是计算机视觉中的一项经典任务,其目标不仅是擦除画面中的目标物体,还需同时消除该物体在场景中诱发的一切视觉效应,例如阴影、反射、光照变化等。然而,现有方法大多依赖预定义的效应类别和固定的数据分布,难以泛化到真实世界中常见的复杂场景——比如物体与其效应在空间上分离、多种效应叠加组合,或是长尾物理现象。

EffectLearner正是针对这一核心瓶颈提出的解决方案。该框架首次将视觉语言模型(VLM)的语义推理能力引入视频物体移除流程,使模型能够显式地分析“这个物体在场景中引发了哪些效应”,并将推理结果作为条件信号指导后续的扩散Transformer(DiT)视频擦除器。配合专门构建的EffectWorld数据集和渐进式训练课程,EffectLearner在多个评测基准上展现出对复杂物体-效应关系的更强泛化能力。

英文题目:EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

论文出处:arXiv 每日论文精选 · arXiv:2608.05565

原始论文:PDF / 论文页面

这篇论文解决什么问题?

传统的视频修复方法(如ProPainter、DiffuEraser)主要关注显式掩码区域内的像素重建,对物体诱发效应的处理往往是被动且不完整的。当物体的阴影投射在远处地面、反射出现在相邻玻璃表面时,这些方法常常无法识别并移除这些空间分离的效应。

近期一些工作(如ROSE、EffectErase)开始尝试联合移除物体及其效应,但它们仍从预定义的效应类别中隐式学习关联,面对训练数据中未见的效应组合或弱相关效应时,泛化能力明显不足。通用视频编辑模型(如VACE)虽然生成能力更强,但缺乏对物体-场景交互的精确推理,容易改变无关内容或产生幻觉结构。

更深层的问题在于,现有数据集未能充分覆盖真实世界中的复杂效应场景。组合效应(如同时存在阴影和反射)、空间分离效应、长尾物理现象(如水面倒影的动态演化)等情形在现有基准中极为稀缺,导致模型难以学习到鲁棒的物体-效应推理能力。

此外,动态场景下的时空一致性也是一个被长期忽视的挑战。物体移除后,视频帧间的运动平滑度和背景稳定性往往难以保证,尤其是在目标占据大面积前景或存在复杂运动遮挡的情况下。

核心创新

  • 提出语义推理增强的物体-效应移除框架EffectLearner,首次将VLM用于显式推理物体-场景交互以指导视频物体移除。
  • 设计运动感知掩码引导和运动一致性损失,从引导和训练监督两方面提升动态场景下的时空一致性。
  • 构建EffectWorld数据集,覆盖组合效应、空间分离效应、长尾物理现象等复杂场景,弥补现有数据集不足。
  • 引入渐进式训练课程,使模型从基础移除逐步过渡到复杂效应推理和时空稳定。

方法概览

EffectLearner由VLM物体-效应推理器和DiT视频擦除器组成。推理器分析目标高亮视频,提取紧凑的效应感知语义上下文;擦除器在语义引导下联合移除目标及效应。引入运动感知掩码引导和运动一致性损失增强动态场景下的时空稳定性。构建包含复杂效应的EffectWorld数据集,并采用渐进式训练课程。

  • VLM物体-效应推理器:输入为目标高亮标注的视频片段,VLM在结构化文本提示的引导下进行跨模态推理,提取紧凑的效应感知语义上下文令牌(Effect-Aware Context Tokens)。这些令牌编码了“哪些区域属于物体本身、哪些区域属于诱发效应、效应与物体的因果关联强度”等关键信息。
  • DiT视频擦除器:基于扩散Transformer架构,将VLM推理器输出的语义上下文令牌与原始视频、物体掩码一同作为条件输入,在扩散过程中联合移除目标物体及其效应。语义引导使擦除器能够区分“需要移除的效应区域”和“需要保留的背景内容”。
  • 区域加权流匹配(Region-Weighted Flow Matching):针对物体和效应区域通常远小于背景区域的问题,在流匹配损失中对目标区域施加更高权重,避免背景主导优化导致效应移除不充分。
  • 运动感知掩码引导(Motion-Aware Mask Guidance):在推理阶段,利用光流信息将当前帧的物体掩码扩展为时序并集掩码(Temporal Union Mask),覆盖物体在相邻帧中可能影响到的区域,从而更完整地捕捉动态效应。
  • 运动一致性损失(Motion Consistency Loss):在训练阶段引入额外的运动一致性监督,约束移除后视频的光流与原始背景光流保持一致,从训练目标层面增强时空稳定性。
  • EffectWorld数据集构建:通过精心设计的数据采集和标注流程,收集包含组合效应、空间分离效应、长尾物理现象等复杂场景的配对视频数据。数据集涵盖多种物体类别和场景类型,为模型训练提供了更丰富的效应多样性。
  • 渐进式训练课程:训练分为三个阶段——首先在基础修复数据上训练像素重建能力,然后引入简单效应场景学习物体-效应关联,最后在EffectWorld的复杂场景上微调时空一致性和效应推理能力。这种课程设计使模型能够稳步掌握从简单到复杂的移除技能。

逐图理解论文

核心区分与研究空白

核心区分与研究空白
Figure 1: Overview of EffectLearner. The framework consists of two core components: (1) the VLM-Based Object-Effect Reasoner (left), which performs cross-modal reasoning over a target-highlighted input video under structured textual guidance to extract compact semantic context; and (2) the DiT-Based Video Eraser (middle), which integrates the semantic context with the source video and object mask to achieve high-fidelity object-effect removal. Motion-aware mask guidance and a motion consistency loss (right) are further introduced to enhance spatiotemporal consistency.

图1展示了EffectLearner的整体架构。左侧的VLM推理器接收目标高亮视频,输出效应感知语义令牌;中间的DiT擦除器将这些令牌与原始视频和掩码融合进行扩散生成;右侧展示了运动感知掩码引导和运动一致性损失如何增强时空稳定性。建议重点关注语义令牌的信息流向,理解推理结果如何具体指导擦除过程。

核心结论

核心结论
Table 1: Quantitative results on ROSE-Bench and EffectWorld-Eval. The best and second-best results are bolded and underlined.

实验结果表明,EffectLearner在多个基准上全面超越了现有方法。尤其是在包含复杂效应的场景中,无论是阴影的完整消除、反射的准确移除,还是视频帧间的运动平滑度,都展现出明显优势。消融实验进一步证实,VLM语义推理和运动一致性损失是两个最关键的贡献——缺少前者,模型无法识别空间分离的效应;缺少后者,视频的时序稳定性会急剧恶化。

Figure 2: Data construction pipeline of EffectWorld

Figure 2: Data construction pipeline of EffectWorld
Figure 2: Data construction pipeline of EffectWorld.

图2呈现了EffectWorld数据集构建的完整流程。从视频采集、目标标注、效应识别到配对数据生成,该流程专门设计用于捕获组合效应和空间分离效应等复杂场景。注意观察数据采集阶段如何确保效应多样性和标注质量。

实验如何设计?

  • 定量评测在三个基准上进行:ROSE-Bench(标准VOR评测集)、EffectWorld-Eval(包含33个复杂效应案例的配对评测集)、EffectWorld-Wild(包含70个开放世界视频的无配对评测集)。
  • 对比方法包括传统修复方法(ProPainter、DiffuEraser)、通用视频编辑模型(VACE)、以及物体-效应联合移除方法(ROSE、EffectErase)。
  • 评测指标涵盖像素级重建质量(PSNR、SSIM、MAE)、感知质量(LPIPS)、视频时序质量(FVD),以及在EffectWorld-Wild上使用VBench评估主体一致性、背景一致性、运动平滑度、动态程度和成像质量。
  • 消融实验系统验证了VLM引导、区域加权流匹配、运动感知掩码并集和运动一致性损失四个组件的独立贡献。
  • 引入LLM-as-a-Judge和人工评估,从目标移除、效应移除、背景保留和时序渲染四个维度进行细粒度评分,弥补自动指标的局限性。

关键结果与论文证据

  • 在ROSE-Bench上,EffectLearner取得LPIPS 0.054和FVD 81.866的最优结果,表明其在标准场景下已超越现有方法(Table 1, p.6)。
  • 在EffectWorld-Eval的复杂效应场景中,EffectLearner在PSNR(29.521)、SSIM(0.934)、LPIPS(0.044)、FVD(69.184)等全部五项指标上均排名第一,验证了其对复杂效应的处理优势(Table 1, p.6)。
  • 在EffectWorld-Wild开放世界评测中,EffectLearner总分0.772,背景一致性0.958,动态程度0.400,均为最优或次优,证明其在无配对真实场景下的泛化能力(Table 2, p.6)。
  • LLM评估中,EffectLearner总分3.389,目标移除3.778,效应移除3.547,均排名第一;人工评估总分3.675,效应移除3.900,背景保留3.950,同样领先(p.13)。
  • 消融实验表明,移除VLM引导导致所有指标下降,证实语义推理对识别弱相关和空间分离效应至关重要(Table 3, p.7)。
  • 移除运动一致性损失时,LPIPS升至0.187,FVD飙升至294.778,说明运动一致性监督对时序稳定性有决定性影响(Table 3, p.7)。
  • 区域加权流匹配和时序并集掩码的移除也分别导致效应区域移除不完整和时序闪烁问题,验证了各组件解决互补性失效模式的设计合理性(Table 3, p.7)。
  • 定性可视化显示,EffectLearner在阴影投射、水面倒影、玻璃反射等复杂场景下能更完整地移除效应,而对比方法常残留明显痕迹或错误移除背景内容(Figure 3, p.6-7)。

阅读时需要注意

  • 对于占据大面积前景且遮挡复杂纹理的目标,移除后重建区域可能出现纹理过度平滑和局部失真,这源于扩散模型在信息严重缺失区域的内在生成不确定性。
  • 在严重运动模糊和重复遮挡情况下,运动感知掩码引导可能错误地将本应保留的细薄结构(如栏杆、树枝)纳入移除范围。
  • VLM推理器的性能受限于底层视觉语言模型的能力边界,对于极端罕见或高度抽象的物体-效应关系,推理准确性可能下降。
  • EffectWorld数据集虽然覆盖了多种复杂场景,但规模仍相对有限,可能无法涵盖所有真实世界中的长尾效应类型。

关联工作

  • ProPainter和DiffuEraser代表了基于传播和扩散的强修复基线,但它们的设计哲学是“响应掩码”而非“理解场景”,因此在效应移除上存在根本性局限。
  • ROSE首次提出物体-效应联合移除的概念,但其依赖预定义效应类别的做法限制了泛化空间,EffectLearner通过VLM推理突破了这一限制。
  • VACE等通用视频编辑模型展示了强大的生成能力,但缺乏对物体-场景因果关系的精确建模,EffectLearner的语义推理机制恰好弥补了这一差距。
  • RACCOON、Kiwi-Edit等基于VLM的视频编辑方法主要面向显式编辑指令,而EffectLearner关注的是隐式的物体-场景交互推理,两者在问题设定上互补。

发表评论