快速导读:现有数据集如 DVM 或 Senorita-2M 缺乏干净的背景视频或包含视觉特效的 Alpha 遮罩,无法提供三元组监督。这使得模型难以学习对象与场景的物理交互,导致生成结果缺乏真实感。
视频对象插入与图层分解是视频编辑的核心任务,但现有方法多依赖隐式推理,缺乏对前景、背景及其物理交互(如阴影、反射)的显式建模。这导致编辑结果背景扭曲、细节丢失,且难以进行后续调整。
本文提出 TriLayer 数据集与 DBL-Diffusion 模型,通过显式图层表示解决上述问题。TriLayer 提供包含视觉特效的三元组监督数据,DBL-Diffusion 则通过双分支架构联合生成 RGB 合成视频与 RGBA 前景层,实现更真实、灵活的编辑效果。
英文题目:Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
论文出处:arXiv 每日论文精选 · arXiv:2607.25802
原始论文:PDF / 论文页面
对应视频标题:视频编辑新范式:DBL-Diffusion 如何实现显式图层分解与对象插入|推荐指数:★★★★★
这篇论文解决什么问题?
当前视频编辑方法主要分为两类:基于修复的方法(如 VACE-Inp)和基于逐场景优化的方法。前者往往忽略前景与背景的物理交互,导致插入对象缺乏真实感;后者则难以处理动态场景,且缺乏对前景层的显式监督。
现有数据集如 DVM 或 Senorita-2M 存在明显缺陷:DVM 缺乏干净的背景视频,Senorita-2M 缺少包含视觉特效的 Alpha 遮罩。这使得模型无法学习对象与场景之间的复杂交互,限制了编辑质量与灵活性。
因此,亟需一个包含完整图层信息(合成视频、背景、前景及 Alpha 遮罩)的数据集,以及一个能够显式建模这些图层的生成模型,以实现高质量的视频对象插入与分解。
核心创新
方法概览
现有数据集如 DVM 或 Senorita-2M 缺乏干净的背景视频或包含视觉特效的 Alpha 遮罩,无法提供三元组监督。这使得模型难以学习对象与场景的物理交互,导致生成结果缺乏真实感。
- TriLayer 数据集包含 3,964 个视频三元组,涵盖合成视频、背景视频及包含视觉特效的前景 RGBA 层。数据通过自动化处理与人工验证构建,确保图层对齐与质量。
- DBL-Diffusion 基于 VACE 骨干网络,设计为双分支架构:RGB 分支生成合成视频,RGBA 分支生成前景层。两分支通过联合交叉注意力机制共享信息,确保生成结果的一致性。
- 训练策略采用混合 LoRA-DoRA:RGB 分支使用 LoRA 微调,RGBA 分支使用 DoRA 微调,以稳定处理 RGB 与 RGBA 的分布差异。
- 引入解耦时间步采样(Disentangled Timestep Sampling),允许两分支独立控制噪声水平,进一步提升训练稳定性与生成质量。
逐图理解论文
失败案例:隐式推理的代价

定性比较视频对象插入结果。观察 DBL-Insert 生成的前景层(黄色框)与背景的自然融合,对比基线方法的伪影与扭曲。
研究缺口:缺乏显式监督数据

现有数据集如 DVM 或 Senorita-2M 缺乏干净的背景视频或包含视觉特效的 Alpha 遮罩,无法提供三元组监督。这使得模型难以学习对象与场景的物理交互,导致生成结果缺乏真实感。
核心贡献:TriLayer 与 DBL-Diffusion

对比 DBL-Insert 与 DBL-Decompose 的工作流程。上方为对象插入,下方为图层分解,直观展示模型的双向应用能力。
技术细节:混合微调与解耦采样

为稳定训练,模型采用 LoRA-DoRA 混合策略:RGB 分支用 LoRA,RGBA 分支用 DoRA,处理分布差异。引入解耦时间步采样,允许两分支独立控制噪声,进一步提升生成质量与稳定性。
实验验证:插入与分解的双重优势

实验显示,DBL-Insert 在对象插入任务上取得最高 ViCLIP-T 分数,DBL-Decompose 在背景重建上获得最佳 FID 分数。用户研究也表明,多数参与者偏好其生成的前景层包含完整视觉特效,如阴影与反射。
实验如何设计?
- 在 TriLayer 数据集上评估视频对象插入性能,使用 ViCLIP-T、VBench、CLIP-I 和 DINO-I 等指标。
- 在 Movies 和 Kubric 数据集上评估背景重建质量,使用 PSNR、SSIM 和 LPIPS 指标。
- 通过提取基线方法的 RGBA 层,评估前景层生成质量。
- 进行用户研究,邀请 20 名参与者对插入与分解结果进行主观评价。
关键结果与论文证据
- DBL-Insert 在视频对象插入任务上取得最高 ViCLIP-T (24.767) 和 DINO-I (0.747) 分数,显著优于基线方法(Table 2, p.6)。
- DBL-Decompose 在背景重建任务上取得最佳 FID 分数(Movie-BG: 14.527, Kubric-BG: 16.340),表明其能更好地保留背景细节(Table 5, p.13)。
- DBL-Insert 的 RGBA 分支在前景层质量评估中表现最佳,ViCLIP-T 达 17.884,DINO-I 达 0.482(Table 4, p.13)。
- 用户研究中,61.5% 的参与者偏好 DBL-Insert 的整体质量,71.5% 和 75.0% 分别偏好其背景与前景分解结果(Table 7-8, p.13)。
阅读时需要注意
- 处理复杂物理交互与高速动态运动时仍存在困难。
- 双分支架构增加计算与内存开销,单次推理约需 1 小时(A100)。
- 基于生成的背景重建在像素级指标(PSNR/SSIM)上低于重建基线。
关联工作
- VACE [Jiang et al. 2025] 作为基础扩散模型,为 DBL-Diffusion 提供骨干网络。
- Gen-Omnimatte [Lee et al. 2025] 与 OmnimatteZero [Samuel et al. 2025] 作为图层分解基线,用于对比评估。
- AnyV2V [Ku et al. 2024] 与 ReVideo [Mou et al. 2024] 作为视频对象插入基线,验证 DBL-Insert 的有效性。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
视频对象插入与层分解的显式层建模
韩圭镇,韩国浦项科技大学 申承洙,韩国浦项科技大学 赵成贤,韩国浦项科技大学
DBL-Insert
背景视频 前景视频 合成视频 DBL-Decompose2026 7月 28
合成视频 前景视频 背景视频
图 1. 我们提出的 DBL-Diffusion 概览。我们的框架通过显式层建模解决分层视频任务,并包含两种实例化:[cs.CV] 用于视频分层对象插入的 DBL-Insert 和用于视频层分解的 DBL-Decompose。黄色方框表示输入掩码。
大多数视频编辑系统仍缺乏显式的分层视频表示,1 引言 限制了其进行真实合成、对象复用和 Recent advances in generative video models [Blattmann et al. 2023; 一致操作的能力。这种局限性在视频 Wan et al. 2025; Yang et al. 2024] 扩展了可控视频编辑的能力,但大多数方法仍然在没有 对象插入和视频层分解中尤为明显,现有方法由于缺乏显式 前景-背景及其物理交互——这些对于真实 合成和一致编辑至关重要。这种局限性在两个根本上依赖分层 结构的任务中变得尤为明显:视频对象插入和视频层分解。 视频对象插入旨在将用户指定的对象 集成到背景视频中。早期的基于修复的方法 [Bian et al. 2025; Jiang et al. 2025; Mou et al. 2024; Tu et al. 2025] 隐式 地在掩码区域内生成前景,通常会扭曲 附近的背景内容并限制后期编辑的灵活 性。更新的方法 [Chen et al. 2025; Jin et al. 2025; Zi et al. 2025] 通过从配对 背景-合成视频中学习来提高对象插入质量,但仍然缺乏显式的前景 层,其中包括对象引起的视觉效果。没有这种层, 模型无法将前景和背景视为可分离的 arXiv:2607.25802v1 恢复前景和背景层,使用三元组监督。实验表明,显式层建模显著提高了 插入保真度和分解质量。
作者联系方式:韩圭镇,韩国浦项科技大学,kyujin@postech.ac.kr;申承洙,韩国浦项科技大学,seungjoo.shin@postech.ac.kr;赵成贤,韩国浦项科技大学,s.cho@postech.ac.kr。
第 2 页
2 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
组件,导致合成质量下降且插入对象的可复用性受限。• 我们开发了 DBL-Diffusion,这是一种统一的双分支扩散框架,通过共享去噪和跨分支交互联合建模 RGB 和 RGBA 表示。这种公式化方法显式地捕捉了分层视频结构,并作为多种分层视频任务的通用骨干网络。• 我们在两个任务中实例化了 DBL-Diffusion:用于视频分层对象插入的 DBL-Insert 和用于视频层分解的 DBL-Decompose,实现了高保真插入和分解方面的实质性改进。
另一条相关的工作线专注于视频层分解,旨在将合成视频分离为前景和背景层,从而实现对象移除、复制和背景替换等应用。然而,现有方法缺乏对前景层的显式监督,因此依赖于场景级优化或隐式推理 [Lin et al. 2023; Lu et al. 2021; Suhail et al. 2023],导致泛化能力有限。最近的基于扩散的方法 [Lee et al. 2025; Samuel et al. 2025] 提高了重建质量,但仍然在没有显式前景层监督的情况下学习分解,未能解决根本瓶颈。
尽管视频对象插入和层分解源于不同的目标,但最终都需要相同的缺失要素:提供显式、物理一致的前景-背景-合成三元组的数据集。此类数据将使模型能够直接学习分层视频表示,而不是隐式推断或依赖场景级优化。在本文中,我们证明了对分层视频表示的显式监督能够开启新的视频操作任务并显著改进现有任务。为此,我们引入了 TriLayer,这是一个由对齐的合成、背景和前景视频组成的大规模三元组视频数据集,其中前景层显式包含对象外观及其相关的视觉效果。通过提供合成-背景-前景对应关系,TriLayer 首次实现了分层视频表示的监督学习,填补了现有数据集的关键空白。我们进一步提出了一种可扩展的合成流水线,结合自动处理、基于 VLM 的过滤和人工验证,从真实世界视频中构建高质量的分层监督数据。基于 TriLayer,我们开发了 DBL-Diffusion(Dual-Branch Layered Diffusion),这是一种统一的双分支扩散框架,联合建模 RGB 合成视频和 RGBA 前景层,以实现显式的分层视频表示学习。虽然双分支架构已出现在其他上下文中 [Li et al. 2024],但我们的公式化是首次利用这种设计进行分层视频结构建模,使模型能够生成场景级 RGB 合成视频和显式的 RGBA 前景层,后者捕捉对象引起的效果,如阴影和反射。我们实例化了两个互补的任务:(1) DBL-Insert 用于视频分层对象插入,生成显式的 RGBA 前景层以实现逼真的合成和灵活的后期编辑——这是视频领域中分层插入的首次演示;(2) DBL-Decompose 用于视频层分解,使用三元组监督从合成视频中恢复前景和背景层。这两种实例化共同表明,显式层建模对于高保真插入和准确分解至关重要。
我们的贡献总结如下: • 我们引入了 TriLayer,这是一个提供合成-背景-前景对应关系的大规模三元组视频数据集,首次实现了分层视频表示的监督学习。我们还提出了一种支持大规模构建高质量分层视频数据集的合成流水线。
2 相关工作
视频对象插入。现有工作通过几种范式进行视频对象插入。免训练方法 [Ku et al. 2024; Li et al. 2025b] 将对象相关特征注入预训练扩散模型,无需额外训练即可实现插入。基于修复的方法将插入公式化为掩码视频补全 [Bian et al. 2025],而基于运动引导的方法 [Mou et al. 2024; Tu et al. 2025] 利用对象轨迹来提高时间连贯性和可控性。最近的系统进一步扩展了适用性:OmniInsert [Chen et al. 2025] 支持灵活对象的无掩码插入,InsertAnywhere [Jin et al. 2025] 通过 4D 重建估计静态对象的掩码,LoVoRA [Xiao et al. 2025] 利用光流引导插入。尽管取得了这些进展,现有方法仅在 RGB 域中运行,并未显式建模对象层,限制了层感知编辑并阻碍了复杂场景中逼真的合成。相比之下,我们的方法在统一的扩散框架内联合建模对象插入和分层视频表示。
视频层分解。视频层分解旨在将合成视频分离为前景和背景层,以用于对象移除、复制和背景替换等应用。Omnimatte [Lu et al. 2021] 引入了一种提取包含对象外观和相关视觉效果的前景层的框架。OmnimatteRF [Lin et al. 2023] 结合了神经辐射场以提高一致性,Omnimatte3D [Suhail et al. 2023] 将此思想扩展到 3D 场景表示。更近期的方法如 Gen-Omnimatte [Lee et al. 2025] 和 OmnimatteZero [Samuel et al. 2025] 利用预训练扩散模型来推断前景层。然而,现有的前景层估计方法——包括 Omnimatte 系列和基于扩散的方法——缺乏对带有视觉效果的前景层的显式监督,迫使模型仅从合成视频中推断透明度和外观。这种欠约束设置导致分解不稳定且泛化能力有限。相比之下,我们的方法引入了显式的三元组监督,实现了分层视频表示的可泛化学习。
3 TriLayer 数据集
3.1 数据集概述
为了支持学习既能捕捉对象外观又能捕捉对象引起的视觉效果的层表示,TriLayer 为每个样本提供对齐的合成、背景和前景视频。合成视频包含带有对象的原始场景。前景视频及其 alpha 遮罩捕捉了不透明对象区域以及半透明效果,如
第 3 页
视频对象插入与分层分解的显式分层建模 • 3
背景层 前景层 视频 VLM生成对象掩码 VLM生成 通过带Alpha遮罩的视频预处理 过滤生成 人类标注 对象移除生成 数据库过滤 视频数量: 视频数量: 视频数量: 视频数量: 视频数量: 视频数量: 3,964 视频数量: 9,178 9,178 18,000 4,956 5,492 18,000
前景视频 视频
视频Alpha遮罩 背景
图 2. TriLayer 数据集构建流程详解。下方展示了 TriLayer 数据集中的代表性示例。
表 1. 与现有开源视频抠像和视频对象插入数据集的比较。我们的数据集提供去除了视觉特效的真实背景视频、包含视觉特效的 Alpha 遮罩以及动态对象标注,从而支持真实的视频分层对象插入。
合成背景视频 0-1 Alpha 遮罩 Alpha 遮罩(包含视觉特效) 动态对象 真实世界视频帧数 数据集 视频(去除视觉特效) 掩码 DVM ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< VideoMatting108 ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< VideoMatte240K ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< Senorita-2M ✓ ✗ ✓ ✗ ✗ ✓ ✓ 33–64 VPData ✓ ✗ ✓ ✗ ✗ ✓ ✓ 81< ROSE++ ✓ ✓ ✓ ✗ ✗ ✗ ✗ 81< TriLayer (Ours) ✓ ✓ ✓ ✓ ✓ ✓ ✓ 81
阴影和反射。背景视频既不包含对象,也不包含其相关的特效,作为分解的干净参考以及分层对象插入的输入。 尽管每个样本包含三个对齐的视频,但这些并非独立的层;合成视频是通过将前景层通过 Alpha 合成叠加到背景层上物理形成的。每个样本还提供对象名称以及由 VLM 生成的描述其外观和相关特效的标题,这些作为 DBL-Diffusion 和 DBL-Decompose 的条件信号。 该数据集包含 3,964 个视频三元组,涵盖了多样的对象、运动、环境和光照条件。 表 1 将 TriLayer 与现有公开数据集进行了比较。视频抠像数据集 [Lin et al. 2021; Sun et al. 2021; Zhang et al. 2021] 专注于前景提取,不包含用于视觉特效的 Alpha 遮罩。Senorita-2M [Zi et al. 2025] 和 VPData [Bian et al. 2025] 缺乏干净背景视频,使得分层分解无法进行监督。ROSE++ [Jin et al. 2025] 包含虚拟场景中的静态对象,因此无法建模动态对象-场景交互。相比之下,TriLayer 提供完整的分层监督,使模型能够从完全对齐的合成、背景和前景数据中学习对象外观及对象引发的视觉特效。
前景层提取。给定合成视频和重建的背景,我们提取一个 RGBA 前景层,以捕获对象外观及相关视觉特效。我们结合来自 Gen-Omnimatte [Lee et al. 2025]、视频
图 2. TriLayer 数据集构建流程详解。下方展示了 TriLayer 数据集中的代表性示例。
表 1. 与现有开源视频抠像和视频对象插入数据集的比较。我们的数据集提供去除了视觉特效的真实背景视频、包含视觉特效的 Alpha 遮罩以及动态对象标注,从而支持真实的视频分层对象插入。
合成背景视频 0-1 Alpha 遮罩 Alpha 遮罩(包含视觉特效) 动态对象 真实世界视频帧数 数据集 视频(去除视觉特效) 掩码 DVM ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< VideoMatting108 ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< VideoMatte240K ✓ ✗ ✗ ✓ ✗ ✓ ✓ 81< Senorita-2M ✓ ✗ ✓ ✗ ✗ ✓ ✓ 33–64 VPData ✓ ✗ ✓ ✗ ✗ ✓ ✓ 81< ROSE++ ✓ ✓ ✓ ✗ ✗ ✗ ✗ 81< TriLayer (Ours) ✓ ✓ ✓ ✓ ✓ ✓ ✓ 81
阴影和反射。背景视频既不包含对象,也不包含其相关的特效,作为分解的干净参考以及分层对象插入的输入。 尽管每个样本包含三个对齐的视频,但这些并非独立的层;合成视频是通过将前景层通过 Alpha 合成叠加到背景层上物理形成的。每个样本还提供对象名称以及由 VLM 生成的描述其外观和相关特效的标题,这些作为 DBL-Diffusion 和 DBL-Decompose 的条件信号。 该数据集包含 3,964 个视频三元组,涵盖了多样的对象、运动、环境和光照条件。 表 1 将 TriLayer 与现有公开数据集进行了比较。视频抠像数据集 [Lin et al. 2021; Sun et al. 2021; Zhang et al. 2021] 专注于前景提取,不包含用于视觉特效的 Alpha 遮罩。Senorita-2M [Zi et al. 2025] 和 VPData [Bian et al. 2025] 缺乏干净背景视频,使得分层分解无法进行监督。ROSE++ [Jin et al. 2025] 包含虚拟场景中的静态对象,因此无法建模动态对象-场景交互。相比之下,TriLayer 提供完整的分层监督,使模型能够从完全对齐的合成、背景和前景数据中学习对象外观及对象引发的视觉特效。
前景层提取。给定合成视频和重建的背景,我们提取一个 RGBA 前景层,以捕获对象外观及相关视觉特效。我们结合来自 Gen-Omnimatte [Lee et al. 2025]、视频
3.2 数据集构建流程 为了构建 TriLayer,我们设计了一个多阶段流程,从真实世界的视频中推导前景-背景-合成三元组。该流程结合了自动化处理和人工验证,以确保高质量的分层监督(图 2)。 视频预处理与候选选择。我们首先从 Pexels [Pexels 2026] 收集多样化的真实世界视频。原始视频经过调整大小和时间裁剪,以匹配扩散训练设置。对于包含多个镜头的视频,我们使用 PySceneDetect [PysceneDetect 2026] 检测镜头边界,并仅保留第一个干净镜头,因为后续镜头通常会引入过渡伪影(例如淡出或突然切换),从而降低前景-背景分离的质量。然后,我们应用视觉-语言模型来识别主要前景对象,并过滤掉严重模糊、重度遮挡或对象极小的片段。在我们的实现中,我们使用 Qwen2.5-VL-32B [Bai et al. 2025] 进行语义过滤。
前景掩码提取与背景重建。对于每个视频样本,我们使用 Grounded-SAM2 [Ravi et al. 2024; Ren et al. 2024] 提取每帧的对象掩码。这些掩码指导背景重建,其中前景区域被移除,并使用现成的对象移除模型 [Miao et al. 2025] 进行修复,从而生成干净背景视频。
前景层提取。给定合成视频和重建的背景,我们提取一个 RGBA 前景层,以捕获对象外观及相关视觉特效。我们结合来自 Gen-Omnimatte [Lee et al. 2025]、视频
第 4 页
4 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
替换提示 VACE (RGB 分支) VAE R LoRA 解码器
背景视频 [第1帧, 背景视频] 合成
现成 联合交叉 模型 注意力 拼接 遮罩 序列
RGBA DoRA VAE VACE (RGBA 分支) 解码器 第1帧 编辑提示 [第1帧对象, 前景视频 背景恒定颜色]
提示 VACE (RGB 分支) VAE LoRA 解码器 对象遮罩序列 合成背景视频 现成 模型 联合交叉 注意力
RGBA DoRA VAE 提示 VACE (RGBA 分支) 解码器 对象视频 前景视频
图 3. DBL-Insert 和 DBL-Decompose 概述。(顶部) DBL-Insert 通过生成前景层与合成层一起,执行视频对象分层插入。(底部) DBL-Decompose 通过将合成层分离为前景和背景层,执行视频分层分解。
抠图 (MatAnyone [Yang et al. 2025]),以及分割 (Grounded- 前景层。尽管两个分支在不同的 SAM2):Gen-Onimatte 提供具有可靠 层上运行,但它们通过联合交叉注意力 [Li et al. 效果提取的初始 RGBA 层,而 MatAnyone 和 Grounded-SAM2 细化对 2024] 进行集成,实现双向信息交换和一致 象的不透明度和边界。最终的 alpha 遮罩是各源之间的逐像素 的分层合成。 最大值,RGB 值选自获胜 alpha 的源。这种混合策略提高了效率 DBL-Diffusion 作为一个统一的主干,可以实例化 和质量。更多详细信息请参见补充材料。然后我们使用 VLM 生成 用于不同的分层视频任务。在本节中,我们介绍 以对象为中心的标题,描述对象及其视觉效果。这些标题 两种实例化:用于分层对象插入的 DBL-Insert 和 作为下游任务的语义条件信号。 用于分层视频分解的 DBL-Decompose。尽管它们 共享相同的架构原理,但这两个模型在输入、输出和训练目标上有所不同,如下所述。
过滤。从大约 18,000 个候选者开始,我们应用自动 4.1 DBL-Insert 过滤和多轮人工验证,以确保 遮罩准确性、背景稳定性和前景保真度。在标题生成后 DBL-Insert 将双分支架构应用于分层对象 最后一遍去除剩余的失败案例,最终 插入,其目标是合成前景对象层 得到 3,964 个高质量三元组,适合训练分层视频 𝑉𝐹,它可以无缝集成到目标背景 𝑉𝐵 中。 表示。 在这种设置中,RGB 分支生成 RGB 合成 𝑉𝐶,而 RGBA 分支生成包含对象及其关联效果的显式前景层。 4 DBL-Diffusion 用于显式分层建模 尽管生成了这两个输出,但它们服务于不同的目的。𝑉𝐶 提供时间上 我们的目标是以显式分层表示对视频进行建模, 连贯的可视化,并在去噪过程中充当辅助信号,而 𝑉𝐹 则作为 将前景对象及其关联的视觉效果 插入对象的确定性表示。在推理时,𝑉𝐹 与 𝑉𝐵 进行 alpha 混合 与背景场景分离。为此,DBL-Diffusion 采用 以获得最终的高保真结果,使该方法对 𝑉𝐶 中的 双分支扩散架构,由对场景级外观进行建模的 RGB 分支 轻微的背景不一致性具有鲁棒性。 和对 RGBA 分支进行预测组成
第 5 页
显式分层建模用于视频对象插入与分层分解 • 5
DBL-Insert 接收四个输入:背景视频 $V_B$、描述对象的文本提示 $T$(无需包含对象引发的效果)、指示其位置的边界框序列 $B$,以及已插入对象的编辑后第一帧 $E$。$E$ 可由任何现代文本引导图像编辑模型 [Google 2026; Liu et al. 2025] 合成,并在时序生成开始前锚定对象的外观。基于这些输入,我们为双分支模型构建条件信号。首先,我们使用 SAM2 [Ravi et al. 2024] 从 $E$ 中提取前景对象,获得 RGB 图像及其 alpha 遮罩。这些用于构建 RGBA 分支的条件视频 $C_F$:第一帧包含置于恒定背景色之上的提取前景,其余帧仅包含恒定背景(alpha 为零)。对于 RGB 分支,我们将背景视频的第一帧替换为 $E$ 以形成 $C_C$。我们还将 $B$ 转换为二值遮罩序列 $C_M$,将合成限制在前景区域,并将第一帧遮罩设为零以防止修改。构建的条件信号连同文本提示一起馈入双分支模型。RGB 分支接收原始文本提示 $T$,而 RGBA 分支接收额外提示“背景是透明的。”以及 $T$,鼓励其生成 RGBA 前景层而非完整的 RGB 帧。
给定这些条件信号,DBL-Insert 使用双分支扩散架构进行分层视频合成。我们采用 VACE [Jiang et al. 2025] 扩散骨干网络作为两个分支的基础,因为它支持多种类型的条件。RGB 分支在标准 VACE 潜在空间中运行,并使用 RGB VAE 进行解码。RGBA 分支则使用来自 WAN-alpha [Dong et al. 2025] 的 RGBA 潜在空间,该空间联合编码和解码 RGB 与 alpha。仅适配输入/输出投影层以匹配 RGBA 潜在维度;其余骨干网络共享。
为了保持层间一致性,分支通过每个 transformer 块中的联合交叉注意力进行耦合:RGB 分支关注 RGBA 特征,RGBA 分支对称地关注 RGB 特征。这确保合成视频反映前景层的几何结构和外观,而前景层捕获场景相关的线索,如光照、运动和遮挡。去噪后,每个分支的潜在表示由其对应的 VAE 解码,生成最终的 RGB 合成视频和 RGBA 前景层。
4.2 DBL-Decompose
DBL-Decompose 实例化了我们的双分支扩散框架,用于分层视频分解:给定合成视频 $V_C$,模型恢复出干净的背景视频 $V_B$ 和 RGBA 前景层 $V_F$。RGB 分支移除前景对象及其相关的视觉效果以重建 $V_B$,而 RGBA 分支预测 $V_F$,捕获外观、边界、透明度以及阴影和反射等效果。这些输出共同形成输入的显式分层表示。
模型接收合成视频 $V_C$、描述前景对象的文本提示 $T$、对象名称 $T_N$ 和对象遮罩序列 $M$ 作为输入。遮罩可使用现成的视频分割模型(如 SAM2 [Ravi et al. 2024])获得。为了引导 RGBA 分支,我们通过掩码 $V_C$ 中的背景区域构建仅包含对象的条件视频 $C'_F$,提供粗略的空间先验,同时允许模型在去噪过程中细化外观和透明度。RGB 分支接收 $V_C$ 作为其条件视频,促使其移除对象并恢复被遮挡的背景内容。与 DBL-Insert 类似,对象遮罩 $M$ 提供给两个分支。RGBA 分支接收前景描述 $T$,而 RGB 分支接收辅助提示“自然地移除视频中的 {object_name}。具有写实风格。”其中 object_name 替换为 $T_N$。
DBL-Decompose 复用了与 DBL-Insert 相同的双分支架构,包括 VACE [Jiang et al. 2025] 扩散骨干网络和 WAN-alpha RGBA VAE [Dong et al. 2025]。
4.3 训练
DBL-Insert 和 DBL-Decompose 均使用混合 LoRA–DoRA 适应策略进行训练,该策略反映了两分支的不同角色。RGB 分支在域内运行:它在预训练扩散变换器的潜在空间中预测 RGB 视频,其目标分布与预训练模型原始训练数据非常接近。对于此分支,通过 LoRA [Hu et al. 2022] 进行低秩适应,提供了一种在不修改完整参数集的情况下高效且稳定地专业化模型的方法。
相比之下,RGBA 分支必须学习预训练模型中缺失的域外概念,包括透明度、alpha 遮罩和特定于层的视觉效果。为了支持这种分布偏移,我们采用 DoRA [Liu et al. 2024],它解耦了权重的大小和方向。这种保持方向的参数化在允许受控低秩更新的同时维持了预训练的方向先验,从而在学习新的特定层行为时导致更稳定的优化。经验表明,这种混合策略提高了训练稳定性,并在两项任务中产生了更高保真度的分层表示。
为了进一步稳定联合优化,我们在整流流框架 [Liu et al. 2022] 内使用解耦的时间步采样训练模型。每个分支以各自不同的噪声水平演化,这平衡了 RGB 外观和 RGBA 层重建的学习动态,同时保留了有效的跨分支交互。
具体而言,我们为 RGB 和 RGBA 分支采样独立的时间步 $t_x, t_y \sim U(0, 1)$,并训练模型预测相应的速度。总体目标是 RGB 和 RGBA 速度预测损失的总和,实践中发现等权重效果良好。这种解耦训练方案不仅稳定了优化,还通过独立控制每个分支的噪声水平实现了条件生成。例如,将 RGBA 分支固定在低噪声水平,允许模型在保留背景视频的同时插入或编辑前景层,从而实现场景感知的分层操作。
5 实验
我们采用 Wan2.1-VACE-1.3B [Jiang et al. 2025] 作为基础扩散变换器。DBL-Insert 和 DBL-Decompose 均使用 AdamW [Loshchilov and Hutter 2017] 训练 3 个 epoch,学习率为 $1 \times 10^{-4}$。LoRA [Hu et al. 2022](秩 128)应用于
第 6 页
6 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
表 2. TriLayer 上的视频对象插入对比。‘VACE-Inp’ 表示使用预训练 VACE 的修复模型,‘VACE-C’ 表示在 TriLayer 数据集上针对视频对象插入微调的 VACE,‘VACE-F’ 表示在 TriLayer 数据集上针对视频分层对象插入微调的 VACE。
背景 主体 运动 成像 模型 ViCLIP-T ↑ 美学 ↑ CLIP-I ↑ DINO-I ↑ 一致性 ↑ 一致性 ↑ 平滑度 ↑ 质量 ↑
AnyV2V [Ku et al. 2024] 23.520 0.906 0.902 0.984 0.480 0.583 0.740 0.567 ReVideo [Mou et al. 2024] 24.303 0.926 0.934 0.991 0.511 0.666 0.764 0.699 VACE-Inp [Jiang et al. 2025] 24.717 0.943 0.954 0.992 0.506 0.663 0.760 0.716 VACE-C 24.535 0.946 0.963 0.993 0.511 0.661 0.761 0.742 VACE-F 24.466 0.934 0.955 0.993 0.534 0.661 0.796 0.715 DBL-Insert 24.767 0.946 0.963 0.993 0.537 0.660 0.796 0.747
表 3. 背景层重建对比。含对象 不含对象 首帧 帧条件 帧条件 电影 Kubric 25 帧 方法 PSNR↑ LPIPS↓ SSIM↑ PSNR↑ LPIPS↓ SSIM↑
基于生成的方法 ObjectDrop [Winter et al. 2024] 28.05 0.124 – 34.22 0.083 – DBL-Insert Lumiere 修复 [Bar-Tal et al. 2024] 26.62 0.148 – 31.46 0.157 – Propainter [Zhou et al. 2023] 27.44 0.114 – 34.67 0.056 – 1 帧 DiffuEraser [Li et al. 2025a] 29.51 0.105 – 35.19 0.048 – DBL-Decompose 33.09 0.025 0.962 38.22 0.021 0.979 DBL- 基于重建的方法 Omnimatte [Lu et al. 2021] 21.76 0.239 0.736 26.81 0.207 0.831 Decompose D2NeRF [Wu et al. 2022] – – – 34.99 0.113 0.887 LNA [Kasten et al. 2021] 23.10 0.129 0.847 – – – OmnimatteRF [Lin et al. 2023] 33.86 0.017 0.981 40.91 0.028 0.970 图 5. 前景对象条件影响的定性消融实验。 生成式 Omnimatte [Lee et al. 2025] 32.69 0.030 0.989 44.07 0.010 0.981 OmnimatteZero [Samuel et al. 2025] 35.11 0.014 0.992 44.97 0.010 0.988 黄色方框表示输入掩码。
源视频 DoRA-DoRA
AnyV2V [Ku et al. 2024]、ReVideo [Mou et al. 2024] 和 VACE- 修复 (VACE-Inp) [Jiang et al. 2025]。 为了分析我们核心思想的作用——显式三元组监督(背景、前景、合成),我们还纳入了在 TriLayer 上微调的两个 VACE 变体:VACE-C(单分支,LoRA-LoRA 背景-合成监督)和 VACE-F(单分支,背景-前景监督)。三元组监督需要同时具备 TriLayer 数据集和具有联合交叉注意力的双分支架构,这使得 RGB 和 RGBA 分支能够学习解耦的场景和前景表示。这些组件无法独立进行消融:移除 RGBA 分支或交叉注意力会导致三元组监督崩溃,并将模型简化为单分支形式。因此,VACE-C 和 VACE-F 作为我们设计的受控消融实验。它们与 DBL-Insert 共享相同的条件接口,但缺乏三元组监督和跨分支交互,从而允许我们衡量当我们的双分支架构坍缩为其单分支对应物时性能的下降程度。
RGB 分支,而 DoRA [Liu et al. 2024](秩 32)应用于 RGBA 分支。推理期间,我们使用 50 个采样步。所有生成的视频包含 81 帧,分辨率为 480 × 832。
5.1 DBL-Insert:对比与消融实验 我们使用三类指标评估分层对象插入:(1) 通过 ViCLIP-T [Wang et al. 2022] 测量的文本-视频对齐度,(2) 通过 VBench [Huang et al. 2025] 评估的视频质量,包括背景/主体一致性、成像质量和美学,以及 (3) 通过 CLIP-I [Radford et al. 2021] 和 DINO-I [Oquab et al. 2023] 测量的主体一致性。我们将上述方法与 AnyV2V、ReVideo 和 VACE-Inpainting (VACE-Inp) [Jiang et al. 2025] 进行对比。定量和定性对比结果见表 2 和图 6。AnyV2V 和 ReVideo 经常改变背景外观或引入时间不一致性,而 VACE-Inp 受限于其修复公式,无法合成掩码区域外的对象诱导效果。VACE-C 和 VACE-F 受益于数据集监督,但在主体一致性和合成质量方面仍然表现不佳。相比之下,DBL-Insert 在所有指标上实现了最平衡的性能:RGBA 分支专注于前景层合成,而 RGB 分支确保场景一致性的合成,从而产生更真实的集成效果。
第 7 页
显式分层建模用于视频对象插入与分层分解 • 7
5.2 DBL-Decompose:源自编辑后第一帧的前景与背景层锚点重建 正如混合图像-视频扩散管线中所观察到的优势 [Kim et al. 2025] 一样,对于 DBL-Decompose,$C'_F$ 提供了更清晰的对象外观线索,从而实现更准确的 RGBA 层恢复。总体而言,前景条件在生成稳定且视觉连贯的输出方面起着重要作用。
5.4 应用
基于分层的编辑。我们的基于分层的表示实现了直观的基于分层的视频编辑:用户可以风格化或重新风格化背景(例如应用卡通外观),同时保留原始前景,或独立调整前景的颜色、纹理或风格(图 9(a))。这些编辑在整个视频中一致地传播,并且可以在无需手动抠图或复杂后处理的情况下重新合成。此外,我们的框架可以重复应用以获得多个层,允许对单个场景元素进行选择性编辑或重新风格化,并实现连贯的重新合成。
如图 8 所示,Gen-Omnimatte 难以分离复杂的视觉效果,并且由于其基于场景的优化,经常产生半透明或不完整的前景层。OmnimatteZero 从自注意力图推导 alpha 掩码,这对于透明物体或细粒度边界可能不准确。相比之下,DBL-Decompose 在所有指标上实现了最佳的前景重建性能,生成了高质量的 RGBA 层,实现了对象外观与场景依赖效果的清晰分离。这些结果突显了显式三元组监督以及双分支架构在实现准确且可泛化的分层分离方面的优势。
背景重建结果总结在表 3 中。OmnimatteRF、Generative Omnimatte 和 OmnimatteZero 等以重建为导向的基线方法取得了更高的 PSNR/SSIM/LPIPS 分数,这是预期的,因为它们直接优化像素级保真度或通过注意力掩码和 VAE 解码保留潜在表示。相比之下,DBL-Decompose 利用扩散先验生成合理的背景,而不是严格复现真实帧,导致像素级相似度较低,但生成了视觉更连贯且更真实的分层输出。这反映了像素级重建准确性与生成层质量之间的固有权衡,特别是在涉及透明度的挑战性场景中。
基于分层的编辑评估。我们使用 PSNR、SSIM 和 LPIPS 评估前景和背景重建的视频分层分解。对于前景分解,我们与两种代表性的最先进方法 Gen-Omnimatte [Lee et al. 2025] 和 OmnimatteZero [Samuel et al. 2025] 进行比较,它们分别反映了基于优化和前馈范式。对于背景重建,我们遵循先前的工作,在 Movies [Lin et al. 2023] 和 Kubric [Wu et al. 2022] 基准上进行评估,并与更广泛的基线进行比较,包括 Omnimatte [Lu et al. 2021]、D2NeRF [Wu et al. 2022]、LNA [Kasten et al. 2021]、OmnimatteRF [Lin et al. 2023]、Generative Omnimatte [Lee et al. 2025] 和 OmnimatteZero [Samuel et al. 2025]。
场景感知编辑。DBL-Insert 进一步支持场景感知分层编辑,它通过基于给定前景层对 RGBA 分支进行条件约束,同时允许 RGB 分支合成场景一致的视觉效果。这使得模型能够自动生成依赖于插入或修改对象的阴影、反射和光照交互,使编辑内容自然地融入场景。如图 9(b) 所示,这些效果是在无需手动设计或后处理的情况下产生的,使得场景感知编辑既直观又高保真。
VFX 编辑与分解。DBL-Diffusion 不仅限于实心前景对象,还扩展到更广泛的前景现象,包括半透明的 VFX 元素,如火焰和烟雾。为了验证这一能力,我们在一个包含 1,155 个三元组视频片段的内部数据集上训练了 DBL-Insert 和 DBL-Decompose,该数据集由真实世界背景视频与渲染的 VFX 元素(如火焰、烟雾及相关效果)配对组成,并保留 15 个视频用于测试。图 7 展示了分层对象插入和分层分解的定性示例,表明我们的框架也能有效处理 VFX 风格的半透明现象。
5.3 其他消融实验
LoRA 与 DoRA。我们比较了仅 LoRA、仅 DoRA 以及混合 LoRA–DoRA 配置(图 4)。仅 LoRA 和仅 DoRA 均表现出明显的失败案例,通常产生不稳定的前景层或不一致的合成。由于两个分支通过交叉注意力交换信息,单方法变体往往在两个输出中显示出类似的退化。在实践中,混合 LoRA–DoRA 配置提供了最稳定的行为,避免了单方法变体中观察到的严重伪影。
前景条件。我们分析了 DBL-Insert 和 DBL-Decompose 的 RGBA 分支中使用的前景条件视频 $C_F$ 和 $C'_F$ 的作用。虽然这两个模型在没有这些信号的情况下也能产生输出,但条件显著提高了视觉质量和时间一致性,如图 5 所示。对于 DBL-Insert,条件提供了高质量的外观信息。
6 结论
在这项工作中,我们引入了一种新颖的三元组视频数据集 TriLayer,它显式地建模了前景-背景-合成关系,从而为分层视频表示提供监督。基于此数据集,我们提出了两种模型:用于视频对象分层插入的 DBL-Insert 和用于视频分层分解的 DBL-Decompose。我们的方法在多项指标上取得了强劲的性能,同时支持实用且灵活的基于分层的视频编辑。我们相信,我们的数据集为未来关于分层感知视频理解和编辑的研究提供了宝贵的资源。
局限性。尽管结果令人鼓舞,但我们的方法仍有几个局限性。首先,我们的模型仍然难以捕捉对象与场景之间复杂的物理交互和高度动态的运动。其次,双分支架构引入了额外的计算和内存开销。未来的工作将专注于提高效率,并将框架扩展到更好地建模物理交互。
第 8 页
8 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
添加婴儿。添加龙。添加皮卡丘。添加狗。 视频 源 VACE-Inp
VACE-C
VACE-F
DBL-Insert
图 6. 与现有最先进模型的视频对象插入定性比较。此处,VACE-F 和 DBL-Insert 的结果通过将前景层(黄色框)合成到背景视频上获得。
添加烟雾。添加火焰。分解烟雾。分解火焰。 视频 视频 源 源
DBL-DBL-Insert 分解
(a) 视频对象插入 (b) 视频分层分解
图 7. 内部数据集上的视频分层对象插入和分层分解定性结果。黄色框表示前景层。此处,DBL-Insert 通过将前景层合成到背景视频上获得。
第 9 页
显式分层建模用于视频对象插入与分层分解 • 9
分解海龟。分解女性。分解鹈鹕。分解绵羊。 视频 源
Gen- Omnimatte
Zero Omnimatte
DBL- 分解
图 8. 与现有最先进(SOTA)模型的视频分层分解定性对比。黄色方框表示前景层。
& 视频源 重定位 缩放
前景视频复制
Alpha 混合 背景替换 分支 合成 DBL-插入 多层 RGB
(a) 基于分层的视频编辑 (b) 场景感知的分层编辑
图 9. 应用定性示例。(a) 基于分层的视频编辑示例。(b) 场景感知的分层编辑示例。黄色方框表示输入掩码。
第 10 页
10 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
参考文献适配。在第四十一届机器学习国际会议。 Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Xingchao Liu, Chengyue Gong, 和 Qiang Liu。2022。Flow straight and fast: Learning Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, 使用整流流生成和传输数据。arXiv 预印本 arXiv:2209.03003 Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo (2022)。 Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, Ilya Loshchilov 和 Frank Hutter。2017。解耦权重衰减正则化。arXiv 和 Junyang Lin。2025。Qwen2.5-VL 技术报告。arXiv:2502.13923 [cs.CV] 预印本 arXiv:1711.05101 (2017)。 https://arxiv.org/abs/2502.13923 Erika Lu, Forrester Cole, Tali Dekel, Andrew Zisserman, William T Freeman, 和 Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Michael Rubinstein。2021。Omnimatte:将对象及其效果关联到视频中。 Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, 等人。2024。Lumiere:一种用于视频生成的时空 In IEEE/CVF 计算机视觉与模式识别会议论文集。 扩散模型。在 SIGGRAPH Asia 2024 会议论文中。 4507–4515。 1–11。Chenxuan Miao, Yutong Feng, Jianshu Zeng, Zixiang Gao, Hantang Liu, Yunfeng Yan, Yuxuan Bian, Zhaoyang Zhang, Xuan Ju, Mingdeng Cao, Liangbin Xie, Ying Shan, 和 Donglian Qi, Xi Chen, Bin Wang, 和 Hengshuang Zhao。2025。Rose:去除对象 Qiang Xu。2025。Videopainter:使用即插即用上下文控制进行任意长度视频修复和编辑。在计算机图形学与交互技术特别兴趣组会议论文集。1–12。Chong Mou, Mingdeng Cao, Xintao Wang, Zhaoyang Zhang, Ying Shan, 和 Jian Zhang。 图形学与交互技术特别兴趣组会议论文集。1–12。 2024。Revideo:使用运动和内容的重制视频。神经信息处理系统进展 37 (2024), 18481–18505。 Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, 等人。2023。 Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Stable video diffusion:将潜在视频扩散模型扩展到大型数据集。arXiv et al. 2023。Dinov2:无监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2311.15127 (2023)。 预印本 arXiv:2304.07193 (2023)。 Jinshu Chen, Xinghui Li, Xu Bai, Tianxiang Ma, Pengze Zhang, Zhuowei Chen, Gen Pexels。2026。Pexels。https://www.pexels.com Li, Lijie Liu, Songtao Zhao, Bingchuan Li, 等人。2025。OmniInsert:通过扩散 Transformer 模型进行无掩码 PysceneDetect。2026。PysceneDetect。https://www.scenedetect.com/ 视频插入。arXiv 预印本 arXiv:2509.17627 (2025)。 Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Haotian Dong, Wenjing Wang, Chen Li, 和 Di Lin。2025。Wan-Alpha:高质量 Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等人。2021。 带 Alpha 通道的文本到视频生成。arXiv e-prints (2025), arXiv–2509。从自然语言监督中学习可迁移视觉模型。在国际机器学习会议中。PmLR, 8748–8763。 Google。2026。Nano Banana 2 – Gemini AI 图像生成器和照片编辑器。https: Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu //gemini.google/overview/image-generation/ Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson, 等人。2024。Sam Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, 2:在图像和视频中进行分割。arXiv 预印本 arXiv:2408.00714 (2024)。 Liang Wang, Weizhu Chen, 等人。2022。Lora:大语言模型的低秩适配。Iclr 1, 2 (2022), 3。Tianhe Ren, Qing Jiang, Shilong Liu, Zhaoyang Zeng, Wenlong Liu, Han Gao, Hongjie Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nat- Huang, Zhengyu Ma, Xiaoke Jiang, Yihao Chen, 等人。2024。Grounding dino 1.5: tapol Chanpaisit, Chenyang Si, Yuming Jiang, 等人。2025。Vbench++:全面 Advance the" edge" of open-set object detection。arXiv 预印本 arXiv:2405.10300 且多功能的视频生成模型基准套件。IEEE 模式分析与机器智能汇刊 (2025)。 (2024)。 Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, 和 Yu Liu。2025。 Dvir Samuel, Matan Levy, Nir Darshan, Gal Chechik, 和 Rami Ben-Ari。2025。Omni- Vace:全合一视频创建和编辑。在 IEEE/CVF 国际计算机视觉会议论文集。 matteZero:使用预训练视频扩散模型进行快速免训练的全遮罩。 17191–17202。 在 SIGGRAPH Asia 2025 会议论文集。1–11。 Hoiyeong Jin, Hyojin Jang, Jeongho Kim, Junha Hyung, Kinam Kim, Dongjin Kim, Mohammed Suhail, Erika Lu, Zhengqi Li, Noah Snavely, Leonid Sigal, 和 Forrester Huijin Choi, Hyeonji Kim, 和 Jaegul Choo。2025。InsertAnywhere:弥合 4D Cole。2023。Omnimatte3D:在非受限单目视频中关联对象及其效果。 场景几何与扩散模型以实现逼真的视频对象插入。arXiv 预印本 arXiv:2512.17504 (2025)。 在 IEEE/CVF 计算机视觉与模式识别会议论文集。630–639。 Yoni Kasten, Dolev Ofri, Oliver Wang, 和 Tali Dekel。2021。分层神经图集用于 Yanan Sun, Guanzhi Wang, Qiao Gu, Chi-Keung Tang, 和 Yu-Wing Tai。2021。Deep 一致的视频编辑。ACM 图形学汇刊 (TOG) 40, 6 (2021), 1–12。 视频抠像通过时空对齐与聚合。在 IEEE/CVF 计算机视觉与模式识别会议论文集。6975–6984。 Geonung Kim, Janghyeok Han, 和 Sunghyun Cho。2025。VideoFrom3D:通过互补图像和视频 Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, 和 Hengshuang Zhao。2025。Videoanydoor:具有精确运动控制的高保真视频对象插入。 扩散模型进行 3D 场景生成。在 SIGGRAPH Asia 2025 会议论文 (SA Conference Papers ’25)。 在计算机图形学与交互技术特别兴趣组会议论文集。1–11。 ACM, 香港, 香港, 1–11。doi:10.1145/3757377.3763871 Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Max Ku, Cong Wei, Weiming Ren, Huan Yang, 和 Wenhu Chen。2024。AnyV2V:一个 Yu, Haiming Zhao, Jianxiao Yang, 等人。2025。Wan:开放且先进的大规模 免微调框架用于任何视频到视频编辑任务。机器学习汇刊 (2024)。 视频生成模型。arXiv 预印本 arXiv:2503.20314 (2025)。 Yao-Chih Lee, Erika Lu, Sarah Rumbley, Michal Geyer, Jia-Bin Huang, Tali Dekel, 和 Yi Wang, Kunchang Li, Yizhuo Li, Yinan He, Bingkun Huang, Zhiyu Zhao, Hongjie Forrester Cole。2025。生成式全遮罩:学习将视频分解为图层。在计算机视觉与模式识别会议论文集。 Zhang, Jilan Xu, Yi Liu, Zun Wang, 等人。2022。Internvideo:通用视频基础 12522–12532。 模型通过生成式和判别式学习。arXiv 预印本 arXiv:2212.03191 Guangzhao Li, Yanming Yang, Chenxi Song, 和 Chi Zhang。2025b。Flowdirec- (2022)。 tor:免训练的流引导以实现精确的文本到视频编辑。arXiv 预印本 Daniel Winter, Matan Cohen, Shlomi Fruchter, Yael Pritch, Alex Rav-Acha, 和 Yedid arXiv:2506.05046 (2025)。 Hoshen。2024。Objectdrop:引导反事实以实现照片级真实的对象 移除和插入。在欧洲计算机视觉会议中。Springer, 112–
Xirui Li, Charles Herrmann, Kelvin CK Chan, Yinxiao Li, Deqing Sun, Chao Ma, 和 Ming-Hsuan Yang。2024。一种统一基于扩散的条件生成的简单方法。Tianhao Wu, Fangcheng Zhong, Andrea Tagliasacchi, Forrester Cole, 和 Cengiz Oztireli。2022。Dˆ 2nerf:从单目视频中自监督解耦动态和静态物体。神经信息处理系统进展 35 (2022),32653–32666。 Xiaowen Li, Haolan Xue, Peiran Ren, 和 Liefeng Bo。2025a。DiffuEraser:用于视频修复的扩散模型。arXiv:2501.10018 [cs.CV] https://arxiv.org/abs/2501.10018 Zhihan Xiao, Lin Liu, Yixin Gao, Xiaopeng Zhang, Haoxuan Che, Songping Mai, 和 Qi Geng。2025。LoVoRA:基于文本引导且无需掩码的视频对象移除与添加及可学习对象感知定位。arXiv 预印本 arXiv:2512.02933 (2025)。 Lin Liu, Chen Gao, Jia-Bin Huang, Changil Kim, Yipeng Wang, Matthias Zwicker, 和 Ayush Saraf。2023。Omnimatterf:具有 3D 背景建模的鲁棒全遮罩。在 IEEE/CVF 国际计算机视觉会议论文集。23471–23480。 Shanchuan Lin, Andrey Ryabtsev, Soumyadip Sengupta, Brian L Curless, Steven M Seitz, 和 Ira Kemelmacher-Shlizerman。2021。实时高分辨率背景抠图。在 IEEE/CVF 计算机视觉与模式识别会议论文集。8762–8771。 Shiyu Liu, Yucheng Han, Peng Xing, Fukun Yin, Rui Wang, Wei Cheng, Jiaqi Liao, Yingming Wang, Honghao Fu, Chunrui Han, 等。2025。Step1x-edit:一种通用的图像编辑实用框架。arXiv 预印本 arXiv:2504.17761 (2025)。 Shih-Yang Liu, Chien-Yi Wang, Hongxu Yin, Pavlo Molchanov, Yu-Chiang Frank Wang, Kwang-Ting Cheng, 和 Min-Hung Chen。2024。Dora:权重分解的低秩自适应。 Peiqing Yang, Shangchen Zhou, Jixin Zhao, Qingyi Tao, 和 Chen Change Loy。2025。MatAnyone:具有持续记忆传播的稳定视频抠图。在计算机视觉与模式识别会议论文集。7299–7308。 Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等。2024。Cogvideox:具有专家变换器的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072 (2024)。 Yunke Zhang, Chi Wang, Miaomiao Cui, Peiran Ren, Xuansong Xie, Xian-Sheng Hua, Hujun Bao, Qixing Huang, 和 Weiwei Xu。2021。注意力引导的时间一致视频对象抠图。在第 29 届 ACM 国际多媒体会议论文集。5128–5137。
第 11 页
视频对象插入与分层分解的显式分层建模 • 11
Shangchen Zhou, Chongyi Li, Kelvin CK Chan, 和 Chen Change Loy。2023。Propainter:改进视频修复中的传播与Transformer。在IEEE/CVF国际计算机视觉会议论文集。10477–10486。 Bojia Zi, Penghui Ruan, Marco Chen, Xianbiao Qi, Shaozhe Hao, Shihao Zhao, Youze Huang, Bin Liang, Rong Xiao, 和 Kam-Fai Wong。2025。Señorita-2M:由视频专家提供的高质量基于指令的通用视频编辑数据集。arXiv预印本 arXiv:2502.06734 (2025)。
第 12 页
12 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
补充材料
视频对象插入与分层分解的显式分层建模
A 实现细节
负向提示词包括:“明亮色调、过曝、静态、模糊细节、字幕、风格、作品、绘画、图像、静态、整体灰色、最差质量、低质量、JPEG压缩残留、丑陋、不完整、多余手指、手部绘制糟糕、面部绘制糟糕、变形、毁容、肢体畸形、手指融合、静止图片、杂乱背景、三条腿、背景中有很多人、倒退行走、变色、身体透明度”。联合交叉注意力权重初始化为预训练基础模型的自注意力权重 [Jiang et al. 2025]。在训练过程中,我们对 RGB 分支的查询、键和值投影(即 $W_x^Q, W_x^K, W_x^V$)应用 LoRA [Hu et al. 2022],对 RGBA 分支的相应投影(即 $W_y^Q, W_y^K, W_y^V$)应用 DoRA [Liu et al. 2024]。
VACE-C 和 VACE-F 训练。对于 VACE-C,我们使用 LoRA 微调扩散变换器;而对于 VACE-F,我们采用 DoRA 进行微调。为了公平比较,两个模型均在相同的 TriLayer 和内部数据集上以相同的训练超参数进行训练。由于双分支扩散变换器架构,我们的模型每个推理案例大约需要一小时。所有实验均在单块 NVIDIA A100 80GB GPU 上进行。
B 更多定量结果:插入的前景层
为了评估插入前景层的质量,我们专门针对 RGBA 层输出进行了定量实验。由于 AnyV2V、ReVideo 和 VACE-Inp 不显式生成前景层,我们使用现成的基于 Omnimatte 的模型 [Lee et al. 2025] 提取 RGBA 层。表 4 展示了插入对象 RGBA 前景层的结果。现有方法缺乏对分层表示的显式监督,限制了它们在视频对象插入过程中捕捉视觉效果的能力。此外,依赖基于 Omnimatte 的提取引入了额外的局限性,例如半透明物体伪影以及分离火焰和烟雾等复杂效果的困难。
比较方法。对于 AnyV2V [Ku et al. 2024],我们将第一帧与背景视频拼接作为输入。ReVideo [Mou et al. 2024] 支持一次生成最多 14 帧。为了生成 81 帧的视频,我们采用自回归策略,即前一个生成片段的最后一帧作为下一步生成的第一帧。
与 OmniInsert [Chen et al. 2025]、InsertAnywhere [Jin et al. 2025]、LoVoRA [Xiao et al. 2025] 和 VideoAnywhere [Tu et al. 2025] 的比较不可行,因为没有官方代码公开可用。
评估。为了对视频对象插入和分层分解进行定量评估,我们构建了 LayeredVid-Benchmark,这是一个包含 85 个视频的综合性基准测试,每个视频长 5 秒,包含 81 帧。该基准测试旨在涵盖多样的物体类别、真实场景和运动模式,从而实现全面的泛化能力评估。
ViCLIP-T [Wang et al. 2022]、CLIP-I [Radford et al. 2021] 和 DINO-I [Oquab et al. 2023] 使用预训练模型进行评估。具体而言,我们采用 ViCLIP-L_InternVid-FLT-10M 作为 ViCLIP-T,而 clip-vit-large-patch14 和 dinov2-large 分别用于 CLIP-I 和 DINO-I。对于 CLIP-I 和 DINO-I,相似度计算在第一帧分割对象与后续帧之间进行。为了比较前景层重建,我们提供真实背景视频和对象掩码作为 Gen-Omnimatte [Lee et al. 2025] 和 OmnimatteZero [Samuel et al. 2025] 的输入。
相比之下,我们的双分支设计将外观和分层建模解耦,使得能够更有效地学习物体结构和视觉效果。因此,DBL-Insert 生成更高质量、更逼真的前景层,在定量评估中取得了优越的性能。
C 更多定量结果:背景重建质量
基于重建的 omnimatte 方法显式优化以恢复原始背景,这自然有利于像素级指标(如 PSNR 和 SSIM)。相比之下,我们的方法侧重于生成感知上合理的背景(表 5 和图 8)。因此,虽然我们的方法并不总是能达到最佳的像素级重建精度,但它始终获得优越的 FID 分数,显示出更高的视觉保真度。
D 更多定量结果:用户研究
为了进一步评估感知质量,我们对视频对象插入和分层分解进行了额外的用户研究。评估由 20 名参与者在一个由手动收集和创建的 10 个真实视频组成的基准测试上进行。
第 13 页
视频对象插入与分层分解的显式分层建模 • 13
表 4. 定量比较:插入前景层的质量。‘VACE-Inp’表示使用预训练 VACE 的修复模型,‘VACE-F’表示在 TriLayer 数据集上微调以用于视频分层对象插入任务的 VACE。
主体运动成像 模型 ViCLIP-T ↑ 美学 ↑ CLIP-I ↑ DINO-I ↑ 一致性 ↑ 平滑度 ↑ 质量 ↑
AnyV2V + Gen-Omnimatte 12.273 0.902 0.996 0.345 0.458 0.641 0.274 ReVideo + Gen-Omnimatte 14.451 0.911 0.997 0.363 0.515 0.663 0.395 VACE-Inp + Gen-Omnimatte 13.880 0.921 0.997 0.358 0.507 0.667 0.408 VACE-F 17.884 0.888 0.991 0.382 0.604 0.691 0.466 DBL-Insert (RGBA branch) 17.884 0.957 0.995 0.395 0.605 0.693 0.482
表 5. 背景重建的额外 FID (↓) 比较。如表 7 所示,DBL-Insert 在所有评估标准上均优于所有竞争方法,表现出 模型 Kubric-BG Movie-BG 更高的插入质量以及与预期编辑目标更好的对齐。 Gen-Omnimatte 16.598 16.344 OmnimatteZero 96.077 36.428 对于分层分解,参与者评估重建背景和前景层的感知 DBL-Decompose 16.340 14.527 质量。如表 8 所示,DBL-Decompose 在背景和前景重建方面均获得 了最高的偏好,且优势巨大,表明我们的显式分层建模产生了比现有方法更具 表 6. 解耦时间步采样在前景重建上的消融研究。 视觉合理性的分解层。
方法 PSNR ↑ SSIM ↑ LPIPS↓ FID ↓ 无解耦采样 27.050 0.930 0.068 38.236 有解耦采样 28.760 0.935 0.059 32.305
表 7. 由 20 名参与者对 10 个视频进行视频对象插入的用户研究。
主体插入 提示 整体 模型 一致性↑ 合理性↑ 对齐↑ 质量↑ AnyV2V 1.0% 1.0% 1.5% 1.5% ReVideo 0.5% 1.0% 1.0% 1.5% VACE-Inp 17.5% 10.0% 21.0% 15.5% VACE-C 15.0% 11.5% 18.5% 13.0% VACE-F 9.5% 8.5% 7.5% 7.0% DBL-Insert 56.5% 68.0% 50.5% 61.5%
表 8. 由 20 名参与者对 10 个视频进行分层分解的用户研究。
背景 前景 模型 质量↑ 质量↑ Gen-Omnimatte 8.0% 19.0% OmnimatteZero 20.5% 6.0% DBL-Decompose 71.5% 75.0%
E TriLayer 数据集详情
基于 VLM 的过滤。我们采用 Qwen2.5-VL-32B-Instruct [Bai et al. 2025] 作为视觉语言模型 (VLM) 进行数据过滤。 过滤流程分为两个阶段:(1) 质量评估 表 7. 由 20 名参与者对 10 个视频进行视频对象插入的用户研究。 和 (2) 对象选择。在质量评估阶段,如图 10 所示,VLM 通过 考虑可见性、模糊、遮挡和对象显著性等因素来评估视频和对象的质量。 基于生成的推理,每个样本被分类为 ACCEPTABLE(可接受)或 REJECTED(拒绝),仅保留被接受的样本。然而,我们观察到 VLM 偶尔会关注 在视觉上不显著或未被相机正确捕捉的对象,导致推理不可靠。为了解决这个问题,我们引入对象过滤阶段。如图 11 所示,我们通过比较 VLM 生成的推理与视频标题来识别主要对象,从而过滤掉不合适的对象候选者。 最后,为了为每个视频分配一致的对象类别标签,我们 采用基于 VLM 的选择器,如图 12 所示,该选择器确定给定视频最具代表性的对象类别。
基于 VLM 的提示。如图 13 所示,我们使用 VLM 设计以对象为中心的提示,以关注场景中存在的对象。
SAM-mask 和对象移除过滤。为了获得干净的视频,我们使用 ROSE [Miao et al. 2025] 从合成视频中移除对象。由于 ROSE 需要对象掩码作为输入, 我们使用 SAM2 [Ravi et al. 2024] 和 Grounded-DINO [Ren et al. 2024] 生成对象掩码视频。然而,如图 14 所示, 我们观察到对象掩码有时不完整或不准确,导致 ROSE 未能完全移除对象或其相关视觉效果。为了解决这个问题,我们 应用人工过滤步骤来丢弃这些低质量样本。
视频涵盖多样的对象类别和视觉效果(例如, 阴影、反射和水花),以及场景配置,以提供全面的评估。 对于视频对象插入,参与者被要求比较不同方法生成的视频在主体一致性、插入合理性、提示对齐和整体质量方面的表现。
第 14 页
14 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
您是一位专注于筛选适合对象插入任务的高质量视频的视觉分析与评估助手。 您的工作是严格根据视频帧评估每个视频,并确定该视频是否适合用于训练或评估对象插入模型。 请遵循以下详细标准进行判断: 拒绝标准——如果视频符合以下任一条件,则不适合: 1. 视频中完全不存在目标对象(即任何帧中均未出现)。 2. 对象太小或太大,导致无法清晰可见或识别。 3. 同一对象的实例过多,导致插入模糊或画面杂乱。 4. (重要)相机运动非静态且动态变化,导致背景发生显著改变(例如从水下切换到陆地,或从天空切换到地面)。 5. 视频中存在相机或对象的模糊或动态运动,导致对象或背景不清晰或不稳定。 6. 视频整体质量较低(例如对象消失、难以看清、运动过多或帧转换过快)。 7. 视频中对象或背景存在显著遮挡,导致不适合插入。 8. 对象包含复杂且动态变化的纹理(例如飘动的毛发、多层羽毛),导致真实的对象插入不可靠。 9. 由于距离、光照、分辨率或视觉模糊等问题,对象在视频中不清晰可见或无法识别。 10. (重要)对象在视频播放过程中完全从可见帧中消失。 11. 背景快速或不一致地变化,导致场景理解受到干扰。 英文输出示例: 1. REJECTED: The object is not present in some frames of the video. 2. REJECTED: The object is too small or too large and partially occluded in the video. 3. REJECTED: The background changes rapidly in the video. 4. REJECTED: The object completely disappears from the visible frame during the video. 5. ACCEPTABLE: The object appears clearly in the video with sufficient size and no occlusion. 您必须始终使用英文输出,并严格根据上述标准进行评估。 {给定视频帧(用户)} 请根据标准评估视频是否适合对象插入任务,并提供 ACCEPTABLE 或 REJECTED 状态及理由,如示例所示。
图 10. 用于基于 VLM 的整体视频和对象质量评估器的指令。蓝色文本表示用户输入。
您是一位助手,用于判断给定描述中描述的主要对象是否在视频标题中提到。如果描述中提到的任何关键对象与视频标题匹配,请输出 ’YES’;否则,输出 ’NO’。 无论哪种情况,请提供简要解释。 输出格式为: YES/NO: 简要解释 给定描述:{针对给定视频的基于 VLM 评估器的描述。(VLM)} 视频标题:{给定视频标题(用户)}
图 11. 用于基于 VLM 的主要对象质量评估器的指令。蓝色文本表示用户输入,红色文本表示前一阶段的 VLM 输出。
前景层过滤。为了获得高质量的前景层生成结果,如图 15 所示。每个样本由人工标注为四个标签之一:GOOD、gen-GOOD、mat-GOOD 和 BAD。具体而言,gen-GOOD 表示仅 Gen-Omnimatte 的结果质量可接受;mat-GOOD 对应 SAM2 和 MatAnyone 提供更好结果的情况;GOOD 表示所有方法成功结合的情况;BAD 指被丢弃的低质量输出。 为了进一步确保质量,我们对生成的结果进行人工验证。为了获得高质量的前景层,我们结合了 Gen-Omnimatte [Lee et al. 2025]、MatAnyone [Yang et al. 2025] 和 SAM2 [Ravi et al. 2024],如图 15 所示。虽然 Gen-Omnimatte 能有效捕捉视觉效果,但它经常为对象区域产生半透明结果。为了解决这个问题,我们引入 SAM2 和 MatAnyone 来细化对象透明度并恢复细粒度结构(如头发或毛发),从而生成更准确且视觉上连贯的前景层。
第 15 页
视频对象插入与分层分解的显式分层建模 • 15
您是一位助手,能够从给定图像及其标题中识别出单个最清晰可见的主要对象。您的任务是仅输出图像中最突出且清晰可见的一个对象。如果未可见可识别的对象,则返回“Nothing”。 规则: 1. 仅输出一个单词或短语:最清晰可见的对象。 2. 除非背景元素是唯一可见的内容,否则忽略背景元素。 3. 如果存在多个对象,请选择最显著或中心聚焦的那个。 4. 如果图像模糊不清或包含无可识别对象,则输出“Nothing”。 英文输出示例: 1. 对象:["dog"] 2. 对象:["human"] 3. 对象:["horse"] 4. 对象:["Nothing"] 您必须始终使用英文输出,并严格根据上述标准进行评估。 {给定视频帧(用户)} 视频标题:{给定视频标题(用户)}
图 12. 用于基于 VLM 的视频主要对象选择器的指令。蓝色文本表示用户输入。
基于这些注释,我们定义了改进的前景统计信息。TriLayer 包含 3,964 个样本,涵盖 229 个对象类别,其分层和 alpha 遮罩如下所示:如图 16(a) 所示,该数据集呈现出多样化的对象类别分布,其中未明确列出的类别被归入“其他”类。在图 16(b) 中,我们展示了通过人工验证分配的前景分层标签分布,以确保分层合并注释的质量。
$$ \begin{aligned} M_{mat\_GOOD} &= \max(M_{sam}, M_{mat}), \\ V_{mat} &= M_{mat\_GOOD} \times V_{rgb}, \\ V_{fg}[i, j] &= \begin{cases} V_{mat}[i, j], & \text{if } M_{mat\_GOOD}[i, j] > M_{gen\_GOOD}[i, j] \\ V_{omni\_fg}[i, j], & \text{otherwise} \end{cases} \\ M_{GOOD} &= \max(M_{mat\_GOOD}, M_{gen\_GOOD}), \end{aligned} \quad (1) $$
其中 $M_{sam}$、$M_{mat}$ 和 $M_{gen\_GOOD}$ 分别表示从 SAM2、MatAnyone 和 Gen-Omnimatte 获得的 alpha 遮罩。$V_{rgb}$、$V_{omni\_fg}$ 和 $V_{fg}$ 分别表示来自 Gen-Omnimatte 的合成视频、前景层以及改进后的前景层。$M_{mat\_GOOD}$ 和 $M_{GOOD}$ 分别表示对应于 mat-GOOD 和 GOOD 的改进 alpha 遮罩。
如图 17 所示,展示了数据集中的其他示例。
F 更多定性结果
受篇幅限制,主论文中仅展示了每个定性示例的单帧。为了更好地可视化分层编辑结果,我们裁剪了选定区域以突出关键效果,并使用 Adobe Premiere Pro 进行合成。完整的视频编辑结果请参见补充视频。
第 16 页
16 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
您是一位提示词优化专家。您的目标是根据用户提供的视频信息,生成一个高质量且细节丰富的英文提示词,清晰描述主体的运动与视觉特征。利用主体与场景细节,以生动、电影感或风格准确的方式重写提示词。您必须严格遵循以下示例的格式与语气。
任务要求: 1. 使用简单直接的动词清晰描述视频中主体的运动或动作。 2. 丰富提示词中的关键主体特征——包括外观、情绪、数量、种族、姿势等。 3. 强调任何摄像机运动或角度,如跟踪镜头、航拍、摇摄或推近。 4. 准确描绘与主体相关的自然运动与空间构图(例如,狗在草地上奔跑,鸟在天空中翱翔)。 5. 整合视频中可见的细节,如服装、物体、风景、光照和背景构图。 6. 撰写的提示词长度约为 80–100 词。 7. 无论用户输入何种语言,您重写的提示词必须始终为英文。
书面英文提示词示例: 1. 视频展示了一辆红色跑车,置于摄影棚环境中。车身流线型且现代,姿态低矮宽大。它拥有大型尾翼和突出的前分流器。车轮为黑色,采用多辐条设计。车身相对于相机呈轻微角度摆放,可同时看到车头和侧面。背景为中性灰色,与车身鲜艳的红色形成对比。光照柔和均匀,突显了车身的曲线与轮廓。视频整体风格干净专业,聚焦于汽车的设计与特征。 2. 视频展示了一只黑棕相间的小狗,耳朵大,戴着绿色项圈。小狗将头 resting 在人的手臂上,手臂佩戴棕色皮革手表。小狗眼睛睁得很大,似乎直视镜头。背景模糊,但看似室内环境,有白色表面。视频风格为特写镜头,景深浅,聚焦于小狗面部和人的手臂。小狗表情好奇且专注。 3. 视频中,一男一女在停车场并肩行走。男子身穿蓝色衬衫,手提粉色包;女子身穿白色衬衫,戴着太阳镜。他们走向背景中停放的一辆银色汽车。停车场停满了其他车辆,表明这是一个繁忙区域。这对情侣看起来心情愉快,他们微笑着享受彼此的陪伴。视频整体风格随意自然,捕捉了日常生活中的瞬间。
直接输出 80-100 词的书面英文文本。 {给定视频帧(用户)} 主体是 {对象名称}。请撰写高质量且细节丰富的英文提示词。
图 13. 基于 VLM 的提示词生成器用于给定视频和对象的指令。蓝色文本表示用户输入,红色文本表示前一阶段 VLM 的输出。
源视频 SAM2 结果 源视频 ROSE 结果
图 14. 基于 SAM 的掩码和 ROSE 对象移除的失败案例,其中对象掩码不完整或视觉效果未完全移除。
第 17 页
视频对象插入与分层分解的显式分层建模 • 17
源视频 gen-GOOD mat-GOOD GOOD
图 15. 前景层质量的人工标注示例。绿色方框表示选定的前景层标签。底行被标记为 BAD,因为它未能捕捉到与对象相关的视觉效果。
(a) 对象统计 (b) 前景层标签统计
图 16. TriLayer 数据集的统计信息。(a) 对象类别的分布。(b) 前景层标签的分布。
第 18 页
18 • Kyujin Han, Seungjoo Shin, and Sunghyun Cho
合成背景前景文本提示 写实风格。一只羽毛呈斑驳棕色和白色、具有独特冠羽的鸟稳步走过潮湿泥泞的表面,其倒影清晰可见于其下方,随着它向前迈步而映照出它的动作。这只鸟偶尔低下头啄食地面,它的腿…… 写实风格。一名身穿海军蓝夹克和黑色紧身裤的人在红色跑道上做弓步动作,随着右腿伸展、左膝降低接近地面,以受控的动作向前移动,保持平衡和姿势。这个人的影子清晰投射……
图 17. TriLayer 数据集的其他示例。