FlexComposer:统一图像与动态素材的视频合成框架

快速导读:提出统一框架FlexComposer,通过轨迹引导的条件生成,将静态图像和动态视频无缝插入背景视频,实现精确的时空控制与光照和谐化。

FlexComposer提出了一个统一的视频合成框架,能够将静态图像和动态视频资产无缝插入背景视频中。其核心创新在于将视频合成标准化为轨迹引导的条件生成任务,通过用户定义的3D轨迹实现精确的时空控制。该框架不仅保持了前景资产的内在保真度——静态图像的视觉特征和动态视频的内部运动——还隐式地实现了光照和谐化,包括阴影和反射的合成。

与传统图形学管线不同,FlexComposer避免了多阶段误差累积;与现有扩散模型方法不同,它统一处理了静态和动态两种异构输入。论文通过大量定量和定性实验证明,该方法在轨迹一致性、视频质量和光照和谐化方面均优于现有方法。

英文题目:FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control

论文出处:arXiv 每日论文精选 · arXiv:2607.29627

原始论文:PDF / 论文页面

这篇论文解决什么问题?

视频合成是视觉特效和内容创作的基础技术,广泛应用于电影制作、增强现实和短视频创作。传统图形学管线通常包含前景提取、轨迹跟踪、光照估计和合成等多个阶段,每个阶段的误差会累积,导致最终效果不自然。

近年来,扩散模型在图像和视频生成领域取得了显著进展,催生了一系列基于学习的视频合成方法。然而,这些方法存在一个根本性的权衡:轨迹控制的图像到视频(I2V)方法可以从静态图像幻觉出运动,但无法保留预动画资产的动态特征;而视频编辑方法虽然可以处理动态输入,却缺乏细粒度的空间控制来实现沿用户定义轨迹的精确放置。

更关键的是,现有方法缺乏一个统一的机制来无缝集成静态图像和动态视频资产。静态前景合成需要模型同时生成物体运动和视角变化,而动态前景合成则需要保持输入视频的内部动态。这两种任务对模型的要求截然不同,此前没有方法能够在一个框架内同时解决。

此外,光照和谐化是视频合成中的另一个关键挑战。插入的前景物体需要与背景场景的光照条件一致,包括颜色、阴影和反射的适配。大多数现有方法要么忽略了这一问题,要么将其作为独立的后处理步骤,无法实现端到端的和谐化。

核心创新

  • 提出统一规范前景表示,将动态视频稳定化、静态图像扩展并注入噪声,解耦物体内在运动与全局位移,统一处理异构输入。
  • 设计空间感知潜在注入,一种无参数机制,利用VAE潜在空间平移等变性,将规范特征精确传输到用户定义轨迹,无需辅助适配器。
  • 构建混合数据集并实施合成到真实课程学习策略,结合程序化模拟、真实世界素材和生成数据,隐式学习物理上合理的光照和阴影和谐化。

方法概览

FlexComposer将视频合成标准化为轨迹引导的条件生成任务。包含三个阶段:(1) 统一规范前景表示,通过像素空间预处理和VAE编码,将异构输入解耦为稳定、居中的规范特征;(2) 空间感知潜在注入,利用VAE潜在空间的平移等变性,通过无参数机制将规范特征传输到目标轨迹;(3) 生成式合成,使用条件扩散Transformer融合传输的前景特征与背景潜在表示,合成最终视频。训练采用混合数据集和三阶段课程学习策略。

  • 统一规范前景表示:FlexComposer首先将异构输入解耦为稳定、居中的规范特征。对于动态视频资产,使用SpatialTracker v2提取物体质心轨迹,然后通过逆变换将每一帧稳定到规范空间,消除全局位移,仅保留物体的内在运动(如蝴蝶翅膀的扇动)。对于静态图像,将其在时间维度上复制扩展,并注入噪声以模拟运动不确定性,使扩散模型能够在生成过程中填补运动细节。
  • 空间感知潜在注入:这是一个无参数机制,利用VAE潜在空间的平移等变性。具体而言,规范特征根据用户定义的3D轨迹在潜在空间中进行平移,精确传输到目标位置。该过程不需要任何辅助适配器或额外网络,完全基于VAE的数学性质。同时,可见性门控机制利用SpatialTracker v2提供的可见性掩码,处理前景物体被背景遮挡的情况。
  • 生成式合成:传输后的前景特征与背景视频的潜在表示在通道维度拼接,作为条件输入到视频扩散Transformer(DiT)中。模型基于Flow Matching目标进行训练,学习在给定前景条件和背景上下文的条件下生成和谐的视频帧。扩散模型隐式地处理光照适配、阴影生成和边缘融合。
  • 混合数据集构建:训练数据包含三个来源:程序化模拟数据(使用Blender生成具有精确轨迹标注的合成视频)、真实世界素材(从现有视频数据集中提取)和生成数据(利用预训练模型生成的补充样本)。这种混合策略确保了数据的多样性和标注的准确性。
  • 三阶段课程学习:第一阶段仅使用程序化模拟数据,让模型学习基本的空间传输和合成能力;第二阶段引入真实世界素材,使模型适应自然场景的复杂性;第三阶段加入生成数据,进一步提升模型的泛化能力。这种渐进式训练策略有效避免了训练初期的不稳定性。
  • 骨干网络初始化:FlexComposer的扩散Transformer骨干网络使用Wan-Move的预训练权重进行初始化,这为模型提供了良好的视频生成先验。在此基础上,仅对新增的条件注入模块和交叉注意力层进行微调,使用LoRA技术保持训练效率。
  • 推理流程:推理时,用户提供背景视频、前景资产(图像或视频)、3D轨迹和可见性掩码。Grounded-SAM2用于自动前景分割,SpatialTracker v2用于轨迹提取和可见性估计。整个流程端到端运行,无需手动干预。
  • 复杂3D旋转支持:通过将3D变换应用于SAM3D重建的代理几何体,FlexComposer可以合成具有挑战性的离面运动(如翻转、滚动)。注入生成的轨迹确保了即使在极端姿态变化下也能保持时间一致性。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 3: Qualitative Comparison on Static Foreground Compositing. We com- pare our method against trajectory-controlled I2V methods on two challenging scenar- ios. Our method demonstrates superior occlusion handling and trajectory adherence while maintaining visual fidelity

图3展示了静态前景合成的定性对比。FlexComposer在处理遮挡和保持轨迹一致性方面明显优于对比方法。在复杂场景中,基线方法可能出现前景消失或轨迹偏离,而FlexComposer保持了稳定的视觉效果。

研究空白与核心思路

研究空白与核心思路
Fig. 2: The Pipeline of FlexComposer. (1) Inputs: A dynamic background, a static/dynamic foreground asset, a 3D trajectory, and visibility masks. (2) Unified Representation: Diverse inputs are encoded into a canonical feature space to preserve identity and local motion. (3) Spatiotemporal Latent Injection: Canonical features are warped into the background latent space along the trajectory, utilizing a visibility gate for occlusions. (4) Generative Composition: The warped features condition a video diffusion model to synthesize the final composite.

图2展示了FlexComposer的完整流程。输入包括动态背景、静态或动态前景资产、3D轨迹和可见性掩码。统一表示阶段将异构输入编码到规范特征空间。时空潜在注入阶段沿轨迹将规范特征传输到背景潜在空间。生成式合成阶段使用条件视频扩散模型合成最终结果。

核心结论与意义

核心结论与意义
Fig. 9: Qualitative results of complex 3D rotations. FlexComposer synthesizes chal- lenging out-of-plane motions (e.g., flips, rolls) by applying explicit 3D transformations to a SAM3D-reconstructed proxy. Injecting the resulting trajectory ensures temporally consistent synthesis even during extreme pose changes.

图9展示了复杂3D旋转合成的定性结果。FlexComposer通过将显式3D变换应用于SAM3D重建的代理几何体,成功合成了具有挑战性的离面运动,如物体的翻转和滚动,同时保持了时间一致性。

实验如何设计?

  • 静态前景合成评估:在DAVIS和MoveBench两个数据集上进行测试。DAVIS包含高分辨率视频和精确的物体分割标注,MoveBench提供了多样化的运动模式。对比方法包括ImageConductor、LeviTor、Tora、MagicMotion和Wan-Move等轨迹控制的I2V方法。评估指标包括FID、FVD(视频质量)、EPE(轨迹一致性)、PSNR和SSIM(像素级保真度)。
  • 动态前景合成评估:构建了包含50个视频资产的专用测试集,涵盖不同类型的动态前景(如爆炸、流水、动物运动)。对比方法包括AnyV2V、VACE和GenCompositor。采用VBench协议评估主体一致性、背景一致性、运动平滑度和FVD。
  • 视频和谐化评估:在HYouTube数据集上进行测试,该数据集包含需要光照适配的视频合成样本。对比方法包括Harmonizer、VTT和GenCompositor。评估指标包括PSNR、SSIM、LPIPS和CLIP Score。
  • 消融实验设计:系统性地移除或替换各个组件,包括规范表示、静态扩展噪声、重光照增强、可见性门控、潜在传输、背景上下文和课程学习策略。每个变体在相同设置下训练和评估,以量化各组件的贡献。
  • 用户研究:招募25名参与者进行主观偏好评估,比较FlexComposer与基线方法在视觉质量、轨迹准确性和光照自然度方面的表现。
  • 下游应用验证:展示复杂3D旋转合成和轨迹驱动运动迁移的定性结果,验证框架的通用性和扩展能力。

关键结果与论文证据

  • 静态前景合成:FlexComposer在DAVIS数据集上取得EPE 2.15、FID 13.4、FVD 82.6、PSNR 17.40、SSIM 0.658(第9页),在MoveBench上取得EPE 2.38、FID 11.2、FVD 74.9、PSNR 18.60、SSIM 0.682(第10页),在所有指标上均优于对比方法。定性结果显示,FlexComposer在处理遮挡和保持轨迹一致性方面表现尤为突出。
  • 动态前景合成:在V2V任务上,FlexComposer取得主体一致性91.20%、背景一致性93.85%、运动平滑度98.71%、FVD 468.30(第11页),显著优于AnyV2V、VACE和GenCompositor。这表明统一框架能够有效保持动态前景的内部运动。
  • 视频和谐化:FlexComposer在HYouTube数据集上取得PSNR 42.5、SSIM 0.952、LPIPS 0.037、CLIP Score 0.974(第11页),在所有指标上大幅领先Harmonizer、VTT和GenCompositor。定性结果展示了合成的阴影和反射效果。
  • 消融实验关键发现:完整模型取得EPE 2.39、FVD 79.8、运动平滑度98.8、LPIPS 0.036、CLIP Score 0.975(第12页)。移除规范表示导致性能显著下降,验证了其核心作用。静态扩展噪声对运动生成至关重要,无噪声版本产生不自然的静态外观。可见性门控有效处理了遮挡场景。
  • 课程学习策略的有效性:直接使用混合数据训练导致训练不稳定和次优结果,而三阶段课程学习显著提升了最终性能,验证了渐进式训练的必要性。
  • 复杂3D旋转:FlexComposer成功合成了具有挑战性的离面运动(第13页),包括物体的翻转和滚动,同时保持了时间一致性和视觉质量。
  • 运动迁移能力:通过将源轨迹映射到目标角色,框架支持跨角色和背景的运动迁移(第14页),展示了潜在传输机制的通用性。
  • 用户研究结果:在视觉质量、轨迹准确性和光照自然度三个维度上,参与者显著偏好FlexComposer的结果,验证了定量指标与人类感知的一致性。

阅读时需要注意

  • 物理交互未模拟:FlexComposer仅依赖扩散先验进行合成,不显式建模物理交互(如碰撞、重力),可能导致不合理的物理效果,特别是在前景物体与背景场景有复杂交互时。
  • 长视频一致性:在生成长时间视频且视角变化极端时,可能出现时间不一致性,表现为物体的外观漂移或运动不连贯。
  • VAE假设限制:方法依赖VAE潜在空间的平移等变性假设,对于极端变形或超出训练分布的轨迹可能失效,导致特征传输不准确。
  • 数据依赖性:混合数据集和课程学习策略对数据质量和多样性敏感,特定领域的数据不足可能影响泛化能力。
  • 用户研究规模:用户研究样本量较小(25人),主观偏好结果可能不完全代表广泛用户群体。

关联工作

  • Wan-Move作为轨迹控制的I2V方法,在静态前景合成任务中作为对比基线,同时其预训练权重用于初始化FlexComposer的骨干网络(第8页)。
  • Tora是轨迹导向的扩散Transformer,在静态前景合成中作为对比基线(第9页)。
  • GenCompositor是生成式视频合成方法,在动态前景合成和视频和谐化任务中作为对比基线(第10页)。
  • AnyV2V是免调优的视频编辑框架,VACE是一体化视频创建和编辑方法,两者在动态前景合成中作为对比基线(第10页)。
  • Harmonizer和VTT分别代表白盒和基于学习的视频和谐化方法,在视频和谐化评估中作为对比基线(第11页)。

发表评论