InsertFuse:先分后合,解决多类别图像插入的任务冲突

快速导读:提出 InsertFuse 框架,通过分离类别专家训练与跨类别能力整合,并引入 Token-Aligned Geometry Conditioning (TAGC)、Region-Balanced Flow Matching 和 Reference CFG,解决了多类别图像插入中的任务冲突与精细控制难题。

参考引导的图像插入(Reference-Guided Image Insertion)要求模型将给定的参考物体精准地放入目标场景的指定区域,同时保持参考的外观特征并适配目标场景的几何、姿态和遮挡关系。这项任务在虚拟试穿、广告植入、内容创作等场景中有广泛应用,但现有方法大多针对单一类别(如服装、配饰)设计,难以用一个模型同时处理多种插入类别。

InsertFuse 提出了一个两阶段统一框架来解决这一难题。其核心洞察是:不同插入类别(如人体、服装、配饰)的优化目标存在本质冲突,直接混合数据联合训练会导致各类别专项能力严重退化。因此,InsertFuse 先为每个类别独立训练专家模型,再通过一种名为 Insertion On-Policy Distillation (IOPD) 的在线策略蒸馏方法,将多专家能力整合到一个统一的学生模型中。

英文题目:InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion

论文出处:arXiv 每日论文精选 · arXiv:2608.06490

原始论文:PDF / 论文页面

这篇论文解决什么问题?

基于扩散模型和 Flow Matching 的图像编辑近年来取得了显著进展,但在参考引导的图像插入任务中,模型面临双重挑战:既要精确保留参考物体的外观和身份,又要将其无缝融入目标场景。AnyDoor、Insert Anything 等方法尝试用统一模型处理多类别插入,但直接混合训练不同类别的数据会引入严重的优化冲突。

论文通过梯度分析实验直观展示了这一冲突:在共享的 LoRA 参数上,人体与服装、人体与配饰类别的梯度余弦相似度经常为负值(Figure 5),意味着不同类别的更新方向相互抵消。同时,各类别的梯度范数也存在显著差异,导致某些类别在联合训练中被主导类别压制。

A2-Edit 尝试用 Mixture-of-Transformers 路由来缓解类别干扰,但其专家分支仍然联合优化,冲突并未根本解决。InsertFuse 的关键区别在于:它不在训练过程中混合不同类别的梯度信号,而是先让各类别独立学习,再通过蒸馏将能力迁移到统一模型。

核心创新

  • 提出 Insertion On-Policy Distillation (IOPD),一种用于图像插入的在线策略蒸馏框架,将类别特定专家的能力整合到统一学生模型,缓解直接联合训练带来的跨类别干扰。
  • 提出 Token-Aligned Geometry Conditioning (TAGC),将插入掩码转换为与视觉令牌网格对齐的几何特征(区域占用、符号距离、边界邻近度),提供显式的空间控制。
  • 提出 Region-Balanced Flow Matching,对插入区域和背景区域的预测误差分别进行归一化,消除因区域面积差异导致的监督信号不平衡问题。
  • 提出 Reference CFG,在固定场景和几何条件下,通过对比有无参考图像的预测来隔离并增强视觉参考的引导信号,提升参考外观和身份的一致性。

方法概览

InsertFuse 采用两阶段框架。第一阶段,为每个插入类别独立训练一个专家模型,并引入 TAGC 提供显式几何空间控制、Region-Balanced Flow Matching 平衡插入区域与背景的优化、Reference CFG 增强参考保真度。第二阶段,提出 Insertion On-Policy Distillation (IOPD),冻结所有专家模型,通过让学生模型沿自身生成轨迹匹配对应专家的参考引导速度目标,将多专家能力整合到一个统一的学生模型中。

  • 第一阶段:类别专家独立训练。为每个插入类别(如配饰、服装、人体等)独立训练一个专家模型,每个专家仅使用对应类别的数据。这种隔离训练确保每个专家在其专长领域达到最优性能,不受其他类别干扰。
  • Token-Aligned Geometry Conditioning (TAGC):将插入区域的二值掩码转换为与视觉令牌网格对齐的几何特征,包括区域占用(region occupancy)、符号距离(signed distance)和边界邻近度(boundary proximity)。这些特征被注入到 patchified 视觉特征中,为模型提供显式的空间控制信号,使其明确知道“在哪里插入”。消融实验显示,TAGC 将 DINO-I 从 0.6889 提升至 0.6972(Table 2)。
  • Region-Balanced Flow Matching:标准 Flow Matching 对全图所有位置的预测误差进行均匀平均,但由于插入区域通常远小于背景区域,导致背景的监督信号主导训练。RBFM 对插入区域和背景区域的误差分别进行归一化后再合并,确保小面积插入区域获得足够的优化关注。消融实验中,RBFM 将 PSNR 从 23.47 提升至 24.06(Table 2)。
  • Reference CFG:在固定场景和几何条件的前提下,通过对比有无参考图像的预测结果来隔离参考图像的引导信号。具体做法是训练时随机丢弃参考图像,推理时通过外推增强参考条件的影响。这类似于 Classifier-Free Guidance 的思想,但针对参考图像维度。消融实验显示,Reference CFG 将 DINO-I 从 0.6889 提升至 0.7076(Table 2)。
  • 第二阶段:Insertion On-Policy Distillation (IOPD)。冻结所有类别专家模型,让学生模型沿自身生成轨迹进行前向扩散,在每个访问状态上,由对应类别的专家模型提供速度目标(velocity target),学生模型通过匹配这些目标来学习。这种“在线策略”蒸馏的关键在于:学生是在自己的生成分布上被训练,而非专家的分布,从而避免了分布偏移问题。
  • IOPD 与直接联合训练的本质区别:直接联合训练让不同类别的梯度同时更新同一组参数,产生冲突;而 IOPD 中,学生每次仅从一个专家接收蒸馏信号,且专家参数冻结,不存在梯度交叉干扰。Table 2 显示,IOPD 模型的 DINO-I 为 0.7148,显著优于直接联合训练的 0.6478。
  • 基础模型选择:InsertFuse 基于 Qwen-Image-Edit-2511 构建,这是一个通用图像编辑模型。专家训练和蒸馏过程均使用 LoRA 进行参数高效微调,降低了计算开销。
  • 训练细节:第一阶段训练五个类别专家,第二阶段蒸馏为一个统一学生模型。具体超参数见 Table 4(第11页)。

逐图理解论文

失败的直觉

失败的直觉
Figure 5: Cross-category gradient analysis under direct joint training. (a) Mean pairwise cosine similarity between category gradients computed over the shared LoRA parameters. Values close to zero indicate weakly aligned update directions, while negative values indicate first-order gradient interference. (b) Fraction of repeated measurements for which each category pair exhibits negative cosine similarity. Human–garment and human–accessory show the most recurrent conflicts. (c) Distribution of the ℓ2 norms of category-mean gradients, displayed on a logarithmic scale; green triangles denote the means. The results reveal both heterogeneous gradient directions and unequal update magnitudes across insertion categories.

图5展示了直接联合训练下的跨类别梯度分析。子图(a)显示各类别梯度对的平均余弦相似度,接近零或负值表示更新方向不一致。子图(b)统计了各类别对出现负余弦相似度的频率,人体-服装和人体-配饰冲突最频繁。子图(c)显示各类别梯度范数分布差异大。这些结果直接证明了跨类别优化的根本性冲突,为IOPD的设计提供了动机。

核心洞察:先分后合

核心洞察:先分后合
Figure 1: Overview of InsertFuse. Left: The masked context and reference images are encoded through the vision-language and VAE branches. Token-Aligned Geometry Conditioning (TAGC) converts the target mask into grid-aligned geometry features and integrates them with the patchified visual features. Right: Category-specific experts are first trained on their respective insertion data. During student training, on-policy rollouts and Insertion On-Policy Distillation (IOPD) are interleaved: the student generates trajectories, and the matched frozen expert supplies velocity targets at the visited states for distillation. The resulting unified student handles all insertion categories without retaining the experts at inference.

图1展示了InsertFuse的整体框架。左侧显示场景图像和参考图像通过视觉-语言分支和VAE分支编码,TAGC将目标掩码转换为网格对齐的几何特征并与视觉特征融合。右侧展示了两阶段流程:先独立训练类别专家,再通过IOPD将多专家能力蒸馏到统一学生模型。这张图是理解方法架构的关键。

三个精细控制设计

三个精细控制设计
Figure 3: Qualitative ablations of TAGC and Region- Balanced Flow Matching. (a) TAGC improves geometric alignment and produces a cleaner transition between the cap and the head. (b) RBFM reduces bracelet artifacts and re- covers clearer chain and star details.

图3展示了TAGC和RBFM的定性消融结果。子图(a)中,加入TAGC后帽子与头部的几何对齐更准确,过渡更自然。子图(b)中,RBFM减少了手镯区域的伪影,链子和星星的细节更清晰。这些可视化结果与Table 2中的定量提升相互印证。

结论与价值

结论与价值
Figure 2: Qualitative comparison across diverse reference-guided insertion cases. The cyan overlay in each source image denotes the designated insertion region. InsertFuse more faithfully preserves reference-specific appearance and fine-grained structure while adapting the inserted subject to the target geometry, pose, perspective, and occlusion relationships.

图2展示了跨多个插入类别的定性对比结果。青色区域标记了插入位置。可以观察到InsertFuse在保留参考外观细节(如纹理、形状)的同时,更好地适配了目标场景的几何、姿态和遮挡关系。与AnyDoor、Insert Anything等方法的对比直观展示了InsertFuse的优势。

实验如何设计?

  • 评估基准:在公开的 AnyInsertion 基准和自建的多类别测试集上进行定量评估。AnyInsertion 基准覆盖多种插入场景,自建测试集则针对论文关注的五个类别进行更细致的评测。
  • 对比方法:包括专用插入方法 AnyDoor、Insert Anything、A2-Edit,以及通用编辑模型 FLUX.1 Kontext 和 Qwen-Image-Edit-2511。
  • 评估指标:采用 DINO-I 和 CLIP-I 衡量参考外观保真度,PSNR、SSIM、LPIPS 衡量像素级重建质量,FID 衡量整体图像质量。
  • 用户调研:进行多维度用户调研,评估参考保真度、插入质量和整体质量。参与者从匿名方法中选择偏好结果,统计各方法的偏好份额。
  • 消融实验:系统验证 TAGC、Region-Balanced Flow Matching、Reference CFG 和 IOPD 各组件的贡献,以及不同掩码条件化策略和流匹配加权策略的影响。
  • 梯度分析:在共享 LoRA 参数上计算各类别梯度的成对余弦相似度,量化直接联合训练中的跨类别冲突程度(Figure 5)。

关键结果与论文证据

  • 主实验结果(Table 1,第4页):InsertFuse 在 AnyInsertion 基准上取得 DINO-I 0.7838、CLIP-I 0.9156、PSNR 24.26、SSIM 0.8850、LPIPS 0.0948、FID 1.49,在自建多类别测试集上取得 DINO-I 0.7148、CLIP-I 0.9020、PSNR 24.40、SSIM 0.8967、LPIPS 0.0795、FID 1.39,在多数指标上优于对比方法。
  • 用户调研结果(Table 3,第6页):InsertFuse 在参考保真度上获得 51.8% 的偏好份额,插入质量 58.2%,整体质量 55.4%,均显著领先于其他方法。
  • TAGC 消融(Table 2,第6页):添加 TAGC 后,DINO-I 从 0.6889 提升至 0.6972,验证了几何条件化对参考保真度的正向作用。定性结果(Figure 3a)显示 TAGC 改善了帽子与头部之间的几何对齐和过渡。
  • RBFM 消融(Table 2,第6页):RBFM 将 PSNR 从 23.47 提升至 24.06,LPIPS 从 0.0873 降至 0.0832。定性结果(Figure 3b)显示 RBFM 减少了手镯伪影,恢复了更清晰的链子和星星细节。
  • Reference CFG 消融(Table 2,第6页):Reference CFG 将 DINO-I 从 0.6889 提升至 0.7076,是提升参考保真度最有效的单一组件。定性结果(Figure 4a)显示增强参考引导强度可以更好地保留帽子的纹理和标志。
  • IOPD vs. 直接联合训练(Table 2,第6页):IOPD 模型的 DINO-I 为 0.7148,直接联合训练仅为 0.6478,差距显著。定性结果(Figure 4b)显示直接联合训练扭曲了心形吊坠,而 IOPD 保持了参考一致性。
  • 梯度冲突分析(Figure 5,第14页):人体-服装和人体-配饰类别的梯度余弦相似度经常为负,且各类别梯度范数差异大,直接证实了跨类别优化的根本性冲突。
  • 掩码条件化策略对比(Table 5,第12页):TAGC 相比 Mask Latent Concatenation 和 Raw Mask Injection 在多项指标上表现更优,验证了符号距离和边界邻近度信息的价值。注意该表中标记为 † 的数据为临时估计值。

阅读时需要注意

  • 论文未明确讨论方法本身的局限性,如极端遮挡、复杂光照变化或大角度视角差异下的鲁棒性。
  • IOPD 需要先训练多个专家模型,增加了训练阶段的计算开销和工程复杂度。
  • Table 5 和 Table 6 中标记为 † 的数据为实验规划的临时估计值,并非最终实测结果,相关结论的可靠性有待验证。
  • 评估主要依赖自动指标和用户调研,缺乏对失败案例的系统性分析。

关联工作

  • AnyDoor:零样本对象级图像定制方法,是参考引导图像插入的基线模型之一,但主要针对单一对象类别设计。
  • Insert Anything:使用共享 DiT 进行人体、物体和服装插入的统一模型,直接优化混合类别数据,是 InsertFuse 的主要对比方法。
  • A2-Edit:通过 Mixture-of-Transformers 路由缓解类别干扰,但其专家分支仍联合优化,冲突未根本解决。
  • FLUX.1 Kontext:用于上下文图像生成和编辑的 Flow Matching 模型,作为通用编辑基线进行对比。
  • Qwen-Image-Edit-2511:通用图像编辑模型,也是 InsertFuse 构建的基础模型。

发表评论