快速导读:提出 InsertFuse 框架,通过分离类别专家训练与跨类别能力整合,并引入 Token-Aligned Geometry Conditioning (TAGC)、Region-Balanced Flow Matching 和 Reference CFG,解决了多类别图像插入中的任务冲突与精细控制难题。
参考引导的图像插入(Reference-Guided Image Insertion)要求模型将给定的参考物体精准地放入目标场景的指定区域,同时保持参考的外观特征并适配目标场景的几何、姿态和遮挡关系。这项任务在虚拟试穿、广告植入、内容创作等场景中有广泛应用,但现有方法大多针对单一类别(如服装、配饰)设计,难以用一个模型同时处理多种插入类别。
InsertFuse 提出了一个两阶段统一框架来解决这一难题。其核心洞察是:不同插入类别(如人体、服装、配饰)的优化目标存在本质冲突,直接混合数据联合训练会导致各类别专项能力严重退化。因此,InsertFuse 先为每个类别独立训练专家模型,再通过一种名为 Insertion On-Policy Distillation (IOPD) 的在线策略蒸馏方法,将多专家能力整合到一个统一的学生模型中。
英文题目:InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion
论文出处:arXiv 每日论文精选 · arXiv:2608.06490
原始论文:PDF / 论文页面
这篇论文解决什么问题?
基于扩散模型和 Flow Matching 的图像编辑近年来取得了显著进展,但在参考引导的图像插入任务中,模型面临双重挑战:既要精确保留参考物体的外观和身份,又要将其无缝融入目标场景。AnyDoor、Insert Anything 等方法尝试用统一模型处理多类别插入,但直接混合训练不同类别的数据会引入严重的优化冲突。
论文通过梯度分析实验直观展示了这一冲突:在共享的 LoRA 参数上,人体与服装、人体与配饰类别的梯度余弦相似度经常为负值(Figure 5),意味着不同类别的更新方向相互抵消。同时,各类别的梯度范数也存在显著差异,导致某些类别在联合训练中被主导类别压制。
A2-Edit 尝试用 Mixture-of-Transformers 路由来缓解类别干扰,但其专家分支仍然联合优化,冲突并未根本解决。InsertFuse 的关键区别在于:它不在训练过程中混合不同类别的梯度信号,而是先让各类别独立学习,再通过蒸馏将能力迁移到统一模型。
核心创新
- 提出 Insertion On-Policy Distillation (IOPD),一种用于图像插入的在线策略蒸馏框架,将类别特定专家的能力整合到统一学生模型,缓解直接联合训练带来的跨类别干扰。
- 提出 Token-Aligned Geometry Conditioning (TAGC),将插入掩码转换为与视觉令牌网格对齐的几何特征(区域占用、符号距离、边界邻近度),提供显式的空间控制。
- 提出 Region-Balanced Flow Matching,对插入区域和背景区域的预测误差分别进行归一化,消除因区域面积差异导致的监督信号不平衡问题。
- 提出 Reference CFG,在固定场景和几何条件下,通过对比有无参考图像的预测来隔离并增强视觉参考的引导信号,提升参考外观和身份的一致性。
方法概览
InsertFuse 采用两阶段框架。第一阶段,为每个插入类别独立训练一个专家模型,并引入 TAGC 提供显式几何空间控制、Region-Balanced Flow Matching 平衡插入区域与背景的优化、Reference CFG 增强参考保真度。第二阶段,提出 Insertion On-Policy Distillation (IOPD),冻结所有专家模型,通过让学生模型沿自身生成轨迹匹配对应专家的参考引导速度目标,将多专家能力整合到一个统一的学生模型中。
- 第一阶段:类别专家独立训练。为每个插入类别(如配饰、服装、人体等)独立训练一个专家模型,每个专家仅使用对应类别的数据。这种隔离训练确保每个专家在其专长领域达到最优性能,不受其他类别干扰。
- Token-Aligned Geometry Conditioning (TAGC):将插入区域的二值掩码转换为与视觉令牌网格对齐的几何特征,包括区域占用(region occupancy)、符号距离(signed distance)和边界邻近度(boundary proximity)。这些特征被注入到 patchified 视觉特征中,为模型提供显式的空间控制信号,使其明确知道“在哪里插入”。消融实验显示,TAGC 将 DINO-I 从 0.6889 提升至 0.6972(Table 2)。
- Region-Balanced Flow Matching:标准 Flow Matching 对全图所有位置的预测误差进行均匀平均,但由于插入区域通常远小于背景区域,导致背景的监督信号主导训练。RBFM 对插入区域和背景区域的误差分别进行归一化后再合并,确保小面积插入区域获得足够的优化关注。消融实验中,RBFM 将 PSNR 从 23.47 提升至 24.06(Table 2)。
- Reference CFG:在固定场景和几何条件的前提下,通过对比有无参考图像的预测结果来隔离参考图像的引导信号。具体做法是训练时随机丢弃参考图像,推理时通过外推增强参考条件的影响。这类似于 Classifier-Free Guidance 的思想,但针对参考图像维度。消融实验显示,Reference CFG 将 DINO-I 从 0.6889 提升至 0.7076(Table 2)。
- 第二阶段:Insertion On-Policy Distillation (IOPD)。冻结所有类别专家模型,让学生模型沿自身生成轨迹进行前向扩散,在每个访问状态上,由对应类别的专家模型提供速度目标(velocity target),学生模型通过匹配这些目标来学习。这种“在线策略”蒸馏的关键在于:学生是在自己的生成分布上被训练,而非专家的分布,从而避免了分布偏移问题。
- IOPD 与直接联合训练的本质区别:直接联合训练让不同类别的梯度同时更新同一组参数,产生冲突;而 IOPD 中,学生每次仅从一个专家接收蒸馏信号,且专家参数冻结,不存在梯度交叉干扰。Table 2 显示,IOPD 模型的 DINO-I 为 0.7148,显著优于直接联合训练的 0.6478。
- 基础模型选择:InsertFuse 基于 Qwen-Image-Edit-2511 构建,这是一个通用图像编辑模型。专家训练和蒸馏过程均使用 LoRA 进行参数高效微调,降低了计算开销。
- 训练细节:第一阶段训练五个类别专家,第二阶段蒸馏为一个统一学生模型。具体超参数见 Table 4(第11页)。
逐图理解论文
失败的直觉

图5展示了直接联合训练下的跨类别梯度分析。子图(a)显示各类别梯度对的平均余弦相似度,接近零或负值表示更新方向不一致。子图(b)统计了各类别对出现负余弦相似度的频率,人体-服装和人体-配饰冲突最频繁。子图(c)显示各类别梯度范数分布差异大。这些结果直接证明了跨类别优化的根本性冲突,为IOPD的设计提供了动机。
核心洞察:先分后合

图1展示了InsertFuse的整体框架。左侧显示场景图像和参考图像通过视觉-语言分支和VAE分支编码,TAGC将目标掩码转换为网格对齐的几何特征并与视觉特征融合。右侧展示了两阶段流程:先独立训练类别专家,再通过IOPD将多专家能力蒸馏到统一学生模型。这张图是理解方法架构的关键。
三个精细控制设计

图3展示了TAGC和RBFM的定性消融结果。子图(a)中,加入TAGC后帽子与头部的几何对齐更准确,过渡更自然。子图(b)中,RBFM减少了手镯区域的伪影,链子和星星的细节更清晰。这些可视化结果与Table 2中的定量提升相互印证。
结论与价值

图2展示了跨多个插入类别的定性对比结果。青色区域标记了插入位置。可以观察到InsertFuse在保留参考外观细节(如纹理、形状)的同时,更好地适配了目标场景的几何、姿态和遮挡关系。与AnyDoor、Insert Anything等方法的对比直观展示了InsertFuse的优势。
实验如何设计?
- 评估基准:在公开的 AnyInsertion 基准和自建的多类别测试集上进行定量评估。AnyInsertion 基准覆盖多种插入场景,自建测试集则针对论文关注的五个类别进行更细致的评测。
- 对比方法:包括专用插入方法 AnyDoor、Insert Anything、A2-Edit,以及通用编辑模型 FLUX.1 Kontext 和 Qwen-Image-Edit-2511。
- 评估指标:采用 DINO-I 和 CLIP-I 衡量参考外观保真度,PSNR、SSIM、LPIPS 衡量像素级重建质量,FID 衡量整体图像质量。
- 用户调研:进行多维度用户调研,评估参考保真度、插入质量和整体质量。参与者从匿名方法中选择偏好结果,统计各方法的偏好份额。
- 消融实验:系统验证 TAGC、Region-Balanced Flow Matching、Reference CFG 和 IOPD 各组件的贡献,以及不同掩码条件化策略和流匹配加权策略的影响。
- 梯度分析:在共享 LoRA 参数上计算各类别梯度的成对余弦相似度,量化直接联合训练中的跨类别冲突程度(Figure 5)。
关键结果与论文证据
- 主实验结果(Table 1,第4页):InsertFuse 在 AnyInsertion 基准上取得 DINO-I 0.7838、CLIP-I 0.9156、PSNR 24.26、SSIM 0.8850、LPIPS 0.0948、FID 1.49,在自建多类别测试集上取得 DINO-I 0.7148、CLIP-I 0.9020、PSNR 24.40、SSIM 0.8967、LPIPS 0.0795、FID 1.39,在多数指标上优于对比方法。
- 用户调研结果(Table 3,第6页):InsertFuse 在参考保真度上获得 51.8% 的偏好份额,插入质量 58.2%,整体质量 55.4%,均显著领先于其他方法。
- TAGC 消融(Table 2,第6页):添加 TAGC 后,DINO-I 从 0.6889 提升至 0.6972,验证了几何条件化对参考保真度的正向作用。定性结果(Figure 3a)显示 TAGC 改善了帽子与头部之间的几何对齐和过渡。
- RBFM 消融(Table 2,第6页):RBFM 将 PSNR 从 23.47 提升至 24.06,LPIPS 从 0.0873 降至 0.0832。定性结果(Figure 3b)显示 RBFM 减少了手镯伪影,恢复了更清晰的链子和星星细节。
- Reference CFG 消融(Table 2,第6页):Reference CFG 将 DINO-I 从 0.6889 提升至 0.7076,是提升参考保真度最有效的单一组件。定性结果(Figure 4a)显示增强参考引导强度可以更好地保留帽子的纹理和标志。
- IOPD vs. 直接联合训练(Table 2,第6页):IOPD 模型的 DINO-I 为 0.7148,直接联合训练仅为 0.6478,差距显著。定性结果(Figure 4b)显示直接联合训练扭曲了心形吊坠,而 IOPD 保持了参考一致性。
- 梯度冲突分析(Figure 5,第14页):人体-服装和人体-配饰类别的梯度余弦相似度经常为负,且各类别梯度范数差异大,直接证实了跨类别优化的根本性冲突。
- 掩码条件化策略对比(Table 5,第12页):TAGC 相比 Mask Latent Concatenation 和 Raw Mask Injection 在多项指标上表现更优,验证了符号距离和边界邻近度信息的价值。注意该表中标记为 † 的数据为临时估计值。
阅读时需要注意
- 论文未明确讨论方法本身的局限性,如极端遮挡、复杂光照变化或大角度视角差异下的鲁棒性。
- IOPD 需要先训练多个专家模型,增加了训练阶段的计算开销和工程复杂度。
- Table 5 和 Table 6 中标记为 † 的数据为实验规划的临时估计值,并非最终实测结果,相关结论的可靠性有待验证。
- 评估主要依赖自动指标和用户调研,缺乏对失败案例的系统性分析。
关联工作
- AnyDoor:零样本对象级图像定制方法,是参考引导图像插入的基线模型之一,但主要针对单一对象类别设计。
- Insert Anything:使用共享 DiT 进行人体、物体和服装插入的统一模型,直接优化混合类别数据,是 InsertFuse 的主要对比方法。
- A2-Edit:通过 Mixture-of-Transformers 路由缓解类别干扰,但其专家分支仍联合优化,冲突未根本解决。
- FLUX.1 Kontext:用于上下文图像生成和编辑的 Flow Matching 模型,作为通用编辑基线进行对比。
- Qwen-Image-Edit-2511:通用图像编辑模型,也是 InsertFuse 构建的基础模型。