MapRoute++:用代理引导的语义路由,把概念擦除从“删掉”变成“改道”

快速导读:MapRoute++ 在冻结的 Stable Diffusion v1.4 中插入轻量残差 MLP 映射器,通过两阶段训练与语义路由将目标概念重定向到代理概念,在 Genµ 2.0 挑战基准上以 0.721 的平均 ERR 分数超越现有基线。

MapRoute++ 解决的是文本到图像扩散模型中的概念遗忘问题:模型在训练中会学到版权内容、社会偏见等不良概念,需要在不破坏无关概念生成能力的前提下移除这些概念。论文的核心思路不是直接删除目标概念的表示,而是把目标概念重定向到代理概念,让模型在遇到目标提示时生成代理概念的图像。

该方法在冻结的 Stable Diffusion v1.4 中为每个目标概念插入一个轻量残差 MLP 映射器,通过两阶段训练和推理时的语义路由,在 Genµ 2.0 挑战基准上取得了优于现有基线的平均 ERR 分数。

英文题目:MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

论文出处:arXiv 每日论文精选 · arXiv:2608.13478

原始论文:PDF / 论文页面

这篇论文解决什么问题?

文本到图像扩散模型在海量互联网数据上训练,不可避免地学习到受版权保护的艺术风格、社会偏见等不良概念。概念擦除的目标是移除这些概念,同时保留无关概念和语义相邻概念的生成能力,并抵御间接提示和对抗性提示的攻击。

现有方法分为两类:基于优化的方法如 ESD、CRCE、CORE、AGE、FADE,通过微调模型参数来擦除概念;模块化方法如 SPM、Receler、MapRoute,通过插入轻量模块来改变特定概念的表示。MapRoute 是本文的直接前作,使用概念专用映射器进行语义路由,但代理概念选择任意、训练目标单一。

MapRoute++ 的改进动机在于:代理概念的选择质量直接影响擦除效果,过弱的代理导致目标残留,过强的代理导致相邻概念过擦除。同时,单一训练目标无法兼顾不同概念类型的擦除需求。

核心创新

  • 两阶段训练策略:先恒等预训练建立基线,再引入目标-代理映射,降低对非目标概念的扰动
  • 任务特定训练目标:艺术风格保留 Lkeep2 以保护艺术家身份,对象类别省略 Lkeep2
  • 多同义词与释义表示目标概念,增强对未见与对抗提示的泛化
  • 启发式代理概念选择,避免评估泄漏且不依赖挑战数据集提示
  • 输入条件语义路由机制,推理时动态选择 top-k 相关映射器

方法概览

MapRoute++ 在冻结文本编码器与 U-Net 之间为每个目标概念插入轻量残差 MLP 映射器。训练分两阶段:Stage 1 在广泛概念词汇上学习恒等映射;Stage 2 将目标概念嵌入重定向到启发式选择的代理概念,并用 Lkeep1(恒等保持)和 Lkeep2(专名保护)正则化。推理时基于提示与目标概念的语义相似度动态选择 top-k 映射器,对 EOT token 嵌入序列进行逐 token 变换。

  • MapRoute++ 在冻结的文本编码器与 U-Net 之间为每个目标概念插入一个轻量残差 MLP 映射器,修改的是序列级 EOT token embedding,而非整个文本嵌入。
  • 训练分两阶段:Stage 1 在广泛概念词汇上学习恒等映射,建立基线;Stage 2 将目标概念嵌入重定向到启发式选择的代理概念,并用 Lkeep1(恒等保持)和 Lkeep2(专名保护)正则化。
  • Lkeep2 是任务特定的:对于艺术风格类概念,Lkeep2 保护艺术家身份不被误擦除;对于对象类别概念,则省略 Lkeep2,因为对象类别不需要专名保护。
  • 目标概念用多个同义词和释义表示,增强对未见提示和对抗提示的泛化能力。
  • 代理概念选择采用启发式方法,避免评估泄漏,不依赖挑战数据集的提示。
  • 推理时基于提示与目标概念的语义相似度动态选择 top-k 映射器,对 EOT token 嵌入序列进行逐 token 变换,实现输入条件语义路由。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 3: Representative qualitative failures. Top row: Van Gogh remains visually present after unlearning, including for indirect and adversarial prompts. Bottom row: the base model produces a recognizable adjacent bird, but the unlearned Blue Jay mapper often converts adjacent birds into texture-like patterns; adversarial prompting can still produce bird-like imagery.

图 3 展示了定性失败案例:Van Gogh 风格在擦除后仍可见,Blue Jay 映射器将相邻鸟类退化为纹理状图案。这揭示了风格类和相邻概念擦除的局限性。

研究缺口

研究缺口
Fig. 1: MapRoute++ uses a two-stage residual MLP to redirect concepts to surrogates in frozen diffusion models, modifying the sequence-level EOT token embedding for targeted suppression while preserving semantic fidelity.

图 1 展示了 MapRoute++ 的整体架构:在冻结的文本编码器与 U-Net 之间插入残差 MLP 映射器,修改序列级 EOT token embedding。观察此图可以理解两阶段训练和语义路由的流程。

验证与结论

验证与结论
Table 1: Comparison of Average ERR Score by Various Approaches. Best performing score per type is bolded and next best performing score is underlined.

表 1 对比了各方法的平均 ERR 分数,MapRoute++ 在五类概念上均优于基线。注意场景类从 MapRoute 的 0.190 提升到 0.707,说明两阶段训练对场景类概念尤其有效。

实验如何设计?

  • 在 Stable Diffusion v1.4 上对 Genµ 2.0 挑战的 20 个概念进行评估,涵盖对象、动物、风格、场景、动作五类。
  • 使用 LLaVA v1.6 Mistral 7B 以受限 yes/no 问题计算 ERR 分数,每概念生成 20 张图像。
  • 与 ESD、CA、FMN、FADE、MapRoute 五个基线在五类概念上对比平均 ERR。
  • 对代理概念选择进行消融与定性分析,展示成功与失败案例。
  • 使用两块 Nvidia RTX A6000 (48GB) GPU,沿用 MapRoute 官方仓库参数。

关键结果与论文证据

  • MapRoute++ 平均 ERR 0.721,比最强基线 FADE (0.600) 高 12.1%(第 4 页)。
  • 场景类 ERR 0.707,比 MapRoute (0.190) 提升超 50%,说明两阶段训练和代理选择对场景类概念尤其有效(第 4 页)。
  • 对象类 ERR 0.863,动物类 0.604,风格类 0.574,动作类 0.857,风格类擦除效果最差(第 4 页)。
  • Golf Ball ERR 0.9738,Eating 0.9710,为最高分概念;Blue Jay ERR 0.2990,Doodle 0.3558,Van Gogh 0.3926,为最低分概念(第 5 页)。
  • 平均 Afgt 0.7575,Aret 0.9462,Aadj 0.7633,Aind 0.8100,Aadv 0.8725,表明无关概念保留效果最好,目标遗忘和相邻保留是相对短板(第 5 页)。
  • 定性分析显示,Blue Jay 映射器会破坏相邻鸟类概念,将其退化为纹理状图像;对抗性提示下 Blue Jay 仍可生成鸟类图像,存在对抗泄漏(第 8 页)。

阅读时需要注意

  • 风格类擦除效果最差:Van Gogh、Doodle、Monet 等依赖全局纹理与笔触的风格难以通过语义 token 嵌入变换完全消除。
  • Blue Jay 映射器会破坏相邻鸟类概念,将其退化为纹理状图像,说明语义路由的边界不够精确。
  • 对抗性提示下 Blue Jay 仍可生成鸟类图像,存在对抗泄漏。
  • 代理概念选择对擦除质量影响大,过弱代理导致目标残留,过强代理导致相邻概念过擦除。
  • 论文为 Genµ 2.0 挑战提交,部分结果基于挑战私有测试集,复现需访问官方数据集。
  • ERR 分数依赖 LLaVA 模型的 yes/no 判断,存在评估模型自身偏差。

关联工作

  • MapRoute 是直接前作,MapRoute++ 在其基础上增加两阶段训练、多义词表示、任务特定目标与启发式代理选择。
  • ESD 是基于优化的概念擦除基线,在对比实验中平均 ERR 0.477;FADE 是细粒度擦除基线,对比实验中最强基线,平均 ERR 0.600。
  • SPM 使用一维适配器进行模块化概念擦除,Receler 是轻量擦除器模块化方法,两者与 MapRoute++ 同属模块化路线。

发表评论