免调优语义引导:多模态扩散Transformer的概念擦除

快速导读:提出一种免训练、免调优的语义引导方法,通过在MM-DiT中间块文本分支提取目标概念与安全概念的表示差构建steering vector,并注入连续早中期块,实现名人、艺术风格和裸体等概念擦除。

多模态扩散Transformer(MM-DiT)已成为文本到图像生成的主流骨干,SDv3.5和FLUX.1等模型在图像质量和语义对齐上表现突出。然而,这类模型同样继承了大规模训练数据中的风险:它们可以生成NSFW内容、受版权保护的艺术风格,以及真实名人的逼真肖像。如何在不大幅修改模型参数、不牺牲生成质量的前提下擦除这些不期望概念,是当前安全对齐研究的核心难题。

本文提出一种免训练、免调优的语义引导方法。其核心思路是:在MM-DiT的中间块文本分支中,提取目标概念与安全概念的token表示差,构建一个steering vector,然后将该向量注入连续的早期和中间块。由于rectified flow的采样轨迹近似直线,这个在单一中间时间步构建的向量可以在所有去噪时间步一致生效。实验在SDv3.5-medium和FLUX.1上验证了名人、艺术风格和裸体三类概念的擦除效果,并展示了多风格可控转换的能力。

英文题目:Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

论文出处:arXiv 每日论文精选 · arXiv:2608.12829

原始论文:PDF / 论文页面

这篇论文解决什么问题?

概念擦除的现有方法大致分为两类。一类是模型修改方法,如UCE通过闭式权重编辑、ESD通过微调、CA通过消融概念相关权重来实现擦除。这些方法通常需要额外的训练或权重操作,计算开销大,且往往针对特定架构设计,难以直接迁移到大规模MM-DiT。另一类是免调优方法,如SLD扩展negative prompting机制,TraSCE引入基于loss的引导,STG使用安全文本嵌入引导。这些方法虽然避免了训练,但在MM-DiT上的擦除效果有限。

MM-DiT与早期UNet架构存在本质差异。MM-DiT采用Transformer骨干和rectified flow采样,文本与图像token通过joint self-attention统一交互。其深层嵌入中的目标概念知识对表层prompt干预不敏感,语义空间更广。此外,T5-XXL文本编码器的使用使得基于token级线性可分性的传统方法失效。这意味着,针对UNet设计的steering方法(如CASteer、SAeUron)无法直接迁移到MM-DiT。

一个直观的失败案例是:在MM-DiT中简单使用negative prompting或表层文本嵌入引导,往往只能部分抑制目标概念,生成结果仍可能残留名人面部特征或目标风格的笔触。这说明需要一种更深入地作用于MM-DiT内部语义表示的方法。

核心创新

  • 提出针对MM-DiT的免训练语义引导概念擦除框架,仅操作稀疏文本分支token,开销可忽略
  • 揭示MM-DiT块级生成角色:早期块编码全局结构、中间块编码核心语义、晚期块细化细节
  • 利用rectified flow的直线采样轨迹,使单一steering vector可在所有去噪时间步一致生效
  • 支持多风格引导,可将目标风格可控地转换为多种指定风格(如Monet转像素艺术、写实、单色)

方法概览

分析MM-DiT各block的生成角色,发现中间块主要编码目标概念语义;在中间块(如b=10)和中间去噪时间步(t=0.5),从文本分支提取目标概念与安全概念的token表示差,归一化后乘以强度l构建steering vector;将该向量注入连续早期和中间块(b=3,…,10),并在所有去噪时间步一致施加。

  • 块级角色分析:作者通过向不同Transformer块注入随机高斯噪声并观察生成结果,发现早期块主要编码全局结构,中间块编码核心语义(如目标概念的身份或风格),晚期块负责细节细化。这一发现为steering vector的构建位置提供了依据。
  • steering vector构建:在中间块(如b=10)和中间去噪时间步(t=0.5),从文本分支提取目标概念token与安全概念token的表示差,归一化后乘以强度l,得到steering vector。这个向量代表了从目标概念指向安全概念的语义偏移方向。
  • 注入策略:将steering vector注入连续的早期和中间块(b=3,…,10),而非单一块。消融实验表明,连续早中期块注入的效果显著优于单块注入,因为概念语义在多个块中都有分布。
  • 时间步一致性:由于rectified flow的采样轨迹近似直线,在中间时间步构建的steering vector可以在所有去噪时间步一致施加,无需为每个时间步单独构建向量。
  • 多风格引导:通过将目标风格token替换为指定风格token来构建steering vector,可以实现可控的风格转换,如将Monet风格转换为像素艺术、写实或单色风格。
  • 计算开销:该方法仅操作稀疏的文本分支token,不涉及模型参数修改或额外训练,推理开销可忽略。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 4: Qualitative comparison between our method and baselines on Stable Diffusion-v3.5-medium. Our method effectively erases diverse concepts while largely preserving the overall image layout and quality. Specifically, for style erasure, our method erases Monet style to pixel art style, Kelly McKernan style to ink wash style, and Picasso style to photorealism style.

在MM-DiT上,传统的negative prompting和表层文本嵌入引导往往只能部分抑制目标概念。生成结果仍可能残留名人面部特征或目标风格的笔触。原因在于,MM-DiT的深层嵌入对表层prompt干预不敏感,T5-XXL文本编码器又使基于token级线性可分性的方法失效。

核心区分:块级角色

核心区分:块级角色
Figure 3: (a) and (b) are images generated by SDv3.5, where random Gaussian noise is injected into distinct Transformer blocks (each image corresponds to noise injection in a specific block, with other blocks unchanged). (c) is a visualization of the averaged attention maps of target-related tokens.

该图展示了块级角色分析:向不同Transformer块注入噪声后,早期块影响全局结构,中间块影响核心语义,晚期块影响细节。注意力图可视化进一步确认目标相关token在中间块有最强的语义响应。

方法贡献

方法贡献
Figure 2: The overall pipeline of our proposed method. We construct a steering vector from the output target tokens in the text branch of the middle block b (top). We then inject the vector into consecutive early and middle blocks (bottom). The construction process is performed at an intermediate denoising timestep, while the injection process is conducted coherently across all timesteps.

该图展示了方法的整体流程:上半部分显示在中间块文本分支提取目标概念与安全概念的token表示差构建steering vector,下半部分显示将该向量注入连续早期和中间块。注意构建发生在中间去噪时间步,而注入在所有时间步一致进行。

验证与消融

验证与消融
Table 1: Performance comparison between our method and baselines on erasing three conceptual categories from Stable Diffusion-v3.5-medium and FLUX.1. Metrics are color-coded by their evaluation objective: Yellow for erasure effectiveness,

在SDv3.5和FLUX.1上,该方法对名人、艺术风格和裸体三类概念的擦除效果均优于免调优基线和模型修改基线。消融实验进一步证实:中间块构建优于早期和晚期块构建,连续早中期块注入优于单块注入。对抗攻击测试也显示,该方法对Ring-A-Bell和I2P等攻击具有较强鲁棒性。

结论与意义

结论与意义
Figure 8: Example images show multi-style steering for con- trolled style transformation: Monet style is steered into pixel art, photorealism, and monochrome, while Van Gogh style is steered into cartoon, watercolor, and ink wash styles.

该图展示了多风格引导的可控转换:Monet风格被转换为像素艺术、写实和单色,Van Gogh风格被转换为卡通、水彩和水墨。这说明steering vector不仅可以擦除概念,还可以实现定向的风格迁移。

实验如何设计?

  • 模型:SDv3.5-medium和FLUX.1[DEV],两者均为大规模MM-DiT模型。
  • 擦除概念:名人(Elon Musk、Taylor Swift、Leonardo DiCaprio、Steve Jobs、Audrey Hepburn)、艺术风格(Van Gogh、Monet、Picasso、Kelly McKernan、Andy Warhol)和裸体三类。
  • 基线:免调优方法SLD、TraSCE、STG、NP,以及模型修改方法UCE、ESD、CA。
  • 评估指标:名人擦除用GIPHY和LLaVA,艺术风格擦除用Gram matrix score和LPIPS,裸体擦除用NudeNet,图像质量用FID和CLIP,美学用Aesthetic分数。
  • 消融实验:构建block选择(早期/中间/晚期)、构建时间步选择、注入block组合(单块/多块/早中期)。
  • 对抗鲁棒性:Ring-A-Bell、I2P、MMA-Diffusion、P4D四种攻击,仅针对nudity概念。

关键结果与论文证据

  • SDv3.5上名人擦除GIPHY=0.020,LLaVA=0.002,优于所有基线(SLD 0.029/0.022,NP 0.034/0.022)(第5页,Table 1)。
  • FLUX.1上名人擦除GIPHY=0.014,LLaVA=0.004,优于UCE 0.117/0.056、ESD 0.059/0.005、CA 0.192/0.086(第5页,Table 1)。
  • SDv3.5上裸体擦除NudeNet=0.220,优于SLD 0.526、TraSCE 0.460、STG 0.490、NP 0.296(第5页,Table 1)。
  • FLUX.1上裸体擦除NudeNet=0.023,优于UCE 0.167、ESD 0.239、CA 0.044(第5页,Table 1)。
  • 对抗攻击下FLUX.1裸体擦除:Ring-A-Bell NudeNet=0.057,I2P=0.014,MMA-Diffusion=0.016,P4D=0.013,均优于所有基线(第8页,Table 4)。
  • 消融:中间块构建(GIPHY=0.020,Gram=0.137)优于早期块和晚期块构建(第7页,Table 2)。
  • 消融:注入连续早中期块优于单块注入,单块注入的擦除效果显著下降(第7页,Table 3)。
  • 敏感性分析:名人擦除在l=60-100稳定,艺术风格在l=30-60稳定;最终选择名人l=70、艺术风格l=40(第8页,Figure 7)。

阅读时需要注意

  • 艺术风格擦除后Aesthetic分数略低于部分基线(如SDv3.5上6.367 vs TraSCE 6.608),作者归因于更彻底的风格转换导致目标风格在美学预测器训练集中代表性不足。
  • steering强度l需针对不同概念类别经验性选择(名人l=70,艺术风格l=40),缺乏自动化的强度选择机制。
  • 构建steering vector需要为每个目标概念精心策划成对prompt数据集,这增加了实际部署的前期工作量。
  • 对抗鲁棒性实验仅针对nudity概念,未覆盖名人和艺术风格的对抗攻击。

关联工作

  • CASteer和SAeUron是针对UNet架构设计的steering方法,分别基于cross-attention激活和稀疏自编码器。它们无法直接迁移到MM-DiT,因为MM-DiT的joint self-attention和T5-XXL文本编码器改变了语义表示的结构。
  • ACT通过学习transport map控制模型输出,但需要per-block映射学习,计算开销较大。FMN和MACE则通过微调cross-attention块实现遗忘,属于模型修改方法。
  • 本文的方法与这些工作的关键区别在于:它完全免训练,仅利用MM-DiT中间块文本分支的表示差构建steering vector,且利用rectified flow的直线轨迹特性实现全时间步一致注入。

发表评论