快速导读:首次提出直接优化编码器注意力目标的不可感知ℓ∞扰动攻击,使DETR-R50的mAP从42.1降至0.97,DINO-Swin-L从56.8降至1.44。
检测Transformer(如DETR、DINO)通过编码器自注意力建模目标间的空间关系,这一注意力结构对检测性能至关重要。然而,现有对抗攻击主要针对检测输出损失进行优化,注意力崩溃仅作为副产品出现,并未被直接利用。本文提出了一种全新的攻击范式:在ℓ∞约束下,直接以编码器最后一层的注意力logits为优化目标,通过投影梯度下降(PGD)生成不可感知的扰动,使检测性能从高水平骤降至近乎零。
该攻击设计了四种定性不同的注意力破坏目标——dispersion、re-ranking、permutation和peak-suppression,分别破坏注意力分布的集中性、排序、键值分配和主导模式。实验表明,无论采用哪种破坏目标,攻击都能将DETR-R50的mAP从42.1降至3以下,其中dispersion目标更是降至0.97。更重要的是,该攻击无需任何外部补丁或sink token,且能泛化到可变形注意力机制,在DINO-Swin-L上同样取得压倒性效果。
英文题目:Corrupting Attention: Evasion-Based Adversarial Attacks on Encoder Attention in Detection Transformers
论文出处:arXiv 每日论文精选 · arXiv:2608.06674
原始论文:PDF / 论文页面
这篇论文解决什么问题?
检测Transformer的核心优势在于编码器自注意力能够建模全局上下文和对象间关系。DETR使用标准的密集自注意力,而DINO等后续工作引入了可变形注意力以提高效率。无论哪种形式,编码器注意力都是检测性能的关键支柱。
已有对抗攻击方法大致分为两类:一类针对检测输出优化损失函数(如AFOG),注意力崩溃只是检测失败的副作用;另一类通过可见补丁引入外部sink token劫持注意力(如Attention-Fool、LQA),但这类方法依赖可见扰动,且难以泛化到可变形注意力。
本文指出了一个关键研究空白:尚未有工作将编码器注意力本身作为直接攻击目标。如果攻击者能够精确操控注意力分布,而非依赖检测损失的间接影响,是否能以更小的扰动实现更彻底的检测崩溃?这一问题在可变形注意力场景下尤为突出,因为基于补丁的sink token方法无法直接作用于采样点选择机制。
此外,注意力破坏的多样性也是一个未探索的维度。注意力分布包含多种结构属性——哪些token获得高注意力、注意力是否集中、排序关系如何——不同的破坏方式可能揭示脆弱性的不同侧面。
核心创新
- 首次直接以编码器注意力为优化目标,在不可感知扰动下实现攻击,无需外部补丁或sink token。
- 设计四种定性不同的注意力破坏目标,证明脆弱性源于注意力结构本身而非特定目标。
- 攻击泛化到密集自注意力和可变形注意力,在DETR和DINO上均取得SOTA。
方法概览
在ℓ∞约束下,使用PGD优化输入扰动,将编码器最后一层中目标token的注意力logits驱向预定义的破坏目标(dispersion、re-ranking、permutation、peak-suppression),模型参数冻结。
- 攻击框架(第3页,图2):在ℓ∞约束下,使用PGD优化输入扰动,目标是最小化编码器最后一层中目标token的注意力logits与预定义破坏目标之间的差异。模型参数完全冻结,仅优化输入图像。
- 目标token选择(第4页):并非攻击所有token,而是通过一个阈值τ筛选出编码器最后一层注意力中行和超过阈值的token作为"目标token"(object tokens),这些token通常对应前景目标。仅替换这些token的注意力logits行,保留其他token和所有value向量不变。
- 四种破坏目标(第4页,图3):dispersion目标将注意力均匀分散到所有token上,消除任何集中性;re-ranking目标反转原始注意力的排序,使原本低注意力的token获得高注意力;permutation目标随机打乱注意力分配;peak-suppression目标抑制原始注意力中的峰值,使分布趋于平坦。这四种目标分别破坏注意力分布的不同结构属性。
- 优化空间选择(第7页):攻击在logits空间(softmax之前)而非softmax之后的概率空间进行优化。实验表明,logits空间优化使DETR-R50的mAP降至0.97,而softmax后优化仅降至7.96,因为logits空间提供了更丰富的梯度信息和更大的操纵自由度。
- 可变形注意力适配(第3-4页):对于可变形注意力,攻击不直接操控采样点位置,而是优化采样点的注意力权重。破坏目标作用于采样点的注意力分布,使模型无法有效聚合特征。这一设计使攻击能够泛化到DINO等使用可变形注意力的模型。
- 损失函数设计:攻击损失定义为目标token的注意力logits与破坏目标之间的均方误差。PGD迭代在ℓ∞球内进行投影,扰动预算ϵ=8/255,迭代10次,步长2/255。
逐图理解论文
现有方法的局限

图1展示了DETR-R50和DINO-Swin-L在干净图像、AFOG攻击和本文攻击下的检测结果与编码器注意力可视化。本文攻击使注意力完全丧失空间结构,检测结果几乎全部消失,而AFOG仍保留部分检测和注意力结构。这直观展示了直接攻击注意力的压倒性优势。
攻击框架与破坏目标

图2展示了攻击框架的整体流程:干净图像经过PGD优化生成ℓ∞约束扰动,扰动后的图像输入冻结的检测Transformer,攻击损失计算编码器最后一层注意力与破坏目标之间的差异。框架简洁但效果显著。
攻击效果与可视化证据

图4对比了不同破坏目标下的检测结果和注意力图。对于DETR-R50展示的是多头平均自注意力,对于DINO-Swin-L展示的是可变形采样点及其注意力权重。所有破坏目标都导致注意力结构崩溃和检测失败。
关键消融发现

图5展示了扰动预算和迭代次数对攻击效果的敏感性分析。本文方法(实线)在所有预算和迭代次数下都显著优于AFOG(虚线),且在较小预算下已接近饱和效果。
实验如何设计?
- 数据集与指标:在MS COCO 2017验证集上评估,使用mAP作为主要指标。
- 模型选择:测试了8种不同骨干和注意力机制的检测Transformer,包括DETR-R50(密集自注意力)和DINO-Swin-L(可变形注意力)作为主要对比模型。
- 攻击参数:扰动预算ϵ=8/255,PGD迭代10次,步长2/255。所有对比方法在相同约束下运行。
- 对比基线:与AFOG、GARSDC等SOTA不可感知攻击方法对比,同时与基于补丁的注意力劫持方法进行定性比较。
- 消融实验维度:不同破坏目标的效果对比、编码器层选择(最后一层vs.其他层)、优化空间(logits vs. softmax)、扰动预算与迭代次数的敏感性分析、跨模型迁移性。
关键结果与论文证据
- 主要结果(第5页,表1):在DETR-R50上,dispersion目标将mAP从42.1降至0.97,远优于AFOG的4.1。在DINO-Swin-L上,re-ranking目标将mAP从56.8降至1.44,同样碾压AFOG的7.3。
- 四种破坏目标均有效(第6页,表2):在DETR-R50上,所有四种目标都将mAP降至3以下——dispersion 0.97,re-ranking 1.28,peak-suppression 2.48,permutation 2.58。这表明脆弱性源于注意力结构本身,而非特定破坏方式。
- 注意力可视化(第6页,图4):攻击后的编码器注意力图完全丧失空间结构,目标token的注意力均匀分散或随机分布,与干净图像上清晰的目标聚焦形成鲜明对比。
- 优化过程分析(第7页,图6):注意力在PGD迭代中逐步退化,仅需少数几次迭代就从结构化分布崩溃为无结构噪声图,验证了攻击的高效性。
- logits vs. softmax(第7页):在logits空间优化使mAP降至0.97,而在softmax后优化仅降至7.96,差距近8倍,证明logits空间是更有效的攻击面。
- 扰动预算敏感性(第7页,图5):在ϵ从2/255到16/255的范围内,本文方法始终显著优于AFOG,且在较小预算下已能实现强攻击效果。
- 跨模型迁移性(第7页):DETR→DINO迁移时,本文方法mAP为12.19,优于AFOG的17.81(越低越好),但迁移攻击效果仍远弱于白盒攻击,表明注意力破坏具有一定的模型特异性。
- 编码器层选择:攻击最后一层编码器注意力效果最佳,因为最后一层注意力直接影响解码器的交叉注意力输入。攻击浅层注意力的效果递减。
阅读时需要注意
- 攻击仅在白盒设置下验证,需要完全访问模型参数和注意力图。黑盒场景下的迁移性虽优于AFOG,但仍远不足以构成实际威胁。
- 未探索针对注意力破坏的防御策略,如注意力正则化或对抗训练,这限制了论文的实用价值。
- 未深入分析注意力崩溃如何具体传播到解码器的交叉注意力和最终预测,攻击的因果链条尚不完整。
- 目标token选择依赖阈值τ,但论文未对该参数进行详细的消融研究,其敏感性未知。
关联工作
- AFOG(第2页):针对检测Transformer的不可感知扰动攻击,优化检测损失函数,注意力崩溃仅作为副产品出现。本文直接以注意力为目标,效果显著优于AFOG。
- Attention-Fool与Patch-Fool(第2页):通过可见补丁引入sink token劫持注意力,但仅适用于全局点积注意力,无法泛化到可变形注意力。
- LQA(第2页):利用补丁同时劫持编码器和解码器注意力,依赖可见扰动,攻击隐蔽性差。
- Alam et al.(第3页):将补丁攻击扩展到可变形注意力,但需要两个协同补丁,攻击复杂度高且可见。