一次投毒,任意控制:VLM可编程后门的核心逻辑

快速导读:本文提出首个针对VLM的any-to-any后门攻击范式,通过一次性启发式投毒使模型将触发器视为指令,并在推理时利用特征空间触发器隐写术为任意未见过的目标caption动态合成隐蔽触发器。

视觉语言模型(VLM)在图像描述、视觉问答等任务中表现优异,但其训练依赖大规模不可信数据,后门攻击风险日益突出。现有后门攻击大多沿用分类任务中的BadNets范式,将固定触发器绑定到预定义恶意输出,目标在投毒前必须预先确定。一旦攻击者想更换攻击目标,就需要重新投毒并重训练大模型,成本高昂且容易暴露。本文提出首个针对VLM的any-to-any后门攻击范式,核心思想是将VLM的零样本泛化能力转化为攻击者可控的漏洞:通过一次性启发式投毒,让模型学会'触发器即指令'的通用行为;推理时利用特征空间触发器隐写术,为任意未见过的目标caption动态合成隐蔽触发器,实现投毒后的动态目标控制。

英文题目:Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.10959

原始论文:PDF / 论文页面

这篇论文解决什么问题?

VLM如LLaVA、Qwen3-VL、MiniGPT-v2在图像描述等任务中广泛应用,但其训练数据通常来自互联网等不可信来源,攻击者可以在训练数据中注入恶意样本。传统后门攻击借鉴BadNets范式,将固定触发器绑定到预定义恶意输出。这种固定映射的局限在于:目标在投毒前必须预先绑定,更换目标需要重新投毒和重训练大模型,成本高且易暴露。TrojVLM和MTAttack等VLM后门攻击虽然扩展到多目标,但在未见过的trigger-target对上攻击成功率降为零,说明它们只是记忆了固定映射而非学习通用规则。IAG作为输入感知的视觉定位后门攻击,适配到caption生成后unseen pair ASR仅37%到50%,因为caption包含更长、更组合化的语义,直接文本到触发器的生成不够可靠。

核心创新

  • 首次提出any-to-any caption-control投毒范式,将VLM的零样本泛化能力转化为攻击者可控漏洞,实现投毒后动态选择未见过的目标caption而无需重训练
  • 设计启发式投毒策略,使VLM学习'触发器即指令'的通用行为而非固定trigger-target映射
  • 提出基于特征空间的特征空间触发器隐写术TS(·),将任意目标caption映射为L∞范数控制噪声或无语义patch触发器,兼顾隐蔽性与攻击有效性
  • 发现对掩码区域施加高斯模糊可显著提升小扰动预算触发器的攻击成功率

方法概览

方法包含两部分:(1) 启发式投毒策略——从触发器-目标数据集Dt采样(ximaget, ytextt)对,将触发器图像缩放到Wt×Ht后按掩码M叠加到良性图像左上角,并将标签替换为触发器图像的caption,使模型学习'触发器即指令'的通用规则而非记忆固定映射;(2) 特征空间触发器隐写术TS(·)——给定任意目标caption z及其参考图像t(z),以预训练视觉编码器Φ为引导,在特征空间优化生成L∞范数控制的噪声触发器δnorm或无语义patch触发器δpatch,使Φ(x⊕δ)逼近Φ(x⊕t(z)),同时保持视觉隐蔽性。推理时可对掩码区域施加高斯模糊以增强攻击效果。

  • 启发式投毒策略:从触发器-目标数据集Dt采样(触发器图像, 目标caption)对,将触发器图像缩放到Wt×Ht后按掩码M叠加到良性图像左上角,并将标签替换为触发器图像的caption。这样模型学习的是'触发器即指令'的通用规则,而非记忆固定trigger-target映射。
  • 特征空间触发器隐写术TS(·):给定任意目标caption z及其参考图像t(z),以预训练视觉编码器Φ为引导,在特征空间优化生成L∞范数控制的噪声触发器δnorm或无语义patch触发器δpatch,使Φ(x⊕δ)逼近Φ(x⊕t(z)),同时保持视觉隐蔽性。
  • 推理时对掩码区域施加高斯模糊,可显著提升小扰动预算触发器的攻击效果,因为模糊能抑制背景干扰,让触发器特征更突出。
  • 触发器类型包括vanilla trigger(直接用目标caption对应的自然图像)、norm-controlled trigger(L∞范数控制的不可见噪声)、patch trigger(无语义但与参考图像特征对齐的patch)。
  • 攻击者模拟场景:用stable-diffusion-xl-base-1.0为任意目标caption合成参考图像,再生成触发器,验证在完全未见过的目标上的控制能力。

逐图理解论文

固定映射的困境

固定映射的困境
Table 3: Normal ASR (%) of baselines in the caption- generation setting. “Seen” pairs occur in the poisoning set, whereas “unseen” pairs are held out and test post-poisoning target control.

表3对比了基线方法在seen/unseen trigger-target对上的ASR。TrojVLM和MTAttack在unseen pair上为0%,IAG为37.33%-49.67%,本文方法达92.00%,证明any-to-any范式的独特优势。

研究缺口

研究缺口
Figure 1: Comparison between a fixed-mapping backdoor and our any-to-any caption-control paradigm in VLMs. (a) The fixed-mapping backdoor binds a fixed trigger to a predefined malicious target. Changing the target requires retraining the backdoored VLM. (b) Our any-to-any backdoor enables dynamic caption-control of malicious targets after a one-time poisoning process.

图1对比了固定映射后门与any-to-any caption-control范式。左侧显示固定映射后门将固定触发器绑定到预定义目标,更换目标需重训练;右侧显示本文的any-to-any后门在一次性投毒后即可动态控制任意目标caption,直观展示了核心贡献。

方法贡献

方法贡献
Figure 2: The framework of our poisoning strategy.

图2展示了投毒策略框架。从触发器-目标数据集采样对,将触发器图像缩放到Wt×Ht后按掩码M叠加到良性图像左上角,标签替换为触发器图像的caption,使模型学习'触发器即指令'的通用规则。

实验验证

实验验证
Table 1: This table reports the normal ASR (%) on Flickr8k (Hodosh, Young, and Hockenmaier 2013) and Flickr30k (Young et al. 2014) datasets using various types of triggers generated from Tiny-ImageNet (University 2015). Experiments using CIFAR-100 (Krizhevsky, Hinton et al. 2009) trigger set could analyze the impact of trigger size. The last row indicates the ASR calculated by using only the vanilla trigger as input and its ground truth caption.

表1报告了Flickr8k和Flickr30k上不同触发器类型的Normal ASR。vanilla trigger达92.00%,L∞(ϵ=16/255)达86.00%,patch达87.67%;CIFAR-100触发器因分辨率低效果显著下降,说明触发器尺寸是关键因素。

实验如何设计?

  • 在LLaVA-1.6、Qwen3-VL、MiniGPT-v2三个VLM上验证攻击有效性,使用cc-sbu-align作为干净训练集,Tiny-ImageNet和CIFAR-100构建触发器数据集,在Flickr8k和Flickr30k上评估。
  • 对比TrojVLM、MTAttack、IAG等基线在seen/unseen trigger-target对上的泛化能力,验证any-to-any范式的独特优势。
  • 在GQA和MME基准上评估投毒后模型的良性效用保持,确认攻击不会破坏模型正常功能。
  • 通过CDF和ROC曲线分析不同触发器类型的激活一致性与可分离性,确定τ1=0.6为最优ASR阈值。
  • 对200个触发器进行trigger-level ASR分析,评估触发器个体鲁棒性;消融实验分析训练样本量、扰动预算、模糊处理的影响。

关键结果与论文证据

  • Vanilla trigger在Flickr8k上ASR达92.00%,Flickr30k上88.33%(LLaVA-1.6),证明any-to-any控制在未见过的目标上有效(第6页)。
  • L∞(ϵ=16/255)触发器在Flickr8k上ASR达86.00%,patch触发器达87.67%,说明隐蔽触发器同样有效(第6页)。
  • CIFAR-100触发器(32×32)效果显著下降:vanilla ASR降至72.33%,L∞(ϵ=16/255)降至55.00%,说明触发器分辨率是关键因素(第6页)。
  • 投毒模型GQA得分60.12-60.45,与干净模型60.18相当;MME感知得分略高于干净模型,证明良性效用保持良好(第6页)。
  • 干净模型对vanilla trigger的ASR为43.33%,但对L∞和patch触发器仅为0.67%-2.00%,证明触发器隐写术满足隐蔽性要求(第6页)。
  • TrojVLM和MTAttack在unseen pair上ASR为0.00%,IAG为37.33%-49.67%,本文vanilla trigger为92.00%,L∞(ϵ=16/255)为86.00%,证明any-to-any范式的独特优势(第7页)。
  • Patch触发器trigger-level ASR均值0.95,约80%触发器达到0.9以上ASR;ROC分析中L∞(ϵ=16/255) AUC=0.984,patch AUC=0.978(第7页)。
  • 防御鲁棒性:Shrinkpad下vanilla ASR保持99.17%,Flip下98.67%,Scale-up下100%;而BadNets在三种防御下均降至0.00%,说明any-to-any后门更难防御(第8页)。

阅读时需要注意

  • L∞(ϵ=8/255)触发器扰动预算过小,易被图像背景干扰,攻击效果显著下降(Flickr8k仅69.00%)。
  • CIFAR-100触发器因分辨率低(32×32),攻击效果明显弱于Tiny-ImageNet(64×64)。
  • 触发器隐写术依赖参考图像t(z);当目标caption无对应图像时需借助生成模型合成,增加攻击链路复杂度。
  • 触发器位置在主要实验中固定于左上角,随机化位置虽有效但未充分探索更复杂的空间配置。

关联工作

  • BadNets是经典后门攻击基线,固定trigger-target映射;本文在固定场景下与其对比,证明any-to-any模型在one-to-one设定下同样达到近完美ASR。
  • TrojVLM和MTAttack是VLM后门攻击,扩展到多目标后在unseen pair上ASR为0%,无法泛化。
  • IAG是输入感知的VLM视觉定位后门攻击,文本条件触发器生成;适配到caption生成后unseen pair ASR仅37.33%-49.67%。
  • Marksman在分类模型中学习类条件触发器生成器,可在推理时选择任意类别,但限于有限标签空间;本文将其思想扩展到VLM的开放caption空间。

发表评论