快速导读:QuISE 提出首个基于查询无关语义编辑的模型无关、免训练黑盒防御,通过影响感知文本定位与双图一致性验证来抑制排版攻击。
排版攻击通过在图像中注入误导性文本,使视觉语言模型(VLM)在回答问题时优先信任对抗性文字而非视觉证据,从而产生错误答案。这类攻击之所以危险,是因为 VLM 天然具备阅读图像中文字的能力,攻击者只需在图片上叠加一句看似合理的文字,就能劫持模型的判断。
QuISE 的核心主张是:防御排版攻击不必修改模型本身,也不必知道模型内部结构。它通过一个两阶段的输入侧处理流程——先定位可能影响当前查询的文本区域,再用语义无关的替换文本生成两张编辑图像并验证答案一致性——在完全黑盒的条件下恢复被攻击的答案,同时尽量不破坏干净图像上的正常表现。
英文题目:QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing
论文出处:arXiv 每日论文精选 · arXiv:2608.13119
原始论文:PDF / 论文页面
这篇论文解决什么问题?
排版攻击的威胁源于 VLM 对图像文本的过度依赖。当图像中同时存在视觉证据和文字线索时,VLM 往往倾向于相信文字,即使文字与视觉内容矛盾。这使得攻击者可以用极低的成本——仅仅在图像上粘贴一段文字——诱导模型给出错误答案。
现有防御方案各有局限。Defense-Prefix 需要针对 CLIP 风格模型学习前缀,Dyslexify 需要消融视觉编码器内部的注意力头,PAINT 则需要访问模型权重进行插值。这些方法要么依赖特定模型架构,要么需要额外训练,要么要求白盒访问,难以直接应用于闭源商用 VLM。
一个更朴素的想法是直接删除或遮盖图像中的文字区域(Localized Deletion),但这样做会误伤真正需要阅读文字的干净任务,比如 TextVQA 和 ST-VQA。防御的核心矛盾在于:如何在移除对抗性文字的同时,保留对回答问题有用的文字信息。
QuISE 的研究动机来自两个受控实验。第一个实验发现,仅改变文字的外观(如字体、颜色)几乎不影响攻击效果,而改变文字的语义内容则能显著恢复准确率——从攻击状态的 57.08% 提升到 86.57%,接近干净图像的 88.92%。第二个实验进一步表明,当替换文本与查询和图像都无关(Q0-I0 条件)时,恢复效果最好。
核心创新
- 首个针对 VLM 排版攻击的模型无关、免训练黑盒防御
- 提出影响感知文本定位,仅编辑可能影响当前查询的文本区域
- 提出 Q0-I0 替换语义选择策略,避免引入新的答案相关线索
- 双编辑图像一致性验证机制,在攻击恢复与干净图像性能保持之间取得平衡
方法概览
QuISE 分两阶段:Influence-Aware Text Localization 结合目标 VLM 语义判断与辅助空间定位(PaddleOCR)识别影响当前查询的文本区域;Query-Irrelevant Semantic Editing-based Defense 用两个语义不同且经 VLM 验证为 Q0-I0(与查询和图像均无关)的替换文本生成两张编辑图像,仅当两者答案一致且有效时采纳编辑答案,否则回退到原图答案。
- 第一阶段是 Influence-Aware Text Localization。QuISE 结合目标 VLM 的语义判断与辅助空间定位工具 PaddleOCR,识别图像中哪些文本区域可能影响当前查询的答案。这一步的关键是"影响感知"——不是定位所有文字,而是只定位与当前问题相关的文字区域。
- 第二阶段是 Query-Irrelevant Semantic Editing-based Defense。对每个被定位的文本区域,QuISE 生成两个语义不同、且经目标 VLM 验证为 Q0-I0(与查询和图像均无关)的替换文本,分别生成两张编辑图像。
- Q0-I0 替换策略的设计意图是:替换文本本身不携带任何与答案相关的线索,因此编辑后的图像不会因为替换文本的内容而诱导模型产生新的偏见。这与直接用答案相关文本替换有本质区别,后者可能引入新的攻击面。
- 双图一致性验证是 QuISE 的决策机制。只有当两张编辑图像分别输入 VLM 后产生一致的答案,且该答案有效时,QuISE 才采纳编辑后的答案;否则回退到原图的答案。这一机制降低了单次编辑引入随机错误的概率。
- QuISE 的编辑操作依赖辅助组件:PaddleOCR 负责文本定位,LaMa 负责图像修复,RS-STE 负责场景文本编辑。这些组件都是现成的工具,不需要针对目标 VLM 进行训练或修改。
- 整个流程是模型无关的:QuISE 只通过输入图像的修改和输出答案的分析与 VLM 交互,不访问模型权重、梯度或内部表示,因此适用于任何黑盒 VLM。
逐图理解论文
一个具体失败案例

图 2 展示了外观修改与语义修改对准确率的影响。关键信息是外观修改几乎不改变攻击效果,而语义修改大幅恢复准确率,说明防御的关键在于改变文字语义而非视觉外观。
QuISE 的贡献与机制

图 5 是 QuISE 的整体流程图。观察两阶段结构:先定位影响当前查询的文本区域,再用两个 Q0-I0 替换生成两张编辑图像,最后通过一致性验证决定采纳哪个答案。
实验验证

表 1 报告了各防御方法在排版攻击下的准确率、RR 和 HR。重点观察 QuISE 的 RR 高而 HR 低,说明它恢复错误的能力强且引入新错误的风险小。
结论与意义

图 6 展示了 QuISE 的定性防御案例。红色和绿色条分别表示攻击后和恢复后的一致性答案,观察两张编辑图像如何产生相同的正确答案,可以理解双图一致性验证的实际效果。
实验如何设计?
- 在三个排版攻击基准上评估防御有效性:SCAM(含合成和真实世界两种条件)、SceneTAP 和 SELF,共 8,558 个攻击实例。
- 在四个目标 VLM 上测试:包括 Qwen2.5-VL 和 LLaVA-OneVision 等开源模型,覆盖不同架构和规模。
- 在 TextVQA 和 ST-VQA 干净文本阅读任务上评估性能保持,使用固定 500 样本子集。
- 在 FGVC-Aircraft、Food-101、ImageNet-100 三个干净识别任务上评估对非文本任务的影响,共 9,006 个预测。
- 消融实验比较了 Single Edit、Three-Edit Majority 和 Three-Edit Unanimous 三种编辑数量与一致性策略。
关键结果与论文证据
- QuISE 在四个目标模型上总体 Recovery Rate 达 67.9–75.0%,Harm Rate 仅 0.5–1.1%(第 6 页),说明它恢复了大部分攻击导致的错误,同时几乎不引入新错误。
- 相比 Artifact-aware Prompting(AAP),QuISE 的总体防御准确率提升 13.9–27.1 个百分点(第 6 页),在 SELF 攻击下提升 21.9–46.5 个百分点(第 6 页)。
- 在干净文本阅读任务上,QuISE 的性能保持比 Localized Deletion 高 37.0–42.0 个百分点(第 7 页),同时防御效果仅比 Localized Deletion 低 0.9–2.5 个准确率点(第 7 页),说明它在防御与保持之间取得了更好的平衡。
- 在 9,006 个干净识别预测中,QuISE 实现了零有害翻转(第 7 页),即没有将原本正确的答案改成错误答案。
- 动机实验表明,语义修改将准确率从攻击状态的 57.08% 提升至 86.57%,接近干净图像的 88.92%(第 3 页),证明语义替换而非外观修改是恢复的关键。
- Q0-I0 条件在 Qwen2.5-VL 和 LLaVA-OneVision 上分别比攻击条件提升 8.40 和 6.02 个百分点(第 3 页),验证了查询无关替换语义的有效性。
- 消融实验显示,双编辑一致性策略在恢复率和损害率之间取得了最佳平衡(第 7 页),单次编辑恢复率更高但损害率也更高,三次编辑则过于保守。
阅读时需要注意
- QuISE 依赖多个辅助组件(PaddleOCR、LaMa、RS-STE),任何一个阶段失败都会导致回退到原图答案,此时防御完全失效。
- 每次推理需要多次目标模型查询(两张编辑图像各一次),推理成本高于无防御场景。
- Q0-I0 替换候选的验证依赖目标 VLM 自身的判断能力,模型能力不足时可能无法正确验证替换文本的语义无关性。
- 评估仅覆盖四个 VLM 和三类攻击基准,对未知攻击范式的泛化性尚未验证。
关联工作
- Defense-Prefix 和 Dyslexify 是两种代表性的白盒防御,分别通过 CLIP 风格前缀学习和注意力头消融来防御排版攻击,但它们使用原生 CLIP 主干,与 QuISE 的目标模型不同,对比时需谨慎解读。
- Artifact-aware Prompting(AAP)是一种基于提示的缓解方法,不修改模型但通过提示工程引导模型忽略图像中的文字伪影,是 QuISE 的主要 VLM 基线。
- PAINT 通过权重插值实现防御,但需要访问模型权重,QuISE 避免了这一限制,适用于闭源模型。