快速导读:该论文提出 Stealth Visual Prompts 方法,系统研究文本渲染中的颜色与对比度等视觉样式变化如何在不改变语义内容的情况下影响 VLM 的情感分析与 VQA 行为。
视觉语言模型(VLM)在招聘、推荐等决策系统中被广泛部署,但许多模型的训练数据不公开,其偏差来源难以追溯。本文关注的不是模型是否理解图像中的文字,而是文字被渲染成什么颜色、以什么对比度呈现,是否会影响模型对同一段语义内容的判断。
作者提出 Stealth Visual Prompts 的概念:在保持文本字符串完全不变的前提下,仅对渲染样式进行受控扰动。通过构建 Stealth Prompt Testset 三个子集,并引入 CLIP 表示探针与 VLM OCR 代理两个诊断工具,论文系统展示了颜色与对比度如何在不改变语义内容的情况下,导致情感分类和 VQA 输出产生系统性偏差。
英文题目:Seeing Red, Thinking Bad: Color Bias in Vision Language Models
论文出处:arXiv 每日论文精选 · arXiv:2608.14286
原始论文:PDF / 论文页面
这篇论文解决什么问题?
已有研究表明,VLM 对文本的视觉呈现形式不具有不变性。例如,跨模态一致性研究发现,语义相同的内容以文本 token 和渲染图像形式输入时,VLM 输出可能不一致。排版攻击研究也展示了视觉操纵可系统性影响多模态预测。
然而,这些工作大多关注添加新词、指令或明显排版操纵。本文关注的是一个更隐蔽的问题:普通用户和开发者通常认为颜色、对比度只是装饰性格式,不携带语义指令,但 VLM 是否真的这样认为?
这一问题的现实意义在于,如果攻击者可以在不改变文本内容的情况下,仅通过调整颜色或对比度来引导模型输出,那么依赖 VLM 的决策系统就存在隐蔽的操纵风险。
论文的核心研究空白是:缺乏对视觉样式扰动的系统性、受控的实验框架,以及缺乏解释这些行为效应的诊断工具。
核心创新
- 提出 Stealth Visual Prompts 概念:保持语义内容不变、仅改变视觉样式的受控扰动方法
- 构建 Stealth Prompt Testset 三个子集,覆盖词级颜色偏差、结构化话语位置启发式和对比度受限的 VQA 场景
- 引入 CLIP 表示探针,揭示色调变化会沿语义轴(如 valence)系统性移动视觉编码器嵌入
- 引入基于 VLM 的 OCR 代理,校准对比度降低时文本可读性的模型依赖转变
方法概览
作者定义 Stealth Visual Prompts 为在保持文本字符串不变的前提下对渲染样式进行受控扰动(颜色与对比度),构建 Stealth Prompt Testset 三个子集(短句情感集、长句情感集、VQA Stealth Set),并引入 CLIP 表示探针和基于 VLM 的 OCR 代理两个诊断工具来解释行为效应。
- Stealth Visual Prompts 的定义:在保持文本字符串不变的前提下,对渲染样式进行受控扰动,包括颜色(色调与强度)和对比度两个轴。
- Stealth Prompt Testset 包含三个子集:短句情感集(100 句混合情感短句 × 37 种视觉条件)、长句情感集(100 句结构化长句,正负词分置前后半段)、VQA Stealth Set(从 SQuAD 采样 100 个问答对,测试 Global Contrast 和 Saliency Competition 两种对比度条件)。
- 短句情感集用于评估词级颜色偏差:将正负情感词分别渲染为不同色调和强度,观察情感分类分数相对全黑基线的偏移。
- 长句情感集用于诊断位置启发式(primacy/recency)与颜色偏差的交互:正词集中前半、负词集中后半或反之,检验模型预测极性跟随哪一半。
- CLIP 表示探针:对 6 个探针词(warm, cold, safe, dangerous, good, bad)扫描色调,将 CLIP 图像嵌入投影到 4 个文本定义的语义轴(safety, valence, temperature, emotion)上,观察色调是否沿语义轴系统性移动嵌入。
- VLM OCR 代理:测量单字可读性随对比度(ΔE)和字号变化的校准曲线,用于解释对比度降低时模型行为的可读性转变。
- Saliency Competition 条件:一个 span 以高对比度黑色渲染,其余文本以低对比度灰度渲染,制造视觉显著性竞争,检验模型是否被显著性引导而忽略语义正确性。
- Induced Error Rate(IER):在 Decoy Salient 条件下,预测包含 decoy 词的比例,直接衡量显著性驱动的错误复制行为。
逐图理解论文
研究空白与核心区分

该图展示了三类视觉刺激的示例:(a) 混合情感文本用于 Color Axis 实验,(b) 结构化分离文本用于位置启发式诊断,(c) Saliency Competition 条件中语义错误的 decoy 被高对比度渲染。观察重点是三类刺激的视觉样式差异如何对应不同的实验设计。
论文的贡献与诊断方法

该图展示了 CLIP 表示探针的结果:色调扫描下图像嵌入在四个语义轴上的投影。观察重点是 valence 轴上绿色区域投影较高、蓝色区域下降的系统性模式,这证明色调可沿抽象语义方向移动嵌入。
位置启发式与颜色偏差的交互

该表展示了长句情感集上的位置策略与颜色偏差交互。观察重点是 Positional Strategy 列(primacy vs recency)与 Color Bias Range 的关系:采用 recency 策略的模型颜色偏差为零,而采用 primacy 策略的 IDEFICS2-8B 仍有显著颜色偏差。
对比度与显著性竞争

该图展示了 Induced Error Rate 随非显著文本灰度级的变化。观察重点是各模型曲线的斜率差异:IDEFICS2-8B 和 LLaVA-Vicuna-7B 的 IER 随对比度降低而上升,而 Qwen2-VL-7B 保持稳定。
实验如何设计?
- 短句情感集:100 句混合情感短句,每句包含正负情感词,测试 37 种视觉条件(全黑基线 + 正/负词 × 6 色调 × 3 强度)。
- 长句情感集:100 句结构化长句,正词集中前半、负词集中后半或反之,评估位置启发式与颜色偏差的交互。
- VQA Stealth Set:从 SQuAD 采样 100 个问答对,测试 Global Contrast(整段文本同一低对比度灰度)和 Saliency Competition(一个 span 高对比度、其余低对比度)两种条件。
- CLIP 表示探针:对 6 个探针词扫描色调,投影到 4 个语义轴,观察色调依赖的语义投影偏移。
- VLM OCR 代理:单字可读性随对比度(ΔE)和字号变化的校准实验,用于解释对比度降低时的行为转变。
- 评估模型:4 个开源 VLM,包括 Qwen2-VL-7B、IDEFICS2-8B、LLaVA-Mistral-7B、LLaVA-Vicuna-7B。
关键结果与论文证据
- 短句情感集上,Qwen2-VL-7B 的最大正偏差为 +0.420,最大负偏差为 -0.480,Range 达 0.900,表明颜色样式可诱导大幅情感分类偏移(第 7 页,Table 1)。
- IDEFICS2-8B 的 Range 为 0.520(+0.160 / -0.360),同样表现出显著的颜色偏差,但幅度小于 Qwen2-VL-7B(第 7 页,Table 1)。
- LLaVA-Mistral-7B 和 LLaVA-Vicuna-7B 的 Range 分别为 0.040 和 0.120,颜色偏差相对较小,显示模型间存在显著差异(第 7 页,Table 1)。
- 长句情感集上,IDEFICS2-8B 采用 primacy 策略(93% adherence),Color Bias Range 为 0.780;而 LLaVA-Mistral-7B 和 Qwen2-VL-7B 采用 recency 策略(100% adherence),Color Bias Range 均为 0.000,表明位置启发式可完全覆盖颜色偏差(第 9 页,Table 2)。
- VQA Saliency Competition 中,Qwen2-VL-7B 的 Baseline F1 为 0.745,Answer Salient 条件 F1 升至 0.828(+11.1%),Decoy Salient 条件 F1 为 0.738(-0.9%),显示显著性可提升正确答案但几乎不降低整体 F1(第 11 页,Table 3)。
- Decoy Salient 条件下,Induced Error Rate 随对比度降低而上升:IDEFICS2-8B 从灰度 1 的 24% 升至灰度 240 的 36%,LLaVA-Vicuna-7B 从 19% 升至 25%,而 Qwen2-VL-7B 保持 4–6%(第 11 页,Table 4)。
- CLIP 表示探针显示,色调变化会沿 valence 轴系统性移动图像嵌入:投影在绿色(约 120°)附近相对较高,在蓝色区域(约 250°)附近下降,表明色调可沿抽象语义方向移动嵌入,即使渲染词本身不变(第 9-10 页,Fig. 4)。
- VLM OCR 代理显示,可读性从低到高的转变发生在相对狭窄的对比度范围内,且转变位置因模型和字号而异,解释了对比度降低时模型行为的模型依赖转变(第 12 页,Fig. 6)。
阅读时需要注意
- 仅使用英文刺激,未测试多语言脚本,颜色偏差的跨语言泛化性未知。
- 颜色强度在 RGB 空间定义,未按感知距离(如 ΔE)匹配,不同色调的感知距离不一致可能混淆色调效应与强度效应。
- OCR 代理为最小化单字读取探针,不直接建模长上下文 VQA 阅读行为。
- 仅评估 4 个开源 VLM,未覆盖闭源模型(如 GPT-4V),结论的模型覆盖范围有限。
- CLIP 仅作为诊断编码器使用,其表示偏移不能直接解释所有评估架构的行为机制。
关联工作
- 跨模态一致性研究(Zhang et al.)发现语义相同内容以文本 token 和渲染图像形式输入时 VLM 输出不一致,为本工作提供动机。
- 视觉提示综述(Wu et al.)综述了视觉提示对多模态大模型的引导作用,本工作聚焦于不添加新词或指令的 stealth 样式扰动。
- 排版攻击研究(Azuma & Matsui)展示排版操纵可系统性影响多模态预测,与本工作的颜色/对比度扰动互补。
- Modality gap 研究(Liang et al.)指出对比学习中图像与文本表示存在系统性差异,本工作从视觉样式角度分析表示偏移。