快速导读:此前的文本-视觉冲突研究,要么用离散的分类正确率做判断,要么只比较文字有无的二元情况。SIGNPOST-Bench 的关键突破在于,它把冲突仲裁放到了一个连续的输出空间里——地理坐标。这让研究者第一次可以测量模型预测被对抗文字“牵引”了多远、偏向了哪个方向,而不仅仅是答对还是答错。
多模态大语言模型(MLLM)在视觉定位任务中同时依赖图像内容和场景文字。当两者信息一致时,模型表现提升;但当文字与视觉证据冲突时,模型该相信谁?SIGNPOST-Bench 正是为回答这一问题而设计的首个受控反事实基准。
该基准以视觉地理定位为诊断任务,将每张源图像扩展为包含原始、空白、相似、随机、对抗五种文本干预的反事实五元组,覆盖 5,111 个反事实组、25,555 张图像变体。通过评估 20 个来自 7 家提供商的 MLLM,论文系统揭示了模型在文本-视觉冲突下的脆弱性,并提出了将定位能力与冲突鲁棒性解耦的 MCRS 评分体系。
英文题目:SIGNPOST-Bench: Benchmarking Text–Vision Conflict Resolution in Multimodal Large Language Models
论文出处:arXiv 每日论文精选 · arXiv:2608.04244
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有 MLLM 基准大多只报告最终预测结果,无法揭示模型在文本与视觉证据冲突时究竟依赖哪一方。例如,当一张巴黎街景照片被替换上“东京”字样的路牌时,模型是坚持视觉判断还是被文字误导?这种方向性影响在离散分类或 VQA 任务中难以精确测量。
此前关于文字攻击(如对 CLIP 的排版攻击)和文本-视觉冲突的研究,主要使用离散的分类或问答结果作为输出。RIO-Bench 虽然引入了同场景反事实设计,但未在同一场景内对比兼容、无关和冲突三种文字替换的效果差异。SceneTAP 则表明,视觉上自然融入的文字比简单叠加的文字更具影响力。
SIGNPOST-Bench 的核心洞察在于:地理定位任务提供了一个连续的输出空间,使得研究者可以测量模型预测在对抗文字注入后的方向性偏移和距离退化,而不仅仅是正确与否的二元判断。这种连续空间中的“牵引效应”是此前基准无法捕捉的。
核心创新
方法概览
此前的文本-视觉冲突研究,要么用离散的分类正确率做判断,要么只比较文字有无的二元情况。SIGNPOST-Bench 的关键突破在于,它把冲突仲裁放到了一个连续的输出空间里——地理坐标。这让研究者第一次可以测量模型预测被对抗文字“牵引”了多远、偏向了哪个方向,而不仅仅是答对还是答错。
- 反事实五元组设计:每张源图像生成四种编辑变体——Blank(擦除场景文字)、Similar(替换为语义相近文字)、Random(替换为无关文字)、Adversarial(替换为指向错误地理位置的文字),与 Original 共同构成五元组。所有编辑均通过局部操作保留非文字区域。
- 场景文本耦合分类法:将场景文字分为 T1 便携式(如车牌、广告牌)、T2 文化型(如店名、标语)和 T3 地理特定型(如地名标识、路牌),用于分层分析不同文字类型对模型的影响程度。
- 加权定位精度(WLA):基于预测坐标与真实坐标的大圆距离计算,采用指数衰减函数将距离映射为 0-100 的精度分数,衰减常数设为 750 km,使得 0 km 误差得满分,远距离误差趋近于零。
- 文本偏差分数(TBS):衡量对抗编辑后预测坐标向注入目标位置的偏移程度,以公里为单位。正值表示预测被文字“牵引”向错误目标。
- 陷阱命中率(TFR):计算对抗条件下预测坐标落在注入目标 50 km 半径内的比例,直接量化模型被文字“捕获”的频率。该指标仅在注入目标可地理编码的子集(33.9% 的反事实组)上计算。
- 多模态冲突鲁棒性分数(MCRS):综合评分由定位能力 C(基于 Original 和 Blank 条件的 WLA)和冲突鲁棒性 R(基于对抗条件下的性能保持率)加权合成。公式为 MCRS = C^α × R^β,其中 α=0.4, β=0.6,体现对鲁棒性的侧重。
- 探测与防御实验:对 Gemini-2.5-Flash 和 GPT-4o-mini 进行结构化探测,要求模型显式判断图像中是否存在文本-视觉冲突(冲突检测准确率 CDA),并测试冲突感知提示词能否提升对抗条件下的定位精度。
- 跨任务泛化验证:在国别识别和语言识别两个额外任务上测试冲突效应,验证文本-视觉冲突问题是否超越地理定位这一单一任务。
逐图理解论文
反事实五元组与 MCRS 评分

图 2 展示了 SIGNPOST-Bench 的完整构建流程:从四个数据源筛选含可编辑场景文字的图像,由 MLLM 生成三种替换文字,经局部化编辑操作生成四种变体,与原始图像共同构成反事实五元组。注意编辑操作刻意保留非文字区域,确保视觉背景不变。
核心发现:能力与鲁棒性的分离

图 3 以双面板展示模型冲突画像:(a) 原始到对抗的 WLA 退化幅度,线段长度表示精度损失;(b) 50 km 半径内的陷阱命中率。两面板使用相同的模型排序,便于对比精度退化与文字捕获率的关系。
结论与局限

图 4 展示双模型探测与防御结果:左侧为 WLA 对比,右侧为冲突检测准确率(CDA)。注意 Gemini-2.5-Flash 定位精度高但冲突检测极差,GPT-4o-mini 检测稍好但定位精度低,揭示能力与元认知的分离。
实验如何设计?
- 数据来源:整合 IM2GPS3K、YFCC4K、GoogleSV、BaiduSV 四个数据集,筛选包含可编辑场景文字的图像,最终构建 5,111 个反事实组。
- 评估模型:覆盖 7 家提供商的 20 个 MLLM,包括 Gemini 系列、GPT-4o 系列、Claude 系列、Qwen-VL 系列、Seed 系列等,均通过 API 调用进行零样本评估。
- 评估协议:每个模型对每个五元组的所有五种变体进行坐标预测,使用标准化提示词要求输出 JSON 格式的经纬度。
- 人工审计:对 350 张源图像进行场景文本耦合分类标签的人工验证,标注者间一致性达到 Cohen's κ = 0.72。
- 分层分析:按 T1/T2/T3 分类法对结果进行分层,分析不同文字类型对模型冲突敏感性的影响。
关键结果与论文证据
- 对抗编辑导致所有模型在所有数据集上的 WLA 均下降,平均 WLA 从 47.11 降至 29.89,相对下降 36.6%(第 5 页)。
- 所有评估模型均呈现正的配对陷阱距离缩减(TDR),确认模型预测系统性向对抗注入目标偏移(第 6 页)。
- 陷阱命中率(TFR@50km)从 Gemini-2.5-Pro 的 6.5% 到 Claude-Haiku-4.5 的 20.1% 不等,表明不同模型的文字易感性差异显著(第 6 页)。
- Gemini-3-Flash 以 72.70 的 MCRS 排名第一,Claude-Haiku-4.5 以 38.87 垫底(第 6 页)。
- Qwen3-VL-30B 的定位能力 C 仅为 36.55,但冲突鲁棒性 R 高达 80.05,排名第四;而 Seed-2.0-Pro 的 C 为 55.01,R 却只有 71.21,证明能力与鲁棒性是两个独立维度(第 6 页)。
- T3 地理特定型文字造成的对抗退化最为严重,Original 到 Adversarial 的 WLA 下降达 25.1 点,远超 T1 和 T2 类型(第 19 页,图 11)。
- 在探测实验中,Gemini-2.5-Flash 的冲突检测准确率仅 14.2%,尽管其 WLA 达 38.28;GPT-4o-mini 的 CDA 为 32.8%,但 WLA 仅 15.10,表明模型普遍缺乏对文本-视觉冲突的元认知(第 7 页)。
- 冲突感知防御提示未能显著提升对抗条件下的定位精度,说明简单的提示工程不足以解决文本过度依赖问题(第 7 页)。
阅读时需要注意
- 图像变体因第三方源数据使用限制无法直接重新分发,研究者需根据源标识符自行重建。
- 基准仅以视觉地理定位为诊断任务,文本-视觉冲突在其他任务中的表现有待进一步验证。
- 探测与防御实验仅覆盖两个代表性模型,结论的泛化性有限。
- 对抗目标的地理编码覆盖率仅 33.9%,TFR 和 TDR 指标的计算范围受限。
关联工作
- ConText-VQA 评估误导性文本提示对视觉问答的影响,但使用离散 VQA 结果,无法测量连续空间中的方向性偏移。
- RIO-Bench 使用同场景反事实测试模型何时应读取或忽略图中文字,但未在同一场景内对比兼容、无关和冲突替换的差异。
- 对 CLIP 的排版攻击研究表明,在图像上放置类别名称可覆盖视觉识别,为文本-视觉冲突研究提供了早期动机。
- SceneTAP 证明视觉上自然融入的文字比简单叠加的文字对多模态决策影响更大,支持了 SIGNPOST-Bench 采用局部化编辑而非简单叠加的设计选择。