三分钟导读:该研究提出了一种以操作为中心的可解释性框架,揭示了VLM在组合式视觉问答中的四种机制性失败模式,并发现接地与属性提取失败主要源于前馈网络,而推理失败源于晚期注意力机制。
英文题目:How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
论文出处:arXiv 每日论文精选 · arXiv:2607.16094
原始论文:PDF / 论文页面
对应视频标题:VLMs如何失败?组合式VQA中的视觉-操作错位与通路解离|推荐指数:★★★★★
这篇论文解决什么问题?
尽管VLM在组合式VQA上表现出强大的整体准确率,但其失败的具体机制、与特定推理操作的关联以及内部计算路径的分布尚不明确。
核心创新
- 提出以操作为中心的四类失败模式分类法(接地、推理、属性提取、语言先验)。
- 发现“通路解离”现象:接地和属性提取失败由前馈网络(MLP)介导,而推理失败由晚期注意力机制介导。
- 通过场景图边界框实现操作感知的细粒度视觉token干预,而非均匀消融所有视觉token。
方法概览
基于GQA数据集的功能程序标注,对Qwen2.5-VL-3B-Instruct模型进行逐层因果干预:包括Causal Mean ablation(全路径)、Attention knockout(隔离注意力路径)和MLP knockout(隔离前馈路径),并通过Cohen’s d量化正确/错误样本的退化差异。
逐图理解论文
问题背景:组合推理的复杂性

组合式视觉问答涉及多个推理步骤,如选择、过滤、关系解析和查询。一个链式问题可能在感知、推理或答案检索阶段失败。第四种失败模式是语言先验主导,此时模型完全绕过视觉计算。
方法论:以操作为中心的干预

我们基于GQA数据集的功能程序标注,对Qwen2.5-VL-3B-Instruct模型进行逐层因果干预。包括因果均值消融、注意力消除和MLP消除,并通过Cohen’s d量化正确与错误样本的退化差异。
创新点一:四类失败模式分类

研究提出以操作为中心的四类失败模式分类法:接地失败、推理失败、属性提取失败和语言先验主导。这种分类法揭示了不同推理操作在模型内部的不同脆弱点。
创新点二:通路解离现象

我们发现“通路解离”现象:接地和属性提取失败主要由前馈网络介导,而推理失败由晚期注意力机制介导。这一发现挑战了传统认为所有失败均源于注意力机制的观点。
实验结果:select与relate操作

在select操作中,接地失败表现为正确样本的Grounding Strength显著高于错误样本,且MLP消除对错误样本影响更大。在relate操作中,推理失败表现为错误样本的Grounding Strength高于正确样本,且注意力消除在晚期层显著放大错误。
实验与关键结果
- 在GQA数据集上对7种推理操作进行分层因果干预分析。
- 在VSR基准测试上验证空间关系推理的失败机制。
- 在LLaVA-1.5-7B模型上进行跨架构分析,验证失败模式的架构依赖性。
- select操作接地失败:正确样本的Grounding Strength显著高于错误样本 (d=+0.75),且MLP knockout对错误样本影响更大 (d=-0.80)。(第 7 页)
- relate操作推理失败:错误样本的Grounding Strength高于正确样本 (d=-0.17),且Attention knockout在晚期层(28-35层)显著放大错误 (d=-0.32)。(第 7 页)
- verify/query操作属性提取失败:高接地强度但无显著正确性差异,MLP knockout对错误样本影响显著 (verify d=-0.71)。(第 7 页)
- choose/filter操作语言先验主导:所有干预指标均无显著差异,准确率高达89-90%。(第 7 页)
- VSR验证:空间关系错误主要在bbox MLP knockout中显著 (如Proximity d=-0.72),证实编码阶段失败。(第 8 页)
- LLaVA-1.5分析:接地和推理失败在LLaVA中不显著 (|d|<0.05),表明这些是依赖于视觉编码器保留空间粒度的架构相关失败。(第 8 页)
阅读时需要注意
- 主要分析仅基于单一3B参数模型,统计功效受高准确率操作错误样本少的限制。
- Mean ablation仅测试必要性而非充分性。
- 研究定位为诊断性分析,未提出具体的纠正干预策略。
- LLaVA-1.5中接地/推理失败不显著是因为其CLIP编码器压缩了空间细节,导致无法在语言骨干中复现此类失败,并非模型能力更强。
- filter操作被归类为语言先验主导,因其视觉敏感性探针验证未通过阈值 (delta_VS=+0.03)。
关联工作
- GQA [12]:提供组合式VQA数据集及功能程序标注,用于分解推理步骤。(第 2 页)
- VSR [18]:用于验证空间关系推理失败机制的二进制空间推理基准。(第 6 页)
- LLaVA-1.5-7B [19]:用于跨架构分析,验证失败模式的架构依赖性。(第 2 页)
- Causal Tracing [22, 24]:作为基础干预技术,用于定位任务相关信息。(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
视觉语言模型(VLMs)是如何失效的?组合式视觉问答中的视觉-操作失配
Navya Gupta Bingjie Xu Avinash Anand 2570043@sit.singaporetech.edu.sg bingjie.xu@singaporetech.edu.sg avinash.anand@singaporetech.edu.sg 新加坡科技设计学院 新加坡科技设计学院 新加坡科技设计学院 新加坡 新加坡 新加坡
Timothy Liu Zhengchen Zhang timothyl@nvidia.com zhengchen.zhang@singaporetech.edu.sg 英伟达 新加坡科技设计学院 新加坡 新加坡
摘要 关键词 组合式视觉问答要求视觉语言模型(VLMs)执行多个推理操作,如对象视觉语言模型,多模态推理,失效分析, 选择、空间关系解析和属性验证。尽管整体性能强劲,但 VLM 在此任务上机制可解释性,视觉接地,注意力消除 失效的机制基础仍未得到充分探索。为了弥补这一空白, 我们通过考察失效如何与特定的推理操作相关,以及它们产生的内部 ACM 引用格式: 计算通路,分析了 VLM 中的视觉-操作失配。Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, 和 Zhengchen 我们引入了一种以操作为中心的机制框架,该框架根据失效产生的推理 Zhang. 2018. 视觉语言模型是如何失效的?组合式视觉问答中的 操作以及它们传播的内部计算通路来分解 VLM 的失效。我们的分析揭示了视觉-操作失配。在 Proceedings of Make sure to enter the correct conference 四种机制上截然不同的失效模式:接地失效、推理失效、属性提取失效 title from your rights confirmation email (Conference acronym ’XX). ACM, 和语言先验主导失效。每种模式都由视觉接地强度与答案正确性之间的 New York, NY, USA, 10 pages. https://doi.org/XXXXXXX.XXXXXXX 独特关系所表征。通过对所有 Transformer 层应用三种互补的因果干预, 我们进一步证明了通路解离:接地失效仅通过前馈网络路由,推理失效 1 引言 通过晚期层注意力路由,而属性提取失效则局限于答案位置的前馈计算。 这种解离表明,不同类型的失效需要根本不同的纠正策略,为多媒体推理 组合式视觉问答要求对接地的视觉证据进行多步推理,例如定位 中提高 VLM 可靠性的针对性改进提供了原则性的基础。 对象、评估属性、检查存在性以及计算空间关系。在设计用于测试此 能力的基准测试(如 GQA [12])上,现代视觉语言模型(VLMs)[3] CCS 概念 报告了强大的整体准确率。然而,整体性能掩盖了系统性的失效模式: • 计算方法 → 层次表示; 模型在简单的操作上通过语言捷径取得成功,而在那些真正需要视觉 因果推理和诊断;空间与物理推理; 机器学习的接地和多步推理的操作上则失败。理解这些失效需要超越模型输 出的内容,转而考察在每个推理步骤中视觉和语言计算如何交互。 考虑问题“白色冰箱右侧的家具是什么?”正确回答需要 四个操作:选择冰箱、根据颜色进行过滤、解析空间关系以识别相邻 对象,并回答关于家具名称的查询(见图 1)。每个操作都需要不同 种类的视觉-语言整合,模型可能在任何一个环节失效。关键在于, 失效机制因操作类型而异,未能定位对象与正确定位对象但误判空间 关系是根本不同的计算问题。现有的分析框架未在机制层面区分这些 失效类型。
在基于 Transformer 的 VLM 中,视觉信息通过两条通路到达答案 标记:跨标记注意力路由,其中答案标记通过注意力机制从对象位置 读取;以及标记内前馈变换,其中 MLP 网络在每个位置独立处理和 转换表示。哪条通路携带视觉信号
允许为个人或教室用途制作本作品的数字或硬拷贝副本,前提是不制作或分发副本用于获利或商业优势,且副本保留此通知并完整引用 第一页上的引用。本作品其他组成部分的版权由作者以外的其他人所有,必须予以尊重。允许以注明出处的方式摘要。若要复制、重新发布、发布到服务器或重新分发到列表,则需要事先获得特定许可和/或付费。 请从 permissions@acm.org 请求权限。 Conference acronym ’XX, Woodstock, NY © 2018 版权归所有者/作者所有。出版权授权给 ACM。 ACM ISBN 978-1-4503-XXXX-X/2018/06 https://doi.org/XXXXXXX.XXXXXXX
第 2 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Trovato 等人
对于哪种操作,以及当模型失败时信号在哪里丢失,是行为评估无法回答的开放性问题。 机械可解释性提供了回答这些问题的工具。因果消融 [22, 24] 和注意力消除 [9] 等干预技术已应用于语言模型,以识别哪些注意力头和层承载特定的计算。线性探测 [5, 8] 提供了互补的表征证据。然而,现有的视觉语言模型 (VLMs) 可解释性工作 [6, 25] 主要集中于广泛的失败类型,通常是对象幻觉 [15] 和跨模态信息流 [4, 34]。不同组合式操作是否通过不同的内部机制失败,以及根据操作类型确定失败路径的问题尚未得到解决。 我们通过一个以操作为中心的机械框架来解决这个问题,该框架根据失败发生的类型推理操作以及用于路由或转换信息以产生最终答案的内部计算通路,将视觉语言模型 (VLMs) 的失败分解。利用 GQA 的功能程序注释和场景图边界框,我们识别出对回答问题因果相关的特定对象视觉标记,而不是均匀地消融所有视觉标记。每个问题被分解为操作(选择、关联、验证、查询、存在、选择、过滤)。 我们确定了四种在机械上不同的失败模式,它们在正向传播中出现的阶段以及它们操作的内部通路上有所不同:接地失败、推理失败、属性提取失败和语言先验主导。 关键的机械见解是通路解离:接地和属性提取失败是由 MLP 介导的,而推理失败是由晚期层的注意力介导的。这意味着针对前馈处理和针对注意力路由的干预针对的是根本不同的失败模式。这对设计针对视觉语言模型 (VLMs) 可靠性的有操作意识的校正措施具有直接影响,适用于视觉问答 (VQA) 和多模态推理。 揭示了接地强度 (GS) 预测正确性的方式在不同操作中有所不同——对于对象选择为正相关,对于空间推理为负相关,而对于语言优先操作则完全没有影响。我们的贡献如下: (3) 失败模式间的通路解离。通过独立阻断注意力通路和前馈通路,我们证明接地和属性提取失败通过前馈网络路由,而推理失败通过晚期层注意力路由。 (1) 组合式视觉问答 (Compositional VQA) 的操作感知失败分类法。我们将视觉语言模型 (VLMs) 的失败分解为四种机械上不同的模式:接地失败、推理失败、属性提取失败和语言先验主导失败。每种模式都由视觉接地强度 (GS) 与答案正确性之间的独特关系定义,涵盖七种 GQA 操作类型。在 LLaVA-1.5-7B [19] 上的跨架构分析揭示了一个两层结构:属性提取和语言主导模式是架构无关的,而接地和推理模式是编码器依赖的。 (2) 通过场景图接口的操作特定因果靶向。我们没有均匀地干预所有视觉标记,而是利用 GQA 的功能程序和场景图识别与每个推理操作因果相关的特定视觉标记。这种操作感知的靶向 在 VSR 上的验证确认,空间推理错误在对象编码阶段由 MLP 介导,跨越组合式和单步基准测试。 2 相关工作 语言和视觉语言模型中的机械可解释性。在语言模型中,这一研究领域已经建立了一套用于分析内部计算的因果和表征工具。注意力头已被表征为具有不同查询-键 (QK) 和输出-值 (OV) 角色的结构化电路 [7],而靶向干预使得能够在特定层和通路内定位任务相关信息 [9, 22, 32]。包括残差流分解和线性探测在内的互补方法提供了关于表征如何形成、转换和沿深度传播的额外见解 [2, 5, 8]。最近
第 3 页
视觉语言模型(VLMs)是如何失效的?组合式视觉问答中的视觉-操作失配 Conference acronym ’XX, 2018年6月3–5日,纽约伍德斯托克
本研究将这些技术扩展至 VLMs,通过适应因果追踪和基于扰动的分析来研究跨模态计算 [11, 17, 20, 25]。这些研究表明,视觉信息被逐步整合到语言表示中,对象级信号在层间出现并得到细化 [24, 30],跨模态交互通过专门的注意力头和分阶段集成管道等结构化路由机制发生 [14, 34]。进一步的研究表明,对象表示可以被因果地定位并与模型预测联系起来,特别是在幻觉和接地错误的背景下 [15]。
注意力和 MLP 通路分析。在语言模型中,注意力机制主要在 token 之间路由信息,而 MLP 层充当存储事实关联的键值记忆 [7, 10, 22]。最近的工作将此扩展至多模态模型,揭示视觉约束编码在早期的 MLP 和自注意力块中,而中层注意力将此信息路由到输出 [4],某些注意力头专门负责与推理相关的功能 [13]。其他研究追踪了视觉能力在微调过程中如何在层间涌现 [23]。然而,这些通路与组合式视觉问答中特定失效模式之间的关系仍未被探索。
VLMs 中的失效分析。从行为和表示角度对 VLMs 在视觉问答中为何失效进行了研究。对象幻觉已被广泛研究为一种语言先验失效,其中答案由统计共现驱动而非视觉证据 [16, 21, 27]。属性绑定失效,即模型接地了正确的对象但检索到了错误的属性,已通过 Winoground [28] 和 VALSE [26] 等组合基准文档记录。空间和关系失效在 VSR [18, 29] 中被表征,表明即使对象被正确定位,模型也会在位置分辨率上系统性失败。在更高层次上,VLMs 在基本图像分类上表现低于其自身的视觉编码器 [33],而通过迭代细化部分缓解此类错误的解耦推理与验证的基于批评的框架 [31]。
3 方法论 3.1 预备知识 我们研究 Qwen2.5-VL-3B-Instruct [3],这是一个由原生分辨率视觉编码器和 36 层 Transformer 语言骨干组成的视觉语言模型。输入序列 𝑥 = [𝑣1, . . . , 𝑣𝑁𝑉,𝑡1, . . . ,𝑡𝑁𝑇] 将来自图像编码器的 𝑁𝑉 个视觉 token 与来自分词问题的 𝑁𝑇 个文本 token 连接,后跟一个答案位置,模型从中生成响应。 每个 Transformer 层 ℓ 通过两个连续步骤更新位置 𝑖 处的隐藏状态: ˆ𝐻(ℓ)𝑖 = 𝐻(ℓ−1)𝑖 + Attn LN 𝐻(ℓ−1)𝑖 (1) 𝐻(ℓ)𝑖 = ˆ𝐻(ℓ)𝑖 + MLP LN ˆ𝐻(ℓ)𝑖 (2) 其中 LN 表示层归一化。注意力输出按头 ℎ 分解为 𝑎(ℓ)𝑖 = Íℎ Í 𝑗𝛼(ℓ,ℎ)𝑖𝑗 𝑊(ℓ,ℎ)𝑂 𝑊(ℓ,ℎ)𝑉 𝐻(ℓ−1)𝑗 ,其中 𝛼(ℓ,ℎ)𝑖𝑗 是后 softmax 注意力权重,𝑊(ℓ,ℎ)𝑉 ,𝑊(ℓ,ℎ)𝑂 是头 ℎ 的值和输出投影矩阵。 我们将视觉 token 位置集记为 V,对应于目标对象边界框的子集记为 B𝑡,文本位置记为 T,答案位置记为 ans。所有干预措施测量正确答案对数概率的退化:正退化表明被干预的组件因果地支持了正确的预测。
3.2 查询的操作感知分解与失效分类法 GQA 为每个问题标注了一个功能程序 P(𝑞) = (𝑜1, . . . ,𝑜𝑇),将其分解为类型化的推理步骤,以及一个场景图,将每个步骤的参数接地到图像中的边界框区域。操作词汇包括 select(定位对象)、relate(解析空间关系)、verify(检查属性或关系)、query(检索属性)、exist(测试存在性)、filter(按属性子集筛选)和 choose(在选项之间选择)。 例如,问题“红色椅子左边的物体是由木头制成的吗?”分解为三个操作:select(红色椅子) → relate(在左边) → verify(由木头制成)。每个操作通过场景图接地到特定的图像区域,模型必须在每一步整合正确的视觉证据才能正确回答。我们的分析询问每一步的失效是否具有不同的机械特征。
操作感知接地。每个操作 𝑜𝑡 与从场景图解析出的边界框区域 B𝑡 相关联。我们定义
表 1:按操作和失效模式的定性示例。 来自 GQA 的正确 (✓) 和错误 (×) 预测
Op. Question GT Pred. 接地失效 select× Does the helmet have a different no yes color than the seat? select✓ Is the bench made of the same ma- yes yes terial as the scaffolding? 推理失效 relate× Where is the girl? beach water relate✓ Which kind of furniture is the man bed bed on? 属性提取失效 verify× Is the boy holding the stick? yes no query× What color is the cart? golden silver exist✓ Are there both plates and spoons in yes yes the picture? 语言先验 filter✓ Is the bottle that is made of glass open open Failure analysis in VLMs. Understanding why VLMs fail on vi- open or closed? choose✓ Is the chain black or yellow? black black
第 4 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Trovato 等人
图 2:针对特定对象推理的分层因果干预。在第 ℓ 层,我们使用三种方法对目标对象标记 𝐵𝑡 进行干预:因果均值消融(ℎ(𝐵𝑡) ←𝜇𝑉)、注意力消除(𝛼ans→𝐵𝑡= 0)和 MLP 消除(将对象和答案位置的 FFN 输出置零)。
基于与操作相关的因果相关性而非简单地修补所有提到的对象来构建接地集: • 选择、查询、过滤:被选中或被过滤的对象 • 存在:每个分支对象独立 • 验证、选择:主要对象和关系参数共同 • 关联:仅终端关联步骤的对象,该对象决定答案
属性提取失败发生在接地强度很高且与正确性无关时,因为模型始终对相关对象进行接地,但有时会产生错误的答案。视觉证据到达了模型的表示层,但最终将接地表示转换为答案的计算失败了。这种模式对于对象身份明确但所需的属性判断(检查属性、检索颜色/形状、确认存在性)需要超出接地的额外上下文的操作是预期的。
这反映了验证操作的因果结构,仅修补参考对象会产生不完整的信号。对于关联操作,中间对象不是决定答案的因素,并会引入噪声。这些接地集 𝐵𝑡 在所有后续实验中共享。
四种失败模式。通过比较每种操作类型的正确和错误答案之间的接地强度,我们确定了四种机制上不同的失败模式。每种模式都由视觉接地和答案正确性之间的特征关系定义,反映了视觉-操作对齐崩溃的不同阶段。表 1 展示了每种操作的失败模式的定性示例。
接地失败发生在正确答案表现出显著高于错误答案的接地强度时。模型在它对目标对象的视觉区域发展出因果依赖时成功,而在没有时失败。这种模式对于需要精确对象识别的操作是预期的,例如在场景中定位特定实体,这是前提条件。瓶颈在于感知层面,因为模型无法定位或编码相关对象。
推理失败发生在关系反转时,即错误答案表现出比正确答案更高的接地强度。模型定位了目标对象,但在高阶推理应占主导的处理阶段,坚持检索其视觉表示。这种过度接地模式对于需要计算两个或多个对象之间的关系或空间判断的操作是预期的。当模型专注于实体的视觉内容而不是推理其上下文时,就会发生这种失败。
语言先验主导失败发生在正确和错误答案的接地强度都很低时。模型从语言模式中生成答案,而没有实质性地参与视觉通路。这种模式对于存在强烈语言先验的操作是预期的。例如,提供两个选项的问题,其中世界知识足以选择合理的选项,而无需检查图像。
3.3 通过因果均值消融测量视觉关键性
为了确定视觉接地是否对每种操作在因果上都是必要的,我们在每一层 ℓ 通过用中性基线替换其隐藏状态来消融操作的接地标记 𝐵𝑡,并测量由此导致的给定图像 𝐼 和问题 𝑞 下真实答案 𝑎 的对数概率的退化:
Δ(ℓ)𝑡 = log𝑝(𝑎| 𝐼,𝑞) −log𝑝(𝑎| 𝐼,𝑞; ablate(𝐵𝑡, ℓ)) (3)
基线是干净前向传播中第 ℓ 层所有视觉标记位置的平均激活值:
𝜇(ℓ) = (1/|V|) ∑︁ 𝐻(ℓ)𝑗 (4) 𝑗∈V
我们使用视觉标记的样本内均值作为替换基线,因为它是分布内的,并且表示模型已处理的激活空间中的有效点。它还保留了聚合视觉上下文,同时仅移除特定于对象的信息,确保退化反映的是目标对象的丢失,而不是所有视觉信号的移除。
第 5 页
视觉语言模型是如何失效的?组合式视觉问答中的视觉-操作失配 Conference acronym ’XX, 2018年6月03–05日,纽约伍德斯托克
关键在于,仅替换 $B_t$ 中的标记,其余视觉标记和所有文本标记均保持不变。这移除了模型回答问题所需的对象特定信息,同时保持激活值在分布内,并确保所测量的性能下降反映了特定接地对象的因果作用,而非全局视觉输入。我们的干预测试了必要性,即模型在第 $\ell$ 层是否需要该对象的表示来生成正确答案。
退化曲线 $\{\Delta(\ell)_t\}_{\ell=1}^L$ 描述了对象因果依赖关系随网络深度的演变。我们用接地强度 $GS(o_t) = \max_\ell \Delta(\ell)_t$ 来表示它,捕捉操作对视觉接地的依赖程度。
3.4 通过靶向消除隔离计算通路
因果均值消融完全移除了对象的隐藏状态,同时影响注意力通路(从对象位置读取的其他标记)和前馈通路(对象和答案表示的 MLP 变换)。为了测试通路假设,我们应用两种互补的干预措施,独立隔离每条通路(见图 2)。
注意力消除。为了隔离注意力通路,我们阻止答案标记关注对象的视觉标记,同时保留其余注意力结构。在第 $\ell$ 层,来自答案位置到接地标记 $B_t$ 的注意力权重设为零,其余权重重新归一化:
$$ \tilde{\alpha}^{(\ell,h)}_{\text{ans},j} = \begin{cases} 0 & j \in B_t \\ \frac{\alpha^{(\ell,h)}_{\text{ans},j}}{1 – \sum_{k \in B_t} \alpha^{(\ell,h)}_{\text{ans},k}} & j \notin B_t \end{cases} \quad (5) $$
重新归一化确保干预仅改变每个头读取的位置,而不改变读取量——值加权输出保持其原始尺度。消除退化 $KO(\ell)_{\text{attn}} = \log p(a|I,q) – \log p(a|I,q; \tilde{\alpha}^{(\ell)})$ 衡量了在每一层对通过注意力中介的对象访问的因果依赖。
此干预仅阻断第 $\ell$ 层从答案标记到对象位置的直接注意力路径。间接路径未被阻断。这是一个有意的设计选择,因为阻断所有间接路径需要同时跨所有层进行干预,这将混淆层定位,而这正是实验的主要目标。因此,层退化曲线测量的是每一深度处直接注意力路由的边际因果贡献,而非来自对象标记的总信息流。
MLP 消除。为了隔离前馈通路,我们将特定标记位置的 MLP 输出置零。我们考虑两种针对不同计算角色的变体:
$$ \tilde{f}^{(\ell)}_i = \begin{cases} 0 & i \in S \\ f^{(\ell)}_i & i \notin S \end{cases} \quad (6) $$
其中 $S$ 是目标位置集合,$f^{(\ell)}_i$ 是第 $\ell$ 层位置 $i$ 处的 MLP 输出。在对象位置消除 ($S = B_t$) 中,MLP 无法变换对象的表示,从而破坏标记内的视觉处理,同时保持注意力路由不变。在答案位置消除 ($S = \{\text{ans}\}$) 中,MLP 无法变换答案标记的表示,从而破坏将注意力信息转换为最终预测的计算。
通路比较。三条退化曲线:因果均值消融 $\Delta(\ell)$、注意力消除 $KO(\ell)_{\text{attn}}$ 和 MLP 消除 $KO(\ell)_{\text{mlp}}$ 是在具有相同正确性标签的相同样本上计算的,从而实现直接比较。按模型正确性对每种退化指标进行分层,并计算接地特异性偏移 (Cohen’s $d$),揭示了哪种通路携带区分正确性的信号。跨所有三个指标的联合签名将每种操作分配给其失效模式(表 3)。
数据和采样。我们使用 GQA [12],它提供与功能程序和场景图配对的组合式问题。场景图为所有接地对象提供边界框,使得能够针对与每个推理步骤相关的视觉标记 $B_t$ 进行操作感知的识别。我们从平衡的训练集中每种操作类型(select, relate, verify, exist, query, choose, filter)采样 500 个问题,共计 3,500 个样本。关于 relate 操作的 VSR [18] 泛化实验报告在第 5 节中。
模型和推理。所有实验均使用 fp16 精度的 Qwen2.5-VL-3B-Instruct [3]。模型正确性由与真实标签匹配的贪婪生成确定。答案对数概率通过对真实标记进行教师强制计算得出。所有干预措施均逐层应用于所有 36 层,为每个样本生成一条退化曲线。每个实验需要每个样本 37 次前向传播(1 次干净 + 36 次干预)。
指标和统计。我们按模型正确性对每种操作报告三个量:
- 接地强度 (GS):跨层的均值消融下的峰值退化,衡量对对象视觉表示的总因果依赖。
- 注意力消除退化 ($KO_{\text{attn}}$):当来自答案位置到 $B_t$ 的注意力被阻断时的峰值退化,隔离注意力通路。
- MLP 消除退化 ($KO_{\text{mlp}}$):当答案位置的 MLP 输出被置零时的峰值退化,隔离前馈通路。
- 接地特异性偏移 (GSS):正确和错误样本在每个退化指标上的 Cohen’s $d$,作为失效模式分类的主要统计量:正的 GSS 表明正确预测显示出更高的退化(接地有助于成功);负的 GSS 表明错误预测显示出更高的退化(过度接地)。
每种失效模式由其跨所有三个指标的联合签名来识别(表 3)。
表示验证。为了支持因果发现反映的是视觉计算而非表面文本特征,我们从 GQA 构建对比问题对 $(q_{\text{clean}}, q_{\text{corrupt}})$,它们共享相同的图像但在语义相关的词上有所不同(例如,替换对象名称或属性)。我们提取隐藏状态以
第 6 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Trovato 等人
1.2 dabl=-0.16每层对配对中的两个成员进行训练,并训练线性回归 1.2 选择 接地失败 (acc=60%, n=500)dabl=+0.75dattn=-0.20 关联 推理失败 (acc=45%, n=500) dattn=-0.31 探针以将每个状态分类为干净或损坏。配对由行为视觉敏感性进行划 1.0 dmlp=-0.81 1.0 dmlp=-0.17 变化) 变化) 0.8分:如果模型在干净输入和损坏输入之间生成的答案发生变化,则该配对为视觉敏感 0.8 (VS),否则为视觉不敏感 (NV)(公式 7)。 (log-prob 0.6 (log-prob 0.6 均值 0.2 均值 0.2 VS(𝑞) = 1 𝑓(𝐼,𝑞clean) ≠𝑓(𝐼,𝑞corrupt) (7) 0.0 0.0 探针准确率差距 𝛿VS = accVS −accNV 作为有效性 0 8 16层 24 32 0 8 16层 24 32 标准。我们要求 𝛿VS > 0.05 才能将操作的因果 验证 属性提取失败 (acc=86%, 过滤 语言先验 (acc=90%, n=500) n=500) 1.2 dabl=+0.10 dabl=-0.08 dattn=+0.05 dattn=+0.07结果视为反映了视觉接地表示,而不是 1.0 dmlp=-0.80 dmlp=-0.06 1.0
文本伪影。 变化) 0.8 变化) 0.8
0.6 空间关系泛化。GQA 分析将失败分解为七种操作类型,但每个问题涉及 (对数概率 (对数概率 0.6 多个链式操作,使得难以从上游接地步骤中隔离出空间 效应 0.4 效应 0.4 推理组件。为了 disentangle 均值 0.2 均值 0.2 这一点,我们在 VSR [18] 上复制了所有三种干预措施,VSR 是一个二元 0 8 16 24 32 0 8 16 24 32层 层 空间推理基准测试,其中每个问题都需要在两个对象之间进行单一 均值均值消融消融 ·· 正确正确 注意力注意力 KO KO ·· 正确正确 MLP MLP KO KO 答案答案 ·· 正确正确(平滑)(平滑) 的空间判断(例如,“猫在笔记本电脑后面”;回答是/否)。我们使用测试集(2,195 个样本,66 图 3:四种机制上不同的失败模式。按正确性划分的均值消融(实线)、注意力 关系类型,跨越 7 个元类别),应用与 GQA 相同的协议,并对主语、宾语以及两者同时进行干预。 消除(虚线)和 MLP 消除(点线)下的逐层退化,按正确性划分(蓝色 = 正确,红色 = 错误)。 正确 5 结果 表 3 展示了三种干预措施 across 的完整机械特征。 表 2:反事实探测验证。视觉敏感
干预措施。每种干预措施在每一层独立应用,我们报告答案对数概率的最大退化程度,并按模型正确性进行拆分,使用 Cohen’s $d$ 量化正确性与退化之间的关联。三种干预措施的整体模式将每个操作归类为四种失败模式之一。我们首先从表征角度验证这些分类,然后逐一分析每种失败模式,最后利用 VSR 基准测试概括“relate”操作,并将我们的方法应用于 LLaVA-1.5-7B 模型 [19]。
5.1 表征验证
失败分类法基于针对特定视觉标记的因果干预措施。一个潜在的混淆因素是,干预措施可能检测到干净问题和损坏问题之间的表面语言差异,而非视觉计算的真实变化。表 2 报告了每个操作视觉敏感性差距 $\delta_{VS}$。
分类法中依赖视觉的失败模式所涉及的三个操作均通过了验证阈值 ($\delta_{VS} > 0.05$),且差距显著。在每种情况下,在模型明确改变答案的对对上训练的探针实现了近乎完美的准确率,而在答案未改变的对对上训练的探针表现明显较差。这证实了推理失败、接地失败和属性提取失败模式背后的因果信号反映了视觉表征的变化,而非词汇线索。
filter 未通过阈值 ($\delta_{VS} = +0.03$),为其被归类为视觉无关提供了独立的表征证据。query 和 select 处于边缘状态 ($\delta_{VS} = +0.06$)。它们较高的 NV 基线 ($\sim 0.94$) 表明,这些操作生成的问题结构足够独特,使得探针仅凭文本即可检测到反事实差异,但正差距仍然证实了残留的视觉贡献。我们将 choose 排除在探针分析之外,因为为二元选择题构建有效的反事实对是不可行的(例如,将“链条是黑色还是黄色?”改为“链条是黄色还是黑色?”)。这仅改变了选项顺序,而未引入真正的语义对比。
5.2 接地失败:select
Select 产生了研究中最为清晰的机械信号。均值消融揭示了接地强度与正确性之间的强正相关 ($d = +0.75$)。正确答案严重依赖于目标对象的视觉表征,而错误答案则表现出极小的依赖性。模型失败是因为它从未对目标对象建立因果依赖,瓶颈在于感知层面。
通路分析将这一失败定位在前馈网络中。注意力消除未产生显著的正确性判别力,表明无论正确与否,阻断答案标记对对象的注意力对输出影响甚微。相比之下,在答案位置进行的 MLP 消除产生了
第 7 页
视觉语言模型是如何失效的?组合式视觉问答中的视觉-操作失配 Conference acronym ’XX, 2018年6月03–05日,纽约伍德斯托克
表 3:所有干预措施下的完整机械特征谱。对于每种操作:模型准确率、均值消融接地强度 (GS)、注意力消除 (Attn KO) 峰值退化,以及答案位置的 MLP 消除 (MLP KO),按正确性划分并计算 Cohen’s 𝑑。显著性:*𝑝< 0.001,𝑝< 0.01,*𝑝< 0.05。失效模式基于三种干预措施的整体模式分配。
| Operation | Acc. | Mean Ablation GS✓ | Mean Ablation GS× | Mean Ablation 𝑑 | Attn KO KO✓ | Attn KO KO× | Attn KO 𝑑 | MLP KO (answer) KO✓ | MLP KO (answer) KO× | MLP KO (answer) 𝑑 | Failure mode | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | select | 60.4% | 0.975 | 0.489 | +0.75* | 0.074 | 0.104 | −0.19 | 1.104 | 1.439 | −0.80* | Grounding | | relate | 44.8% | 0.894 | 1.116 | −0.17 | 0.164 | 0.298 | −0.32* | 1.438 | 1.543 | −0.17* | Reasoning | | verify | 86.4% | 1.134 | 0.995 | +0.12 | 0.050 | 0.045 | 0.05 | 0.956 | 1.197 | −0.71* | Attr. extraction | | query | 67.4% | 0.918 | 0.759 | +0.15 | 0.224 | 0.234 | −0.02 | 1.965 | 1.739 | +0.33* | Attr. extraction | | exist | 82.5% | 1.147 | 0.775 | +0.03 | 0.043 | 0.060 | −0.15** | 0.822 | 0.906 | −0.27* | Attr. extraction | | choose | 89.4% | 0.310 | 0.281 | +0.08 | 0.190 | 0.176 | +0.10 | 1.744 | 1.830 | −0.13 | Language prior | | filter | 90.0% | 0.214 | 0.217 | −0.01 | 0.1393 | 0.1453 | +0.0659 | 1.438 | 1.464 | −0.06 | Language prior |
在所有操作中具有最大的负效应 (𝑑= −0.80),且错误答案对 MLP 干扰显著更敏感。 这种解离在图 3(左上角)中可见,其中全通路消融差距在注意力通路中完全缺失,并完全由前馈通路解释。 这表明 select 中的物体识别是通过 token 内的 MLP 计算而非跨 token 注意力路由进行的。模型在答案位置通过前馈变换处理物体身份,当此计算失败时,物体从未被有效接地。
5.3 推理失败:relate
Relate 表现出相反的接地特征。均值消融显示出反转的接地-正确性关系。错误答案比正确答案更因果依赖于目标物体。模型定位了物体,但在抽象关系推理应占主导的处理阶段,坚持检索其视觉表示。 通路分析将此失败定位到注意力机制。注意力消除放大了反转信号,几乎使均值消融效应翻倍,且退化集中在第 28–35 层(图 3,右上角;图 4)。答案位置的 MLP 贡献了与消融相当但显著弱于注意力通路的次要效应,表明 MLP 部分补偿了注意力对视觉内容的过度路由,而非驱动错误。 答案位置的 MLP 消除揭示了失效位置。对于 verify,错误答案对 MLP 干扰显著更敏感,这是仅次于 select 的第二大效应。答案位置的前馈网络未能从良好接地的表示中提取正确的验证判断,即使模型正确地将关系中的两个物体接地,也无法计算关系是否成立。 物体位置 MLP 消除证实了这一点,并显示在 bbox 位置也具有显著敏感性 (𝑑= −0.49),表明 MLP 对物体表示本身的处理也导致了失败。
5.4 属性提取失败:verify, query, exist
三种操作在均值消融下共享共同特征:高绝对接地强度,无显著的正确性区分。无论答案是否正确,模型始终接地相关物体。注意力消除放大了反转信号,几乎使均值消融效应翻倍,且退化集中在第 28–35 层(图 3,右上角;图 4)。答案位置的 MLP 贡献了与消融相当但显著弱于注意力通路的次要效应,表明 MLP 部分补偿了注意力对视觉内容的过度路由,而非驱动错误。 答案位置的 MLP 消除揭示了失效位置。对于 verify,错误答案对 MLP 干扰显著更敏感,这是仅次于 select 的第二大效应。答案位置的前馈网络未能从良好接地的表示中提取正确的验证判断,即使模型正确地将关系中的两个物体接地,也无法计算关系是否成立。 物体位置 MLP 消除证实了这一点,并显示在 bbox 位置也具有显著敏感性 (𝑑= −0.49),表明 MLP 对物体表示本身的处理也导致了失败。
Query 显示了一种不同的变体:MLP 效应方向反转 (𝑑= +0.33),正确答案更依赖于答案位置的 MLP 计算。当 MLP 成功处理接地表示时,属性被正确检索;
- p < 0.05 (BH)
图 4:各操作层间注意力消除差异 (ΔKO = incorrect − correct)。红色表示错误预测在该层更依赖 bbox 注意力;蓝色表示正确预测更依赖。relate 在第 33 层显示出集中的正向信号,证实了晚期层的注意力介导过度接地。
与所有操作中最低准确率 (45%) 相比,relate 是唯一一种模型访问正确视觉信息会主动损害性能的操作。
第 8 页
尽管当 MLP 未能有效参与时,答案会默认为错误响应。问题不在于 MLP 失效,而在于它从未接收到可以从中提取正确属性的表示。
表 4:VSR 跨实验摘要。每种干预下的 Cohen’s 𝑑(正确 vs. 错误)。示例关系说明了每个类别。
| 类别 | 示例关系 | 消融 (Abl.) | 注意力 (Attn) | MLP(object) | | :— | :— | :— | :— | :— | | 投射 (Projective) | behind, left of, above, in front of | −.35* | −.13ns | −.60* | | 拓扑 (Topological) | inside, part of, contains, touching | −.08* | +.01ns | −.81*** | | 方向 (Directional) | toward, past, away from | +.14ns | +.45* | −.61** | | 邻接 (Adjacency) | alongside, at the side of, attached to | −.23* | +.10* | −.30ns | | 邻近 (Proximity) | near, close to, far from | −.07ns | +.04ns | −.72* | | 方向 (Orientation) | facing, parallel to, perpendicular to | −.33ns | −.01ns | −.03ns | | 未分配 (Unallocated) | next to, opposite to, among | +.83* | +.49* | −.31ns |
Exist 在对象位置 MLP(𝑑= −0.66)和注意力通路中均显示出显著效应,并在对象-位置 MLP 中表现出中等程度的答案-位置效应。与 verify 和 query 不同,exist 的失败分布在各个通路中,没有单一的主导机制,这与存在性检查是一种可能在多个阶段失败的更简单操作相一致。
5.5 语言先验主导:choose, filter
choose 和 filter 操作在所有三种干预下均显示出一致的零结果。因果均值消融产生的接地强度最低,且没有任何正确性判别能力。注意力消除和 MLP 消除均未揭示出显著的通路特异性效应。这些操作通过语言模式而非视觉计算实现了高准确率(89–90%)(图 3,右下角)。
Choose 利用编码在语言模型参数中的世界知识,并在不检查图像的情况下选择合理的答案,这与 VLMs 在问题结构允许时依赖语言先验的有据可查的倾向一致 [1]。Filter 应用基于属性的子集划分,模型仅从问题语义中解决这一问题。第 5.1 节中通过线性探测检测到的独立证据证实了这一分类:filter 显示出最低的视觉敏感配对率(27%)和可忽略不计的探测验证差距。
5.6 VSR 上的空间关系验证
GQA 分析将 relate 识别为一种推理失败,其中模型通过晚期层注意力过度接地终端对象。VSR 将这种关系成分隔离出来,因为每个问题都需要在两个对象之间进行单一的空间判断,从而消除了多步组成的混淆因素。表 4 报告了每种元类别在所有三种干预下的解离模式。
空间错误在对象编码阶段的 MLP 介导下发生。七种类别中有四种类别显示出显著的 bbox MLP 消除解离,且错误预测始终更敏感。最强的效应出现在拓扑(Topological)和邻近(Proximity)关系中,这些类别需要对对象之间的包含关系和距离进行精确编码,此时 MLP 对边界框标记的转换最为关键。
对于大多数空间类别,注意力路由并不携带错误信号。唯一的显著注意力效应出现在邻接(Adjacency)和方向(Directional)中,且为正方向。这些类别的空间判断锚定在一个对象相对于其直接邻居的位置上,使得注意力介导的对锚定对象的访问对于正确答案确实至关重要。
失败位点是编码,而非解码。答案位置 MLP 消除在所有类别中均为零。在 GQA 中,属性提取操作在答案位置失败,因为 MLP 必须在此处将接地表示转换为输出。VSR 的答案位置零结果表明,空间判断在通过 bbox MLP 编码对象位置的阶段就出现了断裂,而不是在组装答案的阶段——这加强了编码-解码区分追踪空间推理失败与跨基准测试的属性提取失败边界的观点。
5.7 跨架构分析
该分类法在 Qwen2.5-VL 上识别出四种失败模式,该模型具有原生分辨率的视觉编码器,能够在标记表示中保留空间细节。为了测试哪些模式反映了任务级别的计算需求,哪些反映了架构特定的电路,我们将相同的干预应用于 LLaVA-1.5-7B,该模型使用冻结的 CLIP-ViT 编码器和轻量级 2 层 MLP 适配器。
除了 exist(𝑑=−0.60, 𝑝<0.001)外,答案位置 MLP 处还出现了 query 的属性提取失败(𝑑=+0.48, 𝑝<0.001),而 choose 和 filter 的第四种失败模式语言先验(均为零)保持一致。这些模式反映了与输出解码相关的任务结构,并且需要在答案位置进行特定的 MLP 计算,无论视觉标记如何编码。在这两个模型中,语言依赖操作都绕过了视觉。
像 select 的接地和 relate 的推理失败这样的视觉依赖失败在 LLaVA 中未产生显著的解离(所有 |𝑑| < 0.05)。这是预期的,因为 LLaVA 的冻结 CLIP 编码器产生的视觉标记是压缩的语义摘要,具有大的感受野,因此,消融特定对象的标记移除的独特信息较少,因为相邻标记编码了相似的内容。在 Qwen2.5-VL 中确定的这些失败模式依赖于视觉编码器保留空间精确、对象特定的信息,而语言模型的 MLP 必须随后处理这些信息。当编码器已经抽象掉这些空间细节时,这些失败模式便无法在语言骨干网中显现。
这一分析表明了一个两层分类法:与架构无关的任务级别失败模式(输出解码),以及仅在视觉编码器保留足够的空间粒度供语言模型处理失败时出现的编码器依赖失败模式。
第 9 页
VLMs 是如何失败的?组合式视觉问答中的视觉-操作不对齐 Conference acronym ’XX, 2018年6月3–5日,纽约伍德斯托克
6 结论 [11] Michal Golovanevsky, William Rudman, Vedant Palit, Ritambhara Singh, 和 我们提出了一种以操作为中心的机械解释框架,该框架 Carsten Eickhoff。2024。VLMs 注意到了什么?用于高斯噪声 将 GQA 数据集上组合推理中的 VLM 失败分解为操作类型和内部计算通路。 arXiv 通过三种互补的因果干预措施,应用于 Qwen2.5-VL 的所有预文本预印本 arXiv:2406.16320 (2024)。 [12] Drew A Hudson 和 Christopher D Manning。2019。Gqa:一个用于真实世界 视觉编码器层,我们确立了四种失败模式:接地、推理、属性提取和语言先验主导。每种模式都有独特的因果特征。核心发现是通路解离:接地和属性提取失败通过前馈网络路由,而推理失败通过晚期层注意力路由。在 VSR 基准上的跨基准验证以及在 LLaVA-1.5 上的跨架构分析表明,属性提取和语言主导模式是架构无关的,而接地和推理模式仅在视觉编码器保留足够的空间粒度时才会出现。
局限性。我们的主要分析使用单个 3B 参数模型在 GQA 上进行。均值消融干预测试了必要性而非充分性。高准确率的操作中错误样本有限,限制了统计功效。我们的贡献是诊断性的,而非展示纠正性干预措施。
参考文献 [1] Aishwarya Agrawal, Dhruv Batra, Devi Parikh, 和 Aniruddha Kembhavi。2018。不要只是假设;看并回答:克服视觉问答中的先验。在 IEEE 计算机视觉与模式识别会议论文集。4971–4980。 [2] Guillaume Alain 和 Yoshua Bengio。2016。使用线性分类器探针理解中间层。arXiv 预印本 arXiv:1610.01644 (2016)。 [3] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等。2025。Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631 (2025)。 [4] Samyadeep Basu, Martin Grayson, Cecily Morrison, Besmira Nushi, Soheil Feizi, 和 Daniela Massiceti。2024。理解多模态大语言模型中的信息存储和传输。神经信息处理系统进展 37 (2024), 7400–7426。 [5] Yonatan Belinkov。2022。探针分类器:承诺、不足与进展。计算语言学 48, 1 (2022年3月), 207–219。doi:10.1162/coli_a_00422 [6] Gabriela Ben Melech Stan, Estelle Aflalo, Raanan Yehezkel Rohekar, Anahita Bhiwandiwalla, Shao-Yen Tseng, Matthew Lyle Olson, Yaniv Gurwicz, Chenfei Wu, Nan Duan, 和 Vasudev Lal。2024。Lvlm-intrepret:大型视觉语言模型的可视化工具。在 IEEE/CVF 计算机视觉与模式识别会议论文集。8182–8187。 [7] Nelson Elhage, Neel Nanda, Catherine Olsson, Tom Henighan, Nicholas Joseph, Ben Mann, Amanda Askell, Yuntao Bai, Anna Chen, Tom Conerly, Nova Das-Sarma, Dawn Drain, Deep Ganguli, Zac Hatfield-Dodds, Danny Hernandez, Andy Jones, Jackson Kernion, Liane Lovitt, Kamal Ndousse, Dario Amodei, Tom Brown, Jack Clark, Jared Kaplan, Sam McCandlish, 和 Chris Olah。2021。变压器电路的数学框架。变压器电路线程 (2021)。https://transformer-circuits.pub/2021/framework/index.html。 [8] Javier Ferrando 和 Elena Voita。2024。信息流路由:大规模自动解释语言模型。在 2024 年自然语言处理实证方法会议论文集,Yaser Al-Onaizan, Mohit Bansal, 和 Yun-Nung Chen (编)。计算语言学协会,美国佛罗里达州迈阿密,17432–17445。doi:10.18653/v1/2024.emnlp-main.965 [9] Mor Geva, Jasmijn Bastings, Katja Filippova, 和 Amir Globerson。2023。剖析自回归语言模型中事实关联的回忆。在 2023 年自然语言处理实证方法会议论文集,Houda Bouamor, Juan Pino, 和 Kalika Bali (编)。计算语言学协会,新加坡,12216–12235。doi:10.18653/v1/2023.emnlp-main.751 [10] (Note: Reference [10] is missing in the provided text, proceeding to [11]) [11] Michal Golovanevsky, William Rudman, Vedant Palit, Ritambhara Singh, 和 Carsten Eickhoff。2024。VLMs 注意到了什么?用于无高斯噪声文本-图像损坏和评估的机械解释管道。arXiv 预印本 arXiv:2406.16320 (2024)。 [12] Drew A Hudson 和 Christopher D Manning。2019。Gqa:一个用于真实世界视觉推理和组合式视觉问答的新数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集。6700–6709。 [13] Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, 和 Krista A Ehinger。2025。调查视觉语言模型中注意力头的功能角色:推理模块的证据。arXiv 预印本 arXiv:2512.10300 (2025)。 [14] Jinyeong Kim, Seil Kang, Jiwoo Park, Junhyeok Kim, 和 Seong Jae Hwang。2025。解释大型视觉语言模型中图像到文本信息流的注意力头。arXiv 预印本 arXiv:2509.17588 (2025)。 [15] Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Weitao Ma, 和 Xiachong Feng。2025。大型视觉语言模型中对象表示的因果追踪:机械解释与幻觉缓解。arXiv 预印本 arXiv:2511.05923 (2025)。 [16] Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, 和 Ji-Rong Wen。2023。评估大型视觉语言模型中的对象幻觉。在 2023 年自然语言处理实证方法会议论文集。292–305。 [17] Zihao Lin, Samyadeep Basu, Mohammad Beigi, Varun Manjunatha, Ryan A Rossi, Zichao Wang, Yufan Zhou, Sriram Balasubramanian, Arman Zarei, Keivan Rezaei, 等。2025。多模态基础模型机械解释综述。arXiv 预印本 arXiv:2502.17516 (2025)。 [18] Fangyu Liu, Guy Emerson, 和 Nigel Collier。2023。视觉空间推理。计算语言学协会汇刊 11 (2023), 635–651。 [19] Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee。2023。视觉指令微调。神经信息处理系统进展 36 (2023), 34892–34916。 [20] Yiming Liu*, Yuhui Zhang*, 和 Serena Yeung-Levy。2025。机械解释博客文章 2025 (AprilMeets 28, Vision2025)。语言模型:见解与局限性。在 ICLR 2025-vlm-understanding-29/blog/vlm-understanding/#activation-patching https://d2jud02ci9yv69.cloudfront.net/2025-04-28-vlm-understanding-29/blog/vlm-understanding/#activation-patching。 [21] Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, 和 Honglak Lee。2024。在 VLMs 中植入视觉语言先验。arXiv 预印本 arXiv:2501.00569 (2024)。 [22] Kevin Meng, David Bau, Alex Andonian, 和 Yonatan Belinkov。2022。定位和编辑 GPT 中的事实关联。神经信息处理系统进展 35 (2022), 17359–17372。 [23] Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr, Ronald Clark, Christian Schroeder de Witt, 和 Constantin Venhoff。2026。迈向理解多模态微调:空间特征。arXiv 预印本 arXiv:2602.08713 (2026)。 [24] Clement Neo, Luke Ong, Philip Torr, Mor Geva, David Krueger, 和 Fazl Barez。2024。迈向解释视觉语言模型中的视觉信息处理。arXiv 预印本 arXiv:2410.07149 (2024)。 [25] Vedant Palit, Rohan Pandey, Aryaman Arora, 和 Paul Pu Liang。2023。迈向视觉语言机械解释:BLIP 的因果追踪工具。在 IEEE/CVF 国际计算机视觉会议论文集。2856–2861。 [26] Letitia Parcalabescu, Michele Cafagna, Lilitta Muradjan, Anette Frank, Iacer Calixto, 和 Albert Gatt。2022。VALSE:一个以语言现象为中心的视觉和语言模型任务无关基准。在第 60 届计算语言学协会年会议论文集(第 1 卷:长论文)。8253–8280。 [27] Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, Trevor Darrell, 和 Kate Saenko。2018。图像描述中的对象幻觉。在 2018 年自然语言处理实证方法会议论文集,Ellen Riloff, David Chiang, Julia Hockenmaier, 和 Jun’ichi Tsujii (编)。计算语言学协会,比利时布鲁塞尔,4035–4045。doi:10.18653/v1/D18-1437 [28] Tristan Thrush, Ryan Jiang, Max Bartolo, Amanpreet Singh, Adina Williams, Douwe Kiela, 和 Candace Ross。2022。Winoground:探测视觉和语言模型的视觉-语言组合性。在 IEEE/CVF 计算机视觉与模式识别会议论文集。5238–5248。 [29] Shengbang Tong, Zhuang Liu, Yuexiang Zhai, Yi Ma, Yann LeCun, 和 Saining Xie。2024。睁眼瞎?探索多模态 LLM 的视觉缺陷。在 IEEE/CVF 计算机视觉与模式识别会议论文集。9568–9578。
[10] Mor Geva, Roei Schuster, Jonathan Berant, 和 Omer Levy。2021。Transformer 前馈层是关键值记忆。在自然语言处理实证方法会议论文集 2021 中,Marie-Francine Moens, Xuanjing Huang, Lucia Specia, 和 Scott Wen-tau Yih (编)。计算语言学协会,在线和多米尼加共和国蓬塔卡纳,5484–5495。doi:10.18653/v1/2021.emnlp-main.446
[30] Zeping Yu 和 Sophia Ananiadou。2024。理解多模态大语言模型:LLaVA 在视觉问答中的机械可解释性。arXiv 预印本 arXiv:2411.10950 (2024)。
[31] Di Zhang, Jingdi Lei, Junxian Li, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, 等。2025。Critic-v:VLM 评论员帮助捕捉多模态推理中的 VLM 错误。在 IEEE/CVF
第 10 页
会议缩写 ’XX,2018年6月3–5日,纽约伍德斯托克 Trovato 等人
计算机视觉与模式识别会议。9050–9061。 图像分类能力差的模型?神经信息处理系统进展 [32] Fred Zhang 和 Neel Nanda。2024。迈向语言模型激活修补的最佳实践 系统 37 (2024),51727–51753。 中的指标与方法。在第十二届国际表征学习会议上。https://openreview.net/forum?id=Hf17y6u9BC [34] Zhi Zhang, Srishti Yadav, Fengze Han, 和 Ekaterina Shutova。2025。多模态大语言模型中的跨 模式信息流。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集 [33] Yuhui Zhang, Alyssa Unell, Xiaohan Wang, Dhruba Ghosh, Yuchang Su, Ludwig 19781–19791。 Schmidt, 和 Serena Yeung-Levy。2024。为何视觉接地语言