三分钟导读:该研究通过探针分析发现VLM内部编码了正确的计数信息,但输出方向存在错位,并提出了一种基于误差检测器的自校正方法,在不更新参数的情况下将计数准确率提高了最高15.6%。
英文题目:The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs
论文出处:arXiv 每日论文精选 · arXiv:2607.09544
原始论文:PDF / 论文页面
对应视频标题:VLM计数为何失败?探针揭示内部编码与输出错位,自校正提升15.6%|推荐指数:★★★★★
这篇论文解决什么问题?
尽管VLM在多模态任务上表现强劲,但在基本物体计数任务上仍频繁失败,且现有研究多停留在行为层面,缺乏对内部表示与最终输出之间错位机制的深入理解。
核心创新
- 首次将SVCCA应用于探针权重矩阵,量化GT与Output计数信息的子空间错位。
- 通过因果干预证明探针提取的计数方向对模型输出具有因果影响。
- 提出无需参数更新的检测器引导自校正框架,显著优于随机或全量重提示基线。
方法概览
1. 训练三种探针(Ground-Truth, Output, Error Detector)分析VLM中间层激活;2. 使用SVCCA分析GT与Output探针权重的子空间对齐程度;3. 执行因果干预(Causal Steering)验证计数方向的作用;4. 提出基于Error Detector的推理时自校正方法,仅在检测到错误时触发重提示。
逐图理解论文
方法:探针分析与子空间对齐

研究训练了三种探针:Ground-Truth探针提取真实计数,Output探针提取模型初始输出,Error Detector用于检测错误。通过奇异向量典型相关分析,即SVCCA,比较GT与Output探针权重的子空间对齐程度。结果显示,非线性探针如MLP和Circular探针的SVCCA值接近零,表明它们提取的计数方向与输出方向高度错位,这种错位并非简单的层深差异所致。
因果干预:验证计数方向的作用

为了验证探针提取的计数方向是否具有因果影响,研究在InternVL2-1B上执行了因果干预。通过沿探针衍生的计数方向修改激活,发现当干预强度在特定范围内时,模型准确率从约27%显著提升至约46%。这证明VLM内部确实编码了正确的计数信息,只是未被正确引导至输出端。绿色阴影区域为有效干预区,粉色区域为破坏性干预区。
自校正框架:检测器引导的重提示

基于上述发现,研究提出了一种无需参数更新的自校正方法。该方法仅在Error Detector检测到错误时触发重提示,而非无条件地对所有样本进行重提示。这种策略旨在平衡校正增益与计算成本。通过比较Always Reprompt和Random-K基线,研究验证了检测器引导的校正策略在合成数据集上的有效性,能够更精准地定位并修正错误。
实验结果:准确率显著提升

在四个合成数据集和一个真实基准CountBench上评估了四种VLM。结果显示,InternVL2-4B在DC-DS数据集上的准确率提升了15.60个百分点。Detector的F1分数与校正增益之间存在高达0.803的Spearman相关系数,表明检测器的准确性直接决定了校正效果。这一结果在多个模型和数据集中均得到验证,证明了方法的鲁棒性。
检测器性能与校正增益的相关性

进一步分析显示,Detector F1与校正增益∆Acc之间存在强正相关。每个点代表一次运行,包含模型、数据集、探测器和种子。高F1的检测器能够更有效地识别错误并触发校正,从而获得更高的准确率提升。这一相关性在CountBench真实数据集上同样成立,表明该方法不仅适用于合成数据,也具备处理真实场景的潜力。
实验与关键结果
- 在4个合成数据集和1个真实基准(CountBench)上评估4个VLM(InternVL2-1B/4B, Qwen3-VL-2B/8B)。
- 层间探针性能分析与SVCCA子空间对齐分析。
- InternVL2-1B上的因果干预实验。
- 不同探测器架构与重提示策略的对比实验。
- InternVL2-4B在DC-DS数据集上准确率提升15.60 pp(第 8 页)
- Detector F1与校正增益(∆Acc)的Spearman相关系数为0.803(第 11 页)
- 非线性探针(MLP/Circular)的Weight-SVCCA接近0,显示高度错位(第 6 页)
- InternVL2-1B在DC-DS数据集上通过因果干预将准确率从~27%提升至~46%(第 7 页)
阅读时需要注意
- 仅评估了参数规模在8B以下的模型。
- 合成数据集向现实世界场景的泛化能力尚未验证。
- 因果干预实验仅在单个模型(InternVL2-1B)上进行。
- 计数任务限制在1-9个物体的范围内。
- Always Reprompt基线虽在某些配置下表现更好,但计算成本高且可能破坏原本正确的答案。
- 过度干预(过大的α值)会导致性能下降,表明线性近似仅在局部有效。
- Qwen3-VL系列模型的校正增益显著低于InternVL2系列,表明探测器质量是关键瓶颈。
关联工作
- Sun et al. (2025):扩展了LLM算术推理的多探针框架至VLM计数任务。(第 2 页)
- Paiss et al. (2023a):提供了CountBench基准,用于评估VLM计数能力。(第 4 页)
- Raghu et al. (2017):提出了SVCCA方法,本文将其适配用于探针权重子空间比较。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
数量就在那里,但存在错位:理解与纠正视觉语言模型中的计数失败
Ahmed Oumar El-Shangiti1,2 Abzal Nurgazy1 Hilal AlQuabeh1 Nikolai Rozanov3 Kentaro Inui1
1 MBZUAI 2 DataBayt.AI Labs 3 伦敦帝国理工学院 通讯作者:ahmed.oumar@mbzuai.ac.ae
摘要
尽管在许多多模态任务上表现强劲,视觉语言模型(VLMs)在基本物体计数方面仍然面临困难。我们调查了这是否反映了内部知识的缺失或内部表征与言语化输出之间的差距(Vo 等人,2025)。在来自五个计数数据集的四个 VLM 的激活上训练简单的探针(Probe)揭示,非线性探针能够可靠地检测计数错误,这表明即使 VLM 输出错误答案,它们通常也编码了正确的计数。SVCCA 分析显示,在模型真实计数上训练的探针占据了一个部分共享的激活子空间,但沿着错位的方向读出。我们进一步使用因果引导(Causal Steering)干预验证了我们的发现,证明增强由探针识别出的计数方向确实能改善模型的计数性能。我们提出了一种探测器引导的自纠正方法,该方法仅在简单探针预测失败时选择性地重新提示模型。这种推理时的干预无需任何参数更新,即可将计数准确率提高多达 15.6 个百分点。我们的结果确立了基于激活的错误探针作为改善 VLM 计数的实用工具,以及洞察内部知识与模型输出之间差距的机制透镜。
尽管在许多多模态任务上表现强劲,视觉语言模型(VLMs)在基本物体计数方面仍然面临困难。这使得计数成为测试 VLM 是否真正将其预测建立在图像基础上,而非依赖表面相关性或语言先验(Vo 等人,2025)的一个有用指标。同时,计数暴露了 VLM 中的几个核心失败模式,包括幻觉、在杂乱或遮挡下的失败、物体区分能力差,以及将感知表征转化为语言时的错误。最近的工作表明,这些弱点即使在强大的当代模型中也依然显著(Weng 等人,2025;Vo 等人,2025;Paiss 等人,2023a;Fu 等人,2023)。
大多数现有工作记录了 VLM 在计数方面的薄弱,但这主要是在行为层面,通过基准测试和聚合性能比较(Weng 等人,2025;Vo 等人,2025;Paiss 等人,2023a;Fu 等人,2023)。受此结果启发,我们提出了一种探测器引导的自纠正方法,该方法仅在简单推理时的干预能改善计数准确率时,选择性地重新提示模型,无需任何参数更新,即可将计数准确率提高多达 15.6 个百分点。我们的结果确立了基于激活的错误探针作为改善 VLM 计数的实用工具,以及洞察内部知识与模型输出之间差距的机制透镜。
这些研究很重要,因为它们确立了计数作为一种持续的失败模式,但它们在很大程度上留下了一个更根本的问题未解:为什么 VLM 会在计数上失败?特别是,行为评估可以显示模型何时出错,但它们无法揭示正确的计数是否缺失于模型的内部表征中,是否存在于但与模型最终答案对齐不良,或者失败是否出现在解码的后期阶段。
1 引言
视觉语言模型(VLMs)已在包括图像描述(Li 等人,2023a)、视觉问答(Liu 等人,2023a)、推理(Lu 等人,2024)和网页导航(Koh 等人,2024)在内的广泛任务中取得了强劲的性能。然而,在这些任务上的强劲表现并不意味着可靠的定量感知。在这些能力中,计数尤为重要,因为它要求模型检测相关物体,将它们与干扰项区分开来,保持一致的对应关系,并将视觉证据映射到确切的数值答案。这使得计数成为测试 VLM 是否真正将其预测建立在图像基础上,而非依赖表面相关性或语言先验(Vo 等人,2025)的一个有用指标。同时,计数暴露了 VLM 中的几个核心失败模式,包括幻觉、在杂乱或遮挡下的失败、物体区分能力差,以及将感知表征转化为语言时的错误。最近的工作表明,这些弱点即使在强大的当代模型中也依然显著(Weng 等人,2025;Vo 等人,2025;Paiss 等人,2023a;Fu 等人,2023)。
大多数现有工作记录了 VLM 在计数方面的薄弱,但这主要是在行为层面,通过基准测试和聚合性能比较(Weng 等人,2025;Vo 等人,2025;Paiss 等人,2023a;Fu 等人,2023)。受此结果启发,我们提出了一种探测器引导的自纠正方法,该方法仅在简单探针预测失败时选择性地重新提示模型。这种推理时的干预无需任何参数更新,即可将计数准确率提高多达 15.6 个百分点。我们的结果确立了基于激活的错误探针作为改善 VLM 计数的实用工具,以及洞察内部知识与模型输出之间差距的机制透镜。
这些研究很重要,因为它们确立了计数作为一种持续的失败模式,但它们在很大程度上留下了一个更根本的问题未解:为什么 VLM 会在计数上失败?特别是,行为评估可以显示模型何时出错,但它们无法揭示正确的计数是否缺失于模型的内部表征中,是否存在于但与模型最终答案对齐不良,或者失败是否出现在解码的后期阶段。
一小部分工作开始更机制性地考察计数(Hasani 等人,2025;Alghisi 等人,2025),并且一些方法尝试直接改善性能。例如,Alghisi 等人(2025)重新训练模型的部分部分,而 Sengupta 等人(2025)使用基于注意力的干预并获得了适度的提升。然而,这些方法主要针对更好的最终行为或计数过程中涉及的层/令牌,而不是解释计数信息是如何在内部表征中编码的,以及它与言语化输出之间的差距。
第 2 页
在内部如何表示,或者为什么有时会在最终预测中缺乏相关性。通过激活引导(activation steering)增强计数方向可以提高准确率,而随机方向则会降低准确率。(4)我们将这些见解转化为一种由探测器引导的自我纠正方法,该方法无需微调即可将计数准确率提高多达 15.6 个百分点(表 1)。
2 相关工作
VLM 计数与可靠性。计数长期以来一直被用作视觉推理的压力测试,从 VQA 风格的基准测试(如 TallyQA (Acharya et al., 2019))和日常场景计数(Chattopadhyay et al., 2017; Weng et al., 2025)到最近的 CLIP 时代分析(Paiss et al., 2023b)。更广泛的 multimodal 评估报告了定位和对象保真度方面的系统性弱点,包括较差的计数性能(Guo et al., 2025; Vo et al., 2025)、幻觉(Li et al., 2023c; Fu et al., 2023)以及薄弱的感知-推理对齐(Liu et al., 2023b; Yu et al., 2023; Yue et al., 2023; Vo et al., 2025)。我们的工作具有互补性:我们不是提出新的基准,而是测试隐藏激活中是否已经包含可以识别和纠正计数错误的可恢复信号。
探针与推理时纠正。探针方法被广泛用于测试激活中编码了哪些属性(Alain and Bengio, 2017; Belinkov, 2022)。在 NLP 中,探针已被用于句法(Hewitt and Manning, 2019)、类流水线式的语言结构(Tenney et al., 2019)和事实关联(Meng et al., 2022)。最近的研究还探讨了激活中的潜在置信度和与真实性相关的结构(Kadavath et al., 2022; Burns et al., 2023),以及特定于数学的表示(Heinzerling and Inui, 2024; El-Shangiti et al., 2025)。在 VLM 中,探针被用于分析计数机制(Hasani et al., 2025)并定位限制计数性能的瓶颈组件(Alghisi et al., 2025)。推理时干预表明,内部信号可以在不更新参数的情况下提高事实准确性(Li et al., 2023b)。与此同时,测试时推理和纠正方法,如自一致性(Self-consistency)(Wang et al., 2023)、思维树(Tree-of-Thought)(Yao et al., 2023a)、ReAct(Yao et al., 2023b)、自我改进(Self-Refine)(Madaan et al., 2023)、反思(Reflexion)(Shinn et al., 2023)和 StateAct(Rozanov and Rei, 2025),通过搜索或迭代反馈来改善输出。与我们的工作最接近的是 (Sun et al., 2025),它探测了 LLM
2
第 3 页
视觉语言模型 (VLM) 评估数据集 CountBench (真实世界) 合成数据集 (4种类型)
L1 L2 L3 L end
sing. color sing. color sing. shape diff. shape Ground Truth Initial VLM (1st pass) Y = 5 input output (1 4 "Q: How many diff. color diff. color tomatoes are there shape diff. shape in the image? A: " sing.
"Q: How many object(s) are in this image? A: "
1 表征分析 (第1节) 2 因果干预 (第4节) 3 检测器引导的自我修正 (第5节) 内部表征中是否存在正确的计数? 使用内部信号对模型的输出进行因果干预 使用检测器预测的失败来选择性触发修正
激活值 no Keep initial 激活值 激活值 在最佳层进行干预 from 1 st pass Error Detector Error output (all layers) from 1 st pass predicted? at best layer at best layer 4 yes train
Probes (trained) Correction prompt VLM GT Count Probe apply 对预测的影响 (2nd pass)
(重新考虑答案) Output Count Probe After (direction steering) Forward pass (unsteered) Baseline (with intervention) Predicted count Predicted count 4 5 Corrected Error Detector Correct count information
在内部存在,但在不同的子空间中,与生成过程弱耦合,但通过沿探针推导的方向进行因果引导,可以显著改善计数能力。
图 1:基于激活的探针、干预和自校正框架概览。该流水线提取 VLM 隐藏状态以训练探针,通过 SVCCA 分析表征子空间,沿探针导出的计数方向对激活进行因果引导,并利用内部错误检测器选择性地在推理时触发校正。
在算术推理过程中,针对真实标签、输出和二元正确性信号提取隐藏状态,并利用所得的错误检测器进行选择性重提示。
3 分析:VLM 能否在内部计数物体?
计数是推理的一个重要实例;已有研究证明,这对 VLM 而言极具挑战性 (Guo et al., 2025)。在本文中,我们调查 VLM 中的计数机制。我们将计数任务形式化为输入图像 $I$ 和文本查询 $q$,该任务要求模型 $M$ 产生计数估计 $\hat{y}$,使得 $\hat{y} = M(I, q)$,其中 $y$ 表示真实计数,$y, \hat{y} \in \{1, 2, \dots, 9\}$。
3.1 探针架构
令 $x_l \in \mathbb{R}^d$ 表示第 $l$ 层最终文本 token 的表示,其中 $d$ 为 VLM 的隐藏维度。探针是从 $x_l$ 到目标标签的映射。我们考虑三种探针任务。首先,真实计数探针将 $x_l$ 映射到真实计数 $y$。其次,输出计数探针将相同的表示 $x_l$ 映射到模型自身预测的计数 $\hat{y}$。这两个探针具有相同的架构,但使用不同的监督信号进行训练(下文将说明所研究的架构)。第三,对于错误检测,我们训练一个独立的错误探针来预测模型的答案是否正确:$e = \mathbb{I}[\hat{y} \neq y] \in \{0, 1\}$,其中 $e=1$ 表示计数预测错误。因此,计数探针解决的是基于计数标签的多类分类问题,而错误探针解决的是基于正确性标签的二类分类问题。
我们采用四种表达能力递增的探针类型 (Sun et al., 2025)。圆形探针通过 $w_1, w_2 \in \mathbb{R}^d$ 将 $x_l$ 投影到学习到的二维平面上,通过角度编码数字:$\hat{y} = 10 \text{atan2}(w_1^\top x_l, w_2^\top x_l) / 2\pi$。线性探针应用仿射变换 $\hat{y} = w^\top x_l + b$,使用 $\ell_2$ 正则化进行训练,并在推理时进行四舍五入。逻辑回归探针分配每类权重:$\hat{y} = \arg \max_i (w_i^\top x_l)$。MLP 探针添加一个隐藏层(ReLU,512 个单元):$\hat{y} = \arg \max_i (W_2^\top \text{ReLU}(W_1^\top x_l + b_1) + b_2)$。所有分类探针均使用交叉熵进行训练;圆形探针使用平滑 $\ell_1$ 损失进行训练。
3.2 通过 SVCCA 测量表征对齐
探针准确率告诉我们某个表征是否包含关于目标的信息。然而,
第 4 页
仅凭准确率无法告诉我们两个目标是否从相同的内部方向解码。这一区别是我们问题的核心。一个层可能同时包含关于真实计数 $y$ 和模型输出 $\hat{y}$ 的信息,但两者可能依赖于不同的子空间。在这种情况下,模型可能在内部编码了正确的数量,但其最终预测却围绕不同的表征方向进行组织。反之,如果在 $y$ 和 $\hat{y}$ 上训练的探针依赖于高度相似的子空间,那么模型的最终答案就更紧密地与该层可用的内部计数信息对齐。
为了验证这一点,我们比较在相同隐藏状态上训练但监督信号不同的同构探针对:一个探针预测真实计数 $y$,另一个预测模型输出 $\hat{y}$。然后我们询问这两个探针是否从表征空间中相似的方向(子空间)读取其信息。
我们通过奇异向量典型相关分析(SVCCA; (Raghu et al., 2017))来量化子空间对齐;完整的数学细节见附录 A.1。给定在真实计数和模型输出上训练的两个探针的权重矩阵 $W_{gt}, W_{out} \in \mathbb{R}^{c \times d}$,我们从每个矩阵中提取前 $k$ 个左奇异向量,得到标准正交基 $U^{(k)}_{gt}, U^{(k)}_{out} \in \mathbb{R}^{d \times k}$。然后我们计算典型相关系数 $\rho_1, \dots, \rho_k = \sigma_1, \dots, \sigma_k U^{(k)}_{gt}{}^\top U^{(k)}_{out}$,并将对齐程度总结为:$\text{SVCCA}(W_{gt}, W_{out}) = \frac{1}{k} \sum_{i=1}^k \rho_i$。
该分数具有直观的解释。接近 1 的值表明真实计数探针和输出探针依赖于隐藏表征中几乎相同的方向,这表明模型的最终计数与该层内部可用的计数信息对齐。接近 0 的值表明这两个探针依赖于几乎正交的子空间,表明与正确计数对齐的信息与与生成答案对齐的信息之间存在更大的不匹配。
我们使用 SVCCA 的动机在于需要对基不变性进行比较。直接比较探针权重矩阵并不可靠,因为两个探针可以使用不同但等价的基来实现相同的子空间。通过比较由主奇异向量张成的子空间而不是原始参数,SVCCA 提供了更稳健的度量。
这种分析为我们定位计数故障出现的位置提供了一种机制工具。如果一个层显示出对真实计数的强可解码性,但与输出探针的对齐较弱,这表明正确的数量信息存在,但未忠实传递到最终答案中。相反,如果真实计数难以解码,则计数故障很可能起源于视觉或多模态表征本身。
3.3 实验设置
数据集。 我们精心设计并构建了四个合成数据集,每个数据集包含 1170 张图像(512 × 512,白色背景),其中包含放置在随机网格上的 {1, . . . , 9} 个不重叠对象。这四个数据集在对象的颜色和形状方面变化视觉多样性(例如,相同颜色/不同形状 vs. 不同颜色/不同形状,详见附录 A.2 表 2)。样本在九个计数类别中均匀分布,采用 80/20 的分层训练/测试分割。此外,我们在 CountBench (Paiss et al., 2023a) 上进行评估,移除包含超过九个对象的图像,并使用 50/50 的分层分割以匹配我们的实验设置。
模型。 我们评估了四个公开可用的 VLM:InternVL2-1B, InternVL2-4B (Chen et al., 2024), Qwen3-VL-2B-Instruct, 和 Qwen3-VL-8B-Instruct (Bai et al., 2025)。所有模型均使用贪婪解码运行。模型来自 HuggingFace Transformers (Wolf et al., 2020)。所有模型均在零样本设置下进行评估。所有探针均使用加权交叉熵损失训练 2000 个 epoch,以缓解类别不平衡问题。表现最佳的层将被用于
第 5 页
1.0 InternVL2-1B | gt_probe Qwen3-VL-2B-Instruct | gt_probe InternVL2-4B | gt_probe Qwen3-VL-8B-Instruct | gt_probe 该 MLP 表明,恢复出的计数信息 0.8
F1 0.6 Probe 0.4 反映了表示中 真实的 结构, 0.2 架构:线性、对数、循环、MLP 0.0 而非表达力强大的分类器 0 5 10层 15 20 25 0 5 10 层15 20 25 0 5 10 层15 20 25 30 0 5 10 15层20 25 30 35 独立学习任务 (Hewitt and Liang, (a) 跨模型深度的逐层探测 F1 分数(基于真值目标)。 2019)。出现了一个显著的时间不对称性: InternVL2-1B | output_probe Qwen3-VL-2B-Instruct | output_probe InternVL2-4B | output_probe Qwen3-VL-8B-Instruct | output_probe 真值探针在较早的层达到平台期,而 1.0
0.8 输出探针在接近最终层时达到峰值,这表明 0.6 模型在给出言语化答案之前,已经很好地编码了正确的计数。 Probe 0.4 0.2 架构:线性、对数、循环、MLP F1 0.0 0 5 10层 15 20 25 0 5 10 层15 20 25 0 5 10 层15 20 25 30 0 5 10 15层20 25 30 35 例外情况是 InternVL2-1B,其中输出 探针保持在 60-65% 左右的水平,但同一激活上的错误检测器实现了 > 90% 的 F1 (b) 跨模型深度的逐层探测 F1 分数(基于模型输出目标)。 分数(图 2c)。这表明,预测模型是否会出错 InternVL2-1B Qwen3-VL-2B-Instruct InternVL2-4B Qwen3-VL-8B-Instruct 可能比预测它会说什么更容易; 0.8 F1 0.6 二元错误信号可能占据比完整输出分 检测器 0.4 错误 0.2 布更易于访问的子空间。 检测器MLP对数-循环-单独-循环-联合 0.0 0 5 10层 15 20 25 0 5 10 层15 20 25 0 5 10 层15 20 25 30 0 5 10 15层20 25 30 35 对于错误检测,我们训练了四种检测器类型: (c) 每层的错误检测性能(F1 分数)。 MLP、Logistic-Separately、Circular-Separately 和 Circular-Jointly (Sun et al., 2025)。“Separately” 图 2:跨模型深度的逐层探测和检测器性能 变体在两个相同架构的探针(一个在 y 上训练,一个在 ŷ 上训练)不一致时标记错误;联合变体在两个循环探针之间的角距离上训练单个模型。InternVL2 激活上的检测器产生了近乎完美的 F1,而 Qwen3-VL 激活上的检测器表现较低,这与可用的训练错误较少一致。正如我们在 §5.1 和图 5 中所示,检测器 F1 与下游校正增益强相关。类似的训练和分析已在最后一个 token 和从视觉编码器提取的平均 token 层面进行过,更多细节见附录 C。
3.5 SVCCA:真值探针与输出探针之间的子空间发散 此过程对所有探针、数据集、所有四层模型重复,并对三个随机种子取平均。SVCCA 衡量学习到的表示之间的相似性。在图 3 中,我们报告了在两个目标下训练的同一探针家族的权重(图 14a 为激活)之间计算的 SVCCA 分数:真值计数预测和模型输出计数预测。在图 3(a) 中,非线性探针(Circular 和 MLP)处于近乎正交的区域(低 SVCCA)。线性探针显示出比非线性探针更高的对齐度,但对齐度仍然有限,尤其是对于逻辑回归。这些发现支持子空间错位假设:与计数相关的信息在内部编码,但与驱动最终言语化输出的表示子空间耦合较弱。为了测试这种模式是否仅仅是层选择的人工产物,图 3(b) 绘制了
5
第 6 页
层间差距与权重-SVCCA gt_probe 与 output_probe:按探针类型划分的权重-SVCCA 1.0 r = -0.45 LinLog MLP 解释 1.0 Circ 高 (同一子空间) 中等 0.8 0.8 低 极低 0.623 0.6 0.6
0.4 权重-SVCCA 权重-SVCCA 0.4 0.320 均值 0.2 0.2 0.100 0.098
0.0 0.0 Lin Log MLP Circ 0 5 10 15 20 25 30 探针类型 层间差距 |gt_layer out_layer|
(a) 按探针家族划分的平均权重-SVCCA。 (b) 权重-SVCCA 与最佳层间差距的关系。
图 3:gt_probe 与 output_probe 的权重空间 SVCCA 分析。(左)在完整的 4 模型、4 数据集、3 种子扫描中,按探针家族划分的平均 SVCCA。MLP 和圆形探针位于近乎正交的区域,而线性探针显示出显著更高的对齐度。(右)SVCCA 与最佳层间差距 |lgt −lout| 的关系。较大的层间分歧往往与较低的对齐度相关,但在较小的层间差距下 SVCCA 仍然较低,这表明子空间分歧不能仅归因于深度不匹配。
SVCCA 与最佳层间差距。即使在较小的层间差距下,低 SVCCA 仍然持续,这表明子空间分歧不能仅归因于深度不匹配,正如先前研究(Burns et al., 2023; Gekhman et al., 2025)所讨论的那样。
4 因果引导干预
上述探针和 SVCCA 分析确立了一个事实:VLM 内部编码的计数信息与其口头化输出存在分歧。这些结果具有相关性:探针可能恢复了一个与计数相关但在生成过程中并非因果参与的方向。为了区分这两种可能性,我们在所有四个合成数据集的完整合成测试集上执行了直接的激活引导实验。
方法。对于每个样本,我们首先运行未修改的模型以获得基线预测 $\hat{y}$,并记录基线准确率(图 4)。然后,我们在保存的 Logistic gt_probe 的最佳层 $l^*$ 处应用单次前向钩子(forward-hook)干预,重新运行相同的样本。令 $x_{l^*} \in \mathbb{R}^d$ 表示第 $l^*$ 层的最终提示词元隐藏状态,$w_c$ 表示类别 $c$ 的探针权重向量。我们将引导方向定义为真实类别方向与基线类别方向之间的归一化成对差异:
$$ d = \frac{w_y – w_{\hat{y}}}{\|w_y – w_{\hat{y}}\|_2}, \quad \tilde{x}_{l^*} = x_{l^*} + \alpha \cdot \text{RMS}(x_{l^*}) \cdot d, \quad \text{(1)} $$
$$ \text{RMS}(x) = \frac{\|x\|_2}{\sqrt{d}}, $$
其中 $\alpha$ 控制引导强度,RMS 缩放确保扰动与局部激活范数成正比。作为对照,我们运行相同的实验,将 $d$ 替换为相同维度的随机采样单位向量。每个 $\alpha$ 在 5 到 65 的范围内进行扫描。
结果。图 4 绘制了探针派生(蓝色)和随机方向(红色)干预下模型准确率随 $\alpha$ 变化的函数关系。出现以下三个观察结果:(1) 探针派生的引导在因果上改善了计数。在所有四个数据集上,沿探针方向引导在广泛的范围内(绿色区域)将准确率提升至未引导基线之上。最显著的增益出现在 diff_col_diff_shape 上,准确率从约 27% 的基线提升至中等 $\alpha$ 时的峰值约 46%,对应绝对增益约为 19 个百分点。在 sing_col_sing_shape 和 diff_col_sing_shape 上,尽管增益较温和但持续存在(约 6–8 个百分点),且贯穿一系列中等干预强度。这些结果表明,探针恢复的方向不仅仅是与计数相关,而是在模型的生成过程中发挥了因果作用。(2) 随机引导单调地降低了性能。在所有四个数据集上,随机方向控制要么在 $\alpha$ 较小时保持在基线附近,要么随着 $\alpha$ 的增长而稳步下降(红色曲线进入粉色区域),这证实了 (1) 中的改进是特定于探针派生方向 $d$ 的。
第 7 页
引导准确率 原始基线 破坏性引导区域 随机噪声基线 有效引导区域 5 探测器引导的自我修正 不同颜色,不同形状 不同颜色,单一形状 50% 45% 方法 35% 令 $x_l^* \in \mathbb{R}^d$ 为从层 $l^*$ 的 Accuracy 40%30% 模型 20%25% 最后一个非填充 token 中提取的激活,针对 15% VLM M 对于图像-查询对 $(I, q)$,其中 10% 单一颜色,不同形状 单一颜色,单一形状 50% $l^* = \arg \max_l F1(D(l), D_{val})$ 是在保留验证 45% 集 $D_{val}$ 上产生最佳探测器性能的层。令 $\hat{y}^{(1)} = M(I, q)$ 为首次 Accuracy 30% 模型 20%25% 预测。探测器 $D(l^*) : \mathbb{R}^d \rightarrow [0, 1]$
15% 估计错误概率: 10% 10 20 30 40 50 60 10 20 30 40 50 60 (Alpha) (Alpha)
图 4:InternVL2-1B 在四个合成计数数据集上的因果引导结果。绿色阴影标记了有效引导区域,其中基于探针的引导超过基线;粉色阴影标记了破坏性区域,其中引导低于基线。
而不是通用激活扰动的伪影。随着 $\alpha$ 进一步增加,蓝色和红色曲线之间差距的扩大进一步证实了因果效应的方向特异性。(3) 过度引导具有破坏性。在所有数据集上,存在一个临界 $\alpha$,超过该值后,即使是基于探针的引导也开始产生负面影响。在 sing_col_diff_shape 上,蓝色曲线在 $\alpha = 45$ 左右进入破坏性区域,而在 diff_col_sing_shape 上,增益过早 plateau。这种非单调性与局部线性解释一致:探针方向是计数子空间的良好一阶近似,但大的扰动会将隐藏状态推离该线性近似成立的区域。
启示。因果引导实验表明,基于探针的计数方向可以影响生成,但也揭示了直接激活干预取决于两个因素:数据集几何结构和引导幅度 $\alpha$。这促使我们以一种侵入性更小的方式使用相同的表征见解:与其直接修改隐藏状态,我们使用激活级别的错误信号来决定模型何时应重新考虑其答案。图 5 支持了这一选择,显示探测器 F1 与修正增益之间存在强烈的正相关,表明可靠的内部失败预测转化为有效的下游修正。因此,我们转向一种探测器引导的自我修正方法,将探针视为干预门而非引导机制。
5.1 所提方法结果
表 1 报告了零-shot 原始模型、Always Reprompt 基线、Random-K 基线以及我们的方法在四个合成数据集和四个 VLM 上的性能。在 Always Reprompt 设置中,每个样本都被无条件地重新提示(即 100% 的样本),而 Random-K 重新提示与我们探针标记的相同数量 $K$ 的样本,但以均匀随机方式选择它们。
我们观察到,对于几乎所有模型,具有单一颜色且形状变化的数据集是最难的。唯一的例外是 InternVL2-4B 模型。接下来,我们在第 5.1 节中介绍探测器引导的自我修正,此处 $\tau$ 固定为等于 0.5 的常数。
7
第 8 页
数据集 模型 原始 始终重提示 表示 随机-K ours (∆) 误差检测器架构。其次,VLM 家族之间的差异比检测器之间的差异更大:InternVL2 受益显著(高达 +15.95 个百分点),而 Qwen3-VL-2B 的收益为 IVL2-1B 26.50 23.50 23.97 31.80 (+5.31) 35.43 IVL2-1B 29.77 28.21 28.45 (+5.66) (+0.43 至 +2.42 个百分点),且独立于探针选择, IVL2-4B 34.62 50.85 45.73 50.21 (+15.60) DC-DS Q3VL-2B 71.51 71.51 71.69 72.04 (+0.53) 43.95 IVL2-4B 39.89 44.16 43.02 (+4.06) Q3VL-8B 79.34 84.33 80.31 83.76 (+4.42) 这表明纠正的瓶颈在于激活中误差信号的质量,而不是检测器架构本身。表 A.4 DC-SS Q3VL-2B 71.94 72.93 72.65 72.83 (+0.89) 报告了每个检测器的真阳性纠正率和假阳性保留率。其他提示见 B.1。通过在 CountBench 数据集上重复完整的 SC-SS Q3VL-8B 92.31 94.44 92.59 94.41 (+2.10) 流程,我们证明我们的发现不仅适用于合成数据集。 IVL2-1B 24.22 24.22 23.50 30.88 (+6.66) IVL2-4B 43.02 47.58 46.79 50.61 (+7.59) 表 A.4 SC-DS 62.46 Q3VL-2B 61.40 62.11 61.18 (+1.07) 报告了每个检测器的真阳性纠正率和假阳性保留率。其他提示见 B.1。通过在 CountBench 数据集上重复完整的 SC-SS Q3VL-8B 66.95 77.49 71.94 77.49 (+10.54) IVL2-1B 23.65 30.48 28.77 35.11 (+11.47) 流程,我们证明我们的发现不仅适用于合成数据集。 IVL2-4B 39.74 44.73 43.20 45.37 (+5.63) 表 A.4 Q3VL-2B 69.80 70.94 70.48 71.62 (+1.82) Q3VL-8B 90.60 92.17 90.92 92.59 (+1.99) 流程,我们证明我们的发现不仅适用于合成数据集。 IVL2-1B 40.15 49.24 46.78 46.97 (+6.82) 流程,我们证明我们的发现不仅适用于合成数据集。 IVL2-4B 51.33 54.73 51.66 55.11 (+3.79) CountBench 79.31 Q3VL-2B 72.92 78.79 73.67 (+6.39) 88.59 Q3VL-8B 79.92 89.02 81.11 (+8.66) 6 结论
在本文中,我们介绍了第一项研究,该研究考察了简单的探针如何预测真实计数、模型预测计数以及 VLM 内部表示中的错误似然。我们进一步证明,这些简单的探针可以准确地预测 VLM 何时即将生成错误的计数。互补的 SVCCA 分析显示,在真实计数上训练的探针和在模型输出上训练的探针占据了未对齐的读出子空间,表明生成过程中真实计数表示和输出计数表示之间存在分歧。我们进一步使用因果引导干预验证了我们的发现,证明增强计数识别探针的方向确实提高了模型的计数性能。最后,我们将这些见解整合到一种方法中,该方法使用简单的探针进行错误检测和基于重提示的纠正,使计数性能提高了高达 15.6%。 表 1:在 3 个种子和 4 个检测器上聚合的平均计数准确率 (%)。始终重提示是朴素的重提示;它对 100% 的评估样本应用纠正(重提示)。Random-K 是预算匹配的随机干预;Ours 是基于检测器的纠正。∆ 仅报告 Ours − Before(百分点)。红色值表示与原始值相比性能下降。
尽管始终重提示在几种配置下优于 ours,但它不是两种原因下的实用策略。首先,它在计算上昂贵,因为它无条件地需要对整个数据集进行第二次前向传播。其次,无差别重提示是不可靠的:它可能会翻转之前正确的答案,从而降低整体性能(表 1)。相比之下,ours 恢复了始终重提示实现的大部分收益,同时仅对一小部分样本进行选择性重提示,避免了计算开销和性能下降的风险。它始终优于 Random-K 基线。总体而言,我们的方法带来了高达 15.6%(平均 5.3%)的提升。最大的增益出现在 InternVL2 家族,而最小的增益出现在 Qwen3-VL-2B;这些趋势与误差检测探针的质量紧密一致(图 2c)。图 5 进一步说明了探针在误差检测上的性能与自我纠正增益之间的相关性,显示当探针的 F1 分数超过 90% 时获得最大的改进(强相关性 ρ = 0.803)。表 3 提供了跨检测器类型的纠正增益摘要。我们可以看到几种模式。首先,没有单个检测器始终占主导地位,这表明检测器选择并不关键,且该方法具有鲁棒性。
7 局限性与未来工作
局限性在于,由于计算限制,我们仅研究了高达 8B 参数的模型,使用其向现实世界场景转移尚未验证的合成数据,仅涵盖两个 VLM 家族,仅使用一个模型进行因果干预实验,并将计数任务限制在 1-9 范围内。未来的工作应评估更大的模型、现实世界的泛化能力、更多的 VLM 家族以及超出 10 个物体的更难的计数场景。
参考文献 Manoj Acharya, Kushal Kafle, and Christopher Kanan. 2019. TallyQA: Answering complex counting ques-
8
第 9 页
在《AAI人工智能会议论文集》第33卷,第8076–8084页。
Guillaume Alain 和 Yoshua Bengio。2017。使用线性分类器探针理解中间层。在《国际学习表征会议(ICLR)研讨会》。ArXiv:1610.01644。
Simone Alghisi, Gabriel Roccabruna, Massimo Rizzoli, Seyed Mahed Mousavi, 和 Giuseppe Riccardi。2025。[解构/重构] VLM在计数中的推理。预印本,arXiv:2510.19555。
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhi-fang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, 等45人。2025。Qwen3-VL技术报告。预印本,arXiv:2511.21631。
Yonatan Belinkov。2022。探针分类器:承诺、局限性与进展。《计算语言学》,48(1):207–219。
Collin Burns, Haotian Ye, Dan Klein, 和 Jacob Steinhardt。2023。无监督发现语言模型中的潜在知识。arXiv预印本 arXiv:2212.03827。
Prithvijit Chattopadhyay, Ramakrishna Vedantam, Ram-prasaath R. Selvaraju, Dhruv Batra, 和 Devi Parikh。2017。在日常场景中计数日常物体。在《IEEE计算机视觉与模式识别会议(CVPR)论文集》,第1135–1144页。
Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, 等。2024。InternVL:扩展视觉基础模型并针对通用视觉-语言任务进行对齐。在《IEEE/CVF计算机视觉与模式识别会议论文集》,第24185–24198页。
Ahmed Oumar El-Shangiti, Tatsuya Hiraoka, Hilal AlQuabeh, Benjamin Heinzerling, 和 Kentaro Inui。2025。数值推理的几何结构:语言模型在线性子空间中比较数值属性。在《美洲语言技术协会计算语言学会议论文集:人类语言技术(第2卷:短文)》,第550–561页,新墨西哥州阿尔伯克基。计算语言学协会。
Chaoyou Fu, Yujie Dai, Yinpeng Luo, Liang Li, Shuhuai Ren, Runpeng Zhang, Zihan Wang, Chenyang Zhou, Yadong Shen, Meng Zhang, 等。2023。MME:多模态大语言模型的综合评估基准。arXiv预印本 arXiv:2306.13394。
Zorik Gekhman, Eyal Ben David, Hadas Orgad, Eran Ofek, Yonatan Belinkov, Idan Szpektor, Jonathan Herzig, 和 Roi Reichart。2025。由内而外:LLM中的隐藏事实知识。预印本,arXiv:2503.15299。
Xuyang Guo, Zekai Huang, Zhenmei Shi, Zhao Song, 和 Jiahao Zhang。2025。你的视觉语言模型甚至数不到20:揭示VLM在组合计数中的失败。预印本,arXiv:2510.04401。
Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, 和 Mahdieh Soleymani Baghshah。2025。理解大语言模型和视觉语言模型中的计数机制。预印本,arXiv:2511.17699。
Benjamin Heinzerling 和 Kentaro Inui。2024。语言模型中数值属性的单调表示。在《第62届计算语言学协会年会论文集(第2卷:短文)》,第175–195页,泰国曼谷。计算语言学协会。
John Hewitt 和 Percy Liang。2019。使用控制任务设计和解释探针。预印本,arXiv:1909.03368。
John Hewitt 和 Christopher D. Manning。2019。用于在词表示中寻找句法的结构探针。在《北美计算语言学协会第2019年会议论文集:人类语言技术,第1卷(长篇和短篇论文)》,第4129–4138页,明尼苏达州明尼阿波利斯。计算语言学协会。
Saurav Kadavath, Rylan Schaeffer, Juhyeon Kwon, Katie Mills, Alyssa Yao, 等。2022。语言模型(大部分)知道它们知道什么。arXiv预印本 arXiv:2207.05221。
Jing Yu Koh, Robert Lo, Lawrence Jang, Vikram Duvvur, Ming Chong Lim, Po-Yu Huang, Graham Neubig, Shuyan Zhou, Ruslan Salakhutdinov, 和 Daniel Fried。2024。VisualWebArena:在逼真的视觉网页任务上评估多模体智能体。预印本,arXiv:2401.13649。
Junnan Li, Dongxu Li, Silvio Savarese, 和 Steven C. H. Hoi。2023a。BLIP-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练。在《第40届国际机器学习会议论文集》,《机器学习研究论文集》第202卷,第19730–19742页。PMLR。
Kenneth Li, Oam Patel, Fernanda Viégas, Hanspeter Pfister, 和 Martin Wattenberg。2023b。推理时干预:从语言模型中引出真实答案。在《神经信息处理系统进展》,第36卷。Curran Associates, Inc.
Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, 等。2023c。评估大型视觉语言模型中的物体幻觉:POPE基准。arXiv预印本 arXiv:2305.10355。
9
第 10 页
Haotian Liu, Chunyuan Li, Qingyang Wu, 和 Yong Jae Lee. 2023a. 视觉指令微调。预印本,arXiv:2304.08485。
Yucheng Sun, Alessandro Stolfo, 和 Mrinmaya Sachan. 2025. 探测语言模型中的算术错误。预印本,arXiv:2507.12379。
Yang Liu, Wenhai Du, Kai Zhang, Xiaoxin Li, Jinghao Hu, Xiang Liu, Zicheng Zhou, Yuan He, Zejun Qiu, 等。2023b. MMBench:你的多模态模型是全才吗?arXiv 预印本 arXiv:2307.06281。
Ian Tenney, Dipanjan Das, 和 Ellie Pavlick. 2019. BERT 重新发现了经典的 NLP 流水线。在《第 57 届计算语言学协会年会议论文集》中,第 4593–4601 页,意大利佛罗伦萨。计算语言学协会。
Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, 和 Jianfeng Gao. 2024. MathVista:在视觉语境中评估基础模型的数学推理能力。预印本,arXiv:2310.02255。
An Vo, Khai-Nguyen Nguyen, Mohammad Reza Tae-siri, Vy Tuong Dang, Anh Totti Nguyen, 和 Daeyoung Kim. 2025. 视觉语言模型存在偏见。预印本,arXiv:2505.23941。
Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Sean Welleck, Amir Yazdanbakhsh, 和 Peter Clark. 2023. Self-refine:基于自我反馈的迭代优化。在《神经信息处理系统进展》中,第 36 卷。Curran Associates, Inc.
Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, 和 Denny Zhou. 2023. 自洽性提升语言模型中的思维链推理。在《国际学习表征会议》中。
Kevin Meng, David Bau, Alex Andonian, 和 Yonatan Belinkov. 2022. 定位和编辑 GPT 中的事实关联。在《神经信息处理系统进展》中,第 35 卷,第 17359–17372 页。Curran Associates, Inc.
Tengjin Weng, Jingyi Wang, Wenhao Jiang, 和 Zhong Ming. 2025. VisNumBench:评估多模态大语言模型的数感。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 3830–3840 页。
Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, 和 Tali Dekel. 2023a. 教 CLIP 数到十。预印本,arXiv:2302.12066。
Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pieric Cistac, Tim Rault, Remi Louf, Morgan Funtowicz, Joe Davison, Sam Shleifer, Patrick von Platen, Clara Ma, Yacine Jernite, Julien Plu, Canwen Xu, Teven Le Scao, Sylvain Gugger, 等 3 人。2020. 变换器:最先进的自然语言处理。在《2020 年自然语言处理实证方法会议论文集:系统演示》中,第 38–45 页。
Roni Paiss, Ariel Ephrat, Omer Tov, Shiran Zada, Inbar Mosseri, Michal Irani, 和 Tali Dekel. 2023b. 教 CLIP 数到十。在《IEEE/CVF 国际计算机视觉会议论文集》中,第 3323–3333 页。
Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Karthik Narasimhan, Yuan Cao, 等。2023a. 思维树:利用大语言模型进行深思熟虑的问题解决。arXiv 预印本 arXiv:2305.10601。
Maithra Raghu, Justin Gilmer, Jason Yosinski, 和 Jascha Sohl-Dickstein. 2017. SVCCA:用于深度学习动态和可解释性的奇异向量典型相关分析。在《神经信息处理系统进展》中,第 30 卷。Curran Associates, Inc.
Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, 和 Yuan Cao. 2023b. ReAct:在语言模型中协同推理与行动。在《国际学习表征会议》中。
Nikolai Rozanov 和 Marek Rei. 2025. StateAct:通过自我提示和状态跟踪增强 LLM 基础智能体。在《第 1 届智能体语言模型研究研讨会论文集》中,第 367–385 页,奥地利维也纳。计算语言学协会。
Wenhao Yu, Yiming Chen, Xiang Wu, Zhen He, Yuhang Liu, Xu Zhao, 等。2023. MM-Vet:评估大型多模态模型的综合能力。arXiv 预印本 arXiv:2308.02490。
Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, 和 Donald E. Brown. 2025. 视觉语言模型能计数吗?一个合成基准及基于注意力的干预分析。预印本,arXiv:2511.17722。
Xi Yue, Yuan Ni, Kai Zhang, Tong Zheng, Yang Liu, Wenxuan Gao, 等。2023. MMMU:一个面向专家级人工智能的大规模多学科多模态理解与推理基准。arXiv 预印本 arXiv:2311.16502。
Noah Shinn, Federico Cassano, Ashwin Gopinath, Karthik Narasimhan, 和 Shunyu Yao. 2023. Reflexion:具有强化学习的语言智能体。在《神经信息处理系统进展》中,第 36 卷。Curran Associates, Inc.
A 详细结果
A.1 SVCCA 细节
我们使用奇异向量典型相关分析(SVCCA)(Raghu 等,
第 11 页
2017)。考虑一对具有相同架构的已训练线性分类器,其权重矩阵表示为 $$W_{gt} \in \mathbb{R}^{c \times d}, \quad W_{out} \in \mathbb{R}^{c \times d}, \quad (4)$$ 其中 $c$ 是类别的数量,$d$ 是隐藏维度。探针权重矩阵的每一行对应一个特定类别的读出方向,因此该矩阵的行空间表征了该探针用于预测的子空间。
为了为每个探针提取稳定的低维基,我们计算奇异值分解: $$W_{gt}^\top = U_{gt}\Sigma_{gt}V_{gt}^\top, \quad W_{out}^\top = U_{out}\Sigma_{out}V_{out}^\top. \quad (5)$$ 然后,我们从每个分解中保留前 $k$ 个左奇异向量,得到正交基矩阵 $$U_{gt}^{(k)}, U_{out}^{(k)} \in \mathbb{R}^{d \times k}. \quad (6)$$ 这些基分别张成了真实标签探针和输出探针使用的主要读出子空间。
接下来,我们通过计算其交叉投影矩阵的奇异值来衡量这两个子空间的对齐程度: $$\rho_1, \dots, \rho_k = \sigma_1, \dots, \sigma_k \left( U_{gt}^{(k)\top} U_{out}^{(k)} \right), \quad (7)$$ 其中每个 $\rho_i \in [0, 1]$ 是一个典型相关系数。直观地说,$\rho_i$ 衡量了两个探针子空间中第 $i$ 个最对齐方向的相似程度。我们通过平均典型相关系数来总结对齐程度: $$\text{SVCCA}(W_{gt}, W_{out}) = \frac{1}{k} \sum_{i=1}^k \rho_i. \quad (8)$$
A.2 合成数据集详情
B 修正提示模板
以下提示在探测器引导的自我修正流程的第二遍(§5)中使用: $$f_{corr}(q, \hat{y}^{(1)})$$
<image>
<q>: 这张图片中有多少个物体?
Answer:
Your previous answer: \hat{y}^{(1)}
That’s definitely wrong. The correct count
should be:
如图 5 所示,计数提示在四个数据集中的三个上产生了最高的绝对增益,在 sing_col_diff_shape 上达到了 +16.67 的提升。然而,stronger 仍然是最保守和最稳定的方法。在通过以保真度为导向的指标进行评估时,stronger 保持了最高的平均假阳性保留率(在合成数据集中范围为 71.95% 到 95.21%),并实现了
Detector F1 vs Correction Gain 17.5 Model InternVL2-1B 15.0 Qwen3-VL-2B-Instruct InternVL2-4B (pp) 12.5 Qwen3-VL-8B-Instruct Detector 10.0 MLP Log-S Accuracy 7.5 Circ-J Circ-S Delta 5.0 2.5 0.0 0.4 0.5 0.6 0.7 0.8 0.9 1.0 Best Detector F1
Figure 5: Detector F1 vs. correction gain ($\Delta$Acc)。每个点代表一次运行(模型 $\times$ 数据集 $\times$ 探测器 $\times$ 种子)。Spearman $\rho = 0.803$。
所有轮次使用的系统提示如下:
System Prompt You are a helpful assistant. Output only the final count in the format <count>.
B.1 附加提示的实验
为了评估探测器引导的自我修正对干预提示具体框架的敏感性,我们比较了三种不同的重提示策略。每种提示变体的确切文本定义如下:
stronger That’s definitely wrong. The correct count should be:
strongv2 That’s incorrect. Recount every visible item in the image carefully.
counting I made an error in my previous count—there appears to be a different number of objects in the image. I’ll recount carefully, step by step:
第 12 页
属性 值
颜色 蓝色、红色、绿色、黄色、黑色、橙色、紫色、青色、品红色、酸橙色 形状 圆形、正方形、三角形 颜色模式 sing_color(每张图片统一颜色)、diff_color(每个物体不同颜色) 形状模式 sing_shape(每张图片统一形状)、diff_shape(每个物体不同形状) 物体数量 1–9 图像分辨率 512 × 512
表 2:合成计数数据集的属性。Pillow Python 包负责图像创建和形状渲染
1.0 InternVL2-1B | gt_probe | DC-DS Qwen3-VL-2B-Instruct | gt_probe | DC-DS InternVL2-4B | gt_probe | DC-DS Qwen3-VL-8B-Instruct | gt_probe | DC-DS 1.0 InternVL2-1B | gt_probe | DC-SS Qwen3-VL-2B-Instruct | gt_probe | DC-SS InternVL2-4B | gt_probe | DC-SS Qwen3-VL-8B-Instruct | gt_probe | DC-SS
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2 ArchitectureLinLogCircMLP ArchitectureLinLogCircMLP 0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(a) 跨模型深度的逐层探测 F1 分数(真实目标)。 (a) 跨模型深度的逐层探测 F1 分数(真实目标)。
InternVL2-1B | output_probe | DC-DS Qwen3-VL-2B-Instruct | output_probe | DC-DS InternVL2-4B | output_probe | DC-DS Qwen3-VL-8B-Instruct | output_probe | DC-DS InternVL2-1B | output_probe | DC-SS Qwen3-VL-2B-Instruct | output_probe | DC-SS InternVL2-4B | output_probe | DC-SS Qwen3-VL-8B-Instruct | output_probe | DC-SS 1.0
0.8 0.8 ArchitectureLinLogCircMLP F1 ArchitectureLinLogCircMLP F1 1.0 0.6 0.6 Probe 0.4 Probe 0.4
0.2 0.2
0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(b) 跨模型深度的逐层探测 F1 分数(模型输出目标)。 (b) 跨模型深度的逐层探测 F1 分数(模型输出目标)。
1.0 InternVL2-1B | DC-DS Qwen3-VL-2B-Instruct | DC-DS InternVL2-4B | DC-DS Qwen3-VL-8B-Instruct | DC-DS InternVL2-1B | DC-SS Qwen3-VL-2B-Instruct | DC-SS InternVL2-4B | DC-SS Qwen3-VL-8B-Instruct | DC-SS
F1 0.8 F1 0.8 0.6 0.6 Detector Detector 0.4 0.4 Error Error 0.2 0.2 DetectorMLPLog-SCirc-JCirc-S DetectorMLPLog-SCirc-JCirc-S 0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(c) 每层的错误检测器性能(F1 分数)。 (c) 每层的错误检测器性能(F1 分数)。
图 6:跨模型深度的逐层探测和检测器性能 图 7:跨模型深度的逐层探测和检测器性能 顶部:按层划分的真实探测 F1 分数。 顶部:按层划分的真实探测 F1 分数。 中部:按层划分的输出监督探测 F1 分数。 中部:按层划分的输出监督探测 F1 分数。 底部:按层划分的错误检测器 F1 分数。曲线是在模型和三个随机种子之间聚合的。DC- 底部:按层划分的错误检测器 F1 分数。曲线是在模型和三个随机种子之间聚合的。DC- DS:不同颜色不同形状数据集 SS:不同颜色单一形状数据集
在大多数数据集和划分的组合中,四种数据集(diff_col_diff_shape 和 具有最高的综合有效性。这凸显了激进错误纠正与基线一致性保持之间的清晰架构权衡。 sing_col_sing_shape)。 相比之下,探针引导方法始终产生正向增益,在 sing_col_diff_shape 划分上实现了巨大的 +16.24% 绝对提升。从机制上讲, B.2 熵与探针引导自校正的比较 探针引导方法通过准确定位和纠正有缺陷的推理路径而成功, 而通用的、基于不确定性的熵指标未能有效解决这些问题。 结果表明,探针引导的自校正严格优于所有评估数据集上的基于熵的启发式方法。 仅依赖输出熵来触发自校正非常不可靠;它在两个数据集上积极降低模型性能(产生净负准确率增量)。
C 视觉编码器探测结果 测试在两种不同的设置下进行:探针是在提取的激活上训练的
12
第 13 页
InternVL2-1B | gt_probe | SC-DS Qwen3-VL-2B-Instruct | gt_probe | SC-DS InternVL2-4B | gt_probe | SC-DS Qwen3-VL-8B-Instruct | gt_probe | SC-DS 1.0 InternVL2-1B | gt_probe | SC-SS Qwen3-VL-2B-Instruct | gt_probe | SC-SS InternVL2-4B | gt_probe | SC-SS Qwen3-VL-8B-Instruct | gt_probe | SC-SS 1.0
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2 ArchitectureLinLogCircMLP ArchitectureLinLogCircMLP 0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(a) 跨模型深度的逐层探测 F1 分数(真实目标)。 (a) 跨模型深度的逐层探测 F1 分数(真实目标)。
InternVL2-1B | output_probe | SC-DS Qwen3-VL-2B-Instruct | output_probe | SC-DS InternVL2-4B | output_probe | SC-DS Qwen3-VL-8B-Instruct | output_probe | SC-DS InternVL2-1B | output_probe | SC-SS Qwen3-VL-2B-Instruct | output_probe | SC-SS InternVL2-4B | output_probe | SC-SS Qwen3-VL-8B-Instruct | output_probe | SC-SS 1.0
0.8 0.8 ArchitectureLinLogCircMLP F1 ArchitectureLinLogCircMLP F1 1.0 0.6 0.6 Probe 0.4 Probe 0.4
0.2 0.2
0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(b) 跨模型深度的逐层探测 F1 分数(模型输出目标)。 (b) 跨模型深度的逐层探测 F1 分数(模型输出目标)。
1.0 InternVL2-1B | SC-DS Qwen3-VL-2B-Instruct | SC-DS InternVL2-4B | SC-DS Qwen3-VL-8B-Instruct | SC-DS 1.0 InternVL2-1B | SC-SS Qwen3-VL-2B-Instruct | SC-SS InternVL2-4B | SC-SS Qwen3-VL-8B-Instruct | SC-SS
F1 0.8 F1 0.8 0.6 0.6 Detector Detector 0.4 0.4 Error Error 0.2 0.2 DetectorMLPLog-SCirc-JCirc-S DetectorMLPLog-SCirc-JCirc-S 0.0 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35
(c) 逐层误差检测器性能(F1 分数)。 (c) 逐层误差检测器性能(F1 分数)。
Figure 8: 跨模型深度的逐层探测和检测器性能 Figure 9: 跨模型深度的逐层探测和检测器性能 顶部:按层划分的真实探针 F1 分数。 顶部:按层划分的真实探针 F1 分数。 中部:按层划分的输出监督探针 F1 分数。 中部:按层划分的输出监督探针 F1 分数。 底部:按层划分的误差检测器 F1 分数。曲线在模型和三个随机种子之间聚合。SC-DS:单色不同形状数据集。 底部:按层划分的误差检测器 F1 分数。曲线在模型和三个随机种子之间聚合。SC-SS:单色单形状数据集。
VLM 视觉编码器的最后一个视觉令牌的处理流程。这一趋势在各种视觉表示复杂度中持续存在,尽管这些样本的性能通常低于其真实对应样本的性能。 (结果分别显示在图 19、20、21 和 22 中,以及每张图像中所有令牌的平均激活结果,显示在图 15、16、17 和 18 中)。 对 DC-DS、DC-SS、SC-DS 和 SC-SS 数据集的分层分析结果揭示了模型内部感知与其最终言语化结果之间持续存在的机制差距。具体而言,多层感知机(MLP)在非常早的阶段——通常在第 5 层或第 10 层——就达到了性能峰值,并在此后直到最终层保持这一平台期。这表明“真实”答案在正向传播的早期阶段就从视觉输入中提取出来,并在模型内部得到表示。模型在到达最终输出层(在此处做出言语化决策)之前很久就已经“知道”了答案。值得注意的是,Qwen-3-VL 模型的真实探针在中层之后开始下降,这在 InternVL-2 模型中并未观察到。与在过程早期就达到平台期的真实探针不同,输出探针通常仅在最后阶段才达到峰值 F1 值。 此外,基于视觉编码器激活训练的误差检测算法获得的高 F1 分数,很可能是由于场景复杂度与模型错误率之间的虚假相关性,而非真正的误差检测。因为视觉语言模型(VLM)在包含大量物体的图像上会犯更多错误,而这些图像往往在视觉上更密集和杂乱,所以“复杂”场景(多物体)和“简单”场景(少物体)的视觉编码器激活存在系统性差异。误差检测算法利用了这一点:它学会对对应于复杂场景的激活预测“错误”,对简单场景预测“正确”,从而实际上充当了场景复杂度分类器,而非误差检测器。由于复杂性和错误在数据集中共存,这导致了 F1 分数的变化被夸大,并不能反映模型判断成功或失败的真实能力。
在模型的最终层中,这表明实际计数的表征子空间仅在生成过程的末尾才完全形成。对比分析显示,基于平均激活值训练的探针 consistently 优于其他方法。
13
第 14 页
InternVL2-1B | gt_probe | CountBench Qwen3-VL-2B-Instruct | gt_probe | CountBench InternVL2-4B | gt_probe | CountBench Qwen3-VL-8B-Instruct | gt_probe | CountBench 1.0 Architecture Dataset Model MLP Log-S Circ-J Circ-S 0.8 LinLogCircMLP 0.6 F1 Probe 0.4 InternVL2-1B +5.27 +6.41 +5.13 +4.42 InternVL2-4B +15.10 +15.95 +15.81 +15.53 0.2 DC-DS +0.57 Qwen3-VL-2B +0.57 +0.43 +0.57 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 Qwen3-VL-8B +4.13 +5.27 +3.85 +4.42
(a) 跨模型深度的逐层探针 F1 分数(真实目标)。 InternVL2-1B +5.84 +5.98 +4.42 +6.41 DC-SS InternVL2-4B +4.13 +4.42 +3.70 +3.99 Qwen3-VL-2B +0.57 +0.71 +1.00 +1.28 Qwen3-VL-8B +1.85 +2.56 +1.99 +1.99
InternVL2-1B | output_probe | CountBench Qwen3-VL-2B-Instruct | output_probe | CountBench InternVL2-4B | output_probe | CountBench Qwen3-VL-8B-Instruct | output_probe | CountBench 1.0 +6.84 +6.84 InternVL2-1B +6.55 +6.41 0.8 +7.83 InternVL2-4B +7.69 +7.12 +7.69 ArchitectureLinLogCircMLP 0.6 F1 SC-DS Probe 0.4 Qwen3-VL-2B +1.14 +1.28 +1.14 +0.71 0.2 Qwen3-VL-8B +10.40 +11.11 +9.97 +10.68 0.0 0 5 10Layer 15 20 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 InternVL2-1B +11.40 +12.25 +10.97 +11.25 InternVL2-4B +5.56 +6.13 +5.84 +4.99 (b) 跨模型深度的逐层探针 F1 分数(模型输出目标)。 SC-SS Qwen3-VL-2B +1.00 +2.42 +2.28 +1.57 Qwen3-VL-8B +1.71 +2.28 +1.99 +1.99
1.0 InternVL2-1B | CountBench Qwen3-VL-2B-Instruct | CountBench InternVL2-4B | CountBench Qwen3-VL-8B-Instruct | CountBench Table 3: 分层检测器引导增益:均值 ∆Acc
F1 0.8 0.6 (pp) 对于我们的方法相对于“之前”的提升,按模型/数据集计算, Detector Detector and averaged over 3 seeds. Detector abbreviations are Error 0.4 0.2 MLPLog-SCirc-JCirc-S Log-S (Logistic-Separately), Circ-J (Circular-Jointly), 20 0.0 0 5 10Layer 15 25 0 5 10 Layer15 20 25 0 5 10 Layer15 20 25 30 0 5 10 15Layer20 25 30 35 and Circ-S (Circular-Separately). Bold and green mark (c) 逐层误差检测器性能(F1 分数)。 the best detector(s) per row.
图 10:跨模型深度的逐层探针和检测器性能。顶部:逐层真实探针 F1。中间:逐层输出监督探针 F1。底部:逐层误差检测器 F1。曲线是在模型和三个随机种子之间聚合的。CountBench 数据集
在所有四个视觉复杂度级别上,对最后一个视觉令牌限制探针。这种性能优势可能源于这样一个事实:准确计数所需的关键空间信息并不集中在单个补丁或令牌中,而是分布在整个图像网格中。通过聚合所有补丁的特征,平均表示允许对场景进行更整体的表示,减少了提取单个令牌固有的信息损失,并为探针提供更稳健的信号,以
检测器 F1 与校正增益
10
(pp) 8 模型 6 IV2-1B Q3-2B 准确率 IV2-4B 4 Q3-8B 检测器 Delta MLP 2 Log-S Circ-J Circ-S
0.0 0.2 0.4 0.6 0.8 1.0 最佳检测器 F1
图 11:检测器 F1 与校正增益 (∆Acc)。每个点代表一次运行。数据集为 CountBench
14
第 15 页
SC-SS | 权重-SVCCA SC-DS | 权重-SVCCA 1.0 ProbeLin 1.0 ProbeLin Log Log MLP MLP 0.8 Circ 0.8 Circ
0.6 0.6权重-SVCCA 权重-SVCCA 0.4 0.4 均值 均值 0.2 0.2
0.0 0.0 IV2-1B Q3-2B IV2-4B Q3-8B IV2-1B Q3-2B IV2-4B Q3-8B 模型 模型
(a) 单色单形 (b) 单色异形
DC-SS | 权重-SVCCA DC-DS | 权重-SVCCA 1.0 ProbeLin 1.0 ProbeLin Log Log MLP MLP 0.8 Circ 0.8 Circ
0.6 0.6权重-SVCCA 权重-SVCCA 0.4 0.4 均值 均值 0.2 0.2
0.0 0.0 IV2-1B Q3-2B IV2-4B Q3-8B IV2-1B Q3-2B IV2-4B Q3-8B 模型 模型
(c) 异色单形 (d) 异色异形
图 12:不同视觉语言模型和数据集的逐层 SVCCA 相似度得分。高分表示真实标签与输出探针之间具有强对齐性。
15
第 16 页
MLP Log-S Circ-J Circ-S
Data Model TP FP ∆Acc (pp) TP FP ∆Acc (pp) TP FP ∆Acc (pp) TP FP ∆Acc (pp)
IVL2-1B 8.9 86.6 5.26 10.1 88.6 6.41 8.8 85.1 5.13 8.4 79.1 4.40 IVL2-4B 25.9 78.7 15.09 27.5 76.7 15.94 26.5 83.8 15.81 26.2 80.0 15.51 DC-DS Q3-2B 4.2 97.6 0.56 5.3 95.0 0.43 4.4 98.1 0.56 5.5 95.0 0.56 Q3-8B 25.1 100.0 4.15 30.5 88.9 5.26 26.0 93.0 3.85 26.0 93.3 4.40
IVL2-1B 9.3 91.7 5.85 9.4 96.3 5.98 7.9 89.4 4.40 10.0 97.8 6.41 IVL2-4B 9.9 65.3 4.15 10.6 66.4 4.40 9.1 75.5 3.72 9.3 74.5 3.97 DC-SS Q3-2B 4.2 97.3 0.56 6.1 97.4 0.73 5.3 98.4 0.98 7.7 100.0 1.28 Q3-8B 48.9 100.0 1.84 61.0 100.0 2.56 42.2 99.3 2.01 48.3 83.3 2.01
IVL2-1B 11.1 62.3 6.84 10.5 61.1 6.54 11.0 71.2 6.41 10.7 73.5 6.84 IVL2-4B 17.1 66.8 7.82 18.1 61.5 7.69 16.3 75.9 7.14 17.1 77.8 7.69 SC-DS Q3-2B 5.0 96.4 1.15 7.3 91.0 1.28 5.2 95.9 1.15 4.6 92.1 0.73 Q3-8B 34.2 96.7 10.38 35.5 100.0 11.11 34.0 93.0 9.96 34.9 93.3 10.68
IVL2-1B 16.0 86.1 11.41 16.5 100.0 12.26 16.0 85.0 10.98 16.0 92.1 11.24 IVL2-4B 11.9 77.3 5.56 12.8 72.6 6.11 12.2 75.7 5.85 10.9 76.4 5.00 SC-SS Q3-2B 9.5 93.4 0.98 14.7 94.0 2.44 13.2 95.4 2.26 12.4 92.0 1.58 Q3-8B 33.8 100.0 1.71 42.7 100.0 2.26 34.9 99.0 2.01 41.3 94.4 2.01
表4:按模型和数据集划分的完整检测器分析,结果基于三个随机种子的平均值。在每个检测器模块内,列分别报告了TP(真阳性修正率,%)、FP(假阳性保留率,%)和∆Acc(净准确率增益,以百分点计)。模型缩写IVL2代表InternVL2,Q3代表Qwen3-VL;检测器缩写Log-S代表Logistic-Separately(逻辑回归-单独),Circ-J代表Circular-Jointly(圆形-联合),Circ-S代表Circular-Separately(圆形-单独)。
stronger strongv2 counting
Dataset Raw Naive Random-K Ours (∆) Naive Random-K Ours (∆) Naive Random-K Ours (∆)
diff_col_diff_shape 27.35 22.65 22.54 32.05 (+4.70) 26.92 25.43 30.77 (+3.42) 22.65 22.97 36.01 (+8.65) diff_col_sing_shape 29.49 27.78 26.71 36.22 (+6.73) 30.34 27.46 36.64 (+7.16) 23.93 23.72 37.71 (+8.23) sing_col_diff_shape 22.65 22.22 20.94 29.59 (+6.94) 19.23 17.52 26.71 (+4.06) 27.35 23.29 39.32 (+16.67) sing_col_sing_shape 23.93 31.20 28.21 33.97 (+10.04) 29.06 25.21 34.61 (+10.69) 18.38 18.80 28.42 (+4.49)
表5:InternVL2-1B合成数据集的重提示策略比较。结果基于四种探针架构(MLP、Circular-Separately、Logistic-Separately和Circular-Jointly)的平均值。
Entropy-Guided Probe-Guided (Ours)
Dataset Base Acc. Acc. ∆ Acc. ∆
diff_col_diff_shape 27.35% 25.64% -1.71% 34.62% +7.26% diff_col_sing_shape 29.49% 31.20% +1.71% 38.03% +8.55% sing_col_diff_shape 22.65% 29.06% +6.41% 38.89% +16.24% sing_col_sing_shape 23.93% 20.51% -3.42% 28.63% +4.70%
表6:基于计数提示策略的熵引导与探针引导自校正方法的比较。
16
第 17 页
层间隙与权重-SVCCA CountBench | 权重-SVCCA 1.0 r = -0.46 LinLog MLP Circ 1.0 探针线性 对数 0.8 MLP 0.8 Circ 0.6 0.6 0.4 权重-SVCCA 权重-SVCCA 0.4 均值 0.2 0.2
0.0 0.0 IV2-1B Q3-2B IV2-4B Q3-8B 0 1 2 3 4 5 6 7 8 模型 层间隙 |gt_layer out_layer|
(a) 按探针族划分的平均权重-SVCCA。 (b) 权重-SVCCA 与最佳层间隙的关系。
图 13:gt_probe 与 output_probe 的权重空间 SVCCA 分析。(左)在整个 4 模型、3 种子扫描中,按探针族划分的平均 SVCCA。MLP 和圆形探针位于近正交区域,而线性探针显示出显著更高的对齐度。(右)SVCCA 与最佳层间隙 |lgt −lout| 的关系。较大的层分歧往往与较低的对齐度相关,但在较小的层间隙下 SVCCA 仍然较低,这表明子空间发散不能简化为深度不匹配。CountBench 数据集
层间隙与激活-SVCCA gt_probe 与 output_probe:按探针类型划分的激活-SVCCA 1.0 r = -0.10 LinLog 0.997 MLP 解释 1.0 Circ 高 (同一子空间) 中等 0.875 0.8 0.8 0.726 0.753 低 非常低 0.6 0.6
0.4 激活-SVCCA 0.4 激活-SVCCA 均值 0.2 0.2
0.0 0.0 线性 对数 MLP Circ 0 5 10 15 20 25 30 探针类型 层间隙 |gt_layer out_layer|
(a) 按探针族划分的平均激活-SVCCA。 (b) 激活-SVCCA 与最佳层间隙的关系。
图 14:gt_probe 与 output_probe 的激活空间 SVCCA 分析。
17
第 18 页
1.0 InternVL2-1B | gt_probe | DC-DS Qwen3-VL-2B-Instruct | gt_probe | DC-DS InternVL2-4B | gt_probe | DC-DS Qwen3-VL-8B-Instruct | gt_probe | DC-DS 1.0 InternVL2-1B | gt_probe | DC-SS Qwen3-VL-2B-Instruct | gt_probe | DC-SS InternVL2-4B | gt_probe | DC-SS Qwen3-VL-8B-Instruct | gt_probe | DC-SS
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2 ArchitectureLinLogCircMLP ArchitectureLinLogCircMLP 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(a) 跨视觉编码器深度的逐层探针 F1 分数(真实目标) (a) 跨视觉编码器深度的逐层探针 F1 分数(真实目标)
Qwen3-VL-2B-Instruct | output_probe | DC-SS InternVL2-4B | output_probe | DC-SS Qwen3-VL-8B-Instruct | output_probe | DC-SS 1.0
0.8 InternVL2-1B | output_probe | DC-DS ArchitectureLinLogCircMLP Qwen3-VL-2B-Instruct | output_probe | DC-DS InternVL2-4B | output_probe | DC-DS Qwen3-VL-8B-Instruct | output_probe | DC-DS 1.00.8 InternVL2-1B | output_probe | DC-SS ArchitectureLinLogCircMLP
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2
0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(b) 跨视觉编码器深度的逐层探针 F1 分数
(模型输出目标)。 (模型输出目标)。
1.0 InternVL2-1B | error_detector | DC-DS Qwen3-VL-2B-Instruct | error_detector | DC-DS InternVL2-4B | error_detector | DC-DS Qwen3-VL-8B-Instruct | error_detector | DC-DS 1.0 InternVL2-1B | error_detector | DC-SS Qwen3-VL-2B-Instruct | error_detector | DC-SS InternVL2-4B | error_detector | DC-SS Qwen3-VL-8B-Instruct | error_detector | DC-SS
0.8 0.8
0.6 0.6 F1Detector F1Detector
0.4 0.4 Error Error
Architecture Architecture 0.2 0.2 MLPLog-SCirc-JCirc-S MLPLog-SCirc-JCirc-S 0.0 0.0 0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(c) 视觉编码器中的错误检测性能(F1分数)。 (c) 视觉编码器中的错误检测性能(F1分数)。 编码器。 编码器。
图15:该图展示了跨模型和种子聚合的性能,其中每幅图像的激活值计算为所有图像块上标记的平均值。顶部图显示真实探针F1,用于衡量特征与实际物体计数的对齐程度。中间图跟踪输出监督探针F1,评估与模型首次通过结果的对齐程度。底部图显示错误检测器F1,指示系统在预测错误以触发干预路径方面的可靠性。DC-DS:不同颜色不同形状;DC-SS:不同颜色单一形状。
18
第 19 页
1.0 InternVL2-1B | gt_probe | SC-DS Qwen3-VL-2B-Instruct | gt_probe | SC-DS InternVL2-4B | gt_probe | SC-DS Qwen3-VL-8B-Instruct | gt_probe | SC-DS 1.0 InternVL2-1B | gt_probe | SC-SS Qwen3-VL-2B-Instruct | gt_probe | SC-SS InternVL2-4B | gt_probe | SC-SS Qwen3-VL-8B-Instruct | gt_probe | SC-SS
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2 ArchitectureLinLogCircMLP ArchitectureLinLogCircMLP 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(a) 跨视觉编码器深度的逐层探针 F1 分数 (a) 跨视觉编码器深度的逐层探针 F1 分数 (真实目标) (真实目标)
InternVL2-1B | output_probe | SC-SS Qwen3-VL-2B-Instruct | output_probe | SC-SS InternVL2-4B | output_probe | SC-SS Qwen3-VL-8B-Instruct | output_probe | SC-SS 1.0 InternVL2-1B | output_probe | SC-DS Qwen3-VL-2B-Instruct | output_probe | SC-DS InternVL2-4B | output_probe | SC-DS Qwen3-VL-8B-Instruct | output_probe | SC-DS 1.0
0.8 0.8 ArchitectureLinLogCircMLP
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
Architecture 0.2 0.2 LinLogCircMLP 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(b) 跨视觉编码器深度的逐层探针 F1 分数 (b) 跨视觉编码器深度的逐层探针 F1 分数
(模型输出目标)。 (模型输出目标)。
1.0 InternVL2-1B | error_detector | SC-DS Qwen3-VL-2B-Instruct | error_detector | SC-DS InternVL2-4B | error_detector | SC-DS Qwen3-VL-8B-Instruct | error_detector | SC-DS 1.0 InternVL2-1B | error_detector | SC-SS Qwen3-VL-2B-Instruct | error_detector | SC-SS InternVL2-4B | error_detector | SC-SS Qwen3-VL-8B-Instruct | error_detector | SC-SS
0.8 0.8
0.6 0.6 F1Detector F1Detector
0.4 0.4 Error Error
Architecture Architecture 0.2 0.2 MLPLog-SCirc-JCirc-S MLPLog-SCirc-JCirc-S 0.0 0.0 0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(c) 视觉编码器中的错误检测性能(F1分数)。 (c) 视觉编码器中的错误检测性能(F1分数)。 编码器。 编码器。
图17:该图展示了跨模型和种子聚合的性能,其中每幅图像的激活值计算为所有图像块上标记的平均值。顶部图显示真实探针F1,用于衡量特征与实际物体计数的对齐程度。中间图跟踪输出监督探针F1,评估与模型首次通过结果的对齐程度。底部图显示错误检测器F1,指示系统在预测错误以触发干预路径方面的可靠性。SC-DS:单色不同形状 单色单形状
19
第 20 页
1.0 InternVL2-1B | gt_probe | DC-DS Qwen3-VL-2B-Instruct | gt_probe | DC-DS InternVL2-4B | gt_probe | DC-DS Qwen3-VL-8B-Instruct | gt_probe | DC-DS 1.0 InternVL2-1B | gt_probe | DC-SS Qwen3-VL-2B-Instruct | gt_probe | DC-SS InternVL2-4B | gt_probe | DC-SS Qwen3-VL-8B-Instruct | gt_probe | DC-SS
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
架构 0.2 0.2 LinLogCircMLP 架构LinLogCircMLP 0.0 0 5 10 0.0 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 25 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 25
(a) 跨视觉编码器深度的逐层探测 F1 分数 (a) 跨视觉编码器深度的逐层探测 F1 分数 (真实目标) (真实目标)
InternVL2-1B | output_probe | DC-SS Qwen3-VL-2B-Instruct | output_probe | DC-SS InternVL2-4B | output_probe | DC-SS Qwen3-VL-8B-Instruct | output_probe | DC-SS 1.0
0.8 InternVL2-1B | output_probe | DC-DS 架构LinLogCircMLP Qwen3-VL-2B-Instruct | output_probe | DC-DS InternVL2-4B | output_probe | DC-DS Qwen3-VL-8B-Instruct | output_probe | DC-DS 1.00.8 架构LinLogCircMLP
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
0.2 0.2
0.0 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 25 0.0 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 0 5 10 层 15 20 25
(b) 跨视觉编码器深度的逐层探测 F1 分数 (b) 跨视觉编码器深度的逐层探测 F1 分数
(模型输出目标)。 (模型输出目标)。
1.0 InternVL2-1B | error_detector | DC-DS Qwen3-VL-2B-Instruct | error_detector | DC-DS InternVL2-4B | error_detector | DC-DS Qwen3-VL-8B-Instruct | error_detector | DC-DS 1.0 InternVL2-1B | error_detector | DC-SS Qwen3-VL-2B-Instruct | error_detector | DC-SS InternVL2-4B | error_detector | DC-SS Qwen3-VL-8B-Instruct | error_detector | DC-SS
0.8 0.8
0.6 0.6 F1Detector F1Detector
0.4 0.4 Error Error
Architecture Architecture 0.2 0.2 MLPLog-SCirc-JCirc-S MLPLog-SCirc-JCirc-S 0.0 0.0 0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(c) 视觉编码器中的错误检测性能(F1分数)。 (c) 视觉编码器中的错误检测性能(F1分数)。 编码器。 编码器。
图19:该图展示了跨模型和种子聚合的性能,其中每幅图像的激活值从视觉编码器的最后一个令牌中提取。顶部图显示真实标签探针的F1分数,用于衡量特征与实际物体计数的对齐程度。中间图跟踪输出监督探针的F1分数,评估与模型首次通过结果的对齐程度。底部图显示错误检测器的F1分数,表明系统在预测错误以触发干预路径方面的可靠性。DC-DS:不同颜色不同形状;DC-SS:不同颜色单一形状
20
第 21 页
1.0 InternVL2-1B | gt_probe | SC-DS Qwen3-VL-2B-Instruct | gt_probe | SC-DS InternVL2-4B | gt_probe | SC-DS Qwen3-VL-8B-Instruct | gt_probe | SC-DS 1.0 InternVL2-1B | gt_probe | SC-SS Qwen3-VL-2B-Instruct | gt_probe | SC-SS InternVL2-4B | gt_probe | SC-SS Qwen3-VL-8B-Instruct | gt_probe | SC-SS
0.8 0.8
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
Architecture Architecture 0.2 0.2 LinLogCircMLP LinLogCircMLP 0.0 0 5 10 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(a) 跨视觉编码器深度的逐层探针 F1 分数 (a) 跨视觉编码器深度的逐层探针 F1 分数 (真实目标) (真实目标)
InternVL2-1B | output_probe | SC-SS Qwen3-VL-2B-Instruct | output_probe | SC-SS InternVL2-4B | output_probe | SC-SS Qwen3-VL-8B-Instruct | output_probe | SC-SS 1.0 InternVL2-1B | output_probe | SC-DS Qwen3-VL-2B-Instruct | output_probe | SC-DS InternVL2-4B | output_probe | SC-DS Qwen3-VL-8B-Instruct | output_probe | SC-DS 1.0
0.8 0.8 ArchitectureLinLogCircMLP
F1 0.6 F1 0.6 Probe 0.4 Probe 0.4
Architecture 0.2 0.2 LinLogCircMLP 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 0.0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(b) 跨视觉编码器深度的逐层探针 F1 分数 (b) 跨视觉编码器深度的逐层探针 F1 分数
(模型输出目标)。 (模型输出目标)。
1.0 InternVL2-1B | error_detector | SC-DS Qwen3-VL-2B-Instruct | error_detector | SC-DS InternVL2-4B | error_detector | SC-DS Qwen3-VL-8B-Instruct | error_detector | SC-DS 1.0 InternVL2-1B | error_detector | SC-SS Qwen3-VL-2B-Instruct | error_detector | SC-SS InternVL2-4B | error_detector | SC-SS Qwen3-VL-8B-Instruct | error_detector | SC-SS
0.8 0.8
0.6 0.6 F1Detector F1Detector
0.4 0.4 Error Error
Architecture Architecture 0.2 0.2 MLPLog-SCirc-JCirc-S MLPLog-SCirc-JCirc-S 0.0 0.0 0 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 0 5 10 Layer 15 20 25
(c) 视觉编码器中的错误检测性能(F1分数)。 (c) 视觉编码器中的错误检测性能(F1分数)。 编码器。 编码器。
图 21:该图展示了跨模型和种子聚合的性能,其中每幅图像的激活值从视觉编码器的最后一个令牌中提取。上图显示真实探针 F1,用于衡量特征与实际物体计数的对齐程度。中图跟踪输出监督探针 F1,评估与模型首次通过结果的对齐程度。下图显示错误检测器 F1,指示系统在预测错误以触发干预路径方面的可靠性。SC-DS:单色不同形状 单色单形状
21