HIVE:幻觉如何重塑VLM推理

三分钟导读:实验显示,幻觉并非总是有害。在PlantVillage数据集上,GPT-4o使用幻觉描述时准确率提升14.68%。在ISIC皮肤镜数据集上,准确率提升11.76%。这表明幻觉语义可引导模型找到正确推理路径。

英文题目:HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

论文出处:arXiv 每日论文精选 · arXiv:2607.07507

原始论文:PDF / 论文页面

对应视频标题:HIVE:幻觉如何重塑VLM推理|推荐指数:★★★★★

这篇论文解决什么问题?

视觉语言模型常因部分可观测性产生幻觉。以往研究聚焦检测或抑制幻觉,却忽视了幻觉出现后的推理阶段。我们提出幻觉后推理概念,探讨幻觉语义如何影响下游预测。

核心创新

方法概览

实验显示,幻觉并非总是有害。在PlantVillage数据集上,GPT-4o使用幻觉描述时准确率提升14.68%。在ISIC皮肤镜数据集上,准确率提升11.76%。这表明幻觉语义可引导模型找到正确推理路径。

逐图理解论文

核心发现:幻觉的收益

核心发现:幻觉的收益
Table 2: Faithful (F) vs. Hallucinated (H) accuracy on vision-language tasks. Cells show mean accuracy (%). ∆denotes H −F in percentage points and is shown inline at bottom-right.

实验显示,幻觉并非总是有害。在PlantVillage数据集上,GPT-4o使用幻觉描述时准确率提升14.68%。在ISIC皮肤镜数据集上,准确率提升11.76%。这表明幻觉语义可引导模型找到正确推理路径。

机制分析:语义覆盖与熵

机制分析:语义覆盖与熵
Fig. 2: Process- and output-level analysis of hallucination effects. Left: rea- soning chain embeddings show that hallucinated prompts reshape inference trajectories with task-dependent differences (p < 0.05), diversifying reasoning. Right: caption en- tropy analysis shows that correct predictions exhibit higher entropy than incorrect ones, indicating expanded semantic coverage. Stars indicate p < 0.05.

机制分析表明,幻觉描述拓宽了语义覆盖范围。推理链嵌入显示,幻觉提示重塑了推理轨迹,增加了多样性。同时,正确预测的推理熵更高,说明幻觉帮助模型探索了更广泛的语义空间,避免了过早收敛。

案例研究:ISIC诊断

案例研究:ISIC诊断
Fig. 6: Case study on ISIC. A hallucinated (H) caption introduces a spurious vascu- lar cue that anchors the reasoning toward a seborrheic keratosis (SK) frame, ultimately yielding the correct benign diagnosis. In contrast, the faithful (F) caption confines rea- soning to superficial features, leading to a malignant misclassification, highlighting hallucination’s potential as constructive guidance.

以ISIC案例为例,幻觉描述引入了虚假的血管线索,将推理锚定在脂溢性角化病框架,最终得出正确的良性诊断。而忠实描述局限于表面特征,导致恶性误判。这展示了幻觉作为建设性引导的潜力。

相关工作与对比

相关工作与对比
Fig. 1: Post–hallucination reasoning in VLMs. (a) Prior work mainly focuses on detecting or suppressing hallucinations, whereas we study reasoning that occurs after hallucinations appear. (b) A medical example illustrates how hallucinated cues (e.g., lesion size) can alter the model’s observation and reasoning process. (c) Across models and vision tasks, hallucinations can systematically change task performance, revealing structured post–hallucination dynamics, especially in vision–language tasks.

与FactCC等检测基准不同,HIVE关注推理效应。类似LLM中错误中间步骤导向正确答案的现象,VLM中幻觉语义也能辅助推理。这与More Thinking, Less Seeing等研究形成互补,揭示了多模态推理的复杂性。

实验与关键结果

阅读时需要注意

  • 需注意,此结论不主张故意引入幻觉。收益依赖于严格控制,过度幻觉会损害可靠性。文本任务收益有限,且不同模型表现非单调。例如Qwen2.5-VL 72B在某些任务上出现下降,需结合具体场景评估。
  • Findings do not advocate for deliberate hallucination as a strategy.
  • Benefits depend critically on control; excessive hallucination degrades reliability.
  • Text-only tasks showed limited or unstable benefits compared to vision-language tasks.
  • Results are specific to the evaluated models and decoding settings.

关联工作

  • 视觉语言模型常因部分可观测性产生幻觉。以往研究聚焦检测或抑制幻觉,却忽视了幻觉出现后的推理阶段。我们提出幻觉后推理概念,探讨幻觉语义如何影响下游预测。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

HIVE:理解视觉语言模型中的幻觉后推理

何峰1*,王振廷2,王其凡3,关强4,刘东方1†, 唐瑞祥2,李乾坤5†

1 普渡大学 2 罗格斯大学 3 Meta AI 4 肯特州立大学 5 伦敦帝国理工学院

摘要。视觉–语言模型(VLMs)中的幻觉通常被视为语义错误,但它们往往源于部分或模糊的视觉证据。先前的工作主要集中于在生成时检测或抑制幻觉,而忽略了随后的推理阶段。在本工作中,我们研究幻觉后推理(PHR),即幻觉语义进入模型推理上下文并影响下游预测的阶段。为了系统地研究 PHR,我们引入了 HIVE(幻觉推理与验证引擎),这是一种评估基础设施,能够实现忠实路径与幻觉路径之间的受控比较。在九个任务和九个模型上,我们观察到结构化的模态依赖模式:幻觉路径通常能提高视觉–语言任务的准确率,而纯文本任务则表现出有限或不稳定的影响。进一步的分析表明,幻觉线索扩大了语义覆盖范围并重塑了推理动态,同时保持了稳定的推理。这些发现强调,一旦幻觉语义进入模型的推理上下文,它们可能会影响下游推理。理解这一幻觉后阶段对于提高多模态推理系统的可靠性和可解释性至关重要。代码公开在 https://github.com/hefengcs/HIVE。

关键词:VLMs · 幻觉分析 · 多模态推理

1 引言

视觉–语言模型(VLMs)通常在部分可观测性下运行 [13,27,28,37,48,67]。遮挡、低分辨率和运动模糊经常导致它们产生推测性的语义补全 [20,56,66]。根据社区标准,这种无法验证的内容被视为幻觉。然而,幻觉源于不完整的视觉证据,而非孤立的系统故障 [8,10,11,18,70]。因此,大多数现有研究集中在

† 通讯作者。

  • 工作完成于访问普渡大学期间。

第 2 页

2 F. He 等

皮肤镜图像(医学领域) 图像描述 幻觉 描述 图像 c 幻觉出现

幻觉发生后会发生什么? 问:该病变是否为恶性? 答:是 ✔️ 幻觉后推理 观察 检测/缓解 推理 幻觉:病变 >7 mm 忠实:色素性病变 抑制 利用幻觉线索进行 推理 幻觉 推理 先前工作 我们的工作 → 答:否 ✖️

幻觉:提示 ABCDE 规则。 忠实:无诊断线索。 (a) 幻觉后推理 (b) VLM 案例研究(医学) (c) 性能

图 1:VLM 中的幻觉后推理。(a) 先前工作主要关注检测或抑制幻觉,而我们研究的是幻觉出现后发生的推理过程。(b) 一个医学示例说明了幻觉线索(例如病变大小)如何改变模型的观察和推理过程。(c) 在不同模型和视觉任务中,幻觉会系统地改变任务性能,揭示了结构化的幻觉后动态,特别是在视觉-语言任务中。

关于在幻觉出现时检测 [15,27,32,34,39,51,69] 或缓解幻觉 [45,46,57,64,72]。人们很少关注幻觉语义进入 VLM 推理过程后会发生什么,这使得这一幻觉后阶段在很大程度上未被探索。

同时,对 LLM 的研究表明,思维链推理 [5,26,35,44, 45, 61, 62] 并不严格遵循人类的因果逻辑:错误的中间步骤仍可能导致正确的结论。这一观察结果表明,即使中间表示不完美或部分错误,推理仍可能在潜在空间中继续演化。类比而言,VLM 中的幻觉也可能与下游推理过程相互作用。然而,这些推测性线索是有助于、阻碍还是仅仅干扰推理,目前尚不清楚。

我们将这种现象称为幻觉后推理(Post-Hallucination Reasoning, PHR),它描述了在幻觉语义成为模型推理上下文的一部分并影响后续预测后所出现的推理行为。尽管多模态系统中幻觉普遍存在,但 PHR 的结构和影响仍知之甚少。如图 1 所示,一旦幻觉语义进入模型的推理上下文,它们可能会重塑观察和推理过程,最终影响下游预测。在各种基准测试中,我们观察到一个一致的模式:幻觉语义线索有时可以提高视觉-语言任务中的下游推理。这表明幻觉偶尔可能提供推测性的语义锚点来引导推理,而不仅仅是降低预测质量。然而,这种效应既非普遍存在,也未被充分理解。这些观察结果引出了两个基本问题:(1) 在什么情况下 PHR 能改善下游推理?(2) 为什么 PHR 会导致推理改善?

第 3 页

HIVE 3

为了系统地研究这些问题,我们引入了 HIVE(幻觉推理与验证引擎,Hallucination Inference and Verification Engine),这是一个用于研究幻觉后推理(PHR)的评估基础设施。HIVE 构建成对的忠实路径(Faithful)和幻觉路径(Hallucinated)描述,验证其有效性,并能够控制测量它们对下游预测的影响。通过比较在匹配条件下原始输入、忠实描述和幻觉描述,HIVE 使我们能够隔离由幻觉语义引发的推理效应,并分析 PHR 的结构。在 9 个任务和 9 个模型上,我们观察到了结构化的模式:幻觉语义线索通常会提升视觉-语言基准测试的性能,且增益在不同模型族和解码设置中呈现系统性变化。 为了理解 PHR 背后的机制,我们在多个层面上分析了由幻觉引发的推理动态。(I)幻觉描述扩大了语义覆盖范围(Semantic Coverage),并拓宽了嵌入分布。(II)它们调节推理熵(Reasoning Entropy),其中正确预测与较高的熵相关。 这些发现揭示 PHR 是多模态推理中被忽视的一个阶段,在此阶段,幻觉语义可以重塑甚至有时增强下游推理,而不仅仅是引入噪声。我们的贡献如下: ❶ 幻觉后推理现象。我们识别并刻画了 PHR,这是 VLM 中一个此前被忽视的阶段,在此阶段,幻觉语义会影响不同任务设置下的下游推理。我们观察到了结构化的模式,表明幻觉语义线索可以系统地重塑模型预测,而不仅仅是引入噪声。 ❷ PHR 的评估基础设施。我们提出了 HIVE,这是一个旨在通过受控语义比较来研究 PHR 的评估基础设施。HIVE 在匹配的配置下组织描述生成、幻觉判别和下游评估,实现了忠实描述与幻觉描述之间的成对比较,使我们能够隔离并量化跨多个模型和任务领域的下游影响。 ❸ PHR 的机制分析。我们在输入、推理过程和输出层面上分析了 PHR。我们的结果表明,幻觉描述扩大了语义覆盖范围,引发了独特的分布偏移,并调节了与成功预测相关的推理动态。这些发现揭示了幻觉语义如何重塑多模态推理中的推理轨迹。

2 相关工作 VLM 中的幻觉:检测与缓解。幻觉指的是与给定输入不一致的内容。幻觉在 LLM 和 VLM 的输出中广泛存在,出现在摘要 [71] 和开放域问答 [49] 等任务中。它们的存在损害了高利害领域(如医疗 [24,43] 和法律决策支持 [2,9])的可靠性。两大主要研究方向是:检测和缓解。对于检测,研究提出了事实性指标和基准测试,如 FactCC [21]、QAGS [55]、TruthfulQA [29] 和 Q2 [14],以及基于一致性或内部状态的评判方法 [7, 39, 51]。对于缓解,方法包括(I)指令级微调 [31, 65, 68],(II)约束解码 [4,23,42,51],以及(III)训练或检索增强

第 4 页

4 F. He 等

[25,40,50]。这些工作大多将幻觉视为 undesirable errors(不良错误),并专注于检测或抑制它们,从而在很大程度上未探索幻觉语义在后续推理中的作用。 大语言模型中的中间推理与潜在动态。最近针对纯语言模型的研究表明,模型的推理过程并不一定与其显式的思维链(chain-of-thought)文本相一致。多项研究表明,大语言模型可能会生成不正确、不一致或部分虚构的中间步骤,同时仍产生正确的最终答案 [47,60]。这一现象表明,推理在潜在空间中继续演化,并不严格由中间文本的忠实度决定。进一步的分析表明,即使中间步骤包含幻觉元素,大语言模型也能维持稳定的内部推理 [19,22,58]。这些发现意味着,不忠实或推测性的内容并不会终止推理;相反,模型会进入后续推理阶段,该阶段仍可能产生连贯的结论。 多模态推理模型中的幻觉。最近的工作开始研究多模态推理中的幻觉效应,表明不完美的感知线索会影响视觉语言模型(VLMs)的推理结果。诸如 More Thinking, Less Seeing [63]、More Thought, Less Accuracy [53]、MIRAGE [6] 以及多模态思维链分析 [36] 等研究表明,幻觉与推理动态的交互超越了感知层面的错误。最近的综述进一步总结了该领域的评估和检测工作 [3]。然而,这些方法主要分析中间推理轨迹或基准层面的行为,而没有明确研究一旦幻觉语义被用作输入上下文,将如何影响下游推理。 与现有方法不同,我们关注视觉语言模型推理中一个被严重忽视的阶段:幻觉后推理(Post-Hallucination Reasoning, PHR),即一旦模型生成并采纳了幻觉语义,它可能会影响后续的推理和任务预测。先前关于视觉语言模型幻觉的工作几乎完全集中在幻觉是否发生、为何发生以及如何减少它们上。然而,人们很少关注幻觉语义如何影响随后的推理过程。因此,PHR 的结构和影响仍知之甚少,该领域缺乏用于研究它的受控语义干预框架。

3 PHR 评估流程 3.1 问题设定 HIVE 被设计为一个用于研究视觉语言模型中 PHR 的评估基础设施。它考察一旦模型生成并采纳了幻觉语义,与忠实语义相比,这些幻觉语义如何影响后续的推理和任务预测。HIVE 并未引入新的模型或训练方法,而是遵循既定的社区实践,包括基于提示的图像描述生成和幻觉检测,并将它们组织成一个受控的语义干预框架,以分析幻觉语义的因果效应。为了考察这一问题,我们将 HIVE 围绕三个原则进行组织。 ① 公平比较。我们必须确保忠实描述和幻觉描述之间的唯一区别在于幻觉本身的存在。因此,

第 5 页

HIVE 5

标题是从统一来源生成的,使用相同的提示、温度和令牌预算。这种设计排除了混淆因素,使我们能够专注于跨任务和模型的后端性能差异,该差异通过幻觉增强与忠实增强之间的准确率差距 $\Delta(H – F)$ 来衡量。

② 任务无关的幻觉生成。当要求大型语言模型(LLM)对任何输入(无论模态如何)生成自由形式的标题时,幻觉自然会产生。一些标题保持忠实,而另一些则引入了不可验证或推测性的元素。这种固有属性使我们能够无缝地将范式适应于各种文本和多模态任务。

③ 可靠的判别。幻觉检测本质上是不完美的,即使是人工标注者也可能存在分歧。为了增强鲁棒性,我们采用由多个检测器组成的集成方案,每个检测器独立判断每个标题,并应用多数投票以获得最终标签。这种集成策略确保框架在噪声分类器下保持可靠。形式上,令 $x \in \mathcal{X}$ 表示带有标签 $y \in \mathcal{Y}$ 的输入,$f : \mathcal{X} \times \mathcal{C} \rightarrow \mathcal{Y}$ 为特定于任务模型。每个输入可以与忠实标题 $C_F$ 或幻觉标题 $C_H$ 配对。这种三元组设计确保幻觉是条件间唯一的变量,从而实现受控且可解释的评估。形式上,我们定义这些条件:

$$ y_F = f(x \parallel C_F)_{\text{Faithful}}, \quad y_H = f(x \parallel C_H)_{\text{Hallucinatory}}, \quad (1) $$

其中 $\parallel$ 表示与任务指令的连接。给定评估指标 $\mathcal{L}(\hat{y}, y)$(在我们的实验中实例化为准确率),我们将幻觉效应量化为

$$ \Delta(H – F) = \mathbb{E}_{(x,y) \sim \mathcal{D}} \left[ \mathcal{L}(f(x \parallel C_H), y) – \mathcal{L}(f(x \parallel C_F), y) \right] \quad (2) $$

这种成对比较将幻觉隔离为受控的实验变量,并 enables 跨模型和任务的 PHR 进行“苹果对苹果”的分析。

3.2 HIVE 评估流程

HIVE 评估流程由三个模块组成:(I) 标题生成器,(II) 标题判别器,以及 (III) 任务求解器。给定一个输入实例,该流程通过这些组件进行处理,以确保跨任务的一致性和受控评估。标题生成器首先接收原始输入(文本、图像或结构化记录),并在统一的、任务无关的提示下生成一组候选标题,其中可能包含忠实和幻觉语义。标题判别器随后评估这些候选项,并将每个候选项分类为忠实 ($C_F$) 或幻觉 ($C_H$);仅保留检测器之间达成多数一致的对 $\langle C_F, C_H \rangle$。最后,任务求解器整合原始输入 $x$、配对标题中的一个以及特定于任务的指令,以生成最终预测 $y$。这种设计产生了三个受控条件:原始 ($y_{\text{raw}} = f(x)$)、+忠实 ($y_F = f(x \parallel C_F)$) 和 +幻觉 ($y_H = f(x \parallel C_H)$)。

第 6 页

6 F. He 等人

标题生成器(Caption Generator)。标题生成器旨在生成多样化的语义候选项,其中可能同时包含忠实和幻觉变体。所有标题均使用相同的提示词、温度参数和令牌预算,从统一来源生成,从而确保解码超参数不会混淆归因。给定输入 $x$,生成器输出 $N$ 个描述该输入的自然语言标题。由于大语言模型(LLM)固有的随机性,部分标题保持忠实,而其他标题则引入推测性内容,这随后使得判别器能够构建对比的忠实(F)/幻觉(H)对。该设计保证了 F 和 H 标题均源自相同的生成过程,为后续评估提供了受控的入口点。 标题判别器(Caption Discriminator)。针对候选标题,标题判别器确定每个标题是忠实的($C_F$)还是幻觉的($C_H$)。由于幻觉检测本质上存在噪声,我们采用多个检测器的集成,每个检测器提供独立的判断。最终标签通过多数投票决定,这显著提高了在噪声或不完美分类器下的鲁棒性。我们进一步通过专门的对照实验验证了幻觉判别器的可靠性(第 4.2 节)。各个检测器的详细实现细节及集成配置见附录 S7,以确保充分的清晰度和可复现性。 任务求解器(Task Solver)。求解器并非新颖模型,而是一个受控接口,用于在相同的模型和解码设置下隔离标题对下游预测的影响。我们通过对比三种条件 $C \in \{\text{raw}, C_F, C_H\}$ 下的预测结果,来衡量标题忠实性的孤立影响。我们使用统一的提示词构建器,将三个部分连接起来:

$\Phi(\mathcal{I}_{\text{task}}, x, C) = \text{sc}(x)\text{Seed}\,s(C)$ (3)

HIVE 将幻觉视为一种受控的语义干预,从而能够系统地研究推测性线索如何影响多模态模型中的下游推理。提示词模板列于附录 S2 中。

4 实验

4.1 PHR 何时有效?

我们首先表征幻觉语义如何影响跨多种模型和任务的下游预测。利用 HIVE 评估基础设施,我们系统地分析了涵盖文本和多模态场景的 9 项任务和 9 个模型中的 PHR。每个模型在两种输入条件下进行评估:忠实和幻觉。表 1 报告了纯文本基准的结果,而表 2 总结了视觉-语言任务。更多的数据集和模型细节见附录 S6。 ❶ 纯文本任务上的 LLM:收益有限或不稳定。在文本任务中,幻觉提供的收益很少或没有收益。在多个 LLM 家族中,幻觉输入下的性能通常与忠实设置相似或更低,仅有偶尔的孤立改进(见表 1)。整体趋势微小且不一致,表明幻觉语义难以在基于规则或符号约束的任务中被利用。

第 7 页

HIVE 7

表 1:纯文本任务中忠实 (F) 与幻觉 (H) 路径的准确率。 单元格显示准确率 (%)。$\Delta(H – F)$ 表示幻觉路径与忠实路径之间的百分点差异($\uparrow$ 增益,$\downarrow$ 下降)。

\begin{tabular}{llccccccc} \hline \multicolumn{2}{c}{} & \multicolumn{2}{c}{Claude-3} & \multicolumn{2}{c}{DeepSeek} & \multicolumn{1}{c}{Mistral} & \multicolumn{2}{c}{DeepSeek} \\ \cline{3-4} \cline{5-6} \cline{8-9} Dataset & & P. GPT-4o & GPT-3.5 & Sonnet & v3 & Large & O3 & R1 \\ \hline AntiCP2 & F & 54.59(–) & 43.63(–) & 46.84(–) & 52.19(–) & 56.69(–) & 53.95(–) & 49.87(–) \\ & H & 58.35\delimiter"3222378+3.76 & 47.76\delimiter"3222378+4.13 & 48.21\delimiter"3222378+1.37 & 45.01\delimiter"3223379-7.18 & 57.84\delimiter"3222378+1.15 & 50.17\delimiter"3223379-3.78 & 46.42\delimiter"3223379-3.45 \\ \hline BBBP & F & 61.67(–) & 60.75(–) & 64.07(–) & 61.60(–) & 59.41(–) & 73.27(–) & 70.53(–) \\ & H & 68.33\delimiter"3222378+6.66 & 57.53\delimiter"3223379-3.22 & 64.95\delimiter"3222378+0.88 & 55.56\delimiter"3223379-6.04 & 59.65\delimiter"3222378+0.24 & 59.47\delimiter"3223379-13.80 & 58.88\delimiter"3223379-11.65 \\ \hline CodeXGLUE & F & 55.15(–) & 58.90(–) & 49.25(–) & 49.46(–) & 50.11(–) & 45.10(–) & 51.54(–) \\ & H & 52.75\delimiter"3223379-2.40 & 57.40\delimiter"3223379-1.50 & 53.40\delimiter"3222378+4.15 & 50.13\delimiter"3222378+0.67 & 56.40\delimiter"3222378+6.29 & 46.06\delimiter"3222378+0.96 & 48.95\delimiter"3223379-2.59 \\ \hline SARA v3 & F & 62.93(–) & 52.28(–) & 62.07(–) & 58.10(–) & 59.14(–) & 65.52(–) & 58.62(–) \\ & H & 62.24\delimiter"3223379-0.69 & 54.83\delimiter"3222378+2.55 & 63.97\delimiter"3222378+1.90 & 58.96\delimiter"3222378+0.86 & 60.34\delimiter"3222378+1.20 & 62.07\delimiter"3223379-3.45 & 54.48\delimiter"3223379-4.14 \\ \hline ProofWriter & F & 69.49(–) & 66.55(–) & 76.03(–) & 85.17(–) & 70.86(–) & 97.76(–) & 89.31(–) \\ & H & 75.00\delimiter"3222378+5.51 & 66.21\delimiter"3223379-0.34 & 76.73\delimiter"3222378+0.70 & 85.86\delimiter"3222378+0.69 & 68.62\delimiter"3223379-2.24 & 98.45\delimiter"3222378+0.69 & 92.93\delimiter"3222378+3.62 \\ \hline \end{tabular}

❷ 视觉-语言任务上的 VLMs:显著且一致的增益。 在视觉-语言基准测试中,幻觉输入在所有模型中均带来了清晰且实质性的性能提升(见表 2)。GPT-4o、Gemini-2.0-Flash 和 Qwen-VL-Max 通常表现出增益,尽管在某些设置下(如 GQA 数据集)会出现个别下降。与纯文本设置中幻觉效应微小且不稳定的情况不同,VLM 在多个任务和模型族中可靠地从幻觉语义中受益。

这些结果表明,幻觉字幕可以通过引入支持下游推理的额外感知线索来丰富视觉 grounding。视觉-语言任务通常涉及部分可观测性,其中重要的线索可能缺失或模糊。在这种设置下,幻觉字幕可以作为推测性假设,扩展模型的假设空间,并为推理提供额外的语义锚点。

模型间的差异。虽然这一总体模式在 VLMs 中普遍存在,但 PHR 增益的幅度因模型而异。例如,GPT-4o 表现出适度但稳定的改进,而 Gemini-2.0-Flash 和 Qwen-VL-Max 在感知密集型任务上通常表现出更大的增益。这种差异可能反映了不同模型在视觉 grounding 强度和推理策略上的差异:具有更强感知 grounding 的模型能更好地利用幻觉字幕引入的推测性语义线索,而其他模型则受益较少。

4.2 验证幻觉判别器

在幻觉基准上的可靠性。为了评估 HIVE 幻觉判别器的可靠性,我们在两种互补的设置下对其进行评估。首先,我们在 TruthfulQA 基准上测试判别器,该基准广泛用于探测语言模型中的幻觉行为。判别器在该基准上达到了 81.76% 的准确率。为了近似现实世界中的跨域使用,我们通过从九个任务中各采样 20 条字幕,构建了一个包含 180 条字幕的精选数据集。这些字幕经过人工

第 8 页

8 F. He 等人

表 2:视觉语言任务中忠实 (F) 与幻觉 (H) 的准确率。 单元格显示平均准确率 (%)。∆ 表示以百分点为单位的 H − F 差值,并以内联形式显示在右下角。

Claude 3 Gemini 2.0 Qwen 数据集 P. GPT-4o Sonnet Flash VL-Max

GQA F 71.36(–) 62.02(–) 75.23(–) 69.88(–) H 74.22\delimiter"3222378+2.86 61.03\delimiter"3223379-0.99 75.69\delimiter"3222378+0.46 67.90\delimiter"3223379-1.98

Dex-Net F 53.25(–) 50.29(–) 49.88(–) 51.54(–) H 55.76\delimiter"3222378+2.51 50.71\delimiter"3222378+0.42 51.15\delimiter"3222378+1.27 54.12\delimiter"3222378+2.58

ISIC F 63.88(–) 54.19(–) 67.23(–) 58.71(–) H 75.64\delimiter"3222378+11.76 61.02\delimiter"3222378+6.83 67.90\delimiter"3222378+0.67 75.62\delimiter"3222378+16.91

PlantVillage F 62.73(–) 55.28(–) 62.71(–) 67.84(–) H 77.41\delimiter"3222378+14.68 72.50\delimiter"3222378+17.22 70.98\delimiter"3222378+8.27 77.66\delimiter"3222378+9.82

图 2:幻觉效应的过程级与输出级分析。左侧:推理链嵌入显示,幻觉提示重塑了推理轨迹,并表现出任务依赖性的差异 (p < 0.05),从而增加了推理的多样性。右侧:标题熵分析显示,正确预测的熵高于错误预测,表明语义覆盖范围扩大。星号表示 p < 0.05。

被标注为幻觉或忠实。在该人工标注数据集上评估判别器,准确率达到 83.72%。这些结果表明,判别器不仅适用于单一基准测试,还能可靠地将幻觉标题与忠实标题区分开来,为我们在整个实验中使用的成对比较提供了稳定的基础。 随机检查器控制。为了排除由任意过滤带来的性能提升,我们将幻觉判别器替换为随机检查器,后者在不进行事实评估的情况下接受标题。所有解码控制保持不变,以确保公平比较。如表 3 所示,随机过滤仅导致微小的性能变化 (0.17–1.23%),且在各数据集上均未产生统计显著的增益 (所有 p > 0.14)。这一结果表明,第 4.1 节中报告的性能提升不太可能源于随机过滤效应。 提示鲁棒性。为了排除观察到的性能提升源于提示敏感性的可能性,我们使用语义等价的提示改写重复了实验。具体而言,我们评估了三个提示:原始提示 (P0) 和两个改写变体 (P1 和 P2)。结果总结在表 4 中。在各数据集和模型上,幻觉增强

第 9 页

HIVE 9

表 3:随机检查器消融实验。$\Delta$ 表示绝对准确率差异(H–F)。$p$ 值来自双侧配对 t 检验;(n.s.) = 在 $p<0.05$ 水平上不显著。

| Dataset | Faithful (F) | H + Random (H) | $\Delta$(H–F) | $p$ | | :— | :— | :— | :— | :— | | AntiCP2 | 0.5015 ± 0.0124 | 0.5114 ± 0.0200 | +0.0100 | 0.526 (n.s.) | | PlantVillage | 0.7358 ± 0.0189 | 0.7481 ± 0.0205 | +0.0123 | 0.354 (n.s.) | | Dex-Net | 0.4950 ± 0.0068 | 0.4967 ± 0.0062 | +0.0017 | 0.757 (n.s.) | | ISIC | 0.5763 ± 0.0067 | 0.5805 ± 0.0042 | +0.0043 | 0.142 (n.s.) |

在所有提示变体下,幻觉输入 consistently outperform 忠实输入。尽管由于 LLM 对提示的已知敏感性,绝对准确率略有波动,但效应的方向保持稳定。这表明观察到的改进并非绑定于特定的提示表述。

表 4:跨改写提示的提示鲁棒性。P0 表示原始提示,而 P1 和 P2 是语义等价的改写版本。$\Delta$ 报告了幻觉注入带来的准确率提升(H–F)。

| Dataset / Model | P0 $\Delta$(%) | P1 $\Delta$(%) | P2 $\Delta$(%) | Consistency | | :— | :— | :— | :— | :— | | PlantVillage / GPT-4o | +14.68 | +28.00 | +9.89 | ✓ | | PlantVillage / Claude 3 Sonnet | +17.22 | +16.42 | +12.84 | ✓ | | ISIC / GPT-4o | +11.76 | +4.55 | +5.00 | ✓ | | ISIC / Claude 3 Sonnet | +6.83 | +4.54 | +4.77 | ✓ |

Token-level ablation. 我们进行了 token 级别的消融实验,以测试幻觉内容对于成功预测是否必要。具体而言,我们首先识别出仅在提供幻觉描述时才能解决的样本子集,其中幻觉路径成功而忠实路径失败。在这些描述中,我们定位作为模型推理过程中核心证据的幻觉 token。然后,我们使用中性占位符遮蔽这些 token,并在相同样本上重新评估模型。如表 5 所示,我们评估了幻觉路径成功而忠实路径失败的样本子集。对于该子集,H-before 由于构造原因接近完美,而在遮蔽幻觉证据 token 后,所有四个数据集上的后消融准确率(H-after)均大幅下降。这一结果表明,关键的幻觉 token 充当了信息性线索而非冗余噪声,且模型依赖它们来得出正确的预测。

4.3 推理收敛性分析

为了评估幻觉描述引入的语义偏移是否影响模型推理的稳定性,我们在两个互补的层面上分析推理收敛性:(I) 链内收敛(Intra-chain convergence),衡量在幻觉输入下,中间推理步骤是否逐渐与最终结论对齐(图 3 左侧);以及 (II) 链间一致性(Inter-chain consistency),评估从同一输入采样的多条推理路径是否在不同的采样种子下收敛到语义相似的轨迹(图 3

第 10 页

10 F. He 等

表 5:去除幻觉后的跨领域准确率。H-after Acc. 表示掩码掉幻觉证据 token 后的消融后准确率。

数据集 领域 任务 H-after Acc. AntiCP2 生物医学 多肽分类 0.244 ± 0.085 PlantVillage 农业 疾病识别 0.700 ± 0.111 Dex-Net 机器人 抓取预测 0.364 ± 0.061 ISIC 皮肤病学 病变诊断 0.380 ± 0.062

图 3:PlantVillage 数据集上的链间稳定性。左图:逐步余弦相似度显示推理链在推理过程中逐渐收敛。右图:幻觉 (H) 和忠实 (F) 描述展现出高度重叠的相似度分布,表明幻觉在采样运行间保持了稳定性。

右图)。这些分析提供了幻觉如何在推理链内部及跨推理链影响收敛性的细粒度视角,使我们能够确定它们是使模型的推理过程失稳还是保持稳定。进一步的实现细节见附录 S9。

❸幻觉不会破坏链内收敛性。从图 3(左图)可以看出,逐步到最终的语义相似度稳步增加,中间步骤逐渐与最终结论对齐。这一轨迹表明,推理链随着推理的展开自然收敛,而不是偏离目标答案。此外,缩小的方差带表明这种收敛模式在多次运行和数据集中保持稳定。

❹推理链表现出极强的链间一致性。从图 3(右图)中,我们观察到在幻觉 (H) 和忠实 (F) 描述下生成的推理路径在多次采样运行中均表现出极高的成对相似度(均值 ≈0.97)。这两个分布几乎重叠,且统计检验确认两者之间无显著差异 (p > 0.6)。这表明,无论描述中是否包含幻觉,模型在跨推理链中都会收敛到一致的推理轨迹。多条采样路径并未发散至不稳定的替代方案,而是保持语义对齐,这突显了模型推理的鲁棒性。

第 11 页

HIVE 11

幻觉路径(H) 忠实路径(F) 幻觉路径(H) 忠实路径(F)

图 4:字幕嵌入的分布(忠实路径 (F) 与 幻觉路径 (H))。幻觉输入表现出更宽的语义分布和更长的尾部。

要点 ❶。带有幻觉字幕的推理链保持稳定:中间步骤始终收敛于最终答案,且采样的多条路径保持高度一致。这种稳定性表明,幻觉可以支持可靠且可复现的推理。

4.4 为什么 PHR 有效 为了解释在视觉-语言任务上观察到的显著且一致的改进(见第 4.1 节),我们分析了为何幻觉字幕能为 VLM 提供有用的语义信号。我们的分析侧重于有益的情况,并从三个互补的层面考察幻觉的影响:(I) 输入层面的偏移。幻觉字幕大幅重塑了提供给模型的语义输入,表现出更宽的分布范围和与忠实字幕更低的相似度(图 4)。这表明幻觉引入了有意义的语义变化,而非冗余噪声,从而丰富了模型的视觉 grounding。(II) 过程层面的调制。推理链熵分析(图 2 左侧)显示,幻觉以任务依赖的方式调制推理动态。它们在推理密集型任务上降低轨迹熵(促进收敛和稳定性),而在结构上开放-ended 的任务上增加熵(支持探索),表明对模型推理过程的主动重塑。(III) 输出层面的多样性。正确的预测始终比错误的预测具有更高的字幕熵(图 2 右侧),这表明由幻觉引起的更广泛的语义覆盖与成功的推理呈正相关。这种多样性不仅仅是词汇上的变化,而是反映了扩展的语义 grounding,从而支持下游任务的性能。相似度计算、熵估计和统计检验的进一步实现细节见附录 S8。我们给出以下观察结果: ❺幻觉重塑语义输入。从图 4 中,我们观察到幻觉字幕在平均相似度和分布范围上与忠实字幕存在系统性差异。幻觉输入在嵌入空间中表现出更大的方差和更重的尾部,这种差异在配对 t 检验下具有统计学显著性 (p < 0.01)。这证实了它们引入了真实的

第 12 页

12 F. He 等人

图 5:下游任务准确率作为幻觉强度的函数。我们在忠实描述和幻觉描述之间进行逐渐插值,并评估下游性能。结果呈现出倒 U 型模式:引入适度的幻觉提高了准确率,而过度的幻觉则降低了准确率。

输入层面的偏移而非作为冗余噪声,为模型提供了额外的锚点以探索替代推理路径。重要的是,这种偏移在多个数据集中均被一致观察到,强调了输入层面的语义重塑是幻觉的一般属性,而非特定于数据集的现象,并且在不同模态和领域中均表现出稳健性。

❻ 幻觉调节推理动态。如图 2(左)所示,幻觉提示以任务依赖的方式改变了推理轨迹的熵。在 BBBP、AntiCP2 和 ProofWriter 等推理密集型任务上,幻觉降低了运动熵,表明它们促进了更收敛和稳定的推理。相反,在 SARA v3 等结构开放-ended 的任务上,幻觉增加了熵,使模型能够探索更广泛的推理路径。这些差异具有统计学显著性(配对 t 检验,p < 0.05),表明幻觉不仅仅是注入噪声,而是以可以鼓励收敛或支持探索的方式主动重塑推理动态,具体取决于任务。

❼ 正确预测与更高的描述熵对齐。如图 2(右)所示,在 GQA、Dex-Net、ISIC 和 PlantVillage 等数据集中,导致正确预测的幻觉描述始终表现出比导致错误预测的描述更高的语义熵。这些差异具有统计学显著性(p < 0.05),并且该效应在所有评估的数据集中均保持一致,强调了更高的语义多样性是成功推理的一般标志,而非特定于数据集的现象。这一结果不仅突出了词汇多样性,还强调了潜在空间中的语义多样性是支持准确任务性能的有用信号。

要点 ❷。幻觉一致地重塑输入,调节推理轨迹,且更高的语义多样性与正确结果相关,表明其效用源于拓宽语义空间,而非添加冗余噪声。

第 13 页

HIVE 13

我们进一步分析推理链内部产生的幻觉。通过检测第一个幻觉标记的位置(早期、中期、晚期),我们观察到一致的位置模式:早期幻觉往往与更强的下游改进相关。这表明在推理过程早期引入的推测性线索可能会塑造不断演变的推理轨迹。详细的实验结果见附录 S4。

直观地说,幻觉化的字幕扩展了模型可用的语义假设空间。在部分可观测性下,忠实字幕通常仅描述可见属性,这可能为推理提供的线索不足。幻觉线索引入了推测但任务相关的语义锚点,引导模型对输入做出合理的解释。当这些锚点与任务的潜在结构一致时,它们帮助模型探索有用的推理轨迹,而不是局限于不完整的观察结果。

4.5 案例研究

除了聚合结果外,我们还通过案例研究来说明幻觉字幕如何在实践中重塑推理链。我们从 ISIC 数据集中选取了一个样本,该任务旨在确定皮肤病变是良性还是恶性。给定相同的输入,忠实(F)字幕侧重于表面属性(例如不对称性、不规则边界),将推理限制在黑色素瘤标准上,导致错误的恶性预测。相比之下,幻觉(H)字幕引入了暗示脂溢性角化病(SK)框架的血管线索。尽管该线索并不严格忠实于图像,但它提供了一个与任务对齐的语义触发器,从而重塑推理轨迹:中间步骤越来越锚定 SK 框架,最终导致正确的良性诊断。这个例子表明,幻觉可以提供额外的语义锚点,将推理过程引导向更有效的诊断路径,而不仅仅是注入噪声。如图 6 所示,幻觉字幕可以引入辅助但任务相关的线索,引导推理链走向正确的结果。附录 S5 提供了更多数据集的案例研究。

4.6 消融实验

为了确定幻觉提供最强效用的条件,我们进行了一系列消融实验,考察三个关键生成因素:采样温度、标记预算和幻觉强度。这些分析揭示了不同的生成配置如何塑造幻觉字幕引入的语义扩展,以及这种扩展如何转化为下游的性能提升。 温度。我们分析了采样温度如何影响幻觉字幕的有用性。如表 6 所示,所有四个数据集均在 T = 0.6 时达到峰值,产生了最强且最一致的增益(例如,ISIC 上 +11.76%,PlantVillage 上 +14.68%,Dex-Net 上 +2.51%,AntiCP2 上 +3.76%)。较低的温度(T = 0.0/0.3)生成的字幕较为保守,语义扩展有限(例如,AntiCP2 上 -4.27%,ISIC 上 -5.05%),而较高的温度(T = 0.9)增加了方差并降低了可控性(例如,

第 14 页

14 F. He et al.

H-Caption: 粉红色-棕色病变,边界不规则, 血管活动;疑似脂溢性角化病/基底细胞癌。 Reasoning: 虚假血管。

H-Path – 锚定 SK 框架 H-Gain

诊断。

  • 观察到血管性 + 异质性
  • ✔ 结论:良性(正确)。 锚定良性 SK

F-Caption: 不对称病变,具有多种 颜色,不规则边界和血管。 H-Summary Reasoning: 虚假血管线索 Q: 良性 还是恶性? F-Path — 观察到黑色素瘤血管性标准 + 异质性 锚定正确良性 SK 框架结果。 A: ✔ 良性

  • ✘ 结论:恶性(错误)。

图 6:ISIC 案例研究。幻觉(H)描述引入了一个虚假的血管线索,该线索将推理锚定在脂溢性角化病(SK)框架上,最终得出正确的良性诊断。相比之下,忠实(F)描述将推理限制在表面特征上,导致恶性误分类,突显了幻觉作为建设性指导的潜力。

−5.00% on AntiCP2)。这些观察结果表明,T = 0.6 左右的适度温度实现了最有效的平衡,在不过度引入变异性的情况下提供有用的语义增强。

表 6:不同温度和令牌条件下的幻觉诱导增益(∆)。我们报告相对增益 ∆= H −F,通过消除数据集之间的基线准确率差异来隔离幻觉效应。粗体值标记最强增益,下划线值标记次佳增益。

数据集 温度 (T ) 令牌长度

0.0 0.3 0.6 0.9 128 256 512 1024

AntiCP2 -4.27 +0.10 +3.76 -5.00 +0.15 +3.76 +4.48 -0.14 PlantVillage +2.30 -4.46 +14.68 +1.51 -4.66 +14.68 +7.86 +9.49 Dex-Net +0.07 +1.88 +2.51 +0.14 +1.56 +2.51 -2.04 +1.93 ISIC +9.26 -5.05 +11.76 +3.70 -2.10 +11.76 +1.33 -0.48

最大令牌预算。我们使用温度 T = 0.6 检查令牌长度的影响(表 6)。短生成(128 个令牌)限制了语义覆盖范围,导致增益微弱或不一致。256 个令牌的预算在所有数据集上产生了强劲且稳定的改进。更大的预算(512 或 1024 个令牌)可能会产生更高的峰值,但也会引入更大的方差。剔除关键的幻觉令牌会导致准确率大幅下降,证实了幻觉的收益依赖于充分且结构良好的语义线索。 幻觉强度。为了评估幻觉强度对下游性能的影响,我们使用 GPT-4o 生成具有不同幻觉级别的描述,并将它们分为强和弱两类。我们在忠实描述和幻觉描述之间,以及强幻觉和弱幻觉之间进行插值,然后将它们重新投影到 SBERT 空间以进行对齐。图 5 显示了平滑的语义过渡(右侧)和倒 U 型模式(左侧),

第 15 页

HIVE 15

其中,适度的幻觉强度能提供最可靠的准确率提升,而过度的强度则会降低可控性。

启示 ❸. 适度的幻觉水平能带来最强的增益,这表明幻觉线索的收益取决于受控的语义扩展,而非过度的或微弱的生成。

5 讨论与结论 我们的研究结果指出了幻觉后推理(PHR)的双重特征。忠实路径鼓励利用(exploitation),将模型锚定在已验证的证据上,从而产生精确但狭窄的预测。幻觉路径促进探索(exploration),通过推测性但与任务相关的线索扩展假设空间,这些线索偶尔能解锁忠实输入无法获得的捷径。因此,幻觉不仅仅是错误,而是拓宽模型推理景观的替代信号。然而,其收益关键取决于控制:适度的幻觉强度能在不破坏推理稳定性的情况下丰富语义,而过度的或不匹配的幻觉则会降低可靠性。温度、Token 预算和插值强度为在不同数据集、模型和解码设置中调整这种平衡提供了实用的杠杆,而回退到忠实路径的机制有助于管理风险。 局限性。尽管我们的研究揭示了 PHR 在不同任务和模型中的一致模式,但仍存在若干局限性。首先,我们的评估是在一组固定的基准上进行的,可能无法完全捕捉现实世界多模态推理场景的多样性。其次,我们的干预主要作用于字幕层面,而幻觉也可能出现在中间推理步骤或潜在表示中。第三,虽然幻觉线索在部分可观测性下有时能辅助推理,但在其他设置中也可能引入虚假信号。未来的工作应调查更广泛的任务领域,并开发原则性机制,以更好地控制多模态推理系统中由幻觉引起的语义扩展。 更广泛的影响。本研究通过考察幻觉语义如何与下游推理相互作用,促进了对多模态模型中幻觉行为的更深入理解。重要的是,我们的发现不应被解读为提倡将幻觉作为一种有意的推理策略。相反,PHR 似乎是在证据不完整的情况下进行推理时的副产品。理解这一现象可能为未来平衡探索性语义线索与可靠锚定及验证的方法提供信息。 我们希望这项工作能鼓励社区进一步调查幻觉语义在模型推理中的作用,并开发原则性方法来理解和控制 PHR。

致谢

我们感谢审稿人和领域主席的建设性反馈。

第 16 页

16 F. He 等

参考文献

1. Agrawal, P., Bhagat, D., Mahalwal, M., Sharma, N., Raghava, G.P.: Anticp 2.0: 一种用于预测抗癌肽的更新模型。Briefings in bioinformatics 22(3) (2021) 25 2. Bendahman, N., Pinel-Sauvagnat, K., Hubert, G., Billami, M.B.: 在法律抽象摘要中,并非所有幻觉都应被抛弃。 收录于:NAACL (2025) 3 3. Chen, Z., Min, Y., Zhang, J., Yan, B., Wang, J., Wang, X., Shan, S.: 多模态幻觉评估与检测综述。IJCV 134(3), 131 (2026) 4 4. Choi, S., Fang, T., Wang, Z., Song, Y.: Kcts: 结合令牌级幻觉检测的知识约束树搜索解码。收录于:EMNLP (2023) 3 5. Creswell, A., Shanahan, M.: 使用大型语言模型进行忠实推理。arXiv 预印本 arXiv:2208.14271 (2022) 2 6. Dong, B., Ni, M., Huang, Z., Yang, G., Zuo, W., Zhang, L.: Mirage: 评估多模态推理链中 MLLM 的幻觉。收录于:NeurIPS. 第 38 卷,pp. 122910–122955 (2026) 4 7. Du, X., Xiao, C., Li, Y.: Haloscope: 利用未标记的 LLM 生成结果进行幻觉检测。收录于:NeurIPS (2024) 3 8. Gong, X., Ming, T., Wang, X., Wei, Z.: Damro: 深入 LVL 的注意力机制以减少对象幻觉。收录于:EMNLP. pp. 7696–7712 (2024) 1 9. Guha, N., Nyarko, J., Ho, D.E., Ré, C., Chilton, A., Narayana, A., Chohlas- Wood, A., Peters, A., Waldon, B., Rockmore, D.N., 等:Legalbench: 一个协作构建的基准,用于衡量大型语言模型中的法律推理。 收录于:NeurIPS (2023) 3 10. Han, G., Lim, S.N.: 基于基础模型的小样本目标检测。收录于:CVPR. pp. 28608–28618 (2024) 1 11. Han, J., Ren, Y., Ding, J., Yan, K., Xia, G.S.: 通过变分特征聚合实现小样本目标检测。收录于:AAAI. 第 37 卷,pp. 755–763 (2023) 1 12. Henderson, P., Krass, M.S., Zheng, L., Guha, N., Manning, C.D., Jurafsky, D., Ho, D.E.: Pile of law: 从法律及 256GB 开源法律数据中学习负责任的数据过滤。收录于:NeurIPS (2022) 25 13. Hong, Y., Wu, Q., Qi, Y., Rodriguez-Opazo, C., Gould, S.: Vln bert: 用于导航的循环视觉-语言 BERT。收录于:CVPR. pp. 1643–1653 (2021) 1 14. Honovich, O., Choshen, L., Aharoni, R., Neeman, E., Szpektor, I., Abend, O.: Q2: 通过问题生成和问题回答评估知识驱动对话中的事实一致性。收录于:EMNLP (2021) 3 15. Hu, X., Ru, D., Qiu, L., Guo, Q., Zhang, T., Xu, Y., Luo, Y., Liu, P., Zhang, Y., Zhang, Z.: 以知识为中心的幻觉检测。收录于:EMNLP. pp. 6953–6975 (2024) 2 16. Hudson, D.A., Manning, C.D.: Gqa: 一个用于现实世界视觉推理和组合式问答的新数据集。收录于:CVPR (2019) 25 17. Hughes, D., Salathé, M., 等:一个开放访问的植物健康图像存储库,旨在推动移动疾病诊断的发展。arXiv 预印本 arXiv:1511.08060 (2015) 25 18. Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y.J., Madotto, A., Fung, P.: 自然语言生成中的幻觉综述。ACM computing surveys 55(12), 1–38 (2023) 1 19. Kadavath, S., Conerly, T., Askell, A., Henighan, T., Drain, D., Perez, E., Schiefer, N., Hatfield-Dodds, Z., DasSarma, N., Tran-Johnson, E., 等:语言模型(大部分)知道它们知道什么。arXiv 预印本 arXiv:2207.05221 (2022) 4

第 17 页

HIVE 17

20. Krizhevsky, A., Sutskever, I., Hinton, G.E.: 使用深度卷积神经网络进行 ImageNet 分类。在:NeurIPS (2012) 1 21. Kryściński, W., McCann, B., Xiong, C., Socher, R.: 评估抽象文本摘要的事实一致性。在:EMNLP (2020) 3 22. Lanham, T., Chen, A., Radhakrishnan, A., Steiner, B., Denison, C., Hernandez, D., Li, D., Durmus, E., Hubinger, E., Kernion, J., 等:衡量思维链推理中的忠实度。arXiv 预印本 arXiv:2307.13702 (2023) 4 23. Lee, Y.L., Tsai, Y.H., Chiu, W.C.: 深入探讨视觉对比解码,以减轻大型视觉语言模型的幻觉。arXiv 预印本 arXiv:2412.06775 (2024) 3 24. Lehman, E., Jain, S., Pichotta, K., Goldberg, Y., Wallace, B.C.: 在临床笔记上预训练的 BERT 是否揭示了敏感数据?在:NAACL (2021) 3 25. Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., Küttler, H., Lewis, M., Yih, W.t., Rocktäschel, T., 等:用于知识密集型 NLP 任务的检索增强生成。在:NeurIPS (2020) 4 26. Li, J., Cao, P., Chen, Y., Xu, J., Li, H., Jiang, X., Liu, K., Zhao, J.: 迈向更好的思维链:对有效性和忠实度的反思。在:ACL。第 10747–10765 页 (2025) 2 27. Li, Y., Du, Y., Zhou, K., Wang, J., Zhao, W.X., Wen, J.R.: 评估大型视觉语言模型中的对象幻觉。在:EMNLP (2023) 1, 2 28. Li, Z., Wu, X., Du, H., Liu, F., Nghiem, H., Shi, G.: 最新大型视觉语言模型综述:基准评估与挑战。在:CVPR。第 1587–1606 页 (2025) 1 29. Lin, S., Hilton, J., Evans, O.: TruthfulQA:衡量模型模仿人类谎言的程度。在:ACL (2022) 3 30. Liu, B., Wei, H., Niu, D., Chen, H., He, Y.: 以人类的方式提问:从文本语料库进行可扩展的问答生成。在:WWW (2020) 26 31. Liu, F., Lin, K., Li, L., Wang, J., Yacoob, Y., Wang, L.: 通过鲁棒的指令微调减轻大型多模态模型中的幻觉。在:ICLR (2024) 3 32. Liu, S., Halder, K., Qi, Z., Xiao, W., Pappas, N., Htut, P.M., John, N.A., Benajiba, Y., Roth, D.: 迈向长上下文幻觉检测。在:NAACL。第 7827–7835 页 (2025) 2 33. Lu, S., Guo, D., Ren, S., Huang, J., Svyatkovskiy, A., Blanco, A., Clement, C., Drain, D., Jiang, D., Tang, D., 等:CodexGlue:用于代码理解和生成的机器学习基准数据集。在:NeurIPS (2021) 25 34. Luo, J., Li, T., Wu, D., Jenkin, M., Liu, S., Dudek, G.: 幻觉检测与幻觉缓解:一项调查。arXiv 预印本 arXiv:2401.08358 (2024) 2 35. Lyu, Q., Havaldar, S., Stein, A., Zhang, L., Rao, D., Wong, E., Apidianaki, M., Callison-Burch, C.: 忠实的思维链推理。在:IJCNLP。第 305–329 页 (2023) 2 36. Ma, J., Suo, W., Wang, P., Zhang, Y.: 理解与缓解多模态思维链模型中的幻觉。在:CVPR。第 40224–40234 页 (2026) 4 37. Ma, Y.J., Hejna, J., Fu, C., Shah, D., Liang, J., Xu, Z., Kirmani, S., Xu, P., Driess, D., Xiao, T., 等:视觉语言模型是上下文价值学习者。在:ICLR (2024) 1 38. Mahler, J., Liang, J., Niyaz, S., Laskey, M., Doan, R., Liu, X., Ojea, J.A., Goldberg, K.: Dex-Net 2.0:利用合成点云和分析抓取指标进行深度学习的鲁棒抓取规划。arXiv 预印本 arXiv:1703.09312 (2017) 25

第 18 页

18 F. He 等人

39. Manakul, P., Liusie, A., Gales, M.: Selfcheckgpt:针对生成式大语言模型的零资源黑盒幻觉检测。在:EMNLP (2023) 2, 3, 26 40. Manevich, A., Tsarfaty, R.: 通过语言对比解码 (LCD) 缓解大型视觉-语言模型 (LVLMs) 中的幻觉。在:ACL (2024) 4 41. Martins, I.F., Teixeira, A.L., Pinheiro, L., Falcao, A.O.: 一种用于计算机模拟血脑屏障渗透建模的贝叶斯方法。Journal of chemical information and modeling 52(6), 1686–1697 (2012) 25 42. Mudgal, S., Lee, J., Ganapathy, H., Li, Y., Wang, T., Huang, Y., Chen, Z., Cheng, H.T., Collins, M., Strohman, T., 等:来自语言模型的受控解码。在:ICML (2024) 3 43. Nori, H., King, N., McKinney, S.M., Carignan, D., Horvitz, E.: GPT-4 在医学挑战问题上的能力。arXiv 预印本 arXiv:2303.13375 (2023) 3 44. Parcalabescu, L., Frank, A.: 论自然语言解释的忠实性或自洽性测量。在:ACL (2024) 2 45. Peng, S., Yang, S., Jiang, L., Tian, Z.: 通过句子级早期干预缓解物体幻觉。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 635–646 (2025) 2 46. Qiu, Y., Ziser, Y., Korhonen, A., Ponti, E., Cohen, S.B.: 检测和缓解多语言摘要中的幻觉。在:EMNLP (2023) 2 47. Rajpurkar, P., Jia, R., Liang, P.: 知你所不知:SQuAD 中的不可回答问题。在:ACL (2018) 4 48. Rohrbach, A., Hendricks, L.A., Burns, K., Darrell, T., Saenko, K.: 图像描述中的物体幻觉。在:EMNLP (2018) 1 49. Sadat, M., Zhou, Z., Lange, L., Araki, J., Gundroo, A., Wang, B., Menon, R.R., Parvez, M., Feng, Z.: DelucionQA:检测领域特定问答中的幻觉。在:EMNLP (2023) 3 50. Sennrich, R., Vamvas, J., Mohammadshahi, A.: 通过源对比解码和语言对比解码缓解幻觉和机器翻译中的非目标输出。在:EACL (2024) 4 51. Su, W., Wang, C., Ai, Q., Hu, Y., Wu, Z., Zhou, Y., Liu, Y.: 基于大语言模型内部状态的无监督实时幻觉检测。在:ACL (2024) 2, 3 52. Tafjord, O., Dalvi, B., Clark, P.: Proofwriter:在自然语言上生成蕴含、证明和溯因陈述。在:计算语言学协会年会联合会议 ACL-IJCNLP 论文集 (2021) 25 53. Tian, X., Zou, S., Yang, Z., He, M., Waschkowski, F., Wesemann, L., Tu, P.H., Zhang, J.: 更多思考,更少准确性?论视觉-语言模型中推理的双重性质。在:ICLR (2026), https://openreview.net/forum?id=XpL5eqjCjF 4 54. Tschandl, P., Rosendahl, C., Kittler, H.: HAM10000 数据集,一个包含常见色素性皮肤病变多源皮肤镜图像的大型集合。Scientific data 5(1), 1–9 (2018) 25 55. Wang, A., Cho, K., Lewis, M.: 通过提问和回答问题来评估摘要的事实一致性。在:ACL (2020) 3 56. Wang, F., Zhou, W., Huang, J.Y., Xu, N., Zhang, S., Poon, H., Chen, M.: MDPO:多模态大语言模型的条件偏好优化。在:EMNLP。pp. 8078–8088 (2024) 1 57. Wang, X., Pan, J., Ding, L., Biemann, C.: 通过指令对比解码缓解大型视觉-语言模型中的幻觉。在:ACL (2024) 2

第 19 页

HIVE 19

58. Wang, X., Zhou, D.: 无需提示的链式思维推理。在:NeurIPS (2024) 4 59. Wang, Y., Reddy, R.G., Mujahid, Z., Arora, A., Rubashevskii, A., Geng, J., Afzal, O.M., Pan, L., Borenstein, N., Pillai, A., 等:Factcheck-bench:用于自动事实核查器的细粒度评估基准。在:EMNLP (2024) 26 60. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S., Yogatama, D., Bosma, M., Zhou, D., Metzler, D., 等:大语言模型的涌现能力。TMLR (2022) 4 61. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E.H., Le, Q.V., Zhou, D:链式思维提示激发大语言模型中的推理能力。在:NeurIPS (2022) 2 62. Xu, J., Fei, H., Pan, L., Liu, Q., Lee, M.L., Hsu, W:通过符号链式思维实现忠实逻辑推理。在:ACL (2024) 2 63. Xu, Z., Liu, C., Wei, Q., Wu, J., Zou, J., Wang, X., Zhou, Y., Liu, S:思考更多,看见更少?评估多模态推理模型中放大的幻觉。在: NeurIPS. 第38卷,第82878–82905页 (2026) 4 64. Yin, H., Si, G., Wang, Z:Clearsight:视觉信号增强以减轻多模态大语言模型中的物体幻觉。在: 计算机视觉与模式识别会议论文集。第14625–14634页 (2025) 2 65. Yu, Q., Li, J., Wei, L., Pang, L., Ye, W., Qin, B., Tang, S., Tian, Q., Zhuang, Y:Hallucidoctor:减轻视觉指令数据中的幻觉毒性。在: CVPR (2024) 3 66. Zellers, R., Bisk, Y., Farhadi, A., Choi, Y:从识别到认知:视觉常识推理。在:CVPR (2019) 1 67. Zhang, J., Huang, J., Jin, S., Lu, S:面向视觉任务的视觉-语言模型综述。TPAMI 46(8),第5625–5644页 (2024) 1 68. Zhang, J., Wang, T., Zhang, H., Lu, P., Zheng, F:反思性指令微调:减轻大型视觉-语言模型中的幻觉。在:ECCV (2024) 3 69. Zhang, T., Qiu, L., Guo, Q., Deng, C., Zhang, Y., Zhang, Z., Zhou, C., Wang, X., Fu, L:通过增强焦点来提升基于不确定性的幻觉检测。 在:EMNLP。第915–932页 (2023) 2 70. Zhang, W., Wang, Y.X:幻觉提升少样本目标检测。在: CVPR。第13008–13017页 (2021) 1 71. Zhao, Z., Cohen, S.B., Webber, B:减少摘要生成中的数量幻觉。在:EMNLP (2020) 3 72. Zhou, X., Zhang, M., Lee, Z., Ye, W., Zhang, S:Hademif:大语言模型中的幻觉检测与缓解。在:ICLR (2025) 2

第 20 页

20 F. He 等

附录摘要

本补充材料包含 ECCV 2026 会议论文《HIVE: 理解视觉语言模型中的幻觉后推理 (Post-Hallucination Reasoning)》的额外细节。补充材料组织结构如下:

– §S1 报告显著性与鲁棒性分析。内容包括跨数据集的平均值±标准差 (mean±std)、$\Delta(H–F)$ 以及 p 值。 – §S2 列出提示词模板 (prompt templates)。每个数据集均包含角色提示词 (role prompt)、生成提示词 (generation prompt) 和评估提示词 (evaluation prompt)。 – §S3 研究模型规模的影响,表明幻觉带来的增益在 Qwen2.5-VL 不同尺寸下呈现非单调性。 – §S4 分析推理链中幻觉的位置效应。研究幻觉 token 的位置(早期、中期、晚期)如何影响跨数据集和模型的下游任务性能。 – §S5 展示案例研究 (case studies)。提供 DexNet、BBBP 和 PlantVillage 上的定性示例,展示幻觉生成的描述 (captions) 如何作为锚点,引导推理走向正确结果。 – §S6 总结数据集、模型及评估协议。 – §S7 解释描述判别器 (caption discriminator)。详细描述了三种互补的事实性验证器 (factuality verifiers)。 – §S8 提供分析设置。分别描述了输入级、过程级和输出级的分析流程。 – §S9 提供收敛性与相似性分析。报告了链内 (intra-chain) 和链间 (inter-chain) 的收敛情况。 – §S10 报告在 MMStar 和 MMBench 上的额外鲁棒性实验,显示在感知和推理子集上均获得一致的提升。 – §S11 列出数据集和模型许可协议。 – §S12 声明 GPT-5 仅用于语法检查。

S1 显著性与鲁棒性

所有报告的结果均为五次独立运行(使用不同的随机种子)的平均值,并以平均值±标准差 (mean±std) 呈现。我们进行双侧配对 t 检验 (two-sided paired t-tests) 以比较忠实 (Faithful, F) 和幻觉 (Hallucinated, H) 输入。表 S1 报告了所有九个数据集的完整结果,包括平均值±标准差、相对增益 $\Delta(H–F)$ 以及 p 值。大多数任务表现出具有统计显著性的增益 ($p<0.05$ 或 $p<0.01$)。例如,在重度依赖感知的数据集如 ISIC (+11.8%, $p = 0.0015$) 和 PlantVillage (+14.7%, $p<10^{-8}$) 上,幻觉带来了巨大且一致的改进;而在规则驱动的任务如 CodeXGLUE 和 SARA 上,差异则微乎其微或不显著 ($p>0.1$)。这些结果证实,所报告的改进具有统计可靠性,而非随机波动。

S2 提示词模板

为确保跨基准测试的一致性,我们设计了统一的提示词模板,遵循三部分结构:角色提示词、生成提示词、

第 21 页

HIVE 21

表 S1:幻觉诱导增益的统计显著性。5 次运行的均值±标准差。$\Delta(H-F)$ 表示准确率增益。双侧配对 t 检验 p 值;显著结果 ($p<0.05$) 已加粗。

| 数据集 | 领域 | 忠实 (F) | 幻觉 (H) | $\Delta(H-F)$ | p | | :— | :— | :— | :— | :— | :— | | AntiCP2 | 蛋白质 | 0.5459±0.0067 | 0.5835±0.0126 | +0.0376 | 0.00036 | | BBBP | 药物属性 | 0.6167±0.0264 | 0.6833±0.0118 | +0.0667 | 0.00481 | | CodeXGLUE | C++ 代码 | 0.5515±0.0326 | 0.5275±0.0227 | −0.0240 | 0.102 | | SARA_V3 | 法律推理 | 0.6293±0.0084 | 0.6224±0.0161 | −0.0069 | 0.147 | | ProofWriter | 逻辑 | 0.6949±0.0125 | 0.7500±0.0217 | +0.0551 | 1.57×10$^{-5}$ | | GQA | 多模态 VQA | 0.7136±0.0040 | 0.7422±0.0078 | +0.0286 | 0.00088 | | DexNet | 机器人 | 0.5325±0.0045 | 0.5576±0.0116 | +0.0251 | 0.00038 | | ISIC | 医学 | 0.6388±0.0126 | 0.7564±0.0248 | +0.1176 | 0.00151 | | PlantVillage | 农业 | 0.6273±0.0249 | 0.7741±0.0211 | +0.1468 | 3.42×10$^{-9}$ |

以及一个评估提示词。角色提示词为模型分配了针对特定领域的专家身份(例如药物发现、法律推理、医学诊断)。生成提示词要求模型将原始输入($\{Sign\}$)转化为自然语言,从而生成忠实或幻觉描述。最后,评估提示词指定了下游任务,该任务始终要求做出二元决策(是/否)并提供逐步推理链。这种设计确保了唯一的实验变量是描述的类型(忠实 vs. 幻觉),而提示词的所有其他方面均保持受控。

表 S2 列出了所有九个数据集使用的完整模板。这些模板包括基于文本的任务(AntiCP2、BBBP、CodeXGLUE、SARA、ProofWriter)和多模态任务(GQA、DexNet、ISIC、PlantVillage)。模板在所有模型和实验中均保持固定,因此观察到的差异可完全归因于幻觉语义的存在与否。

S3 模型规模的影响

我们在三种不同规模(7B、32B、72B)下评估 Qwen2.5-VL 模型。如表 S3 所示,幻觉的影响并非随规模单调变化。32B 模型获益显著(+9.4%),而 7B 和 72B 模型则显示出轻微下降。这表明规模本身并不能决定幻觉的有效性:中等规模的模型可能从额外的语义线索中获益,而非常大的模型可能在忠实输入上已经饱和,使得进一步的幻觉变得冗余甚至具有干扰性。

第 22 页

22 F. He 等人

表 S2:跨数据集使用的提示词。每个数据集都配有一个角色提示词、一个生成提示词和一个评估提示词,以确保任务特定的上下文和一致性。

数据集 角色提示词 生成提示词 评估提示词

AntiCP2 你是一名蛋白质{Sign}\n 用自然语言描述: 你是一名负责评估短肽序列 科学专家。 是否具有抗癌活性的肽生物信息学 专家。回答:是或否。然后 提供逐步推理过程。 BBBP 你是一名{Sign}领域的药物发现专家。 用自然语言描述: 该分子是否具有穿透血脑屏障的能力? 回答:是或否。然后提供逐步推理过程。 CodeX. 你是一名软件{Sign}安全专家兼教授。 用自然语言描述: 你是一名软件安全专家兼教授。以下 教授。 C 函数是否存在安全漏洞?回答:是或否。 然后提供逐步推理过程。 SARA_V3 你是一名法律{Sign}专家。 用自然语言描述: 你是一名法律推理助手。 专家。 判断以下法律主张是否有事实支持。回答:是或否。然后提供 逐步推理过程。 Proof 你是一名推理{Sign}助手。 用自然语言描述: 你是一名逻辑推理助手。判断陈述是否由给定的 事实和规则上下文蕴含。回答:是 或否。然后提供逐步推理 过程。 GQA 你是一名推理{Sign}专家。 用自然语言描述该图像: 你是一名视觉推理专家。 专家。 根据图像回答问题。回答:是或否。然后 提供逐步推理过程。 Dex_Net 你是一名机器人抓取评估{Sign}专家。 用自然语言描述该图像: 你是一名专门从事平行夹爪 评估的资深机器人操作工程师。规划。回答:是或否。然后提供 逐步推理过程。 ISIC 你是一名皮肤科专家{Sign}。 用自然语言描述该图像: 你是一名皮肤科专家。 皮肤科专家。 根据此图像,判断病变是恶性(黑色素瘤) 还是良性。回答:是(恶性黑色素瘤) 或否(良性)。然后提供逐步 推理过程。 PlantV. 你是一名经验丰富的茄科作物植物病理学家{Sign}。 用自然语言描述该图像: 你是一名诊断番茄叶部 茄科作物 疾病的植物病理学专家。判断其显示的是早疫病还是晚疫病:如果是早疫病回复是,如果是晚疫病回复否。回答:是或否。 然后提供逐步推理过程。

第 23 页

HIVE 23

表 S3:Qwen2.5-VL 系列内的扩展性结果。幻觉效应是非单调的:较小和中等偏大的模型受益,而非常大的模型表现出波动性或饱和性。

模型 忠实 (F) 幻觉 (H) ∆(H−F) Qwen2.5-VL-7B 0.5898±0.0000 0.5276±0.0000 −0.0622 Qwen2.5-VL-32B 0.5935±0.0068 0.6874±0.0409 +0.0939 Qwen2.5-VL-72B 0.7349±0.0171 0.6856±0.0167 −0.0493

表 S4:推理链内幻觉的位置效应。准确率变化 (∆) 是相对于无幻觉条件测量的。

数据集 / 模型 无 早期 ∆ 晚期 ∆ 中间 ∆ BBBP + GPT-4o 65.22 +23.11 +8.23 −15.22 BBBP + Claude-3 52.93 +21.42 +43.07 +44.85 ISIC + GPT-4o 78.47 +13.75 +5.31 +4.20 ISIC + Claude-3 80.05 +3.96 +16.38 +10.12

S4 推理链中幻觉的位置效应

尽管主文侧重于通过基于图像的干预引入的幻觉,但幻觉也可能出现在模型自身的推理链中。为了更好地理解它们对下游预测的潜在影响,我们进行了额外的分析,考察生成推理轨迹中幻觉标记的位置效应。 具体而言,我们检测模型推理链中的幻觉标记,并根据序列中第一个幻觉出现的位置对样本进行分组,分为早期、中期、晚期或无。对于每个类别,我们测量由此产生的任务准确率,并将其与未发生幻觉的基线条件进行比较。实验在两个代表性数据集(BBBP 和 ISIC)上使用两个模型(GPT-4o 和 Claude-3 Sonnet)进行。结果总结在表 S4 中,报告了相对于无幻觉条件的准确率差异。

S5 定性案例研究

DexNet:机器人抓取。图 S2 展示了来自 DexNet 的机器人抓取案例。幻觉 (H) 图像错误地将深度图解释为轮式机器人剪影,但这种虚假线索提供了一个具体的物体锚点,使得能够正确推理抓取能力。相比之下,忠实 (F) 图像仅描述了灰色梯度和爪状形状,未能建立物体身份,从而导致错误的“否”预测。此案例说明了

第 24 页

24 F. He 等

H-Caption:尖端和边缘变暗,明显 H-Mistake 表明晚疫病。 Reasoning: 边缘变暗

H-Path – 锚定晚疫病,引导推理。 H-Gain

的诊断。 F-Caption:边缘变暗,外观干燥, 强烈暗示可能的晚疫病感染。 H-Summary Reasoning: 虚假的边缘颜色 Q:早疫病还是晚疫病? – 观察到边缘变暗。 线索锚定推理, F-Path – 没有晚疫病的锚点。 导致正确的晚疫病结果。

  • 观察到边缘变暗。
  • ✔ 结论:晚疫病(正确)。 锚定边缘变暗
  • ✘ 结论:早疫病(错误)。 晚疫病结果。

图 S1:PlantVillage 的案例研究。幻觉(H)字幕突出了虚假线索“尖端和边缘变暗”,该线索将推理锚定在晚疫病上,最终得出正确的诊断。相比之下,忠实(F)字幕注意到了相同的边缘变暗,但缺乏晚疫病的明确锚点,导致错误的早疫病分类。此示例说明了幻觉,即使基于部分误导性的特征,也能提供决定性的锚点,引导推理走向正确的结果。

展示了幻觉虽然事实错误,但能丰富推理空间并支持正确决策。 BBBP:分子渗透性。图 S3 展示了来自 BBBP 的分子分类示例。幻觉(H)字幕错误地将骨架识别为萘,但这一线索将推理锚定在良好的疏水性上,引导模型正确预测血脑屏障渗透。与此同时,忠实(F)字幕强调带有质子化胺的联苯骨架,将推理锚定在尺寸/电荷约束上,导致错误的“否”预测。此案例表明,即使是错误的芳香族锚点也可以作为正确的渗透性分类的建设性信号。 PlantVillage:作物病害识别。图 S1 说明了作物病害识别任务。幻觉(H)字幕突出了尖端和边缘变暗,将推理锚定在晚疫病上并产生正确的诊断。相比之下,忠实(F)字幕注意到了类似的边缘变暗,但没有明确锚定晚疫病,导致错误的早疫病决策。此案例强调,幻觉即使基于虚假线索,也能作为决定性的锚点,引导推理走向正确的结果。 案例研究总结。在 DexNet、BBBP 和 PlantVillage 中,出现了一致的模式:幻觉字幕经常引入虚假或事实错误的线索(例如机器人剪影、萘核心或变暗的叶片边缘)。然而,这些线索作为决定性的锚点,扩展了推理空间,提供了额外的结构,引导模型走向正确的结果。相比之下,忠实字幕虽然事实准确,但可能缺乏足够的锚定,导致推理保持浅层且有时不正确。这些案例研究突出了幻觉的建设性潜力:即使不完美,幻觉也能注入归纳信号,从而提高决策质量。

第 25 页

HIVE 25

H-Caption: 一张 32×32 的深度图,形似 H-Mistake 小型轮式机器人的轮廓。 缺乏内在 Reasoning: 物体身份

H-Path – 将带轮子的身体作为锚点 H-Gain

的推理 F-Caption: 一张带有灰色 渐变的 32×32 深度图,形似 H-Summary 爪子的轮廓。 虚假的机器人线索启用了 Q: 能否被 F-Path Reasoning: 更丰富的推理,从而 机械臂抓取? – 观察灰色渐变 + 爪子形状 得出正确的抓取结果。 A: ✔ 是 – 缺乏附近物体

  • 观察轮廓 + 圆形形状
  • ✔ 结论:是(正确)。 启用更丰富
  • ✘ 结论:否(错误)。

图 S2:DexNet 的案例研究。一个幻觉(H)字幕将深度图误读为带有轮子的机器人轮廓,将推理锚定在可抓取物体上,从而得出正确答案。相比之下,忠实(F)字幕仅注意到灰色渐变和类爪形状,未能建立物体身份,导致错误的“否”预测。此示例表明,尽管幻觉线索在事实上是不正确的,但它们可以丰富推理过程并促成正确的决策。

S6 实验设置

数据集。我们在涵盖文本和多模态领域的 9 个数据集上进行实验。文本(5):AntiCP2 [1](抗菌肽分类),BBBP [41](血脑屏障渗透),CodeXGLUE [33](C++ 异常预测),SARA [12](法律推理),ProofWriter [52](基于逻辑的自然语言推理)。多模态(4):GQA [16](视觉问答),DexNet [38](基于深度的机器人抓取),ISIC [54](皮肤病变分类),PlantVillage [17](来自 RGB 图像的作物病害识别)。

模型。我们评估了 9 个大语言模型,涵盖专有和开源系统:闭源:GPT-4o、GPT-3.5-turbo、Claude 3 Sonnet、Gemini 2.0 Flash、O3。开源:DeepSeek-V3、DeepSeek-R1、Mistral Large、Qwen-VL。

评估。对于二分类任务,我们报告准确率(Accuracy)作为主要指标,以确保数据集和模型家族之间的一致性。

统计。除非另有说明,我们报告 5 次独立运行的均值±标准差。对于每个数据集,我们进行双侧配对 t 检验以比较忠实输入与幻觉输入。统计显著性在常规阈值(p<0.01)下报告;完整结果和更多细节见附录 S1。Token 预算通过最大生成长度实现,尽管生成可能提前终止。

S7 字幕判别器的实现

我们实现了三个互补模块来评估幻觉字幕的事实合理性。每个模块的动机均源于先前关于自洽性、细粒度事实核查以及基于释义的语义验证的研究。

第 26 页

26 F. He et al.

H-Caption: 具有胺/亚胺侧链和氯离子的萘核分子。 H-Mistake 核心被错误识别为芳香族。 SMILES 字符串编码 Reasoning: aromatic. 分子结构, H-Path – 观察到萘核 + 疏水性 其中芳香核、电荷 – 锚定平面小骨架偏移 H-Gain 和盐形式等特征影响 锚点有利 血脑屏障 BBB。 通透性。 F-Caption: 具有质子化氨基-亚胺链和氯离子的联苯核衍生物。 C1=C(C=CC2=C1C=CC=C2) Reasoning: H-Summary CC([NH2+]C)=NC.[Cl-] – 观察到联苯核 + 质子化胺锚点 Q: 穿透屏障? F-Path BBB 推理, 产生 – 锚定尺寸/电荷阻碍 通透性 A: ✔ 是 正确 预测。 – ✘ 结论: 否(错误)。

图 S3:BBBP 案例研究。幻觉(H)描述错误地将分子识别为基于萘,但引入了有利于血脑屏障通透性的疏水锚点,从而得出正确的“是”结果。相比之下,忠实(F)描述侧重于带有质子化胺的联苯骨架,将推理锚定在尺寸和电荷约束上,导致错误的“否”预测。此示例说明,尽管芳香族线索在事实上是错误的,但可以提供建设性的锚点,引导推理走向正确的分子通透性。

细粒度事实验证器。受 Factcheck-Bench [59] 的细粒度评估视角启发,该模块使用句子分割将每个描述分解为独立的事实声明。每个声明由大型语言模型使用结构化提示进行独立验证,返回二元判决(真/假)、置信度分数(0–1)和简短理由。最终分数是已验证为真的声明的置信度的平均值,并对检测到的假声明进行惩罚。这种设计使得能够在单个声明级别审计幻觉,而不仅仅是以前评估中使用的聚合整个描述级别。 自评估事实验证器。受 SelfCheckGPT [39] 等自一致性方法启发,该模块提示模型直接评估答案的事实正确性(可选问题上下文)在多种实际场景中。模型输出带有置信度和解释的二元判决。与细粒度验证器相比,这种方法轻量级,并在整个答案级别评估事实性。我们还支持多模态变体,在可用的不同评估设置中结合图像输入。 释义一致性验证器。遵循利用释义和问题生成进行语义一致性的思想 [30],该模块生成原始描述的两个释义,同时严格保留含义。释义仅作为澄清意图的辅助证据,而事实性决策始终优先考虑原始描述。事实裁决提示随后产生二元判决、置信度和简洁推理。这种一致性检查减少了提示方差,并稳定了整体准确性的事实性判断。 描述判别器。这三种判别器共同提供了互补的视角:(I) 细粒度声明验证,(II) 整体自

第 27 页

HIVE 27

评估,以及(III)辅助改写的一致性。在我们的实验中,我们包含了一个随机检查器基线(均匀随机接受/拒绝)以及结合多个验证器的集成变体。

S8 分析设置的实现细节

输入级。为了量化忠实路径与幻觉路径字幕之间,以及正确预测与错误预测之间的差异,我们采用以下分析流程。对于每个数据集,我们收集由生成模型产生的幻觉字幕嵌入。当有多个运行结果可用时,我们通过搜索特定运行的目录或进行聚合来解决嵌入的一致性问题,以确保覆盖范围一致。字幕和嵌入与预测标签对齐,如有必要则对样本进行截断以保证长度匹配。使用带有完整奇异值分解(SVD)的主成分分析(PCA)将高维嵌入投影到三维潜在空间。这保留了主要的语义方向,同时去除了冗余方差,便于密度估计。我们通过拟合具有固定带宽的高斯核密度估计器(KDE)来估计嵌入的局部分布熵。对于每个样本,负对数密度作为其熵值,反映其位于语义空间的密集区域还是稀疏区域。我们分别报告正确预测和错误预测的熵的均值和标准差。为了评估正确组和错误组之间差异的显著性,我们进行了不假设方差相等的双样本独立 t 检验。我们报告每个数据集的检验统计量和 p 值。结果在所有九个基准测试中进行聚合,并在附录 §S1 中总结。该程序提供了一种原则性的方法来检查幻觉如何在输入级重塑语义分布、调节推理轨迹,并通过基于熵的分析与预测准确性相关联。 过程级。为了检查幻觉如何调节推理动力学,我们量化推理链嵌入的熵。对于每个输入,我们记录在忠实(F)和幻觉(H)字幕下逐步推理轨迹的隐藏状态表示。然后,我们通过主成分分析(PCA)将这些嵌入投影到低维空间,并使用核密度估计(KDE)估计其密度分布。KDE 输出的负对数似然作为熵的度量,捕捉了推理步骤间运动的分散程度。应用配对双样本 t 检验来评估统计显著性(p < 0.05)。这种测量使我们能够表征幻觉是鼓励更收敛的推理轨迹(较低的熵)还是多样化推理路径(较高的熵),这取决于任务结构。 输出级。为了分析幻觉的语义效应,我们估计在幻觉(H)条件下字幕嵌入的熵,并比较正确预测和错误预测之间的差异。对于每个数据集,我们收集幻觉字幕(CH)的 OpenCLIP 嵌入。通过将实例数量匹配,将预测和黄金标签与这些嵌入对齐。

第 28 页

28 F. He 等

表 S5:标题熵分析(H 条件)。比较正确预测与错误预测之间的熵。数值显示每组的平均熵、它们的差异以及双侧 t 检验。显著结果(p < 0.05)已加粗。

数据集 正确 错误 ∆(C-W) t 统计量 p 值

AntiCP2 0.861 0.856 +0.005 0.32 0.749

BBBP 0.886 0.960 −0.074 −2.26 0.032

CodeXGLUE 0.901 0.897 +0.004 0.30 0.768

SARA_V3 1.030 1.004 +0.025 1.91 0.060

ProofWriter 0.975 0.998 −0.023 −1.14 0.262 GQA 1.150 1.048 +0.102 4.61 1.4×10−5

DexNet 0.977 0.899 +0.078 2.76 0.006

ISIC 0.923 0.823 +0.100 3.87 0.0012

PlantVillage 0.914 0.860 +0.054 3.05 0.0030

为了提高密度估计的稳定性和减少噪声,使用主成分分析(PCA)将嵌入投影到 3 维潜在空间中。这保留了主导方差方向,同时缓解了维度灾难。我们采用具有高斯核(带宽 = 0.5)的核密度估计(KDE)来近似潜在的语义分布。对于每个样本,我们计算 KDE 下的负对数似然,作为语义熵的代理。我们根据预测正确性将样本分为两组,并计算每组熵的平均值 ± 标准差。使用在不等方差假设下的双侧 t 检验来评估统计差异。此过程产生幻觉标题中语义多样性的稳健度量,使我们能够测试正确预测是否与比错误预测更高的熵相关。表 S5 总结了幻觉(H)输入下的标题熵,按正确与错误预测分类。我们发现正确预测通常与更高的熵一致,在四个多模态数据集(GQA, DexNet, ISIC, PlantVillage)上存在显著差异。这些结果证实,语义多样性是成功推理的可靠标志,而非数据集特定的伪影。

S9 收敛性和相似性分析的详细信息 链内收敛。为了进一步理解幻觉推理的内部动态,我们分析推理链中的中间步骤是否逐渐收敛到最终结论。具体而言,我们从幻觉标题中提取逐步推理轨迹,并使用 OpenCLIP(ViT-L/14,OpenAI 权重)计算语义嵌入。每个中间步骤

第 29 页

HIVE 29

表 S6:通用基准测试的性能提升。GPT-4o 在 MMStar 和 MMBench 上的结果。 数值报告了幻觉描述(hallucinated captions)相对于忠实描述(faithful captions)的准确率提升。

子集 MMStar MMBench

粗粒度百分比 +3.13 +5.77 细粒度百分比 +4.17 +0.38 实例推理 +6.25 +2.14 逻辑推理 +4.29 +4.44 平均值 +4.46 +3.18

通过余弦相似度与最终步骤进行比较,生成跨推理链平均的“步骤-最终”相似度曲线。随着推理链的推进,相似度持续增加,而方差带变窄,表明幻觉推理表现出稳定的链内收敛性。这表明中间步骤并未偏离,而是稳步与最终结论对齐。 链间收敛性。为了进一步评估推理轨迹的稳定性,我们计算了多个采样链之间的平均路径相似度。对于每个数据集,我们首先提取了幻觉(H)和非幻觉(NH)推理路径,然后使用 OpenCLIP(ViT-L/14,OpenAI 权重)对所有中间步骤进行嵌入。对不同运行之间的余弦相似度进行平均,得到整体路径级相似度分数。随后,我们比较了 H 和 NH 条件下平均相似度的分布。应用核密度估计(KDE)来可视化这些分布。结果表明,H 和 NH 路径均持续获得极高的相似度(均值 ≈0.97),且分布几乎重叠。这证实了幻觉并未损害链间稳定性,且多次推理路径在运行之间保持语义对齐。

S10 额外的鲁棒性实验

为了检验观察到的 PHR 效应是否仅限于我们原始的领域特定数据集,我们进一步在两个通用多模态基准测试 MMStar 和 MMBench 上评估了 GPT-4o。我们关注与本研究范围一致的感知和推理子集。如表 S6 所示,幻觉描述在所有评估的子集中均产生了方向一致的性能提升。

S11 许可证

数据集。本研究使用的所有数据集均为公开可用的基准测试。其许可条款如下:AntiCP2 依据 GPL-3.0 发布;BBBP 依据 MIT 许可证;CodeXGLUE 依据数据计算使用协议(C-UDA);SARA_V3 依据 CC BY 4.0;ProofWriter 依据 CC BY 4.0;GQA 标注依据 CC BY 4.0;Dex-Net 代码依据 BSD-3-Clause 许可证,而其 HDF5 数据库仅限用于研究(非商业)用途;

第 30 页

30 F. He 等

ISIC 在 CC BY-NC(非商业)许可下;PlantVillage 在 CC0 许可下。我们强调,我们对这些数据集的使用严格限于学术研究目的。 模型。本研究中使用的所有模型均为其各自提供商公开发布的 API 或检查点。具体而言,Qwen2.5-VL-3B 和 Qwen2.5-VL-72B 在 Qwen 研究许可下发布,而 Qwen2.5-VL-7B 和 Qwen2.5-VL-32B 采用 Apache 2.0 许可。对于商业 API 模型,包括 GPT-4o、GPT-3.5-turbo(OpenAI)、Claude 3 Sonnet(Anthropic)、Gemini 2.0 Flash(Google DeepMind)、O3(OpenAI)、DeepSeek-V3 和 DeepSeek-R1(DeepSeek)、Mistral Large(Mistral)以及 Qwen-VL(Alibaba),其使用受其提供商的服务条款和 API 协议约束。我们强调,根据这些模型的公开可用性和许可条款,我们对这些模型的使用严格限于学术研究目的。

S12 AI 披露

我们承认仅使用 GPT-5 进行语法检查。该模型用于纠正语法错误,同时确保文本的原始含义和意图保持不变。

发表评论