快速导读:核心缺口在于缺乏统一框架,能同时实现跨度检测、类型分类与解释生成。现有工作要么侧重检测,要么依赖人工标注,难以规模化应用。
多模态大语言模型(MLLMs)的幻觉问题一直是制约其可靠性的核心瓶颈。传统方法多停留在响应级别的二元检测,即判断回答是否包含幻觉,却忽视了幻觉的具体类型与成因。这种粗粒度处理导致后续修正缺乏针对性,难以实现精准纠错。
HalluScope提出了一种细粒度幻觉诊断框架,将检测、分类与解释生成统一为单一任务。通过构建大规模标注数据集HalluScope-30K,并设计多粒度联合奖励函数进行强化学习训练,该方法不仅提升了检测精度,更提供了可解释的诊断报告,为下游幻觉缓解提供了新路径。
英文题目:HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models
论文出处:arXiv 每日论文精选 · arXiv:2607.21105
原始论文:PDF / 论文页面
对应视频标题:MLLM幻觉诊断新范式:HalluScope如何实现细粒度纠错?|推荐指数:★★★★★
这篇论文解决什么问题?
当前MLLM幻觉研究存在明显的粒度缺失。以MHALO和HALODET为代表的基线方法,主要关注于识别幻觉存在的跨度(span),但未能区分幻觉是源于感知错误(如物体识别错误)还是推理错误(如逻辑矛盾)。这种‘黑盒’式的检测使得开发者无法针对性地优化模型的视觉编码器或推理模块。
此外,现有方法缺乏对幻觉成因的解释。即使检测到错误,模型也无法说明‘为什么’这是错的,导致自我修正(Self-Refine)或外部反馈(CRITIC)机制效率低下。缺乏因果解释的诊断,如同医生只告知‘有病’却不指出‘病灶’,限制了治疗的有效性。
因此,研究亟需一种能够同时定位错误位置、分类错误类型并生成解释的诊断工具。这不仅有助于提升评估的细粒度,更为构建闭环的幻觉缓解系统提供了必要的数据支撑。
核心创新
方法概览
核心缺口在于缺乏统一框架,能同时实现跨度检测、类型分类与解释生成。现有工作要么侧重检测,要么依赖人工标注,难以规模化应用。
- HalluScope-30K数据集构建:利用Gemini-3-Pro作为标注器,通过‘幻觉注入’(针对正确回答)和‘幻觉标注’(针对错误回答)两种策略,从8个源数据集生成近30,000个细粒度诊断样本。
- 统一诊断任务定义:将幻觉诊断定义为联合任务,模型需输出幻觉跨度、类型标签(基于MHALO的12类分类体系)以及解释文本。
- 多粒度联合奖励函数:在GRPO训练框架下,设计包含格式有效性、跨度检测F1和类型分类F1的联合奖励。通过调整权重,平衡检测精度与分类准确性。
- 模型架构:基于Qwen2.5-VL构建HalluScope-4B和8B模型,通过监督微调(SFT)初始化,再经由GRPO进行强化学习优化。
- 解释生成机制:模型在诊断过程中同步生成解释,说明幻觉产生的视觉或逻辑原因,并提供修正建议。
逐图理解论文
方法贡献

概述HalluScope框架:左侧为数据生成流程,通过注入和标注构建HalluScope-30K;右侧为训练流程,使用多粒度联合奖励优化模型。
核心结论

反馈实验结果图:横轴为反馈轮数,纵轴为准确性。对比不同诊断粒度(无诊断、仅检测、检测+分类)对模型准确性提升的影响,细粒度诊断效果最佳。
意义与局限

定性对比图:展示HalluScope-8B与Gemini-3-Pro在4个样本上的诊断结果。注意HalluScope能更精准地定位幻觉跨度并提供合理解释。
实验如何设计?
- 基准测试:在MHALO基准上评估跨度级检测性能,使用F1M和F1IoU指标。
- 分类基准:在自定义的733样本细粒度分类基准上评估类型分类性能,使用F1Macro和F1Micro。
- OOD泛化:在HalLoc Caption基准上测试模型对分布外数据的泛化能力。
- 反馈实验:将HalluScope的诊断结果作为反馈信号,迭代优化Qwen3-VL-8B和LLaVA-1.5-7B,评估4轮反馈后的准确性提升。
- 消融实验:分别移除检测奖励和分类奖励,分析其对整体性能的影响。
关键结果与论文证据
- 在MHALO基准上,HalluScope-8B取得64.03的F1M和57.57的F1IoU,优于Gemini-3-Flash(第7页)。
- 在自定义分类基准上,HalluScope-8B实现51.66的F1Macro和59.60的F1Micro,展现强大的类型区分能力(第7页)。
- 在HalLoc Caption OOD测试中,HalluScope-8B达到71.0%的端到端准确率,证明其泛化性(第7页)。
- 反馈实验显示,经过4轮诊断反馈,Qwen3-VL-8B的准确性从68.76%提升至81.17%,LLaVA-1.5-7B从33.02%提升至50.34%(第8页)。
- 在AMBER基准上,HalluScope反馈使LLaVA-1.5-7B的CHAIR分数从7.5降至4.2,Hal分数从33.3降至20.5(第8页)。
- 消融研究表明,移除分类奖励会显著降低检测性能,反之亦然,证明联合优化的必要性(第7-8页)。
阅读时需要注意
- 数据生成依赖闭源模型Gemini-3-Pro,可能引入标注偏差。
- 自定义分类基准与训练数据同源,泛化性评估需谨慎。
- 反馈实验中,HalluScope-8B与目标模型共享底座,可能存在性能高估风险。
关联工作
- MHALO提供了幻觉分类体系,但仅作为检测基准,未涉及解释生成。
- HALODET专注于token级检测,缺乏类型分类。
- CRITIC和Self-Refine依赖外部或内部反馈,但缺乏细粒度诊断支持。
- HalLoc作为独立OOD基准,验证了HalluScope的泛化能力。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
HalluScope:面向多模态大语言模型的细粒度幻觉诊断
金伟林 王明宇 李文博∗ 北京大学 北京大学 未来技术学院 中国北京 中国北京 中国北京
黄浩洋 吴一凡† 李颖† 未来技术学院 北京大学 北京大学 中国北京 中国北京 中国北京
黄刚 吴中海 北京大学 北京大学 中国北京 中国北京
摘要 尽管多模态大语言模型(MLLMs)在广泛的视觉-语言任务中取得了卓越性能,但它们仍受幻觉问题困扰,即模型输出与视觉内容、文本语境或常识知识不一致。现有研究主要通过粗粒度的幻觉检测来解决这一问题,然而这些方法往往缺乏对幻觉类型及支持下游幻觉缓解所需信息的充分诊断。为填补这一空白,我们提出了面向 MLLMs 的细粒度幻觉诊断这一新的统一任务,该任务联合执行幻觉检测、分类及可解释的解释生成。
我们开发了一套自动化数据生成流水线,并构建了 HalluScope-30K,这是一个涵盖八个来源和五个任务类别的大规模诊断数据集。基于该数据集,我们设计了一种多粒度联合奖励函数,并训练了两个诊断模型 HalluScope-4B 和 HalluScope-8B,它们在 MHALO 基准测试及我们提出的细粒度幻觉分类基准测试上均达到了最先进(SOTA)性能。值得注意的是,在联合优化下,检测与分类相互促进。此外,诊断驱动的反馈实验表明,我们模型生成的细粒度诊断解释能有效引导目标模型纠正其幻觉,在 Qwen3-VL-8B-Instruct 和 LLaVA-1.5-7B 上,完整诊断均显著优于所有基线方法。
1. 幻觉检测与分类 图片展示了 <Object>San Agustin Church</Object>,这是一座著名的历史地标。该建筑位于 <Knowledge_Error>Manila, Philippines</Knowledge_Error>,是一座 <Knowledge_Error>UNESCO World Heritage Site</Knowledge_Error>。其 <Color_Attribute>red brick</Color_Attribute> 建筑特色包括一座宏伟的楼梯,位于主立面 <Spatial_Relation>behind the main2026 facade</Spatial_Relation> 之后。该建筑及其周边环境具有 <Knowledge_Error>Victorian Gothic style</Knowledge_Error> 的特征。它位于哪里? 问题:马尼拉 2. 幻觉解释生成 回答:它不是圣保罗废墟世界遗产遗址。该建筑位于中国澳门。其建筑风格为巴洛克式,而非维多利亚哥特式,且楼梯位于立面之前而非之后。砖块并非红色,而是浅色石材。
对象 知识 颜色 空间 逻辑 图 1:细粒度幻觉诊断示例。[cs.CV] 给定图像-问题对和 MLLM 响应,HalluScope (1) 检测带有类型分类的幻觉跨度,并 (2) 生成带有纠正建议的解释。
CCS 概念 • 计算方法 → 计算机视觉问题 [9, 24]。
关键词 多模态大语言模型,幻觉诊断,强化学习,幻觉缓解 arXiv:2607.21105v1
1 引言 多模态大语言模型(MLLMs)[2, 14, 25, 55] 在广泛的视觉-语言任务中取得了强劲性能,包括图像理解 [6]、视觉问答 [1, 21] 和视觉推理 [33, 43]。尽管取得了这些进展,幻觉仍然是一个持续存在的挑战,模型输出与视觉内容、文本语境或常识知识不一致 [3, 26, 34]。此类错误损害了 MLLM 输出的可靠性,特别是在医疗、自动驾驶和科学分析等高利害场景中 [9, 24]。因此,识别和缓解幻觉已成为 MLLMs 的关键挑战。
现有研究主要通过粗粒度的检测或反馈来解决幻觉问题,通常将其表述为二分类问题 [7, 49, 53]。然而,此类方法仅确定响应是否包含幻觉,而未定位幻觉跨度、识别其类型或解释根本原因,从而为有效的幻觉分析和缓解提供了不足的诊断信息。为了解决这些局限性,最近的工作探索了细粒度幻觉检测(FHD)[4],它在令牌级别上定位响应中的幻觉跨度。相比之下
第 2 页
Conference’17, 2017年7月, 华盛顿特区, 美国 Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, 和 Zhonghai Wu
与粗粒度方法相比,FHD 为幻觉分析提供了更具信息量的信号,从而支持高质量的标注 [16, 49]、模型对齐 [12] 和反馈生成。尽管取得了这些进展,现有的 FHD 方法仍主要关注跨度级检测(Span-level Detection),而未进一步分析已识别幻觉的类型或成因。然而,不同类型的幻觉源于根本不同的失败机制 [31],需要不同的缓解策略。例如,物体识别错误等感知幻觉(Perceptual Hallucinations)通常可以通过重新审视图像来缓解,而涉及空间推理或复杂语义关系的推理幻觉(Reasoning Hallucinations)则需要更复杂的验证机制。细粒度幻觉分类可以揭示此类错误模式,从而实现针对性分析和更有效的缓解。除了分类之外,描述幻觉发生原因及纠正方法的解释性说明,可为下游纠正提供可操作的指导。因此,幻觉检测、分类和解释生成并非相互独立,而是相互促进的,这使得它们的联合优化对于全面诊断和有效缓解至关重要。受这些观察结果的启发,我们提出了面向多模态大语言模型(MLLMs)的细粒度幻觉诊断(Hallucination Diagnosis),该任务统一了幻觉检测、分类和可解释解释生成。为支持这一任务,我们开发了一套多模态幻觉诊断数据生成流水线,并构建了 HalluScope-30K,这是一个用于细粒度幻觉诊断的大规模数据集。基于该数据集,我们设计了一个多粒度联合奖励函数,以联合优化幻觉检测和分类,并训练了两个诊断模型:HalluScope-4B 和 HalluScope-8B。由于幻觉诊断本质上是一个多阶段任务,我们独立评估了每个阶段。在细粒度幻觉检测方面,我们在 MHALO 基准上评估了我们的模型。与代表性的 MLLMs 和专门的幻觉检测基线相比,我们的模型在多个子集上达到了最先进(SOTA)性能,平均 F1M 为 64.03,F1IoU 为 57.57。在幻觉分类方面,我们进一步构建了一个包含 733 个样本的细粒度基准,涵盖五个任务类别,包括通用感知、数学推理、OCR、空间推理和幻觉检测。在此基准上,我们的方法也达到了最先进性能,F1Macro 为 51.66,F1Micro 达到 59.60。在幻觉缓解方面,我们在两个目标模型上进行了诊断驱动的反馈实验。结果表明,提高诊断粒度逐步提升了缓解效果:在 Qwen3-VL-8B-Instruct 上,完整诊断将准确率从 68.76% 提升至 81.17%,在 LLaVA-1.5-7B 上从 33.02% 提升至 50.34%,显著优于仅检测和自校正基线。这些结果共同证实了检测、分类和解释是相互促进的:联合优化提升了各个单独阶段的效果,更丰富的诊断带来了更有效的缓解。我们的贡献如下:
• 我们提出了一项新任务,即面向 MLLMs 的细粒度幻觉诊断,该任务统一了幻觉检测、分类和可解释解释生成,并发现这三个阶段在联合优化下相互促进。 • 我们开发了一套自动化数据生成流水线,并构建了 HalluScope-30K,这是一个大规模数据集,为幻觉诊断提供了细粒度监督。 • 我们设计了一个多粒度联合奖励函数,使检测和分类在训练过程中相互受益,并训练了两个诊断模型:HalluScope-4B 和 HalluScope-8B。 • 我们构建了一个细粒度幻觉分类基准,并在 MHALO 基准和我们构建的基准上均取得了最先进性能。我们进一步证明,提高诊断粒度逐步改善了两个目标模型上的幻觉缓解效果。
2 相关工作
2.1 MLLMs 中的幻觉
多模态大语言模型(MLLMs)中的幻觉是指生成的内容与视觉输入、文本上下文或既定世界知识不一致 [8, 26],这引起了越来越多的关注。在 MLLMs 中,此类不一致通常归因于鼓励流畅但视觉无依据的续写的强语言先验,以及来自预训练数据的统计偏差,导致模型依赖虚假相关性 [23]。
2.2 MLLMs 的细粒度幻觉检测与缓解
近期关于 MLLMs 中幻觉的研究越来越多地从粗粒度的响应级判断转向细粒度分析,旨在为幻觉检测和缓解提供更精确的监督。早期的工作主要将模型输出分解为更小的文本或语义单元,如子句、句子或主张(claims)。例如,M-HalDetect [16] 执行子句级幻觉检测,Xiao 等人 [46] 在句子级别进行操作,而 Pelican [35] 通过主张分解和接地(grounding)在主张级别验证幻觉。更多最近的工作将细粒度幻觉检测和缓解推向令牌级(token-level)建模 [4, 10–12, 44, 57]。Whitehead 等人 [44] 将幻觉检测表述为序列标注问题,以直接在细粒度上定位幻觉内容。MHALO [4] 进一步训练了一个专用模型用于令牌级幻觉检测,并采用粗粒度类型分类,但未提供用于下游缓解的细粒度分类或诊断解释。此外,
第 3 页
HalluScope: 面向多模态大语言模型的细粒度幻觉诊断 Conference’17, July 2017, Washington, DC, USA
MetaToken [11]、TLDR [12] 和 ECD [10] 分别通过元分类、奖励建模和解码时概率估计,在生成过程中估算词元级别的幻觉可能性。与此同时,MTRE [57] 指出幻觉信号可能会在多个词元或语义层面上逐步显现。总体而言,细粒度幻觉信号正日益与下游缓解措施相结合。然而,现有方法主要解决跨度级定位问题,而幻觉分类仍较为粗糙,且缺乏诊断性解释,限制了检测输出的实际价值。
3 预备知识
3.1 幻觉诊断任务定义
我们将细粒度幻觉诊断构建为一个统一任务,涵盖幻觉检测、幻觉分类和可解释解释生成。给定由图像、文本查询和模型响应组成的多模态输入,该任务旨在定位响应中的幻觉跨度,将每个跨度分类为预定义的幻觉类型,并生成可解释的解释,描述幻觉产生的原因并建议可能的修正策略。
具体而言,对于幻觉检测,模型通过结构化 XML 标注识别并标记响应中的幻觉跨度。对于幻觉分类,我们采用 MHALO [4] 提出的分类体系,将幻觉分为感知和推理两个高层类别。感知级幻觉源于对图像视觉理解或信息提取的错误,而推理级幻觉则源于基于感知信息的错误推断或逻辑推理(包含 12 种细粒度类型的完整分类体系见附录)。对于解释生成,模型生成自然语言描述,解释每种幻觉发生的原因并建议如何修正。
给定统一数据集,我们使用基座模型(后训练前)为每个样本生成响应。由于原始标准答案通常简短且缺乏足够的细节以进行细粒度标注,我们重新生成长度更长、信息更丰富的响应,以提供用于幻觉诊断的更丰富上下文。
3.2 幻觉诊断形式化
数据构建符号:在数据生成流水线中,每个样本表示为 $x_k = (i_k, d_k, q_k, g_k, o_k, y^*_k)$,其中 $i_k$ 表示视觉输入,$d_k$ 表示数据集来源,$q_k$ 表示问题,$g_k$ 表示标准答案。给定 $(i_k, q_k)$,基座模型首先生成响应 $o_k \sim p_\theta(\cdot | i_k, q_k)$。根据 $o_k$ 与 $g_k$ 的一致性,响应进一步通过幻觉注入或幻觉标注进行处理,以生成最终的幻觉诊断响应 $y^*_k$。$y^*_k$ 中的每个诊断跨度被分配 $C$ 种预定义幻觉类型之一。
评估符号:为了评估幻觉诊断,我们将预测跨度集合记为 $P = \{p_i\}_{i=1}^n$,标准跨度集合记为 $G = \{g_j\}_{j=1}^m$,其中 $n$ 和 $m$ 分别表示预测和标准跨度的数量。每个跨度对应响应中的连续词元段,并由其起始和结束边界表示:
$p_i = [s_{p_i}, e_{p_i}], \quad g_j = [s_{g_j}, e_{g_j}]$
其中 $s_{p_i}$ 和 $e_{p_i}$ 表示第 $i$ 个预测跨度的起始和结束位置,$s_{g_j}$ 和 $e_{g_j}$ 表示第 $j$ 个标准跨度的起始和结束位置。相应地,跨度长度定义为:
$|p_i| = e_{p_i} – s_{p_i} + 1, \quad |g_j| = e_{g_j} – s_{g_j} + 1$
我们进一步使用 $T(p_i)$ 和 $T(g_j)$ 表示预测跨度 $p_i$ 和标准跨度 $g_j$ 中包含的词元集合。它们的词元重叠定义为:
$|T(p_i) \cap T(g_j)|$
这计算了两个跨度之间共享词元的数量。
4 方法
图 2 展示了 HalluScope 框架。该框架从五个任务类别的八个数据集出发,生成模型响应,并通过两种互补策略构建细粒度幻觉标签:针对正确回答样本的幻觉注入,以及针对错误回答样本的幻觉标注。经过多阶段质量控制后,该框架产生了包含近 30,000 个诊断样本的 HalluScope-30K 数据集。基于该数据集,我们设计了一个多粒度联合奖励函数,并训练了两个诊断模型:HalluScope-4B 和 HalluScope-8B。
4.1 数据生成流水线
4.1.1 数据收集。HalluScope 框架始于从五个任务类别中收集八个数据集:(1) 通用感知:MMBench [28] 和 MMStar [5];(2) 数学推理:Geo170K [13] 和 MathV360K [36];(3) 光学字符识别 (OCR):OCRBench [29];(4) 空间推理:RealWorldQA [45];以及 (5) 幻觉检测:M-HalDetect [16] 和 RLHF-V [49]。由于这些数据集在格式和标注上存在差异,我们首先进行标准化预处理:统一数据字段、去除重复项并过滤无效样本(例如缺失答案)。每个处理后的样本遵循第 3.2 节中定义的符号 $x_k$。
与依赖强大闭源模型扩展标准答案的方法不同,从基座模型的实际输出构建幻觉数据更好地保留了合成样本的真实性,因为它们反映了模型真实的幻觉行为,而非人工模拟的行为。这也提高了数据多样性,因为模型在不同任务和样本中表现出多变的幻觉模式。
4.1.2 幻觉标签生成。获得模型响应后,我们根据模型响应与标准答案的一致性对样本进行划分,以构建细粒度幻觉标签。对于正确回答的样本,我们采用闭源模型(Gemini-3-Pro)进行幻觉注入:分析原始响应并引入针对特定幻觉类型的定向修改,同时保持上下文连贯性。注入的幻觉在类型上保持多样性,并在上下文中保持自然,以确保对幻觉分类体系的广泛覆盖。对于错误回答的样本,我们采用相同的闭源模型进行幻觉标注:定位幻觉
第 4 页
Conference’17, 2017年7月, 华盛顿特区, 美国 Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, 和 Zhonghai Wu
HalluScope: 细粒度幻觉诊断框架
1 2 幻觉数据收集 标签生成 真实答案 是 幻觉注入 注入数据 通用数学 MMStar MathV360K 正确? 幻觉 已标注 MMBench Geo170K 否 标注数据 统一格式 基础模型 答案 幻觉 其他 RLHF-V OCRBench 3 4 M-HalDetect 真实世界QA 样本质量 后训练 1.监督微调 幻觉数据 问题:… 控制 答案:… 2.强化学习 选项:…. 格式规范化 标签 文本质量 幻觉一致性 规范化 评估 样本1: Q1 A1 验证 …… 样本2: Q1 A1 重复样本 移除 数据集 模型输出 1 输出 n GRPO 图像显示 <Object>圣奥古斯丁 问题:… 无效样本 教堂</Object>,著名的历史地标。 答案:(空) 过滤 奖励函数:此结构位于 <Knowledge_Error>, 菲律宾</Knowledge_Error>… 𝑹= 𝑹𝒇×( 𝟏−𝝀𝑹𝒅𝒆𝒕+ 𝝀𝑹𝒄𝒍𝒔)
图 2:HalluScope 数据生成流程和训练流程概览。
响应中的跨度并分配相应的类型标签。由于这些反馈生成。这一阶段作为后续强化学习的冷启动初始 这些响应已经包含由基础模型产生的真实幻觉,化:模型学习遵循所需的输出格式并获得初步的幻 因此,直接注释捕捉了真实的幻觉行为,而无需人工模觉检测和分类能力,减少了强化学习优化期间的无效 拟。通过结合这两种策略,我们保留了来自真实模型探索 [51]。 输出的幻觉样本,同时也从正确响应中合成新的幻觉 4.2.2 强化学习。在强化学习阶段,我们应用组相对策略优化(GRPO)[17] 以进一步优化 SFT 初始化的模型。对于每个样本 𝑥𝑘,策略生成 𝐾 个候选输出 {𝑦𝑘}𝐾𝑘=1,每个输出由多粒度奖励 𝑅(𝑦𝑘) 评分,该奖励共同评估格式合规性、跨度级检测质量和类型分类准确性。使用第 3.2 节中定义的符号,奖励公式为: 4.1.3 样本质量控制。最后,我们通过三阶段流程执行系统的质量控制:(1) 标签规范化,通过基于规则的映射(例如,大小写规范化和同义词解析)将非标准幻觉类型标签映射到 12 种标准幻觉类型集合;(2) 文本质量评估,使用 LLM-as-Judge 方法对清晰度、流畅性和连贯性进行评分,仅保留高于预定义阈值的样本;(3) 幻觉一致性验证,检查生成幻觉标签的格式正确性、类型有效性、语义合理性和上下文一致性。只有通过所有三个阶段的样本才会被包含在最终数据集中。 通过此流程,我们构建了 HalluScope-30K,包含近 30,000 个样本,涵盖五个任务类别和八个来源,每个样本都具有细粒度的幻觉诊断标签。数据集统计信息和质量控制标准见附录。
4.2 HalluScope 模型的训练 基于 HalluScope-30K,我们通过两阶段范式训练两个诊断模型:监督微调(第 4.2.1 节)后接强化学习(第 4.2.2 节)。
4.2.1 监督微调。在监督微调阶段,我们使用 HalluScope-30K 作为监督信号,通过 LoRA [18] 训练基础模型,使其能够生成统一的幻觉检测、分类和可解释诊断输出的结构化诊断输出。
格式奖励。𝐼format 是一个二元指示函数,仅当诊断输出满足所有预定义的格式约束时才等于 1。具体而言,整个结果必须包含在 <Tagged_Text> 标签内,每个幻觉跨度必须使用 <hallucination type="TYPE"> 标签进行注释。所有标签必须符合 XML 语法规则,且每个类型属性必须属于预定义的幻觉类型。这种门控机制确保只有结构上有效的输出才能获得正向诊断奖励,而前面的 SFT 阶段为格式合规性提供了热身启动。
幻觉检测奖励。幻觉检测奖励评估模型检测幻觉的能力,并作为整体奖励函数中最关键的组成部分。由于细粒度幻觉诊断任务要求模型不仅要识别所有幻觉,还要准确定位每个幻觉跨度,因此检测奖励被设计为共同考虑预测跨度的覆盖率和精确度。为此,我们定义了一个复合检测奖励为:
第 5 页
HalluScope: 面向多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月17日,美国华盛顿特区
原始的 $PM_R$ 仅考虑词元重叠,这可能会在相同词元出现在不同位置时产生错误的匹配。因此,我们引入位置一致性约束:仅当预测跨度与真实跨度在位置边界上重叠时,部分匹配才有效。改进后的 $PM_R$ 定义为:
$$ PM_R(g_j) = \begin{cases} 1, & \exists p_i \in P, p_i = g_j, \\ \frac{1}{|G|} \sum_{(i,j) \in \hat{M}} \frac{|T(p_i) \cap T(g_j)|}{|T(g_j)|}, & \exists p_i \in P, \max(s_{p_i}, s_{g_j}) \le \min(e_{p_i}, e_{g_j}), \\ 0, & \text{otherwise}. \end{cases} \quad (6) $$
其中 $\hat{M}$ 最大化所有匹配跨度对的总 IoU。如果多个 $p_i$ 与 $g_j$ 重叠,则选择得分最高者。基于精确率的分数 $PM_P$ 定义类似。总体召回率和精确率分别为 $Rec_M = \frac{1}{m} \sum_j PM_R(g_j)$ 和 $Prec_M = \frac{1}{n} \sum_i PM_P(p_i)$,$F1M$ 为它们的调和平均数。
Token-aware IoU Metric $F1IoU$。 虽然 $F1M$ 捕捉了跨度间的包含关系,但它并未量化内容级别的重叠。我们通过将词元内容一致性纳入 IoU 计算,改进了来自 MHALO 的 $F1IoU$ 指标。仅在存在位置重叠时计算 token-aware IoU:
$$ IoU_t(p_i, g_j) = \begin{cases} \frac{|T(p_i) \cap T(g_j)|}{|T(p_i) \cup T(g_j)|}, & \max(s_{p_i}, s_{g_j}) \le \min(e_{p_i}, e_{g_j}), \\ 0, & \text{otherwise}. \end{cases} \quad (7) $$
这种表述减少了当预测跨度和真实跨度几乎没有实际词元重叠时因边界重合导致的过高估计。仅当 $IoU_t(p_i, g_j) \ge \delta$ ($\delta=0.5$) 时匹配才有效。通过匈牙利算法 [22] 获得最优的一对一匹配:
$$ \hat{M} = \max_{M \in \mathcal{M}} \sum_{(i,j) \in M} \mathbb{1}[IoU_t(p_i, g_j) \ge \delta], \quad (8) $$
这种多粒度奖励设计为幻觉诊断提供了细粒度且稳定的优化信号。具体而言,格式奖励强制执行结构上有效的输出,检测奖励促进准确的幻觉跨度定位,分类奖励鼓励区分细粒度的幻觉类型。与仅基于最终匹配结果的奖励设计相比,这种分层公式联合优化了输出结构、跨度定位和类型分类,减少了奖励稀疏性并提高了训练稳定性。基于此训练策略,我们获得了两个幻觉诊断模型:HalluScope-4B 和 HalluScope-8B。
分类指标 $F1Macro$ 和 $F1Micro$。 这些指标评估 $C$ 个预定义幻觉类型上的幻觉分类。对于每种类型 $k$,我们根据预测类型是否与真实类型匹配来统计真阳性 ($TP_k$)、假阳性 ($FP_k$) 和假阴性 ($FN_k$) 的数量。$F1Macro$ 独立计算每种幻觉类型的 F1 分数,并对所有 $C$ 个类别取平均,无论频率如何均平等对待每种类型,从而更好地反映稀有和常见类型之间的平衡性能。$F1Micro$ 从全局聚合的 TP、FP 和 FN 计数中计算 F1,受频繁类别影响更大,反映整体分类准确率。形式化定义见附录。
5 实验 5.1 实验设置 5.1.1 评估指标。我们使用四个指标来评估幻觉诊断。对于细粒度幻觉检测,我们采用并改进了来自 MHALO [4] 的 $F1M$ 和 $F1IoU$,引入了位置一致性约束。对于幻觉分类,我们使用 $F1Macro$ 和 $F1Micro$ 分数。
部分匹配指标 $F1M$。 为了衡量预测跨度与真实跨度之间的匹配质量,我们采用了 Jafari 等人 [20] 提出的基于召回率的部分匹配分数 ($PM_R$)。然而,原始的 $PM_R$ 仅考虑词元重叠,这可能会在相同词元出现在不同位置时产生错误的匹配。因此,我们引入位置一致性约束:仅当预测跨度与真实跨度在位置边界上重叠时,部分匹配才有效。改进后的 $PM_R$ 定义为:
$$ r_{det}(y_k) = r_{content}(y_k) \cdot r_{count}(y_k) \quad (2) $$
其中 $r_{content}$ 衡量跨度匹配质量,$r_{count}$ 惩罚预测跨度数量的偏差。具体而言,$r_{content}$ 计算通过匈牙利算法匹配的最佳跨度对上的平均 IoU(遵循 5.1.1 节中的符号):
$$ r_{content}(y_k) = \frac{1}{|G|} \sum_{(i,j) \in \hat{M}} IoU(p_i, g_j) \quad (3) $$
计数奖励 $r_{count}$ 衡量预测和真实幻觉跨度数量之间的一致性。由于仅依赖内容匹配可能不足以惩罚产生过多或过少跨度的模型,我们引入高斯核平滑函数,当数量完全匹配时产生最大奖励 1,并随着差异增加而平滑衰减:
$$ r_{count}(y_k) = \exp \left( -\frac{(n-m)^2}{m} \right), \quad (4) $$
其中 $n=|P|$ 和 $m=|G|$ 分别表示预测和真实幻觉跨度的数量。
幻觉分类奖励。 在幻觉诊断任务中,幻觉分类建立在成功的幻觉检测之上。因此,在设计分类奖励时,我们仍以基于 IoU 的匹配结果为基础。在获得最佳匹配 $\hat{M}$ 后,我们进一步检查每个匹配对的幻觉类型标签是否一致,并相应地奖励分类结果。基于这一思想,分类奖励定义如下:
$$ r_{cls}(y_k) = \frac{1}{|G|} \sum_{(i,j) \in \hat{M}} \mathbb{1}[t_i = t_j] \quad (5) $$
其中 $\mathcal{M}$ 表示 $P$ 和 $G$ 之间所有双射匹配对的集合:
$$ \mathcal{M} = \{ M \subseteq P \times G \mid \forall (p_i, g_j), (p_i', g_j') \in M, i \neq i', j \neq j' \}. \quad (9) $$
最终得分为 $F1IoU = 2|\hat{M}|/(|P| + |G|)$,它平衡了预测集和真实集中正确匹配的跨度比例,通过要求充分的词元重叠而非部分包含,提供了比 $F1M$ 更严格的评估。
第 6 页
Conference’17, 2017年7月, 华盛顿特区, 美国 Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, 和 Zhonghai Wu
表 1:MHALO 基准测试结果。F1M 和 F1IoU 衡量跨度级幻觉检测的质量,IF 表示格式有效性比率。最佳结果以粗体突出显示,次佳结果以下划线标示。
RLHF-V (500) M-HalDetect (500) Geo170K (500) MathV360K (500) 平均
模型 F1M F1IoU IF F1M F1IoU IF F1M F1IoU IF F1M F1IoU IF F1M F1IoU IF
基线模型
Qwen3-VL-4B-Instruct 33.81 27.36 99.6 16.33 13.06 95.2 40.74 26.05 94.8 41.69 39.46 87.6 33.14 26.48 94.3 Qwen3-VL-8B-Instruct 40.30 34.62 99.6 18.61 13.69 99.0 37.40 24.46 86.8 51.12 48.93 89.0 36.86 30.43 93.6 Gemini-3-Flash 53.20 43.26 100.0 45.25 36.45 100.0 63.95 48.55 100.0 74.87 66.06 100.0 59.32 48.58 100.0 Gemini-3-Pro 50.71 40.68 100.0 48.37 41.61 100.0 63.14 46.96 100.0 72.20 62.13 100.0 58.61 47.84 100.0 GPT-4o 45.83 34.23 100.0 36.11 32.28 100.0 57.38 42.58 99.6 69.49 59.53 99.8 52.20 42.16 99.8 GPT-5 51.26 41.32 100.0 40.31 31.80 100.0 53.19 38.08 100.0 63.53 49.52 100.0 52.07 40.18 100.0 HALODET-4B† 35.43 28.66 100.0 27.41 24.66 99.4 44.34 34.58 80.2 73.82 68.82 97.6 45.25 39.18 94.3 HALODET-8B† 37.94 30.52 99.8 20.34 18.92 100.0 35.13 26.43 83.4 66.61 61.36 98.2 40.00 34.31 95.3
我们的模型
HalluScope-4B 54.63 43.66 100.0 44.36 39.36 100.0 68.37 64.14 99.0 77.77 73.11 99.4 61.28 55.07 99.6 HalluScope-8B 55.17 43.66 100.0 47.24 45.31 99.8 74.65 67.05 99.4 79.06 74.26 99.0 64.03 57.57 99.6 † 由于模型权重未公开,我们遵循原始论文的方法和数据重新训练 HALODET,使用与我们方法相同的基础模型。
表 2:我们幻觉分类基准的主要结果。F1M 和 F1IoU 评估跨度级检测,而 F1Macro 和 F1Micro 评估类型分类。最佳结果以粗体突出显示,次佳结果以下划线标示。
模型 F1M F1IoU F1Macro F1Micro
Qwen3-VL-4B-Instruct 44.03 36.91 27.55 35.27 Qwen3-VL-8B-Instruct 56.47 49.27 33.73 40.28 Gemini-3-Flash 67.33 60.45 44.44 47.87 Gemini-3-Pro 67.55 61.17 49.14 53.14 GPT-4o 61.67 55.30 40.10 48.12 GPT-5 62.70 55.21 43.93 43.54 HalluScope-4B 69.76 64.77 48.46 55.79 HalluScope-8B 72.20 67.69 51.66 59.60
5.1.2 基准测试。我们在细粒度幻觉诊断任务上评估我们的模型。由于该任务涉及多个阶段,我们在不同阶段分别评估模型性能。对于幻觉检测阶段,我们采用 MHALO 基准 [4] 进行评估。MHALO 是一个专为细粒度幻觉检测设计的基准,包含从四个公开子集抽取的 2,000 个样本:RLHF-V [49]、M-HalDetect [16]、Geo170K [13] 和 MathV360K [36]。我们在每个子集上评估每个模型的细粒度幻觉检测能力,并将结果与一系列代表性多模态大语言模型(MLLMs)以及专门的 HALODET 基线模型进行比较。尽管共享源数据集,但我们确保训练数据与 MHALO 测试集之间没有样本重叠。
对于幻觉分类阶段,由于目前尚无专门针对细粒度幻觉分类的公开基准,我们进一步构建了一个包含 733 个样本的基准。该基准由 MMBench [28]、MMStar [5]、OCRBench [29]、RealWorldQA [45]、Geo170K [13]、MathV360K [36]、M-HalDetect [16] 和 RLHF-V [49] 等数据集构建而成,旨在评估模型在包括一般感知、数学推理、OCR、空间推理和幻觉检测在内的多个任务类别中的性能。该基准的详细组成见附录。
5.1.3 基线模型。我们将我们的模型与几个强大的基线模型进行比较。由于 HalluScope-4B 和 HalluScope-8B 是分别通过对 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct [2] 进行后训练获得的,我们将这两个基础模型作为基本基线纳入比较。我们还将我们的模型与代表性 MLLMs 进行比较,包括 Gemini-3-Flash、Gemini-3-Pro [39]、GPT-4o [19] 和 GPT-5 [37]。我们还纳入了 HALODET-4B 和 HALODET-8B [4] 作为细粒度幻觉检测的专用基线。由于它们的模型权重未公开,我们遵循原始方法和数据重新训练这两个模型,使用与我们方法相同的基础模型。由于 HALODET 专为幻觉检测设计,不包含类型分类,因此未纳入分类基准评估。
5.1.4 实现细节。我们使用 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct 作为基础模型。监督微调(SFT)阶段训练 1 个 epoch,强化学习(RL)阶段训练 250 步,其中 𝜆= 0.3。所有超参数、硬件配置以及关于 𝜆 的消融实验均在附录中提供。
5.2 主要结果
本节展示了 HalluScope-4B 和 HalluScope-8B 的评估结果。表 1 和表 2 分别报告了模型在 MHALO 基准和我们幻觉分类基准上的性能。从这些结果中,我们强调以下发现:
第 7 页
HalluScope:面向多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月17日,美国华盛顿特区
Qwen3-VL-8B-Instruct (733个样本) LLaVA-1.5-7B (733个样本) 55 基线 基线 85 第1轮 第1轮 第2轮 50 第2轮 第3轮 第3轮 (%) 80 第4轮 (%) 第4轮 45
75 40 准确率 准确率
35 70 68.8% 33.0%
+Self-Refine +CRITIC-Det +CRITIC-Cls +HalluScope +Self-Refine +CRITIC-Det +CRITIC-Cls +HalluScope
图3:在两个目标模型上,不同诊断粒度下四轮反馈后的准确率(%)。
HalluScope-4B 和 HalluScope-8B 在 MHALO 基准测试中实现了表3:Hal- 最先进的性能。如表1所示,Loc Caption 基准测试(%)上的分布外分类结果。Det 表示检测覆盖率 两个 HalluScope 模型均在 MHALO 基准测试中取得了最先进的结果。和 E2E 表示端到端准确率(联合检测并正确分类)。最佳结果以粗体显示。 HalluScope-8B 获得了最高的平均 F1M 为 64.03,F1IoU 为 57.57,分别比最强的基线 Object Attribute Relationship Overall 模型 Gemini-3-Flash 高出 4.71 和 8.99 分。HalluScope-4B 也以平均 F1M 为 61.28 和 Model Det E2E Det E2E Det E2E Det E2E F1IoU 为 55.07 超越了所有基线模型。与专用基线 HALODET- 4B 和 HALODET-8B 相比,我们的模型显示出显著的改进, Qwen3-VL-8B-Instruct 65.1 64.6 42.1 24.3 14.6 5.4 44.2 35.2 GPT-5.5 85.4 84.4 73.2 56.0 64.2 31.5 75.7 60.9 表明我们的数据生成管道和多粒度 Gemini-3-Pro 81.5 81.1 68.4 50.3 51.9 46.5 69.4 61.3 奖励函数比原始的 HALODET 训练策略更有效。此外,两个模型均比其 HalluScope-8B 92.1 90.7 86.8 57.8 87.7 59.8 89.1 71.0 各自的基座模型(Qwen3-VL-4B/8B-Instruct)平均高出约 27 分,证实了我们后训练方法的有效性。值得注意的是,由于我们的训练数据由 Gemini-3-Pro 标注,人们可能会担心模型只是简单复制了 Gemini 的标注模式。然而,我们的模型在 MHALO 基准测试上持续优于 Gemini-3-Pro 这一事实,该基准测试是一个由我们管道构建的外部基准测试,表明我们的模型获得了超越标注来源的真实诊断能力。
我们的模型在幻觉分类基准测试中实现了最先进的性能。HalluScope-4B 和 HalluScope-8B 在所有四项评估指标上均优于所有基线模型。HalluScope-8B 取得了最佳结果,F1Macro Average 为 51.66,F1Micro 为 59.60,而 HalluScope-4B 也在 F1M、F1IoU 和 F1Micro 方面超越了最强的基线 Gemini-3-Pro。这些结果表明,我们的方法通过细粒度诊断数据与多粒度奖励优化的结合,有效提高了幻觉检测和类型分类的能力。
5.3 分布外泛化 由于我们的分类基准测试与训练集使用相同的数据生成管道,人们可能会质疑分类改进是否在该分布之外具有泛化能力。为了解决这一担忧,我们进一步在 HalLoc [32] 上进行评估,这是一个独立的细粒度幻觉分类基准测试,HalluScope 在训练期间从未见过。我们将我们的 12 种幻觉类型映射到 HalLoc 的三个类别(对象、属性、关系),并在 HalLoc Caption 基准测试(3,079 个样本)上使用两个跨度级指标进行评估:检测覆盖率(Det)和端到端准确率(E2E),其中 E2E 要求跨度既被正确检测又被正确分类。在所有模型中使用相同的提示,表3 显示 HalluScope-8B 在所有三个类别中均实现了最佳的 E2E 准确率,总体 E2E 达到 71.0,并优于 GPT-5.5(60.9)和 Gemini-3-Pro(61.3)。这证实了我们的模型获得了真实的细粒度分类能力,能够泛化到分布外数据,而不仅仅是拟合我们管道的标注模式。
第 8 页
Conference’17, 2017年7月, 美国华盛顿特区 Jin Weilin, Wang Mingyu, Li Wenbo, Huang Haoyang, Wu Yifan, Li Ying, Huang Gang, 和 Wu Zhonghai
表5:我们在基准测试(HalluScope-8B)上的消融实验: ours vs. 无检测模块的 ours 表6:在 AMBER 基准测试上,经过四轮迭代后,诊断驱动反馈的结果。最佳结果以粗体高亮显示。
| Subset | Method | Qwen3-VL-8B-Instruct F1Macro | Qwen3-VL-8B-Instruct F1Micro | LLaVA-1.5-7B CHAIR↓ | LLaVA-1.5-7B Cover↑ | LLaVA-1.5-7B Hal↓ | LLaVA-1.5-7B Cog↓ | | :— | :— | :— | :— | :— | :— | :— | :— | | MMBench | Ours | 59.16 | 68.97 | 7.5 | 73.7 | 54.2 | 2.7 | | MMStar | Ours w/o det. | 58.26 | 62.15 | 7.5 | 50.7 | 33.3 | 3.9 | | OCRBench | Baseline | 81.60 | 81.02 | 8.8 | 75.0 | 64.4 | 4.0 | | RealWorldQA | Self-Refine | 54.82 | 69.21 | 7.6 | 72.8 | 53.1 | 2.9 | | Geo170K | CRITIC-Det | 28.53 | 41.59 | 7.6 | 72.9 | 54.2 | 3.0 | | HalluScope | CRITIC-Cls | 7.4 | 73.4 | 52.9 | 2.7 | 4.2 | 50.8 | | MathV360K | HalluScope | 50.00 | 59.11 | 38.75 | 43.90 | 39.05 | 63.69 | | M-HalDetect | RLHF-V | 21.46 | 37.18 | 51.89 | 61.46 | 39.02 | 33.45 | | Average | | 51.66 | 59.60 | 38.17 | 40.54 | | |
通过标记幻觉跨度并生成结构化修正指令,而不进行类型分类; 5.4 消融实验 为了验证我们多粒度联合奖励函数的有效性,我们进行了消融实验,训练了两个变体模型:一个仅使用检测奖励 $r_{det}(y_k)$,另一个仅使用分类奖励 $r_{cls}(y_k)$。如表4所示,移除分类奖励导致在 MHALO 基准测试上的检测性能下降,平均 F1M 从 64.03 降至 61.28,F1IoU 从 57.57 降至 55.30。这表明分类目标提供了互补的监督信号,也有助于跨度级检测。如表5所示,移除检测奖励导致在我们的基准测试上分类性能出现更严重的退化,平均 F1Macro 从 51.66 降至 38.17,F1Micro 从 59.60 降至 40.54。这表明准确的跨度检测是有效类型分类的前提。这些结果证实,通过多粒度奖励函数联合优化检测和分类,比单独优化任一目标能取得更好的性能。
5.5 诊断驱动反馈实验 在评估了我们模型的性能后,一个自然的问题出现了:它提供了什么实际价值?最直接的答案是,它能够为错误答案提供诊断解释,从而启用目标模型的自我改进。为此,我们在两个模型上探索了诊断驱动的多轮反馈实验:Qwen3-VL-8B-Instruct 和 LLaVA-1.5-7B。我们在分类基准测试的 733 个样本上进行评估,其中每个目标模型首先生成初始响应;HalluScope-8B 随后分析该响应,识别幻觉跨度及其类型,并为目标模型提供解释以重新生成答案。此过程可迭代多轮。详细的实验设置见附录。
为了研究诊断粒度如何影响缓解效果,我们比较了四种反馈模式。Self-Refine [30] 作为纯自我纠正的基线,其中目标模型仅被告知之前的答案不正确,并被提示重试,没有任何外部诊断。基于 CRITIC [15] 的验证-纠正范式,我们设计了两种具有递增粒度的诊断驱动基线:CRITIC-Det 提供跨度级反馈,通过标记幻觉跨度并生成结构化修正指令,而不进行类型分类;CRITIC-Cls 进一步在跨度标记和修正指令中纳入类型注释(例如,Object, Calculation_Error),不仅告知目标模型哪里错了,还告知错误类型。最后,HalluScope 使用 HalluScope-8B 直接检测幻觉跨度,分类其类型,并生成可解释的解释,告知目标模型哪里错了、为什么错以及如何纠正。
如图3所示,增加诊断粒度在反馈轮次中一致地带来更大的准确率提升。在初始准确率为 68.76% 的 Qwen3-VL-8B-Instruct 上,HalluScope 在 4 轮后将准确率提升至 81.17%,显著优于 CRITIC-Cls 的 79.40%、CRITIC-Det 的 77.63% 和 Self-Refine 的 76.81%。在 LLaVA-1.5-7B 上也呈现出相同的趋势,HalluScope 从初始的 33.02% 提升至 50.34%。请注意,HalluScope-8B 与 Qwen3-VL-8B-Instruct 共享相同的基座模型,这可能会引入优势。为了控制这一混淆因素,我们还在使用不同架构和基座模型的 LLaVA-1.5-7B 上进行了额外评估。两种模型上一致的性能排序证实,外部诊断反馈对于可靠的自我纠正至关重要,并且增加诊断粒度可以逐步增强幻觉缓解效果,无论目标模型的架构如何。
为了进一步验证诊断驱动反馈在我们自己的基准测试之外具有泛化能力,我们还在 AMBER [40] 上进行了额外评估,这是一个独立的无 LLM 幻觉基准测试,包含 1,004 张图像。我们采用其基于规则的指标:CHAIR(对象幻觉率)、Cover(对象覆盖率)、Hal(句子级幻觉率)和 Cog(认知级幻觉率),并对相同的两个目标模型应用四轮迭代反馈。如表6所示,HalluScope 反馈在两个模型上一致地降低了幻觉,特别是在 LLaVA-1.5-7B 上将 CHAIR 从 7.5 降至 4.2,将 Hal 从 33.3 降至 20.5,同时保持或提高了对象覆盖率。相比之下,Self-Refine 甚至可能增加幻觉(在 Qwen3-VL-8B-Instruct 上 Hal 从 54.2 升至 64.4),这是由于无引导的重新生成所致。这些结果证实,我们的细粒度诊断反馈泛化到了外部基准测试,并可靠地提高了生成质量,而较粗糙或无诊断的基线提供的效果有限,甚至产生负面影响。
第 9 页
HalluScope:面向多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月17日,美国华盛顿特区
分类:对象知识错误 | 颜色属性 | 空间关系 | 逻辑错误 | 数字属性 | 形状属性 | 计算错误
Q:有多少顶厨师帽? Ground Truth:图片中有六顶厨师帽。 HalluScope 8B:图片中有六顶厨师帽。 Gemini-3-pro:图片中有一位穿着蓝色衬衫站在大伞下的男子。他右手拿着伞,抬头望向天空。周围散落着几把较小的伞…… F1!: 1.0 | F1!: 0.0 | F1!: 0.75
Q:这张照片是关于什么的? Ground Truth:人行道上的两个交通灯亮着绿灯,指示蓝色公交车应左转。 HalluScope 8B:人行道上的两个交通灯亮着绿灯,指示蓝色公交车应左转。 Gemini-3-pro:人行道上的两个交通灯亮着绿灯,指示蓝色公交车应左转。 F1!: 0.97 | F1!: 0.62
Q:如果角A加角C等于110度,角B的度数是多少? Ground Truth:因为四边形ABCD是梯形,角A + 角C = 110°,因此角A = 角C = 65°。AD不平行于BC,因此角A + 角B不等于180°,而是170°。因此,角B = 170° – 65° = 105°。 HalluScope 8B:因为四边形ABCD是梯形,角A + 角C = 110°,因此角A = 角C = 65°。AD不平行于BC,因此角A + 角B不等于180°,而是170°。因此,角B = 170° – 65° = 105°。 Gemini-3-pro:因为四边形ABCD是梯形,角A + 角C = 110°,因此角A = 角C = 65°。AD不平行于BC,因此角A + 角B不等于180°,而是170°。因此,角B = 170° – 65° = 105°。 F1!: 0.47 | F1!: 0.81 | F1!: 0.57
RLHF-V | M-HalDetect | RealWorldQA | Geo170K
图4:HalluScope-8B与Gemini-3-Pro在四个代表性样本上的定性比较。彩色跨度表示带有类型特定注释的检测到的幻觉。每个预测均显示F1M分数。
5.6 案例研究 图4展示了HalluScope-8B与Gemini-3-Pro在不同数据集和幻觉类型上的四个代表性比较示例。在RLHF-V示例中,HalluScope-8B精确识别出数字幻觉“六”,并取得了完美的F1M分数1.0,而Gemini-3-Pro未能检测到任何幻觉(F1M: 0.0)。对于包含多种幻觉类型(对象、空间关系)的M-HalDetect样本,HalluScope-8B定位了大部分幻觉跨度,F1M为0.75,而Gemini-3-Pro仅达到0.47,且边界不够精确。RealWorldQA案例表明,HalluScope-8B能够准确检测现实场景中的细微感知错误(F1M: 0.97 vs. 0.62)。Geo170K示例涉及几何问题中的推理幻觉(逻辑错误、计算错误、知识错误),其中HalluScope-8B的F1M为0.81,而Gemini-3-Pro为0.57,展示了其在识别逻辑和计算错误方面更强的能力。这些案例表明,HalluScope-8B在感知和推理幻觉方面,始终能产生更准确的跨度级检测和更精确的类型分类。
6 结论 在本文中,我们引入了细粒度幻觉诊断这一统一任务,涵盖多模态大语言模型(MLLMs)的幻觉检测、分类及可解释解释生成。我们开发了一套自动化数据生成流水线,构建了HalluScope-30K,这是一个包含近30,000个诊断注释的大规模数据集,涵盖八个数据集和五个任务类别,并设计了一个多粒度联合奖励函数来训练两个诊断模型:HalluScope-4B和HalluScope-8B。尽管当前流水线依赖闭源模型进行幻觉注入和注释,我们计划在未来工作中用开源替代方案解决这一问题,但实验表明,我们的模型在MHALO检测基准上均取得了最先进的性能。
第 10 页
Conference’17, 2017年7月, 美国华盛顿特区 金伟林, 王明宇, 李文博, 黄浩然, 吴一凡, 李颖, 黄刚, 吴中海
通过视觉对比解码引用参考模型。在 IEEE/CVF [1] Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, 计算机视觉与模式识别会议论文集。13872–13882。 C Lawrence Zitnick, 和 Devi Parikh。2015。Vqa:视觉问答。在 [24] Chunyuan Li, Cliff Wong, Sheng Zhang, Naoto Usuyama, Haotian Liu, Jianwei IEEE 国际计算机视觉会议论文集。2425–2433。 Yang, Tristan Naumann, Hoifung Poon, 和 Jianfeng Gao。2023。Llava-med:在 [2] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, 一天内训练用于生物医学的大型语言-视觉助手。神经信息处理系统进展 Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等。2025。Qwen3-vl 第36卷 (2023), 28541–28564。 技术报告。arXiv 预印本 arXiv:2511.21631 (2025)。 [25] Junnan Li, Dongxu Li, Silvio Savarese, 和 Steven Hoi。2023。Blip-2:通过 [3] Zechen Bai, Pichao Wang, Tianjun Xiao, Tong He, Zongbo Han, Zheng Zhang, 冻结图像编码器和大型语言模型引导语言-图像预训练。在国际机器学习 和 Mike Zheng Shou。2024。多模态大型语言模型的幻觉: 会议上。PMLR, 19730–19742。 综述。arXiv 预印本 arXiv:2404.18930 (2024)。 [26] Hanchao Liu, Wenyuan Xue, Yifei Chen, Dapeng Chen, Xiutian Zhao, Ke Wang, [4] Yishuo Cai, Renjie Gu, Jiaxu Li, Xuancheng Huang, Junzhe Chen, Xiaotao Gu, 和 Liping Hou, Rongjun Li, 和 Wei Peng。2024。大型 Minlie Huang。2025。MHALO:评估 MLLM 作为细粒度幻觉 视觉-语言模型中的幻觉综述。arXiv 预印本 arXiv:2402.00253 (2024)。 检测器。在计算语言学发现:ACL 2025。 [27] Sheng Liu, Haotian Ye, 和 James Zou。2025。通过潜在空间引导减少大型 9197–9222。 视觉-语言模型中的幻觉。在第十三届国际 [5] Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, 学习表征会议。 Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, 等。2024。我们是否在 [28] Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo 评估大型视觉-语言模型的正确道路上?神经信息处理系统进展 Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, 等。2024。Mmbench: 第37卷 (2024), 27056–27087。 你的多模态模型是全才吗?。在欧洲计算机 [6] Xinlei Chen, Hao Fang, Tsung-Yi Lin, Ramakrishna Vedantam, Saurabh Gupta, 视觉会议上。Springer, 216–233。 Piotr Dollár, 和 C Lawrence Zitnick。2015。Microsoft coco 字幕:数据收集 [29] Yuliang Liu, Zhang Li, Mingxin Huang, Biao Yang, Wenwen Yu, Chunyuan Li, 和评估服务器。arXiv 预印本 arXiv:1504.00325 (2015)。 Xu-Cheng Yin, Cheng-Lin Liu, Lianwen Jin, 和 Xiang Bai。2024。Ocrbench:关于 [7] Xiang Chen, Chenxi Wang, Yida Xue, Ningyu Zhang, Xiaoyan Yang, Qiang Li, 大型多模态模型中 OCR 的隐藏奥秘。中国科学:信息科学 Yue Shen, Lei Liang, Jinjie Gu, 和 Huajun Chen。2024。多模态大型语言模型的 67卷, 12期 (2024), 220102。 统一幻觉检测。在第62届计算语言学协会年会论文集 [30] Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah (第1卷:长论文)。3235–3252。 Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, 等。 [8] Zhiyuan Chen, Yuecong Min, Jie Zhang, Bei Yan, Jiahao Wang, Xiaozhen Wang, 2023。自我改进:带自我反馈的迭代优化。神经信息处理系统进展 和 Shiguang Shan。2026。多模态幻觉评估与检测综述。国际计算机视觉 第36卷 (2023), 46534–46594。 杂志 134卷, 3期 (2026), 131。 [31] Abhika Mishra, Akari Asai, Vidhisha Balachandran, Yizhong Wang, Graham [9] Yun-Wei Chu, Kai Zhang, Christopher Malon, 和 Martin Renqiang Min。2025。 Neubig, Yulia Tsvetkov, 和 Hannaneh Hajishirzi。2024。语言模型的细粒度幻觉 使用视觉检索增强生成减少医疗多模态大型语言模型的幻觉。arXiv 预印本 检测和编辑。arXiv 预印本 arXiv:2401.06855 arXiv:2502.15040 (2025)。 (2024)。 [10] Laura Fieback, Nishilkumar Balar, Jakob Spiegelberg, 和 Hanno Gottschalk。 [32] Eunkyu Park, Minyeong Kim, 和 Gunhee Kim。2025。Halloc:视觉语言模型中 2025。使用概率幻觉检测进行高效对比解码——缓解大型视觉语言模型 幻觉的令牌级定位。在 IEEE/CVF 计算机视觉与模式识别会议论文集。 中的幻觉。arXiv 预印本 29893–29903。 arXiv:2504.12137 (2025)。 [33] Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, [11] Laura Fieback, Jakob Spiegelberg, 和 Hanno Gottschalk。2024。Metatoken: 和 Furu Wei。2023。Kosmos-2:将多模态大型语言模型锚定到 通过元分类检测图像描述中的幻觉。arXiv 预印本 世界。arXiv 预印本 arXiv:2306.14824 (2023)。 arXiv:2405.19186 (2024)。 [34] Pranab Sahoo, Prabhash Meharia, Akash Ghosh, Sriparna Saha, Vinija Jain, 和 [12] Deqing Fu, Tong Xiao, Rui Wang, Wang Zhu, Pengchuan Zhang, Guan Pang, Aman Chadha。2024。大型语言、图像、视频和音频基础模型中 Robin Jia, 和 Lawrence Chen。2024。Tldr:用于大型视觉语言模型的令牌级 幻觉的全面综述。计算语言学发现:EMNLP 2024 (2024), 11709–11724。 侦探奖励模型。arXiv 预印本 arXiv:2410.04734 (2024)。 [35] Pritish Sahu, Karan Sikka, 和 Ajay Divakaran。2024。Pelican:通过声明分解 [13] Jiahui Gao, Renjie Pi, Jipeng Zhang, Jiacheng Ye, Wanjun Zhong, Yufei Wang, 和思维链验证纠正视觉-LLM 中的幻觉。在2024年自然语言处理 Lanqing Hong, Jianhua Han, Hang Xu, Zhenguo Li, 等。2023。G-llava:解决 实证方法会议论文集。8228–8248。 多模态大型语言模型的几何问题。arXiv 预印本 [36] Wenhao Shi, Zhiqiang Hu, Yi Bin, Junhua Liu, Yang Yang, See Kiong Ng, Lidong arXiv:2312.11370 (2023)。 Bing, 和 Roy Ka-Wei Lee。2024。Math-llava:为多模态大型语言模型引导数学推理。 [14] Team Glm, Aohan Zeng, Bin Xu, Bowen Wang, Chenhui Zhang, Da Yin, Dan Bing, 在计算语言学发现:EMNLP 2024。4663–4680。 Zhang, Diego Rojas, Guanyu Feng, Hanlin Zhao, 等。2024。Chatglm:来自 [37] Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed glm-130b 到 glm-4 的大型语言模型家族,所有工具。arXiv 预印本 El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, 等。 arXiv:2406.12793 (2024)。 2025。Openai gpt-5 系统卡片。arXiv 预印本 arXiv:2601.03267 (2025)。 [15] Zhibin Gou, Zhihong Shao, Yeyun Gong, Yelong Shen, Yujiu Yang, Nan Duan, [38] Zhiqing Sun, Sheng Shen, Shengcao Cao, Haotian Liu, Chunyuan Li, Yikang 和 Weizhu Chen。2023。Critic:大型语言模型可以通过工具交互批判进行自我 Shen, Chuang Gan, Liangyan Gui, Yu-Xiong Wang, Yiming Yang, 等。2024。 纠正。arXiv 预印本 arXiv:2305.11738 (2023)。 使用事实增强强化学习对齐大型多模态模型。在计算语言学发现:ACL 2024。 [16] Anisha Gunjal, Jihan Yin, 和 Erhan Bas。2024。检测和防止大型视觉语言模型 13088–13110。 中的幻觉。在 AAAI 人工智能会议论文集,第38卷。18135–18143。
[17] Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, [39] Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, 等。2025。DeepSeek-R1 通过强化学习激发大语言模型中的推理能力。Nature 645, 8081 等。2023。Gemini:一系列高度多模态模型家族。arXiv 预印本 (2025), 633–638。arXiv:2312.11805 (2023)。 [18] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean [40] Junyang Wang, Yuhang Wang, Guohai Xu, Jing Zhang, Yukai Gu, Haitao Jia, Wang, Liang Wang, Weizhu Chen, 等。2022。Lora:大语言模型的低秩适应。Iclr 1, 2 (2022), 3。Jiaqi Wang, Haiyang Xu, Ming Yan, Ji Zhang, 等。2023。Amber:一个无 LLM 的多维基准,用于多模态大语言模型幻觉评估。arXiv 预印本 [19] Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, arXiv:2311.07397 (2023)。 Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, 等。2024。Gpt-4o 系统卡片。arXiv 预印本 arXiv:2410.21276 (2024)。 [41] Junyang Wang, Yiyang Zhou, Guohai Xu, Pengcheng Shi, Chenlin Zhao, Haiyang [20] Nazanin Jafari, James Allan, and Sheikh Muhammad Sarwar. 2024. 针对隐性有害内容的目标跨度检测。在 2024 ACM SIGIR Xu, Qinghao Ye, Ming Yan, Ji Zhang, Jihua Zhu, 等。2023。大视觉语言模型中幻觉的评估与分析。arXiv 预印本 arXiv:2308.15126 信息检索理论国际会议论文集。117–122。 (2023)。 [21] Jiayi Kuang, Ying Shen, Jingyou Xie, Haohao Luo, Zhe Xu, Ronghao Li, Yinghui [42] Xintong Wang, Jingheng Pan, Liang Ding, and Chris Biemann. 2024. 通过指令对比解码减轻大视觉语言模型中的幻觉。在 Li, Xianfeng Cheng, Xika Lin, and Yu Han. 2025。多模态大语言模型在视觉问答中的自然语言理解与推理:一项综述。Comput. Surveys 15840–15853。 57, 8 (2025), 1–36。 [43] Yiqi Wang, Wentao Chen, Xiaotian Han, Xudong Lin, Haiteng Zhao, Yongfei Liu, [22] Harold W Kuhn. 1955。匈牙利算法用于指派问题。Naval research logistics quarterly 2, 1-2 (1955), 83–97。 Bohan Zhai, Jianbo Yuan, Quanzeng You, and Hongxia Yang. 2024。探索多模态大语言模型 (mllms) 的推理能力:多模态推理新兴趋势的综合综述。arXiv 预印本 [23] Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, arXiv:2401.06805 (2024)。 and Lidong Bing. 2024。减轻大视觉语言模型中的对象幻觉。
第 11 页
HalluScope:面向多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月17日,美国华盛顿特区
[44] Spencer Whitehead, Jacob Phillips, 和 Sean Hendryx。2024。使用受损的接地数据预训练多模态幻觉检测器。arXiv 预印本 arXiv:2409.00238 (2024)。 [45] xAI。2024。Grok-1.5V:使用 Grok 进行多模态理解。https://x.ai/blog/grok-1.5v [46] Wenyi Xiao, Ziwei Huang, Leilei Gan, Wanggui He, Haoyuan Li, Zhelun Yu, Fangxun Shu, Hao Jiang, 和 Linchao Zhu。2025。通过细粒度 AI 反馈检测和缓解大型视觉语言模型中的幻觉。在《AAAI 人工智能会议论文集》第 39 卷中。25543–25551。 [47] Le Yang, Ziwei Zheng, Boxu Chen, Zhengyu Zhao, Chenhao Lin, 和 Chao Shen。2025。Nullu:通过 Halluspace 投影缓解大型视觉语言模型中的对象幻觉。在《计算机视觉与模式识别会议论文集》中。14635–14645。 [48] Shukang Yin, Chaoyou Fu, Sirui Zhao, Tong Xu, Hao Wang, Dianbo Sui, Yunhang Shen, Ke Li, Xing Sun, 和 Enhong Chen。2024。Woodpecker:多模态大语言模型的幻觉校正。《中国科学:信息科学》67, 12 (2024), 220105。 [49] Tianyu Yu, Yuan Yao, Haoye Zhang, Taiwen He, Yifeng Han, Ganqu Cui, Jinyi Hu, Zhiyuan Liu, Hai-Tao Zheng, Maosong Sun 等人。2024。RLHF-V:通过来自细粒度校正人类反馈的行为对齐实现可信多模态大语言模型。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中。13807–13816。 [50] Bohan Zhai, Shijia Yang, Chenfeng Xu, Sheng Shen, Kurt Keutzer, Chunyuan Li, 和 Manling Li。2023。HallE-Control:控制大型多模态模型中的对象幻觉。arXiv 预印本 arXiv:2310.01779 (2023)。 [51] Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, 和 Lidong Bing。2025。OpenMMReasoner:通过开放且通用的配方推动多模态推理的前沿。arXiv:2511.16334 [cs.AI] https://arxiv.org/abs/2511.16334 [52] Ruiyang Zhang, Hu Zhang, 和 Zhedong Zheng。2024。VL-Uncertainty:通过不确定性估计检测大型视觉语言模型中的幻觉。arXiv 预印本 arXiv:2411.11919 (2024)。 [53] Yudong Zhang, Ruobing Xie, Xingwu Sun, Yiqing Huang, Jiansheng Chen, Zhanhui Kang, Di Wang, 和 Yu Wang。2025。DHCP:通过跨模态注意力模式检测大型视觉语言模型中的幻觉。在《第 33 届 ACM 国际多媒体会议论文集》中。3555–3564。 [54] Zhiyuan Zhao, Bin Wang, Linke Ouyang, Xiaoyi Dong, Jiaqi Wang, 和 Conghui He。2023。超越幻觉:通过幻觉感知的直接偏好优化增强 LVLMS。arXiv 预印本 arXiv:2311.16839 (2023)。 [55] Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, 和 Mohamed Elhoseiny。2023。MiniGPT-4:通过先进的大型语言模型增强视觉语言理解。arXiv 预印本 arXiv:2304.10592 (2023)。 [56] Lanyun Zhu, Deyi Ji, Tianrun Chen, Peng Xu, Jieping Ye, 和 Jun Liu。2025。IBD:通过图像偏差解码缓解大型视觉语言模型中的幻觉。在《计算机视觉与模式识别会议论文集》中。1624–1633。 [57] Geigh Zollicoffer, Minh Vu, 和 Manish Bhattarai。2025。MTRE:用于 VLM 中幻觉检测的多令牌可靠性估计。arXiv 预印本 arXiv:2505.11741 (2025)。
第 12 页
会议’17,2017年7月,美国华盛顿特区 金伟林,王明宇,李文博,黄浩洋,吴一凡,李颖,黄刚,吴中海
A 数据集详情 (2) 子集采样。对于大规模数据集(MathV360K 和 Geo170K),我们使用随机采样的子集以维持任务类别间的A.1 数据集构成 平衡组成。 表 7 总结了 HalluScope-30K 的构成。该数据集被分为 (3) 去重。我们根据问题、选项和答案的拼接构建去重键, 29,747 个样本的训练集和 733 个样本的测试集。两个集合均覆盖并移除重复条目,仅保留首次出现的条目。 了来自五个任务类别的八个源数据集,确保测试集评估了所有 幻觉类型。这八个源数据集是: 预处理完成后,所有样本进入幻觉标签 生成流水线。经过多阶段质量控制后(附录 C),得到最终的 • MMBench [28]:一个多学科视觉理解基准,涵盖感知、推理和知识,横跨多 种语言。 • MMStar [5]:一个精心策划的多模态基准,强调 抵抗纯文本捷径的视觉关键问题。 如正文所述,HalluScope 采用两种互补的标签生成策略,基于模型回答的正确性:对正确回答的样本进行幻觉注入,对错误回答的样本进行幻觉标注。表 8 • MathV360K [36]:一个大规模数学视觉问答集合,涵盖 24 个子领域,包括几何、代数和 统计。 • Geo170K [13]:一个专注于几何的数据集,包含来自 Geo3K 和 GeoQA+ 的基于图表的 推理问题。 • OCRBench [29]:一个 OCR 评估基准,涵盖文本 识别、场景文本理解和文档分析。 • RealWorldQA [45]:现实世界空间理解问题, 需要推理物体的位置、方向和 环境。 • M-HalDetect [16]:一个带有 COCO 图像的图像描述和 VQA 数据集,最初是为多模态幻觉 检测而设计的。 • RLHF-V [49]:一个带有偏好标注的视觉问答数据集;我们将选定的答案作为地面真值。
表 8:按任务类别划分的幻觉注入(正确回答)与标注(错误回答)的比例。 任务类别 注入 标注 注入比例 通用感知 6,806 1,640 80.6% 数学推理 10,072 5,156 66.1% OCR 848 134 86.4% 空间推理 494 236 67.7% 幻觉检测 0 12,118 0.0%
总计 18,220 19,284 48.6%
表 7:按源数据集和任务类别划分的 HalluScope-30K 构成。 任务类别 源数据集 训练 测试 总计 通用感知 MMBench 5,372 113 5,485 MMStar 726 58 784 数学推理 MathV360K 6,371 123 6,494 Geo170K 3,899 123 4,022 OCR OCRBench 735 44 779 空间推理 RealWorldQA 526 42 568 幻觉检测 M-HalDetect 7,385 114 7,499 RLHF-V 4,733 116 4,849 总计 29,747 733 30,480
该比例在不同任务类别间差异显著。OCR 和 通用感知数据集表现出较高的注入率,分别为 86.4% 和 80.6%,因为基础模型 Qwen3-VL-8B-Instruct 正确回答了这些问题的绝大多数。数学推理 由于模型在几何和数学问题上的准确率较低,注入率为 66.1%。幻觉检测 数据集,即 M-HalDetect 和 RLHF-V,完全通过 标注路径处理,因为这些数据集提供了预先存在的 模型响应,其中已经包含幻觉。
A.3 注入与标注比例
A.4 幻觉类型分布 图 5 说明了训练集和测试集中幻觉类型的分布。每个样本可能包含多种类型的多个幻觉跨度,因此跨度计数超过样本总数。 该分布表现出显著的类别不平衡。Object 是最常见的类型,占所有训练跨度的 26.2%,而 Query_Misunderstanding 严重不足,仅有 373 个训练跨度(0.27%)和 7 个测试跨度。这种不平衡直接解释了模型在这些罕见类型上的低性能(例如 Query_Misunderstanding)。平均而言,每个样本在训练集和测试集中都包含 4.6 个幻觉跨度。
A.5 基准构建 幻觉分类基准由 733 个样本组成,这些样本来自与训练分割相同的数据生成流水线,
第 13 页
HalluScope:多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月17日,美国华盛顿特区
30 训练 26.2 测试 25 23.8
(%) 20 18.7
15 13.2 10.0 10.2 10.8 9.8 9.4 9.4 9.0 比例 10 7.6 6.5 6.0 5.3 5.1 4.6 5 3.9 3.4 3.0 2.0 1.7 0 对象 OCR 数值 颜色 形状 空间 数值 空间 逻辑 计算 知识 查询 属性 属性 属性 属性 关系 关系 错误 错误 错误 误解
图 5:训练集(29,747 个样本,137,283 个跨度)和测试集(733 个样本,3,375 个跨度)中每种幻觉类型的比例。
标注员 A 标注员 B 标注员 C B 幻觉分类法 100 我们采用 MHALO [4] 提出的幻觉分类法, 标注员 A 100% 76% 74% 它将 12 种细粒度幻觉类型组织为两个高层 90 (%) 级类别:感知级和推理级。表 9 总结了所有 90 率 类型及其定义。 标注员 B 76% 100% 66% 80 感知级幻觉源于视觉理解或信息提取中的错误, 70 一致性 可以通过检查图像直接验证。它们被组织为两个子组: 标注员 C 74% 66% 100% • 内容错误:Object(对象),指误判对象的存在、缺失或类别;OCR,指误读可见文本、数字或符号。 图 6:在 100 个随机采样的测试样本上,三位标注员之间的成对一致性率。 • 属性错误:Numerical_Attribute(数值属性),指对单个实体的绝对数量或测量的错误;Color_Attribute(颜色属性),指对正确识别对象的颜色错误;Shape_Attribute(形状属性),指几何或结构形式的错误;Spatial_Attribute(空间属性),指对单个对象的位置、方向或距离的错误。
推理级幻觉源于错误的推理、计算或知识应用,需要超出直接视觉观察的认知处理。它们被组织为两个子组: • 关系错误:Numerical_Relation(数值关系),指多个实体之间错误的定量比较;Spatial_Relation(空间关系),指多个对象之间错误的空间排列。虽然关系错误可能涉及视觉内容,但它们需要对多个对象进行比较推理,而不是对单个元素的直接感知。 • 推理错误:Logical_Error(逻辑错误),指推理链条有缺陷或无效推理;Calculation_Error(计算错误),指算术或数学计算中的错误;Knowledge_Error(知识错误),指对外部知识或领域特定事实的错误应用;Query_Misunderstanding(查询误解),指回答了与所问不同的问题。
通过严格去重以确保两个拆分之间没有重叠。子集的组成如表 7 所示,涵盖所有任务类别。每个测试样本都经过与训练数据相同的质量控制流程,包括文本质量评估和幻觉一致性验证。
为了评估基准的标注质量,三位独立标注员各自评估了 100 个随机采样的测试实例,并判断幻觉标签(跨度边界和类型分配)是否正确。请注意,此标注任务需要联合验证跨度边界和来自 12 类细粒度分类法的幻觉类型,这比二元幻觉检测要困难得多。标注员 A 和 B 报告的准确率均为 80.0%,而标注员 C 报告的准确率为 76.0%。成对一致性率如图 6 所示,分别为 76.0%(A–B)、74.0%(A–C)和 66.0%(B–C)。较低的成对率主要反映了细粒度类型分配固有的主观性,而非跨度检测错误:标注员通常就某个跨度是否幻觉达成一致,但偶尔在分配的类型上存在分歧(例如,Numerical_Attribute 与 Calculation_Error)。在多数投票(至少两名标注员一致)下,准确率达到 86.0%,证实了基准标注的高质量。
第 14 页
Conference’17, 2017年7月,美国华盛顿特区 Jin Weilin, Wang Mingyu, Li Wenbo, Huang Haoyang, Wu Yifan, Li Ying, Huang Gang, Wu Zhonghai
表 9:用于幻觉诊断的幻觉类型及定义,采用自 MHALO [4] 的分类体系。中线以上的类型为感知级;中线以下的类型为推理级。
类型 定义
对象错误 在识别对象的存在、缺失或类别时的错误。
OCR 未能正确读取可见文本、数字或符号。 数值属性 识别单个对象或元素的绝对值时的错误。 颜色属性 对正确识别的对象或区域的颜色产生误判。 形状属性 描述对象的几何或结构形状时的错误。
空间属性 识别单个对象的位置、方向或距离时的错误。
数值关系 对对象或数值间的定量关系进行推理时的错误。 空间关系 对多个对象间的空间关系进行推理时的错误。
逻辑错误 由有缺陷的逻辑推理导致的错误结论。
计算错误 算术或数学计算中的失误。 知识错误 错误使用外部知识、常识或领域规则。
查询误解 因误解查询意图或约束而产生的回复。
C 质量控制 细节方面:(1) 每个标记的幻觉在语义上是否 plausible 作为真实的 MLLM 错误,以及 (2) 注入幻觉后周围文本是否保持连贯。此外,应用基于规则的检查以确保格式正确性(XML 标签闭合正确,无嵌套)和类型有效性(每个类型属性属于预定义的 12 种类型集合)。任何这些检查未通过的样本都将从最终数据集中移除。
C.1 标签规范化 标签规范化阶段将非标准幻觉类型标签映射到标准化的 12 种类型集合。该流程应用超过 80 种基于规则的映射,包括大小写规范化(例如,“object” → “Object”)、复数转单数转换(例如,“Calculation_Errors” → “Calculation_Error”)、空格分隔和 CamelCase 变体的格式统一,以及语义同义词映射(例如,“Entity” → “Object”,“Factual_Error” → “Knowledge_Error”)。如果没有规则匹配,则尝试通过去除下划线、空格和连字符后比较标签来进行模糊匹配。包含无法映射标签(例如,“Unknown”,“None”)的样本将被完全丢弃。
C.2 文本质量评估 我们使用 LLM-as-Judge 来评估每个生成样本的文本质量。评判者从三个维度以 1-5 分进行评分: • 清晰度 (1-5):回复是否易于理解,语言无歧义,思想表达清晰。 • 流畅度 (1-5):回复是否读起来自然,语法、用词和句子流畅度是否恰当。 • 连贯性 (1-5):回复是否在整个过程中保持逻辑一致性,思想之间过渡平滑且无矛盾。 只有当样本在所有三个维度上的得分均 ≥4 时,才通过质量评估。在任何维度上得分低于阈值的样本都将从数据集中移除。
C.3 幻觉一致性验证 在标签规范化和文本质量评估之后,我们使用 LLM-as-Judge 来验证生成幻觉标签的一致性。具体而言,对于每个样本,评判者模型会获得原始图像、问题、真实答案以及带有幻觉标注的回复,并被要求评估两个
D 实现细节 D.1 训练超参数 所有实验均在四台服务器上进行,包括两台配备 2 块 NVIDIA H20Z GPU (144 GB) 的服务器和两台配备 2 块 NVIDIA B20Z GPU (180 GB) 的服务器。我们使用 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct 作为基础模型。 SFT 阶段。我们应用秩为 $r=8$、$\alpha=16$ 的 LoRA 微调,针对所有线性层,并冻结视觉塔。训练运行 1 个 epoch,学习率为 $5 \times 10^{-5}$,批次大小为 8,最大序列长度为 4096。SFT 完成后,LoRA 适配器合并到基础模型中。 RL 阶段。我们应用 GRPO,组大小 $K=5$,并进行全参数训练(无 LoRA),视觉塔不冻结。学习率为 $1 \times 10^{-6}$,全局批次大小为 32,训练运行 250 步。KL 系数为 0.01,奖励权重 $\lambda$ 设置为 0.3。最大提示长度为 4096,最大回复长度为 2048。在训练 rollout 期间,温度为 1.0,top-$p$ 为 1.0;在验证期间,温度为 0.6,top-$p$ 为 0.95。我们使用带有 CPU 卸载的 FSDP 和 vLLM 进行 rollout 生成。RL 框架基于 EasyR1(构建于 veRL 之上)。
D.2 缓解实验设置 我们提供缓解实验的更多细节。反馈前的初始准确率对于 Qwen3-VL-8B-Instruct 为 68.76% (504/733),对于 LLaVA-1.5-7B 为 33.02% (242/733)。所有模型均使用贪婪解码(温度 = 0),最大生
第 15 页
HalluScope:多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月, 华盛顿特区, 美国
(a) 子集级 F1Macro (b) 子集级 F1Micro (c) 类型级 F1
MMB. MMB. 对象
查询 OCR 误解
80 80 80 RLHF-V MMS. RLHF-V MMS.
60 60 60 知识 数值 错误 属性
40 40 40
20 20 20
M-Hal. OCR. M-Hal. OCR. 错误 计算. 颜色属性
逻辑 形状 错误 属性
数学 RWQA 数学 RWQA
空间 空间 关系 属性 地理 地理 数值关系
Qwen3-VL-4B Qwen3-VL-8B GPT-4o GPT-5 Gemini-3-Flash Gemini-3-Pro HalluScope-8B
图 7:在我们的幻觉分类基准上的子集级和类型级分类结果。(a) 子集级 F1Macro。(b) 子集级 F1Micro。(c) 12 种幻觉类型上的类型级 F1。
表 10:𝜆 对检测和分类性能的影响。每个指标的最佳结果已加粗。 表 11:乘法与加法检测奖励组成。每个指标的最佳结果已加粗。
MHALO 分类 MHALO 分类 𝜆 组成 平均 F1M 平均 F1IoU F1M F1Macro F1Micro 平均 F1M 平均 F1IoU F1M F1Macro F1Micro 0.1 61.97 56.65 72.48 49.74 58.54 乘法 64.03 57.57 72.20 51.66 59.60 0.3 64.03 57.57 72.20 51.66 59.60 加法 62.70 57.36 71.13 51.99 59.46 0.5 62.88 56.98 71.14 52.53 59.55 0.7 64.92 59.10 70.70 51.87 58.88
在 OCRBench 上(F1Macro=81.6 对比 Gemini-3-Flash 的 57.3)和 M- 长度为 2048 个 token。对于自由形式问题,正确性由 HalDetect(F1Micro=63.7 对比 Gemini-3-Pro 的 46.5),表明 Gemini-3-Pro 裁判通过语义等价性确定;对于多选题,提取选项字母并直接比较。 我们的模型在 OCR 相关和开放式幻觉分类方面表现尤为出色。Geo170K 仍然是所有模型最具挑战性的 所有四种模式的反馈提示模板见附录 H.3。 子集(F1Micro < 42),反映了在几何问题上进行细粒度类型分类的难度。 类型级分析。HalluScope-8B 在 12 种幻觉类型中的 7 种上取得了最佳 F1。 E 评估指标 最大的提升出现在推理级类型上:Numerical_Relation(56.1 对比 Gemini-3-Pro 的 38.0),Logi- F1Macro: 𝐶 cal_Error(59.5 对比 41.6),以及 Spatial_Relation(56.5 对比 51.6)。一个显 1 ∑︁ 2𝑇𝑃𝑘 . (10) 著的弱点是 Calculation_Error(F1=15.8),其中 GPT-5 达到 F1Macro = 𝐶 2𝑇𝑃𝑘+ 𝐹𝑃𝑘+ 𝐹𝑁𝑘 63.7,表明数值计算验证更受益于更大模型的更强推理能力。 𝑘=1 该指标对类别频率不敏感,能更好地反映幻觉类型间的平衡性能。 Query_Misunderstanding 在 HalluScope-8B 和 Gemini-3-Pro 上均得分为 F1=0.0, F1Micro: 与其在数据集中的极端稀缺性一致(仅 7 个测试跨度,见附录 A.4)。 2 Í𝐶𝑘=1𝑇𝑃𝑘 . (11) F1Micro = 2 Í𝐶𝑘=1𝑇𝑃𝑘+ Í𝐶𝑘=1 𝐹𝑃𝑘+ Í𝐶𝑘=1 𝐹𝑁𝑘 F.1 解释质量评估 F1Micro 是从全局聚合统计量计算的,受频繁类别的影响更大。 F 额外实验结果 图 7 展示了我们在幻觉分类基准上的子集级和类型级分类结果。 除了检测和分类,HalluScope 还生成自然语言解释,描述幻觉发生的原因 子集级分析。HalluScope-8B 在所有八个子集上取得了最高的 F1Micro。 以及如何纠正。为了直接评估这些解释的质量,我们从分类基准中随机抽取 50 个诊断案例,并邀请三位独立标注员对每个解释在三个维度上进行 1-5 分的评分: 因果准确性 (CA),解释是否正确识别了幻觉的原因;纠正有用性 (CU),
第 16 页
Conference’17, 2017年7月, 华盛顿特区, 美国 Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, 和 Zhonghai Wu
是否提供可操作的修正指导;以及视觉定位(Visual Grounding, VG),即推理是否基于图像证据。如表12所示,解释的平均得分为3.89,其中视觉定位得分较高(4.61),表明诊断推理很好地植根于视觉输入。注释者间一致性(单点内的成对一致性)在CA上达到70.7%,在CU上达到82.0%,在VG上达到86.0%,表明这三个维度具有良好的一致性。这些结果直接验证了HalluScope诊断解释的质量。
表12:对50个随机采样的诊断案例的解释质量人工评估。CA:因果准确性;CU:修正有用性;VG:视觉定位。
注释者 CA↑ CU↑ VG↑ Avg↑
注释者 #1 3.90 3.62 4.42 3.98 注释者 #2 3.40 3.28 4.46 3.71 注释者 #3 3.72 3.24 4.96 3.97
平均值 3.67 3.38 4.61 3.89
G 额外消融实验 G.1 奖励权重敏感性 (𝜆) 如正文所述,强化学习阶段优化一个多粒度联合奖励,该奖励结合了跨度级检测奖励 𝑟det(𝑦𝑘) 和类型级分类奖励 𝑟cls(𝑦𝑘)。超参数 𝜆控制这两个目标的相对重要性。较高的 𝜆将更多的训练信号分配给正确的类型分类,而较低的 𝜆则优先考虑准确的跨度检测。多粒度联合奖励公式化为: 𝑅(𝑦𝑘) = Iformat ((1 −𝜆) 𝑟det(𝑦𝑘) + 𝜆𝑟cls(𝑦𝑘)) (12)
我们在 𝜆∈{0.1, 0.3, 0.5, 0.7} 下训练模型,并在表10中报告了MHALO基准和我们自己的幻觉分类基准上的结果。 增加 𝜆将更多的训练信号分配给类型分类。如表10所示,𝜆= 0.7 实现了最高的MHALO检测得分,Avg F1M=64.92 且 Avg F1IoU=59.10,这可能是因为分类奖励 𝑟cls 也通过类型匹配的IoU隐式鼓励了准确的跨度检测。然而,它在我们的幻觉分类基准上将性能降低至 F1M=70.70。相反,𝜆= 0.1 使 F1M 最大化至 72.48,但MHALO检测最弱,为 61.97,且 F1Macro 最低,为 49.74。我们选择 𝜆= 0.3 作为默认值,因为它在保持三个指标(F1M=72.20, F1Macro=51.66 和 F1Micro=59.60)上强大的分类性能的同时,实现了具有竞争力的MHALO检测(64.03),提供了最佳的整体平衡。
G.2 检测奖励组成:乘法与加法 我们比较了检测奖励的两种组成模式:乘法形式 𝑟det = 𝑟content × 𝑟count 和加法形式 𝑟det = 0.5 · 𝑟content + 0.5 · 𝑟count。表11总结了结果。乘法形式在大多数指标上优于加法变体,在MHALO检测方面具有显著优势,其中 F1M 达到 64.03,而加法形式为 62.70。这符合预期,因为乘法组合要求内容匹配和计数准确性同时保持高水平,从而提供更强的训练信号, discourages partial matches( discourages 部分匹配)。
H 提示模板 H.1 数据生成提示 我们的数据生成管道使用四个提示驱动阶段:阶段1生成模型答案并判断正确性,阶段2通过注入或注释应用幻觉标签生成,阶段3评估语言质量,阶段4验证幻觉一致性。完整提示如下。
阶段1a:模型答案生成 你是一位专家级的视觉问答助手。 问题:{question} 1. 说明:逐步分析图像并自然地思考。 2. 展示你的推理过程和分析。 3. 确保你的推理逻辑连贯且具有教育意义。 4. 最后,以提供的正确答案结束 –重要提示:在推理和分析中要彻底 – 考虑问题中的所有相关信息 – 你的推理过程应自然且富有指导性,并引导至正确答案 请提供你的推理和答案。
阶段1b:答案正确性判断 确定模型的答案与真实答案相比在语义上是否正确。 – 对于数值答案:需要完全匹配 – 对于描述性答案:语义等价即可 问题:{question} 真实答案:{ground_truth} 模型答案:{model_answer} 说明:考虑: 1. 核心含义/结果应完全相同 2. 数值答案应完全匹配 3. 对于多项选择题,所选选项应匹配 仅使用以下之一进行回复:“CORRECT” 或 “INCORRECT”
第 17 页
HalluScope:多模态大语言模型的细粒度幻觉诊断 Conference’17, 2017年7月,美国华盛顿特区
阶段 2a:幻觉注入(针对正确样本) 阶段 3:质量评估
你是将幻觉注入视觉问答数据的专家。你是语言质量评估专家。你的任务是评估生成的 任务:将 3–5 种不同类型的幻觉注入给定的正确模型答案,以创建视觉问答 (VQA) 任务 答案的合理性。每个幻觉标签应覆盖一个自然的语义单元——重要提示:答案包含格式为 <hallucination 的合理但不正确的响应。当可能时,使用短短语(1–3 个词),但较长的跨度在错误是 type="TYPE">内容</hallucination> 的幻觉标签中。评估质量时,你应忽略 连贯短语时是可以接受的。 幻觉标签内的实际内容(因为它代表故意注入的错误)。 幻觉类型:[12 种类型,含定义和边界规则] 仅关注评估整体文本结构、流畅性和连贯性。 数据集类别:{dataset_category} 从三个维度进行评估: 优先类型(使用 2–3 种):{primary_types} 1. 清晰度 (1–5):答案是否易于理解?句子结构是否良好? 次要类型(使用 1–2 种):{secondary_types} 2. 流畅性 (1–5):语言是否自然且语法正确?文本是否流畅? 注入策略:应用以下一种或多种策略来自然地注入幻觉 3. 连贯性 (1–5):答案结构是否合理?文本在 (1) 实体替换:用相似但不正确的实体替换正确实体。 格式和流程方面是否内部一致? (2) 对象属性修改:保持对象不变,更改属性。 输入: (3) 对象关系修改:更改多个对象之间的关系。 – 问题:{question} (4) 数值扰动:修改数值。 – 答案:{answer} (5) 精确到模糊转换:用误导性的模糊表达替换精确信息。 指令: (6) 知识替换:用看似合理但不正确的信息替换正确的领域知识。 1. 根据上述三个维度分析答案。 (7) 推理链中断:修改或打破逻辑推理流程。 2. 忽略幻觉标签内内容的 factual correctness(事实正确性)——这些是故意 (8) OCR 特定错误:引入文本/数字识别错误。 错误的。 (9) 空间位置扰动:修改空间描述。 3. 评估整体文本的语言质量、结构和可读性。 (10) 查询意图重定向:回答一个不同但相关的问题。 4. 为每个维度分配 1 到 5 的分数。 (11) 比较关系反转:反转比较关系。 5. 简要说明你的评分理由。 (12) 多步计算错误:在多步计算的特定步骤中引入错误。 6. 确定样本是 PASS(通过)还是 FAIL(失败)。PASS 标准:所有分数 ≥4。 (13) 上下文归因错误:在多对象场景中,将属性或动作分配给错误的实体。 输出:<analysis>…</analysis>, <scores> 清晰度/流畅性/连贯性:[1–5] </scores>, 输入: <decision> PASS 或 FAIL 及理由 </decision>。 – 问题:{question} – 真实答案:{ground_truth} – 模型答案(正确):{model_answer} 要求: 1. 注入 3–5 种不同类型的幻觉。标签总数可以超过 5 个。允许的幻觉类型: 2. 使用格式:<hallucination type="TYPE">幻觉内容</hallucination>。 基于感知:对象、OCR、数值属性、颜色属性、形状属性、空间属性。 3. 标签不得嵌套或重叠。相邻且类型相同的标签必须合并。 基于推理:逻辑错误、计算错误、知识错误、查询误解、 相邻且类型不同的标签是允许的。 数值关系、空间关系。 4. 使幻觉合理且自然。 验证四个方面: 5. 每个标签应覆盖一个自然的语义单元——单个词、短短语(2–3 个词)或 1. 语法:标签格式是否正确?(开闭标签匹配,type 属性 中等短语(4–5 个词)。 存在。) 6. 保持标签插入后的文本一致性。 2. 类型正确性:type 属性是否为上述 12 种允许类型之一? 7. 多样化幻觉类型;不要全程使用单一类型。 3. 内容逻辑:与作为真实答案的原始答案相比,标签内的内容是否确实代表幻觉(错误)? 8. 变化标签长度;混合单字和短短语标签。 4. 上下文:周围文本是否流畅自然? 9. 仅当相邻的幻觉词属于同一类型时才合并它们。 输入: 输出:带有所有幻觉标签的完整修改后答案。 – 问题:{question} – 原始答案(真实答案):{original_answer} 阶段 2b:幻觉标注(针对错误样本) 指令: 1. 将幻觉答案与原始答案进行比较。 你是识别和标注视觉问答响应中幻觉的专家。 2. 检查目标答案中的每个幻觉标签。 任务:模型给出了一个不正确的答案。识别并标注幻觉部分。 3. 验证标记内容是否与原始答案矛盾,或引入与其类型一致的错误。 幻觉类型:[与阶段 2a 相同的 12 种类型] 4. 验证未标记部分是否与原始答案一致(除非它们被 数据集类别:{dataset_category} 修改以支持幻觉)。 关注这些类型:{primary_types} 输出格式: 输入: <analysis> 对标签及其与原始答案相比的逻辑正确性的分析。 – 问题:{question} </analysis> – 真实答案:{ground_truth} <validation> Syntax_Valid: [Yes/No], Types_Valid: [Yes/No], Logic_Valid: [Yes/No] – 模型答案(不正确):{model_answer} </validation> 要求: <decision> Result: [PASS/FAIL]. Reason: [简要理由。如果 FAIL,请指定导致问题的标签或原因] </decision> 1. 识别与真实答案不同的部分。 2. 使用格式:<hallucination type="TYPE">幻觉内容</hallucination>。 3. 标签不得嵌套或重叠。相邻且类型相同的标签必须合并。 相邻且类型不同的标签是允许的。 4. 每个标签应覆盖一个自然的语义单元——单个词、短短语(2–3 个词)或 中等短语(4–5 个词)。不要过度拆分。 5. 保持标签插入后的文本一致性。 6. 多样化幻觉类型;不要全程使用单一类型。 7. 变化标签长度;混合单字和短短语标签。 8. 仅当相邻的幻觉词属于同一类型时才合并它们。 输出:带有幻觉标注的模型答案。
H.2 评估提示 HalluScope-4B/8B 在推理时使用以下三部分提示进行幻觉 诊断。系统提示定义了 12 种幻觉类型及其描述,并指定了严格的 输出格式,要求标记文本包裹在 <Tagged_Text> 定界符中。 用户提示提供要分析的图片、问题和模型响应。
第 18 页
Conference’17, 2017年7月, 华盛顿特区, 美国 Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, 和 Zhonghai Wu
系统提示词类型分类;CRITIC-Cls 进一步将类型注释纳入跨度标记和修正指令中;并且 HalluScope 使用 HalluScope-8B 生成可解释的解释,告知目标模型哪里错了、为什么错以及如何修正。
系统提示词 你是一个仔细的视觉问答助手。你将获得带有幻觉注释标记的先前答案。请重新检查图像,考虑标记的幻觉,并提供修正后的答案。
自我修正 用户:你对此问题的先前答案不正确。请重试。 提示: 1. 仔细重新检查图像 2. 逐步思考你实际看到的内容 3. 提供修正后的答案 问题:{question} 现在请根据你在图像中实际观察到的内容提供修正后的答案。
重要输出格式要求: 1. 以确切这一行开始:“Here is the response with hallucinated content tagged:” 2. 然后使用 <Tagged_Text> 标签包裹标记后的响应 3. 在 <Tagged_Text> 标签内: – 输出原始响应,仅添加 <hallucination type="TYPE"> 标签 – 不要修改或更改原始响应中的任何单词 – 仅在幻觉内容周围添加 <hallucination type="TYPE"> 标签 – 每个标签必须包含指定幻觉类别的 type 属性 – 如果没有幻觉,则按原样输出原始文本 </Tagged_Text> 4. 以 5. 不要添加任何其他文本、分析或解释 6. 任何其他格式都将被拒绝
示例输入: 给模型的提示:描述图像 模型的响应:那辆明亮的红色跑车停在湖边。
正确输出格式: Here is the response with hallucinated content tagged: <Tagged_Text> The <hallucination type="Color_Attribute">bright red</hallucination> <hallucination type="Object">sports</hallucination> car is <hallucination type="Spatial_Attribute">parked near a lake</hallucination>. </Tagged_Text>
错误输出(请勿这样做): – 在 “Here is the response with hallucinated content tagged:” 之前的任何文本 – 标题和 <Tagged_Text> 之间的任何文本 – </Tagged_Text> 之后的任何文本 – 任何解释性文本或分析 – 对原始文本的任何修改 – 除了 <hallucination type="TYPE"> 之外的任何额外格式或标签
记住: – 单独且具体地用类型标记每个幻觉 – 严格保持原始文本内容不变 – 使用上面列出的确切类型名称(带下划线) – 基于感知的类型(Object, OCR, Numerical_Attribute, Color_Attribute, Shape_Attribute, Spatial_Attribute):当错误可以直接从图像中验证时使用 – 基于推理的类型(Numerical_Relation, Spatial_Relation, Logical_Error, Calculation_Error, Knowledge_Error, Query_Misunderstanding):当错误涉及比较、推理或超出直接观察的推断时使用
用户提示词
<image> 这是给模型的提示: {question} 这是模型的响应: {answer} 请分析图像,并在模型的响应中为任何幻觉内容添加 <hallucination> 标签。记住要单独标记每个幻觉内容!
H.3 反馈提示词模板 所有四种反馈模式共享相同的系统提示词,仅在用户消息上有所不同。诊断粒度逐步增加:Self-Refine 仅告知目标模型其先前答案不正确,没有任何外部诊断;CRITIC-Det 通过标记带有结构化修正指令的幻觉跨度来提供检测级反馈,但没有