TruthLens:让LVLM自己说出幻觉——一个特殊token如何暴露模型的不诚实

快速导读:TruthLens微调LVLM的LM head,通过一个特殊token的对数概率来暴露每个目标token的真实性信号,无需辅助模型即可实现SOTA的幻觉检测。

大型视觉语言模型(LVLM)在图像描述和视觉问答中经常生成图像中不存在的物体,这种现象被称为目标幻觉(Object Hallucination)。现有的检测方法大多依赖辅助模型分析视觉-语言交互,或利用隐藏状态相似性、注意力权重等间接信号,但忽略了LLM内部表征中已经编码的置信度信息。TruthLens的核心发现是:LVLM的隐藏层特征空间中,真实目标token与幻觉目标token高度线性可分,但这种可分性在LM head的输出概率分布中大幅衰减,导致模型无法有效进行自我检测。

TruthLens提出了一种token级自评估真实性分数,通过微调LM head,让一个罕见特殊token的对数概率显式暴露每个目标token的真实性信号。训练时使用MSE损失将真实目标分数拉向1、幻觉目标分数拉向0,并施加KL散度约束以保持生成能力。推理时直接使用该分数进行幻觉检测,无需任何辅助模型,零额外计算开销。在MSCOCO和Object365上的实验表明,TruthLens在多个LVLM上均显著超越现有最强基线。

英文题目:TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.05616

原始论文:PDF / 论文页面

这篇论文解决什么问题?

目标幻觉是LVLM在实际部署中的核心可靠性问题。当模型描述一张图像时,它可能自信地提及不存在的物体,例如在一张只有猫和沙发的照片中声称看到了狗。这种错误在医疗报告生成、自动驾驶场景理解等高风险应用中可能造成严重后果。现有的幻觉检测方法大致分为三类:基于视觉-语言交互分析的方法(如GLSIM利用隐藏状态相似性、SVAR利用注意力权重)、基于输出概率的方法(如Internal Confidence使用最大目标token概率、NLL使用负对数似然)、以及需要辅助模型的方法。

TruthLens的研究动机来自一个关键观察:使用LDA(线性判别分析)对LVLM隐藏层特征进行可视化发现,真实目标token和幻觉目标token在隐藏层空间中高度可分,但LM head输出的logit空间或概率空间中,这种可分性大幅衰减。这意味着模型内部其实知道自己在胡说,但LM head这个翻译层丢失了关键的真实性信号。论文将这一现象称为LM head的失效,并以此作为方法设计的出发点。

这一发现与近期LLM可解释性研究的趋势一致:多项工作表明LLM的隐藏状态包含事实正确性信息,但这些信息不一定能传递到最终输出。TruthLens的独特之处在于,它不是去分析隐藏状态本身,而是直接修复LM head的信号传递路径,让模型能够自我评估每个生成token的真实性。

TruthLens借鉴了LASER通过特殊token对数概率量化完整解决方案推理奖励的思想,但将其从序列级别扩展到token级别。这一扩展使得幻觉检测可以精确到每个目标token,而非对整个回答做出整体判断,为后续的文本修正提供了更细粒度的信号。

核心创新

  • 揭示了LVLM中真实与幻觉目标token在隐藏层特征空间高度可分,但在LM head输出中该可分性大幅衰减的现象。
  • 提出token级自评估真实性分数,通过特殊token的对数概率显式暴露LM head中的真实性信号。
  • 仅需少量标注数据微调,无需辅助模型,推理零额外开销,且能跨数据集和更大标签空间泛化。

方法概览

TruthLens将罕见特殊token重新用作参考token。对于每个目标token位置,提取LM head分配给该特殊token的对数概率,减去预定义常数作为真实性分数。训练时使用MSE损失将真实目标分数拉向1、幻觉目标分数拉向0,并施加KL散度约束以保持生成能力。推理时直接使用该分数进行幻觉检测。

  • 核心公式:TruthLens将真实性分数定义为特殊token的对数概率减去一个预定义常数。对于每个目标token位置,模型在生成该token的同时,也计算LM head分配给一个罕见特殊token(如<|reserved_special_token_0|>)的对数概率。这个对数概率经过常数偏移后,直接作为该目标token的真实性分数。
  • 训练目标:使用MSE损失将真实性分数与二元标签对齐——真实目标token的分数被拉向1,幻觉目标token的分数被拉向0。同时施加KL散度约束,确保微调后的模型输出分布不偏离原始模型太远,从而保持生成能力。论文还引入了损失重加权策略,对幻觉样本给予更高权重以缓解类别不平衡。
  • 特殊token选择:论文实验了多种特殊token,包括<|reserved_special_token_0|>、<|endoftext|>等。结果表明,选择一个在预训练中极少被使用的token效果最佳,因为它的对数概率在微调前接近均匀分布,为真实性信号提供了干净的载体。
  • 多token目标处理:对于由多个子token组成的目标词,TruthLens在最后一个子token位置计算真实性分数。实验表明,最后一个子token通常包含最丰富的语义信息,在该位置监督效果最优。
  • 推理流程:推理时,模型正常生成文本,同时为每个目标token计算真实性分数。通过设定阈值,可以判断每个目标token是否为幻觉。整个过程不引入任何额外模型或计算步骤,与原始生成流程完全一致。
  • 训练数据:仅使用MSCOCO的4000张图像及其标注,每张图像通过LVLM生成描述,并根据标注确定每个目标token的真实/幻觉标签。这种轻量级的训练数据需求使得方法易于扩展到新的LVLM。
  • 与LASER的关系:LASER通过特殊token对数概率量化完整解决方案的推理奖励,TruthLens将其扩展到token级别,实现了更细粒度的真实性评估。这一扩展使得方法可以定位到具体的幻觉token,而非仅给出整体判断。
  • 与logit-based方法的区别:Internal Confidence等方法直接使用目标token自身的概率作为置信度,但TruthLens揭示了这些概率中真实性信号已经衰减。通过引入独立的特殊token作为信号载体,TruthLens绕开了这一衰减问题。

逐图理解论文

隐藏层知道真相,LM head却丢失了信号

隐藏层知道真相,LM head却丢失了信号
Fig. 3: Comparison of hallucination detection performance and LDA-based visualiza- tion on MSCOCO across different LVLM architectures.

图3对比了不同LVLM架构下隐藏层特征与LM head输出的LDA可分性。左侧柱状图显示TruthLens显著提升了检测性能,右侧LDA可视化展示了微调前后真实/幻觉token在特征空间中的分布变化。重点关注微调后LM head输出空间中两类token的分离程度。

一个特殊token如何暴露真实性

一个特殊token如何暴露真实性
Fig. 2: Overview of the proposed self-evaluation framework. The truthfulness score is formulated as the difference between the log-probability of a designated special token, predicted at the corresponding token position, and a constant. During training, an MSE loss aligns this score with binary rewards (1 for real, 0 for hallucinated). At inference, the score is directly leveraged for hallucination detection without auxiliary models.

图2是TruthLens框架的整体概览。左侧展示了标准LVLM生成流程,右侧展示了TruthLens如何通过特殊token的对数概率计算真实性分数。训练时MSE损失将分数与二元标签对齐,推理时直接使用分数进行检测。注意图中特殊token位置与目标token位置的对应关系。

实验验证:显著超越最强基线

实验验证:显著超越最强基线
Table 1: Performance comparison on MSCOCO and Objects365 benchmarks. The best results are in bold, and the second best are underlined.

表1展示了MSCOCO和Object365上的完整性能对比。TruthLens在5个LVLM上均超越所有基线方法,包括GLSIM、SVAR、Internal Confidence等。注意LLaVA-OneVision-1.5-8B在MSCOCO上AUROC达93.04的突出表现。

核心贡献与诚实局限

核心贡献与诚实局限
Fig. 5: Evolution of token separability.

图5展示了微调过程中token可分性的演化。随着训练进行,LM head输出空间中真实与幻觉token的LDA可分性逐步提升,直观验证了TruthLens确实修复了信号衰减问题。

实验如何设计?

  • 目标幻觉检测评估:在MSCOCO和Object365两个数据集上进行,涵盖LLaVA-OneVision-1.5-8B、Qwen2.5-VL-7B等5个主流LVLM。评估指标为AUROC和AUPR。
  • 目标属性幻觉检测评估:在CLEVR和SpatialMQA数据集上评估方法对属性幻觉(如颜色、空间关系错误)的检测能力。
  • 消融实验:在LLaVA-1.5-7B上系统验证MSE损失、损失重加权和KL散度约束各组件的贡献。
  • 特殊token分析:对比不同特殊token选择对检测性能的影响,验证罕见token的优势。
  • 通用能力保持:在VQAv2、POPE等13个通用基准上评估微调前后模型性能变化,确保方法不损害原始能力。
  • 超参数敏感性:分析训练步数、学习率等超参数对检测性能的影响,验证方法的鲁棒性。

关键结果与论文证据

  • 在MSCOCO上,LLaVA-OneVision-1.5-8B的AUROC达93.04,AUPR达98.93,比最强基线GLSIM提升16.10% AUROC(第10页)。
  • 在Object365上,LLaVA-OneVision-1.5-8B的AUROC达82.14,AUPR达88.31,比最强基线SVAR提升9.55% AUROC(第10页)。
  • 在SpatialMQA上,Qwen2.5-VL-7B的AUROC从64.84(Contextual Lens)提升至76.06,展示了方法在属性幻觉检测上的有效性(第10页)。
  • 消融实验表明,仅用预训练模型直接使用特殊token对数概率,AUROC仅34.80;加入MSE+KL后达89.02;再加重加权达90.57 AUROC,验证了各组件的必要性(第12页)。
  • 微调后LLaVA1.5-7B在13个通用基准上性能几乎不变,如VQAv2从75.59变为75.65,POPE从85.76变为85.67,证明KL散度约束有效保持了生成能力(第12页)。
  • 特殊token选择实验中,<|reserved_special_token_0|>表现最优,验证了罕见token作为信号载体的优势(第12页)。
  • 多token目标监督位置实验表明,在最后一个子token位置计算真实性分数效果最佳(第14页)。
  • token可分性演化分析显示,微调后LM head输出空间中的真实/幻觉token可分性显著提升,验证了方法确实修复了信号衰减问题(第14页)。

阅读时需要注意

  • 幻觉检测性能高度依赖微调后LVLM自身的能力;若基础模型在目标任务上表现差,token可分性弱,检测效果受限。
  • 训练仅使用MSCOCO的4000张图像,虽能泛化到Object365等数据集,但可能对分布外数据不够鲁棒。
  • KL散度约束对保持生成能力至关重要,移除会导致模型生成重复无意义文本,增加了训练复杂度。
  • 方法目前仅针对目标token级别的幻觉检测,对于更复杂的逻辑错误或上下文不一致性幻觉尚未涉及。

关联工作

  • LASER:借鉴其通过特殊token对数概率量化完整解决方案推理奖励的思想,TruthLens将其扩展到token级别,实现了更细粒度的真实性评估。
  • GLSIM:基于隐藏状态相似性的目标幻觉检测方法,是TruthLens在MSCOCO上的主要对比基线,TruthLens在AUROC上超越其16.10%。
  • SVAR:基于注意力权重的幻觉检测方法,TruthLens在Object365上显著超越它,AUROC提升9.55%。
  • Internal Confidence与NLL:利用输出概率进行检测的logit-based方法,TruthLens揭示了这些方法中真实性信号已衰减的根本问题,并在多个模型上表现更优。

发表评论