快速导读:提出内在接地签名(IGS)和验证器引导解码(VGD),在生成时定位并仅重写高风险的对象提及,从而在保持模型原有视觉理解和覆盖度的同时显著减少对象幻觉。
大型视觉语言模型(LVLMs)在图像描述和视觉问答中展现出强大能力,但一个长期困扰的问题是对象幻觉——模型会自信地描述图像中并不存在的物体。现有缓解方法大多在模型、分布或响应层面进行粗粒度干预,例如修改解码策略、重定向注意力或事后修正,这些方法往往以牺牲视觉理解深度、缩短响应长度或降低真实对象覆盖率为代价。
本文提出了一种全新的思路:不修改模型本身,而是在生成过程中对每个对象提及进行接地诊断,仅对识别为高风险的提及进行局部修正。核心贡献包括两个紧密耦合的部分:内在接地签名(IGS)和验证器引导解码(VGD)。IGS是从冻结LVLM的注意力中提取的分布式有符号模式,能够揭示对象提及是否缺乏视觉支撑;VGD则利用离线训练的稀疏逻辑回归验证器将IGS映射为接地风险分数,在解码时对高风险提及触发KV缓存回滚和局部重写。
英文题目:Hallucinations Leave a Grounding Signature: Verifier-Guided Decoding for Selective Object Correction
论文出处:arXiv 每日论文精选 · arXiv:2607.27823
原始论文:PDF / 论文页面
这篇论文解决什么问题?
对象幻觉问题在LVLM中普遍存在,其根源在于模型生成时过度依赖语言先验而非视觉证据。传统的输出置信度(如token概率)反映的是语言流畅性而非视觉接地程度,因此无法可靠区分幻觉对象和真实对象。
现有推理时干预方法可大致分为几类:视觉对比解码(VCD)通过对比原始和扭曲图像的输出分布来抑制幻觉;OPERA通过惩罚过度信任和回溯分配来修正;注意力重定向方法(如OWL)直接修改注意力分布。这些方法虽然有效,但都在较粗的粒度上操作——要么影响整个响应,要么修改全局解码策略,导致真实接地对象的覆盖率下降、描述变短或视觉理解受损。
一个关键的研究空白是:缺乏可靠的对象级接地诊断信号。如果能在生成每个对象提及时就判断它是否有视觉支撑,就可以实现精准干预——只修正幻觉对象,保留所有正确接地的内容。这需要一种既轻量又具有判别力的信号,而现有的标量注意力指标(如平均图像注意力)已被证明无法胜任这一任务。
本文的核心洞察是:幻觉对象和真实对象在注意力模式上存在系统性差异,但这种差异不是简单的标量差异,而是分布在多个注意力头和多个层中的有符号模式。作者将这种模式命名为内在接地签名(IGS),并通过因果干预实验证明其与视觉接地的因果关系。
核心创新
- 发现并定义了内在接地签名(IGS),一种分布式的有符号注意力模式,能在生成时揭示对象提及是否缺乏视觉支撑,解释了为何标量注意力线索会遗漏无支撑对象。
- 提出验证器引导解码(VGD),一种轻量级解码框架,将纠正范围与对象级接地风险绑定,仅对识别为高风险的提及进行局部回滚和重写,保持基础LVLM和已接受前缀不变。
- 通过单一阈值暴露幻觉-覆盖率权衡的显式前沿,而非隐藏操作点,支持跨数据集迁移而无需重新拟合验证器。
方法概览
VGD框架:1) 从冻结LVLM的注意力中构建每个对象提及的内在接地签名(IGS),即跨头、跨层的分布式有符号图像/汇点注意力模式;2) 离线训练一个L1稀疏逻辑回归验证器,将IGS映射为接地风险分数;3) 在线解码时,对低风险提及直接接受,对高风险提及则回滚KV缓存、抑制该对象及其同义词,并局部重新生成受影响部分。
- 内在接地签名(IGS)的构建:对于每个生成的对象提及,从冻结LVLM的所有注意力头和所有层中提取两个关键信号——该提及token对图像token的注意力权重和对BOS sink token的注意力权重。将两者相减得到有符号的分布式模式,即IGS。因果实验表明,当移除视觉证据时,注意力会系统性地从图像token转移到BOS sink,验证了IGS与视觉接地的因果关系。
- 验证器训练:使用CHAIR数据集自动标注的对象提及作为训练数据(幻觉vs真实),训练一个L1正则化的稀疏逻辑回归分类器。验证器以IGS为输入,输出每个提及的接地风险分数。L1正则化是关键设计选择,它迫使模型仅使用少数具有判别力的注意力头和层,提高了干预精度和跨架构泛化能力。
- 在线解码流程:在LVLM生成过程中,使用轻量级名词识别器检测每个新生成的对象提及。对该提及提取IGS并送入验证器获得风险分数。低于阈值的提及直接接受,高于阈值的提及触发干预。
- 局部回滚与重写:当检测到高风险提及时,VGD将KV缓存回滚到该提及开始之前的状态,将该对象及其同义词加入抑制列表,然后从回滚点重新生成受影响的部分。已接受的前缀完全保持不变,基础LVLM的参数也完全冻结。
- 阈值与操作点:VGD通过单一阈值参数控制干预强度。较低的阈值(如@rec70)更激进地抑制幻觉但可能影响覆盖率;较高的阈值(如@rec90)更保守地保持覆盖率。这个阈值显式地定义了幻觉-覆盖率权衡的前沿,用户可根据应用场景选择操作点。
- 跨数据集迁移:验证器在CHAIR数据上训练后,可直接应用于NoCaps等不同分布的数据集,无需重新拟合。这是因为IGS捕捉的是模型内部的接地模式,而非特定数据集的统计特征。
逐图理解论文
失败的直觉

图2提供IGS的因果和结构证据。子图a-b显示移除视觉证据导致注意力从图像token转移到BOS sink,子图c-d展示有符号权重稀疏地分布在多个头和层中,形成分布式签名。
方法:验证器引导解码

图3展示从IGS到VGD的完整流程。上方:分布式图像/汇点注意力形成每个对象的IGS,L1稀疏读出器将其映射为接地风险。下方:低风险提及被接受,高风险提及触发KV缓存回滚、同义词抑制和局部重写。
核心结论

VGD最有力的结论是:它首次在对象级别实现了可校准的幻觉干预。通过调节单一阈值,用户可以显式地在幻觉抑制和覆盖率保持之间选择操作点——这不是隐藏的权衡,而是清晰可见的前沿。在保守的@rec90设置下,VGD将AMBER-G的幻觉率大幅降低,同时覆盖率、描述长度几乎与不干预的基线持平。更令人印象深刻的是,验证器在CHAIR数据上训练后,可以直接迁移到NoCaps等完全不同的数据集,无需重新拟合,幻觉率同样显著下降。这证明IGS捕捉到的是模型内在的接地机制,而不是某个数据集的统计捷径。
意义与局限

这项工作的意义在于,它为LVLM的幻觉问题提供了一种外科手术式的解决方案——不伤及模型的视觉理解能力,只精准切除幻觉部分。但也要注意,验证器依赖自动标注数据训练,可能继承标注噪声;在极端高风险场景下,局部重写可能达到重试上限而无法完全修正。以上就是这篇论文的核心内容,感谢收听。
实验如何设计?
- 主实验在CHAIR-MSCOCO和AMBER-G两个标准基准上进行,评估对象幻觉减少(CHAIRi、CHAIRs、AMBER-G CHAIR)和覆盖率保持(Cover、Len)。
- 基线方法包括VCD、OPERA、DoLa、SID、OWL、REVERSE和Woodpecker,涵盖推理时干预、训练时方法和事后修正等范式。
- 跨数据集迁移实验在NoCaps验证集的全部4500张图像上进行,使用Open Images的验证负例指标(OI-VNs、OI-VNi)评估对象存在性错误,同时测量CIDEr和SPICE以评估描述质量。
- IGS诊断能力在六种LVLM架构上评估,包括LLaVA-1.5、Qwen2-VL、Shikra等,使用AUROC衡量接地诊断的判别力。
- 消融实验系统比较了不同特征组合(置信度、汇点注意力、图像注意力)和正则化方法(L1 vs L2)对验证器性能的影响。
- 效率测量记录了VGD在不同操作点下的挂钟时间和干预频率,与贪婪解码进行对比。
关键结果与论文证据
- VGD在@rec90操作点下将AMBER-G CHAIR从7.8降至4.4,同时Cover保持在50.8(基线51.0),CHAIRi/CHAIRs从15.4/50.0降至9.7/34.8,描述长度保持101.8(基线101.2),几乎无损失(见表1,第6页)。
- VGD在Qwen2-VL上将AMBER-G CHAIR从7.4降至1.9,在Shikra上从11.4降至4.3,展现跨架构有效性(见表1,第6页)。
- IGS在六种LVLM配置上达到0.927–0.939的AUROC,平均0.933,证明接地签名在不同架构中稳定复现(见图4a,第7页)。
- NoCaps跨数据集迁移中,VGD @rec90将OI-VNs/OI-VNi从8.90/6.28降至7.89/5.60,CIDEr/SPICE保持101.64/16.14(基线103.85/16.49),验证器无需重新拟合(见表2,第7页)。
- VGD @rec90的挂钟成本为2.73秒/描述,对比贪婪解码的1.69秒,相对成本1.61倍,在可接受范围内(见图4d,第7页)。
- L1正则化验证器优于L2版本,在相同特征集下提高了干预精度,因为稀疏性选择了更具判别力的注意力头和层(见表3,第7页)。
- 与OWL等强基线相比,VGD在保持更高覆盖率的同时实现可比的幻觉抑制,暴露了幻觉-覆盖率权衡的显式前沿(见图4c,第7页)。
- 因果干预实验证实,移除视觉证据会导致注意力从图像token系统性地转移到BOS sink,为IGS的接地解释提供了因果基础(见图2a-b,第2页)。
阅读时需要注意
- 验证器依赖CHAIR自动标注的校准数据,可能继承标注噪声,影响风险分数的准确性。
- 局部回滚和重写机制在极端高风险场景下可能达到重试上限(@rec70时有1.51%的描述达到上限),导致无法完全修正。
- 对象提及识别依赖轻量级名词识别器,可能遗漏复杂或隐式的对象表达,限制了干预的覆盖范围。
- 跨架构迁移时需为每个骨干网络独立拟合验证器,IGS模式虽复现但系数不可直接迁移。
- 实验主要在贪婪解码下进行,未验证在其他解码策略(如束搜索、采样)下的效果。
关联工作
- VCD(视觉对比解码)通过对比原始和扭曲图像的输出分布来抑制幻觉,是推理时干预的代表性方法,在本文中作为重要基线对比。
- OPERA通过过度信任惩罚和回溯分配来修正幻觉,与VGD的局部回滚机制有相似之处但粒度不同。
- OWL基于注意力重定向,表现出强抑制能力但覆盖率显著降低,凸显了VGD在保持覆盖率方面的优势。
- REVERSE通过回顾性重采样进行训练时干预,提供了统一的评估设置,本文部分基线结果直接引用其报告。