快速导读:提出 TTH,一种无需训练、单次生成、不改模型权重或隐状态的解码策略,通过 CLIP 验证候选物体 token 并以熵自适应融合来抑制 LVLM 物体幻觉。
大视觉语言模型(LVLM)在图像描述任务中经常生成图像里并不存在的物体,这种现象被称为物体幻觉(Object Hallucination)。幻觉的根源在于 LVLM 依赖语言先验:当模型对某个物体 token 的预测置信度较低、熵较高时,它倾向于选择训练语料中出现频率更高的词,而不是图像中实际存在的物体。
本文提出 TTH(Test-Time Hallucination mitigation),一种无需训练、单次生成、不改模型权重或隐状态的解码策略。TTH 在每一步解码时用 CLIP 验证候选物体 token,并通过熵自适应融合将视觉验证信号注入 LVLM 的 logit 空间,从而在保持接近 Greedy 效率的同时显著抑制物体幻觉。
英文题目:Test-Time Hallucination Control in Large Vision-Language Models
论文出处:arXiv 每日论文精选 · arXiv:2608.11474
原始论文:PDF / 论文页面
这篇论文解决什么问题?
物体幻觉是 LVLM 的核心可靠性问题之一。与纯语言模型不同,LVLM 的幻觉直接违背视觉输入,在图像描述、视觉问答、具身智能等场景中可能造成严重后果。现有免训练缓解方法大致分为两类:一类基于多次解码,如 VCD 通过原图与噪声图的输出对比来抑制幻觉,OPERA 基于 anchor token 聚合模式,HALC 采用自适应 focal-contrast 解码,这些方法都需要额外生成,计算开销大;另一类修改模型内部,如 Nullu 通过权重投影编辑模型,需要访问权重且可能破坏预训练知识。
CLIP 等零样本多模态分类器(Zero-shot Multi-Modal Classifier, MMC)在视觉 grounding 方面表现优异,能够准确判断图像中是否存在某个物体,但它们无法自由生成文本。TTH 的核心洞察是:在解码时把 CLIP 当作一个轻量的 token 验证器,只对候选物体 token 做存在性判断,既不增加生成次数,也不修改模型内部。
研究空白因此清晰:需要一种在单次生成内、不动模型权重或隐状态、仅在 logit 层面操作的测试时幻觉控制策略。TTH 正是针对这一空白提出的。
核心创新
- 提出 TTH:首个在单次生成内、不改模型权重或隐状态的测试时物体验证解码策略
- 引入 WordNet 驱动的物体候选筛选与 CLIP 零样本验证模块
- 提出熵自适应融合机制,对低置信度(高熵)预测施加更强的 CLIP 校正
- 在 logit 层面操作,保持效率且可即插即用于多种 LVLM
方法概览
TTH 在每步解码时取 top-k 候选 token,用 WordNet 筛选物体 token;对多个物体候选,用 CLIP 计算“a photo of {object}”与图像的相似度作为验证 logits,将其缩放到 LVLM logits 范围,再以归一化熵为权重与原始 logits 融合,最后用融合 logits 选 token。
- TTH 在每一步解码时取 top-k 候选 token,k 的默认值为 10(消融实验显示 10 为最优)。
- 用 WordNet 筛选候选中的物体类 token:只有属于物体语义类别的 token 才进入验证流程,非物体 token 不参与 CLIP 验证,避免不必要的计算。
- 对每个物体候选,构造“a photo of {object}”形式的 prompt,用 CLIP 计算其与输入图像的相似度,作为该候选的视觉验证分数。
- Logit Rescaling:将 CLIP 相似度分数缩放到 LVLM logits 的数值范围,使两者可以在同一尺度上融合。
- Entropy-adaptive Fusion:以 LVLM 当前预测分布的归一化熵为权重,将缩放后的 CLIP logits 与原始 LVLM logits 加权融合。熵越高(模型越不确定),CLIP 的校正力度越大。
- 融合后的 logits 用于选择下一个 token,整个过程只修改 logit,不触碰模型权重和隐状态,因此可即插即用于多种 LVLM。
逐图理解论文
失败案例与直觉

这是 TTH 的完整框架图。从 LVLM 生成 logits 开始,经过 Token Validator Module 的 WordNet 筛选和 CLIP 验证,再到熵自适应融合,最终输出 grounded token。注意图中“jacket”被保留而“hoodie”被抑制的示例。
研究空白

该图对比了三类免训练幻觉缓解策略:多次解码、修改内部状态、以及 TTH 的单次生成 logit 验证。重点观察 TTH 如何同时避免前两类的计算开销和模型修改风险。
验证与结论

作者在 CHAIR、OPOPE 和 LLaVA-Bench 三个基准上,用 LLaVA-1.5、MiniGPT-4、mPLUG-Owl2 三种模型做了系统验证。TTH 在三种模型上一致降低了物体幻觉,同时保持了描述流畅度;在 LLaVA-Bench 上,GPT-4V 评分的准确性和详细度也都有提升。最值得注意的是效率:TTH 的吞吐量接近 Greedy,而 OPERA、HALC 这类多次解码方法慢了一个数量级以上。
实验如何设计?
- 在 CHAIR(CHAIRS 句子级、CHAIRI 物体级)、OPOPE(含 random/popular/adversarial 三种设置)和 LLaVA-Bench 三个基准上评估。
- 覆盖 LLaVA-1.5、MiniGPT-4、mPLUG-Owl2 三种 LVLM,验证方法的模型无关性。
- 与 Greedy、Beam Search、DoLa、OPERA、VCD、HALC、Woodpecker、LURE、Nullu 等基线对比。
- 消融实验:候选数量从 3 到 50 变化,以及固定融合系数与熵自适应融合的对比。
- 效率评估:在相同硬件上测量吞吐量(items/s),与 Greedy、OPERA、HALC 等对比。
关键结果与论文证据
- 在 CHAIR 基准上,TTH 在 LLaVA-1.5 上取得 CHAIRS 14.27、CHAIRI 4.76,显著低于 Greedy 基线(第 10 页,Table 2)。
- 在 MiniGPT-4 和 mPLUG-Owl2 上,TTH 同样一致降低 CHAIRS 和 CHAIRI,说明方法跨模型有效(第 10 页,Table 2)。
- 在 OPOPE 基准上,TTH 在三种模型上均提升 Accuracy 和 F1,其中 LLaVA-1.5 的 Accuracy 达到 80.46(第 10 页,Table 1)。
- 在 LLaVA-Bench 上,GPT-4V 评分的 Accuracy 和 Detailedness 在三种模型上均有提升(第 11 页,Table 3)。
- 效率方面,TTH 的吞吐量为 0.59 items/s,接近 Greedy 的 0.72 items/s,而 OPERA 仅 0.09 items/s、HALC 仅 0.02 items/s,差距超过一个数量级(第 12 页,Fig. 4)。
- 消融显示候选数量为 10 时 CHAIRS 和 CHAIRI 均最优(第 12 页,Fig. 5)。
- 熵自适应融合相比固定融合系数在 CHAIRS 和 CHAIRI 上均有改善,验证了自适应机制的必要性(第 13 页,Fig. 6)。
阅读时需要注意
- TTH 主要针对图像描述任务中的物体幻觉,对无显式物体生成的任务(如二值探测)效果有限。
- 未处理属性幻觉,例如颜色、尺寸等错误描述。
- 效率评估中 TTH 使用 greedy search,与 beam search 基线的对比可能不完全公平。
- OPOPE 上 TTH 的 Accuracy 提升幅度相对有限(约 1.3–1.4%),说明在物体存在性探测场景下增益不如描述任务显著。
关联工作
- VCD:对比解码方法,通过原图与噪声图输出对比抑制幻觉,但需要额外解码,计算开销大。
- OPERA:基于 anchor token 聚合模式的解码策略,有效但吞吐量极低。
- HALC:自适应 focal-contrast 解码,减少幻觉但效率瓶颈严重。
- Nullu:通过权重投影编辑模型抑制幻觉,需访问模型权重,TTH 无需。
- M3ID:生成与图像互信息更高的 token,属于解码验证类方法,与 TTH 思路相近但实现不同。