测试时幻觉控制:单次生成、不改模型,用 CLIP 验证物体 token

快速导读:提出 TTH,一种无需训练、单次生成、不改模型权重或隐状态的解码策略,通过 CLIP 验证候选物体 token 并以熵自适应融合来抑制 LVLM 物体幻觉。

大视觉语言模型(LVLM)在图像描述任务中经常生成图像里并不存在的物体,这种现象被称为物体幻觉(Object Hallucination)。幻觉的根源在于 LVLM 依赖语言先验:当模型对某个物体 token 的预测置信度较低、熵较高时,它倾向于选择训练语料中出现频率更高的词,而不是图像中实际存在的物体。

本文提出 TTH(Test-Time Hallucination mitigation),一种无需训练、单次生成、不改模型权重或隐状态的解码策略。TTH 在每一步解码时用 CLIP 验证候选物体 token,并通过熵自适应融合将视觉验证信号注入 LVLM 的 logit 空间,从而在保持接近 Greedy 效率的同时显著抑制物体幻觉。

英文题目:Test-Time Hallucination Control in Large Vision-Language Models

论文出处:arXiv 每日论文精选 · arXiv:2608.11474

原始论文:PDF / 论文页面

这篇论文解决什么问题?

物体幻觉是 LVLM 的核心可靠性问题之一。与纯语言模型不同,LVLM 的幻觉直接违背视觉输入,在图像描述、视觉问答、具身智能等场景中可能造成严重后果。现有免训练缓解方法大致分为两类:一类基于多次解码,如 VCD 通过原图与噪声图的输出对比来抑制幻觉,OPERA 基于 anchor token 聚合模式,HALC 采用自适应 focal-contrast 解码,这些方法都需要额外生成,计算开销大;另一类修改模型内部,如 Nullu 通过权重投影编辑模型,需要访问权重且可能破坏预训练知识。

CLIP 等零样本多模态分类器(Zero-shot Multi-Modal Classifier, MMC)在视觉 grounding 方面表现优异,能够准确判断图像中是否存在某个物体,但它们无法自由生成文本。TTH 的核心洞察是:在解码时把 CLIP 当作一个轻量的 token 验证器,只对候选物体 token 做存在性判断,既不增加生成次数,也不修改模型内部。

研究空白因此清晰:需要一种在单次生成内、不动模型权重或隐状态、仅在 logit 层面操作的测试时幻觉控制策略。TTH 正是针对这一空白提出的。

核心创新

  • 提出 TTH:首个在单次生成内、不改模型权重或隐状态的测试时物体验证解码策略
  • 引入 WordNet 驱动的物体候选筛选与 CLIP 零样本验证模块
  • 提出熵自适应融合机制,对低置信度(高熵)预测施加更强的 CLIP 校正
  • 在 logit 层面操作,保持效率且可即插即用于多种 LVLM

方法概览

TTH 在每步解码时取 top-k 候选 token,用 WordNet 筛选物体 token;对多个物体候选,用 CLIP 计算“a photo of {object}”与图像的相似度作为验证 logits,将其缩放到 LVLM logits 范围,再以归一化熵为权重与原始 logits 融合,最后用融合 logits 选 token。

  • TTH 在每一步解码时取 top-k 候选 token,k 的默认值为 10(消融实验显示 10 为最优)。
  • 用 WordNet 筛选候选中的物体类 token:只有属于物体语义类别的 token 才进入验证流程,非物体 token 不参与 CLIP 验证,避免不必要的计算。
  • 对每个物体候选,构造“a photo of {object}”形式的 prompt,用 CLIP 计算其与输入图像的相似度,作为该候选的视觉验证分数。
  • Logit Rescaling:将 CLIP 相似度分数缩放到 LVLM logits 的数值范围,使两者可以在同一尺度上融合。
  • Entropy-adaptive Fusion:以 LVLM 当前预测分布的归一化熵为权重,将缩放后的 CLIP logits 与原始 LVLM logits 加权融合。熵越高(模型越不确定),CLIP 的校正力度越大。
  • 融合后的 logits 用于选择下一个 token,整个过程只修改 logit,不触碰模型权重和隐状态,因此可即插即用于多种 LVLM。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 2: Overview of the proposed Test-Time Hallucination mitigation (TTH) frame- work. The LVLM first generates token logits conditioned on the image and prompt. The Token Validator Module extracts top-k candidates, filters object tokens using Word- Net, and verifies them with CLIP by matching object-specific prompts (e.g., “a photo of jacket”) against the image. Verified scores are rescaled and fused with the LVLM logits using entropy-based weighting. The refined logits yield grounded outputs (e.g., “jacket”) while suppressing hallucinated tokens (e.g., “hoodie”).

这是 TTH 的完整框架图。从 LVLM 生成 logits 开始,经过 Token Validator Module 的 WordNet 筛选和 CLIP 验证,再到熵自适应融合,最终输出 grounded token。注意图中“jacket”被保留而“hoodie”被抑制的示例。

研究空白

研究空白
Fig. 1: (a) A major category of training-free hallucination mitigation strategies relies on multiple generations during decoding, which is computationally inefficient. (b) An- other category modifies internal layers (editing) or hidden states (steering) before or during inference, which is often complex and may disrupt the model’s knowledge and reasoning. (c) In contrast, our proposed method, TTH, overcomes both limitations by requiring only a single generation and operating without altering model weights or hidden states, making it both efficient and stable.

该图对比了三类免训练幻觉缓解策略:多次解码、修改内部状态、以及 TTH 的单次生成 logit 验证。重点观察 TTH 如何同时避免前两类的计算开销和模型修改风险。

验证与结论

验证与结论
Table 2: CHAIR and BLEU scores across LVLMs; lower CHAIR = less hallucination, higher BLEU = better fluency.

作者在 CHAIR、OPOPE 和 LLaVA-Bench 三个基准上,用 LLaVA-1.5、MiniGPT-4、mPLUG-Owl2 三种模型做了系统验证。TTH 在三种模型上一致降低了物体幻觉,同时保持了描述流畅度;在 LLaVA-Bench 上,GPT-4V 评分的准确性和详细度也都有提升。最值得注意的是效率:TTH 的吞吐量接近 Greedy,而 OPERA、HALC 这类多次解码方法慢了一个数量级以上。

实验如何设计?

  • 在 CHAIR(CHAIRS 句子级、CHAIRI 物体级)、OPOPE(含 random/popular/adversarial 三种设置)和 LLaVA-Bench 三个基准上评估。
  • 覆盖 LLaVA-1.5、MiniGPT-4、mPLUG-Owl2 三种 LVLM,验证方法的模型无关性。
  • 与 Greedy、Beam Search、DoLa、OPERA、VCD、HALC、Woodpecker、LURE、Nullu 等基线对比。
  • 消融实验:候选数量从 3 到 50 变化,以及固定融合系数与熵自适应融合的对比。
  • 效率评估:在相同硬件上测量吞吐量(items/s),与 Greedy、OPERA、HALC 等对比。

关键结果与论文证据

  • 在 CHAIR 基准上,TTH 在 LLaVA-1.5 上取得 CHAIRS 14.27、CHAIRI 4.76,显著低于 Greedy 基线(第 10 页,Table 2)。
  • 在 MiniGPT-4 和 mPLUG-Owl2 上,TTH 同样一致降低 CHAIRS 和 CHAIRI,说明方法跨模型有效(第 10 页,Table 2)。
  • 在 OPOPE 基准上,TTH 在三种模型上均提升 Accuracy 和 F1,其中 LLaVA-1.5 的 Accuracy 达到 80.46(第 10 页,Table 1)。
  • 在 LLaVA-Bench 上,GPT-4V 评分的 Accuracy 和 Detailedness 在三种模型上均有提升(第 11 页,Table 3)。
  • 效率方面,TTH 的吞吐量为 0.59 items/s,接近 Greedy 的 0.72 items/s,而 OPERA 仅 0.09 items/s、HALC 仅 0.02 items/s,差距超过一个数量级(第 12 页,Fig. 4)。
  • 消融显示候选数量为 10 时 CHAIRS 和 CHAIRI 均最优(第 12 页,Fig. 5)。
  • 熵自适应融合相比固定融合系数在 CHAIRS 和 CHAIRI 上均有改善,验证了自适应机制的必要性(第 13 页,Fig. 6)。

阅读时需要注意

  • TTH 主要针对图像描述任务中的物体幻觉,对无显式物体生成的任务(如二值探测)效果有限。
  • 未处理属性幻觉,例如颜色、尺寸等错误描述。
  • 效率评估中 TTH 使用 greedy search,与 beam search 基线的对比可能不完全公平。
  • OPOPE 上 TTH 的 Accuracy 提升幅度相对有限(约 1.3–1.4%),说明在物体存在性探测场景下增益不如描述任务显著。

关联工作

  • VCD:对比解码方法,通过原图与噪声图输出对比抑制幻觉,但需要额外解码,计算开销大。
  • OPERA:基于 anchor token 聚合模式的解码策略,有效但吞吐量极低。
  • HALC:自适应 focal-contrast 解码,减少幻觉但效率瓶颈严重。
  • Nullu:通过权重投影编辑模型抑制幻觉,需访问模型权重,TTH 无需。
  • M3ID:生成与图像互信息更高的 token,属于解码验证类方法,与 TTH 思路相近但实现不同。

发表评论