快速导读:UniProbe 从冻结 LVLM 的单次前向传播中构建计算轨迹图,并用 GNN、ViT、GRU 交替模块进行令牌级幻觉检测与解码期缓解。
大型视觉语言模型(LVLM)在视觉推理中频繁产生幻觉,而有效缓解的前提是能在令牌级别精确定位幻觉片段。现有方法要么需要昂贵地微调整个骨干模型,要么依赖忽略生成过程的外部验证器,要么把内部信号压缩成孤立特征或手工统计量,丢弃了空间、序列和关系结构。UniProbe 的核心主张是:幻觉的证据已经存在于冻结 LVLM 的内部计算轨迹中,关键在于用对的结构去读取它。
UniProbe 从冻结 LVLM 的单次前向传播中读取中间层隐藏状态与注意力,构建覆盖图像、查询、响应令牌的有向计算轨迹图,再用 L 个交替的 GNN、ViT、GRU 模块分别整合关系证据、二维视觉几何和响应顺序,最后由线性头输出每个响应令牌的幻觉概率。流式变体把 BiGRU 换成单向 GRU,直接驱动解码期的拒绝-重采样干预。
英文题目:UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations
论文出处:arXiv 每日论文精选 · arXiv:2608.10835
原始论文:PDF / 论文页面
这篇论文解决什么问题?
LVLM 幻觉的难点在于定位:一个响应里可能只有少数几个令牌是幻觉,其余内容完全正确。如果检测器只能给出整句级别的标签,就无法支持定向干预,只能粗暴地删除或重写整段输出。因此令牌级检测是幻觉缓解的关键基础设施。
现有令牌级检测方法大致分三类。第一类如 HaloDet 微调骨干模型以内联标注幻觉片段,检测效果好但训练成本高,且改变了骨干本身的生成行为。第二类如 HalLocalizer 训练外部验证器比较图像与响应,但验证器独立于生成过程,无法利用生成时的内部状态。第三类如 HALP 探测内部表征,但只预测全局幻觉标签,不做令牌级定位。
更隐蔽的问题是结构丢失。LVLM 的一次前向传播产生的是异构计算轨迹:图像令牌构成二维网格,查询和响应令牌构成一维序列,注意力图则编码跨模态关系。把这些信号压平成孤立特征向量,或者手工设计注意力统计量,都会丢掉空间、顺序和关系信息。UniProbe 的研究空白正在于此:没有人把完整的异构计算轨迹当作一个统一的结构化对象来学习。
核心创新
- 首次将 LVLM 异构计算轨迹(图像二维网格、查询/响应一维序列、注意力关系)建模为统一有向图,并用 GNN、ViT、GRU 交替模块联合处理
- 提出流式(在线)检测变体,将检测直接转化为解码期拒绝-重采样干预,实现幻觉感知解码
- 提出自适配策略,用目标模型自生成标注微调检测器,缓解训练-部署分布偏移
- 保持骨干 LVLM 完全冻结,仅约 16M 可训练参数,延迟仅 1.06×
方法概览
UniProbe 从冻结 LVLM 的单次前向传播中读取中间层隐藏状态与注意力,构建图像、查询、响应令牌的有向计算轨迹图;用 L 个交替的 GNN(关系证据)、ViT(二维视觉几何)、GRU(响应顺序)模块处理,线性头输出每个响应令牌的幻觉概率。流式变体将 BiGRU 换为单向 GRU,用于幻觉感知解码中的拒绝-重采样;自适应策略用目标模型在 Objects365 上的自生成标注微调检测器以缓解分布偏移。
- 计算轨迹图构建:从冻结 LVLM 的某一中间层读取隐藏状态和注意力图,把图像、查询、响应三类令牌作为节点,注意力权重作为有向边,形成一张异构有向图。图像节点保留二维空间位置,查询和响应节点保留一维顺序。
- 交替模块设计:L 个块依次执行 GNN、ViT、GRU。GNN 在图上做消息传递,整合跨模态关系证据;ViT 处理图像令牌的二维几何结构;GRU 沿响应序列建模生成顺序。三者交替而非并联,让不同结构信息逐步融合。
- 线性头输出:每个响应令牌的最终表示经过一个线性头,输出该令牌为幻觉的概率。整个检测器只有约 16M 可训练参数,骨干 LVLM 完全冻结。
- 流式变体:把 BiGRU 替换为单向 GRU,使检测器可以在解码过程中逐令牌运行,支持幻觉感知解码中的拒绝-重采样:当检测概率超过阈值时拒绝当前采样并重新生成。
- 自适配策略:用目标模型在 Objects365 上自生成描述,结合 GT 对象标注和 CHAIR 自动标注构造训练数据,微调检测器以缓解训练-部署分布偏移。
- 读出层选择:检测信号集中在中间层而非输出层,GLM-4.1V 在 layer 20 达到峰值,LLaVA-1.5 在 layer 14 达到峰值,越靠近输出层信号越弱。
逐图理解论文
失败案例

图 1 展示令牌级检测与缓解的动机:HaloDet 误标非幻觉令牌,HalLocalizer 只捕获部分幻觉片段,而 UniProbe 精确定位。观察黄色高亮与红色幻觉文本的对应关系,可以直观理解令牌级定位的难度。
研究空白

图 2 是 UniProbe 的架构总览:从冻结 LVLM 的单次前向传播读取隐藏状态和注意力,构建计算轨迹图,经 GNN、ViT、GRU 交替模块后由线性头输出每个响应令牌的幻觉概率。注意三类令牌节点和三种模块的对应关系。
证据与消融

证据链是完整的。MHALO 和 HalLoc 上,UniProbe 在多个骨干上超过 HaloDet 和 HalLocalizer;POPE 上大幅超越手工注意力分数的 Token Grounding。最关键的消融是:移除图模块,F1M 直接下降 10.1;把结构建模换成平面 MLP 探针,F1M 只剩 31.9。结构就是核心贡献,不是锦上添花。
缓解与人类偏好

检测器的真正价值在缓解。流式变体在自适配后把 CHAIRi 从 18.0 降到 8.2,CHAIRs 从 37.2 降到 16.6,延迟只有 1.06 倍。人类偏好研究里,UniProbe 的缓解后描述在 55% 的比较中被选为最佳,远超 PAS 的 30% 和 HaloDet 的 15%。
实验如何设计?
- 令牌级检测评估在 MHALO 和 HalLoc 两个基准上进行,覆盖 GLM-4V、Qwen-3-VL、LLaVA-1.5、InternVL2、InstructBLIP 等多个骨干。
- 对象幻觉检测在 COCO 自生成描述和 POPE 上进行,与 Token Grounding 等先验检测器对比。
- 流式检测与缓解在 COCO 流式自生成描述上评估,指标包括 CHAIRi、CHAIRs、SPICE、JS Div 和延迟。
- 消融实验对比 MLP/Transformer 平面探针、单模块变体、移除各模块的影响,以及读出层、解码阈值、注意力头平均、预算等超参数。
- 人类偏好研究由 100 名评分者完成 20 次比较,共 2000 次判断,比较 UniProbe、PAS 和 HaloDet 的缓解后描述质量。
关键结果与论文证据
- MHALO 上 GLM-4V 骨干 F1M/F1IoU 达到 63.2/52.9,超过 HaloDet 的 59.1/49.8(第 6 页)。
- HalLoc 上三个骨干均超过 HalLocalizer,如 LLaVA-1.5 上 F1 为 74.3 对比 69.8(第 6 页)。
- COCO 自生成描述检测 F1 达 92.3,POPE F1 63.1 / AUC 90.0,远超 Token Grounding 的 82.0 和 41.0/75.0(第 6 页)。
- 流式缓解在自适配后 CHAIRi 从 18.0 降至 8.2,CHAIRs 从 37.2 降至 16.6,降幅约 55%,延迟仅 1.06×(第 7 页)。
- 人类偏好研究中 UniProbe 获得 55% 的选择率,对比 PAS 30% 和 HaloDet 15%(第 12 页)。
- 消融显示移除图模块 F1M 下降 10.1,移除 BiGRU 下降 4.6;平面 MLP 探针仅 31.9 F1M,证明结构建模是核心贡献(第 7 页)。
- 注意力头平均为每边一个标量优于保留所有头作为逐边特征,后者增加参数却不提升检测(第 13 页)。
- 解码阈值 τ 需要谨慎选择:τ=0.40 时 CHAIRi 降 36% 但删除 12% 正确提及,论文采用 τ=0.70 作为最激进且不伤正确内容的设置(第 8 页)。
阅读时需要注意
- 需要访问隐藏状态和注意力图,仅适用于开源模型或闭源提供商内部使用,无法作为黑盒 API 的外部检测器。
- 每个骨干需单独训练读出器,内部表征跨模型差异大,未探索跨骨干迁移。
- 自适配依赖 Objects365 的 GT 对象标注和 CHAIR 自动标注,标注噪声可能影响检测器质量。
关联工作
- CHARM 在注意力图上做消息传递检测 LLM 幻觉,UniProbe 将其扩展到多模态异构轨迹。ACT-ViT 用 ViT 读取激活张量,UniProbe 借鉴了结构化轨迹的思想。Lookback Lens 基于注意力做文本解码引导,UniProbe 将其扩展到多模态流式设置。OPERA 用固定启发式惩罚过度信任的注意力模式,UniProbe 用学习式检测器替代手工规则。