维纳表示滤波:零成本抑制视觉语言模型幻觉

快速导读:提出一种无需训练、基于维纳滤波的表示编辑方法,通过离线估计真实与幻觉表示的协方差结构,将校正算子吸收到模型权重中,从而在推理时零成本地抑制视觉语言模型的对象幻觉。

视觉语言模型(VLMs)在图像描述、视觉问答等任务上表现优异,但深受对象幻觉困扰——模型常常生成图像中并不存在的物体、属性或关系。现有缓解策略要么需要额外训练,要么在推理时引入显著的计算开销,例如解码时约束方法常导致5-10倍的推理减速。

本文提出了一种全新的视角:将幻觉抑制建模为表示空间中的线性最小均方误差(MMSE)估计问题。核心思想是,真实表示与幻觉表示在深层隐藏状态中存在结构化的分离,可以通过维纳滤波进行模式级衰减。该方法完全无需训练,且通过将滤波器吸收到模型权重中,实现了推理时零额外计算成本。

英文题目:Wiener Representation Filtering for VLM Hallucination Suppression

论文出处:arXiv 每日论文精选 · arXiv:2608.08167

原始论文:PDF / 论文页面

这篇论文解决什么问题?

对象幻觉是VLM在实际部署中最突出的可靠性问题之一。当模型描述一张海滩照片时,它可能凭空编造出'棕榈树'或'冲浪板'等不存在的物体。这种幻觉源于视觉编码器与大语言模型之间的信息瓶颈,以及语言模型先验对视觉证据的覆盖。

现有缓解方法大致分为两类:训练依赖方法(如RLHF、指令微调)需要大量标注数据和计算资源;训练无关方法(如VCD、OPERA、HALC)在解码时进行干预,虽然避免了训练,但每次推理都需要额外的前向传播或logits对比,导致显著的延迟。权重编辑方法如Nullu通过SVD识别并硬性移除幻觉方向,但硬截断可能破坏模型的表示能力。

本文的关键观察是:在VLM的深层表示中,真实描述和幻觉描述对应的隐藏状态形成了可分离的聚类(如图1的UMAP可视化所示)。这意味着幻觉信息集中在低维子空间中,为线性滤波提供了几何基础。

核心创新

  • 首次将VLM幻觉缓解形式化为表示空间中的线性MMSE估计问题,并推导出闭式维纳滤波器。
  • 提出一种基于协方差结构的谱塑造方法,对幻觉主导模式进行连续、成比例的衰减,而非硬性截断,保证了稳定性。
  • 通过将滤波器离线吸收到FFN权重中,实现了完全训练无关且推理零成本的幻觉抑制。

方法概览

将隐藏状态建模为真实成分与幻觉相关失真的叠加。利用成对的真实/幻觉描述校准数据,估计真实表示协方差(ΣT)和幻觉失真协方差(ΣH)。通过求解广义特征值问题,得到按失真-信号比排序的谱模式,并推导出闭式维纳增益进行模式级衰减。引入锐度指数α控制衰减强度。最终将得到的维纳算子Fα吸收到选定深层的前馈网络(FFN)输出投影权重中,实现推理时无额外计算。

  • 问题形式化:将某一层的隐藏状态h建模为真实成分h_T与幻觉相关失真h_H的叠加,即h = h_T + h_H。目标是从观测到的h中恢复h_T,这是一个经典的线性MMSE估计问题。
  • 协方差估计:利用成对的真实/幻觉描述校准数据(来自LURE或HaluEval数据集),分别估计真实表示的协方差矩阵Σ_T和幻觉失真的协方差矩阵Σ_H。这一步骤是离线的,仅需一次计算。
  • 谱分解与维纳增益:通过求解广义特征值问题Σ_H q = λ Σ_T q,得到按失真-信号比排序的谱模式。对于每个模式i,维纳增益为g_i = 1/(1 + α·λ_i),其中α是锐度指数,控制衰减强度。λ_i越大(即该模式中幻觉占比越高),衰减越强。
  • 滤波器构造:利用特征向量矩阵Q和增益矩阵G,构造维纳算子F_α = Q G Q^{-1}。该算子在表示空间中对幻觉主导方向进行连续、成比例的衰减,而非硬性截断。
  • 权重吸收:选定模型中若干深层的FFN输出投影矩阵W_out,将维纳算子吸收为W_out' = F_α W_out。这一操作等价于在推理时对隐藏状态施加滤波,但完全不需要额外计算——滤波器已经'固化'在权重中。
  • 编辑层选择:实验表明,编辑LLaVA-1.5的第28-31层效果最佳。过浅的层编辑效果有限,过深的层可能影响语言生成的流畅性。
  • 锐度指数α:α控制衰减的激进程度。α=0时无衰减(等价于原始模型),α→∞时退化为硬截断。通过小规模验证集搜索,可在幻觉抑制与描述质量之间取得平衡。
  • 与Nullu的对比:Nullu通过SVD识别并直接移除幻觉方向,本质上是硬截断。本文的维纳滤波采用连续衰减,保留了部分信息,在稳定性和描述质量上更优。

逐图理解论文

幻觉的结构化分离

幻觉的结构化分离
Figure 1: (a) UMAP visualization of MiniGPT4 and mPLUG-Owl2 hidden activations for truthful (blue) and hallucinatory (amber) samples from LURE, showing distinct clusters that reveal low-rank hallucination subspaces. (b) Qualitative comparison of captions generated by MiniGPT before and after applying our proposed Wiener based correction. The baseline model hallucinates non-existent objects such as clouds, and striped pole at the top, while our method suppresses these errors.

图1展示了两个关键发现:(a) UMAP可视化显示真实描述(蓝色)和幻觉描述(琥珀色)的隐藏状态在MiniGPT-4和mPLUG-Owl2中形成明显分离的聚类,表明幻觉信息集中在低维子空间中;(b) 定性对比显示,基线模型在描述中幻觉出'云朵'和'条纹杆'等不存在的物体,而维纳滤波方法成功抑制了这些错误。

从硬截断到连续衰减

从硬截断到连续衰减
Figure 4: Hallucination spectrum (eigenvalues of ΣH = QΛQ⊤) for three vision–language models. The curves show a small set of high-variance “spikes” followed by a long decaying tail, indicating that hallucination behavior is concentrated in a low-dimensional set of dominant eigenmodes, with the remaining spectrum reflecting noise-like variation.

图4展示了三个VLM的幻觉谱(Σ_H的特征值分布)。曲线呈现少量高方差'尖峰'后接长衰减尾部的特征,表明幻觉行为集中在少数主导特征模式上,为低秩滤波提供了理论依据。

零成本推理的秘密

零成本推理的秘密
Table 4: Ablation analysis on CHAIR using MiniGPT-4. Lower CHAIRS and CHAIRI indicate fewer hallucinations, while higher BLEU indicates better caption quality.

这个方法最巧妙的地方在于部署方式。得到的维纳滤波算子是一个线性变换,可以直接吸收到选定深层的FFN输出投影权重中。也就是说,我们只需要离线修改一次模型文件,推理时完全不需要任何额外计算——没有额外的前向传播,没有logits对比,没有回溯搜索。幻觉抑制被'编译'进了权重里。实验表明,在LLaVA-1.5上编辑第28到31层效果最佳,锐度指数α则通过小规模验证集搜索来确定。

跨模型跨任务的泛化证据

跨模型跨任务的泛化证据
Table 1: Comparison of VLMs (LLaVA-1.5, MiniGPT-4, and mPLUG-Owl2) on MSCOCO using strategies for hallucination mitigation. CHAIRS and CHAIRI measure sentence- and instance hallucinations (lower is better). All experiments use a maximum token limit of 64.

表1报告了三个VLM在MSCOCO上的CHAIR评估结果。维纳滤波方法在CHAIRS和CHAIRI两个指标上均取得最低值,且推理速度与Greedy解码相当,而VCD、OPERA等方法虽然也降低了幻觉率,但推理时间显著增加。

结论与局限

结论与局限
Figure 6: CHAIR captioning examples showing how Nullu and greedy decoding introduce spurious objects, while our method consistently remains visually grounded. Results are over the LLaVA 1.5 7B model.

图6展示了LLaVA-1.5上的定性对比示例。在海滩场景中,Greedy解码幻觉出棕榈树和伞下的人群,Nullu错误描述了冲浪板,而维纳滤波方法生成了准确反映图像内容的描述,直观展示了方法的优势。

实验如何设计?

  • 模型:LLaVA-1.5-7B、MiniGPT-4、mPLUG-Owl2、Gemma3-4B-it,覆盖多种VLM架构。
  • 幻觉评估基准:CHAIR(句子级CHAIRS和实例级CHAIRI)、POPE(Random/Popular/Adversarial三种设置)、MME(10个子任务的综合评估)。
  • 对比方法:解码时策略(Greedy、Beam Search、VCD、OPERA、HALC)和权重编辑方法(Nullu)。
  • 消融实验:分析均值失真减法、均匀收缩、不同层深编辑、锐度指数α的影响。
  • 泛化测试:在视频理解基准TempCompass和离散扩散语言模型Dream-v0上验证。
  • 跨域迁移:从HaluEval到CHAIR、从LURE到TruthfulQA的迁移实验。

关键结果与论文证据

  • CHAIR评估(表1,第8页):在LLaVA-1.5上,CHAIRS降至14.93,CHAIRI降至4.70;在MiniGPT-4上,CHAIRS降至16.87,CHAIRI降至6.13;在mPLUG-Owl2上,CHAIRS降至15.40,CHAIRI降至6.07,均优于所有对比方法。
  • POPE评估(表2,第8页):在LLaVA-1.5的Random、Popular、Adversarial设置下,准确率/F1分别达到85.16/86.52、78.43/81.53、70.86/76.57,在多数设置下取得最优。
  • MME评估(表5,第19页):在LLaVA-1.5上取得148.5的平均分,超越Greedy(147.0)和OPERA(145.6),在Count子集上提升10分。
  • Gemma3-4B-it结果(表6,第19页):CHAIRS从0.357降至0.261,相对降低约27%。
  • FaithDial评估(表3,第9页):在Dream-v0-Instruct-7B上,FaithCritic幻觉率从92%降至74%,Claude评判幻觉率从93%降至50%。
  • 消融实验(表4,第10页):均值失真减法效果有限,均匀收缩不如维纳滤波,编辑第28-31层效果最佳。
  • 跨域迁移(表8,第20页):从HaluEval学习的滤波器在CHAIR上仍有效,从LURE学习的滤波器在TruthfulQA上提升准确率,表明学到的幻觉模式具有跨域泛化性。
  • 假设验证(表9,第22页):成对校准数据的加性误差低、谱集中度高,随机配对则破坏这些性质,验证了真实与幻觉成分可加性假设的合理性。

阅读时需要注意

  • 方法依赖成对的真实/幻觉描述校准数据集,其质量和覆盖度直接影响协方差估计的准确性。
  • 维纳滤波基于真实与幻觉成分不相关的假设,虽经实证验证,但在极端情况下可能不完全成立。
  • 超参数(编辑层范围L和锐度指数α)需要针对不同模型进行小规模验证集搜索,非完全自适应。
  • 方法主要针对对象幻觉设计,对属性、关系等其他类型幻觉的抑制效果未作重点评估。
  • 在降低幻觉的同时,BLEU值略有下降(如LLaVA-1.5上从0.158降至0.151),表明描述流畅性或信息量可能受到轻微影响。

关联工作

  • OPERA:解码时策略,通过过度信任惩罚和回溯分配机制减少幻觉,但引入推理开销。
  • VCD:通过对比原始和扰动视觉输入的logits抑制幻觉,需要额外的前向传播。
  • HALC:自适应焦点对比解码,在推理时动态纠正幻觉token,计算成本较高。
  • Nullu:权重编辑方法,通过SVD识别并硬性移除幻觉方向,本文方法相比采用连续衰减更为稳定。

发表评论