上下文盲区:为什么DPO缓解幻觉会失效,以及如何校准

快速导读:提出Contextual Preference Gain (CPG)指标揭示现有DPO类方法的上下文盲区,并设计C2-DPO通过显式最大化CPG来缓解MLLM物体幻觉。

多模态大模型在视觉语言任务上表现优异,但物体幻觉问题始终困扰着实际部署。近期工作如C-DPO通过在偏好数据中引入辅助caption来增强上下文接地,试图缓解幻觉。然而,本文作者发现一个被忽视的关键问题:现有DPO类方法的优化目标本身并未显式要求模型利用上下文,导致模型在完整上下文与退化上下文之间偏好分数几乎不变,呈现上下文盲区。

针对这一问题,论文提出Contextual Preference Gain (CPG)作为诊断指标,量化偏好分数随上下文丰富度的变化,并发现CPG与幻觉率强负相关。基于此,作者设计C2-DPO框架,通过上下文偏好校准损失显式最大化CPG,同时保持退化上下文下的偏好排序。实验表明,该方法在多个幻觉基准上显著优于现有基线,且校准机制可无缝集成到SimPO、RDPO等变体及纯文本LLM设置中。

英文题目:Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

论文出处:arXiv 每日论文精选 · arXiv:2608.12158

原始论文:PDF / 论文页面

这篇论文解决什么问题?

物体幻觉是指模型生成与视觉输入不一致的物体描述,例如将图片中不存在的物体描述为存在,或错误描述物体的属性。这一问题源于多模态模型在训练过程中过度依赖语言先验,而未能充分接地视觉证据。

DPO作为一种直接偏好优化方法,通过隐式奖励建模Bradley-Terry偏好,在缓解幻觉方面展现出潜力。然而,标准DPO的优化目标只关注优选响应与劣选响应之间的相对排序,并未涉及模型对上下文的利用程度。

C-DPO在偏好数据中引入非幻觉辅助描述,试图通过数据层面的上下文增强来改善接地。但作者指出,数据层面的增强并不等同于优化层面的保证:即使数据中包含辅助caption,模型在训练后仍可能忽略这些上下文信息。

这一观察引出了本文的核心研究缺口:现有偏好优化方法缺乏对上下文利用程度的显式诊断和优化机制,导致上下文盲区现象普遍存在。

核心创新

  • 提出Contextual Preference Gain (CPG)诊断指标,量化偏好分数随上下文丰富度的变化,并发现CPG与幻觉率强负相关。
  • 揭示现有DPO、SimPO、RDPO的上下文盲区现象:CPG分布高度集中于零附近。
  • 提出C2-DPO框架,通过上下文偏好校准损失显式最大化CPG,同时保持退化上下文下的偏好排序。
  • 证明CPC可无缝集成到SimPO、RDPO等偏好优化变体及纯文本LLM设置中。

方法概览

定义Contextual Preference Gain (CPG)为完整上下文与退化上下文(移除caption)下偏好分数之差。C2-DPO在标准DPO损失基础上,加入Contextual Preference Calibration损失Lc(以NCE形式对比完整与退化上下文的偏好分数,最大化CPG),并对退化上下文施加DPO损失LDPO(x′)以保持正确偏好排序。总目标为LDPO(x) + λc·Lc(x,x′) + λu·LDPO(x′)。

  • 定义Contextual Preference Gain (CPG):完整上下文x与退化上下文x′(移除caption)下偏好分数之差,用于量化模型对上下文的敏感程度。
  • 诊断分析:在Object HalBench和AMBER上分析CPG与幻觉率的关系,发现两者呈强负相关,说明CPG可作为幻觉风险的代理指标。
  • 揭示上下文盲区:对DPO、SimPO、RDPO的CPG分布进行分析,发现三者均高度集中在零附近,表明现有方法对上下文变化不敏感。
  • C2-DPO总目标:在标准DPO损失LDPO(x)基础上,加入上下文偏好校准损失Lc(x,x′),以NCE形式对比完整与退化上下文的偏好分数,显式最大化CPG。
  • 退化上下文正则:对退化上下文x′施加DPO损失LDPO(x′),确保即使上下文被削弱,模型仍保持正确的偏好排序,防止校准过程破坏基础偏好学习。
  • 损失系数λc和λu控制校准强度与退化正则的平衡,论文建议在0.3–0.5范围内选择。
  • CPC的通用性:上下文偏好校准机制与具体偏好优化变体解耦,可无缝集成到SimPO、RDPO等框架中,形成C2-SimPO、C2-RDPO。
  • 梯度分析:附录中通过逐点互信息PMI解释CPG梯度的信息论含义,说明校准损失如何引导模型关注上下文中的接地证据。

逐图理解论文

一个具体的失效案例

一个具体的失效案例
Fig. 1: Motivation of C2-DPO. A model should yield higher preference scores when richer context is provided. However, standard DPO shows minimal change between full and degraded contexts, revealing context-blind behavior. C2-DPO amplifies this gap, enabling models to better leverage contextual information and reduce hallucination.

该图展示了C2-DPO的核心动机:理想情况下,更丰富的上下文应带来更高的偏好分数,但标准DPO在完整与退化上下文之间偏好分数变化极小,呈现上下文盲区。C2-DPO通过放大这一差距,使模型更好地利用上下文信息。

研究缺口:上下文盲区

研究缺口:上下文盲区
Fig. 2: Correlation between CPG and hallucination rates. We analyze the re- lationship between Contextual Preference Gain (CPG) and hallucination rate across multiple models. On both Object HalBench (left) and AMBER (right), CPG shows a strong negative correlation with hallucination rate, suggesting that increased CPG is closely associated with improved grounding.

该图在Object HalBench和AMBER上展示了CPG与幻觉率的关系。两个基准上均呈现强负相关,说明CPG越高,幻觉越少,为CPG作为幻觉风险代理指标提供了实证依据。

C2-DPO如何解决

C2-DPO如何解决
Fig. 4: Context-Calibrated Direct Preference Optimization via Contextual Preference Calibration (C2-DPO). Given a full context x and a degraded context x′, C2-DPO calibrates the preference score by (1) applying the standard DPO loss on x, (2) contrasting preference scores between x and x′ via a Contextual Preference Calibration loss to maximize contextual preference gain, and (3) applying DPO on x′

该图展示了C2-DPO的整体框架:在完整上下文上应用标准DPO损失,通过上下文偏好校准损失对比完整与退化上下文的偏好分数以最大化CPG,并在退化上下文上施加DPO损失以保持正确排序。

训练动态与泛化验证

训练动态与泛化验证
Fig. 5: Contextual Preference Gain (CPG) comparison be- tween C2-DPO and C-DPO. Our C2-DPO steadily increases CPG throughout training, while C-DPO stays near or below zero, indicating its limited ability to utilize contex- tual signals.

该图对比了C2-DPO与C-DPO在训练过程中的CPG变化。C2-DPO的CPG持续上升,而C-DPO的CPG始终在零附近或为负,直观展示了校准损失在引导模型学习利用上下文方面的效果。

结论与局限

结论与局限
Table 5: Robustness to con- text quality.

这篇论文的核心贡献在于,它把幻觉缓解从数据构造层面推进到了优化目标层面:不是给模型更多上下文,而是让模型真正学会利用上下文。一个诚实的局限是,退化上下文主要采用移除caption的方式,对噪声图像等其他退化形式的改善幅度较小。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 模型:LLaVA-v1.5-7B和Qwen2-VL-Instruct-2B,使用LoRA进行参数高效微调。
  • 训练数据:C-DPO发布的SENTINEL上下文感知偏好数据集,包含完整上下文与退化上下文配对。
  • 评估基准:Object HalBench、AMBER、HallusionBench评估幻觉率;ScienceQA、MM-Vet、TextVQA评估通用推理能力。
  • 基线对比:VCD、OPERA、DoLa、HA-DPO、POVID、CLIP-DPO、RLAIF-V、TPO、vanilla-DPO、C-DPO等。
  • 消融实验:分析Lc(x,x′)与LDPO(x′)两个损失分量的独立贡献。
  • 泛化实验:将CPC与SimPO、RDPO结合,并在纯文本LLM Qwen2.5-Instruct-1.5B上以AlpacaEval 2验证。

关键结果与论文证据

  • CPG与幻觉率在Object HalBench和AMBER上呈强负相关,为上下文利用程度提供了可量化的诊断信号(第6页)。
  • DPO、SimPO、RDPO的CPG分布高度集中在零附近,证实上下文盲区现象的普遍性(第7页)。
  • Qwen2-VL-Instruct-2B上C2-DPO将Object HalBench响应级幻觉率从C-DPO的2.5降至1.6,相对降低36%;提及级从1.6降至1.0,相对降低60%(第11页)。
  • LLaVA-v1.5-7B上C2-DPO将Object HalBench响应级幻觉率降至4.8,提及级降至2.7,AMBER CHAIR降至2.8(第11页)。
  • 消融实验表明,上下文偏好校准损失Lc和退化上下文DPO损失LDPO(x′)对最终性能均有贡献,缺一不可(第11页)。
  • C2-SimPO和C2-RDPO分别优于其基础变体,证明CPC的泛化性(第12页)。
  • AlpacaEval 2上C2-DPO的LC从DPO的24.1提升至25.9,C2-SimPO的LC从SimPO的33.5提升至34.1,说明CPC在纯文本LLM上同样有效(第12页)。
  • 训练动态显示C2-DPO的CPG持续上升,而C-DPO的CPG始终在零附近或为负,说明校准损失确实在引导模型学习利用上下文(第13页)。

阅读时需要注意

  • 仅在7B和2B两个模型规模上验证,未覆盖更大规模模型,CPC在大模型上的效果有待确认。
  • 退化上下文主要采用移除caption的方式,对噪声图像等其他退化形式的改善幅度较小(第14页)。
  • 损失系数λc、λu需在0.3–0.5范围内选择,超出该范围性能下降,实际部署需要额外调参。
  • 未探索C2-DPO在关系幻觉、属性幻觉等其他幻觉类型上的独立效果。
  • CPG与幻觉率的负相关为观察性结论,论文未提供因果性证明。
  • C2-DPO依赖辅助caption的存在,在无caption的实际部署场景中退化上下文的构造方式需重新设计。

关联工作

  • C-DPO:在偏好数据中引入非幻觉辅助描述以增强上下文接地,是C2-DPO的直接基线和数据来源(第2页)。
  • DPO:C2-DPO的基础偏好优化框架,通过隐式奖励建模Bradley-Terry偏好(第4页)。
  • SimPO:无参考模型的偏好优化变体,C2-DPO的CPC被证明可与其结合(第12页)。
  • RDPO:解耦长度与质量的DPO变体,C2-DPO的CPC同样适用(第12页)。
  • HA-DPO:幻觉感知的DPO方法,属于偏好数据构造类基线(第11页)。
  • VCD与OPERA:基于对比解码和过度信任惩罚的推理时幻觉缓解方法,作为非偏好优化基线对比(第11页)。

发表评论