上下文盲区:为什么DPO缓解幻觉会失效,以及如何校准 13 8 月, 2026 作者 PengChao 提出Contextual Preference Gain (CPG)指标揭示现有DPO类方法的上下文盲区,并设计C2-DPO通过显式最大化CPG来缓解MLLM物体幻觉。