跳至内容

pchao.org

LDPO

上下文盲区:为什么DPO缓解幻觉会失效,以及如何校准

13 8 月, 2026 作者 PengChao
一个具体的失效案例

提出Contextual Preference Gain (CPG)指标揭示现有DPO类方法的上下文盲区,并设计C2-DPO通过显式最大化CPG来缓解MLLM物体幻觉。

分类 CVPR三分钟 标签 C2-DPO、 CVPR三分钟、 LDPO、 MLLM、 人工智能、 深度学习、 计算机视觉 发表评论
© 2026 pchao.org • Built with GeneratePress