MLLM
EgoMonth:月级第一视角视频如何暴露多模态模型的长期记忆断层
EgoMonth 提出首个跨 20–120 天、301 小时第一视角日常视频的月级基准,用 1,443 个人工 QA 和 14 任务三层认知框架评估 MLLM 的长期时空记忆,发现最强模型 Gemini 2.5 Pro 仅 71.8%,比人类低 22.4 个百分点。
文档MLLM的关系型隐私泄露:当视觉证据消失,模型靠记忆联合泄密
本文揭示文档MLLM在视觉证据缺失时会依赖记忆的字段关联联合泄露多个敏感字段,并提出动态关系解耦遗忘框架DRUF及基准DocPrivacyBench来缓解该风险。
上下文盲区:为什么DPO缓解幻觉会失效,以及如何校准
提出Contextual Preference Gain (CPG)指标揭示现有DPO类方法的上下文盲区,并设计C2-DPO通过显式最大化CPG来缓解MLLM物体幻觉。
Diagram-MMU:科学图表的解析、编辑与问答,模型到底卡在哪一步?
Diagram-MMU 是首个同时评估 MLLM 在科学图表解析、编辑与问答三项任务上基础能力与智能体能力的 TikZ 基准,覆盖 6 类图表、3.7k 张图与 18.3k 个样本。
从体育到安全:多模态大模型为何“看见”危险却“看不懂”因果?
提出SPRINT基准,通过2888个真实体育视频评估MLLMs的主动物理危险预警能力,揭示模型在危险感知与因果理解之间存在巨大差距,且高度依赖提示词。
多模态大模型的空间幻觉:如何不训练就揪出推理链中的错误证据?
提出一种无训练、模块化的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA)来定位并纠正多模态大模型推理链中与视觉输入不一致的中间空间证据,从而提升最终答案准确性。
更好、更强、更快、更广:面向多模态大语言模型分割的结构化全掩码预测
提出结构化全掩码预测范式,将自回归对话与非自回归掩码生成解耦,通过单次前向传播同时预测所有掩码令牌,在保持对话能力的同时实现高效、高性能的通用分割。