EgoMonth:月级第一视角视频如何暴露多模态模型的长期记忆断层

论文代表图:figure-01-p001-01

EgoMonth 提出首个跨 20–120 天、301 小时第一视角日常视频的月级基准,用 1,443 个人工 QA 和 14 任务三层认知框架评估 MLLM 的长期时空记忆,发现最强模型 Gemini 2.5 Pro 仅 71.8%,比人类低 22.4 个百分点。

多模态大模型的空间幻觉:如何不训练就揪出推理链中的错误证据?

方法贡献

提出一种无训练、模块化的框架,通过构建空间证据图(SEG)和空间证据可靠性评估(SERA)来定位并纠正多模态大模型推理链中与视觉输入不一致的中间空间证据,从而提升最终答案准确性。

更好、更强、更快、更广:面向多模态大语言模型分割的结构化全掩码预测

论文贡献与解决方案

提出结构化全掩码预测范式,将自回归对话与非自回归掩码生成解耦,通过单次前向传播同时预测所有掩码令牌,在保持对话能力的同时实现高效、高性能的通用分割。