快速导读:EgoMonth 提出首个跨 20–120 天、301 小时第一视角日常视频的月级基准,用 1,443 个人工 QA 和 14 任务三层认知框架评估 MLLM 的长期时空记忆,发现最强模型 Gemini 2.5 Pro 仅 71.8%,比人类低 22.4 个百分点。
EgoMonth 是首个面向长期时空记忆的月级第一视角视频基准。它从 30 名志愿者中筛选出 20 名参与者,收集了跨 20–120 天、总计约 301 小时的日常第一视角视频,并基于这些视频人工撰写了 1,443 个四选一 QA。与以往依赖网络视频或孤立会话的长视频基准不同,EgoMonth 的核心特征是参与者级连续性:同一人的多个片段共享持久环境、日常惯例和跨天依赖,使模型必须真正记住并整合分散在数周内的证据才能作答。
论文的评估结果揭示了一个清晰的断层:最强闭源模型 Gemini 2.5 Pro 的宏平均准确率仅为 71.8%,而人类基线达到 94.2%,差距超过 22 个百分点;最强开源模型 Qwen2.5-VL 的宏平均准确率只有 58.0%。更值得注意的是,多个模型在部分任务上低于随机水平,说明问题不是简单的容量不足,而是缺乏结构化的时空记忆机制。
英文题目:EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory
论文出处:arXiv 每日论文精选 · arXiv:2608.13113
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有长视频理解基准的进步集中在分钟级到小时级的时间跨度上,例如 Video-MME、LongVideoBench、MLVU 和 LVBench 等。这些基准大多依赖网络视频、电影或剪辑片段,视频之间没有共享的时空背景,也没有跨片段的因果依赖。模型可以在单个片段内完成局部理解,却不需要在数天甚至数周的时间尺度上保持一致记忆。
第一视角视频数据集如 Ego4D 和 Ego-Exo4D 提供了丰富的日常活动记录,但它们的设计目标主要是短时会话内的活动识别、技能学习和社交交互理解,缺乏跨天连续性和月级时间深度。EgoLife 虽然引入了多天第一视角基准,但其时间尺度为一周共同生活,评估重点与 EgoMonth 互补而非重叠。NTCIR Lifelog 和 LSC 任务涉及多月生活日志检索,但使用低帧率图像流而非连续视频,无法评估模型对连续时空流的记忆能力。
这种基准设计的空白导致了一个关键问题:当模型面对同一参与者在数周内的真实生活记录时,它能否像人类一样形成稳定的行为模式认知、定位稀疏的具体事件、并在需要时跨多个视频整合证据进行推理?EgoMonth 正是为回答这一问题而构建的。
核心创新
- 首个月级(20–120 天)第一视角视频理解基准,支持跨视频推理和参与者级连续性
- 基于认知科学的三层 14 任务评估框架,从行为模式固化到稀疏情景索引再到多证据级联推理
- 全人工撰写与交叉审核的 1,443 个 QA,包含需要跨多天多视频证据整合的问题
- 系统诊断当前 MLLM 的长期时空记忆瓶颈:时间注意力稀释、空间定位坍塌、缺乏结构化时空表征
方法概览
从 30 名志愿者收集 400+ 小时第一视角日常视频,经质量筛选保留 20 人 738 个片段、301 小时;用 Grounding DINO 1.5 与 SAM 2 做隐私匿名化;设计三层 14 任务认知框架(Schema Consolidation、Episodic Indexing、Cascading Reasoning),由人工撰写并三轮交叉审核 1,443 个四选一 QA(含跨视频问题);在 12 个开源与闭源 MLLM 上以统一多选题协议评估,报告宏平均 Avg 和微平均 Acc。
- 数据收集:从 30 名志愿者收集 400+ 小时第一视角日常视频,经质量筛选排除参与者流失和录制质量不足的样本,最终保留 20 人、738 个片段、约 301 小时(18,072 分钟),时间跨度 20–120 天。
- 隐私匿名化:使用 Grounding DINO 1.5 进行开放集目标检测以定位隐私敏感区域,再用 SAM 2 进行精确实例分割和掩码,并辅以人工复核。论文明确指出自动检测仍可能存在漏检风险。
- 三层认知框架:Schema Consolidation 层考察从数周重复线索推断习惯、性格等稳定行为模式的能力;Episodic Indexing 层要求在长视频流中定位稀疏、低冗余的具体证据;Cascading Reasoning 层要求跨时间、地点、视角整合多证据进行依赖敏感推理。
- 14 任务设计:框架细化为 14 个具体任务,涵盖行为模式固化、稀疏情景索引和多证据级联推理三个层次,任务难度随对长期记忆的需求递增。
- QA 构建:全部 1,443 个四选一 QA 由人工撰写,包含单视频问题和需要跨多个视频片段整合证据的跨视频问题,经过三轮交叉审核以保证质量。
- 评估协议:在 12 个开源与闭源 MLLM 上以统一多选题协议评估,采用确定性解码和固定帧采样,报告宏平均 Avg 和微平均 Acc 两个指标。
- 人类基线:3 名未参与出题的标注者观看完整视频后作答全部 1,443 题,Fleiss' κ 达到 0.78,表明标注一致性良好。
- 诊断分析:论文进一步分析了帧密度与记忆准确率的关系、参数规模对证据整合与精确索引的不同影响,以及模型在时间注意力和空间定位上的具体失败模式。
逐图理解论文
一个具体的失败

该表展示各模型在每个任务上的准确率。灰色行标记了至少一个模型低于随机水平的任务,直观暴露了模型在特定认知能力上的系统性失败。
研究空白

该表将 EgoMonth 与现有长视频基准进行多维度对比。EgoMonth 是唯一支持跨视频推理且具有月级参与者级连续性的基准,这一独特性在表中清晰可见。
三层认知框架与贡献

该表呈现 14 任务的认知层级分类。从 Schema Consolidation 到 Episodic Indexing 再到 Cascading Reasoning,任务对长期记忆的需求逐层递增。理解这个层级结构是把握论文评估框架的关键。
结论与意义

该表提供每位参与者的详细统计,包括片段数、总时长、时间跨度和短视频数量。它展示了数据集的个体差异和整体规模。
实验如何设计?
- 评估模型:12 个 MLLM,包括 Chat-UniVi-V1.5、LLaVA-NeXT-Video、MiniCPM-V 4.5、Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3-VL-30B-A3B、ShareGPT4Video、ST-LLM、VideoLLaMA3、VITA-1.5 和 Gemini 2.5 Pro。
- 人类基线:3 名标注者观看完整视频后独立作答,取平均作为人类参考分数,Fleiss' κ = 0.78。
- 帧密度分析:对比不同帧采样策略(如 VITA-1.5 的 16 帧与 Qwen2-VL 的 256 帧)在同一任务上的表现,以诊断时间注意力稀释现象。
- 参数规模分析:考察模型参数规模对证据整合类任务和精确索引类任务的不同影响。
- 跨基准对比:在 HLV-1K、Video-MME、MLVU、LVBench、LongVideoBench 等基准上收集已有分数进行扩展对比,论文注明部分分数来自不同版本或划分,直接比较需谨慎。
- 计算成本:开源模型评估总计算约 762 GPU-hours(NVIDIA RTX 4090 48GB),说明月级视频评估的计算开销显著。
关键结果与论文证据
- Gemini 2.5 Pro 以 Avg 71.8%、Acc 72.6% 成为最强模型,但仍比人类基线低 22.4 个百分点(第 8 页)。
- 人类基线 Avg 94.2%、Acc 95.1%,Fleiss' κ = 0.78,表明任务本身可靠且人类可解(第 8 页)。
- 最强开源模型 Qwen2.5-VL (32B) 仅达 Avg 58.0%、Acc 60.8%,与闭源模型差距明显(第 8 页)。
- Chat-UniVi-V1.5 在 Event Counting 任务上仅 8.8%,远低于随机水平 25%,说明模型在该任务上完全失效(第 8 页)。
- ShareGPT4Video 在 Cross-view Spatial Reasoning 任务上仅 20.0%,同样低于随机水平(第 8 页)。
- VITA-1.5 仅用 16 帧在 Event Counting 上达 41.6%,超过 Qwen2-VL 用 256 帧的 36.8%,证明冗余帧会稀释关键帧的注意力(第 8 页)。
- Qwen2.5-VL 在 Procedure Planning 任务上达 78.6%,为开源模型该任务最高分,说明部分任务对现有模型仍相对可解(第 8 页)。
- 数据集统计:738 个片段、18,072 分钟(约 301 小时)、20 名参与者、跨度 20–120 天(第 13 页)。
阅读时需要注意
- 仅 20 名参与者,人口统计覆盖有限,难以进行细粒度的亚组分析,结论的泛化性受限。
- 时间跨度限于月级到多月,未覆盖季节性变化或年度级的长期记忆与行为演变。
- 隐私匿名化依赖自动检测加人工复核,仍可能存在漏检风险,数据集为 research-only 许可,原始视频需额外审批。
- 模型评估采用确定性解码和固定帧采样,未报告统计显著性检验,跨基准对比中部分分数来自不同版本或划分。
关联工作
- Ego4D:大规模第一视角视频数据集,但缺乏跨天连续性和月级时间深度,无法评估持久记忆。
- Ego-Exo4D:第一/第三人称技能活动数据集,聚焦短时会话内的技能学习,与长期记忆评估目标不同。
- EgoLife:多天第一视角基准,时间尺度为一周共同生活,与 EgoMonth 的月级跨度互补。
- Video-MME、LongVideoBench、MLVU、LVBench:长视频理解基准,但均基于网络视频或孤立片段,无参与者级时间连续性。
- EgoSchema:长时第一视角 QA 诊断基准,聚焦单会话内的理解,不涉及跨天依赖。
- NTCIR Lifelog / LSC:多月生活日志检索任务,使用低帧率图像流而非连续视频,无法评估连续时空流的记忆。