EgoMonth:月级第一视角视频如何暴露多模态模型的长期记忆断层

快速导读:EgoMonth 提出首个跨 20–120 天、301 小时第一视角日常视频的月级基准,用 1,443 个人工 QA 和 14 任务三层认知框架评估 MLLM 的长期时空记忆,发现最强模型 Gemini 2.5 Pro 仅 71.8%,比人类低 22.4 个百分点。

EgoMonth 是首个面向长期时空记忆的月级第一视角视频基准。它从 30 名志愿者中筛选出 20 名参与者,收集了跨 20–120 天、总计约 301 小时的日常第一视角视频,并基于这些视频人工撰写了 1,443 个四选一 QA。与以往依赖网络视频或孤立会话的长视频基准不同,EgoMonth 的核心特征是参与者级连续性:同一人的多个片段共享持久环境、日常惯例和跨天依赖,使模型必须真正记住并整合分散在数周内的证据才能作答。

论文的评估结果揭示了一个清晰的断层:最强闭源模型 Gemini 2.5 Pro 的宏平均准确率仅为 71.8%,而人类基线达到 94.2%,差距超过 22 个百分点;最强开源模型 Qwen2.5-VL 的宏平均准确率只有 58.0%。更值得注意的是,多个模型在部分任务上低于随机水平,说明问题不是简单的容量不足,而是缺乏结构化的时空记忆机制。

英文题目:EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

论文出处:arXiv 每日论文精选 · arXiv:2608.13113

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有长视频理解基准的进步集中在分钟级到小时级的时间跨度上,例如 Video-MME、LongVideoBench、MLVU 和 LVBench 等。这些基准大多依赖网络视频、电影或剪辑片段,视频之间没有共享的时空背景,也没有跨片段的因果依赖。模型可以在单个片段内完成局部理解,却不需要在数天甚至数周的时间尺度上保持一致记忆。

第一视角视频数据集如 Ego4D 和 Ego-Exo4D 提供了丰富的日常活动记录,但它们的设计目标主要是短时会话内的活动识别、技能学习和社交交互理解,缺乏跨天连续性和月级时间深度。EgoLife 虽然引入了多天第一视角基准,但其时间尺度为一周共同生活,评估重点与 EgoMonth 互补而非重叠。NTCIR Lifelog 和 LSC 任务涉及多月生活日志检索,但使用低帧率图像流而非连续视频,无法评估模型对连续时空流的记忆能力。

这种基准设计的空白导致了一个关键问题:当模型面对同一参与者在数周内的真实生活记录时,它能否像人类一样形成稳定的行为模式认知、定位稀疏的具体事件、并在需要时跨多个视频整合证据进行推理?EgoMonth 正是为回答这一问题而构建的。

核心创新

  • 首个月级(20–120 天)第一视角视频理解基准,支持跨视频推理和参与者级连续性
  • 基于认知科学的三层 14 任务评估框架,从行为模式固化到稀疏情景索引再到多证据级联推理
  • 全人工撰写与交叉审核的 1,443 个 QA,包含需要跨多天多视频证据整合的问题
  • 系统诊断当前 MLLM 的长期时空记忆瓶颈:时间注意力稀释、空间定位坍塌、缺乏结构化时空表征

方法概览

从 30 名志愿者收集 400+ 小时第一视角日常视频,经质量筛选保留 20 人 738 个片段、301 小时;用 Grounding DINO 1.5 与 SAM 2 做隐私匿名化;设计三层 14 任务认知框架(Schema Consolidation、Episodic Indexing、Cascading Reasoning),由人工撰写并三轮交叉审核 1,443 个四选一 QA(含跨视频问题);在 12 个开源与闭源 MLLM 上以统一多选题协议评估,报告宏平均 Avg 和微平均 Acc。

  • 数据收集:从 30 名志愿者收集 400+ 小时第一视角日常视频,经质量筛选排除参与者流失和录制质量不足的样本,最终保留 20 人、738 个片段、约 301 小时(18,072 分钟),时间跨度 20–120 天。
  • 隐私匿名化:使用 Grounding DINO 1.5 进行开放集目标检测以定位隐私敏感区域,再用 SAM 2 进行精确实例分割和掩码,并辅以人工复核。论文明确指出自动检测仍可能存在漏检风险。
  • 三层认知框架:Schema Consolidation 层考察从数周重复线索推断习惯、性格等稳定行为模式的能力;Episodic Indexing 层要求在长视频流中定位稀疏、低冗余的具体证据;Cascading Reasoning 层要求跨时间、地点、视角整合多证据进行依赖敏感推理。
  • 14 任务设计:框架细化为 14 个具体任务,涵盖行为模式固化、稀疏情景索引和多证据级联推理三个层次,任务难度随对长期记忆的需求递增。
  • QA 构建:全部 1,443 个四选一 QA 由人工撰写,包含单视频问题和需要跨多个视频片段整合证据的跨视频问题,经过三轮交叉审核以保证质量。
  • 评估协议:在 12 个开源与闭源 MLLM 上以统一多选题协议评估,采用确定性解码和固定帧采样,报告宏平均 Avg 和微平均 Acc 两个指标。
  • 人类基线:3 名未参与出题的标注者观看完整视频后作答全部 1,443 题,Fleiss' κ 达到 0.78,表明标注一致性良好。
  • 诊断分析:论文进一步分析了帧密度与记忆准确率的关系、参数规模对证据整合与精确索引的不同影响,以及模型在时间注意力和空间定位上的具体失败模式。

逐图理解论文

一个具体的失败

一个具体的失败
Table 3: Per-task accuracy (%) on EgoMonth. Bold: best score within each model group; human performance is shown as reference. Avg: macro-average across tasks. Acc: accuracy of all questions. Human: average of three annotators. Gray rows indicate tasks where at least one model falls below random chance (25%).

该表展示各模型在每个任务上的准确率。灰色行标记了至少一个模型低于随机水平的任务,直观暴露了模型在特定认知能力上的系统性失败。

研究空白

研究空白
Table 2: Comparison of EgoMonth with existing long-video understanding benchmarks. EgoMonth is the only benchmark that supports cross-video reasoning with month-level per-participant continuity. Dashes (–) indicate that the corresponding statistic is not clearly reported or is not directly comparable across benchmarks. H, A, and LLM denote human annotation, automatic annotation, and LLM- assisted annotation, respectively.

该表将 EgoMonth 与现有长视频基准进行多维度对比。EgoMonth 是唯一支持跨视频推理且具有月级参与者级连续性的基准,这一独特性在表中清晰可见。

三层认知框架与贡献

三层认知框架与贡献
Table 1: EgoMonth 14-task taxonomy organized by cognitive levels. The hierarchy reflects increasing demands on long-term memory, from redundant behavioral schema consolidation to sparse episodic indexing and multi-evidence spatiotemporal reasoning.

该表呈现 14 任务的认知层级分类。从 Schema Consolidation 到 Episodic Indexing 再到 Cascading Reasoning,任务对长期记忆的需求逐层递增。理解这个层级结构是把握论文评估框架的关键。

结论与意义

结论与意义
Table 4 provides detailed per-participant statistics. We initially recruit 30 volunteers; 10 are excluded due to participant attrition or insufficient recording quality, leaving 20 participants in the final dataset.

该表提供每位参与者的详细统计,包括片段数、总时长、时间跨度和短视频数量。它展示了数据集的个体差异和整体规模。

实验如何设计?

  • 评估模型:12 个 MLLM,包括 Chat-UniVi-V1.5、LLaVA-NeXT-Video、MiniCPM-V 4.5、Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3-VL-30B-A3B、ShareGPT4Video、ST-LLM、VideoLLaMA3、VITA-1.5 和 Gemini 2.5 Pro。
  • 人类基线:3 名标注者观看完整视频后独立作答,取平均作为人类参考分数,Fleiss' κ = 0.78。
  • 帧密度分析:对比不同帧采样策略(如 VITA-1.5 的 16 帧与 Qwen2-VL 的 256 帧)在同一任务上的表现,以诊断时间注意力稀释现象。
  • 参数规模分析:考察模型参数规模对证据整合类任务和精确索引类任务的不同影响。
  • 跨基准对比:在 HLV-1K、Video-MME、MLVU、LVBench、LongVideoBench 等基准上收集已有分数进行扩展对比,论文注明部分分数来自不同版本或划分,直接比较需谨慎。
  • 计算成本:开源模型评估总计算约 762 GPU-hours(NVIDIA RTX 4090 48GB),说明月级视频评估的计算开销显著。

关键结果与论文证据

  • Gemini 2.5 Pro 以 Avg 71.8%、Acc 72.6% 成为最强模型,但仍比人类基线低 22.4 个百分点(第 8 页)。
  • 人类基线 Avg 94.2%、Acc 95.1%,Fleiss' κ = 0.78,表明任务本身可靠且人类可解(第 8 页)。
  • 最强开源模型 Qwen2.5-VL (32B) 仅达 Avg 58.0%、Acc 60.8%,与闭源模型差距明显(第 8 页)。
  • Chat-UniVi-V1.5 在 Event Counting 任务上仅 8.8%,远低于随机水平 25%,说明模型在该任务上完全失效(第 8 页)。
  • ShareGPT4Video 在 Cross-view Spatial Reasoning 任务上仅 20.0%,同样低于随机水平(第 8 页)。
  • VITA-1.5 仅用 16 帧在 Event Counting 上达 41.6%,超过 Qwen2-VL 用 256 帧的 36.8%,证明冗余帧会稀释关键帧的注意力(第 8 页)。
  • Qwen2.5-VL 在 Procedure Planning 任务上达 78.6%,为开源模型该任务最高分,说明部分任务对现有模型仍相对可解(第 8 页)。
  • 数据集统计:738 个片段、18,072 分钟(约 301 小时)、20 名参与者、跨度 20–120 天(第 13 页)。

阅读时需要注意

  • 仅 20 名参与者,人口统计覆盖有限,难以进行细粒度的亚组分析,结论的泛化性受限。
  • 时间跨度限于月级到多月,未覆盖季节性变化或年度级的长期记忆与行为演变。
  • 隐私匿名化依赖自动检测加人工复核,仍可能存在漏检风险,数据集为 research-only 许可,原始视频需额外审批。
  • 模型评估采用确定性解码和固定帧采样,未报告统计显著性检验,跨基准对比中部分分数来自不同版本或划分。

关联工作

  • Ego4D:大规模第一视角视频数据集,但缺乏跨天连续性和月级时间深度,无法评估持久记忆。
  • Ego-Exo4D:第一/第三人称技能活动数据集,聚焦短时会话内的技能学习,与长期记忆评估目标不同。
  • EgoLife:多天第一视角基准,时间尺度为一周共同生活,与 EgoMonth 的月级跨度互补。
  • Video-MME、LongVideoBench、MLVU、LVBench:长视频理解基准,但均基于网络视频或孤立片段,无参与者级时间连续性。
  • EgoSchema:长时第一视角 QA 诊断基准,聚焦单会话内的理解,不涉及跨天依赖。
  • NTCIR Lifelog / LSC:多月生活日志检索任务,使用低帧率图像流而非连续视频,无法评估连续时空流的记忆。

发表评论