ObjectStream:用隐式对象做记忆锚点,流式视频理解不再丢失细节

研究空白与核心贡献

流式视频理解面临一个核心矛盾:模型必须在未知未来查询的情况下持续保留有用证据,但内存和延迟约束又迫使它不断压缩历史信息。现有方法按 token 重要性或时间冗余来压缩,却忽略了一个关键事实——视频理解本质上是对持久对象及其演化的追踪。ObjectStream 提出了一种全新的思路:直接从冻结的 Video-LLM 特征空间中自动发现隐式对象,将它们作为记忆锚点,跨帧关联成持久轨迹,再配合对象突变检测和近期视觉窗口,构建紧凑而完整的流式记忆。在 OVO-Bench 和 StreamingBench 两个在线流式基准上,ObjectStream 让 Qwen2.5-VL-7B 的实时视觉感知得分大

FOLIO:无需训练的流式视频聚焦语义记忆系统

FOLIO系统架构概览

本文介绍FOLIO系统,一种面向流式视频理解的无训练方法。针对流式场景中记忆成本随视频增长及冗余细节保留的问题,FOLIO采用动态焦点状态引导记忆写入,区分重要实体与上下文。系统包含短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。实验显示,在OVO-Bench上Perception达82.0%,在StreamingBench上整体准确率达74.5%。需注意记忆写入成本随视频长度线性增长,且错误多源于检索证据区分度不足而非记忆缺失。