ObjectStream:用隐式对象做记忆锚点,流式视频理解不再丢失细节

研究空白与核心贡献

流式视频理解面临一个核心矛盾:模型必须在未知未来查询的情况下持续保留有用证据,但内存和延迟约束又迫使它不断压缩历史信息。现有方法按 token 重要性或时间冗余来压缩,却忽略了一个关键事实——视频理解本质上是对持久对象及其演化的追踪。ObjectStream 提出了一种全新的思路:直接从冻结的 Video-LLM 特征空间中自动发现隐式对象,将它们作为记忆锚点,跨帧关联成持久轨迹,再配合对象突变检测和近期视觉窗口,构建紧凑而完整的流式记忆。在 OVO-Bench 和 StreamingBench 两个在线流式基准上,ObjectStream 让 Qwen2.5-VL-7B 的实时视觉感知得分大