ObjectStream:用隐式对象做记忆锚点,流式视频理解不再丢失细节

快速导读:提出无需训练、即插即用的 ObjectStream 框架,将冻结 Video-LLM 特征空间中的隐式对象作为记忆锚点,组织持久对象历史、瞬时变化和近期视觉上下文,在流式和离线长视频基准上显著提升性能并降低显存与延迟。

ObjectStream 是一个面向流式视频理解的训练无关框架,其核心思想是将冻结 Video-LLM 特征空间中的隐式对象作为记忆锚点,组织持久对象历史、瞬时变化和近期视觉上下文。与现有方法按 token 重要性或时间冗余压缩视觉历史不同,ObjectStream 首次以持久、演化的对象为中心来组织流式记忆,从而在长期推理中保留细粒度的对象证据。

该框架包含三个协同工作的记忆模块:隐式对象锚定记忆(Latent Object-Anchored Memory)负责发现和跟踪隐式对象,对象条件时序残差(Object-Conditioned Temporal Residuals)保留对象级突变周围的短期证据,近期视觉定位窗口(Recent Visual Grounding Window)保留最新若干帧的原始 token 以支持实时定位。三者共同构成紧凑的流式视觉记忆,在显著提升性能的同时大幅降低显存与延迟。

英文题目:ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

论文出处:arXiv 每日论文精选 · arXiv:2607.28312

原始论文:PDF / 论文页面

这篇论文解决什么问题?

流式视频理解要求模型在未知未来查询的情况下持续保留有用视觉证据,并受限于严格的内存和延迟约束。随着视频流不断增长,视觉 token 的历史上下文迅速膨胀,模型必须在有限的内存预算内决定保留哪些信息、丢弃哪些信息。

现有训练无关的流式记忆方法主要沿三条路径压缩视觉上下文:基于 token 重要性的剪枝(如 QueryStream)、基于时间冗余的帧选择、以及基于片段相关性的 KV-cache 压缩(如 StreamKV)。这些方法虽然有效降低了内存占用,但都缺乏对持久对象及其演化的显式建模,导致细粒度对象信息在长期推理中逐渐丢失。

一个典型的失败场景是:当用户在一段长视频中询问“那个穿红衣服的人后来去了哪里”时,现有方法可能因为早期帧中该对象的视觉 token 被压缩或丢弃而无法准确回答。这是因为它们没有将“穿红衣服的人”作为一个持久对象来追踪和维护其视觉证据。

ObjectStream 正是针对这一研究空白提出的:能否在不依赖外部检测器或分割模型的前提下,直接从冻结的 Video-LLM 特征空间中自动发现和跟踪隐式对象,并以这些对象为锚点来组织流式记忆?

核心创新

  • 首次将冻结 Video-LLM 特征空间中的隐式对象作为流式记忆锚点,无需外部检测器或分割模型。
  • 提出对象条件时序残差模块,显式保留对象级突变周围的短期证据,弥补平滑对象记忆的不足。
  • 设计统一的三组件记忆框架(持久对象历史、瞬时变化、近期上下文),在训练无关、即插即用的前提下实现高效流式推理。

方法概览

ObjectStream 包含三个记忆模块:(1) 隐式对象锚定记忆(Latent Object-Anchored Memory),从冻结视觉 token 中通过查询无关显著性估计和空间聚类发现隐式对象候选,跨帧关联为持久对象轨迹,并在受限预算下保留对象级证据;(2) 对象条件时序残差(Object-Conditioned Temporal Residuals),检测对象级突变并保留局部原始 token;(3) 近期视觉定位窗口(Recent Visual Grounding Window),保留最新若干帧的原始 token 以支持实时定位。三者共同构成紧凑的流式视觉记忆。

  • 隐式对象发现(第3页):ObjectStream 从冻结的视觉 token 中通过查询无关显著性估计来发现隐式对象候选。具体而言,它计算每个 token 与帧级上下文向量的余弦距离作为显著性得分,然后对高显著性 token 进行空间聚类,形成隐式对象区域。这一过程完全在冻结特征空间中完成,无需任何外部检测器或分割模型。
  • 跨帧对象关联(第4页):对于每一帧发现的隐式对象,ObjectStream 通过特征相似度匹配将其与已有的对象轨迹关联。使用指数移动平均(EMA)平滑更新对象轨迹的特征表示,并在受限预算下保留每个对象的代表性 token,形成持久对象记忆。
  • 对象条件时序残差(第4页):为弥补平滑对象记忆对瞬时变化的不足,该模块检测对象级突变——当某帧中对象的特征与 EMA 表示差异超过阈值时,保留该帧中该对象周围的原始 token 作为短期证据。这确保了模型不会错过对象状态的突然变化。
  • 近期视觉定位窗口(第3页):始终保留最新若干帧的完整原始 token,以支持对当前时刻的实时定位和即时查询。该窗口与持久对象记忆和时序残差互补,形成完整的时间覆盖。
  • 三组件协同(第3页):三个记忆模块的输出被拼接为统一的视觉上下文,送入 Video-LLM 进行推理。持久对象历史提供长期对象演化证据,时序残差捕获瞬时变化,近期窗口支持实时定位,三者共同构成紧凑而完整的流式记忆。
  • 内存预算控制(第4页):ObjectStream 通过对象集预算 M 和每对象 token 数 ki 来控制总内存占用。对象轨迹的维护采用先进先出策略,当对象数量超过预算时,移除最不活跃的轨迹。
  • 与外部方法的对比(第7页):论文对比了多种对象记忆构建策略,包括 Patch Top-K、DINOv2 聚类和 SAM+DINOv2。ObjectStream 的隐式对象发现方法在性能与效率之间取得了最佳平衡,而 SAM+DINOv2 虽然产生更精细的分割掩码,但时间关联一致性较差。
  • 训练无关特性:整个框架无需任何微调或适配训练,直接作用于冻结的 Video-LLM 特征空间,实现了真正的即插即用。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: Comparison between existing streaming memory and ObjectStream. Existing methods compress streaming ob- servations into coarse latent representations, whereas Object- Stream organizes memory around latent objects to preserve fine-grained object evidence for long-term reasoning.

图1对比了现有流式记忆方法与ObjectStream的核心区别。左侧的现有方法将流式观察压缩为粗糙的隐式表示,丢失了细粒度对象信息;右侧的ObjectStream围绕隐式对象组织记忆,保留了持久对象证据。注意观察右侧如何将不同对象(如人和物体)分别维护为独立的记忆锚点。

研究空白与核心贡献

研究空白与核心贡献
Figure 2: Overview of ObjectStream. It comprises three memory modules: Latent Object-Anchored Memory discovers and tracks latent object anchors and stores their persistent evidence; Object-Conditioned Temporal Residuals preserve transient changes; and the Recent Visual Grounding Window retains recent observations for immediate grounding.

图2展示了ObjectStream的整体架构。三个记忆模块以不同颜色标识:隐式对象锚定记忆(蓝色)负责发现和跟踪对象,对象条件时序残差(橙色)捕获突变,近期视觉定位窗口(绿色)保留最新帧。注意三个模块的输出如何拼接为统一的视觉上下文送入Video-LLM。

结论与价值

结论与价值
Table 1: Performance comparison on OVO-Bench and StreamingBench. For OVO-Bench, we report real-time visual perception scores and the average backward tracing score. For StreamingBench, we report real-time category scores and the average score. Bold indicates the best result, and underlining indicates the second-best result. † indicates the backbone model.

表1展示了OVO-Bench和StreamingBench上的性能对比。重点关注ObjectStream相对于全token基线和FluxMem的提升幅度,以及在不同backbone规模(7B和72B)上的一致性增益。

实验如何设计?

  • 在线流式基准:OVO-Bench(评估实时视觉感知和反向追踪能力)和 StreamingBench(评估实时类别得分),均采用在线流式协议,模型在每一帧到达时即时更新记忆并可能收到查询。
  • 离线长视频基准:EgoSchema 和 VideoMME-Long,用于验证 ObjectStream 在离线场景下的通用性,此时模型可以访问完整视频但内存预算仍然受限。
  • Backbone 模型:所有实验均基于 Qwen2.5-VL 系列(7B 和 72B),以验证方法在不同规模模型上的效果。
  • 对比方法:包括训练无关的流式记忆方法 FluxMem、QueryStream、OASIS,以及全 token 基线和随机丢弃基线。
  • 组件消融:通过逐步移除近期视觉定位窗口、隐式对象锚定记忆和对象条件时序残差,分析各组件的贡献。
  • 对象构建策略分析:对比 Patch Top-K、DINOv2 聚类、SAM+DINOv2 和 ObjectStream 的隐式对象发现,评估不同策略的性能与效率。

关键结果与论文证据

  • OVO-Bench 实时视觉感知得分:Qwen2.5-VL-7B + ObjectStream 从 63.3 提升至 73.3(+10.0),反向追踪得分从 44.6 提升至 49.5(第6页,表1)。
  • StreamingBench 平均得分:从 73.9 提升至 76.8(+2.9),在所有对比方法中取得最优(第6页,表1)。
  • 离线基准表现:VideoMME-Long 从 51.3 提升至 54.0(+2.7),EgoSchema 从 58.5 提升至 60.8(+2.3),同时丢弃 82.5% 的视觉 token(第7页,表3)。
  • 效率提升:ObjectStream 将峰值 GPU 显存和 TTFT 降低约 50%(与全 token 基线相比),在第1页摘要中报告。
  • 组件消融结果:移除近期视觉定位窗口导致性能显著下降,验证了实时定位信息的重要性;隐式对象锚定记忆和时序残差各自贡献稳定增益(第6页,表2)。
  • 对象构建策略对比:ObjectStream 以 19.89 GB 峰值显存和 6.697 s TTFT 取得 73.3 的 OVO-Bench 实时视觉感知得分,优于 Patch Top-K、DINOv2 聚类和 SAM+DINOv2(第7页,表4)。
  • 定性分析:ObjectStream 的隐式对象发现能够跨帧维护任务相关对象的状态,而 SAM+DINOv2 虽然产生更精细的分割掩码,但时间关联一致性较差(第7页,图4)。
  • Backbone 扩展性:Qwen2.5-VL-72B + ObjectStream 同样取得显著提升,验证了方法在不同规模模型上的有效性(第6页,表1)。

阅读时需要注意

  • 隐式对象发现依赖冻结的 Video-LLM 特征空间,可能受限于 backbone 模型的对象感知能力。若 backbone 本身对某些对象类型不敏感,ObjectStream 无法弥补这一缺陷。
  • 对象轨迹维护和突变检测中的阈值(如匹配阈值 θ、分位数 q)需手动设定,可能影响跨场景泛化能力,在不同视频域或帧率下可能需要重新调参。
  • 在极端长时流式场景下,对象集预算 M 和每对象 token 数 ki 的固定分配策略可能不够灵活,无法根据视频内容的复杂度动态调整资源分配。
  • 论文声称“训练无关”,但所有实验均基于 Qwen2.5-VL 系列 backbone,对其他 Video-LLM(如 LLaVA、InternVL 等)的即插即用性需进一步验证。
  • 对象条件时序残差模块依赖对象轨迹的匹配质量,若跨帧关联错误,可能引入噪声 token,反而干扰模型推理。

关联工作

  • FluxMem:训练无关的流式记忆方法,引入层次化视觉记忆平衡长期历史与近期观察。ObjectStream 在 OVO-Bench 和 StreamingBench 上均优于 FluxMem,验证了以对象为中心的记忆组织优于层次化压缩。
  • QueryStream:训练无关的查询感知 token 剪枝方法,根据当前查询动态选择相关 token。ObjectStream 在 OVO-Bench 上表现更优,说明查询无关的持久对象记忆比查询感知的临时剪枝更有效。
  • OASIS:训练无关的按需层次化事件记忆方法。ObjectStream 在 OVO-Bench 上取得更高得分,表明对象级证据组织优于事件级记忆。
  • VideoLLM-Online:训练依赖的在线视频指令微调方法。ObjectStream 以训练无关方式实现流式理解,避免了昂贵的微调成本,具有更强的实用性和即插即用性。

发表评论