StreamTTT:流式VLM如何同时保住实时感知与长期记忆

快速导读:StreamTTT通过将长期历史写入注意力上下文之外的在线更新快权重(TTT分支),同时保留短滑动KV缓存专用于近期证据,从而在流式VLM中同时保持实时感知精度并提升回溯记忆能力。

流式视频语言模型面临一个根本性矛盾:要准确回答关于当前场景的问题,模型需要把注意力集中在最近的视觉证据上;但要回答关于几分钟前发生事件的问题,模型又必须保留足够的历史信息。现有方法大多通过压缩、检索或token合并把历史注入注意力上下文,这不可避免地占用上下文容量并稀释近期证据的注意力权重。

StreamTTT的核心主张是:长期记忆不必挤进注意力上下文。它把每个自注意力块改造成混合层——滑动窗口注意力(SWA)处理近期KV缓存,并行TTT分支用大块TTT(LaCT)在线更新快权重存储跨块历史,输出经可学习门控融合。这样,近期感知和长期回忆各走各的通道,互不干扰。

英文题目:StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.13416

原始论文:PDF / 论文页面

这篇论文解决什么问题?

SimpleStream(Shen et al., 2026)已经揭示了感知-记忆权衡:缩短上下文能提升当前场景感知,但损害长期回忆;注入历史上下文又会稀释近期证据。这个权衡的根源在于注意力机制本身——所有信息都必须通过同一个有限的上下文窗口竞争注意力分数。

TTT(test-time training)提供了一条不同的路径:把快速更新的参数作为序列状态,在注意力之外存储压缩历史。Sun et al.(2024)和Zhang et al.(2025b)奠定了快权重记忆的理论基础,Titans(Behrouz et al., 2025)进一步改进了TTT的记忆动态。但此前TTT在流式音视频中的应用(如video-SALMONN S)聚焦生成或领域特定记忆,尚未系统解决通用流式VLM的感知-记忆权衡。

StreamTTT的研究空白在于:没有人把TTT快权重作为注意力上下文之外的长期记忆通道,与滑动窗口注意力并行工作,并在统一的流式评测框架下验证其效果。

核心创新

  • 提出双记忆架构:短滑动KV缓存专用于近期证据,并行TTT快权重状态在注意力上下文外存储压缩长期历史,避免历史token稀释近期注意力
  • 构建112.4K实时QA训练语料:将Streamo主动QA的查询时间重定位到答案时间(tq:=ta),并新增动作QA、空间推理(ADT)、未来动作预测(FAP)和字幕监督
  • 联合训练离线长视频QA与实时QA,实现实时感知与回溯记忆的互补监督
  • 实现跨窗口全局连续的M-RoPE位置编码,使分窗推理等价于单次全视频前向

方法概览

StreamTTT基于Qwen3-VL,将每个自注意力块改造为混合层:滑动窗口注意力(SWA)处理近期KV缓存,并行TTT分支用大块TTT(LaCT)在线更新快权重存储跨块历史,输出经可学习门控tanh(α)融合(初始接近零)。推理按时间窗口顺序进行,KV缓存裁剪至最近L个token,TTT状态固定大小跨窗口携带;M-RoPE位置通过运行标量偏移保持全局连续。训练联合使用119K离线长视频QA和112.4K实时QA语料(将Streamo主动QA的查询时间移至答案时间tq:=ta,并补充动作、空间推理、预测和字幕数据)。

  • 混合层设计:每个自注意力块包含两个并行分支。SWA分支处理最近L个token的KV缓存,TTT分支用LaCT规则在线更新快权重,两个分支的输出经可学习门控tanh(α)融合,初始α接近零,让模型从纯SWA行为平滑过渡到混合行为。
  • LaCT更新规则:按chunk聚合加权损失进行单次更新,避免逐token更新的计算开销,使TTT分支在流式推理中保持高效。
  • 推理时间窗口划分:视频按墙钟时间划分为连续窗口,每个窗口内做SWA+TTT前向,窗口间KV缓存裁剪至最近L个token,TTT状态以固定大小跨窗口携带,实现常数内存的流式推理。
  • M-RoPE全局连续位置编码:通过运行标量偏移保持跨窗口的位置连续性,使分窗推理在位置编码层面等价于单次全视频前向,避免窗口边界的位置断裂。
  • 训练数据构建:联合使用119K离线长视频QA和112.4K实时QA语料。实时QA的关键改造是把Streamo主动QA的查询时间从原始提问时间移到答案时间(tq:=ta),让模型在答案事件发生时被提问,从而训练其利用当前证据回答的能力。
  • 新增监督类型:在实时QA语料中补充动作QA、空间推理(ADT)、未来动作预测(FAP)和字幕监督,覆盖更丰富的流式理解场景。

逐图理解论文

感知与记忆的冲突

感知与记忆的冲突
Figure 1: StreamTTT-4B retains recency-level perception while improving backward tracing on OVO-Bench (Niu et al., 2025).

观察StreamTTT-4B与SimpleStream在OVO-Bench双轨上的对比:实时感知保持在同一水平,而回溯追踪明显提升。这直接展示了论文的核心主张——不牺牲当前感知即可改善长期回忆。

核心区分:记忆不必挤进注意力

核心区分:记忆不必挤进注意力
Figure 2: StreamTTT overview. (a) At token t, the pretrained sliding-window attention branch maps (xt, Kt−1) to (oSWA

关注混合层的两个并行分支:SWA处理近期KV缓存,TTT分支用LaCT更新快权重,输出经tanh(α)门控融合。注意初始α接近零的设计,说明模型从纯SWA行为平滑过渡。

训练数据与评测设计

训练数据与评测设计
Table 4: Composition of the 112.4K real-time training corpus. The upper block converts Streamo’s proactive QA by moving each query to its annotated answer time (tq := ta; §B.2). A dash indicates that the source construction does not provide a task label. The lower block contains examples constructed or repurposed in this work; stars mark the two annotation-derived datasets detailed in §B.3 and §B.4. The separate 119K offline whole-video sample is not included.

光有架构还不够,训练数据必须让模型学会在答案事件发生的时刻被提问。论文把Streamo的主动QA查询时间从原始提问时间移到答案时间,并补充动作问答、空间推理、未来动作预测和字幕监督,构建了十一万条实时QA语料,与离线长视频QA联合训练。评测在OVO-Bench的双轨上进行:实时感知和回溯追踪,同时用StreamingBench的RTVU子集补充验证。

消融揭示TTT分支的必要性

消融揭示TTT分支的必要性
Table 2: Memory architecture × training data. All trained cells use the Qwen3-VL-4B backbone, the same optimization schedule and seed. Following Shen et al. (2026), evaluation covers OVO- Bench’s Real-Time Visual Perception and Backward Tracing categories at 2 fps. “Sliding KV only” disables the TTT branch while leaving the remaining architecture unchanged. The frozen recency baseline (Shen et al., 2026-style, 4 frames) requires no training. The hybrid model with joint supervision achieves the strongest balance across the two tracks. Because HLD primarily measures hallucination robustness rather than episodic event recall, we report ER = (EPM + ASI)/2 as the recall metric.

对比四种配置的双轨得分,重点看'混合架构+联合监督'行:它同时保持了高实时感知和高情景回忆。禁用TTT分支后两轨都大幅下降,证明TTT分支对双轨性能都不可或缺。

结论与边界

结论与边界
Figure 3: Window-budget analysis. Accuracy with and without the TTT state as the sliding attention window grows from 4K to 64K tokens.

观察4K窗口下有无TTT状态的差距:OVO-EPM上TTT几乎完全弥补了窗口缩小带来的损失,但EgoSchema上只恢复了一部分。这揭示了TTT对回忆密集型任务的补偿边界。

实验如何设计?

  • 主评测在OVO-Bench上进行,包含Real-Time Visual Perception和Backward Tracing双轨,以2 fps采样帧。
  • 补充评测使用StreamingBench的RTVU子集,衡量实时视觉理解能力。
  • 消融实验(Table 2)对比记忆架构×训练数据的四种组合:冻结recency基线、仅滑动KV+联合监督、混合架构+不同监督、混合架构+联合监督。
  • Table 3在匹配内存预算下对比学习型快权重与启发式压缩方法(StreamMem、HERMES),所有行使用Qwen3-VL-4B骨干和联合训练数据。
  • Figure 3分析滑动窗口预算从4K到64K tokens时,有无TTT状态对OVO-EPM、EgoSchema-Subset和VideoMME-Long的影响。

关键结果与论文证据

  • StreamTTT-4B在OVO-Bench双轨平均68.59,实时感知78.9,回溯追踪58.3(Table 1,第6页)。
  • 相比SimpleStream-4B,实时感知提升1.4(78.9 vs. 77.5),回溯追踪提升3.7(58.3 vs. 54.6)(Table 1,第6页)。
  • StreamingBench RTVU上,StreamTTT-4B得分80.48,仅比SimpleStream-8B(80.59)低0.11,参数量减半(Table 1,第6页)。
  • 消融显示混合架构+联合监督达到最优平衡:RT Avg 78.85,ER 59.55,Avg 69.20;禁用TTT分支后RT Avg降至68.19,ER降至49.58(Table 2,第7页)。
  • 匹配预算下,快权重(78.85/59.55)优于StreamMem(75.48/55.82)和HERMES(75.11/57.34)(Table 3,第8页)。
  • 4K窗口预算下,TTT在OVO-EPM上恢复约97%的窗口扩展增益(60.27 vs. 60.61),但在EgoSchema上仅恢复约40%(47.4 vs. 66.8),说明TTT对回忆密集型任务的补偿有限(Figure 3,第8页)。
  • 当整个视频可放入64K窗口时,TTT配置(65.6)略低于纯滑动窗口注意力(66.8),表明TTT是补充而非替代(Figure 3,第8页)。

阅读时需要注意

  • 固定大小的TTT状态仍是有损摘要,在回忆密集型视频上无法完全替代全注意力。
  • 当视频可完整放入上下文时,TTT配置略低于纯SWA,说明TTT的价值主要体现在长视频场景。
  • Table 3中启发式方法未做方法特定重训练,对比评估的是完整配置而非孤立记忆机制。
  • 论文标注为work in progress(预印本),结果可能随后续版本更新。

关联工作

  • SimpleStream(Shen et al., 2026)是主要对比对象,它揭示了感知-记忆权衡并提供了recency基线。
  • TTT/LaCT(Sun et al., 2024; Zhang et al., 2025b)提供快权重记忆的理论基础,Titans(Behrouz et al., 2025)改进了TTT的记忆动态。
  • Streamo(Xia et al., 2026)提供主动QA数据源,StreamTTT将其查询时间重定位以构建实时QA语料。
  • HERMES(Zhang et al., 2026a)和StreamMem(Yang et al., 2025b)作为Table 3的启发式对比基线,分别代表KV缓存分层记忆和查询无关的KV缓存记忆。

发表评论