快速导读:StreamTTT通过将长期历史写入注意力上下文之外的在线更新快权重(TTT分支),同时保留短滑动KV缓存专用于近期证据,从而在流式VLM中同时保持实时感知精度并提升回溯记忆能力。
流式视频语言模型面临一个根本性矛盾:要准确回答关于当前场景的问题,模型需要把注意力集中在最近的视觉证据上;但要回答关于几分钟前发生事件的问题,模型又必须保留足够的历史信息。现有方法大多通过压缩、检索或token合并把历史注入注意力上下文,这不可避免地占用上下文容量并稀释近期证据的注意力权重。
StreamTTT的核心主张是:长期记忆不必挤进注意力上下文。它把每个自注意力块改造成混合层——滑动窗口注意力(SWA)处理近期KV缓存,并行TTT分支用大块TTT(LaCT)在线更新快权重存储跨块历史,输出经可学习门控融合。这样,近期感知和长期回忆各走各的通道,互不干扰。
英文题目:StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs
论文出处:arXiv 每日论文精选 · arXiv:2608.13416
原始论文:PDF / 论文页面
这篇论文解决什么问题?
SimpleStream(Shen et al., 2026)已经揭示了感知-记忆权衡:缩短上下文能提升当前场景感知,但损害长期回忆;注入历史上下文又会稀释近期证据。这个权衡的根源在于注意力机制本身——所有信息都必须通过同一个有限的上下文窗口竞争注意力分数。
TTT(test-time training)提供了一条不同的路径:把快速更新的参数作为序列状态,在注意力之外存储压缩历史。Sun et al.(2024)和Zhang et al.(2025b)奠定了快权重记忆的理论基础,Titans(Behrouz et al., 2025)进一步改进了TTT的记忆动态。但此前TTT在流式音视频中的应用(如video-SALMONN S)聚焦生成或领域特定记忆,尚未系统解决通用流式VLM的感知-记忆权衡。
StreamTTT的研究空白在于:没有人把TTT快权重作为注意力上下文之外的长期记忆通道,与滑动窗口注意力并行工作,并在统一的流式评测框架下验证其效果。
核心创新
- 提出双记忆架构:短滑动KV缓存专用于近期证据,并行TTT快权重状态在注意力上下文外存储压缩长期历史,避免历史token稀释近期注意力
- 构建112.4K实时QA训练语料:将Streamo主动QA的查询时间重定位到答案时间(tq:=ta),并新增动作QA、空间推理(ADT)、未来动作预测(FAP)和字幕监督
- 联合训练离线长视频QA与实时QA,实现实时感知与回溯记忆的互补监督
- 实现跨窗口全局连续的M-RoPE位置编码,使分窗推理等价于单次全视频前向
方法概览
StreamTTT基于Qwen3-VL,将每个自注意力块改造为混合层:滑动窗口注意力(SWA)处理近期KV缓存,并行TTT分支用大块TTT(LaCT)在线更新快权重存储跨块历史,输出经可学习门控tanh(α)融合(初始接近零)。推理按时间窗口顺序进行,KV缓存裁剪至最近L个token,TTT状态固定大小跨窗口携带;M-RoPE位置通过运行标量偏移保持全局连续。训练联合使用119K离线长视频QA和112.4K实时QA语料(将Streamo主动QA的查询时间移至答案时间tq:=ta,并补充动作、空间推理、预测和字幕数据)。
- 混合层设计:每个自注意力块包含两个并行分支。SWA分支处理最近L个token的KV缓存,TTT分支用LaCT规则在线更新快权重,两个分支的输出经可学习门控tanh(α)融合,初始α接近零,让模型从纯SWA行为平滑过渡到混合行为。
- LaCT更新规则:按chunk聚合加权损失进行单次更新,避免逐token更新的计算开销,使TTT分支在流式推理中保持高效。
- 推理时间窗口划分:视频按墙钟时间划分为连续窗口,每个窗口内做SWA+TTT前向,窗口间KV缓存裁剪至最近L个token,TTT状态以固定大小跨窗口携带,实现常数内存的流式推理。
- M-RoPE全局连续位置编码:通过运行标量偏移保持跨窗口的位置连续性,使分窗推理在位置编码层面等价于单次全视频前向,避免窗口边界的位置断裂。
- 训练数据构建:联合使用119K离线长视频QA和112.4K实时QA语料。实时QA的关键改造是把Streamo主动QA的查询时间从原始提问时间移到答案时间(tq:=ta),让模型在答案事件发生时被提问,从而训练其利用当前证据回答的能力。
- 新增监督类型:在实时QA语料中补充动作QA、空间推理(ADT)、未来动作预测(FAP)和字幕监督,覆盖更丰富的流式理解场景。
逐图理解论文
感知与记忆的冲突

观察StreamTTT-4B与SimpleStream在OVO-Bench双轨上的对比:实时感知保持在同一水平,而回溯追踪明显提升。这直接展示了论文的核心主张——不牺牲当前感知即可改善长期回忆。
核心区分:记忆不必挤进注意力

关注混合层的两个并行分支:SWA处理近期KV缓存,TTT分支用LaCT更新快权重,输出经tanh(α)门控融合。注意初始α接近零的设计,说明模型从纯SWA行为平滑过渡。
训练数据与评测设计

光有架构还不够,训练数据必须让模型学会在答案事件发生的时刻被提问。论文把Streamo的主动QA查询时间从原始提问时间移到答案时间,并补充动作问答、空间推理、未来动作预测和字幕监督,构建了十一万条实时QA语料,与离线长视频QA联合训练。评测在OVO-Bench的双轨上进行:实时感知和回溯追踪,同时用StreamingBench的RTVU子集补充验证。
消融揭示TTT分支的必要性

对比四种配置的双轨得分,重点看'混合架构+联合监督'行:它同时保持了高实时感知和高情景回忆。禁用TTT分支后两轨都大幅下降,证明TTT分支对双轨性能都不可或缺。
结论与边界

观察4K窗口下有无TTT状态的差距:OVO-EPM上TTT几乎完全弥补了窗口缩小带来的损失,但EgoSchema上只恢复了一部分。这揭示了TTT对回忆密集型任务的补偿边界。
实验如何设计?
- 主评测在OVO-Bench上进行,包含Real-Time Visual Perception和Backward Tracing双轨,以2 fps采样帧。
- 补充评测使用StreamingBench的RTVU子集,衡量实时视觉理解能力。
- 消融实验(Table 2)对比记忆架构×训练数据的四种组合:冻结recency基线、仅滑动KV+联合监督、混合架构+不同监督、混合架构+联合监督。
- Table 3在匹配内存预算下对比学习型快权重与启发式压缩方法(StreamMem、HERMES),所有行使用Qwen3-VL-4B骨干和联合训练数据。
- Figure 3分析滑动窗口预算从4K到64K tokens时,有无TTT状态对OVO-EPM、EgoSchema-Subset和VideoMME-Long的影响。
关键结果与论文证据
- StreamTTT-4B在OVO-Bench双轨平均68.59,实时感知78.9,回溯追踪58.3(Table 1,第6页)。
- 相比SimpleStream-4B,实时感知提升1.4(78.9 vs. 77.5),回溯追踪提升3.7(58.3 vs. 54.6)(Table 1,第6页)。
- StreamingBench RTVU上,StreamTTT-4B得分80.48,仅比SimpleStream-8B(80.59)低0.11,参数量减半(Table 1,第6页)。
- 消融显示混合架构+联合监督达到最优平衡:RT Avg 78.85,ER 59.55,Avg 69.20;禁用TTT分支后RT Avg降至68.19,ER降至49.58(Table 2,第7页)。
- 匹配预算下,快权重(78.85/59.55)优于StreamMem(75.48/55.82)和HERMES(75.11/57.34)(Table 3,第8页)。
- 4K窗口预算下,TTT在OVO-EPM上恢复约97%的窗口扩展增益(60.27 vs. 60.61),但在EgoSchema上仅恢复约40%(47.4 vs. 66.8),说明TTT对回忆密集型任务的补偿有限(Figure 3,第8页)。
- 当整个视频可放入64K窗口时,TTT配置(65.6)略低于纯滑动窗口注意力(66.8),表明TTT是补充而非替代(Figure 3,第8页)。
阅读时需要注意
- 固定大小的TTT状态仍是有损摘要,在回忆密集型视频上无法完全替代全注意力。
- 当视频可完整放入上下文时,TTT配置略低于纯SWA,说明TTT的价值主要体现在长视频场景。
- Table 3中启发式方法未做方法特定重训练,对比评估的是完整配置而非孤立记忆机制。
- 论文标注为work in progress(预印本),结果可能随后续版本更新。
关联工作
- SimpleStream(Shen et al., 2026)是主要对比对象,它揭示了感知-记忆权衡并提供了recency基线。
- TTT/LaCT(Sun et al., 2024; Zhang et al., 2025b)提供快权重记忆的理论基础,Titans(Behrouz et al., 2025)改进了TTT的记忆动态。
- Streamo(Xia et al., 2026)提供主动QA数据源,StreamTTT将其查询时间重定位以构建实时QA语料。
- HERMES(Zhang et al., 2026a)和StreamMem(Yang et al., 2025b)作为Table 3的启发式对比基线,分别代表KV缓存分层记忆和查询无关的KV缓存记忆。