StreamTTT:流式VLM如何同时保住实时感知与长期记忆
StreamTTT通过将长期历史写入注意力上下文之外的在线更新快权重(TTT分支),同时保留短滑动KV缓存专用于近期证据,从而在流式VLM中同时保持实时感知精度并提升回溯记忆能力。
StreamTTT通过将长期历史写入注意力上下文之外的在线更新快权重(TTT分支),同时保留短滑动KV缓存专用于近期证据,从而在流式VLM中同时保持实时感知精度并提升回溯记忆能力。
本文揭示了视觉语言模型(VLM)中“问题优先”(Question-First)提示导致性能下降的悖论。通过Logit Lens和因果注意力阻断实验,我们发现问题优先虽能引导感知,但因距离过远导致下游读取失败。为此,提出无需训练的提示回音策略(Question Echoing和Image Echoing),在Qwen3-VL等模型上显著恢复并超越基线性能。