ReToken:一个可学习令牌,让VLM在长视频中精准定位关键帧

论文代表图:figure-04-p006-01

视觉语言模型处理长视频时,常因无关帧干扰而答非所问。传统基于注意力的内部检索信号不可靠,外部检索器又需重新编码图像。本文发现VLM的值空间比键空间携带更强的文本对齐信号,并据此提出ReToken——一个可学习的检索令牌。它附加在问题后,通过计算与各帧值向量的相似度来检索相关帧,仅增加极少参数。实验表明,在Visual Haystacks上,ReToken的检索召回率远超基于注意力的方法;在长视频基准LVBench上,零样本迁移即带来显著提升。但该方法需要两次前向传播,且在需要全局总结的任务上表现不佳。