ReToken:一个可学习令牌,让VLM在长视频中精准定位关键帧

快速导读:提出一个可学习的检索令牌ReToken,通过在VLM的值空间中计算相似度来检索相关视觉信息,显著提升长上下文图像和视频问答的性能。

视觉语言模型(VLM)在回答关于图像或视频的问题时,面临一个核心挑战:当输入包含大量视觉信息时,模型容易被无关内容分散注意力,导致性能下降。现有的解决方案要么依赖外部检索器对图像重新编码,增加了计算开销;要么利用VLM内部的注意力分数进行检索,但研究发现注意力分数与内容相关性之间的关联很弱,检索结果不可靠。

本文提出ReToken,一个轻量级的可学习检索令牌,通过在VLM的值(Value)空间中计算相似度来定位与问题相关的视觉帧。该方法仅需在输入序列中增加一个令牌嵌入,并训练一个投影矩阵,即可实现高效的内部检索。更令人惊讶的是,仅在多图像问答数据上训练的ReToken,能够零样本迁移到长视频理解任务,并取得显著性能提升。

英文题目:ReToken: One Token to Improve Vision–Language Models for Visual Retrieval

论文出处:arXiv 每日论文精选 · arXiv:2607.28627

原始论文:PDF / 论文页面

对应视频标题:ReToken:一个可学习令牌,让VLM在长视频中精准定位关键帧|推荐指数:★★★★★

这篇论文解决什么问题?

在长上下文视觉理解中,VLM需要从大量候选帧中找出与问题相关的信息。以Visual Haystacks基准为例,模型需要从50甚至100张干扰图像中找到包含答案的那一张。直接让VLM处理所有图像不仅计算量大,而且模型容易被干扰项误导,准确率随图像数量增加而急剧下降。

一种直观的解决方案是利用VLM内部的注意力机制:既然模型在生成答案时会“关注”输入中的某些部分,那么注意力分数最高的帧理应是与问题最相关的。然而,论文通过实验揭示了一个关键事实:注意力分数与相关性之间的关联非常弱。在视频检索任务中,基于注意力分数选出的Top-1帧落入真实时间窗口的概率极低,几乎等同于随机猜测。

外部检索器(如CLIP、SigLIP2)虽然检索质量较高,但需要将图像重新编码为独立的特征向量,再与文本查询进行匹配。这不仅引入了额外的计算开销,还割裂了检索与生成两个阶段,使得检索到的图像特征无法直接复用VLM已有的编码。

因此,研究团队提出了一个核心问题:能否在VLM内部找到一个比注意力更可靠的检索信号,从而在不显著增加计算负担的前提下,实现精准的视觉信息定位?

核心创新

  • 发现并验证了在预训练VLM中,值空间比传统的查询-键空间能提供更强的视觉检索信号。
  • 提出ReToken,一个轻量级的可学习检索令牌,仅增加一个令牌嵌入和一个投影矩阵,即可实现高效的查询相关视觉检索。
  • 展示了仅在多图像问答数据上训练的ReToken,能够零样本迁移到长视频理解任务,并取得显著提升。

方法概览

提出ReToken,一个可学习的嵌入令牌,附加在问题令牌后。在VLM的最后一层,通过计算ReToken输出经投影矩阵Wr后的向量与各帧均值值向量的余弦相似度作为检索分数,并使用类别平衡的二元交叉熵损失进行训练。推理时采用两阶段检索-回答流程:先缓存视频特征,再通过ReToken检索相关帧的KV缓存生成答案。默认冻结VLM,仅训练ReToken和投影矩阵。

  • 关键发现:值空间优于键空间。在Transformer的注意力机制中,每个令牌会经过查询(Query)、键(Key)、值(Value)三个投影。研究发现,VLM的值投影携带了比键投影更强的文本对齐信号。具体来说,将问题中目标短语对应的值向量与各帧的值向量计算相似度,可以更准确地定位相关图像。但直接对问题令牌的值向量取均值会引入噪声,因为问题中并非所有词都与检索目标相关。
  • ReToken的设计。为解决上述问题,论文提出在问题令牌序列末尾附加一个可学习的嵌入令牌——ReToken。该令牌经过VLM各层的处理后,其最后一层的输出通过一个可训练的投影矩阵Wr,转化为检索查询向量。同时,每帧图像的所有视觉令牌的值向量被池化为一个代表向量。检索分数即定义为查询向量与各帧代表向量之间的余弦相似度。
  • 训练策略。训练时,使用带有帧级相关性标签的数据(来自MIRAGE数据集)。ReToken的输出经过投影后,与各帧的值向量计算相似度,得到检索分数。使用类别平衡的二元交叉熵损失进行监督,以应对正负样本不均衡的问题。默认设置下,VLM的所有参数保持冻结,仅训练ReToken嵌入和投影矩阵Wr,参数量极小。
  • 两阶段推理流程。推理分为两个阶段:第一阶段,将所有输入帧送入VLM进行编码,缓存每帧的值向量和KV cache;第二阶段,给定问题,将ReToken附加在问题后送入VLM,计算检索分数,选出得分最高的K帧,然后仅使用这些帧的KV cache生成答案。这种设计使得视频编码只需进行一次,后续不同问题可复用缓存。
  • 与Q-Former的区别。Q-Former(BLIP-2)也使用可学习查询令牌来压缩视觉特征,但ReToken与之有本质不同:ReToken是动态生成的,其输出依赖于当前问题;它接受显式的检索监督信号;且仅使用单个令牌,而非一组查询令牌。
  • 与SPRING的关系。SPRING为检索增强的语言模型引入了可学习令牌,ReToken将其思想扩展到视觉检索领域,并创新性地在值空间而非键空间中进行操作,从而获得了更强的检索信号。
  • 部分微调的权衡。实验发现,如果解冻VLM的前几层进行联合训练,可以在图像检索任务上获得更好的性能,因为微调后的KV cache更“干净”,干扰更少。但这种微调会损害模型在视频任务上的零样本迁移能力,因为模型可能过拟合于图像数据的分布。
  • 训练数据过滤。论文对MIRAGE数据集进行了过滤,移除了那些不需要精确图像定位即可回答的问题(如纯文本推理题),保留了约70%的样本用于训练ReToken。实验表明,过滤后的数据训练的ReToken性能更好。

逐图理解论文

注意力的失效

注意力的失效
Figure 1: Attention-based retrieval mechanisms are not effective for retrieving relevant visual information in VLMs. (a) shows attention scores from question tokens (as queries) to frame tokens (as keys), across frames in one video; (b) shows whether the top-1 retrieved frame falls within the ground-truth time window (240 candidate frames per video on average, sampled at 0.5 FPS).

图1展示了基于注意力的检索为何失效。左图显示问题令牌对各帧的注意力分数分布,可见注意力分数与帧内容的相关性很弱;右图显示基于注意力选出的Top-1帧落入真实时间窗口的概率极低,说明注意力不是可靠的检索信号。

值空间的发现

值空间的发现
Figure 2: Retrieval Example. Question/Sentence: "For the image with a cow, is there a truck?". Target phrase: "a cow".

那VLM内部到底有没有更可靠的检索信号?研究团队发现,Transformer的值投影——也就是Value空间——携带了比键投影更强的文本对齐信号。简单说,用问题中关键短语的值向量去和各帧的值向量算相似度,能更准地找到相关图像。但问题在于,直接对问题里所有词的值取平均会引入大量噪声,因为不是每个词都对检索有用。这就引出了一个核心矛盾:值空间信号好,但缺乏一个干净的查询表示。

ReToken的设计与训练

ReToken的设计与训练
Figure 3: Training Pipeline. The visual tokens, question tokens, and a learnable embedding (RETOKEN) are fed into the LLM decoder. The RETOKEN output from the final layer serves as a retrieval query, scoring each frame based on its cosine similarity to the frame’s pooled value features. The resulting scores are supervised using ground-truth frame-relevance labels and a class-balanced binary cross-entropy loss. By default, we train RETOKEN while keeping the VLM frozen. The generation loss is used only during VLM partial fine-tuning setting.

图3展示了ReToken的训练流程。视觉令牌、问题令牌和可学习的ReToken嵌入一起送入VLM解码器,ReToken在最后一层的输出经投影矩阵Wr后,与各帧池化后的值向量计算余弦相似度作为检索分数,使用二元交叉熵损失进行监督。

核心结论

核心结论
Table 2: Retrieval Strategy Comparison. We compare ReToken against different retrievers on Visual Haystacks with retrieval budget K“1. “GT Cache” means using the KV cache of the ground truth image as input and serves as the oracle upper bound for any retriever. All results are based on Qwen3VL-8B with the VLM frozen.

表2对比了不同检索策略在Visual Haystacks上的Recall@1。ReToken在C=2时达到88.5,远超ReKV的63.3;在C=50时仍有64.7,而ReKV降至1.8,几乎失效。这证明了值空间检索的鲁棒性。

价值与局限

价值与局限
Table 11: RETOKEN helps most when the evidence is localized and nameable, and hurts when it is dispersed across the video. Per-type accuracy on LVBench. K=100. #QA denotes the number of questions per type; a question can carry multiple type labels.

表11按问题类型分析了ReToken的增益与损失。在需要定位具体物体或动作的问题上提升显著,但在摘要类问题上反而下降,揭示了方法的核心局限:当证据分散时,检索式方法不再适用。

实验如何设计?

  • 主要基准:Visual Haystacks,评估VLM从多张图像中检索信息并回答问题的能力,上下文图像数量C从2到100不等,检索预算K=1。
  • 视频基准:QAEgo4DTest-MC(第一人称长视频问答)和LVBench(长视频理解),用于评估零样本迁移能力。
  • 对比方法:包括外部检索器SigLIP2、基于注意力的内部检索ReKV、均匀采样基线,以及使用真实标签帧的Oracle上限。
  • 基础模型:主要使用Qwen3VL-8B和InternVL3.5-8B,默认冻结VLM参数。
  • 效率评估:在单张H100 GPU上测量长视频问答的延迟和显存占用,对比不同检索策略的推理成本。
  • 错误分析:在LVBench上按问题类型(如物体识别、动作理解、时序推理等)分析ReToken的增益与损失。

关键结果与论文证据

  • 检索质量显著提升:在Visual Haystacks上,当上下文包含50张图像时,ReToken的Recall@1达到64.7,而基于注意力的ReKV仅为1.8(第7页表2)。这验证了值空间检索远优于注意力检索。
  • 问答准确率随上下文规模增长的优势扩大:在Qwen3VL-8B上,当上下文图像从10张增加到50张时,ReToken相对于均匀采样的提升从约5个百分点扩大到13.4个百分点(第9页表4)。上下文越大,检索的价值越明显。
  • 零样本迁移到长视频:仅在图像数据上训练的ReToken,在LVBench长视频基准上为Qwen3VL-8B带来8.0个百分点的提升(第9页表6)。且视频越长,提升越显著,在超过1小时的视频上增益最大。
  • 值空间优于键空间:消融实验直接对比了基于键和基于值的检索,值空间在所有设置下均显著优于键空间(第10页表7)。训练曲线也显示,基于值的ReToken收敛更快,且相关与不相关帧之间的分数差距更大(第17页图6)。
  • 单令牌足够:使用多个ReToken令牌并未带来性能提升,单个令牌即可达到相当的效果(第18页表13),体现了设计的简洁性。
  • 允许ReToken关注图像很重要:如果让ReToken在注意力计算中跳过视觉令牌(即不关注图像),性能会下降,说明ReToken需要“看到”图像才能做出准确的检索判断(第18页表14)。
  • 效率开销可控:在长视频问答中,ReToken的两阶段推理相比均匀采样增加了约20%的延迟,但准确率提升远超这一成本(第10页表10)。视频编码只需一次,后续每个问题的检索开销很小。
  • 局限性:在需要全局总结的任务上表现不佳。错误分析显示,ReToken在“摘要”类问题上反而降低了准确率,因为这类问题的证据分散在整个视频中,而非集中在少数几帧(第11页表11)。

阅读时需要注意

  • 需要两次前向传播(一次编码、一次检索+生成),增加了少量推理延迟和显存需求,尽管编码可复用。
  • 训练数据仅限于多图像问答,缺乏对视频时序结构的显式建模,可能限制了在需要时序推理的任务上的表现。
  • 在需要全局总结或证据分散的任务上表现不佳,因为ReToken的设计假设答案集中在少数相关帧中。
  • 部分微调VLM层虽能提升图像任务性能,但会损害视频任务的零样本迁移能力,需要在通用性和任务特异性之间权衡。

关联工作

  • ReKV:基于注意力的内部视觉检索方法,直接使用问题令牌对图像令牌的注意力分数作为检索信号。本文证明了这种方法在长上下文中几乎失效,并提出了值空间检索作为替代方案。
  • MIRAGE:多图像问答框架,提出了Visual Haystacks基准和相应的训练数据。ReToken使用其数据训练,并在其基准上进行主要评估。
  • SigLIP2:作为外部图像-文本检索器的代表,需要独立编码图像,检索质量高但计算开销大,且无法复用VLM的内部特征。
  • Q-Former (BLIP-2):使用一组可学习查询令牌压缩视觉特征,但查询令牌是静态的,不依赖于具体问题,且缺乏显式的检索监督。
  • SPRING:为检索增强的语言模型引入可学习令牌,ReToken将其思想从文本检索扩展到视觉检索,并创新性地在值空间中操作。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ReToken:一个令牌提升视觉–语言模型的视觉检索能力

Yao Xiao1 Reuben Tan2 Zhen Zhu1,3˚ Yuqun Wu1 Jianfeng Gao2 Derek Hoiem1 1伊利诺伊大学厄巴纳-香槟分校,2微软研究院,3Google DeepMind 1{yaox11, dhoiem}@illinois.edu

摘要

长视觉上下文对视觉–语言模型构成挑战:随着干扰项数量增加,性能会下降,且受GPU内存限制,一次性处理所有令牌在计算上不可行。我们提出RETOKEN,一个单一的可学习嵌入,作为显式检索目标进行训练,它仅从预填充的KV cache中选择一小部分与查询相关的视觉令牌。RETOKEN仅在合成图像问答数据集上训练,便在图像和视频基准上取得了稳定的提升:在Visual Haystacks上,Qwen3VL-8B提升13.4个点,InternVL3.5提升12.4个点(相对提升>20%);在LVBench上,它以零样本方式迁移到长视频,为Qwen3VL-8B带来8.0个点的增益。得益于其轻量级设计,训练和长视频推理均可在单个H100上完成。代码见:https://github.com/avaxiao/ReToken。

3500 真实时间窗口 20.0 ReToken(均值 = 8.5%) 18.4[cs.CV] 3000 17.5 注意力检索(均值 = 5.1%) 2500 (%) 15.0 分数 2000 12.5 10.0 1500 Recall@1 6.8 注意力 7.5 1000 5.0

500 0 20 40 60 80 100 120 0 10 20 30 35 帧索引 层索引

(a) 注意力分数无法区分相关帧与干扰帧。 (b) ReToken在最后一层实现了超过3倍的召回率。QAEgo4DTest-MC上的逐层VLM Recall@1

图1:基于注意力的检索机制在VLM中无法有效检索相关视觉信息。(a) 展示了从问题令牌(作为查询)到帧令牌(作为键)的注意力分数,覆盖一个视频中的所有帧;(b) 展示了排名第一的检索帧是否落在真实时间窗口内(平均每个视频240个候选帧,以0.5 FPS采样)。arXiv:2607.28627v1

1 引言

长视觉上下文,例如来自图像集合或长达一小时的视频,现已进入视觉–语言模型(VLM)的输入范围[26, 38, 4, 9]。然而,VLM在回答

˚本工作完成时作者在UIUC(目前在Google DeepMind)。

预印本。

第 2 页

当只有一小部分图像或帧与提示相关时,从长视觉上下文中回答问题[45],有时在GPU内存限制下一次性处理完整上下文在计算上是不可行的。因此,处理长视觉输入归结为一个检索问题:选择一小部分帧或令牌,模型可以从中产生正确答案。在处理文本时,得益于广泛的长上下文训练[47, 16],大型语言模型(LLMs)产生的注意力信号可以对输入上下文具有选择性。对于VLMs,我们发现类似的信号并不可靠:文本与视觉特征之间的注意力与相关性呈弱相关,如图1a所示,并且基于注意力的检索器在Qwen3VL-8B的QAEgo4DTest-MC上,各层的平均Recall@1仅为5.1%(图1b)。

观察有效的方法,我们发现了一个显著的不对称性:在一个受控的双图像设置中,将精确的目标短语与平均视觉值投影进行匹配,而不是与键进行匹配,在Qwen3VL上将Recall@1从65.7提高到78.0,在InternVL3.5上从78.8提高到83.8(表1)。值承载着通过注意力实际传播的内容,它们似乎为基于文本的视觉检索提供了更好的空间。然而,对于任意检索文本,值-值池化并非普遍优于查询-键评分。简单地对所有问题令牌取平均会引入噪声,逆转了值空间的优势。

基于这一发现,我们提出了RETOKEN,一个单一的可学习嵌入,它被附加到问题中,并明确地作为检索目标进行训练。RETOKEN通过其投影嵌入与帧在最后一层的平均值向量之间的余弦相似度对每一帧进行评分,并使用类别平衡的二元交叉熵损失,根据真实相关性标签进行监督。该令牌和一个单一的投影矩阵是唯一增加的参数;VLM默认被冻结。

尽管其占用空间极小,RETOKEN在图像和视频基准测试中都带来了一致的提升。在Visual Haystacks [45]上,它将Qwen3VL-8B [4]提高了13.4个点,将InternVL3.5 [42]提高了12.4个点,相当于超过20%的相对增益。更值得注意的是,尽管仅在多图像问答上训练,RETOKEN能够泛化以提升长视频理解性能:它零样本迁移到长视频,在LVBench [41]上为Qwen3VL-8B带来了8.0个点的提升,该基准测试的平均视频长度超过一小时。

我们的贡献如下:

• 我们发现,在值空间中计算的检索分数,而非传统的查询-键空间,为检索视觉信息提供了显著更强的信号。 • 我们引入了RETOKEN,一个轻量级的可学习检索令牌,使预训练的VLMs能够更有效地识别相关的视觉信息。 • 我们展示了仅在多图像问答上训练的RETOKEN能够零样本迁移到长视频基准测试,这为可扩展的长上下文多模态推理提供了一条实用的路径。

2 相关工作

视觉检索。视觉检索的主流方法是训练图像-文本嵌入模型,以对齐视觉和语言特征空间,例如使用双编码器如CLIP [31]、Perception Encoder [5]和SigLIP2 [39],或者将VLM适配为通用嵌入器,如E5-V [18]和LamRA [27]。虽然有效,但所有这些方法都作为独立于VLM的外部检索器运行:相关图像必须首先由检索器选择,然后由VLM重新编码以生成答案。长视频问答中的一个相关家族将一个独立的定位器与一个回答模型串联起来:SeViLA [49]将BLIP-2 [22]重新用作关键帧定位器和回答器,而VideoAgent [43]和VideoTree [44]则构建了智能体流水线,迭代地为LLM检索和描述关键帧。另一条工作线源于长上下文语言建模,它将模型自身的注意力分数视为检索信号,在单次前向传播中统一检索与生成。InfLLM [46]和EM-LLM [14]在NLP中通过基于查询到键的注意力选择键值块,有效地展示了这一点,而ReKV [13]则将该机制未经修改地迁移到视觉领域。我们诊断了VLMs中基于注意力的检索的局限性,并提出了RETOKEN,它通过一个可学习的令牌在值空间中执行检索。

长上下文理解。在处理长视觉上下文时,先前的工作遵循三个主要方向。基于记忆的方法,如MovieChat [35]和MA-LMM [17],在流式输入上维护一个固定大小的记忆库,合并或驱逐旧内容以限制状态。令牌压缩方法,如Chat-UniVi [19]、LLaMA-VID [23]、LongVU [32]和Video-XL [33]

第 3 页

在将视觉令牌送入大语言模型之前,对其进行剪枝、合并或总结,以缩短前缀长度并降低注意力和KV-cache成本。这两类方法均独立于查询来界定视觉上下文。而基于检索的方法则将上下文选择推迟到推理阶段,挑选与查询相关的子集以保留细粒度证据:Goldfish [3] 将视频切分为片段,并根据字幕与查询的相似度检索Top-K片段;Video-RAG [28] 利用来自ASR、OCR和目标检测器的视觉对齐辅助文本增强检索;DrVideo [29] 则将视频转换为长文档,并为大语言模型检索与问题相关的段落。然而,此类方法的最终任务精度受限于检索器而非大语言模型,我们的工作正是直接针对这一瓶颈。

用于视觉聚合的可学习令牌。RETOKEN与在VLM中引入可学习令牌以聚合或检索视觉内容的方法最为直接相关。BLIP-2 [22] 中的Q-Former和Flamingo [1] 中的Perceiver Resampler使用一小组可学习查询,将可变长度的视觉特征压缩为固定大小的表示,以供冻结的大语言模型使用;InstructBLIP [11] 则将Q-Former扩展为文本条件化。这些模块作为编码器与大语言模型之间桥梁的一部分,与视觉-语言对齐联合训练,并生成多个令牌(通常为32或64个),旨在将视觉内容传递到生成阶段。SPRING [51] 在外部检索到的段落前添加可插拔的软提示令牌,以帮助冻结的纯文本大语言模型消费这些段落。Video-XL [33] 中的视觉总结令牌类似地将一块视觉KV压缩为单个令牌。RETOKEN在三个维度上有所不同:(i)运行机制。Q-Former和提示调优将可学习令牌用作静态的、与查询无关的输入条件。相比之下,ReToken是动态生成的。一个首轮占位符生成一个输出令牌,该令牌检索与查询相关的视觉KV上下文。(ii)监督方式。Q-Former在对齐或生成损失下作为视觉压缩器进行训练,而RETOKEN则通过直接针对最终层值向量计算的显式检索损失进行监督。(iii)容量。我们的方法仅需单个令牌,而非一组32-64个令牌。贡献的第二部分是诊断性的:在预训练的VLM中,注意力(查询-键)分数对于视觉检索并不可靠,而值空间则携带了强得多的信号。

3 方法

在本节中,我们首先在3.1节分析基于注意力的检索方法在识别相关视觉令牌方面的局限性。基于这些见解,我们在3.2节讨论所提出的RETOKEN方法,该方法使用一个可学习的令牌嵌入来帮助计算更具信息量的相关视觉令牌检索分数。

3.1 基于注意力的检索

在我们的实验设置中,我们考虑一个基于仅解码器语言模型的VLM,该模型包含N个Transformer层 tL1, . . . , LNu。给定输入问题令牌Tt和视觉令牌Iv,VLM基于条件概率 ppy | Iv, Ttq 自回归生成响应y。对于多图像和视频输入,视觉令牌被划分为F帧,Iv “ tIpfqv uFf“1,每帧贡献M{F个令牌(其中M为视觉令牌总数)。对于长视频,M可能过大,导致全上下文推理不可行。因此,我们的目标是检索出K个最相关帧的子集(其中K ! F),其令牌足以回答问题。

注意力分数作为检索信号。在每一层 l P t1, 2, . . . , Nu,VLM计算注意力分数 Aplq “ QplqKplqJ{ d,该分数指示每个令牌对最终响应的贡献程度。注意力贡献较高的令牌可被解释为与问题更相关。在我们的分析中,我们使用最先进的ReKV [13] 方法,该方法直接使用注意力分数作为检索分数,并在帧级别进行聚合。在第l层,我们计算每帧视觉令牌的平均键向量和问题令牌的平均查询向量如下:

1{ \ba { \fr c r l)}_f = a \mathbf{I}_v^{(f)}|}\sum_{i\in\mathbf{I}_v^{(f)}}\mathbf{k}^{(l)}_i,\qquad\bar{\mathbf{q}}^{(l)}\frac{1}{E}\sum_{t=1}^{E}\mathbf{q}^{(l)}_t (1) \mathb f {k}}^{( }{|

其中E表示问题令牌总数。然后,帧级检索分数 splqf 和Top-K帧选择计算如下:

\m a \ bar { \math bf{q}}^{(l)\top\bar{\mathbf{k}}^{(l)}_f,\qquad\mathcal{S}_K^{(l)}\mathrm{TopK}\mathbf{s}_f^{(l)}{eq:attn-retrieval} (2) t hbf {s}_f^{( l )} =

第 4 页

图2:检索示例。 问题/句子:“For the image with a cow, is there a truck?”。目标短语:“a cow”。

其中 K 表示在第 l 层与问题最相关的 K 个帧。给定逐层检索集 tK uNl“1,模型通过冻结的 VLM 重新运行生成过程,并采用逐层稀疏注意力:在每一层 l,问题和答案令牌仅关注属于 K 的视觉令牌。因此,第 l 层的缩减视觉上下文为 K ss,答案基于此层依赖的上下文 K s, Tts 进行自回归解码。

基于注意力的检索的局限性。 尽管基于注意力的检索很直观,但两个结构性问题促使我们提出新方法。首先,注意力是为下一个令牌预测而非检索而训练的,因此高注意力令牌并不保证与查询相关内容对应。这种不匹配因典型 VLM 训练数据的构成而加剧:输入的图像或视频几乎总是与问题完全相关,因此模型从未被要求从多个视觉输入中进行选择。其后果在图像和视频场景中均可见:在 Visual Haystacks [45] 上,即使在最简单的双图像情况下,逐层 ¯qJ¯kf 检索器的 recall@1 也仅为 63.3%(表 1);在长视频 QAEgo4DTest-MC 上,其各层平均 recall@1 仅为 5.1%(图 1b)。其次,对问题令牌取平均以形成单一查询本身是一种启发式方法,由此产生的排序会随检索文本的选择而变化。如表 1 所示,用直接指代目标实体的目标短语替换完整的问题句子可提高 Recall@1。图 2 展示了一个问题句子及其目标短语。

为何值空间携带检索信号。 表 1:Value ˆ Value 信息量更大,但对输入敏感。在 2 张输入图像中,基于检索分数检索 1 张图像的 Recall@1。 一个更可靠的信号存在于值投影中。在 Transformer 注意力层内,一个令牌的值携带了传播给任何关注它的令牌的内容,而查询-键内积仅决定该内容如何被聚合。因此,在每个帧内对值投影进行池化,可以得到该帧对关注令牌所贡献内容的表示,这使得值特征比键特征对检索文本更敏感。表 1 在两个骨干模型上一致证实了这一点:使用指代目标实体的精确目标短语,在 Qwen3VL 上,值空间池化以 78.0% 的 recall@1 识别出真实图像,而相应的查询-键分数为 65.7%;在 InternVL3.5 上,这一对比为 83.8% 对 78.8%。这与视觉分割中的观察结果相呼应,即有报告指出值特征信息量更大,而查询-键特征可被替代的聚合信号替换 [50, 40, 21];特别是 TextRegion [48] 表明,在图像-文本模型中,最终注意力块中的值特征富含视觉-语言语义,而注意力权重主要充当聚合机制。然而,这种敏感性是双刃剑:使用完整的问题句子时,平均操作混合了许多无信息令牌,由此产生的噪声查询会削弱甚至逆转值空间优势。因此,值空间对精确的检索目标有利,而对噪声目标不利。

3.2 ReToken:用于视觉检索的单一令牌

为改进检索,我们引入了 RETOKEN,这是一个单一的可学习嵌入 Xr P Rd,它被附加到问题之后,并被显式训练为检索目标。RETOKEN 解决了

第 5 页

图3:训练流程。视觉令牌、问题令牌以及一个可学习的嵌入(RETOKEN)被送入LLM解码器。最终层输出的RETOKEN用作检索查询,根据其与各帧池化值特征的余弦相似度对每帧进行评分。所得分数通过真实帧相关性标签和类别平衡的二元交叉熵损失进行监督。默认情况下,我们训练RETOKEN时保持VLM冻结。生成损失仅在VLM部分微调设置下使用。

检索分数。给定包含视觉令牌Iv、问题令牌Tt和附加检索令牌Xr的输入序列,我们在最终层LN通过一个轻量级投影Wr P Rdˆd计算检索分数,该投影与Xr共同构成唯一新增的参数。第f帧的检索分数为投影嵌入与该帧均值值向量¯vpNqf之间的余弦相似度, \ba { { r {(N)} = \ fr ac1 } {|\ma t hbf {I} _v^{(f (3) \mathb f {v}}_f^ 在推理时,我们仅在最终层LN计算一次TopKpspNqf,并将其广播至所有层,而非维护逐层的子集K u。由于训练数据为短上下文且无需检索,我们在训练时不应用此操作。

训练。默认情况下,我们在VLM冻结的状态下训练RETOKEN;仅更新检索令牌Xr和单个最终层投影Wr。我们使用检索损失Lret监督这些参数,该损失将最终层检索分数与真实相关性标签yf P t0, 1u进行比较。令F` “ tf : yf “ 1u和F´ “ tf : yf “ 0u分别表示相关和不相关图像的集合。为防止损失被不相关图像主导,我们采用类别平衡的二元交叉熵,其中正负项分别取平均, { f h = \m a t \te xt {ret} } {1} {|\mathca l{F}^{+}|}\sum_{f\mathcal{F}^{+}}\sigma(\taus_f^{(N)})\frac{1}{|\mathcal{F}^{-}|}\sum_{f\mathcal{F}^{-}}\sigma\taus_f^{(N)}){eq:retoken-bce} (4) cal L}_{ – \ rac 其中spNqf为图像f在最终层LN的检索分数,σp¨q为sigmoid函数,τ为可学习的logit尺度参数。

我们还探索了一种部分微调变体,即微调VLM的早期层,以赋予视觉表示更大的灵活性。在此设置下,训练由两个互补损失驱动,如图3所示。除上述检索损失外,我们使用生成损失Lgen,即对答案的标准下一令牌预测损失,以保持模型的问答能力,并防止解冻层在仅使用Lret时发生漂移。总损失为 {L}=\mathcal{L}_{\text{ret}}+\lambda\,\mathcal{L}_{\text{gen}} (5) \mat h c al

推理。在测试时,我们采用两阶段先检索后回答的流程(图4)。视频首先被编码一次,随后每个问题检索出一个视觉KV cache子集用于答案生成。

第 6 页

步骤一:一次性缓存视频 步骤二:检索后回答

层 L1 · · · LN ¯v(N)1 , ¯v(N)2 , . . . , ¯v(N)F 问题 I(1)v KV ·· ·· ·· KV

VLM VLM I(2)v KV ·· ·· ·· KV 问题 VLM 投影后的ReToken 相似度 … top-K 答案 I(Fv ) KV ·· ·· ·· KV ReToken 帧

F 帧 持久化视觉 KV cache

图 4: 推理流程。我们的方法首先缓存所有输入帧的特征。给定文本查询,ReToken 检索相关帧,并基于其缓存特征生成答案。

一次性缓存视频:在视频输入阶段,VLM 处理视觉令牌,并将每层产生的 KV cache 存储到持久化缓存中。对于短视频,这是一次完整的全上下文前向传播。对于长视频,我们遵循 ReKV [13] 的方法,使用滑动窗口注意力掩码逐块编码视频:每个块仅关注最近的 lm 个视觉令牌,同时其新产生的 KV 状态被追加到缓存中。当 GPU 内存受限时,较早的 KV 状态可卸载至 CPU 内存。

检索后回答:给定一个问题,我们在缓存的视觉上下文上通过冻结的 VLM 执行两次前向传播。第一次传播计算来自最后一层的检索集 SpNqK;第二次传播基于所选帧生成答案。我们使用两次传播是因为 RETOKEN 仅在 LN 层受到监督(公式 4)。第一次传播使检索令牌能够充分融合文本和视觉内容,而第二次传播则使其能够关注一组一致的视觉令牌,这与其训练方式相匹配。

第一次传播 – 检索。我们将检索令牌 Xr 附加到问题后,并在缓存的视觉 KV 上执行第一次传播。对于短视频,Xr 在 l < N 的层关注所有缓存的视觉令牌,并在 LN 层通过公式 3 计算索引 SpNqK。对于长视频,早期层的注意力预算无法容纳完整缓存,因此在每个 l < N 的层,我们限制 Xplqr 的注意力如下:(1) 通过该层冻结的值投影,投影上下文化的 Xplqr;(2) 计算此投影与帧在 l 层的均值向量 ¯vplqf 之间的余弦相似度,为每一帧打分;(3) 在计算 l 层输出前,将 Xplqr 的注意力限制在此分数下的 top-K1 帧内。我们默认使用 K1 = 256,这使每个早期层的注意力保持在 GPU 内存内,同时为最后一层的排序优化留出空间。在 LN 层,我们随后在每帧值均值上计算公式 3,以获得按原始时间戳重新排序的 SpNqK。 我们注意到此检索传播预算 K1 与回答阶段的预算 K 之间存在不对称性:RETOKEN 的检索传播在每个早期层关注最多 K1 = 256 帧,这与回答时使用的 K 不同。因此,RETOKEN 在排序候选帧时能访问更多视觉上下文,而在生成答案时仍仅使用 K 帧的视觉上下文。

第二次传播 – 回答。对于每一层 l,我们仅加载属于 SpNqK 中帧的视觉 KV cache,并在此缩减后的视觉上下文上,结合问题执行标准生成传播。因此,回答阶段关注约 K ¨ M{F 个视觉令牌,而非全部 M 个,而昂贵的视频编码仅对每个视频执行一次。当对同一视频提出多个问题时,此方法尤为高效。完整的提示模板以及 RETOKEN 如何与上下文视觉令牌和问题交互的示例,请参见补充材料 A。

4 实验

4.1 设置

实现细节。我们对 RETOKEN 及所有基线方法使用贪婪解码配置。我们在图像问答(QA)数据集上,使用 Qwen3VL-8B 和 InternVL3.5-8B 训练 RETOKEN。对于默认的冻结 VLM 设置,我们使用 64 的有效批量大小,学习率

第 7 页

训练时,我们采用 3×10⁻⁴ 的学习率,在单张 H100 GPU 上对可学习令牌训练 3 个 epoch,模型为 Qwen3VL-8B。 由于 InternVL3.5-8B 需要更多令牌来表示单张图像,导致计算和内存开销显著增加,我们仅对其训练一个 epoch。我们采用线性预热后接余弦学习率衰减的策略。在部分微调设定下,学习率为 2×10⁻⁵,有效批次大小为 64。由于该设定收敛迅速,并在一个 epoch 后开始过拟合,我们在第一个 epoch 结束时应用早停。在此设定下,Qwen3VL-8B 的训练在单张 H100 GPU 上约需 4 小时。

对于长视频推理,我们使用 128 帧的编码块大小,以及长度为 lₘ=30,000 个令牌的滑动窗口,这约对应 153 帧(每帧 196 个令牌)。

训练数据集。我们默认的多图像训练数据集来自 MIRAGE [45] 微调数据集,其中每个样本都标注了每张图像的相关/不相关标签。我们采用 95%/5% 的训练/验证划分。这是一个多图像问答(MIQA)数据集,它结合了现有的 MIQA 数据集(RetVQA [30]、SlideVQA [36] 和 WebQA [7])与通过聚类和干扰项采样从 LLaVA Visual Instruct 150K 数据集 [25] 改编的合成 MIQA 数据。更多细节请参见补充材料 B.1。

评估数据集。我们在四个基准上评估 RETOKEN,这些基准旨在考察检索和长上下文理解的不同方面。

Visual Haystacks (VHs) [45] 是与 MIRAGE 一同提出的基准,用于评估视觉语言模型的纯视觉识别能力。它基于 COCO 数据集 [24] 构建,包含 1,000 个问答对,并提供与查询相关的图像标注。答案始终为“是”或“否”。对于每个问答样本,会添加数量不等的干扰图像,以测试模型在大量输入中定位信息内容的能力。

QAEgo4DTest-MC [12] 是 QAEgo4D-test 基准 [6] 的多项选择子集,专注于长时自我中心视频的问答。每个样本都标注了与问题相关的视频片段。视频长度从 4 分钟到 20 分钟不等。

LVBench [41] 是一个用于极端长视频理解的基准,包含 103 个公开来源的 YouTube 视频,总计约 117 小时,平均时长 68 分钟,单个视频最长可达 2 小时。这是一个多项选择数据集,评估指标为准确率。

Video-MME [15] 包含 900 个视频和 2,700 个问答对。视频时长从 11 秒到 1 小时不等,分为短(<2 分钟)、中(4–15 分钟)和长(30–60 分钟)三个子集。每个问题均为多项选择,我们报告准确率作为评估指标。

4.2 Visual Haystacks 检索与准确率

我们在 Visual Haystacks 基准 [45] 的单针任务上评估 RETOKEN 与基线方法,该任务中干草堆里恰好有一张图像与查询相关。上下文大小 C 控制干扰图像的数量,C 越大对模型的挑战越大。K 表示检索的图像数量。

表 2:检索策略比较。我们在检索预算 K=1 的设置下,比较 RETOKEN 与不同检索器在 Visual Haystacks 上的表现。“GT Cache”表示使用真实相关图像的 KV cache 作为输入,作为任何检索器的理论上限。所有结果均基于冻结 VLM 的 Qwen3VL-8B。

| 指标 | 标准 | GT Cache | SigLIP2 | ReKV | CoT | RETOKEN | |——|——|———-|———|——|—–|———| | C=2, K=1 | | | | | | | | Recall | N/A | 100 | 76.4 | 63.3 | 65.3 | 88.5 | | Top-K 准确率 | 82.0 | 86.5 | 82.8 | 73.0 | 77.8 | 85.9 | | C=50, K=1 | | | | | | | | Recall | N/A | 100 | 20.8 | 1.8 | 3.1 | 64.7 | | 准确率 | 58.6 | 80.7 | 60.7 | 51.2 | 51.5 | 72.0 |

图 5:准确率 vs. 检索图像数 K。冻结的 Qwen3VL-8B。

第 8 页

检索令牌与基于注意力的检索行为对比。图5比较了RETOKEN与基于注意力的检索器ReKV [13],在C=50和C=100条件下,检索预算从K=1到K=128时的表现。当K≥C时,所有图像均作为输入,无需检索。在有效检索区间(K<C)内,两种方法呈现相反趋势:RETOKEN在K较小时表现最佳,随着更多图像(多为干扰项)被检索而性能下降;而ReKV初始性能较低,随K增大而提升。这一交叉点反映了精确率与召回率的权衡:RETOKEN在每个槽位上更精确,而ReKV需要更宽的预算来召回相关图像。

检索策略比较。我们还计算了召回率,以衡量不同策略在Visual Haystacks上的检索能力。此处召回率衡量的是当K=1时,检索器是否成功选择了真实相关图像。表2比较了RETOKEN与几种检索策略在Visual Haystacks上的表现。我们与四个基线进行了对比:Standard预填充所有图像(默认VLM推理流程);GT Cache使用真实相关图像的KV cache作为输入,作为理论上限;SigLIP2 [39]首先用siglip2-giant-opt-patch16-384检索单张图像,并将其KV cache输入VLM;CoT则提示VLM首先生成目标搜索短语,再以该短语作为查询进行ReKV基于注意力的检索(完整提示见补充材料B.2)。

RETOKEN显著优于所有基线,在大上下文规模(C=50)下保留了GT Cache理论上限的大部分准确率,而其他方法均告失败。

存储的KV Cache与重新编码视觉输入的差异。观察表2中GT Cache的准确率,我们发现一个有趣现象:即使每种情况下仅使用同一张真实相关图像的缓存,准确率仍随C增大而下降(C=2时为86.5,C=50时为80.7)。这是因为图像token已关注到之前的图像,而这些图像在此情况下不相关,从而引入了干扰信息。

为量化这种干扰,我们比较了使用“GT Image”(单独重新编码真实相关图像,产生干净的KV cache)与“GT Cache”(真实相关图像的融合KV cache)时的准确率。两者之差∆GT Image−GT Cache衡量了干扰程度(表3);差值越小,表明存储的KV cache越干净。在检索数据集上进行部分微调,能促使模型生成更干净的KV cache表示(仅训练检索令牌时,KV cache不受影响)。更干净的KV cache有利于Visual Haystacks任务,但可能对需要跨相邻帧连接信息的视频理解构成挑战。

准确率比较。表4报告了从C=1(仅查询相关图像,无干扰项)到C=100不同上下文规模下的准确率。检索预算K设为1。在C=1时,RETOKEN与原始Qwen3VL-8B骨干网络表现一致,因为当C≤K时我们跳过检索。

随着上下文规模增大,RETOKEN与原始骨干网络之间的差距显著扩大。唯一的例外是InternVL3.5-8B在C=100时的表现,我们将其归因于其1个epoch的训练预算(第4.1节)。RETOKEN与外部基线相比也表现优异,在所有上下文规模下均超越所有基线,包括专用的多图像RAG框架MIRAGE。

4.3 图像到视频的迁移评估

在图像数据上验证RETOKEN后,我们现在评估其向视频场景的迁移能力。值得注意的是,本节结果均使用仅在多图像MIRAGE训练数据上训练的RETOKEN获得,展示了强大的零样本迁移能力。默认情况下,我们以0.5 FPS采样的视频,在视频基准上评估冻结的Qwen3VL-8B。“均匀采样”指加载K个均匀采样帧的KV cache作为输入。

表3:在检索数据集上进行部分微调可产生更干净的KV cache。∆GT Image−GT Cache衡量干扰程度。差值越小,表明存储的KV cache越干净。

| 损失函数 | GT Cache | ∆GT Image−GT Cache | 模型 | GT Image | | :— | :— | :— | :— | :— | | 生成 | 检索 | C=2 | C=50 | C=2 | C=50 | | Qwen3VL-8B | 87.8 | 86.5 | 80.7 | 1.3 | 7.1 | | ✓ | 87.8 | 86.8 | 82.3 | 1.0 | 5.5 | | 微调层 1-3 | ✓ | ✓ | 88.5 | 87.3 | 83.6 | 1.2 | 4.9 |

第 9 页

表4:ReToken的优势随上下文规模扩大而增长,在冻结VLM且C=50时相对提升超过20%。在Visual Haystacks上的性能。C表示上下文图像数量(即作为输入提供的图像)。E表示上下文溢出或CUDA内存不足错误。

方法 C=1 C=2 C=3 C=5 C=10 C=20 C=50 C=100

通用模型 Gemini-1.5 Pro [37] 88.4 82.0 78.3 76.0 71.9 68.6 62.8 57.4 InternVL2 [8] 88.1 80.5 72.3 63.9 58.8 55.2 E E

专用模型 SigLIP2 [39] 72.0 69.2 68.1 65.3 64.1 60.3 58.7 58.3 MIRAGE [45] 83.2 77.8 76.6 72.8 70.5 66.0 63.6 62.0 RENDINO·SigLIP2 [20] 81.2 78.6 77.4 76.0 74.0 72.1 68.3 65.5

冻结VLM Qwen3VL-8B [4] 87.8 82.0 77.9 74.7 69.2 64.0 58.6 55.7 + RETOKEN 87.8 (+0.0) 85.9 (+3.9) 84.4 (+6.5) 82.5 (+7.8) 80.7 (+11.5) 76.8 (+12.8) 72.0 (+13.4) 67.7 (+12.0) InternVL3.5-8B [42] 87.5 81.6 79.3 73.1 69.0 65.0 57.3 55.3 + RETOKEN 87.5 (+0.0) 84.1 (+2.5) 83.7 (+4.4) 80.7 (+7.6) 76.9 (+7.9) 73.0 (+8.0) 69.7 (+12.4) 59.7 (+4.4)

微调VLM的前3层 Qwen3VL-8B [4] 88.5 85.6 82.4 79.6 76.5 71.2 64.2 61.5 + RETOKEN 88.5 (+0.0) 86.5 (+0.9) 85.2 (+2.8) 84.3 (+4.7) 82.8 (+6.3) 79.8 (+8.6) 75.0 (+10.8) 70.6 (+9.1)

QAEgo4DTest-MC上的准确率。表5显示,RETOKEN的优势在检索预算紧张时最为显著。当K=1时,RETOKEN比均匀采样提高了6.8个点,而ReKV实际上比均匀采样略差。与图像相互独立的多图像问答不同,相邻视频帧提供了互补的上下文,因此随着K增大,准确率继续攀升,而RETOKEN相对于均匀采样的领先优势则有所缩小。

表5:QAEgo4DTest-MC上的零样本性能。

K 均匀采样 ReKV RETOKEN 1 42.8 42.6 49.6 16 53.6 57.8 60.0 32 55.2 59.8 60.6

长视频理解。检索的收益随视频长度增长(表6a)。在Video-MME的Short划分上,RETOKEN没有带来增益,因为这些视频仅持续2分钟(0.5 FPS下60帧),低于我们100帧的检索输入预算,因此不会触发检索。然而,随着视频长度增加,增益变得显著。RETOKEN在LVBench上实现了8.0个点的提升(表6b)。

4.4 消融研究

我们默认在Visual Haystacks上使用Qwen3VL-8B对RETOKEN的设计选择进行消融,重点关注:(1) 基于视觉键或值的检索;(2) 仅训练令牌与部分微调的比较;(3) 推理设置的影响;(4) 效率分析;以及 (5) 错误分析。

表6:ReToken对长视频的帮助更大,即使仅用图像训练。冻结VLM并仅微调ReToken。

(a) Qwen3VL在VideoMME不同划分上的性能增益 (b) “处理原始帧”部分的所有结果均源自技术报告[4]。

(%) 80 均匀采样 模型 LVBench Video-MME 77.1 77.1 ReToken 时长 # 帧数 30 – 140 分钟 0 – 60 分钟 +0.0 +2.6 处理原始帧 70 67.7 65.1 Gemini 2.5 Pro [10] 512 69.0 80.6 准确率 60 56.6 OpenAI GPT-5 [34] 256 – 77.3 QA 53.2 Claude Opus 4.1 [2] 100 – 73.3 50 Short Medium Long Qwen3VL-8B [4] 2 FPS 58.0 71.4 Short 0-2 分钟 从存储的KV cache中以0.5 FPS检索 Medium 4-15 分钟 Qwen3VL-8B [4] 100 40.6 65.1 Long 30-60 分钟 + RETOKEN 100 48.6 (+8.0) 67.1 (+2.0) 0 10 20 30 40 50 60 70 视频时长(分钟)

第 10 页

表8:微调早期层可提升图像任务性能,但会降低视频任务性能。(a) 在C=50、K=1设置下,微调前几层VLM(第1–3层)可获得最佳的召回率-准确率权衡。(b) 在图像上训练VLM会降低视频上的准确率;在QAEgo4DTest-MC上以K=16进行评估。

(a) 在图像上训练,在图像上评估。 (b) 在图像上训练,在视频上评估。

微调层数 冻结 1 1-3 1-10 N 策略 均匀采样 ReKV [13] ReToken

召回率 64.7 68.3 68.2 58.2 64.3 冻结 53.6 57.8 60.0 准确率 72.0 73.3 75.0 72.6 71.3 第1–3层 50.0 55.2 58.0

我们进一步消融了单个令牌是否足以进行检索(见补充材料C.1),以及RETOKEN是否可以跳过对视觉令牌的注意力计算(见补充材料C.2)。 表7:键 vs. 值。 基于平均视觉键或值的检索得分。我们在表7中消融了RETOKEN的评分机制,设置C=50、K=1:“ˆKey”训练RETOKEN通过平均图像键进行检索,而“ˆValue”则使用平均图像值。“ˆValue”在召回率和准确率上均明显领先。我们将此归因于值携带了通过注意力实际传播的内容,为在众多干扰项中区分相关图像提供了更具判别性的信号。补充材料B.3提供了进一步的证据。 ˆKey ˆValue 召回率 59.4 64.7 准确率 70.6 72.0

仅训练令牌或部分微调VLM层。表8a消融了部分微调的深度。微调前几层(1–3)在保持高召回率的同时获得了最佳准确率,表明早期层是塑造视觉特征而不损害下游性能的最佳位置。

表8b比较了冻结和部分微调设置的迁移能力。RETOKEN在两者中均显示出明显优势。然而,部分微调下的整体性能低于冻结设置。一个可能的原因是,在图像数据上微调LLM层可能导致领域偏移,尤其是考虑到图像训练数据与视频基准之间存在分布差异。

单次或两次推理。由于RETOKEN被训练在最后一层进行检索,我们使用两次推理在最后一层获得检索结果,然后将其广播到所有层。我们在表9中消融了其效果,并报告了C=50、K=1下的准确率。“单次”意味着每一层检索自己的图像并直接基于此生成响应。“两次”意味着早期层关注所有视觉令牌,最后一层的检索结果被广播以生成响应。ReKV和RETOKEN的结论不同。一种可能的解释是,基于注意力的检索适合直接回答,因此它不依赖最后一层的结果;相比之下,RETOKEN仅在最后一层使用检索损失进行训练。因此,ReKV的默认设置是单次推理,而RETOKEN是两次推理。 表9:两次推理。 ReKV RETOKEN 单次 51.2 50.4 两次 50.4 72.0

表10:长视频问答的运行时间与质量对比(QAEgo4DTest-MC,每个视频约240帧,0.5 FPS,单张H100)。延迟按每个问题在一次性视频编码后报告。RETOKEN以检索阶段仅适度的开销实现了更高的准确率,且编码和回答阶段的成本相同。

延迟(秒,每个问题) GPU峰值(GB) 问答(%) 方法 K 编码: 检索/加载 回答 检索 回答 准确率 召回率

均匀采样 16 14.68 0.081 0.169 65.1 65.4 53.6 38.0 RETOKEN 16 14.68 0.519 0.167 66.6 65.4 60.0 70.6

均匀采样 32 14.70 0.128 0.166 66.0 66.7 55.2 59.6 RETOKEN 32 14.70 0.538 0.166 67.2 66.8 60.6 81.2

:编码每个视频执行一次;答案从K个检索帧的视觉令牌生成。

第 11 页

表11:当证据局部化且可命名时,RETOKEN帮助最大;当证据分散在视频各处时,则效果不佳。LVBench上按问题类型的准确率。K=100。#QA表示每种类型的问题数量;一个问题可携带多个类型标签。

| 问题类型 | #QA | 均匀采样 | RETOKEN | ∆ | |———|—–|———|———|—-| | 关键信息检索 | 291 | 42.3 | 57.7 | 15.4 | | 实体识别 | 677 | 40.0 | 50.5 | 10.5 | | 推理 | 201 | 40.8 | 46.3 | 5.5 | | 时间定位 | 220 | 35.0 | 38.6 | 3.6 | | 事件理解 | 647 | 41.4 | 43.3 | `1.9 | | 摘要 | 58 | 36.2 | 31.0 | ´5.2 |

运行时间与内存使用。 表10将每个问题的成本分解为检索和回答阶段,并单独报告视频编码时间,因为编码会生成一个持久的KV cache,供同一视频的所有问题共享。编码占用了大部分预算,每个视频约14.7秒。当对某个视频提出的问题较少时,编码主导了计算时间,但可作为预处理步骤执行。RETOKEN为每个问题的检索和回答时间增加了约0.4秒,但显著提升了召回率和问题准确率。

错误分析。 LVBench为每个问题标注了任务类型标签,使我们能够刻画RETOKEN在何时效果最佳、何时失效(表11)。当证据局部化且可命名时,RETOKEN表现最强:关键信息检索(15.4)和实体识别(10.5)正是精确的检索目标能够锁定相关帧的场景。当相关性依赖于跨帧或时间结构而非单帧内容时,如时间定位和事件理解,增益会缩小。RETOKEN在摘要任务上效果不佳,因为证据分散在整个视频中;对于这种问题类型,均匀覆盖是更好的先验。

5 结论

我们诊断了VLMs中基于注意力的检索的局限性,并引入了RETOKEN,一种可学习的令牌,用于改进视觉检索。我们的诊断指向一个更广泛的原理:在预训练的VLMs中,值空间携带更强的文本对齐信号。尽管仅在多图像数据上训练,RETOKEN在图像和长视频基准上均取得了显著改进,从图像到视频实现了零样本迁移。训练和长视频推理均可适配于单块H100 GPU,使RETOKEN成为迈向可扩展长上下文多模态推理的实用一步。

局限性。 RETOKEN需要两次前向传播,并在早期层中关注更多视觉上下文,略微增加了内存需求和响应时间。我们的训练数据仅限于多图像问答。在视频数据上训练可能帮助RETOKEN更好地捕捉时间结构,并改进视频理解。

未来工作。 RETOKEN通过将查询内容与每帧值均值进行匹配来独立评分每一帧,放宽这一设计开辟了几个方向。首先,检索可以针对连续帧集合,这些帧的信息源于它们的时间组合,而非任何单一帧。其次,时间偏移查询,例如“我进入房间之前发生了什么”,需要一种能感知时间位移的评分机制,因为单纯的内容匹配倾向于定位所描述的事件,而非其之前的帧。第三,在令牌级别而非帧级别计算检索分数,可以恢复仅占据少量令牌、被帧级均值池化稀释的证据。

致谢

我们感谢Xiaodong Liu、Sethuraman T V和Bolin Lai富有洞见的评论和有益的讨论。

本研究项目受益于Microsoft Agentic AI Research and Innovation (AARI)资助计划,并部分由海军研究办公室根据N00014-23-1-2383号拨款支持。本工作还通过CIS240059号分配使用了NCSA Delta的NVIDIA GPU,以及

第 12 页

致谢:本研究使用了由美国国家科学基金会(NSF)资助项目#2138259、#2138286、#2138307、#2137603和#2138296支持的先进网络基础设施协调生态系统:服务与支持(ACCESS)项目所提供的CIS250059资源。

参考文献 [1] Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, 等. Flamingo: 一种用于小样本学习的视觉语言模型. Advances in neural information processing systems, 35:23716–23736, 2022. [2] Anthropic. 系统卡附录:Claude Opus 4.1. 技术报告, Anthropic, 2025年8月. [3] Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman, Mingchen Zhuge, Jian Ding, Deyao Zhu, Jürgen Schmidhuber, 和 Mohamed Elhoseiny. Goldfish: 对任意长视频的视觉语言理解. 收录于 European Conference on Computer Vision, 页码 251–267. Springer, 2024. [4] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等. Qwen3-vl 技术报告. arXiv preprint arXiv:2511.21631, 2025. [5] Daniel Bolya, Po-Yao Huang, Peize Sun, Jang Hyun Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, Hanoona Rasheed, 等. Perception encoder: 最佳的视觉嵌入并不在网络输出层. arXiv preprint arXiv:2504.13181, 2025. [6] Leonard Bärmann 和 Alex Waibel. 我把钥匙放哪儿了?——基于情景记忆的自我中心视频问答. 收录于 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 页码 1559–1567, 2022. [7] Yingshan Chang, Mridu Narang, Hisami Suzuki, Guihong Cao, Jianfeng Gao, 和 Yonatan Bisk. Webqa: 多跳多模态问答. 收录于 Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 页码 16495–16504, 2022. [8] Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, 等. 通过模型、数据和测试时扩展突破开源多模态模型的性能边界. arXiv preprint arXiv:2412.05271, 2024. [9] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, 等. Internvl: 扩展视觉基础模型并针对通用视觉语言任务进行对齐. 收录于 Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 页码 24185–24198, 2024. [10] Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, 等. Gemini 2.5: 以前沿的推理、多模态、长上下文和下一代智能体能力推动边界. arXiv preprint arXiv:2507.06261, 2025. [11] Wenliang Dai, Junnan Li, Dongxu Li, Anthony Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale N Fung, 和 Steven Hoi. Instructblip: 通过指令微调迈向通用视觉语言模型. Advances in neural information processing systems, 36:49250–49267, 2023. [12] Shangzhe Di 和 Weidi Xie. 长时自我中心视频中的定位问答. 收录于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 页码 12934–12943, 2024. [13] Shangzhe Di, Zhelun Yu, Guanghao Zhang, Haoyuan Li, Tao Zhong, Hao Cheng, Bolin Li, Wanggui He, Fangxun Shu, 和 Hao Jiang. 基于上下文视频KV缓存检索的流式视频问答. arXiv preprint arXiv:2503.00540, 2025. [14] Zafeirios Fountas, Martin A Benfeghoul, Adnan Oomerjee, Fenia Christopoulou, Gerasimos Lampouras, Haitham Bou-Ammar, 和 Jun Wang. 面向无限上下文大语言模型的类人情景记忆. 收录于 13th International Conference on Learning Representations Iclr 2025. ICLR, 2025. [15] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等. Video-mme: 首个面向多模态大语言模型视频分析的综合评估基准. 收录于 Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 页码 24108–24118, 2025.

12

第 13 页

[16] Chi Han, Qifan Wang, Hao Peng, Wenhan Xiong, Yu Chen, Heng Ji, and Sinong Wang. Lm-infinite: Zero-shot extreme length generalization for large language models. 收录于《2024年北美计算语言学协会会议论文集:人类语言技术(第一卷:长文)》,页码3991–4008,2024年。

[17] Bo He, Hengduo Li, Young Kyun Jang, Menglin Jia, Xuefei Cao, Ashish Shah, Abhinav Shrivastava, and Ser-Nam Lim. Ma-lmm: Memory-augmented large multimodal model for long-term video understanding. 收录于《IEEE/CVF计算机视觉与模式识别会议论文集》,页码13504–13514,2024年。

[18] Ting Jiang, Minghui Song, Zihan Zhang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang, Deqing Wang, and Fuzhen Zhuang. E5-v: Universal embeddings with multimodal large language models. arXiv预印本 arXiv:2407.12580,2024年。

[19] Peng Jin, Ryuichi Takanobu, Wancai Zhang, Xiaochun Cao, and Li Yuan. Chat-univi: Unified visual representation empowers large language models with image and video understanding. 收录于《IEEE/CVF计算机视觉与模式识别会议论文集》,页码13700–13710,2024年。

[20] Savya Khosla, Sethuraman TV, Barnett Lee, Alexander Schwing, and Derek Hoiem. Ren: Fast and efficient region encodings from patch-based image encoders. arXiv预印本 arXiv:2505.18153,2025年。

[21] Mengcheng Lan, Chaofeng Chen, Yiping Ke, Xinjiang Wang, Litong Feng, and Wayne Zhang. Proxyclip: Proxy attention improves clip for open-vocabulary segmentation. 收录于《欧洲计算机视觉会议论文集》,页码70–88。Springer,2024年。

[22] Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. 收录于《国际机器学习会议论文集》,页码19730–19742。PMLR,2023年。

[23] Yanwei Li, Chengyao Wang, and Jiaya Jia. Llama-vid: An image is worth 2 tokens in large language models. 收录于《欧洲计算机视觉会议论文集》,页码323–340。Springer,2024年。

[24] Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C Lawrence Zitnick. Microsoft coco: Common objects in context. 收录于《欧洲计算机视觉会议论文集》,页码740–755。Springer,2014年。

[25] Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee. Improved baselines with visual instruction tuning. 收录于《IEEE/CVF计算机视觉与模式识别会议论文集》,页码26296–26306,2024年。

[26] Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. Visual instruction tuning. 《神经信息处理系统进展》,36:34892–34916,2023年。

[27] Yikun Liu, Yajie Zhang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Jiangchao Yao, Yanfeng Wang, and Weidi Xie. Lamra: Large multimodal model as your advanced retrieval assistant. 收录于《计算机视觉与模式识别会议论文集》,页码4015–4025,2025年。

[28] Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, et al. Video-rag: Visually-aligned retrieval-augmented long video comprehension. arXiv预印本 arXiv:2411.13093,2024年。

[29] Ziyu Ma, Chenhui Gou, Hengcan Shi, Bin Sun, Shutao Li, Hamid Rezatofighi, and Jianfei Cai. Drvideo: Document retrieval based long video understanding. 收录于《计算机视觉与模式识别会议论文集》,页码18936–18946,2025年。

[30] Abhirama Subramanyam Penamakuri, Manish Gupta, Mithun Das Gupta, and Anand Mishra. Answer mining from a pool of images: towards retrieval-based visual question answering. arXiv预印本 arXiv:2306.16713,2023年。

[31] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. Learning transferable visual models from natural language supervision. 收录于《国际机器学习会议论文集》,页码8748–8763。PmLR,2021年。

[32] Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Balakrishnan Varadarajan, Florian Bordes, et al. Longvu: Spatiotemporal adaptive compression for long video-language understanding. arXiv预印本 arXiv:2410.17434,2024年。

13

第 14 页

[33] Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, Tiejun Huang, and Bo Zhao. Video-xl: 面向小时级视频理解的超长视觉语言模型. 见《计算机视觉与模式识别会议论文集》,页码26160–26169,2025.

[34] Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, 等. OpenAI GPT-5 系统卡. arXiv 预印本 arXiv:2601.03267, 2025.

[35] Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Feiyang Wu, Haozhe Chi, Xun Guo, Tian Ye, Yanting Zhang, 等. Moviechat: 从稠密令牌到稀疏记忆的长视频理解. 见《IEEE/CVF 计算机视觉与模式识别会议论文集》,页码18221–18232,2024.

[36] Ryota Tanaka, Kyosuke Nishida, Kosuke Nishida, Taku Hasegawa, Itsumi Saito, and Kuniko Saito. Slidevqa: 一个面向多图像文档视觉问答的数据集. 见《AAAI 人工智能会议论文集》,第37卷,页码13636–13645,2023.

[37] Gemini Team, Petko Georgiev, Ving Ian Lei, Ryan Burnell, Libin Bai, Anmol Gulati, Garrett Tanzer, Damien Vincent, Zhufeng Pan, Shibo Wang, 等. Gemini 1.5: 解锁跨百万令牌上下文的多模态理解. arXiv 预印本 arXiv:2403.05530, 2024.

[38] Gemma Team, Thomas Mesnard, Cassidy Hardin, Robert Dadashi, Surya Bhupatiraju, Shreya Pathak, Laurent Sifre, Morgane Rivière, Mihir Sanjay Kale, Juliette Love, 等. Gemma: 基于 Gemini 研究与技术的开放模型. arXiv 预印本 arXiv:2403.08295, 2024.

[39] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, 等. SigLIP 2: 具有改进语义理解、定位和稠密特征的多语言视觉-语言编码器. arXiv 预印本 arXiv:2502.14786, 2025.

[40] Feng Wang, Jieru Mei, and Alan Yuille. SCLIP: 重新思考稠密视觉-语言推理的自注意力机制. 见《欧洲计算机视觉会议论文集》,页码315–332. Springer, 2024.

[41] Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Ming Ding, Xiaotao Gu, Shiyu Huang, Bin Xu, 等. LVBench: 一个极限长视频理解基准. 见《IEEE/CVF 国际计算机视觉会议论文集》,页码22958–22967,2025.

[42] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, 等. InternVL3.5: 推进开源多模态模型在通用性、推理和效率上的发展. arXiv 预印本 arXiv:2508.18265, 2025.

[43] Xiaohan Wang, Yuhui Zhang, Orr Zohar, and Serena Yeung-Levy. VideoAgent: 以大语言模型为代理的长视频理解. 见《欧洲计算机视觉会议论文集》,页码58–76. Springer, 2024.

[44] Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, and Mohit Bansal. VideoTree: 面向长视频大语言模型推理的自适应树状视频表示. 见《计算机视觉与模式识别会议论文集》,页码3272–3283,2025.

[45] Tsung-Han Wu, Giscard Biamby, Jerome Quenum, Ritwik Gupta, Joseph E Gonzalez, Trevor Darrell, and David M Chan. Visual Haystacks: 一个以视觉为中心的大海捞针基准. arXiv 预印本 arXiv:2407.13766, 2024.

[46] Chaojun Xiao, Pengle Zhang, Xu Han, Guangxuan Xiao, Yankai Lin, Zhengyan Zhang, Zhiyuan Liu, and Maosong Sun. InfLLM: 面向大语言模型的高效上下文记忆免训练长上下文外推. 《神经信息处理系统进展》,37:119638–119661,2024.

[47] Guangxuan Xiao, Yuandong Tian, Beidi Chen, Song Han, and Mike Lewis. 具有注意力汇的高效流式语言模型. arXiv 预印本 arXiv:2309.17453, 2023.

[48] Yao Xiao, Qiqian Fu, Heyi Tao, Yuqun Wu, Zhen Zhu, and Derek Hoiem. TextRegion: 来自冻结图像-文本模型的文本对齐区域令牌. arXiv 预印本 arXiv:2505.23769, 2025.

[49] Shoubin Yu, Jaemin Cho, Prateek Yadav, and Mohit Bansal. 自链式图像-语言模型用于视频定位与问答. 《神经信息处理系统进展》,36:76749–76771,2023.

[50] Chong Zhou, Chen Change Loy, and Bo Dai. 从 CLIP 中提取自由稠密标签. 见《欧洲计算机视觉会议论文集》,页码696–712. Springer, 2022.

14

第 15 页

[51] Yutao Zhu, Zhaoheng Huang, Zhicheng Dou, and Ji-Rong Wen. One token can help! learning scalable and pluggable virtual tokens for retrieval-augmented large language models. In *Proceedings of the AAAI Conference on Artificial Intelligence*, volume 39, pages 26166–26174, 2025.

15

第 16 页

A 提示模板

在本节中,我们详细说明使用RETOKEN进行训练和推理时所用的提示模板。为突出RETOKEN引入的修改,我们将承载内容的令牌按颜色编码如下:所有视觉令牌、检索到的视觉令牌、问题令牌及<Retrieval>令牌、模型输出答案。

A.1 原始提示模板

视觉语言模型使用的标准提示格式将所有视觉令牌与文本查询一同输入模型:

原始提示

<system><|vision_start|>所有视觉令牌<|vision_end|>问题令牌<|im_end|><|im_start|>assistant: 答案

A.2 训练提示模板

在训练期间,我们根据训练模式采用两种互补的提示格式。第一种格式在问题后附加<Retrieval>令牌(教会模型何时调用检索),在冻结和部分微调设置中均被使用:

训练提示1:学习触发检索

<system><|vision_start|>所有视觉令牌<|vision_end|>问题令牌<Retrieval>

第二种格式旨在保留模型原有的问答能力,仅在LLM被部分微调时与第一种格式一同使用:

训练提示2:保持其原有问答能力

<system><|vision_start|>所有视觉令牌<|vision_end|>问题令牌<|im_end|><|im_start|>assistant: 答案

A.3 推理流程

在推理时,我们采用两阶段“先检索后回答”的流程。在阶段1中,检索期间最多关注K1帧,模型使用<Retrieval>令牌聚合与查询相关的信息,并在最后一层执行检索。在阶段2中,仅将检索到的视觉令牌(检索到的视觉令牌)提供给模型以生成最终答案。

推理阶段1:触发检索

<system><|vision_start|>所有视觉令牌<|vision_end|>问题令牌<Retrieval>

推理阶段2:使用检索到的令牌回答

<system><|vision_start|>检索到的视觉令牌<|vision_end|>问题令牌<|im_end|><|im_start|> assistant: 答案

B 补充细节

B.1 训练数据过滤

原始的MIRAGE微调集聚合了多个开源VQA数据集,其中许多在Qwen3VL预训练期间已被见过。我们观察到,在这些示例的很大一部分上,当以完整的干扰图像集为条件时,Qwen3VL的生成损失低于仅以目标真实图像为条件时的损失,这表明模型已经记住了这些

第 17 页

表12:训练数据集的影响。“w/o filtered”表示直接从原始MIRAGE微调集中采样70,686个样本,不经筛选用于训练ReToken。“w/ filtered”为我们的默认设置。

方法 C “ 1 C “ 2 C “ 3 C “ 5 C “ 10 C “ 20 C “ 50 C “ 100 Qwen3VL-8B [4] 87.8 82.0 77.9 74.7 69.2 64.0 58.6 55.7 w/o filtered 87.8 85.2 83.1 80.8 78.1 75.5 69.3 62.7 w/ filtered 87.8 85.9 84.4 82.5 80.7 76.8 72.0 67.7

底层的问答对,并绕过了预期的检索任务。为解决此问题,我们对MIRAGE增强数据集(其中来自不同问答的图像被组合成单个多图像输入)应用了三种筛选:

• 记忆筛选。我们丢弃那些仅以目标图像为条件的生成损失高于以完整图像集为条件的生成损失的样本,因为此类样本不再需要检索即可回答。 • 难度筛选。我们根据问题查询令牌与目标图像键令牌之间的平均注意力得分对剩余样本进行排序,并保留得分较高的样本。在一项对照实验中,我们发现较容易的检索样本(目标图像上的注意力得分较高)比较难的样本能训练出更强的检索器。 • 多图像筛选。我们移除单图像问答样本(缺乏用于检索的干扰图像)和OCR式查询(测试文本识别而非视觉识别)。

筛选后,最终训练数据集中共有70,686个样本。我们注意到,我们的筛选仅应用于MIRAGE训练集;Visual Haystacks评估集和视频数据集保持不变。筛选信号(生成损失和注意力得分)仅从冻结的Qwen3VL-8B在训练样本上计算得出,未访问任何评估标签或样本。表12展示了筛选的影响。

B.2 思维链(CoT)检索基线

CoT提示模板(查询重写基线)

给定以下问题,我应该搜索什么短语来找到回答所需的视觉证据?仅回复搜索短语,不超过5个词。 问题:{question}

B.3 键还是值?训练对比

1.6 1.0 ReToken × Vision Key 1.4 ReToken × Vision Value Step Step 1.2 v.s. 0.8

0.6 v.s. 1.0 Gap 0.8 Loss 0.4 0.6 Score

0.4 0.2 Training ReToken × Vision Key 0.2 Retrieval ReToken × Vision Value 0.0 0.0 0 500 1000 1500 2000 2500 3000 0 500 1000 1500 2000 2500 3000 (a) 检索损失 (b) 正负图像间的差距

图6:训练对比。RETOKEN ˆValue变体(a)在检索损失上收敛速度更快,且(b)学习到的相关与不相关图像之间的检索得分差距显著更大。

17

第 18 页

图6展示了在冻结VLM、仅训练RETOKEN的情况下,检索损失和检索分数差距随训练步数的变化:ˆValue展现出明显优势。

C 设计选择

C.1 多令牌

表13报告了在检索任务上训练3个ReTokens的结果。我们将3个ReTokens顺序附加,并通过计算每个投影后的ReToken与平均图像值特征之间的余弦相似度来得到检索分数。然后,我们对所得的logits取平均,以获得最终分数。

表13:多令牌性能与单令牌相当。Qwen3VL-8B。

方法 C=1 C=2 C=3 C=5 C=10 C=20 C=50 C=100

3 tokens 87.8 85.5 84.3 82.5 82.0 77.6 72.1 67.9 1 token 87.8 85.9 84.4 82.5 80.7 76.8 72.0 67.7

总体性能相当,两个方向均有小幅波动。一个原因可能在于我们的训练方案:多令牌设计平等对待所有嵌入,因为三个令牌都通过一个平均分数进行监督,没有任何机制促使它们专门化,因此这些令牌很可能收敛到相似的解。一个有前景的方向是赋予不同令牌专门化的能力,使某个令牌在其专长领域表现更突出。但这超出了本工作的范围,我们留待未来探索。

C.2 查询组合或视觉摘要

由于我们将RETOKEN附加到输入中,它可以同时关注图像和查询,使其既能充当视觉摘要令牌,也能充当查询摘要令牌。为了更好地理解RETOKEN的作用,我们设计了一项消融实验,其中RETOKEN仅被允许关注查询令牌。在此设置下,我们执行两个前向流。在流A中,我们编码视觉令牌并缓存其KV。在流B中,我们仅处理查询和RETOKEN,使得查询令牌和RETOKEN都无法关注视觉部分。这样,RETOKEN仅看到查询令牌,并学习仅基于输入查询来总结我们想要检索的内容。然后,我们通过计算流B最后一层投影后的RETOKEN与流A最后一层平均视觉值特征之间的余弦相似度来得到检索分数。

表14:允许ReToken关注图像能带来更好的结果。在“skip images”设置中,问题令牌也跳过视觉令牌。VLM被冻结。

方法 C=1 C=2 C=3 C=5 C=10 C=20 C=50 C=100

Qwen3VL-8B [4] 87.8 82.0 77.9 74.7 69.2 64.0 58.6 55.7 skip images 87.8 83.4 78.9 76.2 73.7 68.5 63.1 62.0 attend images 87.8 85.9 84.4 82.5 80.7 76.8 72.0 67.7

表14报告了关注与不关注图像的结果。结果显示,完全跳过视觉令牌仍能获得不错的性能,但不如关注图像的变体。这表明,当RETOKEN能够理解输入视频/图像中发生的内容时,它能取得更好的检索结果。

18

发表评论