视觉token何时变成文本:用跨模态残差找出真正该留的视觉信息

快速导读:提出训练无关的视觉token压缩方法SIEVE,通过跨模态残差(CMR)量化视觉token中无法被文本子空间解释的信息,结合注意力相关性与残差空间多样性选择,在多个VLM上以11.1%的token保留率实现显著加速。

视觉语言模型(VLM)在推理时需要处理大量视觉token,自注意力计算和KV-cache开销随token数量急剧增长。现有剪枝方法大多依赖单层局部信号,如注意力分数或特征相似度,缺乏对多模态推理全过程的整体视角。本文作者重新审视VLM推理过程,发现随着LLM层加深,文本token通过自注意力持续聚合视觉信息,视觉token表示逐渐可被文本子空间解释。

基于这一观察,作者提出训练无关的视觉token压缩方法SIEVE。SIEVE首先用Tikhonov正则化最小二乘将每个视觉token投影到文本子空间,以重构残差与原始范数之比作为跨模态残差(CMR)分数;同时从top图像关注头聚合文本到视觉的注意力分数;两者相乘得到引导分数,再在残差空间用余弦相似度度量冗余,通过贪心选择并逐步抑制冗余候选完成token筛选。

英文题目:When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

论文出处:arXiv 每日论文精选 · arXiv:2608.10489

原始论文:PDF / 论文页面

这篇论文解决什么问题?

VLM推理的显存和计算瓶颈主要来自视觉token。以LLaVA-1.5-7B为例,一张图像通常产生576个视觉token,与文本token一起进入LLM后,自注意力的计算量和KV-cache都随序列长度平方或线性增长。当视觉token保留率降到11.1%时,KV-cache可从319MB降至63MB,但如何在如此激进的压缩下保持性能,是现有方法面临的难题。

现有训练无关的token剪枝方法大致可分为三类:基于注意力分数的(如FastV、SparseVLM)、基于特征相似度的(如DART、VisionZip)、以及基于多样性或覆盖度选择的(如HoloV、SCOPE)。这些方法的一个共同局限是只依赖单层局部信号,没有考虑视觉信息在多模态推理全过程中的演化。

作者的关键观察是:在VLM推理过程中,视觉token的表示并非静态的。随着LLM层加深,文本token通过自注意力机制持续从视觉token中聚合信息,导致视觉token的表示逐渐向文本子空间靠拢。这意味着深层视觉token中相当一部分信息已经可以被文本表示解释,真正需要保留的是那些无法被文本解释的残差信息。

为量化这一现象,作者提出层级的跨模态吸收指标CMA(Cross Modal Absorption)。CMA衡量视觉token表示可被文本子空间解释的程度。在LLaVA-1.5-7B上,CMA随层深单调递增(Spearman ρ=+0.99),最终层CMA约为随机基线的29倍。这一发现为视觉token压缩提供了新的理论依据:压缩应该聚焦于保留那些残差信息最大的token。

核心创新

  • 提出跨模态吸收(CMA)指标,从几何表示角度量化视觉信息被文本子空间吸收的程度,揭示深层视觉token的跨模态冗余现象
  • 提出token级跨模态残差(CMR)分数,通过Tikhonov正则化投影度量每个视觉token中无法被文本解释的独特视觉信息
  • 提出SIEVE训练无关压缩方法,融合CMR、注意力相关性和残差空间多样性选择三个互补视角
  • 设计FlashAttention兼容的dual-flash注意力信号计算策略,无需物化完整注意力矩阵

方法概览

SIEVE首先用Tikhonov正则化最小二乘将每个视觉token投影到文本子空间,以重构残差与原始范数之比作为CMR分数;同时从top图像关注头聚合文本到视觉的注意力分数;两者相乘得到引导分数,再在残差空间用余弦相似度度量冗余,通过贪心选择并逐步抑制冗余候选完成token筛选。

  • 跨模态残差(CMR)的定义:对每个视觉token,用Tikhonov正则化最小二乘将其投影到文本子空间,计算重构残差与原始范数之比。CMR越高,表示该token包含越多无法被文本解释的独特视觉信息。
  • Tikhonov正则化的作用:文本子空间的维度远低于视觉token的维度,直接最小二乘投影可能不稳定。Tikhonov正则化通过引入能量比η控制投影的稳定性,η∈{0.65,0.75,0.85,0.95}。
  • 注意力相关性聚合:从top图像关注头(Htop)聚合文本到视觉的注意力分数。注意力分数存在偏差,需通过头部筛选过滤噪声头。实验表明Htop=12时性能最佳,过少的头会丢失有用的视觉相关性信号。
  • 引导分数的融合:将CMR分数与注意力分数相乘得到引导分数。两者捕捉的是互补信号——注意力反映查询条件下的语义相关性,CMR捕捉独特的残差信息。四个基准上两者的token选择平均重叠仅11.54%。
  • 残差空间多样性选择:在去除文本可解释成分后的残差空间中,用余弦相似度度量token间的冗余。贪心选择引导分数最高的token,并逐步抑制与已选token在残差空间中过于相似的候选。
  • dual-flash注意力策略:为兼容FlashAttention,SIEVE通过辅助值矩阵获取注意力统计而不物化完整注意力矩阵,避免了显存开销的大幅增加。
  • 训练无关特性:SIEVE不需要任何微调或额外训练,可以直接应用于不同架构的VLM,包括LLaVA-1.5-7B、LLaVA-NeXT-7B和Qwen2.5-VL-7B。

逐图理解论文

一个被忽视的现象

一个被忽视的现象
Figure 2: Layer-wise evolution of cross-modal absorption in LLaVA-1.5-7B. Cross-modal absorption (CMA) increases across Transformer layers.

该图展示LLaVA-1.5-7B中跨模态吸收(CMA)随Transformer层数的演化。CMA单调递增的趋势是本文核心观察的直接证据,说明深层视觉token表示逐渐可被文本子空间解释。

研究缺口

研究缺口
Figure 3: Overview of SIEVE. SIEVE measures each visual token’s residual information with respect to the text subspace via CMR, combines it with attention relevance, and performs residual-space diversity selection to retain informative and non- redundant visual tokens for the compressed input sequence.

该图展示SIEVE的整体流程:CMR计算、注意力相关性聚合、引导分数融合、残差空间多样性选择。理解该图有助于把握三个互补视角如何协同工作。

效果与消融

效果与消融
Table 1: Performance comparison of different token reduction methods on LLaVA-1.5-7B.

效果上,SIEVE在三种架构上都超过了最强基线。LLaVA-1.5-7B保留11.1%的token时平均性能96.0%,超过SCOPE;Qwen2.5-VL-7B在同样保留率下超过FastV 9.2个百分点。消融实验更说明问题:如果把残差空间多样性换成直接Top-K选择,性能骤降6.46个百分点;换成原始空间多样性也下降0.89个百分点。这说明残差空间的选择才是关键,而不是简单的分数排序。

结论与局限

结论与局限
Figure 1: 3D visualization of visual tokens relative to the text subspace. Text tokens are centered and projected by PCA to obtain the first two principal directions, denoted as Text PC1 and Text PC2. Visual tokens are centered using the same text mean and projected onto these directions to obtain planar coordinates, while height and color indicate their CMR. More results are provided in Appendix A.

该图展示了视觉token相对于文本子空间的三维可视化。文本token被PCA投影获得前两个主方向,视觉token用相同均值和方向投影,高度和颜色表示CMR。可以观察哪些视觉token远离文本子空间、哪些已经接近。

实验如何设计?

  • 在三种VLM架构上评估:LLaVA-1.5-7B、LLaVA-NeXT-7B、Qwen2.5-VL-7B,覆盖GQA、MMBench、MMBench-CN、MME、POPE、SQA、VQAv2、TextVQA八个基准。
  • 与FastV、SparseVLM、DART、VisionZip、HoloV、SCOPE、SpecFlow等训练无关基线在多个token保留率下对比。
  • 超参数敏感性分析:能量比η∈{0.65,0.75,0.85,0.95}与图像关注头数Htop∈{1,2,4,8,12,16,20,24,28,32}的网格搜索。
  • 组件消融:仅注意力分数、仅CMR分数、加性融合、Top-K选择、原始空间多样性,与完整SIEVE对比。
  • 效率分析:在POPE上对比总时间、prefill时间、KV-cache和F1。

关键结果与论文证据

  • LLaVA-1.5-7B保留64个token(11.1%)时,SIEVE平均性能96.0%,超过最强基线SCOPE 0.6个百分点(第5页)。
  • LLaVA-NeXT-7B保留320个token时,SIEVE保持97.5%原始平均性能,比DART和HoloV分别高1.4和1.3个百分点(第6页)。
  • Qwen2.5-VL-7B在11.1%保留率下SIEVE达96.7%,超过FastV 9.2个百分点、HoloV 2.3个百分点(第6页)。
  • LLaVA-NeXT-7B上SIEVE实现3.62×prefill加速、2.49×端到端加速、6.02×KV-cache缩减(第7页)。
  • 组件消融显示Top-K选择降至90.13%(-6.46),原始空间多样性95.70%(-0.89),仅注意力96.07%,仅CMR 96.00%,完整SIEVE 96.59%(第7页)。
  • CMA在POPE上从层0的0.008增至层31的0.209,约为随机基线(0.0073)的29倍,达理论上界(约0.5)的42%(第11页)。
  • 注意力与CMR的token选择平均重叠仅11.54%,最大预算下也仅13.27%,证明两者是互补信号(第13页)。

阅读时需要注意

  • CMA的绝对值在[0,1]尺度上看似较小(0.2-0.4),需结合文本子空间低维特性解释,可能影响直观理解。
  • 超参数Htop和η虽鲁棒但需针对不同模型架构调整,缺乏统一的自动选择机制。
  • 实验主要覆盖图像理解任务,视频和多图场景的验证有限。

关联工作

  • FastV是基于注意力分数的训练无关token剪枝基线,SIEVE在多个设置下均超过它。
  • SparseVLM提出基于注意力的token稀疏化方法,SIEVE借鉴其dual-flash注意力策略以兼容FlashAttention。
  • SCOPE是显著性-覆盖度导向的token剪枝方法,在LLaVA-1.5上是最强基线,SIEVE在相同保留率下超过它0.6个百分点。
  • ToMe是相似度token合并的经典方法,但SIEVE的残差空间多样性选择在去除文本可解释成分后度量冗余,与原始空间相似度有本质区别。

发表评论