快速导读:提出训练无关的视觉token压缩方法SIEVE,通过跨模态残差(CMR)量化视觉token中无法被文本子空间解释的信息,结合注意力相关性与残差空间多样性选择,在多个VLM上以11.1%的token保留率实现显著加速。
视觉语言模型(VLM)在推理时需要处理大量视觉token,自注意力计算和KV-cache开销随token数量急剧增长。现有剪枝方法大多依赖单层局部信号,如注意力分数或特征相似度,缺乏对多模态推理全过程的整体视角。本文作者重新审视VLM推理过程,发现随着LLM层加深,文本token通过自注意力持续聚合视觉信息,视觉token表示逐渐可被文本子空间解释。
基于这一观察,作者提出训练无关的视觉token压缩方法SIEVE。SIEVE首先用Tikhonov正则化最小二乘将每个视觉token投影到文本子空间,以重构残差与原始范数之比作为跨模态残差(CMR)分数;同时从top图像关注头聚合文本到视觉的注意力分数;两者相乘得到引导分数,再在残差空间用余弦相似度度量冗余,通过贪心选择并逐步抑制冗余候选完成token筛选。
英文题目:When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
论文出处:arXiv 每日论文精选 · arXiv:2608.10489
原始论文:PDF / 论文页面
这篇论文解决什么问题?
VLM推理的显存和计算瓶颈主要来自视觉token。以LLaVA-1.5-7B为例,一张图像通常产生576个视觉token,与文本token一起进入LLM后,自注意力的计算量和KV-cache都随序列长度平方或线性增长。当视觉token保留率降到11.1%时,KV-cache可从319MB降至63MB,但如何在如此激进的压缩下保持性能,是现有方法面临的难题。
现有训练无关的token剪枝方法大致可分为三类:基于注意力分数的(如FastV、SparseVLM)、基于特征相似度的(如DART、VisionZip)、以及基于多样性或覆盖度选择的(如HoloV、SCOPE)。这些方法的一个共同局限是只依赖单层局部信号,没有考虑视觉信息在多模态推理全过程中的演化。
作者的关键观察是:在VLM推理过程中,视觉token的表示并非静态的。随着LLM层加深,文本token通过自注意力机制持续从视觉token中聚合信息,导致视觉token的表示逐渐向文本子空间靠拢。这意味着深层视觉token中相当一部分信息已经可以被文本表示解释,真正需要保留的是那些无法被文本解释的残差信息。
为量化这一现象,作者提出层级的跨模态吸收指标CMA(Cross Modal Absorption)。CMA衡量视觉token表示可被文本子空间解释的程度。在LLaVA-1.5-7B上,CMA随层深单调递增(Spearman ρ=+0.99),最终层CMA约为随机基线的29倍。这一发现为视觉token压缩提供了新的理论依据:压缩应该聚焦于保留那些残差信息最大的token。
核心创新
- 提出跨模态吸收(CMA)指标,从几何表示角度量化视觉信息被文本子空间吸收的程度,揭示深层视觉token的跨模态冗余现象
- 提出token级跨模态残差(CMR)分数,通过Tikhonov正则化投影度量每个视觉token中无法被文本解释的独特视觉信息
- 提出SIEVE训练无关压缩方法,融合CMR、注意力相关性和残差空间多样性选择三个互补视角
- 设计FlashAttention兼容的dual-flash注意力信号计算策略,无需物化完整注意力矩阵
方法概览
SIEVE首先用Tikhonov正则化最小二乘将每个视觉token投影到文本子空间,以重构残差与原始范数之比作为CMR分数;同时从top图像关注头聚合文本到视觉的注意力分数;两者相乘得到引导分数,再在残差空间用余弦相似度度量冗余,通过贪心选择并逐步抑制冗余候选完成token筛选。
- 跨模态残差(CMR)的定义:对每个视觉token,用Tikhonov正则化最小二乘将其投影到文本子空间,计算重构残差与原始范数之比。CMR越高,表示该token包含越多无法被文本解释的独特视觉信息。
- Tikhonov正则化的作用:文本子空间的维度远低于视觉token的维度,直接最小二乘投影可能不稳定。Tikhonov正则化通过引入能量比η控制投影的稳定性,η∈{0.65,0.75,0.85,0.95}。
- 注意力相关性聚合:从top图像关注头(Htop)聚合文本到视觉的注意力分数。注意力分数存在偏差,需通过头部筛选过滤噪声头。实验表明Htop=12时性能最佳,过少的头会丢失有用的视觉相关性信号。
- 引导分数的融合:将CMR分数与注意力分数相乘得到引导分数。两者捕捉的是互补信号——注意力反映查询条件下的语义相关性,CMR捕捉独特的残差信息。四个基准上两者的token选择平均重叠仅11.54%。
- 残差空间多样性选择:在去除文本可解释成分后的残差空间中,用余弦相似度度量token间的冗余。贪心选择引导分数最高的token,并逐步抑制与已选token在残差空间中过于相似的候选。
- dual-flash注意力策略:为兼容FlashAttention,SIEVE通过辅助值矩阵获取注意力统计而不物化完整注意力矩阵,避免了显存开销的大幅增加。
- 训练无关特性:SIEVE不需要任何微调或额外训练,可以直接应用于不同架构的VLM,包括LLaVA-1.5-7B、LLaVA-NeXT-7B和Qwen2.5-VL-7B。
逐图理解论文
一个被忽视的现象

该图展示LLaVA-1.5-7B中跨模态吸收(CMA)随Transformer层数的演化。CMA单调递增的趋势是本文核心观察的直接证据,说明深层视觉token表示逐渐可被文本子空间解释。
研究缺口

该图展示SIEVE的整体流程:CMR计算、注意力相关性聚合、引导分数融合、残差空间多样性选择。理解该图有助于把握三个互补视角如何协同工作。
效果与消融

效果上,SIEVE在三种架构上都超过了最强基线。LLaVA-1.5-7B保留11.1%的token时平均性能96.0%,超过SCOPE;Qwen2.5-VL-7B在同样保留率下超过FastV 9.2个百分点。消融实验更说明问题:如果把残差空间多样性换成直接Top-K选择,性能骤降6.46个百分点;换成原始空间多样性也下降0.89个百分点。这说明残差空间的选择才是关键,而不是简单的分数排序。
结论与局限

该图展示了视觉token相对于文本子空间的三维可视化。文本token被PCA投影获得前两个主方向,视觉token用相同均值和方向投影,高度和颜色表示CMR。可以观察哪些视觉token远离文本子空间、哪些已经接近。
实验如何设计?
- 在三种VLM架构上评估:LLaVA-1.5-7B、LLaVA-NeXT-7B、Qwen2.5-VL-7B,覆盖GQA、MMBench、MMBench-CN、MME、POPE、SQA、VQAv2、TextVQA八个基准。
- 与FastV、SparseVLM、DART、VisionZip、HoloV、SCOPE、SpecFlow等训练无关基线在多个token保留率下对比。
- 超参数敏感性分析:能量比η∈{0.65,0.75,0.85,0.95}与图像关注头数Htop∈{1,2,4,8,12,16,20,24,28,32}的网格搜索。
- 组件消融:仅注意力分数、仅CMR分数、加性融合、Top-K选择、原始空间多样性,与完整SIEVE对比。
- 效率分析:在POPE上对比总时间、prefill时间、KV-cache和F1。
关键结果与论文证据
- LLaVA-1.5-7B保留64个token(11.1%)时,SIEVE平均性能96.0%,超过最强基线SCOPE 0.6个百分点(第5页)。
- LLaVA-NeXT-7B保留320个token时,SIEVE保持97.5%原始平均性能,比DART和HoloV分别高1.4和1.3个百分点(第6页)。
- Qwen2.5-VL-7B在11.1%保留率下SIEVE达96.7%,超过FastV 9.2个百分点、HoloV 2.3个百分点(第6页)。
- LLaVA-NeXT-7B上SIEVE实现3.62×prefill加速、2.49×端到端加速、6.02×KV-cache缩减(第7页)。
- 组件消融显示Top-K选择降至90.13%(-6.46),原始空间多样性95.70%(-0.89),仅注意力96.07%,仅CMR 96.00%,完整SIEVE 96.59%(第7页)。
- CMA在POPE上从层0的0.008增至层31的0.209,约为随机基线(0.0073)的29倍,达理论上界(约0.5)的42%(第11页)。
- 注意力与CMR的token选择平均重叠仅11.54%,最大预算下也仅13.27%,证明两者是互补信号(第13页)。
阅读时需要注意
- CMA的绝对值在[0,1]尺度上看似较小(0.2-0.4),需结合文本子空间低维特性解释,可能影响直观理解。
- 超参数Htop和η虽鲁棒但需针对不同模型架构调整,缺乏统一的自动选择机制。
- 实验主要覆盖图像理解任务,视频和多图场景的验证有限。
关联工作
- FastV是基于注意力分数的训练无关token剪枝基线,SIEVE在多个设置下均超过它。
- SparseVLM提出基于注意力的token稀疏化方法,SIEVE借鉴其dual-flash注意力策略以兼容FlashAttention。
- SCOPE是显著性-覆盖度导向的token剪枝方法,在LLaVA-1.5上是最强基线,SIEVE在相同保留率下超过它0.6个百分点。
- ToMe是相似度token合并的经典方法,但SIEVE的残差空间多样性选择在去除文本可解释成分后度量冗余,与原始空间相似度有本质区别。