视觉Token剪枝的盲区:被忽视的“死Token”为何仍有价值

快速导读:通过EmbedLens识别的token角色(alive, dead, sink)分析现有视觉token剪枝方法的偏差,发现保留非alive token有时能维持或提升性能,表明剪枝决策不能仅依赖单个token的语义相关性。

视觉语言模型(VLM)将图像转换为视觉token序列输入大语言模型,导致推理计算量随token数量线性增长。视觉token剪枝成为缓解这一瓶颈的主流方案,但现有方法(如FastV、DART、DivPrune)均基于单一启发式规则选择保留哪些token,其剪枝决策与token在LLM嵌入空间中的功能角色之间的关系尚不明确。

本文借助EmbedLens工具将投影后的视觉token分为四类角色:携带图像特定语义的alive token、高度同质化的dead token、以及两类sink token(ViT sink和LLM sink)。通过分析三种剪枝方法在不同token预算下的角色分布,发现它们存在截然不同的角色偏差;进一步的角色保护实验表明,保留非alive token有时反而能提升性能,挑战了“仅保留语义相关token”的直觉。

英文题目:Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

论文出处:arXiv 每日论文精选 · arXiv:2608.04483

原始论文:PDF / 论文页面

这篇论文解决什么问题?

VLM推理时,视觉编码器输出的图像特征经投影层映射到LLM的嵌入空间,形成视觉token序列。随着输入分辨率提升,视觉token数量急剧增加,自注意力计算成为瓶颈。视觉token剪枝通过在LLM的特定层丢弃部分token来减少计算量,但现有方法仅依赖注意力分数、重复度或多样性等启发式指标,缺乏对token功能角色的理解。

EmbedLens的分析揭示了一个关键现象:投影后的视觉token在LLM嵌入空间中呈现稀疏结构,大部分token聚集在少数文本ID附近,形成dead token;少数token分散在语义相关区域,成为alive token;还有部分token具有大激活范数或高注意力但不携带语义,被归类为sink token。这一角色分类为理解剪枝行为提供了新的分析维度。

直觉上,剪枝应优先保留alive token、丢弃dead token,因为前者携带语义而后者看似冗余。但本文的核心发现是:这一直觉并不完全成立。不同剪枝方法对四类角色的偏好差异显著,且在某些任务上保留dead token反而带来性能提升,说明剪枝决策不能仅依赖单个token的语义相关性。

核心创新

  • 首次将EmbedLens的token角色分析与视觉token剪枝方法联系起来,揭示不同剪枝方法存在不同的角色偏差。
  • 改进EmbedLens的token角色分配方法,提出基于质心并增加alive质心的分配策略,提高角色分配与聚类结果的一致性。
  • 通过角色保护剪枝实验和跨角色注意力分析,发现dead token等非alive token在剪枝下仍能通过群体级注意力影响模型行为。

方法概览

首先分析FastV、DART、DivPrune在不同token预算下的剪枝token角色分布;然后改进EmbedLens的角色分配策略,引入基于质心的分配并增加alive质心;接着通过角色保护剪枝实验(排除特定角色不被剪枝)探究各角色对下游性能的贡献;最后分析跨角色注意力模式(group-level attention mass和pairwise attention score)以解释非alive token的作用。

  • 角色分布分析:在LLaVA-v1.5-7B上应用FastV、DART、DivPrune三种剪枝方法,在5种token预算(保留64至576个token)下统计被剪枝token的角色构成,并与下游10个基准的性能变化关联分析(Fig. 1)。
  • EmbedLens角色分配改进:原方法通过token与文本ID质心的最近邻匹配分配角色,但存在质心级匹配与token级分配不一致的问题。本文引入基于质心的分配策略,并增加alive质心以覆盖更多语义token,通过t-SNE可视化验证改进效果(Fig. 2)。
  • 角色保护剪枝实验:在50% token预算下,分别强制保护alive、dead、ViT sink、LLM sink四类token不被剪枝,在10个VLM基准上评估性能变化,以量化各角色对下游任务的贡献(Table 1)。
  • 跨角色注意力分析:计算原始序列、角色移除及DivPrune剪枝下的group-level attention mass(群体级注意力质量)和pairwise attention score(成对注意力分数),分析不同角色组之间的注意力交互模式,解释非alive token的作用机制(Fig. 3-5)。

逐图理解论文

直觉的失效

直觉的失效
Fig. 1: Token-category distribution and downstream performance under different token budgets. For FastV, DART, and DivPrune, we report the composition of pruned tokens over four token categories and the corresponding performance across ten benchmarks. The x-axis denotes the token budget, while the y-axis indicates either the number of pruned tokens in each category or the downstream task performance.

该图展示三种剪枝方法在不同token预算下被剪枝token的角色分布及对应的下游性能。左侧子图显示FastV倾向剪枝alive token,DART保留更多sink token,DivPrune主要剪枝dead token;右侧子图显示性能随预算变化的趋势,可观察角色分布与性能之间的关联。

研究空白与角色偏差

研究空白与角色偏差
Fig. 2: Visualization of token role assignment strategies in EmbedLens analysis. The left panel illustrates the gap between centroid-level text-ID matching and token-level role assignment, while the right panels show t-SNE visualizations of token roles on COCO-10K under different assignment strategies.

该图对比不同角色分配策略的效果。左侧示意质心级匹配与token级分配的差异;右侧t-SNE可视化显示改进的质心分配策略使角色边界更清晰,新增的alive质心(红色)有效覆盖了语义相关的token簇。

核心贡献:角色保护实验

核心贡献:角色保护实验
Fig. 3: Layer-wise group-level attention mass under three input settings: the original visual token sequence (top row), alive-token pruning (middle row), and dead-token pruning (bottom row).

该图展示原始序列、移除alive token、移除dead token三种设置下的逐层group-level attention mass。可观察dead token组(橙色)在原始序列中获得了与alive token组相当的注意力预算,移除dead token后注意力分布发生显著变化。

机制解释:群体级注意力

机制解释:群体级注意力
Fig. 4: Layer-wise group-level attention mass under three input settings: the original visual token sequence (top row), DivPrune (middle row), and DivPrune with dead- token protection (bottom row).

该图对比原始序列、DivPrune剪枝、DivPrune保护dead token三种设置下的group-level attention mass。DivPrune剪枝后dead token的注意力预算大幅下降,而保护dead token可部分恢复这一预算,解释了性能提升的注意力机制。

实验如何设计?

  • 基础模型:LLaVA-v1.5-7B,使用CLIP-ViT-L作为视觉编码器,投影层输出576个视觉token。
  • 剪枝方法:FastV(基于注意力分数,在第2层剪枝)、DART(基于token重复度)、DivPrune(基于token多样性),均在LLM的第2层执行剪枝。
  • 评估基准:10个VLM常用基准,包括MMBench、MME、POPE、SEEDBench、ScienceQA等,覆盖感知、推理、幻觉检测等多类任务。
  • 角色分配:使用改进的EmbedLens在COCO-10K上分配token角色,alive质心通过聚类确定。
  • 注意力分析:在COCO-10K子集上计算LLM各层的group-level attention mass和pairwise attention score,对比原始序列与剪枝序列的差异。

关键结果与论文证据

  • FastV倾向剪枝alive token,因其高注意力分数集中在浅层而被误判为冗余;DART倾向保留sink token,因其重复度高而被视为重要;DivPrune更倾向剪枝non-alive token,因其多样性低而被优先丢弃(Fig. 1,第7页)。
  • 改进的质心分配策略使角色分配与聚类结果更一致,新增的alive质心有效覆盖了原方法中未被正确分类的语义token(Fig. 2,第8页)。
  • 保护alive token在三种剪枝方法下均带来平均超过1%的性能提升(FastV +1.14%, DART +1.26%, DivPrune +1.25%),验证了alive token的核心价值(Table 1,第10页)。
  • DivPrune保护dead token后平均性能提升0.93%,其中MMBench提升6.12%,表明dead token并非完全无用(Table 1,第10页)。
  • dead token的group-level attention mass与alive token相当,说明dead token作为群体获得了大量注意力预算;但其pairwise attention score较小,表明单个dead token与文本token的交互强度较低(Fig. 3-5,第11-13页)。
  • DivPrune剪枝后,dead token的group-level attention mass显著下降,而保护dead token可部分恢复这一注意力预算,解释了性能提升的机制(Fig. 4,第12页)。

阅读时需要注意

  • 仅在LLaVA-v1.5-7B单一模型上验证,未探索其他VLM架构(如InstructBLIP、Qwen-VL)上的泛化性。
  • 角色保护实验仅在50% token预算下进行,未探索其他预算比例下的角色贡献变化。
  • 注意力分析仅提供关联性证据,未通过因果干预实验(如直接操控注意力权重)建立dead token与性能之间的因果机制。
  • 角色分类依赖EmbedLens的聚类结果,聚类参数的选择可能影响角色边界的稳定性。

关联工作

  • EmbedLens(第4页):本文直接基于其token角色分类框架进行分析和改进,原方法将视觉token分为alive、dead、sink三类,本文增加alive质心以提升分配精度。
  • FastV(第5页):基于注意力分数的剪枝方法,在LLM浅层根据视觉token获得的注意力权重进行剪枝,本文发现其存在误剪alive token的偏差。
  • DART(第6页):基于token重复度的剪枝方法,通过识别重复模式剪枝冗余token,本文揭示其倾向保留sink token。
  • DivPrune(第6页):基于token多样性的剪枝方法,通过最大化保留token的多样性选择剪枝目标,本文发现其更倾向剪枝non-alive token。

发表评论