快速导读:通过EmbedLens识别的token角色(alive, dead, sink)分析现有视觉token剪枝方法的偏差,发现保留非alive token有时能维持或提升性能,表明剪枝决策不能仅依赖单个token的语义相关性。
视觉语言模型(VLM)将图像转换为视觉token序列输入大语言模型,导致推理计算量随token数量线性增长。视觉token剪枝成为缓解这一瓶颈的主流方案,但现有方法(如FastV、DART、DivPrune)均基于单一启发式规则选择保留哪些token,其剪枝决策与token在LLM嵌入空间中的功能角色之间的关系尚不明确。
本文借助EmbedLens工具将投影后的视觉token分为四类角色:携带图像特定语义的alive token、高度同质化的dead token、以及两类sink token(ViT sink和LLM sink)。通过分析三种剪枝方法在不同token预算下的角色分布,发现它们存在截然不同的角色偏差;进一步的角色保护实验表明,保留非alive token有时反而能提升性能,挑战了“仅保留语义相关token”的直觉。
英文题目:Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles
论文出处:arXiv 每日论文精选 · arXiv:2608.04483
原始论文:PDF / 论文页面
这篇论文解决什么问题?
VLM推理时,视觉编码器输出的图像特征经投影层映射到LLM的嵌入空间,形成视觉token序列。随着输入分辨率提升,视觉token数量急剧增加,自注意力计算成为瓶颈。视觉token剪枝通过在LLM的特定层丢弃部分token来减少计算量,但现有方法仅依赖注意力分数、重复度或多样性等启发式指标,缺乏对token功能角色的理解。
EmbedLens的分析揭示了一个关键现象:投影后的视觉token在LLM嵌入空间中呈现稀疏结构,大部分token聚集在少数文本ID附近,形成dead token;少数token分散在语义相关区域,成为alive token;还有部分token具有大激活范数或高注意力但不携带语义,被归类为sink token。这一角色分类为理解剪枝行为提供了新的分析维度。
直觉上,剪枝应优先保留alive token、丢弃dead token,因为前者携带语义而后者看似冗余。但本文的核心发现是:这一直觉并不完全成立。不同剪枝方法对四类角色的偏好差异显著,且在某些任务上保留dead token反而带来性能提升,说明剪枝决策不能仅依赖单个token的语义相关性。
核心创新
- 首次将EmbedLens的token角色分析与视觉token剪枝方法联系起来,揭示不同剪枝方法存在不同的角色偏差。
- 改进EmbedLens的token角色分配方法,提出基于质心并增加alive质心的分配策略,提高角色分配与聚类结果的一致性。
- 通过角色保护剪枝实验和跨角色注意力分析,发现dead token等非alive token在剪枝下仍能通过群体级注意力影响模型行为。
方法概览
首先分析FastV、DART、DivPrune在不同token预算下的剪枝token角色分布;然后改进EmbedLens的角色分配策略,引入基于质心的分配并增加alive质心;接着通过角色保护剪枝实验(排除特定角色不被剪枝)探究各角色对下游性能的贡献;最后分析跨角色注意力模式(group-level attention mass和pairwise attention score)以解释非alive token的作用。
- 角色分布分析:在LLaVA-v1.5-7B上应用FastV、DART、DivPrune三种剪枝方法,在5种token预算(保留64至576个token)下统计被剪枝token的角色构成,并与下游10个基准的性能变化关联分析(Fig. 1)。
- EmbedLens角色分配改进:原方法通过token与文本ID质心的最近邻匹配分配角色,但存在质心级匹配与token级分配不一致的问题。本文引入基于质心的分配策略,并增加alive质心以覆盖更多语义token,通过t-SNE可视化验证改进效果(Fig. 2)。
- 角色保护剪枝实验:在50% token预算下,分别强制保护alive、dead、ViT sink、LLM sink四类token不被剪枝,在10个VLM基准上评估性能变化,以量化各角色对下游任务的贡献(Table 1)。
- 跨角色注意力分析:计算原始序列、角色移除及DivPrune剪枝下的group-level attention mass(群体级注意力质量)和pairwise attention score(成对注意力分数),分析不同角色组之间的注意力交互模式,解释非alive token的作用机制(Fig. 3-5)。
逐图理解论文
直觉的失效

该图展示三种剪枝方法在不同token预算下被剪枝token的角色分布及对应的下游性能。左侧子图显示FastV倾向剪枝alive token,DART保留更多sink token,DivPrune主要剪枝dead token;右侧子图显示性能随预算变化的趋势,可观察角色分布与性能之间的关联。
研究空白与角色偏差

该图对比不同角色分配策略的效果。左侧示意质心级匹配与token级分配的差异;右侧t-SNE可视化显示改进的质心分配策略使角色边界更清晰,新增的alive质心(红色)有效覆盖了语义相关的token簇。
核心贡献:角色保护实验

该图展示原始序列、移除alive token、移除dead token三种设置下的逐层group-level attention mass。可观察dead token组(橙色)在原始序列中获得了与alive token组相当的注意力预算,移除dead token后注意力分布发生显著变化。
机制解释:群体级注意力

该图对比原始序列、DivPrune剪枝、DivPrune保护dead token三种设置下的group-level attention mass。DivPrune剪枝后dead token的注意力预算大幅下降,而保护dead token可部分恢复这一预算,解释了性能提升的注意力机制。
实验如何设计?
- 基础模型:LLaVA-v1.5-7B,使用CLIP-ViT-L作为视觉编码器,投影层输出576个视觉token。
- 剪枝方法:FastV(基于注意力分数,在第2层剪枝)、DART(基于token重复度)、DivPrune(基于token多样性),均在LLM的第2层执行剪枝。
- 评估基准:10个VLM常用基准,包括MMBench、MME、POPE、SEEDBench、ScienceQA等,覆盖感知、推理、幻觉检测等多类任务。
- 角色分配:使用改进的EmbedLens在COCO-10K上分配token角色,alive质心通过聚类确定。
- 注意力分析:在COCO-10K子集上计算LLM各层的group-level attention mass和pairwise attention score,对比原始序列与剪枝序列的差异。
关键结果与论文证据
- FastV倾向剪枝alive token,因其高注意力分数集中在浅层而被误判为冗余;DART倾向保留sink token,因其重复度高而被视为重要;DivPrune更倾向剪枝non-alive token,因其多样性低而被优先丢弃(Fig. 1,第7页)。
- 改进的质心分配策略使角色分配与聚类结果更一致,新增的alive质心有效覆盖了原方法中未被正确分类的语义token(Fig. 2,第8页)。
- 保护alive token在三种剪枝方法下均带来平均超过1%的性能提升(FastV +1.14%, DART +1.26%, DivPrune +1.25%),验证了alive token的核心价值(Table 1,第10页)。
- DivPrune保护dead token后平均性能提升0.93%,其中MMBench提升6.12%,表明dead token并非完全无用(Table 1,第10页)。
- dead token的group-level attention mass与alive token相当,说明dead token作为群体获得了大量注意力预算;但其pairwise attention score较小,表明单个dead token与文本token的交互强度较低(Fig. 3-5,第11-13页)。
- DivPrune剪枝后,dead token的group-level attention mass显著下降,而保护dead token可部分恢复这一注意力预算,解释了性能提升的机制(Fig. 4,第12页)。
阅读时需要注意
- 仅在LLaVA-v1.5-7B单一模型上验证,未探索其他VLM架构(如InstructBLIP、Qwen-VL)上的泛化性。
- 角色保护实验仅在50% token预算下进行,未探索其他预算比例下的角色贡献变化。
- 注意力分析仅提供关联性证据,未通过因果干预实验(如直接操控注意力权重)建立dead token与性能之间的因果机制。
- 角色分类依赖EmbedLens的聚类结果,聚类参数的选择可能影响角色边界的稳定性。
关联工作
- EmbedLens(第4页):本文直接基于其token角色分类框架进行分析和改进,原方法将视觉token分为alive、dead、sink三类,本文增加alive质心以提升分配精度。
- FastV(第5页):基于注意力分数的剪枝方法,在LLM浅层根据视觉token获得的注意力权重进行剪枝,本文发现其存在误剪alive token的偏差。
- DART(第6页):基于token重复度的剪枝方法,通过识别重复模式剪枝冗余token,本文揭示其倾向保留sink token。
- DivPrune(第6页):基于token多样性的剪枝方法,通过最大化保留token的多样性选择剪枝目标,本文发现其更倾向剪枝non-alive token。