ALTR:无注意力轻量级Token缩减,让VLM在边缘设备更流畅

ALTR框架核心思路

本文提出ALTR框架,解决VLM中视觉Token冗余导致的计算瓶颈。通过Rényi熵估计重要性和基于MLP变换一致性的多样性采样,ALTR在不依赖注意力图或成对比较的情况下,实现即插即用的Token缩减。实验显示,在LLaVA-v1.5-7B上保留192个Token时,平均性能保留98.86%,且额外FLOPs仅为4.13M,完全兼容FlashAttention-2。该方法适用于需要高效部署VLM的边缘场景。