ALTR:无注意力轻量级Token缩减,让VLM在边缘设备更流畅

三分钟导读:本文提出ALTR,一种无需注意力图或成对比较的即插即用Token缩减框架,通过Rényi熵估计重要性和基于MLP变换一致性的多样性采样,在保持高性能的同时显著降低计算开销。

英文题目:Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

论文出处:arXiv 每日论文精选 · arXiv:2607.13500

原始论文:PDF / 论文页面

对应视频标题:ALTR:无注意力轻量级Token缩减,让VLM在边缘设备更流畅|推荐指数:★★★★★

这篇论文解决什么问题?

现有VLM在边缘设备部署中面临视觉Token数量庞大导致的计算负担,且现有的Token缩减方法要么依赖与FlashAttention等现代加速框架不兼容的注意力图,要么依赖计算密集的成对相似度比较,削弱了效率增益。

核心创新

  • 提出无注意力的重要性估计方法,利用Rényi熵量化Token内在信息量,避免显式注意力计算。
  • 引入基于特征变换一致性的多样性感知采样,通过MLP变换后的余弦相似度排序实现隐式语义组织,无需成对比较。
  • 设计训练即插即用模块,完全兼容FlashAttention等现代加速框架,实现线性时间复杂度。

方法概览

ALTR框架包含两个阶段:Stage I通过计算特征激活的二阶Rényi熵来估计Token重要性,保留熵值最高的Token;Stage II利用视觉编码器最后一层MLP变换前后的余弦相似度作为变换一致性信号,对剩余Token排序并进行步长采样以保留多样性。最终通过平衡系数λ组合两个子集。

逐图理解论文

ALTR框架核心思路

ALTR框架核心思路
Fig. 1: The Framework of ALTR.

本文提出ALTR框架,一种无需注意力图或成对比较的即插即用Token缩减方案。ALTR包含两个阶段:首先通过计算特征激活的二阶Rényi熵来估计Token重要性,保留熵值最高的Token;其次利用视觉编码器最后一层MLP变换前后的余弦相似度作为变换一致性信号,对剩余Token排序并进行步长采样以保留多样性。最终通过平衡系数λ组合两个子集,实现高效的信息保留。

LLaVA基准性能评估

LLaVA基准性能评估
Fig. 2: Performance on LLaVA-Next

在LLaVA-v1.5-7B上的评估显示,ALTR在保留192个Token时,平均性能保留98.86%,优于所有基线。即使在极端压缩至64个Token时,平均性能仍保留94.52%,优于VisionZip的94.08%。在LLaVA-NeXT上保留320个Token时,GQA准确率达到59.28%,显著优于PyramidDrop的49.86%。这些结果证明了ALTR在不同Token预算下的高性能保持能力。

消融实验与组件分析

消融实验与组件分析
Fig. 3: Ablation study results.

消融实验进一步验证了ALTR各组件的有效性。移除重要性估计模块会导致性能显著下降,而移除多样性采样模块则影响Token的语义覆盖。定性可视化结果显示,ALTR保留的Token更集中于关键语义区域。这些实验证实了Rényi熵和变换一致性采样在Token选择中的互补作用,确保了缩减后的Token集兼具信息密度和多样性。

超参数敏感性分析

超参数敏感性分析
Fig. 5: Sensitivity of our method to the balancing coefficient λ under different visual-token budgets.

超参数敏感性分析考察了平衡系数λ的影响。实验表明,ALTR对λ值具有较好的鲁棒性,在不同视觉Token预算下,性能波动较小。然而,λ仍需固定值,未来可探索基于任务特征的自适应策略以进一步优化性能。这一分析为实际应用中参数调优提供了参考,确保了方法在不同场景下的稳定性。

实验与关键结果

  • 在LLaVA-v1.5-7B上评估MME, TextVQA, ScienceQA, GQA四个基准,保留192, 128, 64个Token。
  • 在LLaVA-NeXT (GQA) 和 Qwen2.5-VL-7B (TextVQA) 上验证泛化能力。
  • 效率分析:对比FLOPs, CUDA时间和时间复杂度。
  • 兼容性分析:测试与FlashAttention-2的配合使用。
  • 边缘部署测试:在NVIDIA Jetson AGX Orin上进行OOM边界研究。
  • 消融实验:移除重要性或多样性模块。
  • 超参数敏感性分析:平衡系数λ的影响。
  • 在LLaVA-v1.5保留192 Token时,平均性能保留98.86%,优于所有基线。(第 7 页)
  • 在LLaVA-v1.5保留64 Token时,平均性能保留94.52%,优于VisionZip (94.08%)。(第 7 页)
  • 在LLaVA-NeXT保留320 Token时,GQA准确率为59.28%,优于PyramidDrop (49.86%)。(第 7 页)
  • 在Qwen2.5-VL保留150 Token时,TextVQA准确率为72.19%,优于VisionZip。(第 7 页)
  • ALTR引入额外FLOPs仅为4.13M,CUDA时间为0.579ms,显著低于VisionZip (106.91M, 0.884ms) 和 VisPruner (2880.35M, 7.151ms)。(第 8 页)
  • 在Jetson AGX Orin上,ALTR在128 Token预算下引入69.9ms缩减延迟,且支持最大1792 Token的生成长度。(第 9 页)

阅读时需要注意

  • 当前方法主要针对静态图像,未来需扩展至视频语言模型等具有时间动态性的场景。
  • 平衡系数λ虽鲁棒,但仍需固定值,未来可探索基于任务特征的自适应策略。
  • 该方法为训练-free,直接应用于预训练VLM,无需微调。
  • 在极端压缩(如64 Token)下,尽管性能保留较高,但仍存在约5.48%的平均性能下降。

关联工作

  • SparseVLMs:基于注意力图的Inner-LM方法,与ALTR的无注意力设计形成对比。(第 3 页)
  • VisionZip:基于相似度的Before-LM方法,ALTR在效率和性能上均优于该方法。(第 7 页)
  • FlashAttention:现代加速框架,ALTR证明其无注意力设计完全兼容FlashAttention-2。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

1

面向高效视觉语言模型的无注意力机制与轻量级 Token 缩减

Xuanyi Hao , Zuoyuan Zhang , Zhibo Wang , IEEE 高级会员, Xiaoyi Pang , Jiahui Hu , Jiacheng Du , Shuguo Zhuo

摘要—视觉语言模型 (VLMs) 在多模态理解方面取得了 强大的性能,但由于处理大量视觉 Token 带来的巨大计算开销, 在资源受限的边缘设备上部署仍然具有挑战性,这显著增加了 LLM 推理过程中的序列长度以及自注意力的二次方计算成本, 给边缘硬件带来了沉重的计算负担。因此,在保留关键视觉信息 的同时减少视觉 Token 的数量,对于实现可扩展且高效的 VLM 部署至关重要。Token 缩减是加速 VLM 推理的一个有前景的方向, 但现有方法要么依赖于与现代加速框架不兼容的注意力图,要么 依赖于计算密集型的成对相似度比较,这破坏了可扩展性并抵消 了其在部署中的实际效益。在本文中,我们提出了一种无注意力 机制且轻量级的 Token 缩减框架,作为 VLM 的即插即用模块, 该模块保留了重要且多样的 Token,以生成紧凑的视觉表示。 首先,为了实现无注意力机制的重要性估计,我们采用信息论 视角,并使用一种新颖的基于熵的准则来量化 Token 信息,保留 那些具有更多信息的 Token,以确保以轻量级方式实现多样化的 视觉覆盖。其次,为了产生类似的信号,我们引入了一种诱导 相似 Token 聚集的变换,其中这种一致性信号将相似的 Token 彼此靠近,并使得基于步长的选择能够产生多样化的 Token 集合。 在多个 VLM 基准上的大量实验表明,我们的框架在精度与效率 之间取得了良好的权衡,在激进压缩下仍能保持具有竞争力的性能。

I. 引言

视觉语言模型 (VLMs) 已成为多模态理解的强大范式, 在视觉问答、图像描述和多模态对话等任务中表现出卓越的性能 [1, 2, 3, 4]。通过将视觉编码器与大语言模型 (LLM) 耦合, VLMs 能够将视觉表示与语言语义对齐,并执行复杂的跨模态推理, 凸显了其在边缘和移动应用中的潜力。然而,由于 VLMs 存在 巨大的计算开销,将其部署在资源受限的边缘设备上 [5, 6, 7, 8] 仍然极具挑战性。这种开销的主要来源之一是视觉编码器生成的 视觉 Token 数量过多 [9, 10, 11, 12],每张图片往往达到数百甚至 数千个。这显著增加了输入序列长度以及自注意力机制在 LLM 推理过程中的二次方计算成本,给边缘硬件带来了沉重的计算负担。 因此,在保留关键视觉信息的同时减少视觉 Token 的数量,对于 实现可扩展且高效的 VLM 部署至关重要。Token 缩减 [13, 14, 15, 16] 因此被视为缓解这一瓶颈并通过保留信息性 Token 同时移除冗余 Token 来加速 VLM 推理的一个有前景的方向。

大多数现有方法使用注意力图来估计 Token 的重要性,并根据 其注意力权重丢弃或合并视觉 Token [17, 18, 19, 20, 21, 22]。 尽管这些方法有效,但它们本质上依赖于显式的注意力计算, 这使得它们与现代加速框架如 FlashAttention [23, 24, 25, 26] 不兼容,后者避免了注意力矩阵的显式化,从而在大规模 VLM 推理中实现加速。这种不兼容性严重限制了这些方法在大规模 VLM 中的适用性。其他工作试图通过基于特征相似度选择 Token 来避免这一限制 [27, 28, 29, 30]。然而,这些方法通常需要大量的 成对 Token 比较,引入了巨大的计算开销,削弱了 Token 缩减 带来的实际效率增益。这些局限性 [cs.CV] 索引术语—VLMs, Token 缩减, 边缘设备。 凸显了需要一种视觉 Token 缩减方法,该方法能同时实现强大的 有效性、高效率以及广泛的兼容性。

在本文中,我们的目标是开发一种运行于视觉编码器和 LLM 之间的视觉 Token 缩减框架,在实现高效 Token 压缩的同时, 完全兼容现代加速框架。然而,实现这一目标面临着几个根本性 挑战。首先,确定保留哪些视觉 Token inherently 具有挑战性, 因为视觉信号具有密集和高冗余的性质。在没有下游跨模态交互 先验知识的情况下,很难识别哪些 Token 对于在 Token 缩减后 保留准确的多模态推理至关重要。其次,无注意力机制与计算 轻量级之间存在根本性的张力。注意力机制通过其学习到的加权 模式自然地强调视觉上显著的 Token,使得注意力图成为 Token 重要性估计的便捷信号。在没有此类线索的情况下,替代策略 往往依赖于大量的 Token 交互,这不可避免地引入了巨大的 计算开销。因此,设计一种既无注意力机制又计算轻量级的 Token 缩减方法变得极具挑战性。

为了解决这些挑战,我们提出了一种无注意力机制且轻量级的 视觉 Token 缩减方法,称为 ALTR。

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Jiacheng Du, Shuguo Zhuo, 均隶属于浙江大学区块链与数据安全全国重点实验室,中国杭州 310027。(邮箱: xyhao, zuoyuan2024, zhibowang, jcdu, shuguozhuo@zju.edu.cn)。 Xiaoyi Pang 隶属于香港科技大学,中国香港特别行政区。(邮箱: xypang@whu.edu.cn)。 Jiahui Hu 隶属于南昌大学人工智能学院,中国南昌 330038。(邮箱: jiahuihu@ncu.edu.cn)。

第 2 页

2

II. 相关工作

A. 视觉语言模型

视觉语言模型(VLMs)近年来经历了快速演变,显著提升了统一多模态理解的能力。该领域的早期研究主要关注通过双编码器架构对齐视觉和文本表示,例如 CLIP 风格模型 [10, 11],其中图像和文本被独立编码并在共享嵌入空间中进行匹配。尽管这些方法在检索和分类任务中有效,但它们缺乏细粒度的跨模态交互。为了实现更深层次的多模态推理,后续工作引入了交叉注意力机制,以显式地融合视觉和文本特征。代表性模型如 ViLBERT [31] 和 UNITER [32] 采用基于 Transformer 的架构,具有跨模态注意力层,允许图像区域和文本标记之间进行双向交互。尽管性能有所提升,但这些模型通常是在中等规模数据集上训练的,泛化能力有限。

最近,大型语言模型的出现重塑了 VLM 的设计。主导范式转向一种模块化架构,将预训练的视觉编码器与强大的 LLM 耦合。在此框架中,视觉输入首先由视觉主干网络进行标记化,然后投影到语言嵌入空间,使 LLM 能够以自回归方式执行多模态推理。这种设计显著提高了可扩展性和任务泛化能力。在此范式基础上,最近的大规模 VLM,如 Gemini [1]、InternVL [2] 和 Qwen-VL [3],通过大规模多模态预训练和指令微调进一步提升了性能。这些模型在视觉问答、图像描述和多模态对话等各种任务中展现出强大的能力,并表现出涌现的推理能力。

尽管取得了这些进展,视觉输入的标记化表示引入了巨大的计算开销。现代视觉编码器,特别是基于 ViT 的架构 [9],将图像分解为大量视觉标记,每张图像往往达到数百甚至数千个,其中许多是冗余或信息量较少的。当这些标记被输入到 LLM 时,序列长度显著增加,导致内存消耗更高,并在自注意力中产生二次计算复杂度。在高分辨率或多图像场景中,这一挑战变得更加严重。因此,提高视觉标记处理的效率已成为可扩展 VLM 部署的关键研究方向。

B. VLM 的标记缩减

标记缩减已在 VLM 中被广泛探索,作为提高计算效率的有效策略 [33, 34, 35, 36, 37, 38]。一类主要方法依赖于注意力图来估计标记的重要性,并丢弃注意力权重较低的标记。例如,SparseVLMs [17] 利用 VLM 内的自注意力矩阵,将视觉相关的文本标记识别为评分者,并利用其注意力响应来估计视觉标记的重要性。

我们的核心思想是通过联合建模标记的重要性和多样性来进行一次性标记选择,确保保留的标记既具有信息量又具有视觉代表性。为了在不使用注意力图的情况下实现高效可靠的评估,我们重新审视视觉标记本身,并观察到信息丰富的标记往往表现出更丰富且退化程度较低的特征分布。受此洞察的引导,我们从信息论的角度量化标记的重要性,仅基于每个标记的特征激活来测量其内在信息含量。这使得我们能够通过单次传递识别并保留最具信息量的视觉标记,其计算独立于注意力机制,且随标记数量线性扩展。除了保留高度信息丰富的标记外,有效的视觉语言推理还需要在保留的视觉表示中保持足够的多样性,特别是在下游任务未知的情况下。我们没有显式地成对比较标记(这将产生高昂的计算成本),而是引入了一种变换诱导的一致性信号,即当通过相同的网络层处理时,表示相似的标记表现出相似的变化信号。通过此信号对标记进行排序,每个标记的标量值使相似标记彼此靠近,从而启用基于步长的采样,从有序列表的不同区域选择标记,从而产生多样化的标记集,与成对向量比较相比,其开销可忽略不计。这两个标准通过一个比率超参数集成,该超参数在基于重要性的选择和基于多样性的选择之间分配标记,从而为高效的 VLM 推理生成紧凑且具有表现力的标记集。

我们的主要贡献总结如下:

  • 我们引入了一个无注意力且轻量级的标记缩减框架,用于视觉语言模型,在保持与现代加速框架完全兼容的同时,实现高效的视觉标记压缩。
  • 我们提出了一种联合感知重要性和感知多样性的标记缩减机制,该机制结合了熵引导的重要性估计和变化引导的多样性采样,使得能够在不依赖注意力图或昂贵的成对标记交互的情况下,保留信息丰富且多样化的标记。
  • 大量实验表明,我们的框架在 LLaVA-v1.5 上的各种标记预算下 consistently 实现了最先进的性能,并很好地泛化到 LLaVA-Next 和 Qwen2.5-VL。此外,与现有方法相比,我们的方法产生的计算开销更低,并且完全兼容现代加速框架,使其在资源受限的边缘设备上部署更具优势。

本文其余部分组织如下。第二部分回顾了 VLM 和现有标记缩减策略的相关工作。第三部分介绍了 VLM 的内部架构并形式化了标记缩减问题。第四部分详细介绍了提出的 ALTR 标记缩减框架。第五部分提供了对所提出方法的全面实验评估。第六部分总结了本文并讨论了未来的研究方向。

第 3 页

3

令牌。PyramidDrop [18] 利用最后一个指令令牌与视觉令牌之间的注意力来估计视觉令牌的重要性,并在预定义阶段逐步丢弃冗余令牌。MustDrop [19] 在编码、预填充和解码阶段估计视觉令牌的重要性,并通过双注意力过滤机制逐步剪枝冗余令牌。虽然这些方法有效地减少了令牌数量,但它们依赖于显式的注意力计算,这使得它们与现代加速框架(如 FlashAttention,其避免显式化注意力矩阵以提高效率)不兼容。

为了解决这一局限性,一些工作提出了基于令牌相似度指标识别冗余令牌的免注意力令牌缩减策略。例如,SAINT [27] 通过基于图的公式建模令牌相似度来识别冗余令牌,其中高度相似的令牌会被剪枝。DyMU [28] 动态合并相似的视觉令牌以减少冗余,并引入虚拟令牌解合并以重建完整的注意力动态。虽然消除了对注意力图的需求,但此类方法通常由于广泛的令牌交互而引入额外的计算,其复杂度通常与令牌数量的平方成正比。

此外,一些工作将令牌缩减机制直接整合到模型架构中。这些方法通常引入额外的模块 [39, 40] 或重新设计视觉编码器 [41, 42],以在前向传播过程中逐步压缩令牌序列。虽然在提高效率方面有效,但这些方法与模型架构和训练过程紧密耦合。因此,它们通常需要端到端的重训练或大量的微调,这限制了它们对现有预训练 VLM 的适用性,并阻碍了在实际场景中的直接复用。

因此,仍然需要一个即插即用的令牌缩减框架,该框架能够有效识别关键视觉令牌,而不依赖于注意力机制或产生沉重的计算开销。

III. 预备知识

典型的视觉语言模型 (VLM) 包含三个主要组件:(i) 视觉编码器 $E_v$,从输入图像中提取视觉表示;(ii) 投影器 $P$,将视觉特征映射到语言模型的嵌入空间;以及 (iii) 大型语言模型 (LLM) $E_\ell$,执行多模态推理和生成。

给定输入图像 $I$,视觉编码器生成 $N$ 个视觉令牌序列:$X = E_v(I) = \{x_i\}_{i=1}^N$,其中 $x_i \in \mathbb{R}^D$。这些令牌随后由投影器投影到 LLM 嵌入空间:$Z = P(X)$,其中 $z_i \in \mathbb{R}^{d_\ell}$,$d_\ell$ 表示 LLM 的隐藏维度。最后,LLM 消耗投影后的视觉令牌 $Z$ 以及文本输入,以执行多模态理解、推理和响应生成。

B. 问题表述

本工作的目标是识别一个紧凑的视觉令牌子集,该子集保留了原始图像中的关键视觉内容,同时显著降低了处理所有 $N$ 个令牌相关的计算成本。给定完整的视觉令牌序列 $X = \{x_i\}_{i=1}^N$,我们的目标是选择一个缩减子集

$$ X^* \subset X, \quad |X^*| = K \ll N, \quad (1) $$

使得使用 $X^*$ 实现的多模态推理性能尽可能接近使用完整令牌集 $X$ 获得的性能。

形式上,我们定义一个令牌选择算子 $S$,将原始令牌序列映射为缩减后的序列,即 $X^* = S(X)$。令牌缩减问题随后可以表述为以下约束优化问题:

$$ \min_S |S(X)| \quad (2) $$ $$ \text{s.t.} \quad L(F(S(X)), F(X)) \le \delta, $$

其中 $F(\cdot)$ 表示固定的 VLM,$L(\cdot, \cdot)$ 衡量有无令牌缩减时模型输出之间的差异,$\delta$ 指定了可容忍的性能下降水平。

实际上,直接求解上述优化问题是不现实的。因此,实用的令牌选择算子 $S$ 应满足两个关键需求:(i) 优先选择携带高信息量且对下游多模态推理至关重要的令牌;(ii) 保持所选令牌之间足够的语义多样性,以减轻冗余。这些需求为开发高效且有效的令牌缩减方法提供了原则性指导。

IV. 方法论

我们提出了一种免注意力且轻量级的视觉令牌缩减框架 ALTR(见图 1),用于视觉语言模型。该框架运行于视觉编码器和 LLM 之间,近似于一个平衡重要性和多样性的双目标选择问题。给定输入图像,视觉编码器首先生成视觉令牌序列。我们不是将所有令牌输入 LLM,而是执行一次性令牌缩减,以选择一个紧凑但信息丰富的视觉令牌子集。我们的方法由两个连续阶段组成。在第一阶段,我们使用二阶 Rényi 熵估计令牌重要性,该熵衡量特征激活在维度上的离散程度。通过将归一化的特征幅度解释为潜在语义成分上的分布,具有较高熵的令牌被认为编码了更丰富且退化程度更低的信息。在第二阶段,我们利用最终层 MLP 诱导的令牌间变换的一致性。每个令牌与其变换表示之间的余弦相似度作为表征变换敏感性的轻量级代理。基于此指标对令牌进行排序,使其按潜在语义顺序排列,沿此顺序进行步长采样可确保对特征空间的广泛覆盖。最终选定的令牌随后被投影到 LLM 嵌入空间,并与文本令牌一起处理以进行多模态推理。这两个阶段将在以下小节中详细描述。

A. 视觉语言模型的架构

第 4 页

4

图像输入 阶段 1

⊕ 选择 阶段 2 视觉 编码器 投影器 阶段 1 之后 Token 选择 LLM 重要性感知 多样性感知 Token 文本输入 视觉 Token 缩减 标志中的单词是 "c'est Tokenizer cheese" 吗?请回答是或否 (a) ALTR 框架

计算 Rényi 熵:𝑯𝟐= −𝒍𝒐𝒈σ 𝒑𝒋𝟐 阶段 2 之后

√ 高 𝑯𝟐 MLP 排序

× 余弦相似度 步长选择 最终保留的 Token 低 𝑯𝟐 (b) 阶段 1:基于 Rényi 熵的重要性感知 Token 选择 (c) 阶段 2:基于特征变化一致性的多样性感知 Token 选择 (d) ALTR 流程的可视化

图 1:ALTR 的框架。

A. 阶段 I:基于 Rényi 熵的重要性感知 Token 选择 我们随后使用二阶 Rényi 熵来量化该分布的集中程度:

D 阶段 I 的目标是识别那些为下游多模态推理贡献大量语义内容的视觉信息丰富的 Token。与利用注意力图来指导 Token 选择的方法不同,我们发现具有更丰富且更均匀特征激活的 Token 倾向于编码重要的视觉模式,而具有高度集中或退化激活的 Token 通常对应于低信息区域。为了形式化这一直觉,我们将每个 Token 表示解释为分布在特征维度上的潜在语义成分的组成。在这种观点下,每个特征通道的幅度反映了相应潜在因子的贡献。因此,我们对特征值进行归一化,以获得维度上的离散分布,从而实现对激活分散度的原则性测量。

H2(xi) = −log X p2i,j. (4) 令 X = {xi}Ni=1 表示由视觉编码器产生的视觉 Token,其中 xi ∈RD。对于每个 Token xi,我们沿通道维度归一化其特征值: j=1 |xi,j| pi,j = , (3) 与香农熵相比,二阶 Rényi 熵计算效率高,并更加强调主导成分,因此特别适用于测量高维特征空间中的激活集中度。较高的熵值对应于更均匀的分布,表明该 Token 激活了更广泛的潜在成分,从而编码了更丰富且更非退化的语义信息。 PDk=1 |xi,k| 其中 pi,j 可以解释为潜在语义成分上的离散概率分布。使用绝对值避免了符号抵消,并确保激活幅度忠实地反映特征贡献。 基于这一标准,我们选择熵值最高的前 K1 个 Token,形成重要性感知 Token 集 Ximp。

B. 阶段 II:基于特征变化一致性的多样性感知 Token 选择 虽然阶段 I 识别了视觉信息丰富的 Token,但有效的视觉-语言推理还需要保留多样化的视觉线索,因为语义相似的 Token 通常提供有限的互补信息,而多样性能够实现更广泛的上下文覆盖和更稳健的多模态推理。为此,我们引入了一种基于特征变化一致性的多样性感知 Token 选择策略。 我们的核心见解是,MLP 诱导的表示变化作为语义接近度的隐式指标,

第 5 页

5

当具有相似视觉内容的 token 在相同的非线性映射下经历一致的变换轨迹时,我们可以利用这一观察结果,在由变换响应定义的潜在空间中组织 token,而无需显式的成对比较。

形式上,对于每个 token $x_i \in X \setminus X_{imp}$,我们从视觉编码器的最后一层 MLP(记为 $f(\cdot)$)中提取其 MLP 前表示 $x'_i$ 和 MLP 后表示 $x''_i$。变换过程如下:

$$ x''_i = f(x'_i) = W_2 \sigma(W_1 x'_i), \quad (5) $$

其中 $W_1$ 和 $W_2$ 是 MLP 的权重矩阵,$\sigma(\cdot)$ 是激活函数。值得注意的是,$x'_i$ 和 $x''_i$ 均从视觉编码器的标准前向传播中获得,不产生额外的计算开销。

为了量化由变换引起的变化,我们测量原始表示与变换表示之间的余弦相似度:

$$ s_i = \cos(x'_i, x''_i) = \frac{x'^\top_i x''_i}{\|x'_i\|_2 \|x''_i\|_2} \quad (6) $$

这个标量指标捕捉了 MLP 变换下方向一致性的程度。更具体地说,具有相似语义特征的 token 往往产生相似的 $s_i$ 值,而语义不同的 token 更有可能在这个变换响应空间中分散。因此,根据 $s_i$ 对 token 进行排序为分组语义相似的 token 提供了一个高效的代理。

基于这种排序,我们执行基于步长的采样以确保均匀覆盖。给定目标预算 $K_2$,我们在排序后的序列上以固定间隔 $(N – |X_{imp}|)/K_2$ 选择 token。这种方法可以解释为在由变换响应诱导的潜在语义轴上进行均匀采样,有效地防止了相似 token 在最终集合中的集中。

该策略有效地增强了保留 token 之间的多样性,从而产生一个多样性感知的 token 集合 $X_{div}$。

C. 整体 Token 缩减流程

整体流程将 token 缩减过程形式化为一个结构化选择问题,如算法 1 所示。给定一组 $N$ 个视觉 token,我们的方法通过组合两个互补的子集来构建缩减 token 集合 $X^*$:一个重要性感知子集 $X_{imp}$ 和一个多样性感知子集 $X_{div}$。重要性感知子集是通过对 token 根据它们的 Rényi 熵进行排名并选择前 $K_1$ 个 token 获得的。多样性感知子集是从剩余 token 中通过基于变换一致性的排序,随后进行基于步长的采样获得的,从而产生 $K_2$ 个额外的 token。最终的缩减 token 集合由下式给出:

$$ X^* = X_{imp} \cup X_{div}, \quad |X^*| = K_1 + K_2 = K, \quad (7) $$

其中两个子集之间的平衡由 $\lambda$ 控制,$K_1 = \lambda K$ 且 $K_2 = (1 – \lambda)K$。

值得注意的是,整个流程是无训练的,不依赖于注意力图或 token 间的成对交互。因此,我们的方法计算高效、可扩展,并且易于与现代加速框架兼容。

算法 1 VLMs Token 缩减流程 输入:视觉 token $X = \{x_i\}_{i=1}^N$,目标预算 $K$,平衡因子 $\lambda \in [0, 1]$ 输出:缩减后的 token 集合 $X^*$,满足 $|X^*| = K$

1: $K_1 \leftarrow \lfloor \lambda K \rfloor, K_2 \leftarrow K – K_1$ 2: $X_{imp} \leftarrow \emptyset, X_{div} \leftarrow \emptyset$

{阶段 I:重要性感知 Token 选择} 3: for each token $x_i \in X$ do 4: 归一化特征幅度: $$p_{i,j} = \frac{|x_{i,j}|}{\sum_{k=1}^D |x_{i,k}|}$$ 5: 计算二阶 Rényi 熵: $$H_2(x_i) = -\log \sum_{j=1}^D p_{i,j}^2$$ 6: end for 7: $X_{imp} \leftarrow \text{Top-}K_1 \text{ tokens by } H_2(\cdot)$

{阶段 II:多样性感知 Token 选择} 8: $X_{rem} \leftarrow X \setminus X_{imp}$ 9: for each $x_i \in X_{rem}$ do 10: 从视觉编码器最后一层获取 MLP 前表示 $x'_i$ 和 MLP 后表示 $x''_i$ 11: 计算相似度得分: $$s_i = \cos(x'_i, x''_i) = \frac{x'^\top_i x''_i}{\|x'_i\|_2 \|x''_i\|_2}$$ 12: end for 13: 按 $s_i$ 升序对 $X_{rem}$ 进行排序 14: 计算步长 $t \leftarrow \max(1, \lfloor |X_{rem}|/K_2 \rfloor)$ 15: 选择 $X_{div}$ 为 $\{x_i \mid i = 1, 1+t, \dots \}$ 直到 $K_2$ 个 token 16: $X^* \leftarrow X_{imp} \cup X_{div}$ 17: return $X^*$

V. 实验

在本节中,我们从多个角度进行综合实验,以评估所提方法的有效性、效率、兼容性和实际部署能力。我们首先介绍实验设置,涵盖模型、数据集、基线和实现细节。然后,我们进行全面的性能分析,以评估我们的方法在任务准确性方面的有效性。随后,我们进行效率分析,以评估我们的方法在计算成本和延迟降低方面的表现。接下来,我们调查我们的方法与现代系统级加速技术的兼容性,展示其集成到实际推理流水线中的潜力。最后,通过在部署的推理系统上的测试床评估,我们进一步验证了该方法在现实部署场景下的有效性。最后,我们进行消融实验和超参数分析,以评估关键组件的贡献并证明我们设计选择的合理性。

第 6 页

6

表 I:在 LLaVA-v1.5 上的性能表现。括号外的数值表示在 TextVQA、ScienceQA 和 GQA 上的原始准确率 (%),或在 MME 上的原始总分。括号内的数值表示相对于原始模型的性能,其中原始模型的性能归一化为 100%。平均值是基于归一化结果计算的。

| Dataset | MME | TextVQA | ScienceQA | GQA | Avg. | | :— | :— | :— | :— | :— | :— | | Method | | | | | | | | Upper Bound, 576 tokens (100%) | | | | | | LLaVA-v1.5-7B | 1861.59 (100%) | 58.21% (100%) | 70.17% (100%) | 59.27% (100%) | 100% | | | Retain 192 Tokens (↓66.7%) | | | | | | SparseVLMs (ICML 25) | 1776.42 (95.42%) | 57.75% (99.21%) | 69.82% (99.50%) | 59.44% (100.29%) | 98.61% | | PyramidDrop (CVPR 25) | 1770.23 (95.09%) | 56.20% (96.55%) | 70.03% (99.80%) | 57.16% (96.44%) | 96.97% | | MustDrop (arXiv) | 1751.11 (94.06%) | 56.25% (96.63%) | 69.98% (99.50%) | 57.03% (96.22%) | 96.66% | | VisionZip (CVPR 25) | 1750.38 (94.03%) | 57.45% (98.69%) | 69.68% (99.30%) | 59.28% (100.02%) | 98.01% | | VisPruner (ICCV 25) | 1,765.68 (94.85%) | 57.62% (98.99%) | 69.77% (99.43%) | 59.33% (100.10%) | 98.34% | | ALTR (Ours) | 1,808.74 (97.16%) | 57.64% (99.02%) | 69.65% (99.26%) | 59.27% (100.00%) | 98.86% | | | Retain 128 Tokens (↓77.8%) | | | | | | SparseVLMs (ICML 25) | 1768.26 (94.99%) | 56.70% (97.41%) | 69.77% (99.43%) | 58.32% (98.40%) | 97.55% | | PyramidDrop (CVPR 25) | 1,645.33 (88.38%) | 55.11% (94.67%) | 70.01% (99.77%) | 55.22% (93.17%) | 94.00% | | MustDrop (arXiv) | 1681.17 (90.31%) | 56.10% (96.38%) | 69.87% (99.57%) | 56.17% (94.77%) | 95.26% | | VisionZip (CVPR 25) | 1,749.71 (93.99%) | 56.64% (97.30%) | 69.82% (99.50%) | 58.03% (97.91%) | 97.18% | | VisPruner (ICCV 25) | 1,764.88 (94.80%) | 57.15% (98.18%) | 69.75% (99.40%) | 58.43% (98.58%) | 97.74% | | ALTR (Ours) | 1,791.51 (96.24%) | 56.81% (97.59%) | 69.87% (99.57%) | 58.32% (98.40%) | 97.95% | | | Retain 64 Tokens (↓88.9%) | | | | | | SparseVLMs (ICML 25) | 1,591.23 (85.48%) | 53.47% (91.86%) | 70.29% (100.17%) | 53.74% (90.67%) | 92.04% | | PyramidDrop (CVPR 25) | 1,250.47 (67.17%) | 46.92% (80.60%) | 69.56% (99.13%) | 43.79% (73.88%) | 80.20% | | MustDrop (arXiv) | 1,535.76 (82.50%) | 54.50% (93.63%) | 69.91% (99.63%) | 52.71% (88.93%) | 91.17% | | VisionZip (CVPR 25) | 1,667.02 (89.55%) | 54.90% (94.31%) | 69.96% (99.70%) | 54.97% (92.75%) | 94.08% | | VisPruner (ICCV 25) | 1,656.33 (88.97%) | 55.66% (95.62%) | 69.79% (99.46%) | 55.31% (93.32%) | 94.34% | | ALTR (Ours) | 1,699.18 (91.28%) | 54.60% (93.80%) | 69.84% (99.53%) | 55.40% (93.47%) | 94.52% |

A. 实验设置

模型与数据集。 遵循 prior work,我们在 LLaVA 框架 [43, 44] 上实现我们的方法,并在四个广泛使用的基准上进行评估:MME [45]、TextVQA [46]、ScienceQA [47] 和 GQA [48]。这些基准涵盖了包括感知、OCR、科学推理和组合视觉推理在内的多样化能力。我们报告 TextVQA、ScienceQA 和 GQA 上的准确率 (%),以及 MME 上的总分,遵循官方评估协议。为了更直观地进行对比分析,我们以百分比格式呈现结果,并将具有 100% 上限的原始模型的准确率或分数作为参考。此外,我们在 Qwen2.5-VL [49] 系列上进行了初步实验,以评估我们的方法在不同 VLM 架构上的泛化能力。

基线。 我们将我们的方法与五个具有代表性和影响力的基线进行比较,这些基线大致可分为 Inner-LM 和 Before-LM 两类方法。Inner-LM 方法,包括 SparseVLMs [17]、PyramidDrop [18] 和 MustDrop [19],在推理期间在语言模型内减少视觉 token,通常由注意力图引导。相比之下,Before-LM 方法,如 VisionZip [21] 和 VisPruner [22],在将特征输入语言模型之前对视觉特征进行剪枝或压缩。这些基线代表了视觉 token 缩减中常用的策略,并为评估相关工作的有效性提供了强有力的基准。

B. 性能分析

LLaVA-v1.5 上的结果。 我们在 LLaVA-v1.5 [43] 上评估了提出的 ALTR 方法,这是一个广泛用于视觉 token 剪枝的设置。实验在多个基准上进行,所有结果均以百分比格式报告,以全 token 设置作为 100% 的参考基线。遵循 prior work [13, 14, 17, 18],我们考虑了三种保留的视觉 token 预算:192、128 和 64,分别对应 66.7%、77.8% 和 88.9% 的 token 缩减。当视觉 token 数量从 576 减少到 192 时,ALTR 在不进行任何额外训练的情况下保留了原始平均性能的 98.86%,与全 token 基线相比仅下降了 1.14%。在这种适度的剪枝设置下,ALTR 在所有对比方法中实现了最佳的整体性能。具体而言,ALTR 相对于 VisionZip、VisPruner、SparseVLMs、PyramidDrop 和 MustDrop 的平均性能保留增益分别为 0.85%、0.52%、0.25%、1.89% 和 2.20%,其中在后两者上观察到的提升最大。这些结果表明,ALTR 可以移除三分之二的视觉 token,同时几乎完全保留了原始的多模态推理能力。

对于仅保留原始视觉 token 22.2% 的 128 token 设置,ALTR 仍然保持了强大的性能鲁棒性。其平均性能保留率为 97.95%,仅比原始

第 7 页

完整 token 基线。与现有的具有竞争力的 Before-LM 方法相比,ALTR 在平均保留率上比 VisionZip 高出 0.77%,比 VisPruner 高出 0.21%。相比之下,几种之前的 Inner-LM 方法在这种更强的压缩率下出现了更明显的性能下降,其中 SparseVLMs、PyramidDrop 和 MustDrop 仅分别保留了基线性能的 97.55%、94.00% 和 95.26%。这表明,即使视觉 token 预算从 192 进一步减少到 128,ALTR 仍然有效,在激进剪枝下在各个基准测试中表现出更好的稳定性。

在最具有挑战性的 64-token 设置下,仅保留了 11.1% 的视觉 token,这意味着完整 token 基线使用了九倍多的视觉 token。在这种极端的缩减机制下,传统的 token 缩减方法表现出显著的精度下降。例如,SparseVLMs、PyramidDrop 和 MustDrop 仅分别保留了原始平均性能的 92.04%、80.20% 和 91.17%。相比之下,ALTR 保留了完整 token 性能的 94.52%,尽管压缩严重,平均缩减幅度仅为 5.48%。ALTR 还分别比 VisionZip 和 VisPruner 高出 0.44% 和 0.18%。这些结果突显了 ALTR 在极端 token 稀疏化下的强大鲁棒性,并表明即使在高度受限的 token 预算下,它也能有效地识别并保留最具信息量的视觉 token。

这些结果验证了 ALTR 核心设计的有效性。ALTR 不依赖于注意力图和大量的 token 交互,而是从视觉编码器的内在统计信息中选择 token。二阶 Rényi 熵有助于识别具有更丰富且退化程度较低的特征激活的 token,而最后一层 MLP 变换提供了一个轻量级信号,用于选择更多样化的 token。在保留 192、128 和 64 个 token 的情况下,ALTR 的一致增益表明,其优势来自于利用视觉模型自身的特征分布和变换行为,使其既有效又可作为即插即用模块用于 VLM token 缩减。

其他 VLM 上的结果。我们在高分辨率 VLM LLaVA-Next [44] 上的 GQA 数据集上进一步评估了 ALTR。LLaVA-Next 将每张图像划分为五个子图像,导致视觉 token 数量显著增加,从而提出了更具挑战性的视觉 token 缩减问题。如图 2 所示,原始 Vanilla 模型在不进行 token 缩减的情况下达到了 64.27% 的准确率,这作为上限性能参考。在三种 token 保留配置——33.3%(960 个 token)、22.2%(640 个 token)和 11.1%(320 个 token)下,ALTR 在所有对比方法中始终取得了最佳准确率,表明其在激进 token 压缩下具有强大的可扩展性和鲁棒性。

具体而言,使用 960 个 token 时,ALTR 达到了 63.67% 的准确率,非常接近 Vanilla 性能(64.27%),同时显著优于 VisionZip(61.62%)、VisPruner(62.10%)、PyramidDrop(60.82%)和 MustDrop(57.63%),且无需任何额外训练。当进一步将 token 预算减少到 640 个 token 时,ALTR 保持了 62.51% 的高准确率,保留了大部分原始性能,并仍然超越所有基线,表明其在适度压缩下保留关键视觉信息的有效性。值得注意的是,在最极端的设置下——仅保留 11.1% 的视觉 token,大约 320 个 token,ALTR 达到了 59.28% 的准确率,表现出优雅的降级能力,并显著优于 PyramidDrop(49.86%),同时始终超过 VisionZip(58.65%)、VisPruner(58.95%)和 MustDrop(57.36%)。

我们还在 Qwen2.5-VL-7B[49] 上的 TextVQA 数据集上,在相同的缩减配置下进行了实验。与在 LLaVA-Next 上的观察结果类似,ALTR 在高和低视觉 token 设置下始终保持了强劲的性能。具体而言,当保留 33.3% 的视觉 token(对应约 450 个 token)时,ALTR 达到了 82.45% 的准确率,比 VisionZip 高出 0.95%。当保留率进一步降低到 22.2%(约 300 个 token)时,ALTR 仍获得 78.94% 的准确率,比 VisionZip 提高了 1.97%。值得注意的是,在最激进的压缩设置下——仅保留 11.1% 的视觉 token,大约 150 个 token,ALTR 达到了 72.19% 的准确率,比 VisionZip 高出 5.48%,证明了其在 token 受限场景下的有效性和适应性。

C. 效率分析

我们在 MME 数据集上评估了 token 缩减模块在 LLaVA-v1.5-7B 上的效率,所有实验均在单张 NVIDIA RTX 5880 上进行。为了公平比较,我们选择 VisionZip 和 VisPruner 作为代表性基线,因为它们遵循与我们相同的 Before-LM 缩减范式,即在输入语言模型之前压缩视觉 token。这种设置确保所有对比方法都在 VLM 推理管道的同一阶段运行,并在相同的 token 预算下进行评估,即保留 192 个视觉 token,其中包含 64 个重要性 token 和 128 个多样性 token。

我们首先分析在考虑排序和索引操作时,不同压缩模块的时间复杂度。

第 8 页

8

令 $N$ 表示原始视觉 token 的数量,$D$ 表示每个视觉 token 的隐藏层维度。VisionZip 主要受限于 token 相似度计算和上下文合并,其时间复杂度为 $O(N^2D)$。VisPruner 执行迭代式的 token-token 相似度计算,并伴随常数级的删除步骤,导致其时间复杂度为 $O(N^3D)$。相比之下,我们的方法仅引入针对隐藏层的逐 token 评分和排序,时间复杂度为 $O(ND + N \log N)$。这种较低的时间复杂度源于我们的方法避免了成对的 token-token 相似度计算以及密集的 token 合并。

除了复杂度分析外,我们还测量了每个 Before-LM 压缩模块引入的额外计算开销,包括 FLOPs(浮点运算次数)和 CUDA 时间。FLOPs 是通过累加每个压缩模块所需的浮点算术运算次数来计算的。CUDA 时间使用 PyTorch [50] Profiler 进行测量,该工具记录压缩过程中 GPU kernel 的执行时间。非算术操作(如 topk、argsort、argmax、掩码、gather/scatter 和索引移动)不包含在 FLOPs 中,但会反映在测量的 CUDA 时间中。

如表 II 所示,我们的方法实现了最低的复杂度,并仅引入 4.13M 的额外 FLOPs,远低于 VisionZip(106.91M)和 VisPruner(2880.35M)。在实际运行时间方面,我们的方法也实现了最低的 CUDA 时间,仅需 0.579 ms,而 VisionZip 为 0.884 ms,VisPruner 为 7.151 ms。尽管 FLOPs 未能涵盖所有非算术开销,但 CUDA 时间的结果证实了我们的方法在实践中依然高效。这些结果表明,我们的设计在缩减效果和计算开销之间取得了有利的平衡。

TABLE II: 时间复杂度、FLOPs 和 CUDA 时间的比较

| Method | Time Complexity | FLOPs (M) | CUDA Time (ms) | | :— | :— | :— | :— | | VisionZip | $O(N^2D)$ | 106.91 | 0.884 | | VisPruner | $O(N^3D)$ | 2880.35 | 7.151 | | Ours | $O(ND + N \log N)$ | 4.13 | 0.579 |

D. 兼容性分析

为了评估我们的方法与现代系统级加速技术的兼容性,我们在 Qwen2.5-VL 上,在固定的 token 预算下,使用两种不同的注意力实现进行了实验。具体而言,我们考虑两种部署配置:(1) 基线配置,其中视觉编码器和 LLM 均采用标准的 eager 注意力实现;(2) 加速配置,其中为视觉编码器和 LLM 均启用 FlashAttention-2 [24]。此比较旨在调查我们的方法是否能在实际的 VLM 推理场景中有效保留优化注意力内核带来的优势。

如表 III 所示,我们的方法与 FlashAttention-2 完全兼容。与 eager 实现相比,在视觉和语言组件中均采用 FlashAttention-2 显著提高了整体推理效率。平均视觉编码器延迟从 179.632 ms 降低至 35.567 ms,实现了约 5 倍的加速。同时,平均预填充(prefill)延迟从 214.242 ms 降低至 71.481 ms,表明单个模块层面的内核加速可以有效转化为端到端的性能提升。此外,峰值内存消耗从 16.388 GB 降低至 15.622 GB,表明 FlashAttention-2 通过避免大型中间注意力张量的显式化(materialization),提供了额外的内存节省。这些结果表明,我们的无注意力(attention-free)设计与高效的注意力内核兼容,并能在实际的 VLM 推理中有效保留系统级的加速优势。

TABLE III: Qwen2.5-VL-7B 上与 FlashAttention-2 的兼容性

| | Vision Attn. | Vision Time (ms) | Prefill (ms) | Peak Mem. (GB) | | :— | :— | :— | :— | :— | | Eager | | 179.632 | 214.242 | 16.388 | | FlashAttn2 | | 35.567 | 71.481 | 15.622 |

E. 测试平台评估

为了进一步评估视觉 token 缩减在边缘平台上的实际部署可行性,我们在 NVIDIA Jetson AGX Orin 上进行了 OOM(内存溢出)边界研究,该平台作为我们的边缘测试平台。Jetson AGX Orin 代表了现代边缘 AI 平台:它在提供设备端推理 GPU 加速的同时,受到比数据中心 GPU 严格得多的内存和资源限制。这使其成为研究在现实边缘场景中部署 VLM 时出现的内存瓶颈的合适平台。

我们的测试平台配置旨在模拟实际部署场景,其中 VLM 进程无法独占所有系统内存。在实际的边缘应用中,内存通常由操作系统、相机或传感器流水线、预处理模块、用户应用程序以及其他后台服务共享。为了以受控的方式捕捉这一约束,我们对 VLM 进程施加固定的可用内存预算,并评估每种方法是否能在不超出预算的情况下完成长响应生成。所有方法均在相同条件下进行评估,包括 batch size 为 1、eager 注意力以及相同的图像-提示输入,以便内存可行性的差异可归因于视觉 token 缩减策略,而非执行设置的改变。

我们使用 max_new_tokens 参数设置目标生成长度,并以 256 个 token 为步长逐渐增加该值。随后,我们报告最大无 OOM 响应长度,定义为在成功完成且未发生 CUDA OOM、系统级 OOM、进程终止或执行不完整的情况下,所能测试的最大目标长度。

表 IV 报告了在 16GB 内存预算下的结果。在不进行视觉 token 缩减的情况下,全 token 推理成功完成了所有测试长度,直至生成 768 个 token,

第 9 页

9

表 IV:在 Jetson AGX Orin 上可用内存预算为 16GB 时的无 OOM(内存溢出)生成边界。

| Method | Vision Tokens | Max Length | First Fail | Reduction Time | | :— | :—: | :—: | :—: | :—: | | Full-token | 576 | 768 | 1024 | – | | VisionZip | 192 | 1280 | 1536 | 106.3 ms | | VisPruner | 192 | 1280 | 1536 | 293.2 ms | | SparseVLMs | 192 | 0 | 256 | – | | Ours | 192 | 1280 | 1536 | 73.3 ms | | VisionZip | 128 | 1536 | 1792 | 98.5 ms | | VisPruner | 128 | 1536 | 1792 | 289.3 ms | | SparseVLMs | 128 | 0 | 256 | – | | Ours | 128 | 1536 | 1792 | 69.9 ms | | VisionZip | 64 | 1536 | 1792 | 92.2 ms | | VisPruner | 64 | 1536 | 1792 | 308.0 ms | | SparseVLMs | 64 | 0 | 256 | – | | Ours | 64 | 1536 | 1792 | 67.1 ms |

而在 LLM 预填充阶段,首次失败发生在 1024 个 token 处。相比之下,视觉 token 缩减显著扩展了可行的生成范围。当保留 128 或 64 个视觉 token 时,ALTR 成功完成了所有测试长度,直至生成 1536 个 token,首次失败观察于 1792 个 token 处。VisionZip 和 VisPruner 在相同的保留 token 预算下表现出相同的最大可行生成长度,表明减少视觉 token 前缀对于提高边缘内存可行性是有效的。

重要的是,这种内存可行性增益并未以沉重的缩减阶段开销为代价。呼应表 II 中的效率结果,ALTR 在 Jetson 平台上保持轻量级,在 128-token 预算下仅引入 69.9 ms 的缩减延迟,相比之下 VisionZip 为 98.5 ms,VisPruner 为 289.3 ms。这表明 ALTR 可以在保持低缩减开销的同时提高边缘内存可行性。值得注意的是,SparseVLMs 在 16GB 预算下在模型加载阶段失败,这表明具有额外模型端组件的方法可能需要更高的最小内存预算才能开始推理。这使得它们不太适合内存受限的边缘设备,其中单个 VLM 进程的可用内存通常有限。

F. 消融分析

我们在 LLaVA-v1.5-7B 上对保留 128 个 token 的情况进行了消融实验,以调查每个提出组件的贡献。具体而言,我们将完整模型(mix)与两个退化变体进行比较,即移除重要性感知选择模块(w/o Imp)和移除多样性感知选择模块(w/o Div)。实验结果如图 3 所示。完整模型取得了最佳的整体性能,在所有评估基准上获得 97.95% 的平均分数,这证明了联合结合重要性感知和多样性感知 token 选择策略的有效性。

移除重要性感知选择模块导致性能显著下降,平均分数从 97.95% 降至 92.96%。具体而言,MME 分数从 96.24% 降至 89.57%,而 TextVQA 分数从 97.59% 降至 85.96%。同时,在 ScienceQA 和 GQA 上也观察到一致的下降,分数分别从 99.57% 降至 98.63%,从 98.40% 降至 97.67%。这些结果表明,重要性感知选择对于识别和保留任务相关的视觉 token 至关重要。如果没有这个组件,token 压缩过程可能会丢弃信息丰富的区域,导致关键视觉语义的丢失,从而限制模型在受限 token 预算下的多模态理解能力。

我们进一步通过从完整模型中移除多样性感知选择模块来评估该模块的效果。 resulting 变体获得的平均分数为 97.12%,比完整模型低 0.83%。虽然在个别基准上可以观察到轻微的性能波动,但 w/o Div 变体在整体性能方面始终低于完整模型。特别是,它在 MME(93.00% vs. 96.24%)、ScienceQA(99.26% vs. 99.57%)、GQA(98.01% vs. 98.40%)以及平均分数上得分较低,这表明保持保留的视觉 token 之间具有足够的多样性的重要性。这些结果表明,多样性感知选择通过减少冗余 token 选择并提高视觉信息的覆盖率,提供了超越基于重要性的过滤的互补优势。因此,保留的 token 集可以保留更丰富的视觉表示,并实现更稳健的多模态理解。

为了进一步说明每个组件的效果,我们在图 4 中提供了定性 token 选择可视化。与完整的 ALTR 相比,移除重要性感知阶段导致更分散且信息量较少的 token 选择,其中几个保留的 token 落在背景或低内容区域,而任务相关的细节被削弱。另一方面,移除多样性感知阶段往往会在局部显著区域周围产生更多的冗余选择,导致对整体视觉内容的覆盖不足。相比之下,完整的 ALTR 选择的 token 更好地与信息丰富的对象、文本区域和结构细节对齐,同时仍保持广泛的空间和语义覆盖。

这些可视化结果与定量消融结果一致,进一步表明基于熵的重要性估计和基于变化的多样性选择在产生紧凑且具有代表性的 token 集方面发挥着互补作用。

第 10 页

10

六、结论与讨论

在本文中,我们提出了一种无注意力机制且轻量级的视觉语言模型(Vision-Language Models)视觉 Token 缩减框架,旨在提高推理效率的同时保留多模态推理能力。我们的方法通过联合建模 Token 重要性和多样性,执行一次性 Token 选择,从而构建出紧凑且具有表现力的视觉 Token 集合,以实现高效的多模态推理。所提出的框架避免了对注意力图和昂贵的成对 Token 交互的依赖,使其与现代加速框架完全兼容,并可扩展至大规模视觉 Token 序列。大量实验表明,我们的方法在广泛的 VLM 基准测试中,在保持甚至提升性能的同时,始终实现了显著的 Token 缩减和推理加速。

除了实证有效性外,我们的工作还提供了几个概念性见解。首先,我们表明视觉 Token 表示的内在属性可以提供可靠的信号用于重要性估计,而无需注意力监督或额外训练。其次,我们强调可以通过轻量级的隐式组织来促进视觉 Token 之间的多样性,而不是通过昂贵的显式相似度计算。这些观察结果共同表明了对 Token 缩减更广泛的视角:通过利用预训练表示中已存在的结构,可以实现高效的选择。

未来研究有几个有前景的方向。一个途径是探索用于确定 Token 预算或根据任务特征动态平衡重要性和多样性的自适应策略。另一个方向是将所提出的框架扩展到视频语言模型或具有时间动态的多模态设置中,在这些设置中,Token 冗余现象更为显著。我们希望这项工作能鼓励进一步研究免训练的、有利于加速的 Token 缩减方法,并为在边缘设备上开发更高效、更实用的 VLM 做出贡献。

G. 超参数分析

图 5:我们的方法在不同视觉 Token 预算下对平衡系数 $\lambda$ 的敏感性。

我们分析了我们的方法相对于平衡超参数 $\lambda$ 的鲁棒性,该参数控制了我们 Token 选择策略中两个组件的相对重要性。我们在一个广泛的范围内变化 $\lambda$,并在多个基准测试的不同视觉 Token 预算下评估模型。如图 5 所示,我们的方法在不同的 $\lambda$ 值下始终保持强劲的性能。虽然最佳设置可能在 Token 预算之间略有不同,但在广泛的 $\lambda$ 范围内,整体性能变化微乎其微。这表明我们的方法不依赖于仔细的超参数调整,并且在不同配置下仍然有效。

在我们的实验中,为了确保受控比较且无需针对特定方法进行调优,所有涉及平衡超参数的方法均采用相同的 $\lambda$ 值。

参考文献

[1] G. Team, R. Anil, S. Borgeaud, J.-B. Alayrac, J. Yu, R. Soricut, J. Schalkwyk, A. M. Dai, A. Hauth, K. Millikan et al., “Gemini: a family of highly capable multimodal models,” arXiv preprint arXiv:2312.11805, 2023.

[2] Z. Chen, J. Wu, W. Wang, W. Su, G. Chen, S. Xing, M. Zhong, Q. Zhang, X. Zhu, L. Lu et al., “Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,” in Proc. of IEEE/CVF CVPR, 2024, pp. 24 185–24 198.

[3] P. Wang, S. Bai, S. Tan, S. Wang, Z. Fan, J. Bai, K. Chen, X. Liu, J. Wang, W. Ge, Y. Fan, K. Dang, M. Du, X. Ren, R. Men, D. Liu, C. Zhou, J. Zhou, and J. Lin, “Qwen2-VL: enhancing vision-language model’s perception of the world at any resolution,” arXiv preprint arXiv:2409.12191, 2024.

[4] J. Li, D. Li, S. Savarese, and S. Hoi, “BLIP-2: bootstrapping language-image pre-training with frozen

第 11 页

11

image encoders and large language models,” in Proc. of Accelerating your large vision-language models via pyra- ICML, 2023, pp. 19 730–19 742. mid visual redundancy reduction,” in Proc. of IEEE/CVF [5] Z. Zhang, L. Wu, Z. Wang, J. Hu, C. Ma, and Q. Liu, CVPR, 2024, pp. 14 593–14 603. “Cost-efficient and secure federated learning for edge [19] T. Liu, L. Shi, R. Hong, Y. Hu, Q. Yin, and L. Zhang, computing,” IEEE Transactions on Mobile Computing, “Multi-stage vision token dropping: Towards efficient vol. 24, no. 12, pp. 13 615–13 632, 2025. multimodal large language model,” arXiv preprint [6] X. Pang, Z. Wang, J. Li, R. Zhou, J. Ren, and Z. Li, “To- arXiv:2411.10803, 2024. wards online privacy-preserving computation offloading [20] L. Hu, F. Shang, W. Feng, and L. Wan, “Lightvlm: in mobile edge computing,” in Proc. of IEEE INFOCOM, Acceleraing large multimodal models with pyramid token 2022, pp. 1179–1188. merging and kv cache compression,” arXiv preprint [7] Y. Zhou, X. Pang, and Z. Wang, “Aflora: Adap- arXiv:2509.00419, 2025. tive federated fine-tuning of large language models [21] S. Yang, Y. Chen, Z. Tian, C. Wang, J. Li, B. Yu, and with resource-aware low-rank adaption,” arXiv preprint J. Jia, “Visionzip: Longer is better but not necessary in arXiv:2505.24773, 2025. vision language models,” in Proc. of IEEE/CVF CVPR, [8] D. Liu, Z. Wang, X. Pang, Y. Sun, J. Hu, P. Sun, and 2025, pp. 19 792–19 802. Y. Hu, “Towards efficient edge learning for large models [22] Q. Zhang, A. Cheng, M. Lu, R. Zhang, Z. Zhuo, J. Cao, in heterogeneous resource-limited environments,” in Proc. S. Guo, Q. She, and S. Zhang, “Beyond text-visual of IEEE BigCom, 2023, pp. 223–230. attention: Exploiting visual cues for effective token [9] A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, pruning in vlms,” in Proc. of IEEE/CVF ICCV, 2025, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, pp. 20 857–20 867. G. Heigold, S. Gelly et al., “An image is worth 16×16 [23] T. Dao, D. Fu, S. Ermon, A. Rudra, and C. R´e, “Flashat- words: Transformers for image recognition at scale,” in tention: Fast and memory-efficient exact attention with Proc. of ICLR, 2021. io-awareness,” in Proc. of NeurIPS, vol. 35, 2022, pp. [10] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, 16 344–16 359. S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark [24] T. Dao, “Flashattention-2: Faster attention with better et al., “Learning transferable visual models from natural parallelism and work partitioning,” in Proc. of ICLR, vol. language supervision,” in Proc. of ICML, 2021, pp. 8748– 2024, 2024, pp. 35 549–35 562. 8763. [25] J. Shah, G. Bikshandi, Y. Zhang, V. Thakkar, P. Ramani, [11] X. Zhai, B. Mustafa, A. Kolesnikov, and L. Beyer, and T. Dao, “Flashattention-3: Fast and accurate attention “Sigmoid loss for language image pre-training,” in Proc. with asynchrony and low-precision,” in Proc. of NeurIPS, of IEEE/CVF ICCV, 2023, pp. 11 975–11 986. vol. 37, 2024, pp. 68 658–68 685. [12] Z. Wang, Z. Zhang, X. Pang, Q. Zhang, X. Hao, S. Zhuo, [26] W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. and P. Sun, “Tap-vits: Task-adaptive pruning for on- Yu, J. Gonzalez, H. Zhang, and I. Stoica, “Efficient device deployment of vision transformers,” arXiv preprint memory management for large language model serving arXiv:2601.02437, 2026. with pagedattention,” in Proc. of ACM SOSP, 2023, pp. [13] L. Chen, H. Zhao, T. Liu, S. Bai, J. Lin, C. Zhou, and 611–626. B. Chang, “An image is worth 1/2 tokens after layer [27] A. Jeddi, N. Baghbanzadeh, E. Dolatabadi, and B. Taati, 2: Plug-and-play inference acceleration for large vision- “Similarity-aware token pruning: Your vlm but faster,” language models,” in Proc. of ECCV, 2024, pp. 19–35. arXiv preprint arXiv:2503.11549, 2025. [14] C. Zhang, K. Ma, T. Fang, W. Yu, H. Zhang, Z. Zhang, [28] Z. Wang, S. Purushwalkam, C. Xiong, S. Savarese, H. Ji, Y. Xie, K. Sycara, H. Mi, and D. Yu, “VScan: Rethinking and R. Xu, “Dymu: Dynamic merging and virtual unmerg- visual token reduction for efficient large vision-language ing for efficient vlms,” arXiv preprint arXiv:2504.17040, models,” arXiv preprint arXiv:2505.22654, 2025. 2025. [15] W. Zhang, Z. Zhu, N. Li, S. Tao, K. Liu, and Y. Liu, [29] K. Shao, K. Tao, C. Qin, H. You, Y. Sui, and H. Wang, “Adaptinfer: Adaptive token pruning for vision-language “Holitom: Holistic token merging for fast video large model inference with dynamical text guidance,” arXiv language models,” in Proc. of NeurIPS, vol. 38, 2026, pp. preprint arXiv:2508.06084, 2025. 135 547–135 570. [16] J. Chen, X. Liu, Z. Wen, Y. Wang, S. Huang, and H. Chen, [30] K. Tao, C. Qin, H. You, Y. Sui, and H. Wang, “Dycoke: “Variation-aware vision token dropping for faster large Dynamic compression of tokens for fast video large vision-language models,” in Proc. of IEEE/CVF CVPR, language models,” in Proc. of IEEE/CVF CVPR, 2025, 2026, pp. 3489–3499. pp. 18 992–19 001. [17] Y. Zhang, C.-K. Fan, J. Ma, W. Zheng, T. Huang, [31] J. Lu, D. Batra, D. Parikh, and S. Lee, “Vilbert: Pretraining K. Cheng, D. Gudovskiy, T. Okuno, Y. Nakata, K. Keutzer task-agnostic visiolinguistic representations for vision-and- et al., “Sparsevlm: Visual token sparsification for efficient language tasks,” in Proc. of NeurIPS, vol. 32, 2019, pp. vision-language model inference,” in Proc. of ICML, 2025, 13–23. pp. 74 840–74 857. [32] Y.-C. Chen, L. Li, L. Yu, A. El Kholy, F. Ahmed, Z. Gan, [18] L. Xing, Q. Huang, X. Dong, J. Lu, P. Zhang, Y. Zang, Y. Cheng, and J. Liu, “Uniter: Universal image-text Y. Cao, C. He, J. Wang, F. Wu et al., “Pyramiddrop: representation learning,” in Proc. of ECCV, 2020, pp.

第 12 页

12

[33] S. Yang, R. Xu, C. Cui, T. Wang, D. Lin, and J. Pang, “Vflowopt: A token pruning framework for lmms with visual information flow-guided optimization,” in Proc. of IEEE/CVF ICCV, 2025, pp. 23 924–23 934. [34] H. Wu, Y. Fan, J. Dai, J. Tong, Y. Ma, and X. Shen, “Hidrop: Hierarchical vision token reduction in mllms via late injection, concave pyramid pruning, and early exit,” in Proc. of ICLR, 2026. [35] D. Li, Z. Yang, and S. Lu, “Todre: Visual token pruning via diversity and task awareness for efficient large vision-language models,” arXiv preprint arXiv:2505.18757, pp. arXiv–2505, 2025. [36] J. Lee, K. Xuan, C. Ekbote, S. Polisetty, Y. R. Fung, and P. P. Liang, “Tamp: Token-adaptive layerwise pruning in multimodal large language models,” in Findings of ACL, 2025, pp. 6892–6908. [37] C. Qian, X. Yu, D. Li, G. Chi, Z. Yang, Q. Ma, and X. Miao, “Swiftvlm: Efficient vision-language model inference via cross-layer token bypass,” arXiv preprint arXiv:2602.03134, 2026. [38] W. Ye, Q. Wu, W. Lin, and Y. Zhou, “Fit and prune: Fast and training-free visual token pruning for multi-modal large language models,” in Proc. of AAAI, vol. 39, no. 21, 2025, pp. 22 128–22 136. [39] S. Zhang, Q. Fang, Y. Yang, and Y. Feng, “Llava-mini: Efficient image and video large multimodal models with one vision token,” in Proc. of ICLR, 2025, pp. 53 285–53 310. [40] Y. Sun, Y. Xin, H. Li, J. Sun, C. Lin, and R. T. Batista-Navarro, “Lvpruning: An effective yet simple language-guided vision token pruning approach for multi-modal large language models,” in Findings of NAACL, 2025, pp. 4299–4308. [41] M. Cai, J. Yang, J. Gao, and Y. J. Lee, “Matryoshka multimodal models,” in Proc. of ICLR, 2025, pp. 46 254–46 272. [42] W. Hu, Z.-Y. Dou, L. H. Li, A. Kamath, N. Peng, and K.-W. Chang, “Matryoshka query transformer for large vision-language models,” in Proc. of NeurIPS, vol. 37, 2024, pp. 50 168–50 188. [43] H. Liu, C. Li, Y. Li, and Y. J. Lee, “Improved baselines with visual instruction tuning,” in Proc. of IEEE/CVF CVPR, 2024, pp. 26 296–26 306. [44] H. Liu, C. Li, Y. Li, B. Li, Y. Zhang, S. Shen, and Y. J. Lee, “Llava-next: Improved reasoning, ocr, and world knowledge,” January 2024. [Online]. Available: https://llava-vl.github.io/blog/2024-01-30-llava-next/ [45] C. Fu, P. Chen, Y. Shen, Y. Qin, M. Zhang, X. Lin, J. Yang, X. Zheng, K. Li, X. Sun et al., “Mme: A comprehensive evaluation benchmark for multimodal large language models,” in Proc. of NeurIPS, vol. 38, 2026. [46] A. Singh, V. Natarajan, M. Shah, Y. Jiang, X. Chen, D. Batra, D. Parikh, and M. Rohrbach, “Towards vqa models that can read,” in Proc. of IEEE/CVF CVPR, 2019, pp. 8317–8326. [47] P. Lu, S. Mishra, T. Xia, L. Qiu, K.-W. Chang, S.-C. Zhu, O. Tafjord, P. Clark, and A. Kalyan, “Learn to

发表评论