RUTA:把视觉令牌分配变成一个率-效用优化问题

快速导读:问题的根源在于,现有方法把令牌缩减当成一个预处理步骤,没有和查询需求关联起来。RUTA 的核心洞见是:这本质上是一个率-效用优化问题——在保证回答质量的前提下,最小化传递给大语言模型的令牌数量。这个视角把令牌分配从手工规则提升到了有理论支撑的优化框架。

视觉语言模型(VLM)在推理时需要处理大量视觉令牌,这给大语言模型(LLM)带来了沉重的计算和内存负担。现有的视觉令牌缩减方法通常依赖固定的每样本令牌预算,或者使用启发式规则进行剪枝与合并,缺乏一个统一的框架来显式地平衡令牌用量与下游任务性能。RUTA 将视觉令牌缩减重新定义为一个率-效用优化问题,通过联合学习查询条件化的候选构建、伯努利保留采样和基于锚点的聚合,为每个图像-查询对自适应地分配视觉令牌。

RUTA 的核心思想源自信息论中的率失真理论:在保持任务效用的前提下,最小化传递给 LLM 的视觉令牌数量。与固定预算方法不同,RUTA 能够根据查询的复杂度动态调整令牌用量——简单查询使用更少的令牌,复杂查询保留更多的视觉证据。在 LLaVA-NeXT-7B 和 Qwen3-VL-8B 两个主流 VLM 上的实验表明,RUTA 在极低令牌率下显著优于现有方法,并且在令牌预算增加时能够接近甚至匹配未压缩模型的性能。

英文题目:RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

论文出处:arXiv 每日论文精选 · arXiv:2608.04132

原始论文:PDF / 论文页面

这篇论文解决什么问题?

VLM 的推理流程通常包括视觉编码器提取图像特征、投影层将特征映射到 LLM 的输入空间,以及 LLM 进行多模态推理。高分辨率图像和长视频会产生数千个视觉令牌,使得 LLM 的自注意力计算复杂度呈二次增长。因此,在视觉令牌进入 LLM 之前对其进行压缩,已成为提升推理效率的关键技术路径。

现有的视觉令牌缩减方法大致分为两类:训练无关方法和训练依赖方法。训练无关方法如 FastV、SparseVLM、VisionZip 和 DivPrune 等,通过注意力冗余分析、相似性合并或多样性剪枝来减少令牌数量,但它们通常需要外部指定固定的令牌保留数量。训练依赖方法如 TwigVLM 和 ATP-LLaVA 引入了可学习的压缩模块,但仍然依赖预设的令牌预算或层级阈值。

这些方法的共同局限在于:它们将令牌缩减视为一个独立于查询需求的预处理步骤,忽略了不同查询对视觉证据的需求差异。一个询问“图片中有几个人”的简单查询可能只需要几十个令牌,而一个要求“描述左下角小字内容”的复杂查询则需要更多的视觉细节。固定预算方法要么在简单查询上浪费计算资源,要么在复杂查询上丢失关键信息。

RUTA 的出发点是:令牌缩减不应该是一个固定预算的分配问题,而应该是一个根据查询需求动态调整的优化问题。这一视角将令牌分配从启发式规则提升到了有理论支撑的优化框架层面。

核心创新

  • RUTA 的做法分三步。首先,用一个轻量级定位器根据查询找到图像中的感兴趣区域,只把这个区域编码成候选令牌,数量从几千降到几百。然后,一个小的神经网络为每个候选令牌预测一个保留概率,所有概率加起来就是期望的令牌用量。最后,用伯努利采样选出锚点,把没选中的令牌信息合并到锚点上,避免直接丢弃造成信息损失。整个框架和视觉语言模型联合训练,通过一个可微的率惩罚项来平衡性能和令牌用量。

方法概览

问题的根源在于,现有方法把令牌缩减当成一个预处理步骤,没有和查询需求关联起来。RUTA 的核心洞见是:这本质上是一个率-效用优化问题——在保证回答质量的前提下,最小化传递给大语言模型的令牌数量。这个视角把令牌分配从手工规则提升到了有理论支撑的优化框架。

  • 率-效用优化形式化:RUTA 将视觉令牌缩减建模为最小化期望令牌率与任务损失加权和的问题。目标函数包含两项:任务损失(如交叉熵)和期望令牌率的可微惩罚项,通过超参数 λrate 控制二者的权衡。这种形式化使得模型能够在训练过程中自动学习最优的令牌分配策略,而非依赖外部指定的预算。
  • 查询条件化候选构建:RUTA 使用一个轻量级的查询条件化定位器(localizer),根据查询文本在图像中识别感兴趣区域。定位器输出一个包围框,RUTA 对该区域进行裁剪、缩放和编码,生成候选视觉令牌。如果定位器未检测到相关区域,则使用全图编码作为候选。这一步将候选令牌的数量从原始的全图令牌(如 2000+)大幅缩减到数百个,同时保留了与查询最相关的视觉信息。
  • 伯努利保留采样:对于每个候选令牌,RUTA 使用一个两层的 MLP 预测其保留概率 ρi。所有保留概率之和即为期望令牌率。在训练时,RUTA 通过独立的伯努利采样将候选令牌划分为锚点(anchors)和非锚点(non-anchors),并使用直通估计器(straight-through estimator)处理采样的不可微性。在推理时,可以直接根据保留概率进行确定性选择。
  • 基于锚点的聚合:被采样的非锚点令牌并非直接丢弃,而是通过语义亲和度和空间邻近度合并到锚点令牌中。具体来说,RUTA 计算非锚点与锚点之间的注意力权重,将非锚点的信息聚合到最相关的锚点上。这种聚合策略保留了非锚点中的有用信息,避免了直接剪枝可能造成的信息丢失。
  • 联合训练:整个框架——包括定位器、保留概率预测器和聚合模块——与 VLM 的 LLM 部分联合训练。训练时只更新 RUTA 引入的新参数,冻结原始的视觉编码器和 LLM 权重。这种设计既保证了训练效率,又避免了对预训练知识的破坏。
  • 可微的期望令牌率:RUTA 的关键技术之一是使用期望令牌率而非实际采样令牌数作为率惩罚项。由于期望令牌率是保留概率的连续函数,这一设计使得整个优化目标完全可微,支持端到端的梯度反向传播。
  • 自适应分配的实现:通过率-效用联合优化,RUTA 能够根据每个样本的查询复杂度自动调整保留概率的分布。简单查询对应的候选令牌保留概率普遍较低,而复杂查询则保留更多的锚点。这种自适应行为完全由优化目标驱动,无需任何手工设计的规则。

逐图理解论文

固定预算的困境

固定预算的困境
Figure 1 Fixed-budget versus adaptive visual token allocation. A fixed budget retains 64 tokens for each query, leaving surplus capacity for the low-demand query but insufficient evidence for the high-demand query, which leads to an incorrect answer. At the same average rate, RUTA retains 24 and 104 tokens, respectively, adapting token usage to each query’s evidence demand and answering both correctly. Red boxes mark the query-conditioned regions of interest.

图 1 对比了固定预算与自适应分配的行为差异。固定预算为每个查询保留 64 个令牌,导致简单查询浪费容量而复杂查询证据不足。RUTA 在相同平均率下为简单查询分配 24 个令牌、复杂查询分配 104 个令牌,两个查询均回答正确。红色框标注了查询条件化的感兴趣区域。

研究空白与RUTA的思路

研究空白与RUTA的思路
Figure 2 System diagram of RUTA. Given an image and a query, a query-conditioned localizer identifies a region of interest, which is cropped, resized, and encoded into candidate visual tokens 𝑍. A two-layer MLP predicts a retention probability 𝜌𝑖for each candidate, and their sum gives the expected token rate b𝑅𝜑. During training, independent Bernoulli sampling partitions the candidates into anchors and non-anchors. The non-anchor information is then merged into the anchors to produce the compact visual token sequence e𝑉. RUTA is trained with a task loss and a rate penalty weighted by 𝜆rate, balancing prediction utility against the number of visual tokens passed to the LLM.

图 2 展示了 RUTA 的系统架构。查询条件化定位器首先识别感兴趣区域并生成候选令牌,MLP 预测每个候选的保留概率,伯努利采样将候选划分为锚点和非锚点,非锚点信息通过注意力机制合并到锚点中。训练时联合优化任务损失和期望令牌率惩罚。

核心结论

核心结论
Table 1 Matched low-rate results across five benchmarks. Tok denotes the number of visual tokens averaged over samples and LLM layers, whereas Acc denotes benchmark-specific accuracy metric. Reference denotes performance without visual token reduction, and Mean Acc is the unweighted average across the five benchmarks. Boldface marks the highest accuracy among reduced methods within each backbone block.

表 1 报告了匹配低令牌率下的五个基准测试结果。RUTA 在两个 VLM 上均取得最高的平均准确率,且在单个基准上始终接近或达到最优。Tok 列显示各方法的平均视觉令牌用量,Acc 列为基准特定的准确率指标。

价值与局限

价值与局限
Figure 3 Rate–utility curves for LLaVA-NeXT-7B and Qwen3-VL-8B. Each point reports the mean accuracy across the five benchmarks against the corresponding average number of visual tokens processed per sample and LLM layer. Dashed lines indicate the performance of the unreduced reference models. RUTA achieves its largest gains under stringent token budgets, although its advantage narrows on LLaVA-NeXT as the budget increases.

图 3 绘制了率-效用曲线,每个点对应一个令牌预算下的五个基准平均准确率。RUTA 在严格令牌预算下优势最大,但在 LLaVA-NeXT 上随着预算增加优势收窄。虚线表示未压缩参考模型的性能。

实验如何设计?

  • 实验在两个主流 VLM 上进行:LLaVA-NeXT-7B 和 Qwen3-VL-8B,覆盖了不同规模和架构的模型。
  • 评估使用了五个标准的视觉问答基准:VQAv2、GQA、TextVQA、A-OKVQA 和 VizWiz,涵盖了通用视觉理解、文本阅读和面向盲人的视觉问答等多种场景。
  • 对比方法包括训练无关方法(FastV、SparseVLM、VisionZip、DivPrune、PruneSID)和训练依赖方法(TwigVLM、ATP-LLaVA、GlimpsePrune),覆盖了当前主流的视觉令牌缩减范式。
  • 主要实验在匹配的低令牌率下进行,确保各方法的平均令牌用量可比。此外还进行了率-效用曲线分析,在多个令牌预算下系统比较各方法的性能。
  • 消融实验在 TextVQA 上进行,分别考察了候选定位器的选择、自适应分配策略、锚点合并方式以及率系数的影响。

关键结果与论文证据

  • 在匹配的低令牌率下,RUTA 在两个 VLM 上均取得了最高的平均准确率(LLaVA-NeXT-7B 上 64.42,Qwen3-VL-8B 上 74.78),验证了率-效用优化框架的有效性(Table 1, p.8)。
  • RUTA 在 LLaVA-NeXT-7B 上仅使用 2.0% 的视觉令牌,保留了 88.2% 的任务性能;在 Qwen3-VL-8B 上使用 4.2% 的令牌,保留了 94.4% 的性能(p.2)。
  • 率-效用曲线显示,RUTA 在极低令牌预算下(如 56 个令牌)的优势最为显著。在 Qwen3-VL-8B 上,RUTA 在 56 到 512 个令牌的范围内始终优于对比方法,并在 512 个令牌时接近未压缩模型的性能(Figure 3, p.9)。
  • 在 LLaVA-NeXT-7B 上,RUTA 的优势随着令牌预算增加而收窄,在 320 个令牌时被 PruneSID 超越。这表明查询条件化候选构建在令牌极度稀缺时最为有效,而全图压缩方法在预算充足时能够保留更广泛的空间覆盖(Figure 3, p.9)。
  • 定性示例展示了 RUTA 的自适应分配行为:对于简单的位置查询,RUTA 仅保留 24 个锚点;对于需要细节描述的查询,保留 42 个锚点;当定位器无法识别相关区域时,RUTA 回退到全图编码并保留 139 个锚点(Figure 4, p.10)。
  • 率系数 λrate 的调节实验表明,增大 λrate 能够平滑地降低令牌用量,验证了率-效用权衡的可控性(Figure 5a, p.10)。
  • 消融实验证实了查询条件化定位器的重要性:使用随机区域或全图作为候选会显著降低性能。同时,自适应分配策略优于固定分配和随机分配,基于注意力的锚点合并优于简单的锚点保留(Figure 6, p.11)。

阅读时需要注意

  • 视觉令牌数量是模型相关的代理指标,不能直接反映端到端推理延迟或硬件吞吐量。定位器和候选编码的额外开销未计入令牌计数。
  • 候选构建使用单个包围框,当查询涉及多个空间上分离的区域时,可能丢失部分视觉信息。
  • RUTA 需要针对每个 VLM 和任务数据集进行训练,即插即用性不如训练无关方法。
  • 在 LLaVA-NeXT 上的优势随着令牌预算增加而减弱,表明方法在宽松预算下的增益有限。

关联工作

  • FastV 和 SparseVLM 是训练无关的 LLM 内部缩减方法,通过注意力冗余分析在浅层 LLM 后丢弃视觉令牌,但缺乏对查询需求的显式建模。
  • VisionZip 和 DivPrune 在视觉令牌进入 LLM 之前进行压缩,分别基于相似性合并和多样性剪枝,但同样依赖固定的令牌保留数量。
  • TwigVLM 和 ATP-LLaVA 引入了可训练的压缩模块,但分别使用预设的令牌预算和层级阈值,未能实现真正的自适应分配。
  • RUTA 与这些方法的本质区别在于将令牌分配提升为优化问题,使得令牌用量成为优化变量而非外部约束。

发表评论