三分钟导读:SmartVL通过联合控制视觉Token数量和LLM计算能力(深度与宽度),在满足动态计算预算的同时,实现了优于现有单维度自适应方法的多模态大语言模型推理效率与精度的帕累托前沿。
英文题目:Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
论文出处:arXiv 每日论文精选 · arXiv:2607.20357
原始论文:PDF / 论文页面
对应视频标题:少看快想:多模态大语言模型的联合Token-计算自适应推理|推荐指数:★★★★★
这篇论文解决什么问题?
多模态大语言模型(MLLMs)推理成本高且固定,现有自适应方法通常独立优化单个维度(如仅剪枝Token或仅跳过层),忽略了视觉Token密度与LLM架构容量之间的根本耦合关系,导致全局效率次优。
核心创新
- 提出联合控制序列长度、模型深度和模型宽度的统一自适应推理框架,解决跨阶段耦合问题。
- 设计两个轻量级控制器,通过共享预算编码和可微FLOPs估计器进行端到端联合优化。
- 引入非对称预算违反损失(Asymmetric budget violation loss)和Gumbel-sigmoid采样,确保严格遵循延迟预算并防止结构坍塌。
- 实现内容感知和预算感知的跨维度计算分配策略,无需手动调整阈值。
方法概览
提出SmartVL框架,包含视觉侧Token控制器和LLM侧计算控制器。两者通过共享预算编码连接,并利用可微延迟估计器进行端到端训练。Token控制器基于图像内容和预算动态选择视觉Token;计算控制器基于保留的Token数和预算动态调整执行的层数和注意力头组。
逐图理解论文
背景:现有方法的局限性

以FastV为代表的Token剪枝方法,通过静态或半动态策略减少视觉输入,但无法适应LLM内部计算资源的动态需求。另一方面,AdaLLaVA等仅关注LLM侧的计算自适应,通过跳过层或头组来节省FLOPs,却未考虑视觉Token数量对后续处理的影响。这种单维度的优化策略,使得模型在面对不同复杂度的图像时,无法灵活分配视觉感知与逻辑推理的计算资源,造成资源浪费或精度损失。
方法:SmartVL框架概述

为了解决上述问题,我们提出SmartVL框架,这是一个联合控制视觉Token数量和LLM计算能力的自适应推理系统。SmartVL包含两个核心组件:视觉侧的Token控制器和LLM侧的计算控制器。Token控制器根据图像内容和预算动态选择保留的视觉Token,而计算控制器则基于保留的Token数和预算,动态调整执行的Transformer层数和注意力头组。两者通过共享预算编码紧密连接,实现跨维度的协同调度。
实验设置:基准与基线对比

我们在VQAv2、GQA、TextVQA、ScienceQA、POPE、MMBench和VizWiz七个主流基准上进行零样本评估,以验证SmartVL的有效性。对比基线包括仅计算自适应的AdaLLaVA、仅Token剪枝的FastV和LLaVA-PruMerge+,以及组合方法AdaLLaVA-PruMerge。我们评估了SmartVL的两个变体:SmartVL-L仅控制层数,SmartVL-LH同时控制层数和注意力头组,以探究不同控制维度的贡献。
结果:扩展性与变体分析

在LLaVA-1.5-13B模型上,SmartVL-LH变体在7.25T FLOPs下准确率达75.45%,优于AdaLLaVA在8.27T FLOPs下的72.27%。这表明SmartVL不仅在小模型上有效,在更大规模模型上同样具备扩展性。通过对比SmartVL-L和SmartVL-LH,我们发现同时控制层数和头组能提供更宽的适应范围和更好的精度-效率折衷,特别是在处理复杂视觉推理任务时,宽度和深度的联合调整至关重要。
分析:任务依赖性与内容感知

深入分析发现,不同任务对Token保留率和计算保留率的最优组合存在显著差异。例如,POPE任务倾向于高Token保留率,对计算保留率容忍度较高;而VQAv2则需要更深的LLM处理,偏好高计算保留率。SmartVL能够根据输入内容动态调整这种分配,如图示所示,在4 TFLOPs预算下,不同图像的最佳(T, C)组合各不相同,证明了其内容感知和预算感知的自适应能力,无需手动调整阈值。
实验与关键结果
- 在VQAv2, GQA, TextVQA, ScienceQA, POPE, MMBench, VizWiz七个基准上进行零样本评估。
- 对比基线包括:仅计算自适应(AdaLLaVA)、仅Token剪枝(FastV, LLaVA-PruMerge+)、组合方法(AdaLLaVA-PruMerge)及全模型。
- 评估SmartVL-L(仅层控制)和SmartVL-LH(层+头组控制)两种变体。
- 在LLaVA-1.5-13B模型上验证扩展性。
- 在VQAv2上,50%计算预算下准确率74.4%,优于AdaLLaVA的67.9%。(第 12 页)
- 在TextVQA上,50%计算预算下准确率54.4%,优于AdaLLaVA的29.8%。(第 12 页)
- 在VizWiz上,50%计算预算下准确率55.1%,优于AdaLLaVA的34.3%。(第 12 页)
- 在7个基准的平均意义上,~50%计算预算下比AdaLLaVA平均高出7.8%准确率。(第 4 页)
- 在LLaVA-13B上,7.25T FLOPs下准确率达75.45%,优于AdaLLaVA在8.27T下的72.27%。(第 15 页)
阅读时需要注意
- 延迟估计器主要针对Prefill阶段的FLOPs,未扩展至内存受限的Decode阶段。
- 架构路由与权重量化正交,尚未结合以获取复合增益。
- FLOP减少转化为实际墙钟时间提升需依赖专用硬件内核支持。
- 不同任务对Token保留率和计算保留率的最优组合不同(如POPE偏好高Token保留,VQAv2偏好高计算保留),单一配置无法通吃。
- 训练初期需延迟预算约束权重以防止网络陷入退化稀疏状态。
关联工作
- AdaLLaVA:直接相关的基线,仅进行LLM侧自适应,未联合控制视觉Token。(第 5 页)
- FastV:仅Token剪枝基线,静态配置,无法自适应。(第 5 页)
- LLaVA-PruMerge+:仅Token剪枝基线,在有限预算窗口内与SmartVL精度相当但范围较窄。(第 3 页)
- MoDES:针对MoE架构的自适应计算,关注专家宽度控制。(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
少看,快想:面向多模态大语言模型的联合Token-计算自适应方法
Pengcheng Wang1, Zhiquan Wang1, Jayoung Lee1, Zhuoyan Xu2, Ran Xu3, Saurabh Bagchi1, Yin Li2, 和 Somali Chaterji1
1 普渡大学,美国印第安纳州韦斯特拉斐特 2 威斯康星大学麦迪逊分校,美国威斯康星州麦迪逊 3 NVIDIA,美国加利福尼亚州圣克拉拉
摘要。多模态大语言模型(MLLMs)近期在视觉-语言任务中展现了强大的性能。然而,由于其输入视觉Token数量庞大以及大语言模型(LLM)计算量大,导致推理成本高昂,这仍是实际部署的关键障碍。近期工作试图通过自适应优化单个维度来降低成本,例如剪枝冗余的视觉Token或跳过LLM的层和头。尽管如此,先前的方法通常独立地处理这些维度,并忽视了一个根本性的耦合关系:可用计算资源必须根据输入内容动态分配给所有维度。为了弥合这一差距,我们提出了SmartVL,一个统一的自适应推理框架,能够根据变化的输入内容和计算预算,联合控制视觉Token数量和模型计算能力。SmartVL引入了一个视觉侧的Token控制器,用于动态选择信息丰富的视觉Token,以及一个LLM侧的计算控制器,用于自适应地调整LLM的计算量。重要的是,这些控制器经过训练以相互协调,从而使整体推理成本满足目标预算。为了实现这种联合调度,我们使用共享的预算编码连接这些控制器,并利用可微分的延迟估计器进行端到端训练。这种设计使SmartVL能够学习跨阶段的分配策略,以适应输入复杂度和运行时计算约束。在多个MLLM基准上的实验表明,通过联合调度,SmartVL始终优于先前的自适应方法,并实现了更优的精度-效率帕累托前沿。项目页面:https://www.schaterji.io/publications/2026/jointtokencompute.
关键词:多模态大语言模型 · 自适应推理
1 引言
多模态大语言模型(MLLMs)已成为多模态理解的主导范式,在广泛的视觉-语言任务中取得了显著成功,包括视觉问答(VQA)、图像描述和定位 [1, 8, 22, 32, 40]。然而,这种通用性是以
第 2 页
2 P. Wang 等
推理时的高计算成本。重要的是,这种成本在很大程度上是固定的,与输入视觉数据的复杂性无关。例如,处理一个物体的标志性图像所需的计算量,与处理嵌入在复杂背景中的同一物体的图像所需的计算量基本相同。这种不匹配在具有不同延迟要求的部署场景中变得更加明显。实时系统施加严格的延迟约束4,以确保快速响应,而离线系统可能容忍更长的处理时间。即使在单个部署环境中,模型可用的计算资源也可能根据系统负载而波动。 现有的高效推理解决方案通常采用静态推理管道 [2, 8],这些方案未考虑输入复杂性的变化或运行时可用的计算预算。因此,这些方法可能会为简单输入分配过多的计算量,同时缺乏在运行时可用计算预算显著减少时进行调整的灵活性,导致性能次优。这引出了一个关键问题:我们能否为多模态大语言模型(MLLMs)设计一个自适应推理框架,根据输入内容和可用计算预算动态分配计算资源? 为了实现这种自适应设计,我们必须识别并控制 MLLM 推理成本的主要驱动因素。MLLMs 通常将预训练的视觉编码器与大型语言模型(LLM)集成。视觉编码器将输入图像或视频转换为一组视觉 Token,这些视觉 Token 随后与文本 Token 一起由 LLM 进一步处理。这导致了预填充阶段(Prefill stage)的主要计算瓶颈,其计算量可以通过三个主要维度进行缩减。首先,序列长度:标准的视觉编码器如 CLIP ViT-L/14 [27] 每张图像生成 576 个 patch Token,所有这些 Token 都与文本 Token 拼接,并经过语言模型的每一层处理。其次,模型深度:语言模型通常由 32 层或更多的 Transformer 层组成,每一层都对延迟和内存占用做出贡献。第三,模型宽度:在每一层内,计算分布在多个注意力头和宽泛的前馈网络中。在变化的延迟约束和输入内容下最大化性能,需要在这些计算轴之间复杂的相互作用中进行权衡。 尽管先前的工作通过诸如 Token 剪枝(例如,FastV [4], AIM [42], LLaVA-PruMerge [28], VTW [21])来利用序列长度这一维度,以及通过自适应层/头跳过(例如,AdaLLaVA [37], MoDES [13])来利用模型深度和宽度这一维度,但这些方法的主要局限性在于它们严格孤立地处理各个维度。这种解耦的方法导致了阶段不兼容,并阻碍了全局最优的效率。具体而言,孤立的 Token 剪枝评估空间冗余,但未意识到 LLM 所需的高级语言上下文。丢弃视觉上冗余但对语义至关重要的 Token 会导致不可逆的信息损失,这种损失会传播到下游层。相反,孤立的模型跳过假设输入序列是完整的,未能根据实际输入长度调整其计算深度,从而
4 在本文中,我们使用基于 FLOPs 的计算预算作为这些延迟目标的硬件无关代理。
第 3 页
少看,快想 3
先前的 token 剪枝已经简化了上下文。我们的关键洞察在于,视觉序列中的 token 冗余与 LLM 内的推理复杂度在根本上是耦合的。语言模型的架构容量,特别是其深度和宽度,严格取决于剪枝后视觉输入的信息密度。 受此洞察驱动,我们提出了 SmartVL,这是一种统一的自适应推理框架,联合控制序列长度、模型深度和模型宽度。SmartVL 由两个轻量级模块组成:一个视觉侧 token 控制器和一个 LLM 侧计算控制器。关键在于,为了确保框架显式地感知内容和预算,这两个控制器根据融合中间特征来制定分配决策,这些特征共同编码了输入语义和目标计算预算。与依赖孤立启发式规则不同,两个控制器都通过可微资源估计器进行端到端训练,该估计器直接惩罚偏离计算预算的情况。 通过将所有的计算决策建立在融合的内容和预算表示之上,该框架消除了手动阈值调整的需要。在推理过程中,一个集成的边界机制严格强制执行计算预算,同时实现动态的跨维度计算权衡。因此,系统自主决定为每个输入实例分配 FLOPs 是保留更多视觉上下文还是激活更深的推理层,如图 1 所示。 我们在多个 MLLM 基准测试(VQAv2, GQA, TextVQA, ScienceQA, POPE, MMBench, VizWiz)上评估了 SmartVL,并与单维度 token 剪枝基线(LLaVA-PruMerge+, FastV)、二维计算自适应方法(AdaLLaVA)以及组合的 token-计算自适应方案(AdaLLaVA-PruMerge)进行了比较。与单独的 token 或计算控制或其简单组合相比,联合 token-计算调度始终产生更优的精度-效率帕累托前沿。 具体而言,SmartVL 在所有 FLOPs 水平上始终优于 AdaLLaVA,在 50% 计算量下实现了 6.6% 的精度提升,并保持这一优势直至全容量。虽然 SmartVL 在其受限的 3T 到 4.8T 窗口内提供了与 PruMerge+ 相当的精度,但我们的框架在从 2.5T 到全容量 8.5T 的显著更宽范围内具有可扩展性。
我们的主要贡献总结如下。 • 我们提出了一种统一的自适应推理框架,联合控制序列长度、模型深度和模型宽度,以满足不同的计算
第 4 页
4 P. Wang et al.
预算。该方法明确解决了视觉 token 空间密度与 LLM 架构容量之间 先前工作所忽视的根本性跨阶段耦合问题。 • 我们设计了两个轻量级控制器,通过 MLLM 管道中的共享预算编码 链接,并通过可微延迟估计器进行联合优化。为了稳定复合离散搜索空间, 我们引入了一种利用 Gumbel-sigmoid 采样和非对称预算违规损失 的训练策略,确保严格遵循目标延迟,同时保持推理准确性。 • 在多个 MLLM 基准测试和多样化任务上的实验表明,我们的方法 一致优于解耦基线解决方案。值得注意的是,我们的框架实现了更强的 Pareto frontier,具有更宽的适应范围:在相同的计算预算下,我们的方法 提供了更高的准确性。在约 50% 的计算预算下,我们的方法在七个基准测试上 平均比 AdaLLaVA 高出 7.8%。
2 相关工作
MLLMs 架构。现代 MLLMs 采用“patch tokens + LLM”架构: ViT 风格的编码器生成密集的视觉 token,这些 token 被投影到 语言模型的嵌入空间中,并以自回归方式处理 [17, 23, 27]。在视觉到语言的投影阶段,出现了两种主要方法。第一种采用可学习的查询机制,例如 BLIP-2 [18] 和 InstructBLIP [7] 中的 Q- Former,通过与固定数量的可学习查询进行交叉注意力来压缩视觉信息。 这种基于查询的范式已被后续模型如 VideoL- LaMA [39] 和 Qwen2-VL [36] 所采用。或者,LLaVA [23] 和 MiniGPT-4 [44] 使用多层感知机 (MLP) 将视觉 token 直接投影到 语言模型的嵌入空间中,这种设计已被证明对多模态指令微调有效,并在最近 的模型如 Molmo [8] 和 Qwen2.5/3-VL [2,3] 中进行了扩展。尽管存在这种架构多样性,当前的 MLLMs 无论输入数据的复杂度如何,都具有固定的计算成本, 并且无法在推理时响应不同的计算预算。 这些差距激发了我们对内容和预算感知的自适应推理的研究。
MLLMs 的高效推理。紧凑架构通过将小型语言骨干网络(例如 Phi-2 [16])与视觉编码器配对来降低推理成本, 正如 TinyGPT-V [38]、LLaVA-ϕ [45] 和 TinyLLaVA [43] 所展示的那样。 MobileVLM [5] 和 MobileVLM V2 [6] 进一步优化了骨干网络和投影器 的设计以适应移动部署,在低于 3B 参数的规模下实现了具有竞争力的准确性。 训练后压缩和条件计算提供了一种互补策略。量化和低秩适应可以在最小化精度下降的情况下减少内存带宽 和算术强度 [9, 35]。混合专家 (MoE) 架构,如 MoE-LLaVA [20] 和 LLaVA-MoD [29], 将每个 token 路由到一小部分专家模块,从而减少总模型容量。另一条研究路线针对大量视觉 token,这些
第 5 页
少看,快想 5
同时影响注意力复杂度和键值缓存内存。FastV [4] 和 VTW [21] 基于注意力模式,在浅层之后剪枝多达一半的图像 token。LLaVA-PruMerge [28] 利用视觉编码器键值统计信息,在 token 进入大语言模型(LLM)之前执行早期剪枝。IVTP [12] 结合视觉侧和指令感知的剪枝,仅保留与查询相关的 token。FastVLM [33] 用原生生成极少 token 的混合编码器替换了标准的 ViT 主干网络。尽管这些方法在很大程度上提高了效率,但它们继承了根本性的静态配置问题,因此无法支持自适应推理。
自适应、预算感知的推理。最近的一些工作寻求动态分配计算资源:要么响应显式的资源预算,要么由每个输入的内容驱动,或者两者兼有。MoDES [13] 针对基于混合专家(MoE)的多模态大语言模型(MLLM)中的自适应计算,通过学习每个 token 的专家重要性并应用输入依赖的专家激活来减少每个 token 的计算量。它专注于通过轻量级门控控制专家宽度,而不改变基础架构。AIM [42] 将 token 减少扩展到免训练设置,支持在单个模型内的一系列资源配置下进行 token 合并和剪枝。与我们的工作最直接相关的是 AdaLLaVA [37],它学习一种推理策略,给定图像-问题对和延迟预算代理,自适应地丢弃 LLM 中的 Transformer 层、注意力头和 MLP 模块,同时很大程度上保持准确性。尽管 AdaLLaVA 展示了预算条件化的模型组件控制,但它没有联合协调视觉 token 数量和模型容量。SmartVL 通过一个统一框架解决了这一局限性,该框架同时控制 MLLM 计算的三个轴,条件基于输入内容和延迟预算。
3 SmartVL:MLLM 的自适应推理
给定图像 $I$ 和文本提示 $T$,标准 MLLM 将 $I$ 编码为 $N$ 个视觉 token,将它们与文本 token 拼接,并通过一个 $L$ 层的 Transformer 处理该序列(隐藏维度为 $D$,每层有 $A$ 个头)。由此产生的预填充(Prefill)计算跨越三个维度:1) 序列长度 $S$,由保留的视觉 token 数量 $S_{vis}$ 决定;2) 模型深度 $L_{eff}$,即执行的 Transformer 层数;3) 模型宽度 $\alpha_l$,即第 $l$ 层中激活的注意力头和 FFN 通道的比例。我们将 $(S, L_{eff}, \alpha_l)$ 用作分配框架的自适应搜索空间。
预算约束。令 $f(\cdot; \phi)$ 表示参数为 $\phi$ 的 MLLM。令 $b \in [b_{min}, 1]$ 表示以全模型预填充 FLOPs 分数形式表示的目标计算预算。我们使用 FLOPs 作为预算指标,因为预填充计算是计算密集型的,且 FLOPs 提供了与延迟相关的硬件无关代理,与现代加速器上的实际运行时间(wall-clock time)具有良好的相关性。强制执行最小值 $b_{min} > 0$,因为前 $P$ 层(前缀层,见第 3.2 节)始终以全容量执行。
第 6 页
6 P. Wang 等
适应策略。给定输入 $(I, T)$ 和预算 $b$,我们寻求一个学习到的分配策略 $\pi$,该策略为三个联合维度确定二进制掩码。这些掩码共同定义了计算配置,如下所示: – 序列长度 ($S$):Token 掩码 $m_{\text{token}}$ 决定了保留的视觉 token 数量 $S_{\text{vis}} = \sum_i m_{\text{token},i}$,从而产生有效序列长度 $S = S_{\text{text}} + S_{\text{vis}}$,其中 $S_{\text{text}}$ 是文本 token 的数量。 – 有效深度 ($L_{\text{eff}}$):层掩码 $m_{\text{layer}}$ 决定了 transformer 块的执行,直接控制模型的垂直深度。 – 有效宽度 ($\alpha_l$):激活分数 $\alpha_l \in [0, 1]$ 表示源自 $m_{\text{layer}}$ 和 $m_{\text{head}}$ 的每层宽度。具体而言,$\alpha_l = 0$ 表示跳过该层,而 $\alpha_l = 1$ 表示以全容量执行。 在推理时,生成的答案 $X_a$ 由模型 $f$ 在由 $\pi(I, T, b)$ 决定的特定分配下运行产生。
$\hat{X}_a \leftarrow f\big(I,T;\;\varphi\,\big(I,T,b\big)\big)\label{eq:inference_under_pi}$ (1)
即,$f$ 应用于 prompt,其 token 和层/头选择由 $\pi$ 给出。策略 $\pi^*$ 在满足预算约束的情况下最大化任务准确率:
$\pi^* = \arg\max_{\pi} \; \text{limits}_{\pi} \; \mathcal{A}(I,T,f,\text{s.t.}\mathcal{C}(I,T,\leqb\cdot\mathcal{C}_{\mathrm{full}},\label{eq:budget_constrained}$ (2)
其中 $\mathcal{A}(I, T, f, \pi)$ 表示在分配 $\pi(I, T, b)$ 下运行 $f$ 时的准确率,$\mathcal{C}(I, T, \pi)$ 表示产生的预填充计算成本,$\mathcal{C}_{\text{full}}$ 是全模型预填充成本。策略 $\pi$ 由两个顺序控制器实现(第 3.1 和 3.2 节)。每个 transformer 层的成本缩放为 $\mathcal{O}(\alpha_l \cdot D^2S + \alpha_l \cdot DS^2)$,其中 $D^2S$ 源于线性投影(Q/K/V/O 和 FFN),$DS^2$ 源于注意力分数计算。对 $L_{\text{eff}}$ 个执行层进行聚合:
$\mathcal{C}_{\mathrm{prefill}}=\mathcal{O}\Bigl(\Sigma_{l=1}^{L}\alpha_l\cdot(D^2S+DS^2)\Bigr)\label{eq:prefill_brief}$ (3)
序列长度通过注意力以二次方形式进入,使得 token 减少成为杠杆效应最高的单一维度。深度(活跃层数)和宽度($\alpha_l$)各自提供与 token 减少相乘的缩减效果,因此对这三个维度进行联合控制产生的节省严格大于单独优化任何单一维度。 框架概览。我们通过两个由共享预算信号桥接的学习控制器来实现这一公式(图 2)。视觉侧 token 控制器(第 3.1 节)通过每个 token 的 Gumbel-sigmoid 决策确定保留哪些视觉 token。LLM 侧计算控制器(第 3.2 节)确定执行哪些 transformer 层以及每层内激活哪些注意力头组。这两个控制器通过可微 FLOPs 估计器(第 3.3 节)进行端到端联合优化,该估计器将它们的连续输出映射到估计的计算比率。具体而言,$\pi$ 分解为两个组件:
$\mathbf{m}_{\mathrm{token}} = \pi_{\mathrm{tok}}(\mathbf{h}_b),(\mathbf{m}_{\mathrm{layer}},\,\mathbf{m}_{\mathrm{comp}}(\tilde{\mathbf{h}}_b^{(P)}),\label{eq:pi_decompose}$ (4) 其中 $\mathbf{h}_b \in \mathbb{R}^{C_v}$($C_v$ 表示视觉编码器隐藏维度)是 ViT 输出处预算 token 的隐藏状态,编码了图像内容
第 7 页
少看,快想 7
语言响应 预测损失 ∇ prediction → LLM, 控制器
大型语言模型 计算控制器
投影器 分词器 追加 可微分 语言指令 延迟估计器 令牌控制器
视觉编码器 预算编码器 预算违规 损失 追加 ∇ violation → 控制器 视觉输入 全局预算
图 2: SmartVL 概述。视觉侧的令牌控制器和 LLM 侧的计算控制器共同管理三个耦合的计算维度:视觉令牌(序列长度)、激活的注意力头和 FFN 容量(宽度),以及执行的 Transformer 层(深度)。两个控制器均以相同的全局预算为条件,并通过可微分延迟估计器进行端到端训练,使它们能够学习跨所有三个维度的内容和预算感知分配策略。
和预算 b(第 3.1 节),且 $\tilde{h}(P_b) \in \mathbb{R}^D$ 是经过 $P_{LLM}$ 个前缀层后的预算令牌的隐藏状态,并与来自 $\pi_{tok}$(第 3.2 节)的令牌计数 $\kappa$ 融合。
3.1 视觉侧令牌控制器
作为联合分配过程的初始阶段,令牌控制器通过根据图像内容和计算预算自适应地选择一组视觉令牌作为 LLM 的输入,从而确定序列长度。 编码器内预算融合。为了将令牌选择与视觉处理紧密耦合并最小化开销,我们将预算信号直接嵌入到视觉编码器中。标量预算 $b$ 通过正弦编码(PE)[34] 和 MLP 映射到 ViT 隐藏空间:
\m t hbf {e } _b^{\m a thrm{ViT}}\mathrm{MLP}_{\mathrm{ViT}}\bigl(\mathrm{PE}(b)\bigr\mathbf{p}_b\label{eq:budget_token_vit} (5) a
其中 $p_b$ 是学习到的位置嵌入。该预算令牌被追加到输入序列 $X_0 = [x_{CLS}, x_1, . . . , x_N, e_b^{\mathrm{ViT}}]$。通过在 ViT 层中关注所有图像块,它动态地将视觉内容与预算约束融合,输出上下文感知的预算状态 $h_b \in \mathbb{R}^{C_v}$。 逐令牌 Gumbel-Sigmoid 决策。令牌控制器通过线性层投影 $h_b$ 以计算逐令牌 logits $z \in \mathbb{R}^N$。为了实现可微分的二值路由,我们应用 Gumbel-sigmoid 松弛 [15,26]。$z_i$ 被 Gumbel 噪声 $\xi_i$ 扰动,以在温度 $\tau$ 下产生连续值 $y_i$:
y _ i = \ sigma \ bi g l (( z _i + \xi _i ) / \tau\bigrm_i=\mathbf{1}[y_i>\mathrm{sg}(y_i)y_i.\label{eq:gumbel_sigmoid} (6)
这种直通估计器(STE),其中 $\mathrm{sg}(\cdot)$ 是停止梯度算子,在前向传播期间应用离散掩码 $m_{token} \in \{0, 1\}^N$,同时在反向传播中通过连续值 $y_i$ 路由梯度。保留的令牌计数 $S_{vis} =$
第 8 页
8 P. Wang 等
Pi mi 根据输入动态适应。在训练期间,被丢弃的 token 被置零,以保持用于批处理的静态张量形状。在推理时,我们移除噪声($\xi_i = 0$)并物理丢弃满足 $\sigma(z_i) \le 0.5$ 的 token。LLM 仅处理选定的 token;RoPE [31] 原生处理这种压缩后的连续序列,无需进行位置重新编码。由于 token 控制器是在与推理时相同的预算信号下训练的,其学习到的 logits 会根据图像内容和目标预算为每个输入生成 token 掩码,从而避免了为每个数据集手动调整保留比率。
3.2 LLM 端计算控制器
在从 token 控制器接收视觉序列后,LLM 端计算控制器构成了联合分配框架的第二阶段。它通过动态决定执行哪些 transformer 层以及激活每层中的哪些注意力头组,来控制模型深度 $L_{eff}$ 和宽度 $\alpha_l$。为明确解决跨阶段耦合问题,这些离散的架构决策严格依赖于实际保留的视觉 token 数量 $S_{vis}$ 和共享的全局预算。
预算编码与前缀层。为了将标量预算 $b$ 投影到 LLM 嵌入空间,我们复用视觉侧的正弦编码,但应用一个不同的 MLP 以匹配 LLM 隐藏层维度 $D$:$\mathbf{e}_{b}^{LLM} = \text{MLP}_{LLM}(\text{PE}(b)) \in \mathbb{R}^D$。该预算 token 附加在提示序列的末尾,接收标准的 RoPE 并 attends 到所有先前的视觉和文本内容。初始的 $P$ 个 transformer 块(前缀层)严格以全容量执行,以建立最小的计算基线。通过这些层,预算 token 聚合全局上下文以输出内容感知的表示 $\mathbf{h}_b^{(P)}$。
跨阶段 token 数量嵌入。尽管前缀状态 $\mathbf{h}_b^{(P)}$ 捕获了视觉上下文,但它缺乏对已消耗 token 预算的显式度量。由于 LLM 推理成本严格依赖于保留的序列长度,我们根据归一化的 token 存活率 $\kappa = \text{sg} \sum_{i=1}^N \sigma(z_i) / N \in [0, 1]$ 对计算控制器进行显式条件约束。该标量经过位置编码并添加到前缀边界状态: $$ \tilde{\mathbf{h}}_b^{(P)} = \mathbf{h}_b^{(P)} + \text{MLP}_{\kappa}(\text{PE}(\kappa)) \label{eq:token_count_embed} \quad (7) $$
关键在于,停止梯度算子 $\text{sg}(\cdot)$ 隔离了视觉控制器和计算控制器的优化轨迹。直接将 LLM 的架构分配梯度反向传播通过 $\kappa$ 会导致严重的幅度不平衡,迫使视觉控制器过早陷入退化的稀疏状态。断开这条特定路径在严格保留前向预算条件的同时,稳定了联合离散优化过程。
通过独立的 Gumbel-Sigmoid 进行门控。给定融合状态 $\tilde{\mathbf{h}}_b^{(P)}$,计算控制器预测剩余层 $P+1$ 到 $L$ 的离散执行掩码。与先前通过 Gumbel-softmax 选择强制执行确定性 top-K 约束的自适应方法(例如 AdaLLaVA)不同,我们的框架同时应用独立的 Gumbel-sigmoid 激活(公式 (6))
第 9 页
少看,快想 9
到每一层或头组。这种独立的公式化至关重要,因为最优的活跃模块数量并非静态预定义;相反,它从全局预算和先前的视觉 token 存活率中动态涌现。为了防止过早的结构崩溃,我们将线性门控偏置初始化为正值,确保网络在不对称违反损失(第 3.3 节)引发选择性停用之前,在接近全容量的状态下开始优化。我们探索两种特定的分配粒度:层控制器(L)。单个线性投影将融合状态映射为 $L-P$ 个 logits。这些 logits 通过独立的 Gumbel-sigmoid 函数进行处理,以生成二进制层掩码 $\mathbf{m}_{\text{layer}} = (g_l)_{l=P+1}^L \in \{0, 1\}^{L-P}$。每个元素 $g_l$ 控制其对应的动态调度层 $l$ 的执行:如果 $g_l = 0$,则通过残差连接严格绕过该层;如果 $g_l = 1$,则以全容量执行($\alpha_l = 1$)。
层-头控制器(LH)。为了实现更细粒度的分配,将 $A$ 个注意力头划分为 $G$ 个大小相等的组(例如,对于具有 $A=32$ 的 LLaMA-7B,$G=4$)。线性门控头为动态调度的层生成一组组级二进制掩码矩阵,其中 $\mathbf{M} = \text{GumbelSigmoid}(\mathbf{W}_h \tilde{\mathbf{h}}^{(P_b)}) + \mathbf{c}_h$。$\mathbf{M} \in \{0, 1\}^{(L-P) \times G}$ 中的每一行对应于层 $l$,记为 $\mathbf{M}_l \in \{0, 1\}^G$,并作为二进制掩码广播到该层内各自的头组;因此 $\mathbf{M} = \mathbf{m}_{\text{head}}$。为了保持平衡的计算缩减,每个组的一个决策同步控制多头注意力组件和 FFN 的相应中间维度。层 $l$ 的活跃容量分数动态计算为 $\alpha_l = \sum_{j=1}^G \mathbf{M}_{l,j} / G$。因此,当特定层的所有组掩码评估为零时($\alpha_l = 0$),整个层将被跳过,从而在单一公式中统一了深度和宽度控制。
3.3 联合训练与推理
在全局严格预算下联合优化视觉 token 控制器和 LLM 计算控制器中的分配决策,在不可微性和训练稳定性方面带来了根本性挑战。为了规避离散瓶颈并将代理概率映射到连续的比率,我们设计了一个可微的 FLOPs 估计器。在此估计比率的指导下,应用不对称预算违反损失,以确保稳定、软引导的优化,同时避免结构崩溃。此外,在训练期间集成了动态预算采样过程,使统一模型能够在连续的资源约束谱系中泛化。
可微延迟估计器。给定 $\tilde{S}_{\text{vis}} = \sum_{i=1}^N \sigma(z_i)$($S_{\text{vis}}$ 的可微代理),$\alpha_l$ 为有效层活跃度,且 $S = S_{\text{text}} + \tilde{S}_{\text{vis}}$,估计的预填充成本计算如下:
$$ \hat{\mathcal{C}} = \sum_{l=1}^{L} \alpha_l \left[ (8D^2 + 6DD_{\mathrm{int}}) \cdot S + 4D \cdot S^2 + 2DV \cdot S \right], \label{eq:compute_est} \quad (8) $$
其中 $D_{\text{int}}$ 是 FFN 中间维度,$V$ 是词汇表大小。归一化比率 $r = \hat{\mathcal{C}} / \mathcal{C}_{\text{full}}$ 在 $\tilde{S}_{\text{vis}}$ 和 $\{\alpha_l\}$ 方面均可微。令 $\theta$ 表示
第 10 页
10 P. Wang et al.
两个控制器的参数,包括它们各自的预算和 token 计数嵌入模块。这种可微分的延迟估计器绕过了不可微分的离散路由瓶颈,为预算约束建立了端到端的梯度路径。预算惩罚的梯度 $(\partial r/\partial \theta)$ 仅传播到这些控制器参数,明确驱动视觉 token 控制器和 LLM 计算控制器学习符合预算。
非对称预算违反损失。给定估计的计算比率 $r$ 和目标预算 $b$,我们构建一个非对称惩罚:
$$ \mathcal{L}_{\mathrm{over}} = \max(0, rb)^2, \mathcal{L}_{\mathrm{under}}=\max(b-\mu r),\label{eq:loss_over_under} \quad (9) $$
其中边际 $\mu$ 定义了一个零惩罚容忍区间 $[b-\mu, b]$。非对称形式反映了两种违规的不同后果。超出预算会破坏请求的操作点,因此受到二次方惩罚,而未充分利用虽然可行,但会留下可用容量未被使用。我们对后者进行线性惩罚,提供持续激励以利用计算资源,同时不会压倒任务预测损失。最终训练目标整合了这些项:
$$ \mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{pred}}\lambda(t)\cdot(w_{\mathrm{over}}\cdot\mathcal{L}_{\mathrm{over}} + w_{\mathrm{under}}\cdot\mathcal{L}_{\mathrm{under}}),\label{eq:total_loss} \quad (10) $$
其中 $w_{\mathrm{over}}$ 和 $w_{\mathrm{under}}$ 分别是 $\mathcal{L}_{\mathrm{over}}$ 和 $\mathcal{L}_{\mathrm{under}}$ 的权重。$\lambda(t) = \min(1, t/T_{\mathrm{warmup}})$ 线性缩放违反权重。这种调度预热对于优化稳定性至关重要。在控制器学会区分任务相关特征之前立即强制执行预算约束,会导致惩罚梯度主导 $\mathcal{L}_{\mathrm{pred}}$,过早地将网络强制进入退化的稀疏状态。延迟完全正则化可确保控制器首先建立可靠的重要性分布,使后续的剪枝建立在学到的任务效用而非随机初始化之上。
训练流程。在每一步,从 $[b_{\min}, b_{\max}]$ 中均匀采样一个目标预算 $b$ 并应用于整个批次。这使得模型能够泛化到不同的计算预算,同时批次级别的共享保持了硬件执行效率。为了实现对 $b$ 的细粒度敏感性,我们采用正弦编码,使控制器能够处理未见过的预算比率。该框架对 LLM、投影层和两个控制器进行端到端优化,以协调感知和认知阶段的决策;视觉编码器保持冻结状态,以确保训练期间输入特征分布的稳定。
推理。移除 Gumbel 噪声可在推理时产生确定性的执行掩码。由于可微分的训练目标以软方式强制执行预算,原始掩码偶尔会超过目标预算;对于 $b < 1.0$,因此我们应用确定性预算投影。经验上,我们发现生成质量对序列截断具有相对的韧性,因此投影首先丢弃置信度最低的视觉 token。仅当 token 级别的调整不足时,才会减少层或头。
实现细节。控制器超参数,包括 token 和计算 Gumbel 温度,在所有基准和预算中保持固定;每个操作点是通过在推理时更改目标计算预算来选择的。
第 11 页
少看,快想 11
4 实验与结果
4.1 实验设置
基准测试。我们通过 lmms-eval [41] 在涵盖多种能力的七个基准测试上评估零样本性能:VQAv2 [10](通用)、GQA [14](空间)、TextVQA [30](文本中心)、ScienceQA [25](推理)、VizWiz [11](现实世界盲人场景)、POPE [19](幻觉)和 MMBench [24](综合)。遵循先前的工作 [37],我们报告官方指标和平均预填充 FLOPs。
基线方法。我们将 SmartVL 与四类方法论进行对比:(1) 仅计算(AdaLLaVA [37]),仅具备 LLM 侧自适应能力;(2) 仅 Token(LLaVA-PruMerge+ [28], FastV [4]),专注于使用静态 LLM 进行序列剪枝;(3) 顺序式(AdaLLaVA-PruMerge),这是一种两阶段组合,缺乏联合端到端优化;(4) 全模型参考(LLaVA-1.5 [22]),作为性能上限和 FLOPs 归一化锚点。对于固定 Token 剪枝基线,我们使用其原始接口扫描预设的保留比率直至完全保留 Token,涵盖 FastV 的 10%–100% 和 PruMerge+ 的 1/8–1。由此产生的固定比率配置构成了用于绘制其帕累托前沿的操作点。
模型变体。我们评估了我们设计的两种变体,区别在于计算控制器的粒度:SmartVL-L 使用层级门控(仅深度),SmartVL-LH 使用头组门控(深度和宽度)。两种变体均包含视觉侧的 Token 控制器。
4.2 主要结果与讨论
精度-效率权衡。我们在图 1 中预览了 VQAv2 上的结果;此处提供定量比较。在 VQAv2 上,SmartVL 在不同计算预算下均展现出一致的增益。在 50% FLOPs 时,SmartVL 达到 74.4% 的准确率,而 AdaLLaVA 为 67.9%,AdaLLaVA-PruMerge 为 74.5%。AdaLLaVA 在 50% 预算(其最低操作点)时准确率急剧下降,而 SmartVL 在全预算的 20% 到 100% 范围内均保持了较高的准确率。在 70% FLOPs 时,SmartVL(75.7%)与 AdaLLaVA(74.4%)之间的差距仍为 1.3 个百分点,而在满预算下,SmartVL 的准确率与基础模型持平(76.5%)。AdaLLaVA-PruMerge 在中段范围内实现了相当的准确率,但仅限于少数手动配置的 Token 保留比率(我们在 65%、80% 和 100% 的 AdaLLaVA 层下测试了 25% 的 PruMerge+ Token 保留率),且无法进行连续自适应。FastV 和 LLaVA-PruMerge+ 是固定的 Token 剪枝方法(如第 4.1 节所述,我们扫描了其原始保留比率接口);它们使用数据集级别的保留配置,无法针对每个请求或样本进行自适应调整。这些结果证实,联合跨维度控制比解耦基线能产生更好的帕累托前沿。
综合基准测试结果。图 3 将比较扩展到了另外六个基准测试:GQA、TextVQA、ScienceQA、POPE、VizWiz 和 MMBench。SmartVL 在这些基准测试中持续优于或持平于基线方法
第 12 页
12 P. Wang et al.
GQA TextVQA ScienceQA 62 70 61 55 69 50 68 60 45 59 67 40 58 35 66 57 30% 40% 50% 60% 70% 80% 90% 100% 30 30% 40% 50% 60% 70% 80% 90% 100% 65 30% 40% 50% 60% 70% 80% 90% 100% 2 3 4 5 6 7 8 2 3 4 5 6 7 8 9 2 3 4 5 6 7 8 9 POPE VizWiz MMBench 64Accuracy 56 87 52 62 48 SmartVL 44 60 AdaLLaVA-PruMerge 86 40 58 AdaLLaVA 30% 40% 50% 60% 70% 80% 90% 100% 36 30% 40% 50% 60% 70% 80% 90% 100% 30% 40% 50% 60% 70% 80% 90% 100% 2 3 4 5 6 7 8 2 3 4 5 6 7 8 9 2 3 4 5 6 7 8 9 FLOPs (T) Fig. 3: Accuracy–Latency Pareto comparison across benchmarks. Pareto fronts on (a) GQA, (b) TextVQA, (c) ScienceQA, (d) POPE, (e) VizWiz, and (f) MM- Bench. SmartVL consistently achieves a stronger or comparable accuracy–efficiency tradeoff across operating points against AdaLLaVA and AdaLLaVA-PruMerge.
diverse tasks. On TextVQA and VizWiz, AdaLLaVA suffers severe degrada- tion at 50% budget (29.8% and 34.3%, respectively), whereas SmartVL main- tains 54.4% and 55.1% at the same FLOP level. On GQA, SmartVL (59.8% at 50%) slightly trails AdaLLaVA-PruMerge (60.1%) but surpasses AdaLLaVA (56.8%). On ScienceQA and POPE, all three methods achieve comparable ac- curacy, with SmartVL showing modest gains in the mid-range. On MMBench, AdaLLaVA and AdaLLaVA-PruMerge are competitive at full budget; SmartVL achieves 62.0% at 50% compared to 63.1% for AdaLLaVA-PruMerge and 63.3% for AdaLLaVA. Overall, SmartVL provides the most consistent Pareto frontier across benchmarks, with the largest advantages on VQA-style tasks (VQAv2, TextVQA, VizWiz) where adaptive token and compute control matter the most.
4.3 Vision Token Controller Analysis
A distinguishing feature of our framework relative to AdaLLaVA is the addition of a learned vision-side token controller that operates after the ViT encoder. This section isolates its contribution by comparing against established token selection methods. Fig. 4 compares our token controller (with the compute controller dis- abled, i.e., all layers and heads active) against PruMerge+ [28] and FastV [4] on VQAv2. Our token controller achieves a consistently favorable accuracy-efficiency tradeoff across the full range. In the high FLOPs regime, it preserves accuracy better than both baselines by retaining the most task-relevant tokens. In the low FLOPs regime, it outperforms FastV and PruMerge+ by a clear margin. Impor- tantly, our token controller is budget-conditioned: a single trained model pro- duces different token subsets for different budgets and selects input-dependent token subsets for each target budget. By comparison, the fixed-pruning baselines form discrete retention-ratio operating points, while our controller changes the retained token set with the target budget. This budget-conditioned flexibility of our approach is what enables seamless integration with the compute controller in the full framework.
第 13 页
少看,快想 13
(%) 76 (%) 55 74 50
72 45准确率 准确率 SmartVL-L 70 ours 40 SmartVL-LH FastV AdaLLaVA-PruMerge 35 AdaLLaVA VQA-v2 68 LLaVA-PruMerge+ TextVQA 66 30% 40% 50% 60% 70% 80% 90% 100% 30 30% 40% 50% 60% 70% 80% 90% 100% 2 3 4 5 6 7 8 2 3 4 5 6 7 8 9 FLOPs (T) FLOPs (T)
图 4: 令牌剪枝方法的帕累托前沿(VQAv2)。我们的学习到的令牌控制器在变化的计算预算下,与 FastV / LLaVA-PruMerge+ 相比实现了更有利的权衡。 图 5: 不同模型变体的帕累托前沿(TextVQA)。我们的变体(L 和 LH)与 AdaLLaVA / AdaLLaVA-PruMerge 相比,实现了更大的适应范围和更好的权衡。
4.4 消融研究
L 与 LH 变体。在 TextVQA 上比较两种变体和基线(图 5),SmartVL 在所有计算预算下均获得一致的提升。在 50% FLOPs 时,SmartVL-L 的准确率为 54.1%,优于 AdaLLaVA-PruMerge(51.3%),并避免了 AdaLLaVA 的严重性能下降(29.8%)。这种性能优势在 70% FLOPs 时依然保持(分别为 57.0% 对比 54.3% 和 50.8%),并在满容量时扩展至领先的基线准确率 58.1%。SmartVL-LH 变体提供了一个可行的替代方案,但在满预算下略有下降(57.5%)。这一发现表明,MLLM 的冗余主要存在于序列和深度维度。保持全宽注意力对于推理质量至关重要,这使得联合令牌-层控制优于完全无约束的 3D 控制器。虽然在中间范围表现相当,但 AdaLLaVA-PruMerge 缺乏连续适应能力,而是依赖手动、离散的配置(例如,25% 令牌配合 65-100% 层)。此外,AdaLLaVA 在 50% 计算量下遭受严重的准确率下降,暴露了相对于跨维度控制,仅进行层剪枝的根本局限性。
内容依赖的最优令牌-计算分配。SmartVL 的一个关键设计选择是联合训练令牌控制器和计算控制器,而不是孤立地优化任一维度。为了验证这一决定,我们进行了消融研究,分别训练视觉令牌控制器和计算控制器。我们扫描令牌保留率 $T \in \{0.5, 0.6, 0.7, 0.8, 0.9\}$ 和计算保留率 $C \in \{0.5, 0.6, 0.7, 0.8\}$,并记录由此产生的计算量和准确率。在这种设置下,每个控制器接收其自己的预算信号,指定保留多少视觉令牌或多少 LLM 计算量。如图 6 所示,最优的 $(T, C)$ 在不同任务和预算水平下变化显著。例如,POPE 始终倾向于高视觉覆盖率与最小 LLM 深度($T=0.8, C=0.5$),而 VQAv2 和 TextVQA 随着预算增加需要更深层次的推理(在 7 TFLOPs 时为 $T=0.9, C=0.8$)。此外,单维度适应是不够的。在图 7 中,我们展示了具有不同令牌或计算保留率但端到端 FLOPs 相似的组合。在
第 14 页
14 P. Wang 等
图 6:最优的 Token-计算自适应策略因任务而异。各图展示了在不同计算预算下的最佳性能分配。最优组合在不同任务和计算预算水平下有所不同;例如,POPE 始终倾向于较高的 Token 保留率,同时对降低计算保留率的容忍度较高,而 VQAv2 则需要更深的 LLM 处理以及更高的计算保留率。没有任何单一配置或权衡策略适用于所有不同任务。
图 7:在 4 TFLOPs 计算预算下 Token-计算分配的可视化。上图和下图分别展示了在 POPE 和 TextVQA 上的预测结果。不同的 (T, C) 组合根据输入内容表现出不同的性能,这表明最佳预算分配是依赖于内容的。
在约 4 TFLOPs 的可比 FLOPs 下,将预算从视觉 Token 转移到 LLM 计算(或反之)会导致对同一输入产生不同的预测,且该模式在不同任务间也存在差异。这证实了推理成本应以内容感知的方式在两个维度上进行分配。如果仅使用其中一个维度,模型将缺乏应对多样化任务类型和输入特性所需的灵活性。
扩展至 13B 模型。我们进一步在 LLaVA-1.5-13B 主干网络上实例化 SmartVL,该网络拥有 40 层语言层,并固定使用 20 层前缀,在 VQAv2 验证集上进行评估。13B 变体遵循相同的
第 15 页
少看,快想 15
全局预算的训练和推理管道与 7B 模型相同,AdaLLaVA 13B [37] 作为相应的仅计算基线。 如图 8 所示,联合 token- 计算适应在更大规模上提升了帕累托前沿。 在半预算区间附近,SmartVL 76 准确率 74在 7.25T 预填充 FLOPs 下达到 75.45% 的准确率,而 AdaLLaVA 在 SmartVL (13B) VQAv2 72 AdaLLaVA (13B) 8.27T 下达到 72.27%。在可比 30% 40% 50% 60% 70% 80% 90% 100% 的中/高计算水平下,SmartVL 4 6 8 10 12 14 16 在 11.56T 计算量下获得 77.66% FLOPs (T) 的准确率,而 AdaLLaVA 在 11.57T 下为 Fig. 8: 在 VQAv2 上扩展到 13B。 SmartVL 提升了准确率-效率的 76.45%,并在满预算下达到 78.82%, 帕累托前沿,优于 AdaLLaVA。 而 AdaLLaVA 为 77.85%。 这些结果表明,学习到的分配策略可以迁移到更大的骨干网络,联合视觉 token 和 LLM 深度适应继续在受限计算下改善准确率-效率权衡。
5 结论与讨论
在本文中,我们提出了 SmartVL,这是一种统一的自适应推理框架, 在不同的全局预算和输入内容下,联合控制 MLLM 中的视觉 token 使用和 LLM 计算。 通过将视觉侧的 token 控制器与 LLM 侧的计算控制器耦合, 利用共享的预算编码和可微延迟估计器,SmartVL 学习了跨不同计算维度的内容感知分配策略。 在多个基准上的大量实验表明,这种联合调度比先前的自适应基线实现了更强的准确率-效率权衡。
未来工作。我们的延迟估计器以预填充阶段的 FLOPs 作为主要推理成本;将此自适应路由扩展到内存受限的解码阶段仍待解决。我们的架构路由与权重量化是正交的,结合两者可能会产生叠加的收益。最后,将 FLOPs 的减少转化为实际时钟时间的改进,需要将稀疏执行掩码与专用硬件内核相结合。
致谢。本材料部分基于由美国国家科学基金会资助的工作,资助编号为 CNS-2333487/2333491(CPS Frontier)、CNS-2146449(NSF CAREER)和 IIS-2442739(NSF CAREER),以及来自 Google 的捐赠。本材料中表达的任何观点、发现、结论或建议均为作者的观点,不一定反映赞助方的观点。我们要感谢审稿人和领域主席的建设性反馈,这些反馈有助于改进这项工作。
第 16 页
16 P. Wang 等
参考文献
1. Bai, J., Bai, S., Yang, S., Wang, S., Tan, S., Wang, P., Lin, J., Zhou, C., Zhou, J.: Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond. arXiv preprint arXiv:2308.12966 (2023) 2. Bai, S., Cai, Y., Chen, R., Chen, K., Chen, X., Cheng, Z., Deng, L., Ding, W., Gao, C., Ge, C., et al.: Qwen3-VL technical report. arXiv preprint arXiv:2511.21631 (2025) 3. Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., Song, S., Dang, K., Wang, P., Wang, S., Tang, J., Zhong, H., et al.: Qwen2.5-VL technical report. arXiv preprint arXiv:2502.13923 (2025) 4. Chen, L., Zhao, H., Liu, T., Bai, S., Lin, J., Zhou, C., Chang, B.: An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision- language models. In: ECCV (2024) 5. Chu, X., Qiao, L., Lin, X., Xu, S., Yang, Y., Hu, Y., Wei, F., Zhang, X., Zhang, B., Wei, X., et al.: MobileVLM: A fast, strong and open vision language assistant for mobile devices. arXiv preprint arXiv:2312.16886 (2023) 6. Chu, X., Qiao, L., Zhang, X., Xu, S., Wei, F., Yang, Y., Sun, X., Hu, Y., Lin, X., Zhang, B., et al.: MobileVLM V2: Faster and stronger baseline for vision language model. arXiv preprint arXiv:2402.03766 (2024) 7. Dai, W., Li, J., Li, D., Tiong, A., Zhao, J., Wang, W., Li, B., Fung, P.N., Hoi, S.: Instructblip: Towards general-purpose vision-language models with instruction tuning. In: NeurIPS (2023) 8. Deitke, M., Clark, C., Lee, S., Tripathi, R., Yang, Y., Park, J.S., Salehi, M., Muen- nighoff, N., Lo, K., Soldaini, L., et al.: Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models. In: CVPR (2025) 9. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L.: QLORA: Efficient fine- tuning of quantized LLMs. In: NeurIPS (2023) 10. Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In: CVPR (2017) 11. Gurari, D., Li, Q., Stangl, A.J., Guo, A., Lin, C., Grauman, K., Luo, J., Bigham, J.P.: Vizwiz grand challenge: Answering visual questions from blind people. In: CVPR (2018) 12. Huang, K., Zou, H., Xi, Y., Wang, B., Xie, Z., Yu, L.: IVTP: Instruction-guided visual token pruning for large vision-language models. In: ECCV (2024) 13. Huang, Y., Wang, Z., Yuan, Z., Ding, Y., Gong, R., Guo, J., Liu, X., Zhang, J.: MoDES: Accelerating mixture-of-experts multimodal large language models via dynamic expert skipping. In: CVPR (2026) 14. Hudson, D.A., Manning, C.D.: GQA: A new dataset for real-world visual reasoning and compositional question answering. In: CVPR (2019) 15. Jang, E., Gu, S., Poole, B.: Categorical reparameterization with gumbel-softmax. In: ICLR (2017) 16. Javaheripi, M., Bubeck, S., Abdin, M., Aneja, J., Bubeck, S., Mendes, C.C.T., Chen, W., Del Giorno, A., Eldan, R., Gopi, S., et al.: Phi-2: The surprising power of small language models. Microsoft Research Blog (2023) 17. Jia, C., Yang, Y., Xia, Y., Chen, Y.T., Parekh, Z., Pham, H., Le, Q., Sung, Y.H., Li, Z., Duerig, T.: Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML (2021)
第 17 页
少看,快想 17
18. Li, J., Li, D., Savarese, S., Hoi, S.: BLIP-2: Bootstrapping language-image pre- training with frozen image encoders and large language models. In: ICML (2023) 19. Li, Y., Du, Y., Zhou, K., Wang, J., Zhao, W.X., Wen, J.R.: Evaluating object hallucination in large vision-language models. In: EMNLP (2023) 20. Lin, B., Tang, Z., Ye, Y., Huang, J., Zhang, J., Pang, Y., Jin, P., Ning, M., Luo, J., Yuan, L.: MoE-LLaVA: Mixture of experts for large vision-language models. IEEE Transactions on Multimedia (2026) 21. Lin, Z., Lin, M., Lin, L., Ji, R.: Boosting multimodal large language models with visual tokens withdrawal for rapid inference. In: AAAI (2025) 22. Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tuning. In: CVPR (2024) 23. Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning. In: NeurIPS (2023), LLaVA: Large Language and Vision Assistant 24. Liu, Y., Duan, H., Zhang, Y., Li, B., Zhang, S., Zhao, W., Yuan, Y., Wang, J., He, C., Liu, Z., et al.: MMBench: Is your multi-modal model an all-around player? In: ECCV (2024) 25. Lu, P., Mishra, S., Xia, T., Qiu, L., Chang, K.W., Zhu, S.C., Tafjord, O., Clark, P., Kalyan, A.: Learn to explain: Multimodal reasoning via thought chains for science question answering. In: NeurIPS (2022) 26. Maddison, C., Mnih, A., Teh, Y.: The concrete distribution: A continuous relax- ation of discrete random variables. In: ICLR (2017) 27. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.: Learning transferable visual models from natural language supervision. In: ICML (2021) 28. Shang, Y., Cai, M., Xu, B., Lee, Y.J., Yan, Y.: LLaVA-PruMerge: Adaptive token reduction for efficient large multimodal models. In: ICCV (2025) 29. Shu, F., Liao, Y., Zhang, L., Zhuo, L., Xu, C., Zhang, G., Shi, H., Chan, L., Yu, Z., He, W., et al.: LLaVA-MoD: Making llava tiny via moe-knowledge distillation. In: ICLR (2025) 30. Singh, A., Natarajan, V., Shah, M., Jiang, Y., Chen, X., Batra, D., Parikh, D., Rohrbach, M.: Towards vqa models that can read. In: CVPR (2019) 31. Su, J., Ahmed, M., Lu, Y., Pan, S., Bo, W., Liu, Y.: Roformer: Enhanced trans- former with rotary position embedding. Neurocomputing (2024) 32. Tian, X., Gu, J., Li, B., Liu, Y., Wang, Y., Zhao, Z., Zhan, K., Jia, P., Lang, X., Zhao, H.: DriveVLM: The convergence of autonomous driving and large vision- language models. In: Conference on Robot Learning (2025) 33. Vasu, P.K.A., Faghri, F., Li, C.L., Koc, C., True, N., Antony, A., Santhanam, G., Gabriel, J., Grasch, P., Tuzel, O., Pouransari, H.: FastVLM: Efficient vision encoding for vision language models. In: CVPR (2025) 34. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, Ł., Polosukhin, I.: Attention is all you need. In: NeurIPS (2017) 35. Wang, C., Wang, Z., Xu, X., Tang, Y., Zhou, J., Lu, J.: QuantVLM: Post-training quantization for efficient vision–language models. In: NeurIPS (2024) 36. Wang, P., Bai, S., Tan, S., Wang, S., Fan, Z., Bai, J., Chen, K., Liu, X., Wang, J., Ge, W., et al.: Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution. arXiv preprint arXiv:2409.12191 (2024) 37. Xu, Z., Nguyen, K.D., Mukherjee, P., Bagchi, S., Chaterji, S., Liang, Y., Li, Y.: Learning to inference adaptively for multimodal large language models. In: ICCV (2025) 38. Yuan, Z., Li, Z., Huang, W., Ye, Y., Sun, L.: TinyGPT-V: Efficient multimodal large language model via small backbones. arXiv preprint arXiv:2312.16862 (2023)
第 18 页
18 P. Wang 等
39. Zhang, H., Li, X., Bing, L.: Video-LLaMA: An instruction-tuned audio-visual lan- guage model for video understanding. In: EMNLP Demo Track (2023) 40. Zhang, J., Huang, J., Jin, S., Lu, S.: Vision-language models for vision tasks: A survey. IEEE TPAMI (2024) 41. Zhang, K., Li, B., Zhang, P., Pu, F., Cahyono, J.A., Hu, K., Liu, S., Zhang, Y., Yang, J., Li, C., et al.: LMMs-Eval: Reality check on the evaluation of large mul- timodal models. In: Findings of the Association for Computational Linguistics: NAACL 2025 (2025) 42. Zhong, Y., Liu, Z., Li, Y., Wang, L.: AIM: Adaptive inference of multi-modal llms via token merging and pruning. In: ICCV (2025) 43. Zhou, B., Hu, Y., Weng, X., Jia, J., Luo, J., Liu, X., Wu, J., Huang, L.: TinyLLaVA: A framework of small-scale large multimodal models. arXiv preprint arXiv:2402.14289 (2024) 44. Zhu, D., Chen, J., Shen, X., Li, X., Elhoseiny, M.: MiniGPT-4: Enhancing vision- language understanding with advanced large language models. In: ICLR (2024) 45. Zhu, Y., Zhu, M., Liu, N., Xu, Z., Peng, Y.: LLaVA-Phi: Efficient multi-modal assistant with small language model. In: EMCLR (2024)