三分钟导读:该研究通过系统性的边缘设备能耗分析发现,VLM推理的能耗主要由自回归解码阶段决定,输出长度是能耗的主导因素,而视觉令牌剪枝的节能效果远不如控制输出长度。
英文题目:Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference
论文出处:arXiv 每日论文精选 · arXiv:2607.09520
原始论文:PDF / 论文页面
对应视频标题:看见免费,说话昂贵:揭示边缘VLM推理的真实能耗瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
现有VLM效率优化工作主要聚焦于减少视觉令牌,隐含假设视觉处理是主要能耗来源,但缺乏对边缘设备上多模态推理能耗的系统性测量和归因。
核心创新
- 发现平均推理功率是模型固有常数(Power Fingerprint),对输入分辨率、图像复杂度和提示词类型不敏感(变异系数<5%)。
- 揭示解码阶段能耗占比高达86-97%,每个输出令牌的能耗是输入令牌的11-39倍,源于计算密集与内存带宽受限的不对称性。
- 证明视觉令牌剪枝的节能上限极低(最多节省10%),而控制输出长度可节省高达97%的能耗。
- 提出跨模型的通用能耗预测器,仅需模型大小、输入/输出令牌数即可解释98.6%的能耗方差。
方法概览
在NVIDIA RTX 3070和Jetson Orin NX上对5个VLM模型进行系统性能耗画像,分析输入分辨率、图像复杂度、提示词类型对平均功率和推理时间的影响,并建立线性能耗预测模型。
逐图理解论文
方法:系统性能耗画像

我们在NVIDIA RTX 3070和Jetson Orin NX上,对InternVL3、Qwen2-VL、Qwen2.5-VL、Gemma-3等5个VLM模型进行系统性能耗画像。实验改变输入分辨率、图像复杂度及提示词类型,测量每推理平均功率、预填充和解码阶段的时间与能耗,并建立线性能耗预测模型。
创新一:功率指纹的不变性

研究发现,平均推理功率是模型固有常数,即Power Fingerprint。它对输入分辨率、图像复杂度和提示词类型不敏感,变异系数低于5%。这意味着能耗差异完全由推理时间决定,而非功率波动。这一发现简化了能耗建模,使其仅依赖于模型大小和令牌数量。
创新二:解码阶段的能耗主导

VLM推理分为预填充和解码两个阶段。数据显示,解码阶段能耗占比高达86%至97%。每个输出令牌的能耗是输入令牌的11至39倍。这源于架构不对称性:解码阶段需为每个令牌进行全权重读取,而预填充可并行处理所有输入令牌,分摊了成本。
实验:不同硬件上的能耗分解

在Jetson Orin NX上,对于固定视觉令牌的InternVL3-1B,解码能耗占比87%至91%。对于动态视觉令牌的Qwen2.5-VL-3B,预填充能耗随分辨率增加而上升,但在常用分辨率下,解码仍占72%。这证实了无论硬件如何,解码阶段都是能耗的主要贡献者。
创新三:剪枝 vs 输出控制

视觉令牌剪枝的节能上限极低,最多节省10%能耗。相比之下,控制输出长度可节省高达97%的能耗。对于7B和8B模型,完全移除视觉令牌仅节省3%至4%,而简短回答提示可减少96%至97%能耗。输出长度控制比视觉令牌剪枝有效2至24倍。
实验与关键结果
- 在RTX 3070和Jetson Orin NX上测试InternVL3、Qwen2-VL、Qwen2.5-VL、Gemma-3等5个模型。
- 改变输入分辨率(224×224至896×896)、图像内容复杂度(1-16个物体)、提示词类型(详细描述vs简短回答)。
- 测量每推理平均功率、预填充(Prefill)和解码(Decode)阶段的时间与能耗。
- 通过线性回归拟合延迟模型和能耗预测模型。
- 解码能耗占比86-97%(第 1 页)
- 每个输出令牌成本是输入令牌的11-39倍(第 1 页)
- 平均功率变异系数<5%(第 4 页)
- 剪枝所有视觉令牌最多节省10%能耗(第 7 页)
- 控制输出长度最多节省97%能耗(第 7 页)
- 通用预测器R²=0.986(第 7 页)
阅读时需要注意
- 研究主要基于llama.cpp推理服务器,不同推理引擎可能表现不同。
- 量化模型(Q4/Q8)的结果可能不完全适用于全精度模型。
- 视觉令牌剪枝的上限分析假设极端情况(移除100%视觉令牌),实际方法难以达到。
- 不要仅通过减少视觉令牌来优化能耗,应优先控制输出长度。
- 动态视觉令牌模型在高分辨率下预填充能耗显著增加,需注意分辨率陷阱。
- 平均功率恒定意味着能耗差异完全由推理时间决定,而非功率波动。
关联工作
- MobileVLM, FastVLM, SmolVLM:现有边缘VLM效率工作,主要优化视觉令牌或模型大小。(第 2 页)
- LLM能耗画像研究:针对纯文本LLM的能耗分析,未扩展至多模态设置。(第 2 页)
- 视觉令牌剪枝工作:基于计算成本优化视觉令牌,假设视觉处理是主要能耗。(第 2 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
看见是免费的,说话则不然:揭示边缘 VLM 推理中的真正能量瓶颈
詹俊飞 沈浩勋 郭明刚 电气与系统工程系 电气与系统工程系 电气与系统工程系 宾夕法尼亚大学 宾夕法尼亚大学 宾夕法尼亚大学 美国宾夕法尼亚州费城 美国宾夕法尼亚州费城 美国宾夕法尼亚州费城 zjf2024@engineering.upenn.edu haoxun@engineering.upenn.edu gmingang@engineering.upenn.edu
黄子轩 何腾娇 中国科学院深圳先进技术研究院 信息科学与技术学院 暨南大学 中国深圳 中国广州 zx.huang5@siat.ac.cn htj2018@jnu.edu.cn
摘要 预填充 解码(生成) 385.3 J Gemma-34B 16.8x 视觉语言模型(VLMs)是具身智能的感知骨干,但其在边缘硬件上的能量足迹仍 400
Qwen2.5-VL 3B 12.2x 鲜为人知。现有的效率工作主要集中在减少视觉令牌上,隐含地将视觉处理视为 (焦耳) 3503002026 成本较低,而将“说话”视为主要成本。我们颠覆了这一隐含假设,通过对设备内 250 解码 主导 97% 的 总能量 Qwen2-VL2B 39.0x 200 86 视觉处理进行隐式处理,从而隐含地认为视觉处理成本较低,而“说话”成本较高。 94% 149.2 能耗消耗 150 J InternVL3 17.5x “说话” 2B 11 39× 更多 107.4 J 主导 能量 成本。我们 颠覆了 这一隐含假设,通过 100 比 “看见” 80.4 J 能量 88% InternVL3 97% 首次系统地分析设备内 VLM 推理的能量,涵盖三个架构家族中的五个模型, 50 34.4 J 1B 11.2x 92%
0 10 20 30 40 跨越五个模型,涵盖三个架构家族, 0 InternVL386% InternVL3 Qwen2-VL Qwen2.5-VL Gemma-310 1B
2B 2B 3B 4B Cost Ratio (Decode / Prefill) 四种输入分辨率,以及两种硬件平台(NVIDIA RTX (a) Energy Decomposition (b) Per-token Cost Ratio 3070 和 Jetson Orin NX)。我们的分析得出了三个发现。首先, 平均推理功率是一个模型固有的常数,不随 Figure 1: Energy anatomy of VLM inference on the RTX 3070 输入分辨率、图像复杂度和提示类型而变化,在所有条件下变化幅度 at 448×448. (a) Decode dominates at 86–97%. (b) Each output 小于 5%。这意味着,所有输入之间的能量变化必然源于推理[cs.CV] 时间的变化,而非功耗的变化。其次,由于 预填充(Prefill)和解码(Decode)阶段之间存在的计算瓶颈和内存瓶颈不对称性, how much it says. 每个输出令牌所需的挂钟时间(wall-clock time)是每个输入令牌的 11 到 39 倍, 使得输出令牌数量成为延迟和能量的主要驱动因素。第三,图像复杂度,即 由图像中的物体数量衡量,在相同分辨率下会导致高达 4.1 倍的能量 CCS Concepts 差异。这种差异并非源于视觉处理成本的增加,而是源于输出 长度的差异。这些发现揭示了视觉令牌剪枝(Visual Token Pruning)的根本局限性:即使移除所有视觉令牌,对于固定令牌数量的模型而言,最多也只能节省总能量的 10%。在参数量从 10 亿到 80 亿的模型范围内,控制输出长度最多可节省总能量的 97%,且随着模型规模的增大,解码(Decode)阶段的能量主导地位愈发显著。简而言之,真正的能量 bottleneck in edge VLM inference is not what the model sees, but 瓶颈不在于模型看到了什么,而在于模型输出了多少。 • Computer systems organization →Embedded and cyber- length. These findings expose a fundamental limitation of visual physical systems; • Computing methodologies →Machine token pruning: even removing all visual tokens saves at most 10% learning; • Hardware →Power and energy. of total energy for fixed-token models. Across models spanning 1 billion to 8 billion parameters, controlling output length saves up to 97% of total energy, with the energy dominance of decoding Keywords growing stronger at larger model scale. In short, the true energy Vision-Language Models, Energy Profiling, Edge Inference, On- bottleneck in edge VLM inference is not what the model sees, but Device AI, Embodied AI, Power Measurement how much it says.
Permission to make digital or hard copies of all or part of this work for personal orarXiv:2607.09520v1 classroom use is granted without fee provided that copies are not made or distributed for profit or commercial advantage and that copies bear this notice and the full citation on the first page. Copyrights for components of this work owned by others than the ACM Reference Format: author(s) must be honored. Abstracting with credit is permitted. To copy otherwise, or Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, and Tengjiao republish, to post on servers or to redistribute to lists, requires prior specific permission He. 2026. Seeing is Free, Speaking is Not: Uncovering the True Energy and/or a fee. Request permissions from permissions@acm.org. Bottleneck in Edge VLM Inference. In Proceedings of the 34th ACM Inter- MM ’26, Rio de Janeiro, Brazil national Conference on Multimedia (MM ’26), November 10–14, 2026, Rio de © 2026 Copyright held by the owner/author(s). Publication rights licensed to ACM. ACM ISBN XXX-X-XXXX-XXXX-X/26/10 Janeiro, Brazil. ACM, New York, NY, USA, 10 pages. https://doi.org/XX. https://doi.org/XX.XXXX/XXXXXXX.XXXXXXX XXXX/XXXXXXX.XXXXXXX
第 2 页
MM ’26, 2026年11月10–14日,巴西里约热内卢 Junfei Zhan 等人,Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, 和 Tengjiao He
1 引言 能量变量。在所有模型中,输出令牌数量几乎完美地预测了每张图像的能量消耗,而图像复杂度会通过其对输出长度的影响,在相同分辨率下导致高达 4.1 倍的能量差异。与此同时,输入分辨率对能量的影响相对较小:动态令牌架构(如 Qwen2-VL [6, 30])从 224×224 增加到 896×896 时,能量增加 8% 至 24%;而固定令牌架构(如 Gemma-3 [15] 和 InternVL3 [38])则几乎保持不变。这些发现表明,设备端 VLM 推理的真正能量瓶颈不在于模型“看到”什么,而在于它“说出”多少。具体而言,我们的贡献如下:
具身智能代理(Embodied AI agents)正越来越多地部署在机器人操作和无人机检查等现实世界任务中,这要求实时视觉推理和精确的动作执行。视觉-语言-动作(VLA)范式 [23] 目前通过采用视觉语言模型(VLM)作为中央处理单元,主导了这一领域。RT-2 [8] 和 PaLM-E [13] 等关键里程碑展示了跨模态知识转移的强大能力,而 $\pi_0$ [7] 和 OpenVLA [20] 等近期工作则表明,即使是 7B 参数的 VLM 主干网络,其性能也能超越 55B 参数的 RT-2-X,高出 16.5%,这表明紧凑型 VLM 已经可以作为具身代理的有效核心。
• 功率是模型的指纹。我们表明,平均推理功耗是一个模型内在常数,不随输入分辨率、图像复杂度和提示类型的变化而变化,在所有条件下变化幅度小于 5%。这将能量分析简化为理解什么决定了推理时间。
部署这些具身代理需要在边缘设备(如 NVIDIA Jetson 模块、移动 SoC 和 AR 眼镜的嵌入式 GPU)上直接运行 VLM 推理,因为严格的延迟、连接性和隐私约束使得云卸载往往不切实际 [1]。为了实现设备端推理,社区开发了一系列用于边缘设备的高效 VLM。例如,MobileVLM [10] 在移动 SoC 上实现了 21.5 令牌/秒的速度,而 FastVLM [29] 相比 LLaVA-OneVision,在首令牌时间上实现了 85 倍的加速。SmolVLM [24] 进一步将模型大小减少到 2.56 亿参数,仅需不到 1 GB 的 GPU 内存。然而,即使是这些高效模型也必须在严格的硬件预算内运行。边缘电池通常仅提供 40 至 100 Wh 的能量,而单次 VLM 查询可能消耗 50 至 500 焦耳 [5]。随着连续感知-动作循环中推理查询的积累,总能耗可能在几小时内耗尽电池。因此,能耗不仅仅是次要的优化目标,而是决定具身代理运行能力的硬性约束。
• 能量分解。我们将推理能量分解为预填充(prefill)和解码(decode)阶段,并表明自回归解码占总能量的 86% 至 97%,这是由两个阶段之间计算密集型和内存密集型不对称性驱动的。
• 视觉令牌剪枝上限。我们推导了一个理论上限,表明即使移除所有视觉令牌,对于固定令牌模型而言,最多也只能节省总能量的 10%,而控制输出长度最多可节省 97%。
• 跨模型能量预测器。我们表明,一个具有五个特征(即模型大小、输入令牌数量、输出令牌数量和两个交互项)的线性模型,无需针对每个模型进行校准,即可解释所有配置下 98.6% 的能量方差,验证了 VLM 推理能量是低维的且由架构决定的。
尽管设备端 VLM 的能效日益重要,但尚无现有工作系统地测量边缘硬件上多模态 VLM 推理的能耗。虽然针对纯文本大型语言模型(LLM)的能量分析已被研究 [16, 17, 33],但这些工作并未扩展到多模态场景,导致视觉编码的能量影响尚未被表征。将这些方法扩展到 VLM 并非易事,因为多模态推理交织了具有不同计算特性的视觉编码、预填充和解码阶段,使得难以将能量归因于各个阶段 [26]。在没有此类测量的情况下,现有的 VLM 效率工作 [9, 32, 34] 仅基于计算成本优化视觉令牌减少,隐含地假设视觉令牌处理是主要的能量成本。这一假设从未得到实证验证。如果该假设不成立,那么优化视觉令牌可能带来的节能效果远低于预期。
2 预备知识:边缘设备上的 VLM 推理
我们回顾 VLM 的推理流程,以建立本文 throughout 使用的术语和计算阶段(图 2)。
2.1 输入编码与视觉令牌策略
VLM 接收一张高度为 $H$、宽度为 $W$ 的图像以及一段文本提示。在视觉侧,视觉编码器(通常是视觉 Transformer,ViT [12])将输入图像划分为固定大小的 $p \times p$ 像素块,并将每个块映射为嵌入向量。模态投影器(mm_proj,通常是线性层或浅层 MLP)随后将这些嵌入映射到语言模型的令牌空间,产生 $N_{vis}$ 个视觉令牌。在文本侧,子词分词器将提示转换为 $N_{text}$ 个文本令牌,每个令牌映射为 $d_{model}$ 维的嵌入。
视觉令牌的数量 $N_{vis}$ 取决于模型的视觉令牌策略,该策略定义了输入分辨率如何映射到令牌数量。我们在当代架构中区分两种策略。第一种是固定令牌架构。InternVL3 [38] 和 Gemma-3 [15] 等模型在编码前将所有图像调整大小至预定义的内部分辨率,无论输入分辨率如何,都会产生恒定数量的视觉令牌:
$$ N_{vis} = \left( \frac{R_{internal}}{p} \right)^2 \quad (1) $$
我们直接测试了视觉令牌处理是多模态 VLM 推理主要能量负担这一隐含假设,问道:在设备端 VLM 推理中,焦耳(能量单位)去了哪里,这种理解如何使能量感知的部署成为可能?通过对五个 VLM 在三个架构家族、四种输入分辨率和两个硬件平台(NVIDIA RTX 3070 和 Jetson Orin NX)上进行系统性能量分析,我们发现了一个反直觉的结果:看见是免费的,说话不是。如图 1 所示,每个输出令牌的能量成本是每个输入令牌(包括视觉令牌)的 11 到 39 倍,使得输出长度成为主导因素。
第 3 页
看见是免费的,说话却不是:揭示边缘 VLM 推理中的真正能耗瓶颈 MM ’26,2026年11月10–14日,巴西里约热内卢
输入 编码 拼接 ▲ LLM 推理 输出 预填充阶段 解码阶段
视觉编码 高 计算密集型:对所有 视觉编码器 mm_proj 输入令牌进行批处理 (ViT) 线性/MLP 负载 𝑁𝑖nput令牌 内存密集型:每个令牌读取完整权重 PradoThis isMonathe Lisa, a ● Single forward pass ● Autoregressive generation 输入 ● All tokens in 图像 视觉令牌 N输入 parallel ● One forward pass per token contemporary (H×W×3) 计算 复制 … ● Builds KV缓存 ● Reuses KV缓存 + 文本编码 低 描述 分词器 令牌 文本 (BPE / 嵌入 this × N输入 × N输出 (通常 ≫ 预填充) 输出 文本 令牌 ▶ WordPiece) (查找 表) image! 令牌) (N输出 t = 0 t_end t₁ 推理时间 Ntxt × dmodel [5, 182, 39, …] 形状: 输入 提示 令牌 ID
图 2:VLM 推理流水线。输入图像和文本提示分别被编码为视觉令牌和文本令牌,拼接成统一序列,并由语言模型分两个阶段处理:首先是并行的预填充,然后是顺序的自回归解码。
其中 𝑅internal 是固定的内部分辨率,𝑝 是 ViT 的补丁大小。例如,InternVL3 使用 490 像素的内部分辨率,补丁大小为 14,产生 (490/14)² = 1,225 个补丁嵌入,这些嵌入通过像素洗牌投影器下采样为 265 个令牌。这意味着,无论原始图像是 224×224 还是 896×896,视觉编码器产生的令牌数量始终相同,额外的分辨率信息在调整大小时被丢弃。
第二种是动态分辨率架构。诸如 Qwen2-VL [30] 和 Qwen2.5-VL [6] 等模型在其原生分辨率或接近原生分辨率下处理图像,因此 𝑁vis 随输入图像面积缩放,可以近似为: 𝐻 𝑊 𝑁vis = × , (2) 𝑝· 𝑠 𝑝· 𝑠 其中 𝑠 是一个空间合并因子,它在将补丁输入语言模型之前将相邻的补丁组合成一个令牌。对于 Qwen2-VL,𝑠= 2,意味着每 2 × 2 的补丁块被合并为一个视觉令牌。实际上,𝑁vis 的范围从 224×224 时的 73 个令牌到 896×896 时的超过 1,000 个令牌。这种依赖于分辨率的缩放对推理成本有直接影响,我们在第 4 节中进行了量化。
2.2 两阶段 LLM 推理 视觉和文本令牌序列与任何系统提示令牌 𝑁sys 拼接,形成长度为 𝑁in = 𝑁sys + 𝑁vis + 𝑁text 的统一输入序列。语言模型分两个计算阶段处理此序列 [26]。
在预填充期间,所有 𝑁in 令牌在一个并行前向传递中通过 Transformer。因为所有位置都是预先已知的,计算在整个输入序列上执行大型矩阵乘法,实现高算术强度(每字节内存流量的 FLOPs),从而完全饱和计算资源。
表 1:本研究中的模型概况。“固定”模型无论输入分辨率如何,都产生恒定的视觉令牌数量;“动态”模型随输入面积缩放。令牌数量如推理服务器报告,包括图像分隔符。 模型 视觉编码器 参数量 量化 令牌策略 视觉令牌 InternVL3-1B InternViT 1B Q8_0 固定 265 / 265 / 265 / 265 InternVL3-2B InternViT 2B Q4_K_M 固定 265 / 265 / 265 / 265 Qwen2-VL-2B Qwen-ViT 2B Q4_K_M 动态 73 / 265 / 585 / 1033 Qwen2.5-VL-3BGemma-3-4B Qwen-ViTSigLIP 3B4B Q4_K_MQ4_K_M 动态固定 73265/ /265265/ /585265/ /1033265
当模型发出结束序列令牌或达到最大输出长度时,推理结束。总推理时间因此分解为: 𝑡= 𝑡prefill(𝑁in) + 𝑡decode(𝑁out), (3) 其中解码的每令牌成本远高于预填充,这是由于这种计算密集型和内存密集型的二分法,我们在第 4 节中对此进行了量化。
3 功率是模型的指纹 我们首先探讨是什么驱动了单次 VLM 推理的能耗成本。单次推理的总能量 𝐸 是两个量的乘积:平均功率 ¯𝑃 和推理时间 𝑡,即 𝐸= ¯𝑃× 𝑡。我们首先通过测量每次推理的平均功率来调查功率项,定义为单次推理运行的总能量除以其挂钟持续时间。
我们在两个边缘硬件平台上进行实验:NVIDIA RTX 3070 Laptop GPU(8 GB VRAM,频率锁定在 1500 MHz)和 NVIDIA Jetson Orin NX(15 W 功率模式,通过 jetson_clocks 锁定时钟)。所有模型均通过 llama-server (llama.cpp) 提供,使用贪婪解码(𝑇=0)。每次推理
GPU 的计算单元。预填充(Prefill)阶段填充键值(KV)缓存,该缓存存储所有输入令牌在解码期间复用的中间表示。
在解码(Decode)阶段,输出令牌以自回归循环的方式一次生成一个。在每一步中,模型从内存中读取全部权重,但仅对单个令牌执行计算,导致算术强度较低,其瓶颈在于内存带宽而非计算能力。新生成的令牌被追加到 KV 缓存中,该过程重复进行,直到生成完成。
正如表 1 所示,我们对五个视觉语言模型(VLM)进行了分析,这些模型涵盖三种架构系列,参数量在 1B 至 4B 之间,并采用固定令牌和动态分辨率的视觉令牌策略。
我们系统地变化了从业者可能预期会影响功耗的三个因素:输入分辨率、图像内容复杂度和任务提示。令人惊讶的是,这些因素均无显著影响。
平均功耗是通过在 100 毫秒的时间间隔内收集的功耗样本来计算的:在笔记本电脑上通过 HWiNFO64 Pro(系统总功耗)采集,在 Jetson 上通过板载 INA3221 传感器(VDD_IN 轨)采集。
第 4 页
MM ’26, 2026年11月10–14日,巴西里约热内卢 Junfei Zhan 等人,Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, 和 Tengjiao He
100 分辨率 224² (CV=0.6%) 90.5W 90 3.3 功耗与提示词无关 448² 672² 90 (CV=4.1%) 76.8W (W) 我们 测试 任务提示词 是否 影响 功耗。 由于 提示词 896²(W) 71.4W 80 65.1W (CV=3.7%) 80 (CV=4.9%) 控制 输出 长度 和 因此 预填充 与 功耗功耗 70 70 VLM 模型 解码 计算,我们 设计 两个 提示词 以 引出 最大 52.4W 线性 趋势 InternVL3-1B 60 (CV=3.1%) 60平均 平均 不同的 输出 长度 同时 保持 输入 图像 相同。 InternVL3-2B Qwen2-VL-2B 50 Qwen2.5-VL-3B 在相同的 40 张 448² 图像上,我们比较:(I) 描述:“描述 50 Gemma-3-4B 40 InternVL3 InternVL3 Qwen2 Qwen2.5 Gemma 1B 2B VL VL 3-4B 1B 2B 3B 4B 这张图片。”这个开放式提示词会引出详细的描述(InternVL3-1B 平均 2B 3B 模型参数量 (B) 398 输出令牌)。(II) 简短:“这张图片中的主要 (a) 功耗与分辨率的关系 (b) 功耗与模型大小的关系 物体是什么?用一个词回答。”这个受限提示词 在预填充后几乎立即终止(平均 3 个输出令牌, 图 3:笔记本电脑 GPU 上每次推理的平均功耗 包括 EOS 令牌)。 (RTX 3070,锁定频率 1500 MHz)。 如图 4(b) 所示,尽管输出长度存在约 100 倍的差异, 但两种提示词下的每次推理平均功耗几乎没有区别: 3.1 功耗与分辨率无关 InternVL3-1B 为 14.6 W 与 14.8 W (CV = 1.4%),Qwen2.5-VL-3B 为 14.1 W 与 14.4 W (CV = 3.4%)。
我们首先检查输入分辨率是否影响每次推理的平均功耗。在 RTX 3070 上,表 1 中列出的五个模型中的每一个都在四种分辨率(224² 到 896²)下进行评估,每个配置使用 COCO 2017 验证图像 [21] 运行 12 次,前两次运行作为预热被丢弃。 如图 3(a) 所示,在每个模型内部,不同分辨率下的功耗分布几乎相同:InternVL3-1B 消耗 52.4 ± 1.6 W,Qwen2.5-VL-3B 消耗 76.8 ± 3.2 W,Gemma-3-4B 消耗 90.5 ± 0.5 W,每个模型的变异系数均低于 5%。这对于固定令牌模型和动态分辨率模型均成立(见表 1)。值得注意的是,Qwen2.5-VL-3B 从 224² 到 896² 视觉令牌数量增加了 14 倍,但平均功耗没有产生可测量的变化。 图 3(b) 进一步揭示,这种与分辨率无关的功耗随模型大小线性缩放。对所有五个模型进行线性回归得出: ¯𝑃= 12.1𝑆+ 42.2 (𝑅2 = 0.918) (4) 其中 𝑆 是数十亿参数的数量。每个额外的十亿参数使每次推理的平均功耗增加约 12 W。
3.2 功耗与内容无关 分辨率无关性对于固定令牌模型来说可能是预期的,因为它们的计算图不随分辨率改变。更严格的测试是,直接影响模型“看到”什么以及如何响应的图像内容,能否调节每次推理的平均功耗。 为了测试这一点,我们构建了一个包含 40 张 COCO 2017 图像的数据集,这些图像基于注释的对象数量分为六个内容复杂度层级:T1(单个对象,场景极简)到 T6(12–16 个对象,复杂场景)。我们在笔记本电脑 GPU 上对 InternVL3-1B 和 Qwen2.5-VL-3B 进行性能分析。
3.4 启示:能量 = 功耗 × 时间 第 3.1–3.3 节确立了每次推理的平均功耗仅由模型的大小和架构决定,而与输入分辨率、图像内容或任务提示词无关。我们将这个稳定的值称为模型的功耗指纹,记为 ¯𝑃。这一发现在两个硬件平台(笔记本电脑 GPU 和嵌入式 Jetson)、跨越三个架构家族的五个模型以及广泛的输入条件下都是一致的。 根本原因在于,通过 llama.cpp 进行的边缘推理是一个顺序的、逐个令牌的过程:在预填充阶段,GPU 对所有输入令牌执行密集矩阵乘法,而在解码阶段,它一次对一个令牌执行相同的操作。在这两个阶段,GPU 都处于完全饱和状态,因此无论处理什么,瞬时功耗保持恒定。更改输入图像、分辨率或提示词会改变 GPU 运行的时间长度,但不会改变其在任何给定时刻的工作强度。 由于 ¯𝑃 对于给定的模型–硬件对实际上是恒定的,总推理能量简化为 𝐸= ¯𝑃× 𝑡,其中 𝑡 是总推理延迟。这有一个直接后果:跨输入、分辨率和图像内容的所有能量变化必须源于推理时间的变化,而不是功耗的变化。因此,“焦耳去了哪里?”这个问题就简化为“时间去了哪里?”
4 时间去了哪里? 第 3 节确立了功耗在推理过程中实际上是恒定的,从而将能量方程简化为 𝐸= ¯𝑃× 𝑡。自然随之而来的问题是:什么决定了推理时间 𝑡?在本节中,我们将推理延迟分解为其组成阶段,并表明单个因素,即输出令牌的数量,
Jetson Orin NX 在 4482 分辨率下。如图 4(a) 所示,尽管从 T1 到 T6 对象数量增加了 14 倍,尽管这些图像引发了截然不同的输出长度(平均从 95 到 482 个令牌),但每次推理的平均功率保持平稳:InternVL3-1B 为 14.6 W(CV = 1.1%),Qwen2.5-VL-3B 为 14.1 W(CV = 2.9%)。
这一结果值得注意,因为正如我们将在第 4 节中所示,这些图像消耗的能量差异高达 4 倍。然而,所有这些变化都源于推理时间的差异,而非功率的差异。
4.1 两阶段分解
正如第 2 节所回顾的,自回归 VLM 推理分为两个阶段:一个计算受限的 Prefill 阶段,它在单次并行前向传递中处理所有 $N$ 个输入令牌;以及一个内存带宽受限的 Decode 阶段,它一次生成一个输出令牌,每个令牌都需要单独的前向传递。这种架构上的二分法
第 5 页
看见是免费的,说话则不然:揭示边缘 VLM 推理中真正的能耗瓶颈 MM ’26,2026年11月10–14日,巴西里约热内卢
InternVL3-1B (Q8) Qwen2.5-VL-3B (Q4) Jetson Orin NX @ 448px Jetson Orin NX @ 448px 14.7 W 17 14.2 W InternVL3-1B (Q8) Qwen2.5-VL-3B (Q4) Jetson Orin NX @ 448px Jetson Orin NX @ 448px 17 (CV=1.4%) (CV=3.4%) 17 16 14.6 W 14.1 W 17 (CV=1.1%) (CV=2.9%) 16 16 (W) (W) 15 16 15 (W) (W) 15 Power Power Power 15 Power 14 14 14 14 Average Average Average Average 13 13 13 13 12 12 12 12 T1 T2 T3 T4 T5 T6 T1 T2 T3 T4 T5 T6 (1) (2) (3-4) (5-7) (8-11) (12-16) (1) (2) (3-4) (5-7) (8-11) (12-16) "Describe this image." "Main object? One word." "Describe this image." "Main object? One word." Content Complexity Tier (object count) Content Complexity Tier (object count) (avg 398 tokens) (avg 3 tokens) (avg 102 tokens) (avg 3 tokens)
(a) content complexity (b) prompts
Figure 4: Per-inference average power on a Jetson Orin NX (15 W mode). (a) Power across content complexity, from single-object scenes (T1) to dense multi-object scenes (T6). (b) Power across two prompts
产生了一个简单的挂钟推理时间分解: Table 2: Fitted parameters of the latency model (Equation 7) on the RTX 3070. The ratio𝛼𝑑/𝛼𝑝quantifies the decode-prefill 𝑡wall = 𝑡prefill(𝑁in) + 𝑡decode(𝑁out). (5) cost asymmetry.
因为预填充阶段一次性处理所有输入令牌,而解码阶段每个输出令牌需要一次处理,所以增加一个输入令牌和一个输出令牌的边际成本至少相差一个数量级。我们将这种不对称性形式化如下。 Model 𝛼𝑝(ms/tok) 𝛼𝑑(ms/tok) 𝛽(ms) 𝛼𝑑/𝛼𝑝 Qwen2-VL-2B 0.14 5.46 153 39× Definition 4.1 (Per-token marginal latency). Let 𝛼𝑝denote the Qwen2.5-VL-3B 0.67 8.18 143 12× marginal wall-clock cost of adding one input token to the prefill, Gemma-3-4B 0.74 12.46 50 17× and 𝛼𝑑the marginal wall-clock cost of generating one additional output token during decode: memory, producing high arithmetic intensity (FLOPs per byte trans- 𝜕𝑡prefill 𝜕𝑡decode 𝛼𝑝= , 𝛼𝑑= . (6) ferred) that saturates the compute units. During decode, each for- 𝜕𝑁in 𝜕𝑁out ward pass reads the full model weights but performs only 𝑂(1) Under these definitions, wall-clock time is well approximated by useful operations per weight element, resulting in low arithmetic the linear latency model: intensity bottlenecked by memory bandwidth. On the RTX 3070 (256 GB/s memory bandwidth, 20.3 TFLOPS FP32), the transition 𝑡wall ≈𝛼𝑝· 𝑁in + 𝛼𝑑· 𝑁out + 𝛽, (7) from compute-bound to memory-bound execution produces exactly where 𝛽captures fixed overhead (model initialization, tokenization, the order-of-magnitude cost gap we observe. sampling). The key claim of this section is that 𝛼𝑑≫𝛼𝑝, which makes 𝑁out the dominant driver of inference time. 4.3 What Determines the Time Split? The asymmetry 𝛼𝑑≫𝛼𝑝establishes that decode is inherently more 4.2 The Decode-Prefill Cost Asymmetry expensive per token, but the actual fraction of wall time spent in We estimate the parameters of Equation 7 empirically for all five each phase depends on three factors that vary across inference models on the RTX 3070. For models with dynamic visual tokeniza- instances: input resolution, image content, and prompt type. We tion (Qwen2-VL, Qwen2.5-VL), the number of input tokens 𝑁in use the Jetson Orin NX to disentangle these factors, as its inference varies across resolutions while 𝑁out varies across images, enabling server reports per-phase timings (prompt_ms and predicted_ms) direct multivariate regression. For fixed-token models (InternVL3, that enable direct measurement of the prefill-decode split. Table 3 Gemma-3), 𝑁in is constant across resolutions, so we estimate 𝛼𝑝by summarizes the results, varying one factor at a time while holding comparing the intercepts of latency-vs-𝑁out regressions between the others constant. multimodal and text-only conditions, which differ only in 𝑁in. Resolution affects prefill, not decode. For InternVL3-1B, which Table 2 reports the fitted coefficients. Across all models, the uses a fixed visual tokenizer (259 tokens at all resolutions), pre- decode-to-prefill cost ratio 𝛼𝑑/𝛼𝑝ranges from 11× to 39×, confirm- fill remains nearly constant at 1.8 s regardless of input resolution ing the architectural prediction: each decode step performs a full (CV = 8.9%), and decode dominates at 87% to 91% of total phase time. weight-reading pass for a single token, while prefill amortizes the For Qwen2.5-VL-3B, which scales visual tokens with resolution, the same pass across all input tokens simultaneously. picture is different: prefill grows from 1.6 s at 224×224 to 18.7 s at The roofline model [31] provides a hardware-level explanation 896×896, while decode time stays comparable across resolutions. for this asymmetry. During prefill, the accelerator performs 𝑂(𝑁in) This produces a resolution trap: at 896×896, prefill and decode reach multiply-accumulate operations per weight element loaded from approximate parity (55% vs. 45%), even though the model ingests
第 6 页
MM ’26, 2026年11月10–14日,巴西里约热内卢 Junfei Zhan 等人,Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, 和 Tengjiao He
表 3:在 Jetson Orin NX(15 W 模式下)上的预填充(Prefill)和解码(Decode)时间。三个因素独立变化:分辨率、图像内容和提示类型。𝜌decode 表示解码阶段占总阶段时间的比例。
| 因素 | 条件 | 𝑁vis | ¯𝑁out | 𝑡prefill (s) | 𝑡decode (s) | 𝜌decode | | :— | :— | :— | :— | :— | :— | :— | | InternVL3-1B (Q8), Describe 提示 | | | | | | | | 分辨率 | 224×224 | 265 | 271 | 1.8 | 11.8 | 0.87 | | | 448×448 | 265 | 398 | 1.8 | 18.0 | 0.91 | | | 672×672 | 265 | 371 | 1.8 | 16.6 | 0.90 | | | 896×896 | 265 | 371 | 2.0 | 17.3 | 0.90 | | 内容 | 1–2 个物体 | 265 | 323 | 1.8 | 14.4 | 0.89 | | | 3–5 个物体 | 265 | 295 | 1.9 | 13.4 | 0.88 | | | 6–10 个物体 | 265 | 392 | 1.8 | 17.5 | 0.91 | | | 11+ 个物体 | 265 | 413 | 1.9 | 19.3 | 0.91 | | 提示 | Describe | 265 | 398 | 1.8 | 18.0 | 0.91 | | | 简短回答 | 265 | 3 | 1.8 | 0.07 | 0.04 | | Qwen2.5-VL-3B (Q4), Describe 提示 | | | | | | | | 分辨率 | 224×224 | 73 | 146 | 1.6 | 23.5 | 0.94 | | | 448×448 | 265 | 102 | 6.3 | 16.6 | 0.72 | | | 672×672 | 585 | 107 | 15.8 | 17.7 | 0.53 | | | 896×896 | 1033 | 109 | 18.7 | 15.8 | 0.46 | | 内容 | 1–2 个物体 | mixed | 107 | 11.0 | 16.5 | 0.60 | | | 3–5 个物体 | mixed | 95 | 10.2 | 15.0 | 0.60 | | | 6–10 个物体 | mixed | 145 | 10.3 | 23.3 | 0.69 | | | 11+ 个物体 | mixed | 120 | 10.7 | 19.3 | 0.67 | | 提示 | Describe | 265 | 102 | 6.3 | 16.6 | 0.72 | | | 简短回答 | 265 | 3 | 5.7 | 0.2 | 0.04 |
视觉令牌数量增加 14 倍,但生成的输出令牌数量大致相同。从响应质量的角度来看,额外的预填充计算在很大程度上被浪费了。
图像内容影响解码(Decode),而非预填充(Prefill)。在固定分辨率下,不同的图像会产生截然不同的解码时间,而预填充时间保持不变。对于 InternVL3-1B,预填充时间在所有内容组中稳定在 1.8 到 1.9 秒之间,而解码时间从简单图像(3 到 5 个物体)的 13.4 秒到复杂场景(11+ 个物体)的 19.3 秒不等。这种变化完全源于更复杂的图像引发了更长的模型响应(简单图像为 295 个令牌,复杂图像为 413 个令牌),而非视觉处理成本的任何变化。Qwen2.5-VL-3B 也呈现相同模式:预填充时间在跨分辨率合并的内容组中保持恒定(10.2 到 11.0 秒),而解码时间从 15.0 秒变化到 23.3 秒。对于 InternVL3-1B,输出令牌数量与解码时间之间的皮尔逊相关系数为 𝑟= 0.985,对于 Qwen2.5-VL-3B 为 𝑟= 0.980。
提示类型直接控制输出长度。最显著的演示来自切换提示。当我们将“描述这张图片”(平均 398 个输出令牌)替换为简短回答提示“主要物体是什么?用一个词回答”(平均 3 个输出令牌)时,InternVL3-1B 的解码时间从 18.0 秒骤降至 0.07 秒,减少了 250 倍,而预填充时间保持在 1.8 秒不变。对于 Qwen2.5-VL-3B,效果同样显著:解码时间从 16.6 秒降至 0.2 秒,而预填充时间保持在 6.3 秒与 5.7 秒之间。
这三个观察结果汇聚成一个单一的结论:预填充时间由架构选择(视觉令牌策略和输入分辨率)决定,而解码时间由输出长度决定。由于 𝛼𝑑 ≫ 𝛼𝑝,只要生成非平凡的响应,输出令牌数量就是推断持续时间的决定性因素。
4.4 输出长度是主导时间驱动因素
前面的分析确立了解码(Decode)主导推断时间,且解码时间与 𝑁out 呈线性缩放。因此,推断时间主要由生成的输出令牌数量决定。对于 Jetson 上的 InternVL3-1B,在所有 116 次 Describe 推断中,输出令牌数量与挂钟时间之间的皮尔逊相关系数为 𝑟= 0.981 (𝑝< 10−20),而输出令牌数量与解码时间之间的相关系数为 𝑟= 0.985。
这一发现通过第 3 节的恒定功率结果直接与能量联系起来。由于 𝐸= ¯𝑃× 𝑡 且 ¯𝑃 近似恒定,我们可以写出:
𝐸 ≈ ¯𝑃 · (𝛼𝑑 · 𝑁out + 𝑐), (8)
其中 𝑐 吸收了预填充时间和固定开销。该方程确立了输出令牌数量作为单次推断能量的首要预测因子,并揭示出减少能量等同于减少解码时间,这又等同于控制输出长度。
那么,什么决定了 𝑁out,以及控制推断能量最有效的策略是什么?我们在下一节中解决这些问题。
5 从时间到能量
方程 8 确立了推断能量是输出令牌数量的线性函数,预填充和开销被吸收进常数中。在本节中,我们开发该结果的实践意义:我们量化预填充和解码之间的能量分配(以焦耳为单位),证明视觉令牌剪枝在减少能量方面远不如输出长度控制有效,并通过一个简单的预测模型验证这种分解。
5.1 能量分解:预填充 vs. 解码
由于功率在整个推断过程中近似恒定(第 3 节),总能量自然地分解为预填充和解码贡献:
𝐸 = { ¯𝑃 · 𝑡prefill } 𝐸prefill + { ¯𝑃 · 𝑡decode } 𝐸decode . (9)
基于第 4 节的延迟模型,我们将输出长度敏感度(Output Length Sensitivity, OLS)定义为生成一个额外输出令牌的边际能量成本:
OLS = ¯𝑃 · 𝛼𝑑 (J/token), (10)
这结合了第 3 节的功率指纹和第 4 节的每令牌解码成本。
表 4 报告了 Jetson Orin NX 上两个代表性模型的能量分配。对于 InternVL3-1B(固定视觉令牌),在所有分辨率下,解码占总能量的 87% 到 91%,OLS = 0.68 J/token。对于 Qwen2.5-VL-3B(动态视觉令牌),预填充能量比例从 224×224 时的 6% 增长到 896×896 时的 54%,反映了处理更多视觉令牌成本的增加。尽管如此,在常用的 448×448 分辨率下,解码仍占总能量的 72%。
第 7 页
看见是免费的,说话却不是:揭示边缘 VLM 推理中的真正能量瓶颈 MM ’26,2026年11月10–14日,巴西里约热内卢
表 4:Jetson Orin NX (15 W 模式) 上的能量分解。$E_{pf}$ 和 $E_{dc}$ 表示从 $\bar{P} \times t_{phase}$ 估计的预填充和解码能量 (J);$Dc\%$ 是解码占比 $E_{dc}/E_{tot}$。
| Model | Resolution | $E_{tot}$ | $E_{pf}$ | $E_{dc}$ | $Dc\%$ | | :— | :— | :— | :— | :— | :— | | InternVL3-1B | 224×224 | 192 | 25 | 166 | 87% | | | 448×448 | 291 | 27 | 264 | 91% | | | 672×672 | 263 | 26 | 236 | 90% | | | 896×896 | 274 | 28 | 245 | 90% | | Qwen2.5-VL-3B | 224×224 | 358 | 23 | 338 | 94% | | | 448×448 | 324 | 89 | 234 | 72% | | | 672×672 | 475 | 223 | 249 | 53% | | | 896×896 | 492 | 265 | 223 | 46% |
InternVL3-1B Model (MAPE) (12.4%) InternVL3-2B (16.8%) Qwen2-VL-2B (13.8%) Qwen2.5-VL-3B (10.8%) Gemma-3-4B (9.6%) Gemma-3-4B (2.5%)
(a) Per-model predictor (b) Universal predictor
图 5:RTX 3070 上预测能量与测量能量的对比 (1,680 次多模态推理)。(a) 针对每个模型独立拟合参数。(b) 使用公式 13 在所有五种架构上使用单一模型。
5.2 视觉令牌剪枝的错觉
越来越多的工作将视觉令牌减少作为高效 VLM 推理的主要策略 [9, 27, 32, 34]。这些方法通过剪枝或合并视觉令牌来减少预填充计算,并报告了 FLOPs 或延迟的节省。然而,我们的能量分解表明,这种策略存在根本性的上限:视觉令牌剪枝只能减少预填充能量,而预填充能量仅占总能量的一小部分。
我们可以不运行该方法就估算出任何视觉令牌剪枝方法的最大能量节省。令 $\eta$ 表示被移除的视觉令牌比例。预填充能量的减少最多为 $\eta \cdot E_{prefill}$,因为并非所有预填充计算都涉及视觉令牌(文本令牌和注意力开销仍然存在)。因此,在固定解码行为下,总能量节省的上限为:
$$ \Delta E \le \eta \cdot \frac{E_{prefill}}{E_{total}} \quad (11) $$
表 5 将这一界限应用于跨越 1B 到 8B 参数的四种模型,并将其与通过输出长度控制可实现的能量节省进行比较。对于 InternVL3-1B,即使移除所有视觉令牌 ($\eta=1$),最多也只能节省总能量的 10%,而将输出长度减少 50% 可节省约 45%。在更大规模下,差距进一步扩大:对于 Qwen2.5-VL-7B 和 InternVL3-8B,完全移除视觉令牌仅节省 3–4%,而简短回答提示可将能量降低 96–97%。这种模式成立的原因是,较大模型具有更高的每令牌解码成本 $\alpha_d$,这进一步将能量集中在解码阶段,并降低了预填充的相对权重。输出长度控制在降低能量方面始终比视觉令牌剪枝有效 2 到 24 倍。
提示消融实验提供了直接的实验证据。将提示从“描述这张图片”切换为简短回答提示,使 InternVL3-1B 的输出从 398 个令牌减少到 3 个令牌,将能量从 291 J 降低到 28 J (减少 90%),同时保持预填充能量不变。这证实,控制推理的输出端比优化输入端要有效得多。
5.3 能量预测
分解式 $E = \bar{P} \cdot (\alpha_p N_{in} + \alpha_d N_{out} + \beta)$ 意味着可以从少量架构参数预测能量。其中 $\bar{P}, \alpha_p, \alpha_d$ 和 $\beta$ 是从校准集拟合得到的。给定一个新输入,预测器只需要 $N_{in}$ (由架构和分辨率确定) 和 $N_{out}$ (受 max_tokens 限制)。在所有 1,680 次 RTX 3070 运行中评估,总体 MAPE 为 13.7%,$R^2 = 0.967$ (图 5a)。
通用预测器。一个更雄心勃勃的目标是在没有每模型校准的情况下预测任何模型的能量。我们使用交互特征在所有五个模型上拟合单个线性模型:
$$ \hat{E} = w_0 + w_1 \cdot S + w_2 \cdot N_{in} + w_3 \cdot N_{out} + w_4 \cdot S \cdot N_{in} + w_5 \cdot S \cdot N_{out}, \quad (13) $$
其中 $S$ 是以十亿为单位的模型参数量。交互项 $S \cdot N_{in}$ 和 $S \cdot N_{out}$ 捕捉了第 4 节中的见解,即较大的模型会产生更高的每令牌成本。该预测器在所有 1,680 次运行中实现了 MAPE = 10.3% 和 $R^2 = 0.986$,无需任何每模型拟合 (图 5b)。主导系数是 $w_5$ ($S \times N_{out} = 0.426$),证实模型大小与输出长度之间的交互是主要的能量驱动因素。
留一分辨率交叉验证显示出稳定的准确性 (MAPE 9.7% 到 12.0%),表明该预测器可以泛化到未见过的分辨率配置 (表 6)。这样一个简单模型的成功验证了我们的分解框架:VLM 推理能量是低维的,完全由模型大小、输入令牌数量和输出令牌数量决定。
5.4 部署指南
能量分析为受能量限制的 VLM 部署提供了三个可操作的指南。(i) 限制输出,而非输入。由于每个输出令牌的成本是每个输入令牌的 11 到 39 倍 (表 2),设置较低的 max_tokens 是最有效的能量控制手段。将最大输出从 256 个令牌减少到 128 个令牌,可在所有模型上节省约 40 到 50% 的能量,而将分辨率从 896×896 降低到 224×224 最多仅节省 27%,且仅适用于动态令牌模型。
(ii) 将令牌策略与部署场景匹配。如果应用需要高分辨率输入 (例如,细粒度视觉
我们通过两个具有不同泛化能力的线性预测器对此进行验证。 检查),固定令牌架构(InternVL3、Gemma-3)避免了 每模型预测器。对于每个模型,我们拟合: 动态令牌模型所特有的、依赖于分辨率的能量惩罚。 ˆ𝐸= ¯𝑃· (𝛼𝑝· 𝑁in + 𝛼𝑑· 𝑁out + 𝛽), (12) 如果分辨率固定且较低,动态令牌模型(Qwen2-VL,
第 8 页
MM ’26,2026年11月10–14日,巴西里约热内卢 Junfei Zhan 等人,Junfei Zhan,Haoxun Shen,Mingang Guo,Zixuan Huang,和 Tengjiao He
表 5:视觉令牌剪枝与输出长度控制带来的节能效果(Jetson Orin NX,Describe 提示词,448×448)。 剪枝边界假设完全移除所有视觉令牌(𝜂=1);没有任何实际方法能达到这一极限。纳入 7B 和 8B 模型是为了测试在典型边缘尺寸(1–4B)之外的泛化能力。↓ 表示能量降低。
策略 InternVL3-1B Qwen2.5-VL-3B Qwen2.5-VL-7B InternVL3-8B
移除 50% 视觉令牌 ≤5% ↓ ≤14% ↓ ≤2% ↓ ≤2% ↓ 移除 100% 视觉令牌 ≤10% ↓ ≤28% ↓ ≤4% ↓ ≤3% ↓
max_tokens 256 →128 ≈45% ↓ ≈36% ↓ ≈48% ↓ ≈48% ↓ 短答案提示词(平均 3 个令牌输出) 90% ↓ 73% ↓ 96% ↓ 97% ↓
表 6:在 RTX 3070 上针对 Qwen 2.5 变体的模型和基准测试,跨多个 Jet- 通用能量预测器的留一分辨率交叉验证。 son 平台,而 Abstreiter 等人 [1] 表明,边缘推理每令牌的 成本可比基于云的选择低多达 375 倍。 保留的分辨率 MAPE (%) 尽管取得了这些进展,但这些工作均仅研究纯文本模型。 没有任何工作扩展到多模态 VLM 推理,使得 224×224 12.0 视觉编码、视觉令牌处理以及输入模态与输出长度之间的 448×448 11.4 672×672 9.7 交互对能量的影响完全未被表征。 896×896 10.3 未表征。
平均值 10.9 6.2 VLM 中的视觉令牌效率 在降低 VLM 中视觉令牌的计算成本方面,已取得了显著进展。 Qwen2.5-VL) 可能具有竞争力,因为它们在低分辨率下拥有更少的视觉令牌 FastV [9] 在前两个 LLM 层之后剪枝 50% 的视觉令牌, at low resolution. 且精度损失可忽略不计。LLaVA- (iii) 预见基于内容的能量方差。图像内容 PruMerge [27] 利用注意力稀疏性实现了 14 到 18 倍的令牌 导致通过输出长度产生高达 4.1 倍的能量变化(InternVL3-1B 在 448×448 下为 压缩,而 PyramidDrop [32] 利用更深层次中的视觉冗余 104 到 428 J)。对于嵌入式代理或移动应用的电池预算, 将 FLOPs 减少 55%。其他方法,包括 最坏情况下的能量估计应使用 max_tokens 而不是平均输出长度。我们的 HiRED [4]、VisionZip [34]、SparseVLM [36] 和 DivPrune [2], 通用预测器(公式 13)使得无需针对每个配置进行性能分析即可实现此类估计。 引入了基于注意力或文本感知的稀疏化策略。 A comprehensive survey by Shao et al. [28] provides an overview 6 相关工作 of this rapidly growing area. 我们的工作位于三个研究线程的交叉点:边缘 LLM 推理的能量 However, these works evaluate efficiency exclusively through 分析、VLM 中的视觉令牌效率以及高效的边缘 VLM 架构。我们依次回顾 FLOPs, latency, or memory; none reports actual energy consump- 每一部分,强调没有任何先前的工作测量过边缘硬件上多模态 tion in Joules or Watts. Whether visual token reduction translates VLM 推理的能量消耗。 to proportional energy savings on edge hardware remains an open 问题。正如我们在第 5.2 节所示,答案取决于预填充和解码之间的 能量分配,这仅凭 FLOPs 无法推断。
6.1 边缘 LLM 推理的能量分析 6.3 高效的边缘 VLM 越来越多的工作表征了资源受限硬件上语言模型推理的能量消耗。 除了令牌级优化之外,研究人员还开发了专门用于设备端推理的 Husom 等人 [16] 在树莓派上使用 2 MHz 采样的硬件功率计对 28 个量化 紧凑 VLM 架构。MobileVLM [10] 将视觉令牌减少到 144 个,并在移动 SLM 进行了基准测试,报告称量化带来了高达 69% 的能量降低,并且 SoC 上实现了 21.5 个令牌/秒。FastVLM [29] 采用混合 CNN-ViT 响应长度与总能量之间的相关系数为 𝑟=0.85。Camel [33] 将 GPU 编码器以实现更快的首令牌时间,而 SmolVLM [24] 将模型大小推 频率和批大小选择公式化为 Jetson AGX Orin 上的汤普森采样 低至 256M 参数,需要少于 1 GB 的 GPU 内存。其他值得注意的努力 博弈,实现了纯文本 LLM 的能量-延迟乘积降低 12% 到 30%。Arya 包括 MiniCPM-V [35]、TinyLLaVA [37]、AndesVL [19] 和 HyperVL [22], 和 Simmhan [5] 在同一平台上对 LLM 在八种电源模式下的性能进行了 均针对移动或 NPU 平台。 分析,揭示量化可能会悖论性地增加较小模型的延迟。在组件层面, 这些工作均未提供实证能量测量,即使电池寿命被引用为主要 CLEAR [17] 解决了微秒级执行与毫秒级传感器分辨率之间的时间 动机。我们的工作通过首次对配备 GPU 的边缘硬件上的 VLM 不匹配问题,发现注意力块每 FLOPs 消耗的能量显著高于前馈层。 推理进行系统性能分析,填补了这一空白。我们表明,主要的能量 最近的工具如 EdgeProfiler [25] 和 Edge-First LM [18] 提供了分析 成本并不在于这些架构优化的视觉处理,而在于它们 largely 工具,
第 9 页
看见是免费的,说话则不然:揭示边缘 VLM 推理中的真正能耗瓶颈 MM ’26, 2026年11月10–14日,巴西里约热内卢
et al. [3] 研究了仅 CPU 的 LLM 推理的能量缩放定律, 高分辨率视觉语言模型的高效推理。在 Chung 等人 [11] 诊断了数据中心规模的推理能耗。 人工智能AAAI会议论文集,第39卷。1773–1781。 [5] Mayank Arya 和 Yogesh Simmhan。2025。理解边缘加速器上 LLM 推理的性能 两者均未对边缘 GPU 上的 VLM 能耗进行系统分析。 和功耗。在第七届并行AI与边缘系统研讨会 (PAISE) 上,与 IEEE IPDPS 联合举办。 [6] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, 等。2025。Qwen2.5-VL 技术 7 结论 报告。arXiv 预印本 arXiv:2502.13923 (2025)。 [7] Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea 这项工作首次对边缘硬件上的 VLM 推理进行了系统的能耗分析, Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 等。2025。𝜋0: 涵盖了三个架构家族中的五个模型、四种输入分辨率和两种硬件平 一种用于通用机器人控制的视觉-语言-动作流模型。在机器人科学与系统会议 (RSS) 台(NVIDIA RTX 3070 和 Jetson Orin NX)。我们的分析揭示 论文集。 了一种简单但强大的分解方法:功耗是一个模型固有常数,在所有 [8] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, 条件下变化不到 5%,推理时间主要由自回归解码主导,占总能耗 Krzysztof Choromanski, Tianli Ding, Danny Driess, 等。2023。RT-2: 视觉- 的 86% 至 97%,而能耗直接由两者的乘积得出。 语言-动作模型将网络知识迁移到机器人控制。在第7届机器人学习会议 (CoRL) 每个输出令牌比每个输入令牌多花费 11 到 39 倍的墙钟时间, 论文集。 而图像复杂度通过其对输出长度的影响,在相同分辨率下导致 [9] Liang Chen, Haozhe Zhao, Tianyu Liu, Shuai Bai, Junyang Lin, Chang Zhou, 和 高达 4.1 倍的能耗变化。VLM 推理中的主要能耗成本不是“看”, Baobao Chang。2024。第2层之后,一张图片仅值 1/2 个令牌:即插即用的 而是“说”:即使对于固定令牌模型,移除所有视觉令牌最多仅节省 大型视觉语言模型的推理加速。在欧洲计算机视觉会议 (ECCV) 论文集。19–35。 10% 的总能耗,而控制输出长度最多可节省 97%。在 7B 和 8B [10] Xiangxiang Chu, Limeng Qiao, Xinyu Zhang, Shuang Xu, Fei Wei, 等。2024。 模型上的验证证实,这种模式在更大规模下会增强。 MobileVLM V2: 更快更强的视觉语言模型基线。arXiv 预印本 arXiv:2402.03766 (2024)。 我们的核心分析集中在参数量为 1B 到 4B 的模型上,批处理 [11] Jae-Won Chung, Ruofan Wu, JeffJ. Ma, 和 Mosharaf Chowdhury。2026。 大小为 1,这是单智能体设备部署的典型运行模式。解码主导 焦耳去了哪里?诊断推理能耗。arXiv 预印本 现象在批处理或并发服务下是否持续,仍是一个未解之谜。 arXiv:2601.22076 (2026)。 展望未来,我们的发现表明,VLM 效率社区可能受益于将关注 [12] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xi- 点从推理的输入端转移到输出端。当前的视觉令牌剪枝方法 aohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg 主要针对预填充阶段,该阶段仅占总能耗的一小部分。 Heigold, Sylvain Gelly, Jakob Uszkoreit, 和 Neil Houlsby。2021。一张图片 相比之下,减少解码成本的技术,如推测解码和输出长度预测, 值 16×16 个单词:用于大规模图像识别的 Transformer。在国际学习代表 直接针对主要的能耗阶段,但目前缺乏在边缘硬件上的能耗 会议 (ICLR) 论文集。 特征描述。更广泛地说,我们的能耗分解可以作为具身 AI [13] Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, 系统中推理调度的成本模型,从而实现动态决策,例如根据 Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, 等。 剩余电池容量调整输出长度限制。一个有趣的方向是,通过 2023。PaLM-E: 一种具身多模态语言模型。在第40届国际机器学习会议 (ICML) 将输出长度与图像的结构信息内容联系起来 [14],在运行 论文集。 推理之前预测哪些输入将是高能耗的。 [14] Marc Finzi, Shikai Qiu, Yiding Jiang, Pavel Izmailov, J. Zico Kolter, 和 An- drew Gordon Wilson。2026。从熵到 Epiplexity:重新思考计算受限智能的信息。 致谢 arXiv 预印本 arXiv:2601.03220 (2026)。 [可选] 我们感谢支持本工作的匿名审稿人、同事或资助机构。 [15] Gemma Team, Aishwarya Kamath, Johan Ferret, Shreya Pathak, Nino Vieil- lard, Ramona Merhej, 等。2025。Gemma 3 技术报告。arXiv 预印本 参考文献 arXiv:2503.19786 (2025)。 [1] Maximilian Abstreiter, Sasu Tarkoma, 和 Roberto Morabito。2025。有时 [16] Erik Johannes Husom, Arda Goknil, Mustafa Astekin, Lwin Khin Shar, 等。2025。 痛苦但确实充满希望:边缘语言模型推理的可行性与权衡。ACM 嵌入式计算系统 面向边缘 AI 的可持续 LLM 推理:评估量化 LLM 的能耗 汇刊 (2025)。doi:10.1145/3788870 效率、输出准确性和推理延迟。ACM 物联网汇刊 6, 4 (2025)。 [2] Saeed Ranjbar Alvar, Gursimran Singh, Mohammad Akbari, 和 Yong Zhang。 [17] Hemang Jain, Shailender Goyal, Divyansh Pandey, 和 Karthik Vaidhyanathan。 2025。DivPrune: 基于多样性的视觉令牌剪枝,用于大型多模态模型。在 IEEE/CVF 2025。剖析 Transformer:迈向绿色 AI 的 CLEAR 视角。arXiv 计算机视觉与模式识别会议 (CVPR) 论文集。9392–9401。 预印本 arXiv:2510.02810 (2025)。 [3] Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail [18] SiYoung Jang 和 Roberto Morabito。2025。边缘优先语言模型推理: Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, 和 Román Orús。 模型、指标与权衡。在第45届IEEE分布式计算系统国际会议 (ICDCS) 2025。本地 LLM 能效的缩放定律。arXiv 预印本 arXiv:2512.16531 (2025)。 论文集。 [4] Kazi Hasan Ibn Arif, JinYi Yoon, Dimitrios S. Nikolopoulos, Hans Vandierendonck, [19] Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, 等。2025。AndesVL Deepu John, 和 Bo Ji。2025。HiRED: 注意力引导的令牌丢弃,用于 技术报告:一种高效的移动端多模态大语言模型。 arXiv 预印本 arXiv:2510.11496 (2025)。 [20] Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, 等。2024。 OpenVLA: 一个开源的视觉-语言-动作模型。在第8届机器人学习会议 (CoRL) 致谢 论文集。 [可选] 我们感谢支持本工作的匿名审稿人、同事或资助机构。 [21] Tsung-Yi Lin, Michael Maire, Serge Belongie, Lubomir Bourdev, Ross Girshick, James Hays, Pietro Perona, Deva Ramanan, C Lawrence Zitnick, 和 Piotr Dollár。 参考文献 2014。Microsoft COCO: 常见对象上下文。在欧洲计算机视觉会议 (ECCV) [1] Maximilian Abstreiter, Sasu Tarkoma, 和 Roberto Morabito。2025。有时 论文集。740–755。 痛苦但确实充满希望:边缘语言模型推理的可行性与权衡。ACM 嵌入式计算系统 [22] YuchenLanguageLiuModelet al. for2025.EdgeHyperVL:Devices.AnarXivEfficientpreprintandarXiv:2512.14052Dynamic Multimodal(2025).Large 汇刊 (2025)。doi:10.1145/3788870 [23] Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, 和 Irwin King。2024。 [2] Saeed Ranjbar Alvar, Gursimran Singh, Mohammad Akbari, 和 Yong Zhang。 具身 AI 的视觉-语言-动作模型综述。arXiv 预印本 2025。DivPrune: 基于多样性的视觉令牌剪枝,用于大型多模态模型。在 IEEE/CVF arXiv:2405.14093 (2024)。 计算机视觉与模式识别会议 (CVPR) 论文集。9392–9401。 [24] Andrés Marafioti, Orr Zohar, Miquel Farré, Merve Noyan, Elie Bakouch, 等。 [3] Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail 2025。SmolVLM: 重新定义小型高效多模态模型。arXiv Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, 和 Román Orús。 预印本 arXiv:2504.05299 (2025)。 2025。本地 LLM 能效的缩放定律。arXiv 预印本 arXiv:2512.16531 (2025)。 [25] Alyssa Pinnock, Shakya Jayakody, Kawsher A. Roxy, 和 Md Rubel Ahmed。2025。 [4] Kazi Hasan Ibn Arif, JinYi Yoon, Dimitrios S. Nikolopoulos, Hans Vandierendonck, EdgeProfiler: 一种基于分析模型在边缘设备上快速分析轻量级 LLMs Deepu John, 和 Bo Ji。2025。HiRED: 注意力引导的令牌丢弃,用于 的框架。arXiv 预印本 arXiv:2506.09061 (2025)。 [26] Reiner Pope, Sholto Douglas, Aakanksha Chowdhery, Jacob Devlin, James Brad- Deepu John, 和 Bo Ji。2025。HiRED: 注意力引导的令牌丢弃,用于 bury, Anselm Levskaya, Jonathan Heek, Kefan Xiao, Shivani Agrawal, 和 Jeff 大型多模态模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) Dean。2023。高效扩展 Transformer 推理。在机器学习系统 (MLSys) 论文集。9392–9401。 论文集,第5卷。
第 10 页
MM ’26,2026年11月10–14日,巴西里约热内卢 Junfei Zhan 等人,Junfei Zhan,Haoxun Shen,Mingang Guo,Zixuan Huang,以及 Tengjiao He
[27] Yuzhang Shang,Mu Cai,Bingxin Xu,Yong Jae Lee,以及 Yan Yan。2025。LLaVA- 视觉与模式识别(CVPR)。 PruMerge:用于高效大型多模态模型的自适应令牌缩减。在 [33] Hao Xu,Long Peng,Shezheng Song,Xiaodong Liu,Ma Jun,Shasha Li,Jie Yu, IEEE/CVF 国际计算机视觉会议(ICCV)论文集。 以及 Xiaoguang Mao。2025。Camel:资源受限设备上的能耗感知 LLM 推理。 22857–22867。 arXiv 预印本 arXiv:2508.09173 (2025)。 [28] Kele Shao,Keda Tao,Kejia Zhang,Sicheng Feng,Mu Cai,Yuzhang Shang, [34] Senqiao Yang,Yukang Chen,Zhuotao Tian,等。2025。VisionZip:在视觉语言模型中, Haoxuan You,Can Qin,Yang Sui,以及 Huan Wang。2025。用于高效多模态大型语言模型的令牌 更长并非必要。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集。 压缩综述。arXiv 预印本 arXiv:2507.20198 (2025)。 [35] Yuan Yao,Tianyu Yu,Ao Zhang,Chongyi Wang,Junbo Cui,Hongji Zhu,Tianchi [29] Pavan Kumar Anasosalu Vasu,Fartash Faghri,Chun-Liang Li,Cem Koc,Nate Cai,Haoyu Li,Weilin Zhao,Zhihui He,等。2025。用于在边缘设备上部署的 True,Albert Antony,Gokul Santhanam,James Gabriel,Peter Grasch,Oncel 高效 GPT-4V 级别多模态大型语言模型。Nature Tuzel,以及 Hadi Pouransari。2025。FastVLM:用于视觉 通信 16, 1 (2025), 5509。doi:10.1038/s41467-025-61040-5 语言模型的高效视觉编码。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集 [36] Yuan Zhang,Chun-Kai Fan,Junpeng Ma,Wenzhao Zheng,Tao Huang,Kuan 上。 Cheng,Denis A Gudovskiy,Tomoyuki Okuno,Yohei Nakata,Kurt Keutzer,等。 [30] Peng Wang,Shuai Bai,Sinan Tan,Shijie Wang,Zhihao Fan,Jinze Bai,Keqin 2025。SparseVLM:用于高效视觉语言模型推理的视觉令牌稀疏化。在第 42 届国际机器学习 Chen,Xuejing Liu,Jialin Wang,Wenbin Ge,等。2024。Qwen2-VL:提升 会议(ICML)论文集。 视觉语言模型在任何分辨率下的世界感知能力。arXiv 预印本 arXiv:2409.12191 (2024)。 [37] Baichuan Zhou,Ying Hu,Xi Weng,Junlong Jia,Jie Luo,Xien Liu,Ji Wu,以及 [31] Samuel Williams,Andrew Waterman,以及 David A. Patterson。2009。Roofline: Lei Huang。2024。TinyLLaVA:小型大型多模态模型框架。arXiv 预印本 arXiv:2402.14289 (2024)。 多核架构的直观视觉性能模型。Commun. ACM 52, 4 (2009), 65–76。doi:10.1145/1498765.1498785 [38] Jinguo Zhu,Weiyun Wang,Zhe Chen,Zhaoyang Liu,Shenglong Ye,Lixin Gu, [32] Long Xing,Qidong Huang,Xiaoyi Dong,Jiajie Lu,Pan Zhang,等。2025。Pyra- Hao Tian,Yuchen Duan,Weijie Su,Jie Shao,等。2025。InternVL3:探索 midDrop:通过金字塔视觉 开源多模态模型的先进训练和测试时策略。 冗余减少加速您的大型视觉语言模型。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR) arXiv 预印本 arXiv:2504.10479 (2025)。 论文集上。