CoverPrune:用最优传输把3D VLM的视觉token剪枝从“挑多样”变成“保覆盖”

快速导读:CoverPrune将3D VLM推理时的视觉token剪枝重新定义为最优传输覆盖最大化问题,以保留代表性视觉证据而非最大化多样性,在激进剪枝下保持空间推理性能。

3D视觉语言模型(3D VLM)通过注入显式几何线索实现了空间推理能力的突破,但多视角、多帧输入带来的视觉token数量爆炸,使推理受限于注意力机制的二次复杂度和KV cache的持续增长。CoverPrune针对这一瓶颈提出了一种训练无关的token剪枝方法,其核心思想是将剪枝从传统的“最大化多样性”范式转变为“最大化视觉证据覆盖”范式,并通过最优传输(Optimal Transport, OT)框架形式化这一目标。

论文的核心论点是:在激进压缩下,保留代表性原型token比保留彼此差异最大的token更能维持多视角一致性和几何结构。CoverPrune通过Feature-Spatial-Temporal (FST)传输代价联合建模语义相似度、3D空间邻近性和时间一致性,并设计了Spatial-Guided Greedy Selection (SGS)算法来近似求解NP-hard的子集选择问题。

英文题目:CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

论文出处:arXiv 每日论文精选 · arXiv:2608.13226

原始论文:PDF / 论文页面

这篇论文解决什么问题?

3D VLM的输入通常来自多视角图像或视频帧,每帧经过视觉编码器后产生大量视觉token。当这些token全部送入语言模型时,注意力计算的开销随token数量平方增长,KV cache的内存占用也线性膨胀,这严重制约了模型的推理效率和可扩展性。

现有的训练无关剪枝方法主要分为两类:基于注意力分数的排序方法和基于多样性的选择方法。注意力排序方法假设注意力分数高的token更重要,但attention sink现象——部分token吸引大量注意力却未必携带关键信息——使这一假设在3D场景中经常失效。多样性选择方法则倾向于保留特征空间中彼此距离最远的token,以避免冗余,但这一策略容易偏向离群点,反而丢弃了那些在几何上具有代表性的原型token。

3D场景的特殊性在于,空间推理要求模型理解物体之间的相对位置、朝向和遮挡关系。如果剪枝破坏了多视角一致性——即同一物体在不同视角下的对应token被不一致地保留或丢弃——模型的几何理解就会受损。这正是现有方法在激进压缩下性能急剧下降的根本原因。

核心创新

  • 提出从多样性最大化到视觉证据覆盖保持的剪枝范式转变,用最优传输形式化覆盖-紧凑性目标
  • 设计Feature-Spatial-Temporal (FST)传输代价,联合建模特征、3D空间和时间三个维度的token关系
  • 提出信息量感知的非对称目标容量分配,稳定激进剪枝下的质量分配
  • 开发Spatial-Guided Greedy Selection (SGS)算法,通过半松弛OT将NP-hard子集选择转化为可处理的贪心优化
  • 提出CoverPrune-Lite轻量变体,通过Morton码3D感知排序和容量引导分组实现O(N log N)剪枝

方法概览

CoverPrune将token剪枝形式化为覆盖-紧凑性优化问题,通过最优传输(OT)视角:保留token作为原型向原始token分配表征质量,最小化覆盖分配失真。具体包括:(1) Feature-Spatial-Temporal (FST)传输代价联合建模语义相似度、3D空间邻近性和时间一致性;(2) 基于局部区分度的FST目标容量分配,优先覆盖信息量大的token;(3) Spatial-Guided Greedy Selection (SGS)算法通过半松弛OT近似NP-hard子集选择。CoverPrune-Lite利用Morton码空间填充曲线进行3D感知排序,按容量分组后在组内局部选择原型,实现O(N log N)复杂度。

  • CoverPrune将token剪枝形式化为覆盖-紧凑性优化问题:保留的token作为原型,向原始token分配表征质量,目标是使覆盖分配的失真最小化。这一形式化直接对应最优传输中的质量分配问题。
  • Feature-Spatial-Temporal (FST)传输代价是CoverPrune的核心设计之一。它联合建模三个维度的token关系:特征空间中的语义相似度、3D空间中的几何邻近性、以及时间维度上的帧间一致性。
  • FST目标容量分配采用非对称策略:信息量大的token获得更高的目标容量权重,从而在优化过程中优先被覆盖。这一设计稳定了激进剪枝下的质量分配,避免了均匀容量假设带来的覆盖偏差。
  • Spatial-Guided Greedy Selection (SGS)算法通过半松弛最优传输(semi-relaxed OT)将NP-hard的子集选择问题转化为可处理的贪心优化。半松弛意味着目标侧的容量约束放宽为不等式,使问题具有子模结构,从而贪心选择具有近似保证。
  • CoverPrune-Lite是轻量变体,利用Morton码空间填充曲线进行3D感知排序,将token按空间局部性分组,然后在组内局部选择原型。这一设计将复杂度降至O(N log N),避免了全局OT优化的立方时间复杂度。
  • CoverPrune作为训练无关的即插即用模块,插入在视觉-几何编码器和3D VLM之间,不需要任何微调或额外的训练数据。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 1: CoverPrune and CoverPrune- Lite Performance. We report cross- benchmark quantitative results under varying token retention ratios, with each dimension representing the aver- age performance retention rate relative to the full token baseline across all met- rics for each benchmark; our method achieves near-zero performance loss with 10% visual tokens on general 3D tasks and retains over 90% perfor- mance with 15% visual tokens on the reasoning-heavy VSI-Bench.

图1展示了CoverPrune和CoverPrune-Lite在不同token保留率下的跨基准性能保持率。观察各维度的雷达图可以发现,CoverPrune在10%保留率下几乎无性能损失,而在推理密集的VSI-Bench上15%保留率即可保持90%以上性能,这直观验证了覆盖驱动剪枝的有效性。

研究缺口

研究缺口
Fig. 2: Framework overview. (Left) CoverPrune serves as a training-free, plug-and- play module inserted between the visual-geometric encoder and the 3D VLM. (Right) We formulate token pruning as an Optimal Transport (OT) problem to maximize visual evidence coverage. To resolve this, we introduce three key designs: (1) a Feature-Spatial- Temporal (FST) Cost C (df, dx, dτ) to comprehensively model multidimensional token relationships; (2) an asymmetric capacity assignment to stabilize mass allocation based on token informativeness; and (3) a tractable optimization strategy to approximate the inherently NP-hard combinatorial subset selection problem.

图2展示了CoverPrune的整体框架。左侧显示CoverPrune作为训练无关的即插即用模块插入在视觉-几何编码器和3D VLM之间;右侧展示了OT形式化的三个关键设计:FST代价、非对称容量分配和可处理的优化策略。这张图是理解方法核心逻辑的入口。

实验验证

实验验证
Table 2: Evaluation on VSI-Bench with GS-Reasoner as the base model. Under each ratio, the number of tokens retained by each method was kept consistent. Our proposed CoverPrune and CoverPrune-Lite consistently exhibit superior performance.

表2展示了GS-Reasoner基座下VSI-Bench的详细结果。在每种保留率下各方法的token数量保持一致,CoverPrune和CoverPrune-Lite在平均分和多数单项任务上均优于基线,尤其在低保留率下优势扩大。

实验如何设计?

  • 在三个通用3D任务基准上评估:ScanQA(3D问答)、SQA3D(情境问答)和Scan2Cap(3D描述生成),基座模型为GS-Reasoner。
  • 在VSI-Bench上评估空间推理性能,该基准包含8个以自我为中心的室内扫描视频任务,覆盖从物体定位到关系推理的多种空间能力。
  • 对比基线包括VisionZip(基于注意力的通用VLM剪枝)、FastVID(基于动态密度剪枝的视频LLM方法)、DTC(体素引导的3D动态token压缩)和EgoPrune(利用SfM位姿线索的3D剪枝方法)。
  • 在GS-Reasoner和VLM-3R两个基座模型上验证泛化性,VLM-3R是指令对齐的3D重建增强VLM。
  • 消融实验逐一移除FST capacity、feature cost、geometry cost和time cost组件,以验证各设计的贡献。

关键结果与论文证据

  • CoverPrune在20% token保留率下保持92.4%的全token性能(VSI-Bench, GS-Reasoner),证明覆盖驱动的剪枝策略在温和压缩下几乎无损(第13页)。
  • 在10% token保留率下,CoverPrune在VSI-Bench上的平均分为56.83,超过最强基线DTC的51.66,领先5.17分,说明激进压缩下覆盖策略的优势更加显著(第13页)。
  • CoverPrune-Lite在5% token保留率下VSI-Bench平均分52.88,超过DTC的46.31,领先6.57分,表明轻量变体在极端压缩下仍保持竞争力(第13页)。
  • 在VLM-3R基座上,10%保留率下CoverPrune-Lite平均分54.74,超过DTC的52.64,验证了方法跨基座模型的泛化性(第14页)。
  • 消融实验中移除feature cost导致VSI-Bench整体分下降3.58分(59.76→56.18),为最大单项损失,说明特征维度的语义相似度建模是FST代价中最关键的组件(第14页)。
  • 效率分析显示CoverPrune-Lite的剪枝时间为0.41 ms/token,显著低于DTC的3.47 ms/token和CoverPrune的2.53 ms/token,验证了Morton码排序和分组策略的计算优势(第14页)。
  • CoverPrune-Lite的相对准确率为88.01%,高于DTC的79.85%和CoverPrune的87.84%,说明轻量变体在效率-精度权衡上达到了更好的平衡(第14页)。

阅读时需要注意

  • CoverPrune的迭代全局OT优化具有立方时间复杂度,在长视频序列下剪枝开销较高,限制了其在实时场景中的应用。
  • 实验仅在两个3D VLM基座(GS-Reasoner和VLM-3R)上验证,未扩展到通用2D VLM,方法的适用范围有待进一步检验。
  • FST代价中的权重λ和容量权重α均设为1,未系统探索不同任务下的最优权重配置,可能在某些场景下未达到最优性能。
  • 方法依赖SfM或几何基础模型估计3D坐标,坐标估计误差对剪枝质量的影响未进行分析,这是一个潜在的不确定性来源。

关联工作

  • SPOT(基于最优传输的原型选择框架)为CoverPrune的OT形式化提供了理论基础,但SPOT面向通用原型选择,未针对3D VLM的时空特性进行设计。
  • Partial Wasserstein Covering理论支撑了SGS的近似保证:部分Wasserstein覆盖问题具有子模结构,贪心选择可以达到常数因子近似。
  • DTC作为3D问答的体素引导动态token压缩方法,代表了多样性驱动的3D剪枝路线,但其在激进压缩下的性能下降暴露了多样性策略的局限。
  • EgoPrune利用SfM位姿线索对齐重叠区域后过滤冗余token,与CoverPrune共享利用几何信息的思路,但EgoPrune的过滤逻辑仍是冗余消除而非覆盖保持。

发表评论