EOVSAM:让SAM 3一次看懂所有物体

快速导读:提出EOVSAM,将SAM 3改造为无需提示的掩码生成器,并通过Attentional Aggregation实现端到端的单次前向开放词汇分割,在精度和速度上均显著优于原始SAM 3。

开放词汇分割的目标是根据任意文本描述,将图像中的每个像素分配到对应的语义类别。这一任务在自动驾驶、机器人感知和图像编辑等领域具有重要应用价值。然而,现有方法要么无法区分同类实例,要么采用先分割后识别的多阶段流水线,效率低下。SAM 3虽然原生支持文本引导分割,但进行开放词汇分割时需要对每个类别独立前向推理,计算开销随词汇量线性增长,严重限制了其实际部署。

EOVSAM针对这一效率瓶颈,提出将SAM 3改造为无需提示的单次前向掩码生成器。其核心思想是让模型在一次前向传播中同时完成掩码定位和语义识别,从而消除多遍推理的冗余计算。通过引入Attentional Aggregation策略和几何集成机制,EOVSAM在多个开放词汇分割基准上取得了有竞争力的精度,同时推理速度最高可达原始SAM 3的338倍。

英文题目:EOVSAM: Efficient Open-Vocabulary Segmentation with SAM 3 in One Pass

论文出处:arXiv 每日论文精选 · arXiv:2608.02284

原始论文:PDF / 论文页面

这篇论文解决什么问题?

开放词汇分割方法大致分为两类:基于像素的方法和基于掩码的方法。基于像素的方法直接为每个像素预测语义标签,但无法区分同一类别的不同实例,限制了其在需要实例级理解的任务中的应用。基于掩码的方法通常采用两阶段流水线:首先生成类别无关的掩码提议,然后利用视觉-语言模型对每个掩码进行语义识别。这种先分割后识别的范式虽然能保留实例信息,但引入了额外的后处理步骤和计算开销。

SAM 3作为最新的分割基础模型,支持通过名词短语直接引导分割,理论上可以用于开放词汇分割。然而,其设计初衷是交互式分割,每次推理只能处理一个文本提示。当面对包含数百个类别的开放词汇场景时,需要对每个类别独立运行一次完整的前向传播。这意味着推理时间与词汇量成正比,在ADE20K的150个类别上,SAM 3的推理速度仅为0.03 FPS,完全无法满足实时应用需求。

这一效率瓶颈的根源在于SAM 3的架构设计:文本提示通过交叉注意力机制与图像特征交互,使得每次推理都必须重新计算文本-图像融合过程。此外,SAM 3的图像编码器仅提取用于掩码预测的特征,缺乏与文本模态对齐的语义特征,导致无法直接进行开放词汇分类。因此,如何在不牺牲精度的前提下,将SAM 3改造为高效的开放词汇分割模型,成为一个亟待解决的研究问题。

核心创新

  • 提出将SAM 3改造为无需提示的单次前向掩码生成器,消除多遍推理瓶颈。
  • 引入Attentional Aggregation策略,利用可微的软注意力图聚合视觉特征,实现掩码生成与开放词汇分类的端到端联合优化。
  • 通过移除文本交叉注意力并采用几何集成策略,在保持高精度的同时大幅提升推理速度。

方法概览

EOVSAM将SAM 3改造为无需提示的单次前向掩码生成器。采用C-RADIOv4作为视觉骨干,并行提取SAM和SigLIP特征。检测解码器同时生成掩码嵌入和分类导向的注意力图,利用注意力图聚合SigLIP特征得到物体嵌入,通过余弦相似度与SigLIP文本分类器进行开放词汇识别,实现掩码定位与语义识别的端到端联合优化。

  • EOVSAM的整体架构:将SAM 3的图像编码器替换为聚合视觉骨干C-RADIOv4,该骨干并行提取两组特征——用于掩码生成的SAM特征和用于语义识别的SigLIP特征。检测解码器接收SAM特征,同时输出掩码嵌入和分类导向的注意力图。注意力图以可微的方式聚合SigLIP特征,得到每个掩码对应的物体嵌入,最后通过余弦相似度与SigLIP文本分类器进行开放词汇识别。整个流程在单次前向传播中完成,无需任何提示输入。
  • Attentional Aggregation的核心设计:与传统的Mask Pooling(在掩码区域内平均池化特征)不同,Attentional Aggregation使用检测解码器预测的软注意力图来加权聚合SigLIP特征。这一设计的优势在于:注意力图是可微的,允许分类损失直接反向传播到掩码生成分支,实现端到端联合优化;同时,软注意力图能更精细地捕捉物体边界和语义区域,避免硬掩码池化带来的信息损失。
  • 几何集成策略:EOVSAM同时维护两个分类器——基于SigLIP特征的开放词汇分类器和基于SAM特征的固定词汇分类器。在推理时,将两个分类器的预测概率进行几何加权平均。对于训练中见过的类别,赋予SigLIP分类器更高的权重;对于未见类别,则降低其权重以抑制过自信的预测。这种集成策略有效平衡了开放词汇泛化能力和封闭词汇分类精度。
  • 移除文本交叉注意力:原始SAM 3在掩码解码器中使用了文本-图像交叉注意力层,这是导致逐类推理的根本原因。EOVSAM完全移除了这一模块,将文本信息的使用推迟到最终的分类阶段。这一改动使得模型的计算图与词汇量解耦,推理时间不再随类别数量增长。
  • 边界框监督:除了掩码标注外,EOVSAM在训练时还引入了边界框监督信号。检测解码器额外预测一个边界框回归分支,使用L1损失和GIoU损失进行优化。边界框监督为注意力图的学习提供了额外的空间约束,有助于注意力图更准确地聚焦于物体区域。
  • 训练策略:模型在COCO Panoptic数据集上训练,该数据集包含133个语义类别和丰富的实例标注。训练时使用AdamW优化器,初始学习率为1e-4,采用余弦退火调度。输入分辨率在训练时随机缩放,推理时支持多种分辨率配置以权衡速度与精度。

逐图理解论文

效率困境

效率困境
Figure 1: Inference speed and segmentation performance on datasets with different vocabulary sizes. EOVSAM operates at a resolution scale of 1152, compared to 1008 for SAM 3.

该图对比了EOVSAM和SAM 3在不同词汇量下的推理速度和分割精度。可以观察到,SAM 3的推理时间随词汇量线性增长,而EOVSAM保持恒定。同时,EOVSAM在精度上也优于SAM 3,验证了单次前向设计的双重优势。

核心方法架构

核心方法架构
Figure 2: Adapting SAM 3 for open-vocabulary segmentation. EOVSAM replaces the SAM 3 image encoder with an agglom- erative vision backbone that extracts SAM and SigLIP features in parallel. The detector decoder produces mask embeddings and corresponding attention maps. These maps aggregate the SigLIP features into object embeddings aligned with the predicted masks, which are classified by their cosine similarity to the SigLIP text classifier. This single-pass design removes SAM 3’s repeated inference over the target vocabulary.

该图展示了EOVSAM的整体架构。重点关注三个关键设计:聚合视觉骨干并行提取SAM和SigLIP特征,检测解码器同时输出掩码和注意力图,以及注意力图聚合SigLIP特征进行开放词汇分类。这一流程实现了掩码定位与语义识别的端到端联合优化。

注意力聚合的优势

注意力聚合的优势
Figure 3: Comparison of feature aggregation strategies re- garding gradient flow and computational overhead.

该图对比了Attentional Aggregation与Mask Pooling、Mask-Adapter在梯度流和计算开销上的差异。Attentional Aggregation允许分类损失直接反向传播到掩码生成分支,而Mask Pooling和Mask-Adapter存在梯度阻断,无法实现端到端优化。

速度与精度的突破

速度与精度的突破
Table 3: Inference efficiency. The FPS of the compared methods is measured at their official resolutions. EOVSAM uses a single checkpoint across all resolutions, the numbers in parentheses indicate the input resolution scale. Results are measured on a single RTX 3090 GPU (CUDA 12.4), using identical class lists and precomputed text features.

该表展示了推理效率的对比。EOVSAM在1152分辨率下达到3.77 FPS,而SAM 3仅为0.03 FPS。同时,EOVSAM在不同分辨率下使用同一检查点,展示了灵活的部署能力。

实验如何设计?

  • 开放词汇语义分割评估:在ADE20K(150类和847类)、Pascal-Context(59类和459类)和Pascal-VOC(20类)三个数据集上进行评估,使用mIoU作为主要指标。所有方法在COCO Panoptic上训练,确保训练数据的一致性。
  • 开放词汇全景分割评估:在ADE20K数据集上评估全景分割性能,使用PQ、SQ和RQ三个指标。全景分割要求同时预测语义标签和实例ID,是更具挑战性的综合任务。
  • 推理效率测试:在单张RTX 3090 GPU上测量各方法的FPS,使用相同的类别列表和预计算的文本特征。EOVSAM在不同输入分辨率(1152、896、640)下测试,展示速度-精度的权衡曲线。
  • 消融实验:系统评估各组件的影响,包括SAM 3预训练权重、Attentional Aggregation、边界框监督和文本交叉注意力。同时对比Attentional Aggregation与Mask Pooling、Mask-Adapter等替代方案,验证注意力聚合的优越性。

关键结果与论文证据

  • 语义分割精度:在A-150上达到39.0 mIoU,A-847上达到16.6 mIoU,PC-59上达到60.9 mIoU,PAS-20上达到97.0 mIoU(Table 1, p.5)。在COCO训练的方法中,EOVSAM在多个基准上取得了有竞争力的结果。
  • 全景分割性能:在ADE20K上达到30.9 PQ,73.8 SQ,37.3 RQ(Table 2, p.5)。相比原始SAM 3的复现结果,PQ提升了11.1,验证了端到端联合优化的有效性。
  • 推理效率突破:在1152分辨率下达到3.77 FPS,而SAM 3仅为0.03 FPS,速度提升约338倍(Table 3, p.6)。即使在最高精度配置下,EOVSAM也实现了实时推理。
  • Attentional Aggregation的关键作用:移除该模块导致A-150 mIoU下降16.4,PQ下降11.1(Table 4, p.7),证明注意力聚合是实现端到端优化的核心组件。
  • 与替代聚合方法的对比:Attentional Aggregation在A-150 mIoU上比Mask Pooling高2.3,比Mask-Adapter高1.8(Table 5, p.7),验证了软注意力图在特征聚合中的优势。
  • 几何集成系数的影响:当α=0.6、β=0.4时,在已见和未见类别上取得最佳平衡(Table 6, p.7)。系数对数据集不敏感,但需要手动设定。
  • 定性分析:注意力图与物体边界高度吻合,余弦相似度图在语义区域呈现高响应(Figure 4, p.6),直观展示了Attentional Aggregation的有效性。

阅读时需要注意

  • 训练数据局限:仅在COCO Panoptic上训练,该数据集主要包含常见物体类别,模型在长尾类别或域外场景下的泛化能力有待验证。
  • 骨干网络依赖:依赖C-RADIOv4的预训练权重,该骨干的可用性和更新频率可能限制方法的通用性和可复现性。
  • 几何集成系数非自适应:系数需要手动设定,虽然对数据集不敏感,但在动态变化的开放词汇场景中缺乏自适应性。
  • 低分辨率性能下降:模型在低分辨率下精度明显降低,需要在速度和精度之间进行权衡,可能不适合对精度要求极高的应用。

关联工作

  • FC-CLIP是基于掩码的开放词汇分割方法的代表,使用卷积CLIP骨干和掩码池化进行特征聚合。EOVSAM在推理效率上显著优于FC-CLIP,同时保持了可比的精度。
  • Mask-Adapter是另一种特征聚合方法,在掩码生成器后添加轻量级适配器来对齐视觉和文本特征。EOVSAM的Attentional Aggregation在精度上优于Mask-Adapter,且无需额外的适配器参数。
  • C-RADIOv4是聚合视觉基础模型,能够并行提取多种视觉特征。EOVSAM利用其同时输出SAM特征和SigLIP特征,避免了使用多个独立骨干网络的计算冗余。

发表评论