更好、更强、更快、更广:面向多模态大语言模型分割的结构化全掩码预测

快速导读:提出结构化全掩码预测范式,将自回归对话与非自回归掩码生成解耦,通过单次前向传播同时预测所有掩码令牌,在保持对话能力的同时实现高效、高性能的通用分割。

多模态大语言模型(MLLM)在统一视觉任务方面展现了巨大潜力,但基于MLLM的分割任务长期面临一个三难困境:高分割性能、保持对话能力与快速推理速度三者难以兼得。现有的嵌入预测方法(如LISA)依赖外部解码器,可能损害模型的通用对话能力;而基于下一令牌预测的方法(如Text4Seg)虽然以自回归方式生成掩码,却不得不在性能与速度之间做出取舍——要么生成稀疏输出导致分割质量差,要么生成丰富输出导致推理极慢。

本文提出结构化全掩码预测(Structured All-Mask Prediction)范式,核心思想是将自回归的对话生成与非自回归的掩码预测彻底解耦。在对话阶段,模型正常生成文本回复;当需要分割时,通过特殊的触发令牌激活第二阶段,一次性并行预测所有掩码令牌的类别。这一设计从根本上绕开了三难困境,使得单个模型无需任务特定微调即可覆盖指代分割、推理分割、开放词汇语义分割、实例分割乃至遥感小目标分割等多种任务。

英文题目:Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

论文出处:arXiv 每日论文精选 · arXiv:2608.02791

原始论文:PDF / 论文页面

这篇论文解决什么问题?

MLLM-based分割的现有范式可归为两类。第一类是嵌入预测(Embedding Prediction),代表方法如LISA、GSVA、READ,它们在MLLM的输出端引入像素级损失和外部SAM解码器来生成掩码。问题在于,像素级监督信号可能干扰语言模型的表征空间,导致模型在通用对话基准上的性能下降。

第二类是下一令牌预测(Next-Token Prediction),代表方法如Text4Seg、Seg-Zero。这类方法将掩码表示为文本序列(如坐标序列或逐块分类标签),以自回归方式逐令牌生成。当目标数量增多或需要精细掩码时,生成序列急剧变长,推理延迟线性增长。Text4Seg虽然通过逐块分类实现了较好的性能,但其自回归本质使得多目标场景下的推理速度成为瓶颈。

这两种范式共同构成了一个三难困境:嵌入预测牺牲对话能力,下一令牌预测在性能与速度之间只能二选一。论文第1页的图1清晰地刻画了这一困境——三种需求如同三角形的三个顶点,现有方法只能占据其中两条边。

本文的核心洞察在于:对话生成天然需要自回归(因为语言本身是序列化的),但掩码生成本质上是空间上的并行分类问题,完全不需要自回归。将两者强行绑定在同一生成范式下,是造成三难困境的根本原因。

核心创新

方法概览

问题的根源在于,现有方法把对话生成和掩码生成绑在了同一个范式里。对话确实是序列化的,必须一个字一个字往外蹦;但掩码本质上是图像上的一堆并行分类任务,每个像素是前景还是背景,跟其他像素没有先后依赖关系。强行用自回归的方式去生成掩码,就像用打字机一个字母一个字母地敲出一张照片——不是不行,但注定又慢又别扭。

  • All-Mask Prediction范式(第3页图2):将MLLM分割流程分为两个阶段。Phase 1是标准的自回归对话生成,模型正常输出文本回复,当需要分割时发出特殊令牌<SEG>。Phase 2是非自回归的全掩码预测,图像对齐的[MASK]令牌与对应图像块特征融合后,通过一次混合注意力的前向传播同时预测所有掩码令牌的类别。
  • STAMP:二值全掩码预测(第6页图4):针对单目标指代分割和推理分割设计。Phase 2中每个[MASK]令牌做前景/背景二分类,生成二值掩码。该掩码可选择性送入冻结的SAM进行细化。整个Phase 2仅需一次前向传播,无需重复推理。
  • STAMPlus:结构化全掩码预测(第7页图5):将能力扩展到多目标、多类别场景。Phase 1生成结构化目标列表,每个目标包含ID、类别标签和可选的边界框(用于实例消歧)。Phase 2进行多类掩码预测,输出类别动态绑定到Phase 1生成的ID上,实现单次前向传播同时分割所有目标。
  • 高分辨率掩码令牌缩放:针对遥感等小目标场景,联合提高输入分辨率和掩码令牌预算。更多的[MASK]令牌意味着更细粒度的空间覆盖,使模型能够捕捉微小目标。
  • 混合注意力机制:Phase 2使用混合注意力,[MASK]令牌可以关注图像特征和Phase 1生成的文本上下文,但图像令牌之间保持原有的双向注意力,确保视觉理解不受干扰。
  • 统一单检查点:STAMPlus在训练时混合多种分割任务的指令数据,推理时根据用户指令自动切换行为模式,无需为不同任务加载不同模型权重。
  • 与SAM的协作:掩码预测结果可作为SAM的提示输入,利用SAM的精细边缘能力进一步提升掩码质量,但SAM并非必需——模型本身已能独立输出可用掩码。
  • 动态类别绑定:Phase 2的分类头输出维度与Phase 1生成的目标数量动态匹配,避免了固定类别数带来的容量限制(当前设为200)。

逐图理解论文

失败案例与直觉

失败案例与直觉
Fig. 3. STAMP versus STAMPlus in multi-target segmentation. (a) STAMP must repeat its single-target prediction for each object, and ambiguous referring expressions may yield incorrect masks. (b) STAMPlus first generates a structured target list and then predicts all target IDs jointly in one shared structured mask map.

图3对比了STAMP与STAMPlus在多目标分割中的行为差异。STAMP(a)需为每个目标重复单目标预测,且模糊指代可能导致错误掩码。STAMPlus(b)首先生成结构化目标列表,然后在共享的结构化掩码图中一次性预测所有目标ID。

核心区分与研究空白

核心区分与研究空白
Fig. 2. Comparison of MLLM-based segmentation paradigms. (a) Embedding Prediction: Pixel-level supervision for external mask decoding [12, 14] may degrade the MLLM’s general dialogue capabilities. (b) Next-Token Prediction: Autoregressively generates textual mask representations [11, 18, 23], forcing a trade-off between poor segmentation performance (for sparse outputs) and slow inference (for rich outputs). (c) Our All-Mask Prediction: We decouple dialogue generation (autoregressive) from mask generation (non-autoregressive). By simultaneously predicting all mask tokens as patch-wise classifications in a single pass, our paradigm resolves the segmentation trilemma, uniting preserved dialogue abilities, high segmentation performance and fast inference speed.

图2对比了三种MLLM分割范式。嵌入预测(a)通过像素级损失训练外部解码器,可能损害对话能力。下一令牌预测(b)自回归生成掩码文本,面临性能与速度的权衡。本文的All-Mask Prediction(c)将对话生成与掩码预测解耦,Phase 2一次性并行预测所有掩码令牌。

论文贡献与解决方案

论文贡献与解决方案
Fig. 4. The STAMP Pipeline. Phase 1 (Dialogue Generation): The MLLM autoregressively generates a conversational response, emitting a special <SEG> token to trigger Phase 2. Phase 2 (Binary All-Mask Prediction): Triggered by <SEG>, image-aligned [MASK] tokens are prefilled and fused with their corresponding image-patch features. A single non-autoregressive forward pass with hybrid attention predicts their foreground/background labels simultaneously; the resulting patch mask can optionally prompt a frozen SAM for refinement.

图4展示STAMP的完整流程。Phase 1自回归生成对话回复并发出<SEG>令牌。Phase 2中,图像对齐的[MASK]令牌与图像块特征融合,通过一次混合注意力前向传播同时预测所有令牌的前景/背景标签。

最强结论

最强结论
Fig. 8. Efficiency comparison across MLLM segmentation paradigms. Methods from the same paradigm are grouped by color; numbers following model names denote input resolution, and marker size indicates model scale. Higher and farther left is better. Latency is measured on a single NVIDIA A800 using the same test case for all methods.

图8展示MLLM分割范式的效率对比。同范式方法按颜色分组,数字表示输入分辨率,标记大小表示模型规模。STAMPlus位于左上角最优区域,同时实现高cIoU和低延迟。

意义与局限

意义与局限
Fig. 9. Inference-time scaling with the number of target categories. STAMP and LISA repeat a separate prediction of similar cost for each cate- gory, resulting in a steep latency increase. The additional cost of STAMPlus is concentrated in the Phase 1 autoregressive generation of the structured target list, while all categories share a single Phase 2 mask prediction, yielding a substantially smaller slope. Lines show mean latency and shaded bands show the corresponding standard deviation; all measurements use a single NVIDIA H800 GPU.

图9展示推理延迟随目标类别数量的变化。STAMP和LISA需为每个类别重复预测,延迟线性增长。STAMPlus的额外成本集中在Phase 1的结构化目标列表生成,所有类别共享Phase 2的单次掩码预测,延迟增长斜率显著更小。

实验如何设计?

  • 单目标指代分割:在RefCOCO、RefCOCO+、RefCOCOg和gRefCOCO四个标准基准上评估,使用cIoU作为主要指标。
  • 推理分割:在ReasonSeg数据集上评估模型理解复杂语言描述并定位目标的能力。
  • 遥感小目标分割:在RRSIS-D和EarthReason两个遥感数据集上测试高分辨率掩码令牌缩放的效果。
  • 开放词汇语义分割:在ADE20K、Pascal Context和Pascal VOC上评估多类别联合预测能力,使用mIoU指标。
  • 实例感知分割:在MUSE数据集上评估结构化目标列表和边界框消歧的效果。
  • 通用多模态能力保持:在MME、MMBench、SEEDBench等标准基准上验证对话能力未因分割训练而退化。

关键结果与论文证据

  • STAMPlus-7B在RefCOCO系列上平均cIoU达到81.0,超越Text4Seg++的78.9(第10页),验证了全掩码预测在单目标场景下的性能优势。
  • 在ReasonSeg推理分割上,STAMPlus-7B平均得分64.0,为对比方法中最高(第11页),表明解耦设计未损害复杂语言理解能力。
  • 遥感小目标分割RRSIS-D平均得分76.2,超越专用基线方法(第11页);EarthReason平均得分74.0,相比Text4Seg++的70.1提升显著,证明高分辨率掩码令牌缩放的有效性。
  • 开放词汇语义分割三个数据集平均mIoU达63.7(第11页),单个模型同时处理多类别分割,无需逐类重复推理。
  • MUSE实例分割平均得分63.5(第11页),结构化目标列表和边界框消歧机制有效区分同类别不同实例。
  • 效率对比(第15页图8):STAMPlus在cIoU-延迟图上位于左上角最优区域,同时实现高性能和低延迟。12类别场景下,STAMPlus延迟仅5.16秒,而重复调用STAMP需13.50秒(第15页)。
  • 通用多模态能力保持:STAMPlus-7B在MME上得分2282,与基座模型Qwen2-VL-7B的2312接近(第15页),证明分割训练未显著损害对话能力。
  • 消融实验表明,Phase 1生成的目标线索(类别标签和边界框)对多目标场景的分割精度有显著贡献,移除任一线索均导致性能下降。

阅读时需要注意

  • 固定类别容量(200)可能在目标极多的场景下截断部分目标,无法处理超大规模的全景分割。
  • 高分辨率缩放虽然提升小目标性能,但计算成本相应增加,在资源受限场景下需要权衡。
  • Phase 1的结构化目标生成仍依赖自回归,当类别数量极大时可能成为新的瓶颈。
  • 全景分割仅进行了定性展示,缺乏定量评估。

关联工作

  • LISA(第5页):嵌入预测范式的代表,使用像素级损失和外部SAM解码器,分割性能好但可能损害对话能力。本文的解耦设计从根本上避免了像素级损失对语言表征的干扰。
  • Text4Seg(第5页):下一令牌预测范式的代表,自回归生成逐块分类标签,多目标时推理极慢。本文的非自回归Phase 2直接解决了这一效率瓶颈。
  • Seg-Zero(第5页):使用思维链引导的坐标预测,仍需外部SAM解码器,本质上未脱离嵌入预测或下一令牌预测的框架。
  • GSVA和READ(第5页):均为嵌入预测方法,产生目标特定嵌入供掩码解码器使用,面临与LISA类似的对话能力退化风险。

发表评论