三分钟导读:SAM-MT通过解耦全局上下文与个体目标查询,实现了计算延迟与目标数量无关的实时多目标视频分割,在保持SAM2性能的同时显著提升了密集场景下的效率。
英文题目:SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
论文出处:arXiv 每日论文精选 · arXiv:2607.08688
原始论文:PDF / 论文页面
对应视频标题:SAM-MT:实时交互式多目标视频分割,延迟与目标数无关|推荐指数:★★★★★
这篇论文解决什么问题?
现有视频对象分割(VOS)方法(如SAM2)在处理多目标时通常采用对象级独立处理,导致计算成本和延迟随目标数量线性增长,无法在密集场景中保持实时性。
核心创新
- 提出解耦掩码注意力机制,在共享全局上下文的同时隔离不同目标的查询,防止身份混淆。
- 设计基于查询的稀疏记忆模块,替代昂贵的密集像素记忆,大幅降低多目标场景下的内存占用。
- 引入身份变换器,从稀疏记忆中检索历史查询以更新当前目标,确保长时序下的身份一致性。
- 采用步长采样(Strided Sampling)和重叠防止损失(Overlap Prevention Loss)增强对遮挡和密集目标的鲁棒性。
方法概览
SAM-MT在SAM2基础上引入混合架构:使用共享表示建模全局上下文,同时使用轻量级查询表示个体目标。通过解耦掩码注意力(Decoupled Masked Attention)防止跨目标干扰,并利用基于查询的稀疏记忆(Sparse Memory)和身份变换器(Identity Transformer)实现稳定的时序身份一致性。
逐图理解论文
SAM-MT的核心架构

为此,SAM-MT提出了一种混合架构。它使用共享表示来建模全局上下文,同时使用轻量级查询表示个体目标。这种设计使得计算延迟与目标数量解耦,即使目标数量增加,也能保持接近单目标的推理效率,从而在维持高分割精度的同时,显著提升了处理速度。
解耦掩码注意力机制

为防止不同目标间的身份混淆,SAM-MT引入了Decoupled Masked Attention。该机制在共享全局上下文的同时,严格隔离不同目标的查询。通过这种方式,模型能够专注于各自目标的特征,有效避免了多目标交互中的干扰,确保了每个目标掩码生成的独立性与准确性。
基准测试性能对比

在MOSEv2、LVOSv2和SA-V等六个主流VOS基准测试中,SAM-MT展现了卓越的性能。例如,在MOSEv2验证集上,其J&F指标达到43.0,优于SAM2.1-B+的41.1。在LVOSv2上,J&F为76.6,同样领先于基线方法。这表明解耦架构并未牺牲分割精度,反而在复杂场景中更具优势。
实时性与内存效率

效率提升是SAM-MT的核心贡献。在合成多目标基准测试中,当目标数量达到10个时,SAM-MT的FPS高达36.3,而SAM2.1-B+仅为7.8。在20个目标的极端情况下,SAM-MT的VRAM占用仅为3785 MB,远低于SAM2.1-B+的8585 MB。这证明了其在资源受限环境下的巨大潜力。
密集场景下的定性表现

在真实世界的密集场景中,SAM-MT表现出强大的鲁棒性。如图6所示,即使在目标高度重叠的情况下,模型仍能精确跟踪和分割所有目标,并保持实时速度。相比之下,传统方法往往因计算瓶颈而丢失目标或产生严重的身份交换,难以满足实际应用对稳定性和速度的双重需求。
实验与关键结果
- 在MOSEv2、LVOSv2、SA-V等6个VOS基准测试上进行定量评估,对比SAM2.1-B+、Cutie、DeAOT等方法。
- 构建合成多目标基准测试,评估目标数量从1到20变化时的FPS和VRAM消耗。
- 在密集真实场景和身份模糊场景中进行定性分析,验证跟踪稳定性和身份保持能力。
- 进行消融实验,验证解耦注意力、身份变换器、记忆窗口大小及训练策略的有效性。
- 在MOSEv2、LVOSv2、SA-V等6个VOS基准测试上进行定量评估,对比SAM2.1-B+、Cutie、DeAOT等方法。
- 构建合成多目标基准测试,评估目标数量从1到20变化时的FPS和VRAM消耗。
- 在密集真实场景和身份模糊场景中进行定性分析,验证跟踪稳定性和身份保持能力。
- 进行消融实验,验证解耦注意力、身份变换器、记忆窗口大小及训练策略的有效性。
阅读时需要注意
- 继承SAM的纯视觉架构,缺乏处理复杂高层任务所需的推理能力。
- 虽然效率显著提升,但在极端密集或严重遮挡场景下仍可能存在身份漂移风险(尽管优于基线)。
- 实验主要在NVIDIA A6000 GPU上进行,不同硬件配置下的FPS表现可能有所差异。
- 合成基准测试用于评估可扩展性,真实世界场景的复杂性可能超出合成数据的覆盖范围。
关联工作
- SAM2:基础架构,SAM-MT在其基础上进行多目标扩展(第 1 页)
- STCN, XMem, Cutie:对比基线,这些方法虽共享特征但仍依赖对象级处理(第 2 页)
- DeAOT:对比基线,旨在解耦延迟与目标数量,但速度较低(第 7 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
SAM-MT:实时交互式多目标视频分割 沈瑞琦1,刘昌2,丁恒辉1
1复旦大学,2上海财经大学
现代视频目标分割(VOS)涉及对用户指定目标的跟踪和分割。尽管最近的方法在单目标场景中取得了显著的性能,但将它们扩展到多目标设置通常涉及为每个单独对象复制单目标处理过程,导致随着目标数量的增加,帧率(FPS)降低且延迟无界。基于 Segment Anything 2 (SAM2),我们提出了 SAM-MT,通过将模型转变为实时多目标视频分割的交互式框架来解决这一问题。SAM-MT 使用显式查询来表示不同的单独目标,并与用于全局上下文的共享表示并行工作。它采用解耦掩码注意力(Decoupled Masked Attention)以保持个体身份与跨目标干扰的分离,并使用稀疏记忆(Sparse Memory)实现稳定的时间演化,同时结合专门的处理遮挡和防止重叠的策略。SAM-MT 成功地将延迟与目标数量解耦,在保持 SAM2 强大的视频分割性能的同时,实现了与单目标基线相当的实时速度(10 个目标下 >36 FPS)。
代码:https://github.com/FudanCVL/SAM-MT 邮箱:henghui.ding@gmail.com
2026年7月1日
1 引言
当代视频目标分割(VOS)[1, 2] 在开放词汇环境中跟踪和分割用户指定的对象,其应用范围涵盖野外导航 [3] 和机器人技术 [4]。主流方法遵循时空记忆(STM)范式 [5],利用存储在密集记忆中的大量像素级表示来跟踪和分割目标,并在 VOS 基准测试 [5–12] 中取得了最先进(SOTA)的性能。[cs.CV]
尽管令人印象深刻,但大多数这些方法,包括强大的 SAM2 [9] 及其扩展 [10, 13, 14],都依赖于基于对象(object-wise)的记忆和传播,因此专为单目标处理而设计。因此,处理多个目标需要为每个额外实例重复相同的计算,如图 1(a) 所示。即使是一些早期尝试共享帧级图像特征的方法,它们仍然依赖于独立的基于对象的掩码解码和记忆编码 [6–8](图 1(b))。因此,这种直接的扩展导致随着目标数量的增加,计算成本大幅上升,导致帧率(FPS)下降且延迟无界。一种可能的变通方法是将所有目标合并为一个可跟踪的对象。然而,这种方法丢弃了单独的目标 ID,因此在实际应用中不切实际。此外,合并后的对象通常形成不规则形状,标准 VOS 模型(在真实世界对象上训练)根本无法识别和跟踪(见第 5.3 节)。
与此同时,实际应用要求对多个目标进行实时跟踪和分割。例如,用于自动驾驶的实用 VOS 系统必须 1) 在传播过程中保持单独目标的身份,同时 2) 即使在车辆和行人密集的场景中也要保持实时速度。arXiv:2607.08688v1
这些需求凸显了对实时多目标视频分割框架的需求,该框架能够在目标数量增加时保持接近单目标的效率,同时在传播过程中忠实地保持和更新单独的身份。最近的方法,包括 SAM2,难以弥合这一差距,因为它们的基于对象的处理导致计算量随目标数量增长。
因此,我们提出 SAM-MT 来解决这一问题。如图 1(c) 所示,SAM-MT 通过混合方法扩展了 SAM2 架构:它采用共享表示来建模所有目标的全局上下文,同时并行引入目标查询以表示单独的目标。为了防止跨目标
第 2 页
查询 密集记忆 … 查询 密集记忆 … 查询 密集记忆 … 稀疏记忆 …
历史查询 (T*N,C) 已保存
全局 图像 记忆 记忆 记忆 图像 图像 记忆 记忆 记忆 图像 记忆 编码器 编码器 编码器 编码器 编码器 编码器 编码器 编码器 编码器 编码器 编码器 前置查询 (N,C) 复用
匹配 匹配 匹配 匹配 匹配 匹配
解码器 解码器 解码器 解码器 解码器 解码器 解码器 (带掩码注意力)
更新
(a) STM, SAM2 等 (b) STCN, XMem, Cutie 等 (c) SAM-MT (本文) [5, 9, 10, 15–18] [6–8, 19, 20]
图 1 视频分割架构对比:单目标方法,通过 (a) 完全独立的编码或 (b) 特征共享实现,仍然依赖针对每个对象的处理,导致随着目标数量的增加,计算成本和延迟迅速增长。相比之下,(c) SAM-MT 使用共享表示来建模全局上下文,并使用轻量级查询来表示各个目标,在目标数量增加时保持接近单目标的效率,同时维持 SAM2 的视频分割性能。
干扰,我们提出了解耦掩码注意力(Decoupled Masked Attention),它限制了不同目标的查询之间的注意力交互,同时确保它们共享访问全局上下文。对于时间演化,基于查询的稀疏记忆(Sparse Memory)存储了跨帧的单个目标的历史查询,用于每个目标的重新识别。不需要额外的掩码解码器或记忆编码器,这使得 SAM-MT 能够避免冗余的针对对象计算,并在目标数量增加时保持接近单目标的效率。对于训练,我们采用步长采样(Strided Sampling)而非相邻帧,以更好地在 GPU 约束下处理遮挡。为了进一步鼓励实例级别的分离,引入了专门的监督信号来惩罚不同目标之间的重叠。
综合实验表明,SAM-MT 在涉及密集目标、频繁遮挡和长序列的真实复杂场景中实现了强大的性能。它在包括具有挑战性的 MOSEv2 [2] 和长期 LVOSv2 [21] 在内的六个 VOS 基准测试中,性能与 SAM2.1-B+ 相当。值得注意的是,随着目标数量的增加,SAM-MT 保持了接近单目标的效率,在包含 10 个目标的拥挤场景中运行速度达到 36+ FPS。这相较于 SAM2.1-B+ 等先前方法具有效率优势,后者的帧率从单目标的 37 FPS 急剧下降到 3 个目标时的 17.8 FPS 和 5 个目标时的 12.4 FPS。
总之,我们的贡献总结如下:
• 我们提出了 SAM-MT,一个用于实时交互式多目标视频分割的高效框架。通过将计算成本与目标数量解耦,SAM-MT 在目标数量增加时实现了接近单目标的效率,同时保持了 SAM2 稳健的视频分割性能。
• 我们引入了目标查询来表示单个目标,并引入解耦掩码注意力以防止跨目标干扰,同时共享全局上下文,从而在整个序列中保持目标身份。
• 我们引入了轻量级的基于查询的稀疏记忆来捕捉单个目标的时间演化,并结合步长采样和重叠防止机制以增强鲁棒性。
• SAM-MT 在交互式设置的六个具有挑战性的 VOS 基准测试中实现了具有竞争力的视频分割性能,同时在目标密度方面实现了最佳效率。对于 10 个目标,它以 36+ FPS 的实时速度运行,比 SAM2.1-B+ 快 6 倍。
2 相关工作
VOS 的单目标瓶颈。开创性的时空记忆(Space-Time Memory, STM)范式本质上是为单目标 VOS 设计的,它通过将密集像素级记忆与查询帧进行匹配来跟踪特定对象 [5, 18, 22, 23]。将此类方法扩展到多目标通常需要对每个目标复制单对象流水线,导致计算负担随目标数量增长。为了解决这个问题,后续方法如 STCN [6]、XMem [7] 和 Cutie [8] 重用帧级图像特征以共享
第 3 页
亲和度计算,但它们仍然依赖于对每个对象进行独立的掩码解码和内存编码。 尽管 SAM 系列方法在视频分割中取得了成功 [9, 10],但它们仍然遵循基于对象的处理范式,需要为每个目标复制单对象流水线,从而导致多目标流式处理成本高昂。
基于查询的分割。基于查询的 Transformer 已成为图像和视频分割的主导架构 [24, 25],已有方法 [26–43] 超越了传统的基于 CNN 的基线 [44–47]。这些方法通常使用可学习的查询,这些查询对像素级特征进行交叉注意力计算,以产生丰富的目标表示 [48],随后通过特定任务的头部进行掩码预测。最近的视频分割方法跨帧传播查询,但这些查询通常缺乏明确的目标身份,要么作为通用对象槽 [49],要么作为前景-背景表示 [8]。相比之下,SAM-MT 为每个用户指定的目标分配一个具有身份意识的查询,以实现跨帧的身份一致传播。
3 方法
3.1 预备知识:SAM2 SAM2 [9] 通过将当前帧特征条件化于密集的像素级内存上,将 Segment Anything [35] 范式扩展到视频领域。在帧 t,图像特征 $F_t \in \mathbb{R}^{HW \times C}$ 通过与内存读出 $M_{\text{dense},t} \in \mathbb{R}^{T \times HW \times C}$ 进行交叉注意力计算进行细化: $\tilde{F}_t = \text{softmax}(F_t M_{\text{dense},t}) M_{\text{dense},t}^\top + F_t$. (1)
掩码解码器随后从一组查询 $Q = [G; P]$ 生成掩码,其中 G 和 P 分别表示全局查询和编码的用户提示。这些查询首先通过自注意力进行更新,然后对 $\tilde{F}_t$ 进行交叉注意力计算以进行上下文细化和掩码预测。随后,目标被编码为密集的像素级内存表示(通常包含 4096 个 token),以及一个紧凑的对象指针作为辅助的对象级表示。
由于 SAM2 为每个对象维护独立的目标表示和密集内存,因此多目标跟踪需要复制基于对象的传播,导致延迟和内存使用量随目标数量迅速增长。
3.2 SAM-MT 概述 SAM-MT 是一个实时多目标视频分割框架,如图 2 所示。它采用基于点的交互,点击与目标 ID 关联以指定不同的对象。
输入点被编码为查询,并与 SAM2 的全局查询在解码器中结合。为了保留单个目标的身份,我们引入了解耦掩码注意力(Decoupled Masked Attention),它阻止了跨目标干扰,同时允许每个目标与全局上下文进行交互。生成的查询随后对图像特征进行交叉注意力计算,以进行像素级上下文细化,遵循 [9] 的方法。
每个目标的细化点查询随后被整合为一个唯一的目标查询(每个目标一个查询),该查询用于掩码预测并存储在跨目标共享的统一先进先出(FIFO)稀疏记忆(Sparse Memory)中。对于后续帧,身份变换器(Identity Transformer)从稀疏记忆中检索特定目标的历史查询,以更新传播的目标查询,然后将其输入解码器以重复该过程,从而实现跨帧的一致性分割。
在下文中,我们将详细介绍 SAM-MT 的核心组件:解耦掩码注意力、基于查询的稀疏记忆和身份变换器。为了简洁起见,帧内模块省略了时间下标 t。我们不对从 SAM2 继承的模块声称新颖性。
3.3 可扩展的目标查询 现有的基于查询的视频分割方法通常分配固定数量的通用查询(例如 [8] 中的 16 个),这使得它们难以扩展到具有任意数量用户指定目标的现实场景。如图 2 所示,SAM-MT 采用了一种可扩展的设计,为用户指定的目标分配显式目标查询,从而自然地适应变化的目标数量。
3
第 4 页
稀疏记忆 K&V Q 身份变换器 … … 最终 查询 查询 A B C D 结果 图像 查询全局 解耦掩码注意力 编码器 个体 A B C D 掩码 记忆 掩码 解码器 双向交叉注意力 注意力
来自 SAM2 全局 记忆 掩码 SAM-MT 新增 密集记忆 …… 编码器
图 2 SAM-MT 概览。我们的框架使用查询来表示各个目标,并与用于全局上下文的共享表示并行。我们引入解耦掩码注意力以防止目标间干扰,同时保持对全局上下文的访问。稀疏记忆存储不同目标的历史查询,这些查询由身份变换器处理,以实现鲁棒的逐帧目标重新识别。
3.4 解耦掩码注意力 为防止目标间干扰,我们在解码器的自注意力块中引入了一种解耦掩码注意力策略。令 $G \in \mathbb{R}^{N_g \times C}$ 表示全局查询,$Q_q \in \mathbb{R}^{N_q \times C}$ 表示目标 $q$ 的查询,$k$ 表示目标数量,我们将所有查询拼接为 $Q = [G; Q_1; \dots; Q_k] \in \mathbb{R}^{N \times C}$,其中 $N = N_g + \sum_{q=1}^k N_q$。这里,$N_q$ 是初始帧中用户为目标 $q$ 提供的点击次数,对于后续帧,由于每个目标由单个目标查询表示,因此简化为 $N_q = 1$(见第 3.5 节)。带有残差连接 [50] 的解耦掩码注意力计算如下: $Q' = \text{softmax}(QK^\top + M)V + Q,$ (2) 其中 $M \in \mathbb{R}^{N \times N}$ 表示注意力掩码,其元素为:
$\begin{cases} 0 & \text{if } i \in [1, N_g] \text{ and } j \in [1, N], \\ 0 & \text{if } i \in [1, N] \text{ and } j \in [1, N_g], \\ 0 & \text{if } i, j \in \text{Rng}(q), \text{ for } q \in \{1, \dots, k\}, \\ -\infty & \text{otherwise}, \end{cases}$ $M_{i,j} =$ (3)
其中 $\text{Rng}(q)$ 定义为目标 $q$ 查询的索引范围:
$\begin{pmatrix} \text{Rng}(q) = \left( N_g + \sum_{r=1}^{q-1} N_r + 1, \dots, N_g + \sum_{r=1}^{q} N_r \right). \end{pmatrix}$ (4)
得到的 $Q'$ 聚合了更新后的全局和个体上下文,从中通过 $\text{Rng}(q)$ 提取目标 $q$ 的 $Q'_q$。图 3 了解耦掩码注意力在初始帧和后续帧中的效果:不同目标查询之间的干扰被阻断,而所有目标查询共享对全局上下文的访问。随后,所有查询像 SAM2 [9] 一样与图像特征 $\tilde{F}_t$ 进行交叉注意力计算,提取用于掩码预测的像素级上下文。
3.5 查询整合(初始帧) 对于每个目标 $q$,用户可以在初始帧提供任意数量的 $N_q$ 个点。这些点由解码器处理为 $Q'_q \in \mathbb{R}^{N_q \times C}$,如第 3.4 节所述。为了获得目标的紧凑表示,我们应用基于轻量级 MLP 的加权头 $f_{\text{weight}}$ 来计算其每个点的重要性 $w_q \in \mathbb{R}^{N_q}$,将 $Q'_q \in \mathbb{R}^{N_q \times C}$ 聚合为单个查询 $\hat{Q}_q \in \mathbb{R}^{1 \times C}$,称为目标查询: $N_q$ $w_{q,i} = \text{softmax}(f_{\text{weight}}(Q'_{q,i})), \quad \hat{Q}_q = \sum_{i=1} w_{q,i} \cdot Q'_{q,i}.$ (5)
此过程仅在初始帧执行,为每个目标 $q$ 生成唯一的目标查询。对于后续帧,由于每个目标由其逐帧传播和更新的目标查询表示,因此不再需要整合,我们直接有 $\hat{Q}_q = Q'_q$。
4
第 5 页
K Q Visible K Visible Q Masked Masked Subsequent frames (propagated) Global Initial frame Global
A
B A B C C D D
图 3 解耦掩码注意力的可视化。左侧(初始帧):每个目标可以有任意数量的查询(例如,目标 A–D 分别为 3、1、2 和 2 个查询),它们在共享全局上下文的同时相互隔离。右侧(后续帧):传播的目标查询(每个目标一个查询)遵循相同的掩码规则。
3.6 基于查询的稀疏记忆
由于 SAM2 依赖于稠密像素级记忆 $M_{\text{dense},t} \in \mathbb{R}^{T \times HW \times C}$,为每个目标复制此类记忆在计算上是不可行的。为了保持实时效率,我们仅对所有目标的组合掩码使用稠密记忆以捕获全局上下文。同时,我们引入基于查询的稀疏记忆来建模各个目标的时间演化。
形式上,令 $\hat{Q}_{q,t} \in \mathbb{R}^{1 \times C}$ 表示帧 $t$ 中目标 $q$ 的更新查询。我们将所有 $k$ 个目标的查询聚合为 $\hat{Q}_t = [\hat{Q}_{1,t}, \dots, \hat{Q}_{k,t}] \in \mathbb{R}^{k \times C}$,并更新 FIFO 稀疏记忆 $M_{\text{sparse},t}$,该记忆在大小为 $T$ 帧的时间窗口内维护历史查询,包括初始帧和最近的 $T-1$ 帧:
$$ M_{\text{sparse},t} = [\hat{Q}_t, \hat{Q}_{t-1}, \dots, \hat{Q}_{t-T+2}, \hat{Q}_0] \in \mathbb{R}^{T \cdot k \times C}. \quad (6) $$
稀疏记忆将每目标每帧的存储成本从 $HW$ 个稠密 token 降低为一个目标查询 token,从而允许更长的时间窗口,这可以提高对目标遮挡和重新出现的鲁棒性。
3.7 身份变换器
为了保持跨帧的身份一致性,我们使用身份变换器,利用来自稀疏记忆的相应历史查询来更新目标查询。具体而言,在帧 $t$,来自前一帧的目标查询 $\hat{Q}_{t-1} \in \mathbb{R}^{k \times C}$ 对稀疏记忆 $M_{\text{sparse},t-1} \in \mathbb{R}^{T \cdot k \times C}$ 进行交叉注意力计算。为了防止跨目标干扰,在更新过程中应用了身份感知掩码 $\tilde{M}$:
$$ Q_t = \text{softmax}(\hat{Q}_{t-1} M_{\text{sparse},t-1}^\top + \tilde{M}) M_{\text{sparse},t-1} + \hat{Q}_{t-1}, \quad (7) $$
其中掩码 $\tilde{M} \in \mathbb{R}^{k \times (T \cdot k)}$ 确保每个目标查询仅关注其自身历史:
$$ \tilde{M}_{i,j} = \begin{cases} 0 & \text{if } j \in \Omega_i, \\ -\infty & \text{otherwise}, \end{cases} \quad (8) $$
其中 $\Omega_i = \{i + \tau \cdot k \mid 0 \le \tau \le T-1\}$ 表示目标 $i$ 的历史查询索引。
通过限制每个目标仅关注其自身历史,这种设计保持了跨帧的身份一致性,并减轻了潜在的身份漂移。
4 实验设置
4.1 实现细节
训练设置。我们从预训练的 SAM2.1-B+ [9] 检查点初始化 SAM-MT,并在 8 块 NVIDIA A6000 GPU 上进行训练。遵循 [9],图像编码器的学习率设置为 $3 \times 10^{-6}$,其他组件的学习率设置为 $5 \times 10^{-6}$。训练策略详见第 4.2 节。
5
第 6 页
训练数据。我们在 SA-V 训练集 [9] 的过滤子集上训练 SAM-MT,保留包含至少三个并发目标的序列(约占原始训练集的 35%),以鼓励鲁棒的多目标处理能力。
4.2 训练策略
训练方案。我们采用两阶段训练方案。第一阶段侧重于静态图像级训练,以确保从点击中实现高质量的一次性多目标图像分割。第二阶段将训练扩展到视频序列,鼓励跨帧的时间身份一致性。
步长采样。我们通过结合连续采样和 4 帧步长采样(跨越 32 帧窗口)来对每个序列采样 8 帧。这使得模型能够在 GPU 内存限制下捕捉短期运动和长期动态,例如遮挡和重新出现。
点采样。为了模拟真实的用户交互,我们在每个序列的初始帧中随机采样每个目标的 1–5 个正点和 0–2 个负点。我们结合基于网格的采样和随机采样以提高空间覆盖率。
重叠避免。为了减少空间歧义并鼓励每个像素仅属于一个对象,我们惩罚目标之间的掩码重叠。令 $P_i \in [0, 1]^{H \times W}$ 为目标 $i$ 的预测概率图,我们定义其重叠损失以鼓励互斥预测并缓解像素级歧义:
$$ L_{ovl,i} = \text{Mean} \left( P_i \odot \sum_{j \neq i} P_j \right). \quad (9) $$
损失设计。SAM-MT 的整体损失由两部分组成:单个掩码的监督 $L_I$ 和全局掩码的监督 $L_G$。对于 $k$ 个单个目标,我们结合使用 Focal 损失、Dice 损失和重叠损失以减少身份歧义。对于全局掩码,我们遵循 SAM2 [9] 并使用 Focal、Dice、IoU 和对象分数损失。为简洁起见,省略损失权重:
$$ L_I = \frac{1}{k} \sum_{i=1}^{k} (L_{focal,i} + L_{dice,i} + L_{ovl,i}), \quad (10) $$
$$ L_G = L_{focal} + L_{dice} + L_{iou} + L_{obj}, \quad (11) $$
$$ L_{total} = L_I + L_G. \quad (12) $$
这种双重监督鼓励连贯的全局分割,同时提高单个目标掩码的准确性。
4.3 基准和指标
为了评估 SAM-MT 在复杂现实场景中的性能,我们在六个具有挑战性的 VOS 基准上进行定量评估,包括 MOSEv2 [2]、MOSEv1 [1]、LVOSv2 [21]、LVOSv1 [51] 的验证集,以及 SA-V val [9] 和 SA-V test [9]。具体而言,MOSE 提供了具有挑战性的案例,如频繁遮挡、快速运动、低光环境以及目标不明显的拥挤场景,而 LVOS 侧重于具有对象消失和重新出现的长期时间一致性。SA-V 在重度遮挡和部件级对象建模方面提出了额外的挑战。遵循 [2, 8, 9],我们报告所有基准的 J&F,并为 MOSEv2 额外报告 J&$\dot{F}$。对于多目标可扩展性分析,我们报告每秒帧数 (FPS) 以衡量相对于目标数量的计算效率,并报告 VRAM 以量化 GPU 内存消耗。
4.4 初始化
为了公平比较,SAM-MT 和 SAM2 均使用相同的点击进行初始化,具体为每个序列初始帧中每个目标两个正点击。相比之下,所有其他基线均使用相应的真实掩码进行初始化,这比我们的交互式设置提供了更强的初始化。
第 7 页
表 1 在 VOS 基准上的定量比较。最佳和第二佳性能分别用红色和橙色标记。“–”:因显存不足不可用。
| Method | Initialization | MOSEv2-val J&F | MOSEv2-val J | MOSEv2-val F | MOSEv1-val J&F | LVOSv2-val J&F | LVOSv2-val J | LVOSv2-val F | LVOSv1-val J&F | LVOSv1-val J | LVOSv1-val F | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | STCN [6] | mask | 29.7 | 28.9 | 30.5 | 31.4 | 30.2 | 50.8 | 46.6 | 55.0 | 65.3 | 61.6 | 68.9 | 45.8 | 41.1 | 50.5 | | AOT-L [52] | mask | 30.2 | 29.0 | 31.4 | 32.9 | 31.0 | 57.2 | 53.1 | 61.3 | 63.9 | 60.0 | 67.8 | 59.4 | 53.6 | 65.2 | | R50-AOT [52] | mask | 34.9 | 33.1 | 36.6 | 38.9 | 36.0 | 58.5 | 54.4 | 62.6 | – | – | – | – | – | – | | SwinB-AOT [52] | mask | 34.2 | 32.4 | 36.0 | 38.4 | 35.4 | 60.2 | 56.2 | 64.1 | – | – | – | – | – | – | | DeAOT-L [53] | mask | 32.6 | 30.7 | 34.5 | 37.2 | 33.9 | 59.4 | 55.1 | 63.8 | 67.0 | 62.4 | 71.6 | 58.2 | 51.6 | 64.9 | | R50-DeAOT [53] | mask | 31.6 | 29.7 | 33.5 | 36.1 | 32.9 | 59.0 | 54.7 | 63.4 | 71.4 | 67.8 | 75.1 | 64.7 | 59.1 | 70.3 | | SwinB-DeAOT [53] | mask | 36.7 | 34.9 | 38.6 | 41.0 | 37.9 | 61.7 | 57.6 | 65.9 | 72.6 | 69.0 | 76.2 | 62.6 | 57.4 | 67.8 | | RDE [54] | mask | 32.0 | 30.7 | 33.3 | 35.0 | 32.8 | 48.8 | 44.6 | 52.9 | 61.5 | 58.0 | 65.0 | 52.9 | 47.7 | 58.1 | | XMem [7] | mask | 36.3 | 34.7 | 37.9 | 40.0 | 37.4 | 57.6 | 53.3 | 62.0 | 64.7 | 61.8 | 67.6 | 50.0 | 45.5 | 54.4 | | XMem++ [19] | mask | 34.2 | 32.5 | 35.9 | 37.9 | 35.2 | 56.0 | 51.5 | 60.6 | 61.5 | 58.6 | 64.3 | 42.8 | 38.6 | 47.0 | | DEVA [20] | mask | 38.3 | 36.6 | 40.0 | 42.2 | 39.4 | 60.0 | 55.8 | 64.3 | 72.4 | 68.7 | 76.1 | 55.9 | 51.1 | 60.7 | | Cutie-base [8] | mask | 42.8 | 41.1 | 44.4 | 46.8 | 43.9 | 68.3 | 64.2 | 72.3 | 70.1 | 66.7 | 73.5 | 66.0 | 61.3 | 70.6 | | SAM2.1-B+ [9] | click | 41.1 | 39.4 | 42.8 | 45.4 | 42.4 | 65.1 | 60.7 | 69.5 | 74.6 | 70.9 | 78.3 | 71.3 | 66.5 | 76.1 | | SAM-MT (Ours) | click | 43.0 | 41.4 | 44.5 | 47.1 | 44.2 | 68.2 | 64.4 | 72.0 | 76.6 | 73.3 | 80.0 | 73.6 | 69.0 | 78.3 |
表 2 在 SA-V 验证集和测试集上的定量比较。
| Method | Initialization | SA-V val J&F | SA-V val J | SA-V val F | SA-V test J&F | SA-V test J | SA-V test F | | :— | :— | :— | :— | :— | :— | :— | :— | | SwinB-AOT [52] | mask | 51.1 | 46.4 | 55.7 | 50.3 | 46.0 | 54.6 | | SwinB-DeAOT [53] | mask | 61.4 | 56.6 | 66.2 | 61.8 | 57.2 | 66.3 | | RDE [54] | mask | 51.8 | 48.4 | 55.2 | 53.9 | 50.5 | 57.3 | | XMem [7] | mask | 60.1 | 56.3 | 63.9 | 62.3 | 58.9 | 65.8 | | DEVA [20] | mask | 55.4 | 51.5 | 59.2 | 56.2 | 52.4 | 60.1 | | Cutie-base [8] | mask | 60.7 | 57.7 | 63.7 | 62.7 | 59.7 | 65.7 | | SAM2.1-B+ [9] | click | 65.6 | 62.0 | 69.3 | 66.1 | 62.4 | 69.8 | | SAM-MT | click | 66.1 | 62.9 | 69.4 | 66.4 | 63.0 | 69.8 |
5 实验
5.1 定量评估
如表 1 所示,SAM-MT 在零样本设置下在 VOS 基准上实现了强大的视频分割性能。值得注意的是,在具有挑战性的 MOSEv2 上,SAM-MT 达到了 43.0 的 J&F 分数,优于包括 SAM2.1-B+ 和 Cutie 在内的先前 SOTA 基线。在长期场景中,提升更为显著,SAM-MT 在 LVOSv2 和 LVOSv1 上的 J&F 分别比 SAM2.1-B+ 高出 2.0 和 2.3 分。表 2 进一步展示了 SAM-MT 在 SA-V 上的鲁棒性,在两个划分上均具有竞争力的 J&F 分数。
5.2 多目标可扩展性分析
基准与基线。现有的 VOS 数据集主要由单目标序列主导(例如 MOSEv2-val 中占 79%)。因此,我们构建了一个合成基准,从这些 VOS 数据集中选择多目标序列,以评估在不同目标数量下的多目标可扩展性。具体而言,该基准包含 20 个序列,对应目标数量从 1 到 20,每个序列通过填充或截断至 100 帧。示例序列如图 4 所示。我们将 SAM-MT 与 SAM2.1-B+ [9]、Cutie [8] 以及 DeAOT [53] 进行比较,DeAOT 是一种旨在将延迟与目标数量解耦的代表性 VOS 方法。为了公平比较,SAM2.1-B+ 使用其官方的多目标设置进行评估,包括基于批次的目标拼接和特征复用,其中图像特征仅计算一次并在目标间共享以加速。Cutie 和 DeAOT 在设计上就包含了这些优化。所有实验均在单块拥有 48GB 显存的 NVIDIA A6000 GPU 上进行。
FPS 比较。如表 3 和图 5 所示,SAM-MT 在很大程度上将延迟与目标数量解耦,随着目标密度的增加,保持了接近单目标的效率。尽管处理比许多基线(480p)更高分辨率的输入(1024p),SAM-MT 在所有目标数量下均实现了最高的 FPS。相比之下,随着目标数量的增加,SAM2.1-B+ 和 Cutie 的 FPS 均出现显著下降;例如,
7
第 8 页
3 个目标 7 个目标 10 个目标 14 个目标 20 个目标
图 4 多目标合成基准测试中的示例视频(初始帧)。
表 3 合成基准测试上的 FPS 对比。 40 FPS 与目标数量关系 方法 分辨率 30 1 2 3 5 7 9 11 15 20 DeAOT-L [53] 1.3 × 480p 24.7 24.7 24.7 24.2 24.2 24.1 14.1 14.0 13.7 FPS 20 SwinB-DeAOT [53] 1.3 × 480p 12.9 12.9 12.9 12.7 12.7 12.7 9.2 9.1 9.0 Cutie-base [8] 480p 31.2 31.1 30.4 27.4 23.4 21.8 20.6 18.4 15.0 10 SAM-MTSAM2.1-B+ Cutie-base [8] 1024p 20.3 17.5 14.7 13.2 11.2 9.4 8.9 7.3 6.3 Cutie-baseDeAOT-LSwinB-DeAOT(480p) 0 1 2 3 5 7 9 11 15 20 SAM2.1-B+ [9] 1024p 37.2 22.9 17.8 12.4 9.5 7.8 6.5 4.9 3.7 目标数量 SAM-MT 1024p 37.2 36.8 36.8 36.5 36.4 36.3 36.0 35.7 35.4 图 5 合成基准测试上的 FPS。
表 4 合成基准测试上的 VRAM (MB) 对比。
方法 / 目标数量 1 3 5 7 9 11 13 15 17 20
SAM2.1-B+ 3043 3356 3702 4089 4387 4529 4873 5436 6831 8585 SAM-MT 3094 3247 3312 3357 3430 3491 3548 3627 3719 3785
SAM2.1-B+ 从 37.2 FPS(1 个目标)降至 17.8 FPS(3 个目标)。尽管 DeAOT-L 和 SwinB-DeAOT 在多达 10 个目标时能保持稳定的处理速度,但超过此数量后速度急剧下降,且其 整体帧率远低于我们的方法。
VRAM 对比。表 4 比较了不同目标数量下的 VRAM 使用情况。随着目标数量增加,SAM-MT 的 内存消耗几乎保持稳定,仅从 3094 MB(1 个目标)上升到 3785 MB(20 个目标)。相比之下,SAM2.1-B+ 从 3043 MB 大幅增加到 8585 MB,显示出 我们在密集多目标场景下的内存效率优势。
VOS 基准测试上的 FPS 对比。表 5 报告了不同目标密度下 VOS 基准测试的 FPS。 尽管这些 VOS 基准测试主要由单目标序列主导,但 SAM-MT 始终维持 实时速度,仅随目标数量增加出现轻微下降(例如,在 MOSEv2 上,对于 ≥5 个目标,从 36.9 降至 35.8 FPS)。相比之下,SAM2.1-B+ 在相同设置下从 32.1 急剧下降到 11.5 FPS, Cutie 也呈现出类似趋势。虽然 DeAOT 相对保持稳定,但其整体 FPS 要低得多。
表 5 VOS 基准测试上的 FPS 对比。“All”:整个验证集;“≥2”:包含 ≥2 个并发目标的子集,依此类推。
方法 分辨率 MOSEv2 MOSEv1 LVOSv2 LVOSv1
全部 ≥2 ≥3 ≥5 全部 ≥2 ≥3 ≥5 全部 ≥2 全部 ≥2
DeAOT-L [53] 1.3 × 480p 22.9 21.5 21.4 21.1 29.7 29.0 28.9 28.5 9.5 9.5 7.2 6.5 SwinB-DeAOT [53] 1.3 × 480p 12.7 12.7 12.6 12.3 15.8 15.8 15.6 14.6 6.9 6.7 5.6 4.9 Cutie-base [8] 480p 44.3 41.0 37.9 34.8 42.7 35.9 34.6 27.7 43.4 41.9 44.8 39.6 Cutie-base [8] 1024p 21.3 16.4 14.1 10.2 21.9 15.6 12.6 10.0 19.3 15.2 21.1 16.2
SAM2.1-B+ [9] 1024p 32.1 21.3 17.3 11.5 30.5 19.0 14.5 10.8 32.0 25.6 32.2 22.1 SAM-MT 1024p 36.9 36.2 36.1 35.8 39.2 37.1 36.6 36.1 36.5 35.6 36.7 36.0
5.3 定性评估 高度密集场景。我们在密集多目标场景下评估 SAM-MT。如图 6 所示, SAM-MT 在复杂场景中实现了精确且一致的视频分割,包括马戏表演、 一群鸭子和拥挤的集体健身场景,展示了其在维护和更新方面
8
第 9 页
帧
帧 SAM-MT
帧
SAM-MT
帧
SAM-MT
帧
SAM-MT
图 6 SAM-MT 在高度密集的真实场景中的定性结果。我们的方法在保持实时、接近单目标处理速度的同时,对所有目标实现了精确的跟踪和分割。
在高度杂乱的环境中区分不同的身份。
身份模糊场景。SAM-MT 通过解耦掩码注意力(Decoupled Masked Attention)结合全局上下文和个体身份,而 SAM2 孤立地处理每个目标,并可能受到周围干扰因素的影响。如图 7 所示,在视觉相似物体(如熊猫、车辆、台球和企鹅)拥挤的场景中,SAM2.1-B+ 起初跟踪良好,但随后会出现跟踪丢失或身份漂移。相比之下,SAM-MT 解决了这些歧义,并在整个过程中保持所有目标身份的一致性。
在 SAM2 中将目标合并为单个掩码。对于针对单目标传播优化的 VOS 模型(如 SAM2),在多个目标下保持实时单目标效率的一种简单变通方法是将所有目标合并为一个统一掩码。然而,这不仅丢弃了个体 ID,还形成了不自然的形状,使得“目标”难以跟踪。如图 8 所示,将三辆车合并为一辆无法形成有意义的对象,从而导致完全丢失跟踪。相比之下,SAM-MT 以实时、接近单目标的速度准确跟踪和分割各个目标。
9
第 10 页
帧
SAM2
SAM-MT
帧
SAM2
SAM-MT
图 7 在具有多个视觉相似目标的身份模糊场景中的定性比较。SAM-MT 保持了鲁棒的时序身份一致性,而 SAM2 经常遭受跟踪丢失或身份交换的问题。
SAM2
SAM-MT
图 8 为了维持单目标效率预算,尝试跟踪合并后的目标会导致 SAM2 轻易丢失跟踪。相比之下,SAM-MT 在相同的效率预算下,能够精确地跟踪和分割各个目标,并很好地保留其身份标识(IDs)。
5.4 消融实验
我们在 MOSEv2 验证集 [2] 上进行了消融实验。遵循 [2] 的做法,我们报告了视频分割准确率的 J&F 指标,以及在适用情况下的多目标可扩展性 FPS 指标。为了公平比较,所有消融变体均使用第 4.1、4.2 和 4.4 节中描述的相同协议进行训练。
掩码注意力策略的消融。我们将解耦掩码注意力与两种替代方案进行比较:(a) 全可见性(Full Visibility),其中所有目标查询自由地相互交互;(b) 全掩码(Full Masking),其中全局查询与目标查询完全隔离。如表 6(a) 所示,允许不受限制的查询交互会导致目标查询失去其身份特异性,使 J&F 从 43.0 下降到 37.5,降幅为 5.5 点。相比之下,表 6(b) 显示,将全局上下文与目标查询隔离会削弱全局与个体之间的信息交换,导致 J&F 下降 3.7 点。这些结果验证了我们解耦设计的合理性,该设计在保持目标特定身份的同时,实现了与全局上下文的有效交互。
10
第 11 页
步长采样 无 无
步长采样 有 有
图 9 左:步长采样提高了对目标重新出现的鲁棒性。右:重叠预防减少了密集场景中的像素级身份歧义。
表 6 掩码注意力策略的消融实验。 表 7 身份变换器的消融实验。
策略 J & ˙F J ˙F FPS 策略 深度 J & ˙F J ˙F FPS
无掩码 3 39.1 37.4 40.7 37.1 (a) 全可见性 37.5 35.8 39.1 37.1 1 41.9 40.3 43.4 37.2 (b) 全掩码 39.3 37.7 40.8 36.9 有掩码 3 43.0 41.4 44.5 36.9 (c) 解耦掩码注意力 43.0 41.4 44.5 36.9 5 43.3 41.6 45.0 36.4
表 8 窗口大小的消融实验。 表 9 训练策略的消融实验。
窗口 图像 步长 重叠 J & ˙F J ˙F FPS J & ˙F 大小 预训练 采样 损失
(a) 8 42.4 40.8 44.0 37.1 (a) ✓ ✓ 40.3 (b) 12 42.6 41.0 44.2 37.1 (b) ✓ ✓ 41.7 (c) 16 43.0 41.4 44.5 36.9 (c) ✓ ✓ 42.5 (d) 32 43.1 41.6 44.6 36.6 (d) ✓ ✓ ✓ 43.0
身份变换器的消融实验。表 7 评估了身份感知掩码和变换器深度。在没有掩码的情况下,每个查询都会关注来自所有目标的历史查询,导致跨目标内存污染,J &˙F 下降了 3.9 点。同时,增加变换器块的数量可以提高准确性,但会降低 FPS。我们选择 3 个块以平衡速度和准确性。
稀疏记忆窗口大小的消融实验。表 8 评估了稀疏记忆的窗口大小,其中我们的轻量级查询使 SAM-MT 能够使用比 SAM2 更长的记忆窗口。如图所示,将窗口大小从 8 增加到 32 使 J &˙F 提高了 0.7 点,但由于额外计算,FPS 降低了 0.5。我们设置窗口大小为 16,以获得更好的准确性-速度权衡。
训练策略的消融实验。表 9 评估了训练策略。(a) 移除静态图像预训练导致 J &˙F 下降 2.7 点,表明图像级预训练对于单样本多目标图像分割的必要性。(b) 没有步长采样(即仅使用相邻帧,如 SAM2 [9] 中所示),J &˙F 下降了 1.3 点;如图 9(左)所示,这通常会导致目标重新出现时的身份丢失。(c) 如图 9(右)所示,重叠预防缓解了密集场景(例如一群移动的羊)中的掩码冲突,确保了各个目标的更清晰分离。
5.5 局限性。
据我们所知,SAM-MT 是首个在框架层面解决 SAM 系列多目标瓶颈的工作,在保持具有竞争力的视频分割精度的同时,实现了接近单目标的效率。然而,由于它继承了 SAM 的纯视觉架构,它缺乏处理复杂高级任务所需的推理能力。将其扩展以支持多模态或推理 [55–60] 是一个有前景的未来方向。
6 结论
我们提出了 SAM-MT,这是首个解决 SAM 系列实时交互式视频分割多目标瓶颈的框架。SAM-MT 使用轻量级查询并行表示各个目标,并与共享的全局上下文相结合,使得随着目标数量的增加,仍能保持接近单目标的效率。大量实验表明,SAM-MT 在 VOS 基准测试中保持了 SAM2 强大的分割性能,同时在野外密集场景中实现了实时速度和鲁棒性能。我们希望 SAM-MT 代表了迈向实时交互式多目标视频分割的坚实一步。
11
第 12 页
参考文献
[1] Henghui Ding, Chang Liu, Shuting He, Xudong Jiang, Philip HS Torr, 和 Song Bai。MOSE:一个用于复杂场景视频对象分割的新数据集。在 ICCV 中,第 20224–20234 页,2023。
[2] Henghui Ding, Kaining Ying, Chang Liu, Shuting He, Xudong Jiang, Yu-Gang Jiang, Philip HS Torr, 和 Song Bai。MOSEv2:一个更具挑战性的复杂场景视频对象分割数据集。arXiv 预印本 arXiv:2508.05630,2025。
[3] Jiaming Wang, Diwen Liu, Jizhuo Chen, Jiaxuan Da, Nuowen Qian, Minh Man Tram, 和 Harold Soh。Genie:一种适用于野外环境的通用导航系统。IEEE 机器人与自动化快报,2025。
[4] Brent Griffin, Victoria Florence, 和 Jason Corso。基于视频对象分割的视觉伺服控制和移动机器人上的物体深度估计。在 WACV 中,第 1647–1657 页,2020。
[5] Seoung Wug Oh, Joon-Young Lee, Ning Xu, 和 Seon Joo Kim。使用时空记忆网络进行视频对象分割。在 ICCV 中,第 9226–9235 页,2019。
[6] Ho Kei Cheng, Yu-Wing Tai, 和 Chi-Keung Tang。重新思考时空网络:通过改进的记忆覆盖实现高效的视频对象分割。在 NeurIPS 中,第 34 卷,第 11781–11794 页,2021。
[7] Ho Kei Cheng 和 Alexander G Schwing。Xmem:基于阿特金森-希夫林记忆模型的长期视频对象分割。在 ECCV 中,第 640–658 页。Springer,2022。
[8] Ho Kei Cheng, Seoung Wug Oh, Brian Price, Joon-Young Lee, 和 Alexander Schwing。将物体重新引入视频对象分割。在 CVPR 中,第 3151–3161 页,2024。
[9] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson 等人。Sam 2:在图像和视频中进行分割。在 ICLR 中,第 28085–28128 页,2025。
[10] Shuangrui Ding, Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Yuwei Guo, Dahua Lin, 和 Jiaqi Wang。Sam2long:通过免训练记忆树增强 Sam 2 以进行长视频分割。在 ICCV 中,第 13614–13624 页,2025。
[11] Henghui Ding, Chang Liu, Shuting He, Xudong Jiang, 和 Chen Change Loy。MeViS:一个用于带运动表达视频分割的大规模基准。在 ICCV 中,第 10156–10166 页,2023。
[12] Henghui Ding, Chang Liu, Shuting He, Kaining Ying, Xudong Jiang, Chen Change Loy, 和 Yu-Gang Jiang。MeViS:一个用于指代运动表达视频分割的多模态数据集。IEEE TPAMI,47(12):11400–11416,2025。
[13] Cheng-Yen Yang, Hsiang-Wei Huang, Wenhao Chai, Zhongyu Jiang, 和 Jenq-Neng Hwang。Samurai:利用感知运动的记忆适配分割一切模型以进行零样本视觉跟踪。arXiv 预印本 arXiv:2411.11922,2024。
[14] Jovana Videnovic, Alan Lukezic, 和 Matej Kristan。一种用于 Sam2 视觉对象分割的干扰感知记忆。在 CVPR 中,第 24255–24264 页,2025。
[15] Ho Kei Cheng, Yu-Wing Tai, 和 Chi-Keung Tang。模块化交互式视频对象分割:交互到掩码、传播和差异感知融合。在 CVPR 中,第 5559–5568 页,2021。
[16] Li Hu, Peng Zhang, Bang Zhang, Pan Pan, Yinghui Xu, 和 Rong Jin。学习基于记忆的视频对象分割中的位置和目标一致性。在 CVPR 中,第 4144–4154 页,2021。
[17] Haozhe Xie, Hongxun Yao, Shangchen Zhou, Shengping Zhang, 和 Wenxiu Sun。用于视频对象分割的高效区域记忆网络。在 CVPR 中,第 1286–1295 页,2021。
[18] Haochen Wang, Xiaolong Jiang, Haibing Ren, Yao Hu, 和 Song Bai。Swiftnet:实时视频对象分割。在 CVPR 中,第 1296–1305 页,2021。
[19] Maksym Bekuzarov, Ariana Bermudez, Joon-Young Lee, 和 Hao Li。Xmem++:从少量标注帧实现生产级视频分割。在 ICCV 中,第 635–644 页,2023。
[20] Ho Kei Cheng, Seoung Wug Oh, Brian Price, Alexander Schwing, 和 Joon-Young Lee。通过解耦视频分割进行任意物体跟踪。在 ICCV 中,第 1316–1326 页,2023。
12
第 13 页
[21] Lingyi Hong, Zhongying Liu, Wenchao Chen, Chenzhi Tan, Yuang Feng, Xinyu Zhou, Pinxue Guo, Jinglun Li, Zhaoyu Chen, Shuyong Gao, 等。Lvos: 大规模长时视频目标分割基准。IEEE TPAMI, 2025.
[22] Hongje Seong, Seoung Wug Oh, Joon-Young Lee, Seongwon Lee, Suhyeon Lee, 和 Euntai Kim。用于视频目标分割的层次 记忆匹配网络。In ICCV, 第 12889–12898 页, 2021.
[23] Kwanyong Park, Sanghyun Woo, Seoung Wug Oh, In So Kweon, 和 Joon-Young Lee。逐片段视频目标 分割。In CVPR, 第 1352–1361 页, 2022.
[24] Xiangtai Li, Henghui Ding, Wenwei Zhang, Haobo Yuan, Guangliang Cheng, Pang Jiangmiao, Kai Chen, Ziwei Liu, 和 Chen Change Loy。基于 Transformer 的视觉分割:综述。IEEE TPAMI, 2024.
[25] Jianzong Wu, Xiangtai Li, Shilin Xu, Haobo Yuan, Henghui Ding, Yibo Yang, Xia Li, Jiangning Zhang, Yunhai Tong, Xudong Jiang, Bernard Ghanem, 和 Dacheng Tao。迈向开放词汇学习:综述。IEEE TPAMI, 2024.
[26] Henghui Ding, Chang Liu, Suchen Wang, 和 Xudong Jiang。VLT:用于指代分割的视觉-语言 Transformer 和查询 生成。IEEE TPAMI, 45(6):7900–7916, 2023.
[27] Henghui Ding, Song Tang, Shuting He, Chang Liu, Zuxuan Wu, 和 Yu-Gang Jiang。多模态指代 分割:综述。IJCV, 2026.
[28] Bowen Cheng, Alex Schwing, 和 Alexander Kirillov。逐像素分类并非语义分割所需的一切。NeurIPS, 34:17864–17875, 2021.
[29] Golnaz Ghiasi, Xiuye Gu, Yin Cui, 和 Tsung-Yi Lin。使用图像级标签扩展开放词汇图像分割。 In ECCV, 第 540–557 页。Springer, 2022.
[30] Bowen Cheng, Ishan Misra, Alexander G Schwing, Alexander Kirillov, 和 Rohit Girdhar。掩码注意力 掩码 Transformer 用于通用图像分割。In CVPR, 第 1290–1299 页, 2022.
[31] Junjie He, Pengyu Li, Yifeng Geng, 和 Xuansong Xie。Fastinst:一种简单的基于查询的实时 实例分割模型。In CVPR, 第 23663–23672 页, 2023.
[32] Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, 和 Henghui Ding。关于 3D 高斯溅射在分割、编辑和生成中的综述。IEEE TPAMI, 2026.
[33] Feng Li, Hao Zhang, Huaizhe Xu, Shilong Liu, Lei Zhang, Lionel M Ni, 和 Heung-Yeung Shum。Mask dino: 迈向统一的基于 Transformer 的目标检测和分割框架。In CVPR, 第 3041–3050 页, 2023.
[34] Jitesh Jain, Jiachen Li, Mang Tik Chiu, Ali Hassani, Nikita Orlov, 和 Humphrey Shi。Oneformer:一个 Transformer 统治通用图像分割。In CVPR, 第 2989–2998 页, 2023.
[35] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C Berg, Wan-Yen Lo, 等。Segment anything。In ICCV, 第 4015–4026 页, 2023.
[36] Lei Ke, Mingqiao Ye, Martin Danelljan, Yu-Wing Tai, Chi-Keung Tang, Fisher Yu, 等。高质量 Segment anything。NeurIPS, 36:29914–29934, 2023.
[37] Mingqiao Ye, Seoung Wug Oh, Lei Ke, 和 Joon-Young Lee。Entitysam:分割视频中的所有内容。In CVPR, 第 24234–24243 页, 2025.
[38] Chang Liu, Henghui Ding, 和 Xudong Jiang。GRES:广义指代表达式分割。In CVPR, 第 23592–23601 页, 2023.
[39] Henghui Ding, Chang Liu, Suchen Wang, 和 Xudong Jiang。用于指代分割的视觉-语言 Transformer 和查询生成。In ICCV, 第 16321–16330 页, 2021.
[40] Weijia Wu, Yuzhong Zhao, Zhuang Li, Lianlei Shan, Hong Zhou, 和 Mike Zheng Shou。具有动态查询的图像分割 持续学习。IEEE Transactions on Circuits and Systems for Video Technology, 34 (6):4874–4886, 2023.
[41] Yuchen Zhu, Cheng Shi, Dingyou Wang, Jiajin Tang, Zhengxuan Wei, Yu Wu, Guanbin Li, 和 Sibei Yang。 重新思考用于持续图像分割的基于查询的 Transformer。In CVPR, 第 4595–4606 页, 2025.
[42] Chang Liu, Xudong Jiang, 和 Henghui Ding。Primitivenet:分解指代分割的全局约束。Visual Intelligence, 2(1):16, 2024.
13
第 14 页
[43] Henghui Ding, Chang Liu, Shuting He, Xudong Jiang, 和 Yu-Gang Jiang。GREx:通用指代表达式分割、理解与生成。IJCV,2026。
[44] Jonathan Long, Evan Shelhamer, 和 Trevor Darrell。用于语义分割的全卷积网络。在 CVPR 中,第 3431–3440 页,2015。
[45] Liang-Chieh Chen, George Papandreou, Iasonas Kokkinos, Kevin Murphy, 和 Alan L Yuille。Deeplab:使用深度卷积网络、空洞卷积和全连接 CRF 的语义图像分割。IEEE TPAMI,40 (4):834–848,2017。
[46] Kaiming He, Georgia Gkioxari, Piotr Dollár, 和 Ross Girshick。Mask R-CNN。在 ICCV 中,第 2961–2969 页,2017。
[47] Tianheng Cheng, Xinggang Wang, Lichao Huang, 和 Wenyu Liu。边界保留的 Mask R-CNN。在 ECCV 中,第 660–676 页。Springer,2020。
[48] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, 和 Illia Polosukhin。注意力即所需。在 NeurIPS 中,第 30 卷,2017。
[49] Bowen Cheng, Anwesa Choudhuri, Ishan Misra, Alexander Kirillov, Rohit Girdhar, 和 Alexander G Schwing。Mask2Former 用于视频实例分割。arXiv 预印本 arXiv:2112.10764,2021。
[50] Kaiming He, Xiangyu Zhang, Shaoqing Ren, 和 Jian Sun。用于图像识别的深度残差学习。在 CVPR 中,第 770–778 页,2016。
[51] Lingyi Hong, Wenchao Chen, Zhongying Liu, Wei Zhang, Pinxue Guo, Zhaoyu Chen, 和 Wenqiang Zhang。LVOS:长期视频对象分割基准。在 ICCV 中,第 13480–13492 页,2023。
[52] Zongxin Yang, Yunchao Wei, 和 Yi Yang。使用 Transformer 关联对象进行视频对象分割。在 NeurIPS 中,第 34 卷,第 2491–2502 页,2021。
[53] Zongxin Yang 和 Yi Yang。解耦分层传播中的特征以用于视频对象分割。在 NeurIPS 中,第 35 卷,第 36324–36336 页,2022。
[54] Mingxing Li, Li Hu, Zhiwei Xiong, Bang Zhang, Pan Pan, 和 Dong Liu。用于视频对象分割的循环动态嵌入。在 CVPR 中,第 1332–1341 页,2022。
[55] Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, 和 Jiaya Jia。Lisa:通过大语言模型进行推理分割。在 CVPR 中,第 9579–9589 页,2024。
[56] Zheng Weihua, Xin Huang, Zhengyuan Liu, Tarun Kumar Vangani, Bowei Zou, Xiyan Tao, Yuhao Wu, AiTi Aw, Nancy F Chen, 和 Roy Ka-Wei Lee。Adamcot:通过自适应多语言思维链重新思考跨语言事实推理。在 AAAI 中,第 33863–33871 页,2026。
[57] Zheng Weihua, Roy Ka-Wei Lee, Zhengyuan Liu, Wu Kui, Aiti Aw, 和 Bowei Zou。CCL-XCoT:一种高效的跨语言知识迁移方法以减轻幻觉生成。在计算语言学协会 EMNLP 2025 发现论文集中,第 1768–1788 页,2025。
[58] Zechen Bai, Tong He, Haiyang Mei, Pichao Wang, Ziteng Gao, Joya Chen, Zheng Zhang, 和 Mike Zheng Shou。一个令牌分割所有:视频中的语言指导推理分割。在 NeurIPS 中,第 37 卷,第 6833–6859 页,2024。
[59] Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng 等人。Sa2VA:将 SAM2 与 LLaVA 结合,用于图像和视频的密集接地理解。arXiv 预印本 arXiv:2501.04001,2025。
[60] Weihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu, Yujia Hu, Xing Xie 等人。MMA-ASIA:用于文化接地评估的多语言和多模态对齐框架。arXiv 预印本 arXiv:2510.08608,2025。
14