MobileSAM2:用超图蒸馏实现移动端视频分割

三分钟导读:本文提出HyperKD(超图知识蒸馏)框架,通过构建时序和粒度超图显式提取并蒸馏SAM2中的高阶知识,从而训练出在移动端资源受限设备上高效运行的轻量级MobileSAM2模型。

英文题目:MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

论文出处:arXiv 每日论文精选 · arXiv:2607.12297

原始论文:PDF / 论文页面

对应视频标题:MobileSAM2:用超图蒸馏实现移动端视频分割|推荐指数:★★★★

这篇论文解决什么问题?

大型视频基础模型SAM2虽然性能强大,但参数量巨大,难以在移动手机、笔记本电脑等资源受限设备上部署。

核心创新

  • 首次将超图引入视频分割知识蒸馏,显式建模高阶语义关系。
  • 设计Temporal HyperKD和Granularity HyperKD,分别提取时序和多粒度知识。
  • 提出基于HyperKD指导的渐进式模型收缩策略,平衡效率与性能。

方法概览

提出Hypergraphical Knowledge Distillation (HyperKD),包含Temporal HyperKD和Granularity HyperKD,利用超图显式建模并蒸馏时序一致性和多粒度语义关系;结合渐进式模型收缩策略搜索轻量级MobileSAM2架构。

逐图理解论文

方法概述

方法概述
Fig. 1: Video Segmentation Comparison5. With the proposed HyperKD and the searched model architectures, our MobileSAM2 works effectively with limited parameters.

本文提出Hypergraphical Knowledge Distillation (HyperKD)框架,通过构建时序和粒度超图显式提取并蒸馏SAM2中的高阶知识,从而训练出在移动端资源受限设备上高效运行的轻量级MobileSAM2模型。

模型架构搜索

模型架构搜索
Table 1: Architectures of our searched lightweight MobileSAM26.

结合渐进式模型收缩策略搜索轻量级MobileSAM2架构,平衡效率与性能。Table 1展示了搜索到的轻量级MobileSAM2架构细节。

实验设置

实验设置
Table 2 show the benchmarking of our methods with state-of-the-art knowledge distillation methods, including FitNets [55], CIRKD [70], and FAKD [77], over 5 widely used video segmentation datasets including 2 general video object segmentation (VOS) dataset (i.e., MOSE [10], DAVIS 2017 [64]), 1 long-term VOS dataset (LVOS [24]), and 2 segment anything in videos dataset (SA-V) [54] (i.e., dataset SA-V-val [54] and SA-V-test [54]).

在MOSE, DAVIS 2017, LVOS, SA-V-val, SA-V-test五个基准上进行视频分割评测。与FitNets, CIRKD, FAKD等SOTA知识蒸馏方法及轻量级非蒸馏模型对比。

定量结果

定量结果
Table 2: VOS comparison. With the proposed HyperKD and the searched model architectures, our MobileSAM2 works effectively with limited parameters on video segmentation. Note SAM2 Large [54] serves as the teacher model for all knowledge distill methods. For fair comparsion, all methods process video sequences.

MobileSAM2-23M在LVOS val上J&F得分为69.0,优于FitNets (60.8)和CIRKD (61.5)。MobileSAM2-5M在DAVIS 2017 val上J&F得分为51.0,优于FitNets (38.7)。

具身智能应用

具身智能应用
Table 9: Application of MobileSAM2 on Embodied AI.

在LIBERO-PRO上,MobileSAM2-23M平均成功率为21.8%,优于SAM2-TinyViT-21M (19.3%)。Table 9展示了MobileSAM2在具身智能任务上的应用效果。

实验与关键结果

  • 在MOSE, DAVIS 2017, LVOS, SA-V-val, SA-V-test五个基准上进行视频分割评测。
  • 与FitNets, CIRKD, FAKD等SOTA知识蒸馏方法及轻量级非蒸馏模型对比。
  • 在Embodied AI任务(LIBERO-PRO)和TrackAnything (TAM)上验证泛化性。
  • 进行消融实验分析HyperKD各组件、超图构建阈值、距离度量及数据比例的影响。
  • MobileSAM2-23M在LVOS val上J&F得分为69.0,优于FitNets (60.8)和CIRKD (61.5)(第 11 页)
  • MobileSAM2-5M在DAVIS 2017 val上J&F得分为51.0,优于FitNets (38.7)(第 11 页)
  • MobileSAM2-23M在SA-V test上J&F得分为67.8,接近SAM2 Base+ (74.7)但参数量仅为23.7M vs 68.7M(第 11 页)
  • 在LIBERO-PRO上,MobileSAM2-23M平均成功率为21.8%,优于SAM2-TinyViT-21M (19.3%)(第 15 页)

阅读时需要注意

  • 模型架构搜索空间为手动设计,缺乏自动化神经架构搜索的优化保证。
  • 仅使用约10%的SA-V数据进行蒸馏训练,虽高效但可能限制对长尾分布的覆盖。
  • HyperKD依赖于教师模型SAM2的高质量特征,若教师模型特征噪声大可能影响蒸馏效果。
  • 超图构建中的距离阈值ϵ对性能敏感,需仔细调参(文中建议1.0)。

关联工作

  • SAM2:教师模型,提供被蒸馏的基础能力。(第 1 页)
  • FitNets:基线知识蒸馏方法,用于对比。(第 11 页)
  • CIRKD:SOTA知识蒸馏方法,用于对比。(第 11 页)
  • FAKD:SOTA知识蒸馏方法,用于对比。(第 11 页)
  • TrackAnything (TAM):用于验证HyperKD在其他基础模型上的泛化性。(第 15 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

MobileSAM2:面向空间智能的轻量级“分割任意”模型

Kai Jiang1, Jiaxing Huang1,⋆, Jingyi Zhang2, Weiying Xie3, Yunsong Li3, Yufei Wang4, Aoran Xiao2, 和 Dacheng Tao2

1 香港理工大学,中国香港 2 南洋理工大学,新加坡 3 西安电子科技大学,中国 4 SparcAI Inc.,美国 xdjiangkai@foxmail.com, jiaxing.huang@polyu.edu.hk

摘要。近期的大型视频基础模型 SAM2 能够实现对图像和视频的“分割任意”(segment anything),作为各种应用的强大基础模型。然而,许多此类应用场景需要在手机和笔记本电脑等资源受限的设备上运行。在本工作中,我们旨在通过将重量级的 SAM2 蒸馏为轻量级模型,使其更适用于移动设备,从而在移动设备上实现图像和视频的“分割任意”。为此,我们提出了超图知识蒸馏(Hypergraphical Knowledge Distillation, HyperKD)的思想,旨在有效地从 SAM2 中提取并迁移其泛化且全面的知识。HyperKD 包含时序超图知识蒸馏(Temporal HyperKD)和粒度超图知识蒸馏(Granularity HyperKD),它们分别构建超图以显式建模并提取 SAM2 中的泛化时序知识和全面的细粒度知识,随后通过将其与构建的超图对齐,将这些知识蒸馏到轻量级学生模型中。此外,我们提出了 MobileSAM2,这是一个新的轻量级 SAM2 系列模型,通过在模型尺寸缩减过程中利用 HyperKD 搜索最佳模型架构,以平衡效率与效果。在多个基准上的大量实验验证了 MobileSAM2 的有效性,并展示了其在具身智能(Embodied AI)任务中良好的泛化性能。

关键词:分割任意模型 · 知识蒸馏 · 轻量级模型 · 空间智能 · 具身智能

1 引言

利用大规模视觉数据训练的大型视觉基础模型 [26, 35, 53, 54] 在计算机视觉的各个领域都取得了显著成功。一个突出的例子是分割任意模型(Segment Anything Model, SAM)[35],这是首个图像分割基础模型,它通过 11 亿个掩码标注学习了超过 1100 万张图像,从而实现了“分割任意”。最近,SAM2 [54]

⋆ 通讯作者。

第 2 页

2 K. Jiang 等

图 1: 视频分割对比$^5$。借助提出的 HyperKD 和搜索到的模型架构,我们的 MobileSAM2 在参数量有限的情况下也能有效工作。

已将 SAM 扩展至视频分割,同时保持其图像分割能力不变。SAM2 从包含 113.8K 个视频和 40.9M 个掩码标注(例如,SA-V 手动和内部数据 [54])的史无前例的数据集中学习了丰富的时序和分割知识,并以显著优势超越了传统方法,展示了在静态图像和视频流中对任何事物进行分割的强大灵活性,并表现出强大的泛化能力和零样本能力。

鉴于其令人印象深刻的性能,SAM2 已被用作多种计算机视觉应用的强大基础模型,例如视频编辑 [5, 42]、交通监控 [78, 82]、自动驾驶汽车 [12, 49]、机器人 [11, 27] 等。另一方面,许多这些用例需要在资源受限的设备 [31,36,58](如手机、笔记本电脑、无人机、机器人等)上运行。在本工作中,我们旨在通过将 SAM2 蒸馏为轻量级模型,使其更易于在移动设备上使用,从而促进在移动设备上对图像和视频进行任何事物的分割。

我们首先考察 SAM2 成功背后的关键因素。与之前的视频分割方法相比,SAM2 首次将视频训练数据扩展到了前所未有的水平,无论是在视频数量还是掩码标注的粒度方面,从中学习两种关键类型的知识,包括 (1) 时序知识:SAM2 通过从超过 10 万个视频(约为之前最大数据集的 50 倍)中学习,捕捉视频帧之间丰富的时序相关性,最终获得可泛化的时序知识,使其能够沿视频帧进行鲁棒的分割;以及 (2) 多粒度知识:SAM2 从超过 4000 万个多级掩码标注(例如,物体以及部分和子部分)中捕捉多个粒度级别的视觉概念的多粒度相关性,最终学习到全面的

$^5$ SAM2-TinyViT 表示使用 TinyViT [66] 作为骨干网络的 SAM2。实验细节请参阅表 2。

第 3 页

MobileSAM2 3

多粒度知识,从而实现对视频中各种视觉概念的全面且由粗到细的理解与分割。受这些见解的启发,我们认为蒸馏 SAM2 知识的一种有效方法是全面转移这两种类型的知识,使得轻量级学生模型能够继承 SAM2 鲁棒且全面的视频分割能力。

为此,我们提出了超图知识蒸馏(Hypergraphical Knowledge Distillation, HyperKD),该方法将超图的概念引入知识蒸馏,旨在有效地建模并将 SAM2 的可泛化且全面的知识转移到轻量级模型中。由于这两种类型的知识隐式地编码在 SAM2 的学习参数中,因此难以直接访问,HyperKD 构建超图以显式建模并从 SAM2 中提取可泛化的时序知识和全面的多粒度知识,然后通过将其与构建的超图对齐,将这些知识蒸馏到轻量级学生模型中。

我们通过两个示例实例化了 HyperKD,分别命名为时序超图知识蒸馏(Temporal HyperKD)和粒度超图知识蒸馏(Granularity HyperKD)。Temporal HyperKD 首先将单个视频帧内的图像块/对象视为节点,并将它们嵌入之间的距离视为边,然后通过融合来自每个单独帧的边形成超边,将跨帧的多个相关节点连接起来构建超图。Granularity HyperKD 首先将单个分割粒度层级内的分割实体视为节点,并将它们嵌入之间的距离视为边,然后通过融合来自每个单独分割粒度层级的边形成超边,将跨分割粒度层级(例如,对象、部件和子部件)的多个相关节点连接起来构建超图。

此外,基于我们提出的 HyperKD,我们引入了 MobileSAM2,这是一系列新的轻量级“分割一切”(segment anything)模型,在模型大小和性能之间取得了良好的平衡。具体而言,我们采用渐进式模型收缩策略 [56] 来迭代地缩小大型模型,通过搜索和识别在模型收缩过程中最能保留 SAM2 的时序和多粒度知识(即那些能最小化 HyperKD 损失的模型架构)的模型架构,生成一系列轻量级“分割一切”模型。

我们的 MobileSAM2 具有三个理想的特性:(1) 鲁棒的时序分割:Temporal HyperKD 建模并转移 SAM2 的时序知识,使 MobileSAM2 能够捕捉视频帧之间丰富的相关性,并实现沿视频帧的鲁棒分割;(2) 全面的多粒度分割:Granularity HyperKD 使 MobileSAM2 能够捕捉多个分割粒度层级之间的多样化相关性,从而实现全面且由粗到细的理解与分割;(3) 效率与有效性:通过 HyperKD 搜索最佳模型架构,生成的 MobileSAM2 在模型大小和性能之间实现了有效的平衡。

本工作的主要贡献有三方面。首先,我们引入了超图用于知识蒸馏的概念,以显式建模和转移

第 4 页

4 K. Jiang 等

将 SAM2 的泛化且全面的知识蒸馏到一个轻量级模型中。 据我们所知,这是首个探索利用超图进行视频分割知识蒸馏的工作。其次,我们设计了 HyperKD,包括 Temporal HyperKD 和 Granularity HyperKD,以有效地蒸馏时序和多粒度知识。第三,我们提出了 MobileSAM2,这是一个新的轻量级 segment anything 模型系列,有效地平衡了模型大小与性能。第四,大量实验证明了 MobileSAM2 在多个基准测试中的卓越性能。

2 相关工作

2.1 Segment Anything Model

Segmentation Anything Models (SAMs) 在 diverse datasets 上展示了令人印象深刻的零样本泛化能力和交互式分割能力。SAM [35]、SEEM [86] 和 Semantic-SAM [38] 等模型通过使用可提示架构推进分割任务,该架构处理空间(点、框、掩码)和/或语义(文本)提示以生成分割掩码。Fast-SAM [84]、MobileSAM [79] 和 TinySAM [57] 提升了推理速度,而 HQ-SAM [32] 提高了分割质量。SAM2 [54] 将 SAM [35] 扩展至视频分割,通过基于记忆的 Transformer,在存储对象信息并处理历史交互的基础上,实现了跨视频帧的鲁棒且全面的分割。然而,SAM2 庞大的参数量和计算需求使其在资源受限设备上的部署具有挑战性。压缩和加速 SAM2 是一个尚未充分探索的问题。我们致力于将 SAM2 蒸馏为轻量级模型,使其能够在移动设备上高效地处理图像和视频的分割任务。

2.2 Knowledge Distillation

知识蒸馏 (KD) [20] 旨在大型教师模型的指导下训练紧凑且高效的学生模型。通过从教师的软标签中学习,学生模型可以超越仅使用硬标签训练的模型。KD 方法 broadly categorized 为基于 logit、基于特征和基于关系的方法。基于 logit 的 KD [6, 23, 30, 47, 81, 83] 最小化学生与教师预测概率之间的距离度量,例如 KL 散度,这些概率通常源自 logit 输出的 softmax。基于特征的 KD [7,8,21,22,40,41,43,55,60,61,75] 使用中间特征图或精炼信息作为知识。基于关系的 KD [39,45,50,51,62,72] 对齐学生与教师网络之间的实例相关性。在本工作中,我们的目标是通过捕捉和封装跨帧的由粗到细的语义关系,蒸馏出 SAM2 从超过 100K 视频和 40M 标注中学习到的泛化时序和多粒度知识,从而在轻量级 MobileSAM2 中实现鲁棒且全面的视频分割。

第 5 页

MobileSAM2 5

2.3 超图

超图 [1,14–16,18,19,19,28,34,37,65] 是一种高级数据结构,通过允许超边同时连接多个节点来捕捉复杂的、高阶的关联。这种能力使得超图在建模传统成对图结构无法充分表示的复杂关系方面特别有效。超图已广泛应用于社交网络分析 [71,76]、药物-靶点相互作用建模 [29,63] 和脑网络分析 [67,87] 等领域,在这些领域中,多向交互对于理解潜在结构至关重要。在本工作中,我们设计了一种超图知识蒸馏方法,构建时序和粒度超图,以蒸馏 SAM2 从海量数据集中学到的可泛化知识。这种方法有效地揭示了不同视觉概念在视频帧之间的由粗到细的高阶语义关系,从而产生了一个具有鲁棒且全面的视频分割能力的轻量级 MobileSAM2。

3 方法论

本节介绍了 MobileSAM2,这是一个新的微小且高效的“分割任意”模型系列,在视频分割上实现了有效且高效的蒸馏。我们首先在 3.1 节介绍预备知识。然后在 3.2 节介绍用于小型“分割任意”模型训练的超图知识蒸馏(Hypergraphical Knowledge Distillation, HyperKD)框架。之后,我们在 3.4 节设计了一个新的微小模型系列,通过逐步缩小大型种子模型来平衡效率与效果。

3.1 预备知识

Segment Anything Model 2 (SAM2) [54] 是一个用于视频和图像分割的统一模型。SAM2 旨在利用“可提示分割”(Promptable Segmentation)方案来分割任意对象,该方案中,模型基于视频中任意帧的给定提示(如点、框或掩码)生成交时空域掩码(即“掩码片段”,masklet)的分割结果。当提供适当的提示时,SAM2 可以分割单张图像中的目标对象以及跨视频帧的对象。此外,SAM2 支持“交互式分割”,允许用户通过模型内循环(model-in-the-loop)标注迭代地细化分割结果并扩充训练数据。这一过程造就了一个更强大的 SAM2,能够以更灵活和准确的方式处理多样化的分割任务。 SAM2 通常分两个阶段工作。它首先将输入帧和一组提示编码为特征嵌入,然后根据这些特征以及来自先前观测帧的记忆上下文预测预期的分割掩码。具体而言,SAM2 由图像编码器 EncoderI、记忆模块 MemModule、提示编码器 EncoderP 和掩码解码器 Decoder 组成。给定输入视频 $x_I \in \mathbb{R}^{T \times H \times W \times 3}$,其中 $T$ 是帧数

第 6 页

6 K. Jiang 等

图 2: HyperKD 概览。HyperKD 构建超图,以显式建模并从 SAM2 中提取可泛化的时序知识和全面的多粒度知识,然后通过将其与构建的超图对齐,将这些知识蒸馏到轻量级的 MobileSAM2 中。具体而言,Temporal HyperKD 将单帧内的对象视为节点,并通过超边在帧间连接多个相关节点来构建超图,如沿时序维度所示。Granularity HyperKD 将单个粒度层级内的分割实体视为节点,并通过超边在粒度层级之间(例如,对象、部件和子部件)连接多个相关节点来构建超图,如沿粒度维度所示。通过这种方式,训练后的 MobileSAM2 捕获了跨多个帧和粒度层级的丰富且多样的超图相关性,最终实现了鲁棒且全面的视频理解和分割。 的帧,以及第一帧上的提示 $x_P$,SAM2 首先将 $x_I$ 和 $x_P$ 编码为嵌入,如下所示:

$z^{I} = \textbf{Encoder}^{I}(x^{I}),\;z^{P}=\textbf{Encoder}^{P}(x^{P}).$ (1)

然后,记忆模块根据过去 $N$ 帧的嵌入 $\{z^{I}(j)\}_{j=i-N}^{i-1}$ 和预测 $\{m(j)\}_{j=i-N}^{i-1}$ 对第 $i$ 帧嵌入 $z^{I}_{i}$ 进行条件化处理,如下所示:

$z^{I}_{m}(i) = \textbf{Module}\left(z^{I}(i)\mid\{z^{I}(j)\}_{j=i-N}^{i-1},\{m(j)\}_{j=i-N}^{i-1}\right)$ (2)

其中 $\{z^{I}(j)\}_{j=i-N}^{i-1}$ 和 $\{m(j)\}_{j=i-N}^{i-1}$ 与 $z^{I}(t)$ 交互,导致产生条件化帧嵌入 $z^{I}_{m}$。 掩码解码器 Decoder 然后对提示嵌入 $z^{P}$ 条件下的条件化帧嵌入 $z^{I}_{m}(t)$ 进行解码: $m^{(i)}, c^{(i)} = \textbf{Decoder}\left(z^{I}_{m}(i)\mid z^{P}\right)$ (3)

其中 $z^{P}$ 与 $z^{I}_{m}(i)$ 交互,产生二进制分割预测 $m \in \mathbb{R}^{T \times M \times H \times W}$,其中包括 $M$ 个有效掩码,每个掩码对应不同级别的分割粒度,以及相应的置信度分数 $c \in \mathbb{R}^{T \times M}$。 基于 FitNet [55] 的朴素解决方案。在本文中,我们采用 SAM2 [64] 作为预训练的教师模型,使用 Hiera-L [56] 作为图像编码器。我们采用

第 7 页

MobileSAM2 7

FitNet 方法 [55] 用于知识蒸馏,其中教师模型通过将对齐学生模型图像编码器的中间特征表示与教师模型的相应表示,来指导学生模型。给定无标签视频 $x_I$,教师模型首先通过其图像编码器生成特征嵌入,这些嵌入作为学生模型图像编码器对应层的对齐目标。这种中间表示的对齐增强了我们蒸馏设置中的知识迁移。在无标签数据上对学生模型的无监督训练公式化为:

\begin{equation} \text{fitnet\_loss} = \|z^I_t – z^I_s\|_1, \tag{4} \end{equation}

该式对齐来自教师图像编码器 $\text{Encoder}^I_t$ 和学生图像编码器 $\text{Encoder}^I_s$ 的中间特征嵌入 $z^I_t$ 和 $z^I_s$。

3.2 超图知识蒸馏 (Hypergraphical Knowledge Distillation)

我们观察到,SAM2 的成功源于其从大规模、多粒度视频数据中捕获的两种关键类型的知识:用于跨帧鲁棒分割的时序知识,以及用于在多个层级上深入理解视觉概念的多粒度知识。受此启发,我们提出了超图知识蒸馏(Hypergraphical Knowledge Distillation, HyperKD),该方法利用超图进行知识蒸馏,以有效地捕获并将上述两种类型的知识封装到轻量级模型中。由于 SAM2 的时序和多粒度知识隐式编码在其参数中,HyperKD 通过超图显式地对它们进行建模,学生模型学习模仿这些超图。我们通过两种方法实例化 HyperKD:Temporal HyperKD,它连接跨帧的相关节点以捕获时序一致性;以及 Granularity HyperKD,它连接跨分割层级的节点以传达多层级理解。

Temporal HyperKD Temporal HyperKD 以两步方式工作。第一步是时序超图提取,包括节点和超边的构建,旨在揭示 SAM2 中隐式编码的可泛化时序知识。第二步是时序超图封装,将提取的时序超图封装到学生模型中,使学生模型能够生成更具时序一致性的分割结果。 时序超图提取。利用教师模型视频嵌入 $z^I_t$ 中包含的可泛化时序知识,我们将提出的基于补丁的时序超图(Patch-wise Temporal Hypergraph)和基于实例的时序超图(Instance-wise Temporal Hypergraph)分别公式化为 $GP^t_a = (VP^t_a, EP^t_a)$ 和 $G^{Inst} = (V^{Inst}, E^{Inst})$,它们能够捕获跨帧的时序语义关系和关联。对于 $GP^t_a$,我们将视频嵌入 $z^I_t$ 解构为基于网格的补丁以构成顶点集 $VP^t_a$。对于 $G^{Inst}$,我们通过根据教师模型预测 $m^t$ 中每帧的高置信度分割条目对视频嵌入 $z^I_t$ 进行池化,来构成顶点集 $V^{Inst}$。 不失一般性,为了建立建模 $V$ 中顶点之间关系的超边,我们在每个顶点周围应用 $\epsilon$-球距离阈值。一个

第 8 页

8 K. Jiang et al.

ϵ-ball 形成一个超边,该超边包含距离中心顶点一定距离 ϵ 内的所有顶点。因此,超边集合 EPt a 或 EInst 构建如下: \mathcal { E } = \{\text{ball}(v,\epsilon\midv\in\mathcal\label{eq:HyperedgeExtraction} (5) 其中 ball(v, ϵ) = {u | dist(xIu−xIv) < ϵ, u ∈V} 表示给定顶点 v 的邻接顶点集,V 是 VPt a 或 VInst ,dist(xIu−xIv) 是用于确定邻近度的距离函数。在实际应用中,超图 G 由其关联矩阵 H 表示,其中如果顶点 u 是中心在顶点 v 的超边的一部分,则 H(u, v) = dist(xIu −xIv) = 1 −⟨xIu, xIv⟩/(∥xIu∥∥xIv∥),否则 H(u, v) = 0。 时序超图封装(Temporal Hypergraph Encapsulation)将提取的超图 GPt a 和 GInst 捕获的补丁级和实例级可泛化时序知识封装到学生模型中,从而在学生模型中保留 SAM2 的可泛化时序知识。具体而言,类似于 GPt a 和 GInst 的构建,我们为学生模型的视频嵌入 zIs 构建 GPs a 和 GInss 。然后,通过最小化以下损失函数,将提取的时序超图 GPt a 和 GInst 封装到学生模型中:

\ma t hca l { L}\ _ te x t K{TH D } \ = |H^{Pa}_t-H^{Pa}_s\|_\text\|H^{Ins}_t-H^{Ins}_s\|_\text(6)

其中 HPt a , HInst , HPs a 和 HInss 分别指 GPt a , GInst , GPs a 和 GInss 的关联矩阵。 通过这种方式,时序超图知识蒸馏(Temporal HyperKD)确保补丁级和实例级时序超图捕获特征空间内的邻域关系,有效地将 SAM2 的可泛化时序知识蒸馏到学生模型中,使学生模型能够保持时序一致性,并在视频帧间实现鲁棒的分割。

粒度超图知识蒸馏(Granularity HyperKD)由于时序超图知识蒸馏仅蒸馏可泛化的时序知识,我们进一步设计了粒度超图知识蒸馏,以提取粒度超图并将其封装到学生模型中,从而提高不同细节层次上的分割精度。具体而言,粒度超图捕获了多粒度级别分割实体之间的层次关系,通过提供正交且多粒度的知识来补充时序超图。 粒度超图提取。给定第 i 帧嵌入 zIt (i) ∈RD×h×w 及其预测的二值分割掩码 m(i) ∈RM×H×W,其中包含来自教师模型的 M 个级别的分割粒度,我们将粒度超图实例化为 GGrant = (VGrant , EGrant ),其中每个节点 v ∈VGrant 根据预测的二值分割掩码对帧嵌入进行池化初始化,如下所示:

\fo n ^ \ M o t otesize \mathcal {V} {Gr an} _t= \lef t { \ t ex t b f { askedAveragePooling}\left(z^{I}_t(i,j),m(i,j)\right)\midj=1,\dotsM\right(7)

超边集合 EGrant 可以使用公式 5 构建。 粒度超图封装(Granularity Hypergraph Encapsulation)将提取的粒度超图中的正交和多粒度知识封装到

第 9 页

MobileSAM2 9

学生模型。该过程补充了时序超图,并通过使模型能够在不同细节层次(如对象、部件和子部件)上分割对象,从而提高了分割精度。具体而言,类似于 GGrant 的构建方式,我们利用教师模型的预测结果 $m^{(i)}$,为学生模型的视频嵌入 $z^I_s$ 构建 $G^{Gran}_s$。随后,我们遵循与“时序超图封装”类似的方法,通过最小化以下损失函数,将提取的粒度超图封装到学生模型中:

$$ \mathcal{L}_{\text{GHKD}} = \|H^{Gran}_t – H^{Gran}_s\| \quad (8) $$

其中 $H^{Gran}_t$ 和 $H^{Gran}_s$ 分别是 $G^{Gran}_t$ 和 $G^{Gran}_s$ 的关联矩阵。

3.3 总体目标

综上所述,所提出的 HyperKD 的总体训练损失可以表述为:

$$ \text{Loss} = \| z^I_t – z^I_s \|_1 \alpha \cdot \mathcal{L}_{\text{THKD}} + \beta \cdot \mathcal{L}_{\text{GHKD}}, \quad (9) $$

其中 $\alpha$ 和 $\beta$ 是加权系数。

3.4 模型架构

我们介绍了 MobileSAM2,这是 SAM2 的轻量级版本,在模型大小和性能之间取得了平衡。虽然 SAM2 的内存模块、提示编码器和掩码解码器都很轻量(参数量低于 12M),但其基于 Hiera-L [56] 的图像编码器拥有超过 2.12 亿个参数,对于资源受限的设备来说过于沉重。因此,实例化 MobileSAM2 的关键在于减小图像编码器的大小,同时保留 SAM2 强大且全面的视频分割能力。

受此观察的启发,我们通过渐进式模型收缩方法 [13] 对大型模型种子进行缩放,为 SAM2 提出了一类新的分层视觉 Transformer [56]。具体而言,我们从一个手动设计的 Hiera 骨干网开始,将其作为图像编码器,该骨干网保持了原始 Hiera 设计的核心原则。然后,我们建立了一个包含关键架构组件(如嵌入维度、层数、注意力头配置和扩展比率)的收缩因子参数化搜索空间。渐进式模型收缩过程迭代地识别有前景的架构,最终产生一个更小的 Hiera 变体,它在保持具有竞争力的性能的同时,最大限度地减少了计算复杂度和内存使用,使其适合高效部署。Hiera 以一个补丁嵌入层开始,将输入图像处理为 token,随后是几个阶段,每个阶段通过下采样逐渐增加通道维度并降低空间分辨率。该架构通过在早期阶段使用轻量级的 MultiScaleBlock 层,并在后期阶段过渡到窗口自注意力机制,强调了高效的参数使用。我们考虑以下收缩因子来构建模型:

第 10 页

10 K. Jiang 等

表 1:我们搜索得到的轻量级 MobileSAM26 的架构。

收缩因子 ΓEmb ΓBlk ΓWinSiz ΓHExp 参数量 (M)

MobileSAM2-5M [48, 96, 192, 384] [1, 2, 5, 2] [8, 4, 14, 7] 2 5.84 MobileSAM2-10M [64, 128, 256, 512] [1, 2, 5, 2] [8, 4, 14, 7] 2 10.37 MobileSAM2-23M [96, 192, 384, 768] [1, 3, 9, 1] [8, 8, 14, 7] 2 23.74

– ΓEmb:每个阶段的嵌入维度。减小该值会导致网络更窄,多头自注意力中的头数更少。 – ΓBlk:每个阶段的块数量。通过减小这些值来降低模型的深度。 – ΓWinSiz:每个阶段的窗口大小。较小的窗口大小会导致自注意力期间的操作和模型参数减少。 – ΓHExp:每个阶段多头注意力中注意力头的扩展率。降低每个注意力头的维度会直接减少自注意力的计算负担,从而降低计算成本。

我们通过渐进式模型收缩方法对上述因子进行缩放,并搜索和识别出一个新的轻量级 SAM2 家族,命名为 MobileSAM2,如表 1 所示。

4 实验

表 2 展示了我们的方法与最先进的知识蒸馏方法(包括 FitNets [55]、CIRKD [70] 和 FAKD [77])在 5 个广泛使用的视频分割数据集上的基准测试结果,包括 2 个通用视频对象分割 (VOS) 数据集(即 MOSE [10]、DAVIS 2017 [64])、1 个长期 VOS 数据集(LVOS [24])和 2 个视频中的“任意分割”数据集(SA-V)[54](即数据集 SA-V-val [54] 和 SA-V-test [54])。

4.1 实现细节

我们使用设计的 MobileSAM2 作为轻量级学生模型,并使用 SAM2-L [64](以 Hiera-L [56] 作为图像编码器)作为预训练教师模型。由于 SAM2 的记忆模块(即记忆注意力、记忆编码器和记忆库)、提示编码器和掩码解码器相对轻量(参数量低于 12M),我们通过训练其图像编码器来优化 MobileSAM2,同时保持其剩余模块(即从预训练 SAM2-L 教师模型复制的记忆模块、提示编码器和掩码解码器)冻结。我们仅使用约 10% 的 SA-V 数据 [54](即 11K 视频)进行高效的蒸馏训练。遵循 SAM2 [54],我们采用 AdamW [44] 优化器,初始学习率为 5 × 10−4。所有模型均在 A100 (80GB) GPU 上训练 5 个 epoch,批量大小为 5,每个样本使用 8 帧序列。训练时间为 65 小时。对于每次迭代,我们使用 4 × 4 的空间提示网格由教师模型进行掩码预测。我们设置权重系数 α = 1 和 β = 1 以平衡时序一致性和层次知识迁移。

6 有关 MobileSAM2 架构的更多详细信息,请参阅附录。

第 11 页

MobileSAM2 11

表 2:VOS 对比。借助提出的 HyperKD 和搜索到的模型架构,我们的 MobileSAM2 在视频分割任务中以有限的参数量实现了有效性能。请注意,SAM2 Large [54] 作为所有知识蒸馏方法的教师模型。为了公平比较,所有方法均处理视频序列。

J&F Model 蒸馏方法 参数量 (M) MOSE val DAVIS 2017 val LVOS val SA-V val SA-V test

100% 训练数据,使用 256 块 A100 GPU:113.8K 视频(SA-V 手动数据和内部数据 [54])

SAM2 Base+ [54] – 68.7 72.8 88.8 75.8 72.2 74.7 SAM2 Large [54] – 212.1 74.6 89.2 81.7 74.5 76.0

~10% 训练数据,使用 1 块 A100 GPU:11K 视频(来自 SA-V 手动数据 [54])

无蒸馏 5.4 26.0 30.4 30.8 28.4 27.7 SAM2-TinyViT-5M FitNet [55] 5.4 33.8 38.7 37.7 34.3 35.1

无蒸馏 5.8 29.7 36.6 33.8 32.7 33.0 FitNet [55] 5.8 36.6 41.5 39.7 38.2 39.3 CIRKD [70] 5.8 36.8 43.3 41.2 38.3 38.6 MobileSAM2-5M CAT-KD [21] 5.8 35.0 41.9 40.3 38.3 39.8 FAKD [77] 5.8 37.7 42.5 41.0 39.6 39.9 HyperKD (Ours) 5.8 44.6 51.0 48.8 49.2 49.4

无蒸馏 11.2 27.9 29.6 32.5 28.9 30.8 SAM2-TinyViT-11M FitNet [55] 11.2 36.4 40.0 39.8 37.8 39.0

无蒸馏 10.4 30.9 35.7 34.4 33.7 34.2 FitNet [55] 10.4 38.9 44.3 42.2 41.6 41.4 CIRKD [70] 10.4 40.8 45.8 43.7 42.4 43.2 MobileSAM2-10M CAT-KD [21] 10.4 39.9 44.3 42.9 41.3 41.8 FAKD [77] 10.4 41.3 46.7 44.0 42.4 43.3 HyperKD (Ours) 10.4 48.7 54.2 51.8 49.9 50.0

无蒸馏 21.2 30.3 35.2 34.5 32.0 34.7 SAM2-TinyViT-21M FitNet [55] 21.2 44.9 49.0 47.0 45.8 45.6

无蒸馏 23.7 39.5 44.7 44.8 42.4 44.3 FitNet [55] 23.7 57.4 61.1 60.8 59.4 59.9 CIRKD [70] 23.7 60.4 62.1 61.5 60.7 60.5 MobileSAM2-23M CAT-KD [21] 23.7 60.2 62.1 61.1 59.7 59.9 FAKD [77] 23.7 60.6 65.0 63.4 62.0 62.7 HyperKD (Ours) 23.7 65.8 72.1 69.0 66.4 67.8

4.2 结果

与 SAM2 [54] 一致,我们提出的 MobileSAM2 旨在用于通用、交互式、可提示的视频分割任务,同时我们也解决了半监督视频对象分割 (VOS) 设置,其中提示是第一帧的真实掩码,因为这是该领域的常见协议。我们在表 2 中将 MobileSAM2 与现有的最先进知识蒸馏方法以及配备最先进轻量级骨干网 (Tiny-ViT [66]) 的 SAM2 进行了比较,并报告了基于标准协议的准确率。我们评估了三个不同模型尺寸(5M、10M 和 23M)的 MobileSAM2 版本,每个版本提供了不同的尺寸-准确率权衡。

通用 VOS 数据集上的结果。表 2 展示了在两个通用 VOS 数据集 MOSE 和 DAVIS 2017 上的视频对象分割结果。MobileSAM2 在这些数据集上相比基线实现了显著的性能提升。具体而言,MobileSAM2 在 J&F 分数上大幅优于最先进的方法,突显了我们提出的 HyperKD 在探索高效轻量级模型架构方面的有效性,以及

第 12 页

12 K. Jiang et al.

表 3:HyperKD 结合 Temporal HyperKD 与 Granular HyperKD 的消融研究。 实验在 LVOS val 上的视频对象分割 (VOS) 任务上进行。

Temporal HyperKD Granular HyperKD J&F Patch-wise Instance-wise

MobileSAM2-23M (Baseline/no distill) – – – 44.8 ✓ 62.9 ✓ 64.4 ✓ ✓ 64.4 ✓ 63.1 MobileSAM2-23M ✓ ✓ ✓ 69.0

从预训练的 SAM2 模型中蒸馏知识。MobileSAM2 的优越性能很大程度上归功于 HyperKD 捕获可泛化时序知识和全面多粒度知识的能力,使其能够关注对象的跨时序和多粒度空间线索。这不仅有利于轻量级 MobileSAM2 的架构搜索,还增强了从 SAM2 到轻量级 MobileSAM2 的蒸馏过程。所有方法均显示出性能提升。然而,MobileSAM2 实现了最显著的提升,证明了其通过有效从 SAM2 中蒸馏时序和多粒度知识,能够紧密对齐 SAM2 的表示能力。 长期 VOS 数据集上的结果。表 2 还报告了在长期 VOS 数据集 LVOS 上的实验。MobileSAM2 以显著优势超越所有竞争方法,证明了 HyperKD 在捕获 SAM2 的可泛化时序和多粒度知识以用于长期视频分割方面的有效性和鲁棒性。MobileSAM2 在 LVOS 上取得的巨大性能提升,突显了其由 HyperKD 指导探索的轻量级架构的效率,以及通过 HyperKD 从 SAM2 蒸馏知识的有效性。 视频段 Anything (Segment Anything in Videos) 数据集上的结果。我们在视频段 Anything 数据集(即 SA-V val 和 SA-V test)上评估了我们 MobileSAM2 的有效性,该数据集衡量“任意”对象类别的开放世界分割性能 [54]。表 2 报告了 VOS 结果,展示了相对于基线的显著改进,并优于最先进的方法,从而突显了 MobileSAM2 的优越性。

4.3 消融研究

在表 3 中,我们在 LVOS 数据集上进行了消融研究,以评估我们提出的 MobileSAM2 各组成部分的独立贡献。基线模型在没有从 SAM2 蒸馏的情况下表现不佳,这是因为它捕获视觉概念的高阶时序和多粒度语义关系的能力有限。相比之下,引入 Patch-wise Temporal HyperKD 显著改善了基线性能,表明 Patch-wise Temporal HyperKD 有效地捕获了帧间的块级时序依赖关系。此外,应用

第 13 页

MobileSAM2 13

表 4:在 LVOS 数据集上,HyperKD 中超图构建阈值 $\epsilon$ 的参数分析。

模型架构 MobileSAM2-23M

$\epsilon$ 0.5 0.75 1.0 1.25 1.5

J&F 65.2 68.4 69.0 68.1 62.0

表 5:我们的 HyperKD 与传统基于双顶点图的知识蒸馏在 LVOS 上的对比。

模型架构 MobileSAM2-23M

蒸馏方法 无蒸馏 Context Matters [69] IntRA-KD [25] HyperKD (Ours)

J&F 44.8 60.7 60.9 69.0

实例级时序 HyperKD 带来了进一步的提升,表明它增强了跨帧的实例级时序知识。此外,引入粒度 HyperKD 进一步提升了性能,证明其提供了互补的多粒度知识,有效地促进了鲁棒且全面的视频分割能力。

4.4 讨论

参数研究。在超图的构建中,预定义的 $\epsilon$-球距离阈值用于建立超边,以建模超图中顶点之间的关系。我们通过以 0.25 为步长将 $\epsilon$ 从 0.5 变化到 1.5 来研究其影响。表 4 报告了在 LVOS 数据集上的实验结果。我们还观察到,MobileSAM2 的性能在 0.75 到 1.25 之间相对稳定,仅有微小变化,而在 0.5 和 1.5 的阈值处性能出现下降。较高的阈值会创建连接更紧密的超图,从而增加过平滑的风险;而较低的阈值可能导致超图连接不足,无法捕捉高阶关系。为了平衡这些因素,我们的 HyperKD 在构建超图时使用距离阈值 1.0,这是通过经验选择的,旨在保持连通性而不产生过度的平滑。

HyperKD 与基于图的知识蒸馏。我们将 HyperKD 与先前的基于图的知识蒸馏方法 Context Matters [69] 和 IntRA-KD [25] 进行了比较。如表 5 所示,HyperKD 优于 Context Matters 和 IntRA-KD,主要原因是 Context Matters 和 IntRA-KD 的图无法有效捕捉视觉概念之间的高阶语义关系,而我们的基于超图的方法成功实现了这一点。

用于构建超图的距离度量。我们探索了用于超图构建的不同特征距离度量,并使用了以下度量进行实验:1) 余弦相似度 [9],2) 欧几里得距离 [9],以及 3) 曼哈顿距离 [9]。表 7 中的结果表明,HyperKD 在所有度量下均表现有效且一致。其中,余弦相似度取得了最佳结果,这主要是因为它与注意力机制相契合,

第 14 页

14 K. Jiang et al.

表 6:移动 GPU 上的效率对比。

模型 参数量 (M) 推理 FPS LVOS

SAM2 Base+ 68.7 内存溢出 – SAM2 Large 212.1 内存溢出 –

SAM2-TinyViT-5M 5.4 13.1 37.7 MobileSAM2-5M 5.8 13.3 48.8 SAM2-TinyViT-11M 11.2 11.3 39.8 MobileSAM2-10M 10.4 10.8 51.8 SAM2-TinyViT-21M 21.2 8.0 47.0 MobileSAM2-23M 23.7 8.2 69.0

表 7:在 LVOS 上,使用不同距离度量构建 HyperKD 中超图的分析。

模型架构 MobileSAM2-23M

距离度量 余弦相似度 (本文) 欧氏距离 曼哈顿距离

J&F 69.0 67.2 65.7

使其成为 SAM2 中可泛化时序知识和全面多粒度知识蒸馏的自然选择。 效率分析。我们使用 PyTorch 2.3.1 和 CUDA 12.1(采用自动混合精度 bfloat16),在单张 RTX 4060 (8GB) 移动 GPU 上评估所有模型的推理速度效率。我们对所有模型使用 torch.compile 编译了图像编码器。视频对象分割的 FPS 测量遵循常见协议,批量大小设为 1。表 6 报告了 LVOS 数据集上的结果,表明与原始 SAM2 相比,MobileSAM2 在保持具有竞争力的性能的同时,显著降低了计算开销,使其更适用于资源受限设备的移动端部署。 HyperKD 对其他基础模型的适用性。我们在 TrackAnything (TAM) [73] 上进行了实验,如表 8 所示。这证明了 HyperKD 在 SAM2 之外的适用性:在相同的数据受限设置(∼10%)下,将其应用于结构上独立的 TrackAnything (TAM) [73],HyperKD 将 DAVIS-2017 上 TAM-TinyViT-21M 的 J&F 从 58.9 提升至 63.1,将 MobileTAM-23M 从 60.8 提升至 66.5。更关键的是,它将蒸馏目标与架构设计解耦:由于 TAM 与 SAM2 或 MobileSAM2 没有架构渊源,一致的增益证实性能提升源于 HyperKD 目标本身,而非与特定骨干网络的协同适应。综上所述,这些发现确立了 HyperKD 作为一种可泛化的蒸馏框架,并验证了 MobileSAM2 上的增益反映了真正的知识迁移,而非搜索架构带来的伪影。 MobileSAM2 在具身智能中的应用。随着推理模型和智能体的出现 [17,74,80],为了验证 MobileSAM2 在具身智能系统中的应用,我们将 MobileSAM2 集成到 CaP-Agent0 [17] 中作为核心感知模型,并在 LIBERO-PRO [85] 上评估其操作性能。

第 15 页

MobileSAM2 15

表 8:HyperKD 在 TrackAnything (TAM) [73] 中的适用性。我们在 DAVIS-2017 上报告了 J&F 分数。

模型 蒸馏方法 参数量 (M) DAVIS-2017 J&F

100% 训练数据

TrackAnything (TAM) [73] – 636 73.1

~10% 训练数据

无蒸馏 21.2 58.9 TAM-TinyViT-21M HyperKD (Ours) 21.2 63.1

无蒸馏 23.7 60.8 MobileTAM-23M HyperKD (Ours) 23.7 66.5

表 9:MobileSAM2 在 Embodied AI 中的应用。

方法 Libero-Object Libero-Goal Libero-Spatial 平均 位置 (平均) 任务 (平均) 位置 (平均) 任务 (平均) 位置 (平均) 任务 (平均)

OpenVLA [33] 0 0 0 0 0 0 0 π0 [3] 0 0 0 0 0 0 0 π0.5 [2] 17 1 38 0 20 1 12.8 SAM3 [4]-CaP-Agent0 [17] 27 31 29 16 13 23 23.2

SAM2-TinyViT-21M – CaP-Agent0 21 27 23 13 11 21 19.3 MobileSAM2-23M – CaP-Agent0 24 30 28 14 12 23 21.8

如表 9 所示,基于完整 SAM3 的 CaP-Agent0 实现了 23.2% 的平均成功率,优于基于训练的 VLA 基线模型如 \pi _{0.5}[2] (12.8%)。在相当的小参数规模下,基于最先进 Tiny-ViT [66] 骨干网络的 SAM2-TinyViT-21M 降至 19.3%。相比之下,我们的 MobileSAM2-23M 达到了 21.8% 的平均成功率,保持了具有竞争力的性能,并在空间推理任务和 Embodied AI 任务上优于 SAM2-TinyViT-21M。这些结果表明,MobileSAM2 是资源受限机器人平台的高效感知骨干网络,能够在几乎不牺牲性能的情况下实现实用的机载部署。

5 结论

本文提出了一类微小且高效的视频基础模型系列 MobileSAM2,该系列模型利用提出的 HyperKD 从大型 SAM2 中蒸馏而来。HyperKD 包含 Temporal HyperKD 和 Granularity HyperKD,它们分别构建超图以显式建模并从 SAM2 中提取可泛化的时序知识和全面的多粒度知识,从而促进从 SAM2 到 MobileSAM2 的知识蒸馏以及 MobileSAM2 的模型架构搜索。在多个视频分割数据集上的大量实验表明,MobileSAM2 consistently 以显著优势优于最先进的方法。

致谢

[致陶教授] 本项目由新加坡国家研究基金会 (National Research Foundation, Singapore) 在其 NRF 教授奖 (NRF Professorship Award) 编号 NRF-P2024-001 下资助。本工作还得到了香港理工大学内部基金的支持。

第 16 页

16 K. Jiang 等

参考文献

1. Bai, S., Zhang, F., Torr, P.H.: 超图卷积与超图注意力。 Pattern Recognition 110, 107637 (2021) 2. Black, K., Brown, N., Darpinian, J., Dhabalia, K., Driess, D., Esmail, A., Equi, M.R., Finn, C., Fusai, N., Galliker, M.Y., 等: pi0.5: 具有开放世界泛化能力的视觉-语言-动作模型。 在:第9届机器人学习年度会议 (2025) 3. Black, K., Brown, N., Driess, D., Esmail, A., Equi, M., Finn, C., Fusai, N., Groom, L., Hausman, K., Ichter, B., 等: pi0: 用于通用机器人控制的视觉-语言-动作流模型。arXiv 预印本 arXiv:2410.24164 (2024) 4. Carion, N., Gustafson, L., Hu, Y.T., Debnath, S., Hu, R., Suris, D., Ryali, C., Alwala, K.V., Khedr, H., Huang, A., Lei, J., Ma, T., Guo, B., Kalla, A., Marks, M., Greer, J., Wang, M., Sun, P., Rädle, R., Afouras, T., Mavroudi, E., Xu, K., Wu, T.H., Zhou, Y., Momeni, L., Hazra, R., Ding, S., Vaze, S., Porcher, F., Li, F., Li, S., Kamath, A., Cheng, H.K., Dollár, P., Ravi, N., Saenko, K., Zhang, P., Feichtenhofer, C.: Sam 3: 使用概念分割万物 (2025), https://arxiv.org/abs/2511.16719 5. Ceylan, D., Huang, C.H.P., Mitra, N.J.: Pix2video: 使用图像扩散进行视频编辑。 在:IEEE/CVF 国际计算机视觉会议论文集。pp. 23206–23217 (2023) 6. Chen, D., Mei, J.P., Wang, C., Feng, Y., Chen, C.: 具有多样化同伴的在线知识蒸馏。 在:AAAI 人工智能会议论文集。 vol. 34, pp. 3430–3437 (2020) 7. Chen, D., Mei, J.P., Zhang, H., Wang, C., Feng, Y., Chen, C.: 利用复用教师分类器的知识蒸馏。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 11933–11942 (2022) 8. Chen, P., Liu, S., Zhao, H., Jia, J.: 通过知识回顾蒸馏知识。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 5008–5017 (2021) 9. Deza, E., Deza, M.M., Deza, M.M., Deza, E.: 距离百科全书。Springer (2009) 10. Ding, H., Liu, C., He, S., Jiang, X., Torr, P.H., Bai, S.: Mose: 复杂场景视频对象分割的新数据集。 在:IEEE/CVF 国际计算机视觉会议论文集。pp. 20224–20234 (2023) 11. Dupont, P.E., Nelson, B.J., Goldfarb, M., Hannaford, B., Menciassi, A., O’Malley, M.K., Simaan, N., Valdastri, P., Yang, G.Z.: 2010年至2020年医疗机器人研究十年回顾。Science robotics 6(60), eabi8017 (2021) 12. Faisal, A., Kamruzzaman, M., Yigitcanlar, T., Currie, G.: 理解自动驾驶汽车。Journal of transport and land use 12(1), 45–72 (2019) 13. Feichtenhofer, C.: X3d: 扩展架构以实现高效视频识别。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 203–213 (2020) 14. Feng, Y., Huang, J., Du, S., Ying, S., Yong, J.H., Li, Y., Ding, G., Ji, R., Gao, Y.: Hyper-yolo: 当视觉目标检测遇上超图计算。arXiv 预印本 arXiv:2408.04804 (2024) 15. Feng, Y., Liu, S., Han, X., Du, S., Wu, Z., Hu, H., Gao, Y.: 超图基础模型。arXiv 预印本 arXiv:2503.01203 (2025) 16. Feng, Y., You, H., Zhang, Z., Ji, R., Gao, Y.: 超图神经网络。 在:AAAI 人工智能会议论文集。vol. 33, pp. 3558–3565 (2019)

第 17 页

MobileSAM2 17

17. Fu, M., Yu, J., El-Refai, K., Kou, E., Xue, H., Huang, H., Xiao, W., Wang, G., Li, F.F., Shi, G., et al.: Cap-x: A framework for benchmarking and improving coding agents for robot manipulation. arXiv preprint arXiv:2603.22435 (2026) 18. Gao, Y., Feng, Y., Ji, S., Ji, R.: Hgnn+: General hypergraph neural networks. IEEE Transactions on Pattern Analysis and Machine Intelligence 45(3), 3181–3199 (2022) 19. Gao, Y., Zhang, Z., Lin, H., Zhao, X., Du, S., Zou, C.: Hypergraph learning: Methods and practices. IEEE Transactions on Pattern Analysis and Machine Intelligence 44(5), 2548–2566 (2020) 20. Gou, J., Yu, B., Maybank, S.J., Tao, D.: Knowledge distillation: A survey. Interna- tional Journal of Computer Vision 129(6), 1789–1819 (2021) 21. Guo, Z., Yan, H., Li, H., Lin, X.: Class attention transfer based knowledge distillation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 11868–11877 (2023) 22. Heo, B., Kim, J., Yun, S., Park, H., Kwak, N., Choi, J.Y.: A comprehensive overhaul of feature distillation. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 1921–1930 (2019) 23. Hinton, G., Vinyals, O., Dean, J.: Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531 (2015) 24. Hong, L., Chen, W., Liu, Z., Zhang, W., Guo, P., Chen, Z., Zhang, W.: Lvos: A benchmark for long-term video object segmentation. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 13480–13492 (2023) 25. Hou, Y., Ma, Z., Liu, C., Hui, T.W., Loy, C.C.: Inter-region affinity distillation for road marking segmentation. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 12486–12495 (2020) 26. Huang, J., Zhang, J., Jiang, K., Lu, S.: Open-vocabulary object detection via language hierarchy. arXiv preprint arXiv:2410.20371 (2024) 27. Javaid, M., Haleem, A., Singh, R.P., Suman, R.: Substantial capabilities of robotics in enhancing industry 4.0 implementation. Cognitive Robotics 1, 58–75 (2021) 28. Jiang, J., Wei, Y., Feng, Y., Cao, J., Gao, Y.: Dynamic hypergraph neural networks. In: IJCAI. pp. 2635–2641 (2019) 29. Jin, S., Hong, Y., Zeng, L., Jiang, Y., Lin, Y., Wei, L., Yu, Z., Zeng, X., Liu, X.: A general hypergraph learning algorithm for drug multi-task predictions in micro- to-macro biomedical networks. PLOS Computational Biology 19(11), e1011597 (2023) 30. Jin, Y., Wang, J., Lin, D.: Multi-level logit distillation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 24276– 24285 (2023) 31. Kamath, V., Renuka, A.: Deep learning based object detection for resource con- strained devices: Systematic review, future trends and challenges ahead. Neurocom- puting 531, 34–60 (2023) 32. Ke, L., Ye, M., Danelljan, M., Tai, Y.W., Tang, C.K., Yu, F., et al.: Segment anything in high quality. Advances in Neural Information Processing Systems 36 (2024) 33. Kim, M.J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al.: Openvla: An open-source vision-language- action model. arXiv preprint arXiv:2406.09246 (2024) 34. Kim, S., Lee, S.Y., Gao, Y., Antelmi, A., Polato, M., Shin, K.: A survey on hypergraph neural networks: an in-depth and step-by-step guide. In: Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. pp. 6534–6544 (2024)

第 18 页

18 K. Jiang 等

35. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., 等: Segment anything. arXiv 预印本 arXiv:2304.02643 (2023) 36. Kornaros, G.: 资源受限物联网环境中用于安全的硬件辅助机器学习:综述与未来展望。IEEE Access 10, 58603–58622 (2022) 37. Lee, G., Bu, F., Eliassi-Rad, T., Shin, K.: 超图挖掘综述:模式、 工具与生成器。arXiv 预印本 arXiv:2401.08878 (2024) 38. Li, F., Zhang, H., Sun, P., Zou, X., Liu, S., Yang, J., Li, C., Zhang, L., Gao, J.: Semantic-sam: 在任何粒度下分割和识别任意对象。arXiv 预印本 arXiv:2307.04767 (2023) 39. Li, G., Li, X., Wang, Y., Zhang, S., Wu, Y., Liang, D.: 通过秩模仿和预测引导的特征模仿进行目标检测的知识蒸馏。在: 人工智能会议论文集 (AAAI)。第 36 卷,pp. 1306–1313 (2022) 40. Li, Z., Ye, J., Song, M., Huang, Y., Pan, Z.: 用于高效姿态估计的在线知识蒸馏。在: IEEE/CVF 国际计算机视觉会议论文集 on computer vision. pp. 11740–11750 (2021) 41. Lin, S., Xie, H., Wang, B., Yu, K., Chang, X., Liang, X., Wang, G.: 通过目标感知 Transformer 进行知识 蒸馏。在: IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 10915–10924 (2022) 42. Liu, S., Zhang, Y., Li, W., Lin, Z., Jia, J.: Video-p2p: 使用交叉 注意力控制进行视频编辑。在: IEEE/CVF 计算机视觉与模式识别会议论文集 Vision and Pattern Recognition. pp. 8599–8608 (2024) 43. Liu, Y., Chen, K., Liu, C., Qin, Z., Luo, Z., Wang, J.: 用于语义分割的结构化知识 蒸馏。在: IEEE/CVF 计算机视觉与模式识别会议论文集 on computer vision and pattern recognition. pp. 2604–2613 (2019) 44. Loshchilov, I., Hutter, F.: 解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101 (2017) 45. Mei, K., Delbracio, M., Talebi, H., Tu, Z., Patel, V.M., Milanfar, P.: 条件 扩散蒸馏 (2023) 46. Miles, R., Yucel, M.K., Manganelli, B., Saà-Garriga, A.: Mobilevos: 实时视频 对象分割对比学习结合知识蒸馏。在: IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)。pp. 10480–10490 (2023年6月) 47. Mirzadeh, S.I., Farajtabar, M., Li, A., Levine, N., Matsukawa, A., Ghasemzadeh, H.: 通过教师助手改进知识蒸馏。在: 人工智能会议论文集 AAAI conference on artificial intelligence. vol. 34, pp. 5191–5198 (2020) 48. Mordeson, J.N., Nair, P.S.: 模糊图与模糊超图,第 46 卷。Physica (2012) 49. Parekh, D., Poddar, N., Rajpurkar, A., Chahal, M., Kumar, N., Joshi, G.P., Cho, W.: 自动驾驶汽车综述:进展、方法与挑战。Electronics 11(14), 2162 (2022) 50. Park, W., Kim, D., Lu, Y., Cho, M.: 关系知识蒸馏。在: IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3967–3976 (2019) 51. Peng, B., Jin, X., Liu, J., Li, D., Wu, Y., Liu, Y., Zhou, S., Zhang, Z.: 用于知识蒸馏的 相关性一致性。在: IEEE/CVF 国际计算机视觉会议论文集。pp. 5007–5016 (2019)

第 19 页

MobileSAM2 19

52. Perazzi, F., Pont-Tuset, J., McWilliams, B., Van Gool, L., Gross, M., Sorkine- Hornung, A.: A benchmark dataset and evaluation methodology for video object segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 724–732 (2016) 53. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning. pp. 8748–8763. PMLR (2021) 54. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., Mintun, E., Pan, J., Alwala, K.V., Carion, N., Wu, C.Y., Girshick, R., Dollár, P., Feichtenhofer, C.: Sam 2: Segment anything in images and videos. arXiv preprint arXiv:2408.00714 (2024), https://arxiv.org/abs/2408. 00714 55. Romero, A., Ballas, N., Kahou, S.E., Chassang, A., Gatta, C., Bengio, Y.: Fitnets: Hints for thin deep nets. arXiv preprint arXiv:1412.6550 (2014) 56. Ryali, C., Hu, Y.T., Bolya, D., Wei, C., Fan, H., Huang, P.Y., Aggarwal, V., Chowdhury, A., Poursaeed, O., Hoffman, J., et al.: Hiera: A hierarchical vision transformer without the bells-and-whistles. In: International Conference on Machine Learning. pp. 29441–29454. PMLR (2023) 57. Shu, H., Li, W., Tang, Y., Zhang, Y., Chen, Y., Li, H., Wang, Y., Chen, X.: Tinysam: Pushing the envelope for efficient segment anything model. arXiv preprint arXiv:2312.13789 (2023) 58. Shuvo, M.M.H., Islam, S.K., Cheng, J., Morshed, B.I.: Efficient acceleration of deep learning inference on resource-constrained edge devices: A review. Proceedings of the IEEE 111(1), 42–91 (2022) 59. Su, C.P., Tseng, C.H., Pu, B., Zhao, L., Yang, J., Chen, Z., Lee, S.J.: Ea-kd: Entropy-based adaptive knowledge distillation. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 731–740 (October 2025) 60. Tian, Y., Zhang, C., Guo, Z., Zhang, X., Chawla, N.: Learning mlps on graphs: A uni- fied view of effectiveness, robustness, and efficiency. In: The Eleventh International Conference on Learning Representations (2022) 61. Tian, Y., Krishnan, D., Isola, P.: Contrastive multiview coding. arXiv preprint arXiv:1906.05849 (2019) 62. Tung, F., Mori, G.: Similarity-preserving knowledge distillation. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 1365–1374 (2019) 63. Viñas, R., Joshi, C.K., Georgiev, D., Lin, P., Dumitrascu, B., Gamazon, E.R., Liò, P.: Hypergraph factorization for multi-tissue gene expression imputation. Nature machine intelligence 5(7), 739–753 (2023) 64. Voigtlaender, P., Luiten, J., Torr, P.H., Leibe, B.: Siam r-cnn: Visual tracking by re-detection. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 6578–6588 (2020) 65. Wang, Y., Kleinberg, J.: From graphs to hypergraphs: Hypergraph projection and its remediation. arXiv preprint arXiv:2401.08519 (2024) 66. Wu, K., Zhang, J., Peng, H., Liu, M., Xiao, B., Fu, J., Yuan, L.: Tinyvit: Fast pretraining distillation for small vision transformers. In: European conference on computer vision. pp. 68–85. Springer (2022) 67. Xiao, L., Wang, J., Kassani, P.H., Zhang, Y., Bai, Y., Stephen, J.M., Wilson, T.W., Calhoun, V.D., Wang, Y.P.: Multi-hypergraph learning-based brain functional connectivity analysis in fmri data. IEEE transactions on medical imaging 39(5), 1746–1758 (2019)

第 20 页

20 K. Jiang 等

68. Xu, N., Yang, L., Fan, Y., Yue, D., Liang, Y., Yang, J., Huang, T.: Youtube-vos: A large-scale video object segmentation benchmark. arXiv preprint arXiv:1809.03327 (2018) 69. Yang, A., Lin, S., Yeh, C.H., Shu, M., Yang, Y., Chang, X.: Context matters: Distilling knowledge graph for enhanced object detection. IEEE Transactions on Multimedia (2023) 70. Yang, C., Zhou, H., An, Z., Jiang, X., Xu, Y., Zhang, Q.: Cross-image relational knowledge distillation for semantic segmentation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 12319–12328 (2022) 71. Yang, D., Qu, B., Yang, J., Cudré-Mauroux, P.: Lbsn2vec++: Heterogeneous hypergraph embedding for location-based social networks. IEEE Transactions on Knowledge and Data Engineering 34(4), 1843–1855 (2020) 72. Yang, J., Martinez, B., Bulat, A., Tzimiropoulos, G., et al.: Knowledge distillation via softmax regression representation learning. International Conference on Learning Representations (ICLR) (2021) 73. Yang, J., Gao, M., Li, Z., Gao, S., Wang, F., Zheng, F.: Track anything: Segment anything meets videos (2023) 74. Yao, H., Huang, J., Wu, W., Zhang, J., Wang, Y., Liu, S., Wang, Y., Song, Y., Feng, H., Shen, L., et al.: Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search. Advances in Neural Information Processing Systems 38, 29918–29952 (2026) 75. Yim, J., Joo, D., Bae, J., Kim, J.: A gift from knowledge distillation: Fast opti- mization, network minimization and transfer learning. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 4133–4141 (2017) 76. Young, J.G., Petri, G., Peixoto, T.P.: Hypergraph reconstruction from network data. Communications Physics 4(1), 135 (2021) 77. Yuan, J., Phan, M.H., Liu, L., Liu, Y.: Fakd: Feature augmented knowledge distillation for semantic segmentation. In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision. pp. 595–605 (2024) 78. Zhang, B., Zhang, J.: A traffic surveillance system for obtaining comprehensive infor- mation of the passing vehicles based on instance segmentation. IEEE Transactions on Intelligent Transportation Systems 22(11), 7040–7055 (2020) 79. Zhang, C., Han, D., Qiao, Y., Kim, J.U., Bae, S.H., Lee, S., Hong, C.S.: Faster segment anything: Towards lightweight sam for mobile applications. arXiv preprint arXiv:2306.14289 (2023) 80. Zhang, J., Huang, J., Yao, H., Liu, S., Zhang, X., Lu, S., Tao, D.: R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 1859–1869 (October 2025) 81. Zhang, R., Shen, J., Liu, T., Liu, J., Bendersky, M., Najork, M., Zhang, C.: Do not blindly imitate the teacher: Using perturbed loss for knowledge distillation. arXiv preprint arXiv:2305.05010 (2023) 82. Zhang, X., Feng, Y., Angeloudis, P., Demiris, Y.: Monocular visual traffic surveil- lance: A review. IEEE Transactions on Intelligent Transportation Systems 23(9), 14148–14165 (2022) 83. Zhang, Y., Xiang, T., Hospedales, T.M., Lu, H.: Deep mutual learning. In: Pro- ceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 4320–4328 (2018) 84. Zhao, X., Ding, W., An, Y., Du, Y., Yu, T., Li, M., Tang, M., Wang, J.: Fast segment anything. arXiv preprint arXiv:2306.12156 (2023)

第 21 页

MobileSAM2 21

85. Zhou, X., Xu, Y., Tie, G., Chen, Y., Zhang, G., Chu, D., Zhou, P., Sun, L.: Libero- pro: Towards robust and fair evaluation of vision-language-action models beyond memorization. [arXiv preprint arXiv:2510.03827] (2025) 86. Zou, X., Yang, J., Zhang, H., Li, F., Li, L., Gao, J., Lee, Y.J.: Segment everything everywhere all at once. arXiv preprint arXiv:2304.06718 (2023) 87. Zu, C., Gao, Y., Munsell, B., Kim, M., Peng, Z., Zhu, Y., Gao, W., Zhang, D., Shen, D., Wu, G.: Identifying high order brain connectome biomarkers via learning on hypergraph. In: Machine Learning in Medical Imaging: 7th International Workshop, MLMI 2016, Held in Conjunction with MICCAI 2016, Athens, Greece, October 17, 2016, Proceedings 7. pp. 1–9. Springer (2016)

第 22 页

22 K. Jiang 等

6 附录

6.1 模型架构

我们提出的 MobileSAM2 架构详见表 10。该架构遵循分层结构,从 patch 嵌入层开始,并经过四个阶段。为了构建紧凑的 MobileSAM2 模型系列,我们采用收缩因子 {ΓEmb, ΓBlk, ΓWinSiz, ΓHExp},这使得我们能够缩小模型规模。我们以包含 2700 万参数的基础模型为起点,然后通过调整这些收缩因子生成一组候选模型。从这些候选模型中,我们选择满足参数量和吞吐量特定约束的模型。我们在 SA-V 手动数据集 [54] 的约 2% 上进行训练,并在 LVOS [24] 验证集上验证这些选定的模型。具有最高验证准确率的模型会在后续步骤中进一步细化,直到达到目标性能。

表 10:我们搜索得到的轻量级 MobileSAM2 架构。

阶段 模块 配置

Patch Conv 嵌入维度 ΓEmb_1 嵌入层

输入维度 ΓEmb_1, 输出维度 ΓEmb_2 阶段 1 多尺度模块 [66] × 1 窗口大小 ΓWinSiz_1, 注意力头数 1

输入维度 ΓEmb_2, 输出维度 ΓEmb_2 2 × 1 窗口大小 ΓWinSiz_2, 注意力头数 ΓHExp 阶段 2 多尺度模块 [66] 输入维度 ΓEmb_2, 输出维度 ΓEmb_3 MobileSAM2 × 1 窗口大小 ΓWinSiz_2, 注意力头数 ΓHExp

输入维度 ΓEmb_3, 输出维度 ΓEmb_3 2 × 4 窗口大小 ΓWinSiz_3, 注意力头数 ΓHExp 阶段 3 多尺度模块 [66] 输入维度 ΓEmb_3, 输出维度 ΓEmb_4 2 × 1 窗口大小 ΓWinSiz_3, 注意力头数 ΓHExp

输入维度 ΓEmb_4, 输出维度 ΓEmb_4 阶段 4 多尺度模块 [66] 3 × 2 窗口大小 ΓWinSiz_4, 注意力头数 ΓHExp

6.2 实现细节

我们使用 SA-V 数据集的约 10%(∼11K 个视频)作为高效蒸馏的训练数据。遵循 SAM2 的做法,我们采用 AdamW 优化器,初始学习率为 5 × 10−4。所有模型均在 A100 (80GB) GPU 上训练 5 个 epoch,批量大小为 5,每个样本包含 8 帧序列。每个训练迭代中,教师模型使用 4 × 4 的空间提示网格进行掩码预测,我们将权重系数 α = 1 和 beta = 1 设置为平衡时序一致性和层次知识转移。总训练时间约为 65 小时。

第 23 页

MobileSAM2 23

在我们的渐进式模型收缩框架中,我们从分层 ViT 种子(Hiera-B)开始,并逐步收缩一个架构轴——嵌入维度($\Gamma_{Emb}$)、块数量($\Gamma_{Blk}$)、窗口大小($\Gamma_{WinSiz}$)和头扩展($\Gamma_{HExp}$)。每次缩减步骤都会产生更轻量的候选模型,所有模型均使用相同的蒸馏配方进行训练,并在准确性和参数量方面进行评估。在每次迭代后,根据参数预算选择最佳候选模型,重复此过程,直到观察到所需的效率或收益递减。这种方法避免了昂贵的大规模搜索,明确地将架构选择与 HyperKD 和下游验证联系起来,而不仅仅是模型大小。我们的轻量级架构搜索产生了大约 15 个候选模型;每个候选模型都通过代理快速评估:图像编码器在 SA-V 的大约 10% 数据上训练一个 epoch,并根据在 LVOS 上测量的准确性选择候选模型;每次代理运行需要约 8 小时。选择 LVOS 是出于有意为之,因为我们的目标是长期时序一致性(SAM2 的核心优势),而 LVOS 是实现这一目标最相关的基准。

6.3 评估指标

我们使用两个广泛采用的评估指标:区域相似度(J)和轮廓精度(F),遵循 DAVIS 基准 [52]。

– 区域相似度(J):该指标计算真实值(G)与预测值(M)之间的交并比(IoU),定义为:

$$ J = \frac{M \cap G}{M \cup G} \quad (10) $$

– 轮廓精度(F):该指标通过计算轮廓召回率($P_c$)和轮廓精度($R_c$)的调和均值来评估分割边界的精确度,定义为:

$$ F = \frac{2 \cdot P_c \cdot R_c}{P_c + R_c} \quad (11) $$

遵循 YouTube-VOS 基准 [68],我们分别报告在已知类别和未知类别上的性能。我们计算最终的 J&F 分数如下:

$$ J\&F = \frac{J_s + J_u + F_s + F_u}{4} \quad (12) $$

其中下标 s 和 u 分别表示已知类别和未知类别的分数。这种对已知和未知类别的单独评估提供了对模型在视频对象分割(VOS)中泛化能力的更清晰衡量。

6.4 其他讨论

参数研究 为了调查 HyperKD 中不同损失函数组件的影响,我们对损失函数公式 (9) 中的权重系数 $\alpha$ 和 $\beta$ 进行了参数研究。我们在范围内调整 $\alpha$ 和 $\beta$

第 24 页

24 K. Jiang 等

[10−2, 10−1, 1, 101, 102],同时保持其他参数固定为 1。结果总结在表 11 和表 12 中。

在表 11 中,将 α 从 10−2 增加到 1 显著提升了性能,表明强制时序一致性对于视频分割至关重要。在 α = 1 时,模型取得了 69.0 的最佳 J&F 分数。对于更大的 α 值(α = 10 或 α = 102),性能下降,因为对时序一致性的过度强调可能会扭曲物体的边界。

表 11:损失函数公式 (9) 中 α 的参数研究。我们在保持 β = 1 的同时调整 α。当 α = 1 时取得最佳性能。

| 模型架构 | MobileSAM2-23M | | :— | :— | | α | 10−2 10−1 1 101 102 | | J&F | 60.2 65.7 69.0 66.8 61.4 |

在表 12 中,与 α 类似,随着 β 增加到 1,性能提升并达到 69.0 的峰值。对于非常小的 β 值(β = 10−2 或 β = 10−1),模型缺乏足够的层次特征引导,导致精度较低。对于较大的 β 值(β = 101 或 β = 102),性能下降,这可能是由于层次蒸馏带来的过度正则化所致。

表 12:损失函数公式 (9) 中 β 的参数研究。我们在保持 α = 1 的同时调整 β。当 β = 1 时取得最佳性能。

| 模型架构 | MobileSAM2-23M | | :— | :— | | β | 10−2 10−1 1 101 102 | | J&F | 59.8 64.1 69.0 67.2 62.0 |

与不同超图构建方法的比较 为了研究超图公式对知识蒸馏的影响,我们比较了模糊超图 [48] 和我们提出的基于 HyperKD 的超图构建方法。结果如表 13 所示。在没有基于超图的知识蒸馏的情况下,MobileSAM2-23M 模型仅取得 44.8 的 J&F 分数。这表明,没有超图建模的直接特征蒸馏对于有效的轻量级分割是不足的。模糊超图 [48] 方法将性能提升至 62.4 的 J&F,表明使用超图对多路关系进行建模可以增强知识迁移。然而,模糊超图 [48] 依赖于预定义的边权重,且缺乏显式的高阶结构,这限制了其在视频分割中捕捉复杂关系的能力。

第 25 页

MobileSAM2 25

HyperKD 取得了最高的 J&F 分数 69.0,显著优于 Fuzzy Hypergraph(高出 +6.6)。这表明 HyperKD 的超图公式有效地捕捉了高阶关系,从而实现了更好的时序和粒度感知知识迁移。

表 13:不同超图构建方法的比较。我们在 LVOS 验证集(J&F)上评估了不同超图公式的影响。HyperKD 优于 Fuzzy Hypergraph。

模型架构 MobileSAM2-23M

超图构建方法 无蒸馏 Fuzzy Hypergraph [48] HyperKD (Ours)

J&F 44.8 62.4 69.0

与半监督 VOS 中非 SAM2 架构基线的比较 我们进行了实验,将 MobileSAM2 与下表所示的 MobileVOS 进行比较。在相同的 11K SA-V 数据集训练和半监督 VOS 协议下,得益于 HyperKD 以及架构改进,MobileSAM2 在精度-大小权衡方面优于 MobileVOS [46],这些改进以最小的损失迁移了 SAM2 的时序和多粒度知识,验证了 MobileSAM2 的有效性和新颖性。

表 14:与半监督 VOS 中非 SAM2 架构基线的比较。为了公平比较,所有方法均处理视频序列。

J&F 模型 蒸馏方法 参数量 (M) MOSE val DAVIS2017 val LOVS val SA-V val SA-V test

使用 1 个 A100 GPU 的 ~10% 训练数据:来自 SA-V 手动数据的 11K 视频

MobileNetV2 w/o ASPP MobileVOS 1.9 35.6 40.7 36.8 37.4 37.1 MobileNetV2 MobileVOS 2.5 36.2 41.3 37.5 38.1 38.0 ResNet18 MobileVOS 8.1 37.8 42.5 41.2 40.6 41.0 MobileSAM2-5M HyperKD (Ours) 5.8 44.6 51.0 48.8 49.2 49.4 MobileSAM2-10M HyperKD (Ours) 10.4 48.7 54.2 51.8 49.9 50.0 MobileSAM2-23M HyperKD (Ours) 23.7 65.8 72.1 69.0 66.4 67.8

与近期蒸馏基线的比较 我们在以下相同的数据集/协议下将 HyperKD 与 EA-KD [59] 进行比较,表明其能更有效地迁移时序和多粒度知识。

HyperKD 中数据比例的分析 表 16 显示了训练数据比例对 HyperKD 的影响。J&F 分数从 45.2%(1%

第 26 页

26 K. Jiang 等

表 15:与近期蒸馏基线方法的比较。我们在 LVOS 验证集(J&F)上评估了不同超图构建方式的影响。

模型架构 MobileSAM2-23M

蒸馏方法 无蒸馏 EA-KD [59] HyperKD (Ours)

LOVS (J&F) 44.8 63.6 69.0

数据)提升至 73.0%(20% 数据),其中在 5% 到 10% 之间的增益最大(+13.2%)。 具体而言,在 10% 数据下,MobileSAM2-23M 达到了 69.0% 的 J&F 分数,达到了 20% 数据下性能的 94.5%,证明了 HyperKD 的数据效率。超过 15% 后,增益逐渐减小(+1.7%),表明 HyperKD 能够利用中等规模数据有效提取核心知识,从而降低对大规模数据集的依赖。 这些结果表明,HyperKD 仅需 10-15% 的数据即可实现接近最优的性能,使其非常适合资源受限的训练、实时应用以及移动端部署。

表 16:训练数据比例对 HyperKD 性能的影响。我们报告了 LVOS 验证集上的 J&F 分数(越高越好)。即使数据有限,HyperKD 也能取得具有竞争力的性能。

模型架构 MobileSAM2-23M

训练数据比例 1% 5% 10% 15% 20%

J&F 45.2 55.8 69.0 71.3 73.0

与轻量级非蒸馏模型的比较 如表 17 所示,我们使用相同的评估数据集和评估协议,对 MobileSAM2 与 FastSAM [84] 和 MobileSAM [79] 进行了对比实验。 如下表所示,拥有 68M 参数的 FastSAM 达到了 48.9% 的 J&F 分数。拥有 5.78M 参数的 MobileSAM 仅获得了显著较低的 32.2% J&F 分数。相比之下,我们的 MobileSAM2 仅用 5.84M、10.37M 和 23.74M 参数,分别达到了 48.8%、51.8% 和 69.0% 的 J&F 分数,在模型大小和性能之间实现了更好的权衡。MobileSAM2 的优越性能主要归功于我们精心设计的 HyperKD 和架构改进,这些改进有效地建模并迁移了 SAM2 丰富的时序知识和多样化的多粒度知识,而没有造成过多的精度损失。这些结果验证了 MobileSAM2 在轻量级分割任务中的有效性和新颖性。

任务特定分割损失的分析 我们评估了带有和不带有任务特定分割损失(即使用可用的

第 27 页

MobileSAM2 27

表 17:与轻量级非蒸馏模型的比较。我们在 LVOS 验证集上报告参数量 (MB) 和 J&F 分数(越高越好)。

模型架构 参数量 (MB) J&F

FastSAM [84] 68 48.9 MobileSAM [79] 5.78 32.2

MobileSAM2-5M 5.84 48.8 MobileSAM2-10M 10.37 51.8 MobileSAM2-23M 23.74 69.0

able masks) 以评估其对优化稳定性和性能的影响。如表 18 所示,移除特定任务损失可将性能提升 +1.8 J&F。我们将此归因于以下事实:源自有限 10% 标注数据集的任务损失可能会引入噪声,并与教师模型捕获的丰富结构知识发生冲突。相比之下,HyperKD 基于超图的监督提供了多级别和高质量(时序和粒度)的指导,从而稳定了优化过程并减少了对额外特定任务目标的依赖。

表 18:特定任务分割损失的分析。我们在 LVOS 验证集(J&F)上评估使用特定任务分割损失的影响。

模型架构 MobileSAM2-23M

蒸馏方法 无蒸馏 HyperKD (含特定任务损失) HyperKD (不含特定任务损失)

J&F 44.8 67.2 69.0

研究局限性 用于推导轻量级学生模型的渐进式收缩策略涉及手动设计的搜索空间(例如,嵌入维度、块数量、注意力头大小)。它缺乏神经架构搜索的自动化和优化性保证,这可能限制了 MobileSAM2 的性能上限。

HyperKD 中高阶学习的可视化 图 3 通过查询-像素相似度可视化了超图亲和结构。对于对象上的选定查询点(标记为绿色),我们计算该点与教师特征空间中每个其他空间位置之间的余弦相似度,生成一个热力图,揭示超图认为在语义上相连的像素。教师的超图清晰地分组了查询对象,高相似度集中在对象的整个范围内,且向背景的泄漏极少。通过 HyperKD 蒸馏的学生模型产生了高度相似似的相似度图,证实了核心超图结构——像素级语义分组——已成功从 224M 教师模型迁移到 23M 学生模型。

第 28 页

28 K. Jiang 等

6.5 定性结果

我们提供了更多关于 MobileSAM2-24M 的定性示例。如图 4 所示,MobileSAM2 能够在多个视频中持续生成一致的分割结果。

第 29 页

MobileSAM2 29

图 3:HyperKD 中高阶学习的可视化。

第 30 页

30 K. Jiang 等

图 4:MobileSAM2-24M 的定性示例,其中每一行对应一个视频中的帧,每个 masklet 具有唯一的颜色。

发表评论