MobileSAM2:用超图蒸馏实现移动端视频分割

方法概述

本文提出HyperKD框架,通过构建时序和粒度超图显式提取并蒸馏SAM2中的高阶知识,从而训练出在移动端资源受限设备上高效运行的轻量级MobileSAM2模型。在MOSE, DAVIS 2017, LVOS, SA-V-val, SA-V-test五个基准上进行视频分割评测,与FitNets, CIRKD, FAKD等SOTA知识蒸馏方法及轻量级非蒸馏模型对比。在Embodied AI任务(LIBERO-PRO)和TrackAnything (TAM)上验证泛化性。模型架构搜索空间为手动设计,缺乏自动化神经架构搜索的优化保证。仅使用约10%的SA-V数据进行蒸馏训练,虽高效但可能限制对长尾分布