SAM-MT:实时交互式多目标视频分割,延迟与目标数无关

SAM-MT的核心架构

现有视频对象分割方法如SAM2在处理多目标时,计算成本随目标数量线性增长,难以在密集场景中保持实时性。SAM-MT通过解耦全局上下文与个体目标查询,引入稀疏记忆和身份变换器,实现了高效的多目标跟踪与分割。实验显示,在MOSEv2等基准上性能优于SAM2.1-B+,且在10个目标场景下FPS从7.8提升至36.3。需注意,该方法仍为纯视觉架构,极端遮挡下可能存在身份漂移。