ReflexTrack:用闭环反馈解决无训练视频分割的目标漂移问题

核心贡献

现有无训练RVOS方法多采用开环设计,缺乏对初始提示和时序传播的显式验证,导致在遮挡或形变场景下易失效。ReflexTrack通过Mask-guided Spatial Refinement和Video-level Mask Reflection构建闭环反馈,迭代优化空间提示并修复时序错误。实验显示其在Ref-VPS上显著优于基线,但在ReasonVOS上仍有提升空间。注意:该方法依赖强大MLLM,计算成本较高。

MobileSAM2:用超图蒸馏实现移动端视频分割

方法概述

本文提出HyperKD框架,通过构建时序和粒度超图显式提取并蒸馏SAM2中的高阶知识,从而训练出在移动端资源受限设备上高效运行的轻量级MobileSAM2模型。在MOSE, DAVIS 2017, LVOS, SA-V-val, SA-V-test五个基准上进行视频分割评测,与FitNets, CIRKD, FAKD等SOTA知识蒸馏方法及轻量级非蒸馏模型对比。在Embodied AI任务(LIBERO-PRO)和TrackAnything (TAM)上验证泛化性。模型架构搜索空间为手动设计,缺乏自动化神经架构搜索的优化保证。仅使用约10%的SA-V数据进行蒸馏训练,虽高效但可能限制对长尾分布

SAM-MT:实时交互式多目标视频分割,延迟与目标数无关

SAM-MT的核心架构

现有视频对象分割方法如SAM2在处理多目标时,计算成本随目标数量线性增长,难以在密集场景中保持实时性。SAM-MT通过解耦全局上下文与个体目标查询,引入稀疏记忆和身份变换器,实现了高效的多目标跟踪与分割。实验显示,在MOSEv2等基准上性能优于SAM2.1-B+,且在10个目标场景下FPS从7.8提升至36.3。需注意,该方法仍为纯视觉架构,极端遮挡下可能存在身份漂移。