快速导读:提出统一框架AnyTrack,通过模态感知交互模块(MIM)和上下文理解模块(CUM),首次在单一模型中处理任意模态组合的目标跟踪。
AnyTrack提出了首个能够在单一模型中处理任意模态组合的视觉目标跟踪框架。与现有方法为每种模态组合训练独立模型不同,AnyTrack通过模态感知交互模块(MIM)和上下文理解模块(CUM),实现了对RGB、深度、热红外、事件、语言、音频等任意模态输入的动态融合与目标定位。
该工作的核心洞察是:多模态跟踪的本质挑战不在于模态本身,而在于如何弥合模态差异并建立目标感知的上下文理解。AnyTrack通过混合专家(MoE)的动态路由机制和非对称双向注意力,让模型自适应地利用可用模态的互补信息,天然具备对模态缺失的鲁棒性。
英文题目:AnyTrack: Unifying Visual Object Tracking with Any Modalities
论文出处:arXiv 每日论文精选 · arXiv:2608.06773
原始论文:PDF / 论文页面
这篇论文解决什么问题?
目标跟踪是计算机视觉的基础任务,近年来从单模态逐步发展到多模态融合。RGB-Depth、RGB-Thermal、RGB-Event等组合已被证明能显著提升跟踪精度和鲁棒性。然而,现有方法存在一个根本性局限:每个模型都绑定在固定的模态组合上。
这种绑定带来三个实际问题。第一,参数冗余:为每种模态组合训练独立模型,导致存储和计算资源浪费。第二,部署僵化:当传感器配置变化时,需要重新训练或切换模型。第三,模态缺失脆弱:一旦某个模态不可用,专用模型往往完全失效。
已有一些工作尝试缓解这一问题。ProTrack采用架构共享设计,但需为每个任务重训练参数。Un-Track学习共享潜在空间,却限于预定义模态组合。SUTrack支持多种模态,但仍要求RGB作为必要输入。这些方法都未能实现真正的“任意模态”统一。
AnyTrack的核心突破在于,它不预设任何模态组合,也不要求特定模态必须存在。模型接受任意可用的模态输入,通过动态交互机制自适应地融合信息。这为实际部署提供了前所未有的灵活性。
核心创新
- 首次提出在单一模型中处理任意模态组合的统一跟踪框架AnyTrack。
- 设计模态感知交互模块(MIM),利用混合专家(MoE)实现动态交互,弥合模态差异并保持时空一致性。
- 引入上下文理解模块(CUM),通过全局-局部提示和非对称双向注意力进行目标感知上下文建模。
- 扩展现有多模态跟踪基准,增加灰度图像、语言描述和音频片段,支持全面训练与评估。
方法概览
AnyTrack包含两个核心模块:MIM基于混合专家(MoE)进行动态特征交互和跨模态时序聚合,弥合模态差异并保持时空一致性;CUM通过多模态提示编码器、非对称双向注意力和动态掩码生成,建立视觉特征与目标位置的空间对应,增强前景-背景判别。
- 整体架构:AnyTrack首先将任意模态的模板和搜索区域图像分词为视觉token,与历史帧的时序token拼接,经模态共享的视觉编码器提取特征后,依次通过MIM和CUM处理,最终由预测头输出目标位置。
- MIM设计:模态感知交互模块基于混合专家(MoE)实现。它包含多个模态特定的专家网络和一个噪声门控机制。门控根据输入模态类型动态选择top-k专家进行稀疏激活,实现模态间的动态特征交互。同时,MIM通过跨帧时序聚合保持时空一致性。
- CUM设计:上下文理解模块首先从运动轨迹、语言描述和音频片段构建全局-局部提示。全局提示提供目标的空间先验,局部提示提供语义引导。然后通过非对称双向注意力,使视觉特征感知提示语义,同时提示适应视觉空间细节。最后,动态掩码生成模块增强前景-背景判别。
- 多模态提示编码:语言描述通过CLIP文本编码器处理,音频片段通过WavLM编码,运动轨迹通过可学习的位置编码嵌入。这些异构提示被统一映射到共享语义空间,供CUM使用。
- 训练策略:AnyTrack在扩展的多模态跟踪基准上联合训练,该基准新增了灰度图像、语言描述和音频片段标注。训练采用平衡损失函数,确保模型在各模态组合上均衡优化。
- 模态缺失处理:由于MIM的MoE机制天然支持稀疏激活,当某模态缺失时,对应专家不被激活,模型自动依赖剩余可用模态。无需任何特殊处理或微调。
逐图理解论文
失败的直觉

图1对比了五种跟踪范式:从单模态独立模型到AnyTrack的任意模态统一框架。注意观察(e)中灵活的多模态提示设计,这是AnyTrack区别于其他范式的关键——它不预设模态组合,而是通过提示动态适应输入。
研究空白与AnyTrack的贡献

图2展示AnyTrack整体框架。重点关注MIM和CUM两个核心模块的位置:MIM在视觉编码器之后进行动态特征交互和时序聚合,CUM则利用多模态提示进行目标感知上下文建模。
如何验证

作者在四个主流多模态跟踪基准上进行了全面验证,包括RGB-Depth、RGB-Thermal和RGB-Event等组合。更重要的是,他们专门构造了模态缺失数据集,模拟传感器故障场景,直接测试模型的鲁棒性。消融实验则逐一验证了MIM中噪声门控、语义专家,以及CUM中掩码记忆等关键设计的有效性。
核心结论

图4的注意力图可视化是理解AnyTrack工作原理的最佳窗口。从左到右观察:单模态时注意力分散,随着模态增加,高响应区域逐步收缩并精确覆盖目标。这直观验证了多模态动态交互的互补效应。
实验如何设计?
- 评估基准:在RGBDT500(RGB+Depth)、LasHeR(RGB+Thermal)、DepthTrack(RGB+Depth)和VisEvent(RGB+Event)四个主流多模态跟踪基准上进行评估。
- 模态缺失测试:为每个基准构造对应的模态缺失版本(如RGBDT500_miss),随机丢弃部分模态,模拟传感器故障场景。
- 对比方法:包括OSTrack、MixFormer等单模态跟踪器,以及ViPT、Un-Track、SUTrack、XTrack、RDTTrack等多模态和统一跟踪器。
- 消融实验:系统验证MIM中噪声门控、语义专家、top-k选择的影响,以及CUM中掩码记忆、动态掩码、非对称注意力的贡献。
- 可视化分析:通过注意力图可视化,展示从单模态到多模态配置下模型关注区域的逐步细化过程。
关键结果与论文证据
- 全模态性能:AnyTrack在RGBDT500上达到AUC 79.2、DP 86.1(RGB+D+T+L+A),超越所有对比方法,包括专用的RDTTrack(第6页,表1)。
- LasHeR结果:在RGB+T+L+A配置下,PR 77.2、NPR 72.9、SR 61.1,显著优于仅使用RGB+T的专用跟踪器(第7页,表2)。
- DepthTrack表现:F-score 65.9、RE 65.9、PR 66.0(RGB+D+L),验证了语言提示对深度跟踪的增益(第7页,表3)。
- VisEvent优势:SR 63.9、PR 81.3(RGB+E+L),超越XTrack等利用多模态训练的RGB-X跟踪器(第7页,表4)。
- 模态缺失鲁棒性:在RGBDT500_miss上DP仍达68.5,LasHeR_miss上PR 70.6,DepthTrack_miss上F-score 54.9,VisEvent_miss上SR 54.0,均大幅领先对比方法(第7页,表5)。
- MIM消融:噪声门控和语义专家各自带来显著增益,验证了动态路由和模态特定建模的必要性(第8页,表6)。
- CUM消融:掩码记忆和动态掩码是关键组件,非对称双向注意力优于标准交叉注意力(第8页,表7-8)。
- 注意力可视化:单模态时模型响应发散,随模态增加逐步聚焦目标区域,多模态组合实现精确空间定位(第8页,图4)。
阅读时需要注意
- 论文未讨论模型的计算开销和实时性,在资源受限设备上的部署可行性存疑。
- 扩展基准的语言和音频标注依赖MLLM生成后人工校验,标注质量和一致性可能影响训练效果。
- 未深入分析不同模态缺失模式(如随机缺失vs.长期缺失)对性能的差异化影响。
- MIM中的专家数量和top-k选择等超参数可能对性能敏感,但缺乏敏感性分析。
- 音频和语言编码器(WavLM、CLIP)保持冻结,可能限制端到端优化的潜力。
关联工作
- ProTrack(第3页):首个采用架构共享设计的RGB-X跟踪器,但需为每个任务重训练参数,AnyTrack实现了真正的统一。
- Un-Track(第3页):学习不同模态输入的共享潜在空间,但限于预定义模态组合,AnyTrack支持任意模态。
- SUTrack(第3页):简单统一跟踪器支持多种模态,但仍需RGB作为必要输入,AnyTrack无此限制。
- RDTTrack(第6页):针对RGB+D+T的提示学习框架,AnyTrack在全模态设置下超越其性能。
- XTrack(第7页):利用多模态训练提升RGB-X跟踪器,AnyTrack在VisEvent上表现更优。