快速导读:提出一种无需训练的即插即用模块TPA,在测试时利用少量无标签部署域图像构建DINO特征原型库,通过余弦相似度查找与主机logits线性融合,以输出级操作一致提升多种OVSS模型的精度。
开放词汇语义分割(OVSS)旨在为任意类别集合分配像素级标签,通常依赖CLIP模型实现。然而,CLIP的全局预训练导致其块级特征空间定位噪声大,现有改进方法或重设计内部注意力,或注入辅助视觉基础模型(VFM)特征,均需介入主机模型内部计算,与特定架构深度耦合。
本文提出测试时原型自适应(TPA),一个完全在输出层面操作的即插即用模块。TPA在测试时利用少量无标签部署域图像,通过冻结的DINO编码器构建类别原型库,在推理阶段以余弦相似度查找产生辅助分数,与主机原始logits线性融合。整个过程无需梯度、标签,不修改主机权重和前向传播,可通用于任意OVSS模型。
英文题目:Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation
论文出处:arXiv 每日论文精选 · arXiv:2608.08290
原始论文:PDF / 论文页面
这篇论文解决什么问题?
OVSS的核心挑战在于CLIP的块级特征缺乏细粒度空间定位能力。现有解决方案可分为三类:注意力重设计(如SCLIP)、VFM特征注入(如ProxyCLIP)、以及测试时插件(如FSA、MLMP)。前两类方法虽然有效,但均需修改主机模型内部计算图,与特定架构绑定,无法跨模型复用。
第三类测试时插件方法虽然部分缓解了架构依赖问题,但FSA仍需介入注意力层进行输出反馈调制,MLMP则需在测试时执行梯度更新,均未实现真正的输出级解耦。更重要的是,这些方法都局限于单张图像内部的信息利用,忽视了跨图像类别级先验的潜在价值。
一个关键直觉是:尽管单张图像的预测可能充满噪声,但多张图像中同一类别的高置信度预测区域往往共享一致的视觉特征。如果能将这些跨图像信息聚合成类别原型,就能为每张图像的预测提供稳定的全局参照。这正是TPA的核心动机。
核心创新
- 提出首个完全在输出层面操作、与主机架构无关的OVSS即插即用模块TPA,无需修改主机前向传播或权重。
- 设计了一种基于双重条件(argmax一致性和自适应阈值τ=2/C)的鲁棒锚点过滤机制,有效缓解确认偏差。
- 利用跨图像DINO特征聚合构建类别原型,将原型推理从图像级分类扩展到开放词汇密集预测任务。
- 实现了与内部插件(如FSA, MLMP)的无缝组合,可叠加获得累积增益。
方法概览
TPA包含两个阶段:(1) 自适应阶段:在小型无标签部署域图像池上,利用主机预测的高置信度锚点块,提取冻结的DINO编码器特征,聚合成每类原型;(2) 推理阶段:对每个像素计算其DINO特征与原型库的余弦相似度作为辅助分数,经零中心化后与主机原始log-probabilities线性融合。整个过程无需梯度、标签,不修改主机权重和前向传播。
- 自适应阶段:在小型无标签部署域图像池上,主机模型产生逐像素类别概率。TPA通过双重条件筛选锚点块——要求像素的argmax类别与空间平均池化后的argmax类别一致,且预测概率超过自适应阈值τ=2/C(C为类别数)。这一机制有效缓解了确认偏差,确保只有空间连贯且高置信度的区域参与原型构建。
- 原型构建:筛选出的锚点块通过冻结的DINO编码器提取特征,按类别聚合成单位范数的原型向量。DINOv2通过自蒸馏学习到的特征具有天然的语义对齐特性,使得同类特征在空间中自然聚集,无需额外训练即可产生紧凑且判别力强的原型。
- 推理阶段:对每个像素,计算其DINO特征与原型库中所有原型的余弦相似度,得到辅助类别分数。该分数经零中心化处理后,与主机原始log-probabilities进行线性融合。零中心化操作消除了不同类别间分数尺度的系统性偏差,确保融合后的决策不会偏向高频类别。
- 架构解耦:整个流程中,主机模型和DINO编码器均保持冻结。TPA仅读取主机输出的logits和中间特征,不修改其权重或前向传播路径。这使得TPA可即插即用于任意OVSS模型,无论其内部采用何种注意力机制或VFM注入策略。
- 与内部插件的组合:由于TPA完全在输出层面操作,与修改内部计算的插件(如FSA、MLMP)不存在冲突。实验表明,TPA可与这些方法无缝叠加,获得累积增益,验证了输出级增强与内部增强的正交互补性。
逐图理解论文
失败案例与直觉

图7展示了TPA在VOC21上的定性对比。差异图以绿色标记TPA恢复的区域,红色标记回归区域。可以看到TPA倾向于恢复完整的语义区域而非孤立像素,与DINO特征的空间连贯性一致。
研究空白与核心区分

图2详细展示了TPA的两阶段架构。自适应阶段中,锚点块通过双重条件筛选后贡献DINO特征给逐类运行统计量;推理阶段中,原型库定义辅助密集分类器,其分数与主机log-probabilities融合。
关键发现与组合优势

TPA的增益模式揭示了一个重要规律:基线性能越低的主机获益越大,说明TPA恰好补充了这些模型最缺乏的空间先验。更值得关注的是,TPA与修改模型内部的插件方法完全正交。当TPA与FSA组合时,增益从各自的+2.0和+1.0叠加到+3.1;与MLMP组合时,更是从+4.2和+4.6跃升至+7.5。这意味着输出级增强和内部增强可以无缝协作,为实际部署提供了灵活的叠加策略。
实验如何设计?
- 在5种代表性OVSS主机上评估:SCLIP(注意力重设计)、ClearCLIP、NACLIP、ProxyCLIP(VFM注入)、Trident,覆盖三种CLIP骨干(ViT-B/16、L/14、H/14)。
- 在8个标准语义分割基准上测试,包括PASCAL VOC、PASCAL Context、ADE20K、Cityscapes等,涵盖不同场景复杂度和类别数量。
- 与FSA、ResCLIP、MLMP等测试时插件进行性能对比,验证TPA在输出级操作范式下的竞争力。
- 消融实验系统验证跨图像聚合、DINO特征选择、锚点过滤机制、零中心化等各组件的独立贡献。
- 分析原型库大小对性能的影响、类别重复率、标签重叠鲁棒性、计算开销,以及不同VFM作为库提取器的效果。
关键结果与论文证据
- 在ViT-B/16骨干上,TPA为5个主机带来平均+2.8 mIoU的提升,其中SCLIP +3.7、ClearCLIP +3.1、NACLIP +3.1、ProxyCLIP +2.0、Trident +1.9(第8页表1)。
- TPA增益与主机基线性能呈负相关:基线越低的主机获益越大,表明TPA有效补充了主机缺失的空间先验(第8页)。
- 在ProxyCLIP B/16上,TPA(+2.0)超越FSA(+1.0);组合TPA+FSA获得+3.1 mIoU,验证了输出级与内部插件的正交互补性(第12页表6)。
- 在NACLIP L/14上,TPA(+4.2)与MLMP(+4.6)组合后达到+7.5 mIoU,进一步证实组合策略的有效性(第12页表6)。
- 仅需约10%的部署域图像即可使性能增益饱和,TPA对自适应池大小不敏感,实用性强(第11页图3)。
- 当主机内部VFM为MAE时,TPA增益最大(+4.0 vs. FSA的+1.2),表明TPA的DINOv2原型有效弥补了MAE特征语义对齐不足的缺陷(第10页表2)。
- 锚点过滤机制的可视化显示,筛选出的高置信度像素在空间上形成与语义布局高度一致的连贯区域,直接证实了双重条件防御确认偏差的有效性(第13页图6)。
- 在极端低标签重叠的对抗性划分下,TPA增益仍保持非负,表明原型构建对标签分布偏移具有鲁棒性(第13页图5)。
阅读时需要注意
- 增益大小与主机基线性能呈负相关,对于已注入强空间先验的高性能主机(如ProxyCLIP H/14),增益相对较小(约+1.0 mIoU),边际收益递减。
- 在极端分布外场景或模糊物体边界处,原型匹配可能引入局部像素级错误回归,因为DINO特征在细粒度边界上的判别力有限。
- 依赖DINOv2作为外部特征提取器,虽然其他编码器也有效,但DINOv2效果最佳,若无内置DINOv2则引入额外计算开销。
- 自适应阈值τ=2/C依赖于已知的测试类别数C,在完全开放的动态类别场景下需调整阈值策略。
- 遵循直推式测试时自适应协议,需假设可访问少量无标签部署域图像,与纯归纳式方法存在协议差异。
关联工作
- T3A为图像分类设计了基于原型的测试时自适应方法,TPA将其核心机制从图像级分类扩展到开放词汇密集预测任务,并引入了针对分割场景的锚点过滤和空间一致性约束。
- FSA通过输出反馈调制内部注意力实现测试时增强,但需介入注意力层;TPA完全在输出层面操作,实现了真正的架构解耦。
- MLMP基于梯度熵最小化进行测试时参数更新,TPA无需梯度计算,计算开销更低,且两者可组合使用获得累积增益。