快速导读:提出SCI-CLIP,一种免训练的开放词汇分割框架,通过将分割区域作为统一的推理单元,约束特征交互、重建密集特征并融合参考记忆,解决了现有方法中特征传播、上下文恢复和检索校正粒度不一致的问题。
免训练开放词汇语义分割(OVSS)旨在不进行额外训练的情况下,利用预训练视觉语言模型对任意类别进行像素级分割。现有方法通常将密集预测、跨窗口上下文恢复和外部记忆检索作为独立模块处理,但这些模块在特征交互的粒度上并不一致——有的在像素级操作,有的在窗口级操作,有的在图像级操作。这种粒度不一致性导致信息在不同阶段之间传递时产生偏差,限制了分割性能。
SCI-CLIP的核心洞察是:分割区域可以作为统一的推理单元,将特征交互、上下文恢复和记忆检索组织在同一粒度上。基于这一思想,论文提出了范围重建(Scope Reconstruction)、跨窗口KV聚合(Cross-Window KV Aggregation)和参考记忆(Reference Memory)三个关键模块,构建了一个完整的免训练推理框架。实验表明,这一统一抽象在多个标准基准上带来了显著的性能提升。
英文题目:SCI-CLIP: Segment-Centric Inference with Reference Memory for Training-Free Open-Vocabulary Segmentation
论文出处:arXiv 每日论文精选 · arXiv:2608.05627
原始论文:PDF / 论文页面
这篇论文解决什么问题?
免训练OVSS的核心挑战在于如何从冻结的CLIP模型中提取适合密集预测的特征。CLIP原本为图像级对比学习设计,其输出的特征图在局部区域往往缺乏清晰的语义边界。现有方法如NACLIP通过调整注意力分布来改善局部组织,SCLIP将自注意力重新表述为自相关以增强特征清晰度,ClearCLIP则通过移除残差连接来解耦语义和位置信息。这些方法虽然有效,但都停留在特征锐化层面,没有定义明确的区域级推理单元。
另一方面,基于检索的方法如FreeDA利用扩散模型构建参考区域,ReME检索分割级记忆特征,但它们引入的检索信号往往在不同于密集预测器的粒度上运作。当检索返回图像级或窗口级特征,而密集预测器在像素级做决策时,两者之间的融合就变成了一个粒度不对齐的问题。这种不对齐会导致检索信号无法精确地校正密集预测中的局部错误。
更根本的问题在于,现有方法缺乏一个统一的推理抽象来组织所有阶段。密集特征细化、跨窗口上下文恢复和外部检索校正在不相容的粒度上进行,使得整个推理流程变成了多个独立步骤的松散拼接,而非一个协调一致的过程。SCI-CLIP正是针对这一根本性问题提出了解决方案。
核心创新
- 提出以分割区域为中心的推理框架,将特征交互、上下文恢复和记忆检索统一在同一粒度上。
- 设计跨窗口KV聚合机制,在区域约束的局部重建基础上,选择性地恢复跨裁剪边界的非局部上下文。
- 构建与在线推理共享分割抽象的离线参考记忆,实现粒度对齐的样本校正。
方法概览
SCI-CLIP以分割区域为核心,首先通过区域约束的亲和力图(Scope Reconstruction)限制token交互,然后进行值重建(Value Reconstruction),并引入高斯空间先验(Gaussian Prior)和跨窗口KV聚合(Cross-Window KV Aggregation)恢复上下文,最后在相同的分割粒度上构建并查询离线参考记忆(Reference Memory),融合密集预测与检索结果。
- 分割区域作为统一推理单元:SCI-CLIP首先利用预训练的掩码生成器(如SAM2)产生区域提议,然后将每个分割区域作为后续所有操作的基本单元。这一设计确保了特征交互、上下文恢复和记忆检索都在相同的区域粒度上进行。
- 范围重建(Scope Reconstruction):对于每个分割区域,SCI-CLIP构建一个区域约束的亲和力图,限制token之间的交互仅发生在同一区域内。这避免了跨区域的无关特征相互干扰,使得重建后的密集特征在语义上更加一致。具体实现中,该模块利用区域掩码对注意力图进行加权,确保信息传播不会跨越区域边界。
- 高斯先验(Gaussian Prior):在范围重建的基础上,SCI-CLIP引入基于空间距离的高斯先验,进一步增强局部性偏置。这一先验使得空间上更接近的token在特征交互中获得更高的权重,有助于保持特征的局部连续性。
- 跨窗口KV聚合(Cross-Window KV Aggregation):由于高分辨率图像通常需要分窗口处理,范围重建后的特征可能丢失跨窗口的上下文信息。CW-KV聚合机制通过选择性地引入相邻窗口的键值对,恢复跨裁剪边界的非局部上下文,同时保持区域约束的有效性。这一机制在区域约束的局部重建和全局上下文恢复之间取得了平衡。
- 掩码合并(Mask Merging):初始的区域提议可能存在过度碎片化的问题。SCI-CLIP通过掩码合并机制,将语义相似且空间相邻的小区域合并为更大的区域,减少碎片化对后续推理的影响。
- 参考记忆(Reference Memory):SCI-CLIP离线构建一个样本库,存储训练图像的分割区域及其对应的CLIP特征。在线推理时,对于每个分割区域,系统在参考记忆中检索最相似的区域,并将检索到的特征与密集预测结果进行融合。由于参考记忆中的样本同样以分割区域为单位存储,检索和融合的粒度与密集预测完全对齐。
- 值重建(Value Reconstruction):在范围重建确定的交互图基础上,SCI-CLIP对value特征进行重建,生成每个分割区域的增强特征表示。这一步骤将区域约束的交互图转化为实际的密集特征输出。
- 晚期融合策略:SCI-CLIP采用晚期融合策略将密集预测结果与参考记忆检索结果结合。融合权重是一个关键超参数,论文通过敏感性分析确定了最优范围。
逐图理解论文
方法贡献与验证

表4展示了SCI-CLIP的阶段性消融结果。从基线到逐步添加范围重建、掩码合并、高斯先验、跨窗口KV聚合和参考记忆,每个模块的贡献清晰可见。范围重建带来的提升最大,验证了区域约束是框架的核心;参考记忆的加入进一步提升了性能,但提升幅度小于范围重建,说明密集预测的质量是检索校正的基础。
结论与意义

表2展示了SCI-CLIP与最新免训练方法在8个基准上的mIoU对比。上半部分为CLIP B/16骨干下的结果,SCI-CLIP在7个基准上取得最优;下半部分为更强骨干下的结果,SCI-CLIP在所有基准上领先。需要关注的是,SCI-CLIP在Stuff和ADE等上下文密集型基准上的提升尤为显著,这验证了区域统一推理在复杂场景中的优势。
Figure 3: Cross-window KV aggregation restores context across crop boundaries

图3可视化了跨窗口KV聚合的效果。每行对应一个选定的查询点,展示了局部重建和加入CW-KV聚合后的特征差异。可以观察到,CW-KV聚合有效恢复了跨窗口边界的上下文信息,使得原本因窗口裁剪而丢失的语义关联得以重建。这一可视化直接支持了CW-KV聚合机制的设计动机。
实验如何设计?
- 在8个标准开放词汇分割基准上进行评估,包括VOC21、PC60、Object、V20、PC59、Stuff、ADE和Cityscapes,覆盖了从物体中心到场景级别的多样化分割任务。
- 使用CLIP B/16、L/14和H/14三种不同规模的视觉骨干网络进行实验,验证方法在不同特征质量下的表现。
- 与NACLIP、SCLIP、ClearCLIP、CorrCLIP等最新的免训练方法进行全面对比。
- 进行阶段性消融实验,逐步启用SCI-CLIP的各个组件,分析每个模块的贡献。
- 进行留一法消融实验,从完整模型中逐一移除组件,验证每个模块的必要性。
- 对检索超参数进行敏感性分析,研究参考记忆融合权重、区域检索尺度和标签检索尺度对性能的影响。
关键结果与论文证据
- 在CLIP B/16骨干下,SCI-CLIP在VOC21(75.9)、PC60(46.1)、Object(45.2)、V20(90.3)、PC59(49.6)、Stuff(33.8)、ADE(29.8)共7个基准上取得最优mIoU,在Cityscapes(44.7)上次优(第7页,表2)。
- 在CLIP L/14和H/14骨干下,SCI-CLIP在所有8个基准上均领先于列出的基线方法(第7页,表2下半部分)。
- 阶段性消融显示,范围重建将平均mIoU从45.8提升至49.5,是贡献最大的非检索模块;加入参考记忆后,平均mIoU进一步提升至53.4(第9页,表4)。
- 留一法消融中,移除范围重建导致平均mIoU从56.0降至53.1,移除参考记忆降至53.7,验证了这两个核心模块的关键作用(第14页,表5)。
- 跨窗口KV聚合的可视化分析表明,该机制有效恢复了跨裁剪边界的上下文信息,使得重建后的特征在窗口边界处更加连贯(第8页,图3)。
- 检索超参数敏感性分析显示,参考记忆融合权重对性能影响最大,过高的检索权重反而会降低性能;区域检索尺度和标签检索尺度在较宽范围内表现稳定(第12页,图4)。
- 定性对比显示,SCI-CLIP在复杂场景和细粒度类别上的分割结果更加完整和准确,边界更清晰(第8页,图2)。
- 在Cityscapes数据集上,使用CLIP B/16骨干时性能略低于CorrCLIP,但在更强骨干下这一差距消失,表明方法对特征质量有一定依赖性。
阅读时需要注意
- 在Cityscapes数据集上使用CLIP B/16骨干时性能略低于CorrCLIP,说明在特定场景和较弱骨干下仍有改进空间。
- 参考记忆融合权重对性能影响较大,需要针对不同数据集进行仔细校准,增加了实际部署的调参负担。
- 跨窗口KV聚合和参考记忆模块会引入额外的显存开销,可能限制在资源受限场景下的应用。
- 方法虽为免训练,但依赖多个预训练模型(CLIP、DINO、SAM2等),其性能受上游模型质量影响,且整体推理流程较为复杂。
关联工作
- NACLIP通过调整注意力分布来改善CLIP特征的局部组织,但未定义区域级支持,属于特征锐化方法的早期代表。
- SCLIP将自注意力重新表述为自相关以增强特征清晰度,与NACLIP类似,停留在特征层面的改进。
- ClearCLIP移除残差连接以解耦语义和位置信息,从架构层面改善特征质量,但仍缺乏区域级推理抽象。
- CorrCLIP重建CLIP中的块相关性,是本文的主要对比基线之一,在Cityscapes上表现强劲。
- FreeDA利用扩散模型构建参考区域,属于基于检索的免训练方法,但检索单元与密集预测器可能不对齐。
- ReME检索分割级记忆特征,但依赖额外的视觉语言模型生成辅助信号,且检索粒度与密集预测的协调性未得到充分解决。