DINOde:为何开放词汇分割需要连续对齐而非离散映射?

快速导读:DINOde提出了一种基于常微分方程(ODE)的连续对齐框架,通过语义文本流(STF)和全局上下文流(GCF)将CLIP文本嵌入平滑映射到DINOv3视觉流形,实现了SOTA的开放词汇语义分割性能。

开放词汇语义分割(OVSS)的核心挑战在于如何桥接CLIP的全局语义对齐与DINOv3的精细空间结构。传统方法多采用多层感知机(MLP)进行离散投影,但这种‘跳跃式’映射往往破坏特征空间的拓扑结构,导致语义纠缠。

DINOde提出了一种全新的连续对齐范式。通过常微分方程(ODE),文本嵌入在超球面上沿特定轨迹平滑演化至视觉流形。该方法不仅引入了Semantic Text Flow (STF)和Global Context Flow (GCF),还通过Velocity Tangent Projection (VTP)确保几何一致性,从而在多个基准上实现了性能突破。

英文题目:DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

论文出处:arXiv 每日论文精选 · arXiv:2607.21371

原始论文:PDF / 论文页面

对应视频标题:DINOde:为何开放词汇分割需要连续对齐而非离散映射?|推荐指数:★★★★★

这篇论文解决什么问题?

CLIP模型擅长全局语义理解,但其视觉编码器在密集预测任务中空间定位能力不足。相反,自监督模型DINOv3具备极强的空间结构感知能力,却缺乏原生文本对齐。

现有工作如Talk2DINO尝试通过非线性映射连接两者,但忽略了流形几何特性。离散映射如同在崎岖地形上直接跳跃,容易迷失方向;而连续演化则如同沿等高线行走,能更好地保留局部邻域关系。

这种‘流形纠缠’现象在复杂场景中尤为明显,导致模型对未见类别的分割边界模糊,语义混淆。因此,寻找一种能保留拓扑结构的对齐方式成为关键。

核心创新

  • 提出基于ODE的连续对齐框架,替代传统的单步MLP投影,避免流形纠缠。
  • 引入Velocity Tangent Projection (VTP),确保演化过程严格遵循超球面几何约束。
  • 设计Global Context Flow (GCF),同步优化全局[CLS] token与局部Patch token的对齐。

方法概览

DINOde利用ODE将CLIP文本嵌入连续演化至DINOv3视觉流形。核心组件包括:1) Semantic Text Flow (STF),通过ODE轨迹逐步对齐文本嵌入;2) Global Context Flow (GCF),精炼DINO的[CLS] token以整合全局上下文;3) Velocity Tangent Projection (VTP),将速度场投影到切空间以维持超球面几何结构。

  • Semantic Text Flow (STF):利用ODE将CLIP文本嵌入逐步演化至DINOv3视觉流形。每一步演化都基于当前状态的速度场,确保对齐过程的连续性和平滑性。
  • Global Context Flow (GCF):专门针对DINOv3的[CLS] token进行精炼。通过同步优化全局上下文与局部Patch token,增强模型对整体场景语义的理解能力。
  • Velocity Tangent Projection (VTP):这是保持几何结构的关键。由于特征通常分布在超球面上,VTP将速度场投影到切空间,确保演化轨迹严格遵循超球面几何约束,避免偏离流形。
  • ODE求解器选择:论文对比了Euler、RK2和RK4等求解器,发现简单的Euler方法在效率与精度之间取得了良好平衡,适合实际部署。

逐图理解论文

DINOde方案

DINOde方案
Fig. 2: Overview of the proposed DINOde framework. Given an input image, a frozen DINOv3 encoder extracts patch tokens and a [CLS] token, while a CLIP text encoder produces a semantic text embedding. Semantic Text Flow (STF) continuously aligns the text embedding to the DINO visual manifold via an ODE- based transformation, while Global Context Flow (GCF) refines the global [CLS] representation. To preserve hyperspherical geometry, Velocity Tangent Projection (VTP) constrains the velocity to the tangent space. The aligned embeddings are used to compute patch–text similarity for open-vocabulary semantic segmentation.

图2详细描绘了STF、GCF和VTP的交互。重点关注VTP如何将速度向量投影到切空间,确保演化不偏离超球面。这是保持几何结构的关键机制。

核心结论

核心结论
Table 5: Quantitative comparison with state-of-the-art methods. Bold and Underline denote the best and second-best results, respectively.

表5列出了与SOTA方法的定量对比。观察DINOde在多个数据集上的mIoU表现,特别是与Talk2DINO*的比较,验证了连续对齐带来的性能增益。

实验如何设计?

  • 评估基准:在Pascal VOC、COCO、Cityscapes、ADE20K等8个主流OVSS数据集上进行测试,确保结果的广泛适用性。
  • 对比基线:与Talk2DINO、FreeDA、CLIPer等SOTA方法进行比较,同时设置MLP基线以验证连续对齐的优势。
  • 消融实验:分别移除STF、VTP、GCF组件,分析各模块对最终性能的贡献,并探究ODE步数对结果的影响。

关键结果与论文证据

  • 性能提升:在多数基准上,DINOde超越了Talk2DINO*(使用DINOv3 backbone),平均mIoU提升显著,证明了连续对齐的有效性。
  • 几何优势:几何诊断指标显示,STF在邻域保持等4项指标上均优于MLP基线,证实了其对拓扑结构的保护作用。
  • 步数敏感性:ODE步数增加初期性能提升明显,但超过一定阈值(如Nstep > 10)后,数值误差累积可能导致性能轻微下降。
  • 泛化能力:即使在非DINO骨干(如SAM)上,DINOde仍比MLP基线表现更好,显示其方法的通用性。

阅读时需要注意

  • 训练成本:虽然推理速度与Talk2DINO相当,但训练时间较长(约4小时/单GPU),限制了快速迭代。
  • 后处理依赖:最终性能部分依赖于Pixel-Adaptive Mask Refinement (PAMR)后处理步骤,纯模型输出略低。
  • 数值稳定性:ODE积分步数过多可能引入数值误差,需仔细调参以平衡精度与稳定性。

关联工作

  • Talk2DINO:主要对比基线,使用离散映射,DINOde在其基础上通过连续对齐实现性能提升。
  • dino.txt:需从头训练文本编码器,计算成本高,而DINOde冻结CLIP文本编码器,更高效。
  • CLIPer:基于CLIP的SOTA方法,DINOde在多数基准上超越其性能,展示了DINOv3视觉流的潜力。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

DINOde:用于开放词汇语义分割的连续视觉-文本对齐

Sung-Hoon Yoon1 ⋆, Hoyong Kwon2 ⋆, Changgyoon Oh2 ⋆, 和 Kuk-Jin Yoon2

1 韩国大邱庆北科学技术院 (DGIST) 多模态智能与感知实验室 shyoon@dgist.ac.kr 2 韩国科学技术院 (KAIST) 视觉智能实验室 {kwonhoyong3, changgyoon, kjyoon}@kaist.ac.kr

摘要。开放词汇语义分割 (OVSS) 利用文本语义来分割超出预定义类别的对象。尽管自监督模型 DINOv3 提供了强大的结构化视觉表示,但其缺乏原生的文本对齐能力,阻碍了其在 OVSS 中的直接应用。为了弥补这一差距,我们提出了 DINOde,这是一个基于常微分方程 (ODE) 的框架,用于将 CLIP 文本嵌入连续地对齐到 DINO 视觉流形上。我们的方法采用了两个互补的组件:(i) 语义文本流 (STF),它通过连续的 ODE 轨迹将文本演化至 DINO 流形;(ii) 全局上下文流 (GCF),它逐步精炼由 DINO 的 CLS token 携带的整体图像表示。为了在此演化过程中保持特征空间的超球面几何结构,我们进一步引入了速度切向投影 (VTP),通过投影将学习到的速度场约束在切空间中。通过将对其建模为连续轨迹,DINOde 避免了离散 MLP 投影固有的流形纠缠,并产生了更鲁棒的跨模态对齐。大量实验表明,DINOde 始终优于现有方法,并在多个 OVSS 基准测试中实现了最先进的性能。代码可在 https://github.com/yoon307/DINOde 获取。

关键词:开放词汇 · 语义分割 · ODE

1 引言

语义分割 [12, 15, 26, 49, 54, 55, 62, 76] 已成为计算机视觉中的核心任务,涵盖从自动驾驶系统到医学图像分析等多个领域。然而,由于环境固有的开放性,实际部署仍然具有挑战性,因为未见过的类别经常会出现。因此,最近的研究已转向开放词汇语义分割 (OVSS),旨在分割未见过的类别。

⋆ 同等贡献。

第 2 页

2 Yoon 等人

图 1: 用于开放词汇语义分割 (OVSS) 的 DINOde 框架概览。我们提出了一种连续对齐策略,以弥合文本嵌入与 DINO 视觉特征之间的差距。该插图展示了文本嵌入如何通过单位球面上的常微分方程 (ODE) 轨迹逐步转化为与 DINO 对齐的文本嵌入,从而实现语义分割的逐步精炼。

大规模视觉-语言预训练(如对比语言-图像预训练 (CLIP [47]) 模型)的出现,通过提供视觉特征与文本语义之间的稳健对齐,显著推进了这一方向。早期工作如 LSeg [34] 和 TCL [9] 采用静态对比损失来建立直接的像素-文本对应关系,而其他工作如 MaskCLIP [79] 则直接从冻结的编码器中提取密集伪掩码,以实现无需训练的推理。最近,框架引入了分层区域级分组(如 GroupViT [64]),或集成了专门的掩码适配分割模块(如 OVSeg [35] 和 FC-CLIP [75])以增强空间精度。然而,CLIP 的视觉编码器主要针对全局图像-文本对齐进行优化,往往产生粗糙且在空间上纠缠的表示,这对于密集预测任务而言并非最优。 与此同时,仅使用视觉数据训练的自监督视觉 Transformer (ViT)(如 DINO [8] 和 DINOv2 [46])表现出更优越的定位能力,因此在密集预测任务中获得了越来越多的关注。然而,由于这些自监督模型仅在视觉模态内运行,其表示空间与文本语义未对齐,导致它们无法直接进行开放词汇推理。 与此一致,最近的工作 dino.txt [24] 通过锁定图像-文本对齐,将冻结的 DINOv2 骨干网络与一个新训练的文本编码器对齐,以实现开放词汇分割。然而,它需要在大规模配对数据上从头训练文本编码器,并且需要大量的计算资源进行视觉-文本对齐。另一项同期工作 Talk2DINO [3] 利用 DINOv2 的自注意力头来有选择地对齐最相关的

第 3 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 3

视觉区域与文本概念。虽然该方法在不微调骨干网络的情况下将 DINOv2 空间 token 与 CLIP 文本嵌入对齐,但它仅使用非线性映射函数桥接了两个特征空间。

最近,DINOv3 [53] 通过其 Gram 锚定正则化器实现了高质量空间细节特征的保留。值得注意的是,仅使用多层感知机(MLP)将 DINOv3 与 CLIP 文本嵌入空间对齐,就能提供一个具有竞争力的强大基线。虽然对齐两个冻结模态既高效又易于优化,但试图通过单步瞬时映射来近似这种复杂跨模态变换的基于 MLP 的方案,往往无法保留表示流形之间的拓扑关系(例如,“猫”和“狗”之间的语义邻近性)。我们的实验观察到,基于 MLP 的对齐导致性能次优,主要是因为它采用了流形无关的欧几里得捷径,忽略了数据的内在曲率。这种结构局限性导致了语义纠缠(semantic entanglement),即原始空间中的邻域关系在目标空间中发生扭曲。

为了解决这些局限性,我们引入了 DINOde,这是一种基于连续常微分方程(ODE)的视觉-文本对齐框架。我们的模型不强制执行僵化的单步投影,而是学习一条平滑轨迹,逐渐将文本流形变换为 DINOv3 的表示,如图 1 所示。此外,通过在超球面上结合切向投影,我们确保学习到的速度场严格遵循几何约束,从而实现平滑且保持流形的流动。在此,我们通过单独的 ODE 轨迹对齐文本嵌入和 DINOv3 的 CLS token,以最大化全局-局部语义一致性。因此,DINOde 仅使用图像-文本对就展示了最先进的 OVSS 性能。

我们方法的贡献总结如下:

– 我们引入了 DINOde,这是一种新颖的基于 ODE 的对齐框架,它连续地将 CLIP 文本嵌入变换为 DINOv3 特征,确保平滑且保持几何结构的视觉-文本映射。 – 通过基于 ODE 的框架逐步对齐文本嵌入和 DINOv3 CLS token,所提出的 DINOde 有效地集成了局部和全局信息。 – 我们引入了速度切向投影(Velocity Tangent Projection, VTP),以实现几何约束和保持流形的 ODE 学习。 – 在多个基准测试和未见类别上的广泛实验证明了我们的方法在开放词汇语义分割中的有效性和泛化能力。

2 相关工作

2.1 基于视觉语言模型(VLM)的开放词汇分割

开放词汇语义分割(OVSS)的基础工作主要依赖于视觉语言模型(VLMs),如 CLIP [47],用于视觉和文本特征

第 4 页

4 Yoon 等人

特征提取。这些方法通常分为两类:无解码器对齐和条件解码器框架。

条件解码器框架 为了解决仅使用视觉-语言模型(VLM)特征时存在的严重定位缺陷,全监督条件框架 [22, 34, 35, 65, 68, 69, 75, 78, 84] 将 VLM 与在基础类别像素标注上训练的重型分割解码器相结合。例如,LSeg [34] 在视觉编码器后附加一个密集预测 Transformer,以建立与文本嵌入的直接逐像素对应关系;而 OVSeg [35] 则微调一个基于 Mask2Former 的复杂解码器,以生成类别无关的掩码提议,随后由掩码适配的 CLIP [47] 对这些提议进行分类。这凸显了细粒度定位质量与标注成本之间持续的权衡,从而激发了对更轻量级范式的互补性研究。

无解码器 VLM 对齐 为了避免使用重型、特定任务的解码器,研究人员通常直接从 VLM 中提取密集预测结果。免训练方案 [5,25,32,33,41,51,56,57,60,79] 利用现成的 VLM,无需任何额外的训练阶段或参数更新。例如,MaskCLIP [79] 改变了冻结的 CLIP [47] 视觉编码器的自注意力拓扑结构,以直接提取密集的像素级特征;而 FreeDA [2] 则通过生成扩散增强的视觉原型来增强免训练匹配,从而丰富语义表示。或者,类似于避免密集像素标注的弱监督语义分割研究 [16,28–30,63,67,72,73],OVSS 中的弱监督方案 [7, 9, 35, 40, 44, 64, 70] 仅依赖图像-文本对来对齐特征,而无需像素级标注。值得注意的是,GroupViT [64] 通过对视觉 token 进行聚类以形成由文本引导的语义区域,从而学习分层补丁分组;而 TCL [9] 则利用文本监督生成密集伪掩码以进行跨模态对齐。虽然这些方法通过减轻对密集掩码的依赖提供了一种高效的替代方案,但它们仍然根本上受限于 VLM 的视觉编码器。

2.2 自监督视觉骨干网络

为了弥补 VLM 编码器在空间方面的局限性,最近的工作开始利用自监督视觉模型(SSVMs)。特别是 DINO 系列 [8,18,46,53] 表明,它可以在不依赖文本监督的情况下提取以对象为中心的补丁嵌入,并保持细粒度的空间结构。因此,OVSS 中的一种常见方法是直接将 DINO 的空间特征与 CLIP [47] 的语义空间进行对齐。 SSVM 在密集预测中的有效性主要源于其涌现的以对象为中心的特性。如先前研究 [52,59] 所观察到的,这些模型中的自注意力图自然地捕捉了语义边界和前景对象,而无需显式标签。这种定位能力使 SSVM 能够充当空间锚点,有助于解决 VLM 输出中常见的粗分辨率和网格伪影问题。因此,最近的 OVSS 方法

第 5 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 5

通常采用双骨干网络策略,利用 DINO 进行边界细化,并使用 CLIP [47] 进行零样本分类 [31, 61]。通过结合全局文本-图像对齐与局部几何先验,这些框架生成的掩码边界比仅基于视觉语言模型(VLM)的基线方法要清晰得多。

2.3 连续与基于流的对齐

神经常微分方程(Neural ODEs)[13] 提出了将深度网络视为连续动态系统的思想。网络不再学习离散的层序列,而是学习一个常微分方程(ODE)来变换隐藏特征。这种连续时间表述现在被广泛用于生成建模。例如,流匹配(Flow Matching)[37,38] 和归一化流(Normalizing Flows)[48] 依赖于学习一个向量场以在数据分布之间进行映射。在表示学习中,ODE 网络还保证了可逆性和稳定性,从而实现鲁棒的特征提取 [4, 19]。此外,由于许多特征空间是非欧几里得的,研究人员提出了黎曼和流形常微分方程 [39,42]。通过强制特征严格沿着如超球面等几何流形移动,这些模型保持了原始拓扑结构的完整性。然而,OVSS 中的跨模态对齐仍然依赖于离散或静态方法。标准方法通常简单地使用多层感知机(MLP)层或最优传输(Optimal Transport)[21]。这些突变的映射步骤容易破坏嵌入的几何曲率。虽然连续流自然地保留了这种几何结构,但它们很少被用于对齐不同的模态。因此,我们引入了一种受流形约束的 ODE 流,它将 CLIP [47] 文本空间连续映射到 DINOv3 [53] 视觉空间,实现了平滑且感知几何的对齐。

3 方法

在本工作中,我们引入了一种基于 ODE 的对齐框架,该框架将文本嵌入连续变换到视觉空间。第 3.1 节介绍了我们方法中使用的 ODE 的基本公式,并简要描述了 DINOv3 视觉编码器和 CLIP 文本编码器的公式。随后,第 3.2 节详细阐述了我们提出的 DINOde 框架及其关键组件。

3.1 预备知识

常微分方程。常微分方程(ODE)定义了连续变量如何随时间演化,由一个向量场支配。给定状态 $z_t \in \mathbb{R}^d$ 和时间变量 $t \in [0, 1]$,神经 ODE 使用可学习的神经网络 $v_\theta(z_t, t)$ 来参数化变化率。$z_t$ 的动力学由初值问题描述:

$$ \frac{dz_t}{dt} = v_\theta(z_t, t), \quad z_{t=0} = z_0. \tag{1} $$

将 ODE 从时间 $t = 0$ 积分到 $t = 1$,会产生从初始状态到最终状态的连续变换轨迹:

$$ z_1 = z_0 + \int_{0}^{1} v_\theta(z_t, t) dt. \tag{2} $$

第 6 页

6 Yoon 等人

在实践中,该连续积分使用欧拉法等离散求解器进行数值近似。对于步长 $\Delta t = 1/N_{step}$,状态迭代更新如下:

$$ z_{t+\Delta t} = z_t + \Delta t \cdot v_\theta(z_t, t). \quad (3) $$

这种迭代更新可以看作残差网络的连续深度极限,其中每个块沿依赖于时间的速度场 $v_\theta$ 执行无穷小更新。与离散的单步投影(例如 MLP)不同,ODE 公式为建模复杂的特征变换提供了平滑、可逆且稳定的轨迹。

任务定义。我们基于两个互补的预训练模型构建:DINOv3 用于视觉表示,CLIP 用于文本嵌入。我们的目标是通过学习一种连续变换来桥接这两种表示,使 CLIP 语义流形向 DINOv3 的视觉流形演化,以用于开放词汇语义分割 (OVSS)。给定输入图像 $I \in \mathbb{R}^{3 \times H \times W}$,我们将 DINOv3 视觉编码器表示为 $f_{vis}: \mathbb{R}^{3 \times H \times W} \rightarrow \mathbb{R}^{(N+1) \times D}$。骨干网络将图像编码为 $N$ 个不重叠的 patch token 以及一个可学习的 [CLS] token:

$$ f_{vis}(I) = \left( \mathbf{z}^{img}_{cls}, \mathbf{Z}^{img} \right) \quad (4) $$

其中 $\mathbf{Z}^{img} \in \mathbb{R}^{N \times D}$ 且 $\mathbf{z}^{img}_{cls} \in \mathbb{R}^{D}$,$D$ 表示 DINOv3 的嵌入维度。对于文本提示 $T$,我们将 CLIP 文本编码器表示为 $f_{text}$,得到的语义嵌入为:

$$ \mathbf{z}^{text} = f_{text}(T) \in \mathbb{R}^{D_{text}}, \quad (5) $$

其中 $D_{text}$ 是 CLIP 的嵌入维度。

3.2 DINOde

在本工作中,我们旨在利用自监督视觉模型在开放词汇语义分割中的潜力。我们通过实验观察到,基于 MLP 的方法会导致次优的对齐效果,主要原因是它采用了欧几里得捷径,忽略了特征空间的流形结构。为此,我们提出了 DINOde,这是一种基于 ODE 的图像-文本对齐框架,它将 CLIP 文本空间连续变换为 DINO 的视觉空间。DINOde 由两个互补组件组成:(i) 语义文本流 (STF),它逐渐将文本流形对齐到视觉流形;(ii) 全局上下文流 (GCF),它逐步精炼 DINO 的全局 [CLS] token,从而产生全局对齐的表示。

语义文本流。如图 2 所示,为了连续地将文本嵌入与视觉流形对齐,我们将图像-文本对齐建模为 ODE,如公式 1 所示:$\frac{dz_t}{dt} = v_\theta(z_t, t)$。为了指定初始状态和视觉监督

第 7 页

DINOde:用于开放词汇语义分割(OVSS)的连续视觉-文本对齐 7

输入/特征提取 DINOde 测试时推理 = STF 一张照片 关于 𝑡k+1 …𝒛𝟏"𝒛𝒕𝒆𝒙𝒕 𝑡$ 图块 Token 𝒛𝒊𝒎𝒈 𝑡! 书 … 池化 𝒛𝒊𝒎𝒈 人 狗 沙发 DINO [CLS] Token … GCF 𝑡$ 𝒄𝟏 𝒛𝟎 𝑡" 𝒄𝟀 𝑡k+1… CLIP 文本 归一化 DINO MLP 𝑡" 文本嵌入 嵌入 𝑡"…𝑡! 编码器 𝒄𝟀 MLP 𝑡! … VTP 速度 速度 𝒛𝟎 STF 图块 Token 归一化 𝑡! 网络 ℱ! 嵌入时间 网络 ℱ" 𝑡! 𝒕𝟎 CLIP 文本 MLP 文本 编码器 之前 相似 投影 平面 文本 = “一只狗和一只猫在 有纸张和书籍的墙旁共享一个 坐垫。” 之后 切向 投影 投影速度

图 2:所提出的 DINOde 框架概述。给定输入图像,冻结的 DINOv3 编码器提取图块 token 和 [CLS] token,而 CLIP 文本编码器生成语义文本嵌入。语义文本流(STF)通过基于常微分方程(ODE)的变换将文本嵌入连续对齐到 DINO 视觉流形,而全局上下文流(GCF)精炼全局 [CLS] 表示。为了保持超球面几何结构,速度切向投影(VTP)将速度约束在切空间中。对齐后的嵌入用于计算图块-文本相似度以进行开放词汇语义分割。

目标,我们首先通过可学习的线性投影将文本嵌入映射到 DINO 特征维度:z0 = Norm(Wztext),其中 W ∈RD×Dtext,并使用 z0 作为初始条件。然后,我们获得一个池化视觉嵌入

\la b el {eq:vis_emb} \ mathbf{z}^{img}=\mathrm{Norm}(\mathrm{Pool}(\mathbf{Z}^{img}))\in\mathbb{R}^{D}, (6)

它作为目标视觉表示。这里,Norm(x) = x/∥x∥2 表示 ℓ2 归一化。对于池化操作,我们采用如 [71] 中所述的 top-K 池化。为了有效地将时间信息注入速度网络 Fθ,我们通过正弦嵌入 γ(t) 实现时间条件,并通过逐特征调制将其纳入,即 vθ(z, t) = Fθ(z; γ(t))。关于速度网络的详细信息见补充材料。为了保持超球面特征空间的内在几何结构,我们提出了速度切向投影(VTP),它将速度约束在 zt 处的切空间中:

\tild e { v}_\th et a (\math bf {z}_t,t)=v_\theta(\mathbf{z}_t,t)v_\theta(\mathbf{z}_t,t),\mathbf{z}_t\mathbf{z}_t.{eq:tangent_proj} (7)

然后,我们从 t = 0 到 t = 1 积分 ODE 前向传播,以获得对齐后的嵌入,如公式 3 所示: \labe l { e q:stf_ output}\hat{\mathbf{z}}^{text}=\mathbf{z}_{1}=\Phi_\theta^{text}(\mathbf{z}_0), (8)

第 8 页

8 Yoon 等人

其中 $\Phi_{\text{text}}^\theta$ 表示通过显式欧拉求解器(公式 3)积分公式 1 所得到的数值流映射,即对于 $N_{\text{step}}$ 步,步长 $\Delta t = 1/N_{\text{step}}$,

$$ \mathbf{z}_{t_{k+1}} = \text{Norm}\big(\mathbf{z}_{t_k} + \Delta t\,\tilde{v}_\theta(\mathbf{z}_{t_k},t_k)\big), \quad t_k=k\Delta t. \tag{9} $$

全局上下文流 (Global Context Flow, GCF)。除了文本对齐之外,我们引入全局上下文流 (GCF) 来精炼由 [CLS] token 携带的整体图像表示。DINOv3 产生一个全局表示 $z_{\text{img}}^{\text{cls}} \in \mathbb{R}^D$,它通过聚合所有 patch token 的信息来总结整体图像上下文。虽然 patch token $Z_{\text{img}}$ 捕捉细粒度的、部分级别的细节,但 [CLS] token 提供了给定图像的整体信息。我们利用这一特性来对齐视觉空间和文本空间之间的全局语义。给定来自冻结的 DINOv3 骨干网络的原始 [CLS] token $z_{\text{img}}^{\text{cls}}$,我们首先应用一个轻量级的投影头和 $\ell_2$ 归一化,以在超球面上获得初始状态:

$$ \mathbf{c}_0= \text{Norm}\big(W_{\text{cls}}\mathbf{z}^{\text{img}}_{\text{cls}}\big) \in\mathbb{R}^{D}, \tag{10} $$

其中 $W_{\text{cls}} \in \mathbb{R}^{D \times D}$。然后,我们像 STF 一样通过常微分方程 (ODE) 演化 $c_0$:

$$ \frac{d\mathbf{c}_t}{dt}=u_\phi(\mathbf{c}_t,t), \tag{11} $$

其中 $u_\phi$ 是一个可学习的速度网络。与 STF 类似,时间条件是通过特征级调制注入的正弦嵌入 $\gamma(t)$ 实现的。在这里,我们也应用速度切向投影 (VTP) 以保持超球面几何约束:

$$ \tilde{u}_\phi(\mathbf{c}_t, t)=u_\phi(\mathbf{c}_t,t) – \frac{u_\phi(\mathbf{c}_t,t)^\top\mathbf{c}_t}{\mathbf{c}_t^\top\mathbf{c}_t}\mathbf{c}_t. \tag{12} $$

最后,通过前向积分获得全局精炼表示:

$$ \hat{\mathbf{z}}^{\text{img}}_{\text{cls}}=\mathbf{c}_{1}=\Psi_\phi(\mathbf{c}_0), \tag{13} $$

其中 $\Psi_\phi$ 表示由公式 11 诱导的数值流映射。同样,我们使用具有 $N_{\text{step}}$ 和步长 $\Delta t = 1/N_{\text{step}}$ 的欧拉求解器,如下所示:

$$ \mathbf{c}_{t_{k+1}} = \text{Norm}\big(\mathbf{c}_{t_{k}} + \Delta t\,\tilde{u}_\phi(\mathbf{c}_{t_k},t_k)\big), \quad t_k=k\Delta t. \tag{14} $$

损失公式。在 DINOde 中,我们采用一种 CLIP 风格的对称对比目标来训练速度网络 $(v_\theta, u_\phi)$。在此,受先前工作 [24] 的启发,我们通过拼接池化的 patch 描述符 $z_{\text{img}}$ 和通过 GCF 获得的精炼 CLS token $\hat{z}_{\text{img}}^{\text{cls}}$ 来构建全局图像表示:

$$ \mathbf{z}^{\text{img}}_{||} = \Big[\mathbf{z}^{\text{img}}\,;\,\hat{\mathbf{z}}^{\text{img}}_{\text{cls}}\Big] \in\mathbb{R}^{2D}. \tag{15} $$

对于每个图像-标题对,我们使用 CLIP 对标题进行编码,并产生与视觉对齐的文本特征 $\hat{\mathbf{z}}_{\text{text}} \in \mathbb{R}^D$,该特征是通过语义文本流 (STF)(公式 8)获得的。为了与 $z_{\text{img}||}$ 匹配维度,我们将 $\hat{\mathbf{z}}_{\text{text}}$ 重复以形成 $z_{\text{text}||} \in \mathbb{R}^{2D}$。给定一个包含 $B$ 个图像-标题对的小批量,我们计算相似度矩阵

$$ S_{ij} = \frac{1}{\tau}\,(\mathbf{z}^{\text{img}}_{||,i})^\top\mathbf{z}^{\text{text}}_{||,j}, \tag{16} $$

第 9 页

DINOde:用于开放词汇语义分割(OVSS)的连续视觉-文本对齐 9

其中 $\tau$ 是温度系数。对称对比损失定义如下

$$ L_{NCE} = \frac{1}{2} \mathrm{CE}(\mathbf{S}^\top, \mathbf{y}=[1,\ldots,B]) \quad (17) $$

其中 $\mathrm{CE}$ 和 $\mathbf{y}$ 分别是交叉熵损失和匹配索引。

推理。如图 2 所示,DINOde 的推理阶段利用学习到的语义文本流(STF)为任意类别生成语义锚点,并通过测量其与 DINOv3 补丁标记(patch tokens)的相似度来执行像素级分割。具体而言,对于给定的一组 $M$ 个候选类别 $\{c_m\}_{m=1}^M$,我们首先使用冻结的 CLIP 文本编码器提取其文本嵌入,并通过可学习的投影 $W$ 将其映射到源状态 $z_0 \in \mathbb{R}^{D \times M}$。然后,我们利用学习到的速度网络 $v_\theta$(如公式 9 所述),从 $t=0$ 到 $t=1$ 执行前向积分。得到的目标状态 $\hat{z}_{\text{text}} = z_1 \in \mathbb{R}^{D \times M}$ 作为一组语义锚点,它们与 DINO 的视觉流形最优对齐。最后,通过计算 DINO 补丁标记与这些对齐的语义锚点 $\hat{z}_{\text{text}}$ 之间的余弦相似度来生成密集分割图。

4 实验

4.1 实验设置

数据集。为了评估我们提出方法的鲁棒性和泛化能力,我们在八个常见的开放词汇语义分割(OVSS)基准上进行了广泛的实验。遵循先前文献 [2, 3, 9, 61] 中的分类,这些数据集根据是否包含背景(bg)类别分为两组。第一组包含三个带有背景类别的基准:Pascal VOC 2012 (V21) [20]、Pascal Context (C60) [43] 和 COCO Object (Object) [6],分别包含 21、60 和 81 个类别。第二组包括五个不包含背景类别的基准。具体而言,我们在 COCO Stuff (Stuff) [6]、Cityscapes (City) [17] 和 ADE20K (ADE) [80,81] 上进行评估,它们分别包含 171、19 和 150 个类别。此外,我们还报告了在 Pascal VOC 2012 (V20) [20] 和 Pascal Context (C59) [43] 上的性能,这两者均排除了背景类别,以提供全面的比较。

评估协议与指标。我们遵循先前工作 [3,9,61,64] 中建立的评估协议。在推理过程中,为了与最先进的工作 [3] 进行公平比较,输入图像被调整短边长度为 448 像素,并通过滑动窗口推理进行处理,分辨率为 448×448,步长为 224 像素。遵循先前工作 [3, 56],在推理过程中,文本嵌入是通过平均标准提示模板(例如,“a photo of a {class}”)的编码生成的。每个实验的主要评估指标是平均交并比(mIoU)。

第 10 页

10 Yoon 等人

平均 mIoU 图像 步骤 1 步骤 2 步骤 4 50

45

40

35

30

25

20 15 步数 1 2 3 4 5 6 7 8 9 10 真实标签 步骤 6 步骤 8 步骤 10

图 3:不同 ODE 步数下语义文本流 (STF) 的分析。分割图是通过在每个步骤 $k \in \{1, 2, \dots, 10\}$ 使用对齐后的文本嵌入 $z_{tk}$ 获得的。(左)八个基准测试上的平均 mIoU,展示了流形过渡期间性能的逐步提升。(右)Cityscapes 数据集上各步骤的定性结果。

实现细节。在整个实验中,我们采用 DINOv3 ViT-L/16 作为视觉骨干网络,CLIP ViT-L/14 作为文本编码器。与依赖 CC3M [50] ($\sim$3.3M) 或 CC12M [10] ($\sim$12.4M) 等大规模图像-文本对数据集的传统弱监督开放词汇语义分割 (OVSS) 方法 [9, 11, 40, 64, 66] 不同,我们的基于 DINO 和 ODE 的方法以显著更少的数据实现了高效对齐,具体是在 COCO 2017 Caption [14, 36] 训练集($\sim$118k 张图像)上进行训练。我们使用 AdamW 优化器,学习率为 $1 \times 10^{-4}$,权重衰减为 0.01。模型在单块 NVIDIA RTX 3090 GPU 上以 256 的批量大小训练 20 个 epoch。由于我们使用了冻结的 DINOv3 和 CLIP 编码器,我们可以利用预缓存的嵌入,并且对齐后的文本锚点每个类别集仅缓存一次,从而进一步提高计算效率。包括初始缓存阶段在内的整个训练过程在 4 小时的墙钟时间内完成。与 [3, 9] 一致,我们应用像素自适应掩码细化 (PAMR) [1] 作为后处理步骤,以增强最终语义图的边界贴合度。我们方法的超参数如下:ODE 步数 $N_{step} = 10$,用于 Top-K 池化的 $K = 20$,用于 NCE 损失的温度 $\tau = 0.07$。

4.2 讨论

渐进式流形过渡分析。为了验证 STF 是否如预期那样通过 ODE 有效地学习渐进式流形过渡,我们在不同数量的 ODE 积分步数下进行了定性和定量比较。图 3(左)中的图表展示了每个步骤在八个基准测试上的平均 mIoU。值得注意的是,性能从步骤 1 到步骤 8 迅速提升。这一趋势表明,速度网络经过有效训练,能够以渐进且稳定的方式将 CLIP 文本嵌入传输至 DINO 视觉流形。在步骤 8 到步骤 10 之间,mIoU 曲线显示出更缓慢但稳定的提升。这表明一旦嵌入到达 DINO 流形附近,STF 模块就会执行细粒度调整,以收敛至最优语义坐标

第 11 页

DINOde:用于开放词汇语义分割(OVSS)的连续视觉-文本对齐 11

表 1:所提方法的组件分析。

STF VTP GCF V20 C59 Stuff City ADE V21 C60 Object Avg

(a) 88.4 43.2 29.7 42.5 23.2 68.0 39.6 46.7 47.7 (b) ✓ 88.4 43.0 31.2 44.7 25.2 66.6 39.5 47.1 48.2 (c) ✓ ✓ 88.5 43.4 31.4 45.4 25.5 67.3 39.6 47.2 48.5 (d) ✓ ✓ 90.2 44.3 31.3 45.6 24.8 69.5 40.3 47.2 49.2 (e) ✓ ✓ ✓ 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5

在视觉空间内。图 3 中 Cityscapes 数据集上的定性结果与这些定量观察结果一致。在前 8 步中,我们观察到全局结构和语义一致性迅速改善。在随后的步骤中,结果在细节方面表现出进一步的改进。总之,这些结果表明,我们的 STF 成功学习到了最优的流形过渡轨迹,有效地弥合了 CLIP 和 DINO 之间的模态差距。

组件分析。表 1 展示了消融研究,评估了我们提出的语义文本流(STF)和全局上下文流(GCF)的独立贡献,以及速度切向投影(VTP)的影响。在此表中,结果 (a) 是基线,其中使用标准 MLP 进行文本到视觉的对齐,其参数容量与 STF 速度网络的参数容量相当。(a) 与 (b)–(e) 之间的比较表明,基于 ODE 的通过 STF 进行的渐进式过渡比简单的静态映射实现了更优越的性能。值得注意的是,从 (a) 到 (c) 和 (e),平均 mIoU 的稳步提升表明,STF 成功学习到了将 CLIP 文本嵌入转移到 DINO 视觉流形的最优过渡轨迹,超越了单纯特征对齐的能力。为了验证 VTP 在保持超球面特征空间内在几何结构中的作用,我们比较了 (b) 与 (c) 以及 (d) 与 (e);在这两种情况下,VTP 都带来了有意义的性能提升。这表明,将速度向量投影到切空间,从而在过渡过程中保持特征范数,在确保渐进式流形转移的稳定性和准确性方面起着重要作用。最后,我们分析了 GCF 的效果,它利用 DINO [CLS] token 来整合全局上下文信息。GCF 确保文本嵌入(STF)的过渡不会偏向局部视觉特征,而是考虑到更广泛的全局上下文。(b) 与 (d) 以及 (c) 与 (e) 之间的比较表明,GCF 带来了持续的性能提升。这些结果表明,STF 和 GCF 互补地优化了流形之间的连续对齐。

步数消融。表 2 分析了在 STF 和 GCF 模块的训练和推理过程中使用的 ODE 步数(Nstep)的影响。我们观察到,即使 Nstep = 5,我们的方法也优于

第 12 页

12 Yoon 等人

表 2:ODE 步数(Nstep)的消融研究。

对齐方法 Nstep V20 C59 Stuff City ADE V21 C60 Object 平均

基于 MLP – 88.4 43.2 29.7 42.5 23.2 68.0 39.6 46.7 47.7 5 89.7 44.4 31.7 43.5 25.2 66.7 40.4 48.0 48.7 基于 ODE 10 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5 50 91.0 44.1 31.9 46.1 25.4 69.1 40.2 48.5 49.6

表 3:在不同视觉和文本骨干网络上的泛化能力。我们将提出的对齐方法(Ours)与离散投影基线(MLP)进行了比较。

DINOv3(视觉) CLIP(文本) 对齐方法 V20 C59 Stuff City ADE V21 C60 Object 平均

MLP 88.4 43.2 29.7 42.5 23.2 68.0 39.6 46.7 47.7 ViT-L ViT-L Ours 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5

MLP 87.3 39.2 27.7 38.1 20.7 62.4 36.1 41.8 44.2 ViT-B ViT-L Ours 89.2 41.6 29.3 37.7 22.4 66.2 38.4 43.8 46.1

MLP 80.3 34.8 19.9 25.8 15.7 54.2 32.7 31.6 36.9 ViT-S ViT-L Ours 84.2 36.1 22.6 29.4 16.3 55.6 33.6 32.9 38.8

MLP 87.7 43.1 30.6 43.8 24.3 67.3 39.5 46.3 47.8 ViT-L ViT-B Ours 90.8 42.8 30.5 42.8 25.0 69.8 39.7 48.1 48.7

基于 MLP 的离散映射,证明了基于 ODE 的过渡在跨模态对齐中的有效性。在 Nstep = 10 时获得的提升进一步表明,足够的粒度水平使模型能够更成功地导航不同域之间复杂的流形间隙。对于 Nstep ≥ 10,随着步数的增加,平均 mIoU 呈现出微弱的上升趋势。这表明更多的步数有助于实现更平滑的过渡轨迹,协助模型更紧密地收敛到目标流形上的最优位置。然而,我们也观察到在某些基准测试中性能出现轻微下降。这归因于在过多步数的数值积分过程中微小误差的累积,这可能导致最终嵌入在视觉流形内“过冲”其最优目标。考虑到性能提升与计算开销之间的权衡,我们选择 Nstep = 10 作为我们框架的最佳平衡点。

泛化到多样化的骨干网络。为了展示 DINOde 的泛化能力,我们使用各种视觉和文本骨干网络进行了实验,如表 3 所示。随着 DINOv3 视觉骨干网络缩小至 ViT-B 和 ViT-S,我们基于连续流的对齐方法始终优于基线,即基于 MLP 的对齐方法。这表明,无论视觉表示的粒度如何,基于 ODE 的轨迹建模在桥接模态间的流形间隙方面本质上比离散投影方法更有效。此外,即使 CLIP 文本骨干网络过渡到 ViT-B,DINOde 也超过了基于 MLP 的基线。这

第 13 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 13

表 4:流形保持的几何诊断指标。语义文本流(STF)在所有标准上均优于多层感知机(MLP)基线。

几何标准 MLP STF( ours)

(i) 邻域保持 0.575 0.601 (ii) 角度/测地线一致性 0.693 0.712 (iii) 类结构保持 0.843 0.871 (iv) 对齐空间紧凑性 0.412 0.423

表明我们的方法有效地引导过渡轨迹朝向目标 DINO 视觉流形,即使文本嵌入空间的底层组成发生改变。这些结果表明,DINOde 具有高度的泛化能力,能够灵活适应不同的视觉和文本流形,而无需依赖特定的骨干网络。

流形保持的几何诊断。为了直接验证语义文本流(STF)是否保留了特征空间的内在几何结构,我们在表 4 中报告了四项几何诊断指标。我们测量了 (i) 原始 CLIP 类空间与对齐空间之间的前 10 个最近邻重叠度,(ii) 相邻类之间测地线距离向量的局部皮尔逊相关系数,(iii) 类级别 Gram 矩阵之间的线性 CKA,以评估整体语义结构是否得到保留,以及 (iv) 对齐文本特征与相应类别的掩码感知 DINO 补丁原型之间的平均余弦相似度。在所有四项标准中,STF 均持续超越 MLP 基线,这表明基于连续常微分方程(ODE)的过渡在跨模态对齐过程中更好地保留了邻域结构、测地线一致性和类级别的语义组织。

与最先进方法的比较。在表 5 中,我们展示了所提出的 DINOde 与八个基准测试上最先进的开放词汇语义分割(OVSS)方法之间的定量比较。基线方法分为免训练 OVSS 方法 [2, 5, 23, 32, 33, 41, 51, 56–58, 82] 和利用图像-文本对进行训练的弱监督 OVSS 方法 [3, 7, 9, 24, 35, 40, 44, 64, 70]。我们与代表性的基线及最新的最先进方法进行了全面比较,特别是同样利用图像-文本对进行训练的 dino.txt [24] 和 Talk2DINO [3]。为了确保公平比较,表 5 和图 4 中 Talk2DINO* 的结果是使用官方发布的检查点和集成 DINOv3 骨干网络的源代码获得的。具体针对带有背景类别的基准测试,我们进行了详尽的搜索以寻找最佳背景阈值,从而确保 Talk2DINO* 达到峰值性能。 我们的方法在大多数基准测试(8 个中的 6 个)上均优于现有的最先进方法,无论是否进行掩码细化。值得注意的是,与使用相同 DINOv3 视觉编码器骨干网络的 Talk2DINO* 相比,我们的方法在掩码细化之前的平均交并比(mIoU)达到 49.5%,提升了 1.9 个百分点。在引入最终的掩码细化步骤后,

第 14 页

14 Yoon 等人

表 5:与最先进方法的定量比较。粗体和下划线分别表示最佳和第二佳结果。

模型 视觉编码器 V20 C59 Stuff City ADE V21 C60 目标 平均

无掩码细化 MaskCLIP [82]ECCV 22 CLIP 29.4 12.4 8.8 11.5 7.2 23.3 11.7 7.2 13.9 SCLIP [58]ECCV 24 CLIP 70.6 25.2 17.6 21.3 10.9 44.0 22.3 26.9 29.9 ClearCLIP [32]ECCV 24 CLIP 80.0 29.6 19.9 27.9 15.0 – – – – NACLIP [23]W ACV 25 CLIP 78.7 32.1 21.4 31.4 17.3 52.2 28.7 29.9 36.5 dino.txt [24]CV P R25 DINOv2(reg) 62.1 30.9 20.9 32.1 20.6 – – – – FreeDA [2]CV P R24 DINOv2 71.8 35.4 24.2 32.3 19.4 44.9 31.1 24.6 35.5 FreeDA [2]CV P R24 CLIP+DINOv2 85.7 39.7 26.3 33.6 21.4 44.1 34.8 33.9 39.9 ProxyCLIP [33]ECCV 24 CLIP+DINOv2(reg) 85.2 36.2 24.6 35.2 21.6 56.6 33.0 36.7 41.1 ProxyCLIP [33]ECCV 24 CLIP+DINO 83.2 37.7 25.6 40.1 22.6 60.6 34.5 39.2 43.0 CLIPer [56]ICCV 25 CLIP 88.2 39.8 25.8 – 21.8 61.2 34.3 39.6 – Talk2DINO [3]ICCV 25 DINOv2(reg) 87.1 39.1 27.0 35.8 21.1 60.1 34.2 37.6 42.8 Talk2DINO* [3]ICCV 25 DINOv3 87.7 43.0 32.6 40.8 24.2 65.9 37.9 48.6 47.6 Ours DINOv3 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5

有掩码细化 SCLIP [58]ECCV 24 CLIP 76.3 27.4 18.7 23.9 11.8 47.8 23.8 26.9 32.1 NACLIP [23]W ACV 25 CLIP 84.5 36.4 24.6 37.1 19.6 57.9 36.4 34.6 41.4 FreeDA [2]CV P R24 DINOv2 75.2 39.0 27.0 33.1 21.3 45.3 34.3 26.7 37.7 FreeDA [2]CV P R24 CLIP+DINOv2 87.1 42.4 28.1 33.8 22.6 55.4 37.1 36.1 42.8 ProxyCLIP [33]ECCV 24 CLIP+DINOv2(reg) 85.8 37.6 25.6 37.5 22.5 59.4 34.6 39.0 42.8 ProxyCLIP [33]ECCV 24 CLIP+DINO 83.2 38.0 26.2 41.0 22.6 60.7 34.7 39.4 43.2 CLIPer [56]ICCV 25 CLIP 90.0 43.6 28.7 – 24.4 69.8 38.0 43.3 – Talk2DINO [3]ICCV 25 DINOv2(reg) 89.8 42.7 29.6 38.4 22.9 66.1 37.3 42.3 46.1 Talk2DINO* [3]ICCV 25 DINOv3 88.2 44.3 33.8 40.5 24.8 67.0 39.2 50.4 48.5 Ours DINOv3 91.6 45.3 32.1 46.2 25.9 69.8 41.1 48.4 50.1

我们的框架达到了 50.1% 的平均 mIoU 峰值,进一步巩固了其在大多数基准测试中的优越性能。这一结果表明,性能提升不仅仅归因于骨干网络更优越的视觉表示。图 4 中提供的定性比较进一步支持了我们方法的优越性,该图展示了在三个不同基准测试上的结果:Pascal VOC (V21)、Cityscapes (City) 和 Pascal Context (C59)。值得注意的是,在 Cityscapes 示例(图 4 中间行)中,我们的方法成功捕捉到了基线方法未能识别的小型公交车和植被类别。额外的定性比较结果见补充材料。与其他最先进方法相比,我们的结果在细节方面表现出显著的改进,证明了基于 ODE 的转换有效地实现了最优的文本-视觉流形对齐。

5 结论

在这项工作中,我们提出了 DINOde,这是一种基于 ODE 的对齐框架,旨在弥合开放词汇语义分割中自监督视觉表示与文本表示之间的语义鸿沟。现有的基于 MLP 的投影方法近似于复杂

第 15 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 15

图像 真实标签 FreeDA Talk2DINO* 本文方法

图 4:与最先进方法的定性比较。Talk2DINO* 的结果使用 DINOv3 骨干网络获得,以确保公平比较。

异构表示流形通过单步映射,这往往无法保留特征空间的内在几何结构。为了解决这一局限性,在 DINOde 中,我们提出了语义文本流(Semantic Text Flow, STF),它沿着常微分方程(ODE)轨迹逐步演化文本嵌入,使其趋向于 DINO 特征空间,从而实现平滑的跨模态对齐。此外,全局上下文流(Global Context Flow, GCF)逐步精炼由 [CLS] token 携带的全局图像表示,以更好地捕捉整体视觉语义。为了进一步保留特征空间的超球面几何结构,我们引入了速度切向投影(Velocity Tangent Projection, VTP),它将速度场约束在切空间内,从而实现保持几何结构的对齐。大量实验表明,所提出的 DINOde 有效改善了跨模态表示学习,并一致提升了在 OVSS 基准测试上的性能。这些结果突显了基于流的对齐方法在弥合视觉和语言表示方面潜力。作为未来工作,鉴于现代多模态大语言模型(MLLMs)通过单个 MLP 投影器将冻结的视觉特征映射到语言空间,这类似于我们重新审视的离散基线,我们预计基于连续 ODE 的对齐将是改善 MLLMs 中细粒度视觉定位的一个有前景的方向。

致谢

本研究得到了韩国政府(MSIT)资助的国家研究基金会(NRF)(项目编号:RS-2026-25561904)以及韩国政府(MSIT)资助的韩国国家研究基金会(NRF) grants(项目编号:RS-2026-25473963)的支持。

第 16 页

16 Yoon 等人

参考文献

1. Araslanov, N., Roth, S.: 从图像标签进行单阶段语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 4253–4262 (2020) 2. Barsellotti, L., Amoroso, R., Cornia, M., Baraldi, L., Cucchiara, R.: 使用离线扩散增强原型生成的免训练开放词汇分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3689–3698 (2024) 3. Barsellotti, L., Bianchi, L., Messina, N., Carrara, F., Cornia, M., Baraldi, L., Falchi, F., Cucchiara, R.: 与 DINO 对话:通过语言桥接自监督视觉骨干网络以实现开放词汇分割。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 22025–22035 (2025) 4. Behrmann, J., Grathwohl, W., Chen, R.T., Duvenaud, D., Jacobsen, J.H.: 可逆残差网络。在:国际机器学习会议论文集。pp. 573–582. PMLR (2019) 5. Bousselham, W., Petersen, F., Ferrari, V., Kuehne, H.: 万物定位:视觉-语言 Transformer 中涌现的定位属性。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3828–3837 (2024) 6. Caesar, H., Uijlings, J., Ferrari, V.: Coco-stuff:语境中的物体与材质类别。在:IEEE 计算机视觉与模式识别会议论文集。pp. 1209–1218 (2018) 7. Cai, K., Ren, P., Zhu, Y., Xu, H., Liu, J., Li, C., Wang, G., Liang, X.: Mixreorg:跨模态混合补丁重组是开放世界语义分割的良好掩码学习器。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 1196–1205 (2023) 8. Caron, M., Touvron, H., Misra, I., Jégou, H., Mairal, J., Bojanowski, P., Joulin, A.: 自监督视觉 Transformer 中涌现的属性。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 9650–9660 (2021) 9. Cha, J., Mun, J., Roh, B.: 仅从图像-文本对学习生成文本接地掩码以进行开放世界语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 11165–11174 (2023) 10. Changpinyo, S., Sharma, P., Ding, N., Soricut, R.: Conceptual 12m:推动网络规模图像-文本预训练以识别长尾视觉概念。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3558–3568 (2021) 11. Chen, J., Zhu, D., Qian, G., Ghanem, B., Yan, Z., Zhu, C., Xiao, F., Culatana, S.C., Elhoseiny, M.: 仅从 CLIP 视觉编码器蒸馏探索开放词汇语义分割。在:IEEE/CVF 国际计算机视觉会议论文集。pp. 699–710 (2023) 12. Chen, L.C., Zhu, Y., Papandreou, G., Schroff, F., Adam, H.: 使用空洞可分离卷积的编码器-解码器用于语义图像分割。在:欧洲计算机视觉会议 (ECCV) 论文集。pp. 801–818 (2018) 13. Chen, R.T., Rubanova, Y., Bettencourt, J., Duvenaud, D.K.: 神经常微分方程。神经信息处理系统进展 31 (2018) 14. Chen, X., Fang, H., Lin, T.Y., Vedantam, R., Gupta, S., Dollár, P., Zitnick, C.L.: Microsoft coco captions:数据收集与评估服务器。arXiv 预印本 arXiv:1504.00325 (2015)

第 17 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 17

15. Cheng, B., Schwing, A., Kirillov, A.: 逐像素分类并非语义分割的全部需求。神经信息处理系统进展 34, 17864–17875 (2021) 16. Cho, H., Yoon, S.H., Kweon, H., Yoon, K.J.: 在点中寻找意义:事件相机的弱监督语义分割。在:欧洲计算机视觉会议。页码 266–286。Springer (2024) 17. Cordts, M., Omran, M., Ramos, S., Rehfeld, T., Enzweiler, M., Benenson, R., Franke, U., Roth, S., Schiele, B.: 用于语义城市场景理解的城市景观数据集。在:IEEE计算机视觉与模式识别会议论文集。页码 3213–3223 (2016) 18. Darcet, T., Oquab, M., Mairal, J., Bojanowski, P.: 视觉Transformer需要寄存器。arXiv预印本 arXiv:2309.16588 (2023) 19. Dupont, E., Doucet, A., Teh, Y.W.: 增强型神经常微分方程。神经信息处理系统进展 32 (2019) 20. Everingham, M., Van Gool, L., Williams, C.K., Winn, J., Zisserman, A.: Pascal视觉物体类别(VOC)挑战赛。国际计算机视觉杂志 88(2), 303–338 (2010) 21. Gandhamal, A., Sikdar, A., Sundaram, S.: Ov-coast:用于开放词汇语义分割的最优传输成本聚合。arXiv预印本 arXiv:2506.03706 (2025) 22. Ghiasi, G., Gu, X., Cui, Y., Lin, T.Y.: 利用图像级标签扩展开放词汇图像分割。在:欧洲计算机视觉会议。页码 540–557。Springer (2022) 23. Hajimiri, S., Ayed, I.B., Dolz, J.: 关注你的邻居:免训练的开放词汇语义分割。在:2025 IEEE/CVF计算机视觉应用冬季会议 (WACV)。页码 5061–5071。IEEE (2025) 24. Jose, C., Moutakanni, T., Kang, D., Baldassarre, F., Darcet, T., Xu, H., Li, D., Szafraniec, M., Ramamonjisoa, M., Oquab, M., 等:DINOv2遇见文本:一种统一的图像级和像素级视觉-语言对齐框架。在:计算机视觉与模式识别会议论文集。页码 24905–24916 (2025) 25. Kang, D., Cho, M.: 为开放词汇语义分割中的惰性视觉定位辩护。在:欧洲计算机视觉会议。页码 143–164。Springer (2024) 26. Kim, J., Kwon, H., Kweon, H., Yoon, K.J.: 通过蒸馏辅助测试时自适应引导视频语义分割模型。在:IEEE/CVF计算机视觉与模式识别会议论文集。页码 10766–10777 (2026) 27. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., 等:Segment anything。在:IEEE/CVF国际计算机视觉会议论文集。页码 4015–4026 (2023) 28. Kweon, H., Yoon, S.H., Kim, H., Park, D., Yoon, K.J.: 释放普通分类器的潜力:用于弱监督语义分割的类别特定对抗擦除框架。在:IEEE/CVF国际计算机视觉会议论文集。页码 6994–7003 (2021) 29. Kweon, H., Yoon, S.H., Yoon, K.J.: 通过分类器和重构器的对抗学习实现弱监督语义分割。在:IEEE/CVF计算机视觉与模式识别会议论文集。页码 11329–11339 (2023) 30. Kwon, H., Jeong, J., Yoon, S.H., Yoon, K.J.: 用于弱监督语义分割的相位集中与捷径抑制。在:欧洲计算机视觉会议。页码 293–312。Springer (2024)

第 18 页

18 Yoon 等人

31. Lai, Z.: 探索简单的开放词汇语义分割。在:计算机视觉与模式识别会议论文集。pp. 30221–30230 (2025) 32. Lan, M., Chen, C., Ke, Y., Wang, X., Feng, L., Zhang, W.: Clearclip:分解 CLIP 表示以进行密集视觉-语言推理。在:欧洲计算机视觉会议。pp. 143–160. Springer (2024) 33. Lan, M., Chen, C., Ke, Y., Wang, X., Feng, L., Zhang, W.: Proxyclip:代理注意力改进 CLIP 以用于开放词汇分割。在:欧洲计算机视觉会议。pp. 70–88. Springer (2024) 34. Li, B., Weinberger, K.Q., Belongie, S., Koltun, V., Ranftl, R.: 语言驱动的语义分割。在:国际学习表征会议 (2022), https://openreview.net/forum?id=RriDjddCLN 35. Liang, F., Wu, B., Dai, X., Li, K., Zhao, Y., Zhang, H., Zhang, P., Vajda, P., Marculescu, D.: 使用掩码适配 CLIP 进行开放词汇语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 7061–7070 (2023) 36. Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollár, P., Zitnick, C.L.: Microsoft coco:上下文中的常见对象。在:欧洲计算机视觉会议。pp. 740–755. Springer (2014) 37. Lipman, Y., Chen, R.T., Ben-Hamu, H., Nickel, M., Le, M.: 用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747 (2022) 38. Liu, X., Gong, C., Liu, Q.: 直线且快速流动:学习使用整流流生成和转移数据。arXiv 预印本 arXiv:2209.03003 (2022) 39. Lou, A., Lim, D., Katsman, I., Huang, L., Jiang, Q., Lim, S.N., De Sa, C.M.: 神经流形常微分方程。神经信息处理系统进展 33, 17548–17558 (2020) 40. Luo, H., Bao, J., Wu, Y., He, X., Li, T.: Segclip:用于开放词汇语义分割的可学习中心补丁聚合。在:国际机器学习会议。pp. 23033–23044. PMLR (2023) 41. Luo, J., Khandelwal, S., Sigal, L., Li, B.: 从现成视觉-语言模型中涌现的开放词汇语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 4029–4040 (2024) 42. Mathieu, E., Nickel, M.: 黎曼连续归一化流。神经信息处理系统进展 33, 2503–2515 (2020) 43. Mottaghi, R., Chen, X., Liu, X., Cho, N.G., Lee, S.W., Fidler, S., Urtasun, R., Yuille, A.: 上下文在野外物体检测和语义分割中的作用。在:IEEE 计算机视觉与模式识别会议论文集。pp. 891–898 (2014) 44. Mukhoti, J., Lin, T.Y., Poursaeed, O., Wang, R., Shah, A., Torr, P.H., Lim, S.N.: 使用补丁对齐对比学习的开放词汇语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 19413–19423 (2023) 45. Mur-Labadia, L., Muckley, M., Bar, A., Assran, M., Sinha, K., Rabbat, M., Le-Cun, Y., Ballas, N., Bardes, A.: V-jepa 2.1:解锁视频自监督学习中的密集特征。arXiv 预印本 arXiv:2603.14482 (2026) 46. Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., 等:Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193 (2023)

第 19 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 19

47. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., 等:从自然语言监督中学习可迁移的视觉模型。在:国际机器学习会议。页码 8748–8763。PMLR (2021) 48. Rezende, D., Mohamed, S.:使用归一化流的变分推断。在:国 际机器学习会议。页码 1530–1538。PMLR (2015) 49. Ronneberger, O., Fischer, P., Brox, T.:U-net:用于生物医学图像分割的卷积网络。在:国际医学图像计算 与计算机辅助干预会议。页码 234–241。Springer (2015) 50. Sharma, P., Ding, N., Goodman, S., Soricut, R.:概念字幕:一个经过清洗、超类化的图像替代文本数据集,用于自动图像描述。在:第 56 届计算语言学协会年会论文集 (第一卷:长论文)。页码 2556–2565 (2018) 51. Shin, G., Xie, W., Albanie, S.:Reco:检索与协同分割以实现零样本迁移。 神经信息处理系统进展 35, 33754–33767 (2022) 52. Siméoni, O., Puy, G., Vo, H.V., Roburin, S., Gidaris, S., Bursuc, A., Pérez, P., Marlet, R., Ponce, J.:使用自监督变换器和无标签数据定位对象。arXiv 预印本 arXiv:2109.14279 (2021) 53. Siméoni, O., Vo, H.V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khali- dov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., 等:Dinov3。arXiv 预印本 arXiv:2508.10104 (2025) 54. Sun, G., Liu, Y., Ding, H., Probst, T., Van Gool, L.:用于视频语义分割的由粗到细的特征挖掘。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 3126–3137 (2022) 55. Sun, G., Liu, Y., Ding, H., Wu, M., Van Gool, L.:学习视频语义分割的局部和全局时间上下文。IEEE 模式分析与机器智能汇刊 (2024) 56. Sun, L., Cao, J., Xie, J., Jiang, X., Pang, Y.:Cliper:分层改进 CLIP 的空间表示以用于开放词汇语义分割。在:IEEE/CVF 国际计算机视觉会议论文集。页码 23199– 23209 (2025) 57. Sun, S., Li, R., Torr, P., Gu, X., Li, S.:将 CLIP 作为 RNN:无需训练努力即可分割无数视觉概念。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 13171–13182 (2024) 58. Wang, F., Mei, J., Yuille, A.:Sclip:重新思考密集视觉-语言推理中的自注意力。在:欧洲计算机视觉会议。页码 315–332。 Springer (2024) 59. Wang, Y., Shen, X., Yuan, Y., Du, Y., Li, M., Hu, S.X., Crowley, J.L., Vaufreydaz, D.:Tokencut:使用自监督变换器和归一化割分割图像和视频中的对象。IEEE 模式分析与机器智能汇刊 45(12), 15790–15801 (2023) 60. Wysoczańska, M., Ramamonjisoa, M., Trzciński, T., Siméoni, O.:Clip-diy:CLIP 密集推理免费生成开放词汇语义分割。在:IEEE/CVF 计算机视觉应用冬季会议论文集。 页码 1403–1413 (2024) 61. Wysoczańska, M., Siméoni, O., Ramamonjisoa, M., Bursuc, A., Trzciński, T., Pérez, P.:Clip-dinoiser:教 CLIP 一些 DINO 技巧以用于开放词汇语义分割。在:欧洲计算机视觉会议。页码 320–337。 Springer (2024)

第 20 页

20 Yoon 等人

62. Xie, E., Wang, W., Yu, Z., Anandkumar, A., Alvarez, J.M., Luo, P.: Segformer: 基于 Transformer 的语义分割的简单高效设计。神经信息处理系统进展 34, 12077–12090 (2021) 63. Xie, J., Hou, X., Ye, K., Shen, L.: Clims: 用于弱监督语义分割的跨语言图像匹配。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 4483–4492 (2022) 64. Xu, J., De Mello, S., Liu, S., Byeon, W., Breuel, T., Kautz, J., Wang, X.: Groupvit: 语义分割从文本监督中涌现。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 18134– 18144 (2022) 65. Xu, J., Liu, S., Vahdat, A., Byeon, W., Wang, X., De Mello, S.: 使用文本到图像扩散模型进行开放词汇全景分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2955–2966 (2023) 66. Xu, J., Hou, J., Zhang, Y., Feng, R., Wang, Y., Qiao, Y., Xie, W.: 从自然语言监督中学习开放词汇语义分割模型。在: IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2935–2944 (2023) 67. Xu, L., Ouyang, W., Bennamoun, M., Boussaid, F., Xu, D.: 用于弱监督语义分割的多类标记 Transformer。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 4310–4319 (2022) 68. Xu, M., Zhang, Z., Wei, F., Hu, H., Bai, X.: 用于开放词汇语义分割的侧适配器网络。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2945–2954 (2023) 69. Xu, M., Zhang, Z., Wei, F., Lin, Y., Cao, Y., Hu, H., Bai, X.: 一种使用预训练视觉-语言模型进行开放词汇语义分割的简单基线。 在:欧洲计算机视觉会议。pp. 736–753。Springer (2022) 70. Yi, M., Cui, Q., Wu, H., Yang, C., Yoshie, O., Lu, H.: 一种用于文本监督语义分割的简单框架。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 7071–7080 (2023) 71. Yoon, S.H., Kweon, H., Cho, J., Kim, S., Yoon, K.J.: 通过带有门控金字塔池化层的三元组进行对抗性擦除框架,用于弱监督语义分割。在:欧洲计算机视觉会议。pp. 326–344。Springer (2022) 72. Yoon, S.H., Kwon, H., Jeong, J., Park, D., Yoon, K.J.: 扩散引导的弱监督语义分割。在:欧洲计算机视觉会议。 pp. 393–411。Springer (2024) 73. Yoon, S.H., Kwon, H., Kim, H., Yoon, K.J.: 类别标记注入用于弱监督语义分割。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 3595–3605 (2024) 74. Yu, L., Poirson, P., Yang, S., Berg, A.C., Berg, T.L.: 建模指代表达中的上下文。在:欧洲计算机视觉会议。pp. 69–85。Springer (2016) 75. Yu, Q., He, J., Deng, X., Shen, X., Chen, L.C.: 卷积难以消亡:使用单个冻结卷积 CLIP 进行开放词汇分割。神经信息处理系统进展 36, 32215–32234 (2023) 76. Yuan, Y., Chen, X., Wang, J.: 用于语义分割的对象上下文表示。在:计算机视觉–ECCV 2020:第 16 届欧洲会议,英国格拉斯哥,2020 年 8 月 23–28 日,论文集,第六部分 16。pp. 173–190。Springer (2020)

第 21 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 21

77. Zhai, X., Mustafa, B., Kolesnikov, A., Beyer, L.: 用于语言图像预训练的 Sigmoid 损失。在:IEEE/CVF 国际计算机视觉会议论文集。第 11975–11986 页 (2023) 78. Zhang, H., Li, F., Zou, X., Liu, S., Li, C., Yang, J., Zhang, L.: 开放词汇分割与检测的简单框架。在:IEEE/CVF 国际计算机视觉会议论文集。第 1020–1031 页 (2023) 79. Zheng Ding, Jieke Wang, Z.T.: 使用 MaskCLIP 进行开放词汇通用图像分割。在:国际机器学习会议 (2023) 80. Zhou, B., Zhao, H., Puig, X., Fidler, S., Barriuso, A., Torralba, A.: 通过 ADE20K 数据集进行场景解析。在:IEEE 计算机视觉与模式识别会议论文集。第 633–641 页 (2017) 81. Zhou, B., Zhao, H., Puig, X., Xiao, T., Fidler, S., Barriuso, A., Torralba, A.: 通过 ADE20K 数据集理解场景语义。国际计算机视觉杂志 127(3), 302–321 (2019) 82. Zhou, C., Loy, C.C., Dai, B.: 从 CLIP 提取免费密集标签。在:欧洲计算机视觉会议论文集。第 696–712 页。Springer (2022) 83. Zhou, J., Wei, C., Wang, H., Shen, W., Xie, C., Yuille, A., Kong, T.: iBOT:带有在线分词器的图像 BERT 预训练。arXiv 预印本 arXiv:2111.07832 (2021) 84. Zou, X., Dou, Z.Y., Yang, J., Gan, Z., Li, L., Li, C., Dai, X., Behl, H., Wang, J., Yuan, L., 等:用于像素、图像和语言的通用解码。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 15116–15127 页 (2023)

第 22 页

22 Yoon 等人

补充材料

S1 补充细节

S1.1 实现细节

我们严格遵循先前最先进工作 [3, 56] 中建立的实验协议,包括提示模板、背景处理和掩码细化 (PAMR) 设置,以确保公平且一致的比较。

背景处理。背景管理的策略因基准测试的特点而异。对于没有专用背景类别的基准测试(V20、C59、Stuff、City 和 ADE),我们限制模型仅预测前景类别,遵循 Talk2DINO [3] 的做法。在这些情况下,Pascal VOC、Context 和 ADE20K 的地面真值 (GT) 中提供的背景标注被视为忽略区域。对于包含背景类别的基准测试(V21、C60 和 Object),我们遵循 CLIPer [56] 的做法。我们将背景纳入预测空间,并利用背景阈值处理,将置信度分数低于特定阈值的区域重新分配给背景类别。遵循 CLIPer 的严格实现,我们使用表 6 中列出的基准测试特定的背景类别。当基准测试包含多个背景类别时,最终背景概率计算为预测的背景类别概率中的最大值。

提示模板。为了通过 CLIP 文本编码器生成文本嵌入,我们采用 CLIPer [56] 中使用的特定提示模板。

掩码细化。对于掩码细化,我们遵循 Talk2DINO [3] 采用像素自适应掩码细化 (PAMR)。具体而言,我们应用膨胀率为 {1, 2, 4, 8, 12, 24} 的局部邻域核,并运行 10 次细化迭代以细化预测的掩码。

S1.2 架构细节

如图 5 所示,在整个实验中,MLP 基线模型和我们的速度网络设计完全相同,除了时间条件部分,以确保公平比较。为了最小化仅在速度网络中使用的 Time MLP 和 FiLM 层引入的参数增加,我们将速度网络的 dim 设置为 1024,dimhidden 设置为 512。因此,MLP 基线模型拥有 8.4M 参数,而 DINOde 中的速度网络拥有 7.5M 参数(比 MLP 基线模型少约 10%)。

S2 补充讨论

计算成本。表 7 报告了我们流水线中主要组件的推理时间,包括视觉骨干网络、CLIP 文本编码器和视觉-文本对齐。所有测量值均基于 VOC

第 23 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 23

表 6:各基准测试中使用的背景类别,遵循 CLIPer [56] 的做法。

基准测试 背景类别

地面、土地、草地、树木、建筑物、墙壁、天空、湖泊、水、河流、海洋、铁路、铁道、 V21 键盘、头盔、云、房屋、山脉、海洋、道路、岩石、街道、山谷、桥梁、标志

地面、土地、草地、树木、建筑物、墙壁、天空、湖泊、水、河流、海洋、铁路、 Object 铁道、头盔、云、房屋、山脉、海洋、道路、岩石、街道、山谷、桥梁

C60 背景

图 5:网络架构示意图。(a) MLP 基线,(b) DINOde 的速度网络。

数据集。在此,我们将离散的单步投影(MLP)与提出的语义文本流(STF)进行比较,STF 使用不同数量的欧拉积分步数(Nstep)进行评估。标准的 MLP 基线需要 1.05 毫秒,而执行 STF 的单步前向积分(Nstep = 1)需要 2.01 毫秒。将连续变换轨迹扩展至 Nstep = 10 时,推理时间为 17.70 毫秒。与视觉骨干网络(45.75 毫秒)和 CLIP 文本编码器(354.49 毫秒)的计算成本相比,10 步数值流引入的额外开销相对较小。考虑到 DINOde 实现的性能提升,这种额外成本在准确性和计算开销之间构成了适度的权衡。由于提出的 DINOde 在结构上与 MLP 基线几乎相同,因此 GPU 消耗也保持相对一致。对于固定的类别集合,这种对齐成本仅发生一次并被缓存,因此每幅图像的推理速度与先前工作相当:DINOde 的运行速度为 22.2 FPS,而 Talk2DINO [3] 为 22.3 FPS,一次性文本锚点设置时间为 381.7 毫秒,而 Talk2DINO 为 336.0 毫秒。

第 24 页

24 Yoon 等人

表 7:在 Pascal VOC 数据集上评估的推理时间分析。

方法 时间 (ms) 显存 (MB)

MLP 1.05 82.4 STF (Nstep = 1) 2.01 93.8 STF (Nstep = 10) 17.70 93.8

视觉骨干网络 45.75 1208.7 文本编码 354.49 1693.4

平均 mIoU 50.0 我们的方法 49.5 (Top-K) 49.0 48.5 MLP 48.0 (Top-K) 47.5 47.0 我们的方法 (GAP) 46.5 46.0 45.5 MLP (GAP) 45.0 K 1 5 10 15 20 25 30 35 40

图 6:关于池化策略和超参数 K 的消融研究。

池化策略的消融研究。关于主论文公式 6 中介绍的池化函数“Pool”,我们进行了消融研究,以评估不同池化策略以及 Min-Max Top-K 池化 [71] 中超参数 K 的影响,如图 6 所示。性能报告为八个基准测试上的平均 mIoU。首先,无论采用哪种池化策略——全局平均池化 (GAP) 还是 Min-Max Top-K 池化 (Top-K),我们基于 ODE 的方法始终优于基于 MLP 的基线。这一性能差距清楚地表明了我们基于连续流对齐的优越性,它比基线更有效地弥合了模态差距。 接下来,我们比较了 Top-K 池化与 GAP。如图 6 所示,无论采用基于 MLP 还是我们提出的基于 ODE 的对齐方法,Top-K 池化在所有 K 配置下均 consistently 优于 GAP。这一趋势可归因于 DINOv3 的架构特性,它生成了高度细粒度且对齐良好的块级特征。虽然 GAP 因对所有块 token(包括模糊元素)进行平均平均化而导致信息稀释,但 Min-Max Top-K 池化通过选择性地聚合判别性表示,可能有助于实现更稳健的流形对齐。 最后,我们对 K 进行了消融实验,尽管性能在测试范围内保持相对稳定。虽然峰值性能记录在 K = 10 时,但我们选择 K = 20 以优先考虑整体训练稳定性和特征表示的鲁棒性。

第 25 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 25

表 8:在八个基准测试上,欧拉法、RK2(Heun、Midpoint)和 RK4 ODE 求解器的定量比较。

ODE 积分 V20 C59 Stuff City ADE V21 C60 Object Avg

欧拉法 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5 RK2-Heun 91.0 44.1 31.9 46.1 25.4 69.0 40.3 48.5 49.5 RK2-Midpoint 91.0 44.1 31.9 46.1 25.4 69.1 40.2 48.6 49.5 RK4 90.9 44.1 31.9 45.9 25.3 68.7 40.1 48.4 49.5

表 9:在参数量预算匹配的情况下,与应用于 CLIP 文本编码器的基于 PEFT 的基线方法的比较。

方法 LoRA OFT COFT MLP ours

平均 mIoU ↑ 46.13 46.14 46.12 47.65 49.50

求解器的影响。表 8 比较了默认配置中使用的欧拉积分与二阶 Runge–Kutta (RK2)-Heun 和 RK2-Midpoint 求解器以及四阶 Runge–Kutta (RK4) 求解器。有趣的是,在所有八个基准数据集上,所有求解器获得的平均 mIoU 几乎相同,约为 49.5%,仅在个别数据集上存在微小差异。这表明学习到的速度场产生了足够平滑的轨迹,高阶数值积分并未带来明显的性能提升。综合考虑性能和计算效率,我们采用欧拉积分作为默认求解器。

与 PEFT 方法的比较。在冻结的文本编码器顶部附加一个可训练的投影器可以被视为一种参数高效微调(PEFT)。为了检验 DINOde 的收益是否源于连续对齐而非参数高效适应,我们在可训练参数量匹配的情况下,将 DINOde 与应用于 CLIP 文本编码器的 LoRA、OFT 和 COFT 进行比较(表 9)。尽管它们在各个数据集上的性能各不相同,但 PEFT 基线获得的平均 mIoU 相似。DINOde 始终优于所有 PEFT 基线以及 MLP,证实了改进源于基于 ODE 的跨模态对齐本身。

向非 DINO 骨干网络的泛化。除了主论文中研究的 DINOv3 骨干网络扩展(表 3)外,我们进一步评估了连续对齐是否泛化到其他视觉骨干网络,包括 SAM [27]、SigLIP [77]、iBOT [83] 和 V-JEPA 2.1 [45](表 10)。DINOde 在所有骨干网络上均超越了 MLP 基线。对于 SAM,其表示未针对类级别语义进行优化,两种方法产生的绝对性能都较低,但 DINOde 仍然优于 MLP。这些结果表明,基于 ODE 的对齐带来的好处并非 DINO 所特有,而是适用于具有不同语义结构的各类视觉骨干网络。

第 26 页

26 Yoon 等人

表 10:泛化到非 DINO 视觉骨干网络(平均 mIoU)。

对齐方法 SAM [27] SigLIP [77] iBOT [83] V-JEPA 2.1 [45]

MLP 7.0 26.0 33.1 31.7 本文方法 7.7 26.9 34.5 34.7

额外定性结果。为了进一步证明所提出的 DINOde 的有效性,我们在图 7 中展示了额外的定性比较,以补充正文中展示的定性结果。我们将 FreeDA(一种无需训练的方法)、Talk2DINO*(使用 DINOv3 骨干网络,同样利用自监督视觉骨干网络)以及本文提出的方法进行了比较。定性示例收集自六个数据集:V20、C59、City、ADE、V21 和 C60。如图所示,尽管以往的最先进方法往往无法生成准确的分割掩码,但 DINOde 生成的预测结果与真实值(ground truth)非常接近。这一观察结果表明,所提出的连续对齐方法有效地将自监督视觉特征与文本嵌入进行了对齐。此外,如在 City 和 ADE 数据集上观察到的那样,在这些以往方法通常表现相对较低的数据集上,DINOde 仍然产生了令人满意的分割结果,进一步证明了其有效性。为了进一步探究固定提示模板之外的行为,我们在 RefCOCO+ [74] 风格的自然语言查询上评估了 DINOde(图 8)。DINOde 成功定位了由自由形式表达式描述的目标区域,表明对齐后的流形泛化到了超越固定类别名称的更丰富的语言。

第 27 页

DINOde:面向开放词汇语义分割(OVSS)的连续视觉-文本对齐 27

图像 地面真值 FreeDA Talk2DINO* ours

V20

C59

城市

ADE

V21

C60

图 7:与最先进方法的额外定性比较。Talk2DINO* 的结果使用 DINOv3 骨干网络获得,以确保公平比较。

语言: 黑白 木制长椅 穿蓝色外套的男子 枝叶繁茂的 泰迪熊 穿过公园 树木 图 8:RefCOCO+ [74] 风格自然语言查询的定性结果。

发表评论