语义更强却看不清边界?LingBot-Vision的空间预训练

三分钟导读:传统随机掩码往往忽略包含边界信息的Patch。LingBot-Vision引入边界强制掩码,将所有承载边界的Token强制加入掩码集。这迫使模型必须从上下文重建场景的结构,而非仅恢复平坦区域。

英文题目:Vision Pretraining for Dense Spatial Perception

论文出处:arXiv 每日论文精选 · arXiv:2607.05247

原始论文:PDF / 论文页面

对应视频标题:语义更强却看不清边界?LingBot-Vision的空间预训练|推荐指数:★★★★★

这篇论文解决什么问题?

现代视觉基础模型如DINO和MAE主导了预训练领域,但它们优先优化语义不变性,往往牺牲了细粒度的空间理解和几何结构。对于需要物理智能的任务,这种对边界的忽视成为了瓶颈。

核心创新

方法概览

传统随机掩码往往忽略包含边界信息的Patch。LingBot-Vision引入边界强制掩码,将所有承载边界的Token强制加入掩码集。这迫使模型必须从上下文重建场景的结构,而非仅恢复平坦区域。

逐图理解论文

核心方法概述

核心方法概述
Figure 1. LingBot-Vision learns dense representations via boundary-centric masked modeling. Each row, from left to right: the input image; the PCA projection of the frozen teacher’s patch tokens; boundary tokens (pink) obtained by a-contrario validation of dense line proposals decoded from the model’s own boundary-field prediction, overlaid on the accumulated response of the validated proposals; and cosine-similarity maps between nine boundary-token queries (red crosses, selected by farthest-point sampling in feature space) and all patch tokens. The learned representations carry both semantic grouping and geometric structures. Input images are at 1024px for the short side.

LingBot-Vision提出了一种边界中心的掩码建模方法。它不再将边界视为下游输出,而是作为原生学习信号。通过自蒸馏框架,教师模型在线预测边界场,指导学生重建几何结构。

边界强制掩码

边界强制掩码
Figure 2. Boundary-centric masked modeling on a toy scene. (a) An input image and its patch grid. (b) Random masking is content-agnostic: most hidden patches are flat and recoverable from context, while the boundary-bearing patches largely escape the mask. (c) Boundary-forcing masking adds every boundary-bearing patch to the random mask, so the structure of the scene is exactly what the student must reconstruct. (d) The boundary field that supervises boundary tokens, encoded as per-pixel categorical distributions over discretized distance and orientation bins. During pretraining the boundary field is predicted online by the teacher itself, without human labels or external detectors; every masked token follows the semantic self-distillation objective, and boundary tokens additionally match the categorical boundary target.

传统随机掩码往往忽略包含边界信息的Patch。LingBot-Vision引入边界强制掩码,将所有承载边界的Token强制加入掩码集。这迫使模型必须从上下文重建场景的结构,而非仅恢复平坦区域。

在线目标生成

在线目标生成
Figure 5. Online generation of boundary targets (toy example). Even when the teacher’s boundary field is noisy, as it is early in training (b), the holistic parameterization lets the many weak per-pixel votes in a segment’s support region aggregate into coherent candidate segments anchored at corner points (c), together with spurious candidates such as face diagonals and background chords. The a-contrario test then discards unsupported candidates, and the survivors are re-rendered into the clean target field that supervises the student (d). Boundary targets thus emerge from raw images, with only a frozen single-block corner-point detector fixed (Sec. 3.4).

该方法无需人工标注或外部检测器。它利用冻结的角点检测器和投票聚合解码,从原始图像中自举边界目标。通过a-contrario验证剔除噪声,生成干净的边界场以监督学生模型。

表征质量对比

表征质量对比
Figure 6. PCA of frozen patch features. The top three PCA components of the patch features are mapped to RGB, computed per image for each model (one model per column). LingBot-Vision (rightmost) resolves objects as coherent regions with crisp boundaries: individual cars and lane structure in the traffic scene, hen silhouettes against the wire fence, the winding contour of the snake, and fine structures such as flower stalks and branches. In comparison, DINOv2 exhibits per-token speckle, SigLIP 2 degrades into blocky noise, and V-JEPA 2.1 lets background texture bleed into the foreground regions.

PCA可视化显示,LingBot-Vision的特征能解析出具有清晰边界的连贯区域,如车辆轮廓和蛇形曲线。相比之下,DINOv2存在斑点噪声,SigLIP 2则退化为块状噪声,背景纹理渗入前景。

密集任务性能

密集任务性能
Table 2. Performance on dense visual tasks. We report the Root Mean Squared Error (RMSE) for depth estimation (NYUv2, KITTI) and mean Intersection-over-Union (mIoU) for semantic segmentation (ADE20K, Cityscapes, VOC12). Following [39], ADE20K and VOC12 are evaluated at an input resolution of 448 × 448 for models with patch size 14 and 512 × 512 for those with patch size 16. Cityscapes, NYUv2, and KITTI use their default evaluation resolutions. With a 1B-parameter backbone, LingBot-Vision attains the best NYUv2 RMSE overall, ahead of the 7B-parameter DINOv3.

在密集视觉任务上,1B参数的LingBot-Vision表现优异。NYUv2深度估计RMSE为0.296,优于7B参数的DINOv3。ADE20K语义分割mIoU达53.5,与DINOv3 ViT-H+相当,证明了其高效的空间感知能力。

实验与关键结果

阅读时需要注意

  • 尽管在密集任务上表现卓越,但LingBot-Vision在ImageNet-1K分类上略逊于DINOv3-7B和SigLIP 2。这种权衡表明,增强几何结构感知是以牺牲部分全局语义不变性为代价的,需根据应用场景选择模型。
  • The advantage in dense tasks comes at the cost of global semantic invariance compared to pure self-distillation methods.
  • Performance gains in depth completion depend on the quality of the pretraining initialization; LingBot-Vision initialization scales better with data than DINOv2 (Fig 8).

关联工作

  • 现代视觉基础模型如DINO和MAE主导了预训练领域,但它们优先优化语义不变性,往往牺牲了细粒度的空间理解和几何结构。对于需要物理智能的任务,这种对边界的忽视成为了瓶颈。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

面向密集空间感知的视觉预训练

Zelin Fu∗ Bin Tan∗ Changjiang Sun Shaohui Liu Kecheng Zheng Yinghao Xu Xing Zhu Yujun Shen Nan Xue†

∗同等贡献 †项目负责人

密集空间感知对于物理智能至关重要,视觉系统需要从像素观测中恢复出结构化、度量化和可操作的表示。现代视觉基础模型往往优先考虑语义不变性,这通常以牺牲对详细空间的理解为代价。在本工作中,我们从以边界为中心的视角研究视觉预训练,其动机基于这样一个前提:边界和形状不连续性为感知几何属性提供了关键线索。具体而言,我们提出了掩码边界建模(masked boundary modeling),这是一种自监督范式,它动态学习亚像素级边界表示,随后利用发现的携带边界信息的 token 作为掩码目标,以促进密集视觉 token 的学习。通过扩展该框架,我们开发了 LingBot-Vision,并以 DINOv3 作为强基线,在多样化的下游视觉任务中证明了其有效性。值得注意的是,LingBot-Vision 推动了 LingBot-Depth 向 LingBot-Depth 2.0 的演进,用于深度补全,从而提升了深度估计——这是具身人工智能的关键支柱。我们的研究结果表明,边界建模超越了简单的线段,而是作为一种可扩展的预训练原则,用于学习空间结构化的视觉表示。[cs.CV] 网站:https://technology.robbyant.com/lingbot-vision Github:https://github.com/robbyant/lingbot-vision 检查点:https://huggingface.co/collections/robbyant/lingbot-vision

1 引言

视觉智能不仅关乎识别图像中的内容,还关乎恢复使物理世界可测量、可导航和可操作的密集空间结构。在分割、深度、运动和场景布局中,这种结构反复通过形状和边界显现:对象掩码勾勒出实体,深度不连续性暴露了几何结构,运动剪影分离了动态区域,而遮挡轮廓则组织了可见表面。然而,许多现代视觉基础模型受旨在促进语义不变性、跨模态对齐或外观重建的目标驱动,在下游物理智能所依赖的细粒度空间理解方面相对薄弱。

一个核心原因在于对形状和边界的处理方式。它们通常被视为感知的输出,在专用监督下由任务特定的头部恢复。这种以输出为中心的视角将它们与昂贵、模糊且经常不可用的标注绑定在一起,使得在大规模预训练中难以利用它们。因此,基础模型很少将形状和边界作为原生的学习信号,而是依赖于视图不变式的自蒸馏 [9, 28, 39]、跨模态对齐 [32, 61] 或掩码图像重建 [19]。我们认为这是一个错失的机会:边界和形状不连续性不仅仅是需要预测的输出,而是学习密集表示的基本组织信号。

因此,在本工作中,我们研究了随机初始化的视觉 Transformer 如何仅从原始图像中学习形状和边界感知的表示,而无需人工标注、外部边缘检测器或预训练骨干网络。我们的研究建立在边界几何的密集、过参数化场表示 [58, 59] 之上,这些表示通过逐像素的、类似距离变换的场对矢量化的边界进行编码。此类表示已在监督式的线段和线框检测中得到广泛应用,它们将稀疏的几何结构转化为密集的学习

1

第 2 页

图 1. LingBot-Vision 通过以边界为中心的掩码建模学习密集表示。每一行从左到右依次为:输入图像;冻结教师模型补丁标记(patch tokens)的 PCA 投影;通过 a-contrario 验证获得的边界标记(粉色),这些验证基于从模型自身的边界场预测中解码出的密集线提议,并叠加在经过验证的提议的累积响应之上;以及九个边界标记查询(红色叉号,通过在特征空间中进行最远点采样选择)与所有补丁标记之间的余弦相似度图。所学表示同时包含语义分组和几何结构。输入图像的短边尺寸为 1024 像素。

信号。尽管它们很少被用于自监督表示学习,但我们发现其密集且过参数化的特性使其非常适合我们的目标:在预训练期间,边界几何结构可以从原始图像中自举得到,即使来自未训练的模型,也能产生可用的边界场。

我们采用自蒸馏公式,但将其教师-学生机制从语义标记学习扩展到边界感知的密集标记学习。从随机初始化的网络开始,教师模型为全局视觉语义和子标记边界场生成在线目标,而学生模型则从掩码视图中学习恢复这些目标;通过指数移动平均(EMA)更新,教师的边界感知与学生模型协同演化。这创造了一个根本性的

第 3 页

张力:语义自蒸馏可能会抑制细粒度的边界信号,而边界建模反过来可能会破坏强语义表示所需的不变性。我们方法的核心在于一种设计,将这种张力转化为协作。

边界强制掩码建模。我们的关键思想是让教师自身的边界预测来决定学生必须重建的内容。从教师的在线边界场中,我们识别出携带边界信息的标记(tokens),并将它们强制纳入学生的掩码集合中,从而要求学生仅从周围上下文中恢复边界几何结构。这使得边界——图像中信息密度最高且冗余度最低的区域——成为最难且信息量最大的预测目标。关键在于,掩码标记随后按几何结构进行路由:边界标记由发现的边界场进行监督,而其余掩码标记则遵循标准的语义自蒸馏目标。由于语义目标在两个区域交界处本质上具有歧义性,这种路由在常规掩码建模最薄弱的地方提供了良定的目标。正是这一点使得边界感知表示与语义表示能够共同演化而非相互竞争,从而解决了上述张力。

边界场的类别重参数化。第二个要素使得密集的边界自蒸馏保持稳定。在教师-学生循环中直接回归连续的边界场容易崩溃。我们改为将每个边界场重参数化为离散化分箱上的类别分布,将边界预测重构为逐像素的分类问题。这带来了两个好处。首先,边界目标与稳定语义自蒸馏的中心化和锐化机制兼容,因此边界学习继承了现代自监督学习(SSL)的可扩展性 [28]。其次,它与经典的反常检测理论相联系:在无结构零假设下,边界方向呈均匀分布,因此对均匀性的偏离提供了一种原则性的、无参数的度量,用于衡量标记支持真实边界的强度,这是一种免费获得的验证信号。

扩展与结果。我们将掩码边界建模实例化为大规模模型 LingBot-Vision,这是一个仅使用自监督训练训练的十亿参数视觉 Transformer。在密集空间任务上,LingBot-Vision 的性能匹配或超越了高达七倍规模的视觉基础模型:它在所有比较模型中取得了最佳的 NYU-Depth v2 精度,包括 7B 参数的 DINOv3;在语义和视频对象分割方面与蒸馏后的密集专家模型持平;并且生成的边界标记足够稳定,可以通过冻结特征的简单余弦相似度在视频中跟踪。这些优势在蒸馏后依然存在:ViT-L、ViT-B 和 ViT-S 学生在各自尺寸类别中引领密集预测,而 0.3B 参数的学生仅用大约 23 倍的参数量就达到了与 7B DINOv3 相当的 NYU-Depth v2 精度。最后,我们通过仅更改编码器初始化和训练数据规模,将我们的深度补全系统从 LingBot-Depth 推进到 LingBot-Depth 2.0,在 14 个深度补全基准测试中取得了领先性能;值得注意的是,随着下游训练数据的增加,LingBot-Vision 编码器的优势进一步扩大,表明更好的预训练效果会累积而非被稀释。综上所述,这些结果表明,长期局限于独立轮廓或线段检测的边界建模,可以作为学习空间结构化视觉表示的一种通用且可扩展的预训练原则。

贡献。

  • 我们倡导一种以边界为中心的自监督预训练观点,其中边界是原生的学习信号而非下游输出,并证明它们可以从原始图像中引导生成,无需人工标签、外部边缘检测器或预训练骨干网络。
  • 我们提出了掩码边界建模,这是一种自蒸馏框架,它将教师发现的边界标记强制纳入学生的掩码集合,并按几何结构路由掩码标记,将语义抽象与几何敏感性之间的冲突转化为协作。
  • 我们引入了边界场的类别重参数化,它稳定了密集自蒸馏,并以零额外成本提供了无参数的边界验证。
  • 我们将该框架扩展至 LingBot-Vision,这是一个 1B 参数的视觉 Transformer,在密集空间感知任务上匹敌或超越了高达 7 倍规模的基础模型;我们将其蒸馏为强大的 ViT-L/B/S 系列,并交付了 LingBot-Depth 2.0,在 14 个深度补全基准测试中取得了领先结果。

第 4 页

2 相关工作

在本节中,我们简要回顾视觉数据表示学习的发展,重点关注自监督预训练,然后讨论文献中的边界建模及其与自监督视觉预训练的联系。

2.1 自监督视觉表示学习

从视觉数据中学习有意义且通用的表示一直是计算机视觉和机器学习的一个核心主题。自监督学习(SSL)是最有前景的方向之一,旨在从数据本身学习表示,无需标签。过去十年见证了其通过对比学习 [10, 20]、掩码图像建模 [19, 60, 64]、自蒸馏 [8, 9, 17, 28, 39, 45] 以及最近提出的联合嵌入预测架构(JEPA)[1, 5, 27] 取得的巨大成功。多年来,视觉 SSL 的进展正从全局表示转向密集表示,朝着更大规模的训练迈进,并寻求更原则性的方法来避免大规模下的崩溃。

基于自蒸馏的预训练。自蒸馏谱系目前占据主导地位。DINO [9] 训练学生模型以匹配指数移动平均(EMA)教师模型的概率分布,值得注意的是,它是首批在没有监督的情况下展示注意力图中出现物体布局和边界的模型之一。iBOT [64] 将相同的对齐目标下移至掩码 token,DINOv2 [28] 在精心策划的数据上将其扩展为蒸馏模型家族,Web-SSL [17] 表明无语言预训练可以在数十亿网络图像上持续扩展,而 Franca [45] 则重新设计了聚类目标本身。该谱系的弱点同样一致:由于目标奖励的是对齐而非空间结构,大规模下的密集特征质量很脆弱,DINOv3 [39] 不得不引入 Gram 锚定(Gram anchoring)以防止密集特征图在长期训练计划中退化。边界和布局在这些模型中作为副产品出现,保持其完整性需要越来越多的修正机制。

掩码图像建模。另外两个家族占据了空间-语义权衡的两极。掩码图像建模 [4, 19, 60] 针对像素级目标重建缺失内容,这使其在构造上具有空间忠实性,但作为冻结的语义表示相对较弱。语言监督,从 CLIP [32] 到 SigLIP 2 [43],则是镜像:文本描述整个图像,因此学习到的特征在识别方面表现出色,但在密集预测方面表现不佳,即使更细粒度的 patch-text 对齐 [8] 也只能弥补部分差距。这两种极端都无法同时提供语义和空间精确的表示。

预测架构与世界模型。JEPA 方法 [1, 2, 5] 在潜在空间中进行预测,以避免对像素级干扰进行建模,LeJEPA [3] 最近通过理论上有据可依的目标为该谱系奠定了基础。它们的雄心提高了对空间质量的要求:冻结编码器正成为世界模型和机器人策略的感知基础 [26, 63],其中的几何错误不再是一个丢失的基准点,而是一个错误的动作。

在所有这些家族中,都重复着相同的模式:密集的空间质量是通过间接方式获得的,然后通过事后特征上采样器 [12]、纠正性正则化(如 Gram 锚定)或多个教师的聚合蒸馏 [6, 34] 进行保护。LingBot-Vision 将这一领域趋势推向极致,使密集空间结构成为预训练本身的目标。

2.2 图像边界结构建模

边界结构,即边缘和轮廓,是图像内容最古老的形式化表达之一,捕捉了图像的空间强度变化,自计算机视觉诞生之初就已被研究和应用,人们通过 Sobel [40] 和 Canny [7] 算子及其统计和结构化后继者 [15, 47] 对其非常熟悉。现代的边界建模实践依赖于使用深度神经网络进行学习,涵盖从监督学习到无监督和自监督学习 [21, 23, 29, 55, 57–59, 65]。在这一系列工作中,我们的预训练直接继承了两个思想。第一个是统计方面的:a-contrario 理论 [14] 声明,只有当某种结构在无结构的零模型下出现的可能性很低时,该结构才被认为是有意义的,这赋予了 LSD [47] 无参数控制误检的能力。第二个是表示方面的:吸引力场线 [57–59] 不是将像素分类为边界或非边界 [55],而是将每个线段冗余地编码到一个密集场中,其中每个邻近像素存储足够的几何信息以重建整个线段,从而将稀疏检测转化为密集预测 [21, 65];后续工作将此表示扩展到了大规模自监督训练 [23, 29]。纵观这些文献,边界是产物,而场是

第 5 页

(a) 输入图像 (b) 随机掩码 (c) 边界强制掩码(本文方法) (d) 边界场(目标)

图 2. 以边界为中心的掩码建模在玩具场景上的演示。(a) 输入图像及其补丁网格。(b) 随机掩码与内容无关:大多数被隐藏的补丁是平坦的,可以从上下文中恢复,而携带边界信息的补丁很大程度上避开了掩码。(c) 边界强制掩码将每个携带边界信息的补丁添加到随机掩码中,因此场景的结构正是学生模型必须重建的内容。(d) 用于监督边界 token 的边界场,编码为离散化距离和方向 bin 上的逐像素分类分布。在预训练期间,边界场由教师模型在线预测,无需人工标签或外部检测器;每个被掩码的 token 都遵循语义自蒸馏目标,而边界 token additionally 匹配分类边界目标。

均值。我们的工作反转了这一关系:作为分类变量的吸引场成为自监督预训练的媒介;其均匀分布同时作为反常验证(a-contrario)零假设;而检测质量的边界作为表示学习的副产品自然产生,而非其目标。

3 以边界为中心的掩码表示建模

在过去十年中,掩码建模一直是自然语言处理和计算机视觉中的核心预训练范式。在语言领域,文本是离散 token 的序列,因此掩码一个 token 并从上下文中预测它是一个定义良好的问题,其基于有限词汇表,这是 BERT 等掩码语言模型(以及自回归形式的现代大语言模型)背后的公式。图像没有这种自然的 tokenization:它们是连续的、高度冗余的像素数组,没有与单词相当的离散单元。因此,视觉中的掩码建模首先施加一种 tokenization,通过补丁嵌入将 $H \times W$ 的图像划分为一组不重叠的补丁 token,并从其余部分预测被掩码的 token。最近的掩码建模框架,包括 MAE [19]、I-JEPA 和 V-JEPA [1, 5],以及 DINOv2 [28] 和 DINOv3 [39] 中的 iBOT 目标,都面临着同一个问题:掩码和预测哪些 token,并得出了相同的答案:随机掩码。

然而,随机掩码与内容无关:它隐藏 token 时不考虑其描绘的内容,尽管 token 携带的结构信息差异很大。在本节中,我们提出以边界为中心的掩码建模,让图像结构,特别是其边界,决定掩码哪些 token 以及在那里重建什么。我们建立在 DINO [9] 的自蒸馏范式之上(回顾见第 3.1 节),并增加了一个由教师模型为自己生成的第二几何监督通道。图 2 说明了其核心的掩码和路由机制;随后的子章节将详细阐述每个组件。

3.1 自蒸馏视觉预训练

现代视觉 Transformer (ViT) 的自监督预训练遵循教师-学生自蒸馏范式 [9, 28, 39]。令 $f_\theta$ 为学生网络,$f_{\bar{\theta}}$ 为具有相同架构的教师网络,其权重是学生的指数移动平均 (EMA), $$ \bar{\theta} \leftarrow \lambda \bar{\theta} + (1 – \lambda) \theta, \quad (1) $$ 其中动量 $\lambda$ 在训练过程中逐渐趋近于 1。给定图像 $x$,采样一组增强视图,通常包括两个全局裁剪和几个较低分辨率的局部裁剪 [9]。ViT 将每个视图编码为一个类 token $z_{cls}$ 和一个补丁 token 序列 $\{z_{pi}\}_{i=1}^N$。

5

第 6 页

图像级蒸馏(DINO)。投影头 $h$ 将类别 token 映射到 $C$ 个原型上的分布。教师分布经过中心化和锐化处理,学生模型在不同视图间进行匹配训练:

$$ \bar{p}_t = \text{softmax}\left(\frac{h_\theta(z_{\text{cls}}) – c}{\tau_t}\right), \quad p_s = \text{softmax}\left(\frac{h_\theta(z_{\text{cls}})}{\tau_s}\right), \quad (2) $$

$$ L_{\text{DINO}} = -p_t^{x^{(1)}}{}^\top \log p_s^{x^{(2)}}, \quad (3) $$

上述损失在不匹配的视图对之间求和,并对教师端使用停止梯度(stop-gradient)。温度参数满足 $\tau_t < \tau_s$(教师锐化),而中心 $c$(教师输出的指数移动平均 EMA,或等价于 Sinkhorn–Knopp 归一化 [28])可防止退化为常数分布的平凡解。

补丁级蒸馏(iBOT)。为了学习密集表示,学生模型的补丁 token 子集 $M \subset \{1, \dots, N\}$ 被掩码替换为共享的掩码 token [64]。通过补丁投影头 $g$,学生在每个掩码位置预测一个分布,该分布由对应未掩码 token 的教师分布蒸馏而来:

$$ q_t = \text{softmax}\left(\frac{g(z_{p_i}) – c_{\text{iBOT}}}{\tau}\right), \quad L_{\text{iBOT}} = -\frac{1}{|M|} \sum_{i \in M} q_t^i{}^\top \log q_s^i, \quad (4) $$

掩码是随机选择的。这一范式的定义性且鲜少被质疑的特性是:掩码集合 $M$ 是随机采样的,与图像内容无关。具体而言,$M$ 从块状随机掩码分布中抽取,目标比例为 $r$,即 $M \sim p_{\text{mask}}(\cdot; r)$,因此无论其描绘什么内容,每个补丁被隐藏的可能性都是相等的。这种内容无关的选择将所有 token 视为可互换的重建目标。然而,恢复 token 的难度和信息量在图像各处差异巨大:平坦均匀区域中的 token 很大程度上可由其邻居预测,而跨越边界的 token 则携带不可约简的结构信息。

3.2 边界强制掩码建模

第 3.1 节中,掩码自蒸馏仍有一个自由度未被利用:即隐藏哪些 token。随机掩码对所有 token 一视同仁,但边界携带着内部区域所不具备的结构信息。我们通过让自蒸馏发现边界位置并据此进行掩码来填补这一空白。经典的边缘和线段检测器通常在像素级别读取边界,通常使用卷积解码器。由于 Vision Transformer 在 token 级别运行,我们改为将边界属性附加到每个 token 上:如果教师预测的线或曲线穿过其 $P \times P$ 补丁(此处 $P=16$),则该 token 为边界 token。这些线是如何预测和验证的将在第 3.4 节中讨论。

边界强制掩码与几何路由。具体而言,教师在线生成的预测边界(无标签,见第 3.4 节)被光栅化为像素图。当边界落入其补丁内时,该 token 即为边界 token,从而得到集合:

$$ B = \{ i \in \{1, \dots, N\} : \text{预测边界与 patch}(i) \text{相交} \}, \quad (5) $$

我们通过对边界图在 token 网格上进行最大池化获得该集合。随后,我们将 $B$ 强制加入学生的掩码集合中,叠加在第 3.1 节的随机掩码 $M$ 之上:

$$ M^+ = M \cup B. \quad (6) $$

每个掩码 token 都接受标准自蒸馏中的语义 iBOT 目标 $L_{\text{iBOT}}$ 的监督;边界 token 额外接收类别边界目标 $L_{\text{bnd}}$(第 3.3 节),而类别 token 遵循 $L_{\text{DINO}}$(图 2)。因此,边界 token 具有双重目标:通常的语义重建以及显式的几何重建。边界是图像中冗余度最低的区域:与主要由其邻居决定的内部 token 不同,边界 token 无法通过复制上下文来恢复。将边界 token 强制纳入掩码,意味着隐藏了学生无法免费推断的信息,并迫使其从周围上下文中重建边界几何结构。

第 7 页

图 3. 边界从角点中涌现(发现 1)。对于两张图像,我们在每张图像上绘制五个随机边界场,固定角点,并从每次绘制中解码线段(列)。在底部两行中,每个场通道均被均匀随机采样:解码出的线段仍然锚定在角点上,但保持短小且碎片化。在顶部两行中,仅方向通道受图像等值线方向的无参数估计 [47] 引导,该估计被渲染为边界场,且每次绘制均产生连贯且近乎相同的线段。在这两种情况下,场中均不包含任何学习到的信息。采样和解码细节见附录 A。

几何目标为何带来增益。几何目标是对语义目标的补充而非替代。语义码字不编码显式几何,且在两个或多个区域交汇处最弱,因此标准重建对我们要强制掩码的边界标记监督不足;类别几何目标填补了其缺失的结构。经验上,两者是互补而非竞争的:在边界标记上同时保留语义目标和几何目标,比仅使用几何目标能更好地提升分类和密集几何性能(第 3.6 节)。尽管如此,几何目标仍是关键成分。我们早期的实验中,边界来自现成检测器,且仅使用语义目标重建强制标记,结果仅与随机掩码基线持平(第 3.6 节);并且这种设置必须依赖外部检测器,因为如果不学习边界几何,教师模型自身就没有边界信号。因此,学习这种几何结构正是使边界对学生模型有用的原因:掩码决定模型在哪里面对结构,而类别目标决定模型在那里恢复什么,这是同一机制的两个方面,使得边界感知表示和语义表示能够共同涌现。

自举问题。边界强制预设我们已经知道边界在哪里,但从零开始训练的神经网络并不知道:我们最希望掩码的那些标记正是它目前无法定位的。解决这个鸡生蛋、蛋生鸡的问题需要克服两个障碍。首先,边界必须在第一步就可用,

第 8 页

d θ

d ϕ2 p ϕ1 ϕ1 ϕ2

(a). 边界作为线段 (b). 场通道 (c). 支持区域 (d). 投票聚合解码

图 4. 边界场一览。(a) 图像边界被建模为直线段;曲线边界由短段链组成。(b) 边界场将稀疏线段提升为密集图:线段附近的每个像素存储其到线段的距离 $d$ 以及三个角度 $(\theta, \phi_1, \phi_2)$,这些角度从该像素定位线段;平行线段在 $\theta$ 上共享相同的方向颜色。(c) 编码是故意冗余的:线段支持区域内的任何单个像素 $p$ 都携带足够的信息来重建整个线段。(d) 相反,线段是通过让所有支持像素投票并聚合投票来解码的(橙色笔触:单个噪声投票;深色线条:聚合后的线段),即使单个值存在噪声,这也保持可靠。

在任何边界几何被学习之前。轻量级的角点检测器使得这一点成为可能,这得益于我们构建的密集边界场表示的一个特性(第 3.3 节):

发现 1(边界从角点涌现)。给定一组稀疏的角点,其值均匀随机采样的边界场已经能解码为以角点为锚点的线片段,并且一旦其方向通道由图像梯度的无参数等值线方向引导,相干的线段就会涌现;如果没有角点,解码均会失败。

因此,角点从一开始就锚定了可用的边界(图 3),并且随着训练的进行,场会变得更加锐利(第 3.4 节);我们在附录 A 中详细说明了采样和解码过程。其次,边界目标必须是可以学习的且不会崩溃,这促使我们在第 3.3 节中对类别重参数化进行了探讨。

3.3 边界/线场的重参数化

发现 1 表明,[59] 中提出的整体吸引场(以下简称边界场),一旦给定角点,甚至能将未学习的、 largely 随机的场值转化为线段。因此,如果我们让神经网络预测场值而不是随机采样它们,解码后的线段将成为基于图像的边界预测,并随着场的改善而提高。本节使场具体化,解释了为什么学习它的朴素方法会失败,并推导出使其可学习的类别重参数化。

边界场简述。我们将图像边界建模为直线段集合 $L = \{\ell_j\}_{j=1}^M$,每个线段由其两个端点给出 $\ell_j = (x_1, y_1, x_2, y_2)$;曲线边界表示为短段链。边界场将稀疏集合 $L$ 提升为密集图(图 4):线段附近的每个像素 $p$ 存储一个小属性向量

$$ a(p) = [d_p, \theta_p, \phi_{1p}, \phi_{2p}]^T, \quad (7) $$

记录其到最近线段的距离 $d_p$、朝向它的方向 $\theta_p$,以及从 $p$ 看线段端点的两个角度 $\phi_{1p}, \phi_{2p}$。该参数化是故意冗余的:线段支持区域 $S_\ell = \{p : d_p \le \tau_d\}$ 中的任何单个像素都携带足够的信息来重建整个线段,反之亦然,$L$ 是通过让所有支持像素投票并聚合投票从场中解码出来的。这种“多像素一线段”的冗余使得发现 1 中未学习场的解码成为可能,并在后来使解码对噪声预测保持鲁棒(第 3.4 节)。

为什么是线段而不是边缘图?边缘图逐像素标记光度不连续性,这似乎是一个更通用的选择。问题在于边缘像素几乎无法验证:每个像素都是孤立的滤波器响应,由任意阈值接受或拒绝,没有统计量可供测试,并且纹理像真实结构一样容易引发此类响应。相比之下,线段是一个由许多支持像素支持的单一假设,因此可以针对方向均匀分布的无结构零假设进行测试,并且仅当

第 9 页

其支持无法用偶然性来解释(附录 B)。这种差异在自蒸馏中至关重要,因为教师的预测本身成为学生的目标:未经验证的边缘会将幻觉结构反馈回训练过程,而经过验证的片段则能保持引导目标的纯净(第 3.4 节)。此外,片段具有端点和方向,这正是角点能够锚定它们的原因(发现 1)。

为何采用类别重参数化?该场是一个连续的、向量值的映射,而蒸馏它的直观方法(在 $\ell_1$ 或 $\ell_2$ 损失下回归 $a(p)$)失败了。在带有指数移动平均(EMA)教师的教师-学生循环中,连续回归的目标会发生漂移并崩溃;而且,与语义分支不同,它们无法利用稳定自蒸馏的中心化和锐化操作(第 3.1 节)。我们通过将边界预测转化为分类任务来消除这种不对称性。

从回归到逐像素分类。我们将每个场通道的范围离散化为 $K$ 个箱,并将标量值表示为这些箱上的分布。对于边界位置 $p$ 和通道 $c \in \{d, \theta, \phi_1, \phi_2\}$,(经过验证的)教师值 $a_c(p)$ 被编码为软类别标签

$$ \bar{y}_{ck}(p) \propto \exp \left( -\frac{\delta_{ck}^2}{\tau_\ell} \right), \quad k = 1, \dots, K, \quad (8) $$

其中 $\delta_{ck}$ 是第 $k$ 个箱中心到值 $a_c(p)$ 的距离,$\tau_\ell$ 是标签温度。对于范围在 $2\pi$ 处环绕的方向通道 $\theta$,箱是圆形的,$\delta_\theta$ 是弧长距离。标签故意设计得较窄(仅几个箱宽):过度平滑会将所有目标推向均匀分布,从而抹除信号。学生的边界头针对每个通道预测分布 $\hat{y}_c(p)$,边界目标函数是强制掩码(第 3.2 节)所选边界位置 $B$ 上的交叉熵,

$$ L_{\text{bnd}} = -\frac{1}{|B|} \sum_{p \in B} \sum_{c} \bar{y}_c(p)^\top \log \hat{y}_c(p). \quad (9) $$

继承自蒸馏的稳定性。由于边界现在是类别性的,防止语义自蒸馏崩溃的机制可以原样应用:教师分布在监督学生之前会被中心化(或 Sinkhorn-Knopp 归一化)并锐化,正如第 3.1 节所述。这正是连续形式无法做到的,也是为什么边界学习继承了现代自监督学习(SSL)的稳定性和可扩展性,而不需要专门的正则化器。

原生的零假设及免费验证。类别形式还将学习目标与经典的 a-contrario 检测理论 [14, 47] 联系起来,该理论通过询问在包含无结构的零模型(其中边界方向均匀分布)下,其支持出现的可能性有多低,来验证候选片段。该零假设现在字面上就是箱上的均匀分布。“无边界”因此是一个特定的、可表示的预测,任何偏离均匀性的情况正是 False-Alarm 数量(NFA)测试所测量的证据(附录 B)。由此产生两个无需额外成本的后果:非边界区域不需要特殊的背景类,因为其目标仅仅是均匀分布;并且用于监督学生的同一分布可以被评分以进行统计显著性检验,因此边界验证是表示本身固有的,而不是一个单独的后续步骤。

3.4 边界目标的在线生成

由于 ViT 是从头初始化的,它没有信息来产生有效的边界目标,然而自蒸馏需要从第一步就开始有目标,且我们没有边界注释可供回退。我们的目标由教师本身在线生成,并随着训练的推进进行细化。使这一切成为可能的是边界场的冗余性(第 3.3 节):因为每个片段在其支持区域内的许多像素作用下是超定的,即使场远不准确,也可以从场中读出连贯的片段。

边界在学会之前就已显现。发现 1 已经展示了极端情况:固定角点后,即使携带无学习信息的场值也能解码为合理的片段(图 5)。原因在于上述投票冗余:每个支持像素都对同一个潜在片段进行投票,聚合许多弱投票对噪声具有鲁棒性,因此在场达到像素级精度之前,解码出的几何结构就已经具有意义。这是边界感知从原始图像启动引导的种子:教师不需要是一个好的边界预测器来提供可用的信号;它只需要比学生更好,而 EMA 更新保证了这一点。

9

第 10 页

(a) 输入图像 (b) 噪声场 + 角点种子 (c) 解码候选 (d) 验证后的目标场

图 5. 边界目标的在线生成(玩具示例)。即使教师的边界场存在噪声(如训练早期所示 (b)),整体参数化使得片段支撑区域内许多微弱的逐像素投票能够聚合为以角点为锚点的连贯候选片段 (c),同时也包括面体对角线和背景弦等虚假候选。随后,a-contrario 测试会剔除缺乏支持的候选,幸存者被重新渲染为监督学生的干净目标场 (d)。因此,边界目标直接从原始图像中涌现,仅固定了一个冻结的单块角点检测器(第 3.4 节)。

用于密集场的令牌级头。边界场处于子令牌分辨率,而主干网络每 P × P 令牌输出一个特征;一个轻量级的边界头在不使用任何卷积的情况下弥合了这一差距。每个补丁令牌由一个小 MLP 独立处理,其输出被扩展并重新排列成步长 s = P/r(我们使用 s=2)的 r × r 位置图块,因此一个令牌实际上展开为其覆盖的密集位置。每个位置的特征随后在单位球面上进行 ℓ2 归一化,并按场通道与 K 个学习的二分类原型进行评分:二分类器是无偏置的线性层,具有单位归一化权重,因此每个逻辑值都是余弦相似度,并且在构造上是有界的。这种原型设计模仿了 DINO 投影头,并补充了第 3.3 节中的中心化操作,以防止坍塌。教师和学生共享此头设计,教师的权重为 EMA 副本。最后,通过对每个通道的二分类中心取期望(对于方向通道为圆形均值),从分类预测中读出连续场值,因此离散二分类仍能产生亚二分类精度。

从视图到验证后的目标。在每次迭代中,教师 f¯θ 通过四个步骤将全局视图转换为密集目标场(图 5):(i) 它预测视图上的密集边界场;(ii) 它将场与由冻结的单块 Vision Transformer 定位的稀疏角点集配对;(iii) 结合角点和场,它通过投票聚合(第 3.3 节)解码一组候选线段 L;(iv) 它剔除未能通过 a-contrario 测试(附录 B)的线段,并将幸存者重新渲染为干净、验证后的目标场 a(·)。只有这个重新渲染的场,而不是原始预测,用于监督学生,因此缺乏支持的结构永远不会成为教学信号。由于该场每一步都从 EMA 教师重新生成,目标与模型共同演化:随着学生变得锐利,教师及其发出的边界目标也随之变得锐利。附录 B 中的图 11 对训练模型中此管道的两个保障措施进行了消融实验:可靠的角点锚点即使在没有验证的情况下也能保持解码的清洁,而 a-contrario 测试即使从微弱的场派生锚点中也能恢复几乎相同的线段;仅当两者都不存在时,解码才会退化。

循环中无边界标注。在整个过程中,表示主干从随机初始化开始训练,循环中不包含人工边界标注、边缘检测器、深度传感器或图像分类预训练;边界场、我们方法的学习目标,完全从原始图像中涌现。唯一的固定组件是步骤 (ii) 中用于生成角点种子的单块 Vision Transformer:它仅定位稀疏的角点集,其规模比主干小几个数量级,且从未观察过它帮助解码的边界场。因此,我们将所有表示能力保留用于从头学习边界结构,而不是从预训练模型中导入。

3.5 训练目标

完整目标汇编了第 3.1–3.3 节的内容。对于每张图像,我们采样全局和局部视图;学生在边界强制掩码 M+(第 3.2 节)下处理全局视图,并训练以最小化

L = LDINO + λi LiBOT + λb Lbnd + λk LKoLeo, (10)

其中 LDINO 跨视图对蒸馏类令牌,LiBOT 在 M+ 中的所有掩码令牌上计算,Lbnd 在 B ⊂M+ 的边界位置上计算,因此边界令牌同时接收两种损失,实现了双重

第 11 页

表 1. ImageNet-1K (ViT-L/16) 上的概念验证。所有变体均共享 DINO+iBOT 基线的训练配置。

| | IN-1K k-NN ↑ | NYUv2 depth (linear) | | | :— | :—: | :—: | :—: | | | top-1 ↑ | $\delta_1$ ↑ | RMSE ↓ | | DINO+iBOT baseline [9, 64] | 81.6% | 81.4% | 0.474 | | + 类别边界目标(仅几何) | 81.8% | 84.4% | 0.446 | | + 双重监督(边界 token 上的 iBOT 损失) | 82.0% | 84.7% | 0.443 | | + RoPE backbone(最终配方) | 82.4% | 84.9% | 0.440 | | 仅使用边界强制,语义目标 | 81.4% | 81.2% | 0.481 |

监督部分见第 3.2 节。最后一项是 KoLeo 正则化器 [28],它使批次内的 class-token 特征分布更散。损失权重和调度策略详见第 4.3 节。

所有教师网络的量,包括语义分布和经过验证的边界目标,均在 stop-gradient(停止梯度)下生成,因此梯度仅通过学生网络流动;在每次优化器步骤之后,教师网络作为学生网络的指数移动平均(EMA)进行更新,动量逐渐 annealed(退火)至 1(第 3.1 节),并且每个分支的目标随模型平滑地共同演化。边界目标针对全局视图生成,其分辨率足以进行可靠的解码和验证;局部视图仅通过图像级蒸馏进行监督。结合应用于语义分布和边界分布的中心化和锐化处理,这些足以保持训练稳定:边界分支未附加任何专用的正则化器。

3.6 ImageNet-1K 上的概念验证

在扩展规模之前(第 4 节),我们在小规模下验证每项设计选择:在 ImageNet-1K [13] 上预训练的 ViT-L/16,并与在相同配置下训练的 DINO+iBOT 基线进行比较。我们探测该方法旨在平衡的两个方面:用于全局语义的 ImageNet-1K k-NN 分类,以及用于密集几何结构的 NYU-Depth v2 [38] 线性探测深度估计(表 1)。

主要比较。完整的配方同时提升了两个方面:与匹配的 DINO+iBOT 基线相比,ImageNet-1K k-NN top-1 从 81.6% 提升至 82.4%,而 NYUv2 $\delta_1$ 从 81.4% 提升至 84.9%,RMSE 从 0.474 降至 0.440。因此,边界监督并未以牺牲全局语义为代价换取密集几何结构:正如第 3.2 节所承诺的那样,两者共同涌现,且语义表示本身也因面对结构而受益。

设计消融。表 1 的阶梯式结果归因于各项增益。类别边界目标是关键成分:仅添加它就能带来几乎全部的密集几何改进($\delta_1$ 提升 3.0 点,RMSE 从 0.474 降至 0.446),且未对分类造成任何损失。双重监督随后使 k-NN 提升 0.2 点,$\delta_1$ 提升 0.3 点(RMSE 从 0.446 降至 0.443),证实了语义和几何目标是互补而非竞争的(第 3.2 节)。RoPE backbone 进一步使 k-NN 提升 0.4 点,$\delta_1$ 提升 0.2 点;这是对 backbone 的现代化改进,与我们的方法正交,但我们仍将其带入扩展后的配方中(第 4 节)。相反,在重建时使用语义目标对掩码中的边界 token 进行强制,其表现与基线持平,甚至略低于基线($\delta_1$ 81.2%,RMSE 0.481),重现了我们在最终流水线早期阶段的观察:掩码决定了“在哪里”,但增益来自于“在那里重建了什么”。

对扩展规模的迁移。本研究冻结了第 4 节将保持不变地扩展的方法配置:具有双重监督的边界强制掩码、类别边界目标以及 RoPE backbone。从此处开始发生变化的所有内容,即语料库、模型容量和训练系统,均属于方法外部的因素。

4 LingBot-Vision:推动视觉预训练的边界

基于表 1 中的积极结果,我们将以边界为中心的掩码表示学习推向大型视觉基础模型的可扩展训练。方法本身与第 3 节完全相同;扩展改变的是其周围的一切。遵循 DINOv2 和 DINOv3 [28, 39] 的数据整理流水线,我们组装了一个语料库,

11

第 12 页

大约 161M 张图像,从 20 亿张原始图像中筛选而出,结合了精心策划的公共数据集与基于检索策划的网络数据池(第 4.1 节)。在此语料库上,我们训练了 LingBot-Vision,其骨干网络为 ViT-g/16,参数量约为 11 亿(第 4.3 节),并辅以分布式系统,使边界分支仅占用极小一部分步骤时间(第 4.2 节),以及一种优化配方,确保大规模训练的稳定(第 4.3 节)。此外,我们发现 LingBot-Vision 在数据量和优化预算方面均具有训练效率:它消耗的语料库比 DINOv3 小一个数量级,且训练样本不到后者的三分之一(第 4.1 和 4.3 节)。

4.1 训练数据策划

我们的数据策划流程遵循 DINOv2 [28],并在我们自己的数据源上实现。未策划部分是一个包含约 20 亿张网络图像的内部数据池;策划部分则使用开源数据集作为种子,从该数据池中基于查询进行检索,图像嵌入由预训练的 DINOv2 ViT-B 编码器 [28] 计算得出。种子数据包括 ImageNet-1k 和 ImageNet-21k [13, 35]、Google Landmarks v2 (GLDv2) [53] 以及 Mapillary-SLS [51],以及另外二十个涵盖细粒度识别、实例检索和密集场景理解(例如 ADE20K [62]、NYU-Depth v2 [38]、SUN-RGBD [41]、Cityscapes [11]、VOC [16])的数据集,旨在覆盖广泛的下游任务。

从 20 亿张原始图像到 1.61 亿语料库。每个种子以两种方式之一做出贡献,与 DINOv2 类似:要么直接包含,要么查询未策划数据池以获取视觉相似的图像(对于大种子使用 k-NN 检索,对于小种子使用基于聚类的检索)。检索和去重后,检索部分被物化为三个总计约 1.43 亿张图像的数据池;直接包含部分包括 ImageNet-21k (1315 万)、ImageNet-1k (128 万)、GLDv2 的清洗分割 (158 万) 和 Mapillary-SLS (146 万)。合并后,语料库包含 1.6075 亿张图像,其中约六分之五为基于检索策划的图像。在训练期间,整个策划语料库通过单一的全局均匀洗牌进行采样,因此每张图像被抽取的概率相等。

与 LVD-142M 和 LVD-1689M 的比较。我们的语料库规模与 DINOv2 的 LVD-142M(从 12 亿数据池中策划的 1.42 亿张图像)[28] 相当,比 DINOv3 的 LVD-1689M(从约 170 亿数据池中策划的 16.89 亿张图像)[39] 小一个数量级。虽然我们尽力策划数据,但我们的流程也故意比 theirs 更简单:仅使用一个检索编码器处理 20 亿数据池,没有 LVD-142M 的概念重平衡聚类,也没有 LVD-1689M 的分层策划。LingBot-Vision 在密集任务上(第 5 节)仍然匹配或超越在这些语料库上训练的模型,这表明收益来自预训练目标而非数据优势,并证实了上述关于训练效率的主张。

4.2 分布式训练与效率

在系统方面,我们遵循标准做法,使用 FSDP 在 bf16 混合精度下对模型进行分片,并采用内存高效注意力机制;我们将语料库存储为未压缩的 Arrow 分片,通过内存映射实现加载时的零拷贝随机访问;这些都不是我们方法特有的。特有的部分是边界分支,它在标准自蒸馏之上增加了密集的 K 箱预测和在线目标生成流程。我们描述如何保持这两者的低成本。

稀疏且融合的边界计算。边界头从不密集运行。只有边界 token $B$(每个批次中所有 token 的一小部分)被展开为子 token 分辨率,并与 bin 原型进行评分,因此头的成本随边界 token 的数量而非图像大小缩放。朴素地物化软标签和每个位置四个通道及 K 个箱上的交叉熵会主导内存流量;相反,我们将标签构建(包括圆弧距离通道)和分类交叉熵融合为单个自定义内核,并编译其余的头操作,从而完全消除了多千兆字节的中间张量。

在线目标生成作为批处理 GPU 工作。第 3.4 节中的教师端流程,即场解码、角线配对、a-contrario 验证以及验证片段的重新渲染,作为批处理 CUDA 内核端到端实现,没有每图像循环和主机同步。两个阶段需要特别小心。首先,角线配对计算每个角点与边界场提出的每个线段的两个端点之间的距离;在 GPU 上物化这个成对距离张量在内存上极其昂贵,因此我们将距离计算与 argmin 归约融合,使内存占用与提出的线段数量呈线性关系。

12

第 13 页

而非二次方。其次,LSD [47] 的 a-contrario 验证是一种纯顺序的 CPU 设计;我们将其重构为基于支持像素的逐候选项归约操作,从而实现对一批次中所有候选线段的并行验证。

早期实现曾在 CPU 上执行线段去重,导致每个训练步骤都发生停滞;消除所有主机往返通信对于使目标生成阶段与步骤其余部分清晰重叠至关重要。在最终方案中,生成验证后的边界目标仅占总步骤时间的一小部分,且在相同配置下,端到端训练吞吐量与仅语义的基线模型保持接近。

4.3 实现细节

训练分为三个阶段进行,遵循 DINOv3 [39] 的阶段划分:长期的自蒸馏预训练、在训练后期恢复密集特征质量的 Gram 锚定阶段,以及短期的多分辨率适应阶段。我们的计算预算刻意保持适度。DINOv3 在低分辨率预训练上花费 100 万次迭代,在 Gram 锚定上花费 10 万次迭代,并在全局批量大小为 4,096 的情况下在多级分辨率适应上花费 3 万次迭代;而 LingBot-Vision 在这三个阶段分别花费 30 万次、10 万次和 10 万次迭代,全局批量大小为 3,072;总体而言,其处理的样本量不到 DINOv3 的三分之一。为了进一步节省计算资源,我们的高分辨率适应阶段仅使用 512 像素的单分辨率,而非多级分辨率调度。

骨干网络与头部。LingBot-Vision 使用参数量约为 11 亿的 ViT-g/16 骨干网络,包含 SwiGLU 前馈层、以 fp32 计算的旋转位置嵌入以及四个 register token;概念验证研究(第 3.6 节)使用的是 ViT-L/16。边界头部遵循第 3.4 节:一个三层逐 token 的 MLP,输出步长 s=2 时头部维度为 512,可学习的瓦片位置嵌入,以及每个场通道 K=32 个 bin。DINO 和 iBOT 投影头遵循 DINOv2 [28] 的设计,并保留独立的 iBOT 头。冻结的角点检测器是一个单块 ViT,其规模比骨干网络小几个数量级。

预训练。我们以 3072 的全局批量大小使用 AdamW 进行 30 万次迭代的预训练,基础学习率遵循平方根规则 $\sqrt{bs/1024}$ 进行缩放,并在线性预热后采用余弦调度衰减。权重衰减以余弦调度从 0.04 增加到 0.2,教师温度在前 3 万次迭代中从 0.04 增加到 0.07,EMA 教师动量在整个训练过程中从 0.994 退火至 1.0。公式 10 中的目标权重相等($\lambda_i = \lambda_b = 1$),KoLeo 权重 $\lambda_k = 0.1$,边界分支使用第 3.3 节中提到的窄软标签温度。两项稳定性实践完善了该分支:非边界位置的教师目标填充为均匀随机标签,而非恒定背景值,这消除了平凡的“全背景”解;同时教师端的中心化处理始终保持开启。与概念验证配置相比,扩展规模仅需轻微调整:更高的初始 EMA 动量、更低的权重衰减上限、更少的 bin 数量(K 从 128 减少到 32,经证实对质量无影响),以及遵循 DINOv3 的做法,在所有头部中使用普通而非权重归一化的原型层。在预训练期间,全局和局部裁剪的大小分别为 256 和 112 像素。

Gram 锚定与高分辨率适应。在长期调度中,即使全局指标持续改善,补丁级特征质量也会下降;DINOv3 通过将学生补丁特征的 Gram 矩阵锚定到早期教师快照的 Gram 矩阵来抵消这一现象 [39]。我们为 LingBot-Vision 采用了这一 Gram 锚定阶段,在预训练后运行 10 万次迭代。随后,训练进入一个 100 万次迭代的高分辨率适应阶段,分辨率为 512 像素,采用降低的学习率和更高的 EMA 动量,使骨干网络(及其旋转嵌入)适应高分辨率输入,同时保持边界分支激活。

模型蒸馏以提升效率。在旗舰 ViT-g 训练完成后,我们将其蒸馏到更小的骨干网络中,得到 3 亿参数的 ViT-L、8600 万参数的 ViT-B 和 2100 万参数的 ViT-S。遵循 DINOv2 和 DINOv3 [28, 39] 的蒸馏实践,冻结的 ViT-g 替换了同一训练流水线中的 EMA 教师,使得较小的学生模型继承了旗舰模型的语义和边界感知表示。蒸馏使用的迭代预算与预训练阶段相同,即每个学生 30 万次迭代;我们跳过了 Gram 锚定阶段,因为该阶段旨在抵消由教师漂移引起的问题,而在冻结教师的情况下不会出现此问题;并在 512 像素分辨率下应用 10 万次迭代的高分辨率适应,全局批量大小为 3,072。 resulting 调度比 DINOv3 的蒸馏调度(全局批量大小为 4,096 时,100 万 + 25 万次迭代)要短得多。

第 14 页

图像 DINOv2 DINOv3 SigLIP 2 V-JEPA 2.1 LingBot-Vision

图 6. 冻结补丁特征的 PCA。每个模型的补丁特征的前三个 PCA 分量被映射到 RGB,针对每张图像分别计算(每列对应一个模型)。LingBot-Vision(最右侧)将物体解析为具有清晰边界的连贯区域:交通场景中的单个车辆和车道结构、铁丝网前的母鸡剪影、蛇的蜿蜒轮廓,以及花茎和树枝等精细结构。相比之下,DINOv2 表现出每个 token 的斑点状噪声,SigLIP 2 退化为块状噪声,而 V-JEPA 2.1 则让背景纹理渗入前景区域。

14

第 15 页

表 2. 密集视觉任务上的性能。我们报告深度估计(NYUv2、KITTI)的均方根误差(RMSE)和语义分割(ADE20K、Cityscapes、VOC12)的平均交并比(mIoU)。遵循 [39] 的做法,对于 patch 大小为 14 的模型,ADE20K 和 VOC12 在 448 × 448 的输入分辨率下进行评估;对于 patch 大小为 16 的模型,则在 512 × 512 的分辨率下评估。Cityscapes、NYUv2 和 KITTI 使用其默认评估分辨率。在使用 1B 参数主干网络的情况下,LingBot-Vision 取得了最佳的 NYUv2 RMSE 整体成绩,优于拥有 7B 参数的 DINOv3。

| | 深度估计 | | 分割 | | | | :— | :—: | :—: | :—: | :—: | :—: | | 方法 | 参数量 | NYUv2↓ | KITTI↓ | ADE20k | Citysc. | VOC | | 大于 2B 参数的模型 | | | | | | | | Web-DINO [17] | 7B/14 | 0.466 | 3.158 | 42.7 | 68.3 | 76.1 | | DINOv3 [39] | 7B/16 | 0.309 | 2.346 | 55.9 | 81.1 | 86.6 | | V-JEPA 2.1 ViT-G [27] | 2B/16 | 0.307 | 2.461 | 47.9 | 73.5 | 85.0 | | PEcore [6] | 2B/14 | 0.590 | 4.119 | 38.9 | 61.1 | 69.2 | | PEspatial [6] | 2B/14 | 0.362 | 3.082 | 49.3 | 73.2 | 82.7 | | 小于 2B 参数的模型 | | | | | | | | AM-RADIOv2.5 [34] | 1B/14 | 0.340 | 2.918 | 53.0 | 78.4 | 85.4 | | InternVideo2-1B [49] | 1B/14 | 0.471 | 4.739 | 28.4 | 35.6 | 65.2 | | SigLIP 2 [43] | 1B/16 | 0.494 | 3.273 | 42.7 | 64.8 | 72.7 | | DINOv2 [28] | 1B/14 | 0.372 | 2.624 | 49.5 | 75.6 | 83.1 | | DINOv3 ViT-H+ [39] | 0.8B/16 | 0.352 | 2.635 | 54.8 | 79.5 | 85.8 | | V-JEPA2 ViT-g [2] | 1B/16 | 0.642 | 4.650 | 24.4 | 45.9 | 63.9 | | V-JEPA 2.1 ViT-g [27] | 1B/16 | 0.350 | 2.601 | 47.8 | 71.8 | 84.7 | | LingBot-Vision ViT-g | 1B/16 | 0.296 | 2.552 | 53.5 | 79.6 | 87.5 |

5 结果

在本节中,我们遵循标准的冻结特征探测协议,在各种下游任务上评估我们预训练的视觉基础模型 LingBot-Vision:在密集预测和分类任务上进行线性探测,在全局和视频任务上进行非参数探测(k-NN 检索和标签传播)。与领先的视觉基础模型(例如 DINOv2 [28]、DINOv3 [39]、SigLIP 2 [43] 和 V-JEPA 2.1 [27])相比,其在公共基准测试中表现出的优异性能为空间理解奠定了坚实基础,并最终促成了 LingBot-Depth 2.0 的开发(第 6 节)。

5.1 图像的鲁棒密集表示

5.1.1 补丁特征的 PCA 分量

在任何探测之前,冻结特征的结构已经肉眼可见。图 6 将 LingBot-Vision 和领先的视觉基础模型的补丁特征的前三个 PCA 分量映射为 RGB 颜色,计算针对每张图像进行。在各种场景中,LingBot-Vision 将物体解析为连贯且边界清晰的区域:独立的汽车和高速公路的车道布局、与铁丝网清晰分离的母鸡剪影、蜿蜒的蛇形轮廓,以及围绕土拨鼠的花朵茎等精细结构。对比也暴露了基线模型的特征性失败模式:DINOv2 的特征带有每个 token 的斑点噪声,SigLIP 2 在显著物体之外坍缩为块状噪声,而 V-JEPA 2.1 则让背景纹理渗入前景区域。这些定性差异预示了下面的定量差距:边界忠实(boundary-faithful)的特征正是像素级密集读取所依赖的。

5.1.2 深度估计上的线性探测

评估协议。我们遵循标准的线性探测协议:冻结 ViT 主干网络,仅在每个目标数据集的训练集上训练解码器。我们没有采用增加解码能力的方法(例如 DPT 头 [33] 或多层特征聚合),而是对所有预训练视觉变换器使用单个线性层作用于冻结的补丁 token 作为解码器,因此该比较将性能归因于特征本身,而非读取机制。NYUv2 [38] 和 KITTI [18] 在其默认分辨率下进行评估,并以 RMSE 报告。

15

第 16 页

结果。表 2 按参数量对竞争对手进行了分组。在使用 1B 参数 ViT-g/16 主干网络的情况下,LingBot-Vision 取得了整个表格中最佳的 NYUv2 RMSE(0.296),优于 7B 参数的 DINOv3(0.309)和 2B 参数的 V-JEPA 2.1(0.307),参数量分别减少了 7 倍和 2 倍。与同等规模模型相比,其优势显著:RMSE 比最佳同规模竞争对手 AM-RADIOv2.5(0.340)低 13%,比从 7B 教师模型蒸馏而来的 DINOv3 ViT-H+(0.352)低 16%,比 DINOv2(0.372)低 20%。同等规模下最强的视频预训练基线 V-JEPA 2.1 ViT-g(0.350)仍落后 15%。在 KITTI 数据集上,LingBot-Vision 在 2B 参数以下的模型中取得了最佳 RMSE(2.552),仅被 7B 的 DINOv3(2.346)和 2B 的 V-JEPA 2.1(2.461)超越。值得注意的是,LingBot-Vision 是在 patch size 为 16 的情况下取得这些结果的,这意味着在相同输入分辨率下,其 token 网格比 patch size 为 14 的竞争对手更粗糙。

分析。线性解码器无法弥补表征的缺陷;它只能读出冻结特征已经编码的内容。在此协议下实现准确的深度估计,需要特征在表面内部平滑,而在遮挡边界处发生急剧变化,这正是深度不连续点集中的区域。这正是 LingBot-Vision 面向边界的预训练所针对的 regime,如图 6 所示:物体内部映射为连贯的区域,而过渡保持清晰。因此,深度估计是 LingBot-Vision 优势最大的任务,且其在 NYUv2 上的优势幅度大于 KITTI,因为在 KITTI 上所有主干网络的性能差异缩小:户外驾驶场景主要由道路和天空区域主导,附近遮挡边界较少,因此边界保真度对误差预算的贡献较小。

5.1.3 语义分割上的线性探测

评估协议。针对每个数据集,在冻结的 patch tokens 上训练相同的单层线性解码器。遵循 DINOv3 协议,对于 patch size 为 14 的模型,在 ADE20K [62] 和 VOC12 [16] 上以 448 × 448 进行评估;对于 patch size 为 16 的模型,以 512 × 512 进行评估,从而使所有模型产生相同的 patch-token 分辨率;Cityscapes [11] 使用其默认评估分辨率。我们报告相对于真实标注的平均交并比(mIoU)。

结果。在 ADE20K、Cityscapes 和 VOC12 上(表 2),LingBot-Vision 与蒸馏后的 DINOv3 ViT-H+ 相当:在 ADE20K 上落后 1.3 mIoU(53.5 对比 54.8),而在 Cityscapes 上与之持平,在 VOC12 上领先。与同等规模的标准自监督参考模型 DINOv2 相比,在所有三个基准测试上均有至少 4 mIoU 的提升(例如,在 ADE20K 上为 53.5 对比 49.5),而同等规模的视频预训练模型 V-JEPA 2.1 ViT-g 在 ADE20K 上落后 5.7 mIoU。LingBot-Vision 还在所有三个基准测试上超越了 AM-RADIOv2.5,尽管后者聚合了多个教师模型,包括专门用于分割的模型,并且在 ADE20K 上比经过空间后训练的 PEspatial 高出 4.2 mIoU。剩余的差距仅在于 DINOv3 系列模型(在 ADE20K 上落后 7B 模型 2.4 mIoU),这些模型受益于蒸馏和专用的密集特征目标。我们强调,LingBot-Vision 是使用单一自监督目标从头预训练的,而最强的密集基线模型依赖于从 7B 教师模型(DINOv3 ViT-H+)蒸馏或面向任务的后训练(PEspatial)。

分析。分割任务同时奖励两种特性:同一语义区域的 patch 必须映射到相近的特征,且特征过渡必须恰好落在类别边界上,因为 mIoU 误差集中在轮廓和细结构上。图 6 的 PCA 图显示,LingBot-Vision 同时提供了这两种特性,具有连贯的物体内部和清晰的过渡。比较还区分了目标家族:语言对齐预训练(SigLIP 2,在 ADE20K 上为 42.7 mIoU)以牺牲空间细节为代价优化图像级对齐,而视频预测预训练仅在经过改进后才恢复密集结构(V-JEPA 2 到 V-JEPA 2.1,mIoU 从 24.4 提升到 47.8)。面向边界的图像预训练无需更大的教师模型即可达到蒸馏级别的分割质量。

5.2 视频理解

我们通过两种方式评估冻结特征的时间一致性:定量上,使用标准基准测试上的免训练视频对象分割;定性上,通过在自捕获视频中追踪单个边界 token 并可视化查询 token 随时间变化的相似度响应。

5.2.1 视频对象分割

评估协议。我们在 DAVIS-2017 [30] 和 YouTube-VOS [56] 上评估免训练视频对象分割:第一帧的真实掩码通过冻结 patch 上的 top-k 注意力传播到后续帧。

16

第 17 页

表 3. 冻结特征的视频目标分割。我们在 DAVIS-2017 和 YouTube-VOS 上报告了在免训练标签传播下的 J &F-Mean 指标,对于 patch size 为 16 的模型,图像短边设置为 480 px;对于 patch size 为 14 的模型,短边设置为 420 px。

| Method | Param. | DAVIS-S | YT VOS-S | | :— | :— | :— | :— | | Models greater than 2B parameters | | | | | Web-DINO [17] | 7B/14 | 57.2 | 43.9 | | DINOv3 [39] | 7B/16 | 71.1 | 74.1 | | V-JEPA 2.1 ViT-G [27] | 2B/16 | 69.0 | 72.7 | | PEcore [6] | 2B/14 | 48.2 | 34.7 | | PEspatial [6] | 2B/14 | 68.4 | 68.5 | | Models less than 2B parameters | | | | | AM-RADIOv2.5 [34] | 1B/14 | 66.5 | 70.1 | | InternVideo2-1B [49] | 1B/14 | 50.6 | 51.2 | | SigLIP 2 [43] | 1B/16 | 56.1 | 52.0 | | DINOv2 [28] | 1B/14 | 63.9 | 65.6 | | DINOv3 ViT-H+ [39] | 0.8B/16 | 71.1 | 74.0 | | V-JEPA2 ViT-g [2] | 1B/16 | 52.5 | 53.7 | | V-JEPA 2.1 ViT-g [27] | 1B/16 | 68.1 | 72.3 | | LingBot-Vision ViT-g (Ours) | 1B/16 | 70.0 | 73.5 |

特征,且无需任何微调。视频被调整大小,使得对于 patch size 为 16 的模型短边为 480 px,对于 patch size 为 14 的模型短边为 420 px,我们报告 J &F-Mean。

结果。如表 3 所示,LingBot-Vision 在 DAVIS 和 YouTube-VOS 上分别达到 70.0 和 73.5 的 J &F 分数,与 DINOv3 ViT-H+ (71.1 和 74.0) 以及 7B 参数的 DINOv3 (71.1 和 74.1) 相当,并且在所有其他规模的模型中表现最佳。在参数量相当的情况下,其比 DINOv2 高出 6.1 和 7.9 个百分点;尽管 V-JEPA 2.1 ViT-g 是在视频上训练的,但仍落后 1.9 和 1.2 个百分点。

5.2.2 边界 Token 跟踪

除了聚合基准测试外,我们还从单个 token 的层面探究时间一致性。图 7 追踪了三个边界 token 查询在三个不同性质的视频中的表现:一个是机器人头部摄像头看到的操作片段,一个是自拍猫视频,另一个是家庭场景的相机平移。在每一帧中,每个查询都通过计算冻结的 patch 特征与当前帧边界 token 之间的余弦相似度进行匹配,匹配范围限制在其上一位置周围的局部窗口内,并且查询特征会根据其最佳匹配结果进行更新,同时保持锚定在第一帧的模板上,从而使跟踪器能够跟随外观变化而不发生漂移。查询在三种场景下均保持稳定锁定:在机器人场景中,机械爪手指和被操作的水壶在整个片段中都被锁定;在猫的场景中,头部和侧腹的查询跟随身体完成一整圈转动,而位于静态窗框上的查询保持不动;在相机平移场景下,查询经受住了大幅度的视角变化,并在植物重新进入视野时重新获取目标。在整个过程中,相似度响应保持选择性,而非扩散到整个场景。因此,边界 token 表现为 LingBot-Vision 特征空间中稳定、可跟踪的实体,且这一结果是在没有任何时间监督的情况下获得的。

5.3 全局和密集任务上的强蒸馏模型

我们通过图像级识别来完善整体评估,同时评估庞大的教师模型和蒸馏后的 LingBot-Vision 系列模型,因为分类也是我们进行蒸馏的轴心。

5.3.1 ImageNet 上的线性探测和 k-NN 探测

评估协议。我们在冻结特征上评估 ImageNet-1K [13] 分类任务,使用两种读取方式:一种是在训练集上训练的线性分类器,另一种是免训练的 k-NN 分类器。评估保持 token 对齐:根据 patch size 设置输入分辨率,使得所有模型产生相同数量的 patch token,这与密集任务的协议一致。

17

第 18 页

s 0 = t

s ≈100 t

s 0 = t

s ≈3.5 t

s ≈3 t

s 10 = t

图 7. 边界 token 在三个视频中的追踪。在每个视频的第一帧中播种三个边界 token 查询(左侧面板中的叉号),并通过冻结的 patch 特征与每帧边界 token 之间的余弦相似度进行追踪;三个热力图面板显示了三个查询的相似度响应。顶部一对:从机器人头部摄像头看到的操作片段,查询在整个片段中锁定夹爪手指和壶。中间一对:自拍猫视频,头部和侧腹的查询跟随身体完成一整圈转动,而窗框的查询保持不动。底部一对:穿过家庭的相机平移,查询在视角大幅变化中追踪猫和猫爬架平台,并在植物重新进入视野时重新获取。未使用微调或时间监督。

上述。线性探针遵循标准的网格搜索实践:使用动量为 0.9 的 SGD,训练 10 个 epoch,批量大小为 1024,学习率在 {1, 2, 5} × 10^k(其中 k ∈ {-4, . . . , 0})范围内扫描,权重衰减在 {0, 10^{-5}} 范围内扫描,在 ImageNet-1K 验证集上选择最佳组合;训练使用 Inception 风格的随机缩放裁剪,评估使用 224 × 224 图像。

结果。在巨大规模下(表 4),LingBot-Vision 获得 86.32(线性)和 83.39(k-NN)的 top-1 准确率,与 DINOv2 的旗舰模型(87.00 和 83.68)相当,但低于 DINOv3-7B(87.87 和 85.68)和 SigLIP 2(87.33 和 84.75)。与 DINOv3-7B 的剩余差距主要集中在图像级识别上,而上述密集比较有利于 LingBot-Vision:这与我们面向边界的预训练一致,后者将模型容量投资于局部结构而非图像级不变性。

18

第 19 页

表 4. 旗舰模型在 ImageNet-1k 上的准确率。巨量规模下的线性探测和 k-NN top-1 准确率;蒸馏系列模型的对比见表 5。

| Model | IN-1K Linear | IN-1K k-NN | | :— | :— | :— | | LingBot-Vision (Ours) | 86.32 | 83.39 | | DINOv2 [28] | 87.00 | 83.68 | | DINOv3 [39] | 87.87 | 85.68 | | Franca [45] | 84.50 | 81.11 | | SigLIP2 [43] | 87.33 | 84.75 |

表 5. LingBot-Vision 蒸馏模型与代表性预训练视觉骨干网络的对比。全局任务报告 ImageNet-1k 线性探测和 KNN top-1 准确率,而密集任务报告深度 RMSE↓ 和语义分割 mIoU。我们匹配了不同 patch 大小模型的 patch token 分辨率。

| Size | Model | Global Tasks<br>IN1k-Linear | Global Tasks<br>IN1k-KNN | Dense Tasks<br>NYU↓ | Dense Tasks<br>KITTI↓ | Dense Tasks<br>ADE | Dense Tasks<br>VOC | Dense Tasks<br>City | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | L | DINOv2 [28] | 86.43 | 83.82 | 0.411 | 3.243 | 48.63 | 83.54 | 74.51 | | L | DINOv3 [39] | 87.31 | 85.27 | 0.351 | 2.643 | 55.00 | 88.11 | 79.28 | | L | SigLIP2 [43] | 85.67 | 82.91 | 0.516 | 3.641 | 42.99 | 75.55 | 62.51 | | L | Franca [45] | 82.50 | 71.70 | 0.425 | 3.613 | 45.93 | 84.42 | 72.42 | | L | V-JEPA2.1 [27] | – | – | 0.346 | 2.617 | 46.29 | 84.81 | 71.58 | | L | LingBot-Vision | 86.38 | 83.62 | 0.310 | 2.574 | 52.75 | 87.40 | 78.75 | | B | DINOv2 [28] | 84.27 | 82.17 | 0.429 | 3.416 | 48.25 | 83.81 | 74.19 | | B | DINOv3 [39] | 84.79 | 83.21 | 0.371 | 2.826 | 51.74 | 88.20 | 77.30 | | B | SigLIP2 [43] | 82.47 | 79.47 | 0.539 | 3.847 | 40.49 | 73.50 | 60.12 | | B | Franca [45] | 78.45 | 63.45 | 0.462 | 3.790 | 42.69 | 82.79 | 71.65 | | B | V-JEPA2.1 [27] | – | – | 0.410 | 2.883 | 41.38 | 78.00 | 64.99 | | B | LingBot-Vision (Ours) | 85.05 | 82.32 | 0.339 | 2.793 | 51.44 | 87.10 | 77.17 | | S | DINOv2 [28] | 80.76 | 79.11 | 0.447 | 3.568 | 44.86 | 82.34 | 71.44 | | S | DINOv3 [39] | 80.37 | 79.33 | 0.405 | 2.851 | 46.51 | 84.30 | 73.38 | | S | LingBot-Vision (Ours) | 82.22 | 78.98 | 0.383 | 3.784 | 47.01 | 84.17 | 64.34 |

5.3.2 跨尺度的蒸馏模型

设置。为了适应不同的部署预算,我们将巨量 LingBot-Vision 教师模型蒸馏为 ViT-L、ViT-B 和 ViT-S 学生模型,并使用相同的全局和密集协议对它们进行探测(表 5)。

结果。蒸馏系列模型在每个规模上都保留了教师模型的特征。在 ViT-L 规模下,LingBot-Vision 在全局准确率上与 DINOv2 持平(线性准确率 86.38 对 86.43),同时将 NYUv2 的 RMSE 降低了 25%(0.310 对 0.411);与 DINOv3-L 相比,其线性准确率低了 0.9 分,但在 NYUv2 上的深度预测领先 12%,且在所有分割基准测试中的 mIoU 差距保持在 0.5 到 2.3 之间。值得注意的是,在相同协议下,0.3B 学生模型达到了与表 2 中 7B DINOv3 相当的 NYUv2 RMSE(0.310 对 0.309),而参数量减少了约 23 倍。在 ViT-B 规模下,LingBot-Vision 获得了其尺寸类别中最佳的线性准确率(85.05),以及两个数据集上最佳的深度预测结果(NYUv2 0.339,KITTI 2.793),在 ADE20K 和 Cityscapes 上仅落后 DINOv3-B 最多 0.3 的 mIoU。在 ViT-S 规模下,它再次在线性探测(82.22)、NYUv2(0.383)和 ADE20K(47.01)上领先;最小的学生模型在 k-NN 和 VOC 上仅落后 0.4 分,但在 KITTI 和 Cityscapes 上落后。跨规模来看,视频预训练的 V-JEPA2.1 在所有密集基准测试中均落后,SigLIP 2 在分类任务上表现接近但在密集任务上远远落后,而 Franca 在两个维度上均落后。

分析。有两个观察结果尤为突出。首先,密集任务的优势通过蒸馏几乎完整地传递:学生模型继承了使教师模型表现优异的边界忠实 patch 特征,而与 DINOv3 的剩余差距集中在图像级准确率上,这与巨量规模的对比结果一致。其次,该系列模型形成了一个实用的准确率-计算量前沿:在每个部署预算下,LingBot-Vision 学生模型都提供了其类别中最佳的深度准确率,且分类准确率与最佳竞争对手相差不到 1 分,因此下游用户无需为了模型尺寸而牺牲密集任务的质量。

上述冻结特征的结果,结合表 6 的编码器初始化研究,确立了 LingBot-Vision

19

第 20 页

表 6. 掩码深度建模的编码器初始化研究。使用相同的数据,从不同的编码器初始化开始训练完全相同的 MDM 管道,并在块掩码和稀疏输入深度(顶部)以及真实深度摄像头的原始捕获数据(底部)上进行评估。每个单元格报告 RMSE↓/ D105 ↑;每个规模组内每列的最佳结果以粗体显示。LingBot-Vision 初始化在 ViT-L 上整体表现最强,并且在 ViT-g 上的大多数基准测试中也表现最佳,尽管在 Hammer 捕获数据上 DINOv2 略占优势。

| | Block Mask | | | | | | | | Sparse | | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Init | Arch | DIODE-In | DIODE-Out | Ibims-1 | NYU | VOID | Ibims-1 | NYU | ETH3D | | | | DINOv2 [28] | ViT-L/14 | 0.152/0.981 | 3.192/0.775 | 0.192/0.942 | 0.169/0.920 | 0.214/0.732 | 0.167/0.944 | 0.139/0.930 | 0.385/0.865 | | | | DINOv3 [39] | ViT-L/16 | 0.114/0.988 | 3.065/0.735 | 0.189/0.945 | 0.154/0.922 | 0.190/0.885 | 0.167/0.949 | 0.139/0.929 | 0.460/0.842 | | | | LingBot-Vision | ViT-L/16 | 0.094/0.990 | 2.771/0.794 | 0.167/0.953 | 0.145/0.930 | 0.199/0.887 | 0.167/0.952 | 0.136/0.932 | 0.414/0.868 | | | | | | | | | | | | | | | | | DINOv2 | ViT-g/14 | 0.118/0.990 | 2.778/0.809 | 0.180/0.952 | 0.178/0.922 | 0.203/0.810 | 0.156/0.957 | 0.142/0.932 | 0.361/0.911 | | | | LingBot-Vision | ViT-g/16 | 0.083/0.993 | 2.734/0.801 | 0.166/0.959 | 0.148/0.935 | 0.182/0.916 | 0.142/0.964 | 0.125/0.942 | 0.365/0.911 | | |

| | Hammer | | | ClearGrasp | | | LingBot | | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Init | Arch | D435 | L515 | ToF | D415 | D435 | D415 | D435 | D455 | | DINOv2 [28] | ViT-L/14 | 0.034/0.860 | 0.021/0.960 | 0.030/0.900 | 0.012/0.958 | 0.015/0.915 | 0.295/0.932 | 0.400/0.956 | 0.454/0.900 | | DINOv3 [39] | ViT-L/16 | 0.033/0.871 | 0.022/0.946 | 0.029/0.878 | 0.012/0.968 | 0.012/0.953 | 0.289/0.930 | 0.377/0.955 | 0.414/0.903 | | LingBot-Vision | ViT-L/16 | 0.031/0.892 | 0.020/0.951 | 0.027/0.928 | 0.010/0.981 | 0.010/0.985 | 0.271/0.936 | 0.373/0.955 | 0.415/0.906 | | | | | | | | | | | | | DINOv2 [28] | ViT-g/14 | 0.031/0.910 | 0.021/0.966 | 0.024/0.954 | 0.013/0.946 | 0.018/0.861 | 0.260/0.944 | 0.373/0.962 | 0.447/0.918 | | LingBot-Vision | ViT-g/16 | 0.031/0.905 | 0.022/0.950 | 0.027/0.951 | 0.011/0.973 | 0.015/0.928 | 0.254/0.951 | 0.359/0.965 | 0.409/0.930 |

| REL (越低越好) | | | | D102 (越高越好) | | | | :— | :— | :— | :— | :— | :— | :— | | | | Ours (LingBot-Vision) | | 0.80 | | 0.795 | | 0.035 | | DINOv2 | | | | 0.777 | | 0.032 | 0.030 | | | 0.75 | | | | | | | | | | 0.752 0.755 | | 0.028 | | | | | | | | 0.025 | | 0.024 | | 0.70 0.692 Ours (LingBot-Vision) | | | | | | | | 0.022 0.689 DINOv2 | | | | 0.020 | | | | | | | | 3M | 20M | 150M | 3M | 20M | 150M | |

图 8. 扩展精心策划的训练数据。随着 MDM 训练集从 3M 增长到 20M 和 150M 样本,LingBot-Vision 和 DINOv2 编码器初始化在相同管道下的深度补全质量。左侧:平均绝对相对误差 (REL,越低越好);右侧:严格阈值准确率 D102 (越高越好)。两种初始化都随着数据量的增加而单调改善,但它们不可互换:在 3M 时,两者在 D102 上几乎持平,随着规模扩大,差距逐渐拉大,因为 DINOv2 曲线在 20M 之后趋于饱和 (0.752 到 0.755),而 LingBot-Vision 曲线持续改善 (0.777 到 0.795)。更多的数据放大了而非抵消了具有空间感知原生特性的初始化的优势。

作为强大的空间骨干。第 6 节在此基础上开发了用于度量深度补全的 LingBot-Depth 2.0。

6 遇见 LingBot-Depth 2.0

鉴于 LingBot-Vision 在通用视觉预训练方面的成功,是时候用 LingBot-Vision 作为其空间感知原生骨干,升级我们之前的 LingBot-Depth [42] 以用于深度补全这一面向机器人的感知任务。为了保持内容的完整性,我们首先简要回顾 LingBot-Depth 在前一版本中的训练方式,然后描述我们为实现更强性能所做的调整。简而言之,LingBot-Depth 2.0 有两种尺寸,分别基于我们 LingBot-Vision 预训练的 ViT-L/16 和 ViT-g/16 骨干网络构建,并通过将训练集从公开发布的 3M 样本扩展到精心策划的 150M 集合来探索数据扩展,在涵盖不同深度模式和相机类型的 14 个基准测试中确立了领先的性能。

第 21 页

前视图

时间

顶视图

输入:RGB 输入:原始深度 输出:优化后的深度 输出:优化后的点云

顶视图

时间

前视图

输入:RGB 输入:原始深度 输出:优化后的深度 输出:优化后的点云

输入:RGB 输入:原始深度 输出:优化后的深度 输出:优化后的点云

图 9. LingBot-Depth 2.0 在镜面和玻璃场景上的表现。每组展示了捕获序列连续帧的输入 RGB、传感器原始深度以及优化后的深度,并附带优化后点云的前视图和顶视图。原始深度在最难处理的表面上完全缺失:窗玻璃、玻璃栏杆和反光地板均无测量数据。补全的区域在点云中形成平坦且连续的平面,并在时间上保持稳定。

21

第 22 页

RGB/真值深度 原始深度/点云 OMNI-DC CDMs LingBot-Depth 1.0 LingBot-Depth 2.0

图 10. 深度补全方法的定性比较。每个场景展示了 OMNI-DC、CDMs、LingBot-Depth 1.0 和 LingBot-Depth 2.0 补全后的深度图(上)和对应的点云(下),旁边是带有真值深度的 RGB 帧和原始传感器输入。基线方法使缺失区域保持开放、弯曲平面表面,或在深度不连续处产生漂浮点;LingBot-Depth 2.0 保持平面笔直且物体边界清晰。

22

第 23 页

表 7. 真实传感器捕获数据的深度补全。来自三个相机系列(HAMMER:D435、L515、ToF;ClearGrasp:D415、D435;LingBot:D415、D435、D455)的原始、不完整的深度图由每种方法完成补全。每个单元格报告 RMSE↓/ D105 ↑;每列的最佳结果以粗体显示,次佳结果以下划线标示。LingBot-Depth 2.0 在八种配置中的六种上领先,并在透明物体 ClearGrasp 捕获数据中表现最强;ViT-g 变体单独报告在最后一行。

| | Hammer | | | Cleargrasp | | Lingbot | | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | D435 | L515 | Tof | D415 | D435 | D415 | D435 | D455 | | CDMs [25] | 0.032/0.931 | 0.032/0.884 | 0.059/0.747 | 0.017/0.893 | 0.013/0.948 | 0.516/0.831 | 0.585/0.883 | 0.623/0.755 | | OMNI-DC [67] | 0.079/0.672 | 0.076/0.752 | 0.284/0.470 | 0.042/0.454 | 0.027/0.705 | 0.490/0.840 | 0.577/0.821 | 0.918/0.789 | | Any2Full [66] | 0.050/0.775 | 0.066/0.841 | 0.066/0.728 | 0.030/0.673 | 0.024/0.751 | 0.611/0.902 | 0.633/0.903 | 1.450/0.813 | | PriorDA [50] | 0.077/0.492 | 0.086/0.543 | 0.154/0.395 | 0.040/0.417 | 0.036/0.557 | 0.492/0.626 | 0.598/0.593 | 0.806/0.587 | | LingBot-Depth 1.0 [42] | 0.036/0.861 | 0.034/0.908 | 0.035/0.803 | 0.022/0.787 | 0.018/0.831 | 0.373/0.934 | 0.345/0.942 | 0.434/0.877 | | LingBot-Depth 2.0 | 0.032/0.895 | 0.023/0.942 | 0.031/0.912 | 0.010/0.981 | 0.012/0.960 | 0.242/0.949 | 0.363/0.964 | 0.394/0.930 | | LingBot-Depth 2.0(ViT-g) | 0.031/0.916 | 0.022/0.950 | 0.025/0.952 | 0.016/0.897 | 0.014/0.917 | 0.228/0.957 | 0.345/0.968 | 0.375/0.940 |

表 8. 块掩码和稀疏输入深度上的深度补全。在块掩码模式下,输入深度的大片连续区域被移除;在稀疏模式下,仅保留分散的深度点。每个单元格报告 RMSE↓/ D105 ↑;每列的最佳结果以粗体显示,次佳结果以下划线标示。LingBot-Depth 2.0 在八个基准测试中的七个上取得了最佳的 RMSE;ViT-g 变体单独报告在最后一行。

| | Block Mask | | | | | Sparse | | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | DIODE-In | DIODE-Out | Ibims-1 | NYU | VOID | Ibims-1 | NYU | ETH3D | | CDMs [25] | 0.461/0.762 | 4.594/0.594 | 0.285/0.850 | 0.280/0.782 | 0.990/0.181 | 1.504/0.129 | 0.728/0.281 | 4.173/0.061 | | OMNI-DC [67] | 0.183/0.910 | 3.679/0.492 | 0.195/0.871 | 0.151/0.861 | 0.206/0.937 | 0.132/0.973 | 0.118/0.949 | 0.600/0.872 | | Any2Full [66] | 0.104/0.989 | 6.803/0.807 | 0.148/0.963 | 0.129/0.948 | 0.224/0.909 | 0.148/0.962 | 0.144/0.938 | 2.033/0.791 | | PriorDA [50] | 0.307/0.713 | 3.315/0.596 | 0.356/0.653 | 0.352/0.543 | 0.211/0.912 | 0.138/0.960 | 0.126/0.936 | 0.562/0.840 | | LingBot-Depth 1.0 [42] | 0.132/0.981 | 3.404/0.809 | 0.188/0.955 | 0.117/0.953 | 0.199/0.897 | 0.155/0.965 | 0.143/0.937 | 0.368/0.929 | | LingBot-Depth 2.0 | 0.062/0.995 | 2.440/0.826 | 0.138/0.965 | 0.116/0.951 | 0.170/0.940 | 0.131/0.969 | 0.113/0.950 | 0.522/0.907 | | LingBot-Depth 2.0(ViT-g) | 0.060/0.996 | 2.298/0.841 | 0.132/0.969 | 0.114/0.954 | 0.174/0.940 | 0.124/0.973 | 0.113/0.951 | 0.476/0.924 |

6.1 LingBot-Depth 1.0 回顾

掩码深度建模。LingBot-Depth 将深度补全表述为掩码深度建模(MDM),这是掩码自编码 [19] 的 RGB-D 变体。关键观察在于,消费级深度相机的缺失测量值并非干扰噪声,而是一种自然的掩码信号:它们恰好集中在成像困难的区域,即镜面、透明和无纹理表面,从而标记出必须从视觉上下文中推断几何形状的区域。因此,RGB 帧和原始深度图通过两个独立的嵌入层被分块化并映射到共享的 token 网格上,每个 token 接收共享的空间位置嵌入以及区分这两个来源的模态嵌入。深度 token 根据传感器有效性进行掩码:完全无效的 patch 始终被掩码,部分有效的 patch 以高概率被掩码,而完全有效的 token 则随机添加,直到达到 60% 到 90% 的目标掩码比例。一个从 DINOv2 [28] 初始化的 ViT-L 编码器联合嵌入完整的 RGB token 集和未掩码的深度 token;解码器丢弃潜在深度 token,仅利用上下文 token 通过源自 MoGe [48] 的层次结构 ConvStack 头重建全分辨率深度图,并在有效的真实像素上通过 L1 损失进行监督。

数据策展。MDM 需要缺失模式真实的 RGB-D 数据,而现有数据集要么避免困难的成像条件,要么提供渲染的、无伪影的深度。因此,LingBot-Depth 通过两条并行流水线自行策展数据。合成流在 Blender 中从自托管的室内场景渲染 RGB、完美深度和散斑投影立体对,然后在立体对上运行半全局匹配,从而使生成的类传感器深度携带真实主动相机的伪影(来自 442 个场景的 100 万样本)。真实世界流基于一个定制的多相机捕获装置,涵盖多样化的室内、商业和室外场景,其伪真实值由 FoundationStereo [52] 在左右一致性检查下从立体红外对蒸馏而来(200 万次捕获)。结合开源 RGB-D 数据集,这产生了大约 1000 万个训练样本,其中策展的 300 万个已公开发布。在此语料库上训练后,LingBot-Depth 在深度精度和像素覆盖率方面均超越了顶级 RGB-D 相机。

23

第 24 页

6.2 LingBot-Depth 的两个重要调整

LingBot-Depth 2.0 保持第 6.1 节中掩码深度建模配方不变,并改进了其两个外部要素:编码器初始化和精心策划的训练数据规模。

空间感知原生编码器。该配方的唯一外部依赖是编码器初始化,而这正是 LingBot-Depth 2.0 升级之处:ViT-L/14 的 DINOv2 编码器被替换为我们的 LingBot-Vision 预训练模型,分别在 ViT-L/16 和 ViT-g/16 上实现。表 6 通过从不同初始化状态训练相同的 MDM 管道来隔离这一选择。在 ViT-L 上,LingBot-Vision 编码器在几乎所有基准测试中均优于 DINOv2 和 DINOv3 的初始化状态,在最难的块掩码模式上提升最大(例如,在 DIODE-Indoor 上,RMSE 从 DINOv2 的 0.094 提升至 0.152),且这一优势在巨型规模下依然保持(在 DIODE-Indoor 上为 0.083 对比 0.118)。这是符合预期的:深度补全将其不确定性集中在物体边界和材质过渡周围,而这正是 LingBot-Vision 的边界锚定特征所编码的结构。

扩大精心策划的数据规模。第二个调整是扩大数据规模:利用第 6.1 节回顾的捕获和伪标签标注机制,精心策划的语料库从公开发布的 300 万样本增长到 1.5 亿 RGB-D 样本。图 8 跟踪了随着训练集增长深度补全的质量:与所有比较的编码器初始化相比,随着数据量的增加,准确性单调提升,且 LingBot-Vision 初始化在每个数据规模下都保持领先。因此,这两项调整产生了协同效应:更好的起点并未被更多数据所稀释,它在 1.5 亿数据量下依然持续获益。

6.3 LingBot-Depth 2.0 的基准测试

数据集。我们的评估数据分为三类,与表 7 和表 8 的结构相匹配。(1) 块掩码基准测试是带有高质量真实标签的公开 RGB-D 数据集,从中我们移除了输入深度中的大片连续区域:DIODE-Indoor 和 DIODE-Outdoor [44],覆盖室内和室外场景的精确激光扫描;iBims-1 [24],一个带有经过仔细验证的真实标签的激光扫描室内基准测试,特别是在深度边界周围;以及 NYU [38],标准的 Kinect 捕获室内测试集。(2) 稀疏基准测试将输入深度减少为分散的测量值,遵循 MarigoldDC [46] 在 VOID [54]、iBims-1 和 NYU 上进行采样,并取自 ETH3D [37] 上的稀疏 SfM 深度。(3) 真实传感器基准测试在商用深度摄像头的原始、不完整捕获上进行评估:HAMMER [22],将 RealSense D435、L515 和飞行时间(time-of-flight)捕获的相同场景与高精度真实标签配对;ClearGrasp [36],透明物体的真实 D415 和 D435 捕获,这是主动深度感知的最坏情况;以及我们使用 D415、D435 和 D455 摄像头自行捕获的 LingBot 评估集。我们的 LingBot 评估集包含在 35 个不同室内场景中捕获的 1,751 帧图像。这些场景涵盖了广泛的日常环境:办公室、会议室和接待区;学校、图书馆和实验室;医院和诊所;酒店、客房和住宅;餐厅、展厅和零售空间;以及车站、停车场、车库和电梯等交通区域。其中许多场景包含反射、透明和无纹理表面,这是主动深度感知的最坏情况。为了获得可靠的真实标签,我们在每个摄像头的左右图像对上运行强大的立体匹配模型(FoundationStereo [52]);通过左右一致性检查剔除不可靠的估计,并使用视觉-语言模型(Qwen3.5 [31])检测并移除存在严重运动模糊的帧。将这些真实标签与每个 RealSense 摄像头的原始、不完整深度配对,使我们能够在真实的传感条件下评估深度补全。

评估协议。我们在上述公开基准测试以及真实传感器套件的原始捕获上,在两种输入模式下评估深度补全。在块掩码模式下,输入深度的大片连续区域缺失;在稀疏模式下,仅提供分散的深度点。我们报告 RMSE 和阈值准确率 D105,并与最近的深度补全系统(CDMs [25]、OMNI-DC [67]、Any2Full [66]、PriorDA [50])以及 LingBot-Depth 1.0 进行比较。

定量结果。在掩码模式上(表 8),采用 ViT-L 主干网络的 LingBot-Depth 2.0 在八个基准测试中的七个上取得了最佳的 RMSE:所有四个块掩码设置和四个稀疏设置中的三个,ETH3D 仍由 LingBot-Depth 1.0 保持。在补全最困难的场景下,相比前一版本的提升巨大:在块掩码 DIODE-Indoor 上,RMSE 减半(从 0.132 降至 0.062),DIODE-Outdoor 从 3.404 改善至 2.440。外部基线模型仅在其偏好的模式下表现强劲:CDMs 在稀疏输入下崩溃,Any2Full 在室外块掩码下性能下降,而 LingBot-Depth 2.0 在两种模式下均保持一致。在真实传感器上(表 7),2.0

24

第 25 页

在八种相机配置中的六种上表现最佳,在 Hammer D435 上与 CDMs 持平,并且在透明物体 ClearGrasp 捕获数据上表现尤为出色(RMSE 分别为 0.010 和 0.012),这是主动深度感知中的经典失败案例。 将主干网络扩展至 ViT-g 进一步提升了大多数模式基准测试的性能(DIODE-Indoor 上为 0.060,NYU 在两种设置下分别为 0.114 和 0.113),以及在 LingBot 传感器套件上(三种相机分别为 0.228、0.345 和 0.375),而 ClearGrasp 仍倾向于使用 ViT-L 变体。

定性结果。图 9 探测了主动深度感知的两个经典失败模式:镜面和玻璃,针对捕获的视频序列。原始传感器深度在最困难的场景区域完全缺失:窗玻璃、玻璃栏杆和反射地板完全没有返回任何测量值。LingBot-Depth 2.0 以作为表面一致而非仅逐像素合理的几何结构补全这些区域:在细化后的点云中,窗户和栏杆在前视图和顶视图中均呈现为平坦、连续的面,且补全结果在每个序列的连续帧之间保持稳定。图 10 与基线模型在透明桌面物体、户外标识、带有细结构的深色墙壁以及明亮窗户场景方面进行了比较。差异在点云行中最明显:基线模型要么留下缺失区域未填充,要么弯曲大的平面表面,要么在深度不连续处散布悬浮点,而 LingBot-Depth 1.0 在窗户和物体边缘附近仍存在残余离群点。LingBot-Depth 2.0 保持墙壁笔直、平面完整且物体边界清晰,补全深度中的遮挡边缘与 RGB 帧中的物体轮廓对齐,这是其边界感知编码器的特征。

7 结论

本报告介绍了 LingBot-Vision,这是一种预训练为原生空间感知能力的视觉基础模型。核心理念是将边界结构作为自监督学习的一等公民:图像边界被表示为密集的类别边界场,携带边界的 token 被强制纳入掩码模式,训练目标从教师模型自身的预测中在线引导,并通过参数无关的 a-contrario 验证进行测试,其零假设与均匀类别分布重合。在精心策划的数据集上以 ViT-g 规模训练,LingBot-Vision 提供了同类中最强的冻结特征密集预测性能,包括所有比较模型中最佳的 NYUv2 线性探测 RMSE,优于 7B 参数量的 DINOv3,视频对象分割性能与最强的蒸馏模型相当,具有竞争力的图像级识别能力,以及足够稳定以在视频中跟踪的边界 token。蒸馏将这些特性传递给 ViT-L、ViT-B 和 ViT-S 学生模型,因此相同的配方适用于各种部署预算。

视觉基础模型的价值最终由下游任务衡量。将 LingBot-Depth 升级为 LingBot-Depth 2.0 除了编码器初始化和精心策划数据的规模外,未改变掩码深度建模配方,并在各种掩码模式和真实深度相机上实现了领先的深度补全性能,随着训练数据的增加,LingBot-Vision 初始化的优势进一步扩大。我们将此视为边界导向预训练是实现机器人空间感知的一条实用途径,并向社区发布 LingBot-Vision 的预训练模型。

致谢

我们衷心感谢奥比中光(Orbbec Inc.)的光学测试团队提供的专业支持。我们还感谢胡宇斌、刘昌坤、何兴一、夏梦飞、王建元、张尚展、杨元波提供的有益讨论。LingBot-Depth 2.0 的大规模精心策划 RGB-D 数据的成功离不开黄永涛、卢一博、钟崇军、张涵、秦夏格的支持。

附录

A 采样边界场

本附录详细说明了发现 1 和图 3 背后的演示:从携带无学习信息的边界场中解码线段。

25

第 26 页

(a) 检测器角点 (b) 检测器角点 (c) 场派生角点 (d) 场派生角点 无验证 有验证 无验证 有验证

图 11. 角点锚点和 a-contrario 验证是互补的安全机制。相同的边界场,在相同设置下由相同的 LingBot-Vision 教师模型解码,角点取自冻结的单块检测器 (a, b; 920 个候选线段) 或通过 $j_{loc} = 1 – d$ 从场本身派生 (c, d; 2,382 个候选)。在可靠的角点锚点下,投票聚合解码在验证之前就已经很干净 (a),a-contrario 测试仅移除少量虚假残留 (b; 保留 673 个线段)。在弱自派生锚点下,未验证的解码退化为密集的虚假结构 (c),但 a-contrario 测试恢复了几乎相同的线段 (d; 保留 675 个,拒绝 72%)。任一安全机制单独使用即已足够;只有当两者都被移除时,解码才会失败。结合发现 1,这解释了为什么边界目标可以从头开始稳健地引导启动。

设置。图像被调整大小为 $512 \times 512$,边界场定义在输出步长为 2 处,每个通道归一化到 $[0, 1]$:距离通道由支持阈值 $\tau_d$(在场分辨率下为 5 像素)归一化,三个角度通道由其角度范围归一化(第 3.3 节)。角点由预训练期间使用的冻结角点检测器生成(第 3.4 节),并在所有抽样中保持固定。

抽样。对于每次抽样,场通道按位置独立同分布地从 $U(0, 1)$ 中采样,亚像素细化偏移量设为零。在图 3 的底行中,所有通道都是随机的,包括定向每个位置弦提议的方向通道 $\theta$;随机定向的提议很少达成一致,因此解码后的线段保持较短,但它们仍然锚定在角点上。在顶行中,仅用无参数引导替换 $\theta$,该引导不携带任何学习信息:即图像的水平线方向,即局部强度梯度的正交方向,这是经典 a-contrario 线检测的基础 [14, 47]。共线水平线被分组为线支持区域 [47],生成的线段被渲染为边界场(第 3.3 节的提升),该渲染的 $\theta$ 通道替换随机抽样;距离和端点通道保持随机。

解码。解码遵循第 3.4 节,但禁用 a-contrario 验证:每个位置根据其属性 $(d, \theta, \phi_1, \phi_2)$ 提出一个弦,提议的端点连接到最近的角点,在每个角点对上累积投票,具有足够投票的对成为解码后的线段。图 3 的五列是独立抽样,在最小投票计数从 2 到 10 扫描时渲染;解码后的线段在抽样和扫描过程中基本保持不变。因此,$d, \phi_1$ 和 $\phi_2$ 中的随机性完全被角点锚定和投票聚合所吸收,而方向通道控制恢复的完整性:完全随机的场仍然锚定在角点上,但仅产生短片段(底行),而无参数水平线引导恢复了完整的线段(顶行)。

B a-contrario 验证

a-contrario 框架 [14, 47] 形式化了赫尔姆霍茨原理:几何结构仅在它在一个不含结构的零模型下极不可能出现时才有意义。对于具有 $n$ 个支持像素的候选线段,其中 $k$ 个像素的方向与线段在容差范围内对齐,误报数 (NFA) 为

$$ \text{NFA}(n, k) = N_t \cdot \sum_{i=k}^{n} \binom{n}{i} p^i (1 – p)^{n-i}, \quad (11) $$

26

第 27 页

其中 $p$ 是像素偶然与线段对齐的概率,$N_t$ 是测试候选者的数量。当且仅当 NFA $\le \varepsilon$ 时接受该线段;规范选择 $\varepsilon = 1$(平均每张图像最多一次误报)使得该测试基本上无需参数。零假设(方向均匀分布)恰好是我们类别边界场中各 bin 的均匀分布(第 3.3 节)。

经典测试为何无法并行化。在 LSD [47] 中,候选者构建与验证是纠缠在一起的。候选矩形仅在贪婪区域生长遍历之后才存在:从高梯度种子像素开始,该区域吸收其水平线方向在容差范围内一致的邻居,并将它们标记为已消耗,以便后续种子无法重用它们;随后对生长出的区域拟合矩形并提交给 NFA 测试。区域是一个接一个地生长的,结果依赖于种子顺序,且控制流在每个像素处分支,这就是为什么 a-contrario 检测器一直保持着串行 CPU 设计的原因。

角点锚定将候选者与验证解耦。我们的流水线在不进行任何分组的情况下获得候选集。由于边界场是故意冗余的,完整的弦提议(包含两个端点)可以在每个位置密集读取(第 3.3 节)。角点随后锚定这些提议:批量线段匹配器将每个提议的两个端点 snapped 到最近的角点,成对距离计算被融合到 argmin 归约中,从而使内存保持与提议数量呈线性关系,并且每个角点对累积分配给它的提议的投票。候选集仅仅是生成的角点对图。验证因此成为一种纯粹的单候选者归约,没有共享状态:每个候选者一个 GPU 线程在其线段周围的固定宽度矩形内计算支持度和对齐像素数,并评估上述二项式尾概率,因此训练批次中的所有候选线段都可以并行验证(第 4.2 节)。这种解耦、密集的端点读取以及用角点锚定替代区域生长,使得 a-contrario 验证足够廉价,可以在每次迭代的训练循环中运行。

实现常数。方向证据是图像的水平线场,使用 LSD 的 $2 \times 2$ 有限差分梯度在灰度视图上计算,并在全局裁剪图像上批量处理;梯度幅值可忽略的像素被标记为未定义,且从不计入对齐像素。每个候选者使用固定宽度为 3 像素的矩形,方向以 $\pi$ 为模进行比较,对齐容差为 $\pi/16$,即 $p = 1/16$,比 LSD 的 $\pi/8$ 更严格。我们保留经典测试数量 $N_t = (HW)^{5/2}$,这是所有可能矩形的上界;这对仅包含角点对的候选集来说是保守的,并且我们省略了 LSD 为其宽度细化添加的额外因子,因为我们的宽度是固定的。接受阈值为规范值 $\varepsilon = 1$,且在对尾概率进行评估之前,对齐像素密度低于 0.5 的候选者将被拒绝。在预训练期间,该测试在每次迭代中对每个解码出的线段运行,并且保留少于 10 个验证线段的图像将在该迭代中被排除在边界损失之外。当方向证据取自模型自身的边界场而非图像梯度时(如图 1 所示的边界标记的验证方式),相同的归约过程保持不变。

参考文献

[1] Mahmoud Assran, Quentin Duval, Ishan Misra, Piotr Bojanowski, Pascal Vincent, Michael Rabbat, Yann LeCun, and Nicolas Ballas. Self-supervised learning from images with a joint-embedding predictive architecture. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023.

[2] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Mojtaba Komeili, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, Sergio Arnaud, Abha Gejji, Ada Martin, Francois Robert Hogan, Daniel Dugas, Piotr Bojanowski, Vasil Khalidov, Patrick Labatut, Francisco Massa, Marc Szafraniec, Kapil Krishnakumar, Yong Li, Xiaodong Ma, Sarath Chandar, Franziska Meier, Yann LeCun, Michael Rabbat, and Nicolas Ballas. V-JEPA 2: Self-supervised video models enable understanding, prediction and planning. arXiv preprint arXiv:2506.09985, 2025.

[3] Randall Balestriero and Yann LeCun. LeJEPA: Provable and scalable self-supervised learning without the heuristics. arXiv preprint arXiv:2511.08544, 2025.

[4] Hangbo Bao, Li Dong, Songhao Piao, and Furu Wei. BEiT: BERT pre-training of image transformers. In International Conference on Learning Representations (ICLR), 2022.

[5] Adrien Bardes, Quentin Garrido, Jean Ponce, Xinlei Chen, Michael Rabbat, Yann LeCun, Mido Assran, and Nicolas Ballas. Revisiting feature prediction for learning visual representations from video. Transactions on Machine Learning Research, 2024, 2024.

27

第 28 页

[6] Daniel Bolya, Po-Yao Huang, Peize Sun, Jang Hyun Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, Hanoona Rasheed, Junke Wang, Marco Monteiro, Hu Xu, Shiyu Dong, Nikhila Ravi, Daniel Li, Piotr Dollár, and Christoph Feichtenhofer. Perception encoder: The best visual embeddings are not at the output of the network. In Advances in Neural Information Processing Systems (NeurIPS), 2025.

[7] John Canny. A computational approach to edge detection. IEEE Transactions on Pattern Analysis and Machine Intelligence, 8(6):679–698, 1986.

[8] Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, and André Araujo. TIPSv2: Advancing vision-language pretraining with enhanced patch-text alignment. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026.

[9] Mathilde Caron, Hugo Touvron, Ishan Misra, Hervé Jégou, Julien Mairal, Piotr Bojanowski, and Armand Joulin. Emerging properties in self-supervised vision transformers. In IEEE/CVF International Conference on Computer Vision (ICCV), 2021.

[10] Ting Chen, Simon Kornblith, Mohammad Norouzi, and Geoffrey Hinton. A simple framework for contrastive learning of visual representations. In International Conference on Machine Learning (ICML), 2020.

[11] Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Rehfeld, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, and Bernt Schiele. The Cityscapes dataset for semantic urban scene understanding. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 3213–3223, 2016.

[12] Paul Couairon, Loick Chambon, Louis Serrano, Jean-Emmanuel Haugeard, Matthieu Cord, and Nicolas Thome. JAFAR: Jack up any feature at any resolution. In Advances in Neural Information Processing Systems (NeurIPS), 2025.

[13] Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li, and Li Fei-Fei. ImageNet: A large-scale hierarchical image database. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 248–255, 2009.

[14] Agnès Desolneux, Lionel Moisan, and Jean-Michel Morel. Meaningful alignments. International Journal of Computer Vision, 40(1):7–23, 2000.

[15] Piotr Dollár and C. Lawrence Zitnick. Fast edge detection using structured forests. IEEE Transactions on Pattern Analysis and Machine Intelligence, 37(8):1558–1570, 2015.

[16] Mark Everingham, Luc Van Gool, Christopher K. I. Williams, John M. Winn, and Andrew Zisserman. The Pascal visual object classes (VOC) challenge. International Journal of Computer Vision, 88(2):303–338, 2010.

[17] David Fan, Shengbang Tong, Jiachen Zhu, Koustuv Sinha, Zhuang Liu, Xinlei Chen, Michael Rabbat, Nicolas Ballas, Yann LeCun, Amir Bar, and Saining Xie. Scaling language-free visual representation learning. In IEEE/CVF International Conference on Computer Vision (ICCV), 2025.

[18] Andreas Geiger, Philip Lenz, and Raquel Urtasun. Are we ready for autonomous driving? The KITTI vision benchmark suite. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 3354–3361, 2012.

[19] Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, and Ross Girshick. Masked autoencoders are scalable vision learners. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022.

[20] Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross Girshick. Momentum contrast for unsupervised visual representation learning. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020.

[21] Kun Huang, Yifan Wang, Zihan Zhou, Tianjiao Ding, Shenghua Gao, and Yi Ma. Learning to parse wireframes in images of man-made environments. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 626–635, 2018.

[22] HyunJun Jung, Patrick Ruhkamp, Guangyao Zhai, Nikolas Brasch, Yitong Li, Yannick Verdie, Jifei Song, Yiren Zhou, Anil Armagan, Slobodan Ilic, Ales Leonardis, and Benjamin Busam. Is my depth ground-truth good enough? HAMMER – highly accurate multi-modal dataset for DEnse 3D scene regression. arXiv preprint arXiv:2205.04565, 2022.

[23] Zeran Ke, Bin Tan, Xianwei Zheng, Yujun Shen, Tianfu Wu, and Nan Xue. ScaleLSD: Scalable deep line segment detection streamlined. In IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 6327–6336, 2025.

[24] Tobias Koch, Lukas Liebel, Marco Körner, and Friedrich Fraundorfer. Comparison of monocular depth estimation methods using geometrically relevant metrics on the IBims-1 dataset. Computer Vision and Image Understanding, 191:102877, 2020.

[25] Minghuan Liu, Zhengbang Zhu, Xiaoshen Han, Peng Hu, Haotong Lin, Xinyao Li, Jingxiao Chen, Jiafeng Xu, Yichu Yang, Yunfeng Lin, Xinghang Li, Yong Yu, Weinan Zhang, Tao Kong, and Bingyi Kang. Manipulation as in simulation: Enabling accurate geometry perception in robots. arXiv preprint arXiv:2509.02530, 2025.

28

第 29 页

[26] Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun, 和 Randall Balestriero。LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构。arXiv 预印本 arXiv:2603.19312,2026。

[27] Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, 和 Adrien Bardes。V-JEPA 2.1:解锁视频自监督学习中的密集特征。arXiv 预印本 arXiv:2603.14482,2026。

[28] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy V. Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mido Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jégou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski。DINOv2:在无监督情况下学习鲁棒的视觉特征。机器学习研究汇刊 (Transactions on Machine Learning Research),2024,2024。

[29] Rémi Pautrat, Daniel Barath, Viktor Larsson, Martin R. Oswald, 和 Marc Pollefeys。DeepLSD:利用深度图像梯度进行线段检测与细化。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 17327–17336 页,2023。

[30] Jordi Pont-Tuset, Federico Perazzi, Sergi Caelles, Pablo Arbeláez, Alexander Sorkine-Hornung, 和 Luc Van Gool。2017 DAVIS 视频对象分割挑战赛。arXiv 预印本 arXiv:1704.00675,2017。

[31] Qwen Team。Qwen3.5:迈向原生多模态智能体,2026年2月。

[32] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, 和 Ilya Sutskever。从自然语言监督中学习可迁移视觉模型。在国际机器学习会议 (ICML) 上,2021。

[33] René Ranftl, Alexey Bochkovskiy, 和 Vladlen Koltun。用于密集预测的视觉变换器。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2021。

[34] Mike Ranzinger, Greg Heinrich, Jan Kautz, 和 Pavlo Molchanov。AM-RADIO:聚合视觉基础模型——将所有领域归一化。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2024。

[35] Tal Ridnik, Emanuel Ben Baruch, Asaf Noy, 和 Lihi Zelnik-Manor。面向大众的 ImageNet-21K 预训练。在神经信息处理系统进展 (NeurIPS) 数据集与基准测试轨道上,2021。

[36] Shreeyak S. Sajjan, Matthew Moore, Mike Pan, Ganesh Nagaraja, Johnny Lee, Andy Zeng, 和 Shuran Song。ClearGrasp:用于操作任务的透明物体三维形状估计。在 IEEE 机器人与自动化国际会议 (ICRA) 上,第 3634–3642 页,2020。

[37] Thomas Schöps, Johannes L. Schönberger, Silvano Galliani, Torsten Sattler, Konrad Schindler, Marc Pollefeys, 和 Andreas Geiger。具有高分辨率图像和多相机视频的多视图立体基准。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 2538–2547 页,2017。

[38] Nathan Silberman, Derek Hoiem, Pushmeet Kohli, 和 Rob Fergus。来自 RGBD 图像的室内分割与支持推断。在欧洲计算机视觉会议 (ECCV) 上,第 746–760 页,2012。

[39] Oriane Siméoni, Huy V. Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Michaël Ramamonjisoa, Francisco Massa, Daniel Haziza, Luca Wehrstedt, Jianyuan Wang, Timothée Darcet, Théo Moutakanni, Leonel Sentana, Claire Roberts, Andrea Vedaldi, Jamie Tolan, John Brandt, Camille Couprie, Julien Mairal, Hervé Jégou, Patrick Labatut, 和 Piotr Bojanowski。DINOv3。机器学习研究汇刊 (Transactions on Machine Learning Research),2026。

[40] Irwin Sobel 和 Gary Feldman。用于图像处理的 3 × 3 各向同性梯度算子。斯坦福人工智能项目,1968。

[41] Shuran Song, Samuel P. Lichtenberg, 和 Jianxiong Xiao。SUN RGB-D:RGB-D 场景理解基准套件。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 567–576 页,2015。

[42] Bin Tan, Changjiang Sun, Xiage Qin, Hanat Adai, Zelin Fu, Tianxiang Zhou, Han Zhang, Yinghao Xu, Xing Zhu, Yujun Shen, 和 Nan Xue。用于空间感知的掩码深度建模。在欧洲计算机视觉会议 (ECCV) 上,2026。

[43] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier Hénaff, Jeremiah Harmsen, Andreas Steiner, 和 Xiaohua Zhai。SigLIP 2:具有改进语义理解、定位和密集特征的多语言视觉-语言编码器。arXiv 预印本 arXiv:2502.14786,2025。

29

第 30 页

[44] Igor Vasiljevic, Nicholas I. Kolkin, Shanyi Zhang, Ruotian Luo, Haochen Wang, Falcon Z. Dai, Andrea F. Daniele, Mohammadreza Mostajabi, Steven Basart, Matthew R. Walter, 和 Gregory Shakhnarovich。DIODE:一个密集室内外深度数据集。arXiv 预印本 arXiv:1908.00463,2019。

[45] Shashanka Venkataramanan, Valentinos Pariza, Mohammadreza Salehi, Lukas Knobel, Spyros Gidaris, Elias Ramzi, Andrei Bursuc, 和 Yuki M. Asano。Franca:用于可扩展视觉表示学习的嵌套套娃聚类。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,2026。

[46] Massimiliano Viola, Kevin Qu, Nando Metzger, Bingxin Ke, Alexander Becker, Konrad Schindler, 和 Anton Obukhov。 Marigold-DC:带有引导扩散的零样本单目深度补全。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,第 5359–5370 页,2025。

[47] Rafael Grompone von Gioi, Jérémie Jakubowicz, Jean-Michel Morel, 和 Gregory Randall。LSD:一种具有误检控制的快速线段检测器。IEEE 模式分析与机器智能汇刊,32(4):722–732,2010。

[48] Ruicheng Wang, Sicheng Xu, Cassie Dai, Jianfeng Xiang, Yu Deng, Xin Tong, 和 Jiaolong Yang。MoGe:通过最佳训练监督解锁开放域图像的单目几何估计。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 5261–5271 页,2025。

[49] Yi Wang, Kunchang Li, Xinhao Li, Jiashuo Yu, Yinan He, Guo Chen, Baoqi Pei, Rongkun Zheng, Zun Wang, Yansong Shi, Tianxiang Jiang, Songze Li, Jilan Xu, Hongjie Zhang, Yifei Huang, Yu Qiao, Yali Wang, 和 Limin Wang。InternVideo2:扩展多模态视频理解的基础模型。在欧洲计算机视觉会议 (ECCV) 上,2024。

[50] Zehan Wang, Siyu Chen, Lihe Yang, Jialei Wang, Ziang Zhang, Hengshuang Zhao, 和 Zhou Zhao。Depth Anything with any prior。arXiv 预印本 arXiv:2505.10565,2025。

[51] Frederik Warburg, Søren Hauberg, Manuel López-Antequera, Pau Gargallo, Yubin Kuang, 和 Javier Civera。Mapillary 街道级序列:一个用于终身地点识别的数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 2623–2632 页,2020。

[52] Bowen Wen, Matthew Trepte, Joseph Aribido, Jan Kautz, Orazio Gallo, 和 Stan Birchfield。FoundationStereo:零样本立体匹配。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 5249–5260 页,2025。

[53] Tobias Weyand, André Araújo, Bingyi Cao, 和 Jack Sim。Google Landmarks Dataset v2 – 一个用于实例级识别和检索的大规模基准。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 2572–2581 页,2020。

[54] Alex Wong, Xiaohan Fei, Stephanie Tsuei, 和 Stefano Soatto。来自视觉惯性里程计的无监督深度补全。IEEE 机器人与自动化快报,5(2):1899–1906,2020。

[55] Saining Xie 和 Zhuowen Tu。全嵌套边缘检测。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,第 1395–1403 页,2015。

[56] Ning Xu, Linjie Yang, Yuchen Fan, Dingcheng Yue, Yuchen Liang, Jianchao Yang, 和 Thomas S. Huang。YouTube-VOS:一个大规模视频对象分割基准。arXiv 预印本 arXiv:1809.03327,2018。

[57] Nan Xue, Song Bai, Fudong Wang, Gui-Song Xia, Tianfu Wu, 和 Liangpei Zhang。学习吸引场表示以实现鲁棒的线段检测。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 1595–1603 页,2019。

[58] Nan Xue, Tianfu Wu, Song Bai, Fu-Dong Wang, Gui-Song Xia, Liangpei Zhang, 和 Philip H. S. Torr。全吸引线框解析。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 2785–2794 页,2020。

[59] Nan Xue, Tianfu Wu, Song Bai, Fu-Dong Wang, Gui-Song Xia, Liangpei Zhang, 和 Philip H. S. Torr。全吸引线框解析:从监督学习到自监督学习。IEEE 模式分析与机器智能汇刊,45(12):14727–14744,2023。

[60] Lihe Yang, Shang-Wen Li, Yang Li, Xinjie Lei, Dong Wang, Abdelrahman Mohamed, Hengshuang Zhao, 和 Hu Xu。追求视觉预训练的像素监督。arXiv 预印本 arXiv:2512.15715,2025。

[61] Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, 和 Lucas Beyer。用于语言图像预训练的 Sigmoid 损失。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2023。

[62] Bolei Zhou, Hang Zhao, Xavier Puig, Sanja Fidler, Adela Barriuso, 和 Antonio Torralba。通过 ADE20K 数据集进行场景解析。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上,第 5122–5130 页,2017。

[63] Gaoyue Zhou, Hengkai Pan, Yann LeCun, 和 Lerrel Pinto。DINO-WM:基于预训练视觉特征的世界模型实现零样本规划。在国际机器学习会议 (ICML) 上,2025。

30

第 31 页

[64] Jinghao Zhou, Chen Wei, Huiyu Wang, Wei Shen, Cihang Xie, Alan Yuille, 和 Tao Kong。iBOT:使用在线分词器的图像 BERT 预训练。在国际学习表征会议 (ICLR),2022。

[65] Yichao Zhou, Haozhi Qi, 和 Yi Ma。端到端线框解析。在 IEEE/CVF 国际计算机视觉会议 (ICCV),第 962–971 页,2019。

[66] Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, 和 Desheng Zhang。从任意到完整:通过提示 Depth Anything 在一阶段内完成深度补全。arXiv 预印本 arXiv:2603.05711,2026。

[67] Yiming Zuo, Willow Yang, Zeyu Ma, 和 Jia Deng。OMNI-DC:具有多分辨率深度集成的高度鲁棒深度补全。在 IEEE/CVF 国际计算机视觉会议 (ICCV),第 9287–9297 页,2025。

31

发表评论