SILICA:如何用扩散模型让机器人看清玻璃?

快速导读:SILICA利用CLIP条件化的扩散模型先验,联合预测玻璃分割掩码和深度,无需真实玻璃深度标注即可实现高精度的透明表面感知和机器人导航。

透明表面感知是机器人导航中的长期痛点。传统LiDAR和RGB-D传感器因红外透明性和反射问题,无法提供准确的玻璃深度,导致机器人可能撞击透明障碍物。尽管单目深度估计模型取得了进展,但它们在玻璃上通常预测背景深度,而专用模型受限于领域狭窄和标注稀缺。

SILICA提出了一种新颖的解决方案,利用扩散模型先验进行联合玻璃分割和深度估计。该方法无需真实的玻璃深度标注,而是通过合成深度先验和真实分割掩码进行训练。通过CLIP条件化机制和最小二乘优化,SILICA实现了高精度的透明表面感知,为机器人导航提供了新的可能性。

英文题目:SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

论文出处:arXiv 每日论文精选 · arXiv:2607.24249

原始论文:PDF / 论文页面

对应视频标题:SILICA:如何用扩散模型让机器人看清玻璃?|推荐指数:★★★★★

这篇论文解决什么问题?

标准深度传感器在透明表面上失效,因为红外光穿透玻璃,导致深度读数缺失或错误。这不仅在室内导航中造成危险,也限制了服务机器人的应用范围。现有的学习方法依赖于大量的真实玻璃深度标注,但这些数据极其稀缺且难以获取。

此外,通用单目深度估计模型如Depth Anything V2在玻璃上表现不佳,因为它们缺乏对透明表面的特定先验。专用模型如GW-Depth虽然针对玻璃优化,但泛化能力有限。因此,需要一种能够利用丰富先验知识且对标注依赖较少的方法。

扩散模型在图像生成中展现了强大的空间先验能力,但通常用于生成而非密集预测。SILICA的创新在于将这些先验重新用于感知任务,特别是解决玻璃分割和深度估计中的前景-背景模糊问题。

核心创新

方法概览

现有方法要么依赖稀缺的真实玻璃深度标注,要么缺乏对透明表面的特定先验。扩散模型拥有强大的空间先验,但未被有效用于此类感知任务。

  • SILICA采用共享U-Net架构,从Stable Diffusion微调而来。该架构同时处理玻璃分割和深度估计任务,通过共享特征提取器提高效率。
  • 引入CLIP条件化交叉注意力机制,用于任务切换。通过不同的CLIP文本嵌入(如“glass segmentation”和“depth estimation”),模型能够区分任务,避免任务纠缠。
  • 预测仿射不变深度和分割掩码。仿射不变深度意味着预测的深度值在尺度上不确定,需要通过后续步骤校准。
  • 利用标准深度传感器在非玻璃区域的可靠读数,通过最小二乘优化将仿射不变深度校准为度量级深度。这一过程过滤掉了玻璃区域的无效传感器读数。
  • 训练数据包括真实世界的分割掩码和合成深度数据。这种混合策略减少了对真实玻璃深度标注的依赖,同时利用了合成数据的丰富性。

逐图理解论文

失效直觉

失效直觉
Fig. 1. (Left) Conventional depth cameras and LiDAR sensors do not provide correct depth to glass, leading to misinformed mapping and navigation, potentially allowing robots to collide with transparent structures. (Right) SILICA overcomes this inherent limitation by jointly segmenting glass in an image and predicting accurate metric depth, allowing our robot to identify the correct open door and plan a safe path.

左图显示传统深度传感器在玻璃上的失效,导致映射错误和导航危险。右图展示SILICA如何准确分割玻璃并预测深度,使机器人能够识别正确的门并规划安全路径。这直观地说明了问题的严重性和解决方案的有效性。

核心贡献

核心贡献
Fig. 2. SILICA Pipeline Overview. Our framework employs a shared U-Net architecture for joint glass segmentation and monocular depth estimation ˆzs, ˆzd. During Training (top), we employ a fixed timestep t = T joint latent regression loss LT using CLIP-conditioning cs,cd for task switching, where the latent U-Net learns to directly predict the annotation latents zs,zd from input latents zxs,zxd . During Inference (bottom), the model simultaneously predicts task-specific latents, which are decoded and processed through a least-squares optimization to recover aligned metric depth for transparent surfaces.

上图展示训练过程,使用固定时间步长t=T的联合潜在回归损失LT,并通过CLIP条件化cs,cd进行任务切换。下图展示推理过程,模型同时预测任务特定的潜在变量,解码后通过最小二乘优化恢复对齐的度量深度。这揭示了方法的核心机制。

最强结论

最强结论
Fig. 5. Qualitative comparison of glass segmentation and depth prediction. SILICA can jointly predict glass segmentation and glass-aware depth estimation precisely even in scenes with a busy background (seen in row 1), a half-open glass door (seen in row 2), and a glass window (seen in row 3). SILICA shows consistent performance in all these samples, even in the midst of saliency. The joint prediction approach also helps it correctly identify and predict depth to challenging open/closed doors where other methods hallucinate flat glass or miss the door (row 2).

第一行显示在复杂背景下的精确预测,第二行显示半开玻璃门的处理,第三行显示玻璃窗的预测。SILICA在所有样本中表现一致,即使在显著性干扰下也能正确识别和预测深度。这证明了其在挑战性场景中的鲁棒性。

实验如何设计?

  • 评估数据集包括Mirage 18k(新数据集)、GW-Depth、NYUv2、GDD、3DRef和Trans10k。Mirage 18k提供了多样化的玻璃类型和场景。
  • 基线模型包括Lotus-D、Depth Anything V2、GW-Depth、TransLab、EBLNet和SAM3。这些模型代表了当前最先进的通用和专用方法。
  • 消融实验研究了CLIP条件化与位置编码的影响,以及训练数据中玻璃场景的作用。这些实验验证了关键设计选择的有效性。

关键结果与论文证据

  • 在GDD数据集上,SILICA达到91.60 mIoU,优于TransLab(88.07)和SAM3(65.69)。这表明其在玻璃分割上的优越性。
  • 在Mirage 18k深度测试集上,SILICA的AbsRel为18.04,显著优于Depth Anything V2(25.78)和GW-Depth(24.39)。这证明了其在深度估计上的准确性。
  • 在GW-Depth数据集上,SILICA的AbsRel为4.4,优于GW-Depth(10.0)和Depth Anything V2(5.08)。这进一步验证了其泛化能力。
  • 如果不过滤无效的玻璃传感器点,AbsRel误差会飙升至>85%。这强调了最小二乘校准步骤的重要性。
  • 在NVIDIA RTX 3060 GPU上,推理速度约为5 Hz。这表明该方法在实时应用中具有可行性。

阅读时需要注意

  • 依赖标准深度传感器进行度量校准,要求非玻璃区域提供可靠深度。如果非玻璃区域也缺乏深度信息,校准将失败。
  • 训练需要混合真实分割数据和合成深度数据,引入了领域差异。这可能导致在真实世界中的性能下降。
  • 如果玻璃后的背景与玻璃表面视觉上无法区分,性能可能会下降。这限制了其在极端复杂场景中的应用。

关联工作

  • GW-Depth是玻璃深度估计的领域特定基线,但泛化能力有限。SILICA通过扩散先验提高了泛化能力。
  • Marigold是先前利用扩散模型进行深度估计的工作,但未专门针对玻璃优化。SILICA通过联合分割和条件化机制解决了这一问题。
  • SAM3是先进的分割模型,但在玻璃上表现不佳。SILICA通过联合学习提高了玻璃分割的准确性。
  • Depth Anything V2是通用单目深度估计器,在透明表面上失效。SILICA通过专用先验克服了这一限制。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

SILICA:复用扩散先验以联合进行玻璃分割与深度估计

Tarun R1, Anuj Verma1, Laksh Nanwani1, Sourav Garg1, K. Madhava Krishna1

2026 7月 27日

图 1.(左)传统的深度相机和 LiDAR 传感器无法提供玻璃的正确深度,导致映射和导航信息错误,可能导致机器人撞向透明结构。(右)SILICA 通过联合分割图像中的玻璃并预测准确的度量深度,克服了这一固有局限,使我们的机器人能够识别正确的开门并规划安全路径。[cs.CV] 摘要— 标准深度传感器在透明表面环境中系统性地失效,产生损坏的 3D 地图和严重的导航隐患。虽然专用硬件传感器可以检测玻璃,但它们缺乏模块化且具有广泛的硬件依赖。因此,基于学习的单目深度估计成为一种引人注目的替代方案。然而,特定于领域的玻璃感知单目深度估计器在不熟悉的室内布局中表现不佳;受限于现实世界玻璃深度标注的严重稀缺,它们无法零样本泛化到新场景。这促使我们探索文本到图像扩散模型的广泛先验是否能够实现对透明表面的可泛化感知。我们引入了 SILICA,这是一种统一的流水线,利用这些先验联合预测玻璃分割和玻璃感知深度。这种相互信息交换建立了稳健的空间层次结构,完全消除对配对现实世界玻璃深度标注的需求。随后,我们使用预测的分割掩码从标准传感器中显式过滤出正确的玻璃深度点,恢复准确的度量玻璃深度,用于下游 3D 映射和自主避障。得益于我们新颖的 Mirage 18k 数据集,大量实验表明,SILICA 在多种未见场景中实现了显著的零样本迁移,比最先进模型性能高出近 20%,并为透明表面感知设立了新基准。

I. 引言

感知透明结构(如玻璃板、门和隔断)仍然是机器人感知中一项基本但极具挑战性的任务。虽然恢复准确的 3D 场景几何对于安全导航和 SLAM 至关重要,但标准深度传感器(如 LiDAR、RGB-D 和立体相机)由于镜面反射、折射和视觉模糊,在这些表面上失效。尽管专用声学传感器提供了一种硬件解决方案,但其稀疏的输出和严格的校准依赖使其本质上不可靠。因此,基于学习的单目深度估计已成为一种突出的软件替代方案。近期工作引入了专门的玻璃感知网络 [1],在配对的 RGB 和度量深度图集合上进行监督训练。不幸的是,收集现实世界玻璃标注极具挑战性,这限制了这些模型在狭窄领域内的应用,导致它们在泛化到不熟悉场景时表现不佳。

早期的基于学习的方法试图通过预测 2D 边界分割掩码来解决这一问题 [2], [3], [4], [5],

1 机器人研究中心 (RRC),印度理工学院海德拉巴分校 项目页面 – https://silica-mirage.github.io/ 代码 – https://github.com/rtarun1/Silica 数据集 – Mirage18k

第 2 页

但这些方法缺乏导航所需的显式 3D 几何上下文。最近,基础单目深度估计器 [6] 的出现极大地提升了场景理解能力。然而,在面对复杂的透明结构时,这些基础深度估计器往往表现不佳。在我们的实验中,当玻璃后方可见显著特征时,这些方法 consistently 失败,预测的是背景而非玻璃本身的物理表面深度。

我们的核心直觉是,准确感知透明结构需要解决这些表面固有的严重前景-背景歧义。我们假设,联合学习玻璃分割和单目深度估计可以提供一种互利共赢的解决方案。基于此假设,我们认为推断出的玻璃掩码可以作为显式空间特征来引导表面深度,而几何深度上下文将帮助分割网络将玻璃前方的物体与可见背景隔离开来。然而,尝试这种双任务框架暴露出严重的领域差异:现有的玻璃分割数据集完全由真实世界图像组成,而密集、无伪影的深度监督则需要合成数据 [7]。虽然专注于 3D 的数据集 [11], [12], [13] 提供了密集深度,但仅限于小型桌面物体。近期尝试捕捉真实世界平面玻璃深度的方法,如 GWDepth [1],在规模和多样性上受到严重限制(仅包含约 1,200 个样本)。这种缺乏配对、多样化的真实世界 3D 玻璃数据的情况,从根本上推动了 SILICA 的训练策略,该策略通过桥接真实世界分割掩码与合成深度标注,解决了这一问题。

II. 相关工作

A. 透明表面分割

传统感知透明表面的方法通常将问题框架为 2D 分割任务。以边界为中心模型 [2], [3] 依赖玻璃边缘的高视觉对比度,但在无框门或边缘线索稀缺的复杂玻璃板中失效。相反,基于上下文的网络 [4], [5] 利用高级语义共现,但在透过玻璃可见的复杂杂乱背景面前也失效。即使是最近最先进的模型如 SAM3 [10],在玻璃表面后方存在显著特征时也会遇到困难。

B. 透明玻璃数据集

现有的玻璃分割数据集 [3], [4], [5] 提供了视觉多样性,但仅提供 2D 分割掩码,缺乏度量深度标注。为了弥合这一领域差距并实现通用感知,我们引入了 SILICA:一个利用文本到图像扩散模型 [8] 丰富先验的统一管道。为了管理这种双任务框架,我们通过将特定任务的文本嵌入直接注入 U-Net 的预训练交叉注意力层,利用了网络固有的 CLIP [9] 条件化机制。这种显式路由促进了鲁棒的跨模态互信息交换,使得真实世界分割特征能够自然地引导合成仿射不变深度估计,反之亦然。这绕过了对配对真实世界玻璃深度标注的需求。

C. 单目深度估计方法

在“野外”估计深度指的是在广泛(可能是不熟悉的)设置中成功的方法。虽然早期方法预测相对深度,但其有限的几何效用推动了对仿射不变深度的转变,后者恢复的结构仅相差一个未知的全局缩放和偏移。最近,基础模型 [6], [14] 通过在大规模合成和伪标签数据集上训练大规模判别性架构,实现了卓越的仿射不变零样本性能。然而,尽管拥有如此庞大的数据覆盖,这些模型仍然无法解决复杂设置中透明表面的深度问题,错误地预测可见背景。

D. 基于扩散的单目深度估计

与从头训练大规模网络不同,最先进的方法重新利用了像 Stable Diffusion 这样的文本到图像潜在扩散模型 (LDMs) 的百科全书式空间先验。LDMs 在压缩的潜在空间中运行,隐式地从互联网规模的数据中捕获复杂的结构层次。Marigold [15] 和 GeoWizard [16] 等突破成功地将这些生成先验适应于仿射不变深度,实现了引人注目的零样本泛化,同时支持高度资源高效的微调。然而,与这些以前系统性地丢弃多模态条件化通道的先前方法不同,

• Mirage 18k 数据集:一个新颖的数据集,包含 18,353 张复杂的室内 RGB 图像,配有二值玻璃分割掩码,以及一个包含 2,406 个样本的评估子集,对应透明表面的真实度量深度。

为了满足机器人的延迟约束,我们将迭代生成过程压缩为一个高效的一步确定性潜在回归模型。在真实世界部署中,SILICA 有效利用其预测的掩码,从标准深度传感器中过滤掉透明表面上的错误读数。然后使用剩余的可靠非玻璃点,将我们的仿射不变预测对齐为准确的玻璃感知度量深度。因此,SILICA 表现出卓越的零样本泛化能力,并在复杂的室内环境中达到了最先进性能。

我们的主要贡献总结如下:

• SILICA 管道:一个高效的一步联合感知框架,利用文本到图像扩散先验。通过利用 CLIP 条件化交叉注意力,它驱动真实世界分割和合成深度路径之间的鲁棒互信息传输,完全避免了对配对真实世界玻璃深度标注的需求。使 SILICA 为透明表面感知设定了新基准。在完全未见的环境中,我们的方法展示了卓越的零样本能力,在特定情况下比现有的最先进模型高出近 20%。

第 3 页

我们充分利用模型的全部架构能力。我们提出了一种定向微调协议,显式地重新利用这种条件对齐,从而为我们的联合任务实现了鲁棒的野外性能(如图 5 所示)。

III. 方法论

SILICA 的主要目标是初始接收单张输入图像 $x$,并联合预测玻璃分割掩码 $\hat{s}$ 以及感知玻璃的仿射不变深度图 $\hat{d}$。随后,这些联合预测结果被用于最小二乘优化框架中,以将 $\hat{d}$ 与从深度传感器获得的噪声度量深度样本 $d_{raw}$ 对齐。关键在于,预测的分割掩码 $\hat{s}$ 用于在此对齐过程中显式地过滤掉透明表面上的错误传感器深度测量值,最终生成具有玻璃结构的准确 3D 度量深度图,以供下游任务使用。完整的 SILICA 流程概述如图 2 所示。

A. 潜在回归

对于扩散训练,扩散损失函数 $L_t$ 有两种基本参数化形式:

1) $\epsilon$-预测:模型 $f_{\theta_t}$ 学习预测添加的噪声 $\epsilon$ [17]: $L_{\epsilon t} = \| \epsilon – f_{\theta_t}(z_{yt}, z_{x,t}) \|^2$

2) $x_0$-预测:模型 $f_{\theta}$ 学习直接预测干净的目标样本 $z_y$ [17]: $L_{z t} = \| z_y – f_{\theta_z}(z_{yt}, z_{x,t}) \|^2$

我们不仅要处理多模态数据,还要处理仿真和真实数据的混合。由于包含玻璃分割掩码和准确深度-玻璃标注的数据集存在局限性,我们的训练配置不可避免地引入了显著的域差异:我们的分割样本对 $(s, x_s)$ 完全由真实世界样本组成,而我们的深度样本 $(d, x_d)$ 完全是合成的。为了验证我们的核心假设,即联合训练能够实现互利的信息交换,从而推动我们两个目标的鲁棒零样本真实世界泛化,重要的是共享的 U-Net $f_\theta$ 能够有效处理这些模态和域差异。

受先前文献 [16], [21] 的启发,我们最初评估了一种利用单个 U-Net $f_\theta$ 通过任务切换器处理多模态数据的策略,记为 $s$。切换器 $s$ 是一个一维向量,标记不同的任务,$s \in \{s_d, s_s\}$(分别表示深度估计和分割),通过低维位置编码器映射并直接添加到网络的时间嵌入中。公式化为: $\hat{z}_d = f_\theta(z_{x_d}, t, s_d), \quad \hat{z}_s = f_\theta(z_{x_s}, t, s_s)$ (2)

然而,如第 V-D 节所述,这种配置会迅速崩溃。因此,为了建立更鲁棒的任务路由机制,我们重新审视了生成先验的核心架构。直观地说,对于像 Stable Diffusion 这样的文本到图像模型,它在互联网规模数据集上训练以执行高分辨率图像生成,并显式地由 CLIP [9] 编码的文本提示进行条件化,它必须在语言提示和视觉输出之间保持深刻的结构联系。然而,以前的单目深度估计器在很大程度上忽略了这种提示

B. 玻璃分割与深度估计的联合建模

使用相同 VAE 和解码器进行联合任务的合理性检查:虽然先前的工作 [15] 表明,冻结的 Stable Diffusion 变分自编码器 (VAE) $E$ 能够以低误差准确重建仿射不变深度图(尽管是在 RGB 上预训练的),但对于分割或分割与深度估计的联合建模,不能假设类似的复用。因此,我们进行初始合理性检查,以验证冻结的 VAE $E$ 和解码器 $D$ 是否能够准确重建二值玻璃分割。为此,我们将单通道真实掩码归一化到 VAE 的操作范围,即 $[-1, 1]$,并将其复制到三个通道以模拟 RGB 输入张量 $s$。然后,我们将其通过冻结的 VAE 编码器以获得其潜在表示 $z_s = E(s)$,为了恢复潜在的二值分割 $z_s$,我们立即将其通过冻结的解码器 $\hat{z}_s = D(z_s)$。随后,平均三个输出通道可得卓越的交并比均值 (mIoU) 为 99.97%,这表明潜在压缩和恢复可以以极小的误差完成。这使我们能够使用相同的 VAE 和解码器来训练多模态数据,而无需使用特定领域的编码器-解码器。

之前的文献 [18], [19] 指出,虽然 $\epsilon$-预测依赖于在噪声水平较高时严重放大输出方差的缩放系数,但 $x_0$-预测直接估计干净的目标样本,从而避免了这种不稳定性并产生更稳定的预测。此外,将时间步固定为 $t=T$ 消除了多步去噪过程中的误差传播可能性 [20]。然而,由于扩散模型的随机性质,向输入潜在层馈送随机噪声仍会为不同的随机种子产生略有不同的输出,这已被先前工作 [20] 经验性地证实。

对于我们的机器人感知任务,无论外部因素如何,保证一致的输出至关重要。因此,我们选择完全移除高斯噪声添加 $z_{yt}$。相反,我们在固定的时间步 $t=T$ 直接将图像潜在层 $z_x$ 馈送到 U-Net: $L_t = \| z_y – f_\theta(z_x, t) \|^2$. (1)

这种确定性公式确保了预测的一致性,并允许管道在数据有限的情况下更高效地训练和推理。

第 4 页

图 2. SILICA 流程概览。我们的框架采用共享 U-Net 架构进行联合玻璃分割和单目深度估计,输出 $\hat{z}_s, \hat{d}$。在训练阶段(顶部),我们使用固定时间步 $t = T$ 的联合潜在回归损失 $L_T$,利用 CLIP 条件化 $c_s, c_d$ 进行任务切换,其中潜在 U-Net 学习直接从输入潜在 $z_{xs}, z_{xd}$ 预测标注潜在 $z_s, z_d$。在推理阶段(底部),模型同时预测特定任务的潜在变量,这些潜在变量经解码并通过最小二乘优化处理,以恢复透明表面的对齐度量深度。

引导路径 [15], [16], [20], [21],输入空文本以路由网络特征,使其仅提取视觉特征。相比之下,我们提出了一种微调协议,以充分利用这种预训练的文图对齐。由于视觉合成模型本质上拥有对场景的深层结构理解,利用 CLIP 的共享嵌入空间进行任务条件化,为路由跨模态信息提供了显著更有效的机制。

为了提供鲁棒的全局引导,我们使用特定任务的文本提示显式地对每个路径进行条件化:$y_s = $ “predict glass segmentation” 和 $y_d = $ “predict depth map”。使用冻结的 CLIP 文本编码器 $\tau_\theta$,我们提取相应的文本嵌入 $c_s = \tau_\theta(y_s)$ 和 $c_d = \tau_\theta(y_d)$。与仅从头训练简单的向量以处理任务切换不同,我们将这些嵌入直接注入 U-Net 的预训练交叉注意力层中,如 Stable Diffusion 所示。这种方法将我们显式的任务指令无缝映射到网络的深层特征空间中,充分利用了在文本条件化上训练的 Stable Diffusion U-Net 丰富的预训练先验。

因此,我们最终的联合微调损失函数定义为: $L_T = \|z_s – f_\theta(z_{xs}, t, s_s, c_s)\|_2^2 + \|z_d – f_\theta(z_{xd}, t, s_d, c_d)\|_2^2$ (3)

如我们的实验结果(第五节)所示,我们的流程展示了令人印象深刻的零样本泛化能力,在玻璃分割和玻璃感知深度估计方面均优于最先进方法。

2) 玻璃表面的度量深度:来自 RGB-D 相机的原始传感器深度被转换为原始视差 $D'_{raw} = 1/D_{raw}$。随后,模型预测的仿射不变视差 $\hat{d}$ 和背景掩码 $M_{bg}$(排除了模型预测的玻璃区域)用于恢复全局尺度 $s$ 和偏移 $t$。这是通过对背景像素中的有效深度点求解线性最小二乘优化实现的: $\arg\min_{s,t} \sum_{i \in M_{bg}} (s \cdot \hat{d}_i + t – D'_{raw,i})^2$ (4)

一旦计算出 $s$ 和 $t$,我们将此仿射变换应用于整个预测视差图并取倒数,以恢复对齐的度量深度 $D_{aligned} = 1/(s \cdot \hat{d} + t)$。最后,我们通过保留背景中可靠的原始传感器深度并在预测的玻璃区域内注入我们对齐的度量预测,构建融合的玻璃感知深度图。这种合成策略完全解决了透明玻璃表面上的传感器故障伪影,从而生成准确的玻璃感知深度图。随后,使用已知的相机内参将深度图转换为点云。

IV. 评估

C. 推理与恢复玻璃的度量深度

1) 推理:在推理期间,输入 RGB 图像首先由冻结的编码器 $E$ 处理以提取图像潜在 $z_x$。然后将其与特定任务的 CLIP 文本嵌入($c_s$ 和 $c_d$)一起通过共享 U-Net。

IV. 评估

为了训练和评估用于联合玻璃分割和单目深度估计的 SILICA,我们针对每个任务使用单独的数据源,同时保持平衡的多任务监督。所有数据集和评估协议均为

第 5 页

组织为两个核心类别:玻璃分割和单目深度估计。在单张 Nvidia RTX 5090 GPU 卡上训练我们的方法直至收敛大约需要 1 天。

A. Mirage 18k

我们引入了 Mirage 18k 数据集,包含 18,353 张手动标注的图像,配有成对的二值分割掩码,涵盖 38 个独特场景。我们精心挑选了 12,420 个样本专门用于分割训练,3,527 个样本专门用于分割测试。为确保两组之间没有重叠,我们保证没有任何取自同一场景的数据同时出现在测试集和训练集中。剩余的 2,406 个样本包括成对的玻璃真实度量深度,除了二值分割掩码外,专门用于零样本深度和分割评估。我们的数据集捕捉了野生环境中多样化的玻璃结构分布:我们在复杂场景中拥有多种类型的玻璃结构(例如,磨砂门旁边的一块平板玻璃)在同一张图像中。图 3 定量显示了分布情况。

[图 3 标题] Mirage 18k 中玻璃类型的多样性。训练和测试数据包含多种类型的玻璃,通常同一张图像中包含多种。还包含了 1,930 个不含任何玻璃的样本,以在训练集中提供负样本。

[图 3 数据] 7000 分割测试 6000 分割训练 5000 深度测试 4000 图像数量 3000 2000 1000 0 室内磨砂窗 清晰门 杂项 无玻璃 平板玻璃 门 样本中玻璃的性质

我们使用 CVAT 标注工具生成真实玻璃二值分割掩码。玻璃的真实度量深度是通过将每个面板建模为 3D 平面表面获得的。在每个面板的角落放置临时不透明纸标记,并在 CVAT 中进行标注,然后从局部 15×15 像素邻域中提取其中值深度。为确保框架完美对齐,我们记录两次数据:完全静止的机器人首先记录带有标记的玻璃以捕获可靠的玻璃度量深度表面,然后在移除标记后从完全相同的位姿记录第二个序列。通过在逆深度空间中通过最小二乘优化求解超定系统,我们重建了密集度量深度图,如图 4 所示。该真实深度仅用于深度评估,不用于训练。

[图 4 标题] Mirage 18k 的真实深度获取。原始传感器深度图像对玻璃区域给出噪声返回,因为它对红外光透明。校正后的深度图像显示具有平滑变化深度的多边形,用于验证我们的结果。

B. 训练数据集

1) 玻璃分割:我们将自定义 Mirage 18k 数据集的训练分割与几个已建立的二值玻璃分割数据集聚合在一起:3DRef [22]、Trans10k [3]、GDD [5]、GSD-S [4] 和 GW-Depth [1]。这种整理产生了总共 24,811 个训练样本,涵盖了具有平面和曲面透明结构、不同光照条件和杂乱背景的多样化室内环境。

2) 单目深度估计:对于深度估计,我们利用 Hypersim [7],这是一个大规模、 photorealistic(照片级真实)合成数据集,提供跨越 461 个室内场景的高保真深度标注。为了保持平衡的多任务学习目标并防止训练期间的任务不平衡,我们过滤掉不完整的数据,并从官方训练分割中随机采样恰好 24,811 张图像,以完美匹配我们的玻璃分割语料库的大小。

C. 评估数据集

1) 玻璃分割:我们在 GDD [5]、3DRef [22]、Trans10k [3] 和我们的 Mirage 18k 数据集的官方测试分割上评估分割性能。为了评估 Mirage 18k 提供的纯分布外泛化能力,我们还在完全未见过的野生购物中心数据集上进行测试。

2) 单目深度估计:我们在三个真实世界数据集上评估我们的深度估计性能。其中两个是领域特定数据集(Mirage 18k 和 GW-Depth),它们为透明玻璃结构提供显式深度标注。第三个是 NYUv2 [23],这是一个广泛采用的通用室内深度基准,我们用它来展示模型在标准环境中的鲁棒泛化能力。

D. 基线和评估协议

1) 玻璃分割:我们使用官方 TorchMetrics 实现报告平均交并比 (mIoU)。为确保与先前方法的公平比较,我们应用以下协议: • TransLab 和 EBLNet 在其官方分割上进行训练和评估。由于 EBLNet 的计算要求很高,我们报告代表最可行训练配置的结果。 • GDNet 的结果严格报告在预训练模型公开可用的数据集上。 • GlassSemNet 需要全场景语义标注。在无法重新训练的情况下,我们报告仅推理的结果。

第 6 页

2) 单目深度估计:我们将方法与所有领域特定的基线以及最近的基础分割模型 SAM3 的单目深度估计路径进行了比较。如表 II 所示,我们的联合预测管道在所有评估数据集上均一致优于领域特定的基线 GW-Depth,尽管 GW-Depth 模型是明确在 GW-Depth 数据集和 NYUv2 数据集上训练的,我们仍优于它们。此外,与最先进的判别式单目深度基础模型相比,我们的方法在具有显著透明结构的数据集上取得了最高性能,特定指标提升了高达 20%。

评估协议与指标:对于三个数据集(Mirage 18k、GW-Depth 和 NYUV2)上的所有深度评估,我们遵循 Marigold [15] 使用的标准仿射不变深度估计协议。该协议通过在所有有效像素上使用标准最小二乘拟合,将估计的深度预测与可用的真实值对齐,以恢复全局尺度和偏移。然后使用标准单目深度指标评估这些对齐预测的准确性。我们报告绝对平均相对误差 (AbsRel) $M_1 \sum_{i=1}^M |a_i – d_i|/d_i$,其中 $M$ 是评估像素的总数,$a_i$ 是对齐后的预测深度图,$d_i$ 代表真实深度。我们还报告阈值准确率 $\delta_1$ 和 $\delta_2$,它们分别表示满足 $\max(a_i/d_i, d_i/a_i) < 1.25$ 和 $< 1.25^2$ 的像素比例。

V. 结果 B. 定性结果

我们的定性和定量结果证明了 Stable Diffusion 先验与 CLIP-conditioned cross-attention 任务切换的成功集成。这使得玻璃分割和感知玻璃的单目深度能够实现高度准确且泛化的零样本联合预测。这证实了我们最初的直觉,即通过联合训练这两种模态,相互的信息交换允许网络建立严格的前景-背景层次结构。此外,我们证明了 CLIP 条件化的重要性,并经验性地证明不需要配对的玻璃深度标注。

如 Fig. 5 所示,我们提供了我们的方法与在典型室内机器人部署的高挑战性环境中表现最佳的基线之间的定性比较。值得注意的是,这些复杂、真实的场景是由我们新的 Mirage 18k 数据集独特引入的,旨在明确基准测试操作鲁棒性。

①拥挤的购物中心(大块玻璃):我们的模型成功忽略了动态障碍物(人类),并准确分割了玻璃,尽管背景细节复杂。相比之下,TransLab 和 SAM3 由于背景和前景显著性而失败。在深度估计方面,虽然 DepthAnythingv2 错误地捕捉了玻璃后面物体的深度,但我们的模型准确预测了玻璃深度,而 Lotus-D 也给出了不错的预测,但在一致性上失败。

②半开的玻璃门:TransLab 未能预测开门,SAM3 完全错过了门结构,仅分割了孤立的玻璃板。然而,我们的模型提取了高度准确的分割掩码。在深度方面,SAM3† [10] 错误地预测了错误距离处的完全封闭场景,而 DepthAnythingV2 由于背景显著性在右侧遇到显著困难。相比之下,我们的模型预测了准确的表面深度。

③极端近距离窗户(最小上下文):在视角高度受限的情况下,TransLab 和 SAM3 受到背景柱的影响预测了错误的边界。我们的模型精确隔离了真实且更近的玻璃边界。此外,Lotus-D 和 DepthAnythingV2 完全错过了透明表面,输出背景深度,而我们的模型始终解析出正确的玻璃深度。

这些定性结果提供了明确的证据,表明我们的联合公式有效地学习了一种稳健的空间层次结构。

表 I 分割平均交并比 (MIOU) 结果

数据集 | GDD | 3DRef | Trans10k | Mirage 18k | Mall —|—|—|—|—|— 方法 TransLab [3] | 88.07 | 83.06 | 78.05 | 72.69 | 59.09 EBLNet [2] | 88.72 | 86.71 | 90.28 | 51.05 | 44.39 GDNet† [5] | 87.64* | 84.46 | 77.25 | 67.20 | 42.06 GlassSemNet† [4] | 90.80* | 53.13 | 78.58 | 77.50 | 65.55 SAM3† [10] | 65.69 | 74.37 | 67.93 | 77.51 | 61.03 SILICA (Ours) | 91.60 | 88.31 | 92.43 | 81.21 | 77.83

† 这些模型使用其提供的预训练权重进行评估,我们未对这些实验进行(重新)训练。

  • 指标取自各自文献。

A. 定量结果 1) 玻璃分割:如表 I 所示,SILICA 在所有评估的公共数据集上持续优于先前的领域特定基线。为了评估在复杂、真实环境中的零样本泛化能力,我们进一步在一个未观察到的、内部购物中心部署数据集上评估所有模型,该数据集具有大规模玻璃建筑结构。值得注意的是,我们的方法表现出卓越的性能。

第 7 页

表 II 深度估计的定量结果

NYUv2 [23] GW-Depth [1] Mirage 18k (Ours) 方法 任务 AbsRel ↓ δ1 ↑ δ2 ↑ AbsRel ↓ δ1 ↑ δ2 ↑ AbsRel ↓ δ1 ↑ δ2 ↑

Lotus-D [20] 深度 5.1 97.2 99.2 6.4 95.6 99.11 19.24 79.88 92.99 Depth Anything V2 [6] 深度 4.5 97.9 99.3 5.08 97.37 99.7 25.78 68.60 85.76 GW-Depth [1] 深度 + 分割 9.8† 91.17† 99.0† 10.0† 90.0† 98.9† 24.39 49.11 78.86 SILICA (Ours) 深度 + 分割 5.3 97.1 99.3 4.4 98.14 99.7 18.04 95.34 97.57

† GW-Depth 专门在 NYUv2 上训练。

图 5. 玻璃分割和深度预测的定性比较。即使在背景繁忙(见第 1 行)、半开的玻璃门(见第 2 行)和玻璃窗(见第 3 行)的场景中,SILICA 也能精确地联合预测玻璃分割和感知玻璃的深度估计。SILICA 在这些样本中表现出一致的性能,即使在显著性区域中也是如此。联合预测方法也有助于它正确识别并预测具有挑战性的开/关门深度,而其他方法会幻觉出平坦的玻璃或遗漏门(第 2 行)。

表 III 在使用原始传感器点对齐后,玻璃区域的深度估计性能

achieves an inference rate of approximately 5 Hz for joint segmentation and depth estimation. Because glass structures are static, we directly inject these predictions into a spatio- temporal voxel grid with a decay mechanism to ensure smooth real-time performance. Finally, we also observe that our pipeline implicitly improves overall 3D mapping, as we provide RTAB-Map with stabilized depth points on glass surfaces results in significantly better and cleaner final maps.

† Glass mask was not applied to remove the wrong depth.

chy, successfully resolving severe visual ambiguities in the presence of complex transparent structures.

C. Real-world Deployment

Designed explicitly for robotics, SILICA is integrated into our custom autonomous wheelchair stack for real-world navigation. To operate in a new environment, we first collect a map by feeding the corrected glass depth points from our pipeline into RTAB-Map [25] to construct an accurate 3D Fig. 6. (Top) Without conditioning, task entanglement corrupts depth predictions and segmentation. (Bottom) SILICA’s CLIP-conditioned cross- attention enables stable mutual information exchange, successfully resolving the foreground-background hierarchy.

are then utilized for our MPPI-based 2D navigation and 3D D. Ablationlocalization, enabling the wheelchair to safely plan paths and navigate through glass-structured environments (as shown in Fig. 1). Crucially, multiple deployment runs verify that our model produces very rare false positives in glass-free scenes, ensuring highly reliable robotic operation. Running on a laptop with an NVIDIA RTX 3060 GPU, the pipeline

Model 任务 AbsRel ↓ δ1 ↑ δ2 ↑ Lotus-D† [20] 深度 161.60 2.80 73.40 Depth Anything V2† [6] 深度 174.90 5.60 56.20 GW-Depth [1] 深度 + 分割 32.90 27.50 58.40 SILICA (Ours) 深度 + 分割 24.73 94.30 97.72

图 6. (上) 无条件时,任务纠缠破坏了深度预测和分割。(下) SILICA 的 CLIP-conditioned cross-attention 实现了稳定的互信息交换,成功解决了前景-背景层次结构。

D. 消融实验 CLIP-Conditioning: 为了证明我们架构设计的合理性,我们将基于 CLIP 的条件模块与用于任务切换的朴素位置编码器(公式 2)进行消融对比。如前所述,现实世界玻璃深度标注的严重稀缺性 necessitates 在复杂混合物上训练

第 8 页

表 IV Hypersim 中玻璃场景对 SILICA 模型性能的影响。 变体 AbsRel ↓ δ1 ↑ δ2 ↑ 无玻璃场景 18.93 94.47 97.68 有玻璃场景 18.04 95.34 97.57

合成深度和真实世界分割数据。在这些多模态条件下,简单的 positional encoding 会遭受严重的任务干扰。如图 6 所示,基线无法建立适当的空间层次结构:它错误地将玻璃表面预测为深度图中异常近的位置,并且在分割掩码中也未能消除前景-背景歧义(例如,将背景家具误分类为前景)。

相比之下,我们的 CLIP-conditioned cross-attention 方法(详见 III-B 节)直接连接到 U-Net 的所有交叉注意力层,充分利用扩散模型的鲁棒先验。这种机制实现了高度稳定的任务切换,并促进了深度和分割路径之间的有效互信息传递。如图 6 所示,这种公式成功强制执行了严格的空间层次结构,解决了视觉歧义,并显著提高了两项任务的输出质量。这从经验上证明了 CLIP 条件化对于弥合 sim-to-real 域差距并成功执行我们的联合预测框架至关重要。

消除玻璃深度标注:为了测试显式玻璃监督是否必要,我们过滤了 Hypersim,剔除了玻璃像素占比 > 10% 的场景。在 24,000 张严格无玻璃的图像上从头开始重新训练,仅产生了微小的指标差异(表 IV)。这种鲁棒的性能最终验证了我们的核心直觉:显式玻璃深度标注并非严格要求。相反,我们的 CLIP-conditioned cross-attention 联合训练框架教会了网络透明表面感知所需的正确空间层次结构。

联合训练的互利性:对 SILICA 进行消融实验并与单任务基线对比,证明了它们之间存在严格的相互依赖性。仅进行分割的模型在真实世界误报增加的情况下,mIoU 下降了约 5.0%。相反,仅进行深度的模型缺乏预测的分割掩码,而该掩码对于在度量对齐期间显式过滤损坏的原始传感器数据至关重要,导致玻璃区域的误差激增超过 80%。

致谢 作者仅使用大型语言模型(Gemini、ChatGPT)和 Grammarly 来改善手稿的语言流畅性。我们还要感谢 IHub-Data 通过项目 M2-029 提供的支持。

参考文献 [1] Y. Liang, B. Deng, W. Liu, J. Qin, and S. He, “Monocular depth estimation for glass walls with context: A new dataset and method,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 45, no. 12, pp. 15 081–15 097, 2023. [2] H. He et al., “Enhanced boundary learning for glass-like object segmentation,” in Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), Oct. 2021, pp. 15 859–15 868. [3] E. Xie, W. Wang, W. Wang, M. Ding, C. Shen, and P. Luo, “Segmenting transparent objects in the wild,” in Computer Vision – ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XIII, Glasgow, United Kingdom: Springer-Verlag, 2020, pp. 696–711. [4] J. Lin, Y.-H. Yeung, and R. Lau, “Exploiting semantic relations for glass surface detection,” in Advances in Neural Information Processing Systems, S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, and A. Oh, Eds., vol. 35, Curran Associates, Inc., 2022, pp. 22 490–22 504. [5] H. Mei et al., “Don’t hit me! glass detection in real-world scenes,” in 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020, pp. 3684–3693. [6] L. Yang et al., Depth anything v2, 2024. [7] M. Roberts et al., “Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding,” in International Conference on Computer Vision (ICCV) 2021, 2021. [8] R. Rombach, A. Blattmann, D. Lorenz, P. Esser, and B. Ommer, High-resolution image synthesis with latent diffusion models, 2021. [9] A. Radford et al., “Learning transferable visual models from natural language supervision,” in International conference on machine learning, PmLR, 2021, pp. 8748–8763. [10] N. Carion et al., Sam 3: Segment anything with concepts, 2025. [11] S. Sajjan et al., “Clear grasp: 3d shape estimation of transparent objects for manipulation,” in 2020 IEEE International Conference on Robotics and Automation (ICRA), 2020, pp. 3634–3642. [12] H. Fang, H.-S. Fang, S. Xu, and C. Lu, “Transcg: A large-scale real-world dataset for transparent object depth completion and a grasping baseline,” IEEE Robotics and Automation Letters, vol. 7, no. 3, pp. 7383–7390, 2022. [13] X. Liu, R. Jonschkowski, A. Angelova, and K. Konolige, “Keypose: Multi-view 3d labeling and keypoint estimation for transparent objects,” in 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020, pp. 11 599–11 607. [14] L. Yang, B. Kang, Z. Huang, X. Xu, J. Feng, and H. Zhao, “Depth anything: Unleashing the power of large-scale unlabeled data,” in 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 10 371–10 381. [15] B. Ke, A. Obukhov, S. Huang, N. Metzger, R. C. Daudt, and K. Schindler, Repurposing diffusion-based image generators for monocular depth estimation, 2024. [16] X. Fu et al., Geowizard: Unleashing the diffusion priors for 3d geometry estimation from a single image, 2024. [17] J. Ho, A. Jain, and P. Abbeel, “Denoising diffusion probabilistic models,” arXiv preprint arxiv:2006.11239, 2020. [18] Y. Benny and L. Wolf, “Dynamic dual-output diffusion models,” in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Jun. 2022, pp. 11 482–11 491. [19] T. Salimans and J. Ho, “Progressive distillation for fast sampling of diffusion models,” CoRR, vol. abs/2202.00512, 2022. [20] J. He et al., Lotus: Diffusion-based visual foundation model for high-quality dense prediction, 2025. [21] X. Long et al., “Wonder3d: Single image to 3d using cross-domain diffusion,” arXiv preprint arXiv:2310.15008, 2023. [22] X. Zhao and S. Schwertfeger, “ 3DRef: 3D Dataset and Benchmark for Reflection Detection in RGB and Lidar Data,” in 2024 International Conference on 3D Vision (3DV), Los Alamitos, CA, USA: IEEE Computer Society, Mar. 2024, pp. 225–234. [23] N. Silberman, D. Hoiem, P. Kohli, and R. Fergus, “Indoor segmentation and support inference from rgbd images,” in Computer Vision – ECCV 2012, A. Fitzgibbon, S. Lazebnik, P. Perona, Y. Sato, and C. Schmid, Eds., Berlin, Heidelberg: Springer Berlin Heidelberg, 2012, pp. 746–760. [24] Nicki Skafte Detlefsen et al., TorchMetrics – Measuring Reproducibility in PyTorch, Feb. 2022. [25] M. Labbé and F. Michaud, “Rtab-map as an open-source lidar and visual simultaneous localization and mapping library for large-scale and long-term online operation,” Journal of field robotics, vol. 36, no. 2, pp. 416–446, 2019.

发表评论