SILICA:如何用扩散模型让机器人看清玻璃?

核心贡献

传统深度传感器在玻璃表面失效,导致机器人导航危险。SILICA利用Stable Diffusion先验,联合预测玻璃分割和深度。通过CLIP条件化机制解决任务纠缠,并利用非玻璃区域校准深度。实验显示其在Mirage 18k等数据集上显著优于现有方法。注意:该方法依赖非玻璃区域的传感器读数进行校准。

DGSfM:深度引导的尺度感知全局SfM,解决传统方法尺度模糊与初始化敏感问题

背景:全局SfM的局限

传统全局SfM依赖尺度模糊的对极几何,导致全局定位对噪声基线估计和弱视图图约束敏感。DGSfM通过将单目深度估计集成到全局SfM中,利用深度感知相对位姿求解、视图图过滤和深度引导初始化来解决尺度歧义和初始化敏感性问题。实验显示,在ETH3D和LaMAR数据集上,该方法显著提升了相机位姿估计精度。需注意,方法性能受单目深度模型质量影响,且严格过滤可能略降点云完整性。

ZipDepth:6.1M参数实现零样本单目深度估计的实时部署

Method: ZipDepth 架构概览

ZipDepth 是一个仅含 6.1M 参数的轻量级单目深度估计网络,通过从 Foundation Model 进行大规模知识蒸馏和硬件自适应架构设计,在嵌入式设备上实现了实时推理与卓越的零样本泛化能力。本文介绍了 ZipDepth 的架构设计、训练策略、实验结果及局限性,为嵌入式设备上的实时深度估计提供了新的解决方案。

语义更强却看不清边界?LingBot-Vision的空间预训练

论文代表图:figure-08-p020-02

LingBot-Vision把边界从下游输出变成预训练信号,通过边界强制掩码和在线目标生成提升密集空间感知。本期查看深度、分割、视频对象分割和深度补全证据,同时讨论几何能力与全局语义分类之间的权衡。