Hydra++:实时分层3D场景图构建与对象级形状估计

三分钟导读:Hydra++通过集成学习-based形状估计器(如CRISP)和重投影掩码一致性检查(RMCC),在分层3D场景图中实现了高保真度的对象级网格重建,并支持混合LiDAR-相机配置以改善户外稀疏深度下的重建质量。

英文题目:Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation

论文出处:arXiv 每日论文精选 · arXiv:2607.09455

原始论文:PDF / 论文页面

对应视频标题:Hydra++:实时分层3D场景图构建与对象级形状估计|推荐指数:★★★★★

这篇论文解决什么问题?

现有场景图系统通常使用粗糙的几何表示(如点云或CAD模板),缺乏实例特定的形状细节,且在户外环境中受限于稀疏和噪声的深度测量,导致对象和背景重建质量低下。

核心创新

  • 将类别无关的学习型形状估计器(CRISP/SAM3D)集成到实时分层3D场景图构建管道中。
  • 提出RMCC模块,通过重投影掩码重叠评分验证对象形状预测的有效性,提高鲁棒性。
  • 设计地面感知自适应TSDF积分策略,通过扩展截断距离范围解决户外LiDAR稀疏数据导致的地面网格不连续问题。
  • 支持混合LiDAR-相机传感器配置,提升大规模户外环境下的场景级和对象级重建质量。

方法概览

Hydra++在Hydra和Khronos框架基础上扩展:1) 引入基于学习的形状估计模块(CRISP或SAM3D)进行对象姿态和形状估计;2) 提出重投影掩码一致性检查(RMCC)以验证预测形状与观测掩码的几何一致性,过滤退化预测;3) 采用混合LiDAR-相机配置和地面感知自适应TSDF积分策略,解决户外LiDAR长距离入射角导致的网格断裂问题。

逐图理解论文

方法概述:Hydra++架构

方法概述:Hydra++架构
Fig. 2. System pipeline of Hydra++. Sensor data (RGB-D or 3D LiDAR + camera, semantic segmentation, and odometry) flows through an active window module that performs metric-semantic 3D mesh construction and object tracking. Inactive tracks are processed by a learning-based shape estimation module (instantiated as CRISP [12] or SAM3D [13]) for object pose and shape estimation, which is followed by our proposed reprojection- mask consistency check (RMCC) to validate the predictions. The 3D scene graph construction module instantiates nodes across multiple semantic lay- ers, which are then optimized and updated asynchronously by the backend through deformation-graph-based optimization and incremental updates [1].

Hydra++在Hydra和Khronos框架基础上进行扩展。其核心流程包括:传感器数据通过主动窗口模块进行度量语义3D网格构建和对象跟踪。非活跃轨迹由基于学习的形状估计模块处理,随后通过重投影掩码一致性检查验证预测。最终,3D场景图构建模块实例化多层语义节点,并通过后端异步优化更新。

创新一:学习型形状估计器集成

创新一:学习型形状估计器集成
Fig. 7. Qualitative comparison of mesh reconstruction in an out-of-domain setting, where unseen object instances are given as inputs. (a) RGB image for reference, with target objects highlighted in red boxes; (b) mesh results produced by CRISP [12] and (c) those produced by SAM3D [13].

Hydra++引入了类别无关的学习型形状估计器,如CRISP或SAM3D,用于对象姿态和形状估计。CRISP满足实时性要求,而SAM3D提供更高的精度和域外泛化能力。这一集成使得系统能够捕捉类内变化,例如重建具有不同几何形状的垃圾桶和椅子,从而在对象级场景图中实现更丰富的几何表达。

创新二:重投影掩码一致性检查

创新二:重投影掩码一致性检查
Fig. 4. Overview of the reprojection-mask consistency check (RMCC) for valid (left) and invalid (right) cases. From top to bottom: the RGB-D image with the observed object mask Mobs (input to the shape estimation module, Sec. III-C); and the camera frustum visualizing the observed mask Mobs alongside the reprojected mask Mproj generated from a point cloud sampled from the predicted shape. The validity of the predicted object shape is determined by the overlap score O between Mproj and Mobs; see (8).

为验证预测形状的有效性,我们提出重投影掩码一致性检查模块。该方法将预测形状采样的点云重投影至图像平面,生成重投影掩码,并与观测掩码计算重叠评分。若评分低于阈值,则判定为无效预测并过滤。这一机制显著提高了Precision和F1分数,尽管Recall略有下降,但有效减少了退化预测。

创新三:户外稀疏深度处理

创新三:户外稀疏深度处理
Fig. 9. Mesh quality comparison in outdoor scenes: (a) Meshes generated in RGB-D-only mode, corresponding to the original metric-semantic mesh generation in Hydra [8] or Khronos [11]. (b)–(c) Meshes from a hybrid LiDAR-camera mode without and with the adaptive integration strategy, respectively.

针对户外LiDAR长距离入射角导致的网格断裂问题,Hydra++采用混合LiDAR-相机配置和地面感知自适应TSDF积分策略。通过扩展截断距离范围,该方法有效解决了地面网格不连续问题。实验表明,在Kimera-Multi真实世界户外数据集中,混合配置能成功重建从消防栓到汽车的多种尺寸对象。

实验设置与数据集

实验设置与数据集
Fig. 5. (a) Reference point cloud map and qualitative comparison of object-level mapping results for (b) SlideSLAM [22], (c) Hydra [8], (d) Khronos [11], and (e) our Hydra++. An estimated object is marked as matched (green) if the closest ground-truth (GT) object of the same class lies within τd = 0.2 m, and unmatched (red) otherwise, i.e., the centroid of the partially reconstructed object deviates substantially from the GT centroid.

我们在uHumans2仿真数据集上进行室内RGB-D场景的对象级场景图质量评估,对比SlideSLAM、Hydra和Khronos。同时,在Kimera-Multi真实世界户外数据集上评估混合LiDAR-相机配置的重建效果。定量指标包括Precision、Recall、F1分数和Chamfer距离,以全面衡量形状重建的准确性和完整性。

实验与关键结果

  • 在uHumans2仿真数据集上进行室内RGB-D场景的对象级场景图质量评估,对比SlideSLAM, Hydra, Khronos。
  • 在Kimera-Multi真实世界户外数据集上进行混合LiDAR-相机配置的部署,评估户外场景重建和对象细节恢复。
  • 对比CRISP(实时)与SAM3D(高精度/慢速)在推理延迟、域外泛化能力和形状重建质量上的权衡。
  • 定量和定性分析RMCC模块对预测精度、召回率和F1分数的影响。
  • 在uHumans2数据集(τd=0.2m)上,Hydra++的Precision为0.787,Recall为0.591,F1为0.675,Chamfer距离为0.004,优于基线方法。(第 5 页)
  • 在uHumans2数据集(τd=0.5m)上,Hydra++的Precision为0.921,Recall为0.671,F1为0.776,Chamfer距离为0.020。(第 5 页)
  • SAM3D推理延迟约为11-14秒/对象,而CRISP满足实时性要求,但SAM3D在域外对象(如电脑)重建上表现更好。(第 6 页)
  • RMCC通过过滤错误预测,在所有相对阈值下显著提高了Precision和F1分数,尽管Recall略有下降。(第 7 页)

阅读时需要注意

  • CRISP作为默认估计器,其性能受限于训练分布,对未见过的对象类别泛化能力不如SAM3D。
  • SAM3D虽然泛化能力强,但推理延迟高(11-14秒/对象),不适合实时多对象部署。
  • 缺乏针对对象级网格重建的户外基准数据集,限制了真实户外环境下的训练和评估。
  • CRISP依赖准确的分割掩码,在严重遮挡或噪声掩码下可能产生退化预测(尽管RMCC可过滤部分)。
  • RMCC的有效性依赖于观测掩码的质量,极端的遮挡可能导致有效预测被错误拒绝。
  • 混合LiDAR-相机配置需要精确的传感器标定和时间同步。
  • CRISP的训练需要地面真值网格,在真实户外环境中获取这些数据具有挑战性。

关联工作

  • Hydra [8]:基础框架,Hydra++在其基础上增加了对象级形状估计和RMCC。(第 2 页)
  • Khronos [11]:对比方法,基于RGB-D和实例感知体素聚类,在户外稀疏深度下表现不佳。(第 2 页)
  • SlideSLAM [22]:对比方法,使用参数化几何基元,依赖单一模板,无法捕捉类内变化。(第 2 页)
  • CRISP [12]:核心模块,类别无关的形状和姿态估计器,用于Hydra++的实时配置。(第 2 页)
  • SAM3D [13]:替代模块,基础模型,提供域外泛化能力但推理速度慢。(第 2 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Hydra++:具有对象级形状估计的实时分层3D场景图构建

Hyungtae Lim1, Nathan Hughes1, Xihang Yu1, Ruihan Xu1, Yun Chang1, Jingnan Shi1, Rajat Talak2, and Luca Carlone1

室内(RGB-D相机) 户外(3D激光雷达 + RGB/RGB-D相机)

0.9 m 0.85 m

2.0 m 5 m 4.5 m 10 m

(a) (b) 图 1. Hydra++ 生成的具有对象级形状重建的3D场景图。(a) 使用 uHumans2 数据集 [1] 的室内环境。放大视图显示从部分观测中重建的完整对象形状。每种颜色代表一个语义类别(例如,粉色代表沙发,绿色代表植物,紫色代表垃圾桶,红色代表椅子)。我们框架中的对象形状估计网络捕捉了类内变化,如重建的不同几何形状的垃圾桶和椅子所示。(b) 使用混合激光雷达-相机配置的户外校园场景。我们的方法在现实感知条件下重建各种尺寸的对象,从小的消防栓到大的汽车。

摘要—3D场景图通过编码空间实体(例如,对象、地点)及其关系,为环境提供分层抽象。然而,现有的场景图系统对对象几何的建模较为粗糙,依赖于部分点云或类别级CAD模板,这限制了实例特定的形状细节。本文提出了 Hydra++,这是一项系统级研究,探讨如何将基于学习的对象形状估计器集成到分层3D场景图管道中。Hydra++ 结合了类别无关形状估计器(CRISP)和重投影掩码一致性检查(RMCC),以拒绝来自部分观测或模糊分割的退化预测。在默认的基于 CRISP 的配置中,Hydra++ 执行在线场景图构建;较慢的估计器如 SAM3D 被评估为模块替代方案,以展示泛化-延迟权衡。此外,为了解决户外环境中稀疏和嘈杂的深度测量带来的挑战,Hydra++ 支持混合激光雷达-相机配置,以实现大规模操作,从而提高场景级重建质量。在仿真和真实世界户外校园场景中的实验表明,Hydra++ 提高了对象级和场景级的重建质量。项目页面可在 https://hydra-plusplus.github.io/ 获取。

I. 引言

对3D场景进行建模对于许多机器人任务至关重要,从导航到操作 [2]。随着深度学习和大型语言模型(LLMs)的兴起,许多研究考察了语义映射,即捕获关于环境的语义信息以支持推理和交互 [3]–[6]。特别是,最近的3D场景图方法通过将实体(例如,对象、房间和智能体)视为节点,将关系视为边(例如,相邻、包含和支持),从而编码语义,产生对环境的轻量级且高效的抽象 [7], [8]。

然而,大多数场景图系统仍将对象几何视为粗略代理,通常依赖于从累积点云 [2], [9] 中获得的质心和带有部分重建的边界框。这种抽象对于语义查询 [10] 通常足够,但在下游任务需要实例特定几何形状时,例如接触感知推理、基于模型的操作或重新排列,它成为瓶颈。在户外环境中,这种局限性因稀疏和嘈杂的深度测量而加剧,使得对象和背景(尤其是背景)的网格重建变得极具挑战性。这些挑战共同激发了对更高保真度的对象和背景重建的需求,尤其是在大规模户外环境中。

在本文中,我们提出了 Hydra++,这是一项系统级研究,探讨如何将对象形状估计器集成到分层3D场景图管道中。如图 1 所示,Hydra++ 扩展了 Hydra [8] 和 Khronos [11] 的框架。

1 H. Lim, N. Hughes, X. Yu, R. Xu, Y. Chang, J. Shi, 和 L. Carlone 来自麻省理工学院信息与决策系统实验室,美国马萨诸塞州剑桥市,{shapelim, na26933, jimmyyu, multyxu, yunchang, jnshi, lcarlone}@mit.edu 2 R. Talak 来自新加坡国立大学电气与计算机工程系,新加坡,{talak@nus.edu.sg} 这项工作部分由韩国国家研究基金会(NRF)资助,资助方为韩国政府(MSIT)(编号 RS-2024-00461409),并由美国空军人工智能加速器资助,合作协定编号 FA8750-19-2-1000。

第 2 页

通过结合基于类别的形状估计器(CRISP [12] 或 SAM3D [13])进行逐物体网格级重建,这一方向已通过多种范式得到探索,包括参数拟合 [17]、体积表示 [18]、基于学习的隐式函数 [12], [19] 以及基于扩散的方法 [20],共同证明了即使从部分观测中生成详细物体几何形状的可行性。为了处理由部分观测或不精确分割引起的退化形状预测,我们引入了重投影掩码一致性检查(RMCC)。我们进一步研究了一种混合激光雷达-相机配置,该配置结合了来自 3D 激光雷达传感器的度量尺度深度与基于图像的估计,从而改善了室外环境下物体级和场景级的重建质量。在整篇论文中,实时性声明指的是基于默认 CRISP 实例化的 Hydra++。包含 SAM3D 作为替代模块,以分析域外泛化与推理延迟之间的权衡。

借助 Hydra++,我们提出以下贡献。我们 (i) 引入了一个增强的 3D 场景图构建系统,该系统集成了基于学习的物体形状估计模型,在保持对噪声物体检测鲁棒性的同时提供高保真物体几何形状;(ii) 研究了最先进形状估计方法之间的权衡;(iii) 通过混合激光雷达-相机配置扩展了系统,以支持大规模室外环境。我们在模拟和真实世界环境中通过实验支持了这些主张。

物体级 SLAM。 3D 场景理解是机器人建图的一项基本任务,大量研究使机器人能够在不同的语义粒度下理解和表示环境。由 SLAM++ [3] 开创的物体级 SLAM 已将语义物体直接纳入建图和定位管线 [4]–[6]。代表性系统如 QuadricSLAM [4] 和 CubeSLAM [5] 在因子图公式中使用参数几何基元对物体进行建模,实现了轻量级且可解释的物体级建图。虽然这些方法有效,但它们通常依赖于预定义的几何模型,这限制了它们适应部分观测或不规则物体几何形状的能力。

为了解决这一局限性,后续工作通过鲁棒的物体数据关联和优化扩展了这一研究方向。Bowman 等人 [14] 通过对度量信息和语义信息进行联合优化,并采用概率物体关联,直接解决数据关联问题,从而在模糊环境中实现可靠的物体级建图。在此基础上,Atanasov 等人 [15] 为 SLAM 中的几何、语义和数据关联提供了统一的视角,引入了结构化物体模型的中层部件特征,以超越纯几何表示。

基于学习的物体形状表示。 为了进一步提升物体表示的表达力,Shan 等人 [16] 提出了 ELLIPSDF,它使用由粗椭球和细粒度神经 SDF 组成的双层模型,联合优化物体姿态和形状,从而从多视角 RGB-D 观测中实现紧凑且具有表现力的物体级地图推断。物体的形状估计已经通过多种范式得到探索,包括参数拟合 [17]、体积表示 [18]、基于学习的隐式函数 [12], [19] 以及基于扩散的方法 [20],共同证明了即使从部分观测中生成详细物体几何形状的可行性。

与此同时,人们也探索了将形状先验用于详细物体表示 [21],并提出了去中心化和协作式公式,以在通信约束下支持多机器人物体级建图,例如 SlideSLAM [22]。

带有 3D 场景图的场景表示。 这些物体级表示的发展共同指向了将丰富的物体几何和语义组织到结构化空间框架中的日益增长的兴趣。基于场景图的方法已成为这种层次化空间理解的有前景的范式 [1], [7], [23],使机器人能够从低层几何基元推理到高层语义概念,如房间和建筑物。Hughes 等人 [8] 提出了 Hydra,这是一种实时的空间感知系统,通过增量构建分层场景图,利用层次化描述符和基于变形的优化处理闭环。Bavle 等人 [24], [25] 还为室内场景开发了基于激光雷达的层次化表示,称为 S-Graphs 和 S-Graphs+。Werby 等人 [26] 通过引入开放词汇视觉-语言特征扩展了这一范式,实现了多层环境中的语言条件查询。Greve 等人 [27] 进一步将场景图推向室外自主性,通过构建协作式动态场景图,利用多智能体全景激光雷达数据处理大规模城市环境。

尽管物体级 SLAM 和场景图表示各自都在快速发展,但对于如何将详细的学习物体形状组织到层次化场景理解框架中,目前的探索仍然有限。现有的场景图系统在捕捉语义和拓扑关系方面表现出色,但通常将物体几何抽象为简单的基元,而形状估计方法虽然能生成详细的物体模型,但往往在更广泛的空间上下文之外独立运行。在本工作中,我们研究了在场景图表示中集成学习物体网格估计(使用 CRISP [12] 或 SAM3D [13]),并探讨了如何将此类表示纳入层次化空间理解管线,以支持既受益于语义感知又受益于物体级几何细节的应用。

III. 方法论

A. 系统概述

Hydra++ 建立在 Hydra [8] 和 Khronos [11] 框架用于 3D 场景图构建的基础上,通过引入基于学习的形状估计模块 [12], [13]、预测物体形状的几何一致性检查,以及对混合激光雷达-相机传感器配置的支持,对其进行了扩展。

第 3 页

传感器 活动窗口 3D场景图 …激光射线 对于所有点 … 对于非地面 对于地面 数据 • 度量-语义 构建 … … 语义 地面 预测 地面 3D 未标记点 分割 (映射到 人行道类别) • 多帧 网格构建 形状 3D场景图 里程计 物体跟踪 RMCC 后端 估计 物体

图 2. Hydra++ 系统流程。传感器数据(RGB-D 或 3D 激光雷达 + 相机、语义分割和里程计)流经一个活动窗口模块,该模块执行度量-语义 3D 网格构建和物体跟踪。非活动轨迹由基于学习的形状估计模块(实例化为 CRISP [12] 或 SAM3D [13])处理,用于物体姿态和形状估计,随后是我们提出的重投影掩码一致性检查(RMCC)以验证预测结果。3D 场景图构建模块在多个语义层上实例化节点,然后通过基于变形图的优化和增量更新 [1] 由后端异步优化和更新。

如图 2 所示,系统接收传感器数据(RGB-D 或 LiDAR + RGB/RGB-D 相机)、实例分割掩码和里程计估计。从这些输入中,活动窗口模块维护一个体素地图 $M_t$,该地图通过投影截断符号距离场(TSDF)集成 [28] 进行增量更新。同时,物体候选者从实例标签图像 $I_{inst}$ 中的图像空间提取,该图像编码了每个像素的类别和来自现成分割模型的实例 ID。共享相同实例 ID 的像素被聚类为簇 $C_{ti}$,每个簇通过将深度图像通过相机内参和深度信息反投影到顶点地图 $V$ 中提升到 3D。簇通过感知范围、像素数量和 3D 包围盒体积进行过滤。然后,最大交并比跟踪器 [11] 使用基于体素的重叠将簇跨帧关联,形成时间物体轨迹 $T_k$,其中 $k$ 索引当前活动的轨迹。

当轨迹变为非活动状态(即物体移出活动窗口)时,系统调用基于学习的形状估计模块进行 6-DoF 姿态和形状估计(第 III-C 节),随后进行重投影掩码一致性检查(RMCC)以验证预测结果(第 III-D 节)。验证后的物体节点,连同位置和区域节点,使用 Hydra 后端 [8] 组装成分层 3D 场景图 $G = (V, E)$,其中节点可以跨越多个语义层(例如,代理、物体、位置和区域),边编码空间和语义关系。

在本节的其余部分,我们描述 Hydra++ 的两个主要贡献:(a) 一种用于改进混合 LiDAR-相机配置中地面重建的自适应集成策略(第 III-B 节),以及 (b) 一个由基于学习的形状估计模块(第 III-C 节)和通过 RMCC 进行的几何一致性检查(第 III-D 节)组成的物体级流水线。

B. 地面感知自适应集成策略

在基于 TSDF 的映射中,活动窗口内的每个体素 $u$ 存储一个符号距离值 $\phi(u)$:在自由空间(即表面前方)为正,在表面后方为负,在表面本身为零。表面网格通过寻找零水平集 $\{u \mid \phi(u) = 0\}$ 提取,在实践中这简化为通过移动立方体检测相邻体素之间的符号变化。对于符号变化存在,表面两侧的体素必须接收集成更新;然而,表面后方超出截断距离 $\tau$ 的体素永远不会被更新且不携带任何权重。这意味着如果表面的负侧体素未被任何测量到达,则不会记录符号变化,表面 simply 消失(即,图 3(a) 中的红框)。

在投影集成中,符号距离是沿射线而不是表面法线估计的 [11],这在入射角高时会高估真实距离,并将测量值推出截断带,留下未更新的负侧体素。当使用 LiDAR 点云时,由于 LiDAR 在长距离地面平面上的返回稀疏,这种效应会加剧,导致一致符号转换失败以及碎片化或缺失的地面网格。

为了解决这个问题,我们引入了一种地面感知自适应集成策略。对于地面标记体素 [29],我们不仅丢弃符号距离低于截断距离 $-\tau$ 的测量值,还允许符号距离位于截断带之外额外范围 $d_{extra}$ 内的测量值(经验上,$d_{extra} = 3$ m),如图 3(b) 中的扩展虚线所示。落在此扩展带内的测量值通过将其观测距离钳位到 $-\tau$ 并赋予一个小常数权重进行集成,而不是被丢弃。这种受控的负侧支持确保地面表面后方的体素接收集成更新,恢复可靠零水平集提取所需的符号转换。

C. 物体姿态和形状估计

如第 III-A 节所述,当物体轨迹 $T_k$ 变为非活动时,系统调用基于学习的姿态和形状估计模块,从物体所在的观测中预测 6-DoF 物体姿态和几何形状

第 4 页

RGB 和深度图像 掩码, RGB 和深度图像 掩码, 最为完整可见。为了识别这一观测,我们启发式地选择具有最大 3D 包围盒体积的帧,这通常对应于遮挡最小的视角: (C∗, t∗) = arg max vol 3DBBox(Ctr) . (1) (Ctr ,tr)∈Tk 对于选定的观测,我们提取 RGB-D 帧和二值掩码 $M_{obs} \in \{0, 1\}^{H \times W}$ 以形成模块输入: : 0.87→有效 ✔ : 0.18→无效 ✘ x = (I_{RGB}, I_{depth}, M_{obs}, K) , (2) 相机视锥体 预测形状 投影交集,即,即, 其中 $I_{RGB} \in \mathbb{R}^{H \times W \times 3}$ 是 RGB 图像,$I_{depth} \in \mathbb{R}^{H \times W}$ 是从 RGB-D 相机或投影到图像平面上的 LiDAR 点云获得的深度图像, 未投影的深度测量值(由 过滤) $K \in \mathbb{R}^{3 \times 3}$ 是相机内参矩阵。该模块输出物体位姿 $C^O_T \in SE(3)$、度量尺度 $s \in \mathbb{R}^+$ 以及物体网格 $\mathcal{M}$。在世界坐标系中的物体位姿 $W^T_O$ 为: W W D. 重投影掩码一致性检查 (RMCC) TO = TCt∗· CTO, (3) W 其中 $TCt∗$ 是时刻 $t∗$ 的相机位姿,如公式 (1) 所示。每个 预测来自噪声或不完整的掩码,因为物体节点存储: W W 分割或掩码不精确。为了过滤掉这种退化 Aobj = {l, s, M, pO, RO}, (4) 其中 $l$ 是语义标签,$s \in \mathbb{R}^+$ 是度量尺度, 预测,我们采用重投影掩码一致性 $\mathcal{M}$ 是物体网格,$W p_O \in \mathbb{R}^3$ 和 $W R_O \in SO(3)$ 分别是 $W T_O$ 的平移和旋转。 检查 (RMCC),它验证预测形状与观测掩码之间的几何对齐(图 4)。RMCC 接下来,我们描述与两种不同的位姿和形状估计器的集成。请注意,我们的框架是模块化的,并且对底层形状估计架构是无关的,使其易于扩展到其他方法。 从预测网格 $\mathcal{M}$ 中采样表面点 $P_{surf}$, CRISP: CRISP [12] 是一个类别无关的网络,它联合估计物体网格形状和 6-DoF 位姿以及度量尺度,通过归一化物体坐标空间 (NOCS) 预测。它采用 DINOv2 主干网络 [30],具有用于形状重建和 NOCS 预测的并行分支,分别产生: 通过 $s$ 缩放,通过 $C^O_T$ 变换,并将它们投影到图像平面: CTO ∈SE(3), s ∈R+, zshape ∈R256, (5) 其中 $C^O_T$ 是相对于 NOCS 标准框架的物体位姿,$s$ 是度量尺度,$z_{shape}$ 是潜在形状 预测被接受如果 $O > \tau_O$,从而过滤掉由遮挡或截断视角引起的位姿歧义。代码。因为 CRISP 通过从 $I_{depth}$ 反投影的 3D 点与其预测的 NOCS 坐标之间的像素级对应关系联合求解旋转、平移和尺度,所以所有三个量都在单次前向传播中恢复,无需额外处理。物体网格 $\mathcal{M}$ 随后通过隐式 SDF 解码器解码 $z_{shape}$,通过移动立方体提取等值面并缩放 $s$ 获得。 SAM3D: SAM3D [13] 直接输出 $\mathcal{M}$ 作为密集网格以及物体位姿估计,但网格仅定义到未知的尺度因子。为了恢复度量尺度,遵循 VGGT-SLAM [31] 中使用的像素级尺度对齐,我们在从相机视点光栅化 $\mathcal{M}$ 渲染的深度与物体掩码 $M_{obs}$ 上的传感器测量深度 $I_{depth}$ 之间建立像素级对应关系,并将 $s$ 估计为所有有效对应关系的深度比的中值。 投影坐标形成掩码 $M_{proj} \in \{0, 1\}^{H \times W}$,我们计算重叠得分: |Mproj ∩Mobs| O = . (8) |Mproj| 其中 $\pi([x, y, z]^\top; K) = [\frac{f_x x}{z} + c_x, \frac{f_y y}{z} + c_y]^\top$。 (7)

图 4. 重投影掩码一致性检查 (RMCC) 的概述,针对有效(左)和无效(右)情况。从上到下:带有观测物体掩码 $M_{obs}$ 的 RGB-D 图像(形状估计模块的输入,第 III-C 节);以及可视化观测掩码 $M_{obs}$ 的相机视锥体,以及从由预测形状确定的点云样本生成的重投影掩码 $M_{proj}$;以及 $M_{proj}$ 和 $M_{obs}$ 之间的重叠得分 $O$,用于确定物体形状的有效性 (8)。

IV. 实验 我们进行实验以证实三个关键贡献。我们 (i) 评估将基于学习的物体形状估计集成到分层 3D 场景图流水线中(第 IV-C 和 IV-D 节);(ii) 通过分析形状估计器选择的实际权衡,比较 CRISP(我们的默认估计器)与 SAM3D 作为较慢的替代实例化(第 IV-E 节),并研究 RMCC 对预测可靠性的影响(第 IV-G 节);(iii) 评估户外环境中混合 LiDAR-相机配置,评估场景级网格连续性和物体级几何重建的改进(第 IV-F 节)。

第 5 页

20 20 20 20 20

10 10 10 10 10

[m] 0 [m] Y Y 0 [m]Y 0 [m]Y 0 [m]Y 0

10 10 10 10 10

20 20 20 20 20

0 10 20 30 40 50 0 10 20 30 40 50 0 10 20 30 40 50 0 10 20 30 40 50 0 10 20 30 40 50 X [m] X [m] X [m] X [m] X [m]

(a) 参考地图 (b) SlideSLAM [22] (c) Hydra [8] (d) Khronos [11] (e) Hydra++ (本文方法) 颜色(匹配状态): 真实目标 (GT) 未匹配的估计值(超出 ) 匹配的估计值(在 内) 形状(类别):

图 5. (a) 参考点云地图以及 (b) SlideSLAM [22]、(c) Hydra [8]、(d) Khronos [11] 和 (e) 我们的 Hydra++ 在目标级建图结果上的定性比较。如果最接近的相同类别的真实目标 (GT) 位于 $\tau_d = 0.2$ m 范围内,则估计对象被标记为匹配(绿色),否则为未匹配(红色),即部分重建对象的质心与真实目标质心存在显著偏差。

表 I. 在 uHumans2 数据集 [1] 中,给定 A. 环境设置 距离阈值 $\tau_d$ 时,最先进方法的性能比较。 精度 (P)、召回率 (R) 和 F1 分数是使用真实目标和估计 目标包围盒的质心计算的。注意,切弗距离 (Chamf.)、B-IoU 和 首先,为了将我们的方法与最先进的场景图 V-IoU 仅在有效的目标对上进行平均,其中 graph 方法 [8], [11] 进行比较,我们使用了 uHumans2 数据集 [1],这是一个 photorealistic(照片级真实感)仿真环境,提 估计质心与真实质心之间的距离低于 $\tau_d$。 供了带有语义标注的真实目标网格。我们选择 Chair(椅子)、Couch(沙发)、Plant(植物)和 Bin(垃圾桶)作为感兴趣的目标类别。 方法 P ↑ R ↑ F1 ↑ Chamf. ↓ B-IoU ↑ V-IoU ↑ 重要的是,在闭集语义分割中,有限的 m SlideSLAM 0.206 0.057 0.089 0.039 0.606 0.199 标签分类法迫使许多不同的真实世界对象实 例映射到相同的类别标签,不可避免地引 0.2 Hydra 0.529 0.409 0.461 0.035 0.515 0.298 入了大量的类内变化 [32]。例如,在 uHumans2 的办公室场景中,Chair 类别包括 Khronos 0.362 0.239 0.288 0.028 0.671 0.350 (i) 带扶手和轮子的办公椅,(ii) 带轮子的办公椅,以及 (iii) 餐桌椅,而 Bin 类别包括 (i) 小垃圾桶,(ii) 大垃圾桶,以及 (iii) 饮水机。 $\tau_d$ Ours w/o RMCC 0.670 0.602 0.634 0.008 0.690 0.540 因此,这个办公室场景非常适合突出我们 类别无关形状预测的优势,它可以在不依 m SlideSLAM 0.794 0.159 0.265 0.051 0.436 0.134 赖特定类别形状先验的情况下,容纳大的 类内多样性。 Hydra 0.897 0.705 0.789 0.072 0.412 0.246 0.5 对于现实世界部署,我们使用了 Kimera-Multi 数据集 [33] 中的一段序列。该数据集配备了一台装有 RealSense D455 RGB-D 相机和 m Khronos 0.971 0.546 0.699 0.091 0.358 0.239 Velodyne 3D LiDAR 的机器人,支持混合传感器配置。 在真实世界数据上训练 CRISP 需要每个实例的两个输入:(a) 分割掩码和 (b) 真实目标网格。对于掩码,我们应用了 SAM [34] 来自动从 RGB 帧中分割目标实例,旨在评估 CRISP 是否仅使用现成工具即可训练,而无需人工标注,从而探究其在野外部署的可行性。总共在三个目标类别(消防栓、汽车和长椅)中使用了大约 50 个关键帧。 对于真实几何形状,我们使用带有内置 LiDAR 传感器和 3D 扫描应用的 iPad Pro 扫描了目标对象。生成的网格由于扫描覆盖范围有限和薄结构(例如狭窄的物体部分)而存在孔洞,我们使用 Blender [35] 手动修复了这些孔洞以生成水密网格。这一步骤至关重要:CRISP 依赖于定义良好的符号距离场,而孔洞会在开放边界附近引入符号歧义,从而破坏学习到的形状编码。

B. 评估指标 我们在两个阶段评估目标级建图:(i) 检测性能和 (ii) 几何重建质量。对于检测,我们使用基于质心的指标。给定距离阈值 $\tau_d$,如果存在一个相同语义类别的真实目标,其质心位于估计质心 $\tau_d$ 范围内,则估计对象被计为真阳性 (true positive)。因此,未匹配的估计值为假阳性 (false positive),未匹配的真实目标为假阴性 (false negative)。我们报告精度 (P)、召回率 (R) 和 F1 分数。 对于几何重建,我们使用以下指标评估每个匹配的目标对(质心距离 < $\tau_d$): • 切弗距离 (Chamfer Distance):点集 $P_{pred}$ 和 $P_{GT}$ 之间双向点对点距离,分别从预测网格和真实网格中采样。 • 包围盒交并比 (B-IoU):匹配目标 3D 轴对齐包围盒的交并比: $B\text{-}IoU(C_{pred}, C_{GT}) = \frac{\text{vol}(3D\text{BBox}(C_{pred}) \cap 3D\text{BBox}(C_{GT}))}{\text{vol}(3D\text{BBox}(C_{pred}) \cup 3D\text{BBox}(C_{GT}))},$ (9) 其中 $C_{pred}$ 和 $C_{GT}$ 分别表示预测和真实目标簇。 • 体素交并比 (V-IoU):匹配网格体素化占用空间之间的交并比,遵循与 (9) 相同的形式,其中 $U_{pred}$ 和 $U_{GT}$ 分别表示预测和真实网格的占用体素集合。

第 6 页

(a) RGB

0.0 m 0.7 m

0.0 m 0.8 m

(b) CRISP

(c) SAM3D 0.0 m 1.0 m

0.0 m 0.6 m Fig. 7. 域外设置下的网格重建定性比较,其中输入为未见过的物体实例。(a) 作为参考的 RGB 图像,目标物体用红框标出;(b) CRISP [12] 生成的网格结果;(c) SAM3D [13] 生成的网格结果。

(a) SlideSLAM [22] (b) Hydra [8] (c) Khronos [11] (d) Hydra++ (Ours) 1.00 Mean: 0.43 CRISP Mean: 0.42 CRISP SAM3D SAM3D density2Fig. 6. 与其他物体表示方法的定性比较。在每一行中,左图显示估计的网格(绿色)叠加在地面真实表面点(黑色)上,而右图显示逐点误差热力图。 density0.75 truth surface points (black), while the right image shows the corresponding Mean: 11.01 0.25 Mean: 14.62 Probabilityper-point error heatmap. Probability 0.000 10 20 30 40 00 5 10 15 C. 物体级场景图质量 Runtime (sec) Runtime (sec) Fig. 8. 从左到右:SAM3D [13] 与 首先,我们将 Hydra++ 与现有的场景图 SLAM 方法进行比较:Hydra [8],它通过聚类语义网格来提取物体,以及 Khronos [11],它通过实例分割重建物体,均在 uHumans2 数据集上进行评估。 CRISP [12] 在室内(使用 uHumans2 数据集 [1])和室外(使用 Kimera-Multi 数据集 [33])环境中的时间对比。 如图 5 和表 I 所示,Hydra++ 在严格阈值($\tau_d = 0.2$ m)下的检测和形状指标方面均取得了具有竞争力的性能。特别是,图 5 显示,尽管基线方法 [8], [11] 成功检测到了物体,但它们仅通过累积部分观测来表征物体,这通常导致与地面真实值相比,质心误差超过 0.2 m(部分网格可见于图 6)。 一种基于学习的形状估计器,以重建实例特定的几何结构,捕捉扶手、座椅曲率和靠背形状等显著细节。 在宽松阈值($\tau_d = 0.5$ m)下,Hydra 通过实现最高的召回率获得了最佳的 F1 分数,但其切弗距离显著更高,且包围盒交并比(B-IoU)和体素交并比(V-IoU)更低。这反映了先前方法的根本局限性:由于它们依赖部分观测进行聚类 [8] 和实例跟踪 [11],因此无法推断未观测区域的几何结构,最终降低了场景图中的几何精度。相比之下,Hydra++ 内在地执行物体形状补全,从而产生更低的切弗距离和更高的体积重叠。 总体而言,这些结果表明,固定的每类 CAD 模板在多样化环境中是不足的,而 Hydra++ 通过实例级形状估计有效地捕捉了类内变化。 D. 类内形状变化分析 E. 形状估计模型比较 接下来,我们强调类别无关的、基于学习的形状估计在处理类内变化时的重要性。基于 CAD 模板的方法,如 SlideSLAM [22],依赖于每个语义类的单一标准形状,这 inherent 地限制了其表征多样化真实世界实例的能力。如图 6 的第一行和第二行所示,视觉上截然不同的物体,例如有扶手和无扶手的办公椅,被迫共享相同的模板,导致当真实几何结构与标准模型偏离时,出现系统性的错位和切弗距离增加。相比之下,Hydra++ 利用 尽管我们的流水线主要基于 CRISP [12],但我们进一步分析了形状估计模型的选择如何通过比较 CRISP 和 SAM3D [13] 来影响整体系统行为。这种比较并不意味着每个支持的估计器都能实现实时运行:CRISP 是用于实时配置的默认估计器,而 SAM3D 的评估旨在展示接口的模块化以及与更强的域外泛化能力相关的计算成本。关键区别在于域外泛化与推理速度之间的权衡。为了测试域外泛化能力,我们在原有的四个类别之外引入了一个额外的计算机类别。在 uHumans2 数据集中,各种各样的办公用品被模糊地归入这个单一的计算机标签中。 作为基础模型,SAM3D 表现出强大的泛化能力,能够可靠地重建 CRISP 难以处理的新型域外几何结构(见图 7(b) 和 7(c))。然而,这种鲁棒性是以显著更高的推理延迟为代价的,如图 8 所示;在我们的实验中,SAM3D 每个物体需要大约 11–14 秒,因此不适合在当前系统中进行实时多物体部署。相反,虽然 CRISP 不是基础模型,且仅限于其训练分布,但它拥有快得多的推理时间。

第 7 页

(a) (b) (c)

图 9. 室外场景中的网格质量对比:(a) 仅在 RGB-D 模式下生成的网格,对应于 Hydra [8] 或 Khronos [11] 中的原始度量-语义网格生成方法。(b)–(c) 分别来自混合 LiDAR-相机模式且无/有自适应融合策略的网格。

(b)

图 11. 被 RMCC 拒绝的错误形状估计示例。绿色网格显示估计的形状,黑点是从真实值中采样的。(a) 几何重叠不足导致的类内错误。(b) 来自类别无关的 CRISP 预测的类间错误。

1 0.7 0.8

0.6 0.8 0.5 0.6 (")0.6 (")0.4 (") 0.4 0.3 Score 0.4 SlideSLAM Recall F1 Precision Hydra (a) RGB 输入 (b) Khronos [11] (c) Hydra++ (Ours) 0.2 0.2 Khronos 0.2 Ours w/o RMCC 0.1 图 10. 室外场景图的物体级特写结果。从上到下:消防栓、汽车和长椅。(a) RGB 输入图像(即公式 (2) 中的 $I_{RGB}$)。(b) Khronos [11],一种基于 RGB-D 的方法,依赖于实例感知的体素聚类,由于室外场景中深度测量稀疏,无法生成可靠的物体网格,导致部分网格出现欠分割。(c) Hydra++ 通过混合 LiDAR-相机融合,利用 CRISP [12] 成功重建了每个物体的细粒度几何细节。 几何结构,支持了我们要提出的关于改善室外 总之,CRISP 针对已知物体类别进行了优化,以支持实时部 署,而 SAM3D 可以在应用允许延迟物体级网格更新时, G. RMCC 的定量与定性研究 改善新物体的重建效果。

此外,我们提供了关于 RMCC 效果的定量和定性结果。 F. 混合传感器融合模式的室外部署 物体形状预测模型本质上容易受到部分掩码或退化 最后,我们证明了我们的混合 LiDAR-相机 模式提高了场景级几何结构和物体级重建质量。为了在室内 RGB-D 设置之外验证这一能力,我们使用混合传感器配置在室外环境中部署了 Hydra++,其中 3D LiDAR 点云提供度量场景结构,而 RGB/RGB-D 相机 enables 基于 CRISP 的物体形状估计。 视点,这通常导致形状估计不准确。由于 CRISP 作为类别无关的形状估计器运行,这种模糊输入可能导致严重的类内错位(图 11(a)),甚至生成属于完全不同类别的形状(图 11(b))。然而,我们的 RMCC 模块通过根据公式 (8) 中的重叠分数拒绝图像空间重叠不足的预测,有效地过滤掉了这些错误情况。 如图 9 和图 10 所示,现有方法,如 Hydra [8] 或 Khronos [11],在室外场景中由于深度精度下降,导致场景网格不完整(图 9(a))和物体重建欠分割(图 10(b))。相比之下,我们的混合模式,使用第三节-B 中提出的地面感知自适应融合策略,减少了场景重建中的网格不连续性和虚假孔洞(图 9(c)),同时通过学习的形状先验恢复细粒度的物体细节(图 10(c))。 这种互补的融合使得一致的度量场景网格与详细的实例级物体网格得以保持一致,支持了我们要提出的关于改善室外重建质量的第三个主张。

此外,由于 RMCC 是由相对几何比例而非绝对物理尺寸驱动的,我们使用相对阈值 $\tau_d \leftarrow \kappa \cdot d_{diag}$ 评估其性能,其中 $d_{diag}$ 是真实物体网格的半对角线长度。如图 12 所示,虽然 RMCC 通过拒绝一些有效但不确定的估计导致召回率略有下降,但 RMCC 显著提高了所有相对阈值下的精确率。因此,带有 RMCC 的 Hydra++ 在整个阈值范围内始终获得更高的 F1 分数,证实了其作为稳健后验证步骤的有效性。

第 8 页

五、结论与经验总结

我们提出了 Hydra++,这是一个基于场景图的系统,它将学习到的物体级位姿和形状估计集成到分层 3D 场景图框架中。具体而言,我们证明了一个位姿和形状估计流水线可以无缝集成到系统中,在保持语义锚定的同时,提供更优的物体级几何表示。我们进一步证明,融合激光雷达和相机信息可以提高室外环境下的场景级网格完整性。

我们的经验也凸显了物体级网格重建缺乏室外基准测试的问题。现有的公共数据集通常提供逐点或逐像素的标注,但很少从映射角度提供场景级、实例级的网格真值。这限制了 CRISP 等形状估计器在真实室外环境中的训练和评估。未来的工作将探索生成式室外场景合成,以创建此类基准,并提高超越受控室内环境的泛化能力。

参考文献

[1] A. Rosinol, A. Violette, M. Abate, N. Hughes, Y. Chang, J. Shi, A. Gupta, and L. Carlone, “Kimera: from SLAM to spatial perception with 3D dynamic scene graphs,” Int. J. Robot. Res., vol. 40, no. 12–14, pp. 1510–1546, 2021.

[2] N. Hughes, Y. Chang, and L. Carlone, “Hydra: a real-time spatial perception engine for 3D scene graph construction and optimization,” in Proc. Robot.: Sci. Syst., 2022.

[3] R. F. Salas-Moreno, R. A. Newcombe, H. Strasdat, P. H. J. Kelly, and A. J. Davison, “SLAM++: Simultaneous localisation and mapping at the level of objects,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2013.

[4] L. Nicholson, M. Milford, and N. Sünderhauf, “QuadricSLAM: Dual quadrics from object detections as landmarks in object-oriented SLAM,” IEEE Robot. Autom. Lett., vol. 4, pp. 1–8, 2018.

[5] S. Yang and S. Scherer, “CubeSLAM: Monocular 3-D object SLAM,” IEEE Trans. Robot., vol. 35, no. 4, pp. 925–938, 2019.

[6] C. Li, H. Xiao, K. Tateno, F. Tombari, N. Navab, and G. D. Hager, “Incremental scene understanding on dense SLAM,” in Proc. Int. Conf. Comput. Vis., 2022, pp. 8018–8024.

[7] I. Armeni, Z. He, J. Gwak, A. Zamir, M. Fischer, J. Malik, and S. Savarese, “3D scene graph: A structure for unified semantics, 3D space, and camera,” in Proc. Int. Conf. Comput. Vis., 2019, pp. 5664–5673.

[8] N. Hughes, Y. Chang, S. Hu, R. Talak, R. Abdulhai, J. Strader, and L. Carlone, “Foundations of spatial perception for robotics: Hierarchical representations and real-time systems,” Int. J. Robot. Res., 2024.

[9] S. Wu, J. Wald, K. Tateno, N. Navab, and F. Tombari, “SceneGraphFusion: Incremental 3D scene graph prediction from RGB-D sequences,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2021, pp. 7515–7525.

[10] D. Honerkamp, M. Büchner, F. Despinoy, T. Welschehold, and A. Valada, “Language-grounded dynamic scene graphs for interactive object search with mobile manipulation,” IEEE Robot. Autom. Lett., vol. 9, no. 10, pp. 8298–8305, 2024.

[11] L. Schmid, M. Abate, Y. Chang, and L. Carlone, “Khronos: A unified approach for spatio-temporal metric-semantic SLAM in dynamic environments,” in Proc. Robot.: Sci. Syst., 2024.

[12] J. Shi, R. Talak, H. Zhang, D. Jin, and L. Carlone, “CRISP: Object pose and shape estimation with test-time adaptation,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2025.

[13] X. Chen, F.-J. Chu, P. Gleize, K. J. Liang, A. Sax, H. Tang, W. Wang, M. Guo, T. Hardin, X. Li et al., “SAM3D: 3DFY anything in images,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2026, pp. 7220–7232.

[14] S. Bowman, N. Atanasov, K. Daniilidis, and G. Pappas, “Probabilistic data association for semantic SLAM,” in Proc. Int. Conf. Robot. Automat., 2017, pp. 1722–1729.

[15] N. Atanasov, S. L. Bowman, K. Daniilidis, and G. J. Pappas, “A unifying view of geometry, semantics, and data association in SLAM,” in Proc. Int. Joint Conf. Artif. Intell., 2018, pp. 5204–5208.

[16] M. Shan, Q. Feng, Y.-Y. Jau, and N. Atanasov, “ELLIPSDF: joint object pose and shape optimization with a bi-level ellipsoid and signed distance function description,” in Proc. Int. Conf. Comput. Vis., 2021, pp. 5946–5955.

[17] X. Yu, R. Talak, J. Shi, U. Viereck, I. Gilitschenski, and L. Carlone, “Box pose and shape estimation and domain adaptation for large-scale warehouse automation,” arXiv preprint arXiv:2507.00984, 2025.

[18] B. Xu, W. Li, D. Tzoumanikas, M. Bloesch, A. Davison, and S. Leutenegger, “MID-Fusion: Octree-based object-level multi-instance dynamic SLAM,” in Proc. Int. Conf. Robot. Automat., 2019, pp. 5231–5237.

[19] J. Park, P. Florence, J. Straub, R. Newcombe, and S. Lovegrove, “DeepSDF: Learning continuous signed distance functions for shape representation,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2019.

[20] M. Liu, C. Xu, H. Jin, L. Chen, M. Varma T, Z. Xu, and H. Su, “One-2-3-45: Any single image to 3D mesh in 45 seconds without per-shape optimization,” Adv. Neural Inf. Process. Syst., vol. 36, 2024.

[21] J. Wang, M. Rünz, and L. Agapito, “DSP-SLAM: Object-oriented SLAM with deep shape priors,” in Proc. Int. Conf. 3D Vis., 2021, pp. 1362–1371.

[22] X. Liu, J. Lei, A. Prabhu, Y. Tao, I. Spasojevic, P. Chaudhari, N. Atanasov, and V. Kumar, “SlideSLAM: Sparse, lightweight, decentralized metric-semantic SLAM for multi-robot navigation,” IEEE Trans. Robot., vol. 41, pp. 6529–6548, 2025.

[23] A. Rosinol, A. Gupta, M. Abate, J. Shi, and L. Carlone, “3D dynamic scene graphs: Actionable spatial perception with places, objects, and humans,” in Proc. Robot.: Sci. Syst., 2020.

[24] H. Bavle, J. L. Sanchez-Lopez, M. Shaheer, J. Civera, and H. Voos, “Situational graphs for robot navigation in structured indoor environments,” IEEE Robot. Autom. Lett., vol. 7, no. 4, pp. 9107–9114, 2022.

[25] ——, “S-Graphs+: Real-time localization and mapping leveraging hierarchical representations,” arXiv preprint arXiv:2212.11770, 2022.

[26] A. Werby, C. Huang, M. Büchner, A. Valada, and W. Burgard, “Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation,” in Proc. Robot.: Sci. Syst., 2024.

[27] E. Greve, M. Büchner, N. Vödisch, W. Burgard, and A. Valada, “Collaborative dynamic 3D scene graphs for automated driving,” in Proc. Int. Conf. Robot. Automat., 2024, pp. 11 118–11 124.

[28] L. Schmid, J. Delmerico, J. L. Schönberger, J. Nieto, M. Pollefeys, R. Siegwart, and C. Cadena, “Panoptic Multi-TSDFs: a flexible representation for online multi-resolution volumetric mapping and long-term dynamic scene consistency,” in Proc. Int. Conf. Robot. Automat., 2022, pp. 8018–8024.

[29] H. Lim, M. Oh, and H. Myung, “Patchwork: Concentric zone-based region-wise ground segmentation with ground likelihood estimation using a 3D LiDAR sensor,” IEEE Robot. Autom. Lett., vol. 6, no. 4, pp. 6458–6465, 2021.

[30] M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haziza, F. Massa, A. El-Nouby et al., “DINOv2: Learning robust visual features without supervision,” arXiv preprint arXiv:2304.07193, 2023.

[31] D. Maggio, H. Lim, and L. Carlone, “VGGT-SLAM: Dense RGB SLAM optimized on the SL(4) manifold,” in Adv. Neural Inf. Process. Syst., 2025.

[32] B. Zhou, H. Zhao, X. Puig, S. Fidler, A. Barriuso, and A. Torralba, “Scene parsing through ADE20K dataset,” in Proc. Conf. Comput. Vis. Pattern Recognit., 2017, pp. 5122–5130.

[33] Y. Tian, Y. Chang, L. Quang, A. Schang, C. Nieto-Granda, J. How, and L. Carlone, “Resilient and distributed multi-robot visual SLAM: Datasets, experiments, and lessons learned,” in Proc. Int. Conf. Intell. Robots Syst., 2023.

[34] A. Kirillov, E. Mintun, N. Ravi, H. Mao, C. Rolland, L. Gustafson, T. Xiao, S. Whitehead, A. C. Berg, W.-Y. Lo et al., “Segment anything,” in Proc. Int. Conf. Comput. Vis., 2023, pp. 4015–4026.

[35] B. O. Community, Blender – a 3D modelling and rendering package, Blender Foundation, Stichting Blender Foundation, Amsterdam, 2018. [Online]. Available: http://www.blender.org

发表评论