三分钟导读:SCAGE通过将3D自主探索重构为几何异常最小化问题,利用基于Point Transformer V3的∆-Net学习室内结构先验,从而在实现高体积覆盖率的同时显著提升3D重建质量。
英文题目:Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration
论文出处:arXiv 每日论文精选 · arXiv:2607.15828
原始论文:PDF / 论文页面
对应视频标题:超越前沿:SCAGE利用几何异常引导3D自主探索与高保真重建|推荐指数:★★★★★
这篇论文解决什么问题?
传统基于几何启发式(如Frontier-based)和现有基于学习的方法通常仅关注最大化空间体积覆盖率,忽视了底层结构上下文,导致轨迹效率低下且最终3D重建保真度不足,无法捕捉精细的几何细节。
核心创新
- 将3D自主探索重新定义为几何异常最小化问题,而非单纯的体积边界搜索。
- 设计∆-Net网络,通过无跳连的自编码器结构强制学习典型室内环境的几何先验,而非过拟合训练数据。
- 提出基于异常聚类的自适应视点生成机制,根据异常区域的空间范围动态调整 standoff distance。
- 在效用函数中联合优化体积增益、结构异常分辨率和遍历成本,平衡探索广度与细节质量。
方法概览
提出SCAGE框架,核心为∆-Net(基于Point Transformer V3的去噪自编码器)。训练阶段:对Matterport3D数据集的点云块施加噪声、剪切和掩码,训练网络预测点分布偏移量∆ρ以重建理想结构。推理阶段:计算全局归一化异常分数,聚类高异常区域,生成自适应6-DoF观察视点,并通过结合体积信息增益、异常得分和遍历成本的效用函数规划路径。
逐图理解论文
创新点二:自适应视点生成机制

针对识别出的异常区域,SCAGE提出基于异常聚类的自适应视点生成机制。如图所示,异常被聚类为不同颜色的区域,系统为每个聚类生成候选的6-DoF观察视点。关键点在于,视点与异常区域中心的standoff distance会根据聚类空间范围动态调整。较大区域如墙壁边界,视点放置较远;紧凑区域如家具,视点则靠近,确保每个异常区域都能被完整捕获。
实验设置与基线对比

我们在HM3D验证集上进行仿真评估,使用完美深度和Metric3D v2估计深度。与Classical、NBVP及主要学习基线FrontierNet进行定量和定性对比。FrontierNet虽覆盖率较高,但定性分析显示其常停留在房间入口,未能深入捕捉内部结构细节。SCAGE则通过异常最小化策略,实现了更深入的探索。
定性结果:结构细节的重建能力

定性比较进一步证实了SCAGE的优势。如图所示,其他方法仅能实现部分重建,存在大量白色未扫描区域。而SCAGE能够完整重建构成房屋的元素,包括地板、天花板、桌椅和床铺。这种对结构细节的捕捉能力,源于其将探索定义为异常最小化问题,从而主动寻找并填补结构缺失。
结构理解能力分析

通过PCA可视化∆-Net编码器特征,我们分析了其结构理解能力。如图所示,结构相似的区域在不同房间中表现出一致的特征表示。例如,地板、天花板和床铺等平面水平表面呈现均匀颜色,而风扇、椅子和厨房橱柜等物体则在结构背景中突出显示。这表明网络学习的是底层几何规律,而非记忆特定样本。
真实世界验证与局限性

在搭载RealSense D455相机的P3DX机器人上进行的真实世界验证表明,网络能识别训练集中未见的结构异常,如不完整的椅子,证明其泛化能力。然而,局限性在于训练数据仅使用结构完整的高保真Matterport3D场景,对于训练分布中不存在的物体类别,异常响应较弱。此外,仅使用局部点云块训练可能限制了对全局上下文的理解。
实验与关键结果
- 在HM3D验证集上进行仿真评估,使用完美深度和Metric3D v2估计深度。
- 与Classical [4], NBVP [7], FrontierNet [8]进行定量和定性对比。
- 在P3DX机器人上搭载RealSense D455相机进行真实世界验证。
- 通过PCA可视化∆-Net编码器特征以分析其结构理解能力。
- 平均体积覆盖率约90% (89.7%),比最佳基线FrontierNet (~72.3%) 提升约15%。(第 6 页)
- 重建质量Chamfer Distance平均为0.91×10⁻³,优于FrontierNet的3.02×10⁻³(误差减半)。(第 6 页)
- 使用Metric3D v2估计深度时,覆盖率降至88.1%,Chamfer Distance为1.89×10⁻³,仍优于基线。(第 6 页)
阅读时需要注意
- 训练数据仅使用结构完整的高保真Matterport3D场景,未包含显著伪影或几何缺失的扫描。
- 对于训练分布中不存在的物体类别(如实验室中的其他移动机器人),异常响应较弱,依赖周围区域的异常进行观察。
- 仅使用局部点云块进行训练,可能限制了对全局上下文的理解(尽管实验显示其泛化能力良好)。
- 效用函数中若仅依赖异常得分会导致局部过探索,若仅依赖距离会导致局部偏差,三者结合至关重要。
- FrontierNet虽然覆盖率较高,但定性分析显示其常停留在房间入口,未能深入捕捉内部结构细节。
- 真实世界验证中,网络能识别训练集中未见的结构异常(如不完整的椅子),证明其学习的是底层几何规律而非记忆训练样本。
关联工作
- FrontierNet [8]:作为主要学习基线进行对比,指出其虽覆盖率高但缺乏结构细节捕捉能力。(第 2 页)
- Point Transformer V3 [13]:作为∆-Net的骨干网络,提供高效的3D点云处理能力。(第 2 页)
- Matterport3D [30]:用于训练∆-Net的室内场景数据集。(第 3 页)
- HM3D:用于评估和测试的仿真环境数据集。(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
超越边界:场景异常引导的自主探索
Akash Kumbar1 Abhinav Raundhal1 Madhava Krishna1
场景 824 HM3D
A B C
经典方法 FrontierNet SCAGE 46.9% 78.2% 92.3%
2026 7月 图1:顶部。我们的∆-Net预测场景异常(在3D点云中显示为黄色),这些异常代表在姿态P1(RGB图像中显示或由于重建不佳而显示为空白)处未探索的区域。这种异常信号引导机器人前往最佳下一个视角(P2)。在获取新点云之前,从P2看到的异常显示在(B)中,在获取该视角的点云后,这些异常得以解决,如(C)所示。底部。在HM3D场景上的轨迹和建图比较,起始位置由橙色点标记。经典方法留下大量未探索区域(红色方框),而FrontierNet忽略了局部几何细节。相比之下,我们的方法SCAGE实现了最高的体积覆盖率(92.3%),同时产生了更优越的高保真3D重建(橙色和蓝色插图突出了风扇和椅子的重建质量,这是FrontierNet未能实现的)。
摘要—未知3D环境的自主探索传统上由最大化覆盖率的几何启发式方法驱动。然而,这些方法通常在确定探索目标时未考虑底层结构上下文。这导致轨迹效率低下,往往限制了最终3D重建的保真度。为了弥合空间覆盖率与重建质量之间的差距,我们将此问题重构为几何异常最小化问题。我们提出了SCAGE:SCene Anomaly Guided Exploration(场景异常引导探索框架),这是一种直接在非结构化3D点云上运行的新型自主探索框架。我们不是盲目追逐体积边界,而是赋予机器人对标准室内架构的基础理解。当传入的几何形状与典型室内环境的已知先验(如破碎的墙壁或部分桌子)相矛盾时,系统会将这些区域标记为场景异常。这些几何不一致性作为引导信号,自然地将机器人吸引到最佳观察点以调查并解决这些结构异常。通过主动针对重建不佳的区域,而不仅仅是空白空间,我们的方法无缝地将空间发现与高保真建图相结合。广泛的评估表明,SCAGE实现了优越的体积覆盖率(在现有最先进基线中约为90%)。
I. 引言
自主探索要求移动机器人导航穿过未知的3D环境,以构建数字地图、搜索物体或收集关键信息。这种能力对于广泛的世界级应用至关重要,包括搜救[1]、农业监测[2]和基础设施检查[3]。高效的自主探索,无论是旨在最大化映射体积、丰富语义理解还是提高3D重建质量,最终都归结为确定最佳姿态序列。
历史上,探索策略依赖于几何启发式方法,要么驱动机器人朝向已映射和未映射空间之间的边界[4], [5],要么根据基于占用率的指标评估候选姿态并选择信息量最大的姿态[6], [7]。在这两种情况下,效用都是通过向占用网格进行射线投射来计算的,因此仅反映视点揭示的未知空间体积。由于未知区域未被区分,且已观测表面在标记为占用后即被视为已解决,这些方法奖励开阔的空洞,而非被遮挡或稀疏采样的几何结构,从而产生扩展覆盖率但使结构重要区域重建不佳的轨迹。
最近基于学习的方法试图克服这些局限性,并在3D重建质量方面优于传统方法。然而,由于未知区域未被区分,且已观测表面在标记为占用后即被视为已解决,这些方法奖励开阔的空洞,而非被遮挡或稀疏采样的几何结构,从而产生扩展覆盖率但使结构重要区域重建不佳的轨迹。
1机器人研究中心,印度海得拉巴印度理工学院 †项目页面:https://beyondfrontiers.github.io arXiv:2607.15828v1
第 2 页
通过神经网络预测未映射区域的潜在价值来克服这些局限性。• 我们通过广泛的评估证明,SCAGE 在体积覆盖率(提升约 15%)和 3D 重建质量(误差减半)方面均优于最先进的探索基线。
这些方法通常依赖于 2D 视觉线索 [8], [9] 或外部基础模型 [10]。更重要的是,它们狭隘地专注于最大化空间覆盖率。这无意中使探索空间的行为与生成高保真 3D 重建的最终目标脱节,导致生成的地图可能在体积上完整,但缺乏几何细节或结构完整性(如图 1 所示)。虽然最近的研究开始利用场景补全网络 [11] 和语义先验 [12],通过外推未观测体积来预测信息增益,但这些显式的幻觉方法由于在可靠补全高度复杂的室内场景方面能力有限,往往作为微弱的探索指标。
在本文中,我们引入了一种自主探索的新范式:我们不再仅仅搜索体积边界,而是将探索重构为一个几何异常最小化问题。我们问:我们当前的重建中哪一部分未能满足我们学到的建筑先验?通过针对这些几何矛盾,我们自然地引导机器人走向那些被忽视的未解决或被遮挡的区域。
典型的室内环境表现出可预测的几何分布,如平墙、正交交点和标准的家具布局。不完整、稀疏或被遮挡的观察结果本质上偏离了这些分布,从而产生了我们定义的“场景异常”,即观测到的 3D 几何结构与既定建筑逻辑相矛盾的局部区域。我们提出了 SCAGE:SCene Anomaly Guided Exploration(场景异常引导探索框架),这是一种直接在 3D 点云上运行以识别这些异常的 novel 探索框架。我们框架的核心是 ∆-Net,这是一种基于 Point Transformer V3 [13] 架构的去噪自编码器。∆-Net 旨在学习典型室内结构的几何先验,显式地预测部分观测与其预期建筑形式之间所需的逐点分布偏移(即 ∆)。关键在于,我们在局部点云块上训练网络,而不是整个空间布局,以专注于学习构成典型室内环境的基本结构特征。
在在线探索期间,网络为传入的观察结果预测逐点几何偏差向量。高度异常的区域被聚类以动态计算自适应的 6-DoF 观察视点。在两步前瞻效用规划器的引导下,这种异常驱动的方法自然地引导机器人走向未探索和重建不足的区域,使系统能够同时最大化覆盖率和最小化重建误差。
总之,我们工作的关键贡献在于: • 我们将 3D 自主探索重构为异常最小化问题,引入了一种新颖的框架 SCAGE,该框架利用几何偏差来驱动导航。 • 我们设计了一个去噪自编码器 ∆-Net,它从局部点云块中高效地学习标准室内环境的结构先验。
II. 相关工作
基于几何的探索。传统的探索依赖于几何启发式方法来确定最佳视点。基于前沿(Frontier-based)的方法提取已知区域和未映射区域之间的边界以指导导航 [4], [5]。或者,基于采样的方法针对地图熵和不确定性等指标评估候选位姿,以最大化体积覆盖率 [6], [7]。混合方法弥合了这些范式,要么通过熵和旅行时间效用函数评估前沿采样视点 [14],要么将全局前沿探索与局部最佳下一步视图规划(NBVP)[15] 相结合。最近的层次化框架进一步优化了这些大规模 3D 环境中的策略 [16]。尽管这些方法最大化了映射体积,但它们忽视了环境的潜在结构背景,往往导致以发现新空间为代价对局部区域进行短视的过度探索。
基于学习的探索。为了克服纯几何方法的局限性,最近的文献越来越多地利用基于学习的视觉算法。例如,几种方法使用 3D 占用预测模型或场景补全网络 [11], [12] 估计候选前沿的信息增益,而其他方法则完全绕过稠密 3D 地图,直接从 2D 视觉线索 [8] 预测前沿效用。新兴框架探索新的地图结构,利用神经隐式表示 [17], [18] 和 3D 高斯 [19], [20], [21]。除了纯几何之外,将外观数据(如对象级语义)纳入 3D 表示已被证明对于细化轨迹和视点评估是有效的 [22], [23], [24]。最后,替代范式将探索视为一个决策问题,在彩色图像上采用强化学习 [10], [25], [26],或利用视觉基础模型和 LLM 引导类人导航 [27], [28], [29]。
重新定义探索的前沿。与现有的依赖 2D 视觉线索或体素补全以最大化覆盖率的基于学习的方法不同,我们的方法直接在 3D 点云上运行。我们将目标从简单地寻找空空间转变为检测结构异常,引导机器人走向偏离典型室内环境预期几何结构的区域。这使得我们的系统能够同时最大化覆盖率和最小化重建误差,自然地针对标准体积驱动方法所忽略的未解决或被遮挡的区域。
III. SCAGE 概述
我们在图 2 中展示了所提出的 SCAGE 流程概述。该框架由两个主要阶段组成。
第 3 页
变换 训练流程 噪声 剪切 掩码
Kadamb Niv
A B C 获取 探索 探索 场景异常 相机生成 减少异常
图 2: SCAGE 概述。上部:训练流程。给定室内场景的点云,我们将其分割以获得真实值块 $\rho_{gt}$。我们应用变换 $T$(例如,噪声、剪切、掩码)以模拟部分可观测性,从而得到 $\rho_{noisy}$。我们的 $\Delta$-Net 架构处理此损坏的输入,以预测逐点分布偏移 $\Delta\rho$,可视化为由指向真实值 $\rho_{gt}$ 的逐点箭头映射的噪声输入 $\rho_{noisy}$。预测的 $\Delta\rho$ 被添加到 $\rho_{noisy}$ 以获得 $\rho_{pred}$。网络通过最小化 $\rho_{pred}$ 和 $\rho_{gt}$ 之间的 $L_{Chamfer-Distance}$ 进行训练。下部:探索阶段。给定来自初始位姿 $P_1$ 的部分 3D 观测,$\Delta$-Net 预测分布偏移,该偏移被阈值化以识别场景异常 (A),其中黄色代表高异常区域。相机被生成以针对这些异常,生成候选 6-DoF 视点(红色视锥)。然后机器人导航至最佳位姿 $P_2$。从 $P_2$ 看到的异常 (B) 在捕获新点云后得到解决 (C),从而实现高保真 3D 重建。
首先,在训练流程(第 III-A 节)中,我们训练一个基于点的去噪自编码器,以学习典型室内环境的潜在结构先验。其次,在探索阶段(第 III-B 节),我们利用这些学习到的先验中的逐点分布偏移来识别未见过的区域。这些结构偏差的大小作为异常分数,以驱动自主探索。
A. 学习室内场景的样子 数据准备。我们的目标是捕捉完整、完全观测到的室内场景的几何分布。为此,我们将来自 Matterport3d 数据集 [30] 的各种室内场景的 3D 点云分割为局部块 $\rho_{gt} \in \mathbb{R}^{N \times 3}$ ($N = 4096$)。为了构建监督训练对,教导网络将退化观测映射回其理想化的结构形式,我们对这些真实值块应用一系列随机变换 $T$。具体而言,我们通过注入具有不同标准差的高斯噪声、应用各向异性缩放以及利用随机点掩码(如图 2 所示)来损坏输入,以模拟几何失真、部分覆盖和由现实世界深度传感引起的遮挡,从而产生噪声输入块:$\rho_{noisy} = T(\rho_{gt})$。
模型架构与训练。我们的架构基于 Point Transformer V3 [13] 骨干网络构建,该骨干网络通过空间填充曲线将非结构化 3D 点集序列化为 1D 序列并应用局部序列化注意力,从而高效处理 3D 数据。给定噪声输入点云块 $\rho_{noisy} \in \mathbb{R}^{N \times 3}$,所提出的网络 $\Delta$-Net 采用分层编码器-解码器结构,我们从零开始训练该结构。
编码器逐步将点分辨率下采样为紧凑的 512 通道潜在表示。对称解码器随后将此潜在表示上采样回原始点分辨率,最终的多层感知机 (MLP) 头预测逐点分布偏移向量 $\Delta\rho \in \mathbb{R}^{N \times 3}$。最终的去噪坐标计算为 $\rho_{pred} = \rho_{noisy} + \Delta\rho$。
在训练期间,$\Delta$-Net 通过最小化预测块 $\rho_{pred}$ 和真实值块 $\rho_{gt}$ 之间的 Chamfer Distance 来优化以重建潜在几何结构。
$$ L_{CD}(\rho_{pred}, \rho_{gt}) = \sum_{x \in \rho_{pred}} \min_{y \in \rho_{gt}} \|x – y\|_2^2 + \sum_{y \in \rho_{gt}} \min_{x \in \rho_{pred}} \|x – y\|_2^2 \quad (1) $$
这种双向损失惩罚空间发散,迫使自编码器将异常点映射回学习到的标准室内建筑分布。由此产生的逐点分布偏移向量 $\Delta\rho$ 捕获每个观测区域偏离学习到的几何先验的程度,并在推理期间用于引导机器人前往结构不完整的区域,如下所述。
关键的是,我们通过排除编码器和解码器之间的任何跳跃连接来强制执行严格的信息瓶颈,防止网络绕过此压缩表示并直接复制输入特征。这一设计选择迫使自编码器内化典型室内结构的几何先验,而不是过拟合训练数据中存在的特定损坏。
B. 使用场景异常进行探索 检测场景异常。在探索期间,从初始相机位姿开始,我们获取深度图并将其反向投影到 3D 以获得观测场景的点云。在后续迭代中,新反向投影的点与累积的场景表示合并以形成全局点集 $P$。
第 4 页
视点生成。对于每个聚类 $C_k$,我们计算一个 6-DoF 观测视点,直接针对检测到的异常(如图 3 所示)。我们首先获取几何中心(锚点)$a_k$,并提取指向传感器原点的局部表面法向量 $\hat{n}_k$,以确保生成的视点位于已观测的自由空间内。
观测距离必须适应每个异常的空间范围:小聚类可以从近距离观测,而空间延伸较大的区域则需要相机后退,以便整个聚类保持可见。具体而言,我们计算 $d_{\text{standoff}}$,即聚类空间半径 $r_k = \max_{p_j \in C_k} \|p_j – a_k\|_2$ 所张角度不超过相机水平视场角的最小距离:
$$ d_{\text{standoff}} = \max \left( d_{\text{min}}, \frac{r_k}{\tan(\theta_{\text{FOV}}/2)} \right) \quad (3) $$
其中 $d_{\text{min}}$ 强制执行物理安全裕度。候选相机位置随后为 $P_{\text{cam},k} = a_k + d_{\text{standoff}} \cdot \hat{n}_k$,相机偏航角朝向 $a_k$,从而完全定义一个初步的 6-DoF 目标位姿 $T_k$。
图 3:基于场景异常的视点生成。左上角:场景的一部分,相机用蓝色视锥体表示。右上角:从该相机视角获得的逐点异常分数,高异常区域显示为黄色。左下角:异常被聚类为不同颜色的区域。右下角:对于每个聚类,聚类锚点用红点显示,相应的候选 6-DoF 视点(红色视锥体)朝向每个异常聚类生成。它们放置在距离聚类锚点一定 standoff 距离处(其中一个相机的 standoff 距离用粉线表示),以适应聚类的大小。较大的聚类(例如墙壁边界)产生较大 standoff 距离的视点,而紧凑的聚类则从近距离观测,确保每个异常区域完全包含在相机的视场角内。
目标细化与选择。由于密集异常聚类可能会产生冗余或运动学上不可达的目标,所有候选目标都经过严格的细化阶段。目标在空间上进行整合以合并高度重叠的视图,随后针对体积占用网格进行自由空间和视线验证。然后,对于每个幸存的候选目标 $T_k$,我们使用以下效用函数评估其探索价值:
$$ u(T_k) = \frac{g(T_k) \cdot s_k}{\max(\|P_{\text{robot}} – P_{\text{cam},k}\|_2, \epsilon)} \quad (4) $$
其中 $g(T_k)$ 是通过射线投射计算出的预期体积信息增益,$s_k$ 是聚类 $C_k$ 的平均异常分数,分母表示从机器人当前位置到相机的欧几里得遍历成本。这种公式平衡了三个相互竞争的目标:偏好揭示新体积的视图、解析高异常区域以及最小化旅行距离。我们在表 II 中对这一设计进行了消融实验,证明了所有三个项对于强大性能都是必要的。机器人通过 RRT* 算法 [31] 规划的无碰撞目标路径导航至效用最大化目标。
为了保持均匀的空间密度并控制计算成本,我们应用分辨率为 0.05m 的体素下采样,以获得过滤后的点云 $\tilde{P}$。然后,将下采样的点云划分为重叠的局部块,每个块由 $\Delta$-Net 独立处理。
对于每个块 $\rho \in \mathbb{R}^{N \times 3}$,网络预测逐点分布偏移 $\Delta_\rho \in \mathbb{R}^{N \times 3}$。对于点 $p_i \in \rho$,令其预测偏差向量为 $\Delta p_i$。如果一个点属于多个重叠块,我们通过取最大响应来聚合其偏差幅度。这在 $\tilde{P}$ 上产生全局偏差场。
然后,我们计算全局归一化的异常分数:
$$ s_i = \frac{\|\Delta p_i\|_2 – \min_j \|\Delta p_j\|_2}{\max_j \|\Delta p_j\|_2 – \min_j \|\Delta p_j\|_2}, \quad s_i \in [0, 1] \quad (2) $$
其中极值是在 $\tilde{P}$ 中的所有点上评估的。
其中逐点异常分数量化了局部几何偏离学习到的结构先验的程度,并作为探索的信号。为了减少冗余计算,我们跳过位于低异常邻域内的点的重新处理,从而将推理集中在结构不确定和未探索的区域。
探索未知。为了将这些异常信号转换为可导航的目标,我们提取异常集合 $A = \{p_i \in \tilde{P} \mid s_i > \tau\}$,其中 $\tau = 0.5$ 是经验选择的阈值。由于这些异常点通常代表连续的未观测区域或边界,我们使用基于球查询的聚类将 $A$ 分组为不同的目标聚类 $C_k$。
IV. 实验与结果
A. 实验设置
实现细节。为了确保 $\Delta$-Net 从结构完整的环境中学习几何先验,我们整理了来自 Matterport3D 数据集的 75 个高保真场景作为训练集。这些场景因其高结构完整性而被专门选中,积极过滤掉具有显著伪影或缺失几何形状的点云。通过在 Matterport3D 上仅对这些干净、连续流形进行 $\Delta$-Net 训练,并在未见过的 HM3D 验证场景上进行评估,我们展示了所学先验的跨数据集鲁棒泛化能力。该网络在单个 NVIDIA RTX A6000 GPU 上训练了 600 个 epoch。
第 5 页
经典方法 [4] NBVP [7] FrontierNet [8] SCAGE
图 4:定性比较。(覆盖率与轨迹)。我们的方法与基线方法在 3 个场景上的探索结果(从上到下:804、812、824)。起始位置用青色点标记,未探索区域显示为灰色。轨迹颜色从起点的青色渐变至终点的粉色。我们的方法 SCAGE 在所有场景上均实现了所有基线中的最大覆盖率。尽管 FrontierNet [8] 看似实现了高覆盖率,但它往往只访问房间入口处的区域,未能捕捉构成房间的结构元素,如椅子或床。相比之下,通过将探索建模为异常最小化问题,我们既实现了最大覆盖率,又获得了高质量的重建,捕捉到了构建室内场景的所有细微细节。
基准标准化与仿真。正如 FrontierNet [8] 最近指出的那样,自主探索系统的评估经常因缺乏标准化的测试协议以及依赖有限且分散的场景而受到阻碍。鉴于此评估,我们采用其提出的评估框架以确保透明的比较。我们使用 HM3D 验证场景的相同子集来评估我们的方法,这些场景涵盖了不同的几何复杂度和空间尺度,并强制执行每集相同的最大仿真步数。通过固定验证集划分、剧集视界和传感器规格,我们将学习到的先验知识隔离为性能提升的唯一来源。我们使用 Open3D 模拟相机视点并渲染图像,以 480 × 480 的分辨率生成深度图。传感器配置为视场角 (FOV) 77.32°× 77.32°,最大深度范围为 5m。深度输入以两种变体进行处理:(1) 直接从仿真中渲染的完美深度;(2) 由 Metric3D v2 [32] 预测的噪声深度。我们使用 Octomap 维护体积占用图,并依赖 Open Motion Planning Library (OMPL) 进行底层 3D 路径生成。
B. 结果
基线。我们将 SCAGE 的探索效率与三个成熟的框架进行基准测试,这些框架涵盖了传统和学习范式:我们实现的经典基于前沿的方法 [4]、基于采样的最佳视角规划器 (NBVP) [7],以及最近最先进的视觉探索方法 FrontierNet [8]。为了保证公平和严格的比较,我们使用官方基线实现,并严格遵守 [8] 定义的评估配置,具体测试其相同的 10 个验证网格子集,并强制执行其精确的场景特定最大步数预算。我们在仿真器提供的完美深度下评估基线,并在仿真器提供的深度和 Metric3D v2 [32] 提供的深度下评估我们的方法。
定量评估 我们使用两个主要指标量化探索性能:体积覆盖率和重建质量(通过 Chamfer Distance 衡量),后者是在多个起始位置的多轮运行中取平均值。如表 I 摘要所示,SCAGE 始终优于所有基线,在所有评估场景中实现了约 90% 的最大体积覆盖率,比最佳基线 FrontierNet [8] 提高了约 15%。这表明我们的方法能够彻底导航和映射复杂布局,而不会过早终止或留下大量未探索区域。
关键在于,这种广泛的覆盖率并未以几何细节为代价。我们的方法实现了最佳的整体重建质量,证据是它产生了所有评估方法中最低的 Chamfer Distance。与最佳基线相比,我们实现了不到一半的
第 6 页
场景 ID
方法 804 807 812 824 827 834 854 876 879 880 均值
Classic [4] 30.9 ± 5.3 45.6 ± 2.2 64.5 ± 4.8 48.9 ± 2.3 59.1 ± 7.9 49.7 ± 5.3 51.3 ± 4.4 44.2 ± 8.8 50.2 ± 4.1 62.4 ± 5.3 50.7 NBVP [7] 37.1 ± 6.7 50.1 ± 3.2 83.7 ± 4.1 64.3 ± 4.8 76.7 ± 4.1 64.0 ± 9.4 80.3 ± 2.3 61.4 ± 10.3 63.1 ± 8.4 47.2 ± 3.1 62.8 体积覆盖率 ↑ FrontierNet [8] 55.4 ± 7.1 56.1 ± 6.1 81.8 ± 2.2 72.4 ± 6.2 73.4 ± 9.1 74.5 ± 10.3 93.1 ± 5.3 75.9 ± 8.5 70.8 ± 10.1 69.2 ± 10.1 72.3 SCAGE 92.5 ± 1.0 84.5 ± 0.3 88.8 ± 0.5 93.0 ± 0.5 90.0 ± 0.5 84.1 ± 0.5 91.4 ± 3.5 91.0 ± 0.1 90.4 ± 0.1 91.6 ± 0.8 89.7 SCAGE* 90.1 ± 1.9 81.5 ± 2.4 85.8 ± 1.8 90.0 ± 2.1 87.3 ± 3.5 83.1 ± 1.1 92.1 ± 4.5 92.9 ± 1.6 88.4 ± 0.3 90.1 ± 3.8 88.1
Classic [4] 12.0 ± 4.0 11.0 ± 3.5 3.5 ± 1.0 5.5 ± 2.0 6.0 ± 2.5 4.5 ± 2.0 1.5 ± 1.0 4.5 ± 2.0 6.5 ± 2.5 10.5 ± 4.0 6.55 NBVP [7] 9.5 ± 3.5 8.5 ± 3.0 1.8 ± 0.8 3.5 ± 1.5 3.8 ± 1.8 2.8 ± 1.5 0.8 ± 0.5 2.8 ± 1.2 4.5 ± 2.0 8.0 ± 3.5 4.60 Chamfer(×10−3) ↓ FrontierNet [8] 7.1 ± 3.4 6.5 ± 2.9 0.9 ± 0.3 1.9 ± 1.4 2.1 ± 1.5 1.4 ± 0.9 0.6 ± 0.2 1.5 ± 1.2 2.9 ± 1.8 5.3 ± 4.3 3.02 SCAGE 1.2 ± 0.8 0.5 ± 0.3 0.7 ± 0.2 1.0 ± 0.6 0.6 ± 0.4 1.6 ± 0.4 0.5 ± 0.0 0.6 ± 0.1 0.6 ± 0.1 1.7 ± 0.5 0.91 SCAGE* 2.4 ± 1.2 1.2 ± 0.6 1.6 ± 0.5 2.1 ± 1.0 1.3 ± 0.7 3.1 ± 0.9 1.3 ± 0.3 1.4 ± 0.4 1.3 ± 0.3 3.2 ± 1.1 1.89
表 I:定量比较。比较体积覆盖率和由 Chamfer Distance 量化的重建质量的实验结果。我们的方法在所有场景中实现了最大的覆盖率(约 90%,比最佳基线平均高出约 15%),展示了其在不遗漏场景任何部分的情况下进行探索的能力。更重要的是,伴随着覆盖率,我们实现了最佳的重建质量,如最低的 Chamfer Distance 所示。与最佳基线相比,我们的重建误差平均减少了一半以上。注意我们方法的标准差较低,突显了其在多次运行中对不同初始位置的鲁棒性。第一行的三位数字是场景 ID。前四行的结果使用了来自模拟器的深度数据,包括 SCAGE,而最后一行 SCAGE* 使用了由 Metric3D v2 [32] 估计的深度。红色、橙色和黄色高亮分别表示表现第一、第二和第三好的技术。
经典方法 [4] NBVP [7] FrontierNet [8] SCAGE (场景 804、812 和 824)如图 4 所示。从相同的 初始位置开始,基线方法经常停滞或留下 环境的大量部分未被探索。 值得注意的是,虽然像 FrontierNet [8] 这样的方法 在数值上似乎具有竞争力的覆盖率,但其定性 行为揭示了一个关键缺陷。FrontierNet 倾向于通 过简单地访问房间入口来最大化其体积奖励, 未能深入空间内部去观察实际构成房间的 结构元素(见图 4)。相比之下,通过将探索建模为几何 异常最小化问题,SCAGE 主动寻找未解决的几何 结构,驱动机器人深入房间以 捕捉细微细节。 定性结果:重建质量。这种 针对结构异常的解决直接转化为 极高的视觉保真度,如图 5 所示。 虽然传统方法通常产生碎片化或 图 5:定性比较。(重建质量)。 部分重建的被遮挡物体,SCAGE 捕获了Results comparing reconstruction quality of our method against baselines. By not just focusing on maximizing the coverage, but 室内场景的完整结构细节。我们的 capturing all the structural details of indoor scenes, our method 异常引导方法成功且完整地重 achieves the best visual fidelity. We are able to reconstruct com- 建了各种各样的环境元素。这 pletely all elements that compose a house: not just chairs, dining 包括复杂的杂乱物体,如椅子、餐桌 tables and beds but floor and ceiling as well; while other methods 和床,以及广阔、无特征的表面,如 are only able to achieve partial reconstruction. Notice the white areas that represent regions of the scene which these methods fail 地板和天花板。通过优先考虑结构完整性 to scan and reconstruct. 而非纯粹的空间扩展,我们的方法确保了 最终的 3D 地图既在体积上广阔,又在几 误差使用完美深度,以及使用由 Metric3D v2 [32] 估计的深度约 60%)。此外,SCAGE 在多次评估运行中表现出 remarkably low standard deviation across multiple eval- 何上准确。 uation runs with varying starting positions. This highlights 消融研究:效用函数设计。我们在表 II 中对效用函数(公式 4)的组件进行了消融。 the inherent robustness of the anomaly-driven formulation, 仅依赖异常分数(¯sk)产生了第二高的覆盖率,突显了针对结构模糊性的原始探索能力。 proving that the system reliably captures high-fidelity maps 通过距离对其进行惩罚(¯sk/d(Tk)会降低性能,因为遍历项偏向于选择附近的 regardless of the robot’s initial initialization pose. 目标,导致机器人过度局部投入。完全丢弃异常信号 Qualitative Results: Coverage and Exploration Tra- (g(Tk)/d(Tk),等同于 NBVP [7])是最弱的: jectories. To visually demonstrate the behavioral differences 没有结构线索来区分哪些未观察到的
第 7 页
场景 ID
效用函数 804 876 834 均值
¯sk 77.0 ± 6.5 74.0 ± 7.8 73.1 ± 9.2 74.7 ¯sk/d(Tk) 73.5 ± 6.2 69.9 ± 8.6 72.0 ± 9.8 71.8 g(Tk)/d(Tk) 38.1 ± 6.2 63.4 ± 9.5 63.1 ± 9.1 54.9 g(Tk) · ¯sk/d(Tk) (Ours) 92.5 ± 1.0 91.0 ± 0.1 84.1 ± 0.5 89.2
表 II:消融研究:效用函数设计。在三个场景中,比较不同效用公式的体积覆盖率(%)。g(Tk) 表示体积信息增益,¯sk 为平均聚类异常分数,d(Tk) = max(∥Probot −Pcam,k∥2, ϵ) 为遍历成本。结果表明,整合所有三个项对于最大化探索性能至关重要。
图 7:涌现的结构理解。从场景 876(顶部)和 879(底部)的 ∆-Net 编码器中提取的特征的 PCA 可视化。结构相似的区域在不同房间中共享一致的特征表示(颜色)。例如,地板、天花板和床等平面水平表面表现出均匀的颜色,而风扇、椅子和厨房橱柜等物体则与其结构背景形成鲜明对比。
而是记住训练示例,去理解此类结构的构成。然而,训练分布中缺失的对象类别(例如实验室中的其他移动机器人)会引发较弱的异常响应,并通过周围区域的异常被观察到。
D. 涌现的结构理解
除了定量的覆盖率和重建指标外,我们还观察到 SCAGE 的成功源于网络对室内环境的深层、内在理解。为了调查网络学到了什么,我们从 ∆-Net 编码器中提取密集潜在特征,并使用主成分分析(PCA)将其投影到 RGB 空间(图 7)。尽管该网络完全从头开始训练,没有任何显式的语义监督,但它自然地学会了将相似的结构和语义元素分组。
水平表面(地板、天花板和床)共享一致的特征分布,而独特的建筑物体(如吊扇、椅子和桌子)则高度孤立。这种涌现的结构意识突显了 Point Transformer V3 [13] 骨干网络的强大表达能力。因为模型真正学习了房屋构建的基本要素,所以它能准确地识别场景异常以驱动探索。此外,这些学习到的表示的丰富性表明,我们的预训练编码器可以作为强大的现成特征提取器,用于复杂的下游应用,例如零样本语义分割或物体目标导航。
C. 真实世界验证
我们将 SCAGE 实现为 ROS 包,并部署在配备 RealSense D455 深度相机的 P3DX 机器人上,该相机提供 10 Hz 的 640×360 RGB-D 图像。所有计算均在配备 i5-9300H CPU、32 GB RAM 和 RTX 2060 GPU 的笔记本电脑上进行,实现约 7 Hz 的推理速度以进行实时点云处理。我们在图 6 中展示了结果。尽管是在来自 Matterport3D 数据集的完美房屋上进行训练,SCAGE 在真实世界环境中依然稳健,机器人成功映射了大型室内场景的结构组件。值得注意的是,尽管实验室中的不完整椅子、隔断和墙壁与训练期间看到的特定实例不同,但 ∆-Net 仍将其标记为异常,这证实了网络已经学习了底层几何结构。
图 6:真实世界验证。实验室的示意图代表性地图(左上角)以及由此产生的 3D 点云重建(为了可见性裁剪了屋顶)。机器人的轨迹从绿色起点开始。周围颜色编码的图像对应于绿色、蓝色和红色标记,展示了机器人在环境中的位置及其在捕获那一刻的自视角,包括来自起始位置的一个点云。
V. 结论
我们提出了 SCAGE,一种新颖的自主探索框架,成功弥合了空间覆盖与高保真 3D 重建之间的差距。通过将探索重新定义为几何异常最小化问题,我们超越了传统的探索启发式方法。我们方法的核心是 ∆-Net,这是一种 3D 去噪自编码器,它直接从局部点云块中学习典型室内环境的基础结构先验。
第 8 页
在导航过程中,我们的系统持续将实时 [12] Y. Tao, Y. Wu, B. Li, F. Cladera, A. Zhou, D. Thakur, and V. Kumar, 3D 观测结果与这些学习到的期望进行对比,识 “Seer: Safe efficient exploration for aerial robots using learning to 别出几何矛盾作为场景异常。通过从最佳观测点动 predict information gain,” arXiv preprint arXiv:2209.11034, 2022. 态地针对并解决这些结构歧义,SCAGE 将空间发 [13] X. Wu, L. Jiang, P.-S. Wang, Z. Liu, X. Liu, Y. Qiao, W. Ouyang, 现与精确几何映射无缝耦合。广泛的评估表明,我 T. He, and H. Zhao, “Point transformer v3: Simpler faster stronger,” 们的方法在体积覆盖率方面优于最先进基线(场景 in Proceedings of the IEEE/CVF conference on computer vision and 覆盖率约为 90%,提升了约 15%),并且重建质量 pattern recognition, 2024, pp. 4840–4851. 更高(误差减半)。最终,通过将主要的探索信号 [14] A. Dai, S. Papatheodorou, N. Funk, D. Tzoumanikas, and S. Leuteneg- 从简单地寻找未映射空洞转变为主动实现结构理 ger, “Fast frontier-based information-driven autonomous exploration 解,这项工作为自主 3D 场景探索确立了新方向。 with an mav,” in 2020 IEEE international conference on robotics and automation (ICRA). IEEE, 2020, pp. 9570–9576. 致谢。作者感谢印度政府 MeitY 在项目 [15] M. Selin, M. Tiger, D. Duberg, F. Heintz, and P. Jensfelt, “Efficient “无人机系统(无人机及相关技术)人力资源发展能 autonomous exploration planning of large-scale 3-d environments,” 力建设”下提供的支持。 IEEE Robotics and Automation Letters, vol. 4, no. 2, pp. 1699–1706, 2019. 参考文献 [16] C. Cao, H. Zhu, H. Choset, and J. Zhang, “Tare: A hierarchical framework for efficiently exploring complex 3d environments.” in [1] M. Tranzatto, F. Mascarich, L. Bernreiter, C. Godinho, M. Camurri, [17] Z. Yan, H. Yang, and H. Zha, “Active neural mapping,” in Proceedings S. Khattak, T. Dang, V. Reijgwart, J. L¨oje, D. Wisth et al., “Cerberus: of the IEEE/CVF International Conference on Computer Vision, 2023, Autonomous legged and aerial robotic exploration in the tunnel and pp. 10 981–10 992. urban circuits of the darpa subterranean challenge,” Field Robotics, [18] S. Lee, L. Chen, J. Wang, A. Liniger, S. Kumar, and F. Yu, “Uncer- vol. 2, pp. 274–324, 2022. tainty guided policy for active robotic 3d reconstruction using neural [21] Y. Tao, D. Ong, V. Murali, I. Spasojevic, P. Chaudhari, and V. Kumar, radiance fields,” IEEE Robotics and Automation Letters, vol. 7, no. 4, “Rt-guide: Real-time gaussian splatting for information-driven explo- pp. 12 070–12 077, 2022. [2] C. Gao, F. Daxinger, L. Roth, F. Maffra, P. Beardsley, M. Chli, and ration,” IEEE Robotics and Automation Letters, 2025. [19] W. Jiang, B. Lei, K. Ashton, and K. Daniilidis, “Ag-slam: Active L. Teixeira, “Aerial image-based inter-day registration for precision [22] S. Papatheodorou, N. Funk, D. Tzoumanikas, C. Choi, B. Xu, and gaussian splatting slam,” arXiv preprint arXiv:2410.17422, 2024. agriculture,” in 2024 IEEE International Conference on Robotics and S. Leutenegger, “Finding things in the unknown: Semantic object- [20] W. Jiang, B. Lei, and K. Daniilidis, “Fisherrf: Active view selection Automation (ICRA). IEEE, 2024, pp. 11 862–11 868. centric exploration with an mav,” in 2023 IEEE International Confer- and mapping with radiance fields using fisher information,” in Euro- [3] M. F. Ginting, D. D. Fan, S.-K. Kim, M. J. Kochenderfer, and A- ence on Robotics and Automation (ICRA). IEEE, 2023, pp. 3339– pean Conference on Computer Vision. Springer, 2024, pp. 422–440. A. Agha-Mohammadi, “Semantic belief behavior graph: Enabling 3345. autonomous robot inspection in unknown environments,” in 2024 [23] O. Alama, A. Bhattacharya, H. He, S. Kim, Y. Qiu, W. Wang, C. Ho, [24] S. Kim, O. Alama, D. Kurdydyk, J. Keller, N. Keetha, W. Wang, IEEE/RSJ International Conference on Intelligent Robots and Systems N. Keetha, and S. Scherer, “Rayfronts: Open-set semantic ray frontiers Y. Bisk, and S. Scherer, “Raven: Resilient aerial navigation via (IROS). IEEE, 2024, pp. 7604–7610. for online scene understanding and exploration,” in 2025 IEEE/RSJ open-set semantic memory and behavior adaptation,” arXiv preprint [4] B. Yamauchi, “A frontier-based approach for autonomous exploration,” International Conference on Intelligent Robots and Systems (IROS). arXiv:2509.23563, 2025. in Proceedings 1997 IEEE International Symposium on Computational IEEE, 2025, pp. 5930–5937. [25] D. S. Chaplot, E. Parisotto, and R. Salakhutdinov, “Active neural Intelligence in Robotics and Automation CIRA’97.’Towards New Com- [26] D. S. Chaplot, M. Dalal, S. Gupta, J. Malik, and R. R. Salakhutdinov, localization,” arXiv preprint arXiv:1801.08214, 2018. putational Principles for Robotics and Automation’. IEEE, 1997, pp. “Seal: Self-supervised embodied active learning using exploration and [27] N. Yokoyama, S. Ha, D. Batra, J. Wang, and B. Bucher, “Vlfm: Vision- 146–151. 3d consistency,” Advances in neural information processing systems, language frontier maps for zero-shot semantic navigation,” in 2024 [5] W. Gao, M. Booker, A. Adiwahono, M. Yuan, J. Wang, and Y. W. Yun, vol. 34, pp. 13 086–13 098, 2021. IEEE International Conference on Robotics and Automation (ICRA). “An improved frontier-based approach for autonomous exploration,” in [28] J. Chen, G. Li, S. Kumar, B. Ghanem, and F. Yu, “How to not IEEE, 2024, pp. 42–48. 2018 15th international conference on control, automation, robotics train your dragon: Training-free embodied object goal navigation with [29] K. Qu, J. Tan, T. Zhang, F. Xia, C. Cadena, and M. Hutter, “Ippon: and vision (ICARCV). IEEE, 2018, pp. 292–297. semantic frontiers,” arXiv preprint arXiv:2305.16925, 2023. Common sense guided informative path planning for object goal [6] A. Bircher, M. Kamel, K. Alexis, H. Oleynikova, and R. Siegwart, [30] A. Chang, A. Dai, T. Funkhouser, M. Halber, M. Niessner, M. Savva, navigation,” arXiv preprint arXiv:2410.19697, 2024. “Receding horizon” next-best-view” planner for 3d exploration,” in S. Song, A. Zeng, and Y. Zhang, “Matterport3d: Learning from rgb-d [31] S. Karaman and E. Frazzoli, “Sampling-based algorithms for optimal 2016 IEEE international conference on robotics and automation data in indoor environments,” arXiv preprint arXiv:1709.06158, 2017.
[10] Y. Tao, E. Iceland, B. Li, E. Zwecher, U. Heinemann, A. Cohen, A. Avni, O. Gal, A. Barel, 和 V. Kumar,“利用自主微型飞行器学习探索室内环境,”在 2024 IEEE 国际机器人与自动化会议 (ICRA) 中。IEEE,2024,第 15 758–15 764 页。
[11] L. Schmid, M. N. Cheema, V. Reijgwart, R. Siegwart, F. Tombari,和 C. Cadena,“Sc-explorer:用于安全高效探索、建图和规划的增量 3D 场景补全,”arXiv 预印本 arXiv:2208.08307,2022。
[32] M. Hu, W. Yin, C. Zhang, Z. Cai, X. Long, H. Chen, K. Wang, G. Yu, C. Shen, 和 S. Shen,“Metric3d v2:用于零样本度量深度和表面法线估计的多功能单目几何基础模型,”IEEE 模式分析与机器智能汇刊,第 46 卷,第 12 期,第 10 579–10 596 页,2024。