在线3D场景图为什么总合并错?NoPA的粒子表示

三分钟导读:NoPA提出了一种基于非参数粒子集和MMD合并策略的在线3D场景图生成方法,在保持实时性的同时显著提升了物体关联和关系预测的准确性。

英文题目:NoPA: Non-Parametric Online 3D Scene Graph Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.00529

原始论文:PDF / 论文页面

对应视频标题:在线3D场景图为什么总合并错?NoPA的粒子表示|推荐指数:★★★★

这篇论文解决什么问题?

现有的在线3D场景图生成方法(如FROSS)使用高斯分布近似物体几何形状,导致几何细节丢失和在线推理中的物体合并错误(under-merging/incorrect merging),且SLAM-based方法计算开销大。

核心创新

  • 提出非参数粒子集表示法,替代单一高斯分布,保留多模态几何信息且内存恒定。
  • 设计基于MMD的两阶段合并框架,解决视角变化和噪声预测下的合并不稳定性。
  • 开发关系传播机制,利用几何相似性在亲和度簇内传播关系,弥补2D预测中的关系缺失。

方法概览

NoPA将物体表示为固定大小的非参数粒子集(Non-Parametric Particle Set),保留几何支持。采用两阶段合并策略:1) 恒定时间的Hellinger距离预过滤处理明确案例;2) 对模糊案例使用最大均值差异(MMD)进行分布级合并。此外,引入基于亲和度聚类(Affinity Clusters)的关系传播机制以恢复丢失的关系。

逐图理解论文

NoPA方法概览

NoPA方法概览
Fig. 2: Overview of our online 3D scene graph generation pipeline. (1) A pretrained RT-DETR-EGTR [13,45] model predicts a local 2D scene graph from each RGB frame. (2) For every object node, we sample pixels inside its 2D bounding box, back-project them with depth, and obtain a 3D particle set in the world frame. (3) We associate each local particle set with existing global objects using a two-stage test: a constant-time Hellinger pre-filter followed by MMD on ambiguous cases. (4) We propagate relations within high-affinity clusters to reduce relation dropouts from the 2D predictor.

NoPA提出非参数粒子集表示,将物体建模为固定大小的3D粒子云,保留完整几何支持。流程包括:RT-DETR-EGTR预测2D场景图,反投影生成粒子集,通过两阶段策略关联全局物体,并利用亲和度聚类传播关系,减少2D预测中的关系遗漏。

非参数表示优势

非参数表示优势
Fig. 3: The visualization of objects in Scene 41385849 from the 3DSSG dataset. In the top row, we visualize an instance of the sink class localized by a red bounding box. In the bottom row, we visualize the global 3D object instances. Left: Visualized Gaussian blobs from FROSS [11]. The Gaussian blob only encompasses half of the sink in (a). Spurious blobs spanning across the scene in (c) visualizes the impact of incorrect merging. Right: Visualized kernel densities for our particle set. The entire sink is associated with our particle set in (b). Our representation attains good coverage on objects across the scene without large artifacts in (d).

对比FROSS的高斯Blob,NoPA的粒子集能完整覆盖复杂物体如洗手池。高斯近似常导致物体被截断或产生跨场景的虚假Blob,而NoPA通过核密度估计构建连续分布,无大伪影,显著提升物体定位的几何保真度。

3DSSG定量结果

3DSSG定量结果
Table 1: Comparison with state-of-the-art online 3D SSG generation approaches on the 3DSSG dataset with 20 object classes and 7 predicate classes. The top group of results are the reported results from the respective papers. The middle group of results marked with the \dagger are the reproduced results from the respective GitHub repositories. The Best and Second Best results are highlighted, respectively.

在3DSSG数据集上,NoPA取得Rel. Recall 53.2%,较FROSS提升27.5%。Obj. Recall达69.0%,Pred. Recall 61.4%。全面超越JointSSG等SOTA方法,证明非参数表示与MMD合并的有效性,尤其在复杂室内场景中表现优异。

ReplicaSSG泛化能力

ReplicaSSG泛化能力
Table 2: Comparison with FROSS on the ReplicaSSG dataset with 34 object classes and 9 predicate classes. \dagger refers to the reproduced results. The Best and Second Best results are highlighted, respectively.

在ReplicaSSG数据集上,NoPA Rel. Recall达36.9%,较FROSS提升65.5%。尽管物体类别更多,NoPA仍保持领先,Obj. Recall 28.6%,Pred. Recall 39.5%。这表明方法在不同数据集和场景分布下具有强大的泛化能力和鲁棒性。

定性对比分析

定性对比分析
Fig. 5: We compare the qualitative results between FROSS and our proposed approach for scene 321c867e from the 3DSSG dataset. The scene shows a kitchen from bird’s eye view (BEV). FROSS fails to predict a majority of the wall background class. As a consequence, a majority of the predicate relationships are lost. Our method correctly classifies most objects, except for the counter instance, while correctly predicting the majority of predicate relationships.

定性结果显示,FROSS常漏检墙体背景,导致关系丢失。NoPA正确分类大多数物体,并预测主要谓词关系。在厨房场景中,NoPA准确关联柜台与墙壁,而FROSS因分类错误导致关系链断裂,凸显NoPA在复杂关系推理上的优势。

实验与关键结果

  • 在3DSSG和ReplicaSSG数据集上与FROSS、JointSSG等SOTA方法对比。
  • 消融实验验证非参数表示、MMD合并和关系传播各组件的贡献。
  • 分析不同粒子数量、MMD阈值和模糊带宽度对性能的影响。
  • 定性对比展示NoPA在薄结构物体(如墙壁、窗户)和复杂关系预测上的优势。
  • 3DSSG数据集上Rel. Recall 53.2%, Obj. Recall 69.0%, Pred. Recall 61.4% (n=256)(第 11 页)
  • ReplicaSSG数据集上Rel. Recall 36.9%, Obj. Recall 28.6%, Pred. Recall 39.5% (n=256)(第 12 页)
  • 3DSSG上Rel. Recall较FROSS提升27.5% (53.2% vs 25.7%)(第 11 页)
  • ReplicaSSG上Rel. Recall较FROSS提升65.5% (36.9% vs 22.3%)(第 12 页)
  • 使用GT 2D SSG输入时,NoPA Rel. Recall达84.4%(第 21 页)

阅读时需要注意

  • 严重依赖预训练2D场景图检测器(RT-DETR-EGTR)的准确性,2D预测质量限制了3D性能上限。
  • 对罕见谓词类别的性能受限于2D骨干网络的类别不平衡问题。
  • 非参数表示虽优于高斯,但仍需平衡粒子数量与计算效率。
  • MMD计算复杂度随粒子数平方增长,但仅应用于模糊案例,因此整体延迟增加有限。
  • 过大的粒子数(如n=512)可能导致性能下降,因冗余信息引入噪声。
  • 严格的匹配标准可能导致部分合并对象被过滤,影响关系召回率。

关联工作

  • FROSS:主要基线,使用高斯分布近似,NoPA旨在解决其几何丢失和合并脆弱性问题。(第 2 页)
  • SceneGraphFusion:基于SLAM的在线方法,计算开销大,NoPA避免显式建图以实现实时性。(第 2 页)
  • MonoSSG:仅使用RGB的在线方法,NoPA使用RGB-D以获取深度信息。(第 4 页)
  • JointSSG:在线3D SSG方法,NoPA在3DSSG上全面超越其性能。(第 10 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

NoPA:非参数在线3D场景图生成

Qi Xun Yeo1, Seungjun Lee1, Yan Li1, 和 Gim Hee Lee1

新加坡国立大学计算机系 {qixunyeo, seungjun.lee}@u.nus.edu, {yan.li,gimhee.lee}@nus.edu.sg

摘要。经典的3D场景图生成方法由于环境映射的高计算成本以及需要生成中间点云表示,无法实现实时运行。为了缓解这一问题,最近的一项工作摒弃了点云,转而采用每个对象的轻量级高斯分布。这种近似极大地加速了推理过程,并实现了实时的3D场景图生成。然而,该表示方法存在两个关键弱点。1) 每个对象由单个3D高斯近似,这导致3D几何细节的严重丢失。2) 这种近似与真实对象几何形状之间的差异加剧了在线推理过程中对象候选项的不准确合并。为了解决这些问题,我们提出了NoPA,它将每个对象表示为独立的非参数分布。这种公式在保留参数化高斯公式的实时推理能力的同时,保留了3D几何信息。为了利用我们新颖的对象表示,我们提出了一种定制的合并策略以恢复连贯的对象实例。具体而言,我们利用核密度估计上的最大均值差异(MMD),在在线探索期间实现对象候选项的稳健合并,同时最小化增加的计算复杂度。关键在于为每个对象维护固定的粒子集。此外,为了纠正因对象误分类导致的关系丢失,NoPA在具有高亲和力的对象之间传播关系。实验表明,NoPA在不妨碍实时推理速度的情况下,显著优于当前方法。

关键词:3D场景图 · 非参数分布 · 核密度函数

1 引言

我们研究从流式RGB-D图像进行在线3D场景图生成。3D语义场景图(3D SSG)以结构化表示编码对象及其关系,是具身智能和机器人技术的关键抽象。它支持下游任务,如导航 [4,12,26,30,31,33, 38,39]、场景生成 [5,22,36,40,41] 和操纵 [2,5,9,20,38]。这些能力在医疗 [10, 24, 25]、建筑 [3, 18, 21, 23] 和自动驾驶领域 [7,8,19,44] 中至关重要。

尽管其重要性不言而喻,但大多数先前的工作是在没有严格实时约束的离线环境中解决3D SSG生成问题的 [1, 6, 28, 29, 32, 35, 37, 42]。为了

第 2 页

2 Yeo 等人

图 1:高斯分布(FROSS [11])与非参数分布(本文方法)。我们展示了在单个窗口物体实例上合并以 3D 高斯表示的物体时出现的合并不足(under-merging)问题。顶行(FROSS):在高斯参数化下,局部物体(第 1 列)未能与全局物体(第 2 列)合并,导致合并不足(第 3 列)。合并过程结束后,窗口实例被错误地表示为两个较小的高斯分布,而不是一个较大的高斯分布。这种碎片化产生了不能反映真实场景结构的碎片化 3D 场景图。严格的后处理过滤器随后会将碎片化物体及其关系一并移除。结果,最终 3D SSG 的质量下降。底行(本文方法):我们的非参数化公式允许局部物体与全局物体合并,并保留了更丰富的几何支撑。这减少了合并不足,并产生了更准确且一致的 3D SSG。

据我们所知,只有三项工作解决了具有实时性能的在线设置问题 [11,34,35]。SceneGraphFusion [35] 和 MonoSSG [34] 依赖于同时定位与建图(SLAM)管线,在场景图预测之前重建几何结构,这引入了巨大的计算开销并限制了可扩展性。FROSS [11] 通过将 2D 场景图提升(lift)到 3D 来避免显式建图,并通过将每个物体近似为高斯分布来实现高帧率。

尽管 FROSS 在没有 SLAM 的情况下实现了实时性能,但其高斯参数化施加了严格的几何假设,即每个物体被建模为由其协方差定义的椭球体。这种近似丢弃了精细的几何结构,使得合并过程变得脆弱。如图 1 所示,画框和窗户等薄或平面结构通常会产生接近奇异的协方差矩阵,从而导致合并不足。同一物体的不同视角往往产生具有不一致协方差和空间偏移的高斯椭球体,导致错误的合并。因此,合并决策容易不稳定,因为错误的合并和合并不足会随时间累积,并

第 3 页

NoPA:非参数在线3D场景图生成 3

逐步退化全局3D SSG。这些局限性从根本上源于参数化假设,而非实现细节。

为了克服基于SLAM的流水线带来的计算负担以及高斯建模的几何局限性,我们引入了NoPA(Non-PArametric Online 3D Scene Graph Generation,非参数在线3D场景图生成)。我们的NoPA用固定大小的非参数粒子集替代了高斯对象建模,从而保留了几何支撑。这种表述消除了限制性椭球假设,同时保持了恒定的内存和运行时复杂度。合并两个对象候选项的过程是通过在其统一的粒子支撑上估计核密度(Kernel Density Estimate, KDE),并从中重采样一个固定大小的集合来实现的。这整合了多视角几何证据,同时保持了恒定大小的表示。因此,NoPA在保持实时效率方面与无SLAM的参数化方法相当,同时保留了显著更丰富的几何结构。

采用非参数表示将合并问题从协方差比较转变为跨视角的分布比较。我们经验性地发现,在视角变化下,协方差相似性是不充分且不可靠的,往往导致合并不足(参见图1)。我们通过引入基于最大均值差异(Maximum Mean Discrepancy, MMD)的 principled 分布级合并准则来解决这一问题。MMD直接在特征空间中的粒子集之间测量相似性,即使在不同视角下几何支撑不同或2D预测存在噪声时,也能提供稳定的信号。这显著提高了模糊情况下的合并鲁棒性,并防止了最终3D SSG中级联的结构错误。为了进一步增强3D SSG的全局一致性,我们的NoPA在后处理步骤中结合了关系传播机制。我们使用先前计算的MMD分数对对象候选项进行聚类,并在簇之间传播关系以恢复缺失的边。这减轻了由不完美合并引起的结构损坏,并在不牺牲运行时效率的情况下增强了整体图的完整性。

总之,我们的主要贡献如下:

– 我们引入了NoPA,这是一种用于在线3D场景图生成的非参数化表述,它在消除限制性高斯假设的同时,保持了固定的内存使用和实时计算复杂度。 – 我们设计了一种基于最大均值差异(MMD)的 principled 分布级合并框架,它取代了脆弱的协方差相似性,并提高了在视角变化和噪声预测下的鲁棒性。 – 我们开发了一种由分布相似性指导的关系传播机制,以恢复缺失的关系并加强图的一致性。 – 我们在多个在线3D SSG基准测试中实现了最先进的性能,同时保持了具有竞争力的实时效率。

2 相关工作

离线3D SSG。离线3D SSG生成方法旨在以非增量方式利用真实3D几何结构[1,28,29,32,42]或多视角RGB-D图像[6, 9, 27, 37, 43]来估计3D场景图。Wald等人[28]

第 4 页

4 Yeo 等人

首次提出了 3D SSG 生成的问题,并尝试通过建模成对关系来预测图。大多数现代方法依赖于多视角 RGB-D 图像。Wang 等人 [32] 通过从多模态预言机模型(multimodal oracle model)中将知识蒸馏到 3D 模型中,利用预训练模型先验。Yeo 等人 [37] 提出了一种统计置信度重评分机制,以细化低置信度预测,并使用 SegmentAnything (SAM) [15] 实例掩码来增强节点特征。Koch 等人 [16] 将视觉语言模型(VLMs)的知识蒸馏到 3D 图神经网络(GNN)中。Gu 等人 [9] 运行类别无关分割模型以获得候选对象,利用几何和语义相似性将它们跨视图关联,实例化由 VLMs 细化的 3D SSG 中的节点,并使用对象对提示大型语言模型(LLM)以推断空间关系。Koch 等人 [17] 构建了一种支持节点和谓词查询的关系感知 3D 表示。Zhang 等人 [43] 引入了功能关系,并贡献了一个功能 3D SSG 数据集。这些离线系统通常在固定帧集上聚合信息,并执行昂贵的全局关联和细化。在严格的在线延迟和有限内存约束下,这变得具有挑战性。相比之下,我们的 NoPA 针对在线 3D SSG 生成,每个对象保持恒定内存。我们用固定大小的粒子集替换高斯对象建模,使用分布级合并准则以改进跨视图关联,并在亲和聚类内传播关系,以在增量融合期间恢复遗漏的边。

在线 3D SSG。Kim 等人 [14] 是首个在在线设置中解决 3D SSG 生成的工作。该工作专注于预测组合成全局 3D SSG 的局部 3D SSG。然而,它未能达到实际部署所需的实时速度。Wu 等人 [35] 引入了一种基于图卷积网络(GCN)的聚合函数,简称 FAN,以改进预测的 3D SSG,同时运行 RGB-D SLAM 以获得密集的中间 3D 表示。MonoSSG [34] 提出了一种实体关联方法,将 2D 实体提升到 3D,增强 ORBSLAM,并引入一个几何门,将几何信息与多视角图像特征融合。最近,FROSS [11] 将对象近似为 3D 高斯,以避免繁重的点云处理或环境映射,从而加速推理。然而,通过移除精确定位,它无法利用 3D 中可用的几何信息进行合并,而是依赖于从 RGB-D 观测中对 2D 对象形状的近似。相比之下,我们的 NoPA 通过每个对象的固定粒子数量,在保留几何细节和提高推理速度之间取得了平衡。这种设计在保持实时性能的同时,保留了比 FROSS 更丰富的 3D 几何信息,从而改进了合并和整体模型性能。

3 问题定义

给定 3D 场景的 N 个多视角 RGB 图像,记为 $\{I_i\}_{i=1}^N$,我们的目标是估计一个 3D 场景图:

$\hat{G}^{3D} = (O, R)$, (1)

第 5 页

NoPA:非参数在线3D场景图生成 5

其中 $O = \{o_j\}_{j=1}^M$ 是 $M$ 个物体节点的集合,$R = \{r_{k \to j}\}_{j,k=1}^M$ 是物体对上的有向关系边集合。节点 $j$ 具有物体(类别)标签 $o_j$,从节点 $k$ 到节点 $j$ 的有向边具有谓词标签 $r_{k \to j}$。等价地,场景图可以表示为一组三元组 $\{(o_k, r_{k \to j}, o_j)\}$。

我们研究在线设置。该方法在测试时不假设能够访问完整的图像集 $\{I_i\}_{i=1}^N$。相反,它接收部分观测的序列流,并在场景探索过程中随着新图像的到达而增量更新 $G_{3D}$。

4 预备知识

我们的框架基于 FROSS [11] 构建,该方法从 RGB 帧流中增量更新场景图,并避免显式的环境映射。给定 RGB 观测值 $\{I_i\}_{i=1}^N$,FROSS 首先预测每帧的 2D 场景图 $G^{2D}_i = g_\phi(I_i)$,其中 $g_\phi$ 是预训练的 2D SSG 检测器。然后,它利用每帧的深度图 $d_i$ 和相机位姿 $P_i \in SE(3)$ 将此 2D 图提升到世界坐标系中,并将提升后的结果融合到全局 3D 场景图中:

$$ G^{3D}_i = \mathcal{B}\left(G^{2D}_i \mid d_i, P_i\right) \odot G^{3D}_{i-1}, \label{eq:updateEq} \quad (2) $$

其中 $G^{3D}_{i-1}$ 和 $G^{3D}_i$ 分别表示处理帧 $i$ 之前和之后的全局 3D 场景图。算子 $\mathcal{B}(\cdot \mid d_i, P_i)$ 通过将图像证据与 $d_i$ 进行反向投影并使用 $P_i$ 转换到世界坐标系,将 $G^{2D}_i$ 中的每个 2D 节点映射为 3D 物体假设。融合算子 $\odot$ 在提升后的假设与 $G^{3D}_{i-1}$ 中现有节点之间执行数据关联,随后进行合并和状态更新。

FROSS 使用 $\mathbb{R}^3$ 中的单个高斯分布来表示每个 3D 物体节点 $o_j$:

$$ p(\mathbf{x} \mid o_j) = \mathcal{N}\left(\mathbf{x}; \mu_j, \Sigma_j\right) \quad (3) $$

其中 $\mathbf{x} \in \mathbb{R}^3$ 是一个 3D 点,$\mu_j \in \mathbb{R}^3$ 是物体质心,$\Sigma_j \in \mathbb{R}^{3 \times 3}$ 是协方差矩阵。该高斯分布通过提升从预测的 2D 边界框估计出的 2D 高斯分布来初始化。在融合过程中,当提升后的物体假设 $i$ 与现有全局物体 $j$ 的语义标签匹配且它们的 Hellinger 距离 $d_H(i, j)$ 低于阈值 $\delta_H$ 时,它们会被合并。将每个物体近似为高斯分布 $\mathcal{N}(\mu, \Sigma)$,Hellinger 距离具有闭式解:

$$ d_H(i, j) = \sqrt{1 – \exp\left(-d_B(i, j)\right)} \quad (4) $$

其中 $d_B(i, j)$ 是两个高斯分布 $\mathcal{N}(\mu_i, \Sigma_i)$ 和 $\mathcal{N}(\mu_j, \Sigma_j)$ 之间的 Bhattacharyya 距离:

$$ \begin{split} d_B(i, j) &= \frac{1}{8} \Delta_{ij}^\top \Sigma^{-1} \Delta_{ij} + \frac{1}{2} \ln\left(\frac{\det \Sigma}{\sqrt{\det \Sigma_i \det \Sigma_j}}\right) \\ \Delta_{ij} &= \mu_i – \mu_j, \qquad \Sigma = \frac{\Sigma_i + \Sigma_j}{2}. \end{split} \quad (5) $$

第 6 页

6 Yeo 等人

图 2:我们在线 3D 场景图生成流程的概述。(1) 预训练的 RT-DETR-EGTR [13,45] 模型从每个 RGB 帧预测局部 2D 场景图。(2) 对于每个物体节点,我们在其 2D 边界框内采样像素,利用深度信息进行反向投影,从而在世界坐标系中获得 3D 粒子集。(3) 我们使用两阶段测试将每个局部粒子集与现有的全局物体进行关联:首先进行常数时间的 Hellinger 预过滤,然后在模糊案例上使用 Maximum Mean Discrepancy (MMD)。(4) 我们在高亲和力簇内传播关系,以减少来自 2D 预测器的关系丢失。

FROSS 的局限性。FROSS 使用单个高斯分布表示每个物体,这以椭球形状粗略近似物体几何结构,去除了实例的精细结构细节。这种近似误差在流式图像中累积,导致物体实例因脆弱的合并和错误的关联而变得不连续。

5 我们的方法

概述。图 2 总结了我们在线 3D 场景图生成的框架。我们通过用非参数粒子表示替换 FROSS 的单高斯物体模型,并围绕分布相似度重新设计在线融合过程,改进了 FROSS。在时间步 $i$,预训练的 RT-DETR-EGTR 模型从 RGB 帧 $I_i$ 推断出局部 2D 场景图 $G^{2D}_i$。$G^{2D}_i$ 包含图像平面上的物体节点(带有类别标签的 2D 边界框)和关系边(成对谓词)。我们利用深度图 $d_i$ 和相机位姿 $P_i$(见第 5.1 节)将每个检测到的 2D 物体节点提升为 3D 粒子集,并将这些局部 3D 候选对象融合到前一时间步的全局 3D 场景图中(见第 5.2 节)。融合使用快速的两阶段关联规则:对于清晰匹配/不匹配的情况使用常数时间的 Hellinger 预过滤,对于边界情况对使用最大均值差异 (MMD) 测试。随后,我们通过亲和力簇内的关系传播来稳定关系集,这有助于恢复单视角下 2D 预测器遗漏的关系(见第 5.3 节)。该设计保留了 $R^3$ 中的物体支撑,提高了跨视角关联能力,并保持了每个物体的恒定内存占用。

5.1 非参数物体表示

从 2D 边界框到 3D 粒子。对于 $G^{2D}_i$ 中边界框为 $b$ 的每个检测到的 2D 物体节点,我们在 $b$ 内均匀采样 $n$ 个像素 $\{u_k\}_{k=1}^n$。利用深度图 $d_i$,我们将每个像素反向投影到相机坐标系的 3D 点 $X^c_k =$

第 7 页

NoPA:非参数在线3D场景图生成 7

仅跨度 ours 跨度 (b) (a) FROSS 半个物体 整个物体

条纹伪影 完好保留 (c) (d) 空间范围

图 3:来自 3DSSG 数据集的场景 41385849 中物体的可视化。在第一行中,我们可视化了由红色边界框定位的水槽类的一个实例。在第二行中,我们可视化了全局 3D 物体实例。左侧:来自 FROSS [11] 的可视化高斯团。高斯团仅涵盖了 (a) 中水槽的一半。(c) 中跨越场景的虚假团可视化了错误合并的影响。右侧:我们粒子集的可视化核密度。(b) 中整个水槽都与我们的粒子集相关联。我们的表示法在场景中的物体上实现了良好的覆盖,且在 (d) 中没有大的伪影。

$\pi^{-1}(u_k, d_i(u_k))$ 并使用相机位姿 $P_i \in SE(3)$ 将其转换到世界坐标系: $$ \mathbf{x}_k^{c} = P_i \mathbf{x}_k, \qquad \mathbf{x}_k \in \mathbb{R}^3 \quad (6) $$ 提升后的物体由粒子集 $\mathbf{X}^{(o)} = \{\mathbf{x}_k\}_{k=1}^n$ 表示。 核密度视图。我们将粒子集视为来自未知物体占据分布的样本,并构建核密度估计 (KDE): $$ \hat{f}(\mathbf{x}) = \frac{1}{n} \sum_{k=1}^{n} \kappa(\mathbf{x}, \mathbf{x}_k), \quad (7) $$ 其中 $\kappa(\cdot, \cdot)$ 是 RBF 核: $$ \kappa(\mathbf{x}, \mathbf{y}) = \exp\!\Big(-\frac{\|\mathbf{x}-\mathbf{y}\|_2^2}{2\sigma^2}\Big) \quad (8) $$ 注。单个 3D 高斯强制实施椭球先验,这会模糊多部分结构并放大跨视图的近似误差。如图 3 所示,粒子集保留了 $\mathbb{R}^3$ 中的物体支撑集并允许多模态性,从而在部分观测下减少了过度合并和合并不足。

第 8 页

8 Yeo 等人

5.2 在线关联与合并

我们维护一组全局对象,每个对象包含粒子集 $X(o)$。给定一个局部对象候选者 $\hat{o}$(其粒子集为 $X(\hat{o})$)和一个现有的全局对象 $o$(其粒子集为 $X(o)$),我们判断 $\hat{o}$ 是否对应于 $o$ 并应进行合并,或者是否应生成一个新的全局对象。我们的关联采用两阶段标准:1) 一个常数时间的 Hellinger 预过滤器,用于解决明确的情况,随后是 2) 对模糊对进行的 MMD 测试。

阶段 1:常数时间预过滤器。为了获得一个廉价的一阶矩代理,我们通过匹配前两阶矩,将单峰高斯分布拟合到每个粒子集上:$o$ 对应 $(\mu, \Sigma)$,$\hat{o}$ 对应 $(\hat{\mu}, \hat{\Sigma})$。然后我们计算两个拟合高斯分布之间的 Hellinger 距离 $d_H$。我们不在 $\delta_H$ 处采用硬阈值,而是引入一个宽度为 $2\epsilon$ 的边际带:

$$ \text{merge if } d_H < \delta_H – \epsilon, \qquad \text{spawn if } d_H > \delta_H + \epsilon \quad (9) $$

该边际带防止了在深度噪声、截断或视场重叠有限导致 $d_H$ 波动时做出不稳定的决策。位于 $[\delta_H – \epsilon, \delta_H + \epsilon]$ 范围内的对保持未决状态,并进入阶段 2。

阶段 2:针对模糊对的 MMD。对于位于边际带 $[\delta_H – \epsilon, \delta_H + \epsilon]$ 内的候选者,我们计算两个 KDE 之间的最大均值差异 (MMD):

$$ \begin{aligned} d_{\mathrm{MMD}}^2(o, \hat{o}) &= \mathbb{E}_{\mathbf{x}, \mathbf{x}' \sim\mathcal{X}(o)}\!\left[\kappa(\mathbf{x},\mathbf{x}')\right]+\mathbb{E}_{\mathbf{y},\mathbf{y}'\sim\mathcal{X}(\hat{o})}\!\left[\kappa(\mathbf{y},\mathbf{y}')\right] \\ &\quad -2\,\mathbb{E}_{\mathbf{x}\sim\mathcal{X}(o),\,\mathbf{y}\sim\mathcal{X}(\hat{o})}\!\left[\kappa(\mathbf{x},\mathbf{y})\right] . \quad (10) \end{aligned} $$

我们使用来自 $X(o) \cup X(\hat{o})$ 的随机对的中值启发式方法设置 $\sigma^2$。如果 $d_{\mathrm{MMD}}(o, \hat{o}) \le \delta_{\mathrm{MMD}}$ 则合并,否则生成新对象,其中 $\delta_{\mathrm{MMD}}$ 是一个在保留序列上校准的固定阈值,以匹配所需的精度-召回权衡。

为什么使用 MMD?阶段 1 的高斯拟合故意较为粗糙,在部分视图、细结构或多部件物体的情况下,不同的粒子集可能具有相似的 $(\mu, \Sigma)$。MMD 在再生核希尔伯特空间中直接比较由 KDE 诱导的完整分布,这使得它对超出前两阶矩的支持不匹配敏感。它也是无模型的,并且自然地适用于我们的粒子表示,仅需核评估,无需网格化或显式的点对应。

决策规则。遵循公式 2 中的在线更新,融合算子 $\odot$ 在局部候选者 $\hat{o}$ 和全局对象 $o$ 之间实现两阶段关联:

$$ (o \odot \hat{o}) = \begin{cases} \text{merge} & d_H < \delta_H – \epsilon \\ \text{spawn} & d_H > \delta_H + \epsilon, \\ \text{merge} & \text{otherwise and } d_{\mathrm{MMD}}(o, \hat{o}) \le \delta_{\mathrm{MMD}}, \\ \text{spawn} & \text{otherwise.} \end{cases} \quad (11) $$

第 9 页

NoPA:非参数在线3D场景图生成 9

图4:来自3DSSG数据集的场景7272e16c中对象合并过程的可视化。如果在拟合单峰高斯分布(阶段1)后,局部粒子集与全局粒子集产生的Hellinger距离较小($d_H < \delta\epsilon$),则它们的协方差明显匹配,合并决策是直接的。如果Hellinger距离落在边际带内(阶段2),仅靠协方差对齐不足以确定合并。因此,我们应用更稳健的MMD准则,如果$d_{MMD}$… 左侧:局部和全局粒子集的初始核密度估计。右侧:融合后合并粒子集的核密度估计。由于KDE重采样,合并后粒子数量保持不变,而更新后的粒子集捕捉到了多模态分布。

它首先使用$d_H$接受或拒绝明确的对,并仅在边际带内调用$d_{MMD}$来解决矩匹配不可靠的边界情况。

具有恒定内存的合并更新。每次合并后,我们取粒子的并集,在并集支持上拟合KDE,并重采样固定大小的$n$个粒子集: $$ \mathcal{X}(o) \leftarrow \text{Resample}_n\big(\mathcal{X}(o) \cup \{o\}\big) \label{eq:resample} \quad (12) $$ 此步骤保留了来自两个候选者的几何信息,并防止粒子随时间增长。

备注。Hellinger预过滤器使大多数关联决策变得廉价。MMD将计算集中在高阶矩一致但分布支持不同的困难案例上。如图4所示,重采样保持恒定内存并避免表示向单模态坍缩,从而稳定长时程融合。

5.3 基于亲和聚类的关系传播

在线3D SSG生成对关系丢失敏感,其中低置信度的谓词边被抑制,且一帧中缺失的边可能永远不会在后续帧中恢复。为了提高鲁棒性,我们利用具有相似3D支持的对象之间的几何冗余。具体而言,我们重用计算出的MMD分数

第 10 页

10 Yeo 等人

在存在歧义的关联中构建对象候选集的亲和矩阵。 较低的 MMD 表示较高的几何相似性,从而定义亲和簇。 对于新合并或生成的节点,我们首先将其观测到的 2D 关系复制到对应的 3D 节点。 然后,我们在其亲和簇内传播候选关系,并通过基于可用证据的多数投票来确定最终的关系类型。 这种聚合机制恢复了单视角下遗漏的关系,降低了对关系置信度阈值的敏感性,并限制了关系漂移。

注。基于亲和性的传播通过借用几何相似邻居的一致证据,恢复了单视角下遗漏的关系。 多数投票减少了偶尔出现的假阳性的影响,并防止了关系漂移。

6 实验

6.1 实验设置

数据集。我们遵循 FROSS [11] 相同的评估设置,在 3DSSG [28] 和 ReplicaSSG 数据集上进行评估。 3DSSG 包含 1482 个场景,标注了 21974 个对象以及对象间的 16324 个谓词关系。 每个场景包含多个具有不同运动轨迹的短视频,以捕捉整个场景。 由于使用显著运动模糊拍摄导致图像质量较差,该数据集具有挑战性。 ReplicaSSG 包含 18 个场景,标注了 1526 个对象以及对象间的 582 个谓词关系。 该数据集包含源自 Replica 数据集的高质量图像和网格。 每个场景中大量的对象和谓词使得评估变得非平凡。

基线方法。对于 3DSSG,我们将我们的方法与其他利用带有真实位姿信息的 RGB-D 图像进行在线 3D SSG 生成的方法进行比较,包括 Kim 的框架 [14]、JointSSG [34] 和 FROSS [11]。 我们排除 MonoSSG [34],因为它仅使用 RGB 图像。 我们使用各自的 GitHub 仓库复现了这些方法¹。 对于 ReplicaSSG,我们仅与 FROSS 进行比较,因为它是唯一在该数据集上进行评估的先验方法。

实现细节。我们选择保留预训练的 RT-DETR-EGTR 中排名前 20 的关系,而不是前 10 个,以减少在运行 FROSS 时最终 3D SSG 中关系边的丢失。 这确保了竞争方法之间的公平比较。 我们的实现基于 PyTorch 框架。遵循 FROSS [11],我们将初始 2D SSG 生成模型 RT-DETR-EGTR 预训练最多 50 个 epoch。 所有实验均在单张 RTX 3090 GPU 上进行,以确保公平比较。 我们使用 n = 256 个粒子来表示每个对象。 \delta{MMD} 在 3DSSG 上设置为 0.7,在 ReplicaSSG 上设置为 0.6。 \epsilon 保持为 0.05。

1 对于 JointSSG,我们遵循 https://github.com/ShunChengWu/3DSSG。 对于 Kim 的框架和 FROSS,我们遵循 https://github.com/Howardkhh/FROSS。

第 11 页

NoPA:非参数在线3D场景图生成 11

表1:在包含20个物体类别和7个谓词类别的3DSSG数据集上,与最先进的在线3D SSG生成方法的比较。第一组结果是各论文中报告的结果。第二组标有 \dagger 的结果是从各自的GitHub仓库复现的结果。分别高亮了最佳(Best)和次佳(Second Best)结果。

召回率% (\delimiter)"3222378 平均召回率% (\delimiter)"3222378 方法 延迟 (ms \downarrow) 显存 (MB\delimiter)"3223379 关系 物体 谓词 物体 谓词 JointSSG [34] 25.5 58.1 27.3 43.0 33.3 191 – Kim [14] 9.1 59.0 7.1 51.0 8.0 310 – FROSS [11] 27.9 62.4 33.0 63.8 18.0 7 – JointSSG\dagger[34] 23.4 55.4 27.0 45.4 35.3 284 3252 Kim\dagger2 [11] 0.9 52.1 1.1 44.2 0.4 488 1204 FROSS\dagger[11] 25.7 60.6 30.7 62.4 17.7 22 1204 Ours(n = 128) 49.9 68.5 58.5 65.7 30.2 26 1206 Ours(n = 256) 53.2 69.0 61.4 66.4 29.4 27 1206

与FROSS类似,我们省略了物体和谓词预测中的“无”(None)类别,该类别此前在SceneGraphFusion [35] 中已实现。移除“无”类别的优势在于防止对“无”类别过拟合,因为“无”是最常见的真实标注。

我们遵循与FROSS相同的严格标准,将预测的物体候选项与真实物体实例进行匹配:(1) 从我们的连续粒子集中采样的多数点(超过50%)应映射到其最近邻的真实点,且该点属于对应的匹配真实物体。(2) 属于第二大匹配真实物体的重叠计数占最大匹配真实物体重叠计数的比例不得超过75%。这些标准强制执行预测物体与真实物体之间的一一对应关系,从而提高了评估的鲁棒性。

评估指标。在评估以3D场景图为中心的性能方面,我们遵循SceneGraphFusion [35] 和MonoSSG [34] 的报告方式,分别报告物体类别估计(Obj.)、谓词估计(Pred.)以及关系三元组估计(Rel.)的总体Top-1召回率(Recall)。我们还报告物体类别估计(Obj.)和仅谓词估计(Pred.)的平均召回率(mRecall)。在评估在线设置的运行时效率方面,我们报告了如[11]中所述的延迟,并额外比较了每种方法的内存需求。

6.2 定量结果

我们在表1中展示了Top-1召回率和平均召回率与其他基线方法的主要性能比较。我们的方法优于所有基线方法

2 Kim的方法在RAM OOM(内存溢出)的情况下,在157个场景中的第132个场景崩溃。存储的点云进一步缩小了5倍以适应内存,这可能导致性能大幅下降。

第 12 页

12 Yeo 等人

表 2:在包含 34 个物体类别和 9 个谓词类别的 ReplicaSSG 数据集上与 FROSS 的对比。$\dagger$ 表示复现结果。分别高亮显示最佳(Best)和次佳(Second Best)结果。

Recall% (\delimiter)"3222378 mRecall% (\delimiter)"3222378 Method Latency (ms \downarrow) VRAM (MB\delimiter)"3223379 Rel. Obj. Pred. Obj. Pred. FROSS [11] 22.3 26.1 27.8 28.8 20.4 7 – FROSS\dagger[11] 22.3 25.3 27.5 27.6 12.6 17 1206 Ours(n = 128) 32.4 28.0 34.6 29.6 16.5 22 1230 Ours(n = 256) 36.9 28.6 39.5 29.8 18.6 23 1230

在 top-1 召回率和物体 mRecall 方面表现更优,同时保持了具有竞争力的延迟和可比的显存(VRAM)使用量,以支持实时推理。更令人印象深刻的是,仅使用 128 个粒子的 NoPA 已经超越了所有基线方法。这些结果验证了我们的假设,即我们连续非参数公式的表达力以及改进的合并过程有助于 NoPA 取得优越的性能。 对于表 2 中的 ReplicaSSG,NoPA 在所有指标上均优于 FROSS,其中关系召回率的提升尤为显著(增加了 65.5%)。

6.3 定性结果

我们在图 5 中可视化了与 FROSS 对比的定性结果。与 FROSS 相比,我们的方法能够以更高的成功率区分具有细长结构的物体,例如窗户类别。对于模糊案例,例如柜台实例的分类错误,这种失败是可以理解的,因为两种方法都依赖于粗略近似,而区分柜台和柜子并非易事。值得注意的是,尽管墙壁缺乏纹理,NoPA 仍能正确地将部分墙壁观测结果与相应的墙壁实例关联起来。相比之下,这种模糊性对 FROSS 构成了挑战,它经常产生错误的合并,因此表现出较差的性能。更多的定性结果见补充材料。

6.4 消融实验

为了验证我们提出的方法中各个组件的贡献,我们在表 3 中对每个组件进行了消融实验。用粒子集分布替换高斯分布提高了物体的召回率,但代价是谓词和关系召回率的下降。FROSS 中用于参数化表示的合并方法,由于两种公式之间存在根本性的不兼容,当应用于我们的非参数表示时,显然会导致性能下降。将分布替换与我们为非参数表示量身定制的合并方法相结合,在所有指标上均带来了进一步的改进。关系传播机制进一步提升了关系和谓词的召回率,且未造成物体召回率的下降,因为所有物体的位置和空间范围不受其使用的影响。

第 13 页

NoPA:非参数在线3D场景图生成 13

舱室。 水槽 墙壁 b a 柜台。 窗户 墙壁 a a s c 舱室。 舱室。 墙壁 a a 其他 地板 a 墙壁 a 墙壁

真实标签 (GT) FROSS [11] NoPA (本文方法)

: 漏检节点预测 : 错误节点预测 : 正确节点预测 : 错误边预测 : 正确边预测 a: 附着于 (attached to) s: 站立于 (standing on) b: 嵌入于 (build in) c: 连接于 (connected to)

图 5:我们比较了 FROSS 与我们提出的方法在 3DSSG 数据集场景 321c867e 上的定性结果。该场景是从鸟瞰图(BEV)视角展示的厨房。FROSS 未能预测出大多数墙壁背景类。因此,大多数谓词关系丢失。我们的方法正确分类了大多数物体,除了柜台实例外,同时正确预测了大多数谓词关系。

我们在表 4 中分析了合并方法的影响。我们将 $\delta_{MMD}$ 的值在 0.6 到 0.9 之间变化。我们观察到,较低的阈值由于更严格的合并标准,虽然提高了物体召回率,但以牺牲谓词召回率为代价。相反,较高的阈值提高了谓词和关系召回率,但代价是物体召回率的降低。这证实了 [11] 中的发现。匹配标准会丢弃合并后预测的物体,这些物体要么与真实标签缺乏足够的重叠,要么由于空间范围扩大而与其他匹配物体过度重叠。放宽合并标准会产生更多具有较大空间范围的合并物体,从而降低物体召回率。

计算粒子集分布相似性的 MMD 优于将粒子集分布近似为 3D 高斯分布,后者是计算 Hellinger 距离所必需的,尤其是在模糊情况下。理论解释是预测的 2D SSG 中可能存在误分类的物体。仅靠 Hellinger 距离计算的协方差无法捕捉 MMD 所捕捉到的物体类别分布的完整差异。这种对协方差的过度依赖可能导致错误的合并

第 14 页

14 Yeo 等人

表 3:在 3DSSG 数据集测试集上的消融研究。NP. 表示使用我们的非参数粒子集分布代替高斯分布来表示场景中的物体。Merge. 表示使用我们基于 MMD 的合并方法。Prop. 表示使用我们的关系传播机制。最佳结果以粗体显示。

Recall% (\delimiter)"3222378 mRecall% (\delimiter)"3222378 Method NP. Merge. Prop. Rel. Obj. Pred. Obj. Pred. FROSS × × × 25.7 60.6 30.7 62.4 17.7 + NP. ✓ × × 17.6 66.1 20.8 64.8 11.1 + Merge. ✓ ✓ × 26.3 69.0 31.0 66.4 17.1 Ours ✓ ✓ ✓ 53.2 69.0 61.4 66.4 29.4

表 4:在 3DSSG 数据集验证集上不同 MMD 阈值 \delta{MMD}} 值的比较。最佳结果以粗体显示。

\delta{MMD}} 0.6 0.65 0.7 0.75 0.8 0.85 0.9 Rel. 36.3 47.9 53.7 51.3 46.4 46.5 46.3 Obj. 68.5 67.0 66.0 63.3 59.2 59.3 59.2 Pred. 40.6 53.3 61.0 58.8 53.7 53.7 53.5

不同类别物体之间的差异,这可能解释了我们方法的优越性。更多消融实验和分析请参阅补充材料。

局限性。与将 2D SSG 提升到 3D 的先前工作类似,我们的方法严重依赖于预训练模型的 2D SSG 预测准确性,尤其是物体预测。2D 检测和关系的准确性限制了我们方法的性能上限。

7 结论

我们提出了 NoPA,这是一个用于从多视角 RGB-D 观测中在线生成 3D 场景图的非参数框架。我们的方法用固定大小的粒子集替换了高斯物体模型,这些粒子集在保持恒定内存和运行时复杂度的同时保留了几何支撑。这种设计消除了限制性椭球假设,并产生了更稳定的多视角物体关联。我们引入了基于 MMD 的分布级合并标准,该标准直接在特征空间中比较粒子集,提高了在视角变化和噪声预测下的鲁棒性。轻量级的 Hellinger 距离预过滤器通过避免不必要的 MMD 评估来保持效率。我们进一步提出了一种关系传播机制,以恢复缺失的关系并提高全局图的一致性。实验表明,在多个在线 3D 场景图基准测试中取得了最先进的性能,同时保持了具有竞争力的实时效率。这些结果表明,非参数物体表示为在线 3D SSG 生成提供了一种实用的参数建模替代方案。

第 15 页

NoPA:非参数在线3D场景图生成 15

致谢

本研究/项目得到了新加坡国家研究基金会(NRF)NRF研究员计划(奖项编号 NRF-NRFI09-0008)以及新加坡教育部 Tier 2 资助项目 MOET2EP20124-0015 的支持。

参考文献

1. Armeni, I., He, Z.Y., Gwak, J., Zamir, A.R., Fischer, M., Malik, J., Savarese, S.: 3d scene graph: A structure for unified semantics, 3d space, and camera. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 5664–5673 (2019) 2. Buechner, M., Roefer, A., Engelbracht, T., Welschehold, T., Bauer, Z., Blum, H., Pollefeys, M., Valada, A.: Articulated 3d scene graphs for open-world mobile manipulation. arXiv preprint arXiv:2602.16356 (2026) 3. Çelen, A., Han, G., Schindler, K., Gool, L.V., Armeni, I., Obukhov, A., Wang, X.: I-design: Personalized LLM interior designer. In: Bue, A.D., Canton, C., Pont-Tuset, J., Tommasi, T. (eds.) Computer Vision – ECCV 2024 Workshops – Milan, Italy, September 29-October 4, 2024, Proceedings, Part II. Lecture Notes in Computer Science, vol. 15624, pp. 217–234. Springer (2024). https://doi.org/10.1007/978-3-031-92387-6_17 4. Chang, Y., Ballotta, L., Carlone, L.: D-lite: Navigation-oriented compression of 3d scene graphs for multi-robot collaboration. IEEE Robotics Autom. Lett. 8(11), 7527–7534 (2023). https://doi.org/10.1109/LRA.2023.3320011 5. Dhamo, H., Manhardt, F., Navab, N., Tombari, F.: Graph-to-3d: End-to-end generation and manipulation of 3d scenes using scene graphs. In: IEEE International Conference on Computer Vision (ICCV) (2021) 6. Feng, M., Hou, H., Zhang, L., Wu, Z., Guo, Y., Mian, A.: 3d spatial multimodal knowledge accumulation for scene graph prediction in point cloud. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 9182–9191 (2023) 7. Fischer, T., Porzi, L., Bulò, S.R., Pollefeys, M., Kontschieder, P.: Multi-level neural scene graphs for dynamic urban environments. In: IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16-22, 2024. pp. 21125–21135. IEEE (2024). https://doi.org/10.1109/CVPR52733.2024.01996 8. Greve, E., Büchner, M., Vödisch, N., Burgard, W., Valada, A.: Collaborative dynamic 3d scene graphs for automated driving pp. 11118–11124 (2024). https://doi.org/10.1109/ICRA57147.2024.10610112 9. Gu, Q., Kuwajerwala, A., Morin, S., Jatavallabhula, K.M., Sen, B., Agarwal, A., Rivera, C., Paul, W., Ellis, K., Chellappa, R., et al.: Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning. In: 2024 IEEE International Conference on Robotics and Automation (ICRA). pp. 5021–5028. IEEE (2024) 10. Guo, D., Lin, M., Pei, J., Tang, H., Jin, Y., Heng, P.A.: Tri-modal confluence with temporal dynamics for scene graph generation in operating rooms. In: MICCAI. Springer (2024)

第 16 页

16 Yeo 等人

11. Hou, H.Y., Lee, C.Y., Sonogashira, M., Kawanishi, Y.: FROSS: Faster-than-Real-Time Online 3D Semantic Scene Graph Generation from RGB-D Images. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) (October 2025) 12. Huang, X., Zhao, S., Wang, Y., Lu, X., Zhang, W., Qu, R., Li, W., Wang, Y., Wen, C.: Msgnav: Unleashing the power of multi-modal 3d scene graph for zero-shot embodied navigation (2026), https://arxiv.org/abs/2511.10376 13. Im, J., Nam, J., Park, N., Lee, H., Park, S.: Egtr: Extracting graph from transformer for scene graph generation. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 24229–24238 (June 2024) 14. Kim, U.H., Park, J.M., Song, T.J., Kim, J.H.: 3d-scene-graph: A sparse and semantic representation of physical environments for intelligent agents. IEEE Cybernetics (2019) 15. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., et al.: Segment anything. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 4015–4026 (2023) 16. Koch, S., Vaskevicius, N., Colosi, M., Hermosilla, P., Ropinski, T.: Open3dsg: Open-vocabulary 3d scene graphs from point clouds with queryable objects and open-set relationships. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (June 2024) 17. Koch, S., Wald, J., Colosi, M., Vaskevicius, N., Hermosilla, P., Tombari, F., Ropinski, T.: Relationfield: Relate anything in radiance fields. In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025) 18. Lee, S., Lee, G.H.: Diet-gs: Diffusion prior and event stream-assisted motion deblurring 3d gaussian splatting. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21739–21749 (2025) 19. Lee, S., Lee, G.H.: Segment any events with language. arXiv preprint arXiv:2601.23159 (2026) 20. Lee, S., Zhao, Y., Lee, G.H.: Segment any 3d object with language. arXiv preprint arXiv:2404.02157 (2024) 21. Lin, C., Mu, Y.: Instructscene: Instruction-driven 3d indoor scene synthesis with semantic graph prior. In: International Conference on Learning Representations (ICLR) (2024) 22. Liu, Y., Li, X., Zhang, Y., Qi, L., Li, X., Wang, W., Li, C., Li, X., Yang, M.H.: Controllable 3d outdoor scene generation via scene graphs. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 28052–28062 (October 2025) 23. Nyffeler, J., Tombari, F., Barath, D.: Hierarchical 3d scene graphs construction outdoors. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 26817–26826 (October 2025) 24. Özsoy, E., Czempiel, T., Holm, F., Pellegrini, C., Navab, N.: LABRAD-OR: lightweight memory scene graphs for accurate bimodal reasoning in dynamic operating rooms. In: Greenspan, H., Madabhushi, A., Mousavi, P., Salcudean, S.E., Duncan, J., Syeda-Mahmood, T.F., Taylor, R.H. (eds.) Medical Image Computing and Computer Assisted Intervention – MICCAI 2023 – 26th International Conference, Vancouver, BC, Canada, October 8-12, 2023, Proceedings, Part IX. Lecture Notes in Computer Science, vol. 14228, pp. 302–311. Springer (2023). https://doi.org/10.1007/978-3-031-43996-4_29

第 17 页

NoPA:非参数在线3D场景图生成 17

25. Özsoy, E., Örnek, E., Eck, U., Czempiel, T., Tombari, F., Navab, N.: 4d-or: 面向OR领域建模的语义场景图。在:Wang, L., Dou, Q., Fletcher, P., Speidel, S., Li, S.(编)医学图像计算与计算机辅助干预 – MICCAI 2022 – 第25届国际会议,论文集。第475–485页。计算机科学讲义(包括人工智能讲义和生物信息学讲义子系列),Springer Science and Business Media Deutschland GmbH(2022)。https://doi.org/10.1007/978-3-031-16449-1_45 26. Seiwald, P., Wu, S.C., Sygulla, F., Berninger, T.F.C., Staufenberg, N.S., Sattler, M.F., Neuburger, N., Rixen, D., Tombari, F.: Lola v1.1 – 动态多接触运动硬件和软件设计的升级。在:2020 IEEE-RAS第20届国际人形机器人会议(Humanoids)。IEEE(2021)。https://doi.org/10.1109/humanoids47582.2021.9555790 27. Sonogashira, M., Iiyama, M., Kawanishi, Y.: 迈向包含未知物体的开放集场景图生成。IEEE Access 10, 11574–11583 (2022)。https://doi.org/10.1109/ACCESS.2022.3145465 28. Wald, J., Dhamo, H., Navab, N., Tombari, F.: 从3D室内重建中学习3D语义场景图。在:IEEE/CVF计算机视觉与模式识别会议论文集。第3961–3970页(2020) 29. Wald, J., Navab, N., Tombari, F.: 使用实例嵌入学习3D语义场景图。International Journal of Computer Vision 130(3), 630–651 (2022) 30. Wang, Z., Lee, S., Dai, G., Lee, G.H.: D3d-vlp:用于具身定位和导航的动态3D视觉-语言-规划模型。arXiv预印本 arXiv:2512.12622 (2025) 31. Wang, Z., Lee, S., Lee, G.H.: Dynam3d:动态分层3D令牌赋能VLM进行视觉-语言导航。arXiv预印本 arXiv:2505.11383 (2025) 32. Wang, Z., Cheng, B., Zhao, L., Xu, D., Tang, Y., Sheng, L.: Vl-sat:点云中3D语义场景图预测的视觉-语言语义辅助训练。在:IEEE/CVF计算机视觉与模式识别会议论文集。第21560–21569页(2023) 33. Werby, A., Huang, C., Büchner, M., Valada, A., Burgard, W.: 用于语言定位机器人导航的分层开放词汇3D场景图。Robotics: Science and Systems (2024) 34. Wu, S.C., Tateno, K., Navab, N., Tombari, F.: 从RGB序列增量预测3D语义场景图。在:IEEE/CVF计算机视觉与模式识别会议论文集。第5064–5074页(2023) 35. Wu, S.C., Wald, J., Tateno, K., Navab, N., Tombari, F.: Scenegraphfusion:从RGB-D序列增量预测3D场景图。在:IEEE/CVF计算机视觉与模式识别会议论文集。第7515–7525页(2021) 36. Yang, Z., Lu, K., Zhang, C., Qi, J., Jiang, H., Ma, R., Yin, S., Xu, Y., Xing, M., Xiao, Z., 等:Mmgdreamer:用于几何可控3D室内场景生成的混合模态图。在:AAAI人工智能会议论文集。第39卷,第9391–9399页(2025) 37. Yeo, Q.X., Li, Y., Lee, G.H.: 基于多视图图像进行鲁棒3D场景图生成的统计置信度重评分。在:IEEE/CVF国际计算机视觉会议(ICCV)论文集。第24999–25008页(2025年10月) 38. Yin, H., Wei, H., Xu, X., Guo, W., Zhou, J., Lu, J.: Gc-vln:作为图约束的指令用于免训练视觉-语言导航。arXiv预印本 arXiv:2509.10454 (2025)

第 18 页

18 Yeo 等人

39. Yin, H., Xu, X., Wu, Z., Zhou, J., Lu, J.: SG-nav: 基于 LLM 的零样本物体导航中的在线 3D 场景图提示。在:第三十八届神经信息处理系统年会 (2024),https://openreview.net/ forum?id=HmCmxbCpp2 40. Zhai, G., Örnek, E.P., Chen, D.Z., Liao, R., Di, Y., Navab, N., Tombari, F., Busam, B.: Echoscene: 通过场景图扩散上的信息回波进行室内场景生成。在:计算机视觉 – ECCV 2024:第 18 届欧洲会议,意大利米兰,2024 年 9 月 29 日至 10 月 4 日,论文集,第 XXI 部分。第 167–184 页。Springer- Verlag,柏林,海德堡 (2024)。https://doi.org/10.1007/978-3-031-72664- 4_10 41. Zhai, G., Örnek, E.P., Wu, S.C., Di, Y., Tombari, F., Navab, N., Busam, B.: Commonscenes: 使用场景图生成具有常识的 3D 室内场景。 在:第三十七届神经信息处理系统年会 (2023), https://openreview.net/forum?id=1SF2tiopYJ 42. Zhang, C., Yu, J., Song, Y., Cai, W.: 利用面向边缘的推理进行基于 3D 点的场景图分析。在:IEEE/CVF 计算机视觉与模式识别会议论文集。第 9705–9715 页 (2021) 43. Zhang, C., Delitzas, A., Wang, F., Zhang, R., Ji, X., Pollefeys, M., Engelmann, F.: 面向真实世界室内空间的开放词汇功能 3D 场景图。在: IEEE/CVF 计算机视觉与模式识别会议 (CVPR) (2025) 44. Zhang, Y., Qian, D., Li, D., Pan, Y., Chen, Y., Liang, Z., Zhang, Z., Liu, Y., Mei, J., Fu, M., Ye, Y., Liang, Z., Shan, Y., Du, D.: Graphad: 用于端到端自动驾驶的交互场景图。在:Kwok, J. (编) 第三十四届国际人工智能联合会议论文集,IJCAI-25。 第 2422–2430 页。国际人工智能联合会议组织 (2025 年 8 月)。https://doi.org/10.24963/ijcai.2025/270,主轨道 45. Zhao, Y., Lv, W., Xu, S., Wei, J., Wang, G., Dang, Q., Liu, Y., Chen, J.: Detrs 在实时物体检测中胜过 Yolos。在:IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)。第 16965–16974 页 (2024 年 6 月)

第 19 页

NoPA:非参数在线3D场景图生成 19

NoPA:非参数在线3D场景图 生成 补充材料

在本补充材料中,我们进行了更多的定性和定量分析。

– NoPA在附录A中的额外定量和定性实验中进行了评估,例如每类实验(附录A.1)、使用真实2D场景图作为输入的实验(附录A.2)以及额外的定性结果(附录A.3)。 – 为了证明我们对物体表示类型的选择是合理的,我们在附录B.1中分析了NoPA的非参数公式与其他参数方法相比的有效性。 – 为了解释关系传播为何有效,我们在附录B.2中分析了关系传播机制与基于合并的替代机制之间的差异,后者用于恢复因合并不足而丢失的关系。 – 为了理解我们专注于困难合并决策的原因,我们在附录B.3中分析了改变间隔带的影响,以确定我们对歧义的定义如何影响NoPA的性能。 – 为了在速度和性能之间找到合适的平衡,我们在附录B.4中分析了用于表示每个物体的粒子数量如何影响NoPA的性能。

A 额外实验

A.1 每类实验

我们在3DSSG [28]数据集的测试集上展示了每类实验的结果,见表5和表6。我们从各自的GitHub仓库中复现了FROSS [11]和JointSSG [34]。NoPA在不同物体类别中表现出色,在除三个物体类别之外的所有类别中均取得了最佳性能。具体而言,与FROSS和JointSSG相比,NoPA能更好地区分细薄的平面物体,如画框和窗户类别。对于地板和墙壁等背景类别,FROSS性能较差可归因于合并效果不佳。这导致生成的物体与真实标签的重叠度较低。相反,我们更优的合并公式使我们能够正确识别并将这些无纹理类别合并为一个物体,从而与真实标签获得较大的重叠度,以正确应对这些具有挑战性的实例。

第 20 页

20 Yeo 等人

在各类谓词性能方面,FROSS 和 NoPA 在稀有类别上均表现出相似的较差性能,这归因于它们共同使用的 RT-DETR-EGTR [13, 45] 骨干网络在 2D SSG 预测中的局限性,以及 3DSSG 中谓词类别的严重类别不平衡 [34]。然而,NoPA 在分类那些与我们优越的合并公式正确识别出的物体共现的关系时表现出色。在“attached to”(附着于)这一谓词类别上,NoPA 显著优于所有竞争方法,该类别通常与墙壁物体类别一起出现。在“standing on”(站立于)这一谓词类别与大型家具物体(如桌子和柜子)之间也观察到了类似的现象。这些观察结果可以在附录 A.3 节中通过视觉验证。虽然解决类别不平衡问题可能会进一步提高 NoPA 的性能,但由于解决类别不平衡并非本文的主要焦点,我们将其留作未来工作。

表 5:在 3DSSG 数据集测试集上,各物体类别与最先进方法的比较。最佳结果已高亮显示。

方法 bath. bed bkshf cab. chair cntr. curt. desk door floor ofurn pic. refri. show. sink sofa table toil. wall wind. Mean. JointSSG [34] 100.0 100.0 0.0 47.6 67.4 25.0 57.6 20.0 50.0 90.0 10.7 14.3 0.0 0.0 42.9 55.0 54.1 80.0 68.0 25.0 45.4 FROSS [11] 100.0 83.3 28.6 53.0 61.3 64.5 77.4 25.0 74.1 88.4 42.3 43.0 50.0 42.9 76.7 75.0 65.9 100.0 57.0 40.2 62.4 NoPA (Ours) 100.0 100.0 28.6 58.7 66.0 64.5 77.4 37.5 69.0 93.9 44.4 49.5 50.0 42.9 68.3 76.3 65.9 100.0 78.5 57.5 66.4

表 6:在 3DSSG 数据集测试集上,各谓词类别与最先进方法的比较。最佳结果已高亮显示。

方法 attached to build in connected to hanging on part of standing on supported by Mean. JointSSG [34] 57.2 28.6 29.4 15.0 20.0 0.4 11.4 23.1 FROSS [11] 26.0 48.7 0.0 0.7 0.0 45.1 3.2 17.7 NoPA (Ours) 73.2 48.7 0.0 0.7 0.0 71.4 11.6 29.4

表 7:在 ReplicaSSG 数据集测试集上,各物体类别与最先进方法的比较。最佳结果已高亮显示。

bag bskt. bed bench bike book botl. bowl box cab. chair clock cntr. cup curt. desk door Method Mean. lamp. pil. plant plate pot rail. scrn. shlf. shoe sink stand table toil. towel umb. vase wind. 25.0 40.0 0.0 0.0 0.0 2.2 9.1 37.5 0.0 4.8 71.0 66.7 40.0 28.6 9.1 0.0 73.3 FROSS 27.6 16.7 43.4 36.8 31.2 7.7 0.0 0.0 11.1 8.3 100.0 0.0 66.7 100.0 0.0 66.7 38.9 3.3 25.0 40.0 0.0 0.0 0.0 1.5 9.1 40.6 8.0 4.8 87.0 66.7 60.0 28.6 9.1 0.0 86.7 NoPA (Ours) 29.8 16.7 67.9 36.8 25.0 7.7 0.0 0.0 22.2 8.3 100.0 0.0 55.6 100.0 0.0 66.7 38.9 0.0

A.2 真实 2D SSG 实验

正如 A.1 节所暗示的,我们的方法在很大程度上依赖于预训练模型生成的 2D SSG 预测的准确性,尤其是物体预测。

第 21 页

NoPA:非参数在线3D场景图生成 21

表8:在ReplicaSSG数据集测试集上,各谓词类别与最先进方法的对比。最佳结果已高亮显示。

方法 above against attached to in near on under with 均值 FROSS [11] 0.0 0.0 0.0 0.0 30.7 20.2 0.0 50.0 12.6 NoPA (Ours) 0.0 0.0 0.0 0.0 45.1 23.6 0.0 80.0 18.6

表9:在3DSSG数据集测试集上,使用真实2D场景图(Ground Truth 2D SSG)与预测2D场景图的对比。+ GT 表示使用以真实2D场景图为输入的预言机(oracle)变体。

Recall% (\delimiter)"3222378 mRecall% (\delimiter)"3222378 模型 关系 物体 谓词 物体 谓词 FROSS [11] 25.7 60.6 30.7 62.4 17.7 FROSS [11] + GT 44.6 (+18.9) 77.2 (+16.6) 44.8 (+14.1) 83.7 (+21.3) 42.7 (+25.0) NoPA 53.2 69.0 61.4 66.4 29.4 NoPA + GT 84.4 (+15.4) 88.2 (+26.8) 85.0 (+18.6) 89.3 (+22.9) 80.8 (+51.4)

如果至少在一帧中未能准确进行物体分类,涉及误分类物体的谓词就会变得不正确或被完全遗漏。这会降低相关谓词类别和受影响物体类别的性能。一个典型的例子是FROSS在“attached to”(附着于)谓词类别上的表现较差,这通常与频繁误分类的“wall”(墙)类别有关。 为了调查对2D场景图质量的依赖程度,我们在表9中将FROSS和NoPA与其以真实2D场景图为输入的预言机变体进行了对比。使用真实2D场景图时,NoPA在所有指标上均获得显著提升,尤其是在谓词mRecall方面。这表明NoPA的性能随着更准确的2D场景图输入而提升,并且与FROSS相比,对较差的2D场景图质量具有更强的鲁棒性。

A.3 更多定性结果

图6、图7和图8可视化了3DSSG数据集上更多的定性结果。如A.1节所述,FROSS通常难以正确识别墙类别的实例。即使墙实例被正确分类,FROSS在分类过程中仍倾向于忽略墙实例与其他物体实例之间的关系。NoPA通过一种更具表达力的表示方法解决了这一局限性,该方法支持更可靠的合并并保留预测的关系。其他具有相似几何形状的类别,如沙发和椅子或桌子和书桌,NoPA能够正确分类,而FROSS则无法准确分类。特别是,NoPA和FROSS在许多场景中均未能预测出“hanging on”(悬挂)这一谓词。由于NoPA和FROSS都依赖RT-DETR-EGTR进行所有可能的谓词和物体预测,因此这两种方法都受到每帧初始2D场景图预测的限制。由于初始2D场景图预测中正确预测出谓词“hanging on”的情况很少,NoPA和FROSS均无法展现出足够多的正确谓词预测

第 22 页

22 Yeo 等人

门 h 墙

水槽 6 a a a 墙 墙 地板 a 墙*

h 墙 墙 墙* a 9 2 墙 墙 a a a 门 水槽 a 门 马桶 a s 马桶 s 3 其他 s 地板 a 墙

真实标签 (GT) FROSS [11] NoPa ( ours)

: 缺失节点预测 : 错误节点预测 : 正确节点预测 *: 被遮挡 : 错误边预测 : 正确边预测 a: 附着于 s: 站立于 h: 悬挂于

图 6: 我们比较了 FROSS 和我们提出的方法在 3DSSG 数据集的场景 ab835fae 上的定性结果。标有 * 的对象实例从两个视角角度均不可见,但在输入图像中可见。FROSS 未能预测出大多数墙壁背景类。值得注意的是,FROSS 难以区分墙壁类和水槽类。FROSS 也未能预测出大多数谓词关系。我们的方法正确分类了大多数对象,同时正确预测了大多数谓词关系。

以压倒多数的方式决定最终的谓词预测。因此,两种方法都未能正确分类给定的谓词类。尽管如此,NoPA 能够泛化到不同的环境,因为每个场景对应不同的房间类型。这一结果表明了对对象外观和光照条件变化的鲁棒性。

B 分析

B.1 与其他表示方法的比较

除了我们的非参数分布表示外,对象也可以用其他离散表示来表示,例如预测的 3D 边界框或从 2D 边界框提升的点云。 可靠地合并来自连续帧输入的 3D 边界框需要精心设计,以保持时间一致性并避免检测碎片化。将候选对象的 3D 边界框融合在一起需要计算两个对象之间的度量距离。通常,这种重叠是通过交并比(IoU)来计算的。在我们的实现中,我们利用 IoU 计算并设置硬阈值 \del t a_{IoU}1。如果 IoU

第 23 页

NoPA:非参数在线3D场景图生成 23

窗户 车厢。 墙 一 个 其他 沙发 一 椅子 窗户 个 门 一 个 一 挂 墙 地板 一 挂 个 一 窗帘 墙 桌子 墙

真实标签 FROSS [11] NoPA (本文)

: 缺失节点预测 : 错误节点预测 : 正确节点预测 : 错误边预测 : 正确边预测 a: 附着于 s: 站立于 h: 悬挂于

图 7:我们比较了 FROSS 与我们提出的方法在 3DSSG 数据集的场景 c2d9933f 上的定性结果。FROSS 再次未能预测出大多数墙壁背景类。FROSS 还将沙发实例错误分类为椅子实例。尽管 FROSS 正确分类了大多数物体,但它未能预测出大多数物体之间的谓词关系。我们的方法正确分类了所有物体,同时正确预测了大多数谓词关系。

局部对象候选者与全局对象之间的 IoU 超过 $\delta_{IoU}$ 时,我们将这两个对象合并。否则,我们将局部对象作为新的全局对象生成。

为何失败?使用边界框的主要问题在于,一旦边界框被扩展,就缺乏任何机制来减小其尺寸。这意味着任何具有扩展空间范围的异常边界框都会错误地导致合并后的边界框扩展到超出真实对象范围。此外,每个边界框中也包含了背景空间。因此,即使它们的重叠主要对应于背景区域而非底层前景对象,边界框也可能被融合。鉴于我们对真实标签匹配的严格标准,过大的边界框会被过滤掉。这些大边界框通常由多个合并的对象组成,并拥有更多累积的关系。如表 10 所示,过滤掉此类边界框会移除相关关系并降低关系召回率。 对于从 2D 边界框提升获得的稀疏点云,如果场景中物体出现在大量帧中,由于每个点云中的点数线性增加,它们无法扩展到实时性能。在我们的实现中,我们采用基于最近邻的点云重叠的简单计算,并使用类似的硬阈值 $\delta_{overlap}$。如果局部对象候选者与全局对象之间的重叠超过 $\delta_{overlap}$,我们将这两个对象合并。否则,我们将局部对象作为新的全局对象生成。 为何失败?点云可以捕捉物体的几何细节,但它们同样受到异常值的影响。一个异常点会导致点云扩展到错误的范围。困扰 3D 边界框的大多数问题也适用于点云。由于

第 24 页

24 Yeo 等人

墙壁 书桌 桌子

椅子 窗户 沙发 s a h s s 窗帘 a a a 墙壁 其他 墙壁 s 地板 桌子 真实值 FROSS [11] NoPa (我们的方法) : 缺失节点预测 : 错误节点预测 : 正确节点预测 : 错误边预测 : 正确边预测 a: 附着于 s: 立于 h: 悬挂于

图 8:我们比较了 FROSS 与我们提出的方法在 3DSSG 数据集中场景 5630cfe7 上的定性结果。FROSS 将书桌对象错误分类为桌子类别。FROSS 还将墙壁实例错误分类为其他家具实例。由于初始分类错误,所有与墙壁实例预测的关系都被错误分类或缺失。我们的方法正确分类了所有对象,同时正确预测了大多数谓词关系。

由于从边界框提升的点云主要仅由前景对象组成,因此背景空间的存在大多得以避免。 与前述两种表示方法相比,我们的非参数表示受异常值的影响较小,因为在核密度估计(Kernel Density Estimate, KDE)之后的重采样步骤倾向于移除远离其他粒子的粒子。这确保了对象的范围不太可能超出真实值对象。

B.2 关系传播分析

关系传播背后的直觉是恢复在场景增量探索过程中遗漏的关系。需要注意的是,这些关系必须在探索过程的某个阶段存在。该机制基于以下假设:具有相同对象类别的相邻对象候选者应与相似对象具有相似的关系。为了将对象候选者分组为簇,我们重用预计算的 MMD 来进行合并决策,以避免为了获得对象候选者之间的亲和力而重新计算所有粒子集上的替代度量。亲和力函数计算如下: A} = [\max (0, 1 {d \mathbf { ac_{MMD}(\mathcal{X}_i(o),{X}_j(o))}{2\delta_{MMD}})]_{i,j=1}^{n,n}, (13)

  • \fr

第 25 页

NoPA:非参数在线3D场景图生成 25

表10:在3DSSG数据集测试集上不同表示方法的比较。最佳结果已加粗显示。

| 表示方法 | 召回率% (Rel) | 召回率% (Obj.) | 召回率% (Pred.) | 平均召回率% (Obj.) | 平均召回率% (Pred.) | 延迟 (ms) $\downarrow$ | 显存 (MB) | | :— | :— | :— | :— | :— | :— | :— | :— | | 点云 | 23.3 | 65.0 | 27.4 | 64.2 | 16.2 | 71 | 1530 | | 边界框 | 7.0 | 68.7 | 8.0 | 64.5 | 8.0 | 26 | 1204 | | NoPA ( ours) | 53.2 | 69.0 | 61.4 | 66.4 | 29.4 | 27 | 1206 |

这满足了有界性和单调性的标准,从而确保了公式的规范性。如果两个片段的亲和度分数低于亲和度阈值 $\tau$,则防止它们被归入同一个簇。这种过滤机制避免了形成过大的簇,从而提高了摊销计算效率。整个关系传播机制如算法1所述。

算法1 关系传播 1: 2: $adjclusters_i \leftarrow \mathbb{M}\{root: bb_R^{neigh(root)} \times V$ // $\times V$ 表示有效对象的数量 3: for $i = 1$ to $C$ do // $C$ 表示簇的数量 4: for $j = 1$ to $c_i$ do // $c_i$ 表示从簇 $i$ 中获得的对象数量 5: for $k = 1$ to $c_i$ do 6: // 累积同一簇的关系 7: $r_j \leftarrow adj[j]$ 8: $r_k \leftarrow adj[k]$ 9: $r_c \leftarrow r_j \cup r_k$ 10: $adj[j] \leftarrow r_c$ 11: $adj[k] \leftarrow r_c$ 12: end for 13: end for 14: end for 15: return $adj$

为什么有效?来自同一类的相邻对象往往与其他对象具有相似的关系。类似于半监督学习中的标签传播概念,我们基于从其他数据点获得的信息更新标签。我们的方法与标签传播在三个方面有所不同:1) 我们传播的是关系而不是对象类别。2) 节点已经包含先验信息,并非无标签。3) 传播发生在单步中,而不是多步中。 为什么不合并?合并也聚合来自相邻对象候选者的关系,类似于关系传播。然而,合并并不保留初始的对象候选者。如表11所示,这种保留

第 26 页

26 Yeo 等人

合并分布 𝒅H > δH + ϵ 阶段 1:预过滤 (无歧义生成)

决策 密度 合并 𝒅H < δH − ϵ 4506 (无歧义 合并)

Hellinger 距离

图 9:我们展示了在 ReplicaSSG 数据集的测试集中,根据 NoPA 粒子拟合高斯分布计算出的 Hellinger 距离所决定的合并决策分布。即使在窄边际带 \delta_H – \epsilon \leq d_H \leq \delta_H + \epsilon 内(其中 \delta_H=0.85 且 \epsilon=0.05),也存在大量需要敏感 MMD 计算(超出矩匹配范围)的合并决策。

对象候选者的合并方式对性能有重大影响。如果属于不同实例的对象候选者被合并为一个实例,则至少会与真实值(ground truth)的一个匹配被移除。如果合并后的实例被我们严格的匹配标准过滤掉,甚至两个匹配都可能被移除。结果是,之前通过增强获得的关联在合并后仍然丢失。因此,所有指标的性能都会因合并机制而下降。这也是为什么过于激进的合并方案会失败的原因,并且每次合并的正确性对于防止误差累积至关重要。

B.3 歧义性分析 表 11:不同 关系聚合方法在 图 9 展示了在 ReplicaSSG 数据集中被视为歧义的合并决策分布。即使在这个边际带内存在少量错误决策,也可能级联并导致误差累积,从而降低 NoPA 的性能。

第 27 页

NoPA:非参数在线3D场景图生成 27

表12:在ReplicaSSG数据集测试集上,不同 $\epsilon$ 值的对比。最佳和第二佳结果分别高亮显示。

Recall% (\delimiter)"3222378 mRecall% (\delimiter)"3222378 $\epsilon$ Latency (ms $\downarrow$) Rel Obj. Pred. Obj. Pred 0 16.2 27.4 17.2 29.0 7.9 18 0.05 36.9 28.6 39.5 29.8 18.6 23 0.1 31.7 27.5 34.0 29.2 15.9 24 0.15 31.1 26.0 33.3 28.5 15.7 26

表13:在3DSSG数据集验证集上,每个粒子集中不同粒子数量的对比。最佳和第二佳结果分别高亮显示。

Recall% (\delimiter)"3222378 mRecall% (\delimiter)"3222378 n Latency (ms $\downarrow$ VRAM (MB\delimiter)"3223379 Rel Obj. Pred. Obj. Pred 64 50.8 63.3 57.5 52.8 26.8 26 1206 128 51.3 66.7 58.8 56.1 27.8 27 1206 256 53.7 66.0 61.0 56.6 28.3 29 1206 512 53.0 65.3 60.3 55.2 29.4 30 1207

表12展示了NoPA在不同容差带(对应不同模糊程度)下的性能。$\epsilon = 0$ 表示仅对物体候选者的粒子集上拟合的高斯分布使用Hellinger距离,而不借助额外的MMD支持。NoPA在 $\epsilon = 0.05$ 时取得了最佳性能。

备注。虽然MMD在用于模糊合并时可能是更优的选择,但当根据Hellinger距离进行明确清晰的合并决策时,它会失去其有效性。MMD在再生核希尔伯特空间中比较两个物体分布之间的完整分布距离。然而,它并没有显式编码Hellinger距离所编码的物体之间的欧几里得距离。容差带越大,MMD越有可能错误地合并两个欧几里得距离较大的物体候选者。专注于狭窄的容差带使得MMD能够提供比单纯依赖矩匹配更可靠的合并决策。

B.4 粒子数量分析

由于使用MMD的第二阶段决策规则的理论上运行时间与粒子数量的平方成正比 $O(n) \propto n^2$,我们预期运行时间随粒子数量呈二次方增长。然而,由于我们仅将MMD应用于模糊合并决策,而这些决策仅占合并决策的一小部分子集,因此运行时间成本得到了分摊。经验上,如表13所示,我们发现NoPA的运行时间并没有显著增加

第 28 页

随着粒子数量的增加,性能会发生变化。$n = 256$ 在速度与性能之间取得了恰当的平衡。

评注。反直觉的是,更多的粒子数量并不总是带来性能的提升。使用 $n = 512$ 个粒子的 NoPA 性能低于使用 $n = 256$ 个粒子的情况。一种可能性是,表示单个对象所需的粒子有效数量少于 512。超过 $n = 256$ 的额外粒子可能只是在重复先验粒子的信息,而没有增加额外的上下文。增加更多粒子甚至可能适得其反,因为它会产生噪声更大的对象表示,从而降低性能。

发表评论