快速导读:现有研究多关注2D图像,忽略了3D点云几何结构对优化过程的独特影响。我们缺乏对损失函数在3D场景中失效机制的深入理解,特别是损失景观拓扑如何制约重加权策略的有效性。
在3D点云语义分割任务中,类别不平衡是一个长期存在的挑战。尽管在2D图像领域,Focal Loss、Class-Balanced Loss等专门针对不平衡设计的损失函数取得了显著成功,但它们在3D点云架构上的表现却并不一致。
本文通过系统的实验和机制分析,发现标准交叉熵损失(CE)在多个3D数据集上表现稳健,甚至优于许多复杂方法。作者提出,这一现象的根本原因在于3D点云数据的几何特性所决定的损失景观拓扑结构,而非损失函数本身的设计优劣。
英文题目:Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance
论文出处:arXiv 每日论文精选 · arXiv:2607.21089
原始论文:PDF / 论文页面
对应视频标题:3D点云分割:为何简单CE损失比复杂重加权方法更稳健?|推荐指数:★★★★★
这篇论文解决什么问题?
3D点云数据通过几何结构而非纹理或颜色来编码语义信息,这使得其优化景观与2D图像存在本质差异。现有的不平衡缓解方法大多基于2D视觉假设,即通过调整样本权重来平衡梯度贡献。
然而,在3D场景中,点云的稀疏性和几何复杂性可能导致优化过程对权重变化极为敏感。特别是在极端不平衡的数据集上,激进的重加权策略可能会破坏模型对多数类几何结构的理解,从而导致整体性能下降。
因此,理解不同损失函数在3D点云分割中的实际效果及其背后的机制,对于指导模型设计和训练策略具有重要意义。
核心创新
方法概览
现有研究多关注2D图像,忽略了3D点云几何结构对优化过程的独特影响。我们缺乏对损失函数在3D场景中失效机制的深入理解,特别是损失景观拓扑如何制约重加权策略的有效性。
- 研究在两个具有不同不平衡程度的数据集上进行评估:DALES(极端不平衡,比例641:1)和S3DIS(中度不平衡,比例56:1)。
- 评估了11种不平衡缓解方法,包括6种重加权方案和5种损失函数,使用KPConv和RandLA-Net两种主流3D架构。
- 通过混淆矩阵分解,量化了多数类到少数类和少数类到多数类的错误转移情况。
- 引入决策边界变异性(Decision Boundary Variability)指标,衡量不同损失函数导致的决策边界相对于标准CE的偏离程度。
- 通过权重扰动敏感性和海森矩阵特征值谱分析,表征损失景观的拓扑结构,包括曲率各向异性和平坦度。
逐图理解论文
直觉与反例

该图展示了不同类别频率与性能变化的关系。左侧DALES显示激进方法导致少数类性能大幅下降,右侧S3DIS显示方法间差异微小。这直观地说明了数据集不平衡程度对方法有效性的影响。
核心贡献

该图绘制了决策边界变异性与mIoU的关系。左侧DALES显示强负相关,表明边界不稳定导致性能下降;右侧S3DIS显示弱正相关,说明边界变化对性能影响有限。这支持了景观拓扑决定方法有效性的论点。
结论与意义

研究表明,标准交叉熵损失在3D点云分割中是一个稳健且高效的基线。从业者应谨慎使用复杂的不平衡缓解方法,特别是在极端不平衡场景下,避免过度工程化带来的性能风险。这一发现为3D视觉模型的设计提供了重要的实证依据。
实验如何设计?
- 在DALES和S3DIS数据集上,使用相同的训练配置和超参数,确保比较的公平性。
- 记录每个类别的IoU变化,特别关注少数类(频率<6%)的性能波动。
- 计算决策边界变异性与mIoU之间的斯皮尔曼相关系数,以量化边界稳定性与性能的关系。
- 在20个随机方向上进行权重扰动,观察训练损失的变化,以评估景观的局部曲率。
关键结果与论文证据
- 在DALES数据集上,标准CE的mIoU为80.05%,最佳方法仅高出0.81%,而激进重加权方法(如invf)导致mIoU下降12.27%(第7页)。
- 在S3DIS数据集上,所有方法的mIoU差异很小,范围仅为1.93%,表明方法选择影响有限(第8页)。
- DALES上决策边界变异性与mIoU呈强负相关(rs=-0.874),说明边界不稳定直接导致性能下降(第11页)。
- 混淆矩阵分析显示,激进重加权虽然减少了少数类到多数类的错误,但大幅增加了多数类到少数类的错误,净收益为负(第10页)。
- 海森矩阵特征值谱显示,同一数据集上不同方法的景观几何结构相似,表明拓扑由数据决定而非损失函数(第13页)。
阅读时需要注意
- 机制分析主要基于KPConv架构,RandLA-Net的验证仅限于性能指标,缺乏深入的拓扑分析。
- 研究仅关注基于点的架构,未涵盖体素化或Transformer-based方法。
- 未评估数据层面的不平衡缓解策略,如过采样或欠采样。
- DALES数据集因标注问题排除了一个切片,可能影响结果的完整性。
关联工作
- Pan et al. [15] 首次分析了SemanticKITTI中的不平衡问题,但未评估现代损失级缓解策略。
- Lei et al. [10] 引入了决策边界变异性指标,本研究沿用并扩展了其应用。
- Li et al. [11] 提供了损失景观可视化和海森特征值分析的方法论基础。
- Cui et al. [6], Lin et al. [12] 等提出的不平衡缓解方法在本研究中被系统评估。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
损失景观拓扑揭示了为何在类别不平衡下简单基线在3D点云分割中具有竞争力⋆
Antonis Savva1[0000−0002−0056−5680], Christos Kyrkou1[0000−0002−7926−7642], 和 Theocharis Theocharides1,2[0000−0001−7222−9152]
1 KIOS卓越研究与创新中心 {savva.d.antonis, kyrkou.christos}@ucy.ac.cy 2 电气与计算机工程系, theocharides.theocharis@ucy.ac.cy 塞浦路斯大学, 1 Panepistimiou Avenue, 2109 Aglantzia, 尼科西亚
摘要。3D点云的语义分割面临严重的类别不平衡问题,然而,来自2D计算机视觉的专门针对不平衡感知方法在3D上下文中的有效性仍不清楚。我们系统地评估了11种不平衡缓解方法,涵盖具有极端(641:1)和中等(56:1)不平衡比率的数据集,揭示了一个令人惊讶的发现:使用均匀加权的简单交叉熵损失(CE)通常能达到具有竞争力的性能,在架构和数据集上,其mIoU通常仅比专门方法低0.8-3.3%。通过对错误模式、决策边界和优化景观几何的多方面机制分析,我们的分析表明,不平衡的严重程度塑造了景观拓扑,在极端不平衡下形成狭窄的解盆地,而在中等不平衡下形成平坦的高原。这似乎限制了损失层面修改的有效性,因为所有方法都必须在这些几何约束下进行导航。我们的发现提供了实用指导;标准交叉熵提供了一个稳健的基线,专门方法提供的改进幅度较小(0.8-3.3% mIoU),且因架构和数据集而异,但如果调整不当,可能会导致性能显著下降。这项工作为为何在2D中证明有效的技术不能轻易迁移到基于点的3D点云分割提供了首个机制性解释,并在两种代表性架构上得到了验证。
关键词:3D语义分割 · 类别不平衡 · 损失景观分析 · 决策边界 · LiDAR
⋆本工作已获得第101168067号资助协议“GuardAI – 增强安全关键应用的边缘AI系统的鲁棒性和安全性”的资金支持,由欧洲网络安全能力中心提供支持。然而,文中表达的观点和意见仅代表作者,并不必然反映欧盟或欧洲网络安全能力中心的观点。欧盟或欧洲网络安全能力中心不对此负责。计算资源由塞浦路斯大学高性能计算设施(UCY HPC)提供。
第 2 页
2 A. Savva 等人
1 引言
对激光雷达(LiDAR)数据的3D点云进行语义分割对于自主导航、机器人技术[8]和环境监测[3]至关重要。与大多数真实世界数据集一样,LiDAR点云表现出严重的类别不平衡,多数类包含大量点,而关键的少数类包含的点少得多。这种长尾分布降低了少数类的性能,而对这些类的准确分割对于构建可靠系统至关重要。在此背景下,2D计算机视觉中使用的类别不平衡缓解策略是3D领域提升性能的自然选择,例如基于有效样本数的类别平衡损失[6]、焦点损失(focal loss)[12]、标签分布感知边距[4]、logit调整[14]、跷跷板损失(seesaw loss)[22]和平衡元softmax损失[18]。这些方法在分类任务(包括CIFAR-LT、ImageNet-LT、iNaturalist)、目标检测任务(COCO)和实例分割任务(LVIS)的基准测试中均显示出显著的改进。
尽管这些方法在2D领域取得了成功,但它们是否能有效迁移到3D领域仍有待深入探索。与以外观为特征的2D图像不同,3D点云通过几何结构编码语义。基于点的架构显式地利用了这种结构,可能会形成使得简单损失公式就足以优化的景观。本研究考察了专门的类别不平衡方法在与深度学习架构结合时,在3D领域是否能像2D领域一样带来类似的好处,并调查了其性能背后的机制。
具体而言,本工作做出了四项主要贡献:
– 在两个不同数据集上系统评估了11种类别不平衡缓解方法(六种损失重加权方法和五种损失函数)。结合混淆矩阵分析、决策边界变异性评估和损失景观特征描述,首次提供了机制性解释,说明为何标准交叉熵(CE)在基于点的3D分割中仍具有竞争力。 – 通过详细的混淆矩阵分析,我们表明专门的方法成功提高了少数类的召回率,但降低了精确率,这解释了为何尽管针对不平衡问题,整体性能仍保持中性。例如,激进的重加权将少数类到多数类的错误减少了5-10倍,但将多数类到少数类的错误放大了10倍。 – 我们测量了CE与专门方法之间决策边界的差异,揭示了依赖于数据集的景观拓扑。在DALES数据集上,具有低边界变异性(接近CE)的方法实现了80-81%的mIoU,而较大的偏差导致性能显著下降(降至68%)。在S3DIS数据集上,无论边界配置如何,所有方法都聚集在62.9-64.8%的mIoU范围内,这表明存在一个平坦的景观,方法选择的影响最小。 – 我们通过权重扰动敏感性和海森矩阵特征值谱来表征局部曲率,发现所有方法在每个数据集内都表现出相似的轮廓。
第 3 页
3D 分割中的损失景观拓扑 3
我们分析了 DALES [21](极端不平衡,641:1,室外航空激光雷达)和 S3DIS [1](中度不平衡,56:1,室内激光雷达),结果表明,采用均匀加权的 CE 与专用方法具有竞争力,差异通常在 0.6-3.3% mIoU 范围内。我们的机制分析显示,不平衡的严重程度塑造了优化景观的拓扑结构,极端不平衡会形成狭窄的盆地,其中 CE 的解受到青睐,而偏离该解是危险的(就性能下降而言)。相比之下,中度不平衡会产生平坦的景观,使得方法选择的影响较小。这些发现表明,从业者可以依赖标准的 CE 进行基于点的 3D 分割任务,尽管根据架构的不同,专用方法可能会带来适度的提升。我们在两种基于点的架构(KPConv 和 RandLA-Net)上验证了这些模式。未来的工作应将此分析扩展到更多的架构(例如,基于体素和 Transformer 的架构),并调查数据级和损失级方法的结合。
2 相关工作
2.1 点云语义分割
用于 3D 点云分割的深度学习方法可分为基于投影、基于体素和基于点的方法。基于投影的方法将 3D 点映射到多视图或球形图像上,从而能够使用标准的 CNN,但会遭受信息丢失和遮挡的问题。基于体素的方法将空间划分为规则网格以进行 3D 卷积,以高内存消耗为代价捕捉局部结构 [8]。基于点的方法直接处理原始点云,PointNet 提出了置换不变的特征学习 [5],PointNet++ 引入了分层特征聚合 [17]。随后的进展包括以下方法:使用多层感知机聚合局部特征以缓解随机点采样方法的缺点 [9],学习专门针对点云的卷积核 [23],以及采用基于核点表示的全卷积网络 [19]。
2.2 类别不平衡
类别不平衡缓解方法包括重采样策略、代价敏感学习以及专门的损失函数,如焦点损失(FL)[12]、标签分布感知边际损失(LDAM)[4] 和 logits 调整(LADJ)[14],这些方法在长尾基准测试(iNaturalist、CIFAR-LT、ImageNet LT、LVIS)中显示出改进 [7, 13, 20, 24]。
3D 点云中的不平衡是感知模态固有的,其中激光雷达数据集表现出极端的不平衡(例如,Semantic-KITTI [2]:道路、人行道、停车场约占 40% 的点;标志、行人、骑行者 <0.1%),原因如下:(1) 物理范围不均(地面与小物体),(2) 距离依赖的点密度(远距离物体欠采样),以及 (3) 环境频率(植被无处不在;交通标志稀疏)。Pan 等人
第 4 页
4 A. Savva 等
[15] 对 SemanticKITTI 中的不平衡特性进行了首次系统分析,按难度对类别进行分类,并表明挑战不仅源于频率,还源于类内变化和类间几何属性。然而,他们的研究并未系统评估现代基于损失函数的缓解策略,因此未阐明这些技术何时以及为何成功或失败。
2.3 损失景观分析与决策边界
为了理解为何感知不平衡的方法在基于点的 3D 分割中未能优于标准 CE(尽管它们在 2D 中取得了成功),我们需要分析工具来表征不同的损失函数公式如何塑造优化过程和学到的表示。通过聚合指标(如 mIoU)进行评估揭示了什么表现良好,但未解释原因,使得方法有效性的潜在机制无法得到解释。
理解优化景观对于深度学习理论而言至关重要,正是出于这一目的。损失景观可视化和海森矩阵特征值分析表征了局部曲率,平坦性与更好的泛化能力相关 [11],从而能够评估不同选择(例如批量大小、跳跃连接)如何引导优化。互补地,决策边界分析量化了网络如何划分输入空间(Lei 等人引入了一种变异性指标,用于衡量跨训练运行的边界稳定性 [10]),使我们能够确定专门的方法是否改变了与 CE 相比学到的决策边界。结合来看,这些方法提供了一种机制性视角,以检查性能差异(或缺乏差异)是源于景观几何形状、不同的几何划分,还是两者兼有。在本研究中,我们采用这两种框架,对基于点的 3D 点云分割中的类别不平衡缓解问题进行首次全面的机制性分析。
3 方法论
我们的工作通过以下方式填补了文献空白:(1) 在具有对比不平衡严重程度的数据集上评估 11 种方法;(2) 通过决策边界变异性进行机制性分析;(3) 进行混淆矩阵分析,识别出专门方法未能改善聚合指标背后的精度-召回权衡;以及 (4) 通过网络权重扰动和海森矩阵特征值表征损失景观几何形状。据我们所知,这是首次将优化景观的拓扑结构与基于点的 3D 分割中不平衡缓解的有效性联系起来的工作。
3.1 问题设置
给定点云 $P = \{p_i\}_{i=1}^N$,其中 $p_i \in \mathbb{R}^{3+d}$(坐标加上可选特征),任务是为每个点分配一个语义标签 $y_c \in \{1, \dots, C\}$,其中 $C$ 为类别数量,$N$ 为数据集中的点数。
第 5 页
3D 分割中的损失景观拓扑 5
3.2 评估方法
重加权方案。我们修改标准交叉熵(CE)损失为 $L_{CE} = -\sum_{i=1}^{N} w_c \log(p_{y_i})$,其中 $p_{y_i}$ 是真实类别的预测概率,$w_c$ 是类别权重。用 $n_c$ 表示类别 $c$ 中的训练点数,六种方案为:(1) 均匀(uni)$w_c = 1$(基线),(2) 逆频率(invf)$w_c = N/n_c$,(3) 基于有效样本数的类别平衡(cb)损失 $w_c = (1-\beta)/(1-\beta^{n_c})$,其中 $\beta = 0.9$ [6, 15],(4) 逆对数(invl)$w_c = 1/\log(n_c)$,(5) 逆幂(invp)$w_c = 1/n_c^\gamma$,其中 $\gamma = 0.1$,以及 (6) 互补频率(comf)$w_c = 1 – n_c/N$ [16]。除均匀方案外,所有方案的权重均归一化以总和为 1。
损失函数。我们评估:(1) 焦点损失(FL):$L_{FL} = -\sum_i (1-p_{y_i})^\gamma \log(p_{y_i})$,其中 $\gamma = 1$,其对分类良好的样本进行降权 [12];(2) LDAM,它强制实施类别相关的决策边界 $\Delta_c \propto 1/n_c^{1/4}$ [4];(3) LADJ,它调整对数几率为 $\tilde{z}_c = z_c – \tau \log \pi_c$,其中类别先验 $\pi_c = n_c/N$ 且 $\tau = 0.3$ [14];(4) BalSoft,它将类别频率纳入 softmax 计算中 [18];以及 (5) Seesaw Loss,它在缓解和补偿因子之间动态平衡,前者减少尾部类别的惩罚,后者在发生误分类时增加惩罚 [22]。
3.3 架构与数据集
我们采用 Kernel Point Convolution (KPConv) [19],它使用刚性和可变形核进行几何卷积,以分割 DALES(具有八个语义类别的室外航空激光雷达)[21] 和 S3DIS(具有 13 个语义类别的室内扫描)[1],以及采用随机采样耦合局部特征聚合模块的 RandLA-Net [9]。有关所用具体架构、训练协议和数据集的更多信息,请参见补充材料的第 S1 和 S2 节。
3.4 分析方法
尽管先前的工作已经描述了 3D 分割中不平衡的多面性质 [15],但缺乏对多种缓解策略的系统评估及其机制分析。为了弥补这一空白,我们采用三种互补技术:(1) 混淆矩阵分析,揭示导致性能差异的精确率-召回率权衡;(2) 决策边界变异性,量化与 CE 相比,专用损失如何改变输入空间的划分;以及 (3) 通过海森矩阵特征值和权重扰动进行的损失景观拓扑表征,评估方法是否收敛到定性不同的区域(尖锐极小值与平坦极小值)。这些分析共同提供了机制见解,解释了为何标准 CE 在基于点的 3D 分割中仍具有竞争力。
第 6 页
6 A. Savva 等
混淆矩阵。对于每种方法,我们在测试集上计算完整的混淆矩阵,并分析:(1) 每个类别的精确率和召回率;以及 (2) 被分配给少数类的主要类点的百分比,反之亦然。
决策边界变异性。为了量化不同方法与 CE 相比如何改变学习到的决策边界 (DB),我们采用文献 [10] 中的决策边界分析框架。对于训练好的模型 $f_\theta$,我们将预测标签分配定义为 $y_c = \arg \max_c f_\theta(x)_c$。两种方法(参数为 $\theta_A$ 的方法 A 和参数为 $\theta_{uni}$ 的均匀加权)之间的决策边界变异性衡量的是接收不同标签预测的测试点的比例:
$$ \text{DB-var}(A, \text{uni}) = \frac{1}{N} \sum_{i=1}^{N} \mathbb{I} \left[ \arg \max_c f_{\theta_A}(x_i)_c \neq \arg \max_c f_{\theta_{\text{uni}}}(x_i)_c \right], \quad (1) $$
其中 $\mathbb{I}[\cdot]$ 是指示函数。低变异性表明决策边界与 CE 相似,而高变异性则表明边界发生了实质性改变。
损失景观拓扑。我们通过测量对权重扰动的敏感性来表征收敛模型参数 $\theta^*$ 处优化景观的局部曲率特性。该分析揭示了某个解是占据尖锐、狭窄的最小值,还是宽阔平坦的盆地;这些特性与泛化能力相关 [11]。
我们的方法从 $\theta^*$ 处的切线空间中采样 $K$ 个随机扰动向量。每个向量 $v_k \sim \mathcal{N}(0, I)$ 独立生成,然后使用滤波器归一化幅度匹配 [11] 进行缩放。具体而言,对于网络中的每个权重张量 $W_j$,其对应的扰动分量 $\hat{v}_{k,j}$ 被重新缩放为:
$$ \hat{v}_{k,j} = v_{k,j} \cdot \frac{\|W_j\|_F}{\|v_{k,j}\|_F}, \quad (2) $$
其中 $\|\cdot\|_F$ 表示 Frobenius 范数。这种归一化确保扰动与每层的自然尺度成比例,防止具有不同权重幅度的层产生不成比例的影响。
然后,我们在不同的 $\rho$ 值下评估扰动参数 $\tilde{\theta}_k = \theta^* + \rho \hat{v}_k$ 处的训练损失。损失偏差量化了景观的平坦度:
$$ \delta_k = L_{\text{train}}(\tilde{\theta}_k) – L_{\text{train}}(\theta^*). \quad (3) $$
较低的 $\delta_k$ 值表征了更平坦的最小值,表明模型对微小(权重)扰动不太敏感。我们使用 $K=20$ 个随机方向,以在计算成本和统计可靠性之间取得良好的平衡。
为了表征局部曲率,我们还计算了收敛解 $\theta^*$ 处海森矩阵 $H = \nabla^2_\theta L(\theta^*)$ 的前 10 个特征值。我们使用 Lanczos 算法,该算法仅需通过自动微分直接计算的海森-向量积 [11]。
第 7 页
3D 分割中的损失景观拓扑 7
4 结果
4.1 评估指标
评估结果报告了单次训练的运行情况,测试时预测通过对测试数据集进行 10 次投票传递进行聚合。性能使用每类 IoU 和平均 IoU (mIoU) 进行衡量:
C cmii 1 IoUi = , mIoU = X IoUi, (4) cmii + Pj̸=i cmij + Pk̸=i cmki C i=1
其中 cmij 表示混淆矩阵的元素。
4.2 整体性能
表 1 和表 2 分别展示了所有评估方法在 DALES(按照标准做法,计算 mIoU 时排除未知类)和 S3DIS 上的每类和平均 IoU。在 DALES 上,均匀加权 (uni) 实现了 80.05% 的 mIoU,与表现最好的方法具有竞争力(invp: 80.86%, invl: 80.69%, comf: 80.72%, LDAM: 80.63%),而极端重加权 (invf) 和平衡 softmax 损失 (BalSoft) 显著降低了性能(分别为 67.78%, 68.14%)。具有竞争力的方法之间的差异仅跨越 0.9% 的 mIoU。在 S3DIS 上,所有方法聚集在 62.92-64.85% 的 mIoU 范围内(1.93% 的范围),均匀加权(63.1%)位于中心附近;这种在不同损失公式下的狭窄范围本身就是一个关键发现,证明了在此设置中方法选择的影响有限。最后一行显示了方法间的性能范围,揭示了少数类表现出更大的方差,而多数类保持稳定。 为了确保观察到的模式不是随机种子选择的伪影,我们对均匀加权 (uni) 和每个数据集上表现最好的方法分别使用不同的种子(即种子 1、2 和 3)进行了三次额外的训练。
表 1:DALES 数据集上的每类性能。 方法 均值 地面 植被 汽车 卡车 电线 栅栏 杆子 建筑物 uni 80.047 96.507 93.781 85.143 42.650 94.029 61.092 72.262 94.915 invf 67.780 95.885 91.111 71.534 32.470 86.406 31.041 40.163 93.632 cb 78.534 96.445 93.474 85.103 43.480 94.763 57.071 63.121 94.816 invl 80.692 96.488 93.846 84.828 43.504 94.476 62.659 74.936 94.802 invp 80.861 96.518 93.795 85.137 44.374 94.647 63.169 74.299 94.945 comf 80.715 96.474 93.759 85.192 43.103 94.646 63.280 74.335 94.932 FL 80.039 96.495 93.767 85.025 43.339 93.790 62.402 70.609 94.884 LDAM 80.629 96.510 93.828 85.260 44.550 94.510 62.524 72.894 94.957 LADJ 79.598 96.561 93.665 84.088 42.359 94.277 59.860 70.928 95.047 BalSoft 68.136 96.126 91.771 74.583 22.637 93.752 33.658 38.856 93.708 Seesaw 80.360 96.538 93.826 85.091 43.641 93.990 62.984 71.885 94.924 范围 13.081 0.676 2.735 13.726 21.913 8.357 32.239 36.080 1.415
第 8 页
8 A. Savva 等
表 2:S3DIS 数据集上的各类别性能。 方法 mean ceiling floor wall beam column window door chair table bookcase sofa board clutter uni 63.097 93.693 98.514 80.862 0.000 21.341 43.934 61.597 87.347 79.061 71.098 65.612 59.560 57.642 invf 63.683 92.264 98.314 80.297 0.000 25.512 46.554 60.456 87.337 79.534 71.026 71.432 60.282 54.871 cb 63.556 92.649 98.392 80.499 0.000 24.290 45.111 62.371 87.402 78.244 70.891 67.834 62.327 56.221 invl 63.534 93.449 98.498 80.746 0.000 23.703 45.545 59.198 87.668 79.424 71.799 67.024 60.248 58.635 invp 62.915 92.995 98.416 80.498 0.000 23.474 46.459 60.386 86.864 78.853 70.282 60.821 61.380 57.465 comf 63.534 92.937 98.398 81.069 0.000 21.561 46.451 66.563 87.381 79.507 70.915 62.936 61.760 56.469 FL 63.247 92.213 98.394 79.701 0.000 22.118 44.992 60.418 87.755 79.353 70.239 67.789 62.686 56.555 LDAM 63.268 92.684 98.476 80.578 0.000 24.958 45.116 62.027 87.850 78.675 71.300 63.466 60.798 56.553 LADJ 63.999 92.834 98.405 81.447 0.000 24.748 49.772 62.241 87.156 78.881 71.915 64.341 63.757 56.492 BalSoft 64.848 93.138 98.383 82.602 0.000 28.378 54.368 64.392 86.916 77.966 71.283 66.948 63.054 55.598 Seesaw 63.610 92.922 98.453 80.586 0.000 21.489 47.755 62.613 87.691 78.743 70.777 67.915 62.434 55.549 Range 1.933 1.480 0.200 2.901 0.000 7.037 10.434 7.365 0.986 1.568 1.676 10.611 4.197 3.764
(DALES 上的 invp,S3DIS 上的 BalSoft)。结果在补充材料的第 S3 节中展示,证实了方法排名在不同随机种子下保持稳定;均匀加权的竞争性表现并非统计伪影,且少数类别的标准差增加并未改变竞争性方法之间紧密聚集的基本模式。
为了评估性能模式是否超越 KPConv 具有泛化性,我们使用 RandLA-Net [9] 重复了实验,该网络采用随机采样而非 KPConv 的结构化基于势的方法。RandLA-Net 表现出相同的模式,但性能范围略大,即在 DALES 上,均匀加权达到 76.76%,而最佳方法(LDAM)达到 79.17%(+2.41%);在 S3DIS 上,均匀加权达到 61.38%,而 LDAM 达到 64.70%(+3.32%)。虽然机制分析(第 4.4-4.6 节)侧重于 KPConv,但不同架构间性能结果的一致性表明,均匀 CE 的竞争性表现并非特定于架构的。完整结果见补充材料的表 S2-S3。
4.3 各类别性能分析
为了理解不同方法如何影响各个类别,我们分析了 KPConv 中类别频率与相对于 CE 的性能增益之间的关系。图 1 展示了代表性方法(即损失重加权方法和损失函数中表现最好和最差的方法)的类别频率与 ∆IoU(与 CE 的性能差异)的关系。在此,当变化超过 5%(DALES)或 3%(S3DIS),或频率低于 6% 时,对类别进行标注。在 DALES 上,极端重加权(invf)和 BalSoft 在少数类别上显示出显著退化,电线杆和栅栏的 IoU 损失超过 -30%。相反,温和重加权(invp)和 LDAM 损失在这些相同类别上实现了适度的增益(+2-3%),同时保持了多数类别的性能(表 1)。类别频率与分析方法带来的收益之间没有一致的相关性;一些罕见类别得到改善,而其他类别则大幅退化。
在 S3DIS 上,所有方法围绕基线的聚集更加紧密,∆IoU 值主要位于 ±5% 以内。表现最好的方法(BalSoft)在窗户和柱子上显示出改进(+10%,+7%);然而,invp
第 9 页
3D 分割中的损失景观拓扑 9
在沙发类别上表现出退化(-5%)。这种跨类别的不一致性,结合变化幅度的微小,揭示了尽管损失公式各异,mIoU 差异仍保持在 2% 以内的原因。 图 2 专门关注少数类(频率 <6%)。在 DALES 上,激进的重新加权严重损害了罕见类的性能,而在 S3DIS 上,即使大幅修改损失也仅产生微小且不一致的改进。这些结果表明,与它们在 2D 图像分类中的既定有效性 [4, 6, 12, 14, 18, 22] 相反,专门的方法并未基于点的 3D 分割中的少数类带来系统性收益。
4.4 混淆矩阵
为了理解专门的方法为何在针对少数类的情况下未能提升整体性能,我们通过混淆矩阵分析错误模式。表 3 量化了两种错误类型,即多数类到少数类和少数类到多数类的误分类。在 DALES 中,揭示了均匀加权下的根本权衡,实现了平衡的错误率(多数类到少数类 0.15%,少数类到多数类 12.78%)。激进重新加权(invf)和 BalSoft 大幅减少了少数类到多数类的错误(1.58%,1.89%);因此,成功提高了少数类的召回率,但将多数类到少数类的错误膨胀了 10 倍(1.58%,1.50%),降低了少数类的精确率。这种精确率的崩溃解释了它们较低的 mIoU 分数(67.78%,68.14%)。相反,具有竞争力的方法(invl, invp, comf, LDAM)保持了较低的多数类到少数类污染(≤0.19%),从而保留了精确率,同时接受稍高的少数类到多数类错误(10.36-12.67%),与均匀加权的错误相当。净效应是精确率的保持抵消了召回率的边际增益,导致
DALES S3DIS 10 10 invf invp 窗户 BalSoft 电线杆 FL 电线杆 卡车 卡车 电力 电力 电力 线 围栏 围栏 汽车 汽车 8 CE 基线列 0 沙发 6
列 电力线(%) 4 卡车 板 板 汽车 CE 门 10 窗户 窗户 沙发 列 汽车 板 对比 2 沙发 窗户 板 IoU 列 桌子 桌子 桌子 卡车 0 椅子 椅子 椅子 椅子 书架 书架 书架 书架 20 桌子 门 invp 围栏 invf 2 围栏 LDAM 30 电线杆 BalSoft 4 沙发 电线杆 CE 基线 10 1 10 0 10 1 10 1 10 0 10 1 类别频率(占总点的百分比) 类别频率(占总点的百分比)
图 1:DALES(左)和 S3DIS(右)中类别频率相对于基线(方法 – CE)的性能变化。点代表所选方法的各个类别,注释显示类别名称,其中 |∆IoU| > 5%(DALES)或 |∆IoU| > 3%(S3DIS),或频率 < 6%。阴影区域表示改进(绿色)和退化(红色)区域。DALES 表现出极端的敏感性(invf 和 BalSoft 显著减少罕见类),而 S3DIS 显示出跨方法的紧密聚类。
第 10 页
10 A. Savva 等
DALES S3DIS 0 10 invfinvp 8 FL 5 LDAM 6 BalSoft 10 (%) 4 15 IoU 2 20 invf 0 25 invp FL 2 30 LDAM BalSoft 4 35 cars trucks lines fences poles columnwindow door chair tablebookcase sofa board power
图 2:少数类(频率 <6%)在 DALES(左)和 S3DIS(右)上的性能变化(∆IoU)。对于 DALES,激进的重新加权导致急剧退化,而其他方法仅带来适度增益。对于 S3DIS,所有方法表现出的差异较小,表明方法选择的影响微乎其微。
获得相似的 mIoU。DALES 的精确率和召回率性能见补充材料中的表 S4(RandLA-Net 见表 S6)。 S3DIS 表现出更均匀的行为。所有方法在两个方向上均显示出中等比率(多数类到少数类 3.7-6.27%,少数类到多数类 26.82-36.59%)。即使达到最佳 mIoU(64.85%)的 BalSoft,也以较高的多数类到少数类错误(6.27%)换取较低的少数类到多数类错误(26.82%),这表明召回率的提升被精确率的降低所抵消。更紧密的性能聚类(1.93% mIoU 范围)反映了所有方法中这种精确率-召回率的平衡。S3DIS 的精确率和召回率性能见补充材料中的表 S5(RandLA-Net 见表 S7)。
4.5 决策边界变异性
为了理解不平衡缓解策略的选择是否从根本上改变了决策边界,我们分析了相对于均匀加权(公式 (1))的决策边界(DB)变异性。图 3 展示了两个数据集上 DB 变异性(相对于 uni)与 mIoU 性能之间的关系。在 DALES(左)上,我们观察到显著的负相关,表现出低 DB 变异性(<0.013)的方法实现了 80-81% 的 mIoU,与 uni(80.05%)相当或更高,而表现出高 DB 变异性(>0.020)的方法则遭受性能退化(invf: 67.78%,BalSoft: 68.14%)。Spearman 相关系数为 rs=-0.874(p<0.001),表明偏离 uni 的决策边界强烈预示着性能下降。这种模式表明,在极端不平衡(641:1)的情况下,uni 占据了一个狭窄的有利解盆地,微小的偏离(invp, LDAM, invl, comf 展现出 DB 变异性 ≈0.007-0.0088)可以提供边际增益(+0.6-0.8% mIoU)。然而,大幅偏离可能会完全脱离该盆地。 相比之下,S3DIS(图 3 右)表现出弱正相关(ρ=0.768,p=0.009),尽管 DB 变异性范围从 0.047 到 0.066,但所有方法都聚集在 62.9-64.9% 的 mIoU 内。表现最好的方法(BalSoft: 64.85%)
第 11 页
3D 分割中的损失景观拓扑 11
表 3:DALES(左)和 S3DIS(右)混淆矩阵的分析。 数值表示被分类为多数类/少数类的少数类/多数类点的平均百分比。 方法 多数类→少数类 少数类→多数类 多数类→少数类 少数类→多数类 uni 0.15 12.78 3.79 36.2 invf 1.58 1.58 5.74 32.21 cb 0.43 5.67 4.39 33.81 invl 0.17 11.11 4.07 35.08 invp 0.19 10.36 4.04 35.66 comf 0.19 11.53 4.33 35.11 FL 0.17 11.82 3.7 36.59 LDAM 0.15 12.67 3.97 35.8 LADJ 0.34 7.35 4.57 33.03 BalSoft 1.50 1.89 6.27 26.82 Seesaw 0.18 11.55 4.26 35.92
具有最高的决策边界变异性(0.066),而最接近 uni 的方法(invp, invl)的决策边界变异性约为 0.047,并未始终表现出更优的性能。 这些对比模式与数据集依赖的景观拓扑一致:极端不平衡下的 DALES 呈现狭窄的有利盆地,而中度不平衡下的 S3DIS 呈现宽阔的平原。
4.6 损失景观拓扑
为了表征优化景观拓扑,我们执行两种互补的分析:(1) 通过扰动网络权重进行平坦度评估,以及 (2) 计算海森矩阵特征值谱。我们通过采样 K=20 个随机方向来评估损失敏感性,并使用逐滤波器归一化 [11] 进行归一化。对于权重范数的扰动幅度 ρ ∈{0.01%, 0.1%, 1.0%, 10%, 20%},我们按照公式 (3) 计算训练损失差异。在 DALES 上(图 4a),在 ρ=10% 时损失差异范围为 0 到 0.25,在 ρ=20% 时为 0.08 到 0.35,表明敏感性较高。在 S3DIS 上(图 4b),在 ρ=10% 时 δk < 0.02,并在 ρ=20% 时增加到约 0.15,表明景观更平坦。值得注意的是,每个数据集内的所有方法都表现出相似的扰动曲线,这表明不平衡感知缓解策略的选择并未显著改变局部景观几何结构。 我们计算了海森矩阵的前 10 个特征值(第 3.4 节;图 5)。在 DALES 上,所有方法都表现出主导的第一特征值(λ1),表明曲率各向异性(一个尖锐方向,正交方向相对平坦)。在 S3DIS 上,特征值 λ1-λ6 在下降前保持相似的大小,揭示了更各向同性的曲率。这种数据集级别的差异支持了我们的拓扑差异假设,即 DALES(极端不平衡)显示狭窄盆地,而 S3DIS(中度不平衡)表现出更平坦的平原。 关键在于,每个数据集内的方法之间特征值谱相似。这种相似性表明,损失公式的选择并未显著改变收敛解的局部几何结构。结合决策
第 12 页
12 A. Savva 等
DALES S3DIS invf 80 cb 64.75 invl invp 64.50 78 comf FL 64.25 76 LDAM (%) LADJ 64.00 BalSoft mIoU 74 Seesaw 63.75
72 63.50
70 63.25 Pearson: rp=-0.992, p=0.000 Pearson: rp=0.736, p=0.015 68 Spearman: rs=-0.874, p=0.001 63.00 Spearman: rs=0.768, p=0.009
0.0075 0.0100 0.0125 0.0150 0.0175 0.0200 0.0225 0.0250 0.0275 0.0475 0.0500 0.0525 0.0550 0.0575 0.0600 0.0625 0.0650 DB Variability DB Variability
图 3:DALES(左)和 S3DIS(右)上的决策边界变异性与 mIoU 的关系。每个点代表一种方法;DB 变异性衡量决策边界偏离均匀加权(uni)的程度。DALES 表现出强烈的负相关,较大的偏差导致显著的性能下降(invf、BalSoft:mIoU 下降超过 12%)。S3DIS 表现出微弱的正相关,所有方法均聚集在约 2% 的 mIoU 范围内。
边界分析(第 4.5 节),这些结果表明,损失景观为专用损失函数提供的可利用自由度有限。
5 结论与未来工作
本文分析了 3D 点云分割中的类别不平衡缓解问题,在具有极端和中等不平衡程度的数据集上,评估了两种基于点的架构上的 11 种方法。我们的主要发现挑战了 2D 计算机视觉的常规认知:带有均匀加权的标准交叉熵仍然具有极高的竞争力,专用方法仅提供了适度的改进(根据架构和数据集不同,mIoU 提升 0.8-3.3%)。三种互补的分析(精确率-召回率权衡、决策边界变异性以及损失景观量化)提供了证据,表明所有方法都收敛到具有相似局部曲率的区域
0.5 DALES 0.5 S3DIS Method Method invf invf 0.4 cbinvl 0.4 cbinvl L)( invp L)( invp
FL FLDifference 0.3 comfuni 0.3 comfuni Difference LDAM LADJ LADJ LDAMLoss 0.2 Loss 0.2 BalSoft Train 0.1 BalSoft Seesaw Train 0.1 Seesaw
0.0 0.0 0.01% 0.1% Perturbation 1.0%Percentage (%) 10.0% 20.0% 0.01% 0.1% Perturbation 1.0%Percentage (%) 10.0% 20.0%
(a) (b)
图 4:权重扰动下的训练损失差异(20 个随机方向)。(a)DALES 显示出中等敏感性,而(b)S3DIS 表现出更平坦的景观。对于每个数据集,所有方法都显示出相似的扰动特征。
第 13 页
3D 分割中的损失景观拓扑 13
DALES S3DIS 3 × 10^4 方法 3 × 10^4 方法 invf invf cb cb invl invl 2 × 10^4 invp invp comf 2 × 10^4 comf scale) uniFL scale) uniFL (logi LDAMLADJ (logi LADJLDAM
Seesaw Seesaw特征值 10^4 BalSoft 特征值 10^4 BalSoft
6 × 10^3
6 × 10^3 1 2 3 4 5 6 7 8 9 10 1 2 3 4 5 6 7 8 9 10 特征值索引 i 特征值索引 i
(a) (b)
图 5:所有方法的 Hessian 特征值谱(对数尺度)。(a)DALES 表现出各向异性曲率(主导 λ1),而(b)S3DIS 显示出更各向同性的曲率(λ1–λ6 相似)。方法紧密聚类,表明景观几何由数据特性而非损失公式决定。
在每个数据集内部,这表明优化景观的拓扑主要由不平衡的严重程度塑造,而非损失公式。 我们假设这种现象源于 2D 和 3D 数据之间的差异。与通过纹理和颜色模式编码语义的 2D 图像不同,3D 点云通过几何结构编码信息。基于点的架构通过邻域聚合策略利用这种结构,这可能提供隐式的类别平衡,即少数类在整个点计数中很少见,但在出现时贡献更密集的局部邻域。因此,显式的损失级修改可能提供的额外收益有限,甚至可能降低性能。这种架构-几何耦合在作用于规则网格的标准 2D CNN 中并不存在,这可能部分解释了为何在 2D 中被证明有效的技术不能轻易迁移到基于点的 3D 分割。 在 KPConv 和 RandLA-Net 上使用不同采样策略进行的验证证实,均匀 CE 的竞争性性能在架构间持续存在,尽管专用方法收益的幅度各不相同(KP-Conv:0.8-1.8%;RandLA-Net:2.4-3.3%)。机制分析集中在 KPConv 上;将这些分析扩展到 RandLA-Net 将加强关于潜在机制的主张。然而,两种评估架构之间性能模式的一致性表明,我们的核心发现,即数据特性限制了损失级修改的有效性,并非 KPConv 特有。需要进一步使用基于体素(例如 Cylinder3D)和基于注意力(Point Transformers)的架构进行验证,以确定这些结论是否超越基于点的方法而具有普遍性。
参考文献
1. Armeni, I., Sener, O., Zamir, A.R., Jiang, H., Brilakis, I., Fischer, M., Savarese, S.: 3D Semantic Parsing of Large-Scale Indoor Spaces. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). pp. 1534–1543 (2016). https://doi.org/10.1109/CVPR.2016.170
第 14 页
14 A. Savva 等
2. Behley, J., Garbade, M., Milioto, A., Quenzel, J., Behnke, S., Stachniss, C., Gall, J.: SemanticKITTI: 用于激光雷达序列语义场景理解的数据集。在:2019 IEEE/CVF 国际计算机视觉会议 (ICCV)。第 9296–9306 页 (2019)。https://doi.org/10.1109/ICCV.2019.00939 3. Bodoque, J.M., Aroca-Jiménez, E., Eguibar, M.A., García, J.A.: 基于激光雷达数据开发可靠的城市洪水灾害制图。《水文杂志》617, 128975 (2023)。https://doi.org/https://doi.org/10.1016/j.jhydrol.2022.128975 4. Cao, K., Wei, C., Gaidon, A., Arechiga, N., Ma, T.: 使用标签分布感知边际损失学习不平衡数据集。在:Wallach, H., Larochelle, H., Beygelzimer, A., d'Alché-Buc, F., Fox, E., Garnett, R. (编) 神经信息处理系统进展。第 32 卷。Curran Associates, Inc. (2019) 5. Charles, R.Q., Su, H., Kaichun, M., Guibas, L.J.: PointNet: 用于 3D 分类和分割的点集深度学习。在:2017 IEEE 计算机视觉与模式识别会议 (CVPR)。第 77–85 页 (2017)。 https://doi.org/10.1109/CVPR.2017.16 6. Cui, Y., Jia, M., Lin, T.Y., Song, Y., Belongie, S.: 基于有效样本数的类别平衡损失。在:2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。第 9260–9269 页 (2019)。 https://doi.org/10.1109/CVPR.2019.00949 7. Gupta, A., Dollár, P., Girshick, R.: LVIS: 用于大词汇量实例分割的数据集。在:2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。第 5351–5359 页 (2019)。 https://doi.org/10.1109/CVPR.2019.00550 8. He, Y., Yu, H., Liu, X., Yang, Z., Sun, W., Anwar, S., Mian, A.: 基于深度学习的计算机视觉 3D 分割综述。《信息融合》115, 102722 (2025)。https://doi.org/https://doi.org/10.1016/j.inffus.2024.102722 9. Hu, Q., Yang, B., Xie, L., Rosa, S., Guo, Y., Wang, Z., Trigoni, N., Markham, A.: RandLA-Net: 大规模点云的高效语义分割。在:2020 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。第 11105–11114 页 (2020)。 https://doi.org/10.1109/CVPR42600.2020.01112 10. Lei, S., He, F., Yuan, Y., Tao, D.: 通过决策边界理解深度学习。《IEEE 神经网络与学习系统汇刊》36(1), 1533–1544 (2025)。https://doi.org/10.1109/TNNLS.2023.3326654 11. Li, H., Xu, Z., Taylor, G., Studer, C., Goldstein, T.: 可视化神经网络的损失景观。在:Bengio, S., Wallach, H., Larochelle, H., Grauman, K., Cesa-Bianchi, N., Garnett, R. (编) 神经信息处理系统进展。第 31 卷。Curran Associates, Inc. (2018) 12. Lin, T.Y., Goyal, P., Girshick, R., He, K., Dollár, P.: 用于密集目标检测的 Focal Loss。在:2017 IEEE 国际计算机视觉会议 (ICCV)。 第 2999–3007 页 (2017)。https://doi.org/10.1109/ICCV.2017.324 13. Liu, Z., Miao, Z., Zhan, X., Wang, J., Gong, B., Yu, S.X.: 开放世界中的大规模长尾识别。在:2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。第 2532–2541 页 (2019)。 https://doi.org/10.1109/CVPR.2019.00264 14. Menon, A.K., Jayasumana, S., Rawat, A.S., Jain, H., Veit, A., Kumar, S.: 通过对数调整进行长尾学习 (2021),https://arxiv.org/abs/2007.07314 15. Pan, Y., Xie, F., Zhao, H.: 理解 3D 语义分割在面对类别不平衡和分布外数据时的挑战。《IEEE 智能交通系统汇刊》24(7), 6955–6970 (2023)。 https://doi.org/10.1109/TITS.2023.3256442
第 15 页
3D 分割中的损失景观拓扑 15
16. Prakash, S., Shah, P., Agrawal, A.: 利用 CNN 进行带有 Pascal VOC 的语义分割 (2023)。https://doi.org/https://arxiv.org/abs/2304.13216 17. Qi, C.R., Yi, L., Su, H., Guibas, L.J.: PointNet++:度量空间中点集的深层分层特征学习 (2017),https://arxiv.org/abs/1706.02413 18. Ren, J., Yu, C., Sheng, S., Ma, X., Zhao, H., Yi, S., Li, H.: 用于长尾视觉识别的平衡元 Softmax。在:Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M., Lin, H. (eds.) 神经信息处理系统进展。第 33 卷,pp. 4175–4186。Curran Associates, Inc. (2020) 19. Thomas, H., Qi, C.R., Deschaud, J.E., Marcotegui, B., Goulette, F., Guibas, L.: KPConv:用于点云的灵活且可变形卷积。在:2019 IEEE/CVF 国际计算机视觉会议 (ICCV)。pp. 6410–6419 (2019)。https://doi.org/10.1109/ICCV.2019.00651 20. Van Horn, G., Mac Aodha, O., Song, Y., Cui, Y., Sun, C., Shepard, A., Adam, H., Perona, P., Belongie, S.: iNaturalist 物种分类与检测数据集。在:2018 IEEE/CVF 计算机视觉与模式识别会议。pp. 8769–8778 (2018)。https://doi.org/10.1109/CVPR.2018.00914 21. Varney, N., Asari, V.K., Graehling, Q.: DALES:用于语义分割的大规模航空 LiDAR 数据集。在:2020 IEEE/CVF 计算机视觉与模式识别会议研讨会 (CVPRW)。pp. 717–726 (2020)。https://doi.org/10.1109/CVPRW50498.2020.00101 22. Wang, J., Zhang, W., Zang, Y., Cao, Y., Pang, J., Gong, T., Chen, K., Liu, Z., Loy, C.C., Lin, D.: 用于长尾实例分割的 Seesaw 损失。在:2021 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。pp. 9690–9699 (2021)。https://doi.org/10.1109/CVPR46437.2021.00957 23. Wu, W., Qi, Z., Fuxin, L.: PointConv:3D 点云上的深层卷积网络。在:2019 IEEE/CVF 计算机视觉与模式识别会议 (CVPR)。pp. 9613–9622 (2019)。https://doi.org/10.1109/CVPR.2019.00985 24. Zhang, Y., Kang, B., Hooi, B., Yan, S., Feng, J.: 深层长尾学习:综述。IEEE 模式分析与机器智能汇刊 45(9),10795–10816 (2023)。https://doi.org/10.1109/TPAMI.2023.3268118
第 16 页
3D 分割中的损失景观拓扑 1
损失景观拓扑揭示了为何在类别不平衡下,简单基线在 3D 点云分割中具有竞争力
补充材料
S1 网络架构与训练协议
KPConv 通过带有跳跃连接的层级编码器-解码器架构直接处理非结构化点云。图 S1 展示了遵循文献 [19, 21] 配置的具体架构。在训练方面,我们使用了文献 [19] 中概述的网络参数,即动量值为 0.02 的动量梯度下降优化器,初始学习率为 0.01。学习率调度保持一致,且未应用 Dropout。对于 DALES,输入为 (X, Y, Z) 坐标,批量大小为 10,训练 400 个 epoch;而对于 S3DIS,我们额外使用 RGB 特征,批量大小为 6,训练 500 个 epoch。在这两种情况下,每个 epoch 包含 500 次优化器步骤。每种情况下,为了可复现性,均使用固定种子(42)在单个 NVIDIA GPU 上进行训练。
RandLA-Net 使用带有渐进式随机采样的堆叠局部特征聚合模块处理点云,遵循文献 [9] 中的架构。该网络使用五层,下采样比例为 [4, 4, 4, 4, 2],特征维度为 [16, 64, 128, 256, 512],每层聚合 K=16 个最近邻。在训练方面,我们使用了 Adam 优化器,初始学习率为 0.01,每个 epoch 后降低 5%,遵循文献 [9] 的设置。对于 DALES,输入为 (X, Y, Z) 坐标,而对于 S3DIS,我们也使用 RGB 特征。两个数据集均使用批量大小 6,100 个 epoch,每个样本 40,960 个输入点,每个 epoch 包含 500 次优化器步骤。训练在单个 NVIDIA GPU 上进行。
(a) (b)
图 S1:针对数据集特定配置的 KPConv 架构:(a) DALES(XYZ 特征),以及 (b) S3DIS(XYZ+RGB 特征)。
第 17 页
2 A. Savva 等人
(a) (b)
图 S2:展示长尾特征的类别对数分布:(a) 极端情况(DALES)和 (b) 中度不平衡比率(S3DIS)。
S2 数据集与类别分布
S2.1 DALES
该数据集包含覆盖 40 个城乡图块(每个 0.5 平方公里)的室外航空激光雷达数据,包含八个语义类别(排除未知):地面、植被、汽车、卡车、电线、栅栏、电线杆和建筑物。该数据集表现出极度的不平衡,最频繁类别(地面:48.4%)与最不频繁类别(电线杆:0.08%)之间的比率为 641:1 [21](见补充材料的图 S2a)。由于标注问题(大部分点被标注为未知),一个图块被从训练集中排除。
S2.2 S3DIS
该数据集包含来自 6 个大型建筑区域的室内扫描数据,共 13 个语义类别,包括结构元素(天花板、地板、墙壁)、建筑组件(梁、柱、窗户、门)和家具(椅子、桌子、书柜、沙发、黑板、杂物)。该数据集具有中度不平衡比率(56:1;最频繁的是天花板(19.14%),最不频繁的是沙发(0.49%))[1](见补充材料的图 S2b)。
S2.3 类别分布
图 S2 显示了 DALES(643:1 不平衡)和 S3DIS(55:1 不平衡)的类别对数分布,呈现出典型的长尾模式,其中多数类别主导了点数。
S3 基于种子的变异性分析(使用 KPConv)
为确保观察到的模式不是随机种子选择的伪影,我们针对均匀加权(uni)和每种方法中表现最好的方法,使用不同的种子(即种子 1、2 和 3,来自第 4.2 节)训练了三个额外的运行
第 18 页
3D 分割中的损失景观拓扑 3
表 S1:基于不同种子(即种子 1、2 和 3)的三次运行变异性分析(µ ± σ)。
(a) DALES 数据集
方法 均值 地面 植被 汽车 卡车 uni 80.005 ± 0.167 96.577 ± 0.027 93.796 ± 0.036 84.978 ± 0.159 43.046 ± 0.608 invp 80.998 ± 0.097 96.477 ± 0.094 93.808 ± 0.037 85.152 ± 0.197 45.725 ± 0.515
方法 电线 栅栏 电线杆 建筑物 uni 93.775 ± 0.318 60.907 ± 0.798 71.830 ± 0.355 95.130 ± 0.098 invp 94.530 ± 0.222 63.141 ± 0.263 74.305 ± 0.449 94.848 ± 0.306
(b) S3DIS 数据集
方法 均值 天花板 地板 墙壁 梁 柱 窗户 uni 63.541 ± 0.196 93.196 ± 0.152 98.479 ± 0.021 80.604 ± 0.180 0.000 ± 0.000 23.002 ± 2.546 45.451 ± 1.209 BalSoft 64.919 ± 0.270 92.586 ± 0.359 98.389 ± 0.087 82.038 ± 0.388 0.003 ± 0.005 29.711 ± 0.852 53.546 ± 1.318
方法 门 椅子 桌子 书架 沙发 板 杂物 uni 62.568 ± 0.098 87.831 ± 0.717 79.076 ± 0.520 70.903 ± 0.514 65.376 ± 2.709 61.845 ± 1.139 57.696 ± 1.019 BalSoft 63.998 ± 1.329 87.062 ± 0.070 78.108 ± 0.653 71.214 ± 0.332 67.067 ± 1.447 63.323 ± 0.779 56.904 ± 0.732
数据集(DALES 使用 invp,S3DIS 使用 BalSoft)。表 S1 展示了这些运行的 µ±σ。在 DALES 上,均匀加权实现 80.01±0.17%,而 invp 实现 81 ± 0.1%,证实了两种方法的竞争性性能和低方差。值得注意的是,性能差距(0.99%)大于原始单种子结果(0.81%),且标准差很小(0.10-0.17%),表明收敛稳定。各类别的标准差在少数类中最高(卡车:0.61%;对于 uni,栅栏:0.80%),但两种方法在不同种子间保持了一致的排名。 在 S3DIS 上,均匀加权实现 63.54 ± 0.2%,而 BalSoft 实现 64.92 ± 0.27%,证实了单种子结果中观察到的紧密聚类(1.38% 差距 vs 初始的 1.75%)。两种方法的标准差均保持较小(0.2-0.37%),少数类再次显示出较高的方差(柱:2.55%;对于 uni,沙发:2.71%)。关键在于,排名稳定性持续存在,BalSoft 在所有种子中均略优于 uni。
S4 整体性能(使用 RandLA-Net)
我们还使用 RandLA-Net [9] 验证了这些发现,该网络采用根本不同的设计原则,即随机点采样与 KPConv 中使用的基于结构的潜在采样。此比较旨在检验这些发现是源于 KPConv 特有的属性,还是反映了基于点的 3D 分割的一般特征。表 S2-S3 分别展示了 DALES 和 S3DIS 的完整逐类 IoU 结果。
第 19 页
4 A. Savva 等人
表 S2:使用 RandLA-Net 在 DALES 数据集上的各类别性能。 方法 mean ground vegetation cars trucks power lines fences poles buildings uni 76.762 97.148 93.463 83.352 38.220 91.493 53.511 60.266 96.641 invf 67.372 96.313 89.435 64.182 32.725 91.212 23.269 46.648 95.193 cb 77.068 97.007 92.955 80.660 37.879 93.530 53.537 64.579 96.401 invl 76.843 97.034 93.175 83.681 39.589 89.842 54.049 60.650 96.726 invp 78.481 97.109 93.499 83.569 39.585 93.032 56.368 68.105 96.577 comf 76.960 97.035 93.232 83.347 39.306 91.040 54.002 60.994 96.728 FL 75.972 97.155 93.356 83.481 32.884 90.917 52.261 61.089 96.633 LDAM 79.172 97.182 93.603 84.144 38.690 93.199 57.326 72.420 96.809 LADJ 66.762 97.038 91.130 73.658 18.631 90.722 25.906 40.825 96.186 BalSoft 66.430 96.852 90.782 74.525 24.390 88.973 24.881 34.702 96.333 Seesaw 74.260 97.192 92.805 79.831 30.681 91.024 45.357 60.493 96.694 Range 12.742 0.879 4.168 19.962 20.958 4.557 34.057 37.718 1.616
表 S3:使用 RandLA-Net 在 S3DIS 数据集上的各类别性能。 方法 mean ceiling floor wall beam column window door chair table bookcase sofa board clutter uni 61.375 93.116 97.028 80.367 0.000 17.390 57.660 36.838 78.216 84.665 55.844 70.799 71.421 54.524 invf 60.373 91.363 97.390 78.549 0.000 15.893 60.357 30.560 76.231 85.703 61.124 71.363 64.896 51.420 cb 62.406 91.821 97.074 79.904 0.000 26.317 61.150 33.409 78.371 81.896 75.646 70.521 64.509 50.663 invl 61.661 92.351 97.355 80.518 0.000 16.287 59.860 39.551 77.654 86.433 60.295 70.575 68.157 52.555 invp 63.686 92.722 97.734 80.037 0.000 22.035 59.819 41.352 78.766 86.838 72.210 71.187 72.921 52.304 comf 62.640 92.319 97.902 80.974 0.000 24.176 59.874 33.803 78.060 87.450 61.501 71.115 73.440 53.712 FL 62.526 91.577 97.346 81.361 0.000 21.368 58.047 52.706 76.267 86.805 55.145 71.403 68.610 52.198 LDAM 64.698 92.158 96.902 81.553 0.000 28.788 59.396 50.455 77.356 88.658 66.383 72.024 73.208 54.194 LADJ 64.669 92.080 96.661 82.223 0.000 32.908 62.755 47.018 75.976 88.004 69.933 72.854 67.595 52.687 BalSoft 63.117 91.241 97.327 81.789 0.000 23.710 61.296 43.184 78.355 87.483 67.940 71.363 63.855 52.973 Seesaw 62.491 91.811 97.823 80.882 0.000 20.586 59.820 45.444 78.221 86.209 56.853 71.604 69.960 53.166 Range 4.325 1.875 1.241 3.674 0.000 17.015 5.095 22.146 2.790 6.762 20.501 2.333 9.585 3.861
S5 精确率-召回率模式
第 20 页
3D 分割中的损失景观拓扑 5
表 S4:在 DALES 数据集上使用 KPConv 的精确率(上半部分)和召回率(下半部分)。 方法 均值 地面 植被 汽车 卡车 电线 栅栏 电线杆 建筑物 精确率 uni 89.810 97.494 97.389 90.898 66.322 97.442 84.588 86.107 98.244 invf 70.696 97.793 97.765 74.209 37.779 88.948 31.534 40.854 96.688 cb 83.462 97.447 97.691 90.496 58.262 97.351 62.021 66.010 98.421 invl 90.378 97.432 97.671 89.148 74.008 97.538 82.557 86.632 98.042 invp 89.336 97.456 97.607 89.937 68.918 97.659 79.673 85.183 98.255 comf 89.965 97.474 97.429 90.761 72.899 97.632 77.497 87.633 98.392 FL 89.757 97.236 97.703 89.799 70.484 96.671 81.825 85.759 98.577 LDAM 90.822 97.405 97.498 90.906 74.017 97.321 82.987 88.010 98.435 LADJ 85.702 97.501 97.702 88.581 57.605 97.596 68.139 80.036 98.458 BalSoft 70.964 97.885 98.063 78.068 25.069 97.667 34.497 39.839 96.624 Seesaw 89.690 97.455 97.705 90.208 71.743 97.283 79.553 85.482 98.090 召回率 uni 85.773 98.961 96.199 93.078 54.441 96.409 68.744 81.800 96.553 invf 92.593 98.006 93.049 95.203 69.793 96.798 95.206 95.954 96.735 cb 90.742 98.945 95.586 93.456 63.150 97.271 87.731 93.514 96.281 invl 86.415 99.006 95.995 94.597 51.350 96.784 72.220 84.734 96.631 invp 87.330 99.012 96.003 94.101 55.475 96.844 75.306 85.326 96.573 comf 86.695 98.947 96.137 93.281 51.327 96.870 77.525 83.046 96.427 FL 85.964 99.216 95.881 94.115 52.948 96.921 72.443 79.988 96.202 LDAM 85.914 99.057 96.142 93.210 52.809 97.034 71.716 80.931 96.413 LADJ 89.118 99.011 95.775 94.312 61.546 96.518 83.126 86.174 96.483 BalSoft 92.006 98.165 93.465 94.352 70.000 95.900 93.257 94.030 96.880 Seesaw 86.462 99.035 95.941 93.750 52.699 96.524 75.149 81.882 96.712
表 S5:在 S3DIS 数据集上使用 KPConv 的精确率(上半部分)和召回率(下半部分)。 方法 均值 天花板 地板 墙壁 梁 柱 窗户 门 椅子 桌子 书柜 沙发 板 杂物 精确率 uni 81.565 97.293 99.189 83.317 0.000 80.802 90.412 79.342 92.464 88.386 87.970 95.393 93.337 72.436 invf 78.439 97.256 99.218 85.021 0.000 63.928 87.944 75.279 91.147 85.560 84.813 92.295 85.934 71.316
cb 79.976 97.204 99.156 83.692 0.000 70.435 88.512 79.108 91.532 85.561 87.193 93.828 91.461 72.001 invl 81.193 97.514 99.208 83.270 0.000 77.553 92.832 78.018 92.147 88.147 87.545 93.591 91.378 74.304 invp 81.408 97.384 99.080 82.839 0.000 80.123 91.607 79.555 91.734 87.357 87.349 94.456 93.360 73.464 comf 81.397 97.104 99.111 83.800 0.000 79.199 90.457 82.339 91.315 88.350 86.817 94.667 92.802 72.201 FL 81.557 97.288 99.040 82.106 0.000 77.596 91.282 80.918 92.836 88.108 88.129 96.084 95.333 71.526 LDAM 81.206 97.167 99.181 83.224 0.000 75.858 91.819 81.969 92.589 88.253 87.420 94.464 92.174 71.559 LADJ 80.581 97.421 99.173 84.304 0.000 75.538 88.741 79.821 91.358 87.319 86.883 92.672 91.490 72.828 BalSoft 76.355 97.537 99.348 88.562 0.000 61.114 82.040 76.116 90.521 83.663 84.620 79.317 78.356 71.422 Seesaw 81.308 97.256 99.147 83.407 0.000 75.522 91.293 83.615 92.561 87.675 87.163 95.109 93.637 70.614 Recall uni 69.134 96.201 99.314 96.483 0.000 22.481 46.081 73.363 94.041 88.227 78.755 67.759 62.205 73.838 invf 71.095 94.730 99.082 93.528 0.000 29.803 49.728 75.432 95.432 91.865 81.376 75.961 66.882 70.411 cb 70.232 95.186 99.222 95.475 0.000 27.048 47.916 74.670 95.090 90.147 79.131 71.002 66.177 71.952 invl 69.724 95.730 99.279 96.382 0.000 25.449 47.205 71.048 94.747 88.921 79.968 70.248 63.879 73.549 invp 69.039 95.377 99.323 96.608 0.000 24.926 48.525 71.479 94.240 89.012 78.247 63.073 64.182 72.517 comf 69.709 95.586 99.274 96.135 0.000 22.856 48.844 77.649 95.302 88.819 79.473 65.249 64.867 72.158 FL 69.192 94.647 99.341 96.455 0.000 23.626 47.012 70.457 94.129 88.872 77.579 69.715 64.671 72.987 LDAM 69.345 95.258 99.284 96.203 0.000 27.112 47.005 71.827 94.495 87.878 79.453 65.918 64.108 72.951 LADJ 70.476 95.173 99.219 96.005 0.000 26.904 53.127 73.862 94.988 89.087 80.674 67.790 67.776 71.579 BalSoft 74.027 95.381 99.022 92.467 0.000 34.631 61.714 80.696 95.618 91.967 81.893 81.108 76.353 71.505 Seesaw 69.609 95.423 99.294 95.972 0.000 23.098 50.034 71.370 94.340 88.544 79.013 70.373 65.200 72.252
第 21 页
6 A. Savva 等人
表 S6:在 DALES 数据集上使用 RandLA-Net 的精确率(上半部分)和召回率(下半部分)。 方法 均值 地面 植被 汽车 卡车 电线 栅栏 电线杆 建筑物 精确率 uni 90.701 97.856 97.263 90.867 71.477 96.496 85.943 87.069 98.638 invf 71.142 97.896 97.646 66.215 42.067 95.442 23.581 48.391 97.893 cb 82.464 97.798 97.622 85.886 47.852 97.718 61.025 73.094 98.719 invl 89.890 97.867 97.116 89.935 71.928 96.005 83.386 84.297 98.586 invp 89.639 98.020 97.269 90.030 65.172 97.358 83.573 87.402 98.288 comf 89.957 98.173 96.700 89.207 72.176 96.306 83.013 85.582 98.497 FL 91.748 97.877 97.184 90.854 79.932 96.151 85.964 87.477 98.542 LDAM 90.526 98.068 97.285 89.086 73.628 97.549 82.176 87.901 98.519 LADJ 70.000 98.275 98.143 76.875 20.733 97.030 26.483 43.926 98.533 BalSoft 70.036 98.176 97.901 78.056 28.034 97.913 25.411 36.130 98.669 Seesaw 80.083 98.047 97.862 84.936 40.542 96.327 50.408 74.294 98.248 召回率 uni 81.092 99.261 95.987 90.974 45.099 94.637 58.644 66.190 97.948 invf 90.595 98.349 91.405 95.435 59.574 95.366 94.618 92.832 97.184 cb 88.886 99.173 95.108 92.986 64.508 95.618 81.353 84.717 97.622 invl 81.809 99.131 95.826 92.327 46.824 93.331 60.572 68.375 98.087 invp 83.744 99.052 96.020 92.092 50.205 95.442 63.392 75.519 98.229 comf 81.917 98.820 96.295 92.695 46.325 94.334 60.711 67.979 98.178 FL 79.831 99.246 95.952 91.141 35.843 94.351 57.136 66.944 98.034 LDAM 84.187 99.078 96.114 93.815 44.914 95.434 65.467 80.438 98.239 LADJ 89.902 98.719 92.729 94.625 64.755 93.314 92.231 85.257 97.584 BalSoft 90.132 98.627 92.583 94.277 65.233 90.693 92.269 89.773 97.602 Seesaw 86.714 99.111 94.725 92.998 55.782 94.297 81.903 76.506 98.391
表 S7:在 S3DIS 数据集上使用 RandLA-Net 的精确率(上半部分)和召回率(下半部分)。 方法 均值 天花板 地板 墙壁 梁 柱 窗户 门 椅子 桌子 书柜 沙发 板 杂物 精确率 uni 80.728 97.141 98.861 83.381 0.000 82.797 89.759 79.471 88.871 89.566 97.199 85.960 89.194 67.263 invf 74.180 96.600 99.173 85.167 0.000 57.375 81.855 64.004 84.179 90.240 84.962 85.450 71.991 63.341
cb 76.681 95.900 99.042 84.572 0.000 70.406 82.977 75.524 88.573 86.509 86.136 86.326 75.806 65.082 invl 79.798 96.674 98.868 83.692 0.000 76.523 89.892 75.811 86.614 92.015 96.899 84.885 88.008 67.499 invp 79.341 96.867 99.026 84.283 0.000 75.117 84.877 75.245 89.069 91.002 96.992 85.450 86.219 67.283 comf 79.599 96.816 98.920 84.663 0.000 71.351 93.471 71.754 89.933 92.143 94.772 86.199 89.411 65.357 FL 80.398 95.774 98.914 84.991 0.000 70.135 90.146 80.498 88.941 90.864 97.278 86.048 95.407 66.176 LDAM 79.681 96.640 98.674 86.019 0.000 68.385 88.341 80.285 85.503 92.692 96.148 86.255 88.417 68.498 LADJ 76.895 96.432 99.042 88.867 0.000 62.871 84.382 74.000 81.707 91.869 91.632 82.697 77.851 68.287 BalSoft 75.684 96.620 98.446 88.819 0.000 53.362 83.555 74.459 84.116 91.516 92.316 81.676 72.475 66.530 Seesaw 78.258 96.112 98.849 84.981 0.000 55.685 85.652 74.141 87.210 92.814 95.411 85.078 92.204 69.220 Recall uni 67.684 95.740 98.126 95.696 0.000 18.042 61.720 40.713 86.710 93.928 56.758 80.057 78.186 74.220 invf 69.340 94.399 98.188 90.999 0.000 18.021 69.679 36.903 88.979 94.459 68.539 81.233 86.815 73.206 cb 70.884 95.572 97.993 93.539 0.000 29.590 69.922 37.466 87.187 93.887 86.134 79.388 81.234 69.576 invl 68.100 95.381 98.452 95.501 0.000 17.143 64.180 45.263 88.244 93.442 61.481 80.720 75.135 70.359 invp 70.514 95.589 98.682 94.078 0.000 23.770 66.955 47.864 87.195 94.995 73.864 81.007 82.541 70.144 comf 68.984 95.209 98.960 94.894 0.000 26.775 62.487 38.991 85.534 94.496 63.661 80.253 80.435 75.090 FL 68.694 95.433 98.397 95.012 0.000 23.507 61.979 60.422 84.257 95.105 56.009 80.752 70.954 71.191 LDAM 71.517 95.208 98.180 94.015 0.000 33.208 64.448 57.590 89.033 95.321 68.197 81.362 80.974 72.185 LADJ 73.371 95.328 97.573 91.665 0.000 40.847 71.001 56.323 91.549 95.437 74.703 85.956 83.689 69.754 BalSoft 71.942 94.249 98.845 91.177 0.000 29.908 69.705 50.693 91.962 95.204 72.012 84.966 84.299 72.219 Seesaw 69.141 95.352 98.950 94.371 0.000 24.619 66.483 54.003 88.356 92.374 58.451 81.889 74.359 69.627