MeshFM:不靠3D标注,2D特征如何让模型看懂三维世界?

快速导读:提出MeshFM,一种无需3D标注、通过蒸馏2D基础模型特征并纠正混叠来预测通用3D特征的前馈模型,在多种下游任务中零样本性能媲美专用SOTA模型。

三维形状理解是计算机视觉的核心问题,但现有方法要么依赖昂贵的3D标注,要么需要针对每个形状进行耗时的优化。MeshFM提出了一种全新的范式:仅从2D基础模型(如DINOv2)中蒸馏知识,无需任何3D标注,即可训练出一个前馈网络,直接为任意三维形状预测通用特征。

该工作的核心洞察在于,2D基础模型已经蕴含了丰富的语义信息,但将其有效迁移到3D面临两个关键挑战:一是ViT架构导致的特征混叠问题,二是如何将逐形状优化的昂贵过程解耦为高效的前馈预测。MeshFM通过SAM驱动的混叠纠正和两阶段训练框架,系统性地解决了这两个问题。

英文题目:MeshFM: 2D Features Are All You Need for 3D Shape Understanding

论文出处:arXiv 每日论文精选 · arXiv:2607.27592

原始论文:PDF / 论文页面

对应视频标题:MeshFM:不靠3D标注,2D特征如何让模型看懂三维世界?|推荐指数:★★★★★

这篇论文解决什么问题?

传统3D特征学习方法大致分为两类:基于优化的方法(如Diff3F)需要为每个形状单独优化特征场,速度极慢;基于学习的方法(如PartField)虽然快速,但依赖大量3D标注数据,且学到的特征往往局限于特定任务。

2D基础模型(如DINOv2、SAM)的兴起为3D理解提供了新的可能——这些模型在二维图像上展现了强大的语义理解能力。然而,直接将2D特征投影到3D表面会遇到严重的特征渗漏问题:ViT的分块编码机制导致语义边界附近的像素特征相互污染,使得投影后的3D特征在部件边界处模糊不清。

此外,现有2D到3D的特征蒸馏方法(如Diff3F)采用逐形状优化的策略,虽然能获得高质量特征,但计算成本极高,无法应用于大规模场景或实时任务。这形成了一个核心矛盾:如何既保留2D特征的丰富语义,又实现高效的前馈式3D特征预测?

核心创新

  • 提出基于SAM的特征混叠纠正策略,通过分割掩码识别并替换异常像素,解决ViT架构导致的特征渗漏问题。
  • 设计两阶段蒸馏-预测框架,将昂贵的逐形状优化解耦,实现前馈式通用3D特征预测。
  • 通过SO(3)旋转增强训练,使模型对任意朝向的输入具有鲁棒性,无需测试时对齐。

方法概览

两阶段训练框架:阶段一,利用多视图渲染和SAM纠正特征混叠,将2D基础模型特征蒸馏为3D教师特征场;阶段二,训练一个前馈网络(PVCNN编码器+Triplane Transformer),以教师场为监督,直接预测点云特征,并通过SO(3)旋转增强实现旋转鲁棒性。

  • 阶段一:多视图特征蒸馏与混叠纠正。对每个训练网格,从多个视角渲染2D图像,提取DINOv2特征图。关键创新在于使用SAM对渲染图像进行细粒度分割,在每个分割区域内,将偏离中位数过大的异常像素特征替换为中位数,从而消除ViT分块导致的边界模糊。纠正后的特征被投影到网格表面,训练一个神经场作为3D教师模型。
  • 阶段二:前馈特征预测网络。以阶段一的教师场为监督信号,训练一个由PVCNN编码器和Triplane Transformer组成的前馈网络。该网络输入点云,直接输出每个点的特征向量,无需任何逐形状优化。
  • SO(3)旋转增强。在训练阶段二时,对输入点云施加随机的三维旋转,使模型学会提取旋转等变的特征。这使得MeshFM在测试时无需将形状对齐到规范姿态,对任意朝向的输入都能保持一致的预测。
  • 零样本下游应用。学到的特征具有通用性,可直接用于多种任务:通过K-Means聚类实现部件分割,通过函数映射实现稠密对应,通过均值池化后接轻量分类器实现形状分类,甚至支持基于控制柄的网格变形。

逐图理解论文

直接投影的困境

直接投影的困境
Fig. 3: Feature aliasing correction. We correct the feature aliasing created by patch-based image encoder architectures through fine-grained image segmentation. The segmentation groups define pixel clusters that are assumed to have similar deep fea- tures. Pixels with features substantially different than the cluster median are replaced by the median. The resulting feature map has much less blurring at semantic bound- aries and more stable features within semantic groups.

图3详细说明了SAM混叠纠正的原理。左侧显示ViT分块导致的特征渗漏使边界模糊,右侧展示通过SAM分割掩码识别并替换异常像素后,特征在语义边界处变得清晰锐利。

研究空白与核心洞察

研究空白与核心洞察
Fig. 2: Training pipeline overview. The training phase of MeshFM includes two stages. In the first stage, we distill the information from a 2D foundation model into 3D feature fields. 2D feature maps are extracted from multi-view renderings of the mesh and projected to the mesh surface, and a neural model learns to map 3D coordinates on the mesh to the reference features. In the second stage, we use the teacher feature fields to train a feedforward feature prediction model. The model takes a point cloud sampled from the mesh surface and learns to output the point features from the supervising 3D teacher fields.

图2概述了两阶段训练流程。阶段一将2D基础模型特征蒸馏为3D教师场,阶段二训练前馈网络以教师场为监督直接预测点云特征,实现从逐形状优化到前馈推理的关键转变。

零样本通用特征的力量

零样本通用特征的力量
Fig. 4: Part segmentation comparison. Our method can segment the mesh without training on any 3D annotations. We can even perform on par with PartField, which is directly trained with 3D segmentation annotation. In cases where our segmentation differs from the ground-truth, they are still semantically meaningful (e.g. decorative ribbons on the dress).

这套特征展现出惊人的通用性。在部件分割上,MeshFM零样本性能媲美甚至超越用三维标注训练的PartField;在稠密对应上,即使形状姿态各异、拓扑不同,也能准确匹配;在分类和变形任务上同样表现优异。更关键的是,无论输入形状如何旋转,特征始终保持一致——因为模型在训练时已经见过了所有可能的朝向。

价值与局限

价值与局限
Fig. 9: Left-right mismatch limitation. Our mesh features sometimes do not dis- tinguish left and right symmetric shape parts, such as chair legs and animal limbs, leading to correspondence errors.

图9揭示了主要局限性:由于DINOv2难以区分左右对称部件,MeshFM在椅子腿、动物肢体等对称结构上偶尔产生左右交换的对应错误,这是继承自2D基础模型的固有缺陷。

实验如何设计?

  • 分割评估:在PartObjaverse-Tiny和PartNetE数据集上进行类别无关的语义和实例分割,与Diff3F、PartField等基线比较mIoU。
  • 对应评估:在DenseCorr3D和TOSCA数据集上评估稠密对应性能,指标为归一化测地误差和AUC。
  • 分类评估:在Manifold40数据集上,使用均值池化特征训练三层MLP分类器,报告分类准确率。
  • 消融实验:验证SAM混叠纠正的有效性(表6),比较不同2D基础模型的影响(表7),分析两阶段设计的必要性。
  • 定性展示:包括层次化分割(图6)、旋转鲁棒性(图5)、稠密对应(图7)和网格变形(图8)。

关键结果与论文证据

  • PartObjaverse-Tiny语义分割mIoU达0.549(原始)和0.539(SO(3)旋转),均优于Diff3F和PartField(表1,第9页)。
  • PartNetE语义分割mIoU达0.520(原始)和0.510(SO(3)旋转),显著超越基线(表2,第10页)。
  • DenseCorr3D对应AUC达0.52(原始)和0.50(SO(3)旋转),与SOTA持平或更优(表3,第11页)。
  • TOSCA对应AUC达0.34(原始)和0.33(SO(3)旋转),优于其他方法(表4,第11页)。
  • Manifold40分类准确率达0.92(原始)和0.85(SO(3)旋转),显著优于基线(表5,第13页)。
  • SAM混叠纠正使PartObjaverse-Tiny实例分割mIoU从0.630提升至0.661(表6,第14页),验证了该模块的关键作用。
  • 定性结果显示,MeshFM的特征支持层次化分割(图6),对任意旋转保持稳定(图5),且能处理不同拓扑和几何的对应(图7)。

阅读时需要注意

  • 继承2D基础模型的缺陷:DINOv2难以区分左右对称部件,导致MeshFM在对应任务中偶尔出现左右交换错误(图9,第15页)。
  • 性能上限受限于所蒸馏的2D模型:当前使用DINOv2,未来随2D基础模型进步可进一步提升。
  • 与PartField的旋转对比存在不公平因素:PartField未使用旋转增强,若加入该增强可能缩小差距。

关联工作

  • Diff3F(第4页):基于优化的2D特征蒸馏方法,需逐形状优化,MeshFM将其作为教师场的构建基础,但通过前馈网络实现了高效推理。
  • PartField(第5页):利用SAM掩码和对比学习训练分割感知特征,但依赖3D标注且特征不通用,MeshFM在零样本设置下达到相当性能。
  • DFD(第4页):提供重心坐标蒸馏方法,MeshFM阶段一采用其蒸馏方式,并用于变形应用框架。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

MeshFM:理解三维形状,只需二维特征

Jinfan Zhou ⋆, Richard Liu ⋆, Itai Lang , and Rana Hanocka

芝加哥大学,芝加哥 IL 60637,美国 {zjf, guanzhi, itailang, ranahanocka}@uchicago.edu

2026 7月 30日

图 1:MeshFM 是一种前馈模型,用于计算三维形状的通用特征。学习到的特征具有判别性,能够捕捉不同形状和复杂几何体中的有意义属性。重要的是,这些特征具有多用途性,可以零样本地应用于各种下游任务,[cs.CV] 如分割、对应关系和变形。

摘要。我们提出了 MeshFM,一个从三维输入中提取丰富特征的高效前馈框架。我们的方法将视觉基础模型中的二维特征蒸馏到三维。我们训练一个前馈网络,直接预测三维特征,无需在推理时进行优化。该方法采用两阶段训练策略。首先,我们仅使用二维特征监督来优化三维特征场。其次,我们训练一个网络来回归该特征场。整个过程不需要任何三维标注,而是依赖二维基础模型中的强大信息。我们证明,学习到的特征可以立即应用于下游任务,包括部件分割、稠密对应和网格变形。大量实验表明,仅用二维监督训练的 MeshFM,其性能与显式使用三维监督训练的方法相当,甚至无需针对特定任务进行微调。此外,我们的模型经过训练,对输入物体的极端旋转具有鲁棒性。项目页面:arXiv:2607.27592v1 https://threedle.github.io/MeshFM/

⋆ 同等贡献。

第 2 页

2 Zhou 等

关键词:基础模型 · 3D形状理解 · 特征蒸馏

1 引言

大规模二维基础模型的出现,从根本上改变了计算机视觉的格局。DINO、CLIP和SAM等模型已经证明,从大规模数据中学习到的表征具有丰富的理解能力,并可应用于广泛的任务。自然地,研究人员也试图利用这种丰富的二维先验来完成三维形状任务和三维表征学习。

目前,将二维先验提升到三维主要有两种方法。第一种是直接渲染形状,获取编码后的渲染特征,并通过某种优化过程将这些特征反投影到形状上。我们将这一通用过程称为“蒸馏”。Diff3F [9]和DFD [24]等工作就是这一过程的例证。虽然蒸馏能有效获得高质量的三维特征,但它需要逐形状优化,不适用于实时应用。

另一方面,有些工作通过训练过程间接利用二维先验。这些工作旨在学习特定任务的三维表征,其中网络特征由二维模型提供信息。该领域的代表包括PartField [22],它利用SAM为对比损失生成聚类,以学习具有分割感知的特征;以及DenseMatcher [44],它通过二维反投影初始化含噪三维特征,并对其进行“精炼”,以学习具有对应感知的特征。尽管这些模型达到了SOTA性能,但其特征是为特定任务设计的,无法应用于目标应用之外的场景。此外,它们最终依赖三维数据进行监督,这引入了数据瓶颈。

在这项工作中,我们挑战了“三维任务需要专门的三维网络”这一主流范式。我们假设,对特定任务头的依赖在很大程度上是特征蒸馏不完善的症状。标准的蒸馏技术存在混叠(蒸馏到粗糙顶点)和“特征渗漏”问题,即ViT架构(如DINO)中的图像分块导致背景语义模糊到物体上。我们发现,当这些问题得到解决后,蒸馏后的二维特征足以在大多数三维任务上达到接近SOTA的性能。

为支持这一假设,我们提出了前馈网格特征模型(MeshFM),该模型以前馈方式预测三维输入上具有旋转鲁棒性的丰富视觉特征。我们的方法将昂贵的特征蒸馏过程与实时推理的需求解耦,使我们能够以前馈方式生成“教师质量”的特征场。此外,通过对特征进行直接监督,我们的模型被训练得对极端旋转具有鲁棒性。我们通过两项关键技术创新实现了这一点:

– 基于SAM的精炼教师蒸馏。我们引入了一个鲁棒的“教师”生成阶段,以解决特征噪声的根本原因。首先,我们采用特征场蒸馏,在每个光栅化

第 3 页

MeshFM:二维特征足以实现三维形状理解 3

像素,将学习信号与网格三角剖分解耦,并充分利用二维信号。其次,最关键的是,我们实施了一种特征精炼策略。通过利用SAM提供的精确掩码,我们识别并“擦除”那些跨越部件边界渗漏的异常特征。这引导蒸馏后的特征遵循清晰的几何与视觉边界,从而生成精炼的真值。 – 通用前馈预测。我们并非训练一个任务特定的网络,而是训练一个前馈网络来预测优化后的教师场。在训练过程中,我们还应用了SO(3)旋转增强,使我们的网络具备旋转鲁棒性,从而能够应用于任意朝向的开放场景形状。

该方法的意义重大:MeshFM生成了一种通用的形状表示,无需任何三维标注,也无需针对特定任务进行微调。我们通过将预测的特征零样本应用于三个任务来验证这一点:分割、稠密对应和交互式形状变形。在所有任务中,我们的通用特征性能与专门的SOTA基线方法相当或更优。这一发现表明,当蒸馏得当时,二维特征可能足以实现全面的三维形状理解,而无需复杂的、领域特定的先验。

2 相关工作

2.1 基础模型

基础模型通常指一类能够预测丰富视觉或文本特征的模型,它们在海量无标签互联网数据上进行训练。这些模型采用多种方法训练。对比视觉-语言模型(VLMs),如CLIP [29]和BLIP [20,21],在共享嵌入空间中对齐图像和文本,从而实现鲁棒的开放词汇识别。近期工作如SigLIP [36,42]进一步将这一范式扩展到数十亿图像-文本对,极大地提升了零样本性能。与VLMs并行,自监督学习也产生了强大的表示。DINO系列 [4,26,33] 利用Vision Transformer [8] 的自蒸馏来学习具有空间感知能力的特征,这些特征展现出涌现的语义部件对应关系。其他自监督方法,如MAE [10]和I-JEPA [1],专注于掩码和重建,学习鲁棒的低级特征。“分割一切”范式引入了通用分割模型,能够通过可提示接口进行零样本迁移。该领域已从静态图像 [15] 迅速发展到使用SAM 2 [31]和SAM 3 [3]进行统一的视频和概念分割。与此同时,像SAM 3D [5]这样的模型已将这些能力扩展到三维。近期的聚合模型,如RADIO [11,30],尝试将来自多种模态的基础模型蒸馏到单个高效的主干网络中。

第 4 页

4 Zhou 等

图 2:训练流程概览。MeshFM 的训练阶段包含两个步骤。第一阶段,我们将二维基础模型的信息蒸馏到三维特征场中。从网格的多视角渲染图中提取二维特征图,并将其投影到网格表面,随后一个神经模型学习将网格上的三维坐标映射到参考特征。第二阶段,我们使用教师特征场来训练一个前馈特征预测模型。该模型以从网格表面采样的点云作为输入,并学习从监督的三维教师场中输出点特征。

2.2 用于三维任务的二维先验

利用二维表示进行三维理解的做法早于现代基础模型。多视角 CNN [34] 表明,可以从渲染的二维视图中识别三维形状。这推动了基于投影的方法,即渲染多个视图,并将二维结果反投影到几何体上,后来从分类扩展到密集分割:3DMV [6] 将二维特征图反投影到体素网格中,而虚拟多视角融合 [18] 则在表面上融合渲染视图的预测结果。随着视觉语言模型(VLM)的出现,重点从迁移标签转向迁移开放词汇特征:OpenScene [28] 预测与 CLIP [29] 共同嵌入的密集特征,CLIP-FO3D [43] 和 OpenMask3D [35] 类似地提升二维特征用于开放词汇分割,这与辐射场蒸馏(LERF [13]、DFF [16]、N3F [37])密切相关。Diff3F [9] 从 Stable Diffusion [32] 和 DINOv2 [26] 中蒸馏内部特征,以在不同形状之间建立密集对应关系。 DFD [24] 通过重心坐标将逐像素的二维特征分配给三维点,从而为任意分辨率形状优化特征蒸馏过程。交互式方法也已出现,将人类意图引入循环。iSeg [19] 引入了一种交互式方法,采用注意力机制将 SAM 特征蒸馏到一个三维场中,该场能响应用户点击,从而实现视角一致、用户条件化的三维分割。这些蒸馏方法依赖于昂贵的逐场景优化或交互循环。相比之下,我们的方法训练了一个前馈网络,可直接从点云预测蒸馏后的特征场,无需优化即可立即获取丰富的二维先验。

第 5 页

MeshFM:二维特征足矣实现三维形状理解

图 3:特征混叠纠正。我们通过细粒度图像分割,纠正基于分块的图像编码器架构所产生的特征混叠。分割分组定义了假定具有相似深度特征的像素簇。对于其特征与簇中位数存在显著差异的像素,我们用中位数进行替换。由此得到的特征图在语义边界处的模糊程度大幅降低,且语义组内的特征更加稳定。

任何微调或优化。PartField [22] 采用了一种略有不同的方法,从二维先验中学习三维任务。作者利用 SAM 预测的分割结果和反投影,通过对比学习来学习部件感知特征。PartField 特征已成功应用于需要分割输入的下游应用 [39],但无法泛化到部件聚类之外的任务。

3 方法

给定输入网格,我们以前馈方式预测网格表面上的通用特征。我们方法的训练分为两个阶段。首先,我们将二维基础模型的特征蒸馏到神经场中,为每个训练形状拟合一个单独的场。这些特征场共享一个共同的语义空间,并作为第二阶段训练我们前馈网络时的教师场。在第二阶段训练期间,我们对物体应用 SO(3) 旋转增强,使模型学习到旋转鲁棒的特征。

3.1 第一阶段:教师场蒸馏

在第一阶段,我们的目标是将视觉基础模型中丰富的二维信号蒸馏到一个连续的三维特征场 Φ 中。我们采用 DFD [24] 中的重心坐标特征蒸馏方法,该方法将特征监督与形状的表面离散化解耦,使其成为在任意网格上进行鲁棒蒸馏的理想选择。我们从网格 M 渲染 m 幅多视角图像 {Ik}mk=1,并将其输入二维基础模型,以提取相应的特征图 {Fk}mk=1。然后,将特征反投影到三维空间中,并

第 6 页

6 Zhou et al.

图 4:部件分割对比。我们的方法无需任何3D标注训练即可分割网格,甚至能与直接在3D分割标注上训练的PartField性能相当。当我们的分割结果与真值存在差异时,这些差异在语义上仍然合理(例如裙装上的装饰缎带)。

从所有视角聚合而来。随后,通过优化一个特征场Φ来拟合这一特征监督,该特征场学习将网格上的3D坐标映射到从2D特征图投影而来的关联逐像素特征。

特征混叠纠正 尽管基于ViT的基础模型(如DINOv2 [26]和RADIO [11, 30])提供了丰富的语义描述符,但我们观察到图像分块不可避免地导致物体边界和部件边界处的“特征渗漏”。 我们在图3中对此进行了说明:由于2D编码器的分块采样,戒指上的特征与相邻的不相关特征发生了模糊。无论2D模型的表现力有多强,这种分块级别的混叠在结构层面上是特征提取所固有的。这种特征渗漏无法通过蒸馏优化解决,并会进入最终的3D蒸馏及后续分割中(如图3“原始蒸馏”所示)。 我们通过一种特征精化策略来纠正特征混叠,该策略利用了SAM [31]的精确边界检测能力。对于每个渲染视图\(I_k\),我们使用SAM生成一组不相交的分割掩码\(S_k = \{M_1, \dots, M_{n_k}\}\)。我们假设单个分割区域内的像素描绘了语义一致的部件,因此应具有相似的深层特征。

第 7 页

MeshFM:二维特征即三维形状理解所需的一切 7

图 5:旋转鲁棒性。我们可视化了输入形状在不同旋转下的分割结果。MeshFM 对旋转具有高度鲁棒性,在完整 SO(3) 群的大角度旋转下,分割结果保持一致。

对于每个片段 Mi ∈ Sk,我们首先计算代表性片段特征 µi,即掩码内所有特征向量在通道维度上的中位数:

μ_i = median({f_u | u ∈ M_i}) (1)

其中 f_u 是像素 u 处的原始特征向量。然后,我们识别原始特征与代表性特征存在显著偏差的“离群”像素。若像素 u ∈ Mi 与 µi 的欧氏距离超过标量阈值 τ,则将其视为离群像素: ||f_u – μ_i|| > τ (2)

我们的特征通过重心特征蒸馏进行了单位归一化,因此我们发现将 τ 设为 1 在所有实验中均能产生合理的结果。 对于所有此类离群像素,我们将其原始特征 f_u 替换为代表性特征 µi。如图 3“纠正蒸馏”所示,该操作有效地恢复了特征图中的几何/语义边界。

3.2 第二阶段:旋转鲁棒的前馈特征预测

在第二阶段,我们将第一阶段优化得到的特征场 {Φ} 蒸馏到一个可泛化的前馈网络 Ψ 中。这使我们能够在单次前向传播中预测新形状的三维特征场,从而无需在测试时进行优化。 架构。我们的前馈网络 Ψ 设计用于处理归一化的点云输入 P ∈ R^{C×3},并输出由三平面表示的连续特征场。如图 2 所示,该架构包含两个主要组件:

1. 点-体素编码器:我们采用 PVCNN [25] 编码器从输入几何中提取逐点特征。这些特征通过均值归约被正交投影到三个轴对齐平面(XY、XZ、YZ)上,形成初始的三平面表示。

第 8 页

8 Zhou 等

图 6: 层次化部件分割。我们的方法只需增加特征簇的数量(从左到右),即可对网格进行越来越细粒度的分割。值得注意的是,我们支持广泛的部件数量,能够区分部件实例(例如角色的靴子),并捕捉精细的形状细节(例如步枪枪托上的绑带)。

2. 三平面 Transformer:初始三平面首先经过一个 2D CNN 进行下采样,展平后通过一个 Transformer 来捕获全局上下文。处理后的特征再通过一个转置 2D CNN 上采样回原尺寸,得到最终的三平面张量 T ∈R3×D×H×W,其中 D 是特征维度,H × W 是空间维度。

来自阶段 1 的蒸馏。与阶段 1 依赖可微渲染的 2D 监督(噪声大且代价高)不同,阶段 2 完全由冻结的阶段 1 特征场生成的 3D 信号进行监督。我们将优化后的场 Φi 视为教师,训练 Ψ 直接回归 Φi 的输出。 在训练期间,我们将输入形状归一化到单位立方体,与教师蒸馏时相同。我们通过在形状表面上均匀采样 (x, y, z) 坐标,生成一组查询点 Q = {xk}Kk=1。对于每个查询点 xk,我们通过查询冻结的阶段 1 场来获得目标特征向量 f kgt:f kgt = Φ(xk)。 网络 Ψ 以形状的点云 P 作为输入,预测三平面表示 T = Ψ(P)。然后,我们通过对 T 的三个平面进行双线性插值并求和,计算 xk 处的预测特征 f kpred:f kpred = Sample(T, xk) = Pp∈{XY,XZ,Y Z} Tp(projp(xk))。 训练目标就是预测特征与目标特征之间的 L2 损失:

L = \frac{1}{K}\sum_{k=1}^{K} \left\| \mathbf{f}_k^{pred} – \mathbf{f}_k^{gt} \right\|_2^2 \quad (3)

第 9 页

MeshFM:二维特征足矣实现三维形状理解 9

| 类别 | 原始形状 | 原始形状 | 原始形状 | SO(3)旋转 | SO(3)旋转 | SO(3)旋转 | |——|———-|———-|———-|———–|———–|———–| | | Diff3F [9] | PartField [22] | Ours | Diff3F [9] | PartField [22] | Ours | | 动物 | 0.507 | 0.561 | 0.555 | 0.462 | 0.322 | 0.570 | | 建筑与户外 | 0.515 | 0.481 | 0.572 | 0.445 | 0.308 | 0.533 | | 日用品 | 0.548 | 0.562 | 0.556 | 0.512 | 0.456 | 0.522 | | 电子产品 | 0.539 | 0.572 | 0.595 | 0.524 | 0.437 | 0.605 | | 食物 | 0.544 | 0.635 | 0.494 | 0.565 | 0.461 | 0.520 | | 人体形状 | 0.487 | 0.508 | 0.519 | 0.469 | 0.440 | 0.514 | | 植物 | 0.515 | 0.570 | 0.613 | 0.496 | 0.361 | 0.574 | | 交通工具 | 0.464 | 0.443 | 0.491 | 0.429 | 0.260 | 0.498 | | 平均 | 0.515 | 0.542 | 0.549 | 0.488 | 0.393 | 0.539 |

表1:PartObjaverse-Tiny数据集上的类别无关语义分割。我们报告了在原始形状和SO(3)旋转形状上评估的平均交并比。数值越高越好。最佳结果加粗,次佳结果加下划线。无论是否经过SO(3)旋转,我们的方法均优于当前最优基线。

这种两阶段方法使MeshFM能够将二维基础模型的语义丰富性(在第一阶段捕获)与前馈三维网络的推理速度(在第二阶段实现)结合起来。 SO(3)旋转增强。为使模型适用于常呈现任意朝向的开放世界形状,我们在训练期间应用SO(3)旋转增强。具体而言,我们首先在不使用旋转的情况下训练模型直至收敛。随后再训练365k次迭代,并为每个训练形状沿所有三个轴随机采样旋转角度,在前125k次迭代中线性增加最大旋转角度θmax,直至θmax = 2π。

4 实验

为展示所学特征的通用性,我们将其应用于常见的三维任务,并针对每个任务与当前最优(SOTA)基线方法进行评估。对于所有评估数据集,我们额外为每个形状采样5个随机SO(3)旋转,生成“旋转增强”版本,并进一步评估基线方法的旋转鲁棒性。我们的训练在4块L40S GPU上进行,每块GPU的批大小为4个物体。我们使用Adam优化器,学习率为1 × 10⁻⁴。我们的模型约有126M参数。 我们的目标并非在任一特定任务上展示SOTA性能,而是表明我们的通用特征与SOTA任务特定特征相比具有竞争力。重要的是,我们证明我们的特征能够跨不同任务泛化,而任务特定特征则不能。为此,我们在所有任务上以零样本方式评估所有基线特征,并注意对同一任务的所有特征应用相同的后处理函数。这确保我们在表征质量方面公平地比较特征。

第 10 页

10 Zhou 等

基线方法。我们与 PartField [22](分割)、DenseMatcher [44](纹理对应)和 Diff3F [9](对应)进行比较,这些方法均为各自领域内的 SOTA 模型。这些基线方法均提供每个形状的点特征,从而允许在我们的所有形状任务中进行通用评估。 PartField 比较讨论 虽然我们将 PartField 作为基线,但 PartField 自身指出其 PVCNN 和三平面架构本质上是外在的,需要朝向一致的形状。由于我们的模型使用类似的主干网络,并仅通过 SO(3) 增强获得旋转鲁棒性,PartField 原则上也可以采用相同方式训练。我们承认,将经过增强的模型与未增强的 PartField 进行比较,可能在旋转输入上给我们带来一定优势,尽管其对 2D SAM 掩码监督的依赖会使此类增强更难实施,并可能降低其掩码质量。然而,即使在未旋转的形状上,我们的模型在没有任何标注监督的情况下,性能也与 PartField 相当。

原始 SO(3) 旋转

类别 Diff3F PartField Ours Diff3F PartField Ours

电子与计算机 0.495 0.521 0.502 0.494 0.503 0.495 家用电器 0.373 0.425 0.382 0.372 0.393 0.377 厨房与食品 0.513 0.573 0.542 0.533 0.570 0.545 家具与家居 0.451 0.471 0.486 0.454 0.444 0.467 工具、办公与杂项 0.633 0.600 0.651 0.636 0.592 0.647

平均 0.496 0.517 0.520 0.501 0.499 0.510 表 2: PartNetE [23] 测试集上的类别无关语义分割。我们使用基于原始 PartNet 语义标签的标签,并报告原始数据集和 SO(3) 旋转数据集上的平均交并比。数值越高越好。最佳结果加粗,次佳结果加下划线。我们的方法在有无 SO(3) 旋转的情况下均优于最先进的基线方法。

4.1 部件分割

遵循 PartField [22],我们在两个数据集上评估我们的方法在类别无关的 3D 部件分割任务上的表现:PartObjaverse-Tiny [41] 和 PartNetE [23]。PartObjaverse-Tiny 数据集包含 200 个形状,涵盖 8 个类别,并带有人工标注的分割。PartNetE 测试集包含 1,906 个形状,涵盖 45 个类别,这些类别被整合为 PartField 定义的 5 个类别(映射关系见第 S2.5 节,复制自 PartField)。我们未报告 DenseMatcher 的结果,因为该模型在这些数据集中的非流形输入上失败。 我们报告了两个数据集上语义分割和实例分割标签的结果(实例分割结果见第 S1.1 节)。我们对所有基线特征应用与 PartField 相同的凝聚聚类算法,并将聚类数 k 设为唯一真实标签的数量。

第 11 页

MeshFM:二维特征即三维形状理解所需的一切 11

原始 SO(3)旋转

全部 保留 全部 保留

方法 AUC ↑ 误差 ↓ AUC 误差 AUC 误差 AUC 误差

Diff3F [9] 0.46 11.8 0.48 7.6 0.42 13.8 0.41 10.1 DenseMatcher [44] 0.50 10.2 0.52 6.8 0.46 11.8 0.50 7.8 PartField [22] 0.35 17.1 0.37 11.5 0.24 21.0 0.38 11.2 MeshFM(本文) 0.52 9.6 0.51 7.2 0.50 10.5 0.51 7.0 表3:DenseCorr3D对应关系。我们报告了在所有测试类别和保留类别上,阈值为10%的归一化测地误差(“Err”)和曲线下面积(AUC)。最佳结果加粗,次佳结果加下划线。我们的方法与最先进的基线方法性能相当。

原始 SO(3)旋转

方法 AUC ↑ 误差 ↓ AUC ↑ 误差 ↓

Diff3F [9] 0.48 17.1 0.28 24.8 DenseMatcher [44] 0.11 31.5 0.02 41.7 PartField [22] 0.25 19.3 0.05 39.5 MeshFM(本文) 0.34 18.8 0.33 19.3 表4:TOSCA对应关系。我们报告了阈值为10%的归一化测地误差(Err)和曲线下面积(AUC)。最佳结果加粗,次佳结果加下划线。我们的方法与最先进的基线方法性能相当。

指标计算。遵循先前工作,我们计算预测分割与真实标签之间的平均交并比(mIoU)。为处理标签歧义,我们使用匈牙利算法[17]在不同标签集之间获得最佳的一对一匹配。

结果。我们在表1-2中报告了语义分割结果。MeshFM在两个数据集上均略微优于PartField,而通过旋转增强,我们的方法在所有类别上均显著优于所有基线方法。我们在图4中提供了定性比较,清晰地展示了PartField和Diff3F在适应旋转方面的失败。如前所述,PartField特征具有强烈的规范坐标偏差,而有趣的是,Diff3F往往表现出稍强的鲁棒性(可能源于其骨干图像模型学习到了一定的旋转鲁棒性)。 我们在图5中可视化了我们的旋转鲁棒性,并在图6中展示了额外的层次分割结果。MeshFM特征能产生清晰、边界对齐的分割,且在整个旋转范围内保持一致。

4.2 稠密对应

我们在TOSCA [2]和DenseCorr3D [44]数据集上评估稠密对应。TOSCA数据集包含80个经过变形的

第 12 页

12 Zhou et al.

图7:密集对应比较。在其他方法失败的这些示例上,我们的网格特征在形状间保持一致,即使形状未处于规范姿态且未对齐,也能实现形状间的密集匹配。对应关系通过每对形状上的颜色迁移进行可视化。值得注意的是,这种对应关系适用于各种领域和不同几何形状,包括具有锐利边缘的家居物品和车辆,以及表面光滑的(玩具)动物。

我们从模板网格计算对应图,为每个类别中的每对形状计算对应关系,共得到420对。DenseCorr3D数据集是一个较新的对应数据集,利用了来自Objaverse-XL [7]和OmniObject3D [40]的带纹理形状数据。DenseCorr3D测试集包含24个形状类别,其中3个为保留类别,共计306个测试对。遵循DenseMatcher的做法,我们使用为深度特征设计的正则化函数映射[27]来计算所有方法的对应关系。

指标计算。我们计算预测对应关系的归一化测地误差(“Err”)[14]和10%阈值下的曲线下面积(“AUC”)。

结果。我们在表3和表4中报告了定量结果。与分割结果类似,MeshFM特征在标准数据集上与SOTA模型持平或略逊一筹,但在旋转增强形状上表现出令人印象深刻的稳定性,而其他基线方法在任意朝向下大多失效。PartField特征在此设置下表现尤其差,这可以理解,因为它们是针对分割优化的。然而,这表明通用的3D特征无法从特定任务的训练中学习得到。

第 13 页

MeshFM:二维特征即三维形状理解之所需

我们在图7中展示了定性比较结果,其中给出了方法在规范朝向样本上的预测,以及同一对样本施加随机旋转后的预测。可以观察到,除本方法外,所有方法在计算对应关系时都表现出强烈的规范坐标系偏差,这支持了我们的定量评估,并揭示了现代特征学习技术中一个常见的失效模式。

表5:Manifold40分类。我们通过在Manifold40数据集[12]上对平均池化特征训练并测试一个轻量级(3层)MLP,来评估各方法特征的类别区分能力。我们报告了在Manifold40测试集上的平均准确率,包括使用与不使用SO(3)旋转增强两种情况。

4.3 分类

我们通过在Manifold40数据集[12]的一个子集上对平均池化特征训练并测试一个轻量级(3层)MLP,来评估各方法特征的类别区分能力。我们在表5中报告了原始数据集和旋转增强版本上的平均准确率。在相同轻量级架构下用于分类时,我们的特征比基线特征更具区分性,并且在旋转增强下自然表现出更一致的信号。

4.4 网格变形

我们通过预测网格顶点上的特征,然后在Part-Objaverse数据集上通过DFD框架[24]对控制手柄施加仿射变换来生成变形,如图8所示。从我们的特征中导出的变形权重能够实现输入形状的平滑、语义感知变形,无论其初始朝向如何。可以观察到,我们的变形能够稳健地分离形状中不同的语义特征,并且足够平滑,能够以合理的方式对变形进行插值。

4.5 消融研究

特征混叠纠正消融。我们通过比较在PartObjaverse-Tiny分割任务上使用与不使用SAM训练出的教师场的性能,对基于SAM的特征混叠纠正过程进行了消融实验。具体而言,我们报告了实例分割上的平均交并比(mIoU)。

第 14 页

14 Zhou 等

图 8:基于控制柄的变形。我们展示了在 Part-Objaverse 数据集的形状上,使用我们的特征和深度特征变形框架 [24] 进行的多控制柄变形。初始控制柄及其仿射变换以红色显示,最终控制柄目标位置以绿色显示。

表 6 中的 PartObjaverse-Tiny 数据集。可以观察到,特征混叠纠正在所有类别中都显著提升了教师场的平均交并比(mIoU)性能,表明特征抗混叠能够持续改善跨形状类别的特征质量。

| 类别 | 无 SAM 的教师模型 | 有 SAM 的教师模型 | |——|——————-|——————-| | 动物 | 0.600 | 0.618 | | 建筑与户外 | 0.572 | 0.587 | | 日常用品 | 0.653 | 0.647 | | 电子产品 | 0.701 | 0.716 | | 食物 | 0.620 | 0.778 | | 人形 | 0.680 | 0.714 | | 植物 | 0.592 | 0.633 | | 交通工具 | 0.577 | 0.595 | | 平均 | 0.630 | 0.661 |

表 6:消融实验:PartObjaverse-Tiny 数据集上的实例分割。我们报告了在优化教师特征场时,使用与不使用 SAM 混叠纠正(见第 3.1 节)的平均交并比。数值越高越好,最佳结果以粗体显示。可以观察到,SAM 特征混叠纠正在几乎所有类别中都提升了分割性能。

基础模型特征消融。我们直接在 PartNetE 语义分割任务上比较了从 RADIO、SAM、DINOv2 和 DINOv3 中提取的蒸馏教师场(表 7)。RADIO 和 DINO 变体均产生了可比的高性能结果,证明了我们的方法对不同语义丰富特征的鲁棒性。SAM 特征由于视角不一致性较高而表现稍差(尽管我们的特征场优化仍能较好地整合它们)。

5 局限性

尽管我们预测的网格特征具有通用性,但我们仍然继承了作为监督信号的 2D 基础模型的缺点。特别是在我们的工作中,我们

第 15 页

MeshFM:2D特征足以实现3D形状理解 15

类别 | DINOv2(原始) | RADIO | SAM2 | DINOv3 —|—|—|—|— 电子与计算机 | 0.52 | 0.50 | 0.53 | 0.52 家用电器 | 0.39 | 0.37 | 0.38 | 0.41 厨房与食品 | 0.57 | 0.59 | 0.52 | 0.58 家具与家居用品 | 0.51 | 0.52 | 0.49 | 0.53 工具、办公与杂项 | 0.66 | 0.65 | 0.61 | 0.67 平均 | 0.54 | 0.54 | 0.51 | 0.54

表7:在PartNetE数据集上对2D基础模型的消融实验。

图9:左右不匹配的局限性。我们的网格特征有时无法区分左右对称的形状部件(如椅子腿和动物肢体),导致对应错误。

我们使用了流行的DINOv2模型[26],该模型已知难以区分左右[38],因为它主要推理语义含义,而对相对位置的关注较少。这一局限性在对应任务中尤为明显,如图9所示,左右匹配偶尔会发生交换。尽管如此,我们的特征蒸馏框架并非针对特定2D模型定制。因此,随着2D基础模型的进步,我们的MeshFM能力可以得到提升。

6 结论

我们提出了MeshFM,一种前馈模型,用于预测3D形状的通用特征。我们将2D基础模型的特征蒸馏到3D教师场中,利用我们新颖的混叠纠正技术来对抗部件间的特征渗漏,并使用这些干净、边界感知的场来监督一个经过全范围旋转增强训练的前馈模型。所得特征能够实现零样本、旋转鲁棒的推理,并在分割、对应和变形任务上取得了与特定任务基线相媲美的性能。

7 致谢

本工作得到了美国国家科学基金会(NSF)项目#2304481、#2335493、#2402894、#2542757,美以两国科学基金会(BSF)项目#2022363,Adobe、Snap和Google的捐赠,以及Bennett家族AI+科学合作研究计划的支持。我们感谢3DL实验室成员富有洞见的讨论和反馈。我们也感谢芝加哥大学提供的计算资源、支持和员工专业知识。

第 16 页

16 Zhou 等

参考文献

1. Assran, M., Duval, Q., Misra, I., Bojanowski, P., Vincent, P., Rabbat, M., LeCun, Y., Ballas, N.: 基于联合嵌入预测架构的图像自监督学习。见:IEEE/CVF计算机视觉与模式识别会议论文集,第15619–15629页(2023) 2. Bronstein, A.M., Bronstein, M.M., Kimmel, R.: 非刚性形状的数值几何。计算机科学专著,Springer科学与商业媒体(2008) 3. Carion, N., Gustafson, L., Hu, Y.T., Debnath, S., Hu, R., Suris, D., Ryali, C., Alwala, K.V., Khedr, H., Huang, A. 等:Sam 3:基于概念的分割一切。arXiv预印本 arXiv:2511.16719(2025) 4. Caron, M., Touvron, H., Misra, I., Jégou, H., Mairal, J., Bojanowski, P., Joulin, A.: 自监督视觉Transformer中涌现的特性。见:IEEE/CVF国际计算机视觉会议论文集,第9650–9660页(2021) 5. Chen, X., Chu, F.J., Gleize, P., Liang, K.J., Sax, A., Tang, H., Wang, W., Guo, M., Hardin, T., Li, X. 等:Sam 3d:将图像中的一切三维化。arXiv预印本 arXiv:2511.16624(2025) 6. Dai, A., Nießner, M.: 3dmv:面向三维语义场景分割的联合三维多视图预测。见:欧洲计算机视觉会议(ECCV)论文集,第452–468页(2018) 7. Deitke, M., Liu, R., Wallingford, M., Ngo, H., Michel, O., Kusupati, A., Fan, A., Laforte, C., Voleti, V., Gadre, S.Y., VanderBilt, E., Kembhavi, A., Vondrick, C., Gkioxari, G., Ehsani, K., Schmidt, L., Farhadi, A.: Objaverse-xl:包含千万级三维对象的宇宙。arXiv预印本 arXiv:2307.05663(2023) 8. Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S. 等:一张图像等价于16×16个词:面向大规模图像识别的Transformer。arXiv预印本 arXiv:2010.11929(2020) 9. Dutt, N.S., Muralikrishnan, S., Mitra, N.J.: 扩散三维特征(diff3f):用蒸馏语义特征装饰无纹理形状。见:IEEE/CVF计算机视觉与模式识别会议论文集,第4494–4504页(2024) 10. He, K., Chen, X., Xie, S., Li, Y., Dollár, P., Girshick, R.: 掩码自编码器是可扩展的视觉学习器。见:IEEE/CVF计算机视觉与模式识别会议论文集,第16000–16009页(2022) 11. Heinrich, G., Ranzinger, M., Yin, H., Lu, Y., Kautz, J., Tao, A., Catanzaro, B., Molchanov, P.: Radiov2.5:面向聚合式视觉基础模型的改进基线。见:计算机视觉与模式识别会议论文集,第22487–22497页(2025) 12. Hu, S., Liu, Z., Guo, M., Cai, J., Huang, J., Mu, T., Martin, R.R.: 基于细分的网格卷积网络。ACM图形学汇刊 41(3),25:1–25:16(2022),https://doi.org/10.1145/3506694 13. Kerr, J., Kim, C.M., Goldberg, K., Kanazawa, A., Tancik, M.: Lerf:语言嵌入辐射场。见:IEEE/CVF国际计算机视觉会议论文集,第19729–19739页(2023) 14. Kim, V., Lipman, Y., Funkhouser, T.: 混合内蕴映射。ACM图形学汇刊(SIGGRAPH会议录)30(4)(2011年7月) 15. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y. 等:分割一切。见:IEEE/CVF国际计算机视觉会议论文集,第4015–4026页(2023)

第 17 页

MeshFM:二维特征即三维形状理解所需的一切 17

16. Kobayashi, S., Matsumoto, E., Sitzmann, V.:通过特征场蒸馏分解NeRF以进行编辑。《神经信息处理系统进展》35,23311–23330 (2022) 17. Kuhn, H.W.:分配问题的匈牙利算法。《海军研究后勤季刊》2(1–2),83–97 (1955年3月)。https://doi.org/10.1002/nav.3800020109 18. Kundu, A., Yin, X., Fathi, A., Ross, D., Brewington, B., Funkhouser, T., Pantofaru, C.:面向三维语义分割的虚拟多视图融合。载于:欧洲计算机视觉会议,第518–535页。Springer (2020) 19. Lang, I., Xu, F., Decatur, D., Babu, S., Hanocka, R.:iseg:基于交互式注意力的三维交互式分割。载于:SIGGRAPH Asia 2024会议论文,第1–11页 (2024) 20. Li, J., Li, D., Savarese, S., Hoi, S.:Blip-2:利用冻结图像编码器和大语言模型引导语言-图像预训练。载于:国际机器学习会议,第19730–19742页。PMLR (2023) 21. Li, J., Li, D., Xiong, C., Hoi, S.:Blip:面向统一视觉-语言理解与生成的引导式语言-图像预训练。载于:国际机器学习会议,第12888–12900页。PMLR (2022) 22. Liu, M., Uy, M.A., Xiang, D., Su, H., Fidler, S., Sharp, N., Gao, J.:Partfield:学习面向部件分割及其他任务的三维特征场。载于:IEEE/CVF国际计算机视觉会议论文集,第9704–9715页 (2025) 23. Liu, M., Zhu, Y., Cai, H., Han, S., Ling, Z., Porikli, F., Su, H.:Partslip:基于预训练图像-语言模型的三维点云少样本部件分割。载于:IEEE/CVF计算机视觉与模式识别会议论文集,第21736–21746页 (2023) 24. Liu, R., Lang, I., Hanocka, R.:深度特征变形权重 (2026年1月)。https://doi.org/10.48550/arXiv.2601.12527,http://arxiv.org/abs/2601.12527,arXiv:2601.12527 [cs] 25. Liu, Z., Tang, H., Lin, Y., Han, S.:面向高效三维深度学习的点-体素CNN。《神经信息处理系统进展》32 (2019) 26. Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A. 等:Dinov2:无需监督学习鲁棒视觉特征。arXiv预印本 arXiv:2304.07193 (2023) 27. Ovsjanikov, M., Ben-Chen, M., Solomon, J., Butscher, A., Guibas, L.:函数映射:形状间映射的灵活表示。《ACM图形学汇刊》31(4) (2012年7月)。https://doi.org/10.1145/2185520.2185526,https://doi.org/10.1145/2185520.2185526 28. Peng, S., Genova, K., Jiang, C., Tagliasacchi, A., Pollefeys, M., Funkhouser, T. 等:Openscene:基于开放词汇的三维场景理解。载于:IEEE/CVF计算机视觉与模式识别会议论文集,第815–824页 (2023) 29. Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J. 等:从自然语言监督中学习可迁移的视觉模型。载于:国际机器学习会议,第8748–8763页。PmLR (2021) 30. Ranzinger, M., Heinrich, G., Kautz, J., Molchanov, P.:Am-radio:聚合视觉基础模型将所有领域归为一体。载于:IEEE/CVF计算机视觉与模式识别会议论文集,第12490–12500页 (2024)

第 18 页

18 Zhou 等

31. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., 等:Sam 2:图像与视频中的任意分割。arXiv 预印本 arXiv:2408.00714 (2024) 32. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.:基于潜扩散模型的高分辨率图像合成。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。第 10684–10695 页 (2022) 33. Siméoni, O., Vo, H.V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khalidov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., 等:Dinov3。arXiv 预印本 arXiv:2508.10104 (2025) 34. Su, H., Maji, S., Kalogerakis, E., Learned-Miller, E.:面向三维形状识别的多视图卷积神经网络。收录于:IEEE 国际计算机视觉会议论文集。第 945–953 页 (2015) 35. Takmaz, A., Fedele, E., Sumner, R.W., Pollefeys, M., Tombari, F., Engelmann, F.:Openmask3d:开放词汇三维实例分割。arXiv 预印本 arXiv:2306.13631 (2023) 36. Tschannen, M., Gritsenko, A., Wang, X., Naeem, M.F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., 等:Siglip 2:具备增强语义理解、定位与稠密特征的多语言视觉-语言编码器。arXiv 预印本 arXiv:2502.14786 (2025) 37. Tschernezki, V., Laina, I., Larlus, D., Vedaldi, A.:神经特征融合场:自监督二维图像表示的三维蒸馏。收录于:2022 年国际三维视觉会议 (3DV)。第 443–453 页。IEEE (2022) 38. Uzolas, L., Eisemann, E., Kellnhofer, P.:表面感知的蒸馏三维语义特征。收录于:SIGGRAPH Asia 2025 会议论文。SA 会议论文 '25,美国纽约州纽约市计算机协会 (2025)。https://doi.org/10.1145/3757377.3763974,https://doi.org/10.1145/3757377.3763974 39. Wang, Z., Wei, X., Shi, R., Zhang, X., Su, H., Liu, M.:Partuv:基于部件的三维网格 UV 展开。收录于:ACM SIGGRAPH Asia 计算机图形与交互技术会议暨展览 (2025) 40. Wu, T., Zhang, J., Fu, X., Wang, Y., Jiawei Ren, L.P., Wu, W., Yang, L., Wang, J., Qian, C., Lin, D., Liu, Z.:Omniobject3d:面向真实感知、重建与生成的大词汇量三维物体数据集。收录于:IEEE/CVF 计算机视觉与模式识别会议 (CVPR) (2023) 41. Yang, Y., Huang, Y., Guo, Y.C., Lu, L., Wu, X., Lam, E.Y., Cao, Y.P., Liu, X.:Sampart3d:三维物体任意部件分割。arXiv 预印本 arXiv:2411.07184 (2024) 42. Zhai, X., Mustafa, B., Kolesnikov, A., Beyer, L.:用于语言-图像预训练的 Sigmoid 损失。收录于:IEEE/CVF 国际计算机视觉会议论文集。第 11975–11986 页 (2023) 43. Zhang, J., Dong, R., Ma, K.:Clip-fo3d:从二维稠密 CLIP 中学习自由开放世界三维场景表示。收录于:IEEE/CVF 国际计算机视觉会议论文集。第 2048–2059 页 (2023) 44. Zhu, J., Ju, Y., Zhang, J., Wang, M., Yuan, Z., Hu, K., Xu, H.:Densematcher:从单次演示中学习面向类别级操作的三维语义对应。arXiv 预印本 arXiv:2412.05268 (2024)

第 19 页

MeshFM:2D特征足以理解3D形状 19

补充材料

S1 补充结果

S1.1 补充分割结果

我们展示了本方法预测的更多分割结果。我们在PartNetE [6]和PartObjaverse-Tiny [7]数据集上,展示了本方法在类别无关实例分割任务上的定量结果,并与Diff3F [2]和PartField [5]进行了比较,如表S1和表S2所示。本方法略逊于PartField(后者显式使用分割标注进行训练),但在经过旋转增强的数据集上表现更优,证明了我们的特征适用于非受限形状。 我们还在图S1中展示了PartObjaverse-Tiny上实例分割的更多定性结果。

S1.2 补充对应关系结果

我们在图S2中展示了未对齐物体之间的更多对应关系结果。如图所示,即使形状未对齐且不处于规范姿态,利用我们的特征仍能获得良好的稠密对应,表明本方法学习到了具有语义意义且可区分的特征。

S1.3 跨域对应

我们展示了跨不同域的稠密对应定性结果。如图S3所示,利用本方法预测的特征,即使在完全不同的域之间,只要共享诸如“腿”之类的共同概念,也能获得有意义的对应关系。

S1.4 两阶段设计消融实验

我们在PartNet数据集中约2万形状的子集上,通过消融实验验证了两阶段设计的有效性。对于仅使用阶段二的模型,我们直接在反投影的逐视图2D特征(经过SAM特征混叠纠正)上训练MeshFM,不进行教师场蒸馏。我们在表S3中报告了PartNetE语义分割的性能。前两列比较了训练8.4万次迭代的原始(两阶段)流程与仅阶段二流程。由于原始流程受益于阶段一的优化(相当于2.5万次阶段二迭代),我们也将仅阶段二模型额外训练了2.5万次迭代(第三列)。在这两种情况下,仅阶段二模型的表现均不如我们提出的两阶段流程。我们推测这一差距源于2D模型的多视图不一致性;直接反投影会产生噪声极大的3D监督信号。我们的阶段一优化显式地过滤了这些噪声,确保模型学习到干净、视图一致的特征。

第 20 页

20 Zhou et al.

表 S1:PartObjaverse-Tiny 数据集上的类别无关实例分割。 我们报告在原始形状和经 SO(3) 旋转的形状上评估的平均交并比(mIoU)。数值越高越好。最佳结果加粗,次佳结果加下划线。

| 类别 | Diff3F [2] | PartField [5] | Ours | Diff3F [2] | PartField [5] | Ours | |——|————|—————|——|————|—————|——| | 动物 | 0.541 | 0.683 | 0.605 | 0.500 | 0.607 | 0.637 | | 建筑与户外 | 0.518 | 0.547 | 0.568 | 0.464 | 0.470 | 0.546 | | 日用品 | 0.565 | 0.637 | 0.622 | 0.552 | 0.558 | 0.545 | | 电子产品 | 0.581 | 0.673 | 0.675 | 0.577 | 0.607 | 0.691 | | 食物 | 0.544 | 0.635 | 0.494 | 0.565 | 0.461 | 0.520 | | 人体形状 | 0.590 | 0.689 | 0.646 | 0.564 | 0.641 | 0.660 | | 植物 | 0.539 | 0.697 | 0.613 | 0.513 | 0.586 | 0.596 | | 交通工具 | 0.471 | 0.653 | 0.560 | 0.485 | 0.560 | 0.562 | | 平均 | 0.544 | 0.652 | 0.598 | 0.527 | 0.564 | 0.595 |

表 S2:PartNetE [6] 测试集上的类别无关实例分割。我们使用基于原始 PartNet 实例标签的标注,并报告平均交并比(mIoU)。数值越高越好。最佳结果加粗,次佳结果加下划线。

| 类别 | Diff3F [2] | PartField [5] | Ours | |——|————|—————|——| | 电子与计算机 | 0.345 | 0.382 | 0.329 | | 家用电器 | 0.316 | 0.354 | 0.308 | | 厨房与食物 | 0.463 | 0.540 | 0.486 | | 家具与家居 | 0.410 | 0.508 | 0.444 | | 工具、办公与杂项 | 0.495 | 0.354 | 0.500 | | 平均 | 0.416 | 0.496 | 0.430 |

S1.5 SAM 混叠纠正对对应关系的影响

在主论文中,我们消融分析了 SAM 特征混叠纠正对部件分割的影响(表 6)。此处我们进一步评估其对稠密对应关系的作用。我们在 DenseCorr3D 数据集上比较了使用与不使用 SAM 混叠纠正优化的教师特征场,并在表 S4 中报告了归一化测地误差和 10% 阈值下的曲线下面积(AUC)。SAM 混叠纠正在完整测试集和留出类别上均一致地提升了对应关系质量,证实了更清晰、边界感知的教师特征不仅有利于分割,也有利于对应关系。

第 21 页

MeshFM:二维特征即三维形状理解所需的一切 21

图S1:类别无关的实例分割。这里我们展示了更多实例分割结果。我们的方法预测的特征具有足够的表达能力,能够将人形角色的手部以及卡车示例中的线缆分割出来。对于其他预测结果与真实标注不同的示例,我们的预测同样展现出良好的语义解释性,例如在最后两个示例中,将物体/部件的主体与装饰物或附件分离开来。

S2 技术细节

S2.1 数据集

我们在Objaverse [1]的一个子集上训练模型,该子集包含约13万个形状。我们使用Objaverse++ [4]的标注对数据进行过滤,丢弃了标记为低质量、场景、非单一物体的数据。

S2.2 推理时间对比

我们在表S5中报告了各方法在TOSCA数据集上获取每个形状特征的平均时间。该数据集中的形状平均包含35,812个

第 22 页

22 Zhou 等

图 S2:密集对应。此处我们展示了在 SO(3) 旋转下密集对应结果的更多定性结果。

图 S3:跨域密集对应。此处我们展示了在不同域之间评估的密集对应结果的更多定性结果。

个顶点和 71,556 个面。我们的方法显著快于所有基线方法。Diff3F 基于优化,而 DenseMatcher 依赖昂贵的拉普拉斯特征基分解进行预处理。PartField 尽管使用了类似的架构,但速度也较慢,因为它们对每个面进行 10 倍子采样以获得更平滑的特征。

S2.3 流程成本分析

表 S6 从时间(GPU 小时和实际耗时)和计算量(TFLOPs)两方面,细分了在 20k PartNet 子集上训练系统的流程成本。预处理占用了大量 GPU 小时(约 70%),因为每个形状都需要渲染,并用大型基础模型编码、经 SAM 校正,再将特征反投影到 3D。无论是否包含阶段 1,此预处理步骤都是必需的。阶段 2 训练主导了整个流程的计算量(约 90%),因为与单个特征场相比,MeshFM 模型具有显著更多的参数,并训练了更多的迭代次数。我们注意到,两者

第 23 页

MeshFM:二维特征即可实现三维形状理解

类别 本文方法(84k) 仅第二阶段(84k) 仅第二阶段(109k)

电子与计算机 0.50 0.49 0.49 家用电器 0.38 0.36 0.37 厨房与食品 0.55 0.52 0.53 家具与家居 0.49 0.45 0.46 工具、办公与杂项 0.64 0.60 0.61

平均 0.51 0.47 0.48 表S3:两阶段训练消融实验,括号内为迭代次数。

全部留存数据

方法 AUC(↑) 误差(↓) AUC(↑) 误差(↓)

无SAM教师模型 0.45 12.4 0.50 7.5 有SAM教师模型 0.46 12.2 0.52 7.3 表S4:消融实验:DenseCorr3D数据集上的对应关系。我们报告了在10%阈值下,使用与不使用SAM混叠纠正(见第3.1节)优化的教师特征场之间的归一化测地误差与AUC。最佳结果以粗体显示。SAM特征混叠纠正持续提升了教师特征的对应关系性能。

预处理与第一阶段针对每个形状独立运行,且高度可并行化。因此,我们也报告了并行化后的实际耗时(墙钟时间小时数),该数值显著更低。如表S3和表S6所示,纳入第一阶段以相对较低的成本大幅提升了模型性能。

S2.4 下游应用技术细节

我们提供了从表面特征中获得不同零样本下游任务预测的技术细节。为确保公平比较,我们对所有基线方法均采用完全相同的流程。

部件分割 我们利用特征场中编码的密集语义信息来执行零样本三维部件分割。该方法基于以下观察:来自语义相关部件的特征向量在所学高维空间中紧密聚集。 给定一个包含面集合F = {f1, …, fN}的输入网格,我们首先通过平均每个面fi的顶点坐标来计算其质心ci ∈ R³。然后,我们查询训练好的前馈网络Ψ,为每个面提取一个几何感知的语义特征向量zi:

\ mathb f {z}_i = \Psi(\mathbf{c}_i) \in \mathbb{R}^D, (S1)

其中D为特征维度。为了将形状分解为K个不同的部件,我们将面特征Z = {zi}Ni=1视为潜在空间中的样本,并

第 24 页

24 Zhou 等

Diff3F [2] PartField [5] DenseMatcher [8] 本文方法

时间(秒) 956.3 2.43 99.0 0.13 表 S5:推理时间对比:我们在 TOSCA 数据集上比较了所有方法的特征提取时间。该数据集包含 80 个形状,平均具有 35,812 个顶点和 71,556 个面。

预处理 阶段 1 阶段 2

时间(GPU 小时) 833.3 222.2 116.7 时间(墙上时间 小时) 41.7 11.1 29.2 计算量(TFLOPs) 1.6M 150K 17.3M 表 S6:针对 20k 个 PartNet 形状的训练成本分析。

应用 K-Means 或凝聚聚类。我们的目标是通过最小化簇内方差,将面划分为 K 个不相交的集合(部件)P = {P1, . . . , PK}:

min {µk}K k=1 K∑ k=1 ∑ i∈Pk ∥zi − µk∥2 (S2)

其中 µk 是第 k 个部件的原型特征向量。然后,每个面 fi 被分配给与其最近原型对应的段 Pˆk:

ˆk = argmin k ∥zi − µk∥2 (S3)

这一过程仅基于学习到的语义相似性,就能产生一致的 3D 网格部件分解,无需任何显式监督或人工标注。

稠密对应 尽管在特征空间中进行最近邻搜索可以为对应关系提供一个强大的基线 [3],但它独立处理每个点,忽略了底层流形的全局几何结构。为了强制空间连续性和双射性,我们采用函数映射框架作为一个鲁棒的推理时细化步骤。 谱基投影。对于一对形状 M1 和 M2,我们首先计算拉普拉斯-贝尔特拉米算子的前 k 个特征函数,Φ1 ∈ R|V1|×k 和 Φ2 ∈ R|V2|×k。我们将稠密特征场 F1、F2(从阶段 1 蒸馏而来)投影到这些基上,以获得它们的谱系数:

A = Φ† 1F1, B = Φ† 2F2 (S4)

其中 A, B ∈ Rk×D 是紧凑的谱描述符。 映射优化。我们寻求一个函数映射矩阵 C ∈ Rk×k,该矩阵能在对齐这些谱描述符的同时,促进等距性(与拉普拉斯算子交换性)

第 25 页

MeshFM:二维特征即三维形状理解所需的一切 25

拉普拉斯算子)。我们通过使用L-BFGS-B求解器最小化以下能量来求解最优C:

\min_{\mathbf{C}} \underbrace{\|\mathbf{C}\mathbf{A} – \mathbf{B}\|_F^2}_{\text{特征保留}} + \lambda_{\text{reg}}\underbrace{\|\mathbf{C}\Delta_1 – \Delta_2\mathbf{C}\|_F^2}_{\text{交换性}} (S5)

其中Δ₁、Δ₂是拉普拉斯特征值的对角矩阵。 点到点恢复。一旦C被优化,我们通过比较对齐后的谱嵌入来恢复稠密的点到点对应关系。对于M₁中的每个顶点i,我们分配使谱距离最小化的匹配j ∈ M₂:

j^* = \operatorname*{argmin}_{j} \|(\mathbf{C}\Phi_1)_j – (\Phi_2)_i\|_2 (S6)

这种谱对齐确保了得到的对应关系不仅在语义上准确,而且在几何上平滑,滤除了原始特征匹配中固有的高频噪声。

网格变形 我们利用学习到的特征场的语义一致性来执行基于控制柄的网格变形。我们的方法遵循深度特征变形(DFD),假定语义相似的区域应共同变形,这一特性自然由我们蒸馏出的特征在潜在空间中的邻近性所捕获。 给定一个具有顶点V和一组H个用户定义控制柄的网格,我们通过线性混合计算顶点i的变形位置v′_i:

\mathbf{v}_{i}^{\prime} = \sum_{k=1}^{H} \mathcal{W}_{j_k i} D_k \mathbf{v}_{i} (S7)

其中D_k是与第k个控制柄(位于顶点索引j_k处)相关联的仿射变换,W ∈ ℝ^{|V|×|V|}是变形权重矩阵。 基于特征的权重。与传统方法求解优化问题(例如,双调和坐标)来确定W不同,我们直接从预训练的特征场Φ计算混合权重。我们基于控制柄顶点j_k与网格顶点i之间的特征相似性定义权重W_{ij}:

\mathcal{W}_{j_k i} = \max(1 – \|\mathbf{z}_{j_k} – \mathbf{z}_i\|_2, 0) (S8)

其中z = Φ(v)表示在顶点v ∈ V处从特征场查询的单位范数特征向量。此公式确保控制柄对语义相关的区域施加影响(例如,椅子腿上的控制柄会影响所有腿),而无论欧氏距离如何,从而实现全局语义编辑。

S2.5 PartNetE类别映射(源自PartField)

我们基于PartField中使用的相同类别映射报告PartNetE结果,复现如下。

第 26 页

26 Zhou et al.

– 电子与计算设备:键盘、鼠标、笔记本电脑、手机、相机、USB、显示器、遥控器、打印机、开关(若视为网络或电源开关) – 大型家用电器:洗衣机、洗碗机、冰箱、烤箱、微波炉 – 厨房与食品相关物品:厨房锅、水壶、烤面包机、咖啡机、水龙头、饮水机、刀、瓶子、桶(常用于厨房/清洁场景) – 家具与家居基础设施:桌子、椅子、折叠椅、储物家具、门、窗、灯、垃圾桶、保险箱(常为家居或办公固定装置) – 工具、办公用品及其他:订书机、剪刀、笔、钳子、打火机、盒子、推车(如工具车)、地球仪(装饰/教育用途)、手提箱(旅行/个人物品)、眼镜(个人物品)、时钟

参考文献

1. Deitke, M., Schwenk, D., Salvador, J., Weihs, L., Michel, O., VanderBilt, E., Schmidt, L., Ehsani, K., Kembhavi, A., Farhadi, A.: Objaverse: A universe of annotated 3d objects. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 13142–13153 (2023) 2. Dutt, N.S., Muralikrishnan, S., Mitra, N.J.: Diffusion 3d features (diff3f): Decorating untextured shapes with distilled semantic features. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 4494–4504 (2024) 3. Lang, I., Ginzburg, D., Avidan, S., Raviv, D.: DPC: Unsupervised Deep Point Correspondence via Cross and Self Construction. In: Proceedings of the International Conference on 3D Vision (3DV). pp. 1442–1451 (2021) 4. Lin, C., Liu, H., Lin, Q., Bright, Z., Tang, S., He, Y., Liu, M., Zhu, L., Le, C.: Objaverse++: Curated 3d object dataset with quality annotations. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 6813–6822 (2025) 5. Liu, M., Uy, M.A., Xiang, D., Su, H., Fidler, S., Sharp, N., Gao, J.: Partfield: Learning 3d feature fields for part segmentation and beyond. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 9704–9715 (2025) 6. Liu, M., Zhu, Y., Cai, H., Han, S., Ling, Z., Porikli, F., Su, H.: Partslip: Low-shot part segmentation for 3d point clouds via pretrained image-language models. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 21736–21746 (2023) 7. Yang, Y., Huang, Y., Guo, Y.C., Lu, L., Wu, X., Lam, E.Y., Cao, Y.P., Liu, X.: Sampart3d: Segment any part in 3d objects. arXiv preprint arXiv:2411.07184 (2024) 8. Zhu, J., Ju, Y., Zhang, J., Wang, M., Yuan, Z., Hu, K., Xu, H.: Densematcher: Learning 3d semantic correspondence for category-level manipulation from a single demo. arXiv preprint arXiv:2412.05268 (2024)

发表评论