三分钟导读:本文提出UniPhys框架及UniPhysGen模型,通过感知引导的结构分解、几何感知的关节接地和仿真驱动的一致性验证,将异构3D资产自动转化为具有统一关节语义和内在物理属性的仿真就绪资产。
英文题目:UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets
论文出处:arXiv 每日论文精选 · arXiv:2607.13586
原始论文:PDF / 论文页面
对应视频标题:UniPhysGen:让3D资产具备物理属性,一键生成仿真就绪模型|推荐指数:★★★★★
这篇论文解决什么问题?
现有3D资产缺乏统一的物理语义(关节语义和内在物理属性),且现有方法通常独立处理这些语义或依赖规范化的物体结构,导致在异构3D资产上鲁棒性差,难以直接用于机器人仿真。
核心创新
- 提出UniPhys管道,实现从原始3D网格到仿真就绪资产的自动化统一物理接地。
- 构建UniPhys-40K大规模数据集和UniPhys-Bench人工验证基准,支持大规模训练与评估。
- 提出UniPhysGen模型,在异构部件分解下联合推理关节语义和内在物理属性。
- 引入几何鲁棒的关节接地策略,包括SO(3)增强、球面轴参数化和统一全局位置编码,以缓解几何捷径偏差。
- 设计仿真驱动的一致性验证机制,通过物理模拟验证并优化接地注释的质量。
方法概览
提出UniPhys管道,包含四个阶段:(1) 感知引导的物理意义结构分解,利用SAM先验和PartField生成候选分解;(2) 内在物理属性接地,通过LVLM进行部分感知推理;(3) 几何感知关节接地,结合多模态语义与几何运动推理,使用SO(3)增强和球面参数化;(4) 仿真驱动的一致性验证,通过MuJoCo模拟过滤不一致注释。基于此构建UniPhys-40K数据集和UniPhys-Bench基准,并训练UniPhysGen模型。
逐图理解论文
方法:UniPhys统一接地管道

本文提出UniPhys管道,包含四个阶段:感知引导的结构分解、内在物理属性接地、几何感知关节接地,以及仿真驱动的一致性验证。该流程旨在将原始3D网格自动转化为具有统一关节语义和物理属性的仿真就绪资产。
核心:UniPhysGen模型架构

UniPhysGen模型以3D对象和部件几何为输入,通过统一的多模态骨干网络,联合推理四种结构化物理语义:部件级属性、关节运动学、关节结构及对象级属性。这种设计实现了对异构部件分解的鲁棒处理。
创新:几何鲁棒的关节接地

为缓解几何捷径偏差,本文引入SO(3)增强和球面参数化。通过多模态语义与几何运动推理,结合候选轴视图,使模型能在受限候选空间中筛选物理合理的关节配置,显著提升轴方向推理的准确性。
数据:UniPhys-40K与基准

基于该管道,作者构建了UniPhys-40K大规模数据集和UniPhys-Bench人工验证基准。相比PhysXNet和PhysDB,UniPhys-40K来源更广,且包含完整的关节运动和内在物理属性标注,支持大规模训练与评估。
结果:统一物理接地性能

在UniPhys-Bench上,UniPhysGen关节类型准确率达89.96%,轴角度误差9.77度,枢轴距离误差0.099,结构mIoU为84.95%,全面优于Real2Code、URDFormer等基线方法,展现出强大的统一接地能力。
实验与关键结果
- 在UniPhys-Bench上进行统一物理接地定量评估,对比Real2Code, URDFormer, Articulate-Anything, PARTICULATE, NeRF2Physics。
- 在PartNet-Mobility上进行关节运动参数估计的定量比较。
- 进行鲁棒性分析:不同旋转增强、轴参数化、部件组合粒度下的表现。
- 消融实验:位置编码策略、图像模态影响、模型规模扩展分析。
- 仿真验证:在Isaac Sim中集成接地资产进行抽屉拉动、水龙头旋转等具身交互测试。
- 人工评估:验证仿真驱动验证对注释可靠性的提升。
- UniPhysGen在UniPhys-Bench上关节类型准确率89.96%,轴角度误差9.77°,枢轴距离误差0.099,结构mIoU 84.95%,优于所有基线。(第 7 页)
- 内在物理属性方面,UniPhysGen在材料准确率(77.92%)、密度ALDE(0.438)、摩擦MAE(0.062)、尺度ALDE(0.251)、质量MnRE(0.819)等指标上表现优异。(第 7 页)
- 在Challenging-Rotated测试集上,SO(3)增强+球面参数化使关节类型准确率从50.09%提升至78.11%。(第 8 页)
- 统一全局位置编码将枢轴距离误差从0.319降低至0.099。(第 8 页)
- 在PartNet-Mobility上,UniPhysGen在关节类型、轴、枢轴和运动限制估计上均达到SOTA或接近SOTA水平(见附录Table 9)。(第 30 页)
阅读时需要注意
- UniPhysGen在Challenging-Rotated测试集上的轴角度误差较大(23.40°),表明在极端旋转下轴方向推理仍有挑战。
- 图像模态对几何和功能主导的属性(如尺度、质量、功能)估计贡献有限,甚至略有负面影响。
- 数据集UniPhys-40K虽大,但仍存在长尾分布,且部分资产可能因原始数据质量限制接地精度。
- 基线方法如Articulate-Anything依赖语义先验和规范坐标,公平比较时需注意其假设条件。
- 仿真验证仅为定性展示,缺乏大规模的定量仿真指标(如接触力误差、稳定性评分)。
- UniPhysGen的性能依赖于部件分解的质量,尽管模型对异构分解鲁棒,但极端错误的分解仍可能影响结果。
关联工作
- PhysXNet:对比数据集,PhysXNet仅关注PartNet,且无仿真验证,UniPhys-40K来源更广且含仿真验证。(第 3 页)
- PhysDB:对比数据集,PhysDB仅标注联合类型,UniPhys-40K包含完整的关节运动和内在物理属性。(第 3 页)
- URDFormer:基线方法,基于图像预测URDF,UniPhysGen基于3D点云进行统一物理接地。(第 7 页)
- Articulate-Anything:基线方法,基于VLM,UniPhysGen引入几何约束和SO(3)增强以提高鲁棒性。(第 7 页)
- NeRF2Physics:基线方法,专注于内在物理属性,UniPhysGen联合建模关节和物理属性。(第 7 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
预印本
UNIPHYSGEN:面向仿真就绪 3D 资产的统一物理接地
李贤1,2,魏荣2,杨路杰2,3,黄浩林1,方俊源2,唐思良1,肖军1,唐锐2∗,李俊成1† 1 浙江大学,2 芯原微电子(上海)股份有限公司 3 电子科技大学
摘要
具有物理接地的 3D 资产对于具身智能和机器人仿真日益重要。然而,大多数现有的 3D 资产缺乏统一的物理语义,包括关节语义和内在物理属性,而这些是实现真实交互所必需的。当前的方法要么独立处理这些语义,要么依赖于规范化对象结构,这限制了其在异构 3D 资产上的鲁棒性。我们提出了 UniPhys,一个可扩展的框架,用于自动将原始 3D 资产转换为具有统一物理语义的仿真就绪资产。基于 UniPhys,我们构建了 UniPhys-40K,一个大规模物理接地数据集,以及 UniPhys-Bench,一个经过精心验证的统一物理接地评估基准。我们进一步引入了 UniPhysGen,这是一个统一的物理接地模型,能够联合推理关节语义和内在物理属性。UniPhysGen 结合了几何鲁棒的异构部件关节分解和接地,以缓解几何捷径偏差。广泛的实验表明,UniPhysGen 在关节接地和内在物理属性估计任务上均达到了最先进的性能,而由此生成的资产可以直接部署在机器人仿真环境中进行真实的物理交互。我们的代码和数据集将在 https://github.com/breezexian/UniPhysGen 上提供。[cs.CV]
1 引言
生成式 3D 建模的最新进展 Xiang et al. (2025b;a); Zhao et al. (2025b); Lai et al. (2025) 以及 Objaverse Deitke et al. (2023b;a) 等大规模 3D 存储库的出现,极大地提高了高质量 3D 资产的可用性。然而,尽管它们具有逼真的几何形状和外观,大多数现有资产本质上仍 unaware of simulation(对仿真无感知),缺乏实现真实交互、仿真和具身智能所需的物理接地语义。此类语义包括关节语义(如关节结构和运动学参数)以及内在物理属性(包括材料、密度、摩擦力和质量)。因此,在视觉上逼真的 3D 资产与仿真就绪资产之间仍存在差距。
因此,一个核心挑战在于如何自动将原始 3D 网格转换为具有统一物理语义且物理一致、仿真就绪的资产。现有的物理接地方法仍然支离破碎,主要将关节接地和内在物理属性估计视为独立的问题 Chen et al. (2024); Zhao et al. (2025a); Le et al. (2025); Zhai et al. (2024); Xu et al. (2025)。然而,仿真就绪的资产需要在物理交互和仿真过程中这些语义保持联合一致性。独立地接地这些语义往往会导致物理不一致的运动、不稳定的交互或不可信的仿真行为。更近期的基于物理的生成框架 Cao et al. (2025b;a); Yang et al. (2026) 进一步探索了联合建模关节和内在物理属性。尽管如此,这些方法通常依赖于规范化的部件分解、干净的物体结构或在受限的合成设置下构建的结构假设。这些假设在推广到常见异构且不一致的分解时表现不佳。
∗ 项目负责人 † 通讯作者:junchengli@zju.edu.cn
1
第 2 页
预印本
服务于多样化的资源,包括艺术家设计的网格、程序化生成的结构以及生成式3D资产。与此同时,如表1所示,现有的物理接地数据集要么主要关注关节语义 Xiang et al. (2020); Iliash et al. (2026); Geng et al. (2023); Li et al. (2026),要么严重依赖人工策展、干净的预分割物体部件以及规范的结构分解 Cao et al. (2025a); Yang et al. (2026)。更重要的是,尽管物理接地旨在使资产具备仿真就绪能力,但现有数据集通常止步于语义标注,很少利用仿真来验证或完善接地结果。
为了解决这些局限性,我们引入了 UniPhys,这是一个自动化的物理接地管道,能够将来自不同来源的3D网格统一转换为具有统一关节和物理属性语义的仿真就绪资产。如图1所示,UniPhys 针对物理接地中的三个关键挑战,并通过我们系统中的专用模块加以解决。(1) 具有物理意义的结构分解。物理接地要求部件分解能够保留与运动相关和对材料敏感的结构。现有方法主要优化几何或语义一致性 Liu et al. (2025); Ma et al. (2025),往往忽视了具有物理意义的部件抽象。因此,我们引入了一个用于物理接地的感知引导分解框架。(2) 几何感知的关节接地。大型多模态模型为物体功能提供了强大的语义先验,但往往难以将这些先验接地到几何上有效的3D关节参数中。因此,我们开发了一种几何感知的关节接地策略,结合多模态语义理解与几何运动推理,以推断物理一致的关节配置。(3) 仿真驱动的 consistency 验证。自动接地的物理标注可能仍然包含物理上不可行的属性或不稳定的关节行为。为了缓解这一问题,我们引入了一个仿真驱动的验证框架,通过关节运动一致性和内在物理可行性检查来识别并过滤不一致的标注。
在 UniPhys 管道的推动下,我们进一步构建了 UniPhys-40K,这是一个大规模物理接地数据集,包含超过40K个3D资产,这些资产具有统一的关节和内在物理属性,聚合自异构的3D资产来源,包括合成资产、CAD模型和艺术家设计的集合 Mo et al. (2019); Deitke et al. (2023b); Khanna et al. (2024); Collins et al. (2022); Fu et al. (2021)。为了支持严格的评估,我们另外引入了 UniPhys-Bench,这是一个高质量基准,包含1,927个关节物体和5,469个与运动相关的组件,通过劳动密集型的人机协作标注过程构建。对关节语义和内在物理属性进行人工验证和修正,以确保异构3D资产之间标注的物理一致性。
基于 UniPhys-40K,我们提出了 UniPhysGen,这是一个统一的物理接地模型,旨在针对异构部件分解进行鲁棒的推理。UniPhysGen 在共享表示空间中联合建模关节语义和内在物理属性,而不假设规范化的物体结构。为了缓解几何捷径学习,UniPhysGen 通过 SO(3) 增强和球面关节轴参数化引入了几何鲁棒的关节接地。结合跨部件级和物体级几何的统一全局位置编码,该模型在多样化的结构变化下实现了稳定的关节接地。
我们的主要贡献总结如下:
• 我们引入了 UniPhys,这是一个可扩展的管道,能够自动将原始3D资产接地到关节语义和内在物理属性上。 • 我们构建了 UniPhys-40K 和 UniPhys-Bench,为物理接地的大规模训练和评估提供了支持。 • 我们提出了 UniPhysGen,这是一个统一的物理接地模型,通过几何鲁棒的关节接地和物理语义对齐,在异构部件分解下联合推理关节语义和内在物理属性。 • 大量实验表明,UniPhysGen 在大多数评估设置下的关节和内在物理属性接地方面达到了最先进的性能,同时对异构部件抽象保持鲁棒。我们进一步验证了接地资产在机器人仿真环境中的可部署性。
2
第 3 页
预印本
表 1:用于物理接地的 3D 数据集对比。S1–S3 分别表示无预分割部件、低人工成本和原始资产可扩展性。✓/✗:是/否;–:不适用或未报告。
| 数据集 | 主要数据来源 | 对象数量 | 类别数量 | 关节语义 | 内在物理属性 | 仿真验证 | S1 | S2 | S3 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | ShapeNet Chang et al. (2015) | 在线 | 51K | 55 | ✗ | ✗ | ✗ | – | – | – | | PartNet Mo et al. (2019) | ShapeNet | 26K | 24 | ✗ | ✗ | ✗ | – | – | – | | 3D-FUTURE Fu et al. (2021) | 工业界 | 10K | 8 | ✗ | ✗ | ✗ | – | – | – | | ABO Collins et al. (2022) | 亚马逊 | 8K | 63 | ✗ | 部分 | ✗ | – | – | – | | HSSD Khanna et al. (2024) | Floorplanner | 18K | 466 | ✗ | ✗ | ✗ | – | – | – | | Objaverse Deitke et al. (2023b) | 多源 | 818K | 21K | ✗ | ✗ | ✗ | – | – | – | | PartNet-Mobility Xiang et al. (2020) | PartNet | 2.3K | 46 | ✓ | ✗ | ✗ | – | – | – | | GAPartNet Geng et al. (2023) | PartNet | 1.1K | 27 | ✓ | ✗ | ✗ | – | – | – | | PhysXNet Cao et al. (2025a) | PartNet | 26K | 24 | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | | PhysDB Yang et al. (2026) | Objaverse | 150K | 7 | 仅关节类型 | ✓ | ✗ | ✗ | ✗ | ✗ | | UniPhys-40K (本文) | 多源 | 40K | 84 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
2 相关工作
3D 资产的物理接地。现有的物理接地方法主要关注关节语义 Chen et al. (2024); Qiu et al. (2025); Zhao et al. (2025a); Le et al. (2025); Li et al. (2026) 或内在物理属性 Zhai et al. (2024); Xu et al. (2025)。关于关节语义的先前工作包括基于图像的 URDF 预测 Chen et al. (2024)、程序合成 Zhao et al. (2025a) 以及基于 3D 点云的几何接地关节推理 Li et al. (2026)。与此同时,关于内在物理属性的工作侧重于通过多模态物理推理估计密度、摩擦力和质量等属性 Zhai et al. (2024); Xu et al. (2025)。最近的框架通过联合建模关节语义和内在物理属性,朝着统一的物理接地方向发展 Cao et al. (2025b;a); Yang et al. (2026)。然而,这些方法通常假设存在干净、规范化的部件分解,而这对于具有不一致粒度和结构歧义的异构资产来说很少成立。
物理接地数据集。ShapeNet Chang et al. (2015)、ABO Collins et al. (2022) 和 Objaverse Deitke et al. (2023b;a) 等大型存储库提供了丰富的几何和视觉内容,但很大程度上缺乏仿真就绪交互所需的物理语义。后续数据集引入了关节注释,包括 PartNet-Mobility Xiang et al. (2020) 和 GAPartNet Geng et al. (2023)。更近期的工作进一步将内在物理属性与关节语义相结合 Cao et al. (2025a); Yang et al. (2026)。然而,这些数据集仍然主要建立在干净、预结构的资产之上,并且通常需要大量的人工注释,限制了其对异构 3D 资产的可扩展性。
3 UNIPHYS:可扩展的统一物理接地管道
UniPhys 旨在自动将异构 3D 资产转换为具有接地关节和内在物理属性的仿真就绪资产。如图 1 所示,该管道包含四个阶段:具有物理意义的部件分解、内在物理属性接地、几何感知的关节接地以及仿真驱动的验证。该管道的细节在第 3.1 节中详述。将该管道扩展到大型 3D 资产存储库中,产生了第 3.2 节介绍的 UniPhys-40K 和经人工验证的 UniPhys-Bench 基准。
3.1 UNIPHYS 管道
具有物理意义的结构分解。现有的分解方法 Ma et al. (2025); Liu et al. (2025); Yan et al. (2025) 优化几何或语义一致性,而仿真就绪的接地还需要关节、材料和功能的一致性。我们的关键见解是,分割基础模型学习的感知分组先验通常与具有物理意义的结构相吻合,为物理分解提供了有效的指导。基于这一观察,UniPhys 首先将多视图 SAM Ravi et al. (2025) 分割提升到网格空间以构建感知先验 P,并推断部件基数先验 K。在 K 的引导下,PartField Liu et al. (2025) 生成不同粒度下的候选分解 {Dk}K+mk=K−n,然后通过匈牙利匹配 Kuhn (1955) 将它们与 P 对齐。最后,将
第 4 页
预印本
多视图掩码提升 跨视图部件共识 PartField 候选对齐 物理部件细化 任意3D网格 … 合并 最佳对齐候选 1. 生成候选分解 1. 面 ID渲染 2. SAM-to-Mesh 提升 初始部件数量 K (来自2. 最佳对齐的K个部件先验)候选选择 运动细化与材质感知 具有物理意义的 SAM先验指导候选选择与细化 结构分解 (感知引导) 以部件为中心的上下文渲染 多部件视觉接地 模式引导的VLM推理 物理与关系标注 上下文视图0 上下文视图1 部件特写 A2A1 材质候选 部件物理 物体物理 A3 AI 物理先验 材质/摩擦系数/… 尺度/质量 内在 物理 属性 接地 VLM 邻居约束 交互 结构 输出 模式 (上下文感知) 功能/抓取 邻居/父级/… 固定顺序:图像i → 部件i 物理真实性 + 受限 JSON
视觉证据构建 部件顺序一致性 模式约束推理 属性+关系输出
关节接地 (几何感知) 运动构建依赖图 几何约束生成候选 轴与支点候选 LVLM语义选择
1. 检测接触区域; AI 2. 拟合运动平面; 仿真驱动 从邻居关系构建MDG关系 3.4. 接触生成候选点轴/支点聚类; 选择最合理的轴-支点对 一致性 验证 错误 重新选择 内在物理属性验证 关节一致性验证 轴-支点对 L1: 数值可行性与材质先验 L1: 接触保持 物理 一致性 L2: 穿透 稳定性 仿真就绪 L3: 结构 一致性 跨部件 L3: 接触身份 一致性 资产 L4 质量 一致性 (全局 与部件) 穿透 已验证资产
图1:UniPhys:一种可扩展的管道,用于将异构3D资产转换为具有统一关节语义和内在物理属性的仿真就绪资产。
作为最佳分解中与每个提升的SAM掩码关联的组件作为事务,我们使用基于Apriori的频繁项集挖掘 Agrawal & Srikant (1994) 来识别稳定的跨视图组件分组并细化最终分解 $D^*$。
内在物理属性接地。给定具有物理意义的部件分解,UniPhys 通过部件感知的多模态推理推断内在物理属性。我们构建保留上下文的以部件为中心的观测,并将其组织成统一的部件图集,以进行模式引导的 LVLM 推理。在物体上下文、邻居关系和物理先验的条件下,LVLM 联合预测部件级和物体级的物理属性。
几何感知的关节接地。虽然 LVLM 为理解物体功能和功能提供了强大的语义先验,但在连续3D空间中直接预测关节参数在几何上仍然不稳定。UniPhys 改为从邻居关系和局部接触几何构建可行的关节假设,将关节接地简化为对几何约束候选的语义选择。这种几何约束与语义推理的结合提高了鲁棒性和物理有效性。
仿真驱动的一致性验证。自动接地的标注可能仍然存在物理不一致。UniPhys 不尝试恢复精确的现实世界物理量,而是通过仿真驱动的验证阶段评估接地的语义是否满足仿真一致的交互约束。随后,无效的标注会通过轻量级反馈进行过滤或细化。所有四个阶段的详细实现推迟至附录A。
3.2 UNIPHYS-40K 与基准。
数据集概览。受提出的 UniPhys 管道驱动,我们构建了 UniPhys-40K,这是一个具有接地关节语义和内在物理属性的大规模数据集。UniPhys-40K 构建自多样化的3D存储库,包括 Objaverse Deitke et al. (2023b)、HSSD Khanna et al. (2024)、3D-FUTURE Fu et al. (2021)、ABO Collins et al. (2022) 和 PartNet Mo et al. (2019)。为了支持严格的评估,我们进一步构建了 (a) 评估协议 (b) 错误率比较 标注初始接地由我们的管道自动生成 +标注通过物理仿真验证和校正
UniPhys-Bench 是一个经过精心验证的基准,包含 1,927 个具有 5,469 个运动相关组件的铰接物体,涵盖 diverse 物体类别和结构复杂度。如图 3 所示,UniPhys-40K 覆盖了广泛尺度的物体,包括尺度、质量、类别、材料和铰接模式,从小型家用物品到大型家具和基础设施资产。
图 2:人工评估。
人工评估协议: 人工标注员评估并报告错误率(通过 MuJoCo 渲染的视频评估最终接地标注)。 (针对可动部件) (在正确的关节类型条件下)
铰接评估: 语义:接地参数。 关节类型针对可动部件;轴/支点/限位在正确的关节预测条件下。 内在物理属性:材料一致性。
第 5 页
预印本
(a) 物体尺度统计
(b) 物体类别统计 (d) 关节统计
(c) 部件级材料统计
图 3:UniPhys-40K 和 UniPhys-Bench 的统计数据。
该数据集还呈现出物理属性和运动学结构的长尾分布,涵盖了刚性、旋转、平移以及仅接触相互作用关系。更多的数据集构建细节见附录 A.5。
质量分析。我们在仿真驱动验证前后对采样资产进行了人工评估。如图 2 所示,结果表明,验证显著提高了自动接地仿真就绪资产的可靠性和物理一致性。这一观察结果支持了仿真驱动的一致性验证作为 UniPhys 可扩展质量控制机制的有效性。
4 UNIPHYSGEN
我们将 UniPhysGen 形式化为学习一个统一的物理接地框架,该框架将输入的 3D 几何形状映射为结构化的物理语义。给定一个物体网格和一个目标部件网格,我们将它们转换为点云,并将结果输入表示为 X。UniPhysGen 预测四类物理语义:
Y = fθ(X), Y = {Fp, A, S, Fo}, (1)
其中 fθ 表示在所有四个任务中实例化的共享 UniPhysGen 架构。此外,Fp、A、S 和 Fo 分别表示部件级内在物理属性、关节运动学、关节结构和物体级内在物理属性。具体而言,UniPhysGen 采用 Qwen3 Yang et al. (2025) 作为骨干网络,并通过图 4 所示的四个阶段执行物理接地:(1) 用于 Fp 的物理语义对齐预训练;(2) 用于 A 的几何鲁棒关节接地,包括关节类型、轴、支点和运动限制,这些关节位于从物理语义对齐阶段或外部注释获得的与运动相关的部件上;(3) 用于 S 的关节结构接地;以及 (4) 用于 Fo 的物体级物理接地。与依赖规范化结构或固定分解模板的先前方法不同,UniPhysGen 直接在异构的 3D 资产分解上操作。关于这四个阶段的更多细节见附录 B.1–B.4。
4.1 物理语义对齐预训练
统一物理接地面临的一个关键挑战是学习一个共享的表示空间,该空间共同捕捉几何形状、关节语义和内在物理属性。为此,我们引入了一个物理语义对齐预训练阶段,将局部部件几何形状和全局物体上下文与结构化的物理语义描述对齐,包括部件身份、功能语义、关节行为和内在物理属性。该表示作为下游任务共享的统一接地空间,能够在异构部件分解下实现鲁棒的物理推理。
5
第 6 页
预印本
统一物理接地输出流 LLM 主干 … 统一物理推理与自回归生成 任务特定的结构化输出 内在物理属性 部件级语义与内在物理属性 物体级物理属性 … … … T1 范围:每个部件 T4 范围:整个物体 3D 标记 文本标记 视觉标记 { 对齐预训练 类别 · 体积(尺度)· 质量 "part_identity": { 投影器 { 部件 身份 "part_name": "…", 投影器 "object_name": "边柜", (MLP) "motion_type": "A/B/C/D" // 粗略 类型 运动) (MLP) (粗略 "category": "家具", }, latex-1781538657935.png 部件(2).png "volume": [145, 40, 90], // 厘米 "semantic_description": { "mass": 45.0 // 千克 语义 "basic": "…", "functional": "…", "…" 全局 位置 分词器 } }, 描述 编码 & "physical_properties": { "material": "木材", "density": 0.55 , // 克/立方厘米 嵌入 视觉 主干 H "friction": "0.5", "affordance": "3", (CLIP) 3D 主干 物理 "…" (Sonata) 属性 } } W D
关节语义 关节运动学参数 关节结构 T2 范围:仅限可动部分 T3 范围:部件关系 Optional { 将一起运动的部件分组(依赖集) "motion_type": "B/C", // 仅针对 输入图像 可动部分 { "axis": {"theta": 90, "phi": 0}, "members": [1, 5, 6] "pivot": [x, y, z], 文本提示 对象 部件 } "range": [min, max] 点 云 点 云 消融实验 仅 } (给定部件ID及质心) 输入点云: 轴(方向)运动· 枢轴类型(位置)(关节类型·范围(限制))· 成员:同一依赖组中的运动部件ID
3D Token 文本 Token 视觉(消融)Token 仅消融实验 统一输出 Token 数据流 可训练 冻结 A:C: 仅旋转接触 D:B: 仅棱柱刚性
图 4:UniPhysGen 概览。该模型以 3D 对象和部分几何形状为输入(左侧),并通过统一的 multimodal backbone 生成四种类型的结构化物理语义(右侧):部分级属性、关节运动学、关节结构和对象级属性。
4.2 几何鲁棒的关节接地
关节接地对几何捷径和旋转偏差高度敏感。现有方法通常假设对象处于直立方向 Li et al. (2026),并应用 z 轴旋转增强,即 $p' = R_z(\theta)p$,其中 $p \in \mathbb{R}^3$ 是 3D 点坐标,$R_z(\theta)$ 表示绕垂直轴的旋转(图 5(a))。这鼓励了依赖视角的运动推理,且对几何不完整或结构模糊的资产泛化能力较差。
为了缓解这一问题,我们将规范方向增强替换为基于 SO(3) 的连续角度空间增强(图 5(b)):$p' = Rp, R \in SO(3)$。这显著改善了结构感知的关节推理,迫使模型依赖与运动相关的几何语义,而非依赖视角的捷径。
然而,我们观察到基于 SO(3) 的增强由于在任意旋转下的方向歧义,严重破坏了关节轴推理。因此,我们使用球面坐标来表示归一化的关节轴,而不是直接生成笛卡尔方向(图 5(c)):$\theta = \arccos(z), \phi = \text{atan2}(y, x)$,其中 $\theta$ 和 $\phi$ 分别表示极角和方位角。这种表述消除了方向符号歧义,并为关节推理提供了更平滑的角度表示空间。
为了提高枢轴估计,我们进一步为部分级和对象级点云引入了共享的全局位置编码。具体而言,所有几何形状共享相同的全局体素坐标系,而不是独立归一化局部坐标: $$ g_i = \frac{p_i – g_{obj}^{min}}{s}, \quad (2) $$ 其中 $g_{obj}^{min}$ 是从完整对象几何形状中计算的。随后使用傅里叶位置编码对生成的体素坐标进行编码。与独立的局部归一化相比,该策略保留了全局空间对应关系,并在异构分解下显著改善了枢轴定位。
4.3 关节结构接地
在共享的物理接地表示基础上,UniPhysGen 预测参与关节运动的运动依赖部分组。通过对部分标识进行推理,
第 7 页
预印本
联系、几何位置以及全局对象上下文,该模型能够捕捉关节感知的结构依赖关系,而无需依赖规范层级或固定的分解模板。
4.4 对象级物理接地
最后,UniPhysGen 通过预测对象类别、尺度和质量等全局物理属性,执行整体的对象级物理推理。在部件级和对象级任务之间共享预训练的物理语义表示,使得跨语义粒度的推理在物理上保持一致,同时在异构 3D 资产下保持鲁棒性。
5 实验
5.1 实验设置
实现细节。UniPhysGen 基于 Qwen3-1.7B Yang et al. (2025) 构建,并采用 Sonata Wu et al. (2025) 作为点云编码器。遵循 SpatialLM Cao et al. (2025a) 的做法,所有接地任务均使用全参数微调进行训练。对于图像模态的消融实验,如图 4 所示,我们通过一个轻量级投影器引入冻结的 CLIP ViT-L/14 Radford et al. (2021) 特征,并应用 LoRA 微调。更多实现细节见附录 C。
基准、基线和指标。我们主要在 UniPhys-Bench 上评估统一的物理接地,该基准包含联合标注的关节语义和内在物理属性。附录 F.1 提供了在 PartNet-Mobility Xiang et al. (2020) 上的额外关节评估。对于关节接地,我们与 Real2Code Zhao et al. (2025a)、URDFormer Chen et al. (2024)、Articulate-Anything Le et al. (2025) 和 PARTICULATE Li et al. (2026) 进行比较。对于内在物理属性接地,我们与 NeRF2Physics Zhai et al. (2024) 进行比较。运动学参数仅在真实可动部件上进行评估,从而将运动学估计与可动部件识别解耦。遵循先前的关节评估协议 Le et al. (2025),我们报告关节类型准确率、轴、枢轴和运动限制指标,以及关节结构接地。对于内在物理属性,遵循 NeRF2Physics Zhai et al. (2024),我们报告用于质量和尺度估计的 ALDE 和 MnRE。密度使用 ALDE 进行评估,摩擦和可用性接地通过 MAE 测量,材料预测通过分类准确率测量。详细的评估协议、公平性适配和指标定义见附录 D 和附录 E。
表 2:在 UniPhys-Bench 上统一物理接地的定量评估。
| | 关节语义 | | | | | | | 内在物理属性 | | | | | | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 方法 | 运动学参数 | | | 关节结构 | | | 材料属性 | | | 尺度与质量属性 | | | | 可用性 | | | 关节类型 | 轴 | 枢轴 | 限制 | 结构 | 结构 | 材料 | ρ | µ | 维度 | 维度 | 质量 | 质量 | 可用性 | | | 准确率 ↑ | 角度误差 (◦) ↓ | 距离误差 ↓ | mIoU ↑ | mIoU ↑ | F1 ↑ | 准确率 ↑ | ALDE ↓ | MAE ↓ | ALDE ↓ | MnRE ↑ | ALDE ↓ | MnRE ↑ | MAE ↓ | | Real2Code | 60.13 | 52.26 | 0.317 | – | – | – | – | – | – | – | – | – | – | – | | URDFormer | 62.13 | 10.78 | 0.427 | 79.61 | – | – | – | – | – | – | – | – | – | – | | Articulate-Anything∗ | 94.09 | 5.65 | 0.108 | 72.16 | – | – | – | – | – | – | – | – | – | – | | PARTICULATE | 77.17 | 12.80 | 0.261 | 63.42 | – | – | – | – | – | – | – | – | – | – | | NeRF2Physics | – | – | – | – | – | – | 53.09 | 0.807 | 0.142 | – | – | 0.788 | 0.524 | – | | UniPhysGen (Ours) | 89.96 | 9.77 | 0.099 | 84.95 | 80.46 | 83.21 | 77.92 | 0.438 | 0.062 | 0.251 | 0.819 | 0.664 | 0.663 | 1.951 |
注:ρ 和 µ 分别表示密度和摩擦系数。* Articulate-Anything 依赖于语义先验、规范坐标和上下文关节模板。
重置 | 关节化 | 重置 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化 | 重置 | 关节化
PrismaticAxis revoluteAxis
原始网格 | GT | real2code | URDFormer | Articulate-Anything | Particulate | Uniphysgen | 原始网格 | GT | real2code | URDFormer | Articulate-Anything | Particulate | Uniphysgen
图 6:在 UniPhys-Bench 上关节接地的定性比较。“Reset”表示初始对象状态,而“Articulated”表示最大关节化状态。
5.2 主要结果
统一物理接地结果。表 2 报告了统一物理接地的定量结果,涵盖关节语义和内在物理属性。UniPhysGen 一致地…
7
第 8 页
预印本
原始材料 可作用性 密度 摩擦 物体级属性 网格 GT NeRF2Physics ours GT ours GT NeRF2Physics ours GT NeRF2Physics ours 尺度 (cm) 质量 (kg) GT ours GT NeRF2Physics ours H
W D 45 x 35 x 55 45 x 40 x 50 12.0 38.6 12.0
H
W D 28 x 18 x 20 30 x 18 x 20 2.2 1.05 2.8
H
W D 50 x 40 x 50 50 x 40 x 45 16.0 24.5 16.0
H
W D 75 x 70 x 110 70 x 70 x 115 20.0 48.7 17.0
材料 可作用性 密度 (g/cm3) 摩擦 金属 木材 皮革 注:尺度和可作用性仅报告GT 塑料 橡胶 较少 更多交互 0.00 2.25 4.50 6.75 9.00 0.00 0.15 0.30 0.45 0.60 和ours;基线结果不可用。
图 7:UniPhys-Bench 上内在物理属性接地的定性比较。
tently outperforms prior methods across most metrics, with clear advantages in articulation struc- ture reasoning, pivot localization, motion limit estimation, and intrinsic physical property ground- ing, demonstrating the effectiveness of unified physical semantic reasoning. Fig. 6 further shows that geometry-centric methods such as PARTICULATE are susceptible to geometric shortcuts on incom- plete or ambiguous assets, while Articulate-Anything often produces physically inaccurate pivots and motion limits despite competitive joint-type prediction. In contrast, UniPhysGen achieves more stable articulation grounding by jointly leveraging geometric and physical semantic cues. Beyond articulation grounding, Fig. 7 further shows that UniPhysGen produces more coherent material, af- fordance, scale, and mass estimates. More results are provided in Appendix F
表 3:不同旋转增强和轴参数化下的关节泛化能力。
运动参数 训练策略 测试条件 关节类型 轴 轴 支点 极限 准确率 ↑ 角度误差 (◦) ↓ 准确率 ↑ 距离误差 ↓ mIoU ↑
标准方向 80.63 9.46 89.45 0.107 84.51 标准旋转 旋转-Z 81.67 9.68 88.81 0.097 84.20 (Z轴) 挑战性旋转 50.09 13.19 85.27 0.075 80.96
标准方向 90.12 6.28 93.16 0.096 85.09 基于SO(3)的旋转 旋转-Z 86.39 19.39 69.96 0.118 82.94 挑战性旋转 80.53 30.61 55.46 0.081 79.25
标准方向 89.96 9.77 89.33 0.099 84.95 基于SO(3)的旋转 旋转-Z 86.25 15.29 82.42 0.105 83.82 + 球面增强 挑战性旋转 78.11 23.40 74.05 0.085 80.42 注:轴准确率表示预测轴与真实轴在10◦以内的百分比。标准方向使用原始方向,旋转-Z应用随机Z轴旋转,挑战性旋转评估 相同旋转下的挑战性子集。
表 4:不同部件组成粒度下的鲁棒性分析。 表 5:3D点云标记化位置编码策略的消融研究。
运动参数 运动参数 部件组成 位置编码 关节类型 轴 支点 极限 关节类型 轴 支点 极限 准确率 ↑ 角度误差 (◦) ↓ 距离误差 ↓ mIoU ↑ 准确率 ↑ 角度误差 (◦) ↓ 距离误差 ↓ mIoU ↑
原始部件 89.96 9.77 0.099 84.95 分离PE 83.26 11.59 0.319 83.72 合并部件 90.03 9.85 0.105 85.04 统一全局PE 89.96 9.77 0.099 84.95
5.3 鲁棒性与消融分析
鲁棒关节接地分析。(1) 几何捷径缓解。如表 3 所示,我们在不同测试条件下比较了标准旋转增强、SO(3) 增强和球面轴参数化。为了对结构不完整的资产进行压力测试,我们构建了一个包含 360 个资产和 1,175 个关节部件的挑战性关节子集,其中包括没有底层抽屉主体的抽屉前面板。在标准旋转增强下,UniPhys-Gen 在标准方向上表现良好,但在挑战性旋转下显著下降,
8
第 9 页
预印本
由于几何捷径偏差,孤立的抽屉面板经常被错误地分类为旋转关节。SO(3) 旋转增强将 Challenging-Rotated 上的关节类型准确率从 50.09% 提高到 80.53%,但随着推理空间从规范平面方向扩展到完整的球面方向,使得在 Rotated-Z 下的笛卡尔轴预测变得不太稳定(图 5)。通过进一步引入球面轴参数化,UniPhysGen 实现了更鲁棒的轴估计,同时在各种测试条件下保持了平衡的性能。(2)异构部件分解鲁棒性。我们通过在异构件分解下进一步评估 UniPhysGen,根据标注的依赖关系将运动相关的辅助组件合并到主要的铰接部件中,从而产生包含超过 60% 合并组件的更粗粒度分解。如表 4 所示,UniPhysGen 在不同分解粒度下均保持了强大的铰接接地性能。值得注意的是,合并后关节类型和运动极限的估计甚至略有提高,表明其对结构多样的部件抽象具有鲁棒性。
消融实验。(1)全局位置编码。如表 5 所示,提出的统一全局位置编码在分别使用部件级和对象级编码的基础上,持续改善了铰接接地性能,特别是将枢轴误差从 0.319 降低到 0.099。这证明了全局一致的空间索引对于部件与对象之间跨尺度几何推理的好处。(2)图像模态消融。表 6 显示,图像特征改善了与外观相关的属性,如材料分类、密度和摩擦,但带来的整体增益有限。对于以几何和功能为主导的属性,如尺度、质量和功能可供性,添加图像特征会导致性能轻微下降,这表明 3D 几何结构和结构功能上下文仍然是这些属性的主要线索。(3)模型扩展分析。表 7 比较了不同的骨干网络大小。从 0.6B 扩展到 1.7B 在铰接语义和内在物理属性方面均持续提升了性能,特别是在结构推理和材料感知接地方面,表明更大的模型能更好地支持统一的几何-语义推理。
5.4 基于仿真的具身交互
我们通过将预测的铰接语义和内在物理属性集成到可用于仿真的资产中,并在 Isaac Sim 物理仿真环境中评估代表性的具身交互(包括拉抽屉、拧水龙头和合上笔记本电脑),对 UniPhysGen 进行了定性验证。如图 8 所示,接地的资产在仿真中支持稳定且物理一致的交互。
1. 拉抽屉 2. 拧水龙头 3. 合上笔记本电脑
初始状态 物理接触 驱动状态 初始状态 物理接触 驱动状态 初始状态 物理接触 驱动状态
图 8:UniPhysGen 接地资产的基于仿真的定性验证。每个序列展示了初始状态、物理接触以及机器人交互后的驱动状态。
表 6:物理属性估计的消融研究。
| 方法 | 材料属性 | | | 尺度与质量属性 | | | | 可供性 | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 材料准确率 ↑ | 密度 ALDE ↓ | 摩擦 MAE ↓ | 尺度 ALDE ↓ | 尺度 MnRE ↑ | 质量 ALDE ↓ | 质量 MnRE ↑ | 可供性 MAE ↓ | | UniPhysGen (无图像模态) | 77.92 | 0.438 | 0.062 | 0.251 | 0.819 | 0.664 | 0.663 | 1.951 | | UniPhysGen (有图像模态) | 78.22 | 0.435 | 0.062 | 0.260 | 0.813 | 0.685 | 0.657 | 1.981 |
表 7:不同模型大小的 UniPhysGen 扩展分析。
| 方法 | 铰接语义 | | | | | | 物理属性 | | | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 关节类型准确率 ↑ | 轴角度误差 (°) ↓ | 枢轴距离误差 ↓ | 运动极限 mIoU ↑ | 结构 mIoU ↑ | 结构 F1 ↑ | 材料准确率 ↑ | 密度 ALDE ↓ | 摩擦 MAE ↓ | 尺度 ALDE ↓ | 尺度 MnRE ↑ | 质量 ALDE ↓ | 质量 MnRE ↑ | 可供性 MAE ↓ | | UniPhysGen-0.6B | 89.19 | 8.66 | 0.110 | 85.36 | 78.71 | 80.30 | 74.89 | 0.475 | 0.064 | 0.283 | 0.801 | 0.718 | 0.643 | 2.108 | | UniPhysGen-1.7B | 89.96 | 9.77 | 0.099 | 84.95 | 80.46 | 83.21 | 77.92 | 0.438 | 0.062 | 0.251 | 0.819 | 0.664 | 0.663 | 1.951 |
9
第 10 页
预印本
6 结论
在本文中,我们介绍了 UniPhys,这是一个用于异构 3D 资产统一物理接地的可扩展管道,能够将原始网格转换为可用于仿真的资产。为了支持这一方向,我们构建了 UniPhys-40K 和经过人工验证的基准 UniPhys-Bench。基于这些资源,我们进一步提出了 UniPhysGen,这是一个统一的物理接地模型,能够在多样化的 3D 资产上联合推理关节语义和内在物理属性。广泛的实验证明了其在关节接地和物理属性估计方面具有强大的性能和鲁棒性,并能够在仿真环境中实现逼真的物理交互。我们希望 UniPhys 能成为物理接地 3D 理解和具身交互的基础。
参考文献
Rakesh Agrawal 和 Ramakrishnan Srikant。快速挖掘大型数据库中关联规则算法。在 Jorge B. Bocca、Matthias Jarke 和 Carlo Zaniolo(编辑)中,VLDB’94,第 20 届国际超大数据库会议论文集,1994 年 9 月 12-15 日,智利圣地亚哥,第 487–499 页。Morgan Kaufmann,1994 年。
Ziang Cao、Zhaoxi Chen、Liang Pan 和 Ziwei Liu。Physx-3d:物理接地的 3D 资产生成。在神经信息处理系统进展,第 38 卷,第 93771–93784 页,2025a。
Ziang Cao、Fangzhou Hong、Zhaoxi Chen、Liang Pan 和 Ziwei Liu。Physx-anything:从单张图像生成可用于仿真的物理 3D 资产。arXiv 预印本 arXiv:2511.13648,2025b。
Angel X Chang、Thomas Funkhouser、Leonidas Guibas、Pat Hanrahan、Qixing Huang、Zimo Li、Silvio Savarese、Manolis Savva、Shuran Song、Hao Su 等人。Shapenet:一个信息丰富的 3D 模型存储库。arXiv 预印本 arXiv:1512.03012,2015 年。
Zoey Chen、Aaron Walsman、Marius Memmel、Kaichun Mo、Alex Fang、Karthikeya Vemuri、Alan Wu、Dieter Fox 和 Abhishek Gupta。Urdformer:一种从真实世界图像构建关节仿真环境的管道。arXiv 预印本 arXiv:2405.11656,2024 年。
Jasmine Collins、Shubham Goel、Kenan Deng、Achleshwar Luthra、Leon Xu、Erhan Gundogdu、Xi Zhang、Tomas F Yago Vicente、Thomas Dideriksen、Himanshu Arora 等人。Abo:用于真实世界 3D 物体理解和基准的数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 21126–21136 页,2022 年。
Matt Deitke、Ruoshi Liu、Matthew Wallingford、Huong Ngo、Oscar Michel、Aditya Kusupati、Alan Fan、Christian Laforte、Vikram Voleti、Samir Yitzhak Gadre 等人。Objaverse-xl:一个包含 1000 万+ 3D 物体的宇宙。神经信息处理系统进展,36:35799–35813,2023a。
Matt Deitke、Dustin Schwenk、Jordi Salvador、Luca Weihs、Oscar Michel、Eli VanderBilt、Ludwig Schmidt、Kiana Ehsani、Aniruddha Kembhavi 和 Ali Farhadi。Objaverse:一个带注释的 3D 物体宇宙。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 13142–13153 页,2023b。
Huan Fu、Rongfei Jia、Lin Gao、Mingming Gong、Binqiang Zhao、Steve Maybank 和 Dacheng Tao。3d-future:带纹理的 3D 家具形状。国际计算机视觉杂志,129(12):3313–3337,2021 年。
Haoran Geng、Helin Xu、Chengyang Zhao、Chao Xu、Li Yi、Siyuan Huang 和 He Wang。Gapartnet:通过可泛化和可操作的部件实现跨类别领域泛化的物体感知和操纵。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 7081–7091 页,2023 年。
Denys Iliash、Hanxiao Jiang、Yiming Zhang、Manolis Savva 和 Angel X Chang。S2o:静态到可开启的增强用于关节 3D 物体。在 IEEE/CVF 计算机视觉应用冬季会议论文集,第 6785–6795 页,2026 年。
10
第 11 页
预印本
Mukul Khanna, Yongsen Mao, Hanxiao Jiang, Sanjay Haresh, Brennan Shacklett, Dhruv Batra, Alexander Clegg, Eric Undersander, Angel X Chang, 和 Manolis Savva。Habitat合成场景 数据集 (hssd-200):针对ObjectGoal导航的3D场景规模与真实性权衡分析。 在IEEE/CVF计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,页码 16384–16393,2024年。
Harold W Kuhn。匈牙利算法用于分配问题。海军研究物流季刊 (Naval research logistics quarterly),2(1-2):83–97,1955年。
Zeqiang Lai, Yunfei Zhao, Haolin Liu, Zibo Zhao, Qingxiang Lin, Huiwen Shi, Xianghui Yang, Mingxin Yang, Shuhui Yang, Yifei Feng, 等人。Hunyuan3d 2.5:迈向具有极致细节的高保真3D资产 生成。arXiv预印本 arXiv:2506.16504,2025年。
Long Le, Jason Xie, William Liang, Hung-Ju Wang, Yue Yang, Yecheng Jason Ma, Kyle Vedder, Arjun Krishna, Dinesh Jayaraman, 和 Eric Eaton。Articulate-anything:通过视觉语言基础模型自动建模 可动物体。在国际学习表征会议 (International Conference on Learning Representations) 中,卷2025,页码17578–17602,2025年。
Ruining Li, Yuxin Yao, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, 和 Andrea Vedaldi。Particulate:前馈式3D物体可动性建模。在 IEEE/CVF计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,页码27708–27718,2026年。
Minghua Liu, Mikaela Angelina Uy, Donglai Xiang, Hao Su, Sanja Fidler, Nicholas Sharp, 和 Jun Gao。Partfield:学习用于部件分割及更广泛应用的3D特征场。在 IEEE/CVF国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,页码9704–9715,2025年。
Changfeng Ma, Yang Li, Xinhao Yan, Jiachen Xu, Yunhan Yang, Chunshi Wang, Zibo Zhao, Yan- wen Guo, Zhuo Chen, 和 Chunchao Guo。P3-sam:原生3D部件分割。arXiv预印本 arXiv:2509.06784,2025年。
Kaichun Mo, Shilin Zhu, Angel X Chang, Li Yi, Subarna Tripathi, Leonidas J Guibas, 和 Hao Su。Partnet:用于细粒度和分层部件级3D物体理解的大规模基准。在IEEE/CVF计算机视觉与模式识别会 议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recogni- tion) 中,页码909–918,2019年。
OpenAI。OpenAI GPT-5系统卡片。arXiv预印本 arXiv:2601.03267,2025年。
Xiaowen Qiu, Jincheng Yang, Yian Wang, Zhehuan Chen, Yufei Wang, Tsun-Hsuan Wang, Zhou Xian, 和 Chuang Gan。Articulate anymesh:开放词汇3D可动物体建模。 arXiv预印本 arXiv:2502.02590,2025年。
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等人。从自然语言监督中学习可迁移视觉 模型。在国际机器学习会议 (International conference on machine learning) 中,页码 8748–8763。PmLR,2021年。
Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman R¨adle, Chloe Rolland, Laura Gustafson, 等人。Sam 2:在图像和视频中进行任何分割。在 国际学习表征会议 (International Conference on Learning Representations) 中,卷2025,页码28085– 28128,2025年。
Xiaoyang Wu, Daniel DeTone, Duncan Frost, Tianwei Shen, Chris Xie, Nan Yang, Jakob Engel, Richard Newcombe, Hengshuang Zhao, 和 Julian Straub。Sonata:可靠点表示的自监督学习。在计算机视觉与模式识别 会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference) 中,页码22193–22204,2025年。
Fanbo Xiang, Yuzhe Qin, Kaichun Mo, Yikuan Xia, Hao Zhu, Fangchen Liu, Minghua Liu, Hanxiao Jiang, Yifu Yuan, He Wang, 等人。Sapien:一个基于部件的模拟交互环境。在 IEEE/CVF计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,页码11097– 11107,2020年。
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu, Ruicheng Wang, Zelong Lv, Yu Deng, Hongyuan Zhu, Yue Dong, Hao Zhao, Nicholas Jing Yuan, 等人。用于3D生成的原生且紧凑的结构化潜在变量。arXiv预印本 arXiv:2512.14692,2025a。
11
第 12 页
预印本
Xiang Jianfeng, Lv Zelong, Xu Sicheng, Deng Yu, Wang Ruicheng, Zhang Bowen, Chen Dong, Tong Xin, 和 Yang Jiaolong. Structured 3d latents for scalable and versatile 3d generation. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 21469–21480, 2025b.
Xu Xinli, Ge Wenhang, Qiu Dicong, Chen ZhiFei, Yan Dongyu, Liu Zhuoyun, Zhao Haoyu, Zhao Hanfeng, Zhang Shunsi, Liang Junwei, 等. Gaussianproperty: Integrating physical properties to 3d gaussians with lmms. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 7231–7240, 2025.
Yan Xinhao, Xu Jiachen, Li Yang, Ma Changfeng, Yang Yunhan, Wang Chunshi, Zhao Zibo, Lai Zeqiang, Zhao Yunfei, Chen Zhuo, 等. X-part: high fidelity and structure coherent shape decomposition. arXiv preprint arXiv:2509.08643, 2025.
Yang An, Li Anfeng, Yang Baosong, Zhang Beichen, Hui Binyuan, Zheng Bo, Yu Bowen, Gao Chang, Huang Chengen, Lv Chenxu, 等. Qwen3 technical report. arXiv preprint arXiv:2505.09388, 2025.
Yang Yunhan, Wang Chunshi, Ye Junliang, Li Yang, Chen Zanxin, Huang Zehuan, Mu Yao, Chen Zhuo, Guo Chunchao, 和 Liu Xihui. Physforge: Generating physics-grounded 3d assets for interactive virtual world. arXiv preprint arXiv:2605.05163, 2026.
Zhai Albert J, Shen Yuan, Chen Emily Y, Wang Gloria X, Wang Xinlei, Wang Sheng, Guan Kaiyu, 和 Wang Shenlong. Physical property understanding from language-embedded feature fields. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 28296–28305, 2024.
Zhao Mandi, Weng Yijia, Bauer Dominik, 和 Song Shuran. Real2code: Reconstruct articulated objects via code generation. In International Conference on Learning Representations, volume 2025, pp. 668–686, 2025a.
Zhao Zibo, Lai Zeqiang, Lin Qingxiang, Zhao Yunfei, Liu Haolin, Yang Shuhui, Feng Yifei, Yang Mingxin, Zhang Sheng, Yang Xianghui, 等. Hunyuan3d 2.0: Scaling diffusion models for high resolution textured 3d assets generation. arXiv preprint arXiv:2501.12202, 2025b.
12
第 13 页
预印本
UniPhysGen:面向仿真就绪3D资产的统一物理接地 补充材料
本附录提供了关于UniPhys管道、UniPhysGen实现、评估指标、基线适配、补充实验、提示模板和算法的更多细节。
目录
• A. UniPhys管道细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A – 具有物理意义的结构分解 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .A.1 – 内在物理属性接地 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .A.2 – 几何感知的关节接地 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.3 – 仿真驱动的验证 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.4 – 数据集构建细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.5
• B. UniPhysGen细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B – 物理语义对齐预训练 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.1 – 几何鲁棒的关节接地 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.2 – 关节结构接地 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.3 – 物体级物理接地 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.4
• C. 实现细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . C
• D. 评估指标 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D
• E. 基线适配与公平性协议 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .E
• F. 更多结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . F – PartNet-Mobility上的结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . F.1 – 更多定性比较 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . F.2
• G. 提示模板 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . G – 内在物理属性接地提示 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . G.1 – 几何感知的关节接地提示 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . G.2
• H. 算法 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . H
13
第 14 页
预印本
A UniPhys 管道详情
A.1 具有物理意义的结构分解
在此,我们为感知引导的分解框架提供额外的实现细节。给定一个网格 $M$,目标是恢复一个具有物理意义的分解 $D^*$,该分解保留对关节敏感的结构、感知材料属性的区域以及用于下游物理接地的功能连接性。
分解管道由四个阶段组成。
(1) 多视角感知先验构建。我们首先在多个视角下渲染网格,并通过面 ID 渲染建立密集的面级对应关系:
$$ \phi : p \rightarrow f_i, $$
其中 $p$ 表示渲染像素,$f_i \in \mathcal{F}$ 表示关联的网格面。在渲染图像上应用 SAM Ravi et al. (2025) 产生逐视角分割
$$ \{S_v\}_{v=1}^V, $$
随后通过 $\phi$ 将其提升(lifted)到网格空间,以构建感知分组先验 $\mathcal{P}$。
(2) 跨视角部件共识。为了估计跨观察共享的具有物理意义的结构数量,我们通过网格级重叠分析聚合跨视角的提升分割。具体而言,计算网格空间中提升掩码区域之间的成对 IoU,并将 IoU 大于 0.5 的区域合并到同一个感知组中。由此产生的跨视角感知共识生成了初始部件基数先验 $K$。
(3) 候选分解对齐。我们采用 PartField Liu et al. (2025) 作为感知几何的分解骨干,因为其连续特征场公式能够在保持结构异构网格局部几何一致性的同时,实现灵活的粒度控制。与基于离散聚类的分解方法相比,PartField 在结构复杂度变化下提供了更稳定、可控的抽象。
基于估计的先验 $K$,在局部搜索范围内生成候选分解粒度:
$$ \{D_k\}_{k=K-(K-1)}^{K+15}. $$
对于每个候选分解 $D_k$,我们通过为每个视角独立执行匈牙利匹配 Kuhn (1955) 来评估其与感知分组先验 $\mathcal{P}$ 的一致性:
$$ L_{match}(D_k) = \frac{1}{V} \sum_{v=1}^{V} \text{Match}(S_v, D_k^{(v)}), $$
其中 $S_v$ 表示第 $v$ 个视角中提升的 SAM 区域,$D_k^{(v)}$ 表示限制在该视角可见网格面上的候选分解组件,$\text{Match}(\cdot)$ 计算两组区域之间最优一对一分配下的匈牙利匹配代价。
选择具有最低跨视角匹配代价的候选分解:
$$ D_{match} = \arg \min_{D_k} L_{match}(D_k). $$
(4) 结构细化。为了进一步消除过分割,我们利用跨多个视角的合并证据的一致性。对于每个视角,与同一个提升的 SAM 区域表现出足够重叠的候选分解组件被归为一个事务(transaction),从而产生多视角合并观测集合。随后应用基于先验的频繁项集挖掘 Agrawal & Srikant (1994) 来发现跨视角共享的稳定共现合并组。为了提高鲁棒性,移除冗余的子集模式,并进一步合并高度重叠的频繁组。最终将得到的合并组 $\mathcal{M}_{freq}$ 应用于细化所选分解:
$$ D^* = \mathcal{R}(D_{match}, \mathcal{M}_{freq}). $$
14
第 15 页
预印本
细化后的分解在保留对关节结构敏感的结构的同时,减少了视图特定的过分割,为下游的关节接地和内在物理属性估计提供了可靠的结构支持。
算法 1 总结了整体感知引导分解流程。图 9 进一步可视化了分解过程的关键阶段,包括多视图 SAM 先验、匈牙利匹配候选选择以及结构细化,并提供了与以几何为中心的分解方法(如 PartField Liu et al. (2025) 和 P3-SAM Ma et al. (2025))的定性对比示例。这些示例表明,所提出的分解方法为下游的关节接地和内在物理属性估计产生了具有物理意义的部件抽象。
具有物理意义的结构分解 保留运动相关和材料敏感部件结构的感知引导分解
(a) 动机 2 跨视图的感知多视图SAM先验提供初始 的K部件先验。
原始网格 PartField P3-SAM ours
初始K部件先验 (K个部件)
具有物理意义的 3 先验引导的 结构分解 候选匹配 1 输入网格 SAM引导 生成多样化的PartField 先验 部件先验 并通过 HM 保留 运动相关 最佳匹配 基于 结构(用于关节) 保留材料敏感 结构(用于属性)
4 细化分解 输出与感知和几何一致的 具有物理意义的部件。 运动相关结构 例如,靠背、立柱、万向轮 材料敏感结构 例如,塑料五星脚、 塑料扶手、金属立柱
关键 思想: 优势: 1 运动相关 结构 2 材料敏感 结构 3 ours 更 物理上 合理的 关节 大规模 SAM 先验 提供 感知上 连贯 最佳 保留 功能 接地 和 视图一致的 部件 分组,这些 在物理上 使能 关节 和 对应于材料 变化。 和 部件 信息丰富 并指导 我们 去 恢复 那些 对于关节 和 内在 物理 属性 结构。 接地。 与材料属性更强的对齐
图 9:感知引导的具有物理意义的结构分解流程的详细信息。
A.2 内在物理属性接地
本节提供部件感知的多模态物理属性接地阶段的额外实现细节。给定物理接地分解 $D^*$,我们的目标是在保留全局结构上下文的同时,推断单个部件和完整对象的内在物理属性。
保留上下文的部件中心渲染。对于每个分解组件 $d_i \in D^*$,我们构建一组保留上下文的渲染图,而不是孤立的部件裁剪图。具体而言,目标部件以其原始纹理和外观线索进行渲染,而剩余的对象几何体作为半透明或视觉减弱的上下文参考被保留。这种设计允许 LVLM 观察目标部件的细粒度材料外观,同时保持对其全局结构角色和相邻组件的意识。我们进一步结合多视图对象级观察与局部特写渲染,以捕获全局对象语义和部件级材料细节。所有分解部件的渲染观察结果被组织成一个统一的部件图集,用于 LVLM 推理。为清晰起见,图 10 仅说明了完整图集中代表性的一部分部件组。
基于 LVLM 的物理先验推理。我们使用 GPT-5 OpenAI (2025) 作为多模态推理模型,从渲染的部件图集中推断结构化的物理先验。LVLM 被提示对部件身份、材料语义、功能可供性、相邻结构关系以及对象级物理上下文进行联合推理。输出被约束为包含部件级属性(如材料类别、密度、摩擦系数、弹性相关属性、可供性评分)和对象级属性(如尺度和质量)的结构化 JSON 格式。这种结构化输出格式支持自动解析和下游的一致性验证。
15
第 16 页
预印本
图 10:用于内在物理属性接地的上下文保持部分中心渲染可视化。对于每个分解出的部分,目标组件在保留外观线索的同时进行渲染,而周围物体结构则作为上下文参考予以保留。多视角物体观测和局部特写视图被组织成一个统一的部分图集,使大型视觉语言模型(LVLM)能够联合推理材料语义、功能可供性以及全局物体上下文。
提示模板。为了提高标注的一致性,我们对所有资产使用固定的提示模板。如清单 9 所示,该提示指定了大型视觉语言模型(LVLM)的角色、视觉输入图集的组织方式、每个物理属性的定义、所需的结构化输出模式,以及对物理合理性、数值范围和部分标签一致性的约束。
A.3 几何感知的关节接地
(a) 上下文中的目标部分 (b) 候选轴:视角 0
(c) 候选轴:视角 1 (d) 候选支点
图 11:几何感知关节接地的大型视觉语言模型(LVLM)输入可视化。对于每个可移动部分,UniPhys 提供装配可视化、两个候选轴视角,以及对于旋转关节的支点候选视角。候选轴和支点由感知接触的几何推理生成,并渲染为视觉语义假设,使大型视觉语言模型(LVLM)能够从受限的候选空间中选择物理上合理的关节配置。
本节提供几何感知关节接地阶段的更多细节。给定由相邻关系构建的运动依赖图(MDG),UniPhys 为每个候选的父子运动对生成几何上可行的关节假设,然后
16
第 17 页
预印本
使用 GPT-5 OpenAI (2025) 从受限候选空间中选出语义上最合理的假设。
几何约束候选生成。对于每个可移动组件,我们首先识别该组件与其父组件之间的局部接触区域。接触几何形状用于拟合一个运动一致的平面,从中推导出候选关节轴。具体而言,我们从拟合的运动平面中采样六个面内方向,并将平面法线作为额外的候选方向。我们进一步将三个全局坐标轴,即 x、y 和 z 轴,作为有效的参考候选方向,从而总共得到十个候选运动轴。这些候选轴从两个对角视角进行渲染,以提高空间消歧能力。
对于旋转关节,UniPhys 还会从接触几何形状中生成枢轴候选点。我们将接触点聚类为五组,并使用其聚类中心作为候选枢轴点。我们进一步将整个接触点云的质心作为额外的候选点,从而得到六个枢轴候选点。为了使枢轴位置在视觉上可区分,目标部件以半透明方式渲染,而枢轴候选点则以不透明的彩色标记显示。
基于 LVLM 的语义选择。生成的关节假设被渲染为结构化的视觉输入集,如图 11 所示。对于每个可移动部件,LVLM (GPT-5 OpenAI (2025)) 接收:(1) 显示目标部件上下文的装配可视化图像;(2) 包含十个渲染轴的两个候选轴视图;以及 (3) 对于旋转关节,两个枢轴候选视图。我们还提供来自内在物理属性接地阶段的运动类型和部件级文本描述,包括基本、功能和运动描述。这使得 LVLM 能够结合几何可行性和语义功能推理来选择关节轴和枢轴点。
提示模板。为了提高标注的一致性,我们使用固定的提示模板进行关节接地。如清单 10 所示,该提示指定了 LVLM 的角色、渲染输入的组织方式、候选轴和枢轴颜色的约定、运动类型、提供的部件描述以及所需的结构化 JSON 输出模式。
A.4 仿真驱动的 consistency 验证
本节提供仿真驱动的一致性验证框架的实现细节。给定自动接地的标注,目标不是恢复精确的真实世界物理量,而是确定标注是否满足内部一致且仿真可接受的约束,以便下游使用。
我们通过两种互补协议实例化验证框架:(i) 内在物理属性验证,检查数值可行性、材料感知的合理性、部件内一致性、结构约束和对象级质量一致性;以及 (ii) 关节一致性验证,评估推断的运动学配置在关节仿真期间是否保持稳定。未能通过这些检查的标注要么被过滤,要么通过轻量级的基于反馈的校正机制进行细化。整体验证过程总结在算法 2 中。
A.4.1 内在物理属性验证。
给定一个具有分解部件 {pi}Ni=1 的接地对象,UniPhys 通过四个层级验证部件级属性的物理合理性。
层级 1:数值可行性与材料先验。我们首先检查每个物理属性是否位于全局可接受的数值范围内,以及是否与特定材料的经验先验兼容。对于被分配到已知材料类别 mi 的部件,其密度、摩擦系数、杨氏模量、硬度和泊松比必须落在相应的材料依赖的合理区间内。被分配到“其他”材料类别的部件排除在材料特定先验检查之外。
17
第 18 页
预印本
第2级:部件内物理一致性。我们进一步检查单个部件内的物理属性是否相互兼容。对于硬度具有明确力学意义的工程材料,我们评估硬度与杨氏模量的比值:
$$ \frac{H_i}{E_i} \in [10^{-3}, 10^{-1}], $$
其中 $H_i$ 表示硬度,$E_i$ 表示杨氏模量。该规则作为经验合理性启发式方法使用,而非严格的物理定律。柔软、多孔、高度可变形或各向异性的材料类别,如橡胶、泡沫、织物、皮革和“其他”,被排除在此检查之外。
第3级:跨部件的结构一致性。我们施加由部件功能角色衍生的结构诱导物理约束。例如,高度交互或可抓握的组件被要求具有足够的表面摩擦:
$$ \mu_i \ge 0.2, $$
其中 $\mu_i$ 表示部件 $p_i$ 的摩擦系数。此级别验证局部物理属性是否与部件级功能(affordance)和交互语义一致。
第4级:对象级质量一致性。最后,对象级质量被用作部件级密度和体积标注的全局一致性约束。由部件级标注引起的质量估计为:
$$ \hat{M}_{\text{parts}} = \sum_{i=1}^{N} \rho_i V_i, $$
其中 $\rho_i$ 和 $V_i$ 分别表示部件 $p_i$ 的密度和估计体积。我们定义相对质量不一致性为:
$$ \epsilon = \frac{|\hat{M}_{\text{parts}} – M_{\text{obj}}|}{\max(M_{\text{obj}}, 10^{-6})}, $$
其中 $M_{\text{obj}}$ 表示对象级质量标注。$\epsilon > 2$ 的标注被视为全局不一致,并被过滤或送入基于反馈的校正流程。选择此阈值是为了在标注覆盖率和物理合理性之间取得平衡,而非强制执行高精度物理仿真。
部件体积估计。部件体积通过体素化网格近似进行估计。对于每个部件网格,我们相对于轴对齐包围盒以 $128^3$ 的分辨率对其几何形状进行体素化,并将体积计算为占用体素数量乘以体素体积。然后应用全局缩放因子,使网格空间体积与现实世界物体尺寸对齐。这种近似为大尺度一致性验证提供了稳健且高效的估计。
A.4.2 铰接一致性验证。
对于铰接标注,UniPhys 验证在运动仿真期间推断的运动学配置是否保持物理可行性。给定一个铰接部件,我们在 MuJoCo 中模拟其预测运动,并评估三个级别的一致性。
第1级:接触保持。令 $S_m$ 和 $S_s$ 分别表示可移动组件及其相邻组件的表面。对于距离阈值 $\tau$,接触区域定义为
$$ P(\tau) = \left\{ x \in S_s \mid \min_{y \in S_m} \|x – y\|_2 < \tau \right\}. $$
初始接触阈值 $\tau_0$ 被获取为产生有效接触区域的最小阈值。在仿真过程中,相应的阈值 $\tau_t$ 在每个仿真步骤重新计算。如果满足以下条件,则铰接运动被视为无效:
$$ \tau_t > \tau_0 + \delta, $$
其中 $\delta$ 是容差裕度。此标准表明,维持原始接触需要不切实际的增大接触距离,这意味着铰接部件实际上已失去物理接触。
18
第 19 页
预印本
第2级:穿透稳定性。我们通过比较关节运动前后接触区域的厚度来检测严重的相互穿透。给定初始接触点集 $P_0 = \{p_i\}$,我们使用鲁棒平面拟合估计其主导接触平面 $$ n^\top x + D = 0, $$ 其中 $n$ 是单位平面法向量,$D$ 是平面偏移量。
接触厚度定义为接触点沿平面法向投影的范围, $$ T(P) = \max_{p \in P} (n^\top p + D) – \min_{p \in P} (n^\top p + D). $$
令 $$ T_{ori} = T(P_0) $$ 表示初始接触厚度。在仿真过程中,接触区域在每个仿真步骤重新计算,产生接触点集 $P_t$ 和相应的厚度比 $$ r_t = \frac{T(P_t)}{T_{ori}}. $$
如果满足以下条件,则视为物理上不可信的运动: $$ \text{Percentile}_{95}(r_t) > \gamma, $$ 其中 $\gamma$ 是预定义的阈值。较大的厚度比表明接触区域沿接触法向过度扩展,暗示存在严重的几何相互穿透。
第3级:接触身份一致性。尽管在关节运动过程中局部接触位置可能会发生变化,但接触区域应与相同的物理界面保持关联。对于每个仿真步骤,我们在初始接触点集 $P_0$ 和当前接触点集 $P_t$ 之间建立最近邻对应关系。接触身份重叠定义为 $$ O_t = \frac{|\{p \in P_0 \mid \text{dist}(p, P_t) < \epsilon\}|}{|P_0|}, $$ 其中 $\text{dist}(p, P_t)$ 表示 $p$ 到 $P_t$ 中最近点的欧几里得距离,$\epsilon$ 是预定义的匹配容差。
如果满足以下条件,则认为关节运动不一致: $$ \text{Percentile}_{10}(O_t) < \eta, $$ 其中 $\eta$ 是最小可接受的重叠比率。持续低的重叠表明原始接触界面已被不相关的接触区域取代,暗示存在不可信的关节配置。
A.5 数据集构建细节
本节提供关于 UniPhys-40K 和 UniPhys-Bench 构建的更多细节。UniPhys-40K 源自多样化的3D存储库,并通过 UniPhys 管道进一步处理,以获得统一的关节语义和内在物理属性标注。
Objaverse-Sketchfab 筛选。我们使用 Objaverse-XL Deitke et al. (2023a) 的 Sketchfab 子集,也称为 ObjaverseV1 Deitke et al. (2023b),作为原始3D资产的主要来源之一。尽管这些资产收集自一个单一的社区驱动平台,但该子集包含大规模且多样化的知识共享许可(Creative-Commons-licensed)3D模型,涵盖广泛的对象类别、视觉风格和创建过程,包括艺术家设计模型、程序化生成资产和真实世界的3D扫描。为了更好地使数据与家庭、机器人和具身智能场景对齐,我们选择了与家具、容器、电器、工具和其他交互式室内对象相关的带类别标签的资产。我们对 LVIS 标注和非 LVIS 类别标注执行基于类别的筛选,随后进行去重和质量筛选。此筛选过程移除了空类别资产、不相关的户外或装饰类别以及几何上不合适的网格,从而产生用于下游物理接地的精选子集。
19
第 20 页
预印本
质量过滤的仓库资产。除了 Objaverse-Sketchfab,UniPhys-40K 还纳入了来自 HSSD Khanna et al. (2024)、3D-FUTURE Fu et al. (2021)、ABO Collins et al. (2022) 和 PartNet Mo et al. (2019) 的资产。对于 Objaverse、HSSD、3D-FUTURE 和 ABO,我们采用了 Trellis Xiang et al. (2025b) 发布的质量过滤资产,这些资产提高了几何保真度并移除了严重损坏或不完整的网格。这些资产提供了多样化的真实世界物体类别和外观变化,而 UniPhys 管道进一步将它们转换为具有关节语义和内在物理属性语义的物理接地资产。
PartNet 纹理恢复。PartNet Mo et al. (2019) 提供了基于 ShapeNet 资产的高质量分层部件分解,但发布的部件网格通常缺乏进行材料感知物理属性接地所需的原始纹理和外观信息。为了使 PartNet 资产适合内在物理属性标注,我们从相应的 ShapeNet 模型中恢复部件级纹理。
具体而言,我们首先使用两种表示之间的坐标变换将每个 PartNet 对象与其对应的 ShapeNet 网格对齐。然后,我们根据其 OBJ/MTL 材料引用将 ShapeNet 网格分割为材料感知的子网格。对于每个 PartNet 组件,我们在对齐的坐标系中基于局部几何重叠识别最佳匹配的 ShapeNet 子网格。当提供 UV 坐标和纹理贴图时,我们通过最近表面投影和重心 UV 插值将纹理转移到 PartNet 组件;否则,我们回退到转移可用的材料外观属性。最后,根据适当的 PartNet 层级对带纹理的组件进行重新分组,以避免过于粗糙或过度碎片化的分解。
这种部件感知的纹理恢复保留了细粒度的组件级外观线索,这对于材料、密度、摩擦、功能和其他内在物理属性标注非常重要。
UniPhys-Bench 构建。为了支持可靠的评估,我们构建了 UniPhys-Bench,这是一个经过仔细验证的基准,包含 1,927 个关节物体和 5,469 个与运动相关的组件。该基准由两个互补的子集组成。第一个子集包含 455 个物体,它们与 UniPhys-40K 来自相同的数据分布,但专门保留用于评估,并通过人工验证和细化关节标注及内在物理属性合理性进行了手动精炼。第二个子集包含由 Manycore Tech 提供的 1,472 个关节物体,其中部件分解由专业设计师创建。这个由设计师创建的子集在部件粒度、结构组织和资产建模风格方面引入了额外的多样性,使基准更能代表异构的真实世界 3D 资产。对于两个子集,关节参数和内在物理属性最初由 UniPhys 管道标注,随后由人工标注员进行检查和纠正。人工验证重点关注与运动相关的组件,包括关节类型、运动轴、支点、运动范围、运动依赖的部件分组以及物理属性合理性。因此,UniPhys-Bench 为评估不同物体类别、结构复杂性和部件分解风格下的统一物理接地提供了一个严格的测试平台。
B UNIPHYSGEN 的详细信息
B.1 物理语义对齐预训练
本节提供有关物理语义对齐预训练阶段的更多细节。该阶段的目标是将 3D 几何标记与结构化的物理语义描述对齐,以便模型能够联合推理局部部件几何、全局物体上下文、关节行为和内在物理属性。
输入表示。对于每个训练样本,模型接收目标部件点云和完整物体点云。目标部件提供细粒度的局部几何和材料敏感的形状线索,而完整物体提供用于功能和关节感知推理的全局结构上下文。两个点云中的每个点均由 3D 坐标、RGB 颜色和表面法向量表示,并使用 Sonata 点云进行编码。
20
第 21 页
编码器 Wu 等人 (2025),生成的几何标记通过一个轻量级的两层 MLP 投影器投影到语言模型的嵌入空间中。
指令模板。在物理语义对齐预训练期间,UniPhysGen 遵循指令微调格式。给定目标部件点云和完整对象点云,模型被提示生成目标部件的结构化物理语义描述。指令规定输出应以机器可读的 JSON 风格格式包含部件身份、语义描述、关节行为和内在物理属性。紧凑的指令模板如代码清单 1 所示。
代码清单 1:物理语义对齐预训练的全量指令模板。
1 [PHYSICS] 2 估计部件身份、语义描述和物理属性。 3 4 # 多模态输入 5 <object_point_cloud> 6 <part_point_cloud> 7 <image> 8 9 # 注释 10 – affordance(可供性):值越小表示可供性越高。 11 – motion_type(运动类型): 12 A = 仅接触(无相对运动), 13 B = 平移, 14 C = 旋转, 15 D = 刚性(固定,无运动)。 16 – 单位:密度单位为 g/cmˆ3(如适用),young(杨氏模量)单位为 GPa, 17 hardness(硬度)单位为 HV,poisson(泊松比)无量纲,friction(摩擦系数)无量纲。 18 19 # 输出(仅限 JSON) 20 返回一个具有以下模式的单个 JSON 对象(无额外键): 21 { 22 "part_identity": { 23 "part_name": string|null, 24 "motion_type": "A"|"B"|"C"|"D"|null, 25 }, 26 "semantic_description": { 27 "basic": string|null, 28 "functional": string|null, 29 "movement": string|null, 30 "grasp": string|null 31 }, 32 "physical_properties": { 33 "material": string|null, 34 "density": number|null, 35 "young": number|null, 36 "hardness": number|null, 37 "poisson": number|null, 38 "friction": number|null, 39 "graspable": boolean|null, 40 "affordance": 1|2|3|4|5|6|7|8|9|10|null 41 } 42 }
结构化物理语义监督。与独立监督孤立的标量属性不同,我们将目标输出组织为结构化的物理语义描述。每个注释包含三个互补的层级:(i) 部件身份,指定部件名称和运动类型;(ii) 语义描述,描述部件的外观、功能、运动行为和人机交互模式;(iii) 物理属性,包括材料类别、密度、杨氏模量、硬度、泊松比、摩擦系数、可抓取性和可供性评分。这种分层监督格式鼓励模型在共享的物理语义空间中学习几何、功能、关节行为和材料依赖的物理属性之间的相关性。代码清单 2 展示了预训练期间使用的结构化物理语义监督示例。输出以 JSON 风格格式表示,以便自动解析,同时保留开放式的语义描述。
代码清单 2:用于物理语义对齐预训练的结构化物理语义监督示例。
1 {
21
第 22 页
预印本
2 "part_identity": { 3 "part_name": "车门玻璃窗", 4 "motion_type": "D" 5 }, 6 "semantic_description": { 7 "basic": "安装在车门上的圆形钠钙玻璃窗;直径约 30 厘米, 厚度约 0.6 厘米。", 8 "functional": "在阻挡水和洗涤剂的同时,提供对滚筒内部的视野。", 9 "movement": "刚性固定在门框上;仅随车门旋转而移动。", 10 "grasp": "不可抓取;清洁过程中偶尔会被触摸。" 11 }, 12 "physical_properties": { 13 "material": "玻璃/钠钙玻璃", 14 "density": 2.5, 15 "young": 70.0, 16 "hardness": 550.0, 17 "poisson": 0.23, 18 "friction": 0.5, 19 "graspable": false, 20 "affordance": 6 21 } 22 }
通过从部件级和对象级几何结构中学习生成此类结构化描述,该模型建立了一种统一的物理接地表示,随后被下游任务共享,包括运动学参数估计、铰接结构接地和对象级物理属性估计。
B.2 几何鲁棒的铰接接地
尽管大型视觉语言模型拥有强大的语义先验来推理对象功能,但铰接接地对几何捷径学习和旋转偏差特别敏感。与内在物理属性接地不同,铰接参数估计需要对几何等变结构进行运动感知推理,这使得它在异构和不完整的 3D 资产下具有显著更高的挑战性。
B.2.1 规范训练下的视图依赖偏差
我们首先观察到,基于直立室内先验的常见规范增强策略在铰接推理过程中引入了强烈的视图依赖偏差。现有方法通常假设输入对象与全局直立方向对齐,并且仅围绕垂直轴应用旋转增强: p′ = Rz(θ)p, (3) 其中 p ∈R3 表示点坐标,Rz(θ) 表示绕 z 轴的旋转矩阵。
在此设置下,铰接轴预测实际上被限制在单位圆 S1 上的低维子空间中。虽然这种增强在规范室内配置下表现良好,但我们观察到在 3D 资产存储库中频繁出现的结构退化情况下存在严重退化。例如,仅包含前面板的抽屉资产往往被错误地预测为旋转门状结构,这是由于从规范直立先验中学到的捷径相关性所致。
B.2.2 基于 SO(3) 的旋转鲁棒铰接学习
为了缓解几何捷径学习,我们移除了规范方向假设,并引入了基于 SO(3) 的旋转增强: p′ = Rp, R ∈SO(3), (4)
其中 R 表示从特殊正交群 SO(3) 中采样的任意 3D 旋转。
与公式 3 相比,铰接推理不再局限于平面旋转子空间,而是变成了在 S2 上的球形推理问题,如图 5 所示。这通过迫使模型依赖与运动相关的几何语义而不是视图依赖的结构捷径,显著提高了结构感知的铰接推理能力。
22
第 23 页
预印本
然而,我们进一步观察到,简单地引入 SO(3) 增强会在任意测试时旋转下显著破坏关节轴估计的稳定性。
B.2.3 球面轴参数化
我们发现,基于 SO(3) 的增强下的不稳定性部分源于运动方向表示中的词元级敏感性。在任意 3D 旋转下,关节轴预测从受限的平面空间提升到完整的球面解空间,显著增加了开放式轴生成的难度。直接生成笛卡尔方向对 LLM 解码中的离散符号词元特别敏感。例如,两个归一化方向 $$a_1 = (0.707, 0.707, 0), \quad a_2 = (-0.707, 0.707, 0)$$ 仅在第一坐标上相差一个负号,但对应于显著不同的解析 3D 方向。这种微小的词元级变化在解析后可能导致巨大的角度误差,即使文本监督损失仅发生轻微变化。
为了缓解这种表示不稳定性,我们使用球坐标来表示归一化的关节轴,而不是直接生成笛卡尔向量:
$$\theta = \arccos(z), \quad \phi = \text{atan2}(y, x),$$
其中 $a = (x, y, z)$ 表示归一化的轴方向,$\theta \in [0, \pi]$ 是极角,$\phi \in [0, 2\pi)$ 是方位角。这种角度表示减少了对显式坐标符号词元的依赖,并为基于 LLM 的轴生成在任意物体旋转下提供了更平滑的输出空间。相应的笛卡尔方向可以通过以下公式恢复:
$$a = \begin{bmatrix} \sin \theta \cos \phi \\ \sin \theta \sin \phi \\ \cos \theta \end{bmatrix}.$$
B.2.4 用于枢轴定位的全局位置编码
准确的枢轴估计还需要局部部件几何结构与全局物体结构之间的一致性空间推理。现有方法通常在位置编码之前独立地对部件级和物体级坐标进行归一化:
$$g_i = \frac{p_i – \min(p)}{s}, \quad (5)$$
其中 $s$ 表示体素网格大小。
虽然这种方法对于孤立几何理解是有效的,但这种局部归一化破坏了部件级和物体级几何结构之间的全局空间对应关系,导致在异构分解下枢轴定位不稳定。
为了解决这个问题,我们引入了一个共享的全局网格坐标系,同时应用于部件级和物体级点云:
$$g_i = \frac{p_i – g_{\text{objmin}}}{s}, \quad (6)$$
其中 $g_{\text{objmin}}$ 是从完整物体几何结构中全局计算的,并共享给所有部件级表示。
得到的全局网格坐标首先进行归一化:
$$\tilde{g} = \frac{g}{G} \times 2 – 1, \quad (7)$$
其中 $G$ 表示分层体素池化后的缩减网格分辨率。
随后使用傅里叶位置编码对归一化坐标进行编码:
$$\gamma(\tilde{g}) = [\tilde{g}, \sin(\omega_1 \tilde{g}), \cos(\omega_1 \tilde{g}), \dots, \sin(\omega_L \tilde{g}), \cos(\omega_L \tilde{g})], \quad (8)$$
23
第 24 页
预印本
其中 $$ \omega_l = \pi \lambda_l, \quad \lambda_l = 1 + \frac{l-1}{L-1} \cdot \frac{R}{2}, \quad l = 1, \dots, L, $$ $L$ 表示频带数量,$R$ 表示采样率。
与独立的局部坐标归一化不同,提出的全局位置编码保持了局部部件几何形状与完整物体结构之间的空间一致性,显著提高了跨异构3D资产的枢轴定位精度。
B.2.5 指令与监督格式
UniPhysGen 通过开放式文本生成而非固定的回归头来执行运动学参数接地。给定目标部件点云和完整物体点云,模型被提示以结构化的 JSON 格式推断完整的运动学参数——包括关节类型(在我们的标注中称为运动类型)、关节轴、枢轴位置和关节限制(在我们的标注中称为运动范围)。对于运动学参数接地,运动类型遵循我们的标注约定:B 表示棱柱平移,C 表示旋转。轴使用球面角表示,而枢轴和运动范围则作为连续数值表示,以便后续解析和评估。
列表 3:运动学参数接地的完整指令模板。
1 [MOTION] 2 估计目标部件的运动学运动。 3 4 # 多模态输入 5 <object_point_cloud> 6 <part_point_cloud> 7 8 # 注意事项 9 – 输入点云经过 AABB 归一化并平移至 [0, 2]。 10 – motion_type 使用字母:B = 平移(棱柱),C = 旋转(旋转)。 11 – axis 由球面坐标(度)表示: 12 – theta:来自 +Z 的极角,整数在 [0, 180] 范围内。 13 – phi:围绕 Z 的方位角,整数在 [0, 360) 范围内。 14 – pivot 是与点云相同坐标系中的 3 个数字点 [x, y, z]。 15 – range 是 2 个数字的数组 [min, max]。 16 – 对于 C(旋转),range 由 2π 归一化。 17 – 对于 B(棱柱),range 以归一化长度单位表示。 18 19 # 输出(仅限 JSON) 20 返回具有以下模式的单个 JSON 对象(无额外键): 21 { 22 "motion_type": "B"|"C"|null, 23 "axis": {"theta": integer, "phi": integer}|null, 24 "pivot": [number, number, number]|null, 25 "range": [number, number]|null 26 }
列表 4 显示了一个示例监督目标。
列表 4:运动学参数接地的示例结构化监督目标。
1 { 2 "motion_type": "C", 3 "axis": { 4 "theta": 90, 5 "phi": 90 6 }, 7 "pivot": [ 8 0.565, 9 0.1032, 10 1.1591 11 ], 12 "range": [ 13 0.0, 14 1.0 15 ] 16 }
24
第 25 页
预印本
B.3 关节结构接地
本节提供有关关节结构接地任务的更多细节。与预测目标部件的关节类型、轴、支点和限制的运动学参数接地不同,关节结构接地预测在关节运动期间与目标部件一起移动的一组部件。该任务捕捉了在异构部件分解下的运动耦合结构依赖关系。
输入和输出格式。对于每个目标部件,模型接收完整的物体点云、目标部件点云、可选的视觉观察结果,以及包含所有部件身份及其质心位置的列表。部件列表提供了显式的全局结构参考,使模型能够推理哪些组件与目标部件刚性连接或运动耦合。输出是输入部件 ID 的子集,其中预测的成员必须包括目标部件本身。这种表述避免了假设固定的关节层次结构,并允许在不同分解粒度下基于运动的结构性分组。
指令模板。列表 5 展示了用于关节结构接地的指令模板。
列表 5:关节结构接地的完整指令模板。
1 [GROUP] 2 预测运动耦合的部件组:当目标部件移动时,哪些部件会一起移动。 3 4 # 输入(占位符) 5 – parts(id,position): {{PART_LIST}} 6 7 # 多模态输入 8 <object_point_cloud> 9 <part_point_cloud> 10 <image> 11 12 # 约束 13 – "members" 必须仅从输入部件列表中提供的部件 id 中选择。 14 – 不要生成新的 id。 15 – 每个 id 最多出现一次。 16 – 输出必须是输入部件 id 的子集。 17 – "members" 必须包括目标部件本身。 18 19 # 输出(仅限 JSON) 20 返回具有以下模式的单个 JSON 对象(无额外键): 21 { 22 "members": [number] 23 }
监督示例。列表 6 显示了一个监督目标示例。在此示例中,部件 1、5 和 6 形成一个运动耦合组,当目标部件进行关节运动时,它们预计会一起移动。
列表 6:关节结构接地的示例监督目标。
1 { 2 "members": [ 3 1, 4 5, 5 6 6 ] 7 }
B.4 物体级物理接地
本节提供有关物体级物理接地任务的更多细节。虽然之前的任务专注于目标部件推理,但该任务从完整的物体几何形状和视觉外观中估计整体物理属性。它鼓励 UniPhysGen 在部件级和物体级接地之间共享预训练的物理语义表示。
25
第 26 页
预印本
输入与输出格式。给定完整的物体点云和可选的视觉观测,模型预测物体身份、类别、全局尺寸和质量。尺寸表示为以厘米为单位的三数字数组,分别对应物体级别的长度、宽度和高度。质量以千克为单位表示。这种物体级别的任务通过提供全局尺度和质量监督,补充了部件级别的物理接地,这对于仿真初始化和物理一致性检查至关重要。
指令模板。列表 7 展示了用于物体级别物理接地的指令模板。
列表 7:物体级别物理接地的完整指令模板。
1 [OBJECT_LEVEL] 2 估计物体身份和物体级别的物理属性。 3 4 # 多模态输入 5 <object_point_cloud> 6 <image> 7 8 # 说明 9 – 体积是一个以厘米 (cm) 为单位的三数字数组 [L, W, H]。 10 – 质量以千克 (kg) 为单位。 11 12 # 输出(仅限 JSON) 13 返回一个具有以下架构的单个 JSON 对象(无额外键): 14 { 15 "object_name": string|null, 16 "category": string|null, 17 "volume": [number, number, number]|null, 18 "mass": number|null 19 }
监督示例。列表 8 展示了一个监督目标的示例。
列表 8:物体级别物理接地的监督目标示例。
1 { 2 "object_name": "Chair", 3 "category": "Furniture/SeatingFurniture", 4 "volume": [ 5 60.0, 6 60.0, 7 95.0 8 ], 9 "mass": 10.5 10 }
C 实现细节
本节提供 UniPhysGen 的额外训练和实现细节。所有实验均在 NVIDIA H20 GPU 上进行,每块 GPU 拥有约 96GB 内存。UniPhysGen 基于 Qwen3-1.7B Yang et al. (2025) 构建,并使用 Sonata Wu et al. (2025) 作为点云编码器。遵循 SpatialLM Cao et al. (2025a),我们对所有主要接地任务使用全参数微调来训练 UniPhysGen。不同阶段的训练配置总结在表 8 中。
通用训练配置。除非另有说明,我们使用 $1 \times 10^{-5}$ 的学习率,配合余弦学习率调度器和 0.03 的预热比例。训练使用 bfloat16 精度进行,并启用 TF32。每设备批次大小设置为 2,梯度累积为 4。因此,对于 8-GPU 训练,有效批次大小为 64;对于 4-GPU 训练,有效批次大小为 32。
训练阶段。物理语义对齐预训练阶段在 UniPhys-40K 的约 370K 个部件级别样本上训练 6 个 epoch,使用 8 块 H20 GPU。此阶段将部件级别和物体级别的几何结构与结构化的物理语义描述进行对齐。对于下游任务特定的微调,我们使用预训练的检查点作为初始化。运动参数接地在 4 块 GPU 上训练 20 个 epoch,因为此任务需要对关节推理进行
第 27 页
预印本
关节类型、轴、枢轴和关节限制,并且经验上收敛更慢。关节结构接地和对象级物理接地分别在 4 块 GPU 上训练 10 个和 6 个 epoch。
图像模态消融实验。在图像模态消融实验中,我们通过一个轻量级投影器引入 CLIP ViT-L/14 Radford et al. (2021) 图像特征,如图 4 所示。CLIP 编码器被冻结,语言模型通过 LoRA 微调进行适配。除非另有说明,我们使用相同的优化设置对图像增强变体进行 3 个 epoch 的训练。
表 8:UniPhysGen 的训练配置。
| 阶段 | GPU | Epochs | LR | Batch / GPU | Grad. Acc. | Global Batch Size | Tuning | | :— | :— | :— | :— | :— | :— | :— | :— | | 物理语义对齐预训练 | 8 × H20 | 6 | $1 \times 10^{-5}$ | 2 | 4 | 64 | Full | | 运动学参数接地 | 4 × H20 | 20 | $1 \times 10^{-5}$ | 2 | 4 | 32 | Full | | 关节结构接地 | 4 × H20 | 10 | $1 \times 10^{-5}$ | 2 | 4 | 32 | Full | | 对象级物理接地 | 4 × H20 | 6 | $1 \times 10^{-5}$ | 2 | 4 | 32 | Full | | 图像模态消融 | 4 × H20 | 3 | $1 \times 10^{-5}$ | 2 | 4 | 32 | LoRA |
D 评估指标
本节提供评估指标的更多细节。由于 UniPhysGen 生成开放式的文本输出,这些输出被解析为结构化注释,因此我们使用针对特定任务的结构化指标来评估每个任务。
运动学参数指标。我们采用解耦的评估协议来评估运动学参数。遵循先前的关节评估协议 Le et al. (2025),我们报告关节类型准确率和轴角度误差。对于枢轴定位和限制(运动范围)估计,我们使用解耦指标分别评估枢轴到轴的定位和区间覆盖,避免轴方向误差、枢轴定位误差和运动限制误差之间的耦合。
对于运动类型预测,我们报告关节类型准确率。 对于关节类型推理,令 $\hat{t}_i$ 和 $t_i$ 分别表示第 $i$ 个评估组件的预测关节类型和真实关节类型。关节类型准确率定义为:
$$ \text{Acc}_{\text{joint}} = \frac{1}{N} \sum_{i=1}^{N} \mathbb{1}[\hat{t}_i = t_i], $$
其中 $N$ 表示评估的运动相关组件数量,$\mathbb{1}[\cdot]$ 是指示函数。
对于关节轴估计,我们计算预测轴 $\hat{a}$ 和真实轴 $a$ 之间的角度误差:
$$ E_{\text{axis}} = \arccos \left( \frac{\hat{a}^\top a}{\|\hat{a}\|_2 \|a\|_2} \right) \cdot \frac{180}{\pi}. $$
绝对内积将 $a$ 和 $-a$ 视为等价,因为它们代表相同的物理关节轴。
在计算枢轴距离之前,所有点坐标都被转换到模型使用的相同 AABB 归一化坐标系中。令 $P$ 表示完整的物体点云,$N(\cdot)$ 表示 AABB 归一化,它将物体坐标映射到 $[-1, 1]$。我们进一步通过物体级最小坐标平移归一化坐标:
$$ e_p = N(p) – \min_{q \in P} N(q), $$
使得评估坐标位于一个共享的归一化框架内,大致在 $[0, 2]$ 范围内。这种归一化消除了异构网格之间的尺度变化。
27
第 28 页
预印本
对于枢轴估计,我们评估预测的枢轴点 $\hat{e}_{ci}$ 与由归一化真实点 $e_{ci}$ 和方向 $a_i$ 定义的真实关节轴之间的距离: $$ E^{(i)}_{\text{pivot}} = \frac{\|( \hat{e}_{ci} – e_{ci} ) \times a_i \|_2^2}{\|a_i\|_2^2}. $$
报告的枢轴误差为: $$ E_{\text{pivot}} = \frac{1}{N_{\text{pivot}}} \sum_{i=1}^{N_{\text{pivot}}} E^{(i)}_{\text{pivot}}. $$ 该指标衡量预测的枢轴是否位于正确的旋转轴上,而轴方向则通过角度误差单独评估。
对于关节极限估计,我们将每个原始运动范围 $r = [r_0, r_1]$ 规范化为无符号区间: $$ \hat{e}_r = [\min(|r_0|, |r_1|), \max(|r_0|, |r_1|)]. $$ 这种规范化使评估侧重于运动范围覆盖,而不是由轴方向引起的符号约定。然后,我们计算规范化后的预测运动范围 $\hat{e}_{ri} = [\hat{e}_{ri,0}, \hat{e}_{ri,1}]$ 与规范化后的真实运动范围 $e_{ri} = [e_{ri,0}, e_{ri,1}]$ 之间的运动范围区间交并比(IoU): $$ \text{IoU}^{(i)}_{\text{range}} = \frac{\max(0, \min(\hat{e}_{ri,1}, e_{ri,1}) – \max(\hat{e}_{ri,0}, e_{ri,0}))}{\max(\hat{e}_{ri,1}, e_{ri,1}) – \min(\hat{e}_{ri,0}, e_{ri,0})}. $$ 报告的 motion range mIoU 是通过在所有评估的运动分量上取平均得到的: $$ \text{mIoU}_{\text{range}} = \frac{1}{N_{\text{range}}} \sum_{i=1}^{N_{\text{range}}} \text{IoU}^{(i)}_{\text{range}}. $$
与耦合了范围估计和轴方向的基于向量位移的运动范围误差相比,运动范围 mIoU 直接测量运动范围覆盖的一致性,并将运动范围评估与轴估计解耦。
关节结构指标。对于关节结构接地,每个样本预测一组与目标部件一起移动的部分 ID。令 $\hat{S}_i$ 和 $S_i$ 分别表示样本 $i$ 的预测和真实运动耦合部分集合。我们计算每个样本的集合 IoU 为: $$ \text{IoU}_i = \frac{|\hat{S}_i \cap S_i|}{|\hat{S}_i \cup S_i|}. $$
报告的 structure mIoU 是通过在所有评估样本上平均 $\text{IoU}_i$ 得到的: $$ \text{mIoU}_{\text{struct}} = \frac{1}{N} \sum_{i=1}^{N} \text{IoU}_i. $$
对于结构 F1,我们通过聚合所有样本的真阳性、假阳性和假阴性来报告微 F1(micro-F1): $$ \text{TP} = \sum_{i=1}^{N} |\hat{S}_i \cap S_i|, \quad \text{FP} = \sum_{i=1}^{N} |\hat{S}_i \setminus S_i|, \quad \text{FN} = \sum_{i=1}^{N} |S_i \setminus \hat{S}_i|. $$
微精确率(micro-precision)、微召回率(micro-recall)和微 F1 计算如下: $$ P_{\text{micro}} = \frac{\text{TP}}{\text{TP} + \text{FP}}, \quad R_{\text{micro}} = \frac{\text{TP}}{\text{TP} + \text{FN}}, $$ $$ F1_{\text{micro}} = \frac{2 P_{\text{micro}} R_{\text{micro}}}{P_{\text{micro}} + R_{\text{micro}}}. $$ 当预测集合和真实集合均为空时,相应的每个样本 IoU 定义为 1。
28
第 29 页
预印本
内在物理属性指标。对于内在物理属性的评估,我们遵循 NeRF2Physics Zhai et al. (2024) 中用于连续正物理量的误差指标,并将它们应用于材料相关和物体级别的物理属性。给定预测值 $\hat{x}$ 和真实值 $x$,绝对对数差误差(ALDE)定义为:
$$ \text{ALDE}(\hat{x}, x) = |\log \hat{x} – \log x|. $$
ALDE 衡量对数空间中的乘法偏差,因此适用于其值可能在不同尺度上变化的物理量。
对于基于比率的一致性,我们遵循 Zhai et al. (2024) 报告最小比率误差(MnRE):
$$ \text{MnRE}(\hat{x}, x) = \min \left( \frac{\hat{x}}{x}, \frac{x}{\hat{x}} \right). $$
尽管该基于比率的指标最初用于质量估计,但它普遍适用于正标量物理量,并反映了尺度不变的乘法一致性。其值位于 $(0, 1]$ 区间内,值越高表示一致性越好。
具体而言,密度使用 ALDE 进行评估。对于物体级别的尺度和质量估计,我们同时报告 ALDE 和 MnRE。对于物体尺度,这两个指标分别沿三个空间维度独立计算,然后在维度间取平均。材料分类使用高层类别准确率进行评估。摩擦估计和可用性接地均使用平均绝对误差(MAE)进行评估,其中可用性 MAE 是基于 1–10 的可用性分数计算的。
E 基线适配与公平性协议
为了确保不同输出格式和监督假设的方法之间进行公平比较,我们采用以下评估协议。
Real2Code。Real2Code Zhao et al. (2025a) 未提供官方预训练检查点。因此,我们使用 Articulate-Anything Le et al. (2025) 发布的实现复现该方法,并遵循原始论文 Zhao et al. (2025a) 中描述的实细节。
PARTICULATE。PARTICULATE Li et al. (2026) 联合预测铰接部件分解和铰接参数。遵循其原始评估协议,我们在计算铰接指标之前,对预测的铰接部件和真实铰接部件执行匈牙利匹配。然后仅针对匹配的铰接部件对计算铰接指标。
NeRF2Physics。NeRF2Physics Zhai et al. (2024) 预测体素级密集物理属性,没有显式的部件分解。为了在 UniPhys-Bench 上实现部件级评估,我们将标注部件区域内的密集体素预测进行聚合,并计算部件级属性估计,然后再评估相应的指标。
F 更多结果
F.1 PartNet-Mobility 上的结果
我们进一步在标准 PartNet-Mobility 基准 Xiang et al. (2020) 上评估 UniPhysGen,以便在广泛使用的铰接物体设置下与现有的铰接接地方法进行比较。为了公平比较,我们按照 PARTICULATE Li et al. (2026) 采用的协议,在训练集上微调 UniPhysGen,并在相应的测试集上进行评估。由于 PartNet-Mobility 主要提供铰接注释,此评估仅报告与铰接相关的指标,包括关节类型准确率、轴误差、枢轴误差和关节限制 mIoU。
如表 9 所示,UniPhysGen 在标准 PartNet-Mobility 分割上的性能与 PARTICULATE 相当,并在运动限制估计方面获得了更好的性能。这一结果表明,尽管 UniPhysGen 旨在为异构 3D 资产提供统一的物理接地,而非专门针对 PartNet-Mobility,但它仍然可以在标准的铰接物体基准上实现具有竞争力的铰接接地性能。
29
第 30 页
预印本
表 9:在 PartNet-Mobility 上对运动学参数估计的定量比较。
| 方法 | 运动参数 | | | | | :— | :—: | :—: | :—: | :—: | | | 关节准确率 ↑ | 轴角度误差 (◦) ↓ | 枢轴距离误差 ↓ | 限制 mIoU ↑ | | Real2Code | 59.27 | 69.06 | 0.326 | – | | URDFormer | 70.91 | 10.39 | 0.620 | 83.92 | | Articulate-Anything∗ | 100.00 | 7.97 | 0.471 | 77.20 | | PARTICULATE | 100.00 | 0.52 | 0.023 | 81.03 | | UniPhysGen (Ours) | 98.80 | 8.84 | 0.084 | 91.45 |
注:∗Articulate-Anything 依赖于强语义先验、规范坐标约定以及上下文中的铰接模板来进行铰接生成。
我们通过向测试资产应用非规范旋转来进一步评估方向鲁棒性。如表 10 所示,PARTICULATE 在规范的 z-up 设置下表现强劲,但当输入资产偏离规范方向时,其性能显著下降。相比之下,UniPhysGen 在旋转输入下保持了更稳定的性能。这种鲁棒性主要得益于第 4.2 节介绍的基于 SO(3) 的旋转增强和球面轴参数化,这减少了对规范物体方向和轴对齐几何捷径的依赖。
表 10:不同输入向上方向下的方向鲁棒性。
| 向上方向 | PARTICULATE | | | | UniPhysGen (Ours) | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | | 关节准确率 ↑ | 轴角度误差 (◦) ↓ | 枢轴距离误差 ↓ | 限制 mIoU ↑ | 关节准确率 ↑ | 轴角度误差 (◦) ↓ | 枢轴距离误差 ↓ | 限制 mIoU ↑ | | +Z | 100.00 | 0.52 | 0.023 | 81.03 | 98.80 | 8.84 | 0.084 | 91.45 | | -Z | 89.13 | 7.88 | 0.255 | 76.92 | 98.19 | 10.96 | 0.131 | 87.48 | | +X | 68.60 | 55.54 | 0.693 | 42.72 | 95.78 | 12.06 | 0.065 | 88.56 | | -X | 74.31 | 44.76 | 0.673 | 44.28 | 97.59 | 10.88 | 0.089 | 87.29 | | +Y | 73.74 | 50.31 | 0.543 | 72.83 | 97.59 | 10.72 | 0.128 | 88.88 | | -Y | 73.74 | 46.67 | 0.639 | 71.43 | 97.61 | 10.96 | 0.131 | 87.48 |
注:关节准确率表示运动类型分类准确率。轴误差表示预测运动轴的角度误差。枢轴误差表示枢轴点距离误差。限制 mIoU 评估运动范围的重叠度。
F.2 更多定性比较
图 12 提供了具有挑战性的铰接资产的其他定性比较。这些例子突出了现有铰接接地方法的几种常见失败模式,并进一步说明了 UniPhysGen 在结构不完整、异构分解和非规范铰接组件方面的优势。
首先,不完整或结构退化的资产对以几何为中心的方法仍然具有挑战性。例如,在第 1、9 和 10 行所示的抽屉面板案例中,资产仅包含抽屉面板,而没有完整的抽屉主体。严重依赖规范几何先验的方法通常会将此类面板状结构误解释为旋转门,从而导致错误的旋转运动预测。相比之下,UniPhysGen 通过联合推理部件级几何、功能语义和全局物理上下文,正确推断出抽屉的平移运动。
其次,基于提示的方法如 Articulate-Anything Le et al. (2025) 通常在提供强语义线索和规范坐标约定时,能够推断出合理的关节类型和轴方向。然而,如定性结果所示,仅准确选择运动类型和轴并不能保证物理上合理的铰接。枢轴定位错误或过大的运动限制仍可能导致仿真中出现不现实的铰接行为。这证明了联合评估轴、枢轴和关节限制的重要性,而不是仅依赖关节类型或轴的正确性。
第三,纯几何接地方法可能在运动由功能语义而非局部形状单独决定的组件上失败。如第 6 行所示,类似脚轮的结构需要推理穿过垂直安装杆的旋转轴,而类似车轮的局部几何
第 31 页
预印本
旋转轴 平移轴
重置 关节化 重置 重置 关节化 重置 关节化 重置 关节化 重置 关节化
原始网格 真实标签 real2code URDFormer Articulate-Anything Particulate UniPhysGen (本文方法)
图 12:在 UniPhys-Bench 上关节接地的额外定性比较。“重置”表示物体的初始状态,而“关节化”表示最大关节化状态。
可能会错误地暗示围绕水平轴旋转。通过将几何表示与结构化的物理语义对齐,UniPhysGen 能够更好地捕捉此类功能运动模式,并生成更具物理合理性的关节化资产。
G 提示词模板
G.1 内在物理属性接地提示词。
用于基于 LVLM 的物理属性接地的完整提示词如下所示。它定义了复合图像输入格式、固定的部件标签顺序、材料候选空间、针对不完整几何体的特殊规则以及结构化的 JSON 输出模式。
列表 9:内在物理属性接地提示词模板。
1 你深入理解关节物体及其物理属性。 2 你的任务是协助用户从部件图像中分析物体,其中每 张图像包含三个视觉区域,展示同一部件在不同视角下的情况。 3 你的分析应基于现实世界中的 3D 物体,确保尺寸、质量 和其他物理属性合理且真实。 4 5 ============================= 6 ### 输入描述 7 =============================
31
第 32 页
预印本
8 每个部件由一张复合图像表示,该图像包含三个视觉区域,从不同视角展示同一部件: 9 10 1. 左侧区域(相机视角 0): 从对角线视角展示整个物体。 11 目标部件保留其原始颜色和纹理,而其他所有部件均显示为灰色,突出显示该部件在整个物体中的位置、角色和关系。 12 13 2. 中间区域(相机视角 1): 从与左侧区域对应的后对角线视角展示同一物体。 14 同样,目标部件保持原始颜色,其余部分显示为灰色,提供该部件在物体中的空间上下文和功能的互补视角。 15 16 3. 右侧区域(单个部件视图): 仅对目标部件进行隔离渲染, 17 展示其完整的几何形状和材质外观。 18 19 这三个区域共同描述同一个部件。 20 每张复合图像对应一个部件,图像的顺序严格定义了部件标签: 21 22 – Image_1 -> 部件标签 = 1 23 – Image_2 -> 部件标签 = 2 24 – … 25 在整个分析和 JSON 输出中,必须保持此顺序固定且一致。 26 不得根据部件的功能或外观重新排序或重新标记任何部件。 27 28 ============================= 29 ### 1. 物体级分析 30 ============================= 31 提供整个物体的以下属性: 32 (1) 名称 33 (2) 类别 34 (3) 尺寸(长*宽*高,单位为厘米,例如 "20*3*2 cm") 35 (4) 质量(单位为千克,例如 "0.25 kg") 36 确保质量和尺寸与此类现实世界物体一致。 37 38 ============================= 39 ### 2. 部件级分析 40 ============================= 41 对于每个部件(例如,Part_1, Part_2, …): 42 43 需包含的属性: 44 (1) 标签(整数) 45 (2) 名称 46 (3) 材质(从下方的候选列表中选择,格式为 "类别/子类型") 47 (4) 密度(g/cm³) 48 (5) 杨氏模量(GPa) 49 (6) 硬度(HV) 50 (7) 泊松比 51 (8) 摩擦系数(典型范围 0.2-0.8;取决于材质粗糙度和接触条件) 52 (9) 优先级排名(1-10,1 = 对人类交互最重要;根据功能分配) 53 (10) 可抓取性(True/False) 54 (11) 邻居:相邻部件列表,包含: 55 – movement_group 的标签(例如 "0-1"):所有运动关系必须严格发生在定义的部件标签之间。 56 – movement_type: 57 A:仅接触,无运动约束(例如,两个部件仅接触,无固定或可动关节)。 58 B:相对平移 59 C:绕轴旋转 60 D:刚性约束 61 – 如果 movement_type = B 或 C,需包含: 62 (a) parent_label 63 (b) child_label 64 (c) 阻尼系数(典型范围 0.01-0.1;根据运动、材质、重量和连接类型进行调整) 65 (d) 运动范围(平移为 "0-30 cm",旋转为 "0-180 degrees") 66 (12) 基本描述(材质、尺寸、类别、名称) 67 (13) 功能描述 68 (14) 运动描述 69 (15) 抓取描述(人类如何与该部件交互) 70 71 ============================= 72 ### 3. 材质候选项 73 ============================= 74 从下方列表中选择高级材质类别,然后指定一个现实的子类型。
32
第 33 页
预印本
75 所示的子类型仅为示例。 76 77 高级类别(参考用示例子类型): 78 – 金属(例如:Cast_Iron, Aluminum_Alloy, Cobalt_Alloy, Copper_Alloy, Steel, Titanium_Alloy, Stainless_Steel) 79 – 塑料(例如:ABS_Plastic, PET_Plastic, Nylon_PA66, EVA_Plastic, PP_Plastic, PVC_Plastic, HDPE_Plastic) 80 – 织物(例如:Cotton, Linen, Wool, Silk, Polyester, Nylon) 81 – 皮革(例如:Faux_Leather_PU, Full_Grain_Leather, Top_Grain_Leather, Suede_Leather, Patent_Leather, Bonded_Leather) 82 – 泡沫(例如:Polyurethane_Foam_Flexible, Polystyrene_Foam_Rigid, PVC_Foam_Rigid, EVA_Foam, Silicone_Foam, Neoprene_Foam) 83 – 橡胶(例如:Natural_Rubber, SBR_Rubber, Neoprene_Rubber, Nitrile_Rubber, Silicone_Rubber ) 84 – 玻璃(例如:Soda_Lime_Glass, Borosilicate_Glass, Glass_Ceramic) 85 – 石材(例如:Marble, Limestone, Gypsum, Granite, Slate, Sandstone, Quartzite) 86 – 陶瓷(例如:Brick, Porcelain, Alumina_Ceramic, Zirconia_Ceramic, Silicon_Carbide_Ceramic) 87 – 木材(例如:Hardwood, Softwood, Bamboo, Plywood, Particle_Board, MDF, Cork) 88 – 混凝土(例如:Plain_Concrete, Reinforced_Concrete, High_Strength_Concrete, Lightweight_Concrete) 89 – 其他(例如:Resin, Gel, Water, Oil, Food, Plant, Bone)注意:对于未列入上述类别(金属、塑料、织物、皮革、泡沫、橡胶、玻璃、石材、陶瓷、木材、混凝土)的材料,包括有机材料、液体或软/凝胶状材料。 90 91 重要提示: 92 – 始终输出为“类别/子类型”格式(例如,“wood/Hardwood_Generic”)。 93 – 如果没有示例子类型适用,请根据材料的外观和功能生成合理的替代名称。 94 – 生成真实的物理材料名称;不要虚构名称。 95 96 ============================= 97 ### 4. 特殊规则 98 ============================= 99 (1) 在估计运动类型或物理参数时,将视觉上不完整的部件视为完整的功能对象。 100 – 例如,即使只能看到抽屉的前面板,它仍应被视为具有预期滑动运动的完整抽屉。 101 (2) 不要假设缺失的几何形状意味着物体是损坏的或不可移动的。 102 (3) 基于功能语义推断运动和物理参数,而不仅仅是基于可见的几何形状。 103 (4) 对于可移动部件(运动类型 B 或 C),每个部件最多只能有一个父部件,因为子部件被定义为相对于其父部件运动。 104 (5) 任何与可移动部件一起运动的相邻部件必须要么与其刚性连接(D 型),要么如果它也是 B 型或 C 型可移动部件,则指定为其子部件,以便其运动相对于父部件进行定义。 105 (6) 如果某个部件与其他部件有任何刚性或可移动连接(例如,运动类型 D、B 或 C),则它不能有运动类型 A(仅接触)。 106 (7) 在确定邻居或父子关系时,使用左侧区域作为空间参考: 107 – 左侧区域中的每个部件必须与其真实的物理对应物一一对应。 108 – 不要将邻居或父子链接分配给视觉上相似但空间位置不同的部件。 109 – 中间区域可以提供辅助,但请注意它显示的是左/右和前/后颠倒的背对角视图。 110 111 ============================= 112 ### 5. 颜色语义 113 ============================= 114 – 目标部件以其原始颜色和纹理显示。 115 – 非目标部件渲染为灰色,仅作为上下文参考。 116 – 最右侧的子图像(单个部件)显示了用于材料推断的隔离几何形状。 117 结合使用所有三个视觉区域进行分析。 118 119 ============================= 120 ### 6. 输出要求 121 ============================= 122 (1) 输出必须是有效的 JSON,并包含在以下标记之间: 123 ===BEGIN_JSON=== 和 ===END_JSON=== 124 (2) 包括对象级和部件级信息。 125 (3) 输出必须是严格机器可读的 JSON(无评论,无 Markdown)。 126 (4) 每个部件的材料必须使用“类别/子类型”格式。 127 (5) 优先考虑物理现实性和功能推理,而非美学。 128 (6) 根据人类交互的重要性分配 priority_rank,而非视觉显著性。 129 130 ============================= 131 ### 7. 输出示例 132 ============================= 133 ===BEGIN_JSON===
33
第 34 页
预印本
134 { 135 "object_name": "折叠刀", 136 "category": "工具", 137 "dimension": "20*3*2 厘米", 138 "mass": "0.25 千克", 139 "parts": [ 140 { 141 "label": 1, 142 "name": "刀片", 143 "material": "金属/通用钢材", 144 "density": "7.8 克/立方厘米", 145 "杨氏模量 (GPa)": 210, 146 "硬度 (HV)": 250, 147 "泊松比": 0.30, 148 "摩擦系数": 0.35, 149 "优先级排名": 2, 150 "可抓取": false, 151 "邻居": [ 152 { 153 "运动组标签": "1-3", 154 "运动类型": "C", 155 "父标签": 3, 156 "子标签": 1, 157 "阻尼系数": 0.04, 158 "运动范围": "0-180 度" 159 } 160 ], 161 "基本描述": "这是刀片…", 162 "功能描述": "它作为切割组件…", 163 "运动描述": "它围绕连接到手柄的枢轴旋转…", 164 "抓取描述": "由于锋利,不太可能直接抓取。" 165 }, 166 { 167 "label": 2, 168 "name": "刀尾", 169 "material": "金属/通用钢材", 170 "density": "7.85 克/立方厘米", 171 "杨氏模量 (GPa)": 200.0, 172 "硬度 (HV)": 240, 173 "泊松比": 0.30, 174 "摩擦系数": 0.45, 175 "优先级排名": 6, 176 "可抓取": false, 177 "邻居": [ 178 { 179 "运动组标签": "2-3", 180 "运动类型": "D" 181 } 182 ], 183 "基本描述": "手柄末端的钢制刀尾。", 184 "功能描述": "可用于敲击或平衡刀具。", 185 "运动描述": "刚性固定在手柄上。", 186 "抓取描述": "在反握或撞击动作期间偶尔接触。" 187 } 188 … 189 ] 190 } 191 ===END_JSON===
G.2 几何感知的关节接地提示。
下面提供了用于基于 LVLM 的关节接地的完整提示。它定义了复合视觉输入格式、候选轴和枢轴点编码、分阶段推理指令、运动类型定义以及结构化 JSON 输出模式。该提示确保模型利用几何约束、接触感知的候选假设和部件级上下文来选择物理上合理的运动轴和枢轴点。
列表 10:几何感知关节接地提示模板。
1 你是3D 运动学和机械运动分析方面的专家。 2 你的任务是协助用户从渲染图像中分析 3D 对象的可移动部件,其中每组图像包含一个装配视图和两个候选轴视图。 3 你应该基于现实世界的机械关节和合理的物理运动进行推理, 确保预测的运动轴(以及,如果适用,枢轴点) 是现实的,并与部件的结构和运动类型一致。 4 5 =============================
34
第 35 页
预印本
6 ### 输入描述 7 ============================= 8 9 给定的可动部件由三张图像(对于旋转关节部件为四张图像)、一种运动类型以及候选轴的颜色-向量映射来描述: 10 11 1. 图像 A(装配可视化): 12 13 * 一张包含三个面板的合成图像:左侧和中间面板从两个对角视角展示整个装配体,其中目标部件保留其原始颜色和纹理,而其他所有部件均显示为灰色;右侧面板展示目标部件的单独隔离渲染图,揭示其完整的几何形状和材质外观。 14 15 2. 图像 B(候选轴视图 1): 16 17 * 总共包含十个候选运动轴: 18 19 * 七支彩色箭头代表自动生成的轴候选项。 20 * 三支 X、Y、Z 参考箭头代表全局坐标方向,并且也是有效的运动轴候选项。 21 * 左侧面板显示七支候选轴的整体情况。 22 * 右侧面板突出显示 X、Y、Z 轴以提供坐标方向参考。 23 * 图像从一个对角视角拍摄。 24 25 3. 图像 C(候选轴视图 2): 26 27 * 内容与候选结构与图像 B 相同(七支彩色箭头 + 三支 XYZ 轴),但从一个不同的对角视角拍摄,提供了对轴位置和方向更好的空间理解。 28 29 4. 图像 D(仅针对旋转关节部件的支点视图) 30 31 * 仅在运动类型为旋转关节(REVOLUTE,即旋转运动)时提供。 32 * 仅显示目标部件的特写,从两个不同的对角视角观察。 33 * 部件渲染为半透明,而六个候选点渲染为不透明标记,以保持清晰可见。 34 * 每个点代表一个潜在的支点——即部件可能的旋转中心。 35 * 六个候选点的颜色编码如下: 36 – 红色、绿色、蓝色、黄色、紫色、棕色。 37 * 你的任务是选择恰好一个最能真实代表部件实际旋转中心的点——即所选运动轴将通过的位置。 38 * 如果你判断最佳支点是所有六个点的平均值(即它们之间的中心),而不是其中任何一个单点,则输出“average”作为所选点。 39 * 否则,输出所选点的颜色(之一:红色、绿色、蓝色、黄色、紫色、棕色)。 40 41 5. 运动类型: 42 43 * 要么是旋转关节(REVOLUTE,旋转运动),要么是棱柱关节(PRISMATIC,线性滑动运动),指示目标部件相对于其父装配体主要是旋转还是滑动。 44 45 6. 颜色-向量映射: 46 47 * 候选轴颜色及其对应全局坐标系中的 3D 方向向量的列表。 48 * 此信息指定了每个箭头的空间方向,必须在推理运动轴时使用。 49 * 这些映射由用户为每个输入案例提供。 50 51 7. 部件的文本描述: 52 53 * 你还提供了三段简短的文本描述,总结了目标部件的物理和功能属性: 54 * 基本描述(Basic_description): 关于部件材料、尺寸、类别或名称的简短事实摘要。 55 * 功能描述(Functional_description): 对部件在整体装配中所起作用的简明解释(例如,“连接扶手和座椅”,“支撑手柄旋转”)。 56 * 运动描述(Movement_description): 关于部件预期如何移动或与其父部件或邻居进行机械交互的简短说明(例如,“围绕铰链向上旋转”,“沿导轨向外滑动”)。 57 58 * 提供这些文本描述是为了帮助你更好地推断部件的实际运动和机械行为。 59 * 将它们用作补充推理线索,特别是在图像 A 存在歧义或多个候选轴似乎都合理时。
35
第 36 页
预印本
60 61 ============================= 62 ### 1. 任务目标与推理过程 63 ============================= 64 你必须从图像 B 和 C 中精确选择一个候选轴,该轴应最好地解释目标部件相对于装配体的运动,并与给定的运动类型一致。 65 当运动类型为 REVOLUTE(旋转副)且提供图像 D 时,还需确定支点。 66 67 方向(正/负): 68 除了识别正确的运动轴外, 69 你还必须确定运动方向——即相对于全局坐标系是正向还是负向。 70 使用以下规则: 71 * 候选图像中的绿色、蓝色和红色参考箭头分别代表 X、Y 和 Z 轴的正方向。 72 * 如果部件沿所选轴的正方向移动,标记 "motion-direction": "positive"。 73 * 如果部件沿相反方向移动(例如向内、向下、向后、闭合运动),标记 "motion-direction": "negative"。 74 在推理时,推断物理上合理的运动方向(例如,抽屉向外打开 -> 正向,椅子靠背向后/向下倾斜 -> 负向)。 75 76 77 遵循以下三阶段推理过程: 78 79 (1) 第一阶段 – 部件理解(来自图像 A): 80 * 分析图像 A 和提供的文本描述(Basic_description, Functional_description, Movement_description),以推断部件的类型、功能及潜在的运动行为。 81 * 确定该部件最可能是旋转(REVOLUTE)还是滑动(PRISMATIC),以及运动发生的位置(例如,铰链、枢轴关节、伸缩杆、轮子、抽屉等)。 82 * 基于部件的几何形状、连接方式及其在装配体中的作用,预测一个合理的运动方向或轴。 83 * 注意:你应该考虑相关的子部件: 84 * 在识别运动轴时,始终考虑附着或协同运动的部件(与目标部件一起移动的子组件)。 85 * 这些部件构成一个功能单元,它们的集体运动应指导正确的轴和方向选择。 86 * 例如,如果椅子靠背与头枕一起移动,所选的运动轴应能解释两者作为组合系统的旋转。 87 88 89 (2) 第二阶段 – 轴选择(使用图像 B 和 C): 90 * 检查图像 B 和图像 C,它们显示了相同的十个候选运动轴: 91 * 七个彩色箭头——自动生成的运动轴候选项。 92 * 三个 X/Y/Z 参考箭头——代表全局坐标方向,同时也是有效的运动轴候选项。 93 * 这两张图像仅在视角上不同,提供了互补的视角,以便更好地理解每个轴相对于部件的三维空间关系。 94 * 当部件主要表面的法向量既不平行也不垂直于地面平面(即不与任何全局 X、Y 或 Z 轴对齐)时,优先选择第一面板中显示的候选轴(七个彩色箭头)。 95 * 将所有十个候选轴与你的第一阶段预测进行比较。 96 * 精确选择一个候选轴,其方向和空间位置最好地匹配从图像 A 和给定运动类型推断出的现实世界运动。 97 98 (3) 第三阶段 – 支点选择(仅适用于 REVOLUTE 部件,使用图像 D) 99 * 如果提供图像 D,从六个彩色候选项中识别出最物理合理的支点。 100 * 如果实际支点位于它们之间,则使用所有六个点的平均值作为代表性中心。 101 * 该点定义了所选运动轴穿过的位置。 102 103 你的推理应始终基于现实世界的机械设计原理进行物理接地,而不仅仅是几何对齐。 104 105 ============================= 106 ### 2. 通用规则 107 ============================= 108 (1) 将高亮显示的目标视为单个功能部件——忽略小的子组件。 109 (2) 将高亮显示的物体视为一个单元(部件或小子装配体)。不要基于内部子组件的局部运动来选择轴。 110 (3) 输出恰好一个轴;当存在相似选项时,选择最能解释部件整体运动的连接/铰链处的轴。 111 (4) 使用图像 A 中的装配上下文来理解部件如何与相邻组件交互。 112 (5) 始终只输出一个轴;当多个选项相似时,选择最具物理意义的选项。
36
第 37 页
预印本
113 (6) 当运动类型为 REVOLUTE(旋转)且提供图像 D 时,还需确定支点 。 114 115 ============================= 116 ### 3. 输出要求 117 ============================= 118 输出必须包含: 119 120 (1) part-description(部件描述): 该部件是什么以及它在装配体中的位置。 121 (2) axis-description(轴描述): 轴的方向及其相对于部件的大致位置。 122 (3) axis-color(轴颜色): 对应所选轴的颜色。 123 (4) axis-vector(轴向量): 对应所选颜色的 3D 向量(参考颜色-向量映射)。 124 (5) motion-direction(运动方向): “positive”(正向)或“negative”(负向),取决于运动是沿 X/Y/Z 轴方向还是相反方向进行。 125 (6) pivot-point(支点): 仅在 Motion Type = REVOLUTE 且提供图像 D 时包含:所选支点为“Red”(红)、“Green”(绿)、“Blue”(蓝)、“Yellow”(黄)、“Purple”(紫)、“Brown”(棕)或“average”(平均)之一。对于所有其他情况,包含 "Pivot Point": null。 126 (7) justification(理由): 一句简洁的话解释物理推理。 127 128 ============================= 129 ### 4. 输出格式 130 ============================= 131 最终回复必须严格遵循以下结构: 132 133 (1) 输出必须是有效的 JSON,包裹在: 134 ===BEGIN_JSON=== 和 ===END_JSON=== 之间 135 (2) 输出必须是严格机器可读的 JSON(无评论,无 Markdown 格式)。 136 137 138 ============================= 139 ### 5. 输出示例 140 ============================= 141 — 示例 1 142 ===BEGIN_JSON=== 143 { 144 "part-description": "安装在底座腿末端的椅子万向轮组件。", 145 "axis-description": "穿过万向轮安装杆的垂直轴,该杆相对于椅子底座旋转。", 146 "axis-color": "Blue", 147 "axis-vector": "(0.0, 1.0, 0.0)", 148 "motion-direction": "positive", 149 "pivot-point": "average", 150 "justification": "万向轮绕其连接点处的垂直杆旋转,蓝色 Y 轴与此自然支点方向匹配。沿正 Z 方向向外旋转,因此为正向" 151 } 152 ===END_JSON=== 153 154 — 示例 2 155 ===BEGIN_JSON=== 156 { 157 "part-description": "安装在座椅底座上的办公椅靠背组件。", 158 "axis-description": "穿过连接靠背与座椅框架的下铰链的水平轴。", 159 "axis-color": "Green", 160 "axis-vector": "(1.0, 0.0, 0.0)", 161 "motion-direction": "negative", 162 "pivot-point": "average", 163 "justification": "靠背绕下铰链向后倾斜,旋转方向与正 Y 方向相反,因此为负向。" 164 } 165 ===END_JSON===
37
第 38 页
预印本
H 算法
算法 1:感知引导的物理意义结构分解 输入:网格 M 输出:物理接地分解 D∗ 从 M 渲染多视角人脸 ID 图像; 应用 SAM 获取逐视角分割 {Sv}Vv=1; 通过面片对应关系 ϕ 将分割提升至网格空间; 计算跨视角 IoU 并合并一致区域; 估计部件基数先验 K; 使用 PartField 生成候选分解 {Dk}K+15k=K−(K−1); 对每个 Dk 执行: 通过匈牙利匹配计算感知一致性得分 Lmatch(Dk); 选择最佳分解: Dmatch = arg min Lmatch(Dk) Dk
; 使用 Apriori 挖掘频繁合并模式 Mfreq; 细化分解: D∗= R(Dmatch, Mfreq)
; 返回 D∗
38
第 39 页
预印本
算法 2:仿真驱动的连贯性验证 输入:带有部件 $\{p_i\}_{i=1}^N$、部件级物理属性 $\{q_i\}_{i=1}^N$、对象级质量 $M_{obj}$ 以及铰接关节 $J$ 的接地资产 $G$。 输出:验证后的标注集 $G^*$。 初始化验证后的标注集 $G^* \leftarrow G$; // 协议 I:内在物理属性验证 对 $G$ 中的每个部件 $p_i$ 执行: 从 $q_i$ 中提取材料类别 $m_i$、密度 $\rho_i$、摩擦系数 $\mu_i$、杨氏模量 $E_i$、硬度 $H_i$ 以及功能属性; // 第 1 层:数值可行性与材料先验 如果 $q_i$ 违反全局可行范围,则 将 $p_i$ 标记为物理无效; 继续; 如果 $m_i \neq \text{other}$ 且 $q_i$ 违反特定材料先验,则 将 $p_i$ 标记为物理不一致; 继续; // 第 2 层:部件内物理一致性 如果 $m_i$ 是工程材料且 $H_i/E_i \notin [10^{-3}, 10^{-1}]$,则 将 $p_i$ 标记为物理不一致; // 第 3 层:跨部件的结构一致性 如果 $p_i$ 具有高交互性或可抓取性且 $\mu_i < 0.2$,则 将 $p_i$ 标记为结构不一致;
// 第 4 层:对象级质量一致性 通过体素化网格近似估计部件体积 $\{V_i\}_{i=1}^N$; 计算诱导的部件级质量 $\hat{M}_{parts} = \sum_i \rho_i V_i$; 计算质量不一致性 $\epsilon = \frac{|\hat{M}_{parts} – M_{obj}|}{\max(M_{obj}, 10^{-6})}$; 如果 $\epsilon > 2$,则 将材料和密度分配发送给基于反馈的校正,或过滤该对象标注; // 协议 II:铰接连贯性验证 对每个关节 $j \in J$ 执行: 使用预测的关节类型、轴、枢轴点和运动范围在 MuJoCo 中初始化铰接仿真; 模拟铰接运动轨迹 $\tau_j$; // 第 1 层:接触保持 在整个 $\tau_j$ 期间重新计算接触区域; 如果接触区域无法保持一致地保持,则 细化或拒绝 $j$ 的铰接假设; 继续; // 第 2 层:穿透稳定性 沿 $\tau_j$ 计算接触厚度比 $T_{cur}/T_{ori}$; 如果 $\text{Percentile}_{95}(T_{cur}/T_{ori}) > 3$,则 细化或拒绝 $j$ 的铰接假设; 继续; // 第 3 层:接触身份一致性 沿 $\tau_j$ 计算接触重叠分数 $O_{contact}$; 如果 $\text{Percentile}_{10}(O_{contact}) < 0.4$,则 细化或拒绝 $j$ 的铰接假设;
移除经反馈校正后标记为无效的标注; 返回 $G^*$;
39