快速导读:提出Rest2Art框架,仅从物体的闭合状态(静止状态)观测中,通过跨模型验证和视频扩散模型生成运动假设,重建具有部件级几何和关节参数的铰接物体。
Rest2Art 提出了一个从物体静止状态(闭合状态)观测中重建铰接物体的完整框架。与现有方法需要多个运动状态或已知部件数量不同,Rest2Art 仅依赖单一时相的输入,即可恢复部件级几何和关节参数,将这一病态问题转化为可解任务。
该框架的核心洞察在于:虽然单个预训练模型在静止状态物体上表现不佳,但通过让视觉语言模型(VLM)和分割模型(SAM3)相互校验、迭代优化,可以显著提升部件发现的可靠性;同时,视频扩散模型能够为缺乏运动线索的静止状态提供合理的运动假设,而网格几何约束则进一步筛选和精化这些假设。
英文题目:Rest2Art: Articulated Object Reconstruction from Rest-State Observation
论文出处:arXiv 每日论文精选 · arXiv:2607.27749
原始论文:PDF / 论文页面
这篇论文解决什么问题?
构建交互式数字孪生需要同时恢复物体的3D几何和运动结构。对于铰接物体(如柜子、抽屉、冰箱),这意味着不仅要重建表面形状,还要识别可动部件及其关节参数(旋转轴、平移方向等)。
现有方法普遍依赖多状态观测:Ditto 需要两个状态的点云和已知部件数量,PARIS 需要两个状态的RGB图像,ArtGS 虽然能自动发现部件数量,但仍需两个状态的RGB-D输入。这些方法在实际场景中受限,因为物体常以闭合状态出现,多状态数据难以获取。
从单一静止状态重建铰接物体本质上是一个病态问题——闭合的柜门后可能有任意数量的抽屉,静止的表面不提供任何运动线索。Real2Code 和 Articulate AnyMesh 等少数方法尝试处理静止状态输入,但它们要么依赖可见的部件位移,要么简单串联预训练模型,对噪声敏感且缺乏有效的错误校正机制。
预训练模型(VLM、SAM3、视频扩散模型)各自携带语义和运动先验,但直接应用于静止状态物体时表现不佳:VLM 可能遗漏部件,分割模型在不同视角下结果不一致,视频扩散模型则容易产生幻觉运动(如打开柜门时凭空出现抽屉)。Rest2Art 的关键贡献在于设计了一套机制,让这些不完美的模型相互校正、协同工作。
核心创新
- 首次将静止状态铰接物体重建形式化为病态恢复问题,并提出完整框架。
- 设计VLM与分割模型间的迭代协同优化循环,利用分歧驱动相互校正,并通过置信度加权将验证后的证据提升到网格。
- 提出使用视频扩散模型作为运动假设源,并利用网格几何约束关节参数估计。
- 框架输入无关,可处理多视图、单图像生成和扫描网格等多种输入。
方法概览
Rest2Art以显式网格为中间表示,分三阶段:1) 通过VLM和SAM3的迭代协同优化,利用模型间分歧相互校正,获得部件层次和分割掩码,并基于置信度加权将2D证据提升到网格上;2) 使用视频扩散模型合成铰接视频,提取2D轨迹并拟合刚体关节模型,通过最小化重投影误差和网格几何约束(如穿透惩罚)估计关节参数;3) 将部件补全为可用于物理仿真的体积网格。
- 以显式网格为中间表示:Rest2Art 选择网格而非隐式表示,因为网格便于跨视角投影、几何约束施加和后续物理仿真。多视图输入通过 2D Gaussian Splatting(2DGS)重建为网格,单图像输入则通过图像到3D的生成模型获得网格。
- VLM与SAM3的迭代协同优化(co-refinement):这是框架的核心创新。VLM 预测部件层次树(哪些部件属于同一组、层级关系如何),SAM3 生成2D分割掩码。两者在多个视角上比对:如果 VLM 认为某区域是一个独立部件但 SAM3 未分割出来,则触发 SAM3 在该区域重新分割;反之,如果 SAM3 的分割与 VLM 的层次树冲突,则提示 VLM 修正。这一迭代过程无需人工标注,利用模型间的分歧驱动相互校正。
- 置信度加权提升到网格:协同优化后,每个2D掩码都带有验证置信度。通过多视角反投影,将高置信度的2D证据融合到3D网格上,实现跨视角一致的部件分割。低置信度区域则被抑制,避免错误传播。
- 视频扩散模型合成铰接视频:以静止状态图像为条件,使用 Wan2.2 视频扩散模型生成物体铰接运动的视频。为减少幻觉,论文引入掩码叠加策略——将部件分割掩码作为额外条件输入,使模型更关注可动区域。消融实验表明,该策略将幻觉率从 23.1% 降至 11.5%,准确铰接率从 69.2% 提升至 80.8%。
- 从视频轨迹拟合关节参数:在合成视频中提取2D特征轨迹,然后拟合刚体关节模型。关键约束包括最小化重投影误差和网格几何惩罚(如部件穿透惩罚),确保估计的关节参数在物理上合理。
- 部件补全为体积网格:对于被遮挡的内部几何,Rest2Art 进行近似补全,生成可用于物理仿真的体积网格。论文明确指出这只是近似,无法恢复真实隐藏几何。
- 输入无关的通用设计:框架不依赖特定输入模态。多视图图像、单张RGB图像、甚至已有的扫描网格都可以作为输入,统一处理后输出部件分割和关节参数。
- 计算流程:单次推理约需277秒,主要开销来自多个大型预训练模型的调用,包括 VLM 推理、SAM3 分割、2DGS 重建和视频扩散模型生成。
逐图理解论文
直接使用预训练模型为何失败

图2揭示了直接使用预训练模型的三个典型失败模式:VLM预测的部件层次不完整,SAM3在不同视角下遗漏部件,视频扩散模型在开门时幻觉出并不存在的抽屉。这些失败正是Rest2Art要解决的核心问题。
核心洞察:让模型相互校正

图4详细展示了协同优化的迭代过程:VLM的层次树与SAM3的掩码之间的分歧驱动相互校正,验证后的掩码反投影到网格上实现跨视角一致性。这是框架最核心的技术贡献。
从静止到运动:视频扩散模型提供假设

图3是方法总览,展示了从输入到输出的完整流程:协同优化部件层次与掩码、提升到网格、视频合成与关节估计、内部几何补全。理解这个流程是把握全文逻辑的关键。
网格几何约束精化关节参数

图6展示了关节估计的定性结果,每个例子同时显示预测的静止状态和铰接状态。可以直观评估预测运动与真实运动的吻合程度。
实验如何设计?
- ACD 数据集(Articulated Containers Dataset):包含铰接容器物体的合成数据集,用于评估部件分割和关节估计。关节估计指标包括轴角度误差(Ang.)、位置误差(Pos.)和关节类型准确率(Type)。
- MultiScan 数据集:真实世界RGB-D扫描数据集,包含铰接家具。由于真实扫描质量参差不齐,部分场景无法评估,因此额外报告覆盖率(Cov.)。
- 基线方法包括:两状态重建方法(ArtGS、Ditto)、静止状态生成方法(Singapo、URDFormer)、以及3D部件分割方法(PartField、Find3D、SAMesh)。
- 消融实验覆盖三个关键设计:协同优化的模型选择(GPT-5.2 vs Qwen3-VL 搭配 SAM3)、网格重建后端(2DGS vs 其他方法)、视频生成策略(有无掩码叠加、有无 LoRA 微调)。
- 泛化实验展示框架对单图像输入和扫描网格输入的适应性,验证输入无关设计的有效性。
关键结果与论文证据
- 在 ACD-HSSD 子集上,Rest2Art 达到轴角度误差 11.35°、位置误差 0.85 dm、类型准确率 74.49%;在 ACD-ABO 子集上表现更优,分别为 4.78°、0.20 dm、73.38%(Table 2, p.11)。
- 在真实世界 MultiScan 数据集上,覆盖率为 48.94%,在可评估场景中轴角度误差 17.23°、位置误差 0.26 dm、类型准确率 65.78%(Table 3, p.13)。覆盖率较低反映了真实扫描的挑战性。
- 协同优化显著提升部件发现能力:GPT-5.2 + SAM3 组合使层次树准确率提升 10.2 个百分点至 72.5%;Qwen3-VL + SAM3 组合提升更显著,层次树准确率提升 20.3 个百分点至 72.5%,部件数量准确率提升 16.0 个百分点至 63.8%(Table 4, p.13)。
- 2DGS 作为网格重建后端表现最优,分割 IoU 达 0.97,mAP 达 0.99,关节轴方向误差 3.67°、位置误差 0.154 dm(Table 5, p.14)。
- 视频生成的掩码叠加策略将幻觉率从 23.1% 降至 11.5%,准确铰接率从 69.2% 提升至 80.8%(p.14)。定性结果(Fig. 8, p.14)显示掩码叠加有效抑制了非可动区域的虚假运动。
- 部件分割的定性比较(Fig. 5, p.10)显示 Rest2Art 能分割出真实标注中遗漏的细小部件(如旋钮),边界更精确。
- 关节估计的定性结果(Fig. 6, p.12)展示了预测的静止状态和铰接状态,与真实运动较为一致。
- 泛化实验(Fig. 9, p.15)验证了框架对单图像和扫描网格输入的有效性,输出质量与多视图输入相当。
阅读时需要注意
- 视频生成模型可能产生几何损坏,导致无法提取有效轨迹。在69个测试案例中,有2例因此失败。
- 对于运动幅度微小或铰接不明显的物体(如滑轨抽屉),关节估计精度下降,因为视频扩散模型难以生成可辨识的运动。
- 网格补全仅为近似,无法恢复真实隐藏几何,这限制了在需要精确内部结构的应用中的使用。
- 框架依赖多个大型预训练模型,单次推理约需277秒,计算开销较大,难以满足实时应用需求。
- 在真实世界数据上的覆盖率仅约49%,表明对扫描质量敏感,部分场景因重建质量不足而无法评估。
关联工作
- 两状态重建方法(Ditto、PARIS、ArtGS)在输入充分时表现更好,但其性能下降反映了静止状态设置的固有难度,而非方法本身的缺陷。
- 生成式基线(Singapo、URDFormer)的输出需进行尺度对齐才能评估,其低角度误差部分得益于轴对齐先验,而非真实的运动理解。
- Articulate AnyMesh 同样处理静止状态输入,但采用顺序链接预训练模型的策略,缺乏错误校正机制,对单模型噪声敏感。
- 3D部件分割方法(PartField、Find3D、SAMesh)在静止状态物体上表现不佳,因为它们依赖可见的部件边界或文本查询,而闭合状态下这些线索缺失。