快速导读:SCULPT将部件感知的3D生成建模为减法式组合过程,通过循环的部件-剩余体联合分割预测,从完整物体中逐步提取语义部件并保持整体一致性。
SCULPT提出了一种新的部件感知3D生成范式:减法式组合。与先整体生成再分割、或从预设槽位加性拼装不同,SCULPT从TRELLIS.2生成的完整物体结构化潜变量出发,通过循环的部件-剩余体联合分割预测,逐步从完整物体中提取语义部件,同时保持所有部件在原始物体坐标系中的对齐。
这一设计的核心动机是:现代整体式3D生成器已经学习到腿、轮子、把手等重复子结构及其组合先验,但这些先验被锁在单一不可分割的资产中。SCULPT将分解本身视为生成问题,让部件边界与完整物体在同一个扩散轨迹中共同涌现。
英文题目:SCULPT: Subtractive Composition for 3D Part Generation
论文出处:arXiv 每日论文精选 · arXiv:2608.13541
原始论文:PDF / 论文页面
这篇论文解决什么问题?
部件感知3D生成面临两条技术路线的固有缺陷。后处理分割路线(如PartField、HoloPart)在已生成的完整网格上学习特征场进行分割,部件边界完全由已定形状决定,无法在生成过程中调整几何以适配部件语义。
直接部件生成路线(如Part123、OmniPart)从预设布局或槽位加性合成部件,共享边界容易出现缝隙、穿插和材质不连续。OmniPart虽然规划变长box布局并联合合成部件,是定量比较中最强的直接生成方法,但其部件数量仍受布局规划限制。
一个更接近的公式化方法是UniPart,它同样利用整体生成器中的部件感知先验,但实现为潜变量分割阶段加逐部件扩散,而非显式维护剩余体状态。AutoPartGen则自回归地以整体物体和已生成部件为条件逐部件添加,无显式剩余体约束,且仅建模几何不建模外观。
SCULPT的关键洞察是:如果从完整物体出发,每一步同时预测一个提取部件和更新后的剩余体,那么部件边界与完整物体就能在共享生成轨迹中被共同决定,部件数量由循环展开长度自然决定,而非预设槽位。
核心创新
- 将部件感知3D生成形式化为减法式组合(subtractive composition),把可变基数输出转化为循环的固定签名部件-剩余体分割,部件数量由rollout长度决定而非预设槽位或布局
- 提出分解流Transformer(decomposition flow transformer)实现联合分割预测器,通过图像条件联合去噪和剩余体条件控制,使部件与剩余体在共享轨迹中生成而非独立合成后调和
- 引入原生支撑约束:稀疏支撑组合损失Lcomp、推理时支撑裁剪(clipping)和空剩余体终止,保证预测覆盖当前物体支撑且循环状态不超出被分解物体
- 允许部件与剩余体在接触区域共享非空interface shell(边界体素可同时属于两侧),避免硬体素面分割
方法概览
SCULPT以TRELLIS.2生成完整物体结构化潜变量z0为初始状态,训练联合分割预测器Pθ,在每一步同时去噪生成一个提取部件ẑi和更新后的剩余体zi,仅将剩余体传入下一步,直至剩余体支撑为空或达到安全上限Kmax=24。预测器包含联合去噪分支(从TRELLIS.2初始化)和剩余体条件ControlNet分支(零初始化残差注入),在部件与剩余体的原生稀疏支撑并集上联合处理,允许边界体素重叠(interface shell)。训练使用PartVerse-XL构造的部件-剩余体元组,损失包括rectified-flow损失和稀疏支撑组合损失Lcomp;推理时对预测支撑做阈值化和对当前剩余体的裁剪。
- 初始状态:SCULPT使用TRELLIS.2将条件图像映射为完整物体的结构化潜变量z0,包含稀疏结构、几何、材质三个阶段。联合去噪分支从TRELLIS.2的checkpoint初始化。
- 联合分割预测器Pθ:每一步同时去噪生成一个提取部件ẑi和更新后的剩余体zi,仅将剩余体传入下一步。预测器在部件与剩余体的原生稀疏支撑并集上联合处理,允许边界体素重叠形成interface shell。
- 剩余体条件ControlNet分支:编码当前剩余体并通过零初始化残差注入到DiT块中,将控制信号引入预训练扩散模型,参考了ControlNet的设计。
- 组合损失Lcomp:约束预测部件与剩余体的概率并集覆盖当前输入支撑,防止预测漂移到物体支撑之外。
- 推理时支撑裁剪:对预测支撑做阈值化后,裁剪到当前剩余体支撑内,保证循环状态不超出被分解物体。
- 终止条件:当剩余体稀疏支撑为空或达到安全上限Kmax=24时停止。超出上限时剩余体作为单个额外输出保留。
- 训练数据:使用PartVerse-XL过滤后的37,425个物体、330,455个监督部件-剩余体分割元组,排除与评估集SHA-256匹配的资产。训练时排除了部件token数少于8或多于8192的分割,移除1.5%分割和2.3%资产。
逐图理解论文
失败案例与直觉

图4是定性比较:所有方法使用相同条件图像。注意SCULPT在部件边界和整体一致性上的优势,以及红色框内OmniPart和SCULPT部件重组后的完整物体对比。星号标记的基线使用语义颜色而非生成纹理。
研究缺口与核心区分

图2是方法总览:TRELLIS.2生成完整结构化潜变量z0,每一步联合去噪提取部件(蓝色)和更新剩余体(红色),仅剩余体传入下一步。插图展示ControlNet分支如何编码剩余体并注入零初始化残差。
最强结论

表1是PartObjaverse上的几何对比:SCULPT在部件级、语义组级和物体级的CD上全面占优,但在较粗的F1@.1上略低于TRELLIS.2+PartField,说明优势集中在精细边界。
实验如何设计?
- 评估基准:PartObjaverse,包含200个带实例级和语义级部件标注的网格,由SAMPart3D发布。
- 对比基线:Part123、OmniPart、TRELLIS+PartField、TRELLIS+SAM3D、TRELLIS+PartField+HoloPart、TRELLIS.2+PartField。
- 评估指标:部件级使用匈牙利匹配后的倒角距离(CD)和F1分数,语义组级合并共享语义标签的部件,物体级使用组装后的并集。
- 定性比较:在4张数据集图像、1张text-to-image生成输入和1张真实照片上进行,部分基线以语义颜色渲染而非生成纹理。
- 消融实验:Voxel only(仅适配稀疏结构阶段)、w/o comp. loss(无组合监督)、w/o clipping(无推理裁剪)与完整模型对比。
关键结果与论文证据
- SCULPT在PartObjaverse部件级CD=0.0107,优于TRELLIS.2+PartField的0.0115和OmniPart的0.0136(第11页)。
- SCULPT在语义组级CD=0.0107、F1@.05=0.7614,均为最优(第11页)。
- SCULPT在物体级CD=0.0020、F1@.1=0.9839、F1@.05=0.9212,均为最优(第11页)。
- 相对TRELLIS.2+PartField,SCULPT在部件级、语义组级、物体级CD分别降低7.0%、8.5%、4.8%(第12页)。
- 消融实验显示:Voxel only变体CD从0.0107升至0.0439;w/o comp. loss CD升至0.0279;w/o clipping CD升至0.0260,证明组合损失和推理裁剪各自都不可或缺(第13页)。
- 类均值结果:Human-Shape CD=0.0090,Daily-Used CD=0.0070(最佳类),Buildings & Outdoor CD=0.0142(最差类)(第21页)。
- TRELLIS.2+PartField在较粗的F1@.1指标上略高于SCULPT(部件级0.8897 vs 0.8858),仅在更严格的F1@.05上SCULPT占优,说明SCULPT的优势主要体现在精细边界上。
阅读时需要注意
- rollout安全上限Kmax=24限制了部件数量上限,超出上限时剩余体作为单个额外输出保留而非继续分解。
- 训练数据依赖PartVerse-XL的人工精修部件标注,过滤后仅37,425个物体,规模有限。
- 几何和材质阶段训练时排除了部件token数少于8或多于8192的分割,可能影响极端粒度部件。
- 停止条件依赖固定占用阈值τocc和空支撑检测,缺乏校准的停止机制。
- 未提供材质/纹理的定量评估,仅展示定性结果。
关联工作
- TRELLIS.2是SCULPT的基础生成器,提供结构化潜变量和预训练权重,联合去噪分支从其checkpoint初始化。
- PartVerse-XL与PartObjaverse的部件词汇、边界位置和分解粒度可能不同,评估时未做标签迁移,跨数据集泛化需谨慎解读。
- TRELLIS.2+SAM3D和TRELLIS.2+PartField+HoloPart表现显著差于TRELLIS+对应方法,说明后处理分割对更强生成器的适配存在困难,但这也可能受实现细节影响。
- 定性比较中部分基线(PartField、HoloPart)以语义颜色渲染而非生成纹理,纹理质量对比不完全公平。