三分钟导读:EmbodiedGen V2是一个统一的仿真就绪3D世界引擎,通过代理式生成、交互语义标注和自然语言编辑,将文本/图像转化为可直接用于强化学习和Sim-to-Real部署的可执行物理环境。
英文题目:EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI
论文出处:arXiv 每日论文精选 · arXiv:2607.07459
原始论文:PDF / 论文页面
对应视频标题:EmbodiedGen V2:具身智能仿真环境自动化生成与Sim-to-Real验证|推荐指数:★★★★★
这篇论文解决什么问题?
现有3D生成模型仅产生视觉 plausible 的资产,缺乏物理属性、交互语义和跨模拟器兼容性,导致构建用于具身智能策略训练的“仿真就绪”(sim-ready)环境仍需大量手动工作,限制了闭环学习的可扩展性。
核心创新
- Unified sim-ready representation: 耦合度量几何、物理有效性、交互语义和跨模拟器端口性的共享表示。
- Model-agnostic asset pipeline: 模块化流水线将多种3D生成模型转换为可部署的仿真资产,包含质量门控和自动重试机制。
- Affordance-aware interaction semantics: 自动为生成资产添加部分级交互语义和物理验证的抓取姿态。
- Task-driven world generation: 从自然语言任务解析出Scene Graph,并生成满足物理稳定性和机器人可达性的可执行世界。
- Stateful Vibe Coding: 通过Agent-Skill架构实现基于自然语言的持久化、物理验证的3D世界编辑。
方法概览
系统采用两级表示:对象级(捆绑几何、碰撞、物理参数和affordance)和场景级(Scene Graph)。核心模块包括:1) 仿真就绪资产生成流水线(集成TRELLIS/SAM3D/Hunyuan3D,进行网格修复、凸分解、VLM物理属性恢复);2) Affordance自动标注流水线(P3-SAM分割、VLM语义注释、GraspGen物理验证);3) 任务驱动的世界生成(LLM解析任务为Scene Graph,BFS空间放置);4) Vibe Coding(基于Agent-Skill架构的状态保持自然语言编辑)。
逐图理解论文
核心方法概述

系统采用两级表示:对象级捆绑几何、碰撞、物理参数和Affordance,场景级使用Scene Graph。核心模块包括仿真就绪资产生成流水线、Affordance自动标注、任务驱动的世界生成和Vibe Coding自然语言编辑。所有输出可一致部署于主流模拟器,无需手动适配。
资产生成流水线

资产生成流水线集成TRELLIS、SAM3D或Hunyuan3D等可插拔3D生成后端,进行网格修复、凸分解和VLM物理属性恢复。通过质量门控和自动重试机制,确保输出资产满足仿真要求。该流水线支持从文本或图像输入直接生成可部署的仿真资产。
Affordance自动标注

Affordance自动标注流水线通过P3-SAM进行部分分割,VLM进行语义注释,GraspGen进行物理验证的抓取姿态生成。该流程为生成资产添加部分级交互语义,使机器人能够理解物体的功能性交互区域,如可抓取部位,提升环境交互的真实性。
任务驱动世界生成

任务驱动的世界生成模块利用LLM将自然语言任务解析为Scene Graph,并通过BFS进行空间放置,确保物理稳定性和机器人可达性。该流程生成满足任务约束的交互式世界,包含背景、上下文、操作对象和干扰物,支持大规模多房间场景的自动化构建。
世界生成评估

任务驱动世界生成评估在150个交互式世界上进行,最终环境接受率为83.3%。Scene Graph表示稳定分解开放任务,保持广泛的世界组成多样性。尽管部分世界因对象比例不匹配或局部几何缺陷需手动调整,但整体流程显著减少了人工干预需求。
实验与关键结果
- 资产流水线消融实验:在200个保留资产上评估质量检查器、网格修复和凸分解的影响。
- Affordance标注流水线评估:在200个资产上评估分割后处理和VLM合并对端到端通过率的影响。
- 任务驱动世界生成评估:生成150个交互式世界,评估从任务到图生成、资产实例化到最终世界接受率的各阶段性能。
- 下游闭环验证:引用相关研究[6],评估在生成环境中进行在线RL训练及Sim-to-Real迁移的效果。
- 资产流水线消融实验:在200个保留资产上评估质量检查器、网格修复和凸分解的影响。
- Affordance标注流水线评估:在200个资产上评估分割后处理和VLM合并对端到端通过率的影响。
- 任务驱动世界生成评估:生成150个交互式世界,评估从任务到图生成、资产实例化到最终世界接受率的各阶段性能。
- 下游闭环验证:引用相关研究[6],评估在生成环境中进行在线RL训练及Sim-to-Real迁移的效果。
阅读时需要注意
- 完全在线生成每个世界平均耗时47.7分钟,背景合成是主要瓶颈。
- 剩余16.7%的世界因对象比例不匹配、局部几何缺陷或初始空间放置不稳定而需要手动调整。
- Affordance标注的端到端通过率仅为50%,部分资产无法获得有效的部分级语义或抓取姿态。
- 依赖LLM进行任务分解和语义注释,可能存在语义漂移或幻觉。
- 下游RL结果引用自另一项研究[6],需确认其实验设置与本文生成环境的直接关联性。
- 物理属性(质量、摩擦系数)由VLM推断,可能存在与实际物理特性的偏差。
- 凸分解失败时回退到原始网格,可能导致非凸表面的接触不稳定。
关联工作
- EmbodiedGen V1:前作,提供基础3D内容生成,但缺乏多房间拓扑和交互语义。(第 2 页)
- TRELLIS, SAM3D, Hunyuan3D:作为可插拔的3D生成后端,提供视觉几何基础。(第 3 页)
- Gen2Sim, PhysX-3D:尝试将生成网格与物理参数结合,但未强制执行完整的sim-ready合同。(第 19 页)
- LayoutGPT, Holodeck:基于LLM的场景布局生成,但缺乏物理交互验证和状态保持编辑。(第 19 页)
- P3-SAM:用于3D部分分割的基础模型。(第 6 页)
- SimplerEnv:手工构建的仿真环境,用于对比生成环境的泛化能力。(第 18 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
EmbodiedGen V2:面向具身智能的代理式、仿真就绪(Sim-ready)3D 世界引擎
Xinjie Wang1, Liu Liu1, Taojun Ding1, Andrew Choi1, Chaodong Huang1, Mengao Zhao1, Ziang Li1, Jackson Jiang2, Chunlei Yu2, Shengxiang Liu2, Wei Xu1, Zhizhong Su1 1地平线机器人 (Horizon Robotics), 2WuwenAI
我们提出了 EmbodiedGen V2,这是一个用于构建具身智能可执行仿真就绪(Sim-ready)环境的生成式 3D 世界引擎。尽管仿真就绪 3D 资产生成技术取得了快速进展,但将这些资产组装为策略就绪(policy-ready)的任务环境在很大程度上仍依赖人工操作,这限制了可扩展的闭环学习。EmbodiedGen V2 通过统一的仿真就绪表示法填补了这一空白,该表示法将跨模拟器资产、交互可供性(interaction affordances)、任务驱动的世界、大规模多房间场景以及状态式 Vibe Coding 整合到一个生成式、可编辑且可重用的仿真流水线中。生成的环境支持操作、导航、移动操作、跨模拟器部署以及具身策略训练。在评估中,资产流水线达到了 96.5% 的人类接受率和 98.6% 的碰撞成功率,且 83.3% 的任务驱动世界无需人工修改即可直接用于下游仿真。使用生成式环境进行的在线强化学习进一步将仿真成功率从 9.7% 提升至 79.8%,并在迁移至真实机器人时使任务成功率从 21.7% 提升至 75.0%。这些结果确立了 EmbodiedGen V2 作为训练、评估和部署具身策略的可扩展仿真基础设施的地位。
代码:github.com/HorizonRobotics/EmbodiedGen 网页:horizonrobotics.github.io/EmbodiedGen
任务驱动生成 大规模场景生成 Vibe Coding 3D 世界 意图解析 2026 任务指令 简单 把西兰花放在盘子里。 "创建一个空的餐厅" "在它周围添加一张桌子和四把椅子。" 场景图生成 Jul 背景 代理式世界编译器 8 上下文 [ vibe coding- 模拟器后端 ] 干扰项 IN [技能:房间创建器] [技能:资产创建器] 目标 地板 [技能:资产检索器] [MCP:离线数据集] 机器人 [技能:空间计算] sim.check_stable(scene)
预飞行仿真 开 开 开 开 深度 编译 仿真 修复 通过 中等 ↻自动重试 [cs.RO] 预飞行:发现错误 自动修正
碰撞 无碰撞 悬浮 稳定 资产与可供性生成 比例错误 正确比例 x ✓
最终 3D 世界
法线 仿真就绪环境 把西兰花放在盘子上 把棋子放在棋盘上 把红色方块放入蓝色盒子 困难 在盘子上 在棋盘上 在蓝色盒子里
拿起梨并把它放入篮子 将绿色方块移动到黄色方块上 把木勺子放在盘子上 并放入篮子 在黄色方块上 在盘子上 arXiv:2607.07459v1
分割 跨模拟器的一致碰撞和纹理 Genesis SAPIEN Isaac Sim Isaac Gym MuJoCo Bullet
图 1:EmbodiedGen V2 概述。左侧:通过场景图和带有可供性标注的资产,将自然语言任务转换为仿真就绪场景。中间:不同可控复杂度层级的大规模多房间生成。右侧:Vibe Coding 3D 世界编辑。所有输出均可一致地部署到主流模拟器中。
1
第 2 页
1 引言
生成式 3D 模型在生成视觉上合理的物体和场景方面取得了快速进展,但具身策略学习不仅仅需要视觉 3D 内容。机器人和具身智能体需要可执行的任务环境:物体必须具有物理和交互属性,布局必须满足任务和导航约束,且生成的世界必须能在模拟器之间移植、可编辑,并可用于闭环训练和评估。我们将满足这些要求且无需手动适配即可在物理仿真中直接使用的环境称为仿真就绪(Sim-ready)。尽管最近的流水线在仿真就绪资产和生成式 3D 世界方面取得了重要进展,但为具身任务生成可扩展的仿真就绪环境仍然具有挑战性。关键难点在于将几何、物理、可供性(Affordance)、任务语义和模拟器接口保留在统一的世界表示中,而不是将它们作为单独的后期处理步骤。
基于 EmbodiedGen V1 [1],我们引入了 EmbodiedGen V2,它从生成式 3D 内容工具包发展为用于具身任务环境生成、策略学习和评估的仿真就绪 3D 世界引擎。该系统围绕完整的可执行环境而非孤立的生成产物进行组织。对于大规模世界生成,EmbodiedGen V2 生成具有显式房间拓扑、可通行开口和可单独寻址家具的结构化多房间和整屋场景,克服了 V1 全景图反投影单网格背景中相机平移受限的问题,并支持长视距导航和移动操作。对于资产和交互生成,资产流水线变得可插拔,兼容 TRELLIS [2]、SAM3D [3] 和 Hunyuan3D [4],通过原位场景补全 [5] 接受部分遮挡的图像,为物体增加部件级可供性和经过物理验证的抓取,并将部署扩展到可变形体。对于部署和编辑,EmbodiedGen V2 通过 URDF、包括 MJCF 在内的模拟器 XML 格式以及 USD 为标准模拟器提供标准化导出,而 Vibe Coding 则在持久且经过物理验证的世界状态上提供有状态的自然语言编辑。最后,该系统的评估超越了静态生成质量:生成的环境支持 VLA 策略的在线强化学习和仿真到现实(sim-to-real)的策略迁移 [6, 7]。
综上所述,这些能力将生成式 3D 世界生成与具身策略开发的主要工作流程连接起来。通过在一种表示中保留模拟器可移植性、交互语义、任务条件布局以及可编辑的世界状态,EmbodiedGen V2 支持跨模拟器重用、策略训练、受控的环境变化、策略调试和闭环评估。
我们的主要贡献总结如下:
- 统一的仿真就绪表示。 我们引入了一种共享表示,将度量几何、物理有效性、交互语义和跨模拟器可移植性耦合在一起,为整个生成和编辑流水线提供通用接口。
- 模型无关的仿真资产生成。 我们构建了一个模块化的文本/图像到 3D 资产流水线,将 TRELLIS [2]、SAM3D [3] 和 Hunyuan3D [4] 接入统一的后期处理堆栈,通过质量检查、网格修复、凸分解(Convex Decomposition)、纹理烘焙、物理属性恢复和跨模拟器导出,将原始 3D 输出转换为可部署的仿真资产。
- 感知可供性的交互语义。 我们引入了一种可供性自动标注流水线,为生成的资产增加语义交互属性,将视觉和碰撞感知物体转化为可操作、可验证的仿真实体。我们进一步发布了一个包含 4000 多个资产的集合,提供跨模拟器格式和可供性标注。
- 任务驱动的世界和场景生成。 我们将开放式的自然语言任务解析为场景图(Scene Graph),并通过空间约束和物理稳定性求解生成可执行的交互世界;我们进一步将相同的表示扩展到具有多房间拓扑、可导航空间和实例级可编辑性的大规模场景。
- 用于 3D 世界编辑的有状态 Vibe Coding。 我们通过有状态的智能体-技能框架(agent-skill harness)暴露共享的世界表示,将生成、组合、编辑和导出转化为可组合的技能,从而
第 3 页
自然语言指令转化为对持久化、可部署的世界状态的有界且经物理验证的编辑。
• 闭环策略验证。我们不仅在静态资产和场景质量层面验证生成的环境:下游 VLA/RL 研究 [6] 表明,仅使用 EmbodiedGen V2 生成的环境进行在线微调,可将仿真成功率从 9.7% 提升至 79.8%,真实机器人任务成功率从 21.7% 提升至 75.0%。
2 方法论
2.1 预备知识
我们的目标是生成仿真就绪(Sim-ready)的 3D 世界:产生的世界不仅在视觉上合理,而且能够被具身智能体直接在物理仿真中执行。在本文中,我们使用“仿真就绪”来表示一种输出契约,该契约耦合了四项要求:度量几何、仿真兼容的物理资产、任务级语义与可供性(Affordance),以及标准化的仿真器接口。
EmbodiedGen V2 通过两级表示实例化了这一契约。在对象层面,每个仿真就绪资产捆绑了带纹理的视觉几何体、碰撞几何体、物理参数和可供性标注。在场景层面,一个类型化的 Scene Graph 指定了实体、任务角色——背景、上下文、被操作对象、干扰项以及机器人——及其空间和交互关系,随后这些关系被锚定到目标仿真器中物理稳定的 6-DoF 位姿。以下模块逐步构建这一表示:仿真就绪资产生成创建可部署的对象,可供性自动标注为其丰富交互语义,任务驱动的交互式世界生成和大规模场景生成组合成可执行的世界,而 Vibe Coding 则将同一表示暴露为一种有状态的自然语言编辑接口。
2.2 仿真就绪 3D 资产生成
问题定义。现有的图像到 3D 和文本到 3D 生成模型 [2, 8, 9, 10, 11] 可以产生视觉上合理的 3D 对象,然而它们的输出通常仅具备可视化级别的 3D 可用性,而非仿真级别的资产可用性:网格位于归一化坐标空间中,缺乏真实世界的尺度、质量和摩擦属性,可能包含非流形面或开放表面,并且既没有碰撞表示也没有标准化的仿真接口。我们将仿真就绪资产生成定义为从开放式的文本或图像条件自动产生对象资产的任务,这些资产共同包含仿真兼容的几何体、显式纹理、结构化的物理元数据,以及可供不同物理引擎消费的标准化仿真表示。
流程概述。如图 2 所示,我们提出了一种统一的仿真就绪资产生成流程,通过五个阶段将三种类型的输入——文本提示、无遮挡对象图像和部分遮挡对象图像——映射为标准化的仿真资产:(i) 输入准备:对于文本输入,一个可插拔的文本到图像模型(SD3.5 [12] 或 Kolors [13])生成候选对象图像;对于图像输入(包括遮挡场景),一个前景分割模型(Rembg [14]、SAM [15] 或 RMBG [16])提取目标对象。(ii) 3D 生成:前景图像被输入到一个可插拔的图像到 3D 模型(TRELLIS [2]、SAM3D [3] 或 Hunyuan3D [4]),产生 3D Gaussian [17] 和网格作为中间表示。(iii) 几何细化与纹理烘焙:网格经过拓扑修复和简化,而多视图反投影将 Gaussian 外观烘焙为显式纹理图。(iv) 物理属性恢复:一个视觉-语言模型(VLM)从多视图渲染中推断真实世界的尺度、质量和摩擦系数,随后用于度量重缩放。(v) 仿真资产打包与跨格式导出:几何、外观和物理信息被组装成一个统一的中间表示,并自动转换为不同的仿真器格式。关键在于,我们不将仿真兼容性视为生成后附加的单独导出步骤;相反,面向仿真的质量约束在多个阶段被显式强制执行——候选筛选、3D 生成、
3
第 4 页
1 输入准备 文本提示 图像提示 – 无遮挡物体 图像提示 – 有遮挡物体
带有花卉图案和抛光白色釉面的 陶瓷水果碗
2 3D 生成与质量检查 ↻自动重试 ✓ 语义外观 Trellis Hunyuan3D V3.1 SAM3D x 如果检查失败 ✓ 网格几何 ✓ 跨模态对齐 ✓ 美学质量
RGB 法线 RGB 法线 RGB 金属度 粗糙度 RGB 法线
3 几何与物理细化 ✓ 网格简化 ✓ 网格修复 物理属性 ✓ 凸分解 0.11m 0.04 kg 摩擦系数 语义描述 …
4 跨模拟器导出
URDF 资产转换器 XML USD 标准 SAPIEN Bullet Isaac Gym MuJoCo Genesis Isaac Sim URDF 与 3DGS
图 2:Sim-ready 3D 资产生成流程。从文本或图像输入开始,系统通过输入准备、3D 生成、几何细化与纹理烘焙、基于 VLM 的物理属性恢复以及跨模拟器导出,生成仿真就绪资产。
以及物理恢复——形成闭环的生成-验证-重试流程。
分层质量门控。我们并不依赖单次前向传播来产生最终结果,而是在多个流程阶段嵌入质量门控。在输入阶段,候选图像必须通过前景质量检查(VLM 验证分割的语义正确性和几何完整性);对于文本驱动的路径,系统还会验证生成的图像是否与原始文本意图在语义上保持一致。只有合格的候选者才会进入 3D 生成阶段。在 3D 生成阶段,系统从多视图渲染中评估几何完整性,拒绝截断的几何体、重复的物体以及多余的附加元素;失败时会使用不同的随机种子触发自动重试。在流程末端,美学评分模型 [18] 定量评估纹理和几何质量,过滤掉低于预设阈值的样本。我们将所有质量检查结果作为结构化标签写入最终资产文件中,使得每个资产的质量状态在下游大规模使用中可查询和过滤。
几何处理与物理属性恢复。来自 3D 生成模型的原始网格通常包含非流形面和开放区域,这些与碰撞检测和物理模拟不兼容。在完成拓扑修复和简化后,我们应用 CoACD 算法 [19] 计算近似凸分解,生成一组紧凑的凸碰撞体;如果分解失败,流程将回退到原始网格。在图 2 中,不同的颜色表示分解后的网格
4
第 5 页
图 3:十二件由文本条件生成的服装在 Genesis [24] 中作为可变形网格部署。插图中的热力图展示了布料动力学下的逐顶点位移,证实了生成的几何结构无需手动预处理即可支持软体仿真。
通过凸分解产生的部分。由于高斯表示不适合作为仿真资产的纹理载体,我们通过自动 UV 展开和可微光栅化,将高斯模型的多视图外观烘焙到高分辨率的显式纹理图中。对于物理属性,视觉语言模型 (VLM) 从多视图渲染和物体类别中推断出语义化的真实世界尺度、质量和摩擦范围。我们使用估计的尺度来一致地校准视觉网格、碰撞网格和高斯表示,然后将恢复的质量和摩擦存储在资产的惯性及接触元数据中,以供下游采样或校准使用。
跨仿真器资产导出。我们采用 URDF 作为统一的中间表示,因为它原生支持视觉网格、碰撞网格、惯性参数和辅助元数据的结构化打包,使其成为跨仿真后端合适的规范表示。格式转换器自动将 URDF(SAPIEN [20]、Bullet [21]、Isaac Gym [22])转换为 XML(MuJoCo [23]、Genesis [24])和 USD(Isaac Sim [25]),正确处理视觉/碰撞几何分离、局部坐标变换、材质映射和物理属性注入。这种设计将物体生成与仿真器适配解耦,使得同一生成的资产能够在不同的具身仿真平台上实例化,并保持一致的物理行为。我们在 RoboVerse [26] 中提供了在线使用示例。1
可变形体仿真。除了刚体物理之外,相同的生成和导出路径自然地扩展到软体仿真。图 3 展示了从文本提示生成的十二件服装,并作为可变形网格导出到 Genesis [24];逐顶点位移热力图证实,生成的表面几何结构具有足够的保真度,能够支持布料和软体动力学,无需任何手动网格预处理。
单视图原位补全。为了处理部分遮挡的输入,我们使用 3D-Fixer [5],它通过将碎片化的可见点云视为空间锚点,原位恢复完整的物体几何结构。它通过遮挡鲁棒的特征对齐和由粗到细的补全,对冻结的 TRELLIS 主干 [2] 进行条件处理,从而避免显式的姿态优化。
2.3 可供性自动标注流水线
问题定义。具身操作不仅需要物体类别或实例的语义,还需要与交互相关的部分的语义。操作策略必须推断接触位置、接触区域支持的功能,以及在几何和物理约束下如何执行接触 [27, 28]。我们将可供性自动标注定义为将仿真就绪 (Sim-ready) 3D 资产转换为结构化的部件级交互表示:每个网格面接收一个部件标识符,每个部件都标注了其语义名称、可抓取性、任务相关的抓取场景、功能标签、外观语义,
1 https://roboverse.wiki/metasim/get_started/quick_start/14_real_asset
第 6 页
以及经过仿真验证的候选抓取。该表示将语言层面的意图与局部化的3D接触区域及可执行的机器人动作联系起来。
流水线概览。从第2.2节中的仿真就绪资产开始,我们的可供性自动标注流水线为每个生成的对象增强了一个用于具身操作的结构化部件级模式。如图4所示,流水线分为三个阶段:(i) 功能部件分割:P3-SAM [29] 将网格分解为具有功能意义的部件区域,这些区域作为可供性标注几何时载体;(ii) 部件级语义标注:基于部件掩码,视觉语言模型(VLM,GPT-5.4 [30])解释对齐的RGB图像和掩码渲染结果,以推断每个区域的语义名称、功能角色、可抓取性、任务条件化的抓取场景以及外观描述;(iii) 抓取生成与物理验证:GraspGen [31] 提出6自由度(6-DoF)抓取候选项,这些候选项与接触的网格部件相关联,并通过基于物理的执行测试进行过滤。生成的面级部件分割网格和部件级可供性标注提供了一个基于仿真器的动作接口,指定了指令所指的具体部件、该部件支持何种交互功能,以及机器人如何通过经过仿真过滤的抓取组来执行预期的接触。
[图4描述:1 仿真就绪资产 -> 2 部件分割 -> 3 部件级语义标注 -> 4 抓取生成。具体流程包括:a 无交互区域 -> a 面级分割 -> a 配对视图渲染 -> 部件名称:头带 -> a 密集抓取生成;b 无部件语义 -> b 基于几何的细化 -> b VLM部件语义标注 -> 可抓取:True -> b 语义部件关联;c 无可执行抓取 -> c VLM引导的合并 -> c 标注验证与修复 -> 交互可供性 -> C 基于物理的验证。功能语义部分显示:功能标签:置于头顶。语义描述:一条宽大的弯曲淡粉色软垫带,外层表面光滑哑光,内衬颜色较浅,横跨顶部并连接两侧。置信度:0.74。抓取场景:在放置过程中通过夹住头带侧面来稳定耳机。]
图4:可供性自动标注流水线。从仿真就绪资产开始,系统通过功能部件分割、部件级语义标注以及抓取生成与物理验证,生成结构化的部件级交互表示。
功能部件分割。对于每个仿真就绪资产,P3-SAM [29] 将网格分解为潜在的功能部件区域。它从网格中采样点云,在归一化的3D空间中推断对象的部件结构,并将预测的点云掩码投影回原始网格面上,以获得面级部件分割图。预测的部件标识符被重新映射到固定的调色板上,以便后续的VLM阶段直接访问颜色名称。原始的P3-SAM预测仍可能包含边界错误和过于细粒度的分区,因此我们增加了几何一致的后处理和VLM引导的部件合并。基于几何的后处理通过合并平滑连接的面对象并重新标记小的包围碎片来修正局部标签,旨在消除投影噪声而不破坏真实的尖锐部件边界。对于语义过分割,基于VLM的检查器以对象类别、所有部件颜色名称、2×3多视图网格的RGB渲染结果以及对齐的部件掩码网格作为输入。当检查器识别出相同的功能部件被分割成多个独立的部件区域时,流水线会自动合并相应的区域,并迭代此检查与合并过程,直到不再需要进一步合并为止。最终接受的输出是一个面级分割图,它在几何上是连续的,并且在语义上与对象的功能结构对齐。
部件级语义标注。我们进一步从几何部件区域中提取面向交互的语义。我们复用分割检查器的输入:对象类别、部件颜色名称以及对齐的RGB和部件掩码渲染结果。RGB视图提供外观、材质和结构线索,而掩码则保持跨视角的区域身份,使VLM能够将视觉线索与相同的3D部件关联起来。
这些输入被提供给VLM(GPT-5.4 [30]),以推断每个具有物理意义的部件的结构化属性,包括部件名称、可抓取性、任务条件化的抓取场景、功能标签以及细粒度的语义描述。可抓取性和抓取场景指定该区域是否适合作为机器人接触目标;功能标签表征部件的角色;语义描述记录
第 7 页
外观级线索,如颜色、材质、纹理、形状和相对位置。VLM 响应使用掩码颜色名称将每个部件级注释与其对应的分割区域关联起来。我们进一步应用基于 VLM 的检查器来评判和修正响应,从而生成最终的可供性(Affordance)注释。经过验证的部件级语义为下游任务规划形成了可查询的部件级先验。
抓取生成与物理验证。GraspGen [31] 生成带有置信度分数的 6-DoF 抓取候选项,我们将其映射到接触的语义部件,并按置信度排序。我们在 SAPIEN [20] 中通过模拟闭合、提升、扰动和下降来验证这些候选项,仅保留相对于机械手保持稳定的抓取。生成的注释将部件级交互语义与物理上可执行的抓取提议配对,用于下游操作。
2.4 任务驱动的交互式世界生成
问题定义。我们将任务驱动的交互式世界生成定义为将自然语言任务描述(例如,“将水果放在桌上的盘子里”)映射到可直接用于仿真并满足执行约束的完全实例化的 3D 世界的任务。输出包含两种互补表示:(i) 场景图(Scene Graph)——一种根多叉树,其节点对应 3D 资产,边编码空间父子关系;以及 (ii) 组合的交互式 3D 世界,具有真实尺度的几何形状、物理属性和每个物体的 6-DoF 位姿,可直接加载到物理仿真器中。与以前以房间类别或物体列表作为输入的场景生成方法 [32, 32, 33] 不同,我们的 formulation 是任务驱动的:系统自主推理需要哪些物体、它们在空间上如何关联,以及机器人应放置在哪里以执行所描述的操作任务。这种分解类似于电影制作中的绿幕制作:与其联合生成所有世界细节,我们将交互式环境建模为背景加上最小集的任务相关交互资产。这种抽象保留了任务所需的语义和物理约束,同时大幅降低了世界合成的复杂性和渲染成本。
流水线概览。如图 5 所示,给定自然语言任务描述,流水线分为三个阶段:(1) 场景图生成将任务解析为语义角色,将其组织为具有显式空间关系的场景图,并生成每个物体的视觉描述;(2) 资产生成将每个节点实例化为 Sim-ready 3D 资产;以及 (3) 空间放置通过 BFS 遍历和物理稳定化计算无碰撞、物理稳定的位姿。
输入:任务描述 场景图生成 资产实例化 BFS 空间放置 在线生成 离线检索 布局排列 任务1:将水果放在桌上的盘子里。 背景 (Generation-cli) (资产画廊) 可触性检查 桌子上的盘子。 上下文 厨房 干扰项 接触度检查 目标 IN 可放置性检查 任务2:将西兰花放在 机器人 地板 R T 白色盘子上 桌子 机器人 T D 任务:… 布局组合 ON ON ON ON ON 物理稳态
苹果 香蕉 盘子 马克杯 叉子 t=0 t=6 t=12
质量保证: 物理、几何和外观 闪亮的红苹果 哑光海军蓝陶瓷 带绿叶的 马克杯带弯曲把手 Sim-ready 3D 资产 Sim-ready 3D 场景
图 5:任务驱动的交互式世界生成流水线:从自然语言任务生成场景图,Sim-ready 资产实例化,以及基于 BFS 的空间放置和物理稳定化。
场景图生成。场景分解。给定任务描述,我们提示 LLM 将其分解为五个语义类别:ROBOT,表示机器人类型;BACKGROUND,室内环境;CONTEXT,锚定交互的主要家具;MANIPULATED_OBJS,机器人必须操作的物体;以及 DISTRACTOR_OBJS,与任务无关的合理场景道具。
7
第 8 页
图 6:同一任务驱动的交互式世界布局在六个物理仿真器(Genesis、Isaac Gym、Isaac Sim、MuJoCo、PyBullet 和 SAPIEN3)中的实例化展示,分别显示为 RGB(顶部)和深度(底部)。我们流水线生成的标准化布局描述无需手动适配即可在每个后端中加载和执行,展示了跨仿真器的可移植性。
分解过程强制执行语义一致性:上下文对象必须合理地属于背景。例如,厨房台面与厨房兼容,但与卧室不兼容。分解过程还将输出限制为适合物理仿真的刚体。
层级生成与资产描述。第二个 LLM 查询将分解后的元素组织成一个浅层根 Scene Graph:背景作为根节点,上下文和机器人是其子节点,被操作的对象和干扰对象附加到上下文上。边编码了 ON、INSIDE、FLOOR 和 IN 关系,而单父结构减少了放置歧义。每个资产节点还接收一个视觉描述,用于条件化后续生成阶段。
资产获取。为了平衡多样性和效率,资产和背景均支持两种获取模式:在线生成和离线数据库检索。Scene Graph 中的每个资产节点都可以按需使用第 2.2 节描述的文本到 3D 流水线进行实例化,或者在已有合适实例时从预构建的资产库中检索。所有实例化的资产均携带真实世界的尺度、质量、摩擦、碰撞几何和 URDF 封装。背景场景同样支持在线生成和离线检索:我们使用 EmbodiedGen [1] 的背景生成方法生成简单背景,而大规模场景生成模块(第 2.5 节)生成复杂背景。
BFS 空间放置。我们按广度优先顺序实例化 Scene Graph,以便在放置子节点之前先放置父节点,并根据足迹对兄弟节点进行排序,为较大的对象预留支撑空间。对于每种空间关系,特定关系的采样器会在父几何体上或内部提出子位置 $p_c$,需满足支撑和碰撞约束: $$ p_c \in H_p, \quad \text{Support}(B_c(p_c), H_p) = 1, \quad \text{IoU}\left(B_c(p_c), \bigcup_{j \in P_p} B_j\right) = 0, \quad (1) $$ 其中 $H_p$ 是父节点的支撑区域,$B_c$ 是投影后的子节点足迹,$P_p$ 包含已放置在 $p$ 上的兄弟节点。支撑谓词防止不稳定的放置,而 IoU 项避免物体间碰撞。被操作的对象还必须位于机器人的可达、朝前交互区域内;当未找到可行姿态时,系统会重新采样候选对象或调用特定关系的回退机制。放置完成后,我们在 SAPIEN [20] 中在重力作用下稳定可移动物体,以解决剩余的穿透和漂浮伪影。随后,我们将稳定的 6-DoF 姿态导出为标准化的布局配置,该配置可在不同仿真器中加载以进行可视化和批量策略训练。RoboVerse [26] 提供了一个在线示例,展示了在不同仿真器中直接加载此标准化布局描述(图 6)。2
2 https://roboverse.wiki/metasim/get_started/quick_start/16_embodiedgen_layout
8
第 9 页
输入 场景路由器 世界求解器 规范化器 仿真就绪场景 任务或场景描述 场景蓝图 可行装配体 仿真就绪包装 S = (R, F, C)
将厨房里的苹果放入 客厅水果碗。 房间语义 房间拓扑 仿真就绪 家具层级 场景 一间明亮现代的卧室。 ……
图 7:大规模场景生成。任务描述首先被提炼为场景蓝图,然后在空间约束下组装为可行的多房间装配体,最后规范化为仿真就绪背景,可作为任务驱动的前景布局的背景节点。
2.5 大规模场景生成
问题定义。第 2.4 节中的任务驱动交互式世界生成模块明确地将任务相关的交互式前景资产从世界中分离出来,留下一个由占位符背景节点占据的抽象接口。本节回答该接口的另一半问题:如何在该占位符后面自动合成大规模、多房间、可导航的仿真就绪室内场景,从而使具身智能体不再局限于桌面级几何结构,而能够在统一的物理世界中执行长视野导航和移动操作。形式上,给定任务描述 $T$,该模块输出三元组 $S = (R, F, C)$,其中 $R$ 是标注了门窗连接的房间拓扑图,$F$ 是每个房间独立可寻址的家具实例集合(每个实例包含视觉网格、碰撞代理和物理参数),$C$ 是全球一致的房屋级坐标系。与 EmbodiedGen V1 [1] 的全景反投影单网格背景相比,$S$ 同时暴露了真实的房间拓扑、可通行开口以及独立可编辑的家具实体——这些是仿真中解决此类任务所需的条件。
流程概述。我们提出一个三阶段流程,明确解耦了由自然语言驱动的语义推理与确定性几何约束求解:(i) 任务条件路由将 $T$ 编码为一组离散控制信号,指定实例化哪些房间语义以及目标复杂度;(ii) 分层场景求解将程序化室内生成框架 [34] 从面向渲染的合成器重塑为面向求解的求解器,生成填充有家具骨架的房间或房屋级几何结构;(iii) 模拟器无关的规范化执行实例级分解、碰撞代理生成和坐标规范化,然后通过 URDF 交付场景作为标准化的中间表示,复用第 2.2 节中的统一格式转换器以支持所有主要下游模拟器。这将空间一致性的负担转移到了约束求解器上,补充而非取代了由 LLM 驱动的布局工作 [32, 33]:语言模型仅做出离散的语义决策,而求解器保证了几何和拓扑的可行性。
任务条件路由。视觉语言模型将任务 $T$ 映射为两个离散控制信号:房间范围和场景复杂度。局部任务选择一个合理的房间类别,而跨房间或长视野任务触发全屋联合求解。复杂度级别 $\ell \in \{\text{Minimalist, Simple, Medium, Detail}\}$
第 10 页
控制家具和杂物密度,在任务需求与求解器成本之间提供可解释的接口。
分层场景求解。求解器在平面图和跨房间通行性约束下,按从粗到细的顺序放置三个语义尺度的家具:首先求解骨架级家具(定义房间功能的大型物品,如床、沙发和柜子)的放置和方向,然后在它们的支撑表面上放置中等尺度的物体,最后是桌面尺度的杂物。复杂度层级 $\ell$ 控制求解器激活这些级别的多少,将场景密度暴露为单个可调轴,从而使生成成本随任务难度缩放,从近乎空的房间到完全装饰的室内。为了使输出真正可用于物理仿真而非离线渲染,我们将程序化生成器从面向渲染重塑为面向仿真:我们抑制对物理后端不可解析或仅具装饰性的几何体,并将求解器的预算重新分配给维持大规模多房间场景的可行性。求解器在房间连通性和可通行开口约束下对不可行样本进行重采样。
模拟器无关的规范化。求解器生成的几何体仍处于面向渲染的表示中,必须经过仿真就绪(Sim-ready)打包步骤才能被物理引擎消费。我们扩展了场景级导出,包含三个组件:(i) 逐实例分解沿家具和建筑单元将房屋级几何体分割为可单独加载、可单独替换的实例实体,使得此处生成的背景可以无缝挂载为第 2.4 节中场景图(Scene Graph)的背景节点,其家具实例可根据需求被前景对象替换或扩展;(ii) 凸碰撞代理批量应用第 2.2 节中使用的相同 CoACD [19] 凸分解(Convex Decomposition),在所有家具实例中将视觉网格替换为紧凑的凸包作为碰撞代理,避免非凸网格在场景规模下典型的接触不稳定性和性能下降;(iii) 场景级规范化将房屋级几何体的质心对齐到世界原点,消除在其他随机种子下出现的整体姿态漂移,并确保在批量数据生成下下游策略训练的可比性。打包阶段原生生成 URDF 和 USD,并复用第 2.2 节的统一格式转换器,因此房屋级背景和对象级资产通过相同的交付路径到达所有主要模拟器,在后端之间具有一致的物理语义和接触行为。因此,本节提供的不是一个不可编辑的视觉外壳,而是一个可路由、可寻址、可替换且引擎可移植的结构化仿真就绪背景。结合第 2.2 节的对象级资产和第 2.4 节的任务级布局,它构成了 EmbodiedGen V2 的统一世界表示:可单独用于导航和多房间探索,或作为前景布局的物理背景进行组合,以构成端到端的具身仿真世界。
2.6 面向状态保持的仿真就绪 3D 世界编辑的 Vibe Coding
动机。我们使用“Vibe Coding”一词来描述通过自然语言对话迭代生成和编辑仿真就绪 3D 世界的过程:用户以对话方式表达意图,而确定性的、感知物理的技能后端强制执行可行性和仿真就绪输出契约——这类似于开发者与 AI 编码助手进行“氛围式”协作,同时编译器强制执行类型正确性。此类创作本质上是迭代的——细化实例、调整空间关系、重新设计资产风格并验证物理特性——但传统的 3D 管线(建模、物理标注、特定格式导出)以及每次提示都重新生成整个场景的提示到场景生成器,均不支持保持状态的局部编辑。第 2.2–2.5 节的生成器同样是单次生成的,而现代 LLM 智能体虽然能够通过类型化工具调用调用领域技能,但缺乏针对仿真就绪 3D 世界的自描述技能套件。因此,我们在智能体-技能-框架(agent–skill–harness)抽象下组织这些模块:求解器成为可调用的仿真就绪技能,共享框架维护一个跨对话轮次演化的世界状态,将单次生成转换为在线编辑内核,该内核复用公式 (1) 的主干、CoACD 碰撞代理和物理沉降。
架构与世界状态。编辑引擎包含三个组件。(i) 智能体是一个基于 LLM 的协调器,负责对话理解、意图解析、技能选择、参数补全和反馈解释。(ii) 技能是自包含的能力单元;每个技能都公开其用法、输入、输出和故障模式的自然语言描述,并由第 2.2–2.5 节中的确定性生成器、求解器或导出器提供支持。(iii) 框架是运行时层,用于桥接
10
第 11 页
代理和技能,维护技能注册表、调度逻辑、共享世界状态、失败循环以及编辑日志。给定一个持续的对话流 $\{u_1, u_2, \dots, u_t\}$,harness 维护一个不断演变的仿真就绪(Sim-ready)世界状态:
$$ S_t = \langle G_t, A_t, P_t, H_t \rangle, \quad (2) $$
其中 $G_t$ 是类型化的场景图(Scene Graph),$A_t$ 是仿真就绪资产,$P_t$ 是它们的 6 自由度位姿,$H_t$ 是对话和技能调用历史。对于每个指令,代理选择一个技能,harness 验证其参数,执行确定性后端,并提交有界的状态更新。每次更新都保持几何和物理可行性,在 $H_t$ 中记录可审计的编辑,并保持资产和位姿在模拟器后端之间的一致性。
[图片描述:展示了三个 Vibe Coding 3D 编辑会话的流程图。顶部为厨房场景,中间为客厅场景,底部为办公室场景。每个会话从空白背景 $S_0$ 开始,通过三个自然语言轮次进行,其中类型化的技能提交有界增量 $\Delta S$ 到 $(G, A, P, H)$。绿色和红色箭头分别表示添加和移除的实例;所有会话最终都成为可导出的仿真就绪场景。]
技能套件与运行时契约。我们将技能套件围绕状态化仿真就绪世界生成所需的四个抽象进行组织:资产定位(asset grounding)、世界组合(world composition)、状态化编辑(stateful editing)和执行验证(execution validation)(见表 1)。每个技能声明其触发条件、类型化参数、输出和失败行为。在解析(Parse)和定位(Ground)之后,harness 验证参数,调用确定性后端,并在共享的资产与布局表示中提交 resulting 的有界 $\Delta S$。失败的调用返回结构化诊断信息,用于重试、消歧或回退,且不修改世界状态。该 harness 不绑定于特定的代理实现:我们的参考适配器通过共享插件层与 OpenAI Codex [35] 和 Gemini CLI [36] 集成,任何支持类型化工具调用或斜杠命令插件的代理框架都可以连接到相同的技能集。
代理-技能编辑循环。算法 1 总结了“解析-定位-调用-提交”循环。每个指令在当前可行性约束下产生有界的状态增量;成功的调用会提交并渲染新状态,而失败的调用则返回诊断信息而不改变状态。
11
第 12 页
表 1:Vibe Coding 智能体-技能工具包暴露的核心技能抽象。
| 抽象 | 技能 | 在世界状态转换中的作用 | | :— | :— | :— | | 资产接地 (Asset grounding) | asset-creator | 将开放词汇的对象意图具象化为仿真就绪 (sim-ready) 的资产候选项。 | | | asset-retrieval | 当无需生成时,将对象引用锚定到可复用的资产。 | | | asset-process | 在资产级变换下保持度量和几何一致性。 | | | asset-converter | 将规范资产投影到特定模拟器的格式。 | | 世界构成 (World composition) | background-creator | 为交互式布局合成任务兼容的背景上下文。 | | | room-creator | 使用规范场景实体生成结构化的房间级和房屋级世界。 | | | layout-creator | 将任务语义实例化为具有物理接地的前-背景布局。 | | 状态编辑 (Stateful editing) | spatial-computing | 通过将语言锚定到可寻址实例和碰撞感知的空间约束,提交有界的场景编辑。 | | 执行验证 (Execution validation) | sim-runner | 通过在仿真中执行当前世界状态并返回视觉或策略相关的反馈来闭合循环。 |
算法 1 智能体-技能交互式编辑循环。
要求: 对话流 $\{u_t\}$,初始世界状态 $S_0$ 1: for each instruction $u_t$ do 2: $(\omega, \alpha_{NL}) \leftarrow \text{Parse}(u_t, S_t)$ $\triangleright$ 选择技能和自然语言参数 3: $\alpha \leftarrow \text{Ground}(\alpha_{NL}, S_t)$ $\triangleright$ 解析类型化的世界引用 4: $\Delta S \leftarrow \text{Invoke } \omega, \alpha, C(S_t)$ $\triangleright$ 在约束下执行 5: if $\Delta S = \bot$ then 6: $\text{Diagnose}(\omega, \alpha, S_t)$ $\triangleright$ 返回诊断信息;无状态突变 7: continue 8: end if 9: $S_{t+1} \leftarrow \text{Commit}(S_t, \Delta S)$ $\triangleright$ 原子状态更新 10: $\text{Render}(S_{t+1})$ $\triangleright$ 刷新仿真预览 11: end for
实例接地与空间编辑。接地 (Ground),由智能体处理,是开放语言与符号化世界状态之间的接口。它根据当前的场景图、实例外观、空间坐标以及 $H_t$ 中的近期编辑,解析类别引用(“那把椅子”)、属性引用(“最大的家具”)和历史回指(“我刚才放的那个苹果”),从而为选定的技能 $\omega$ 生成类型化参数 $\alpha$;低置信度的情况会返回前 $k$ 个候选项供用户消歧。对于空间编辑,Ground 将引用映射到 instance_key 和 room_id,并将它们分派给 spatial-computing 技能,该技能将场景暴露为可寻址实例的房间分区 2D 平面图(图 9),并通过重用公式 (1) 中的碰撞 IoU 项来解决 ON/BESIDE/IN 关系,其支撑测试从对象顶表面推广到房间自由地板多边形。因此,离线放置求解器成为该技能的在线核心,并且每次提交的编辑都保持 $G_t$ 和 $P_t$ 在下游模拟器之间的一致性。
12
第 13 页
图 9:空间计算技能的平面图画布。每对图像展示了自上而下的渲染图(左)以及带有房间和实例标签的相应符号平面图(右)。开放词汇参考基于此画布进行接地(grounding),该技能对其房间多边形和实例边界框评估公式 (1)。
3 实验
3.1 仿真就绪流水线质量评估
我们在 200 个保留资产上对仿真就绪流水线的每个阶段进行消融实验,这些资产涵盖了多样化的物体类别。默认的完整流水线(Full pipeline)包括网格修复、凸分解和分层质量检查器;每个变体移除一个组件,同时保持其余部分不变。在此评估中,我们使用 SAM3D [3] 作为图像到 3D 模型,并在单个 NVIDIA RTX 4090 GPU 上运行所有实验。
表 2:在 200 个保留资产上的消融研究。每一行从完整流水线中移除一个组件。时间和网格大小报告为均值 ± 标准差。最佳结果以粗体显示。
| Setting | Human Accept. ↑ | Collision Success ↑ | Time (min) ↓ | Visual Mesh (MB) ↓ | Collision Mesh (MB) ↓ | | :— | :— | :— | :— | :— | :— | | Full pipeline | 96.5% | 98.6% | 2.6 ± 0.4 | 1.43 ± 0.63 | 0.29 ± 0.21 | | w/o Quality checker | 91.0% | 98.1% | 2.2 ± 0.4 | 1.44 ± 0.63 | 0.30 ± 0.22 | | w/o Mesh fixing | 95.5% | 98.3% | 21.3 ± 22.8 | 51.63 ± 25.87 | 0.31 ± 0.26 | | w/o Convex decomp. | 94.5% | 96.5% | 2.3 ± 0.3 | 1.45 ± 0.64 | 1.45 ± 0.64 |
表 2 报告了五项指标。人类接受率(Human Acceptance)是由标注员判定为仿真就绪的资产比例,考虑了与输入条件的一致性、几何合理性、不可见表面的连贯性以及作为仿真资产的整体可用性。碰撞成功率(Collision Success)是 SAPIEN [20] 中脚本化的 Franka Panda 自上而下抓取和提升试验的平均成功率:我们对每个资产在均匀间隔的偏航角上运行 4 次试验,如果物体被提升到与其边界框高度成比例的自适应高度阈值之上,则计为成功。其余列报告了每个资产的处理时间和导出的网格大小。
质量检查器。移除质量检查器使人类接受率降低了 5.5 个百分点(96.5% → 91.0%),同时每个资产仅节省 0.4 分钟。在没有生成-验证-重试循环的情况下,有缺陷的样本未经修正便通过,降低了视觉和语义的完整性。网格大小和碰撞成功率基本保持不变,证实了检查器针对的是感知缺陷而非几何属性。
网格修复。没有网格修复,下游处理变得显著低效:每个资产的处理时间增加了约 8 倍,从 2.6 ± 0.4 分钟增加到 21.3 ± 22.8 分钟,视觉网格大小从 1.43 MB 增长到 51.63 MB。这种退化是因为原始生成输出包含冗余面片和拓扑缺陷,严重减慢了 UV 展开、纹理烘焙和凸分解 [19];每个对象超过 50 MB 的网格对于批量加载数百个资产的仿真器来说也是不切实际的。
凸分解。没有凸分解,碰撞网格将恢复为完整的视觉网格
13
第 14 页
作为碰撞代理(0.29 → 1.45 MB),迫使仿真器在非凸表面上运行。由于接触不稳定和抓取失败,Collision Success(碰撞成功率)从 98.6% 降至 96.5%,同时运行时开销增加可忽略不计(2.6 分钟对比 2.3 分钟)。尽管绝对下降幅度适中,但此类接触误差会在长视距具身操作管道中累积。
总体而言,这三个组件解决了互补的故障模式——感知接受度、部署效率和接触可靠性——共同实现了 96.5% 的 Human Acceptance(人类接受度)和 98.6% 的 Collision Success(碰撞成功率),每个资产耗时 2.6 分钟。
3.2 Affordance 管道质量评估
我们在 200 个涵盖不同物体类别的 Sim-ready(仿真就绪)资产上,在三种匹配设置下评估了 Affordance 自动标注管道。Baseline(基线)使用原始的 P3-SAM 部件分割 [29]、部件级语义标注和抓取生成;两个变体逐步添加几何一致的分割后处理和 VLM 引导的部件合并。所有变体使用相同的资产集和级联协议,其中每个阶段仅在通过前一阶段的资产上进行测量。我们在单个 NVIDIA RTX 4090 GPU 上运行评估,并使用 GPT-5.4 [30] 实例化 VLM 辅助的验证和合并模块。对于抓取验证,每个保留的抓取在 SAPIEN 中执行,如果在验证序列期间物体到机械手的滑移超过 5 cm 或 30◦,则将其丢弃。
表 3:Affordance 自动标注管道在 200 个资产上的消融研究。阶段通过率取决于前一个成功阶段,而端到端通过率是部件分割、部件语义标注和物体级抓取覆盖率的乘积。运行时报告为每个资产的平均值 ± 标准差,涵盖成功和失败的资产。
Segmentation Semantic Grasp Affordance Runtime Setting Pass Rate ↑ Validity Rate ↑ Coverage Rate ↑ Pass Rate ↑ (s) ↓
Baseline 47.0% 98.9% 66.7% 31.0% 109 ± 45 + Post-process 56.5% 97.3% 74.6% 41.0% 105 ± 41 + Post-process + VLM merging 69.5% 99.3% 72.5% 50.0% 94 ± 30
表 3 报告了分阶段和端到端的指标。Segmentation Pass Rate(分割通过率)衡量 VLM 检查器在检查对齐的 RGB 和掩码网格后,是否将分解接受为具有物理意义的功能部件,以及面级掩码是否足够准确以用于下游标注。Semantic Validity Rate(语义有效性率)衡量每个被接受的部件在检查器修复循环后是否获得了有效的结构化标注,包括语义名称、可抓取标志、抓取场景、功能标签和外观描述。Grasp Coverage Rate(抓取覆盖率)在通过语义检查的资产上计算,要求在最终的 Affordance 标注中,整个物体至少有一个经过仿真验证的候选抓取姿态,而对于本质上不适合机械平行夹爪抓取和提升的大型家用电器等资产,则视为满足此标准。Segmentation Pass Rate 和 Semantic Validity Rate 首先由 VLM 检查器筛选,然后进行人工交叉验证,而 Grasp Coverage Rate 则从最终的 Affordance 标注中自动计算。在这种级联评估下,Affordance Pass Rate(Affordance 通过率)计算为三个分阶段率的乘积,代表了具有有效部件级语义且至少有一个物理可执行抓取或明确抓取豁免的资产的端到端产出率。
后处理。添加几何一致的后处理将 Segmentation Pass Rate 从 47.0% 提高到 56.5%,增加了拥有可用面级部件掩码的资产比例。这一改进反映了平滑组件合并和包围片段重新标注的作用,它们减少了由投影引起的边界噪声和孤立的部件碎片,同时没有破坏真实的几何不连续性。在通过分割的资产上,Semantic Validity Rate 保持较高水平(98.9% → 97.3%),而条件 Grasp Coverage Rate 从 66.7% 增加到 74.6%。分割质量和抓取覆盖率的这些改进通过级联传播,使 Affordance Pass Rate 从 31.0% 提高到 41.0%。
VLM 验证。添加基于 VLM 的验证进一步将 Segmentation Pass Rate 提高到 69.5%,
14
第 15 页
显著增加了能够进入抓取生成阶段的资产池。通过合并那些代表相同功能部件但在原始分割中被分离的区域,VLM 检查器生成了与可操作物体结构更对齐的部件分解。语义有效性率(Semantic Validity Rate)提升至 99.3%,而条件抓取覆盖率(conditional Grasp Coverage Rate)保持在具有竞争力的 72.5%,这表明 VLM 模块主要在保持强大抓取覆盖率的同时,增加了可靠的部件级载体数量。在端到端层面,完整配置实现了 50.0% 的 Affordance Pass Rate,较基线提升了 19.0 个百分点。
效率。所有变体每个资产的运行时间约为 1.6–1.8 分钟。完整变体在此测量中速度最快(94.0 ± 30.2 秒),而基线为 108.5 ± 45.1 秒。后处理和 VLM 验证增加了部件分割的成本,因为它们需要面标签细化、检查器渲染以及最多三次合并与重新检查尝试。然而,通过抑制冗余或过度碎片化的部件,这些组件减少了下游部件级语义标注、抓取生成和基于仿真的抓取验证的工作量;例如,VLM 验证将平均部件数量从 5.3 减少到 3.6。这种下游计算的减少超过了增加的分割开销,导致整体每个资产的运行时间降低。
3.3 任务驱动交互式世界生成评估
实验设置。我们生成了 150 个多样化的自然语言操作任务,涵盖不同的室内背景、上下文、操作对象和干扰项。每个任务均按照第 2.4 节端到端生成:LLM 首先将任务解析为 Scene Graph,系统随后在线生成背景和所需的 sim-ready 对象资产,并基于 BFS 的空间放置与 SAPIEN 物理稳定处理生成可直接加载的交互式世界布局。除非另有说明,所有效率数据均在单张 NVIDIA RTX 4090 GPU 上完全在线顺序生成条件下测量。我们手动检查最终的交互式世界,以评估其在下游仿真中的直接可用性,标准包括任务语义一致性、正确的空间关系、合理的物体尺度、物理稳定性以及机器人可执行性。
表 4 从四个角度报告了评估结果:任务到图的生成、资产实例化、自动化质量检查和最终世界级接受度。生成的 150 个交互式世界包含 778 个 sim-ready 对象资产实例,涵盖 128 个对象类别,每个世界平均有 5.19 个交互式资产。这些结果表明,Scene Graph 表示法在保持广泛的世界组成多样性的同时,稳定地分解了开放式任务。
表 4:任务驱动交互式世界生成流程(第 2.4 节)的分阶段分析。结果汇总自在单张 NVIDIA RTX 4090 GPU 上顺序执行的 150 个生成交互式世界。QA 通过率表示资产生成尝试中的单次尝试通过率。
| 类别 | 指标 | 值 | | :— | :— | :— | | 任务到图生成 | 生成的任务条件世界 | 150 个世界 | | | 每个世界的平均交互式资产实例数 | 5.19 个实例 | | | 覆盖的不同对象类别数 | 128 个类别 | | 资产实例化 | 生成的背景资产实例数 | 150 个实例 | | | 生成的对象资产实例数 | 778 个实例 | | | 每个背景资产的时间 | 25.5 ± 3.5 分钟 | | | 每个对象资产的时间 | 3.6 ± 1.1 分钟 | | 资产 QA | 语义外观 | 76.2% | | | 网格几何 | 75.9% | | | 跨模态文本到 3D 对齐 | 91.0% | | | 每个有效资产的平均尝试次数 | 1.35 | | 世界级结果 | 每个世界的总时间 | 47.7 ± 5.4 分钟 | | | 最终环境接受率 | 83.3% |
图 10 展示了由任务驱动交互式世界生成流程生成的代表性布局。
15
第 16 页
图 10:任务驱动交互式世界生成的定性示例。每个世界均通过任务条件化的场景图(Scene Graph)从任务描述生成,包含背景、上下文、可操作物体以及按仿真就绪(Sim-ready)布局排列的干扰项。
16
第 17 页
资产级故障
语义外观检查器 网格几何检查器 跨模态文本到3D对齐检查器
提示:带有光泽黑色表面和极简设计的圆柱形金属笔筒。 提示:带有光滑清漆表面的条纹木桌。 提示:带有浅棕色斑点表面的光泽陶瓷咖啡杯。 ✗两个物体;笔筒和脱落的圆柱形盖子。 ✗桌子缺少一条腿。 ✗额外的把手,与典型的咖啡杯不一致。
场景级故障
任务:将柠檬放入金属碗中。 任务:拿起海绵并将其放入盘子中。 任务:将玩具车放入塑料桶中。
✗由于场景图关系错误,柠檬被初始化在碗内。 ✗海绵太大,机械臂无法抓取。 ✗桶位于桌子边缘,容易滚落。
图11:任务驱动交互式世界生成中的代表性故障案例。顶部:由自动化QA模块过滤的资产级故障,包括语义外观不匹配、网格缺陷和文本到3D漂移。底部:与最终环境检查中未接受部分相对应的主要世界级故障案例,包括任务约束违反、物体尺度不匹配和不稳定放置。
除了这些定性示例外,表4中的分阶段分析显示,完全在线生成每个世界需要 47.7 ± 5.4 分钟,其中背景合成是主要成本(25.5 ± 3.5 分钟)。每个物体资产生成需要 3.6 ± 1.1 分钟。由于 Scene Graph 明确将背景与交互式资产分离,在实际使用中,系统可以重用离线资产库中现有的背景或物体实例,避免重复执行最昂贵的生成步骤,并将世界生成时间减少到分钟级。
自动化质量检查主要在资产实例化期间运行,防止错误在中间表示中传播。语义外观检查器验证前景图像是否与目标类别和关键视觉属性匹配;网格几何检查器检查生成的网格是否完整且无重大几何缺陷;跨模态文本到3D对齐检查器验证最终3D资产是否与原始文本描述保持语义一致,捕捉3D生成过程中引入的语义漂移。这三个检查器的单次尝试通过率分别为 76.2%、75.9% 和 91.0%。通过生成-验证-重试机制,每个有效资产平均仅需 1.35 次生成尝试。人工检查显示,83.3% 的最终交互式世界无需人工修改即可用于下游仿真。如图11所示,剩余的故障主要源于物体尺度不匹配、局部几何缺陷或不完善的初始空间放置,通常可以通过重新采样或轻微的人工调整来纠正。
3.4 下游闭环验证
除了静态生成质量和人工可用性检查外,我们通过总结一项独立的下游研究来考察生成的环境是否支持闭环中的策略学习。Choi 等人 [6] 使用 EmbodiedGen V2 生成的交互式环境进行机器人视觉-语言-动作 (VLA) 策略的在线强化学习 (RL),从在 BridgeV2 [37] 上预训练的 π0 风格模仿策略 πpre 开始。这将生成的场景置于实际的策略优化管道中,它们必须提供稳定的交互动态、任务多样性和可迁移的学习信号,而不仅仅是视觉上合理或物理上可加载。
17
第 18 页
图 12:来自 [6] 的可视化结果。左侧:使用 EmbodiedGen V2 生成的场景进行通用抓取放置训练的并行强化学习快照。右侧:经过微调的 VLA 在 EmbodiedGen V2 上的仿真到现实(sim-to-real)部署。
表 5 总结了下游研究报告的闭环结果。仅使用生成的场景,在线强化学习将仿真成功率从 9.7% 提升至 79.8%。将生成的训练场景数量从 N = 1 扩展到 N = 50,使分布外(OOD)成功率从 53.2% 提升至 77.9%,并将分布内/分布外(ID–OOD)差距从 41.1 个百分点缩小至 2.6 个百分点。相比之下,在三个手工构建的 SimplerEnv [38] 场景上训练的策略在 EmbodiedGen V2 场景上的迁移效果较差,成功率仅为 36.0%。借助域随机化,在生成环境中训练的策略进一步迁移到真实机器人,在 12 个真实场景和 240 次试验中,整体任务成功率从 21.7% 提升至 75.0%,动力学失败率从 66.7% 降低至 18.3%。
Choi 和 Xu [7] 进一步使用 EmbodiedGen V2 生成的场景,通过离线到在线的强化学习训练用于方块堆叠的仿真到现实 VLA 策略,在 144 次试验中将现实世界中的方块堆叠成功率从 43.1% 提升至 88.9%。总体而言,这些结果确立了 EmbodiedGen V2 生成的环境作为闭环策略改进的可扩展生成式仿真基础。
表 5:生成环境的下游闭环验证。结果总结自一项大规模仿真到现实视觉-语言-动作(VLA)强化学习研究 [6]。
| 验证维度 | 下游设置 | 关键结果 | | :— | :— | :— | | 在线可训练性 | 仅使用 EmbodiedGen 生成的场景微调 $\pi_{pre}$ | 仿真成功率从 9.7% 提升至 79.8%,平均完成时间从 10 秒缩短至 8 秒。 | | 场景分布扩展 | 将生成的训练场景数量从 N = 1 扩展至 N = 50 | OOD 成功率从 53.2% 提升至 77.9%,ID–OOD 差距从 41.1 缩小至 2.6 个点。 | | 手工构建场景对比 | 在三个手工构建的 SimplerEnv 场景上训练,并在 EmbodiedGen 场景上评估 | 策略在手工构建场景上达到 96.7% 的成功率,但在 EmbodiedGen 场景上仅为 36.0%。 | | 真实机器人迁移 | 12 个真实场景和 240 次真实机器人试验 | 现实世界任务成功率从 21.7% 提升至 75.0%,同时动力学失败率从 66.7% 降低至 18.3%。 |
18
第 19 页
4 相关工作
先前的工作推动了生成式3D资产、场景布局、可供性(Affordance)标注、自然语言编辑以及具身策略学习等各个组件的发展。EmbodiedGen V2 的不同之处在于,将这些组件视为一个仿真就绪(Sim-ready)基础设施问题:生成的世界必须满足仿真就绪资产契约,暴露交互语义,实例化任务条件化的布局,作为持久化世界状态保持可编辑性,并支持下游策略学习,而无需手动进行场景创作。
仿真就绪3D资产生成。3D生成技术已从基于分数蒸馏的优化 [39] 迅速演进到前馈生成范式(Zero-1-to-3 [40], LRM [41]);目前最先进的方法,如 TRELLIS [2, 11]、SAM3D [3] 和 Hunyuan3D [8, 10],现已实现高质量纹理网格的端到端生成。然而,这些方法主要优化视觉保真度,提供的是可视化级别而非仿真级别的可可用性 [41]。几项工作试图弥合这一差距:Gen2Sim [42] 将扩散生成的网格与LLM估计的物理参数相结合,以支持机器人强化学习训练;PhysX-3D [43] 在 TRELLIS 基础上增加了物理变分自编码器(VAE),以生成具有显式质量和摩擦属性的资产;PhysX-Anything [44] 采用由视觉语言模型(VLM)驱动的流程,从单张图像预测物理属性;PhysForge [45] 针对交互式虚拟环境,并通过物理仿真约束引导资产生成。这些工作朝着物理资产生成的方向迈进,但它们并未联合强制执行此处使用的完整仿真就绪契约:即从开放域文本或图像输入中,进行质量门控生成、网格修复、碰撞代理生成、物理元数据恢复以及标准化多仿真器导出。
3D室内场景布局与大规模场景生成。LayoutGPT [33] 提示语言模型直接预测物体边界框坐标;Holodeck [32] 结合 GPT-4 推理与 Objaverse 资产检索,生成可导航的室内环境;PhyScene [46] 在扩散模型中整合了碰撞、布局和可达性约束,代表了在生成时引入物理交互引导的早期努力。最近,Rein3D [47] 应用强化学习来优化基于全景扩散的室内场景生成,而 Agentic 3D Scene [48] 利用 VLM 智能体在场景合成过程中进行空间上下文推理。这些方法主要关注场景的合理性或可导航性,而 EmbodiedGen V2 从具身任务出发,在解决物理放置之前,明确将场景分解为机器人、背景、上下文、操作物体和干扰物。对于大规模生成,Infinigen [34] 提供了一个基于约束的程序化室内生成框架,但其碰撞代理未进行凸分解(Convex Decomposition),且不接受自然语言作为控制输入。EmbodiedGen V1 [1] 引入了基于全景的单房间背景生成,但缺乏当前世界生成堆栈所需的任务级语义分解、机器人可达性约束、多房间拓扑、可寻址家具实例以及标准化仿真器导出。
3D资产可供性标注。早期的可供性标注依赖于人工努力:3D AffordanceNet [27] 建立了涵盖23种可供性类别的基准,而 Where2Act [28] 从真实机器人交互轨迹中学习关节物体上的可操作区域——两者均具有高标注成本,且对新颖物体类别的泛化能力有限。最近的工作通过基础模型扩展了覆盖范围:P3-SAM [29] 将 SAM 扩展到原生3D部件分割;SegViGen [49] 重新利用嵌入在3D生成模型中的结构知识进行部件分割;ManiTwin [50] 将操作标注扩展到10万个仿真就绪资产。关键区别在于集成:先前的方法围绕现有资产提供标签或分割流程,而 EmbodiedGen V2 协同生成仿真就绪几何结构和结构化部件级可供性标注,使得生成的物体在进入场景生成时即具备可查询的交互语义。
自然语言驱动的3D场景编辑。Chat-Edit-3D [51] 通过视觉专家模型实现对话驱动的迭代场景编辑,但依赖于2D哈希图集(Hash-Atlas)机制,且不维护物理上可部署的3D世界状态。LayoutGPT [33] 和 Holodeck [32] 在每次提示更新时重新生成整个场景,从而排除了有界、有状态局部编辑的可能性。通用编码智能体 [35, 36] 缺乏领域特定的
19
第 20 页
技能以及持久的世界状态,而专业的内容创作工具如 Blender [52] 和 Maya [53] 并未提供自然语言接口。EmbodiedGen V2 将这两者连接起来:语言智能体在持久的类型化世界状态上运行,而领域技能仅在经过接地(grounding)、碰撞感知放置、物理验证和模拟器兼容导出后,才执行有界的编辑操作。
具身策略学习与仿真到现实迁移。视觉-语言-动作(VLA)模型 [54, 55, 56, 57, 58] 将预训练的视觉-语言骨干网络与机器人动作预测相结合,并展现出强大的跨任务泛化能力;然而,在线强化学习微调需要大量物理上合理的仿真环境 [6]。诸如 RLBench [59] 和 ManiSkill3 [60] 等具身基准测试提供了结构化的评估任务,但其固定的场景和有限的资产库并不适合大规模训练可泛化的策略。领域随机化 [61] 部分缩小了视觉域差距,而 Embody4D [62] 等工作通过 4D 世界模型探索了更丰富的时空建模,但两者均未解决生成多样化、物理有效且任务条件化的训练环境的数据供给问题。EmbodiedGen V2 从环境侧解决了这一瓶颈,通过生成可直接用于下游在线策略改进循环的仿真就绪(Sim-ready)场景。
5 结论
本工作将生成式 3D 世界构建定位为具身智能的仿真基础设施。核心挑战不仅在于生成合理的 3D 内容,更在于生成具身智能体可以操作、交互、评估和学习的场景。基于 EmbodiedGen V1 [1],EmbodiedGen V2 通过统一的仿真就绪世界表示实现了这一转变。该表示使度量尺度、物理有效性、可供性(Affordances)、状态可编辑性以及模拟器接口成为每个生成世界的持久属性,从而确保前一阶段的输出作为任务生成、策略训练和评估的有效输入。
EmbodiedGen V2 通过基于可插拔仿真就绪资产管道的可执行世界生成栈实现了这一愿景。资产管道不将原始生成输出视为最终产物,而是对其进行修复、验证、标注并导出为模拟器就绪实体,进而组合成语言条件化的任务世界、大规模可导航场景以及状态化的 Vibe Coding 编辑。这使得用户可以通过受控的、物理感知的操作来更改仿真环境,而非逐案进行手动场景编辑。从这个意义上说,该系统将仿真就绪资产升级为可重用、策略就绪的具身任务环境。
评估结果表明,这种设计不仅提高了生成质量,还提升了下游的可执行性。资产管道达到了 96.5% 的人类接受率和 98.6% 的碰撞成功率,且 83.3% 的任务驱动交互式世界无需手动修改即可用于下游仿真。这些结果表明,该管道在从资产到世界的生成过程中,既保留了感知质量,又保留了执行约束。更重要的是,生成的环境有助于策略改进:在生成世界中进行的在线强化学习将仿真成功率从 9.7% 提高到 79.8%,且由此产生的策略将真实机器人任务成功率从 21.7% 提高到 75.0% [6]。这闭合了 3D 生成与具身学习之间的实践循环:开放式的意图可以转换为可执行环境,通过物理和交互语义进行验证,通过自然语言进行编辑,并作为可扩展的训练和评估基础被重用。
从更广泛的视角来看,EmbodiedGen V2 指向了 3D 生成系统的下一阶段,其衡量标准不仅在于视觉保真度或多样性,更在于生成的世界是否支持闭环的具身行为。可执行的世界生成为更丰富的任务课程、更广泛的仿真到仿真(sim-to-sim)重用以及更具可扩展性的仿真到现实(sim-to-real)策略开发提供了一条路径。这一方向可以使生成的 3D 世界成为人类任务规范、机器人学习和现实部署之间日益实用的接口。
20
第 21 页
参考文献
[1] Xinjie Wang, Liu Liu, Yu Cao, Ruiqi Wu, Wenkang Qin, Dehui Wang, Wei Sui, 和 Zhizhong Su。Embodiedgen: 迈向具身智能的生成式3D世界引擎,2025。URL https://arxiv.org/abs/2506. 10600。
[2] Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, 和 Jiaolong Yang。用于可扩展且多功能3D生成的结构化3D潜在变量。arXiv预印本 arXiv:2412.01506, 2024。
[3] SAM 3D Team, Xingyu Chen, Fu-Jen Chu, Pierre Gleize, Kevin J Liang, Alexander Sax, Hao Tang, Weiyao Wang, Michelle Guo, Thibaut Hardin, Xiang Li, Aohan Lin, Jiawei Liu, Ziqi Ma, Anushka Sagar, Bowen Song, Xiaodong Wang, Jianing Yang, Bowen Zhang, Piotr Dollár, Georgia Gkioxari, Matt Feiszli, 和 Jitendra Malik。 Sam 3d: 将图像中的任何事物3D化。arXiv预印本 arXiv:2511.16624,2025。URL https://arxiv.org/abs/2511. 16624。
[4] Tencent Hunyuan3D Team。Hunyuan3d 2.1: 从图像到具有生产就绪PBR材质的高保真3D资产,2025。
[5] Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, 和 jin Xie。3d-fixer: 从单张图像进行3D场景的由粗到细的局部补全。在计算机视觉与模式识别会议论文集 (CVPR) 中,2026。
[6] Andrew Choi, Xinjie Wang, Zhizhong Su, 和 Wei Xu。利用生成式3D世界扩展机器人VLA的仿真到现实强化学习。arXiv预印本 arXiv:2603.18532,2026。
[7] Andrew Choi 和 Wei Xu。Rankq: 通过自监督动作排名实现从离线到在线的强化学习。arXiv预印本 arXiv:2605.11151,2026。
[8] Zibo Zhao, Zeqiang Lai, Qingxiang Lin, Yunfei Zhao, Haolin Liu, Shuhui Yang, Yifei Feng, Mingxin Yang, Sheng Zhang, Xianghui Yang, Huiwen Shi, Sicong Liu, Junta Wu, Yihang Lian, Fan Yang, Ruining Tang, Zebin He, Xinzhou Wang, Jian Liu, Xuhui Zuo, Zhuo Chen, Biwen Lei, 等。Hunyuan3d 2.0: 扩展扩散模型以生成高分辨率纹理3D资产。arXiv预印本 arXiv:2501.12202,2025。
[9] Weiyu Li, Xuanyang Zhang, Zheng Sun, Di Qi, Hao Li, Wei Cheng, Weiwei Cai, Shihao Wu, Jiarui Liu, Zihao Wang, Xiao Chen, Feipeng Tian, Jianxiong Pan, Zeming Li, Gang Yu, Xiangyu Zhang, Daxin Jiang, 和 Ping Tan。Step1x-3d: 迈向高保真且可控的纹理3D资产生成。arXiv预印本 arXiv:2505.07747,2025。
[10] Zeqiang Lai, Yunfei Zhao, Haolin Liu, Zibo Zhao, Qingxiang Lin, Huiwen Shi, Xianghui Yang, Mingxin Yang, Shuhui Yang, Yifei Feng, Sheng Zhang, Xin Huang, Di Luo, Fan Yang, Fang Yang, Lifu Wang, Sicong Liu, Yixuan Tang, Yulin Cai, Zebin He, Tian Liu, Yuhong Liu, Jie Jiang, Linus, Jingwei Huang, 和 Chunchao Guo。Hun- yuan3d 2.5: 迈向具有极致细节的高保真3D资产生成。arXiv预印本 arXiv:2506.16504, 2025。
[11] Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu, Ruicheng Wang, Zelong Lv, Yu Deng, Hongyuan Zhu, Yue Dong, Hao Zhao, Nicholas Jing Yuan, 和 Jiaolong Yang。用于3D生成的原生且紧凑的结构化潜在变量。 arXiv预印本 arXiv:2512.14692,2025。
[12] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Do- minik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, Kyle Lacey, Alex Goodwin, Yannik Marek, 和 Robin Rombach。扩展整流流Transformer以实现高分辨率图像合成。arXiv预印本 arXiv:2403.03206,2024。doi: 10.48550/arXiv.2403.03206。
[13] Kolors Team。Kolors: 有效训练用于照片级真实文本到图像合成的扩散模型。arXiv 预印本,2024。
[14] Daniel Gatis。rembg。https://github.com/danielgatis/rembg,2025。一种去除图像背景的工具。
[15] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, 和 Ross Girshick。Segment anything。 arXiv:2304.02643,2023。
[16] BRIA AI。Rmbg-1.4: 背景去除模型。https://huggingface.co/briaai/RMBG-1.4,2023。访问日期: 2025-05-19。
21
第 22 页
[17] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, 和 George Drettakis。3d gaussian splatting for real-time radiance field rendering,2023。URL https://arxiv.org/abs/2308.04079。
[18] Christoph Schuhmann。Aesthetic subsets in laion 2170337258 samples,2025。URL http://captions.christoph-schuhmann.de/aesthetic_viz_laion_sac+logos+ava1-l14-linearMSE-en-2.37B.html。检索于 2025 年 5 月 16 日。
[19] Xinyue Wei, Minghua Liu, Zhan Ling, 和 Hao Su。Approximate convex decomposition for 3d meshes with collision-aware concavity and tree search。ACM Transactions on Graphics (TOG),41(4):1–18,2022。
[20] Fanbo Xiang, Yuzhe Qin, Kaichun Mo, Yikuan Xia, Hao Zhu, Fangchen Liu, Minghua Liu, Hanxiao Jiang, Yifu Yuan, He Wang, Li Yi, Angel X. Chang, Leonidas J. Guibas, 和 Hao Su。SAPIEN: A simulated part-based interactive environment。In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR),2020 年 6 月。
[21] Erwin Coumans 和 Yunfei Bai。Pybullet, a python module for physics simulation for games, robotics and machine learning。http://pybullet.org,2016–2021。
[22] Viktor Makoviychuk, Lukasz Wawrzyniak, Yunrong Guo, Michelle Lu, Kier Storey, Miles Macklin, David Hoeller, Nikita Rudin, Arthur Allshire, Ankur Handa, 和 Gavriel State。Isaac gym: High performance gpu-based physics simulation for robot learning,2021。
[23] Emanuel Todorov, Tom Erez, 和 Yuval Tassa。Mujoco: A physics engine for model-based control。In 2012 IEEE/RSJ International Conference on Intelligent Robots and Systems,pages 5026–5033。IEEE,2012。doi: 10.1109/IROS.2012.6386109。
[24] Genesis Authors。Genesis: A generative and universal physics engine for robotics and beyond,2024 年 12 月。URL https://github.com/Genesis-Embodied-AI/Genesis。
[25] NVIDIA。Isaac Sim。https://github.com/isaac-sim/IsaacSim,2024。版本 5.1.0,Apache-2.0 License。
[26] Haoran Geng, Feishi Wang, Songlin Wei, Yuyang Li, Bangjun Wang, Boshi An, Charlie Tianyue Cheng, Haozhe Lou, Peihao Li, Yen-Jen Wang, Yutong Liang, Dylan Goetting, Chaoyi Xu, Haozhe Chen, Yuxi Qian, Yiran Geng, Jiageng Mao, Weikang Wan, Mingtong Zhang, Jiangran Lyu, Siheng Zhao, Jiazhao Zhang, Jialiang Zhang, Chengyang Zhao, Haoran Lu, Yufei Ding, Ran Gong, Yuran Wang, Yuxuan Kuang, Ruihai Wu, Baoxiong Jia, Carlo Sferrazza, Hao Dong, Siyuan Huang, Yue Wang, Jitendra Malik, 和 Pieter Abbeel。Roboverse: Towards a unified platform, dataset and benchmark for scalable and generalizable robot learning,2025。URL https://arxiv.org/abs/2504.18904。
[27] Shengheng Deng, Xun Xu, Chaozheng Wu, Ke Chen, 和 Kui Jia。3D AffordanceNet: A benchmark for visual object affordance understanding。In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2021。
[28] Kaichun Mo, Leonidas J Guibas, Mustafa Mukadam, Abhinav Gupta, 和 Shubham Tulsiani。Where2Act: From pixels to actions for articulated 3D objects。In Proceedings of the IEEE/CVF International Conference on Computer Vision,2021。
[29] Changfeng Ma, Yang Li, Xinhao Yan, Jiachen Xu, Yunhan Yang, Chunshi Wang, Zibo Zhao, Yanwen Guo, Zhuo Chen, 和 Chunchao Guo。P3-SAM: Native 3D part segmentation。arXiv preprint arXiv:2509.06784,2025。
[30] OpenAI。gpt-5.4 model。https://developers.openai.com/api/docs/models/gpt-5.4,2026。访问于 2026 年 6 月 24 日。
[31] Adithyavairavan Murali, Balakumar Sundaralingam, Yu-Wei Chao, Wentao Yuan, Jun Yamada, Mark Carlson, Fabio Ramos, Stan Birchfield, Dieter Fox, 和 Clemens Eppner。GraspGen: A diffusion-based framework for 6-DOF grasping with on-generator training。arXiv preprint arXiv:2507.13097,2025。
[32] Yue Yang, Fan-Yun Sun, Luca Weihs, Eli VanderBilt, Alvaro Herrasti, Winson Han, Jiajun Wu, Nick Haber, Ranjay Krishna, Lingjie Liu, Chris Callison-Burch, Mark Yatskar, Aniruddha Kembhavi, 和 Christopher Clark。Holodeck: Language guided generation of 3d embodied ai environments。In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,pages 16227–16237,2024。
[33] Weixi Feng, Wanrong Zhu, Tsu-Jui Fu, Varun Jampani, Arjun Akula, Xuehai He, Sugato Basu, Xin Eric Wang, 和 William Yang Wang。Layoutgpt: Compositional visual planning and generation with large language models。In Advances in Neural Information Processing Systems,2023。
22
第 23 页
[34] Alexander Raistrick, Lingjie Mei, Karhan Kayan, David Yan, Yiming Zuo, Beining Han, Hongyu Wen, Meenal Parakh, Stamatis Alexandropoulos, Lahav Lipson, Zeyu Ma, 和 Jia Deng。Infinigen indoors:使用程序化生成实现照片级真实的室内场景。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 21783–21794 页,2024 年 6 月。
[35] OpenAI。OpenAI Codex CLI。https://github.com/openai/codex,2025。访问日期:2026-05-11。
[36] Google。Gemini CLI。https://github.com/google-gemini/gemini-cli,2025。访问日期:2026-05-11。
[37] Homer Walke, Kevin Black, Abraham Lee, Moo Jin Kim, Max Du, Chongyi Zheng, Tony Zhao, Philippe Hansen- Estruch, Quan Vuong, Andre He 等人。BridgeData V2:一个用于大规模机器人学习的数据集。在机器人学习会议(CoRL),2023。
[38] Xuanlin Li, Kyle Hsu, Jiayuan Gu, Karl Pertsch, Oier Mees, Homer Rich Walke, Chuyuan Fu, Ishikaa Lunawat, Isabel Sieh, Sean Kirmani, Sergey Levine, Jiajun Wu, Chelsea Finn, Hao Su, Quan Vuong, 和 Ted Xiao。 在仿真中评估现实世界机器人操作策略。arXiv 预印本 arXiv:2405.05941,2024。
[39] Ben Poole, Ajay Jain, Jonathan T Barron, 和 Ben Mildenhall。DreamFusion:使用 2D 扩散模型进行文本到 3D 生成。 在国际学习表征会议,2023。
[40] Ruoshi Liu, Rundi Wu, Basile Van Hoorick, Pavel Tokmakov, Sergey Zakharov, 和 Carl Vondrick。Zero-1-to-3: 零样本单图像到 3D 物体。在 IEEE/CVF 国际计算机视觉会议论文集,第 9298–9309 页,2023。
[41] Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, 和 Hao Tan。LRM:用于单图像到 3D 的大型重建模型。在国际学习表征会议,2024。
[42] Pushkal Katara, Zhou Xian, 和 Katerina Fragkiadaki。Gen2Sim:利用生成模型扩展仿真中的机器人学习。在 机器人与自动化国际会议,2024。
[43] Ziang Cao, Zhaoxi Chen, Liang Pan, 和 Ziwei Liu。PhysX-3D:基于物理的 3D 资产生成。在 神经信息处理系统进展,2025。
[44] Ziang Cao, Fangzhou Hong, Zhaoxi Chen, Liang Pan, 和 Ziwei Liu。PhysX-Anything:来自单图像的仿真就绪物理 3D 资产。arXiv 预印本 arXiv:2511.13648,2025。
[45] Yunhan Yang, Chunshi Wang, Junliang Ye, Yang Li, Zanxin Chen, Zehuan Huang, Yao Mu, Zhuo Chen, Chun- chao Guo, 和 Xihui Liu。PhysForge:为交互式虚拟世界生成基于物理的 3D 资产。arXiv 预印本 arXiv:2605.05163,2026。
[46] Yandan Yang, Baoxiong Jia, Peiyuan Zhi, 和 Siyuan Huang。PhyScene:用于具身智能的物理可交互 3D 场景 合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,2024。
[47] Dehui Wang, Congsheng Xu, Rong Wei, Yue Shi, Shoufa Chen, Dingxiang Luo, Tianshuo Yang, Xiaokang Yang, Yusen Qin, Rui Tang, 和 Yao Mu。Rein3D:使用全景视频扩散模型强化 3D 室内场景生成。arXiv 预印本 arXiv:2604.10578,2026。
[48] Xinhang Liu, Yu-Wing Tai, 和 Chi-Keung Tang。使用空间上下文感知的 VLM 进行代理式 3D 场景生成。arXiv 预印本 arXiv:2505.20129,2025。
[49] Lin Li, Haoran Feng, Zehuan Huang, Haohua Chen, Wenbo Nie, Shaohua Hou, Keqing Fan, Pan Hu, Sheng Wang, Buyu Li, 和 Lu Sheng。SegViGen:重用 3D 生成模型进行部件分割。arXiv 预印本 arXiv:2603.16869,2026。
[50] Kaixuan Wang, Tianxing Chen, Jiawei Liu, Honghao Su, Shaolong Zhu, Minxuan Wang, Zixuan Li, Yue Chen, Huan-ang Gao, Yusen Qin, Jiawei Wang, Qixuan Zhang, Lan Xu, Jingyi Yu, Yao Mu, 和 Ping Luo。ManiTwin: 将数据生成就绪的数字物体数据集扩展至 10 万。arXiv 预印本 arXiv:2603.16866,2026。
[51] Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Yi Yang, Wenrui Ding, Shuchang Zhou, 和 Ming-Hsuan Yang。 Chat-Edit-3D:通过文本提示进行交互式 3D 场景编辑。在欧洲计算机视觉会议,2024。
[52] Blender Online Community。Blender – 一款 3D 建模和渲染软件包。https://www.blender.org,2024。
[53] Autodesk Inc。Autodesk Maya。https://www.autodesk.com/products/maya,2024。
[54] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn 等人。RT-2:视觉-语言-动作模型将网络知识迁移至机器人控制。arXiv 预印本 arXiv:2307.15818,2023。
23
第 24 页
[55] Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Oier Mees, Suraj Gupta, Homer Walke, Joey Hejna, Ayzaan Wahid, Quan Vuong, Adam Gleave 等人。OpenVLA:一个开源的视觉-语言-动作模型。arXiv 预印本 arXiv:2406.09246,2024。
[56] Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter 等人。π0:一种用于通用机器人控制的视觉-语言-动作流模型。arXiv 预印本 arXiv:2410.24164,2024。
[57] Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li 等人。GigaBrain-0:一个由世界模型驱动的视觉-语言-动作模型。arXiv 预印本 arXiv:2510.19430,2025。
[58] Xuewu Lin, Tianwei Lin, Yun Du, Hongyu Xie, Yiwei Jin, Jiawei Li, Shijie Wu, Qingze Wang, Mengdi Li, Mengao Zhao, Ziang Li, Chaodong Huang, Hongzhe Bi, Lichao Huang 和 Zhizhong Su。HoloBrain-0 技术报告。arXiv 预印本 arXiv:2602.12062,2026。
[59] Stephen James, Zicong Ma, David Rovick Arrojo 和 Andrew J. Davison。RLBench:机器人学习基准与学习环境。IEEE 机器人与自动化快报,5(2):3019–3026,2020。
[60] Stone Tao, Fanbo Xiang, Arth Shukla, Yuzhe Qin, Xander Hinrichsen, Xiaodi Yuan, Chen Bao, Xinsong Lin, Yulin Liu, Tse-kai Chan 等人。ManiSkill3:用于可泛化具身智能的 GPU 并行化机器人仿真与渲染。arXiv 预印本 arXiv:2410.00425,2024。
[61] Josh Tobin, Rachel Fong, Alex Ray, Jonas Schneider, Wojciech Zaremba 和 Pieter Abbeel。域随机化:将深度神经网络从仿真迁移到真实世界。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,第 23–30 页,2017。
[62] Peiyan Tu, Hanxin Zhu, Jingwen Sun, Shaojie Ren, Cong Wang, Jiayi Luo, Xiaoqian Cheng 和 Zhibo Chen。Embody4D:一个面向具身智能的通用 4D 世界模型。arXiv 预印本 arXiv:2605.01799,2026。
24