WorldClaw:用智能体从一句话生成可探索的3D开放世界

快速导读:WorldClaw是一个从开放文本提示生成可探索、可编辑3D世界的智能体框架,通过全局到局部的流程先构建语义地形基础,再生成并放置区域对象。

WorldClaw是一个从开放文本提示生成可探索、可编辑3D世界的智能体框架。与传统方法不同,它不直接输出一个不可编辑的隐式场景,而是通过全局到局部的三阶段流程,先构建语义地形基础,再生成并放置区域对象,最终产出一个由显式3D资产组成的完整世界。

该框架的核心洞察在于:大规模3D世界生成需要同时解决全局空间一致性和局部内容丰富性两个相互制约的问题。WorldClaw通过将智能体的规划能力与程序化地形生成、3D资产生成深度耦合,在两者之间找到了一个可操作的平衡点。

英文题目:WorldClaw: Agentic 3D Open-World Generation at Scale

论文出处:arXiv 每日论文精选 · arXiv:2608.05248

原始论文:PDF / 论文页面

这篇论文解决什么问题?

从开放文本生成大规模3D世界面临三重挑战。第一,系统必须保持全局空间一致性——山脉、河流、植被和建筑需要在数平方公里的尺度上形成有意义的空间组织。第二,局部内容必须足够丰富,每个区域的物体需要与地形和语义上下文协调。第三,生成的资产必须是显式的、可编辑的,才能支持下游的游戏开发、仿真和内容创作。

现有方法在这三个维度上各有侧重但难以兼顾。程序化生成(如Infinigen)可控且产生显式资产,但受限于手工规则的表达力,难以从开放文本灵活驱动。图像或视频提升法(如Marble)内容多样,但缺乏全局一致性和几何保真度。原生3D扩散法(如SynCity)几何质量高,但受限于3D场景数据集的规模,难以泛化到任意开放世界主题。多模态大语言模型智能体擅长高层规划,但缺乏精确的3D空间控制能力。

WorldClaw试图填补的正是这个空白:如何将智能体的语义理解和规划能力,与程序化生成的空间控制力、3D生成模型的资产创建能力结合起来,形成一个从文本到可编辑3D世界的完整管线。

值得注意的是,WorldClaw并不试图替代任何单一技术,而是将它们组织成一个由粗到细的协作框架。智能体负责理解意图和制定规划,程序化生成负责构建地形基础,3D生成模型负责创建个体资产,而基于渲染的反馈循环则负责修正三者之间的不协调。

核心创新

  • 提出语义布局引导的程序化地形生成器,可创建跨空间尺度的可控、区域感知地形。
  • 将全局场景与局部地形约束转化为可执行的区域规划,生成多样化且空间一致的对象布局。
  • 引入智能体迭代优化循环,改进地形与对象质量,纠正对象尺度与姿态,解决对象-地形接触问题。

方法概览

WorldClaw采用由粗到细、全局到局部的三阶段流程:(1)意图分析与规划将提示转化为结构化场景规格P;(2)全局地形生成构建具有区域感知语义的地形基础T;(3)区域对象生成与放置根据P和T,在选定区域生成、重建并放置可编辑的3D资产,并通过基于渲染的智能体进行迭代优化。

  • 意图分析与规划阶段(第4-5页):系统将开放文本提示转化为结构化的场景规格P,包含区域定义、每个区域的语义标签、地形参数和对象需求。这一阶段由MLLM智能体完成,输出的是一个可被后续阶段直接执行的规划文档。
  • 全局地形生成阶段(第6-8页):系统根据场景规格P生成语义布局图,然后通过程序化地形生成器构建复合高度场。该生成器将地形分解为多个区域,每个区域根据其语义标签(如“沙滩”“森林”“山脉”)采用不同的噪声函数和参数,最终融合成连续的地形表面。同时,系统为每个区域分配合适的PBR材质。
  • 地形资产散布(第8页):在地形基础之上,系统根据区域语义和局部表面条件(坡度、高度、材质类型)自动散布地形关联资产,如植被、岩石、道路等。这些资产的位置由程序化规则决定,确保它们在空间分布上符合区域语义。
  • 区域对象生成与放置(第9-11页):对于每个规划区域,系统调用3D生成模型创建区域对象,并根据地形约束计算其初始位姿。对象生成采用实例级方式,每个对象独立生成和重建,确保它们是显式的、可编辑的网格资产。
  • 基于渲染的智能体优化(第11页):这是WorldClaw的关键创新。系统从多个视角渲染场景,智能体检查渲染图像中的问题——对象尺度是否合理、姿态是否自然、是否与地形正确接触、是否存在漂浮或穿透。发现问题后,智能体生成针对性的编辑操作,如调整尺度、旋转、平移或局部地形变形,然后重新渲染验证。
  • 对象-地形接触处理(第11页):对于漂浮或穿透的对象,系统采用局部共变形策略:同时调整对象底部顶点和其下方地形的高度场,使两者形成自然的接触关系,而不是简单地将对象向下移动。
  • 迭代优化循环(第11页):优化过程维护一个报告队列,记录所有待处理的问题。每个问题经过评估、编辑、重新渲染验证的完整循环,直到问题解决或达到最大迭代次数。这种闭环反馈机制使得系统能够修正初始生成中的各种空间不协调。
  • 多区域协调(第9页):在放置区域对象时,系统不仅考虑当前区域的地形约束,还检查与相邻区域的边界一致性,避免对象跨越区域边界或与相邻区域的对象产生冲突。

逐图理解论文

失败的直觉

失败的直觉
Figure 8 Qualitative comparison with the representative text-driven 3D scene generation methods. All methods are conditioned on prompts that share the same medieval-village theme and comparable scene requirements, with the wording adapted when necessary to each method’s input format.

图8是关键的定性比较图,将WorldClaw与SynCity、Marble、MajutsuCity、WorldGen和GPT 5.6 Sol在相同的中世纪村庄主题下进行对比。观察重点在于地形组织的空间连贯性、区域内容的丰富度以及自由视角下的视觉质量。WorldClaw在地形过渡和区域结构上明显优于其他方法。

核心洞察

核心洞察
Figure 1 Overview of WorldClaw. Given an open-ended text prompt, WorldClaw constructs an explicit, explorable, and editable 3D world through a three-stage global-to-regional pipeline. (1) Intent Analysis and Planning translates the prompt into a structured scene specification. (2) Global Terrain Generation establishes a region-aware terrain foundation with coherent geometry, appearance, and spatial semantics. (3) Regional Object Generation and Placement populates planned regions with editable 3D assets and refines their arrangements and interactions with terrain.

图1展示了WorldClaw的完整三阶段流程:从开放文本提示开始,经过意图分析与规划生成结构化场景规格,然后进行全局地形生成构建区域感知的地形基础,最后在区域对象生成与放置阶段填充可编辑的3D资产。这张图是理解整个框架工作流的核心。

方法贡献

方法贡献
Figure 2 Overview of global terrain generation and refinement.(a) Initial Height-Field Generation constructs composite terrain geometry from the semantic layout map and region-specific terrain parameters and assigns materials to the corresponding regions.(b) Global Terrain Asset Scattering instantiates terrain-associated assets according to regional semantics and local surface conditions.(c) Terrain Refinement renders, inspects, and locally edits the terrain to correct geometric transitions, material scales, asset distributions, and rendering artifacts.

图2详细展示了全局地形生成与优化的三个子步骤:初始高度场生成根据语义布局图和区域参数构建复合地形并分配材质;全局地形资产散布根据区域语义和局部表面条件放置地形关联资产;地形优化通过渲染检查修正几何过渡、材质尺度和渲染瑕疵。

核心证据

核心证据
Figure 4 Tropical pirate stronghold. An island terrain organizes dense vegetation, settlements, docks, and ships into distinct coastal regions. The figure presents the global composition, regional close-ups, local walk views, and their corresponding instance, depth, and normal renderings.

论文在多种开放世界场景上验证了WorldClaw的能力——热带海盗岛、峡谷部落、沙漠战场、雪地山谷。每个场景都展示了从全局地形到局部漫游的完整空间组织。在与其他五种方法的定性比较中,WorldClaw在地形组织的空间连贯性上明显优于SynCity和Marble,在内容多样性上超越了最接近的基线WorldGen。更重要的是,WorldClaw生成的所有资产都是显式的独立网格,可以直接导入游戏引擎或3D软件进行编辑——这是隐式场景表示方法无法做到的。

实验如何设计?

  • 定性评估场景:论文在多种开放世界提示上展示了WorldClaw的生成结果,包括热带海盗岛(第13页)、峡谷部落(第14页)、沙漠战场(第15页)、雪地山谷(第16页)等,每个场景都包含全局视图、区域特写和局部漫游视角。
  • 对比方法:与五种代表性方法进行定性比较(第17-18页),包括程序化生成代表SynCity、图像提升法代表Marble、LLM驱动方法MajutsuCity、编码智能体方法GPT 5.6 Sol,以及最接近的基线WorldGen。所有方法使用相同的中世纪村庄主题提示。
  • 评估维度:比较聚焦于三个维度——地形组织的空间连贯性、区域内容的丰富度和多样性、自由视角下的视觉外观质量。
  • 硬件配置:所有实验在配备4块NVIDIA H20 GPU的服务器上运行,论文未报告在其他硬件配置下的性能表现。
  • 补充结果:附录中展示了更多场景的生成结果(第32-38页),包括中世纪村庄、雪地河畔村落、沙漠冒险营地、日式岛屿城镇、火山恶魔巢穴、宝石矿场和霍比特风格山谷等。

关键结果与论文证据

  • WorldClaw能够从开放文本提示生成空间连贯的大规模3D世界,地形区域之间的过渡自然,对象分布符合区域语义(第13-16页,图4-7)。
  • 在定性比较中,WorldClaw在地形组织上明显优于SynCity和Marble,后两者缺乏明确的区域结构和长程空间一致性(第17-18页,图8)。
  • 与最接近的基线WorldGen相比,WorldClaw在内容多样性和地形表达力上更优,WorldGen倾向于生成较为平坦和简单的地形(第17页)。
  • 基于渲染的智能体优化循环能够有效纠正对象尺度错误和漂浮问题,在多个场景中展示了优化前后的明显改善(第11页,图3)。
  • 语义布局引导的程序化地形生成器能够创建跨空间尺度的可控地形,从岛屿到山脉再到峡谷,地形特征与文本描述高度一致(第13-16页)。
  • 系统生成的资产是显式的独立网格,支持下游编辑和复用,这是与隐式场景表示方法的关键区别(第4页)。
  • 智能体优化循环的计算开销较大,每个对象需要多轮渲染和评估,对于包含大量对象的复杂场景,总生成时间显著增加(第22页)。
  • 系统对底层模型的质量高度依赖:开源语言模型难以生成可执行且一致的程序化地形代码,开源图像模型难以生成可用的语义布局(第22-23页)。

阅读时需要注意

  • 对底层模型依赖度高:开源LLM在生成程序化地形和材质代码时的一致性和可执行性不足,开源图像模型在语义布局生成上的表现也不稳定,最终视觉质量受限于3D生成骨干模型的能力(第22-23页)。
  • 代码生成稳定性风险:LLM生成的程序在尺度估计、数值参数或节点连接上容易出错,导致地形不一致或材质效果不佳,通常需要多次迭代才能获得可接受的结果(第22页)。
  • 场景生成效率开销大:为每个对象单独生成和重建3D资产,并进行多轮智能体优化,导致推理延迟和计算成本高,对于简单场景而言效率低下(第22页)。
  • 无法恢复部件层级结构:当前框架主要依赖生成式3D模型重建区域对象,无法持续恢复显式的部件层级、参数化结构或交互逻辑,限制了生成资产在下游任务中的进一步编辑能力(第23页)。
  • 硬件限制未充分探索:实验仅在配备4块NVIDIA H20 GPU的服务器上进行,未报告在其他硬件配置下的性能表现或可扩展性(第23页)。

关联工作

  • Infinigen(第19页):经典程序化生成方法的代表,通过规则和程序合成自然环境。WorldClaw在此基础上引入LLM和生成模型,以提升灵活性和语义可控性,但牺牲了Infinigen的完全确定性。
  • Marble(第17页):图像/视频提升法的代表产品,从2D生成结果重建3D场景。WorldClaw在定性比较中展示了其在全局地形组织和资产可编辑性上的优势,但Marble在单视角外观质量上可能更优。
  • WorldGen(第17页):结合语言推理、程序化布局和对象级增强生成可遍历、可编辑3D世界的基线方法。WorldClaw在定性比较中与其最接近,但在内容多样性和地形表达力上更优。
  • MajutsuCity(第17页):LLM驱动的城市级场景生成方法,侧重于实例布局。WorldClaw在定性比较中展示了其在非城市自然地形和开放世界内容上的优势。
  • SynCity(第17页):原生3D扩散方法,通过分块潜在空间生成场景。WorldClaw在定性比较中展示了其在长程组织和地形过渡上的优势,但SynCity在局部几何质量上可能更精细。

发表评论