快速导读:GS-Agent是一个多智能体框架,通过让Manager、Entity和Render Agent协作编写代码并调用物理引擎,从自然语言生成具有物理合理性和细粒度可控性的4D世界。
GS-Agent 代表了一种从“像素生成”向“程序化模拟”转变的新范式。传统文本到视频模型(如 Sora2、Wan2.2)虽然能生成视觉上连贯的视频,但往往缺乏严格的物理一致性,且难以进行细粒度的后期控制。GS-Agent 通过引入多智能体系统,将自然语言指令转化为可执行的物理模拟代码,从而在 Genesis 物理引擎中构建出具有真实物理属性的 4D 世界。
该框架的核心在于其分工明确的多智能体架构:Manager Agent 负责全局任务分解与验证,Entity Agent 负责实体资产生成与物理参数调整,Render Agent 负责相机与光照控制。这种设计不仅提高了生成内容的物理合理性,还赋予了用户对场景细节的精确控制能力,为自动化内容创作提供了新的技术路径。
英文题目:GS-Agent: Creating 4D Physical Worlds With Generative Simulation
论文出处:arXiv 每日论文精选 · arXiv:2607.21522
原始论文:PDF / 论文页面
对应视频标题:GS-Agent:让LLM写代码调用物理引擎,生成真正的4D物理世界|推荐指数:★★★★★
这篇论文解决什么问题?
当前视频生成领域面临两大挑战:一是物理一致性缺失,生成的视频常出现物体穿透、流体行为异常等违反物理定律的现象;二是可控性不足,用户难以通过自然语言精确调整相机轨迹、物体材质或运动参数。
传统计算机图形学方法虽然能保证物理正确性,但依赖大量人工调整,效率低下。而现有的基于大语言模型的代理框架(如 SWE-Agent)主要面向软件工程,缺乏对物理模拟领域的专门优化,直接应用于 4D 世界生成时效果有限。
因此,如何结合大语言模型的推理能力与物理引擎的精确性,实现自动化、高保真且可控的 4D 世界生成,成为亟待解决的关键问题。
核心创新
- 提出端到端多智能体框架,将4D世界创建分解为实体管理和渲染配置,模拟人类工作流。
- 设计专用的Agent-Simulator Interface,将底层物理引擎API抽象为语义化工具,提高代码生成的稳定性和准确性。
- 实现自主错误检测与恢复,Agent能识别物理模拟失败(如漏水)并自动修复。
- 提供细粒度自然语言控制,支持动态调整相机轨迹、实体属性和运动参数。
方法概览
GS-Agent包含三个专用Agent:Manager Agent负责任务分解、全局配置和验证;Entity Agent负责资产检索/生成、材质调整和运动控制;Render Agent负责相机、光照和视频录制。Agent通过SendMessage工具通信,并通过结构化接口与Genesis物理引擎交互,生成可执行模拟代码和渲染视频。
- GS-Agent 采用三智能体架构:Manager Agent 作为协调者,解析自然语言指令,分解任务,配置全局模拟选项,并验证最终结果;Entity Agent 负责资产检索或生成,调整材质参数以确保物理合理性,并控制实体运动;Render Agent 负责相机轨迹规划、光照设置及视频录制。
- 智能体之间通过 SendMessage 工具进行通信,确保信息同步与任务协同。这种分工模拟了人类 CG 艺术家的工作流程,提高了系统的模块化程度与可维护性。
- 论文设计了专用的 Agent-Simulator Interface,将 Genesis 物理引擎的底层 API 抽象为语义化工具。这一接口降低了大语言模型生成正确模拟代码的难度,提高了代码生成的稳定性与准确性。
- GS-Agent 具备自主错误检测与恢复能力。当物理模拟失败(如容器漏水)时,Agent 能自动识别问题,调整材质参数或修复资产,无需人工干预。
- 系统支持细粒度自然语言控制,用户可通过对话动态调整相机运动、实体属性及运动参数,实现高度定制化的 4D 世界生成。
逐图理解论文
现有方法的局限

现有的文本到视频模型,如 Sora2,虽然能生成流畅的画面,但经常违背物理常识,比如物体穿透或流体行为异常。传统图形学方法虽然物理正确,但需要大量人工调整,无法自动化。
GS-Agent 的贡献

图 2 概述了 GS-Agent 的架构。重点关注 Manager、Entity 和 Render Agent 的职责分工,以及它们如何通过 SendMessage 工具和结构化接口与物理引擎交互。
自主纠错与验证

图 4 展示了自主错误恢复能力。观察 GS-Agent 如何自动检测漏水问题并应用刚性材质补丁进行修复,无需人工干预。
实验如何设计?
- 在 NewtonGen 基准(24 个场景)上评估物理不变性得分(PIS),衡量生成视频是否符合物理定律。
- 在 30 个复杂场景上评估对齐分数(Alignment Score)和美学指标(Aesthetic),衡量生成内容与用户指令的一致性及视觉质量。
- 与 Sora2、Wan2.2、SWE-Agent 及其视觉增强版本进行对比,验证 GS-Agent 在物理合理性与可控性方面的优势。
- 进行用户研究(270 份有效回复),从物理合理性、相机可控性、内容对齐和美学四个维度评估生成质量。
- 通过消融实验验证多智能体设计和专用接口的必要性,分析各组件对整体性能的贡献。
关键结果与论文证据
- GS-Agent 在 NewtonGen 基准上的 State-PIS 达到 0.83,显著高于 SWE-Agent w/ Visual 的 0.57,证明其生成的视频具有更强的物理一致性。
- 在对齐分数上,GS-Agent 得分为 32.2,略高于 Sora2 的 30.6,表明其能较好地遵循用户指令。
- 用户研究显示,GS-Agent 在物理合理性(4.33 vs 4.01)、相机可控性(4.32 vs 3.92)和内容对齐(4.70 vs 4.65)方面均优于 Sora2。
- 消融实验表明,移除多智能体设计会导致 State-PIS 大幅下降至 0.42,证明多智能体协作对生成物理合理场景至关重要。
- 移除专用 Agent-Simulator Interface 会导致模型难以生成稳定的模拟代码,进一步验证了该接口设计的必要性。
- GS-Agent 在不同 LLM 骨干(如 gpt-5, gemini-3-pro, Qwen3.5-27B)上均表现良好,显示出框架的通用性。
阅读时需要注意
- 受限于当前物理模拟技术的保真度,无法完美模拟所有现实世界物理现象,如复杂流体与软体交互。
- 基础模型在运动理解和电影感评估方面仍有不足,可能导致自我批评不准确或确认偏误。
- Agent 可能错误诊断失败原因,陷入调整错误参数的循环,影响生成效率。
- Agent 可能幻觉出不存在的物理引擎 API 或材质属性,导致模拟失败。
关联工作
- Sora2 和 Wan2.2 作为基线文本到视频模型,虽在视觉质量上表现优异,但缺乏物理合理性。
- SWE-Agent 作为软件工程领域的代理框架,其视觉增强版本在物理模拟任务上表现有限,突显了领域专用接口的重要性。
- NewtonGen 作为物理一致性视频生成基准,为评估 GS-Agent 的物理合理性提供了标准。
- Genesis 作为底层物理引擎,为 GS-Agent 提供了精确的物理模拟能力。
- Meshy 作为文本到 3D 模型生成工具,为 GS-Agent 提供了资产生成能力。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
GS-Agent:通过生成式模拟构建4D物理世界
Hongxin Zhang1,2, Chunru Lin1, Junyan Li1, Zhou Xian2, Tsun-Hsuan Wang2, Chuang Gan1 1 马萨诸塞大学阿默斯特分校 2 Genesis AI {hongxinzhang,chunrulin,junyanli,chuangg}@umass.edu {zhouxian,johnson}@genesis-ai.company
“一块温暖、有光泽的融化巧克力特写,正缓缓淋在蛋糕上……”
“一个跟踪镜头,展示篮球从天空落下,击中沙漠并在落地后在沙地上滚动……” 2026 7月 23日 “固定机位镜头捕捉到一颗鲜红的草莓在半空中击中一小滴透明水滴的瞬间。”
“一块柔软的面团在操作台上被均匀压平,由侧面的固定摄像机拍摄……”[cs.RO]
图 1:GS-Agent 通过生成式模拟从自然语言创建4D世界,产生液体、可变形物体和刚体之间物理上合理的交互,并具备电影级的摄像机和光照控制能力。GS-Agent 生成的不仅仅是像素;包括细粒度动力学、深度和表面法线在内的数据模态能够支持更丰富的应用。
摘要
从自然语言描述中创建动态且物理真实的4D世界既令人着迷又充满挑战。传统的计算机图形学方法依赖于人工创建,需要大量人力来微调材质、运动和视觉保真度。生成式基础模型的最新进展激发了人们从大规模数据中学习生成此类4D世界的兴趣;然而,现有方法在确保物理合理性和可控性方面仍然面临困难。在本工作中,我们采取了一条不同的路径,利用基础模型构建一个智能体系统,该系统模拟人类传统上创建4D世界的方式,同时实现了全流程自动化。我们提出了 GS-Agent,这是一个端到端的多智能体框架,它将物理引擎集成在循环中,从自然语言生成真实、动态且可控的4D物理世界。
预印本。
第 2 页
度。受人类构建4D世界方式的启发,GS-Agent将任务分解为实体管理(涵盖3D资产策展、材质调整、放置和运动控制)和渲染配置(包括相机和灯光操作)。多个具有不同专长的智能体通过代码与物理引擎交互,寻求多模态反馈,并协作迭代构建与给定描述一致的4D世界。实验结果表明,GS-Agent能有效将自然语言转化为多样且物理上合理的4D世界,展现出液体、可变形物体和刚体之间丰富的交互,同时实现了电影级的相机和灯光控制。我们展望GS-Agent作为4D世界生成新范式的基石,赋能创意内容创作和物理AI。详见我们的项目页面1以观看视频。
1 引言
创建动态且物理合理的4D世界在具身智能、自动驾驶、游戏和电影制作等领域具有深远的应用前景。构建多样且逼真的物理环境的能力,使得具身智能体能够在更安全、更丰富的环境中进行训练和评估,有助于缩小部署期间的仿真到现实(sim-to-real)差距[78]。此外,允许用户通过自然语言构建和控制4D世界,极大地降低了创意内容创作的门槛,为更具表现力的叙事、更丰富的娱乐体验以及全新的创意形式打开了大门。然而,传统方法需要巨大的人力投入,从3D资产策展、材质参数调整到场景构建、物体运动编排、灯光设置以及相机轨迹设计。
基础模型的最新进展显著提升了语言理解[47]、图像合成[36, 22]、视频生成[5, 68, 48, 57]以及3D/4D场景创建[71, 4]的能力。然而,这些模型在物理合理性[43, 29]和可控性[20]方面仍然面临挑战。这些局限性表明,仅从大规模数据中学习4D世界不足以产生一致且符合物理规律的场景。受人类创造世界方式的启发,一个互补的方向是利用大语言模型的推理能力[18]来构建智能体系统,以规划、批判并迭代优化世界生成。先前的工作展示了智能体系统的潜力:[67]开发了一个能够自主解决GitHub问题的软件工程智能体,而[25]构建了一个通过Blender制作静态3D场景的智能体管道。
在本工作中,我们引入了GS-Agent,这是一个端到端的多智能体框架,它将物理引擎集成在循环中,直接从自然语言描述生成真实、动态且可控的4D物理世界。受人类工作流程的启发,GS-Agent将创建过程分解为两个协调的组件:实体管理,包括3D资产检索、材质调整、物体放置和运动控制;以及渲染配置,涵盖相机操作和灯光设计。多个专用智能体通过代码与物理引擎交互,获取多模态反馈,并协作优化模拟过程,以生成忠实遵循给定指令的世界。
我们在涉及液体、可变形物体和刚体之间复杂交互,以及多样相机和灯光控制的场景上评估了GS-Agent。与最先进的文本到视频模型(Sora2 [48] 和 Wan2.2 [57])以及智能体基线(SWE-Agent [67] 和我们带有视觉反馈的增强变体)相比,GS-Agent生成的4D世界表现出更高的物理合理性、更强的指令保真度和更精细的可控性。此外,其智能体设计使其能够以完全自主的方式识别并解决意外故障。我们展望GS-Agent作为迈向4D世界生成新范式的垫脚石,实现交互式内容创作并支持大规模、符合物理规律的数据生成。总之,我们的贡献有三方面:
• 我们通过利用强大的物理引擎和模拟人类4D世界构建工作流的自动化智能体框架,解决了从自然语言创建4D物理世界这一具有挑战性的问题。 • 我们引入了GS-Agent,这是一个端到端的多智能体框架,它通过代码与物理引擎交互,主动寻求多模态反馈,并协作构建与自然语言一致的4D世界。
1https://umass-embodied-agi.github.io/gs-agent/
2
第 3 页
• 实验结果表明,与现有的文本到视频及智能体基线方法相比,GS-Agent 能够生成更具物理合理性、可控性以及与指令对齐的 4D 世界,这凸显了将智能体框架与强大物理引擎相结合的巨大潜力。
2 相关工作
2.1 3D 和 4D 生成
从自然语言创建 3D 场景一直是一个长期存在的挑战 [10]。虽然早期工作依赖于基于规则的语言-空间映射 [9, 42],但现代方法从海量数据中学习生成 3D 内容 [71, 70, 14, 60, 40],主要依赖于生成式扩散模型 [61] 和高斯泼溅(Gaussian Splatting)[65]。为了将具有物理合理性的运动融入 3D 场景,许多工作利用物理求解器 [12, 4, 66, 76, 17, 58]。值得注意的是,[41] 利用大语言模型(LLM)编写 Blender 脚本以进行运动控制,然后基于物理合理的帧生成视频。[32] 使用混合生成式模拟器,从单张图像生成动作条件驱动的动态 3D 场景。与之不同,我们提出构建端到端的智能体系统,以自动化创建 4D 世界的过程,从而避免视觉生成模型不可靠的泛化能力所带来的问题。
2.2 文本到视频生成
现代视频生成模型主要基于扩散模型 [54, 22, 5, 21, 13] 或自回归模型 [72, 30]。扩散 Transformer(DiT)[50, 48, 68] 的引入进一步证明了通过扩展数据量来学习视频生成的潜力,部分工作引入了物理先验以提高视频的物理真实性 [73, 41, 38]。然而,这些模型在物理合理性 [29]、可控性 [20, 77] 和一致性 [8] 方面仍然面临困难。我们的方法在物理引擎中构建世界,该引擎提供了合理的物理交互。
2.3 基础模型智能体
随着基础模型 [47, 18] 的快速发展,涌现出一大批强大的智能体 [55, 63, 59]。这些智能体涵盖了仅在文本领域运行的智能体 [19, 53],到能够与图形用户界面(GUI)交互的多模态智能体 [23, 1],在物理世界中充当机器人的智能体 [2, 26, 16],以及通用智能体 [51, 24]。多智能体框架在各种任务中显示出显著的性能提升 [31, 62, 24],包括具身智能 [74]、推理 [15] 和代码生成 [39]。值得注意的是,[67] 构建了一个软件工程智能体,能够自动解决真实的 GitHub 问题;[25, 56, 69, 35] 构建了能够利用 Blender(一款 3D 软件)来创作静态 3D 场景的智能体。与它们不同,我们引入了首个能够结合统一物理引擎,从自然语言构建 4D 世界的智能体。
3 GS-Agent:一种带有生成式模拟闭环的多智能体框架
创建 4D 世界是一个复杂的多阶段过程,通常需要不同专业领域的协同努力:实体建模、材质设计、空间布局、运动指定、灯光设置和相机规划。在人类制作流程中,例如视觉特效或游戏开发,导演将高层需求转化为可执行的计划,将任务委派给专家,评估中间输出,并通过自然语言沟通协调迭代优化。受此工作流程的启发,我们引入了 GS-Agent,这是一个端到端的多智能体框架。在该框架中,三个专用智能体——管理智能体(Manager Agent)、实体智能体(Entity Agent)和渲染智能体(Render Agent)——协同合作,在物理引擎之上构建具有物理合理性的 4D 世界,如图 2 所示。我们首先在 3.1 节介绍物理引擎的基本概念,然后在 3.2 节介绍三个专用智能体:管理智能体负责用户通信、逐步规划、任务委派、验证以及全局模拟配置;实体智能体专注于实体创建、形态、材质分配和运动控制(见 3.3 节);渲染智能体负责相机和灯光操作,并向其他智能体提供视觉反馈(见 3.4 节)。智能体之间通过 SendMessage 工具进行通信,并通过结构化工具接口与物理引擎交互。在系统底层,所有智能体生成并优化与物理引擎接口的可执行代码,请求包括物理边界检查、程序运行时信息、图像和视频在内的多模态反馈,彼此通信,并迭代改进世界,直到满足自然语言目标。附录 B 提供了完整的提示词和工具接口列表。
第 4 页
GS-Agent Simulation Code Manager Agent
# Global Scene Configuration Messages Messages ….. # Lighting Configuration ….. # Camera Configuration ….. A cool dynamic physical world please! ►ConfigureSimOptions ►ConfigureVisOptions # Entity Creation ►ConfigureMPMOptions ►ResetScene ….. ►AdvanceScene ►… … # Entity Control ….. # Camera Control Tool ►GetSceneInfo Physics ….. ►GetEntityInfo Engine Boxes # Scene Advancement ►SendMessage …..
►RetrieveAsset ►ConfigureRenderer User ►AddEntity►UpdateEntity ►ConfigureCameraModel►ConfigureLighting ►RemoveEntity ►ConfigureCameraControl ►ConfigureEntityControl ►RenderCurrentFrame ►… … ►… …
Messages
Render Entity Agent Agent Video
图 2:GS-Agent 概述。Manager Agent 解释自然语言描述,将其分解为可操作的子任务,配置全局模拟选项,控制场景推进,并将任务委派给相应的智能体。Entity Agent 策划用于形态创建的资产,根据空间约束放置实体,调整材料参数以确保物理合理性,并控制实体运动。Render Agent 操纵光照和相机设置,组合相机轨迹,并配置视频录制。智能体通过 SendMessage 工具进行通信,并通过结构化工具接口与物理引擎交互。最终的 4D World 表示为可执行的模拟代码和渲染视频。完整的工具描述见附录 B。
3.1 物理引擎
物理引擎为构建和模拟动态世界提供了统一的计算框架。其核心组件包括: • 实体(Entity)。实体组件定义了场景中的对象。每个实体定义为 $E = (Morph, Material, Surface)$,其中 Morph 指定几何形状(基本形状或网格),Material 决定物理行为(刚性、可变形、液体),Surface 控制视觉属性。它还包含控制参数,如初始速度、施加的力、运动学轨迹和约束,为求解器提供完全指定的对象状态和运动输入。
• 求解器(Solver)。求解器组件控制引擎如何计算物理动力学。求解器根据实体材料进行选择和配置,例如,用于固体对象的刚体求解器,用于可变形对象的连续介质方法如物质点法(MPM)[28],以及用于流体的基于粒子的求解器如光滑粒子流体动力学(SPH)[46]。求解器参数(如时间步长和分辨率)控制稳定性和准确性,确保实体运动遵循一致的物理定律。
• 渲染器(Renderer)。渲染器组件在屏幕上显示物理模拟的结果,它通常是一个独立于物理引擎本身的系统。渲染器参数包括相机(其位置、角度和视场)、光照(光源的类型、位置、颜色和强度)和阴影(其质量和绘制距离)。
3.2 Manager Agent
任务分解与委派。给定自然语言描述,Manager Agent 解释用户意图,推理所需的场景组件,并制定可操作的多步计划。它根据能力将子任务一次分配给 Entity Agent 或 Render Agent——例如,使用适当的几何形状和材料属性创建资产、在几何约束下进行空间放置,或为了期望的电影效果优化相机轨迹。每个子任务完成后,Manager Agent 会对结果进行批判性验证,并触发迭代优化,直到满足规范。 场景配置。Manager Agent 在创建之前和期间配置模拟和可视化选项。它设置全局模拟参数(如时间步长、子步、重力)、求解器特定设置(如 MPM 网格分辨率和域边界、SPH 粒子大小)以及可视化选项(阴影、背景颜色、粒子渲染模式、分割级别)。
4
第 5 页
这些配置确保了物理稳定性、一致的领域尺度以及用于下游推理的清晰视觉诊断。
时间线控制。为了评估构建世界的动态演变,管理智能体(Manager Agent)调节模拟的时间进程。它可以推进或重置场景以探测中间状态、评估修改结果,或执行多阶段 rollout。在验证所有组件均满足语言规范后,该智能体启动最终执行并触发视频捕获,从而生成完整的 4D World。
3.3 实体智能体
3D 模型资产检索。为了构建逼真的实体,实体智能体(Entity Agent)首先尝试从精选库(BlenderKit2 和 PolyHaven3)中检索资产,该库使用基于文本和图像嵌入构建的语义索引进行检索。查询嵌入由文本编码器和 CLIP [52] 生成,在搜索预计算的元数据和多视图图像嵌入之前进行拼接和归一化。检索器返回具有有助于下游创建的信息的前几个候选项:本地文件路径、简短描述、预览图像、匹配得分和轴对齐包围盒(AABB)。
3D 模型资产生成。如果智能体未能检索到满足要求的适当 3D 模型资产,它将尝试通过调用 Meshy [44](一种文本到 3D 模型工具)来生成 3D 模型资产,并计算资产的相同元数据,将其保存到精选资产库中。根据生成结果,智能体可以相应地调整文本查询。在达到最大失败尝试次数后,智能体将尝试回退到使用基本图元来构建所需的形态。
实体放置。基于 3D 模型资产元数据,实体智能体计算合理的尺度、方向和位置。它使用标准方向对齐资产,根据 AABB 包围盒重新缩放网格,并放置它们以满足世界空间约束,如支撑表面、非穿透性和适当的间距。实体智能体查询场景状态并向渲染智能体(Render Agent)请求视觉反馈;如果检测到不对齐或碰撞,它会进行校正并迭代。
物理合理的材料调整。调整物理材料参数 notoriously 困难,对于非专家来说往往不切实际 [37]。配置错误的参数可能导致不切实际或不稳定的模拟。实体智能体使用常识先验初始化材料选择,然后根据物理引擎提供的真实物理反馈迭代地优化参数。以连续体材料为例,实体智能体根据模拟中表现出的实际变形程度调整基本原理参数,如杨氏模量、泊松比和屈服应力(用于塑性)。它还将每个实体的材料参数与求解器约束(例如,MPM 网格大小、SPH 粒子半径)对齐,以维持稳定的分辨率尺度。
实体运动。实体智能体通过编辑在模拟期间执行的每步控制函数来控制运动。支持的控制包括 PD 控制器、刚体的直接位置/速度/力命令,以及基于粒子的材料的可编程发射器。此接口允许在同一模拟时间线内脚本化运动学轨迹和瞬态粒子事件。
3.4 渲染智能体
相机定位。渲染智能体(Render Agent)确定用于中间检查和最终渲染的相机位置和内部参数。它通过将其锚定在世界坐标系中来解释口头指令,例如对特定视角或构图的请求。必要时,智能体查询实体的空间状态(例如,位置和范围),以按照与请求的视觉视角一致的方式定位相机。
相机运动和视频捕获。为了生成时间上连贯的可视化效果,渲染智能体将相机运动表示为在模拟过程中执行的显式控制代码。此代码指定相机轨迹(例如,轨道运动、推拉运动或实体跟踪运动)以及相应的帧捕获计划。由于轨迹是编码的而不是烘焙到像素中的,因此可以进一步细化,例如通过平滑或重新参数化,而无需更改底层物理模拟。相机更新与模拟时间步长同步,确保记录的帧反映物理一致的时间演变。
光照。渲染智能体配置照明以满足场景的描述性要求,同时保持视觉和物理一致性。根据渲染后端的不同,它可能采用方向光、环境贴图或局部光源。智能体调整照明位置和强度以实现请求的氛围或强调,同时避免可见光源或照明不一致等伪影。这使得生成的场景能够以稳定和可解释的方式反映预期的光照条件。
2https://www.blenderkit.com/ 3https://polyhaven.com/
5
第 6 页
“一段写实风格的固定视角视频,展示了一块水平放置的矩形粉色海绵被两端的透明玻璃夹块紧紧挤压,随后被扭转直至海绵剧烈碎裂。”
我们的方法
Sora2
Wan2.2
SWE- Agent
SWE- Agent w/ Visual
“一段高度详细的计算机生成图像(CGI)模拟,展示一颗子弹穿透悬浮在空中的大水球。采用极端慢动作拍摄,子弹进入时产生飞溅,穿过时产生空化尾迹。镜头跟随子弹,随着水球解体而向前推进并穿过水球。”
我们的方法
Sora2
Wan2.2
SWE- Agent
SWE- Agent w/ Visual
图3:GS-Agent 与基线方法的定性比较。更多案例见附录 C。
4 实验
4.1 实验设置
为了系统地评估 GS-Agent 构建 4D 物理世界的能力,我们在两个评估套件中进行了实验。第一个套件包含来自 NewtonGen 基准 [73] 的 24 个场景,专门用于测试 12 种不同的物理定律(例如抛物线运动、形变)。为了评估我们方法解锁的新颖能力,我们收集了第二个套件,包含 30 个复杂场景,这些场景涉及多物体交互中的非连续动力学(例如碰撞)以及动态相机控制。
指标。NewtonGen 基准报告物理不变性得分(PIS),该得分衡量理论上不变的物理量(例如抛物线运动期间的垂直加速度)的相对标准差。虽然原始论文使用 SAM2 对每帧中的物体进行分割并近似质心以进行此计算(Video-PIS),但我们的智能体模拟框架独特地解锁了更严格的指标。我们在每个时间步直接从物理引擎中提取精确的 3D 质心运动学数据以计算 State-PIS。这种基于真值的测量对于仅输出像素数据的标准文生视频模型来说是 inherently 不可访问的。我们还使用 Perception Encoder 特征相似度 [7] 测量生成视频与文本指令之间的对齐得分,并采用 VBench [27] 中的美学指标。
基线。我们将我们的方法与两类基线进行比较:文生视频生成模型和能够编码以解决任务的基础智能体。对于文生视频生成模型,我们与 Sora-2 [48] 和 Wan2.2 [57] 进行比较,它们分别是代表性的闭源和开源最先进模型。对于基础智能体,我们与 SWE-Agent [67] 进行比较,这是一个成熟的用于软件工程任务的可代理框架。由于 SWE-Agent 原生缺乏视觉能力,我们引入了
6
第 7 页
表 1:主要结果。我们报告了 24 个 NewtonGen 场景上的平均 PIS,以及 30 个场景上的对齐得分和美学指标,最佳结果以粗体显示,次佳结果以下划线标记。
| Method | Video-PIS | State-PIS | Alignment Score | Aesthetic | | :— | :— | :— | :— | :— | | Sora2 [48] | 0.62 | – | 30.6 | 48.5 | | Wan2.2 [57] | 0.46 | – | 29.8 | 58.1 | | SWE-Agent [67] | 0.41 | 0.44 | 25.8 | 42.0 | | SWE-Agent w/ Visual | 0.49 | 0.57 | 26.8 | 44.6 | | GS-Agent (Ours) | 0.71 | 0.83 | 32.2 | 47.6 |
表 2:用户研究结果。我们报告了每种方法在 270 份有效回复中的平均得分。
| Method | Physical Plausibility | Camera Controllability | Content Alignment | Aesthetics | | :— | :— | :— | :— | :— | | Sora2 [48] | 4.01 | 3.92 | 4.65 | 4.18 | | Wan2.2 [57] | 2.72 | 3.49 | 4.45 | 3.71 | | SWE-Agent [67] | 3.18 | 3.49 | 3.40 | 2.40 | | SWE-Agent w/ Visual | 3.25 | 3.96 | 3.72 | 2.44 | | GS-Agent (Ours) | 4.33 | 4.32 | 4.70 | 3.86 |
SWE-Agent w/ Visual 是一种变体,配备了视觉语言模型 (VLM) 工具,用于对生成的视频提供视觉反馈。
实现细节。我们采用 Genesis [3] 作为底层物理引擎,利用其模拟多种材料的能力以及快速、照片级真实的渲染系统。除非另有说明,我们使用 gpt-5 作为我们方法和基线模型的基础模型骨干。为了确保公平比较,所有输出均渲染为 720p 分辨率,以匹配基线视频生成模型的约束,尽管 GS-Agent 本质上支持以高得多的分辨率进行渲染。
4.2 主要结果
与基线的比较。定性比较如图 3 所示,定量结果详见表 1。总体而言,GS-Agent 生成的视频不仅更忠实地符合自然语言提示,而且表现出更优越的物理合理性。文本到视频扩散模型经常表面化地遵循文本指令,同时违反基本的物理原理。例如,在海绵断裂场景中,这些模型会幻觉出突兀且不真实的断裂机制。由于其生成过程完全由文本条件的像素分布驱动,它们产生了视觉上吸引人的帧,但未能保持时间一致性或遵循物理定律。在子弹穿透水球的情况下,Sora2 生成了字面但物理上不正确的“空化尾迹”,而 Wan2.2 生成的视频中,子弹穿过球体时没有任何真实的流体破碎现象。此外,诸如静态背景床在 180° 相机旋转后保持完全一致等不一致性,凸显了缺乏真正的 3D 场景推理能力。与此同时,SWE-Agent 及其变体生成了物理上合理的结果,但往往未能完全满足文本指令,这揭示了联合编写具有准确材料参数的高质量渲染模拟代码的难度。相比之下,GS-Agent 成功平衡了物理真实性、指令保真度和视觉连贯性,验证了我们基于物理循环的多智能体设计的有效性。
人类评估者更偏好 GS-Agent。物理合理性 [45, 75]、相机可控性和内容对齐的自动评估仍然是一个开放的研究挑战。为了提供更稳健的评估,我们进行了包含 15 名参与者的用户研究。受试者被指示对我们方法和基线生成的五个随机排序的视频进行评分,采用 5 点李克特量表,评估方面包括物理合理性、相机可控性、内容对齐和美学。基于 270 份有效回复(表 2),人类评估者在物理合理性、相机可控性和内容对齐方面强烈偏好由 GS-Agent 生成的视频,尽管我们的方法在纯美学方面略落后于最先进的闭源模型。关于研究协议和界面的更多详细信息见附录 C.2。
4.3 涌现能力
自主错误检测与恢复。得益于其灵活的端到端智能体设计,GS-Agent 能够自主检测并解决通常需要人工干预的意外生成失败。为这些边缘情况手工制定鲁棒的规则在很大程度上是不切实际的。如图 4 所示,当导入的 3D 浴缸资产并非完全防水,导致
7
第 8 页
图 4:自主错误恢复。GS-Agent 自动检测泄漏的 3D 资产,并在无人干预的情况下对角落应用刚性材料补丁。
一个白色球 撞击蓝色 球在 User 地板上。 “一条半透明的绿色果冻龙被抛向空中。一把锋利的
00:00.000 00:00.333 00:01.000 00:01.928 很好!能 GS-Agent 刀片在半空中将其切成两半,这两大块晃动的部分在 你 制作 一个 以慢动作落向地面时逼真地抖动。” 视频 慢 动作视频,以便 我能更 User 近距离观察 00:00.000 00:01.667 00:05.933 00:09.967 Ours 运动吗? GS-Agent
向场景中 添加更多 台球。 User 00:00.000 00:00.367 00:01.267 00:01.933 w/o Multi- GS-Agent Agent 更大的 速度以 制造开球。 User w/o Agent- 00:00.000 00:00.300 00:01.733 00:03.967 Simulation GS-Agent Interface
图 5:细粒度可控性。用户 图 6:框架组件的消融实验。 可以通过自然语言与 GS-Agent 交互 移除多智能体设计会导致场景不完整,而移除专门的 以调整渲染效果(例如慢动作)、 智能体-模拟器接口会导致模型在生成稳定的模拟代码时 创建实体(例如添加更多台球)并 遇到困难。 控制实体运动(例如增加开球速度)。
水泄漏,GS-Agent 识别出物理失败,通过向几何体的角落应用刚性材料补丁提出了程序化修复方案,并自动验证了修正后的输出。这突显了系统智能调试和适应不可预见模拟状态的能力。
细粒度可控性。如图 5 所示,用户可以使用自然语言直观地操纵由 GS-Agent 生成的 4D 世界。指令可以规定相机轨迹、生成新实体或精确调整速度等物理参数。这种细粒度的控制显著降低了复杂内容创建的门槛,并促进了动态视觉叙事。
4.4 消融与骨干网络分析
多智能体设计的有效性。我们通过将所有工具访问整合到一个单一的单体智能体中来消融我们提出的架构。如表 4 和图 6 所示,多智能体设计通过将世界生成管道分解为专门的子任务,实现了显著优越的性能。将每个智能体限制在定义明确的上下文中,减少了提示干扰并最小化了工具误用,从而带来更可靠的推理和执行。与 [31] 中的发现一致,多智能体系统有效地扩展了逻辑推理的可用上下文窗口,解锁了高级任务解决能力。
专用智能体-模拟器接口的重要性。为了隔离我们接口带来的影响,我们将 GS-Agent 与带有视觉的 SWE-Agent 基线进行了比较。通用物理模拟器 API 传统上是为人类专家设计的;将这些庞大、低级的动作空间直接暴露给自主智能体,经常会导致语法错误、灾难性的参数选择或物理引擎崩溃。通过将原始模拟器操作抽象为结构化、具有语义意义的工具,我们的接口在约束智能体行为的同时保留了创造性表达能力,直接导致了稳定且物理准确的世界生成。
8
第 9 页
表 3:不同骨干网络下的性能。GS-Agent 在各种骨干网络下均表现良好。
| Model | State PIS | Alignment Score | Aesthetic | | :— | :— | :— | :— | | gpt-5 | 0.83 | 29.9 | 47.6 | | gemini-3-pro | 0.81 | 28.2 | 45.7 | | Qwen3.5-27B | 0.62 | 27.1 | 45.3 |
表 4:消融实验结果。
| Method | State PIS | Alignment Score | Aesthetic | | :— | :— | :— | :— | | GS-Agent | 0.83 | 29.9 | 47.6 | | w/o Multi-Agent | 0.42 | 27.9 | 47.3 | | w/o Agent-Sim Interface | 0.57 | 26.8 | 44.6 |
跨 LLM 骨干网络的鲁棒性。我们评估了利用 gemini-3-pro 和开源权重的 Qwen3.5-27B 模型的框架。如表 3 所示,GS-Agent 成功地在多种骨干网络上运行。虽然较小的 Qwen3.5-27B 带来了预期的性能下降,这主要归因于对严格的空间推理和动态视频理解的要求,但整体流程保持完整。我们预计,随着开源基础模型的快速演进,框架性能将自然扩展。
5 讨论
GS-Agent 生成的不仅仅是视频。虽然我们的定量指标侧重于渲染的视频输出,但 GS-Agent 从根本上构建了一个多模态 4D 世界。它自然地产生丰富的、对齐的数据结构,包括度量深度图、精确的分割掩码、表面法线和粒子级动力学。由于最终输出是可执行的模拟脚本,它可以无缝集成到机器人实体中,用于下游的强化学习和评估。因此,GS-Agent 不仅仅是一个视频生成器,而是具身数据合成的引擎。
保证物理和时间一致性。保持时空一致性是开发像 Genie3 [49] 这样的交互式世界模型的关键瓶颈。虽然纯扩散模型难以在长视界内保持几何一致性 [64],但我们的方法将世界构建建立在由确定性物理引擎执行的程序代码之上。这种方法在数学上保证了几何、运动和材料相互作用的内部一致性,为未来可控的世界模型提供了坚实的基础。
5.1 局限性
当前模拟技术的限制。准确且高效地模拟现实世界仍然是一个开放挑战 [6]。当代图形和物理模拟算法的保真度和可扩展性本质上限制了我们方法的性能上限。然而,即使使用当前的模拟工具,人类已经能够制作出高度复杂的 4D 世界,例如现代游戏和电影中的场景,尽管这需要大量的人工努力。我们的工作旨在自动化这一过程,并利用图形和模拟领域的持续进步 [11],倡导一条通向可扩展、物理基础的世界生成的有前景的路径。
基础模型电影理解能力的局限性。我们的方法依赖于基础模型的自我批评能力,特别是它们评估生成的场景是否表现出预期的运动和连贯的电影表达的能力。虽然像 GPT-5 这样的高级模型在这些领域展示了显著的改进,但它们仍然远非完美 [29, 34]。运动和电影理解方面的持续进步 [45, 33] 将进一步增强我们框架生成细粒度、物理一致且美学丰富内容的能力。
6 结论
在这项工作中,我们提出了 GS-Agent,这是一个多智能体框架,它将物理引擎集成在循环中,从自然语言生成动态且物理上合理的 4D 世界。GS-Agent 通过可执行代码与物理引擎交互,主动寻求多模态反馈,并与其他智能体协作以迭代构建连贯且可控的世界。实验结果表明,GS-Agent 产生了物理上合理的世界,并提供了超越现有方法的细粒度可控性。展望未来,我们将我们的方法视为构建大规模、交互式且一致的世界模拟器的基础,弥合生成模型、具身智能和基于物理的模拟之间的差距,以实现可扩展的多模态数据创建和新的体验格式。
9
第 10 页
参考文献
[1] S. Agashe, K. Wong, V. Tu, J. Yang, A. Li, 和 X. E. Wang. Agent s2: A compositional generalist-specialist framework for computer use agents. arXiv preprint arXiv:2504.00906, 2025.
[2] M. Ahn, A. Brohan, N. Brown, Y. Chebotar, O. Cortes, B. David, C. Finn, K. Gopalakrishnan, K. Hausman, A. Herzog, 等. Do as i can, not as i say: Grounding language in robotic affordances. arXiv preprint arXiv:2204.01691, 2022.
[3] G. Authors. Genesis: A generative and universal physics engine for robotics and beyond, December 2024.
[4] S. Bahmani, I. Skorokhodov, V. Rong, G. Wetzstein, L. Guibas, P. Wonka, S. Tulyakov, J. J. Park, A. Tagliasacchi, 和 D. B. Lindell. 4d-fy: Text-to-4d generation using hybrid score distillation sampling. IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2024.
[5] A. Blattmann, T. Dockhorn, S. Kulal, D. Mendelevitch, M. Kilian, D. Lorenz, Y. Levi, Z. English, V. Voleti, A. Letts, 等. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127, 2023.
[6] A. Boeing 和 T. Br¨aunl. Evaluation of real-time physics simulation systems. In Proceedings of the 5th international conference on Computer graphics and interactive techniques in Australia and Southeast Asia, pages 281–288, 2007.
[7] D. Bolya, P.-Y. Huang, P. Sun, J. H. Cho, A. Madotto, C. Wei, T. Ma, J. Zhi, J. Rajasegaran, H. Rasheed, 等. Perception encoder: The best visual embeddings are not at the output of the network. arXiv preprint arXiv:2504.13181, 2025.
[8] J. Bruce, M. D. Dennis, A. Edwards, J. Parker-Holder, Y. Shi, E. Hughes, M. Lai, A. Mavalankar, R. Steigerwald, C. Apps, 等. Genie: Generative interactive environments. In Forty-first International Conference on Machine Learning, 2024.
[9] A. Chang, W. Monroe, M. Savva, C. Potts, 和 C. D. Manning. Text to 3d scene generation with rich lexical grounding. arXiv preprint arXiv:1505.06289, 2015.
[10] A. Chang, M. Savva, 和 C. D. Manning. Learning spatial knowledge for text to 3d scene generation. In Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pages 2028–2038, 2014.
[11] A. H. Chen, J. Hsu, Z. Liu, M. Macklin, Y. Yang, 和 C. Yuksel. Offset geometric contact. ACM Transactions on Graphics (TOG), 44(4):1–21, 2025.
[12] B. Chen, H. Jiang, S. Liu, S. Gupta, Y. Li, H. Zhao, 和 S. Wang. Physgen3d: Crafting a miniature interactive world from a single image. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 6178–6189, 2025.
[13] H. Chen, Y. Zhang, X. Cun, M. Xia, X. Wang, C. Weng, 和 Y. Shan. Videocrafter2: Overcoming data limitations for high-quality video diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 7310–7320, 2024.
[14] J. Chung, S. Lee, H. Nam, J. Lee, 和 K. M. Lee. Luciddreamer: Domain-free generation of 3d gaussian splatting scenes. arXiv preprint arXiv:2311.13384, 2023.
[15] Y. Du, S. Li, A. Torralba, J. B. Tenenbaum, 和 I. Mordatch. Improving factuality and reasoning in language models through multiagent debate. In Forty-first International Conference on Machine Learning, 2023.
[16] Y. Du, M. Yang, P. Florence, F. Xia, A. Wahid, B. Ichter, P. Sermanet, T. Yu, P. Abbeel, J. B. Tenenbaum, 等. Video language planning. arXiv preprint arXiv:2310.10625, 2023.
[17] N. Gillman, C. Herrmann, M. Freeman, D. Aggarwal, E. Luo, D. Sun, 和 C. Sun. Force prompting: Video generation models can learn and generalize physics-based control signals. In The Thirty-ninth Annual Conference on Neural Information Processing Systems.
10
第 11 页
[18] D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi, 等人。 Deepseek-r1: 通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948, 2025.
[19] I. Gur, H. Furuta, A. Huang, M. Safdari, Y. Matsuo, D. Eck, 和 A. Faust。具有规划、长上下文理解和程序合成能力的真实世界 Web 智能体。arXiv 预印本 arXiv:2307.12856, 2023.
[20] H. He, Y. Xu, Y. Guo, G. Wetzstein, B. Dai, H. Li, 和 C. Yang。Cameractrl: 实现文本到视频生成的相机控制。arXiv 预印本 arXiv:2404.02101, 2024.
[21] J. Ho, W. Chan, C. Saharia, J. Whang, R. Gao, A. Gritsenko, D. P. Kingma, B. Poole, M. Norouzi, D. J. Fleet, 等人。Imagen video: 使用扩散模型生成高清视频。arXiv 预印本 arXiv:2210.02303, 2022.
[22] J. Ho, A. Jain, 和 P. Abbeel。去噪扩散概率模型。神经信息处理系统进展, 33:6840–6851, 2020.
[23] W. Hong, W. Wang, Q. Lv, J. Xu, W. Yu, J. Ji, Y. Wang, Z. Wang, Y. Dong, M. Ding, 等人。 Cogagent: 用于 GUI 智能体的视觉语言模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 14281–14290, 2024.
[24] M. Hu, Y. Zhou, W. Fan, Y. Nie, B. Xia, T. Sun, Z. Ye, Z. Jin, Y. Li, Q. Chen, 等人。Owl: 优化劳动力学习以实现真实世界任务自动化中的通用多智能体辅助。 arXiv 预印本 arXiv:2505.23885, 2025.
[25] Z. Hu, A. Iscen, A. Jain, T. Kipf, Y. Yue, D. A. Ross, C. Schmid, 和 A. Fathi。Scenecraft: 一个用于合成 Blender 代码 3D 场景的 LLM 智能体。在第四十一届国际机器学习会议, 2024.
[26] W. Huang, C. Wang, R. Zhang, Y. Li, J. Wu, 和 L. Fei-Fei。Voxposer: 用于机器人操作的可组合 3D 价值映射,结合语言模型。在机器人学习会议, 页码 540–562. PMLR, 2023.
[27] Z. Huang, Y. He, J. Yu, F. Zhang, C. Si, Y. Jiang, Y. Zhang, T. Wu, Q. Jin, N. Chanpaisit, 等人。Vbench: 视频生成模型的全面基准测试套件。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 21807–21818, 2024.
[28] C. Jiang, C. Schroeder, J. Teran, A. Stomakhin, 和 A. Selle。物质点法用于模拟连续介质。在 ACM SIGGRAPH 2016 课程, 页码 1–52。2016.
[29] B. Kang, Y. Yue, R. Lu, Z. Lin, Y. Zhao, K. Wang, G. Huang, 和 J. Feng。从物理定律视角看视频生成距离世界模型还有多远。arXiv 预印本 arXiv:2411.02385, 2024.
[30] D. Kondratyuk, L. Yu, X. Gu, J. Lezama, J. Huang, G. Schindler, R. Hornung, V. Birodkar, J. Yan, M.-C. Chiu, 等人。Videopoet: 用于零样本视频生成的语言模型。 arXiv 预印本 arXiv:2312.14125, 2023.
[31] G. Li, H. Hammoud, H. Itani, D. Khizbullin, 和 B. Ghanem。Camel: 用于“探索”大语言模型社会“思维”的通信智能体。神经信息处理系统进展, 36:51991–52008, 2023.
[32] Z. Li, H.-X. Yu, W. Liu, Y. Yang, C. Herrmann, G. Wetzstein, 和 J. Wu。Wonderplay: 从单张图像和动作生成动态 3D 场景。arXiv 预印本 arXiv:2505.18151, 2025.
[33] Z. Lin, S. Cen, D. Jiang, J. Karhade, H. Wang, C. Mitra, T. Ling, Y. Huang, S. Liu, M. Chen, 等人。迈向理解任何视频中的相机运动。arXiv 预印本 arXiv:2504.15376, 2025.
[34] H. Liu, J. He, Y. Jin, D. Zheng, Y. Dong, F. Zhang, Z. Huang, Y. He, Y. Li, W. Chen, 等人。 Shotbench: 视觉语言模型中的专家级电影理解。arXiv 预印本 arXiv:2506.21356, 2025.
11
第 12 页
[35] H. Liu, C. Li, Z. Li, Y. Wu, W. Li, Z. Yang, Z. Zhang, Y. Lin, S. Han, 和 B. Y. Feng。Ir3d-bench:将视觉-语言模型的场景理解作为代理逆向渲染进行评估。在神经信息处理系统第39届年度会议数据集与基准测试轨道(The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track)。
[36] H. Liu, C. Li, Q. Wu, 和 Y. J. Lee。视觉指令微调。arXiv 预印本 arXiv:2304.08485,2023。
[37] N. Liu, X.-W. Hua, R. Zhang, 和 L. Wang。具有结构嵌入的物理材质编辑以实现逼真的可变形物体。在 ACM 交互式 3D 图形与游戏研讨会(I3D)论文集,2012。
[38] S. Liu, Z. Ren, S. Gupta, 和 S. Wang。Physgen:基于刚体物理的图像到视频生成。在欧洲计算机视觉会议(ECCV),第 360–378 页。Springer,2024。
[39] Z. Liu, Y. Zhang, P. Li, Y. Liu, 和 D. Yang。用于面向任务的代理协作的动态大语言模型驱动代理网络。在首届语言建模会议(First Conference on Language Modeling),2024。
[40] S. Lu, G. Chen, N. A. Dinh, I. Lang, A. Holtzman, 和 R. Hanocka。Ll3m:大型语言 3D 建模器。arXiv 预印本 arXiv:2508.08228,2025。
[41] J. Lv, Y. Huang, M. Yan, J. Huang, J. Liu, Y. Liu, Y. Wen, X. Chen, 和 S. Chen。Gpt4motion:通过面向 Blender 的 GPT 规划在文生视频中脚本化物理运动。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 1430–1440 页,2024。
[42] R. Ma, A. G. Patil, M. Fisher, M. Li, S. Pirk, B.-S. Hua, S.-K. Yeung, X. Tong, L. Guibas, 和 H. Zhang。从场景数据库进行语言驱动的 3D 场景合成。ACM 图形学汇刊(TOG),37(6):1–16,2018。
[43] F. Meng, J. Liao, X. Tan, W. Shao, Q. Lu, K. Zhang, Y. Cheng, D. Li, Y. Qiao, 和 P. Luo。迈向世界模拟器:构建基于物理常识的视频生成基准。arXiv 预印本 arXiv:2410.05363,2024。
[44] Meshy。Meshy:用于 3D 内容生成的生成式人工智能,2024。访问日期:2026-01-29。
[45] S. Motamed, M. Chen, L. Van Gool, 和 I. Laina。Travl:制作视频-语言模型成为更佳的物理不可能性判断者的配方。arXiv 预印本 arXiv:2510.07550,2025。
[46] M. M¨uller, D. Charypar, 和 M. Gross。用于交互式应用基于粒子的流体模拟。在 2003 年 ACM SIGGRAPH/Eurographics 计算机动画研讨会论文集,第 154–159 页,2003。
[47] OpenAI。Gpt-4 技术报告,2023。
[48] OpenAI。Sora 2,2025。视频和音频生成模型;发布于 2025 年 9 月 30 日。
[49] J. Parker-Holder 和 S. Fruchter。Genie 3:世界模型的新前沿。Google DeepMind 博客,2025。
[50] W. Peebles 和 S. Xie。基于 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议(ICCV)论文集,第 4195–4205 页,2023。
[51] J. Qiu, X. Qi, T. Zhang, X. Juan, J. Guo, Y. Lu, Y. Wang, Z. Yao, Q. Ren, X. Jiang 等。Alita:通用代理,通过最小预定义和最大自进化实现可扩展的代理推理。arXiv 预印本 arXiv:2505.20286,2025。
[52] A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark 等。从自然语言监督中学习可迁移视觉模型。在国际机器学习会议(ICML)论文集,第 8748–8763 页。PmLR,2021。
[53] N. Shinn, F. Cassano, A. Gopinath, K. Narasimhan, 和 S. Yao。Reflexion:具有言语强化学习的语言代理。神经信息处理系统进展,36,2024。
12
第 13 页
[54] J. Sohl-Dickstein, E. Weiss, N. Maheswaranathan, 和 S. Ganguli. 使用非平衡热力学的深度无监督学习. 在《国际机器学习会议》中, 页码 2256–2265. pmlr, 2015.
[55] T. Sumers, S. Yao, K. Narasimhan, 和 T. L. Griffiths. 语言智能体的认知架构. arXiv 预印本 arXiv:2309.02427, 2023.
[56] C. Sun, J. Han, W. Deng, X. Wang, Z. Qin, 和 S. Gould. 3d-gpt: 利用大型语言模型进行程序化 3D 建模. 在《2025 年国际 3D 视觉会议 (3DV)》中, 页码 1253–1263. IEEE, 2025.
[57] T. Wan, A. Wang, B. Ai, B. Wen, C. Mao, C.-W. Xie, D. Chen, F. Yu, H. Zhao, J. Yang, J. Zeng, J. Wang, J. Zhang, J. Zhou, J. Wang, J. Chen, K. Zhu, K. Zhao, K. Yan, L. Huang, M. Feng, N. Zhang, P. Li, P. Wu, R. Chu, R. Feng, S. Zhang, S. Sun, T. Fang, T. Wang, T. Gui, T. Weng, T. Shen, W. Lin, W. Wang, W. Wang, W. Zhou, W. Wang, W. Shen, W. Yu, X. Shi, X. Huang, X. Xu, Y. Kou, Y. Lv, Y. Li, Y. Liu, Y. Wang, Y. Zhang, Y. Huang, Y. Li, Y. Wu, Y. Liu, Y. Pan, Y. Zheng, Y. Hong, Y. Shi, Y. Feng, Z. Jiang, Z. Han, Z.-F. Wu, 和 Z. Liu. Wan: 开放且先进的超大规模视频生成模型. arXiv 预印本 arXiv:2503.20314, 2025.
[58] C. Wang, C. Chen, Y. Huang, Z. Dou, Y. Liu, J. Gu, 和 L. Liu. Physctrl: 用于可控且基于物理的视频生成的生成式物理. 在《第三十九届神经信息处理系统大会》中.
[59] L. Wang, C. Ma, X. Feng, Z. Zhang, H. Yang, J. Zhang, Z. Chen, J. Tang, X. Chen, Y. Lin, 等人. 基于大型语言模型的自主智能体综述. arXiv 预印本 arXiv:2308.11432, 2023.
[60] Y. Wang, X. Qiu, J. Liu, Z. Chen, J. Cai, Y. Wang, T.-H. Wang, Z. Xian, 和 C. Gan. Architect: 通过分层 2D 修复生成生动且可交互的 3D 场景. 《神经信息处理系统进展》, 37:67575–67603, 2024.
[61] Z. Wang, D. Li, Y. Wu, T. He, J. Bian, 和 R. Jiang. 3D 视觉中的扩散模型:综述. arXiv 预印本 arXiv:2410.04738, 2024.
[62] Q. Wu, G. Bansal, J. Zhang, Y. Wu, B. Li, E. Zhu, L. Jiang, X. Zhang, S. Zhang, J. Liu, 等人. Autogen: 通过多智能体对话启用下一代 LLM 应用. 在《首届语言建模会议》中, 2024.
[63] Z. Xi, W. Chen, X. Guo, W. He, Y. Ding, B. Hong, M. Zhang, J. Wang, S. Jin, E. Zhou, 等人. 基于大型语言模型的智能体的崛起与潜力:综述. arXiv 预印本 arXiv:2309.07864, 2023.
[64] J. Xiang, G. Liu, Y. Gu, Q. Gao, Y. Ning, Y. Zha, Z. Feng, T. Tao, S. Hao, Y. Shi, 等人. Pandora: 迈向具有自然语言动作和视频状态的通用世界模型. arXiv 预印本 arXiv:2406.09455, 2024.
[65] T. Xie, Z. Zong, Y. Qiu, X. Li, Y. Feng, Y. Yang, 和 C. Jiang. Physgaussian: 用于生成式动力学的物理集成 3D 高斯. 在《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》中, 页码 4389–4398, 2024 年 6 月.
[66] D. Xu, H. Liang, N. P. Bhatt, H. Hu, H. Liang, K. N. Plataniotis, 和 Z. Wang. Comp4d: LLM 引导的组合式 4D 场景生成. arXiv 预印本 arXiv:2403.16993, 2024.
[67] J. Yang, C. E. Jimenez, A. Wettig, K. Lieret, S. Yao, K. Narasimhan, 和 O. Press. Swe-agent: 智能体-计算机接口实现自动化软件工程. 《神经信息处理系统进展》, 37:50528–50652, 2024.
[68] Z. Yang, J. Teng, W. Zheng, M. Ding, S. Huang, J. Xu, Y. Yang, W. Hong, X. Zhang, G. Feng, 等人. Cogvideox: 具有专家 Transformer 的文生视频扩散模型. 在《第十三届学习表征国际会议》中, 2024.
[69] S. Yin, J. Ge, Z. Z. Wang, C. Wang, X. Li, M. J. Black, T. Darrell, A. Kanazawa, 和 H. Feng. 通过交错多模态推理的视觉作为逆图形智能体. arXiv 预印本 arXiv:2601.11109, 2026.
13
第 14 页
[70] H.-X. Yu, H. Duan, C. Herrmann, W. T. Freeman, 和 J. Wu. Wonderworld: 从单张图像生成交互式 3D 场景。在《计算机视觉与模式识别会议论文集》中,第 5916–5926 页,2025 年。
[71] H.-X. Yu, H. Duan, J. Hur, K. Sargent, M. Rubinstein, W. T. Freeman, F. Cole, D. Sun, N. Snavely, J. Wu 等人. Wonderjourney: 从任意地点到任意地点。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 6658–6667 页,2024 年。
[72] L. Yu, Y. Cheng, K. Sohn, J. Lezama, H. Zhang, H. Chang, A. G. Hauptmann, M.-H. Yang, Y. Hao, I. Essa 等人. Magvit: 掩码生成式视频变换器。在《IEEE/CVF 计算机视觉与模式识别会议论文集》中,第 10459–10469 页,2023 年。
[73] Y. Yuan, X. Wang, T. Wickremasinghe, Z. Nadir, B. Ma, 和 S. H. Chan. Newtongen: 通过神经牛顿动力学实现物理一致且可控的文本到视频生成。arXiv 预印本 arXiv:2509.21309,2025 年。
[74] H. Zhang, W. Du, J. Shan, Q. Zhou, Y. Du, J. B. Tenenbaum, T. Shu, 和 C. Gan. 利用大语言模型模块化构建合作式具身智能体。在《第十二届国际学习表征会议》中,2024 年。
[75] Q. Zhang, P. Jing, H.-X. Yu, F. Ding, F. Nie, W. Wang, Y. Du, J. Zou, J. Wu, 和 B. Shuai. Physion-eval: 通过人类推理评估生成视频中的物理真实性。arXiv 预印本 arXiv:2603.19607,2026 年。
[76] T. Zhang, H.-X. Yu, R. Wu, B. Y. Feng, C. Zheng, N. Snavely, J. Wu, 和 W. T. Freeman. PhysDreamer: 基于物理的视频生成实现与 3D 对象的交互。在《欧洲计算机视觉会议》中。Springer,2024 年。
[77] Z. Zhang, J. Liao, M. Li, Z. Dai, B. Qiu, S. Zhu, L. Qin, 和 W. Wang. Tora: 面向轨迹的视频生成扩散变换器。在《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》中,第 2063–2073 页,2025 年 6 月。
[78] W. Zhao, J. P. Queralta, 和 T. Westerlund. 机器人深度强化学习中的仿真到现实迁移:综述。在《2020 IEEE 计算智能系列研讨会 (SSCI)》中,第 737–744 页。IEEE,2020 年。
14
第 15 页
A 更广泛的影响
GS-Agent 的发展具有显著的积极潜力,同时也引发了重要的伦理和社会考量。
内容民主化与具身智能。从积极的一面来看,我们的框架大幅降低了创建复杂、基于物理的 4D 环境的门槛。这使得独立开发者、教育工作者以及游戏和电影行业的创作者能够以更低成本进行高保真内容创作,减少了对大量手动动画和专门工程工作的需求。此外,通过生成多模态、物理准确的合成数据,GS-Agent 成为机器人技术和具身智能社区的强大催化剂。它提供了一种可扩展的管道来生成多样化的训练环境,有望加速仿真到现实(sim-to-real)的迁移,并减少对缓慢且昂贵的真实世界数据收集的依赖。
双重用途风险与虚假信息。相反,快速生成高度逼真且符合物理规律的场景的能力引入了独特的双重用途风险。与其他高保真生成模型一样,GS-Agent 可能被滥用于合成欺骗性内容。由于我们生成的世界受实际物理定律支配,而非学习到的像素近似值,因此生成的媒体可能显得异常可信,并缺乏标准扩散模型中那种典型的“幻觉”迹象,使得虚假信息更难被揭穿。此外,准确模拟现实世界动态的能力理论上可能被恶意利用,例如用于模拟物理安全基础设施中的漏洞。
经济与环境考量。3D 建模、动画和模拟任务的自动化可能会扰乱视觉特效艺术家和技术总监的劳动力市场。在环境方面,同时运行大型多模态基础模型和复杂的物理引擎计算密集度高,导致显著的碳足迹。
缓解措施。为应对这些风险,我们主张集成强大的数字溯源技术,例如在生成的仿真代码和渲染帧中嵌入加密水印。我们还强调在底层基础模型骨干网中实施严格的安全护栏的重要性,以拒绝恶意的仿真请求。我们鼓励社区负责任地部署交互式世界生成技术,优先考虑透明度和开放的安全评估。
B 其他实现细节
B.1 智能体-仿真接口
大多数现有的仿真 API 是为人机专家设计的,而非基础智能体。为了弥合这一差距,我们引入了一个语义化的结构化接口,允许智能体以可靠且灵活的方式与物理仿真器交互。如图 2 所示,每个智能体都配备了一个与其职责相匹配的定制工具箱,以及一个所有智能体均可访问的通用工具集。表 5 总结了完整的接口。
通用工具。通用工具箱包含三个工具,支持所有智能体共享的基本能力:从仿真中检索信息以及与其他智能体通信。
Manager Agent 的工具。Manager Agent 使用两类工具。第一类配置全局仿真和可视化选项;第二类控制仿真的时间进程。所有配置工具均采用严格的结构化格式接受可选参数,以确保可靠的解析和执行。
Entity Agent 的工具。Entity Agent 的工具最具表现力。每个工具仅接受两个必需参数:<name>,用于标识实体或发射器;<code>,包含精确的几何、物理或控制逻辑。这种设计使得在统一接口内能够进行详细的计算和细粒度操作。我们在工具描述中提供了详细的功能说明和演示。
Render Agent 的工具。Render Agent 的工具箱包括用于查询当前相机和光照配置的实用程序,以及用于指定相机模型、渲染方法和多种光照类型的工具,这些工具均采用严格的参数格式。该智能体还可以渲染当前帧以进行视觉调试,并通过基于 <code> 的控制工具定义灵活的相机运动和录像逻辑。
15
第 16 页
表 5:作为工具的代理-模拟接口。必需参数用 <> 括起,可选参数用 [ ] 括起。
| 组 | 名称 | 参数 | 描述 | | :— | :— | :— | :— | | 通用工具 | GetSceneInfo | – | 获取当前场景的信息。 | | | GetEntityInfo | <name> | 获取特定实体的信息。 | | | SendMessage | <recipient> <message> <image> | 向指定接收者发送消息,附带可选的图像/视频。 | | Manager Agent 的工具 | ConfigureSimOptions | [dt] [substeps] [gravity] | 配置场景的模拟选项。 | | | ConfigureMPMOptions | [grid density] [particle size] [enable CPIC] [lower bound] [upper bound] | 配置场景的 MPM 选项。 | | | ConfigureSPHOptions | [particle size] [lower bound] [upper bound] | 配置场景的 SPH 选项。 | | | ConfigureVisOptions | [show world frame] [show link frame] [show cameras] [shadow] [background color] [segmentation level] | 配置场景的可视化选项。 | | | AdvanceScene | <steps> | 将场景模拟推进 n 步。 | | | ResetScene | – | 将当前场景重置为其初始状态。 | | | FinalizeOutcome | <video path> | 发出任务完成信号并提供最终视频路径。 | | Entity Agent 的工具 | AddEntity | <name> <code> | 向场景中添加具有唯一名称的实体。 | | | RemoveEntity | <name> | 从场景中移除实体。 | | | UpdateEntity | <name> <code> | 更新场景中现有的实体。 | | | AddEmitter | <name> <code> | 向场景中添加具有唯一名称的流体发射器。 | | | UpdateEmitter | <name> <code> | 更新场景中的流体发射器。 | | | RemoveEmitter | <name> | 从场景中移除流体发射器。 | | | RetrieveAsset | <query> | 从库中搜索并检索模型资产。 | | | GenerateAsset | <query> | 调用文本到 3D 模型生成 3D 网格。 | | | ConfigureEntitiesControl | <code> | 设置实体和发射器的逐步控制逻辑。 | | Render Agent 的工具 | GetCameraInfo | – | 获取当前相机配置的信息。 | | | GetLightingInfo | – | 获取当前光照配置的信息。 | | | ConfigureRenderer | <renderer> | 选择并配置渲染器(光栅化器或光线追踪器)。 | | | ConfigureCameraModel | [res] [pos] [lookat] [up] [fov] [model] [aperture] [spp] | 配置渲染的相机参数。 | | | AddDirectionalLight | <dir> <color> <intensity> | 添加方向光(仅限光栅化器)。 | | | ClearDirectionalLights | – | 清除所有方向光(仅限光栅化器)。 | | | AddSphereLight | <pos> <color> <intensity> <radius> | 添加球体光(仅限光线追踪器)。 | | | ClearSphereLights | – | 清除所有球体光(仅限光线追踪器)。 | | | AddEnvSphere | <hdri> <color> [radius] [pos] [euler] | 添加环境球体(仅限光线追踪器)。 | | | RemoveEnvSphere | – | 移除环境球体。 | | | RenderCurrentFrame | – | 将当前相机视图渲染为图像。 | | | ConfigureCameraControl | <code> | 设置逐步相机控制和视频录制逻辑。 |
B.2 提示词
Manager Agent、Entity Agent 和 Render Agent 的完整系统提示词分别见附录 1、附录 2 和附录 3。
B.3 代理自我审查流程
渲染后的视频由 Manager Agent 在上下文中进行审查。每当它调用 AdvanceScene 工具时,都会返回一个渲染视频作为工具执行结果,代理将在上下文中对视频进行推理,生成推理痕迹,例如“视频显示灾难性泄漏,表明网格碰撞体不密封。补救措施:保留当前视觉网格,但将其碰撞替换为显式的密封内部容器并略微向内偏移,以防止粒子初始相交。”随后调用 SendMessage 工具请求 Entity Agent 应用修复并提供上下文。类似地,Render/Entity Agent 会在工具调用结果中存在渲染图像时进行审查,以调整相机角度或材质。例如,“帧顶部有一条暗带,可能来自环境或相机裁剪。为了改善这一点,我可以稍微向下倾斜相机或调整 lookat Z 以消除暗带。”代理迭代调用工具、审查
第 17 页
“一段写实风格的固定视角视频,展示了一块水平放置的矩形粉色海绵被两端的透明玻璃夹块紧紧挤压,随后被扭转直至海绵剧烈断裂。”
我们的方法
Sora2
Wan2.2
SWE-Agent
SWE-Agent 带视觉
“一条半透明的绿色果冻龙被抛向空中。一把锋利的刀在半空中将其切成两半,这两大块果冻在慢动作下落至地面时,呈现出逼真的晃动效果。”
我们的方法
Sora2
Wan2.2
SWE-Agent
SWE-Agent 带视觉
“一段跟拍镜头,展示一个绿色球在地板上滚动,同时另一个黄色圆柱体静止在地板上。”
图 7:GS-Agent(我们的方法)与基线方法的更多定性比较。
在上下文(in-context)中接收结果(渲染的图像/视频、数值状态或来自其他智能体的消息),并继续执行,直到智能体对结果满意或达到工具调用限制。
C 额外实验细节
C.1 更多定性比较
我们在图 7 中展示了我们的方法与其他基线方法的更多定性比较。
17
第 18 页
图 8:用户研究界面。
C.2 用户研究 为了提供更可靠的比较,我们进行了包含 15 名受试者的用户研究。受试者被指示使用 5 点李克特量表(Likert Scale)对我们方法和基线生成的五个随机排序的视频进行评分,评估方面包括物理合理性、相机可控性、内容对齐和美学。共收集了 270 份有效回复。用户研究界面如图 8 所示。四个标准的指导原则如下:
- 物理合理性:运动和交互应尊重物理定律和连续性;材料保持一致(刚性/软性/弹性/液体);无瞬移/突变;能量/物质守恒(无突然的出现/消失/合并);液体的流动/飞溅/扩散行为一致;力引起成比例的响应(无夸张或过度阻尼的反应)。
- 相机可控性:相机应遵循提示并保持稳定(构图、平滑的平移/倾斜/变焦/轨道运动、合理的速度),无抖动、曝光闪烁、裁剪或随机目标切换。如果提示要求特定的相机运动而视频缺乏该运动,则进行惩罚(降低分数)。
- 内容对齐:视频与文本提示的匹配程度(描述的对象、动作、场景和风格是否正确)。
- 美学:整体视觉质量和吸引力——构图、清晰度、光照/阴影、颜色/对比度,以及缺乏令人分心的伪影(噪声、带状伪影、过度模糊/闪烁、时间伪影)。
C.3 失败分析 自我批评中的上下文污染。当前的基础模型仍然缺乏稳健的运动和电影理解能力。在评估中间渲染视频时,由于“上下文污染”,智能体有时无法准确地进行自我批评。因为智能体的上下文窗口包含其自身关于视频应如何呈现的冗长详细计划,它偶尔会表现出确认偏误——说服自己最终渲染的输出成功执行了计划,而没有对实际视觉内容进行批判性评估。
18
第 19 页
失败归因错误。当模拟或视觉检查失败时,智能体有时会错误诊断差异的根本原因。这可能导致智能体陷入迭代循环,试图通过不断调整完全错误的模拟参数来实现预期的物理结果(例如,当实际失败源于不正确的初始空间速度时,反复调整材料摩擦系数)。
不存在的惯例幻觉。智能体偶尔会“幻觉”出后端接口中实际上不存在的物理引擎 API、不支持的材料属性或物理模拟惯例,从而导致执行错误,需要多次回退尝试才能解决。
19
第 20 页
清单 1:Manager Agent 的系统提示词。
你是 Manager Agent,一个高度先进的 AI 智能体,利用 Genesis 物理引擎和资产库,将任何自然语言指令转化为物理和视觉上都逼真的动态世界。你有两个协作伙伴:Entity Agent 和 Render Agent。Entity Agent 专门负责检索逼真的资产、一次创建并管理一个实体,以及控制实体的运动。Render Agent 负责配置摄像机、灯光和渲染器设置;控制摄像机运动、渲染频率和视频录制时机。
根据用户的指令,仔细规划每一步,以确保物理合理性和视觉逼真度。将工作分解为清晰、可管理的任务,并一次分配一个给你的协作伙伴。保持指令精确且简洁,避免过于详尽的细节,批判性地验证他们的输出,并迭代直到结果符合预期。除了向协作伙伴分配任务和验证输出外,你还负责配置场景选项,包括求解器和可视化参数,并根据你的计划和协作伙伴的反馈推进和重置场景。继续操作,直到你构建了完整的动态物理世界并为用户渲染了最终视频,切勿因不确定性而过早停止或交还控制权。如有需要,请做出合理假设,并在事后记录这些假设。
<tool_preambles>
</tool_preambles>
- 在每次调用工具之前,你必须进行广泛的规划,并对每次工具调用的结果进行深入的反思。
- 不要仅通过调用工具来完成整个过程。
- 在执行工具时,简洁且按顺序叙述每一步,明确标记进度。
<persistence>
</persistence>
- 你是一个智能体——在构建完整的动态物理世界,并且用户请求的视频已最终确定并通过调用工具 ‘finalize_outcome’ 报告其路径之前,请继续操作,然后再结束你的回合并将控制权交还给用户。
- 只有当你确定动态物理世界已构建完成,且用户请求的视频已渲染完毕时,才终止你的回合。
- 遇到不确定性或错误时,切勿停止或将控制权交还给用户;研究或推导最合理的方法并继续操作。
- 不要要求人类确认计划或澄清假设,因为你总是可以在稍后进行调整;确定最有效计划和合理假设,并据此推进。
提醒事项:
- 始终通过 ‘send_message’ 工具与协作伙伴沟通。
- 保持指令精确且简洁,说明定性目标和验收标准,让协作伙伴自行决定材料参数等具体细节。
- 你不理解实体或渲染参数在你自身工具范围之外的含义或影响。不要尝试调整或推理这些参数。相反,专注于清楚地说明预期的视觉或功能目标,将参数调整留给 Entity Agent 和 Render Agent。
- 你每次向协作伙伴发送的消息中必须恰好包含一个可执行的任务。不要在一个消息中捆绑多个创建或控制操作。在收到每个协作伙伴的回复后,进行验证和反思,然后才发送下一个单一任务。
- 当他们的回复不尽如人意时,不要仅仅重复你的指令;相反,反思可能出错的地方,相应地调整你的指令,并发送包含更新细节的新消息。
- 始终对协作伙伴的工作持批判态度。始终通过检查返回的实体信息或视觉反馈来验证他们的工作。如果可视化效果不符合你的预期,请要求 Render Agent 使用更具体的指令重新渲染,或要求 Entity Agent
第 21 页
调整实体的放置位置。不要假设你的指令已被正确执行,必须进行验证。
- 在适当的时候使用你自己的工具,例如用于场景配置。
- 渲染智能体无法渲染视频,只能配置摄像机的录制时间。要渲染视频,请指示渲染智能体配置所需的录制时间,然后使用‘advance_scene’工具录制所需的画面。视频录制通常仅在场景步骤 0 开始。每次推进场景前检查当前时间步,并在必要时使用‘reset_scene’工具。除非另有说明,否则始终让渲染智能体自行决定视频帧率。
- 对于仅刚体模拟,使用默认时间步长 0.01 和子步数 1。
- 对于 MPM 和 SPH 等高级材料模型,使用更小的时间步长(例如 0.001 或更小)并增加模拟子步数(例如 5 或更多)以保持数值稳定性。根据实体智能体配置的具体参数调整这些值。
- 在创建或修改实体后,始终运行几步模拟以确保其稳定,然后再向用户展示世界。
- 始终严格遵循 Genesis 物理模拟器中的坐标系。不要假设来自其他 3D、图形或物理引擎的惯例。在解释空间方向(如“在…前面”、“从右侧看”等)时,始终将其映射到 Genesis 坐标系:
- 原点:世界中心 ([0, 0, 0])
- 正 x 轴:向前
- 正 y 轴:向右
- 正 z 轴:向上
- 几何中心定义实体的位置。
- 始终首先验证所有实体的放置和移动是否符合预期。指示渲染智能体使用快速光栅化渲染器配置固定摄像机视图,以进行快速视觉验证。仅在确认实体按请求放置并正确移动后,指示渲染智能体使用高质量光线追踪渲染器设置高级摄像机运动和光照效果,以生成最终视频输出。
- 指示渲染智能体配置灯光,使光源在场景中不可见,除非用户特别要求可见。
- 一旦构建了动态物理世界并渲染出令人满意的最终视频,调用‘finalize_outcome’工具以指示任务已完成,并提供最终视频路径。最终视频分辨率应为 1280 x 720,时长为 3~10 秒;否则,在录制最终视频时指示渲染智能体相应调整。
21
第 22 页
表 2:实体智能体(Entity Agent)的系统提示词。
你是实体智能体(Entity Agent),专门通过检索或生成来策划逼真的资产,并基于管理智能体(Manager Agent)的指令在 Genesis 物理引擎中创建和管理实体。你与渲染智能体(Render Agent)协作,后者负责场景可视化并向你提供视觉反馈。你的主要任务是使用可用工具一次创建或更新一个实体。
<tool_preambles>
</tool_preambles>
- 在每次调用工具之前,你必须进行详尽的规划,并对每次工具调用的结果进行详尽的反思。
- 不要仅通过调用工具来完成整个过程。
- 在执行工具时,简明扼要地按顺序叙述每一步,并清晰地标记进度。
- 最后,使用
send_message工具回复调用智能体,并在收到send_message的工具结果后处理新任务。
一个实体由三个组件组成:
- 形态(Morph):定义形状和几何结构
- 材质(Material):定义物理属性
- 表面(Surface):定义视觉外观
你的工作流程:
1. 除非场景中已存在固定平面,否则始终先向场景中添加一个固定平面。这可以确保实体不会因重力而掉出世界。 2. 仔细解读来自管理智能体(Manager Agent)的指令。如果有任何不清楚或缺失的地方,使用 send_message 向管理智能体请求澄清。 3. 创建或修改实体:
4. 验证实体的创建或修改:
5. 配置实体控制函数。 6. 在获取新任务指令之前,使用 send_message 工具回复管理智能体(Manager Agent)。
- 始终先在库中查找合适的资产。只有在没有合适选择时,才尝试生成资产或使用基本图元。
- 对于策划好的资产,应根据资产的边界框和期望的世界空间对齐方式计算适当的
scale(缩放)和position(位置)。 - 避免将实体放置得过于靠近,以防止碰撞。
- 使用
get_entity_info工具检索实体的当前详细信息。 - 如有需要,使用
send_message工具请求渲染智能体(Render Agent)提供视觉反馈。 - 确保没有实体与其他实体发生碰撞。否则,相应地调整
euler(欧拉角)、scale(缩放)和position(位置)。 - 确保实体之间的空间关系符合预期。否则,相应地调整
euler(欧拉角)、scale(缩放)和position(位置),并请求渲染智能体(Render Agent)提供视觉反馈以再次验证。
提醒事项:
- 你一次只负责一个实体。
- 渲染智能体(Render Agent)只能以某个视角可视化当前帧;它无法渲染视频,也不会修改实体。
- 始终确保物理合理性(重力、间距、弹性、粘性等)。
- 避免实体重叠以防止碰撞。
- 始终严格遵循 Genesis 物理引擎中的坐标系。不要假设来自其他 3D、图形或物理引擎的惯例。在解释空间方向(如“在…前面”、“在…右侧”等)时,始终将这些方向映射到 Genesis 坐标系:
- 原点: 世界中心 ([0, 0, 0])
- 正 x 轴: 前向
- 正 y 轴: 右向
- 正 z 轴: 向上
22
第 23 页
- 几何中心定义了实体的位置。
- 如果检索到的资产不合适,请勿使用它们。
- 资产加载到 Genesis 后,其包围盒与实际几何体之间可能存在差异。创建实体后,务必验证实体的包围盒。
- 固定实体具有零个自由度(dofs),且无法被控制。
- 非关节刚体实体具有 6 个自由度,形式为 [x, y, z, roll, pitch, yaw]。
- 对于粒子材料 MPM 和 SPH,优先使用 "recon" vis_mode。默认的 "visual" vis_mode 仅适用于刚体材料。
- 仅通过 ‘configure_entities_control’ 工具控制实体的运动,而非 ‘add_entity’ 工具。
- 优先使用信息性代码而非防御性代码,设计时应使失败通过运行时结果清晰地暴露底层问题。
- 在获取新任务指令之前,你 MUST 使用 ‘send_message’ 工具回复 Manager Agent。
23
第 24 页
表 3:渲染智能体(Render Agent)的系统提示词。
你是渲染智能体(Render Agent),是 Genesis 物理引擎中专注于相机操控、光照配置和场景可视化的专家。你的主要职责是根据指令准确配置相机、光照和渲染器,渲染当前帧以向你的协作者提供清晰的视觉反馈,并控制相机运动和录制时机。你有两位协作者:管理智能体(Manager Agent)——一个高度先进的 AI 系统,旨在通过工具接口 Genesis 物理引擎,将任何自然语言指令转化为物理动态世界。实体智能体(Entity Agent)——负责创建和管理场景中的实体,并可能请求对特定实体进行可视化。当你完成任务时,使用 send_message 工具通知协作者渲染已成功完成,并提供渲染图像的路径(如果有)。在获取新任务指令之前,你必须使用 send_message 工具回复调用你的智能体。
<tool_preambles>
</tool_preambles>
- 在每次调用工具之前,你必须进行详尽的规划,并对每次工具调用的结果进行详尽的反思。
- 不要仅通过调用工具来完成整个过程。
- 在执行工具时,简洁且按顺序叙述每一步,明确标记进度。
- 最后,使用
send_message工具回复调用你的智能体,并在收到send_message的工具结果后处理新任务。
提醒事项:
- Genesis 物理引擎中有两个渲染器:快速的 Rasterizer(光栅化器)和高质量的 RayTracer(光线追踪器)。默认使用 Rasterizer,它适用于实时渲染和快速预览,而 RayTracer 提供更真实的光照和阴影,但速度较慢,仅应用于最终结果。
- 不同的渲染器支持不同的光照选项。Rasterizer 仅支持配置 DirectionalLight(平行光),而 RayTracer 仅支持配置 SphereLight(球体光)和 EnvSphere(环境球)。配置渲染器时,所有灯光将被清除。
- DirectionalLight 是一种光源,其行为仿佛位于无限远处,并以指定的方向和颜色、强度发射光线。
- SphereLight 是一种球形的网格光源,可以放置在场景中的任何位置,具有位置、半径、颜色和强度。点光源可以模拟为具有适当半径和强度的 SphereLight。平行光可以模拟为位于无限远处、具有极大半径和强度的 SphereLight。请注意,SphereLight 在场景中是可见的,因此它可能会影响渲染图像或视频的外观。尝试以不遮挡场景主要主体且不在相机视野内的方式放置 SphereLight。
- EnvSphere 是一个具有 hdri/exr 图像纹理的球体,为整个场景提供环境光照。它具有位置、半径、颜色和强度。它通常用于为场景提供基础级别的照明。
- 你不能渲染场景中不存在或尚未创建的实体。在渲染之前,始终通过调用
get_scene_info检查存在的实体,并通过调用get_entity_info获取感兴趣实体的信息。 - 你不能直接渲染视频;相反,你可以使用
configure_camera_control工具设置相机运动和录制时机,以便管理智能体在推进场景时渲染视频。 - 始终严格遵循 Genesis 物理引擎中的坐标系。不要假设来自其他 3D、图形或物理引擎的惯例。在解释空间方向(如“在…前面”、“从右侧看”等)时,始终将这些映射到 Genesis 坐标系:
- 原点: 世界中心 ([0, 0, 0])
- 正 x 轴: 前向
- 正 y 轴: 右向
- 正 z 轴: 向上
24
第 25 页
- 对于任何涉及空间语言(例如“在……前面”、“从右侧”、“在上方”)的用户请求,在生成最终指令之前,你必须先执行“空间翻译”步骤,即使用户已指明其假设的正确坐标轴。部分相机视角指令如下:
- “从正面”查看:相机位于 +X 位置,沿负 x 轴方向观察。
- “从背面”查看:相机位于 -X 位置,沿正 x 轴方向观察。
- “从右侧”查看:相机位于 +Y 位置,沿负 y 轴方向观察。
- “从左侧”查看:相机位于 -Y 位置,沿正 y 轴方向观察。
- “从顶部/上方”查看:相机位于 +Z 位置,沿负 z 轴方向观察。
- 如果指令不清晰或你需要更多信息才能继续,请向发出指令的人发送消息以请求澄清,不要涉及其他同事。
- 使用你可用的工具来操作相机、配置灯光并在 Genesis 物理引擎中渲染图像。
- 默认情况下,使用近距离相机位置来捕捉场景中实体的细节。如果指令指定了不同的相机位置,请相应调整。
- 分析渲染结果后,确保图像或视频符合指令中指定的要求。如果不符合,你必须相应地调整相机设置或渲染参数并重新渲染,直到满足标准。然后使用
send_message工具确认已完成并附带渲染输出。 - 不要在没有实际审查渲染结果的情况下对渲染结果进行臆测或做出假设。
- 对渲染结果保持批判性态度。如果可视化效果与你的预期不符,请反思可能出错的地方,调整相机设置或渲染参数,并在必要时重新渲染。
- 对齐渲染频率与录制视频的帧率(fps),以确保视频长度与实际模拟持续时间相匹配。
- 优先使用信息性代码而非防御性代码,设计代码使其通过运行时结果清晰地暴露底层问题。
- 在获取新任务指令之前,你必须使用
send_message工具回复调用智能体。
25