快速导读:提出CG-World,一个源自工业CG管线的大规模世界状态数据集与协议,通过显式对齐世界状态、多模态观测与同根干预分支,支持模型学习世界演化而非仅拟合终端像素。
CG-World提出了一个核心主张:世界模型要从“生成逼真视频”进化到“理解世界如何运转”,关键瓶颈不在于模型架构,而在于缺乏系统对齐世界状态、动作、物理与观测的标准化数据。现有公开数据集要么只有终端视频,要么只有机器人动作但不暴露求解器状态,仿真数据则存在现实差距。CG-World另辟蹊径,从工业CG生产管线中挖掘那些被丢弃的中间产物——显式的物理状态、时间对齐的多模态观测、以及同一场景下不同动作与机制干预产生的分支轨迹。
论文的核心贡献是一个世界状态数据协议和一个大规模数据集CG-World v1。协议将世界状态分解为实体、结构、静态属性、动态状态、关系、事件与规则、观测七类,并定义了三个能力层级:L1观测对齐、L2动态状态、L3因果干预。CG-World v1包含约85万条镜头级片段,每条片段都对齐了深度、法线、分割、光流等多模态观测,并记录了物理重计算结果与多take动作覆盖。更重要的是,它引入了分支谱系管理,系统记录了事实轨迹、观测干预、动作干预、机制干预与严格反事实分支,为训练模型理解因果提供了数据基础。
英文题目:CG-World: A Large-Scale World-State Dataset for World Model Research
论文出处:arXiv 每日论文精选 · arXiv:2607.26452
原始论文:PDF / 论文页面
对应视频标题:CG-World:用工业CG的隐藏状态教会世界模型理解物理演化|推荐指数:★★★★★
这篇论文解决什么问题?
世界模型研究的范式正在发生转变。早期的世界模型以视频生成为核心目标,追求像素级的逼真度。但Physical AI的兴起要求模型不仅能生成视频,还要能预测物理状态、推理动作后果、甚至回答反事实问题——“如果当时推的是左边而不是右边,会发生什么?”这种能力无法从终端视频中习得,因为视频只记录了最终结果,不暴露导致结果的中间机制。
现有数据集的局限非常明显。Kinetics-700、Ego4D等大规模视频数据集缺乏动作标签与接触信号,模型只能学习表面运动模式。Open X-Embodiment、BridgeData V2等机器人数据集虽然提供了动作与观测对,但通常不暴露底层求解器的物理状态、接触图或材料参数,模型学到的仍是“观测到观测”的映射。仿真数据集如Kubric、iGibson虽然可控,但渲染质量与物理引擎的行为与真实世界存在偏差,且不同仿真器之间的状态协议与物理等价性标准不一致。
工业CG生产管线恰好填补了这个空白。在制作动画电影或特效镜头时,艺术家会创建完整的3D场景,定义物体的几何、材质、物理属性,设置关键帧动画或物理模拟,最终渲染出视频。在这个过程中,管线会生成大量中间产物:每一帧的网格状态、骨骼动画数据、深度图、法线图、分割图、光流、相机参数等。这些中间产物与最终视频在实体和时间上严格对齐,构成了天然的多模态过程监督信号。但此前从未有人系统地将这些数据整理为适合世界模型训练的标准化数据集。
CG-World的出发点正是:与其让模型从视频中猜测物理规律,不如直接告诉它每一帧的世界状态是什么。这种“显式监督”的思路与PhyWorld等近期工作形成互补——PhyWorld通过后训练提升视频生成的物理合理性,恰恰说明终端观测缺乏足够的机制监督信号。
核心创新
- 提出世界状态数据协议,分离状态、观测与标注,分离模板、实例与状态,分离连续状态与离散事件,统一时间码对齐。
- 定义世界模型数据集的三个能力层级:L1观测对齐、L2动态状态、L3因果干预。
- 构建首个大规模工业CG世界状态数据集CG-World v1,包含约85万片段,提供显式中间状态、多模态观测与同根分支谱系。
- 引入统一分支谱系与严格反事实数据管理协议,记录干预目标、不变量与替代结果。
方法概览
提出世界状态数据协议,将世界状态分解为实体、结构、静态属性、动态状态、关系、事件与规则、观测七类,定义时间对齐的逻辑样本单元。基于该协议,从工业CG项目中恢复并标准化约85万条镜头级世界状态片段,构建CG-World v1数据集,包含多模态对齐、物理重计算、多take动作覆盖,并引入分支谱系管理事实轨迹、观测干预、动作干预、机制干预与严格反事实分支。
- 世界状态数据协议:将世界状态分解为七大类——实体(物体、角色、相机等)、结构(场景图、层级关系)、静态属性(几何、材质、质量等)、动态状态(位置、速度、关节角度等)、关系(接触、支撑、遮挡等)、事件与规则(碰撞、触发条件等)、观测(RGB、深度、法线、分割、光流等)。协议强调三个分离原则:状态与观测分离、模板与实例及状态分离、连续状态与离散事件分离,并通过统一时间码实现跨模态对齐。
- 逻辑样本单元定义:以镜头(shot)为基本单位,每个镜头包含1-5秒的连续帧序列,所有世界状态、观测与标注都对齐到同一时间轴。这种设计确保了模型可以在任意时间点查询完整的世界状态快照。
- 工业CG数据恢复管线:从已完成权利审查的工业CG项目中提取原始工程文件,解析场景描述、动画曲线、物理模拟缓存、渲染通道等,按照世界状态协议重新组织为标准化的数据包。处理流程包括资产提取、状态重计算、多模态渲染、分支谱系追踪与质量验证。
- 物理重计算与多take动作覆盖:对每个镜头重新运行物理模拟,生成确定性的物理状态序列,避免原始生产中的手动修正或艺术化处理带来的不一致。95%的有效镜头包含3-5个动作变体(multi-take),覆盖同一场景下不同的动作执行方式。
- 分支谱系与反事实数据管理:CG-World v1定义了五种分支类型——事实轨迹(实际采用的镜头)、观测干预(改变相机或渲染参数)、动作干预(改变角色或物体的动作)、机制干预(改变物理参数或约束)、严格反事实(在分支点保持所有不变量,仅改变单一干预目标)。每个分支都记录了干预目标、保持不变的条件以及替代结果。
- 数据集划分与防泄漏策略:采用分组层次划分,确保同一项目、共享资产、历史版本和同根分支不会跨越训练、验证和测试集。最终训练集637,500段(75%),验证集127,500段(15%),测试集85,000段(10%)。
- 三个能力层级的定义:L1观测对齐——提供时间对齐的多模态观测,支持视频生成与预测任务;L2动态状态——提供显式的物理状态序列,支持状态预测与动作条件生成;L3因果干预——提供同根分支数据,支持反事实推理与因果发现。
- 数据访问与许可:完整v1数据集在论文接收后发布。L1/L2及部分L3数据采用非商业学术研究许可,原始L3数据因包含敏感的生产资产,需用例审查与受控访问协议。
逐图理解论文
失败的直觉

图1对比了传统数据集与CG-World的核心差异。传统数据集只保留终端观测(如最终渲染视频),而CG-World显式对齐了世界状态、多模态观测和同根干预分支。注意图中展示的三层结构:底层的世界状态(网格、物理参数)、中层的多模态观测(深度、法线、分割)、以及顶层的分支轨迹(不同动作导致不同结果)。这种设计使模型能够学习世界的演化机制,而非仅仅拟合表面外观。
研究空白与CG-World的切入点

图2展示了时间对齐的世界状态协议的核心结构。注意时间轴上的对齐关系:每一帧的RGB观测都与对应时刻的深度图、法线图、分割图、光流以及底层的3D场景状态严格对齐。这种帧级对齐是CG-World区别于其他数据集的关键特征,使模型可以在任意时间点获取完整的世界状态快照。
核心贡献:协议、数据与分支谱系

表2详细列出了世界状态数据协议的七大类及其代表性内容。从左到右依次为:实体(物体、角色、相机)、结构(场景图、层级)、静态属性(几何、材质)、动态状态(位置、速度)、关系(接触、支撑)、事件与规则(碰撞、触发)、观测(RGB、深度、法线)。这个分类体系是CG-World数据组织的理论基础,确保了不同来源数据的一致性。
实验验证:三层级的能力证据

表5展示了LTX-2.3在观测视频生成任务上的后训练结果。注意CG-World深度控制和Canny控制两种条件下,LPIPS和FVD指标相比官方基线均有大幅降低。这表明即使是最简单的L1层级数据(多模态观测对齐),也能为视频生成模型带来显著的品质提升。
实验如何设计?
- 观测视频生成实验:基于LTX-2.3视频生成模型,使用CG-World的深度图或Canny边缘图作为控制信号进行LoRA后训练。评估指标为LPIPS(感知相似度)和FVD(视频质量),对比基线为官方预训练模型在相同控制条件下的生成结果。
- 多步动作预测实验:基于Cosmos3-Nano模型,使用CG-World的轨迹监督进行LoRA后训练。任务为在LIBERO格式下预测未来16步动作块(包含末端执行器位移、旋转和夹爪状态),评估指标为动作MSE、平移RMSE、旋转误差和夹爪F1。对比基线为在LIBERO数据集上同样进行LoRA后训练的模型。
- VLA仿真迁移实验:基于OpenVLA-7B视觉-语言-动作模型,先使用CG-World的动作数据进行预适应(pre-adaptation),再结合在线微调(OFT)在ManiSkill3仿真环境中评估。任务为桌面容器操作,包括域内PickCube抓取和跨任务StackCube堆叠。评估指标为成功率,并分解抓取与提升阶段进行分析。
- 所有实验均使用CG-World v1的训练集进行后训练或预适应,在测试集或仿真环境中评估,确保与训练数据的项目级隔离。
关键结果与论文证据
- 视频生成质量显著提升(第6页,Table 5):使用CG-World深度控制后训练,LPIPS降至0.4068,FVD降至519.6;使用Canny控制后训练,LPIPS降至0.3989,FVD降至555.5。相比官方模型在相同控制条件下的生成结果,LPIPS降低超过33%,FVD降低超过38%。这表明显式的中间状态监督能有效提升视频生成模型对场景结构的理解。
- 动作预测精度大幅提高(第7页,Table 6):CG-World-LoRA的动作MSE为0.0533,平移RMSE为0.2715,旋转误差为2.14°,夹爪F1为0.957。相比LIBERO-LoRA基线,连续动作误差降低20%至53%,夹爪F1提升0.064。这说明CG-World提供的显式物理状态与多take动作覆盖,比仅依赖机器人演示数据更能帮助模型学习精确的动作控制。
- VLA仿真迁移展现潜力(第7页,Table 7):CG-World预适应结合OFT后,PickCube域内成功率达39.0%,StackCube跨任务成功率达25.0%。值得注意的是,提升阶段成功率高达88.3%,说明模型在CG-World上学会了稳健的抓取后操作能力,但在整体任务链中仍有提升空间。
- 分支谱系数据的独特价值(第5页,Figure 5):CG-World的分支结构允许模型在同一初始状态下观察不同动作或机制干预导致的不同结果,这是传统数据集无法提供的。这种数据格式天然适合训练模型进行反事实推理——如果动作不同,结果会如何变化。
- 工业CG数据的规模与多样性(第4-5页,Figure 4):CG-World v1包含约85万条有效镜头级片段,中位时长2.6秒,43.4万条具有完整多模态对齐,51万条经过物理重计算。数据覆盖多种场景类型、角色动作和物理交互,为世界模型训练提供了丰富的素材。
- 数据协议的可扩展性(第3页,Table 2):七类世界状态的定义具有良好的通用性,不局限于CG领域。论文指出该协议可以适配机器人数据、仿真数据甚至真实世界传感器数据,为构建跨领域的世界状态数据标准提供了基础。
阅读时需要注意
- 工业CG生产偏差:CG-World v1的数据来自工业CG项目,继承了叙事驱动的镜头选择偏好、艺术化的运动风格、特定引擎与求解器的行为特征,以及合成材质与透明度导致的弱化状态-观测对应。这些偏差可能影响模型在真实世界场景中的泛化能力。
- 生产衍生状态的物理真实性:CG数据中的物理状态来自生产求解器,可能包含艺术化修正或简化,不能直接视为校准后的真实世界物理真值。论文建议将这些状态作为显式监督使用,并记录其来源与运行条件。
- 数据访问限制:完整v1数据集需等论文接收后发布,且原始L3数据需要用例审查与受控访问协议,可能限制研究社区的广泛使用。
- 实验覆盖范围有限:当前实验主要验证了L1和L2层级的数据效用,L3因果干预层级的直接实验证据尚不充分,反事实推理能力的评估有待后续工作。
关联工作
- 与视频数据集的关系:Kinetics-700、Ego4D等提供了大规模真实视频,但缺乏动作与物理状态标注。CG-World的独特之处在于提供了与视频帧级对齐的显式世界状态,使模型可以从“发生了什么”学到“为什么发生”。
- 与机器人数据集的关系:Open X-Embodiment、DROID等提供了真实机器人的观测-动作对,但不暴露底层物理状态。CG-World的物理重计算与多take动作覆盖提供了更丰富的监督信号,但需要验证从CG到真实机器人的迁移能力。
- 与仿真数据集的关系:Kubric、iGibson、ThreeDWorld等提供了可控环境,但物理等价性标准不一致。CG-World的优势在于数据来自专业CG生产,渲染质量高且场景复杂度接近真实影视级别。
- 与因果推理基准的关系:IntPhys、PHYRE、CLEVRER等评估直觉物理与因果推理,但多限于判别式问答或简化系统。CG-World的分支谱系为训练生成式因果推理模型提供了数据基础。
- 与PhyWorld的互补性:PhyWorld通过后训练提升视频生成的物理合理性,从侧面证明了终端观测缺乏机制监督。CG-World直接提供机制监督,两者可以结合使用。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
CG-World:面向世界模型研究的大规模世界状态数据集
蔡一鸣1,*,于方杰1,*,于美清2, 石子越3,郭勇1,袁鹏飞1 1CGyear世界模型实验室 2清华大学 3新南威尔士大学 *通讯作者:caiyiming@cgyear.com.cn, yufangjie@cgyear.com.cn
2026年7月29日
图1:CG-World。与传统仅保留最终观测的数据集不同,CG-World对齐了显式的世界状态、多模态观测以及同根干预分支,使模型能够学习世界如何演化,而不仅仅是其表象。 摘要 世界模型需要学习状态、动作、事件和观测的联合分布,而现有的公开视频数据集、机器人轨迹和仿真数据通常只覆盖这些元素中的一部分。为解决这一局限,我们提出了CG-World(图1),这是一个源自工业计算机图形生产管线的世界状态数据协议,并配套一个大规模数据集。该数据集显式记录了中间世界状态,包括多模态语义信息、空间表示、骨骼和控制器状态、运动曲线、相机和光照参数、物理缓存、接触事件以及多通道渲染输出。CG-World v1包含约85万个世界状态片段,每个片段时长1至5秒。它将底层状态、观测、事件、关系和分支元数据分离,并将这些异构记录组织成时间对齐的数据单元,从而提供了显式且全面的世界状态信息表示。为进一步支持基于干预的学习和反事实推理,CG-World引入了一个统一的分支谱系,将世界状态轨迹分类为事实轨迹、观测干预、动作干预、机制干预和严格反事实分支。对于每个分支,干预目标、不变变量和替代结果均被显式记录。我们在三个与世界模型研究相关的受控任务上评估了CG-World:几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移。实验结果表明,CG-World为受控生成、动作建模和具身策略迁移提供了可复用的结构化监督,从而持续提升了模型性能。在未来的工作中,我们旨在通过持续的数据收集和社区协作进一步扩展数据集,目标是将CG-World建设为通用世界模型、物理AI和具身智能研究的共享数据基础设施。
关键词:世界模型;世界状态数据;具身智能;物理AI;工业数据;反事实数据;合成数据
1 引言 世界模型研究正从视频生成转向世界理解与预测。该领域已从将观测历史压缩为潜在表示,发展到在潜在空间中维护可条件化、可干预和可交互的表示,其更广泛的目标是联合建模状态、动力学、控制和物理规律(Ding et al. 2025)。Kinetics-700、Ego4D和Panda-70M已支持视频学
第 2 页
(Carreira 等人,2019;Grauman 等人,2022;Chen 等人,2024)展示了视频世界模型的基础能力(Bruce 等人,2024;Hu 等人,2023;Russell 等人,2025;NVIDIA 等人,2025)。后续工作如 PhyWorld 通过持续后训练和物理偏好优化,提升了视频延续的物理合理性,进一步表明仅靠终端视频观测无法提供可直接学习的机制监督(Zhao 等人,2026)。
传感器采集数据集与具身智能。 Open X-Embodiment 以标准化格式汇集了超过一百万条真实机器人轨迹。RT-2(Zitkovich 等人,2023)和 OpenVLA(Kim 等人,2025)等模型表明,在互联网规模的视觉-语言知识与机器人行为数据上进行联合训练,能够改善语义泛化和跨任务控制。尽管这些数据集捕捉了真实传感器、具身形态和操作噪声,但它们通常无法记录世界的完整潜在状态。CG-World 则提供了互补:它提供了通过真实世界数据采集难以获得的密集中间状态监督。
合成世界与仿真平台。 合成数据生成器和模拟器,如 Kubric、iGibson 和 ThreeDWorld(Greff 等人,2022;Li 等人,2022;Gan 等人,2021),提供了可控环境、丰富标注、物理模拟,并在某些情况下提供了干预变量。然而,不同模拟器之间的状态协议和物理等效性标准并不一致,且不同引擎或参数设置可能以不同的动力学近似相同的物理过程。CG-World 则源自交付的生产记录,并包含大量仅靠引擎计算无法获得的专家创作数据,例如使用 3D 粒子系统创建的流体运动。
物理与因果。 IntPhys 和 PHYRE 评估直觉物理和交互式推理(Riochet 等人,2022;Bakhtin 等人,2019);CLEVRER(Yi 等人,2020)在视频框架中统一了描述、解释、预测和反事实推理;CausalWorld(Ahmed 等人,2021)则允许对操作环境中与物体和机器人相关的因果变量进行显式干预。然而,大多数视觉推理基准仍局限于判别式问答、合理性判断或简化的物理系统,因此覆盖的应用领域较窄。
总之,世界模型训练仍缺乏一个标准化的数据体系,以系统地对齐语义、动作、物理、观测和反事实。CG-World 通过将工业生产中的显式中间物理状态、多通道视觉观测以及同根分支谱系置于一个共享的时空数据体系中,弥补了这一空白。
3 世界状态数据协议
CG-World 定义了一个逻辑协议,在对齐样本中分离世界状态元素,并将其映射到工业或传感器格式。这产生了一种统一、可构建、可转换且可验证的表示。表 2 总结了其七个类别及代表性内容。
第 3 页
顶级类别 | 定义 | 代表性二级类别 ——- | ——- | ——- 实体 | 场景中可追踪的、具有持久身份的物理对象、参与者和观测设备。 | 角色、物体、约束体、相机、光源及其他交互式场景元素 结构 | 实体内部及实体之间相对稳定的空间、拓扑、层级和装配关系。 | 场景图、节点层级、骨骼、蒙皮、网格拓扑及装配关系 静态属性 | 在其声明的有效区间内保持不变的语义、几何、材质或物理属性。 | 类别、资产ID、质量、摩擦系数、材质参数及其他时间稳定的属性 动态状态 | 随时间变化的实体位姿、速度、关节、动画状态、解算器状态或内部物理状态。 | 位姿、速度、关节角度、物体状态及可变形体的内部状态 关系 | 实体之间随时间建立、维持或终止的交互。 | 随时间变化的接触、支撑、抓取、可见性及遮挡关系 事件与规则 | 离散状态转换及其触发条件,连同支配状态演化的机制、约束和运行时配置。 | 语义事件、碰撞、约束切换、断裂、状态转换及逻辑触发器 观测 | 由相机、传感器、渲染器或其他观测函数从世界状态导出的多模态输出。 | RGB、深度、分割、法线、光流、多视图图像、全景图及点云
表2: 核心世界状态数据类别及代表性内容
3.1 逻辑模式与样本定义
为实现跨工具链、任务和模型的重用,我们将数据生产过程分解并与现实世界元素对齐。
在此公式下,世界状态数据包含单一世界演化过程的分层时间记录。设一个世界片段的标准时域为 T = {t0, t1, . . . , tn}。在任意时刻 t,显式世界状态为
Wt = (E, H, P, Xt, Rt, Qt, Πt). (1)
其中,E 为实体集;H 为结构集;P 为静态属性;Xt 为动态状态;Rt 为时变关系;Qt 为事件;Πt 为规则与配置。
给定模态 m 的观测函数 gm 和观测配置 Cmt,时刻 t 的观测为
Omt = gm(Wt; Cmt , ϵmt ) . (2)
模态配置 Cmt 表示采样机制,如相机、扫描仪或文本接口,而 ϵmt 表示观测噪声或编码扰动。因此,来自每种模态的信息被视为源自同一世界状态的观测,而非世界本身。结合时变动作 at 和外部干预 ut,世界状态演化遵循
Wt+1 = F(Wt, at, ut; Θt) + ξt. (3)
其中,F 是由渲染引擎、物理模拟、相机系统及相关组件共同诱导的状态转移过程;Θt 表示解算器、规则和运行时配置;ξt 捕获数值误差、随机扰动或未建模因素。当 ut = ∅ 时,片段记录原始或主轨迹;当 ut ≠ ∅ 时,它记录一个源自相同或共享初始状态的干预分支。
一个完整的 CG-World 数据单元组织为
Di = ⟨Wt0:tn, O1:Mt0:tn, At0:tn, Ut0:tn, Bi, Mi⟩. (4)
在此元组中,Wt0:tn 是世界状态序列,O1:Mt0:tn 是多模态观测序列,At0:tn 是动作或控制信号,Ut0:tn 是干预变量,Bi 是分支谱系,Mi 是元数据规范,包括坐标系、单位和渲染配置等固定信息。因此,世界模型训练可以超越拟合观测或操作结果,转向联合学习下一个世界状态:
p(Wt+1, Ot+1 | W≤t, O≤t, A≤t, U≤t) . (5)
为使协议可执行,CG-World 声明了每个核心字段的语义和数据类型、张量形状、时间索引、单位、坐标系、可用性及来源。载荷通过标准文件或协议引用,如 OpenUSD (Pixar Animation Studios 2025)、RLDS (Ramos et al. 2021) 和 MaterialX;完整模式见补充材料。每个片段由 segment_id、root_family_id 和实体 ID 索引,且必须包含时间范围、实体层级、传感器类别与参数,以及至少一个视觉观测。几何、动画、物理缓存、接触、深度、法线和光流可根据源可恢复性选择提供。如图2所示,由此产生的逻辑样本层将世界状态、动作、状态转换、多模态观测、关系和事件以及分支统一在一个时空索引下,同时支持跨工业工具、模拟平台和真实世界采集系统的可追溯实现。
3.2 组织原则与能力等级
我们采用三项原则来组织世界状态数据: 1. 分离状态、观测与标注,防止模型将压缩的观测或人类标签视为世界本身。 2. 分离模板、实例与状态,允许随时间追踪同一实例的变化。 3. 分离连续状态与离散事件,同时将所有数据对齐到统一的时间码以实现跨模态同步。
第 4 页
图2:时间对齐的世界状态协议。
我们为世界模型数据集定义了三个能力级别。L1,即观测对齐级别,最低要求包括实体索引、空间结构或重建参考、相机或传感器参数、基本观测、统一时间码、坐标系和单位。L2,即动态状态级别,增加了动作轨迹、实体动力学、关系和事件。L3,即因果干预级别,进一步增加了干预变量、不变场、分支谱系、结果变量,以及可比较的事实-干预或事实-反事实对。
3.3 反事实与分支管理协议
分支是从可追溯的世界状态及其在特定观测条件、动作输入或动力学机制下的运行时上下文生成的世界状态轨迹。遵循事实、干预和反事实推理之间的区别(Pearl 2009),CG-World将分支划分为事实轨迹、观测干预、动作干预、机制干预和严格反事实分支。
事实轨迹分支。 记录在给定运行时上下文、动作输入和机制配置下发生并完全保留的世界状态演变。
观测干预分支。 从相同的初始状态修改观测函数,同时保持底层状态轨迹不变。
动作干预分支。 在固定的初始世界状态和运行时上下文下,改变应用于世界的动作或控制输入,然后记录产生的未来状态和观测。
机制干预分支。 在相同的初始状态下,修改一个或少数几个机制变量I,以获得新的世界状态和后续轨迹。
严格反事实分支。 以一个已发生并被完整记录的事实轨迹为条件,然后对动作、状态或机制变量施加替代干预,同时保持相应的外生上下文和未干预机制不变。CG-World仅当分支满足所有四个标准时,才将其标记为严格反事实数据:事实条件化、外生上下文的保留、替代干预的执行,以及个体层面效应的记录。
4 CG-World v1
4.1 数据来源与处理
CG-World v1是一个镜头级世界状态数据集,从授权用于研究和再分发的工业CG制作项目中恢复并标准化。我们恢复世界状态与多版本渲染观测之间的时间对应关系,使用具有时间连续性、持久实体身份和严格状态-观测对齐的世界状态片段作为基本样本单元。该流程包括工业项目解析、跨工具链提取和基于协议的重新组织,如图3所示。
4.2 数据内容、统计单元与规模
在构建CG-World v1主数据集期间,我们没有通过程序化场景随机化或重新模拟来增强数据。v1中的所有状态和观测均源自通过制作质量控制的已保存制作记录。
图4总结了CG-World v1的完整规模、镜头过滤过程和多模态覆盖范围。该数据集包含约850,000个有效的镜头级世界状态片段,每个片段时长1-5秒,中位时长为2.6秒。其中,433,500个镜头具有完整的多模态对齐,510,000个镜头具有物理重计算。百分之九十五的有效镜头包含多镜次动作覆盖,每个镜头有3-5个镜次变体。为防止跨制作项目、共享资产、历史版本和同根分支的数据泄露,CG-World v1采用分组分层划分。最终的训练集、验证集和测试集分别包含637,500、127,500和85,000个片段,对应有效数据的75%、15%和10%。
4.3 多分支与反事实数据
利用第3.3节介绍的分支系统,CG-World v1从桌面容器操作场景中构建了一个干预和反事实子集。该子集按同根分支族组织,如图5所示。每个族使用一个完整记录的事实轨迹作为其
第 5 页
图3:从工业CG项目到CG-World数据包的处理流程。
图4:CG-World v1的数据分布。
参考,并将其与源自同一可追溯世界状态的替代分支关联起来。约9%的该子集源自历史项目版本,其余为程序化生成。表3总结了其主要组织单元、分支规模、干预目标及可推导的监督信号。
4.4 标注与组织 CG-World v1采用源自生产流程的标注:标注信息从工业生产文件中恢复,而非在提取的片段上人工重绘为边界框、掩码或文本描述。文本语义、结构、动作、物理过程及观测结果均在同一生产链中,在人类专家监督下生成。
4.5 数据权利、许可与发布计划 CG-World v1的正式发布仅包含已通过权利审查并允许学术研究使用的工业CG项目。不符合再分发要求的素材仅用于内部统计或受控访问,不纳入公开下载。 完整的CG-World v1数据集将在论文被接收后、且不晚于终稿提交时发布。L1/L2及选定的L3数据将依据非商业学术研究许可分发。包含与世界状态片段对应的完整项目文件的原始L3数据,需经过用例审查并签署受控访问协议。
第 6 页
图5:CG-World中的反事实数据结构
数据单元或分支类型 | 规模 | 主要变化变量 | 提供的监督 —|—|—|— 同根分支族 | 1,000组 | 共享的事实轨迹、初始状态、运行时上下文和分支谱系 | 事实参考、分支对应关系和不变集 观测干预分支 | 100,000 | 相机、焦距、光照、遮挡、渲染通道和图像退化 | 多通道观测、可见性、相机参数和观测差异 严格动作反事实分支 | 5,000 | 抓取位置、速度、倾斜角度、运动路径和释放时机 | 动作轨迹、未来状态、事件边界和个体层面的结果效应 严格机制反事实分支 | 5,000 | 质量、摩擦、质心、液面高度、粘度、接触条件和约束规则 | 物理状态、接触关系、事件变化和个体层面的结果效应 失败结果标注 | 包含在相应的反事实分支中 | 滑动、溢出、碰撞、过早释放和相关失败 | 失败事件、异常接触、发生时间和最终状态变化
表3:CG-World v1的分支与反事实子集
5 实验
我们进行了三项实验:观测视频生成、多步动作预测和视觉-语言-动作迁移。表4总结了评估的模型和初始化检查点。
任务 | 模型与版本 | 后训练方法 —|—|— 观测视频生成 | ltx-2.3-22b-dev (HaCohen et al. 2026) | LoRA (Hu et al. 2022), r = 32 多步动作预测 | Cosmos3-Nano (NVIDIA 2026) | LoRA, r = 32 具身策略迁移 | openvla-7b | LoRA, r = 32
表4:实验模型与初始化检查点
5.1 观测视频生成
我们首先评估源自世界状态的监督是否能改善视频基础模型中的观测生成。在相同的初始帧、提示、测试片段、随机种子和推理配置下,比较了四种设置:无显式控制的I2V、Union Control后训练 (Ben-Yosef et al. 2026)、CG-World单模态后训练,以及混合Depth/Canny后训练。
控制方法 | LPIPS ↓ | FVD ↓ —|—|— Depth LTX-2.3 baseline I2V | 0.503639 | 2568.610 Depth + Official Union | 0.446168 | 532.730 Depth + CG-World Depth | 0.406837 | 519.624 Depth + Mixed Union | 0.278523 | 326.324 Canny LTX-2.3 baseline I2V | 0.503639 | 2568.610 Canny + Official Union | 0.454424 | 652.224 Canny + CG-World Canny | 0.398862 | 555.545 Canny + Mixed Union | 0.304219 | 368.162
表5:LTX-2.3在观测视频生成上的后训练结果
我们使用LPIPS (Zhang et al. 2018) 和FVD (Unterthiner
第 7 页
etal. 2018)来测量生成视频与真实视频之间的感知距离和分布距离。如表5所示,CG-World的几何控制监督在两个控制分支中都取得了最佳结果。相对于Official Union,Depth分支的LPIPS和FVD分别降低了37.57%和38.75%,Canny分支则分别降低了33.05%和43.55%。这些结果表明,同源RGB、几何控制与时序信息之间的严格对齐,提升了受控视频生成的感知保真度和分布一致性。
5.2 面向物理AI的多步动作预测
第二个实验评估CG-World轨迹监督是否改善世界模型的动作预测。数据按LIBERO(Liu et al. 2023)组织,姿态采用连续六维旋转表示(Zhou et al. 2019)。以Cosmos3-Nano为基线,我们构建了三种共享动作连接器和预测头的控制配置。Action-Head Only冻结模型骨干,仅优化动作头和连接器;LIBERO-LoRA在LIBERO上后训练骨干;CG-World-LoRA则在CG-World上后训练骨干。给定当前RGB观测和自然语言指令,模型预测16步的未来动作块。三种配置共享相同的动作头、数据划分原则、训练预算和冻结评估协议。
| 指标 | Action-Head Only | LIBERO-LoRA | CG-World-LoRA | |——|——————|————-|—————| | 动作MSE ↓ | 0.11532 | 0.08061 | 0.05326 | | 平移RMSE ↓ | 0.41624 | 0.34084 | 0.27152 | | 旋转误差(°)↓ | 3.88405 | 4.53336 | 2.13520 | | 夹爪F1 ↑ | 0.70314 | 0.89354 | 0.95726 |
表6:Cosmos3-Nano动作预测结果
如表6所示,CG-World-LoRA在所有四个动作指标上均取得最佳结果。相对于LIBERO-LoRA,三个连续动作误差分别降低了33.93%、20.34%和52.90%,而夹爪F1绝对值提升了0.06372。这些结果支持了CG-World提供了超越独立演示轨迹的连续运动结构这一论断。
5.3 仿真中的VLA迁移
第三个实验评估CG-World是否为VLA模型提供可迁移的运动先验,以及这些先验是否能在有限目标域监督下改善闭环操作。我们使用OpenVLA-7B,并采用OFT连续动作回归范式(Kim, Finn, and Liang 2025)。给定RGB观测和任务指令,模型输出7维相对末端执行器动作。我们比较了使用ManiSkill3(Tao et al. 2024)和CG-World进行后训练的效果。CG-World pre-adapt + OFT条件在相同的目标域OFT协议之前,增加了CG-World动作预适应。我们评估了域内任务在PickCube上的成功率、在未见过的StackCube任务上的跨任务泛化能力,并将失败分解为抓取和举起阶段。
| 配置 | PickCube ID SR | Wilson 95% CI | StackCube OOD SR | |——|—————-|—————|——————| | C1 Zero-shot | 0.7 ± 1.2% | 0.7% [0.2%, 2.4%] | 0.0 ± 0.0% | | C2 RGB BC (OFT) | 4.0 ± 4.4% | 4.0% [2.3%, 6.9%] | 0.0 ± 0.0% | | CG-World pre-adapt + OFT | 39.0 ± 4.4% | 39.0% [33.7%, 44.6%] | 25.0 ± 4.4% |
| 配置 | 抓取 | 举起 | |——|——|——| | C1 Zero-shot | 0.0 ± 0.0% | 0.0 ± 0.0% | | C2 RGB BC (OFT) | 99.0 ± 1.0% | 68.7 ± 7.5% | | CG-World pre-adapt + OFT | 99.5 ± 0.5% | 88.3 ± 3.1% |
表7:OpenVLA在桌面容器操作迁移上的仿真结果
如表7所示,CG-World预训练将域内PickCube成功率从C2的4.0%提升至39.0%,并将StackCube的OOD成功率从所有基线的0%提升至25.0%。其主要收益并非进一步强化已经饱和的目标接近和抓取,而是改善了抓取后的举起、轨迹连续性、物体搬运以及后续动作规划。
6 未来工作
未来工作将使用严格配准的真实-虚拟场景对,来测量观测、动力学和干预效应中的偏差;开发误差和不确定性模型;并利用有限的真实世界数据校准工业CG机制和采样范围。我们还将扩展长时程因果链和动力学覆盖。社区插件将把项目映射到CG-World模式,而贡献将需要模式、时序一致性、授权和来源检查,并在L1/L2/L3层级下获得版本和引用元数据。
7 讨论与结论
7.1 讨论
CG-World v1继承了制作偏差:叙事和镜头选择、风格化或修正的运动、引擎和求解器特定行为、不完整的遗留记录,以及因合成、透明度或程序化材质而弱化的状态-观测对应关系。因此,其源自制作的状态应作为具有记录来源和操作条件的显式监督使用,而非未经校准的真实世界物理真值。
7.2 结论
CG-World通过世界状态协议和大规模数据集,对齐了工业CG状态、动作、多模态观测和因果分支。这种监督支持对状态演化、观测生成和干预结果进行建模,超越了终端像素拟合,从而改善了受控视频生成、动作预测和具身操作迁移。
第 8 页
参考文献 Ahmed, O.; Träuble, F.; Goyal, A.; Neitz, A.; Bengio, Y.; Schölkopf, B.; Bauer, S.; and Wüthrich, M. 2021. CausalWorld: A Robotic Manipulation Benchmark for Causal Structure and Transfer Learning. In International Conference on Learning Representations. Bakhtin, A.; van der Maaten, L.; Johnson, J.; Gustafson, L.; and Girshick, R. 2019. PHYRE: A New Benchmark for Physical Reasoning. In Advances in Neural Information Processing Systems, volume 32. Ben-Yosef, M.; Halperin, T.; Korem, N. K.; Salama, M.; Khazatsky, A.; Pertsch, K.; Nair, S.; et al. 2024. DROID: A Large-Scale In-the-Wild Robot Manipulation Dataset. In Proceedings of Robotics: Science and Systems XX. Bruce, J.; Dennis, M.; Edwards, A.; et al. 2024. Genie: Generative Interactive Environments. arXiv:2402.15391. Cain, H.; Joseph, A.; Chen, A.; Jelercic, U.; and Bibi, O. 2026. AVControl: Efficient Framework for Training Audio-Visual Controls. arXiv:2603.24793. Carreira, J.; Noland, E.; Hillier, C.; and Zisserman, A. 2019. A Short Note on the Kinetics-700 Human Action Dataset. arXiv:1907.06987. Chang, A.; Dai, A.; Funkhouser, T.; et al. 2017. Matterport3D: Learning from RGB-D Data in Indoor Environments. In Proceedings of the International Conference on 3D Vision, 667–676. Chen, T.-S.; Siarohin, A.; Menapace, W.; et al. 2024. Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 13320–13331. Dai, A.; Chang, A. X.; Savva, M.; Halber, M.; Funkhouser, T.; and Nießner, M. 2017. ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 5828–5839. Deng, J.; Dong, W.; Socher, R.; Li, L.-J.; Li, K.; and Fei-Fei, L. 2009. ImageNet: A Large-Scale Hierarchical Image Database. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 248–255. Ding, J.; Zhang, Y.; Shang, Y.; et al. 2025. Understanding World or Predicting Future? A Comprehensive Survey of World Models. ACM Computing Surveys, 58(3): 1–38. Gan, C.; Schwartz, J.; Alter, S.; et al. 2021. ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation. In Proceedings of the NeurIPS Track on Datasets and Benchmarks, volume 1. Grauman, K.; Westbury, A.; Byrne, E.; et al. 2022. Ego4D: Around the World in 3,000 Hours of Egocentric Video. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 18995–19012. Greff, K.; Belletti, F.; Beyer, L.; et al. 2022. Kubric: A Scalable Dataset Generator. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 3749–3761. HaCohen, Y.; Brazowski, B.; Chiprut, N.; et al. 2026. LTX-2: Efficient Joint Audio-Visual Foundation Model. arXiv:2601.03233. Hafner, D.; Pasukonis, J.; Ba, J.; and Lillicrap, T. 2025. Mastering Diverse Control Tasks through World Models. Nature, 640: 647–653. Hu, A.; Russell, L.; Yeo, H.; Murez, Z.; Fedoseev, G.; Kendall, A.; Shotton, J.; and Corrado, G. 2023. GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. Hu, E. J.; Shen, Y.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W. 2022. LoRA: Low-Rank Adaptation of Large Language Models. In International Conference on Learning Representations. Kim, M. J.; Finn, C.; and Liang, P. 2025. Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success. arXiv:2502.19645. Kim, M. J.; Pertsch, K.; Karamcheti, S.; et al. 2025. OpenVLA: An Open-Source Vision-Language-Action Model. In Proceedings of the 8th Conference on Robot Learning, volume 270 of PMLR, 2679–2713. Li, C.; Xia, F.; Martín-Martín, R.; et al. 2022. iGibson 2.0: Object-Centric Simulation for Robot Learning of Everyday Household Tasks. In Proceedings of the 5th Conference on Robot Learning, volume 164 of PMLR, 455–465. Li, M.; Yang, M.; Liu, F.; Chen, X.; Chen, Z.; and Wang, J. 2020. Causal World Models by Unsupervised Deconfounding of Physical Dynamics. arXiv:2012.14228. Liu, B.; Zhu, Y.; Gao, C.; Feng, Y.; Liu, Q.; Zhu, Y.; and Stone, P. 2023. LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning. In Advances in Neural Information Processing Systems, volume 36. Motamed, S.; Culp, L.; Swersky, K.; Jaini, P.; and Geirhos, R. 2026. Do Generative Video Models Understand Physical Principles? In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, 948–958. NVIDIA. 2026. Cosmos 3: Omnimodal World Models for Physical AI. arXiv:2606.02800. NVIDIA; Agarwal, N.; Ali, A.; et al. 2025. Cosmos World Foundation Model Platform for Physical AI. arXiv:2501.03575. Open X-Embodiment Collaboration. 2024. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. In Proceedings of the IEEE International Conference on Robotics and Automation, 6892–6903. Pearl, J. 2009. Causality: Models, Reasoning, and Inference. Cambridge University Press, 2 edition. Pixar Animation Studios. 2025. Universal Scene Description (OpenUSD). OpenUSD Official Documentation, https://openusd.org. Raffel, C.; Shazeer, N.; Roberts, A.; et al. 2020. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. Journal of Machine Learning Research, 21(140): 1–67.
第 9 页
Ramos, S.; Girgin, S.; Hussenot, L.; et al. 2021. RLDS: 一个用于生成、共享和使用强化学习数据集的生态系统。arXiv:2111.02767。 Riochet, R.; Castro, M. Y.; Bernard, M.; Lerer, A.; Fergus, R.; Izard, V.; and Dupoux, E. 2022. IntPhys 2019: 视觉直觉物理理解的基准测试。《IEEE模式分析与机器智能汇刊》,44(9): 5016–5025。 Russell, L.; Hu, A.; Bertoni, L.; Fedoseev, G.; Shotton, J.; Arani, E.; and Corrado, G. 2025. GAIA-2: 一种面向自动驾驶的可控多视图生成式世界模型。arXiv:2503.20523。 Tao, S.; Xiang, F.; Shukla, A.; et al. 2024. ManiSkill3: 面向可泛化具身AI的GPU并行化机器人仿真与渲染。arXiv:2410.00425。 Unterthiner, T.; van Steenkiste, S.; Kurach, K.; Marinier, R.; Michalski, M.; and Gelly, S. 2018. 迈向精确的视频生成模型:新指标与挑战。arXiv:1812.01717。 Walke, H. R.; Black, K.; Zhao, T. Z.; et al. 2023. BridgeData V2: 一个大规模机器人学习数据集。收录于《第7届机器人学习会议论文集》,PMLR第229卷,1723–1736。 Yi, K.; Gan, C.; Li, Y.; Kohli, P.; Wu, J.; Torralba, A.; and Tenenbaum, J. B. 2020. CLEVRER: 用于视频表示与推理的碰撞事件。收录于《国际学习表征会议》。 Zhang, R.; Isola, P.; Efros, A. A.; Shechtman, E.; and Wang, O. 2018. 深度特征作为感知度量的不合理有效性。收录于《IEEE计算机视觉与模式识别会议论文集》,586–595。 Zhao, P.; Lin, J.; Rupprecht, T.; et al. 2026. PhyWorld: 面向视频生成的物理忠实世界模型。arXiv:2605.19242。 Zhou, Y.; Barnes, C.; Lu, J.; Yang, J.; and Li, H. 2019. 论神经网络中旋转表示的连续性。收录于《IEEE/CVF计算机视觉与模式识别会议论文集》,5745–5753。 Zitkovich, B.; Yu, T.; Xu, S.; et al. 2023. RT-2: 视觉-语言-动作模型将网络知识迁移至机器人控制。收录于《第7届机器人学习会议论文集》,PMLR第229卷,2165–2183。