快速导读:PHIZERO 的核心洞察是:人类不是用像素思考物理的。我们看到球飞向积木,脑中浮现的是“碰撞-倾倒-散落”这样的抽象概念,然后才想象具体画面。PHIZERO 把这个过程工程化了——它从海量野生视频中自监督地学出一套紧凑的离散编码,专门描述状态如何变化,与物体长什么样无关。这套编码就是“物理语言”。
PHIZERO 提出了一种全新的物理世界建模范式:不再直接在像素空间预测未来帧,而是先学习一套紧凑的离散“物理语言”来描述状态过渡,再基于这套语言渲染视频。这种“先推理后渲染”的设计将动力学推理与外观合成彻底解耦,使模型能够显式地推理物理过程,而非隐式地记忆像素模式。
该工作的核心洞察来自人类认知:我们并非在视网膜上逐像素推演未来,而是将视觉经验抽象为可组合的因果概念,再用这些概念指导想象。PHIZERO 将这一过程工程化为两个阶段——物理语言分词器从视频中自监督地发现状态过渡的离散编码,物理语言推理器则根据初始帧和动作意图自回归地预测这些编码序列。
英文题目:PHIZERO: A World Model Built Around Physical Language
论文出处:arXiv 每日论文精选 · arXiv:2607.28624
原始论文:PDF / 论文页面
对应视频标题:PHIZERO:用离散物理语言让世界模型先推理再渲染|推荐指数:★★★★★
这篇论文解决什么问题?
当前主流的物理世界模型大多采用视频预测范式,即给定历史帧,直接生成未来帧的像素。这种方法将物理规律隐式地编码在生成模型的参数中,缺乏对底层动力学的显式建模。当遇到训练分布之外的物理交互时,模型往往产生违反直觉的结果,例如物体穿透、重力失效或碰撞响应错误。
根本问题在于,像素空间混合了物理状态和视觉外观。一个球被推动的物理过程——质量、摩擦力、碰撞——与球表面的纹理、光照条件纠缠在一起。直接预测像素迫使模型同时处理这两类信息,导致物理推理被外观统计所淹没。
人类解决这个问题的方式是抽象:我们从视觉经验中提炼出“推”、“滚”、“弹”等概念,用语言或符号进行推理,再在想象中填充视觉细节。PHIZERO 正是受此启发,试图为机器构建类似的抽象层。
与现有工作不同,PHIZERO 不依赖预定义的物理变量或仿真引擎,而是从大规模野生视频中自监督地发现状态过渡的离散结构。这使得它能够覆盖仿真难以建模的复杂真实世界现象,如布料褶皱、流体飞溅和颗粒流动。
核心创新
方法概览
PHIZERO 的核心洞察是:人类不是用像素思考物理的。我们看到球飞向积木,脑中浮现的是“碰撞-倾倒-散落”这样的抽象概念,然后才想象具体画面。PHIZERO 把这个过程工程化了——它从海量野生视频中自监督地学出一套紧凑的离散编码,专门描述状态如何变化,与物体长什么样无关。这套编码就是“物理语言”。
- 物理语言分词器(Physical Language Tokenizer)是 PHIZERO 的核心组件。它接收连续两帧的潜在表示,通过过渡级 Q-Former 提取状态变化特征,再经 FSQ 离散化为固定长度的物理语言序列。一个预训练的扩散解码器(Wan2.2)根据首帧和物理语言重建完整视频,迫使物理语言保留足够的动力学信息。
- 过渡级 Q-Former 的设计是关键创新。标准 Q-Former 处理单帧特征,而过渡级版本同时接收相邻帧的潜在状态,通过交叉注意力学习帧间变化模式。这使得学到的查询向量天然聚焦于运动、形变和交互,而非静态外观。
- 纯噪声预热(pure-noise warm-up)策略解决了训练初期的坍塌问题。在分词器训练的前几个 epoch,扩散解码器的输入被替换为纯噪声,迫使 Q-Former 和 FSQ 不依赖解码器的先验知识,独立学习有意义的过渡编码。这一技巧显著提升了物理语言的表达能力。
- 物理语言推理器(Physical Language Reasoner)基于预训练的 Qwen3-VL-4B VLM。它接收首帧图像和文本动作意图(如“推倒积木塔”),自回归地预测物理语言序列。推理器经过两阶段训练:先在海量视频上继续预训练以适应物理语言模态,再在精选的运动丰富片段上进行 SFT,使其预测的序列能产生物理合理的结果。
- 数据管线采用分层筛选策略。从 50K 小时互联网视频池出发,经过运动量、场景多样性和视觉质量等多轮过滤,最终得到 10K 小时用于分词器预训练、5M 四秒片段用于 SFT、1M 运动丰富片段用于推理器 SFT。仿真数据作为补充,提供精确的物理真值。
- 推理与渲染的解耦使得物理语言成为可迁移的运动接口。编码自源域视频的物理语言序列,可以在编辑首帧(替换实体或场景)后直接渲染,实现零样本跨形态运动迁移。
- 整个框架的训练是分阶段的:先独立训练分词器,冻结后再训练推理器。这种解耦设计使得各组件可以独立优化和替换,例如未来可以接入更强的 VLM 或扩散解码器。
- 物理语言的词汇量通过 FSQ 的码本大小控制,论文中使用 256 个 token 即可实现高质量重建(PSNR 28.9),证明了紧凑表示的可行性。
逐图理解论文
像素预测的失败

定性对比图直观展示了 PHIZERO 与 Wan2.2-5B 的差异。重点观察碰撞后物体的位移幅度、重力作用下物体的形变程度、以及阴影随运动的变化——这些细节反映了模型是否真正理解了物理交互。
核心洞察:物理语言

流水线全景图分左右两部分:左侧展示分词器如何从相邻帧提取物理语言并重建视频,右侧展示推理器如何根据首帧和文本预测物理语言序列。重点关注过渡级 Q-Former 的位置和 FSQ 离散化步骤,这是解耦动力学的关键。
Figure 3: Hierarchical data curation pipeline

数据管线图展示了从 50K 小时原始视频到最终训练集的层层筛选过程。注意各阶段的过滤标准和数据量变化,理解为何需要如此大规模且多样化的野生视频来学习通用的物理语言。
实验如何设计?
- 视频生成评估使用三个基准:Physics-IQ Verified 测试物理结果保真度,PhyGround 评估物理定律遵循度,WorldModelBench 衡量通用世界建模能力。
- 视频理解评估使用 IntPhys2(直观物理理解)、LikePhys(物理合理性判别)和 YoCausal(真实世界因果理解),测试物理语言是否编码了可泛化的物理知识。
- 分词器消融实验对比了有无扩散解码器、有无过渡级 Q-Former、有无纯噪声预热等变体,在重建质量和下游物理一致性上验证各组件贡献。
- 推理器消融实验考察了提示增强、仿真数据混合和两阶段训练策略对 IQ-Score 的影响。
- 物理语言的可迁移性通过 PCA/UMAP 可视化分析,展示不同实体和场景下物理语言序列的语义聚类结构。
- 零样本迁移实验在跨实体和仿真到真实两个设定下进行,源域视频的物理语言序列在编辑首帧后渲染到目标域。
关键结果与论文证据
- 在 Physics-IQ Verified 上,PHIZERO 的 IQ-Score 达到 41.2,显著优于直接像素预测的 Wan2.2-5B 基线(第 7 页 Table 1)。定性结果显示,PHIZERO 更好地捕捉了碰撞位移、重力形变、连锁反应和动态阴影变化(第 8 页 Figure 4)。
- 在 PhyGround 上,物理得分 3.01,总分 2.97,表明物理语言推理有效提升了物理定律遵循度(第 7 页 Table 2)。
- 在 WorldModelBench 上,物理遵循度 4.88,总分 8.19,验证了先推理后渲染范式在通用世界建模上的优势(第 7 页 Table 3)。
- 在 IntPhys2 上,整体准确率 56.34%,说明物理语言编码了可迁移的直观物理知识(第 7 页 Table 4)。
- 在 LikePhys 上,平均误差 41.7,在物理合理性判别任务上表现优异(第 7 页 Table 5)。
- 在 YoCausal 上,聚合排名 2.0,展示了强大的真实世界因果理解能力(第 7 页 Table 6)。
- 分词器消融实验表明,纯噪声预热对物理语言质量贡献最大,移除后 IQ-Score 显著下降(第 8 页 Table 8)。推理器消融显示,两阶段训练和仿真数据混合均带来稳定增益(第 9 页 Table 9)。
- PCA/UMAP 可视化揭示物理语言序列按运动类型自然聚类,而非按外观,证实了动力学与外观的解耦(第 9 页)。零样本跨实体迁移实验展示了物理语言作为通用运动接口的潜力(第 11 页 Figure 8)。
阅读时需要注意
- 物理语言是纯经验表示,不直接对应质量、速度等可解释物理变量,难以进行精确的物理编辑或形式化验证。
- 训练数据限于视觉可观测现象,触觉、微观或亚像素动力学难以建模,覆盖范围受限于视频数据分布。
- 当前模型规模较小(VLM 仅 4B),训练语料 10K 小时,相比物理世界的多样性仍显不足,可能影响长尾场景的泛化。
- 零样本迁移仍需在源域进行简短的分词器微调,并非完全的零样本设定。
关联工作
- Wan2.2 作为预训练扩散解码器和 VAE 编码器,提供了高质量的像素级视频合成能力,使 PHIZERO 可以专注于物理语言的学习。
- Qwen3-VL-4B 作为推理器的基座 VLM,提供了强大的视觉理解和序列预测能力,其预训练知识有助于物理推理。
- FSQ(有限标量量化)将连续过渡特征离散化为紧凑码本,相比 VQ-VAE 更稳定且无需复杂的码本坍塌预防策略。
- Cosmos3 作为物理世界模型基线,在多个基准上被 PHIZERO 超越,凸显了显式物理推理的优势。
- VideoFlexTok 作为视频分词器基线,在重建质量对比中验证了过渡级 Q-Former 设计的有效性。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
预印本
PHIZERO:一个围绕物理语言构建的世界模型
尚舒瑶 王玉琪†§ 高若朋§ 陈旭§ 谭铁牛 樊路 张兆翔
中国科学院自动化研究所 模式识别国家重点实验室 (CASIA)
人类智能 不支持 PhiZero(我们的) 物理语言 坠落 生成器 物体坠落 分词器 推理器 …
观察 收集 不支持物体坠落 视觉经验 抽象 过渡 语言 推理 自然场景视频 学习物理语言 在物理语言中推理 人类:从视觉经验到自然语言推理 PhiZero:从自然场景视频到物理语言推理
当前图像 物理语言 文本/数值 动作 未来视频
通用视频世界建模 2026 物理真实视频生成 图像到世界探索 7月 细粒度世界仿真 30
动作条件驾驶世界模型 动作条件机器人世界模型 零样本运动迁移
编辑 迁移 物理语言 编辑 迁移 物理语言[cs.CV] 将人体运动迁移到G1人形机器人 将人手运动迁移到Sharpa灵巧手 图1:我们提出了PHIZERO,一个物理世界模型,它从自然场景视频中学习紧凑的离散物理语言。该模型在此空间中推理世界演化,并将推断的过渡渲染为视频,从而实现物理真实且可交互的世界建模、细粒度的动作条件仿真以及零样本运动迁移。
摘要
我们提出了PHIZERO,一个围绕物理语言构建的物理世界模型,物理语言是世界状态过渡的一种紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,导致底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象预测结构并用自然语言组织以进行显式推理的能力启发,我们通过自监督从自然场景视频中学习物理语言,并利用它来显式推理物理世界如何演化。相应地,PHIZERO采用先推理后渲染的范式:它首先将未来世界演化推断为物理语言序列,然后将推断的过渡渲染为视频。在生成和理解基准上的大量实验验证了PHIZERO建模物理一致世界演化的能力。我们进一步展示了其在真实且可交互的世界建模、细粒度动作条件仿真以及零样本运动迁移方面的潜力。
†项目负责人。通讯作者。§独立研究员。
1
第 2 页
预印本
1 引言
“你看见了,但你并未观察。” ——夏洛克·福尔摩斯,《波希米亚丑闻》
视频世界模型能够生成具有高视觉保真度的未来视频,因此越来越被视为有前景的物理世界模拟器(OpenAI, 2025; Google DeepMind, 2026)。要使此类模型支持物理人工智能,其核心目标必须超越视觉保真度,转向学习物理世界如何演化。然而,主流方法主要通过像素空间中的直接预测进行训练,导致底层动力学隐含在高维视觉表征中,并常常产生物理上不一致的结果。
我们从人类智能中汲取灵感。人类并非记忆个别的视觉结果,而是从视觉经验中抽象出模式,形成关于世界如何演化的可泛化知识。自然语言是组织和表达此类知识的主要媒介,提供了一个人类可以显式推理的符号空间。语言模型在数字领域的成功进一步证明了语言作为学习和推理基础的可扩展性。然而,当建模目标从数字世界转向物理世界时,自然语言往往过于粗糙,无法忠实地表示视觉经验中观察到的复杂状态转换。因此,我们提出一个问题:我们能否超越自然语言,学习一种更细粒度的物理世界转换表征,以实现显式推理?
为此,我们提出了PHIZERO,一个围绕物理语言∗构建的物理世界模型。该语言通过自监督学习从无标签的野外视频中习得,并捕捉了跨多种视觉经验的状态转换模式(图1)。一旦习得,物理语言便提供了一种中间表征,用于在渲染为视频之前推断世界演化。这种先推理后渲染的范式将动力学推断与像素级合成解耦,使世界演化成为一个显式的推理目标,而非直接的像素空间预测。
学习一种能够捕捉世界如何演化的物理语言,需要将世界动力学与视觉外观解耦。因此,我们开发了一个物理语言分词器,通过自监督视频重建来学习这种表征。给定一个视频,分词器将其状态转换编码为一个离散的物理语言序列,该序列与第一帧一起,条件化一个预训练的扩散解码器以重建视频。解码器的预训练生成先验恢复了细粒度的视觉细节,而第一帧锚定了静态场景外观,使得离散瓶颈能够专注于状态变化,而非冗余的外观信息。我们进一步引入了一个从预训练视觉语言模型(VLM)初始化的物理语言推理器。利用VLM的视觉语义知识和常识先验,推理器根据当前视觉状态和动作意图自回归地预测物理语言序列。预测的序列随后由扩散解码器渲染为视频。
大量实验在评估物理保真度的视频生成基准和评估物理合理性的视频理解基准上验证了PHIZERO。我们进一步表明,物理语言为表示、控制和转移物理世界中的状态转换提供了一个通用接口,支持在序列控制输入下的交互式推演、细粒度的动作条件世界建模以及零样本运动迁移(图1)。这些结果共同将PHIZERO定位为一个有前景的可控且可迁移的物理世界建模框架,对物理人工智能具有广泛潜力。
我们的主要贡献总结如下:
• 我们引入了物理语言,这是一种紧凑的离散状态转换模式表征,可以通过自监督学习从野外视频中大规模习得。
• 我们开发了PHIZERO,一个围绕物理语言构建的物理世界模型。PHIZERO采用先推理后渲染的范式,首先在物理语言空间中推断未来的世界演化,然后将推断出的转换渲染为视频。
• 大量实验在物理生成和理解两方面验证了PHIZERO。我们进一步展示了其在交互式推演、动作条件世界模拟和零样本运动迁移方面的潜力。
∗此处,物理泛指物理世界,而非物理定律的符号系统。
第 3 页
预印本
2 相关工作
2.1 物理世界模型
近期研究越来越多地通过扩展视频生成与预测,在语言或动作条件下模拟未来视觉状态,从而构建物理世界模型。Yang等人 (2023) 从异构真实世界数据中学习交互式模拟器,而Wang等人 (2024);Xiang等人 (2024) 则通过离散视觉预测和语言条件视频生成来建模世界演化。Agarwal等人 (2025);Ali等人 (2025);Agarwal等人 (2026) 进一步通过预训练世界基础模型、统一多模态条件以及面向物理AI的全模态建模推进了这一范式。其他系统通过自回归去噪或潜状态预测后接视频渲染来改进长程模拟 (Zhu等人, 2025;Xiang等人, 2025)。这些方法主要在像素空间中表示世界演化。相比之下,PHIZERO将状态转移显式表示为紧凑的离散物理语言,在此转移空间中推理世界演化,然后将推断出的演化渲染为视频。
2.2 从无标签视频中学习世界动力学
大量研究探索了如何从无标签视频中学习世界动力学的预测性和可操作表示。Bruce等人 (2024);Gao等人 (2025) 从互联网视频中观测到的帧间变化中发现可控的潜在动作空间。在机器人与自动驾驶领域,Schmidt & Jiang (2024);Ye等人 (2025);Chen等人 (2025);Bu等人 (2025b);Shang等人 (2026) 学习潜在动作,并将得到的运动先验迁移到下游控制任务中。Wu等人 (2023;2024) 学习能够捕捉时序变化并可跨场景迁移的潜在动力学。Bardes等人 (2024);Assran等人 (2025) 在表示空间中预测被掩码的时空区域,证明大规模视频预训练可以产生对物理世界理解和规划有用的表示。Ren等人 (2025;2026) 进一步研究是否可以直接从面向任务的视频中获取规划能力。与这些方法不同,我们学习一种紧凑的物理语言,用于捕捉物理世界中的状态转移模式,而非与特定领域或任务绑定的潜在动作。
3 方法
如图2所示,PHIZERO包含两个互补的组件。物理语言分词器将视频中的状态转移压缩为离散的物理语言序列,而扩散解码器则学习以第一帧和提取的物理语言为条件渲染未来视频(第3.2节)。物理语言推理器随后根据第一帧和文本动作意图预测相应的物理语言序列(第3.3节)。
3.1 问题形式化
形式上,令V表示未来视频,I0表示代表当前世界状态的第一帧,c表示文本动作意图,z表示描述从I0到V转移过程的离散物理语言。物理语言作为状态转移的紧凑中间表示,捕捉了世界演化方式的共享模式。我们将未来预测形式化为物理语言序列与未来视频的联合建模,该过程分解为物理语言推理和视频渲染:
pθ,ψ (V, z | I0, c) = pθ (z | I0, c) pψ (V | I0, z). (1) | {z } | {z } | {z } PHIZERO 物理语言推理 未来视频渲染
物理语言推理器推断当前状态应如何在物理语言空间中演化,随后扩散解码器将推断出的转移渲染为未来视频。这种先推理后渲染的分解方式将状态转移推理与像素级合成分离开来。
第 4 页
预印本
重建视频 生成视频
q 过渡级 q Q-Former 投影 FSQ 纯噪声
相邻 量化 融合 替换 扩散解码器 条件 文本 扩散 … 13 98 解码器 ST编码器 物理语言推理 98 72 13 … 物理 语言 自回归VLM 除首帧外 添加噪声 “将酒倒入玻璃杯” 98 72 … 文本动作提示
干净视频 噪声视频 首帧 (a) 物理语言分词器 (b) 物理语言推理器
图2: PHIZERO整体流程。(a) 物理语言分词器使用过渡级Q-Former将视频状态过渡压缩为紧凑的离散物理语言。扩散解码器以物理语言和首帧为条件重建视频。(b) 物理语言推理器使用自回归VLM,根据首帧和文本动作意图预测物理语言序列。随后,训练好的扩散解码器将推断的状态过渡渲染为未来视频。
3.2 物理语言分词器
基于过渡级Q-Former的编码器 给定视频V ∈RB×3×T ×H×W,我们首先使用时空编码器获得潜在特征x ∈RB×C×t×h×w。我们没有从整个视频中提取全局表示,而是显式地建模每对相邻潜在状态之间的过渡。这引入了一种局部时间归纳偏置,在保留完整序列时间顺序的同时,降低了每个压缩过渡的复杂度。令xi ∈RB×C×h×w表示时间步i的潜在状态。对于每对相邻状态(xi, xi+1),我们使用共享的Q-Former (Li et al., 2023)提取过渡表示:
qi = QFormer Q; xi, xi+1 , (2)
其中Q ∈RM×Dq包含M个共享的可学习过渡查询。通过联合关注两个相邻潜在状态,Q-Former为每个时间间隔生成M个过渡特征qi ∈RB×M×Dq。我们按时间顺序拼接所有相邻间隔的特征,得到q ∈RB×N×Dq,其中N = (t −1)M。然后,我们使用有限标量量化(FSQ) (Mentzer et al., 2024)对过渡特征进行离散化。具体而言,特征被投影到一个低维量化空间,并量化为:
z = FSQ (Projdown(q)) , (3)
其中z表示生成的离散物理语言序列。FSQ将其词汇表构建为标量量化级别的笛卡尔积,因此无需单独学习的码本。最后,量化表示z被投影到扩散Transformer的隐藏维度d,得到物理语言上下文Pc ∈RB×N×d。
扩散先验解码器 容量有限的物理语言瓶颈应专注于表示状态过渡,而非编码视频重建所需的所有细粒度外观细节。因此,我们采用预训练视频扩散模型 (Wan et al., 2025) 作为解码器,其强大的生成先验能够从紧凑的状态过渡表示中恢复逼真的外观和视觉细节。为保留此预训练生成先验,我们保持原始模型架构不变,仅将其文本条件替换为物理语言上下文Pc。我们进一步提供首帧I0作为干净的视觉条件,并将其视为静态外观的来源。通过首帧直接提供外观信息,促使离散瓶颈编码未来的状态变化,而非冗余的静态视觉细节。以物理语言上下文Pc、首帧I0、干净潜在变量x0和扩散时间步τ ∼U(0, 1)为条件,解码器使用标准流匹配 (Liu et al., 2023b) 目标重建目标视频: h i 2 LFM = Ex, ϵ, τ vψ(xτ, τ; I0, Pc) −(ϵ −x0) 2 , xτ = (1 −τ)x0 + τϵ, ϵ ∼N(0, I) (4)
4
第 5 页
预印本
分辨率和渲染质量过滤
收集 1千小时 时长过滤 互联网 仿真 物体运动过滤 视频 视频池
分词器SFT和推理器SFT数据 推理器预训练 数据 1百万 已过滤 分词器 高运动质量 预训练数据 5百万 已过滤 4秒视频片段 真实世界 + 仿真 4秒视频片段 物理过滤 丰富运动过滤 1万小时 5万小时 真实世界过滤 开放域视频 美学过滤 真实世界 运动分数过滤 视频池
可观测状态转移过滤 去重
技术质量过滤
分辨率和时长过滤
场景切换和镜头转场过滤
图3: 层次化数据筛选流程。我们收集互联网视频,构建了一个5万小时的开放域真实世界视频池和一个1千小时的仿真视频池。通过渐进式过滤,得到1万小时用于分词器预训练,5百万个四秒片段用于分词器SFT和推理器预训练,以及1百万个运动丰富的四秒片段用于推理器SFT。
纯噪声预热 预训练的扩散解码器可能最初会忽略新引入的物理语言上下文,因为它依赖于部分损坏的目标信息及其现有的去噪先验。为了防止这种捷径,我们引入了一个纯噪声预热阶段,在此阶段所有未来帧的潜变量都从纯噪声初始化。因此,解码器必须依赖物理语言上下文和第一帧来重建未来视频。预热之后,我们恢复标准的流匹配噪声调度。该策略缓解了去噪捷径,并为学习信息丰富的物理语言表示提供了更强的监督。
数据筛选流程 我们分两个阶段训练物理语言分词器:大规模预训练和后续的有监督微调(SFT)。如图3所示,对于预训练,我们从一个包含约5万小时素材的真实世界视频池开始。我们去除重复片段,并过滤掉存在技术缺陷的片段,包括压缩伪影、损坏帧和水印,以及那些不满足分辨率或时长要求或包含突然镜头转场的片段。此过程产生了约1万小时的无标签视频,用于分词器预训练。对于后续的SFT阶段,我们基于美学质量、运动幅度以及由VLM评判器评估的状态转移可观测性,应用了更严格的二次过滤流程。同时,我们通过移除渲染质量低、时长无效或物体运动不足的样本,筛选出约1千小时的仿真视频。将得到的真实世界和仿真数据合并,产生了约5百万个四秒视频片段,用于分词器SFT。更多数据细节见附录A.1。
课程训练方案 我们将这种两阶段训练方案与联合的时间和空间课程相结合。在预训练期间,我们以256×448的分辨率处理视频,并逐步将片段时长从1秒增加到2秒,最后到4秒。这使得分词器能够先学习局部状态变化,然后再建模更长范围的世界演变。然后,我们将重建分辨率提高到512×896,并在筛选出的5百万片段语料库上进行SFT。最后,我们冻结分词器,仅微调扩散解码器以进一步提高重建质量。更多训练细节见附录A.1。
3.3 物理语言推理器
使用预训练VLM进行物理语言推理 预测未来的状态转移需要结合当前视觉状态来解释文本动作意图,并推断世界应如何演变。预训练的VLM从大规模图像-文本数据中编码了丰富的视觉语义和常识世界知识,为此任务提供了强大的先验。因此,我们初始
第 6 页
预印本
我们从预训练的VLM(Bai et al., 2025a)初始化物理语言推理器。为使其适应物理语言分词器所学习的物理语言空间,我们为其词汇表扩展了每个FSQ索引对应的独立原子符号。给定第一帧I0和文本提示c,物理语言推理器在大小为K的FSQ诱导词汇表上自回归地预测长度为N的物理语言序列。其条件分布按时间顺序分解为
YN pθ(z | I0, c) = pθ(zj | I0, c, z<j)。 (5) j=1
我们通过使用冻结的物理语言分词器对每个训练视频进行编码来离线生成监督信号,即z = Tϕ(V)。在教师强制下,物理语言推理器通过自回归交叉熵目标进行优化
XN LVLM = − log pθ(zj | I0, c, z<j)。 (6) j=1
数据筛选流程 我们分两个逐步专业化的阶段构建物理语言推理器的训练数据。如图3所示,对于持续预训练,我们复用了用于物理语言分词器SFT的约500万个经过筛选的四秒真实世界与仿真片段。对于每个片段,VLM生成的描述和第一帧作为输入,而冻结的物理语言分词器提供目标物理语言序列。为防止文本条件泄露结果,如表14所示,我们提示VLM仅总结每个片段中的高层起始动作或交互,而非叙述细粒度的过渡细节。为构建后续的SFT语料库,我们进一步使用基于VLM的丰富运动过滤器和物理过滤器对该通用数据集进行筛选,保留展现出显著状态变化和物理信息交互的片段。结合筛选后的仿真器生成样本,此过程为推理器SFT产生了约100万个运动丰富且物理信息丰富的四秒片段。更多数据细节见附录A.2。
两阶段训练方案 我们分两个阶段训练物理语言推理器,数据分布逐步专业化。在第一阶段,我们从预训练的VLM(Bai et al., 2025a)初始化模型,并在包含500万个片段的通用语料库上进行持续预训练。此阶段使VLM适应自回归物理语言预测,并建立文本意图、当前视觉状态与结果状态转换之间的对应关系。在第二阶段,我们在约100万个运动丰富且物理信息丰富的片段语料库上进行SFT。通过将训练集中在具有显著运动和物理意义后果的交互上,此阶段提高了推断状态转换的物理合理性和精确度,同时保留了在持续预训练期间获得的建模世界转换的广泛能力。更多训练细节见附录A.2。
4 实验
4.1 实现细节
对于物理语言分词器,时空编码器遵循Wan2.2 VAE编码器架构(Wan et al., 2025)并以其预训练权重初始化,而扩散解码器则从Wan2.2-5B(Wan et al., 2025)初始化。我们优化时空编码器和过渡级Q-Former的所有参数,同时使用秩为32的LoRA(Hu et al., 2022)微调扩散解码器。我们将FSQ配置为标量量化级别(8, 5, 5, 5, 5, 5),产生包含25K个离散符号的词汇表,并在过渡级Q-Former中使用32个可学习查询。一个33帧的视频被编码为九个时间潜在状态;因此,从每对相邻状态中提取32个过渡符号,产生长度为(9 −1) × 32 = 256的物理语言序列。对于物理语言推理器,我们从预训练的Qwen3-VL-4B(Bai et al., 2025a)初始化模型,并为其词汇表扩展每个FSQ索引对应的一个原子符号。更多训练配置和数据细节见附录A。
6
第 7 页
预印本
表1:Physics-IQ Verified上的物理结果保真度。表2:PhyGround上的物理定律遵循度。
模型 S-IoU ↑ST-IoU ↑WS-IoU ↑IQ-Score ↑ 模型 综合质量 ↑物理得分 ↑综合得分 ↑
Wan2.2-5B (Wan et al., 2025) 24.7 22.6 13.3 21.2 LTX-Video-19B (HaCohen et al., 2026) 2.56 2.54 2.55 Sora 2 (OpenAI, 2025) 37.3 27.0 26.9 26.5 LTX-Video-22B (HaCohen et al., 2026) 2.59 2.56 2.57 Cosmos3-Nano (Agarwal et al., 2026) 40.4 22.0 24.6 29.1 Wan2.2-5B (Wan et al., 2025) 2.67 2.65 2.66 Wan2.2-14B (Wan et al., 2025) 51.1 20.5 28.5 32.2 Cosmos2.5-2B (Gu, 2025) 2.79 2.70 2.74 Hunyuan-Video (Kong et al., 2024) 47.1 26.9 29.7 33.4 OmniWeaving (Pan et al., 2026) 2.89 2.78 2.84 Grok-Video (xAI, 2026) 52.7 21.4 35.7 34.8 Veo3.1 (Google DeepMind, 2026) 3.01 2.85 2.93 Cosmos3-Super (Agarwal et al., 2026) – – – 39.5 Wan2.2-14B (Wan et al., 2025) 3.00 2.90 2.95
PHIZERO(本文) 58.2 36.8 27.6 41.2 PHIZERO(本文) 2.93 3.01 2.97
表3:WorldModelBench上的通用世界建模。表4:IntPhys2上的直觉物理理解。
模型 物理遵循度 ↑ 常识 ↑ 总计 ↑ 模型 简单 ↑ 中等 ↑ 困难 ↑ 综合 ↑
Pandora (Xiang et al., 2024) 4.05 0.95 6.57 Cosmos-4B (Agarwal et al., 2025) 46.00 52.00 48.05 49.41 OpenSora-Plan (Lin et al., 2024) 3.85 1.01 6.62 Qwen2.5-VL (Bai et al., 2025b) 50.96 53.25 51.49 52.27 CogVideoX (Yang et al., 2025c) 3.88 0.99 6.75 Gemini-1.5 Pro (Gemini Team, 2023) 58.65 53.00 52.67 52.27 Mochi (Genmo AI, 2025) 4.14 1.26 7.62 GPT-4o (Achiam et al., 2023) 57.69 54.75 54.17 53.75 Luma (Luma AI, 2024) 4.13 1.57 7.72 VideoMAEv2 (Wang et al., 2023b) 46.00 58.50 52.73 53.75 Wan2.2-5B (Wan et al., 2025) 4.51 1.41 7.98 V-JEPA (Bardes et al., 2024) 52.00 53.00 57.42 53.75 Runway (Runway ML, 2024) 4.27 1.65 8.08 Gemini-2.5 Flash (Gemini Team, 2023) 64.42 56.75 54.46 55.63
PHIZERO(本文) 4.88 1.71 8.19 PHIZERO(本文) 60.98 60.50 52.38 56.34
表5:LikePhys上的物理合理性判别。表6:YoCausal上的真实世界因果理解。
模型 刚体 ↓流体 ↓光学 ↓平均错误 ↓ 模型 RSI (%) ↑CCI (%) ↑综合排名 ↓ AnimateDiff-SDXL (Guo et al., 2023) 61.44 53.33 37.65 56.0 CogVideoX-2B (Yang et al., 2025c) 41.50 0.93 10.0 ZeroScope (Wang et al., 2023a) 57.32 49.23 41.00 53.3 Wan2.2-5B (Wan et al., 2025) 51.91 -2.12 9.0 ModelScope (Wang et al., 2023a) 59.46 47.23 35.65 52.9 Hunyuan-Video (Kong et al., 2024) 52.05 -0.29 8.0 Mochi (Genmo AI, 2025) 54.22 47.33 49.15 51.9 Wan2.1-1.3B (Wan et al., 2025) 45.51 5.36 7.5 CogVideoX-5B (Yang et al., 2025c) 59.00 43.10 26.65 49.8 Mochi (Genmo AI, 2025) 49.12 3.85 8.0 CogVideoX-2B (Yang et al., 2025c) 56.98 42.00 25.15 48.2 CogVideoX1.5-5B (Yang et al., 2025c) 46.83 4.85 8.0 Wan2.1-1.3B (Wan et al., 2025) 44.66 57.10 41.65 48.0 CogVideoX-5B (Yang et al., 2025c) 49.92 5.09 6.5 LTX-Video-2B (HaCohen et al., 2026) 43.44 33.43 61.50 44.7 LTX-Video-13B (HaCohen et al., 2026) 56.48 -4.32 7.0 CogVideoX1.5-5B (Yang et al., 2025c) 44.14 47.90 42.65 43.8 LTX-Video-2B (HaCohen et al., 2026) 58.86 -0.20 5.0 Wan2.1-14B (Wan et al., 2025) 43.34 45.00 38.35 43.8 Wan2.1-14B (Wan et al., 2025) 53.24 5.91 3.5 Hunyuan-Video (Kong et al., 2024) 36.34 48.67 41.15 43.6 Wan2.2-14B (Wan et al., 2025) 54.19 5.51 3.5
PHIZERO(本文) 29.14 53.15 37.50 41.7 PHIZERO(本文) 55.54 6.20 2.0
4.2 主要结果
视频生成结果 我们在三个面向世界模型的视频生成基准上评估PHIZERO。Physics-IQ Verified (Rädsch et al., 2026) 通过将生成视频与真实参考视频进行基于规则的指标比较,来衡量物理结果保真度。PhyGround (Lin et al., 2026) 使用专精物理的VLM评判器评估物理定律遵循度,而WorldModelBench (Li et al., 2026a) 则从物理遵循度和整体视频质量两方面评估通用世界建模能力。关于生成基准、评估协议和指标的更多细节见附录B.1。如表1、表2和表3所示,PHIZERO在所有三个生成基准上均取得了强劲的性能。它在Physics-IQ Verified上获得了最佳的IQ-Score,在PhyGround上获得了最高的物理得分和综合得分,并在WorldModelBench上取得了最佳的物理遵循度和总计分数。这些结果表明,PHIZERO能够在多样的开放域现象中生成与真实世界物理结果高度匹配的状态转换。
视频理解结果 我们进一步在三个视频理解基准上评估PHIZERO。IntPhys2 (Bordes et al., 2025) 评估直觉物理理解,LikePhys (Yuan et al., 2025) 评估模拟场景中的物理合理性判别,YoCausal (Xie et al., 2026) 则考察真实世界视频中的时序和因果理解。这三个基准均采用成对比较协议,要求模型从一对匹配的有效和无效视频中区分出物理或因果上有效的视频。对于每一对,我们将两个视频编码为物理语言序列,计算它们在物理语言推理器下的对数似然,并选择似然值更高的视频作为有效视频。关于理解基准和基于似然的评估协议的更多细节见附录B.2。如表4、表5和表6所示,PHIZERO在所有三个理解基准上均取得了有竞争力的性能,证明了其识别物理不一致性和因果违规的能力。
定性结果 如图4所示,我们将PHIZERO与Wan2.2-5B基线模型 (Wan et al., 2025) 在Physics-IQ Verified (Rädsch et al., 2026) 的四个代表性案例上进行了比较。尽管Wan2.2-5B通常能生成视觉上合理的交互,但它未能生成预期的物理结果。例如,网球击中了橡皮鸭,但鸭子未受影响
7
第 8 页
预印本
输入图像 Wan2.2-5B 输入图像 Wan2.2-5B “一只抓手将一颗蓝色 “一颗棕色网球从 球悬在一堆绿色动力 黑色管道中径直滚出, 沙上方,然后松开球, 并击中一只黄色橡皮鸭。” 使其落入柔软的沙堆中。” 文本提示 本文方法 文本提示 本文方法
输入图像 Wan2.2-5B 输入图像 Wan2.2-5B
“一排彩色积木 “一个杯子和一个方块 放在黑色平台旁, 围绕平台旋转, 一根旋转的棍子 聚光灯将它们的 挥动并击倒第一块积木。” 影子投射到墙上。” 文本提示 本文方法 文本提示 本文方法
图4:在Physics-IQ Verified上的定性比较。与Wan2.2-5B基线相比,PHIZERO更好地捕捉了交互的物理后果,包括碰撞引起的物体位移、重力驱动的形变、连锁反应以及动态变化的阴影。
表7:物理语言分词器的重建性能。结果在500个以8 FPS采样的四秒真实世界视频上报告,并在512 × 896分辨率下评估。
模型 词元数 ↓ PSNR ↑ SSIM ↑ LPIPS ↓
Wan2.2-5B VAE (Wan et al., 2025) 44800 37.7 0.957 0.042
Video-LaVIT (Jin et al., 2024) 270 23.6 0.835 0.175 VideoFlexTok (Atanov et al., 2026) (k = 32) 288 25.2 0.858 0.177 VideoFlexTok (Atanov et al., 2026) (k = 64) 576 26.5 0.870 0.167
本文方法 256 28.9 0.903 0.087
由碰撞引起。相比之下,PHIZERO生成了连贯的下游效应,包括碰撞引起的物体位移、重力作用下的形变、连锁反应以及变化的阴影。
物理语言分词器重建性能 我们进一步在500个以8 FPS采样、分辨率为512×896的四秒真实世界视频上评估了物理语言分词器的重建性能。我们报告了排除首帧条件后的表示词元数量。如表7所示,Wan2.2 VAE实现了高重建质量,但需要44,800个连续视觉词元。相比之下,我们的物理语言分词器仅用256个离散的物理语言符号来表示每个视频中的未来状态转换,并在高压缩率的分词器中取得了最佳重建质量。这些结果表明,物理语言能够紧凑地编码状态转换,同时保留足够的信息以实现高质量视频重建。
4.3 消融研究
物理语言分词器设计消融 表8:物理语言分词器消融实验 我们消融了物理语言分词器的关键设计组件,结果见表8。将预训练的扩散解码器替换为传统的确定性解码器导致性能下降最大,表明扩散先验恢复了细粒度的外观细节,并使紧凑的瓶颈能够专注于状态转换。将过渡级Q-Former替换为全局Q-Former也会降低重建质量,验证了通过显式建模相邻潜在状态之间的转换所引入的局部时间归纳偏置的有效性。最后,移除纯噪声预热持续降低了重建性能,表明预热鼓励解码器依赖物理语言条件,而不是主要依赖其预训练的去噪先验。
模型 PSNR ↑ SSIM ↑ LPIPS ↓ 无扩散解码器 26.6 0.875 0.119 无过渡级Q-Former 28.2 0.896 0.089 无纯噪声预热 27.9 0.894 0.091 完整模型 28.9 0.903 0.087
第 9 页
预印本
源视频 源视频 源视频
迁移后视频 迁移后视频 迁移后视频 图5:物理语言的可迁移性。我们将每个源视频的状态转移编码为物理语言序列,并在一个经过编辑、具有不同视觉外观的首帧条件下解码相同的序列。迁移后的视频在物体和场景外观发生显著变化的情况下,仍保留了源视频的演变过程。
左转 右转 直行 静止 夹爪:向下/闭合 夹爪:向上/闭合 8 夹爪:向下/张开 夹爪:横扫
6 9
8
4 7 6
5 2 4
13 2 5 3 4 3 2 1 4 5 0 2 4 6 8 10 8 6 4 2 0 6
(a) 自动驾驶 (b) 机器人操作 图6:物理语言的语义结构。我们将转移特征聚合为片段级表示,使用PCA降至20维,并用UMAP投影到3D空间。得到的嵌入自然地根据底层转移模式进行组织,在两个领域中形成了结构化的流形或簇。
表9:推理器消融实验 方法 IQ-Score ↑ 物理语言推理器设计消融实验 我们在Physics-IQ Verified上评估了物理语言推理器。如表9所示,提示增强提升了Wan2.2-5B基线的性能,但仍远低于PHIZERO,这表明仅靠自然语言推理不足以对细粒度的状态转移进行建模。移除仿真数据也会降低性能,证实了仿真器生成的交互能改善对物理上合理的转移的预测,并有益于真实世界的视频生成。这一结果进一步凸显了利用仿真器生成的数据来扩展物理语言推理的潜力。最后,用联合训练替代两阶段训练会降低性能,表明在精心策划的、富含运动和物理信息的视频语料库上进行专门的SFT,有助于模型推断出更精确且物理上合理的状态转移。
Wan2.2-5B(基线) 21.2 + 提示增强 26.6 我们的方法(不含仿真数据) 37.7 我们的方法(不含两阶段训练) 39.2 我们的方法(完整) 41.2
4.4 物理语言分析
物理语言的可迁移性 我们研究了物理语言是否将状态转移与视觉外观解耦。给定一个源视频,我们使用物理语言分词器编码其状态转移,编辑首帧以指定不同的目标外观,并在编辑后的帧条件下解码未改变的物理语言序列。如图5所示,迁移后的视频在视觉外观和背景发生变化的情况下,仍保留了转移模式,包括倾倒、粘性扩散和液体流动。这些结果表明,物理语言捕获了可跨视觉外观迁移的可复用转移信息。
物理语言的语义结构 我们在两个具有明确定义运动学模式的领域——自动驾驶和机器人操作——中分析了物理语言的语义结构。我们使用针对相应领域适配的物理语言分词器,并选择了四个类别,每个类别300个样本。对于自动驾驶,我们从nuScenes (Caesar et al., 2020)中选取了左转、右转、直行和静止片段。对于机器人操作,我们从AGI-Bot RealRobot (Bu et al., 2025a)中选取了四种夹爪转移模式:向下移动同时闭合、向上移动同时闭合、向下移动同时张开以及横扫。我们将转移特征聚合为片段级表示,使用PCA降至20维,并
第 10 页
预印本
“深色阳光照耀的海浪拍打着深色潮湿的岩石。” “一股棕色咖啡流入玻璃杯。”
“两片甜椒落入热油中。” “一个铁罐爆炸并燃起火焰。” (a) 物理逼真的视频世界模型
(b) 轨迹条件驾驶世界模型
(c) 动作条件机器人世界模型
(d) 交互式世界模型 图7: PHIZERO作为一个物理逼真、可控且可交互的视频世界模型。 PHIZERO生成物理上连贯的世界演化,遵循细粒度的动作条件,并支持在序列控制下的交互式推演。
通过PCA,并进一步使用UMAP(McInnes et al., 2018)将它们投影到3D空间。如图6所示,学习到的表征展现出清晰的运动学组织结构。在自动驾驶中,静止片段形成一个独特的簇,而不同的转向模式则沿着一个连续的流形排列。在机器人操作中,四种夹爪过渡模式形成了紧凑且基本分离的簇。这些结果表明,物理语言捕捉了有意义的状态转移语义,并根据世界如何变化而非其视觉内容来组织视频。
4.5 更广泛的应用
我们进一步展示了PHIZERO更广泛的应用潜力。通过显式地表征物理世界如何演化,物理语言提供了一个外观解耦的接口,用于表征、控制和跨视觉外观及领域转移状态转移。该接口支持物理逼真的视频生成、细粒度动作条件世界建模、交互式推演,以及跨具身形态和视觉领域的零样本迁移。
物理逼真的视频世界模型 PHIZERO可以作为一个通用的视频世界模型,从当前视觉状态预测物理上连贯的未来演化。如图7(a)所示,它建模了多样的真实世界动态,包括海浪拍打岩石、液体倒入容器、物体落入热油并产生飞溅,以及金属罐爆炸成火焰和碎片。这些示例既捕捉了复杂事件的完整时序演化,也捕捉了其细粒度的后果,展示了PHIZERO以强物理连贯性建模开放领域世界动态的能力。
可控且可交互的世界模型 现有的动作条件世界模型通常将控制信号直接映射到未来视频,这使得对状态演化的精确控制变得困难。相比之下,PHIZERO将状态转移推理与像素合成分离:给定一个轨迹或动作信号,物理语言推理器首先预测相应的物理语言,然后将其解码为未来视频。我们在nuScenes(Caesar et al., 2020)和AGI-Bot RealRobot(Bu et al., 2025a)上验证了这一能力。如图7(b)和(c)所示,PHIZERO捕捉了驾驶轨迹中的细粒度变化,例如不同的转向幅度,并精确地遵循动作信号以生成准确的夹爪运动。它还支持在序列控制输入下的交互式世界建模。如图7(d)所示,模型根据连续的控制更新相机视角和位置,同时保持时序一致性。这些结果展示了PHIZERO在细粒度、可控和交互式世界建模方面的潜力。可控和交互式世界模型的额外训练和推理细节在附录C.1中提供。
10
第 11 页
预印本
编辑 编辑
(a) 人体到人形机器人迁移
编辑 编辑
(b) 人手到灵巧手迁移
编辑 编辑
(c) 仿真到真实迁移 图8:基于物理语言的零样本跨具身与仿真到真实迁移。我们将源状态转移编码为物理语言序列,并在指定新具身或视觉域的编辑后首帧条件下进行渲染,从而实现零样本跨具身与仿真到真实迁移。
零样本跨具身与仿真到真实迁移 由于物理语言将状态转移与视觉外观解耦,PHIZERO支持跨具身和视觉域的零样本迁移。如图8(a)和(b)所示,我们将人体运动视频的状态转移编码为物理语言,通过将人体替换为UniTree G1人形机器人或将人手替换为Sharpa灵巧手来编辑其首帧,并在编辑后的首帧条件下解码未改变的物理语言序列。这无需目标特定训练即可将全身和手部运动模式迁移到显著不同的具身上。相同的框架也支持仿真到真实迁移。如图8(c)所示,我们将LIBERO (Liu et al., 2023a)视频的首帧转换为逼真的视觉域,并在新外观下渲染原始的仿真状态转移。这些结果表明,物理语言提供了一个跨具身和视觉域的可迁移接口,具有演示重定向、跨形态迁移以及从仿真中低成本生成逼真交互数据的潜力。零样本跨具身与仿真到真实迁移的额外适配与推理细节见附录C.2。
5 结论
我们提出了PHIZERO,一个围绕物理语言构建的物理世界模型。与直接在像素空间中预测未来视频的传统视频模型不同,PHIZERO通过自监督学习从无标签的野外视频中学习物理语言:一种状态转移模式的紧凑离散表示。基于这一表示,PHIZERO遵循先推理后渲染的范式:它首先在物理语言空间中预测未来的世界演化,然后将推断出的转移渲染为视频。在生成和理解基准上的大量实验表明,PHIZERO能够生成物理上连贯的结果,并识别物理上不合理的事件。物理语言进一步为细粒度的动作条件仿真、交互式推演以及跨具身和视觉域的零样本运动迁移提供了接口。这些结果凸显了物理语言在可扩展、可控和可迁移的物理世界建模方面的潜力。我们将在附录E中进一步讨论局限性与未来工作。
11
第 12 页
预印本
A 补充训练细节
A.1 物理语言分词器
我们分两个阶段训练物理语言分词器:大规模预训练和后续的针对性监督微调,并采用联合时空课程学习策略。在预训练阶段,我们汇总了表10所列的数据集。经过去重后,我们过滤掉存在技术缺陷的片段,包括压缩伪影、损坏帧和水印,以及那些不满足分辨率或时长要求或包含突变镜头转场的片段。此过程为分词器预训练产生了约1万小时的无标注真实世界视频。
表10:物理语言分词器预训练数据。我们报告了数据过滤后每个来源语料库的时长。混合数据包含约1万小时的无标注视频。
数据集 时长(小时)
内部数据 3329 HOIGen-1M (Liu et al., 2025b) 2200 OpenVid-1M (Nan et al., 2025) 2051 Moments in Time (Monfort et al., 2019) 844 Kinetics-710 (Li et al., 2022) 840 Sekai-walking (Li et al., 2026b) 288 SSV2 (Goyal et al., 2017) 245 UltraVideo (Xue et al., 2025) 142 WISA-80K (Wang et al., 2026b) 141
总计 10K
在前三个预训练阶段,我们将输入和重建分辨率均保持在256 × 448,并逐步将片段时长从1秒(9帧)增加到2秒(17帧),最终达到4秒(33帧)。在第四个预训练阶段,分词器继续接收256 × 448的输入,而扩散解码器则重建512 × 896的目标。这种跨分辨率重建促使紧凑的物理语言瓶颈专注于状态转换,同时允许扩散解码器依赖其生成先验来恢复高频外观细节。
对于分词器的监督微调,我们基于美学质量、运动幅度和VLM评估的状态转换可观测性,对真实世界语料库应用了更严格的二次过滤流程。在过滤掉渲染质量低、时长无效或物体运动不足的样本后,我们进一步纳入了仿真视频。最终得到的语料库包含约500万个4秒片段,汇总于表11。我们首先在此精选语料库上微调整个模型。在最后的优化阶段,我们冻结时空编码器、过渡级Q-Former和FSQ量化器,仅优化扩散解码器。我们还额外应用了熵正则化损失(Yu et al., 2023)以鼓励FSQ词汇表的均衡利用,以及REPA损失(Yu et al., 2024a)以提高扩散表示的语义质量。所有训练阶段均使用128块NVIDIA A100 GPU。表12总结了完整的训练计划。
A.2 物理语言推理器
我们分两个阶段训练物理语言推理器。在第一阶段,我们对用于物理语言分词器监督微调的相同500万个4秒片段进行持续预训练。对于每个片段,第一帧和一个由VLM生成的高层动作描述作为输入,而冻结的物理语言分词器将完整视频编码为目标物理语言序列。在第二阶段,我们在约100万个片段的语料库上进行运动聚焦的监督微调,该语料库包含使用基于VLM的运动质量和物理交互过滤器从500万片段语料库中选出的80万个样本,以及20万个额外的仿真器生成样本。此阶段将训练集中在显著且具有物理信息的状态转换上。第一帧以512 × 896的分辨率提供,动作描述使用表14中的提示词生成。两个训练阶段均使用128块NVIDIA A100 GPU,其超参数汇总于表13。
12
第 13 页
预印本
表11:物理语言分词器微调数据。我们区分了真实世界和仿真来源,并报告了每个数据集贡献的四秒片段数量。
数据集 类型 片段数
内部数据 真实 2545K HOIGen-1M (Liu et al., 2025b) 真实 574K Moments in Time (Monfort et al., 2019) 真实 528K OpenVid-1M (Nan et al., 2025) 真实 516K SSV2 (Goyal et al., 2017) 真实 180K Sekai-walking (Li et al., 2026b) 真实 173K Kinetics-710 (Li et al., 2022) 真实 128K UltraVideo (Xue et al., 2025) 真实 82K WISA-80K (Wang et al., 2026b) 真实 44K Physics101 (Wu et al., 2016) 仿真 1K Phyco (Narayanan et al., 2026) 仿真 126K ComPhy (Chen et al., 2022) 仿真 60K Cosmos3 (Agarwal et al., 2026) 仿真 51K CLEVRER (Yi et al., 2019) 仿真 20K Physion++ (Tung et al., 2023) 仿真 10K Physion (Bear et al., 2021) 仿真 9K
总计 – 5M
表12:物理语言分词器训练计划。课程预训练、全模型微调和解码器专属精调的视频与优化设置。 预训练 全模型 仅解码器 配置 阶段1 阶段2 阶段3 阶段4 SFT SFT
帧数 9 17 33 33 33 33 时长 1秒 2秒 4秒 4秒 4秒 4秒 全局批次大小 256 输入分辨率 256 × 448 输出分辨率 256 × 448 256 × 448 256 × 448 512 × 896 512 × 896 512 × 896
训练步数 150K 100K 100K 50K 50K 50K 初始纯噪声步数 50K 20K 20K 0 0 0 预热步数 1K LoRA秩 32 FSQ熵损失权重 0.005 REPA损失权重 0.1 学习率 2 × 10⁻⁵ AdamW betas β₁ = 0.9, β₂ = 0.95 最大梯度范数 1.0
表13:物理语言推理器训练设置。持续预训练使VLM适应物理语言预测,而SFT则使其专注于物理信息丰富的状态转换。
持续 运动聚焦 配置 预训练 SFT
全局批次大小 512 首帧分辨率 512 × 896 训练步数 50K 10K 预热步数 1K 学习率 5 × 10⁻⁵ 1 × 10⁻⁵ AdamW betas β₁ = 0.9, β₂ = 0.95 最大梯度范数 1.0
13
第 14 页
预印本
表14:字幕生成提示词。用于为训练物理语言推理器的四秒视频片段生成文本条件的提示词。
系统提示词
你是一名专业的视频字幕生成专家。你的任务是为视频片段生成一个简洁的高层动作条件,用于训练物理世界模型。
字幕要求:
• 撰写一个简洁流畅的英文句子或段落。 • 字数控制在25到60词之间。 • 使用现在时态,仅描述可见内容。 • 在可观察时,涵盖主要主体、动作、场景、摄像机/取景、光照、色彩和视觉风格。
关键规则:
• 优先保证空间精度。 • 聚焦于高层的起始动作或交互意图,而非叙述完整的时间演变。避免细粒度的中间运动、状态变化和次要物理效应。
用户提示词
请仔细观看此视频,并严格遵循你的指令生成字幕。
B 附加评估细节
B.1 物理视频生成评估
我们在三个物理视频生成基准上评估PHIZERO。对于所有基准,模型将提供的第一帧和文本条件作为输入,我们遵循官方的评估协议和发布的评估器。
Physics-IQ Verified Physics-IQ Verified(Rädsch等人,2026)评估生成的视频是否再现了66个受控真实世界物理实验的结果。生成的视频与真实参考视频通过空间交并比(S-IoU)、时空交并比(ST-IoU)和加权空间交并比(WS-IoU)进行比较,这些指标分别评估场景变化的位置、时间和时间频率。IQ-Score在通过重复真实实验之间的变化进行归一化后,汇总这些指标。
PhyGround PhyGround(Lin等人,2026)包含250个精心策划的图像-文本条件,涵盖固体力学、流体动力学和光学中的13条物理定律。我们遵循官方协议,使用发布的PhyJudge-9B评估器,并以4 FPS对生成的视频进行采样。每个视频根据特定标准的评分细则从1到5进行评分。通用质量评估提示对齐度、时间有效性和物体一致性,而物理分数衡量对每个样本适用的物理定律的遵循程度。总分是通用质量和物理分数的平均值。
WorldModelBench WorldModelBench(Li等人,2026a)使用来自七个领域和56个子领域的350个图像-文本条件评估通用世界建模能力,这些领域包括自动驾驶、机器人、人类活动、工业场景、游戏、动画和自然环境。我们遵循官方协议,使用发布的2B-VLM评判模型。物理遵循度评估五项物理一致性标准,范围从0到5,而常识评估空间和时间视觉质量,范围从0到2。总分通过将基准测试评估的所有指标相加获得。
14
第 15 页
预印本
B.2 物理视频理解评估
IntPhys2 IntPhys2 (Bordes et al., 2025) 通过匹配的可能与不可能视频来评估直观物理,涉及物体恒存性、不变性、时空连续性和固体性。其主集合包含1,012个视频,组织为253个四元组,每个场景有两个可能结果和两个不可能结果。我们比较每个匹配的可能-不可能对的物理语言似然,并报告可能视频获得更高似然的对所占百分比。结果分别在简单、中等和困难子集上报告,以及整个主集合上的总体准确率。
LikePhys LikePhys (Yuan et al., 2025) 包含来自12个场景的受控有效-无效视频对。每个比较中的视频在视觉外观上匹配,主要区别在于是否满足相关的物理原理。遵循其似然偏好协议,合理性偏好误差(PPE)是无效视频获得等于或高于有效视频似然的比较所占百分比;因此,值越低表示物理理解越强。我们报告刚体力学、流体力学和光学效应的PPE,以及所有12个场景的平均误差。
YoCausal YoCausal (Xie et al., 2026) 包含1,232个真实世界视频对。每个自然正向视频与其时间反转的对应视频配对,并且两个方向使用相同的描述。反转惊奇指数(RSI)是四个源数据集上的平均正向视频偏好率,当自然视频获得更高的物理语言似然时,即发生正向偏好;50%对应于随机水平。该基准进一步使用VLM标注将视频划分为因果和非因果子集,并定义因果认知指数为 CCI = RSI(Dc) − RSI(Dnc)。综合排名结合了模型在RSI和CCI上的排名,排名越低表示整体性能越好。
评估协议 所有三个基准都通过在共享文本条件下进行成对似然比较来评估。遵循官方评估协议,对于LikePhys,我们使用为每个场景提供的官方提示模板,该模板由该场景的所有有效和无效变体共享;对于YoCausal,我们使用基准提供的提示,用于正向视频及其时间反转的对应视频。IntPhys2不提供实例级文本描述。因此,我们使用VLM为每个视频四元组生成一个场景级描述。VLM仅观察四个视频的第一帧,无法访问未来帧或有效性标签,并被指示仅描述它们共享的可见场景和初始配置。我们还将生成的描述原样应用于四元组中的所有四个视频。形式上,令 (V+, V−) 表示一个匹配对,cpair 为其共享文本条件。对于每个视频,我们使用其自身的第一帧 I0± 和相同的文本条件 cpair,将其编码为物理语言序列 z± = Tϕ(V±),并计算 XN s(V±, cpair) = log pθ z±j | I0±, cpair, z±<j 。 (7) j=1 因此,每个比较中的两个似然仅在评估的视频及其对应的第一帧上有所不同,而文本条件保持相同。具有更高序列似然的视频被选为物理上有效或时间上自然的一个。
C 更广泛应用的训练与推理细节
C.1 可控与交互式世界模型
机器人世界模型 对于机器人操作,我们在AGI-Bot RealRobot数据集 (Bu et al., 2025a) 上适配PHIZERO。我们首先在RealRobot视频上微调物理语言分词器,以便学习到的物理语言捕捉特定领域的机器人手臂和夹爪过渡。对于每个四秒片段,所有机器人手臂关节和夹爪姿态的对应轨迹以8 FPS采样。在每个时间步,这些值按固定顺序排列并序列化为数值文本,并用作物理语言推理器微调的动作条件。在推理时,期望的关节和夹爪轨迹被转换为相同的文本格式,并与当前观察一起提供。推理器将此动作序列翻译
第 16 页
预印本
转化为物理语言,领域适配的解码器则将生成的机器人交互渲染为未来视频。
驾驶世界模型 我们遵循相同流程,在nuScenes(Caesar et al., 2020)上构建轨迹条件化的驾驶世界模型。首先,我们在nuScenes视频上微调物理语言分词器,使其表征和解码器适应驾驶场景的演化。未来四秒的自车轨迹以8 FPS采样,并序列化为按时间排序的数值文本序列。随后,第一帧和文本化的自车轨迹被用于微调物理语言推理器,而从对应未来视频中提取的物理语言序列则作为预测目标。在推理时,候选自车轨迹被转换为相同的数值文本格式。推理器预测在该轨迹下场景应如何在物理语言空间中演化,之后解码器渲染出相应的未来驾驶视频。这种设计使模型能够遵循细粒度的轨迹变化,包括不同的转向方向和幅度,而无需修改通用的先推理后渲染架构。
交互世界模型 对于交互世界建模,控制输入直接以自然语言指令的形式表达,描述相机视角或相机位置的期望变化。由于当前模型生成四秒片段,我们使用滑动窗口自回归推演来扩展生成,突破这一固定时长限制。从当前帧开始,模型预测下一个四秒视频片段,生成片段的最后一帧随后被用作下一个窗口的第一帧条件。重复此过程可生成更长的视频,并允许通过连续的自然语言控制逐步修改相机轨迹。
C.2 运动迁移
迁移协议 我们的运动迁移流程不需要配对视频。相反,我们短暂地在每个源域的视频上微调物理语言分词器,使其能够更准确地将相应的运动模式编码为物理语言。经过这种源域适配后,运动迁移可以直接进行,无需进一步训练。给定一个源视频,我们首先将其状态转移编码为物理语言序列。然后,我们使用GPT-Image 2.0编辑第一帧,将原始主体或视觉外观替换为期望的目标具身形态或目标域。随后,未改变的物理语言序列在编辑后的第一帧条件下被解码。通过这种方式,第一帧指定了目标场景应有的外观,而物理语言则指定了它应如何随时间演化。
人体运动迁移 对于人体运动迁移,我们构建了一个包含多样且显著全身人体运动的子集。源视频收集自(Chen et al., 2026c; Allshire et al., 2025)。我们在此子集上短暂微调物理语言分词器,使其适应人体运动。在推理时,源人体运动视频被编码为物理语言,同时其第一帧被编辑,将人体主体替换为目标人形机器人。从编辑后的第一帧解码原始物理语言序列,即可将全身运动迁移到人形机器人具身形态上,无需配对的人-机器人训练数据。
人手运动迁移 对于人手到灵巧手的迁移,我们构建了一个人手视频子集,包含来自(Lim et al., 2026)的丰富手部运动和物体交互。尽管该数据集提供了配对的人和机器人数据,我们仅使用人手视频进行分词器适配,不使用提供的配对或跨具身对应关系。在推理时,我们编辑第一帧,将人手替换为目标灵巧手,并在此编辑后的外观条件下解码源物理语言序列。这实现了细粒度手部运动和交互模式的迁移,无需配对监督。
仿真到真实迁移 对于仿真到真实迁移,我们短暂地在来自LIBERO(Liu et al., 2023a)的仿真交互视频上微调物理语言分词器。适配过程中不使用任何配对的真实世界视频。给定一个仿真源视频,我们将其状态转移编码为物理语言,并使用GPT-Image 2.0将第一帧转换为逼真的视觉外观。
16
第 17 页
预印本
随后,我们在编辑后的真实帧条件下解码未改变的物理语言序列,生成外观逼真的视频,同时保留仿真中展示的交互过程。
D 补充相关工作
D.1 潜在动作世界模型
潜在动作模型通常通过逆动力学瓶颈结合前向预测器,从观测序列中推断紧凑的过渡变量。早期方法从相邻观测中学习离散潜在动作,并将其用于预训练可控世界模型或下游策略(Cui & Gao, 2023; Schmidt & Jiang, 2024; Bruce et al., 2024; Ye et al., 2025; Gao et al., 2025)。近期工作沿多个互补方向扩展了这一范式。Garrido et al. (2026) 将潜在动作世界模型扩展到异构的开放域视频,并研究了约束连续表示。Jiang et al. (2026b) 通过控制效果对齐来对齐跨视觉上下文的潜在动作语义,而 Wang et al. (2026c) 则将场景动态分解为面向多实体环境的因子化潜在动作。Zhang et al. (2026a) 明确地将动态相关结构与视觉内容解耦。其他方法则将潜在动作与混合数据控制或统一建模相连接:Alles et al. (2025) 为离线强化学习对齐无动作和动作条件轨迹,Wang et al. (2025a) 联合演化潜在动作推断和预训练视频世界模型,Bi et al. (2025) 在统一架构中整合了理解、视频生成和动作预测。Chen et al. (2026a) 引入了一种统一的物理语言,通过视觉锚定的交叉重建来对齐人类和人形机器人的动作,用于策略学习和世界建模。尽管取得了这些进展,潜在动作世界模型主要面向控制而开发,通常针对特定形态和任务或相对受限的环境。相比之下,PHIZERO 利用这种过渡建模范式来表示物理世界本身的开放域演化,从多样化的开放域视频中学习物理语言,并对其进行显式推理,以用于未来视频生成和状态过渡理解。
D.2 视频分词器
视频分词器通过利用空间和时间冗余将视频压缩为紧凑表示。一个主要的工作方向是将持久的视觉内容与时间变化分离。Sun et al. (2023) 将视频分解为场景、物体和运动标记,而 Jin et al. (2024) 则交错使用关键帧和运动标记。Yu et al. (2024b); Tian et al. (2025); Wang et al. (2025b); Liu et al. (2025a) 通过内容帧、参考图像或分层潜在变量对视频进行因子分解,Wang et al. (2026a); Chen et al. (2026b) 进一步用关键帧或时不变标记总结共享外观,同时紧凑地编码时间残差。近期工作越来越多地采用基于扩散的解码器,使得紧凑表示可以省略可由生成先验恢复的精细视觉细节。Ge et al. (2025); Li et al. (2024) 在压缩的时空特征上条件化预训练视频扩散模型,而 Yang et al. (2025a) 则使用条件因果扩散解码器重建视频。Atanov et al. (2026) 使用生成流解码器学习可变长度的由粗到精标记,Teng et al. (2026) 将基于查询的1D潜在变量与像素空间扩散解码器结合以实现自适应压缩。与此密切相关的是,Ressler-Antal et al. (2025) 通过视频重建学习外观解耦的运动表示,用于开放世界运动迁移和运动理解。我们的物理语言分词器同样采用了生成式解码器,但学习到的物理语言并不仅仅用于视频重建。它还作为一个显式的预测目标,模型通过它来推理未来的世界演化,然后再将推断出的过渡渲染为视频。
D.3 物理逼真的视频生成
现有提升视频生成物理一致性的方法大致遵循三个方向。第一个方向是引入源自物理模拟器的显式约束。例如,Montanaro et al. (2024) 使用模拟器导出的光流,Liu et al. (2024) 执行刚体模拟,Foo et al. (2026) 集成了3D物理模拟器。第二个方向是从外部模型或仿真数据中迁移物理先验,通常通过表示对齐实现(Zhang et al., 2026b; Bhowmik et al., 2025; Kim et al., 2026)。沿此工作方向,Xiong et al. (2026) 引入了从仿真中获得的3D几何线索,而 Jiang et al. (2026a) 则学习了一个运动先验
17
第 18 页
预印本
来自VAE潜变量。第三种方法在视频生成中引入显式的物理知识或中间推理。Wang等人(2026b);Zhang等人(2025)在训练期间注入物理知识,而Yang等人(2025b)则使用VLM在生成前推理物体轨迹。相比之下,PHIZERO不依赖模拟器衍生的约束、预定义的物理变量或显式的物理规则作为监督信号。相反,它通过自监督从大规模无标签视频中学习物理语言,抽象出状态转换的模式。
E 局限性与未来工作
局限性 尽管取得了令人鼓舞的结果,但仍存在若干局限性。首先,物理语言目前是作为状态转换的经验表示来学习的,而非符号化物理定律的显式表述。这种数据驱动的表述方式能够从多样化的无标签视频中进行可扩展学习,但由此产生的离散符号尚未直接建立在可解释的物理变量或形式化定律之上。其次,由于物理语言主要从观测视频中学习,其覆盖范围受限于训练数据中视觉可观察到的内容。视觉上模糊或视觉难以触及的世界转换,例如触觉交互和微观粒子动力学,可能因此更难建模。最后,受限于数据和计算资源,我们当前的实现使用了相对较小规模的模型,且训练语料库相对于物理世界的多样性仍然有限。尽管如此,在此规模下取得的强劲性能表明,更大的模型和更多样化的训练数据可以进一步提升基于物理语言的世界建模能力。
未来工作 未来的工作可以从几个方向扩展物理语言。首先,在视频生成之外,物理语言可以作为一种显式的中间表示,用于提升VLM中的时空理解能力,并支持具身策略中更有效的规划。其次,其跨外观和跨具身形态的可迁移性,为缓解真实机器人交互数据的稀缺性开辟了一条有前景的途径。特别是,从大规模人类视频中学习到的状态转换模式,有可能迁移到机器人具身形态上,使具身系统能够利用丰富的人类数据,而仅需有限的机器人特定监督。第三,我们计划通过分层或循环预测,将物理语言建模扩展到当前固定时长片段之外,从而实现长时域世界建模,同时保持时序一致性并忠实地跟踪不断变化的场景状态。最后,我们将通过更强的骨干网络、更多的计算资源以及更大、更多样化的训练语料库,进一步扩展PHIZERO,以提升基于物理语言的世界建模性能。
18
第 19 页
预印本
参考文献
Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, 等. Gpt-4 技术报告. arXiv 预印本 arXiv:2303.08774, 2023.
Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, 等. 面向物理 AI 的 Cosmos 世界基础模型平台. arXiv 预印本 arXiv:2501.03575, 2025.
Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, 等. Cosmos 3:面向物理 AI 的全模态世界模型. arXiv 预印本 arXiv:2606.02800, 2026.
Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, 等. 基于视频基础模型的物理 AI 世界仿真. arXiv 预印本 arXiv:2511.00062, 2025.
Marvin Alles, Xingyuan Zhang, Patrick van der Smagt, 和 Philip Becker-Ehmck. 基于无标签轨迹的潜在动作世界模型控制. arXiv 预印本 arXiv:2512.10016, 2025.
Arthur Allshire, Hongsuk Choi, Junyi Zhang, David McAllister, Anthony Zhang, Chung Min Kim, Trevor Darrell, Pieter Abbeel, Jitendra Malik, 和 Angjoo Kanazawa. 视觉模仿实现情境化人形机器人控制. arXiv 预印本 arXiv:2505.03729, 2025.
Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, 等. V-jepa 2:自监督视频模型赋能理解、预测与规划. arXiv 预印本 arXiv:2506.09985, 2025.
Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, 和 Amir Zamir. Videoflextok:灵活长度的由粗到细视频分词. 收录于第四十三届国际机器学习大会, 2026.
Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, 等. Qwen3-vl 技术报告. arXiv 预印本 arXiv:2511.21631, 2025a.
Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, 和 Junyang Lin. Qwen2.5-vl 技术报告. arXiv 预印本 arXiv:2502.13923, 2025b.
Adrien Bardes, Quentin Garrido, Jean Ponce, Xinlei Chen, Michael Rabbat, Yann LeCun, Mido Assran, 和 Nicolas Ballas. V-jepa:面向视觉表征学习的潜在视频预测. 见 URL https://openreview.net/forum, 2024.
Daniel M Bear, Elias Wang, Damian Mrowca, Felix J Binder, Hsiao-Yu Fish Tung, RT Pramod, Cameron Holdaway, Sirui Tao, Kevin Smith, Fan-Yun Sun, 等. Physion:评估人类与机器的视觉物理预测能力. arXiv 预印本 arXiv:2106.08261, 2021.
Aritra Bhowmik, Denis Korzhenkov, Cees GM Snoek, Amirhossein Habibian, 和 Mohsen Ghafoorian. Moalign:面向视频扩散模型的运动中心表征对齐. arXiv 预印本 arXiv:2510.19022, 2025.
Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, 等. Motus:一个统一的潜在动作世界模型. arXiv 预印本 arXiv:2512.13030, 2025.
Florian Bordes, Quentin Garrido, Justine T Kao, Adina Williams, Michael Rabbat, 和 Emmanuel Dupoux. Intphys 2:在复杂合成环境中评估直觉物理理解. arXiv 预印本 arXiv:2506.09849, 2025.
19
第 20 页
预印本
Jake Bruce, Michael D Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, 等. Genie: 生成式交互环境. 收录于 *第四十一届国际机器学习大会*, 2024.
Qingwen Bu, Jisong Cai, Li Chen, Xiuqi Cui, Yan Ding, Siyuan Feng, Shenyuan Gao, Xindong He, Xuan Hu, Xu Huang, 等. Agibot world colosseo: 一个面向可扩展智能具身系统的大规模操作平台. arXiv 预印本 arXiv:2503.06669, 2025a.
Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, 和 Hongyang Li. Univla: 学习以任务为中心的潜在动作实现任意场景行动. arXiv 预印本 arXiv:2505.06111, 2025b.
Holger Caesar, Varun Bankiti, Alex H Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, 和 Oscar Beijbom. nuscenes: 一个面向自动驾驶的多模态数据集. 收录于 *IEEE/CVF 计算机视觉与模式识别会议论文集*, 页码 11621–11631, 2020.
Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, 和 Yixiao Ge. Unit: 迈向统一的人形机器人策略学习与世界建模物理语言. arXiv 预印本 arXiv:2604.19734, 2026a.
Weiliang Chen, Yuanhui Huang, Xuebo Wang, 和 Yueqi Duan. Tivtok: 广播时不变令牌以实现可扩展视频分词. arXiv 预印本 arXiv:2606.17590, 2026b.
Yi Chen, Yuying Ge, Weiliang Tang, Yizhuo Li, Yixiao Ge, Mingyu Ding, Ying Shan, 和 Xihui Liu. Moto: 以潜在运动令牌作为桥接语言从视频中学习机器人操作. 收录于 *IEEE/CVF 国际计算机视觉大会论文集*, 页码 19752–19763, 2025.
Zhenfang Chen, Kexin Yi, Yunzhu Li, Mingyu Ding, Antonio Torralba, Joshua B Tenenbaum, 和 Chuang Gan. Comphy: 从视频中对物体和事件进行组合物理推理. arXiv 预印本 arXiv:2205.01089, 2022.
Zhenyang Chen, Chuizheng Kong, Chuye Zhang, Yuanshao Yang, Lawrence Y Zhu, Shreyas Kousik, 和 Danfei Xu. Warp: 从离线人类演示中学习全身动作重定向. arXiv 预印本 arXiv:2606.29940, 2026c.
Hanchen Cui 和 Yang Gao. 从大规模多样化视频中学习的通用世界模型. 收录于 *NeurIPS 2023 决策基础模型研讨会*, 2023.
Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, 和 Christian Theobalt. 物理模拟器在环视频生成. 收录于 *IEEE/CVF 计算机视觉与模式识别会议论文集*, 页码 4301–4311, 2026.
Shenyuan Gao, Siyuan Zhou, Yilun Du, Jun Zhang, 和 Chuang Gan. Adaworld: 学习具有潜在动作的自适应世界模型. arXiv 预印本 arXiv:2503.18938, 2025.
Quentin Garrido, Tushar Nagarajan, Basile Terver, Nicolas Ballas, Yann LeCun, 和 Michael Rabbat. 在自然场景中学习潜在动作世界模型. arXiv 预印本 arXiv:2601.05230, 2026.
Yuying Ge, Yizhuo Li, Yixiao Ge, 和 Ying Shan. Divot: 扩散模型赋能视频分词器以实现理解与生成. 收录于 *IEEE/CVF 计算机视觉与模式识别会议论文集*, 页码 13606–13617, 2025.
Gemini Team. Gemini: 一个高性能多模态模型家族. arXiv 预印本 arXiv:2312.11805, 2023. URL https://arxiv.org/abs/2312.11805.
Genmo AI. Genmo AI 博客. https://www.genmo.ai/blog, 2025. 访问日期: 2026年4月29日.
Google DeepMind. Veo 3.1. https://deepmind.google/models/veo/, 2026. 访问日期: 2026年4月29日.
20
第 21 页
预印本
Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, 等. 用于学习和评估视觉常识的"something something"视频数据库. 收录于《IEEE国际计算机视觉会议论文集》,第5842–5850页,2017年.
Jinwei Gu. 面向物理AI的Cosmos世界基础模型. 收录于《第三届生成式AI富媒体国际研讨会论文集》,第39–39页,2025年.
Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, 和 Bo Dai. Animatediff: 无需特定调优即可为个性化文本到图像扩散模型制作动画. arXiv预印本 arXiv:2307.04725, 2023年.
Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, 等. Ltx-2: 高效的联合音视频基础模型. arXiv预印本 arXiv:2601.03233, 2026年.
Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Liang Wang, Weizhu Chen, 等. Lora: 大语言模型的低秩适应. Iclr, 1(2):3, 2022年.
Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, 和 Wei Zhan. Lamo: 用于视频生成中物理真实感的自监督潜在运动先验. arXiv预印本 arXiv:2605.23878, 2026a年.
Yuxin Jiang, Yuchao Gu, Ivor W Tsang, 和 Mike Zheng Shou. Olaf-world: 为视频世界建模定向潜在动作. arXiv预印本 arXiv:2602.10104, 2026b年.
Yang Jin, Zhicheng Sun, Kun Xu, Liwei Chen, Hao Jiang, Quzhe Huang, Chengru Song, Yuliang Liu, Di Zhang, Yang Song, 等. Video-lavit: 使用解耦的视觉-运动分词实现统一的视频-语言预训练. arXiv预印本 arXiv:2402.03161, 2024年.
Manjin Kim, Suha Kwak, 和 Minsu Cho. 用于物理合理视频生成的调温自相似性对齐. 收录于《IEEE/CVF计算机视觉与模式识别会议论文集》,第5148–5158页,2026年.
Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等. Hunyuanvideo: 大型视频生成模型的系统框架. arXiv预印本 arXiv:2412.03603, 2024年.
Dacheng Li, Yunhao Fang, Yukang Chen, Shuo Yang, Shiyi Cao, Justin Wong, Michael Luo, Xiaolong Wang, Hongxu Yin, Joseph Gonzalez, 等. Worldmodelbench: 将视频生成模型作为世界模型进行评判. 《神经信息处理系统进展》,38卷,2026a年.
Junnan Li, Dongxu Li, Silvio Savarese, 和 Steven Hoi. Blip-2: 使用冻结图像编码器和大语言模型引导语言-图像预训练. 收录于《国际机器学习会议论文集》,第19730–19742页. PMLR, 2023年.
Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Limin Wang, 和 Yu Qiao. Uniformerv2: 通过为图像ViT配备视频UniFormer实现时空学习. arXiv预印本 arXiv:2211.09552, 2022年.
Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, 和 Ping Luo. Dicode: 用于语言模型自回归视频生成的扩散压缩深度令牌. arXiv预印本 arXiv:2412.04446, 2024年.
Zhen Li, Chuanhao Li, Xiaofeng Mao, Shaoheng Lin, Ming Li, Shitian Zhao, Zhaopan Xu, Xinyue Li, Yukang Feng, Jianwen Sun, 等. Sekai: 面向世界探索的视频数据集. 《神经信息处理系统进展》,38卷,2026b年.
Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, 和 Hanbyul Joo. Hrdexdb: 用于跨具身灵巧抓取的配对人与机器人数据集. arXiv预印本 arXiv:2604.14944, 2026年.
21
第 22 页
预印本
Bin Lin, Yunyang Ge, Xinhua Cheng, Zongjian Li, Bin Zhu, Shaodong Wang, Xianyi He, Yang Ye, Shenghai Yuan, Liuhan Chen, 等. Open-sora plan: Open-source large video generation model. arXiv preprint arXiv:2412.00131, 2024.
Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y Lu, Enfu Nan, Hokin Deng, 等. Phyground: Benchmarking physical reasoning in generative world models. arXiv preprint arXiv:2605.10806, 2026.
Bo Liu, Yifeng Zhu, Chongkai Gao, Yihao Feng, Qiang Liu, Yuke Zhu, 和 Peter Stone. Libero: Benchmarking knowledge transfer for lifelong robot learning. Advances in Neural Information Processing Systems, 36:44776–44791, 2023a.
Huaize Liu, Wenzhang Sun, Qiyuan Zhang, Donglin Di, Biao Gong, Hao Li, Chen Wei, 和 Changqing Zou. Hi-vae: Efficient video autoencoding with global and detailed motion. arXiv preprint arXiv:2506.07136, 2025a.
Kun Liu, Qi Liu, Xinchen Liu, Jie Li, Yongdong Zhang, Jiebo Luo, Xiaodong He, 和 Wu Liu. Hoigen-1m: A large-scale dataset for human-object interaction video generation. 见 Proceedings of the Computer Vision and Pattern Recognition Conference, 页码 24001–24010, 2025b.
Shaowei Liu, Zhongzheng Ren, Saurabh Gupta, 和 Shenlong Wang. Physgen: Rigid-body physics-grounded image-to-video generation. 见 European Conference on Computer Vision, 页码 360–378. Springer, 2024.
Xingchao Liu, Chengyue Gong, 和 Qiang Liu. Flow straight and fast: Learning to generate and transfer data with rectified flow. 见 International conference on learning representations (ICLR), 2023b.
Luma AI. Luma Dream Machine: AI video generator. https://dream-machine.lumalabs.ai/, 2024. 访问日期: 2026年4月29日.
Leland McInnes, John Healy, 和 James Melville. Umap: Uniform manifold approximation and projection for dimension reduction. arXiv preprint arXiv:1802.03426, 2018.
Fabian Mentzer, David Minnen, Eirikur Agustsson, 和 Michael Tschannen. Finite scalar quantization: Vq-vae made simple. 见 International Conference on Learning Representations, 卷 2024, 页码 51772–51783, 2024.
Mathew Monfort, Alex Andonian, Bolei Zhou, Kandan Ramakrishnan, Sarah Adel Bargal, Tom Yan, Lisa Brown, Quanfu Fan, Dan Gutfreund, Carl Vondrick, 等. Moments in time dataset: one million videos for event understanding. IEEE transactions on pattern analysis and machine intelligence, 42(2):502–508, 2019.
Antonio Montanaro, Luca Savant Aira, Emanuele Aiello, Diego Valsesia, 和 Enrico Magli. Motioncraft: Physics-based zero-shot video generation. Advances in Neural Information Processing Systems, 37:123155–123181, 2024.
Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang, Zhijie Chen, Xiang Li, Jian Yang, 和 Ying Tai. Openvid-1m: A large-scale high-quality dataset for text-to-video generation. 见 International Conference on Learning Representations, 卷 2025, 页码 1045–1064, 2025.
Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, 和 Manmohan Chandraker. Phyco: Learning controllable physical priors for generative motion. 见 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 页码 41892–41902, 2026.
OpenAI. Sora 2 system card. https://cdn.openai.com/pdf/50d5973c-c4ff-4c2d-986f-c72b5d0ff069/sora_2_system_card.pdf, 2025. 访问日期: 2026年1月21日.
Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, 等. Omniweaving: Towards unified video generation with free-form composition and reasoning. arXiv preprint arXiv:2603.24458, 2026.
22
第 23 页
预印本
Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, and Carsten T Lüth. Physics-iq verified. arXiv preprint arXiv:2606.18943, 2026.
Zhongwei Ren, Yunchao Wei, Xun Guo, Yao Zhao, Bingyi Kang, Jiashi Feng, and Xiaojie Jin. Videoworld: Exploring knowledge learning from unlabeled videos. In *Proceedings of the Computer Vision and Pattern Recognition Conference*, pp. 29029–29039, 2025.
Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, and Xiaojie Jin. Videoworld 2: Learning transferable knowledge from real-world videos. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition*, pp. 40569–40580, 2026.
Thomas Ressler-Antal, Frank Fundel, Malek Ben Alaya, Stefan Andreas Baumann, Felix Krause, Ming Gui, and Björn Ommer. Dismo: Disentangled motion representations for open-world motion transfer. arXiv preprint arXiv:2511.23428, 2025.
Runway ML. Introducing Gen-3 Alpha. https://runwayml.com/research/introducing-gen-3-alpha, 2024. Accessed: April 29, 2026.
Dominik Schmidt and Minqi Jiang. Learning to act without actions. In *International Conference on Learning Representations*, volume 2024, pp. 9379–9395, 2024.
Shuyao Shang, Bing Zhan, Yunfei Yan, Yuqi Wang, Yingyan Li, Yasong An, Xiaoman Wang, Jierui Liu, Lu Hou, Lue Fan, et al. Dynvla: Learning world dynamics for action reasoning in autonomous driving. arXiv preprint arXiv:2603.11041, 2026.
Mingzhen Sun, Weining Wang, Xinxin Zhu, and Jing Liu. Moso: Decomposing motion, scene and object for video prediction. In *Proceedings of the IEEE/CVF conference on computer vision and pattern recognition*, pp. 18727–18737, 2023.
Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, and Xihui Liu. Adaptive 1d video diffusion autoencoder. arXiv preprint arXiv:2602.04220, 2026.
Rui Tian, Qi Dai, Jianmin Bao, Kai Qiu, Yifan Yang, Chong Luo, Zuxuan Wu, and Yu-Gang Jiang. Reducio! generating 1k video within 16 seconds using extremely compressed motion latents. In *Proceedings of the IEEE/CVF International Conference on Computer Vision*, pp. 19237–19247, 2025.
Hsiao-Yu Tung, Mingyu Ding, Zhenfang Chen, Daniel Bear, Chuang Gan, Josh Tenenbaum, Dan Yamins, Judith Fan, and Kevin Smith. Physion++: Evaluating physical scene understanding that requires online inference of different physical properties. *Advances in Neural Information Processing Systems*, 36:67048–67068, 2023.
Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, and Ziyu Liu. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025.
Feng Wang, Yichun Shi, Ceyuan Yang, Qiushan Guo, Jingxiang Sun, Alan Yuille, and Peng Wang. Vtok: A unified video tokenizer with decoupled spatial-temporal latents. arXiv preprint arXiv:2602.04202, 2026a.
Jing Wang, Ao Ma, Ke Cao, Jun Zheng, Jiasong Feng, Zhanjie Zhang, Wanyuan Pang, and Xiaodan Liang. Wisa: World simulator assistant for physics-aware text-to-video generation. *Advances in Neural Information Processing Systems*, 38:5388–5416, 2026b.
Jiuniu Wang, Hangjie Yuan, Dayou Chen, Yingya Zhang, Xiang Wang, and Shiwei Zhang. Modelscope text-to-video technical report. arXiv preprint arXiv:2308.06571, 2023a.
23
第 24 页
预印本
Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan Tong, Yinan He, Yi Wang, Yali Wang, and Yu Qiao. Videomae v2: Scaling video masked autoencoders with dual masking. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 14549–14560, 2023b.
Xiaofeng Wang, Zheng Zhu, Guan Huang, Boyuan Wang, Xinze Chen, and Jiwen Lu. Worlddreamer: Towards general world models for video generation via predicting masked tokens. arXiv preprint arXiv:2401.09985, 2024.
Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, and Jiang Bian. Co-evolving latent action world models. arXiv preprint arXiv:2510.26433, 2025a.
Yuchi Wang, Junliang Guo, Xinyi Xie, Tianyu He, Xu Sun, and Jiang Bian. Vidtwin: Video vae with decoupled structure and dynamics. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 22922–22932, 2025b.
Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, and Peter Stone. Factored latent action world models. arXiv preprint arXiv:2602.16229, 2026c.
Jiajun Wu, Joseph J Lim, Hongyi Zhang, Joshua B Tenenbaum, and William T Freeman. Physics 101: Learning physical object properties from unlabeled videos. In BMVC, volume 2, pp. 7, 2016.
Jialong Wu, Haoyu Ma, Chaoyi Deng, and Mingsheng Long. Pre-training contextualized world mod- els with in-the-wild videos for reinforcement learning. Advances in Neural Information Processing Systems, 36:39719–39743, 2023.
Jialong Wu, Shaofeng Yin, Ningya Feng, Xu He, Dong Li, Jianye Hao, and Mingsheng Long. ivideogpt: Interactive videogpts are scalable world models. Advances in Neural Information Pro- cessing Systems, 37:68082–68119, 2024.
xAI. Grok Imagine API: State-of-the-art video generation across quality, cost, and latency. https: //x.ai/news/grok-imagine-api, 2026. Accessed: April 29, 2026.
Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, et al. Pandora: Towards general world model with natural language actions and video states. arXiv preprint arXiv:2406.09455, 2024.
Jiannan Xiang, Yi Gu, Zihan Liu, Zeyu Feng, Qiyue Gao, Yiyan Hu, Benhao Huang, Guangyi Liu, Yichi Yang, Kun Zhou, et al. Pan: A world model for general, interactable, and long-horizon world simulation. arXiv preprint arXiv:2511.09057, 2025.
You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, and Zhixiang Wang. Yocausal: How far is video generation from world model? a causality perspective. arXiv preprint arXiv:2605.30346, 2026.
Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, and Nathan Jacobs. Physalign: Physics-coherent image-to-video generation through feature and 3d representation alignment. arXiv preprint arXiv:2603.13770, 2026.
Zhucun Xue, Jiangning Zhang, Teng Hu, Haoyang He, Yinan Chen, Yuxuan Cai, Yabiao Wang, Chengjie Wang, Yong Liu, Xiangtai Li, et al. Ultravideo: High-quality uhd video dataset with comprehensive captions. arXiv preprint arXiv:2506.13691, 2025.
Nianzu Yang, Pandeng Li, Liming Zhao, Yang Li, Chen-Wei Xie, Yehui Tang, Xudong Lu, Zhihang Liu, Yun Zheng, Yu Liu, et al. Rethinking video tokenization: A conditioned diffusion-based approach. arXiv preprint arXiv:2503.03708, 2025a.
Sherry Yang, Yilun Du, Kamyar Ghasemipour, Jonathan Tompson, Leslie Kaelbling, Dale Schu- urmans, and Pieter Abbeel. Learning interactive real-world simulators. arXiv preprint arXiv:2310.06114, 2023.
Xindi Yang, Baolu Li, Yiming Zhang, Zhenfei Yin, Lei Bai, Liqian Ma, Zhiyong Wang, Jianfei Cai, Tien-Tsin Wong, Huchuan Lu, et al. Vlipp: Towards physically plausible video generation with vision and language informed physical prior. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 12360–12370, 2025b.
24
第 25 页
预印本
Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等. Cogvideox: 基于专家Transformer的文本到视频扩散模型. 发表于 *International Conference on Learning Representations*, 2025卷, 页码83048–83077, 2025c.
Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Se June Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, 等. 从视频中进行潜在动作预训练. 发表于 *International Conference on Learning Representations*, 2025卷, 页码28213–28239, 2025.
Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, 和 Joshua B Tenenbaum. Clevrer: 用于视频表示和推理的碰撞事件. *arXiv preprint* arXiv:1910.01442, 2019.
Lijun Yu, José Lezama, Nitesh B Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, 等. 语言模型击败扩散——分词器是视觉生成的关键. *arXiv preprint* arXiv:2310.05737, 2023.
Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang, Jinwoo Shin, 和 Saining Xie. 面向生成的表示对齐:训练扩散Transformer比你想象的更简单. *arXiv preprint* arXiv:2410.06940, 2024a.
Sihyun Yu, Weili Nie, De-An Huang, Boyi Li, Jinwoo Shin, 等. 通过内容帧运动潜在分解实现高效视频扩散模型. 发表于 *International Conference on Learning Representations*, 2024卷, 页码9642–9670, 2024b.
Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, 和 Daniele De Martini. Likephys: 通过似然偏好评估视频扩散模型中的直观物理理解. *arXiv preprint* arXiv:2510.11512, 2025.
Ke Zhang, Cihan Xiao, Yiqun Mei, Jiacong Xu, 和 Vishal M Patel. 先思考再扩散:大语言模型引导的物理感知视频生成. *arXiv e-prints*, 页码arXiv–2505, 2025.
Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, 和 Si Wu. Dila: 解耦潜在动作世界模型. *arXiv preprint* arXiv:2605.15725, 2026a.
Xiangdong Zhang, Jiaqi Liao, Shaofeng Zhang, Fanqing Meng, Xiangpeng Wan, Junchi Yan, 和 Yu Cheng. Videorepa: 通过与基础模型的关系对齐学习视频生成中的物理. *Advances in Neural Information Processing Systems*, 38:122647–122676, 2026b.
Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, 和 Jiwen Lu. Astra: 基于自回归去噪的通用交互世界模型. *arXiv preprint* arXiv:2512.08931, 2025.
25