PHIZERO:用离散物理语言让世界模型先推理再渲染

核心洞察:物理语言

现有世界模型直接在像素空间预测未来视频,底层物理规律隐式且常出错。PHIZERO 提出“物理语言”——一种从野生视频中学到的紧凑离散状态过渡表示,将动力学推理与像素合成解耦。它先用 VLM 预测物理语言序列,再用扩散解码器渲染视频。在 Physics-IQ、PhyGround 等多个基准上,物理一致性显著优于直接像素预测的基线,并展示了零样本跨实体运动迁移。需注意,物理语言是经验表示,并非可解释的物理变量,且覆盖范围受限于视觉可观测现象。

CG-World:用工业CG的隐藏状态教会世界模型理解物理演化

论文代表图:figure-03-p005-01

世界模型研究正从视频生成转向世界理解与预测,但现有数据集大多只提供终端观测,缺乏动作、物理状态与因果干预信号。CG-World从工业CG生产管线中恢复出约85万条镜头级世界状态片段,将显式的物理中间状态、多模态观测与同根反事实分支系统对齐。实验表明,基于CG-World的后训练能显著提升视频生成质量、动作预测精度与VLA仿真迁移成功率。数据集继承工业CG生产偏差,生产衍生状态不能直接视为真实世界物理真值。

ContactFlow:用接触点轨迹打通人类演示与机器人操作之间的具身鸿沟

论文代表图:figure-01-p007-02

视频世界模型通过想象动作后果来规划机器人行为,但现有方法用关节状态或演员掩码作为条件化信号,这些信号与特定具身深度绑定,难以从人类演示迁移到机器人。ContactFlow 提出一种具身无关的动作表示——将手或夹爪与物体间的 3D 接触点轨迹投影到图像空间,形成稀疏的 7 通道控制视频。基于 Wan 视频扩散模型训练后,该方法在 DROID 数据集上取得最优视频预测质量,并在 7 个未见数据集上展现出强泛化能力。真实世界实验中,世界模型在 10 个桌面抓取放置场景中正确预测了 8 个场景的执行结果。但该方法依赖标定良好的外中心相机和可靠深度估计,推理速度也远未达到实时。

Wonder:如何用稀疏注意力解决视频世界模型的长程记忆与控制漂移

方法贡献:稀疏上下文强制与 MoS 蒸馏

现有视频世界模型在长程交互中常面临控制漂移、记忆丢失和延迟高的问题。Wonder 提出像素空间坐标场实现精准相机控制,利用稀疏上下文强制和全保真 KV Cache 记忆机制解决长期一致性问题,并通过 Mixture-of-Students 蒸馏实现实时推理。实验显示其在 I2V 和 V2V 任务中显著优于 RELIC 等基线,RPE 指标大幅降低。需注意其对训练算力要求高,且依赖外部位姿估计。

HyWorldVLA:混合世界模型如何提升自动驾驶鲁棒性

方法概览:三阶段训练框架

本文介绍HyWorldVLA,一种用于自动驾驶的视觉-语言-动作模型。针对纯像素级模型对噪声敏感、纯潜在级模型缺乏解释性的问题,HyWorldVLA采用混合世界建模,结合视频VAE压缩与联合注意力机制。实验显示其在NAVSIM v1/v2基准上达到SOTA,PDMS达90.59,且在雨雾噪声下表现优异。需注意单目摄像头在转弯场景的视野限制及损失权重平衡。

单卡RTX 5090实时推演:ABot-World-0的LongForcing与全栈优化

数据:WorldExplorer闭环系统

本文介绍ABot-World-0,一种基于动作条件的视频世界模型。针对现有世界模型在长时程一致性、控制耦合及部署效率上的瓶颈,研究提出WorldExplorer闭环数据系统、LongForcing长时程分布匹配机制,以及基于LightVAE、FP8/MXFP4量化和SageAttention2的全栈推理协同设计。在WorldRoamBench基准上,该模型在Strict Accuracy等指标上优于Genie 3等基线,并在单张RTX 5090上实现16 FPS实时交互。需注意,性能数据基于特定硬件,且部分基线模型参数量较大,比较时需考虑规模差异。

Masked Visual Actions:像素级动作接口实现跨本体通用世界建模

方法:掩码视觉动作接口

视频模型蕴含丰富的物理先验,但低维动作信号(如关节角度)具有本体特异性,难以被预训练视频模型有效利用。本文提出“掩码视觉动作”(Masked Visual Actions),将动作表示为像素空间中实体的部分可见轨迹。通过LoRA微调Wan-Fun-Control 2.2 14B模型,在DROID和Robocasa数据集上训练。该方法实现了跨本体泛化,统一了前向模型(预测场景响应)和逆模型(合成机器人行为)。实验显示在DROID上LPIPS为0.0945,策略评估相关性r=0.982。需注意模型学习的是相关性而非因果关系,且存在对任务进展的正向偏差。

Orbis 2:分层世界模型解决自动驾驶长程预测漂移与语义丢失问题

方法:分层架构设计

本文分析Orbis 2分层驾驶世界模型。针对单一层级模型长程预测误差累积问题,提出高层抽象预测与低层细节生成解耦架构。使用压缩DINO latent与Diffusion Forcing预训练,在nuPlan/Waymo上实现低FVD与低FVD-slope。需注意Cosmos-v2.5数据未公开及Epona泛化局限。

Wan-Streamer v0.3:世界与事件流解耦的实时全双工交互模型

预训练数据构造:世界上下文摘要

本文分析 Wan-Streamer v0.3 的核心创新:将视频重构为持久世界上下文与随时间变化的事件流。相比 v0.1/v0.2 针对单一交互任务训练的局限,v0.3 通过通用预训练学习世界动态,支持实时全双工音频视觉交互及开放词汇自由行为生成。实验显示模型侧响应延迟约 200 ms,总交互延迟约 550 ms。需注意预训练数据中的世界上下文摘要可能存在信息丢失,且行为生成依赖语言描述的准确性。

DriftWorld:单步漂移世界模型,实现30+ FPS实时机器人规划

方法:漂移生成架构

扩散世界模型因多步去噪导致推理缓慢,限制实时控制。DriftWorld利用漂移生成模型,通过单步前向传播实现30+ FPS视频生成。实验显示其在Push-T、Bridge-V2等基准上视觉质量优异,且通过GPC-RANK显著提升策略性能。注意:训练需较大显存,依赖预训练特征提取器。