M4World:分钟级多视角多模态驾驶世界模型与细粒度物体操控

方法:共享DiT骨干与多模态控制接口

本文介绍M4World,一种基于DiT的多视角多模态驾驶世界模型。针对现有模型在物体级细粒度可控性和长时程生成稳定性上的不足,M4World通过融合3D几何、语义、图像描述和文本属性的控制接口,实现了空间布局与视觉外观的双重控制。训练采用五阶段配方,包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD及迭代长视频微调,支持4步自回归流式生成。实验显示,在10秒视频上FID为34.8,FVD为288.7,优于MagicDriveV2。在60秒长视频生成中,通过潜在上下文刷新保持稳定性。针对“运载树木的卡车”长尾场景,通过LoRA少样本适配,使BEV检测Recall从1.0

FlowWAM:光流统一世界动作模型与机器人控制

方法:双流扩散Transformer架构

本文介绍FlowWAM,一种将光流作为统一动作表示的世界动作模型。通过双流扩散Transformer,模型在策略模式下联合生成RGB与光流,并通过动作专家解码执行;在世界模型模式下,以目标光流为条件生成未来帧。实验显示,FlowWAM在RoboTwin 2.0仿真基准Clean设置下成功率达92.94%,在WorldArena基准上EWMScore达63.71,并在真实Franka与ARX机器人上优于基线。需注意光流提取的计算开销及HSV编码的归一化敏感性。

CD-LAM:因果去偏潜在动作模型,解决具身世界模型动作跟随性差与数据效率低问题

方法概述:CD-LAM三阶段框架

本文提出CD-LAM框架,针对潜在动作模型(LAM)中动作无关视觉因素泄露导致的动作跟随性差问题,引入基于因果的去偏目标进行微调。实验显示,该方法在2B和14B模型上显著降低FDCE(前景位移切弗距离误差),并在AgiBot真实机器人数据集上实现12倍以上的适应效率提升。需注意,高PSNR不保证良好的动作跟随性,FDCE是更可靠的评估指标。

世界模型会运动,却不懂动力学?iKCE诊断长视界失效

实验设置:DMC Walker 任务

长视界世界模型可能只会做平滑的运动学外推,并未理解摩擦等动力学变化。论文提出iKCE和扰动扫描进行测试时诊断。本期分析摩擦无感、关节噪声阳性对照和消融结果,也说明低iKCE不能直接等同于动力学正确。

走出去再回来,场景还能一致吗?AlayaWorld

AlayaWorld架构概览

AlayaWorld面向长视界可玩视频世界,组合相机控制、3D空间缓存、压缩历史和少步蒸馏。本期重点看回路闭合、实时提示切换和跨风格结果,并区分视觉一致性、物理交互性与项目页定性展示。

不用真实机器人也能采集遥操作数据?RynnWorld-Teleop

模型架构与训练

RynnWorld-Teleop让人手姿态驱动动作条件世界模型,生成带动作标签的机器人第一视角训练视频。本期解释深度感知骨架、流式自回归蒸馏和真实机器人策略实验,同时关注合成动力学误差与Sim2Real边界。

会生成视频,不等于理解物理:LingBot-Video的MoE路线

核心架构

面向内容创作的视频模型未必适合机器人。LingBot-Video从稀疏MoE、具身数据画像和多维奖励三方面重新设计视频预训练。本期核对长序列效率、物理合理性证据,并讨论路由开销、训练数据和奖励模型的复现边界。