快速导读:DreamX-Phi 1.0 是一个基于 Wan2.2-TI2V-5B 的动作条件视频世界模型,通过 PRoPE 几何注意力、深度监督和对象一致性约束,在给定单帧观测和双手动作轨迹时预测未来视频,并在 WorldArena 2.0 上取得 Track 1 第一、Track 2 并列第二。
DreamX-Phi 1.0 是一个面向机器人操作的动作条件视频世界模型:给定单帧 RGB 观测、语言指令和外部指定的双臂动作轨迹,它预测未来的 RGB 视频。论文的核心主张是,现有方法把动作压缩成通用 token 或特征调制,丢掉了末端执行器运动的刚体几何结构,导致生成视频虽然逼真,却可能移动错误的机械臂或丢失被操作物体。
DreamX-Phi 1.0 的解决方案是把 PRoPE 群作用注意力机制从相机设定改造为双臂 SE(3) 动作条件接口,并辅以机器人光流线索、SAM3 掩码加权 RGB 目标、深度潜变量监督和冻结 V-JEPA 教师的关系监督。在 WorldArena 2.0 Track 1 上,它以 EWMScore-P 60.65 排名第一;Track 2 的 Adjust Bottle 成功率为 67.19%,并列第二。
英文题目:DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
论文出处:arXiv 每日论文精选 · arXiv:2608.13489
原始论文:PDF / 论文页面
这篇论文解决什么问题?
世界模型的核心价值在于通过预测未来场景演化来支持规划。现代视频生成器提供了强大的外观和运动先验,但逼真预测并不等于忠实于条件动作。一个典型的失败模式是:模型生成了一段看起来自然的视频,机械臂却在错误的位置运动,或者被操作物体在 rollout 中逐渐消失或变形。
现有动作条件世界模型大致分为两类。一类如 IRASim、Vid2World、HMA,把动作压缩成紧凑 token 或特征调制,缺乏几何显式性,模型很难从 token 中恢复出刚体运动的约束。另一类如 FlowWAM 用光流表示动作,虽然提供了图像平面运动线索,但没有保留连续的刚体轨迹,无法表达旋转和平移的完整 SE(3) 结构。
这个 gap 的本质是:动作条件应该以几何方式告诉模型'哪个刚体在三维空间中如何运动',而不是以统计方式告诉模型'存在某种运动模式'。DreamX-Phi 1.0 的出发点就是把这一几何信息显式地注入视频扩散 Transformer 的注意力机制中。
核心创新
- 提出几何感知动作表示:将 PRoPE 群作用注意力从相机设定改造为双臂 SE(3) 动作条件,按臂分组注意力头并注入夹爪偏置,保留刚体运动结构
- 提出操作感知监督:SAM3 掩码加权 RGB 损失聚焦接触局部误差,冻结 V-JEPA 教师通过 Gram 矩阵对齐约束被操作物体的时空一致性
- 引入辅助深度分支:复制尾部 M 个 Transformer 块,以单向交叉注意力读取 RGB 特征,在潜空间监督深度预测,推理时可选
- 用 DMD 加对抗训练将多步生成器蒸馏为少步学生,条件包含观测帧和动作轨迹
方法概览
以 Wan2.2-TI2V-5B 视频扩散 Transformer 为骨干,将 PRoPE 群作用注意力机制改造为双臂动作条件接口:所有机械臂变换到共享坐标系,按臂分组注意力头,注入 SE(3) 相对变换和夹爪偏置;同时加入机器人光流线索提供图像平面运动条件。训练时用 SAM3 掩码加权 RGB 目标、Depth Anything 3 深度潜变量监督和冻结 V-JEPA 教师的关系监督;推理前用 DMD 对抗训练蒸馏为少步学生模型。
- 骨干网络采用 Wan2.2-TI2V-5B 视频扩散 Transformer。所有机械臂变换到共享坐标系,按臂分组注意力头,注入 SE(3) 相对变换和夹爪偏置,使注意力计算本身携带刚体运动结构。
- PRoPE 原本用于相机设定,DreamX-Phi 将其改造为双臂动作条件接口:每个注意力头只关注一只臂的变换,避免双臂之间的几何信息互相干扰。
- 同时加入机器人光流线索,提供图像平面运动条件,与 SE(3) 几何条件互补:前者告诉模型运动发生在图像的哪个位置,后者告诉模型运动的三维刚体结构。
- 训练时用 SAM3 掩码加权 RGB 目标,让损失聚焦在机械臂和被操作物体的接触局部区域,而不是被背景像素稀释。
- 深度监督通过复制尾部 M 个 Transformer 块实现,以单向交叉注意力读取 RGB 特征,在潜空间监督 Depth Anything 3 的深度预测,推理时可选。
- 对象一致性约束用冻结的 V-JEPA 教师,通过 Gram 矩阵对齐约束被操作物体的时空一致性,防止物体在 rollout 中漂移或消失。
- 推理前用 DMD 加对抗训练将多步生成器蒸馏为少步学生模型,条件包含观测帧和动作轨迹,降低推理成本。
逐图理解论文
研究缺口

图 2 是框架总览,分三部分:动作条件接口(PRoPE 和光流)、训练监督(SAM3 掩码、深度、V-JEPA)、DMD 蒸馏。重点看 PRoPE 如何按臂分组注意力头,以及深度分支如何以交叉注意力读取 RGB 特征。
结论

图 3 的域随机化版本展示模型在变化背景、纹理、光照和干扰物体下的表现。这验证了模型不是靠记忆特定场景,而是真正理解了动作与物体交互的几何关系。
Figure 1 Overview of DreamX-Phi 1

图 1 展示 DreamX-Phi 1.0 的整体概览:从单帧观测和双臂动作轨迹预测未来视频。注意观察输入端的动作轨迹如何与观测帧并列进入模型,这体现了动作作为一等公民的设计理念。
实验如何设计?
- WorldArena 2.0 Track 1:1000 个 episode 的视频预测评估,使用 15 项指标和 EWMScore-P 综合评分。
- WorldArena 2.0 Track 2:用提交的世界模型作为 rollout 环境训练 π0.5 策略,在 RoboTwin 2.0 的 Adjust Bottle 任务上评估成功率。
- WorldArena 1.0 Track 1:Clean-50 协议离线评估,50 个任务各 10 个 held-out episode,非官方排行榜条目。
- 定性评估:在标准 RoboTwin 2.0 场景和域随机化场景下展示 rollout 连贯性,域随机化包括变化的背景、纹理、光照和干扰物体。
关键结果与论文证据
- WorldArena 2.0 Track 1 EWMScore-P 为 60.65,在 31 个参赛条目中排名第一(第 9 页)。
- 关键分项中 Trajectory Accuracy 为 57.15,排名第一,说明几何动作条件对轨迹忠实度的贡献最直接(第 9 页)。
- Depth Accuracy 为 98.55,Interaction Quality 为 57.36,表明深度监督和对象一致性约束在各自维度上有效(第 9 页)。
- WorldArena 2.0 Track 2 Adjust Bottle 成功率为 67.19%,并列第二(第 9 页)。
- WorldArena 1.0 Track 1 离线 EWMScore-P 为 76.88,比官方榜首 UNIS 的 73.64 高 3.24 分(第 11 页)。
- 定性 rollout 显示模型在标准场景和域随机化场景下都能保持机械臂、夹爪和被操作物体的连贯性(第 9-10 页)。
阅读时需要注意
- 评估仅限 WorldArena 和 RoboTwin,Track 2 只覆盖 Adjust Bottle 一个任务,对其他任务、具身形态和真实机器人的泛化未验证。
- 排行榜分数评估整个系统,无法分离各组件贡献,缺少匹配的消融实验。
- 模型只从外部给定动作预测视频,不生成动作本身,未评估作为闭环控制器的能力。
- WorldArena 2.0 排行榜持续更新,文中结果锚定于 2026 年 8 月 12 日快照,不代表最终排名。
关联工作
- PRoPE(Li et al., 2025a)提供群作用注意力机制,DreamX-Phi 将其从相机设定改造为双臂 SE(3) 动作条件,这是方法的核心创新来源(第 3 页)。
- FlowWAM(Chen et al., 2026)用光流作为动作表示,DreamX-Phi 借鉴其图像平面运动线索思路,但补充了完整的三维刚体轨迹(第 3 页)。
- IRASim(Zhu et al., 2025)是 token 类动作接口的代表,DreamX-Phi 的几何显式设计与它形成对比(第 3 页)。
- X-WAM(Guo et al., 2026)的深度适配方案启发了 DreamX-Phi 的辅助深度分支设计(第 6 页)。
- DMD2(Yin et al., 2024a)提供分布匹配蒸馏方法,DreamX-Phi 用它进行少步推理后训练(第 7 页)。