三分钟导读:FlowWAM提出使用光流作为统一的动作表示,通过双流扩散框架将策略推理与世界建模统一,实现了基于无标签视频预训练的高精度机器人操作。
英文题目:FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
论文出处:arXiv 每日论文精选 · arXiv:2607.13017
原始论文:PDF / 论文页面
对应视频标题:FlowWAM:光流统一世界动作模型与机器人控制|推荐指数:★★★★★
这篇论文解决什么问题?
现有的世界动作模型(WAMs)在利用预训练视频生成器进行控制时,面临动作表示与视频先验对齐困难的问题:数值动作缺乏视觉通用性,而现有的视觉动作表示(如掩码、射线图)多为静态空间线索,缺乏跨帧的密集运动结构信息。
核心创新
- 首次将光流作为世界动作模型的统一动作表示,弥合了可执行机器人动作与像素空间视频先验之间的鸿沟。
- 提出双流扩散框架,使动作预测和世界建模在同一个预训练视频生成器中以视频到视频生成的形式统一处理。
- 利用光流可从原始视频中提取且无需动作标签的特性,支持大规模无标签自我中心视频预训练,提升模型泛化能力。
方法概览
FlowWAM采用双流扩散Transformer架构,将RGB帧和HSV编码的光流视频作为两个耦合的视频流。在策略模式下,模型联合生成未来RGB和光流潜变量,并通过动作专家解码为可执行动作;在世界模型模式下,提供目标光流轨迹作为条件,生成符合指定运动的未来RGB帧。训练分为两阶段:在无标签视频上进行光流预训练,在有标签机器人数据上进行联合微调。
逐图理解论文
方法:双流扩散Transformer架构

FlowWAM采用双流扩散Transformer架构,将RGB帧与HSV编码的光流视频作为两个耦合的视频流。在策略模式下,模型联合生成未来RGB和光流潜变量,并通过动作专家解码为可执行动作;在世界模型模式下,提供目标光流轨迹作为条件,生成符合指定运动的未来RGB帧。
仿真策略评估:RoboTwin 2.0基准

在RoboTwin 2.0仿真基准上,FlowWAM展现了卓越的控制性能。在Clean设置下,其策略成功率达到92.94%;在更具挑战性的Random设置下,成功率仍保持在92.14%。这一结果验证了光流表示在复杂动态环境中的鲁棒性,并优于多种视觉语言模型基线。
世界建模评估:WorldArena基准

在WorldArena基准上进行动作条件世界建模评估,FlowWAM的EWMScore达到63.71。其轨迹准确性相对提升18.4%,表明模型能更精确地遵循指定的运动指令。与仅使用文本条件的通用视频模型相比,FlowWAM通过密集光流条件实现了更细粒度的运动控制。
真实世界迁移:单臂与双臂实验

在真实世界实验中,FlowWAM在单臂Franka和双臂ARX机器人平台上进行了迁移测试。FlowWAM平均成功率为75.7%,显著优于基线π0.5的61.4%和Motus的57.1%。定性可视化显示,预测的光流场与物理执行轨迹高度对齐,证明了视频原生表示的有效性。
消融实验:光流表示与条件设计

消融实验验证了光流表示、运动感知重加权及随机潜变量条件等设计的有效性。结果显示,移除光流条件会导致性能显著下降,而引入随机潜变量条件有助于对齐去噪误差分布,提升动作专家的解码稳定性。这些设计共同确保了模型在策略推理中的可靠性。
实验与关键结果
- 在RoboTwin 2.0仿真基准上进行策略成功率评估,对比VLA和WAM基线。
- 在WorldArena基准上进行动作条件世界建模评估,对比通用视频模型和机器人世界模型。
- 在真实世界单臂(Franka)和双臂(ARX)机器人平台上进行迁移实验。
- 进行消融实验,验证光流表示、运动感知重加权、随机潜变量条件等设计的有效性。
- RoboTwin Clean设置成功率92.94%,Random设置成功率92.14%(第 6 页)
- WorldArena EWMScore达到63.71,轨迹准确性(Trajectory Accuracy)相对提升18.4%(第 7 页)
- 真实世界实验中,FlowWAM平均成功率75.7%,优于基线π0.5 (61.4%)和Motus (57.1%)(第 8 页)
阅读时需要注意
- 光流提取依赖于RAFT等光流估计器,计算开销较大。
- 手腕视角的光流目标在预处理中使用占位符填充,可能影响局部细节建模。
- 当前工作主要关注短至中期时间跨度,未来需扩展到更长时序。
- 光流表示依赖于HSV编码,需确保归一化常数m和幅度截断(25 px)的合理性,以避免运动饱和或噪声。
- 动作专家对生成潜变量中的去噪误差敏感,训练时需引入随机潜变量条件以对齐分布。
关联工作
- Motus:对比基线,使用潜在动作(latent action)而非显式光流视频。(第 17 页)
- GigaWorld-Policy:对比基线,使用视频预测作为辅助监督,但不暴露密集光流作为共享接口。(第 17 页)
- X-WAM:对比基线,使用数值投影的动作/状态潜变量,而非密集图像空间光流。(第 17 页)
- CogVideoX:对比基线,通用视频生成模型,仅使用文本条件。(第 17 页)
- IRASim:对比基线,使用数值动作条件进行世界建模。(第 17 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
FlowWAM:作为世界动作模型统一动作表示的光流
Yixiang Chen1,2,∗ Peiyan Li1,2,∗ Yuan Xu1,2 Qisen Ma1,2 Jiabing Yang1,2 Kai Wang1,2 Jianhua Yang1,2 Dong An4 He Guan3 Gaoteng Liu3 Jianlou Si5 Jun Huang5 Jing Liu3 Nianfeng Liu3 Yan Huang1,2,3,† Liang Wang1,2,† 1模式识别国家重点实验室(NLPR),中国科学院自动化研究所 2中国科学院大学人工智能学院 3FiveAges 4MBZUAI 5阿里巴巴集团 yixiang.chen@cripac.ia.ac.cn {yhuang, wangliang}@nlpr.ia.ac.cn
摘要 世界动作模型(WAMs)能够利用预训练视频生成器进行世界建模和动作预测。然而,利用视频生成器进行控制提出了一个新的挑战:如何以与预训练视频生成器对齐的形式表示动作,同时携带足够的运动线索以实现准确控制。现有的数值动作表示无法满足前者,而先前的视觉动作表示则忽略了帧间的时间运动结构。我们通过 FlowWAM 解决了这一问题,这是一个双流扩散框架,采用光流作为统一的、视频原生的动作表示。Flow 视频与 RGB 视频具有相同的格式,并编码了丰富的逐像素位移信息。通过在共享的预训练视频生成器中联合建模,FlowWAM 可以自然地实现两种模式的世界动作模型。在策略模式下,FlowWAM 生成光流以进行动作预测;在世界模型模式下,它使用目标光流序列来引导未来的视频生成。此外,由于光流可以从原始视频中轻松提取而无需动作标签,FlowWAM 可以利用大规模无动作标签的视频数据集进行预训练。我们的实验结果表明,基于光流的动作表示在这两种模式下均带来了性能提升。在 RoboTwin 2.0仿真基准的操纵任务中,FlowWAM 在 Clean 设置下的成功率达到 92.94%,在 Random 设置下达到 92.14%,优于 VLA 和 WAM 基线。在 WorldArena世界建模基准的世界建模任务中,它取得了最佳的总体 EWMScore(63.71),轨迹准确率相对提升了 18.4%。更多结果请访问我们的项目网站:https://flow-wam.github.io。
1 引言
世界动作模型(WAMs)[1–8] 近期作为操作任务中一个有前景的方向出现,与视觉-语言-动作(VLA)策略 [9–11] 并列。虽然 VLA 策略通常受益于图像-语言预训练中的语义先验,但 WAMs 利用已经编码运动和时序动态的预训练视频生成器。这些以运动为中心的先验特别适合操作任务,因为操作的成功不仅取决于将指令与物体对齐,还取决于捕捉机器人和环境逐帧的连续运动。
† 通讯作者。
- 同等贡献。
预印本。
第 2 页
流图像 动作表示 饱和度 𝑥 𝜃 𝐺𝑟𝑖𝑝 ⋯ 𝑞" 帧 T 幅值 𝑞!
数值 图像空间 流图像 光流 HSV 流图像 像素动作 静态 稠密 帧 T+1 估计 轮子 动作 间隙 稀疏 视觉运动
DiT 策略 可执行 模型 动作 用于动作预测的噪声流 动作 专家 世界 未来 模型 视频 ℒ!"#$% 学习 用于动作条件的干净流 自我数据预训练 运动先验 双模式
图 1:FlowWAM 使用光流作为世界动作模型(WAMs)的统一动作表示。通过用稠密流视频表示动作,FlowWAM 桥接了可执行机器人动作与像素空间视频先验,使得在同一框架内能够实现无动作标签的视频预训练、策略推理以及动作条件化的世界建模。
为了利用这些视频先验进行控制,理想的动作表示应既符合预训练视频生成器的视觉输入格式,又保留控制所需的跨帧运动线索。
现有的 WAMs 探索了多种形式的动作表示,在该领域取得了显著进展。数值动作令牌 [1, 7, 6, 8] 是精确的,但不同的机器人使用不同的动作空间,使得跨具身智能体的直接迁移变得困难。学习到的潜在动作 [4, 12] 通过从帧过渡中学习减少了这种依赖性,但它们较为抽象,可能无法保留控制所需的稠密、空间锚定的运动线索。最近的图像空间动作,如动作射线图 [13]、掩码 [14] 或多视角动作图像 [15],通过将控制信号渲染为视觉形式来缩小这一差距。然而,这些视觉条件主要是静态的空间线索,指示动作发生的位置,而不是具身智能体的每个可见部分如何在帧间移动。因此,它们仍然是注入视频生成器的帧级条件信号,而不是与预测的未来视频共同演变的时序稠密动作表示。这些局限性留下了一个未解的问题:如何以视频原生形式表示动作,既保留稠密的跨帧运动线索,又能解码为可执行的控制信号?
我们的关键观察是,光流是 WAMs 自然适用的动作表示。通过记录每个像素的位移并通过 HSV 色彩空间编码将其映射到 RGB 空间,流视频变成了稠密的、类似视频的 motion 信号,与预训练视频生成器的视觉先验无缝对齐。此外,由于光流可以直接从原始自我中心视频中提取,它为无动作标签的预训练和下游控制提供了统一的表示。虽然之前的工作将光流视为辅助信号 [16, 17] 或模块化中间层 [18, 19],但我们重新构想光流为主要、视频原生的动作模态,并深度集成到 WAM 的生成潜在空间中。尽管具有潜力,这一方向在很大程度上仍未得到充分探索。
基于这些见解,我们提出了 FlowWAM,这是一种基于流的双流扩散框架,在统一的扩散骨干网络中联合集成动作预测和世界建模。利用流与 RGB 帧具有相同图像格式的事实,FlowWAM 使得两个流共享相同的 VAE 编码器和 Transformer 块,仅使用轻量级的流特定适配器。这种架构有效地将动作预测和世界建模转化为单一、一致的视频到视频生成任务,使模型能够直接继承大规模视频生成器的丰富运动先验。如图 1 所示,FlowWAM 确立了光流作为统一的动作表示。在策略模式下,模型生成未来流,并将其解码为可执行动作;在世界模型模式下,它使用目标流序列来引导视频生成。FlowWAM 提供了三个关键技术优势:(1) 统一性:流与 RGB 共享相同的图像格式,缩小了控制信号与预训练视频先验之间的模态差距。(2) 可靠性:稠密流为视频预测提供了空间锚定的条件信号,使得动作条件化的世界建模比基于稀疏动作令牌的条件化更忠实、更可靠。(3) 可扩展性:流可以从无动作标签的自我中心视频中提取,允许 FlowWAM 从大规模无标签视频源中获取运动先验。
2
第 3 页
我们的贡献总结如下:
- 据我们所知,我们是首个将光流作为世界动作模型(WAMs)的统一动作表示引入的研究,提供了一种稠密、原生于视频的运动信号,该信号可以从无动作标签的第一人称视频中进行预测、条件控制和学习。
- 我们提出了 FlowWAM,这是一种双流扩散框架,通过共享的预训练视频生成器联合建模 RGB 视频和光流视频,从而同时实现用于操作的动作预测和用于世界建模的视频生成。
- 我们在策略和世界模型设置中展示了 FlowWAM 的性能:在 RoboTwin [20] 上,FlowWAM 在 Clean 设置下取得了 92.94% 的成功率,在 Random 设置下取得了 92.14% 的成功率,优于 VLA 和 WAM 基线。在 WorldArena [21] 上,FlowWAM 取得了 63.71 的 SOTA EWMScore,在动作条件轨迹建模方面取得了显著提升。
2 相关工作
世界动作模型。最近的世界动作模型(WAMs)通过将动作预测与世界建模耦合,利用视频生成器进行机器人操作。为了使想象的未来能够指导策略学习,一条研究路线在共享的生成过程中联合生成视频和动作。例如,DreamZero [1] 和 Cosmos Policy [5] 使用动作标记对视频生成器进行微调,而 UWM [2] 和 CoVAR [3] 通过共享潜在变量将视频和动作扩散头耦合起来。另一条研究路线遵循“先生成后推断”的流水线,首先生成未来视频,然后使用逆动力学模型 [22, 6, 23] 或因果预测模块 [7] 恢复动作。这些方法证明了视频先验在控制中的价值,但动作通常仍然是一个异构流,必须通过特定于动作的标记、头或解码器与视频潜在变量连接。FlowWAM 的不同之处在于,它将动作相关的运动本身表示为光流视频,允许动作表示作为视觉流在同一个预训练视频生成器内进行建模。这使得动作表示保持在视频先验已捕获的运动模式附近。
WAMs 中的动作表示。现有的统一 WAMs 可以根据动作流与视频生成器的关系进行分类。一条研究路线使用数值动作标记 [1, 5, 2],这些标记附加到视频潜在变量上或与视频潜在变量共同生成,利用视频生成器进行预测,同时保持动作在单独的符号空间中。另一条研究路线从帧过渡中学习潜在动作代码 [12, 4, 24],提供了一种独立于任何特定机器人的动作表示。第三条研究路线基于图像空间的动作信号(如射线图 [13]、化身掩码 [14] 或多视图动作图像 [15])对视频生成进行条件控制,将动作信息直接放置在视频生成器的输入域中。FlowWAM 属于第三条路线,但它用稠密的光流视频替换了稀疏的空间线索。这个单一的视频格式流在策略模式下作为动作预测目标,在世界模型模式下作为条件信号。
用于操作的流。光流和像素运动也被用作操作的动作表示,特别是在策略需要显式视觉运动线索时。先前的工作将光流用作 VLA 风格策略的辅助监督信号或运动目标 [16, 17, 4],或用作流到动作、规划和未来流预测流水线中的中间变量 [18, 25, 26, 19]。最近的像素运动系统,如 LangToMo [27] 和 DAWN [28],同样通过结构化的像素运动 bridging 高级运动生成和低级控制,而轨迹方法如 ATM [29] 则对稀疏点轨迹进行建模。这些方法证明了运动线索的价值,但它们限制性地将光流保持在视频生成器之外,作为辅助目标、规划变量或模块间的桥梁。FlowWAM 则将稠密光流建模为原生流,可用于策略推理的生成,并用于条件控制动作敏感的世界建模。相同的运动表示在一个视频生成器内同时支持控制和预测。
3 方法
3.1 概述
FlowWAM 使用光流作为统一的动作表示,连接预训练的视频先验与可执行的机器人控制。给定参考图像 $I_0$ 和语言指令 $\tau$,它联合
第 4 页
输入 双流 DiT 动作专家 RGB RGB 参考 patchRGB RGB 视频 分支 图像 嵌入 RoPE 交叉注意力 联合 策略 自注意力 FFN + 模式 注意力 光流 光流 光流 光流 动作 patch 分支 嵌入 RoPE 流匹配 光流 世界模型 模式 视频 语言指令 无动作标签 训练:两个阶段 推理:两种模式 视频 动作 动作 DiT ℒ!"#$% DiT 动作 专家 专家
(a) 阶段1:视频-光流预训练,DiT 学习运动先验 (a) 策略模式:双流去噪
DiT 动作 ℒ!"#$% + ℒ&'("%) DiT 动作 专家 专家 有动作标签 机器人数据 (b) 阶段2:联合微调,附加动作专家 (b) 世界模型模式:给定光流,仅对 RGB 去噪
图 2:FlowWAM 概述。FlowWAM 在共享的扩散 Transformer 中将 RGB 帧和光流编码为两个耦合的视频流。在策略模式下,模型联合生成未来的 RGB 和光流潜在变量,动作专家将视频生成器的中间特征解码为可执行的机器人动作。在世界模型模式下,期望的光流轨迹作为条件提供,模型生成遵循指定运动的未来 RGB 帧。
模型使用双流扩散 Transformer 对 RGB 和光流视频进行建模。同一个视频生成器支持两种使用模式。当生成光流时,FlowWAM 充当策略,其运动计划被解码为动作。当提供光流时,FlowWAM 充当世界模型,渲染与指定运动一致的 RGB 未来画面。整个框架的概述如图 2 所示。我们在第 3.2 节描述双流生成,在第 3.3 节描述动作专家,在第 3.4 节描述训练过程。
3.2 统一视频-光流生成
RGB 光流编码。我们首先将与动作相关的运动光流转换为与 RGB 视频帧相同的图像格式。给定连续帧,光流场 $f_t \in \mathbb{R}^{H \times W \times 2}$ 记录每个像素的位移 $(u, v)$,捕捉运动发生的位置以及可见点的移动方式。我们使用 HSV 色轮编码 $\phi$ 将其转换为 RGB 图像:
$\frac{\text{atan2}(v, u) + \pi}{2\pi}$ $\frac{\|f_t\|}{m}$ $F_t = \phi(f_t) : H = , S = , V = 1, (1)$ $2\pi$ $m$ 其中 $m$ 是光流幅值的归一化常数,$H$、$S$ 和 $V$ 分别表示色调、饱和度和亮度通道。在所选归一化下,该编码是可逆的:$\phi^{-1}(F_t)$ 恢复数值光流场。由于光流 RGB $F_t$ 与场景帧 $I_t$ 格式相同,与动作相关的运动可以直接由相同的 VAE 编码器和视频生成器处理,无需单独的动作标记器。
双流架构。RGB 帧和光流帧由相同的冻结 VAE 编码器 $E$ 独立编码,产生 RGB 潜在变量 $z = E(V)$ 和光流潜在变量 $z_f = E(F)$,其中 $V$ 和 $F$ 分别表示 RGB 和光流视频序列。唯一的流特定参数是每个流的 patch 嵌入层和输出头,所有 Transformer 块都是共享的。在每个自注意力层内部,RGB 和光流 token 被连接以进行联合注意力,然后拆分回各自的流,并且我们对每个流独立应用旋转位置嵌入 (RoPE)。这种联合注意力机制实现了 RGB 和光流流之间的深层时空交互,而共享的 Transformer 块确保模型完全保留预训练视频生成器的生成能力。
两种操作模式。一旦 RGB 和光流被建模为并行流,策略和世界模型推理的区别仅在于光流是未知还是已观测。在这两种模式中,第一个潜在
第 5 页
每个流的帧都固定为参考观测(图像到视频条件)的干净 VAE 编码,所有后续的潜在帧均通过迭代去噪生成。
在策略模式下,两个流的剩余帧均从高斯噪声初始化并联合去噪。双流 DiT 同时合成未来的 RGB rollout 及其对应的流视频,动作专家从中读取中间特征以解码可执行动作。在世界模型模式下,流潜在变量 $z_f$ 被设置为期望运动轨迹的干净 VAE 编码,并在整个采样过程中保持固定,仅 RGB 潜在变量从噪声初始化。随后,模型渲染出与指定运动一致的未来视频,从而实现用于规划和评估的动作条件预测。因此,流是该框架中共享的动作表示。它既用于策略推理生成,也用于可控的世界建模提供。
3.3 从流潜在变量进行动作预测
FlowWAM 首先使用双流 DiT 预测密集的 RGB 和流潜在变量,然后将此运动计划转换为机器人的底层动作空间。因此,我们使用一个动作专家,这是一个 Transformer,它对双流视频生成器的每层流和 RGB 隐藏状态进行交叉注意力机制,以当前本体感知状态为条件,并在流匹配目标下预测 $N$ 步动作块 $\hat{a}_0 \in \mathbb{R}^{N \times d_a}$。
在训练时,动作专家可以读取由干净视觉潜在变量(冻结的 VAE 编码)计算的隐藏状态。在推理时,它读取由双流模型生成的潜在变量派生的隐藏状态,这些状态可能包含残差去噪误差。为了对齐这些分布,我们在 $p=0.5$ 的训练步骤中将噪声混合到输入视频生成器的潜在变量中,并将采样的噪声级别作为辅助嵌入传递给动作专家,
$$ \tilde{z}_f = (1 – \sigma) z_f + \sigma \epsilon_f, \quad \tilde{z} = (1 – \sigma) z + \sigma \epsilon_r, \quad \sigma \sim U[0, 1], \quad (2) $$
其中 $\epsilon_f, \epsilon_r \sim \mathcal{N}(0, I)$ 相互独立。在剩余的 $1-p$ 训练步骤中,使用纯干净潜在变量。
3.4 训练
FlowWAM 对带有动作标签的机器人数据和无动作标签的视频数据使用相同的训练公式。带有动作标签时,双流视频生成器和动作专家联合优化。无标签时,相同的 RGB-流视频目标仍用于训练双流视频生成器。
视频生成损失。双流 DiT 在 RGB 和流潜在变量上使用流匹配目标 [30] 进行训练。在每个训练步骤中,为两个流采样共享的时间步 $t \sim U[0, 1]$。噪声潜在变量构建为 $z_t = (1 – t) z_0 + t \epsilon$ 和 $z_{ft} = (1 – t) z_{f0} + t \epsilon'$,模型预测速度场 $v_\theta(z_t, t)$ 和 $v_{f\theta}(z_{ft}, t)$。视频损失是两个流的加权组合:
$$ \mathcal{L}_{\text{video}} = (1 – \lambda_f) \mathcal{L}_{\text{RGB}} + \lambda_f \mathcal{L}_{\text{flow}}, \quad (3) $$
其中 $\mathcal{L}_{\text{RGB}}$ 和 $\mathcal{L}_{\text{flow}}$ 分别是 RGB 流和流流的预测速度与目标速度之间的均方误差。为了匹配图像到视频的推理分布,每个噪声流的第一帧潜在变量被替换为其干净的条件潜在变量,并且该帧的损失相应地被屏蔽。我们另外对条件帧施加少量高斯噪声,以模拟自回归 rollout 中最新观测的残差误差。
操作流在空间上是稀疏的,运动集中在本体、操作物体和接触相关区域周围。为了避免静态背景的主导地位,我们对 $\mathcal{L}_{\text{flow}}$ 应用运动感知重加权。每个位置的计算权重来自流潜在变量相对于参考帧的通道平均偏差:
$$ w_{\text{motion}} = 1 + \alpha \cdot \frac{\langle |z_f – z_f^{\text{ref}}| \rangle_c}{\max \langle |z_f – z_f^{\text{ref}}| \rangle_c}, \quad (4) $$
其中 $\langle \cdot \rangle_c$ 对潜在通道进行平均,$\alpha$ 控制增强强度,将学习引导至运动丰富区域。
5
第 6 页
表 1:RoboTwin 2.0 在 Clean 和 Random 设置下的策略成功率。PT:预训练;平均值涵盖所有 50 个任务,各任务的详细分解见附录表 4。
| | GigaWorld | | X-VLA | | Motus | | X-WAM | | Fast-WAM | | FlowWAM Policy | | FlowWAM w/o PT | | FlowWAM w/ PT | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | Task | Clean | Rand. | Clean | Rand. | Clean | Rand. | Clean | Rand. | Clean | Rand. | Clean | Rand. | Clean | Rand. | Clean | Rand. | | Adjust Bottle | 79% | 83% | 100% | 99% | 89% | 93% | 100% | 100% | 100% | 99% | 100% | 100% | 88% | 98% | 99% | 100% | | Beat Block Hammer | 63% | 50% | 92% | 88% | 95% | 88% | 86% | 86% | 98% | 96% | 99% | 97% | 75% | 75% | 99% | 100% | | Grab Roller | 90% | 89% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 100% | 99% | | Handover Mic | 28% | 18% | 0% | 0% | 78% | 63% | 72% | 72% | 88% | 89% | 99% | 100% | 89% | 70% | 99% | 99% | | Hanging Mug | 3% | 3% | 23% | 27% | 38% | 38% | 16% | 12% | 46% | 55% | 58% | 62% | 50% | 50% | 65% | 68% | | Lift Pot | 0% | 0% | 99% | 100% | 96% | 99% | 98% | 98% | 100% | 99% | 100% | 100% | 96% | 98% | 98% | 100% | | Move Can Pot | 29% | 27% | 89% | 86% | 34% | 74% | 76% | 78% | 80% | 84% | 90% | 88% | 62% | 60% | 96% | 97% | | Move Pillbottle Pad | 33% | 29% | 73% | 71% | 93% | 96% | 90% | 90% | 96% | 98% | 100% | 99% | 82% | 79% | 100% | 98% | | Move Playingcard Away | 59% | 67% | 93% | 98% | 100% | 96% | 78% | 72% | 100% | 98% | 100% | 100% | 71% | 71% | 100% | 99% | | Open Laptop | 19% | 35% | 93% | 100% | 95% | 91% | 96% | 98% | 96% | 97% | 98% | 100% | 91% | 98% | 99% | 99% | | ……(50 tasks) | | | | | | | | | | | | | | | | | | Pick Diverse Bottles | 5% | 3% | 58% | 36% | 90% | 91% | 82% | 70% | 91% | 92% | 80% | 85% | 68% | 68% | 90% | 91% | | Pick Dual Bottles | 10% | 6% | 47% | 36% | 96% | 90% | 86% | 86% | 99% | 100% | 100% | 96% | 75% | 91% | 100% | 99% | | Place A2b Right | 62% | 57% | 36% | 36% | 91% | 87% | 90% | 92% | 92% | 89% | 93% | 99% | 82% | 86% | 99% | 96% | | Place Burger Fries | 66% | 70% | 94% | 94% | 98% | 98% | 98% | 96% | 97% | 99% | 96% | 99% | 100% | 91% | 99% | 99% | | Place Container Plate | 71% | 78% | 97% | 95% | 98% | 99% | 98% | 96% | 98% | 100% | 96% | 100% | 98% | 97% | 98% | 98% | | Place Empty Cup | 75% | 86% | 100% | 98% | 99% | 98% | 90% | 90% | 98% | 99% | 100% | 100% | 92% | 93% | 100% | 100% | | Place Mouse Pad | 21% | 26% | 70% | 70% | 66% | 68% | 88% | 90% | 84% | 86% | 83% | 89% | 68% | 68% | 96% | 94% | | Put Bottles Dustbin | 12% | 9% | 74% | 77% | 81% | 79% | 72% | 70% | 85% | 95% | 95% | 90% | 63% | 59% | 96% | 94% | | Scan Object | 42% | 38% | 14% | 36% | 67% | 66% | 60% | 64% | 86% | 79% | 89% | 92% | 60% | 50% | 92% | 94% | | Stack Blocks Two | 48% | 56% | 92% | 87% | 100% | 98% | 100% | 94% | 100% | 100% | 100% | 100% | 95% | 93% | 100% | 100% | | Stack Bowls Two | 78% | 66% | 96% | 93% | 98% | 98% | 96% | 92% | 98% | 98% | 92% | 98% | 100% | 91% | 95% | 95% | | Average (%) | 42.98 | 43.84 | 72.88 | 72.84 | 88.66 | 87.02 | 86.36 | 85.04 | 89.76 | 90.68 | 91.88 | 91.78 | 82.40 | 80.80 | 92.94 | 92.14 |
动作预测损失与总目标。当动作标签可用时,动作专家在独立流匹配调度下,被监督以从双流 DiT 的每层隐藏状态中预测真实动作块,从而产生每个块的损失 $L_{action}$。标注数据的目标函数为
$$ L = L_{video} + \lambda_a L_{action}, \quad (5) $$
其中 $\lambda_a$ 平衡视觉运动建模与动作解码。
无动作标签视频上的预训练。相同的公式也支持无动作标签视频的预训练。由于 $L_{video}$ 仅依赖于 RGB 帧和提取的光流,因此双流视频生成器可以在任何视频语料库上进行训练,包括没有机器人动作标签的以人为中心的操控视频。因此,我们采用两阶段配方:(i) 仅视频阶段,仅在 $L_{video}$ 下更新双流 DiT;(ii) 在机器人演示上的联合阶段,附加动作专家并优化完整的标注数据目标。这将视觉运动建模与特定具身动作解码解耦,使得从人类视频中学习到的运动先验能够转移到机器人控制中,而无需改变流表示。
4 实验
FlowWAM 的核心主张是,光流可以作为策略推理和世界建模的统一动作表示。为了评估这一主张在实践中是否成立,我们围绕三个具体属性设计实验:
- 用于控制的可解码性:预测的光流可以被动作专家解码为可靠的机器人动作,而不仅仅是匹配视觉运动模式。
- 通过无动作标签视频预训练实现的可扩展性:从无动作标签的以人为中心的视频提取的光流,将可重用的运动先验转移到下游策略学习中。
- 用于世界建模的可靠性:密集的光流条件提供了一个逐像素的运动场,紧密引导视频生成以遵循请求的动作轨迹。
我们在 RoboTwin 2.0(第 4.1 节)上测试前两个属性,在 WorldArena(第 4.2 节)上测试第三个属性,并额外验证相同的表示是否转移到现实世界的单臂和双臂机器人平台(第 4.3 节)。第 4.4 节随后调查了这些属性背后的设计选择,并通过逐任务光流误差定量验证了可解码性。
6
第 7 页
表 2:WorldArena 上的主要结果。每列中的最佳和次佳结果已标记。Cond. 列列出了每种方法的动作条件信号。我们优先与提供开源实现或技术报告的模型进行比较,以确保方法论的透明度。
| Method | Cond. | JEPA ↑ | Subj. Acc. ↑ | Bg. Acc. ↑ | Traj. Cons. ↑ | Depth Acc. ↑ | Sem. Acc. ↑ | Align. ↑ | EWMScore | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | General video foundation models | | | | | | | | | | | CogVideoX [35] | Text | 94.84 | 80.97 | 88.38 | 34.79 | 91.09 | 89.70 | | 58.79 | | Veo 3.1 [36] | Text | 57.97 | 75.82 | 91.67 | 11.36 | 74.27 | 83.79 | | 57.77 | | Wan 2.6 [37] | Text | 72.57 | 73.15 | 84.29 | 12.18 | 75.43 | 88.09 | | 59.80 | | Cosmos-Predict 2.5 (text) [38] | Text | 46.69 | 66.19 | 73.98 | 11.60 | 70.71 | 86.34 | | 53.06 | | ABot-PhysWorld (text) [39] | Text | 90.36 | 80.56 | 89.02 | 31.50 | 71.99 | 89.58 | | 62.63 | | Action-conditioned robot world models | | | | | | | | | | | Cosmos-Predict 2.5 (action) [38] | Action | 90.65 | 67.24 | 72.72 | 27.49 | 90.35 | 89.86 | | 54.29 | | IRASim [40] | Action | 93.72 | 72.82 | 78.69 | 35.92 | 93.50 | 89.43 | | 56.15 | | Ctrl-World [41] | Action | 92.77 | 83.56 | 90.30 | 48.20 | 93.25 | 88.68 | | 59.98 | | Vidar [42] | Img-Act | 61.10 | 70.37 | 78.24 | 21.26 | 79.77 | 88.46 | | 51.97 | | Genie Envisioner [43] | Img-Act | 33.81 | 74.53 | 87.54 | 2.63 | 86.83 | 85.98 | | 41.37 | | GigaWorld-1 [44] | Img-Act | 96.77 | 80.97 | 86.43 | 54.27 | 98.44 | 89.42 | | 62.34 | | FlowWAM (Ours) | Flow | 97.14 | 82.46 | 89.97 | 64.26 | 98.97 | 89.93 | | 63.71 |
4.1 操作策略
设置。我们在 RoboTwin 2.0 [20] 上评估操作策略,该基准在固定布局和光照的 Clean 设置下提供 50 个双臂任务,以及在物体姿态、干扰项、光照和背景随机化的 Random 设置下提供任务。模型在 Clean 设置下的 50 个演示和 Random 设置下的 500 个演示(合并)上进行训练,我们报告每个任务在 100 次 rollout 中的成功率。
我们将 FlowWAM 与直接动作 VLA 策略($\pi_{0.5}$ [9], X-VLA [31])以及将视频预测与动作解码相结合的统一世界动作模型(Motus [4], GigaWorld-Policy [32], X-WAM [33], Fast-WAM [8])进行比较。为了确保公平比较,所有 WAM 基线均使用其在大规模视频或无动作标签数据上的各自预训练协议进行评估。FlowWAM 报告了有无在 EgoDex [34] 上进行无动作标签的自车视频预训练的结果。表 1 显示了一个代表性子集,每个任务的详细分解见附录表 4。
结果。如表 1 所示,FlowWAM 在 Clean 设置下达到 92.94% 的成功率,在 Random 设置下达到 92.14% 的成功率,在两种设置下均领先于 VLA 和 WAM 基线。这一优势与使用流作为视频原生动作流是一致的。密集的图像空间位移场为动作专家提供了比离散动作令牌更明确运动计划,并且能够可靠地解码为关节动作,而不仅仅是改善视频预测。
这也支持了可扩展性。在无动作标签的人类第一人称视频上进行预训练进一步提升了 FlowWAM 的性能,且在 Random 设置下的提升明显大于 Clean 设置。这与预期一致,即随机化场景最能从视频生成器积累的视觉鲁棒性中受益。同一张表还显示,即使没有自车视频预训练,FlowWAM 也已经超越了 VLA 基线,表明流本身贡献了大部分增益,而预训练起到了放大器的作用。这种模式表明,策略收益来自于在动作解码之前暴露预测运动作为密集流计划,而不是仅依赖直接的低层动作预测。
4.2 动作条件世界建模
设置。我们在 WorldArena [21] 上评估动作条件世界建模,这是一个统一的基准,在 24 fps 的 121 帧 rollout 上联合评分视频感知质量和动作可靠性。每个 episode 提供初始帧、语言指令以及记录的关节动作轨迹,模型必须从中合成未来视频。我们报告了六个代表性指标以及整体的 EWMScore,完整的 16 项指标分解见附录表 5。
两类基线涵盖了主导范式。通用视频和基础世界模型(CogVideoX [35], Veo 3.1 [36], Wan 2.6 [37], Cosmos-Predict 2.5 [38], ABot-PhysWorld [39])测试仅靠大规模视觉先验是否足以实现具身预测。动作条件机器人世界模型涵盖了数值动作条件(IRASim [40], Ctrl-World [41])以及
7
第 8 页
图 3:单臂和双臂操作任务中的真实世界成功率。
图像空间动作条件(Genie Envisioner [43]、GigaWorld-1 [44]、Vidar [42]),这些方法旨在处理操作动力学,但未采用流作为条件信号。
结果。如表 2 所示,FlowWAM 在 EWMScore 上取得了最佳的总体得分 63.71。可靠性的诊断轴是轨迹准确性(Trajectory Accuracy),该指标衡量生成的 rollout 遵循给定动作的忠实程度。文本条件和数值动作条件的基线在此列中得分较低,图像空间动作带来了部分改进,而 FlowWAM 给出了最强的结果。这种可靠性的提升并未以牺牲视觉质量为代价。FlowWAM 在主体一致性和背景一致性方面与最佳基线保持接近,而在轨迹准确性方面领先第二名近十分。FlowWAM 还在深度准确性(Depth Accuracy)上位居榜首,这与密集流为生成器提供逐像素运动场以进行去噪相一致。
表 2 中的分组基线揭示了一种表示层面的模式。文本、数值动作和图像动作线索可以保留外观,但它们使轨迹控制变得定义不足。流条件则提供了密集的视觉运动场,这解释了为什么 FlowWAM 的最大优势出现在轨迹准确性上,而非仅涉及外观的指标上。
4.3 真实世界操作
设置。我们进一步在真实世界机器人平台上评估 FlowWAM,以测试基于流的动作表示是否能在模拟基准之外进行迁移。该套件包含跨越两个平台的七个任务。单臂 Franka 组(叠碗、放入抽屉、放入盘子、放置两个杯子)强调空间精度和物体接触,而双臂 ARX 组(折叠毛巾、叠碗、清洁盘子) additionally 需要双手协调和更长时间跨度的运动。对于每个任务,所有方法均在相同的 100 次遥操作演示上进行训练,并在具有随机物体姿态的 10 次试验中进行评估,其中 π0.5 [9] 和 Motus [4] 作为基线。
结果。图 3 显示,FlowWAM 在每个任务上都达到了最高的成功率,在整个套件中平均为 75.7%。两个基线 π0.5 和 Motus 的平均得分分别为 61.4% 和 57.1%,且相对于 FlowWAM 的性能差距在双臂任务上大于单臂任务,因为双手协调和更长的时间跨度对底层动作表示提出了更高的要求。这表明,当成功取决于协调多个机器人部件时,流特别有用,因为流直接在图像空间中表示耦合的臂运动,而不仅仅是通过低维关节状态。附录 F.2(图 9)中的定性 rollout 进一步可视化了预测的流计划如何在两个平台上与机器人轨迹对齐。
4.4 分析
消融研究。图 4 的面板 (a) 和 (b) 对模型两侧的设计选择进行了消融。在策略侧(面板 a),用数值动作向量替换流会导致成功率降至 69.8%,而用原始 (u, v) 张量替换 RGB 流则破坏了预训练 VAE 和 DiT 所期望的输入格式(公式 1)。这两个结果都证实,流通道本身(而非通用视觉条件)缩小了动作与视频之间的差距。移除运动感知重加权(公式 4)会导致静态背景主导 Lflow,而在推理时,在不使用随机潜在条件(公式 2)的情况下训练动作专家,会使其对生成潜在变量的残差去噪误差变得脆弱。
1 由于官方 WorldArena 评估要求远程提交且缺乏用于本地评分的真实视频(GT),我们使用自定义验证集进行消融,导致与表 2 中的结果存在差异。
8
第 9 页
(a) 策略模式 (RoboTwin)。 (b) 世界模式 (WorldArena)。 (c) 流质量与成功率。 变体 成功率 (%) 条件输入 EWMScore 1.25 Pearson r = 0.81 数值动作 69.8 仅文本 49.31 (像素)1.00 原始 (u, v) 光流 72.3 数值动作 54.18 误差0.75 无光流损失重加权 83.9 光流动作 (u, v) 56.72 光流0.50 无随机动作专家条件 82.1 图像动作 (掩码) 57.84 FlowWAM (完整) 89.8 FlowWAM (完整) 65.231 0.25 50 60 70 80 90 100 成功率 (%) 图 4:消融实验与光流可解码性。(a) RoboTwin 上的策略侧设计选择。(b) WorldArena 上的动作条件变体。(c) RoboTwin 上的光流误差与策略成功率。
操作策略
世界模型
图 5:FlowWAM 在策略和世界模型模式下的定性可视化。
在世界模型侧(图 b),保持视频生成器固定,仅改变条件输入,显示出与我们的动机相同的模式:仅文本条件导致运动描述不足,数值动作提供了视觉空间之外的机器人状态,原始 (u, v) 张量携带密集位移,但不符合预训练视频生成器期望的图像格式,而图像空间掩码主要是静态的空间线索,指示动作发生的位置,但未编码跨帧的运动方向或大小。只有完整的 RGB 光流将逐像素运动与视频原生表示相结合,将 EWMScore 从 49.31 提升至 65.23。这两个面板共同表明,光流在模型的两端都是必需的:在动作侧作为可解码的目标,在生成侧作为空间对齐的条件信号。
光流可解码性。FlowWAM 的一个核心前提是可解码性:预测的光流应与图像空间运动匹配,并提供恢复正确机器人动作所需的信息。我们通过将光流预测质量与任务成功率相关联来测试这一点,而不是将所有策略增益归因于下游解码器。图 4 的 (c) 部分分析了所有 50 个 RoboTwin 任务。对于每个任务,我们绘制了 FlowWAM 预测的光流与从 RAFT 提取的伪真实光流(基于每个任务新生成的 50 个演示集计算得出)之间的误差,以及相应的策略成功率。预测光流误差较低的任务始终获得较高的成功率,皮尔逊相关系数为 r = -0.81。因此,策略增益跟踪的是光流预测本身的改进,而非不相关的解码器捷径,这为可解码性提供了直接的定量证据。
定性结果。图 5 展示了 FlowWAM 在两种操作模式下的可视化。在策略模式下,预测的光流集中在沿连贯的目标导向轨迹移动的机器人本体上,而 RGB 流保留了周围物体的上下文。解码此机器人运动计划可在随机放置的物体和背景下实现成功的任务完成。在世界
第 10 页
模型模式下,生成的轨迹遵循条件光流所规定的运动,而物体身份和静态背景在帧间保持稳定。附录 F 提供了在更多 RoboTwin 任务(Clean 和 Random 场景,见图 7 和图 8)以及更多世界模型示例(图 10)上的额外轨迹生成结果。
5 结论
在本文中,我们介绍了 FlowWAM,它将光流确立为世界动作模型(WAMs)的统一动作表示。通过将机器人运动编码为密集光流视频,我们弥合了可执行控制与预训练视频先验之间的模态差距。这种统一的表示使得同一模型能够生成用于策略解码的光流、基于光流进行世界建模,并从无动作标签的第一人称视频中进行学习。实验表明,这种统一的动作表示通过保留密集的跨帧运动同时保持可解码为机器人动作的能力,从而改善了控制和世界建模。未来的工作包括将无动作预训练扩展到互联网规模的数据集,并将基于光流的规划扩展到更长的时间范围。
参考文献
[1] Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, 等. World action models are zero-shot policies. arXiv preprint arXiv:2602.15922, 2026.
[2] Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, and Abhishek Gupta. Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets. In Proceedings of Robotics: Science and Systems (RSS), 2025.
[3] Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, and Abhinav Valada. Covar: Co-generation of video and action for robotic manipulation via multi-modal diffusion. arXiv preprint arXiv:2512.16023, 2025.
[4] Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, 等. Motus: A unified latent action world model. arXiv preprint arXiv:2512.13030, 2025.
[5] Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, and Jinwei Gu. Cosmos policy: Fine-tuning video models for visuomotor control and planning. In The Fourteenth International Conference on Learning Representations, 2026.
[6] Jonas Pai, Liam Achenbach, Victoriano Montesinos, Benedek Forrai, Oier Mees, and Elvis Nava. mimic-video: Video-action models for generalizable robot control beyond vlas. arXiv preprint arXiv:2512.15692, 2025.
[7] Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, 等. Causal world modeling for robot control. arXiv preprint arXiv:2601.21998, 2026.
[8] Tianyuan Yuan, Zibin Dong, Yicheng Liu, and Hang Zhao. Fast-wam: Do world action models need test-time future imagination? arXiv preprint arXiv:2603.16666, 2026.
[9] Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 等. π0: A vision-language-action flow model for general robot control. arXiv preprint arXiv:2410.24164, 2024.
[10] Moo Jin Kim, Chelsea Finn, and Percy Liang. Fine-tuning vision-language-action models: Optimizing speed and success. arXiv preprint arXiv:2502.19645, 2025.
[11] Peiyan Li, Yixiang Chen, Hongtao Wu, Xiao Ma, Xiangnan Wu, Yan Huang, Liang Wang, Tao Kong, and Tieniu Tan. BridgeVLA: Input-output alignment for efficient 3d manipulation learning with vision-language models. In The Thirty-ninth Annual Conference on Neural Information Processing Systems, 2026.
[12] Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Se June Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, Lars Liden, Kimin Lee, Jianfeng Gao, Luke Zettlemoyer, Dieter Fox, and Minjoon Seo. Latent action pretraining from videos. In The Thirteenth International Conference on Learning Representations, 2025.
10
第 11 页
[13] Yuxin Jiang, Shengcong Chen, Siyuan Huang, Liliang Chen, Pengfei Zhou, Yue Liao, Xindong He, Chiming Liu, Hongsheng Li, Maoqing Yao, 等. Enerverse-ac: Envisioning embodied environments with action condition. arXiv 预印本 arXiv:2505.09723, 2025.
[14] Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, 等. Bridgev2w: Bridging video generation models to embodied world models via embodiment masks. arXiv 预印本 arXiv:2602.03793, 2026.
[15] Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, 等. Multi-view video diffusion policy: A 3d spatio-temporal-aware video action model. arXiv 预印本 arXiv:2604.03181, 2026.
[16] Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, 等. Robotic vla benefits from joint learning with motion image diffusion. arXiv 预印本 arXiv:2512.18007, 2025.
[17] Zhide Zhong, Haodong Yan, Junfeng Li, Xiangchen Liu, Xin Gong, Tianran Zhang, Wenxuan Song, Jiayi Chen, Xinhu Zheng, Hesheng Wang, 等. Flowvla: Visual chain of thought-based motion reasoning for vision-language-action models. arXiv 预印本 arXiv:2508.18269, 2025.
[18] Mengda Xu, Zhenjia Xu, Yinghao Xu, Cheng Chi, Gordon Wetzstein, Manuela Veloso, and Shuran Song. Flow as the cross-domain manipulation interface. In Conference on Robot Learning, pages 2475–2499. PMLR, 2025.
[19] Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, and Juan Carlos Niebles. Future optical flow prediction improves robot control & video generation. arXiv 预印本 arXiv:2601.10781, 2026.
[20] Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, 等. RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation. arXiv 预印本 arXiv:2506.18088, 2025.
[21] Yu Shang, Zhuohang Li, Yiding Ma, Weikang Su, Xin Jin, Ziyou Wang, Lei Jin, Xin Zhang, Yinzhou Tang, Haisheng Su, 等. WorldArena: A unified benchmark for evaluating perception and functional utility of embodied world models. arXiv 预印本 arXiv:2602.08971, 2026.
[22] Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, and Jianyu Chen. Video prediction policy: A generalist robot policy with predictive visual representations. In International Conference on Machine Learning, pages 24328–24346. PMLR, 2025.
[23] Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, and Jun Zhu. Vidarc: Embodied video diffusion model for closed-loop control. arXiv 预印本 arXiv:2512.17661, 2025.
[24] Bahey Tharwat, Yara Nasser, Ali Abouzeid, and Ian Reid. Latent action pretraining through world modeling. arXiv 预印本 arXiv:2509.18428, 2025.
[25] Yixiang Chen, Peiyan Li, Yan Huang, Jiabing Yang, Kehan Chen, and Liang Wang. Ec-flow: Enabling versatile robotic manipulation from action-unlabeled videos via embodiment-centric flow. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 11958–11968, October 2025.
[26] Chongkai Gao, Haozhuo Zhang, Zhixuan Xu, Cai Zhehao, and Lin Shao. FLIP: Flow-centric generative planning as general-purpose manipulation world model. In The Thirteenth International Conference on Learning Representations, 2025.
[27] Kanchana Ranasinghe, Xiang Li, E-Ro Nguyen, Cristina Mata, Jongwoo Park, and Michael S Ryoo. Pixel motion as universal representation for robot control. arXiv 预印本 arXiv:2505.07817, 2025.
[28] E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe, Xiang Li, and Michael S Ryoo. Pixel motion diffusion is what we need for robot control. arXiv 预印本 arXiv:2509.22652, 2025.
[29] Chuan Wen, Xingyu Lin, John So, Kai Chen, Qi Dou, Yang Gao, and Pieter Abbeel. Any-point trajectory modeling for policy learning. arXiv 预印本 arXiv:2401.00025, 2023.
[30] Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, and Matthew Le. Flow matching for generative modeling. In The Eleventh International Conference on Learning Representations, 2023.
11
第 12 页
[31] Jinliang Zheng, Jianxiong Li, Zhihao Wang, Dongxiu Liu, Xirui Kang, Yuchun Feng, Yinan Zheng, Jiayin Zou, Yilun Chen, Jia Zeng, 等. X-vla: 作为可扩展跨具身视觉-语言-动作模型的软提示 Transformer。arXiv 预印本 arXiv:2510.10274, 2025.
[32] Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jie Li, Jindi Lv, Jingyu Liu, 等. Gigaworld-policy: 一种高效以动作为中心的世界-动作模型。arXiv 预印本 arXiv:2603.17240, 2026.
[33] Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, 和 Huaping Liu. 基于视频先验与异步去噪的统一 4D 世界动作建模。arXiv 预印本 arXiv:2604.26694, 2026.
[34] Ryan Hoque, Peide Huang, David J Yoon, Mouli Sivapurapu, 和 Jian Zhang. Egodex: 从大规模第一人称视频学习中习得灵巧操作。arXiv 预印本 arXiv:2505.11709, 2025.
[35] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, Da Yin, Yuxuan.Zhang, Weihan Wang, Yean Cheng, Bin Xu, Xiaotao Gu, Yuxiao Dong, 和 Jie Tang. Cogvideox: 具有专家 Transformer 的文生视频扩散模型。在 第十三届国际学习表征会议 (The Thirteenth International Conference on Learning Representations), 2025.
[36] Google DeepMind. 介绍 Veo 3.1 及流匹配中的高级能力。https://blog.google/ innovation-and-ai/products/veo-updates-flow/, 2025年10月.
[37] Wan Team, 通义实验室, 阿里巴巴集团. Wan 2.6. https://wan.video/introduction/wan2.6, 2025年12月.
[38] Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, 等. 利用视频基础模型进行物理 AI 的世界模拟。arXiv 预印本 arXiv:2511.00062, 2025.
[39] Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, 等. Abot-physworld: 具有物理对齐的机器人操作交互式世界基础模型。arXiv 预印本 arXiv:2603.23376, 2026.
[40] Fangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, 和 Tao Kong. Irasim: 用于机器人操作的细粒度世界模型。在 IEEE/CVF 国际计算机视觉会议 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 论文集, 第 9834–9844 页, 2025.
[41] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, 和 Chelsea Finn. Ctrl-world: 用于机器人操作的受控生成式世界模型。在 第十四届国际学习表征会议 (The Fourteenth International Conference on Learning Representations), 2026.
[42] Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, 和 Jun Zhu. Vidar: 用于通用操作的具身视频扩散模型。arXiv 预印本 arXiv:2507.12898, 2025.
[43] Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, 等. Genie envisioner: 用于机器人操作的统一世界基础平台。 arXiv 预印本 arXiv:2508.05635, 2025.
[44] GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, 等. Gigaworld-0: 作为数据引擎赋能具身 AI 的世界模型。arXiv 预印本 arXiv:2511.19861, 2025.
[45] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等. Wan: 开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025.
[46] Zachary Teed 和 Jia Deng. Raft: 用于光流的循环全对场变换。在欧洲 计算机视觉会议 (European conference on computer vision) 论文集, 第 402–419 页。Springer, 2020.
[47] Fanbo Xiang, Yuzhe Qin, Kaichun Mo, Yikuan Xia, Hao Zhu, Fangchen Liu, Minghua Liu, Hanxiao Jiang, Yifu Yuan, He Wang, 等. Sapien: 一种基于部件的模拟交互环境。在 IEEE/CVF 计算机视觉与模式识别会议 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 论文集, 第 11097–11107 页, 2020.
[48] Junjie Ke, Qifei Wang, Yilin Wang, Peyman Milanfar, 和 Feng Yang. Musiq: 多尺度图像质量 Transformer。在 IEEE/CVF 国际计算机视觉会议 (Proceedings of the IEEE/CVF international conference on computer vision) 论文集, 第 5148–5157 页, 2021.
12
第 13 页
[49] Adrien Bardes, Quentin Garrido, Jean Ponce, Xinlei Chen, Michael Rabbat, Yann LeCun, Mahmoud Assran, 和 Nicolas Ballas. 重新审视特征预测以从视频中学习视觉表示。 arXiv 预印本 arXiv:2404.08471, 2024.
[50] Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, 等. Sam 3: 使用概念分割万物。arXiv 预印本 arXiv:2511.16719, 2025.
[51] Kevin Zhang, Mohit Sharma, Jacky Liang, 和 Oliver Kroemer. 用于研究的模块化机械臂控制栈:Franka-interface 和 frankapy。arXiv 预印本 arXiv:2011.02398, 2020.
13
第 14 页
A 实现细节与训练流程
本节提供全面的实现细节,以促进第 3.4 节所述训练过程的重现。我们详细阐述了 FlowWAM 的架构组件(第 A.1 节)、两阶段训练策略(第 A.2 节)、数据集构建与预处理(第 A.3 节)、多视图输入配置(第 A.4 节)以及两个阶段的超参数配置(第 A.5 节)。
A.1 架构组件
FlowWAM 通过将运动特定模块集成到预训练的视频生成器中构建而成。基础架构是 Wan2.2-TI2V-5B [45],这是一个拥有 50 亿参数的图像到视频扩散 Transformer (DiT),采用 UMT5-XXL 文本编码器和 Wan2.2 因果 VAE。预训练的 DiT、VAE 和文本编码器架构保持不变。在训练过程中,VAE 和文本编码器保持冻结状态,而 DiT 参数则根据下文详述的特定阶段协议进行更新。
双流生成器包含一条用于 HSV 编码光流的专用路径,同时保持原始视频生成器的能力。光流路径由独立的 patch 嵌入层和输出头组成,两者均从相应的 RGB 层初始化。在 patchification 之后引入了可学习的光流 token 嵌入,以在联合自注意力机制中提供流特定的身份信号。该架构使 RGB 和光流 token 能够共享 Transformer 块和潜在几何结构,同时保持不同的流身份。由于光流帧使用与 RGB 帧相同的 VAE 进行编码,因此使用 RGB 权重初始化光流流提供了兼容的图像潜在先验,与随机初始化相比加速了收敛。
动作专家旨在将视觉-运动潜在变量映射到低级机器人动作。它被实现为一个 AdaLN 扩散 Transformer,拥有约 7.8 亿参数,由 30 层组成(与 Wan2.2 视频 DiT 的深度相匹配),隐藏维度为 1024,16 个注意力头,以及 4096 的 FFN 维度。每个块集成了对动作 token 的自注意力、对拼接的 RGB 和光流视觉特征的双注意力,以及对 T5 指令 token 的双注意力。这些视觉特征并非来自 VAE 潜在变量的 patchification,而是双流视频 DiT 的逐层隐藏状态:每个动作专家块对从其配对的视频 DiT 层读取的拼接 RGB 和光流特征进行双注意力计算。本体感知 token 由归一化的 14D 关节位置 (qpos) 派生,投影到指令嵌入维度并附加到 T5 指令上下文中,使预测的动作块既依赖于生成的运动计划,也依赖于机器人的初始状态。预测头直接预测动作块的流匹配速度,该速度在推理时由流匹配采样器进行积分。
A.2 两阶段训练策略
训练流程分为两个阶段,以解耦通用运动表示学习与具身特定的动作解码。两个阶段均利用 RGB-光流表示和流匹配目标,尽管它们在监督信号、数据源和可训练参数方面有所不同。
阶段 1:无动作运动预训练。阶段 1 涉及在 EgoDex [34] 上预训练双流视频生成器,这是一个包含无机器人动作标签的以人为中心的操纵视频数据集。该阶段侧重于使用 RGB 帧和提取的光流来学习以操纵为中心的运动先验。仅优化视频损失 L_video,学习率为 5×10−5,更新仅限于双流 DiT。
阶段 2:联合具身训练。阶段 2 从阶段 1 的检查点初始化视频生成器,集成动作专家,并在 RoboTwin 2.0 上优化联合目标(公式 5)。来自头部、左手腕和右手腕摄像头的输入流被平铺为 320×384 配置(见第 A.4 节)。每个块生成 T_pixel = 9 个像素帧的 rollout,从中解码出 32 步的动作块(像素帧之间的时间步长为 4)。训练使用 1×10−4 的学习率,损失权重 λ_f = 0.1 和 λ_a = 1.0,以及运动感知重加权强度 α = 2.0。可训练参数包括完整的 DiT、光流流和动作专家。
14
第 15 页
A.3 数据集构建与预处理
RoboTwin 演示数据。在具身训练中,我们在 50 个双臂操作任务上使用 RoboTwin 2.0。每个任务包含一个 Clean 划分,其中有 50 个演示,场景配置为标准配置;以及一个 Random 划分,其中有 500 个演示,物体姿态、干扰物、光照和背景均经过随机化。在第二阶段训练中同时使用这两个划分,以便动作专家既能观察到标准的操作轨迹,也能看到视觉上多样的场景布局。在评估时,遵循基准协议,在每个设置下针对每个任务计算 100 次 rollout 的成功率。
EgoDex 片段采样。对于无动作预训练,我们使用 EgoDex 作为无标签的第一人称操作视频源。由于 EgoDex 不提供机器人动作,因此仅用于 RGB-流视频目标。我们不应用额外的任务级过滤。视频从 30 fps 时间下采样至 15 fps,并调整大小至 320 × 256,以匹配 RoboTwin 头摄像机的宽高比。在训练期间,从帧桶 {17, 33, 49, 65, 81} 中采样片段,使模型既能看到短期的局部运动,也能看到较长的操作轨迹。
光流提取。我们使用 RAFT [46] 对 EgoDex 和 RoboTwin 预处理提取光流。对于 EgoDex,光流直接计算于相邻视频帧之间。对于 RoboTwin,我们通过使用机器人 URDF 在 SAPIEN [47] 中回放记录的机器人关节动作,并将移动的主体渲染到静态背景上,构建仅机器人的光流目标。然后对相邻的仅机器人帧应用 RAFT。这从光流目标中消除了背景、光照和物体运动伪影,为机器人引起的运动提供更干净的监督信号。
HSV 编码与幅度归一化。数值光流场使用公式 1 转换为 HSV 图像,其中色调表示方向,饱和度表示幅度。我们在归一化前使用 25 px 的幅度上限,以防止大位移使颜色编码饱和。小于 0.5 px 的位移被阈值化为零,以抑制近乎静态区域中的光流噪声。
多视图光流目标。对于第二阶段 RoboTwin 训练,来自头摄像机、左手腕和右手腕摄像机的 RGB 观测值被拼接成 T 形输入布局。光流监督提供于头摄像机区域,其中仅机器人回放提供了主体运动的稳定全局视图。手腕光流区域填充为常数占位符,因为我们的预处理流程中不可用仅手腕视角的机器人光流。这使拼接的光流输入格式与 RGB 输入保持一致,同时避免手腕摄像机出现噪声或不一致的伪标签。
A.4 输入表示与光流编码
多视图 T 形拼接。为了在不使用专用编码器的情况下处理多视图输入,我们将头摄像机和手腕摄像机视图拼接为单帧。遵循 T 形布局,头视图以其原生分辨率(320 × 256)占据顶部区域,而左手和右手腕视图则经过下采样并拼接在其下方。生成的 320 × 384 拼接图与冻结的 VAE 和视频生成器补丁嵌入兼容,保持了单视图和多视图场景之间的架构一致性。
光流场生成。光流流旨在捕捉机器人引起的运动。提取流程遵循 A.3 节:EgoDex 光流从相邻 RGB 帧计算,而 RoboTwin 光流从仅机器人回放视频计算,以隔离主体运动。对于多视图拼接图,头摄像机光流占据头区域,手腕区域使用上述常数占位符。
HSV 编码与归一化。数值光流场转换为 HSV 图像(公式 1),将方向映射为色调,幅度映射为饱和度。我们采用 A.3 节中描述的 25 px 幅度上限。
15
第 16 页
A.5 超参数汇总
表 3 总结了两个训练阶段中使用的架构、数据、优化和数值设置。所有训练均在四个节点上的 32 块 NVIDIA H100 GPU 上进行。
表 3:FlowWAM 两个训练阶段的超参数。
| 超参数 | 值 | | :— | :— | | 视频生成器 | | | 基础模型 | Wan2.2-TI2V-5B | | VAE / 文本编码器 | Wan2.2 VAE / UMT5-XXL(冻结,bf16) | | 流流初始化 | patch embedding 和 head 的深度复制 | | 动作专家 | | | 层数 / 隐藏层维度 / 头数 / FFN 维度 | 30 / 1024 / 16 / 4096 | | 参数量 | ∼780M | | 动作维度 | 14 | | 输入(RoboTwin,第 2 阶段) | | | 每摄像头分辨率 | 320 × 256 | | T 形分块分辨率 | 320 × 384 | | 像素帧数 / 动作步数 | 9 / 32 | | 输入(EgoDex,第 1 阶段) | | | 分辨率 | 320 × 256 | | 帧桶 | {17, 33, 49, 65, 81} | | 有效帧率 | 15(从 30 fps 步长为 2) | | 流匹配 | | | 估计器 | RAFT | | 幅度上限 | 25 px | | 噪声阈值 | 0.5 px | | 优化 | | | 优化器 | AdamW(权重衰减 10−2) | | 学习率(第 1 阶段 / 第 2 阶段) | 5×10−5 / 1×10−4 | | 每 GPU 批次大小(第 1 阶段 / 第 2 阶段) | 1 / 16 | | 损失与调度 | | | 流权重 λf | 0.1 | | 动作权重 λa(第 2 阶段) | 1.0 | | 运动增强 α(第 2 阶段) | 2.0 | | 参考增强强度 | 0.1 | | 推理(RoboTwin 评估) | | | 视频 / 动作去噪步数 | 25 / 50 | | 执行与重规划窗口 | 25 |
B 基线详情
本节提供了我们在模拟操作和世界建模实验中评估的基线模型的技术描述。对于真实世界评估,我们遵循第 4.3 节和附录 E 中详述的实验协议,以 π0.5 和 Motus 作为基准。
B.1 操作策略基线
- π0.5 [9] 是一个视觉-语言-动作(VLA)基础模型,它从预训练的 VLM 骨干网络继承了互联网规模的语义知识。它采用流匹配动作专家来生成连续的动作块,从而实现高频(50 Hz)控制以应对复杂的操作任务。我们将其作为强大的直接动作策略基线纳入比较:它从视觉-语言观测中预测低级动作,而不显式生成中间的视频原生运动计划。
- X-VLA [31] 通过软提示机制解决跨具身异构性问题。它在流匹配 Transformer 架构中为不同的硬件配置引入了可学习的嵌入,促进了在多样化、多机器人数据集上的稳定预训练。该基线测试了具身感知提示和直接动作预测是否能够匹代表示动作作为密集图像空间运动所带来的优势。
16
第 17 页
• Motus [4] 提出了一种利用混合Transformer(MoT)架构的统一潜在动作世界模型。它利用基于光流的潜在动作来桥接视觉动态与控制信号,使得动作专家能够在大规模无标签视频数据上进行预训练。Motus 是与 FlowWAM 最接近的策略侧对比方法,因为两者都利用了无标签视频和运动线索,但 Motus 将动作表示在学习的潜在动作空间中,而不是生成显式的光流视频流。
• GigaWorld-Policy [32] 是一种以动作为中心的世界-动作模型,学习联合像素-动作动态。通过利用防止未来视频token影响动作token的因果设计,它在推理时实现了高效的动作解码,同时在训练期间保持了辅助视频生成监督。我们将其纳入以与一种WAM风格的策略进行对比,该策略使用视频预测作为辅助监督,但不将密集光流作为预测和动作解码之间的共享接口。
• X-WAM [33] 是一种统一的4D世界-动作模型,从预训练的视频先验中联合预测未来的多视角RGB-D视频和机器人动作。它通过一个轻量级的深度适应分支增强视频生成器以进行空间重建,并采用异步噪声调度,在少数去噪步骤中解码动作,同时将全部步骤预算分配给视频。我们将其作为强大的空间感知WAM基线纳入,该基线以数值投影的动作/状态潜在变量为条件,而不是将运动作为密集图像空间光流流暴露出来。
• Fast-WAM [8] 是一种世界-动作模型,它在训练期间保留视频联合训练,但在测试时跳过显式的未来想象,直接解码动作以实现实时控制。它是隔离视频先验作用的一个紧密对比:与 FlowWAM 一样,它受益于视频建模,但它用数值token表示动作并放弃显式生成的运动计划,而 FlowWAM 从联合生成的光流流中解码动作。
B.2 世界建模基线
通用视频与基础世界模型。这些基线评估大规模生成先验在建模具身动态方面的能力,无需显式动作条件或仅使用高级文本引导。
• CogVideoX [35] 是一种基于扩散Transformer的视频生成器,利用3D因果VAE和具有自适应LayerNorm的专家Transformer架构,生成时间一致的高分辨率视频。它代表了开放视频生成基线家族,其中具身回放是从视觉和文本上下文中生成的,无需显式的低级机器人动作条件。
• Veo 3.1 [36] 是一种最先进的视频生成器,强调细粒度的叙事控制和增强的真实感。在我们的实验中,它作为高保真文本到视频基线。它的纳入旨在探究非常强大的通用视频先验是否能够弥补机器人操作场景中密集动作条件运动指导的缺失。
• Wan 2.6 [37] 是一种用于电影叙事的多模态视频基础模型,支持多镜头叙事和精确的音画同步。由于 FlowWAM 建立在 Wan 视频生成家族之上,该基线有助于分离预训练视频先验的贡献与额外的光流条件动作表示的贡献。
• Cosmos-Predict 2.5 [38] 是 NVIDIA 的物理AI世界基础模型。它在单一基于流的框架内统一了文本、图像和视频到世界的生成,支持多视角输出和长视界模拟。我们将其作为专为具身预测设计的广泛物理世界先验进行评估,尽管它在低级操作动作的表示和注入方式上与 FlowWAM 不同。
• ABot-PhysWorld [39] 是一个14B参数的扩散Transformer模型,结合了物理感知注释和基于DPO的后训练,以抑制生成操作序列中的非物理行为(例如物体穿透)。它被纳入作为一个强大的物理感知基础基线,测试仅针对物理合理性的后训练是否足以实现轨迹准确的动作跟随。
动作条件机器人世界模型。这些模型明确将低级机器人动作或图像空间动作线索作为未来预测的条件信号纳入。
• IRASim [40] 是一个轨迹到视频的世界模型,它在每个Transformer块中引入了一个帧级动作条件模块,以加强动作与
第 18 页
预测帧以及细粒度的机器人-物体交互。它与数值动作条件化(numerical-action conditioning)提供了直接对比,后者将机器人状态/动作向量直接注入视频生成器,而不是先将其转换为图像空间运动。
- Ctrl-World [41] 是一个面向策略闭环(policy-in-the-loop) rollout 的可控多视角世界模型。它通过基于位姿的记忆检索机制和帧级动作条件化来维持长视距的一致性。该基线测试了显式记忆和位姿条件化是否能在长操作 rollout 中提供与密集光流条件化相当的稳定性。
- Vidar [42] 是一个两阶段双臂操作框架,它将通用视频扩散模型与掩码逆动力学模型(MIDM)耦合,以从生成的轨迹中提取与动作相关的信息。它与我们的设定相关,因为它也将视频生成与双臂动作推理联系起来,但它依赖于下游的逆动力学模块,而不是使用光流作为未来预测的条件信号。
- Genie Envisioner [43] 是一个统一平台,集成了指令条件化的视频生成、神经模拟和策略学习。它采用轻量级并行流匹配解码器将视觉潜在变量映射到电机命令。我们将其作为对比对象,因为它是一个代表性的端到端具身世界建模系统,耦合了视觉预测和控制,但没有显式地强制光流作为共享的动作接口。
- GigaWorld-1 [44] 作为一个世界模型数据引擎。它为数据驱动的稳健世界建模提供了强有力的对比,其中稳健性是通过场景级重建和合成数据生成获得的,而不是通过密集的逐像素光流轨迹获得的。
C 额外的 RoboTwin 结果
表 4 报告了与表 1 中紧凑的主文本对比相对应的完整 RoboTwin 2.0 策略任务成功率。
D WorldArena 评估细节
本节提供 WorldArena 评估协议的详细描述,包括指标定义以及用于评估视觉保真度、物理一致性和可控性的分组策略。
D.1 指标分组与聚合评分
WorldArena 基准包含 16 个指标,归一化到 [0, 100] 的尺度,数值越高表示性能越优。EWMScore 定义为这 16 个指标的算术平均值。所有指标的详细结果见表 5。
这些指标被组织成六个功能组:
- 视觉质量:帧级真实感和特征相似性(IQ, AQ, JEPA)。
- 运动质量:运动的存在和时间平滑度(DD, FS, MS)。
- 内容一致性:主体、背景和光度属性的稳定性(SC, BC, PC)。
- 物理遵循:交互合理性和轨迹准确性(IntQ, TA)。
- 3D 准确性:深度一致性和透视性(DA, Per)。
- 可控性:与指令的一致性以及动作条件化的变化(InsF, SA, AcF)。
D.2 指标定义与实现
我们遵循官方的 WorldArena 指标定义 [21]。在计算 EWMScore 之前,每个原始指标都被归一化到共同的评分范围,因此以下描述侧重于每个指标测量的内容以及 WorldArena 使用的主要评估器。
视觉质量。
18
第 19 页
表 4:在 Clean 和 Random 场景下,RoboTwin 2.0 各任务策略的完整成功率。 加粗数字表示每行中的最佳结果。FlowWAM 报告了带有(w/ PT)和不带有(w/o PT)大规模预训练(PT)的结果。
GigaWorld FlowWAM FlowWAM Simulation Task π0.5 X-VLA Motus X-WAM Fast-WAM Policy w/o PT w/ PT Clean Rand. Clean Rand. Clean Rand. Clean Rand. Clean Rand. Clean Rand. Clean Rand. Clean Rand.
Adjust Bottle 79% 83% 100% 99% 89% 93% 100% 100% 100% 99% 100% 100% 88% 98% 99% 100% Beat Block Hammer 63% 50% 92% 88% 95% 88% 86% 86% 98% 96% 99% 97% 75% 75% 99% 100% Blocks Ranking Rgb 43% 35% 83% 83% 99% 97% 92% 96% 99% 95% 100% 100% 91% 99% 99% 100% Blocks Ranking Size 8% 14% 67% 74% 75% 63% 44% 48% 76% 82% 94% 98% 68% 65% 82% 94% Click Alarmclock 97% 93% 99% 99% 100% 100% 100% 100% 98% 99% 100% 100% 100% 99% 98% 100% Click Bell 75% 76% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 95% 85% Dump Bin Bigbin 30% 42% 79% 77% 95% 91% 92% 100% 90% 96% 97% 96% 89% 96% 96% 98% Grab Roller 90% 89% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 100% 99% Handover Block 18% 19% 73% 37% 86% 73% 80% 80% 88% 79% 95% 81% 67% 52% 96% 78% Handover Mic 28% 18% 0% 0% 78% 63% 72% 72% 88% 89% 99% 100% 89% 70% 99% 99% Hanging Mug 3% 3% 23% 27% 38% 38% 16% 12% 46% 55% 58% 62% 50% 50% 65% 68% Lift Pot 0% 0% 99% 100% 96% 99% 98% 98% 100% 99% 100% 100% 96% 98% 98% 100% Move Can Pot 29% 27% 89% 86% 34% 74% 76% 78% 80% 84% 90% 88% 62% 60% 96% 97% Move Pillbottle Pad 33% 29% 73% 71% 93% 96% 90% 90% 96% 98% 100% 99% 82% 79% 100% 98% Move Playingcard 59% 67% 93% 98% 100% 96% 78% 72% 100% 98% 100% 100% 71% 71% 100% 99% Away Move Stapler Pad 16% 18% 78% 73% 83% 85% 92% 82% 67% 70% 77% 64% 60% 55% 89% 83% Open Laptop 19% 35% 93% 100% 95% 91% 96% 98% 96% 97% 98% 100% 91% 98% 99% 99% Open Microwave 35% 37% 79% 71% 95% 91% 74% 66% 89% 92% 62% 45% 67% 68% 67% 72% Pick Diverse Bottles 5% 3% 58% 36% 90% 91% 82% 70% 91% 92% 80% 85% 68% 68% 90% 91% Pick Dual Bottles 10% 6% 47% 36% 96% 90% 86% 86% 99% 100% 100% 96% 75% 91% 100% 99% Place A2b Left 62% 60% 48% 49% 88% 79% 94% 88% 90% 87% 95% 93% 89% 82% 94% 93% Place A2b Right 62% 57% 36% 36% 91% 87% 90% 92% 92% 89% 93% 99% 82% 86% 99% 96% Place Bread Basket 48% 56% 81% 71% 91% 94% 82% 82% 90% 91% 91% 93% 89% 77% 96% 97% Place Bread Skillet 38% 46% 77% 67% 86% 83% 94% 90% 90% 96% 90% 93% 92% 83% 93% 89% Place Burger Fries 66% 70% 94% 94% 98% 98% 98% 96% 97% 99% 96% 99% 100% 91% 99% 99% Place Can Basket 19% 25% 49% 52% 81% 76% 78% 74% 84% 82% 71% 69% 70% 74% 63% 56% Place Cans Plasticbox 40% 47% 97% 98% 98% 94% 100% 100% 99% 98% 99% 96% 96% 92% 99% 96% Place Container Plate 71% 78% 97% 95% 98% 99% 98% 96% 98% 100% 96% 100% 98% 97% 98% 98% Place Dual Shoes 12% 7% 79% 88% 93% 87% 96% 84% 83% 81% 94% 88% 75% 73% 82% 77% Place Empty Cup 75% 86% 100% 98% 99% 98% 90% 90% 98% 99% 100% 100% 92% 93% 100% 100% Place Fan 25% 36% 80% 75% 91% 87% 92% 94% 84% 92% 96% 96% 83% 71% 94% 94% Place Mouse Pad 21% 26% 70% 70% 66% 68% 88% 90% 84% 86% 83% 89% 68% 68% 96% 94% Place Object Basket 43% 36% 44% 39% 81% 87% 90% 92% 85% 87% 89% 88% 89% 90% 82% 83% Place Object Scale 40% 49% 52% 74% 88% 85% 88% 80% 93% 89% 90% 97% 86% 90% 95% 93% Place Object Stand 74% 65% 86% 88% 98% 97% 100% 98% 97% 96% 90% 94% 88% 93% 90% 94% Place Phone Stand 49% 53% 88% 87% 87% 86% 82% 72% 75% 80% 97% 99% 56% 63% 96% 96% Place Shoe 57% 61% 96% 95% 99% 97% 98% 96% 97% 99% 96% 99% 93% 89% 99% 100% Press Stapler 80% 70% 92% 98% 93% 98% 96% 96% 94% 90% 90% 97% 100% 98% 88% 90% Put Bottles Dustbin 12% 9% 74% 77% 81% 79% 72% 70% 85% 95% 95% 90% 63% 59% 96% 94% Put Object Cabinet 24% 15% 46% 48% 88% 71% 74% 74% 66% 76% 94% 89% 84% 85% 92% 86% Rotate Qrcode 47% 56% 34% 33% 89% 73% 90% 84% 84% 83% 93% 89% 76% 73% 88% 91% Scan Object 42% 38% 14% 36% 67% 66% 60% 64% 86% 79% 89% 92% 60% 50% 92% 94% Shake Bottle 96% 100% 100% 100% 100% 98% 100% 98% 100% 99% 100% 100% 100% 98% 98% 97% Horizontally Shake Bottle 91% 100% 99% 100% 100% 97% 100% 100% 99% 99% 100% 100% 100% 100% 99% 97% Stack Blocks Three 15% 16% 6% 10% 91% 95% 70% 78% 97% 95% 95% 97% 85% 63% 99% 95% Stack Blocks Two 48% 56% 92% 87% 100% 98% 100% 94% 100% 100% 100% 100% 95% 93% 100% 100% Stack Bowls Three 33% 35% 76% 86% 79% 87% 70% 72% 88% 82% 80% 81% 75% 79% 81% 83% Stack Bowls Two 78% 66% 96% 93% 98% 98% 96% 92% 98% 98% 92% 98% 100% 91% 95% 95% Stamp Seal 36% 23% 76% 82% 93% 92% 96% 98% 93% 95% 90% 94% 74% 81% 94% 96% Turn Switch 5% 6% 40% 61% 84% 78% 82% 84% 61% 72% 61% 59% 73% 66% 83% 75%
Average (%) 42.98 43.84 72.88 72.84 88.66 87.02 86.36 85.04 89.76 90.68 91.88 91.78 82.40 80.80 92.94 92.14
• IQ(图像质量)使用 MUSIQ [48] 评估单帧的技术质量。它针对模糊、过曝、传感器噪声和压缩伪影等无参考失真,并对视频中的每帧质量估计进行平均。 • AQ(美学质量)评估帧是否具有视觉上令人愉悦的光照、色彩构图和感知吸引力。WorldArena 使用 LAION 美学预测器计算此分数,该预测器将每帧映射到美学特征空间并平均预测的帧分数。 • JEPA(JEPA 相似度)衡量生成视频与参考视频之间的高级时空相似度。WorldArena 使用预训练的 V-JEPA 编码器 [49] 提取特征,并使用二阶多项式核计算最大均值差异(MMD)分数,因此较高的值表示生成视频分布更接近真实演示分布。
19
第 20 页
表 5:WorldArena 各项指标结果。所有分数均在 [0, 100] 的尺度上报告。
视觉质量 运动质量 内容一致性 物理 3D 准确性 可控性
方法 IQ AQ JEPA DD FS MS SC BC PC IntQ TA DA Per InsF SA AcF EWMScore
CogVideoX 36.23 36.30 94.84 31.47 21.77 73.30 80.97 88.38 33.79 66.96 34.79 91.09 85.46 75.58 89.70 0.00 58.79 Veo 3.1 65.57 48.79 57.97 14.66 8.26 67.85 75.82 91.67 37.52 81.50 11.36 74.27 99.64 97.14 83.79 8.52 57.77 Wan 2.6 67.36 44.40 72.57 33.63 22.01 82.12 73.15 84.29 34.57 73.16 12.18 75.43 93.94 89.96 88.09 9.92 59.80 Cosmos-Predict 2.5 (text) 65.49 44.33 46.69 21.62 17.55 70.93 66.19 73.98 35.39 65.14 11.60 70.71 98.22 64.70 86.34 10.01 53.06 Cosmos-Predict 2.5 (action) 49.48 34.14 90.65 18.96 9.95 65.66 67.24 72.72 45.21 60.46 27.49 90.35 84.68 60.54 89.86 1.31 54.29 IRASim 41.85 32.86 93.72 21.60 11.66 64.31 72.82 78.69 45.70 62.76 35.92 93.50 84.16 65.40 89.43 3.94 56.15 Vidar 41.75 39.87 61.10 21.05 17.03 79.11 70.37 78.24 20.57 60.84 21.26 79.77 81.88 61.54 88.46 7.86 51.92 Genie Envisioner 28.18 26.39 33.81 32.41 19.91 69.17 74.53 87.54 16.04 22.74 2.63 86.83 54.32 20.36 85.98 1.07 41.37 Ctrl-World 42.44 37.05 92.77 41.82 33.57 77.34 83.56 90.30 12.88 62.62 48.20 93.25 83.66 67.68 88.68 3.90 59.98 ABot-PhysWorld (text) 61.03 41.83 90.36 39.33 29.22 76.48 80.56 89.02 20.52 81.96 31.50 71.99 98.94 92.10 89.58 7.65 62.63 GigaWorld-1 51.18 41.17 96.77 30.52 18.64 68.33 80.97 86.43 28.11 75.10 54.27 98.44 95.60 82.14 89.42 0.28 62.34
FlowWAM (Ours) 48.87 40.83 97.14 30.41 20.47 71.65 82.46 89.97 29.78 73.82 64.26 98.97 94.56 82.76 89.93 3.50 63.71
运动质量。
• DD(动态程度,Dynamic Degree)量化视频中显著运动的强度。WorldArena 估计相邻帧之间的 RAFT [46] 光流,关注前 5% 的活跃像素, 并通过分辨率自适应评分函数映射其平均幅值。 • FS(流评分,Flow Score)衡量整个视频的整体运动强度。它对像素和时间上的密集 RAFT 流幅值进行平均,然后对原始值进行归一化,从而使具有 有意义动态交互的视频获得更高的分数。 • MS(运动平滑度,Motion Smoothness)评估运动下的时间连贯性。WorldArena 使用 视频帧插值模型从相邻帧重建中间帧, 使用 SSIM 将插值结果与真实中间帧进行比较,并根据 运动幅值对分数进行加权,以避免对静态视频过度奖励。
内容一致性。
• SC(主体一致性,Subject Consistency)衡量前景物体和机器人部件在帧间是否保持语义 稳定。它比较当前帧、第一帧和前一帧之间的 DINO 特征相似度,并引入动态程度惩罚,使得近乎静态的视频 无法获得人为的高一致性分数。 • BC(背景一致性,Background Consistency)评估场景背景是否随时间保持稳定。 它使用 CLIP 图像特征将每一帧与第一帧和前一帧进行比较,并 应用相同的动态程度调整,以避免奖励静态或冻结的展开过程。 • PC(光度一致性,Photometric Consistency)评估运动过程中的像素级纹理稳定性。WorldArena 利用光流将帧向前和向后扭曲,计算平均端点重建误差, 并将误差的倒数转换为带有动态程度惩罚的归一化分数。
物理与 3D 准确性。
• IntQ(交互质量,Interaction Quality)衡量机器人-物体交互是否符合合理的物理 行为。WorldArena 使用 Qwen3-VL 作为视觉语言模型(VLM)裁判,对可见接触、力传递、 摩擦、穿透和物体响应进行 1-5 级李克特量表评分,然后进行归一化。 • TA(轨迹准确性,Trajectory Accuracy)量化生成的机器人臂轨迹是否遵循 真实执行轨迹。它使用 SAM3 [50] 提取机器人臂的边界框,在必要时插值 缺失的检测框,并计算生成轨迹与参考轨迹之间的归一化动态时间规整(NDTW) 对齐分数。 • DA(深度准确性,Depth Accuracy)评估生成的展开过程是否保留了场景的空间 几何结构。WorldArena 估计生成帧和参考帧的单目深度,应用 基于中位数的尺度对齐以处理深度尺度歧义,计算绝对相对深度 误差,并反转归一化误差,使得较高的值表示更好的几何结构。 • Per(透视性,Perspectivity)评估超越深度图匹配的 3D 合理性。基于 Qwen3-VL 的 裁判评估透视线索,如随深度变化的尺度变化、遮挡关系、 光照一致性和相机几何稳定性,并在归一化的李克特量表上进行评分。
可控性。
20
第 21 页
• 指令遵循(InsF)评估生成的视频是否遵循了请求的动作类型、目标物体以及最终任务状态。WorldArena 使用 Qwen3-VL 作为视觉语言模型(VLM)裁判,采用归一化的 1–5 分制评分,其评分标准会对失败情况进行惩罚,例如目标物体错误、操作类型错误或出现幻觉的人手替代机械臂。 • 语义对齐(SA)衡量生成视频与参考执行之间的语义一致性。WorldArena 首先使用 Qwen2.5-VL 对两个视频生成结构化描述,然后计算这些描述之间的 CLIP 文本特征相似度。 • 动作遵循(AcF)评估模型是否对不同动作指令做出不同响应,而不是退化为重复的轨迹生成。对于共享的初始帧,WorldArena 生成多个不同的动作指令,从生成的视频中提取全局 CLIP 特征,并对平均成对特征不相似度进行评分。
D.3 WorldArena 上的性能分析
表 5 中的综合指标配置文件显示,FlowWAM 的性能提升主要由需要动作接地预测的指标驱动。具体而言,FlowWAM 在轨迹准确性、深度准确性和语义对齐方面取得了最先进(state-of-the-art)的结果。这些结果表明,流条件(flow conditioning)提供了一种空间对齐的信号,引导视频生成器准确建模物体和机器人的动力学特性,而不仅仅是提升通用的图像美学质量。虽然 FlowWAM 在主体和背景一致性方面保持了具有竞争力的性能,但其核心优势在于生成物理上合理且可靠的运动轨迹的能力。
E 真实世界实验设置
本节提供有关真实世界实验设置的更多细节,包括机器人平台、相机配置以及用于评估的任务套件。
[图注:真实世界实验设置。我们在两个物理平台上评估 FlowWAM:单臂 Franka Research 3 机器人和双臂 ARX 5 机器人。]
E.1 机器人平台与传感器
我们使用两个机器人平台来评估 FlowWAM 的跨具身迁移能力:
• Franka Research 3:一个单臂操作平台,通过 FrankaPy [51] 进行控制,配备平行夹爪和一个用于工作空间观测的 ZED 相机,用于高精度抓取放置和接触丰富的物体操作。 • ARX 5:一个双臂机器人平台,使用基于 OCS2 的最优控制栈,配备三个 Intel RealSense D405 相机,包括一个用于全局工作空间视图的前置相机和两个用于近距离操作的手腕相机,用于需要双臂协调运动的任务。
第 22 页
E.2 任务套件与数据收集
真实世界评估套件包含七个任务,旨在测试空间精度、物体交互和双臂协调性:
• 叠碗(Franka):拿起一个碗并将其稳定地放置在另一个碗的顶部。 • 放入抽屉(Franka):抓取物体并将其插入打开的抽屉中,同时避免与抽屉边界发生碰撞。 • 放入盘子(Franka):将目标物体移入盘子中,要求相对于浅容器进行精确放置。 • 放置两个杯子(Franka):依次操作两个杯子,并将它们放置在期望的目标位置。 • 折叠毛巾(ARX):使用双臂抓取并折叠一条可变形的毛巾。 • 叠碗(ARX):协调双臂抓取、转移并稳定地堆叠碗。 • 清洁盘子(ARX):在盘子上方执行双臂清洁动作,要求在较长时间内协调手臂运动。
对于每个任务,所有方法均在相同的 100 个遥操作演示数据上进行训练,并在具有随机物体姿态的 10 次试验中进行评估。
F 可视化结果
本附录提供了定性可视化结果,以补充第 4 节中的定量评估。目的是使 FlowWAM 的行为可直接检查。除了聚合指标外,生成的轨迹(rollouts)应在时间上保持预期的机器人运动、物体交互和场景几何结构。
F.1 RoboTwin 策略轨迹
图 7 和图 8 将图 5 中的策略模式可视化扩展到了更广泛的 RoboTwin 2.0 [20] 任务,涵盖了 Clean(干净)和 Random(随机)两种设置。对于每个任务,我们展示了预测的 RGB 轨迹及其对应的光流计划,以及由动作专家解码的执行仿真轨迹。Clean 示例(图 7)涵盖了在标准布局下的多种双臂操作技能,而 Random 示例(图 8)则在随机物体姿态、干扰物放置、光照和背景条件下探测相同的技能。在这两种设置下,预测的光流集中在移动的机器人本体上,并追踪连贯的目标导向轨迹,同时 RGB 轨迹保留了周围物体的上下文。解码后的动作遵循该机器人运动计划以完成任务,且随着场景的随机化,定性行为保持稳定,这与表 4 中报告的定量鲁棒性相一致。
F.2 真实世界策略轨迹
图 9 可视化了 FlowWAM 在第 4.3 节介绍的真实世界操作套件上的策略模式行为,涵盖了单臂 Franka 平台和双臂 ARX 平台。前四行展示了单臂 Franka 任务(叠碗、放入抽屉、放入盘子、放置两个杯子),这些任务强调空间精度和物体接触。最后三行展示了双臂 ARX 任务(折叠毛巾、叠碗、清洁盘子),这些任务额外要求双臂协调和长时域运动。对于每个任务,我们将模型侧的预测(预测的 RGB 轨迹和对应的光流计划)与预测光流被动作专家解码为连续动作后的实际机器人执行结果并置展示。这种并排布局使得光流在单臂和双臂设置下的作用可直接检查:预测的光流提供了图像空间中的密集运动计划,而执行的轨迹则显示了该计划是否转化为物理机器人上预期的末端执行器运动和物体交互。
F.3 世界模型可视化
图 10 可视化了代表性的动作条件世界模型预测。给定初始观测和目标动作条件,FlowWAM 生成未来的 RGB 帧以及
22
第 23 页
与相应的运动结构。可视化结果展示了密集光流表示如何为视频预测提供空间上的指导,帮助模型保持机器人-物体运动的连贯性,并减少在 rollout 过程中的动作漂移。
G 更广泛的影响
FlowWAM 研究了基于光流的动作表示在模拟和实验室规模操作中的具身世界模型的应用,有望为更具可复用性和数据高效的机器人学习带来潜在益处。我们预计,除了与基础机器人学习研究通常相关的社会影响外,不会产生直接的社会影响。
23
第 24 页
图 7:在 RoboTwin 2.0 Clean 任务上的定性策略 rollout。对于每个任务,小面板展示了 FlowWAM 预测的 RGB 帧及对应的光流计划,大面板展示了动作专家将预测的光流解码为动作后的仿真 rollout。
24
第 25 页
图8:在RoboTwin 2.0随机任务上的定性策略 rollout。与图7中的干净设置相比,此处的场景包括随机化的物体姿态、干扰物、光照和背景。
25
第 26 页
图 9:在单臂和双臂平台上以策略模式进行的真实世界执行示例。 前四行对应于单臂 Franka 任务,最后三行对应于双臂 ARX 任务。在每个任务中,FlowWAM 预测的 RGB 帧和光流计划与相应的物理执行结果配对。预测运动场与实现的机器人轨迹之间的定性一致性展示了视频原生的光流表示如何将模型预测与可执行控制联系起来。
26
第 27 页
图 10:FlowWAM 动作条件世界模型的定性可视化。这些示例展示了预测的未来帧如何在遵循请求的操作动力学的同时,保持物体布局和场景的一致性。
27