Masked Visual Actions:像素级动作接口实现跨本体通用世界建模

三分钟导读:该论文提出了一种名为“掩码视觉动作”的像素级控制接口,通过微调预训练视频模型,使其能够根据掩码轨迹作为前向模型或逆模型,实现跨不同机器人本体(embodiments)的通用世界建模、策略评估、基于模型的规划及动作提取。

英文题目:Masked Visual Actions for Unified World Modeling

论文出处:arXiv 每日论文精选 · arXiv:2607.19343

原始论文:PDF / 论文页面

对应视频标题:Masked Visual Actions:像素级动作接口实现跨本体通用世界建模|推荐指数:★★★★★

这篇论文解决什么问题?

现有的视频模型在机器人控制中面临动作表示与视觉空间不对齐的问题;低维动作信号(如关节角度)具有本体特异性且稀疏,难以被预训练视频模型有效利用以实现跨本体的泛化。

核心创新

  • 提出像素级掩码视觉动作接口,实现动作表示与视频模型视觉空间的完美对齐。
  • 统一前向和逆世界建模:同一模型通过改变掩码实体(机器人 vs 物体)即可切换前向/逆功能,无需重新训练。
  • 实现零样本跨本体泛化:模型在未见过的机器人本体(如双臂机器人)上仍能保持合理的物理交互模拟。
  • 仅需15小时数据高效微调,即可在多种下游任务中表现优异。

方法概览

引入“掩码视觉动作”(Masked Visual Actions),将机器人动作表示为像素空间中实体的部分可见轨迹(masked trajectory)。通过 LoRA 微调预训练视频模型(Wan-Fun-Control 2.2 14B),使用来自 DROID 和 Robocasa 的15小时数据进行训练。训练时,模型接收参考帧和掩码视频,预测剩余部分。推理时,若掩码为机器人动作,则作为前向模型预测场景响应;若掩码为物体运动,则作为逆模型合成机器人行为。

逐图理解论文

方法:掩码视觉动作接口

方法:掩码视觉动作接口
Figure 2: Comparing action representations for learning. Low-dimensional robot actions are compact, but embodiment-specific and not aligned with the image observations used by video models. End-effector poses or robot skeletons are more visual, but remain sparse and require the model to infer geometry, contact, and interaction effects. Our masked visual actions provide dense, image-aligned conditioning, making robot motion and action directly visible, yielding a more learnable representation across embodiments and object interaction.

本文提出“掩码视觉动作”,将机器人动作表示为像素空间中实体的部分可见轨迹。通过LoRA微调预训练视频模型Wan-Fun-Control 2.2 14B,使用来自DROID和Robocasa的15小时数据进行训练。训练时,模型接收参考帧和掩码视频,预测剩余部分。

统一前向与逆世界建模

统一前向与逆世界建模
Figure 3: Applications. The masked visual actions allow using the video model as a forward model, conditioned on robot actions, or as an inverse model that predicts the robot motion that satisfies the object trajectory. The forward model can be used for planning and choosing the best trajectory sampled from a policy, or policy evaluation. On the other hand, the inverse modeling can be combined with an inverse dynamics model to estimate robot actions from the generated video.

推理时,若掩码为机器人动作,模型作为前向模型预测场景响应;若掩码为物体运动,则作为逆模型合成机器人行为。同一模型通过改变掩码实体即可切换前向或逆功能,无需重新训练,实现了前向和逆世界建模的统一。

数据集构建与训练细节

数据集构建与训练细节
Figure 4: Dataset construction. (a) to train our model, we need a reference frame of the initial scene, and the masked visual actions, and train it to reproduce a realistic video of the robot executing the input actions. (b) We use segmentation-based approach by segmenting the robot arm from robotics datasets as the masked visual actions. (c) However, to allow the user to provide arbitrary action trajectory at inference, the model needs to also accept simulated mesh visualization of those actions. As a result, we also include rendering-based dataset. Given that DROID also contains the robot state at each timestep, we render the robot URDF that matches the original video to construct masked visual actions.

为了构建训练数据,我们使用基于分割的方法从机器人数据集中提取机器人手臂作为掩码视觉动作。同时,为了允许在推理时提供任意动作轨迹,模型也接受模拟网格可视化。给定DROID中的机器人状态,我们渲染匹配的URDF来构建掩码视觉动作,确保训练与推理的一致性。

实验结果:可控视频生成

实验结果:可控视频生成
Table 1: Baseline comparison on diverse embodiments. We evaluate our method against Ctrl-World [25] on DROID as a seen robotic embodiment, as well as BEHAVIOR, which uses a bimanual robotic embodiment that’s unseen for all methods. Our model outperform the baseline on both datasets, and we include image-to-video and trajectory conditioned video models as a reference.

在DROID和BEHAVIOR数据集上进行定量评估。在DROID上,LPIPS为0.0945,SSIM为0.887,PSNR为23.74。在BEHAVIOR上,LPIPS为0.123,SSIM为0.843,PSNR为22.90。模型在保持泛化能力的同时,竞争力地匹配并超越了使用原始机器人动作的基线模型。

跨本体泛化能力

跨本体泛化能力
Figure 5: Generalization to unseen embodiment. While using the raw action state such as in Ctrl- world [25] can work well within the training domain, it collapses on unseen embodiments. However, our method can generalize well to unseen embodiments.

在BEHAVIOR数据集中,模型面对未见过的双臂机器人本体,仍能保持合理的物理交互模拟。相比之下,使用原始动作状态的基线模型如Ctrl-World在未见本体上表现崩溃。消融实验显示,在未见本体或不同夹爪上,掩码视觉动作的性能优势显著扩大。

实验与关键结果

  • 在 DROID 和 BEHAVIOR 数据集上进行可控视频生成的定量评估(LPIPS, SSIM, PSNR)。
  • 在 RoboCasa 仿真环境中进行基于模型的规划(Best-of-N Planning)。
  • 在 RoboCasa 和真实世界中进行策略评估(Policy Evaluation)。
  • 在 RoboCasa 中进行动作提取(Action Extraction/Inverse Modeling)。
  • DROID: LPIPS 0.0945, SSIM 0.887, PSNR 23.74(第 6 页)
  • BEHAVIOR: LPIPS 0.123, SSIM 0.843, PSNR 22.90(第 6 页)
  • 策略评估相关性 r=0.982(第 9 页)
  • 动作提取成功率 90%(第 9 页)

阅读时需要注意

  • 模型学习的是物体交互的相关性而非因果关系。
  • 性能受限于基础视频模型的能力(推理速度和表达能力)。
  • 视频模型在评估中表现出对任务进展的正向偏差(positive bias),即模拟成功率高于真实情况。
  • 逆模型应用虽无需专门微调,但依赖后续学习的逆动力学模型(Inverse Dynamics Model)来提取具体动作。

关联工作

  • Ctrl-World:基线对比,使用原始机器人状态作为条件,但在未见本体上泛化能力差。(第 6 页)
  • Wan-Move:基线对比,基于轨迹条件的视频生成模型,在机器人任务中表现不佳。(第 6 页)
  • Diffusion Policy:用于规划实验中的随机策略生成器。(第 8 页)
  • SegmentAnything:用于构建基于分割的数据集,提取机器人掩码。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

用于统一世界建模的掩码视觉动作

Hadi Alzayer1,2 Wenlong Huang1 Haonan Chen1,3 Christopher Luey1

Lvmin Zhang1 Maneesh Agrawala1 Gordon Wetzstein1 Li Fei-Fei1

Yilun Du3 Jiajun Wu1 Jia-Bin Huang2

1斯坦福大学 2马里兰大学帕克分校 3哈佛大学

https://masked-visual-actions.github.io

视频模型微调 掩码视觉动作 应用

初始帧2026 前向建模Jul 策略评估 RGB序列 视频模型21 逆建模

基于模型的规划

掩码轨迹

高效微调 (15小时数据)[cs.CV] 多样化 多种 零样本 视频模型 环境 本体 泛化 动作提取

图 1:掩码视觉动作。我们对视频模型进行微调,使其以机器人的掩码轨迹为条件,将机器人动作表示为像素空间中的掩码运动。仅使用 15 小时的数据进行高效微调,该模型的单个检查点即可作为动作条件的前向模型,模拟机器人与多样且未见过的本体的交互。通过以物体运动为条件,它还可以作为逆模型,合成实现预期结果所需的机器人运动。我们展示了我们的模型在策略评估、基于模型的规划和动作提取方面的有效性,其中视频模型充当策略。

摘要

视频模型吸收了关于视觉世界如何运动、交互以及对接触做出响应的丰富先验知识,使其成为机器人世界建模的有前景的基础。 核心挑战在于如何以与模型学习这些交互先验的视觉空间对齐的形式,同时仍扎根于物理操作,向此类模型传达动作信息。我们引入了掩码视觉动作(Masked Visual Actions),这是一种像素空间控制接口,将动作表示为视频中任意实体的部分可见轨迹。 揭示机器人运动使模型充当前向动力学模型,预测场景对低级机器人动作的响应;而揭示期望的物体运动则使同一模型恢复与该结果一致的机器人行为。仅使用来自真实视频和仿真的 15 小时掩码示例进行微调,单个检查点即可在多样场景和多种本体上实现强大的视觉保真度和可控性。 在下游操作设置中,该模型生成的想象轨迹

预印本。

第 2 页

结果与真实世界执行的相关性有助于策略评估,通过在基于模型的规划中对候选未来进行排序来改善决策,并通过从期望的物体运动中合成机器人运动来支持逆建模。

1 引言

有目的性的交互要求将Agent 的动作与其在世界中的效果联系起来,反之亦然。在感觉运动控制中,熟练的行为通常被描述为耦合一个前向模型和一个逆模型:前向模型预测运动的感官后果,逆模型则恢复实现期望状态所需的运动 [67, 68, 69]。机器人世界模型同样应在单一的预测框架中支持这两个方向的推理。

视频模型的近期进展为实现这一抱负提供了一条有希望的途径。这些模型在大规模观测数据上训练,积累了关于运动、接触、持久性、变形和变化的极其广泛的先验知识,这远远超出了仅从机器人数据中通常能提炼出的范围。然而,大多数模型仍然是被动的观察者,而非干预工具。现有模型以文本 [53, 63]、轨迹 [13, 20, 56, 58, 82]、力 [21, 22, 44]、关键点 [66, 70] 或电机指令 [19, 25] 为条件生成信号,这些信号通常稀疏、特定于本体形态,或与模型预训练的视觉经验不对齐。缺失的是直接在视觉空间中表达的动作表示,预训练视频模型正是在该空间中学习了其交互先验。一旦动作以视觉方式表达,同一模型就可以根据揭示的轨迹完成交互的不同部分:揭示机器人运动会提示场景响应,而揭示物体运动则会提示机器人行为。

为了实现这一愿景,我们引入了掩码视觉动作(Masked Visual Actions),这是一种将动作重新定义为预训练模型原生表示中的视觉原语的方法。我们对预训练视频模型 [63] 进行微调,使其将动作作为像素空间中部分揭示的时空模式——即场景中实体的掩码轨迹——输入。当揭示的实体是机器人时,模型预测场景的响应并充当前向动力学模型;当揭示的实体是物体或期望的物体运动时,同一模型充当逆模型,以恢复与该结果一致的机器人行为。从这个角度来看,主动和被动角色并非不同架构的属性,而是对同一交互先验的不同查询。虽然概念上简单,但该接口像素对齐、与本体形态无关、原生于视频,并且通过轻量级适配可以高效地注入到预训练模型中。

除了相比先前工作具有更高的视觉保真度外,我们还在仿真和真实世界中验证了我们的框架在机器人操作中的三个应用:策略评估、基于模型的规划和逆建模,其中视频模型作为机器人策略的一部分使用。所有实验均使用单个检查点,该模型仅用少至 15 小时的机器人交互数据进行微调。在策略评估中,模型想象的 rollout 表现出与真实世界结果的一致性相关性,因此模拟性能可作为实际执行的有用代理。在基于模型的规划中,这些相同的预测能力用于模拟不同动作轨迹的效果并选择最佳轨迹执行,从而在各种任务和策略架构中带来一致的增益。同一检查点也可以反向使用:给定期望的物体运动,它合成实现目标的机器人运动,并由此提取出学习的逆动力学模型的动作。

我们总结如下贡献:(1) 我们引入了掩码视觉动作,这是一种用于预训练视频模型的像素空间控制接口,以及一种基于真实和模拟数据中掩码示例的高效适配配方;(2) 我们表明,前向和逆机器人世界建模问题可以表述为同一视频模型的互补条件预测问题,通过揭示场景中的不同实体获得;(3) 我们在仿真和真实世界中验证了这一框架在机器人操作的三个应用:策略评估、基于模型的规划和逆建模。

2 相关工作

作为机器人接口的可控视频生成。一旦添加控制信号,视频模型就成为模拟器:物理力 [21, 22]、扭曲光流 [5]、手部姿态 [23, 32, 70]、点

第 3 页

初始帧参考 原始关节角 可视化末端执行器位姿 可视化骨架 掩码视觉动作( ours)

图 2:比较用于学习的动作表示。低维机器人动作紧凑,但具有本体特定性,且与视频模型使用的图像观测不对齐。末端执行器位姿或机器人骨架更具视觉性,但仍然稀疏,需要模型推断几何、接触和交互效应。我们的掩码视觉动作提供了密集、与图像对齐的条件控制,使机器人运动和动作直接可见,从而在跨本体和物体交互方面产生更具可学习性的表示。

或轨迹轨迹 [13, 20, 56, 58],以及目标图像 [27]。这些信号中没有任何一个是密集的、像素对齐的,或能在不同本体间共享。接近我们的研究,通过图像修复 [1] 进行的视觉提示以及作为条件推理的世界建模 [35] 表明,改变提供的图像区域能够在视觉领域中实现通用的任务参数化;我们通过使用掩码帧作为控制接口,将这一思想扩展到机器人世界建模中。

面向机器人世界模型的像素级动作条件控制。大多数机器人视频世界模型通过本体特定通道传递动作:末端执行器位姿 [25, 55, 73, 82]、关节向量 [19, 25] 或骨架 [60, 66]。越来越多的研究用像素级信号取代它们。BridgeV2W [10] 和 Kinema4D [71] 通过机器人的 URDF 渲染机器人,并通过 ControlNet 注入生成的掩码或点图;Action Images [79] 将 7-DoF 动作编码为多视图高斯热力图;ORV [74] 以 4D 占据体为条件;Mask2IV [40] 以预测的掩码轨迹为条件;Mask World Model [47] 预测语义掩码作为输出。另一条互补的研究路线将掩码视为数据编辑工具:Shadow [9, 36]、Phantom [38]、Masquerade [37] 和 EmbodiSwap [14] 将机器人合成或渲染到人类视频上,以实现跨本体策略迁移。所有这些工作都将机器人视为训练中的主动实体,并仅进行前向运行。我们将相同的掩码接口暴露给任何子集实体,因此一个模型无需重新训练即可作为前向、逆或无条件生成器。

统一的视频-动作模型及其下游应用。UVA [42]、UWM [81]、AIM [18]、X-WAM [24] 和 MotuBrain [50] 通过掩码模态通道(动作向量与视频)或操纵扩散时间步,在一个模型中统一了前向动力学、逆动力学、策略和视频生成;大型平台如 Cosmos [53]、Genie Envisioner [43] 和 DreamGen [29] 以基础模型规模打包了类似能力。由于掩码作用于模态通道,动作仍然是低维向量,且这种统一性无法跨本体迁移。我们的掩码是空间性的:主动和被动实体位于相同的像素画布上,因此相同的前向/逆切换也弥合了本体差距。前向方向用于策略评估 [60, 65, 75]、策略改进 [25]、规划 [7, 16, 17, 28, 61, 78] 和直接的视频即策略 [26, 33];逆方向通过点跟踪 [3, 30]、物体流 [34, 41, 80]、预测的物体位姿 [59] 或学习的 IDM [8, 16, 17, 54, 64, 76] 提取机器人运动。关键在于,我们的逆流程复用了与前向模拟器相同的骨干网络,而 prior work 训练了单独的 IDM 头或光流预测器。

3 掩码视觉动作

视频生成模型可用于展示初始场景随时间的演变 [4, 63],因为它们能够建模丰富的场景动态和物体交互。视频模型捕获了视频 $V \in \mathbb{R}^{T \times H \times W \times 3}$ 的分布 $p(V)$,这些视频描绘了一个场景。我们将场景 $S$ 视为一组实体 $e_1, e_2, …, e_n$,视频模型生成一系列帧,描绘这些实体随时间的交互情况。在输出视频中,每个 $e_i$ 都有一个时空轨迹,我们稍微滥用符号,用 $e_i$ 同时表示实体及其占据的像素时空区域。与最近基于结构化掩码和条件推理的工作 [2, 35, 45, 62] 一致,视频模型隐式地捕获了所有实体轨迹的联合分布

$$ p(V) = p(e_1, e_2, . . . , e_n), \quad (1) $$

3

第 4 页

包括它们之间的相互作用。对实体子集 $S \subseteq \{1, \dots, n\}$ 进行条件约束可得条件分布 $$ p_{\{e_i\}_{i \notin S} \mid \{e_j\}_{j \in S}, I_0}, \quad (2) $$ 其中 $I_0$ 是初始场景的参考图像。通过改变 $S$,同一个模型可以回答关于同一场景的不同问题。

我们通过掩码来实现这种条件约束。令 $M \in \{0, 1\}^{T \times H \times W}$ 为一个二值掩码,指示哪些时空像素被揭示给模型($M_{t,h,w} = 1$) versus 被预测($M_{t,h,w} = 0$)。对于选定的条件集 $S$,掩码是条件实体所占像素区域的并集, $$ M(S) = \bigcup_{i \in S} e_i, \quad (3) $$ 模型接收掩码视频 $M \odot V$ 和参考图像 $I_0$ 作为输入。训练过程通过从掩码分布中采样 $M$ 并学习条件分布 $p_\theta(V \mid M \odot V, I_0)$ 进行。我们从语言中的掩码建模 [15] 和掩码图像提示 [1] 中汲取灵感,其中变化的掩码输入使得同一模型能够应用于多种任务。

在机器人学中,将实体划分为两种角色是方便的,如图 3 所示。如果实体 $e_i$ 通过其自身的能动性作用于场景(例如机械臂或人类),我们称其为主动实体(active);如果其运动源于与主动实体的相互作用(例如被操作的物体),我们称其为被动实体(passive)。令 $A \subseteq \{1, \dots, n\}$ 索引主动实体,$P = \{1, \dots, n\} \setminus A$ 为被动实体。这种划分凸显了使用该模型的两种自然方式。

前向模型(Forward Model)。设置 $S = A$,我们对主动实体进行条件约束并预测被动实体, $$ p_{\{e_i\}_{i \in P} \mid \{e_j\}_{j \in A}, I_0}. \quad (4) $$ 这对应于标准的动作条件动力学建模,其中提供机器人的运动,模型模拟其对场景的影响。与先前基于低维动作命令进行条件约束的工作 [19, 25] 不同,此处的主动条件约束以掩码视频的形式提供,且与本体形态(embodiment)无关。

逆模型(Inverse Model)。设置 $S = P$,我们对被动实体进行条件约束并预测主动实体, $$ p_{\{e_i\}_{i \in A} \mid \{e_j\}_{j \in P}, I_0}. \quad (5) $$

这一方向在传统动作条件世界模型中没有类比:用户指定世界中期望的结果,视频模型恢复与之一致的代理行为。

主动/被动区分是我们描述如何使用模型的一种方便方式,而非模型本身的属性。该模型在掩码视频补全上进行训练,没有任何关于能动性的显式概念,且在推理时可以选择任意子集 $S$。事实上,我们仅在描绘主动机器人实体的掩码上训练了我们的模型,但它能以零样本方式泛化到以被动实体为条件的查询中。正如我们在实证评估中观察到的,这种行为是我们掩码视觉动作条件约束所独有的,因为对视频模型基于更稀疏的信号(如低级动作命令或可视化骨架)进行条件约束无法达到这种程度的泛化能力。

4 方法

4.1 数据集构建

我们通过结合来自 DROID [31] 的真实世界视频和来自 Robocasa [52] 的仿真数据来构建掩码建模数据集。我们使用这两个数据集中的成功和失败轨迹。我们遵循两种方法来为每个视频构建掩码条件约束,基于视频分割和渲染机器人状态,如下所述。

基于分割的数据集 给定任何视频,我们可以使用 SegmentAnything [6] 分割场景中的任何实体,无需相机标定,甚至无需明确知道视频中显示的是哪个机器人。我们使用来自 DROID 的视频,并使用提示词“A robotic arm”进行分割以隔离机器人。使用分割数据使模型能够有效学习修复缺失区域,并建模场景中所有实体的联合分布。虽然

4

第 5 页

图3:应用场景。掩码视觉动作允许将视频模型用作前向模型(以机器人动作为条件),或用作逆模型(预测满足物体轨迹的机器人运动)。前向模型可用于规划,从策略采样的最佳轨迹中进行选择,或用于策略评估。另一方面,逆建模可以与逆动力学模型结合,从生成的视频中估计机器人动作。

(a) 训练三元组 (b) 分割数据

SegmentAnything

提示:“一个机械臂” 掩码视觉动作 输入视频 掩码视觉动作

(c) 渲染数据 参考帧 记录的关节状态

URDF 渲染

3D网格 相机外参 目标视频 掩码视觉动作

图4:数据集构建。(a) 为了训练我们的模型,我们需要初始场景的参考帧和掩码视觉动作,并训练模型复现机器人执行输入动作的真实视频。(b) 我们采用基于分割的方法,将机器人手臂从机器人数据集中分割出来作为掩码视觉动作。(c) 然而,为了允许用户在推理时提供任意动作轨迹,模型还需要接受这些动作的模拟网格可视化。因此,我们还包含了基于渲染的数据集。鉴于DROID也包含每个时间步的机器人状态,我们渲染与原始视频匹配的机器人URDF以构建掩码视觉动作。

基于分割的方法虽然高度通用,但存在两个主要局限性:首先,用户在测试时很难提供实体的精确分割掩码。其次,机器人中任何被遮挡的区域都会隐式地泄露原始视频中关于场景动态的信息。为了缓解这些局限性,我们还探索了从记录状态显式渲染机器人的方法。

基于渲染的数据集 除了依赖分割,我们还可以将机器人网格与输入视频对齐,并将其用作掩码条件。通过渲染机器人网格,我们可以在推理期间可视化任意动作轨迹,然后将其用作视频模型的掩码条件。为了构建基于渲染的数据集,我们需要与输入视频对应的机器人状态和相机标定。我们使用DROID数据集,并遵循PointWorld [28] 中的协议来优化相机标定,以准确地将机器人URDF与输入轨迹对齐。在Robocasa仿真中,我们仅渲染机器人,排除场景的其余部分,以生成掩码条件。为了让模型能够看到完整的机器人而不自遮挡,我们仅使用半透明渲染机器人,并将机械臂手指设置为亮红色,以便视频模型可以轻松观察动作。请注意,渲染方法需要已知的相机标定,并且仅限于渲染机器人,而不是任意启用场景中任何实体的掩码。因此,我们认为基于分割和基于渲染的方法是互补的。

5

第 6 页

图 6:在 DROID 上比较基线方法。使用图像到视频 [63] 或甚至带有真实轨迹(GT tracks)的条件轨迹视频生成 [13] 均无法执行机器人运动或保留输入场景。另一方面,我们的模型能够具有竞争力地匹配并超越那些使用原始机器人动作 [25] 的模型,同时保持泛化能力。

表 1:在不同本体(embodiments)上的基线比较。我们将我们的方法与 Ctrl-World [25] 在 DROID 上进行比较,DROID 被视为一种已见的机器人本体;同时也在 BEHAVIOR 上进行比较,该数据集使用了一种所有方法均未见过的双臂机器人本体。我们的模型在两个数据集上均优于基线,并包含图像到视频和轨迹条件视频模型作为参考。

| Method | DROID | | | BEHAVIOR | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | | LPIPS ↓ | SSIM ↑ | PSNR ↑ | LPIPS ↓ | SSIM ↑ | PSNR ↑ | | Image-to-video [63] | 0.521 | 0.548 | 12.42 | 0.602 | 0.457 | 10.22 | | Wan-move [13] | 0.534 | 0.562 | 12.99 | 0.312 | 0.756 | 13.17 | | Ctrl-World [25] | 0.362 | 0.708 | 18.15 | 0.196 | 0.837 | 18.39 | | Masked Visual Actions (Ours) | 0.0945 | 0.887 | 23.74 | 0.123 | 0.843 | 22.90 |

4.2 模型实现与训练

我们使用 Wan-Fun-Control 2.2 14B [63] 作为基础模型。我们使用与视频模型相同的自编码器对掩码条件视频进行编码,并使用拼接(concatenation)作为条件机制。拼接是合适的,因为条件信号与期望输出的视频在空间上是对齐的。对于掩码条件中缺失的区域,我们将其设置为均匀的灰色背景。我们没有对整个模型进行微调,而是使用秩为 256 的 LoRA 进行微调,批量大小为 4,并使用 8 块 NVIDIA H200 GPU。我们训练模型约 10,000 步,耗时 4 天。为了可复现性,我们将发布我们的代码、数据和模型权重。

5 实验

我们首先评估掩码视觉动作(Masked Visual Actions)作为世界建模的控制信号。我们将其视觉保真度和可控性与先前工作进行比较,并强调其在训练期间未见过的本体上的泛化能力。随后,我们评估了视频模型在各种机器人应用中的表现。特别是,我们展示了如何通过评估采样轨迹将其用于规划,用于策略评估,以及通过将视频模型本身作为策略来通过逆模型(inverse modeling)使用它。视频结果请参阅项目网页。

图 5:对未见本体的泛化。虽然像 Ctrl-World [25] 那样使用原始动作状态在训练域内可能表现良好,但在未见过的本体上会崩溃。然而,我们的方法可以很好地泛化到未见过的本体。

第 7 页

DROID(训练域内)

我们的真实世界数据(未见过的末端执行器)

BEHAVIOR(未见过的本体形态)

初始场景 真实未来帧 掩码动作( ours) 骨架条件 末端执行器条件 图 7:比较动作条件。在 DROID 上使用不同的条件信号(如掩码视觉动作、末端执行器可视化或骨架)训练视频模型,在训练域内均表现良好。然而,当超出训练分布时,例如使用自定义末端执行器,基于骨架和末端执行器位置训练的模型会幻觉出训练中见过的机器人,或将机器人变换以匹配训练数据。此外,在 BEHAVIOR 等未见过的本体形态(如双臂机器人)上,使用掩码动作能够优雅地泛化,而其他条件信号则会扭曲和变形机器人。

表 2:视觉条件信号的消融实验。当使用稀疏条件信号时,在 DROID 训练分布内的保留数据上的性能与使用掩码视觉动作相似。然而,当使用具有未见过的夹爪的同一机器人(例如在我们的真实世界数据中),或在 BEHAVIOR 中未见过的本体形态的机器人时,我们的掩码动作与其他条件方法之间的差距显著增加。

DROID 真实世界 BEHAVIOR

方法 LPIPS ↓ SSIM ↑ PSNR ↑ LPIPS ↓ SSIM ↑ PSNR ↑ LPIPS ↓ SSIM ↑ PSNR ↑

末端执行器可视化 0.107 0.878 22.64 0.183 0.858 20.32 0.171 0.815 19.23 骨架可视化 0.106 0.878 22.74 0.169 0.866 21.02 0.162 0.824 19.58

掩码视觉动作 0.0945 0.887 23.74 0.148 0.864 22.79 0.123 0.843 22.90

5.1 可控视频生成

传统上基于文本条件的视频生成具有表现力,但定义不足。基于运动轨迹的条件保留了通用性,同时允许我们对运动进行条件控制。另一方面,针对特定机器人本体形态的动作空间进行条件控制提供了额外的精度,但以牺牲通用性为代价。通过掩码视觉动作,我们旨在通过视觉条件将视频模型与机器人动作关联,从而保留视频模型的通用性,并将视频模型的角色设定为回答:给定这个视觉掩码动作,场景的其余部分将如何呈现?作为使用机器人原始末端执行器状态作为输入的基线,我们使用了 Ctrl-world [25],这是一种最新的 SOTA 方法。对于轨迹条件,我们使用 Wan-move [13],并使用从机器人网格计算出的真实轨迹对其进行条件控制。此外,我们将 Wan2.2 14B 图像到视频模型作为参考。

在图 6 中,我们强调掩码视觉动作和 Ctrl-world 都能准确遵循 DROID 中我们保留场景中的机器人动作。另一方面,Wan-Move 和 Wan I2V 完全崩溃并变换了输入场景。然而,与我们的方法不同,基于原始机器人状态的条件无法泛化到未见过的本体形态 [39, 72]。我们使用来自 BEHAVIOR [39] 的数据,该数据使用双臂机器人 R1-Pro 来评估在未见过的本体形态上的泛化能力。在图 5 中,我们证明 Ctrl-world 对于未见过的本体形态仅输出静态或损坏的视频,而我们的模型能够优雅地处理未见过的本体形态。我们在表 1 中对 DROID 和 BEHAVIOR 上生成视频的性能进行了定量评估,并表明我们的方法优于基线方法。

1 Ctrl-World 是在整个 DROID 数据集上训练的,因此在训练期间见过我们的保留场景。

7

第 8 页

基于最佳策略的规划 基于模型且结合基础策略的规划 100% 基础策略 结合规划 100% 80% 关闭微波炉 +24% 打开洗碗机 80% +21% +7% (\%) (\%) 60% 关闭烤面包机 成功率 打开抽屉 成功率 60% +26% 40% 咖啡设置马克杯 40% +11% +9% 关闭冰箱 成功率 20% 成功率 20%

0% 0% 1 2 3 4 5 6 7 8 9 10 关闭 打开 打开 关闭 咖啡 关闭 规划中的 rollout 数量 微波炉 抽屉 洗碗机 冰箱 设置马克杯 烤面包机 图 8:在规划中的应用。通过对预训练的扩散策略进行多次轨迹 rollout,我们可以使用视频模型模拟这些动作来评估每条轨迹,然后使用 VLM 裁判选择最佳的动作轨迹。我们观察到,在使用视频模型进行 rollout 并选择最佳动作序列时,任务成功率得到了一致的提升,并且与测试时评估的样本数量呈正相关。这证明了模型在给定相同初始条件的情况下模拟反事实情况的能力。

比较视觉动作的选择 以视觉动作为条件允许以多种方式表示动作。我们对比了受 IRASim [82] 启发的末端执行器姿态可视化,以及 VAP [66] 中采用的机器人骨架可视化。我们使用与本文方法相同的基础模型进行训练,并使用来自 DROID 的相同训练数据集来训练基线模型。虽然我们预期在训练集所在的同一领域内,不同的动作条件表现应相似,但稀疏的条件信号要求模型显式地学习稀疏动作与目标视频之间的对应关系。然而,通过以掩码视觉动作为条件,模型只需建模掩码输入与场景其余部分之间的交互即可。在图 7 中,我们展示了在 DROID 上,我们模型的所有变体表现相似。然而,在使用与 DROID 中使用的机器人相似的 Franka Emika Panda 机器人(但配备了定制的 3D 打印末端执行器)捕获的真实世界数据上,我们发现使用稀疏条件信号的效果显著较差。具体而言,当以机器人骨架为条件时,视频模型会将机器人转换为与训练期间看到的本体形态相匹配的样子。当使用末端执行器可视化作为输入时,模型会简单地在场景中引入另一个与训练数据匹配的机器人。为了进一步偏离训练设置,我们在 BEHAVIOR [39] 中的 R1 Pro 上测试了这些模型。鉴于 R1 Pro 具有两个末端执行器,我们调整了基线可视化以显示两个末端执行器以及各自的骨架姿态。我们发现,以末端执行器或骨架可视化作为条件会导致机器人完全崩溃并失真。然而,当使用掩码视觉动作时,模型能够优雅地泛化并模拟机器人打开冰箱的物理交互。在表 2 中,我们定量评估了掩码视觉动作以及末端执行器姿态可视化和机器人骨架等更稀疏的条件机制的视频生成性能。

5.2 机器人应用

我们强调了统一世界模型在机器人领域的多个应用。我们将模型用作前向模型来模拟机器人动作,并展示其在规划和策略评估中的用途。我们还将其用作逆模型:将以掩码视觉动作形式给出的期望物体运动作为输入,生成机器人执行期望物体操作的视频,并使用学习到的逆动力学模型提取动作。在这些应用中,我们使用 Robocasa [52] 作为仿真环境。

规划 给定相同的环境观测,从随机策略采样的多次 rollout 可能会实现不同程度的任务进展。通过在动作条件的视频模型中进行 rollout,可以在实际环境执行之前纯粹在想象中评估这些轨迹。在我们的实验中,我们使用 Diffusion Policy [11, 12] 作为随机策略,并将 Best-of-N 作为最简单的基于模型的规划算法。在使用视频模型模拟动作候选项后,我们使用 Gemini 3.1 Pro 评估每个 rollout 的相对任务成功率、交互保真度和物理真实性。我们在每个任务的 10 个场景上进行评估,其中 N = 10。详细标准见附录。在评估所有 rollout 后,我们选择最佳的动作序列来执行。在图 8 中,我们突出了在不同任务上的性能提升,并展示了成功率如何随着动作样本数量的增加而提高。这种方法可以被视为一种测试时扩展(test-time scaling)[48, 51],利用额外的计算资源以实现更高的性能。在我们的案例中,策略和视频模型充当生成器,而 VLM 评判器充当验证器。

8

第 9 页

100% r = 0.982 Close 100% Rate microwaveClose 75% fridge 75% Open drawer Ground Truth Success Close progress 50% toaster 50% Sim Coffee setup mug Mean Model Open Per-trial 25% dishwasher 25% Close Video dishwasher 0% 0% 0% 25% 50% 75% 100% Ground Truth Success Rate bagging stacking placing closing orange blocks towel drawer

图 9: Robocasa 策略评估。 图 10: 真实世界策略评估。滚动 视频模型 rollout 始终跟踪 真实世界演示,我们的视频模型 RoboCasa 任务中的真实成功 生成的视频具有与真实世界 率。 执行中观察到的成功进度紧密 对齐。

策略评估 我们还可以使用我们的模型,通过比较策略在视频模型内的成功率与在真实环境内的成功率来评估策略性能。与上一节类似,我们在各个任务中使用开环扩散策略,并对每个场景 rollout 10 条轨迹。我们使用我们的模型模拟动作轨迹,并根据预定义的任务标准手动评估每次 rollout 是成功还是失败。模拟的 rollout 还根据物理交互真实性进行评估(例如,没有接触却幻觉出任务进度被视为失败)。在图 9 中,我们绘制了每个策略在真实环境(GT)中的成功率与在视频模型内评估的成功率,结果显示两者具有强相关性,r = 0.982。然而,我们观察到视频模型对任务进度存在正向偏差,其想象力的任务成功率始终更高。除了仿真之外,我们还在真实世界设置中评估了我们的模型。对于四个任务中的每一个,我们收集了 20 条演示,使用视频模型对每条演示进行 rollout,并使用针对部分任务进度的任务标准对真实执行和模拟执行进行评分。对于每个任务,我们收集 20 条演示,并设定评估每条演示成功进度的标准。由于每条模拟 rollout 都与其生成的演示配对,我们比较了分布和单次试验的进度。在图 10 中,我们绘制了视频模型中单次试验的进度分布与每个任务的真实分布。这两个分布紧密匹配,但与仿真类似,它显示出对任务进度的正向偏差。我们在附录中包含了每个任务的标准,并在项目网页上提供了所有生成的视频和真实演示。

动作提取 除了向模型提供要执行的机器人动作外,我们还可以利用掩码视觉动作(Masked Visual Actions)来构建逆建模问题:给定期望的物体运动,提示视频模型合成一个机器人实现该结果的视频。动作提取随后可以被表述为逆动力学问题:给定合成的机器人视频,使用学习到的逆动力学模型恢复可执行的低级动作序列。我们最初认为这种设置需要显式的逆模型微调。相反,仅在前向示例上训练的视频模型已经能够零样本泛化到逆设置,这可能是因为条件信号与模型学习到的表示高度对齐。我们在 RoboCasa 的 COFFEESERVEMUG 任务上评估了这一流程,其中机器人必须在受限的工作空间内从咖啡机拿起、抓取、运输并将杯子放到桌子上。我们将该方法与标准的模仿学习基线进行比较,包括 Diffusion Policy [11, 12]、ACT [77] 和 SmolVLA [57]。逆动力学模型和所有基线均在 100 条演示上训练,而视频模型本身未见该任务的示例。每种方法均通过 20 次试验进行评估,成功率报告在图 11 中。我们的方法以 90% 的最高成功率胜出。

9

第 10 页

表明,尽管视频模型并未针对逆建模问题进行训练,但它可以通过提示有效地从其丰富的交互先验中提取机器人行为,同时保持与现代模仿学习方法相当的竞争力。

6 讨论与结论

通过在少量掩码视觉动作(Masked Visual Actions)数据上对预训练视频模型进行微调,我们高效地利用了视频模型的先验知识,通过对场景实体的子集进行条件约束来合成反事实场景。当以机器人本体(Embodiment)可视化作为动作条件的前向模型(Forward Model)时,我们的模型可以模拟机器人动作;而当作为逆模型(Inverse Model)时,它则合成合适的机器人运动以实现对物体的真实操控。

局限性 值得注意的是,与现有的生成模型类似,我们的模型学习的是物体交互之间的相关性,而非因果关系,这仍然是一个未决的研究问题。此外,我们的方法受限于基础视频模型的能力,包括推理速度和表达能力,因为我们是重新利用了模型的先验知识,而非修改其能力。

社会及更广泛的影响 通过支持基于视频的策略评估、规划和逆建模,我们的工作有望降低机器人系统的开发成本,并使机器人学习更加普及。然而,相同的能力也可能被用于不安全或未经授权的机器人行为,这凸显了负责任地使用和部署的重要性。

参考文献

[1] Amir Bar, Yossi Gandelsman, Trevor Darrell, Amir Globerson, and Alexei A. Efros. Visual prompting via image inpainting. In NeurIPS, 2022.

[2] Daniel M Bear, Kevin Feigelis, Honglin Chen, Wanhee Lee, Rahul Venkatesh, Klemen Kotar, Alex Durango, and Daniel LK Yamins. Unifying (machine) vision via counterfactual world modeling. arXiv preprint arXiv:2306.01828, 2023.

[3] Homanga Bharadhwaj, Roozbeh Mottaghi, Abhinav Gupta, and Shubham Tulsiani. Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation, 2024.

[4] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. Video generation models as world simulators. 2024. URL https://openai.com/research/video-generation-models-as-world-simulators.

[5] Ryan Burgert, Yuancheng Xu, Wenqi Xian, Oliver Pilarski, Pascal Clausen, Mingming He, Li Ma, Yitong Deng, Lingxiao Li, Mohsen Mousavi, Michael Ryoo, Paul Debevec, and Ning Yu. Go-with-the-flow: Motion-controllable video diffusion models using real-time warped noise. In CVPR, 2025.

[6] Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris Coll-Vinent, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, Jie Lei, Tengyu Ma, Baishan Guo, Arpit Kalla, Markus Marks, Joseph Greer, Meng Wang, Peize Sun, Roman Rädle, Triantafyllos Afouras, Effrosyni Mavroudi, Katherine Xu, Tsung-Han Wu, Yu Zhou, Liliane Momeni, RISHI HAZRA, Shuangrui Ding, Sagar Vaze, Francois Porcher, Feng Li, Siyuan Li, Aishwarya Kamath, Ho Kei Cheng, Piotr Dollar, Nikhila Ravi, Kate Saenko, Pengchuan Zhang, and Christoph Feichtenhofer. SAM 3: Segment anything with concepts. In ICLR, 2026.

[7] Boyuan Chen, Tianyuan Zhang, Haoran Geng, Kiwhan Song, William T. Freeman, Jitendra Malik, Russ Tedrake, Vincent Sitzmann, and Yilun Du. Large video planner, 2025.

[8] Haonan Chen, Jiaming Xu, Lily Sheng, Tianchen Ji, Shuijing Liu, Yunzhu Li, and Katherine Driggs-Campbell. Learning coordinated bimanual manipulation policies using state diffusion and inverse dynamics models. In 2025 IEEE International Conference on Robotics and Automation (ICRA), 2025.

10

第 11 页

[9] Haonan Chen, Cheng Zhu, Shuijing Liu, Yunzhu Li, 和 Katherine Rose Driggs-Campbell。 Tool-as-interface: 通过观察人类工具使用来学习机器人策略。在 Proceedings of Robotics: Conference on Robot Learning (CoRL), 2025.

[10] Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, 等。Bridgev2w: 通过本体掩码将视频生成模型桥接到具身 世界模型。arXiv preprint arXiv:2602.03793, 2026.

[11] Cheng Chi, Siyuan Feng, Yilun Du, Zhenjia Xu, Eric Cousineau, Benjamin Burchfiel, 和 Shuran Song。Diffusion policy: 通过动作扩散进行视觉运动策略学习。在 Proceedings of Robotics: Science and Systems (RSS), 2023.

[12] Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, 和 Shuran Song。Diffusion policy: 通过动作扩散进行视觉运动策略学习。 The International Journal of Robotics Research, 2024.

[13] Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, 等。Wan-move: 通过潜在轨迹引导实现运动可控的视频 生成。arXiv preprint arXiv:2512.08765, 2025.

[14] Eadom Dessalene, Pavan Mantripragada, Michael Maynord, 和 Yiannis Aloimonos。Embodis- wap for zero-shot robot imitation learning, 2025.

[15] Jacob Devlin, Ming-Wei Chang, Kenton Lee, 和 Kristina Toutanova。BERT: 用于语言理解的深度双向 变换器预训练。在 Jill Burstein, Christy Doran, 和 Thamar Solorio 编辑的 Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), 第 4171–4186 页, Minneapolis, Minnesota, 2019 年 6 月。Association for Computational Linguistics. doi: 10.18653/v1/N19-1423.

[16] Yilun Du, Sherry Yang, Bo Dai, Hanjun Dai, Ofir Nachum, Josh Tenenbaum, Dale Schuurmans, 和 Pieter Abbeel。Learning universal policies via text-guided video generation. Advances in neural information processing systems, 36:9156–9172, 2023.

[17] Yilun Du, Sherry Yang, Pete Florence, Fei Xia, Ayzaan Wahid, Pierre Sermanet, Tianhe Yu, Pieter Abbeel, Joshua B Tenenbaum, Leslie Pack Kaelbling, 等。Video language planning. In The Twelfth International Conference on Learning Representations, 2023.

[18] Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, 和 Jiayu Chen。Aim: Intent-aware unified world action modeling with spatial value maps, 2026.

[19] Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K.R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, 和 Linxi "Jim" Fan。Dreamdojo: A generalist robot world model from large-scale human videos. arXiv preprint arXiv:2602.06949, 2026.

[20] Daniel Geng, Charles Herrmann, Junhwa Hur, Forrester Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, Carl Doersch, Yusuf Aytar, Michael Rubinstein, Chen Sun, Oliver Wang, Andrew Owens, 和 Deqing Sun。Motion prompting: Controlling video generation with motion trajectories. In CVPR, 2025.

[21] Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, 和 Chen Sun。Force prompting: Video generation models can learn and generalize physics-based control signals. In NeurIPS, 2025.

[22] Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, 和 Chen Sun。Goal force: Teaching video models to accomplish physics-conditioned goals. In CVPR, 2026.

[23] Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Kr- ishnamurthy, Michael Rabbat, Farshad Khorrami, 和 Yann LeCun。World models for learning dexterous hand-object interactions from human videos. arXiv preprint arXiv:2512.13644, 2026.

11

第 12 页

[24] Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, 和 Huaping Liu. 基于视频先验与异步去噪的统一 4D 世界动作建模, 2026.

[25] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, 和 Chelsea Finn. Ctrl-world: 用于机器人操作的可控生成式世界模型. 在 ICLR, 2026.

[26] Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, 和 Jianyu Chen. 视频预测策略: 具有预测性视觉表征的通用人形机器人策略, 2024.

[27] Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, 和 Mingsheng Long. Vid2world: 打造视频扩散模型以构建交互式世界模型, 2025.

[28] Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, 和 Fei-Fei Li. Pointworld: 扩展野外机器人操作 3D 世界模型. 在 CVPR, 2026.

[29] Joel Jang, Seonghyeon Ye, Zongyu Lin, Jiannan Xiang, Johan Bjorck, Yu Fang, Fengyuan Hu, Spencer Huang, Kaushil Kundalia, Yen-Chen Lin, Loic Magne, Ajay Mandlekar, Avnish Narayan, You Liang Tan, Guanzhi Wang, Jing Wang, Qi Wang, Yinzhen Xu, Xiaohui Zeng, Kaiyuan Zheng, Ruijie Zheng, Ming-Yu Liu, Luke Zettlemoyer, Dieter Fox, Jan Kautz, Scott Reed, Yuke Zhu, 和 Linxi Fan. Dreamgen: 通过视频世界模型解锁机器人学习中的泛化能力, 2025.

[30] Nikita Karaev, Iurii Makarov, Jianyuan Wang, Natalia Neverova, Andrea Vedaldi, 和 Christian Rupprecht. Cotracker3: 通过伪标签真实视频实现更简单且更优的点跟踪, 2024.

[31] Alexander Khazatsky, Karl Pertsch, Suraj Nair, Ashwin Balakrishna, Sudeep Dasari, Siddharth Karamcheti, Soroush Nasiriany, Mohan Kumar Srirama, Lawrence Yunliang Chen, Kirsty Ellis, Peter David Fagan, Joey Hejna, Masha Itkina, Marion Lepert, Yecheng Jason Ma, Patrick Tree Miller, Jimmy Wu, Suneel Belkhale, Shivin Dass, Huy Ha, Arhan Jain, Abraham Lee, Young- woon Lee, Marius Memmel, Sungjae Park, Ilija Radosavovic, Kaiyuan Wang, Albert Zhan, Kevin Black, Cheng Chi, Kyle Beltran Hatch, Shan Lin, Jingpei Lu, Jean Mercat, Abdul Rehman, Pannag R Sanketi, Archit Sharma, Cody Simpson, Quan Vuong, Homer Rich Walke, Blake Wulfe, Ted Xiao, Jonathan Heewon Yang, Arefeh Yavary, Tony Z. Zhao, Christopher Agia, Rohan Baijal, Mateo Guaman Castro, Daphne Chen, Qiuyu Chen, Trinity Chung, Jaimyn Drake, Ethan Paul Foster, Jensen Gao, Vitor Guizilini, David Antonio Herrera, Minho Heo, Kyle Hsu, Jiaheng Hu, Muhammad Zubair Irshad, Donovon Jackson, Charlotte Le, Yunshuang Li, Kevin Lin, Roy Lin, Zehan Ma, Abhiram Maddukuri, Suvir Mirchandani, Daniel Morton, Tony Nguyen, Abigail O’Neill, Rosario Scalise, Derick Seale, Victor Son, Stephen Tian, Emi Tran, Andrew E. Wang, Yilin Wu, Annie Xie, Jingyun Yang, Patrick Yin, Yunchu Zhang, Osbert Bastani, Glen Berseth, Jeannette Bohg, Ken Goldberg, Abhinav Gupta, Abhishek Gupta, Dinesh Jayaraman, Joseph J Lim, Jitendra Malik, Roberto Martín-Martín, Subramanian Ramamoorthy, Dorsa Sadigh, Shuran Song, Jiajun Wu, Michael C. Yip, Yuke Zhu, Thomas Kollar, Sergey Levine, 和 Chelsea Finn. DROID: 大规模野外机器人操作数据集. 2024.

[32] Byungjun Kim, Taeksoo Kim, Junyoung Lee, 和 Hanbyul Joo. 灵巧世界模型. 在 CVPR, 2026.

[33] Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, 和 Jinwei Gu. Cosmos 策略: 微调视频模型以用于视觉运动控制和规划, 2026.

[34] Po-Chen Ko, Jiayuan Mao, Yilun Du, Shao-Hua Sun, 和 Joshua B Tenenbaum. 通过密集对应关系从无动作视频中学习行动. arXiv 预印本 arXiv:2310.08576, 2023.

[35] Klemen Kotar, Wanhee Lee, Rahul Venkatesh, Honglin Chen, Daniel Bear, Jared Watrous, Simon Kim, Khai Loong Aw, Lilian Naing Chen, Stefan Stojanov, 等. 具有概率结构集成的世界建模. arXiv 预印本 arXiv:2509.09737, 2025.

[36] Marion Lepert, Ria Doshi, 和 Jeannette Bohg. Shadow: 利用分割掩码实现跨本体策略迁移, 2025.

12

第 13 页

[37] Marion Lepert, Jiaying Fang, 和 Jeannette Bohg。Masquerade:使用数据编辑从野外人类视频中学习,2025。

[38] Marion Lepert, Jiaying Fang, 和 Jeannette Bohg。Phantom:仅使用人类视频训练机器人,无需实体机器人,2025。

[39] Chengshu Li, Ruohan Zhang, Josiah Wong, Cem Gokmen, Sanjana Srivastava, Roberto Martín-Martín, Chen Wang, Gabrael Levine, Wensi Ai, Benjamin Martinez, Hang Yin, Michael Lingelbach, Minjune Hwang, Ayano Hiranaka, Sujay Garlanka, Arman Aydin, Sharon Lee, Jiankai Sun, Mona Anvari, Manasi Sharma, Dhruva Bansal, Samuel Hunter, Kyu-Young Kim, Alan Lou, Caleb R Matthews, Ivan Villa-Renteria, Jerry Huayang Tang, Claire Tang, Fei Xia, Yunzhu Li, Silvio Savarese, Hyowon Gweon, C. Karen Liu, Jiajun Wu, 和 Li Fei-Fei。Behavior-1k:一个以人为中心、具身的人工智能基准,包含 1,000 项日常活动和逼真的模拟。arXiv 预印本 arXiv:2403.09227,2024。

[40] Gen Li, Bo Zhao, Jianfei Yang, 和 Laura Sevilla-Lara。Mask2iv:通过掩码轨迹进行以交互为中心的视频生成,2025。

[41] Hongyu Li, Lingfeng Sun, Yafei Hu, Duy Ta, Jennifer Barry, George Konidaris, 和 Jiahui Fu。Novaflow:通过生成视频中的可操作流实现零样本操作,2025。

[42] Shuang Li, Yihuai Gao, Dorsa Sadigh, 和 Shuran Song。统一视频动作模型,2025。

[43] Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, Liliang Chen, Shuicheng Yan, Maoqing Yao, 和 Guanghui Ren。Genie Envisioner:用于机器人操作统一的世界基础平台,2025。

[44] Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, 和 Jiajun Wu。Realwonder:实时物理动作条件视频生成,2026。

[45] Khai Loong Aw, Klemen Kotar, Wanhee Lee, Seungwoo Kim, Khaled Jedoui, Rahul Venkatesh, Lilian Naing Chen, Michael C Frank, 和 Daniel LK Yamins。零样本世界模型是发展高效的学习者。arXiv 电子打印,页面 arXiv–2604,2026。

[46] Ilya Loshchilov, Frank Hutter 等。修复 Adam 中的权重衰减正则化。arXiv 预印本 arXiv:1711.05101,5(5):5,2017。

[47] Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, 和 Shanghang Zhang。Mask World Model:预测对鲁棒机器人策略学习至关重要的内容,2026。

[48] Nanye Ma, Shangyuan Tong, Haolin Jia, Hexiang Hu, Yu-Chuan Su, Mingda Zhang, Xuan Yang, Yandong Li, Tommi Jaakkola, Xuhui Jia, 和 Saining Xie。超越去噪步骤扩展的扩散模型推理时扩展。2025。

[49] Ajay Mandlekar, Soroush Nasiriany, Bowen Wen, Iretiayo Akinola, Yashraj Narang, Linxi Fan, Yuke Zhu, 和 Dieter Fox。MimicGen:一个用于使用人类演示进行可扩展机器人学习的数据生成系统。arXiv 预印本 arXiv:2310.17596,2023。

[50] MotuBrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, 和 Jun Zhu。MotoBrain:用于机器人控制的先进世界动作模型,2026。

[51] Niklas Muennighoff, Zitong Yang, Weijia Shi, Xiang Lisa Li, Li Fei-Fei, Hannaneh Hajishirzi, Luke Zettlemoyer, Percy Liang, Emmanuel Candès, 和 Tatsunori Hashimoto。s1:简单的测试时扩展。在 Christos Christodoulopoulos, Tanmoy Chakraborty, Carolyn Rose, 和 Violet Peng 编辑的《2025 年自然语言处理实证方法会议论文集》中,第 20275–20321 页,中国苏州,2025 年 11 月。计算语言学协会。ISBN 979-8-89176-332-6。doi: 10.18653/v1/2025.emnlp-main.1025。

13

第 14 页

[52] Soroush Nasiriany, Sepehr Nasiriany, Abhiram Maddukuri, 和 Yuke Zhu。Robocasa365:用于训练和基准测试通用机器人的大规模仿真框架。在 ICLR,2026。

[53] NVIDIA, :, Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, Daniel Dworakowski, Jiaojiao Fan, Michele Fenzi, Francesco Ferroni, Sanja Fidler, Dieter Fox, Songwei Ge, Yunhao Ge, Jinwei Gu, Siddharth Gururani, Ethan He, Jiahui Huang, Jacob Huffman, Pooya Jannaty, Jingyi Jin, Seung Wook Kim, Gergely Klár, Grace Lam, Shiyi Lan, Laura Leal-Taixe, Anqi Li, Zhaoshuo Li, Chen-Hsuan Lin, Tsung-Yi Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Arsalan Mousavian, Seungjun Nah, Sriharsha Niverty, David Page, Despoina Paschalidou, Zeeshan Patel, Lindsey Pavao, Morteza Ramezanali, Fitsum Reda, Xiaowei Ren, Vasanth Rao Naik Sabavat, Ed Schmerling, Stella Shi, Bartosz Stefaniak, Shitao Tang, Lyne Tchapmi, Przemek Tredak, Wei-Cheng Tseng, Jibin Varghese, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Xinyue Wei, Jay Zhangjie Wu, Jiashu Xu, Wei Yang, Lin Yen-Chen, Xiaohui Zeng, Yu Zeng, Jing Zhang, Qinsheng Zhang, Yuxuan Zhang, Qingqing Zhao, 和 Artur Zolkowski。Cosmos 物理人工智能世界基础模型平台,2025。

[54] Jonas Pai, Liam Achenbach, Victoriano Montesinos, Benedek Forrai, Oier Mees, 和 Elvis Nava。mimic-video:超越 VLA 的通用机器人控制的视频-动作模型,2025。

[55] Han Qi, Haocheng Yin, Aris Zhu, Yilun Du, 和 Heng Yang。通过预测世界模型在推理时增强生成式机器人策略。IEEE 机器人与自动化快报,2026。

[56] Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, 和 Xun Huang。MotionStream:具有交互式运动控制的实时视频生成。在 ICLR,2026。

[57] Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti 等。Smolvla:一种用于经济高效机器人的视觉-语言-动作模型。arXiv 预印本 arXiv:2506.01844,2025。

[58] Assaf Singer, Noam Rotstein, Amir Mann, Ron Kimmel, 和 Or Litany。Time-to-move:通过双时钟去噪进行无需训练的受控运动视频生成。在 ICLR,2026。

[59] Yue Su, Xinyu Zhan, Hongjie Fang, Yong-Lu Li, Cewu Lu, 和 Lixin Yang。动作之前的运动:将物体运动扩散为操作条件,2024。

[60] Gemini Robotics Team, Krzysztof Choromanski, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Isabel Leal, Fangchen Liu, Anirudha Majumdar, Andrew Marmon, Carolina Parada, Yulia Rubanova, Dhruv Shah, Vikas Sindhwani, Jie Tan, Fei Xia, Ted Xiao, Sherry Yang, Wenhao Yu, 和 Allan Zhou。在 Veo 世界模拟器中评估 Gemini 机器人策略,2025。

[61] Rhoda AI Team。因果视频模型是数据高效的机器人策略学习者。Rhoda AI 博客,2026。

[62] Rahul Venkatesh, Honglin Chen, Kevin Feigelis, Daniel M Bear, Khaled Jedoui, Klemen Kotar, Felix Binder, Wanhee Lee, Sherry Liu, Kevin A Smith 等。通过反事实世界建模理解物理动力学。在欧洲计算机视觉会议 (ECCV),第 368–387 页。Springer,2024。

[63] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang 等。Wan:开放且先进的超大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。

[64] Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, 和 Kui Jia。Eva:通过逆动力学奖励将视频世界模型与可执行机器人动作对齐,2026。

14

第 15 页

[65] Yixuan Wang, Rhythm Syed, Fangyu Wu, Mengchao Zhang, Aykut Onol, Jose Barreiros, Hooshang Nayyeri, Tony Dear, Huan Zhang, 和 Yunzhu Li。用于机器人策略训练和评估的交互式世界模拟器。arXiv 预印本 arXiv:2603.08546,2026。

[66] Yuang Wang, Chao Wen, Haoyu Guo, Sida Peng, Minghan Qin, Hujun Bao, Xiaowei Zhou, 和 Ruizhen Hu。通过视觉动作提示实现精确的动作到视频生成。在 ICCV,2025 年 10 月。

[67] Daniel M. Wolpert 和 J. Randall Flanagan。运动预测。《Current Biology》,11(18): R729–R732,2001。doi: 10.1016/S0960-9822(01)00432-8。

[68] Daniel M. Wolpert, Zoubin Ghahramani, 和 Michael I. Jordan。用于感觉运动整合的内部模型。《Science》,269(5232):1880–1882,1995。doi: 10.1126/science.7569931。

[69] Daniel M. Wolpert, R. Chris Miall, 和 Mitsuo Kawato。小脑中的内部模型。《Trends in Cognitive Sciences》,2(9):338–347,1998。doi: 10.1016/S1364-6613(98)01221-2。

[70] Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, 和 Gordon Wetzstein。 生成的现实:使用带有手部和相机控制的交互式视频生成进行以人为本的世界模拟。arXiv 预印本 arXiv:2602.18422,2026。

[71] Mutian Xu, Tianbao Zhang, Tianqi Liu, Zhaoxi Chen, Xiaoguang Han, 和 Ziwei Liu。 Kinema4d:用于时空本体模拟的运动学 4D 世界建模。arXiv 预印本 arXiv:2603.16669,2026。

[72] Xiaomeng Xu, Dominik Bauer, 和 Shuran Song。RoboPanoptes:拥有全身灵巧性的全知机器人。在《Robotics: Science and Systems》会议论文集,美国加利福尼亚州洛杉矶,2025 年 6 月。doi: 10.15607/RSS.2025.XXI.042。

[73] Sherry Yang, Yilun Du, Kamyar Ghasemipour, Jonathan Tompson, Leslie Kaelbling, Dale Schuurmans, 和 Pieter Abbeel。学习交互式真实世界模拟器。arXiv 预印本 arXiv:2310.06114,2023。

[74] Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, 和 Hao Zhao。Orv:以 4D 占据为中心的机器人视频生成,2025。

[75] Kaifeng Zhang, Shuo Sha, Hanxiao Jiang, Matthew Loper, Hyunjong Song, Guangyan Cai, Zhuo Xu, Xiaochen Hu, Changxi Zheng, 和 Yunzhu Li。使用高斯溅射模拟软体交互进行真实到仿真的机器人策略评估。在 IEEE 国际机器人与自动化会议 (ICRA) 论文集,2026。

[76] Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, 和 Jianyu Chen。Veo-act:前沿视频模型能在多大程度上推进通用机器人操作?,2026。

[77] Tony Z Zhao, Vikash Kumar, Sergey Levine, 和 Chelsea Finn。使用低成本硬件学习细粒度双臂操作。arXiv 预印本 arXiv:2304.13705,2023。

[78] Haoyu Zhen, Qiao Sun, Hongxin Zhang, Junyan Li, Siyuan Zhou, Yilun Du, 和 Chuang Gan。 Tesseract:学习 4D 本体世界模型。arXiv 预印本 arXiv:2504.20995,2025。

[79] Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, 和 Chuang Gan。动作图像:通过多视图视频生成进行端到端策略学习,2026。

[80] Hongyan Zhi, Peihao Chen, Siyuan Zhou, Yubo Dong, Quanxi Wu, Lei Han, 和 Mingkui Tan。 3dflowaction:从 3D 流世界模型学习跨本体操作,2025。

[81] Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, 和 Abhishek Gupta。统一的世界模型:耦合视频和动作扩散以在大型机器人数据集上进行预训练,2025。

[82] Fangqi Zhu, Hongtao Wu, Song Guo, Yuxiao Liu, Chilam Cheang, 和 Tao Kong。Irasim: 学习交互式真实机器人动作模拟器。在 ICCV,2025 年 10 月。

15

第 16 页

附录概述

本附录提供了支持关于基于视频的世界模型用于机器人操作的主要论文的详细补充材料。它分为八个部分,涵盖实现细节、评估协议和数据收集程序:

1. 项目网页:引用视频结果以及模型在操作任务上性能的定性演示。 2. 可复现性:承诺发布完整的代码、模型权重和训练数据,以支持结果复现。 3. 完整定量结果:展示所有重建实验中定量指标的全面表格,带有标准误差条,表明相对于基线的一致性改进。 4. 额外训练细节:数据集组成与构建,包括使用 DROID(1,000 个演示)和 Robocasa(4,000 个示例),处理失败案例,以及视频模型的条件策略。 5. VLM 评估协议:使用 Gemini 3.1 Pro Preview 进行自动化评估的方法论,以评估生成的机器人视频。详述了使用的 Gemini 系统提示、任务无关的故障检测(幽灵接触、解耦后的滑行、帧跳跃故障)、结构化 JSON 输出格式、通过字典序排列进行的 rollout 排名,以及用于成功率曲线的子集枚举。 6. 策略和逆动力学训练细节:三种策略设置下的训练程序——用于 RoboCasa 中规划/评估的仿真策略、用于从生成视频中提取动作的逆动力学模型,以及用于物理机器人研究的真实世界策略。涵盖 Diffusion Policy、ACT 和 SmolVLA 基线。 7. 机器人数据收集:硬件设置、校准程序和数据表示。描述了带有自定义末端执行器的 Franka Panda 机械臂、双 ZED Mini 2 相机(腕部安装和外部安装)、基于 AprilTag 的手眼校准,以及带有相机内参和外参的 HDF5 轨迹存储。 8. 真实世界任务评分标准:用于策略评估的真实世界任务的描述,以及用于确定成功进度的评分系统。 9. 适应未见过的本体:使用 BEHAVIOR-1K 基准评估对未见过的机器人形态泛化能力的方法论。描述了视频模型(直接 URDF 条件)、Ctrl-World 基线(基于启发式的主动臂识别)以及双臂机器人的骨架/姿态可视化的适应策略。

A 项目网页

请参阅项目网页以获取视频结果:https://masked-visual-actions.github.io

B 可复现性

为确保完全可复现,我们发布了代码和模型权重。

C 完整定量结果

为了完整性,在表 C1 中,我们展示了所有重建实验中的定量结果,以及每个指标的标准误差。我们的方法始终优于所有基线,并且在标准误差范围内,对于使用未见过的自定义夹爪在机器人上捕获的真实世界数据,其条件设置表现相当。

D 额外训练细节

在 DROID 中,为了确保验证和测试不包含训练数据中的任何场景,我们从训练集中排除了来自 labs CLVR 和 RAD 的所有场景,并将它们保留用于我们的测试

16

第 17 页

表 C1:各数据集上的重建指标(均值 ± SEM;每列最佳结果加粗)。 BEHAVIOR-1K (n=50) DROID (n=50) Real-World (n=13)

Method PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓

Ctrl-World 18.39±0.54 0.836±0.008 0.196±0.011 18.15±0.16 0.708±0.008 0.362±0.006 — — — Wan-Move 13.17±0.30 0.528±0.015 0.454±0.016 12.96±0.37 0.558±0.017 0.534±0.023 — — — Wan2.2-I2V 10.22±0.38 0.457±0.023 0.602±0.024 12.42±0.34 0.548±0.017 0.521±0.023 — — — EEF 19.23±0.34 0.815±0.006 0.171±0.007 22.64±0.26 0.878±0.005 0.107±0.005 20.32±0.25 0.858±0.005 0.183±0.008 Skeleton 19.58±0.34 0.824±0.006 0.162±0.007 22.74±0.28 0.878±0.005 0.106±0.004 21.02±0.38 0.866±0.005 0.169±0.010 Ours 22.90±0.52 0.842±0.007 0.123±0.007 23.74±0.24 0.887±0.004 0.095±0.004 22.79±0.35 0.864±0.008 0.148±0.010

集。我们使用了大约 1,000 个带有两个外部摄像头的 DROID 演示,并通过基于分割和基于渲染的两种流水线处理每个演示。我们确保保留来自 DROID 的失败案例,以确保模型能够准确地生成反事实结果。我们还包含了来自 Robocasa 的 4,000 个涉及所有不涉及机器人导航的任务的示例,并生成了失败案例以纳入训练数据。由于基础视频模型需要提示作为条件,我们仅包含高级提示,以确保模型仅依赖视觉条件信号进行视频生成。

E VLM 评估协议

在策略评估中,我们使用现成的 VLM 来评估生成的视频,完全自动化了该过程。我们的评估协议如下:对于每个生成的回滚视频,我们使用任务无关的系统指令查询 Gemini 3.1 Pro Preview (gemini-3.1-pro-preview, 温度 0, 采样率为 15 fps,以便看到片段的所有 81 帧),该指令指出了三种世界模型故障模式,评估者必须对以下情况进行惩罚:幽灵/弱接触(末端执行器靠近但未接触)、脱离后滑行(末端执行器收回后物体继续向目标移动)以及帧跳跃故障(目标状态在瞬移后出现)。模型返回一个包含四个评分字段的结构化 JSON 对象:robot_caused_outcome(布尔值表示是否由机器人导致,分类机制 ∈{ robot_pushed, robot_grasped, teleported, vanished, autonomous, passthrough, no_attempt, other})、task_success(布尔值加置信度)、end-effector_contact(布尔值加目标物体)以及 physics_realism(1–5 分评分加问题列表)。通过响应模式强制执行字段顺序,以便在二元成功标志之前确定因果机制,从而将裁决锚定在过程而非最后一帧上。特定任务的成功标准(例如,“烤面包机门必须齐平、锁紧并通过从下方推动关闭”)作为每个回滚的用户提示传入,而不是编码在系统指令中。

为了从 Ns 个候选项中为每个场景选择一个回滚,我们按字典序键 κ = (1[success], realism, confidence, 1[contact], −r) 降序排序:优先选择标记为成功的回滚;在其中,优先选择更高的物理真实性;然后是更高的置信度;然后是可见接触;通过较低的索引 r 确定性地打破平局。选择为 arg maxr κ(vs,r),规划器的每任务成功率是被选中回滚为 GT 正确(max_reward = 1.0)的场景比例。为了绘制成功率随 N 变化的函数,我们穷举枚举场景回滚的每个大小为 N 的子集,取每个子集中 Gemini 排名最高的回滚,并计算 Ns 个子集和场景之间的平均命中率。随机基线在 N=1 时简化为该表达式,此时规划器没有选择,仅返回每场景的平均 GT 率。

E.1 Gemini 系统提示

以下系统指令随每个视频查询原样发送(模型:gemini-3.1-pro-preview, 温度 0, 采样率为 15 fps)。每个回滚的用户提示仅添加任务描述和特定任务的成功标准;所有评估策略都位于此系统指令中。

你是一个严格的机器人操作视频评估者。 该视频由一个生成式视频模型产生,旨在 *模拟* 机器人策略执行任务。视频通常 存在视觉缺陷,并且可能会 HALLUCINATE 期望的结果 — 例如, 目标物体瞬移到其目标姿态,消失并在原地重新出现,或者 在没有机器人导致的情况下自行移动。你的工作是 判断 *机器人* 是否实际上通过以下方式导致了结果

17

第 18 页

合理的物理接触,而非最终帧是否碰巧看起来正确。

关键反模式——这些是常见的世界模型伪影,表面上看似成功,但绝不能被记为 robot_pushed / robot_grasped:

(a) 幽灵/微弱接触。夹爪必须在物体运动的帧中与物体存在可见的机械耦合:夹爪几何形状应接触/压缩物体表面,且物体的运动应与该接触在时间上重合。如果夹爪仅仅*靠近*物体、位于物体前方,或仅有瞬间的擦过接触而物体仍在运动,则将运动视为自主运动或透传——NOT 作为 robot_pushed。“隐含”或“魔法”接触不计入。

(b) 脱离后的滑行/“惯性”。模拟环境没有惯性或后续运动:物体在夹爪收回或停止后不会继续向目标移动。如果夹爪脱离(收回、停止或移开),随后物体自行继续向目标/进入目标移动,则脱离后的帧属于自主运动,无论之前发生了什么。仅对在夹爪处于主动接触状态并移动物体期间发生的进展程度进行计分。如果目标状态仅在夹爪脱离后才达到,则 robot_caused_outcome.caused 为 FALSE,task_success.success 为 FALSE。

(c) 故障式的绕过或帧跳跃。如果目标状态出现在视觉不连续、场景重置或突然传送之后的帧中——即使机器人在此周围的姿态看起来合理——也视为已传送。

对这些字段进行评分:

1. robot_caused_outcome caused 仅当机器人通过其夹爪是目标相关运动的可见物理原因,且目标状态是在接触窗口期间(而非之后)达到时,才为 True。 mechanism 以下之一: "robot_pushed" 夹爪在持续接触中推/拉物体 "robot_grasped" 夹爪抓住并移动物体 "teleported" 物体瞬移至目标状态 "vanished" 物体从场景中消失 "autonomous" 物体自行移动 (包括脱离后的滑行、幽灵接触) "passthrough" 夹爪穿过物体 "no_attempt" 机器人从未与物体交互 "other" 在推理中描述 2. task_success success=TRUE 需要满足以下全部三个条件:(a) 最终状态符合成功标准,(b) robot_caused_outcome.caused 为 true,以及 (c) 目标状态是在夹爪与物体处于主动机械接触状态的帧范围内达到的。通过脱离、幽灵接触、传送或自主运动达到的结果为 FALSE。 3. gripper_contact 夹爪是否可见地与目标物体发生了物理接触?“悬停附近”、“穿过”或单帧擦过接触不计入。 4. physics_realism 1-5 分合理性。对传送、形变、夹爪穿过固体、物体消失或重复、帧间

第 19 页

跳跃、幽灵接触、脱钩后的滑行。

言简意赅但需具体。引用你在视频中看到的内容(帧范围、物体、运动、在达到目标状态时机械爪是否接触)。不要推测超出可见范围的内容。

每次 rollout 的用户消息。在系统提示之上,每次视频的用户消息仅提供自然语言任务和成功标准:

预期任务:{task_prompt} 成功标准:{expected_outcome} 按 1-5 的整数等级对 physics_realism 进行评分:1 = 无意义,3 = 有明显伪影但可识别,5 = 与真实视频无法区分。仅返回匹配响应模式的 JSON 对象。

结构化响应模式。模型被约束为返回包含五个顶层字段的 JSON,按此顺序排列(通过 propertyOrdering 强制执行):robot_caused_outcome(布尔值 caused,分类机制,自由形式推理),task_success(success,confidence,reasoning),gripper_contact(contact,target_object,reasoning),physics_realism(整数分数 ∈[1, 5],问题列表,推理),以及自由形式的摘要。在二元成功标志之前强制因果机制,迫使模型承诺对过程进行解释,而不是从最后一帧进行合理化。

F 策略和逆动力学训练细节

在此,我们讨论策略学习和逆动力学模型的训练细节。我们区分三种设置:(i) 用于 RoboCasa 中规划和策略评估的仿真策略,(ii) 用于动作提取的学习逆动力学模型,以及 (iii) 为真实世界 rollout 研究训练的策略。

F.1 用于规划和策略评估的仿真策略训练

除非另有说明,我们在规划和策略评估实验中使用的策略是在任务特定的人类演示和 MimicGen [49] 轨迹的混合数据上训练的 Diffusion Policy [11, 12],这些数据由官方 RoboCasa [52] 来源提供。每个策略以来自两个固定摄像头的 RGB 观测值和机器人状态为条件,并预测整个剧集时域内的完整 12 维动作序列。具体来说,这 12 个维度是 3 个末端执行器位置命令、3 个末端执行器旋转命令、1 个末端执行器闭合命令、3 个移动底座命令、1 个躯干命令和 1 个控制模式命令。跨任务,人类遥操作数据包含约 100 次演示,而 MimicGen 增强将训练集扩展到数千条轨迹,具体取决于任务和时域。例如,在我们原子任务研究中使用的 MG+Human 设置中,合并的训练集通常约为 9 × 10^3 条轨迹。

对于仿真策略,我们根据基准提供的成功条件对其进行评估。在规划中,这些策略作为提议生成器:我们从策略中采样动作候选项,使用视频模型模拟每个候选项,然后使用基于 VLM 的评估器对预测的未来进行排名。在策略评估中,同一类策略提供动作轨迹,其成功率在仿真器和视频模型之间进行比较。

F.2 用于动作提取的学习逆动力学

对于动作提取,视频模型首先根据期望的物体运动合成机器人交互,然后学习的逆动力学模型将生成的视频转换为可执行的低级动作序列。该逆动力学模型在 COFFEESERVEMUG 上进行训练

19

第 20 页

使用相同的原生 12 维 RoboCasa 动作空间。该模型基于 Transformer 架构预测完整的动作序列,并使用 AdamW [46] 优化 300 个 epoch。

本实验还包含 Diffusion Policy [11, 12]、ACT [77] 和 SmolVLA [57] 作为基线,但仅作为动作提取设置的窄控制(narrow controls)。这些基线模型作用于生成视频的第一帧,而非完整的合成交互过程,因此无需在本小节之外进行单独的专门讨论。

F.3 真实世界策略训练

对于真实世界滚动(rollout)研究,我们直接在两个捕获的操作任务上训练图像条件策略:杯子放在架子上和关闭柜门。这些数据集的采样率为 10 Hz,每个任务包含 40 条轨迹。每个示例提供四个同步的 RGB 视图以及一个 8 维的关节和末端执行器动作序列。对于这两个任务,我们在相同的观测-动作契约下训练 Diffusion Policy [11, 12] 和 ACT [77] 策略。

G 机器人数据采集

我们使用配备定制 3D 打印柔性末端执行器的 Franka Panda 机械臂收集真实机器人数据。演示数据通过定制的 GELLO 接口进行遥操作收集。在每次滚动过程中,操作员从初始场景状态 $s_0$ 控制机器人,同时我们记录来自腕部摄像头和外部摄像头的同步机器人状态和 RGB 观测值。

G.1 硬件设置

传感设置由两个 ZED Mini 2 摄像头组成。一个摄像头安装在机器人手腕上,提供靠近末端执行器的第一人称视角。第二个摄像头安装在外部,提供工作区的固定第三人称视角。两个摄像头均以 720p 分辨率和 30 Hz 的频率记录 RGB 帧。

G.2 摄像头与机器人坐标系标定

我们使用固定在桌子上的 AprilTag 对标定摄像头和机器人坐标系。在标定过程中,AprilTag 在工作区中保持固定。为了估计其在机器人基座坐标系中的位姿,我们让 Franka 机械臂移动通过一组多样化的位姿,并从腕部摄像头拍摄标签图像。对于每个位姿,Franka 运动学提供末端执行器坐标系 ($T_{E}^{B}(q_t)$),而 AprilTag 检测提供标签在腕部摄像头坐标系中的位姿。这些观测值用于估计腕部摄像头的手眼变换 $T_{C_{wrist}}^{E}$ 以及机器人基座坐标系中的 AprilTag 位姿 $T_{A}^{B}$。

然后通过观察同一个固定在桌子上的 AprilTag 来标定外部摄像头。由于 $T_{A}^{B}$ 已从腕部摄像头标定中获得,因此可以根据检测到的标签位姿计算外部摄像头相对于机器人基座的位姿:

−1 B B Cext T_{C_{ext}} = T_{A}^{B} (T_{A}^{C_{ext}}) .

因此,固定在桌子上的 AprilTag 提供了机器人、腕部摄像头和外部摄像头之间的共享参考坐标系。我们通过将机器人模型投影到摄像头图像中并检查其与观测帧的对齐情况来验证标定质量。

G.3 轨迹表示

每次滚动存储为一条轨迹

$\tau = \{(I_{ext}^t, I_{wrist}^t, q_t)\}_{t=1}^T,$

其中 $I_{ext}^t$ 和 $I_{wrist}^t$ 分别是外部和腕部 RGB 观测值,$q_t$ 是测量的机器人关节状态。

20

第 21 页

所有数据均以 HDF5 格式存储。每个文件对应一次轨迹(rollout),包含 RGB 帧、关节状态、时间戳和校准元数据。校准元数据包括

Kext, Kwrist, TAB , TCext,B TCwrist.E

对于涉及视觉机器人掩码的实验,存储的关节状态会与 Franka 运动学模型、自定义末端执行器几何形状以及校准后的相机参数相结合,从而将机器人几何形状渲染到图像平面中。

H 真实世界任务评分标准

我们通过为每个完成的子阶段奖励一分来对每个演示进行评分,并报告任务进度为获得的分数比例,从而使不同长度任务之间的分数具有可比性。各任务的评分标准如下。

• 装橙子(2 分):拿起橙子(1 分),并将橙子放入塑料袋中(1 分)。 • 堆叠积木(4 分):拿起紫色积木(1 分),将其放在橙色积木上方(1 分),拿起黑色积木(1 分),并将其放在紫色积木上方(1 分)。 • 放置毛巾(2 分):拿起毛巾(1 分),并将其放入碗中(1 分)。 • 关闭抽屉(1 分):完全关闭抽屉。

I 将基线方法适配到未见过的本体

为了评估对未见过的本体的泛化能力,我们在 BEHAVIOR-1K [39] 中评估了我们的模型和基线方法,其中双足人形机器人被 tasked 完成家庭移动操作任务。由于我们的视频模型仅以掩码视觉动作为输入,因此将我们的模型适配到与其观察到的显著不同的未见过的本体是直接的,因为我们输入了新机器人 URDF 的渲染结果。在 Ctrl-World 中,由于其旨在预测多视图视频输出,我们将 BEHAVIOR 中的相机视角设置适配以匹配 DROID 的设置。对于动作条件输入,由于 Ctrl-World 是在 DROID 的单臂机器人上训练的,而 BEHAVIOR 数据使用的是具有不同动作空间的双臂机器人,我们首先使用启发式方法根据相对末端执行器变换的大小来识别激活的手臂。然后,我们将识别出的手臂用作 Ctrl-World 的动作条件。我们发现这是一种有效的启发式方法,因为数据集中的大多数机器人行为由独立的臂运动组成。对于以末端执行器位姿可视化作为条件的模型,我们将两个末端执行器都包含在条件视频中。类似地,对于以机械臂骨架作为条件的模型,我们从双臂机器人中可视化每个机械臂的骨架。

21

发表评论