DriftWorld:单步漂移世界模型,实现30+ FPS实时机器人规划

三分钟导读:DriftWorld是一种基于漂移生成模型的动作条件世界模型,通过单步前向传播实现30+ fps的高速视频生成,显著优于扩散模型基线,并支持高效的在线规划与离线策略评估。

英文题目:DriftWorld: Fast World Modeling through Drifting

论文出处:arXiv 每日论文精选 · arXiv:2607.15065

原始论文:PDF / 论文页面

对应视频标题:DriftWorld:单步漂移世界模型,实现30+ FPS实时机器人规划|推荐指数:★★★★★

这篇论文解决什么问题?

现有的基于扩散的世界模型在推理时需要多步去噪,导致生成rollout的速度过慢,限制了实时规划中的大规模动作搜索和策略评估效率。

核心创新

  • 首个将漂移生成模型适配到动作条件视频预测的世界模型。
  • 提出动作增强漂移场(Action-accentuated drifting field),通过混合无动作真实样本作为负样本来强化动作跟随。
  • 引入基于DINOv2/v3的特征空间漂移损失,解决复杂场景下的视觉模糊问题。
  • 设计运动加权机制,根据空间位置的运动幅度调整损失权重,防止模型陷入动作无关的局部最优。
  • 单步生成架构,推理速度比扩散模型基线平均快17倍。

方法概览

提出DriftWorld,利用漂移场将噪声分布推向数据分布。训练时采用漂移损失(对比损失),鼓励生成的负样本向真实正样本漂移。架构上采用U-Net,结合DINOv2/v3特征空间损失、运动加权(Motion Weighting)和自强制(Self-Forcing)技术,以增强动作跟随性和视觉清晰度。推理时仅需一次前向传播。

逐图理解论文

方法:漂移生成架构

方法:漂移生成架构
Figure 2: Drifting Architecture and Training Overview. (a) We use a U-Net architecture conditioned on history observations and robot actions. (b) DriftWorld is trained using a drifting loss, which is a contrastive loss that encourages the generated future frames (negative samples) to drift toward the ground-truth future frames (the positive sample).

DriftWorld采用U-Net架构,结合历史观测与机器人动作。训练时利用漂移损失,这是一种对比损失,鼓励生成的负样本向真实正样本漂移。推理时仅需一次前向传播,无需迭代去噪。

创新:动作增强漂移场

创新:动作增强漂移场
Figure 13: Comparison of DriftWorld’s generated videos on Bridge-V2 under different scales α for ac- centuating action following. As α increases, the generated gripper follows the specified action more closely. See the 2nd, 3rd, and 6th frames.

为解决动作跟随性差的问题,提出动作增强漂移场。通过混合无动作的真实样本作为负样本,强化模型对动作条件的响应。实验表明,增加动作增强系数可显著提升机械臂对指令的跟随精度。

创新:特征空间漂移损失

创新:特征空间漂移损失
Figure 7: Visualization of ablation on fea- ture space. With the DINOv2 or DINOv3 feature extractor, the generated robot gripper is sharp. Without any features, the gripper is blurry.

在复杂场景中,像素级损失易导致模糊。DriftWorld引入DINOv2或DINOv3作为特征提取器,计算特征空间漂移损失。消融实验显示,使用特征提取器能显著改善Bridge-V2等任务上的视觉质量。

创新:运动加权与自强制

创新:运动加权与自强制
Figure 14: Effect of motion weighting on DriftWorld’s autoregressive generation on RT-1. Without motion weighting, the robot gripper remains mostly stationary in later frames. In contrast, applying motion weighting ensures the gripper correctly moves according to the action conditioning.

为防止模型陷入动作无关的局部最优,设计运动加权机制,根据空间运动幅度调整损失权重。同时,采用自强制训练,后期使用模型自身生成的帧进行自回归训练,提升长期一致性。

实验:视觉质量评估

实验:视觉质量评估
Table 1: Quantitative results for the visual quality of generated videos for Push-T, averaged over 1000 seeds for the starting environment. We also record the average number of seconds per generated frame that each world model takes. All timing results are on a single H100 GPU.

在Push-T、Robomimic、Bridge-V2等基准上评估。Push-T任务中,64帧Rollout的SSIM达0.9925。相比GPC扩散基线,DriftWorld在Bridge-V2和RT-1上均展现出更清晰的接触交互和物体运动。

实验与关键结果

  • 在Push-T, Robomimic (Lift, Can, Square), Bridge-V2, RT-1, Language Table五个基准上进行视觉质量评估。
  • 使用GPC-RANK方法评估在线策略改进能力(Inference-time Policy Improvement)。
  • 评估DriftWorld作为离线模拟器对真实策略进行排序的相关性(Policy Evaluation)。
  • 消融实验验证特征提取器、运动加权、自强制和生成块大小的影响。
  • 平均速度比扩散基线快17倍,达到30+ fps(第 2 页)
  • Push-T任务上,64帧rollout的SSIM为0.9925,PSNR为33.7753,LPIPS为0.0050(第 6 页)
  • Bridge-V2任务上,SSIM为0.821,PSNR为21.871,LPIPS为0.103(第 7 页)
  • RT-1任务上,SSIM为0.836,PSNR为23.916,LPIPS为0.101(第 7 页)
  • Language Table任务上,SSIM为0.913,PSNR为25.974,LPIPS为0.062(第 7 页)
  • Push-T策略评估中,DriftWorld预测IoU与真实IoU的Pearson相关系数为0.9515(第 9 页)
  • Robomimic Lift任务中,预测成功率与真实成功率的Pearson相关系数为0.9916(第 9 页)
  • Robomimic Can任务中,预测成功率与真实成功率的Pearson相关系数为0.9250(第 9 页)
  • 使用GPC-RANK时,Push-T策略的IoU从0.635提升至0.781(第 9 页)

阅读时需要注意

  • 依赖预训练的特征提取器(DINOv2/v3)来保持复杂场景中的视觉清晰度。
  • 训练时内存占用高于标准扩散模型,因为需要为每个前向传播生成多个负样本(如64个)。
  • 受限于GPU显存,上下文和生成帧的长度受到限制,长期时间一致性有待提升。
  • 特征提取器仅在训练时用于计算漂移损失,不影响推理速度。
  • 对于简单数据集(如Push-T),直接在像素空间计算漂移损失即可;对于复杂真实数据集,需使用特征空间。
  • 自强制训练分为两个阶段:第一阶段使用真实历史帧,第二阶段使用模型自身生成的帧进行自回归训练。

关联工作

  • GPC [5]:作为扩散世界模型基线进行对比,用于策略评估和改进实验。(第 6 页)
  • IRASim [2]:作为动作条件世界模型基线进行视觉质量对比。(第 7 页)
  • Ctrl-World [3]:作为动作条件世界模型基线进行视觉质量对比。(第 7 页)
  • WorldGym [30]:作为离线策略评估模拟器基线进行对比。(第 7 页)
  • VDM [46] / LVDM [47]:作为扩散视频生成模型基线,经过适配用于动作条件视频生成对比。(第 7 页)
  • Generative modeling via drifting [6]:提出漂移生成模型的基础理论,本文将其扩展至条件视频预测。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

DriftWorld:通过漂移实现快速世界建模

Susie Lu1 Haonan Chen2 Weirui Ye1 Yilun Du2 1麻省理工学院,2哈佛大学

摘要:预测性世界模型使机器人能够通过想象其动作的结果来进行规划,但其对控制的价值取决于快速生成大量 Rollout 的能力。这为基于扩散的世界模型造成了瓶颈:多步采样使得每次 Rollout 成本高昂,限制了推理时的大规模动作搜索。我们引入了 DriftWorld,这是一种基于漂移生成模型(Drifting Generative Models)的动作条件(Action-Conditioned)世界模型。DriftWorld 在推理时不进行迭代去噪,而是在训练期间学习一个动作条件的漂移场,从而允许它在单次前向传播中,根据当前观测和候选动作序列生成未来帧,速度达到 30+ fps,平均比基于扩散的基线快 17 倍。我们在标准的基于视觉的机器人操作基准测试上评估了 DriftWorld,包括 Bridge-V2、RT-1、Language Table、Push-T 和 Robomimic。通过生成既准确又快速的 Rollout,DriftWorld 以远少于基于扩散的基线的推理时间,实现了最先进的决策性能。此外,DriftWorld 可作为离线世界模拟器,用于在线机器人控制策略的排名,其基于 Rollout 的得分与真实得分的相关性高达 0.99。这些结果表明,漂移模型非常适合机器人世界建模,其中快速、高质量的想象直接支持规划和策略评估。视频和代码可在本网站获取。

关键词:世界模型,动作条件视频生成 [cs.RO] 1 引言

预测性世界模型已成为机器人学习的强大工具,使机器人能够在不执行真实世界动作的情况下预测其动作的结果。随着视频生成的最新进展,动作条件世界模型现在可以模拟细粒度的机器人-物体交互 [1, 2],渲染可控的多视角视频 [3],并生成长视距、时间一致的 Rollout [4]。此类模型带来了两个关键应用。首先,机器人可以通过在世界模型中 Rollout 候选动作提议并选择最佳的一个在真实世界中执行,从而改进其策略。其次,该模型可作为策略评估的离线模拟器。

然而,这些世界模型的实用价值受限于推理速度。最先进的模型主要基于扩散 [3, 5],因此依赖迭代的多步去噪来生成未来帧。这种多步采样对于实时规划来说太慢了。例如,最近关于生成式预测控制的工作 [5] 报告称,扩散世界模型的 Rollout 消耗了 90–95% 的运行时间,导致每个决策周期需要 3 秒或更长时间。因此,模拟数百次 Rollout 以识别最佳候选动作是不切实际的。

为了克服这一瓶颈,我们引入了 DriftWorld,这是一种基于漂移生成模型 [6] 的快速动作条件世界模型。与基于扩散的模型不同,DriftWorld 在单次前向传播中生成高质量的未来帧。DriftWorld 通过在训练时学习一个漂移场,将先验噪声分布映射到数据分布,从而实现 1 步生成。因此,推理不需要扩散模型中使用的迭代多步采样。

原始的漂移模型是为类条件图像生成而设计的。将其适应于动作条件视频生成需要重新思考三个组件:(1) 条件漂移

第 2 页

推理速度 生成 DriftWorld (Ours) IRASim WorldGym Ctrl-World LVDM VDM AVDC GPC

300 40 270.3 100.0 35 33.3 40 38.8 36.6 100 35 250 30 35 30 30 (FPS) 200 80 25 25 25 60 20 Second 150 20 Per 20

15 15 100 96.2 40 30.2 Frames 15 10 10 10 50 20 5 3.7 3.5 5 3.5 5 2.0 0.9 1.2 0.3 1.0 0.3 0.9 2.0 6.4 0.3 0 0 0 0 0 Push-T Robomimic Bridge-V2 RT-1 Language Table

图 1:DriftWorld 概述。DriftWorld 是一种基于漂移的动作条件世界模型,通过单次前向传播生成未来帧。它在所有五个环境中实现了 30+ fps 的生成速度,显著快于现有模型。DriftWorld 可用于高质量生成、高效规划以及策略的离线仿真。

由初始观测和动作序列定义的场,并进行了强调动作跟随的修改;(2) 漂移特征空间,利用 DINOv2/v3 [7, 8] 在复杂场景中保持视觉清晰度;(3) U-Net 架构,确保每个视频帧都精确地以相应动作为条件。

我们在标准的基于视觉的机器人操作基准上评估 DriftWorld,包括真实世界的 Bridge-V2 [9]、RT-1 [10] 和 Language Table [11] 数据集,以及模拟的 Push-T [12, 13] 和 Robomimic [14] 环境。DriftWorld 的平均速度比扩散世界模型基线快 17 倍,同时在 SSIM、PSNR、LPIPS、FID 和 FVD 指标上达到或超过其 Rollout 质量。此外,在 DriftWorld 中 Rollout 策略的动作提议并执行奖励最高的提议可以提升性能:例如,将 Push-T 的 IoU 从 0.635 提高到 0.781。除了在线控制,DriftWorld 还作为离线模拟器对真实世界策略进行排序,在 Push-T、Robomimic Lift 和 Robomimic Can 上与真实性能达到了 0.9515、0.9916 和 0.9250 的皮尔逊相关系数。综上所述,这些结果确立了漂移作为机器人世界建模的坚实基础,其中快速、高质量的想象直接支持规划和策略评估。总体而言,我们的主要贡献如下:

• DriftWorld:我们引入了一种单步、动作条件世界模型,通过单次前向传播生成每个 Rollout,平均速度比基于扩散的世界模型快 17 倍。

• 针对机器人仿真的漂移专业化:我们首次将漂移生成模型应用于条件视频预测,引入了动作增强的漂移场、特征空间漂移损失以及逐帧动作条件。

• 实验验证:我们表明,DriftWorld 在五个基准测试中的 Rollout 质量上达到或超过基线,同时运行速度显著更快,这使得推理时的动作搜索和离线策略评估更加高效。

2 相关工作

用于机器人的动作条件世界模型。预测基于动作条件的未来观测的世界模型在基于模型强化学习 [15, 16] 和机器人领域有着悠久的历史。早期方法在紧凑的潜在空间中运行,但最近的工作通过适配大规模视频生成模型,转向高保真视觉预测。UniSim [1]、GAIA-1 [21]、Genie [22] 以及 Cosmos [23, 24] 等开放权重平台将世界视为响应动作或文本展开的视频,越来越多的工作重新利用

2

第 3 页

将预训练的视频扩散模型用作交互式模拟器 [25, 26, 27]。针对机器人的特定模型,如 IRASim [2]、Ctrl-World [3]、Veo-Robotics [28] 和 UWM [29],能够生成具有多视角一致性的细粒度操作 Rollout,且学习到的模拟器正越来越多地被用作策略训练和评估的环境 [30, 28, 31]。这些模型几乎完全基于多步扩散或自回归 Transformer 构建,虽然能提供高视觉质量,但每帧需要数十次前向传播。DriftWorld 与这些系统共享高保真视觉预测的目标,但用针对动作条件设置的单步漂移生成器取代了迭代采样过程。

快速与少步生成模型。越来越多的工作旨在降低扩散模型的采样成本。渐进式蒸馏 [32] 和一致性模型 [33, 34] 训练学生模型沿扩散 ODE 采取大步长或单步长;整流流 [35] 使概率路径直线化以实现少步采样;而诸如 ADD [36] 等对抗性目标则通过从教师模型蒸馏来推动单步生成。在视频设置中,MagicDrive [37] 和 AnimateDiff-Lightning [38] 应用了类似的思想以获得少步视频采样器。这些方法大多假设存在一个预训练的多步扩散教师模型。漂移生成模型 [6] 则通过迭代地将模型的推前分布向数据分布移动(使用核化吸引-排斥场),从头开始学习单步生成器。据我们所知,我们的工作首次将漂移适应于条件序列预测问题,并表明为了使漂移在机器人世界建模中切实可行,针对动作条件视频所需的适应——动作增强漂移场、特征空间漂移以及逐帧 U-Net 条件控制——是必不可少的。

用于规划和策略评估的世界模型。通过构建模拟未来动态的世界模型,我们可以在想象中推演候选动作序列,从而实现在线策略改进和离线策略排序。基于采样的潜在世界模型规划器 [16, 39] 和最近的生成式预测控制方法 [5] 会对许多 Rollout 进行评分并执行最佳的一个。然而,正如 [5] 中所述,扩散 Rollout 占据了大部分决策时间计算量,这极大地限制了可以评估的提议数量。或者,我们可以使用世界模型直接想象未来计划 [40, 41, 42],但这类方法也受限于扩散生成的缓慢迭代性质。对于离线评估,Veo-Robotics [28]、WorldGym [30] 及相关工作 [1] 使用学习到的模拟器对真实世界策略进行排序,而无需昂贵的硬件 Rollout。DriftWorld 针对这两种场景:其单步 Rollout 允许在控制循环中对更多候选动作进行排序,而其高保真预测使其成为一个可靠的离线模拟器,与真实策略性能保持高度相关。

3 漂移世界模型

在本节中,我们介绍 DriftWorld,这是一种基于漂移的动作条件世界模型,能够通过单次前向传播生成高质量的未来帧预测。这种单步行为使得我们的模型在生成 Rollout 时比现有的主要基于多步扩散的动作条件世界模型显著更快。

3.1 问题表述

我们要解决的问题是动作条件视频生成。令 $o_t$ 表示时间 $t$ 时环境的视觉观测(例如单视角或多视角图像),令 $a_t$ 表示机器人在时间 $t$ 采取的动作。给定过去观测的历史 $o_{t-F:t} = (o_{t-F}, \dots, o_t)$ 和提议的未来动作序列 $a_{t:t+T} = (a_t, \dots, a_{t+T})$,我们的目标是在执行每个动作后准确预测未来的视觉观测 $o_{t+1:t+T+1}$:

$$ o_{t+1:t+T+1} \sim W(\cdot \mid o_{t-F:t}, a_{t:t+T}), $$

其中 $W$ 是动作条件世界模型。

3.2 通过漂移实现单步视频生成

现有的动作条件世界模型主要基于扩散模型,例如 [3, 2, 27]。然而,扩散模型需要多个采样步骤来生成未来帧,因此它们

第 4 页

当反复用于为实时规划生成策略 rollout 时,速度较慢。为了克服这一限制,我们提出了第一个基于近期漂移生成模型 [6] 构建的动作条件世界模型。通过漂移机制,我们的模型在一次前向传播中即可生成未来帧,这在效率上是一个显著的改进。

为了将漂移应用于视频生成,我们将该过程表述如下。令 $f_\theta$ 表示漂移世界模型,它将噪声先验 $\epsilon \sim p_\epsilon$ 和条件 $c$ 映射到生成的未来视频帧 $x = f_\theta(\epsilon, c)$。条件包括历史帧 $o_{t-F:t}$ 和未来动作 $a_{t:t+T}$。根据提供的条件动作数量,模型可以执行单步或块级模拟。为简洁起见,此后我们将省略条件 $c$。

生成视频帧的分布是推前分布 $q = f_\# p_\epsilon$。与依赖推理时迭代多步优化的扩散模型不同,漂移生成模型在训练期间优化生成分布 $q$,使其向真实数据分布 $p$ 演化。我们定义一个漂移场 $V_{p,q}(x)$,它控制样本如何移动以使 $q$ 向 $p$ 演化。给定来自模型当前推前分布 $q_i$ 的生成视频块 $x_i$,漂移后的新视频块 $x_{i+1}$ 定义为 $x_{i+1} = x_i + V_{p,q_i}(x_i)$。

漂移 $V_{p,q_i}(x_i)$ 是一个向量,它将 $x_i$ 吸引向 $p$ 中的正地面真值视频块,并将其排斥远离 $q_i$ 中的负生成视频块: $$ V_{p,q_i}(x) = V_{p^+}(x) – V_{q_i^-}(x), $$ 其中 $V_{p^+}(x)$ 和 $V_{q_i^-}(x)$ 分别是正视频块和负视频块的平均移动向量。虽然用于类别条件图像生成的标准漂移 [6] 使用多个正样本,但 DriftWorld 仅使用一个正样本,因为给定当前帧和要执行的动作,未来帧的正确序列只有一个。因此:

  • 正样本 $y^+$ 是从数据集中抽取的单个地面真值未来观测块 $o_{t+1:t+T+1}$。
  • 负样本 $y^-$ 由模型生成的 $N_{neg}$ 个未来观测块 $\hat{o}_{t+1:t+T+1}$ 组成。

关键在于,当生成分布 $q_i$ 与真实条件视频分布 $p$ 匹配时,达到平衡:此时漂移场变为 0,样本不再移动。

3.3 DriftWorld 的训练流程

训练目标与伪代码。 在训练期间,模型 $f_\theta$ 通过不动点迭代进行优化: $$ L = \mathbb{E}_\epsilon \left[ \| f_\theta(\epsilon) – \text{stopgrad}(f_\theta(\epsilon) + V_{p,q_\theta}(f_\theta(\epsilon))) \|^2 \right] $$ 该损失函数将模型的预测移向由漂移场偏移的冻结目标。

算法 1 提供了应用于数据集中单个视频的单步训练的伪代码。当对包含 $B$ 个视频的批次进行训练时,我们对每个视频独立执行此步骤。由于每个视频包含独特的历史观测序列和动作序列,模型必须计算 $B$ 个不同的、独立的条件漂移场。在这些漂移场中的每一个中,漂移是使用一个正样本(地面真值未来帧)和 $N_{neg}$ 个负样本(模型生成的未来帧)计算的。总损失是批次中 $B$ 个单独损失的总和。

算法 1 训练步骤 输入: $f$: U-Net 模型 输入: $y_{pos}$: $[1, T, C, H, W]$ 正样本 输入: $obs$: $[F, C, H, W]$ 历史观测 输入: $action$: $[T, D]$ 要执行的动作

1: $e \leftarrow \text{randn}([N, T, C, H, W])$ $\triangleright$ 噪声 2: $x \leftarrow f(e, obs, action)$ $\triangleright$ 生成样本 3: $y_{neg} \leftarrow \text{cat}([x, obs[-1]])$ $\triangleright$ 负样本 4: $V \leftarrow \text{compute\_V}(x, y_{pos}, y_{neg})$ 5: $x_{drifted} \leftarrow \text{stopgrad}(x + V)$ 6: $\text{loss} \leftarrow \text{mse\_loss}(x – x_{drifted})$

4

第 5 页

图 2:漂移架构与训练概览。(a)我们使用一个 U-Net 架构,其条件输入为历史观测和机器人动作。(b)DriftWorld 使用漂移损失进行训练,这是一种对比损失,旨在使生成的未来帧(负样本)向真实未来帧(正样本)漂移。

强调动作跟随。为了提高模型对动作条件的遵循程度,我们可选地在训练期间修改目标分布。给定动作 $a_t$ 和历史 $o_{t-F:t}$,我们从真实分布 $p(\cdot | a_t, o_{t-F:t})$ 中抽取正样本。然而,我们从以下混合分布中抽取负样本:(i) 生成的样本和 (ii) 未采取任何动作时的真实样本(即真实帧 $o_t$)。负样本分布变为:

$$ \tilde{q}(\cdot|a_t, o_{t-F:t}) \triangleq (1 – \gamma)q_\theta(\cdot|a_t, o_{t-F:t}) + \gamma p(\cdot|\emptyset, o_{t-F:t}), $$

其中 $\gamma \in [0, 1)$,两项分别为生成样本分布和真实无动作分布。

漂移空间。漂移损失计算的空间可根据数据集复杂度进行调整。对于较简单数据集,我们直接在模型的原始输出空间(例如像素空间)中计算损失。对于 Bridge-V2 [9] 和 RT-1 [10] 等复杂数据集,我们使用编码器 $\phi$ 将输出投影到特征空间。然后对这些特征应用损失,鼓励 $\phi(f_\theta(\epsilon))$ 向 $\phi(y^+)$ 漂移,并远离 $\phi(y^-)$。由于用于计算漂移均值偏移向量的核依赖于成对样本相似度,在特征空间中操作会产生更具语义意义的距离度量。

在实践中,我们使用 DINOv2/v3 [7, 8] 特征编码器。对于 $H \times W \times D$ 的特征图,我们在每个 $H \times W$ 空间位置创建一个独立的漂移场:每个漂移场在该位置操作 $D$ 维向量。最终损失是通过取所有漂移场的 $H \times W$ 个独立漂移损失的加权平均得到的,其中权重可以全部相等,也可以由该位置的运动幅度决定。

基于运动的加权。在真实世界机器人数据集中,连续帧之间机器人夹爪的运动相对较小。将所有空间位置的损失简单等权重的做法可能会使模型陷入动作无关的局部极小值,其中模型学习到一个恒等映射(即复制过去观测 $o_t$)以安全地最小化背景重建误差。为了惩罚模型忽略动作条件,我们在运动较大的空间位置赋予漂移损失更高的权重。运动量化为目标未来帧 $o_{t+1:t+T+1}$ 的特征与前帧 $o_t$ 特征之间的 $L_2$ 距离,权重是特定空间位置运动的双曲正切函数。详细信息见附录。

3.4 动作条件架构

对于 DriftWorld 的核心生成器,我们设计了一个动作条件 U-Net 架构(图 2a)。U-Net 的输入包括当前和历史帧 $o_{t-H:t}$、要执行的动作 $a_{t:t+T}$,以及可选的语言指令。其输出为预测的未来帧 $o_{t+1:t+T+1}$。

5

第 6 页

64帧 rollout 完整回合 rollout

世界模型 MSE ↓ SSIM ↑ PSNR ↑ LPIPS ↓ 耗时 (s) MSE ↓ SSIM ↑ PSNR ↑ LPIPS ↓ 耗时 (s)

GPC World Model [5] 0.0011 0.9717 33.1086 0.0239 0.0104 0.0011 0.9713 32.3692 0.0278 0.0309 AVDC [43] 0.0015 0.9862 30.4990 0.0100 0.1558 0.0021 0.9825 29.8518 0.0143 0.4897 Ctrl-World [3] 0.0180 0.8914 18.0705 0.1844 1.7714 0.0192 0.8854 18.0638 0.2513 2.0154 MSE Baseline 0.0035 0.9704 28.0578 0.0225 0.0037 0.0050 0.9632 26.5779 0.0389 0.0045 DriftWorld (Ours) 0.0007 0.9925 33.7753 0.0050 0.0037 0.0018 0.9846 31.6612 0.0146 0.0045

表 1:Push-T 任务中生成视频视觉质量的定量结果,针对起始环境平均 1000 个种子。我们还记录了每个世界模型生成每帧视频所需的平均秒数。所有耗时结果均在单张 H100 GPU 上测得。

GT

GPC Diffusion

MSE

DriftWorld (Ours)

图 3:不同世界模型在 Push-T 任务中的 rollout 对比。第一行为真实值(Ground Truth),其余三行为自回归生成的长度为 140 帧的 rollout。DriftWorld 的 rollout 与真实值相符。相比之下,对于 GPC 扩散世界模型和 MSE 基线,目标物体在后续帧中被部分抹除,导致红色 T 形块的最终位置不正确。

为了一次性生成多个未来帧,U-Net 使用了来自 [43] 的分解时空卷积:对每个时间步 $T$ 独立且同分布地应用空间卷积,然后在每个空间位置独立且同分布地应用时间卷积。

U-Net 使用 FiLM 对动作 $a_{t:t+T}$ 进行逐帧条件化,确保每个动作 $a_{t+i}$ 条件化由该动作产生的相应未来帧 $o_{t+i+1}$。模型还通过将历史帧与初始高斯噪声在通道维度上拼接来进行历史帧条件化。

3.5 DriftWorld 中的推理管道与策略模拟

在推理时,DriftWorld 使用单次前向传播 $f_\theta(\epsilon \mid o_{t-F:t}, a_{t:t+T})$ 生成未来视频帧,其中 $\epsilon$ 是高斯噪声。

这使得在 DriftWorld 中进行高效的下游策略模拟成为可能。考虑一个基于视觉的策略 $\pi$,它接收视觉观测的历史记录并输出一组要执行的动作块 $a_{t:t+T}$。世界模型模拟这些动作的结果,并将最终预测的观测值 $o_{t+T+1}$ 反馈回策略 $\pi$ 以生成下一个动作块。通过继续这种自回归过程,我们可以在世界模型内完全模拟长视距的策略 rollout。

4 实验

在本节中,我们进行实验以评估 DriftWorld,证明其性能匹配或超过现有的动作条件世界模型,同时以显著更快的速度生成 rollout。为了展示这一点,我们研究了三个核心能力:(i) 视频预测中的视觉质量和一致性(第 4.2 节),(ii) 模型在推理时改进策略的能力(第 4.3 节),以及 (iii) 模型作为离线模拟器用于策略评估的能力(第 4.4 节)。最后,我们在第 4.5 节中对 DriftWorld 的核心组件进行了消融实验。

4.1 实验设置

数据集。我们在五个机器人操作数据集上评估 DriftWorld:真实世界的 Bridge-V2 [9]、RT-1 [10] 和 Language Table [11] 数据集,以及模拟的 Push-T [13] 和

6

第 7 页

模型 SSIM ↑ PSNR ↑ LPIPS ↓ 耗时 (s) 模型 SSIM ↑ PSNR ↑ LPIPS ↓ 耗时 (s)

Lift 任务 Lift 任务 (双视角): 手腕视角 GPC [5] 0.9306 27.7798 0.0241 0.0331 GPC [5] 0.9376 25.1058 0.0770 0.0374 Ctrl-World [3] 0.8698 22.4874 0.0504 3.1602 Ctrl-World [3] 0.9020 19.8061 0.1724 3.1619 DriftWorld (Ours) 0.8907 30.4492 0.0401 0.0100 DriftWorld (Ours) 0.9571 29.4878 0.0341 0.0100

Can 任务 Lift 任务 (双视角): 智能体视角 GPC [5] 0.8917 22.9822 0.0711 0.0331 GPC [5] 0.9079 25.4217 0.0352 0.0374 Ctrl-World [3] 0.8801 22.6784 0.0817 3.1602 Ctrl-World [3] 0.8181 19.7703 0.0905 3.1619 DriftWorld (Ours) 0.8857 29.0428 0.0657 0.0100 DriftWorld (Ours) 0.9317 28.9818 0.0225 0.0100

表 2:Robomimic 任务上生成视频视觉质量的定量结果。左表为 Lift 和 Can 任务上的单视角生成结果,右表为 Lift 任务上的双视角(智能体和手腕视角)生成结果。Square 任务的结果见附录。我们还记录了每个模型生成单帧视频所需的平均秒数。

数据集 世界模型 SSIM ↑ PSNR ↑ LPIPS ↓ FID ↓ FVD ↓ 耗时 (s)

IRASim [2] 0.738 18.836 0.158 10.46 91.55 1.1031 LVDM [47] 0.741 19.191 0.154 9.86 103.51 0.2850 Bridge-V2 VDM [46] 0.725 18.417 0.167 39.88 159.16 3.2078 DriftWorld (Ours) 0.821 21.871 0.103 9.76 101.16 0.0300

IRASim [2] 0.757 21.053 0.151 4.60 93.02 1.1043 LVDM [47] 0.750 20.996 0.153 5.40 94.58 0.2844 RT-1 VDM [46] 0.540 13.822 0.246 31.68 406.13 3.1527 DriftWorld (Ours) 0.836 23.916 0.101 10.53 68.72 0.0258

IRASim [2] 0.877 26.846 0.055 9.30 60.05 1.1381 LVDM [47] 0.874 26.213 0.064 9.80 46.09 0.2704 Language Table VDM [46] 0.794 21.368 0.141 26.16 69.37 0.8660 DriftWorld (Ours) 0.913 25.974 0.062 12.53 39.09 0.0273

表 3:真实世界 Bridge-V2、RT-1 和 Language Table 数据集上生成视频视觉质量的定量结果。我们还记录了每个世界模型生成每帧视频所需的平均秒数。

Robomimic [14] 数据集。Bridge-V2 包含跨越 24 个环境的 60,096 条轨迹,而 RT-1 包含跨越 3 个环境的 87,212 条轨迹。这两个数据集主要位于厨房风格的环境中,我们将主摄像头视角调整为 256 × 256 分辨率。Language Table 包含 442,226 条桌面操作轨迹,我们将摄像头调整为 192 × 256 分辨率。对于模拟环境,我们使用了一个包含总共 500 次专家演示和随机探索轨迹的数据集,用于基于视觉的 Push-T 任务 [5]。我们还使用了包含 700 条轨迹的数据集,涵盖成功和失败案例,分别用于 Robomimic 的 Lift、Can 和 Square 任务。模拟数据集使用 96 × 96 的分辨率。

DriftWorld 设置。我们将 DriftWorld 的设置和漂移损失适应于每个环境的复杂度。给定当前帧、3 个历史帧和 T 个未来动作,DriftWorld 预测 T 个未来帧。我们将预测 horizon T 分别设置为 Push-T、Robomimic、Bridge-V2、RT-1 和 Language Table 数据集的 4、2、1、1 和 1。对于 Push-T 和 Robomimic,模型直接在像素空间中生成输出并计算漂移损失。为了处理真实世界数据集更高的分辨率和复杂度,U-Net 生成器改为在 Stable Diffusion 3 VAE [44, 45] 的潜在空间中运行,漂移损失在 DINOv2/v3 [7, 8] 特征空间中计算。

基线与评估指标。我们将 DriftWorld 与动作条件世界模型 IRASim [2]、WorldGym [30] 和 Ctrl-World [3] 进行比较。我们还针对 GPC 扩散世界模型 [5] 以及通过适配 VDM [46] 和 LVDM [47] 形成的两个用于动作条件视频生成的扩散模型进行评估。为了衡量生成视频的视觉质量,我们在验证集上计算 MSE、SSIM [48]、PSNR [49]、LPIPS [50]、FID [51] 和 FVD [52] 指标。这些指标针对 Bridge-V2 和 RT-1 上的 8 帧自回归生成,以及针对 Push-T、Robomimic 和 Language Table 上的全视频自回归生成。

4.2 世界建模的视觉评估

在所有四个环境中,DriftWorld 在视觉生成质量方面匹配或优于动作条件世界模型基线,同时其推理时间仅为基线的一小部分。

Push-T。表 1 显示了 64 帧和完整剧集(约 250 帧)自回归 rollout 的结果。DriftWorld 优于基线,尤其是在 64 帧视频上,同时生成

第 8 页

快 3.2 到 478 倍。此外,我们的模型优于 MSE 基线模型,该模型共享相同的 U-Net 主干网络,但使用标准 MSE 损失而非漂移损失进行训练。由于 MSE 基线模型也通过单次前向传播生成帧,因此它与 DriftWorld 提供了直接的对比。这一对比证实了漂移损失在 1 步生成中的有效性。

Robomimic。表 2 展示了 Robomimic 任务上的视觉质量指标。在单视图和双视图设置中,DriftWorld 的性能与 Ctrl-World 和 GPC 扩散世界模型相当,且速度显著更快。DriftWorld 生成的视频与 MuJoCo 真实模拟的对比示例见附录。

Bridge-V2、RT-1 和 Language Table。如表 3 所示,DriftWorld 在大多数视觉质量指标上优于基线模型。此外,DriftWorld 的推理时间远少于现有的动作条件世界模型。这些世界模型生成的视频可视化于图 4-5 中。DriftWorld 生成的视频紧密反映了真实环境的动力学特性,并且其动作跟随能力优于 IRASim。

GT

IRASim

WorldGym

DriftWorld (Ours)

图 4:不同世界模型在 Bridge-V2 上的 Rollout 对比。第一行为真实值(Ground Truth),其余行为生成的 Rollout。DriftWorld 准确模拟了机械手夹爪与黄瓜、盘子和蘑菇(左)以及积木(右)的接触交互。相比之下,IRASim 的视频显示了不准确的夹爪运动,而 WorldGym 的视频分别在盘子和积木上表现出伪影。

GT

WorldGym

IRASim

DriftWorld (Ours)

图 5:不同世界模型在 RT-1 上的 Rollout 对比。第一行为真实值,其余行为生成的 Rollout。DriftWorld 生成的视频显示了拿起杆子(左)和打开抽屉(右)的正确运动。

8

第 9 页

4.3 DriftWorld 中的推理时策略改进

与现有的扩散世界模型相比,DriftWorld 能够实现更快且更有效的推理时策略改进。我们通过采用预训练策略、在 DriftWorld 中对其动作提议进行 Rollout,并选择能产生最佳未来状态的动作来评估这一能力。

具体而言,我们采用 GPC-RANK 方法 [5]。在每一步中,基础策略采样 $K$ 个候选动作提议。每个提议都通过世界模型在想象中完成 Rollout。然后,一个奖励函数(来自 [5] 的 ResNet18+MLP 模型)对预测的未来观测值进行评分,并选择奖励最高的动作块用于真实世界执行。

我们将此方法应用于两个针对不同训练轮数训练的扩散策略 [13](详见附录 D)。如表 4 所示,使用 DriftWorld 并设置 $K=50$ 应用 GPC-RANK,与未增强的基础策略相比,显著提升了两个策略的最终交并比(IoU)得分。此外,DriftWorld 的性能优于 GPC 世界模型 AVDC 以及均方误差(MSE)基线,同时以极短的推理时间完成了所有候选提议的 Rollout。

表 4: GPC-RANK 性能。对于两种策略,本表展示了应用 GPC-RANK 后,结合各世界模型的 IoU 得分,并与未使用 GPC-RANK 时的 IoU 得分进行对比。我们记录了每个世界模型 Rollout 所有 $K$ 个动作提议所需的时间。

| World Model | Policy 1 IoU | Policy 2 IoU | Time (s) | | :— | :— | :— | :— | | N/A (Base Policy) | 0.635 | 0.612 | – | | GPC AVDC [43] World Model [5] | 0.698 / 0.726 | 0.614 / 0.682 | 2.24 / 106.1 | | MSE Baseline | 0.639 | 0.609 | 0.912 | | DriftWorld | 0.781 | 0.734 | 0.912 |

4.4 作为策略评估离线模拟器的 DriftWorld

DriftWorld 作为策略评估的准确离线模拟器,能够成功预测策略的绝对性能和相对排名。我们在 Robomimic 和 Push-T 任务中验证了这一能力。

Push-T。我们评估了七种扩散策略 [13],将它们在 DriftWorld 中的平均 IoU 得分与在地真 Push-T 模拟器中的得分进行比较。IoU 得分是方块和目标在 100 个初始化种子下的平均值。如图 6 所示,DriftWorld 正确地对策略进行了排名,仅在策略 5 和策略 6 之间出现一次反转,且绝对得分表现出 0.9515 的高皮尔逊相关系数。相比之下,基线 GPC 世界模型 [5] 存在多次排名错误,且相关性低得多,仅为 0.7345。

Robomimic。我们进一步在 Robomimic 任务上验证 DriftWorld。为此,我们在描绘失败案例的额外视频上对模型进行后训练。我们在世界模型中 Rollout 九种扩散策略 [13],并记录在 50 个环境初始化种子下的平均成功率。DriftWorld 中的模拟成功率与地真 MuJoCo 模拟器中的成功率非常接近,相关系数分别为 0.9916 和 0.9250,优于基线 Ctrl-World 模型 [3]。

图 6: 策略评估。在 Lift、Can 和 Push-T 任务上,与基线相比,DriftWorld 在预测值与地真值的成功率或 IoU 得分之间实现了更高的相关系数。

9

第 10 页

特征提取器的消融实验 自回归生成改进的消融实验

提取器 SSIM ↑ PSNR ↑ LPIPS ↓ FID ↓ FVD ↓ 改进措施 SSIM ↑ PSNR ↑ LPIPS ↓ FID ↓ FVD ↓

无 0.856 25.946 0.107 34.24 168.34 无 0.824 22.320 0.120 8.73 174.67 DINOv2 0.892 25.059 0.047 0.40 13.58 运动权重 0.830 23.416 0.109 11.63 67.88 DINOv3 0.892 25.000 0.046 0.62 6.20 运动权重 + 自强制 0.836 23.916 0.101 10.53 68.72

表 5:DriftWorld 核心组件的消融实验。在 Bridge-V2 数据集上,使用 DINOv2 或 DINOv3 作为特征提取器显著提升了性能(左图)。此外,引入运动权重和自强制(self-forcing)提升了 DriftWorld 在 RT-1 数据集上自回归生成的性能(右图)。

4.5 消融实验

最后,我们对 DriftWorld 的几个核心组件进行了消融实验。

特征空间的消融。漂移损失(drifting loss)计算所在的表示空间对生成质量有显著影响。在 Push-T 和 Robomimic 环境中,直接在像素空间中计算漂移损失就足够了。然而,在真实的 Bridge-V2、RT-1 和 Language Table 数据集上,我们在 DINOv2/v3 [7, 8] 的语义密集特征空间中计算漂移损失。我们在表 5 中对这一设计进行了消融,其中的指标是基于 DriftWorld 在验证集上单次前向传播生成的帧计算的。如果移除特征提取器,并直接在 VAE 潜在空间中计算漂移损失,性能会显著下降,且生成的机器人机械爪变得模糊(见图 7)。相比之下,如果使用 DINOv2 或 DINOv3 作为特征空间,生成的视频是清晰的。最后,值得注意的是,由于特征提取器仅在训练时用于计算漂移损失,它不会降低模型的推理速度。

运动权重和自强制的消融。如表 5 所示,漂移损失的运动权重以及自强制 [53] 对于 DriftWorld 在真实机器人数据集上的自回归生成至关重要。引入运动权重使 DriftWorld 能够精确捕捉机械爪随时间的运动,如显著降低的 FVD 分数所示,因为漂移损失在运动区域上的权重高于静态背景。增加第二个自强制训练阶段,其中模型以自身的预测而非真实帧为条件,进一步提升了性能。

5 讨论

局限性。我们的方法存在几个局限性。首先,我们的模型依赖于强大的预训练特征提取器(DINOv2/v3)以在复杂场景中保持视觉清晰度。其次,与标准扩散模型相比,漂移框架在训练时需要更高的内存使用量,因为模型需要在每次前向传播中生成多个负样本(例如 64 个)以计算漂移损失。因此,每个负样本的上下文帧数和生成帧数受限于 GPU 显存。未来的一个研究方向是增加上下文和生成窗口的长度,以提高长程时间一致性,这可能通过使用稀疏历史 [3] 或具有时间压缩功能的视频 VAE 来实现。

结论。在本文中,我们介绍了 DriftWorld,这是一种快速、单步、动作条件(Action-Conditioned)的世界模型。为了将漂移生成模型(Drifting Generative Models)适应于条件视频生成,我们提出了关键的适应性改进,包括动作条件 U-Net 架构、特征空间集成以及增强的动作跟随。DriftWorld 平均比最先进的扩散基线快 17 倍,并生成准确且视觉上一致的 Rollout,从而改进了推理时的动作搜索和可靠的离线策略评估。

10

第 11 页

参考文献

[1] S. Yang, Y. Du, S. K. S. Ghasemipour, J. Tompson, L. P. Kaelbling, D. Schuurmans, 和 P. Abbeel。学习交互式真实世界模拟器。在第十二届国际学习表征会议 (The Twelfth International Conference on Learning Representations) 上,2024。

[2] F. Zhu, H. Wu, S. Guo, Y. Liu, C. Cheang, 和 T. Kong。IraSim:用于机器人操作的细粒度世界模型。 在 IEEE/CVF 计算机视觉国际会议 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 论文集,第 9834–9844 页,2025。

[3] Y. Guo, L. X. Shi, J. Chen, 和 C. Finn。Ctrl-World:用于机器人操作的可控生成式世界模型。 在 ICLR 上,2026。

[4] Y. Du, S. Yang, P. Florence, F. Xia, A. Wahid, P. Sermanet, T. Yu, P. Abbeel, J. B. Tenen- baum, L. Kaelbling 等人。视频语言规划。在国际学习表征会议 (International Conference on Learning Representations) 上,卷 2024,第 31138–31155 页,2024。

[5] H. Qi, H. Yin, A. Zhu, Y. Du, 和 H. Yang。通过预测性世界建模增强推理时生成式机器人策略。IEEE 机器人与自动化快报 (IEEE Robotics and Automation Letters),2026。

[6] M. Deng, H. Li, T. Li, Y. Du, 和 K. He。通过漂移进行生成建模。arXiv 预印本 arXiv:2602.04770,2026。

[7] M. Oquab, T. Darcet, T. Moutakanni, H. Vo, M. Szafraniec, V. Khalidov, P. Fernandez, D. Haz- iza, F. Massa, A. El-Nouby 等人。Dinov2:无监督学习鲁棒视觉特征。 arXiv 预印本 arXiv:2304.07193,2023。

[8] O. Siméoni, H. V. Vo, M. Seitzer, F. Baldassarre, M. Oquab, C. Jose, V. Khalidov, M. Szafraniec, S. Yi, M. Ramamonjisoa 等人。DINOv3。arXiv 预印本 arXiv:2508.10104, 2025。

[9] H. R. Walke, K. Black, T. Z. Zhao, Q. Vuong, C. Zheng, P. Hansen-Estruch, A. W. He, V. My- ers, M. J. Kim, M. Du 等人。BridgeData V2:用于大规模机器人学习的数据集。在机器 人学习会议 (Conference on Robot Learning) 上,第 1723–1736 页。PMLR,2023。

[10] A. Brohan, N. Brown, J. Carbajal, Y. Chebotar, J. Dabis, C. Finn, K. Gopalakrishnan, K. Haus- man, A. Herzog, J. Hsu, J. Ibarz, B. Ichter, A. Irpan, T. Jackson, S. Jesmonth, N. Joshi, R. Ju- lian, D. Kalashnikov, Y. Kuang, I. Leal, K.-H. Lee, S. Levine, Y. Lu, U. Malla, D. Manjunath, I. Mordatch, O. Nachum, C. Parada, J. Peralta, E. Perez, K. Pertsch, J. Quiambao, K. Rao, M. Ryoo, G. Salazar, P. Sanketi, K. Sayed, J. Singh, S. Sontakke, A. Stone, C. Tan, H. Tran, V. Vanhoucke, S. Vega, Q. Vuong, F. Xia, T. Xiao, P. Xu, S. Xu, T. Yu, 和 B. Zitkovich。Rt- 1:用于大规模真实世界控制的机器人 Transformer。在 arXiv 预印本 arXiv:2212.06817 上, 2022。

[11] C. Lynch, A. Wahid, J. Tompson, T. Ding, J. Betker, R. Baruch, T. Armstrong, 和 P. Florence。 交互式语言:实时与机器人对话。IEEE 机器人与自动化快报 (IEEE Robotics and Automation Letters), 2023。

[12] P. Florence, C. Lynch, A. Zeng, O. A. Ramirez, A. Wahid, L. Downs, A. Wong, J. Lee, I. Mor- datch, 和 J. Tompson。隐式行为克隆。在机器人学习会议 (Conference on robot learning) 上,第 158–168 页。PMLR,2022。

[13] C. Chi, Z. Xu, S. Feng, E. Cousineau, Y. Du, B. Burchfiel, R. Tedrake, 和 S. Song。扩散 策略:通过动作扩散进行视觉运动策略学习。国际机器人研究杂志 (The International Journal of Robotics Research),44(10-11):1684–1704,2025。

[14] A. Mandlekar, D. Xu, J. Wong, S. Nasiriany, C. Wang, R. Kulkarni, L. Fei-Fei, S. Savarese, Y. Zhu, 和 R. Martín-Martín。在从离线人类演示中学习机器人操作时,什么因素很重要。arXiv 预印本 arXiv:2108.03298,2021。

11

第 12 页

[15] D. Ha 和 J. Schmidhuber。World models。arXiv 预印本 arXiv:1803.10122,2018。

[16] D. Hafner, T. Lillicrap, J. Ba 和 M. Norouzi。Dream to control: Learning behaviors by latent imagination。arXiv 预印本 arXiv:1912.01603,2019。

[17] T. Lozano-Perez。Robot programming。IEEE 汇刊,71(7):821–841,1983。

[18] B. Hou, G. Li, J. Jia, T. An, X. Guo, S. Leng, H. Geng, Y. Ze, T. Harada, P. Torr 等人。World model for robot learning: A comprehensive survey。arXiv 预印本 arXiv:2605.00080,2026。

[19] H. Chen, Y. Niu, K. Hong, S. Liu, Y. Wang, Y. Li 和 K. R. Driggs-Campbell。Predicting object interactions with behavior primitives: An application in stowing tasks。在第 7 届机器人学习年会 (Robot Learning) 上,2023。

[20] K. Hong, H. Chen, J. Xu, R. Wang, K. Wang, M. Zhang, S. Liu, Y. Zhu, Y. Li 和 K. Driggs-Campbell。Gotta Scoop ’Em All: Sim-and-Real Co-Training of Graph-Based Neural Dynamics for Long-Horizon Scooping。在 IEEE 机器人与自动化国际会议 (ICRA) 上,2026。待发表。

[21] A. Hu, L. Russell, H. Yeo, Z. Murez, G. Fedoseev, A. Kendall, J. Shotton 和 G. Corrado。Gaia-1: A generative world model for autonomous driving,2023。

[22] J. Bruce, M. Dennis, A. Edwards, J. Parker-Holder, Y. Shi, E. Hughes, M. Lai, A. Mavalankar, R. Steigerwald, C. Apps, Y. Aytar, S. Bechtle, F. Behbahani, S. Chan, N. Heess, L. Gonzalez, S. Osindero, S. Ozair, S. Reed, J. Zhang, K. Zolna, J. Clune, N. de Freitas, S. Singh 和 T. Rocktäschel。Genie: Generative interactive environments。在国际机器学习会议 (ICML) 上,2024。

[23] NVIDIA。Cosmos World Foundation Model Platform for Physical AI,2025。

[24] B. Chen, T. Zhang, H. Geng, C. Zhang, P. Li, K. Song, W. T. Freeman, J. Malik, P. Abbeel, R. Tedrake 等人。Large video planner enables generalizable robot control。arXiv 预印本 arXiv:2512.15840,2025。

[25] H. He, Y. Zhang, L. Lin, Z. Xu 和 L. Pan。Pre-trained video generative models as world simulators。在 AAAI 人工智能会议论文集上,2026。

[26] M. Rigter, T. Gupta, A. Hilmkil 和 C. Ma。AVID: Adapting video diffusion models to world models。Reinforcement Learning Journal,6:737–764,2025。

[27] S. Huang, J. Wu, Q. Zhou, S. Miao 和 M. Long。Vid2World: Crafting video diffusion models to interactive world models。在国际表征学习会议 (ICLR) 上,2026。

[28] G. R. Team, K. Choromanski, C. Devin, Y. Du, D. Dwibedi, R. Gao, A. Jindal, T. Kipf, S. Kirmani, I. Leal 等人。Evaluating gemini robotics policies in a veo world simulator。arXiv 预印本 arXiv:2512.10675,2025。

[29] C. Zhu, R. Yu, S. Feng, B. Burchfiel, P. Shah 和 A. Gupta。Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets。在机器人:科学与系统会议 (RSS) 论文集上,2025。

[30] J. Quevedo, A. K. Sharma, Y. Sun, V. Suryavanshi, P. Liang 和 S. Yang。Worldgym: World model as an environment for policy evaluation。arXiv 预印本 arXiv:2506.00613,2025。

[31] Y. Wang, R. Syed, F. Wu, M. Zhang, A. Onol, J. Barreiros, H. Nayyeri, T. Dear, H. Zhang 和 Y. Li。Interactive world simulator for robot policy training and evaluation。在机器人:科学与系统会议 (RSS) 上,2026。

[32] T. Salimans 和 J. Ho。Progressive distillation for fast sampling of diffusion models,2022。

12

第 13 页

[33] Y. Song, P. Dhariwal, M. Chen, 和 I. Sutskever。一致性模型。发表于 ICML,2023 年。

[34] Y. Song 和 P. Dhariwal。改进的一致性模型训练技术。发表于国际学习表征会议 (International Conference on Learning Representations),第 2024 卷,第 15078–15097 页,2024 年。

[35] X. Liu, C. Gong, 和 Q. Liu。流直线且快速:学习使用整流流生成和转移数据。arXiv 预印本 arXiv:2209.03003,2022 年。

[36] A. Sauer, D. Lorenz, A. Blattmann, 和 R. Rombach。对抗性扩散蒸馏。发表于 ECCV 2024,第 87–103 页,2024 年。

[37] R. Gao, K. Chen, B. Xiao, L. Hong, Z. Li, 和 Q. Xu。MagicDrive-V2:具有自适应控制的高分辨率长视频生成用于自动驾驶。发表于 IEEE/CVF 国际计算机视觉会议 (IEEE/CVF International Conference on Computer Vision),2025 年。

[38] S. Lin 和 X. Yang。Animatediff-lightning:跨模型扩散蒸馏。arXiv 预印本 arXiv:2403.12706,2024 年。

[39] N. Hansen, X. Wang, 和 H. Su。用于模型预测控制的时序差分学习。arXiv 预印本 arXiv:2203.04955,2022 年。

[40] Y. Du, S. Yang, B. Dai, H. Dai, O. Nachum, J. Tenenbaum, D. Schuurmans, 和 P. Abbeel。通过文本引导的视频生成学习通用策略。神经信息处理系统进展 (Advances in Neural Information Processing Systems),36:9156–9172,2023 年。

[41] M. J. Kim, Y. Gao, T.-Y. Lin, Y.-C. Lin, Y. Ge, G. Lam, P. Liang, S. Song, M.-Y. Liu, C. Finn, 和 J. Gu。Cosmos policy:微调视频模型以用于视觉运动控制和规划。arXiv 预印本 arXiv:2601.16163,2026 年。

[42] S. Ye, Y. Ge, K. Zheng, S. Gao, S. Yu, G. Kurian, S. Indupuru, Y. L. Tan, C. Zhu, J. Xiang, 等人。世界动作模型是零样本策略。arXiv 预印本 arXiv:2602.15922,2026 年。

[43] P.-C. Ko, J. Mao, Y. Du, S.-H. Sun, 和 J. B. Tenenbaum。通过密集对应关系从无动作视频中学习行动。发表于国际学习表征会议 (International Conference on Learning Representations),第 2024 卷,第 40938–40958 页,2024 年。

[44] P. Esser, S. Kulal, A. Blattmann, R. Entezari, J. Müller, H. Saini, Y. Levi, D. Lorenz, A. Sauer, F. Boesel, 等人。扩展整流流 Transformer 以实现高分辨率图像合成。发表于 ICML,2024 年。

[45] R. Rombach, A. Blattmann, D. Lorenz, P. Esser, 和 B. Ommer。使用潜在扩散模型进行高分辨率图像合成。发表于 CVPR,第 10684–10695 页,2022 年。

[46] J. Ho, T. Salimans, A. Gritsenko, W. Chan, M. Norouzi, 和 D. J. Fleet。视频扩散模型。神经信息处理系统进展 (Advances in Neural Information Processing Systems),35:8633–8646,2022 年。

[47] Y. He, T. Yang, Y. Zhang, Y. Shan, 和 Q. Chen。用于高保真长视频生成的潜在视频扩散模型。arXiv 预印本 arXiv:2211.13221,2022 年。

[48] Z. Wang, A. C. Bovik, H. R. Sheikh, 和 E. P. Simoncelli。图像质量评估:从误差可见性到结构相似性。IEEE 图像处理汇刊 (IEEE Transactions on Image Processing),13(4):600–612,2004 年。

[49] A. Hore 和 D. Ziou。图像质量指标:PSNR 与 SSIM。发表于第 20 届国际模式识别会议 (20th International Conference on Pattern Recognition),第 2366–2369 页。IEEE,2010 年。

[50] R. Zhang, P. Isola, A. A. Efros, E. Shechtman, 和 O. Wang。深度特征作为感知指标的非凡有效性。发表于 IEEE 计算机视觉与模式识别会议 (IEEE Conference on Computer Vision and Pattern Recognition),第 586–595 页,2018 年。

13

第 14 页

[51] M. Heusel, H. Ramsauer, T. Unterthiner, B. Nessler, 和 S. Hochreiter。通过双时间尺度更新规则训练的 GAN 收敛于局部纳什均衡。《神经信息处理系统进展》,30,2017。

[52] T. Unterthiner, S. Van Steenkiste, K. Kurach, R. Marinier, M. Michalski, 和 S. Gelly。迈向准确的视频生成模型:新指标与挑战。arXiv 预印本 arXiv:1812.01717,2018。

[53] X. Huang, Z. Li, G. He, M. Zhou, 和 E. Shechtman。自强制(Self forcing):弥合自回归视频扩散中的训练-测试差距。《神经信息处理系统进展》,38: 167283–167308,2025。

[54] J. Ho, A. Jain, 和 P. Abbeel。去噪扩散概率模型。《神经信息处理系统进展》,33:6840–6851,2020。

14

第 15 页

附录

A 节展示了额外的定性结果:(i) DriftWorld 在 Bridge-V2、RT-1 和 Language Table 数据集上生成的视频可视化,以及 (ii) DriftWorld 中策略 rollout 的可视化。B 节包含关于生成视频视觉质量的额外定量结果。C 节提供了 DriftWorld 的更多消融实验和可视化。D 节描述了实现细节和超参数。代码位于 https://github.com/Susie-Lu/driftworld。

A 额外定性结果

A.1 Bridge-V2、RT-1 和 Language Table 上生成视频的比较

图 8-10 在 Language Table、Bridge-V2、RT-1 数据集上将 DriftWorld 与动作条件世界模型基线进行了比较。DriftWorld 生成的视频与真实情况非常相似。在这三张图中,省略了初始的真实条件帧。

GT

LVDM

IRASim

DriftWorld (Ours)

图 8: DriftWorld 与基线在 Language Table 上生成的视频比较。

GT

WorldGym

IRASim

DriftWorld (Ours)

图 9: DriftWorld 与基线在 Bridge-V2 上生成的视频比较。

15

第 16 页

GT

WorldGym

IRASim

DriftWorld (本文方法)

图 10:在 RT-1 上,DriftWorld 与基线方法生成的视频对比。

A.2 DriftWorld 策略 Rollout 的对比

如图 11 和图 12 所示,DriftWorld 的策略 Rollout 与真实标签(ground-truth)Rollout 非常相似。

示例 1 示例 2

GT

GPC Diffusion

DriftWorld (本文方法)

图 11:Push-T 任务的策略 Rollout。定性比较显示,DriftWorld 紧密匹配真实标签 Rollout,并且比基线 GPC 扩散模型更准确地遵循动作条件。

B 额外定量结果

表 6 提供了 Robomimic Square 任务的视觉质量指标,该任务未在正文表 2 中展示。

模型 SSIM ↑ PSNR ↑ LPIPS ↓ 耗时 (s)

GPC [5] 0.8126 19.7108 0.0971 0.0311 Ctrl-World [3] 0.7509 17.2030 0.1495 5.2407 DriftWorld (本文方法) 0.7621 21.9541 0.0967 0.0100

表 6:Robomimic Square 任务上生成视频的视觉质量定量结果。除了正文中展示的 Lift 和 Can 任务外,DriftWorld 在该高精度 Robomimic 任务上也表现合理。

16

第 17 页

Lift 任务 Can 任务

Ground Truth

DriftWorld

Lift 任务 (双视角) Square 任务

Ground Truth

DriftWorld

图 12: Robomimic Lift、Can 和 Square 任务的政策 Rollout。生成的视频在所有三个任务上都与真实情况高度吻合。

C DriftWorld 的额外消融实验

在本节中,我们对 DriftWorld 的核心组件进行了进一步的消融实验。

C.1 单帧与块级模拟

DriftWorld 支持在单次前向传播中进行单帧和块级模拟。如表 7 所示,生成 4 个未来帧在 Push-T 任务上表现最佳。

64 帧 Rollout 完整剧集 Rollout

生成的帧数 SSIM ↑ PSNR ↑ LPIPS ↓ SSIM ↑ PSNR ↑ LPIPS ↓

1 0.9840 37.1658 0.0123 0.9801 35.3356 0.0149 2 0.9897 32.1240 0.0073 0.9793 29.9867 0.0211 4 0.9925 33.7753 0.0050 0.9846 31.6612 0.0146

表 7: Push-T 任务中生成块大小的影响。无论 DriftWorld 每次前向传播输出 1、2 还是 4 帧,生成的视频都具有高视觉质量。

C.2 强化动作跟随

给定一个预训练的 DriftWorld 模型,我们可以在推理时灵活指定并改变用于强化动作跟随的比例 $\alpha$,而无需重新训练模型。图 13 展示了我们在 Bridge 数据集上变化 $\alpha$ 时 DriftWorld 的生成效果。当机械臂夹爪快速移动时(如第二和第三帧),对于较高的 $\alpha$ 值(2.5 和 3.5),生成的视频帧清晰,而对于较低的 $\alpha$ 值(1.0 和 2.0),则不清晰。这表明强化动作跟随确实增强了模型遵循指定动作的能力。

为了实现在推理时变化 $\alpha$ 的能力,我们让 DriftWorld U-Net 将 $\alpha$ 作为输入,并在训练期间,我们从概率分布中随机采样 $\alpha$,以便 DriftWorld 接触到各种 $\alpha$ 值。我们从区间 $[1, 4]$ 上的对数均匀分布中采样 $\alpha$,即 $p(\alpha) \propto \alpha^{-1}$。

C.3 漂移损失的运动加权

如图 14 所示,第 3.3 节中的运动加权技术对于 DriftWorld 在具有复杂背景的机器人真实数据集上的自回归生成至关重要。如果没有运动加权,生成的机械臂夹爪大多处于静止状态。相比之下,有了运动加权,生成的夹爪会根据动作移动,生成的视频也与真实情况相似。

17

第 18 页

生成的帧

1.0

2.0

2.5

3.5

图 13:在不同尺度 $\alpha$ 下,DriftWorld 在 Bridge-V2 数据集上生成的视频对比,以强调动作跟随效果。随着 $\alpha$ 的增加,生成的机械臂末端执行器更紧密地跟随指定动作。参见第 2、3 和 6 帧。

真实值 (GT)

无运动权重

运动权重

图 14:运动加权对 DriftWorld 在 RT-1 上自回归生成的影响。在没有运动加重的情况下,机械臂末端执行器在后续帧中基本保持静止。相比之下,应用运动加权确保末端执行器根据动作条件正确移动。

D 实现细节

D.1 DriftWorld 细节

DriftWorld 的超参数如表 8 所示。此外,除了主论文中描述的方法外,我们在训练 DriftWorld 时对漂移场应用了归一化和多温度聚合。

归一化。为了确保漂移场对特征空间中样本的原始幅度和维度不敏感,我们应用了两种归一化。基础漂移场计算为 $V_{p,q_i}(x) = V_{p+}(x) – V_{q_i-}(x)$,其中 $V_{p+}(x)$ 和 $V_{q_i-}(x)$ 是均值偏移向量

18

第 19 页

正样本和负样本的漂移场。每个向量是正/负样本与生成样本 $x$ 之间差异的核加权平均值。首先,我们应用特征归一化,使得无论样本的维度如何,核函数都能取到合理的值范围。我们将样本除以其平均成对距离。然后计算核函数 $k(x, y) = \exp \left( – \frac{\|\tilde{x} – \tilde{y}\|}{\tau \cdot C} \right)$,其中 $\tau$ 是温度。此外,我们按幅度对漂移场进行归一化,以便可以将多个漂移场相加。

多温度聚合。在应用上述归一化后,我们在多个核温度 $\tau$ 上聚合漂移场。聚合后的场为 $\tilde{V} = \sum_{\tau} \tilde{V}_{\tau}$,我们在此基础上计算最终的漂移损失。温度决定了哪些样本 $y$ 被认为与给定样本 $x$ 接近。在低温度下,生成的样本 $x$ 主要受其最近邻的吸引和排斥;而在高温度下,它受周围较大半径内样本的影响。

运动加权。我们对具有较大运动的空域位置施加更高的漂移损失权重。具体而言,给定一个 $H \times W \times D$ 的特征图,整体损失为 $L = \mathbb{E}_{h,w}[c_{h,w} \cdot \ell_{h,w}]$,其中期望是对所有 $H \times W$ 空域位置取的,$c_{h,w}$ 是位置 $(h, w)$ 处的权重,$\ell_{h,w}$ 是该位置处的个体漂移损失。默认设置为 $c_{h,w} = 1$,这在没有复杂背景的环境中效果良好。当使用运动加权时,权重由通用公式 $c_{h,w} = 1 + \lambda \tanh(\alpha \cdot n_{h,w})$ 确定,其中 $n_{h,w}$ 是真实当前帧和未来帧特征之间的归一化差异,$\lambda$ 和 $\alpha$ 是标量。

特征提取器。在真实机器人数据集上,我们在 (i) DINOv3 的特征空间和 (ii) VAE 潜在空间中计算漂移损失。总损失由这两个分量相加构成。对于 DINOv3,我们从 DINOv3 ViT-B/16 的第 2、5 和 8 个块的输出中提取特征。该特征图是一个由 768 维 token 组成的 $16 \times 16$ 网格,因此我们在每个空域位置上计算 256 个独立的漂移损失,并取其加权平均值以形成整体的 DINOv3 漂移损失。对于 VAE 潜在空间,它形成一个由 16 维 token 组成的 $32 \times 32$ 网格,因此我们在每个空域位置上计算 1024 个独立的漂移损失,并取其加权平均值以形成整体的潜在漂移损失。

自强制。我们采用自强制训练 [53] 以提高 DriftWorld 在更复杂数据集上的自回归 Rollout 性能。具体而言,我们的模型训练分为两个阶段。在第一阶段,我们始终以真实历史帧为条件对 DriftWorld 进行条件化。在第二阶段,我们从第一阶段检查点初始化,然后通过让 DriftWorld

19

第 20 页

自回归地生成,将其自身生成的帧(梯度已分离)作为输入。每个生成的负样本 $n_{neg}$ 都会继续其自身的 Rollout。

D.2 DriftWorld 中推理时策略改进的详细信息

以下是关于通过 GPC-RANK [5] 在 DriftWorld 中进行推理时策略改进的更多细节。

扩散策略。我们使用的策略是扩散策略 [13],它根据视觉观测历史 $o_{t-H:t}$ 输出动作块 $a_{t:t+T}$。我们遵循标准设置:观测视界 $H=2$,预测视界 $T=16$,动作视界为 9,并以滚动视界的方式执行控制。扩散策略使用 ResNet18 视觉编码器和 U-Net 扩散主干来建模动作分布。该策略使用 DDPM 公式 [54] 进行训练,并在推理时使用 100 个扩散去噪步骤。在 GPC-RANK 表(表 4)中,策略 1 来自 [5] 的检查点,我们使用相同的代码训练了策略 2。

奖励预测器。在 DriftWorld 中 Rollout 动作提议后,我们需要将动作提议从最好到最差进行排序。为此,我们使用奖励预测器从未来视觉帧中估计 $T$ 块与目标之间的距离。遵循 [5],我们使用两个 ResNet18 网络来估计块的空间位置 $(x, y)$ 和方向 $(\cos \theta, \sin \theta)$。利用此估计的姿态以及目标姿态,我们计算两种配置下块的八个角顶点的坐标。最终奖励是这些对应顶点集之间欧几里得距离之和的 0.01 倍。因此,较小的奖励表示更紧密的对齐,而零奖励表示块与目标完美匹配。

D.3 DriftWorld 中策略评估的详细信息

评估的策略。对于 Push-T 任务,我们选取扩散策略在 epoch 50、100、…、300 处的六个检查点,以及在 epoch 650 处经过更长训练的检查点。对于 Robomimic Lift 任务,我们分别选取扩散策略在 epoch 2、4、6、…、18 处的九个检查点。对于 Robomimic Can 任务,我们选取扩散策略在 epoch 50、100、…、400 以及 epoch 75 处的九个检查点。

在失败演示上的后训练。对于 Robomimic Lift 和 Can 任务,DriftWorld 和基线模型最初在多人类数据集 [14] 上进行训练,该数据集仅包含成功的演示。由于这些初始模型对策略成功率的估计过于乐观,我们在包含大量失败演示的数据集上对模型进行后训练,该数据集是通过 Rollout 扩散策略的早期检查点创建的。这种后训练使模型能够准确地模拟失败情况。

20

发表评论