不用真实机器人也能采集遥操作数据?RynnWorld-Teleop

三分钟导读:为解决2D投影歧义,我们引入深度感知动作表征。通过深度调制颜色与大小渲染21关节手部姿态,将3D动态信息编码至2D骨架视频中,确保动作条件的精确性与可恢复性。

英文题目:RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

论文出处:arXiv 每日论文精选 · arXiv:2607.06558

原始论文:PDF / 论文页面

对应视频标题:不用真实机器人也能采集遥操作数据?RynnWorld-Teleop|推荐指数:★★★★★

这篇论文解决什么问题?

传统物理遥操作受限于硬件成本、固定工作空间及高昂的数据采集开销,难以获取大规模多样化轨迹数据。这成为制约通用机器人自主性发展的核心瓶颈。

核心创新

方法概览

为解决2D投影歧义,我们引入深度感知动作表征。通过深度调制颜色与大小渲染21关节手部姿态,将3D动态信息编码至2D骨架视频中,确保动作条件的精确性与可恢复性。

逐图理解论文

数字遥操作范式

数字遥操作范式
Figure 1 Physical vs. Digital Teleoperation. (Top) Physical teleoperation binds every demonstration to a real robot and a fixed workspace, capping throughput at operator-hours × hardware availability. (Bottom) Digital teleoperation replaces the real robot with RynnWorld-Teleop, a real-time action-conditioned world model that synthesizes the egocentric video the robot would have produced from a single reference image, and retargets the same gesture stream into embodiment-specific robot actions. Both pipelines emit synchronized (RGB observations, robotic actions) pairs, so digital teleoperation is drop-in compatible with downstream imitation learning, without ever moving a real robot.

RynnWorld-Teleop提出‘数字遥操作’范式。它利用动作条件世界模型,仅凭单张参考图像和人手姿态流,即可合成机器人第一视角视频。无需移动真实机器人,即可生成用于模仿学习的高质量数据。

深度感知动作表征

深度感知动作表征
Figure 2 Depth-Aware Representation. We bridge the gap between 2D projections and 3D dynamics by rendering hand skeletons with depth-modulated color and size.

为解决2D投影歧义,我们引入深度感知动作表征。通过深度调制颜色与大小渲染21关节手部姿态,将3D动态信息编码至2D骨架视频中,确保动作条件的精确性与可恢复性。

模型架构与训练

模型架构与训练
Figure 3 Overview of RynnWorld-Teleop. (a) Actions are rendered as depth-aware skeletal videos and encoded into the latent space via a VAE. (b) We expand a pretrained video DiT to incorporate hand-pose conditioning using a distribution-aligned patch embedding branch. (c) The model is distilled into a causal student for interactive, autoregressive generation using a streaming rollout schedule.

核心架构基于Video DiT。我们采用渐进式训练策略:先在大规模人类第一视角视频上预训练以获取操作先验,再针对特定机器人本体进行微调。通过分布对齐的Patch Embedding分支融合手部姿态条件。

真实世界策略评估

真实世界策略评估
Table 3 Real-world policy performance. Success rates (%) across four complex tasks.

我们在TIANJI M6双臂机器人上评估了四种任务。在‘方块推’任务中,仅使用RynnWorld-Teleop生成的数据,π0策略成功率即达82.86%。在‘盖子放置’任务中,混合数据使成功率从42.86%提升至62.86%。

视觉质量与基线对比

视觉质量与基线对比
Table 4 Quantitative results of RynnWorld-Teleop. We report visual quality metrics and inference speeds. Text- and Action-conditioned World Models, as well as the Ablation Study, are evaluated on EgoDex-Test, while Robot-Specific evaluations are conducted on Robotic-Test.

在EgoDex-Test上,RynnWorld-Teleop的FVD为550,优于InterDyn的655。PSNR达到26.78。相比依赖SAM掩码的基线,稀疏骨架条件实现了更高的保真度与时间连贯性。

实验与关键结果

阅读时需要注意

  • 需注意,模型在处理精细液体动力学或高变形物体时仍有困难。‘零真实数据’性能虽具竞争力,但在高精度任务上仍低于混合数据方案。长程生成需分块重锚定以缓解视觉漂移。
  • The 'Zero-Real-Data' performance, while competitive, is lower than mixed-data approaches for high-precision tasks like Lid Placement.
  • Visual drift in long-horizon generation is mitigated by chunked re-anchoring, implying pure autoregressive generation may degrade over time.
  • Generalization to OOD objects/backgrounds is demonstrated via image editing, but real-world robustness to arbitrary novel scenes is not fully quantified.

关联工作


展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

RynnWorld-Teleop:用于数字遥操作的行动条件世界模型

赵浩宇∗1,2,3,赵星月∗1,李航宇5,龚标6,李克寒1,4,黄思腾†1,4,李欣1,4,赵德利1,李忠宇†2,3

1阿里巴巴集团达摩院,2香港具身智能实验室,3香港中文大学,4湖畔实验室, 5阿里巴巴集团,6蚂蚁集团 ∗共同一作,†通讯作者

扩展机器人学习需要大量、多样化的轨迹数据,然而目前的收集过程受限于物理遥操作,其中每一次演示都将操作员的时间绑定到特定的硬件和工作空间上。我们引入了数字遥操作(Digital Teleoperation),这是一种通过将真实机器人替换为生成式世界模型,从而将数据收集与物理约束解耦的范式。在该框架中,操作员的手部姿态流驱动一个以机器人为中心的生成式世界模型,从单张参考图像合成高保真第一人称视频。记录下来的姿态流作为与具身无关的动作标签,可通过标准重定向(Retargeting)/姿态映射传输到任何目标机器人,从而为模仿学习生成独立于物理硬件的完整状态-动作轨迹。我们在 RynnWorld-Teleop 中实例化了这一范式,该系统集成了深度感知骨骼条件控制、在视频扩散 Transformer(DiT)上进行的渐进式人类到机器人训练,以及流式自回归蒸馏。该流水线将生成过程压缩为单次推理,在单张 H100 GPU 上实现了 40+ FPS 的实时交互式生成。仅在 RynnWorld-Teleop 生成的数据上训练的策略,在灵巧且多样的双臂任务中实现了有效的零样本仿真到现实迁移(Sim2Real)。此外,使用我们数字遥操作数据增强真实世界数据集,一致性地提高了成功率,证明了 RynnWorld-Teleop 可作为下一代机器人代理的高保真、可扩展数据引擎。

https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io https://github.com/alibaba-damo-academy/RynnWorld-Teleop[cs.RO] https://huggingface.co/Alibaba-DAMO-Academy/RynnWorld-Teleop https://www.modelscope.cn/models/DAMO_Academy/RynnWorld-Teleop

日期:2026年7月8日

1 引言

机器人领域的最新进展,如视觉-语言-动作(VLA)模型(Black 等人,2024;Brohan 等人,2022;Kim 等人,2024;Li 等人,2026b;Zhao 等人,2026b)和世界模型(Agarwal 等人,2025;Ali 等人,2025),显示出通用自主性的新兴潜力,但仍严重受到数据稀缺的阻碍(Zhao 等人,2026a;Lepert 等人,2025a;Zhao 等人,2023)。获取此类大规模机器人数据将使得训练更加直接,并可能解锁更高的性能上限。虽然传统的遥操作系统(Li 等人,2025b;Ze 等人,2025;Zhao 等人,2025a)提供了高质量的专家数据,但它们通常局限于固定的实验室环境和特定物体(Zhao 等人,2025b;Guo 等人,2026;Zhao 等人,2024)。手动环境重置的巨大开销以及获取多样化真实世界物体的后勤挑战,阻止了这些系统捕捉交互的长尾分布。因此,实现非结构化环境所需的鲁棒泛化仍然是一个开放挑战,仅靠物理平台无法解决。

我们提出通过用生成式机器人替换真实机器人,将操作员时间与物理基础设施解耦。我们将这一范式称为数字遥操作:操作员实时手部姿态流被

第 2 页

物理遥操作

真实世界数据集 重定向/姿态映射 控制 RGB 观测 机器人动作 人类操作员 关节空间动作 真实机器人 硬件绑定 固定工作空间 手动重置

数字遥操作 硬件无关 零资产开销 实时

骨架 渲染 生成 合成数据集

RGB 观测 机器人动作 深度感知 实时视频 人类操作员 骨架表示 流式 重定向/姿态映射

图 1 物理遥操作与数字遥操作对比。(上)物理遥操作将每次演示绑定到真实机器人和固定工作空间,吞吐量上限受限于操作员工时与硬件可用性。(下)数字遥操作用 RynnWorld-Teleop 替代真实机器人,RynnWorld-Teleop 是一个实时的、动作条件化的世界模型,它根据单张参考图像合成机器人本应产生的第一人称视频,并将相同的姿态流重定向/姿态映射为特定具身机器人的动作。两条流水线均输出同步的(RGB 观测,机器人动作)对,因此数字遥操作可直接兼容下游模仿学习,而无需移动任何真实机器人。

一个生成式世界模型,该模型以目标场景的单张参考图像为条件,合成如果机器人实际执行该姿态本应产生的第一人称视频(图 1)。关键在于,由于生成的视频以操作员的关节级手部姿态为基准,所记录的姿态本身即作为一个具身无关的、作为真实标签的动作信号,可通过标准的重定向/姿态映射流水线迁移到任何具体的机器人具身上。生成的视频随后提供匹配的视觉观测,由此产生的轨迹可直接被下游模仿学习算法使用,而无需移动任何真实机器人。如果数字遥操作可行,机器人数据收集将仅受限于操作员的想象力,而非物理基础设施。

近期有两类工作触及这一目标,但未能弥合差距。人类到机器人视频翻译方法 (Lepert et al., 2025a; Li et al., 2025a; Lepert et al., 2025b; Song et al., 2025) 试图通过将机器人具身渲染或翻译到人类演示帧中来“机器人化”人类视频,以弥合视觉差距。尽管它们跨越了视觉差距,但本质上是被动的且仅涉及观测:底层机器人动作从未产生,且庞大的 DiT (Diffusion Transformer) 骨干网络排除了闭环交互的可能性。动作条件化的第一人称世界模型 (Hao et al., 2026; Wang et al., 2026, 2025b; Xie et al., 2026; Tu et al., 2025) 更进一步,能够从人类控制信号中合成未来帧,但它们仍然以人类为中心。渲染出的手仍然是人手,未能弥合具身差距。一个真正的数字遥操作系统必须同时满足:(i) 以机器人为中心,以便操作员可以遥操作机器人;(ii) 以动作为基准,以便每一帧生成都与可恢复的关节级动作信号相关联;(iii) 实时,以便操作员保持在控制回路中并能串联起复杂技能。没有任何现有框架能同时满足这三点。

第 3 页

图 2 深度感知表示。我们通过渲染具有深度调制颜色和尺寸的手部骨架,弥合 2D 投影与 3D 动态之间的差距。

为此,我们提出了 RynnWorld-Teleop,这是第一个以严格意义实现数字遥操作(Digital Teleoperation)的系统,如图 1 所示。RynnWorld-Teleop 是一个以机器人为中心、以动作为条件的世界模型(World Model),它从第一人称视角流式传输高保真交互式视频,其帧率兼容实时控制。它围绕以下三个针对上述需求量身定制的核心设计构建:

  • 深度感知动作表示(第 3.2 节,图 2):RynnWorld-Teleop 渲染 21 个关节的手部姿态,其颜色和半径根据相机距离进行调制,通过 2D 潜在条件信号提供明确的 3D 线索。
  • 渐进式跨域训练(第 3.4 节):RynnWorld-Teleop 首先在大规模第一人称人类视频上进行预训练,以吸收操作先验知识,然后在配对的人机数据上进行微调,以弥合具身差异。
  • 流式自回归蒸馏(第 3.5 节):我们使用与 rollout 一致的调度策略,将双向教师模型蒸馏为因果学生模型,从而实现稳定、实时且长视野的生成。

我们既将 RynnWorld-Teleop 作为生成模型进行评估,更重要的是将其作为数字遥操作系统进行评估,其输出为机器人训练数据。关键在于,仅使用 RynnWorld-Teleop 生成的数据训练的策略,能够在多样化的真实世界操作任务中实现有效的零样本 Sim2Real 迁移;而用数字遥操作数据增强真实演示数据,则一致地提高了成功率。这些结果表明,RynnWorld-Teleop 成功地将数字遥操作从一个诱人的概念转变为下一代机器人学习中可扩展且高效的工具。总之,我们的工作做出了以下贡献:

  • 我们将数字遥操作形式化为一种新的机器人数据生成范式,其中操作员的手部姿态流驱动以机器人为中心的世界模型,生成用于模仿学习的视频,并确定了任何实际实例必须满足的三个要求(以机器人为中心、以动作为基础、实时)。
  • 我们提出了满足所有三个要求的以动作为条件的第一人称世界模型 RynnWorld-Teleop,它将深度感知骨架表示、渐进式人机训练和流式自回归蒸馏结合到一个单一的 40+ FPS 交互式模型中。
  • 我们进一步将 RynnWorld-Teleop 扩展为一个完整的数字遥操作(Digital Teleoperation)系统,该系统能够从单张参考图像实例化任意操作场景,通过重定向(Retargeting)、骨架条件合成和分块重新锚定,生成无限制的动作条件 rollout。
  • 我们表明,仅使用我们数字遥操作(Digital Teleoperation)系统生成的数据训练的策略可以零样本迁移到真实机器人,并且用此类数据增强真实演示数据可以进一步提高成功率,提供了首个实证证据,证明数字遥操作可以作为高保真数据引擎,在机器人学习中既替代又增强物理遥操作。

第 4 页

2 相关工作

2.1 动作条件的自我中心世界模型

世界建模的范式最近已从潜在空间状态预测 (Ha and Schmidhuber, 2018; Assran et al., 2025) 转向高保真视觉模拟,这得益于视频扩散模型的快速进步 (Kong et al., 2024; Wang et al., 2025a; Yang et al., 2024)。Cosmos (Agarwal et al., 2025) 和 Genie (Bruce et al., 2024) 等基础模型展示了通过在大规模视频数据集上进行训练来实现物理 AI 的潜力。然而,这些模型通常仅支持粗粒度控制,这对于复杂的机器人任务来说是不够的。

为了实现细微的控制,一类新的动作条件的自我中心世界模型 (Hao et al., 2026; Wang et al., 2026; Xie et al., 2026; Tu et al., 2025; Goswami et al., 2025; Pallotta et al., 2025; Gao et al., 2026) 应运而生,其重点在于生成由人类动作信号驱动的第一人称视频。例如,Hand2World (Wang et al., 2026) 将双向视频扩散模型蒸馏 (Yin et al., 2025; Huang et al., 2025) 为因果自回归生成器,用于单目流式合成。GeneratedReality (Xie et al., 2026) 以手部动作为条件进行未来帧合成,以生成交互式视频。InterDyn (Akkerman et al., 2025) 通过类似 ControlNet (Zhang et al., 2023) 的分支以二值手部掩码为条件,而 CosHand (Sudhakar et al., 2024) 从掩码输入生成单帧手物交互。尽管取得了这些进展,现有的模拟器仍然主要以人类为中心,主要关注在虚拟场景中合成人类手部运动。RynnWorld-Teleop 将这一前沿扩展到了以机器人为中心的领域,弥合了大规模人类运动先验与可操作的、特定于机器人的世界建模之间的差距。

2.2 人类到机器人的视频翻译

现代视频生成模型已从文本到视频合成 (Kong et al., 2024; Wang et al., 2025a; Yang et al., 2024) 演变为处理多模态提示的复杂系统 (Bruce et al., 2024; Jin et al., 2024)。在机器人领域,早期的工作 (Kuaishou, 2024; Runway, 2025) 专注于视觉上的“人类到机器人”翻译。例如,Phantom (Lepert et al., 2025b) 和 Masquerade (Lepert et al., 2025a) 使用图像修复和渲染技术,将机器人手臂叠加到估计的人类姿态上。X-Humanoid (Yang et al., 2025) 和 Mitty (Song et al., 2025) 利用 Diffusion Transformer 进行视频到视频的翻译,而 H2R (Li et al., 2025a) 提出了用于预训练的人类到机器人数据增强。尽管跨越了视觉领域的差距,但这些方法在很大程度上是被动的且仅用于观察。它们对预录制的视频执行视觉 Retargeting,而没有提供通过动作控制未来状态的机制。这种缺乏动作条件的特性使它们不适合用于交互式模拟器。RynnWorld-Teleop 通过从被动视觉翻译转向主动的、动作条件的生成,有效地弥合了人类运动先验与可操作的机器人数据之间的差距。

3 RynnWorld-Teleop:一种动作条件的自我中心世界模型

给定参考图像 $I_{ref}$ 和手势序列 $P = \{p_1, \dots, p_T\}$,RynnWorld-Teleop 合成高保真的机器人自我中心视频 $V = \{v_1, \dots, v_T\}$。为了弥合人类意图与机器人执行之间的具身差距,我们的框架整合了:(i) 深度感知的动作表示 (第 3.2 节) 和特定于任务的架构 (第 3.3 节);(ii) 用于人类到机器人知识转移的两阶段渐进式训练范式 (第 3.4 节);以及 (iii) 实现实时交互式生成的自回归蒸馏过程 (第 3.5 节)。

3.1 预备知识

RynnWorld-Teleop 建立在 Wan-I2V 架构 (Wang et al., 2025a) 之上,该架构使用 3D 变分自编码器 (VAE) 和基于 Transformer 的去噪器 $F_\Theta$。训练目标遵循条件流匹配 (CFM) 框架 (Lipman et al., 2022)。给定初始图像潜在变量 $z_0 = E(I_V)$,前向过程构建数据与噪声之间的概率路径:

$z_t = (1 – t)z_0 + t\epsilon, \quad \epsilon \sim \mathcal{N}(0, I)$ (1)

第 5 页

Wan-DiT 加噪 VAE 模块 VAE 编码器 解码器

蒸馏 实时

VAE 因果 VAE 模块 编码器 解码器

KV 缓存

图 3 RynnWorld-Teleop 概览。(a) 动作被渲染为深度感知骨骼视频,并通过 VAE 编码到潜在空间。(b) 我们扩展预训练的 Video DiT,通过分布对齐的补丁嵌入分支引入手部姿态条件。(c) 该模型被蒸馏为一个因果学生模型,用于使用流式展开调度进行交互式自回归生成。

其中 $t \in[0, 1]$。网络 $v_\Theta$ 被训练用于预测速度场,条件为参考图像潜在变量 $z_{\text{ref}} = E(I_{\text{ref}})$ 和我们的深度感知骨骼控制潜在变量 $c$:

h i LCFM = E_{t,z_0,\epsilon} \|v_\Theta(z_t, t, z_{\text{ref}}, c) -(\epsilon -z_0)\|^2_2 (2)

在推理过程中,视频是通过使用蒸馏后的因果学生模型求解由 $v_\Theta$ 定义的常微分方程(ODE)来生成的,以实现实时响应。

3.2 深度感知动作表示

我们将动作表示为由 21 关节手部追踪派生的骨骼视频序列。为了解决标准 2D 投影中固有的深度模糊问题——这对于建模精确的手-物交互至关重要——我们采用了一种深度调制渲染技术。具体而言,每个关节和骨骼的深度编码颜色映射及其直径会根据其在相机空间中的深度进行动态缩放(如图 2 所示)。这种表示有效地封装了可动手部结构以及操作所需的空间线索。

为了确保控制信号与视频生成管道兼容,渲染的姿态视频使用预训练的 VAE 编码器投影到潜在空间。这产生了控制潜在变量 $c \in \mathbb{R}^{C \times T \times H \times W}$,其空间和时间与目标视频潜在变量对齐,促进了动作与外观之间的细粒度接地。

3.3 动作条件视频生成

我们的世界模型建立在视频扩散 Transformer (DiT) (Wang et al., 2025a) 之上,将生成过程条件化为手部姿态序列,作为物理动作的高维代理。

姿态到视频条件化。我们的模型遵循图像到视频范式:给定参考图像潜在变量 $z_{\text{ref}}$ 和控制潜在变量 $c$,模型预测后续运动。为了整合姿态信息,我们采用了具有分布对齐的加法补丁嵌入方案。我们引入了一个专用的控制补丁嵌入层 $\text{PatchEmbed}_{c}^{C \to D}$,与原始视频嵌入层 $\text{PatchEmbed}_{z}^{C \to D}$ 并行。它们的输出通过一个可学习的标量门控 $\alpha$ 进行融合:

c -\mu_c x = \text{PatchEmbed}_{z}^{C \to D}(z_t) + \alpha \cdot \text{PatchEmbed}_{c}^{C \to D}(e_c) , e_c = \sigma_c \cdot \sigma_z + \mu_z, (3)

其中 $z_t \in \mathbb{R}^{C \times T \times H \times W}$ 是加噪视频潜在变量,$e_c$ 是对齐的控制潜在变量。由于 $c$ 和 $z$ 源自不同的模态,它们表现出不同的统计特性。我们维护两个信号均值和标准差 $(\mu, \sigma)$ 的滑动估计,并在补丁化之前将 $c$ 对齐到视频潜在变量的分布。

第 6 页

表 1 用于以人为中心的预训练和机器人领域自适应的数据集统计信息。我们报告了帧总数以及经过时间分割后生成的视频切片数量。

| 数据集 | 类型 | 序列长度 | 总帧数 | 总切片数 | | :— | :— | :— | :— | :— | | 以人为中心的预训练 | | | | | | VITRA (Li et al., 2025c) | 人类 | 25 | 30.7M | 1.23M | | EgoDex (Hoque et al., 2025) | 人类 | 81 | 74.0M | 0.91M | | 机器人领域自适应 | | | | | | 本文方法 (真实机器人) | 机器人 | 81 | 0.43M | 5.3K |

这确保了加性控制信号在整个训练过程中与预训练视频流在统计上保持兼容。为了保留生成先验,PatchEmbedc 被零初始化,门控标量 $\alpha$ 被初始化为一个较小的值(例如 0.1),从而使网络能够逐步融入姿态信号,而不会破坏预训练权重。

3.4 渐进式跨域训练

为了促进灵巧操作技能从人类先验到机器人主体的迁移,我们采用两阶段训练范式。为了弥合这两个训练阶段之间的人-机器人主体差异,我们将所有数据转换为配对(2D 骨架,RGB)序列,并在表 1 中展示了各阶段的训练数据统计信息。

阶段 1:以人为中心的预训练。 模型首先在大规模以人为中心的视频数据集上进行训练。在此阶段,DiT 学习手-物交互的基本动力学,并建立从骨骼配置到逼真视觉合成的映射。

我们利用 EgoDex (Hoque et al., 2025) 和 VITRA (Li et al., 2025c) 进行预训练。具体而言,EgoDex 被分割为 81 帧的片段。为了生成骨架引导,我们将 3D SE(3) 手部姿态变换到相机坐标系,并投影到 2D 空间以渲染包含双手和前臂的关节-连杆骨架视频。对于 VITRA,我们提取 25 帧的片段,并利用提供的手部动作标注(MediaPipe 格式的 21 个关节)。这些关节使用相机内参和每个片段初始帧的相机姿态投影到 2D 骨架视频中,以保持空间定位。

阶段 2:机器人领域自适应。 我们在配对的遥操作数据上对模型进行微调,其中人类手势通过逆运动学 (IK) 映射到机器人动作。这使得模型能够作为以机器人为中心的世界模型运行,其中类人意图直接驱动机器人执行视频。

为了为训练 RynnWorld-Teleop 提供必要的多样化物理交互,我们收集了一个专注于复杂双臂协调的大规模真实世界数据集。该数据集包含四个不同的任务,旨在挑战模型对物体动力学和长时程操作的理解。

为了有效捕捉以人为中心的运动先验,我们使用动作捕捉 (MoCap) 系统记录操作者的手部运动,该系统提供同步的 2D 骨架序列。为了确保与预训练阶段的时间一致性,所有机器人轨迹都被分割为 81 帧的片段。这种统一的基于骨架的表示形式,结合一致的时间对齐,促进了操作能力从人类演示到机器人主体的有效迁移。

总共,我们收集了 1,800 个高质量演示片段。与特定任务的政策训练不同,所有 1,800 个片段都被用于训练 RynnWorld-Teleop,使生成模型能够从广泛的物理场景中学习到全面的世界先验。具体任务及其各自的数据分布详见表 2。

3.5 自回归蒸馏

为了支持交互式闭环应用,我们将双向教师模型蒸馏为因果学生模型 (Huang et al., 2025),该模型能够在帧级别自回归地生成视频。该过程涉及重新配置模型以进行流式推理,随后进行两阶段优化:因果流匹配预热和对抗性分布匹配阶段。

第 7 页

表 2 用于 RynnWorld-Teleop 训练的真实世界数据集统计。 任务名称 描述 数量 双物抓取 从盘子中拿起一个苹果和一个香蕉放到桌子上。 500 推方块 用右手将方块从左推到中间,再推到右边 500 双臂搬运 用双手抬起一个西瓜枕头并将其放入托盘中。 500 放置盒盖 将纸盒的盖子放到盒子上。 300 总计 1,800

因果流式架构。学生模型采用因果时间掩码和固定大小的 KV 缓存(具有就地写入功能的预分配缓冲区)以实现低延迟推理。与教师模型不同,学生模型在时间 $t$ 的注意力被限制为 $\{1, \dots, t\}$。为了在自回归 rollout 期间保持长期一致性,我们将 $I_{ref}$ 的嵌入保留为持久化的 sink token,并将所有后续生成的 KV 状态追加到缓存中。该设计在整个生成过程中保留了初始参考图像的身份和空间上下文。

因果流匹配预热。训练以因果流匹配 (Lipman et al., 2022) 目标开始,以弥合双向处理和因果处理之间的差距。我们通过最小化均方误差,以帧因果的方式训练学生模型预测速度场 $v_\theta$:

$h LMSE = E_{t,\epsilon} \left[ \|v_\theta(x_t, t) – (\epsilon – x_0)\|^2 \right]$. (4)

此阶段使用单步速度回归建立学生模型的流式生成和控制跟随能力,为采样加速提供稳定的初始化。

分布匹配蒸馏。为了仅在四个去噪步骤中实现高保真合成,我们随后采用分布匹配蒸馏 (DMD) (Yin et al., 2024)。该优化利用学习到的评论家(critic)和冻结的教师模型提供基于分数的梯度引导,推动学生模型的输出分布向教师模型靠拢。在此阶段,学生模型执行 4 步采样 rollout。关键在于,我们跨连续块对持久化的 KV 缓存进行梯度反向传播。这种跨块梯度流鼓励模型最小化过渡处的边界伪影,确保时间连续性平滑,并使最终模型能够在实时交互循环中匹配教师模型的视觉质量。

4 RynnWorld-Teleop 作为数字遥操作系统

第 3 节确立了 RynnWorld-Teleop 作为一个动作条件的自世界模型,它将手部姿态流转化为高保真、实时的机器人视频。然而,为了实现数字遥操作的承诺,仅靠世界模型是不够的:它必须嵌入到一个闭环中,该闭环捕获操作者意图、驱动生成器,并产生下游策略可直接消耗的运动轨迹。在本节中,我们描述了将 RynnWorld-Teleop 转化为此类数据引擎的周边系统。第 4.1 节详细介绍了将原始操作者运动转换为用于模仿学习的配对(视频,动作)轨迹的端到端管道,而第 4.2 节将此范式与传统物理仿真进行对比,并阐明了数字遥操作作为可扩展数据源的独特优势。

4.1 用于策略学习的数据生成管道

为了促进可扩展的策略训练,我们开发了一套系统的管道,利用 RynnWorld-Teleop 作为高保真数据引擎来生成合成机器人轨迹。

重定向。给定佩戴在操作者胸部、手腕和上臂的 Vive 追踪器提供的原始 6-DoF 姿态,我们首先通过校准的坐标变换链计算每个手臂的目标末端执行器姿态,该变换链通过平移缩放因子将操作者的工作空间映射到机器人的工作空间。随后,通过迭代阻尼最小二乘 (DLS) 逆运动学求解器获得相应的关节配置,并利用源自上臂追踪器的零空间肩部先验进行正则化,以保持

第 8 页

机械臂处于自然、类人的配置中。每次更新后均强制执行关节限位约束。由此,对于每一个操作者手势,都会生成一个同步的 54 维机器人动作向量(双 7 自由度机械臂 + 双 20 自由度灵巧手),该向量与驱动 RynnWorld-Teleop 的手部姿态流完全对齐。完整的变换链、DLS 公式以及零空间目标详见附录 B。

骨骼条件合成。对于每个源演示,我们提取初始 RGB 帧作为参考图像 $I_{ref}$。操作者的手部姿态流被渲染为 16 FPS 的 2D 深度感知骨骼序列 $S_{1:T}$。通过对 $I_{ref}$ 和 $S_{1:T}$ 进行条件控制,RynnWorld-Teleop 合成相应的机器人执行视频。值得注意的是,由于 $I_{ref}$ 是目标场景唯一的视觉规范,它也可以由用户提供或经过合成编辑,以实例化超出训练分布的操作场景。我们在第 5.3 节中验证了这一泛化能力。无论哪种情况,真实机器人动作 $a_{1:T}$ 都与生成的视频帧同步。每个动作 $a_t \in \mathbb{R}^{54}$ 是双 7 自由度机械臂和双 20 自由度灵巧手的绝对关节位置的拼接向量。这些动作是在原始遥操作期间从操作者姿态重定向而来的,确保合成的视觉观测和机器人状态在下游模仿学习中完美对齐。

通过分块重新锚定缓解漂移。以纯自回归方式生成长视距视频可能导致视觉漂移和累积的物理不一致性。为确保合成数据保持物理 grounded(基于物理事实),我们采用基于分块(chunk-based)的生成策略,分段长度为 81 帧。对于第一个分块,模型以演示的真实起始帧进行初始化。对于每个后续分块,我们通过提供该特定时间步机器人摄像头的实际第一人称视角帧作为新的 $I_{ref}$ 来重新锚定生成过程。这种周期性接地确保在整个复杂、长视距任务中,合成环境(例如物体姿态和光照)与真实动作序列保持一致。

4.2 与传统仿真的数据引擎对比

我们将 RynnWorld-Teleop 与传统物理模拟器进行比较,以突出其作为可扩展数据引擎的优势:

• 零 3D 资产开销:传统仿真需要为每个对象提供明确的 3D 网格和 URDF(Guo et al., 2026; Zhao et al., 2025b)。RynnWorld-Teleop 从单个参考图像 $I_{ref}$ 隐式实例化环境,完全绕过了手动资产建模的瓶颈。

• 无视觉域差距:模拟渲染固有地存在现实差距(Zhao et al., 2026b)。RynnWorld-Teleop 直接在真实世界像素分布内合成帧,自然地捕捉复杂的光照、反射和传感器噪声,无需域随机化。

• 隐式物理 vs. 手动系统辨识:模拟器需要繁琐的系统辨识(摩擦、质量),且难以处理可变形物体。通过在大规模人类视频上进行预训练,RynnWorld-Teleop 吸收了物理“常识”,无需显式微分方程即可生成合理的接触动力学。

5 实验

5.1 训练细节

我们采用 Wan2.2-TI2V-5B (Wang et al., 2025a) 作为基础模型。为了使基础模型与我们目标环境的视觉特征(例如光照、特定物体)对齐,我们首先执行标准的文本到视频(TI2V)微调作为预热。此阶段不涉及动作条件控制。我们在 64 块 NVIDIA H100 GPU 上以 $2 \times 10^{-5}$ 的学习率对完整模型进行 2,000 步训练,使模型能够适应人类和机器人数据集的特定视觉域。

动作条件训练。我们引入深度感知骨骼条件分支,并探索两种训练范式以适配模型:低秩自适应(LoRA)和全参数监督微调(SFT)。两种范式均遵循两阶段渐进式调度:

• 阶段 1(第一人称人类预训练):我们使用预训练的 Wan-2.2-TI2V-5B 主干初始化模型,并在大规模人类数据集上学习基本的操作动力学。

第 9 页

1 1 3 3 1 1 2 4 2 2 1 4 2 2 双抓取 推方块 双臂搬运 放置盖子 图 4 任务示意图。我们设计了四个用于现实世界评估的操作任务。

– 基于 LoRA:我们优化 patch 嵌入层和 LoRA 权重(秩为 64),学习率为 2 × 10−5。

– 全参数 SFT:我们执行全参数微调,学习率为 2 × 10−5,采用 200 步预热和 EMA(衰减系数 0.999)以稳定交互先验的学习。

• 阶段 2(机器人领域适应):我们在 1,800 对“人-机器人”片段上微调阶段 1 的检查点,以弥合具身差异。

– 基于 LoRA:我们继续训练 LoRA 权重和控制分支,学习率为 1 × 10−5。

– 全参数 SFT:我们使用学习率为 1 × 10−5 细化全模型参数,结合 EMA(衰减系数 0.999)和 200 步预热,以确保在复杂双臂协调任务中的稳定性。

自回归蒸馏。最后,将双向教师模型转换为因果学生模型,以实现实时推理:

• 因果流匹配预热:学生模型经历一个预热阶段,以建立时间因果性,学习率为 1 × 10−5。

• 对抗蒸馏(DMD):对于少步交互生成,我们应用 DMD,生成学习率为 2 × 10−6,判别器学习率为 5 × 10−7。

5.2 数字遥操作系统的评估

实验设置。实验在配备双臂和双 WUJI 灵巧手的 TIANJI M6 移动机器人上进行。一个第一人称视角的 RealSense D435i 相机捕获视觉流。有关硬件和逆运动学求解器的详细信息,请参阅附录 A。

如图 4 所示,为了展示在各种操作挑战中的泛化能力,我们在四个需要不同级别双臂协调的独立任务上评估了我们的方法:

• (1) 双抓取:机器人使用左臂从盘子中拿起一个苹果,使用右臂拿起一根香蕉,然后依次将这两个物体放置在桌面上。

• (2) 推方块:一个顺序推动任务,左臂将一个大方块从左区推向中心,随后右臂接手将其推向指定的右侧目标区。

• (3) 双臂搬运:一个重载协调任务,双臂必须同步从桌面上抬起一个西瓜毛绒玩具,并将其准确放入托盘中。

• (4) 放置盖子:一个注重精度的任务,要求机器人拿起盖子并准确对齐以覆盖一个纸箱。

这些任务共同挑战了模型在双臂协同、时间序列和长视界交互方面的熟练程度。对于每个任务,我们通过对环境初始状态进行显著随机化来评估模型的泛化能力。这包括改变任务相关物体(例如水果、容器)在空间坐标和轴向旋转方面的 6-DoF 位姿。主要评估

第 10 页

表 3 真实世界策略性能。四项复杂任务的成功率(%)。

| 方法 | 数据来源 | 双臂抓取 | 方块推动 | 双臂提升 | 盖子放置 | | :— | :— | :— | :— | :— | :— | | DP (Chi et al., 2025) | 300 真实数据 | 82.86 | 85.71 | 88.57 | 57.14 | | DP (Chi et al., 2025) | 300 真实数据 + 300 RynnWorld-Teleop | 88.57 | 88.57 | 94.29 | 65.71 | | π0.5 (Intelligence et al., 2025) | 300 真实数据 | 94.29 | 100.00 | 94.29 | 42.86 | | π0.5 (Intelligence et al., 2025) | 300 真实数据 + 300 RynnWorld-Teleop | 97.14 | 97.14 | 100.00 | 62.86 | | π0 (Black et al., 2024) | 300 真实数据 | 88.57 | 94.29 | 91.43 | 34.29 | | π0 (Black et al., 2024) | 0 真实数据 + 300 RynnWorld-Teleop | 68.57 | 82.86 | 77.14 | 28.57 | | π0 (Black et al., 2024) | 300 真实数据 + 300 RynnWorld-Teleop | 94.29 | 100.00 | 97.14 | 54.29 |

双臂抓取 | 方块推动 | 双臂提升 | 盖子放置

真实数据 | RynnWorld-Teleop 图 5 通过 t-SNE 进行的特征分布分析。我们可视化了真实世界轨迹和 RynnWorld-Teleop 生成轨迹的高维特征嵌入。

指标为成功率,定义为每个任务在 35 次连续真实世界试验中成功完成的百分比。如果机器人在 120 秒内达到目标状态,则视为试验成功。

通过生成数据扩展进行策略学习。除了视觉保真度之外,RynnWorld-Teleop 还作为数字遥操作的生成数据引擎:它通过将无约束的人类手势转换为与真实动作完美同步的逼真执行轨迹,从而扩展机器人训练集。

我们通过增强三种最先进的策略来评估这一能力:Diffusion Policy (DP) (Chi et al., 2025)、π0.5 (Intelligence et al., 2025) 和 π0 (Black et al., 2024)。如表 3 所示,用 300 个 RynnWorld-Teleop 生成的片段增强 300 个真实世界片段,在几乎所有任务中都带来了持续的性能提升。这种改进在高精度任务(如盖子放置)中最为显著,其中 π0.5 的成功率从 42.86% 增加到 62.86%(+20%),π0 从 34.29% 增加到 54.29%(+20%)。值得注意的是,仅使用 300 个 RynnWorld-Teleop 生成的片段(不使用任何真实数据)训练的 π0 在方块推动任务中达到了 82.86% 的成功率,在双臂提升任务中达到了 77.14% 的成功率。这种零真实数据(Zero-Real-Data)性能凸显了我们的模型合成的视频不仅在视觉上逼真,而且在物理上具有依据,捕捉到了灵巧操作的基本动力学特性。通过将低成本的人类手势序列转化为高价值的机器人训练数据,RynnWorld-Teleop 为真实世界机器人中的数据稀缺瓶颈提供了可扩展的解决方案。

特征分布分析。为了进一步调查真实世界机器人轨迹与 RynnWorld-Teleop 合成的轨迹之间的视觉和语义对齐情况,我们使用 t-SNE 进行了特征分布分析。我们从真实世界演示集和 RynnWorld-Teleop 生成的数据集中各随机采样 1000 帧。使用预训练的 I3D (Carreira and Zisserman, 2017) 提取特征以捕获高级语义信息。

如图 5 所示,RynnWorld-Teleop 生成数据的分布与真实世界数据显著重叠。这种高度对齐表明,我们的生成世界模型成功捕捉到了机器人操作的基础分布,包括复杂的手-物交互和环境光照。这种特征级的一致性解释了我们策略学习实验中观察到的有效零样本 Sim2Real 迁移。

第 11 页

表 4 RynnWorld-Teleop 的定量结果。我们报告了视觉质量指标和推理速度。文本条件和动作条件世界模型以及消融研究在 EgoDex-Test 上进行评估,而机器人特定评估在 Robotic-Test 上进行。

| 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | FVD ↓ | FPS ↑ | | :— | :— | :— | :— | :— | :— | | 文本条件世界模型 | | | | | | | CogVideoX-1.5-I2V-5B (Yang et al., 2024) | 18.22 | 0.786 | 0.322 | 2790 | 0.8 | | Wan-2.2-TI2V-5B (Wang et al., 2025a) | 18.61 | 0.772 | 0.373 | 1998 | 2.8 | | Wan-2.1-I2V-14B (Wang et al., 2025a) | 18.08 | 0.735 | 0.418 | 1540 | 0.3 | | Wan-2.2-I2V-14B (Wang et al., 2025a) | 21.05 | 0.816 | 0.265 | 1337 | 0.3 | | Wan-2.2-TI2V-5B (SFT) (Wang et al., 2025a) | 20.93 | 0.806 | 0.282 | 1223 | 2.8 | | 动作条件世界模型 | | | | | | | InterDyn (Akkerman et al., 2025) | 21.47 | 0.831 | 0.279 | 655 | 2.9 | | CosHand (Sudhakar et al., 2024) | 18.14 | 0.785 | 0.406 | 1527 | 0.8 | | Mask2IV (Li et al., 2026a) | 21.50 | 0.836 | 0.219 | 1650 | 0.9 | | RynnWorld-Teleop (LoRA (Hu et al., 2022)) | 26.08 | 0.876 | 0.151 | 585 | 2.8 | | RynnWorld-Teleop (SFT) | 26.78 | 0.887 | 0.119 | 550 | 2.8 | | RynnWorld-Teleop-Causal | 22.25 | 0.830 | 0.207 | 1226 | 40.0 | | 消融研究 (LoRA) | | | | | | | Concatenation Fusion | 19.69 | 0.821 | 0.260 | 1191 | 2.8 | | w/o Human Pre-training | 17.81 | 0.763 | 0.453 | 2598 | 2.8 | | w/o DMD (Causal) | 19.25 | 0.777 | 0.244 | 1338 | 40.0 | | w/o Causal Warm-up (Causal) | 14.26 | 0.688 | 0.408 | 2150 | 40.0 | | 动作条件机器人特定世界模型 | | | | | | | RynnWorld-Teleop | 22.53 | 0.898 | 0.148 | 763 | 2.8 | | RynnWorld-Teleop-Causal | 18.66 | 0.743 | 0.249 | 1534 | 40.0 |

实时控制的延迟分析。 为了验证 RynnWorld-Teleop (Causal) 的实时能力,我们在单块 NVIDIA H100 GPU 上评估了其端到端推理延迟。我们的蒸馏因果学生模型通过 4 步流匹配调度进行优化,在 480 × 832 分辨率下实现了 40.0 fps 的高吞吐量。

平均每帧延迟约为 25 毫秒,可分解为三个主要阶段:

  • 骨骼动作编码 (∼5%): 对深度感知的骨骼序列进行预处理和 VAE 编码,以提供条件潜在变量。
  • 因果 DiT 去噪 (∼72%): 通过 4 步 DiT 推理进行自回归潜在变量生成,利用滑动窗口 KV 缓存以提高时间效率。
  • 视觉解码 (∼23%): 从潜在空间通过 VAE 解码到最终的 RGB 像素空间。

这一性能实现了约 40 Hz 的有效交互频率,显著超过了现有动作条件世界模型 Wang et al. (2026); Akkerman et al. (2025) 典型的 2–10 Hz 帧率。关键在于,这一吞吐量匹配或超过了现实世界机器人相机标准的 30 Hz 频率,从而最大限度地减少了感知到执行的差距,并在数字遥操作期间确保流畅、响应迅速的体验。

5.3 动作条件世界模型评估

实验设置。 为了全面评估 RynnWorld-Teleop 的生成能力,我们建立了两个不同的评估基准,如表 4 所示:

  • EgoDex-Test (以人为中心的领域): 为了评估通用交互先验并进行消融研究,我们使用了 EgoDex 数据集 (Hoque et al., 2025)。我们从官方 EgoDex 测试集中随机采样了 50 个视频序列,每个序列包含 81 帧,帧率为 16 FPS。这些序列涵盖了各种各样的未见人类-物体交互。使用这个具有代表性的子集确保了模型将大规模人类操作先验转移到动作条件合成方面的无偏评估。

第 12 页

图 6 RynnWorld-Teleop 的定性结果。我们的模型有效地将单一流的手势流映射到人类和机器人实体上。通过在大规模第一人称人类视频上进行预训练,RynnWorld-Teleop 吸收了丰富的操作先验知识,并成功将这些知识迁移到机器人执行中。合成的视频保持了高保真度和时间连贯性。

• 机器人测试(机器人特定领域):为了评估模型在实际机器人实体和真实实验室环境中的性能,我们保留了一个特定的机器人测试集。该数据集由 20 个视频序列(每个序列 81 帧)组成,这些序列是从我们自行收集的遥操作数据中随机选择的,确保它们在第二阶段机器人适应训练期间未被见过。这些序列涵盖了所有四个任务类别(双抓取、推方块、双臂提升和放置盖子),以验证 RynnWorld-Teleop 能否在各种机器人操作场景中保持高视觉保真度和时间一致性。

为了评估动作条件视频生成,我们采用了一套综合指标:PSNR 和 SSIM 用于结构保真度,LPIPS 用于感知相似性,以及 FVD 用于评估时间连贯性。对于 FVD,我们使用标准的 I3D 骨干网来评估 81 帧展开序列的分布对齐和时间连贯性。所有指标均在相应的测试序列上取平均值,以确保统计显著性。我们还报告了在单个 NVIDIA H100 GPU 上测量的 FPS。

动作条件世界建模。如表 4 所示,我们的方法显著优于通用 I2V 模型和动作条件视频生成模型。

像 Wan (Wang et al., 2025a) 和 CogVideoX (Yang et al., 2024) 这样的通用 I2V 基线模型虽然拥有强大的纹理先验,但缺乏响应细粒度手势的机制,导致操作过程中的时间连贯性较差(FVD > 1300)。值得注意的是,一个直接在相同的机器人和人类数据集上微调 Wan-2.2-TI2V-5B 的朴素 SFT 基线(在表 4 中记为 SFT)仍然远远落后于 RynnWorld-Teleop(FVD 1223 对 585;PSNR 20.93 对 26.08)。这一比较强调,简单的监督微调不足以掌握复杂的机器人灵巧性。相比之下,RynnWorld-Teleop 的卓越性能源于我们专门的深度感知姿态表示和分布对齐的条件控制,这使得

第 13 页

图 7 对分布外(OOD)视觉状态的泛化能力。RynnWorld-Teleop 在训练数据中未包含的两个维度上实现了泛化:(i) 未见过的物体(前两行),其中参考帧中的操作对象被替换为新的类别或形状;(ii) 未见过的背景(后两行),其中桌面纹理被替换为训练期间未出现过的环境。在所有情况下,修改后的参考图像均通过现成的图像编辑工具获得,无需对真实世界中的物体或场景进行任何修改。RynnWorld-Teleop 在物体级和背景级偏移下均保持了高视觉保真度、时间连贯性以及物理上合理的动力学特性。

第 14 页

拼接 相加 无预训练 有预训练 图 8 条件策略。与拼接相比,我们的分布对齐相加方案(公式 3)保留了预训练权重,确保了合成的稳定性。 图 9 预训练的影响。阶段 1 预训练提供了鲁棒的交互先验。如果没有它,模型在有限的机器人数据上进行微调时无法保持视觉质量。

提供更明确且有效的动作定位。

与以人为中心的模型如 CosHand (Sudhakar et al., 2024) 和 Mask2IV (Li et al., 2026a) 相比,RynnWorld-Teleop 通过准确渲染复杂的机器人本体,有效地弥合了本体论差距。我们的蒸馏因果学生模型在保持这种高保真度的同时支持交互式生成,从而促进响应式闭环应用,如图 6 的可视化所示。

对分布外 (OOD) 视觉状态的泛化。数字遥操作的一个关键优势是,可以从单张参考图像实例化新的操作场景。为了验证这一主张,除了上述闭集基准测试外,我们还评估了 RynnWorld-Teleop 泛化到训练分布之外的场景的能力。具体而言,我们考虑了两个互补的视觉 OOD 泛化维度:未见过的物体和未见过的背景。对于未见过的物体,我们将参考图像中被操作的物品替换为训练数据中从未出现过的类别或形状(例如,用红色球体替换木块,或用橄榄球替换西瓜毛绒玩具)。对于未见过的背景,我们交换参考图像中的桌面纹理(例如,在纯白桌子上叠加图案桌布)。在这两种设置中,修改后的参考图像均通过现成的图像编辑工具生成,无需对真实世界中的物体或场景进行任何修改。如图 7 所示,RynnWorld-Teleop 在物体级和背景级偏移下均保持了时间一致性,并忠实地执行了动作条件的轨迹。这些结果表明,RynnWorld-Teleop 学习到了与特定物体纹理和背景外观解耦的泛化交互先验,支持了数字遥操作可以从单张参考图像实例化任意目标场景的范式级主张。

5.4 消融研究

条件策略:相加 vs. 拼接。我们研究了不同融合策略对整合姿态控制的影响。我们将我们的分布对齐相加方案(公式 3)与标准的拼接融合进行比较,其中控制潜变量被附加到噪声视频潜变量之后。如表 4 所示,拼接融合导致性能显著下降,FVD 从 585 增加到 1191。这表明直接拼接破坏了基础 DiT 的预训练潜分布,导致合成不稳定。定性上,如图 8 所示,我们的带有零初始化门控的相加方法有效地保留了生成先验,在保持精确控制的同时确保了更好的视觉保真度。

人类第一人称预训练的价值。为了验证我们的两阶段训练范式,我们评估了一个变体 w/o Human Pre-training(无人类预训练),该变体直接在机器人数据上进行微调。表 4 中的定量结果显示性能严重崩溃(FVD 2598,LPIPS 0.453),因为有限的机器人数据不足以从头教会模型复杂的手-物物理。如图 9 的可视化所示,如果没有来自人类视频的交互先验,模型无法合成真实的手部结构,并表现出严重的“鬼影”和模糊纹理,最终导致物体恒常性丧失,即在执行操作期间机器人末端执行器和目标苹果完全消失。这证实了从大规模人类第一人称数据集转移知识对于弥合本体论差距和实现高质量机器人世界建模至关重要。

顺序蒸馏的有效性。我们在表 4 中评估了两阶段蒸馏课程必要性。将最终模型与仅基于流匹配基线(w/o DMD)进行比较,揭示了显著的

第 15 页

质量差距(PSNR 22.25 对比 19.25)。虽然流匹配(flow-matching)建立了基本的因果架构,但它缺乏教师模型的高保真细化能力。更重要的是,我们观察到,若在不进行因果预热阶段(w/o Causal Warm-up)的情况下,直接将 DMD (Yin et al., 2024) 应用于双向教师模型,会导致严重的训练不稳定和纹理模糊。这证实了第一阶段(因果预热)对于弥合双向处理与因果处理之间的结构差距至关重要,它提供了稳定的初始化,使得后续的 DMD (Yin et al., 2024) 阶段能够在仅 4 步内成功继承教师模型复杂的手-物交互先验。

6 结论

在本文中,我们提出了 RynnWorld-Teleop,这是一种生成式数字遥操作框架,旨在弥合无约束人类手势与精确机器人执行视频之间的差距。通过引入深度感知的姿态表示和渐进式的两阶段训练范式,我们的模型成功地将大规模人类数据集中的交互先验迁移到特定的机器人实体上。为了支持实时交互式用例,我们通过一种新颖的流式自回归蒸馏过程,将双向教师模型蒸馏为因果学生模型,从而确保在长时域内的时空一致性。实验结果表明,RynnWorld-Teleop 不仅能合成高保真、动作一致的交互视频,还能作为一个强大的生成式数据引擎。使用 RynnWorld-Teleop 合成的轨迹增强真实世界机器人数据集,显著提高了操作策略的成功率和泛化能力。我们相信,这项工作为利用人类直觉作为数字控制信号来训练通用机器人代理提供了一条可扩展的路径,并希望数字遥操作能成为可扩展机器人数据流水线中的标准组成部分。

局限性。尽管 RynnWorld-Teleop 成功证明了数字遥操作作为一种可行的数据引擎的可行性,但仍存在若干局限性。首先,虽然深度调制渲染捕捉了 3D 空间动态,但模型在处理复杂的物理现象(如细粒度的液体动力学或高度可变形物体的操作)时偶尔会遇到困难。解决这些情况可能需要涵盖此类交互的更丰富的训练数据。其次,目前弥合实体差距需要针对每个平台进行微调,这限制了该范式在机器人舰队中的可扩展性。我们认为,跨实体基础世界模型(可能以机器人运动学描述符为条件)是一个有前景的方向。

第 16 页

参考文献

Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, 等人。Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575, 2025。

Rick Akkerman, Haiwen Feng, Michael J Black, Dimitrios Tzionas, 和 Victoria Fernández Abrevaya。Interdyn: 使用视频扩散模型实现可控的交互式动力学。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. of IEEE Conf. on Computer Vision and Pattern Recognition) 中,第 12467–12479 页,2025。

Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Eliza- beth Cha, Yu-Wei Chao, 等人。利用视频基础模型进行物理人工智能的世界模拟。arXiv 预印本 arXiv:2511.00062, 2025。

Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, 等人。V-jepa 2:自监督视频模型实现理解、 预测和规划。arXiv 预印本 arXiv:2506.09985, 2025。

Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 等人。π0:用于通用机器人控制的视觉-语言-动作流模型。arXiv 预印本 arXiv:2410.24164, 2024。

Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakr- ishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, 等人。Rt-1:用于大规模现实世界控制的机器人 Transformer。 arXiv 预印本 arXiv:2212.06817, 2022。

Jake Bruce, Michael D Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, 等人。Genie:生成式交互式环境。在第四十一届 国际机器学习会议 (Forty-first International Conference on Machine Learning) 中,2024。

Joao Carreira 和 Andrew Zisserman。Quo vadis, action recognition? 一个新模型和 Kinetics 数据集。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. of IEEE Conf. on Computer Vision and Pattern Recognition) 中,第 6299–6308 页,2017。

Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, 和 Shuran Song。 Diffusion policy:通过动作扩散进行视觉运动策略学习。《国际机器人研究杂志》 (The International Journal of Robotics Research), 44(10-11):1684–1704, 2025。

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, 和 Yue Wang。Lome:学习基于动作条件的自我中心世界模型的人体-物体操作。arXiv 预印本 arXiv:2603.27449, 2026。

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, 和 Yann LeCun。世界模型可以利用人类视频进行灵巧操作。 arXiv 预印本 arXiv:2512.13644, 2025。

Lijun Guo, Haoyu Zhao, Xingyue Zhao, Rong Fu, Linghao Zhuang, Siteng Huang, Zhongyu Li, 和 Hua Zou。 Articulat3d:结合几何和运动约束从单目视频重建可数字孪生的关节结构。 arXiv 预印本 arXiv:2603.11606, 2026。

David Ha 和 Jürgen Schmidhuber。世界模型。arXiv 预印本 arXiv:1803.10122, 2(3):440, 2018。

Jinkun Hao, Mingda Jia, Ruiyan Wang, Xihui Liu, Ran Yi, Lizhuang Ma, Jiangmiao Pang, 和 Xudong Xu。Egosim: 用于具身交互生成的自我中心世界模拟器。arXiv 预印本 arXiv:2604.01001, 2026。

Ryan Hoque, Peide Huang, David J Yoon, Mouli Sivapurapu, 和 Jian Zhang。Egodex:从大规模自我中心视频学习灵巧操作。arXiv 预印本 arXiv:2505.11709, 2025。

Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Liang Wang, Weizhu Chen, 等人。 Lora:大语言模型的低秩自适应。《国际学习表征会议论文集》 (Proc. of International Conference on Learning Representations), 1(2):3, 2022。

Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman。Self forcing:弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009, 2025。

Physical Intelligence, Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, 等人。π0.5:具有开放世界泛化能力的视觉-语言-动作模型。 arXiv 预印本 arXiv:2504.16054, 2025。

第 17 页

Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, 和 Zhouchen Lin. 用于高效视频生成建模的金字塔流匹配。arXiv 预印本 arXiv:2410.05954, 2024.

Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, 等人. Openvla: 一个开源的视觉-语言-动作模型。arXiv 预印本 arXiv:2406.09246, 2024.

Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等人. Hunyuanvideo: 一个大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603, 2024.

快手. Kling ai. https://klingai.com/, 2024.

Marion Lepert, Jiaying Fang, 和 Jeannette Bohg. Masquerade: 使用数据编辑从野生人类视频中学习。arXiv 预印本 arXiv:2508.09976, 2025a.

Marion Lepert, Jiaying Fang, 和 Jeannette Bohg. Phantom: 仅使用人类视频训练机器人而无需机器人。 2025. arXiv 预印本 arXiv:2503.00779, 2025b.

Gen Li, Bo Zhao, Jianfei Yang, 和 Laura Sevilla-Lara. Mask2iv: 通过掩码轨迹进行以交互为中心的视频生成。在人工智能会议论文集 (Proc. of the AAAI Conf. on Artificial Intelligence) 中, 第 40 卷, 第 6091–6099 页, 2026a.

Guangrun Li, Yaoxu Lyu, Zhuoyang Liu, Chengkai Hou, Jieyu Zhang, 和 Shanghang Zhang. H2r: 一种用于从视频进行机器人预训练的人类到机器人数据增强。arXiv 预印本 arXiv:2505.11920, 2025a.

Hangyu Li, Qin Zhao, Haoran Xu, Xinyu Jiang, Qingwei Ben, Feiyu Jia, Haoyu Zhao, Liang Xu, Jia Zeng, Hanqing Wang, 等人. Teleopbench: 一个以模拟器为中心的双臂灵巧遥操作基准测试。arXiv 预印本 arXiv:2505.12748, 2025b.

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, 等人. 用于机器人控制的因果世界建模。arXiv 预印本 arXiv:2601.21998, 2026b.

Qixiu Li, Yu Deng, Yaobo Liang, Lin Luo, Lei Zhou, Chengtang Yao, Lingqi Zeng, Zhiyuan Feng, Huizhi Liang, Sicheng Xu, 等人. 基于真实人类活动视频的可扩展视觉-语言-动作模型预训练用于机器人操作。arXiv 预印本 arXiv:2510.21571, 2025c.

Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le. 用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747, 2022.

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, 和 Juergen Gall. Egocontrol: 通过 3D 全身姿态进行可控的第一人称视频生成。arXiv 预印本 arXiv:2511.18173, 2025.

Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson, 等人. Sam 2: 分割图像和视频中的任何对象。在表示学习国际会议 (Proc. of International Conference on Learning Representations) 论文集中, 第 2025 卷, 第 28085–28128 页, 2025.

Runway. Runway aleph. https://runwayml.com/, 2025.

Yiren Song, Cheng Liu, Weijia Mao, 和 Mike Zheng Shou. Mitty: 基于扩散的人类到机器人视频生成。 arXiv 预印本 arXiv:2512.17253, 2025.

Sruthi Sudhakar, Ruoshi Liu, Basile Van Hoorick, Carl Vondrick, 和 Richard Zemel. 通过手法控制世界。在欧洲计算机视觉会议 (Proc. of European Conf. on Computer Vision) 论文集中, 第 414–430 页. Springer, 2024.

Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, 和 Hengshuang Zhao. Playerone: 第一人称世界模拟器。 arXiv 预印本 arXiv:2506.09995, 2025.

Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, 等人. Wan: 开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025a.

Yuang Wang, Chao Wen, Haoyu Guo, Sida Peng, Minghan Qin, Hujun Bao, Xiaowei Zhou, 和 Ruizhen Hu. 通过视觉动作提示实现精确的动作到视频生成。在 IEEE 计算机视觉与模式识别会议 (Proc. of IEEE Conf. on Computer Vision and Pattern Recognition) 论文集中, 第 12713–12724 页, 2025b.

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, 和 Xingang Pan. Hand2world: 通过自由空间手势进行自回归第一人称交互生成。arXiv 预印本 arXiv:2602.09600, 2026.

第 18 页

Linxi Xie, Lisong C Sun, Ashley Neall, Tong Wu, Shengqu Cai, 和 Gordon Wetzstein。生成的现实:使用带有手部和相机控制的交互式视频生成进行以人为中心的世界模拟。arXiv 预印本 arXiv:2602.18422,2026。

Pei Yang, Hai Ci, Yiren Song, 和 Mike Zheng Shou。X-humanoid:将人类视频转化为机器人视频以大规模生成类人机器人视频。arXiv 预印本 arXiv:2512.04537,2025。

Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng 等人。Cogvideox:具有专家 Transformer 的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072,2024。

Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T Freeman, 和 Taesung Park。具有分布匹配蒸馏的一步扩散。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. of IEEE Conf. on Computer Vision and Pattern Recognition) 中,第 6613–6623 页,2024。

Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang。从慢速双向到快速自回归视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 22963–22974 页,2025。

Yanjie Ze, Zixuan Chen, Joao Pedro Araújo, Zi-ang Cao, Xue Bin Peng, Jiajun Wu, 和 C Karen Liu。Twist:遥操作全身模仿系统。arXiv 预印本 arXiv:2505.02833,2025。

Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala。向文本到图像扩散模型添加条件控制。在 IEEE 国际计算机视觉会议论文集 (Proc. of IEEE Intl. Conf. on Computer Vision) 中,第 3836–3847 页,2023。

Haoyu Zhao, Xingyue Zhao, Lingting Zhu, Weixi Zheng, 和 Yongchao Xu。Hfgs:强调空间和时间高频分量的 4D 高斯溅射用于内窥镜场景重建。arXiv 预印本 arXiv:2405.17872,2024。

Haoyu Zhao, Sixu Lin, Qingwei Ben, Minyue Dai, Hao Fei, Jingbo Wang, Hua Zou, 和 Junting Dong。Smap:用于物理合理的类人机器人全身控制的自监督运动适应。arXiv 预印本 arXiv:2505.19463,2025a。

Haoyu Zhao, Hao Wang, Xingyue Zhao, Hao Fei, Hongqiu Wang, Chengjiang Long, 和 Hua Zou。Physsplat:通过多模态大语言模型引导的高斯溅射实现 3D 场景的高效物理仿真。在 IEEE 国际计算机视觉会议论文集 (Proc. of IEEE Intl. Conf. on Computer Vision) 中,第 5242–5252 页,2025b。

Haoyu Zhao, Cheng Zeng, Linghao Zhuang, Yaxi Zhao, Shengke Xue, Hao Wang, Xingyue Zhao, Zhongyu Li, Kehan Li, Siteng Huang 等人。利用高斯溅射为现实世界零样本机器人操作学习生成高保真模拟数据。IEEE 机器人与自动化快报 (IEEE Robotics and Automation Letters),2026a。

Haoyu Zhao, Linghao Zhuang, Xingyue Zhao, Cheng Zeng, Haoran Xu, Yuming Jiang, Jun Cen, Kexiang Wang, Jiayan Guo, Siteng Huang 等人。迈向具有类人先验的感知可用性的机器人灵巧抓取。在 AAAI 人工智能会议论文集 (Proc. of the AAAI Conf. on Artificial Intelligence) 中,第 40 卷,第 13126–13134 页,2026b。

Tony Z Zhao 等人。利用低成本硬件学习细粒度双臂操作。机器人:科学与系统 (Robotics: Science and Systems),2023。

第 19 页

自由度 (DOF):7 自由度 (DOF):20 负载:6kg 骨架重量:< 600g 自重:11kg 指尖力:15N

TIANJI M6 WUJI 手

图 10 硬件基础设施。评估使用我们的标准机器人设置:一套配备 WUJI 手的双臂 TIANJI M6 系统。详细规格包括自由度 (DoF)、负载和指尖力,总结如下,以确保我们操作基准的可复现性。

附录

A 真实机器人系统设置

我们的真实机器人基于 TIANJI M6 和 WUJI 手构建,如图 10 所示。策略的推理频率设置为 50 Hz。命令发送的延迟保持在 18 到 30 毫秒之间。底层接口以 500 Hz 的频率运行,确保平滑的实时控制。控制策略与底层接口之间的通信通过 LCM(轻量级通信和编组)实现。

我们通过遥操作收集真实世界演示数据。我们的硬件设置包括双 TIANJI 7-DoF 机械臂和双 WUJI 20-DoF 灵巧手,总共 54 个自由度。对于手臂控制,人类操作员佩戴五个 HTC Vive 追踪器(安装在胸部、双手腕和双上臂)。系统以 100-120 Hz 的频率计算腕部到胸部的相对变换,并将其输入到在单独进程中运行的基于 Pinocchio 的逆运动学求解器中。生成的关节命令进一步由具有速度、加速度和加加速度约束的 Ruckig 轨迹生成器进行平滑处理,然后以 200 Hz 的频率发送给机械臂。

对于手部控制,操作员如图 11 所示,佩戴 Manus 数据手套。原始手套信号被转换为 21 点 MediaPipe 手部骨架格式,并通过专用的 Retargeting 模块重定向到 20-DoF WUJI 手关节空间,同时应用指数移动平均滤波器进行运动平滑。

B RynnWorld-Teleop 中的 Retargeting

我们在本节提供第 4.1 节中总结的完整 Retargeting 流程。给定来自 Vive 追踪器的原始姿态,我们首先通过坐标变换链计算每个手臂的目标末端执行器姿态:

Ttarget = Tbase · Scale(T−1chest · Twrist) · Tee, (5)

其中 T−1chest · Twrist 提取追踪器空间中的腕部到胸部的相对姿态,Scale(·) 算子仅将平移分量按因子 s(例如,s = 1.5)缩放,以将操作员的作业空间映射到机器人的

第 20 页

追踪器

Manus

图 11 真实世界数据采集的操作员设置。

工作空间,$T_{base}$ 和 $T_{ee}$ 是固定的标定变换,分别用于将追踪器坐标系与机器人基座坐标系和末端执行器坐标系对齐。

我们使用迭代阻尼最小二乘法(DLS)求解逆运动学。在每次迭代中,计算 6D 任务空间误差 $e \in \mathbb{R}^6$(位置和方向),关节更新量为:

$$ \Delta q = J^{\#}_\lambda e, \quad (6) $$

其中 $J^{\#}_\lambda$ 是通过 SVD 获得的阻尼伪逆:

$$ J = U \Sigma V^\top, \quad J^{\#}_\lambda = V \text{diag} \left( \frac{\sigma_i}{\sigma_i^2 + \lambda^2} \right) U^\top, \quad (7) $$

采用自适应阻尼因子 $\lambda = \lambda_{\min} + \frac{0.01}{1 + \sigma_{\max}}$,在接近奇异点时增加阻尼。 为了产生自然的臂部构型,我们利用源自上臂追踪器的零空间肩部先验。具体而言,将臂追踪器位置变换到机器人坐标系中以得到参考肘部位置,从中求解部分逆运动学(对关节 $q_0, q_1$ 的 $3 \times 2$ 子雅可比矩阵进行最小二乘求解)以获得肩部参考值 $q_{\text{ref}}^{\text{shoulder}}$。这些值作为加权零空间任务注入:

$$ \Delta q \leftarrow \Delta q + (I – J^{\#}_\lambda J) w (q_{\text{ref}} – q), \quad (8) $$

其中肩部关节的权重 $w = 0.5$。关节限制通过在每次积分步骤后进行硬截断来强制执行。

C 视觉比较结果

如图 12 所示,与基于掩码的方法相比,RynnWorld-Teleop 产生了在时间上更稳定且物理上更合理的交互。虽然 Mask2IV 等方法保持了结构形状,但它们通常会出现纹理闪烁,并且缺乏精细的手指关节运动。相比之下,我们的深度感知骨骼表示提供了明确的结构约束,使得 RynnWorld-Teleop 能够在 EgoDex (Hoque et al., 2025) 基准测试的复杂双手场景中合成逼真的手指-物体接触。

第 21 页

真实值 (GT)

控制掩码 (Control Mask)

InterDyn

CosHand

Mask2IV

2D 骨骼姿态

RynnWorld- Teleop

真实值 (GT)

控制掩码 (Control Mask)

InterDyn

CosHand

Mask2IV

2D 骨骼姿态

RynnWorld- Teleop

图 12 定性比较。与依赖 SAM 生成的掩码进行条件控制的基线方法不同,RynnWorld-Teleop 使用稀疏的骨骼姿态,实现了更高的保真度和时间一致性。请注意,基线方法以其原生支持的分辨率进行可视化。

第 22 页

frame_0001.jpg

图 13 RynnWorld-Teleop 在机器人操作任务上的定性结果。从单张参考图像和一系列人类手部姿态流开始,RynnWorld-Teleop 合成高保真、时间连贯的机器人执行视频。结果展示了模型渲染复杂灵巧交互(如双手协调和高精度物体处理)的能力,同时严格遵循输入动作信号。

第 23 页

此外,我们在图 13 中展示了 RynnWorld-Teleop 在目标机器人领域的实际有效性。通过成功将人类数据集中的交互先验迁移到 WUJI 灵巧手上,我们的模型能够合成高分辨率的 photorealistic(照片级真实感)执行视频。这些结果表明,RynnWorld-Teleop 能够准确捕捉复杂的机械动力学和环境反射,在 Lid Placement(放置盖子)和 Bimanual Lifting(双手搬运)等不同任务中,生成的机器人轨迹在视觉上与现实世界的遥操作记录无法区分。

D 基线实现细节

CosHand。CosHand (Sudhakar et al., 2024) 是一种基于扩散的手部图像生成模型,它根据参考图像和目标手部掩码合成目标手部外观。我们使用官方发布的检查点,并采用其图像条件生成流程。对于每个视频,我们提取第 0 帧作为参考图像,并使用 SAM2 (Ravi et al., 2025) 从真实视频(ground truth video)中获取每帧的二值手部分割掩码。在每个时间步 $t > 0$,我们以参考图像、参考手部掩码(第 0 帧)和目标手部掩码(第 $t$ 帧)为条件,使用 DDIM 采样,步数为 50,无分类器引导尺度(classifier-free guidance scale)为 1.5,在 $256 \times 256$ 分辨率下生成目标帧。生成的帧随后被调整大小至 $480 \times 832$ 以匹配真实分辨率,每个视频生成 81 帧,帧率为 16 fps。

Mask2IV。Mask2IV (Li et al., 2026a) 是一个两阶段潜在视频扩散模型,它根据输入图像、文本提示和起始/结束手部掩码生成视频。我们使用两个阶段的官方发布检查点。对于每个真实视频,我们提取 SAM2 (Ravi et al., 2025) 手部掩码,并将 81 帧序列划分为 5 个不重叠的 16 帧块。对于第 $i$ 个块,条件包括:索引为 $16i$ 的真实帧作为输入图像,第 $16i$ 帧(起始)和第 $16(i + 1)$ 帧(结束)的手部掩码,以及源自任务名称的文本提示(例如,“a hand pouring”)。推理在 $320 \times 512$ 分辨率下进行,使用 50 个 DDIM 步,$\eta = 1.0$,无分类器引导尺度为 1.0,引导重缩放(guidance rescale)为 0.7。这 5 个块按顺序拼接形成 80 帧的输出视频,随后调整大小至 $480 \times 832$ 用于评估。

InterDyn。InterDyn (Akkerman et al., 2025) 在 Stable Video Diffusion (SVD) 的基础上扩展了一个 ControlNet 分支,该分支接受手部交互掩码作为空间条件。我们通过帧重采样将每个真实视频从 16 fps 转换为 12 fps,并将其分为 2 个不重叠的 28 帧块。相应的 SAM2 (Ravi et al., 2025) 手部掩码也以类似方式重采样,并转换为 InterDyn 输入流水线所需的 VP9 编码 WebM 格式。对于每个块,InterDyn 将第一帧作为参考图像,并将 28 帧掩码序列作为 ControlNet 条件,使用 50 个去噪步生成 14 个输出帧,帧率为 6 fps(时间下采样因子为 2)。这两个块每个视频产生 28 个预测帧,原生分辨率为 $256 \times 384$,随后上采样至 $480 \times 832$ 以与真实值进行指标计算。

发表评论