三分钟导读:CD-LAM通过引入基于因果的去偏目标(具身中心重建、动作中心对比学习、潜在空间校准)对潜在动作模型进行微调,显著提升了动作条件世界模型的动作跟随性、视觉保真度和机器人动作适应效率。
英文题目:Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
论文出处:arXiv 每日论文精选 · arXiv:2607.09185
原始论文:PDF / 论文页面
对应视频标题:CD-LAM:因果去偏潜在动作模型,解决具身世界模型动作跟随性差与数据效率低问题|推荐指数:★★★★★
这篇论文解决什么问题?
现有的潜在动作模型(LAMs)仅使用视频重建目标训练,导致动作无关的视觉因素(如背景、非交互物体)泄露到潜在动作表示中,造成下游动作条件世界模型(ACWMs)在动作跟随上表现脆弱且不可控。
核心创新
- 识别并量化了LAM中动作无关混淆因子对可控性的负面影响
- 提出三种因果去偏目标:具身中心重建、动作中心对比学习、潜在空间校准
- 设计了FDCE指标以独立评估动作跟随性,区别于像素级保真度
- 实现了仅需1/12更新次数的机器人动作适应效率提升
方法概览
提出CD-LAM框架,包含三个阶段:1) LAM去偏微调:使用具身中心重建、动作中心对比学习和潜在空间校准三个目标微调LAM;2) ACWM去偏微调:在去偏潜在动作上训练ACWM;3) 机器人动作适应:通过轻量级桥接层将可执行机器人动作映射到去偏潜在空间。
逐图理解论文
方法概述:CD-LAM三阶段框架

CD-LAM框架包含三个阶段。第一阶段对LAM进行去偏微调,引入具身中心重建、动作中心对比学习和潜在空间校准三个目标。第二阶段在去偏潜在动作上训练动作条件世界模型。第三阶段通过轻量级桥接层,将可执行机器人动作映射到去偏潜在空间,实现高效适应。
创新点一:量化混淆因子负面影响

研究首先识别并量化了潜在动作模型中动作无关混淆因子对可控性的负面影响。通过因果分析发现,仅依赖重建训练的LAM会将动作无关的捷径依赖引入潜在空间,导致即使视觉重建质量高,动作跟随性能依然低下,这为后续去偏设计提供了理论依据。
创新点三:FDCE指标与效率提升

设计FDCE指标以独立评估动作跟随性,区别于像素级保真度。FDCE通过比较前景位移轨迹的切弗距离,更准确反映控制能力。实验表明,该方法实现了仅需1/12更新次数的机器人动作适应效率提升,在2B和14B模型上分别仅需3k和6k次更新即可超越基线。
实验设置:基线与评估指标

在2B和14B动作条件世界模型骨干网络上评估CD-LAM与DreamDojo基线的对比。在AgiBot真实机器人数据集上进行机器人动作适应和干预测试,并在EgoDex数据集上进行潜在动作条件生成评估。消融实验验证各去偏目标组件的有效性,去偏数据规模从1小时扩展至1000小时。
结果:动作跟随性显著改善

实验结果显示,CD-LAM在ACWM去偏微调后,FDCE降低42%(2B)和26%(14B)。在机器人动作适应后,FDCE进一步降低35%(2B)和30%(14B)。零动作干预下,FDCE降至5.03(2B)和2.18(14B),表明模型在缺乏显式动作输入时仍能保持合理的运动趋势,可控性显著增强。
实验与关键结果
- 在2B和14B ACWM骨干网络上评估CD-LAM与DreamDojo基线的对比
- 在AgiBot真实机器人数据集上进行机器人动作适应和干预测试
- 在EgoDex数据集上进行潜在动作条件生成的评估
- 消融实验验证各去偏目标组件的有效性
- 去偏数据规模扩展实验(1h至1000h)
- FDCE降低42% (2B) 和 26% (14B) 在ACWM去偏微调后(第 7 页)
- FDCE降低35% (2B) 和 30% (14B) 在机器人动作适应后(第 7 页)
- 14B模型PSNR提升1.0 dB(第 13 页)
- 机器人动作适应更新次数减少12倍以上 (3k/6k vs 50k)(第 9 页)
- 零动作干预下FDCE降低至5.03 (2B) 和 2.18 (14B)(第 7 页)
阅读时需要注意
- 对比学习使用的粗粒度动作原语标签可能不够精确
- 去偏效果依赖于SAM3前景掩码的质量
- 在少量动作类别上性能提升不明显或略低于基线
- PSNR高并不保证动作跟随性好,两者相关性低
- 消融实验中移除零转换校准虽在特定分割上降低FDCE,但导致相机偏移响应增加,表明其去偏必要性
- 不同模型间的绝对FDCE值不可直接比较,需关注相对变化
关联工作
- DreamDojo:作为基线模型进行比较(第 5 页)
- Genie:引入大规模离散潜在动作代码本的视频到动作抽象(第 9 页)
- MotionPro:基于点跟踪的运动控制评估方法,FDCE受其启发(第 10 页)
- SAM3:用于生成前景掩码以计算FDCE和具身中心重建(第 13 页)
- CoWTracker:用于计算前景区域内点轨迹以计算FDCE(第 13 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
动作条件世界模型中的因果去偏潜在动作模型
Yufan Wei1,2∗, Kun Zhou1†, Lingjun Mao1,2∗, Zijun Zhang1, Ziming Xu1, Ziqiao Xi1, Shuang Liang1,2∗, Ruobing Han1, Yuchen Yan1, Xinyue Wang1,2∗, Fan Feng1, Biwei Huang1 1 Aether AI 2 加州大学圣地亚哥分校 ∗ 在 Aether AI 实习期间完成。 † 项目负责人兼通讯作者:franciskunzhou@gmail.com
CD-LAM DreamDojo 动作路径 观测路径 FDCE(px) ↓ PSNR ↑ 步数 ↓ 混淆路径 50 12.63 13 k 50 k 潜在动作 21.01 模型 12 21 11.11 20.60 +1.0 CD-LAM 11 dB -34.8% +0.75 -94% -88% 10 dB 观测 混淆 动作 观测 动作 -30.4% 20 20.01 条件化 条件化 9 19.852026 8.24 动作条件化 动作条件化 8 世界模型 世界模型 7.73 6 k 3 kJul 7 19 ACWM 去偏 机器人动作 10 2B 14B 2B 14B 2B 14B 微调 适应 (a) 动作跟随 (b) 视觉保真度 (c) 效率 (d) 因果分析
图 1. 性能概览及潜在的混淆机制。CD-LAM 在 DreamDojo 上显著提高了动作跟随、视觉保真度和数据效率。(a) CD-LAM 在 2B 和 14B 规模下均降低了具身动作跟随误差 (FDCE)。(b) CD-LAM 也在两个规模下提高了 PSNR(标注了以 dB 为单位的增益)。(c) 与 DreamDojo 的 50k 更新参考相比,CD-LAM 在最终的 2B 和 14B 检查点仅使用了 3k 和 6k 次机器人动作适应更新;见图 8 中的交叉曲线。(d) 因果分析:仅通过重建训练的 LAM 可能会将动作无关的混淆因素泄漏到动作条件中;CD-LAM 减少了沿此路径测量的捷径依赖性,(a)–(c) 量化了由此产生的增益。[cs.CV]
摘要—动作条件世界模型 (ACWMs) 旨在模拟基于具身动作的未来观测, 为机器人规划、策略评估和数据增强提供了有前景的基础。 然而,学习可控的 ACWMs 需要大规模的动作标注数据,这在现实世界中 收集成本依然高昂。潜在动作模型 (LAMs) 通过从视频中推断潜在动作来 缓解这一瓶颈,无需可执行的动作标签,但现有的 LAMs 通常 仅使用重建目标进行训练,因此将动作相关的动力学与动作无关的视觉因素 如背景和未交互物体纠缠在一起。在本工作中,我们将这种动作无关偏差 识别为可控 ACWMs 的关键障碍,并引入评估指标来衡量潜在 动作偏差、动作跟随和鲁棒性。我们提出了 CD- LAM,这是一种用于基于 LAM 的 ACWMs 的因果去偏框架。 最终检查点。 代码 ↗ 项目页面 ↗ 模型 ↗ uation, and data augmentation. Index Terms—latent action models, world models, causal debias- ing 缓解这一瓶颈,通过从视频中推断潜在动作 无需可执行的动作标签,但现有的 LAMs 通常 I. 引言 仅使用重建目标进行训练,因此将动作相关的动力学与动作无关的视觉因素 纠缠在一起,例如背景和未交互物体。在本工作中,我们 识别出这种动作无关偏差是可控 ACWMs 的关键障碍,并引入评估指标来衡量潜在 动作偏差、动作跟随和鲁棒性。我们提出了 CD- 动作条件世界模型 (ACWMs) [1]–[4] 已 成为直接从视觉观测和具身控制信号模拟物理 信号。给定当前的视觉观测和一个动作 动作偏差、动作跟随和鲁棒性。我们提出了 CD- 轨迹,ACWM 旨在预测由此产生的未来 LAM,这是一种用于基于 LAM 的 ACWMs 的因果去偏框架。 观测序列,从而模拟环境 和具身将如何在该干预下演变。通过 预测不同候选动作轨迹的未来,ACWMs 有潜力作为通用 器,用于机器人规划、策略评估和数据 增强。 然而,ACWMs 的可控性依赖于大规模 动作标注数据,而在现实世界中收集带有 动作注释的机器人视频仍然成本高昂 [5], [6]。在
第 2 页
LAM 具身智能 潜在动作 条件化 动力学 动作 潜在动作 动作- 背景 运动 动作- 条件化世界模型 抑制 …… 无关 物体 混淆因素 ? 无关 外观 𝑂(𝑡) 𝑂(𝑡+ 1) 混淆因素 ACWM 去偏 潜在动作 精细- 以具身智能为中心 以动作为中心 潜在空间 微调 编码器 重构 对比学习 校准 桥梁
前景 背景
潜在 具身智能 背景 v 3 条件化 动作解码器 动力学 运动 机器人动作 条件化世界模型
𝑂'(𝑡+ 1) 机器人 潜在动作模型 1 LAM 去偏微调 动作适应
图 2. CD-LAM 概述。CD-LAM 在保持下游动作条件化格式不变的情况下,分三个阶段对 LAM 的潜在动作空间进行去偏。阶段 1(LAM 去偏微调)利用三个 CD-LAM 目标对 LAM 进行去偏;阶段 2(ACWM 去偏微调)在去偏后的潜在动作上训练 ACWM;阶段 3(机器人动作适应)通过轻量级桥梁将可执行的机器人动作对齐到同一空间。
相比之下,人类视频更容易收集且规模更大,并包含丰富的物理交互,但通常缺乏可执行的动作标注 [7]–[9]。为了利用这些大规模数据源,潜在动作模型(LAMs)通过从无标签的视频转换中推断出紧凑的潜在动作表示,提供了一座桥梁 [10]–[12]。通过对这些潜在动作进行大规模预训练,ACWM 可以有效预热以学习动作可控的动态,并在有限的标注机器人数据上进行微调后,实现更强的动作跟随性能 [13], [14]。
尽管前景广阔,现有的 LAMs 通常仅使用视频重构目标进行训练,这无法防止与动作无关的视觉因素被编码到潜在动作中。结果,与动作无关的因素,如背景场景和非交互物体,可能会泄漏到潜在动作表示中。我们在第 III 节的实证分析表明,这种与动作无关的因素会导致有偏的潜在动作表示,最终混淆 ACWM:该模型可以生成视觉上合理的 rollout,但在面对小扰动时,无法可靠地跟随目标动作条件,且变得脆弱 [15]–[17]。因此,我们的目标是通过使潜在动作表示在因果上扎根于以具身智能为中心的动作特征,同时解耦与动作无关的因素并缓解表示坍塌,来对 LAMs 进行去偏。具体而言,我们为 LAMs 引入了三个因果去偏目标:以具身智能为中心的重构、以动作为中心的对比学习,以及潜在空间校准,这些目标分别鼓励以具身智能为重点、感知动作且校准良好的非坍塌动作表示。
为此,我们提出了 CD-LAM,这是一种用于基于 LAM 的 ACWM 的因果去偏方法。CD-LAM 包含一个高效的三阶段微调流程(图 2),首先对 LAM 进行去偏,然后对 ACWM 进行去偏,最后将其适应于现实世界的机器人动作。在阶段 1 中,我们利用以具身智能为中心的重构、以动作为中心的对比学习和潜在空间校准对 LAM 进行微调,以强调以具身智能为中心的动作动力学。在阶段 2 中,我们在从无标签视频中提取的去偏潜在动作上微调 ACWM,以去除所学可控性的偏差。在阶段 3 中,我们添加了一个轻量级的动作到潜在映射层,将机器人动作桥接到潜在空间,并将 ACWM 适应于可执行的机器人控制。
借助这些目标,两个去偏阶段分别仅需 1k 和 2k 次更新。实证表明,CD-LAM 在 2B 和 14B 骨干网络(第 V 节)上,改善了图 1 中总结的所有三个方面。首先,基于去偏潜在动作条件化的 ACWM rollout 表现出更低的动作跟随误差:在 2B 和 14B 规模下,FDCE 分别下降了 42% 和 26%。其次,在机器人动作适应后,这些增益依然存在:FDCE 进一步下降了 35% 和 30%,并伴随着视觉保真度的提高,去偏后的 14B 模型在每个指标上都取得了最佳性能。第三,去偏后的潜在空间适应成本显著降低:CD-LAM 以超过 12 倍的机器人动作适应更新次数少于 DreamDojo 基线。总之,这些结果表明,针对 LAM 的去偏是提高有限机器人动作数据下可控性的有效方法。
本文做出以下四项贡献: • 我们分析了现有 LAMs 中与动作无关的偏差,并引入了用于衡量基于 LAM 的 ACWMs 中潜在动作偏差、可控性和鲁棒性的指标。 • 我们提出了 CD-LAM,这是一个基于三个 LAM 目标的因果去偏框架:以具身智能为中心的重构、以动作为中心的对比学习和潜在空间校准。
第 3 页
• 我们表明,CD-LAM 实现了有效且高效的去偏,在 2B 和 14B 骨干网络上提升了动作跟随能力、视觉保真度以及适应效率,同时以比 DreamDojo 参考方法少 12 倍以上的机器人动作适应更新次数,达到了与之相当的效果。 • 我们发布了去偏后的 LAM、去偏后的 ACWM、评估协议以及训练代码,以促进未来对可控具身世界模型的研究。
III. 潜在动作中的混杂因素分析
在基于 LAM 的 ACWM 中,$z_t$ 是 ACWM 去偏微调期间世界模型接收到的唯一动作信号,因此 $z_t$ 中的任何偏差都会成为动作条件本身的偏差。我们首先分析为什么重构目标会允许此类偏差,然后验证现有 ACWM 中由此导致的失败。
A. 为什么以重构为中心的损失会引入混杂因素
对于具身 ACWM,$z_t$ 应作为控制信号,其主导变化应反映关键的具身动力学特性:身体和物体运动、接触以及位移。然而,经过重构训练的 LAM 并不强制要求这种纯粹性。其目标仅要求预测充分性,即 $z_t$ 有助于建模 $p(o_{t+1} | o_t, z_t)$,因此任何与转换预测相关的因素都可以进入潜在空间:
$$ z_t = \mu_\phi(o_t, o_{t+1}) \approx f(A_t, C_t, V_t), \quad (5) $$
其中 $A_t$ 表示具身动作效应,$C_t$ 表示场景上下文,$V_t$ 表示源侧视觉因素,如背景延续和外观连续性。符号 $f(\cdot)$ 表明,目标中没有任何内容阻止 $z_t$ 除了与 $A_t$ 相关外,还与 $C_t$ 和 $V_t$ 存在非平凡的依赖关系。这导致了与动作无关的混杂,如图 1(d) 所示。场景上下文和源侧视觉因素在观察历史中是有效的证据,因为它们有助于渲染当前场景。然而,一旦编码进 $z_t$,它们就进入了模型的动作侧,而条件部分指定的是视频延续而非具身动力学。
II. 预备知识
A. 动作条件世界模型
动作条件世界模型 (ACWM) 预测在动作序列下的未来观测:
$$ p_\theta(o_{t+1:t+H} | o_{\le t}, u_{t:t+H-1}), \quad (1) $$
其中 $o_t$ 表示时间 $t$ 的视觉观测,$u_t$ 表示记录的机器人可执行动作,例如相对末端执行器位移。动作序列 $u_{t:t+H-1}$ 可能来自策略、规划器或人类操作员。通常,ACWM 通过条件下一视频预测进行训练,为此条件分布使用类似扩散的视频损失。
B. 潜在动作模型
给定相邻帧 $\langle o_t, o_{t+1} \rangle$,LAM 推断出一个潜在动作向量 $z_t \in \mathbb{R}^d$,即观察到的动作相关信息的摘要 [10]–[12]。LAM 可以写为编码器与解码器的配对:
$$ z_t \sim q_\phi(z | o_t, o_{t+1}), \quad \hat{o}_{t+1} = D_\psi(o_t, z_t). \quad (2) $$
我们记 $\mu_\phi(o_t, o_{t+1})$ 为 $q_\phi$ 的后验均值,在需要确定性潜在动作时使用。标准的 LAM 目标是下一帧重构,可选地加上瓶颈或先验正则化器:
$$ L_{LAM} = \mathbb{E} \, \ell(D_\psi(o_t, z_t), o_{t+1}) + \text{Reg}(z_t). \quad (3) $$
这里 $\ell$ 是观测重构损失,Reg 表示特定 LAM 使用的容量控制机制,例如 KL 瓶颈。该目标通过有助于重构或预测观察到的转换的信息来定义 $z_t$。
C. ACWM 的去偏微调
先前的基于 LAM 的 ACWM 系统在 ACWM 去偏微调期间使用潜在动作作为缺失机器人动作的替代品:转换被编码为 $(o_t, o_{t+1}) \mapsto z_t$,世界模型训练如下:
$$ p_\theta(o_{t+1:t+H} | o_{\le t}, z_{t:t+H-1}). \quad (4) $$
此流程需要两个属性。潜在动作应捕获观察到的转换中的具身动作,且世界模型应使未来运动遵循潜在动作条件 [10]–[14]。注意,$z_t$ 扮演的角色与 $u_t$ 不同:记录的机器人动作 $u_t$ 是由具身主体及其控制器定义的可执行控制信号,而 $z_t$ 是仅由 LAM 训练目标定义的源自视频的条件变量。我们在第 III 节中考察此类变量是否适合真实机器人动作条件。
机器人动作适应则继承了这种受污染的潜在空间。机器人动作 $u_t$ 可以锚定具身动力学于 $A_t$,但它无法指定源特定的上下文、背景延续或类似相机的变化,因此可执行的机器人动作被迫与部分不可动作化的潜在空间对齐。结果是机器人动作跟随能力较弱。
B. 代表性基于 LAM 的 ACWM 的实证研究
接下来,我们检查分析出的失败是否出现在实践中,以 DreamDojo [14] 作为代表性基于 LAM 的 ACWM。证据分为两层:弱的动作跟随能力和混杂的潜在动作表示。
弱的机器人动作跟随。机器人动作适应后,生成的具身动力学应遵循条件动作。然而,DreamDojo ACWM 在两种基本设置中容易违反这一要求,这两种设置均保持初始帧固定,仅替换条件动作。我们选择了一些示例进行定性分析。
首先,在零动作下,我们执行动作替换,记为 $do(u_t = 0)$。尽管具身运动应被抑制,但 rollout 仍在继续移动(图 3)。
其次,在目标动作迁移中,条件动作被替换为取自不同目标视频的动作,rollout 应复现目标具身动力学,然而它并没有做到(图 4)。这些示例表明,ACWM 并不能可靠地遵循提供的机器人动作。
潜在动作中的与动作无关的混杂因素。我们进一步直接检查潜在动作空间。一个干净的潜在
第 4 页
表 I. LAM 动作无关混淆因素审计。CD-LAM(我们的方法,见第四节)减少了零转换、相机位移和剧集上下文响应。捷径泄漏(Shortcut leakage)是指不同动作同剧集样本对与相同动作不同剧集样本对之间的差距。所有诊断均在任何世界模型展开之前单独评估 LAM 编码器;干净的潜在动作应在所有三项诊断中表现出弱响应(越低越好)。
| 诊断指标 | DreamDojo LAM | CD-LAM | | :— | :—: | :—: | | 零转换响应(静态对 $(o_t, o_t)$;相对范数 $\downarrow$) | | | | 中位响应 | 0.527 | 0.043 | | 绝对潜在范数(中位数) | 3.119 | 0.226 | | 相机位移鲁棒性(合成平移;相对范数 $\downarrow$) | | | | 水平位移(均值/中位数) | 0.555 / 0.536 | 0.156 / 0.096 | | 垂直位移(均值/中位数) | 0.545 / 0.529 | 0.110 / 0.064 | | 动作邻域结构(硬负样本诊断,$\downarrow$) | | | | 捷径泄漏 | 0.151 | 0.014 |
图 3. 零机器人动作输入仍会产生运动。帧由 2B DreamDojo ACWM 在 AgiBot 数据集 [18] 上经过机器人动作适应后生成,初始帧固定,所有相对机器人动作输入替换为零,$d_o(u_t = 0)$。展开过程仍会产生本体运动。
图 4. 展开过程未遵循转移的目标动作。第一行提供机器人动作序列的源上下文,第二行显示目标视频帧输入,第三行是 ACWM 在固定源上下文条件下针对该目标动作的展开结果。展开过程未能复现目标本体动力学,表明机器人动作适应后存在目标动作不匹配。
CD-LAM 通过一种高效的阶段性微调管道实现了受动机驱动的去偏方法。
A. 设计原则
第三节的分析导出了三个设计原则:动作无关因素应被排除在潜在动作空间之外,而视觉上下文应通过观察路径保持可用。
- 以本体为中心的重建。重建信号应强调与本体动力学相关的区域,而非背景区域。
- 以动作为中心的结构。潜在动作空间应具有对相似动作视频进行分组的结构,而不是对视觉相似但动作不同的视频进行分组。
- 校准且非坍缩的潜在空间。重复行显示的源上下文帧输入与第二行显示的目标视频帧输入应映射到指定的零转换参考,而普通转换应保留足够的变化性以编码本体动力学。
CD-LAM 通过三个匹配的 LAM 目标实现这些原则:以本体为中心的重建($L_{emb}$)、以动作为中心的对比学习($L_{ctr}$)和潜在空间校准($L_{cal}$)。潜在空间应满足三个基本属性:(1) 从重复帧对编码的零转换潜在值 $z_{0t} = \mu_\phi(o_t, o_t)$ 应保持接近零;(2) 类似相机的图像位移应仅引起较小的潜在响应;(3) 局部邻域应反映动作相似性而非共享的视觉上下文。为了量化这三种类型的偏差,我们设计了相应的评估指标(附录 A)并将其应用于 DreamDojo LAM。如表 I 所示,DreamDojo LAM 未能达到这些期望的属性,并表现出显著的偏差:重复帧对和合成相机位移产生了较大的潜在响应,而相同剧集的视觉上下文即使在动作原语不同的情况下也会使潜在值更靠近。这些结果表明,DreamDojo LAM 学习的动作显著受到动作无关混淆因素的影响。
IV. CD-LAM:潜在动作的因果去偏
第三节表明,仅使用重建目标训练的 LAM 可能会使 $z_t$ 成为混淆的潜在动作。受此分析启发,我们提出了 CD-LAM,这是一种因果去偏方法。给定转换 $(o_t, o_{t+1})$,CD-LAM 产生去偏潜在动作:
$$ z^{CD}_t = \mu_\phi(o_t, o_{t+1}) \in \mathbb{R}^d, \quad (6) $$
该潜在动作被馈入与原始 DreamDojo 潜在值相同的 ACWM 条件格式中。LAM 使用以下公式进行微调:
$$ L_{CD} = L_{emb} + \lambda_{ctr}(k)L_{ctr} + \lambda_{cal}L_{cal}. \quad (7) $$
这里 $\lambda_{ctr}(k)$ 和 $\lambda_{cal}$ 是对比学习和校准项的权重,其中 $\lambda_{ctr}(k)$ 随训练步数 $k$ 变化(我们将 $t$ 保留用于帧时间)。
1) 以本体为中心的重建损失
我们使用以本体为中心的加权均方误差进行帧对重建。给定转换 $(o_t, o_{t+1})$,CD-LAM 预测 $\hat{o}_{t+1} = D_\psi(o_t, z^{CD}_t)$,如公式 (2) 所示。令 $M_t \in [0, 1]^{h \times w}$ 为由
第 5 页
SAM3 [19],其中 $h \times w$ 为帧分辨率。我们定义空间权重 $$ W_t = \alpha_{fg}M_t + \alpha_{bg}(1 – M_t), \quad \alpha_{fg} > \alpha_{bg}, \quad (8) $$ 并优化 $$ L_{emb} = \frac{1}{|\Omega|} \sum_{t} \left\| W_t \odot (\hat{o}_{t+1} – o_{t+1}) \right\|_2^2. \quad (9) $$ 这里 $\Omega$ 表示帧的像素网格。该损失强调主体动力学区域的重建,同时保留非零的背景权重以维持全局视觉一致性。
仅靠重建会将每个转换独立处理。CD-LAM 在粗略操作原语(manipulation primitives)上添加了一对对比损失,使得动作一致的转换在不同视觉背景下保持接近。令 $v_i = \text{norm}(r_\omega(z^{CD}_i))$,对于同原语对令 $y_{ij} = +1$,否则 $y_{ij} = -1$。我们使用 $$ L_{ctr} = \frac{1}{|P|} \sum_{(i,j) \in P} \text{softplus} \left( -y_{ij}(\tau v_i^\top v_j + b) \right). \quad (10) $$ 这里 $r_\omega$ 是一个仅由该损失使用的辅助投影头,$\tau$ 和 $b$ 是学习到的温度和偏置 [20]。同原语对被拉近,不同原语对被推远。原语标签是通过将描述性动词聚类到 12 维原语空间获得的粗略动词级类别(附录 B);它们不包含可执行机器人动作,因此该项塑造了潜在动作表示,而不会使 CD-LAM 变成监督式机器人动作学习。
2) 以动作为中心的对比学习
3) 潜在空间校准
潜在空间校准损失具有两个作用: $$ L_{cal} = L_{KL-fb} + L_{zero}. \quad (11) $$ 自由位 KL 项 $L_{KL-fb}$ 作为仅应用于每个维度自由位下限的 KL 惩罚,提供容量控制,防止 $z_t$ 存储任意的转换信息,同时保留普通转换中的变化。零转换校准项 $L_{zero}$ 将重复帧输入锚定到零转换参考: $$ L_{zero} = \mathbb{E}_{o_t} \left[ \left\| \frac{\|z^0_t\|_2}{\text{sg}(s_\Delta) + \epsilon} – m_{zero} \right\|_2^2 \right]. \quad (12) $$ 这里 $z^0_t = \mu_\phi(o_t, o_t)$ 是第三节-B 中的零转换潜在变量,$s_\Delta$ 是普通转换潜在变量的运行均方根范数,$\text{sg}(\cdot)$ 表示停止梯度,$[x]_+ = \max(x, 0)$,$m_{zero}$ 是一个小的边际值,$\epsilon$ 是一个小常数。$L_{zero}$ 将零转换潜在变量的范数推至普通转换潜在变量运行均方根的 $m_{zero}$ 倍以下。这校准了零转换参考,而不会迫使普通转换潜在变量坍塌。
C. 多阶段训练
CD-LAM 用于三阶段训练流程(图 2)。前两个阶段在动作未标记视频(ACWM 去偏微调)上运行,而最终阶段引入配对的机器人动作(机器人动作适应)。
1) 阶段 1(LAM 去偏微调)。我们首先使用 CD-LAM 目标(公式 7)在动作未标记视频上微调 LAM。
2) 阶段 2(ACWM 去偏微调)。然后,我们从视频转换中提取去偏潜在变量 $z^{CD}_t$,并在 $z^{CD}_t$ 替代 $z_t$ 的条件下,继续根据公式 (4) 训练 ACWM。这将世界模型适应到去偏潜在动作空间,然后再引入可执行机器人动作。
3) 阶段 3(机器人动作适应)。最后,对于配对的机器人动作数据 $(o_t, u_t, o_{t+1})$,我们将可执行机器人动作对齐到去偏潜在动作空间。训练一个轻量级 MLP 桥接器 $g_\eta$ 来回归停止梯度的 CD-LAM 潜在变量,$g_\eta(u_t) \approx \text{sg}(\mu_\phi(o_t, o_{t+1}))$,辅助动作读取器通过循环一致性目标鼓励映射后的潜在变量保留关于 $u_t$ 的信息。在机器人动作适应期间,ACWM 接收 $\hat{z}_t = g_\eta(u_t)$,因此可执行机器人动作进入与阶段 2 中使用的相同的去偏潜在动作空间。
V. 实验
我们从三个方面评估 CD-LAM。首先,潜在动作理解:LAM 的表示是否捕捉了主体动力学,而非与动作无关的混淆因素?其次,下游动作跟随:ACWM 是否在固定视觉背景下遵循潜在动作和机器人动作条件?第三,机器人动作适应效率与数据利用:小型 LAM 去偏阶段是否能降低机器人动作适应成本并产生巨大的下游收益?
A. 实验设置
模型与基线。我们在两个规模(2B 和 14B)的 ACWM 骨干网络上应用 CD-LAM 去偏,它们共享同一个去偏 LAM。DreamDojo [14] 及其原始重建训练的 LAM 作为基线;CD-LAM 仅替换 LAM 的潜在动作空间,并保持 ACWM 架构、潜在维度和条件格式不变,因此所有比较都隔离了 LAM 去偏阶段的影响。去偏阶段还使用 SAM3 前景掩码和粗略原语标签(附录 B)作为训练信号;基线不使用这些。
训练。训练遵循第四节-C 中的三个阶段,并在 96 块 H100 GPU 上运行。LAM 去偏微调使用 1k 优化器步数,每 GPU 批次大小为 32;除非另有说明,CD-LAM 模型使用 100h 去偏数据层级(表 IV 将该层级从 1h 变化到 1000h)。ACWM 去偏微调使用 2k 优化器步数,每 GPU 批次大小为 12(2B)和 2(14B)。对于机器人动作适应后的主要结果,我们报告对齐运行的最终检查点:2B 为 3k 步,14B 为 6k 步。在所有效率比较中,
第 6 页
来源
DreamDojo-2B
CD-LAM-2B
DreamDojo-14B
CD-LAM-14B
图 5. 在 2B 和 14B 规模下,机器人动作适应后的代表性回放序列。行:2B 和 14B 规模下的真实值(ground truth)、DreamDojo 和 CD-LAM;所有模型行均从相同的初始帧开始,并接收相同的机器人动作序列。DreamDojo 的机械臂姿态偏离了真实轨迹,且扩展至 14B 规模并未修复这种漂移,而 CD-LAM 在两个规模下均能跟踪指令动作;场景外观保持相当,因此差异在于动作跟随能力而非视觉质量。彩色叠加层是用于区分模型的行标记,而非模型输出。
步数表示在对齐协议下的优化器更新次数:两个模型使用相同的机器人动作适应数据、批量大小和优化器设置,因此步数具有直接可比性。图 1(c) 中的 50k 步参考值以及图 8 中的虚线表示 DreamDojo 完整的原始机器人动作适应预算。
评估数据。在 ACWM 去偏微调后的潜在动作条件回放序列,在来自 EgoDex [21] 的 300 个保留片段上进行评估,EgoDex 是一个与无动作标注阶段相匹配的以人为中心的物体操作语料库;机器人动作回放序列和机器人动作适应后的直接干预,在来自 AgiBot [18] 不同片段的 300 个片段上进行评估,AgiBot 是一个具有配对可执行机器人动作的真实机器人数据集。
干预协议。干预遵循第三节-B 部分:观测历史保持不变,仅替换条件动作。在零动作条件下,$do(u_t = 0)$,本体运动应被抑制。在目标动作转移下,条件动作被替换为从不同目标视频中编码的动作,回放序列应反映在固定源上下文下的目标动作的方向和幅度。对于潜在动作,这意味着 $do(z_t = z^{target}_t)$,其中 $z^{target}_t = \mu_\phi(o^{target}_t, o^{target}_{t+1})$;对于机器人动作,这意味着 $do(u_t = u^{target}_t)$,其中 $u^{target}_t$ 为目标视频记录的動作。
指标。我们使用 PSNR、前景 PSNR (FG-PSNR)、SSIM 和 LPIPS 评估视觉保真度。这些指标衡量回放序列在视觉上是否接近参考序列,但它们并不直接测试本体动力学是否遵循动作条件。为了量化动作跟随能力,我们报告前景位移切弗距离误差 (FDCE),即生成的前景位移轨迹与参考前景位移轨迹之间的对称切弗距离,值越低越好。前景掩码使用 SAM3 [19] 选择本体和交互物体区域,点轨迹仅在有效前景区域内使用 CoWTracker [22] 计算。每个回放序列对最多采样 16 个有效前景锚点。如图所示
第 7 页
图 6(a) 中,FDCE 比较的是诱导的前景位移,而非原始像素外观。FDCE 以像素为单位测量;我们报告均值,它对偶尔的大失败敏感,以及中位数,它反映了典型行为。FDCEfull 指标的定义和报告惯例在附录 A 中提供。如图 6(b) 所示,一次 rollout 可能在 PSNR 上得分很高,但错过了指令的运动,因此仅凭重建质量不足以测试可控性。
B. 潜在动作理解审计(阶段 1)
我们首先在任何世界模型 rollout 之前审计潜在动作。这直接测试了第 III 节中确定的上游来源:编码器 $(o_t, o_{t+1}) \rightarrow z_t$ 是否将动作无关的混淆因子响应为具身动作。
表 I 中的每个诊断都针对公式 (5) 中的一个混淆因子:零转换响应测试重复帧是否仍会产生动作类似的潜在变量,相机偏移响应测试源端视觉因素 $V_t$,捷径泄漏测试场景上下文 $C_t$。表 I 显示,CD-LAM 强烈减少了对动作无关混淆因子的响应,同时保留了局部动作结构:中位数零转换响应从 0.527 降至 0.043,合成相机偏移引起的响应减小了 3.6–8.3 倍,捷径泄漏从 0.151 降至 0.014。使用相同的硬负样本探针验证了保留性:来自不同片段的相同原语对保持几乎不变的余弦相似度(0.132 对比 0.131),因此 CD-LAM 将潜在动作空间去偏向了具身转换语义,而不是均匀地缩小它。阶段 1 因此提供了第 III 节所要求的修复;接下来的两个小节追踪它如何向下游传播。
D. 机器人动作适应 Rollouts(阶段 3)
然后,我们在机器人动作适应后评估下游动作跟随。这里的实验输入是可执行的机器人动作 $u_t$,它通过场景上下文 $C_t$ 进入 ACWM,映射为 $\hat{z}_t = g_\eta(u_t)$,因此该测试询问 ACWM 是否在映射到去偏潜在动作空间后遵循可执行的机器人动作。
表 III 是主要的系统级结果:CD-LAM 增强了具身动作跟随,同时提高了视觉保真度。在 2B 规模下,$FDCE_{mean}$ 下降了 35%(从 12.63 降至 8.24),在 14B 规模下下降了 30%(从 11.11 降至 7.73),并且在两个规模下 $FDCE_{med}$、PSNR、SSIM 和 LPIPS 均有持续改进。在 14B 规模下,CD-LAM 进一步改进了其 2B 对应版本在表 III 中的每一列,而基线缩放效果参差不齐:即使 PSNR 提高,$FDCE_{med}$ 也从 8.15 恶化到 8.98。这补充了第 V-C 节:规模不能替代去偏,但会与去偏产生叠加效应。定性 rollout 如图 5 所示;图 7 确认了该增益 (a) 跨越了动作类别,而不仅仅是单个原语,并且 (b) 将整个 rollout 分布向更低的 FDCE 和更高的 PSNR 移动。完整的逐动作分解和额外的迁移示例在图 A.1 中提供,其中 CD-LAM 在少数类别上与基线持平或略逊一筹。评估类别遵循 AgiBot 的动作标注,并与附录 B 中的 12 类训练原语不同。
直接动作跟随干预。表 III 的干预列应用了评估协议中的两种干预,并直接显示 rollout 对提供的动作条件更敏感。在零动作干预 $do(u_t = 0)$ 下,残余 FDCE 在 2B 规模下减半(从 10.71 降至 5.03),在 14B 规模下降至四分之一以下(从 9.36 降至 2.18):当动作指定无运动时,rollout 现在基本保持静止,这正是图 3 显示基线所缺乏的行为。在目标动作迁移 $do(u_t = u_t^{target})$ 下,FDCE 从 24.36 改善到 22.55,从 24.82 改善到 21.11。最大的相对增益恰好出现在条件压力测试的地方,这与对动作输入的敏感性提高一致:机器人动作适应将机器人动作对齐到一个现在编码具身动力学而非动作无关混淆因子的空间。
(a) FDCE 计算 (b) PSNR–FDCE 散点图 图 6. 视觉保真度和动作跟随是互补的。(a) FDCE 通过比较生成的和参考的前景位移轨迹,使用对称切弗距离来测量前景运动一致性。(b) 像素级保真度不能证明动作跟随:PSNR 仅解释了 FDCE 的有限方差 ($r = -0.38, R^2 = 0.14$)。
C. ACWM 去偏微调 Rollouts(阶段 2)
接下来,我们测试去偏 LAM 是否也通过 ACWM 去偏微调来去偏世界模型,使用潜在动作条件 rollout。世界模型直接消耗由 LAM 提取的潜在动作 $z_t$,没有机器人动作桥梁,因此任何增益都归因于潜在动作条件本身,而不是机器人动作对齐。
表 II 显示了两个规模下的一致增益。在潜在动作 rollout 中,CD-LAM 在 2B 规模下将 FDCE 减少了 42%(从 34.00 降至 19.63),在 14B 规模下减少了 26%(从 40.29 降至 29.87),同时也提高了 PSNR、SSIM 和 LPIPS;在目标动作迁移 $do(z_t = z_t^{target})$ 下,FDCE 分别下降了 21% 和 34%。迁移像素指标几乎保持不变,而 FDCE 显著改善,表明主要增益在于运动跟随,而不是像素相似性。
去偏确实传播了:这里没有对任何 LAM 输出进行评分,只对 ACWM rollouts 进行评分,因此这些增益表明阶段 2 将阶段 1 的修复携带到了世界模型中。此外,规模不能替代去偏:基线的 FDCE 从 2B 到 14B 恶化(迁移情况下从 34.00 到 40.29,以及从 42.74 到 50.27),因此更大的骨干网络放大了视觉能力,但没有放大动作跟随,而 CD-LAM 在两个规模上都提高了两者。
第 8 页
表 II. ACWM 去偏微调后的潜在动作条件 rollout。左块:基于视频转换中的潜在动作 $z_t$ 的 rollout。右块:在固定源上下文下的目标动作转移 $\text{do}(z_t = z_t^{\text{target}})$。右块的像素差异微乎其微,因此主要的比较指标是 FDCE。粗体表示每个 backbone 中表现更好的模型;FDCE 越低越好。
潜在动作 $z_t$ rollout $\text{do}(z_t = z_t^{\text{target}})$
Backbone Model FDCE ↓ PSNR ↑ SSIM ↑ LPIPS ↓ PSNR ↑ SSIM ↑ LPIPS ↓ FDCE ↓
DreamDojo 34.00 20.88 0.780 0.413 13.02 0.598 0.643 42.74 2B CD-LAM 19.63 24.29 0.827 0.308 13.15 0.588 0.600 33.81
DreamDojo 40.29 21.04 0.792 0.398 13.11 0.593 0.631 50.27 14B CD-LAM 29.87 23.18 0.814 0.342 13.03 0.597 0.617 33.22
表 III. 机器人动作适应及直接干预后的 2B/14B ACWM 结果。在 AgiBot 上进行评估。零动作干预 $\text{do}(u_t = 0)$ 测试零动作是否抑制了本体运动;其 FDCE 是相对于静态参考(固定初始帧)计算的,因此该列表示为残余运动,与 rollout 列不可直接比较。目标动作转移 $\text{do}(u_t = u_t^{\text{target}})$ 测试在固定源上下文下的动作跟随能力。粗体表示每个 backbone 中表现更好的模型;FDCE 越低越好。
机器人动作 $u_t$ rollout $\text{do}(u_t = 0)$ $\text{do}(u_t = u_t^{\text{target}})$
Backbone Model FDCE$_{\text{mean}}$ ↓ FDCE$_{\text{med}}$ ↓ PSNR ↑ SSIM ↑ LPIPS ↓ FDCE ↓ FDCE ↓
DreamDojo 12.63 8.15 19.85 0.798 0.271 10.71 24.36 2B CD-LAM 8.24 6.75 20.60 0.806 0.269 5.03 22.55
DreamDojo 11.11 8.98 20.01 0.808 0.263 9.36 24.82 14B CD-LAM 7.73 5.99 21.01 0.818 0.247 2.18 21.11
CD-LAM DreamDojo
(a) 按动作类型划分的 FDCE (b) Rollout 分布
图 7. 机器人动作适应后的动作跟随行为,超越聚合分数。(a) CD-LAM 在 2B 和 14B 规模下,降低了所示八个动作类别的 FDCE(完整细分见图 A.1),表明这种增益并非集中在单一原语中。(b) 在机器人动作适应后的 2B ACWM 上,CD-LAM 将 rollout 分布向更低的 FDCE 和更高的 PSNR 移动。
E. 机器人动作适应效率与去偏数据 机器人动作适应计算。图 1(c) 总结了 扩展 终点:最终对齐的检查点使用了 3k(2B)和 6k (14B)次更新,而参考值为 50k。上述主要结果比较的是最终检查点。我们 表 IV 评估了同一效应的数据方面。即使仅 1h 的 CD-LAM 层级也将 FDCE$_{\text{mean}}$ 从 12.63 降低到 8.91,同时保 持 PSNR,而 1000h 层级进一步将其降低至 7.97。机器人动作适应协议下,图 8 显示在 14B 规模时, 1h 层级已经捕获了 1000h 层级 FDCE 改进(4.66 个点中的 3.72 个点)的大约 80%,因此收益主要 来自于去偏本身,而非去偏数据规模。早期的大增益以及较大层级带来的较小但一致的增益支持“少即是多”模式: 使用有限数据进行目标 LAM 去偏解锁了大部分下游可控性改进,而额外数据继续 提供收益。这是“少即是多”效应的计算方面:因为 ACWM 不再需要遗忘混淆的动作条件,短暂的 阶段 1 去偏过程取代了大量下游
第 9 页
以细化具身动作一致性。
F. 目标消融
最后,我们对 CD-LAM 的三个目标组件进行消融,以将经验增益回溯至第 IV-A 节中的设计原则。表 V 报告了三项读数,用于识别每个术语控制的失效模式:ACWM 去偏微调后的 rollout 保真度、LAM 相机位移响应以及机器人动作 FDCE。此消融中的 FDCE 是在单独的消融评估设置下测量的,因此其绝对值与表 III 不可比。
具身中心加权保护前景保真度和动作跟随性:移除它会使 FG-PSNR 降低 0.31 dB,并使机器人动作 FDCE 恶化 1.17 px,同时相机位移响应几乎保持不变。动作中心对比对 PSNR 或相机位移响应几乎没有影响(在报告精度下相同),但移除它会使机器人动作 FDCE 恶化 1.84 px,表明其主要作用是组织动作一致的过渡邻域,而非锐化帧。
零转移校准是抑制与动作无关的相机位移响应的关键因素。移除它会使水平/垂直相机位移响应从 0.133/0.101 增加到 0.637/0.637,增大约 4.8 倍/6.3 倍。尽管如此,移除它在此分割上降低了 FDCE;表注解释了为何我们不将其解读为更好的去偏。每个术语都控制着其设计所针对的失效模式,符合第 IV-A 节的设计原则:这三个目标是互补的,而非冗余的。
表 V. CD-LAM 的目标消融。PSNR 和 FG-PSNR 是在 ACWM 去偏微调后,在潜在动作条件 ACWM 的 rollout 上测量的,而非在 LAM 解码器重建上测量。相机位移响应是对合成水平/垂直图像位移的相对潜在响应,机器人动作 FDCE 是在机器人动作适应后的 rollout 上测量的。所有列均在单独的消融评估设置下测量,且仅在此表内可比。
| Objective | PSNR ↑ | FG-PSNR ↑ | Cam-shift x/y ↓ | FDCE ↓ | | :— | :— | :— | :— | :— | | Full CD-LAM | 29.64 | 26.57 | 0.133 / 0.101 | 17.23 | | w/o emb.-centric weighting | 29.53 | 26.26 | 0.134 / 0.100 | 18.40 | | w/o action-centric contrast | 29.64 | 26.57 | 0.134 / 0.101 | 19.07 | | w/o zero-trans calibration | 29.31 | 26.48 | 0.637 / 0.637 | 16.10† |
† 该变体在此分割上获得了更低的机器人动作 FDCE,但它未能通过上游相机位移诊断。因此,我们不将其解读为更好的动作去偏;零转移校准的证据在于其对与动作无关的相机位移响应的抑制。
图 8. 机器人动作适应效率。在对齐协议下,CD-LAM 在 3k–4k 次更新内超越了 DreamDojo 参考(比 50k 参考少 12 倍以上),并在最终的 6k 检查点明显超越它。曲线显示的是 14B 模型在监控子集上的表现;绝对值与表 III 不可直接比较。
VI. 相关工作
潜在动作模型。从动作未标注视频中学习的潜在动作模型读取一帧对并推断出一个紧凑的潜在动作,以总结两者之间的变化,使得解码器或世界模型能够预测下一帧。这一思想源于通过观看未标注视频来学习行动:从观察中模仿潜在策略 [23] 以及大规模视频预训练以进行控制 [24]。Genie [10] 使用离散潜在动作码本,以大规模引入了这种视频到动作的抽象;LAPO [11] 仅从观察中恢复潜在动作以引导策略,LAPA [12] 通过对帧间转换进行量化来学习离散潜在动作;AdaWorld [13] 将此类潜在动作学习为快速世界模型适应的条件;以及 Moto [25] 和 IGOR [26] 等具身操作变体,将帧间运动或图像目标变化标记化为共享的潜在动作空间。更近期的变体探索了加性组合潜在动作 [27]、共同演化的潜在动作-世界模型 [28] 以及跨视角动作中心潜在动作 [29]。其共同原则是关联性的:潜在动作由改善下一帧重建的内容定义(呼应掩码重建表示学习 [30]),而主要的杠杆是扩展数据和码本大小。
世界模型与动作条件世界模型。世界模型将经验压缩为学习到的潜在动态,这些动态可以 rollout 以想象用于规划或控制的未来 [1], [2],以及视频基础模型如 UniSim [31] 和 Cosmos [32] 将其扩展到高分辨率、长视距的网络规模视频预测。动作条件世界模型 additionally 将 rollout 条件化于动作,给定控制输入预测未来,而不仅仅是继续视频。这正是将被动视频预测器转变为具身代理可控模拟器的关键 [3], [4],并且越来越多地在大规模跨具身语料库 [5], [6] 上进行训练。潜在动作世界模型是 ACWM 的一种变体,其条件动作是 LAM 的潜在动作而非记录的控制命令,因此在动作未标注视频上基于潜在动作训练期间学习的潜在动作条件,随后可以驱动具身代理:DreamDojo [14] 实例化了这种 LAM–ACWM 配方,是我们进行比较的基线。
可控视频与具身运动的指标。
表 IV. 去偏数据的扩展。每个层级使用所述时长的视频对 LAM 进行去偏,然后在 2B 骨干网络上重复相同的对齐机器人动作适应。所有层级共享相同的 1k 步 Stage-1 预算,因此该比较在固定计算量下隔离了数据数量。
| Model | PSNR ↑ | FDCEmean ↓ | FDCEmed ↓ | | :— | :— | :— | :— | | DreamDojo | 19.85 | 12.63 | 8.15 | | CD-LAM-1h | 20.54 | 8.91 | 6.88 | | CD-LAM-10h | 20.61 | 8.87 | 6.23 | | CD-LAM-100h | 20.60 | 8.24 | 6.75 | | CD-LAM-1000h | 20.64 | 7.97 | 6.12 |
第 10 页
视频世界模型通常通过像素级和分布级的保真度(例如 PSNR 和 FVD [33])进行评分,这些指标奖励清晰、合理的帧,但对是否遵循了指令动作 largely insensitive(很大程度上不敏感):一个模型可以复制上下文并得分良好,同时忽略潜在动作。基于动作跟随的评估则追踪事物实际移动的位置:MotionPro [34] 基于点跟踪基准和方法 [35]–[37],通过点跟踪器传播的点上的平均轨迹距离(ObjMC)来评估物体运动控制。我们采用了这种基于跟踪的立场,但将其专门化用于具身操作,其中我们的 FDCE 指标在 Segment-Anything 掩码 [38], [39](我们管线中的 SAM3 [19])上,使用 CoWTracker 跟踪 [22] 的 delta 轨迹来测量前景运动。这一区别对我们的评估至关重要:重建是必要但不充分的,像素和运动指标可以对潜在动作空间进行不同的排序。
因果与去偏表示学习。另一条并行工作线通过跨训练环境的一致性 [40]、捷径学习的分析 [41] 以及模仿学习中受因果动机启发的校正(其中策略会依附于专家动作的干扰相关性 [42]),从学习到的表示中去除虚假或非因果因素。这些方法对策略或分类器的输入进行去偏;而 CD-LAM 则对条件变量进行去偏:即下游世界模型视为干预手柄的潜在动作,其中混杂因素损害的是可控性而非准确性。
先前的工作主要将潜在动作扩展为用于视频重建的预测表示。相反,我们专注于潜在动作表示空间中与动作无关的混杂因素,并表明有针对性的 LAM 去偏可以提高下游可控性和机器人动作适应效率。
VII. 结论
我们提出了 CD-LAM,这是一个因果去偏框架,旨在提高基于 LAM 的动作条件世界模型的可控性。从仅重建的 LAM 训练可以将与动作无关的视觉因素编码到潜在动作中的观察出发,我们分析了这种有偏表示如何混淆下游 ACWM,导致尽管视觉合理的 rollout,但动作跟随能力弱且鲁棒性差。为了解决这个问题,CD-LAM 引入了三个轻量级的去偏目标:以具身为中心的重建、以动作为中心的对比学习以及潜在空间校准,它们共同促进以具身为中心、感知动作且校准良好的非塌陷潜在动作表示。通过高效的三阶段微调管线,CD-LAM 首先对 LAM 进行去偏,然后对 ACWM 进行去偏,最后将模型适应于可执行的机器人动作。在 2B 和 14B 骨干网络上的实验表明,CD-LAM 提高了潜在动作可控性、机器人动作跟随、视觉保真度、鲁棒性和适应效率,同时以比 DreamDojo 参考少 12 倍以上的机器人动作适应更新次数,达到了与之相当的效果。
第 11 页
参考文献
[1] D. Ha 和 J. Schmidhuber, “World models,” arXiv 预印本 arXiv:1803.10122, 2018. [2] D. Hafner, J. Pasukonis, J. Ba, 和 T. Lillicrap, “Mastering diverse domains through world models,” arXiv 预印本 arXiv:2301.04104, 2023. [3] H. Xue, Y. Chen, L. Ma, Z. Zhao, L. Moukheiber, Y. Zhu, 和 Y. Chen, “ACWM-Phys: Investigating generalized physical interaction in action-conditioned video world models,” arXiv 预印本 arXiv:2605.08567, 2026. [4] J. Wu, S. Yin, N. Feng, X. He, D. Li, J. Hao, 和 M. Long, “iVideoGPT: Interactive VideoGPTs are scalable world models,” 在神经信息处理系统进展 (NeurIPS), 2024, arXiv:2405.15223. [5] Open X-Embodiment Collaboration, “Open X-Embodiment: Robotic learning datasets and RT-X models,” arXiv 预印本 arXiv:2310.08864, 2023. [6] A. Khazatsky, K. Pertsch 等, “DROID: A large-scale in-the-wild robot manipulation dataset,” 在机器人:科学与系统 (RSS), 2024. [7] K. Grauman, A. Westbury, E. Byrne 等, “Ego4D: Around the world in 3,000 hours of egocentric video,” 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 2022. [8] K. Grauman, A. Westbury, L. Torresani 等, “Ego-Exo4D: Understanding skilled human activity from first- and third-person perspectives,” 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 2024. [9] D. Damen, H. Doughty, G. M. Farinella, S. Fidler, A. Furnari, E. Kazakos, D. Moltisanti, J. Munro, T. Perrett, W. Price, 和 M. Wray, “Scaling egocentric vision: The EPIC-KITCHENS dataset,” 欧洲计算机视觉会议 (ECCV), 2018. [10] J. Bruce, M. Dennis, A. Edwards, J. Parker-Holder, Y. Shi, E. Hughes, M. Lai, A. Mavalankar, R. Steigerwald, C. Apps, Y. Aytar, S. Bechtle, F. Behbahani, S. Chan, N. Heess, L. Gonzalez, S. Osindero, S. Ozair, S. Reed, J. Zhang, K. Zolna, J. Clune, N. de Freitas, S. Singh, 和 T. Rocktäschel, “Genie: Generative interactive environments,” 在机器学习国际会议 (ICML), 2024, arXiv:2402.15391. [11] D. Schmidt 和 M. Jiang, “Learning to act without actions,” 在表示学习国际会议 (ICLR), 2024, lAPO; arXiv:2312.10812. [12] S. Ye, J. Jang, B. Jeon, S. Joo, J. Yang, B. Peng, A. Mandlekar, R. Tan, Y.-W. Chao, B. Y. Lin, L. Liden, K. Lee, J. Gao, L. Zettlemoyer, D. Fox, 和 M. Seo, “Latent action pretraining from videos,” 在表示学习国际会议 (ICLR), 2025. [13] S. Gao, S. Zhou, Y. Du, J. Zhang, 和 C. Gan, “AdaWorld: Learning adaptable world models with latent actions,” 在机器学习国际会议 (ICML), 2025. [14] S. Gao, W. Liang, K. Zheng, A. Malik, S. Ye, S. Yu, W.-C. Tseng, Y. Dong, K. Mo, C.-H. Lin, Q. Ma, S. Nah, L. Magne, J. Xiang, Y. Xie, R. Zheng, D. Niu, Y. L. Tan, K. R. Zentner, G. Kurian, S. Indupuru, P. Jannaty, J. Gu, J. Zhang, J. Malik, P. Abbeel, M.-Y. Liu, Y. Zhu, J. Jang, 和 L. Fan, “DreamDojo: A generalist robot world model from large-scale human videos,” arXiv 预印本 arXiv:2602.06949, 2026. [15] C. Zhang, T. Pearce, P. Zhang, K. Wang, X. Chen, W. Shen, L. Zhao, 和 J. Bian, “What do latent action models actually learn?” 在神经信息处理系统进展 (NeurIPS), 2025. [16] A. Nikulin, I. Zisman, D. Tarasov, N. Lyubaykin, A. Polubarov, I. Kiselev, 和 V. Kurenkov, “Latent action learning requires supervision in the presence of distractors,” 在机器学习国际会议 (ICML), 2025. [17] S. Ye, J. Jang, B. Jeon, S. Joo, J. Yang, B. Peng, A. Mandlekar, R. Tan, Y.-W. Chao, B. Y. Lin, L. Liden, K. Lee, J. Gao, L. Zettlemoyer, D. Fox, 和 M. Seo, “Latent action pretraining from videos,” 在表示学习国际会议 (ICLR), 2025. [18] S. Gao, S. Zhou, Y. Du, J. Zhang, 和 C. Gan, “AdaWorld: Learning adaptable world models with latent actions,” 在机器学习国际会议 (ICML), 2025. [19] N. Carion, L. Gustafson, Y.-T. Hu, S. Debnath, R. Hu, D. Suris, C. Ryali, K. V. Alwala, H. Khedr, A. Huang 等, “SAM 3: Segment anything with concepts,” arXiv 预印本 arXiv:2511.16719, 2025. [20] X. Zhai, B. Mustafa, A. Kolesnikov, 和 L. Beyer, “Sigmoid loss for language image pre-training,” 在 IEEE/CVF 计算机视觉国际会议 (ICCV), 2023. [21] R. Hoque, P. Huang, D. J. Yoon, M. Sivapurapu, 和 J. Zhang, “EgoDex: Learning dexterous manipulation from large-scale egocentric video,” 2025. [在线]. 可用: https://arxiv.org/abs/2505.11709 [22] Z. Lai, E. Insafutdinov, E. Sucar, 和 A. Vedaldi, “CoWTracker: Tracking by warping instead of correlation,” 2026. [在线]. 可用: https://arxiv.org/abs/2602.04877 [23] A. D. Edwards, H. Sahni, Y. Schroecker, 和 C. L. Isbell, “Imitating latent policies from observation,” 在机器学习国际会议 (ICML), 2019, iLPO; arXiv:1805.07914. [24] B. Baker, I. Akkaya, P. Zhokhov, J. Huizinga, J. Tang, A. Ecoffet, B. Houghton, R. Sampedro, 和 J. Clune, “Video PreTraining (VPT): Learning to act by watching unlabeled online videos,” 在神经信息处理系统进展 (NeurIPS), 2022, arXiv:2206.11795. [25] Y. Chen, Y. Ge, W. Tang, Y. Li, Y. Ge, M. Ding, Y. Shan, 和 X. Liu, “Moto: Latent motion token as the bridging language for learning robot manipulation from videos,” 在 IEEE/CVF 计算机视觉国际会议 (ICCV), 2025. [26] X. Chen, J. Guo, T. He, C. Zhang, P. Zhang, D. C. Yang, L. Zhao, 和 J. Bian, “IGOR: Image-Goal representations are the atomic control units for foundation models in embodied AI,” arXiv 预印本 arXiv:2411.00785, 2024. [27] H. Wei, X. Chen, C. Zhang, T. Pearce, J. Chen, A. Lamb, L. Zhao, 和 J. Bian, “Learning additively compositional latent actions for embodied AI,” arXiv 预印本 arXiv:2604.03340, 2026. [28] Y. Wang, F. Zhang, D.-C. Zhan, L. Zhao, K. Wang, 和 J. Bian, “Co-evolving latent action world models,” arXiv 预印本 arXiv:2510.26433, 2025. [29] J. M. Lee, D. Lee, S. Ju, T. Cho, J. W. Koo, L. Zhao, S. Hong, 和 J. Lee, “MVP-LAM: Learning action-centric latent action via cross-viewpoint reconstruction,” arXiv 预印本 arXiv:2602.03668, 2026. [30] K. He, X. Chen, S. Xie, Y. Li, P. Dollár, 和 R. Girshick, “Masked autoencoders are scalable vision learners,” 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 2022. [31] M. Yang, Y. Du, S. K. S. Ghasemipour, J. Tompson, L. P. Kaelbling, D. Schuurmans, 和 P. Abbeel, “Learning interactive real-world simulators,” 在表示学习国际会议 (ICLR), 2024, uniSim; arXiv:2310.06114. [32] NVIDIA, “Cosmos world foundation model platform for physical AI,” arXiv 预印本 arXiv:2501.03575, 2025. [33] T. Unterthiner, S. van Steenkiste, K. Kurach, R. Marinier, M. Michalski, 和 S. Gelly, “Towards accurate generative models of video: A new metric and challenges,” arXiv 预印本 arXiv:1812.01717, 2018, fVD. [34] Z. Zhang, F. Long, Z. Qiu, Y. Pan, W. Liu, T. Yao, 和 T. Mei, “MotionPro: A precise motion controller for image-to-video generation,” 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 2025. [35] C. Doersch, A. Gupta, L. Markeeva, A. Recasens, L. Smaira, Y. Aytar, J. a. Carreira, A. Zisserman, 和 Y. Yang, “TAP-Vid: A benchmark for tracking any point in a video,” 在神经信息处理系统进展 (NeurIPS), 2022, arXiv:2211.03726. [36] C. Doersch, Y. Yang, M. Vecerik, D. Gokay, A. Gupta, Y. Aytar, J. a. Carreira, 和 A. Zisserman, “TAPIR: Tracking any point with per-frame
[17] W. Dai, K. Lan, J. Zhou, B. Zhao, X. Su, J. Tong, W. Guan, 和 S. Yang,“ConLA:从人类视频中学习对比潜在动作以用于机器人操作”,arXiv 预印本 arXiv:2602.00557,2026。 [18] AgiBot-World-Contributors, Q. Bu, J. Cai, L. Chen, X. Cui, Y. Ding, S. Feng, S. Gao, X. He, X. Hu, X. Huang, S. Jiang, Y. Jiang, C. Jing, H. Li, J. Li, C. Liu, Y. Liu, Y. Lu, J. Luo, P. Luo, Y. Mu, Y. Niu, Y. Pan, J. Pang, Y. Qiao, G. Ren, C. Ruan, J. Shan, Y. Shen, C. Shi, M. Shi, M. Shi, C. Sima, J. Song, H. Wang, W. Wang, D. Wei, C. Xie, G. Xu, J. Yan, C. Yang, L. Yang, S. Yang, M. Yao, J. Zeng, C. Zhang, Q. Zhang, B. Zhao, C. Zhao, J. Zhao, 和 J. Zhu,“AgiBot World Colosseo:一个用于可扩展和智能具身系统的大规模操作平台”,在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,2025。[在线] 可用:https://arxiv.org/abs/2503.06669 [37] N. Karaev, I. Rocco, B. Graham, N. Neverova, A. Vedaldi, 和 C. Rupprecht,“CoTracker:联合追踪更好”,在欧洲计算机视觉会议 (ECCV) 上,2024。 [38] A. Kirillov, E. Mintun, N. Ravi, H. Mao, C. Rolland, L. Gustafson, T. Xiao, S. Whitehead, A. C. Berg, W.-Y. Lo, P. Dollár, 和 R. Girshick,“Segment anything”,在 IEEE/CVF 国际计算机视觉会议 (ICCV) 上,2023,sAM;arXiv:2304.02643。 [39] N. Ravi, V. Gabeur, Y.-T. Hu, R. Hu, C. Ryali, T. Ma, H. Khedr, R. Rädle, C. Rolland, L. Gustafson 等,“SAM 2:图像和视频中的 Segment anything”,arXiv 预印本 arXiv:2408.00714,2024。 [40] M. Arjovsky, L. Bottou, I. Gulrajani, 和 D. Lopez-Paz,“不变风险最小化”,arXiv 预印本 arXiv:1907.02893,2019。
第 12 页
[41] R. Geirhos, J.-H. Jacobsen, C. Michaelis, R. Zemel, W. Brendel, M. Bethge, 和 F. A. Wichmann, “Shortcut learning in deep neural networks,” Nature Machine Intelligence, vol. 2, pp. 665–673, 2020. [42] P. de Haan, D. Jayaraman, 和 S. Levine, “Causal confusion in imitation learning,” in Advances in Neural Information Processing Systems (NeurIPS), 2019.
第 13 页
附录 A 报告规范。FDCE 以评估分辨率下的像素为单位报告。 指标详情 由于偶尔的 rollout 会出现灾难性失败,均值对这些大异常值敏感,而中位数反映典型行为;因此我们同时报告两者。PSNR 报告。我们将 PSNR 作为视觉保真度指标,以分贝(dB)为单位在全帧上计算。对于归一化到 [0, 1] 的图像,像素指标(PSNR、SSIM、LPIPS)是相对于参考 rollout 在全帧上计算的,而 FG-PSNR 将相同的计算限制在前景掩码上。
$$ \text{PSNR}(x, \hat{x}) = 10 \log_{10} \frac{1}{\text{MSE}(x, \hat{x})} \quad (\text{A.1}) $$
图 1(b) 报告了每种设置的绝对 PSNR,并标注了 CD-LAM 的增益(单位为 dB)。由于 PSNR 是对数的,固定的 dB 增益对应于 MSE 的乘法减少:机器人动作适应后在 14B 处的 +1.0 dB 增益意味着 MSE 减少了 20.6% ($10^{-1/10} \approx 0.794$)。
FDCE 定义。FDCE 通过比较前景位移轨迹而非原始像素来衡量前景动作的跟随情况。前景掩码使用 SAM3 [19] 选择本体和交互物体区域,并使用 CoWTracker [22] 仅在有效的前景区域内计算点轨迹。
对于参考前景点 $p_{sj}$ 和 rollout 步骤 $s$ 处的生成前景点 $\hat{p}_{si}$,我们定义相对于初始帧的位移向量为
$$ a_{sj} = p_{sj} – p_{0j}, \quad \hat{a}_{si} = \hat{p}_{si} – \hat{p}_{0i}. \quad (\text{A.2}) $$
生成轨迹 $i$ 与参考轨迹 $j$ 之间的平均距离为
$$ c_{ij} = \frac{1}{H} \sum_{s=1}^{H} \| \hat{a}_{si} – a_{sj} \|_2. \quad (\text{A.3}) $$
给定 $N_g$ 个生成的前景轨迹和 $N_r$ 个参考前景轨迹,我们计算对称的切弗距离(Chamfer distance)为
$$ \text{FDCE}(\hat{o}, o) = \frac{1}{2N_g} \sum_{i=1}^{N_g} \min_{j} c_{ij} + \frac{1}{2N_r} \sum_{j=1}^{N_r} \min_{i} c_{ij}. \quad (\text{A.4}) $$
在我们的评估中,我们对每个 rollout 对采样最多 16 个有效前景锚点,并计算双向最近邻距离的平均值。较低的 FDCE 表示生成的 rollout 产生的前景位移更接近参考动作。
鲁棒性属性。该协议在构建上是保守的。锚点播种在侵蚀后的前景掩码内,并且在评分之前丢弃可见度置信度低的轨迹,因此虚假的背景点不会进入距离计算。公式 (A.4) 中的对称切弗距离形式对位移几何形状进行评分,而不是匹配的点数,因此该指标对不同数量的有效轨迹具有鲁棒性。已知的故障模式是受限于跟踪器而非指标本身(手-物体严重遮挡、快速操作下的运动模糊以及无纹理机械爪上的跟踪漂移),这些情况会导致同一 clip 中所有比较模型的 FDCE 膨胀,从而使比较偏向于零假设。
LAM 诊断定义。表 I 中的三个诊断指标是从审计分割(audit split)上的后验均值 $\mu_\phi$ 计算得出的,并以中位数报告(相机偏移也以均值报告),针对评估对。零转换和相机偏移响应分别馈入一个复制对和一个合成偏移对,并除以普通转换的典型潜在范数:
$$ R_{\text{zero}} = \frac{\| \mu_\phi(o_t, o_t) \|_2}{D}, \quad R_{\text{shift}} = \frac{\| \mu_\phi(o_t, T_3(o_t)) \|_2}{D}, \quad (\text{A.5}) $$
其中 $D = \text{RMS} \| \mu_\phi(o_t, o_{t+1}) \|_2 + \epsilon$ 是在审计分割上计算的,$T_3$ 在评估分辨率 $320 \times 640$ 下将帧水平或垂直平移 3 像素。捷径泄漏(shortcut leakage)是余弦间隙
$$ L_{\text{shortcut}} = \mathbb{E}[\cos(z_i, z_j) | \text{同一 episode, 不同 primitive}] – \mathbb{E}[\cos(z_i, z_j) | \text{不同 episode, 同一 primitive}], \quad (\text{A.6}) $$
其中对从审计分割中抽取,使用附录 B 中的粗粒度动作原语标签;单独的第二项用作正文中引用的动作邻居保留检查(0.132 vs. 0.131)。
附录 B 粗粒度动作原语标签
动作中心对比损失(公式 (10))使用粗粒度动作原语标签,而不是可执行的机器人动作。标签空间是一个包含 12 种规范动词的集合:pick–place(拾取-放置)、insert–remove(插入-移除)、stack–unstack(堆叠-拆解)、scoop–dump(舀取-倾倒)、open(打开)、close(关闭)、turn on(开启)、turn off(关闭)、wash–rinse(清洗-漂洗)、cut(切割)、stir(搅拌)和 pour(倾倒)。标签来自视频的字幕注释,分为三个步骤。首先,我们从每个 clip 的字幕中提取并还原主要动词(及其小品词),使得“picking up”和“picked up”映射到同一个动词。其次,我们根据语义相似性对提取的动词进行粗粒度聚类,合并同义词和近义义词(例如,grab, grasp 和 take)。第三,每个聚类被分配给 12 种规范原语之一;没有可靠动词的 clip 保持未标记状态,不参与任何对比对。标签仅针对动词级别(没有控制器状态或轨迹),仅告诉 $L_{ctr}$ 哪些转换可能共享同一个原语。
在干净 ego 索引的 68,864 个转换对中,25,192 个(36.6%)带有原语标签;未标记的转换对仅用于重建和校准。扩展到 ego+robot 索引后,标记数量增加到 91,664,同时保留了 12/12 的原语覆盖率,且 LAM 审计分割也覆盖了所有 12 种原语。标签分布呈长尾状(pick–place 占主导地位),因此典型的训练批次使对比项暴露于有效的 8–10 种原语(指数化标签熵)。聚类故意合并了短语和视角依赖的动词变体,因此 $L_{ctr}$ 从不依赖细粒度的字幕语义。
第 14 页
来源
目标
Dreamdojo-2B
CD-LAM-2B
Dreamdojo-14B
CD-LAM-14B
按动作类型划分的 FDCE — 所有动作 每个动作的中位数 · 误差线 = IQR(p25–p75)
ours baseline 2B
120
100
↓ 80 (像素) FDCE 60 40
20
0 Pick Place Push Pull Pull apart Open Press button TapHandover Pour Brush Fold Dip Shake Grasp Hang Hold Iron Lift Lower MoveRelease Scan StackStretch Press
14B
50
40 ↓ (像素) 30 FDCE 20
10
0 Pick Place Push Pull Pull apart Open Press button TapHandover Pour Brush Fold Dip Shake Grasp Hang Hold Iron Lift Lower MoveRelease Scan StackStretch Press
图 A.1. 额外的目标-动作及按动作分解的结果。顶部:目标-动作迁移示例:源上下文行提供固定的视觉上下文,目标运动行提供机器人动作序列,并在相同的目标动作下生成 rollout。CD-LAM 在两个规模下都能更可靠地迁移目标运动。底部:按动作分解的 FDCE(中位数;误差线显示四分位距)。CD-LAM 在大多数类别中降低了 FDCE。