跨具身迁移的隐式钥匙:行为对齐表征如何让机器人共享技能

快速导读:研究行为对齐表征(如末端执行器轨迹、语言动作、边界框)在VLA模型中促进跨具身迁移的作用,发现末端执行器轨迹最有效,且表征在更大规模跨具身数据下增益更显著。

跨具身迁移是机器人学习中的核心挑战:不同机器人的观测空间(相机视角、分辨率)和动作空间(关节角度、末端位姿)差异巨大,导致在一个机器人上训练的策略难以直接部署到另一个机器人上。本文提出了一种隐式对齐方案——行为对齐表征(Behavior-Aligned Representations),通过在VLA模型中联合预测跨具身不变且能预测动作的中间表示,来统一异构数据,从而促进迁移。

作者构建了模拟基准RoboCasa-X,系统评估了三种行为对齐表征:末端执行器轨迹(end-effector traces)、语言动作(language motions)和边界框(bounding boxes)。核心发现是:末端执行器轨迹是最有效的单一表征,联合表征(Joint Reps)在多数场景下表现最佳,且表征的增益随跨具身数据规模扩大而增强。真实机器人实验进一步验证了该方法的sim-to-real迁移能力。

英文题目:Cross-Embodiment Transfer via Behavior-Aligned Representations

论文出处:arXiv 每日论文精选 · arXiv:2607.27549

原始论文:PDF / 论文页面

这篇论文解决什么问题?

大规模模仿学习利用多样化机器人数据集训练通用策略已成为趋势,如Open X-Embodiment项目。然而,跨具身迁移常因观测和动作空间的异构性而效果有限。显式对齐方法(如统一动作空间或观测空间)往往需要针对每对具身进行专门设计,难以规模化。

本文的核心洞察是:尽管不同机器人的底层动作空间不同,但它们在执行相同任务时,其行为在高层语义上是可对齐的。例如,无论是哪种机械臂,抓取杯子都需要末端执行器移动到杯子附近并闭合夹爪。这种高层行为可以用跨具身不变的中间表示来描述,如末端执行器在三维空间中的轨迹、物体边界框的位置变化、或自然语言描述的动作步骤。

受RT-H(使用语言动作层次)和RT-Trajectory(使用末端轨迹草图)等工作的启发,本文提出将这些行为对齐表征作为VLA模型的辅助预测目标,通过共享的表征空间隐式地对齐不同具身的数据,从而让模型学习到具身无关的通用知识。

核心创新

  • 提出利用行为对齐表征隐式统一跨具身数据以促进迁移的框架
  • 构建模拟基准RoboCasa-X,系统评估跨具身迁移中不同表征的效果
  • 发现末端执行器轨迹是跨具身迁移中最有效的单一表征
  • 验证表征可从无动作数据中促进跨具身迁移

方法概览

在VLA模型中联合预测行为对齐表征(边界框、语言动作、末端执行器轨迹)与动作,通过表征的跨具身不变性隐式对齐异构数据,并研究不同表征组合与训练策略对迁移的影响。

  • 行为对齐表征的提取:对于末端执行器轨迹,使用分割模型从图像中提取末端执行器掩码,并计算其中心点的帧间位移;对于语言动作,通过启发式规则将末端位姿变化转换为自然语言描述(如“向前移动”);对于边界框,使用Grounding DINO检测任务相关物体的边界框变化。
  • 模型架构:基于VLA模型,在预测动作的同时,联合预测一种或多种行为对齐表征。训练时,模型接收图像和语言指令,输出动作以及选定的表征。这种多任务学习迫使模型学习跨具身共享的中间表示。
  • 联合表征训练(Joint Reps):将多种表征作为独立的预测头,与动作预测头一起联合优化。与ECoT(具身链式思维,先预测表征再预测动作)不同,Joint Reps在训练时同时学习所有输出,推理时可直接预测动作,无需显式生成中间表征。
  • 无动作预训练:利用仅包含行为对齐表征但无动作标签的数据集进行预训练。由于表征是跨具身不变的,模型可以从这些无动作数据中学习到有用的视觉和语义特征,再在目标机器人上微调动作预测头。
  • 推理策略:比较了两种推理方式——直接预测动作(Joint Reps默认方式)和先预测表征再基于表征预测动作(类似ECoT)。实验发现,推理时预测表征对性能影响通常不显著,表征的收益主要来自训练阶段的隐式对齐。
  • RoboCasa-X基准:基于RoboCasa模拟器构建,包含三种源机器人(Panda、UR5、Kinova)和三种目标机器人(Panda-OG、UR5-OG、Kinova-OG),任务涵盖拾取放置、开关水龙头等操作,场景在厨房布局、纹理、物体类型和位姿上具有显著变化。

逐图理解论文

研究空白与本文贡献

研究空白与本文贡献
Fig. 1. Left: We consider cross-embodiment datasets of both simulated and real-world robots. We then extract behavior-aligned representations: language motions via heuristics and end effector pose deltas, end effector traces via segmentation models, and bounding boxes via Grounding DINO. Right: We train VLAs with different choices of representations and ways of incorporating them, and study how this impacts transfer from cross-embodiment datasets.

图1展示了方法概览:左侧为跨具身数据集(模拟和真实机器人),从中提取三种行为对齐表征(语言动作、末端轨迹、边界框);右侧为VLA模型训练,比较不同表征选择和融合方式对跨具身迁移的影响。注意观察表征提取的流程和模型的多输出设计。

关键发现

关键发现
Fig. 3. We compare training with no representations, each representation separately, and combined using either ECoT or Joint Reps. Each representation improves transfer over using none, with end-effector traces helping the most. Joint Reps performs the best overall, except on Panda-OG, where end-effector traces alone are better.

图3比较了不同表征和训练策略的性能:无表征、单一表征、ECoT和Joint Reps。重点观察末端执行器轨迹(蓝色)在多数任务上的优势,以及Joint Reps(红色)的整体最佳表现,但在Panda-OG上末端轨迹单独更优。

真实世界验证

真实世界验证
Fig. 6. We show examples of our real tasks (right) in comparison to their sim counterparts (left, middle). We also show actual predictions from Joint Reps models, which demonstrate similar predicted representations across different embodiments in unseen scenes.

图6展示了真实机器人任务(右)与模拟任务(左、中)的对比,以及Joint Reps模型的实际预测。注意观察模型在不同具身上预测出相似的行为对齐表征,直观展示了表征的跨具身不变性。

实验如何设计?

  • 预训练数据:使用三种源机器人的跨具身数据混合物进行预训练,数据规模包括无先验、XP-900和XP-3K三种设置,以研究数据规模的影响。
  • 迁移评估:在三种目标机器人上使用少量数据进行微调,评估任务成功率。比较无表征、单一表征(末端轨迹、语言动作、边界框)、ECoT和Joint Reps的性能。
  • 推理分析:对Joint Reps模型,比较直接预测动作与先预测表征再预测动作的效果,以分离表征在训练和推理阶段的作用。
  • 无动作迁移:使用无动作标签的先验数据集进行预训练,仅利用行为对齐表征,评估表征能否从无动作数据中促进迁移。
  • 真实机器人实验:将模拟预训练的模型迁移到真实FR3和ViperX机器人上,执行拾取放置任务,验证sim-to-real跨具身迁移能力。

关键结果与论文证据

  • 联合表征(Joint Reps)在模拟跨具身迁移中整体表现最佳,但在Panda-OG上末端执行器轨迹单独使用更优(第4页,图3)。这表明表征的最佳组合可能依赖于具体具身差异。
  • 末端执行器轨迹是最有效的单一表征,在所有任务和具身上均优于语言动作和边界框(第4页,图3)。这验证了空间轨迹作为跨具身不变表示的强对齐性。
  • 表征的增益随跨具身数据规模扩大而增强:无先验时提升5%,XP-900提升15%,XP-3K提升19%(第5页,图4)。这说明行为对齐表征能更有效地利用大规模异构数据。
  • 推理时预测表征对性能影响通常不显著(第5页,图5),表明表征的收益主要来自训练阶段的隐式对齐,而非推理时的显式中间推理。这与ECoT相关研究的发现一致。
  • 无动作预训练结合表征相比无先验提升14%,相比有动作但无表征提升11%(第6页,图7)。这证明行为对齐表征可以从无动作数据中提取有用知识,为利用海量无标签视频数据提供了可能。
  • 真实机器人sim-to-real跨具身迁移中,Joint Reps将任务进度提升28%(第7页,图8),验证了方法在真实世界视觉和动作空间差异下的有效性。
  • 模型在不同具身上预测出相似的行为对齐表征(第6页,图6),直观展示了表征的跨具身不变性,这是迁移成功的关键机制。

阅读时需要注意

  • 模拟环境中各具身间对齐程度较高(相同相机位姿、场景、任务分布),可能高估了表征的迁移效果。在更显著的具身差异下(如不同相机视角、不同环境布局),表征的对齐性可能下降。
  • 所研究的表征偏向物体中心的操作任务(如抓取、放置),可能不适用于其他类型任务(如导航、灵巧手操作)。表征的选择和有效性高度依赖于任务和具身的特性。
  • 真实机器人实验中任务变异性被人为降低,可能影响结论的泛化性。更广泛的真实世界任务和具身组合有待进一步验证。

关联工作

  • Open X-Embodiment和RT-X展示了大规模跨具身数据集的潜力,但也揭示了直接混合异构数据训练的局限性,本文通过行为对齐表征提供了一种改进方案。
  • RT-H使用语言动作层次作为辅助表征提升策略性能,RT-Trajectory利用末端轨迹草图作为条件输入,本文系统比较了多种表征并提出了联合训练框架。
  • ECoT通过链式思维预测多种表征再预测动作,本文的Joint Reps简化了这一过程,并发现推理时预测表征非必需,与“Training Strategies for Efficient Embodied Reasoning”的发现一致。

发表评论