快速导读:研究行为对齐表征(如末端执行器轨迹、语言动作、边界框)在VLA模型中促进跨具身迁移的作用,发现末端执行器轨迹最有效,且表征在更大规模跨具身数据下增益更显著。
跨具身迁移是机器人学习中的核心挑战:不同机器人的观测空间(相机视角、分辨率)和动作空间(关节角度、末端位姿)差异巨大,导致在一个机器人上训练的策略难以直接部署到另一个机器人上。本文提出了一种隐式对齐方案——行为对齐表征(Behavior-Aligned Representations),通过在VLA模型中联合预测跨具身不变且能预测动作的中间表示,来统一异构数据,从而促进迁移。
作者构建了模拟基准RoboCasa-X,系统评估了三种行为对齐表征:末端执行器轨迹(end-effector traces)、语言动作(language motions)和边界框(bounding boxes)。核心发现是:末端执行器轨迹是最有效的单一表征,联合表征(Joint Reps)在多数场景下表现最佳,且表征的增益随跨具身数据规模扩大而增强。真实机器人实验进一步验证了该方法的sim-to-real迁移能力。
英文题目:Cross-Embodiment Transfer via Behavior-Aligned Representations
论文出处:arXiv 每日论文精选 · arXiv:2607.27549
原始论文:PDF / 论文页面
这篇论文解决什么问题?
大规模模仿学习利用多样化机器人数据集训练通用策略已成为趋势,如Open X-Embodiment项目。然而,跨具身迁移常因观测和动作空间的异构性而效果有限。显式对齐方法(如统一动作空间或观测空间)往往需要针对每对具身进行专门设计,难以规模化。
本文的核心洞察是:尽管不同机器人的底层动作空间不同,但它们在执行相同任务时,其行为在高层语义上是可对齐的。例如,无论是哪种机械臂,抓取杯子都需要末端执行器移动到杯子附近并闭合夹爪。这种高层行为可以用跨具身不变的中间表示来描述,如末端执行器在三维空间中的轨迹、物体边界框的位置变化、或自然语言描述的动作步骤。
受RT-H(使用语言动作层次)和RT-Trajectory(使用末端轨迹草图)等工作的启发,本文提出将这些行为对齐表征作为VLA模型的辅助预测目标,通过共享的表征空间隐式地对齐不同具身的数据,从而让模型学习到具身无关的通用知识。
核心创新
- 提出利用行为对齐表征隐式统一跨具身数据以促进迁移的框架
- 构建模拟基准RoboCasa-X,系统评估跨具身迁移中不同表征的效果
- 发现末端执行器轨迹是跨具身迁移中最有效的单一表征
- 验证表征可从无动作数据中促进跨具身迁移
方法概览
在VLA模型中联合预测行为对齐表征(边界框、语言动作、末端执行器轨迹)与动作,通过表征的跨具身不变性隐式对齐异构数据,并研究不同表征组合与训练策略对迁移的影响。
- 行为对齐表征的提取:对于末端执行器轨迹,使用分割模型从图像中提取末端执行器掩码,并计算其中心点的帧间位移;对于语言动作,通过启发式规则将末端位姿变化转换为自然语言描述(如“向前移动”);对于边界框,使用Grounding DINO检测任务相关物体的边界框变化。
- 模型架构:基于VLA模型,在预测动作的同时,联合预测一种或多种行为对齐表征。训练时,模型接收图像和语言指令,输出动作以及选定的表征。这种多任务学习迫使模型学习跨具身共享的中间表示。
- 联合表征训练(Joint Reps):将多种表征作为独立的预测头,与动作预测头一起联合优化。与ECoT(具身链式思维,先预测表征再预测动作)不同,Joint Reps在训练时同时学习所有输出,推理时可直接预测动作,无需显式生成中间表征。
- 无动作预训练:利用仅包含行为对齐表征但无动作标签的数据集进行预训练。由于表征是跨具身不变的,模型可以从这些无动作数据中学习到有用的视觉和语义特征,再在目标机器人上微调动作预测头。
- 推理策略:比较了两种推理方式——直接预测动作(Joint Reps默认方式)和先预测表征再基于表征预测动作(类似ECoT)。实验发现,推理时预测表征对性能影响通常不显著,表征的收益主要来自训练阶段的隐式对齐。
- RoboCasa-X基准:基于RoboCasa模拟器构建,包含三种源机器人(Panda、UR5、Kinova)和三种目标机器人(Panda-OG、UR5-OG、Kinova-OG),任务涵盖拾取放置、开关水龙头等操作,场景在厨房布局、纹理、物体类型和位姿上具有显著变化。
逐图理解论文
研究空白与本文贡献

图1展示了方法概览:左侧为跨具身数据集(模拟和真实机器人),从中提取三种行为对齐表征(语言动作、末端轨迹、边界框);右侧为VLA模型训练,比较不同表征选择和融合方式对跨具身迁移的影响。注意观察表征提取的流程和模型的多输出设计。
关键发现

图3比较了不同表征和训练策略的性能:无表征、单一表征、ECoT和Joint Reps。重点观察末端执行器轨迹(蓝色)在多数任务上的优势,以及Joint Reps(红色)的整体最佳表现,但在Panda-OG上末端轨迹单独更优。
真实世界验证

图6展示了真实机器人任务(右)与模拟任务(左、中)的对比,以及Joint Reps模型的实际预测。注意观察模型在不同具身上预测出相似的行为对齐表征,直观展示了表征的跨具身不变性。
实验如何设计?
- 预训练数据:使用三种源机器人的跨具身数据混合物进行预训练,数据规模包括无先验、XP-900和XP-3K三种设置,以研究数据规模的影响。
- 迁移评估:在三种目标机器人上使用少量数据进行微调,评估任务成功率。比较无表征、单一表征(末端轨迹、语言动作、边界框)、ECoT和Joint Reps的性能。
- 推理分析:对Joint Reps模型,比较直接预测动作与先预测表征再预测动作的效果,以分离表征在训练和推理阶段的作用。
- 无动作迁移:使用无动作标签的先验数据集进行预训练,仅利用行为对齐表征,评估表征能否从无动作数据中促进迁移。
- 真实机器人实验:将模拟预训练的模型迁移到真实FR3和ViperX机器人上,执行拾取放置任务,验证sim-to-real跨具身迁移能力。
关键结果与论文证据
- 联合表征(Joint Reps)在模拟跨具身迁移中整体表现最佳,但在Panda-OG上末端执行器轨迹单独使用更优(第4页,图3)。这表明表征的最佳组合可能依赖于具体具身差异。
- 末端执行器轨迹是最有效的单一表征,在所有任务和具身上均优于语言动作和边界框(第4页,图3)。这验证了空间轨迹作为跨具身不变表示的强对齐性。
- 表征的增益随跨具身数据规模扩大而增强:无先验时提升5%,XP-900提升15%,XP-3K提升19%(第5页,图4)。这说明行为对齐表征能更有效地利用大规模异构数据。
- 推理时预测表征对性能影响通常不显著(第5页,图5),表明表征的收益主要来自训练阶段的隐式对齐,而非推理时的显式中间推理。这与ECoT相关研究的发现一致。
- 无动作预训练结合表征相比无先验提升14%,相比有动作但无表征提升11%(第6页,图7)。这证明行为对齐表征可以从无动作数据中提取有用知识,为利用海量无标签视频数据提供了可能。
- 真实机器人sim-to-real跨具身迁移中,Joint Reps将任务进度提升28%(第7页,图8),验证了方法在真实世界视觉和动作空间差异下的有效性。
- 模型在不同具身上预测出相似的行为对齐表征(第6页,图6),直观展示了表征的跨具身不变性,这是迁移成功的关键机制。
阅读时需要注意
- 模拟环境中各具身间对齐程度较高(相同相机位姿、场景、任务分布),可能高估了表征的迁移效果。在更显著的具身差异下(如不同相机视角、不同环境布局),表征的对齐性可能下降。
- 所研究的表征偏向物体中心的操作任务(如抓取、放置),可能不适用于其他类型任务(如导航、灵巧手操作)。表征的选择和有效性高度依赖于任务和具身的特性。
- 真实机器人实验中任务变异性被人为降低,可能影响结论的泛化性。更广泛的真实世界任务和具身组合有待进一步验证。
关联工作
- Open X-Embodiment和RT-X展示了大规模跨具身数据集的潜力,但也揭示了直接混合异构数据训练的局限性,本文通过行为对齐表征提供了一种改进方案。
- RT-H使用语言动作层次作为辅助表征提升策略性能,RT-Trajectory利用末端轨迹草图作为条件输入,本文系统比较了多种表征并提出了联合训练框架。
- ECoT通过链式思维预测多种表征再预测动作,本文的Joint Reps简化了这一过程,并发现推理时预测表征非必需,与“Training Strategies for Efficient Embodied Reasoning”的发现一致。