快速导读:提出统一框架,从手-物关系视角将抓取、重定位、手中旋转和平移建模为同一任务,蒸馏出单一跨技能策略,实现无缝长程操作。
灵巧操作是机器人学中长期存在的挑战,涉及抓取、重定位、手中旋转和平移四种基本技能。现有方法通常为每种技能设计特定的约束、目标函数甚至手部形态,导致不同技能的策略之间缺乏兼容性,难以组合成连贯的长程操作序列。UniCross 提出了一种统一的视角:从手-物关系运动出发,将所有技能视为“在保持物体稳定的同时实现期望的关系运动”,从而在统一的观测空间、动作空间和奖励结构下训练和蒸馏策略。
该框架首先用 PPO 独立训练十个单技能策略(一个抓取、一个重定位、六个旋转方向、两个平移方向),这些策略共享相同的网络结构和奖励公式,然后通过 DAgger 数据集聚合算法将它们蒸馏为一个单一的跨技能策略。蒸馏后的统一策略不仅保持了与单技能专家策略接近的性能,还展现出对未见物体形状、不同手部形态和外部扰动的鲁棒性,并能通过技能链式组合完成长程操作任务。
英文题目:UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis
论文出处:arXiv 每日论文精选 · arXiv:2607.28198
原始论文:PDF / 论文页面
这篇论文解决什么问题?
灵巧操作的四项基本技能——抓取、重定位、手中旋转和手中平移——在传统方法中被视为独立的问题。例如,GraspXL 专注于动态抓取合成,RotateIt 针对手中旋转设计特定目标,而 Yin 等人的手中平移方法则依赖固定的手腕姿态。这种技能特定的设计思路带来了一个根本性问题:不同技能的策略在状态表示、动作空间和奖励函数上互不兼容,无法直接组合。
在实际的长程操作场景中,机器人往往需要先抓取物体,再重定位到合适的手内姿态,然后进行旋转或平移以完成最终任务。如果每个子技能都需要独立的策略和切换机制,不仅增加了系统复杂度,还可能在技能切换时引入不稳定因素,导致操作失败。因此,如何在一个统一的框架内实现多种技能的兼容与连续,成为灵巧操作走向实用的关键瓶颈。
UniCross 的作者观察到,尽管四种技能的表观目标不同,但从手与物体之间的相对运动来看,它们本质上都是在保持接触稳定的前提下,控制手部使物体达到期望的相对位姿。这一洞察构成了统一建模的理论基础:如果能够设计一种通用的关系运动表示,那么所有技能都可以用同一套状态、动作和奖励来描述。
此外,现有方法往往与特定的手部形态绑定,例如针对 MANO 手模型设计的策略难以直接迁移到 Allegro 或 Sharpa Wave 等不同几何结构的手上。UniCross 通过在手部状态和物体表示中抽象出形态无关的特征,使得统一策略能够跨手部形态泛化,进一步提升了框架的通用性。
核心创新
- 提出手-物关系视角,将抓取、重定位、手中旋转和平移统一建模。
- 设计统一的观测空间、动作空间和奖励结构,使单技能策略可直接蒸馏为跨技能策略。
- 采用交互感知的物体表示,跨技能捕捉物体几何特征,支持未见物体泛化。
- 框架与手部形态无关,可迁移至不同灵巧手模型。
方法概览
将四种技能建模为统一关系公式的实例化。首先用PPO独立训练10个单技能策略(共享观测空间、网络结构、动作空间和奖励结构),然后通过DAgger蒸馏为单一统一策略。观测空间包含手部状态、交互感知的物体表示(接触状态、接触力、距离向量)和基于关系的目标特征。奖励由交互目标、目标跟踪和正则化项组成。
- 统一关系公式:UniCross 将每种技能的目标定义为一个期望的手-物关系位姿 g_target。对于抓取,g_target 是物体相对于手部的稳定抓取姿态;对于重定位,g_target 是物体在手中的新目标位姿;对于旋转和平移,g_target 则是在当前物体位姿基础上施加的增量变换。所有技能共享相同的目标表示形式,仅在 g_target 的实例化上有所不同(详见论文 Table 1,第5页)。
- 统一的观测空间:观测包含三个核心部分:(1) 手部状态,包括关节角度、指尖位置等形态无关的特征;(2) 交互感知的物体表示,包括接触状态、接触力和手部关键点到物体表面的距离向量,这些特征跨技能捕捉物体的局部几何信息;(3) 基于关系的目标特征,编码当前手-物关系与目标关系之间的差异。这种观测设计使得策略能够感知物体的几何形状而不依赖显式的物体模型。
- 统一的动作空间:策略输出手部关节的目标位置,由底层 PD 控制器执行。动作空间对所有技能保持一致,不因技能类型而改变维度或含义,这为后续的策略蒸馏提供了直接的条件。
- 统一的奖励结构:奖励函数由三项组成——交互目标奖励(鼓励手部与物体保持稳定接触)、目标跟踪奖励(衡量当前手-物关系与目标关系的接近程度)和正则化项(惩罚过大的关节力矩和动作抖动)。不同技能使用相同的奖励公式,仅在目标关系 g_target 的定义上有所区别。
- 单技能策略训练:使用 PPO 算法在 Isaac Gym 仿真环境中独立训练十个单技能策略。每个策略针对一种技能和方向(旋转有六个方向,平移有两个方向),但共享完全相同的网络结构、观测空间和动作空间。训练时使用长方体、圆柱体等简单几何体作为物体。
- 跨技能策略蒸馏:采用 DAgger 算法将十个单技能专家策略蒸馏为一个统一策略。在每次 DAgger 迭代中,统一策略在环境中执行动作,同时查询对应技能的专家策略获取参考动作,将状态-参考动作对加入数据集,然后用行为克隆更新统一策略。这一过程使统一策略逐渐学会在所有技能上的综合行为。
- 交互感知的物体表示:这是实现跨物体泛化的关键设计。通过计算手部关键点到物体表面的距离向量,策略能够感知物体的局部几何特征,而不需要物体的全局形状或类别信息。这使得策略在遇到训练中未见过的物体形状(如六棱柱、八棱柱)时,仍能根据局部接触信息做出合理的动作决策。
- 形态无关的手部表示:手部状态使用关节角度和指尖位置等特征,避免依赖特定手部模型的运动学参数。这使得在 MANO 手上训练的策略可以直接迁移到 Allegro 和 Sharpa Wave 手上,只需在仿真中重新定义手部模型即可,无需重新训练。
逐图理解论文
失败的技能组合

图1展示了UniCross的统一灵巧操作框架概览。图中呈现了四种技能(抓取、重定位、旋转、平移)在统一手-物关系公式下的执行过程,以及技能链式组合实现的长程操作序列。注意观察不同技能如何共享相同的手-物关系表示,以及策略在不同手部形态上的迁移效果。
统一视角:手-物关系运动

图2是框架的详细概览图。左侧展示了十个单技能策略的独立训练过程,右侧展示了通过DAgger蒸馏为单一统一策略的流程。重点关注统一的观测空间(手部状态、交互感知物体表示、关系目标特征)和统一的奖励结构如何贯穿整个框架。
证据:高成功率与跨形态泛化

表2对比了统一策略与各技能基线方法在原始设置和通用设置下的成功率。注意观察统一策略在通用设置下四项技能的成功率均超过98%,且与专用基线方法性能相当,证明了统一框架未牺牲单项技能性能。
长程操作与局限

表4展示了长程操作的结果。两种技能链(抓取+重定位+旋转和抓取+重定位+平移)的整体成功率表明统一策略能够无缝组合技能。注意旋转链成功率(87.4%)低于平移链(96.3%),反映了重定位后手部姿态对旋转的影响。
实验如何设计?
- 仿真环境:所有实验在 Isaac Gym 中进行,使用 Allegro 手作为默认手部模型。物体包括长方体、圆柱体、球体和棱柱等简单几何体,物理属性(质量、摩擦系数等)在一定范围内随机化以增加鲁棒性。
- 单技能对比实验:将统一策略与 GraspXL(抓取)、RotateIt(旋转)和 Yin 等人的方法(平移)在两种设置下比较——基线方法的原始设置和 Unicross 的通用设置。通用设置要求所有方法使用相同的观测和动作空间,以公平评估统一框架的有效性(Table 2,第6页)。
- 泛化实验:在训练中未见过的物体形状(球体、六棱柱、八棱柱)上测试四种技能的成功率,评估交互感知物体表示的泛化能力。同时在不同手部形态(MANO、Sharpa Wave)上测试,评估形态无关设计的迁移效果(Table 3,第7页)。
- 鲁棒性测试:在操作过程中对物体施加随机外部扰动力,测试策略在扰动下维持稳定操作的能力。扰动力的大小和方向随机变化,模拟真实场景中的意外碰撞或外力干扰(Table 3,第7页)。
- 长程操作实验:测试技能链式组合的成功率,包括“抓取+重定位+旋转”和“抓取+重定位+平移”两种序列。评估指标为整体成功率,即所有子技能均成功完成的比例(Table 4,第8页)。
- 消融实验:逐一移除观测空间中的关键组件(目标观测、目标动作、目标奖励、距离向量、接触状态),分析各组件对四种技能性能的贡献(Table 5,第8页)。
关键结果与论文证据
- 统一策略在通用设置下四种技能均达到高成功率:抓取98.7%,重定位99.0%,旋转98.8%,平移99.1%,性能接近甚至超过各技能的专用基线方法(Table 2,第6页)。这表明统一框架并未因技能共享而牺牲单项技能的性能。
- 在未见物体形状上,统一策略展现出强泛化能力:抓取95.8%,重定位98.6%,旋转98.3%,平移96.0%(Table 3,第7页)。交互感知的物体表示使策略能够根据局部接触信息适应新的物体几何形状。
- 跨手部形态迁移效果显著:在 MANO 手上,抓取96.8%,重定位96.6%,旋转94.5%,平移95.3%(Table 3,第7页)。形态无关的手部表示设计使得策略无需重新训练即可迁移到不同手部模型。
- 在外部扰动下,策略保持高鲁棒性:抓取98.6%,重定位99.0%,旋转98.4%,平移97.6%(Table 3,第7页)。统一的奖励结构中的交互目标项鼓励策略维持稳定接触,从而抵抗外力干扰。
- 长程操作中,技能链“抓取+重定位+平移”整体成功率达96.3%,“抓取+重定位+旋转”为87.4%(Table 4,第8页)。旋转链成功率相对较低,论文分析认为重定位后的手部姿态可能不利于后续旋转的启动。
- 消融实验表明,目标观测和目标奖励对性能贡献最大,移除后各技能成功率显著下降。距离向量和接触状态对泛化能力尤为重要,移除后未见物体上的性能下降明显(Table 5,第8页)。
- 蒸馏得到的统一策略性能接近但略低于单技能专家策略,这是 DAgger 蒸馏中常见的性能损失,但换来了单一策略覆盖所有技能的巨大实用优势。
- 定性结果(Figure 3-6,第7、13页)展示了统一策略在不同手部形态(MANO、Allegro、Sharpa Wave)和不同物体上的操作序列,验证了框架的形态无关性和跨物体泛化能力。
阅读时需要注意
- 训练和评估使用的物体限于简单几何体(长方体、圆柱体、球体、棱柱),对复杂日常物体(如工具、餐具、不规则形状物体)的泛化性未经验证。交互感知的物体表示虽然能捕捉局部几何,但在高度复杂的拓扑结构上可能失效。
- 长程操作中,重定位后的手部姿态可能导致后续旋转成功率下降(87.4% vs 平移的96.3%),说明技能间的姿态连续性仍有优化空间。
- 所有实验均在仿真环境中完成,未在真实机器人上验证。仿真到现实的迁移(sim-to-real)是灵巧操作的重要挑战,本文未涉及。
- 旋转和翻译在扰动下的性能下降略大于抓取和重定位,表明动态操作中的稳定性控制仍有改进余地。
关联工作
- GraspXL(第6页对比):基于强化学习的动态抓取合成方法,是抓取技能的基线。UniCross 在通用设置下与之对比,展示了统一框架在抓取任务上的竞争力。
- RotateIt(第6页对比):针对手中旋转的专用方法,设计了特定的旋转目标和约束。UniCross 在旋转任务上与之性能相当,但不需要技能特定的设计。
- Yin et al. 手中平移方法(第6页对比):依赖固定手腕姿态的平移基线。UniCross 在通用设置下超越该方法,体现了统一动作空间的优势。
- D-Grasp(第2页引用):基于强化学习的动态抓取合成,属于同一仿真训练范式,但仅针对单一技能。
- DexterityGen(第3页引用):从抓取切换中提取操作先验用于遥操作正则化,而非合成新操作动作。UniCross 与之不同,直接合成可执行的操作策略。