快速导读:现有评估仅报告整体成功率,无法诊断具体哪个因子导致失败。虽然先前的研究注意到捷径学习,但缺乏因子级的量化分析和可操作的数据收集策略。我们不知道模型是听不懂动词,还是分不清尺寸,这使得针对性改进无从下手。
预训练视觉语言动作模型(VLA)在机器人操作中展现出强大的零样本能力,但在面对未见过的指令组合时,其性能往往急剧下降。本文指出,这种组合泛化失败并非随机噪声,而是源于模型对特定指令因子(如颜色)的系统性过度依赖,即“因子偏差”。
为了解决这一问题,作者提出了因子主导率(FDR)和因子主导层级(FDH)两个新指标,用于细粒度诊断模型在哪些因子上存在接地不足。基于这些诊断结果,文章提出了一种偏差感知数据收集策略,通过向欠接地因子倾斜演示预算,显著提升了模型在分布外场景下的泛化能力,且所需演示数量仅为基线的一半。
英文题目:Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation
论文出处:arXiv 每日论文精选 · arXiv:2607.21582
原始论文:PDF / 论文页面
对应视频标题:机器人VLA为何“偷懒”?因子偏差诊断与偏差感知数据收集策略解析|推荐指数:★★★★★
这篇论文解决什么问题?
现有的VLA评估通常只报告整体成功率,掩盖了模型失败的具体原因。例如,当模型无法执行“推蓝色方块”时,我们不知道它是没听懂“推”这个动词,还是没识别出“蓝色”。这种黑盒评估阻碍了针对性的改进。
先前的研究虽然注意到模型存在捷径学习(shortcut learning)行为,但缺乏系统性的因子级分析框架。此外,现有的数据收集策略多为随机或均匀采样,未能针对模型的薄弱环节进行优化,导致数据效率低下。
本文认为,指令由多个因子组成(动词、颜色、物体、尺寸、空间属性),模型在不同因子上的接地程度存在显著差异。这种差异构成了“因子偏差”,是限制组合泛化的关键瓶颈。
核心创新
方法概览
现有评估仅报告整体成功率,无法诊断具体哪个因子导致失败。虽然先前的研究注意到捷径学习,但缺乏因子级的量化分析和可操作的数据收集策略。我们不知道模型是听不懂动词,还是分不清尺寸,这使得针对性改进无从下手。
- 首先,将自然语言指令分解为五个独立因子:Verb(动词)、Color(颜色)、Object(物体)、Size(尺寸)和Spatial Attribute(空间属性)。
- 其次,定义因子主导率(FDR)作为成对评估指标。通过构造特定的分布外测试场景,测量模型在两个因子冲突时更倾向于依赖哪一个。正值表示第一个因子主导,负值表示第二个因子主导。
- 接着,基于FDR得分,使用Copeland排名算法计算因子主导层级(FDH),得到每个模型在所有因子上的全局排名,从而识别出哪些因子是“欠接地”的。
- 最后,提出偏差感知数据收集策略(V)。该策略根据FDH结果,动态调整演示数据的分布,向欠接地因子倾斜采样预算,同时保持总演示数量不变。
逐图理解论文
直觉与失效案例

图1展示了因子分解、因子偏差问题、FDR/FDH指标定义以及偏差感知数据收集策略的整体框架。请重点关注(b)部分,它直观展示了模型如何过度拟合颜色而忽略动词,这是本文核心问题的具象化。
研究差距:缺乏细粒度诊断

表1列出了各模型在不同因子对上的FDR得分。请观察正值和负值的分布,特别是颜色与其他因子对比时的显著正值,这证实了颜色主导的普遍性。
方法:FDR/FDH与偏差感知策略

表2展示了各模型的FDH排名。请对比不同模型的层级结构,注意动词和尺寸在所有模型中均处于底层,这为数据收集策略提供了明确的优化方向。
结论:高效泛化

表3展示了真实机器人实验结果。请重点关注V策略在100个演示下超越其他策略200个演示的表现,这证明了偏差感知策略的数据效率。
实验如何设计?
- 在ManiSkill仿真环境中评估了6个主流VLA模型,包括pi0.5、pi0、OpenVLA-oft、GR00T-N1.7、XVLA和Genie-Envisioner。
- 设计了多种因子变化场景,如颜色-物体对、颜色-空间对等,以测试模型在不同因子组合下的泛化能力。
- 在真实机器人UR5上进行了Bun、Pizza和Cup三个任务实验,使用GR00T-N1.7作为基础模型,对比随机采样、L形采样和偏差感知策略V的表现。
关键结果与论文证据
- 所有模型均表现出显著的因子偏差,其中颜色是最主导的因子,而动词和尺寸是最欠接地的因子(层级:颜色 >= 物体 >= 空间 >= 动词 >= 尺寸)(第5页)。
- 在仿真环境中,偏差感知策略V在颜色-物体和颜色-空间对上的成功率分别比最佳基线高出10和7个百分点(第7页)。
- 在真实机器人Bun任务中,V策略使用100个演示即达到54.2%的成功率,超越了使用200个演示的L策略(37.5%)和随机策略(47.9%)(第8页)。
- V策略在小预算下优于完整覆盖策略,因为其提供了更高的演示密度,更有效地利用了有限的数据资源(第8页)。
阅读时需要注意
- 评估仅限于桌面操作场景,因子空间受控,未验证在复杂开放世界或多步任务中的泛化能力。
- V策略是一种启发式分配方法,并非全局最优的覆盖策略搜索。
- 尺寸因子由于涉及相对几何依赖,本质上难以接地,限制了其在相关配对中的增益。
关联工作
- 与Gao et al. [40]相比,本文继承了其V策略结构,但引入了偏差感知的因子优先级排序。
- 与RT-1/2、Openpi等大规模多任务学习工作相比,本文诊断了它们的捷径行为,提供了更细粒度的分析视角。
- 与Libero、DROID等基准相比,本文提供了因子级的细粒度分析,而不仅仅是整体鲁棒性评估。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
策略性扩展:通过偏差感知评估与数据收集学习机器人操作中的组合泛化
Yu Qi1, Zhang Ye1, Xinyi Xu1, Yuxuan Lu1, Amitoj Sandhu2, Boce Hu1, Haojie Huang1, Jonathan Tremblay2†, Lawson L.S. Wong1† 1东北大学 2英伟达 †共同指导
摘要:组合泛化对于机器人遵循多样化指令至关重要。然而,预训练策略已知会走捷径,依赖显著线索而非语言接地。我们引入一个诊断框架,将此类失败定位到单个指令因子(例如可重用的语义组件,如颜色、动词、物体、尺寸和空间属性)。我们的框架形式化了指令因子偏差,即微调策略过度依赖主导因子作为捷径的倾向,并通过两个指标对其进行量化:因子主导率(FDR),捕捉因子间的成对偏差;以及因子主导层级(FDH),将这些偏差聚合为全局排名。在六个基础策略上的评估揭示了广泛一致的排序,即 color ≥ object ≥ spatial ≥ verb ≥ size,其中颜色占主导地位,而动词和尺寸最欠接地。我们展示了一种进一步重新分配固定诊断预算以针对欠接地因子的偏差感知数据收集策略:在仿真和真实机器人上,该方法仅使用一半演示数据即可优于基线,从而实现更样本高效且可泛化的策略学习。
关键词:机器人操作,机器人学习基准[cs.RO]
(a) 指令因子 (b) 问题:因子偏差 训练演示 分布外评估
推动红色立方体。 捷径 指令:推动蓝色立方体。
失败!模型走捷径 依赖颜色而非接地 到动词 拿起蓝色立方体。
(c) 评估:使用 FDR 和 FDH 量化偏差 (d) 解决方案:偏差感知数据收集 主导得分:值 在分布外设置中: ours 颜色
物体因子 空间因子 1 值 过度拟合 动词 过度拟合 尺寸 到动词 到物体 样本 泛化性 因子主导率 因子主导层级 效率与可扩展性
arXiv:2607.21582v1
图 1:(a) 我们将语言指令分解为因子。(b) 我们识别因子偏差问题:在微调期间,与训练数据中包含的其他因子相比,预训练模型倾向于过度拟合某些因子。例如,模型过度拟合“蓝色”(颜色)以拿起立方体,而不是推动它(动词)。(c) 我们使用因子主导率(FDR)进行成对因子评估,使用因子主导层级(FDH)进行全局排名来量化这种偏差。(d) 我们引入诊断引导的偏差感知数据收集,以实现样本高效且可泛化的策略学习。
第 2 页
1 引言
扩展数据规模是现代机器人学习中实现泛化的主导范式,然而更多的数据并不能可靠地教会策略遵循语言指令。在大规模、多样化演示数据上训练的通用机器人策略,往往并非因为解析了词汇,而是因为抓住了最能可靠预测正确动作的线索,从而在未见指令上取得成功。例如,在图 1 (b) 中,策略忽略了动作动词,而是利用物体类型与动作之间关系的捷径。此类行为在机器学习领域已有详尽记录 [1, 2],并日益出现在机器人策略中。
此类捷径行为已在机器人基础策略中得到研究,观察发现这些策略倾向于依赖视觉上显著的线索,而非对指令进行接地 [3, 4]。然而,现有的分析仍然较为粗糙,且主要报告在不同条件下的聚合成功率:数据集多样性 [5, 6]、语言扰动 [7, 8] 和视觉鲁棒性 [9, 10]。这仅揭示了策略是否失败,而未说明为何失败。因此,目前尚不清楚策略实际上依赖指令的哪些部分、依赖程度如何,以及如何修复此类失败。
在本文中,我们系统地研究了指令因子层面的捷径行为。我们将指令因子定义为指令中可复用且独立的语义组件,如描述性颜色、动作动词、物体类型等。图 1 显示,策略在分布外设置下对因子的泛化能力不均。我们将此类失败称为指令因子偏差:微调后的策略倾向于过度依赖主导因子作为捷径,而对其他因子欠接地。为了评估这种偏差,我们针对日常机器人桌面指令的五个常见维度(颜色、动词、物体、尺寸和空间属性)构建了一个结构化基准。为了提供深入分析,我们引入了两个诊断指标:因子主导率(Factor Dominance Rate, FDR),用于衡量成对因子偏差;以及因子主导层级(Factor Dominance Hierarchy, FDH),它将成对 FDR 分数聚合为全局排名。最后,在六种基础策略中,因子偏差表现出惊人的一致性:颜色是最主导的因子,动词和尺寸是最欠接地的,且形成的层级关系 color ≥ object ≥ spatial ≥ verb ≥ size 在多种架构中广泛成立。
这一诊断的实际价值之一在于将捷径诊断转化为偏差感知的数据收集原则。由于指令空间随因子数量呈组合爆炸式增长,穷尽覆盖通常不可行,尤其是在真实机器人场景中。我们提出了一种与模型无关的策略,将有限的演示预算重新分配给欠接地因子,即 FDH 排名较低的因子。我们的策略在大多数仿真和真实机器人设置中优于基线方法;在真实机器人上,仅用一半的演示数据便实现了更强的性能。综上所述,这些结果表明,除了增加数据数量和多样性外,塑造数据分布以缓解因子偏差能更有效地提升组合泛化(Compositional Generalization)能力。
总之,我们的贡献有三方面:
• 我们识别出语言指令中的因子偏差是一种系统性且此前未被测量的失败模式,它制约了预训练机器人策略的组合语言泛化能力。 • 我们引入了首个因子偏差评估的定量框架,并提出了 FDR 和 FDH,揭示了预训练策略骨干网络中一致的发现。 • 我们提出了一种简单而有效的偏差感知数据收集策略,在匹配的演示预算下优于基线方法,并通过跨多个模型的仿真和真实机器人实验进行了验证。
2 相关工作
机器人操作中的组合泛化。我们研究语言指令的组合泛化(Compositional Generalization)[2, 11, 12, 13, 14]——即重组已学习原语以处理新指令组合的能力。先前的工作通过显式结构先验(模块化架构 [15]、符号规划器 [16, 17]、程序化策略 [18])或在 RT-1/2 [19, 20] 和 Openpi [21, 22] 等模型中通过大规模多任务学习隐式地追求这一目标,这些模型在 DROID [23] 和 Open X-Embodiment [24] 上进行了训练。在本文中,我们首次识别并评估了因子偏差
2
第 3 页
在语言指令中,作为一种系统性且此前未被测量的失败模式,它制约了预训练机器人策略的组合泛化能力。
机器人基础模型中捷径行为评估。先前的工作观察到,预训练机器人策略表现出捷径行为,倾向于依赖视觉上显著的线索,而非在指令上接地 [3, 25, 4, 24, 23]。我们的评估在两个方面有所不同。首先,先前的研究在数据集多样性 [5, 6, 26]、背景纹理 [27]、语言扰动 [7, 8] 和视觉鲁棒性 [9, 10] 下测量成功率,但沿指令因子的细粒度捷径分析仍未得到充分探索。其次,它们通常在仿真中报告任务成功率 [7, 8, 28, 29, 30, 31],而不是诊断失败行为——揭示策略是否失败,但不揭示失败原因,使得难以推导出可操作的改进措施。我们通过系统评估因子偏差失败行为的框架、FDR 和 FDH 评估指标以及用于组合泛化的偏差感知数据收集策略,填补了这一文献空白。
机器人操作中的数据收集策略。大规模收集机器人演示仍然是模仿学习中的一个主要瓶颈 [32, 33]。大量工作通过改进数据采集流水线来降低这一成本,包括可扩展的遥操作、动作捕捉、仿真与真实协同训练、主动学习 [34, 35, 36, 37, 38]。与这些收集效率工作互补,其他研究认为,任务覆盖率——而非数据集大小——往往是泛化的真正瓶颈 [39, 6, 5]。基于对组合泛化中环境因素 [40] 的理解,并受我们因子偏差诊断的启发,我们提出了一种偏差感知的数据收集策略,将演示分配给代表性不足的因子,以提高组合泛化能力。
图 2:ManiSkill 中的仿真设置。
3 问题表述
如图 2 所示,我们的实验在 ManiSkill [41] 中的多任务桌面操作设置中进行,其中每个自然语言指令按照模板“[动词] [尺寸] [颜色] [物体] 在桌子的 [空间属性] 上”分解为五个因子(例如,“抓住桌子左侧最小的红色立方体”)。
因子词汇表由机器人操作中日常指令的五个常见因子组成:动词(抓、提、推、拉、旋转、滑动)、颜色(红、黄、蓝、橙、绿、黑)、物体(立方体、球体、杯子、汽车、金字塔、星星)、尺寸(小、大、较小、较大、最小、最大)和空间属性(左、右、中、前、后)。它们的笛卡尔积定义了一个包含 6×6×6×6×5 = 6,480 个唯一指令的指令空间;每个场景最多添加三个具有随机空间配置的随机干扰项。策略在该指令空间或子空间上进行训练和评估。更详细的实验设置见补充材料。
4 因子偏差评估
本节介绍我们的因子级诊断框架。我们首先定义因子主导率(FDR)来衡量成对因子的主导性,然后将成对分数聚合为因子主导层级(FDH),以揭示模型间的全局偏差模式。
4.1 用于成对因子偏差评估的因子主导率(FDR)
设置。为了探测因子对 (f1, f2) 内的偏差,我们在故意将两个因子相关联的训练分布上微调策略(在图 3 (a) 中,f1 的每个值与 f2 的一个值配对(蓝色单元格)),同时随机化所有其他因子和空间布局。然后我们在未见过的非对角线组合(灰色单元格)上进行评估,并观察哪个因子导致了随后的过拟合。
推理场景的构建。场景的设置由因子类型决定。我们区分以动作为中心的因子(动词),它决定了策略如何与
第 4 页
对象训练分布:训练分布: 动词 抓取红球。抓取蓝星。抓取红杯。 拉动红车。测试指令:相同动词 测试指令:抓取蓝杯。 抓取红车。测试场景: (蓝星,红杯)在场景中 相同对象 模型在评估期间的行为:蓝杯不存在
成功
过拟合 到动词
过拟合 到对象
其他
(a) (b)
图 3:因子相关性实验设置。(a)(动词,对象)设置。在推理期间,场景中只有两个颜色相同的对象:目标对象(“车”)和训练中与动词配对的对象(“球”)。我们通过检查模型是过拟合于训练配对的动词还是训练配对的对象来计算 FDR。(b)(颜色,对象)设置遵循类似的训练和推理设置;在推理时,指令中的对象在场景中不存在。
对象,来自以对象为中心的因子(颜色、对象、大小、空间属性),确定选择哪个对象以及在哪里。这给出了两种情况,如图 3 (a) 和 (b) 所示:
• 动词与以对象为中心的因子(图 3 (a))。场景中呈现两个共享相同颜色的对象:指令目标(例如“车”)和指令动词在训练中与其中配对的物体(例如对于“抓取”是“球”)。对动词的过拟合表现为对动词配对对象采取行动(抓取球),而对对象的过拟合表现为将该对象的训练动词(“拉动”)应用于指令目标(“车”)。 • 两个以对象为中心的因子(图 3 (b))。我们发出一个故意不可能的指令(例如,“抓取蓝杯”)到一个仅包含两个训练配对对象(蓝星和红杯)的场景中。由于没有单个对象同时满足这两个属性,策略所作用的物体表明了它是受颜色驱动还是受对象驱动。伸手去抓蓝星意味着它遵循了颜色而忽略了对象;伸手去抓红杯意味着它遵循了对象而忽略了颜色。
评分。基于规则的成功仅捕获任务完成情况,无法可靠地将过拟合失败归因于特定因子。因此,我们使用 Gemini-2.5-Flash [42] 将每个智能体视角的轨迹分类为成功、过拟合到 f1 或过拟合到 f2,选择它作为裁判模型,以在大量轨迹视频的情况下平衡评估效率和质量。在补充材料中,我们显示其判断与人工标注高度一致。最后,我们使用 Nf1、Nf2 作为两种过拟合模式的计数来计算评分,因此 FDR 计算如下: Nf1 −Nf2 FDR(f1, f2) = ∈(−1, 1), ϵ →0. (1) Nf1 + Nf2 + ϵ
FDR 的符号表示因子主导的方向:正值表示 f1 主导,负值表示 f2 主导。其幅度反映了偏差的强度。接近 0 的值表明两个因子以平衡的方式接地。
FDR 实验结果。在表 1 中,我们报告了六种机器人策略模型上的实验结果。对于每对 FDR 分数,使用 300 个演示进行训练,并在 OOD 单元格中均匀采样 400 个轨迹用于模型评估。这些分数进一步用于在下一节中计算 FDH。
4.2 因子主导层级 (FDH) 与发现
我们通过 Copeland 排名将成对 FDR 分数聚合为全局排名,即因子主导层级 (FDH):每个因子 fi 获得一个 Copeland 分数:C(fi) = Pj̸=i ⊮[FDR(fi, fj) > τ],其中 τ 是平局阈值(我们使用 τ = 5%)。一个因子得分 +1 为
4
第 5 页
表1:因子主导率(FDR,%),用于跨VLA和视频动作模型骨干网络的成对因子主导性评估。每个FDR通过从OOD分布中均匀采样的400次 rollout 计算得出。正值表示第一个因子占主导;负值表示第二个因子占主导。接近零的值表示接地更平衡。
| 因子对 | π0.5 [22] | π0 [21] | OpenVLA-oft [43] | GR00T-N1.7 [44] | XVLA [45] | Genie-Envisioner [46] | | :— | :— | :— | :— | :— | :— | :— | | (动词, 颜色) | -4.0 | -6.0 | -6.2 | -6.8 | -1.0 | -22.0 | | (动词, 物体) | -9.2 | -16.7 | 16.0 | -25.3 | -19.0 | -25.0 | | (动词, 尺寸) | 26.3 | 41.3 | 4.5 | 25.1 | 38.0 | 32.6 | | (动词, 空间) | -7.4 | -2.1 | 4.5 | -12.2 | -5.0 | -14.2 | | (颜色, 物体) | 57.3 | 42.1 | 17.5 | 22.8 | 31.0 | 22.2 | | (颜色, 尺寸) | 54.0 | 52.4 | 33.6 | 52.4 | 56.0 | 30.9 | | (颜色, 空间) | 38.6 | 32.6 | 39.5 | 8.4 | 19.0 | 36.5 | | (物体, 尺寸) | 22.0 | 31.2 | 1.6 | 52.4 | 29.0 | 11.4 | | (物体, 空间) | -3.8 | -2.9 | 17.0 | 9.5 | 9.0 | 20.9 | | (尺寸, 空间) | -7.9 | -13.0 | 19.8 | -11.0 | -32.0 | -23.7 |
表2:因子主导层级(FDH),针对每个模型,通过对成对FDR分数进行Copeland排名得出。> 表示严格主导;≈ 表示性能相当(平局)。
| 模型 | 因子主导层级 (FDH) | | :— | :— | | π0.5 [22] | 颜色 > 物体 ≈ 空间 > 动词 > 尺寸 | | π0 [21] | 颜色 > 物体 > 空间 ≈ 动词 > 尺寸 | | OpenVLA-oft [43] | 颜色 > 物体 ≈ 动词 ≈ 尺寸 > 空间 | | GR00T-N1.7 [44] | 颜色 > 物体 > 空间 > 动词 > 尺寸 | | XVLA [45] | 颜色 ≈ 物体 > 空间 > 动词 > 尺寸 | | Genie-Envisioner [46] | 颜色 > 物体 > 空间 > 动词 > 尺寸 |
每次成对获胜计1分,每次失败或平局计0分。因子按 $C(f_i)$ 降序排列。我们在表2中报告了所有模型的FDH,并观察到以下三个发现:
发现1:颜色是最主导的指令因子。在所有评估的骨干网络中,颜色始终表现为最主导的因子。一种可能的解释是,颜色构成了一个高度显著的低级视觉线索:它被视觉编码器可靠地捕捉,并且最有可能在大规模训练数据中引发捷径相关性。
发现2:动词和尺寸相对被忽视。与颜色相比,动词和尺寸因子在大多数骨干网络中表现出最弱的主导性,除了OpenVLA-oft,它显示出更强的动词和尺寸接地能力。一种可能的解释是,这些因子更难从大规模演示中一致地学习,特别是因为尺寸通常依赖于相对几何关系,而现有数据集在这方面可能缺乏足够的多样性。
发现3:不同模型共享FDH一致性。在表2中,除了OpenVLA-oft [43] 外,因子层级在架构间大致一致:颜色 ≥ 物体 ≥ 空间 ≥ 动词 ≥ 尺寸。这种一致性表明,因子偏差层级主要是多个策略骨干网络的共享属性,这促使我们在第5节中描述一种模型无关的数据收集策略。
5 基于因子偏差的战略数据收集
我们假设在发现3中观察到的一致因子层级可以直接指导数据收集。我们的目标不是在全球范围内搜索最优采样策略,而是提供一种简单且有效的偏差感知数据收集策略,从而在组合泛化和数据效率方面带来显著增益。
方法。图5可视化了针对2个因子的不同采样策略,坐标轴枚举了两个因子的可能值,蓝点标记收集的样本,灰点标记保留的样本。V( ours)受Gao等人[40]启发,我们收集最左侧的一列——固定 $f_1$ 同时变化 $f_2$,其中 $FDR(f_2, f_1) > \tau$,意味着 $f_1$ 是欠接地因子。此外,我们还包括对角线和次对角线轴。对于三个或更多因子($N_f \ge 3$),一列是
第 6 页
1. 颜色对象 (π0.5) 2. 动词对象 (π0.5) 3. 颜色动词 (π0.5) 4. 动词尺寸 (π0.5) 9. 动词颜色对象 (π0.5) 11. 所有因子 (π0.5)
5. 颜色空间 (π0) 6. 空间尺寸 (GR00T) 7. 动词空间 (GR00T) 8. 空间对象 (GR00T) 10. 动词颜色对象 (π0) 12. 所有因子 (GR00T)
V( ours) L 随机
图 4:仿真实验结果。每个面板绘制了在因子变化 f 下,演示预算 n 对应的成功率。在图 11、12 中,f = 50,在所有其他图中,n = 200。每个检查点在三个随机种子下进行评估,每个种子包含 200 次 rollout。点代表单次种子运行,线代表其均值。更多结果和细节见补充材料。
每个欠接地 (Under-grounded) 因子增加演示,优先选择由 FDH 排名较低的因子。完整策略 (Complete strategy) 利用所有可能的组合,作为上限性能参考,这在现实中不可行,尤其是在真实机器人场景中。随机策略 (Random strategy) 在全空间中随机采样可能的因子组合。L 策略固定每个因子中的一个,并对另一个因子进行均匀采样。详情见补充材料。
6 实验
为了验证发现 3 中揭示的一致性是否能转化为有效的数据收集策略,我们在仿真(第 6.1 节)和真实机器人实验(第 6.2 节)中对多个模型进行了实验。此外,遵循 Gao 等人 [40] 的确切设置。为了公平比较,我们在所有方法中保持总因子变化 f 和演示预算 n 之和相同。
欠接地因子的选择。为了制定 V 中设计的策略,我们复用发现 3 中观察到的单一全局排序(颜色 ≥ 对象 ≥ 空间 ≥ 动词 ≥ 尺寸),而不是为每个设置重新估计偏差。具体而言,当 Nf = 2 时,我们选择排名较低的那个因子;当 Nf = 3 时,选择排名最低的两个因子;当 Nf > 3 时,选择排名最低的三个因子。因子始终按主导性升序选择,即从最弱向上选择。
图 5:方法。
因子变化 (f)。两个因子配置之间的因子变化通过汉明距离 [47] 计算。一个因子值的变化(例如,将红色立方体替换为蓝色立方体)计为 1 次因子变化。在 Gao 等人 [40] 中,f 表示环境设置的人类努力。在我们的设置中,f 衡量指令空间中配置的多样性以及任务切换成本。当策略产生不同的总因子变化 f 时,我们额外采样随机配置以使所有方法的 f 相等。详情见补充材料。
演示预算 (n)。它表示允许收集的演示总数。
6.1 仿真实验
实验设置。我们在 π0 [21]、π0.5 [22]、GR00T-N1.7 [44] 上验证了我们数据收集策略的有效性。我们考虑成对因子变化实验,以及动词-颜色-对象 (Verb-Color-Object) 和所有因子 (All-Factor) 设置。每个任务都有单独的指令子空间:例如,在颜色空间 (Color Spatial) 中,颜色和空间变化,而其余因子在两个值内随机化。干扰项和
6
第 7 页
1 2 1 2 1 2
3 4 3 4 3 4
图 7:真实机器人实验。我们在三个操作任务上进行了实验:Bun、Pizza 和 Cup。每个任务包含 16 种指令变体,具有随机化的空间配置。
对象位置随机化定义见第 3 节。实验参数和结果报告于图 4。我们在补充材料中提供了更多细节。
结果与分析。如图 4 所示,在匹配的因子变化量和演示预算下,V 在绝大多数设置中匹配或优于 L 和 Random 基线。在面对强主导因子时,增益最大:在颜色主导的对子中,V 在 Color Object 上比最佳基线提高了 10 个百分点,在 Color Spatial 上提高了 7 个百分点。这一优势不仅限于颜色——V 还将 GR00T 上的空间-尺寸接地能力提升了 14 个百分点,并且在 All Factor 设置中(n = 800)随演示预算的扩展表现更好。主要例外是 π0.5 上的 Verb Size 设置,其中 V (51%) 在 f = 18 时落后于 Random (68%);我们将此归因于尺寸从相对几何中接地本质上很难(发现 2),因此额外的尺寸演示并不总是有益。当 Nf ≥ 3 时,增益尤为显著。在图 9–10(Verb Color Object)中,V 在 f = 20 时已达到仅在 f = 30 时才能达到的基线性能,并在 f = 30 时比最佳基线提高了多达 15 个百分点。在图 11–12(All Factor)中,V 仅使用一半的演示预算(n = 400 对比 n = 800)就超越了所有基线,证实了我们提出的策略既具有样本效率又具有可扩展性。
6.2 真实机器人实验
如图 6 所示,我们在配备自定义设计的夹爪、RealSense D455 作为代理视角相机以及 FLIR Blackfly S GigE 作为手持相机的 UR5 机器人上,执行了三个日常操作任务:Bun、Pizza 和 Cup。演示数据使用 GELLO [48] 收集。
任务设计。如图 7 所示,每个任务都是一个自然语言条件设置,由共同变化两个指令因子 (f1, f2) 形成 16 种指令变体,即每个任务一个 4 × 4 网格。Bun 变化 Color Spatial:策略被要求拾取指定颜色在指定位置的面包卷(例如,“将绿色面包卷放入左侧的第一个蒸笼中”)。Pizza 变化 Spatial Object:策略被要求拾取指定的调味品并将其挤在披萨的固定位置(例如,“在左上角的披萨上添加芥末酱”)。Cup 变化 Verb Color:策略被要求对特定颜色的杯子执行某项技能(例如,“将搅拌勺放入红色杯子中”)。详细信息见补充材料。
实验设置。我们在 GR00T-N1.7 [44] 上评估我们的策略 V 与第 5 节中定义的 Random 和 L 基线,在匹配的因子变化 f = 12 和两个演示预算 n = 100 和 n = 200 下进行。此外,我们还包括 Complete 策略,该策略穷尽覆盖整个指令空间,作为上限参考。在推理时,每个检查点在总共 48 次 rollout 中均匀评估(每条指令 3 次 rollout)。
结果与分析。我们在表 3 中报告了真实机器人实验结果。在所有三个任务中,V 始终优于两个基线,比 L 提高了 28.7 个百分点,比 Random
7
第 8 页
方法 Bun(100) Bun(200) Pizza(100) Cup(100)
L 22.9%(11/48) 37.5%(18/48) 35.4%(17/48) 37.5%(18/48)
Random 37.5%(18/48) 47.9%(23/48) 50.0%(24/48) 47.9%(23/48)
V(Ours) 54.2%(26/48) 64.6%(31/48) 62.5%(30/48) 66.7%(32/48)
表3:在GR00T-N1.7 [44]上的真实机器人实验结果。括号中的数字表示训练演示的数量。图9:Bun上的缩放行为。
平均提升了16.7个百分点。这一优势在两种演示预算下均成立:在Bun任务上,V在n=100时(54.2%)已经超过了n=200时的L(37.5%)和Random(47.9%),这表明感知偏差的分配具有显著更高的样本效率:它用一半的演示数据就能获得更高的成功率。随着预算从n=100增加到n=200,所有方法的表现均有提升,而V始终保持明显领先。这些结果将我们的仿真发现迁移到了物理平台,证实了将演示数据分配给欠接地(Under-grounded)因子能够产生更具泛化能力、数据效率更高的语言条件策略。
在小演示预算下,部分覆盖可能比完全覆盖产生更好的性能。在图9中,我们的V策略在n=100时大幅优于Complete策略。我们将此归因于演示密度:在固定的小预算下,Complete将演示稀疏地分布在整个组合空间中,导致每个指令的采样不足;而V将预算集中在较少的组合上,为每个指令提供足够的演示以学习可靠的行为,并通过组合泛化(Compositional Generalization)恢复被留出的组合。
采样策略塑造泛化行为。如图8所示,我们可视化了Bun任务(n=200, f=12)的逐单元格评估结果,其中棕色单元格标记已收集(训练)的组合,数字表示成功回放的次数。Random将其预算分散在网格中,其成功次数也相应分散。相比之下,V以结构化的方式集中收集,在分布外(out-of-distribution)单元格上产生了更多的成功泛化。这种行为在真实机器人设置中尤其有价值,因为演示预算有限,且每次收集的轨迹成本高昂;通过避免穷举的指令覆盖,感知偏差的采样有可能扩展到更大的指令空间。
7 结论
在本工作中,我们研究了指令因子偏差作为预训练机器人策略在微调期间的一种细粒度捷径失效现象。我们表明,策略往往过度依赖主导的指令因子,而使其余因子欠接地,这限制了在分布外指令下的组合泛化能力。为了量化这种行为,我们引入了因子相关性实验,并提出了因子主导率(Factor Dominance Rate, FDR)和因子主导层级(Factor Dominance Hierarchy, FDH),用于成对和全局的因子偏差诊断。在六个基础策略中,我们发现了一致的模式:颜色是最主导的因子,而动词和尺寸往往欠接地。受此诊断的启发,我们提出了一种与模型无关的感知偏差数据收集策略,将演示重新分配给欠接地因子,表明通过塑造数据分布以减轻因子偏差,可以在单纯增加数据数量和多样性之外,提升组合泛化能力。
局限性与未来工作。我们的评估是在具有受控因子空间的桌面操作设置中进行的;目前尚不清楚所识别的因子偏差模式以及我们的感知偏差策略是否能推广到具有更丰富物体多样性或多步任务的更复杂开放世界场景。此外,我们提出的V策略只是感知偏差分配的一个实例,而非全局最优策略;未来的工作可以通过对覆盖策略进行原则性搜索来增强我们的设计,例如通过主动学习或课程学习设计。
8
第 9 页
目录
1 引言 2
2 相关工作 2
3 问题表述 3
4 因子偏差评估 3
4.1 用于成对因子偏差评估的因子主导率 (FDR) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4.2 因子主导层级 (FDH) 与发现 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
5 基于因子偏差的策略性数据收集 5
6 实验 6
6.1 仿真实验 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
6.2 真机实验 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
7 结论 8
A 因子评估空间 10
B 因子偏差与因子主导率评估 10
B.1 实验设置 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
B.2 使用 Gemini-2.5-Flash 评分及与人类的一致性 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
B.3 通过 Copeland 排名进行因子主导层级 (FDH) 构建 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
C 实验 13
C.1 不同的数据收集策略 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13
C.2 每种策略的因子变化计数 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
C.3 仿真实验设置 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
C.4 仿真实验结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
C.5 真机实验 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
9
第 10 页
A 因子评估空间
如主论文第3节(第3页)所述,每条指令均从以下模板生成:
“[动词] 桌子[空间属性]上的[大小][颜色][物体]。”
完整的因子词汇表复现于表4。五个因子的笛卡尔积产生 6 × 6 × 6 × 6 × 5 = 6,480 条唯一指令。
表4:因子词汇表。五个指令因子及其取值。我们区分以动作为中心的因子(Verb),它决定策略如何与物体交互,以及四个以物体为中心的因子(Color, Object, Size, Spatial Attribute),它们决定选择哪个物体及其位置。
因子类型 取值
Verb 以动作为中心 抓取、抬起、推动、拉动、旋转、滑动 Color 以物体为中心 红色、黄色、蓝色、橙色、绿色、黑色 Object 以物体为中心 立方体、球体、杯子、汽车、金字塔、星星 Size 以物体为中心 小、大、较小、较大、最小、最大 Spatial Attribute 以物体为中心 左、右、中、前、后
场景构成。每个场景实例化了指令目标物体以及随机采样的若干干扰物体,并在每次重置时重建,以便无法利用固定的物体或空间先验。在ManiSkill中实现,使用带有腕部摄像头的Panda机械臂(智能体视角和手持视角摄像头的分辨率均为256×256)。
B 因子偏差与因子主导率(FDR)评估
本节提供主论文第3节中介绍的因子偏差评估的完整实验细节。
训练与推理指令细节。如图3(a)所示,训练语言指令沿对角线单元格采样,而评估语言指令沿灰色单元格采样。更具体地说,我们列出训练和推理指令的指令空间如下。
训练指令空间。
• 颜色-物体: “[动词] [颜色] [物体]。” 对角线绑定6对(颜色,物体): 红+立方体、黄+球体、蓝+杯子、橙+汽车、绿+金字塔、黑+星星。载体动词 ∈{抓取, 抬起}。 ⇒12 条训练指令。
• 颜色-空间: “[动词] 位于[空间]的[颜色]立方体。” 对角线绑定5对(颜色, 空间):红+在左侧、蓝+在中间、黄+在右侧、绿+在后方、橙+在前方。物体固定为立方体。载体动词 ∈{抓取, 抬起}。 ⇒10 条训练 指令。
• 颜色-动词: “[动词] [颜色] [物体]。” 对角线绑定6对(动词,颜色): 抬起+红、抓取+黄、推动+蓝、拉动+橙、旋转+绿、滑动+黑。载体物 体 ∈{立方体, 球体}。 ⇒12 条训练指令。
• 颜色-大小: “[动词] [大小] [颜色] 立方体。” 对角线绑定6对(颜色,大小): 红+小、蓝+较小、绿+最小、黄+大、橙+较大、黑+最大。 物体固定为立方体。载体动词 ∈{抓取, 抬起}。 ⇒12 条训练指令。
• 物体-空间: “[动词] 位于[空间]的[物体]。” 对角线绑定5对(物体,空 间):立方体+在左侧、杯子+在中间、球体+在右侧、金字塔+在后方、 汽车+在前方。载体动词 ∈{抓取, 抬起}。 ⇒10 条训练
10
第 11 页
• 对象-动词(OBJECT VERB):“[动词] [颜色] [对象]。”对角线绑定 6 对(动词,对象):lift+cube(抬起+立方体)、grasp+sphere(抓取+球体)、push+cup(推动+杯子)、pull+car(拉动+汽车)、rotate+pyramid(旋转+金字塔)、slide+star(滑动+星形)。载体颜色 ∈{yellow, red}(黄色,红色)。⇒ 12 条训练指令。
• 对象-尺寸(OBJECT SIZE):“[动词] [尺寸] [对象]。”对角线绑定 6 对(对象,尺寸):cube+small(立方体+小)、cup+smaller(杯子+较小)、sphere+large(球体+大)、pyramid+smallest(金字塔+最小)、car+larger(汽车+较大)、star+largest(星形+最大)。载体动词 ∈{Grasp, Lift}(抓取,抬起)。⇒ 12 条训练指令。
• 空间-动词(SPATIAL VERB):“[动词] [对象] 在 [空间位置]。”对角线绑定 5 对(动词,空间位置):lift+on the left(抬起+在左侧)、push+in the middle(推动+在中间)、grasp+on the right(抓取+在右侧)、rotate+at the back(旋转+在后方)、pull+in front(拉动+在前方)。载体对象 ∈{cube, sphere}(立方体,球体)。⇒ 10 条训练指令。
• 空间-尺寸(SPATIAL SIZE):“在 [空间位置] 抬起 [尺寸] [对象]。”对角线绑定 5 对(空间位置,尺寸):on the left+small(在左侧+小)、in the middle+smaller(在中间+较小)、on the right+large(在右侧+大)、at the back+smallest(在后方+最小)、in front+larger(在前方+较大)。动词固定为 Lift(抬起)。载体对象 ∈{cube, sphere}(立方体,球体)。⇒ 10 条训练指令。
• 动词-尺寸(VERB SIZE):“[动词] [尺寸] [对象]。”对角线绑定 6 对(动词,尺寸):lift+small(抬起+小)、grasp+large(抓取+大)、push+smaller(推动+较小)、pull+larger(拉动+较大)、rotate+smallest(旋转+最小)、slide+largest(滑动+最大)。载体对象 ∈ {cube, sphere}(立方体,球体)。⇒ 12 条训练指令。
评估指令空间(Evaluation Instruction Space)。对于因子评估指令空间,针对每对因子,仅从完整网格中采样前两个主要因子,例如,在 COLOR(颜色)、OBJECT(对象)中,指令从枚举颜色和对象的完整网格中采样。其他值从相同分布中采样。
B.1 实验设置(Experiment Setup)。
在每对因子相关性实验中,训练期间从成对因子训练指令空间中随机采样 300 个演示。评估期间,在每个评估指令空间下随机执行 400 次 rollout(轨迹/回合)。
B.2 使用 Gemini-2.5-Flash 和人工一致性进行评分(Scoring with Gemini-2.5-Flash and Human Agreement)
为何使用视觉语言模型(VLM)裁判。基于规则的成功检查仅报告任务是否完成;它们无法将过拟合失败归因于特定因子。因此,我们使用 Gemini-2.5-Flash [42] 将每个智能体视角的 rollout 分类为以下之一:成功、对 f1 过拟合、对 f2 过拟合或其他。
为何专门选择 Gemini-2.5-Flash。鉴于 rollout 视频数量庞大,每个模型需要 4000 个视频来计算 FDR 和 FDH。Gemini-2.5-Flash 在标注质量与吞吐量/成本之间提供了有利的平衡。
裁判输入与协议。对于每个 rollout,裁判接收指令、场景中两个候选对象的描述以及记录的智能体视角视频;它返回结果标签以及简短的理由。
裁判模型提示(Judge Model Prompt)。我们的提示分为动词冲突模板和双对象冲突模板。
动词冲突模板:以下是四个动词主导实验(VERB COLOR, VERB OBJECT, VERB SIZE, VERB SPATIAL):
仔细观看此机器人操作视频。
给机器人的指令: "{instruction}"
这是一个关于动词偏差的冲突实验。机器人使用特定的动词-属性配对进行训练:
- 动词 "{verb_i}" 与一组属性配对(指令动词)
- 动词 "{verb_j}" 与 {factor2_desc} 配对
11
第 12 页
机器人必须选择执行哪个动作。请仔细观察。
按此确切格式回答: ROBOT_ACTION: [用一句话描述物理动作] ACTION_TYPE: ["{verb_i}" 若为指令动作,"{verb_j}" 若为竞争 动作,"other" 若两者皆非] FACTOR_FOLLOWED: ["verb" 若机器人遵循了指令动词 ’{verb_i}’, "{factor2}" 若机器人遵循了 {factor2} 因子 (执行了 ’{verb_j}’),"neither" 若不明确] REASONING: [用1-2句话解释你的判断]
双物体冲突模板。(六种非动词主导实验:COLOR OBJECT、 COLOR SIZE、COLOR SPATIAL、OBJECT SIZE、SPATIAL OBJECT、SPATIAL SIZE):
请仔细观察此机器人操作视频。
给机器人的指令: "{instruction}"
这是一个关于因子偏差的实验。场景中包含 两个物体:
- 物体 A:具有 {factor1}=’{val_i}’ — 匹配指令中的 ’{factor1}’
- 物体 B:具有 {factor2}=’{val_j}’ — 匹配指令中的 {factor2}
没有物体同时具备这两个属性。机器人必须选择一个。
按此确切格式回答: ROBOT_ACTION: [用一句话描述机器人手臂做了什么] OBJECT_TOUCHED: [A (匹配 {factor1}),B (匹配 {factor2}),无] FACTOR_FOLLOWED: ["{factor1}" 若机器人选择物体 A, "{factor2}" 若选择物体 B,"neither"] REASONING: [用1-2句话解释你的判断]
输出解析。响应按字段解析(对五个 KEY: value 行进行正则匹配)。仅 FACTOR FOLLOWED 用于计算 FDR 统计量;其他字段用于审计和定性检查。 标记为 neither 的轨迹被排除在 Nf1 + Nf2 之外。
设 Nf1 和 Nf2 为两种过拟合模式的计数,因子主导率 (FDR) 为 FDR(f1, f2) = (Nf1 − Nf2) / (Nf1 + Nf2 + ϵ) ∈(−1, 1), ϵ →0. (2)
与人工标注的一致性。为了验证裁判模型,我们将其标签与随机采样子集上的人工标注进行比较。裁判模型与人工标注的整体一致率达到 88.7%,表明与人工标签具有高度一致性。
表 5:Gemini-2.5-Flash 裁判模型与 pi0.5 轨迹保留样本中人工标注的一致性。 成功 过拟合-f1 过拟合-f2 整体
一致性 (%) 90.0 83.0 93.0 88.7
标注轨迹 80
B.3 通过 Copeland 排名进行因子主导层级 (FDH) 聚合
我们通过 Copeland 排名将成对 FDR 分数聚合为全局排名。每个因子 fi 获得一个 Copeland 分数: C(fi) = Σ_{j≠i} [ FDR(fi, fj) > τ ] , (3)
12
第 13 页
其中 $\tau$ 为平局阈值(我们使用 $\tau = 5\%$)。因子在每对比较中获胜得 +1 分,输或平局得 0 分;如表 6 所示,我们报告了 Copeland 分数的详细实验结果。
表 6:各模型的 Copeland 分数 $C(f_i)$ ($\tau = 5\%$)。 模型 颜色 物体 空间 动词 尺寸
$\pi_{0.5}$ 3 2 2 1 0 $\pi_0$ 4 2 1 1 0 OpenVLA-oft 4 1 0 1 1 GR00T-N1.7 4 3 2 1 0 XVLA 3 3 1 1 0 Genie-Envisioner 4 3 2 1 0
表 7:各模型的 Copeland 分数 $C(f_i)$ ($\tau = 10\%$)。 模型 颜色 物体 空间 动词 尺寸
$\pi_{0.5}$ 3 1 0 1 0 $\pi_0$ 3 2 1 1 0 OpenVLA-oft 3 1 0 1 1 GR00T-N1.7 2 2 2 1 0 XVLA 3 2 1 1 0 Genie-Envisioner 4 3 2 1 0
FDH 对平局阈值的敏感性。此外,我们还报告了如表 6 ($\tau = 5\%$) 和表 7 ($\tau = 10\%$) 所示的 Copeland 分数的详细实验结果。我们还报告了相应的 FDH,如下所示:
在 $\tau = 5\%$ 时:
• $\pi_{0.5}$: 颜色 > {物体 ≈ 空间} > 动词 > 尺寸 • $\pi_0$: 颜色 > 物体 > {空间 ≈ 动词} > 尺寸 • OpenVLA-oft: 颜色 > {物体 ≈ 动词 ≈ 尺寸} > 空间 • GR00T-N1.7: 颜色 > 物体 > 空间 > 动词 > 尺寸 • XVLA: {颜色 ≈ 物体} > {空间 ≈ 动词} > 尺寸 • Genie-Envisioner: 颜色 > 物体 > 空间 > 动词 > 尺寸
在 $\tau = 10\%$ 时:
• $\pi_{0.5}$: 颜色 > {物体 ≈ 动词} > {空间 ≈ 尺寸} • $\pi_0$: 颜色 > 物体 > {空间 ≈ 动词} > 尺寸 • OpenVLA-oft: 颜色 > {物体 ≈ 动词 ≈ 尺寸} > 空间 • GR00T-N1.7: {颜色 ≈ 物体 ≈ 空间} > 动词 > 尺寸 • XVLA: 颜色 > 物体 > {空间 ≈ 动词} > 尺寸 • Genie-Envisioner: 颜色 > 物体 > 空间 > 动词 > 尺寸
总之,不同模型之间的发现保持一致,尤其是颜色 ≥ 物体 ≥ 空间 ≥ 动词 ≥ 尺寸这一顺序在不同模型和不同阈值下均保持一致。
C 实验
C.1 不同的数据收集策略
我们如下说明我们的数据收集策略。
• 完整收集。从子空间中的所有单元格进行收集,即因子值的完整笛卡尔积。这穷尽了指令空间,并作为上限参考;它
13
第 14 页
在大规模场景下不可行,尤其是在真实机器人上。在我们的实验中,我们报告了真实机器人实验中 Complete 的性能作为上限性能。
• 随机(Random)。在整个子空间内均匀随机采样因子组合,直到达到预算 $n$。
• L。将每个因子固定在一个值,并均匀采样其他因子;对于 $N_f = 2$,这会收集完整的一行和一列,在网格上形成“L”形。
• V( ours)。遵循 Gao 等人 [40] 的直觉,我们沿着欠接地(under-grounded)因子分配覆盖范围。对于一对 $(f_1, f_2)$,若 $\text{FDR}(f_2, f_1) > \tau$(即 $f_2$ 占主导且 $f_1$ 欠接地),我们收集最左侧的一列——固定 $f_1$ 并变化 $f_2$——此外还包括网格的对角线和次对角线以保留联合覆盖。对于 $N_f \ge 3$,每个欠接地因子额外添加一列,优先选择由 FDH 排名较低的因子。
当面对 $N$ 个因子时,我们在以下表格中提供 L 和 V(ours)的伪代码。
算法 1 V(ours):面向 $N$ 个因子的偏差感知数据收集 输入:场景 $S$;因子网格 $F$($N$ 个因子 $\times k$ 个值);基础配置 $f^*$ 1: $f \leftarrow f^*$ // 阶段 1($N$ 条辐条):对每个因子,单独扫描它,其他因子保持为基础值 2: for $i \leftarrow 1$ to $N$ do 3: $f \leftarrow f^*$ ▷ 在辐条之间重置 4: for $j \leftarrow 1$ to $k$ do 5: $f[i] \leftarrow F_{i,j}$ 6: SETFACTORS($S, f$); COLLECTDATA($S$) 7: end for 8: end for // 阶段 2(主对角线):所有因子同步推进 9: for $j \leftarrow 1$ to $k$ do 10: $f[i] \leftarrow F_{i,j}$ for all $i \leftarrow 1$ to $N$ 11: SETFACTORS($S, f$); COLLECTDATA($S$) 12: end for // 阶段 3($N$ 条次对角线):一个因子比其他因子领先一步 13: for $\ell \leftarrow 1$ to $N$ do ▷ 哪个因子领先 14: for $j \leftarrow 1$ to $k – 1$ do 15: $f[i] \leftarrow F_{i,j}$ for all $i \neq \ell$ 16: $f[\ell] \leftarrow F_{\ell,j+1}$ 17: SETFACTORS($S, f$); COLLECTDATA($S$) 18: end for 19: end for 20: 仅保留唯一配置
算法 2 L 策略部署 输入:场景 $S$,因子值 $F$(大小 $N$ 个因子 $\times k$ 个值),基础因子值 $f^*$(大小 $N$ 个因子) 1: for $i \leftarrow 1$ to $N$ do 2: $f \leftarrow f^*$ 3: for $j \leftarrow 1$ to $k$ do 4: $f_i \leftarrow F_{i,j}$ 5: SETFACTORS($S, f$) 6: COLLECTDATA($S$) 7: end for 8: end for 9: 仅保留唯一配置
14
第 15 页
C.2 各策略的因子变化计数
设 $N_f$ 为实验中指令因子的数量(例如,因子对为 $N_f=2$,全空间为 $N_f=5$),设 $k_i$ 为因子 $i$ 的取值数量(此处动词、颜色、物体和大小为 $k_i=6$,空间因子为 $k_i=5$)。遵循 Gao 等人 [40] 的方法,收集计划(collection schedule)的成本是因子变化的总数:每两个连续配置之间的转换贡献其汉明距离(即值发生变化的因子数量;一次性改变所有 $N_f$ 因子的成本为 $N_f$)。
- Complete。访问所有 $\prod_{i=1}^{N_f} k_i$ 个因子组合,成本为 $O(\prod_i k_i)$ 次因子变化(例如,因子对为 $6 \times 6 = 36$,五因子全空间为 $6 \times 6 \times 6 \times 6 \times 5 = 6480$)——随 $N_f$ 呈指数增长,在大规模下不可行;仅用作上界参考。
- V( ours)。从基础 $f^*$ 开始,按阶梯顺序一次改变一个因子,因此每一步仅改变一个因子,且所有值在 $O(\sum_i k_i)$ 次变化内覆盖(线性)。具体而言,当 $N=2$ 时,$N_f \approx 3 * k$。
- L。从 $f^*$ 开始,让每个配置仅偏离 $f^*$ 一个因子(穿过 $f^*$ 的十字形),同样为 $O(\sum_i k_i)$。具体而言,当 $N=2$ 时,$N_f \approx 2 * k$。
- Random。独立同分布(IID)采样整个配置;在独立均匀重采样每个因子的情况下,每次转换的期望汉明距离为 $\sum_{i=1}^{N_f} (k_i-1)/k_i$,因此 $n$ 次演示后的期望总因子变化为 $E[f_{Random}] = (n-1) \sum_i (k_i-1)/k_i = O(n N_f)$,即每增加一个演示约 $N_f$ 次变化。
两种利用组合性的计划(V 和 L)均为线性,$O(\sum_i k_i)$,而 Complete 为指数级 $\prod_i k_i$。为了公平比较,我们固定所有方法的总因子变化 $f$ 和预算 $n$。
此外,为了匹配各策略间的总因子变化数 $f$,我们使用 Random 策略采样少量额外演示。由于数量很少,这不会显著改变原始采样分布。我们进行此调整是因为 Random 的因子变化成本要高得多,尤其是在高维设置中。
C.3 仿真实验设置
仿真平台。仿真演示由 ManiSkill [41](mplib,每环境求解器)中的脚本化运动规划生成,而非遥操作或学习策略。对于策略选择的每个指令配置,我们在带有腕部摄像头的 Panda 机械臂上构建分解场景(目标 + 最多三个随机干扰物)并执行指令动词;我们重试直到达到目标数量的成功演示,并丢弃失败案例。每个演示记录智能体视角和腕部图像($256 \times 256$),以及 8 维状态和 8 维动作,然后转换为 LeRobot 格式。
仿真设置。对于每个因子对实验,两个主要因子在 $6 \times 6$(或 $6 \times 5$)的对角网格上变化;指令模板中出现的载体因子取 2 个随机采样值;指令中未包含的其余因子固定为默认场景值。场景级干扰物体(数量和位置)在每集(episode)中随机化。具体的数据采样策略由 $N_f$ 决定。默认情况下,收集 200 个演示用于训练。在推理期间,默认执行 200 次 rollout,使用三个随机种子进行评估,我们报告各项性能及其平均值。
预训练模型检查点。我们使用公开发布的预训练检查点初始化所有策略,并使用每个模型的默认训练配置在我们收集的演示上进行后训练。所有模型均训练至收敛。
C.4 仿真实验结果
我们在图 10 中提供了额外的实验结果,这在两个方面与我们的主要发现一致。首先,偏差感知的收集(V)在较高的因子变化预算下带来了最大的增益:
15
第 16 页
在空间×大小(GR00T)和颜色×空间(π0)任务上,V 在 f=18 时明显优于 L 和 Random(48.1 对比 33.9/28.7 以及 54.9 对比 47.8/46.8),而在较小的 f 值下,这三种策略几乎难以区分。其次,在涉及大小的配对(颜色×大小、动词×大小)中,这种优势消失——L 匹配或超过 V,且绝对成功率保持低位——这表明无论采用何种收集策略,大小始终是难以接地的最难因子。这与我们的因子主导分析一致,其中大小是接地最差的因子(层级中最低):在有限的数据预算下,没有任何策略能可靠地捕捉大小信息,只有当预算增加时,结构化分配才开始发挥作用。
C.5 真实机器人实验
任务。我们在三个自然需要多任务语言能力的真实机器人任务上评估模型性能。详细信息如下,额外的实验演示视频见补充材料。
Bun。在此任务中,要求机器人拿起特定颜色的包子并将其放入蒸笼的特定位置。随机干扰物放置在蒸笼和物体附近。干扰物的位置是随机的。指令示例:“将(绿色、白色、黄色、紫色)包子放入左侧的(第一、第二、第三、第四)蒸笼篮中。”
Pizza。在此设置中,要求机器人将不同的酱料放在披萨上。酱料的位置每次都会互换。指令示例:“将(芥末酱、配料、薄荷、番茄酱)添加到(左上、右下、右上、左下)的披萨上” 图 10:额外结果。
Cup。在此设置中,要求机器人将不同的酱料放在披萨上。酱料的位置每次都会互换。示例语言指令包括“将搅拌勺放入(蓝色、红色、绿色、粉色)杯子中”,“将(粉色、蓝色、红色、绿色)杯子端上托盘”,“塑造(粉色、蓝色、红色、绿色)杯子”,“从(粉色、蓝色、红色、绿色)杯子中倒出水”。
评估设置。每个模型进行 48 次回合。对于每个回合,成功条件是机器人在两次尝试中完成该任务。示例模板为“将搅拌勺放入(粉色、红色、蓝色、绿色)杯子中”
16
第 17 页
参考文献
[1] R. Geirhos, J.-H. Jacobsen, C. Michaelis, R. Zemel, W. Brendel, M. Bethge, 和 F. A. Wich- mann. 深度神经网络中的捷径学习。Nature Machine Intelligence, 2(11):665–673, 2020.
[2] B. Lake 和 M. Baroni. 缺乏系统性的泛化:对序列到序列循环网络组合技能的研究。在 International conference on machine learning, 页码 2873–2882. PMLR, 2018.
[3] A. Agrawal, D. Batra, D. Parikh, 和 A. Kembhavi. 不要只是假设;看并回答:克服视觉问答中的先验。在 Proceedings of the IEEE conference on computer vision and pattern recognition, 页码 4971–4980, 2018.
[4] Y. Fang, Y. Feng, D. Jing, J. Liu, Y. Yang, Z. Wei, D. Szafir, 和 M. Ding. 当视觉覆盖语言时:评估和缓解 VLA 中的反事实失败。arXiv preprint arXiv:2602.17659, 2026.
[5] Y. Xing, X. Luo, J. Xie, L. Gao, H. Shen, 和 J. Song. 通用机器人策略中的捷径学习:数据集多样性和碎片化的作用。arXiv preprint arXiv:2508.06426, 2025.
[6] F. Lin, Y. Hu, P. Sheng, C. Wen, J. You, 和 Y. Gao. 机器人操作模仿学习中的数据缩放定律。在 International Conference on Learning Representations, 卷 2025, 页码 54877–54910, 2025.
[7] S. Fei, S. Wang, J. Shi, Z. Dai, J. Cai, P. Qian, L. Ji, X. He, S. Zhang, Z. Fei, 等人。 Libero-plus:视觉-语言-动作模型的深入鲁棒性分析。arXiv preprint arXiv:2510.13626, 2025.
[8] B. Liu, Y. Zhu, C. Gao, Y. Feng, Q. Liu, Y. Zhu, 和 P. Stone. Libero:终身机器人学习的知识转移基准。Advances in Neural Information Processing Systems, 36:44776–44791, 2023.
[9] S. Choi, Y. Lee, Y. Park, C. D. Kim, R. Krishna, D. Fox, 和 Y. Yu. vla-eval:视觉-语言-动作模型的统一评估框架。arXiv preprint arXiv:2603.13966, 2026.
[10] E. Liu, S. Liang, L. Lu, X. Zeng, X. Cao, A. Liu, 和 S. Pang. Roboview-bias:评估机器人操作中具身代理的视觉偏差。arXiv preprint arXiv:2509.22356, 2025.
[11] D. Hupkes, V. Dankers, M. Mul, 和 E. Bruni. 组合性分解:神经网络如何泛化?Journal of Artificial Intelligence Research, 67:757–795, 2020.
[12] D. Keysers, N. Sch¨arli, N. Scales, H. Buisman, D. Furrer, S. Kashubin, N. Momchev, D. Sinopalnikov, L. Stafiniak, T. Tihon, 等人。测量组合泛化:一种基于真实数据的综合方法。arXiv preprint arXiv:1912.09713, 2019.
[13] B. Lin, D. Bouneffouf, 和 I. Rish. 应用中组合泛化的综述。arXiv preprint arXiv:2302.01067, 2023.
[14] C. Li, C. Jing, Z. Li, M. Zhai, Y. Wu, 和 Y. Jia. 大型视觉-语言模型中的上下文组合泛化。在 Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 页码 17954–17966, 2024.
[15] C. Devin, A. Gupta, T. Darrell, P. Abbeel, 和 S. Levine. 学习用于多任务和多机器人迁移的模块化神经网络策略。在 2017 IEEE international conference on robotics and automation (ICRA), 页码 2169–2176. IEEE, 2017.
17
第 18 页
[16] D. Xu, S. Nair, Y. Zhu, J. Gao, A. Garg, L. Fei-Fei, 和 S. Savarese。神经任务编程:学习跨层级任务的泛化能力。在 2018 IEEE 国际机器人与自动化会议 (ICRA) 中,第 3795–3802 页。IEEE,2018 年。
[17] Y.-L. Kuo, B. Katz, 和 A. Barbu。遵循自然语言指令的深度组合式机器人规划器。在 2020 IEEE 国际机器人与自动化会议 (ICRA) 中,第 4906–4912 页。IEEE,2020 年。
[18] W. Qiu 和 H. Zhu。无需预言机的程序化强化学习。在国际学习表征会议 (ICLR) 中,2022 年。
[19] A. Brohan, N. Brown, J. Carbajal, Y. Chebotar, J. Dabis, C. Finn, K. Gopalakrishnan, K. Hausman, A. Herzog, J. Hsu 等人。RT-1:用于大规模现实世界控制的机器人 Transformer。arXiv 预印本 arXiv:2212.06817,2022 年。
[20] B. Zitkovich, T. Yu, S. Xu, P. Xu, T. Xiao, F. Xia, J. Wu, P. Wohlhart, S. Welker, A. Wahid 等人。RT-2:视觉-语言-动作模型将网络知识迁移至机器人控制。在机器人学习会议 (CoRL) 中,第 2165–2183 页。PMLR,2023 年。
[21] K. Black, N. Brown, D. Driess, A. Esmail, M. Equi, C. Finn, N. Fusai, L. Groom, K. Hausman, B. Ichter 等人。$\backslash\pi_0$:用于通用机器人控制的视觉-语言-动作流模型。arXiv 预印本 arXiv:2410.24164,2024 年。
[22] P. Intelligence, K. Black, N. Brown, J. Darpinian, K. Dhabalia, D. Driess, A. Esmail, M. Equi, C. Finn, N. Fusai 等人。$\pi_{0.5}$:具有开放世界泛化能力的视觉-语言-动作模型。arXiv 预印本 arXiv:2504.16054,2025 年。
[23] A. Khazatsky, K. Pertsch, S. Nair, A. Balakrishna, S. Dasari, S. Karamcheti, S. Nasiriany, M. K. Srirama, L. Y. Chen, K. Ellis 等人。Droid:大规模野外机器人操作数据集。arXiv 预印本 arXiv:2403.12945,2024 年。
[24] A. O’Neill, A. Rehman, A. Maddukuri, A. Gupta, A. Padalkar, A. Lee, A. Pooley, A. Gupta, A. Mandlekar, A. Jain 等人。Open X-Embodiment:机器人学习数据集与 RT-X 模型:Open X-Embodiment 协作 0。在 2024 IEEE 国际机器人与自动化会议 (ICRA) 中,第 6892–6903 页。IEEE,2024 年。
[25] R. Cadene, C. Dancette, M. Cord, D. Parikh 等人。Rubi:减少视觉问答中的单模态偏差。神经信息处理系统进展,32,2019 年。
[26] M. Shi, L. Chen, J. Chen, Y. Lu, C. Liu, G. Ren, P. Luo, D. Huang, M. Yao, 和 H. Li。多样性是扩展机器人操作所需的一切吗?IEEE 机器人汇刊,2026 年。
[27] S. Wu, X. Luo, J. Zhang, J. Xie, J. Song, H. T. Shen, 和 L. Gao。机器人基础模型的政策对比解码。arXiv 预印本 arXiv:2505.13255,2025 年。
[28] T. Chen, Z. Chen, B. Chen, Z. Cai, Y. Liu, Z. Li, Q. Liang, X. Lin, Y. Ge, Z. Gu 等人。RobotWin 2.0:具有强域随机化的可扩展数据生成器与基准,用于鲁棒的双臂机器人操作。arXiv 预印本 arXiv:2506.18088,2025 年。
[29] S. Nasiriany, A. Maddukuri, L. Zhang, A. Parikh, A. Lo, A. Joshi, A. Mandlekar, 和 Y. Zhu。Robocasa:面向通用机器人的日常任务大规模仿真。arXiv 预印本 arXiv:2406.02523,2024 年。
[30] O. Mees, L. Hermann, E. Rosete-Beas, 和 W. Burgard。Calvin:用于长视界机器人操作任务的语言条件策略学习的基准。IEEE 机器人与自动化快报,7(3):7327–7334,2022 年。
18
第 19 页
[31] X. Yang, R. Dagli, A. Zook, H. Hadfield, A. Goyal, S. Birchfield, F. Ramos, 和 J. Tremblay。 Robolab:用于分析任务通用策略的高保真仿真基准。arXiv 预印本 arXiv:2604.09860,2026 年。
[32] A. Mandlekar, Y. Zhu, A. Garg, J. Booher, M. Spero, A. Tung, J. Gao, J. Emmons, A. Gupta, E. Orbay 等人。Roboturk:通过模仿进行机器人技能学习的众包平台。在机器人学习会议,第 879–893 页。PMLR,2018 年。
[33] M. Kelly, C. Sidrane, K. Driggs-Campbell, 和 M. J. Kochenderfer。Hg-dagger:与人类专家互动的模仿学习。在 2019 年国际机器人与自动化会议 (ICRA),第 8077–8083 页。IEEE,2019 年。
[34] C. Wang, H. Shi, W. Wang, R. Zhang, L. Fei-Fei, 和 C. K. Liu。Dexcap:用于灵巧操作的可扩展且便携的动作捕捉数据采集系统。arXiv 预印本 arXiv:2403.07788, 2024 年。
[35] M. Lepert, J. Fang, 和 J. Bohg。Phantom:仅使用人类视频训练机器人而非使用真实机器人。arXiv 预印本 arXiv:2503.00779,2025 年。
[36] A. Maddukuri, Z. Jiang, L. Y. Chen, S. Nasiriany, Y. Xie, Y. Fang, W. Huang, Z. Wang, Z. Xu, N. Chernyadev 等人。仿真与真实联合训练:基于视觉的机器人操作的一个简单配方。arXiv 预印本 arXiv:2503.24361,2025 年。
[37] V. Saxena, M. Bronars, N. R. Arachchige, K. Wang, W. C. Shin, S. Nasiriany, A. Mandlekar, 和 D. Xu。在机器人操作的大规模数据集学习中什么很重要。国际学习表征会议 2025,2025 年。
[38] M. Salganicoff, L. H. Ungar, 和 R. Bajcsy。基于视觉的机器人抓取主动学习。 机器学习,23(2):251–278,1996 年。
[39] S. Belkhale, Y. Cui, 和 D. Sadigh。模仿学习中的数据质量。神经信息处理系统进展,36:80375–80395,2023 年。
[40] J. Gao, A. Xie, T. Xiao, C. Finn, 和 D. Sadigh。通过组合泛化实现机器人操作的高效数据采集。arXiv 预印本 arXiv:2403.05110,2024 年。
[41] T. Mu, Z. Ling, F. Xiang, D. Yang, X. Li, S. Tao, Z. Huang, Z. Jia, 和 H. Su。ManiSkill: 具有大规模演示的可泛化操作技能基准。arXiv 预印本 arXiv:2107.14483,2021 年。
[42] G. Comanici, E. Bieber, M. Schaekermann, I. Pasupat, N. Sachdeva, I. Dhillon, M. Blistein, O. Ram, D. Zhang, E. Rosen 等人。Gemini 2.5:通过高级推理、多模态、长上下文和下一代代理能力推动前沿。arXiv 预印本 arXiv:2507.06261,2025 年。
[43] M. J. Kim, K. Pertsch, S. Karamcheti, T. Xiao, A. Balakrishna, S. Nair, R. Rafailov, E. Foster, G. Lam, P. Sanketi 等人。Openvla:一个开源的视觉-语言-动作模型。arXiv 预印本 arXiv:2406.09246,2024 年。
[44] J. Bjorck, F. Casta˜neda, N. Cherniadev, X. Da, R. Ding, L. Fan, Y. Fang, D. Fox, F. Hu, S. Huang 等人。Gr00T N1:用于通用人形机器人的开源基础模型。arXiv 预印本 arXiv:2503.14734,2025 年。
[45] J. Zheng, J. Li, Z. Wang, D. Liu, X. Kang, Y. Feng, Y. Zheng, J. Zou, Y. Chen, J. Zeng 等人。X- VLA:作为可扩展跨具身视觉-语言-动作模型的软提示 Transformer。 arXiv 预印本 arXiv:2510.10274,2025 年。
[46] Y. Liao, P. Zhou, S. Huang, D. Yang, S. Chen, Y. Jiang, Y. Hu, J. Cai, S. Liu, J. Luo 等人。Genie Envisioner:用于机器人操作的统一世界基础平台。arXiv 预印本 arXiv:2508.05635,2025 年。
19
第 20 页
[47] wikipedia. 汉明距离. https://en.wikipedia.org/wiki/Hamming_distance, 2025. 访问日期:2026-05-25。
[48] P. Wu, Y. Shentu, Z. Yi, X. Lin, 和 P. Abbeel。Gello:一种通用、低成本且直观的机器人机械臂遥操作框架。在 2024 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上,第 12156–12163 页。IEEE,2024。
20