机器人操作OOD鲁棒性:GuidedAttention的可校正视觉注意力

快速导读:现有方法要么扩展训练数据多样性,要么学习鲁棒表征,但缺乏显式的人类在环校正机制。视觉提示方法虽提供干预能力,但未将注意力作为可校正的中间表示,难以在运行时动态调整。

端到端视觉运动策略在分布内(ID)条件下表现优异,但在面对位置或外观变化时,常因缺乏可解释性而失效。GuidedAddress这一痛点,提出将视觉注意力显式建模为可校正的关键点,为人类干预提供透明接口。

该方法不仅提升了策略的鲁棒性,还通过特征空间对齐确保校正后的注意力与策略输入一致。尽管存在跟踪依赖和校正时机限制,其核心思想为可解释机器人控制提供了新范式。

英文题目:GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

论文出处:arXiv 每日论文精选 · arXiv:2607.21049

原始论文:PDF / 论文页面

对应视频标题:机器人操作OOD鲁棒性:GuidedAttention的可校正视觉注意力|推荐指数:★★★★★

这篇论文解决什么问题?

当前模仿学习策略多为黑盒模型,难以诊断失败原因。当环境出现分布外变化时,策略可能关注错误区域,导致操作失败。现有方法多依赖数据增强或鲁棒表征学习,但缺乏执行时的人类干预机制。

视觉提示方法如边界框或草图虽提供一定干预能力,但未将注意力作为显式中间表示,且不支持动态校正。GuidedAttention填补这一空白,将注意力建模为可解释、可校正的关键点序列。

在真实场景中,位置偏移或外观变化常导致策略注意力漂移。例如,毛巾折叠任务中,彩色积木干扰可能使策略忽略毛巾角,导致抓取失败。传统方法无法在运行时纠正此类错误。

因此,需要一种机制,在保持策略性能的同时,允许人类在关键时机校正注意力,确保策略聚焦任务相关结构。

核心创新

方法概览

现有方法要么扩展训练数据多样性,要么学习鲁棒表征,但缺乏显式的人类在环校正机制。视觉提示方法虽提供干预能力,但未将注意力作为可校正的中间表示,难以在运行时动态调整。

  • AttnEnc模块:使用ResNet和Transformer编码器-解码器预测像素级关键点,生成注意力特征。这些关键点作为显式中间表示,条件化Diffusion Policy。
  • DP-GA架构:将注意力特征与本体状态结合,输入去噪扩散过程生成动作。前向-逆权重共享确保预测与校正特征的一致性。
  • Keypoint Override机制:允许用户在初始帧校正关键点,校正后的关键点替换预测值,并更新注意力特征。此机制支持从注意力漂移中恢复。
  • Co-Tracker集成:校正后的关键点由Co-Tracker自动跟踪,无需持续人工干预。跟踪模块确保关键点在序列中保持空间一致性。
  • 特征空间对齐:通过权重共享和特征对齐,确保校正后的关键点特征与策略输入兼容,避免分布偏移。
  • 任务定义:每个任务定义少量关键点(如动态关键点附着于操作对象,静态关键点定义于目标对象),简化标注负担。

逐图理解论文

失败直觉

失败直觉
Fig. 5. Real-world manipulation tasks. (A–D) show real-world task execution under ID conditions. (E) shows the Appearance OOD condition for Towel Fold, where numerous colorful block distractors introduce significant visual clutter. All tasks use two attention keypoints.

在毛巾折叠任务中,彩色积木干扰常使策略忽略毛巾角,导致抓取失败。传统黑盒策略无法诊断或纠正此类注意力漂移,只能依赖数据增强或重新训练,缺乏运行时干预能力。

方法贡献

方法贡献
Fig. 2. Policy architecture overview. (A) The policy conditions a denoising diffusion process for action generation on attention features from image-based keypoints, together with propriocep- tive states. (B) Each image is processed by a ResNet and Transformer encoder-decoder to predict pixel-level keypoints, which are embedded as attention features. (C) During rollout, users can optionally correct predicted keypoints when attention drift occurs. The corrected keypoints replace the predictions and update the attention features, enabling recovery from failures. The figure shows two of four keypoints overridden.

图2展示策略架构。注意AttnEnc如何预测关键点并生成注意力特征。观察校正机制如何替换预测值并更新特征,理解其恢复失败的能力。

实验如何设计?

  • 仿真环境:MuJoCo中三个任务(Cable、Ring、Particle),评估ID、位置OOD、外观OOD及组合OOD条件。
  • 真实世界实验:UR5e机器人执行三个任务(Cup Insertion、Chain Pick-and-Place、Towel Fold),评估ID、位置OOD及外观OOD(仅Towel Fold)。
  • 基线对比:与ACT和DP基线比较,评估GuidedAttention在ID和OOD条件下的性能提升。
  • 消融研究:分析特征路由和注意力监督的影响,验证各组件贡献。
  • 校正机制评估:比较自主执行与人类校正后的性能差异,量化校正价值。

关键结果与论文证据

  • 在真实世界ID条件下,DP-GA(默认)相比ACT提升15-30个百分点,相比DP提升5-15个百分点(第6页)。
  • 在仿真Pos+App-OOD条件下,校正后的DP-GA成功率为67.8%,显著高于DP基线的28.9%(第6页)。
  • 在真实世界外观OOD(Towel Fold)中,人类校正带来约80个百分点的性能提升(第6页)。
  • 禁用特征路由导致校正启用时成功率下降约60个百分点,凸显特征对齐的重要性(第5页)。
  • 校正机制在位置OOD中同样有效,证明其泛化能力。
  • Co-Tracker在大多数情况下保持跟踪稳定性,但在严重遮挡下可能失效。

阅读时需要注意

  • 关键点数量假设:假设少量关键点足以覆盖所有任务相关结构,复杂场景可能不足。
  • 2D坐标限制:关键点基于2D图像坐标,忽略深度和遮挡,可能影响性能。
  • 跟踪依赖:依赖Co-Tracker,严重变形或长期遮挡可能导致跟踪失败。
  • 校正时机限制:仅支持初始帧校正,不支持持续监督,动态环境可能不足。

关联工作

  • Diffusion Policy [23]:基线方法,DP-GA条件化注意力特征而非全局CNN特征。
  • ACT [29]:基线方法,Action Chunking Transformer与DP-GA对比。
  • Visual Prompting [16-18]:先前工作使用边界框、草图或点,GuidedAttention不同在于使用显式中间注意力表示且支持用户校正。
  • Co-Tracker [27]:作为现成跟踪模块,用于传播关键点。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

GuidedAttention:一种用于通过模仿学习实现分布外(OOD)鲁棒机器人操作的、可解释且可修正的视觉注意力方法

Masaki Murooka1,2, Ryoichi Nakajo2, Keisuke Shirai2, Tomohiro Motoda2, Hanbit Oh2, Ryo Hanai2, Yukiyasu Domae2

摘要——端到端的视觉运动策略为人类理解或修正策略的视觉注意力提供的机会很少。我们提出了 GuidedAttention,这是一种视觉运动模仿学习框架,它将可解释且可修正的视觉注意力作为显式的中间表示引入。从相机图像中预测与任务相关的注意力关键点,并对基于扩散的动作策略进行条件约束。用户可以在 rollout 初始化时检查并选择性地修正选定的关键点,此后修正后的注意力将通过跟踪模块在整個执行过程中自动传播。仿真和现实世界的实验表明,GuidedAttention 一致地提高了机器人操作性能,特别是在位置和外观分布外(OOD)条件下。

I. 引言

直接从经验中学习灵活的行为操作,使得机器人能够在难以使用传统基于模型的方法进行显式建模的环境中运行。端到端的表示学习进一步消除了对手动特征工程的依赖,并可以直接处理高维感官输入。然而,与传统的模块化流水线相比,端到端策略在运行期间为人类理解或修正策略的视觉注意力提供的机会很少 [1], [2]。即使人类可以轻易识别与任务相关的物体或位置,策略也必须完全依靠自己发现这些视觉线索。因此,策略可能会仅仅因为缺乏人类可以轻易提供的一个简单但关键的提示而失败 [3], [4]。

为了解决这一局限性,我们提出了 GuidedAttention,这是一种视觉运动模仿学习框架,它将可解释且可修正的视觉注意力作为显式的中间表示引入。我们使用从相机图像预测的与任务相关的视觉注意力关键点来实例化这种表示,以条件化一个基于扩散的动作策略,称为 Diffusion Policy with GuidedAttention (DP-GA)。在训练过程中,用户仅在每次演示的初始帧中标注关键点,现成的跟踪模型将它们传播到剩余帧中。在 rollout 期间,策略自主预测注意力关键点以及机器人动作。必要时,用户可以在 rollout 初始化时修正选定的关键点一次,此后修正后的注意力将在整个执行过程中自动跟踪(图 1)。因此,GuidedAttention 在提供自主动作生成的同时,提供了一个显式的接口,用户可以通过该接口检查和修正策略的视觉注意力。

这种能力在分布外(OOD)环境中特别有用,在这些环境中,从演示中学习的视觉注意力可能会偏离与任务相关的结构。模仿学习策略通常在训练分布内泛化良好,但在分布偏移下可能会遭受显着的性能下降 [5], [6]。GuidedAttention 允许用户在自主注意力预测变得不可靠时提供与任务相关的视觉引导,而无需持续监督。我们在多个仿真和现实世界的操作任务上评估了所提出的方法,并证明了在位置和外观 OOD 条件下的性能提升。

本文的主要贡献总结如下:

• 我们引入了可解释且可修正的视觉注意力作为视觉运动模仿学习的显式中间表示,使用户能够检查并选择性地修正策略的视觉注意力。

• 我们提出了 DP-GA,它对基于扩散的

第 2 页

在视觉注意力关键点和物体上进行动作生成。此类分布偏移通常导致策略 支持一次性用户纠正,随后自动跟踪。 失去对任务相关实体的关注,从而导致操作性能下降。 • 我们通过仿真和真实世界实验证明,GuidedAttention 提高了机器人操作 性能,特别是在位置和外观 OOD 条件下。 现有方法主要通过两种方式提高鲁棒性。 一种方向是通过将 OOD 状态纳入数据来显式扩展训练分布。BMIL 在演示数据周围生成额外的轨迹 [19], RoCoDA 反事实地替换干扰性的环境 元素 [20],而 ROSIE 合成语义视觉变 化 [21]。尽管这些方法增加了数据多样性, 但其鲁棒性仅限于训练期间遇到的变化。 II. 相关工作 A. 模仿学习中的视觉注意力 视觉模仿学习的研究越来越侧重于从视觉观测中提取任务相关信息,以改善策略学习。早期工作表明,通过视觉关键点表示观测能够实现更结构化的视觉运动控制 [7]。 最近的方法探讨了如何获取这些注意力线索。注意力可以通过预测最小化视觉动态预测误差的关键点来估计 [8],从物体提议先验中推导 [9],或从人类演示视频中提取 [10]。另一条工作线研究了这些表示应如何在视觉运动策略中被利用。关键点可以作为主要的视觉表示 [11],通过语义物体部分信息进行丰富 [12],或经过选择性过滤以提高鲁棒性 [13]。 与主要将注意力作为学习表示以提高策略性能的前人方法不同,GuidedAttention 将视觉注意力视为一种显式的中间表示,它既具有可解释性,又可由用户进行纠正。这种注意力表示在人类指导和端到端视觉运动策略之间提供了直观的接口,同时与动作生成紧密耦合。

B. 视觉运动策略中的人类引导 视觉运动策略的人类引导可以在不同抽象层次上提供。基于语言和视觉语言模型指定高级任务目标 [14], [15],而视觉提示方法通过边界框 [16]、草图 [17]、轨迹标注 [3]、语义标注 [4] 或稀疏点提示 [18] 提供更直接的空间引导。虽然这些方法在提供人类引导的方式上有所不同,但它们都证明了纳入人类提供信息以提高视觉运动策略的有效性。 GuidedAttention 采取了一种不同的方法,在感知和动作生成之间引入了一个显式的中间注意力表示。用户不是直接向策略指定引导,而是通过策略预测的注意力关键点与策略交互,这些关键点可以在动作生成之前进行检查和可选纠正。

C. 模仿学习中的 OOD 鲁棒性 模仿学习中的 OOD 问题以多种形式出现,包括物体配置与训练数据不同的位置 OOD,由背景或纹理变化引起的外观 OOD,以及涉及未见类别的类别 OOD。

III. 方法 A. 总体策略架构 所提出的 DP-GA 概述如图 2 (A) 所示。与直接将动作生成条件化于学习到的视觉特征的常规视觉运动策略不同,DP-GA 在感知和动作生成之间引入了一个显式的视觉注意力表示。这种注意力表示对用户具有可解释性,并且可以在策略 rollout 期间进行可选纠正,同时与动作生成紧密耦合。 DP-GA 以多视图 RGB 观测和本体感受关节状态作为输入。对于每个相机图像,视觉注意力编码器 (AttnEnc) 预测任务相关的注意力关键点并提取相应的注意力特征。这些注意力特征与本体感受特征连接,并用于条件化基于 U-Net 骨干网络的 CNN 去噪扩散策略 [23]。 与先前基于 CNN [23] 或点云编码器 [24] 的全局视觉特征条件化的扩散策略不同,DP-GA 将动作生成条件化于可解释的视觉注意力特征上,这些特征显式地定位任务相关结构,同时为可选的人类纠正提供了显式接口。

B. 视觉注意力编码器 如图 2 (B) 所示,AttnEnc 预测视觉注意力的显式中间表示。它估计任务相关的注意力关键点及其相应的注意力特征,随后用于条件化扩散策略。AttnEnc 遵循 DETR 风格架构 [25],由 Transformer 编码器和解码器组成,但与预测边界框不同

第 3 页

在 DETR 中,它预测注意力关键点的 2D 坐标。RGB 图像首先通过 ResNet-18 骨干网络 [26] 进行处理以获取块特征(patch features),这些特征被输入到带有位置嵌入的 Transformer 编码器中。解码器接收对应于预定义关键点数量的可学习查询(queries),并生成注意力特征。最后,一个作为线性层实现的坐标头将每个注意力特征映射为 2D 坐标,如下所示:

$$ p_i = h_\theta(f_i) = A f_i + b \quad (1) $$

其中 $p_i \in \mathbb{R}^2$ 表示第 $i$ 个关键点的坐标,$f_i \in \mathbb{R}^{d_f}$ 是其注意力特征。线性映射 $h_\theta(\cdot)$ 的参数由 $A$ 和 $b$ 表示。对于每张图像,AttnEnc 输出一组注意力特征 $\{f_i\}_{i=1}^{N_k}$,其中 $N_k$ 是预定义的任务相关关键点数量。这些注意力特征随后用于条件化用于动作生成的去噪扩散过程。

我们还评估了一种以坐标为特征的变体,其中预测的坐标 $p_i$ 本身(而不是 $f_i$)被用作扩散过程的条件输入。训练同时优化动作预测和关键点预测。令 $p_i^{gt} \in \mathbb{R}^2$ 表示从人工标注中获得的第 $i$ 个关键点的地面真实坐标。关键点损失定义为预测关键点与地面真实关键点之间的均方误差(MSE):

$$ L_{kp} = \frac{1}{N_k} \sum_{i=1}^{N_k} \| p_i – p_i^{gt} \|_2^2 \quad (2) $$

通过对通过关键点预测监督的特征进行条件化,扩散过程使策略能够专注于对操作至关重要的空间相关位置。在推理(rollout)阶段,动作是通过 AttnEnc 从当前图像预测关键点,并将生成的注意力特征作为条件输入到扩散模型中来生成的。

(B) 视觉注意力编码器

C. 关键点覆盖机制

在策略推理过程中,预测的注意力关键点作为一个可解释的接口,用户可以通过它检查策略的视觉注意力。当预测的注意力被判断为不可靠时(例如,在外观或位置 OOD 条件下),用户可以可选地修正一部分关键点坐标,如图 2 (C) 所示。修正后的坐标随后通过 $h_\theta(\cdot)$ 的逆映射转换为注意力特征,并替换最终条件集中对应的预测特征:

$$ z_i = \begin{cases} f_i & (\text{prediction path}) \\ h_\theta^{-1}(p_i^{gt}) & (\text{override path}) \end{cases} \quad (3) $$

其中 $z_i$ 表示实际用于策略条件化的特征。

引入三种技术以确保此覆盖机制的一致性和可靠性:

(i) 前向-逆权重共享。由于 $h_\theta(\cdot)$ 是从 $d_f$ 维特征到 2D 坐标的线性映射,其解析逆可以在不增加额外参数的情况下定义:

$$ h_\theta^{-1}(p_i) = A^+(p_i – b) \quad (4) $$

其中 $A^+$ 表示 Moore-Penrose 伪逆。强制这种参数共享鼓励了前向预测与逆恢复之间的相互一致性。

(ii) 特征空间对齐损失。因为当 $d_f > 2$ 时逆映射是不定的(underdetermined),多个特征向量可能对应于同一个坐标。为了确保前向预测的特征与逆恢复的特征保持线性映射 $h_\theta(\cdot)$ 对齐,我们引入以下特征空间一致性

第 4 页

一致性损失:

$$ L_{feat} = \frac{1}{N_k} \sum_{i=1}^{N_k} \| f_i – h_{\theta}^{-1}(p_{gt}^i) \|^2 \quad (5) $$

这鼓励两条路径产生一致的关键点特征。

(iii) 随机特征路由。即使应用了上述对齐策略,前向预测特征与从真实关键点恢复的特征之间仍可能存在残余差异。为了避免扩散模型在训练期间依赖特定的单一通路,我们在对扩散过程进行条件约束时,随机选择每个关键点特征 $z_i$ 是来自预测路径还是覆盖路径。这鼓励两种类型的特征都能诱导一致的动作分布,并在预测关键点仍然不准确时稳定早期训练。

D. 关键点标注与跟踪

1) 训练:真实标签生成:为了获得用于监督的真实关键点,人类在每个演示的第一帧上点击关键点位置,这使得标注既轻量又直观。随后的真实关键点则通过以下公式获得:

$$ p_{gt}^i[t] = G(p_{gt}^i[t-1], I[t], I[t-1]), \quad (6) $$

其中 $G(\cdot)$ 是跟踪模块(在我们的实现中为 Co-Tracker [27]),$I[t]$ 是时间 $t$ 的 RGB 图像。已知为静态的关键点在轨迹中保持固定。

2) rollout:人类可控注意力:在测试时,策略以前馈方式预测关键点,从而实现完全自主执行,无需人类指导。由于预测的关键点充当人类可解释的中间表示,策略的视觉焦点可以实时监控,故障模式也可以被诊断。为了增强在挑战性视觉条件(如 OOD 条件)下的鲁棒性,用户可以可选地通过在相机图像上点击来提供初始 rollout 帧的修正关键点。覆盖操作可以仅应用于部分关键点或选定的相机视图,从而降低交互成本。随后,跟踪模块会持续传播这些修正后的关键点,并在整个执行过程中将其作为扩散过程的条件输入,而静态关键点保持固定。这使得以最小的努力实现人类可控的注意力成为可能。

2) 评估条件:我们在分布内(ID)和分布外(OOD)条件下评估性能。

位置 OOD:在 ID 条件下,rollout 在两个演示目标位置之间插值的 10 个目标物体位置上执行。在 OOD 条件下,rollout 在 10 个未见过的目标物体位置上执行,这些位置要么超出演示范围进行外推,要么沿垂直于演示变化轴的方向偏移。目标物体对应于 Cable 和 Ring 中的杆,以及 Particle 中的源盒子。

外观 OOD:在 ID 条件下,桌面具有纯绿色纹理。在 OOD 条件下,我们增强相同的

图 3. 仿真操作任务。 (A) Cable:将柔性电缆穿过杆之间的狭窄间隙。 (B) Ring:将柔性环放置在杆上。 (C) Particle:将粒子舀入盒子中。 (D) Cable (Appearance OOD):桌面上的纹理干扰物引入了严重的视觉变化。所有任务均使用两个注意力关键点:一个附着在被操作物体或工具上的动态关键点,以及一个定义在目标物体或环境上的静态关键点。

Cable:机器人抓住柔性电缆的一端,并将其引导穿过桌面上两根垂直杆之间的狭窄间隙。我们使用两个注意力关键点:一个位于被抓握电缆末端的动态关键点,以及一个位于一根杆底部的静态关键点。

Ring:机器人抓住一个环并将其放置在直立的杆上,使环环绕杆并 resting 在桌面上。我们使用两个注意力关键点:一个位于起始时环最低部分的动态关键点,以及一个位于杆底部的静态关键点。

Particle:机器人使用铲状工具将粒子从源盒子转移到目标盒子。我们使用两个注意力关键点:一个位于铲尖的动态关键点,以及一个位于源盒子边缘的静态关键点。

对于每个任务,我们总共收集了 30 次遥操作演示(两个分布内目标位置各 15 次)。真实注意力关键点在每个演示的第一帧手动标注。动态关键点随后使用 Co-Tracker [27] 自动传播,而静态关键点保持固定。

所有实验,包括仿真和现实世界,均使用 RoboManipBaselines 框架 [28] 实现。

IV. 实验

A. 仿真实验

1) 任务与设置:我们在 MuJoCo 仿真环境中评估所提出的方法,使用了三个需要灵巧且精确的视觉运动协调的操作任务(图 3)。所有任务均涉及配备平行夹爪和提供固定对角俯视视角的单 RGB 摄像头的 Universal Robots UR5e 机械臂。

第 5 页

带有杂乱彩色方形图案的绿色桌面,这些方块随机放置和定向,引入了显著的外观变化。

3) 与基线方法的比较:我们将我们的方法与两种强大的基于视觉的模仿学习基线方法进行比较。我们评估了两种引导注意力策略的变体。 DP-GA(默认):扩散模型以从视觉注意力编码器中提取的注意力特征为条件,其中关键点预测鼓励它们在空间上与任务相关的物理结构对齐。 DP-GA(坐标作为特征):扩散模型直接以预测的注意力关键点坐标为条件,将它们视为用于控制的结构化几何线索。

两种变体都共享相同的视觉注意力编码器和第 III 节中描述的引导注意力覆盖机制,仅在注意力表示如何对策略进行条件化方面有所不同。

为了进行比较,我们包含了两种广泛使用的基于视觉的模仿学习基线方法。 DP:以基于 CNN 的全局视觉特征为条件的扩散策略,没有显式的注意力表示 [23]。 ACT:一种动作分块 Transformer,从视觉观测中预测多步动作序列 [29]。

所有方法都在相同的数据集和 rollout 协议下训练和评估:每个条件进行 10 次 rollout,共 3 个随机种子。

无需人工干预的性能。当完全自主执行时,DP-GA 对应于表 I 中的绿色行。首先比较基线方法,ACT 在 ID 条件下的表现与 DP 相似,但在 OOD 设置中性能大幅下降,这表明扩散模型具有很强的泛化能力。在此基础上,DP-GA 在大多数评估条件下进一步优于 DP。特别是,它在 ID 条件下实现了约 15 个百分点 (pp) 的提升,证明了利用空间结构化注意力线索的好处。虽然 DP-GA(默认)在外观 OOD 设置中略低于 DP,但 DP-GA 在所有其他 OOD 条件下始终比 DP 高出约 10 pp,证实了引导注意力学习显著增强了分布偏移下的鲁棒视觉运动控制。

注意力校正带来的额外增益。当预测的注意力变得不可靠时,用户可以选择仅在第一帧校正注意力关键点,之后在执行过程中会自动跟踪这些关键点。这在分布偏移下带来了显著的性能提升。在 ID 条件下保持高成功率的同时,两种 DP-GA 变体在 OOD 性能上比其完全自主执行提高了约 15–30 pp。因此,在位置和外观 OOD 设置中,DP-GA 的成功率比 DP 基线高出约 20–30 pp(见表 I,红色行)。这些结果表明,可选的人工校正有效地补充了自主注意力预测,并进一步改善了位置和外观分布偏移下的性能。

4) 消融研究:为了评估关键引导注意力组件的贡献,我们对 DP-GA 的默认变体进行了消融研究。 特征路由:在训练期间,禁用预测路径和覆盖路径之间的随机路由。因此,扩散模型仅以预测的注意力特征为条件。 注意力监督:在训练期间移除关键点损失 $L_{kp}$ 和特征对齐损失 $L_{feat}$,因此不强制注意力特征表示空间上有意义的地点。

消融分析。表 II 总结了在默认变体的 DP-GA 中消融关键引导注意力组件时的性能下降情况,评估条件包括有和无注意力校正的 ID 条件。启用注意力校正时,禁用特征路由导致性能急剧下降近 60 pp,这表明在训练期间正确整合基于覆盖的特征对于在 rollout 期间利用人工注意力校正至关重要。相比之下,移除注意力监督会导致在有和无注意力校正的情况下均出现显著的性能下降(分别下降约 65 pp 和 30 pp),这表明鲁棒性要求注意力特征与任务相关的结构对齐。这些结果证实,鲁棒性并非简单地源于 Transformer-特征条件化的扩散策略架构本身;相反,它严重依赖于将人工校正的注意力正确整合到策略条件化中。总体而言,我们的仿真结果表明,引导注意力显著提高了对位置和外观分布偏移的鲁棒性。

5) 额外分析:我们从鲁棒性和提示的角度进一步分析了所提出的方法。 对跟踪和标注准确性的鲁棒性。图 4 显示了添加到跟踪和用户指定的关键点上的噪声的影响。该方法在适度噪声下保持稳定并逐渐退化,同时在 OOD 条件下相对于基线策略保持明显的优势。

与标记叠加提示的比较。表 III 与通过直接在输入图像上叠加边界框或点标记来提供视觉提示的基线方法进行了比较 [16]。虽然这些方法提供了类似的空间线索,但它们往往效果较差,特别是在 OOD 条件下。

关键点和相机数量的影响。只要选择了任务相关的点,即使不增加关键点或相机视图的数量,也能实现强大的性能。关键点和相机都可以部分覆盖

第 6 页

表 I 四种泛化条件下的仿真成功率

| Policy | Variant | Correction | ID | Pos-OOD | App-OOD | Pos+App-OOD | | :— | :— | :— | :— | :— | :— | :— | | DP-GA | Default | – | 83.3% (±7.4%) | 55.6% (±8.6%) | 45.6% (±8.8%) | 34.4% (±6.9%) | | DP-GA | Default | Enabled | 84.4% (±4.3%) | 70.0% (±5.5%) | 76.7% (±13.1%) | 67.8% (±13.7%) | | DP-GA | Coord-as-feat | – | 84.4% (±4.3%) | 55.6% (±13.5%) | 70.0% (±5.7%) | 38.9% (±13.6%) | | DP-GA | Coord-as-feat | Enabled | 87.8% (±5.7%) | 68.9% (±6.9%) | 81.1% (±10.6%) | 63.3% (±7.2%) | | DP | – | – | 67.8% (±6.3%) | 45.6% (±9.6%) | 54.4% (±9.0%) | 28.9% (±5.7%) | | ACT | – | – | 53.3% (±30.7%) | 28.9% (±14.1%) | 6.7% (±5.7%) | 8.9% (±6.9%) |

结果基于三个操作任务(Cable、Ring、Particle)的平均值。每个数值表示在 3 个随机种子和 3 个任务上的平均成功率 ± 标准差,每个 ID / OOD 条件下有 10 次 rollout。绿色行:完全自主执行。红色行:在第一次 rollout 帧对预测注意力进行可选的人类修正,随后进行自动跟踪。粗体数字表示最佳性能,以及在该条件下与最佳性能相差 5 个百分点以内的结果。

表 II GuidedAttention 组件的消融实验

| Variant | Correction | ID (∆from Default) | | :— | :— | :— | | No feature routing | – | 81.1% (±6.9%) (-2.2 pp) | | No feature routing | Enabled | 25.5% (±14.6%) (-58.9 pp) | | No attention supervision | – | 52.2% (±7.3%) (-31.1 pp) | | No attention supervision | Enabled | 17.8% (±16.7%) (-66.7 pp) |

消融实验应用于 DP-GA 的默认变体。所有结果均在与表 I 相同的评价协议下获得。数值表示在 3 个仿真任务(Cable、Ring、Particle)、3 个随机种子以及每个 ID 条件下 10 次 rollout 上的平均成功率 ± 标准差。括号中的数字显示相对于 DP-GA(默认)的性能下降。

表 III 与 Marker Overlay Prompting 的比较

| Policy | ID | Pos+App-OOD | | :— | :— | :— | | DP-GA | 86.7% (±4.7%) | 83.3% (±12.5%) | | MOP-Box | 60.0% (±0.0%) | 33.3% (±24.9%) | | MOP-Point | 50.0% (±14.1%) | 3.3% (±4.7%) |

被骑乘,从而允许灵活的人类修正,而无需重新指定。

B. 真实世界实验

1) 任务与设置:所有真实世界实验均使用带有平行夹爪的 Universal Robots UR5e 机械臂进行。使用两个 RGB 摄像头(Intel RealSense D435):一个安装在顶部,另一个安装在侧面斜角处。策略仅使用 RGB 流作为视觉输入。

我们评估了三个需要视觉精度和泛化能力的操作任务(图 5):

  • 杯子插入:机械臂抓取一个橙色杯子,并将其插入一个稍大的蓝色杯子中。使用两个注意力关键点:每个杯子的边缘。
  • 链条抓取与放置:机械臂抓取一条塑料链条并将其放入杯子中。使用两个注意力关键点:被抓取的链条尖端和杯子边缘。
  • 毛巾折叠:机械臂在桌面上将一条长方形毛巾对折。使用两个注意力关键点:毛巾的两个远角。

对于每个任务,我们收集了 32 次遥操作演示:在 4 个目标物体位置各 8 次演示。真值注意力关键点在第一个帧手动标注,并使用 Co-Tracker 自动传播,遵循与仿真中相同的协议。

2) 评价条件:每种方法在 3 个随机种子下进行评估,每个条件有 10 次 rollout。我们测量 ID 和位置 OOD 条件下的性能,其中 ID rollout 在演示目标位置的凸包内执行,而位置 OOD rollout 在该凸包外先前未见过的物体位置执行。对于毛巾折叠任务,我们通过在桌面上放置许多小型彩色方块来额外评估外观 OOD 泛化能力,以诱导强烈的纹理变化。

3) 定量评估:我们评估了与仿真实验中相同的四种策略:DP-GA(默认)、DP-GA(坐标作为特征)、DP 基线和 ACT 基线。每种策略均在有和无注意力修正的情况下进行评估。

图 6 总结了三个真实世界任务的成功率平均值。在 ID 条件下(图 6 (A)),DP-GA 的两个变体均优于基线,证实了即使在没有分布偏移的情况下,利用与任务对齐的注意力线索也能改善视觉运动控制。DP-GA(默认)相比 ACT 提高了 15–30 个百分点,相比 DP 提高了 5–15 个百分点。

在位置 OOD 条件下(图 6 (B)),引导注意力的优势变得更加明显:即使没有注意力修正,DP-GA 在完全自主执行期间的成功率也略高于两个基线。当提供可选的人类注意力修正时,它进一步提升了性能,根据任务不同,额外提高了 20–40 个百分点。相比之下,基线策略遭受了显著的性能下降,经常无法完成任务。

最后,仅在毛巾折叠任务上评估了外观 OOD(图 6 (C))。严重的视觉干扰显著降低了大多数方法(尤其是那些完全依赖学习到的注意力的方法)的性能。虽然 DP 在这种外观偏移下保持了一定程度的鲁棒性,但人类注意力修正使 DP-GA 实现了大幅恢复,相比其自主执行提高了约 80 个百分点,相比 DP 基线提高了约 40 个百分点。这些结果表明,可选的注意力修正

第 7 页

(E) 毛巾折叠 (A) 杯子插入 (B) 杯子插入(俯视图) (C) 链条抓取与放置 (D) 毛巾折叠 (外观分布外)

图 5. 真实世界操作任务。 (A–D) 展示了在分布内 (ID) 条件下的真实世界任务执行。(E) 展示了毛巾折叠任务的外观分布外 (Appearance OOD) 条件,其中大量彩色积木干扰物引入了显著的视觉杂乱。所有任务均使用两个注意力关键点。

100 ACT DP 86.7 82.2 DP-GA (自主) 80 DP-GA (修正) 71.1 66.7 60.0 60

40 25.6 20

0 ACT DP DP-GA DP-GA (默认) (坐标作为特征) (A) 分布内性能

100 ACT DP (A) DP 基线在位置分布外 (B) DP-GA (自主) 在 80 DP-GA DP-GA (自主)(修正) 64.4 71.1 (失败) 位置分布外 (成功) 60 40 30.0 35.6 22.2 20 6.7 0 ACT DP DP-GA DP-GA (默认) (坐标作为特征) (B) 位置分布外性能

100 ACT DP 90.0 90.0 80 DP-GA DP-GA (自主)(修正) 60 50.0 (C) DP-GA (自主) 在 (D) DP-GA (注意力修正) 40 外观分布外 (失败) 在外观分布外 (成功) 20 13.3 0.0 0.0 图 7. 分布偏移下的定性真实世界轨迹。 0 ACT DP DP-GA DP-GA 引导式视觉注意力通过保持对任务 (默认) (坐标作为特征) 相关结构的关注来提高鲁棒性。 (C) 外观分布外性能 在 DP-GA 的图像中,预测的关键点以叉号形式可视化。 (A, B) 在链条抓取与放置任务中,DP-GA 自主地 图 6. 真实世界操作成功率。 将注意力保持在链条末端和杯口周围,即使在未见过的物体位置也能实现成功放置。 (A) 和 (B) 中的结果是三个真实世界任务上的平均值。(C) 仅在毛巾折叠任务上 进行评估。所有结果均为三个随机种子的平均值,每个种子在每个条件下进行 10 次轨迹。蓝色条形表示基线策略。绿色条形表示完全自主执行。红色条形表示可选的人类对预测注意力的修正。

预测的注意力可以有效缓解感知失败,同时保持自主策略执行,即使在极具挑战性的视觉条件下也是如此。

4) 定性评估:为了更好地理解视觉注意力如何促成任务成功或失败,我们在真实世界轨迹期间将注意力关键点叠加在相机图像上进行可视化。

在外观分布外条件下,分别执行了无注意力修正和有注意力修正的情况。在没有注意力修正的情况下,强烈的视觉干扰导致毛巾角落的关键点定位错误,从而导致抓取尝试失败。相比之下,当仅在第一帧修正预测的注意力,随后自动跟踪时,机器人可以可靠地抓住毛巾角落并成功完成折叠。

这些定性结果说明了可解释且可修正的视觉注意力如何增强空间定位,并在真实世界分布偏移下实现鲁棒的视觉运动性能。

图 7 (A) 和 (B) 分别展示了在位置分布外条件下,使用 DP 基线和 DP-GA (默认) 的链条抓取与放置任务的轨迹。面对以前未见过的杯子位置,DP 基线未能引导链条进入杯子。相比之下,尽管存在位置偏移,DP-GA 通过自主保持对链条末端和杯口附近的注意力,成功完成了任务。

图 7 (C) 和 (D) 比较了外观分布外条件下毛巾折叠任务的轨迹。

V. 局限性

虽然引导式注意力提高了环境分布外情况下的视觉运动鲁棒性,但仍存在几个局限性。

首先,该方法假设少量手动定义的关键点足以表示所有任务相关的结构。

第 8 页

相关结构。尽管这一假设在已评估的任务中成立,但更复杂的场景可能需要更丰富或自适应的注意力表示。

其次,关键点标注依赖于二维图像坐标,并未明确考虑深度或遮挡,这可能导致在关键点不可见时性能下降。

第三,我们的方法依赖于现成的跟踪模块来随时间传播关键点,因此其性能部分取决于跟踪质量。虽然在我们的设置中跟踪通常很稳定,但在严重变形或长时间遮挡的场景中仍可能出现失败。通过将静态结构上的关键点视为固定点,部分缓解了这一局限性,但提高跟踪鲁棒性仍然是一个重要的研究方向。

我们相信,解决这些问题将进一步提高引导注意力的适用性和鲁棒性。

VI. 结论

我们提出了 GuidedAttention,这是一种视觉运动模仿学习框架,它在感知和行动生成之间引入了可解释且可校正的视觉注意力作为显式中间表示。通过允许用户检查并可选地校正预测的注意力关键点,同时保持自主策略执行,GuidedAttention 为人类与端到端视觉运动策略的交互提供了直观的接口。仿真和现实世界中的实验结果表明,这种可由人类校正的注意力始终能改善操作性能,特别是在位置和外观分布偏移的情况下。我们希望这项工作能鼓励未来关于端到端机器人学习中人类可解释表示和人机交互的研究。

参考文献

[1] J. Yu, T. Sadjadpour, A. O’Neill, M. Khfifi, L. Y. Chen, R. Cheng, M. Z. Irshad, A. Balakrishna, T. Kollar, and K. Goldberg, “MANIP: A modular architecture for integrating interactive perception for robot manipulation,” in IEEE/RSJ International Conference on Intelligent Robots and Systems, 2024, pp. 1283–1289. [2] L. Zheng, Z. Ouyang, C. Wang, J. Pan, and W. Zhang, “From video to control: A survey of learning manipulation interfaces from temporal visual data,” arXiv:2604.04974, 2026. [3] J. Gu, S. Kirmani, P. Wohlhart, Y. Lu, M. G. Arenas, K. Rao, W. Yu, C. Fu, K. Gopalakrishnan, Z. Xu, P. Sundaresan, P. Xu, H. Su, K. Hausman, C. Finn, Q. Vuong, and T. Xiao, “RT-Trajectory: Robotic task generalization via hindsight trajectory sketches,” in International Conference on Learning Representations, 2024. [4] Y. Li, Z. Gong, H. Li, X. Huang, H. Kang, G. Bai, and X. Ma, “Robotic visual instruction,” in IEEE/CVF Conference on Computer Vision and Pattern Recognition, June 2025, pp. 12 155–12 165. [5] A. Xie, L. Lee, T. Xiao, and C. Finn, “Decomposing the generalization gap in imitation learning for visual robotic manipulation,” in IEEE International Conference on Robotics and Automation, 2024, pp. 3153–3160. [6] P. Gupta, H. Admoni, and A. Bajcsy, “Adapting by analogy: OOD generalization of visuomotor policies via functional correspondence,” in Conference on Robot Learning, 2025. [7] C. Finn, X. Y. Tan, Y. Duan, T. Darrell, S. Levine, and P. Abbeel, “Deep spatial autoencoders for visuomotor learning,” in IEEE Inter- national Conference on Robotics and Automation, 2016, pp. 512–519. [8] H. Ichiwara, H. Ito, K. Yamamoto, H. Mori, and T. Ogata, “Contact- rich manipulation of a flexible object based on deep predictive learning using vision and tactility,” in IEEE International Conference on Robotics and Automation, 2022, pp. 5375–5381. [9] Y. Zhu, A. Joshi, P. Stone, and Y. Zhu, “VIOLA: Imitation learning for vision-based manipulation with object proposal priors,” Conference on Robot Learning, 2022. [10] H. Xiong, Q. Li, Y.-C. Chen, H. Bharadhwaj, S. Sinha, and A. Garg, “Learning by watching: Physical imitation of manipulation skills from human videos,” in IEEE/RSJ International Conference on Intelligent Robots and Systems, 2021, pp. 7827–7834. [11] J. Gao, Z. Tao, N. Jaquier, and T. Asfour, “K-VIL: Keypoints-based visual imitation learning,” IEEE Transactions on Robotics, vol. 39, no. 5, pp. 3888–3908, 2023. [12] S. Wang, J. You, Y. Hu, J. Li, and Y. Gao, “SKIL: Semantic keypoint imitation learning for generalizable data-efficient manipulation,” in Robotics: Science and Systems, 2025. [13] Y. Zhang, S. Mittal, Z. Zhang, L. Ke, S. Srinivasa, and A. Gupta, “ATK: Automatic task-driven keypoint selection for robust policy learning,” in Conference on Robot Learning, 2025. [14] M. Ahn, A. Brohan, N. Brown, Y. Chebotar, O. Cortes, B. David, C. Finn, C. Fu, K. Gopalakrishnan, K. Hausman, et al., “Do as I can, not as I say: Grounding language in robotic affordances,” in Conference on Robot Learning, 2022. [15] Y. Jiang, A. Gupta, Z. Zhang, G. Wang, Y. Dou, Y. Chen, L. Fei- Fei, A. Anandkumar, Y. Zhu, and L. Fan, “VIMA: General robot manipulation with multimodal prompts,” in International Conference on Machine Learning, 2023. [16] M. A. Muttaqien, T. Motoda, R. Hanai, and Y. Domae, “Visual prompting for robotic manipulation with annotation-guided pick-and- place using ACT,” in IEEE International Conference on Automation Science and Engineering, 2025, pp. 2642–2649. [17] P. Sundaresan, Q. Vuong, J. Gu, P. Xu, T. Xiao, S. Kirmani, T. Yu, M. Stark, A. Jain, K. Hausman, D. Sadigh, J. Bohg, and S. Schaal, “RT-Sketch: Goal-conditioned imitation learning from hand-drawn sketches,” in Conference on Robot Learning, 2024. [18] M. Levy, S. Haldar, L. Pinto, and A. Shirivastava, “P3-PO: Prescriptive point priors for visuo-spatial generalization of robot policies,” in IEEE International Conference on Robotics and Automation, 2025, pp. 4167–4174. [19] J. Y. Park and L. Wong, “Robust imitation of a few demonstrations with a backwards model,” Advances in Neural Information Processing Systems, vol. 35, pp. 19 759–19 772, 2022. [20] E. Ameperosa, J. A. Collins, M. Jain, and A. Garg, “RoCoDA: Counterfactual data augmentation for data-efficient robot learning from demonstrations,” in IEEE International Conference on Robotics and Automation, 2025, pp. 13 250–13 256. [21] T. Yu, T. Xiao, J. Tompson, A. Stone, S. Wang, A. Brohan, J. Singh, C. Tan, D. M, J. Peralta, K. Hausman, B. Ichter, and F. Xia, “Scaling robot learning with semantically imagined experience,” in Robotics: Science and Systems, 2023. [22] Z. Sun and S. Song, “Latent policy barrier: Learning robust visuomotor policies for robot policies by staying in-distribution,” arXiv:2508.05941, 2025. [23] C. Chi, Z. Xu, S. Feng, E. Cousineau, Y. Du, B. Burchfiel, R. Tedrake, and S. Song, “Diffusion policy: Visuomotor policy learning via action diffusion,” The International Journal of Robotics Research, vol. 44, no. 10-11, pp. 1684–1704, 2025. [24] Y. Ze, G. Zhang, K. Zhang, C. Hu, M. Wang, and H. Xu, “3D diffusion policy: Generalizable visuomotor policy learning via simple 3D representations,” in Robotics: Science and Systems, 2024. [25] N. Carion, F. Massa, G. Synnaeve, N. Usunier, A. Kirillov, and S. Zagoruyko, “End-to-end object detection with transformers,” in European Conference on Computer Vision. Springer, 2020, p. 213–229. [26] K. He, X. Zhang, S. Ren, and J. Sun, “Deep residual learning for image recognition,” in IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 770–778. [27] N. Karaev, I. Rocco, B. Graham, N. Neverova, A. Vedaldi, and C. Rupprecht, “CoTracker: It is better to track together,” in European Conference on Computer Vision. Springer, 2024, pp. 18–35. [28] M. Murooka, T. Motoda, R. Nakajo, H. Oh, K. Makihara, K. Shirai, T. Ogata, and Y. Domae, “RoboManipBaselines: A unified framework for imitation learning in robotic manipulation across real and simula- tion environments,” IEEE Access, vol. 14, pp. 97 896–97 909, 2026. [29] T. Z. Zhao, V. Kumar, S. Levine, and C. Finn, “Learning fine-grained bimanual manipulation with low-cost hardware,” in Robotics: Science and Systems, 2023.

第 9 页

附录

A. 替代视觉提示的比较

1) 提示表示方式选择的讨论:在模仿学习中,先前的几项研究探讨了允许用户在策略执行期间在相机图像上提供视觉提示的想法,这与我们的设置精神相似 [3], [4], [16], [17]。然而,这些方法在几个重要方面与我们的方法不同。

首先,它们在所需用户信息的粒度上存在差异。在 RT-Trajectory [3] 中,用户指定一个连续末端执行器轨迹以及一个抓取点。虽然这允许对策略进行详细指导,但它给用户带来的负担远大于我们的方法,后者仅需在初始帧中指定关键点。RT-Sketch [17] 使用目标场景状态的线条草图作为提示。尽管这种输入格式即使对于没有机器人专业知识的用户也是可访问的,但它仍然要求在每次发出操作命令时绘制草图,这对用户来说并非微不足道的负担。Robotic Visual Instruction (RoVI) [4] 允许用户直接在图像上编写语义指令。它支持多种形式,如物体轨迹、表示执行顺序的数字以及突出显示目标物体的圆圈。因此,在 RoVI 中,视觉提示代表了任务意图本身,而在我们的方法中,它仅作为策略内部维护的注意力点的线索。这种设计允许我们将视觉提示严格定位为分布外 (OOD) 情况的辅助信号。如第 IV 节所示,即使不手动覆盖注意力关键点,我们的方法仍比没有视觉提示的基线策略取得更高的成功率,而覆盖机制进一步提高了性能。

2) 与标记叠加的定量比较:作为具有相对相似提示粒度和目的的基线,我们将我们的方法与标记叠加提示 (MOP) 进行了比较,该方法在训练和执行期间直接在提供给策略的图像上叠加固定颜色的标记 [16]。为了确保公平比较,我们匹配了任务和提示位置,仅改变视觉提示的表示方式。我们在图 3 (B) 所示的 Ring 任务上进行了仿真比较,该任务涉及将柔性环放置在杆子上。如图 A1 所示,标记叠加在我们方法中使用的注意力关键点的相同位置,具体在环的最低点(红色)和目标杆子(橙色)。除了像先前方法那样叠加矩形区域的 MOP-Box 外,我们还评估了 MOP-Point,这是一种使用基于点的叠加以更好地与我们的表示方式对齐的变体。如表 A1 所示,在分布内 (ID) 和 OOD 条件下,我们的方法在成功率方面始终比两种基线高出 20 个百分点 (pp) 以上。这些结果表明,仅在输入图像上叠加标记不足以可靠地利用与任务相关的信息。相比之下,我们的方法显式预测注意力点并利用辅助监督,在引导策略方面更为有效。

图 A1. 标记叠加提示的示意图。

图 A2. 跟踪准确性的定量影响。 三种不同策略在仿真中 Ring 任务上的成功率,在三种随机种子下评估,同时改变添加到跟踪关键点的噪声幅度。Pos-OOD 和 App-OOD 分别指物体位置和桌面纹理的 OOD 设置。

B. 跟踪模块的影响

1) 关于使用跟踪模块的讨论:我们的方法采用 Co-Tracker [27] 这一现成的跟踪模块,以自动随时间传播注意力关键点。因此,整体性能的一部分取决于跟踪器的质量。在本文考虑的六个仿真和真实世界操作任务中,Co-Tracker 通常能够保持稳定的跟踪,即使目标暂时被遮挡或移出相机视野后来又重新出现。在这些设置中,我们未观察到跟踪器成为主要的性能瓶颈。然而,在其他涉及更严重形变的任务场景中,观察到了跟踪失败,这可能会限制所提出方法的适用性。在我们的框架中,这一问题得到部分缓解,因为附着在环境固定结构(例如安装在桌子上的杆子)上的关键点被定义为静态关键点,因此不受跟踪模块的影响。此外,如果未来出现改进的跟踪模块,该方法可以很容易地与之集成。

第 10 页

表 A1 与标记叠加提示(Marker Overlay Prompting)的比较

策略 ID 位置分布外 (Pos-OOD) 外观分布外 (App-OOD) 位置+外观分布外 (Pos+App-OOD)

DP-GA 86.7% (±4.7%) 86.7% (±9.4%) 93.3% (±4.7%) 83.3% (±12.5%) MOP-Box 60.0% (±0.0%) 46.7% (±4.7%) 43.3% (±26.2%) 33.3% (±24.9%) MOP-Point 50.0% (±14.1%) 50.0% (±8.2%) 23.3% (±4.7%) 3.3% (±4.7%)

在相同实验条件下,DP-GA 与标记叠加提示(MOP)[16] 的比较。结果展示了仿真中 Ring 任务的表现。Pos-OOD 和 App-OOD 分别指训练数据中不存在的物体位置和桌面纹理的分布外(OOD)设置。每个值表示在 3 个随机种子下的平均成功率 ± 标准差,每个 ID / OOD 条件包含 10 次 rollout。粗体数字表示每种条件下的最佳性能。

2) 跟踪精度的定量影响:我们在仿真中对图 3 (B) 所示的 Ring 任务进行了评估,通过在训练和 rollout 期间向 Co-Tracker 跟踪的关键点注入不同幅度的随机噪声,并测量由此产生的成功率。如图 A2 所示,在适度的噪声范围内,成功率保持相对稳定,并随着噪声幅度的增加而逐渐下降。在物体位置和背景外观均发生偏移(Pos+App-OOD)的设置下,输入分辨率为 320 × 224,当噪声幅度为 8 像素时,成功率下降约 30 个百分点(pp);然而,它仍然比没有注意力关键点的基线高出 20 多个百分点。

C. 关键点标注精度的影响

用户指定的注意力关键点是通过在相机图像上点击标注的,因此这类输入自然可能包含标注误差。为了定量评估所提方法对标注误差的容忍度,我们在 Ring 任务上进行了仿真评估。在 rollout 时,我们在初始帧中向用户指定的注意力关键点注入不同幅度的随机噪声,并评估由此产生的成功率。结果如图 A3 所示。虽然在小的扰动下成功率基本保持不变,但随着噪声幅度的增加,成功率逐渐下降。在物体位置和背景外观均发生偏移(Pos+App-OOD)的设置下,输入分辨率为 320 × 224,当噪声幅度为 8 像素时,成功率下降约 20 个百分点(pp);然而,它仍然比没有注意力关键点的基线高出 40 多个百分点。根据我们的经验,这种敏感度水平足够温和,用户可以在不增加困难的情况下提供标注,同时仍能受益于所提方法的性能。

D. 关键点数量的影响

在所提方法中,用户在 rollout 期间不需要覆盖所有注意力关键点,而是可以仅指定子集。为了评估覆盖关键点数量的影响,我们在 Ring 任务上进行了仿真研究。具体而言,我们使用 2、4 和 6 个注意力关键点训练策略,并对每个策略,在测量任务成功率的同时,改变 rollout 时覆盖的关键点数量。结果如表 A2 所示。总体而言,随着 rollout 时覆盖的关键点比例增大,性能往往会有所提升。然而,增加训练期间使用的关键点总数并不会显著改变成功率。关键点主要放置在环和杆周围,覆盖靠近杆的关键点往往能产生更高的成功率。这表明关键点的重要性取决于其关联的物体,某些关键点比其他点对任务成功的影响更大。当适当选择与任务相关的关键点时,即使只有两个关键点也能实现高成功率。这使用户能够在不显著增加标注工作量的情况下受益于所提方法。

E. 相机数量的影响

如图 2 (A) 所示,所提策略架构可以将多个相机图像作为输入。此外,可以在 rollout 时为仅部分相机覆盖注意力关键点。为了评估相机数量的影响,我们在 Ring 任务上进行了仿真研究。除了原始的前视相机外,我们在工作区中引入了左视和右视相机,如图 A4 所示。我们使用双相机输入(前+左和前+右)训练策略。对于双相机策略,我们进一步在 rollout 时评估了两种设置:覆盖

第 11 页

表 A2 关键点数量的定量影响

ID 位置分布外 (Pos-OOD)

推理时覆盖的关键点数 (Nk) 推理时覆盖的关键点数 (Nk) 训练时关键点数 (Nk) 1 (环) 1 (杆) 2 4 6 训练时关键点数 (Nk) 1 (环) 1 (杆) 2 4 6

2 76.7% 76.7% 86.7% – – 2 50.0% 80.0% 86.7% – – 4 86.7% 96.7% – 4 73.3% 93.3% – 6 80.0% 93.3% 93.3% 6 70.0% 80.0% 93.3%

外观分布外 (App-OOD) 位置+外观分布外 (Pos+App-OOD)

推理时覆盖的关键点数 (Nk) 推理时覆盖的关键点数 (Nk) 训练时关键点数 (Nk) 1 (环) 1 (杆) 2 4 6 训练时关键点数 (Nk) 1 (环) 1 (杆) 2 4 6

2 30.0% 80.0% 93.3% – – 2 16.7% 56.7% 83.3% – – 4 43.3% 96.7% – 4 46.7% 96.7% – 6 23.3% 46.7% 96.7% 6 16.7% 50.0% 80.0%

展示了仿真中 Ring 任务的结果。Pos-OOD 和 App-OOD 分别指物体位置和桌面纹理的分布外 (OOD) 设置。 每个值表示在 3 个随机种子上的平均成功率,每个 ID/OOD 条件下进行 10 次 rollout。

表 A3 相机数量的定量影响

ID 位置分布外 (Pos-OOD)

策略输入 DP-GA DP-GA 策略输入 DP-GA DP-GA DP DP 图像 (仅前端覆盖) (双图像覆盖) 图像 (仅前端覆盖) (双图像覆盖)

前端 86.7% – 56.7% 前端 86.7% – 60.0% 前端+左 80.0% 86.7% 56.7% 前端+左 60.0% 63.3% 50.0% 前端+右 83.3% 93.3% 50.0% 前端+右 80.0% 83.3% 43.3%

外观分布外 (App-OOD) 位置+外观分布外 (Pos+App-OOD)

策略输入 DP-GA DP-GA 策略输入 DP-GA DP-GA DP DP 图像 (仅前端覆盖) (双图像覆盖) 图像 (仅前端覆盖) (双图像覆盖)

前端 93.3% – 23.3% 前端 83.3% – 10.0% 前端+左 30.0% 50.0% 26.7% 前端+左 33.3% 36.7% 23.3% 前端+右 83.3% 90.0% 53.3% 前端+右 43.3% 80.0% 26.7%

展示了仿真中 Ring 任务的结果。Pos-OOD 和 App-OOD 分别指物体位置和桌面纹理的分布外 (OOD) 设置。 粗体数字表示最佳性能,括号内的数字表示在每种条件下与最佳性能相差 5 个百分点以内的结果。每个值 表示在 3 个随机种子上的平均成功率,每个 ID/OOD 条件下进行 10 次 rollout。

(A) 前端相机 (B) 左端相机 (C) 右端相机 图 A4. 多视角的相机图像。

仅使用前端相机的关键点,并对两个相机进行关键点覆盖。结果如表 A3 所示。我们的 DP-GA 始终比没有注意力关键点的 DP 基线取得更高的成功率。在 DP-GA 的各种变体中,仅前端和前端+右策略取得了相似的高性能,而前端+左策略的成功率较低。这可能是因为,从左端相机视角看,环和杆更频繁地被遮挡,使得区分任务相关的结构更加困难。这些结果表明,所提出的方法可以有效利用多个相机。然而,增加相机数量并不一定能提高性能;相反,选择能够提供任务相关观测的视角更为重要。

发表评论