APIVOT:用视觉思维解决长程机器人规划的几何困境

三分钟导读:APIVOT 是一种基于 VLM 的机器人规划器,通过自适应地交错语言推理(用于语义分解)和视觉思维(用于几何可行性验证),在长 horizon 厨房任务中实现了更高的成功率和推理效率。

英文题目:APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

论文出处:arXiv 每日论文精选 · arXiv:2607.08024

原始论文:PDF / 论文页面

对应视频标题:APIVOT:用视觉思维解决长程机器人规划的几何困境|推荐指数:★★★★★

这篇论文解决什么问题?

长 horizon 机器人规划需要同时处理语义任务结构(如目标分解、动作排序)和几何可行性(如空间限制、物体碰撞)。现有 VLM 规划器通常产生语义合理但几何不可行的计划,且缺乏内部几何推理能力。

核心创新

  • 提出 APIVOT,将几何推理直接整合到规划器的内部推理轨迹中,而非作为后验验证。
  • 设计三阶段训练课程,逐步教会模型理解、生成并自适应使用视觉思维。
  • 实现自适应模态选择,在保持高性能的同时显著降低 token 使用量。

方法概览

APIVOT 在推理轨迹中自适应地交错语言令牌和视觉思维(Visual Thoughts)。视觉思维作为想象的未来状态,用于内部验证几何可行性。模型通过三阶段 SFT 课程训练:1) 理解提供的视觉思维;2) 生成视觉思维并对齐真实未来观测;3) 自适应选择模态,仅在需要几何精度时生成视觉思维。

逐图理解论文

方法核心:交错视觉-语言思维

方法核心:交错视觉-语言思维
Figure 1: APIVOT (above) plans for long-horizon tasks by interleaving language reasoning with visual thoughts. While a standard VLM planner (below) reasonsing in text may produce a semantically plausible but geometrically infeasible plan, APIVOT imagines future states inside its reasoning trace. These visual thoughts reveal potential collisions or constraints before execution, enabling the planner to verify geometric constraints during planning.

APIVOT 提出在推理轨迹中自适应交错语言令牌与视觉思维。视觉思维作为想象的未来状态,用于内部验证几何可行性。不同于外部验证器,APIVOT 将几何推理直接整合到规划器的内部思维过程中,使模型能在执行前预判并修正潜在冲突。

训练策略:三阶段 SFT 课程

训练策略:三阶段 SFT 课程
Figure 2: APIVOT produces a reasoning trace of interleaved language tokens (yellow) and visual- thoughts (purple) followed by a plan, and is trained with a three-stage SFT curriculum. In all stages, we apply teacher-forced SFT to a reference reasoning trace and plan (blue border). Stage 1 teaches the model to plan with ground-truth visual thoughts, provided at every reasoning step; Stage 2 trains it to generate visual thoughts itself by aligning them to encoded ground-truth future observations via a cosine similarity loss; and Stage 3 omits visual thoughts for some reference steps, teaching the model to plan adaptively with visual thoughts.

模型通过三阶段 SFT 课程训练。第一阶段,模型学习理解提供的真实视觉思维;第二阶段,训练模型生成视觉思维,并通过余弦相似度损失对齐真实未来观测;第三阶段,省略部分视觉思维,教导模型仅在需要几何精度时自适应生成,实现模态选择。

实验设置:KitchenWorlds 基准

实验设置:KitchenWorlds 基准
Figure 9: KitchenWorlds task suite with increasing complexity. CONTAINMENT (above) requires placing target objects into constrained storage regions, testing accessibility, obstruction handling, and free-space reasoning. SORTING (middle) requires semantic reasoning over object types to assign food objects to containers, while capacity constraints make some assignments geometrically infeasible. STORING LEFTOVERS (below) composes both challenges into a longer-horizon held-out task, requiring the robot to sort food into containers and then store them in a constrained fridge.

评估在 KitchenWorlds 模拟器上进行,涵盖 CONTAINMENT、SORTING 和 STORING LEFTOVERS 任务家族。这些任务要求处理物体可达性、遮挡处理及空间推理。基线包括通用 VLM 如 Gemini-ER-1.5、VLM 规划器 VLM-TAMP 及符号规划器 FastDownward。

主要结果:成功率显著提升

主要结果:成功率显著提升
Figure 12: Success rates across all task families.

APIVOT 平均成功率为 0.419,较最佳 VLM 基线 Gemini-ER-1.5 提升 8.1 个百分点,较最佳规划基线 VLM-TAMP 提升 9.0 个百分点。这表明将几何推理内化到思维轨迹中,能有效弥补纯语言规划的几何缺陷,提高长程任务的整体执行成功率。

几何复杂度分析:高占用率优势

几何复杂度分析:高占用率优势
Figure 4: Success rate by occupancy ratio.

随着几何复杂度(占用率)增加,APIVOT 与基线的性能差距扩大。在高占用率场景下,差距从 0.07 增至 0.17。这说明在空间受限、几何约束严格的场景中,内部视觉思维对验证可行性至关重要,纯语言模型更易因忽略空间限制而失败。

实验与关键结果

  • 在 KitchenWorlds 模拟器上评估,包含 CONTAINMENT, SORTING, 和 STORING LEFTOVERS 任务家族。
  • 对比基线包括通用 VLM (Gemini-ER-1.5, Qwen3-VL-8B), VLM 规划器 (VLM-TAMP, Reflect-VLM) 和符号规划器 (FastDownward)。
  • 分析不同几何复杂度(占用率)和 token 预算下的性能。
  • 分析自适应模态选择行为及其与约束类型的关系。
  • 在 KitchenWorlds 模拟器上评估,包含 CONTAINMENT, SORTING, 和 STORING LEFTOVERS 任务家族。
  • 对比基线包括通用 VLM (Gemini-ER-1.5, Qwen3-VL-8B), VLM 规划器 (VLM-TAMP, Reflect-VLM) 和符号规划器 (FastDownward)。
  • 分析不同几何复杂度(占用率)和 token 预算下的性能。
  • 分析自适应模态选择行为及其与约束类型的关系。

阅读时需要注意

  • 实验仅在 KitchenWorlds 模拟器中进行,缺乏真实世界或更逼真模拟器的验证。
  • 潜在视觉表示在特定任务分布上训练,可能无法捕捉真实世界的全部几何和外观变化。
  • 自适应模态选择是通过 SFT 学习的,而非针对任务成功显式优化(如 RL)。
  • 框架仅处理文本和潜在图像,未包含点或边界框等其他表示形式。
  • 几何约束类型和模态标签依赖于模拟器衍生的启发式规则,可能不完全反映真实物理约束。
  • 自适应行为是基于监督数据学习的,可能在未见过的复杂几何场景中泛化能力有限。

关联工作

  • 长 horizon 机器人规划面临核心挑战:需同时处理语义任务结构与几何可行性。现有 VLM 规划器常生成语义合理但几何不可行的计划,如忽略空间限制或物体碰撞。传统 TAMP 依赖手工符号,而纯 VLM 缺乏内部几何推理能力,导致执行失败。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

APIVOT:基于交错视觉-语言思维的自适应规划

Emily Jin Joy Hsu Yiqing Xu Weiyu Liu† Nick Haber† Jiajun Wu†

斯坦福大学

摘要

长周期机器人规划需要同时对语义任务结构和几何可行性进行推理。为了成功执行任务,机器人必须分解目标、选择与任务相关的物体并排列动作序列,同时确保计划满足空间约束,如可用自由空间有限和物体碰撞等问题。在本文中,我们提出了 APIVOT,这是一种基于 VLM 的规划器,它通过自适应地交错语言和视觉思维来实现长周期规划。APIVOT 学习利用语言进行语义推理,同时使用视觉思维作为想象的未来状态,以进行几何可行性的内部验证。在长周期厨房任务中,APIVOT 优于通用 VLM 和先前的规划框架,在空间受限的设置中取得了最大的性能提升。我们发现 APIVOT 学习了有意义的模态选择行为,证明了视觉-语言思维的自适应交错提高了规划成功率和推理效率。*

1 引言

长周期机器人规划需要灵活地交错语义推理和几何推理。考虑以下任务:“将剩菜存入冰箱。”为了成功实现这一目标,机器人必须进行语义推理以识别哪些物品需要存储,选择合适的容器,并确定满足先决条件的动作序列(例如,在放入任何物品之前冰箱门必须打开)。同时,成功执行取决于几何约束,例如剩菜是否适合放入所选容器中,容器在冰箱内应如何排列,以及是否需要移开任何现有物体以创造足够的自由空间。这两种推理模式紧密交织。一个在符号上有效的计划如果容器发生碰撞仍可能失败,而早期做出的几何决策可能会影响下游哪些动作仍然可行。

现有的基于 LLM 和 VLM 的规划器能够可靠地生成语义上合理的动作序列,但在成功取决于几何可行性时往往表现不佳 [1–8]。先前的工作通过将模型与外部运动规划器、可行性检查器或学习到的动力学模型耦合来解决这一问题 [9–13]。然而,这些系统通常将几何反馈纳入重规划过程中,这并不会塑造规划器的内部推理。相反,我们认为有效的规划器应该自身交错语义和几何推理,利用语言和视觉作为互补的模态。语言在语义推理方面非常有效,例如任务分解和动作选择 [14],但它无法以紧凑、精确的方式表达基于结果场景配置进行规划所需的几何结构。相比之下,视觉表示有效地编码了空间布局、物体形状和剩余自由空间,使其非常适合几何推理 [15, 16]。因此,语言和视觉是互补的推理模式,应根据任务需求自适应地使用。虽然最近的视觉-语言-动作(VLA)模型开始将视觉表示纳入中间推理,但它们统一地应用这些表示,而在何时使用视觉和语言进行推理方面仍面临挑战 [14–19]。

† 共同指导。

预印本。

第 2 页

输入 带有交错视觉-语言思维的自适应规划 任务:将碗放入冰箱内部。 移开碗1以腾出空间。 将碗3放入内部 规划 放置 <IMAGE_START> 移动 拿起(碗2) 打开 碗2 放置(碗2,[2,9]) 盒4 场景: 内部 冰箱0。 拿起(碗1) 到 冰箱0。 柜台5 放置(碗1,[4,3]) 拿起(盒4) <IMAGE_END> <IMAGE_END> 放置(盒4,[14,7]) 拿起(碗3) APIVOT 放置(碗3, [7,4])

物体: 打开冰箱0。碗1已经在内部。为了确保 规划:打开(冰箱0) 冰箱0、碗1、… VLM 物体之间不发生碰撞,将碗2放置在 拿起(碗2),放置(碗2,[3,8]), 碗1的前方且冰箱的左侧。放置碗3… 拿起(碗3),放置(碗3,[1,4])

图1:APIVOT(上方)通过交错语言推理与视觉思维来规划长周期任务。 而标准的 VLM 规划器(下方)仅通过文本推理可能会产生语义上合理但几何上不可行的规划,APIVOT 在其推理轨迹中想象未来状态。这些视觉思维在执行前揭示了潜在的碰撞或约束,使规划器能够在规划过程中验证几何约束。

为此,我们提出了 APIVOT,这是一种基于 VLM 的规划器,它自适应地交错语言与视觉思维以执行长周期机器人规划(图1)。给定任务指令和场景的图像观测,我们的模型首先生成交错语言和视觉思维的推理轨迹,然后输出一系列执行动作。它学习使用语言进行关于子目标分解和行动顺序的语义推理,并使用代表想象未来状态的视觉思维来验证几何可行性并指导下游规划。关键在于,我们的模型学习自适应的模态选择,在每个规划步骤选择合适的模态以联合执行语义和几何推理。

APIVOT 在展示交错视觉-语言思维的参考轨迹上使用监督微调(SFT)进行训练。这些轨迹监督模型生成和使用视觉思维进行推理,同时相应的潜在视觉状态与不同中间状态下场景的真实编码图像对齐。我们在三阶段课程下训练 APIVOT,逐步教会其自适应规划。在第一阶段,模型学习对提供的视觉思维进行推理,并从中提取几何信息用于规划。在第二阶段,它学习自回归地生成这些视觉思维,并优化它们以用于下游规划。在第三阶段,它学习自适应的模态选择,仅在当前规划步骤有用时才生成视觉思维。

我们在 KitchenWorlds [10] 中的一系列长周期规划任务上评估了 APIVOT。在所有任务族中,APIVOT 显著优于现有方法,包括通用 VLM、基于 VLM 的规划框架和符号规划器。我们的模型实现了 0.419 的平均任务成功率,比表现最好的基线提高了 8.1 个百分点。特别是,APIVOT 在几何约束设置中表现出最大的优势,随着复杂性的增加,差距从 7 个百分点扩大到 17 个百分点。除了提高任务成功率外,我们发现我们的方法以强大的计算效率实现了这些增益。APIVOT 在各种推理预算下始终优于仅基于语言的 VLM。这表明视觉思维为规划提供了一种紧凑、表达力强的表示,捕捉了仅靠语言难以描述或冗长的空间信息。我们进一步分析了 APIVOT 学到的模态选择行为。虽然每一步都使用视觉思维提供了性能的上限,但 APIVOT 在将令牌使用量大幅减少 39% 的同时,保留了 91% 的性能。这种效率增益与我们发现 APIVOT 仅在需要几何精度的步骤上选择性生成视觉思维的结果一致。总之,这些结果表明 APIVOT 学会了为下游规划进行有意义的模态选择。

总之,我们的贡献如下:

• 我们引入了 APIVOT,这是一种基于 VLM 的规划器,它交错语言用于语义推理,并将视觉思维作为想象的未来状态用于内部几何推理。

• 我们提出了一种三阶段训练课程,逐步教会模型在长周期规划过程中对视觉思维进行推理、生成并自适应使用。

• 我们证明,我们的方法在多样化的生态长周期规划任务中提高了任务成功率和效率,优于通用 VLM 和规划框架,并通过自适应模态选择降低了推理成本。

2

第 3 页

2 相关工作

长周期机器人操作的推理。长周期机器人操作需要对符号任务结构和几何可行性进行推理。现有方法大致可分为三类。经典的任务与运动规划 (TAMP) 方法将符号搜索与几何可行性检查或采样相结合 [20–23]。虽然这些方法具有理论依据,但需要手工指定符号抽象和领域模型。相比之下,基于大语言模型 (LLM) 和视觉-语言模型 (VLM) 的规划器利用预训练模型将自然语言指令分解为动作序列、程序或高层计划 [1–8]。这些方法提供了更大的灵活性,但通常主要在语义层面进行推理,生成的计划在语言上看似合理,但在几何上不可行。第三条工作路线通过将 LLM 和 VLM 规划器与外部规划器、验证器或学习到的动力学模型集成,提高了其几何基础 [9–13, 24, 25]。外部模块通过可行性检查和重新规划提供几何反馈,从而改善执行效果,但几何推理仍处于模型自身推理过程之外。我们的工作属于基于 VLM 的规划器这一更广泛的类别,但将几何推理直接集成到规划中。APIVOT 在其自身的推理轨迹中生成视觉思维,在生成计划之前产生想象的未来状态以调节后续决策。通过这种方式,几何推理成为规划的内部组成部分,而非事后验证信号。

多模态推理与视觉-语言-动作模型。虽然先前的规划方法通常通过外部验证器或模拟器引入几何信息,但另一种选择是让规划器本身执行多模态推理。最近的统一多模态模型学习了视觉理解和生成的共享框架 [26–32]。这些模型支持通用视觉生成,但未解决生成应如何引导长周期决策的问题。相关的一条工作研究多模态思维链或潜在视觉推理,其中模型使用中间视觉表示进行推理,而非纯文本推理 [33–42]。这些方法改善了视觉和空间推理,但主要通过对当前观察进行注意力机制、视觉标记、感知细化或静态问题解决来操作 [35–38]。然而,机器人规划需要超越当前图像的推理,以规划场景如何在多个动作下演变。第三条工作路线通过视觉-语言-动作模型和具身基础模型将多模态推理引入机器人领域 [14–19]。这些方法使用视觉中间表示、空间表示或多模态上下文来改善动作生成,但主要针对策略执行而非高层语义规划。相比之下,APIVOT 在高层规划轨迹中使用视觉思维,学习自适应地使用视觉和语言。

自适应且高效的多模态推理。另一条工作路线旨在通过询问模型应分配多少计算量来提高模型的推理效率。一些方法分配不同的思考预算,将推理压缩为潜在令牌,或决定何时需要显式的思维链 [41, 43]。在多模态设置中,相关方法通过使视觉表示更紧凑、使用潜在视觉令牌、专用视觉模块或显式基元(如点和边界框)来降低视觉推理的成本 [36, 37, 39, 40, 42]。在具身设置中,先前的工作通过轻量级训练策略或将中间推理与动作预测交错来提高推理效率 [14, 44]。总体而言,这些方法通过使推理更便宜或更选择性分配来提高效率。

然而,在机器人规划中,效率还取决于哪种表示适合给定的决策。语言对于语义决策(如目标分解、物体选择和前提条件)既高效又具有表现力。视觉思维更适合于关于将物体放入受限空间或评估剩余可用空间的几何推理,但成本也更高 [45–47]。因此,APIVOT 学习自适应的模态选择。它根据规划决策的结构在语言和视觉思维之间进行选择。这使得适应性以任务为基础,在提高性能的同时减少了不必要的视觉推理。

3 视觉-语言自适应规划

在本节中,我们介绍 APIVOT,这是一种基于 VLM 的规划器,它通过在推理轨迹中将语言与视觉思维交错来学习规划,如图 2 所示。我们首先概述问题公式并描述整体规划流程(第 3.1 节)。随后,我们介绍监督微调设置(第 3.2 节)。最后,我们介绍训练

第 4 页

任务:将碗放入冰箱。 真实轨迹: 计划 将碗 放入冰箱。

场景: 余弦 CE 损失 投影 图像 CE 损失 相似度 头 $f$ 编码器 $E$ 损失

物体: 推理步骤 $r_t$ fridge0, bowl1, …

APIVOT

训练 阶段 1 真实 真实 真实 真实 阶段 2 阶段 3 阶段

图 2:APIVOT 生成由交错的语言令牌(黄色)和视觉思维(紫色)组成的推理轨迹,后接一个计划,并通过三阶段监督微调(SFT)课程进行训练。在所有阶段中,我们对参考推理轨迹和计划(蓝色边框)应用教师强制 SFT。阶段 1 教导模型使用在每个推理步骤提供的真实视觉思维进行规划;阶段 2 通过余弦相似度损失将其生成的视觉思维与编码的真实未来观测值对齐,从而训练其自行生成视觉思维;阶段 3 省略了部分参考步骤的视觉思维,教导模型使用视觉思维进行自适应规划。

课程,教导模型自适应地生成视觉思维,并将其与语言结合用于规划(第 3.3 节)。

问题表述。 我们考虑在具有参数化技能的半马尔可夫决策过程(semi-MDP)中的目标条件规划 [48, 20]。环境是一个元组 $(S, A, T)$,其中 $S$ 是状态空间,$A$ 是参数化技能的有限库,$T : S \times A \rightarrow S$ 是由技能执行引起的转移函数。每个技能 $a \in A$ 接受离散的对象参数以及可选的连续参数。在本工作中,我们将 $A$ 实例化为三种技能:open(obj)、pick(obj) 和 place(obj, target, u, v),其中 $(u, v)$ 是图像空间中的放置坐标,利用观测到的深度图像和已知的相机外参将其提升为世界坐标系下的位姿。一个回合由初始状态 $s_0$ 和自然语言目标 $g$ 指定,当达成 $g$ 或达到超时限制时终止。我们假设拥有一个成功演示数据集 $D = \{\tau_i\}_{i=1}^N$,其中每条轨迹 $\tau_i = ((s_{ti}, a_{ti}))_t$ 都标注了每一步应用的技能 $a_{ti}$。 在每个时间步 $t$,规划器观测到当前状态 $s_t$ 的图像观测 $I_t$ 以及检测到的物体列表 $O_t = \{(o_i, [x_{ti}, y_{ti}])\}$,其中 $o_i$ 是物体实例,$[x_{ti}, y_{ti}]$ 是其图像空间位置。检测到的物体作为输入提供,以将规划与感知隔离开来,使模型能够专注于推理和决策。我们在闭环、滚动时域设置 [49] 中执行计划:给定 $(I_t, O_t)$ 和目标 $g$,规划器输出剩余计划 $(a^1_t, \dots, a^N_t)$ 的技能调用序列;第一个技能 $a^1_t$ 应用于环境,状态转移到 $s_{t+1}$,并使用更新后的观测值重新调用规划器。这种设置鼓励模型在整个任务上进行推理,同时在先前动作后将每个决策建立在观测状态之上。

3.1 规划器概述

在推理时,APIVOT 生成多模态推理轨迹和计划。该轨迹交错排列模型对任务分解、动作依赖关系和约束的推理,以及视觉思维。计划指定规划器动作空间 $\mathcal{A}_{plan}$ 中的一系列动作,包括离散基元和放置参数。

多模态推理轨迹。 APIVOT 生成推理轨迹 $R := r_1 \oplus \dots \oplus r_m$,其中 $\oplus$ 表示连接,每个 $r_j$ 是与中间子目标 $\rho_j$ 关联的推理步骤。如图 2 所示,每个步骤由文本令牌 $t_j$ 组成,并可能包含视觉令牌 $v_j$。文本令牌描述子目标 $\rho_j$,包括要交互的物体、其在推进任务中的作用以及相关语义或几何约束。当可视化未来场景有助于验证子目标的可行性时,模型会生成一段视觉令牌 $v_j$,我们称之为视觉思维。否则,$v_j = \emptyset$。这种形式支持自适应多模态推理。模型可以依赖语言进行语义推理,并在需要时引入视觉思维。

4

第 5 页

视觉思维。视觉思维在轨迹中被实例化为一个固定长度为 $K$ 的视觉令牌序列,由特殊的开始和结束令牌界定:<|image_start|> <|image_pad|> $K$ <|image_end|>。这些离散令牌指示视觉思维在自回归序列中的位置,而解码器在 $K$ 个视觉令牌处的隐藏状态编码了其视觉内容。我们将这些隐藏状态表示为潜在视觉状态 $H_j \in \mathbb{R}^{K \times d}$,其中 $d$ 是 VLM 的隐藏维度。由于 $H_j$ 保留在自回归上下文中,后续令牌可以在下游推理和计划生成过程中关注这一预测的未来状态表示。

行动计划。基于推理轨迹,模型输出一个计划 $(a_1, \dots, a_n)$,其中每个 $a_i \in \mathcal{A}_{\text{plan}}$ 指定一个离散原语(如打开、拾取或放置),以及任何所需的放置参数。从概念上讲,轨迹的语言部分支持离散动作选择,而视觉思维编码用于定位放置参数的空间上下文。

3.2 来自参考输出的监督

我们从预训练的 VLM 初始化 APIVOT,该模型可以处理视觉输入并进行基于文本的推理,但不能生成或使用视觉思维进行规划。为了有效规划,我们在源自成功演示的参考输出上进行监督微调(SFT)。每个参考输出由多模态推理轨迹和计划组成,并附带真实图像。

参考输出构建。我们通过将每个演示 $\tau \in \mathcal{D}$ 分解为一系列子目标来构建参考输出。连续的拾取/放置技能调用被配对,每个子目标都标注了三个标签:约束类型、模态标签和目的。约束类型捕捉所需的推理类型,而模态标签指定参考轨迹是仅通过文本解决还是包含视觉思维。具体而言,我们定义三种约束类型:符号前提条件,其中决策与连续参数无关(例如,打开冰箱);当前几何约束,其中参数受当前场景限制(例如,接近装满的冰箱中的大碗);以及未来几何可行性,其中参数在局部不受限制,但决定了后续子目标是否保持可行(例如,放置一个小碗以便稍后能放入一个更大的碗)。后两者涉及连续参数,并包括高级计划的贪婪细化可能失败以及向下可细化性可能崩溃的情况 [20]。我们通过计算深度和相机外参上的几何指标(包括表面积、物体足迹和自由空间余量)来确定约束类型,并通过阈值化所得的紧密度将其映射到模态标签:符号前提条件步骤仅使用文本,而几何步骤在紧密度超过阈值时获得视觉思维。我们还为每个子目标标记一个目的,例如推进任务、满足前提条件或清除障碍物。

然后,我们将标注好的子目标组装成一个结构化骨架,并提示一个高容量语言模型将其扩展为自然语言推理轨迹。我们指示它保留骨架的结构,同时添加关于任务分解、子目标选择和接近目标的连接性推理。将扩展条件设定为子目标和注释,使轨迹扎根于与规划相关的物理约束,而非通用合理化,同时仍匹配 VLM 的自然推理风格。对于每个标记为包含视觉思维的推理步骤,我们在该步骤的文本组件之后插入离散视觉令牌序列。我们还在相应的子目标达成后附加环境的目标未来 RGB 观测。该图像提供了监督信号,用于将视觉思维与该轨迹点处的真实未来状态对齐。使用此过程,我们构建了具有不同模态标注策略的 SFT 数据集,以诱导不同的行为,例如在每个步骤使用视觉思维或自适应使用。更多细节和推理轨迹示例见附录 A.2。

视觉对齐。为了监督 VLM 的潜在视觉状态,我们将它们与通过冻结视觉编码器 $E$ 编码相应真实图像获得的特征进行对齐。我们使用预训练 VLM 自身的视觉编码器,以鼓励视觉思维位于模型的视觉特征空间内。令 $I_{\text{gt}, j}$ 为第 $j$ 个视觉思维的真实 RGB 图像。我们用 $E$ 编码 $I_{\text{gt}, j}$ 并沿补丁维度对所得补丁特征进行平均池化,得到 $K$ 个目标特征:$Z_{\text{gt}, j} = \text{AvgPool}(E(I_{\text{gt}, j})) \in \mathbb{R}^{K \times d_E}$,其中 $d_E$ 是 $E$ 的特征维度。然后,我们使用学习到的投影头 $f_\phi : \mathbb{R}^d \to \mathbb{R}^{d_E}$ 将每个潜在视觉状态 $H_j$ 投影到编码器特征空间中,得到 $Z_j = f_\phi(H_j)$。最后,我们对投影后的潜在状态应用余弦相似度损失:$\mathcal{L}_{\text{vis}} = \frac{1}{|\mathcal{B}_{\text{vis}}|} \sum_{j \in \mathcal{B}_{\text{vis}}} 1 – \cos(Z_j, Z_{\text{gt}, j})$,其中 $\mathcal{B}_{\text{vis}}$ 是批次中的视觉思维集合。

5

第 6 页

训练目标。在各个阶段,我们优化一个包含三个组成部分的训练目标: $L_{total} = L_{CE,plan} + \lambda_{CE,trace}L_{CE,trace} + \lambda_{vis}L_{vis}$,其中 $\lambda_{CE,trace}$ 和 $\lambda_{vis}$ 是控制损失组件权重的超参数。此处,$L_{CE,trace}$ 和 $L_{CE,plan}$ 分别是针对多模态推理轨迹和计划中的令牌计算的交叉熵损失。$L_{CE,trace}$ 损失监督推理轨迹的结构和内容,包括视觉思维(Visual Thoughts)的语法,而 $L_{CE,plan}$ 训练模型在给定推理轨迹的条件下生成成功的计划。同时,视觉损失 $L_{vis}$ 将潜在视觉状态与目标场景内容对齐。

3.3 训练课程

我们的三阶段训练课程教导模型如何:1) 使用视觉思维作为规划的中间上下文,2) 在内部生成它们,以及 3) 判断何时使用它们是有用的。

阶段 1:视觉思维理解。第一阶段教导模型使用视觉思维来指导规划。为了将这种能力与视觉思维生成和模态选择隔离开来,我们在每个推理步骤都包含视觉思维的轨迹上进行训练,并直接向模型提供目标潜在视觉状态。具体而言,我们在所有视觉令牌位置将相应的真实视觉特征注入解码器输入,为生成后续的推理和行动提供上下文。由于提供了潜在视觉状态,我们禁用了视觉对齐损失,仅监督离散输出令牌。通过这种方式,模型学习生成参考推理文本,并有效地将规划建立在提供的视觉状态之上。

阶段 2:视觉思维生成。第二阶段教导模型自行生成视觉思维。与阶段 1 一样,每个推理步骤都包含一个视觉思维,以便模型学习视觉思维生成的机制,而无需决定何时需要它们。模型不再注入真实嵌入,而是必须在视觉占位符位置生成自己的潜在视觉状态。我们通过设置 $\lambda_{vis} > 0$ 来优化所有损失组件,鼓励模型生成视觉令牌,并使潜在视觉状态编码目标场景上下文。

阶段 3:自适应模态选择。最后阶段教导模型为每个子目标决定合适的推理模态,并仅在有用时生成视觉思维。我们在具有自适应模态选择的推理轨迹上进行训练,其中视觉思维仅针对从几何 grounding 中受益的子目标生成。我们基于模拟器衍生的几何启发式方法分配模态标签,这些启发式方法识别受限于有限自由空间、碰撞敏感放置或下游可行性依赖关系的子目标。在此阶段,我们包含所有训练损失组件。轨迹交叉熵损失监督何时使用视觉思维,而视觉对齐和计划交叉熵损失分别保留潜在视觉状态生成和下游规划行为。这些损失共同鼓励模型保留使用视觉思维进行规划的优势,同时学习有选择地发出它们,以减少不必要的推理成本。

4 实验

我们的实验旨在解决两个主要问题。首先,我们评估 APIVOT 是否提高了长视界(long-horizon)规划性能,并进一步分析这些增益产生的时机。其次,我们理解 APIVOT 在多大程度上展示了有意义的自适应模态选择行为。

4.1 实验设置 任务。我们设计了一系列长视界厨房任务,这些任务要求对语义和几何约束进行联合推理。这些任务系统地变化语义目标、几何约束及其组合,从而在需要精确几何推理的设置中实现受控评估。该套件包含三个任务家族:CONTAINMENT(容纳)、SORTING(分类)和 STORING LEFTOVERS(存放剩余物)。CONTAINMENT 涉及将物体放入受限的存储空间,需要推理语义前提条件和有限的自由空间。SORTING 涉及按类型将物体分配给容器,通常在限制可行分配的容量约束下进行。STORING LEFTOVERS 将这些组合成更长的视界任务,先进行分类,然后放入共享的受限空间。我们在 CONTAINMENT 和 SORTING 上进行训练,并保留 STORING LEFTOVERS 用于评估迁移和组合泛化能力。示例见附录 A.1。

我们在 KitchenWorlds [10] 模拟器中生成所有数据。我们的流水线采样具有不同场景布局和物体配置的多样化任务实例,产生从简单到复杂

第 7 页

初始状态 APIVOT 基线 将所有碗放入 将锅放在台面上 将碗移到旁边 将碗放入冰箱 将碗放入冰箱 将碗放入冰箱 迷你冰箱中。 移除 创建 障碍物 空间 …

3 个碗 2 个干扰项

几何约束 重新排列物体以创建自由空间 成功,因为 立即放置 碰撞,因为

初始状态 APIVOT 基线 按类型对食物进行分类 将土豆1放入炖锅1 将土豆2放入炖锅2 将卷心菜3放入炖锅2 将卷心菜3放入炖锅1 将土豆2放入炖锅2 放入炖锅中。

… …

2 个土豆 3 个卷心菜 仅 1 种可行分配 正确分配:土豆 à 炖锅1(大) 成功,因为 错误分配 碰撞,因为

图 3:我们展示了 APIVOT 和表现最佳的基线在每个任务上的执行轨迹: CONTAINMENT(顶部)和 SORTING(底部)。

从拥有充足自由空间的情况到更难的情况,例如需要打开门、移除障碍物或在狭窄空间下仔细排列物体。对于每个任务实例,我们使用 PDDLStream [21] 生成成功轨迹并合成相应的参考输出。我们在每个训练任务上使用 2,000 个示例进行训练,并在每个训练任务的保留数据集以及保留任务上进行评估,每个数据集包含 100 个示例。其他数据集细节见附录 A.2。

我们在滚动时域设置下评估方法,该方法可访问原语动作的共享库。我们的主要指标是任务成功率,定义为成功完成的回合比例。为了衡量基于 VLM 方法的推理成本,我们报告令牌使用量,计算方式为推理轨迹中的令牌数量。对于扩展思考型 VLM,我们包括内部推理令牌。

模型实现。APIVOT 基于 Qwen3-VL-8B-Instruct [26] 初始化,并使用应用于注意力层和 MLP 投影的 LoRA 进行微调。完整细节见附录 B。

基线。我们将 APIVOT 与三类规划器进行比较:通用 VLM、基于 VLM 的规划器和符号规划器。对于通用 VLM,我们使用 Gemini-3.1-Pro、Gemini-ER-1.5 [27]、Qwen3-VL-8B-Instruct(APIVOT 的基础模型)和 Qwen3-VL-8B-Thinking。我们为 Gemini-3.1-Pro、Gemini-ER-1.5 和 Qwen3-VL-8B-Thinking 启用了扩展思考功能。此外,我们选择 VLM-TAMP [10] 和 Reflect-VLM [13] 作为基于 VLM 的规划器的代表,并选择 FastDownward [23] 作为符号规划器。由于 FastDownward 假设可以访问符号状态,我们根据 BLADE [50] 从视觉输入和语言中推断出符号状态并提供给它,以确保公平比较。更多实现细节见附录 C。

4.2 任务规划性能 表 1:各任务族的规划性能。 整体性能。在表 1 中,我们 模型 平均 CONTAIN SORT STORE 将 APIVOT 与先前工作进行比较, VLM 基线 涵盖训练任务族和保留任务族。我们将先前方 Gemini-3.1-Pro 0.245 0.281 0.241 0.213 法分为通用 VLM 基线和规划基线。APIVOT 取得了 Gemini-ER-1.5 0.338 0.364 0.339 0.311 最高的平均任务成功率 0.419。与表现最佳的 Qwen3-VL-8B-Instruct 0.188 0.218 0.183 0.162 VLM 基线 Gemini-ER-1.5 相比,APIVOT 提高了 Qwen3-VL-8B-Thinking 0.232 0.259 0.234 0.204 8.1 个百分点,这表明更强的基于语言的预训练推理 规划基线 对于这些任务是不够的。与最强的规划基线 VLM-TAMP 相 FastDownward 0.272 0.331 0.247 0.238 Reflect-VLM 0.292 0.348 0.272 0.257 比,APIVOT 的成功率提高了 9.0 个百分点。我们假设这些 VLM-TAMP 0.329 0.370 0.311 0.307 提升来自于在规划过程中整合语义和几何推理,使空间约束 APIVOT (Ours) 0.419 0.472 0.421 0.365 能够塑造后续决策。这些提升在两个训练任务中均保持一致, APIVOT 在 CONTAINMENT 任务上比先前工作高出 10.2 个百分点,在 SORTING 任务上高出 8.2 个百分点。值得注意的是,APIVOT 在 STORING LEFTOVERS(一个结合了两个训练任务的保留组合任务)上也取得了 5.4 个百分点的提升。这一结果表明,APIVOT 学习到的规划策略可以迁移到语义和几何约束的新颖组合中。在附录 D.1 中,我们

7

第 8 页

在具有更长任务视界和更高复杂度的分布外设置下进行评估,发现我们的模型仍保持竞争力。

几何复杂度增加下的性能。为了理解这些增益的来源,图 4 根据几何复杂度分解了任务成功率。由于所有任务族都需要将物体放置到目标区域,我们使用占用率(Occupancy Ratio)来衡量这一指标,定义为任务相关物体总面积与目标区域可用面积之比。

我们将 APIVOT 与最强的代表性 VLM 基线 Gemini-ER-1.5 以及所有规划基线进行比较。在低占用率设置下,任务约束较少,所有方法均取得较高的成功率。然而,随着占用率的增加,任务需要更精确的放置,所有方法的表现均下降。值得注意的是,尽管基线性能在这些条件下显著下降,APIVOT 仍保持相对稳健,随着占用率的增加,其优势从 0.07 扩大到 0.17 个百分点。图 3 说明了这一优势:在 CONTAINMENT 任务中,APIVOT 预判到在没有更多空闲空间的情况下无法放置最后的碗。因此,它首先重新排列现有物体,从而实现成功。相比之下,Gemini-ER-1.5 输出一个符号上有效的计划,但直接放置物体,导致碰撞。更多示例见附录 E.1。

推理预算下的性能。为了评估视觉思维(Visual Thoughts)是否比语言更有效地编码空间信息,我们在匹配的推理令牌最大预算下将 APIVOT 与 VLM 基线进行比较(图 5)。APIVOT 在这些设置下始终优于所有基线,在低和中度令牌预算下增益最大。虽然增加令牌分配提高了某些推理密集型基线的性能,但即使在更大的规模下,它们的性能仍低于 APIVOT。这表明视觉思维为规划提供了更高效的令牌表示。APIVOT 不依赖冗长的语言轨迹来描述空间配置,而是通过视觉思维直接且紧凑地编码这些信息。

视觉思维的作用。为了隔离视觉思维的贡献,我们使用标准 SFT 训练了我们方法的纯文本变体,其中推理轨迹仅使用语言。这种消融实验控制了改进是仅来自领域特定的 SFT,还是来自以视觉方式表示中间未来状态的能力。在所有任务中,基础模型的平均成功率为 0.18,而纯文本微调变体仅显示出有限的改进,达到 0.24(附录 D.2)。相比之下,APIVOT 达到 0.42,表明虽然领域特定的 SFT 有益,但 APIVOT 更大的增益来自其对视觉思维的使用。附录 D.4 中的其他推理轨迹模态消融进一步解耦了模态选择的影响。

4.3 自适应模态选择行为

有效的模态选择。为了评估自适应模态选择的好处,我们将我们的方法(Adaptive)与两种推理时的消融方法进行比较:纯文本推理(No-Image)和每一步都使用视觉思维(Always-Image)。如图 6 所示,Always-Image 实现了最高的任务成功率,但由于每一步都使用视觉思维,导致令牌使用量更高。相比之下,APIVOT 保留了 Always-Image 91% 的性能,同时将令牌使用量大幅减少了 39%,使其在性能-效率权衡曲线上处于有利位置。

第 9 页

初始状态 步骤 1:我正在将 步骤 2:我现在将 步骤 3:……由于第二个 步骤 4:通过回顾 步骤 5:……我必须 番茄放入第一个炖锅…… 西葫芦放入第二个炖锅…… 西葫芦很长,我必须小心 动作后的图像, 精确以确保炖锅放置 并精确放置它 我可以验证西葫芦是否 无碰撞。 冰箱 <IMAGE_START>… 移动炖锅…… <IMAGE_START>… 2 个干扰项

成功

1 个番茄, 2 个西葫芦

图 8:在保留的“储存剩菜”任务上的自适应推理行为。APIVOT 通过语言推理进行语义决策,例如食物与容器的分配,同时为对几何敏感的步骤(如无碰撞的西葫芦放置和最终冰箱存储)选择性生成视觉思维。这表明 APIVOT 在需要空间精度时调用视觉推理,而不是均匀地使用视觉思维。

前沿。与基线相比,APIVOT 也位于权衡曲线的高成功率、低成本区域。通过选择性使用视觉思维,APIVOT 避免了不必要的推理,同时保持了其对规划的好处。

约束感知的模态选择。除了对效率的影响外,我们还考察了 APIVOT 对视觉思维的选择性使用是否反映了有意义的模态选择行为。我们分析模型的推理轨迹,以查看它是否根据在每个推理步骤中识别出的约束系统地使用视觉思维。对于不同类型的约束,图 7 报告了 APIVOT 将步骤识别为涉及该约束的频率(蓝色),以及在那些步骤中生成视觉思维的频率(绿色)。当我们的模型确定某个步骤不需要几何推理(例如,无约束、语义前置条件)时,它不会产生视觉思维。另一方面,它在涉及有限自由空间的步骤中使用了 48.4% 的视觉思维,在涉及下游可行性约束的步骤中使用了 56.2% 的视觉思维。我们在图 8 中看到了这种自适应推理的一个例子。这表明 APIVOT 已经学会了根据精度重要的时刻选择性使用视觉思维,而不是均匀地应用它们。

5 结论

我们提出了 APIVOT,这是一种基于 VLM 的规划器,它学习利用交错的语言和视觉思维进行长视界任务规划。我们的结果表明,引入视觉思维提高了规划性能,在空间受限的设置中提升最大。除了提高成功率外,我们的模型还学习了有意义的模态选择行为,选择用语言推理语义任务结构,并在几何精度有用时使用视觉推理。通过这种自适应策略,APIVOT 在保持效率的同时实现了显著的性能提升,证明了学习以正确的模态进行推理对于有效的多模态规划至关重要。

局限性。首先,我们的实验是在 KitchenWorlds 模拟器中进行的。虽然任务套件捕捉了符号和几何规划挑战的生态范围,但在更具视觉真实感的模拟器或现实世界设置中对其进行评估仍然是一个重要的下一步。其次,我们学习的潜在视觉表示是在我们的任务分布内训练的,可能无法捕捉现实世界几何形状和外观的全部变异性。将视觉预训练扩展到更大的现实世界数据集,或利用统一文本和图像生成模型的进展,可以进一步提高性能和泛化能力。第三,自适应模态选择是通过监督微调(SFT)学习的,而不是针对任务成功进行显式优化。虽然我们的模型已经表现出语义上有意义的图像使用,但强化学习或测试时适应以优化任务成功的抽象选择可能会产生更稳健的策略。最后,我们的框架在文本和潜在图像上进行推理。将其扩展到包括其他表示(例如点或边界框)是一个自然的方向,使其能够在更多抽象级别上进行推理,从而提高规划性能和效率。

9

第 10 页

致谢

本工作得到了美国空军科学研究办公室(Air Force Office of Scientific Research)资助项目 FA9550-25-C-B010 以及斯坦福以人为本的人工智能研究所(Stanford Human-Centered AI Institute)Hoffman-Yee 资助计划的支持。

参考文献

[1] Michael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J. Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, and Andy Zeng. Do As I Can, Not As I Say: Grounding Language in Robotic Affordances, August 2022. arXiv:2204.01691 [cs].

[2] Wenlong Huang, Pieter Abbeel, Deepak Pathak, and Igor Mordatch. Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents, March 2022. arXiv:2201.07207 [cs].

[3] Wenlong Huang, Fei Xia, Ted Xiao, Harris Chan, Jacky Liang, Pete Florence, Andy Zeng, Jonathan Tompson, Igor Mordatch, Yevgen Chebotar, Pierre Sermanet, Noah Brown, Tomas Jackson, Linda Luu, Sergey Levine, Karol Hausman, and Brian Ichter. Inner Monologue: Embodied Reasoning through Planning with Language Models, July 2022. arXiv:2207.05608 [cs].

[4] Bo Liu, Yuqian Jiang, Xiaohan Zhang, Qiang Liu, Shiqi Zhang, Joydeep Biswas, and Peter Stone. LLM+P: Empowering Large Language Models with Optimal Planning Proficiency, September 2023. arXiv:2304.11477 [cs].

[5] Ishika Singh, Valts Blukis, Arsalan Mousavian, Ankit Goyal, Danfei Xu, Jonathan Tremblay, Dieter Fox, Jesse Thomason, and Animesh Garg. Progprompt: Program generation for situated robot task planning using large language models. Autonomous Robots, 47(8):999–1012, 2023.

[6] Jacky Liang, Wenlong Huang, Fei Xia, Peng Xu, Karol Hausman, Brian Ichter, Pete Florence, and Andy Zeng. Code as policies: Language model programs for embodied control. In 2023 IEEE International conference on robotics and automation (ICRA), pages 9493–9500. IEEE, 2023.

[7] Chan Hee Song, Jiaman Wu, Clayton Washington, Brian M Sadler, Wei-Lun Chao, and Yu Su. Llm-planner: Few-shot grounded planning for embodied agents with large language models. In Proceedings of the IEEE/CVF international conference on computer vision, pages 2998–3009, 2023.

[8] Zhenyu Wu, Ziwei Wang, Xiuwei Xu, Jiwen Lu, and Haibin Yan. Embodied task planning with large language models. arXiv preprint arXiv:2307.01848, 2023.

[9] Frank Joublin, Antonello Ceravola, Pavel Smirnov, Felix Ocker, Joerg Deigmoeller, Anna Belardinelli, Chao Wang, Stephan Hasler, Daniel Tanneberg, and Michael Gienger. CoPAL: Corrective Planning of Robot Actions with Large Language Models. In 2024 IEEE International Conference on Robotics and Automation (ICRA), pages 8664–8670, May 2024.

[10] Zhutian Yang, Caelan Garrett, Dieter Fox, Tomás Lozano-Pérez, and Leslie Pack Kaelbling. Guiding Long-Horizon Task and Motion Planning with Vision Language Models, October 2024. arXiv:2410.02193 [cs].

[11] Shu Wang, Muzhi Han, Ziyuan Jiao, Zeyu Zhang, Ying Nian Wu, Song-Chun Zhu, and Hangxin Liu. LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning, August 2024. arXiv:2403.11552 [cs].

10

第 11 页

[12] Marta Skreta, Zihan Zhou, Jia Lin Yuan, Kourosh Darvish, Alán Aspuru-Guzik, 和 Animesh Garg。RePLan: 基于感知与语言模型的机器人重规划,2024年2月。arXiv:2401.04157 [cs]。

[13] Yunhai Feng, Jiaming Han, Zhuoran Yang, Xiangyu Yue, Sergey Levine, 和 Jianlan Luo。Reflective Planning: 用于多阶段长视界机器人操作的视觉-语言模型,2025年2月。arXiv:2502.16707 [cs]。

[14] Michał Zawalski, William Chen, Karl Pertsch, Oier Mees, Chelsea Finn, 和 Sergey Levine。基于具身思维链推理的机器人控制,2025年3月。arXiv:2407.08693 [cs]。

[15] Qingqing Zhao, Yao Lu, Moo Jin Kim, Zipeng Fu, Zhuoyang Zhang, Yecheng Wu, Zhaoshuo Li, Qianli Ma, Song Han, Chelsea Finn, Ankur Handa, Ming-Yu Liu, Donglai Xiang, Gordon Wetzstein, 和 Tsung-Yi Lin。CoT-VLA: 视觉-语言-动作模型的视觉思维链推理,2025年3月。arXiv:2503.22020 [cs]。

[16] Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu Sun, Kun Feng, Qingzhou Lu, Sheng Chen, Yangang Zhang, Wei Li, 和 Jianyu Chen。BagelVLA: 通过交错的视觉-语言-动作生成增强长视界操作,2026年2月。arXiv:2602.09849 [cs.RO]。

[17] Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, 和 Xuelong Li。EO-1: 用于通用机器人控制的开放统一具身基础模型,2025年8月。arXiv:2508.21112 [cs.RO]。

[18] Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, 和 Jianye Hao。从看到做:弥合机器人操作的推理与决策,2025年5月。arXiv:2505.08548 [cs.RO]。

[19] Physical Intelligence, Bo Ai, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Greg Balke, Kevin Black, George Bokinsky, Shihao Cao, Thomas Charbonnier, Vedant Choudhary, Foster Collins, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Maitrayee Dhaka, Jared DiCarlo, Danny Driess, 等。π0.7: 一种具有涌现能力的可 steer 通用机器人基础模型,2026年4月。arXiv:2604.15483 [cs.LG]。

[20] Caelan Reed Garrett, Rohan Chitnis, Rachel Holladay, Beomjoon Kim, Tom Silver, Leslie Pack Kaelbling, 和 Tomás Lozano-Pérez。集成任务与运动规划。Annual Review of Control, Robotics, and Autonomous Systems, 4(1):265–293, 2021年5月。

[21] Caelan Reed Garrett, Tomás Lozano-Pérez, 和 Leslie Pack Kaelbling。PDDLStream: 通过乐观自适应规划集成符号规划器与黑盒采样器,2020年3月。arXiv:1802.08705 [cs]。

[22] Constructions Aeronautiques, Adele Howe, Craig Knoblock, ISI Drew McDermott, Ashwin Ram, Manuela Veloso, Daniel Weld, David Wilkins Sri, Anthony Barrett, Dave Christianson, 等。Pddl——规划域定义语言。技术报告,Tech. Rep., 1998年。

[23] M. Helmert。Fast Downward 规划系统。Journal of Artificial Intelligence Research, 26:191–246, 2006年7月。arXiv:1109.6051 [cs]。

[24] Yiqing Xu, Jiayuan Mao, Linfeng Li, Yilun Du, Tomas Lozáno-Pérez, Leslie Pack Kaelbling, 和 David Hsu。“set it up”: 使用组合生成模型进行功能性物体排列。The International Journal of Robotics Research, page 02783649251378198, 2024年。

[25] Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, 和 Zachary Kingston。使用 VLM 推理约束任务与运动规划,2026年3月。arXiv:2510.25548 [cs]。

[26] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin

11

第 12 页

Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, and Ke Zhu. Qwen3-VL Technical Report, November 2025. arXiv:2511.21631 [cs].

[27] Gemini Robotics ER 1.6 Model Card.

[28] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, and Haoqi Fan. Emerging properties in unified multimodal pretraining, 2025. arXiv:2505.14683 [cs.CV].

[29] Jinheng Xie, Zhenheng Yang, and Mike Zheng Shou. Show-o2: Improved native unified multimodal models, 2025. arXiv:2506.15564 [cs.CV].

[30] Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, and Yuren Cong. TUNA: Taming unified visual representations for native unified multimodal models, 2025. arXiv:2512.02014 [cs.CV].

[31] Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, and Yuren Cong. Tuna-2: Pixel embeddings beat vision encoders for multimodal understanding and generation, April 2026. arXiv:2604.24763 [cs.CV].

[32] Shengbang Tong, David Fan, John Nguyen, Ellis Brown, Gaoyue Zhou, Shengyi Qian, Boyang Zheng, Théophane Vallaeys, Junlin Han, Rob Fergus, Naila Murray, Marjan Ghazvininejad, Mike Lewis, Nicolas Ballas, Amir Bar, Michael Rabbat, Jakob Verbeek, Luke Zettlemoyer, Koustuv Sinha, Yann LeCun, and Saining Xie. Beyond language modeling: An exploration of multimodal pretraining, March 2026. arXiv:2603.03276 [cs.CV].

[33] Zhaochen Su, Peng Xia, Hangyu Guo, Zhenhua Liu, Yan Ma, Xiaoye Qu, Jiaqi Liu, Yanshu Li, Kaide Zeng, Zhengyuan Yang, Linjie Li, Yu Cheng, Heng Ji, Junxian He, and Yi R. Fung. Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers, July 2025. arXiv:2506.23918 [cs].

[34] Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, Tom Goldstein, and Micah Goldblum. Zebra-CoT: A dataset for interleaved vision language reasoning, July 2025. arXiv:2507.16746 [cs.CV].

[35] Chengzu Li, Wenshan Wu, Huanyu Zhang, Yan Xia, Shaoguang Mao, Li Dong, Ivan Vuli´c, and Furu Wei. Imagine while Reasoning in Space: Multimodal Visualization-of-Thought, January 2025. arXiv:2501.07542 [cs].

[36] Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, and Xudong Wang. Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens, November 2025. arXiv:2511.19418 [cs].

[37] Zeyuan Yang, Xueyang Yu, Delin Chen, Maohao Shen, and Chuang Gan. Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens, June 2025. arXiv:2506.17218 [cs].

[38] Jiawei Gu, Yunzhuo Hao, Huichen Will Wang, Linjie Li, Michael Qizhe Shieh, Yejin Choi, Ranjay Krishna, and Yu Cheng. ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning, February 2026. arXiv:2510.27492 [cs].

[39] Zixian Ma, Jianguo Zhang, Zhiwei Liu, Jieyu Zhang, Juntao Tan, Manli Shu, Juan Carlos Niebles, Shelby Heinecke, Huan Wang, Caiming Xiong, Ranjay Krishna, and Silvio Savarese. LATTE: Learning to Think with Vision Specialists, September 2025. arXiv:2412.05479 [cs].

12

第 13 页

[40] Haozhe Wang, Alex Su, Weiming Ren, Fangzhen Lin, 和 Wenhu Chen。Pixel Reasoner: 通过好奇心驱动的强化学习激励像素空间推理,2025年10月。arXiv:2505.15966 [cs]。

[41] Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, 和 Wen-Sheng Chu。Mull-tokens: 模态无关的潜在思维,2025。arXiv:2512.10941 [cs.CV]。

[42] Ruijie Lu, Yiyang Ma, Xiaokang Chen, Lingxiao Luo, Zhiyu Wu, Zizheng Pan, Xingchao Liu, Yutong Lin, Hao Li, Wen Liu, Zhewen Hao, Xi Gao, Shaoheng Nie, Yixuan Wei, Zhenda Xie, Ting Chen, 和 Gang Zeng。Thinking with visual primitives, 2026。技术报告。

[43] Chenwei Lou, Zewei Sun, Xinnian Liang, Meng Qu, Wei Shen, Wenqi Wang, Yuntao Li, Qingping Yang, 和 Shuangzhi Wu。AdaCoT: 通过强化学习实现帕累托最优的自适应思维链触发,2025。arXiv:2505.11896 [cs.LG]。

[44] William Chen, Suneel Belkhale, Suvir Mirchandani, Oier Mees, Danny Driess, Karl Pertsch, 和 Sergey Levine。高效具身推理的训练策略,2025。arXiv:2505.08243 [cs.RO]。

[45] Freda Shi, Xinyun Chen, Kanishka Misra, Nathan Scales, David Dohan, Ed Chi, Nathanael Schärli, 和 Denny Zhou。大型语言模型容易受到无关上下文的干扰,2023年6月。arXiv:2302.00093 [cs]。

[46] Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, 和 Percy Liang。迷失在中间:语言模型如何使用长上下文,2023年11月。arXiv:2307.03172 [cs]。

[47] Siye Wu, Jian Xie, Jiangjie Chen, Tinghui Zhu, Kai Zhang, 和 Yanghua Xiao。无关输入在多大程度上会扭曲大型语言模型的响应?,2024年9月。arXiv:2404.03302 [cs]。

[48] Richard S Sutton, Doina Precup, 和 Satinder Singh。在MDP和半MDP之间:强化学习中时间抽象的框架。Artificial intelligence, 112(1-2):181–211, 1999。

[49] David Q Mayne, James B Rawlings, Christopher V Rao, 和 Pierre OM Scokaert。约束模型预测控制:稳定性和最优性。Automatica, 36(6):789–814, 2000。

[50] Weiyu Liu, Neil Nie, Ruohan Zhang, Jiayuan Mao, 和 Jiajun Wu。从演示和语言中学习组合行为。In 8th Annual Conference on Robot Learning, 2024。

13

第 14 页

APIVOT 补充材料:Adaptive Planning with Interleaved Vision-Language Thoughts

附录组织如下:在附录 A 中,我们包含任务套件和数据生成管道的详细信息。在附录 B 中,我们描述了模型的实现,包括训练和计算细节。在附录 C 中,我们提供了基线方法和评估协议的详细信息。此外,我们在附录 D 和附录 E 中提供了额外的实验结果和分析。

A 任务套件与数据集

本节描述任务套件和数据生成管道,包括场景采样、参考计划构建和推理轨迹生成。随后,我们提供训练数据的示例。最后,我们提供数据集的统计信息。

A.1 任务套件

我们定义了三个任务家族:CONTAINMENT(容纳)、SORTING(分类)和 STORING LEFTOVERS(存放剩余物),如图 9 所示。这些家族测试不同约束的组合,包括语义前提条件、遮挡处理以及在有限自由空间下的几何放置。

A.1.1 CONTAINMENT。

目标。 该任务的目标是将一组目标物体(例如碗)放置到一个区域(例如冰箱或橱柜)中。场景初始化时,所有目标物体均可见地放置在台面上,而目标区域的可访问性、遮挡情况和可用自由空间可能各不相同。

核心挑战。 核心挑战包括识别语义前提条件(例如门是打开的)、解决几何约束(例如移除干扰物体以为目标物体腾出空间),以及在几何受限的情况下进行精确规划(例如精确的目标物体放置)。因此,更难的实例需要推理可访问性、遮挡情况和放置可行性。

变体。 我们改变目标物体的数量和大小、容器的门状态、目标区域是空的还是被遮挡、干扰物体的数量以及可用自由空间的数量。这产生了从具有充足空间的简单开放容器案例到需要前置动作、障碍物移除和精确放置的受限案例的各种实例。

A.1.2 SORTING。

目标。 目标是将一组食物物体按类型分类到单独的目标容器中。每个实例包含两种食物类型(例如西葫芦和番茄)和两个容器(例如炖锅),机器人必须将每种类型的所有物体放入单独的容器中。场景初始化时,所有目标物体和容器均可见地放置在台面上,因此核心挑战是在容量约束下的语义分配。

核心挑战。 食物类型到容器的有效分配取决于物体几何形状和容器容量。为了验证分配是否有效,我们在模拟器中采样放置位置,以检查所有物体是否都能无碰撞地放置在其分配的容器中。我们定义两种分配模式:both-valid(两者均有效)和 one-valid(仅一个有效)。在 both-valid 模式下,任一类型都可以放入任一容器。在 one-valid 模式下,一种类型超过了较小容器的容量,只有一种分配成功,这需要从食物类型到容器的唯一映射。因此,更难的实例不能仅通过语义分组来解决。它们要求规划器基于容量和放置可行性执行分配。

变体。 为了引发这些挑战,我们改变每种物体的数量和大小以及容器的相对容量。这产生了两种模式的样本,其分配在视觉上的明显程度各不相同。

14

第 15 页

包含:将所有碗放入迷你冰箱中。

分类:按类型将食物分类到炖锅中。

储存剩菜:按类型将食物分类到炖锅中,并将其存入迷你冰箱。

图 9:KitchenWorlds 任务套件,复杂度递增。CONTAINMENT(上图)要求将目标物体放置在受限的存储区域中,测试可达性、障碍物处理以及自由空间推理。SORTING(中图)要求对物体类型进行语义推理,以将食物物体分配到容器中,而容量约束使得某些分配在几何上不可行。STORING LEFTOVERS(下图)将这两种挑战组合成一个更长视野的保留任务,要求机器人将食物分类到容器中,然后将它们存储在受限的冰箱中。

A.1.3 储存剩菜。

目标。目标是通过先将食物物体分类到容器中,然后将容器放入冰箱,来储存一组食物作为剩菜。每个实例包含两种食物类型、两个容器(例如,炖锅)和一个迷你冰箱。机器人必须将每种食物类型的所有物体放入单独的容器中,然后将装满的容器存储在冰箱中。此任务结合了 SORTING 中的基于容量的分配挑战以及 CONTAINMENT 中的访问和自由空间约束。我们将此任务家族从训练中排除,以评估模型是否能够将组件家族泛化到新的组合任务中。

核心挑战。有效的计划取决于食物到容器的分配以及将 resulting 容器存储在冰箱中的可行性。与 Sorting 类似,食物类型到容器的分配可能取决于物体几何形状和容器容量。此外,最终的冰箱放置可能需要打开冰箱、清除障碍物并在有限的自由空间内排列容器。因此,更难的实例需要推理早期的分配和放置决策如何影响下游存储的可行性。

变化。与 SORTING 和 CONTAINMENT 任务一样,我们改变食物物体的数量和大小、容器的相对容量、冰箱门状态以及冰箱内部。这产生了需要组合语义分组、容量推理和几何放置约束的更长视野任务。

15

第 16 页

A.2 数据生成流程

我们在 KitchenWorlds [10] 中生成所有训练和评估数据,这是一个基于 PyBullet 的仿真环境。数据生成流程包含以下四个阶段:

步骤 1:场景采样。给定一个任务族,我们采样一个包含任务相关物体类别的场景。此外,我们系统地改变初始场景布局,包括任务相关物体的数量、干扰物以及几何约束的程度。这些变化产生了不同难度级别的样本,从拥有充足自由空间的简单设置,到需要打开门、移除障碍物或在狭小空间内仔细排列物体的更困难情况。

步骤 2:成功参考计划生成。为了为采样的任务实例生成参考计划,我们使用 PDDLStream [21] 结合 FastDownward [23] 生成可行的可执行计划,然后将生成的可行可执行轨迹转换为由我们的模型预测的紧凑动作空间。

如果找到了成功轨迹,我们将 PDDLStream 的输出处理为参考计划。原始输出包含高层动作和低层连续参数,例如物体位姿、抓取、机器人构型和运动轨迹。由于我们的模型预测的是接地的高层动作而非低层机器人轨迹,我们过滤 PDDLStream 计划以保留对应于 open(打开)、pick(拾取)和 place(放置)的动作。具体而言,open 动作由铰接物体参数化,pick 基元由要抓取的物体参数化,place 基元由被放置的物体、目标支撑表面以及从接地放置位姿获得的归一化图像空间放置点参数化。这产生了一个由接地高层动作组成的成功且经仿真器验证的参考计划。

此外,我们保存仿真器状态、符号计划信息以及低层命令序列。这些保存的工件允许我们回放计划、计算每个动作的元数据,并渲染用于构建监督训练所需参考输出的 RGB 观测值。

步骤 3:结构化骨架构建。给定参考计划,我们的目标是构建一个用于监督微调的交错语言-视觉推理轨迹。为此,我们首先为该轨迹提取一个结构化骨架。

首先,我们将参考计划分解为一系列子目标。具体而言,open 动作变为一个 open 子目标,连续的 pick-place 动作被组合成一个单一的 place 子目标。Place 子目标进一步根据物体是被放置到目标容器还是被移动到其他位置(例如清除障碍物或重新定位物体)进行分类。这一系列子目标捕捉了参考计划的结构,同时抽象掉了动作级别的细节。

接下来,每个子目标都标注了目的、约束类型和模态标签。可能的子目标目的包括推进任务、满足语义前置条件以及清除障碍物。为了确定约束类型和模态标签,我们使用通过回放保存的计划并保存几何指标所获得的仿真器派生元数据。对于 place 子目标,我们计算目标表面上的可用自由空间、当前物体的自由空间余量以及放置后的剩余自由空间。我们还通过比较放置后的剩余自由空间与仍需放置的剩余目标物体的足迹来估计未来的可行性。这些量是从投影到 X-Y 平面上的物体边界框计算的。尽管这些指标是近似的,但它们提供了一致的仿真器接地信号,用于识别依赖于空间约束的子目标。

基于这些标注,每个子目标被标记为一种约束类型:符号前置条件、当前几何约束或未来几何可行性。我们使用这些约束标注来为每个推理步骤分配模态标签。具有符号前置条件约束的步骤被分配为纯文本推理。对于具有当前几何或未来几何可行性约束的步骤,如果几何启发式方法达到预定义阈值,则分配其使用图像。

步骤 4:参考轨迹扩展。在构建好标注的骨架轨迹后,我们使用一个高容量语言模型将其扩展为自然语言推理轨迹。骨架指定了决策点的序列、相应的动作、每个决策的目的、其

16

第 17 页

主要规划约束、分配的模态以及任何相关的视觉参考。LLM 被指示在保持此结构的同时,添加关于任务分解、子目标选择、目标进展、相关物理约束以及为何语言或视觉思维(Visual Thought)适用于每个步骤的连接性推理。生成的推理随后被解析回结构化格式,因此最终参考输出既包含自然语言推理轨迹,也包含经模拟器验证的目标计划。我们在此步骤中使用 gemini-3-flash-preview。轨迹扩展提示词见附录 F.1。

对于分配了视觉模态的每个推理步骤,我们在该步骤的文本组件之后插入一个视觉思维(Visual Thought)。在轨迹中,视觉思维由离散视觉令牌跨度 <|image_start|><|image_pad|>…<|image_pad|><|image_end|> 表示,并在子目标达成后与渲染的 RGB 观测值配对。在训练期间,渲染图像为视觉思维令牌提供潜在的目标。

A.3 数据集示例

在图 10 和图 11 中,我们为每个训练任务族提供了数据集示例。这些示例展示了任务指令和输入场景,以及参考输出(推理轨迹、子目标图像和计划)。

A.4 数据集统计

使用上述流程,我们为每个训练阶段和评估构建了数据集。对于每个训练阶段,数据集包含来自每个训练任务族的 2,000 个示例。CONTAINMENT 实例包含 1–4 个目标物体,SORTING 实例包含 2–5 个目标物体。我们还系统地变化干扰物体的存在、场景布局和初始状态。

对于评估,每个数据集包含 100 个示例。我们包含两个分布内(ID)数据集,每个训练任务族一个,从与训练数据相同的目标物体和约束分布中采样。我们还在保留的组合任务族 STORING LEFTOVERS 上进行评估,其中包含 2-5 个用于排序的目标物体。最后,我们构建了两个族内分布外(OOD)数据集,以评估对更长任务视界和更高任务复杂度的泛化能力。对于任务视界,我们将 CONTAINMENT 增加到 5–7 个目标物体,SORTING 增加到 6–10 个。对于复杂度,我们增加了所需前置动作的数量,这些动作定义为不直接有助于目标的动作(例如移除障碍物、开门)。

17

第 18 页

包含:将碗存入迷你冰箱。

任务:将碗存入迷你冰箱。 参考推理轨迹 子目标图像 初始状态 第1步:迷你冰箱里已经有两个大锅,但我认为厨房台面上还有三个大碗可见。为了完成 全局 放大 任务,我只需要把碗放进迷你冰箱。我将首先放置碗#3_28。由于有足够的空闲空间, 文本足以处理此步骤。

第2步:我现在将碗#1_25放入迷你冰箱,以继续满足任务要求。我主要担心的是确保 为稍后需要存入的最后一个碗留出足够的空间。我将使用动作后图像来验证此碗的位置 是否保留了剩余物体足够的空间。图像 参考计划 表示为 <|image_start|>…<|image_end|>。 pick(bowl#3_28) place(bowl#3_28, minifridge_10, [576, 440]) 第3步:最后,我将把碗#2_26放入迷你冰箱以 pick(bowl#1_25) 完成任务。由于冰箱现在很拥挤,我必须 place(bowl#1_25, minifridge_10, [544, 479]) 极其小心以避免与内部已有物体发生碰撞。 pick(bowl#2_26) 必须使用动作后图像来确认放置 place(bowl#2_26, minifridge_10, [552, 414]) 是否精确且符合严格的几何约束。图像 表示为 <|image_start|>…<|image_end|>。

任务:将碗存入迷你冰箱。 参考推理轨迹 子目标图像 初始状态 第1步:迷你冰箱里已经有两个大锅,但我认为厨房台面上还有两个大碗可见。由于碗相对较小,我认为仍有足够的剩余空间。我将 全局 放大 首先将碗#1_32放置在避开锅具并为第二个碗留出空间的开放区域。为了谨慎起见, 我将使用动作后图像来验证碗是否放置得当。图像 表示为 <|image_start|>…<|image_end|>。

第2步:我现在将碗#2_33放入冰箱以完成 任务。第二个碗也很小,因此冰箱 参考计划 中第一个碗右侧仍有足够的空间。我不需要担心 pick(bowl#1_32) 限制未来的放置,因此文本足以处理此步骤。 place(bowl#1_32, minifridge_14, [192, 524]) pick(bowl#2_33) place(bowl#2_33, minifridge_14, [211, 513])

任务:将碗存入迷你冰箱。 参考推理轨迹 子目标图像 初始状态 第1步:我必须将三个碗放入冰箱。目前冰箱里有两个大 锅。为了腾出空间,我需要从冰箱中取出 全局 放大 厨房锅#1,为主任务物体腾出更多空间。 我将使用右侧水槽台面作为目标表面。它 相当大,因此无需使用动作后图像来验证放置。

第2步:我现在将碗#2_16放入冰箱,开始满足 任务要求。现在有很多开放空间,但我想 谨慎行事,以便为后续放置保留足够的空间。我将 参考计划 使用动作后图像来确保此放置是精确的。 pick(kitchenpot#1_29) 图像表示为 <|image_start|>…<|image_end|>。 place(kitchenpot#1_29, sink_counter_right_6, [392, 473]) 第3步:我将继续把碗#3_17放入冰箱。 pick(bowl#2_16) 冰箱仍然相当空。由于此步骤后只剩下一个碗 place(bowl# 2_16, minifridge_11, [751, 578]) 需要放置,当前的放置不太可能产生显著的 pick(bowl#3_17) 下游约束。因此,我可以仅使用文本推理进行合理的 place(bowl#3_17, minifridge_11, [729, 571]) 放置。 pick(bowl#1_15) place(bowl#1_15, minifridge_11, [743, 553]) 第4步:最后,我正在将碗#1_15移入迷你冰箱以 完成目标物体集合。内部现在非常满,使得 这最后一个碗必须完美放置,以免碰到 任何其他东西。我将检查动作后图像,以确保最终 放置成功且无碰撞。图像表示为 <|image_start|>…<|image_end|>。任务现已完成, 我将输出最终答案。

图10:CONTAINMENT 的训练示例,显示输入和参考输出。

18

第 19 页

排序:按类型将食物分类放入炖锅中。

任务:按类型将番茄和西葫芦分类放入炖锅中。

初始状态 全局 放大

参考计划 pick(veggietomato_28) place(veggietomato_28, braiserbody#1_26, [364, 478]) pick(veggietomato#1_29) place(veggietomato#1_29, braiserbody#1_26, [363, 491]) pick(veggiezucchini_30) place(veggiezucchini_30, braiserbody#2_27, [311, 442])

参考推理轨迹 步骤 1:我将首先对两个番茄进行分类。作为分类任务的一部分,我将把 veggietomato_28 放入 braiserbody#1_26。由于炖锅初始为空,有足够的开放空间。番茄可以自由放置,无需精确定位,因此文本描述提供了足够的信息以确保成功放置。

步骤 2:接下来,我将把第二个番茄 veggietomato#1_29 移动到同一个炖锅中。由于第一个番茄已经在里面,我需要更小心地放置,以确保两个番茄在不碰撞的情况下容纳。我将检查动作后图像以验证第二个番茄是否正确放置在剩余空间内。图像表示为 <|image_start|>…<|image_end|>。

步骤 3:最后,我将把 veggiezucchini_30 放入 braiserbody#2_27 以完成任务。由于西葫芦较长,我需要仔细定位,使其正确放入且不碰到炖锅侧壁。我将使用动作后图像确认西葫芦成功放入炖锅内。图像表示为 <|image_start|>…<|image_end|>。分类任务现已完成,因此我将输出最终计划。

子目标图像

任务:按类型将卷心菜和西葫芦分类放入炖锅中。

初始状态 全局 放大

参考计划 pick(veggiezucchini_29) place(veggiezucchini_29, braiserbody#16_45, [575, 486]) pick(veggiezucchini#1_30) place(veggiezucchini#1_30, braiserbody#16_45, [571, 499]) pick(veggiezucchini#2_31) place(veggiezucchini#2_31, braiserbody#16_45, [574, 440]) pick(veggiecabbage#1_27) place(veggiecabbage#1_27, braiserbody#25_54, [433, 471]) pick(veggiecabbage_26) place(veggiecabbage_26, braiserbody#25_54, [439, 460]) pick(veggiecabbage#2_28) place(veggiecabbage#2_28, braiserbody#25_54, [445, 476])

参考推理轨迹 步骤 1:场景中有三个西葫芦和三个卷心菜。由于西葫芦较长,我将把它们分类放入较大的炖锅(braiserbody#16_45)中,从最大的西葫芦(veggiezucchini_29)开始。为了确保 veggiezucchini_29 正确放入炖锅内,我需要动作后图像来验证其放置情况。图像表示为 <|image_start|>…<|image_end|>。

步骤 2:接下来,我需要将 veggiezucchini#1_30 放入同一个炖锅中以继续分类过程。容器中目前有足够的空间,且这个西葫芦较短。由于我不需要担心此特定移动的空间限制,基于文本的指令足以完成此步骤。

步骤 3:我正在将最后一个西葫芦放入炖锅中以完成此部分分类任务。容器仍有充足空间,但我需要找到一个精确的位置以避免碰到其他物品。动作后图像有助于检查 veggiezucchini#2_31 的放置情况。图像表示为 <|image_start|>…<|image_end|>。

步骤 4:现在,我将把卷心菜分类放入较小的炖锅 braiserbody#25_54 中。我将首先移动 veggiecabbage#1_27。炖锅当前为空,因此放置不受限制。我可以仅依靠文本指导此操作,而无需视觉确认结果。

步骤 5:我需要将下一个卷心菜放入第二个炖锅中以保持食物物品有序。在放置 veggiecabbage_26 时,我需要小心确保它不与现有的卷心菜发生碰撞。有必要使用动作后图像来验证卷心菜是否安全地定位在容器内。图像表示为 <|image_start|>…<|image_end|>。

步骤 6:我将把最后一个卷心菜移动到第二个炖锅中以完成任务。由于容器非常拥挤,我必须小心放置,以确保无碰撞地容纳。我将检查动作后图像以验证最终排列是否成功。图像表示为 <|image_start|>…<|image_end|>。任务现已完成,我将输出最终答案。

子目标图像

图 11:SORTING 的训练示例,显示输入和参考输出。

19

第 20 页

B 模型与训练细节

我们提供了 APIVOT 的实现细节,包括用于表示潜在视觉思维的架构以及用于微调的训练设置。

B.1 架构与视觉思维实现

我们的模型基于 Qwen3-VL-8B-Instruct 初始化,并扩展了基础 VLM 解码器,以支持在自回归推理轨迹中使用潜在视觉思维。我们将每个视觉思维表示为固定长度的特殊令牌序列:<|image_start|> <|image_pad|>K <|image_end|>,其中 $K = 16$。由于 Qwen3-VL-8B 的隐藏层维度为 $d = 4096$,每个视觉思维对应一个潜在视觉状态 $H_j \in \mathbb{R}^{16 \times 4096}$。

视觉思维序列的起始和结束令牌监督模型生成有效的视觉思维结构,而对应于图像填充令牌(image-pad tokens)的隐藏状态则代表模型的潜在视觉思维。

B.2 训练与计算资源

我们使用 LoRA 对语言模型的注意力层和 MLP 投影模块进行微调,秩 $r = 16$,缩放系数 $\alpha = 32$。

我们按照第 3.3 节描述的三阶段监督微调课程训练模型。每个任务族使用 2000 个样本进行 1 个 epoch 的训练。在所有训练阶段中,我们使用每设备批次大小(per-device batch size)为 4,梯度累积步数为 16,优化器为 AdamW,采用余弦学习率衰减,学习率为 $4 \times 10^{-5}$,预热比例(warmup ratio)为 0.08。

对于训练目标:在第 1 阶段,我们设置 $\lambda_{CE,trace} = 1.0$ 且 $\lambda_{vis} = 0$。在第 2 和第 3 阶段,我们设置 $\lambda_{CE,trace} = 1.0$ 且 $\lambda_{vis} = 5.0$。

训练在单块拥有 96GB 显存的 RTX PRO 6000 GPU 上进行,每次运行耗时约 14 小时。

20

第 21 页

C 评估:执行协议与基线

在本节中,我们描述了用于评估所有模型的闭环执行协议,随后详细介绍了通用视觉-语言模型(VLM)和规划基线。

C.1 闭环执行协议

我们在相同的滚动时域执行设置中评估所有方法,并使用我们的模拟器。

形式上,环境被建模为一个元组 $(S, A, T)$,其中 $S$ 是状态空间,$A_{sim}$ 是模拟器动作空间,$T: S \times A_{sim} \rightarrow S$ 是转移函数。在我们的设置中,$A_{sim}$ 由参数化的动作基元(例如,打开、拾取和放置)组成,其连续参数(例如,抓取位姿、物体位姿)在世界坐标系中定义。

规划器并不直接输出 $A_{sim}$ 中的动作。相反,它预测在一个类似的动作空间 $A_{plan}$ 中的动作,该空间保留了相同的离散基元,但仅表达放置参数。具体而言,如第 3 节所述,规划器动作空间 $A_{plan}$ 包含三个高层基元:$open(obj)$、$pick(obj)$ 和 $place(obj, target, u, v)$。$open$ 动作用于打开铰接式容器,如橱柜或冰箱。$pick$ 动作用于选择物体实例,而 $place$ 动作使用归一化到 $[0, 1000]$ 范围的图像空间放置坐标 $(u, v)$ 将持有的物体放置在目标物体上或内部。

在执行过程中,规划器动作通过利用模拟器状态、已知相机位姿和场景几何结构将任何图像空间坐标提升为世界坐标系,从而映射到 $A_{sim}$。具体而言,我们将预测的图像坐标反投影到场景中,针对模拟器几何结构进行射线投射,并将物体放置在生成的 3D 点处。随后,模拟器应用相应的基元并根据 $T$ 更新状态。

当任务成功,或达到最大执行步数或墙上时钟时间时,回合终止。任务成功定义为在终止时满足所有目标谓词。

C.2 通用 VLM 基线

我们通过提示通用 VLM 直接生成与我们模型相同动作格式的规划来评估它们。每个提示包含当前图像观测、任务目标、带有图像空间物体位置的物体列表以及动作模式(见图 21)。模型输出一个规划,并使用上述共享的闭环协议进行解析和执行。

对于基于 Gemini 的基线,我们使用温度参数为 0 的贪婪解码评估 Gemini-3.1-Pro 和 Gemini-ER-1.5。对于 Qwen 基线,我们评估 Qwen3-VL-8B-Instruct 和 Qwen3-VL-8B-Thinking。为 Gemini-3.1-Pro、Gemini-ER-1.5 和 Qwen3-VL-8B-Thinking 启用了扩展思维(Extended thinking)。它们的思维令牌(thinking tokens)被包含在令牌使用量测量中。

C.3 规划基线

FastDownward。我们将 FastDownward [23] 作为符号规划基线进行评估。由于 FastDownward 无法直接在 RGB 观测上运行,我们在我们生成的数据集上训练 BLADE [50],以便从图像和语言输入中推断规划器所需的符号谓词。推断出的状态被转换为 PDDL 问题,并使用带有 LM-cut 启发式的 A* 搜索通过 FastDownward 求解。由于 FastDownward 产生的是符号动作而非图像空间放置坐标,我们通过随机采样对其放置动作进行接地(grounding)。

Reflect-VLM。我们将 Reflect-VLM [13] 作为 VLM 规划基线进行评估,该基线使用外部想象的未来观测来在执行前批评和修订其规划。为了将 Reflect-VLM 适应我们的任务设置,我们使用与我们方法相同的任务实例和动作空间,在其生成的规划数据集上对其进行训练。在推理时,Reflect-VLM 接收当前图像、目标和物体位置,并按照其实现提出包含 $n=5$ 个高层动作的规划。提出的规划使用基于扩散的动力学模型展开固定数量的想象步数,产生未来观测,这些观测被提供给 VLM 进行反思。

21

第 22 页

VLM-TAMP。VLM-TAMP [10] 是一个具有代表性的基于视觉-语言模型(VLM)的任务与运动规划(TAMP)框架,该框架利用 VLM 提出符号规划结构,并由下游规划器生成可执行动作。在此框架中,VLM 接收与通用 VLM 基线相同的输入,即当前图像、目标、物体位置以及动作模式,并被提示提出一系列形式化子目标。随后,这些子目标由符号规划器求解,并通过相同的执行接口进行落地。

22

第 23 页

D 补充结果

在本节中,我们提供了额外的分布外(Out-of-Distribution, OOD)泛化结果,并对 APIVOT 训练和推理流程中主要组件进行了消融实验。具体而言,我们分析了领域特定微调的作用、每个训练阶段的贡献、推理模态的影响,以及启发式引导的推理轨迹生成的影响。

D.1 分布外泛化

实验设置。我们在分布外(OOD)设置下进一步评估 APIVOT,这些设置相对于训练分布增加了任务视界(task horizon)和几何复杂度。LONGER HORIZON(更长视界)设置增加了目标物体的数量,而 INCREASED COMPLEXITY(增加复杂度)设置则包含更严格的自由空间约束,以及在放置之前打开存储区域或移除障碍物等额外的前置步骤。

结果。如表 2 所示,APIVOT 在这些更困难的设置中仍保持竞争力,其表现与通用 VLM 和规划基线相当或更强。这表明其学到的视觉思维(Visual Thoughts)使用方式可以迁移到更复杂的场景中,尽管与分布内(In-Distribution, ID)相比,性能优势幅度较小。

然而,与基线相比,APIVOT 表现出最大的 ID-OOD 性能下降之一。OOD 设置中包含的物体数量多于训练期间见过的物体,这要求视觉思维(Visual Thoughts)编码更密集的空间配置。因此,我们假设这种性能下降部分归因于对更杂乱场景的视觉思维(Visual Thoughts)生成缺乏足够的监督。

表 2:族内分布外泛化。我们报告了成功率和相对 ID-OOD 差距。

| Model | Success Rate ↑ <br> Long Horizon | Success Rate ↑ <br> More Complex | Relative Gap ↓ <br> Long Horizon | Relative Gap ↓ <br> More Complex | | :— | :—: | :—: | :—: | :—: | | VLM Baselines | | | | | | Gemini-3.1-Pro | 0.225 | 0.224 | 0.082 | 0.086 | | Gemini-ER-1.5 | 0.331 | 0.303 | 0.021 | 0.104 | | Qwen3-VL-8B-Instruct | 0.177 | 0.188 | 0.059 | 0.000 | | Qwen3-VL-8B-Thinking | 0.199 | 0.235 | 0.142 | -0.013 | | Planning Baselines | | | | | | FastDownward | 0.213 | 0.243 | 0.217 | 0.107 | | Reflect-VLM | 0.242 | 0.252 | 0.171 | 0.137 | | VLM-TAMP | 0.281 | 0.269 | 0.146 | 0.182 | | APIVOT (Ours) | 0.338 | 0.336 | 0.193 | 0.199 |

D.2 文本微调消融

实验设置。为了隔离 APIVOT 的性能提升是否仅来自领域特定微调,我们使用与 APIVOT 相同的 Qwen3-VL-8B-Instruct 主干网络、任务实例和专家规划,训练了一个纯文本变体。该变体使用标准的监督微调(SFT)在文本推理轨迹和最终规划上进行训练,以此作为对照,以检验模型是否仅通过学习特定任务的语言理由和行动格式就能恢复相同的规划改进。

结果。如图 12 所示,纯文本 SFT 优于基础 Qwen3-VL-8B-Instruct 模型,将平均任务成功率从 0.188 提高到 0.24。这表明领域特定微调是有效的。模型从接触任务分布、结构化推理格式和专家行动序列中受益。然而,与 APIVOT 相比,纯文本 SFT 带来的提升有限,APIVOT 的平均成功率为 0.419。因此,纯文本 SFT 仅占整体提升的一小部分。剩余的差距表明,APIVOT 的性能提升不仅仅归因于更好的特定任务语言监督,而是归因于其以视觉方式表示中间未来状态并利用这些状态进行规划的能力。

23

第 24 页

0.47 仅推理 0.42 0.42 TextAPIVOT微调( ours) 0.4 0.36

0.28 成功率 0.24 0.24 0.22 0.22 任务 0.2 0.18 0.18 0.16

0.0 平均 包含 排序 存放剩菜 任务类别

图 12:所有任务类别的成功率。

D.3 训练阶段消融实验

实验设置。APIVOT 通过三阶段课程进行训练,逐步教会其理解、生成并自适应地利用视觉思维进行规划(第 3.3 节)。为了评估每个阶段的贡献,我们从完整的 APIVOT 训练流程开始,每次消融一个阶段,并在所有任务上进行评估。这隔离了每个训练阶段在学习有效且高效规划方面的贡献。

结果。我们在表 3 中报告了每个消融实验的平均成功率和令牌使用量。我们发现,移除第 1 阶段使平均成功率大幅下降了 11.8 个百分点。这表明,仅靠后续的视觉生成监督,模型并未学会利用视觉思维进行规划。如果没有第 2 阶段,APIVOT 的性能下降了 7.4 个百分点,这表明在每个步骤中学习生成视觉思维为生成行为提供了重要的先验。如果没有这个阶段,APIVOT 在需要时无法可靠地实例化视觉思维,这一点由令牌数量的减少所证实。最后,移除第 3 阶段虽然获得了最高的成功率,但也大幅增加了令牌数量。这凸显了第 3 阶段在教会模型选择性调用视觉思维的同时保持性能方面的作用。如果没有这个阶段,模型会均匀地依赖视觉思维,这虽然可以提高成功率,但推理成本会显著增加。

总体而言,我们看到第 1 阶段和第 2 阶段对于学习有效的视觉思维表示至关重要,而第 3 阶段有助于实现有利的性能-成本平衡。

表 3:APIVOT 三阶段训练课程的消融实验。 方法 成功率 令牌使用量

APIVOT 0.419 262

无第 1 阶段:理解 0.301 235 无第 2 阶段:生成 0.345 206 无第 3 阶段:自适应 0.457 498

D.4 推理模态消融实验

实验设置。为了分离训练时的多模态监督和推理时的多模态生成的影响,我们消融了训练和推理时使用的模态。我们将 APIVOT 与仅在文本轨迹上微调的纯文本变体进行比较,如附录 D.2 所示。对于 APIVOT,我们进一步消融推理时的推理模态:1) 纯文本,不使用视觉思维;2) 始终图像,在每个步骤生成图像;3) 自适应,我们学习的平衡性能与成本的策略;4) 真实值(GT)预言机,其中 APIVOT 以真实视觉思维为条件作为上限。

结果。如表 4 所示,与纯文本微调相比,文本+图像训练总体上提高了规划性能。即使推理时的推理是纯文本的,文本+图像模型的性能仍比纯文本模型高出 3.8 个百分点。这表明多模态监督

24

第 25 页

在测试时提供了超越显式视觉生成的额外收益,这可能是通过鼓励对几何结构更敏感的规划表示来实现的。

推理时的视觉思维带来了更大的性能提升,如图像始终(image-always)和自适应(adaptive)消融实验的结果所示。最后, oracle 视觉思维实现了最高的平均成功率,在所有任务族中均优于生成的视觉思维。这一差距表明,提高生成视觉思维的质量可能会带来进一步的收益。

表 4:训练和推理模态对规划性能的影响。 训练 推理 平均 包含 排序 存储

文本 文本 0.244 0.281 0.217 0.235

文本 0.282 0.332 0.267 0.246 图像(始终) 0.459 0.483 0.466 0.428 文本+图像 (APIVOT) 图像(自适应) 0.419 0.472 0.421 0.365 图像(真实值,oracle) 0.482 0.494 0.482 0.470

D.5 启发式引导推理轨迹消融

实验设置。APIVOT 的第三个 SFT 阶段通过在推理轨迹中针对几何受限的子目标选择性插入视觉思维进行训练,从而教授自适应模态选择。如第 3.2 节和附录 A.2 所述,这些插入位置是基于模拟器导出的启发式规则确定的。为了隔离这种放置策略的影响,我们从相同的第二阶段检查点初始化所有模型,并改变用于第三阶段训练的数据集。我们将最终基于启发式的训练数据集(构建为 75% 的时间使用视觉思维)与随机基线进行比较,后者以 0.75 的概率在每个步骤独立插入视觉思维。这控制了几何启发式的有效性。我们还评估了使用率分别为 50% 和 25% 的启发式数据集。

结果。如表 5 所示,基于启发式的 75% 配置取得了最佳成功率。尽管随机基线在推理时使用了更多的视觉思维,但其表现不如我们的启发式策略。这表明几何启发式为学习在有益时自适应使用视觉思维提供了有效的信号。

然而,将视觉思维的使用率降低到 50% 和 25% 会导致性能下降。在推理时,视觉思维的使用率似乎出现崩溃,模型仅在 20% 和 3% 的步骤中使用它们。这表明,稀疏的视觉思维监督削弱了模型学习使用视觉表示的能力,即使是从在每个步骤都生成视觉思维的第二阶段检查点初始化。这些结果表明,需要更稳健的策略来学习自适应模态选择。

表 5:推理轨迹启发式消融。粗体表示用于训练 APIVOT 的设置。 参考轨迹 推理时

模态策略 视觉思维使用率 (%) 成功率 视觉思维使用率 (%)

启发式( ours) 75 0.419 56 启发式 50 0.332 20 启发式 25 0.254 3

随机 75 0.371 63

25

第 26 页

E 补充分析

E.1 定性示例

我们提供了与表现最佳的视觉-语言模型(Gemini-ER-1.5)及规划基线(VLM-TAMP)在所有三项任务(CONTAINMENT、SORTING 和 STORING LEFTOVERS)上的定性对比。在这些示例中,APIVOT 能更可靠地预判空间约束并生成物理上可行的放置方案,从而取得成功,而基线方法则面临困难。

26

第 27 页

图 13:CONTAINMENT 的定性比较:APIVOT 清除障碍物以完成任务,而 Gemini-ER-1.5 识别空间约束过晚并超时。

27

第 28 页

图 14:CONTAINMENT 的定性比较:APIVOT 为未来的碗具放置保留了空间,而 VLM-TAMP 未能预见最终的放置约束。

28

第 29 页

图 15:SORTING 的定性比较:APIVOT 成功完成了正确的炖锅分配,而 Gemini-ER-1.5 失败并切换至不可行的分配方案。

29

第 30 页

图 16:SORTING 任务的定性比较:APIVOT 通过选择空间灵活性更高的炖锅分配方案取得成功,而 VLM-TAMP 则选择了相反的方案,导致放置空间不足。

30

第 31 页

图 17:STORING LEFTOVERS 任务的定性比较:APIVOT 对物体进行排序并将两个大型炖锅都放入冰箱,而 Gemini-ER-1.5 无法可行地放置两个炖锅。

31

第 32 页

图 18:STORING LEFTOVERS 任务的定性比较:APIVOT 在受限区域内完成了分类、障碍物移除和放置,而 VLM-TAMP 在出现数次错误后超时。

32

第 33 页

E.2 失败分析

我们将 APIVOT 的失败归类为以下主要失败模式:

过早完成目标:由于 APIVOT 从当前观察和物体清单中推断任务进度,它有时会将部分完成的任务误判为已完成,从而在剩余与目标相关的动作尚未执行时结束回合。我们观察到,这种失败模式在长视界任务中更为常见,这表明需要显式的进度跟踪。

动作顺序错误:计划包含所有必要的动作,但顺序错误。APIVOT 偶尔能识别出相关的物体和操作,但未能正确建模它们的时间依赖关系。例如,APIVOT 可能会计划先放置一个物体,然后再清除该物体上的障碍物。

缺失前置动作:APIVOT 有时会省略使任务可解所必需的动作,尽管这些动作与目标没有直接关系。APIVOT 能够可靠地处理语义前置条件(例如打开关闭的门),但在几何约束方面仍面临挑战,例如需要移除障碍物或重新排列阻挡目标位置的物体,此时动作的必要性仅从场景的空间配置中显而易见。

几何定位:高层计划在原则上是可执行的,但系统错误地定位了放置点。当计划在使用 oracle 模拟器放置时成功,但在使用 APIVOT 预测的点时失败,我们便识别出这些失败。这类失败在约束紧密的场景中更为常见,因为此类场景对放置的容错率较小。

33

第 34 页

F 提示模板

在此,我们提供用于 VLM 基线数据生成和评估的提示模板。

F.1 数据生成 LLM 扩展提示

我们提供用于对用于 SFT 的参考推理轨迹进行轨迹扩展的提示。 我们使用 gemini-3-flash-preview 进行轨迹扩展。

数据生成推理提示

你将获得来自机器人任务规划轨迹的结构化规划步骤。你的工作是将每个步骤转换为自然推理,解释规划者会如何思考该决策。

对于每个步骤,撰写 2-3 句遵循以下结构的推理: 1. 说明该动作在任务背景下的作用。 2. 识别此步骤中涉及的关键约束。 3. 解释所选模态(text 或 text_image_post)为何合适。

在最后,表明任务已完成,并将输出最终答案。不要提前添加此内容。 推理应听起来像规划者在思考决策,而不是元数据描述。

推理风格要求:

  • 以自然推理风格撰写。
  • 以第一人称规划者口吻撰写推理(例如,“我需要……”)。
  • 不要简单地重述原因字符串。将其扩展为自然推理。
  • 保持推理与每个步骤一致。
  • 简洁但具有解释性。

输出格式: 以 JSON 形式返回推理结果。

[{"step_index": 0, "reasoning": "推理段落"}, … {"step_index": n, "reasoning": "推理段落 + 结尾句"}]

要求:

  • 仅输出有效的 JSON。
  • 不要在 JSON 之外包含解释。
  • 不要包含 Markdown。
  • 不要包含评论。
  • 每个步骤对应一个条目。
  • 步骤索引必须与输入匹配。
  • 仅对最终步骤,追加一个额外的结尾句。

示例输入: 步骤 0: 动作:将胡萝卜移入冰箱 动作目的:将目标物体放入目标容器 约束类型:future_geometric_feasibility(未来几何可行性) 模态:Text_image_post 为何选择此模态:放置必须为剩余物体保留空间

示例输出: {"step_index": 0, "reasoning": "我将胡萝卜移入冰箱,以便将一个目标物体放入目标容器。关键约束是为其他蔬菜保留足够的空间。动作后图像很有用,因为我需要检查确切放置是否为未来物体留出空间。"}

––––––––––––––––

重申你的目标:对于每个步骤,你将结构化的规划决策扩展为反映任务规划者思考方式的自然推理。仅对最终步骤,追加一个额外的结尾句。结尾句必须清楚地表明任务已完成,并将输出最终答案。不要将其添加到任何早期步骤中。 你的推理应:

  • 清楚地连接动作与任务目标
  • 解释影响决策的关键约束
  • 证明为何需要文本或视觉检查
  • 听起来像是深思熟虑的决策,而非数据描述

不要复制模板措辞、列出字段、逐字重复原因字符串、发明新的动机或添加不必要的冗长。专注于生成清晰、自然的逐步规划者推理,这些推理实际上可以指导任务的执行。

现在为以下步骤生成推理。

{INSERT STEPS FOR A GIVEN TRACE}

图 19:用于将结构化规划轨迹扩展为自然语言推理轨迹的提示。

34

第 35 页

F.2 VLM 推理提示

我们提供了用于评估我们方法(图 20)和纯文本 VLM 基线(图 21)规划所使用的提示。在这两个提示中,模型接收输入观测、目标、物体列表、任务约束和操作原语,随后被提示输出逐步推理,接着输出由每行一个形式化动作组成的计划。

使用 APIVOT 进行规划的提示指定输出为结构化的 〈think〉 轨迹,其中每一步指定规划意图、关键约束、模态决策和理由,随后是形式化的 〈answer〉 计划。

35

第 36 页

APIVOT 规划提示词

你获得了一张厨房世界场景的输入图像。你的任务是推理该图像并规划一系列动作,以实现以下目标: “{goal}”。 请使用由以下基本动作定义的形式化语言来响应动作: {set_of_actions}。 每行必须恰好包含一个动作。

场景对象: 动作中引用的对象必须来自以下列表。每个名称的格式为 <object_category>_<instance_id>。每个对象都与其中心位置配对,格式为 [x, y](归一化到 0-1000): {object_id_to_points} {task_constraints}

规划指南: 你是一个拥有 {n_arms} 个机械臂的移动机器人。你必须遵守以下常识规则: 1. 在拿起物体之前,你至少必须有一只空手。 2. 你只能对上面列出的对象执行动作。 3. 你应旨在以最少的动作数实现目标。

答案格式: 你必须输出恰好两个部分: </think> <answer>…</answer> –––––––––––––––– 1) 思考部分(</think> section): 在思考部分,你必须生成一个结构化的规划轨迹,作为按顺序排列的推理步骤序列,格式如下: 第 k 步:… 每一步应描述完成该任务所需的下一个规划子目标。每一步应包括以下方面的推理: 1. 规划意图:说明下一步必须决定或做什么,以及它如何有助于实现目标。 2. 关键约束: 识别影响此步骤的最重要约束。示例包括:

3. 模态决策: 决定此步骤是否需要视觉验证,或者文本推理是否足够。 4. 理由: 解释为何该模态选择是合适的。 –––––––––––––––– 图像表示规则: 如果某一步骤需要视觉验证,则必须在该步骤的推理之后立即输出图像表示。 正确结构示例: 第 2 步:我需要确定容器是否仍有足够的空间容纳剩余的目標物体。关键约束是保留足够的空闲空间以供未来放置。我需要一张动作后的图像来验证剩余的布局是否为其他物体留出足够的空间。 <IMAGE_START><IMAGE_PAD>…<IMAGE_END> –––––––––––––––– 2) 答案部分(<answer> section): 以基本动作列表的形式输出最终计划。 要求:

–––––––––––––––– 最终规则:

</think> <answer>…</answer>

  • 空间容量
  • 物体可访问性
  • 顺序依赖关系
  • 每行一个动作
  • 仅使用形式化的基本动作语言
  • 此处不要包含推理
  • 计划必须与思考部分中的推理保持一致
  • 你的输出必须严格遵循以下结构:
  • 不要包含这些部分之外的任何内容。
  • 不要在思考部分之外包含解释。
  • 不要在 <answer> 内部包含推理。
  • 确保推理和计划保持一致。

图 20:用于 APIVOT 的规划提示词。

36

第 37 页

仅文本的 VLM 评估提示

您将获得一个厨房世界场景的输入图像。您的任务是对图像进行推理,并规划一系列动作以实现以下目标: “{goal}”。 请使用由以下基本动作定义的形式化语言来响应动作:{set_of_actions}。 每行必须恰好包含一个动作。 场景物体: 动作中引用的物体必须来自以下列表。每个名称的格式为 ‘<object_category>_<instance_id>’。每个物体都与其中心位置配对,格式为 [x, y] (归一化为 0-1000): {object_id_to_points} {task_constraints} 规划指南: 您是一个拥有 {n_arms} 只机械臂的移动机器人。您必须遵守以下常识规则: 1. 在拿起物体之前,您必须至少有一只空手。 2. 您只能对上面列出的物体采取行动。 3. 您应旨在以最少的动作数实现目标。 输出格式: 首先,写出完成任务的分步推理,包括任务分解、子目标设定和动作序列。每一步都应专注于规划完成当前任务所需的下一个规划子目标,并推理接下来必须决定或做什么,以及这如何有助于实现目标。 然后,在单独的一行上写“Answer:”,后跟最终计划,即每行一个动作的动作列表。

图 21:用于 VLM 基线的纯文本规划提示。

37

发表评论