三分钟导读:本文提出FoMoVLA框架,通过联合学习未来特征前瞻和稀疏2D点追踪,并利用未来条件交叉注意力模块耦合两者,显著增强了VLA模型的动作生成能力。
英文题目:FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
论文出处:arXiv 每日论文精选 · arXiv:2607.14739
原始论文:PDF / 论文页面
对应视频标题:FoMoVLA:通过联合视觉前瞻与运动引导增强VLA模型|推荐指数:★★★★★
这篇论文解决什么问题?
现有VLA模型本质上是反应式的,缺乏对世界动态的显式前向预测;现有的视觉前瞻方法虽能预测未来视觉状态,但缺乏显式的运动引导,无法说明如何到达该状态。
核心创新
- 提出联合学习未来特征预测和稀疏2D点追踪的VLA框架,提供显式的时空监督。
- 设计未来条件交叉注意力模块(FCCA),将运动预测条件化于预测的未来状态,强制前瞻视觉状态与几何运动动力学的一致性。
- 采用训练时辅助、推理时零开销的设计,通过重排输入序列顺序确保图像token对语言指令的goal-aware conditioning。
方法概览
FoMoVLA在训练时引入两个辅助分支:(1) 未来特征预测分支:使用可学习的<Foresight> tokens和EMA教师网络预测最终帧的紧凑视觉特征;(2) 点追踪分支:利用冻结的CoTracker-v3生成稀疏2D点轨迹作为监督信号。通过FCCA模块,将点追踪条件化于前瞻表示之上,确保局部轨迹估计与全局前瞻先验的一致性。推理时丢弃所有辅助分支,无额外参数开销。
逐图理解论文
问题:运动引导的缺失

现有的视觉前瞻方法虽能预测未来视觉状态,但缺乏显式的运动引导,无法说明如何到达该状态。点追踪虽能捕捉运动,但通常孤立优化,未与未来状态预测形成协同。这导致模型难以理解动作与视觉变化之间的因果联系。
方法:FoMoVLA框架概览

FoMoVLA在训练时引入两个辅助分支。首先是未来特征预测分支,使用可学习的<Foresight> tokens和EMA教师网络预测最终帧的紧凑视觉特征。其次是点追踪分支,利用冻结的CoTracker-v3生成稀疏2D点轨迹作为监督信号。
实验:LIBERO基准表现

在LIBERO基准上进行评估,包括Spatial, Object, Goal, Long四个任务套件。FoMoVLA平均成功率达到98.8%,优于所有基线。这一结果证明了联合学习未来特征和运动轨迹的有效性,显著提升了复杂任务的成功率。
实验:零样本鲁棒性评估

在LIBERO-Plus上进行零样本分布外鲁棒性评估,涵盖视角、光照、背景等扰动。FoMoVLA零样本总成功率为80.5%,优于StarVLA 6.4个百分点。这表明模型学到的前瞻和运动先验具有良好的泛化能力。
实验:RoboCasa真实机器人

在RoboCasa GR-1 Tabletop基准上测试人形机器人的桌面操作任务。FoMoVLA平均成功率为56.9%,优于StarVLA-GR00T 9.1个百分点。这验证了方法在真实物理环境中的有效性。
实验与关键结果
- 在LIBERO基准上进行评估,包括Spatial, Object, Goal, Long四个任务套件。
- 在RoboCasa GR-1 Tabletop基准上进行评估,测试人形机器人的桌面操作任务。
- 在LIBERO-Plus上进行零样本分布外(OOD)鲁棒性评估,涵盖视角、光照、背景等扰动。
- 进行消融实验,分析点网格密度、前瞻架构、前瞻-运动耦合设计的影响。
- 评估FoMoVLA在不同VLA框架(StarVLA-π, StarVLA-OFT)上的可扩展性。
- LIBERO平均成功率98.8%,优于所有基线(第 5 页)
- LIBERO-Plus零样本总成功率80.5%,优于StarVLA (+6.4%)(第 6 页)
- RoboCasa GR-1 Tabletop平均成功率56.9%,优于StarVLA-GR00T (+9.1%)(第 6 页)
- 引入FCCA后,点追踪ATE-all误差降低25.0%,Survival@10px提升17.3个百分点(第 11 页)
- 推理延迟仅增加9.4ms,GPU内存增加0.1GB(第 11 页)
阅读时需要注意
- 当前的追踪监督仅在图像空间中建模视差运动,未能捕捉动态场景中的3D几何结构。
- 模型在固定视角和初始姿态下训练,对视角和深度变化的泛化能力受限。
- FCCA模块在训练初期为零初始化,需确保训练稳定性以逐步注入未来信息。
- 点追踪监督依赖于冻结的CoTracker-v3,其准确性直接影响运动分支的学习效果。
- 输入序列顺序重排(文本在前)对于实现goal-aware视觉表示至关重要,不可忽略。
关联工作
- FlowVLA:基线方法,利用光流作为视觉思维链,但未预测未来视觉状态。(第 2 页)
- JOPAT:基线方法,联合去噪稀疏2D点轨迹和动作,但未结合未来特征前瞻。(第 2 页)
- Spatial Forcing:基线方法,通过隐式空间表示对齐增强VLA,属于未来预测类方法。(第 2 页)
- CoTracker-v3:用作训练时的冻结点追踪教师模型,生成稀疏点位移目标。(第 4 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
FoMoVLA:为视觉-语言-动作模型 bridging 视觉前瞻与运动指导
Wei Li1,∗, Peijin Jia1,∗, Yuan Ma1,∗,‡, Xuefeng Jiang2, Titong Jiang3, Sheng Sun2, Yujian Li1, Xin Wen1, Han Hong1, Zhikang Liu1, Bailin Li1, Kun Zhan1,† 1 理想汽车 2 中国科学院大学 3 清华大学 ∗ 同等贡献。 ‡ 项目负责人。 † 通讯作者。
摘要
视觉-语言-动作(VLA)模型在视觉运动策略学习中取得了令人印象深刻的成果,但本质上仍是被动的,仅将当前观测和语言映射为动作,缺乏对世界动态的显式前向预测。现有的视觉前瞻方法能够预测未来的视觉状态,但缺乏显式的运动指导——它们展示了“去哪里”,但未展示“如何到达”。我们认为,未来特征预测与稀疏点追踪(Point Tracking)具有天然的互补性:前者提供目标状态,后者捕捉朝向该目标的连续运动路径。我们提出了 FoMoVLA,这是一个通过联合学习未来特征前瞻和稀疏 2D 点追踪,为 VLA 表示增加显式时空监督的框架,从而增强前瞻 token 以解码连续动作状态。FoMoVLA 引入稀疏时间 2D 点轨迹以建模紧凑的几何运动,并通过一个轻量级的未来条件交叉注意力模块(FCCA)将两者耦合,该模块使得预期状态与点动态之间的一致性推理成为可能,从而显著增强动作生成。在 LIBERO、RoboCasa GR-1 Tabletop 和 LIBERO-Plus 上的大量实验证明了其最先进的性能以及强大的零样本泛化能力。项目页面 [cs.CV] 可在 https://liauto-research.github.io/FoMoVLA 获取。
图 1:架构对比。(a) 原始 VLA 直接将观测映射为动作。(b) 以辅助任务形式增强视觉前瞻的 VLA。(c) FoMoVLA 联合预测视觉前瞻和运动,通过强制预期状态与点动态之间的一致性来显著增强动作生成。
1 引言
机器人学习的最新进展确立了 VLA 模型作为机器人操作强大范式的地位,在多样化的操作任务中展现出卓越的性能 (Brohan et al. 2023; Kim et al. 2024; Li et al. 2024; Ghosh et al. 2024; Black et al. 2025b; Bjorck et al. 2025)。然而,现有的 VLA 方法通常仅依赖瞬时视觉观测和语言指令来学习直接的被动映射。虽然在标准具身任务中有效,但这种被动范式本质上缺乏对场景演化或长时程物体动态进行建模所需的时空前瞻能力。
越来越多的研究试图通过未来预测监督来提升 VLA 模型的前瞻能力 (Zhang et al. 2025; Bu et al. 2025; Bai et al. 2026; Lin et al. 2026)。然而,现有方法在真正服务于动作控制方面仍有不足。一方面,对多帧未来视觉状态的密集像素级预测保留了丰富的场景信息,但不可避免地捕获了大量与动作控制无关的静态内容 (Zhang et al. 2026c),导致表示冗余和高昂的建模开销。另一方面,更紧凑的关键帧级未来表示提高了效率,但通常仅表征要达到的目标状态,未能捕捉到达该状态所需的具体动态交互 (Zhong et al. 2025; Lin et al. 2026)。
我们认为,可操作的前瞻(actionable foresight)不仅应编码未来状态本身,还应编码通向该状态的连续时间运动动态。基于这一见解,我们通过预测未来特征而非原始像素来实现视觉前瞻,并通过稀疏点追踪来实现运动指导,后者编码了任务相关物体将移动的位置。除了预测未来视觉像素之外,通过 2D 点轨迹进行的运动追踪 (Karaev et al. 2024; Zhang et al. 2026b; Qian et al. 2026) 提供了与动作更对齐的世界动态时空表示,捕捉了整个任务执行过程中的连续局部运动和交互细节。关键在于,我们使用未来特征作为目标状态锚点,并将终端状态建模与时间点追踪统一起来,以联合指导动作生成。通过这种方式,未来想象不再是一个孤立的辅助
第 2 页
辅助目标。相反,它与点追踪协同工作,将前瞻能力直接注入动作生成过程,使策略能够学习既面向未来又受物理约束的动作。
为此,我们提出了 FoMoVLA,它在基础模型中联合学习未来特征预测和稀疏 2D 点追踪,作为互补的仅训练阶段监督信号。具体而言,几个可学习的前瞻 token 通过指数移动平均教师网络(EMA Teacher)进行监督,以学习视觉前瞻,提供紧凑的目标状态表示;同时,一个冻结的现成点追踪器为稀疏网格点提供逐帧位移目标,迫使图像 token 的隐藏状态编码显式的运动线索。关键在于,这两个目标并非独立:一个零初始化的交叉注意力模块(FCCA)使点追踪以前瞻表示为条件,将局部轨迹估计锚定在全局前瞻先验上。在推理阶段,所有辅助分支均被丢弃,不增加任何参数开销且延迟可忽略不计。我们的主要贡献如下:
- 我们引入了一种新颖的视觉-语言-动作(VLA)框架,通过联合学习紧凑的未来特征预测和稀疏 2D 点追踪,利用显式的时空监督增强潜在表示。
- 我们提出了一种未来条件交叉注意力模块(FCCA),将前瞻 token 与时间点追踪耦合,确保预期视觉状态与几何运动动力学之间的一致性。
- 我们在 LIBERO 和 RoboCasa GR-1 Tabletop 上取得了最先进的性能,并在 LIBERO-Plus 上展现出强大的零样本泛化能力,在多种操作任务中优于具有竞争力的 VLA 基线模型。
2 相关工作
视觉-语言-动作模型。通过直接在机器人演示数据上微调预训练的视觉-语言模型(VLM),视觉-语言-动作(VLA)模型将视觉观察和语言指令映射为机器人动作(Brohan et al. 2023; Kim et al. 2024; Ghosh et al. 2024)。该领域随后沿着两个主要方向取得进展。在策略方面,开发了更具表达力的动作解码器,包括流匹配(Flow Matching)(Black et al. 2025b; Physical Intelligence et al. 2026)和基于扩散的公式化方法(Chi et al. 2023; Liu et al. 2025; Li et al. 2024)。在感知方面,采用了具有双系统架构(Bjorck et al. 2025)和专用视觉编码器(Shi et al. 2026)的更强骨干网络,以改善视觉接地。尽管取得了这些进展,最近的研究表明,具身控制的主要瓶颈在于 VLM 的视觉模块,而非其语言理解或动作解码能力(Zhang et al. 2026a)。这表明,下游操作能力的提升不仅需要扩展 VLM 骨干网络,更需要从根本上增强其表示视觉结构和动态的能力。
预测性监督与运动追踪。为了弥补这一差距,越来越多的工作将未来预测或运动追踪引入 VLA 训练,通过显式或隐式的预测目标实现。像素级方法预测未来帧,或将视觉生成与动作预测交错进行(Cen et al. 2025; Zhang et al. 2025; Hu et al. 2026; Cai et al. 2026),以巨大的计算开销为代价提供丰富的监督。潜在空间方法通过在 VLM 特征空间中直接预测未来表示,提供了一种更高效的替代方案(Sun et al. 2026; Fan et al. 2026; Lyu et al. 2026; Su et al. 2026; Ma et al. 2025; Syed et al. 2026)。几何方法以更紧凑的方式捕捉运动:FlowVLA 预测像素级光流作为视觉思维链(Zhong et al. 2025);JOPAT 在扩散框架内联合去噪稀疏 2D 点追踪、可见性掩码和动作(Guan et al. 2026);Spatial Forcing 在训练期间将冻结教师中的几何知识蒸馏为辅助监督(Li et al. 2026a)。这些方法表明,运动和几何信息可以增强动作预测。然而,这些方法分别学习视觉前瞻或运动追踪,缺乏显式交互。相比之下,我们的方法在共享骨干网络中联合学习未来特征预测和点追踪。
3 方法
我们的框架如图 2 所示,通过三个互补的训练时分支增强 VLA 策略,将显式的时空监督注入学习到的表示中。具体而言,它包括:(1) 一个点追踪分支,在冻结点追踪器的监督下从图像 token 隐藏状态预测 2D 点轨迹,将图像特征接地于显式的运动线索(如何移动)(第 3.2 节);(2) 一个未来特征预测分支,用于学习未来视觉状态的紧凑表示(最终到达何处)(第 3.3 节);以及 (3) 一个未来条件交叉注意力(FCCA)模块,通过将运动预测条件化于预测的未来,将这两个目标耦合(第 3.4 节)。
3.1 预备知识
VLA 策略公式化。典型的 VLA 模型定义了一个策略 $\pi$,将视觉观察 $o_t \in \mathbb{R}^{H \times W \times 3}$ 和自然语言指令 $l$ 映射为 $T$ 个连续动作的块 $a_{t:t+T} \in \mathbb{R}^{T \times D}$,其中 $D$ 为动作维度。遵循动作分块范式(Black et al. 2025b; Jiang et al. 2025),在每个控制步骤联合预测整个块能够实现时间上连贯的执行。预训练的 VLM 作为骨干网络:视觉编码器将 $o_t$ 标记为 $M$ 个空间图像 token,隐藏维度为 $d$;与标记化的指令 $l$ 一起输入 VLM,产生上下文表示 $c$,用于条件化动作头。
流匹配动作头。动作头通过条件流匹配进行训练(Black et al. 2025b; Bjorck et al. 2025)。在标准高斯噪声 $x_0 \sim \mathcal{N}(0, I)$ 和真实动作块 $x_1 = a_{t:t+T}$ 之间定义线性插值路径:
$$ x_\tau = (1 – \tau) x_0 + \tau x_1, \quad \tau \sim U[0, 1]. \quad (1) $$
第 3 页
图 2:FoMoVLA 的概述。给定当前观测和语言指令,VLM 主干网络处理图像 token(文本 token 置于首位以实现目标感知条件控制)以及 K 个可学习的 <Foresight> token。
DiT 网络 $v_\theta(x_\tau, \tau, c)$ 被训练以匹配恒定条件速度 $x_1 – x_0$: $$ \mathcal{L}_{\text{action}} = \mathbb{E}_{\tau, x_0, x_1} \left[ \| v_\theta(x_\tau, \tau, c) – (x_1 – x_0) \|^2 \right]. \quad (2) $$ 在推理时,通过从 $\tau=0$ 到 $\tau=1$ 积分 $dx/d\tau = v_\theta(x_\tau, \tau, c)$ 来恢复动作块。
3.2 点追踪
为了使 VLM 的图像 token 表示建立在显式的空间运动之上,我们监督它们预测跨越整个动作块的 2D 点轨迹。一个关键的前提是这些表示必须具备目标感知能力:模型必须根据语言指令理解物体应移动到哪里。在具有因果注意力的标准自回归 VLM 中,置于文本 token 之前的图像 token 无法关注序列中后续出现的文本 token。因此,我们重新排序输入序列,使文本 token 位于图像 token 之前,从而确保每个图像 token 的隐藏状态都受到完整语言指令的条件约束,这为从图像 token 隐藏状态解码任务相关的运动提供了必要的基础。
稀疏点选择。 视觉编码器以固定的 patch 步长 $s$ 处理输入图像,生成 $H' \times W'$ 的空间特征图。我们通过将每个压缩 patch 单元的中心映射回原始图像中的相应坐标,定义一组 $N = H' \times W'$ 的查询点,从而在图像 token 和空间查询位置之间建立一一映射,产生一种轻量级的几何监督信号。每个图像 token 的隐藏状态因此直接与动作块时间范围内的一个可追踪点相关联。
通过点追踪进行监督。 给定当前帧 $o_t$ 和 $N$ 个网格点,冻结的点追踪器作为教师网络,用于生成稀疏的真实位移目标,从而避免了昂贵的密集像素渲染。$d^\star \in \mathbb{R}^{N \times T \times 2}$(按图像尺寸归一化)和可见性标签 $v^\star \in \{0, 1\}^{N \times T}$,其中 $T$ 是动作块的长度。具体而言,我们使用 CoTracker-v3 (Karaev et al. 2024) 作为追踪教师。追踪器沿动作块的所有 $T$ 帧向前追踪每个点,提供密集的逐帧时间监督。它仅在训练期间使用,并在推理时丢弃;所有运动知识都被吸收进 VLM 主干网络的参数中。
对齐头。 从位于 $N$ 个图像 token 位置的 VLM 隐藏状态中,我们提取潜在特征 $h \in \mathbb{R}^{N \times d}$。两个轻量级投影头预测点位移和可见性: $$ \hat{d} = f_{\text{track}}(h) \in \mathbb{R}^{N \times T \times 2}, \quad \hat{v} = f_{\text{vis}}(h) \in \mathbb{R}^{N \times T} \quad (3) $$ 其中 $f_{\text{track}}$ 是一个两层 MLP(LayerNorm → Linear → GELU → Linear),$f_{\text{vis}}$ 具有类似的架构,但隐藏维度较小。
运动损失。 运动对齐目标结合了位移回归、可见性分类和轨迹平滑度: $$ \mathcal{L}_{\text{track}} = \mathcal{L}_{\text{disp}} + \mathcal{L}_{\text{vis}} + \lambda_{\text{smooth}} \mathcal{L}_{\text{smooth}} \quad (4) $$
第 4 页
1 $$L_{disp} = \sum_{n,t} v^\star_{n,t} \|\hat{d}_{n,t} – d^\star_{n,t}\|^2 \quad (5)$$ $$L_{vis} = \text{BCE}(\hat{v}, v^\star) \quad (6)$$ $$L_{smooth} = \frac{1}{N(T-2)} \sum_{n,t} v^\star_{n,t} \|\Delta^2 \hat{d}_{n,t}\|^2 \quad (7)$$
平滑项对二阶时间差分 $\Delta^2 \hat{d}_{n,t} = \hat{d}_{n,t+1} – 2\hat{d}_{n,t} + \hat{d}_{n,t-1}$ 进行正则化,以抑制剧烈的运动变化并促进符合物理规律的轨迹。所有损失项均通过真实可见性进行掩码处理,以便被遮挡的点不会贡献噪声梯度。
3.3 未来特征预测
虽然跟踪分支提供了基于单个空间位置的稀疏逐帧运动监督,但它并未编码最终目标状态的整体表示。因此,我们在图像和指令标记之后附加 $K$ 个特殊的 <Foresight> 标记,并训练其隐藏状态以编码 $o_{t+T}$(动作块的最后帧)的视觉特征。这些标记从而为目标场景配置提供了紧凑的语义表示。与使用所有 $N$ 个图像标记隐藏状态来预测 $T$ 步内逐帧位移的跟踪分支不同,$K$ 标记瓶颈故意保持紧凑,鼓励模型捕捉全局场景级变化,而非细粒度的时间细节。
EMA 教师网络。为了提供稳定的回归目标,我们维护视觉编码器的影子副本,并通过指数移动平均(EMA)以动量 $\mu$ 作为教师进行更新。对于目标帧 $o_{t+T}$,冻结的 EMA 教师生成目标视觉特征 $z^\star \in \mathbb{R}^{M \times d}$,其中 $M = H' \times W'$ 是视觉补丁的数量。
MAE 解码器。为了从紧凑的 $K$ 标记瓶颈重构紧凑的 $M$ 补丁目标,我们采用轻量级的 MAE 解码器。$K$ 个 <Foresight> 隐藏状态与 $M-K$ 个可学习的掩码标记拼接,并通过带有正弦位置嵌入的轻量级 ViT 解码器,得到重构预测 $\hat{z} \in \mathbb{R}^{M \times d}$。重构目标为余弦相似度损失: $$L_{foresight} = \frac{1}{M} \sum_{i=1}^{M} \left( 1 – \frac{\hat{z}_i \cdot z^\star_i}{\|\hat{z}_i\| \|z^\star_i\|} \right) \quad (8)$$
对于推理,$K$ 个 <Foresight> 标记保留在输入序列中,允许动作头对具有未来信息的隐藏状态进行交叉注意力机制,从而为后续动作块获取目标视觉状态的显式先验。
3.4 未来条件点追踪
上述两个目标,即未来特征预测和几何点追踪,可以独立优化为并行辅助损失项。然而,这将它们视为无关的正则化项。我们假设,如果模型知道预期的未来状态,运动预测将从中受益:如果模型知道未来的视觉状态将是什么样子,那么预测每个点如何移动以到达该状态就变成了一个约束更好的问题。
为了实例化这种条件约束,我们在 VLM 的视觉标记提取器和位移投影器之间插入一个轻量级的 FCCA 模块。令 $H_{vis} \in \mathbb{R}^{N \times d}$ 表示网格位置处的视觉特征,$H_{fut} \in \mathbb{R}^{K \times d}$ 表示 <Foresight> 位置处的 VLM 隐藏状态。FCCA 模块计算: $$\tilde{H}_{vis} = H_{vis} + \text{MHA}(\text{LN}(H_{vis}), \text{LN}(H_{fut}), \text{LN}(H_{fut})) \quad (9)$$ 其中 MHA 是具有 8 个头部的多头注意力机制,LN 表示层归一化。
MHA 的输出投影初始化为零,使得该模块在训练开始时表现为恒等映射,从而在不扰动的情况下保留预训练 VLM 的特征。随着训练的进展,该模块逐渐学习将未来信息注入到供给位移预测器的空间标记中。
这种设计通过使用 FCCA 将前瞻表示作为运动预测的条件信号,将两个分支连接起来,确保预测的未来状态和点轨迹在联合上一致。
3.5 训练与推理
训练目标。整体训练损失结合了动作预测与两个辅助目标: $$L = L_{action} + \lambda_1 L_{foresight} + \lambda_2 (L_{disp} + L_{vis} + \lambda_{smooth} L_{smooth}) \quad (10)$$ 其中 $\lambda_1, \lambda_2$ 和 $\lambda_{smooth}$ 是损失权重系数,详见第 4.1 节。动作损失 $L_{action}$ 是 DiT 动作头的流匹配目标。点追踪教师网络仅用于生成监督信号,且不接收梯度更新;EMA 教师网络仅通过动量平均进行更新,不进行反向传播。
推理。在测试时,所有辅助分支都被丢弃。唯一的修改是在输入中添加 $K$ 个 <Foresight> 标记,使中位延迟增加 9.4 ms,GPU 内存增加 0.1 GB(表 8)。
4 实验
4.1 实验设置
基准。LIBERO (Liu et al. 2023) 包含四个套件(Spatial, Object, Goal, Long),每个套件有 10 个任务,每个任务有 50 个演示。我们在每个任务上进行 20 次 rollout,其中 $T=8$。RoboCasa GR-1 Table-top (Nasiriany et al. 2024) 包含 GR-1 人形机器人的 24 个桌面抓取放置任务,每个任务有 1,000 个演示(共 24,000 个)。我们在每个任务上进行 50 次 rollout,其中 $T=16$。LIBERO-Plus (Fei et al. 2025) 在 10,030 个实例上扩展了 LIBERO,包含 7 个扰动维度(视角、机器人状态、语言、光照、背景、噪声、布局)。我们在扰动数据上评估零样本性能,无需任何微调。
基线。我们将 FoMoVLA 与三组现有方法进行比较。第一组由通用 VLA 和世界动作模型组成(GR00T-N1.5 (Bjorck et al. 2025) 和 $\pi_0$ (Black et al. 2025b),X-VLA (Zheng et al. 2026),
第 5 页
类型 方法 空间 物体 目标 长程 平均
GR00T-N1.5 (Bjorck 等 2025) (arXiv ’25) 92.0 92.0 86.0 76.0 86.5 π0 (Black 等 2025b) (RSS ’25) 96.8 98.8 95.8 85.2 94.1 X-VLA (Zheng 等 2026) (ICLR ’26) 98.2 98.6 97.8 97.6 98.1 LangForce (Lian 等 2026) (ICML ’26) 99.2 99.6 99.4 95.2 98.4 VLA/WAM Fast-WAM (Yuan 等 2026b) (arXiv ’26) 98.2 100.0 97.0 95.2 97.6 LingBot-VA (Li 等 2026b) (RSS ’26) 98.5 99.6 97.2 98.5 98.5 Cosmos Policy (Kim 等 2026) (ICLR ’26) 98.1 100.0 98.2 97.6 98.5 Spatial Forcing (Li 等 2026a) (ICLR ’26) 99.4 99.6 98.8 96.0 98.5
WorldVLA (Cen 等 2025) (arXiv ’25) 87.6 96.2 83.4 60.0 81.8 DreamVLA (Zhang 等 2025) (NeurIPS ’25) 97.5 94.0 89.5 89.5 92.6 未来预测 UniVLA (Bu 等 2025) (RSS ’25) 96.5 96.8 95.6 92.0 95.2 LaRA-VLA (Bai 等 2026) (ICML ’26) 96.4 99.8 98.6 96.6 97.9 HiF-VLA (Lin 等 2026) (CVPR ’26) 98.8 99.4 97.4 96.4 98.0
FlowVLA (Zhong 等 2025) (arXiv ’25) 93.2 95.0 91.6 72.6 88.1 点追踪 GeoPredict (Qian 等 2026) (CVPR ’26) 98.0 98.2 95.7 94.0 96.5 JOPAT (Guan 等 2026) (arXiv ’26) 97.2 98.9 98.4 96.4 97.8
基础骨干网络 97.8 98.8 97.4 92.0 96.5 + 未来预测 99.0 99.4 97.2 94.4 97.5 ours + 追踪 98.6 99.2 99.0 94.4 97.8 + 未来预测 + 追踪 98.8 99.4 99.2 95.8 98.3 + 未来预测 + 追踪 + FCCA 98.4 99.6 99.4 97.6 98.8
表 1:LIBERO 评估结果。我们将我们的方法与代表性的 VLA 基线、未来预测方法和点追踪方法进行比较,并进一步提供了每个提出组件的消融实验。完整模型在 4 个任务套件中实现了最高的平均成功率。
LangForce (Lian 等 2026)、Spatial Forcing (Li 等 2026a)、Fast-WAM (Yuan 等 2026b)、LingBot-VA (Li 等 2026b)、Cosmos Policy (Kim 等 2026))。第二组包括未来预测方法(WorldVLA (Cen 等 2025)、DreamVLA (Zhang 等 2025)、UniVLA (Bu 等 2025) 和 LaRA-VLA (Bai 等 2026)、HiF-VLA (Lin 等 2026)),这些方法预测未来的视觉表示,但不建模几何运动。第三组包含点追踪方法(FlowVLA (Zhong 等 2025)、GeoPredict (Qian 等 2026) 和 JOPAT (Guan 等 2026)),它们利用光流或点轨迹,但不预测未来的视觉状态。
实现细节。所有变体均基于 StarVLA-GR00T (Ye 等 2026) 作为基础骨干网络。输入图像被调整为 224×224 像素。ViT 的补丁大小为 16,产生 14×14 的特征图,该特征图进一步通过空间合并模块压缩为 8×8 图像令牌(M=N=64),并输入到 VLM 中。N=64 个追踪查询点放置在每个 8×8 补丁单元的中心,这些单元映射回原始图像分辨率。我们使用 K=16 个 <Foresight> 令牌。MAE 解码器通过一个 2 层 ViT 解码器将这些令牌与 M−K=48 个可学习的掩码令牌扩展。EMA 教师使用动量 µ=0.999。损失权重为 λ1=0.1,λ2=0.3,以及 λsmooth=0.1。我们使用 8 块 H20 GPU 配合 DeepSpeed ZeRO-2、AdamW (β1=0.9, β2=0.95) 以及每个模块的学习率(VLM:1×10−5;辅助头:1×10−4)进行训练。对于 LIBERO,训练步数为 30K,批量大小固定为 12;而对于 RoboCasa,训练步数为 100K,批量大小固定为 8。
4.2 主要实验
表 1 展示了主要结果,并有几点观察:(1) 两个辅助目标单独使用时均优于基础 VLA,证实了预测和几何监督提供了互补的归纳偏置。(2) 简单结合两个目标而未进行未来交互,仅带来适度的改进,表明独立的多任务训练存在协同效应有限的问题。(3) 包含 FCCA 的完整设计在所有 LIBERO 套件中均取得了具有竞争力的结果,表明通过未来条件显式连接这两个目标,其收益超过了简单的损失聚合。这种优势在 LIBERO-Long 和 RoboCasa 上尤为明显,因为在这些任务中,长程推理和精确的空间控制更为关键。
表 2 报告了 LIBERO-Plus 上的零样本 OOD 鲁棒性。FoMoVLA 达到了 80.5% 的整体得分,与 Abot-M0 相当,无需额外预训练,并显著优于 StarVLA (+6.4%)。最强的增益出现在语言 (+5.5% over StarVLA) 和背景扰动上。相机和机器人状态偏移上的增益较为温和,这可能是由于模型是在固定视角和初始姿态下训练的,使其难以仅凭 2D 运动线索泛化到新的配置。
表 3 总结了 RoboCasa GR-1 Tabletop 上的平均成功率。FoMoVLA 达到了 56.9%,比 StarVLA-GR00T 骨干网络提高了 9.1%,证明了我们的双目标训练在具有自观察的人形平台上带来了持续的增益。RoboCasa 的逐任务结果和组件级消融实验见表 7。
第 6 页
方法 预训练 相机 机器人 语言 光照 背景 噪声 布局 总计 π0 (Black et al. 2025b) ✓ 13.8 6.0 58.8 85.0 81.4 79.0 68.9 53.6 VLA-JEPA (Yang et al. 2026) ✓ 63.3 67.1 85.4 95.6 93.6 66.3 85.1 79.5 Abot-M0 (Yang et al. 2026) ✓ 60.4 67.9 86.4 96.2 91.6 86.4 82.6 80.5 OpenVLA (Kim et al. 2024) ✗ 0.8 3.5 23.0 8.1 34.8 15.2 28.5 15.6 WorldVLA (Cen et al. 2025) ✗ 0.1 27.9 41.6 43.7 17.1 10.9 38.0 25.0 UniVLA (Bu et al. 2025) ✗ 1.8 46.2 69.6 69.0 81.0 21.2 31.9 42.9 DreamVLA (Zhang et al. 2025) ✗ 26.2 17.6 67.0 77.5 71.5 53.6 43.5 48.9 Cosmos Policy (Kim et al. 2026) ✗ 69.6 51.0 89.6 97.7 85.7 87.3 83.7 79.7 StarVLA (Ye et al. 2026) ✗ 52.5 49.8 88.5 95.7 95.7 73.0 76.9 74.1 Qwen-RobotManip-scratch (Yuan et al. 2026a) ✗ 70.4 44.9 88.1 95.8 95.5 84.4 79.1 78.3 FoMoVLA (Ours) ✗ 64.0 62.2 94.0 94.1 96.2 82.2 79.6 80.5
表 2:在 LIBERO-Plus 上的分布外鲁棒性评估。所有方法均在零样本(zero-shot)且无微调的情况下进行评估。
在附录中。
方法 平均成功率
π0.5 (Black et al. 2025a) 37.0 StarVLA-FAST (Ye et al. 2026) 39.0 StarVLA-π (Ye et al. 2026) 43.9 StarVLA-GR00T (Ye et al. 2026) 47.8 GR00T-N1.6 (Bjorck et al. 2025) 47.6 StarVLA-OFT (Ye et al. 2026) 48.8
FoMoVLA (Ours) 56.9
表 3:RoboCasa GR-1 桌面任务(24 个任务,每个任务 50 次 rollout)的平均成功率(%)。
4.3 消融研究 未来条件约束。表 1 显示,包含 FCCA 的完整模型相较于非 FCCA 变体实现了稳定的性能提升(例如,在 LIBERO-Long 上提升 1.8%),这证实了只有当运动预测显式地以预测的未来表示为条件时,两个目标才能实现协同效应。图 3 从定性角度说明了这一点:没有 FCCA 时,预测的点轨迹表现出错误的位移方向;有了 FCCA,运动预测与点的实际追踪轨迹一致。这种定性证据表明,联合优化这两个目标比朴素的多任务训练能产生更连贯的时空表示。
稀疏监督设计。我们首先对点网格密度进行消融(表 4 的上半部分):稀疏的 8 × 8 网格(64 个点,与 patch 对齐)实现了最佳的整体性能,特别是在长视距任务上,而更密集的网格(16 × 16)则导致性能下降。这验证了我们轻量级稀疏点监督的设计选择,它使用了稀疏 4 倍的点集,但仍足以捕捉与任务相关的运动。对于前瞻解码器架构,MAE 瓶颈设计在长视距任务上优于 Direct-64,这证实了紧凑的 K-token 瓶颈鼓励全局目标状态编码,而非 patch 级别的记忆。
辅助任务耦合。表 4 的下半部分消融了耦合前瞻和追踪目标的设计选择。当两个分支都从相同的 16 个可学习目标 token(Shared goal tokens)中提取信息时,长视距任务上的性能急剧下降(85.8%)。我们将这种下降归因于共享 token 嵌入上的梯度干扰,因为这两个辅助目标偏好不同的信息:未来外观 versus 空间运动。为每个分支分配其各自的一组 16 个可学习查询(Separate query tokens)消除了这种梯度冲突,并恢复了强劲的性能(98.2%)。使用 64 个 ViT 图像
第 7 页
方法 空间 物体 目标 长程 平均
StarVLA-π 98.8 99.6 95.8 88.4 95.7 + FoMoVLA 98.2 98.6 98.0 96.6 97.9 ∆ -0.6 -1.0 +2.2 +8.2 +2.2
StarVLA-OFT 97.8 98.6 96.2 93.8 96.6 + FoMoVLA 99.0 99.4 99.0 94.8 98.0 ∆ +1.2 +0.8 +2.8 +1.0 +1.4
表 5:FoMoVLA 在不同主流视觉-语言-动作模型框架的策略头中的可扩展性。
结果表明,FoMoVLA 能够补充不同的策略头,而不是依赖于特定的动作解码器设计。
4.5 定性分析。
图 4:FoMoVLA 的定性结果。FoMoVLA 有效地学习了未来特征和点追踪。
我们在图 4 中可视化了当前观测特征、预测与真实未来特征、预测与真实点追踪,以及预测的变化热力图(当前特征与预测未来特征之间的逐块余弦距离)。预测的前瞻特征紧密重构了真实未来特征,证实了 K-token 瓶颈捕获的是全局场景级变化,而非记忆局部纹理。预测的点轨迹与真实运动对齐,表明几何监督已成功融入视觉语言模型主干网络。关键在于,预测的变化热力图集中在与任务相关的区域(被操作物体和末端执行器路径),同时抑制静态背景。前瞻锚点告诉模型场景在哪里发生变化,而点追踪指导如何发生变化,两者共同提供了互补证据,表明 FoMoVLA 学习的是时空接地表示,而非独立优化两个辅助损失。
表 4:设计选择:点网格密度、前瞻架构和前瞻-运动耦合设计对 LIBERO 成功率(%)的影响。
对于两个分支共享图像 token(Shared image tokens)的设计提供了一种不同的解决方案:由于这些特征主要由主动作预测目标优化,辅助损失不再在嵌入层面直接冲突,从而达到了 97.4% 的成功率。我们的最终设计(Image + Goal CrossAttn)通过将图像 token 作为运动解码器的输入,并通过前瞻查询 token 的交叉注意力注入目标导向上下文,实现了最佳结果(98.8%),从而在不产生表示干扰的情况下实现了合作性信息流。
4.4 跨不同框架的可扩展性。
为了评估 FoMoVLA 是否绑定于特定的动作形式化方法,我们进一步将其实例化在两个替代 StarVLA 变体之上:StarVLA-π 和 StarVLA-OFT。如表 5 所示,FoMoVLA 持续提升了这两个变体的性能。特别是,它将 StarVLA-π 的平均成功率从 95.7% 提升至 97.9%,在 LIBERO-Long 上增益最大(+8.2),同时将 StarVLA-OFT 从 96.6% 提升至 98.0%。这些结果表明 FoMoVLA 具有良好的通用性。
5 结论
在本文中,我们提出了 FoMoVLA,这是一个仅训练框架,通过未来特征预测和未来条件点追踪,赋予视觉-语言-动作模型显式的时空前瞻能力。联合学习紧凑的未来特征预测和稀疏、轻量级的点追踪,我们的方法产生了更具预测性和时空接地的视觉表示,从而改进了对未来状态转移的建模以及更有效的机器人操作。由于所有辅助组件仅在训练期间使用,FoMoVLA 不会带来额外的推理开销。在 LIBERO 和 RoboCasa 上的大量实验表明,与强基线相比,FoMoVLA 带来了一致的性能提升,突显了显式时空监督对视觉-语言-动作模型的有效性。
关于局限性,当前的追踪监督仅在图像空间中建模视图依赖运动,未能捕捉动态场景中的 3D 几何结构。未来的一个有前景的方向是将 2D 点追踪与 3D 运动预测相结合,以实现更丰富的几何推理,并提高对视角和深度变化的鲁棒性。
第 8 页
参考文献
Bai, S.; Lyu, J.; Zhou, W.; Li, Z.; Wang, D.; Xing, L.; Zhao, X.; Wang, P.; Wang, Z.; Chi, C.; 等人. 2026. Latent Reasoning VLA: 面向视觉-语言-动作模型的潜在推理与预测. 在 ICML 中.
Bjorck, J.; Castañeda, F.; Cherniadev, N.; Da, X.; Ding, R.; Fan, L.; Fang, Y.; Fox, D.; Hu, F.; Huang, S.; 等人. 2025. GR00T N1: 通用人形机器人的开放基础模型. arXiv:2503.14734.
Black, K.; Brown, N.; Darpinian, J.; 等人. 2025a. π0.5: 具有开放世界泛化能力的视觉-语言-动作模型. arXiv:2504.16054.
Black, K.; Brown, N.; Driess, D.; Esmail, A.; Equi, M.; Finn, C.; Fusai, N.; Groom, L.; Hausman, K.; Ichter, B.; 等人. 2025b. π0: 用于通用机器人控制的视觉-语言-动作流模型. 在 Robotics: Science and Systems (RSS) 中.
Brohan, A.; Brown, N.; Carbajal, J.; Chebotar, Y.; Chen, X.; Choromanski, K.; Ding, T.; Driess, D.; Dubey, A.; Finn, C.; 等人. 2023. RT-2: 将网络知识迁移至机器人控制的视觉-语言-动作模型. 在机器人学习会议 (CoRL) 中, 2165–2183. PMLR.
Bu, Q.; Yang, Y.; Cai, J.; Gao, S.; Ren, G.; Yao, M.; Luo, P.; 和 Li, H. 2025. UniVLA: 通过任务中心的潜在动作学习在任何地方行动. 在 RSS 中.
Cai, J.; Cai, Z.; Cao, J.; Chen, Y.; He, Z.; Jiang, L.; Li, H.; Li, H.; Li, Y.; Liu, Y.; 等人. 2026. InternVLA-A1: 统一机器人操作的感知、生成与动作. arXiv:2601.02456.
Cen, J.; Yu, C.; Yuan, H.; Jiang, Y.; Huang, S.; Guo, J.; Li, X.; Song, Y.; Luo, H.; Wang, F.; 等人. 2025. WorldVLA: 迈向自回归动作世界模型. arXiv:2506.21539.
Chi, C.; Xu, Z.; Feng, S.; Cousineau, E.; Du, Y.; Burchfiel, B.; Tedrake, R.; 和 Song, S. 2023. Diffusion Policy: 通过动作扩散进行视觉运动策略学习. 在 RSS 中.
Fan, J.; Liu, Y.; Li, S.; Ren, B.; Li, S.; Zhang, X.-P.; Ding, W.; 和 Deng, Z. 2026. FUTURE-VLA: 实时执行下的统一轨迹预测. arXiv:2602.15882.
Fei, S.; Wang, S.; Shi, J.; Dai, Z.; Cai, J.; Qian, P.; Ji, L.; He, X.; Zhang, S.; Fei, Z.; Fu, J.; Gong, J.; 和 Qiu, X. 2025. LIBERO-Plus: 视觉-语言-动作模型的深入鲁棒性分析. arXiv:2510.13626.
Ghosh, D.; Walke, H.; Pertsch, K.; Black, K.; Mees, O.; Dasari, S.; Hejna, J.; Kreiman, T.; Xu, C.; Luo, J.; 等人. 2024. Octo: 一个开源通用机器人策略. 在 Robotics: Science and Systems (RSS) 中.
Guan, J.; Zhao, W.; Pei, Y.; Chen, Z.; Solin, A.; 和 Kannala, J. 2026. 点追踪提升世界动作模型. arXiv:2605.23856.
Hu, Y.; Zhang, J.; Luo, Y.; Guo, Y.; Chen, X.; Sun, X.; Feng, K.; Lu, Q.; Chen, S.; Zhang, Y.; Li, W.; 和 Chen, J. 2026. BagelVLA: 通过交错的视觉-语言-动作生成增强长时程操作. arXiv:2602.09849.
Jiang, T.; Jiang, X.; Ma, Y.; Wen, X.; Li, B.; Zhan, K.; Jia, P.; Liu, Y.; Sun, S.; 和 Lang, X. 2025. 学得越好,剪枝越精:迈向高效的视觉-语言-动作模型. 通过可微分令牌剪枝优化模型. arXiv:2509.12594.
Karaev, N.; Rocco, I.; Graham, B.; Neverova, N.; Vedaldi, A.; 和 Rupprecht, C. 2024. CoTracker: 联合追踪效果更佳. arXiv:2307.07635.
Kim, M. J.; Gao, Y.; Lin, T.-Y.; Lin, Y.-C.; Ge, Y.; Lam, G.; Liang, P.; Song, S.; Liu, M.-Y.; Finn, C.; 和 Gu, J. 2026. Cosmos Policy: 微调视频模型以进行视觉运动控制和规划. arXiv:2601.16163.
Kim, M. J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; 等人. 2024. OpenVLA: 一个开源视觉-语言-动作模型. 在机器人学习会议 (CoRL) 中, 第 270 卷, 2679–2713. PMLR.
Li, F.; Song, W.; Zhao, H.; Wang, J.; Ding, P.; Wang, D.; Zeng, L.; 和 Li, H. 2026a. Spatial Forcing: 视觉-语言-动作模型的隐式空间表示对齐. 在 ICLR 中.
Li, L.; Zhang, Q.; Luo, Y.; Yang, S.; Wang, R.; Han, F.; Yu, M.; Gao, Z.; Xue, N.; Zhu, X.; Shen, Y.; 和 Xu, Y. 2026b. 用于机器人控制的因果世界建模. arXiv:2601.21998.
Lian, S.; Yu, B.; Lin, X.; Yang, L. T.; Shen, Z.; Wu, C.; Miao, Y.; Huang, C.; 和 Chen, K. 2026. LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解. 在第 43 届国际机器学习会议论文集, 机器学习研究会议论文集. PMLR.
Lin, M.; Ding, P.; Wang, S.; Zhuang, Z.; Liu, Y.; Tong, X.; Song, W.; Lyu, S.; Huang, S.; 和 Wang, D. 2026. HiF-VLA: 通过运动表示实现视觉-语言-动作模型的后见之明、洞察与视觉前瞻. arXiv:2512.09928.
Liu, B.; Zhu, Y.; Gao, C.; Feng, Y.; Liu, Q.; Zhu, Y.; 和 Stone, P. 2023. LIBERO: 终身机器人学习的知识迁移基准. 在神经信息处理系统进展 (NeurIPS) 中.
Liu, S.; Wu, L.; Li, B.; Tan, H.; Chen, H.; Wang, Z.; Xu, K.; Su, H.; 和 Zhu, J. 2025. RDT-1B: 用于双臂操作的扩散基础模型. 在 ICLR 中.
Lyu, J.; Liu, K.; Zhang, X.; Liao, H.; Feng, Y.; Zhu, W.; Shen, T.; Chen, J.; Zhang, J.; Dong, Y.; 等人. 2026. LDA-1B: 通过通用具身数据摄入扩展潜在动态动作模型. 在 RSS 中.
Ma, X.; Xing, L.; Zhang, H.; Li, W.; 和 Lu, S. 2025. 统一感知与动作:用于机器人动作生成的混合模态管道与隐式视觉思维链. arXiv:2511.19859.
Nasiriany, S.; Maddukuri, A.; Zhang, L.; Parikh, A.; Lo, A.; Jia, P.; Joshi, A.; Mandlekar, A.; 和 Zhu, Y. 2024. RoboCasa: 面向通用机器人的日常任务大规模仿真. 在 Robotics: Science and Systems (RSS) 中.
第 9 页
Physical Intelligence; Ai, B.; Amin, A.; Aniceto, R.; Balakrishna, A.; Black, K.; Driess, D.; Finn, C.; Hausman, K.; Levine, S.; et al. 2026. π0.7: A Steerable Generalist Robotic Foundation Model with Emergent Capabilities. arXiv:2604.15483. Qian, J.; Han, B.; Shi, C.; Xiao, L.; Yang, L.; Shi, S.; and Jiang, L. 2026. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation. arXiv:2512.16811. Shi, H.; Xie, B.; Liu, Y.; Sun, L.; Liu, F.; Wang, T.; Zhou, E.; Fan, H.; Zhang, X.; and Huang, G. 2026. MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation. In ICLR. Su, Y.; Chen, S.; Shi, H.; Liu, M.; Zhang, Z.; Huang, N.; Zhong, W.; Zhu, Z.; Liu, Y.; and Liu, X. 2026. World Guidance: World Modeling in Condition Space for Action Generation. arXiv:2602.22010. Sun, J.; Zhang, W.; Qi, Z.; Ren, S.; Liu, Z.; Zhu, H.; Sun, G.; Jin, X.; and Chen, Z. 2026. VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model. arXiv:2602.10098. Syed, S. N.; Jakobsson, A.; Hao, H.; and Ichnowski, J. 2026. Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation. arXiv:2606.02486. Yang, Y.; Zeng, S.; Lin, T.; Chang, X.; Qi, D.; Xiao, J.; Liu, H.; Chen, R.; Chen, Y.; Huo, D.; et al. 2026. ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning. arXiv:2602.11236. Ye, J.; et al. 2026. StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing. arXiv:2604.05014. Yuan, H.; Liang, Z.; Chen, A.; Wang, Y.; Li, H.; Lin, P.; Huang, Y.; Lei, Z.; Zhang, T.; Zhang, J.; Zhang, J.; Fan, J.; Zhou, G.; Peng, Q.; Lv, C.; Chen, X.; Yang, A.; Huang, F.; Lin, J.; Liu, D.; Zhou, J.; Wu, C.; and Chen, X.-H. 2026a. Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models. arXiv:2606.17846. Yuan, T.; Dong, Z.; Liu, Y.; and Zhao, H. 2026b. Fast-WAM: Do World Action Models Need Test-time Future Imagination? arXiv:2603.16666. Zhang, J.; Chen, X.; Wang, Q.; Li, M.; Guo, Y.; Hu, Y.; Zhang, J.; Bai, S.; Lin, J.; and Chen, J. 2026a. VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models. arXiv:2601.03309. Zhang, J.; Zheng, C.; Yang, Y.; Argus, M.; Soraki, R.; Han, W.; Anderson, T.; Li, C.-L.; Liu, S.; Duan, J.; Ren, Z.; Zhang, J.; and Krishna, R. 2026b. MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction. arXiv:2606.18558. Zhang, W.; Liu, H.; Qi, Z.; Wang, Y.; Yu, X.; Zhang, J.; Dong, R.; He, J.; Lu, F.; Wang, H.; et al. 2025. DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge. arXiv:2507.04447. Zhang, Z.; Luo, W.; Wang, H.; Sheng, Y.; Wang, Y.; Guo, H.; Ren, H.; Du, X.; Che, Y.; Cao, T.; Yuan, L.; and Yu, Y. 2026c. Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation. arXiv:2605.01772. Zheng, J.; Li, J.; Wang, Z.; Liu, D.; Kang, X.; Feng, Y.; Zheng, Y.; Zou, J.; Chen, Y.; Zeng, J.; et al. 2026. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model. In ICLR. Zhong, Z.; Yan, H.; Li, J.; Liu, X.; Gong, X.; Zhang, T.; Song, W.; Chen, J.; Zheng, X.; Wang, H.; and Li, H. 2025. FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models. arXiv:2508.18269.
第 10 页
FoMoVLA:为视觉-语言-动作模型搭建视觉前瞻与运动指导的桥梁
补充材料
A A.1 模型参数分解 表 6 详细列出了 FoMoVLA 的参数分解情况。在训练过程中,整个模型通过辅助分支引入了 60.7 M 的额外参数(+1.3%):前瞻解码器(30.5 M)、FCCA 模块(26.2 M)、追踪投影器(2.6 M)以及可见性头(1.3 M)。由于所有辅助分支在推理时均被丢弃,部署参数与 Vanilla 基线(4599.3 M)保持一致。
模块 Vanilla FoMoVLA
VLM 主干网络 4437.8 4437.8 动作模型 161.5 161.5 前瞻解码器 – 30.5 FCCA 模块 – 26.2 追踪投影器 – 2.6 可见性头 – 1.3
训练总参数量 (M) 4599.3 4660.0 推理总参数量 (M) 4599.3 4599.3
表 6:模型参数分解(单位:百万)。辅助分支(阴影行)在推理时被丢弃, 保持与 Vanilla 基线相同的部署规模。 双向自注意力以形成连贯的未来表示,并且 (3) 动作令牌对所有 可用信息具有完全可见性。图 5 说明了注意力掩码 A.2 注意力掩码设计 的结构。 如第 3.2 节所述,我们重新排序输入序列,将指令令牌置于图像令牌之前,以确保目标感知的视觉表示。此处详述了控制 VLM 主干网络内跨模态交互的完整注意力掩码设计。 输入序列组织为:指令 → 当前图像 → 前瞻 → 动作。我们采用具有下列规则的结构性注意力掩码:(1) 指令令牌之间使用严格的因果注意力,仅关注前面的令牌;(2) 当前图像令牌对所有前面的指令令牌以及它们自身进行因果注意力,确保视觉表示完全受语言指令条件约束;(3) 前瞻令牌之间采用双向注意力,同时 additionally 关注所有指令和当前图像令牌——这使得 K 个 <Foresight> 令牌可以自由交换信息,促进基于任务规范和当前观测对预测未来状态的整体编码;(4) 动作令牌关注所有前面的模态——指令、当前图像和前瞻令牌——使动作头能够利用包括未来信息表示在内的完整上下文进行动作预测。 这种非对称注意力设计确保了 (1) 指令令牌向所有下游模态提供单向条件约束,而不受视觉观测的影响;(2) 前瞻令牌通过
B 额外实验分析 B.1 推理成本 表 8 比较了 Vanilla 基线与 FoMoVLA 之间的推理成本。部署时唯一的额外开销来自处理附加到输入序列的 K=16 个 <Foresight> 令牌。这仅使中位推理延迟增加 9.4 ms,分配的 GPU 内存仅增加 0.1 GB。与主论文中报告的显著性能提升相比,这些边际成本可以忽略不计,证实 FoMoVLA 引入了极小的部署开销。
B.2 FCCA 对点追踪的定量影响 为了量化 FCCA 对点追踪质量的影响,我们使用冻结的 CoTracker 教师网络作为真实值,在 LIBERO-10 训练集的 10,000 个样本上评估使用和不使用 FCCA 训练的模型。我们报告四个指标:(1) ATE-all,所有 64 个追踪网格点的平均轨迹误差;(2) ATE-moving,仅限于真实位移超过 3 px 的点(捕捉与任务相关的运动);(3) Median TE,移动点的中位轨迹误差(对异常值鲁棒);(4) Survival@10px,最终帧
第 11 页
+ 未来预测 + 未来预测 任务 基础模型 + 未来预测 + 追踪 + 追踪 + 追踪 + FCCA
PnPBottleToCabinetClose 46.0 64.0 70.0 68.0 72.0 PnPCanToDrawerClose 80.0 68.0 72.0 79.0 73.0 PnPCupToDrawerClose 54.0 52.0 50.0 51.0 41.0 PnPMilkToMicrowaveClose 48.0 60.0 38.0 56.0 51.0 PnPPotatoToMicrowaveClose 28.0 42.0 28.0 40.0 38.0 PnPWineToCabinetClose 46.0 44.0 56.0 54.0 49.0 PnPNovelFromCuttingboardToBasket 48.0 48.0 52.0 57.0 54.0 PnPNovelFromCuttingboardToCardboardbox 40.0 54.0 36.0 52.0 53.0 PnPNovelFromCuttingboardToPan 68.0 82.0 70.0 70.0 69.0 PnPNovelFromCuttingboardToPot 52.0 62.0 42.0 61.0 67.0 PnPNovelFromCuttingboardToTieredbasket 56.0 62.0 44.0 51.0 55.0 PnPNovelFromPlacematToBasket 42.0 60.0 54.0 55.0 60.0 PnPNovelFromPlacematToBowl 44.0 54.0 60.0 56.0 51.0 PnPNovelFromPlacematToPlate 48.0 54.0 74.0 57.0 71.0 PnPNovelFromPlacematToTieredshelf 18.0 24.0 30.0 44.0 27.0 PnPNovelFromPlateToBowl 60.0 62.0 70.0 58.0 51.0 PnPNovelFromPlateToCardboardbox 50.0 54.0 60.0 53.0 61.0 PnPNovelFromPlateToPan 54.0 58.0 64.0 54.0 63.0 PnPNovelFromPlateToPlate 70.0 74.0 76.0 76.0 76.0 PnPNovelFromTrayToCardboardbox 38.0 40.0 62.0 56.0 60.0 PnPNovelFromTrayToPlate 56.0 58.0 78.0 74.0 78.0 PnPNovelFromTrayToPot 50.0 68.0 64.0 53.0 71.0 PnPNovelFromTrayToTieredbasket 36.0 44.0 50.0 51.0 45.0 PnPNovelFromTrayToTieredshelf 16.0 18.0 34.0 32.0 30.0
平均值 47.8 54.4 55.6 56.6 56.9
表 7:RoboCasa GR-1 桌面场景的消融研究:24 个任务(每个任务 50 次 rollout)的逐任务成功率(%)。每一列在基础模型上逐步增加一个组件。
指标 基础模型 FoMoVLA
中位延迟 (ms) 94.3 103.7 平均延迟 (ms) 97.5 103.8 分配的 GPU 显存 (GB) 9.3 9.4
表 8:推理成本比较。延迟和显存 图 6:有无 FCCA 的点追踪精度的定量比较。引入未来-条件交叉注意力减少了轨迹误差(ATE-all、ATE-moving、中位 TE),并显著提高了 Survival@10px,证实了未来状态条件为运动预测提供了强大的几何先验。
在动作块结束时,FCCA 使得绝大多数被追踪的点收敛到紧密的误差界限内。这些结果证实,将运动预测显式地条件化于预测的未来状态——而不是将未来预测和点追踪视为独立的目标——能够产生更准确、更可靠的轨迹估计。误差保持在 10 像素以下。
如图 6 所示,引入 FCCA 在所有指标上均带来了一致的改进。ATE-all 从 1.2 像素降至 0.9 像素(-25.0%),ATE-moving 从 3.8 像素降至 2.3 像素(-39.5%),表明对任务相关运动点的位移预测显著更准确。中位 TE 同样从 3.7 像素降至 2.1 像素(-43.2%),证实这种改进并非仅由异常值校正驱动。最显著的是,Survival@10px 从 78.0% 增加到 95.3%(+17.3 个百分点),证明了
B.3 RoboCasa GR-1 桌面消融 定量结果 表 7 展示了在 RoboCasa GR-1 桌面基准(24 个任务,每个任务 50 次 rollout)上的逐组件消融结果。从基础模型(47.8%)开始,仅添加未来预测将平均成功率提升至 54.4%(+6.6%),并添加点
第 12 页
图 7:RoboCasa GR-1 桌面任务(第一人称视角)上的定性结果。从左至右依次为:当前观测、真实未来帧、真实未来 PCA 特征、预测的视觉前瞻 PCA、真实点追踪、预测点追踪以及预测的变化热力图。该模型成功处理了非平稳的第一人称视角,产生了准确的未来预测和运动轨迹。
仅追踪带来的提升为 55.6%(+7.8%),表明两个辅助目标均独立地增强了策略学习。结合这两个目标进一步将性能提升至 56.6%(+8.8%),证明了它们的互补性:未来预测提供了语义目标状态的理解,而追踪提供了几何运动推理。最后,引入 FCCA 实现了最佳的整体性能 56.9%(+9.1%),证实了对运动预测进行显式未来表示条件化对于实现完全协同至关重要。这些趋势与 LIBERO 的消融实验(表 1)一致,验证了所提出的组件在不同的机器人形态和相机配置(第一人称与第三人称)下具有泛化能力。
定性结果 为了进一步验证 FoMoVLA 在固定相机设置之外的通用性,我们在 RoboCasa GR-1 桌面基准测试上展示了定性可视化结果(图 7)。与使用静态第三人称相机的 LIBERO 不同,RoboCasa 提供安装在机器人头部的第一人称观测,引入了连续的视角