先预见后行动:未来状态条件视觉语言导航

三分钟导读:FSC-VLN通过在训练阶段引入冻结视觉编码器提取的未来状态作为停止梯度目标,对齐可学习的未来查询token,从而在不增加推理成本的情况下提升端到端VLM导航策略在长程任务中的表现。

英文题目:Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

论文出处:arXiv 每日论文精选 · arXiv:2607.18042

原始论文:PDF / 论文页面

对应视频标题:先预见后行动:未来状态条件视觉语言导航|推荐指数:★★★★★

这篇论文解决什么问题?

标准行为克隆仅监督下一步动作,未显式训练策略状态预测未来视觉结果,导致在长程连续导航中误差累积难以纠正。

核心创新

  • 提出特权专家未来输入诊断,验证未来视觉信息对当前动作选择的有用性。
  • 设计轻量级双查询机制,将未来状态预测与动作条件生成解耦,通过因果注意力让qA利用qF的预测信息。
  • 实现无需推理时访问未来图像的未来状态监督,仅增加两个前缀token,保持推理效率。

方法概览

提出FSC-VLN,在因果token序列中插入可学习的未来查询(qF)和行动查询(qA)。训练时,利用冻结的SigLIP编码器提取专家轨迹未来帧(Δ=32步)的视觉嵌入作为停止梯度目标,通过投影空间L1损失对齐qF的隐藏状态。推理时丢弃未来目标分支,仅使用在线上下文和两个查询token进行单次因果预填充。

逐图理解论文

方法概述:双查询与未来监督

方法概述:双查询与未来监督
Figure 1: Overview of FSC-VLN. A frozen visual encoder maps the current and historical observations into visual tokens that, together with the instruction, form the online context. We prepend a learnable future query qF and an action query qA to create a future-supervised causal prefix for action generation. During training only, a target branch encodes the expert-trajectory future observation ot+∆with the same frozen visual modules to provide a stop-gradient embedding target for aligning qF ; this branch is discarded at inference.

FSC-VLN在因果token序列中插入可学习的未来查询qF和行动查询qA。训练时,利用冻结的SigLIP编码器提取专家轨迹未来帧的视觉嵌入作为停止梯度目标。通过投影空间L1损失对齐qF的隐藏状态,使模型学会预测未来视觉状态。

推理效率:零额外计算开销

推理效率:零额外计算开销
Figure 1 presents the architecture of our future-state-conditioned policy. The model contains three components: a frozen visual encoder, a query-conditioned causal policy, and a training-only future- target branch.

推理阶段,模型丢弃未来目标分支,仅使用在线上下文和两个查询token进行单次因果预填充。这种设计确保FSC-VLN在不增加推理延迟和计算成本的前提下,利用训练时学到的未来状态信息指导动作生成,保持与基线StreamVLN相同的效率。

特权诊断:未来信息的价值验证

特权诊断:未来信息的价值验证
Table 1: Privileged expert-future input diagnostic on R2R val-unseen (1839 episodes). The future image is provided as an additional policy input during both training and evaluation. This experiment tests whether expert-future visual information is useful for navigation and is not an upper bound on FSC-VLN. We train on (R2R+RxR). ∆denotes absolute change (percentage points).

为验证未来视觉信息的有用性,作者进行了特权输入诊断。在训练和测试时均提供未来图像,结果显示SR从29.96%大幅提升至71.77%,SPL从26.25%提升至64.15。这证明未来视觉信息对当前动作选择具有极高的信息增益,尽管这不是最终的部署方案。

主要结果:整体性能提升

主要结果:整体性能提升
Table 2: Overall performance. We train on (R2R+RxR+. . . ) and evaluate on R2R val-unseen (1839 episodes). ∆denotes absolute change (percentage points).

在R2R+RxR数据集上训练的FSC-VLN,在R2R val-unseen测试集上表现优异。相比基线,SR提升1.47个百分点至31.43%,SPL提升1.11个百分点至27.36%。这表明未来状态监督能有效改善端到端导航策略的整体成功率。

分层评估:长程任务增益显著

分层评估:长程任务增益显著
Table 3: Stratified short- vs long-horizon evaluation. We train on (R2R+RxR+…) and evaluate on R2R val-unseen (1293 short / 546 long). ∆denotes absolute change (percentage points).

按地理距离分层评估发现,FSC-VLN的增益主要集中在长程轨迹。在长程任务中,SR提升3.85个百分点,SPL提升3.70个百分点。相比之下,短程任务提升微弱。这说明未来状态预测对于纠正长距离累积误差尤为关键。

实验与关键结果

  • 在R2R val-unseen数据集上评估FSC-VLN与StreamVLN基线的性能对比。
  • 特权输入诊断实验:在训练和测试时均提供未来图像,验证其信息增益。
  • 分层评估:按地理距离将轨迹分为短程(≤10m)和长程(>10m),分析方法对不同horizon的影响。
  • 消融实验:移除行动查询(qA),仅保留未来查询(qF),评估双查询设计的必要性。
  • 特权诊断下SR从29.96%提升至71.77%,SPL从26.25%提升至64.15% (Table 1, p8)(第 8 页)
  • R2R+RxR训练下,FSC-VLN SR提升1.47pp (31.43%),SPL提升1.11pp (27.36%) (Table 2, p8)(第 8 页)
  • 长程轨迹下,R2R+RxR训练时SR提升3.85pp,SPL提升3.70pp (Table 3, p8)(第 8 页)
  • 移除qA后,SR从45.79%降至45.19%,SPL从42.81%降至41.76% (Table 4, p9)(第 9 页)

阅读时需要注意

  • 未来目标基于专家轨迹,可能与智能体在累积误差下的实际on-policy未来分布存在偏差。
  • 固定未来步长Δ可能不适用于所有场景或episode长度。
  • 仅在单一骨干网络(Qwen2)和R2R/RxR数据集上验证,泛化性待考察。
  • 特权诊断实验中的未来图像仅在训练和测试时作为额外输入,非部署方案,旨在证明未来信息的价值。
  • FSC-VLN的增益主要集中在长程任务,短程任务提升微弱甚至无显著提升。

关联工作

  • StreamVLN:基线模型,采用慢速视觉记忆和快速对话上下文,FSC-VLN在此基础上扩展。(第 2 页)
  • VLA-JEPA:相关工作,同样使用冻结编码器提取未来latent作为停止梯度目标,但应用于VLA而非纯VLN。(第 3 页)
  • FastWAM:相关工作,训练时联合训练世界模型,推理时直接预测动作,支持了未来监督对控制有益的观点。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

在行动之前预判:基于未来状态条件的视觉语言导航

Lingfeng Zhang ∗ Zhanguang Zhang Noah’s Ark Lab, 2012 Labs, Huawei Noah’s Ark Lab, 2012 Labs, Huawei

Liheng Ma Tongtong Cao Noah’s Ark Lab, 2012 Labs, Huawei Department of Foundation model, 2012 Labs, Huawei

Yingxue Zhang Noah’s Ark Lab, 2012 Labs, Huawei

摘要 端到端的视觉语言导航(VLN)利用因果视觉语言模型,可以将指令和第一人称观察直接映射为动作,但标准的行为克隆仅监督下一个动作,并未显式训练策略以预测未来的视觉结果。我们首先询问,在训练和测试时作为诊断特权输入,专家轨迹的未来图像是否对选择当前动作有用?(这些专家轨迹的未来图像在实际部署的测试时不可用,因此我们仅将此设置用作特权输入诊断。)答案是肯定的;这一健全性检查表明,未来观察可以提供丰富且可操作的线索。接着我们提出一个可部署的问题:在推理时不访问未来图像,我们是否仍能通过仅使用压缩的未来视觉潜在变量作为训练监督而受益?我们提出了基于未来状态条件的 VLN(FSC-VLN),该方法添加了一个未来查询 token,并通过一个仅在训练期间使用的目标分支,将其隐藏状态与提前 $\Delta$ 步的冻结视觉嵌入 $\Delta$ 对齐,该分支在训练结束后被移除。在 R2R val-unseen 上,FSC-VLN 在两种训练数据范式下,相较于 StreamVLN 风格的基线,提升了 SR/OSR/SPL 指标,且在长视界片段中增益更大;消融实验进一步支持了双查询设计(分离未来查询和行动查询)。

1 引言

视觉语言导航(VLN)要求具身智能体通过将其锚定在一序列第一人称视觉观察中,来遵循自然语言指令 [Anderson et al., 2018, Ku et al., 2020]。在连续环境中(VLN-CE),智能体必须进一步将此锚定转化为底层动作,而无需依赖预定义的导航图 [Krantz et al., 2020]。由此产生的策略必须共同维护指令进度,解释不断变化的场景,并从长序列原始动作中积累的误差中恢复。

最近的视觉语言模型为实现这一问题的更直接方法提供了可能。诸如 NaVid [Zhang et al., 2024b]、Uni-NaVid [Zhang et al., 2024a]、NaVILA [Cheng et al., 2024] 和 StreamVLN [Wei et al., 2025] 等方法,将指令、当前观察和视觉历史编码为多模态 token 序列,并微调预训练语言模型以生成导航动作

∗对应作者邮箱:lingfeng.zhang1@h-partners.com, zhanguang.zhang@huawei.com, 和 yingxue.zhang@huawei.com

第 2 页

自回归地。这种表述减少了对特定任务地图和航点选择模块的依赖,但其性能仍然强烈依赖于大规模的行为克隆数据。增加更多演示数据可以改善动作模仿 [Zhang et al., 2024a],但它无法识别限制进一步进展的缺失学习信号。

具体而言,标准的动作克隆目标直接监督专家动作序列,但并不明确要求内部策略状态显式表征 Agent 未来可能观察到的内容。因果视觉语言模型(VLM)可能会从演示中隐式地学习此类信息,但仅靠下一步动作监督对其隐藏状态的预测内容没有直接约束。这种区别在连续导航中可能很重要:局部合理的动作仍可能导致轨迹逐渐偏离,且较小的错误在更长的执行时间范围内变得越来越难以纠正。因此我们问:

未来衍生的训练监督能否在不访问推理期间未来观测的情况下,提升可部署的在线策略?

我们将这两个问题分开讨论:

诊断问题:如果在测试时直接将专家轨迹的未来图像 $\Delta= 32$ 步作为特权输入提供给策略(并在训练中使用相同的特权),这种额外的视觉证据是否有助于选择当前动作?此设置不可部署;我们仅将其用作健全性检查,以确认未来观测包含导航的可行动线索(第 4 节,表 1)。

可部署问题:如果在推理时不访问未来图像,我们是否仍可以通过使用压缩的未来视觉潜在变量作为仅用于训练的监督信号来改进在线策略?由于专家未来观测反映了一个特定的轨迹结果,而真正的策略内未来在决策时是依赖于动作且不确定的,因此这种特权输入诊断旨在确立其有用性,而不是定义一个可部署方法应匹配的目标。相反,它激励学习一种对视觉未来状态具有预测性的表示,同时保持推理不变。

基于这一观察,我们引入了未来状态条件视觉语言导航(Future-State-Conditioned VLN, FSC-VLN),这是对端到端因果 VLM 导航策略的轻量级扩展。对于每个观测回合,FSC-VLN 在因果 token 序列中插入一个可学习的未来查询(future query)和一个可学习的动作查询(action query)。在训练期间,未来查询处的上下文隐藏状态与 $\Delta$ 步之后的观测的池化视觉表示对齐。目标表示由共享的冻结视觉编码器提取,并被视为停止梯度(stop-gradient)目标。将未来查询放置在动作查询之前,使得动作查询表示及后续动作 token 能够通过因果自注意力机制关注到由未来监督的查询前缀。

所提出的机制在 token 级别运行,不改变 Transformer 块、视觉编码器架构或全词汇语言建模头。未来目标分支仅在训练期间需要。在推理时,多模态上下文和两个学习到的查询在单次因果预填充(causal prefill)中联合处理。未来查询不会自回归解码,也不会提取其最终表示并通过单独模型调用重新插入。仅自回归解码导航动作。因此,FSC-VLN 在推理时不需要未来观测、未来图像生成器、辅助目标编码器或第二次策略前向传播,仅向原始在线序列添加了两个学习到的前缀 token。

我们的实验回答了这两个问题:表 1 解决了特权输入诊断问题,而表 2–3 评估了可部署的未来潜在监督,并在长周期片段中显示出更大的增益。

我们的贡献有三方面:

• 我们引入了针对基于端到端 VLM 的 VLN 的特权专家未来输入诊断。 通过在训练和评估期间将专家轨迹观测 $\Delta$ 步之后的观测作为额外输入输入,我们探测未来视觉证据是否能够告知当前导航决策。此诊断不可部署,仅报告以激励在测试时不使用未来输入的训练监督。 • 我们将未来状态预测表述为端到端 VLM 导航的辅助训练目标,通过将未来查询表示与 $\Delta$ 步之后的观测的冻结视觉嵌入对齐来实现,并通过轻量级双查询设计实现,其中未来监督查询位于因果 token 序列中动作查询之前,

2

第 3 页

无需修改预训练骨干网络架构,即可实现基于未来条件触发的动作生成。

• 我们在两种训练数据范式下对 FSC-VLN 进行了评估,发现其性能提升主要集中在长视距轨迹上;消融实验支持将未来监督查询与动作解码查询分离的必要性。在推理阶段,在线上下文和两种查询被联合处理在一个因果预填充(causal prefill)过程中,无需自回归的未来潜在生成,也无需额外的策略前向传播。由于该方法每步仅增加两个前缀 token,预计推理成本将与基线保持接近。

2 相关工作

用于导航的视觉-语言模型。近期的视觉-语言导航方法越来越多地将导航表述为使用预训练多模态模型进行动作预测。NaVid 将基于视频的 VLM 条件化于指令和在线单目 RGB 流上,以预测下一个导航动作 [Zhang et al., 2024b]。Uni-NaVid 通过协调不同具身导航任务的输入和低层动作空间,将这种表述扩展到多个具身导航任务中 [Zhang et al., 2024a]。NaVILA 则采用分层设计,其中 VLA 模型生成具有空间定位的中层指令,由学习到的运动控制器执行 [Cheng et al., 2024]。MapNav 在利用 VLM 预测导航动作之前,用标注的自上而下语义地图替换原始观测历史 [Zhang et al., 2025]。更新近的方法侧重于高效地表示长观测历史。StreamVLN 维护一个慢速更新的视觉记忆以及一个快速流式的对话上下文 [Wei et al., 2025],而 JanusVLN 将视觉语义信息和空间几何信息分离到两个紧凑的隐式记忆中 [Zeng et al., 2025]。

尽管这些方法在记忆表示和动作接口上有所不同,但其策略学习仍然主要以动作为中心:多模态上下文被优化以预测动作或中间动作指令,而没有显式训练一个策略状态以匹配未来的视觉观测,并随后使用该状态来条件化动作预测。我们的工作研究了在端到端 VLM 导航器中添加这种预测性结构是否能改善决策,特别是在长导航视距下。

用于具身控制的未来预测。预测性视觉建模最近在机器人操作方面显示出巨大的潜力。DreamZero 使用自回归视频扩散骨干网络联合建模未来视频和机器人动作,证明了视频动力学预训练可以提高跨任务和跨具身形态的泛化能力 [Ye et al., 2026]。LingBot-VA 同样在自回归扩散模型中交错视频和动作表示,并联合预测视觉演变和控制轨迹 [Li et al., 2026]。这些方法将未来想象作为视频-动作模型的显式部分,但迭代视频去噪可能会引入显著的部署成本。

FastWAM 将训练时的世界建模与测试时的想象分离:它保留了未来视频联合训练,但在推理时直接预测动作,而不生成未来观测 [Yuan et al., 2026]。其受控实验表明,大部分控制收益来自于通过预测性监督学到的表示,而不是在测试时显式渲染未来 rollout。VLA-JEPA 进一步将未来预测从像素空间转移到表示空间:它使用冻结编码器将未来视频帧编码为潜在目标,并训练一个预测器(学生路径)仅根据过去和当前上下文来匹配这些未来潜在向量。重要的是,原始未来帧仅用于形成停止梯度目标,而在测试时不作为策略的输入提供 [Sun et al., 2026]。LingBot-VLA 2.0 进一步引入了从互补的深度和因果视频教师中蒸馏出的当前和未来查询 [Wu et al., 2026]。总之,这些结果提供了强有力的证据,表明未来图像或未来潜在向量的监督可以改善操作策略。然而,它们并未直接确立同一原则是否有利于指令引导的导航,因为在指令引导的导航中,错误会在显著更长的动作序列中累积,且智能体必须在语言、部分观测和空间进展之间保持一致性。

3

第 4 页

图 1:FSC-VLN 概览。冻结的视觉编码器将当前和历史观测映射为视觉 token,这些 token 与指令共同构成在线上下文。我们在前面添加可学习的未来查询 $q_F$ 和行动查询 $q_A$,以创建用于动作生成的未来监督因果前缀。仅在训练期间,目标分支使用相同的冻结视觉模块对专家轨迹的未来观测 $o_{t+\Delta}$ 进行编码,以提供用于对齐 $q_F$ 的停止梯度嵌入目标;该分支在推理时被丢弃。

3 方法

3.1 问题表述

在导航步骤 $t$,智能体接收自然语言指令 $I$、当前视觉观测 $o_t$ 以及历史观测序列 $H_t$。策略预测一个短序列的导航动作 $$ a_t = (a_{t,1}, \dots, a_{t,M}) \quad , \quad (1) $$ 且每个动作属于 $$ \mathcal{A} = \{\uparrow, \leftarrow, \rightarrow, \text{STOP}\} \quad . \quad (2) $$ 动作被表示为普通语言 token,并由因果语言模型自回归生成。遵循 StreamVLN 的做法,导航动作被表示为文本 token,并通过全词汇语言模型(LM)头进行自回归解码。

在训练期间,我们额外观察到未来图像 $o_{t+\Delta}$。该未来图像仅用于监督内部未来状态表示。它从不提供给在线策略,且在推理时不需要。

3.2 模型概览

图 1 展示了我们基于未来状态条件的策略架构。该模型包含三个组件:冻结的视觉编码器、查询条件的因果策略以及仅用于训练的未来目标分支。

在线分支将指令、历史观测和当前观测编码为多模态上下文。在动作生成之前插入两个可学习的查询 token:一个是预测未来观测潜在表示的未来查询 $q_F$,随后是行动查询 $q_A$。动作生成基于未来监督的因果前缀。这两个查询与多模态上下文一起由 Qwen2-7B [Yang et al., 2024] 因果 Transformer 联合处理。

未来目标分支使用与在线分支相同的冻结视觉模块对 $o_{t+\Delta}$ 进行编码。其输出为未来查询提供停止梯度目标。因此,策略在学习预见未来视觉状态的同时,仍保持单次因果 Transformer 前向传播以进行在线动作预测。

4

第 5 页

3.3 冻结视觉编码

遵循 StreamVLN [Wei et al., 2025] 的做法,我们使用 SigLIP [Zhai et al., 2023] 作为视觉编码器。 给定图像 $o$,编码器生成一个 $M \times M$ 的网格状 patch 特征。一个带有 GELU 激活函数的两层 MLP 将每个特征从 SigLIP 的特征维度 $d^*$ 映射到语言模型的维度 $d$: $$ e_V(o) = P_{vis}(E_{vis}(o)) \in \mathbb{R}^{M^2 \times d}, \quad (3) $$ 其中 $E_{vis}$ 表示 SigLIP,$P_{vis}$ 表示投影器。

我们应用步长为 2 的平均池化,将特征网格从 $M \times M$ 缩减为 $N \times N$。因此,每一帧由 $N^2$ 个视觉 token 表示: $$ V(o) \in \mathbb{R}^{N^2 \times d}. \quad (4) $$

当前观测和历史帧的视觉 token 与指令 token 交错排列,以构建在线上下文 $C_t$。在整个训练过程中,$E_{vis}$ 和 $P_{vis}$ 均保持冻结。这保持了视觉目标空间的稳定性,并将优化集中在因果策略和查询表示上。

3.4 查询条件化的因果策略

对于每个观测回合,我们在多模态上下文中添加一个可学习的未来查询和一个可学习的行动查询。为了清晰起见,省略固定的对话分隔符 token,得到的因果序列为 $$ X_t = C_t, q_F, q_A, a_t, \quad (5) $$ 其中 $$ q_F, q_A \in \mathbb{R}^{1 \times d}. \quad (6) $$ 这两个查询均为可训练参数,初始化为 $N(\mu, \sigma^2)$。

完整的序列由因果 Transformer $F_\phi$ 处理: $$ H_t = F_\phi(X_t). \quad (7) $$ 我们用 $h^F_t$ 和 $h^A_t$ 分别表示未来查询和行动查询位置的隐藏状态。在因果自注意力机制下,$h^F_t$ 总结了指令和视觉上下文: $$ h^F_t = F_\phi(C_t, q_F). \quad (8) $$ 行动查询还可以额外关注未来查询的表示: $$ h^A_t = F_\phi(C_t, q_F, q_A). \quad (9) $$ 这种顺序提供了从未来状态预测到行动生成的显式因果路径。行动查询不接收专家轨迹的未来特征;它仅访问在未来查询位置计算出的上下文依赖表示。

Transformer 隐藏状态通过语言模型头映射为全词汇量的 logits: $$ \ell_i = W_{LM} h_i, \quad (10) $$ 其中 $h_i$ 表示位置 $i$ 处的 Transformer 隐藏状态,且 $$ W_{LM} \in \mathbb{R}^{|\mathcal{V}| \times d} \quad (11) $$

特别地,省略固定的对话模板 token,第一个行动的 logits 由行动查询隐藏状态获得: $$ \ell_{t,1} = W_{LM} h^A_t \quad (12) $$ 随后的行动 token 是自回归预测的: $$ \ell_{t,j} = W_{LM} h^{act}_{t,j-1}, \quad j > 1 \quad (13) $$ 其中 $h^{act}_{t,j-1}$ 是与前一个生成的行动 token 相关的隐藏状态。 LM 头是一个无偏置的线性层。下一个 token 的概率为 $$ p_\theta(y_{i+1} | y_{\le i}, C_t, q_F, q_A) = \text{softmax}(W_{LM} h_i) \quad (14) $$

策略自回归地生成文本行动符号 STOP, ↑, ←, 和 →。在执行时,生成的文本被解析为相应的离散导航行动。

5

第 6 页

3.5 未来状态目标构建

未来目标由观测值 $o_{t+\Delta}$ 构建。在训练过程中,随机外观增强仅应用于在线上下文图像。未来目标图像仅经过标准的 SigLIP 预处理,不进行额外的随机增强,从而为未来状态对齐提供稳定的目标。该图像通过共享的冻结视觉编码器和投影器: $$ V^*_{t+\Delta} = \text{sg} [V(o_{t+\Delta})] \in \mathbb{R}^{N^2 \times d}, \quad (15) $$ 其中 $\text{sg}[\cdot]$ 表示停止梯度操作。

由于策略使用单个未来查询,我们使用平均池化聚合 $N^2$ 个未来视觉 token: $$ z^*_{t+\Delta} = \frac{1}{N^2} \sum_{j=1}^{N^2} V^*_{t+\Delta,j} \in \mathbb{R}^d \quad (16) $$ 目标分支与在线分支共享冻结的 SigLIP 和 MLP 参数。因此,$z^*_{t+\Delta}$ 在嵌入空间中定义了一个确定性目标。

预测的未来状态是 Transformer 在未来查询位置的输出: $$ \hat{z}_{t+\Delta} = h_F \quad (17) $$

3.6 投影未来状态对齐

未来状态目标 $z^*_{t+\Delta} \in \mathbb{R}^d$ 是高维的,因此我们在紧凑的投影空间中进行对齐。令 $g: \mathbb{R}^d \rightarrow \mathbb{R}^{d'}$ 表示一个投影,其中 $d' \ll d$。我们定义投影后的未来状态损失为 $$ \mathcal{L}_{\text{future}} = \| g(\hat{z}_{t+\Delta}) – g(z^*_{t+\Delta}) \|_1 \quad (18) $$ 我们使用 $\ell_1$ 惩罚以降低对投影空间中单个特征异常值的敏感性。

由于目标路径应用了停止梯度,梯度不会流入冻结的视觉编码器: $$ \nabla_{z^*_{t+\Delta}} \mathcal{L}_{\text{future}} = 0 \quad (19) $$ 因此,$\mathcal{L}_{\text{future}}$ 更新因果 Transformer 参数和未来查询嵌入,同时保持目标编码器不变。来自动作预测的梯度还可以通过因果依赖关系 $q_F \rightarrow q_A \rightarrow a_t$ 到达未来查询,鼓励未来查询表示既能够预测专家的未来观测,又对动作生成有用。

3.7 训练目标

导航策略使用针对完整语言模型词汇表的标准下一个 token 交叉熵进行训练。令 $Y$ 表示标记化的训练序列,$S$ 表示监督助手侧的位置集合。语言建模损失为 $$ \mathcal{L}_{\text{LM}} = -\frac{1}{|S|} \sum_{i \in S} \log p_\theta(Y_i | Y_{<i}, C_t, q_F, q_A) \quad (20) $$ 完整的训练目标为 $$ \mathcal{L}_{\text{total}} = \mathcal{L}_{\text{LM}} + \lambda_F \mathcal{L}_{\text{future}} \quad (21) $$ 我们联合优化因果语言模型(包括 LM 头)以及未来和动作查询嵌入。SigLIP 编码器和 MLP 投影器保持冻结。

3.8 推理

在推理时,丢弃未来目标分支。多模态上下文、未来查询和动作查询被连接在一起,并在单个因果预填充(causal prefill)中联合处理。未来查询不进行自回归解码;其上下文感知的隐藏状态作为预测的未来状态表示。由于未来查询在因果序列中位于动作查询之前,动作查询表示及后续动作 token 可以关注未来查询前缀。随后,LM 头自回归地解码导航动作。推理时不需要任何未来观测、目标特征或辅助目标编码器。

6

第 7 页

4 实验

设置 我们使用 StreamVLN 作为我们的基线端到端 VLM 导航策略。所有共享组件(骨干网络、优化器、学习率调度、批次大小、数据预处理和解码设置)均遵循 StreamVLN 配置,以确保公平比较。

指标 我们报告成功率(SR),即智能体在目标容忍区内停止的 episode 比例;Oracle 成功率(OSR),即其轨迹曾进入目标容忍区(无论最终停止点如何)的 episode 比例;以及路径加权成功率(SPL),它通过最短路径距离与执行路径长度之比来补充成功指标,以反映导航效率。

数据 我们在标准的室内 VLN 基准数据集上进行训练和评估:R2R(Room-to-Room)[Krantz et al., 2020] 和 RxR(Room-across-Room)[Ku et al., 2020],这些数据集提供了与照片级真实室内环境中的导航轨迹配对的人类标注语言指令。除非另有说明,结果均在 R2R val-unseen 分割上报告。遵循 StreamVLN 风格训练中的先前做法,我们还考虑了一种扩展的训练方案,该方案使用 EnvDrop [Tan et al., 2019] 增强 R2R+RxR,这是一种在训练期间增加环境多样性的数据增强方法,以及 ScaleVLN [Wang et al., 2023],这是一个额外的超大规模 VLN 训练集,用于扩大演示覆盖范围。

轨迹分层 为了分析视界效应,我们根据起点和终点之间的测地线距离对 episode 进行分层:测地线距离 ≤10 m 的 episode 被标记为短视界,而距离 > 10 m 的 episode 被标记为长视界。在 R2R val-unseen(1839 个 episode)上,这产生了 1293 个短视界 episode 和 546 个长视界 episode。

实现细节 我们从 Qwen2 初始化策略,并使用 SigLIP-SO400M 作为冻结的视觉编码器。每个训练样本是一个最多包含 32 个低级控制步骤的轨迹片段;策略在每个观察回合预测四个动作。我们使用一个可学习的未来查询(future query)和一个可学习的行动查询(action query)。

对于未来监督,目标观察值是在专家轨迹上从当前步骤偏移 ∆= 32 步处选择的;如果 t + ∆ 超过轨迹长度,则使用最后一帧。随机外观增强仅应用于在线上下文图像,而未来目标使用标准的 SigLIP 预处理。

我们使用投影的 ℓ1 对齐损失(第 3.6 节)对 future-query 隐藏状态进行监督,并设置 λF = 0.1。我们在构建的轨迹片段上训练一个 epoch。训练使用 4 块 GPU,每设备批次大小为 1,梯度累积步数为 16 步(全局批次大小为 64)。我们使用 AdamW,学习率为 2 × 10−5,权重衰减为 0,预热比例为 0.075,采用余弦调度,并在 1.0 处进行梯度裁剪。

我们联合微调 Qwen2 因果语言模型和 LM 头以及 future/action query 嵌入,同时保持 SigLIP 编码器和视觉 MLP 投影器冻结。训练使用 bfloat16 精度、梯度检查点和 DeepSpeed ZeRO-2。我们对 R2R+RxR 和 R2R+RxR+EnvDrop+ScaleVLN 两种训练配置使用相同的优化设置。

特权专家未来输入诊断 我们首先回答诊断问题:如果在测试时将专家轨迹上提前 ∆= 32 步的专家轨迹未来观察值作为额外输入提供给策略(并且以相同的特权进行训练),那么该未来视觉证据对于选择当前动作是否有用?此设置不可部署,仅用作健全性检查。结果显示,未来观察值可以提供高度信息,将 SR 从 29.96% 提高到 71.77%,OSR 从 38.49% 提高到 74.00%,SPL 从 26.25% 提高到 64.15%(表 1)。

主要结果 如表 2 所示,在我们实验的两种训练数据方案中,FSC-VLN 均提高了所有三个聚合导航指标。使用 R2R+RxR 训练数据时,它将 SR 从 29.96% 提高到 31.43%,OSR 从 38.49% 提高到 41.76%,SPL 从 26.25% 提高到 27.36%,分别提升了 1.47、3.27 和 1.11 个百分点。当训练集通过 EnvDrop 和 ScaleVLN 扩展时,FSC-VLN 分别将 SR、OSR 和 SPL 提高了 0.98、1.04 和 0.85 个百分点。

7

第 8 页

表 1:R2R val-unseen(1839 个回合)上的特权专家未来输入诊断。未来图像在训练和评估期间均作为额外的策略输入提供。本实验旨在测试专家未来视觉信息是否对导航有用,并确认其并非 FSC-VLN 的上界。我们在 (R2R+RxR) 上进行训练。∆ 表示绝对变化(百分点)。

| 模型 | SR | Oracle SR | SPL | | :— | :— | :— | :— | | Baseline (R2R + RxR) | 29.96% | 38.49% | 26.25% | | Baseline + Expert-future image at train and test (diagnostic) | 71.77% | 74.00% | 64.15% | | Gain ∆ | +41.81 | +35.51 | +37.90 |

表 2:整体性能。我们在 (R2R+RxR+…) 上进行训练,并在 R2R val-unseen(1839 个回合)上进行评估。∆ 表示绝对变化(百分点)。

| 模型 | SR | Oracle SR | SPL | | :— | :— | :— | :— | | Baseline (R2R + RxR) | 29.96% | 38.49% | 26.25% | | FSC-VLN (ours) | 31.43% | 41.76% | 27.36% | | Gain ∆ | +1.47 | +3.27 | +1.11 | | Baseline (R2R + RxR + EnvDrop + ScaleVLN) | 44.81% | 49.97% | 41.96% | | FSC-VLN (ours) | 45.79% | 51.01% | 42.81% | | Gain ∆ | +0.98 | +1.04 | +0.85 |

如表 3 所示,聚合结果掩盖了对轨迹长度的显著依赖。在 R2R+RxR 训练下,FSC-VLN 仅使短视距 SR 和 SPL 分别变化 +0.46 和 +0.02 个点,而长视距 SR、OSR 和 SPL 分别提高了 3.85、7.15 和 3.70 个点。在添加 EnvDrop 和 ScaleVLN 后,这一模式保持不变:短视距 SR 和 SPL 各增加 +0.15 个点,而长视距 SR、OSR 和 SPL 分别提高了 2.93、3.67 和 2.52 个点。因此,该方法在很大程度上未改变短视距行为,而其观察到的增益集中在更长的轨迹上。这种分层结果支持了以下假设:当局部决策必须在较长的执行视距内保持连贯时,未来状态监督最为有用。

消融实验:是否有必要使用单独的行动查询? 我们的模型使用两个查询位置 qF 和 qA,插入在上下文和行动 token 之间:Ct →qF →qA →Yt。我们使用未来状态对齐损失对 qF 处的隐藏状态进行监督,而 qA 关注 qF 并作为动作解码的即时条件状态。 为了测试 qA 是否必要,我们将其移除并保持所有其他设置(骨干网络、未来目标、损失权重和调度)不变,得到 Ct →qF →Yt。在此变体中,qF 处的同一状态必须同时匹配未来视觉目标,并提供用于预测第一个行动 token 的前缀状态。 表 4 显示,移除 qA 会降低 SR(45.79% → 45.19%)和 SPL(42.81% → 41.76%),而 Oracle SR 略有增加(51.01% → 51.77%)。表 5 中的分层结果表明,下降幅度在长视距回合中更大(SR:33.88% → 32.60%,SPL:32.03% → 30.94%)。

表 3:分层短视距与长视距评估。我们在 (R2R+RxR+…) 上进行训练,并在 R2R val-unseen(1293 个短视距 / 546 个长视距)上进行评估。∆ 表示绝对变化(百分点)。

| | 短视距 | | | 长视距 | | | | :— | :— | :— | :— | :— | :— | :— | | 模型 | SR | Oracle SR | SPL | SR | Oracle SR | SPL | | Baseline (R2R + RxR) | 33.49% | 43.39% | 29.29% | 21.61% | 26.92% | 19.07% | | FSC-VLN (ours) | 33.95% | 45.01% | 29.31% | 25.46% | 34.07% | 22.77% | | Gain ∆ | +0.46 | +1.62 | +0.02 | +3.85 | +7.15 | +3.70 | | Baseline (R2R + RxR + EnvDrop + ScaleVLN) | 50.66% | 57.23% | 47.22% | 30.95% | 32.78% | 29.51% | | FSC-VLN (ours) | 50.81% | 57.15% | 47.37% | 33.88% | 36.45% | 32.03% | | Gain ∆ | +0.15 | -0.08 | +0.15 | +2.93 | +3.67 | +2.52 |

8

第 9 页

表 4:消融实验。我们在 (R2R+RxR+EnvDrop+ScaleVLN) 上训练,并在 R2R val-unseen(1839 个片段)上进行评估。∆ 表示绝对变化(百分点)。

| 模型 | SR | Oracle SR | SPL | | :— | :— | :— | :— | | FSC-VLN (future query + action query) | 45.79% | 51.01% | 42.81% | | FSC-VLN (only future query) | 45.19% | 51.77% | 41.76% | | Diff ∆ | | -0.60 | +0.76 | -1.05 |

表 5:分层短视距与长视距评估的消融实验。我们在 (R2R+RxR+EnvDrop+ScaleVLN) 上训练,并在 R2R val-unseen(1293 个短视距 / 546 个长视距)上进行评估。∆ 表示绝对变化(百分点)。

| 模型 | SR | Oracle SR | SPL | SR | Oracle SR | SPL | | :— | :— | :— | :— | :— | :— | :— | | | | | | Short-horizon | | | | | | | | Long-horizon | | | | FSC-VLN (future query + action query) | 50.81% | 57.15% | 47.37% | 33.88% | 36.45% | 32.03% | | FSC-VLN (only future query) | 50.50% | 58.78% | 46.33% | 32.60% | 35.16% | 30.94% | | Diff ∆ | | -0.31 | +1.63 | -1.04 | -1.28 | -1.29 | -1.09 |

总体而言,即使智能体偶尔能够到达目标区域(如 Oracle SR 所示),行动查询(action query)也能提高最终路径的效率,这表明将未来状态预测(qF)与行动条件(qA)分离,能在解码过程中更好地保留和利用预测的未来信息。

5 讨论

为什么未来状态监督有帮助。行为克隆优化即时动作预测,但并不直接鼓励策略状态能够预测早期决策的下游视觉后果。辅助对齐目标增加了一个直接约束,将部分隐藏状态与未来观测嵌入绑定在一起。

我们的消融结果还表明,这种预测信号如何暴露给解码器至关重要。当未来监督查询必须同时充当行动条件状态(即移除单独的行动查询)时,Oracle SR 可能会增加,而 SR/SPL 会下降,且在长视距片段中下降更为明显。这种模式与表示层面的权衡一致:未来监督状态可能携带有用的到达目标线索,但专用的行动查询有助于通过因果注意力将该信息转化为高效的逐步决策。

效率与部署。FSC-VLN 保持了基线的推理模式:对在线上下文进行一次因果预填充(causal prefill),随后对动作 token 进行自回归解码。未来目标分支仅在训练期间使用,推理过程仅引入两个学习到的前缀 token。

局限性。未来目标取自专家轨迹,可能会因累积误差而与智能体的在线策略(on-policy)未来不同。此外,固定的视距 ∆ 可能并不适用于所有场景和片段长度。最后,我们的实验仅关注单一骨干网络;该方法在其他 VLN 骨干网络和环境中是否有效仍有待验证。

未来方向。未来的工作可以研究自适应或多步目标(例如,多个 ∆ 值)、不确定性感知目标,以及与滚动级训练信号相结合的方法,这些方法可以在不改变推理过程的情况下优化全局指令完成度和路径效率。

6 结论

我们使用特权专家未来输入诊断来验证未来观测包含端到端 VLM 导航的可行动视觉证据。随后,我们提出了 FSC-VLN,这是一种可部署的方法,它通过在训练期间将未来查询表示与压缩的未来视觉潜在表示对齐,从而在不访问推理时未来图像的情况下改进在线策略。在 R2R 上的实验中

9

第 10 页

在 val-unseen 数据集上,FSC-VLN 带来了适度的整体提升,且在长视界(long-horizon)片段中改善更为显著;消融实验表明,专用的行动查询(action query)有助于将未来监督(future-supervised)表示转化为更优的导航行为。

参考文献

Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko Sünderhauf, Ian Reid, Stephen Gould, and Anton Van Den Hengel. Vision-and-language navigation: Interpreting visually- grounded navigation instructions in real environments. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 3674–3683, 2018.

An-Chieh Cheng, Yandong Ji, Zhaojing Yang, Zaitian Gongye, Xueyan Zou, Jan Kautz, Erdem Bıyık, Hongxu Yin, Sifei Liu, and Xiaolong Wang. Navila: Legged robot vision-language-action model for navigation. arXiv preprint arXiv:2412.04453, 2024.

Jacob Krantz, Erik Wijmans, Arjun Majumdar, Dhruv Batra, and Stefan Lee. Beyond the nav-graph: Vision-and-language navigation in continuous environments. In European Conference on Computer Vision, pages 104–120. Springer, 2020.

Alexander Ku, Peter Anderson, Roma Patel, Eugene Ie, and Jason Baldridge. Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding. In Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), pages 4392–4412, 2020.

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, et al. Causal world modeling for robot control. arXiv preprint arXiv:2601.21998, 2026.

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, and Zhibo Chen. Vla-jepa: Enhancing vision-language-action model with latent world model. arXiv preprint arXiv:2602.10098, 2026.

Hao Tan, Licheng Yu, and Mohit Bansal. Learning to navigate unseen environments: Back translation with environmental dropout. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pages 2610–2621, 2019.

Zun Wang, Jialu Li, Yicong Hong, Yi Wang, Qi Wu, Mohit Bansal, Stephen Gould, Hao Tan, and Yu Qiao. Scaling data generation in vision-and-language navigation. In Proceedings of the IEEE/CVF international conference on computer vision, pages 12009–12020, 2023.

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, et al. Streamvln: Streaming vision-and-language navigation via slowfast context modeling. arXiv preprint arXiv:2507.05240, 2025.

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, et al. From foundation to application: Improving vla models in practice. arXiv preprint arXiv:2607.06403, 2026.

An Yang, Baosong Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Zhou, Chengpeng Li, Chengyuan Li, Dayiheng Liu, Fei Huang, et al. Qwen2 technical report. arXiv preprint arXiv:2407.10671, 2024.

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, et al. World action models are zero-shot policies. arXiv preprint arXiv:2602.15922, 2026.

Tianyuan Yuan, Zibin Dong, Yicheng Liu, and Hang Zhao. Fast-wam: Do world action models need test-time future imagination? arXiv preprint arXiv:2603.16666, 2026.

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, and Ning Guo. Janusvln: Decoupling semantics and spatiality with dual implicit memory for vision-language navigation. arXiv preprint arXiv:2509.22548, 2025.

10

第 11 页

Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, 和 Lucas Beyer。用于语言图像预训练的 Sigmoid 损失。在 IEEE/CVF 国际计算机视觉会议论文集,第 11975–11986 页,2023 年。

Jiazhao Zhang, Kunyu Wang, Shaoan Wang, Minghan Li, Haoran Liu, Songlin Wei, Zhongyuan Wang, Zhizheng Zhang, 和 He Wang。Uni-navid:一种用于统一具身导航任务的基于视频的多模态模型。arXiv 预印本 arXiv:2412.06224,2024a。

Jiazhao Zhang, Kunyu Wang, Rongtao Xu, Gengze Zhou, Yicong Hong, Xiaomeng Fang, Qi Wu, Zhizheng Zhang, 和 He Wang。Navid:基于视频的多模态模型为视觉-语言导航规划下一步。arXiv 预印本 arXiv:2402.15852,2024b。

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, 和 Renjing Xu。Mapnav:一种用于基于多模态模型的视觉-语言导航的新型记忆表示,通过注释语义地图实现。在第 63 届计算语言学协会年会论文集(第 1 卷:长论文),第 13032–13056 页,2025 年。

11

发表评论