先预见后行动:未来状态条件视觉语言导航

方法概述:双查询与未来监督

本文提出FSC-VLN方法,解决标准行为克隆在长程导航中因缺乏未来状态监督导致的误差累积问题。通过在训练阶段引入冻结SigLIP编码器提取的未来视觉嵌入作为目标,对齐可学习的未来查询token,实现未来状态监督。实验显示在R2R+RxR数据集上SR提升1.47pp,且在长程任务中增益显著。需注意该方法依赖专家轨迹,且增益主要集中在长距离导航。