FoMoVLA:通过联合视觉前瞻与运动引导增强VLA模型

方法:FoMoVLA框架概览

本文提出FoMoVLA框架,解决现有VLA模型缺乏显式世界动态预测的问题。通过联合优化未来特征前瞻和稀疏2D点追踪,并利用FCCA模块耦合两者,模型在LIBERO基准上达到98.8%平均成功率,在RoboCasa上优于基线9.1%。推理时无额外开销。需注意模型对固定视角训练数据的依赖及FCCA初始化的稳定性。