TurboVLA:扔掉大语言模型,机器人操控为何能跑32Hz?

价值与局限

当前主流 VLA 模型将大语言模型置于核心,视觉信息先转成文本 token 再预测动作,这条 V→L→A 间接通路带来了巨大的计算和内存开销。TurboVLA 提出直接 V+L→A 范式,用轻量双向交叉注意力融合视觉与语言特征,完全绕过 LLM。在 LIBERO 基准上以 0.2B 参数达到 97.7% 成功率,推理延迟仅 31.2 ms,显存占用不到 1 GB。真实世界实验中四项任务均优于 π0.5。但该方法专为执行级指令设计,缺乏高层任务规划所需的复杂语义推理能力。