快速导读:问题的根源在于角色错配。大语言模型擅长语义理解和长程推理,但执行层操控需要的不是语言生成能力,而是精准的视觉-语言对齐和快速的动作映射。当指令已经具体到“拿起杯子”时,模型的核心任务是把杯子的视觉位置、机械臂状态与指令语义直接关联,而非进行复杂的常识推理。现有工作要么保留 LLM 只做加速,要么压缩模型规模,却始终没有跳出 V→L→A 的框架。
TurboVLA 针对当前 LLM-centric VLA 模型在实时操控场景下的根本瓶颈,提出了一个激进但有效的问题:机器人执行层的动作生成,真的需要大语言模型吗?论文的回答是否定的。通过将视觉和语言特征直接融合并解码为连续动作块,TurboVLA 在保持高成功率的同时,将推理延迟和显存需求降低了一个数量级。
这项工作并非简单地压缩模型,而是重新审视了 VLA 架构中 LLM 的角色。LLM 擅长语义理解和长程推理,但对于“抓取红色方块并放入左侧抽屉”这类具体指令,执行层需要的不是语言生成能力,而是精准的视觉-语言对齐和快速的动作映射。TurboVLA 正是抓住了这一区分,用轻量交互模块替代了笨重的 LLM 推理。
英文题目:TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
论文出处:arXiv 每日论文精选 · arXiv:2607.27205
原始论文:PDF / 论文页面
对应视频标题:TurboVLA:扔掉大语言模型,机器人操控为何能跑32Hz?|推荐指数:★★★★★
这篇论文解决什么问题?
以 OpenVLA 为代表的 LLM-centric VLA 模型遵循 V→L→A 范式:视觉观测被投影为 token 送入 LLM,与指令 token 一起进行自回归处理,最后从 LLM 的隐状态中解码动作。这一设计虽然借助 LLM 的预训练知识获得了良好的语义泛化能力,但代价极高——每次动作生成都需要完整的前向传播通过数十亿参数的 Transformer,导致延迟通常在数百毫秒级别,难以满足高频控制需求。
π0.5 等后续工作尝试通过引入专用动作专家来加速,但本质上仍保留了 LLM 作为多模态接口的核心地位。这种“加速但不换道”的策略,使得模型规模和推理成本始终居高不下。在消费级 GPU 或边缘设备上部署时,显存和算力成为不可逾越的障碍。
更深层的问题在于:执行层操控是否需要 LLM 级别的语义理解?当指令已经明确到“拿起杯子”时,模型的核心任务是将视觉场景中的杯子位置、机械臂状态与指令中的动作语义对齐,而非进行复杂的常识推理。这一洞察构成了 TurboVLA 设计的出发点。
此外,现有 LLM-centric VLA 的视觉编码器通常需要将图像转换为与 LLM 兼容的 token 序列,这一投影过程本身也引入了信息损失和计算开销。TurboVLA 选择直接使用 DINOv3 等视觉基础模型提取特征,避免了视觉到文本的强制转换。
核心创新
方法概览
问题的根源在于角色错配。大语言模型擅长语义理解和长程推理,但执行层操控需要的不是语言生成能力,而是精准的视觉-语言对齐和快速的动作映射。当指令已经具体到“拿起杯子”时,模型的核心任务是把杯子的视觉位置、机械臂状态与指令语义直接关联,而非进行复杂的常识推理。现有工作要么保留 LLM 只做加速,要么压缩模型规模,却始终没有跳出 V→L→A 的框架。
- 独立编码:视觉观测通过 DINOv3(ViT-B 或 ViT-L)提取特征,语言指令通过 BERT 编码。两者各自保留本模态的完整信息,不做强制对齐投影。
- 双向视觉-语言交互模块:核心创新在于 N 层交叉注意力堆叠。视觉特征作为 Query 关注语言特征,语言特征作为 Query 关注视觉特征,双向更新后得到任务条件化的多模态表征。这一设计受 Grounding DINO 启发,但针对操控任务做了简化。
- 动作解码:交互后的多模态特征与机器人本体状态拼接,送入基于 ACT 的 Transformer 解码器,一次性预测连续动作块(action chunk),包含未来多步的末端位姿和夹爪状态。
- 端到端行为克隆训练:整个 pipeline 从视觉和指令输入到动作输出完全可微,使用标准的 behavior cloning 损失进行监督学习。无需额外的预训练阶段或强化学习微调。
- 参数规模控制:DINOv3 ViT-B 配置下总参数量仅 0.2B,其中视觉编码器约 86M,BERT 约 110M,交互模块和动作解码器仅占数 M。推理时单张 RTX 4090 上显存占用 0.9 GB。
- 多任务扩展:对于 RoboTwin 2.0 的双臂 50 任务场景,将视觉编码器升级为 ViT-L,总参数增至 0.4B,仍保持 43.4 ms 的低延迟。
- 训练策略:LIBERO 实验使用标准的多任务联合训练;真实世界实验则从 LIBERO 预训练 checkpoint 出发,仅用 4×65 条演示数据微调,展示了良好的迁移能力。
- 与 LLM-centric 路线的根本区别:TurboVLA 不做“视觉→文本→动作”的间接映射,而是直接学习“视觉+语言→动作”的端到端映射,将语义理解隐式地融入跨模态交互中。
逐图理解论文
失败案例与直觉

图 2 对比了 LLM-centric VLA 与 TurboVLA 的架构差异。左侧的 V→L→A 通路需要将视觉 token 送入 LLM 处理,右侧的 V+L→A 通路则直接融合视觉和语言特征。下方的散点图直观展示了 TurboVLA 在性能-效率权衡上的优势。
方法贡献与验证

表 1 的 LIBERO 对比结果值得逐行细看:TurboVLA 在参数仅为 OpenVLA 的 1/35、π0.5 的 1/15 的情况下,取得了最高的平均成功率,同时延迟和显存降低了一个数量级。
关键证据与结论

消融实验揭示了两个关键事实。第一,拿掉语言条件后,成功率从 97.7% 骤降到 70.8%,说明语言指令对操控至关重要,即使模型里没有 LLM。第二,双向视觉-语言交互是性能的核心保障——仅单向更新或直接拼接特征,都会导致成功率下降。真实世界实验进一步验证了这套方案的实用性:在四项操控任务上,TurboVLA 全部优于 π0.5,证明从仿真到真实的迁移完全可行。
价值与局限

图 1 展示了 TurboVLA 的紧凑部署场景:一台消费级 GPU 即可驱动机械臂完成语言条件操控任务。注意图中标注的实时推理速度和低显存占用,这是本文的核心卖点。
实验如何设计?
- LIBERO 基准:涵盖 Object、Spatial、Goal、Long 四个子套件,评估单臂语言条件操控的全面能力。对比方法包括 OpenVLA、π0.5 等 LLM-centric VLA 以及 Diffusion Policy 等非语言条件方法。
- RoboTwin 2.0 基准:50 个双臂操控任务,仅使用干净演示数据训练,评估多任务学习和双臂协调能力。
- 真实世界实验:基于 AgileX Piper 单臂平台,配备腕部和第三视角 RGB-D 相机,测试 Grab Roller、Move Playing Card、Press Stapler、Stack Bowls 四项任务,与 π0.5 直接对比。
- 消融实验:系统性地移除语言条件、替换指令编码器、改变交互方式(无交互/单向/双向)和交互深度,验证各组件的必要性。
- 硬件环境:所有延迟和显存测量均在单张 RTX 4090 上以 batch size 1 进行,确保结果的可复现性和实际部署参考价值。
关键结果与论文证据
- LIBERO 主结果(Table 1, p.9):TurboVLA 以 0.2B 参数取得 97.7% 平均成功率,超越 OpenVLA(7B 参数,约 95%)和 π0.5(约 3B 参数,约 96%),同时延迟仅 31.2 ms,显存 0.9 GB。
- RoboTwin 2.0 结果(Table 2, p.9):在多任务设定下达到 60.2% 成功率,虽低于部分逐任务方法,但以单一模型处理 50 个双臂任务,且参数和延迟远低于 LLM-centric 方案。
- 真实世界对比(Figure 4, p.10):四项任务成功率分别为 92.5%、80%、90%、87.5%,全面优于 π0.5,验证了从仿真到真实的迁移能力。
- 语言条件消融(Table 3, p.11):移除语言输入后成功率从 97.7% 骤降至 70.8%,证明语言条件对任务执行至关重要,即使模型不使用 LLM。
- 交互方式消融(Table 5, p.11):双向交互取得 97.7% 最优结果,优于无交互(95.2%)和仅更新视觉或语言的单向变体(96.1%、96.5%),验证了双向设计的必要性。
- 交互深度消融(Table 6, p.11):N=2 层交叉注意力即可达到最佳性能,继续增加深度收益递减,说明轻量设计已足够。
- 指令编码器对比(Table 4, p.11):BERT 编码器优于 CLIP text encoder 等替代方案,表明在操控场景下,纯文本语义编码比视觉-语言联合预训练更有效。
- 效率优势的根源:TurboVLA 的推理延迟主要来自视觉和语言编码器的一次前向传播,交互模块和动作解码器的开销几乎可忽略,这与 LLM 的自回归解码形成鲜明对比。
阅读时需要注意
- 设计范围限于执行级指令,对于需要多步推理、常识判断或开放词汇理解的高层任务规划,仍需 LLM 或其他推理模块的支持。
- RoboTwin 2.0 实验仅使用干净演示训练,未测试在随机化场景或噪声数据下的鲁棒性。
- 真实世界实验任务数量有限(4 项),且微调数据量较小,更大规模的真实世界泛化能力有待验证。
- 视觉编码器(DINOv3)和语言编码器(BERT)均为冻结的预训练模型,未在操控数据上进行联合微调,可能限制了表征的进一步优化空间。
关联工作
- OpenVLA(p.3):代表性 LLM-centric VLA,使用 7B 参数的 LLM 进行自回归动作 token 预测,是 TurboVLA 的主要对比基线之一。
- π0.5(p.3):当前 SOTA 的 LLM-centric VLA,引入专用动作专家模块,在性能和效率上均有提升,TurboVLA 在多个维度上与其直接对标。
- Grounding DINO(p.5):其双向视觉-语言交互设计直接启发了 TurboVLA 的核心模块,但 TurboVLA 将其适配到操控动作预测场景。
- ACT(p.7):Action Chunking Transformer 的动作块预测架构被 TurboVLA 采用,用于从多模态特征解码连续动作序列。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
TURBOVLA:在RTX 4090上以32 Hz运行、显存占用低于1 GB的实时视觉-语言-动作模型
Hengyi Xie1∗, Chenfei Yao1∗, Xianjin Wu1, Xuanyang Xi2, Yiping Tang2, Di Xu2, Yingying Zhu1, Dingkang Liang1†, Xiang Bai1, Han Ding1
1华中科技大学,2华为技术有限公司,中国 {hengyi xie, yaochenfei, dkliang, xbai}@hust.edu.cn {xixuanyang, tangyiping, xudi21}@huawei.com § https://github.com/H-EmbodVis/TurboVLA https://H-EmbodVis.github.io/TurboVLA
以LLM为中心的VLA部署 π0.5 执行
以LLM为中心的VLA在远程服务器上 感知 93ms 动作 “把三个碗 远程服务器 叠起来” 庞大模型 仍需通过LLM推理
高延迟2026 极高显存 高部署成本 … …
网络七月 依赖网络,高延迟,高成本,受环境限制 以LLM为中心的推理将动作更新限制在11 Hz 未完成 29 我们的TurboVLA部署TurboVLA在边缘设备上 感知 31ms 动作TurboVLA感知 31ms执行动作 感知 31ms 动作 “把三个碗 轻量级模型 叠起来” (总参数量0.2B) 通过直接视觉与语言交互快速生成动作
超快推理 (32ms延迟)
极低显存 (< 1GB推理GPU内存) 边缘 (消费级低成本GPU即可) 设备 直接边缘推理,低延迟,低成本且更可靠 TurboVLA在RTX 4090上实现32 Hz的动作更新 已完成[cs.CV] 图1:TurboVLA以0.2B参数、0.9 GB推理显存和31.2 ms策略延迟,实现了紧凑的本地部署和实时的语言条件操作。
摘要
视觉-语言-动作(VLA)模型通常采用以LLM为中心的V →L →A路径,即视觉观测被投影到大语言模型的表示空间,然后再解码为机器人动作。尽管有效,但这种设计在每次策略调用时都会产生大量的计算和内存开销。在本工作中,我们提出了TurboVLA,一种新的VLA范式,它将传统的V →L →A路径重新构建为直接的V+L→A映射。TurboVLA不再使用大语言模型作为感知与动作之间的核心接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互直接在它们之间交换信息,并用一个紧凑的解码器预测连续的动作块。这种简洁的设计直接从视觉和语言特征中构建任务条件化的表示,显著降低了VLA推理的计算和内存成本。在LIBERO基准测试上,TurboVLA仅以0.2B参数、31.2 ms推理延迟和0.9 GB推理显存(在消费级RTX 4090上),就达到了97.7%的平均成功率,媲美甚至超越了规模大得多的VLA策略。这些结果确立了TurboVLA作为主流LLM-centric VLA范式的一种简单而有效的替代方案,为如何连接视觉、语言和动作以实现高效的机器人操作提供了新的视角。
∗同等贡献,按姓氏字母顺序排列。 †项目负责人。
第 2 页
100 本方法 自回归动作专家 SmolVLA (arXiv 25) (%) VLA VLA 95 π0.5 (CoRL 25) 动作成功率 DDVLA (ICML 26) 90 自回归 CogVLA (NeurIPS 25) 策略 策略 成功率 解码 85 Evo-1 (CVPR 26) 0 50 100 150 200 250 大语言模型 视觉-语言交互 延迟 (ms) ↓ Mantis (CVPR 26) 第N块 交叉注意力 TurboVLA(本方法) … 0.2 第1块 0.8Evo-1 (CVPR 26) SmolVLA (arXiv 25) LLM对齐的Token 图像特征 指令特征 2.3 π0.5 (CoRL 25) 3.4 Mantis (CVPR 26) 文本编码器 4.9 视觉编码器 分词器 视觉编码器 (BERT) DDVLA (ICML 26) 7.5 “把三个碗 “把三个碗 CogVLA (NeurIPS 25) 叠起来。” 叠起来。” 8.3 观察 指令 观察 指令 0 2 4 6 8 10 V L A V + L A 参数量 (B)
(a) 现有以LLM为中心的VLA(左)与本方法(右)的对比 (b) 性能提升 图2: 从以LLM为中心的VLA到TurboVLA。(a) 以LLM为中心的VLA从大语言模型表征中预测动作,而TurboVLA直接融合视觉与指令特征进行连续控制。(b) TurboVLA以显著更低的延迟和模型规模,取得了极具竞争力的LIBERO性能。
1 引言
视觉-语言-动作(VLA)模型已成为语言条件机器人操作的有力框架,将视觉观测、自然语言指令和机器人动作统一在一个策略中(Brohan et al., 2023; Zitkovich et al., 2023; Kim et al., 2024; Octo Model Team et al., 2024; Black et al., 2025a; Physical Intelligence et al., 2025; Liu et al., 2025; Li et al., 2024; Fu et al., 2025)。一种常见的设计是将大语言模型置于这一过程的核心。这类系统实际上遵循一条间接的V→L→A路径:视觉观测被转换为与语言对齐的表征,与任务指令结合,由大语言模型处理,随后解码为动作(Driess et al., 2023; Zitkovich et al., 2023; Kim et al., 2024)。这种设计将大规模预训练中广泛的语义知识迁移到机器人控制中,并支持开放词汇理解、语义泛化和高层推理。
然而,以LLM为中心的VLA模型为实时机器人执行带来了显著瓶颈,而实时性对于响应式交互、高吞吐量操作以及在资源受限机器人平台上的部署至关重要。如图2(a)所总结的,现有以LLM为中心的VLA模型主要遵循两种动作生成设计。自回归VLA模型,如OpenVLA(Kim et al., 2024)和RT-2(Zitkovich et al., 2023),将动作表示为token,因此继承了语言生成的顺序解码成本。近期方法通过并行动作解码、连续动作头或专用动作专家来缓解这一成本(Black et al., 2025a; Physical Intelligence et al., 2025; Kim et al., 2025; Li et al., 2024; Shukor et al., 2025)。尽管这些动作专家设计避免了逐token的动作生成,但视觉观测和指令仍需通过拥有数十亿参数的语言模型处理,然后才能预测动作。这些大语言模型核心带来了巨大的计算和内存开销,导致高推理延迟并限制了控制频率。这引出了一个更根本的问题:如何设计一个简单、优雅且高效的VLA,能够直接将视觉和语言映射为动作,用于执行级操作,而不以大语言模型为中心?
我们的核心观察是:语言对于指令条件操作是必要的,但执行级控制不必以大语言模型为中心。一旦指令已经明确了预期的操作技能,执行策略就不需要进行开放式的语言生成或自主任务分解。相反,它主要需要利用指令来确定当前的视觉证据应如何引导动作。在当前以LLM为中心的VLA模型中,这种交互是通过一个通用的语言模型表征来中介的,
第 3 页
其广泛的推理与生成能力超出了许多执行级任务的需求。轻量级文本编码器(如BERT (Devlin et al., 2019))能够提供指令中与执行相关的语义,而紧凑的跨模态交互则使语言和视觉能够共同构建面向控制的表征 (Lynch & Sermanet, 2020; Shridhar et al., 2022; Jang et al., 2022; Mees et al., 2022b)。这暗示了一种不同的VLA范式:与其围绕以LLM为中心的潜在空间组织感知与控制,不如让视觉和语言直接交互,形成专用于连续动作预测的表征。
因此,我们提出TurboVLA,一个简单而高效的V+L→A模型,用于实时语言条件操控。如图2(a)所示,TurboVLA分别使用视觉编码器和轻量级文本编码器处理视觉观测和任务指令。受先进的视觉定位模型(如Grounding DINO (Liu et al., 2024b))中高效跨模态交互的启发,TurboVLA用直接的视觉-语言交互取代了以大型语言模型为中心的执行通路,避免了通过十亿参数级语言模型处理多模态输入所带来的计算和内存开销。一个紧凑的交叉注意力模块高效地融合指令与视觉特征,随后在单次前向传播中将其解码为连续动作块 (Zhao et al., 2023),无需自回归地生成动作token。这种轻量级设计显著降低了推理延迟和GPU内存占用。
大量实验表明,TurboVLA在实现实时执行的同时,保持了强大的操控性能。在消费级RTX 4090上,其端到端策略延迟仅为31.2毫秒(从接收当前多模态观测到生成动作块),相当于每秒超过30次动作块预测(32 Hz)。TurboVLA仅包含0.2B参数,约为π0.5 (Physical Intelligence et al., 2025)参数量的6%,且推理时显存占用低于1 GB。尽管设计轻量,TurboVLA在LIBERO (Liu et al., 2023)上仍取得了97.7%的平均成功率,与规模大得多的VLA系统性能相当。如图2(b)所总结的,TurboVLA在操控性能、推理延迟和模型规模之间提供了有利的权衡,从而降低了在延迟敏感和资源受限的机器人系统中部署语言条件操控策略的硬件门槛。更广泛地,这些结果促使VLA社区审视执行级控制是否必须始终以大型语言模型为中心,并超越单纯的任务成功率来评估未来系统。我们的贡献总结如下:
• 我们重新审视了现有VLA模型以LLM为中心的设计,并指出大型语言模型核心是实时动作执行的主要瓶颈。基于此分析,我们引入了一种实时VLA范式,该范式保留了语言条件,同时将大型语言模型从执行级控制中移除。 • 我们提出TurboVLA,一个简单高效的V+L→A模型,它结合了轻量级指令编码、直接的视觉-语言交互、机器人状态条件以及非自回归的连续动作块预测。 • 在LIBERO上的实验表明,TurboVLA取得了97.7%的平均成功率,同时在消费级RTX 4090上以每秒超过30次在线策略推理的速度运行,仅需0.2B参数和低于1 GB的推理显存。除LIBERO外,TurboVLA在具有挑战性的双臂操作和真实世界场景中依然有效。
2 相关工作
视觉-语言-动作模型。视觉-语言-动作(VLA)模型将视觉观测、任务指令和动作预测整合在一个统一的策略中,通常利用大规模视觉-语言预训练来实现语义泛化。RT-1 (Brohan et al., 2023)展示了可扩展的基于Transformer的机器人控制,而RT-2 (Zitkovich et al., 2023)和OpenVLA (Kim et al., 2024)则通过动作token接口将预训练的视觉-语言模型适配到机器人轨迹上。连续控制模型,如π0 (Black et al., 2025a)和π0.5 (Physical Intelligence et al., 2025),则是在预训练的多模态骨干网络上附加专用的动作专家。这一通用VLA方向也通过跨具身数据集 (O’Neill et al., 2024)、可重用策略表征 (Octo Model Team et al., 2024)、基于扩散的机器人策略 (Liu et al., 2025; Li et al., 2024)以及面向多样化具身的基础模型 (Bjorck et al., 2025; Bu et al., 2025; Wang et al., 2026c)得到了推进。近期方法通过视觉预见 (Yang et al., 2026)、预测性世界知识 (Zhang et al., 2025c)和潜在推理 (Bai et al., 2026)增强了VLA学习。
第 4 页
其他方法通过以姿态为中心的预训练或点-动作交互引入几何感知的控制表征(Lin et al., 2026a; Chen et al., 2026a)。近期工作进一步将VLA策略扩展到动态操作,通过融入时序运动线索和短时域未来预测(Fang et al., 2026)。这些工作共同展示了大规模预训练多模态表征和日益丰富的中间表征的优势。TurboVLA聚焦于一种不同的架构选择:并非让每个控制步骤都经过一个大型生成式多模态骨干网络,而是将任务文本单独编码,并将其直接与视觉观测和机器人状态融合,用于执行层级的动作预测。
VLA策略中的高效执行。近期工作通过动作侧重新设计和骨干侧优化来提升VLA效率。动作即令牌(action-as-token)策略继承了语言模型的顺序解码过程,这催生了连续动作专家(Black et al., 2025a; Physical Intelligence et al., 2025; Kim et al., 2025)、紧凑且结构化的动作分词器(Pertsch et al., 2025; Liu et al., 2026),以及采用并行解码的动作块(action chunking)(Liu et al., 2025; Liang et al., 2026c)。紧凑型VLA架构,包括TinyVLA(Wen et al., 2025)、RoboMamba(Liu et al., 2024a)、SmolVLA(Shukor et al., 2025)和Evo-1(Lin et al., 2026b),在保留预训练多模态表征的同时,减小了模型规模或推理成本。另一条互补的研究路线通过量化(Xu et al., 2026; Wang et al., 2025)、令牌重用或剪枝(Xu et al., 2025; Jiang et al., 2025)、动态深度(Yang et al., 2025)、结构化剪枝(Wang et al., 2026a; Zhang et al., 2026)和蒸馏(Chen et al., 2026c; Jeon et al., 2026)来减少冗余的骨干计算。其他方法在不改变基础策略的情况下提高响应能力,包括异步动作块执行(Black et al., 2025b)、流式推理和时域感知流采样(Lu et al., 2026),以及推测性推理(Niu et al., 2026)。这些方法加速了动作生成或减少了计算量,同时基本保留了大型多模态骨干网络作为执行表征。相比之下,TurboVLA从底层控制通路中移除了大型生成式语言骨干,直接从紧凑的视觉、文本和本体感知特征构建动作表征。
机器人控制的语言接口。文本指令可以作为任务规范,用于调节感知和控制,而非作为生成式语言模型的提示。早期的模仿学习方法表明,一个共享策略可以将视觉观测和自然语言命令直接映射到不同的操作行为(Lynch & Sermanet, 2020; Stepputtis et al., 2020)。CLIPort(Shridhar et al., 2022)将预训练的视觉-语言语义与空间操作通路相结合,而BC-Z(Jang et al., 2022)则基于预训练的文本或人类视频嵌入来调节多任务策略。CALVIN(Mees et al., 2022b)和HULC(Mees et al., 2022a)将文本任务条件扩展到基于非结构化演示的长时域控制。PerAct(Shridhar et al., 2023)将文本目标融入基于体素的Transformer策略,而VIMA(Jiang et al., 2023)则通过交错的文本和视觉提示来表示任务。在执行层级策略之外,具身多模态语言模型结合了语言理解、3D定位和任务调度,以生成有依据的动作计划(Liang et al., 2026a)。这种面向规划的能力与本文研究的高效执行层级控制是互补的。这些工作确立了文本表征作为机器人控制有效任务输入的地位。TurboVLA在当前VLA范式下研究这一接口,探讨紧凑的文本编码器和直接的视觉-文本交互是否足以实现高性能、实时的连续控制。
3 预备知识
以LLM为中心的视觉-语言-动作模型。大多数现有VLA模型(Kim et al., 2024; Black et al., 2025a; Physical Intelligence et al., 2025; Zhou et al., 2025; Fu et al., 2025)将大型语言模型置于视觉到动作通路的核心。给定视觉观测On,视觉编码器首先提取视觉特征并将其投影到语言模型的令牌空间。投影后的视觉令牌随后与分词后的任务指令拼接,并由大型语言模型联合处理: eZvn h i = Pv(Ev(On)) , HLn = FL eZvn; Tok(x) , (1) 其中Ev表示视觉编码器,Pv将视觉特征映射到语言模型的嵌入空间,Tok(x)表示指令令牌,FL是大型语言模型。重要的是,阶段L不仅仅负责编码语言。它充当核心表征
4
第 5 页
动作块 指令条件化 视觉感知 视觉特征 指令特征 𝑎𝑡, … , 𝑎𝑡+𝑐ℎ𝑢𝑛𝑘𝑠𝑖𝑧𝑒−1
动作块解码器
FFN FFN 动作就绪特征 机器人 状态 指令到视觉交叉注意力 V-L交互模块 N × 视觉到指令交叉注意力
DinoV3 BERT 层归一化 层归一化
“把三个碗 叠起来。” K 观测 指令 视觉特征 指令特征
(a) 整体架构 (b) 视觉-语言交互模块 图3: TurboVLA概览。(a) TurboVLA通过紧凑的模态编码器、视觉-语言交互和动作块解码器,简单而高效地将视觉观测和语言指令映射为连续动作块。(b) 交互模块设计尽可能简洁,使用堆叠的双向交叉注意力生成视觉感知的指令特征和指令条件化的视觉特征。
视觉感知与机器人动作之间的桥梁:视觉信息与语言模型空间对齐,与任务指令融合,并转化为用于预测动作的多模态表示。因此,我们将这一主流的计算路径概括为V→L→A,其中L表示以LLM为中心的多模态接口。 现有的LLM-centric VLA模型主要在如何从HLn生成动作方面存在差异。自回归模型将机器人动作离散化,并从语言模型表示中顺序预测它们(Zitkovich et al., 2023; Kim et al., 2024),而动作专家模型则使用一个独立的连续解码器, ˆAn = Dact HLn , sn , (2) 以并行方式生成动作(Black et al., 2025a; Physical Intelligence et al., 2025; Kim et al., 2025; Li et al., 2024)。尽管动作专家模型避免了逐token的动作生成,但它们保留了相同的表示依赖关系,因为动作解码器是在大语言模型产生的特征上运行的。因此,尽管使用了不同的动作生成机制,两种设计都保留了L作为从视觉感知到动作预测的核心桥梁。
直接视觉-语言交互。交叉注意力为视觉和语言特征之间的直接信息交换提供了一种简单高效的机制。给定视觉特征Zv和指令特征Zl,语言条件化的视觉特征可以通过以下方式获得: eZv = Zv + Attn (Qv, Kl, Vl) , (3) 而视觉感知的指令特征则通过交换查询和上下文模态来生成。这种双向交互使得任务语言能够塑造视觉处理过程,同时视觉上下文能够细化指令表示。诸如Grounding DINO(Liu et al., 2024b)等视觉-语言定位模型采用这种直接的跨模态交互来建立文本概念与视觉内容之间的细粒度对应关系。这些模型将生成的特征用于目标定位,而我们则利用直接的视觉-语言交互来构建面向控制的表示,用于连续动作预测。
5
第 6 页
4 TURBOVLA
我们提出TurboVLA,一种直接且简洁的V+L→A范式,用于执行级语言条件操控。如图3(a)所示,TurboVLA首先使用视觉编码器和轻量级文本编码器对视觉观测和任务指令进行编码。随后,一个简洁紧凑的视觉-语言交互模块直接在两种模态之间交换信息,构建可供动作使用的特征。最后,动作块解码器将这些特征与当前机器人状态结合,在单次前向传播中预测完整的连续动作序列。与LLM-centric VLA模型不同,我们的方法在动作预测之前,不会将视觉和文本输入经由大语言模型处理。
4.1 多模态特征编码
为降低以LLM为中心的执行路径开销,同时保留简洁但充分的指令理解能力,TurboVLA采用紧凑的模态专用编码器。执行级指令通常通过物体、属性和空间关系来指定操控技能,无需开放式生成或任务级规划。因此,我们使用BERT(Devlin et al., 2019)等轻量级编码器对指令进行编码,并使用视觉编码器处理视觉观测。如图3(a)所示,所得特征被投影到共享隐藏维度d,用于后续的视觉-语言交互和动作预测。给定任务指令x,文本编码器提取token级指令特征: Zl = Pl (ftext(x)) ∈RNl×d, (4)
其中Pl将编码器输出投影到策略维度,Nl为指令token的数量。我们保留完整的token序列而非池化嵌入,以便物体、属性和空间关系仍可用于细粒度的视觉条件化。 对于每个相机观测I(i)n,图像编码器提取空间视觉特征,这些特征经投影后与位置嵌入和相机视角嵌入相加: Zv,(i)n = Pv fimg I(i)n + E(i)pos + e(i)view, Zvn = h Zv,(1)n ; . . . ; Zv,(K)n i . (5)
这里,E(i)pos保留视角内的空间结构,e(i)view标识相机来源。拼接K个流可保留来自多个视角的互补线索。
机器人状态是将任务条件化的场景特征转化为可执行动作所必需的,但对于视觉-语言对应关系并非必要。我们将其单独编码为: Zsn = fstate(sn) ∈RNs×d, (6)
其中fstate是一个轻量级投影网络。状态特征直接输入动作解码器,使跨模态交互专注于任务条件化的场景理解。这些模态专用编码器用针对执行级操控定制的紧凑特征序列取代了高维LLM接口,在保留控制所需信息的同时,降低了中间激活内存和下游注意力成本。
4.2 视觉-语言交互模块
独立编码的视觉和文本特征尚未识别哪些视觉内容与当前指令相关。LLM-centric VLA在大型语言骨干网络内部完成这种对齐,而TurboVLA则使用图3(b)中简洁高效的视觉-语言交互模块,直接在两个流之间交换信息。 令V n0 = Zvn和L0n = Zl表示初始视觉和指令特征。交互模块通过N个双向跨模态层逐步更新两个流:
V n,ℓ Lℓn = FusionLayerℓ V nℓ−1 , Lℓ−1n , ℓ= 1, . . . , N. (7)
每一层包含层归一化、双向交叉注意力以及带残差连接的模态专用前馈网络。视觉到指令的注意力将场景上下文注入
第 7 页
将指令信息引入指令流,同时指令到视觉的注意力机制使视觉特征以任务语义为条件。在最后一层之后,更新后的流被拼接为:
Zvln = [V nN ; LNn ]。 (8)
通过这个紧凑的交互模块,目标物体、属性及空间关系等信息可以调制相关的视觉特征,同时指令表征也同步适应当前场景。这种简洁的交互设计高效地为动作预测提供了任务特定的多模态信息,而无需依赖大语言模型广泛的生成与推理能力。
4.3 连续动作块预测
我们采用ACT风格(Zhao et al., 2023)的轻量级Transformer解码器,将融合后的多模态表征与机器人状态特征映射为连续动作序列: ˆAn = Dθ(Qa, Zvln ; Zsn) ∈ RH×da, (9)
其中 Qa = [q1, . . . , qH] 包含 H 个可学习的动作查询,Dθ 表示动作块解码器。在此阶段引入机器人状态,提供了当前的具身配置信息,同时使前置的交互模块专注于以任务为条件的场景理解。
所有动作查询并行解码,使得策略能够在单次前向传播中预测完整的 H 步动作块,无需动作分词或序列生成。我们通过专家动作块上的行为克隆来训练 TurboVLA。给定目标序列 A∗n = [a∗n,1, . . . , a∗n,H],训练目标为 ℓ1 损失,且无需辅助的语言建模目标。紧凑的特征编码、直接的视觉-语言交互以及并行动作解码,共同构成了图3(a)所示的高效 V+L→A 执行路径。
5 实验
我们评估 TurboVLA 能否在保持强大语言条件操作性能的同时,大幅降低以LLM为中心的VLA策略的模型规模、推理延迟和内存开销。我们首先描述了在 LIBERO (Liu et al., 2023)、RoboTwin 2.0 (Chen et al., 2026b) 以及真实世界部署中的实现细节与评估协议。随后,我们评估了单臂操作上的性能-效率权衡,检验了所提架构在双臂多任务控制上的可扩展性,验证了其在真实世界部署中的有效性,并对我们直接的视觉-语言交互设计的主要组件进行了消融分析。
5.1 实现细节
我们使用 DINOv3 (Siméoni et al., 2025) 作为视觉骨干网络,BERT (Devlin et al., 2019) 作为轻量级指令编码器。视觉和文本特征被投影到共享空间 d = 256,并由 N = 6 层双向视觉-语言交互层处理,这些层使用基于定位预训练的特征增强权重进行初始化 (Liu et al., 2024b)。一个ACT风格的Transformer解码器 (Zhao et al., 2023) 将生成的多模态特征和机器人状态映射为连续动作块。在所有基准测试中,我们使用 ℓ1 损失进行行为克隆训练,学习率为 5 × 10−5,在四块 RTX 4090 GPU 上进行。各基准测试的具体设置如下所述。
5.2 基准测试与评估指标
我们在三个互补的设置下评估 TurboVLA:LIBERO (Liu et al., 2023) 上的单臂操作、RoboTwin 2.0 (Chen et al., 2026b) 上的双臂操作,以及在真实机器人平台上的部署。
LIBERO 包含四个套件——LIBERO-Object、LIBERO-Spatial、LIBERO-Goal 和 LIBERO-Long——每个套件包含十个语言条件操作任务。我们使用随 OpenVLA (Kim et al., 2024) 发布的修改版 no noops RLDS 数据集,并联合训练一个混合套件模型,其视觉骨干为 DINOv3 ViT-B。该模型预测连续 7-DoF 动作的 12 步块,训练 80k 步,包含 10k 预热步,有效批量大小为
第 8 页
256. 遵循VLA-Adapter的部署协议(Wang et al., 2026b),在不引入任何额外技术的情况下,我们对每个任务进行50次部署试验,并报告在2,000次试验上的套件级和平均成功率。
RoboTwin 2.0包含50个需要协调双臂控制的语言条件双臂操作任务。在可用计算预算下,我们将训练限制在官方干净演示数据上,不包含随机化场景数据。我们联合训练一个多任务模型,采用DINOv3 ViT-L骨干网络,预测14维绝对关节位置动作的50步动作块。训练持续55k步,包含1k步预热,有效批量大小为192。遵循StarVLA(StarVLA Community, 2026)的训练和评估框架,在不引入任何额外技术的情况下,我们对每个任务进行100次干净设置下的部署试验,并报告全部50个任务的平均成功率。
真实世界评估。我们使用图4所示的AgileX Piper平台进行了真实世界实验。我们考虑了四个具有代表性的语言条件操作任务:抓取滚轮、移开扑克牌、按压订书机和堆叠三个碗。这些任务要求准确的目标定位、视角鲁棒性以及在真实传感噪声下的稳定闭环执行。我们从在LIBERO上预训练的TurboVLA检查点初始化策略,并在4×65个遥操作真实世界演示数据上微调12.5k步。每个任务评估40次试验,并报告成功率。我们在相同平台、训练数据和评估协议下与π0.5进行比较。
评估指标与对比。我们以任务成功率作为所有基准测试的主要指标。同时报告总参数量、推理延迟和推理显存占用。对于对比中包含的所有其他可运行方法,这些效率指标均使用官方架构、实现和检查点,在RTX 4090上以批量大小为1进行测量。延迟从多模态输入到生成一个动作块或等效数量的自回归动作令牌进行测量,推理显存占用表示完整在线策略的峰值GPU内存使用量。
5.3 主要结果
表1和表2展示了TurboVLA在仿真基准上的互补评估。从这些结果中,我们得出以下观察。
1) 超越以LLM为中心的执行路径可提升性能-效率前沿。如表1总结,TurboVLA以显著更低的成本匹配了大型能力导向VLA的操作能力。其平均成功率达到97.7%,而π0.5(Physical Intelligence et al., 2025)为96.9%,同时仅使用其约6%的参数量,并将推理延迟从93.6 ms大幅降低至31.2 ms。我们的方法在平均成功率上也优于近期的VLA-JEPA(Sun et al., 2026),同时速度超过其3倍,且仅使用其约7%的参数量。这一对比表明,强大的执行级操作能力并非固有地依赖于使用数十亿参数的LLM作为感知与动作之间的核心接口。相较于加速导向VLA,优势依然明显:OpenVLA-OFT(Kim et al., 2025)和离散扩散VLA(Liang et al., 2026c)优化了动作生成,分别实现了112.2 ms和60.8 ms的推理延迟,但两者均比我们的方法更慢且平均成功率更低,因为它们的大型语言骨干仍保留在执行中心。与轻量级VLA相比,TurboVLA进一步改善了权衡的两端。它在平均成功率上优于近期的Evo-1(Lin et al., 2026b)和VLA-Adapter(Wang et al., 2026b),同时模型显著更小、速度更快。这种性能-效率优势也延伸至RoboTwin 2.0基准。如表2所示,TurboVLA在50个双臂任务上以43.4 ms的推理延迟实现了60.2%的平均成功率,优于π0.5的57.0%和95.6 ms,以及StarVLA-α(Ye et al., 2026)的50.3%和74.9 ms。
这些结果表明,仅加速动作生成或仅减小模型规模都是不够的。通过重新设计多模态执行路径,TurboVLA验证了简单直接的V+L→A范式,作为一种更有效的方式,在单臂和双臂控制场景下共同实现强大的操作性能、低延迟和紧凑的模型规模。
2) 架构效率转化为实际可部署性。实际的机器人部署同时受限于策略准确性、响应延迟和常驻内存,而非任何单一因素。
第 9 页
表1:LIBERO基准对比。“Emb. PT.”表示在LIBERO之外使用机器人数据进行额外的具身预训练。Params表示总参数量。Latency表示从多模态输入到生成一个action chunk或等效数量的自回归动作token的时间。延迟和推理显存均在单张RTX 4090上以批大小为1测量。对于TurboVLA,报告的参数量对应DINOv3 ViT-B配置。
| 方法 | 具身预训练 | 参数量 (B)↓ | 显存 (GB)↓ | 延迟 (ms)↓ | 空间 | 物体 | 目标 | 长程 | 平均成功率 (%)↑ | |——|———–|————|————|————|——|——|——|——|——————-| | 非VLA策略基线 | | | | | | | | | | | Diffusion Policy (Chi et al., 2023) (RSS'23) | ✗ | 0.3 | 1.1 | 924.8 | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 | | 能力导向VLA | | | | | | | | | | | OpenVLA (Kim et al., 2024) (CoRL'24) | ✓ | 7.5 | 14.9 | 202.9 | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 | | π0 (Black et al., 2025a) (RSS'25) | ✓ | 3.2 | 12.3 | 84.2 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 | | UniVLA (Bu et al., 2025) (RSS'25) | ✓ | 7.6 | 15.0 | 173.8 | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 | | π0.5 (Physical Intelligence et al., 2025) (CoRL'25) | ✓ | 3.4 | 12.8 | 93.6 | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 | | CogVLA (Li et al., 2025) (NeurIPS'25) | ✓ | 8.3 | 16.1 | 115.5 | 98.6 | 98.8 | 96.6 | 95.4 | 97.4 | | Mantis (Yang et al., 2026) (CVPR'26) | ✓ | 4.9 | 7.9 | 198.7 | 98.8 | 99.2 | 94.4 | 94.2 | 96.7 | | MM-ACT (Liang et al., 2026b) (CVPR'26) | ✗ | 8.2 | 16.3 | 723.2 | 97.8 | 99.4 | 94.8 | 93.0 | 96.3 | | VLA-JEPA (Sun et al., 2026) (ECCV'26) | ✓ | 2.8 | 5.3 | 108.7 | 96.2 | 99.6 | 97.2 | 95.8 | 97.2 | | VEGA-3D (Wu et al., 2026) (ECCV'26) | ✓ | 9.0 | 16.0 | 546.4 | 97.4 | 99.4 | 97.0 | 95.2 | 97.3 | | 加速导向VLA | | | | | | | | | | | OpenVLA-OFT (Kim et al., 2025) (RSS'25) | ✓ | 7.7 | 15.7 | 112.2 | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 | | DDVLA (Liang et al., 2026c) (ICML'26) | ✓ | 7.5 | 14.5 | 60.8 | 97.2 | 99.4 | 96.8 | 92.2 | 96.4 | | 轻量化VLA | | | | | | | | | | | SmolVLA (Shukor et al., 2025) (ArXiv'25) | ✗ | 2.3 | 7.1 | 203.1 | 93.0 | 94.0 | 91.0 | 77.0 | 88.8 | | DreamVLA (Zhang et al., 2025c) (NeurIPS'25) | ✗ | 0.7 | 1.5 | 128.0 | 97.5 | 94.0 | 89.5 | 89.5 | 92.6 | | VLA-Adapter (Wang et al., 2026b) (AAAI'26) | ✗ | 1.5 | 4.3 | 87.3 | 97.8 | 99.2 | 97.2 | 95.0 | 97.3 | | Evo-1 (Lin et al., 2026b) (CVPR'26) | ✗ | 0.8 | 1.7 | 137.2 | 92.7 | 97.7 | 96.3 | 92.3 | 94.8 | | TurboVLA (本文) | ✗ | 0.2 | 0.9 | 31.2 | 99.2 | 99.8 | 97.4 | 94.2 | 97.7 |
表2:RoboTwin 2.0基准对比,所有方法均在干净设置下训练和评估。“Emb. PT.”表示在RoboTwin 2.0之外使用机器人数据进行额外的具身预训练,Params表示总参数量。单任务方法为50个任务分别训练独立策略,多任务方法则跨所有任务联合训练单一策略。对于TurboVLA,报告的参数量对应DINOv3 ViT-L配置。
| 方法 | 具身预训练 | 参数量 (B)↓ | 延迟 (ms)↓ | 平均成功率 (%)↑ | |——|———–|————|————|——————-| | 单任务训练 | | | | | | Diffusion Policy (Chi et al., 2023) (RSS'23) | ✗ | 0.1 | 794.1 | 28.0 | | ACT (Zhao et al., 2023) (RSS'23) | ✗ | 0.1 | 20.4 | 29.7 | | DP3 (Ze et al., 2024) (RSS'24) | ✗ | 0.3 | 78.4 | 55.2 | | π0 (Black et al., 2025a) (RSS'25) | ✓ | 3.2 | 87.6 | 46.4 | | FlowPolicy (Zhang et al., 2025b) (AAAI'25) | ✗ | 0.3 | – | 41.0 | | RDT (Liu et al., 2025) (ICLR'25) | ✓ | 1.7 | 204.8 | 34.5 | | SeedPolicy (Gui et al., 2026) (ArXiv'26) | ✗ | 0.2 | 823.9 | 42.8 | | 多任务训练 | | | | | | UP-VLA (Zhang et al., 2025a) (ICML'25) | ✓ | 1.6 | 74.3 | 52.9 | | π0.5 (Physical Intelligence et al., 2025) (CoRL'25) | ✓ | 3.4 | 95.6 | 57.0 | | StarVLA-α (Ye et al., 2026) (ECCV'26) | ✗ | 3.8 | 74.9 | 50.3 | | TurboVLA (本文) | ✗ | 0.4 | 43.4 | 60.2 |
单一效率指标。如表1所总结,大多数高性能VLA策略运行在数十亿参数级别,需要数GB的推理显存,且其推理延迟通常远高于TurboVLA。这样的资源需求可能将部署限制在配备高显存GPU的平台上,或需要额外的压缩和系统级优化。相比之下,完整的TurboVLA策略在LIBERO基准上结合了97.7%的平均
第 10 页
TurboVLA (Ours) π0.5 95 第三视角 (%) 90 RGB-D 相机 (D435) 成功率 85 六自由度 AgileX 80 PIPER 机械臂 成功率 75 70 腕部视角 RGB-D 抓取抓取 滚轮滚轮 移动移动 扑克牌扑克牌 按压按压 订书机订书机 堆叠堆叠 碗碗 相机 (D435) 堆叠碗 按压订书机 真实世界任务物体
抓取滚轮 移动扑克牌
图 4: 在 AgileX Piper 平台上的真实世界评估。左图:我们的单臂设置,包含一个腕部视角 RGB-D 相机和一个第三视角 RGB-D 相机,以及四项任务中使用的物体。右上图:TurboVLA 与 π0.5 在四项真实世界操作任务上的成功率对比。右下图:TurboVLA 的定性执行示例。
成功实现 31.2 ms 的 action chunk 推理,且推理显存仅需 0.9 GB。这种良好的效率特性也很好地迁移到了真实机器人部署中。如图 4 所示,TurboVLA 在四项真实世界 AgileX Piper 任务上分别取得了 92.5%、80%、90% 和 87.5% 的成功率,持续优于 π0.5。这些结果表明,所提出的直接 V + L → A 通路在真实世界执行级操作中是充分且有效的。
5.4 消融研究
我们在 LIBERO 上进行消融实验,以研究四个问题:语义语言条件是否必要、指令应如何编码、哪种 vision-language interaction 设计最有效,以及该方法对交互深度 N 和动作预测范围 H 的敏感度。
语义语言条件与指令编码。我们首先研究语言本身的作用。表 3 显示,移除语言后,平均成功率从 97.7% 降至 70.8%,其中在 LIBERO-Goal 上的降幅最大(97.4% → 11.6%)。这证实了当同一场景兼容多种行为时,策略不能仅依赖视觉先验。用可学习的任务 ID 嵌入替代语义指令可以恢复部分性能,但仍比完整模型低 2.3%,这表明自然语言指令提供的不仅仅是封闭集合的任务标识。接着,我们检验所提出的架构是否依赖于特定的文本骨干网络。如表 4 所示,T5-small (Raffel et al., 2020) 取得了具有竞争力的 97.1% 平均成功率,而 SigLIP (Zhai et al., 2023) 文本编码器达到了 95.5%,这表明执行级指令可以由轻量级文本编码器有效处理,无需大型生成式语言模型,且所提出的架构并不依赖于特定的文本表示。
Vision-language interaction 设计。在确立了语义指令特征的重要性之后,我们接下来研究视觉和语言特征在动作解码之前应如何交互。如图 5 所示,我们比较了无交互、两种非对称交叉注意力变体以及所提出的双向交互,同时保持所有其他架构和训练设置不变。如表 5 所示,直接拼接取得了 95.2% 的平均成功率,而两种单向交叉注意力变体将其提升至 96.1% 和 96.5%。双向交互表现最佳,达到 97.7%,这表明场景感知的指令特征和指令条件化的视觉特征为动作预测提供了互补信息。
交互深度与动作预测范围。最后,我们探索了策略的两个实用超参数。表 6 显示,将交互层数从 N = 2 增加到 N = 6,平均成功率从 93.5% 稳步提升至 97.7%,而更深的 N = 8 模型则略微下降至 96.6%。因此,我们使用 N = 6 作为容量与效率之间的良好平衡。我们还改变了动作预测范围 H,同时保持架构的其余部分不变。如图 6 所示,性能从 H = 8 时的 96.4% 提升到 H = 12 时的 97.7%,然后在 H = 15 时下降至 95.6%。这表明预测范围太短会限制时序表达能力,而预测范围太长则会使 action chunk 预测更加困难。因此,我们在所有主要实验中使用 H = 12。
10
第 11 页
表3:语言条件的影响。表4:指令编码器的影响。
条件 空间 物体 目标 长程 平均 文本编码器 总参数量 (M) 空间 物体 目标 长程 平均
无语言 87.0 99.4 11.6 85.0 70.8 SigLIP-Base 216.9 98.6 99.6 94.8 89.0 95.5 任务ID嵌入 95.6 98.6 95.8 91.6 95.4 T5-Small 141.9 98.8 99.8 96.8 92.8 97.1 语义指令 99.2 99.8 97.4 94.2 97.7 BERT 216.1 99.2 99.8 97.4 94.2 97.7
表5:视觉-语言交互的影响。表6:交互深度N的影响。
交互设计 空间 物体 目标 长程 平均 N 总参数量 (M) 空间 物体 目标 长程 平均
无交互 97.4 99.8 90.8 92.8 95.2 2 206.6 96.6 99.6 88.4 89.4 93.5 语言查询视觉 98.4 99.4 94.2 92.4 96.1 4 211.3 98.0 99.4 93.2 92.2 95.7 视觉查询语言 98.6 100.0 94.4 93.0 96.5 6 216.1 99.2 99.8 97.4 94.2 97.7 双向交互 99.2 99.8 97.4 94.2 97.7 8 220.8 98.2 99.6 95.8 92.8 96.6
动作块解码器 动作块解码器 动作块解码器 动作块解码器
指令到视觉交叉注意力
指令到视觉交叉注意力 视觉到指令交叉注意力
视觉到指令交叉注意力
视觉 指令 视觉 指令 视觉 指令 视觉 指令 特征 (a) 无交互 (b) 语言查询视觉 (c) 视觉查询语言 (d) 双向交互(本文方法) 图5:视觉-语言交互变体。(a) 直接拼接视觉和指令特征。(b) 仅使用视觉特征更新指令特征。(c) 仅使用指令特征更新视觉特征。(d) 双向交互联合更新两个特征流。
总体而言,这些消融实验表明,TurboVLA在实现高效性的同时,并未舍弃语义语言信息或显式的跨模态建模。其性能得益于轻量级指令编码与充分的双向视觉-语言交互,这支持了所提出的直接执行路径作为以LLM为中心的VLA架构的有效替代方案。
6 结论
在本文中,我们提出了TurboVLA,这是一种简单而高效的V+L→A范式,它超越了传统的以LLM为中心的视觉-语言-动作学习执行路径。通过结合轻量级指令编码、紧凑视觉表示、双向视觉-语言交互和动作块解码,TurboVLA在保持任务条件操作能力的同时,显著减小了模型尺寸、推理延迟和内存消耗。我们的结果表明,执行层面的控制不一定需要通用LLM作为感知与动作之间的核心接口,我们希望该架构能为社区进一步审视大语言模型在VLA系统中的作用提供新的见解。尽管如此,TurboVLA主要针对具体的执行层面指令设计,可能无法提供高层任务规划所需的复杂语义理解和推理能力。未来工作将探索将LLM的高层规划能力与TurboVLA的高效执行路径相结合,以构建既智能又高效的层次化系统。
第 12 页
参考文献
Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, 等. Latent reasoning vla: Latent thinking and prediction for vision-language-action models. 收录于《国际机器学习会议论文集》, 2026.
Johan Bjorck, Fernando Castañeda, Nikita Cherniadev, Xingye Da, Runyu Ding, Linxi Fan, Yu Fang, Dieter Fox, Fengyuan Hu, Spencer Huang, 等. Gr00t n1: An open foundation model for generalist humanoid robots. arXiv预印本 arXiv:2503.14734, 2025.
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, 等. π0: A vision-language-action flow model for general robot control. 收录于《机器人学:科学与系统会议论文集》, 2025a.
Kevin Black, Manuel Galliker, 和 Sergey Levine. Real-time execution of action chunking flow policies. 收录于《神经信息处理系统进展会议论文集》, 第38卷, 第33383–33407页, 2025b.
Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, 等. Rt-1: Robotics transformer for real-world control at scale. 收录于《机器人学:科学与系统会议论文集》, 2023.
Qingwen Bu, Yanting Yang, Jisong Cai, Shenyuan Gao, Guanghui Ren, Maoqing Yao, Ping Luo, 和 Hongyang Li. Univla: Learning to act anywhere with task-centric latent actions. 收录于《机器人学:科学与系统会议论文集》, 2025.
Shizhe Chen, Paul Pacaud, 和 Cordelia Schmid. Pointact: Vision-language-action models with multi-scale point-action interaction. 收录于《机器人学:科学与系统会议论文集》, 2026a.
Tianxing Chen, Zanxin Chen, Baijun Chen, Zijian Cai, Yibin Liu, Zixuan Li, Qiwei Liang, Xianliang Lin, Yiheng Ge, Zhenyu Gu, 等. Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation. 收录于《国际机器学习会议论文集》, 2026b.
Yuxuan Chen, Yixin Han, Yize Huang, 和 Xiao Li. Rlrc: Reinforcement learning-based recovery for compressed vision-language-action models. 《IEEE机器人与自动化快报》, 2026c.
Cheng Chi, Zhenjia Xu, Siyuan Feng, Eric Cousineau, Yilun Du, Benjamin Burchfiel, Russ Tedrake, 和 Shuran Song. Diffusion policy: Visuomotor policy learning via action diffusion. 收录于《机器人学:科学与系统会议论文集》, 2023.
Jacob Devlin, Ming-Wei Chang, Kenton Lee, 和 Kristina Toutanova. Bert: Pre-training of deep bidirectional transformers for language understanding. 收录于《2019年计算语言学协会北美分会会议论文集:人类语言技术》, 第1卷(长文与短文), 第4171–4186页, 2019.
Danny Driess, Fei Xia, Mehdi SM Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, 等. Palm-e: An embodied multimodal language model. 收录于《国际机器学习会议论文集》, 2023.
Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, 和 Xiang Bai. Towards generalizable robotic manipulation in dynamic environments. 收录于《欧洲计算机视觉会议论文集》, 2026.
Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Dingkang Liang, Chong Zhang, Dingyuan Zhang, Hongwei Xie, Bing Wang, 和 Xiang Bai. Orion: A holistic end-to-end autonomous driving framework by vision-language instructed action generation. 收录于《IEEE国际计算机视觉会议论文集》, 第24823–24834页, 2025.
Youqiang Gui, Yuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, 和 Shuaicheng Liu. Seedpolicy: Horizon scaling via self-evolving diffusion policy for robot manipulation. arXiv预印本 arXiv:2603.05117, 2026.
12
第 13 页
Eric Jang, Alex Irpan, Mohi Khansari, Daniel Kappler, Frederik Ebert, Corey Lynch, Sergey Levine, 和 Chelsea Finn. Bc-z: Zero-shot task generalization with robotic imitation learning. 见机器人学习会议论文集,第 991–1002 页。PMLR, 2022。
Boseong Jeon, Yunho Choi, 和 Taehan Kim. Shallow-π: Knowledge distillation for flow-based vlas. 见IEEE智能机器人与系统国际会议论文集,2026。
Titong Jiang, Xuefeng Jiang, Yuan Ma, Xin Wen, Bailin Li, Kun Zhan, Peng Jia, Yahui Liu, Sheng Sun, 和 Xianpeng Lang. The better you learn, the smarter you prune: Towards efficient vision-language-action models via differentiable token pruning. arXiv预印本 arXiv:2509.12594, 2025。
Yunfan Jiang, Agrim Gupta, Zichen Zhang, Guanzhi Wang, Yongqiang Dou, Yanjun Chen, Li Fei-Fei, Anima Anandkumar, Yuke Zhu, 和 Linxi Fan. Vima: General robot manipulation with multimodal prompts. 见国际机器学习会议论文集,2023。
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, 等. Openvla: An open-source vision-language-action model. 见机器人学习会议论文集,2024。
Moo Jin Kim, Chelsea Finn, 和 Percy Liang. Fine-tuning vision-language-action models: Optimizing speed and success. 见机器人学:科学与系统会议论文集,2025。
Qixiu Li, Yaobo Liang, Zeyu Wang, Lin Luo, Xi Chen, Mozheng Liao, Fangyun Wei, Yu Deng, Sicheng Xu, Yizhong Zhang, 等. Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation. arXiv预印本 arXiv:2411.19650, 2024。
Wei Li, Renshan Zhang, Rui Shao, Jie He, 和 Liqiang Nie. Cogvla: Cognition-aligned vision-language-action models via instruction-driven routing & sparsification. 见神经信息处理系统进展会议论文集,第38卷,第137646–137675页,2025。
Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, 和 Xiang Bai. Cook and clean together: Teaching embodied agents for parallel task execution. 见AAAI人工智能会议论文集,第40卷,第18415–18424页,2026a。
Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, 等. Mm-act: Learn from multimodal parallel generation to act. 见IEEE国际计算机视觉与模式识别会议论文集,第35080–35090页,2026b。
Zhixuan Liang, Yizhuo Li, Tianshuo Yang, Chengyue Wu, Sitong Mao, Liuao Pei, Tian Nian, Shunbo Zhou, Xiaokang Yang, Jiangmiao Pang, 等. Discrete diffusion vla: Bringing discrete diffusion to action decoding in vision-language-action policies. 见国际机器学习会议论文集,2026c。
Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, 和 Yanwei Fu. Posevla: Universal pose pretraining for generalizable vision-language-action policies. 见机器人学:科学与系统会议论文集,2026a。
Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, 等. Evo-1: Lightweight vision-language-action model with preserved semantic alignment. 见IEEE国际计算机视觉与模式识别会议论文集,第13397–13406页,2026b。
Bo Liu, Yifeng Zhu, Chongkai Gao, Yihao Feng, Qiang Liu, Yuke Zhu, 和 Peter Stone. Libero: Benchmarking knowledge transfer for lifelong robot learning. 见神经信息处理系统进展会议论文集,第36卷,第44776–44791页,2023。
Chaoqi Liu, Xiaoshen Han, Jiawei Gao, Yue Zhao, Haonan Chen, 和 Yilun Du. Oat: Ordered action tokenization. 见机器人学:科学与系统会议论文集,2026。
Jiaming Liu, Mengzhen Liu, Zhenyu Wang, Pengju An, Xiaoqi Li, Kaichen Zhou, Senqiao Yang, Renrui Zhang, Yandong Guo, 和 Shanghang Zhang. Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation. 见神经信息处理系统进展会议论文集,第37卷,第40085–40110页,2024a。
13
第 14 页
Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, 等. Grounding dino: Marrying dino with grounded pre-training for open-set object detection. 收录于《欧洲计算机视觉会议论文集》,第38–55页。Springer, 2024b.
Songming Liu, Lingxuan Wu, Bangguo Li, Hengkai Tan, Huayu Chen, Zhengyi Wang, Ke Xu, Hang Su, 和 Jun Zhu. Rdt-1b: a diffusion foundation model for bimanual manipulation. 收录于《国际学习表征会议论文集》,2025.
Yuxiang Lu, Zhe Liu, Xianzhe Fan, Zhenya Yang, Jinghua Hou, Junyi Li, Kaixin Ding, 和 Hengshuang Zhao. Faster: Rethinking real-time flow vlas. arXiv预印本 arXiv:2603.19199, 2026.
Corey Lynch 和 Pierre Sermanet. Language conditioned imitation learning over unstructured data. 收录于《机器人:科学与系统会议论文集》,2020.
Oier Mees, Lukas Hermann, 和 Wolfram Burgard. What matters in language conditioned robotic imitation learning over unstructured data. 《IEEE机器人与自动化快报》,7(4):11205–11212, 2022a.
Oier Mees, Lukas Hermann, Erick Rosete-Beas, 和 Wolfram Burgard. Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks. 《IEEE机器人与自动化快报》,7(3):7327–7334, 2022b.
Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, 和 Huawei Li. Realtime-vla flash: Speculative inference framework for diffusion-based vlas. arXiv预印本 arXiv:2605.13778, 2026.
Octo Model Team, Dibya Ghosh, Homer Walke, Karl Pertsch, Kevin Black, Oier Mees, Sudeep Dasari, Joey Hejna, Tobias Kreiman, Charles Xu, 等. Octo: An open-source generalist robot policy. 收录于《机器人:科学与系统会议论文集》,2024.
Abby O'Neill, Abdul Rehman, Abhiram Maddukuri, Abhishek Gupta, Abhishek Padalkar, Abraham Lee, Acorn Pooley, Agrim Gupta, Ajay Mandlekar, Ajinkya Jain, 等. Open x-embodiment: Robotic learning datasets and rt-x models. 收录于《IEEE国际机器人与自动化会议论文集》,第6892–6903页。IEEE, 2024.
Karl Pertsch, Kyle Stachowicz, Brian Ichter, Danny Driess, Suraj Nair, Quan Vuong, Oier Mees, Chelsea Finn, 和 Sergey Levine. Fast: Efficient action tokenization for vision-language-action models. 收录于《机器人:科学与系统会议论文集》,2025.
Physical Intelligence, Kevin Black, Noah Brown, James Darpinian, Karan Dhabalia, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, 等. π0.5: a vision-language-action model with open-world generalization. 收录于《机器人学习会议论文集》,2025.
Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, 和 Peter J Liu. Exploring the limits of transfer learning with a unified text-to-text transformer. 《机器学习研究杂志》,21(140):1–67, 2020.
Mohit Shridhar, Lucas Manuelli, 和 Dieter Fox. Cliport: What and where pathways for robotic manipulation. 收录于《机器人学习会议论文集》,第894–906页。PMLR, 2022.
Mohit Shridhar, Lucas Manuelli, 和 Dieter Fox. Perceiver-actor: A multi-task transformer for robotic manipulation. 收录于《机器人学习会议论文集》,第785–799页。PMLR, 2023.
Mustafa Shukor, Dana Aubakirova, Francesco Capuano, Pepijn Kooijmans, Steven Palma, Adil Zouitine, Michel Aractingi, Caroline Pascal, Martino Russi, Andres Marafioti, 等. Smolvla: A vision-language-action model for affordable and efficient robotics. arXiv预印本 arXiv:2506.01844, 2025.
Oriane Siméoni, Huy V Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Michaël Ramamonjisoa, 等. Dinov3. arXiv预印本 arXiv:2508.10104, 2025.
14
第 15 页
StarVLA Community. Starvla: A lego-like codebase for vision-language-action model developing. arXiv preprint arXiv:2604.05014, 2026.
Simon Stepputtis, Joseph Campbell, Mariano Phielipp, Stefan Lee, Chitta Baral, and Heni Ben Amor. Language-conditioned imitation learning for robot manipulation tasks. In Proc. of Advances in Neural Information Processing Systems, volume 33, pp. 13139–13150, 2020.
Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, and Zhibo Chen. Vla-jepa: Enhancing vision-language-action model with latent world model. In Proc. of European Conference on Computer Vision, 2026.
Hanzhen Wang, Jiaming Xu, Yushun Xiang, Jiayi Pan, Yongkang Zhou, Yong-Lu Li, and Guohao Dai. Specprune-vla: Accelerating vision-language-action models via action-aware self-speculative pruning. In Proc. of Intl. Conf. on Machine Learning, 2026a.
Hongyu Wang, Chuyan Xiong, Ruiping Wang, and Xilin Chen. Bitvla: 1-bit vision-language-action models for robotics manipulation. arXiv preprint arXiv:2506.07530, 2025.
Yihao Wang, Pengxiang Ding, Lingxiao Li, Can Cui, Zirui Ge, Xinyang Tong, Wenxuan Song, Han Zhao, Wei Zhao, Pengxu Hou, et al. Vla-adapter: An effective paradigm for tiny-scale vision- language-action model. In Proc. of the AAAI Conf. on Artificial Intelligence, pp. 18638–18646, 2026b.
Yuqi Wang, Xinghang Li, Wenxuan Wang, Junbo Zhang, Yingyan Li, Yuntao Chen, Xinlong Wang, and Zhaoxiang Zhang. Unified vision-language-action model. In Proc. of Intl. Conf. on Learning Representations, 2026c.
Junjie Wen, Yichen Zhu, Jinming Li, Minjie Zhu, Zhibin Tang, Kun Wu, Zhiyuan Xu, Ning Liu, Ran Cheng, Chaomin Shen, et al. Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation. IEEE Robotics and Automation Letters, 2025.
Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, and Xiang Bai. Generation models know space: Unleashing implicit 3d priors for scene understanding. In Proc. of European Conference on Computer Vision, 2026.
Siyu Xu, Yunke Wang, Chenghao Xia, Dihao Zhu, Tao Huang, and Chang Xu. Vla-cache: Efficient vision-language-action manipulation via adaptive token caching. In Proc. of Advances in Neural Information Processing Systems, volume 38, pp. 164448–164473, 2025.
Yuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu, Yuming Li, Bing Li, and Zhipeng Zhang. Qvla: Not all channels are equal in vision-language-action model’s quantization. In Proc. of Intl. Conf. on Learning Representations, 2026.
Yantai Yang, Yuhao Wang, Zichen Wen, Luo Zhongwei, Chang Zou, Zhipeng Zhang, Chuan Wen, and Linfeng Zhang. Efficientvla: Training-free acceleration and compression for vision-language- action models. In Proc. of Advances in Neural Information Processing Systems, volume 38, pp. 40891–40914, 2025.
Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, and Zhijie Deng. Mantis: A versatile vision-language-action model with disentangled visual foresight. In Proc. of IEEE Intl. Conf. on Computer Vision and Pattern Recognition, pp. 42505–42515, 2026.
Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, and Jiaya Jia. Starvla-alpha: Reducing complexity in vision-language-action systems. In Proc. of European Conference on Computer Vision, 2026.
Yanjie Ze, Gu Zhang, Kangning Zhang, Chenyuan Hu, Muhan Wang, and Huazhe Xu. 3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations. In Proc. of Robotics: Science and Systems, 2024.
Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, and Lucas Beyer. Sigmoid loss for language image pre-training. In Proc. of IEEE Intl. Conf. on Computer Vision, pp. 11975–11986, 2023.
15
第 16 页
Jianke Zhang, Yanjiang Guo, Yucheng Hu, Xiaoyu Chen, Xiang Zhu, and Jianyu Chen. Up-vla: A unified understanding and prediction model for embodied agent. In *Proc. of Intl. Conf. on Machine Learning*, 2025a.
Qinglun Zhang, Zhen Liu, Haoqiang Fan, Guanghui Liu, Bing Zeng, and Shuaicheng Liu. Flowpolicy: Enabling fast and robust 3d flow-based policy via consistency flow matching for robot manipulation. In *Proc. of the AAAI Conf. on Artificial Intelligence*, volume 39, pp. 14754–14762, 2025b.
Rongyu Zhang, Menghang Dong, Yuan Zhang, Liang Heng, Xiaowei Chi, Gaole Dai, Li Du, Dan Wang, Yuan Du, and Shanghang Zhang. Mole-vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation. In *Proc. of the AAAI Conf. on Artificial Intelligence*, volume 40, pp. 18764–18772, 2026.
Wenyao Zhang, Hongsi Liu, Zekun Qi, Yunnan Wang, Xinqiang Yu, Jiazhao Zhang, Runpei Dong, Jiawei He, He Wang, Zhizheng Zhang, et al. Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge. In *Proc. of Advances in Neural Information Processing Systems*, volume 38, pp. 24195–24228, 2025c.
Tony Z Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn. Learning fine-grained bimanual manipulation with low-cost hardware. In *Proc. of Robotics: Science and Systems*, 2023.
Xin Zhou, Dingkang Liang, Sifan Tu, Xiwu Chen, Yikang Ding, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, and Xiang Bai. Hermes: A unified self-driving world model for simultaneous 3d scene understanding and generation. In *Proc. of IEEE Intl. Conf. on Computer Vision*, pp. 27817–27827, 2025.
Brianna Zitkovich, Tianhe Yu, Sichun Xu, Peng Xu, Ted Xiao, Fei Xia, Jialin Wu, Paul Wohlhart, Stefan Welker, Ayzaan Wahid, et al. Rt-2: Vision-language-action models transfer web knowledge to robotic control. In *Proc. of the Conference on Robot Learning*, pp. 2165–2183. PMLR, 2023.
16