VLA
跨具身迁移的隐式钥匙:行为对齐表征如何让机器人共享技能
不同机器人的观测和动作空间差异巨大,如何让一个模型从多种机器人数据中学习并迁移到新机器人?本文提出行为对齐表征——一种跨具身不变且能预测动作的中间表示。通过在VLA模型中联合预测末端执行器轨迹、语言动作和边界框,隐式对齐异构数据。实验表明,末端执行器轨迹是最有效的单一表征,联合表征在模拟和真实机器人迁移中均显著提升性能,且表征的增益随跨具身数据规模扩大而增强。但需注意,模拟环境中的高度对齐可能高估了迁移效果,表征选择也依赖于具体任务和具身差异。
TurboVLA:扔掉大语言模型,机器人操控为何能跑32Hz?
当前主流 VLA 模型将大语言模型置于核心,视觉信息先转成文本 token 再预测动作,这条 V→L→A 间接通路带来了巨大的计算和内存开销。TurboVLA 提出直接 V+L→A 范式,用轻量双向交叉注意力融合视觉与语言特征,完全绕过 LLM。在 LIBERO 基准上以 0.2B 参数达到 97.7% 成功率,推理延迟仅 31.2 ms,显存占用不到 1 GB。真实世界实验中四项任务均优于 π0.5。但该方法专为执行级指令设计,缺乏高层任务规划所需的复杂语义推理能力。
HiFi-UMI:仅凭高保真数据实现零真机后训练
机器人操控策略学习长期受限于高保真数据的稀缺性。HiFi-UMI提出一种软硬件协同的高保真数据采集系统,通过头戴式SLAM、微秒级GPIO同步和超广角视觉,解决了传统UMI系统的漂移与同步问题。论文证明,仅使用此类数据进行后训练,即可在真实机器人上实现与遥操作相当的成功率,无需任何真实机器人数据作为锚点。实验涵盖多种VLA和WAM模型,展示了其在接触丰富任务中的有效性。需注意,该结论基于特定硬件配置,且未完全剥离数据量与保真度的影响。
机器人VLA为何“偷懒”?因子偏差诊断与偏差感知数据收集策略解析
预训练机器人策略常因过度依赖颜色等主导因子而忽略动词或尺寸,导致组合泛化失败。本文提出FDR/FDH指标量化这种“因子偏差”,并据此设计偏差感知数据收集策略。实验表明,该策略在ManiSkill仿真与UR5真机实验中,以半数演示显著提升了成功率。需注意,评估依赖VLM裁判且限于桌面操作场景。
HyWorldVLA:混合世界模型如何提升自动驾驶鲁棒性
本文介绍HyWorldVLA,一种用于自动驾驶的视觉-语言-动作模型。针对纯像素级模型对噪声敏感、纯潜在级模型缺乏解释性的问题,HyWorldVLA采用混合世界建模,结合视频VAE压缩与联合注意力机制。实验显示其在NAVSIM v1/v2基准上达到SOTA,PDMS达90.59,且在雨雾噪声下表现优异。需注意单目摄像头在转弯场景的视野限制及损失权重平衡。
FoMoVLA:通过联合视觉前瞻与运动引导增强VLA模型
本文提出FoMoVLA框架,解决现有VLA模型缺乏显式世界动态预测的问题。通过联合优化未来特征前瞻和稀疏2D点追踪,并利用FCCA模块耦合两者,模型在LIBERO基准上达到98.8%平均成功率,在RoboCasa上优于基线9.1%。推理时无额外开销。需注意模型对固定视角训练数据的依赖及FCCA初始化的稳定性。