Faster-WAM:高效保留推理时未来表征,让世界动作模型在分布偏移下依然鲁棒

快速导读:提出Faster-WAM,通过一次视频前向和稀疏交互保留推理时未来表征,在分布外场景下显著提升鲁棒性并降低延迟。

世界动作模型(World Action Models, WAMs)通过预测未来视觉动态来增强机器人操作策略,已成为具身智能领域的重要方向。然而,现有WAM在推理效率与分布外(out-of-distribution, OOD)鲁棒性之间存在根本性矛盾:联合去噪视频与动作的Joint-WAM虽然保留了推理时未来表征,但计算开销巨大;而Fast-WAM通过移除推理时未来条件化获得效率提升,却在分布偏移下出现显著的性能退化。

Faster-WAM直面这一矛盾,提出了一套精巧的推理时未来条件化保留机制。其核心洞察在于:未来条件化对OOD泛化至关重要,但不必以密集的逐层交互为代价。通过一次视频前向生成可复用KV缓存、在选定阶段进行稀疏视频-动作交互、以及聚合多深度未来表征,Faster-WAM在LIBERO、RoboTwin 2.0、LIBERO-Plus及真实世界双臂操作任务上均展现出接近甚至超越Joint-WAM的鲁棒性,同时将推理延迟降低至252.95 ms,相比Joint-WAM加速2.21倍。

英文题目:Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

论文出处:arXiv 每日论文精选 · arXiv:2608.04404

原始论文:PDF / 论文页面

这篇论文解决什么问题?

WAM的核心工作流程是在推理时先预测未来视频帧,再基于预测的未来视觉信息生成动作。Joint-WAM(如Li et al. 2026b; Bi et al. 2025)采用联合去噪的方式,在每一步去噪迭代中同时处理视频和动作token,两者通过交叉注意力密集交互。这种设计天然保留了推理时未来条件化,使动作生成始终能参考丰富的未来视觉上下文。然而,其代价是高昂的:视频分支需要在每一步去噪中重新前向传播,且视频与动作分支的密集交互导致计算量随去噪步数线性增长。

Fast-WAM(Yuan et al. 2026)提出了一个看似巧妙的简化:仅在训练时使用未来视频作为条件信号,推理时则完全丢弃未来分支,仅基于当前观测生成动作。这带来了显著的效率提升,因为推理时无需运行视频分支。但本文作者通过受控实验揭示了一个关键发现:当测试环境出现分布偏移时——例如光照变化、新背景或未见过的干扰物——Fast-WAM的成功率急剧下降。在LIBERO-Plus基准上,Fast-WAM的平均成功率仅为49.14%,而Joint-WAM达到66.27%。这一对比直接证明了推理时未来条件化对OOD鲁棒性的关键作用。

同期工作Efficient-WAM(Li et al. 2026a)尝试通过蒸馏视频专家、使用低分辨率未来token和非对称去噪来保留未来隐变量,但其设计重心在于压缩未来表征本身。Faster-WAM则从另一个角度切入:聚焦于未来表征与动作生成之间的交互方式设计,探索如何以最低的计算代价将未来信息注入动作分支。

这一问题的现实意义在于:真实世界的机器人部署不可避免地面临各种分布偏移——从室内光照变化到操作台背景替换,从物体外观差异到全新类别的干扰物。一个既高效又鲁棒的WAM推理范式,是推动机器人操作从实验室走向开放环境的关键技术环节。

核心创新

  • 揭示推理时未来条件化对WAM分布外泛化的关键作用,确立保留未来表征的设计原则。
  • 提出SparseMoT,将密集的逐层视频-动作交互替换为选定阶段的稀疏交互,大幅降低计算。
  • 提出Interval KV-Fusion,在不增加注意力序列长度的情况下聚合多深度未来KV表征,为动作分支提供丰富时序信息。

方法概览

Faster-WAM采用一次视频前向生成可复用的KV缓存,通过SparseMoT在选定阶段进行稀疏视频-动作交互,并利用Interval KV-Fusion聚合多深度未来表征,其余阶段仅进行动作自更新。

  • 一次视频前向与KV缓存复用:Faster-WAM在推理开始时仅执行一次完整的视频分支前向传播,生成对未来视频帧的预测,并将各层的Key-Value(KV)缓存保存下来。后续的动作去噪迭代中,视频分支不再重复计算,而是直接复用这些缓存的KV表征。这从根本上避免了Joint-WAM中视频分支随去噪步数重复计算的问题。
  • SparseMoT——选择性视频-动作交互:Faster-WAM采用Mixture-of-Transformers(MoT)架构,将Transformer层分为视频-动作交互层和动作自更新层两类。SparseMoT的核心设计是仅在选定的少数阶段(而非每一层)进行视频-动作交叉注意力交互,其余阶段仅执行动作token的自注意力更新。这种稀疏交互策略大幅减少了交叉注意力的计算次数,同时保留了关键的未来信息注入点。
  • Interval KV-Fusion——多深度未来表征聚合:在SparseMoT的每个交互阶段,动作分支需要访问视频分支的KV缓存。Faster-WAM提出Interval KV-Fusion机制,将来自多个视频层深度的KV表征进行聚合,而非仅使用单一层的表征。具体而言,它将相邻若干层的KV缓存通过融合操作整合,使动作分支在一次交互中就能获得多粒度的未来视觉信息。重要的是,这种融合在KV缓存层面进行,不增加注意力操作的序列长度,因此几乎不引入额外计算开销。
  • 动作自更新层的主导地位:在SparseMoT的层分配中,绝大多数层被设计为动作自更新层。这些层仅包含动作token的自注意力与前馈网络,完全不涉及视频分支的计算。这种设计使得Faster-WAM的大部分推理计算集中在轻量的动作分支上,仅在稀疏的交互点才引入视频上下文的访问。
  • 与Joint-WAM的推理流程对比:Joint-WAM在每一步去噪中都需要运行完整的视频分支并与动作分支进行逐层密集交互,形成迭代式的密集耦合。Faster-WAM则将流程重构为“一次视频前向→缓存→稀疏交互动作去噪”的三阶段范式,将视频计算与动作去噪解耦,仅在必要时通过缓存的KV进行轻量交互。
  • 训练时的未来条件化保持:值得注意的是,Faster-WAM在训练阶段仍然使用完整的未来视频作为条件信号,这与Joint-WAM一致。其效率增益完全来自推理时的架构优化,而非训练信号的削弱。这确保了模型在训练过程中充分学习未来条件化的重要性,而推理时的稀疏交互和缓存复用则负责降低部署成本。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: Inference-time future conditioning is critical for ro- bust WAMs. Compared with Joint-WAM (a controlled imple- mentation representing Joint-WAMs), Fast-WAM improves efficiency by removing future conditioning at inference, yet suffers a marked performance drop under distribution shift. Motivated by this finding, Faster-WAM efficiently preserves inference-time future conditioning, achieving strong OOD robustness at lower latency.

图1直观展示了核心矛盾:Joint-WAM保留未来条件化但计算密集,Fast-WAM移除未来条件化后效率提升却在分布偏移下性能骤降。Faster-WAM的定位是在两者之间找到最优平衡点——高效保留推理时未来条件化。观察此图时应关注三条曲线在OOD场景下的分离程度,这直接支撑了论文的核心论点。

方法贡献与验证逻辑

方法贡献与验证逻辑
Figure 2: Overview of Faster-WAM. (a) Overall framework of Faster-WAM, featuring SparseMoT for selective video–action interaction and Interval KV-Fusion for aggregating multi-level future representations. (b) Inference comparison between Joint- WAM and Faster-WAM, contrasting iterative dense coupling with one-pass future-context caching and sparse interaction.

图2展示了Faster-WAM的完整架构。图(a)呈现SparseMoT的层结构设计,注意视频-动作交互层(彩色)与动作自更新层(灰色)的稀疏分布模式,以及Interval KV-Fusion如何聚合多层KV缓存。图(b)对比了Joint-WAM的迭代密集耦合与Faster-WAM的一次缓存稀疏交互范式,这是理解效率提升来源的关键。

最强结论

最强结论
Table 3: Success rates (%) on LIBERO-Plus across seven distribution shifts. P.T. denotes embodied pretraining. The best and second-best average results are shown in bold and underlined, respectively.

表3的LIBERO-Plus结果是论文最有力的证据。七种分布偏移类型覆盖了背景替换、光照变化、物体外观差异等真实部署中常见的OOD场景。Faster-WAM在几乎所有偏移类型上均优于Joint-WAM和Fast-WAM,平均成功率领先幅度超过7个百分点,直接证明了稀疏交互设计不仅未损害、反而增强了OOD鲁棒性。

实验如何设计?

  • 基准测试涵盖三个仿真基准和一个真实世界平台:LIBERO(标准操作任务)、RoboTwin 2.0(双臂操作)、LIBERO-Plus(专门设计的OOD鲁棒性基准,包含七种分布偏移类型),以及真实世界双臂操作任务(包括标准任务和OOD场景)。
  • 对比基线包括Joint-WAM和Fast-WAM的受控实现。为确保公平比较,三者共享相同的视频主干网络、训练数据和优化设置,仅推理时的未来条件化方式和交互机制不同。这隔离了推理时未来条件化与交互方式的影响。
  • LIBERO-Plus评估直接使用LIBERO训练的策略,未进行任何额外微调,以严格测试模型在训练分布之外的泛化能力。
  • 真实世界实验包含四个标准操作任务(摘草莓、搭塔、存盒子、叠盘子)以及针对“摘草莓”任务设计的四种OOD条件:标准背景、新背景、改变光照、未见过的干扰物。
  • 推理延迟测量在相同硬件上进行,取10次运行的平均值(预热5次后),并分解为视觉延迟和动作延迟两个组成部分,以精细分析各模块的计算开销。
  • 消融实验系统性地验证了三个关键设计选择:未来条件化的有无(对比current-only变体)、Interval KV-Fusion的贡献、以及SparseMoT的交互稀疏度对性能的影响。

关键结果与论文证据

  • LIBERO基准上,Faster-WAM取得平均成功率99.0%(Table 1, page 5),与Joint-WAM持平,显著优于Fast-WAM,证明稀疏交互设计在标准分布下不损失性能。
  • RoboTwin 2.0基准上,Faster-WAM平均成功率达92.6%,其中Clean子集92.8%,Randomized子集92.3%(Table 2, page 5),在双臂操作场景下同样保持领先。
  • LIBERO-Plus OOD基准上,Faster-WAM平均成功率73.57%,大幅领先Fast-WAM的49.14%和Joint-WAM的66.27%(Table 3, page 5),在七种分布偏移类型上均表现最优或次优,充分验证了推理时未来条件化对OOD鲁棒性的关键作用。
  • 真实世界标准任务上,Faster-WAM平均成功率95.8%,超过Joint-WAM的90.8%和Fast-WAM的88.3%(Figure 3, page 6),在四个任务中的三个取得最高成功率。
  • 真实世界OOD场景下,Faster-WAM平均成功率71.1%,显著优于Joint-WAM的55.6%和Fast-WAM的45.6%(Figure 4, page 6),在光照变化和干扰物条件下优势尤为明显。
  • 推理延迟方面,Faster-WAM总延迟252.95 ms,相比Joint-WAM的559.84 ms加速2.21倍,甚至低于Fast-WAM的320.97 ms(Table 4, page 6)。延迟分解显示,Faster-WAM的视觉延迟仅需一次前向的约50 ms,动作延迟约200 ms,而Joint-WAM的视觉与动作延迟无法分离且总和高达560 ms。
  • 消融实验(Table 5, page 7)表明:移除未来条件化(current-only变体)导致LIBERO-Plus成功率大幅下降,证实未来表征的必要性;移除Interval KV-Fusion同样造成性能损失,验证多深度聚合的价值;增加SparseMoT的交互稀疏度(减少交互阶段数)对性能影响相对温和,表明稀疏交互具有较大的设计空间。

阅读时需要注意

  • 视频-动作交互阶段的选择目前基于固定步长的启发式策略,未采用学习或自适应机制来确定最优交互位置。不同任务或不同分布偏移类型可能需要不同的交互稀疏度配置。
  • 系统级加速手段尚未探索,包括图编译优化、定制CUDA kernel、以及针对KV缓存访问模式的专用算子设计。这些工程优化有望进一步降低延迟。
  • 当前评估集中在操作类任务,Faster-WAM在导航、移动操作等需要更长时序依赖的场景下的表现有待验证。
  • Interval KV-Fusion的融合操作目前采用相对简单的聚合方式,更复杂的注意力机制或动态融合策略可能进一步提升未来信息的利用效率。

关联工作

  • Joint-WAMs(Li et al. 2026b; Bi et al. 2025)确立了联合去噪视频与动作的范式,是保留推理时未来条件化的代表性方案,但其计算密集的特性限制了实际部署。
  • Fast-WAM(Yuan et al. 2026)首次提出训练-推理解耦的未来条件化策略,揭示了效率与鲁棒性之间的权衡,为Faster-WAM的研究动机提供了直接的经验基础。
  • Light-WAM(Li et al. 2026c)延续Fast-WAM的仅在训练时使用未来建模的思路,通过紧凑视频主干和直接动作解码进一步降低部署成本,但同样面临OOD鲁棒性不足的问题。
  • Efficient-WAM(Li et al. 2026a)作为同期工作,通过蒸馏、低分辨率token和非对称去噪保留未来隐变量,与Faster-WAM形成互补:前者压缩未来表征,后者优化交互方式。

发表评论