CofactVLA:用反事实干预,让机器人不再“只看不听”

快速导读:提出CofactVLA框架,通过构建语言掩码反事实分支,在特征层和动作层进行双重因果干预,以解决VLA模型中的“视觉覆盖”现象。

CofactVLA针对视觉-语言-动作(VLA)模型中普遍存在的“视觉覆盖”现象,提出了一种基于反事实干预的解耦框架。该现象表现为模型在接收到语言指令后,仍过度依赖视觉场景中的显著物体(如目标物、干扰物)来生成动作,而忽略指令本身的语义意图,导致在分布外场景下严重失效。

CofactVLA的核心思路是将动作生成形式化为一个双路径解耦图(Dual-path Deconfounding Graph, DDG),在标准的事实路径之外,构建一条语言掩码的反事实路径。通过单次前向传播,框架在特征层和动作层分别执行反事实协方差缩减(CCR)和正交投影引导(OPG),从几何与统计两个维度剥离视觉混淆因子的影响,使模型的动作决策真正由语言意图驱动。

英文题目:CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention

论文出处:arXiv 每日论文精选 · arXiv:2608.04396

原始论文:PDF / 论文页面

这篇论文解决什么问题?

VLA模型通常由视觉编码器、语言编码器和动作解码器组成,视觉模态因其高维、密集的信息特性,在训练中天然占据主导地位。当场景中存在与任务无关但视觉显著的物体时,模型容易形成一条从视觉输入到动作的虚假后门路径,即“视觉覆盖”现象。

现有解决方案主要分为两类:数据增强和推理时干预。数据增强方法如CAST和Counterfactual VLA,通过修改训练样本的视觉或语言模态来打破虚假关联,但面临组合爆炸问题,难以覆盖所有可能的混淆场景。推理时干预如Classifier-Free Guidance,通过在动作层对视觉条件进行标量外推来抑制视觉先验,但在连续动作空间中容易放大噪声,导致生成的轨迹偏离有效动作流形。

CofactVLA的出发点是:视觉覆盖本质上是一个因果混淆问题。视觉场景中存在一个混淆因子C,它同时影响视觉输入和动作输出,使得语言意图T对动作A的真实因果效应被掩盖。因此,解决该问题的关键在于从模型内部表征中显式地去除C的影响,而非依赖外部数据增强或粗糙的标量调节。

核心创新

  • 提出统一的VLA解耦框架CofactVLA,将视觉覆盖现象形式化为因果混淆问题,并构建双路径解耦图(DDG)。
  • 提出动作级正交投影引导(OPG),一种用于连续流匹配的几何解耦策略,通过正交投影提取纯净语义意图。
  • 提出特征级反事实协方差缩减(CCR),通过惩罚反事实与事实特征协方差差异的正特征空间,显式缓解视觉混淆因子干扰。

方法概览

提出CofactVLA框架,将动作生成形式化为双路径解耦图(DDG)。通过单次前向传播构建语言掩码的反事实分支,并执行两个协同干预:1) 动作级正交投影引导(OPG),在流匹配中几何投影去除视觉偏差;2) 特征级反事实协方差缩减(CCR),通过惩罚协方差差异的正特征空间来抑制视觉混淆因子。

  • 双路径解耦图(DDG):CofactVLA将VLA的决策过程建模为两条路径。事实路径同时接收视觉和语言输入,生成事实动作流;反事实路径仅接收视觉输入(语言被掩码),生成反事实动作流。两条路径共享视觉编码器和动作专家,但在语言条件上形成对照。
  • 动作级正交投影引导(OPG):在流匹配框架中,事实流Vf包含了语言意图和视觉偏差的混合信息,而反事实流Vcf主要编码视觉先验。OPG将Vf正交投影到Vcf的方向上,几何地剥离视觉偏差分量,提取出纯净的语义意图方向。这一操作等价于在动作空间执行do-演算,切断混淆因子到动作的虚假路径。
  • 特征级反事实协方差缩减(CCR):在特征层面,CofactVLA计算事实特征与反事实特征的协方差矩阵差异,并提取该差异矩阵的正特征空间作为视觉混淆因子的主方向Ubias。随后,通过惩罚事实特征在Ubias上的投影,显式地抑制视觉混淆信息在特征表示中的编码。
  • 单次前向传播实现:与需要多次推理的Classifier-Free Guidance不同,CofactVLA通过在一次前向传播中同时构建事实和反事实分支,实现了高效的双重干预。反事实分支仅需对语言token进行掩码操作,不引入额外的模型参数或推理开销。
  • 与基座模型的兼容性:CofactVLA以π0和π0.5等基于流匹配的VLA模型为基座,OPG和CCR作为即插即用的干预模块,可直接嵌入现有的流匹配训练和推理流程,无需修改基座模型的架构或训练目标。

逐图理解论文

研究空白与核心思路

研究空白与核心思路
Figure 1: (a) Motivation: Visual modality inadvertently induces a spurious backdoor path (I 99K C →A). The visual confounder C acts as a shortcut that dictates the action A, overriding the true semantic intent T. (b) Our proposed Dual-path Deconfounding Graph: The red do-operator signifies Feature-Level Counterfactual Covariance Reduction (CCR), which explicitly suppresses the spurious visual confounder C. The blue do-operator signifies Action-Level Orthogonal Projection Guidance (OPG), which geometrically extracts and enhances the pure language intent T.

图1展示了视觉覆盖现象的因果结构(左)和CofactVLA的双路径解耦图(右)。左图中,视觉混淆因子C通过虚假后门路径影响动作A,覆盖了语言意图T的真实因果效应。右图中,红色do-算子表示特征级CCR干预,抑制混淆因子C;蓝色do-算子表示动作级OPG干预,提取纯净语言意图T。

方法贡献:双重因果干预

方法贡献:双重因果干预
Figure 2: The overall architecture of CofactVLA. (Left) Driven by the proposed Dual-path Deconfounding Graph (DDG), we propose an intervention framework to address the vision-override phenomenon. (Right) The framework consists of two core components dynamically built upon factual and counterfactual flows. To execute Language Intervention, Orthogonal Projection Guidance (OPG) geometrically extracts the pure semantic intent by projecting the factual flow Vf onto the counterfactual visual prior Vcf. To execute Vision Intervention, Contrastive Covariance Reduction (CCR) extracts the dominant visual confounder bias Ubias via the covariance difference of latent features to cleanse the features before feeding them to the action expert.

图2展示了CofactVLA的整体架构。左侧为双路径解耦图(DDG)的形式化表示,右侧为具体实现。事实流和反事实流共享视觉编码器和动作专家,OPG在动作层对两个流进行正交投影,CCR在特征层计算协方差差异并抑制混淆方向。

结论与意义

结论与意义
Figure 3: Performance comparison of real-world exper- iments and the evaluation of OOD scene.

这套方法的效果非常直接:在LIBERO模拟基准上,CofactVLA几乎做到了指令零失误。更关键的是泛化能力——在完全没见过的场景里,比如换了背景纹理、改变了物体摆放,CofactVLA的成功率比π0.5高出一大截。真实机器人实验也验证了这一点:标准场景下稳定可靠,OOD场景下依然能准确执行指令。这说明,通过因果干预让模型真正“听懂话”,比堆数据、调参数更治本。

实验如何设计?

  • 模拟基准:在LIBERO基准的四个任务子集(Living、Kitchen、Study、Object)上评估标准操作成功率,并与OpenVLA、RT-1、π0、π0.5等方法对比。
  • 零样本泛化:在LIBERO-Plus基准的四个泛化维度(Spatial、Object、Goal、Long)上评估分布外泛化能力,所有方法均未在目标场景上训练。
  • 真实世界验证:在真实机器人平台上部署CofactVLA和π0.5,测试四个操作任务在标准场景和分布外场景(如更换背景纹理、改变光照)下的成功率。
  • 消融研究:分别移除OPG和CCR模块,验证各组件的独立贡献;同时对比不同的反事实设计(如仅使用特征干预或仅使用动作干预)。
  • 敏感性分析:对动作级因果尺度γ和特征级干预强度β进行参数扫描,分析干预强度对性能的影响趋势。

关键结果与论文证据

  • LIBERO基准:CofactVLA平均成功率达98.5%,在Object子集上达到100.0%,全面超越π0.5等基线方法(第6页,Table 1)。
  • LIBERO-Plus零样本泛化:CofactVLA总成功率达69.1%,相比π0.5的53.6%有显著提升,尤其在Object和Goal维度上优势明显(第6页,Table 2)。
  • 真实世界标准场景:CofactVLA平均成功率达90.8%,优于π0.5的71.0%,验证了方法在物理环境中的有效性(第7页,Figure 3)。
  • 真实世界OOD场景:CofactVLA平均成功率达75.8%,相比π0.5的23.5%有+52.3%的绝对提升,证明反事实干预对视觉混淆的鲁棒性(第7页,Figure 3)。
  • 消融实验:完整CofactVLA(CCR+OPG)达到98.5%平均成功率,单独使用CCR为97.5%,单独使用OPG为98.0%,验证了双重干预的协同效应(第7页,Table 3)。
  • 敏感性分析:动作级因果尺度γ在1.0-2.0范围内性能稳定,γ=3时性能轻微下降;特征级强度β在0.05-0.1范围内最优,β=0.2时出现退化(第8页,Figure 4)。
  • 定性可视化:在视觉覆盖场景中,CofactVLA能够准确抓取指令指定的目标物体,而π0.5常被视觉显著的干扰物误导;在OOD场景中,CofactVLA保持了稳定的轨迹规划(第8-9页,Figure 5、Figure 6)。

阅读时需要注意

  • 语义基础依赖:CofactVLA的因果干预无法合成基座VLM未学习的概念,当指令涉及模型知识范围外的物体或属性时,干预效果受限。
  • 物理遮挡脆弱性:在严重物理遮挡(如机械臂遮挡相机视野)的情况下,视觉输入的退化仍会导致性能下降,这是当前VLA范式的共性挑战。
  • 干预强度敏感:OPG的因果尺度γ和CCR的强度β需要针对具体任务进行调参,过大或过小的干预强度均可能导致性能损失。

关联工作

  • RT-1和RT-2是将视觉-语言模型适配为VLA模型的先驱工作,将连续控制形式化为序列建模任务,但未专门处理模态间的混淆问题。
  • π0和π0.5是基于流匹配的VLA模型,将动作生成建模为从噪声到目标动作分布的连续变换过程,是CofactVLA的基座模型和主要对比基线。
  • OpenVLA是开源VLA模型,在LIBERO-Plus基准上作为对比方法之一,其性能显著低于CofactVLA,反映了模态解耦的重要性。
  • Classifier-Free Guidance是一种在推理时通过标量外推抑制视觉先验的策略,CofactVLA的OPG方法旨在解决其在高维空间引入噪声的问题。
  • CAST和Counterfactual VLA利用反事实数据增强来减少视觉捷径,CofactVLA则从模型内部表征进行解耦,避免了数据增强的组合爆炸问题。

发表评论