快速导读:提出CofactVLA框架,通过构建语言掩码反事实分支,在特征层和动作层进行双重因果干预,以解决VLA模型中的“视觉覆盖”现象。
CofactVLA针对视觉-语言-动作(VLA)模型中普遍存在的“视觉覆盖”现象,提出了一种基于反事实干预的解耦框架。该现象表现为模型在接收到语言指令后,仍过度依赖视觉场景中的显著物体(如目标物、干扰物)来生成动作,而忽略指令本身的语义意图,导致在分布外场景下严重失效。
CofactVLA的核心思路是将动作生成形式化为一个双路径解耦图(Dual-path Deconfounding Graph, DDG),在标准的事实路径之外,构建一条语言掩码的反事实路径。通过单次前向传播,框架在特征层和动作层分别执行反事实协方差缩减(CCR)和正交投影引导(OPG),从几何与统计两个维度剥离视觉混淆因子的影响,使模型的动作决策真正由语言意图驱动。
英文题目:CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention
论文出处:arXiv 每日论文精选 · arXiv:2608.04396
原始论文:PDF / 论文页面
这篇论文解决什么问题?
VLA模型通常由视觉编码器、语言编码器和动作解码器组成,视觉模态因其高维、密集的信息特性,在训练中天然占据主导地位。当场景中存在与任务无关但视觉显著的物体时,模型容易形成一条从视觉输入到动作的虚假后门路径,即“视觉覆盖”现象。
现有解决方案主要分为两类:数据增强和推理时干预。数据增强方法如CAST和Counterfactual VLA,通过修改训练样本的视觉或语言模态来打破虚假关联,但面临组合爆炸问题,难以覆盖所有可能的混淆场景。推理时干预如Classifier-Free Guidance,通过在动作层对视觉条件进行标量外推来抑制视觉先验,但在连续动作空间中容易放大噪声,导致生成的轨迹偏离有效动作流形。
CofactVLA的出发点是:视觉覆盖本质上是一个因果混淆问题。视觉场景中存在一个混淆因子C,它同时影响视觉输入和动作输出,使得语言意图T对动作A的真实因果效应被掩盖。因此,解决该问题的关键在于从模型内部表征中显式地去除C的影响,而非依赖外部数据增强或粗糙的标量调节。
核心创新
- 提出统一的VLA解耦框架CofactVLA,将视觉覆盖现象形式化为因果混淆问题,并构建双路径解耦图(DDG)。
- 提出动作级正交投影引导(OPG),一种用于连续流匹配的几何解耦策略,通过正交投影提取纯净语义意图。
- 提出特征级反事实协方差缩减(CCR),通过惩罚反事实与事实特征协方差差异的正特征空间,显式缓解视觉混淆因子干扰。
方法概览
提出CofactVLA框架,将动作生成形式化为双路径解耦图(DDG)。通过单次前向传播构建语言掩码的反事实分支,并执行两个协同干预:1) 动作级正交投影引导(OPG),在流匹配中几何投影去除视觉偏差;2) 特征级反事实协方差缩减(CCR),通过惩罚协方差差异的正特征空间来抑制视觉混淆因子。
- 双路径解耦图(DDG):CofactVLA将VLA的决策过程建模为两条路径。事实路径同时接收视觉和语言输入,生成事实动作流;反事实路径仅接收视觉输入(语言被掩码),生成反事实动作流。两条路径共享视觉编码器和动作专家,但在语言条件上形成对照。
- 动作级正交投影引导(OPG):在流匹配框架中,事实流Vf包含了语言意图和视觉偏差的混合信息,而反事实流Vcf主要编码视觉先验。OPG将Vf正交投影到Vcf的方向上,几何地剥离视觉偏差分量,提取出纯净的语义意图方向。这一操作等价于在动作空间执行do-演算,切断混淆因子到动作的虚假路径。
- 特征级反事实协方差缩减(CCR):在特征层面,CofactVLA计算事实特征与反事实特征的协方差矩阵差异,并提取该差异矩阵的正特征空间作为视觉混淆因子的主方向Ubias。随后,通过惩罚事实特征在Ubias上的投影,显式地抑制视觉混淆信息在特征表示中的编码。
- 单次前向传播实现:与需要多次推理的Classifier-Free Guidance不同,CofactVLA通过在一次前向传播中同时构建事实和反事实分支,实现了高效的双重干预。反事实分支仅需对语言token进行掩码操作,不引入额外的模型参数或推理开销。
- 与基座模型的兼容性:CofactVLA以π0和π0.5等基于流匹配的VLA模型为基座,OPG和CCR作为即插即用的干预模块,可直接嵌入现有的流匹配训练和推理流程,无需修改基座模型的架构或训练目标。
逐图理解论文
研究空白与核心思路

图1展示了视觉覆盖现象的因果结构(左)和CofactVLA的双路径解耦图(右)。左图中,视觉混淆因子C通过虚假后门路径影响动作A,覆盖了语言意图T的真实因果效应。右图中,红色do-算子表示特征级CCR干预,抑制混淆因子C;蓝色do-算子表示动作级OPG干预,提取纯净语言意图T。
方法贡献:双重因果干预

图2展示了CofactVLA的整体架构。左侧为双路径解耦图(DDG)的形式化表示,右侧为具体实现。事实流和反事实流共享视觉编码器和动作专家,OPG在动作层对两个流进行正交投影,CCR在特征层计算协方差差异并抑制混淆方向。
结论与意义

这套方法的效果非常直接:在LIBERO模拟基准上,CofactVLA几乎做到了指令零失误。更关键的是泛化能力——在完全没见过的场景里,比如换了背景纹理、改变了物体摆放,CofactVLA的成功率比π0.5高出一大截。真实机器人实验也验证了这一点:标准场景下稳定可靠,OOD场景下依然能准确执行指令。这说明,通过因果干预让模型真正“听懂话”,比堆数据、调参数更治本。
实验如何设计?
- 模拟基准:在LIBERO基准的四个任务子集(Living、Kitchen、Study、Object)上评估标准操作成功率,并与OpenVLA、RT-1、π0、π0.5等方法对比。
- 零样本泛化:在LIBERO-Plus基准的四个泛化维度(Spatial、Object、Goal、Long)上评估分布外泛化能力,所有方法均未在目标场景上训练。
- 真实世界验证:在真实机器人平台上部署CofactVLA和π0.5,测试四个操作任务在标准场景和分布外场景(如更换背景纹理、改变光照)下的成功率。
- 消融研究:分别移除OPG和CCR模块,验证各组件的独立贡献;同时对比不同的反事实设计(如仅使用特征干预或仅使用动作干预)。
- 敏感性分析:对动作级因果尺度γ和特征级干预强度β进行参数扫描,分析干预强度对性能的影响趋势。
关键结果与论文证据
- LIBERO基准:CofactVLA平均成功率达98.5%,在Object子集上达到100.0%,全面超越π0.5等基线方法(第6页,Table 1)。
- LIBERO-Plus零样本泛化:CofactVLA总成功率达69.1%,相比π0.5的53.6%有显著提升,尤其在Object和Goal维度上优势明显(第6页,Table 2)。
- 真实世界标准场景:CofactVLA平均成功率达90.8%,优于π0.5的71.0%,验证了方法在物理环境中的有效性(第7页,Figure 3)。
- 真实世界OOD场景:CofactVLA平均成功率达75.8%,相比π0.5的23.5%有+52.3%的绝对提升,证明反事实干预对视觉混淆的鲁棒性(第7页,Figure 3)。
- 消融实验:完整CofactVLA(CCR+OPG)达到98.5%平均成功率,单独使用CCR为97.5%,单独使用OPG为98.0%,验证了双重干预的协同效应(第7页,Table 3)。
- 敏感性分析:动作级因果尺度γ在1.0-2.0范围内性能稳定,γ=3时性能轻微下降;特征级强度β在0.05-0.1范围内最优,β=0.2时出现退化(第8页,Figure 4)。
- 定性可视化:在视觉覆盖场景中,CofactVLA能够准确抓取指令指定的目标物体,而π0.5常被视觉显著的干扰物误导;在OOD场景中,CofactVLA保持了稳定的轨迹规划(第8-9页,Figure 5、Figure 6)。
阅读时需要注意
- 语义基础依赖:CofactVLA的因果干预无法合成基座VLM未学习的概念,当指令涉及模型知识范围外的物体或属性时,干预效果受限。
- 物理遮挡脆弱性:在严重物理遮挡(如机械臂遮挡相机视野)的情况下,视觉输入的退化仍会导致性能下降,这是当前VLA范式的共性挑战。
- 干预强度敏感:OPG的因果尺度γ和CCR的强度β需要针对具体任务进行调参,过大或过小的干预强度均可能导致性能损失。
关联工作
- RT-1和RT-2是将视觉-语言模型适配为VLA模型的先驱工作,将连续控制形式化为序列建模任务,但未专门处理模态间的混淆问题。
- π0和π0.5是基于流匹配的VLA模型,将动作生成建模为从噪声到目标动作分布的连续变换过程,是CofactVLA的基座模型和主要对比基线。
- OpenVLA是开源VLA模型,在LIBERO-Plus基准上作为对比方法之一,其性能显著低于CofactVLA,反映了模态解耦的重要性。
- Classifier-Free Guidance是一种在推理时通过标量外推抑制视觉先验的策略,CofactVLA的OPG方法旨在解决其在高维空间引入噪声的问题。
- CAST和Counterfactual VLA利用反事实数据增强来减少视觉捷径,CofactVLA则从模型内部表征进行解耦,避免了数据增强的组合爆炸问题。