Masked Visual Actions:像素级动作接口实现跨本体通用世界建模

方法:掩码视觉动作接口

视频模型蕴含丰富的物理先验,但低维动作信号(如关节角度)具有本体特异性,难以被预训练视频模型有效利用。本文提出“掩码视觉动作”(Masked Visual Actions),将动作表示为像素空间中实体的部分可见轨迹。通过LoRA微调Wan-Fun-Control 2.2 14B模型,在DROID和Robocasa数据集上训练。该方法实现了跨本体泛化,统一了前向模型(预测场景响应)和逆模型(合成机器人行为)。实验显示在DROID上LPIPS为0.0945,策略评估相关性r=0.982。需注意模型学习的是相关性而非因果关系,且存在对任务进展的正向偏差。