Masked Visual Actions:像素级动作接口实现跨本体通用世界建模

方法:掩码视觉动作接口

视频模型蕴含丰富的物理先验,但低维动作信号(如关节角度)具有本体特异性,难以被预训练视频模型有效利用。本文提出“掩码视觉动作”(Masked Visual Actions),将动作表示为像素空间中实体的部分可见轨迹。通过LoRA微调Wan-Fun-Control 2.2 14B模型,在DROID和Robocasa数据集上训练。该方法实现了跨本体泛化,统一了前向模型(预测场景响应)和逆模型(合成机器人行为)。实验显示在DROID上LPIPS为0.0945,策略评估相关性r=0.982。需注意模型学习的是相关性而非因果关系,且存在对任务进展的正向偏差。

NeuralActuator:低成本伺服平台无传感器力感知与动力学建模

数据集:NAD与数据验证

针对低成本伺服平台(如无刷直流电机)存在的摩擦、滞后及背隙等非线性效应,传统线性电流-扭矩近似(τ=KtI)失效,导致Sim-to-Real误差大且缺乏力感知能力。本文提出NeuralActuator,基于Transformer架构处理历史状态与遥测数据,结合可微分仿真(Differentiable Simulation)进行训练。创新点在于利用仿真姿态轨迹作为代理监督信号(Torque Surrogate),无需直接扭矩标签即可训练。模型同时输出等效广义力代理、外部力估计、接触概率及电机状态。在NAD数据集上训练,并在OpenManipulator-X、SO-101及Franka Panda