ContactFlow:用接触点轨迹打通人类演示与机器人操作之间的具身鸿沟
视频世界模型通过想象动作后果来规划机器人行为,但现有方法用关节状态或演员掩码作为条件化信号,这些信号与特定具身深度绑定,难以从人类演示迁移到机器人。ContactFlow 提出一种具身无关的动作表示——将手或夹爪与物体间的 3D 接触点轨迹投影到图像空间,形成稀疏的 7 通道控制视频。基于 Wan 视频扩散模型训练后,该方法在 DROID 数据集上取得最优视频预测质量,并在 7 个未见数据集上展现出强泛化能力。真实世界实验中,世界模型在 10 个桌面抓取放置场景中正确预测了 8 个场景的执行结果。但该方法依赖标定良好的外中心相机和可靠深度估计,推理速度也远未达到实时。