ShadowDancer:用“影子”教会世界模型任意动作——从数据构造解决动态与外观纠缠
交互式视频世界模型面临一个根本困境:如何精确控制任意动作?符号指令太模糊,结构化运动输入不通用,而现有的潜在动作模型(LAM)通过自重建学习控制信号,却将动态与外观纠缠在一起,导致动作迁移失败。ShadowDancer提出影子学习范式,通过构建“影子对”——重放同一动态但独立重采样外观的两个帧同步视频——并训练LAM进行跨影子预测,迫使潜在表征仅保留共享的动态信息。实验表明,该方法在人类运动、第一人称战斗、机器人操作等五个动态族上均实现了精确的动作迁移,长序列rollout的盲测胜率超过94%。但该方法依赖游戏引擎或模拟器构建影子对,真实视频只能作为自配对参与训练,无法提供解耦的监督信号。