LAWM-3D:从人类视频中学习3D感知的潜在动作,构建可泛化的机器人世界模型

几何对齐与多视角训练

提出LAWM-3D框架,通过多视角联合训练、非单射RGB-D重建和几何特征对齐,从无标签人类视频中学习视角不变的3D感知潜在动作,显著提升世界模型的生成质量、物理一致性和泛化能力。