M4World:分钟级多视角多模态驾驶世界模型与细粒度物体操控
本文介绍M4World,一种基于DiT的多视角多模态驾驶世界模型。针对现有模型在物体级细粒度可控性和长时程生成稳定性上的不足,M4World通过融合3D几何、语义、图像描述和文本属性的控制接口,实现了空间布局与视觉外观的双重控制。训练采用五阶段配方,包括双向中期训练、教师强制因果适应、四步学生ODE初始化、自强制非对称DMD及迭代长视频微调,支持4步自回归流式生成。实验显示,在10秒视频上FID为34.8,FVD为288.7,优于MagicDriveV2。在60秒长视频生成中,通过潜在上下文刷新保持稳定性。针对“运载树木的卡车”长尾场景,通过LoRA少样本适配,使BEV检测Recall从1.0