MotionForesight:复用视频模型进行未来3D场景流预测
本视频解析MotionForesight论文。该方法基于TrackCraft3R架构,通过冻结视频DiT和跟踪解码器,仅训练轻量级LoRA适配器和输出头,将回顾性3D跟踪模型转化为前瞻性预测模型。实验显示,在SSv2未见视频上ADE为4.47cm,在OOD手机视频上ADE为9.31cm,优于依赖语言指令的MolmoMotion。该方法无需语言或动作标签,仅凭视觉上下文即可泛化,但存在确定性预测无法表示多模态未来、以及运动幅度校准不足(平均运动比率r=0.72)等局限性。