DynaPix:视觉语言模型为何认不出精确的未来?

论文代表图:figure-01-p002-01

这就是 DynaPix 基准揭示的核心发现:时间锚定差距。现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 用物理模拟器生成场景,因此每个未来帧都有精确的真值。它将预测任务分为三类:由碰撞等物理事件锚定的、由经过的固定时间锚定的、以及由短时间窗口锚定的。结果发现,所有模型在事件锚定上表现尚可,在时间锚定上却集体失败。