DynaPix:视觉语言模型为何认不出精确的未来?

快速导读:这就是 DynaPix 基准揭示的核心发现:时间锚定差距。现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 用物理模拟器生成场景,因此每个未来帧都有精确的真值。它将预测任务分为三类:由碰撞等物理事件锚定的、由经过的固定时间锚定的、以及由短时间窗口锚定的。结果发现,所有模型在事件锚定上表现尚可,在时间锚定上却集体失败。

视觉语言模型(VLM)正越来越多地被用作具身智能体的感知核心。一个智能体不仅需要描述当前场景,更需要预测未来的精确状态——例如,积木倒塌后每个物体的确切位置。然而,现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 正是为解决这一验证难题而提出的基准。

DynaPix 的核心洞察是:当未来时刻由物理事件(如碰撞)标记时,模型表现尚可;但当未来时刻仅由经过的固定时间指定时,模型几乎完全失败。这一“时间锚定差距”在人类身上并不存在——人类在时间锚定任务上的准确率高达 83.3%,而最佳模型仅为 27.3%,接近随机猜测的 25%。这一发现揭示了当前 VLM 在物理时间理解上的根本性缺陷。

英文题目:DynaPix: Can Vision-Language Models Identify the Exact Future?

论文出处:arXiv 每日论文精选 · arXiv:2608.05505

原始论文:PDF / 论文页面

这篇论文解决什么问题?

具身智能体需要做出可验证的具体预测。例如,一个操作机械臂的模型需要知道:在推动某个物体两秒后,物体的精确位置是什么?这类预测必须与真实物理结果一致,而非仅仅“看起来合理”。然而,现有的视频预测评估通常使用生成质量指标(如 FVD)或文本相似度,这些指标无法区分“看起来像未来”和“就是未来”之间的关键差异。

DynaPix 的设计直接针对这一验证缺口。它基于物理模拟器(Bullet、MoVi-A、Physion)生成场景,因此每个未来帧都有确定的 oracle 真值。基准包含两个赛道:选择赛道(从四个候选中选出正确未来帧)和检索赛道(从约一万帧数据库中排序找出正确帧)。选择赛道进一步分为三类锚定方式:事件锚定(目标时刻由碰撞等物理事件标记)、时间锚定(目标时刻仅由经过的固定时间指定)和窗口锚定(目标时刻是观察窗口后一个短时间跨度的未来状态)。

这三类锚定的设计并非随意为之。事件锚定测试模型是否能利用物理事件的显著性来定位未来;时间锚定测试模型是否具备内在的时间感知能力;窗口锚定则介于两者之间,测试模型在短时间范围内的预测能力。通过对比这三类任务上的表现,DynaPix 能够精确诊断模型的失败模式。

值得注意的是,DynaPix 的干扰项设计极具挑战性。在选择赛道中,干扰项来自同一场景的不同时刻(同场景错时干扰项),这意味着模型不能仅靠场景识别来作答,而必须真正理解时间推进带来的状态变化。这种设计与以往仅使用不同场景作为干扰项的基准形成鲜明对比。

核心创新

方法概览

这就是 DynaPix 基准揭示的核心发现:时间锚定差距。现有的未来预测评估大多接受文本描述或看起来合理的图像作为答案,无法验证预测是否与真实的、特定的未来状态一致。DynaPix 用物理模拟器生成场景,因此每个未来帧都有精确的真值。它将预测任务分为三类:由碰撞等物理事件锚定的、由经过的固定时间锚定的、以及由短时间窗口锚定的。结果发现,所有模型在事件锚定上表现尚可,在时间锚定上却集体失败。

  • 场景生成与真值获取:DynaPix 使用 Bullet 物理引擎生成 CLEVRER 风格的碰撞场景,并从 MoVi-A 和 Physion 数据集构建零样本迁移套件。每个场景的完整动态记录由模拟器提供,因此任意时刻的帧都可以作为精确的真值。
  • 选择赛道三类锚定:事件锚定以“下一次碰撞后的第一帧”为目标;时间锚定以“观察截止后经过固定时间(1 秒或 2 秒)的帧”为目标;窗口锚定以“观察窗口结束后短时间跨度内的状态”为目标。三类锚定的测试集分布不均,窗口锚定占 72%,因此论文强调应按锚定类别分别评估,而非依赖加权平均。
  • 检索赛道设计:检索赛道包含 2,002 个查询和约 10,000 帧的数据库。查询分为未来状态查询(给定观察视频,检索正确的未来帧)和反事实查询(移除某个物体后,检索相应的运动结果)。这一设计测试模型在开放环境中的精确未来定位能力。
  • 物理锚定的思维链蒸馏:传统 CoT 蒸馏使用教师模型生成的推理过程训练学生模型,但教师模型本身可能产生错误推理。DynaPix 提出从模拟器的真实动态记录中提取推理过程——例如,记录中明确标注了碰撞时间、物体速度变化等信息,这些信息被转化为自然语言推理链,用于监督学生模型(Qwen3-VL-8B)的训练。
  • 推理链的构建方式:模拟器记录包含每个物体的位置、速度、碰撞事件等结构化数据。论文将这些数据转化为描述性文本,例如“红色球体在 1.2 秒时与蓝色立方体碰撞,碰撞后红色球体速度从 (2.0, 0, 0) 变为 (0.5, 0, 0)”。这些文本被用作训练学生模型时的推理目标。
  • 对比微调检索适配:对于检索赛道,论文对 Qwen3-VL-Emb-8B 进行对比微调,使用 DynaPix 的训练数据优化嵌入空间,使正确未来帧的嵌入与查询嵌入更接近。
  • 人类验证探针:论文招募三位标注者对平衡子样本进行测试,以验证时间锚定任务对人类是可解的。人类在时间锚定任务上的高准确率(83.3%)与模型表现(27.3%)形成鲜明对比,证明失败源于模型能力而非任务本身的不可能性。
  • 评估指标:选择赛道使用准确率(chance rate 25%);检索赛道使用 Recall@k、MRR 和中位排名。论文特别强调按锚定类别分别报告,因为窗口锚定占测试集多数,会掩盖时间锚定上的失败。

逐图理解论文

一个具体的失败案例

一个具体的失败案例
Figure 2: The three selection anchors, shown on real benchmark instances. Given an observed prefix cut before the target, choose one exact future frame t⋆(green) among four candidates. Event-anchored: frame right after the next collision. Window-anchored: state a short horizon ahead. Time-anchored: state a fixed time after the cut. Distractors are wrong moments from the same scene or hard negatives from a different scene.

图 2 展示了三类选择锚定的具体实例。事件锚定以碰撞后的第一帧为目标,时间锚定以固定时间后的帧为目标,窗口锚定以短时间跨度后的状态为目标。该图帮助读者理解三类锚定在视觉上的差异,以及干扰项的设计方式。

时间锚定差距

时间锚定差距
Table 2 reports per-family accuracy. We treat these as primary and the mean as reference, because the test set is 72% window-anchored. A pooled score would be dominated by window and hide failure on the time family. Accuracy separates sharply by family. With a salient collision marking the target moment, the best generative model reaches 65.1%, and VLM2Vec reaches 71.1%, both well above the 25% chance rate. With elapsed time alone, ev- ery model is near chance, with a best of 27.3%. The contrast holds within Qwen3-VL-8B instruct:

表 2 报告了按锚定类别划分的零样本选择准确率。关键观察是时间锚定列的所有模型都接近 25% 的随机水平,而事件锚定和窗口锚定列则有模型显著高于随机。这一对比是论文核心论点的直接证据。

论文的贡献与验证

论文的贡献与验证
Table 4: Physics-grounded CoT distillation. (a) CLEVRER selection accuracy per family. (b) Retrieval on 2,002 queries over 10,000 frames. The distilled stu- dent replaces the two-stage pipeline’s generative stage, and the contrastive row finetunes the direct embedder. Bold marks the best result in each column of each panel.

表 4 展示了物理锚定 CoT 蒸馏的结果。蒸馏后的事件锚定和窗口锚定准确率大幅提升,时间锚定也有显著改善但仍远低于其他类别。该表还展示了对比微调对检索性能的提升效果。

核心结论

核心结论
Figure 3: The retrieval track of DynaPix (illustrative). From the observation video, a method ranks the true future frame (green) among a database of about 10,000 frames. Future-state queries ask for the scene after the observation: the true future is the outcome the dynamics force, here the toppling stack settled flat, while distractors show the scene before the collapse or a different scene. Counterfactual queries remove a named object and ask for the resulting motion: without the blue cube the red sphere rolls on, whereas the factual outcome keeps the cube and the sphere stops against it.

图 3 展示了检索赛道的示意流程。从观察视频出发,模型需要在约一万帧的数据库中排序找出正确的未来帧。该图还展示了反事实查询的设计:移除某个物体后,正确的未来帧与事实结果不同。

实验如何设计?

  • 零样本选择评估:测试多种生成式 VLM(Qwen3-VL 系列、Qwen3.5-VL、Qwen3.6-VL)和相似度评分器(VLM2Vec)在三类锚定上的选择准确率。模型以 instruct 模式或 thinking 模式运行,thinking 模式的不可解析输出计为错误。
  • 零样本检索评估:测试直接嵌入器(Qwen3-VL-Emb-8B)和两阶段预测-匹配流水线(先生成未来帧描述,再与数据库匹配)的检索性能。数据库规模约 10,000 帧,chance Recall@1 为 0.01%。
  • 物理锚定 CoT 蒸馏:使用 CLEVRER 训练集对 Qwen3-VL-8B 进行蒸馏训练,评估在 CLEVRER 选择赛道和检索赛道上的表现,并与仅使用答案监督的基线对比。
  • 对比微调:对 Qwen3-VL-Emb-8B 进行对比微调,评估检索性能提升。
  • 人类研究:三位标注者对 59 个平衡子样本进行选择任务,记录准确率和决策时间。标注深度不均(10 项仅一人标注,30 项两人,19 项三人),因此论文将每位标注者的结果作为主要证据,多数投票作为参考。
  • 消融实验:对蒸馏学生模型进行组件消融,移除推理链中的不同信息类型(如碰撞时间、速度变化),评估对准确率的影响。

关键结果与论文证据

  • 时间锚定差距显著:最佳零样本模型(Qwen3-VL-8B instruct)在时间锚定选择上的准确率仅为 27.3%,接近 25% 的随机水平(第 5 页)。而在事件锚定上,VLM2Vec 达到 71.1%(第 5 页)。这一差距在所有测试模型上一致存在。
  • 人类与模型形成鲜明对比:人类多数投票在时间锚定任务上达到 83.3%,而最佳模型仅 27.3%(第 6 页)。每位标注者在时间锚定上的准确率都远超模型,证明任务本身对人类是可解的。
  • 检索任务极具挑战性:最佳零样本检索 Recall@1 仅为 13.3%(Qwen3-VL-Emb-8B),MRR 为 0.283(第 7 页)。两阶段流水线表现更差,说明生成式预测再匹配的策略不如直接嵌入有效。
  • 物理锚定 CoT 蒸馏有效但有限:蒸馏将时间锚定准确率从 27.3% 提升至 45.4%,其中 1 秒子类达到 64.0%,2 秒子类仅 37.6%(第 8 页)。事件锚定从 64.7% 提升至 92.4%,窗口锚定从 42.0% 提升至 96.7%。仅使用答案监督的基线远低于完整蒸馏,证明推理链内容而非答案监督本身带来了主要增益(第 8 页,附录 J)。
  • 对比微调大幅提升检索性能:对比微调将 Qwen3-VL-Emb-8B 的 Recall@1 从 13.3% 提升至 48.8%,MRR 从 0.283 提升至 0.652(第 8 页)。
  • Thinking 模式存在解析问题:Qwen3-VL-8B thinking 模式的不可解析输出率达 33.6%,这些输出被计为错误,可能低估了其真实能力(第 5 页)。Qwen3.5-27B 和 Qwen3.6-27B 的解析率分别为 89.9% 和 81.1%。
  • 窗口锚定占测试集多数,需谨慎解读均值:测试集中 72% 为窗口锚定项,未加权均值会掩盖时间锚定上的失败(第 5 页)。论文强调应按锚定类别分别评估。
  • 蒸馏增益可能依赖于谓词词汇设计:物理锚定推理链的质量取决于从模拟器记录中提取的信息类型和表述方式,而非模型真正学会了物理推理(第 9 页)。

阅读时需要注意

  • 三类锚定在时间跨度、干扰项来源、目标显著性等方面存在多重差异,因此性能差距不能完全归因于时间锚定本身,需要更严格的匹配锚定对照实验。
  • 数据完全来自合成模拟器,真实世界场景的迁移性能未经测试。
  • 帧级精确的选择任务可能将预测能力与亚秒级时间戳辨别能力混淆,尽管人类研究部分缓解了这一担忧。
  • 蒸馏增益可能依赖于设计者选择的谓词词汇,而非模型真正获得了物理推理能力。
  • 检索适配仅在单向量架构上测试,未涉及晚交互或多向量检索器。

关联工作

  • CLEVRER(Yi et al., 2019):DynaPix 使用 CLEVRER 的碰撞场景设计和 Bullet 模拟器作为主要场景来源,但将任务从视频问答扩展为精确的未来帧识别。
  • Physion(Bear et al., 2021):DynaPix 从 Physion 的刚体场景构建零样本迁移套件,测试模型在未见过的物理场景上的泛化能力。
  • VLM2Vec(Jiang et al., 2025):作为强相似度评分器基线,在事件锚定选择任务上达到 71.1% 的最佳零样本准确率。
  • Qwen3-VL(Bai et al., 2025):主要评估的生成式 VLM,也是物理锚定 CoT 蒸馏的学生模型。
  • 思维链蒸馏(Hsieh et al., 2023; Wang et al., 2023):DynaPix 的蒸馏方法修改了标准 CoT 蒸馏,将推理链锚定在模拟器记录而非教师模型的生成结果上。

发表评论