视频生成器具备因果推理能力吗?CGDJ基准揭示“感知-预测鸿沟”

三分钟导读:本文提出Causal-Generative Dual-Judge (CGDJ)基准,通过显式因果感知和隐式生成预测评估视频生成器的推理能力,揭示了当前模型存在显著的“感知-预测鸿沟”及音视频不一致现象。

英文题目:Thinking in Video: Can Video Generators Really Reason About the Real World?

论文出处:arXiv 每日论文精选 · arXiv:2607.17523

原始论文:PDF / 论文页面

对应视频标题:视频生成器具备因果推理能力吗?CGDJ基准揭示“感知-预测鸿沟”|推荐指数:★★★★★

这篇论文解决什么问题?

现有视频生成评估指标(如FVD)侧重视觉保真度,无法区分模型是真正理解因果逻辑还是仅通过统计记忆模仿外观;缺乏同时评估因果理解与物理生成一致性的框架。

核心创新

  • 重新定义“Thinking in Video”范式,将视频视为构建和验证因果思维的媒介。
  • 提出Flatten Temporal Video策略,解决视频生成器难以处理交错视频-文本输入的问题,实现时空动态的空间化映射。
  • 构建CGDJ基准,联合评估显式因果感知和隐式生成预测,揭示“感知-预测鸿沟”。
  • 发现音视频不一致现象,即模型能正确口头描述因果逻辑,但无法在视觉上生成一致的物理结果。

方法概览

提出CGDJ框架,包含两个互补模块:(1) Explicit Causal Perception:利用Flatten Temporal Video策略将视频和时间查询转换为空间网格图像,测试模型对因果结构的显式理解;(2) Implicit Generative Prediction:在因果转折点分割视频,测试模型生成符合物理规律的未来视频的能力。

逐图理解论文

方法:CGDJ基准框架概述

方法:CGDJ基准框架概述
Figure 1: The overall workflow of the Causal Generative Dual Judge (CGDJ) consists of two components, Explicit Causal Perception (top) and Implicit Generative Prediction (bottom). Specifically, the pipeline transforms raw video sequences into model-compatible image inputs via the Flatten Temporal Video strategy. The video generator then processes this context to execute the assigned task and synthesize the final reasoning video.

为此,本文提出Causal-Generative Dual-Judge (CGDJ)基准。该框架包含两个互补模块:显式因果感知与隐式生成预测。显式模块测试模型对因果结构的识别能力,隐式模块测试其生成符合物理规律未来视频的能力。这一设计旨在重新定义“Thinking in Video”范式,将视频视为构建和验证因果思维的媒介。

创新:Flatten Temporal Video策略

创新:Flatten Temporal Video策略
Figure 2: The construction process of the CGDJ benchmark. (a) Explicit Causal Perception Data utilizes a Flatten Temporal Video strategy to map temporal dynamics into a spatial grid, combining visual history with rasterized text queries for direct reasoning. (b) Implicit Generative Prediction Data evaluates simulation by splitting videos at a critical inflection point; The pre-event frames serve as a flattened visual condition, prompting the model to generate the physically consistent post-event future.

核心创新在于提出Flatten Temporal Video策略。传统视频生成器难以处理交错的视频与文本输入,该策略将视频帧和时间查询转换为空间网格图像,实现时空动态的空间化映射。这不仅保留了因果信息,还解决了输入兼容性问题,使模型能够直接对网格化的视觉历史与文本查询进行推理。

实验设置:模型与评分机制

实验设置:模型与评分机制
Table 1: Detailed configurations of the representative base- line video generative models evaluated in our experiments.

我们在CGDJ基准上评估了Sora-2、Veo-3.1、Wan-2.2-14B、HunyuanVideo-1.5等视频生成模型,以及Qwen3-VL、GPT-5、Gemini-3-Flash等多模态大语言模型 (MLLM)。评分采用Gemini-3-Pro进行自动化评估,并与人类专家评分进行对齐验证,确保评估结果的可靠性与一致性。

结果:显式因果感知性能

结果:显式因果感知性能
Table 2: Accuracy (%) on Explicit Causal Understanding Tasks. Area: Setting A (Native Video Input). Area: Setting B (Flatten Temporal Video Input). The Red represents better AVG performance.

在显式因果理解任务中,Gemini-3-Flash在Flatten Temporal Video输入下准确率达74.1%,保留了其原生输入性能的89%。相比之下,视频生成模型表现较弱,Sora-2准确率为51.2%,Veo-3.1为49.9%,而Wan-2.2-14B仅为0.7%。这表明当前视频生成器在显式因果感知方面仍远落后于先进MLLM。

结果:隐式生成预测性能

结果:隐式生成预测性能
Table 3: Score (%) on Implicit Generative Action Tasks. The Red represents better AVG performance.

在隐式生成动作任务中,Sora-2得分为61.6%,Veo-3.1为58.9%,Wan-2.2-14B为41.5%。尽管分数高于显式任务,但绝对值仍不高。自动化评分与人类专家评分的Pearson Correlation为0.82,Mean Absolute Difference为0.14,证明自动化评估具有高度可靠性,能够有效反映模型生成质量。

实验与关键结果

  • 在CGDJ基准上评估Sora-2, Veo-3.1, Wan-2.2-14B, HunyuanVideo-1.5等视频生成模型及Qwen3-VL, GPT-5, Gemini-3-Flash等MLLM。
  • 对比Native Video Input与Flatten Temporal Video Input下的模型性能。
  • 分析不同空间网格布局(5×8, 7×10, 8×12)和视频帧数对推理性能的影响。
  • 通过Gemini-3-Pro进行自动化评分,并与人类专家评分进行对齐验证。
  • 比较Audio-Only, Video-Only及Audio ∩ Video的准确率,分析音视频不一致性。
  • Sora-2在Explicit Causal Understanding中准确率为51.2%,在Implicit Generative Action中得分为61.6%。(第 6 页)
  • Veo-3.1在Explicit Causal Understanding中准确率为49.9%,在Implicit Generative Action中得分为58.9%。(第 6 页)
  • Wan-2.2-14B在Explicit Causal Understanding中准确率仅为0.7%,但在Implicit Generative Action中得分为41.5%。(第 6 页)
  • Gemini-3-Flash在Flatten Temporal Video Input下准确率为74.1%,保留了其Native输入性能(83.0%)的约89%。(第 6 页)
  • 自动化评分与人类专家评分的Pearson Correlation为0.82,Mean Absolute Difference为0.14。(第 7 页)
  • 在Explicit Causal Understanding中,7×10网格布局在Sora-2和Veo-3.1上均取得最佳平均性能。(第 8 页)
  • 在Implicit Generative Action中,7-Pics输入策略取得最高保真度。(第 8 页)

阅读时需要注意

  • Flatten Temporal Video策略虽然保留了因果信息,但相比Native Video Input仍有一定信息损失。
  • 当前视频生成器在显式因果感知方面仍远落后于先进的MLLM(如Gemini-3-Flash)。
  • 模型在自然科学与社会学/人文领域的表现存在差异,物理机械规律比社会动态更难内化。
  • 高视觉保真度不等于因果正确性,模型可能通过统计模仿生成看似合理但物理错误的视频。
  • 音视频不一致表明模型可能依赖语言先验而非内部世界模型进行推理。
  • 评估结果受输入格式(网格布局、帧数)影响显著,需优化参数以获得最佳性能。

关联工作

  • Video-MME:CGDJ的Explicit Causal Understanding数据采用了Video-MME中的900个视频。(第 3 页)
  • Physion:CGDJ的Implicit Generative Action数据中的Natural Sciences类别部分数据来源于Physion。(第 3 页)
  • TLD Benchmark:CGDJ的Implicit Generative Action数据中的Sociology & Humanities类别部分数据来源于TLD。(第 3 页)
  • Videophy-2:相关工作,评估视频生成中的物理常识。(第 9 页)
  • Tivibench:相关工作,评估视频生成模型的思维视频推理能力。(第 9 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视频思维: 视频生成器真的能够推理现实世界吗?

张永恒1,2∗ 杨光1∗ 侯瑞涵1∗ 陈启光1∗ 刘子昂1 刘晓龙2 张曼曼2 郝彦超2 魏正2 吴浩3 秦立波1 戴沛珊1† 李颖辉3 尹迪2 孙兴2

1中南大学 2腾讯 3清华大学

显式因果感知 AI视频生成器 最终推理

变换 查询 显式因果感知

… 时间 时间

理解 推理 2026 输入视频 展平时序视频 感知与预测 输出视频 变换 隐式生成预测Jul 20 … 时间 时间

自然 社会学 科学 人文

隐式生成预测[cs.CV] 图1:因果生成双裁判(CGDJ)的整体工作流程由两个部分组成:显式因果感知(上部)和隐式生成预测(下部)。具体而言,该流程通过展平时序视频策略将原始视频序列转换为模型兼容的图像输入。视频生成器随后处理此上下文以执行分配的任务并合成最终推理视频。

摘要 世界模型和视频生成的最新进展催生了一种新兴的推理范式,该范式利用视频生成模型来模拟、预测和推理现实世界的动态。我们将这一范式重新定义为“视频思维”,其中视频不仅仅是输出产物,而是构建、扩展和验证因果思维的媒介。然而,这一承诺尚未得到验证:令人信服的推演可能反映的是记忆中的外观而非因果理解,而现有的指标将感知保真度与语义逻辑分离开来。为了评估视频生成器是否支持此类推理,我们引入了因果生成双裁判(CGDJ),从两个角度审计世界模型的一致性。显式因果感知通过时空展平的视觉问答测试生成器是否将视频场景视为推理问题,而隐式生成预测评估其是否将因果后果渲染为一致的未来视频。将 CGDJ 应用于代表性的开源和闭源生成器揭示了一个清晰的感知-预测鸿沟:尽管开源模型的显式因果感知接近于零,但它们仍能产生合理的动态;而先进的闭源系统在推理与生成之间表现出更强但仍有限的对齐。进一步的分析暴露了音视频不一致现象,即模型比其视觉渲染更可靠地口头描述正确的因果逻辑,这挑战了“世界模拟器”的说法。

arXiv:2607.17523v1

CCS 概念 • 计算方法 → 人工智能;计算机视觉;自然语言处理。

关键词 ∗ 同等贡献。 † 通讯作者。 世界模型,视频生成模型,视频思维。

第 2 页

Zhang 等人

1 引言 ❷隐式生成预测:我们测试模型是否能在视频中演绎其推理过程。基于因果前件,模型必须合成后续的未来序列。这种生成协议迫使模型超越选择或口头回答答案的层面:它必须物理渲染出结果,从而可以直接检查其视觉推演是否在因果上有效。 视频生成的最新进展改变了人们对视频模型能力的认知。自回归和基于扩散的系统现在能够合成具有连贯对象、运动和交互的高清、长达一分钟的片段 [1–7]。这一飞跃激发了一个超越视觉合成的主张:如果模型能够从视觉条件推演出合理的未来,它或许可以将视频作为推理的媒介。我们将这一方向称为“视频思维”(Thinking in Video):模型不仅仅是用语言描述答案,而是在时间维度上构建、扩展和审计一个视觉世界。因此,视频生成器成为候选的“通用世界模拟器”,内化了支配现实在不同场景下的物理定律和社会动态 [8–10]。 近期关于“用视频思考”的尝试探索了这种可能性在数学、导航和具身问题解决中的应用 [11–18]。 然而,“视频思维”的核心承诺尚未得到验证。一个令人信服的推演过程并不一定是正确的推理过程。模型生成破碎的玻璃、下落的物体或人类的反应,可能是因为它理解了因果条件,也可能是因为它记住了高频的视觉关联 [19, 20]。这种区分至关重要:推理需要反事实和因果有效性,而不仅仅是照片级的连续性。现有的评估往往通过 Fréchet 视频距离 (FVD) 或 Inception 分数来奖励感知质量,却忽略了生成的未来是否遵循场景力学 [21–23]。如果不将视觉合理性与因果正确性分开,将视频生成器视为开放世界决策的推理引擎为时过早 [24–28]。 现有的基准测试很少测试模型是否理解因果情境并通过生成来行动。这反映了一种结构性缺陷:范式将视觉保真度与语义逻辑割裂。分布式指标衡量平滑度、真实感或文本对齐度,但幻觉内容可能得分很高 [19, 29–32]。静态多模态基准测试考察符号或视觉问答,但不考察动态的视频答案 [33, 34]。因此,当生成器看似在推理时,我们无法判断它是在模拟因果性还是在模仿表象。这种差距隐藏了“感知-预测鸿沟”(Perception-Prediction Gap):模型可能知道结果却无法渲染出一致的像素。评估“视频思维”需要审计感知与预测。 为了弥补这一差距,如图 1 所示,我们引入了因果生成双裁判(Causal-Generative Dual-Judge, CGDJ),这是一个基准和评估框架,用于评估视频生成模型是否真正具备“视频思维”能力。CGDJ 不仅仅询问输出是否看起来良好,而是询问模型是否能将视频作为推理媒介:它必须从视觉证据中识别因果结构,然后通过生成有效的时序后果来 grounding 该结构。该范式包含两个互补模块: ❶显式因果感知:我们测试模型是否能识别并阐述视频的因果结构,而不仅仅是生成合理的延续。由于大多数视频生成器无法处理交错的视频-文本提示,我们的“展平时序视频”(Flatten Temporal Video)策略将视频帧和光栅化查询转换为统一的图像网格。这创造了一个显式的、可直接判断的视觉问答任务,迫使模型揭示其识别出的因果进程,而不是依赖统计延续。 实验表明,当前的视频生成器仅具备部分“视频思维”能力。在显式方面,先进的闭源生成器如 Sora-2 和 Veo-3.1 显示出可测量的因果感知能力,而开源生成器在相同的展平推理协议下几乎崩溃。然而,在生成方面,开源模型仍能产生 moderately plausible(中等合理)的因果延续,暴露出显著的感知-预测鸿沟:视觉动作可以超越显式的因果理解。进一步分析显示存在音视频不一致(Audio-Visual Misalignment),即模型往往比渲染结果更可靠地口头阐述正确的因果逻辑。这些结果挑战了简单的“世界模拟器”叙事。当前系统可以模仿世界动态的部分内容,最强的模型开始使感知与预测对齐,但稳健的视频推理仍然需要因果知识与视觉计算之间更强的 grounding。 我们的主要贡献总结如下: (1) 我们将视频生成模型的推理重新定义为“视频思维”范式,其中视频成为构建和验证因果思维的媒介,并强调需要正确评估当前生成器是否支持此类推理。 (2) 我们提出了因果生成双裁判(CGDJ)框架,采用展平时序视频策略,共同评估当前视频生成模型中的显式因果感知和隐式生成预测。 (3) 通过实验,我们揭示了一个根本性的感知-预测鸿沟:当前模型可以在缺乏可靠因果感知的情况下表现出合理的视觉动态,而先进系统在物理和社会动态方面显示出早期但有限的显式推理与生成模拟之间的对齐 [35–37]。 为了促进进一步的研究,所有代码和数据将公开提供:https://github.com/BRZ911/Thinking-in-Video.

2 因果–生成双裁判 为了评估视频生成模型是仅仅在模仿像素统计还是真正在模拟世界动态,我们提出了因果–生成双裁判(Causal–Generative Dual-Judge, CGDJ)。如图 2 所示,该范式将语义理解(感知)与物理渲染(预测)的评估解耦。CGDJ 包括:(i) 因果–生成双裁判基准 (§2.1),以及 (ii) 因果–生成双裁判评估。

2.1 因果–生成双裁判基准 2.1.1 显式因果理解数据。如图 2 (a) 所示,综合基准构建过程包括两个主要阶段:数据收集和展平时序视频转换:

第 3 页

视频思维:视频生成器真的能对现实世界进行推理吗?

输入视频 输入文本查询 原始视频 输入视频 视频描述 Q: 有多少只红袜子……? 这个视频是关于人们…… O: A. 1 B. 4 C. 2 D. 3 …… 展平时序视频 ……

时间 手动分割 …… …… 黄金视频

(a) 显式因果感知数据 (b) 隐式生成预测数据

图 2:CGDJ 基准的构建过程。(a) 显式因果感知数据利用展平时序视频策略,将时序动态映射到空间网格中,将视觉历史与光栅化的文本查询相结合以进行直接推理。(b) 隐式生成预测数据通过在关键转折点分割视频来评估模拟能力;事件前的帧作为展平的视觉条件,提示模型生成符合物理一致性的事件后未来。

数据收集。为了评估视频生成模型的因果推理能力,我们通过采用 Video-MME [38] 中的所有 900 个视频,使我们的基准与视频理解标准保持一致。为了确保在不同时间尺度上的全面评估,收集范围涵盖短、中、长持续时间。此外,该数据集涵盖了多样化的现实世界动态,分为六个领域:(i) 知识,(ii) 生活记录,(iii) 体育竞赛,(iv) 艺术表演,(v) 电影与电视,以及 (vi) 多语言。这些领域的统计分布如图 3 (a) 所示。这使得能够评估跨不同物理和社会动态的内部因果理解。

展平时序视频转换。由于当前的视频生成模型严格限制为仅处理静态图像输入,为了克服这一根本限制,我们提出了展平时序视频策略,将视频-问题对映射到单个静态图像 $I_{composite} \in \mathbb{R}^{720 \times 1280 \times 3}$ 上。

形式上,给定视频 $V$ 和问题-选项对 $Q$,构建过程包括三个步骤:

1. 时序网格构建:我们通过均匀时序采样提取 $N=70$ 帧序列。这些帧被连接成一个尺寸为 $7 \times 10$ 的空间矩阵 $I_{grid}$: $$ I_{grid} = \bigoplus_{r=1}^{7} \bigoplus_{c=1}^{10} x_{t}^{(r-1)10+c} \quad (1) $$ 其中 $\oplus$ 表示空间拼接。该网格有效地将时序序列转换为视觉编码器可访问的空间纹理。

2. 语义渲染:我们直接通过专用的高保真光栅化函数将特定文本查询 $Q$ 转换为密集的像素空间表示 $I_{text}$,而不是依赖传统的预训练外部文本编码器。这个新渲染的文本块被战略性地放置在最终图像网格的上部整个空间视觉场中。

3. 垂直整合:模型的最终复合输入是通过沿主高度维度将特定语义指令张量与展平的时序网格张量垂直拼接而精心合成的。为了确保与现有标准视频生成架构的技术兼容性,这个新融合的张量随后经过自适应调整大小操作以匹配所需的目标分辨率: $$ I_{composite} = \text{Resize}_{1280 \times 720}([I_{text}; I_{grid}]) \quad (2) $$ 这种布局通过在网格上方堆叠文本来创建“视觉表示”,从而通过对指令和历史的联合注意力实现因果推理。

2.1.2 隐式生成动作数据。如图 2 (b) 所示,构建过程包括三个主要步骤:数据收集、视频分割和展平时序视频转换:

数据收集。我们将广泛的世界动态系统地分类为自然科学和社会学与人文科学,以在刚性物理力学和复杂人类行为之间平衡评估。

• 自然科学:此类别评估模型对物理定律的基本理解。我们汇总了来自各种权威基准的数据,包括 The Sound of Water [39]、Physion [40] 和 Physics IQ Benchmark [27]。我们将这些数据分类为四个细分子领域:(i) 物理力学,(ii) 自然与生命科学,(iii) 材料与结构,以及 (iv) 场与能量。

• 社会学与人文科学:此类别评估对人类行为和社会逻辑的模拟。数据来源包括 TLD Benchmark (车辆信号) [41]、Kinetics Human Action [42]、Ego4D [43] 以及精选的网络视频。这些被分类为子领域:(i) 交通行为,(ii) 生活行为,(iii) 职业角色行为,(iv) 公共社会行为,以及 (v) 体育活动行为。

如图 3 (b) 所示,最终策划的基准总共包含 600 个高质量视频。为了确保在物理刚性和社会复杂性之间的无偏见评估,我们在两个领域之间保持严格平衡的分布:300 个样本用于自然科学,300 个样本用于社会学与人文科学。

第 4 页

Zhang 等人

视频分割。为了将标准的生成任务严格地重构为结构化的因果预测问题,我们实施了一种精确的时间分割策略。对于基准测试中的每一个视频,专家标注员手动识别并定位因果拐点(或关键节点)。这个特定的时间戳代表了因果条件积累触发不可逆事件或状态转变的决定性边界。 ❶输入视频:事件前的序列作为视觉条件,为后续生成提供必要的因果背景。此外,我们使用 Gemini-3-Pro [44] 生成详细的语义视频描述,该描述与视频共同注入以辅助生成。 ❷黄金视频:随后的时间片段作为不可变的真实参考基准,捕捉初始条件的实现结果。这段经验记录的素材作为严格基线,用于审计模型外推的有效性。 视频时间过渡的展平。与显式理解模块中提到的先前策略类似,我们采用展平技术将视频上下文输入生成模型。具体而言,我们从输入视频中以均匀离散的时间步长提取 $N=7$ 个关键帧,以表示运动轨迹。形式上,这些帧在空间上拼接以形成连续的视觉条件 $I_{motion}$: $I_{motion} = \bigoplus_{i=1}^{N} x_{t_i}$ (3) 其中 $x_{t_i}$ 表示时间步 $t_i$ 处的帧,$\oplus$ 表示空间水平拼接。这种排列构建了一个连贯的“时间视觉箭头”,有效地编码了运动的方向向量和动态时间状态变化。

2.2 因果-生成双裁判评估 为了量化模型模拟世界动态的能力,如图 4 所示,我们设计了一个基于先进多模态模型的自动化评估流水线。 ❷因果判断:Gemini-3-Pro 被指派充当裁判。它将生成视频中的视觉事件与正确答案的逻辑要求进行对比。MLLM 确定生成视频是否描绘了真实答案所隐含的因果后果,并将生成结果分类为“正确”或“错误”。我们在图 6 中将此自动化指标与人类判断进行了验证。 该自动化流水线确保评估超越肤浅的像素指标,并专注于生成内容的语义和因果正确性。

2.2.2 隐式生成评估。为了评估真实世界模拟的真实性,如图 4 (b) 所示,我们采用了一种全面的、系统的、严格的基于参考的比较评估。利用 Gemini-3-Pro 有效地充当专门的“视频质量审计员”。它系统地以真实“黄金视频”为基准,对模型生成的视频进行评估,同时确保严格遵守相关的文本描述。 具体而言,评估过程如下: 基于 MLLM 的裁决。我们采用 Gemini-3-Pro [44] 作为核心评估器,因为它具备卓越的视觉理解能力和长上下文推理能力,这对我们的分析至关重要。 评分机制。自动化评估器根据以下三个维度分配分数 $S \in [0.0, 1.0]$:(i) 语义

Zhang et al.

(a) 显式因果理解 分类 短/中/长视频 知识 270 生活记录 210 体育竞赛 150 艺术表演 120 影视 120 多语言 30 总计 900

(b) 隐式生成动作 分类 视频 总计自然科学 300 物理力学 110 自然与生命科学 80 材料与结构 60 场与能量 50 总计社会学与人文科学 300 交通行为 100 生活行为 100 职业角色行为 60 公共社会行为 20 体育活动行为 20 总计 600

图 3:因果-生成双裁判基准的统计分布。(a) 显式因果理解 across 六个领域的 900 个视频分布。(b) 隐式生成动作 600 个视频的分类。

2.2 因果-生成双裁判评估 生成的视频由被测模型产生,(2) 转录的音频文本,(3) 原始问题和选项,以及 (4) 真实答案。

第 5 页

视频思维:视频生成器真的能对现实世界进行推理吗?

(a) 显式因果感知评估 (b) 隐式生成预测评估

输出视频 黄金视频 指令:您是一位专家回答 指令:您是一位严格…… 可见 回答 来自 NLP 评估器…… 0. 首先,确定 NLP 将模型生成的视频 以回应 图像中的 CorrectIncorrect。 … 需要 时间 … 对照评分标准(0.0 – 视频…1.0): …… 输入: … – 0.0 – 0.2:主要幻觉 … 视频:[输出视频] … 时间 音频文本:[转录音频文本] 输入: 输出视频 视频描述:[视频描述] 问题:[原始问题] 选项:[原始选项] 标准视频:[黄金视频] …… 正确答案:[黄金答案] 输出视频:[输出视频] 时间 … 裁判回应:……视频中生成的答案是正确的。 裁判回应:……正确识别了射箭设置…… 得分:0.9。

图 4:因果生成双裁判 (Causal–Generative Dual-Judge) 的整体评估流程包含两个截然不同但互补的协议:(a) 显式因果理解评估和 (b) 隐式生成动作评估。

对齐(对象/动作正确性)、(ii) 参考一致性(逻辑流与地面真值)以及 (iii) 物理有效性(无闪烁/物理违规)。分数范围从 0.0(幻觉)到 1.0(完美匹配),有效量化了模型将推理扎根于物理动作的本能能力。

表 1:我们实验中评估的代表性基础视频生成模型的详细配置。

模型 分辨率 来源类型 时长 价格 Wan-2.2-14B [6] 1280 × 720 开源 5s – Hunyuan-1.5 [4] 1280 × 720 开源 5s – Veo-3.1 [5] 1280 × 720 闭源 8s $0.4/s Sora-2 [3] 1280 × 720 闭源 12s $0.1/s

3 实验

在本节中,我们进行全面实证分析,以验证新提出的因果生成双裁判 (CGDJ)。我们的系统实验旨在探究世界模拟的两个最显著方面:

(1) 显式因果理解:我们首先评估各种模型是否具备通过特定分析任务识别支配复杂现实世界事件的正确因果动态所需的基本理论知识(如 §2.1 所述)。

(2) 隐式生成动作:然后我们评估视频生成模型通过将知识扎根于物理动作来生成与真实世界动态紧密一致的合法未来视频序列的内在能力。

通过比较这两种互补的模式,我们旨在进一步量化“感知-预测鸿沟”并诊断现代视频生成模型作为世界模拟器的状态。

3.1 显式因果理解的实验设置

为了评估视频生成模型的显式推理能力,我们以先进的 MLLM 为基准,以定量突出关键的感知和推理性能差距。实验设置设计如下:

多模态大语言模型基线。为了建立性能上限并验证我们视觉表示的有效性,我们评估了一系列先进的 MLLM。这包括 Qwen3-VL-Instruct (2B, 4B 和 8B)[46],以及专有前沿模型,包括 GPT-5[47] 和 Gemini-3-Flash [44]。对于这些 MLLM,我们设计了两种不同的输入协议,以分析信息格式的影响:(1) 设置 A(原生视频输入):模型直接处理原始视频令牌,利用其原生时间编码器。(2) 设置 B(展平时间视频输入):模型处理“展平”的空间网格图像,这与用于视频生成模型的输入格式完全相同。此比较验证了展平策略是否保留了足够的因果信息用于推理。

视频生成模型基线与推理。我们对一组代表性的领先视频生成模型进行基准测试,将其分为开源和闭源组。由于模型不能原生处理用于理解任务的交错视频-文本输入,所有模型均使用我们提出的展平时间视频策略进行评估。配置针对模型的可访问性进行了定制:

• 开源模型(本地推理):我们选择了 Wan-2.2-14B [6] 和 HunyuanVideo-1.5 [4]。我们利用它们的官方实现在本地服务器上进行推理。

• 闭源模型(API 访问):我们通过其官方 API 评估了先进的 Veo-3.1 [5] 和 Sora-2 [3]。这些模型使用其默认的稳定持续时间设置(长达 12s)进行测试。为了确保基准测试的经济透明度,我们在评估期间记录了定价。

表 1 详细列出了用于比较目的的包括分辨率、最大持续时间和定价在内的综合参数设置。

第 6 页

Zhang 等人

表 2:显式因果理解任务上的准确率 (%)。区域:设置 A(原生视频输入)。区域:设置 B(展平时序视频输入)。红色表示更好的平均 (AVG) 性能。

视频长度 视频类别 模型 平均 短 中 长 知识 电影 体育 艺术 生活 多领域

原生视频输入(语言模型)

Qwen3-VL-2B [46] 70.3 52.0 49.0 63.7 59.2 48.7 55.0 56.7 43.3 57.1 Qwen3-VL-4B [46] 76.3 59.3 49.0 66.3 62.5 59.3 61.7 58.1 50.0 61.6 Qwen3-VL-8B [46] 82.3 65.3 56.7 71.5 73.3 62.7 66.7 66.7 60.0 68.1 GPT-5 [47] 88.0 79.3 71.0 82.2 82.5 75.3 81.7 78.1 63.3 79.4 Gemini-3-Flash [44] 91.7 82.3 75.0 85.2 86.7 82.7 79.2 83.3 63.3 83.0

展平时序视频输入(语言模型)

Qwen3-VL-2B [46] 48.7 40.0 42.3 47.0 41.7 40.0 40.0 45.7 40.0 43.7 Qwen3-VL-4B [46] 57.3 40.3 43.7 54.8 46.7 38.0 41.7 48.1 40.0 47.1 Qwen3-VL-8B [46] 64.7 50.7 50.0 61.5 56.7 49.3 47.5 53.8 60.0 55.1 GPT-5 [47] 74.3 65.0 63.3 72.2 73.3 58.7 68.3 65.2 60.0 67.6 Gemini-3-Flash [44] 79.7 72.7 70.0 78.5 77.5 64.0 74.2 74.8 66.7 74.1

展平时序视频输入(视频生成模型)

Wan-2.2-14B [6] 1.0 0.7 0.3 0.4 0.8 0.7 1.7 0.5 0.0 0.7 HunyuanVideo-1.5 [4] 1.3 0.3 1.8 1.5 1.7 2.0 0.0 1.5 3.3 1.5 Veo-3.1 [5] 52.3 48.0 49.3 54.1 49.2 48.3 44.6 51.9 30.0 49.9 Sora-2 [3] 52.5 49.5 51.5 53.9 52.1 45.3 51.7 51.2 50.0 51.2

3.2 主要结果 在此判别任务中完全崩溃,这可能是由于 表 2 和表 3 总结了我们的因果生成双裁判 (Causal–Generative Dual-Judge) 评估的定量结果。从这些实验比较中,我们观察到: 1. 时空展平作为因果推理的有效媒介。为了验证我们的展平策略是否保留了推理所需的充分信息,我们比较了 MLLM 在原生视频输入与展平时序视频输入下的性能。结果显示,虽然将时序视频转换为空间网格不可避免地会导致一些信息丢失,但先进的 MLLM 仍保持了稳健的性能。值得注意的是,Gemini-3-Flash 在展平设置下达到了 74.1%,保留了其原生性能 (83.0%) 的约 89%。即使是较小的 Qwen3-VL-8B,相对于其原生性能也保持了可观的 81%。这一证据证实,我们通过展平技术构建的“视觉媒介”包含足够的逻辑线索。 2. 生成模型中涌现但有限的推理能力。出现了明显的分歧。Sora-2 (51.2%) 和 Veo-3.1 (49.9%) 等闭源模型表现出可测量的显式推理能力,其表现与 8B 参数的 MLLM 相当。这表明扩大视频生成规模或内部提示重写流程,会催生一种涌现的、尽管是初级的对世界动态的理解。然而,它们远远落后于最先进的推理引擎 Gemini-3-Flash (74.1%),这表明当前的“世界模拟器” (World Models) 尚未成为稳健的推理器。值得注意的是,Wan-2.2 (0.7%) 和 HunyuanVideo (1.5%) 等开源权重模型在此判别任务中完全崩溃,这可能是由于它们在训练过程中缺乏指令遵循对齐。 3. 闭源模型主导物理模拟。在生成领域,Sora-2 以 61.6% 的平均分领先,紧随其后的是 Veo-3.1 (58.9%),显示出在模拟复杂动态方面的优越能力。开源模型在我们的自动化 MLLM 评估下落后,分别为 42.5% 和 41.5%。有趣的是,模型在社会学与人文领域 (Sociology & Humanities) 的表现始终优于自然科学领域 (Natural Sciences),Sora-2 在这两个领域的得分分别为 65.6% 和 57.7%。这种差异表明,支配现实世界的刚性、不可变的物理定律,对于模型内化而言,可能比社会动态的模式更具挑战性。 4. 高级模仿与真正理解。通过并列表 2 和表 3,我们揭示了一个区分高级模仿与真正理解的关键“感知-预测鸿沟” (Perception-Prediction Gap)。在 Wan-2.2 等开源权重模型中观察到了显著的失调,尽管其在显式理解 (Explicit Understanding) 上的得分接近零 (0.7%),但在隐式生成动作 (Implicit Generative Action) 上却达到了可观的能力 (41.5%)。这意味着此类模型通过统计像素模仿进行操作,呈现出因果事件的纹理,而未理解其底层逻辑。相比之下,Sora-2 展现出同步的概况(显式:51.2%,隐式:61.6%)。这种相关性表明,随着模型向真正的“世界模拟器” (World Models) 扩展,其生成动作越来越建立在显式掌握因果定律的基础上,标志着从表面合成向物理一致模拟的转变。

第 7 页

视频思维:视频生成器真的能对现实世界进行推理吗?

表 3:隐式生成动作任务上的得分(%)。红色表示更好的平均(AVG)性能。

\begin{tabular}{l c c c c c c c c c c c} \multicolumn{1}{c}{} & \multicolumn{5}{c}{自然科学} & \multicolumn{5}{c}{社会学与人文} & \multicolumn{1}{c}{} \\ \cline{2-6} \cline{7-11} \multicolumn{1}{c}{} & 物理 & 自然 & 材料 & 场 & AVG & 交通 & 生命 & 职业 & 公共 & 体育 & AVG \\ 模型 & & & & & & & & & & & \\ \hline Wan-2.2-14B [6] & 52.1 & 27.0 & 48.5 & 49.5 & 38.6 & 51.1 & 29.7 & 33.3 & 30.0 & 46.0 & 44.3 \\ Hunyuan-1.5 [4] & 44.4 & 33.8 & 39.8 & 47.7 & 41.2 & 42.9 & 46.0 & 48.4 & 34.0 & 34.5 & 44.0 \\ Veo-3.1 [5] & 60.6 & 58.1 & 51.6 & 54.0 & 57.0 & 49.1 & 69.8 & 67.4 & 61.3 & 55.3 & 60.8 \\ Sora-2 [3] & 56.9 & 59.0 & 59.3 & 55.7 & 57.7 & 60.6 & 73.0 & 65.1 & 69.8 & 52.0 & 65.6 \\ \end{tabular}

图 5:音频交集视频(Audio∩Video)、纯视频(Video)和纯音频(Audio)的比较。实证结果表明,音频准确率显著高于视频准确率。这表明模型能够语义化地描述结果,但在物理生成方面却失败了。

图 6:隐式生成动作任务上 Gemini-3-Pro 评分(蓝色)与人类专家评分(绿色)的对齐分析。该图展示了视频样本的分数分布。皮尔逊相关系数高达 0.82,平均绝对差异低至 0.14。

3.3 因果生成双裁判分析

为了更深入地了解“感知-预测鸿沟”背后的潜在机制,并解决潜在的格式混淆因素,我们进行了一系列深入的实验分析。

1. 语言知识与生成动作之间的脱节。为了深入诊断“感知-预测鸿沟”,我们在相同的输入条件下评估模型口头输出与视觉输出之间的一致性。具体而言,我们评估了两个不同通道的生成准确率:纯音频通道(模型是否口头阐述了正确的推理/答案)和纯视频通道(模型是否在物理上渲染了正确的推理)。如图 5 所示的比较结果揭示了一种与指令遵循识别准确率无关的显著音视频不一致(Audio-Visual Misalignment)。我们观察到,音频生成的准确率显著高于视频生成。这表明模型已成功内化描述因果结果所需的语义知识,证明其在理论上“理解”了该场景。然而,这种语义理解未能转化为物理 grounding(物理落地)。模型表现得像“理论上的专家,实践中的新手”,能够口头预测未来,却无法模拟像素级的动态。这一结果表明,当前模型依赖语言先验来解决问题,而不是基于稳健的内部世界模型进行操作。

2. 通过人类对齐验证自动评分的可靠性。为了验证我们 Gemini-3-Pro 评估器的可靠性,我们进行了人类评估对齐研究。三位人类专家盲目地对测试集进行评分,并计算其平均分数以基准化物理性和一致性。结果如图 6 所示,将他们的共识分数与模型的预测进行比较,显示出高度的一致性。我们实现了 0.8205 的皮尔逊相关系数和 0.1468 的平均绝对差异。这些指标证实 Gemini-3-Pro 反映了人类判断,可作为评估的稳健代理。

3. 时间密度与空间分辨率之间的权衡。为了验证 Flatten Temporal Video 的最佳采样策略,我们评估了不同时间粒度下的推理能力。结果如下:

❶ 显式因果理解(5×8 vs. 7×10 vs. 8×12):如图 7 所示,结果显示大多数持续时间呈现出明显的倒 U 型性能曲线,在我们默认的 7 × 10 配置处达到峰值。值得注意的是,将密度增加到 8 × 12 会导致性能下降(例如,Veo-3.1 从 49.9% 降至 43.4%,而 Sora-2 降至 47.4%)。这表明虽然更多的帧在理论上提供了更丰富的时间上下文,但它们引发了严重的视觉压缩,由于单元格分辨率降低,阻碍了从密集网格中提取语义。此外,虽然 5×8 布局有利于短片,但它缺乏较长序列中复杂因果推理所需的时间分辨率。

第 8 页

Zhang 等人

65

57 (%)

49

41

33 性能 (5×8) (7×10) (8×12) (5×8) (7×10) (8×12) (5×8) (7×10) (8×12) (5×8) (7×10) (8×12) (5×8) (7×10) (8×12) (5×8) (7×10) (8×12) 25 短 中 长 平均 Veo-(5×8) 61.5 42.9 38.5 47.6 Veo-(7×10) 52.3 48.0 49.3 49.9 Veo-(8×12) 48.2 46.2 36.0 43.4 Sora-(5×8) 55.6 45.5 46.2 49.1 Sora-(7×10) 52.5 49.5 51.5 51.2 Sora-(8×12) 50.0 43.8 48.3 47.4

图 7:不同空间网格布局和视频时长下的性能比较。柱状图和表格展示了 Veo-3.1 和 Sora-2 在三种特定展平策略下的显式因果理解准确率:5 × 8(稀疏)、7 × 10(平衡)和 8 × 12(密集)。7 × 10 设置在所有类别中产生了最佳的平均性能。

65 与视频”范式,其中生成作为推理的内在 62 组成部分 [12, 51–53]。然而,区分真正的因果理解与单纯的统计记忆 59 仍然是一个关键挑战,因为传统指标不成比例地 56 偏向感知保真度而非逻辑一致性。 现有推理基准中的鸿沟。新兴 53 基准评估各种推理方面,从基于规则 性能 50 的动力学 [54–56] 到开放式视觉推理 [15, 52, 57] 1 张图片 4 张图片 7 张图片 10 张图片 Veo-3.1 54.8 57.2 58.9 56.7 和特定任务 [13]。尽管最近的努力试图减轻 Sora-2 60.3 57.5 61.6 59.5 外观偏差 [58–62]。然而,依赖基本任务, 它们无法验证物理和社会动力学。通过孤立地评估 图 8:动作任务中不同输入下的性能比较。结果表明,7 张图片产生了 判别和生成,它们忽视了表面层输出与真正因果理解之间的差距。 最高的保真度,优于稀疏和密集 为了解决当前因果评估中的关键空白,并与现有方法形成对比,我们引入了因果生成双裁判 (CGDJ) 框架。与以往的工作不同,CGDJ 通过两种互补的模式联合评估内部一致性:显式因果理解和隐式生成动作。通过构建因果生成评估基准,我们提供了一个严格的测试平台,以区分视频生成模型是否真正内化了支配其渲染场景的物理定律和因果结构。

5 结论 我们重新定义使用视频生成模型进行推理为视频思维,并引入因果生成双裁判 (CGDJ) 来评估当前的生成器是否支持这一范式。通过联合考察显式因果感知和隐式生成预测,我们揭示了一个明显的感知-预测鸿沟:模型可能会生成看似合理的视觉动力学,而缺乏可靠的因果感知;而更强大的系统则在推理和生成之间显示出早期但有限的对齐。我们进一步发现了音视频不一致现象,即口头化的因果知识并不一定转化为一致的视频延续。最终,CGDJ 倡导将视频生成评估从感知保真度转向因果一致性,为基于现实、具备推理能力的世界模型提供诊断见解。

❷隐式生成动作(1 vs. 4 vs. 7 vs. 10 张图片): 如图 8 所示,比较结果证实 7 张图片代表最佳提示,优于稀疏(1、4 张图片)和密集(10 张图片)输入。较少帧数下的较低分数表明运动模糊,即模型缺乏足够的时序向量来推断未来状态。相反,10 帧时的轻微下降指向上下文冗余,其中高度压缩的关键帧引入了空间噪声,淹没了视觉编码器的语义特征提取。

总之,这些发现证实我们选择的配置(7 × 10 网格和 7 帧)在保持空间保真度和编码足够时序动力学之间取得了最佳平衡,这对于稳健的模拟是必需的。

4 相关工作 迈向“与视频思考”。视频生成模型的最新进展已从高保真纹理合成演变为复杂的时空动力学建模 [48–50]。这一进展支持将视频生成器概念化为初具规模的通用世界模拟器,并促进了“与视频思考”范式,其中生成作为推理的内在组成部分 [12, 51–53]。然而,区分真正的因果理解与单纯的统计记忆仍然是一个关键挑战,因为传统指标不成比例地偏向感知保真度而非逻辑一致性。

现有推理基准中的鸿沟。新兴基准评估各种推理方面,从基于规则的动力学 [54–56] 到开放式视觉推理 [15, 52, 57] 和特定任务 [13]。尽管最近的努力试图减轻外观偏差 [58–62]。然而,依赖基本任务,它们无法验证物理和社会动力学。通过孤立地评估判别和生成,它们忽视了表面层输出与真正因果理解之间的差距。

为了解决当前因果评估中的关键空白,并与现有方法形成对比,我们引入了因果生成双裁判 (CGDJ) 框架。与以往的工作不同,CGDJ 通过两种互补的模式联合评估内部一致性:显式因果理解和隐式生成动作。通过构建因果生成评估基准,我们提供了一个严格的测试平台,以区分视频生成模型是否真正内化了支配其渲染场景的物理定律和因果结构。

5 结论 我们重新定义使用视频生成模型进行推理为视频思维,并引入因果生成双裁判 (CGDJ) 来评估当前的生成器是否支持这一范式。通过联合考察显式因果感知和隐式生成预测,我们揭示了一个明显的感知-预测鸿沟:模型可能会生成看似合理的视觉动力学,而缺乏可靠的因果感知;而更强大的系统则在推理和生成之间显示出早期但有限的对齐。我们进一步发现了音视频不一致现象,即口头化的因果知识并不一定转化为一致的视频延续。最终,CGDJ 倡导将视频生成评估从感知保真度转向因果一致性,为基于现实、具备推理能力的世界模型提供诊断见解。

第 9 页

视频思维:视频生成器真的能对现实世界进行推理吗?

参考文献 arXiv 预印本 arXiv:2511.13704, 2025. [1] Junru Lu, Jiarui Qin, Lingfeng Qiao, Yinghui Li, Xinyi Dai, Bo Ke, Jianfeng [16] Gemini Robotics Team, Coline Devin, Yilun Du, Debidatta Dwibedi, Ruiqi Gao, He, Ruizhi Qiao, Di Yin, Xing Sun, Yunsheng Wu, Yinsong Liu, Shuangyin Liu, Abhishek Jindal, Thomas Kipf, Sean Kirmani, Fangchen Liu, Anirudha Majumdar, Mingkong Tang, Haodong Lin, Jiayi Kuang, Fanxu Meng, Xiaojuan Tang, Yunjia et al. Evaluating gemini robotics policies in a veo world simulator. arXiv preprint Xi, Junjie Huang, Haotong Yang, Zhenyi Shen, Yangning Li, Qianwen Zhang, arXiv:2512.10675, 2025. Yifei Yu, Siyu An, Junnan Dong, Qiufeng Wang, Jie Wang, Keyu Chen, Wei Wen, [17] Jingxuan Wei, Caijun Jia, Xi Bai, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Taian Guo, Zhifeng Shen, Daohai Yu, Jiahao Li, Ke Li, Zongyi Li, and Xiaoyu Tan. Yu, Conghui He, Lijun Wu, and Cheng Tan. Ggbench: A geometric generative Youtu-llm: Unlocking the native agentic potential for lightweight large language reasoning benchmark for unified multimodal models. In Proceedings of the models, 2026. URL https://arxiv.org/abs/2512.24618. IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 5199– [2] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej 5210, 2026. Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, et al. [18] Xu Liu, Yongheng Zhang, Qiguang Chen, Yao Li, Sheng Wang, and Libo Qin. Let’s Stable video diffusion: Scaling latent video diffusion models to large datasets. think with images efficiently! an interleaved-modal chain-of-thought reasoning arXiv preprint arXiv:2311.15127, 2023. framework with dynamic and precise visual thoughts. In Proceedings of the AAAI [3] OpenAI. Sora 2. https://openai.com/index/sora-2, 2025. Conference on Artificial Intelligence, volume 40, pages 32213–32221, 2026. [4] Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack [19] Shaowei Liu, Zhongzheng Ren, Saurabh Gupta, and Shenlong Wang. Physgen: Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, Linus, Patrol, Peizhen Zhang, Peng Rigid-body physics-grounded image-to-video generation. In European Conference Chen, Penghao Zhao, Qi Tian, Songtao Liu, Weijie Kong, Weiyan Wang, Xiao on Computer Vision, pages 360–378. Springer, 2024. He, Xin Li, Xinchi Deng, Xuefei Zhe, Yang Li, Yanxin Long, Yuanbo Peng, Yue [20] Minghui Lin, Xiang Wang, Yishan Wang, Shu Wang, Fengqi Dai, Pengxiang Ding, Wu, Yuhong Liu, Zhenyu Wang, Zuozhuo Dai, Bo Peng, Coopers Li, Gu Gong, Cunxiang Wang, Zhengrong Zuo, Nong Sang, Siteng Huang, et al. Exploring Guojian Xiao, Jiahe Tian, Jiaxin Lin, Jie Liu, Jihong Zhang, Jiesong Lian, Kaihang the evolution of physics cognition in video generation: A survey. arXiv preprint Pan, Lei Wang, Lin Niu, Mingtao Chen, Mingyang Chen, Mingzhe Zheng, Miles arXiv:2503.21765, 2025. Yang, Qiangqiang Hu, Qi Yang, Qiuyong Xiao, Runzhou Wu, Ryan Xu, Rui Yuan, [21] Tim Salimans, Ian Goodfellow, Wojciech Zaremba, Vicki Cheung, Alec Rad- Shanshan Sang, Shisheng Huang, Siruis Gong, Shuo Huang, Weiting Guo, Xiang ford, and Xi Chen. Improved techniques for training gans. Advances in neural Yuan, Xiaojia Chen, Xiawei Hu, Wenzhi Sun, Xiele Wu, Xianshun Ren, Xiaoyan information processing systems, 29, 2016. Yuan, Xiaoyue Mi, Yepeng Zhang, Yifu Sun, Yiting Lu, Yitong Li, You Huang, [22] Thomas Unterthiner, Sjoerd van Steenkiste, Karol Kurach, Raphaël Marinier, Yu Tang, Yixuan Li, Yuhang Deng, Yuan Zhou, Zhichao Hu, Zhiguang Liu, Zhihe Marcin Michalski, and Sylvain Gelly. FVD: A new metric for video generation, Yang, Zilin Yang, Zhenzhi Lu, Zixiang Zhou, and Zhao Zhong. Hunyuanvideo 2019. URL https://openreview.net/forum?id=rylgEULtdN. 1.5 technical report, 2025. URL https://arxiv.org/abs/2511.18870. [23] Songwei Ge, Aniruddha Mahapatra, Gaurav Parmar, Jun-Yan Zhu, and Jia-Bin [5] Google. Veo 3. https://aistudio.google.com/models/veo-3, 2025. Huang. On the content bias in fréchet video distance. In Proceedings of the [6] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 7277– Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng 7288, 2024. Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu [24] Tarun Gupta, Wenbo Gong, Chao Ma, Nick Pawlowski, Agrin Hilmkil, Meyer Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Scetbon, Marc Rigter, Ade Famoti, Ashley Juan Llorens, Jianfeng Gao, et al. The Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, essential role of causality in foundation world models for embodied ai. arXiv Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng preprint arXiv:2402.06665, 2024. Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming [25] Gowthami Somepalli, Vasu Singla, Micah Goldblum, Jonas Geiping, and Tom Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Goldstein. Diffusion art or digital forgery? investigating data replication in Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao diffusion models. In Proceedings of the IEEE/CVF conference on computer vision Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, and Ziyu and pattern recognition, pages 6048–6058, 2023. Liu. Wan: Open and advanced large-scale video generative models, 2025. URL [26] Karthik Valmeekam, Matthew Marquez, Alberto Olmo, Sarath Sreedharan, and https://arxiv.org/abs/2503.20314. Subbarao Kambhampati. Planbench: An extensible benchmark for evaluating [7] Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing large language models on planning and reasoning about change. Advances in Huang, Jiayi Kuang, Siyu Chen, Ao Shen, Hao Wu, et al. From chatbot to digital Neural Information Processing Systems, 36:38975–38987, 2023. colleague: The paradigm shift toward persistent autonomous ai. arXiv preprint [27] Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, and Robert Geirhos. arXiv:2606.14502, 2026. Do generative video models understand physical principles? In Proceedings of the [8] Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, et al. World simulation 2026. with video foundation models for physical ai. arXiv preprint arXiv:2511.00062, [28] Hao Wu, Yuqi Li, Yuan Gao, Fan Xu, Fan Zhang, Kun Wang, Penghao Zhao, 2025. Qiufeng Wang, Yizhou Zhao, Weiyan Wang, Yingli Tian, Xian Wu, and Xiaomeng [9] Jingtao Ding, Yunke Zhang, Yu Shang, Yuheng Zhang, Zefang Zong, Jie Feng, Huang. Roboalign-r1: Distilled multimodal reward alignment for robot video Yuan Yuan, Hongyuan Su, Nian Li, Nicholas Sukiennik, et al. Understanding world models, 2026. URL https://arxiv.org/abs/2605.03821. world or predicting future? a comprehensive survey of world models. ACM [29] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Computing Surveys, 58(3):1–38, 2025. Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, et al. Vbench: [10] Hritik Bansal, Clark Peng, Yonatan Bitton, Roman Goldenberg, Aditya Grover, Comprehensive benchmark suite for video generative models. In Proceedings and Kai-Wei Chang. Videophy-2: A challenging action-centric physical com- of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages monsense evaluation in video generation. arXiv preprint arXiv:2503.06800, 2025. 21807–21818, 2024. [11] Yinghui Li, Qingyu Zhou, Yangning Li, Zhongli Li, Ruiyang Liu, Rongyi Sun, [30] Yaofang Liu, Xiaodong Cun, Xuebo Liu, Xintao Wang, Yong Zhang, Haoxin Zizhen Wang, Chao Li, Yunbo Cao, and Hai-Tao Zheng. The past mistake is the Chen, Yang Liu, Tieyong Zeng, Raymond Chan, and Ying Shan. Evalcrafter: future wisdom: Error-driven contrastive probability optimization for chinese Benchmarking and evaluating large video generation models. In Proceedings spell checking. In Findings of the Association for Computational Linguistics: ACL of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 2022, pages 3202–3213, 2022. 22139–22149, 2024. [12] Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming [31] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, et al. Think- Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, et al. Video generation models ing with video: Video generation as a promising multimodal reasoning paradigm. as world simulators. OpenAI Blog, 1(8):1, 2024. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recog- [32] Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, and Dimitris Samaras. What nition, pages 41121–41129, 2026. about gravity in video generation? post-training newton’s laws with verifiable [13] Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, rewards. arXiv preprint arXiv:2512.00425, 2025. Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, et al. Reasoning via video: [33] Kaiyue Sun, Kaiyi Huang, Xian Liu, Yue Wu, Zihan Xu, Zhenguo Li, and Xihui The first evaluation of video models’ reasoning abilities through maze-solving Liu. T2v-compbench: A comprehensive benchmark for compositional text-to- tasks. arXiv preprint arXiv:2511.15065, 2025. video generation. In Proceedings of the Computer Vision and Pattern Recognition [14] Wei Chow, Jiachun Pan, Yongyuan Liang, Mingze Zhou, Xue Song, Liyu Jia, Sain- Conference, pages 8406–8416, 2025. ing Zhang, Siliang Tang, Juncheng Li, Fengda Zhang, et al. Weave: Unleashing [34] Vipula Rawte, Sarthak Jain, Aarush Sinha, Garv Kaushik, Aman Bansal, Prathik- and benchmarking the in-context interleaved comprehension and generation. sha Rumale Vishwanath, Samyak Rajesh Jain, Aishwarya Naresh Reganti, Vinija arXiv preprint arXiv:2511.11434, 2025. Jain, Aman Chadha, et al. Vibe: A text-to-video benchmark for evaluating hal-

[15] Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, 等. Tivibench: 针对视频生成模型的“视频思维”推理基准测试. 在 Proceedings of the 5th Workshop on Trustworthy NLP (TrustNLP 2025) 中, 第 232–246 页, 2025.

[35] David Ha 和 Jürgen Schmidhuber. World models. arXiv 预印本 arXiv:1803.10122, 2(3), 2018.

第 10 页

张等人

[36] Yann LeCun。通往自主机器智能之路 0.9 版。2, Srivastava, Anushree Agrawal, Arun Vijayvergiya, Ashley Tyra, Ashvin Nair, 2022-06-27。Open Review, 62(1):1–62, 2022。 Avi Nayak, Ben Eggers, Bessie Ji, Beth Hoover, Bill Chen, Blair Chen, Boaz [37] Ning Li, Jingran Zhang, 和 Justin Cui。我们是否统一了图像生成和 Barak, Borys Minaiev, Botao Hao, Bowen Baker, Brad Lightcap, Brandon McK- 理解?关于 gpt-4o 图像生成能力的实证研究。arXiv inzie, Brandon Wang, Brendan Quinn, Brian Fioca, Brian Hsu, Brian Yang, Brian 预印本 arXiv:2504.08003, 2025。 Yu, Brian Zhang, Brittany Brenner, Callie Riggins Zetino, Cameron Raymond, [38] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Camillo Lugaresi, Carolina Paz, Cary Hudson, Cedric Whitney, 以及等人。Openai Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, 等人。Video-mme: gpt-5 系统卡片, 2025。URL https://arxiv.org/abs/2601.03267. 首个全面的视频分析多模态 MLLM 评估基准。在计算机视觉与模式识别会议论文集, [48] Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming 页码 24108–24118, 2025。 Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, [39] Piyush Bagad, Makarand Tapaswi, Cees GM Snoek, 和 Andrew Zisserman。水 Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, 和 Sen He。扩展零样本 的声音:从倒液体中推断物理属性。在 ICASSP [49] Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong 2025-2025 IEEE 国际声学、语音和信号处理会议 Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, 和 (ICASSP), 页码 1–5。IEEE, 2025。 Min Zhang。奖励强制:通过奖励分布匹配蒸馏实现高效流式视频生成, 2025。URL https://arxiv.org/abs/2512.04678. [40] Daniel M Bear, Elias Wang, Damian Mrowca, Felix J Binder, Hsiao-Yu Fish Tung, 2025。URL https://arxiv.org/abs/2512.04678. RT Pramod, Cameron Holdaway, Sirui Tao, Kevin Smith, Fan-Yun Sun, 等人。 [50] Wuyang Li, Wentao Pan, Po-Chien Luan, Yang Gao, 和 Alexandre Alahi。Stable Physion:评估人类和机器从视觉中进行物理预测的能力。 video infinity:通过错误回收实现无限长度视频生成。arXiv arXiv 预印本 arXiv:2106.08261, 2021。 预印本 arXiv:2510.09212, 2025。 [41] Jinhao Chai, Shiyi Mu, 和 Shugong Xu。Tld:车辆尾灯信号数据集 [51] Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan 和基准。arXiv 预印本 arXiv:2409.02508, 2024。 Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, 等人。Longvt:通过原生工具调用激励“ [42] Will Kay, Joao Carreira, Karen Simonyan, Brian Zhang, Chloe Hillier, Sudheendra 视频思维”。arXiv 预印本 arXiv:2511.20785, Vijayanarasimhan, Fabio Viola, Tim Green, Trevor Back, Paul Natsev, 等人。The 2025。 kinetics 人类动作视频数据集。arXiv 预印本 arXiv:1705.06950, 2017。 [52] Yang Luo, Xuanlei Zhao, Baijiong Lin, Lingting Zhu, Liyao Tang, Yuqi Liu, Ying- [43] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Cong Chen, Shengju Qian, Xin Wang, 和 Yang You。V-reasonbench:面向 Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, 视频生成模型统一推理基准套件, 2025。URL 等人。Ego4d:3000 小时自我中心视频环游世界。在 IEEE/CVF 计算机视觉与模式识别会议论文集, https://arxiv.org/abs/2511.16668. 页码 18995–19012, 2022。 [53] Yongheng Zhang, Xu Liu, Ruihan Tao, Qiguang Chen, Hao Fei, Wanxiang Che, [44] Gemma Team, Aishwarya Kamath, Johan Ferret, Shreya Pathak, Nino Vieil- and Libo Qin。Vitcot:视频-文本交错的思维链,用于提升 lard, Ramona Merhej, Sarah Perrin, Tatiana Matejovicova, Alexandre Ramé, 大语言模型中的视频理解能力。在第 33 届 ACM Morgane Rivière, Louis Rouillard, Thomas Mesnard, Geoffrey Cideron, Jean [54] Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, bastien Grill, Sabela Ramos, Edouard Yvinec, Michelle Casbon, Etienne Pot, Ivo Di Weng, Haifeng Liu, Can Ye, 和 Boxi Wu。Ruler-bench:探测下一代视频生成模型的基于规则的 Penchev, Gaël Liu, Francesco Visin, Kathleen Kenealy, Lucas Beyer, Xiaohai 推理能力,用于视觉基础智能, 2025。URL https://arxiv.org/abs/2512.02622. Zhai, Anton Tsitsulin, Robert Busa-Fekete, Alex Feng, Noveen Sachdeva, Ben- 智能, 2025。URL https://arxiv.org/abs/2512.02622. jamin Coleman, Yi Gao, Basil Mustafa, Iain Barr, Emilio Parisotto, David Tian, [55] Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, 和 Yuzhang Shang。 Matan Eyal, Colin Cherry, Jan-Thorsten Peter, Danila Sinopalnikov, Surya Bhu- 世界模拟器能推理吗?gen-vire:一个生成式视觉推理基准, patiraju, Rishabh Agarwal, Mehran Kazemi, Dan Malkin, Ravin Kumar, David 2025。URL https://arxiv.org/abs/2511.13853. Vilar, Idan Brusilovsky, Jiaming Luo, Andreas Steiner, Abe Friesen, Abhanshu [56] Yongheng Zhang, Xu Liu, Ruoxi Zhou, Qiguang Chen, Hao Fei, Wenpeng Lu, Sharma, Abheesht Sharma, Adi Mayrav Gilady, Adrian Goedeckemeyer, Alaa and Libo Qin。CCHall:一种用于检测大语言模型中联合跨语言和跨模态 Saade, Alex Feng, Alexander Kolesnikov, Alexei Bendebury, Alvin Abdagic, Amit 幻觉的新基准。在 Wanxiang Che, Vadi, András György, André Susano Pinto, Anil Das, Ankur Bapna, Antoine Joyce Nabende, Ekaterina Shutova, 和 Mohammad Taher Pilehvar, 编辑, Miech, Antoine Yang, Antonia Paterson, Ashish Shenoy, Ayan Chakrabarti, Bilal 计算语言学协会第 63 届年会论文集(第 1 卷:长论文), 页码 30728–30749, 维也纳, 奥地利, 2025 年 7 月。 Piot, Bo Wu, 和 Bobak Shahriari 等人。Gemma 3 技术报告, 2025。URL 计算语言学协会。ISBN 979-8-89176-251-0。doi: 10. https://arxiv.org/abs/2503.19786。 18653/v1/2025.acl-long.1485。URL https://aclanthology.org/2025.acl-long.1485/. [45] Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, [57] Libo Qin, Qiguang Chen, Xiachong Feng, Yang Wu, Yongheng Zhang, Yinghui and Ilya Sutskever。通过大规模弱监督实现鲁棒的语音识别。 Li, Min Li, Wanxiang Che, 和 Philip S Yu。大语言模型遇见 NLP:一项 在国际机器学习会议论文集, 页码 28492–28518。PMLR, 2023。 综述。Frontiers of Computer Science, 20(11):2011361, 2026。 [46] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, [58] Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, [59] Hokin Deng。视频模型开始解决国际象棋、迷宫、数独、心理旋转, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, 和瑞文矩阵。arXiv 预印本 arXiv:2512.05969, 2025。 Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, [60] Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, 和 Philip S Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, 和等人。Qwen3-vl Yu。用于视频推理的潜在视觉缓存。arXiv 预印本 arXiv:2607.02607, 技术报告, 2025。URL https://arxiv.org/abs/2511.21631。 2026。 [47] Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El- [61] Zefan Cai, Haoyi Qiu, Tianyi Ma, Haozhe Zhao, Gengze Zhou, Kung-Hsiang Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, Akshay Huang, Parisa Kordjamshidi, Minjia Zhang, Xiao Wen, Jiuxiang Gu, 等人。Mmgr: Nathan, Alan Luo, Alec Helyar, Aleksander Madry, Aleksandr Efremov, Aleksan- 多模态生成式推理。arXiv 预印本 arXiv:2512.14691, 2025。 dra Spyra, Alex Baker-Whitcomb, Alex Beutel, Alex Karpenko, Alex Makelov, [62] Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Alex Neitz, Alex Wei, Alexandra Barr, Alexandre Kirchmeyer, Alexey Ivanov, Wayne Xin Zhao, 和 Minghui Qiu。超越最后一帧:面向生成式视频推理的过程感知 Alexi Christakis, Alistair Gillespie, Allison Tam, Ally Bennett, Alvin Wan, Alyssa 评估, 2026。URL https://arxiv.org/abs/2512. Huang, Amy McDonald Sandjideh, Amy Yang, Ananya Kumar, Andre Saraiva, 24952。 Andrea Vallone, Andrei Gheorghe, Andres Garcia Garcia, Andrew Braunstein, [63] Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Andrew Liu, Andrew Schmidt, Andrey Mereskin, Andrey Mishchenko, Andy Wayne Xin Zhao, 和 Minghui Qiu。超越最后一帧:面向生成式视频推理的过程感知 Applebaum, Andy Rogerson, Ann Rajan, Annie Wei, Anoop Kotha, Anubha 评估, 2026。URL https://arxiv.org/abs/2512. Sharma, Abheesht Sharma, Adi Mayrav Gilady, Adrian Goedeckemeyer, Alaa 24952。

发表评论