WorldExam:从表观外观到内在反应性的世界模型基准评测

快速导读:当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。

WorldExam 是一个面向视频世界模型的层次化诊断基准,包含 1,474 个测试案例,覆盖相机驱动、动作驱动和语言驱动三种主流范式。其核心贡献在于将评估从传统的视觉质量和显式指令遵循,拓展到“内在反应性”——模型能否从场景状态中推断出未在输入中明确描述的合理后果。

该基准定义了四级诊断层次:视觉质量、控制遵循、空间一致性和世界反应性,分别通过八项任务实例化。评测采用基于几何的指标(恢复的相机/主体轨迹、地形几何)和 VLM 检查表评分,并在相机驱动模型间引入图像空间位移对齐以保证公平比较。

英文题目:WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

论文出处:arXiv 每日论文精选 · arXiv:2608.02603

原始论文:PDF / 论文页面

这篇论文解决什么问题?

当前的可控视频生成模型越来越多地被用作世界模型,期望它们能从初始观测和控制指令中预测未来的视觉状态。然而,现有基准主要评估布局控制精度、动作保真度或提示指定的交互结果,并未系统测试模型能否推断出由场景状态隐含决定的反应。

例如,当指令只要求“向前走”时,一个真正理解世界的模型应该能根据前方是平地还是楼梯,自动生成行走或攀爬的动作。这种“场景条件化反应”是衡量模型是否具备世界理解能力的关键,但此前缺乏专门的评测手段。

WorldExam 的定位正是填补这一空白:它不仅考察模型能否执行显式指令,更考察模型能否理解场景隐含的物理约束和因果逻辑,从而生成合理的、未在输入中陈述的后果。

核心创新

方法概览

当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。

  • 四级诊断层次:视觉质量层使用任务无关的通用指标评估所有生成视频;控制遵循层通过 Camera Control 和 Subject Control 任务评估模型对相机轨迹和主体动作的执行精度;空间一致性层通过 Scene Revisit 任务评估模型在相机运动后恢复一致场景视图的能力;世界反应性层包含 Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction 和 Goal Completion 五项任务,评估模型推断场景条件化反应的能力。
  • 原子控制单元适配:WorldExam 将基本控制动作(前进、平移、旋转等)适配到三种模型接口。相机驱动模型接收 SE(3) 轨迹,动作驱动模型接收离散动作序列,语言驱动模型接收自然语言描述。对于反应性任务,模型输入仅指定显式控制或目标,场景条件化反应被有意省略。
  • 图像空间位移对齐:不同相机驱动模型对相同输入平移量的图像空间响应差异显著。WorldExam 通过校准流程测量每个模型在默认输入下的图像空间位移,并据此缩放输入平移量,使所有模型产生对齐的图像空间位移,确保公平比较。
  • 基于几何的评估:对于 Subject Control 和 Terrain Interaction 任务,使用 SAM2 和 VGGT-Ω 恢复主体轨迹,通过水平区域掩码估计重力方向和水平面,再将轨迹沿重力方向投影到由主体移除图像恢复的完整地形几何上,从而获得地形轨迹并计算控制精度和地形交互指标。
  • VLM 检查表评估:对于语义反应任务(Object Interaction、Social Interaction、Physical Reaction、Goal Completion),使用 GPT-5.5 根据预定义检查表对生成视频进行逐项评分。检查表包含场景条件化反应的关键要素,评估结果与人类判断的 Spearman's ρ 平均达到 0.81,PLCC 平均达到 0.82。
  • 测试案例构建:动态交互轨道的六项任务采用结构化流程:从任务模式扩展为结构化草稿,生成候选初始图像并经人工筛选,再根据选定图像细化场景描述、文本提示和可选检查表,最终形成测试案例。基准覆盖第一/第三人称视角、人/动物/车辆/机器人主体、多样化的室内外场景和地形类型。

逐图理解论文

研究空白与核心区分

研究空白与核心区分
Table 1 Comparison with representative world-model benchmarks. The table compares supported model paradigms, viewpoints, task coverage, case counts, and evaluated models. C, A, and L denote camera-, action-, and language-driven model paradigms, respectively. † indicates that the instruction specifies the expected interaction consequence; the corresponding WorldExam tasks leave the evaluated reaction unstated.

当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。

论文的贡献与评测方法

论文的贡献与评测方法
Fig. 2 shows how the four diagnostic levels are instantiated. Visual Quality uses task-agnostic metrics across all videos, while the other three levels are instantiated by eight tasks. Control Adherence includes Camera Control and Subject Control, while Spatial Consistency uses Scene Revisit. World Reactivity includes four reaction-oriented tasks, Terrain Interaction, Object Interaction, Social Interaction, and Physical Reaction, plus Goal Completion for goal-directed execution.

WorldExam 构建了一个四级诊断层次:从视觉质量、控制遵循、空间一致性,一直到世界反应性,通过八项任务实例化。关键设计在于,对于反应性任务,模型输入只给出显式控制或目标,场景条件化的反应被有意省略。评估手段也做了相应创新:控制类任务用基于几何的评估,通过恢复 3D 轨迹和地形几何来精确衡量;反应类任务则用 VLM 检查表评分,让 GPT-5.5 根据预定义检查表逐项判断。此外,论文还引入了图像空间位移对齐,校准不同相机驱动模型对输入平移的响应差异,确保公平比较。

核心发现

核心发现
Figure 8 Task-level performance across evaluation tracks. Two models per interface are compared across all eight tasks, ordered from static-scene diagnostics through Subject Control to World Reactivity; crosses mark unsupported tasks.

图 8 直观呈现了三种范式模型在八项任务上的能力分裂:相机驱动模型在 Camera Control 和 Scene Revisit 上表现突出,但在动态交互任务上完全缺失;动作和语言驱动模型各有优势但均不全面。

意义与局限

意义与局限
Figure 1 Overview of WorldExam. WorldExam is a hierarchical diagnostic benchmark from apparent appearance to inherent reactivity. It evaluates 1,474 test cases across camera-, action-, and language-driven interfaces, four diagnostic

图 1 展示了 WorldExam 的整体框架:从表观外观到内在反应性的四级诊断层次,覆盖相机、动作和语言三种驱动接口,包含 1,474 个测试案例。注意观察四个层次如何从视觉质量逐步深入到世界反应性。

实验如何设计?

  • 静态场景轨道评估了 20 个代表性模型,包括 6 个相机驱动模型、7 个动作驱动模型和 7 个语言驱动模型,任务为 Camera Control 和 Scene Revisit。
  • 动态交互轨道评估了 9 个兼容模型,包括 2 个动作驱动模型和 7 个语言驱动模型,任务涵盖 Subject Control 和五项世界反应性任务。相机驱动模型因接口限制被排除在此轨道外。
  • 分析了输入平移乘数对 NeoVerse 性能的影响,乘数从 1× 变化到 4×,仅应用于 SE(3) 轨迹的平移分量,旋转分量保持不变。
  • 通过 800 个实例的人类评估验证了 VLM 检查表评分的可靠性,计算了 Spearman's ρ 和 PLCC 相关系数。
  • 使用 DA3 重新计算静态场景和动态交互轨道的指标,以评估度量鲁棒性。

关键结果与论文证据

  • 静态场景轨道上,NeoVerse 以 97.33 的 Camera Control 分数和 89.25 的 Scene Revisit 分数领先,任务平均分 93.29,综合得分 85.39(第 12 页)。
  • 动作驱动模型中,WorldPlay 表现最佳,Camera Control 分数 92.74,Scene Revisit 分数 72.51,任务平均分 82.63(第 12 页)。
  • 语言驱动模型中,Hailuo 2.3 以 63.29 的 Camera Control 分数和 48.70 的 Scene Revisit 分数领先,任务平均分 55.99(第 12 页)。
  • 将 NeoVerse 的输入平移乘数从 1× 增加到 4× 时,Camera Control 分数从 97.33 降至 43.67,Scene Revisit 分数从 89.25 降至 42.18,表明输入平移校准对公平比较至关重要(第 13 页)。
  • 动态交互轨道上,语言驱动模型在世界反应性任务上普遍优于动作驱动模型;WorldPlay 在 Subject Control 上达到 82.63,但反应性分数较低,揭示了控制精度与反应性之间的能力分裂(第 14 页)。
  • VLM 检查表评估在所有任务上的 Spearman's ρ ≥ 0.72,PLCC ≥ 0.74,800 个实例的平均 ρ 为 0.81,PLCC 为 0.82,验证了自动化评估的可靠性(第 14 页)。
  • 综合来看,三种范式呈现明显的能力互补但均不完整:相机驱动模型控制精度最高但不支持动态交互,动作驱动模型主体控制精确但反应性不足,语言驱动模型交互和目标任务表现更好但控制遵循较弱(第 14 页图 8)。

阅读时需要注意

  • 动态交互轨道排除了相机驱动模型和部分动作驱动模型,无法实现完全统一的跨范式比较。
  • VLM 检查表评估可能继承评判模型 GPT-5.5 的偏差。
  • 基于几何的评估依赖 SAM2 跟踪和 VGGT-Ω 重建的精度,在挑战性案例中可能失败。
  • 基准聚焦于短视频片段(100-200 帧),未评估长时记忆或持久世界模拟能力。

关联工作

  • WorldScore 评估相机轨迹布局控制和几何一致性,WorldExam 在此基础上扩展到内在反应性和多范式支持。
  • MIND 关注动作控制和闭环重访一致性,WorldExam 增加了场景条件化反应任务。
  • Omni-WorldBench 评估提示指定的交互结果,WorldExam 有意省略被评估的反应以测试内在反应性。
  • WorldMark 标准化动作表示以支持跨模型比较,WorldExam 将原子控制适配到各模型的本地接口。

发表评论