快速导读:当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。
WorldExam 是一个面向视频世界模型的层次化诊断基准,包含 1,474 个测试案例,覆盖相机驱动、动作驱动和语言驱动三种主流范式。其核心贡献在于将评估从传统的视觉质量和显式指令遵循,拓展到“内在反应性”——模型能否从场景状态中推断出未在输入中明确描述的合理后果。
该基准定义了四级诊断层次:视觉质量、控制遵循、空间一致性和世界反应性,分别通过八项任务实例化。评测采用基于几何的指标(恢复的相机/主体轨迹、地形几何)和 VLM 检查表评分,并在相机驱动模型间引入图像空间位移对齐以保证公平比较。
英文题目:WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
论文出处:arXiv 每日论文精选 · arXiv:2608.02603
原始论文:PDF / 论文页面
这篇论文解决什么问题?
当前的可控视频生成模型越来越多地被用作世界模型,期望它们能从初始观测和控制指令中预测未来的视觉状态。然而,现有基准主要评估布局控制精度、动作保真度或提示指定的交互结果,并未系统测试模型能否推断出由场景状态隐含决定的反应。
例如,当指令只要求“向前走”时,一个真正理解世界的模型应该能根据前方是平地还是楼梯,自动生成行走或攀爬的动作。这种“场景条件化反应”是衡量模型是否具备世界理解能力的关键,但此前缺乏专门的评测手段。
WorldExam 的定位正是填补这一空白:它不仅考察模型能否执行显式指令,更考察模型能否理解场景隐含的物理约束和因果逻辑,从而生成合理的、未在输入中陈述的后果。
核心创新
方法概览
当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。
- 四级诊断层次:视觉质量层使用任务无关的通用指标评估所有生成视频;控制遵循层通过 Camera Control 和 Subject Control 任务评估模型对相机轨迹和主体动作的执行精度;空间一致性层通过 Scene Revisit 任务评估模型在相机运动后恢复一致场景视图的能力;世界反应性层包含 Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction 和 Goal Completion 五项任务,评估模型推断场景条件化反应的能力。
- 原子控制单元适配:WorldExam 将基本控制动作(前进、平移、旋转等)适配到三种模型接口。相机驱动模型接收 SE(3) 轨迹,动作驱动模型接收离散动作序列,语言驱动模型接收自然语言描述。对于反应性任务,模型输入仅指定显式控制或目标,场景条件化反应被有意省略。
- 图像空间位移对齐:不同相机驱动模型对相同输入平移量的图像空间响应差异显著。WorldExam 通过校准流程测量每个模型在默认输入下的图像空间位移,并据此缩放输入平移量,使所有模型产生对齐的图像空间位移,确保公平比较。
- 基于几何的评估:对于 Subject Control 和 Terrain Interaction 任务,使用 SAM2 和 VGGT-Ω 恢复主体轨迹,通过水平区域掩码估计重力方向和水平面,再将轨迹沿重力方向投影到由主体移除图像恢复的完整地形几何上,从而获得地形轨迹并计算控制精度和地形交互指标。
- VLM 检查表评估:对于语义反应任务(Object Interaction、Social Interaction、Physical Reaction、Goal Completion),使用 GPT-5.5 根据预定义检查表对生成视频进行逐项评分。检查表包含场景条件化反应的关键要素,评估结果与人类判断的 Spearman's ρ 平均达到 0.81,PLCC 平均达到 0.82。
- 测试案例构建:动态交互轨道的六项任务采用结构化流程:从任务模式扩展为结构化草稿,生成候选初始图像并经人工筛选,再根据选定图像细化场景描述、文本提示和可选检查表,最终形成测试案例。基准覆盖第一/第三人称视角、人/动物/车辆/机器人主体、多样化的室内外场景和地形类型。
逐图理解论文
研究空白与核心区分

当前世界模型基准存在一个关键盲区:它们要么评估视觉质量,要么检查模型是否执行了输入中明确写出的指令。但真正的世界理解,恰恰体现在那些“没说出口”的部分——场景本身隐含的物理约束和因果逻辑。WorldExam 的核心区分就在这里:它将评估从“显式指令遵循”推进到“内在反应性”,考察模型能否从场景状态中推断出未在输入中陈述的合理后果。
论文的贡献与评测方法

WorldExam 构建了一个四级诊断层次:从视觉质量、控制遵循、空间一致性,一直到世界反应性,通过八项任务实例化。关键设计在于,对于反应性任务,模型输入只给出显式控制或目标,场景条件化的反应被有意省略。评估手段也做了相应创新:控制类任务用基于几何的评估,通过恢复 3D 轨迹和地形几何来精确衡量;反应类任务则用 VLM 检查表评分,让 GPT-5.5 根据预定义检查表逐项判断。此外,论文还引入了图像空间位移对齐,校准不同相机驱动模型对输入平移的响应差异,确保公平比较。
核心发现

图 8 直观呈现了三种范式模型在八项任务上的能力分裂:相机驱动模型在 Camera Control 和 Scene Revisit 上表现突出,但在动态交互任务上完全缺失;动作和语言驱动模型各有优势但均不全面。
意义与局限

图 1 展示了 WorldExam 的整体框架:从表观外观到内在反应性的四级诊断层次,覆盖相机、动作和语言三种驱动接口,包含 1,474 个测试案例。注意观察四个层次如何从视觉质量逐步深入到世界反应性。
实验如何设计?
- 静态场景轨道评估了 20 个代表性模型,包括 6 个相机驱动模型、7 个动作驱动模型和 7 个语言驱动模型,任务为 Camera Control 和 Scene Revisit。
- 动态交互轨道评估了 9 个兼容模型,包括 2 个动作驱动模型和 7 个语言驱动模型,任务涵盖 Subject Control 和五项世界反应性任务。相机驱动模型因接口限制被排除在此轨道外。
- 分析了输入平移乘数对 NeoVerse 性能的影响,乘数从 1× 变化到 4×,仅应用于 SE(3) 轨迹的平移分量,旋转分量保持不变。
- 通过 800 个实例的人类评估验证了 VLM 检查表评分的可靠性,计算了 Spearman's ρ 和 PLCC 相关系数。
- 使用 DA3 重新计算静态场景和动态交互轨道的指标,以评估度量鲁棒性。
关键结果与论文证据
- 静态场景轨道上,NeoVerse 以 97.33 的 Camera Control 分数和 89.25 的 Scene Revisit 分数领先,任务平均分 93.29,综合得分 85.39(第 12 页)。
- 动作驱动模型中,WorldPlay 表现最佳,Camera Control 分数 92.74,Scene Revisit 分数 72.51,任务平均分 82.63(第 12 页)。
- 语言驱动模型中,Hailuo 2.3 以 63.29 的 Camera Control 分数和 48.70 的 Scene Revisit 分数领先,任务平均分 55.99(第 12 页)。
- 将 NeoVerse 的输入平移乘数从 1× 增加到 4× 时,Camera Control 分数从 97.33 降至 43.67,Scene Revisit 分数从 89.25 降至 42.18,表明输入平移校准对公平比较至关重要(第 13 页)。
- 动态交互轨道上,语言驱动模型在世界反应性任务上普遍优于动作驱动模型;WorldPlay 在 Subject Control 上达到 82.63,但反应性分数较低,揭示了控制精度与反应性之间的能力分裂(第 14 页)。
- VLM 检查表评估在所有任务上的 Spearman's ρ ≥ 0.72,PLCC ≥ 0.74,800 个实例的平均 ρ 为 0.81,PLCC 为 0.82,验证了自动化评估的可靠性(第 14 页)。
- 综合来看,三种范式呈现明显的能力互补但均不完整:相机驱动模型控制精度最高但不支持动态交互,动作驱动模型主体控制精确但反应性不足,语言驱动模型交互和目标任务表现更好但控制遵循较弱(第 14 页图 8)。
阅读时需要注意
- 动态交互轨道排除了相机驱动模型和部分动作驱动模型,无法实现完全统一的跨范式比较。
- VLM 检查表评估可能继承评判模型 GPT-5.5 的偏差。
- 基于几何的评估依赖 SAM2 跟踪和 VGGT-Ω 重建的精度,在挑战性案例中可能失败。
- 基准聚焦于短视频片段(100-200 帧),未评估长时记忆或持久世界模拟能力。
关联工作
- WorldScore 评估相机轨迹布局控制和几何一致性,WorldExam 在此基础上扩展到内在反应性和多范式支持。
- MIND 关注动作控制和闭环重访一致性,WorldExam 增加了场景条件化反应任务。
- Omni-WorldBench 评估提示指定的交互结果,WorldExam 有意省略被评估的反应以测试内在反应性。
- WorldMark 标准化动作表示以支持跨模型比较,WorldExam 将原子控制适配到各模型的本地接口。