快速导读:PlayWorld 提出用多模态 Agent Player 以长程目标驱动闭环交互来评测视频世界模型,覆盖几何一致性、交互保真度、视野外演化与洞察演化四个维度。
视频世界模型承诺根据用户动作持续生成可交互环境,但如何评测它们一直是个悬而未决的问题。PlayWorld 的核心主张是:评测应该模拟人类玩家,以场景锚定的长程目标驱动闭环交互,而不是执行预定义轨迹。这一视角转变暴露了现有评测范式的根本局限——固定动作序列无法适应不同模型的动作粒度和响应差异,导致跨模型比较不公平。
PlayWorld 构建了 171 个人工标注案例,覆盖 50 种动作模式,每个案例包含初始世界、长程目标和基础动作序列。Agent Player 观察生成帧与动作历史,通过 Keep/Stop/Extend/Correct/End 五类决策在线调整执行,VQA rubric verifier 以样本特定 Yes/No 问题对四个维度打分。该基准在 9 个代表性世界模型上生成了 1400 多个交互视频,揭示了当前模型在几何一致性、交互保真度、视野外演化和洞察演化方面的系统性缺陷。
英文题目:PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
论文出处:arXiv 每日论文精选 · arXiv:2608.13552
原始论文:PDF / 论文页面
这篇论文解决什么问题?
现有世界模型评测基准如 WorldScore、WorldMark 和 WBench 都依赖预定义轨迹:要么是固定相机路径,要么是固定动作序列。这种设计隐含假设所有模型对相同动作的响应方式一致,但实际上不同模型的动作粒度差异巨大。一个模型可能需要 10 步才能完成 360 度旋转,另一个模型可能 3 步就转过了头。用同一套预定义动作序列评测它们,等于用同一把尺子量不同弹性的橡皮筋。
更深层的问题是,预定义轨迹无法覆盖长程交互目标。人类玩家不会机械地执行动作序列,而是带着目标——比如'走到水边'或'绕到房子后面看看'——根据观察不断调整策略。如果评测只关心模型能否跟随预设动作,就无法检验模型在目标驱动下的持续世界建模能力。
PlayWorld 的研究空白正在于此:缺乏一个以人类玩家视角、长程目标驱动的自动化评测协议。这个空白不仅是工程问题,更是认识论问题——我们到底在评测'动作跟随'还是'世界建模'?
核心创新
- 提出 Agent Player 闭环交互范式,以长程目标而非固定轨迹评测世界模型,支持跨模型公平比较
- 设计 Keep/Stop/Extend/Correct/End 五类在线动作调整决策,适应不同模型的动作粒度
- 构建 171 个人工标注案例、50 种动作模式、820+ VQA 问题的 PlayWorld 基准
- 提出四维能力评测框架:geometry consistency、interaction fidelity、out-of-sight evolution、insight evolution
- 引入轨迹验证门控机制,避免指令跟随失败污染能力评分
方法概览
PlayWorld 为每个评测案例提供初始世界、场景锚定的长程目标和基础动作序列;Agent Player 观察生成帧与动作历史,通过 Keep/Stop/Extend/Correct/End 决策在线调整执行;VQA rubric verifier 以样本特定 Yes/No 问题对四个维度打分,并结合轨迹验证门控与基础能力指标。
- 基准构建流程:从多样化初始世界出发,标注者根据场景特定属性定义长程目标,编写基础动作序列,并构建样本特定的 VQA rubric。每个案例的预期轨迹被可视化,作为轨迹验证的参考。
- Agent Player 的决策循环:Agent Player 观察当前生成帧和已执行动作历史,在五个决策中选择——Keep(继续执行当前动作)、Stop(停止当前动作)、Extend(延长当前动作)、Correct(纠正动作方向或幅度)、End(结束当前 rollout)。这种设计使 Agent Player 能够根据模型的实际响应动态调整执行策略。
- 四维评测框架:geometry consistency 评测相机运动与回访时环境结构是否保持一致;interaction fidelity 评测主体与障碍物、水、火等交互的物理合理性;out-of-sight evolution 评测目标离开视野后状态是否持续合理变化;insight evolution 评测固定机位持续观察场景中可见过程的演化。
- VQA rubric verifier:每个案例配有样本特定的 Yes/No 问题,由 Gemini 3.1 Pro 作为评测器对生成视频打分。这种设计避免了通用评测指标无法捕捉场景特定语义的问题。
- 轨迹验证门控:在计算能力评分前,先验证 rollout 是否按预期路径到达目标视角。如果轨迹验证失败,说明是指令跟随问题而非世界建模问题,该 rollout 的能力评分将被排除。这一机制将'控制能力'与'世界建模能力'解耦。
- 基础能力评测:包括 7 项视频质量指标(Aesthetic Quality、Imaging Quality、Motion Smoothness、Temporal Flickering、Temporal Consistency、Depth Stability、Subject Consistency)和 Translation/Rotation Pass Rate,用于衡量模型的基本生成质量与动作可控性。
逐图理解论文
失败案例与直觉

该图展示了四个评测维度的代表性失败案例。注意观察模型在几何一致性(结构漂移)、交互保真度(物理不合理)、视野外演化(状态不持续)和洞察演化(过程不连贯)方面的具体失败模式。
研究空白

PlayWorld 指出的核心空白是:现有基准都依赖预定义轨迹,无法适应不同模型的动作粒度,也无法覆盖长程交互目标。WorldScore、WorldMark、WBench 这些工作各有侧重,但都假设模型对相同动作的响应方式一致。这个假设在真实交互中根本不成立。
核心贡献与评测方式

该图展示了基准构建流程:从初始世界到长程目标定义、基础动作序列编写、VQA rubric 构建的完整管线。注意 170 多个案例、50 种动作模式和 820 多个问题的规模如何支撑评测的多样性。
关键发现

评测结果揭示了一个重要分离:轨迹控制能力与世界建模能力不是一回事。SANA-WM 的轨迹验证通过率很高,但 VQA 能力评分却很低——模型能跟随动作,但生成的世界缺乏一致性。反过来,HappyOyster 的基础能力得分最高,长程世界建模能力却只排第二。这说明现有评测指标可能系统性地高估了模型能力。
结论与意义

该图展示了 VQA 指标与人类偏好的对齐程度。注意 Spearman 相关性的显著性水平,这验证了自动化评测的可靠性,是 PlayWorld 方法论有效性的关键证据。
实验如何设计?
- 在 9 个代表性世界模型上评测,包括 5 个 web 接口模型和 4 个本地 chunk-wise 生成模型,共生成 1400 多个交互视频。
- 对比三种控制策略:Preset Only(仅执行基础动作序列)、Agent Only(完全在线选择动作)、Preset + Agent(以基础动作序列为参考,在线调整执行),在 Genie 3 和 HappyOyster 上各 25 个案例。
- 对比三种 agent 模型:Claude Haiku、Claude Sonnet、Gemini 3.1 Pro,在 Genie 3 上使用 Preset + Agent 策略,评估决策质量和延迟。
- 人类验证:600 个成对判断,检验 VQA 指标与人类偏好的 Spearman 相关性,验证自动化评测的可靠性。
关键结果与论文证据
- Genie 3 总体 VQA 得分 2.12,为 9 个模型中最高;HappyOyster 1.92 次之;Matrix-Game-3.0 最低 1.14(第 7 页,Table 2)。这表明即使是最好模型,在四维能力评测中也仅达到中等水平。
- Genie 3 轨迹验证通过率总体 87.1%,最高;HY-WorldPlay 41.6% 最低(第 8 页,Table 3)。轨迹控制能力与 VQA 能力评分之间存在显著分离。
- SANA-WM 轨迹验证通过率 80.4% 较高,但 VQA 总体仅 1.48(第 8 页),证明轨迹控制与能力可分离——模型能跟随动作,但生成的世界缺乏一致性。
- Preset + Agent 在 Genie 3 上 Trajectory Score 1.08、Human Preference 65.6%,优于 Preset Only(0.92/39.6%)和 Agent Only(0.88/29.2%)(第 10 页,Table 4)。在线调整显著提升了交互质量。
- HappyOyster Basic Ability Score 76.4 最高,Genie 3 为 72.2,Matrix-Game-3.0 最低 18.1(第 11 页,Table 6)。基础能力高不代表长程世界建模能力强。
- Claude Haiku 决策延迟 3.83 s/call,低于 Claude Sonnet(6.21)和 Gemini 3.1 Pro(4.36)(第 11 页,Table 5)。论文推荐 Claude Haiku 作为 agent 模型。
- 人类验证显示 VQA 指标与人类偏好具有显著相关性(第 12 页,Figure 6),支持自动化评测的可靠性。
阅读时需要注意
- Agent Player 依赖多模态大模型,决策延迟受供应商基础设施和网络条件影响,跨环境不可直接比较。
- HY-World2 对初始图像有全局场景建模要求,部分案例被跳过;Hunyuan-GameCraft-2 要求每 chunk 非空动作输入,洞察演化案例无法按原协议评测。
- VQA rubric verifier 依赖 Gemini 3.1 Pro 作为单一评测器,存在评测器偏差风险。
- Depth Stability 和 Subject Consistency 在模型几乎不产生相机运动时仍可能虚高,基础能力指标需要谨慎解读。
关联工作
- WorldScore 和 WorldMark 评测预定义相机轨迹下的 3D 一致性与多视角几何,但无闭环适应。WBench 和 WorldRoamBench 使用预定义多轮导航模式评测交互世界模型,同样缺乏在线调整。
- MemoBench 评测动态变化环境中的记忆与视野外演化,但采用固定 lookaway 协议,无法适应不同模型的动作粒度。Omni-WorldBench 提供交互、物理、记忆综合评测,但未解决跨模型公平比较问题。
- PlayWorld 的关键区别在于:它将评测从'执行预定义轨迹'转变为'追求长程目标',使评测协议能够适应不同模型的动作粒度和响应差异。