StatePlay:首个让AI生成游戏画面遵守规则的状态感知模型

快速导读:提出 StatePlay,首个通过显式联合预测游戏状态与视觉内容来提升生成游戏画面机制一致性的游戏世界模型。

游戏世界模型(Game World Model)旨在根据玩家操作生成可交互的游戏环境,是通向通用AI游戏引擎的关键技术。然而,现有模型几乎全部聚焦于像素级的视觉质量,忽略了游戏最本质的特征——由显式规则构成的内部机制。这导致生成的画面虽然视觉逼真,却频繁出现“零血攻击”“空槽放超杀”等违反游戏规则的错误,从根本上丧失了可玩性。

StatePlay 首次将游戏内部状态(血量、技能槽、计时器等)显式引入世界模型的建模过程,提出状态感知的游戏世界模型。通过 Mixture-of-Transformers 架构和专门构建的街霸3数据集,StatePlay 在保持视觉质量的同时,将机制保真度从最强基线的63.7%大幅提升至82.3%,证明了状态建模对于游戏生成的关键价值。

英文题目:StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.26754

原始论文:PDF / 论文页面

对应视频标题:StatePlay:首个让AI生成游戏画面遵守规则的状态感知模型|推荐指数:★★★★★

这篇论文解决什么问题?

游戏世界模型的核心挑战在于:游戏画面不仅是像素的序列,更是底层规则系统的可视化投影。以格斗游戏为例,角色能否释放超杀取决于技能槽是否满值,角色是否倒地取决于血量是否归零。这些规则由精确的内部状态控制,而非视觉特征。

现有模型如 Matrix-Game 3.0、HY-World 1.5 和 ReactiveGWM,将游戏生成简化为视频预测任务——输入历史帧和玩家动作,输出未来帧。它们通过像素空间的生成损失来学习,但内部状态的转换规律无法从视觉信号中可靠推断。例如,技能槽的填充速度受多种隐藏变量影响,仅凭画面无法准确建模。

近期工作如 WildWorld 和 From Pixels to States 虽然引入了带状态标注的数据集,但它们仅将状态作为辅助信息或预测目标,并未研究状态预测如何反哺视觉生成,提升生成帧的机制一致性。StatePlay 正是填补了这一研究空白。

这一问题的实际影响是深远的:如果AI生成的游戏画面不能遵守规则,那么基于这些模型构建的交互式游戏体验将毫无可玩性可言。玩家无法信任游戏世界的反馈,所有策略和操作都失去了意义。

核心创新

  • 提出首个状态感知的游戏世界模型 StatePlay,联合预测游戏状态和视觉内容,解决现有模型缺乏状态建模的问题。
  • 设计 Mixture-of-Transformers (MoT) 风格架构,为状态和视觉分支保留专门化表征,并通过联合注意力实现跨模态交互。
  • 构建首个同步包含视频帧、玩家动作和内部状态(血量、技能槽、计时器)标注的街霸3数据集,并平衡了机制关键场景的分布。

方法概览

StatePlay 采用 Mixture-of-Transformers (MoT) 架构,包含独立的状态分支和视觉分支,通过共享的联合注意力模块实现跨模态信息交换。状态分支使用 Smooth L1 回归损失直接预测游戏状态,视觉分支使用 flow matching 目标生成视频帧。模型基于 Wan2.2-TI2V-5B 构建,并在自建的包含同步状态-帧-动作标注的 Street Fighter 3 数据集上训练。

  • StatePlay 采用 Mixture-of-Transformers (MoT) 架构,包含独立的状态分支和视觉分支。状态分支负责预测下一时刻的游戏状态(血量、技能槽、计时器等),视觉分支负责生成下一帧的游戏画面。两个分支通过共享的联合注意力模块实现跨模态信息交换,使状态信息能够引导视觉生成,同时视觉特征也能辅助状态预测。
  • 状态分支使用 Smooth L1 回归损失进行优化,直接监督状态值的精确预测。这一设计选择至关重要——消融实验表明,相比使用 flow matching 损失预测状态,回归损失将机制保真度提升了21.6%。原因在于状态值是连续且精确的标量,回归损失能提供更强的数值约束。
  • 视觉分支基于 Wan2.2-TI2V-5B 预训练模型构建,使用 flow matching 目标生成视频帧。动作条件通过交叉注意力注入,状态条件则通过联合注意力模块从状态分支传递过来。这种设计使得视觉生成始终受到当前状态约束,从而保证机制一致性。
  • MoT 架构的关键优势在于为两个模态保留了专门化的表征空间。消融实验对比了共享式架构(状态和视觉使用同一Transformer处理),结果显示 MoT 架构将机制保真度提升了17.6%。这说明状态预测和视觉生成需要不同的特征提取方式,强行共享会损害各自性能。
  • 训练数据方面,作者构建了首个同步包含视频帧、玩家动作和内部状态标注的街霸3数据集。数据集通过模拟器内存直接提取精确的状态值,避免了人工标注的误差。同时,数据集特意平衡了机制关键场景(如血量归零、技能槽满值、超杀释放等)的分布,确保模型充分学习这些边界情况。
  • 推理时,StatePlay 采用自回归方式:给定历史帧和当前状态,模型预测下一时刻的状态和下一帧。预测的状态作为下一轮推理的输入,形成闭环。为增强鲁棒性,训练时对输入状态添加了噪声,使模型学会从有噪状态中恢复,避免推理时的误差累积。
  • 模型还引入了 NPC 策略标注,通过 Gemini 对NPC行为进行分类(如进攻型、防守型、反击型),并将策略描述作为文本条件注入生成过程。这使得生成的对战行为更加多样化和可控。
  • 整个训练流程分为两个阶段:首先在通用视频数据上预训练视觉分支,然后在街霸3数据集上联合微调状态分支和视觉分支。这种策略充分利用了预训练模型的视觉先验,同时让状态分支从零开始学习游戏特定的状态动力学。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 1: Existing game world models produce mechanically inconsistent gameplay, such as attacking at zero health or triggering a super art without a full skill meter (red boxes, top). In contrast, StatePlay jointly achieves state awareness and mechanics consistency (bottom table).

图1对比了现有模型和StatePlay的核心差异。上半部分用红框标出现有模型的两类典型错误:零血状态下继续攻击,以及技能槽未满时释放超杀。下半部分的表格展示了StatePlay在状态感知和机制一致性上的全面提升,直观说明了论文要解决的核心问题。

核心区分与研究空白

核心区分与研究空白
Figure 2: Overview of StatePlay. By explicitly modeling game states, including timers, health points, and skill meters, StatePlay guides frame generation to remain consistent with the underlying game mechanics (highlighted in green bounding box).

图2展示了StatePlay的整体框架。绿色边框高亮的部分是本文的核心创新——显式建模游戏状态(计时器、血量、技能槽),并将这些状态信息作为条件引导视频帧的生成。图中清晰展示了状态如何从游戏引擎中提取,又如何反馈到生成过程中。

方法贡献与验证

方法贡献与验证
Figure 3: StatePlay block architecture during training. StatePlay adopts a Mixture-of-Transformers (MoT)-style architecture with separate state and visual branches. A shared joint-attention module enables information exchange between the two branches. The state branch is optimized with a regression loss, while the visual branch is trained using a flow-matching objective. White-filled boxes denote inputs and supervision targets, while colored boxes represent model components. The block is repeated N times.

图3详细展示了StatePlay的训练架构。MoT风格的双分支设计一目了然:左侧是状态分支,使用回归损失优化;右侧是视觉分支,使用flow matching目标训练。中间的联合注意力模块是两个分支信息交换的关键通道。白色框表示输入和监督目标,彩色框表示模型组件。

核心结论

核心结论
Table 1: Quantitative comparison of game world models under zero-shot evaluation and state-aware fine-tuning. Bold values indicate the best performance, while “–” denotes metrics that are not applicable to a given method.

表1是论文最核心的定量结果。上半部分为零样本评估,所有模型的机制保真度都很低。下半部分为状态感知微调后的结果,StatePlay在所有机制指标上大幅领先。注意ReactiveGWM虽然视觉指标不错,但机制保真度仅63.7%,而StatePlay达到82.3%。

实验如何设计?

  • 实验在自建的街霸3数据集上进行,包含超过10万对同步的状态-帧-动作样本。数据集按8:1:1划分训练集、验证集和测试集。
  • 基线模型包括 Matrix-Game 3.0、HY-World 1.5 和 ReactiveGWM。其中 ReactiveGWM 是当前最强的游戏世界模型。所有基线在零样本和状态感知微调两种设置下进行评估。
  • 评估指标分为三类:机制保真度指标(Move-Acc 衡量招式准确性,Att-Acc 衡量攻击命中准确性,由 Gemini-3.1-Pro 和 GPT-5.5 作为视觉评判员打分);状态预测指标(State Alignment Score 和归一化 L1 距离);视觉质量指标(SSIM、LPIPS、FVD)。
  • 消融实验系统性地验证了 MoT 架构、回归损失函数、噪声状态输入、联合注意力模块等设计选择的有效性。每个消融实验都保持其他变量不变,仅改变目标组件。
  • 所有模型在相同的硬件环境(8×A100 GPU)和训练配置下进行公平对比。微调实验使用相同的训练轮数和批次大小。
  • 视觉评判员评估时,为每个生成样本提供三张真实参考帧,要求评判员从机制一致性的角度进行打分。评估提示词经过精心设计,明确列出了需要检查的机制要素(血量变化、技能槽状态、角色姿态等)。

关键结果与论文证据

  • 在零样本评估中,所有基线模型的机制保真度均低于50%,证实了现有模型普遍缺乏状态感知能力。即使是最强的 ReactiveGWM,也频繁出现零血攻击和空槽放超杀的错误(见论文第6页 Table 1)。
  • 经过状态感知微调后,StatePlay 的 State Alignment Score 达到0.947,平均归一化 L1 距离低于0.06,表明状态预测极为精确(见论文第6页)。
  • 在机制保真度方面,StatePlay 在 Gemini 评估下达到82.3%,相比最强基线 ReactiveGWM 的63.7%提升了18.6个百分点(见论文第6页 Table 1)。这一提升在 GPT-5.5 评估下同样显著,验证了结论的鲁棒性。
  • 消融实验揭示了三个关键设计的作用:MoT 架构相比共享式架构提升机制保真度17.6%;回归损失相比 flow matching 损失提升21.6%;噪声状态输入提升模型对状态误差的鲁棒性(见论文第6页 Table 2)。
  • 定性结果(论文第7页 Figure 4)直观展示了 StatePlay 的优势:在血量归零场景中,ReactiveGWM 生成的NPC仍保持站立并继续攻击,而 StatePlay 正确生成了倒地动画;在技能槽未满场景中,ReactiveGWM 错误地触发了超杀,StatePlay 则保持了机制一致性。
  • 视觉质量方面,StatePlay 的 SSIM 和 LPIPS 指标与 ReactiveGWM 持平或略优,说明状态建模并未牺牲视觉质量,反而通过提供更强的条件约束提升了生成稳定性。
  • 在长序列生成测试中(超过100帧),StatePlay 保持了稳定的机制一致性,而基线模型随着序列增长,错误率显著上升。这归功于状态分支提供的持续引导和噪声训练带来的误差恢复能力。
  • NPC 策略标注的引入进一步提升了生成行为的多样性。通过指定不同的策略描述,StatePlay 能够生成风格迥异的对战序列,展示了模型的可控性潜力。

阅读时需要注意

  • 仅在街霸3单一格斗游戏上验证,泛化到其他游戏类型(如FPS、RAC、RPG)需要构建更多样化的状态感知数据集。不同游戏的状态空间差异巨大,模型架构可能需要相应调整。
  • 像素级指示器(如血条、技能槽的视觉显示)偶尔会出现与内部状态不一致的情况。这是因为视觉分支在生成时需要在状态约束和视觉真实感之间取得平衡,有时会偏向后者。
  • 当多种机制同时触发时(如超杀释放与回合结束重叠),视觉质量可能下降。这是因为联合注意力模块需要同时处理多个状态约束,信息瓶颈可能导致部分约束被削弱。
  • 模型性能高度依赖从模拟器内存提取的精确状态标注。对于无法直接提取状态的商业游戏或真实游戏视频,该方法难以直接应用,限制了其实用范围。

关联工作

  • ReactiveGWM 作为当前最强的游戏世界模型,采用纯视觉的生成范式,在视觉质量上表现出色,但缺乏状态建模导致机制保真度不足。StatePlay 在其基础上引入了状态分支,证明了状态感知的关键价值。
  • World Action Model (WAM) 启发了 StatePlay 的 MoT 架构和动作条件注入设计。但 WAM 的目标是预测动作,而 StatePlay 的目标是预测游戏状态,两者在任务定义和架构细节上有本质区别。
  • WildWorld 和 From Pixels to States 等近期工作引入了带状态标注的数据集,但未探索状态预测如何提升视觉生成的机制一致性。StatePlay 首次建立了状态预测与视觉生成之间的双向促进关系。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

StatePlay:面向机制一致性生成的状态感知游戏世界模型

林子君1,2,4,†,王泽清1,3,†,陈思丹4,温碧文2,金叶莹1,3,‡,∗

1腾讯 2南洋理工大学 3新加坡国立大学 4新加坡科技研究局前沿人工智能研究中心

摘要 生命值为零时攻击 技能槽未满时释放超必杀

近期的游戏世界模型能够根据玩家动作生成视觉逼真 且可交互的环境。然而,游戏并非仅由像素定义;它们 受显式机制支配,即控制生命值减少、技能激活和游戏 终止等状态依赖规则。这些机制依赖于精确的内部状态, 如生命值、技能槽和计时器,它们与视觉观察紧密耦合, 并决定游戏进程的演变方式。若不建模这些状态动态, 视觉质量 交互性 状态感知 机制一致性 现有的游戏世界模型可能生成视觉上合理的推演,但违 以往的生成式游戏世界模型 背了底层的游戏规则。本文提出StatePlay,一种新颖的 StatePlay(本文方法)2026 状态感知游戏世界模型,它联合预测视觉内容与游戏状 图1:现有游戏世界模型会产生机制不一致的游戏过程, 态,以促进机制一致的生成。StatePlay采用混合专家 例如在生命值为零时攻击,或在技能槽未满时触发超必Jul Transformer架构(Mixture-of-Transformers, MoT),在保 杀(红框,上图)。相比之下,StatePlay同时实现了状态29 留专用视觉和状态表征的同时,支持跨模态交互,使预 感知和机制一致性(下表)。 测的状态能够引导帧生成。每个分支进一步通过适合其 模态的独特目标进行优化。实验表明,StatePlay在状态 型能够生成视觉逼真且可控的游戏推演,同时支持与动 预测上实现了低于0.06的平均归一化L1距离。此外,与 态环境(Tong等,2026)、非玩家角色(Wang等, 未进行显式状态建模的模型相比,我们的方法将生成游[cs.CV] 2026a)以及多名玩家(Wu等,2026)的交互,从而带来 戏推演中的机制保真度提升了18.6%。总体而言,我们的 更具沉浸感、创造性和吸引力的游戏体验。 工作凸显了状态感知游戏世界建模的重要性,并超越了 然而,模拟一个可玩的游戏需要的不仅仅是生成遵循 像素级真实感,朝着完整且机制忠实的游戏生成迈进。 用户意图的逼真帧。游戏受底层机制支配,这些机制通 项目页面:https://jimntu.github.io/stateplay_page/ 常由内部状态变量决定,如生命值、技能槽和计时器。 这些状态调控着有效动作、视觉过渡和游戏进程。以格 1 引言 斗游戏为例,玩家只有在技能槽满时才能施放某些特殊 世界模型因能根据智能体或用户动作模拟未来环境动态 攻击,并且一旦任一玩家的生命值归零,游戏即应结束。 而受到越来越多的关注(Bruce等,2024;Mao等,2026)。 因此,有效且一致的机制是游戏的基础,直接决定了生 与传统的视频生成模型(Seedance等,2026;Team等, 成的环境是真正可玩的,还是仅仅是一个视觉演示。 2025)不同,它们强调以动作为条件的预测,其中未来 尽管内部状态至关重要,现有的游戏世界模型将游戏 观察由历史上下文和交互输入共同决定。这一能力使其 过程生成形式化为像素空间中的预测任务,并忽视了状arXiv:2607.26754v1 非常适合自动驾驶(Wang等,2024)、具身人工智能 态动态在塑造未来观察中的因果作用。因此,当前模型 (Ye等,2026)和游戏(Yu等,2025)等闭环应用。特 可能生成视觉上合理的推演,但未能遵循游戏规则。如 别地,游戏提供了一个有前景的测试平台,因为环境必 图1所示,玩家可能在游戏本应结束后继续战斗,或在 须随时间对玩家动作做出一致响应。近期的游戏世界模 技能槽未满时施放超必杀。此类失败导致了机制不一致 且不完整的游戏体验。 †本工作完成于腾讯的研究实习期间,由金叶莹指导。 ‡项目负责人。 ∗通讯作者。

第 2 页

显式状态预测 机制一致的帧生成

计时器 生命值 技能槽 视频帧

玩家 NPC 玩家 NPC 95 100% 100% 10% 0%

94 100% 88% 25% 5%

基础攻击:NPC生命值少量减少;双方技能槽增加。

62 58% 55% 100% 60%

61 58% 27% 0% 60% 超级必杀技:NPC生命值大幅减少;需要玩家技能槽全满, 使用后归零。

28 13% 15% 71% 92% 28 0% 15% 71% 92% 游戏结束:玩家生命值归零,显示“You Lose”。

图2: StatePlay概览。通过显式建模游戏状态,包括计时器、生命值和技能槽,StatePlay引导帧生成与底层游戏机制保持一致(绿色边界框高亮部分)。

为弥补这一不足,我们提出了StatePlay,这是首个状态感知的游戏世界模型,能够联合预测游戏状态和视觉内容,以实现机制一致的游戏玩法生成(见图2)。我们的核心观察是:玩家操作通常直接反映在像素级变化中,而内部状态动态无法仅从视觉观察中可靠习得。因此,现有仅包含帧和操作的游戏世界模型数据集不足以学习状态转换和游戏规则。

基于这一观察,我们从数据和模型两个角度构建了StatePlay。首先,由于缺乏带有显式状态标注的开源数据集,我们从《街头霸王3》(SF3)(Capcom 1998)构建了一个同步的状态-帧-操作数据集。该数据集记录了游戏帧和玩家操作,以及包括生命值、技能槽和计时器在内的内部状态,使我们能够系统研究显式状态建模对游戏世界模型的影响。其次,受联合建模视觉帧和操作的世界动作模型(WAM)(Ye等,2026;Kim等,2026)启发,我们设计了StatePlay,采用混合专家Transformer架构(Mixture-of-Transformers,MoT)风格的主干网络,同时预测游戏状态并生成视觉内容。具体而言,StatePlay耦合了两种模态,同时为每个分支优化定制目标,以生成既视觉合理又符合游戏机制的推演结果。

实验凸显了结合显式状态预测生成视觉内容的重要性。StatePlay能够准确建模内部游戏状态,在关键状态变量上的平均归一化L1距离低于0.06。除状态预测本身外,将状态与视觉生成耦合,使机制保真度相比最佳基线模型提升了18.6%。与通过像素级监督隐式学习游戏机制的无状态游戏世界模型相比,StatePlay在保持视觉质量和操作可控性的同时,更好地保留了状态相关事件,如技能激活、生命值减少和游戏终止。这些结果表明,显式状态建模对于推动游戏世界模型超越视觉真实感,迈向更具可玩性和机制一致性的模拟至关重要。

总体而言,我们的贡献总结如下: • 我们提出了StatePlay,首个状态感知的游戏世界模型,联合预测游戏状态和视觉内容,解决了先前工作中状态建模的缺失问题。 • 我们引入了一种新颖的混合专家Transformer架构(MoT)风格架构,为状态分支和视觉分支设定不同目标。通过将状态建模与视觉生成显式耦合,实现了准确的状态预测和机制一致的帧生成。 • 我们进行了大量实验,证明StatePlay相比无状态游戏世界模型,机制保真度提升了18.6%,同时保持了准确的状态预测、操作可控性和视觉质量。

2 相关工作

2.1 游戏世界模型

游戏世界模型有潜力通过自主生成以玩家操作作为条件的交互式内容,从而变革游戏开发。Genie(Bruce等,2024)等开创性工作表明,视频生成模型可以通过从未标注视频中学习操作可控的动态,来生成可玩的环境。ReactiveGWM(Wang等,2026a)、Incantation

第 3 页

(Zhu 等,2026)和 MultiWorld(Wu 等,2026)进一步将这一方向拓展至更丰富的交互形式,涵盖自由探索、与环境和 NPC 的互动,以及与其他玩家的交互。与此同时,近期工作如 Lyra 2.0(Shen 等,2026)、HY-World 1.5(Sun 等,2025)和 Matrix-Game 3.0(Wang 等,2026b)则专注于提升实时交互、长程一致性以及高分辨率生成。

尽管游戏世界模型进展迅速,但状态预测——对于构建可玩环境同样至关重要——在很大程度上仍被忽视。在本工作中,我们识别出近期游戏世界模型研究中这一缺失的组成部分,并使游戏世界模型能够同时预测游戏状态并生成遵循底层游戏规则的视频帧。

2.2 状态感知的世界建模

状态信息的使用在具身智能和决策领域已被广泛研究,其中状态的定义取决于任务设定。在具身人工智能中,状态通常指本体感知信息,如机器人姿态和关节配置,这有助于策略生成物理上可行的动作(Black 等,2025;Kim 等,2024)。在自动驾驶中,自车速度、加速度以及周围物体运动等状态变量常被建模,以支持更安全的未来预测和规划(Zheng 等,2024;Hu 等,2022)。这些例子表明,显式状态建模对于既需要视觉理解又需要规则一致交互的系统至关重要。

游戏同样涉及任务相关的状态,例如第一人称射击游戏中的弹药或绷带数量、竞速游戏中的氮气或速度,以及格斗游戏中的生命值或技能槽。然而,由于游戏状态信息并非总能从环境中直接提取,或从生成内容中可靠推断,这一视角在游戏世界模型中仍探索不足。最相关的工作包括 WildWorld(Li 等,2026a)和 From Pixels to States(Li 等,2026b),它们引入了带有显式状态标注的动作条件视频数据集,但状态预测如何提升帧生成的机制保真度,以及此类状态信息应如何融入游戏世界模型,仍不清楚。在本工作中,我们提出 StatePlay,一个状态感知的游戏世界模型,以填补这一空白,并系统性地研究视觉生成与状态预测如何相互补充和增强。

3 StatePlay

3.1 状态感知数据集构建

我们专门使用《街头霸王 3》(SF3)(Capcom,1998)构建数据集,因为公开可用的游戏数据集很少提供显式状态标注。该游戏为研究状态预测与机制一致性视觉生成之间的关系提供了一个合适的起点,因为它包含直观的状态变量和明确定义的游戏规则。这些状态直接关联游戏进程:不同攻击造成不同数值的生命值减少,超必杀技仅在技能槽满时才能激活,当任一角色生命值归零时游戏结束。状态感知数据集的构建分为三个阶段:游戏对局录制、机制分布平衡和 NPC 策略标注。

游戏对局录制 遵循与 ReactiveGWM(Wang 等,2026a)类似的数据采集流程,采用 stable-retro 框架(Poliquin,2026)以编程方式收集游戏对局片段。它为 SF3 提供了兼容 Gymnasium 的接口,使我们能够通过 Python 控制游戏,记录视觉观察和动作。玩家由智能体控制,这些智能体从 11 维动作空间中采样动作,包括 4 个移动动作、6 个普通攻击和 1 个超必杀技。此外,我们从模拟器内存中提取五个状态变量:游戏计时器、玩家和 NPC 的生命值及技能槽。每个对局持续到回合结束的击倒,然后被分割为 20 FPS 的 5 秒片段。

机制分布平衡 在收集了带有同步玩家动作和内部状态的游戏片段后,我们根据五个与机制相关的类别平衡数据集:结果胜利、结果失败、宏成功、宏失败和普通。标签使用 Gemini-3.1-Pro(Google DeepMind,2026)和记录的游戏状态共同分配。具体而言,当 Gemini 检测到相应的“You Win”或“You Lose”帧,且某一角色生命值归零时,片段被标记为结果胜利或结果失败。当 Gemini 检测到成功执行的超必杀技、记录的动作包含相应指令且技能槽超过所需阈值时,片段被标记为宏成功。相反,当玩家发出指令但技能槽不足,导致发出普通攻击时,则标记为宏失败。其余不包含这些状态依赖事件的片段被标记为普通。最终,我们构建了一个包含 10,000 个片段的平衡训练集。状态关键案例占数据集的 40%,包括结果胜利、结果失败、宏成功和宏失败,各占 10%。其余 60% 为普通案例。这种平衡策略确保数据集包含足够的片段,其中状态信息对于生成机制一致的游戏帧至关重要,同时仍保留常见的游戏动态。更多细节请参见附录 B.1。

NPC 策略标注 为使模型能够引导 NPC 对玩家采取不同策略,我们使用 Gemini-3.1-Pro 以自然语言描述标注 NPC 行为。遵循(Wang 等,2026a),我们设计提示词,沿三个策略类别描述 NPC 行为:进攻,即 NPC 拉近距离并主动攻击玩家;牵制,即 NPC 保持距离并使用飞行道具;防御,即 NPC 以下蹲防御被动应对。详细的 NPC 策略提示词请参见附录 B.2。综上,我们构建了一个包含 10,000 个训练片段的状态感知数据集,涵盖视频帧、玩家动作、状态信息和 NPC 文本描述,并在不同机制相关场景中实现了平衡分布。

第 4 页

动作与攻击 𝐀 状态分支 视觉分支 视频

[𝐵, 𝑓, 𝑆] 噪声 𝝐𝒔 [𝐵, 𝑓, 𝐾] 𝐬$ 动作 VAE 编码器 𝐸" 状态 𝐬𝟎 状态编码器 𝐸! 模块 噪声 𝝐" 𝐱𝟎 … 𝐱$

“NPC 行为与策略” [𝐵, 𝐿s, 𝐶] 逐时间步 [𝐵, 𝑓, 𝐶] 𝐀’ 空间 [𝐵, 𝐿𝑣, 𝐶] …… 加法 广播 自注意力 回归 文本 自注意力 交叉注意力 ℒ#$%$& 𝐇𝐬 𝐇𝐯 编码器 联合注意力

100% 55% … 25% 5% [𝐵, 𝐿s, 𝐶] 𝐇#, 𝐇𝐯, [𝐵, 𝐿𝑣, 𝐶] 流匹配 状态解码器 𝐷! FFN FFN 𝝐" −𝐱𝟎 ℒ"'(&)

图 3: 训练时的 StatePlay 模块架构。StatePlay 采用混合专家Transformer架构(Mixture-of-Transformers, MoT)风格的设计,包含独立的状态分支和视觉分支。共享的联合注意力模块实现两个分支之间的信息交换。状态分支通过回归损失进行优化,而视觉分支则使用流匹配目标进行训练。白色填充框表示输入和监督目标,彩色框表示模型组件。该模块重复 N 次。

3.2 模型架构 状态分支与视觉分支 为了联合预测帧间游戏状态并生成机制一致的视觉帧,我们在现有游戏世界模型普遍采用的视觉分支(5B)之外,引入了一个轻量级的状态分支(0.76B)。图 3 所示的这种简单而有效的设计,可以轻松集成到不同的游戏世界模型中,赋予它们状态建模能力。 受世界动作模型中动作条件设计的启发,我们通过根据采样的时间步 t 向干净状态序列 s0 添加高斯噪声 ϵs 来构建状态分支: st = (1 − t)s0 + tϵs, ϵs ∼ N(0, I), (1) 其中 s0 ∈ RB×f×S,B 表示批次大小,f 表示潜在帧数,S 表示状态变量数(不同游戏可能有所不同)。在推理过程中,第一帧的状态作为条件提供,而其余帧的状态从噪声初始化并由模型预测。扰动后的状态序列随后由状态编码器 Es 和状态自注意力模块处理,得到状态表示 Hs ∈ RB×Ls×C,该表示捕获了时序状态动态和机制相关信息,其中 Ls 为状态令牌长度,每个令牌包含 C 维特征。 类似地,视频分支使用独立采样的高斯噪声 ϵv 来扰动 VAE 编码器产生的干净潜在表示 x0: xt = (1 − t)x0 + tϵv, ϵv ∼ N(0, I), (2) 其中 x0 ∈ RB×Lv×C 表示视觉潜在表示,包含 Lv 个视觉令牌,每个令牌的特征维度为 C,与状态令牌的维度匹配。扰动后的视觉潜在表示 xt 随后由视觉自注意力模块处理,然后与文本嵌入进行交叉注意力,如图 3 所示,生成视觉表示 Hv ∈ RB×Lv×C,该表示同时捕获了视觉动态和来自文本提示的语义信息。 状态表示 Hs 和视觉表示 Hv 由各自对应的专家分支分别处理,因为它们对应着本质上不同的模态。这种模态特定设计的有效性将在第 4.4 节中进一步分析。 此外,动作序列 A ∈ RB×f×K(其中 K 表示动作维度)由动作编码器投影为动作嵌入 A′ ∈ RB×f×C。然后,动作嵌入在令牌嵌入之后立即注入到视觉分支和状态分支中,使玩家动作能够在整个网络中联合调节视觉生成和状态预测。

混合专家Transformer架构 在从各自的专家分支获得状态表示 Hs 和视觉表示 Hv 之后,应用联合注意力模块进行跨模态信息交换: H′v = Hv + MHA(Hv, Hs, Hs), H′s = Hs + MHA(Hs, Hv, Hv). (3) 具体来说,视觉令牌作为查询,关注从状态令牌派生的键和值,从而使视觉生成能够融入机制相关的状态信息。

第 5 页

信息。相反,状态令牌作为查询,关注从视觉令牌派生的键和值,使状态预测能够利用相应的视觉动态。这种双向交互实现了有效的信息交换,同时在各分支中保留了模态特定的表示。

损失设计 StatePlay针对视觉生成和状态预测进行联合优化。对于视觉分支,我们遵循基于Wan的游戏世界模型所采用的标准流匹配目标,学习用于去噪扰动视觉潜变量的速度场:

Lvideo = Ex0,ϵv,t h ∥vθ(xt, t) −(ϵv −x0)∥22 i , (4)

其中vθ表示视觉分支预测的速度场,xt是时间步t的扰动视觉潜变量,ϵv −x0是线性流路径下对应的真实速度。

对于状态分支,我们没有采用世界动作模型中使用的相同流匹配目标,而是直接用平滑L1回归损失来监督预测的状态。与简单地将流匹配应用于状态预测相比,回归更适合低维、受机制约束的游戏状态特性:

Lstate = SmoothL1 (Ds(H′s), s0) , (5)

其中Ds表示状态解码器,损失在预测的状态序列Ds(H′s)和对应的干净状态序列s0之间计算。

最后,两个目标通过加权求和进行联合优化:

Ltrain = λstateLstate + λvideoLvideo, (6)

其中λstate和λvideo分别表示状态分支和视觉分支的损失权重。关于此设计选择的详细消融研究见第4.4节。

4 实验
4.1 评估指标

我们的基准测试从四个互补维度评估每个生成的片段:视觉质量、动作控制、状态对齐度和机制保真度。所有指标均在额外的100个生成样本测试集上进行评估,这些样本均匀覆盖了各种机制类别。

  • 视觉质量:通过比较生成视频与参考游戏引擎输出来评估帧级和感知保真度:
  • −SSIM (Wang et al. 2004):在对齐帧尺寸和裁剪后测量结构相似性,捕捉场景布局、角色形状和局部图像结构。
  • −LPIPS (Zhang et al. 2018):使用深度视觉特征测量感知相似性。
  • 动作控制:评估生成的游戏玩法遵循指令玩家动作的程度。它在移动和战斗两个层面衡量可控性:
  • −移动准确率 (Move-Acc):量化生成的角色移动与输入移动方向之间的对齐度。我们使用SAM2.1 (Ravi et al. 2025) 和Grounding DINO (Liu et al. 2024) 跟踪角色,当观察到的位移在归一化的[0, 1]坐标空间中满足预定义阈值时,计为移动成功。
  • −攻击准确率 (Att-Acc):衡量生成的攻击行为与预期攻击指令之间的一致性。我们使用ClipAttack-Net进行评估,这是一个基于ResNet-18 (He et al. 2016) 和4层空洞TCN (Bai, Kolter, and Koltun 2018) 的自定义6类帧级攻击分类器,在大约5千个片段上训练,置信度阈值为0.7。
  • 状态对齐度:衡量生成游戏状态的准确性,包括计时器、玩家生命值、对手生命值以及双方的技能槽。对于每个状态变量,我们计算相对于目标状态轨迹的归一化预测误差,并报告平均距离。我们进一步将状态对齐分数定义为1 −距离。
  • 机制保真度:评估生成片段中机制的正确性。我们使用Gemini-3.1-Pro (Google DeepMind 2026) 和GPT-5.5 (OpenAI 2026) 作为视觉评判器,采用严格的提示词和真实参考图像,将识别出的机制与目标标签进行比较。这包括但不限于验证正确的获胜者和有效的超必杀技执行。Gemini-3.1-Pro直接处理每个视频,而GPT-5.5由于视频输入支持有限,评估24个均匀采样的帧。结果以三次运行的平均值±标准差报告,以获得更可靠的评估。详情请参阅附录D。
4.2 实现细节

我们采用Wan2.2-TI2V-5B (Wan et al. 2025) 作为基础视频扩散模型,配合Wan2.2 VAE和UMT5-XXL文本编码器 (Chung et al. 2023)。模型在我们收集的包含10,000个5秒视频片段的数据集上训练,每个片段都标注了玩家动作、游戏状态和文本描述。我们的模型训练了40,000步,批量大小为4,学习率为5 × 10−5。所有视频帧都被调整到480 × 832。超参数N、LS、LV、f、C、K、λstate和λvideo分别设置为30、25、9750、25、3072、11、1和1。

4.3 与游戏世界模型的比较

零样本评估 StatePlay首先在零样本设置下与几个最先进的游戏世界模型进行比较。为确保公平比较,所有基线模型均使用其原始发布的架构和预训练权重进行评估,未作修改。由于现有的游戏世界模型既不支持我们的状态表示,也不共享相同的动作空间,我们仅报告视觉质量和机制保真度。如表1所示,Matrix-Game 3.0 (Wang et al. 2026b)、LingBot-World (Team et al. 2026)、LingBot-World 2.0 (Gao et al. 2026) 和HY-World 1.5 (Sun et al. 2025) 产生的视觉质量相对较差。尽管ReactiveGWM (Wang

第 6 页

视觉质量 动作控制 (%) 机制保真度 (%) (n = 3) 方法 状态对齐度 ↑ SSIM ↑ LPIPS ↓ 移动准确率 ↑ 攻击准确率 ↑ Gemini-3.1-Pro ↑ GPT-5.5 ↑

零样本评估

Matrix-Game 3.0 (Wang et al. 2026b) 0.142 0.673 – – – 42.3±0.9 42.3±0.5 LingBot-World (Team et al. 2026) 0.183 0.601 – – – 44.3±0.5 53.0±0.8 LingBot-World 2.0 (Gao et al. 2026) 0.191 0.641 – – – 41.3±0.9 43.0±0.8 HY-World 1.5 (Sun et al. 2025) 0.172 0.537 – – – 41.0±0.8 43.0±1.4 ReactiveGWM (Wang et al. 2026a) 0.340 0.457 – – – 48.0±0.7 43.3±1.6

状态感知微调

Matrix-Game 3.0 (Wang et al. 2026b) 0.240 0.478 40.0 6.67 – 48.7±1.7 58.3±0.9 HY-World 1.5 (Sun et al. 2025) 0.352 0.521 40.0 11.7 – 41.7±0.5 38.3±0.5 ReactiveGWM (Wang et al. 2026a) 0.376 0.439 95.0 100.0 – 63.7±2.1 59.7±0.9 StatePlay 0.378 0.424 92.5 95.0 0.947 82.3±0.5 78.3±0.5

表1:零样本评估与状态感知微调下游戏世界模型的定量对比。粗体值表示最佳性能,“–”表示该指标不适用于对应方法。

耦合方式 状态损失 视觉质量 动作控制 (%) 机制保真度 (%) (n = 3) 状态对齐度 ↑ 共享 MoT 流匹配 回归 SSIM ↑ LPIPS ↓ 移动准确率 ↑ 攻击准确率 ↑ Gemini-3.1-Pro ↑ GPT-5.5 ↑ ✓ ✓ 0.309 0.541 75.0 90.0 0.804 52.0±0.9 49.7±1.2 ✓ ✓ 0.355 0.450 97.5 100.0 0.943 64.7±2.1 67.7±0.5 ✓ ✓ 0.363 0.430 85.0 71.7 0.845 60.7±1.2 62.0±1.4 ✓ ✓ 0.378 0.424 92.5 95.0 0.947 82.3±0.5 78.3±0.5

表2:状态感知世界建模中不同耦合方式与状态损失设计的对比。

et al. 2026a),其在域内数据集上训练,视觉质量显著优于其他零样本基线,但其在Gemini和GPT评估下的机制保真度均低于50%。这一结果表明,当前的游戏世界模型能够生成视觉上合理的游戏画面,但在仅依赖视觉建模时,仍难以忠实保留游戏规则。

状态感知微调 我们进一步在状态感知数据集上对基线模型进行微调,以评估仅通过视觉监督是否能涌现出机制一致的游戏画面。据我们所知,现有的开源游戏世界模型既未显式建模也未预测内部游戏状态;因此,状态对齐度指标不适用,故予以省略。我们也省略了LingBot-World模型系列的微调结果,因为它们包含超过240亿参数,相比我们57.5亿参数的StatePlay模型,需要显著更多的训练内存。 如表1所示,StatePlay取得了0.947的状态对齐度分数,表明其能准确预测内部游戏状态。更重要的是,它实现了最高的机制保真度,在Gemini评估下达到82.3%,在GPT评估下达到78.3%,在两种评估器的三次运行中均一致优于所有基线。这些结果表明,联合学习状态预测与帧生成,能有效引导模型生成更符合底层游戏机制的游戏画面。此外,引入显式状态建模并未损害游戏世界模型的核心能力。在显著提升机制保真度的同时,StatePlay保持了与现有基线相当或更优的视觉质量和动作控制能力。

总体而言,零样本与微调设置下的对比表明,现有游戏世界模型能够生成视觉上合理且可控的游戏画面,但在仅依赖视觉建模时,难以保留状态相关的规则。StatePlay通过显式建模内部游戏状态,并将状态预测与帧生成耦合,解决了这一局限。

4.4 消融研究 耦合方式 为评估MoT风格骨干网络在状态感知世界建模中的有效性,我们将其与世界动作模型中另一种常见的架构选择——共享风格骨干网络(Hou et al. 2026)进行对比。在共享风格设计中,帧令牌与状态令牌由统一的骨干网络处理,因此视觉预测与状态预测在共同的潜在空间中联合建模。相比之下,MoT风格设计通过分离的专家分支,使视频与状态建模保持部分专业化,同时通过共享的联合注意力实现跨模态交互。从表2可见,性能差距在机制保真度上最为显著,MoT风格骨干网络比共享风格骨干网络高出17.6%。 这一提升表明,模态特定的结构对于状态感知世界建模至关重要。尽管视觉动态与游戏状态紧密耦合,但它们对应着本质不同的表征:视频预测关注高维视觉细节,而状态预测遵循低维但对规则敏感的时间动态。将两种模态强行纳入完全共享的潜在空间,可能会干扰优化过程,并削弱机制建模。相比之下,MoT风格

第 7 页

(a) 超必杀技 (b) 结果胜利 (c) 结果失败

Reactive- GWM

StatePlay

图4: 最佳基线模型ReactiveGWM与StatePlay生成的三个示例推演(a)–(c)的定性对比。红色边界框标记违反规则的推演,绿色边界框标记本方法生成的符合游戏机制的推演。请放大查看以获得更好的可见性。

骨干网络使每种模态能够保留其专用表征,同时在视觉生成与状态预测之间保持充分的交互。

状态损失 流匹配通常被用于世界动作模型中,以联合训练帧生成与动作预测。然而,我们观察到游戏状态具有不同于动作的特性。动作通常是连续的控制信号,可能根据策略自由变化,而游戏状态则是紧凑的、受规则支配的变量,具有结构化的时序模式。例如,生命值通常在受到攻击后减少,而技能槽通常逐渐增加并在释放特殊招式后重置。这些差异使得流匹配不太适用于状态预测。尽管流匹配对高维视觉生成有效,但它会向低维状态变量引入随机扰动,并要求模型在其分布上学习一个传输向量场。这种形式化可能会不必要地复杂化状态预测,因为状态转移主要由显式机制决定,并且可以通过时序回归更直接地建模。表2中的实验结果进一步表明,使用直接回归损失监督状态始终优于流匹配,在状态对齐度上提升了12.1%,在机制保真度上提升了21.6%。更多消融研究见附录E。

4.5 定性可视化

我们比较了最佳基线模型ReactiveGWM与StatePlay的定性结果。为公平比较,两种方法均使用相同的动作序列、文本提示、初始帧和初始状态作为输入。

如图4(a)所示,当技能槽满时,StatePlay成功释放超必杀技,并在执行后正确地将技能槽重置为0。相比之下,ReactiveGWM即使在技能槽达到所需阈值时也未能触发超必杀技,并产生了模糊的视觉伪影,两个角色在视觉上纠缠在一起。

图4(b)展示了一个游戏结束的情况,其中NPC的生命值降至0。ReactiveGWM生成了一个无效的推演,NPC在生命值为零的情况下仍然站立并攻击,而StatePlay则正确生成了“You Win”的结果。图4(c)展示了相反的情况,玩家的生命值降至0。ReactiveGWM错误地将玩家描绘为获胜,玩家在庆祝而NPC躺在地上,而StatePlay则生成了符合游戏规则的正确失败结果。

这些可视化结果进一步表明,缺乏显式状态建模的游戏世界模型(如ReactiveGWM)倾向于过拟合像素级的视觉动态,而无法捕捉有效的游戏机制。相比之下,我们的状态感知设计使StatePlay能够更准确地预测内部状态,并生成机制一致的推演。更多可视化结果请参见附录F。

5 结论与讨论

在本文中,我们介绍了StatePlay,一个状态感知的游戏世界模型,它将显式的内部状态预测融入游戏帧生成中。与以往主要关注以玩家动作为条件的视觉动态的游戏世界模型不同,StatePlay将计时器、生命值和技能槽等状态作为生成过程的一部分进行建模。通过将状态预测与帧生成耦合,我们的方法生成的推演不仅在视觉上合理,而且更符合底层的游戏机制。在一个直观的格斗游戏上的实验表明,StatePlay能准确预测内部状态,并在保持动作可控性和视觉质量的同时,提升了机制保真度。这些结果确立了状态感知建模的重要性,并为构建更完整、可玩的游戏世界模型提供了一个初步可行的框架。

然而,由于包含同步状态、帧和动作的公开数据集仍然有限,我们将初步评估集中在《街头霸王3》上。跨游戏类型的更广泛验证需要更大、更多样化的状态感知数据集。考虑到状态建模对机制一致性生成的好处,我们希望这项工作能鼓励开发在更广泛的游戏中带有显式状态标注的数据集,从而使状态感知的游戏世界模型能够扩展并泛化到不同的规则系统中。

第 8 页

参考文献 Li, Z.; Meng, Z.; Shi, S.; Zhai, M.; Tan, J.; Li, C.; 和 Zhang, Bai, S.; Kolter, J. Z.; 和 Koltun, V. 2018. 用于序列建模的通用卷积与循环网络实证评估. arXiv preprint arXiv:1803.01271. Liu, S.; Zeng, Z.; Ren, T.; Li, F.; Zhang, H.; Yang, J.; Jiang, Black, K.; Brown, N.; Darpinian, J.; Dhabalia, K.; Driess, Q.; Li, C.; Yang, J.; Su, H.; 等. 2024. Grounding dino: 将dino与基于定位的预训练结合用于开放集目标检测. 载于欧洲计算机视觉会议, 38–55. Springer. D.; Esmail, A.; Equi, M. R.; Finn, C.; Fusai, N.; Galliker, M. Y.; 等. 2025. π0.5: 一种具备开放世界泛化能力的视觉-语言-动作模型. 载于第九届机器人学习年度会议. Mao, X.; Li, Z.; Li, C.; Xu, X.; Ying, K.; 和 Zhang, K. Bruce, J.; Dennis, M. D.; Edwards, A.; Parker-Holder, J.; 2026. Yume1.5: 一种文本控制的交互式世界生成模型. 载于IEEE/CVF计算机视觉与模式识别会议论文集, 7752–7761. Shi, Y.; Hughes, E.; Lai, M.; Mavalankar, A.; Steigerwald, R.; Apps, C.; 等. 2024. Genie: 生成式交互环境. 载于第四十一届国际机器学习会议. OpenAI. 2026. GPT-5.5系统卡. https://openai.com/index/gpt-5-5-system-card/. 访问日期: 2026-07-28. Capcom. 1998. 街头霸王 Alpha 3. 街机. Poliquin, M. 2026. Stable Retro: OpenAI Gym Retro的一个维护分支. 访问日期: 2026-07-07. Chung, H. W.; Constant, N.; Garcia, X.; Roberts, A.; Tay, Y.; Narang, S.; 和 Firat, O. 2023. Unimax: 面向大规模多语言预训练的更公平且更有效的语言采样. arXiv preprint arXiv:2304.09151. Ravi, N.; Gabeur, V.; Hu, Y.-T.; Hu, R.; Ryali, C.; Ma, T.; Gao, Z.; Wang, Q.; Zhu, J.; Chen, J.; Liu, Z.; Bai, Q.; Wang, Khedr, H.; Rädle, R.; Rolland, C.; Gustafson, L.; 等. 2025. Sam 2: 分割图像和视频中的任意目标. 载于国际学习表征会议, 卷2025, 28085–28128. J.; Yuan, Y.; Wang, H.; Lu, Y.; Cheng, K. L.; Zhang, H.; Gao, J.; Feng, T.; Liu, Y.; Yao, Y.; Xu, Y.; Zhu, X.; Shen, Y.; 和 Ouyang, H. 2026. 具备多功能交互的无限世界. arXiv:2607.07534. Seedance, T.; Chen, D.; Chen, L.; Chen, X.; Chen, Y.; Chen, Google DeepMind. 2026. Gemini 3.1 Pro模型卡. Z.; Chen, Z.; Cheng, F.; Cheng, T.; Cheng, Y.; 等. 2026. Seedance 2.0: 推进面向世界复杂性的视频生成. arXiv preprint arXiv:2604.14148. https://deepmind.google/models/model-cards/gemini-3-1-pro/. 访问日期: 2026-07-28. Shen, T.; Bahmani, S.; He, K.; Srinivasan, S. G.; Cao, T.; He, K.; Zhang, X.; Ren, S.; 和 Sun, J. 2016. 用于图像识别的深度残差学习. 载于IEEE计算机视觉与模式识别会议论文集, 770–778. Ren, J.; Li, R.; Wang, Z.; Sharp, N.; Gojcic, Z.; 等. 2026. Lyra 2.0: 可探索的生成式3D世界. arXiv preprint arXiv:2604.13036. Hou, B.; Li, G.; Jia, J.; An, T.; Guo, X.; Leng, S.; Geng, Sun, W.; Zhang, H.; Wang, H.; Wu, J.; Wang, Z.; Wang, Z.; H.; Ze, Y.; Harada, T.; Torr, P.; 等. 2026. 面向机器人学习的世界模型: 综述. arXiv preprint arXiv:2605.00080. Wang, Y.; Zhang, J.; Wang, T.; 和 Guo, C. 2025. Worldplay: 面向实时交互世界建模的长期几何一致性. arXiv preprint arXiv:2512.14614. Team, K.; Chen, J.; Ci, Y.; Du, X.; Feng, Z.; Gai, K.; Guo, Hu, A.; Corrado, G.; Griffiths, N.; Murez, Z.; Gurau, C.; Yeo, S.; Han, F.; He, J.; He, K.; 等. 2025. Kling-Omni技术报告. arXiv preprint arXiv:2512.16776. H.; Kendall, A.; Cipolla, R.; 和 Shotton, J. 2022. 面向城市驾驶的基于模型的模仿学习. 神经信息处理系统进展, 35: 20703–20716. Team, R.; Gao, Z.; Wang, Q.; Zeng, Y.; Zhu, J.; Cheng, Hu, Y.; Zhang, J.; Luo, Y.; Guo, Y.; Chen, X.; Sun, K. L.; Li, Y.; Wang, H.; Xu, Y.; Ma, S.; 等. 2026. 推进开源世界模型. arXiv preprint arXiv:2601.20540. X.; Feng, K.; Lu, Q.; Chen, S.; Zhang, Y.; 等. 2026. Bagelvla: 通过交错视觉-语言-动作生成增强长程操作. arXiv preprint arXiv:2602.09849. Tong, Z.; Lai, H.; Wang, Z.; Xing, Z.; Cheng, K.; Xu, H.; Pu, Kim, M. J.; Gao, Y.; Lin, T.-Y.; Lin, Y.-C.; Ge, Y.; Lam, G.; Z.; Zhu, S.; Feng, R.; Zhao, J.; 等. 2026. SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型. arXiv preprint arXiv:2605.23345. Liang, P.; Song, S.; Liu, M.-Y.; Finn, C.; 等. 2026. Cosmos policy: 微调视频模型用于视觉运动控制与规划. arXiv preprint arXiv:2601.16163. Wan, T.; Wang, A.; Ai, B.; Wen, B.; Mao, C.; Xie, C.-W.; Kim, M. J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E. P.; Sanketi, P. R.; Chen, D.; Yu, F.; Zhao, H.; Yang, J.; 等. 2025. Wan: 开放且先进的大规模视频生成模型. arXiv preprint arXiv:2503.20314. Vuong, Q.; 等. 2024. OpenVLA: 一种开源视觉-语言-动作模型. 载于第八届机器人学习年度会议. Wang, X.; Zhu, Z.; Huang, G.; Chen, X.; Zhu, J.; 和 Lu, J. Li, Z.; Meng, Z.; Shi, S.; Peng, W.; Wu, Y.; Zheng, B.; Li, 2024. Drivedreamer: 面向自动驾驶的真实世界驱动世界模型. 载于欧洲计算机视觉会议, 55–72. Springer. C.; 和 Zhang, K. 2026a. Wildworld: 一个面向生成式ARPG、包含动作与显式状态的大规模动态世界建模数据集. arXiv preprint arXiv:2603.23497. Wang, Z.; Bovik, A. C.; Sheikh, H. R.; 和 Simoncelli, E. P. 2004. 图像质量评估: 从误差可见性到结构相似性. IEEE图像处理汇刊, 13(4): 600–612.

第 9 页

Wang, Z.; Chen, D.; Xing, Z.; Tong, Z.; Zhang, Y.; Yang, X.; 和 Jin, Y. 2026a. ReactiveGWM: 在反应式游戏世界模型中操控NPC. arXiv preprint arXiv:2605.15256. Wang, Z.; Liu, Z.; Li, J.; Huang, K.; Xu, B.; Kang, F.; An, M.; Wang, P.; Jiang, B.; Wei, Y.; 等. 2026b. Matrix-game 3.0: 具有长时记忆的实时流式交互世界模型. arXiv preprint arXiv:2604.08995. Wu, H.; Yu, J.; Zou, Y.; 和 Liu, X. 2026. Multiworld: 可扩展的多智能体多视角视频世界模型. arXiv preprint arXiv:2604.18564. Ye, S.; Ge, Y.; Zheng, K.; Gao, S.; Yu, S.; Kurian, G.; Indupuru, S.; Tan, Y. L.; Zhu, C.; Xiang, J.; 等. 2026. 世界动作模型是零样本策略. arXiv preprint arXiv:2602.15922. Yu, J.; Qin, Y.; Wang, X.; Wan, P.; Zhang, D.; 和 Liu, X. 2025. Gamefactory: 利用生成式交互视频创造新游戏. 见 IEEE/CVF 国际计算机视觉大会论文集, 11590–11599. Zhang, R.; Isola, P.; Efros, A. A.; Shechtman, E.; 和 Wang, O. 2018. 深度特征作为感知度量的不合理有效性. 见 IEEE 计算机视觉与模式识别大会论文集, 586–595. Zheng, W.; Chen, W.; Huang, Y.; Zhang, B.; Duan, Y.; 和 Lu, J. 2024. Occworld: 学习用于自动驾驶的3D占用世界模型. 见 欧洲计算机视觉大会, 55–72. Springer. Zhu, S.; Peng, Q.; Pu, Z.; Shu, Z.; Ke, X.; Xing, Z.; Tong, Z.; Wang, Z.; Cui, X.; Wang, H.; 等. 2026. Incantation: 以自然语言作为多实体视频世界模型的动作接口. arXiv preprint arXiv:2605.18601.

第 10 页

A 实验模型信息 表3总结了实验中使用的模型配置。StatePlay增加了一个轻量级的0.76B参数状态分支,同时持续优于游戏世界模型基线。由于大多数模型都构建在来自同一模型家族的基础扩散模型、文本编码器和VAE之上,这些结果进一步证明了我们用于状态感知游戏建模的混合专家Transformer架构(Mixture-of-Transformers, MoT)的有效性。

| 模型 | 参数量 | 基础模型 | 文本编码器 | VAE | | :— | :— | :— | :— | :— | | Matrix-Game | 6.312B | Wan2.2-TI2V-5B | UMT5-XXL | Wan2.2 | | LingBot-World 3.0 | 37.089B | Wan2.1-I2V-A14B(含高/低噪声DiT) | UMT5-XXL | Wan2.1 | | LingBot-World 2.0 | 24.352B | Wan2.1-I2V-A14B | UMT5-XXL | Wan2.1 | | HY-World 1.5 | 18.11B | HunyuanVideo-1.5-480P-I2V | Qwen2.5-VL-7B-Instruct | HYVideo-1.5 | | ReactiveGWM | 5.001B | Wan2.2-TI2V-5B | UMT5-XXL | Wan2.2 | | StatePlay | 5.759B | Wan2.2-TI2V-5B | UMT5-XXL | Wan2.2 |

表3:所评估游戏世界模型的架构配置。

B 状态感知数据集构建 B.1 机制分布平衡标准 为确保多样化机制场景的平衡覆盖,我们根据表4所示的分布构建训练数据集。仅当一个片段同时满足相应的视觉条件和状态条件时,才将其分配到特定类别,从而确保观察到的游戏画面与底层机制之间的一致性。我们为四个状态关键类别各收集了1,000个片段,为正常游戏收集了6,000个片段,共计10,000个训练样本。

| 类别 | 数量 | 视觉条件 | 状态条件 | | :— | :— | :— | :— | | 结果胜利 | 1k | 最终帧出现“You Win” | 玩家HP > 0,NPC HP = 0 | | 结果失败 | 1k | 最终帧出现“You Lose” | 玩家HP = 0,NPC HP > 0 | | 宏指令成功 | 1k | 超必杀技已执行 | 宏指令输入;玩家技能槽 ≥ τ | | 宏指令失败 | 1k | 未执行超必杀技 | 宏指令输入;玩家技能槽 < τ | | 正常 | 6k | 无终局或超必杀技事件 | 无 | | 总计 | 10k | 40% 状态关键,60% 正常 | |

表4:数据集类别与分类标准。

胜利和失败仅在对应的结果画面可见时被识别,而宏指令成功则要求一个清晰执行的超必杀技成功命中对手。

B.2 NPC策略标注 为了鼓励NPC在生成的推演中策略性地与玩家交战,我们遵循ReactiveGWM(Wang et al. 2026a)的方法,并使用Gemini-3.1-Pro(Google DeepMind 2026)将NPC行为分类为三种策略:进攻、控制和防御。详细的标注提示如图5所示。生成的策略标签与对应的视频片段、玩家动作和游戏状态一同包含在训练数据集中。

NPC策略提示

你将获得一段格斗游戏的5秒游戏片段。仅分析NPC的可见行为,并将其策略分类为进攻、控制或防御。不要推断隐藏意图或使用视觉上不可观察的信息。

首先,记录以下事实观察:NPC是否执行拳击、踢击、跳跃攻击、投技、特殊近战攻击或飞行道具攻击;是否向玩家推进;是否受到伤害;是否施加持续的近距离压制;是否蹲下或防御;主要的交战距离(近、中或远);以及哪个角色攻击更频繁。

然后,仅指定一种策略:

  • 进攻:NPC向前推进,在近距离反复攻击,施加持续压制,并且发起的攻击多于玩家。
  • 控制:NPC保持中远距离,避免近距离交锋,并使用一个或多个飞行道具攻击来限制玩家的移动。
  • 防御:NPC执行很少或不执行攻击,不向前推进,主要进行防御、蹲下、后撤、格挡、闪避或对伤害做出反应。

图5:用于分类格斗行为并将多样化策略描述纳入数据集的NPC策略标注提示。

C 失败案例 尽管StatePlay能准确预测有效机制所需的内部状态,但诸如生命条和技能槽等像素级指示器仍可能偶尔出现不一致。当多个机制同时发生时,例如超必杀技与比赛结束同时发生,视觉质量也可能下降。更强的视觉生成能力可能有助于解决这些限制。

D 机制保真度评估细节 为了稳健地评估机制保真度,我们向Gemini-3.1-Pro和GPT-5.5提供明确的视觉规则、固定的决策优先级和参考图像,以判断每个生成的推演是否遵循真实机制。胜利和失败仅在对应的结果画面可见时被识别,而宏指令成功则要求一个清晰执行的超必杀技成功命中对手。完整的提示和参考图像如图6所示。

第 11 页

评估提示(机制保真度)

你正在评估一段生成的《街头霸王3》游戏视频片段。 允许的输出类别:normal、macro_success、macro_fail、result_win 和 result_lose 你必须根据生成视频中实际可见的内容进行分类,而不是根据文件名或真实标签来判断。 重要视觉规则: 1. result_win: 仅当视频中清晰显示玩家的胜利结果画面/文字,尤其是“YOU WIN”, 或与所附 result_win 参考图明确匹配的胜利结果画面时,才选择 result_win。仅出现 K.O. 帧、对手倒地、 胜利姿势、对手血量耗尽或最后一击,但未显示“YOU WIN”/胜利结果画面,则不足以判定。 2. result_lose: 仅当视频中清晰显示玩家的失败结果画面/文字,尤其是“YOU LOSE”, 或与所附 result_lose 参考图明确匹配的失败结果画面时,才选择 result_lose。仅出现 K.O. 帧、玩家 倒地、玩家血量耗尽或对手获胜,但未显示“YOU LOSE”/失败结果画面,则不足以判定。 3. macro_success: 当角色的超必杀技/特殊连段序列被清晰执行并命中或明显影响对手时,选择 macro_success。注意寻找大型超必杀特效、戏剧性的冻结/闪光、电影式连击序列、多段超必杀技,或所附 macro 参考图。无需结束该回合。 4. macro_fail: 当超必杀技/连段序列被清晰尝试但未命中、被格挡、挥空、被打断,或未对对手产生明确命中/效果时,选择 macro_fail。 5. normal: 对于普通游戏过程、模糊的战斗、跳跃/攻击/格挡动作、投技、普通攻击、波动拳、未显示可见的 YOU WIN/YOU LOSE 结果文字的 K.O.,或上述任何特殊/结果状态均未清晰可见的情况,选择 normal。 判定优先级: • 如果“YOU WIN”可见,回答 result_win。 • 否则,如果“YOU LOSE”可见,回答 result_lose。 • 否则,如果超必杀技/连段清晰命中或影响对手,回答 macro_success。 • 否则,如果超必杀技/连段被清晰尝试但失败/未命中/被格挡,回答 macro_fail。 • 否则,回答 normal。 所附参考图像依次为:result_win 参考图、result_lose 参考图、macro/超必杀技参考图 仅返回一个 JSON 对象。不要返回列表。不要包含 markdown。

{ "predicted_state": "normal|macro_success|macro_fail|result_win|result_lose", "matches_gt": true, "confidence": 0.0, "evidence": { "you_win_visible": true, "you_lose_visible": false, "super_art_visible": false, "super_art_hits": false }, "reason": "一句简短的话,指出决定性的可见证据" }

图 6:机制保真度评估提示(上),以及三张真实参考图像(下)。

第 12 页

(a) 超级必杀技

Reactive- GWM

StatePlay

(b) 结果 胜利

Reactive- GWM

StatePlay

(c) 结果 失败

Reactive- GWM

StatePlay

图 7: 由最佳基线模型ReactiveGWM与StatePlay生成的三个示例推演(a)–(c)的定性对比。请放大查看以获得更好的可视效果。

E 状态输入对比 状态输入 机制保真度 (%) 状态对齐度 ↑ 由于StatePlay使用回归目标进行状态预测,我们比较了 广播噪声 Gemini ↑ GPT ↑ 训练期间构建状态输入的两种方式:在所有时间步上广播 初始干净状态,以及向状态序列添加噪声。 ✓ 0.938 78.3±2.4 76.0±0.8 如表5所示,基于噪声的输入在状态对齐度和机制保真度 ✓ 0.947 82.3±0.5 78.3±0.5 上均一致优于广播基线。我们推测,在所有时间步上广播 相同的干净状态会产生过于静态的初始化,这阻碍了模型 表5: 不同状态输入设计的对比。 学习随时间演变的帧动态。因此,遵循先前世界-行动模型 (Hu et al. 2026; Ye et al. 2026) 的做法,我们在训练期间 同时扰动视频潜变量和原始状态。 未明确预测游戏状态,经常生成违反底层游戏机制的推演。 具体而言,图7(a)显示,即使技能槽已满,它也无法执行 F 更多定性对比 超级必杀技。在图7(b)中,当NPC生命值归零后,它没有 显示游戏结果。在图7(c)中,尽管出现了“You Lose”信息, 我们在图7中提供了额外的定性对比。ReactiveGWM和 但后续帧变得模糊和失真,而非过渡到合适的游戏结束画 StatePlay均在相同的状态感知数据集上微调了40,000步。 面。相比之下,StatePlay通过显式建模底层游戏状态,生 尽管训练设置完全相同,仅建模视觉观测的ReactiveGWM, 成了机制一致的推演。

发表评论