Marionette:把几何交给渲染器,把外观留给扩散模型

快速导读:Marionette 将交互式游戏世界模型分解为显式 276 维关节世界状态预测、零参数确定性图形桥渲染和外观视频扩散三部分,使几何与遮挡由构造保证精确,控制通过覆写单个动作 token 实现。

Marionette 的核心主张是:交互式游戏世界模型不应把几何、遮挡、度量运动这些必须精确的结构属性交给像素空间的生成序列去隐式维护。论文将世界模型拆成三部分——两阶段自回归动力学模型输出显式 276 维关节状态,零参数图形桥把状态确定性渲染成三通道姿态控制视频,外观扩散模型再把控制视频画成逼真 RGB。

这一分解的动机类似语言模型智能体调用计算器:神经模型只负责它擅长的不确定部分(外观),而物理上必须精确的部分(几何、遮挡、度量运动)由构造保证。控制只从两处注入——覆写最新动作 token,或覆写根平移与旋转——这使实体级、时间戳精确的控制成为可能。

英文题目:Marionette: Predicting World States, Rendering Geometry, Painting Appearance

论文出处:arXiv 每日论文精选 · arXiv:2608.14530

原始论文:PDF / 论文页面

这篇论文解决什么问题?

现有交互式游戏世界模型直接在像素或潜空间自回归外观。姿态、几何、遮挡等结构化属性由同一生成序列隐式维护,长时程下误差累积,导致一致性与可控性脆弱。视频是高维观测,而底层世界状态是低维的;直接学习 p(video) 把物理、身份与控制纠缠在像素空间。

论文的直觉是:如果几何和遮挡由确定性渲染器保证,神经模型就不需要'学会'它们,也就不存在'学错'它们的可能。这回应了一个具体失败模式——端到端像素自回归基线在长 rollout 中交换怪物身份、漂移几何,而商用视频生成系统在时间戳动作调度下要么不执行、要么延迟执行并交换角色外观。

研究缺口在于:此前没有工作把显式度量关节状态、确定性渲染桥和外观扩散模型组合成一个可长时程自回归、可精确控制的交互式世界模型。WildWorld 提供数据,ARDY 和 Kimodo 提供运动生成先验,Wan2.2-Fun-5B 提供扩散骨干,但组合方式与状态接口是本文的贡献。

核心创新

  • 将世界模型分解为显式度量关节状态 + 零参数确定性渲染桥 + 外观扩散模型,几何与遮挡由构造保证精确
  • 两阶段动力学分解:离散决策(ActionGPT)与连续动画(PoseGPT)分离,控制接口为单 token 覆写
  • 三通道几何缓冲姿态控制视频编码(高度/关节身份/逆深度),使观测模型无需推断几何
  • 在显式状态上施加可行性规则(地形碰撞器、分离上限)修复长时程行为,无需改动观测模型
  • 扫描地形高度场以多层单元表示并同时输入动力学模型与渲染桥

方法概览

三组件流水线:(1) 两阶段自回归动力学模型——ActionGPT(约2.5M参数)逐帧逐实体预测离散动作 token 与根运动,PoseGPT(约25M参数)将动作映射为连续身体姿态,二者共同输出 276 维显式状态 s;(2) 零参数图形桥 R(s) 通过 Gram–Schmidt 正交化、累积和积分、关节放置、相机投影与光栅化将状态转为三通道姿态控制视频(高度、关节身份、逆深度);(3) 基于 Wan2.2-Fun-5B 的控制条件视频扩散观测模型将姿态控制视频渲染为逼真 RGB,并以 chunk-relay 支持长时程。控制仅从两处注入:覆写最新动作 token,或覆写根平移与旋转。

  • 两阶段动力学模型:ActionGPT(约 2.5M 参数)逐帧逐实体预测离散动作 token 与根运动,PoseGPT(约 25M 参数)将动作映射为连续身体姿态,二者共同输出 276 维显式状态 s(表 3,第 12 页)。
  • 零参数图形桥 R(s):通过 Gram–Schmidt 正交化、累积和积分、关节放置、相机投影与光栅化,将状态转为三通道姿态控制视频——高度、关节身份、逆深度(第 12 页)。
  • 观测模型基于 Wan2.2-Fun-5B 的控制条件视频扩散,以 chunk-relay 支持长时程自回归(第 6 页)。
  • 控制接口仅两处:覆写最新动作 token(离散决策层),或覆写根平移与旋转(连续状态层)。
  • 推理时可行性规则:地形碰撞器将穿透关节投影到地形表面,分离上限将两实体距离约束在 6 米内,二者作用于显式状态而非观测模型(第 8 页)。
  • 扫描地形高度场以多层单元表示,同时输入动力学模型与渲染桥,使地形信息在状态层与渲染层共享同一来源。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 8 Qualitative comparison under one timestamped action schedule (stand still until 5 s, then one large melee attack), all systems starting from the same recorded first frame. Our model receives the schedule as injected action tokens. The baseline and the commercial systems receive it as text. Commercial systems render superb appearance but follow the schedule loosely or not at all (Seedance never attacks; Grok attacks seconds late and swaps both characters’ appearance), and the pixel-autoregressive baseline exchanges the monster’s identity. Precise entity-level control at a commanded time is the axis the decoupled state interface provides.

时间戳动作调度下的定性对比:所有系统从同一记录首帧出发,本文模型以注入 token 接收调度,基线与商用系统以文本接收。重点看 Seedance 从不攻击、Grok 延迟且交换角色外观,而本文模型在指令帧精确执行。

核心区分

核心区分
Figure 2 The deterministic bridge on a 12-second generated rollout. Top: pose-control frames rasterized from the predicted state (terrain depth encoding with both entities’ skeletons). Bottom: the RGB frames the observation model renders from them. The geometry shared by the two rows is computed by the bridge, not generated by a neural model.

对比 12 秒生成 rollout 的姿态控制帧(上)与观测模型渲染的 RGB 帧(下)。两行共享同一几何,因为几何由桥确定性计算而非神经生成;检查上下两行的骨架对齐程度即可理解'几何由构造保证'的含义。

架构与控制接口

架构与控制接口
Figure 1 Marionette overview. Bottom: the pipeline. ActionGPT makes discrete per-entity action decisions as a streaming token sequence; PoseGPT turns them into a continuous articulated world state; a zero-parameter graphics bridge renders the state to a pose-control video; a control-conditioned video-diffusion observation model adds appearance. Top: each stage illustrated with recorded data from one moment of a hunter–monster fight. The pose-control render and the game RGB show the same recorded frame through the same camera. Control enters the neural side at two points and nowhere else: editing the newest action token as it streams, and editing the root translation and rotation of the state. Everything the bridge computes from the state is exact by construction; appearance is not, and is the observation model’s to supply.

观察流水线总览:底部展示 ActionGPT→PoseGPT→图形桥→观测模型的完整链路,顶部用同一时刻的猎人-怪物战斗帧对比姿态控制渲染与游戏 RGB。重点看控制注入的两处位置——最新动作 token 与根平移旋转——以及'桥计算的一切由构造精确,外观不是'这一分工。

状态层规则的作用

状态层规则的作用
Table 2 The effect of each rule. Twelve held-out windows, identical checkpoint, bridge commit and seeds; only the rule applied to the state differs. Recorded state is the same measurement on the recorded trajectories of those windows, and is a reference level, not a competing method. CFR, collision-frame ratio: frames with any of 11 key joints below terrain at a 0.15 m margin. MMP, mean maximum penetration depth. Skate, contact-gated foot slide. Sep, monster–hunter distance at the final frame; the separation cap bounds it at 6 m by construction.

规则消融表:同一 checkpoint、同一桥提交、同一种子,只改变作用于状态的规则。CFR、MMP、Skate、Sep 四列分别对应穿透、深度、脚滑、分离距离,记录状态行是参考水平而非竞争方法。

可控性证据与结论

可控性证据与结论
Table 4 State-layer controllability probe at scale. Hunter root-aligned MPJPE (m) at horizon 120, seed context 64 frames, deterministic decoding; 48 held-out segments (mean ± std). Bottom: per-frame error bucketed by the class of the driving token.

可控性探针给出最有力的证据:在 48 段 held-out 片段上,强制注入正确动作 token 的根对齐误差几乎等于自由生成,而注入错误 token 会让误差膨胀三成以上。token 切换演示更直观——三条 rollout 共享种子,切换前像素级一致,第五秒覆写动作后几帧内姿态就分叉。结论是:把世界状态显式化,控制就不再是提示词的祈祷,而是一个可验证的接口操作。

实验如何设计?

  • 观测层对比:Marionette 与端到端像素自回归基线在 12 段 16 秒 rollout 上的 FVD16 对比(表 1,第 7 页)。
  • 状态层规则消融:记录状态 vs 生成状态(无规则/+碰撞器/+碰撞器+分离上限)在 CFR、MMP、Skate、Sep 上的对比(表 2,第 8 页)。
  • 可控性探针:48 段 held-out 片段在 Free/Force-GT/Force-Shuf 三种动作流下的 RA-MPJPE 对比及按动作类别分桶(表 4,第 17 页)。
  • 长时程行为:20 段自由 rollout 的根漂移曲线与逐 chunk FVD 曲线(图 5,第 16 页)。
  • token 切换演示:共享种子下三种注入动作在指令帧执行的定性验证(图 6,第 18 页)。
  • 与商用视频生成系统(Seedance 2.0、Grok Imagine 1.5)在时间戳动作调度下的定性对比(图 8,第 20 页)。

关键结果与论文证据

  • 观测层 FVD16:Marionette 831 vs Pixel-AR 基线 975,bootstrap 区间重叠,点估计偏低但两列重叠是唯一可读信息(表 1,第 7 页)。
  • 最终 chunk FVD:Marionette 1013 vs 基线 1198,长时程下两模型 FVD 均缓慢平滑上升且不分离(图 5B,第 16 页)。
  • 地形碰撞器将 CFR 从 0.337 降至 0.114(-66%),MMP 从 0.444 降至 0.157 m;分离上限将最终帧分离距离从 21.2 m 降至 5.1 m(表 2,第 8 页)。
  • 每条规则只影响其目标量:碰撞器降低穿透而不改变分离,分离上限反之(图 3,第 9 页)。
  • Force-Shuf 使 RA-MPJPE 从 0.272 退化到 0.357 m(+31%),Force-GT < Force-Shuf 在 33/48 段成立(表 4,第 17 页)。
  • 错误 token 误差膨胀按动作类别分异:stationary 2.3×、attack 1.8×、locomotion 1.3×,locomotion 姿态跨 id 差异最小故膨胀最小(图 7,第 19 页)。
  • 预测状态驱动观测模型 FVD 831 vs 记录状态 799,差距很小,说明状态预测质量已接近记录状态(第 9 页)。
  • 商用系统在时间戳调度下外观出色但执行松散或完全不执行:Seedance 从不攻击,Grok 延迟数秒且交换角色外观(图 8,第 20 页)。

阅读时需要注意

  • 外观随长时程漂移:姿态控制视频固定了几何但未约束外观,外观身份仅靠 chunk-relay 种子传播并衰减;修复方案为每 chunk 重新供给实体参考图像(第 9 页)。
  • 记录状态覆盖不全:AI 同伴和小型怪物有 RGB 但无记录关节,观测模型学会自行补充这些实体,导致推理时出现无状态支撑的内容(第 9 页)。
  • 观测模型在 GT 姿态上训练、在生成姿态上推理,存在分布偏移;可通过可行性规则投影和训练时扰动 GT 状态缓解(第 9 页)。
  • 动力学模型仅覆盖单一怪物类型(173 动作词表),多怪物动作空间近于不相交,扩展需重训。
  • 可微穿透/接触惩罚被优化器通过拉伸骨骼规避(骨长误差从 3% 升至 13%),规则仅在优化器无法交易的位置才稳定(第 13 页)。

关联工作

  • WildWorld [36]:本文数据来源,提供帧级动作标签与逐实体状态(第 10 页)。
  • ARDY [93]:自回归运动生成,显式根与潜身体嵌入的混合表示,可直接供给动画阶段(第 3 页)。
  • Kimodo [54]:大规模运动扩散模型,支持文本+末端执行器/路径点/关键帧约束(第 3 页)。
  • Wan2.2-Fun-5B [48, 65]:观测模型的 DiT 视频扩散骨干(第 6 页)。
  • FVD [63]:观测层感知与时间质量指标(第 7 页)。

发表评论