三分钟导读:WorldWeaver通过引入动态更新的世界状态寄存器(World State Registers)和混合Transformer架构,解决了Multi-Agent视频生成中跨视角逻辑一致性和全局状态保持的难题。
英文题目:STREAMING MULTI-AGENT AUTOREGRESSIVE DIFFUSION MODEL WITH WORLD STATE REGISTERS
论文出处:arXiv 每日论文精选 · arXiv:2607.21594
原始论文:PDF / 论文页面
对应视频标题:WorldWeaver:利用世界状态寄存器解决Multi-Agent视频生成的逻辑一致性难题|推荐指数:★★★★★
这篇论文解决什么问题?
现有的自回归视频扩散模型主要依赖局部帧历史(KV缓存)作为条件,难以在Multi-Agent或多视角设置中维持共享的、逻辑一致的世界状态,导致跨 Agent交互和长期生成的连贯性不足。
核心创新
- 世界状态寄存器(WSR):一种持久且动态更新的token集合,用于跨 Agent和 rollout 步骤携带共享世界信息。
- 多源监督信号:通过Agent状态(Agent status)、鸟瞰图(Bird's-eye view)和场景文本(Scene text)对WSR进行显式 grounding。
- 混合Transformer(MoT)架构:为WSR和帧token分配独立的权重分支,解决状态建模与视觉生成之间的参数冲突。
- 自强制训练策略:在训练阶段模拟推理时的自回归 rollout,暴露并纠正帧和状态寄存器的累积漂移。
方法概览
提出WorldWeaver,一种流式Multi-Agent视频扩散模型。核心创新是引入“世界状态寄存器”(WSR),这是一组可学习的token,用于存储共享的世界信息和个体 Agent状态,并在每次生成块后动态更新。训练分为三阶段:1) 双向训练(Multi-Agent教师模型);2) 因果训练(引入WSR及辅助监督信号);3) 自强制训练(Self-Forcing,模拟推理时的误差传播)。架构上采用混合Transformer(MoT)分离状态和视觉分支的参数。
逐图理解论文
方法概述:WorldWeaver架构

WorldWeaver通过引入动态更新的世界状态寄存器来解决上述难题。核心创新是引入世界状态寄存器,这是一组可学习的token,用于存储共享的世界信息和个体 Agent状态,并在每次生成块后动态更新。架构上采用混合Transformer,分离状态和视觉分支的参数。
创新点:世界状态寄存器

世界状态寄存器是一种持久且动态更新的token集合,用于跨 Agent和生成步骤携带共享世界信息。通过Agent状态、鸟瞰图和场景文本对寄存器进行显式接地,鼓励世界状态寄存器编码全局场景信息,从而提升生成的逻辑连贯性。
实验设置:MinecraftMulti-Agent任务

我们在基于SolarisEngine的双 AgentMinecraft视频生成任务上进行评估。与Frame concat和Solaris基线模型进行对比。消融实验分析不同监督信号对世界状态寄存器的贡献,并对比Dense Transformer与混合Transformer架构的效果。
主要结果:性能显著提升

实验结果显示,WorldWeaver在WorldScore上达到105.1,超越Solaris基线的81.0。Grounding VLM准确率从81.3提升至93.8,Consistency VLM准确率从57.8提升至76.6。Building VLM准确率从9.4大幅提升至28.1,表明场景理解能力显著增强。
定性分析:状态可解释性

定性可视化展示了生成的世界及解码的世界状态,包括Agent统计、鸟瞰图和场景文本。世界状态寄存器 rollout 允许模型生成逻辑连贯的世界,并更好地同步跨 Agent信息。此外,寄存器提供了更可解释的方式来检查每个生成块所代表的状态。
实验与关键结果
- 在基于SolarisEngine的双 AgentMinecraft视频生成任务上进行评估。
- 与Frame concat和Solaris基线模型进行对比。
- 消融实验分析不同监督信号(Agent状态、鸟瞰图、场景文本)的贡献。
- 消融实验对比Dense Transformer与MoT架构的效果。
- 半监督训练实验:评估在少量标注数据(带鸟瞰图)和大量无标注数据下的性能。
- WorldScore 105.1 (超越Solaris的81.0)(第 8 页)
- Grounding VLM准确率从81.3提升至93.8(第 8 页)
- Consistency VLM准确率从57.8提升至76.6(第 8 页)
- Building VLM准确率从9.4提升至28.1(第 8 页)
- MoT架构在场景文本监督下WorldScore达103.2,优于Dense的91.3(第 10 页)
- 半监督训练下,加入10K无标注数据后WorldScore提升至90.3(第 10 页)
阅读时需要注意
- 现实世界中的复杂状态信息(如底层3D几何细节、高层语义关系)通常不可直接获取,当前方法依赖模拟器提供的显式标注。
- 场景文本标注由大模型离线生成,可能无法完全捕捉超出Agent直接视野的广阔场景上下文。
- WorldScore是一个辅助排名指标,对FID尺度敏感,主要评估指标应为VLM准确率和FID。
- MoT架构的优势依赖于显式的状态监督,若无监督信号,MoT并未自动优于Dense架构。
关联工作
- Solaris:基线模型,提供Multi-Agent世界模型设定和数据收集引擎。(第 3 页)
- Diffusion Forcing:流式自回归扩散的基础,提供因果注意力机制。(第 5 页)
- Self-Forcing:用于减少训练-测试分布差异的自强制范式。(第 2 页)
- Mixture-of-Transformers (MoT):用于分离不同模态/token角色权重的架构设计。(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
预印本。
带有世界状态寄存器的流式Multi-Agent自回归扩散模型
Sicheng Mo* 1 Yuheng Li* 2 Ziyang Leng1 Krishna Kumar Singh2 Bolei Zhou1
1加州大学洛杉矶分校 2 Adobe Research
A 过去帧上下文 B 世界状态寄存器 C 生成帧 Agent 1 Agent统计信息 Agent 1
动态更新
2026 鸟瞰图 Agent 2 Agent 2
场景文本Jul 总体:Alpha 保持 总体:Alpha 保持 总体:Alpha 保持 静止,面向 Bravo,而 静止,而 Bravo 静止,而 Bravo Bravo 向左转 34 向前移动并向 向前移动并向 度,同时保持 右转,同时保持 右转,同时保持 两者之间的距离 两者之间的距离 较近距离23 它们都看着 它们面对面站在 它们之间,其中 彼此。 平坦的草地上。 Alpha 面向 Bravo 并 看向地平线。
图 1:我们的模型支持在共享世界中交互的Agent。在 rollout( rollout 过程)期间,一组 寄存器 token 表示跨 Agent共享的 evolving(不断演变)的世界状态。该状态捕捉Agent[cs.CV] 状态、鸟瞰图和场景文本,并在生成新帧的每个 rollout 步骤时进行动态更新。
摘要
Multi-Agent交互世界模型不仅应生成一致的观察结果,还应维护跨 Agent持久存在 并跨视图演变的世界状态。现有的自回归视频扩散流水线将观察历史作为条件上下文 传递,这使得在Multi-Agent和多视图设置中难以维持共享状态。我们提出了 WorldWeaver (W2), 一种流式Multi-Agent视频扩散模型,它通过跨 Agent世界状态寄存器增强 rollout: 可学习的 token,用于存储共享的世界信息,跟踪各个Agent的状态,并在每个生成的块之后 进行动态更新。 我们通过涵盖各个Agent状arXiv:2607.21594v1 态、包括鸟瞰图在内的全局状态视图以及场景文本的监督信号来对这些寄存器进行约束。我们进一步 使用 Mixture-of-Transformers(混合 Transformer)设计改进了架构,该设计为 世界状态建模和视觉帧建模使用独立的权重。在双Agent Minecraft 视频生成的广泛 实验中,显式的世界状态建模提高了逻辑一致性和生成质量。项目页面: https://vail-ucla.github.io/worldweaver/
- 同等贡献。
1
第 2 页
预印本。
1 引言
生成建模的最新进展使得日益强大的交互式流式世界模型(WMs)成为可能(ope; Savva 等, 2026)。大多数视频世界模型从单个Agent的视角模拟场景。虽然这种设计可以产生视觉上合理的帧,但维持逻辑和几何一致性具有挑战性。在Multi-Agent设置中(Savva 等, 2026),这一问题被进一步放大,因为每个观察者只能看到同一潜在 3D 世界的部分 2D 投影,而跨 Agent的观察必须与该共享状态保持一致。除了这些跨 Agent约束外,无论特定观察者是否看到,世界状态都在持续演变。这一视角促使我们直接对潜在的世界状态进行建模,而不是将一致性视为每Agent视频生成的副产品。
基于块自回归视频扩散模型(Chen 等, 2024; Yin 等, 2024)可以生成时间一致的视频。在这种流水线中,过去的帧被视为条件上下文,模型通过联合时空注意力生成下一个视频块。然而,由于每个块都必须解码为像素空间,模型需要在每个生成步骤中重新推断世界信息。因此,它保留的是有限的观察历史,而不是能够解释观察到的和未观察到的变化的显式世界状态。在多视图设置中,这进一步引入了每个Agent的观察与共享世界状态之间的不匹配。
为了解决这个问题,我们在生成过程中显式地对世界状态进行建模,而不是让它们从帧历史中反复推断。我们引入了一个世界状态寄存器(World State Registers, WSR),这是一组可学习的 token,用于捕获共享的世界信息,并在生成过程中被增量更新。该寄存器旨在携带持久的全局信息和各个Agent的状态。我们为这个世界状态寄存器定义了两个关键属性:(1) 在Agent和 rollout 步骤之间具有持久性,以及 (2) 当新观察到来时可动态更新。通过这种方式,所有Agent的观察都贡献于世界状态的更新,从而在潜在世界状态层面鼓励时间和跨 Agent的一致性。
为了促进长视距视频生成,我们调整了 Self-Forcing 范式(Huang 等, 2025),以在 rollout 期间同时更新帧和世界寄存器。在每次去噪视频块之后,模型从之前的寄存器和新生成的观察中刷新世界寄存器,以便更新的寄存器可以为下一个块提供条件。我们进一步利用互补的监督信号对寄存器进行 grounding:Agent状态鼓励局部运动一致性,鸟瞰图约束全局几何结构,场景文本提供语义 grounding。我们还探讨了半监督世界状态训练的效果,其中一小部分标记数据可以锚定寄存器语义,而额外的未标记视频继续改善生成 rollout。
我们还研究了扩散模型中世界状态建模的架构。当密集 transformer 权重必须生成像素并更新世界寄存器时,帧和状态目标可能会相互竞争,尤其是当寄存器被推向更丰富的监督语义时。因此,我们使用混合 Transformer(Mixture-of-Transformers, MoT)架构(Liang 等, 2024),将世界寄存器分支视为独立的状态路径,同时使其与视觉 rollout 耦合。这种分离改善了监督下的寄存器学习,并稳定了流式生成期间的帧寄存器自强制(Self-Forcing)。
我们将我们的贡献总结如下:
1. 我们引入了世界状态寄存器的新设计,这是一组持久且可动态更新的 token,用于在Agent和 rollout 步骤之间携带共享的世界信息。 2. 我们探索了用于 grounding 世界状态的监督空间,范围从单个Agent状态到鸟瞰图和场景文本等全局世界状态信号。 3. 我们提出了一种改进的基于 MoT 的视频扩散模型架构,支持世界状态和视频帧的联合生成。我们的实验表明,这种设计提高了性能,并减少了状态更新与帧生成之间的冲突。
2 相关工作
流式视频扩散模型。大规模扩散模型为图像和视频生成提供了灵活的基础。视频扩散模型(ope; Ma 等, 2024; Wang 等, 2023)使用双向注意力来合成连贯的视觉内容,并在…下实现平滑的时间过渡。
2
第 3 页
预印本。
共享文本条件。基于这些骨干网络,自回归视频扩散方法(Chen et al., 2024; Yin et al., 2024)引入了块级因果注意力和 KV 缓存以支持流式生成。Self-Forcing(Huang et al., 2025)通过在训练期间使用模型自身生成的帧进行 rollout,进一步减少了训练与测试之间的不匹配,而最近的扩展研究(Shin et al., 2025; Cui et al., 2025; Zhu et al., 2026; Zhao et al., 2026)则通过注意力汇聚(attention sinks)和更强的位置编码改进了分钟级流式生成。这些进展使得长视域生成日益可行,但它们的主要目标仍然是生成质量和 rollout 稳定性。相比之下,我们的 WorldWeaver 基于流式视频扩散进行交互式生成,并使用持久化的世界状态寄存器(World State Registers, WSR)来生成逻辑一致的世界,其中时间和跨 Agent的一致性建立在超出局部上下文窗口的显式状态基础之上。
基于记忆的视频生成。记忆机制已在视频生成中得到广泛探索,以保留当前帧或局部上下文未完全指定的信息,包括外观、身份、几何结构、物体状态和场景布局。显式记忆方法引入检索缓冲区、空间地图、3D 表示或 4D 场景记忆,供生成器参考 Xiao et al. (2026); Yu et al. (2025; 2026)。这种设计与 3D 新视角合成密切相关,因为两者都使用可查询的场景表示来跨视角保留几何、外观和布局 Team et al. (2026); Yang et al. (2026b); Sun et al. (2025)。然而,现有的显式建模在可扩展性方面仍受限,并且需要随时间更新动态物体状态。隐式记忆方法通过过去帧条件、循环 rollout 或注意力 KV 缓存将历史存储在生成模型内部 Chen et al. (2024); Yin et al. (2024); Huang et al. (2025); Zhao et al. (2026); Gao et al. (2026),但由于记忆与视觉 token 纠缠且偏向近期观测,它们提供的约束较弱。另一条工作路线也重视状态建模在生成视频中的作用,以确保逻辑正确性(Liu et al., 2026; Po et al., 2025; Chen et al., 2025; Po et al., 2026)。相比之下,我们的方法将记忆保留在生成器内部作为持久化的世界状态寄存器,但将其作为隐式记忆进行训练,并接受来自单个Agent状态和全局场景状态的显式监督,因此存储的状态获得了直接的世界生成基础,超越了仅基于帧历史。
统一模型中的世界理解与生成。视觉生成与理解并未完全解耦。文生图扩散模型已显示出用于分类(Li et al., 2023; Clark & Jaini, 2023)、检测(Xu et al., 2024)和分割(Xu et al., 2023; Tian et al., 2024; Namekata et al., 2024)等判别性任务的有用视觉表示。一条统一的多模态模型路线通过训练单一模型同时执行文生图生成和图生文理解,进一步明确了这一联系(Zhou et al., 2024; Wang et al., 2024; Xie et al., 2024)。另一条工作路线(Mo et al., 2025; Shi et al., 2024; Deng et al., 2025; Yang et al., 2026a),包括 Mixture-of-Transformers(Liang et al., 2024),探索为不同模态和 token 角色使用独立的权重或专用的融合模块,将统一的多模态预训练扩展到更广泛的交错和上下文丰富设置。同时,MetaMorph(Tong et al., 2025)和 X-Fusion(Mo et al., 2025)表明,理解任务可以通过塑造更强的多模态表示来改善生成。我们的 WorldWeaver 基于这些观察,并通过世界状态寄存器进一步探索世界理解与生成之间的协同作用。这些寄存器提供了一种结构化且可验证的表示,并辅以来自单个Agent状态和全局场景状态的额外基础。
3 方法
3.1 概述
我们采用 Solaris(Savva et al., 2026)的Multi-Agent世界模型设置。多个Agent在共享世界中行动,模型根据过去的观测和行动预测每个Agent的未来视频流。我们通过为每个生成的张量附加一个玩家轴,扩展了单玩家潜在视频扩散管线。这为同步的Multi-Agent生成提供了紧凑的张量设置。对于 P 个Agent,每步的观测和行动为 $x_t = (x_{t1}, \dots, x_{tP})$ 和 $a_t = (a_{t1}, \dots, a_{tP})$。由 N 个潜在帧组成的片段形成 $x \in \mathbb{R}^{P \times N \times H \times W \times C}$。条件 $c$ 捆绑了第一帧视觉嵌入、掩码的第一帧潜在向量以及每个Agent的动作序列,具体维度推迟到实验中说明。我们在下面的小节中介绍特定阶段的目标。
3
第 4 页
预印本。
低信噪比 高信噪比 低信噪比 高信噪比 世界状态 空间去噪 寄存器 空间去噪 新状态更新 干净 噪声内容 Xt0 𝑅0 帧内容KV 随不同帧KV信噪比变化
KV缓存 KV缓存 新状态更新 旧状态移除 时间 AR Xt1 … 𝑅1 rollout KV缓存 KV缓存 新状态更新 旧状态移除
Xt2 … … 𝑅2
(A) 无世界状态寄存器的 rollout (B) 带世界状态寄存器的 rollout ( ours)
𝐶1 𝑅1 𝐶2 𝑅2 𝐶3 𝑅3 𝐶4 z 𝐶1 𝑅1𝑅1𝑅1𝑅1 Agent解码器统计信息
𝑅1 X y
𝐶2 鸟瞰图 𝑅2 𝐶1 𝑅1 𝐶2 𝑅2 𝐶3 𝑅3 解码器
𝐶3 DiT 总体:Alpha保持 𝑅3 空闲,面向Bravo,同时 左转34度, 保持 距离 它们 之间 朝着彼此。 (C) 训练期间的因果掩码 (D) 世界状态寄存器的监督
图2:流程概览。(A) 标准的流式自回归扩散模型从局部KV缓存窗口中对每个新帧进行去噪。(B) 我们的模型使用世界状态寄存器进行流式处理,这些寄存器携带全局状态信息和各个Agent的状态。(C) 第二阶段训练期间的因果注意力掩码。帧令牌关注局部窗口和最新的寄存器。(D) 辅助解码器利用Agent状态、鸟瞰图地图和场景文本对寄存器进行 grounding,鼓励世界状态寄存器编码全局场景信息。
接下来,我们将世界状态寄存器作为独立的跨 Agent状态路径引入。这些寄存器是可学习的 token,用于捕获关于共享世界的隐藏信息。它们在Agent之间共享,并随着新帧的生成而增量更新。寄存器与帧 token 共存于因果 Transformer 中,因此单次前向传播即可同时去噪下一帧并刷新跨 Agent世界状态。我们进一步采用混合Transformer (MoT) 设计,为寄存器和帧 token 分配独立的权重分支,同时在交错序列上保持联合注意力。详细实现见附录 B.2。
我们的模型在标准的单Agent预训练基础上遵循三阶段训练课程。阶段 1(双向训练)在同步的Multi-Agent片段上微调多玩家教师模型。该教师模型拥有完整的时间上下文,并通过双向注意力学习跨 Agent场景结构。阶段 2(因果训练)通过结合因果注意力和寄存器监督的流匹配目标,将此教师模型转换为因果学生模型。阶段 3(自强制训练)在学生模型自身的预测上进行 rollout。在每生成一帧后,模型会提交更新后的寄存器,从而使寄存器漂移与帧漂移一同暴露。此阶段使用来自双向教师模型的 DMD 风格分布匹配,同时保留状态监督。
3.2 阶段 1:双向训练
阶段 1 训练一个多玩家双向教师模型,该模型在双向和跨玩家注意力下联合去噪所有玩家的潜在序列。该教师模型提供同步场景结构的完整时间估计,包括共享布局、玩家相对运动和跨视角一致性。我们从预训练的单人模型初始化该教师模型,以保留视觉生成先验,同时使模型适应同步多玩家数据。我们使用条件流匹配目标训练该教师模型,该目标预测速度场 $v_\theta(x_t, c, t)$:
$\mathcal{L}_{\text{flow}} = \mathbb{E} \left[ \| v_\theta(x_t, c, t) – (\epsilon – x_0) \|_2^2 \right]$. (1)
4
第 5 页
预印本。
3.3 阶段 2:使用世界状态寄存器的因果训练
在此阶段,我们从双向阶段 1 的检查点初始化因果模型,并使用上述定义的流匹配损失继续训练。遵循 Solaris (Savva et al., 2026) 和 Diffusion Forcing (Chen et al., 2024) 的做法,我们为每个Agent和潜在帧采样独立的噪声水平,应用块级因果掩码,并仅维护最近 W 个潜在帧的滑动窗口。这种训练赋予学生模型自回归生成能力,其中每一帧都基于动作输入和过去帧进行条件生成。然而,这种设计无法在局部上下文窗口之外对世界建模进行 grounding(锚定/基础化),因此可能无法保持跨 Agent共享的逻辑一致的世界。
为了解决这个问题,我们显式地对世界状态进行建模,而不是仅依赖局部帧历史。世界状态表示特定时间步的持久信息,并总结共享场景,包括全局布局、物体配置和Agent状态,这些信息可能无法从每个Agent的当前视角中看到。通过跨 rollout 步骤携带此状态,世界模型可以同步跨 Agent的预测,并保持逻辑一致的跨 Agent交互。在实践中,我们将世界状态寄存器(WSR)定义为一组可学习的 K 个 token $r_i \in \mathbb{R}^{K \times d}$。我们使用 WSR 正式定义世界模型的流式机制如下:
$$r_i = G_\theta(r_{i-1}, x_{i-W+1}, \dots, x_i, a_i), \quad p_\theta(x_{i+1} | x_{i-W+1}, \dots, x_i, a_{i+1}, r_i).$$
在 rollout 期间,每个寄存器 $r_i$ 在上下文帧 $x_i$ 生成后被提交(committed),从而作为通过帧 i 的状态摘要,用于条件化下一个上下文帧。
受 Diffusion Forcing (Chen et al., 2024) 中因果掩码的启发,我们将帧 token 和寄存器组交错排列为 $[x_0, r_0, x_1, r_1, \dots, x_{F-1}, r_{F-1}]$。这种排序使得 rollout 在状态层面具有因果性:提交的寄存器 precedes(位于…之前)下一个帧,且该帧以该寄存器为条件。具体来说,$r_i$ 位于 $x_{i+1}$ 之前并为其提供条件,因此状态更新和帧预测在序列中交替进行。结合大小为 W 的局部注意力窗口,每个寄存器查询关注以提交步骤结束的相同局部上下文帧,以及紧邻的前一个寄存器。因此,$r_i$ 的寄存器查询关注 $[x_{i-W+1}, \dots, x_i]$ 和 $r_{i-1}$,如图 2(C) 所示。
阶段 2 在单个训练目标内保持流匹配损失和寄存器监督,其中流匹配项在提交的寄存器下为学生模型提供帧级监督。然而,仅凭此信号并未指定 WSR 路径应保留哪些信息。因此,我们使用辅助世界状态预测对每个提交的寄存器进行 grounding,如图 2(D) 所示。对于每种监督类型 $m \in \mathcal{M}$,预测头输出 $h_m(r_i)$、相同的步骤目标 $y^m_i$ 以及度量 $d_m$ 使预测、目标和距离计算显式化。在我们的实验中,我们使用三种监督信号:
1. Agent状态。预测头预测模拟器状态向量 $\hat{y}^{\text{agent}}_i = h_{\text{agent}}(r_i)$,目标 $y^{\text{agent}}_i$ 包含位置、速度和方向。我们使用 $d_{\text{agent}} = \|\hat{y}^{\text{agent}}_i – y^{\text{agent}}_i\|_2^2$。 2. 鸟瞰图。预测头预测鸟瞰图 $\hat{y}^{\text{bev}}_i = h_{\text{bev}}(r_i)$,由对齐的鸟瞰目标 $y^{\text{bev}}_i$ 监督。我们使用 $d_{\text{bev}} = 1 – \cos(\hat{y}^{\text{bev}}_i, \phi_{\text{DINOv2}}(y^{\text{bev}}_i))$,其中 $\phi_{\text{DINOv2}}$ 表示冻结的 DINOv2 编码器 (Oquab et al., 2024)。 3. 场景文本。预测头预测 token 逻辑值 $\hat{y}^{\text{text}}_i = h_{\text{text}}(r_i)$,目标 $y^{\text{text}}_i$ 是文本场景描述。我们使用 $d_{\text{text}} = \text{CE}(\hat{y}^{\text{text}}_i, y^{\text{text}}_i)$。
结合流匹配损失,我们使用以下目标训练学生模型:
$$\mathcal{L}_{\text{reg}} = \sum_{i,m} \lambda_m d_m(h_m(r_i), y^m_i), \quad \mathcal{L}_{S2} = \mathcal{L}_{\text{flow}} + \lambda_{\text{state}} \mathcal{L}_{\text{reg}}.$$
这里的求和遍历 rollout 步骤和三种目标类型,我们在阶段 2 中将 $\lambda_{\text{state}}$ 默认设置为 1。在阶段 2 目标中,$\mathcal{L}_{\text{flow}}$ 仍然是帧生成的流匹配损失,而 $\mathcal{L}_{\text{reg}}$ 为提交的寄存器分配显式状态目标。预测头是仅用于训练的模块,在推理时被丢弃,因此这种监督不会改变 rollout 成本。我们在第 4.3 节中对这些监督类型进行了消融实验。
5
第 6 页
预印本。
算法 1 带世界状态寄存器的自回归扩散推理 要求:帧 KV 缓存大小 $W$ 要求:条件 $C$ 要求:去噪时间步 $\{t_1, \dots, t_T\}$ 要求:生成帧数 $M$ 要求:因果自回归扩散模型 $G_\theta$,通过 $G_\theta$ 返回 KV 1: 初始化生成的潜变量 $X_\theta \leftarrow [\ ]$ 2: 初始化帧 KV 缓存 $KVC \leftarrow [\ ]$ 3: 初始化寄存器 KV 缓存 $KVR \leftarrow [\ ]$ 4: 初始化世界状态 $r_0$ 5: $KVR.\text{append}(r_0)$ 6: for $i = 1, \dots, M$ do 7: 初始化 $x_{iT}^i \sim \mathcal{N}(0, I)$ 8: for $j = T, \dots, 1$ do 9: 设置 $KV \leftarrow (KVC, KVR)$ 10: 设置 $\hat{x}_i^0 \leftarrow G_\theta(x_{ij}^i; t_j, KV, c_i)$ 11: if $j = 1$ then 12: $X_\theta.\text{append}(\hat{x}_i^0)$ 13: 设置 $KV_i^C \leftarrow G_\theta(\hat{x}_i^0; 0, KV, c_i)$ 14: if $|KVC| = W$ then 15: $KVC.\text{pop}(0)$ 16: end if 17: $KVC.\text{append}(KV_i^C)$ 18: 设置 $r_i \leftarrow G_\theta(KVR, \hat{x}_i^0, c_i)$ 19: 设置 $KVR \leftarrow [r_0, r_i]$ 20: else 21: 采样 $\epsilon \sim \mathcal{N}(0, I)$ 22: 设置 $x_{i,j-1}^i \leftarrow \Psi(\hat{x}_i^0, \epsilon, t_{j-1})$ 23: end if 24: end for 25: end for 26: return $X_\theta$
算法 2 带帧和状态寄存器展开的自强制训练 要求:条件 $C$ 要求:去噪时间步 $\{t_1, \dots, t_T\}$ 要求:视频帧数 $N$ 要求:因果自回归扩散模型 $G_\theta$,通过 $G_\theta$ 返回 KV 1: loop 2: 初始化生成的潜变量 $X_\theta \leftarrow [\ ]$ 3: 初始化帧 KV 缓存 $KVC \leftarrow [\ ]$ 4: 初始化寄存器 KV 缓存 $KVR \leftarrow [\ ]$ 5: 初始化世界状态 $r_0$ 6: $KVR.\text{append}(r_0)$ 7: 采样 $s \sim \text{Uniform}(1, \dots, T)$ 8: for $i = 1, \dots, N$ do 9: 初始化 $x_{iT}^i \sim \mathcal{N}(0, I)$ 10: for $j = T, \dots, s$ do 11: 设置 $KV \leftarrow (KVC, KVR)$ 12: 设置 $\hat{x}_i^0 \leftarrow G_\theta(x_{ij}^i; t_j, KV, c_i)$ 13: if $j = s$ then 14: $X_\theta.\text{append}(\hat{x}_i^0)$ 15: 设置 $KV_i^C \leftarrow G_\theta(\hat{x}_i^0; 0, KV, c_i)$ 16: $KVC.\text{append}(KV_i^C)$ 17: 设置 $r_i \leftarrow G_\theta(0, KV, c_i)$ 18: 设置 $KVR \leftarrow [r_0, r_i]$ 19: else 20: 采样 $\epsilon \sim \mathcal{N}(0, I)$ 21: 设置 $x_{i,j-1}^i \leftarrow \Psi(\hat{x}_i^0, \epsilon, t_{j-1})$ 22: end if 23: end for 24: end for 25: 使用 $L_{S3}$ 更新 $\theta$,并在学生展开上更新 $s_{\text{fake}}$ 26: end loop
3.4 阶段 3:带上下文帧和状态展开的自强制
我们将推理展开定义为我们世界模型在部署时使用的自回归过程。 在每一步中,模型从当前帧 KV 缓存、最新提交的寄存器和动作输入中对下一个潜变量帧进行去噪。 然后,它将生成的帧附加到缓存中,并刷新世界状态寄存器以总结更新后的世界状态。算法 1 给出了这种推理展开,图 2(B) 可视化了相同的帧寄存器循环。
然而,阶段 2 的模型尚未准备好进行长视距展开。教师强制训练使用真实因果上下文训练学生,而推理使用其自身生成的帧和提交的寄存器,允许帧和状态错误在展开过程中传播。遵循自强制(Self-Forcing)方法,阶段 3 通过在训练期间模拟这种展开,并将因果学生暴露于其自身生成的历史中,来解决这种不匹配问题。我们将自强制训练循环定义为:首先在学生生成的上下文帧和提交的寄存器上运行学生,然后对产生的干净预测应用自强制目标。算法 2 总结了该循环。
应用自强制(Huang et al., 2025)中的 DMD 生成器目标,我们用新鲜噪声扰动展开预测,$\hat{x}_t = (1 – t)\hat{x}_0 + t\epsilon$,其中 $\epsilon \sim \mathcal{N}(0, I)$,并使用以下公式训练学生:
$$ L_{sf} = \mathbb{E}_{t,\epsilon} \left[ \|\hat{x}_0 – s_g(\hat{x}_0 – (s_{\text{fake}}(\hat{x}_t, c, t) – s_{\text{real}}(\hat{x}_t, c, t)))\|_2^2 \right] \quad (2) $$
其中 $s_g(\cdot)$ 表示停止梯度,$s_{\text{real}}$ 是一个从阶段 1 教师初始化的冻结评分网络,$s_{\text{fake}}$ 是一个在学生展开上的可训练判别器。因为在展开过程中帧 $x_i$ 会提交 $r_i$,阶段 3 在编码已完成上下文帧世界状态的寄存器上重用相同的寄存器损失:
$$ L_{S3} = L_{sf} + \lambda_{\text{state}} L_{\text{reg}}. $$
6
第 7 页
预印本。
同样,我们在第 3 阶段默认将 $\lambda_{state}$ 设置为 1。在实践中,我们遵循 Solaris (Savva et al., 2026) 的做法,使用四步去噪调度,时间步为 $1000 \rightarrow 750 \rightarrow 500 \rightarrow 250 \rightarrow 0$,并在 rollout 期间采样早期退出的去噪步骤以进行随机梯度截断。在此阶段,我们发现仅靠 DMD 损失不足以提高稳定性,因为世界状态寄存器 (WSR) 建模也存在漂移问题。因此,我们相对于第 2 阶段增加了所选每头寄存器监督权重,这有助于训练更好的寄存器并稳定长视界 rollout。
4 实验
在本节中,我们首先在 4.2 节介绍主要结果,然后在 4.3 节分析每种监督信号的贡献,在 4.4 节研究模型架构,并在 4.5 节讨论半监督训练。
4.1 实验设置
训练数据。我们基于 SolarisEngine (Savva et al., 2026) 的数据收集管线构建。我们收集了约 126 小时同步的双人视频,包含丰富的Agent状态信息以及额外的鸟瞰图摄像头画面。我们进一步使用 Qwen2.5-VL-72B-Instruct (Bai et al., 2025) 对每个 4 帧片段的场景文本进行标注。详细的数据收集和标注见附录 A。
评估。我们在 Solaris 原始测试集 (Savva et al., 2026) 上评估我们的模型。对于每个片段,模型接收两名玩家的第一帧观测和完整动作序列,然后生成剩余的 rollout。我们报告每个评估类别的视觉语言模型准确率 (VLM accuracy) 和 Fréchet Inception Distance (FID)。VLM accuracy 衡量生成的视频是否保留了查询的世界关系,如相对物体位置和跨玩家一致性,而 FID 衡量视觉真实感和分布保真度。为了在不替代任一指标的情况下总结这两个维度,我们还报告了一个辅助世界分数: $$ \text{WorldScore} = \frac{\frac{1}{K} \sum_{k=1}^{K} \text{VLM}_k}{\frac{1}{K} \sum_{k=1}^{K} \text{FID}_k}, \quad (3) $$ 其中 $K = 5$。我们以百分点报告 VLM accuracy,并将比率乘以 100 以提高可读性。由于 WorldScore 是无界的且对 FID 的尺度敏感,我们仅将其用作辅助排名指标。VLM accuracy 和 FID 仍然是主要指标。
4.2 主要结果
我们将我们的 WorldWeaver Multi-Agent世界模型与以下基线进行比较:(1) Frame concat:一种世界模型,沿通道维度连接两名玩家的观测,遵循 Multiverse (team, 2025);(2) Solaris (Savva et al., 2026):一种Multi-Agent世界模型,通过扩展帧 token 序列并在玩家间使用双向注意力来同步Multi-Agent观测。为了确保公平比较,我们使用与我们的模型相同的训练数据重新训练了 Solaris 模型。
如表 1 所示,WorldWeaver 将聚合世界分数提高到 105.1,大幅超越了之前的最佳成绩。VLM accuracy 的提升在状态敏感类别中最为显著。与 Solaris 基线相比,Grounding 从 81.3 提升至 93.8,Building 从 9.4 提升至 28.1,Consistency 从 57.8 提升至 76.6。这些提升表明,持久寄存器所做的不仅仅是提高视觉保真度:它们帮助模型在玩家和 rollout 步骤之间维持一个逻辑连贯且可验证的世界模型。
图 3 可视化了生成的世界以及解码的世界状态,包括Agent统计信息、鸟瞰图地图和场景文本。对于Agent统计信息,我们选择性可视化位置和轨迹。对于鸟瞰图地图,我们使用主成分分析 (PCA) 将预测的 DINOv2 (Oquab et al., 2024) 特征投影到 RGB 图像上。世界状态寄存器 (WSR) rollout 使 WorldWeaver 能够生成逻辑连贯的世界,并更好地同步跨 Agent信息。此外,WSR 提供了一种更具可解释性的方式来检查每个生成块所代表的状态。
7
第 8 页
预印本。
表 1:与Multi-Agent世界模型基线的比较。我们报告类别级 VLM 准确率、FID (Heusel et al., 2017) 以及综合世界得分。每列中的最佳结果以粗体突出显示。
| Method | Movement VLM ↑ | Movement FID ↓ | Grounding VLM ↑ | Grounding FID ↓ | Memory VLM ↑ | Memory FID ↓ | Building VLM ↑ | Building FID ↓ | Consistency VLM ↑ | Consistency FID ↓ | World Score ↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Frame concat | 77.1 | 68.9 | 53.1 | 66.6 | 37.5 | 74.4 | 0.0 | 103.2 | 49.5 | 129.4 | 49.1 | | Solaris* | 79.7 | 43.3 | 81.3 | 37.2 | 43.8 | 61.2 | 9.4 | 83.4 | 57.8 | 110.7 | 81.0 | | W2 (Ours) | 82.8 | 34.0 | 93.8 | 36.8 | 46.9 | 64.8 | 28.1 | 75.9 | 76.6 | 100.7 | 105.1 |
1 Agent
移动 并 向右转弯, 同时 改变他们的位置 PREVIOUS block, PREVIOUS block, while Alpha with relative and view direction Bird-Eye Agent Scene remains idle Bird-Eye Agent Scene facing Alpha now Bird-Eye Agent Scene direction
forward sprinting right, while PREVIOUS block, PREVIOUS block, while Alpha with relative and view direction Bird-Eye Agent Scene remains idle Bird-Eye Agent Scene facing Alpha now Bird-Eye Agent Scene direction
further from Alpha by 1-2 blocks change View Stats Text Alpha has started Bravo has moved both Alpha and The current block slightly away compared to the View Stats Text Bravo left compared to the View Stats Text shows significant in the relative no
2 Agent
changes in the the maintain CURRENT block; block; facing positions and View Stats Text There are no There are no Both players Both Alpha and both Alpha and View Stats Text changes CURRENT both Alpha in and View Stats Text maintain positions, directions, their and idle View Stats Text Bravo their orientations
Bravo maintain Bravo maintain behaviors without any or Bird-Eye Registers Agent Scene their positions Bird-Eye Agent Scene their positions Bird-Eye Agent Scene Bird-Eye Agent Scene
2 Agent
图 3:定性可视化。我们展示了带有接地世界状态的Multi-Agent rollout 生成结果:Agent坐标、鸟瞰图地图和场景文本。这些信号使得持久化世界状态可检查,并有助于验证跨玩家随时间的一致性。有关更详细的视频演示,请参阅项目页面。
4.3 监督信号分析
一个核心问题不仅是如何监督世界状态寄存器,而且为什么需要显式监督。理想情况下,寄存器仅通过扩散损失即可学习特定于Agent的状态和全局场景信息。然而,在实践中,该信号并未指定哪些信息应存储为世界状态。因此,我们添加了互补的监督信号,鼓励寄存器编码有意义且有用的世界状态信息。
我们假设世界状态寄存器应编码局部动态、全局几何和跨模态语义。因此,我们将三种监督类型实例化如下。(1) 对于个体状态监督,寄存器预测Agent统计信息,包括每个玩家的位置、速度和方向。这些目标为寄存器提供了明确的每Agent坐标信号,使我们能够测试持久化状态是否携带每个玩家的可验证运动信息。(2) 对于全局 3D 监督,我们使用鸟瞰图,从自我中心视角展示场景布局和物体分布。该信号要求寄存器保留两个玩家共享的空间结构,而不仅仅是当前帧中可见的自我中心证据。(3) 对于
全局跨模态监督,我们附加描述当前帧视觉状态的场景文本。该目标补充了局部动态和全局几何信息,要求寄存器在多次 rollout 中保留类别、属性和高层内容。
8
第 9 页
预印本。
表 2:世界状态寄存器的监督消融实验。我们比较了没有显式目标的寄存器与具有不同信号的寄存器;它们的组合进一步提升了世界状态寄存器的性能。
| 变体 | 移动性 VLM ↑ | 移动性 FID ↓ | 接地 VLM ↑ | 接地 FID ↓ | 记忆 VLM ↑ | 记忆 FID ↓ | 构建 VLM ↑ | 构建 FID ↓ | 一致性 VLM ↑ | 一致性 FID ↓ | 世界得分 ↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | 基线 | 79.7 | 43.3 | 81.3 | 37.2 | 43.8 | 61.2 | 9.4 | 83.4 | 57.8 | 110.7 | 81.0 | | 仅寄存器 | 90.6 | 43.2 | 81.3 | 44.3 | 62.5 | 66.1 | 21.9 | 84.3 | 62.5 | 101.9 | 93.8 | | + Agent统计 | 95.3 | 41.0 | 59.4 | 45.5 | 56.3 | 60.1 | 9.4 | 80.8 | 75.0 | 107.9 | 88.1 | | + 鸟瞰图 | 82.8 | 39.1 | 96.9 | 40.7 | 46.9 | 64.7 | 31.3 | 74.2 | 71.9 | 103.4 | 102.4 | | + 场景文本 | 85.9 | 40.2 | 84.4 | 38.4 | 62.5 | 62.1 | 25.0 | 78.8 | 73.4 | 101.6 | 103.2 | | + 全部 | 82.8 | 34.0 | 93.8 | 36.8 | 46.9 | 64.8 | 28.1 | 75.9 | 76.6 | 100.7 | 105.1 |
从 Solaris (Savva et al., 2026) 基线开始,我们首先启用没有显式监督的寄存器,然后逐个添加每种信号,最后评估组合设置,如表 2 所示。所有其他超参数保持在第 4.1 节的默认值。首先,我们观察到仅寄存器本身就有帮助:没有任何显式状态目标的情况下,世界得分从 81.0 提升至 93.8。我们将这一增益归因于寄存器隐式地构建了持久的世界状态,因为它们提供了一个专用槽位来携带跨 Agent信息,而不是在每一步都从局部窗口重新计算这些信息。
然而,与基线相比,显式建模世界状态目标可以进一步推动性能提升。所有三种监督变体均优于基线(81.0),因为它们指定了寄存器应编码的内容,并在 rollout 步骤中保持可验证性,而不是将这一选择完全留给像素损失。我们发现,在单一监督信号中,场景文本的帮助最大,将世界得分提升至 103.2。结合所有三种信号进一步将世界得分从 93.8 提升至 105.1,同时提高了平均 VLM 准确率并降低了平均 FID。这些结果证实了我们的假设,并突出了在Multi-Agent世界模型设置中启用世界状态寄存器的重要性。
4.4 模型架构分析
受近期多模态生成研究 (Mo et al., 2025) 的启发,我们将架构视为不同 token 角色之间潜在冲突的来源。密集 Transformer 原则上可以使用相同的参数来渲染像素上下文帧并生成准确的世界状态寄存器。然而,寄存器 token 旨在代表关于世界的隐藏信息,而帧 token 主要携带局部视觉信息。一旦寄存器编码了更丰富的状态信息,这种功能上的差异变得更难平衡。我们遵循 MoT 设计,使用独立的模态特定权重来处理寄存器 token 和帧 token,同时允许它们通过共享的注意力机制进行交互。
表 3 比较了在两种设置下密集和 MoT 主干网络的性能,分别使用没有显式监督的寄存器和使用场景文本监督的寄存器。结果表明,MoT 并非自动有益。在没有显式监督的情况下,MoT 并未在聚合世界得分上优于密集主干网络。在场景文本监督下,模式发生变化:密集模型的世界得分降至 91.3,而 MoT 达到 103.2。这种对比表明,世界状态寄存器中更丰富的语义表示更难使用与视觉 token 相同的参数化进行处理。因此,当寄存器携带独特的语义世界状态时,分离寄存器和帧的计算变得有用。
此外,我们调查了 MoT 模型在第 3 阶段训练期间的训练动态。独立的权重参数还允许更受控的学习过程。我们经验性地发现,第 3 阶段训练中的寄存器损失收敛速度慢于 DMD 蒸馏损失,而寄存器损失主要更新寄存器 Transformer,DMD 蒸馏损失主要更新视觉 Transformer。因此,在第 1500 步之后,我们应用了独立的 LR 调度,冻结视觉 Transformer 的权重参数,仅在第 3 阶段训练期间更新寄存器 Transformer 的权重参数。如图 4 所示,平均 VLM 准确率从 63.8 提升至 68.1。这一结果表明,MoT 对于基于 WSR 的Multi-Agent世界建模至关重要。
图 4:第 3 阶段自强制训练过程中的 VLM 准确率。
第 10 页
预印本。
表 3:密集 Transformer 与 MoT 主干网络的消融实验。我们在无寄存器监督和场景文本监督两种设置下,比较了密集 Transformer 与混合 Transformer(Mixture of Transformers)。
移动性 定位 记忆 构建 一致性 世界
模型 VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ 得分 ↑
无监督 密集 76.6 41.7 87.5 40.4 65.6 54.0 12.5 87.2 73.4 107.4 95.5 MoT 90.6 43.2 81.3 44.3 62.5 66.1 21.9 84.3 62.5 101.9 93.8
场景文本监督 密集 81.3 37.3 81.3 53.1 53.1 54.8 9.4 73.9 71.9 106.4 91.3 MoT 85.9 40.2 84.4 38.4 62.5 62.1 25.0 78.8 73.4 101.6 103.2
表 4:半监督训练。每一行对应不同数量的无鸟瞰图标注数据片段(未标注数据),其中“1K / N K”表示 1K 个标注片段和 N K 个未标注片段。
移动性 定位 记忆 构建 一致性 世界
数据划分 VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ VLM ↑ FID ↓ 得分 ↑
1K / 0K 78.1 60.0 75.0 72.6 21.9 95.0 15.6 76.9 71.9 111.0 63.2 1K / 2.5K 68.8 58.8 56.3 60.2 65.6 96.4 15.6 79.7 56.3 112.4 64.4 1K / 5.0K 85.9 60.4 56.3 58.3 81.3 79.8 28.1 76.6 71.9 117.7 82.3 1K / 10.0K 81.3 44.3 65.6 53.2 84.3 75.8 25.0 73.6 68.8 112.9 90.3
4.5 扩展:半监督训练
一个自然的问题是,该流水线能否超越完全仪器化的模拟器数据,向更真实的世界建模扩展。收集带有显式世界状态标注(例如Agent统计信息和鸟瞰图地图)的真实世界数据仍然具有挑战性。因此,我们采用半监督设置:带有鸟瞰图地图的片段被标记,而没有这些地图的片段则未标记。这种设置作为未来真实数据环境的代理,在这些环境中原始视频可能很丰富,但显式的世界状态标签有限。
在我们的实验设置中,我们将标注集固定为 1K 个视频片段,并逐渐增加未标注视频片段的数量。标注样本同时接收扩散损失和寄存器监督损失,而未标注样本仅通过扩散目标训练视频生成器。我们应用鸟瞰图监督,并使用默认的训练超参数,除了第二阶段训练长度,我们使用 20K 步而不是 60K 步,以防止对标注数据过拟合。表 4 显示,添加未标注数据将聚合世界得分从无未标注数据的 63.2 提高到 5K 未标注片段的 82.3,并进一步提高到 10K 未标注片段的 90.3。我们观察到 VLM 准确率和 FID 在整个表中普遍一致地改善,这表明当少量监督子集将隐藏的世界状态锚定在寄存器中时,未标注的回放数据仍然可以提高生成质量。总体而言,我们的方法为难以收集显式世界状态标签的设置提供了一种有前景的方向。
5 结论
我们介绍了 WorldWeaver,这是一种流式Multi-Agent视频扩散模型,具有用于交互式视频生成的跨 Agent世界状态寄存器。核心思想是维护和更新跨 Agent的共享世界状态。我们的模型随后细化记住的场景信息,而不是反复依赖不断扩展的帧历史。在Multi-Agent Minecraft 实验中,这种设计提高了视觉质量和逻辑一致性,消融实验表明,显式的世界状态监督进一步将寄存器塑造为更可验证的状态表示。
局限性。虽然我们的实验突出了跨 Agent世界状态寄存器的潜力,但仍存在几个局限性。我们的关键改进来自于额外的状态监督,但现实世界中的状态要复杂得多,且无法直接获取。然而,我们相信这是未来工作的一种有前景的方向,其中世界模型可以感知更复杂的状态信息,例如从低级的 3D 一致视觉细节到跨 Agent和玩家的高级语义关系。我们希望这项工作能为具有跨 Agent能力的未来世界模型研究提供启示。
10
第 11 页
预印本。
参考文献
Sora: 从文本创建视频 — openai.com. https://openai.com/index/sora/. [访问日期 2025-04-30]. 2
Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, and Junyang Lin. Qwen2.5-vl technical report, 2025. URL https://arxiv.org/abs/2502.13923. 7, 18
Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, and Vincent Sitzmann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. Advances in Neural Information Processing Systems, 37:24081–24125, 2024. 2, 3, 5
Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, and Chi Jin. Recurrent autoregres- sive diffusion: Global memory meets local attention. arXiv preprint arXiv:2511.12940, 2025. 3
Kevin Clark and Priyank Jaini. Text-to-image diffusion models are zero shot classifiers. Advances in Neural Information Processing Systems, 36:58921–58937, 2023. 3
Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, and Cho-Jui Hsieh. Self-forcing++: Towards minute-scale high-quality video generation. arXiv preprint arXiv:2510.02283, 2025. 3
Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xi- aonan Nie, Ziang Song, et al. Emerging properties in unified multimodal pretraining. arXiv preprint arXiv:2505.14683, 2025. 3
Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, and Yue Wang. Lome: Learning human-object manipulation with action-conditioned egocentric world model. arXiv preprint arXiv:2603.27449, 2026. 3
Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al. The llama 3 herd of models. arXiv preprint arXiv:2407.21783, 2024. 18
Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter. Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems, 30, 2017. 8
Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion. arXiv preprint arXiv:2506.08009, 2025. 2, 3, 6
Alexander C Li, Mihir Prabhudesai, Shivam Duggal, Ellis Brown, and Deepak Pathak. Your diffusion model is secretly a zero-shot classifier. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 2206–2217, 2023. 3
Weixin Liang, Lili Yu, Liang Luo, Srinivasan Iyer, Ning Dong, Chunting Zhou, Gargi Ghosh, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, et al. Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models. arXiv preprint arXiv:2411.04996, 2024. 2, 3
Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, and Xuanchi Ren. Gamma-world: Generative multi-agent world modeling beyond two players. arXiv preprint arXiv:2605.28816, 2026. 3
Xin Ma, Yaohui Wang, Gengyun Jia, Xinyuan Chen, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, and Yu Qiao. Latte: Latent diffusion transformer for video generation. arXiv preprint arXiv:2401.03048, 2024. 2
Sicheng Mo, Thao Nguyen, Xun Huang, Siddharth Srinivasan Iyer, Yijun Li, Yuchen Liu, Abhishek Tandon, Eli Shechtman, Krishna Kumar Singh, Yong Jae Lee, et al. X-fusion: Introducing new modality to frozen large language models. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 228–238, 2025. 3, 9
Koichi Namekata, Amirmojtaba Sabour, Sanja Fidler, and Seung Wook Kim. Emerdiff: Emerging pixel-level semantic knowledge in diffusion models. arXiv preprint arXiv:2401.11739, 2024. 3
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, et al. Dinov2: Learning robust visual features without supervision. Transactions on Machine Learning Research, 2024. 5, 7
11
第 12 页
预印本。
Ryan Po, Yotam Nitzan, Richard Zhang, Berlin Chen, Tri Dao, Eli Shechtman, Gordon Wetzstein, 和 Xun Huang. 长上下文状态空间视频世界模型。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,第 8733–8744 页,2025。3
Ryan Po, David Junhao Zhang, Amir Hertz, Gordon Wetzstein, Neal Wadhwa, 和 Nataniel Ruiz. Multigen: 扩散游戏引擎中可编辑多人世界的关卡设计。arXiv 预印本 arXiv:2603.06679,2026。3
Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy Meehan, Dhairya Mishra, Srivats Poddar, Jack Lu, 和 Saining Xie. Solaris: 在《我的世界》中构建多人视频世界模型。arXiv 预印本 arXiv:2602.22208,2026。2, 3, 5, 7, 9, 15, 18, 19
Weijia Shi, Xiaochuang Han, Chunting Zhou, Weixin Liang, Xi Victoria Lin, Luke Zettlemoyer, 和 Lili Yu. Llama-fusion: 调整预训练语言模型以用于多模态生成。arXiv 预印本 arXiv:2412.15188,2024。3
Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, 和 Xun Huang. Motionstream: 具有交互式运动控制的实时视频生成。arXiv 预印本 arXiv:2511.01266,2025。3
Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, 和 Chunchao Guo. Worldplay: 迈向实时交互式世界建模的长期几何一致性。arXiv 预印本 arXiv:2512.14614,2025。3
Enigma 团队。介绍 Multiverse:首个 AI 多人世界模型,2025。URL https://enigma.inc/blog。7
InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, 等。InSpatio-World: 通过时空自回归建模实现的实时 4D 世界模拟器。arXiv 预印本 arXiv:2604.07209,2026。3
Junjiao Tian, Lavisha Aggarwal, Andrea Colaco, Zsolt Kira, 和 Mar Gonzalez-Franco. Diffuse attend and segment: 使用 Stable Diffusion 进行无监督零样本分割。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 3554–3563 页,2024。3
Shengbang Tong, David Fan, Jiachen Li, Yunyang Xiong, Xinlei Chen, Koustuv Sinha, Michael Rabbat, Yann LeCun, Saining Xie, 和 Zhuang Liu. Metamorph: 通过指令微调实现多模态理解与生成。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,第 17001–17012 页,2025。3
Xinlong Wang, Xiaosong Zhang, Zhengxiong Luo, Quan Sun, Yufeng Cui, Jinsheng Wang, Fan Zhang, Yueze Wang, Zhen Li, Qiying Yu, 等。Emu3: 下一个 token 预测即所需。arXiv 预印本 arXiv:2409.18869,2024。3
Yaohui Wang, Xinyuan Chen, Xin Ma, Shangchen Zhou, Ziqi Huang, Yi Wang, Ceyuan Yang, Yinan He, Jiashuo Yu, Peiqing Yang, 等。Lavie: 使用级联潜在扩散模型的高质量视频生成。arXiv 预印本 arXiv:2309.15103,2023。2
Zeqi Xiao, Yushi Lan, Yifan Zhou, Wenqi Ouyang, Shuai Yang, Yanhong Zeng, 和 Xingang Pan。Worldmem: 具有记忆的长期一致世界模拟。神经信息处理系统进展 (Advances in Neural Information Processing Systems), 38:49632–49652,2026。3
Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, 和 Mike Zheng Shou。Show-o: 单个 Transformer 统一多模态理解与生成。arXiv 预印本 arXiv:2408.12528,2024。3
Chenfeng Xu, Huan Ling, Sanja Fidler, 和 Or Litany。3Difftection: 具有几何感知扩散特征的 3D 目标检测。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 10617–10627 页,2024。3
Jiarui Xu, Sifei Liu, Arash Vahdat, Wonmin Byeon, Xiaolong Wang, 和 Shalini De Mello。使用文本到图像扩散模型进行开放词汇全景分割。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,第 2955–2966 页,2023。3
Ceyuan Yang, Zhijie Lin, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Chaorui Deng, Kunchang Li, Zihan Ding, Yuwei Guo, 等。Omni 模型中的上下文展开。arXiv 预印本 arXiv:2604.21921,2026a。3
Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, 和 Zhaoxiang Zhang。Neoverse: 利用野外单目视频增强 4D 世界模型。arXiv 预印本 arXiv:2601.00393,2026b。3
12
第 13 页
预印本。
Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang。 从缓慢的双向到快速的因果视频生成器。arXiv e-prints, pp. arXiv–2412, 2024. 2, 3
Jiwen Yu, Jianhong Bai, Yiran Qin, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Xihui Liu。 上下文即记忆:具有记忆检索的场景一致交互式长视频生成。在 SIGGRAPH Asia 2025 会议论文集中,pp. 1–11, 2025. 3
Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg, 等人。Mosaicmem:用于可控视频世界模型的混合空间记忆。arXiv 预印本 arXiv:2603.17117, 2026. 3
Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, 和 Ioannis Patras。Relax forcing:用于一致长视频生成的松弛 kv 记忆。arXiv 预印本 arXiv:2603.21366, 2026. 3
Chunting Zhou, Lili Yu, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, 和 Omer Levy。Transfusion:使用一个多模态模型预测下一个 token 并扩散图像。arXiv 预印本 arXiv:2408.11039, 2024. 3
Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu。Causal forcing:正确完成的自回归扩散蒸馏,用于高质量实时交互式视频生成。arXiv 预印本 arXiv:2602.02214, 2026. 3
13
第 14 页
预印本。
附录
A 数据收集 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
A.1 概述 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
A.2 个体状态:Agent统计信息 . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
A.3 全局状态:鸟瞰图 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
A.4 跨模态状态:场景文本 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
B 管道与实现细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
B.1 状态解码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
B.1.1 Agent统计信息解码 . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
B.1.2 鸟瞰图解码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
B.1.3 场景文本解码 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
B.2 混合Transformer (Mixture-of-Transformers, MoT) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
B.3 训练 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
B.3.1 阶段 1:双向训练 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
B.3.2 阶段 2:使用世界状态寄存器 (World State Registers, WSR) 的因果训练 . . . . . . . . 19
B.3.3 阶段 3:使用上下文帧和状态展开 (State Rollout) 的自强制 (Self-Forcing) 训练 . . . . . . . . 19
14
第 15 页
预印本。
A 数据收集
A.1 概述
我们在 SolarisEngine 模拟器(Savva 等,2026)的基础上构建数据集。该数据集包含约 126 小时同步的双Agent交互记录,分辨率为 832×480,帧率为 20 fps。每次记录会话配对两个Agent,分别称为 Alpha 和 Bravo,它们在同一个 episode 中并发行动,每个Agent的状态以 20 Hz 的频率与视频流一起记录。每次会话都配有三组互补的世界状态标注流:捕捉个体动态的每Agent统计信息、揭示全局场景布局的共享鸟瞰图,以及提供跨模态语义的每块场景文本。这些信号提供了用于锚定世界状态寄存器(World State Registers, WSR)的个体、全局和跨模态监督,我们将在以下小节中详细说明每种流的收集方法。
A.2 个体状态:Agent统计信息
对于个体状态流,我们以 20 Hz 的频率记录每个Agent的位置、速度和方向,以及真实控制器输入,从而生成一个紧凑的状态记录,捕捉每个Agent在 episode 中的运动方式。图 5 可视化了 Alpha 和 Bravo 随时间变化的这些统计信息。
A.3 全局状态:鸟瞰图
除了每个Agent的第一人称相机外,每次记录会话还由位于场景上方的共享固定顶视相机进行拍摄。由于该相机是共享的而非附着在任一Agent上,两个Agent同时出现在单个帧中,提供了它们相对位置和空间关系的全局视图,这与两个第一人称流形成互补。图 5 展示了在一个 episode 过程中该顶视相机的代表性帧。
A.4 跨模态状态:场景文本
场景文本收集过程独立于游戏引擎。为了提供用于跨模态场景理解的语言锚定监督,我们使用 Qwen2.5-VL-72B-Instruct 对每次记录进行标注。每个 episode 被划分为包含四个连续帧的时间块,对应于 20 fps 下的 200 毫秒,并与我们视频标记器的时间下采样因子相匹配。对于每个块,我们组装来自共享顶视图和两个第一人称视图的同步输入。我们从每个视图中为当前块采样三帧,并在可用时将紧邻的前一个块作为时间上下文包含在内。生成过程限制在 256 个 token 以内。
为了将描述锚定在观察到的行为上,而不是要求模型仅从像素中推断动作,我们还将提示条件设置为当前块每个Agent的真实控制器输入摘要,包括移动键、动作键、快捷栏或工具选择以及净相机旋转。我们在为块 t 生成描述时使用以下问题模板,并在存在时将块 t-1 作为时间上下文提供:
按时间顺序显示双Agent会话的同步短块:首先是前一个块,然后是当前块。对于每个块,你看到的是一个顶视图,然后是 Alpha 的第一人称视图,接着是 Bravo 的第一人称视图。忽略角落文本、聊天、生命值和饥饿条;第一人称视图底部的条是该玩家的快捷栏。 当前块的真实控制器输入:Alpha [当前输入摘要],Bravo [当前输入摘要]。前一个块的真实控制器输入:Alpha [前一个输入摘要],Bravo [前一个输入摘要]。 结合视图和这些输入,严格按照以下模板填写,每行一句: 总体情况:每个Agent在当前块中的行为、它们的相对位置和距离,以及每个Agent的朝向或注视方向。 变化:当前块与前一个块在相对位置、朝向方向、视角方向以及每个Agent行为方面的差异。
对于没有前一个块的 episode 的第一个块,我们省略时间上下文,并使用较短的提示,其中“变化”行固定为“第一个块,无前一个,无”。
15
第 16 页
预印本。
帧 Agent
统计 Agent
查看 鸟瞰图
整体:Alpha 向前移动并 略微向右转,保持与 Bravo 的距离,而 Bravo 保持静止;Alpha 面向 Bravo,Bravo 面向 Alpha。 文本 变化:Alpha 已移动 到当前区块,略微靠近 Bravo,并调整了其朝向 为向右,与上一区块相 比,而 Bravo 的位置和 朝向保持不变。
整体:Alpha 和 Bravo 保 持静止,Alpha 位于左侧, Bravo 位于右侧,两者面 向彼此,中间隔着几块 鹅卵石。 变化:当前区块与上一 区块之间没有差异; Alpha 和 Bravo 均保持 其位置和朝向,且处于 空闲状态,没有任何变 化。
整体:Alpha 向右转 34 度并向下看,而 Bravo 向下看 14 度;两者均 保持在各自的位置, Alpha 面向 Bravo, Bravo 面向 Alpha。 变化:在当前区块中, Alpha 向右转得更多, 两名玩家都比上一区块 中 Alpha 已经向右转并 向下看、Bravo 处于空闲 状态时,看得更向下, 表明他们在结构内的注 意力和位置发生了变化。
整体:Alpha 向前移动并 略微向右转,向下看, 而 Bravo 略微向左转并 也向下看,两名玩家均 保持静止。 变化:与上一区块相比, Alpha 向前移动得更多, 向右转得更多,而 Bravo 将其视线调整为向左, 两名玩家现在看得更向 下,表明他们在结构内 的注意力和位置发生了 变化。
图 5:Multi-Agent Minecraft 设置中用于数据收集和标注流的可视化。
图 5 展示了代表性的块输入及其生成的描述。由于该流水线围绕每个Agent的局部运动和控制器输入构建,生成的描述忠实地描述了每个Agent的行为,但未捕捉到超出这两个Agent的更广泛场景上下文,例如周围地形或任一Agent直接 vicinity 之外的事件。
16
第 17 页
预印本。
B 流水线与实现细节
WorldWeaver 通过在自回归展开过程中添加显式的持久状态路径,将单个玩家视频扩散先验转化为流式双人世界模型。该流水线包含三个实现组件。首先,在训练期间使用辅助头解码固定的世界状态寄存器,用于代理统计信息、鸟瞰图特征和场景文本。其次,混合 Transformer(Mixture-of-Transformers, MoT)主干网络将寄存器 token 和玩家帧 token 路由到角色特定的参数分支,同时保持对交错序列的联合注意力。最后,训练遵循三阶段课程学习:首先将视频先验适配到同步的双人数据,然后训练因果寄存器学生模型,最后在自强制(Self-Forcing)下让学生模型接触其自身生成的帧和固定的寄存器。
B.1 状态解码
表 5:三种世界状态寄存器监督信号的配置。每种信号拥有独立的仅训练预测头 $h_m$、目标 $y_m$、距离度量 $d_m$ 和损失权重 $\lambda_m$。组合设置同时激活所有头并累加各信号损失。在推理时丢弃这些头。
代理状态 鸟瞰图 场景文本 组合
解码器架构 层数 4 12 16 – 通道数 256 768 2048 – 查询数量 2 256 – – 世界状态寄存器数量 256 256 256 64/64/128 权重初始化 随机 随机 预训练 – 可学习 是 是 否 –
优化 距离度量 $d_m$ 均方误差 余弦相似度 交叉熵 – S2: 损失权重 $\lambda_m$ 0.02 2.0 0.1 0.02/2.0/0.1 S3: 损失权重 $\lambda_m$ 0.2 2.0 0.5 0.2/2.0/0.5
表 5 总结了数值配置,本节更详细地描述了用于训练世界状态寄存器的状态解码监督信号。通用模式是将固定的世界状态寄存器(WSR)token 投影到解码器空间,并将它们与接收监督的 token 一起放置在注意力序列中。对于基于 Transformer 的头,该序列通过完全自注意力进行处理;对于场景文本,投影后的寄存器在冻结的语言模型中扮演与前缀嵌入相同的角色。从这个角度看,投影后的寄存器充当类似前缀的条件 token:剩余的查询、补丁或字幕 token 关注此状态表示,然后由相应的目标进行评分。以下段落首先描述这种共享的解码模式,然后给出代理统计信息、鸟瞰图特征和场景文本的具体目标和损失。
正文已经定义了加权寄存器损失,因此我们在此关注正文描述中未明确说明的实现细节。每个头解码每个固定的寄存器步骤,不对 WSR token 进行池化。单一信号消融实验可能读取完整的寄存器库,而组合设置使用不相交的 64/64/128 切片。缺失的目标会被受影响的头跳过,实现直接使用表 5 中的每头权重,没有单独的全局状态权重。
B.1.1 代理统计信息解码
附录指定了代理头使用的状态向量。每个玩家由位置、速度和方向表示,与正文中的代理状态目标相匹配。目标选自潜在对齐的模拟器帧,并保持原始单位。我们不应用每字段的归一化、裁剪或时间平滑。
17
第 18 页
预印本。
B.1.2 鸟瞰图解码
鸟瞰图信号是特征监督,而非像素重建。解码器从 256 个可学习的 patch 查询中预测一个 16×16 网格的 768 维 DINOv2 ViT-B/14 patch 特征。目标俯视帧经过数据管线处理,然后通过冻结的 DINOv2 预处理路径转换为 224×224;我们使用密集的 patch token,而非 CLS token 或池化特征。仅使用 PCA 到 RGB 进行定性可视化。
B.1.3 场景文本解码
场景文本头不应被解读为直接词汇对数几率头。可训练模块将选定的 WSR 切片投影为 2048 维的前缀嵌入,用于冻结的 Llama-3.2-1B (Grattafiori et al., 2024) 评分器;产生下一个 token 对数几率的是冻结的语言模型,而非可训练头。字幕被分词为 128 个训练槽位,在交叉熵中忽略填充和 BOS。字幕目标由 Qwen2.5-VL-72B-Instruct (Bai et al., 2025) 离线编写,这与用于监督的冻结 Llama 模型是分开的。
B.2 混合 Transformer
与世界状态寄存器(WSR)并列,我们在自回归扩散设计中引入了混合 Transformer(MoT)主干。重要的是,MoT 仅改变了生成器参数的共享方式,而流式展开、交错的 token 布局以及因果 KV 缓存均保持不变。具体而言,WSR token 使用状态分支,而内容帧 token 使用视觉分支。在我们的实现中,一个分支包括 transformer 投影层、前馈网络、条件层和归一化层。我们使用预训练的视觉分支权重来初始化状态分支权重。值得注意的是,对于自注意力,尽管寄存器 token 和内容帧 token 由不同的投影矩阵编码,但注意力权重是在交错序列上联合计算的。由于分支形状匹配,每个 token 仍然只激活单个参数副本,因此除了路由开销外,随着总参数数量的增加,每个 token 的 FLOPs 保持不变。
B.3 训练
表 6:主要组合世界状态模型使用的三阶段训练课程超参数设置。所有阶段均使用 P=2 个玩家。标记为“–”的条目不适用于该阶段。
阶段 1 阶段 2 阶段 3 双向 因果训练 自强制
架构 滑动窗口 W – 6 6 寄存器 token K – 256 256 主干 密集 MoT MoT
优化 训练步数 120K 80K 3-4K 批次大小 32 32 32 优化器 AdamW AdamW AdamW β (0.9, 0.95) (0.9, 0.95) (0.9, 0.95) 学习率 1×10−4 1×10−4 3×10−6
表 6 列出了主要组合设置的超参数。共享的选择包括 P=2,K=256 个寄存器,头部分组为 64/64/128,因果阶段中 W=6,使用 bf16 混合精度的 AdamW,以及 32 的批次大小。
B.3.1 阶段 1:双向训练
我们从官方的 Solaris 双向检查点 Savva et al. (2026) 初始化。在观测值、动作、VAE 潜变量和第一帧条件中添加了玩家轴,并且不使用寄存器路径。在表 6 的设置下训练运行 120K 步。
18
第 19 页
预印本。
B.3.2 阶段 2:使用世界状态寄存器的因果训练
我们首先在没有寄存器的情况下训练因果学生模型 60K 步,然后继续使用 WSR、MoT 和三个状态头进行 20K 步的训练。这 60K+20K 的训练计划与我们检查中完整 80K 步使用 WSR 的训练相匹配。遵循 Solaris (Savva et al., 2026) 的方法,我们在 Diffusion Forcing 噪声下,使用真实潜在变量上的流匹配损失和寄存器损失来训练该模型,不使用实时教师或 ODE rollout。寄存器权重遵循表 5,没有额外的全局乘数。
B.3.3 阶段 3:使用上下文帧和状态 rollout 的自强制训练
生成器加载匹配的 Stage-2 组合检查点。$s_{real}$ 和 $s_{fake}$ 均从 Stage-1 双向检查点开始;$s_{real}$ 保持冻结,$s_{fake}$ 单独训练。每次更新在共享的早期退出机制下,对 1000→750→500→250→0 进行无梯度 rollout,然后对生成的上下文进行梯度传递以计算 DMD 和寄存器损失。与阶段 2 相比,Agent统计数据和场景文本权重提高,而 BEV 权重保持不变(表 5)。训练持续 3–4K 步。第 4.4 节中的 MoT 冻结计划是一个单独的延续步骤,它锁定所有非寄存器生成器参数组。
19