单卡RTX 5090实时推演:ABot-World-0的LongForcing与全栈优化

三分钟导读:本文提出ABot-World-0,一种基于动作条件的视频世界模型,通过多源数据闭环、双向到因果的渐进式蒸馏(引入LongForcing)及全栈推理协同设计,在单张RTX 5090上实现了16 FPS的实时720P交互式世界推演。

英文题目:Infinite Interactive World Rollout on a Single Desktop GPU

论文出处:arXiv 每日论文精选 · arXiv:2607.19191

原始论文:PDF / 论文页面

对应视频标题:单卡RTX 5090实时推演:ABot-World-0的LongForcing与全栈优化|推荐指数:★★★★★

这篇论文解决什么问题?

现有世界模型在将视频生成能力转化为可交互、低延迟、长时程且稳定的本地模拟器时,面临数据获取难、控制与一致性耦合、自回归漂移及部署效率低四大瓶颈。

核心创新

  • WorldExplorer闭环数据系统:基于训练反馈动态调整采集策略,解决数据分布偏差。
  • LongForcing机制:在DMD阶段利用扩展时长的双向教师监督学生自推演轨迹,缓解长时程累积漂移。
  • 统一键盘动作接口:将场景漫游与角色控制统一为离散键盘输入,结合参考图像保持角色身份一致性。
  • 全栈推理协同设计:在单RTX 5090上通过量化、轻量解码及内存调度实现16 FPS/1.2s延迟的720P实时交互。

方法概览

1. 数据:构建包含AAA游戏、仿真引擎及互联网视频的多源数据基础设施,通过WorldExplorer进行基于训练反馈的闭环采集与14项质量过滤。2. 模型:以Wan2.2为骨干,注入动作控制与角色参考记忆;通过Teacher Forcing和ODE Distillation将双向教师模型蒸馏为因果学生模型;引入LongForcing进行长时程分布匹配以抑制漂移。3. 部署:采用LightVAE、FP8/MXFP4量化、SageAttention2、Fast-RoPE及内存感知调度,实现单卡实时流式推理。

逐图理解论文

数据:WorldExplorer闭环系统

数据:WorldExplorer闭环系统
Figure 2: Data Pipeline Overview. An end-to-end pipeline couples agent-driven and internet-scale collection, multi-stage quality filtering, and structured multimodal annotation. Curated data trains the world model, whose evaluation feeds a training-feedback loop that drives targeted re-collection and continual data refinement.

数据是模型泛化的基石。ABot-World-0构建了包含AAA游戏、仿真引擎及互联网视频的多源数据基础设施。通过WorldExplorer系统,模型利用训练反馈动态调整采集策略,执行14项质量过滤,形成从数据收集、模型训练到反馈再采集的闭环,有效缓解了数据分布偏差问题。

架构:动作控制与记忆注入

架构:动作控制与记忆注入
Figure 4: ABot-World-0 Model Architecture. ABot-World-0 incorporates action control and reference-character memory into a pretrained video DiT. Keyboard actions guide dynamics, while reference images help preserve char- acter identity.

模型以Wan2.2为骨干,采用DiT架构。通过注入动作控制模块,将场景漫游与角色控制统一为离散键盘输入。同时,引入参考图像作为角色记忆,确保在长时程推演中保持角色身份的一致性。这种设计使得模型能够根据离散动作指令,生成符合物理逻辑且角色连贯的视频序列。

训练:渐进式蒸馏与LongForcing

训练:渐进式蒸馏与LongForcing
Figure 3: Overall training pipeline of ABot-World-0. We first adapt a pretrained video generator into a high- quality bidirectional action-conditioned teacher. The teacher is then progressively converted into a causal autore- gressive student through Teacher Forcing, Causal ODE Distillation, and LongForcing, enabling few-step low-latency inference and stable long-horizon interactive rollout.

训练流程包括将双向教师模型蒸馏为因果学生模型。首先通过Teacher Forcing和Causal ODE Distillation实现初步转换,随后引入LongForcing机制。LongForcing在DMD阶段利用扩展时长的双向教师监督学生自推演轨迹,进行长时程分布匹配,从而有效抑制自回归过程中的累积漂移。

部署:全栈推理协同优化

部署:全栈推理协同优化
Table 1: Deployment setting and operating envelope of ABot-World-0 on a single NVIDIA RTX 5090.

为实现单卡实时推理,研究采用了LightVAE、FP8/MXFP4量化、SageAttention2加速注意力计算、Fast-RoPE及内存感知调度。这些全栈优化措施显著降低了计算开销,使得在1280×704分辨率下,模型能够在单张RTX 5090上稳定运行,满足实时交互的帧率要求。

实验:WorldRoamBench基准对比

实验:WorldRoamBench基准对比
Table 3 reports concrete WorldRoamBench sub-dimensions only. We compare against Genie 3 [3], Hap- pyOyster [85], LingBot-World [86], and HY-World 1.5 [87] following the benchmark protocol.

在WorldRoamBench基准上,ABot-World-0与Genie 3、HappyOyster等模型进行定量对比。结果显示,模型在Strict Accuracy上达到0.5266,Partial Accuracy为0.7290,Trajectory Score为0.6752。这些指标表明,模型在动作控制精度和轨迹连贯性上具有竞争力,尤其在视觉质量和记忆保持方面表现稳定。

实验与关键结果

  • 在WorldRoamBench基准上与Genie 3, HappyOyster, LingBot-World, HY-World 1.5进行定量对比。
  • 长时程推演测试:展示小时级(1小时)和天级(24小时)的关键帧连续性。
  • 域外泛化测试(OOD):评估未见场景和角色下的动作一致性。
  • 物理交互定性分析:验证碰撞、足迹、水体扰动等物理现象的合理性。
  • 系统性能分析:不同优化配置下的FPS、VRAM及延迟对比。
  • WorldRoamBench Strict Acc: 0.5266(第 18 页)
  • WorldRoamBench Partial Acc: 0.7290(第 18 页)
  • WorldRoamBench Traj. Score: 0.6752(第 18 页)
  • WorldRoamBench Aesthetic: 0.5039(第 18 页)
  • WorldRoamBench Memory: 0.5041(第 18 页)
  • 推理帧率: 15.831 FPS (MXFP4配置)(第 17 页)
  • 峰值显存: 17.148 GiB (MXFP4配置)(第 17 页)
  • Action-to-first-frame latency: 1.2 s(第 1 页)

阅读时需要注意

  • 未进行量化感知训练(Quantization-aware training),未来可能进一步改善速度-质量权衡。
  • 互联网数据依赖姿态估计伪标签,存在噪声,不如游戏/仿真数据精确。
  • 模型在极端长时程(天级)推演中仍可能出现累积误差,尽管表现优于基线。
  • 性能数据基于单张NVIDIA RTX 5090,其他硬件表现可能不同。
  • MXFP4等激进量化配置虽提升FPS,但可能牺牲部分视觉质量(文中未详细列出MXFP4的具体视觉指标,仅列出FP8为默认质量配置)。
  • WorldRoamBench对比中,部分基线模型参数量较大(如14B, 8.3B),而ABot-World-0为5B,需注意模型规模差异对公平性的潜在影响。

关联工作

  • Genie 3:对比基线,在WorldRoamBench上比较动作控制与视觉质量。(第 18 页)
  • Diffusion Forcing / Self-Forcing:相关工作,LongForcing受其启发,用于解决自回归漂移问题。(第 4 页)
  • Wan2.2:ABot-World-0使用的预训练视频生成骨干网络。(第 12 页)
  • SageAttention2:用于加速注意力计算的底层算子。(第 17 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

AMAP CV Lab | 阿里巴巴集团 技术报告

在单张桌面 GPU 上实现无限交互式世界推演

ABot-World 团队

2026 年 7 月

摘要

我们提出了 ABot-World-0,这是一个动作条件视频世界模型,支持实时、长视距闭环交互。该模型依托涵盖 AAA 游戏、仿真引擎和网络视频的多源数据基础设施,以学习可控的世界动力学。WorldExplorer 执行由训练反馈引导的Agent 驱动数据收集,而统一流水线则应用 14 项确定性质量检查、基于视觉语言模型(VLM)的评估以及同步的动作和文本标注。我们通过教师强制(teacher forcing)和常微分方程(ODE)蒸馏,将双向动作条件教师模型渐进式蒸馏为因果学生模型,并引入 LongForcing 机制以对齐学生模型的长时程自推演与扩展视距教师模型,从而缓解累积分布偏移和自回归漂移。原始键盘动作提供了场景漫游和第三人称角色交互的统一控制接口,而参考角色记忆则为第三人称推演过程中的身份一致性提供持久外观线索。在部署方面,我们联合设计了流式推理栈,包括轻量级 VAE 解码器、高效注意力机制、感知内存的调度以及低比特 DiT 推理。在优化的低比特配置下,ABot-World-0 在单张 NVIDIA RTX 5090 桌面 GPU 上以 720P 分辨率、最高 16 FPS 的速度进行流式推理,动作到首帧的延迟为 1.2 秒,峰值显存占用约为 19 GiB。在 WorldRoamBench 和扩展交互式推演上的实验表明,该模型具有竞争力的可控性和连贯的长时程世界演化能力。https://github.com/amap-cvlab/ABot-World [cs.CV] arXiv:2607.19191v1

图 1:ABot-World-0 将单张 NVIDIA RTX 5090 GPU 转化为实时交互式世界模拟器,在峰值显存预算约为 19 GiB 的情况下,以 720P 分辨率和最高 16 FPS 的速度实现无限动作条件世界推演,动作到首帧的延迟为 1.2 秒。

ABot-World-0 第 1 页,共 33 页

第 2 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

1 引言

人工智能正从生成静态内容转向生成可进入、可控制并持续演化的世界。其目标并非一系列视觉上合理的片段序列,而是一个持久的生成式环境:在该环境中,动作会改变状态,产生的观测结果会指导后续动作,且随着交互的持续,世界保持连贯。因此,世界模型 [1–7] 是迈向通用模拟器的关键一步:它们必须表征世界的当前状态,预测在干预下世界的演化方式,并为规划、学习、创造和具身智能提供基础。这是一个系统级挑战,而非单一生成目标。视觉保真度仍然必要,但必须联合优化可控性、状态持久性、 rollout 稳定性、延迟、吞吐量和内存占用。大规模视频生成的快速进展 [8–16] 提供了日益强大的视觉和动态先验,然而将这些先验转化为响应迅速、易于访问的世界,需要解决闭环问题。

近期系统已确立了该议程的重要部分。Genie [2] 展示了如何通过推断的潜在动作从互联网游戏数据中学习可玩环境,而 Genie 2 和 Genie 3 [3, 17] 展示了能力日益增强的实时动态环境。GameNGen [4]、Oasis [5]、WHAM [18]、Runway GWM [19]、Cosmos [6] 和 Waymo World Model [20] 探索了游戏、开放世界、物理 AI 和驾驶设计空间中的互补点。然而,仅扩展视频模型并不能解决交互式世界建模的四个耦合瓶颈:获取具有可靠动作监督的广泛且时间连贯的数据;在相机导航和具身角色控制中表征用户意图;防止生成的历史在成为下一步输入时发生漂移;以及在实用硬件上以交互速度部署整个生成和解码堆栈。一个系统可能在任一维度上表现强劲,但作为本地持久世界模拟器仍不可用。

数据问题尤为根本。被动互联网视频提供了视觉多样性,但很少暴露同步的控制信号;游戏录像提供了精确输入,但风格可能较为单一;仿真提供了几何结构和可控性,但需要精心设计轨迹。我们将这些来源视为互补而非可互换。我们的数据基础设施结合了 AAA 游戏数据、仿真引擎数据和真实互联网视频。WorldExplorer 是一种基于Agent 的采集系统,它生成同步的多模态游戏和仿真轨迹,并将采集工作从训练反馈中重新分配。一个感知来源但统一的处理流水线随后在六个质量维度上执行 14 项确定性检查、基于视觉语言模型 (VLM) 的语义评估、动作标注和结构化语言标注。这使得数据集构建成为世界模型开发闭环的一部分:数据分布并非仅收集一次,而是被主动塑造,以暴露模型在运动、视角、环境和动作机制方面表现薄弱的区域。

我们基于此基础设施构建了 ABot-World-0,这是一个动作条件视频世界模型,旨在作为对控制-一致性-效率耦合问题的端到端解决方案。该模型使用统一的、帧同步的键盘动作接口,而非单独的潜在动作接口;在数据构建期间,源原生控制和基于姿态的伪动作被映射到同一动作空间中,这在推理时对用户自然可用。统一的动作表征涵盖了观察者风格的场景漫游和演员风格的角色运动,而参考角色记忆为长程第三人称 rollout 提供了持久的外观信息。这些选择使得控制通道成为动力学模型本身的一部分,而非外部后处理接口。

学习流水线将视觉-动态质量与在线所需的因果约束分离。我们首先在多源动作-视频语料库上训练双向教师模型,其中全视界生成为动作条件动力学提供了高质量目标。随后,我们通过长时程强制 (LongForcing) 和常微分方程 (ODE) 蒸馏将其逐步转换为因果学生模型,这在保留可部署信息模式的同时减少了去噪预算。关键在于,局部蒸馏本身并不能解决闭环生成问题:每个学生模型的预测都会改变后续预测的视觉上下文,导致短视界训练状态与长视界推理状态之间出现日益扩大的不匹配。我们

ABot-World-0 第 2 页,共 33 页

第 3 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

介绍 LongForcing,这是一种最终的分布匹配阶段,通过扩展视域双向教师模型对学生模型的长时程自推演进行监督。通过在学生的自推演过程中扩展分布级监督,LongForcing 为短时程目标仅能微弱覆盖的长时程推演上下文提供校正信号。

实时交互还需要超越少步采样的系统协同设计。ABot-World-0 将其因果模型与轻量级 VAE 解码器、感知记忆的模块调度、低比特 DiT 推理、高效低精度注意力机制以及有界局部上下文 KV 缓存相结合。在其优化的低比特运行范围内,单个 NVIDIA RTX 5090 上的 720P 流式处理管道最高可达 16 FPS,动作到首帧延迟为 1.2 秒,同时峰值显存预算约为 19 GiB。报告的延迟涵盖了从接收用户动作到首个解码响应帧可用之间的完整生成和解码路径,而非单独报告采样速度。

我们的贡献有四个方面:

• 我们提出了 ABot-World-0,这是一种统一的动作条件视频世界模型,使用原始键盘输入来支持场景漫游和角色控制,并通过参考角色记忆在第三人称交互期间提供互补的外观线索。 • 我们开发了用于交互式世界建模的多源数据基础设施,包括 WorldExplorer 的训练反馈驱动收集循环、同步的多模态捕获、多阶段质量控制以及统一的动作和文本标注。 • 我们引入了一种渐进式双向到因果的训练管道和 LongForcing,将分布级教师监督扩展到长时程学生自推演,以减轻累积的自回归漂移。 • 我们展示了一个面向部署的流式处理栈,其优化的低比特运行范围在单个 RTX 5090 上以约 19 GiB 的峰值显存预算实现了最高 16 FPS 的 720P 输出和 1.2 秒的动作到首帧延迟,并在 WorldRoamBench 上结合扩展的交互式推演评估了可控性、视觉质量、物理合理性和时间记忆。

综上所述,这些组件将交互式世界建模框定为一项全栈能力,而非单一的生成目标。ABot-World-0 是迈向本地视觉模拟器的一步,这些模拟器可以被持续探索、控制和改进,以用于交互式创作、Agent 学习和具身智能研究。

2 相关工作

2.1 双向视频生成

生成建模的最新进展极大地提高了视频合成的质量,扩散模型已成为主导范式 [8, 9, 11]。早期的视频扩散模型通常采用基于 U-Net 的架构,而最近的方法越来越多地采用具有时空注意力机制的扩散变换器 [14, 15, 21–24]。通过对整个片段的空间和时间依赖关系进行建模,这些方法 [14, 16, 25] 在视觉质量和时间连贯性方面取得了强大的性能。这种全片段双向建模也非常适合插值、填充和有界生成等任务,其中需要考虑多个时间约束。

然而,这种全片段建模通常由双向注意力实现,其中每一帧都可以访问过去和未来的上下文。虽然这对时间一致性有益,但这种设计将整个序列中的帧耦合在一起,使得在低延迟或流式场景中以增量方式生成和输出帧变得困难。这一局限性激发了最近的因果或自回归视频扩散方法的发展,这些方法试图将双向视频扩散模型转换或蒸馏为顺序生成器,以牺牲部分全局上下文为代价,换取更高效的在线生成。

ABot-World-0 第 3 页,共 33 页

第 4 页

AMAP CV 实验室 | 阿里巴巴集团 技术报告

2.2 自回归视频生成

为了克服非因果模型的局限性,自回归(AR)视频生成方法 [10, 13, 26–28] 按顺序生成帧,仅根据先前生成的内容对每个新片段进行条件约束。通过强制执行因果约束,这些方法实现了低延迟流式传输,并且当与有界上下文或缓存结合使用时,降低了长视频合成相关的内存开销。早期的 AR 模型主要依赖于基于离散标记的 Transformer,而最近的工作 [29–33] 将因果结构整合到扩散和基于流的框架 [8, 34, 35] 中,以实现更优的视觉质量。

AR 生成的因果结构使其非常适合实际的长视频合成,因为它支持流式生成。这使得 AR 生成为可扩展视频生成的有吸引力的范式。因此,在本工作中,我们专注于 AR 范式,并解决提高长时程稳定性的关键挑战。

2.3 长视频生成

自回归模型在超出训练时程后会出现漂移,表现为渐进式质量下降、身份不一致、运动停滞或在适度数量的自回归展开后坍缩为静态帧。

时间漂移与 AR 展开中的暴露偏差和误差累积密切相关。为了缓解这一问题,Diffusion Forcing [29]、PA-VDM [36] 和 Rolling Forcing [33] 等方法在训练期间采用异构噪声调度 [37–39],而无需训练的 FIFO-Diffusion [40] 等方法通过滑动潜在窗口扩展预训练模型,但在没有显式展开对齐的情况下仍然遭受最终的性能下降。或者,Self-Forcing 及其变体如 LongLive [41]、Self-Forcing++ [42] 使用因果注意力、KV 重新缓存和蒸馏,在模型自身的展开分布下监督模型以进行长视频生成。后续工作进一步解决了细粒度的不匹配问题:Causal Forcing [43] 解决了双向教师模型与因果学生模型之间的架构差距,Context Forcing [44] 利用具有慢-快记忆(Slow–Fast Memory)的长上下文教师模型,HiAR [45] 在匹配的噪声级别执行分层去噪,Diagonal Distillation [46] 联合优化时间块和去噪步骤。在本工作中,我们使用渐进式双向到因果的流水线:在长动作条件序列上训练的教师模型提供高质量的动力学监督,而 LongForcing 将该监督扩展到长的学生自展开过程中,以减少累积漂移。

即使具有展开对齐的目标,长程漂移仍然存在,因为对完整历史进行密集注意力计算是不可行的。虽然简单的滑动窗口或 KV 缓存截断通常会导致身份丢失和运动停滞,但最近的以记忆为中心的方法通过 RoPE 稳定化、深层注意力汇(attention sinks)和结构化 KV 记忆 [47–50] 提高了稳定性。LongLive-2.0 [51] 进一步使用多 shot 注意力汇在提示切换之间保持身份一致性,而无需训练的扩展方法(例如 FLEX [52]、PackForcing [53])通过位置校正或缓存分区来缓解漂移。因此,长视频生成已从仅仅将扩散模型因果化,演变为一个涵盖展开对齐、记忆设计、位置外推、蒸馏和高效部署的综合挑战。

2.4 交互式视频生成

交互式视频生成根据用户动作对视频动力学进行条件约束,为交互式世界、游戏类模拟器和具身 AI 基准 [7, 17, 54, 55] 提供了基础。一种常见的方法是使用专用网络编码 6-DoF 相机外参 [56–58],另一种方法则注入与潜在标记对齐的密集 Plücker 射线图或视锥特征 [59–62]。这些方法通常使用全局或初始帧坐标系中的校准轨迹来表示相机运动。在长展开过程中,累积的姿态可能会超出训练分布,而定期的重新锚定可能会引入

ABot-World-0 第 4 页,共 33 页

第 5 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

跨时间片段的一致性。感知相机的位置编码方法 [63–65] 将相机几何或姿态融入令牌的位置表示中。相比之下,我们将生成条件设定为离散键盘动作,这些动作指定了角色移动和相机运动的局部、增量控制,而非校准后的全局相机轨迹。这些动作是相对于当前角色或相机状态进行解释的,并从固定的动作空间中抽取,从而保持控制表示有界,并自然地与长时程推演期间的实时用户交互保持一致 [7, 54, 55]。

2.5 实时视频生成

实时交互式视频生成由两个耦合的指标决定:延迟,即用户动作与相应视觉更新之间的延迟,以及吞吐量,即系统在长时程推演期间能维持的持续帧率 [7, 41, 66, 67]。延迟主要受去噪预算和生成时间单元的影响,因为标准扩散模型每帧需要多次评分网络前向传播,而蒸馏的少步模型 [31, 32, 41, 51, 66, 68–70] 降低了这一成本。逐帧自回归设计 [4, 31, 41] 最小化了动作到像素的延迟,因为每个新控制都可以影响紧接着发出的帧。然而,它们每帧需要一个完整的去噪周期,这严重限制了吞吐量并增加了推演过程中的序列依赖性。分块生成 [39, 71, 72] 则联合去噪一帧块,通过分摊注意力计算和 VAE 解码来实现更高的 FPS 和更强的短程时间一致性,代价是当前块内的控制延迟是有界的。吞吐量反过来取决于每个时间单元生产和解码的效率:在每个块内对多帧分摊注意力计算和 VAE 解码可以提高 FPS,而低比特权重和 KV 缓存 [51, 73]、内核融合以及序列或张量并行 [7, 74, 75] 则降低了内存和执行开销。异步流式解码 [51] 还可以将生成与显示重叠。在本工作中,我们提倡一种面向部署的交互式视频生成公式,该公式联合优化延迟、吞吐量和内存效率。我们的方法采用带有渐进式视觉交付的分块流式管道。通过协同设计轻量级 VAE 解码、内存感知调度、低比特 DiT 推理、高效注意力机制和优化位置编码,我们的优化部署环境在单张 NVIDIA RTX 5090 桌面 GPU 上,峰值 VRAM 预算约为 19 GiB 的情况下,支持最高 16 FPS 的 720P 交互式流媒体传输,动作到首帧的延迟为 1.2 秒。

3 数据基础设施

3.1 概述

ABot-World 将数据生产视为模型开发的一个组成部分,而不是一次性的预处理阶段。构建高保真、动作可控的世界模型从根本上依赖于大规模、高质量的训练数据,这些数据涵盖多样的环境、视角和运动模式。我们的训练语料库来自三个互补的来源:AAA 游戏数据、仿真引擎数据和真实互联网数据。每种来源的详细特征和收集方法将在第 3.2 节中描述。

如图 2 所示,我们的数据基础设施通过三个渐进阶段处理所有三种来源:

收集。游戏和仿真数据通过 WorldExplorer 收集,这是一个统一的基于Agent 的系统(第 3.2.2 节),它导航虚拟环境并捕获同步的多模态信号,同时利用闭环训练反馈。互联网数据经过单独的 video segmentation 和姿态估计管道(第 3.2.5 节)。

质量过滤。原始收集的数据通过多阶段过滤管道(第 3.3 节),该管道结合了跨越六个质量维度的 14 种确定性信号检查,并结合视觉语言模型

ABot-World-0 第 5 页,共 33 页

第 6 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

数据来源 Agent 驱动收集 多阶段质量过滤 24/7 自主运行 14 项检查 · 6 个维度 🎮 完整性 & 格式 AAA 游戏 GameWorld 引擎 文件 配对 · 帧 · 分辨率 多 标题 NavMesh Agent · 并行 捕获 RGB + 姿态 + 动作 🤖 自主运行 原始 帧丢失检测 视频 ⚙ 视觉与几何 仿真 合成管线 VLM · 事件 · 几何 训练反馈 UE + 3DGS 程序化 + 真实轨迹 过场与边界移除 循环 RGB + 姿态 🤖 自主运行 🌐 元数据与软 互联网视频 一致性 · 加权 公开 + 内部 互联网管线 场景回放样本评分 姿态估计 COLMAP / ViPE 伪标签估计 (高效数据比率)

训练与 结构化标注 评估 动作标签 场景描述 语义与身份 🎯 世界模型 在精选数据上训练 游戏:真实标签 API VLM 生成的标题 场景标签(天气、时间…) 📊 评估指标 仿真:确定性 游戏标识符前缀 视角与车辆类型 FVD · 动作保真度 互联网:姿态估计 无相机运动信息 人物身份(第三人称) 长时程稳定性 → 统一动作信号 → 文本条件训练 → 分层采样 → 失败案例

图 2:数据管线概览。端到端管线将Agent 驱动与互联网规模的收集、多阶段质量过滤以及结构化多模态标注相结合。精选数据用于训练世界模型,其评估结果反馈至训练循环,驱动有针对性的重新收集与持续的数据优化。

基于(VLM)的语义评估,剔除技术缺陷和语义无效样本。

标注。幸存片段被增强动作标签、结构化自然语言场景描述以及语义标签(第 3.4 节),用于动作条件训练和文本条件训练。该管线遵循统一的、与来源无关的采集和处理设计,同时在可用时保留来源原生的原始控制信号,并将特定来源的动作信息转换为规范表示以用于模型训练。

我们的数据基础设施与现有方法相比,具有三个关键优势:

• 完全自动化的Agent 驱动收集,结合训练反馈驱动的自适应重平衡,将数据生产从被动批处理转变为与训练目标紧密耦合的主动伺服系统。 • 全面的质量控制管线——涵盖六个质量维度的 14 项独立检查,辅以基于 VLM 的语义评估——被系统地应用,以最大化有效数据比率。 • 确定性动作标注(通过直接 API 访问和轨迹设计用于游戏和仿真数据)与统一的多源处理流程相结合,提供了高质量标签,而真实世界视频则通过姿态估计伪标签贡献多样性。

3.2 数据收集

3.2.1 数据来源与收集范式

我们的训练数据涵盖三个互补的来源。AAA 游戏数据提供了丰富、高保真的 3D 环境,具有精确同步的动作和观测信号,但本质上局限于特定标题和视觉风格。仿真引擎数据提供了几何精确的合成数据,具有确定性动作标签和完整的环境控制;值得注意的是,我们通过 ABot-3DGS [76, 77] 重建的街道航拍和街道扫描数据,产生了源自专有、非公开资产的 photorealistic(照片级真实)真实世界场景。真实世界互联网数据引入了自然的相机动态、多样化的光照……

ABot-World-0 第 6 页,共 33 页

第 7 页

AMAP CV Lab | 阿里巴巴集团 技术报告

以及域泛化信号难以在合成数据中复现,但缺乏真实动作标签且需要噪声姿态估计。

针对交互式环境数据收集,已发展出三种收集范式,每种范式各有不同的权衡。手动录制(人类游戏操作)能够产生真实、自然的行为,但面临严重的可扩展性瓶颈、轨迹碎片化以及高昂的人力成本。基于规则的自动化收集(在游戏和仿真环境中进行脚本化探索)以较低的边际成本持续运行并提供确定性标注,但其根本受限于预定义的脚本——它无法自主发现新场景、根据训练反馈调整策略或动态重新平衡数据分布。基于Agent 的收集方法中,强化学习或模仿学习Agent 自主导航交互式环境,能够实现有目的、目标导向的探索,并以规模化方式产生平滑连续的轨迹,但仍容易陷入探索范围狭窄或奖励黑客(reward-hacking)失败模式,且本质上不适用于被动消费的数据(如互联网视频)。

3.2.2 WorldExplorer:数据闭环收集系统

为了解决现有范式的局限性——特别是基于规则脚本的僵化性以及传统基于Agent 方法的探索范围狭窄和缺乏训练反馈——我们开发了 WorldExplorer,这是一种适用于游戏和仿真环境的统一基于Agent 的收集系统。WorldExplorer 提供模块化、与环境无关的架构,为每个后端提供特定来源的适配器,包含四个核心组件。

导航Agent 。导航Agent 通过多阶段目标选择策略自主遍历虚拟环境,逐步放宽探索标准——从优先探索完全未探索的区域,到搜索附近区域,再到带有碰撞检测的前进运动回退——从而实现高场景覆盖率低重访率。该策略适用于任何具有可导航网格的交互式虚拟环境,无论是实时游戏世界还是重建的 3DGS 场景。

并行采集管道。视频帧、相机参数(位置、旋转、视场角 (FOV)、焦距)、控制输入、环境状态和元数据通过并行管道同时获取。所有模态通过毫秒级精度的时间戳进行同步,在 30 FPS 下跨模态对齐误差低于 33 毫秒,并且每次录制会话在事后被分割为训练片段。

任务模板系统。收集工作被组织成结构化的任务类别,以确保行为分布的完整性——从标准导航和自由探索,到对地标的集中观察,再到对长尾场景的目标覆盖,这些场景在自然交互中很少出现,但对稳健训练至关重要。场景配置在多个维度上进行参数化——地理、天气、一天中的时间、交通密度、视角模式和车辆类型——从而实现对数据分布的细粒度控制。

训练反馈驱动的闭环。WorldExplorer 最显著的特征是其闭环、分布感知的设计。与其使用固定的收集比例运行,训练监控模块持续跟踪各类别的性能指标,弱点诊断组件通过跨维度评分识别表现不佳的场景-动作组合,自适应策略生成器在保持最低覆盖率底线以防止灾难性遗忘的同时更新收集比例。Agent 通过加权任务模板选择和实时场景参数调整进行动态适应,整个过程无需人工干预。完整的闭环——训练反馈 → 弱点诊断 → 策略适应 → Agent 导向生产——将数据收集从被动的批量生产转变为主动的智能伺服系统,在整个模型开发生命周期中与训练目标紧密耦合。

ABot-World-0 第 7 页,共 33 页

第 8 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

3.2.3 游戏数据采集

游戏数据构成了我们训练语料库的主要且最大来源。WorldExplorer 被应用于多种跨不同流派(开放世界探索、城市驾驶、马术穿越)的 AAA 级大作,自然地涵盖了第一人称和第三人称视角。与我们统一的数据驱动训练范式一致,该流水线在共享的采集和处理框架内支持第一人称和第三人称视角,同时在适用时保留特定视角的标注。这种设计使得单一模型架构能够学习跨两种视角的动作条件动态,而无需分别训练特定视角的模型。每次录制会话均生成分辨率为 1920×1080 的 RGB 视频,以及同步的逐帧相机位姿、控制信号和环境元数据。

游戏数据的一个显著优势在于其天然提供的视角多样性。第一人称视角提供与相机光轴紧密对齐的直接自运动信号,而第三人称视角则提供可观察的角色动态和周围空间上下文,从而丰富模型对Agent-环境交互的理解。此外,直接的 API 访问消除了基于姿态估计方法中固有的标签噪声,使游戏数据成为我们训练语料库中最高质量的监督信号。

源原生控制信号直接从游戏运行时 API 捕获,具有真值精度,并与每个视频帧同步。这些特定于源的控制随后被转换为数据流水线中使用的规范动作表示。

3.2.4 模拟数据采集

为了增强轨迹多样性并提供游戏录制无法提供的几何监督信号 [78],我们构建了一个使用两种互补渲染后端的合成流水线:用于具有完全环境控制的逼真场景渲染的虚幻引擎 (Unreal Engine, UE),以及由 ABot-3DGS [76, 77] 驱动的 3D 高斯溅射 (3D Gaussian Splatting, 3DGS) 后端。ABot-3DGS 从多视角图像重建高度逼真的场景——可选择接受激光雷达 (LiDAR) 和预处理的光测摄影点云作为几何先验——并应用于我们专有的街道航拍数据和街道扫描数据,以生成大规模户外城市环境和庞大的室内场景覆盖。这些几何准确的真实世界场景表示源自专有、非公开资产。

WorldExplorer 通过两种互补模式在这些 3D 资产上执行轨迹:(a) 程序化路径生成,采用具有多点插值的几何模式合成;以及 (b) 真实世界轨迹导入,将从物理设备捕获的运动路径映射到 3D 场景中,保留真实的人类浏览行为,如重复扫描和自然的手持抖动。每条轨迹在渲染前都经过碰撞检测,动作标签通过将平移和旋转位移投影到相机基向量上并二值化为离散动作信号来确定性地派生,从而产生与帧对齐的标注。

3.2.5 互联网数据采集

对于真实世界的互联网数据,由于内容是被动消费而非交互式生成,因此Agent 驱动的采集不适用。我们转而采用基于视频的流水线,从多样化的互联网来源(包括驾驶 footage、步行游览和航拍视频)中提取训练信号。原始视频首先根据场景边界和内容连贯性分割为训练片段,确保每个片段捕捉到一致的环境或活动。然后,通过姿态估计方法恢复 6-DoF 相机轨迹作为伪标签——根据场景特征(如室内/室外设置、静态/动态内容以及纹理丰富度)进行选择——以处理互联网视频中遇到的多样化视觉条件。

动作意图标签通过将帧间平移和旋转位移投影到相机基向量上并通过阈值处理进行二值化来派生,产生与

ABot-World-0 第 8 页,共 33 页

第 9 页

AMAP CV Lab | 阿里巴巴集团 技术报告

视频帧。虽然这些伪标签包含游戏和仿真真实标签中不存在的估计噪声,但互联网数据通过引入自然相机动态、真实世界的光照变化以及难以在合成数据中复制的域泛化信号,极大地扩展了训练的多样性。

3.3 质量过滤

原始收集的数据不可避免地包含从技术伪影(帧丢失、分辨率不匹配)到语义问题(用户界面叠加层、死亡序列、几何故障)的各种质量问题。我们实施了一个统一的多阶段过滤管道,涵盖六个质量维度的14项独立检查——(1) 文件完整性、(2) 视觉有效性、(3) 几何一致性、(4) 游戏状态正确性、(5) 动作-标签对齐,以及 (6) 元数据质量——并辅以基于视觉语言模型(VLM)的语义评估,以生成最终可用于训练的数据集。该管道分三个阶段渐进式运行,每个阶段针对不同类别的质量问题。检查按顺序执行——早期阶段的格式验证能够在进行计算密集型分析之前快速拒绝不合格样本。

阶段 1:文件完整性。快速确定性检查——文件对存在性、帧数一致性、分辨率合规性、帧丢失检测——以高吞吐量消除根本性有缺陷的录制。格式级别的错误会触发片段级别的拒绝,因为它们使样本无法用于下游的动作条件模型训练。

阶段 2:视觉有效性、几何一致性与游戏状态正确性。内容级分析通过基于 VLM 的筛选(用户界面叠加层、加载屏幕、弹出窗口、渲染异常)、几何异常检测(用于地形裁剪的垂直位移跳跃、相机穿透物体分析)、游戏状态信号处理(删除死亡序列、过场动画和地图边界移除)以及动作-标签对齐验证来检测语义无效的片段。第三人称角色的可见性会被评估并标记(但不拒绝),用于下游的加权处理。

阶段 3:元数据质量。幸存的片段会获得元数据标注——动作-姿态一致性分数、屏幕颜色偏移标志——这些作为软信号用于训练时的样本加权和课程调度,而不是硬性拒绝,从而允许模型仍然从不完美的但具有信息量的训练样本中有效学习。

3.4 数据标注

幸存的片段被标注用于动作条件和文本条件的世界模型训练。该管道在设计上尽可能与数据源无关,同时在可用时利用特定于数据源的信号。

动作标签。动作标签通过特定于数据源的机制获得,并转换为共享的标准格式。对于游戏数据,源原生控制信号直接从游戏的运行时 API 捕获,具有真实标签精度,并与每个视频帧同步。对于仿真数据,标签源自设计好的轨迹(第 3.2.4 节)。对于互联网视频,标签源自通过位移投影和阈值处理估计的姿态(第 3.2.5 节)。这些伪标签虽然带有估计噪声,但能够大幅扩展训练数据的多样性。因此,这三种来源为统一模型训练提供了共同的动作表示。

场景描述。除了动作标签外,我们还使用大型视觉语言模型(VLM)为每个片段生成结构化的自然语言描述。这些描述作为文本条件生成训练期间的条件输入,使模型除了响应低级动作控制外,还能响应高级语义提示(例如,“沿着沿海高速公路的晴朗驾驶”)。

VLM 生成的描述捕捉了整体场景构图、环境特征、天气和光照条件以及显著的动态事件,同时故意省略了相机

ABot-World-0 第 9 页,共 33 页

第 10 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

运动信息以解耦运动控制与场景生成——这一设计选择有助于防止模型将文本描述与相机轨迹信号混淆。对于游戏数据,每个字幕前都添加了游戏标识符 token,使模型能够学习特定来源的视觉风格和渲染惯例。

语义标记。每个片段还额外标注了一组由视觉语言模型(VLM)提取的结构化语义标签,包括场景属性(室内/室外、城市/乡村、建筑类型)、天气状况、一天中的时间、车辆类型和视角模式。这些标签支持训练过程中的分层采样,确保对多样化环境条件的均衡接触,并促进针对特定子集的目标微调或评估。

人物身份。对于第三人称视角数据,我们额外提取结构化的人物身份表示:从每个第三人称片段中,我们识别出角色清晰可见且无遮挡的帧,然后根据相机与角色的相对角度,裁剪出朝向四个基本观察方向(正面、背面、左侧面、右侧面)的人物缩略图。从这些方向性缩略图中,我们进一步通过基于图像的补全合成一个标准的正面肖像,从而生成标准化的身份参考。

这些注释支持第三人称场景中的身份条件生成,并为角色一致的视频合成提供身份参考。共同构成的多源精选语料库支持完整的 ABot-World 训练流程,而模型评估则反馈给后续的 WorldExplorer 收集过程,并闭合图 2 所示的数据-模型闭环。

4 ABot-World-0

本节介绍完整的 ABot-World-0 流程。我们首先介绍一般问题公式化(第 4.1 节),该公式化定义了交互式世界建模任务,包括动作条件输入和训练目标。接着,我们描述双向教师训练(第 4.2 节),该训练通过大规模交互式视频数据,赋予预训练视频生成器动作条件的动态建模能力。随后,我们介绍因果蒸馏(第 4.3 节),该过程将双向生成能力转移到一个因果自回归模型中,该模型支持高效的在线交互和长时程推演。为了进一步提高推演的稳定性,我们引入了 LongForcing,这是一种长时程分布匹配策略,它将教师监督扩展到更长的时间上下文,并减轻累积的自回归漂移。最后,我们详细介绍我们的推理加速流程(第 4.4 节)。

总之,本节介绍了三个核心技术组件:

1. 一个动作可控的视频世界模型,用于统一的交互式生成。ABot-World-0 使用原始键盘输入作为场景漫游和第三人称角色交互的唯一动作接口,同时参考角色记忆提供互补的外观条件,以支持第三人称交互期间的角色身份一致性。 2. 一个渐进式双向到因果的训练流程,用于高效且稳定的推演。教师强制和 ODE 蒸馏逐步将双向教师转移为因果少步学生模型,而 LongForcing 将长时程学生自推演与扩展时程教师对齐,以减轻累积的分布偏移和自回归漂移。 3. 一个用于实时单 GPU 部署的全栈推理协同设计。部署栈结合了少步扩散、轻量级 VAE 解码、低比特 DiT 推理、高效注意力机制和位置编码,以及内存感知调度,从而在单台桌面 GPU 的计算和内存限制内实现实时交互式生成。

ABot-World-0 第 10 页,共 33 页

第 11 页

AMAP CV 实验室 | 阿里巴巴集团 技术报告

4.1 公式化表述

世界模型的根本目标是从过去的观察和Agent 交互中预测环境的未来状态。在我们的设定中,环境状态由视频表示,模型根据先前观察到的帧、用户动作以及高级文本指令和参考图像等多模态条件,预测未来的视觉观察结果。我们将此任务表述为一个交互式世界建模问题,该问题涵盖了三个关键要求:长时程视频推演、动作条件化以及跨长时程的时间一致性。

形式上,令 $v_{0:t-1}$ 和 $a_{t:t+L-1}$ 分别表示可用的视觉历史和未来动作序列。令 $c$ 表示由文本提示和参考图像组成的多模态条件。我们的目标是建模 $p_\theta(v_{t:t+L-1} \mid v_{0:t-1}, a_{t:t+L-1}, c)$ , (1)

其中 $v_{t:t+L-1}$ 表示长度为 $L$ 的下一个视频块。通过迭代预测并追加未来块,模型可以自回归地推演出长时程轨迹。

如图 3 所示,我们的训练流程包含两个主要阶段,每个阶段对应不同的条件建模目标:

1. 双向教师学习。 在第一阶段,我们训练一个双向教师模型,以初始帧、完整动作序列和多模态条件为条件生成全时程视频。具体而言,给定初始帧 $v_0$、动作 $a_{1:T}$ 和多模态条件 $c$,教师模型被训练用于建模 $p_{bi\phi} (v_{1:T} \mid v_0, a_{1:T}, c)$ . (2)

双向架构联合生成目标序列,允许信息在整个时间范围内传播,而不是强制严格的因果依赖关系。这种非因果公式化允许全时程信息交换,并为视觉一致性、运动质量和动作对齐提供强大的教师模型。我们从预训练的视频生成主干网络开始,在大规模视频-动作数据上对教师模型进行微调,包括动作条件化、参考角色记忆和长序列训练。 2. 通过蒸馏进行因果学生模型学习。 在第二阶段,我们将训练好的双向教师模型蒸馏到一个因果自回归生成器中,其目标与公式 (1) 中的在线推演设置相匹配。具体而言,学生模型建模

$p_{causal\theta} (v_{t:t+L-1} \mid v_{0:t-1}, a_{t:t+L-1}, c)$ , (3)

仅使用过去的视觉观察、相应的动作序列和多模态条件来预测每个未来的视频块,而无法访问未来帧。 由于双向教师模型依赖于全序列生成和迭代去噪,因此无法直接部署用于交互式自回归推演。因此,我们采用渐进式的三阶段蒸馏流程。首先,Teacher Forcing(教师强制)在因果视觉条件下将教师模型的知识转移给自回归学生模型。其次,ODE 蒸馏通过学习从中间噪声潜在变量到由冻结的 Stage 1 因果模型的概率流 ODE 在相同因果输入下定义的清洁端点的映射,将多步自回归去噪压缩为少步预测。第三,我们引入 LongForcing,它针对扩展时程教师模型执行分布匹配。更长的监督时程覆盖了学生模型自推演的后期部分,其中预测错误有更多机会累积。这提供了超越短时程训练的分布级校正监督,并减少了自回归推演过程中的长期漂移。

以下各节将详细描述每个阶段。

ABot-World-0 第 11 页,共 33 页

第 12 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

双向教师模型 自回归因果学生模型

阶段 1 动作控制注入 阶段 1 阶段 2 阶段 3

教师强制 (Teacher Forcing) ODE 蒸馏 LongForcing 目标:将预训练的视频生成器 适配为双向动作可控的 目标:将双向教师模型转换为因果学生模型。 目标:将多步去噪蒸馏为少步 目标:提升 rollout 稳定性 世界模型。 推理。 并减少长时程漂移。 历史(干净) 多步教师模型 学生 rollout (去噪轨迹) 键盘操作 打包后的 附加条件 … xT → … → xt → … → x0 教师分布 动作 动作 token 条件 长时程匹配 (校正漂移) 预测 蒸馏 学生(因果) ↔ 教师 目标块(加噪) (双向) 参考 视频 DiT 少步 rollout(推理) ← 匹配分布 → 记忆 token 骨干网络 xT → … → xk → x0 ∇x log pT(xt) − ∇x log pS(xt) → 0

高质量动作条件全时程生成器 低延迟因果 rollout 模型,用于实时交互

图 3:ABot-World-0 的整体训练流程。我们首先将预训练的视频生成器适配为高质量的双向动作条件教师模型。随后,通过教师强制(Teacher Forcing)、因果 ODE 蒸馏和 LongForcing,逐步将该教师模型转换为因果自回归学生模型,从而实现低延迟的少步推理和稳定的长时程交互式 rollout。

4.2 带有动作控制注入的双向教师模型训练

预训练的视频生成模型拥有丰富的世界先验知识,如视觉外观、物理合理性和场景构成,但缺乏动作条件的动态知识,即从离散控制输入到相应视觉状态转换的映射。为了弥补这一差距,我们将动作控制信号和参考图像注入到预训练的 Wan2.2 骨干网络 [16] 中,训练一个双向视频生成模型。通过对大规模多源视频-动作数据进行带有时间增强的全参数微调,我们的模型学习了动作与视觉动态之间的对应关系,为后续的因果自回归适配奠定了坚实基础。

4.2.1 动作控制注入

我们使用原始键盘输入作为唯一的交互式控制信号。具体而言,每个帧级动作被表示为一个 8 维的多热向量,对应 8 个离散按键:W/A/S/D 用于角色或相机移动,I/J/K/L 用于相机旋转。令

a1:T = {a1, . . . , aT }, at ∈{0, 1}8, (4)

表示长度为 T 的视频的逐帧动作序列。与依赖估计相机姿态或学习潜在动作的方法相比,这种原始键盘信号可直接从游戏录屏中获得,并且在推理时与用户意图自然对齐。

为了匹配视频分词器的时间压缩率,我们将每 4 个连续的帧级动作沿通道维度打包,这与 VAE 的时间块大小(temporal patch size)4 保持一致。具体而言,打包后的动作 token 序列为

˜a1:T/4 = {˜a1, . . . , ˜aT/4}, ˜aτ ∈{0, 1}32, (5)

其中 ˜aτ = Concat(a4τ−3, a4τ−2, a4τ−1, a4τ) . (6)

因此,每个时间动作 token 的维度为 8 × 4 = 32,并与经过 VAE 压缩后的一个潜在帧对齐。

ABot-World-0 第 12 页,共 33 页

第 13 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

随后,我们将打包的动作序列输入到动作控制适配器 $F_\psi$ 中。我们采用一种相机适配器架构,由 PixelUnshuffle、一个卷积层(其核大小和步长均设置为 DiT 的空间块大小)以及随后的残差卷积块组成。PixelUnshuffle 的下采样因子被选择为与 VAE 的空间压缩率相匹配,以便适配器输出严格对齐 DiT 分块潜在标记的时空分辨率。用 $z$ 表示加噪视频潜在变量,用 $\text{PatchEmbed}(z)$ 表示其分块嵌入,则动作条件的潜在标记由下式给出: $\hat{z} = \text{PatchEmbed}(z) + F_\psi(\tilde{a}_{1:T/4})$. (7)

这种设计实现了动作信息以逐标记加法注入的方式直接注入到 DiT 主干网络中。

在我们的模型中,我们全程在分块阶段使用加法注入。

4.2.2 身份保持条件

视频世界模型在长时程第三人称推演过程中可能会遭遇身份漂移问题,即尽管保留了运动动力学,但角色外观逐渐发生偏离。为了解决这个问题,我们引入了一个参考角色记忆模块,该模块由可控角色的多个规范参考图像组成。

参考图像由与推演帧相同的 VAE 编码,并转换为身份记忆标记,这些标记被前置到视频标记序列中,位于 DiT 主干网络之前。我们为记忆标记分配固定的负时间 RoPE 索引,为非负索引的视频标记分配正时间索引,从而将静态身份信息从生成的轨迹中分离出来。此外,我们采用非对称的记忆-视频注意力模式,其中视频标记关注记忆标记,而记忆标记与视频标记隔离。这使得在自回归推演过程中能够持续检索身份信息,并提高长时程下的角色一致性。

输入视频帧 生成视频帧 … … 模型设计

参考图像(身份记忆) 预训练模块 视频分词器 (VAE) 视频分词器 (VAE) 解码器 适配器模块 … 时间下采样大小 = 4 核心 DiT 主干 可控主体的规范视角 … 身份记忆

加噪潜在标记 ⊕ 加法注入 动作序列 (帧, 8 维) 动作打包 (4 帧) … 因果 DiT 主干 训练数据与设置 分块嵌入 (全参数微调) 🎮 大规模游戏数据 (分块化) 🕐 时间学习 打包动作标记 (32 维) 🎬 长时程

视频标记 (正时间) 身份 记忆 (负时间) 📊 全参数微调 … … ⊕ … 0 1 2 … N−1 非对称注意力 … -3 -2 −1 动作控制适配器 $F_\psi$ (视频关注身份标记)

(PixelUnshuffle + 卷积 + 残差块)

图 4:ABot-World-0 模型架构。ABot-World-0 将动作控制和参考角色记忆集成到预训练的视频 DiT 中。键盘动作引导动力学,而参考图像有助于保持角色身份。

4.3 因果渐进式学生蒸馏

由于双向教师模型需要生成完整序列并进行多步去噪,因此无法直接部署用于实时交互。因此,我们通过一个三阶段渐进式流水线将其蒸馏为因果生成器:(1) 教师强制(Teacher forcing),在因果视觉条件下将双向教师转换为自回归学生;(2) ODE 蒸馏,在保持生成质量的同时将自回归去噪过程减少为少步推理;以及 (3) LongForcing,用于

第 14 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

通过扩展时程教师模型进行长时程分布匹配,以提高自推演(rollout)的稳定性,并缓解自回归生成过程中的累积漂移。通过将学生模型暴露于更广泛的长时程学生自推演上下文中,其中推演误差可能会累积,LongForcing 提供了超出短训练时程的校正监督。每个阶段都建立在前一阶段的基础上,逐步将高质量但非因果的教师模型转化为适合实时交互式推演的高效因果世界模型。

4.3.1 阶段 1:教师强制(Teacher Forcing)

我们并非从头开始训练因果学生模型,而是从训练好的双向教师模型初始化它,并通过因果训练目标和注意力掩码策略对模型进行适配。虽然双向教师模型利用完整的时序上下文联合去噪整个视频序列,但因果学生模型仅使用先前观察到的视觉上下文来生成未来的视频块。

具体而言,在教师强制过程中,历史帧作为干净的真实潜在变量(ground-truth latents)提供,而目标块则根据扩散过程被破坏。因果注意力掩码限制模型访问超出可用历史范围的未来视觉上下文,从而匹配自回归推理所需的信息结构。这种表述保留了双向教师模型学到的视觉先验和长程动态知识,同时使模型适应因果生成。

形式上,对于从时间 $t$ 开始的推演步骤,学生模型建模为

$p_{\theta}^{\text{causal}}(v_{t:t+L-1} | v_{0:t-1}, a_{t:t+L-1}, c)$ , (8)

其中 $v_{0:t-1}$ 用作干净的视觉条件,$v_{t:t+L-1}$ 转换为用于扩散训练的噪声潜在目标。通过在此阶段依赖真实历史,该目标提供了从双向轨迹建模到因果自回归推演的稳定适配。

4.3.2 阶段 2:ODE 蒸馏

前一阶段获得的因果扩散模型在每个自回归推演步骤中仍需要迭代去噪。为了降低推理延迟,我们应用因果 ODE 蒸馏,训练一个少步模型来近似由阶段 1 因果模型诱导的概率流 ODE。

一个关键要求是参考模型和蒸馏模型遵循相同的因果分解。因此,我们冻结阶段 1 的因果扩散模型(由 $\theta_c$ 参数化),并将两个模型置于相同的因果上下文条件下: $C_t = (v_{0:t-1}, a_{t:t+L-1}, c)$ , (9)

其中 $v_{0:t-1}$ 表示干净的视觉历史,$a_{t:t+L-1}$ 表示目标动作序列,$c$ 表示由文本提示和参考图像组成的多模态条件。

令 $z_{cs}$ 为阶段 1 因果模型概率流 ODE 轨迹上噪声水平 $s$ 处的中间潜在变量。其对应的干净端点为

$z_{c0} = \Phi_{\theta_c, s\to0}(z_{cs}; C_t)$ , (10)

其中 $\Phi_{\theta_c, s\to0}$ 表示从噪声水平 $s$ 到干净端点的因果模型概率流 ODE 的积分。蒸馏模型被训练以直接预测此端点:

$\mathcal{L}_{\text{ODE}} = \mathbb{E}_{s, z_{cs}, C_t} \|f_{\theta}(z_{cs}, s, C_t) – \text{sg}(z_{c0})\|_2^2$ , (11)

其中 $\text{sg}(\cdot)$ 表示停止梯度操作。

ABot-World-0 第 14 页,共 33 页

第 15 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

由于中间潜在变量及其端点是在相同条件下从同一因果 ODE 轨迹中获得的,因此它们为每个自回归预测步骤定义了一致的流映射。此外,蒸馏目标仅依赖于部署期间可用的因果上下文,不需要未来的视觉观测。因此,所得模型可以用显著更少的去噪步骤来近似原始因果扩散端点映射,同时保持其自回归展开行为。

4.3.3 阶段 3:LongForcing

经过 ODE 蒸馏后,因果学生模型仅需少量去噪步骤即可执行自回归展开。然而,它仍然面临一个根本性的长时程挑战:由于每个预测都基于先前生成的帧进行条件约束,微小的分布误差会不断累积,并逐渐使展开过程偏离训练期间极少遇到的长时程学生展开上下文。这些长时程学生展开上下文受到的分布匹配监督有限,导致展开分布逐渐偏离期望的世界动力学。

因此,我们引入了 LongForcing,这是一种最终的长时程分布匹配阶段,通过扩展教师监督的时间范围来提高展开稳定性。与在固定因果条件下学习干净端点流映射的 ODE 蒸馏不同,LongForcing 在长时程条件视频分布的层面上对学生和教师进行对齐。关键见解在于,长时程稳定性不仅取决于准确的局部转换,还取决于闭环展开分布是否保持在教师监督所覆盖的时间区域内。

更长的学生自展开使模型接触到长时程学生展开上下文,在这些上下文中,微小的预测错误有更多机会累积。LongForcing 在这些自生成轨迹上进行训练,并在最终的分布匹配蒸馏(DMD)阶段 [68] 应用来自扩展时程教师的分布级校正监督。这鼓励学生在不要求显式帧级轨迹匹配的情况下维持合理的长时程动力学。与短时程教师监督相比,扩展时程在更长的时间范围内提供分布级指导,旨在减轻视觉质量和动作条件动力学的渐进式退化。

4.4 面向实时世界展开的全栈协同设计

少步蒸馏显著降低了每个自回归预测的去噪成本,但仅靠它本身不足以在单张消费级 GPU 上实现实时交互式世界展开。随着去噪预算的压缩,主要的系统瓶颈转向分块潜在解码、Transformer 计算、注意力机制和位置编码开销、上下文内存流量以及运行时模型驻留。

因此,我们将实时部署表述为一个全栈协同设计问题,涵盖时间生成粒度、VAE 解码器、低精度 DiT 执行、注意力和 RoPE 内核、有界上下文内存以及运行时模块调度。我们的目标不是优化孤立的算子,而是共同平衡三个部署关键属性:持续生成吞吐量、动作到首帧延迟以及峰值 GPU 内存使用量。这种协同设计的推理栈使得在单张 NVIDIA RTX 5090 GPU 上实现实时、高分辨率、长时程的交互式生成成为可能。

4.4.1 部署目标与运行时指标

ABot-World-0 采用分块因果生成,联合生成一帧潜在帧块,并在将结果帧交付给流式运行时之前解码整个块。我们将动作到首帧延迟定义为用户按键到相应推理

第 16 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

表 1:ABot-World-0 在单张 NVIDIA RTX 5090 上的部署设置与运行包络。

| 项目 | 规格 | | :— | :— | | GPU | 1× NVIDIA RTX 5090 | | Batch size (批大小) | 1 | | Resolution (分辨率) | 1280 × 704 | | Inference (推理) | 分块流式推理 (Chunk-wise streaming) | | Throughput (吞吐量) | 高达 16 FPS | | Action-to-first-frame latency (动作到首帧延迟) | 1.2 s | | Peak VRAM (峰值显存) | ≤19.3 GiB |

块已被解码,且其首个响应帧变得可用。

该表报告的是整体部署包络,而非单一精度特定的运行点。 表 2 报告了 FP8 和更激进的低位宽配置 across 的详细速度与内存权衡。

4.4.2 分块流式推理与运行时协同设计

轻量级 VAE 解码器降低了首帧延迟和峰值内存占用。尽管 DiT 仍然是主要的计算组件,但在高分辨率下,VAE 解码对首帧延迟和内存消耗仍有不可忽略的贡献。受 TAEHV [79] 的启发,我们简化并剪枝了解码器架构,构建了一个轻量级 VAE 解码路径,称为 LightVAE,显著减少了解码时间和峰值内存占用。

由于在响应帧可供流式运行时使用之前,必须解码完整的潜在块(latent chunk),因此减少块的解码时间直接降低了动作到首帧的延迟。

内存感知调度提高了单 GPU 部署的可行性。为了进一步减轻 GPU 内存压力,我们采用了受 FramePack [80] 模块交换工具启发的内存感知运行时调度。模型模块根据其执行顺序和内存需求进行分阶段驻留,而不是要求推理流水线的所有组件同时驻留在 GPU 上。这种策略在不修改模型架构的情况下降低了峰值 VRAM 使用量,同时限制了在延迟关键推理路径上的数据传输开销。

Fast-RoPE 降低了时间位置编码的开销。长视距自回归生成在移动局部注意力上下文上反复应用时间位置编码。我们采用 Fast-RoPE 来优化流式生成过程中的时间位置编码。具体而言,我们在局部注意力窗口内重新锚定时间 RoPE,以减少随着 rollout 推进而在完整可见上下文上重复计算 RoPE 的开销。我们还使用基于 Triton 的 RoPE 内核来加速旋转操作。这些优化共同降低了长视距交互式推理过程中的位置编码开销。

4.4.3 低位宽计算与上下文内存协同设计

低位宽混合精度推理提高了 DiT 的吞吐量和内存效率。为了降低 DiT 推理的计算和内存带宽成本,我们遵循 LightX2V [81] 的部署实践应用低位宽量化。FP8 作为我们默认的质量导向运行点,在 GEMM 吞吐量和内存带宽效率方面提供了显著改进。

我们还评估了更激进的低位宽格式,以表征部署包络的上限吞吐量区域。具体而言,DiT 主干中计算密集型的线性层被量化,而数值敏感组件如 VAE 和文本编码器则保持较高精度

ABot-World-0 第 16 页,共 33 页

第 17 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

精度。这种混合精度设计在推理吞吐量和内存使用之间提供了可配置的权衡,同时为数值敏感组件保留了更高的精度。

高效的注意力内核加速了主导性的 Transformer 算子。注意力计算构成了扩散 Transformer 每步延迟的主要部分,特别是在具有长令牌序列的高分辨率视频生成中。因此,我们采用 SageAttention2 [82] 作为高效的注意力后端。它无需重新训练模型或修改架构即可替换传统的注意力执行方式,从而降低了主导性 Transformer 算子的运行时成本。

有界 KV 缓存防止上下文无限增长,而缓存量化可以进一步降低其固定成本。对于长时程流式生成,朴素的全历史 KV 缓存会随着生成的上下文持续增长,最终成为实际的内存和带宽瓶颈。ABot-World-0 通过带有滚动驱逐机制的有界局部上下文 KV 缓存避免了这种无限增长,使缓存占用量独立于总的 rollout 持续时间。

然而,即使在有界上下文设计下,驻留的键(key)和值(value)张量仍然是高分辨率下内存消耗和内存带宽流量的主要来源。为了进一步降低这一成本,我们探索了 KV 缓存量化,它在压缩缓存的键和值张量的同时,保留了它们用于后续注意力计算的可用性。

遵循最近在线向量量化的进展 [83],该策略可以同时降低固定缓存占用量和局部上下文注意力的带宽压力。因此,KV 缓存量化可以补充低比特 DiT 推理,并在受限的 GPU 内存下提高长时程生成的可扩展性。

4.4.4 端到端系统分析

表 2:在单张 NVIDIA RTX 5090 GPU 上,1280 × 704 分辨率和批量大小 1 下,不同优化变体的系统级分解。

配置 DiT 时间 (ms/chunk) VAE 时间 (ms/chunk) FPS ↑ VRAM (GiB) ↓

基础 – – OOM OOM + SageAttention2 – – OOM OOM + SageAttention2 + LightVAE 1191.081 78.276 9.117 20.491 + SageAttention2 + LightVAE + FP8 845.180 75.980 12.405 15.925 + SageAttention2 + LightVAE + FP8 + Fast-RoPE 786.871 71.730 13.269 19.281 + SageAttention2 + LightVAE + MXFP6 + Fast-RoPE 718.281 85.994 14.098 18.287 + SageAttention2 + LightVAE + MXFP4 + Fast-RoPE 638.843 72.957 15.831 17.148

每个推理块包含 3 个潜在帧,并生成 12 个解码后的视频帧。DiT 和 VAE 时间按每个推理块报告,FPS 表示生成吞吐量,VRAM 表示峰值 GPU 内存使用量(单位为 GiB),OOM 表示内存溢出。表 2 表明,实时部署源于全栈优化,而非单个算子的加速。基础配置和仅使用 SageAttention2 的变体均出现内存溢出,这表明仅更快的注意力内核不足以使完整的高分辨率流水线在单张桌面 GPU 上可部署。内存可行性需要 Transformer 执行、视频解码、数值精度和运行时模型驻留的联合优化。

引入 LightVAE 产生了第一个可行的配置,以 20.491 GiB 的峰值 VRAM 实现了 9.117 FPS。这一结果表明,原始 VAE 是内存可行性的一个重要瓶颈,而 VAE 解码仍然是块响应延迟中不可忽视的组成部分。

在此基础上,对 DiT 主干进行量化带来了显著增益。FP8 将每个块的 DiT 时间从 1191.1 毫秒减少到 845.2 毫秒,将生成吞吐量从 9.117 FPS 提高到 12.405 FPS,并将峰值内存使用量从 20.491 GiB 减少到 15.925 GiB。添加 Fast-RoPE 进一步将 DiT 时间减少到 786.9 毫秒,并将吞吐量提高到 13.269 FPS。测得的峰值内存增加到

ABot-World-0 第 17 页,共 33 页

第 18 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

在此配置下占用 19.281 GiB,这表明峰值显存占用由完整的运行时配置决定,而非仅由单个算子的成本决定。

我们将 FP8 作为默认的质量导向配置,而更激进的低位宽格式则扩展了高吞吐量的运行范围。在优化的低位宽配置下,ABot-World-0 最高可达 16 FPS,同时峰值显存占用保持在 19.3 GiB 以下。

总体而言,结果验证了我们的核心系统见解:少步生成并不会自动转化为实时交互。实时、高分辨率的世界推演需要时间生成、潜在解码、Transformer 算术、注意力机制与位置编码、上下文内存管理以及运行时调度的全栈协同设计。这些优化共同将蒸馏后的因果模型转化为一个实用的交互式世界模拟器,能够在单张桌面 GPU 上持续运行。

量化感知训练可能会进一步改善速度-内存-质量之间的权衡。我们将此方向留作未来工作。

5 评估

我们通过三个互补的视角对 ABot-World-0 进行评估:在 WorldRoamBench 上的定量比较、LongForcing 的 60 秒时间消融实验,以及涵盖小时级和天级推演、域外控制(OOD)和物理交互的定性压力测试。WorldRoamBench 衡量动作可控性、轨迹跟随、视觉质量、物理合理性和时间记忆,而扩展推演则考察模型在基准范围之外的行为。LongForcing 消融实验直接评估自推演过程中的视觉误差累积,而定性案例则展示了扩展交互、身份持久性、控制泛化和合理的物理效应。这些实验共同刻画了 ABot-World-0 在长时间交互过程中的可控性、连贯性和状态持久性。

5.1 WorldRoamBench 评估

为了在交互式、长视距场景中评估 ABot-World-0,我们使用了 WorldRoamBench [84],这是一个用于可控视频世界模型的开放世界基准。WorldRoamBench 评估四个关键维度:动作可控性、视觉合理性、物理一致性和时间记忆保持。

5.1.1 定量结果

表 3 仅报告了具体的 WorldRoamBench 子维度结果。我们遵循基准协议,与 Genie 3 [3]、HappyOyster [85]、LingBot-World [86] 和 HY-World 1.5 [87] 进行比较。

表 3:WorldRoamBench 在动作、视觉、物理和记忆选定子维度上的定量比较,表头相应着色。最佳结果以粗体显示,次佳结果以下划线标示。

模型 大小 严格准确率 部分准确率 轨迹得分 美学评分 成像质量 力学表现 记忆表现

Genie 3 – 0.4700 0.6608 0.6719 0.4711 0.4757 0.5454 0.6073 HappyOyster – 0.5317 0.7631 0.7737 0.5235 0.4377 0.5395 0.6309 LingBot-World 14B 0.3235 0.4198 0.4094 0.2898 0.2875 0.2777 0.3006 HY-World 1.5 8.3B 0.1640 0.2088 0.2015 0.1400 0.1236 0.1115 0.1562

ABot-World-0 5B 0.5266 0.7290 0.6752 0.5039 0.4651 0.5223 0.5041

ABot-World-0 在动作保真度、轨迹跟随、视觉质量、物理力学和记忆得分方面均表现出色。

ABot-World-0 第 18 页,共 33 页

第 19 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

5.1.2 定性分析

除了具有竞争力的定量性能外,ABot-World-0 还展示了三种对实际交互式世界模型至关重要的定性能力:在极长推演过程中保持持续的可控性和场景连贯性、能够泛化到不同场景和可控角色的统一控制接口,以及对动作和环境约束产生合理的物理响应。在评估的案例中,ABot-World-0 在保持可识别的场景结构、角色和物体身份以及运动连续性的同时,对用户指令保持响应,而不会迅速退化为冻结运动、重复纹理或严重的视觉漂移。这些结果表明,ABot-World-0 学习的是持久且具状态感的交互动态,而不仅仅是生成本地合理的短片段序列。

图 5、图 6 和图 7 展示了模型的长时程生成能力。小时级结果包含五个独立的推演,以带时间戳的关键帧条形式可视化。尽管生成长度较长,ABot-World-0 在持续响应输入动作流的同时,保持了连贯的环境、视角和可控角色。天级压力测试进一步使模型面临严重的累积误差条件,采样的检查点保留了可识别的场景结构和活跃的运动,而不是退化为纹理噪声、重复内容或静态帧。

图 8 评估了域外 (OOD) 控制泛化能力,其中环境和可控角色均位于训练分布之外。这些示例涵盖了在统一动作表示下的不同场景和可控角色。在这些 OOD 设置下,生成的运动始终遵循输入动作序列,同时与周围环境保持连贯,表明学习到的动作条件化能够泛化到新的场景-角色组合。

图 9 突出了交互过程中出现的合理物理后果。例如,一个人将纸箱推开,脚步声引起水中时间上一致的扰动,一个人走过雪地留下持久的脚印,第一人称运动被墙壁阻挡,以及角色与栏杆碰撞而未穿过它。这些案例涉及碰撞、接触效应、持久的环境变化和几何约束,这些并非仅由动作标签指定。尽管 ABot-World-0 并未显式地使用符号物理规则或真实世界碰撞标注进行训练,但它从大规模交互式视频经验中产生了合理的物理响应。

ABot-World-0 第 19 页,共 33 页

第 20 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

REC 0分钟 6分钟 12分钟 18分钟 24分钟

30分钟 36分钟 42分钟 48分钟 54分钟 结束 第三人称奇幻游戏场景,白发剑客站在阳光照耀的山间草地上,……

REC 0分钟 6分钟 12分钟 18分钟 24分钟

30分钟 36分钟 42分钟 48分钟 54分钟 结束 第三人称奇幻游戏场景,骑手骑马穿越明亮的绿色草地……

REC 0分钟 6分钟 12分钟 18分钟 24分钟

30分钟 36分钟 42分钟 48分钟 54分钟 结束 第三人称电影式奇幻游戏场景,身穿盔甲的骑手骑着白马沿山……

REC 0分钟 6分钟 12分钟 18分钟 24分钟

30分钟 36分钟 42分钟 48分钟 54分钟 结束 第三人称黑暗奇幻游戏场景,身穿斗篷的白发战士走向阴森的城堡……

REC 0分钟 6分钟 12分钟 18分钟 24分钟

30分钟 36分钟 42分钟 48分钟 54分钟 结束 第三人称奇幻冒险游戏场景,金发少年站在石板路上……

图 5:小时级长时程生成示例。每次展开(rollout)均展示为带时间戳的关键帧条,证明了在一小时交互式展开过程中持续的可控性和场景连贯性。

ABot-World-0 第 20 页,共 33 页

第 21 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

REC 0h 1h 2h 3h 4h

5h 6h 7h 8h 9h

10h 11h 12h 13h 14h

15h 16h 17h 18h 19h

20h 21h 22h 23h 24h END 第三人称奇幻游戏场景,一名年轻的金发冒险者站在高高的绿草中,白色和……

REC 0h 1h 2h 3h 4h

5h 6h 7h 8h 9h

10h 11h 12h 13h 14h

15h 16h 17h 18h 19h

20h 21h 22h 23h 24h END 第三人称奇幻游戏场景,一名白发剑客沿着陡峭的草山坡移动,……

图 6:天尺度长时程生成示例,集合 I。来自两个天尺度展开(rollout)示例的时间戳关键帧显示,在扩展生成过程中的采样检查点处,场景结构可识别、视角一致且存在活跃运动。

ABot-World-0 第 21 页,共 33 页

第 22 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

REC 0h 1h 2h 3h 4h

5h 6h 7h 8h 9h

10h 11h 12h 13h 14h

15h 16h 17h 18h 19h

20h 21h 22h 23h 24h END 第三人称黑暗奇幻游戏场景,白发猎人在暴风雨天空下攀爬荒凉的岩石斜坡,……

REC 0h 1h 2h 3h 4h

5h 6h 7h 8h 9h

10h 11h 12h 13h 14h

15h 16h 17h 18h 19h

20h 21h 22h 23h 24h END 第三人称雪地荒野游戏场景,身穿亮橙色夹克的探险者奔跑穿过……

图 7:天尺度长时程生成示例,集合 II。另外两个带时间戳的展开示例在存在显著累积误差的情况下,在采样检查点处仍保持了可识别的场景结构和活跃的运动。

ABot-World-0 第 22 页,共 33 页

第 23 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

REC

第三人称游戏场景,一名背着背包的男子穿过整洁的工业仓库或装卸区,…… END

REC

END 第三人称游戏场景,一名身穿黑色皮夹克的男子站在宽阔潮湿的城市大道中央,……

REC

第三人称游戏场景,一名身披红袍的武士手持长柄武器,站在积雪的寺庙庭院中,…… END

REC

END 第三人称动漫风格奇幻游戏场景,一名金发白衣女孩站在郁郁葱葱的绿色草地上,……

REC

END 第三人称游戏场景,一名男子站在阳光明媚的城市人行道上,旁边是现代化的购物街,……

图 8:跨不同场景和可控角色的域外(OOD)控制泛化能力。每一行展示了一个交互式 rollout( rollout 过程),其中环境和可控主体均位于训练分布之外。通过使用统一的动作接口,ABot-World-0 在保持与周围环境一致性的同时,生成了动作一致的角色运动。

ABot-World-0 第 23 页,共 33 页

第 24 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

REC

END 一名男子手提纸箱,走在积雪覆盖的村庄街道上,……

REC

END 一名男子站在浅滩沙漠河流中,两岸是岩石河岸和棕榈树,温暖的阳光,……

REC

END 一名身穿橙色冬季派克大衣的角色站在积雪的海岸线上,头顶是鲜艳的绿色极光,……

REC

END 一名角色沿着狭窄的混凝土路径行走,旁边是高耸的灰色墙壁,现代校园风格的……

REC

END 一名背着背包的角色正在穿越积雪的山口,攀爬金属楼梯,……

图 9:物理交互示例。这些案例包括物体碰撞、水迹、雪痕、墙壁阻挡以及与栏杆的碰撞且无穿透现象。

ABot-World-0 第 24 页,共 33 页

第 25 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

5.2 LongForcing 对长时程推演的影响

我们将 LongForcing 与一种因果强制(Causal-Forcing)风格的基线方法 [43] 进行比较,该基线方法已适配至我们的交互式世界模型,并在相同的推演协议下进行评估。两种变体均使用学生模型自回归推演产生的历史数据进行训练,并在最终的后训练阶段应用分布匹配蒸馏(DMD)。LongForcing 的区别在于,在此阶段使用长时程教师监督,而非基线方法所使用的短时程监督。我们使用 HPSv3 分数 [88]、高饱和度像素比例、感知模糊分数和图块重复率对两种变体在 60 秒推演中的表现进行评估。HPSv3 分数越高越好;其他三项指标的值越低越好。

(a) HPSv3 美学评分 (b) 高饱和度像素比例 10 0.008 因果强制 因果强制 LongForcing 0.007 LongForcing 8 0.006

6 0.005

0.004

4 0.003

0.002 2 0.001

0 0.000

(c) 感知模糊分数 (d) 图块重复率 2.5 因果强制 ×10−3 因果强制 0.34 LongForcing LongForcing

2.0

0.32

1.5

0.30

1.0

0.28

0.5

0.26

0.0 0 15 30 45 60 0 15 30 45 60 时间 (秒) 时间 (秒)

图 10:在 60 秒推演过程中,我们的因果强制风格基线与 LongForcing 的逐帧比较。两种变体均使用学生自推演和最终阶段的 DMD;LongForcing 额外使用长时程教师监督。标记为“因果强制”的曲线表示本报告中所使用的适配后的因果强制风格基线。HPSv3 值越高越好,而高饱和度像素比例、感知模糊分数和图块重复率的值越低越好。曲线为评估集上的平均值。

如图 10 所示,两种变体之间的差异在推演的后期部分变得更加明显。因果强制风格的基线在推演的后半段显示出 HPSv3 逐渐下降,同时饱和度过高、模糊和图块重复现象增加。相比之下,LongForcing 在同一时间段内保持了更高的 HPSv3 分数和更低的伪影相关指标,表明在自回归生成过程中视觉误差的累积较少。

ABot-World-0 第 25 页,共 33 页

第 26 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

6 讨论与未来工作

显式动作支持简单的条件控制。键盘输入是离散的,在时间上与视频对齐,并直接反映用户意图。对于这些显式控制信号,我们在补丁嵌入(patch-embedding)阶段使用加法注入,以在保留预训练模型视觉先验的同时提供可靠的控制。对于潜在动作、连续相机轨迹或语义指令等模糊信号,更复杂的条件控制方法可能仍然有用。

长时程漂移应更好地被理解为分布偏移问题。随着自回归生成的进行,视觉上下文中的小误差会不断累积,逐渐使模型超出短时程训练所覆盖的状态范围。基于 Sink 的上下文稳定化和固定参考帧可以延缓这一过程,但过度的锚定可能会使模型过于接近其初始观测,从而限制运动和场景演变。LongForcing 采取了不同的路径:它在长学生自推演(self-rollouts)上进行训练,并使用扩展时程教师来正则化由此产生的分布。这使得模型能够在保持稳定的同时继续想象新内容。我们在天尺度推演中采样的连贯检查点,与训练时分布对齐的目标一致,表明这是一条有前景的长时程生成途径。

实时交互不仅仅是几步采样。另一个实际经验是,仅减少去噪步数并不能产生交互式系统。一旦 DiT 被蒸馏,VAE 解码、注意力计算、内存传输以及 KV 缓存的内存占用和带宽需求仍然是实质性的系统成本。通过协同优化这些组件,ABot-World-0 能够在单张桌面 GPU 上维持实时推理。对于交互式世界模型而言,动作到首帧的延迟、持续吞吐量以及内存占用,比单纯的去噪步数更具意义。

未来工作。这些观察结果指向了几个自然的扩展方向。更丰富的动作和语义事件可能需要更结构化的条件控制;多尺度 LongForcing 和持久场景记忆可能进一步改善长时程一致性;而更高效的解码和上下文管理则可将高分辨率实时生成扩展到更广泛的消费级硬件。

7 结论

ABot-World-0 将动作条件视频世界建模带入了实时桌面部署。该模型在涵盖 AAA 游戏、仿真引擎和互联网视频的多源动作-视频数据上进行训练,单个模型支持跨不同环境和可控主体的场景导航与角色控制。参考角色条件控制在长时程第三人称生成过程中提供了持久的外观线索。

训练流程始于一个学习动作条件视觉动态的双向教师模型,并通过教师强制(teacher forcing)和 ODE 蒸馏逐步将其转化为高效的因果生成器。LongForcing 进一步将学生的长自推演与扩展时程教师对齐,将分布级监督扩展到重复自回归生成过程中遇到的长时程学生推演上下文。在超出训练时程的 60 秒推演评估中,结果显示 LongForcing 相对于 Causal-Forcing 风格的基线减少了视觉误差累积,支持了在评估推演过程中改善的视觉稳定性。

优化的部署栈结合了轻量级 VAE 解码器、低比特推理、高效注意力机制以及内存感知调度,在单张 RTX 5090 上实现了最高 16 FPS 的 720P 流式传输,动作到首帧延迟为 1.2 秒,同时在优化的低比特工作点上峰值 VRAM 保持在 19.3 GiB 以下。WorldRoamBench 上的结果表明,在动作跟随、轨迹跟随、视觉质量、物理力学和记忆保持方面具有竞争力的性能。值得注意的是,采样检查点

ABot-World-0 第 26 页,共 33 页

第 27 页

AMAP CV Lab | 阿里巴巴集团 技术报告

来自天尺度(day-scale)展开的采样点在评估的时间戳上保持了可识别的视觉质量、动态特性和场景连贯性,且未出现可观察到的崩溃现象。

ABot-World-0 证明了在单个视频世界模型中可以实现统一的交互控制、稳定的长时程推理以及消费级实时部署。通过不断扩展生成的世界以超越预定义的场景边界,它为交互式内容创作、游戏模拟、Agent 学习和具身智能研究提供了一个开放且实用的基础。

8 贡献者

项目赞助人:徐穆、郭宁。

基础模型团队:江帆†、孙兆旭、王梦超、朱子玉、王驰宇、张云鹏、刘文林、王云、郑雪、孙锐、倪俊峰。

数据团队:潘宏宇†、孙仲旭、余飞、葛曾业、杜萌萌、范年飞、孙明超、刘宇、永昌。

AI 基础设施团队:朱彦庆†、王佳航、应宁、玄宇泽、杨迪。

基准测试团队:刘志成†、高哲、徐廷冰、隋家诚、杨文锦。

工程团队:赖俊南†、范年飞、刘树峰、杜萌萌、刘源、郑正、彭英良、曹大伟、盛凯峰、蔡宇翔、陆飞。

致谢

我们衷心感谢余成镇、孙冲、龚春诺、张健、王倩薇、雷宇(按名字首字母排序)在整个项目开发过程中提供的宝贵支持、深刻见解和贡献。

参考文献

[1] Seung Wook Kim, Yuhao Zhou, Jonah Philion, Antonio Torralba, and Sanja Fidler. Learning to simulate dynamic environments with GameGAN. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2020.

[2] Jake Bruce, Michael D. Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, et al. Genie: Generative interactive environments. In International Conference on Machine Learning (ICML), 2024.

[3] Google DeepMind. Genie 3. https://deepmind.google/models/genie/, 2025.

[4] Dani Valevski, Yaniv Leviathan, Moab Arar, and Shlomi Fruchter. Diffusion models are real-time game engines. In International Conference on Learning Representations (ICLR), 2025.

[5] Decart and Etched. Oasis: A universe in a transformer. https://oasis-model.github. io/, 2024.

†表示各团队的技术负责人。

ABot-World-0 第 27 页,共 33 页

第 28 页

AMAP CV 实验室 | 阿里巴巴集团 技术报告

[6] NVIDIA, Niket Agarwal, 等人。Cosmos 物理人工智能世界基础模型平台。arXiv 预印本 arXiv:2501.03575, 2025。

[7] Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, Kalyan Sunkavalli, Feng Liu, Zhengqi Li, 和 Hao Tan。RELIC:具有长时程记忆的交互式视频世界模型。arXiv 预印本 arXiv:2512.04040, 2025。

[8] Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, 和 David J Fleet。视频扩散模型。神经信息处理系统进展, 35:8633–8646, 2022。

[9] Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, 等人。Make-A-Video:无需文本-视频数据的文本到视频生成。arXiv 预印本 arXiv:2209.14792, 2022。

[10] Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, 和 Jie Tang。CogVideo:通过 Transformer 进行大规模文本到视频生成的预训练。arXiv 预印本 arXiv:2205.15868, 2022。

[11] Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, 和 Karsten Kreis。对齐你的潜在变量:使用潜在扩散模型进行高分辨率视频合成。 在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 22563–22575, 2023。

[12] Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, 和 Dumitru Erhan。Phenaki:从开放域文本描述生成可变长度的视频。在 国际学习表征会议 (ICLR), 2023。

[13] Dan Kondratyuk, Lijun Yu, Xiuye Gu, José Lezama, Jonathan Huang, Grant Schindler, Rachel Hor- nung, Vighnesh Birodkar, Jimmy Yan, Ming-Chang Chiu, 等人。VideoPoet:用于零样本视频生成的语言模型。在 国际机器学习会议 (ICML), 2024。

[14] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等人。HunyuanVideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603, 2024。

[15] Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang, 等人。Movie Gen:一系列媒体基础模型。arXiv 预印本 arXiv:2410.13720, 2024。

[16] Team Wan。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025。

[17] Jack Parker-Holder, Philip Ball, Jake Bruce, Vibhavari Dasagi, Kristian Holsheimer, Christos Ka- planis, Alexandre Moufarek, Guy Scully, Jeremy Shar, Jimmy Shi, 等人。Genie 2:大规模基础世界模型。Google DeepMind 博客, 2024。

[18] Anssi Kanervisto, Dave Bignell, Linda Yilin Wen, Martin Grayson, Raluca Georgescu, Sergio Val- carcel Macua, Shan Zheng Tan, Tabish Rashid, Tim Pearce, Yuhan Cao, Abdelhak Lemkhenter, Chentian Jiang, Gavin Costello, Gunshi Gupta, Marko Tot, Shu Ishida, Tarun Gupta, Udit Arora, Ryen W. White, Sam Devlin, Cecily Morrison, 和 Katja Hofmann。面向游戏构思的世界和人类动作模型。Nature, 638(8051):656–663, 2025。

[19] Runway。介绍 GWM-1。Runway Research, 2025。

ABot-World-0 第 28 页,共 33 页

第 29 页

AMAP CV Lab | 阿里巴巴集团 技术报告

[20] Chiyu Max Jiang, Xander Masotto, 和 Bo Sun。Waymo 世界模型:自动驾驶模拟的新前沿。Waymo 博客,2026 年。

[21] Haoyu Lu, Guoxing Yang, Nanyi Fei, Yuqi Huo, Zhiwu Lu, Ping Luo, 和 Mingyu Ding。VDT:通过掩码建模实现通用视频扩散变换器。在国际学习表征会议 (ICLR),2024 年。

[22] Xin Ma, Yaohui Wang, Gengyun Jia, Xinyuan Chen, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, 和 Yu Qiao。Latte:用于视频生成的潜在扩散变换器。arXiv 预印本 arXiv:2401.03048,2024 年。

[23] Guoqing Ma, Haoyang Huang, Kun Yan, Liangyu Chen, Nan Duan, Shengming Yin, Changyi Wan, Ranchen Ming, Xiaoniu Song, Xing Chen 等。Step-Video-T2V 技术报告:视频基础模型实践、挑战与未来。arXiv 预印本 arXiv:2502.10248,2025 年。

[24] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng 等。CogVideoX:具有专家变换器的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072,2024 年。

[25] Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang, Chao Weng, 和 Ying Shan。VideoCrafter2:克服数据限制以实现高质量视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,2024 年。

[26] Chenfei Wu, Lun Huang, Qianxi Zhang, Binyang Li, Lei Ji, Fan Yang, Guillermo Sapiro, 和 Nan Duan。GODIVA:从自然描述生成开放域视频。arXiv 预印本 arXiv:2104.14806,2021 年。

[27] Songwei Ge, Thomas Hayes, Harry Yang, Xi Yin, Guan Pang, David Jacobs, Jia-Bin Huang, 和 Devi Parikh。使用时间无关 VQGAN 和时间敏感变换器生成长视频。在欧洲计算机视觉会议 (ECCV),第 102–118 页。Springer,2022 年。

[28] Wilson Yan, Yunzhi Zhang, Pieter Abbeel, 和 Aravind Srinivas。VideoGPT:使用 VQ-VAE 和变换器进行视频生成。arXiv 预印本 arXiv:2104.10157,2021 年。

[29] Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vincent Sitzmann。扩散强制 (Diffusion Forcing):下一个 token 预测与全序列扩散的结合。在神经信息处理系统进展 (NeurIPS),2024 年。

[30] Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, 和 Zhouchen Lin。金字塔流匹配用于高效视频生成建模。arXiv 预印本 arXiv:2410.05954,2024 年。

[31] Tianwei Yin, Qiang Zhang, Richard Zhang, William T. Freeman, Frédo Durand, Eli Shechtman, 和 Xun Huang。从缓慢的双向到快速的自回归视频扩散模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,第 22963–22974 页,2025 年。

[32] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman。自强制 (Self Forcing):弥合自回归视频扩散中的训练-测试差距。arXiv 预印本 arXiv:2506.08009,2025 年。

[33] Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, 和 Shijian Lu。滚动强制 (Rolling Forcing):实时自回归长视频扩散。arXiv 预印本 arXiv:2509.25161,2025 年。

[34] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。用于生成建模的流匹配 (Flow matching)。arXiv 预印本 arXiv:2210.02747,2022 年。

[35] Xingchao Liu, Chengyue Gong, 和 Qiang Liu。流直线且快速:学习使用整流流 (Rectified Flow) 生成和传输数据。arXiv 预印本 arXiv:2209.03003,2022 年。

ABot-World-0 第 29 页,共 33 页

第 30 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

[36] Desai Xie, Zhan Xu, Yicong Hong, Hao Tan, Difan Liu, Feng Liu, Arie Kaufman, 和 Yang Zhou. 渐进式自回归视频扩散模型, 2025.

[37] Guibin Chen, Dixuan Li, Sen Yang, Bin Zhu, Bohan Tan, Mingyu Wang, 等. SkyReels-V2: 无限长度电影生成模型. arXiv 预印本 arXiv:2504.13074, 2025.

[38] Mingzhen Sun, Weining Wang, Gen Li, Jiawei Liu, Jiahui Sun, Wanquan Feng, Shanshan Lao, SiYu Zhou, Qian He, 和 Jing Liu. AR-Diffusion: 基于自回归扩散的异步视频生成, 2025.

[39] Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, 和 Yue Zhao. StreamDiT: 实时流式文本到视频生成, 2026.

[40] Jihwan Kim, Junoh Kang, Jinyoung Choi, 和 Bohyung Han. FIFO-Diffusion: 无需训练即可从文本生成无限 视频. 在神经信息处理系统进展 (NeurIPS), 2024.

[41] Shuai Yang, Wei Huang, Ruihang Chu, Yicheng Xiao, Yuyang Zhao, Xianbang Wang, Muyang Li, Enze Xie, Yingcong Chen, Yao Lu, 等. LongLive: 实时交互式长视频生成. arXiv 预印本 arXiv:2509.22622, 2025.

[42] Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh. Self-Forcing++: 迈向分钟级高质量视频生成, 2025.

[43] Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu. Causal Forcing: 正确执行自 回归扩散蒸馏以实现高质量实时交互式视频生成. 在国际机器学习会议 (ICML), 2026. arXiv:2602.02214.

[44] Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, 和 Wenhu Chen. Context Forcing: 具有长上下文的自回归视频生成一致性, 2026.

[45] Kai Zou, Dian Zheng, Hongbo Liu, Tiankai Hang, Bin Liu, 和 Nenghai Yu. HiAR: 通过分层去噪实现高效 自回归长视频生成, 2026.

[46] Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, 和 Weiyang Liu. 通过对角线蒸馏实现流式自回归视频生成. 在 ICLR, 2026.

[47] Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh. LoL: 比长更长,将视频生成扩展至小时级. arXiv 预印本 arXiv:2601.16914, 2026.

[48] Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, 和 Seungryong Kim. Deep Forcing: 通过深度汇聚和参与式压缩实现无需训练的长视频生成. arXiv 预印本 arXiv:2512.05081, 2025.

[49] Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, 和 Ioannis Patras. Relax Forc- ing: 松弛 KV 内存以实现一致的长视频生成. arXiv 预印本 arXiv:2603.21366, 2026.

[50] Youngrae Kim, Qixin Hu, C-C Jay Kuo, 和 Peter A Beerel. MemRoPE: 通过演化记忆令牌实现无需训练的无限视频 生成. arXiv 预印本 arXiv:2603.12513, 2026.

[51] Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, 等. LongLive-2.0: 用于长视频生成的 NVFP4 并行基础设施. arXiv 预印本 arXiv:2605.18739, 2026.

ABot-World-0 第 30 页,共 33 页

第 31 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

[52] Jia Li, Xiaomeng Fu, Xurui Peng, Weifeng Chen, Youwei Zheng, Tianyu Zhao, Jiexi Wang, Fangmin Chen, Xing Wang, and Hayden Kwok-Hay So. Train short, inference long: Training-free horizon extension for autoregressive video generation. arXiv 预印本 arXiv:2602.14027, 2026.

[53] Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, and Kaipeng Zhang. PackForcing: Short video training suffices for long video sampling and long context infer- ence. arXiv 预印本 arXiv:2603.25730, 2026.

[54] Ruili Feng, Han Zhang, Zhilei Shu, Zhantao Yang, Longxiang Tang, Zhicai Wang, Andy Zheng, Jie Xiao, Zhiheng Liu, Ruihang Chu, et al. The Matrix: Infinite-horizon world generation with real-time moving control. 神经信息处理系统进展, 38:87318–87344, 2026.

[55] Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren, et al. Matrix-game 2.0: An open-source real-time and streaming interactive world model. arXiv 预印本 arXiv:2508.13009, 2025.

[56] Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ping Luo, and Ying Shan. MotionCtrl: A unified and flexible motion controller for video generation. In ACM SIGGRAPH 2024 Conference Papers, pages 1–11, 2024.

[57] Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, et al. ReCamMaster: Camera-controlled generative rendering from a single video. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 14834–14844, 2025.

[58] Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y Wang, Joan Lasenby, and Chun-Hao Huang. SpaceTimePilot: Generative rendering of dynamic scenes across space and time. arXiv 预印本 arXiv:2512.25075, 2025.

[59] Basile Van Hoorick, Rundi Wu, Ege Ozguroglu, Kyle Sargent, Ruoshi Liu, Pavel Tokmakov, Achal Dave, Changxi Zheng, and Carl Vondrick. Generative camera dolly: Extreme monocular dynamic novel view synthesis. In European Conference on Computer Vision, pages 313–331. Springer, 2024.

[60] Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, and Ceyuan Yang. CameraCtrl: Enabling camera control for text-to-video generation. arXiv 预印本 arXiv:2404.02101, 2024.

[61] Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, and Yingcong Chen. DualCamCtrl: Dual-branch diffusion model for geometry-aware camera-controlled video generation. arXiv 预印本 arXiv:2511.23127, 2025.

[62] Jensen Zhou, Hang Gao, Vikram Voleti, Aaryaman Vasishta, Chun-Han Yao, Mark Boss, Philip Torr, Christian Rupprecht, and Varun Jampani. Stable Virtual Camera: Generative view synthesis with diffusion models. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 12405–12414, 2025.

[63] Ruilong Li, Brent Yi, Junchen Liu, Hang Gao, Yi Ma, and Angjoo Kanazawa. Cameras as relative positional encoding. 神经信息处理系统进展, 38:15984–16009, 2026.

[64] Chunyang Li, Yuanbo Yang, Jiahao Shao, Hongyu Zhou, Katja Schwarz, and Yiyi Liao. ReRoPE: Repurposing RoPE for relative camera control. arXiv 预印本 arXiv:2602.08068, 2026.

[65] Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajiˇc, Siyu Tang, and Gordon Wetzstein. BulletTime: Decoupled control of time and camera pose for video generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18319–18330, 2026.

ABot-World-0 第 31 页,共 33 页

第 32 页

AMAP CV 实验室 | 阿里巴巴集团 技术报告

[66] Shanchuan Lin, Ceyuan Yang, Hao He, Jianwen Jiang, Yuxi Ren, Xin Xia, Yang Zhao, Xuefeng Xiao, and Lu Jiang. 用于实时交互式视频生成的自回归对抗后训练。神经信息处理系统进展,38:41061–41086, 2026.

[67] Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, 等。LTX-Video:实时视频潜在扩散。arXiv 预印本 arXiv:2501.00103, 2024.

[68] Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Frédo Durand, William T. Freeman, and Taesung Park. 具有分布匹配蒸馏的一步扩散。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,2024.

[69] Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, and William T Freeman. 改进的分布匹配蒸馏以实现快速图像合成。神经信息处理系统进展,37:47455–47487, 2024.

[70] Yang Song, Prafulla Dhariwal, Mark Chen, and Ilya Sutskever. 一致性模型。在国际机器学习会议论文集,页码 32211–32252。PMLR, 2023.

[71] Hansi Teng, Hongyu Jia, Lei Sun, Lingzhi Li, Maolin Li, Mingqiu Tang, Shuai Han, Tianning Zhang, WQ Zhang, Weifeng Luo, 等。MAGI-1:大规模自回归视频生成。arXiv 预印本 arXiv:2505.13211, 2025.

[72] Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, and Xun Huang。MotionStream:具有交互式运动控制的实时视频生成。arXiv 预印本 arXiv:2511.01266, 2025.

[73] Haocheng Xi, Shuo Yang, Yilong Zhao, Muyang Li, Han Cai, Xingyang Li, Yujun Lin, Zhuoyang Zhang, Jintao Zhang, Xiuyu Li, 等。Quant VideoGen:通过 2 位 KV 缓存量化实现自回归长视频生成。arXiv 预印本 arXiv:2602.02958, 2026.

[74] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, and Yuxiong He。DeepSpeed Ulysses:启用极端长序列 Transformer 模型训练的系统优化。arXiv 预印本 arXiv:2309.14509, 2023.

[75] Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, and Gennady Pekhimenko。Swift- Fusion:在 GPU 上分布式推理扩散变换器的可扩展序列并行方法。在 ACM 人工智能与智能系统会议论文集,CAIS ’26,页码 1037–1050, 纽约,纽约州,美国,2026。计算机协会。

[76] AMAP, 阿里巴巴。云镜 AMAP:AI 驱动的 3D 重建和数字孪生平台。https: //yunjing.amap.com/, 2023。访问日期:2026-07。

[77] Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, 等。ABot-3DWorld 0:探索任何 3D 空间的通用世界模型。arXiv 预印本 arXiv:2607.11673, 2026.

[78] Junyi Chen, Haoyi Zhu, Xianglong He, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Zhoujie Fu, Jiangmiao Pang, and Tong He。DeepVerse:作为世界模型的 4D 自回归视频生成。arXiv 预印本 arXiv:2506.01103, 2025.

[79] Ollin Boer Bohan。TAEHV:用于混元视频的微小型自编码器。GitHub 仓库,2025.

[80] Lvmin Zhang。FramePack:具有帧上下文打包的实用视频扩散。GitHub 仓库, 2025.

[81] LightX2V Contributors。LightX2V:轻量视频生成推理框架。https:// github.com/ModelTC/lightx2v, 2025.

ABot-World-0 第 32 页,共 33 页

第 33 页

AMAP 计算机视觉实验室 | 阿里巴巴集团 技术报告

[82] Jintao Zhang, Haofeng Huang, Pengle Zhang, Jia Wei, Jun Zhu, 和 Jianfei Chen。SageAttention2: 具有彻底异常值平滑和每线程 INT4 量化的高效注意力机制。arXiv 预印本 arXiv:2411.10958, 2024。

[83] Amir Zandieh, Majid Daliri, Majid Hadian, 和 Vahab Mirrokni。TurboQuant: 具有接近最优失真率的在线向量量化。arXiv 预印本 arXiv:2504.19874, 2025。

[84] Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, 和 Baoquan Chen。 WorldRoamBench: 用于交互式世界模型长时程稳定性的开放世界基准, 2026。

[85] 阿里云。阿里云推出 HappyOyster,一款用于实时沉浸式创作与交互的世界模型产品。阿里云博客, 2026。

[86] Robbyant 团队, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, 等。推进开源世界模型。arXiv 预印本 arXiv:2601.20540, 2026。

[87] 腾讯混元。HY-World 1.5: 具有实时延迟和几何一致性的交互式世界建模系统框架。技术报告, 腾讯混元, 2025。

[88] Yuhang Ma, Xiaoshi Wu, Keqiang Sun, 和 Hongsheng Li。HPSv3: 迈向宽谱人类偏好评分。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 15086–15095 页, 2025。

ABot-World-0 第 33 页,共 33 页

发表评论