会生成视频,不等于理解物理:LingBot-Video的MoE路线

三分钟导读:为解决数据分布偏差,我们构建了Data Profiling Engine。该引擎从结构、语义、运动、相机及质量五个互补维度对样本进行结构化标注。这些画像记录直接驱动下游的过滤、平衡采样及Caption重写,确保训练数据的多样性与高质量。

英文题目:Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

论文出处:arXiv 每日论文精选 · arXiv:2607.07675

原始论文:PDF / 论文页面

对应视频标题:会生成视频,不等于理解物理:LingBot-Video的MoE路线|推荐指数:★★★★★★

这篇论文解决什么问题?

当前视频模型多用于机器人隐式模拟,但密集架构推理成本高昂,且互联网数据缺乏显式物理交互先验。这导致生成视频虽具高视觉保真度,却常违背物理规律,难以满足具身智能对物理一致性与可控性的严苛要求。

核心创新

方法概览

为解决数据分布偏差,我们构建了Data Profiling Engine。该引擎从结构、语义、运动、相机及质量五个互补维度对样本进行结构化标注。这些画像记录直接驱动下游的过滤、平衡采样及Caption重写,确保训练数据的多样性与高质量。

逐图理解论文

核心架构

核心架构
Figure 2. Overview of the task-unified single-stream diffusion transformer. Unified inputs are processed by stacked transformer blocks, where timestep modulation controls the attention and Sparse MoE branches; the attention branch applies QK-Norm and multi-modal 3D RoPE, while the MoE branch combines always-on shared experts with top-Kr routed experts before predicting velocity.

LingBot-Video采用任务统一的单流Diffusion Transformer (DiT) 架构。其核心在于引入稀疏Mixture-of-Experts (MoE) 分支,结合始终在线的共享专家与Top-K路由专家。这种设计在时间步调制下,实现了容量与计算的高效解耦。

数据画像引擎

数据画像引擎
Figure 9. Overview of the Data Profiling Engine. Each image or video sample is annotated across five complementary dimensions (structural, semantic, motion, camera, and quality) into a structured profile record, which then drives downstream filtering, balanced sampling, and captioning.

为解决数据分布偏差,我们构建了Data Profiling Engine。该引擎从结构、语义、运动、相机及质量五个互补维度对样本进行结构化标注。这些画像记录直接驱动下游的过滤、平衡采样及Caption重写,确保训练数据的多样性与高质量。

知识拓扑与课程学习

知识拓扑与课程学习
Figure 10. World-Knowledge Topological Graph. Structured tags from the Data Profiling Engine link each sample to a semantic tree of visual concepts and, for videos with actions, to an action tree of dynamic behaviors. The graph serves as a control surface for data curation: node statistics and training-feedback signals are used to up-weight rare or difficult concepts, down-weight saturated easy modes, and identify under-covered domains for targeted data expansion.

基于画像数据,我们构建了World-Knowledge Topological Graph,将概念组织为语义树与动作树。结合五阶段渐进式预训练课程,系统能动态上采样长尾困难概念,下采样饱和模式,从而实现对物理世界知识的全面覆盖与高效学习。

MoE扩展优势

MoE扩展优势
Figure 5. Comparable active-parameter scaling comparison between Dense 1.3B and MoE 13B-A1.4B using training and validation loss. Training curves show raw logged losses in the background and smoothed curves for visualization; validation curves are unsmoothed and aligned to the training-loss step range.

实验表明,MoE架构在扩展性上显著优于密集模型。MoE 13B-A1.4B在训练与验证损失上均优于Dense 1.3B。更重要的是,MoE 30B-A3B在长序列长度下,性能接近Dense 14B,同时保持了更低的激活参数开销,验证了稀疏路由的有效性。

推理效率提升

推理效率提升
Figure 7. MoE-to-dense speed ratio, computed as dense latency divided by MoE 30B-A3B latency.

在推理效率方面,MoE优势更为明显。在1M Token序列长度下,MoE 30B-A3B相比Dense 30B实现了3.18倍的加速。这种速度提升源于稀疏激活机制,使得模型在处理长视频序列时,能够以极低的计算成本维持高吞吐量。

实验与关键结果

  • 在推理效率方面,MoE优势更为明显。在1M Token序列长度下,MoE 30B-A3B相比Dense 30B实现了3.18倍的加速。这种速度提升源于稀疏激活机制,使得模型在处理长视频序列时,能够以极低的计算成本维持高吞吐量。
  • 在推理效率方面,MoE优势更为明显。在1M Token序列长度下,MoE 30B-A3B相比Dense 30B实现了3.18倍的加速。这种速度提升源于稀疏激活机制,使得模型在处理长视频序列时,能够以极低的计算成本维持高吞吐量。

阅读时需要注意

  • 尽管表现优异,仍需注意几点局限:扩展定律仅在120B参数及早期训练轨迹中验证;Refiner依赖少量高质量数据,可能限制对低质量输入的泛化;且MoE路由开销在短序列中可能影响延迟。未来工作将聚焦于全收敛验证及物理指标的量化评估。
  • MoE routing overhead may impact latency for short sequences compared to dense models.
  • Physical plausibility improvements are qualitative in many cases; quantitative metrics for physical laws are limited.
  • Caption Rewriter may hallucinate attributes if not strictly bounded, affecting prompt adherence.

关联工作

  • 当前视频模型多用于机器人隐式模拟,但密集架构推理成本高昂,且互联网数据缺乏显式物理交互先验。这导致生成视频虽具高视觉保真度,却常违背物理规律,难以满足具身智能对物理一致性与可控性的严苛要求。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

扩展混合专家模型视频预训练 用于具身智能

Shuailei Ma∗, Jiaqi Liao∗, Xinyang Wang∗, Jingjing Wang∗, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng†

∗同等贡献 †项目负责人

尽管在机器人控制方面展现出前景,但视频生成模型由于其主要关注内容创作,存在领域不匹配的问题。例如,其设计本质上优先考虑视觉保真度和创造性,而非计算效率和物理真实性。在本工作中,我们提出了 LingBot-Video,这是一种基于 Diffusion Transformer (DiT) 的视频预训练范式,专门针对具身智能量身定制。从架构角度来看,我们采用 Mixture-of-Experts (MoE) 而非密集框架,以实现建模能力与推理效率之间更好的权衡,并成功从零开始对其进行扩展。从数据角度来看,我们构建了一个数据画像引擎,通过大量面向机器人的视频片段增强标准互联网视频,涵盖操作理解、动作和导航、世界动力学以及第一人称视角。从训练角度来看,我们开发了一种多维奖励系统,以在物理合理性和任务完成方面强制执行对齐,超越了美学、提示遵循和运动一致性等标准标准。综合评估验证了其作为视频基础模型的性能和效率。我们将 LingBot-Video 作为首个大规模开源 MoE 视频基础模型贡献给社区,这是弥合数字创造力与物理执行之间差距的开创性努力。[cs.CV] 网站:https://technology.robbyant.com/lingbot-video Github:https://github.com/robbyant/lingbot-video 检查点:https://huggingface.co/robbyant/lingbot-video

1 引言

除了在内容创作方面的成功之外,基于扩散的 [7, 9, 36, 37, 81, 89, 105] 和自回归 [32, 101, 119] 视频模型在根据文本、图像和其他控制信号合成时间连贯且照片级真实的序列方面展示了非凡的能力 [10, 23, 31, 92, 96]。这种能力激发了大量工作,这些工作将视频模型解释为物理世界的隐式模拟器,使其能够用于机器人 [2, 52, 55]、自动驾驶 [77, 78] 和交互式环境 [10]。在这种范式中,视频模型不仅作为生成系统,还作为支持规划、策略学习和基于想象的控制的预测世界模型 [4]。然而,将这些模型从被动视频生成转化为主动具身推理和智能仍然是一个开放挑战。

尽管前景广阔,但视频生成模型与具身智能需求之间仍然存在根本性的差距。大多数视频基础模型针对感知质量(如真实性、美学和文本对齐)进行优化,而非物理正确性或可控性。虽然这些目标产生了视觉上引人注目的结果,但它们并未明确强制执行与物理交互约束的一致性,例如接触稳定性、刚体动力学或在干预下的长视界状态一致性。这凸显了一个关键张力:虽然互联网规模的视频提供了丰富的视觉多样性,但它并不能保证符合具身交互的约束。

1

第 2 页

图 1. LingBot-Video 生成的文本到图像和文本到视频任务样本。LingBot-Video 能够在多样化的场景和主体中生成具有高视觉保真度、丰富细节以及强文本提示对齐能力的图像和视频。

现有弥合视频生成与具身智能之间差距的努力通常在三个紧密耦合的维度上存在不足:架构、数据和训练目标。在架构方面,大多数基于扩散的视频变换器依赖于密集计算,其中所有参数在 token 和时间步上均匀激活,导致推理成本高昂且可扩展性有限。尽管最近的稀疏混合专家模型 (MoE) formulations [50, 57] 在大型语言模型 (LLM) [1, 5, 8, 94, 99, 121] 中展示了令人鼓舞的效率提升,但其在视频生成中的应用仍然有限。在数据方面,训练语料库主要由缺乏机器人具身先验或精确交互动态的互联网视频组成,导致在物理模拟中的接地能力较弱。从训练角度来看,当前的对齐策略主要优化美学质量和文本-视频对应关系,而未纳入明确的物理可行性、任务完成度或长视域奖励信号。因此,现有系统难以同时实现可扩展性、物理一致性和具身接地。

在本工作中,我们提出了 LingBot-Video,这是一种基于 DiT 的视频预训练范式,专为具身智能设计。我们的方法通过三个集成组件解决了上述局限性。首先,我们引入了一个混合专家模型 (MoE) 视频框架,它实现了稀疏条件计算,提高了推理效率,同时扩展了模型处理复杂时空动态的能力。其次,我们构建了一个机器人增强的预训练语料库,将互联网规模的视频与机器人操作、导航和第一人称数据集统一起来,从而向模型注入明确的具身和交互先验。第三,我们开发了一个多维奖励系统,该系统超越了美学目标,纳入了物理合理性和任务导向的成功信号,鼓励模型学习与具身环境一致的动态和交互。这些组件共同使得一个更具物理接地性和计算效率的视频基础模型成为可能。

2

第 3 页

总体而言,我们提出了 LingBot-Video,据我们所知,这是首个面向具身智能的大规模开源混合专家视频基础模型,旨在弥合数字视频生成与物理执行之间的差距。我们的贡献主要体现在三个方面:

  • 我们引入了一种稀疏混合专家(MoE)视频扩散框架,并配合可扩展的训练范式,实现了时空建模中可扩展性与效率之间的权衡。
  • 我们开发了一个专用的数据画像引擎,系统地分析、过滤和重新平衡异构视频源。这使得大规模互联网视频与具身数据集的有效整合成为可能,从而增强了对物理交互、动作语义以及具身特定动态的建模能力。
  • 我们提出了一种多维奖励系统,该系统结合了物理合理性和任务级成功信号,超越了传统的感知和文本对齐目标。

2 方法

2.1 任务统一的单流扩散变换器

我们的架构采用级联设计,由一个任务统一的基础生成器和一个细化器组成。基础生成器采用单流扩散变换器来处理紧凑的视觉潜在变量和多模态条件。我们使用 Qwen3-VL-4B [6] 从多模态指令中提取条件。Wan2.1-VAE [105] 用于高效的视觉潜在变量压缩。本节结构如下:首先,我们介绍统一输入公式和单流扩散变换器;然后,我们详细阐述通过稀疏混合专家实现的扩展策略;最后,我们介绍级联细化器。

统一输入公式。我们将每个训练样本表示为一个单一的 token 序列,由视觉潜在变量 patch 和条件 token 组成。具体而言,在将视觉 patch 和条件特征投影到相同的隐藏维度后,我们沿序列维度将它们连接起来形成统一输入。在这种公式下,我们在单一框架内处理文本到图像(T2I)、文本到视频(T2V)和图像到视频(TI2V)任务,并将图像目标表示为特殊的单帧(T = 1)视频生成情况。为了解决条件和视觉 token 之间的结构差异,我们采用 3D MM-RoPE [11, 71, 113] 机制将它们放置在非重叠的时间坐标范围内,从而无需任务特定的架构或编码器。

单流扩散变换器。效率和可扩展性指导着 LingBot-Video 的设计。受 LLM 仅解码器架构 [1, 5, 94, 99] 的可扩展性和单流设计的参数效率启发,我们采用了一种精简的单流扩散变换器主干。经过轻量级的模态特定输入投影后,所有视觉和条件 token 共享相同的变换器块。这种单流架构最大限度地提高了参数复用率,并促进了每一层中密集的多模态交互。与通过独立路径处理模态的双流架构 [24] 相比,我们的统一主干将所有 token 作为单一序列处理。这种设计将多模态特征分组为更大的统一 GEMM 计算,旨在提高模型 FLOPs 利用率(MFU)[17] 并减少内核启动开销。此外,虽然双流模型在每个块内的注意力之前和之后需要频繁地连接和分割条件和潜在 token,但我们的模型连续处理统一序列。这减少了受内存带宽限制的张量重组和布局转换开销 [19],这在序列并行分布式布局 [43, 48] 下尤其有益。因此,在分布式扩展场景中,这种设计简化了通信模式,并有助于避免双流分区带来的额外负载不均衡和同步开销。

多模态 3D RoPE。为了在单流中分离条件和视觉 token 同时保持视频几何结构,我们将所有 token 映射到多模态 3D RoPE [11, 71, 113] 坐标系。具体而言,给定 L 个条件 token 和 F × H × W 的视觉潜在变量网格,条件 token 使用时间坐标 (i, 0, 0),其中 i = 1, . . . , L,而视觉 patch token 使用 (L + 1 + f, h, w)。查询和键头维度沿时间、垂直和水平轴拆分,并独立应用相应的旋转频率。这在保持空间局部性和时间顺序的同时,使注意力保持完全的单流特性。

QK-Norm。为了稳定深层变换器主干中的注意力,我们遵循先前大规模视觉和扩散变换器的实践 [21, 24],在计算注意力之前使用每头 RMSNorm 对查询和键进行归一化。这种稳定机制有助于控制高分辨率训练期间的注意力 logits 增长和特征尺度,

第 4 页

预测速度 稀疏混合专家 块数 × N 路由专家 共享专家

多头注意力

统一输入 时间嵌入

图 2. 任务统一的单流扩散变换器概览。统一输入由堆叠的变换器块处理,其中时间步调制控制注意力和稀疏 MoE 分支;注意力分支应用 QK-Norm 和多模态 3D RoPE,而 MoE 分支在预测速度之前结合始终开启的共享专家与 top-Kr 路由专家。

特别是在混合精度下。此外,每个块在注意力和前馈残差分支周围使用 RMSNorm,以保持激活值有界,同时不引入特定模态的路径。

AdaLN-单调制。为了减少调制开销,我们采用 adaLN-single 设计 [13, 105, 106],即在变换器堆栈之前计算一次共享的时间步调制。每个块向该共享信号添加一个层特定的可训练调制表,并使用由此产生的移位、缩放和门控参数来调制其注意力和前馈分支。共享投影遵循 DiT 风格的自适应归一化 [70] 进行零初始化,而每层调制表以小的随机值初始化,从而在不使用每块时间步 MLP 的情况下提供稳定的残差学习。

2.2 基于稀疏混合专家的扩展

混合专家 (MoE) 范式的根本动机在于对高度多样和复杂数据分布进行建模的需求,利用专门的子网络(专家)来捕捉不同的模式或领域 [42, 45]。视频生成旨在模拟连续的物理世界,要求模型捕捉复杂物理过程(如流体运动和三维空间一致性)的视觉表示,以及变化的运动轨迹和丰富的材质纹理 [9, 37, 105]。因此,MoE 是扩展视频扩散模型以捕捉物理定律的巨大复杂性的自然选择 [69, 82]。在传统的稠密模型中,前馈网络 (FFN) 强制所有 token 共享相同的参数路径。在统一的视频预训练中,这会导致严重的子任务干扰 [42, 45, 67],因为一组参数必须同时建模非对称领域(如空间纹理与时间运动),并适应跨越 T2I、T2V 和 TI2V 条件的多样化任务格式。特别是对于扩散模型,训练动态本质上表现出偏移

4

第 5 页

在不同噪声机制之间,要求模型解决低噪声细节重建与高噪声全局布局构建之间的差异。

稀疏混合专家模型(Sparse Mixture-of-Experts, MoE)已在大型语言模型中被有力证明为在恒定计算预算下扩展参数容量的强大范式 [18, 25, 50, 57, 86]。受此成功驱动,我们将稀疏 MoE 框架整合到基础生成器中,以实现容量与计算的解耦。这使得我们能够扩展总参数容量——为多样化的物理先验创建一个庞大的存储库——同时严格控制每个令牌的激活 FLOPs。这种解耦对于高分辨率视频生成尤为关键,因为高分辨率视频生成很容易扩展到百万令牌(1M+)的时空序列,而密集扩展会带来 prohibitive 的计算开销。基于扩散的视频生成器在去噪步骤中反复处理完整的视觉潜在序列 [37, 70],使得每个令牌的 Transformer 计算成为长视频的主要扩展压力。稀疏路由减少了每个去噪步骤中的激活前馈计算,同时保留了总参数容量,使得长视频容量扩展更加可行。

稀疏 MoE 架构。在每个 Transformer 块中,我们保留单流 FFN 残差分支结构,并仅将其密集前馈计算替换为令牌选择的稀疏 MoE 层 [25, 50, 86],如图 2 所示。我们的 MoE 设计融入了 DeepSeekMoE [18, 57] 的关键架构原则,特别是细粒度专家分割和共享专家隔离,以鼓励专家专业化,同时保持共享的通用先验。给定令牌 $t$ 的调制 FFN 输入 $u_t$,稀疏 MoE 层计算来自共享专家和路由专家的分支输出: $$ m(u_t) = \sum_{i=1}^{N_s} E^{(s)}_i (u_t) + \sum_{j \in R_b(u_t)} g_{t,j} E^{(r)}_j (u_t), \quad (1) $$ 其中 $R_b(u_t)$ 是选定的路由专家集,$E^{(s)}_i (\cdot)$ 和 $E^{(r)}_j (\cdot)$ 分别表示第 $i$ 个共享专家函数和第 $j$ 个路由专家函数。每个专家都实现为 SwiGLU MLP [84]。我们将共享专家的数量记为 $N_s$,路由专家的总数记为 $N_r$。门控 $g_{t,j}$ 由以下路由方程定义。生成的 MoE 分支输出 $m(u_t)$ 通过单流块的门控残差分支注入回 Transformer 块。为了最大化专家专业化并减少知识混合 [18],我们采用细粒度专家分割策略,将共享专家和路由专家的中间维度设置为小于标准密集 FFN 对应物的宽度。在这种设计下,共享专家提供一条通用路径,以捕获所有令牌之间的通用物理原理和空间一致性,而路由专家捕获专门特征。

对于令牌 $t$,我们使用 Sigmoid 路由器 [57] 计算路由专家亲和力: $$ \alpha_{t,j} = \text{Sigmoid}(u_t^\top r_j), \quad (2) $$ 这里,$\alpha_{t,j}$ 是令牌 $t$ 与路由专家 $j$ 之间的路由器亲和力,$r_j \in \mathbb{R}^d$ 是第 $j$ 个路由专家的可学习路由器嵌入。为了控制分布式训练中的通信成本,我们采用 DeepSeek 风格的组限制路由策略 [57]。我们将 $N_r$ 个路由专家划分为 $N_g$ 个组。在添加在线校正偏差后,$\tilde{\alpha}_{t,j} = \alpha_{t,j} + b_j$,我们选择前 $K_g$ 个组,其中每个组由其前 2 个偏差校正亲和力分数的总和进行评分。令 $G_b(u_t)$ 表示属于这些选定组的专家集。在 $G_b(u_t)$ 内,我们选择前 $K_r$ 个专家作为 $R_b(u_t)$。整体 MoE 架构如图 2 所示。

用于负载均衡的在线偏差校正。为了在保持表示容量的同时维持负载均衡,我们使用无辅助损失的负载均衡策略 [57, 108]。我们为每个专家引入一个动态校正偏差 $b_j$,该偏差在训练期间进行调整,并且仅用于选择顶级专家: $$ g'_{t,j} = \begin{cases} \alpha_{t,j}, & \text{if } \tilde{\alpha}_{t,j} \in \text{Top}_{K_r}(\{\tilde{\alpha}_{t,k} \mid k \in G_b(u_t)\}), \\ 0, & \text{otherwise}. \end{cases} \quad (3) $$ 这里,$g'_{t,j}$ 是稀疏未归一化门控:它保留选定专家的原有关联度 $\alpha_{t,j}$,并将所有未选定的专家设置为零。最终的门控值通过对选定的原有关联度分数进行归一化并应用路由缩放因子 $\gamma$ 获得: $$ g_{t,j} = \gamma \frac{g'_{t,j}}{\sum_{k=1}^{N_r} g'_{t,k}}. \quad (4) $$

5

第 6 页

此处,$g_{t,j}$ 是应用于 token $t$ 的第 $j$ 个专家的最终路由权重,$\gamma$ 是路由缩放因子,$k$ 是归一化项中路由专家的索引。在训练过程中,第 $j$ 个专家的校正偏差会利用其负载偏差的符号在每个优化器步骤中在线更新: $$ b_j \leftarrow b_j – \eta \text{sign}(n_j – \bar{n}), \quad (5) $$ 其中 $b_j$ 是第 $j$ 个专家的校正偏差,$n_j$ 是选择第 $j$ 个专家的有效 token 分配数量(跨所有 rank 全局累积),$\bar{n}$ 是每个专家的平均负载,$\eta$ 是偏差更新的 learning rate。当启用偏差中心化(bias centering)时,我们在每次更新后对偏差进行均值中心化: $$ b_j \leftarrow b_j – \frac{1}{N_r} \sum_{k=1}^{N_r} b_k. \quad (6) $$ 这种中心化保留了相对负载均衡信号,同时保持路由器输入依赖且稳定。

序列级辅助损失(Sequence-Wise Auxiliary Loss)。视频生成自然涉及长时空 token 序列,其中批次级别的专家平衡统计信息可能会掩盖单个视频内部的路由不平衡。因此,我们采用 DeepSeek-V3 [57] 中的序列级辅助平衡损失,该损失鼓励在每个打包的视频序列内部实现平衡的专家使用,而不仅仅是在全局批次级别。对于包含 $S$ 个序列的打包批次,序列级平衡损失定义为: $$ L_{\text{seq}} = \frac{1}{S} \sum_{s=1}^{S} \sum_{j=1}^{N_r} f_j^{(s)} P_j^{(s)}, \quad (7) $$ 此处,$S$ 是打包序列的数量,$s$ 索引一个序列,$j$ 索引一个路由专家。我们计算序列 $s$ 中专家 $j$ 的平均归一化路由概率为: $$ P_j^{(s)} = \frac{1}{T_s} \sum_{t=1}^{T_s} p_{t,j}, \quad p_{t,j} = \frac{\alpha_{t,j}}{\sum_{k=1}^{N_r} \alpha_{t,k}}. \quad (8) $$ 此处,$T_s$ 是第 $s$ 个打包统一序列的 token 长度,$p_{t,j}$ 是 token $t$ 选择专家 $j$ 的归一化路由概率,$P_j^{(s)}$ 是其在序列上的平均值。我们计算归一化分配频率为: $$ f_j^{(s)} = \frac{1}{K_r T_s} \sum_{t=1}^{T_s} c_j^{(s)}, \quad c_j^{(s)} = \sum_{t=1}^{T_s} \mathbb{1}[\alpha_{t,j} \in \text{Top}_{K_r}(\{\alpha_{t,k} \mid 1 \le k \le N_r\})]. \quad (9) $$ 此处,$c_j^{(s)}$ 是序列 $s$ 中属于从原始亲和力 $\alpha_{t,j}$ 计算出的无偏 Top-$K_r$ 集合的专家 $j$ 的 token 数量,该计算在在线偏差校正和组限制路由之前进行。指示函数 $\mathbb{1}[\cdot]$ 在此选择条件为真时返回 1,否则返回 0。归一化频率 $f_j^{(s)}$ 从计算图中分离(detached),以便梯度仅通过 $P_j^{(s)}$ 流动。辅助平衡损失应用于所有 Transformer 块并加到扩散损失中: $$ L_{\text{aux}} = \lambda_{\text{aux}} L_{\text{seq}}, \quad (10) $$ $$ L = L_{\text{diff}} + L_{\text{aux}}, \quad (11) $$ 其中 $\lambda_{\text{aux}}$ 是辅助损失权重,$L_{\text{aux}}$ 是加权序列级平衡损失,$L_{\text{diff}}$ 是扩散训练损失,$L$ 是最终训练目标。通过将每个 token 路由到 $K_r$ 个激活的路由专家,我们保持每个 token 的激活计算成本与标准稠密模型相当,而总参数容量随专家池大小 $N_r$ 扩展。这种解耦确保生成器能够扩展其表示能力以捕捉复杂的物理先验,而不会导致每个 token 的 FLOPs 线性增加。

2.3 稀疏混合专家配方探索

为了确定统一视频扩散预训练的最佳稀疏路由配置,我们系统地探索 MoE 设计空间。我们将探索结构化为两个主要维度:首先,在固定激活计算预算下专家池的扩展(总参数容量);其次,路由的粒度(细粒度

6

第 7 页

在固定的总参数量预算下,使用大量小型专家进行路由与使用少量大型专家进行粗粒度路由的对比)。所有配置均在统一的预训练数据混合集上进行评估。

专家规模与容量-计算解耦。我们首先评估通过扩展可用路由专家的数量 $E \in \{64, 128, 256\}$ 来增加总参数容量对模型的影响,同时严格保持每个 token 的激活参数量恒定为 1.4 B。如图 3 所示,增加专家数量在训练损失和验证损失上均带来了一致的提升,证明了容量-计算解耦的有效性。然而,与从 $E = 64$ 到 $E = 128$ 的显著改进相比,从 $E = 128$ 到 $E = 256$ 的性能提升微乎其微。考虑到性能、延迟和内存占用之间的权衡,我们选择 $E = 128$ 作为默认的专家规模,这在捕获大部分观察到的容量收益的同时,避免了更大专家池带来的额外通信和存储开销。

MoE 7B-A1.4B-E64 MoE 7B-A1.4B-E64 0.17 MoE 13B-A1.4B-E128 0.190 MoE 13B-A1.4B-E128 MoE 25B-A1.4B-E256 Loss 0.185 MoE 25B-A1.4B-E256 Loss 0.16 0.180 Training 0.175 0.15 Validation

0.170

10k 20k 30k 40k 10k 20k 30k 40k Training Steps Training Steps

(a). 训练损失。 (b). 验证损失。

图 3. 使用训练损失和验证损失进行的专家数量配方对比。训练曲线在背景中显示原始记录的损失,并绘制平滑曲线以用于可视化;验证曲线未平滑,并与训练损失的步长范围对齐。

细粒度专业化与粗粒度路由。接下来,我们在固定的 13 B 总参数量预算下,对 FFN 参数的划分进行消融实验。我们比较了一种细粒度路由配方(MoE 13B-A1.4B-E128,将每个 token 路由到 128 个专家中的 $K_r = 8$ 个)与一种粗粒度路由配方(MoE 13B-A1.5B-E64,将每个 token 路由到 64 个专家中的 $K_r = 4$ 个)。如图 4 所示,尽管粗粒度路由模型具有更高的激活参数量(因此每个 token 的 FLOP 占用更大),但在整个训练过程中,其表现始终劣于细粒度对应模型。这一性能差距突显了细粒度专家专业化的优势 [18, 57]。通过将 FFN 参数划分为更多、更小的专家,模型获得了显著更大的组合路由空间($\binom{128}{8}$ 对比 $\binom{64}{4}$),遵循了 MoE 模型的稀疏 top-K 路由原则 [25, 50, 86]。这使得表示异构模态和噪声级别的视觉 token 能够形成更定制化的执行路径,而路由到更少、更大的专家则会导致参数层面的梯度冲突 [42, 45, 67] 和知识混合 [18]。

2.4 扩展实验

为了验证我们的稀疏单流扩散变换器(Diffusion Transformer, DiT)的可扩展性和效率,我们遵循分析模型扩展行为和稀疏 MoE 效率的既定做法 [25, 38, 46, 50, 86],在不同规模的模型上进行了扩展实验。我们首先在计算量可比的情况下对模型进行基准测试,评估稀疏参数相对于标准稠密基线的优势。然后,我们研究了我们的架构在总参数量高达 120 B 时的扩展轨迹。最后,我们分析了我们的稀疏架构在不同序列长度下的推理效率。

激活参数量可比扩展。如图 5 所示,我们在相似的激活计算预算下,将 MoE 13B-A1.4B(13 B 总参数量,1.4 B 激活参数量)与标准的 Dense 1.3B 基线进行比较。在整个训练过程中,稀疏模型在训练损失和验证损失上均表现出显著的性能优势。在视频预训练中,建模复杂的空间时间特征和连续物理交互需要高表示容量 [37, 70]。在等效的计算约束下,稀疏 MoE 模型十倍增加的总参数容量为物理世界先验提供了显著更大的存储库,这与

7

第 8 页

MoE 13B-A1.4B-E128 MoE 13B-A1.4B-E128 0.17 MoE 13B-A1.5B-E64 0.190 MoE 13B-A1.5B-E64 Loss 0.185 Loss 0.16 0.180 Training 0.175 0.15 Validation

0.170

10k 20k 30k 40k 10k 20k 30k 40k Training Steps Training Steps

(a). 训练损失。 (b). 验证损失。

图 4. 使用训练损失和验证损失进行的激活容量配方比较。训练曲线在背景中显示原始记录的损失,并绘制平滑曲线以进行可视化;验证曲线未平滑,并与训练损失的步长范围对齐。

通过稀疏专家路由实现的容量-计算解耦 [25, 50, 86]。这有效地解决了稠密基线的特征容量瓶颈,使稀疏模型能够在不增加计算预算的情况下实现更优越的性能。

Dense 1.3B Dense 1.3B 0.160 MoE 13B-A1.4B MoE 13B-A1.4B 0.18 0.155 Loss Loss 0.150 0.17

0.145 Training Validation 0.140 0.16

0.135 5k 20k 40k 60k 5k 20k 40k 60k Training Steps Training Steps

图 5. Dense 1.3B 与 MoE 13B-A1.4B 之间使用训练损失和验证损失进行的可比激活参数缩放比较。训练曲线在背景中显示原始记录的损失,并绘制平滑曲线以进行可视化;验证曲线未平滑,并与训练损失的步长范围对齐。

跨计算优势。此外,我们的稀疏架构相对于稠密基线表现出显著的跨计算优势。如图 6a 所示,MoE 13B-A1.4B 和 MoE 30B-A3B 均持续优于具有约两倍激活参数规模的稠密模型。具体而言,MoE 30B-A3B 的性能接近 Dense 14B。这证明了容量-计算解耦从根本上加速了视频扩散模型的缩放效率,释放了更优越的表示能力。

高达 120B 的可预测缩放定律。为了在实用资源约束下探测我们架构的缩放潜力,我们进行了一项早期缩放研究,将总参数量从 13B 增加到 120B,激活参数按比例从 1.4B 缩放到 11B(MoE 13B-A1.4B、MoE 30B-A3B、MoE 60B-A6B 和 MoE 120B-A11B)。如图 6b 所示,当模型在对齐的训练步长下进行比较时,较大的稀疏模型持续实现更低的训练损失,表现出与神经缩放定律观察结果 [38, 46] 一致的、可预测的依赖规模的改进。尽管由于资源限制,这些运行并未训练至完全收敛,但早期训练轨迹为我们稀疏单流设计(具有无辅助损失的负载均衡和序列级辅助损失)的可扩展性提供了实用的初步验证。

推理效率。为了验证稀疏容量不会转化为高昂的推理成本,我们在从 16K 到 1M(1,048,576)个 token 的序列长度范围内,对深度匹配的稠密和 MoE DiT 变体进行了基准测试,

8

第 9 页

0.19 Dense 1.3B Dense 6B MoE 13B-A1.4B MoE 13B-A1.4B MoE 60B-A6B Dense 3B Dense 14B MoE 30B-A3B MoE 30B-A3B MoE 120B-A11B 0.18 0.145 Long-run zoom Loss 0.17 Loss 0.17

0.141 0.16 0.137 0.16 20k 50k 80k Training Training 0.15

0.14 0.15

10k 20k 30k 40k 50k 60k 2k 4k 6k 8k 10k Training Steps Training Steps

(a). Dense and sparse scaling. (b). MoE scaling at aligned steps.

图 6. 计算量可比扩展实验的训练损失对比。淡色背景轨迹显示原始记录的训练损失;粗曲线仅用于可视化平滑,未用于改变底层测量值。

遵循稀疏 MoE 文献中对条件计算和路由开销的强调 [25, 50, 57, 86]。

如图 7 所示,我们分析了推理速度比,定义为 $r = T_{dense}/T_{MoE}$,其中 $r > 1$ 表示 MoE 30B-A3B 比相应的稠密基线更快。我们首先将 MoE 模型与其激活参数等效模型 Dense 3B 进行比较,以评估路由开销。在序列长度为 1M token 时,注意力(attention)和前馈神经网络(FFN)计算主导执行过程 [111],稀疏模型实现了近乎持平的延迟,速度比为 0.97×。接下来,我们评估稀疏性相对于更大稠密模型的性能提升。随着参数规模的增加,MoE 架构显示出显著的延迟优势:在 1M token 时,相对于 Dense 6B、Dense 14B 和 Dense 30B 的速度比分别达到 1.50×、2.59× 和 3.18×。这些结果表明,我们的稀疏框架在保持 3B 规模模型推理效率的同时,成功扩展了模型容量,为长上下文视频生成提供了一种高度实用的架构。

2.5 级联细化器

直接生成高分辨率视频因时空 token 数量巨大而计算成本高昂。为了平衡计算复杂度和生成质量之间的权衡,我们采用了级联设计。这遵循了将高分辨率扩散生成分解为基础阶段和一个或多个细化或超分辨率阶段的常见做法 [9, 36, 79]。高容量基础生成器首先在较低分辨率下建模整体运动和场景布局。随后,专用的第二阶段细化器提高分辨率。在实践中,我们将视频从 480p 上采样至 1080p。在训练期间,我们通过下采样目标视频来模拟基础生成器的输出。然后,我们应用包括高斯模糊和压缩在内的合成退化,以构建退化的低分辨率输入。此类合成退化流水线广泛用于盲复原和现实世界超分辨率中,以提高对不完美的低分辨率输入的鲁棒性 [109, 122]。该退化视频在像素空间中上采样至目标分辨率。然后,我们使用 VAE 编码器对其进行编码以获得条件潜在变量 $x_{lr}$。直接在潜在空间中处理上采样的条件避免了中间像素空间解码。这减少了计算开销,同时保持了视觉质量 [12, 112, 124, 125]。

与从纯高斯噪声去噪不同,细化器学习从

9

第 10 页

基础生成(480p) 精炼器生成(1080p) 基础生成(480p) 精炼器生成(1080p)

图 8. 精炼器生成。我们将基础视频生成与精炼后的视频生成进行比较。左侧示例的综合提示词为“三位舞者,中间一位男士,两侧各一位女士,正在舞台上表演传统印度舞蹈……”。右侧示例的综合提示词为“一个名为‘AURORA’的人形机器人正稳步走在精心修剪的正式花园的碎石小径上……”。

向从目标视频编码的干净目标潜在变量 $x_0$ 退化的条件 $x_{lr}$。这种公式构建在整流流(rectified flow)和流匹配(flow-matching)目标之上,后者通过向量场回归学习连续传输动力学 [56, 60, 98]。在训练期间,精炼器阈值 $\tau \sim \text{Uniform}(0.85, 0.95)$ 定义了条件轨迹的最大噪声水平。我们用高斯噪声 $\epsilon$ 扰动 $x_{lr}$ 以形成噪声起始条件 $x_\tau = (1 – \tau)x_{lr} + \tau\epsilon$。对于采样的训练时间步 $t \in [0, \tau]$,扰动后的潜在变量 $x_t$ 和目标速度 $v^\star_{\text{ref}}$ 公式化为: $$ x_t = \frac{1 – t}{\tau} x_0 + \frac{t}{\tau} x_\tau, \quad v^\star_{\text{ref}} = \frac{x_\tau – x_0}{\tau}. \quad (12) $$ 模型使用与基础生成器相同的流匹配损失公式进行优化,但限制在时间步 $t \le \tau$。这种阈值化的轨迹将去噪限制在靠近退化条件的噪声区域。因此,精炼器保留了基础模型的全局语义和运动。其能力专门用于恢复高频细节、锐化纹理以及修正局部伪影。

在推理期间,由基础阶段生成的低分辨率视频在像素空间中上采样至目标分辨率。然后我们对其进行编码以获得条件潜在变量 $x_{lr}$。我们在起始时间步 $t = \tau_{\text{inf}}$(例如 $\tau_{\text{inf}} = 0.85$)用高斯噪声 $\epsilon$ 扰动 $x_{lr}$。这产生了噪声起始潜在变量 $x_{\tau_{\text{inf}}} = (1 – \tau_{\text{inf}})x_{lr} + \tau_{\text{inf}}\epsilon$。去噪是通过从 $t = \tau_{\text{inf}}$ 到 $t = 0$ 反向积分整流流 ODE 轨迹来执行的,从而产生干净的视频潜在变量。如图 8 所示,精炼器显著增强了面部外观(左侧),同时成功恢复了高频细节并生成了清晰、可读的 OCR 文本(右侧)。

3 数据

视频生成模型的性能与其训练数据的规模、质量和多样性密不可分。然而,简单地扩大数据收集规模会导致收益递减,并且通常受到获取成本和计算开销等实际因素的瓶颈限制。为了解决这些挑战,我们开发了一个集成的、可扩展的数据基础设施,该基础设施由几个协同模块构建而成。数据画像引擎(Data Profiling Engine)为每个样本提取多维属性——涵盖结构、语义、运动、相机和质量方面——为下游处理提供统一的基础。世界知识拓扑图(World-Knowledge Topological Graph)将视觉概念组织成层次化的语义结构,从而实现分布感知采样并增强长尾覆盖。密集结构化字幕模块(Dense Structured Captioning)生成层次化的文本描述,以提供

10

第 11 页

图像 质量 美学评分 美学、清晰度、曝光、合成感、 色偏、噪声、水印、Logo、字幕 -2.37 0.47 4.70

相机 景别 色调、景别、拍摄角度、镜头类型、 构图、光线质量、光源 广角 中景 特写

运动 主体运动评分 42.2% 主体运动、相机运动、 24.1% 14.8% 12.4% 视频 追踪运动 1.0 2.0 3.0 4.0 6.5% 5.0

语义 对象与动作 对象、环境、世界知识、 风格、动作、文本渲染

结构 片段剪辑 分辨率、时长、片段、帧率

图 9. Data Profiling Engine 概述。每个图像或视频样本在五个互补维度(结构、语义、运动、相机和质量)上进行标注,形成结构化配置文件记录,进而驱动下游的过滤、平衡采样和字幕生成。

细粒度的语义监督,同时,在推理过程中,一个互补的 Caption Rewriter(字幕重写器)将简短的用户提示映射到相同的结构化格式中,从而缩小训练与部署之间的提示分布差距。 在此基础设施之上,我们将精心策划的语料库组织为分阶段的 Data Curriculum(数据课程)(第 3.5 节),该课程控制渐进式预训练(第 5 节)每个阶段所消耗的数据量和组成。

3.1 Data Profiling Engine

Data Profiling Engine 将原始多模态样本转换为结构化、多维度的记录,这些记录捕捉结构、语义、运动、相机和质量属性。我们不是依赖自由形式的注释,而是将每个样本投影到一个固定的模式上,为异构的图像和视频数据提供统一且可查询的表示。这些标准化记录驱动所有后续处理阶段,从过滤和采样到字幕生成。核心注释由强大的视觉-语言模型(VLMs)生成,并进一步通过下文详述的一系列专用评分和检测模型进行增强。图 9 提供了此流程的概述。

结构元数据。这一维度记录基本媒体属性,包括空间分辨率、原生帧率和时长。对于视频内容,我们采用 TransNetV2 [91] 来检测镜头边界并将视频流分割为片段级单元,确保每个训练片段代表一个单一的时间连贯镜头。

语义标签。每个样本都被分配语义注释以及类别级别的置信度分数,这些分数作为分布感知采样期间使用的 World-Knowledge Topological Graph(世界知识拓扑图)的基础。同时,VLM annotator [6, 72] 提取结构化标签,将场景分解为其组成元素:前景和背景对象、环境设置、世界知识实体、视觉风格、动作和渲染文本。这既提供了对场景的高级整体理解,也为精确的数据策展提供了显式的实体锚点。

运动和时序动态。对于视频数据,引擎通过三个互补的信号来表征运动:相机运动、主体运动和追踪运动。VLM annotator 将相机运动与主体运动解耦,并对各自的强度进行评分。作为这些基于 VLM 估计的补充,源自 LocoTrack [16] 点跟踪屏幕的基于几何的追踪运动信号筛选掉了那些原本会收到虚假运动分数的近乎静态或退化的片段。这些线索共同使得下游策展阶段能够有效地平衡静态和高动态内容。

相机和电影属性。每个样本进一步标记有七种不同的电影属性,由

第 12 页

语义树

{
  "object": {
    "foreground_object": ["robot", "Scottish Terrier", "leash"],
    "background_object": ["bench", "apartment building", "tree"],
    "environment_settings": []
  },
  "world_knowledge": [],
  "style": [],
  "action": ["walking"],
  "text_render": []
}

语义链接 动作链接

长尾分布 逐节点损失 高损失 采样权重 数据诊断 上采样 高损失/稀有样本 领域 下采样 覆盖率 低损失/简单样本 低损失

图 10. 世界知识拓扑图。来自 Data Profiling Engine 的结构化标签将每个样本链接到视觉概念的语义树,对于包含动作的视频,则链接到动态行为的动作树。该图作为数据策展的控制面:节点统计信息和训练反馈信号用于对稀有或困难的概念进行上采样,对饱和的简单模式进行下采样,并识别覆盖不足的领域以进行针对性的数据扩展。

由电影摄影数据微调的 VLM 标注器提取。这些属性包括色调、景别、拍摄角度、镜头类型、构图、光线质量和光源(例如,由硬日光照明的暖色调、中广角、高角度镜头)。明确这些属性有助于在生成过程中对电影风格进行细粒度控制,并支持在策展过程中进行风格感知的数据平衡。

质量与美学信号。视觉质量使用专门的训练评分器和 VLM 判断进行评估。我们使用 HPSv3 [62] 计算美学分数。此外,我们使用 OmniAID [30] 估计样本是合成(AI 生成)的可能性,以检测并对生成的图像进行下采样。同时,VLM 标注器的基础阶段提供清晰度和曝光度的序数评级,以及标记水印、徽标、字幕、色偏和噪声的二进制伪影指示器。这些信号共同指导自动过滤和重加权阶段,确保在训练之前移除或降低低质量和包含伪影的样本的权重。

3.2 世界知识拓扑图

为了使数据策展不仅关注质量,还关注分布感知,我们构建了世界知识拓扑图 [11],沿两个互补的轴组织样本:语义概念树和动作树。语义树由图像和视频共享,为对象、场景、视觉风格和世界知识实体提供通用词汇。动作树仅附加到视频样本上,捕捉动态行为,这对于视频预训练尤为重要,例如物体操作、运动、日常活动和人类手势。这两种视图的结合使我们不仅能查询样本中出现了什么,还能查询样本中发生了什么。

语义概念树。我们首先从 Data Profiling Engine 提取语义标签,包括前景和背景对象、环境设置、世界知识实体、风格和渲染文本(图 10)。直接嵌入这些原始标签并不可靠,因为许多标签是稀疏的、模糊的,或被专有名词和领域特定术语所主导。因此,我们用简短的文本介绍扩展每个标签,以描述其视觉 grounded 的含义,然后将标签及其介绍的连接进行嵌入。生成的表示与常用的 Wikipedia 概念 [68, 110] 一起聚类,形成大型分层清单。该层次结构包含 50,000 个细粒度叶子概念和 1,000 个中间视觉类别。在较低层级,基于嵌入的聚类 [102] 提供了高覆盖率和可扩展性。然而,在顶层,纯自动聚类往往与人类感知的粒度不一致;例如,视觉上相似的类别可能因本体名称而被分开,而视觉上不同的类别可能因其文本描述在语义上接近而被合并。我们

12

第 13 页

因此,我们采用由大语言模型(LLM)辅助的“发现-分类-整合”(Discover–Classify–Consolidate)流程,将 1,000 个中间类别合并为 25 个视觉上连贯的顶层组。发现阶段从代表性类别中提出初始的扁平化分类法;分类阶段分配所有中间类别,同时允许提出有界的新桶(new-bucket)建议;整合阶段则合并重叠的桶,重命名不清晰的桶,并吸收样本量不足的桶。这产生了一个与人类认知对齐的树状结构,其中每个样本都被分配到一个从细粒度到粗粒度的语义路径。

动作树(Action Tree)。对于视频数据,我们进一步从画像器(profiler)生成的动作标签中构建动作树。由于原始动作标签简短、嘈杂且冗余,我们首先规范化其表面形式,然后利用基于代表性视频片段的视觉语言模型(VLM)生成的简短描述来扩展每个标签。我们将动作标签及其描述的连接向量进行嵌入,并将生成的表示聚类为规范的动作节点。这种描述增强型聚类减少了短动作短语中的歧义,同时将视觉上相似的运动模式进行分组。聚类之后,我们对高频或模糊的节点进行轻量级的审查和修正,并丢弃不可靠的长尾动作。这产生了数百个规范的动作节点,涵盖了操作、人类手势、运动和日常活动。所有样本均通过其语义路径进行索引,而具有可靠动作标注的视频则额外链接到一个或多个规范的动作节点,从而为我们提供了联合的语义-动作画像。

分布感知采样与数据诊断。该图作为后期数据课程的控制面。在面向挑战的持续训练期间,我们提高罕见或困难的语义和动作节点的权重,特别是那些与操作、物理接触和长尾人类活动相关的节点,同时降低过度代表的通用视频节点的权重。除了静态图统计信息外,我们还通过早期预训练阶段的训练反馈来形成闭环。在前两个阶段之后,我们按语义节点聚合去噪损失,对于视频样本则按动作节点聚合,从而获得数据难度的节点感知估计,该估计用于指导后续阶段的采样权重。由于每个节点都维护着样本数量和代表性示例,该图还揭示了覆盖盲区:缺失的动作和代表性不足的物体类别。我们利用这些信号来指导针对性的数据获取并重新平衡训练混合数据,从而在不盲目增加语料库规模的情况下提高长尾多样性。

3.3 密集结构化描述(Dense Structured Captioning)

遵循 FIBO [33] 的研究,该研究表明在长结构化描述上进行训练能显著提高提示遵循能力和可控性,我们使用密集结构化 JSON 描述对所有训练数据进行标注。我们的描述涵盖四种类型的数据——图像、视频、VLA 视频和第一人称视角(egocentric)视频。这四种类型共享相同的模式:视频、VLA 和第一人称视角描述只是在图像模式的基础上增加了一些额外字段。

  • 图像描述。每个图像描述包含四个部分:(1) 对整个图像的综合描述;(2) 一组相机标签(色调、景别、拍摄角度、镜头类型、构图、光线质量和光源),每个标签均从固定值集中选择;(3) 图像中出现的命名实体的可选世界知识列表;(4) 显著元素列表。对于每个元素,描述其位置、相对大小、形状和颜色、纹理、与其他元素的关系以及方向。如果元素是人,描述还包括姿态、性别、肤色、表情和服装;如果是重复物体的集群,描述将其标记为集群并给出大致数量。
  • 视频描述。视频描述在图像模式的基础上增加了时间信息。全局描述分为两部分:场景中发生的事件以及相机的运动。此外,每个显著元素都带有一个带时间戳的动作列表,例如,手在 [2.67s, 3.67s] 期间进入画面放置食物。因此,描述不仅告诉模型视频中有什么,还告诉模型谁做了什么,以及何时做的。
  • VLA 描述。机器人操作视频使用相同的视频模式。机械臂和夹爪像其他任何物体一样被描述为显著元素,其带时间戳的动作将每个片段划分为清晰的阶段,例如,向下移动以抓取、张开夹爪以释放以及收回。此类数据中省略了性别和肤色字段。
  • 第一人称视角描述。第一人称视频也使用视频模式。相机运动字段描述了佩戴者的头部和身体运动,佩戴者的手被标注为显著元素,其带时间戳的动作描述了它们如何与物体交互。同样省略了性别和肤色字段。

每种数据类型的示例描述见附录 A。

13

第 14 页

阶段 1 阶段 2 阶段 3 阶段 4 阶段 5

192p 192p 480p 480p 1080p 100%

61%

27% 27%

图像 视频 0.2% 通用 通用 27% OCR 电影感 导航 47% VLA OCR 第一人称视角

100%

图 11. 五个渐进式预训练阶段的数据课程。图像流(蓝色)和视频流(绿色)被分解为其组成来源,带宽表示每个来源的相对比例;百分比表示在每个阶段相对于该模态初始数据池保留的数据比例。

3.4 标题重写器

生成器基于第 3.3 节中描述的密集结构化标题进行条件训练——这些标题是冗长、属性丰富且格式为 JSON 的描述。然而,在推理期间,用户通常提供简短的自由形式提示。为了弥合这种训练-推理分布差距,我们引入了一个标题重写器(Caption Rewriter),将提示扩展和格式化分解为两阶段流水线,避免单步映射模型不可靠的问题。

在第一阶段,扩展(Expand),一个零样本大语言模型(例如 Qwen3.6-27B [72])将用户提示处理为紧凑的、以动作为中心的自然语言描述(在一千字以内)。此阶段有意生成简洁的、非枚举的描述,省略了过于具体的细粒度属性——如纹理、确切颜色、相对大小和精确相机参数——这些属性极易产生幻觉。第二阶段,映射(Map),利用经过 LoRA [39] 微调的 Qwen3.6-27B 将这种中间散文转换为最终的结构化 JSON 标题。尽管映射阶段填充了完整的模式,但它受到严格限制的完成约束:它必须逐字保留散文中的所有显式信息(包括场景布局、主体、带时间戳的动作和命名实体),并且仅被允许合理地推断低风险缺失字段。这种策略限制了潜在幻觉,并使两阶段重写器比同时执行扩展和结构化提示的单模型产生更可靠且结构更好的标题。

这两个阶段无缝支持文本到视频(T2V)和文本-图像到视频(TI2V)生成。对于 TI2V,提供条件第一帧作为 $t=0$ 的真实值,确保视觉外观严格遵循图像,而运动动态遵循文本。此外,每个提示都附加了目标持续时间,以限制所有预测的动作时间戳落在视频持续时间之内。

3.5 数据课程

基于精心策划的语料库,我们将训练数据组织为五个阶段的课程,以与渐进式预训练计划(第 5 节)保持一致;这里我们关注数据本身在这些阶段中的演变。模态混合和每个来源的组成发生系统性变化——从仅包含低分辨率(192p)图像的图像数据,到具有丰富具身内容的图像-视频联合数据,分辨率逐渐增加,最后是一个小型的高质量视频精炼集。级联精炼器(第 2 节)是在该语料库的高质量 1080p 子集上单独训练的。图 11 总结了模态混合和每个来源的比例如何在五个阶段中演变。

阶段 1:精心策划的低分辨率图像池。初始阶段仅在 192p 图像上进行训练,保留通过美学质量和最低分辨率过滤的样本,同时严格丢弃最低层级的内容。

第 15 页

阶段 2:视频引入与来源扩展。阶段 2 在匹配的 192p 分辨率下,将视频内容与图像一同引入:大量视频片段加入经过严格质量筛选的较小规模图像库。视频片段通过分辨率、美学和运动过滤器的组合进行准入;值得注意的是,运动标准结合了基于几何的跟踪信号和基于视觉语言模型 (VLM) 的运动评估,以稳健地过滤掉近乎静止的片段。关键在于,此阶段标志着将超过 70,000 小时的面向具身智能的镜头注入语料库——涵盖真实机器人、模拟、开源和第三人称视角的人形和四足平台上的机器人操作 (VLA),以及导航和第一人称视角视频——同时包含富含文本的视频。与此同时,图像过滤器收紧,以执行更高的美学标准、严格的最低分辨率要求,并消除色偏、噪声和模糊。

阶段 3:更高分辨率的重新过滤。阶段 3 将视频和图像流扩展至 480p,按比例收紧相应的美学和运动标准;更高分辨率的门槛显著缩小了两种模态中准入的数据量。我们有意保留高运动视频以加强动态内容的覆盖范围,同时让图像流遵循阶段 2 中建立的严格质量关卡。

阶段 4:以挑战为重点的重新平衡。在相同的 480p 分辨率下,此阶段采用感知来源的策展方法,使语料库与具身智能的需求保持一致。大量通用和精选视频受到涵盖分辨率、美学、清晰度、运动以及无水印等伪影的严格质量标准约束,而稀缺但高价值的具身智能来源,包括操作、导航、第一人称视角镜头和基准数据集,仅经过最小程度的过滤,以最大化其覆盖范围。这种刻意设计的不对称性用冗余的通用镜头交换对具身智能至关重要的长尾、以动作为中心的数据,从而产生一个比原始来源数量所暗示的更具具身智能特征的混合体。

阶段 5:高质量精炼子集。最后阶段是一个 1080p 的小规模高质量视频精炼集,用于训练级联精炼器(第 2 节):从通用来源中选取的精选子集,样本需满足最严格的美学、分辨率和技术质量门槛,仅保留极小一部分(远低于初始视频库的 1%)。

4 基础设施

4.1 预训练基础设施

与仅图像或仅语言的工作负载相比,大规模视频预训练带来了不同的系统瓶颈 [9, 17, 36, 105]。训练管道必须摄入异构的图像和视频流,并管理由分辨率和持续时间决定的可变序列长度。为了实现高训练吞吐量和内存效率,我们的预训练基础设施经过协同设计,以解决六个核心挑战:基于令牌预算的数据加载、可组合的多维并行、激活内存管理、编译优先的图捕获、显式通信预取以及非阻塞运行时 I/O [54, 61, 66, 76, 88, 128]。

4.1.1 异构数据管道与基于令牌预算的打包

数据管道不是按固定数量的样本进行批处理,而是根据目标令牌预算构建每个小批量。数据集在采样配置下估算视觉和条件令牌的长度,允许采样器根据批次的剩余令牌容量动态决定是否追加样本。这种在线长度感知调度至关重要,因为打包输入的两端都具有高度可变性:视觉令牌来自具有不同原生分辨率、纵横比和持续时间的图像和视频,而条件令牌在多模态条件下各不相同;这些因素共同导致令牌数量出现数量级差异。

打包的一维批次。经过 VAE 和条件编码后,每个样本产生视觉令牌 $x_i$ 和条件令牌 $y_i$。我们将所有有效段连接成一个单一的一维序列 $[x_1, y_1, x_2, y_2, \dots, x_N, y_N]$,而不是将异构样本堆叠成矩形张量。数据加载器构建打包序列元数据,如累积序列长度和注意力掩码,使可变长度注意力内核(例如 FlashAttention [19])能够在单次前向传播中处理打包批次,同时防止跨样本注意力泄漏。这种统一表示允许图像、视频和不同的条件模态联合处理,而无需按模态或分辨率对数据加载器进行分区。为了最大化令牌利用率并消除填充浪费,

第 16 页

智能填充采样器(smart-fill sampler)动态搜索秩局部候选池,以在下一个视频片段超出剩余限制时填充每个打包批次的任何剩余 token 预算 [49]。

4.1.2 可组合并行训练

我们将分布式训练栈组织为四个可组合的并行维度:数据并行(DP)[53, 88]、完全分片数据并行(FSDP)[76, 126]、序列并行(SP)[43] 和专家并行(EP)[41, 50, 75, 86]。训练系统通过命名的多维设备网格来表示这些维度,允许每次训练运行在不改变核心训练循环的情况下配置并组合式选择所需的并行模式。这种统一的抽象将吞吐量扩展、模型状态分片、长序列上下文分区和 MoE token 路由整合到单一的并行计划中 [54, 61, 66, 85, 115, 128]。

数据并行(DP)。DP 作为吞吐量扩展的主要外层维度。每个 DP 进程组消耗 token 预算数据流的不同分片,同时全局同步梯度、损失指标和优化器状态。对于混合数据分片,数据并行网格被分解为复制和分片维度,允许独立配置跨节点复制和节点本地参数分片 [53, 76, 88]。

完全分片数据并行(FSDP)。我们利用 FSDP 在分片维度上对参数、梯度及优化器状态进行分片,并扩展至混合分片数据并行(HSDP)以实现多节点可扩展性。FSDP 作为密集 Transformer 块和非专家模块的主要模型状态扩展机制 [76, 126]。FSDP 分片应用于激活检查点(activation checkpointing)和编译决策之后,确保分片钩子、混合精度策略以及高精度忽略参数以确定性顺序解析。此顺序对于保持数值敏感参数(例如归一化、路由缩放)以 FP32 复制,同时以较低精度编译周围张量计算至关重要 [21]。

序列并行(SP)。为了支持长上下文视频序列,我们集成了 Ulysses 序列并行(SP)[43]。在 Transformer 块之前,打包序列被填充以与 Ulysses 组大小对齐,并沿 token 维度切片。在注意力块内,all-to-all 集合操作将 token 分片转置为 head 分片以进行多头注意力计算,随后的 all-to-all 集合操作恢复序列分片布局。最后,收集序列并去除填充以重建原始的一维打包布局。这使得序列长度成为集群上的分布式资源,而非单个加速器的内存限制。

专家并行(EP)。EP 通过将专家池分布在各个秩上并将每个 token 路由到托管其选定专家的设备来扩展稀疏 MoE 层 [25, 41, 50, 57, 75, 86]。在 MoE 前向传播期间,路由的 token 通过 all-to-all 通信分发,由本地专家处理,然后组合回其原始序列位置,从而在不要求每个 GPU 托管每个专家的情况下保留全局路由语义。在我们的实现中,专家分发和组合路径通过 DeepEP [20] 进行加速。

4.1.3 激活检查点

激活检查点通过在反向传播期间重新计算选定的前向激活来管理长打包视频序列的内存占用 [14]。系统支持多种检查点粒度:完整块级重新计算、层级选择性检查点、操作级选择性检查点以及内存预算驱动的检查点 [48]。这种粒度是可配置的,使训练配方能够在不同模型规模和并行配置之间动态平衡重新计算开销和内存约束。至关重要的是,检查点路径实现为非重入(non-reentrant),以防止激活重新计算与专家通信集合操作之间的生命周期冲突。

4.1.4 编译优先图捕获

图编译并非可选的兼容功能,而是关键的吞吐量优化。训练流水线在 FSDP2 分片之前应用带有 Inductor 后端的 torch.compile,允许在附加分片钩子之前融合局部块计算 [3]。在我们的内部训练基准测试中,结合完整块激活检查点与编译可将模型浮点运算利用率(MFU)提高约 1.9 倍,这表明编译优先图捕获恢复了因未融合块级执行而损失的大量加速器利用率。

16

第 17 页

4.1.5 异步监控与分布式检查点 I/O

运行时 I/O 操作与训练循环协同设计,以防止指标记录和状态序列化阻塞加速器。监控路径完全异步:训练秩(ranks)将日志事件(如标量、直方图、图表)入队到一个有界队列中,由后台线程进行处理并写入磁盘。GPU 张量在入队前被传输到主机内存,而有界队列可防止日志背压(backpressure)阻塞计算。这种非阻塞设计允许系统监控全面的诊断指标——如步骤时间分解、MFU、MoE 负载均衡和路由统计——而不会影响训练吞吐量 [64]。

4.2 训练后基础设施

现有的强化学习训练框架主要围绕语言或视觉-语言模型设计。在这些设置中,轨迹自然地表示为 token 序列,策略对数似然通常可以从每个 token 的概率中获得。基于这一假设,先前的工作构建了成熟的 RLHF/RLVR 目标和系统,包括 PPO、DPO 和 GRPO,以及解耦大模型训练、生成和奖励计算的基础设施 [40, 63, 74, 80, 83, 87, 97, 123]。视频扩散模型的训练后阶段违反了这些以 token 为中心的假设:其优化目标与去噪过程或潜在轨迹紧密耦合,其中间状态是高维视频潜在变量而非轻量级文本 token,且对数概率计算、信用分配和奖励评估与语言建模存在显著差异。

最近的工作如 Flow-GRPO、DanceGRPO、DiffusionNFT 和 AWM 探索了扩散模型的强化学习训练后阶段 [58, 116, 118, 127]。类似的基于 RL 的训练后思想也开始出现在最近的尖端生成模型技术报告中 [12, 112],表明 RL 正成为扩散模型训练后阶段中日益重要的组成部分。

4.2.1 扩散原生 RL 系统设计

针对大型 MoE 视频生成模型的 RL 训练后阶段对基础设施提出了极其沉重的需求。单个训练样本对应于约 100K token 的序列;视频 RL 的中间状态——潜在轨迹和每步采样统计——达到 GB 级规模,远大于文本 token;而 MoE 模型庞大的参数量对权重同步和内存管理都造成了巨大压力。

因此,我们为视频扩散模型设计了一套扩散原生的 RL 基础设施。该系统在统一的数据抽象下组织条件、潜在轨迹、奖励和过渡级训练数据;支持 GRPO 风格的逆过程优化和前向过程目标;并兼容 LoRA 风格的参数高效微调和全模型微调 [39]。为了处理由大型中间视频状态引入的内存和通信压力,该基础设施将 rollout、奖励评估和训练解耦为独立的执行角色。它使用面向通信的数据抽象来处理大型潜在对象,并使用面向服务的奖励层来处理异构奖励模型、服务端解码和请求批处理。这种设计使 RL 堆栈与现有扩散管道保持兼容,同时提高了大规模视频扩散模型训练后阶段的效率 [64, 103]。

4.2.2 RL 系统性能

该基础设施也针对速度进行了大量优化:30B 模型的全参数权重同步在每步 20 秒内完成;GB 级中间状态在多个 GPU 节点间的 rollout 和训练之间在 50 毫秒内交换;系统在完整的 RL 步骤中保持了 43.9% 的端到端 MFU。

4.3 服务基础设施

LingBot-Video 通过 Diffusers 兼容的模型包和 SGLang Diffusion 运行时提供服务 [103, 129]。服务堆栈旨在满足三个实际需求:用于开放部署的可移植模型包、用于基于容差的回归测试的数值对齐参考路径,以及用于长视频生成的优化多 GPU 路径。同一运行时支持文本到图像(T2I)、基础文本到视频(T2V)和文本-图像到视频(TI2V)生成,并可在基础视频生成后选择性地调用第二阶段精炼器。

第 18 页

4.3.1 Diffusers 兼容模型包

为了最大限度地提高可访问性并降低开源社区的部署门槛,我们将发布产物组织为一个 Diffusers 兼容的模型包 [103]。优先保证与标准 Diffusers API 的兼容性,确保开发者和研究人员可以在通用的 PyTorch 环境中开箱即用地部署模型,而无需复杂的软件配置或自定义二进制编译。在这种打包方案下,模型被组织为一个统一的根目录,其中基础 DiT 和精炼 DiT 作为独立组件存储。这两个阶段共享相同的条件(conditioning)和自动编码器权重。一个轻量级的叠加层构建器通过配置文件动态暴露所选的 DiT 组件作为激活的变换器(active transformer),从而构建出 Diffusers 和 SGLang 所期望的运行时视图。这种设计使得基础模型和精炼模型的服务可以复用该包,而无需复制共享权重或权重张量,从而保持发布产物的紧凑和整洁。

4.3.2 SGLang 原生服务后端

为了优化服务效率并最大化推理吞吐量,我们在 SGLang [129] 之上构建部署运行时,SGLang 是一个广泛采用的加速引擎,以其在服务基于扩散的管道方面的性能而闻名。利用 SGLang 使我们的部署栈能够利用高度优化的 CUDA 内核和分布式调度策略。在此框架内,服务运行时提供三种不同的执行路径:直接 Diffusers 路径、通用 SGLang 扩散后端以及专门的 LingBot-Video 原生适配器。直接 Diffusers 路径作为一个可读的、急切模式(eager-mode)的参考和调试基线,用于在受控数值设置下检查调度器修改和模型行为。LingBot-Video 原生适配器使 Diffusers 风格的去噪循环与该参考路径保持紧密对齐,同时将我们的自定义管道直接注册到 SGLang 的服务表面和分布式执行钩子中。这种架构分离使得核心去噪逻辑保持稳定且易于审计,同时允许 SGLang 优化的计算内核和分布式执行策略在相同的模型接口后面透明地应用。

4.3.3 分布式视频服务

为了适应多样化的生产需求,我们的 SGLang 部署框架提供了两种推荐的推理配置:通过上下文并行性(context parallelism)在多个 GPU 上分片长视频 token 序列,以及利用批处理无分类器引导(CFG)来高效评估条件和无条件分支。根据部署目标,用户可以选择以下两种专门的执行模式:

  • 保真优先版本:专为回归测试和数值一致性检查而设计,此基线配置在调度器逻辑、路由专家执行和精度策略方面尽可能遵循主训练代码库。它保留用于路由专家的标准分组矩阵乘法(grouped GEMM),采用向量化 token 填充和恢复,并维持混合精度布局。具体而言,它以 BF16 执行标准变换器层和文本编码器,同时保持数值敏感参数——如归一化层、路由门控和缩放平移调制表——为 FP32。在实践中,这种模式作为一个保守的参考基准,通过将实现引起的偏差保持在预期的数值容差范围内,而不是优先考虑最大吞吐量。
  • 速度优先版本:专为高吞吐量服务、快速视觉筛选和低延迟交互式应用而定制,此配置文件在保持相同调度器和模型接口的同时,优化计算密集型瓶颈。它用高度优化的 FP8 SGLang Triton 内核替换标准的路由专家执行路径,显著减少了内存占用和内核执行时间。结合序列分片和并行化引导评估,这个加速版本在视频生成质量受到有限观察影响的情况下,提供了显著的吞吐量提升。

5 训练

5.1 渐进式预训练

当从训练一开始就同时引入高分辨率视频、多种条件模态和异构数据源时,大规模视频预训练的优化极具挑战性 [9, 36, 105]。对于稀疏的混合专家模型(MoE)扩散模型,由于路由器需要满足以下条件,这一挑战更加复杂:

18

第 19 页

在不同任务和模态间建立专门的专家路径 [18, 25, 86]。因此,从一开始就让模型面对全规模的训练复杂性,可能会增加优化不稳定、路由崩溃和样本质量次优的风险 [25, 69]。

为了解决这些挑战,我们设计了一种渐进式预训练课程,以优化友好的顺序引入学习目标 [9, 36]。该课程首先建立稳定的帧级视觉先验,然后引入时序建模,扩展任务条件,协调数据分布,最后细化高分辨率细节。这种分阶段设计将静态外观学习与动态演化分离开来,并使稀疏路由器能够逐渐专业化,而不是一次性暴露于所有异质性来源 [31, 89]。我们将课程组织为五个阶段,每个阶段在前一阶段的基础上增加一个训练复杂性来源。

阶段 1:仅图像先验获取。第一阶段建立了基本的文本-视觉语义对齐和鲁棒的单帧视觉先验 [13, 24]。通过将图像表述为我们统一框架内的单帧(T = 1)视频序列,我们使模型能够在没有时序动力学额外复杂性的情况下学习物体形状、纹理和场景美学 [31, 89]。关键在于,这种“先图像”的预热为稀疏路由器提供了稳定的优化环境,使其能够在遇到异构视频任务之前有效初始化 [18, 25]。

阶段 2:低分辨率时序学习。第二阶段将视频数据引入图像-视频训练混合中,同时故意保持简化的任务表述。图像样本继续强化帧级视觉先验,而视频样本则通过文本到视频(T2V)生成进行训练,以便模型在解决多条件格式化之前专注于时序动力学、相机运动和帧间一致性 [7, 37]。此阶段将静态视觉先验适应为连贯的时序表示,而不会突然增加优化难度 [31, 89]。

阶段 3:多任务条件。阶段 3 在训练混合中保留图像样本,并将视频侧的任务定义从纯 T2V 扩展为 T2V 和文本-图像到视频(TI2V)生成的联合混合 [9, 106]。主要目标是教导模型有效利用视觉条件:在 TI2V 任务中,模型必须忠实地保留提供的初始帧,同时预测时序连贯的未来帧 [23, 106]。通过在基础时序学习稳定后才引入这一要求,我们避免了将早期的运动获取与更具挑战性的视觉条件保持约束相混淆。

阶段 4:加权分布协调。阶段 4 专注于优化数据分布。大规模网络数据表现出严重的质量差异和来源不平衡,这可能会降低训练稳定性和专家专业化,尤其是在预训练的后期阶段。因此,我们切换到加权采样器,通过别名表根据预定义的采样权重从高价值和高数据源中进行采样。此阶段让模型在更干净、更平衡的混合数据下稳定下来,然后再进入最终细化阶段。

阶段 5:高分辨率细化。最终阶段作为高分辨率细化器,在视频数据上进行训练。其主要目的是将训练能力专门用于生成高频空间细节并修正高分辨率样本中的局部伪影,同时保持视频的时序清晰度(例如,最小化纹理闪烁)[36, 79, 124]。遵循第 2 节中描述的级联细化器配置,此阶段优化条件细化轨迹。它将上采样的低分辨率基础阶段输出映射到干净的高分辨率目标,确保模型保留基础阶段的语义和运动动力学,同时成功恢复细粒度的空间细节 [9, 124]。

5.2 后训练

5.2.1 基于多面奖励的强化学习

奖励建模。视觉生成后训练中现有的强化学习(RL)方法通常依赖于整体奖励模型,这些模型输出单个标量分数来表示整体的人类偏好或通用文本对齐 [47, 93, 114]。然而,视频生成本质上是多维度的,容易受到复杂故障模式的影响,如静态模式崩溃、时序幻觉和物理不合理性,而全局、粗粒度的奖励无法有效惩罚这些情况。为了解决这一问题并提供细粒度的优化信号,我们将评估解耦为一套全面的六个专用奖励模型,以优化训练过程中的视觉质量和物理动力学:视觉质量、文本-视频对齐、动态程度、运动连贯性、人体运动一致性和物理合理性。

19

第 20 页

• 视觉质量。遵循 LongCat-Video [12] 的做法,我们采用 HPSv3 [62] 作为 VQ 评估的基础,以联合评估视觉质量和文本-视频对齐程度。我们利用视频中所有帧的不同统计信息来设计互补的奖励信号,分别捕捉整体视觉保真度和稳健的标题对齐情况。由此产生的复合奖励对模糊、伪影和低分辨率输出进行惩罚,同时对标题级别的对齐保持敏感。

• 文本-视频对齐。我们提出了一种基于时间视觉问答(VQA)的细粒度、以动作为中心的文本-视频对齐奖励,用于评估文本-视频对齐程度。我们首先将训练标题解析为结构化实体,并将每个实体与特定的动作和精确的时间窗口相关联。为了确保评估准确性并减少计算开销,我们引入了一种具有分叉窗口机制的自适应时间切片策略:动态动作接收填充窗口,而静态时间标准则强制执行严格边界。随后,我们采用 Qwen3.6-27B [72] 作为零样本评估器,对切片帧上的批量验证查询进行回答。文本-视频对齐奖励被计算为归一化到 [0, 1] 的加权满足率,其中权重根据动作复杂度动态分配。与传统的全球语义匹配指标不同,这种细粒度的方法确保准确生成多阶段动作能获得显著更高的奖励,有效地惩罚时间幻觉和缺失动作。

• 动态程度。我们引入由 Qwen3.6-27B [72] 评估的动态程度奖励,以测量并鼓励适当的运动强度。具体而言,为了效率起见,生成的视频在空间上被下采样至最大高度 480p,并使用专门的动作评估提示进行评估。视觉语言模型(VLM)输出包含 1 到 5 的离散运动分数的结构化信息,我们将其线性映射到 [0, 1] 范围内的连续奖励标量。通过依赖 VLM 而非传统的光流法,该奖励捕捉了具有语义意义的主体动态。这抵消了文本到视频模型生成静态、类图像序列的趋势,有效地打破了静态模式崩溃,同时不损害时间一致性。

• 运动连贯性。文本到视频模型以固定的播放帧率(例如 24 fps)生成视频,但生成的运动往往存在慢动作效应:它看起来比现实世界中慢,仿佛是由高速摄像机拍摄但在 24 fps 下播放。遵循 Pulse-of-Motion [27] 的做法,我们仅从生成的帧中估计运动实际发生的速度。奖励机制旨在引导模型生成在标准 24 fps 播放速率下看起来自然的运动。它完全奖励表现出真实物理速度的内容,同时惩罚显示人工慢动作效应的输出,从而引导模型生成具有自然节奏动态的视频。

• 人体运动一致性。我们使用全面的蒸馏方法训练生成式人体运动一致性模型以评估人体运动。我们构建了真实和合成视频的高质量数据集,以生成五维伪影分数,专门针对不可能的拓扑结构、面部扭曲、手部畸形、肢体数量错误和半透明身体,以及逐步推理以评估空间正确性和时间保真度。随后,我们在这一精心策划的语料库上微调视觉语言混合专家模型 [72]。通过对显式推理轨迹实施监督,该模型超越了肤浅的标量回归,从而内化了潜在的结构和语义约束。在强化学习阶段,它输出结构化理由和离散分数,这些分数被映射到 [0, 1] 范围内的连续奖励标量。该机制明确解决了空间扭曲和时间-语义错位问题,引导策略朝向物理上合理且与文本对齐的人体运动。

• 物理合理性。我们引入物理合理性奖励,以评估生成的视频轨迹是否在连贯的物理场景中展开,其中与任务相关的实体保持存在、空间定位一致并与预期的任务演变一致。该评估器不仅测量感知质量,还基于标题条件和帧证据:它从标题中建立预期的参与者、目标物体和最终状态线索,但仅根据采样帧中可见的现象分配分数。它首先从三个互补的轴评估基础物理约束:运动因果性,验证物体是否保持静止或继续移动,除非受到合理的外力影响;物体恒存性和非穿透性,检查边界丢失、穿透、不可能的重叠以及无支持的出现或消失;以及材料-运动学真实性,检查实体是否遵循合理的材料行为和刚体运动。在这些物理基础之上,评估器还结合了任务完成度的评估。它通过检查正确的动作发生、准确的物体操作和指定的最终空间状态的成功实现,验证预期的物理状态变化是否实际发生。由此产生的分数被聚合为统一的物理奖励。通过联合评估遵循性

20

第 21 页

基于基本物理定律和实现任务驱动的状态变化,该设计确保生成的视频维持一个连贯的、基于物理的世界,其中动态操作和状态变化在视觉上具有依据且在物理上是合理的。

奖励聚合。六个奖励信号通过解耦的逐奖励归一化聚合为一个单一的优势值,详见第 5.2.2 节。

5.2.2 在线策略 GRPO 训练

我们使用组相对策略优化(Group Relative Policy Optimization, GRPO)[58, 83, 118] 对 LingBot-Video 进行后训练,以最大化多面奖励。我们的设置遵循 Flash-GRPO [34] 的单步探索范式:每次 rollout 仅在组内共享的一个去噪步骤中是随机的,噪声通过保系数采样(Coefficients-Preserving Sampling, CPS)[107] 注入,策略梯度经过重加权以平衡时间步,且训练严格遵循在线策略(on-policy),不带 KL 正则化。我们在下文详述每个组件。

组共享单步探索。GRPO 通过比较同一提示的 G 次 rollout 来估计优势值,这需要随机采样。在 Flow-GRPO 和 DanceGRPO [58, 118] 中,每个去噪步骤都是随机的,且所有步骤共享相同的轨迹级优势值,这导致了严重的信用分配问题 [12, 35, 51]。遵循 Flash-GRPO [34] 的做法,我们仅使恰好一个去噪步骤随机化。对于每个组,从推理调度表的前半部分均匀抽取一个步骤索引 k,并由所有 G 次 rollout 共享。转换 $t_k \rightarrow t_{k+1}$ 被随机采样,而其他所有步骤保持为确定性常微分方程(ODE)步骤。每个轨迹因此恰好包含一个随机转换,组内的优势值在同一时间步进行比较,策略更新仅应用于产生变化的转换,从而实现精确的信用分配。

保系数采样。对于随机步骤,我们采用 CPS [107],这是一种 DDIM 风格的转换 [90],而不是常见的随机微分方程(SDE)转换 [58]。转换后的 SDE 的欧拉-马尤拉马(Euler–Maruyama)步骤注入的噪声多于调度表所规定的 [107],留下可见的伪影从而破坏奖励分数,且其扩散系数在高噪声水平下会爆炸,需要额外的裁剪补丁 [12];CPS 通过构造避免了这两者。设 $1 = t_0 > t_1 > \cdots > t_N = 0$ 为推理调度表。在步骤 $t_i$,速度预测 $\hat{v}_\theta$ 给出干净图像和噪声估计:

$$ \hat{x}_0 = x_{t_i} – t_i \hat{v}_\theta, \quad \hat{\epsilon} = x_{t_i} + (1 – t_i) \hat{v}_\theta. \quad (13) $$

CPS 转换到 $t_{i+1}$ 为:

$$ x_{t_{i+1}} = \mu_\theta + s_i \epsilon, \quad \mu_\theta = (1 – t_{i+1}) \hat{x}_0 + \sqrt{t_{i+1}^2 – s_i^2} \hat{\epsilon}, \quad (14) $$

其中 $\epsilon \sim \mathcal{N}(0, I)$ 是新的高斯噪声,$s_i = t_{i+1} \sin(\eta \pi / 2)$ 是注入的噪声尺度,$\eta \in [0, 1]$ 控制探索强度(在我们的实验中 $\eta = 0.7$)。由于 $(t_{i+1}^2 – s_i^2) + s_i^2 = t_{i+1}^2$,转换后的总噪声恰好匹配调度表系数:样本保持在确定性采样器的边缘路径上,且奖励始终在干净视频上进行评估。遵循 [107],转换的对数似然取简化形式 $\log \pi_\theta(x_{t_{i+1}} | x_{t_i}) \propto -\|x_{t_{i+1}} – \mu_\theta\|^2$。

时间步平衡梯度重加权。步骤 $k$ 的策略梯度强度与转换增益成正比:

$$ \kappa_k = 2 s_k \frac{\partial \mu_\theta}{\partial \hat{v}_\theta}, \quad \frac{\partial \mu_\theta}{\partial \hat{v}_\theta} = (1 – t_k) \sqrt{t_{k+1}} \cos \frac{\eta \pi}{2} – t_k (1 – t_{k+1}), \quad (15) $$

这在调度表中变化剧烈,因此均匀采样的关键步骤会让少数时间步主导训练 [12, 34, 35]。我们将每个转换按逆增益进行重加权,并在整个调度表上归一化为单位均值:

$$ \lambda_k = \frac{\kappa_k^{-1}}{\frac{1}{N} \sum_{j=0}^{N-1} \kappa_j^{-1}}. \quad (16) $$

这里,$N$ 是推理步骤的数量,归一化因子是在调度表网格上解析计算的,而不是从批次统计中计算的,因为更新批次中的所有样本共享一个时间步。这在改变有效学习率的情况下,使各时间步的更新幅度相等。

21

第 22 页

多奖励优势归一化。第 5.2.1 节中的奖励具有不同的尺度和方差,因此我们在将它们加权融合 [59] 之前,对每个奖励进行独立归一化:

$$ \hat{A}^{(i)} = \sum_r w_r \frac{R_r(x_0^{(i)}, c) – \mu_r}{\sigma_r + \delta}, \quad (17) $$

其中 $R_r(x_0^{(i)}, c)$ 是样本 $i$ 在提示 $c$ 下的第 $r$ 个奖励,$w_r$ 是其权重,$\mu_r$ 和 $\sigma_r$ 是组内 $R_r$ 的均值和标准差,$\delta$ 是一个小常数。

目标函数。最终损失是采样关键转换上的重加权策略梯度:

$$ \mathcal{L}_{\text{GRPO}}(\theta) = -\mathbb{E} \left[ \lambda_k \hat{A}^{(i)} \log \pi_\theta (x_{t_{k+1}}^{(i)} | x_{t_k}^{(i)}) \right]. \quad (18) $$

每个 rollout 批次仅用于一次梯度更新,因此训练严格遵循在线策略(on-policy),且重要性比率保持为一。遵循 [34, 117, 118],我们不使用 KL 惩罚和参考模型,并微调所有模型参数。

5.2.3 基于真实视频的反向感知微调

大多数现有的扩散模型强化学习后训练方法依赖奖励模型来提供优化信号 [58, 118],这在视频领域引入了奖励黑客(reward hacking)的风险。为了缓解这一问题,我们利用真实视频作为直接偏好信号:真实视频片段作为正样本(被选样本),而在相同提示下由模型生成的视频作为负样本(被拒样本)。这种数据配置与 RealDPO [15] 具有相似的动机,后者也将真实视频与生成视频配对。对于优化过程,我们采用 DiffusionNFT [127] 的前向过程优化框架,从而避免通过去噪轨迹进行反向传播。

偏好对构建。在每个训练步骤中,我们从精心策划的数据集中采样一批真实视频片段,并通过预训练的 VAE 将其编码为干净潜在变量 $x_w^0$(被选样本)。激活策略通过推理管道为每个提示生成 $N$ 个视频,其 VAE 潜在变量构成被拒池 $\{x_l^{0,i}\}_{i=1}^N$。每个被拒潜在变量 $x_l^0$ 与相应的被选潜在变量 $x_w^0$ 配对形成偏好对。两个潜在变量都被扰动到共享的随机时间步 $t \sim U(0, 1)$ 和共享噪声向量 $\varepsilon \sim \mathcal{N}(0, I)$:

$$ x_w^t = (1 – t)x_w^0 + t\varepsilon, \quad x_l^t = (1 – t)x_l^0 + t\varepsilon. \quad (19) $$

干净潜在变量通过 $\hat{x}^0 = x^t – t \cdot \hat{v}$ 从加噪状态恢复,其中 $\hat{v}$ 表示预测的速度。操作单步加噪状态避免了轨迹级别的对数概率计算,使每次更新在计算上保持轻量级。

反向感知优化。我们维护两条共享相同基础模型的预测路径:(i) 接收梯度的激活策略 $\theta$;(ii) 旧策略,即 $\theta$ 的指数移动平均(EMA)副本,通过防止激活策略变化过快来稳定优化。对于任何加噪状态 $x_s^t$($s \in \{w, l\}$),两条路径产生速度预测 $\hat{v}_s^\theta$ 和 $\hat{v}_s^{\text{old}}$。

遵循 DiffusionNFT [127],我们构建一个隐式正策略,混合激活和旧速度预测以模仿目标,以及一个隐式负策略,在外推旧策略之后以抑制它:

$$ \hat{v}^{\text{pos}} = \beta \hat{v}^\theta + (1 – \beta) \hat{v}^{\text{old}}, \quad \hat{v}^{\text{neg}} = (1 + \beta) \hat{v}^{\text{old}} – \beta \hat{v}^\theta, \quad (20) $$

其中 $\beta \in (0, 1]$ 控制激活策略偏离旧策略的程度。DiffusionNFT 将每个样本的损失定义为正分支和负分支的奖励加权混合:

$$ \mathcal{L}_{\text{NFT}}(r) = r \| \hat{v}^{\text{pos}} – v \|^2 + (1 – r) \| \hat{v}^{\text{neg}} – v \|^2, \quad (21) $$

其中 $v = \varepsilon – x^0$ 是真实流匹配速度,$r \in [0, 1]$ 是归一化奖励。

成对偏好适配。我们通过将真实视频视为最优样本($r = 1$)并将生成视频视为负样本,将此公式适配到我们的成对设置中。由此得到:

$$ \mathcal{L}_{\text{chosen}} = \mathcal{L}_{\text{NFT}}(1)_w = \| \hat{v}_w^{\text{pos}} – v_w \|^2, \quad \mathcal{L}_{\text{reject}} = \mathcal{L}_{\text{NFT}}(r)_l = r \| \hat{v}_l^{\text{pos}} – v_l \|^2 + (1 – r) \| \hat{v}_l^{\text{neg}} – v_l \|^2. \quad (22) $$

22

第 23 页

原始 后训练

原始 后训练

原始 后训练

原始 后训练

图 12. 后训练前后在通用视频质量上的定性比较,展示了在几个基本视频生成领域中的显著改进。后训练有效解决了关键伪影,包括不一致的手部和肢体合成、模糊或不正确的文本渲染以及结构物体变形。

原则上,拒绝样本的 $r$ 可以通过根据生成质量设定的奖励模型来分配。为了简化并避免引入奖励模型的开销,我们设置 $r = 0$。我们还对激活策略相对于基础模型的冻结副本进行正则化,以防止策略在微调过程中偏离太远:

LKL = 12 ∥ˆvwθ −ˆvwref∥2 + ∥ˆvlθ −ˆvlref∥2 . (23)

23

第 24 页

原始 后训练

原始 后训练

原始 后训练

原始 后训练

图 13. 具身场景下后训练前后的定性比较。后训练阶段通过解决基线伪影(如手臂和抓取物体的结构失真、非物理穿透、过早释放物体以及物体重复)显著增强了物理合理性。

总训练目标为: LRealNFT = Lchosen + Lreject + λKLLKL. (24)

24

第 25 页

动作表示 动作注入

预测速度 $a_1$ $a_2$ … $a_{4T}$ 块数 × N 帧级对齐的动作

重塑 稀疏 MoE [T, 4*dimA] C 带 RMSNorm (缩放, 平移, 门控)

ActionEmbedder

零填充前缀 注意力块 [T+1, 4* hidden_dim] C 带 RMSNorm (缩放, 平移, 门控)

0 $a_1$ $a_2$ … $a_T$ 潜在级对齐的动作 时间嵌入 统一输入

图 14. LingBot-Video-A2V 的架构。给定未来 4T 帧的帧级动作,LingBot-Video-A2V 首先将原始指令转换为相对动作,展平动作序列,并通过可学习的 ActionEmbedder 将其映射为动作潜在变量。为了在时间上将动作序列与 T + 1 个视觉潜在变量对齐,我们在初始状态前添加了一个零动作。动作嵌入与时间嵌入一起注入到预训练的变换器块中。

5.3 动作到视频的后训练

具身世界模拟要求模型从当前状态和计划好的动作序列出发,推演出合理的未来视觉轨迹 [95, 130]。除了视觉生成之外,这种模拟的未来场景对于具身智能和机器人规划至关重要,支持策略评估 [95, 100]、通过想象推演进行测试时规划 [104]、通过合成轨迹实现机器人数据扩展 [29],以及用于交互式策略改进的强化学习环境 [28, 44]。为了考察 LingBot-Video 是否能将其预训练的对物理合理性、空间关系和时间演化的理解迁移到这一下游设置中,我们进一步将其后训练为动作条件世界模型,记为 LingBot-Video-A2V。仅以初始世界状态(由第一张图像和文本状态描述表示)和机器人动作参数为条件,LingBot-Video-A2V 生成动作条件的未来世界状态视觉推演。这一设置对物理定律建模和动作跟随能力提出了具有挑战性的测试。我们将后训练设计围绕三个组件组织:

• 数据重描述。预训练的 LingBot-Video 擅长遵循提示,其中详细的提示描述了整个视频的演化,包括物理动态和动作描述。为了将此模拟器适应为预测器,我们重写数据描述,使得每个提示仅描述初始状态。这鼓励模型仅使用给定的机器人动作来驱动视频演化。我们进一步应用严格的时间泄漏检查,以确保提示不泄露未来的观察结果或动态。

• 动作表示与注入。给定初始帧和未来的机器人动作块,我们首先将原始动作转换为相对动作,使得每一步都编码相对于前一状态的增量变化。LingBot-Video-A2V 随后将整个动作块展平为单个序列,并通过 ActionEmbedder 进行投影。如图 14 所示,我们在初始观测前添加一个零动作,并保持动作潜在变量与视觉潜在变量在时间上对齐。编码后的潜在级对齐动作作为残差信号注入,以调制每个变换器块,并与时间嵌入一起使用。为了稳定后训练,我们将 ActionEmbedder 的最后一层初始化为零,使得新引入的动作分支能够逐渐集成到预训练的主干中。

• 训练设置。我们采用 Fourier GR-1 后训练数据集进行实验 [26]。每个训练样本遵循相同的公式:模型观察初始世界状态,接收一系列机器人动作,并被监督以生成相应的未来视觉推演。从统一的预训练 LingBot-Video 开始,我们优化 ActionEmbedder 以及完整的变换器主干,而不是孤立地训练动作分支,从而将原始视频模拟器适应为基于动作预测未来帧。我们运行 8k 步的后训练,全局批次大小为 64,学习率为 1e−5。

25

第 26 页

这种适应得益于强大的预训练世界先验与针对性的动作展开数据之间的协同效应。LingBot-Video 提供了关于物理世界因果律、空间关系和时间演化的动作感知先验,而我们经过重新描述(recaptioned)并过滤了数据泄露的 GR-1 轨迹则为动作条件展开提供了干净的监督信号。因此,LingBot-Video-A2V 在后训练后能够实现高质量的动作跟随,并可轻松适配到具身世界模拟中。我们在第 6.4 节中包含了额外的实验结果。

5.4 蒸馏

为了提高推理效率,我们遵循改进的分布匹配蒸馏(Distribution Matching Distillation, DMD2)框架 [120],将 LingBot-Video 蒸馏为一个少步生成器。令 $G_\theta$ 表示以统一条件 $c$ 为条件的学生生成器,并令 $x_0 = G_\theta(z, c)$,其中 $z \sim \mathcal{N}(0, I)$。对于采样的时间步 $t$,我们将生成的潜在视频扰动为 $x_t = \alpha_t x_0 + \sigma_t \epsilon$。该方法通过在扩散噪声级别上最小化反向 KL 风格的分布匹配目标,将学生分布匹配到教师分布:

$$ \nabla_\theta L_{\text{DMD}} = \mathbb{E}_{z,t,\epsilon} \left[ -w_t \left( s_{\text{real}}(x_t, t, c) – s_{\text{fake}}(x_t, t, c) \right) \frac{\partial G_\theta(z, c)}{\partial \theta} \right], \quad (25) $$

其中 $s_{\text{real}}$ 由教师视频扩散模型提供,而 $s_{\text{fake}}$ 是通过在当前学生样本上在线训练的辅助评分模型估计得到的。我们还保留了一个轻量级的 GAN 目标,以提供真实数据监督并提高视觉质量。

6 评估

6.1 内部基准

为了验证 LingBot-Video 作为物理世界模型的能力,我们在内部基准上进行了全面的评估,涵盖两个不同的维度:通用质量(General Quality),用于评估基本的生成能力;以及具身领域(Embodied Domain),用于探测与具身 AI 和现实世界交互相关的专门、高难度场景。为了全面评估生成能力,内部基准涵盖了两个核心生成设置:文本到视频(Text-to-Video, T2V)和文本加图像到视频(Text-and-Image-to-Video, TI2V)。

通用质量。通用领域关注基础的视频生成质量,确保生成的视频在视觉上令人愉悦、时间上一致且语义准确。

  • 运动质量(Motion Quality)衡量运动的自然性、连续性和物理合理性。它评估视频是否表现出平滑的运动轨迹,并且是否避免了严重的时序伪影,如闪烁、结构变形或不自然的人类动作(例如身份漂移或衣物变形)。
  • 提示遵循(Prompt Following)评估模型遵循输入文本指令的忠实程度。它衡量多个实体之间的语义对齐、复杂计数场景、顺序动作、指定的摄像机运动等。
  • 视觉一致性(Visual Consistency)量化模型随时间保持身份和场景上下文的能力。这包括保持背景布局、主体细节和特定实例在帧间的一致性。对于 TI2V 设置,它还额外包含首帧图像保留,以确保生成的视频忠实地继承输入参考图像的外观和风格。
  • 美学质量(Aesthetic Quality)评估生成视频的整体视觉吸引力、艺术价值和风格执行,强调整体电影构图、光照和纹理。

具身领域。除了通用质量外,LingBot-Video 还针对复杂、交互式和具身场景。对于配备摄像头的现实世界机器人,核心目标不是从头生成场景,而是基于当前观察(初始帧 $I_0$)和控制指令($T$)预测未来的物理交互。具身领域评估专门探测模型在需要物理理解、空间推理和交互的高度专门化任务上的表现。它涵盖以下类别:

  • 人类交互(Human Interaction)评估模型合成复杂物理交互和表达性行为的能力。这涵盖细粒度类别,如人与人的交互、物体操作、人与动物的交互等。

26

第 27 页

(a). T2V quality score. (b). T2V domain score.

(c). TI2V quality score. (d). TI2V domain score.

Figure 15. Quantitative evaluation on our internal benchmark. We evaluate the performance of LingBot-Video and other state-of-the-art open-source competitors across two dimensions: general quality (for overall visual appeal and coherence) and embodied domain (for specific category distributions). Top row shows results under the Text-to-Video (T2V) setting, while the bottom row illustrates results under the Text-and-Image-to-Video (TI2V) setting.

and sports dynamics. It also extends to human-related evaluation, such as detailed hand and finger motions, and subtle facial emotions and expressions.

• Physical Simulation focuses on how well the model adheres to intuitive physical laws, acting as a “world simulator” for embodied generation. It covers scenarios governed by classical mechanics, optics (e.g., reflections, shadows), thermodynamics, fluid dynamics, material properties, and magnetism.

• Robotics targets embodied agent scenarios, testing the model’s capability to generate coherent movements for diverse robotic platforms, including humanoid robots, robotic arms, and quadrupedal robots.

• Egocentric Perspective assesses the model’s proficiency in rendering first-person perspective videos, which are crucial for ego-agent.

• Navigation tests the model’s understanding of spatial layouts and motion planning across diverse environments, including outdoor streets, autonomous driving scenes, interactive game environments, and complex indoor layouts.

Results. We compare LingBot-Video with five open-source models, including NVIDIA Cosmos 3 Super-Image- to-Video, Wan 2.2 A14B, LongCat-Video, Hunyuan Video 1.5, and LTX-2.3. As shown in Fig. 15c and Fig. 15d, LingBot-Video achieves state-of-the-art performance among all open-source competitors on the TI2V task, securing the top spot in both general quality and embodied domain scores. This demonstrates our model’s superior capability in simulating precise physical trajectories, such as robotic arm manipulation and obstacle avoidance. For the T2V task ( Fig. 15a and Fig. 15b), while our model ranks second in general quality, we still consistently outperform competitive baselines such as Cosmos on the embodied domain score. This edge, even in the absence of initial image conditioning, highlights that LingBot-Video possesses robust and intrinsic physical priors crucial for embodied AI applications.

27

第 28 页

RBench 平均分 Physics-IQ 验证集 0.7 ours 0.620 0.607 40.4 39.5 ours 闭源 开源 40 0.584 0.581 0.563 0.6 开源 0.507 分数 33.4 32.2 0.5 0.460 30 分数 0.437 0.4 验证 0.3 20 平均 0.2 Physics-IQ 10 0.1 0.0 0 2.6 pro 1.5 A14B 1.5 3SuperVeo3 Wan 2.2 视频 Cosmos3 LingBot-Video Wan Wan A14B LongCat-Video1.5 LingBot-Video Cosmos Seedance Hunyuan 2.2HunyuanVideo

(a). RBench 分数。 (b). Physics-IQ 验证集 I2V 分数。

图 16. 公开基准分数对比。我们可视化了表 1 中的平均分和 Physics-IQ 验证分数,并将 LingBot-Video 与开源和闭源基线进行对比突出显示。

任务 具身形态 模型 类型 平均 操作 空间 多实体 长视界 推理 单臂 双臂 四足 人形

LingBot-Video 开源 0.620 0.578 0.643 0.444 0.634 0.505 0.636 0.639 0.758 0.689 Cosmos3 Super 开源 0.581 0.487 0.642 0.444 0.591 0.395 0.615 0.623 0.739 0.691 LongCat-Video 开源 0.437 0.372 0.310 0.220 0.384 0.186 0.586 0.576 0.681 0.621 Wan 2.2 A14B 开源 0.507 0.381 0.454 0.373 0.501 0.330 0.608 0.582 0.690 0.648 HunyuanVideo 1.5 开源 0.460 0.442 0.316 0.312 0.438 0.364 0.513 0.526 0.634 0.595

Wan 2.6 闭源 0.607 0.546 0.656 0.479 0.514 0.531 0.666 0.681 0.723 0.667 Seedance 1.5 pro 闭源 0.584 0.577 0.495 0.484 0.570 0.470 0.648 0.641 0.680 0.692 Veo 3 闭源 0.563 0.521 0.508 0.430 0.530 0.504 0.634 0.610 0.689 0.637

表 1. RBench 评估结果。我们报告了开源和闭源模型在五个任务导向类别和四个具身形态特定类别上的平均分和子维度分数。部分模型的分数来源于 RBench [22]。

6.2 公开基准

为了补充我们的内部评估,我们进一步在 RBench [22] 和 Physics-IQ Verified [73] 这两个专为具身和物理领域视频生成设计的公开自动化评估基准上评估 LingBot-Video。

RBench。RBench [22] 专门针对以机器人为中心的交互的正确性,使其成为我们评估中机器人类别的有力补充。该基准包含 650 个文本-图像提示,分为两个主要赛道:250 个任务导向场景,涵盖五种交互类型(操作、空间关系、多实体协作、长视界规划和视觉推理),以及 400 个具身形态特定场景,涵盖四种机器人形态(单臂、双臂、人形和四足)。在 RBench 上的出色表现进一步验证了 LingBot-Video 的具身生成能力,特别是在需要物理连贯性和精确指令遵循的以机器人为中心的场景中。这与我们在内部基准中观察到的机器人领域优势(图 15d)一致,并表明 LingBot-Video 的物理世界建模能力超出了我们内部评估套件的范围。

Physics-IQ Verified。Physics-IQ Verified [73] 是 Physics-IQ [65] 基准的改进版本,用于评估视频生成模型是否能够预测现实世界的物理现象,而不仅仅是产生视觉上合理的运动。该基准由 66 个受控物理实验构建,涵盖固体动力学、流体动力学、热力学、光学和磁学。每个实验从三个视角和两次拍摄中记录,总共生成 396 个真实世界视频。支持两种评估模式。在图像到视频(I2V)中,模型以单个开关帧和可选文本提示为条件,预测后续运动。在视频到视频(V2V)续写中,模型以 3 秒的条件视频和可选文本提示为条件,预测接下来 5 秒的运动。生成的视频与真实的物理续写进行对比

第 29 页

沿四个互补的维度:空间重叠、时间对齐、幅度加权的空间一致性以及像素级误差。我们在 I2V(图像到视频)设置下评估 LingBot-Video,这与我们基于图像条件的生成接口相匹配。如图 16(b) 所示,LingBot-Video 获得了 40.4 的 Physics-IQ Verified 分数,在已评估的开源模型中排名第一,并略微超过 Cosmos 3(39.5)。与 Hunyuan Video 1.5(33.4)和 Wan 2.2 A14B(32.2)相比,优势更为明显,表明其在真实物理过程上的预测一致性更强。结合 RBench 的结果,这表明 LingBot-Video 的世界建模能力已从以机器人为中心的交互场景扩展到更广泛的物理动力学领域。

6.3 用户研究

我们进行了 Good-Same-Bad (GSB) 人类评估,以将 LingBot-Video 与领先的开源和商业视频生成模型进行基准测试。评估采用的领域与我们内部基准测试相同。对于每个提示,人类评估者会以随机且匿名的并排格式观看一对视频,并被要求判断第一个视频相对于第二个视频是 Good(更好)、Same(相当)还是 Bad(更差)。这种盲测成对设置强制进行直接的质量比较,从而减轻主观评分偏差。在本研究中,我们将 LingBot-Video 与六个开源模型(NVIDIA Cosmos 3, Wan 2.2 5B, Wan 2.2 A14B, LongCat-Video, HunyuanVideo 1.5 和 LTX-2.3)以及四个商业模型(Kling-V3, Wan 2.7, Seedance 2.0 和 HappyHorse 1.0)进行了比较。总共,我们为每个比较对收集了 400 个提示的人类评分。图 17 报告了文本到视频 (T2V) 和文本加图像到视频 (TI2V) 生成的完整 GSB 细分情况。对于 T2V 生成,LingBot-Video 明显优于几个开源基线模型,在与 Wan 2.2 5B、LongCat-Video、Wan 2.2 A14B 和 LTX-2.3 的比较中,Good 率超过了 Bad 率。与更强的开源模型如 HunyuanVideo 1.5 和 Cosmos 3 相比,竞争更为激烈,表明 LingBot-Video 仍处于具有竞争力的水平。对于 TI2V 生成,优势变得更加一致:LingBot-Video 在所有已评估的开源基线模型中,Good 率均高于 Bad 率,其中与 Wan 2.2 5B 的差距尤为显著,并且相对于 Cosmos 3、LTX-2.3、Wan 2.2 A14B、LongCat-Video 和 HunyuanVideo 1.5 也有明显的提升。这一更强的 TI2V 结果表明,LingBot-Video 是一个强大的开源模型,但略逊于更强的商业模型。

HappyHorse 1.0 (closed) Seedance 2.0 (closed)

Kling-V3 (closed) Kling-V3 (closed)

Seedance 2.0 (closed) HappyHorse 1.0 (closed)

Wan 2.7 (closed) Wan 2.7 (closed)

Cosmos 3 (open) Hunyuan Video 1.5 (open)

Hunyuan Video 1.5 (open) LongCat-Video (open)

LTX-2.3 (open) Wan 2.2 A14B (open)

Wan 2.2 A14B (open) LTX-2.3 (open)

LongCat-Video (open) Cosmos 3 (open)

Wan 2.2 5B (open) Wan 2.2 5B (open)

0% 20% 40% 60% 80% 100% 0% 20% 40% 60% 80% 100% Share of pairwise votes (%) Share of pairwise votes (%) Good (ours better) Similar (tie) Bad (ours worse) Good (ours better) Similar (tie) Bad (ours worse)

(a). T2V. (b). TI2V.

图 17. 用户研究结果。T2V 和 TI2V 生成的 Good-Same-Bad 人类评估结果。

6.4 动作到视频后训练

我们在图 18 中包含了 LingBot-Video-A2V 在 EgoDex Eval 和 DreamDojo-HV Eval 上的结果,以检查后训练模型是否泛化到用于训练的 GR-1 轨迹之外。这两个评估数据集都包含 GR-1 后训练数据集中不存在的新颖对象和动作,因此适合测试分布外 (out-of-distribution) 的动作跟随能力,而非对训练轨迹的记忆。图 18 所示的结果表明,我们的模型更好地遵循物理定律,并且更准确地执行动作。

29

第 30 页

开始 à 结束 真实标签

DreamDojo

我们的方法

开始 à 结束 真实标签

DreamDojo

我们的方法

图 18. 与 DreamDojo [26] 相比,我们的模型展现出对物理定律更好的遵循性,例如在第一个示例中保留了黄苹果,以及更强的动作跟随能力,如手相对于三明治的姿态所示。

30

第 31 页

图19. LingBot-Video在文本和图像到视频生成任务上的定性结果。每一行展示从单个生成视频中均匀采样的五个关键帧;时间从左到右流动。

31

第 32 页

图 20. LingBot-Video 在文本和图像到视频生成任务上的定性结果。

32

第 33 页

图 21. LingBot-Video 在文本和图像到视频生成任务上的定性结果。

33

第 34 页

图 22. LingBot-Video 在文本和图像到视频生成任务上的定性结果。

34

第 35 页

图 23. LingBot-Video 在文本到视频生成任务上的定性结果。每一行展示了从单个生成视频中均匀采样的五个关键帧;时间从左到右流动。

35

第 36 页

结论与讨论

在本工作中,我们提出了 LingBot-Video,这是一种开创性的基于混合专家模型(MoE)的视频基础模型,专为具身智能量身定制,成功弥合了数字创造力与物理执行之间的差距。通过从头扩展基于混合专家模型的扩散变换器(DiT),我们在建模能力和推理效率之间实现了最佳平衡,为下一代机器人大脑的开发铺平了道路。我们旨在将其打造为一个具身视频模拟器,在机器人社区中发挥关键作用:

• 数据引擎:大规模合成高保真、低成本的训练数据,以缓解机器人领域的数据稀缺问题。

• 策略评估器:作为视觉模拟器,以安全关键的方式评估机器人策略,无需承担现实世界的风险。

• 动作规划器:预测“接下来会发生什么”,以协助机器人的实时决策和规划。

通过开源 LingBot-Video,我们希望激发并与社区合作,共同推动具身物理引擎和下一代机器人大脑的边界。

贡献者

预训练:Shuailei Ma, Jingjing Wang, Kecheng Zheng, Yinghao Xu

数据基础设施:Xinyang Wang, Jingjing Wang, Jiaqi Liao, Shuailei Ma, Yuqi Gan, Weisen Wang, Wei Wu, Jiahao Shao, Hao Ouyang, Qiuyu Wang, Yipengjing Sun, Liangxiao Hu

后训练:Jiaqi Liao, Chaoran Feng, Zijing Hu, Zichen Xi, Yanhong Zeng, Qin Zhao, Zifan Shi, Shangzhan Zhang, Nan Xue

Refiner:Chong Bao

服务基础设施:Shuailei Ma

评估:Jingjing Wang*, Zijing Hu*, Chaoran Feng, Lunke Pan

项目赞助:Xing Zhu, Yujun Shen

项目负责人:Ka Leong Cheng

∗ 同等贡献

致谢

我们要感谢 Qingyan Bai, Jingye Chen, Jingyue Chen, Ka Yu Cheng, Xiaoyue Duan, Xiaoqian Ma, Yihao Meng, Fan Fan, Biao Gong, Bo Jiang, Yangyan Li, Yixuan Li, Zichen Liu, Fan Lu, Yichong Lu, Fangqing Teng, Hanlin Wang, Jiahao Wang, Junke Wang, Ruonan Wang, Wenfei Xie, Jingmei Zhao Shuai Zhou, Jiapeng Zhu, Jiayi Zhu(按姓氏字母顺序排列)提供的宝贵讨论和协助。

参考文献

[1] Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, et al. Gpt-4 technical report. arXiv preprint arXiv:2303.08774, 2023.

[2] Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, et al. Cosmos 3: Omnimodal world models for physical ai. arXiv preprint arXiv:2606.02800, 2026.

[3] Jason Ansel, Edward Yang, Horace He, Natalia Gimjshein, Animesh Jain, et al. Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation. In Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2, pages 929–947, 2024.

[4] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, et al. V-jepa 2: Self-supervised video models enable understanding, prediction and planning. arXiv preprint arXiv:2506.09985, 2025.

36

第 37 页

[5] Jinze Bai, Shuai Bai, Yunfei Chu, Zeyu Cui, Kai Dang, Xiaodong Deng, Yang Fan, Wenbin Ge, Yu Han, Fei Huang, 等。 Qwen 技术报告。arXiv 预印本 arXiv:2309.16609, 2023。

[6] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, 和 Ke Zhu。Qwen3-vl 技术 报告。arXiv 预印本 arXiv:2511.21631, 2025。

[7] Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, 等。Lumiere: 一种用于视频生成的时空扩散模型。在 SIGGRAPH Asia 2024 会议论文集中, 第 1–11 页, 2024。

[8] Xiao Bi, Deli Chen, Guanting Chen, Shanhuang Chen, Damai Dai, Chengqi Deng, Honghui Ding, Kai Dong, Qiushi Du, Zhe Fu, 等。Deepseek llm: 以长期主义扩展开源语言模型。arXiv 预印本 arXiv:2401.02954, 2024。

[9] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, 等。Stable video diffusion: 将潜在视频扩散模型扩展至大规模数据集。 arXiv 预印本 arXiv:2311.15127, 2023。

[10] Jake Bruce, Michael D Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, 等。Genie: 生成式交互环境。在第四十一届国际机器学习会议中,第 4603–4623 页, 2024。

[11] Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Xin Jin, Liangchen Li, 等。Z-image: 一种具有单流 Diffusion Transformer (DiT) 的高效图像生成基础模型。arXiv 预印本 arXiv:2511.22699, 2025。

[12] Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, 和 Tong Zhang。Longcat-video 技术报告。arXiv 预印本 arXiv:2510.22200, 2025。

[13] Junsong Chen, Jincheng Yu, Chongjian Ge, Lewei Yao, Enze Xie, Zhongdao Wang, James Kwok, Ping Luo, Huchuan Lu, 和 Zhenguo Li。Pixart-alpha: 用于照片级真实文本到图像合成的 Diffusion Transformer (DiT) 快速训练。在国际 学习表征会议中,卷 2024,第 57611–57640 页, 2024。

[14] Tianqi Chen, Bing Xu, Chiyuan Zhang, 和 Carlos Guestrin。以亚线性内存成本训练深度网络。arXiv 预印本 arXiv:1604.06174, 2016。

[15] Guo Cheng, Danni Yang, Ziqi Huang, Jianlou Si, Chenyang Si, 和 Ziwei Liu。Realdpo: 真实与否,这就是偏好。 arXiv 预印本 arXiv:2510.14955, 2025。

[16] Seokju Cho, Jiahui Huang, Jisu Nam, Honggyu An, Seungryong Kim, 和 Joon-Young Lee。用于点跟踪的局部全对对应。 在欧洲计算机视觉会议中,第 306–325 页。Springer, 2024。

[17] Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, 等。Palm: 通过路径扩展语言建模。机器学习研究杂志, 24(240):1–113, 2023。

[18] Damai Dai, Chengqi Deng, Chenggang Zhao, RX Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Yu Wu, 等。Deepseekmoe: 迈向混合专家模型 (MoE) 语言模型的终极专家专业化。在计算语言学协会第 62 届年会论文集(第 1 卷:长论文)中,第 1280–1297 页, 2024。

[19] Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, 和 Christopher Ré。Flashattention: 具有 I/O 感知能力的快速且内存高效的精确注意力机制。在神经信息处理系统进展中,卷 35,第 16344–16359 页, 2022。

[20] DeepSeek-AI。Deepep: 一种高效的专家并行通信库。https://github.com/deepseek-ai/DeepEP, 2025。访问日期:2026-07-08。

[21] Mostafa Dehghani, Alexey Gritsenko, Aurelien Sun, Sherjil Uesato, Yi Tay, Basil Mustafa, Joao Carreira, Christian Szegedy, 和 Xiaohua Zhai。将视觉变换器扩展至 220 亿参数。在国际机器学习会议中,第 7480–7512 页, 2023。

37

第 38 页

[22] Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, 和 Daquan Zhou。 重新思考具身世界的视频生成模型。在第四十三届国际机器学习会议 (Forty-third International Conference on Machine Learning) 上, 2026。

[23] Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, 和 Anastasis Germanidis。结构 和内容引导的视频合成与扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision) 中, 第 7346–7356 页,2023。

[24] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel 等人。扩展整流流变换器以进行高分辨率图像合成。在第四十一届 国际机器学习会议 (international conference on machine learning) 上,第 12606–12633 页,2024。

[25] William Fedus, Barret Zoph, 和 Noam Shazeer。Switch 变换器:通过简单且 高效的稀疏性扩展至万亿参数模型。《机器学习研究期刊》(Journal of Machine Learning Research), 23(120):1–39, 2022。

[26] Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin 等人。Dreamdojo:来自大规模人类视频的通用人形机器人世界模型。arXiv 预印本 arXiv:2602.06949, 2026。

[27] Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou Lin, 和 Zhengzhong Tu。运动 的脉搏:从视觉动态中测量物理帧率。arXiv 预印本 arXiv:2603.14375, 2026。

[28] Yanjiang Guo, Tony Lee, Lucy Xiaoyang Shi, Jianyu Chen, Percy Liang, 和 Chelsea Finn。Vlaw:视觉-语言-动作策略与世界模型的迭代协同改进。arXiv 预印本 arXiv:2602.12063, 2026。

[29] Yanjiang Guo, Lucy Xiaoyang Shi, Jianyu Chen, 和 Chelsea Finn。Ctrl-world:用于机器人操作的可控生成式世界模型。arXiv 预印本 arXiv:2510.10125, 2025。

[30] Yuncheng Guo, Junyan Ye, Chenjue Zhang, Hengrui Kang, Haohuan Fu, Conghui He, 和 Weijia Li。Omniaid:解耦 语义与伪影以用于野外通用 AI 生成图像检测。arXiv 预印本 arXiv:2511.08423, 2025。

[31] Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, 和 Bo Dai。 Animatediff:无需特定微调即可动画化您的个性化文本到图像扩散模型。在第十二届国际 学习表征会议 (The Twelfth International Conference on Learning Representations) 上,2024。

[32] Agrim Gupta, Lijun Yu, Kihyuk Sohn, Xiuye Gu, Meera Hahn, Fei-Fei Li, Irfan Essa, Lu Jiang, 和 José Lezama。照片级真实 视频生成与扩散模型。在欧洲计算机视觉会议 (European Conference on Computer Vision) 上,第 393–411 页。Springer, 2024。

[33] Eyal Gutflaish, Eliran Kachlon, Hezi Zisman, Tal Hacham, Nimrod Sarid, Alexander Visheratin, Saar Huberman, Gal Davidi, Guy Bukchin, Kfir Goldberg, 和 Ron Mokady。从 1,000 个单词生成图像:通过 结构化字幕增强文本到图像。arXiv 预印本 arXiv:2511.06876, 2025。

[34] Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang 等人。Flash-grpo:通过单步策略优化实现视频扩散的高效对齐。arXiv 预印本 arXiv:2605.15980, 2026。

[35] Xiaoxuan He, Siming Fu, Yuke Zhao, Wanli Li, Jian Yang, Dacheng Yin, Fengyun Rao, 和 Bo Zhang。Tempflow-grpo:当 时机对流模型中的 GRPO 至关重要时。arXiv 预印本 arXiv:2508.04324, 2025。

[36] Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, Ruiqi Gao, Alexey Gritsenko, Diederik P Kingma, Ben Poole, Mohammad Norouzi, David J Fleet 等人。Imagen video:使用扩散模型进行高清视频生成。arXiv 预印本 arXiv:2210.02303, 2022。

[37] Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, 和 David J Fleet。视频扩散 模型。《神经信息处理系统进展》(Advances in neural information processing systems), 35:8633–8646, 2022。

[38] Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, Tom Hennigan, Eric Noland, Katie Millican, George van den Driessche, Bogdan Damoc, Aurelia Guy, Simon Osindero, Karen Simonyan, Erich Elsen, Jack W. Rae, Oriol Vinyals, 和 Laurent Sifre。 训练计算最优的大型语言模型。在《神经信息处理系统进展》(Advances in Neural Information Processing Systems) 上,第 30016–30030 页, 2022。

[39] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, 和 Weizhu Chen。Lora: 大型语言模型的低秩自适应。在第十届国际 学习表征会议 (The Tenth International Conference on Learning Representations) 上,2022。

[40] Jian Hu, Xibin Wu, Zilin Zhu, Weixun Wang, Dehao Zhang, Yu Cao 等人。Openrlhf:一个易于使用、可扩展且高性能的 RLHF 框架。arXiv 预印本 arXiv:2405.11143, 6, 2024。

38

第 39 页

[41] Changho Hwang, Wei Cui, Yifan Xiong, Ziyue Yang, Ze Liu, Han Hu, Zilong Wang, Rafael Salas, Jithin Jose, Prabhat Ram, et al. Tutel: 大规模自适应混合专家模型 (Mixture-of-Experts, MoE)。在机器学习与系统会议论文集 (Proceedings of Machine Learning and Systems) 中,第 269–287 页,2023 年。

[42] Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan, and Geoffrey E. Hinton. 局部专家自适应混合模型。《神经计算》(Neural Computation), 3(1):79–87, 1991 年。

[43] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, and Yuxiong He. DeepSpeed Ulysses:支持超长序列 Transformer 模型训练的系统优化。arXiv 预印本 arXiv:2309.14509, 2023 年。

[44] Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, et al. Wovr:作为强化学习后训练 VLA 策略可靠模拟器的世界模型。arXiv 预印本 arXiv:2602.13977, 2026 年。

[45] Michael I Jordan and Robert A Jacobs. 层次化混合专家模型与期望最大化 (EM) 算法。《神经计算》(Neural computation), 6(2):181– 214, 1994 年。

[46] Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei. 神经语言模型的缩放定律。arXiv 预印本 arXiv:2001.08361, 2020 年。

[47] Yuval Kirstain, Adam Polyak, Uriel Singer, Shahbuland Matiana, Joe Penna, and Omer Levy. Pick-a-pic:一个面向文本生成图像的 用户偏好开放数据集。神经信息处理系统进展 (Advances in neural information processing systems), 36:36652–36663, 2023 年。

[48] Vijay Korthikanti, Jared Casper, Sangkug Lym, Lawrence McAfee, Michael Andersch, Mohammad Shoeybi, and Bryan Catanzaro. 减少大型 Transformer 模型中的激活值重计算。在机器学习与系统会议论文集 (Proceedings of Machine Learning and Systems) 中, 第 341–353 页,2023 年。

[49] Mario Michael Krell, Matej Kosec, Sergio P. Perez, and Andrew Fitzgibbon. 无交叉污染的高效序列打包:在不影响性能的情况下加速 大型语言模型。arXiv 预印本 arXiv:2107.02027, 2021 年。

[50] Dmitry Lepikhin, HyoukJoong Lee, Yuanzhong Xu, Dehao Chen, Orhan Firat, Yanping Huang, Maxim Krikun, Noam Shazeer, and Zhifeng Chen. GShard:通过条件计算和自动分片扩展巨型模型。在第九届国际学习表征会议 (The Ninth International Conference on Learning Representations) 上,2021 年。

[51] Junzhe Li, Yutao Cui, Tao Huang, Yinping Ma, Chun Fan, Yiming Cheng, Miles Yang, Zhao Zhong, and Liefeng Bo. MixGRPO: 利用混合 ODE-SDE 解锁基于流的 GRPO 效率。arXiv 预印本 arXiv:2507.21802, 2025 年。

[52] Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, et al. 用于机器人控制的因果世界建模。arXiv 预印本 arXiv:2601.21998, 2026 年。

[53] Shen Li, Yanli Zhao, Rohan Varma, Omkar Salpekar, Pieter Noordhuis, Teng Li, Adam Paszke, Jeff Smith, Brian Vaughan, Pritam Damania, and Soumith Chintala. PyTorch Distributed:加速数据并行训练的经验。《VLDB 会刊》(Proceedings of the VLDB Endowment), 13(12):3005–3018, 2020 年。

[54] Wanchao Liang, Tianyu Liu, Less Wright, Will Constable, Andrew Gu, Chien-Chin Huang, Iris Zhang, Wei Feng, Howard Huang, Junjie Wang, Sanket Purandare, Gokul Nadathur, and Stratos Idreos. TorchTitan:面向生产就绪的大型语言模型预训练的一站式 PyTorch 原生解决方案。在第十三届国际学习表征会议 (The Thirteenth International Conference on Learning Representations) 上,2025 年。

[55] Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, et al. Genie Envisioner:用于机器人操作统一的机器人基础平台。arXiv 预印本 arXiv:2508.05635, 2025 年。

[56] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, and Matt Le. 用于生成建模的流匹配 (Flow Matching)。在 第十一届国际学习表征会议 (The Eleventh International Conference on Learning Representations) 上,2023 年。

[57] Aixin Liu, Bei Feng, Bing Xue, Bingxuan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, et al. DeepSeek-V3 技术报告。arXiv 预印本 arXiv:2412.19437, 2024 年。

[58] Jie Liu, Gongye Liu, Jiajun Liang, Yangguang Li, Jiaheng Liu, Xintao Wang, Pengfei Wan, Di Zhang, and Wanli Ouyang. Flow-GRPO:通过在线强化学习训练流匹配模型。在神经信息处理系统进展 (Advances in neural information processing systems) 中, 第 40783–40818 页,2026 年。

[59] Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, et al. GDPO:用于多奖励强化学习优化的组奖励解耦归一化策略优化。arXiv 预印本 arXiv:2601.05242, 2026 年。

[60] Xingchao Liu, Chengyue Gong, and Qiang Liu. 直线且快速的流:学习使用整流流 (Rectified Flow) 生成和传输数据。在 第十一届国际学习表征会议 (The Eleventh International Conference on Learning Representations) 上,2023 年。

39

第 40 页

[61] Qianli Ma, Yaowei Zheng, Zhelun Shi, Zhongkai Zhao, Bin Jia, Ziyue Huang, Zhiqi Lin, Youjie Li, Jiacheng Yang, Yanghua Peng, Zhi Zhang, and Xin Liu. Veomni: Scaling any modality model training with model-centric distributed recipe zoo. arXiv preprint arXiv:2508.02317, 2025.

[62] Yuhang Ma, Xiaoshi Wu, Keqiang Sun, and Hongsheng Li. Hpsv3: Towards wide-spectrum human preference score. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 15086–15095, 2025.

[63] Zhiyu Mei, Wei Fu, Kaiwei Li, Guangju Wang, Huanchen Zhang, and Yi Wu. Real: Efficient rlhf training of large language models with parameter reallocation. In Proceedings of Machine Learning and Systems, 2025.

[64] Philipp Moritz, Robert Nishihara, Stephanie Wang, Alexey Tumanov, Richard Liaw, Eric Liang, Melih Elibol, Zongheng Yang, William Paul, Michael I Jordan, et al. Ray: A distributed framework for emerging {AI} applications. In 13th USENIX symposium on operating systems design and implementation (OSDI 18), pages 561–577, 2018.

[65] Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, and Robert Geirhos. Do generative video models understand physical principles? In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026.

[66] Deepak Narayanan, Mohammad Shoeybi, Jared Casper, Patrick LeGresley, Mostofa Patwary, Vijay Korthikanti, Dmitri Vainbrand, Prethvi Kashinkunti, Julie Bernauer, Bryan Catanzaro, Amar Phanishayee, and Matei Zaharia. Efficient large-scale language model training on gpu clusters using megatron-lm. In Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis, pages 1–15, 2021.

[67] Steven J. Nowlan and Geoffrey E. Hinton. Evaluation of adaptive mixtures of competing experts. In Advances in Neural Information Processing Systems 3 (NIPS 1990), pages 774–780. Morgan Kaufmann, 1990.

[68] Lawrence Page, Sergey Brin, Rajeev Motwani, and Terry Winograd. The pagerank citation ranking : Bringing order to the web. In The Web Conference, 1999.

[69] Byeongjun Park, Hyojun Go, Jin-Young Kim, Sangmin Woo, Seokil Ham, and Changick Kim. Switch diffusion transformer: Synergizing denoising tasks with sparse Mixture-of-Experts (MoE). In European Conference on Computer Vision, pages 461–477. Springer, 2024.

[70] William Peebles and Saining Xie. Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 4195–4205, 2023.

[71] Qi Qin, Le Zhuo, Yi Xin, Ruoyi Du, Zhen Li, Bin Fu, Yiting Lu, Xinyue Li, Dongyang Liu, Xiangyang Zhu, et al. Lumina- image 2.0: A unified and efficient image generative framework. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 20031–20042, 2025.

[72] Qwen Team. Qwen3.6-27B: Flagship-level coding in a 27B dense model. https://qwen.ai/blog?id=qwen3.6-27b, 2026. Accessed: 2026-07-08.

[73] Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, and Carsten T Lüth. Physics-iq verified. arXiv preprint arXiv:2606.18943, 2026.

[74] Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, and Chelsea Finn. Direct preference optimization: Your language model is secretly a reward model. In Advances in Neural Information Processing Systems, pages 53728–53741, 2023.

[75] Samyam Rajbhandari, Conglong Li, Zhewei Yao, Minjia Zhang, Reza Yazdani Aminabadi, Ammar Ahmad Awan, Jeff Rasley, and Yuxiong He. Deepspeed-moe: Advancing Mixture-of-Experts (MoE) inference and training to power next-generation ai scale. In International Conference on Machine Learning, pages 18332–18346. PMLR, 2022.

[76] Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He. Zero: Memory optimizations toward training trillion parameter models. In SC20: International Conference for High Performance Computing, Networking, Storage and Analysis, pages 1–16, 2020.

[77] Xuanchi Ren, Yifan Lu, Tianshi Cao, Ruiyuan Gao, Shengyu Huang, Amirmojtaba Sabour, Tianchang Shen, Tobias Pfaff, Jay Zhangjie Wu, Runjian Chen, et al. Cosmos-drive-dreams: Scalable synthetic driving data generation with world foundation models. arXiv preprint arXiv:2506.09042, 2025.

[78] Lloyd Russell, Anthony Hu, Lorenzo Bertoni, George Fedoseev, Jamie Shotton, Elahe Arani, and Gianluca Corrado. Gaia-2: A controllable multi-view generative world model for autonomous driving. arXiv preprint arXiv:2503.20523, 2025.

[79] Chitwan Saharia, Jonathan Ho, William Chan, Tim Salimans, David J Fleet, and Mohammad Norouzi. Image super-resolution via iterative refinement. IEEE transactions on pattern analysis and machine intelligence, 45(4):4713–4726, 2022.

40

第 41 页

[80] John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, 和 Oleg Klimov。近端策略优化算法。arXiv 预印本 arXiv:1707.06347, 2017。

[81] Seedance 团队, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng 等。Seedance 2.0:推进面向世界复杂性的视频生成。arXiv 预印本 arXiv:2604.14148, 2026。

[82] Sha Haiying 和 Zheng Yan。视觉扩散变换器中的稀疏混合专家路由:从路由崩溃到选择性死锁的诊断、边界校准与演进路线图。arXiv 预印本 arXiv:2605.19378, 2026。

[83] Shao Zhihong, Wang Peiyi, Zhu Qihao, Xu Runxin, Song Junxiao, Bi Xiao, Zhang Haowei, Zhang Mingchuan, Li YK, Wu Yang 等。Deepseekmath:推动开放语言模型中数学推理的极限。arXiv 预印本 arXiv:2402.03300, 2024。

[84] Shazeer Noam。GLU 变体改进 Transformer。arXiv 预印本 arXiv:2002.05202, 2020。

[85] Shazeer Noam, Cheng Youlong, Parmar Niki, Tran Dustin, Vaswani Ashish, Koanantakool Penporn, Hawkins Peter, Lee HyoukJoong, Hong Mingsheng, Young Cliff, Sepassi Ryan, 和 Hechtman Blake。Mesh-tensorflow:面向超级计算机的深度学习。在神经信息处理系统进展中, 2018。

[86] Shazeer Noam, Mirhoseini Azalia, Maziarz Krzysztof, Davis Andy, Le Quoc, Hinton Geoffrey, 和 Dean Jeff。极其庞大的神经网络:稀疏门控混合专家层。在国际学习表征会议中, 2017。

[87] Sheng Guangming, Zhang Chi, Ye Zilingfeng, Wu Xibin, Zhang Wang, Zhang Ru, Peng Yanghua, Lin Haibin, 和 Wu Chuan。Hybridflow:一种灵活且高效的 RLHF 框架。在第二十届欧洲计算机系统会议论文集, 第 1279–1297 页, 2025。

[88] Shoeybi Mohammad, Patwary Mostofa, Puri Raul, LeGresley Patrick, Casper Jared, 和 Catanzaro Bryan。Megatron-lm:使用模型并行性训练数千亿参数语言模型。arXiv 预印本 arXiv:1909.08053, 2019。

[89] Singer Uriel, Polyak Adam, Hayes Thomas, Yin Xi, An Jie, Zhang Songyang, Hu Qiyuan, Yang Harry, Ashual Oron, Gafni Oran 等。Make-a-video:无需文本-视频数据的文本到视频生成。在第十一届国际学习表征会议中, 2023。

[90] Song Jiaming, Meng Chenlin, 和 Ermon Stefano。去噪扩散隐式模型。在第九届国际学习表征会议中, 2021。

[91] Soucek Tomás 和 Lokoc Jakub。Transnet v2:一种用于快速镜头转换检测的有效深度网络架构。在第三十二届 ACM 国际多媒体会议论文集, 第 11218–11221 页, 2024。

[92] Sun Wenqiang, Zhang Haiyu, Wang Haoyuan, Wu Junta, Wang Zehan, Wang Zhenwei, Wang Yunhong, Zhang Jun, Wang Tengfei, 和 Guo Chunchao。Worldplay:迈向实时交互式世界建模的长期几何一致性。arXiv 预印本 arXiv:2512.14614, 2025。

[93] Tang Zhenyu, Feng Chaoran, Deng Yufan, Wu Jie, Li Xiaojie, Wang Rui, Chen Yunpeng, 和 Zhou Daquan。通过奖励建模增强图像生成中的空间理解。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 27249–27259 页, 2026。

[94] Gemini 团队, Anil Rohan, Borgeaud Sebastian, Alayrac Jean-Baptiste, Yu Jiahui, Soricut Radu, Schalkwyk Johan, Dai Andrew M, Hauth Anja, Millican Katie 等。Gemini:一系列高度多模态模型。arXiv 预印本 arXiv:2312.11805, 2023。

[95] Gemini Robotics 团队, Choromanski Krzysztof, Devin Coline, Du Yilun, Dwibedi Debidatta, Gao Ruiqi, Jindal Abhishek, Kipf Thomas, Kirmani Sean, Leal Isabel 等。在 Veo 世界模拟器中评估 Gemini 机器人策略。arXiv 预印本 arXiv:2512.10675, 2025。

[96] Robbyant 团队, Gao Zelin, Wang Qiuyu, Zeng Yanhong, Zhu Jiapeng, Cheng Ka Leong, Li Yixuan, Wang Hanlin, Xu Yinghao, Ma Shuailei, Chen Yihang, Liu Jie, Cheng Yansong, Yao Yao, Zhu Jiayi, Meng Yihao, Zheng Kecheng, Bai Qingyan, Chen Jingye, Shen Zehong, Yu Yue, Zhu Xing, Shen Yujun, 和 Ouyang Hao。推进开源世界模型。arXiv 预印本 arXiv:2601.20540, 2026。

[97] THUDM。Slime:一种用于大规模强化学习的 LLM 后训练框架。https://github.com/THUDM/slime, 2025。

[98] Tong Alexander, Fatras Kilian, Malkin Nikolay, Huguet Guillaume, Zhang Yanlei, Rector-Brooks Jarrid, Wolf Guy, 和 Bengio Yoshua。通过小批量最优传输改进和泛化基于流的生成模型。机器学习研究汇刊, 2024。

41

第 42 页

[99] Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, 等。Llama:开放且高效的基础语言模型。arXiv 预印本 arXiv:2302.13971,2023。

[100] Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z Ren, Lucy X Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, 等。Sc3-eval:通过自洽视频生成评估机器人基础模型。arXiv 预印本 arXiv:2606.18610,2026。

[101] Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, 和 Dumitru Erhan。Phenaki:从开放域文本描述生成可变长度视频。在 International Conference on Learning Representations (ICLR) 中,2023。

[102] Huy V Vo, Vasil Khalidov, Timothée Darcet, Théo Moutakanni, Nikita Smetanin, Marc Szafraniec, Hugo Touvron, Camille Couprie, Maxime Oquab, Armand Joulin, 等。用于自监督学习的自动数据策展:一种基于聚类的方法。Transactions on Machine Learning Research,2024。

[103] Patrick von Platen, Suraj Patil, Anton Lozhkov, Pedro Cuenca, Nathan Lambert, Kashif Rasul, Mishig Davaadorj, Dhruv Nair, Sayak Paul, William Berman, Yiyi Xu, Steven Liu, 和 Thomas Wolf。Diffusers:最先进的扩散模型。 https://github.com/huggingface/diffusers,2022。访问日期:2026-07-08。

[104] Chi Wan, Kangrui Wang, Yuan Si, Pingyue Zhang, 和 Manling Li。Worldagen:结合测试时世界模型训练的统一状态-动作预测。在 Proceedings of the AAAI Conference on Artificial Intelligence 中,第 40 卷,页码 18584–18592,2026。

[105] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。

[106] Wan-AI Team。Wan2.2:一个文生视频和图生视频生成框架。https://github.com/Wan-Video/ Wan2.2,2025。访问日期:2026-07-08。

[107] Feng Wang 和 Zihao Yu。具有流匹配强化学习的系数保持采样。arXiv 预印本 arXiv:2509.05952,2025。

[108] Liang Wang, Huazuo Gao, Ruixin Zhao, Xiaoting Sun, 和 Damai Dai。混合专家模型 (MoE) 的无辅助损失负载均衡策略。arXiv 预印本 arXiv:2408.15664,2024。

[109] Xintao Wang, Liangbin Xie, Chao Dong, 和 Ying Shan。Real-esrgan:使用纯合成数据训练真实世界盲超分辨率。在 Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops 中,页码 1905–1914,2021。

[110] Wikimedia Foundation。Wikimedia 下载。https://dumps.wikimedia.org,2026。访问日期:2026-07-08。

[111] Samuel Williams, Andrew Waterman, 和 David Patterson。Roofline:一种针对多核架构的直观视觉性能模型。Communications of the ACM,52(4):65–76,2009。

[112] Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, 等。Hunyuanvideo 1.5 技术报告。arXiv 预印本 arXiv:2511.18870,2025。

[113] Chenyuan Wu, Jiahao Wang, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, 等。Omnigen2:迈向指令对齐的多模态生成。在 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition 中,页码 21964–21975,2026。

[114] Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, 和 Yuxiao Dong。Imagereward: 学习并评估文生视频生成的人类偏好。Advances in Neural Information Processing Systems, 36:15903–15935,2023。

[115] Yuanzhong Xu, HyoukJoong Lee, Dehao Chen, Blake Hechtman, Yanping Huang, Rahul Joshi, Maxim Krikun, Dmitry Lepikhin, Andy Ly, Marcello Maggioni, Ruoming Pang, Noam Shazeer, Shibo Wang, Tao Wang, Yonghui Wu, 和 Zhifeng Chen。Gspmd:机器学习计算图的通用且可扩展的并行化。arXiv 预印本 arXiv:2105.04663,2021。

[116] Shuchen Xue, Chongjian Ge, Shilong Zhang, Yichen Li, 和 Zhi-Ming Ma。优势加权匹配:在扩散模型中对齐强化学习与预训练。arXiv 预印本 arXiv:2509.25050,2025。

[117] Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, 等。视频生成的系统化后训练框架。arXiv 预印本 arXiv:2604.25427,2026。

[118] Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang, 等。Dancegrpo:释放 GRPO 在视觉生成中的潜力。arXiv 预印本 arXiv:2505.07818,2025。

42

第 43 页

[119] Wilson Yan, Yunzhi Zhang, Pieter Abbeel, 和 Aravind Srinivas。Videogpt:使用 VQ-VAE 和 Transformer 进行视频生成。arXiv 预印本 arXiv:2104.10157,2021。

[120] Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T Freeman。改进的分布匹配蒸馏以实现快速图像合成。在神经信息处理系统进展中,第 47455–47487 页,2024。

[121] Aohan Zeng, Xiao Liu, Zhengxiao Du, Zihan Wang, Hanyu Lai, Ming Ding, Zhuoyi Yang, Yifan Xu, Wendi Zheng, Xiao Xia 等。GLM-130B:一个开源的双语预训练模型。在第十一届国际学习表征会议中,2023。

[122] Kai Zhang, Jingyun Liang, Luc Van Gool, 和 Radu Timofte。为深度盲图像超分辨率设计实用的退化模型。在 IEEE/CVF 国际计算机视觉会议论文集,第 4791–4800 页,2021。

[123] Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu 等。Relax:用于大规模全模态后训练的异步强化学习引擎。arXiv 预印本 arXiv:2604.11554,2026。

[124] Shilong Zhang, Wenbo Li, Shoufa Chen, Chongjian Ge, Peize Sun, Yifu Zhang, Yi Jiang, Zehuan Yuan, Bingyue Peng, 和 Ping Luo。FlashVideo:流动保真度至细节以实现高效高分辨率视频生成。在 AAAI 人工智能会议论文集,第 12735–12743 页,2026。

[125] Yifu Zhang, Hao Yang, Yuqi Zhang, Yifei Hu, Fengda Zhu, Chuang Lin, Xiaofeng Mei, Yi Jiang, Zehuan Yuan, 和 Bingyue Peng。Waver:挥动你的方式实现逼真的视频生成。arXiv 预印本 arXiv:2508.15761,2025。

[126] Yanli Zhao, Andrew Gu, Rohan Varma, Liang Luo, Chien-Chin Huang, Min Xu, Less Wright, Hamid Shojanazeri, Myle Ott, Sam Shleifer, Alban Desmaison, Can Balioglu, Pritam Damania, Bernard Nguyen, Geeta Chauhan, Yuchen Hao, Ajit Mathews, 和 Shen Li。PyTorch FSDP:扩展完全分片数据并行的经验。VLDB 汇编,16(12):3848–3860,2023。

[127] Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, 和 Ming-Yu Liu。DiffusionNFT:具有前向过程的在线扩散强化学习。在国际学习表征会议 (ICLR) 中,2026。

[128] Lianmin Zheng, Zhuohan Li, Hao Zhang, Yonghao Zhuang, Zhifeng Chen, Yanping Huang, Yida Wang, Yuanzhong Xu, Danyang Zhuo, Eric P. Xing, Joseph E. Gonzalez, 和 Ion Stoica。Alpa:自动化分布式深度学习中的算子间和算子内并行。在第 16 届 USENIX 操作系统设计与实现研讨会中,第 559–578 页,2022。

[129] Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie, Chuyue Sun, Jeff Huang, Cody Hao Yu Yu, Shiyi Cao, Christos Kozyrakis, Ion Stoica, Joseph E. Gonzalez, Clark Barrett, 和 Ying Sheng。SGLang:结构化语言模型程序的高效执行。在神经信息处理系统进展中,第 62557–62583 页,2024。

[130] Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, 和 Abhishek Gupta。统一的世界模型:耦合视频和动作扩散以在大型机器人数据集上进行预训练。arXiv 预印本 arXiv:2504.02792,2025。

第 44 页

A 结构化描述详情

A.1 示例结构化描述

我们按数据类别各展示一个代表性描述,内容直接摘自训练数据。

图像数据的示例结构化描述。

1 { 2 "comprehensive_description": "这张图片捕捉了一座宏伟宫殿大厅的奢华内部,可能是克里姆林宫大宫殿。 ,→ 该房间以华丽的巴洛克或新古典主义风格为特征,拥有高耸的拱形天花板,天花板上装饰着复杂的金色 ,→ 图案和中央徽章。墙壁覆盖着带有金色刺绣的深红色织物,其间点缀着高大的白色凹槽柱,柱头饰有华丽的金色装饰。在大厅的尽头,一个抬高的平台上摆放着一幅历史人物的带框大幅肖像和一把红色软垫王座。地板是抛光木地板的杰作,呈现出复杂的几何 ,→ 和圆形镶嵌图案,色调各异。一盏巨大的多层水晶吊灯从左上角垂下, ,→ 为整个空间投下温暖的金光。整体氛围充满了巨大的财富、力量和历史 ,→ 意义,对称的构图强调了房间的规模和建筑细节。", 3 "camera_info": { 4 "color": "暖色", 5 "frame_size": "极广角", 6 "shot_type_angle": "低角度", 7 "lens_size": "广角", 8 "composition": "平衡", 9 "lighting": "硬光", 10 "lighting_type": "人造光" 11 }, 12 "world_knowledge": [], 13 "prominent_elements": [ 14 { 15 "name": "拱形天花板", 16 "description": "一个高耸的拱形天花板,饰有复杂的金色徽章图案和精细雕刻。", 17 "location": "横跨画面上半部分", 18 "relative_size": "主导", 19 "shape_and_color": "拱形;金色和奶油色", 20 "texture": "雕刻和金属质感", 21 "appearance_details": "具有中央大徽章和辐射状的小圆形图案。", 22 "relationship": "构成了整个场景的上边界。", 23 "orientation": "拱形", 24 "pose": "", 25 "expression": "", 26 "clothing": "", 27 "gender": "", 28 "skin_tone_and_texture": "" 29 }, 30 { 31 "name": "红色墙板", 32 "description": "覆盖着带有金色刺绣的深红色织物的墙壁大片区域。", 33 "location": "横跨中间和背景墙壁", 34 "relative_size": "主导", 35 "shape_and_color": "矩形;深红色和金色", 36 "texture": "织物和金属刺绣", 37 "appearance_details": "织物装饰有重复的金色花卉和纹章图案。", 38 "relationship": "为柱子和王座区域提供了主要背景。", 39 "orientation": "垂直", 40 "pose": "", 41 "expression": "", 42 "clothing": "", 43 "gender": "", 44 "skin_tone_and_texture": "", 45 "is_cluster": true, 46 "number_of_objects": "多个" 47 }, 48 { 49 "name": "凹槽柱", 50 "description": "带有垂直凹槽和华丽金色柱头的高大白色柱子。", 51 "location": "分布在墙壁和尽头", 52 "relative_size": "大", 53 "shape_and_color": "圆柱形;白色和金色", 54 "texture": "光滑和金属质感", 55 "appearance_details": "柱头装饰华丽,饰有金箔和古典图案。", 56 "relationship": "它们支撑着上部建筑元素并框住王座区域。", 57 "orientation": "直立", 58 "pose": "", 59 "expression": "", 60 "clothing": "", 61 "gender": "",

44

第 45 页

62 "skin_tone_and_texture": "", 63 "is_cluster": true, 64 "number_of_objects": "many" 65 }, 66 { 67 "name": "parquet floor", 68 "description": "A highly polished wooden floor with intricate geometric and circular inlaid patterns.", 69 "location": "spanning the bottom half of the frame", 70 "relative_size": "dominant", 71 "shape_and_color": "flat; various shades of brown and tan", 72 "texture": "smooth and glossy", 73 "appearance_details": "Features complex interlocking geometric shapes and circular medallions.", 74 "relationship": "Reflects the light from the chandelier and the colors of the walls.", 75 "orientation": "horizontal", 76 "pose": "", 77 "expression": "", 78 "clothing": "", 79 "gender": "", 80 "skin_tone_and_texture": "" 81 }, 82 { 83 "name": "large portrait", 84 "description": "A framed painting depicting a historical figure, likely a monarch.", 85 "location": "center background, above the throne", 86 "relative_size": "medium", 87 "shape_and_color": "rectangular; dark tones with gold frame", 88 "texture": "matte", 89 "appearance_details": "The figure is dressed in elaborate historical attire and is seated.", 90 "relationship": "Positioned as the focal point of the room’s back wall.", 91 "orientation": "upright", 92 "pose": "", 93 "expression": "", 94 "clothing": "", 95 "gender": "", 96 "skin_tone_and_texture": "" 97 }, 98 { 99 "name": "ornate throne", 100 "description": "A single, high-backed chair upholstered in red fabric with gold trim.", 101 "location": "center background, on a raised platform", 102 "relative_size": "small", 103 "shape_and_color": "rectangular; red and gold", 104 "texture": "fabric and metallic", 105 "appearance_details": "Features a high back and gold-colored armrests and legs.", 106 "relationship": "Sits on a small red-carpeted dais in front of the portrait.", 107 "orientation": "upright", 108 "pose": "", 109 "expression": "", 110 "clothing": "", 111 "gender": "", 112 "skin_tone_and_texture": "" 113 }, 114 { 115 "name": "crystal chandelier", 116 "description": "A large, multi-tiered chandelier with numerous light sources.", 117 "location": "top-left corner", 118 "relative_size": "medium", 119 "shape_and_color": "complex; gold and clear", 120 "texture": "metallic and glass", 121 "appearance_details": "Features multiple arms and hanging crystal elements.", 122 "relationship": "Hangs from the ceiling and provides the main light source for the left side of the room.", 123 "orientation": "hanging", 124 "pose": "", 125 "expression": "", 126 "clothing": "", 127 "gender": "", 128 "skin_tone_and_texture": "" 129 } 130 ] 131 }

视频数据的结构化描述示例。

1 { 2 "comprehensive_description": {

45

第 46 页

3 "scene_content_description": "视频捕捉了一个户外烹饪场景,几个肉卷正在一个大型黑色圆形金属烤盘上准备。烤盘置于明火之上,底部可见火焰和发红的余烬。肉卷由薄切的红肉片制成,内填绿色香草和橙色胡萝卜块,并用木制牙签固定。在整个视频中,白色烟雾从热表面升起。一个人的手不时从右上角进入画面,将额外的肉卷放到烤盘上。背景柔和模糊,显示出一些绿色植物和木质结构的迹象,暗示这是一个花园或后院环境。光线明亮自然,营造出温暖而质朴的氛围。", 4 "camera_movement_description": "摄像机在整个视频中保持静止,维持着对烤盘和烹饪过程的稳定、平视特写镜头。" 5 }, 6 "camera_info": { 7 "color": "饱和", 8 "frame_size": "宽幅", 9 "shot_type_angle": "高角度", 10 "lens_size": "中焦", 11 "composition": "居中", 12 "lighting": "硬光", 13 "lighting_type": "日光" 14 }, 15 "world_knowledge": [], 16 "prominent_elements": [ 17 { 18 "name": "肉卷", 19 "description": "几个由薄红肉片制成的圆柱形卷,内填绿色香草和橙色胡萝卜块,并用木制牙签固定。", 20 "actions": [ 21 { 22 "timestamp": "[0.0s – 7.1s]", 23 "action": "肉卷被放置在烤盘上,烹饪时发出滋滋声,并升起烟雾。" 24 } 25 ], 26 "location": "烤盘上的画面中心", 27 "relative_size": "大", 28 "shape_and_color": "红色、绿色和橙色的圆柱形", 29 "texture": "肉质且湿润", 30 "appearance_details": "可见牙签以及欧芹和胡萝卜等馅料成分。", 31 "relationship": "放置在黑色烤盘上进行烹饪。", 32 "orientation": "水平", 33 "pose": "", 34 "expression": "", 35 "clothing": "", 36 "gender": "", 37 "skin_tone_and_texture": "", 38 "is_cluster": true, 39 "number_of_objects": "几个" 40 }, 41 { 42 "name": "黑色烤盘", 43 "description": "一个大型圆形平面金属烹饪表面,具有略微粗糙的哑光黑色饰面。", 44 "actions": [ 45 { 46 "timestamp": "[0.0s – 7.1s]", 47 "action": "" 48 } 49 ], 50 "location": "占据画面下部和中部的大部分区域", 51 "relative_size": "主导", 52 "shape_and_color": "圆形且黑色", 53 "texture": "哑光且略微粗糙", 54 "appearance_details": "显示出烹饪产生的热量和油脂痕迹。", 55 "relationship": "作为肉卷的烹饪表面。", 56 "orientation": "水平", 57 "pose": "", 58 "expression": "", 59 "clothing": "", 60 "gender": "", 61 "skin_tone_and_texture": "" 62 }, 63 { 64 "name": "人的手", 65 "description": "一只不时出现以在烤盘上放置肉卷的人手。", 66 "actions": [ 67 { 68 "timestamp": "[0.0s – 0.67s]", 69 "action": "从右上角进入并放置一个肉卷。" 70 }, 71 { 72 "timestamp": "[2.67s – 3.67s]", 73 "action": "从右上角进入并放置一个肉卷。"

46

第 47 页

74 }, 75 { 76 "timestamp": "[5.33s – 6.0s]", 77 "action": "从右上角进入并放置一卷物品。" 78 } 79 ], 80 "location": "画面右上角", 81 "relative_size": "中等", 82 "shape_and_color": "肤色手掌", 83 "texture": "光滑皮肤", 84 "appearance_details": "仅可见手掌和部分前臂。", 85 "relationship": "与肉卷和煎锅相互作用。", 86 "orientation": "向下伸展", 87 "pose": "伸展并抓取", 88 "expression": "", 89 "clothing": "", 90 "gender": "男性", 91 "skin_tone_and_texture": "浅色皮肤" 92 }, 93 { 94 "name": "烟雾", 95 "description": "从热煎锅升起的缕缕白烟和灰烟。", 96 "actions": [ 97 { 98 "timestamp": "[0.0s – 7.1s]", 99 "action": "持续上升并向画面左侧飘动。" 100 } 101 ], 102 "location": "画面上方左侧和中心", 103 "relative_size": "中等", 104 "shape_and_color": "无定形,白色/灰色", 105 "texture": "缕状且半透明", 106 "appearance_details": "细长的上升烟柱。", 107 "relationship": "由煎锅的热量和烹饪中的肉类产生。", 108 "orientation": "向上升起", 109 "pose": "", 110 "expression": "", 111 "clothing": "", 112 "gender": "", 113 "skin_tone_and_texture": "" 114 } 115 ] 116 }

VLA 数据的结构化字幕示例。

1 { 2 "comprehensive_description": { 3 "scene_content_description": "视频以第一人称视角展示了一个机器人工作空间,可能是一个模拟的杂货店 ,→ 或自动分拣站。前景中放置着一辆带有红色手柄的金属丝网购物车,车内装有一个印有红色文字的透明塑料袋。购物车后方是一个木制展示架,分为几个隔间,整齐地陈列着各种色彩鲜艳的人造农产品。物品包括黄甜椒、紫茄子、红南瓜、白蘑菇、褐土豆、绿黄瓜、黄玉米、红番茄和红辣椒。画面中可见两个机械臂。左侧机械臂具有灰色机身和黑色两指夹爪,在整个视频中完全静止在左上角。右侧机械臂具有白色机身和黑色两指夹爪,是活跃的主体。它起初握着一根绿黄瓜,向下移动将黄瓜定位在购物车内塑料袋的上方,然后张开夹爪将黄瓜释放到袋中。放下物品后,右侧机械臂向上并向右轻微回缩,回到展示架上方的较高位置。 ,→光线明亮且均匀,突出了人造蔬菜的鲜艳色彩。", 4 "camera_movement_description": "摄像机在整个视频中保持完全静止,维持固定的、略微俯视的视角,俯瞰购物车和展示架。" 5 }, 6 "camera_info": { 7 "color": "饱和", 8 "frame_size": "广角", 9 "shot_type_angle": "高角度", 10 "lens_size": "超广角 / 鱼眼", 11 "composition": "平衡", 12 "lighting": "硬光", 13 "lighting_type": "人造光" 14 }, 15 "world_knowledge": [], 16 "prominent_elements": [ 17 { 18 "name": "右侧机械臂",

47

第 48 页

19 "description": "一个具有白色圆柱形机身和黑色双指夹爪机构的机械臂。", 20 "actions": [ 21 { 23 "timestamp": "[0.0s – 1.5s]", 24 "action": "向下移动并抓取一根绿色黄瓜。" 25 }, 26 { 27 "timestamp": "[1.5s – 5.5s]", 28 "action": "张开夹爪以释放黄瓜。" 29 }, 30 { 31 "timestamp": "[5.5s – 7.2s]", 32 "action": "向上并向右移动。" 33 } 34 ], 35 "location": "从右上角开始,移动至下部中心,然后返回右上角。", 36 "relative_size": "大", 37 "shape_and_color": "圆柱形和棱角分明,白色和黑色。", 38 "texture": "光滑,金属和塑料材质。", 39 "appearance_details": "具有关节、电缆和独特的双指夹爪。", 40 "relationship": "与绿色黄瓜互动,并在购物车上方移动。", 41 "orientation": "初始时向下倾斜,然后向上收回。", 42 "pose": "", 43 "expression": "", 44 "clothing": "", 45 "is_cluster": false, 46 "number_of_objects": "" 47 }, 48 { 49 "name": "左侧机械臂", 50 "description": "一个具有灰色矩形机身和黑色双指夹爪机构的机械臂。", 51 "actions": [ 52 { 53 "timestamp": "[0.0s – 7.2s]", 54 "action": "保持静止。" 55 } 56 ], 57 "location": "画面的左上角。", 58 "relative_size": "大", 59 "shape_and_color": "棱角分明,灰色和黑色。", 60 "texture": "光滑,金属和塑料材质。", 61 "appearance_details": "具有独特的双指夹爪和可见的关节。", 62 "relationship": "位于展示架上方,处于非活动状态。", 63 "orientation": "向下倾斜。", 64 "pose": "", 65 "expression": "", 66 "clothing": "", 67 "is_cluster": false, 68 "number_of_objects": "" 69 }, 70 { 71 "name": "绿色黄瓜", 72 "description": "一根细长的绿色人造蔬菜。", 73 "actions": [ 74 { 75 "timestamp": "[0.0s – 1.5s]", 76 "action": "被右侧机械臂抓住并向下移动。" 77 }, 78 { 79 "timestamp": "[1.5s – 5.5s]", 80 "action": "向下掉落进入塑料袋。" 81 }, 82 { 83 "timestamp": "[5.5s – 7.2s]", 84 "action": "静置在塑料袋内。" 85 } 86 ], 87 "location": "起始于右侧机械臂的夹爪中,最终位于下部中心的塑料袋内。", 88 "relative_size": "小", 89 "shape_and_color": "细长,绿色。", 90 "texture": "光滑。", 91 "appearance_details": "看起来像标准的黄瓜。", 92 "relationship": "被右侧机械臂握住,然后掉入塑料袋中。", 93 "orientation": "被握住时向下倾斜,静置在袋中时呈水平状态。", 94 "pose": "", 95 "expression": "", 96 "clothing": "", 97 "is_cluster": false, 98 "number_of_objects": ""

48

第 49 页

98 }, 99 { 100 "name": "shopping cart", 101 "description": "A metal wire shopping cart with red handles.", 102 "actions": [ 103 { 104 "timestamp": "[0.0s – 7.2s]", 105 "action": "Remains stationary." 106 } 107 ], 108 "location": "Lower half of the frame.", 109 "relative_size": "dominant", 110 "shape_and_color": "Rectangular wireframe, silver and red.", 111 "texture": "Metallic.", 112 "appearance_details": "Contains a clear plastic bag with red text.", 113 "relationship": "Serves as the receptacle for the dropped cucumber.", 114 "orientation": "Horizontal.", 115 "pose": "", 116 "expression": "", 117 "clothing": "", 118 "is_cluster": false, 119 "number_of_objects": "" 120 }, 121 { 122 "name": "display shelf", 123 "description": "A wooden shelf divided into compartments, holding various artificial vegetables.", 124 "actions": [ 125 { 126 "timestamp": "[0.0s – 7.2s]", 127 "action": "Remains stationary." 128 } 129 ], 130 "location": "Upper half of the frame, behind the shopping cart.", 131 "relative_size": "dominant", 132 "shape_and_color": "Rectangular, light brown wood with colorful items.", 133 "texture": "Wood grain.", 134 "appearance_details": "Contains neatly arranged yellow peppers, purple eggplants, red pumpkins, mushrooms, potatoes, corn, ,→tomatoes, and chili peppers.", 135 "relationship": "Provides the background context and source of the items.", 136 "orientation": "Horizontal.", 137 "pose": "", 138 "expression": "", 139 "clothing": "", 140 "is_cluster": false, 141 "number_of_objects": "" 142 } 143 ] 144 }

示例结构化描述(针对第一人称视角数据)。

1 { 2 "comprehensive_description": { 3 "scene_content_description": "视频以第一人称视角展示了一个人正在修理一台机器,场景可能位于车库或车间。环境特征为混凝土地板,上面散落着少量碎屑。主要主体是一台位于画面中央的大型亮橙色割草机。割草机左侧有一个显眼的黑色后轮胎,胎面花纹深邃;右侧是黑色的发动机罩,侧面贴有蓝色的“Kohler Professional”贴纸。穿着黑色短袖衬衫的人的左臂可见,平放在画面左侧的混凝土地板上。穿着蓝色牛仔裤的人的双腿在画面底部可见。动作开始时,穿着黑色短袖衬衫的人的右臂从画面右侧进入。右手伸向割草机中心,具体目标是发动机区域附近的一根黑色电缆或电线。手抓住电缆并向上并向右拉动,以操作该部件。在整个过程中,左手保持静止在地板上,提供稳定性。", 4 "camera_movement_description": "相机固定在身体上,提供第一人称视角。相机表现出轻微、持续的平移和倾斜运动,与操作者自然的头部和身体运动相对应。镜头始终保持对机器和人物手部的特写。" 5 }, 6 "camera_info": { 7 "color": "Saturated", 8 "frame_size": "Medium", 9 "shot_type_angle": "High angle", 10 "lens_size": "Ultra Wide / Fisheye", 11 "composition": "Center", 12 "lighting": "Hard light", 13 "lighting_type": "Daylight"

49

第 50 页

14 }, 15 "world_knowledge": [], 16 "prominent_elements": [ 17 { 18 "name": "right hand", 19 "description": "一只人类右手和前臂,穿着黑色短袖衬衫。", 20 "actions": [ 21 { 22 "timestamp": "[0.0s – 2.0s]", 23 "action": "" 24 }, 25 { 26 "timestamp": "[2.0s – 5.0s]", 27 "action": "从右侧进入画面,伸向中心,抓住一根黑色电缆,并将其向上和向右拉动。" 28 } 29 ], 30 "location": "从画面右边缘向画面右侧中心移动。", 31 "relative_size": "中等", 32 "shape_and_color": "手臂形状,肤色,黑色袖子。", 33 "texture": "光滑皮肤,织物纹理。", 34 "appearance_details": "穿着黑色短袖衬衫。", 35 "relationship": "与割草机上的黑色电缆相互作用。", 36 "orientation": "向前伸展并略微向下。", 37 "pose": "", 38 "expression": "", 39 "clothing": "黑色短袖衬衫。", 40 "is_cluster": false, 41 "number_of_objects": "" 42 }, 43 { 44 "name": "left hand", 45 "description": "一只人类左手和前臂,穿着黑色短袖衬衫,平放在地面上。", 46 "actions": [ 47 { 48 "timestamp": "[0.0s – 5.0s]", 49 "action": "保持静止在地板上。" 50 } 51 ], 52 "location": "画面左下角。", 53 "relative_size": "中等", 54 "shape_and_color": "手部形状,肤色,黑色袖子。", 55 "texture": "光滑皮肤,织物纹理。", 56 "appearance_details": "穿着黑色短袖衬衫,可见一枚戒指戴在手指上。", 57 "relationship": " resting on the concrete floor, providing stability for the person.", 58 "orientation": "平坦,水平。", 59 "pose": "", 60 "expression": "", 61 "clothing": "黑色短袖衬衫。", 62 "is_cluster": false, 63 "number_of_objects": "" 64 }, 65 { 66 "name": "lawnmower", 67 "description": "一件大型户外机械,主要为橙色,带有黑色部件。", 68 "actions": [ 69 { 70 "timestamp": "[0.0s – 5.0s]", 71 "action": "保持静止。" 72 } 73 ], 74 "location": "占据画面的中心和右侧部分。", 75 "relative_size": "主导", 76 "shape_and_color": "复杂的机械形状,主要为亮橙色和黑色。", 77 "texture": "光滑涂漆金属,橡胶轮胎。", 78 "appearance_details": "具有一个带有深花纹的大型黑色后轮胎,一个黑色发动机罩,以及一个蓝色的“Kohler Professional”贴纸。", 79 "relationship": "右手正在操作的物体。", 80 "orientation": "直立。", 81 "pose": "", 82 "expression": "", 83 "clothing": "", 84 "is_cluster": false, 85 "number_of_objects": "" 86 }, 87 { 88 "name": "black cable", 89 "description": "一根连接到割草机上的细柔性黑色电线或电缆。", 90 "actions": [ 91 {

50

第 51 页

92 "timestamp": "[0.0s – 2.0s]", 93 "action": "保持静止。" 94 }, 95 { 96 "timestamp": "[2.0s – 5.0s]", 97 "action": "被右手抓住并向上并向右拉动。" 98 } 99 ], 100 "location": "画面中心,靠近割草机的发动机区域。", 101 "relative_size": "小", 102 "shape_and_color": "细长、线性、黑色。", 103 "texture": "光滑、柔韧。", 104 "appearance_details": "看起来像是一根控制电缆或电线。", 105 "relationship": "连接到割草机,由右手操作。", 106 "orientation": "弯曲,从发动机区域延伸出来。", 107 "pose": "", 108 "expression": "", 109 "clothing": "", 110 "is_cluster": false, 111 "number_of_objects": "" 112 } 113 ] 114 }

51

发表评论