Chimera:混合注意力+Chinchilla缩放,视觉扩散模型的长序列高效生成之道

快速导读:提出Chimera,一个为长序列视觉生成设计的混合线性-全局注意力扩散骨干网络,并配套HeteroP超参数迁移方案和Chinchilla缩放定律。

Chimera是一个为长序列视觉生成设计的混合线性-全局注意力扩散骨干网络,同时配套HeteroP超参数迁移方案和Chinchilla风格的算力最优缩放定律。该工作直面视觉生成进入token密集型时代后的核心矛盾:全注意力机制的计算成本随序列长度平方增长,而语言模型中已有的稀疏注意力、压缩KV表示等方案无法直接迁移到需要保留时空局部性和多模态双向交互的视觉扩散模型中。

Chimera采用单流架构统一处理文本、图像和视频token,核心创新在于将KDA线性注意力与MLA全局注意力混合使用,并设计模态感知短卷积(mShortConv)在单一扫描模式下捕获局部时空结构,从而实现了无位置编码(NoPE)设计。在缩放方面,HeteroP根据张量的功能扇入和模型深度为每个参数组推导独立的缩放比例,实现了跨宽度和深度的稳定超参数迁移。基于此,作者为图像和视频预训练分别拟合了算力最优缩放定律,并首次将图像-视频数据配比作为显式缩放变量进行分析。

英文题目:Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

论文出处:arXiv 每日论文精选 · arXiv:2607.28611

原始论文:PDF / 论文页面

对应视频标题:Chimera:混合注意力+Chinchilla缩放,视觉扩散模型的长序列高效生成之道|推荐指数:★★★★★

这篇论文解决什么问题?

视觉生成模型正快速进入token密集型时代。高分辨率图像和长视频生成需要处理数万甚至数十万token的序列,而标准的多头注意力(MHA)机制计算复杂度为O(N²),内存占用随序列长度急剧增长。这使得大规模训练和长序列推理变得极其昂贵。

语言模型领域已经通过稀疏注意力、压缩KV表示、混合专家(MoE)和Chinchilla缩放定律等方法有效应对了类似挑战。然而,这些方案无法直接迁移到视觉扩散模型。原因在于:视觉生成需要保留精确的时空局部性,扩散模型的多模态双向交互要求注意力机制能够同时处理文本和视觉token,且生成任务对位置信息的依赖方式与语言建模不同。

此外,视觉扩散模型领域长期缺乏系统性的缩放框架。研究者通常依赖经验规则或从语言模型借用的缩放策略来分配模型大小、训练token和数据配比,缺乏对算力最优分配的定量指导。这导致资源分配可能远非最优,大量算力被浪费在次优的模型配置上。

核心创新

  • 提出Chimera混合视觉扩散骨干网络,结合KDA线性注意力、MLA全局注意力和模态感知短卷积,实现无位置编码(NoPE)的高效长序列建模。
  • 设计模态感知短卷积(mShortConv),在单一扫描模式下为不同模态提供局部时空归纳偏置,替代RoPE的位置选择、近因衰减和多维编码功能。
  • 提出HeteroP,首个针对异构视觉扩散骨干网络的模块级超参数迁移参数化方案,实现跨模型宽度和深度的稳定超参数迁移。
  • 为视觉扩散预训练拟合Chinchilla风格的算力最优缩放定律,并首次将图像-视频数据配比作为显式缩放变量进行分析。

方法概览

Chimera采用单流架构统一处理文本、图像和视频token。核心模块包括:1) 混合注意力机制,结合KDA线性注意力和MLA全局注意力;2) 模态感知短卷积,在单一扫描模式下捕获局部时空结构,实现无位置编码(NoPE)设计;3) 稀疏MoE层扩展容量;4) 恒等超连接(iHC)和夹心归一化保证训练稳定性。缩放方面,提出HeteroP,根据张量的功能扇入和模型深度为每个参数组推导独立的缩放比例,实现跨宽度和深度的超参数迁移,并基于此拟合Chinchilla风格的算力最优缩放定律。

  • 混合注意力机制:Chimera在每个Transformer块中交替使用KDA线性注意力和MLA全局注意力。KDA(Kimi Delta Attention)是一种具有内容自适应状态衰减的线性注意力机制,计算复杂度为O(N),能够高效跟踪长序列状态。MLA(Multi-head Latent Attention)通过低秩键值对压缩减少KV缓存,作为周期性全局注意力层提供跨序列的全局交互。这种3:1的KDA/MLA混合比例在效率和建模能力之间取得了平衡。
  • 模态感知短卷积(mShortConv):在每次KDA更新之前,mShortConv在单一扫描模式下为不同模态捕获局部时空依赖性。对于图像,它建模2D空间邻域;对于视频,它同时捕获空间和时间维度的局部结构。这一设计替代了RoPE的位置选择、近因衰减和多维编码三大功能,使得Chimera能够完全移除位置编码(NoPE)。
  • 无位置编码(NoPE)设计:Chimera通过扫描顺序提供序列位置信息,通过KDA的内容自适应状态衰减实现近因偏置,通过mShortConv提供局部时空归纳偏置。NoPE设计的关键优势在于:模型不受训练时位置编码范围的限制,天然支持零样本长度外推。
  • 稀疏MoE层:Chimera在每隔一个块中引入稀疏MoE前馈网络,通过辅助损失自由的负载均衡策略(auxiliary-loss-free balancing)保持专家利用率均衡。这在不显著增加计算量的前提下扩展了模型容量。
  • 恒等超连接(iHC)和夹心归一化:iHC将残差流转换矩阵固定为恒等矩阵,配合预归一化和后归一化的夹心式RMSNorm,保证了深层训练的信号传播稳定性。
  • HeteroP超参数迁移方案:HeteroP根据每个参数组的功能扇入(fan-in)和模型深度,为不同模块(如MLA的KV压缩秩、KDA的头宽度、MoE的专家宽度等)推导独立的缩放比例。这使得从代理模型到目标模型的超参数(尤其是学习率)迁移保持稳定,无需针对每个模型规模重新调参。
  • Chinchilla缩放定律拟合:基于HeteroP实现的稳定超参数迁移,作者训练了多个不同规模的Chimera模型,通过IsoFLOP分析和损失包络方法拟合了算力最优缩放定律。图像预训练的缩放定律显示N_opt ∝ C^0.48~0.52,D_opt ∝ C^0.48~0.51,表明算力应近乎均匀分配给模型大小和训练token。视频预训练的缩放定律显示N_opt ∝ C^0.53~0.56,在高算力预算下略微偏向增大模型容量。
  • 图像-视频数据配比分析:作者首次将数据配比作为显式缩放变量,在多个算力预算下拟合了IsoFLOP曲面。结果显示,图像损失最优的配比从约4:1缓慢漂移至3:1,而视频损失最优配比始终保持在1:1(即最偏向视频的配比)。

逐图理解论文

失败案例与直觉

失败案例与直觉
Figure 16 Zero-shot video-length extrapolation beyond the 5-second training horizon. We generate videos of 5–30 seconds without length-specific finetuning and evaluate only the final 5 seconds of every video. KDA denotes our Chimera model. Panels (a) and (c) report absolute FID and FVD, while panels (b) and (d) report the percentage change relative to each model’s own 5-second result. Evaluation uses 512 videos per model and duration, with 512×81 tail frames for FID and 512 tail clips for FVD. Lower is better, and a positive relative change denotes degradation.

图16展示了零样本视频长度外推结果。Chimera的FID和FVD随视频长度增长仅轻微退化,而Wan2.1和HunyuanVideo-1.5在超过训练长度后质量急剧下降。这验证了NoPE设计在长度外推上的优势。

核心区分与研究空白

核心区分与研究空白
Figure 2 Illustration of the Chimera architecture. Chimera is a single-stream latent diffusion Transformer in which text tokens and noised visual tokens are concatenated into a unified sequence and processed jointly. Each block combines a sparse Mixture-of-Experts feed-forward network with either a KDA layer or a MLA layer. Before each KDA update, a modality-aware short convolution (mShortConv) mixes local context in each modality’s native geometry. Timestep information is injected through AdaLN modulation. Each block applies sandwich-style RMSNorm (pre- and post-normalization), while identity hyper-connections (iHC) wrap each sublayer to stabilize signal propagation.

图2详细展示了Chimera的单流架构:文本token和噪声视觉token拼接为统一序列,每个块交替使用KDA或MLA注意力,配合稀疏MoE前馈网络。注意KDA前的模态感知短卷积(mShortConv)和夹心式RMSNorm、恒等超连接(iHC)的设计细节。

核心结论

核心结论
Figure 12 Compute efficiency under matched training conditions. We calculate the compute ef- ficiency across 2B instantiations of Wan2.1, Z-Image, Chimera-dense, and the complete Chimera configuration trained with the deterministic dataloader and a compute budget of 5 × 1020 FLOPs.

图12展示了匹配算力下的预训练损失曲线对比。Chimera的曲线始终低于所有基线,在损失0.149处,完整Chimera相比Wan2.1实现了6.8倍的计算效率提升。注意Chimera-dense(不含MoE)已比Wan2.1高效1.7倍,说明混合注意力架构本身贡献显著。

实验如何设计?

  • HeteroP迁移稳定性验证:在宽度0.25×到2.75×(20M到1.12B激活参数)和深度4到32层的范围内,测试HeteroP与标准参数化(SP)的学习率迁移稳定性。
  • 算力最优缩放定律拟合:训练多个不同规模的Chimera模型,通过IsoFLOP分析和损失包络方法分别拟合图像(256²分辨率)和视频(180p分辨率)预训练的缩放定律。
  • 预训练计算效率对比:在匹配算力(5×10²⁰ FLOPs)和确定性数据加载器下,对比Chimera与Wan2.1、Z-Image等基线模型的预训练损失下降曲线。
  • 零样本视频长度外推:在5秒视频上训练,直接生成5至30秒的视频,评估尾部5秒的FID和FVD,对比Wan2.1和HunyuanVideo-1.5。
  • 长序列内存和延迟基准测试:对比3:1 KDA/MLA骨干与MHA/MLA骨干在不同序列长度下的内存占用和推理延迟。
  • 文本到图像生成质量评估:在GenEval和DPG-Bench基准上评估Chimera(仅600 H100天训练)的生成质量,与FLUX.1-dev、Z-Image-Turbo等模型对比。

关键结果与论文证据

  • 预训练计算效率:在相同训练损失0.149下,完整Chimera配置达到该损失的算力为6.27×10¹⁹ FLOPs,相比Wan2.1(4.29×10²⁰ FLOPs)计算效率提升6.8倍(第23页)。
  • 消融分析:Chimera-dense(不含MoE和HeteroP)达到相同损失需2.55×10²⁰ FLOPs,仍比Wan2.1高效1.7倍,表明混合注意力架构本身已带来显著效率提升(第23页)。
  • 视频长度外推:从5秒外推至30秒,Chimera的FID仅从77.1增至82.1(相对退化6.5%),而Wan2.1和HunyuanVideo-1.5分别退化50.5%和53.6%(第24页)。
  • 长序列效率:在255k token序列下,KDA/MLA骨干比MHA/MLA骨干快2.14倍,且支持超过1.68倍的最大序列长度(第27页)。
  • 图像缩放定律:N_opt ∝ C^0.48~0.52,D_opt ∝ C^0.48~0.51,算力应近乎均匀分配给模型大小和训练token(第20页)。
  • 视频缩放定律:N_opt ∝ C^0.53~0.56,在高算力预算下略微偏向增大模型容量(第20页)。
  • 数据配比:图像损失最优的图像:视频比例从约4:1缓慢漂移至3:1(指数-0.08),视频损失最优比例始终为1:1(第22页)。
  • GenEval基准:Chimera(仅600 H100天训练)总分为0.68,与FLUX.1-dev(0.67)相当,超过Z-Image-Turbo(0.65)(第28页)。

阅读时需要注意

  • 缩放定律拟合基于预训练扩散损失,未直接关联下游生成质量指标(如FID、人工偏好),算力最优配置可能不直接对应最优生成质量。
  • HeteroP的模块级规则依赖于对架构中每个张量功能角色的精确识别,迁移到新架构时需要额外的分析和适配工作。
  • 算力最优数据配比分析仅在有限的图像-视频比例范围内进行,极端比例下的行为未知。
  • 模型评估主要在学术基准上进行,未涉及商业级产品对比或大规模用户研究。
  • 零样本视频长度外推能力依赖于NoPE设计和因果卷积,可能不适用于所有类型的视频内容或运动模式。

关联工作

  • DiT(Peebles & Xie, 2023):Chimera沿用了扩散Transformer框架和AdaLN条件注入,但将全注意力替换为混合线性-全局注意力。
  • Wan2.1(Wang et al., 2025):作为主要基线模型,Chimera在匹配算力下实现了显著更高的预训练计算效率。
  • KDA(Liu et al., 2025):Chimera直接采用KDA作为核心线性注意力机制,实现O(N)复杂度的长序列状态跟踪。
  • MLA(Liu et al., 2024):采用MLA作为周期性全局注意力层,通过压缩KV表示降低缓存成本。
  • Chinchilla Scaling Laws(Hoffmann et al., 2022):借鉴其方法论为视觉扩散模型拟合算力最优缩放定律。
  • μP/CompleteP(Yang et al., 2022 / Everett et al., 2024):HeteroP基于其宽度/深度超参数迁移原理,扩展至异构多模块视觉骨干网络。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Chimera:混合视觉扩散Transformer的设计与Chinchilla缩放 Chongjian Ge∗§†, Hanwen Jiang∗§, Tianyu Wang∗§, Jiuxiang Gu§, Yiran Xu§, Ziwen Chen§, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan†

Adobe Research ∗同等贡献,§核心贡献,†项目负责人

视觉生成正进入token密集型时代:高分辨率图像、长视频和多模态上下文使得扩散Transformer中全注意力的二次方成本愈发难以承受。语言模型经历了类似的转变,但为其开发的解决方案无法直接迁移到视觉扩散模型,后者必须保留时空局部性并支持跨模态的双向交互。我们提出了Chimera,一种与原则性缩放方案协同设计的混合视觉扩散骨干网络。Chimera通过三种互补机制在单一流中处理文本、图像和视频token:Kimi Delta Attention (KDA)以高效的O(N)计算复杂度提供长上下文状态追踪,交错的Multi-head Latent Attention (MLA)实现直接的全局交互,模态感知短卷积捕获局部时空上下文。这些组件共同支持处理统一的光栅顺序token序列,无需位置编码。稀疏Mixture-of-Experts (MoE)层进一步扩展模型容量,同时控制激活计算量。为缩放这种异构架构,我们引入了HeteroP,一种模块级缩放方案,根据每个张量的功能扇入和模型深度跨宽度和深度迁移超参数。HeteroP使我们能够针对激活模型大小、训练token数量以及图像-视频数据比例拟合Chinchilla风格的计算最优法则。在这些法则的指导下,我们训练了一个110亿参数的Chimera模型,激活参数为20亿。实验得出三个主要发现。首先,通过预训练扩散损失衡量,我们的密集骨干网络实现了匹配的全注意力Wan-2.1(20亿)基线1.7倍的计算效率,而完整系统将此系数提升至7.3倍。其次,无需针对特定长度微调,Chimera展现出从5秒训练片段到30秒视频的零样本长度外推能力,最后五秒的FID仅下降6.5%。第三,拟合的缩放法则表明,计算最优的图像预训练在激活模型大小和训练token数量之间几乎均等分配计算资源,而视频预训练在较高计算预算下略微偏向模型大小。我们希望这些发现能为设计和缩放高效的长上下文扩散架构提供原则性基础。

日期:2026年7月25日

1 引言

视觉生成正成为一个长序列问题。一张以16×16分块的4096×4096图像已包含约65K个视觉token,而视频、密集条件及多轮交互进一步增加了序列长度[7, 63, 67]。我们将此称为token密集型时代,其中序列长度成为内存、延迟和训练成本的主要决定因素。然而,该领域的进展受到两个相互关联的差距制约。架构上,主流的扩散Transformer仍依赖全自注意力[63],其成对交互随序列长度呈二次方扩展[81]。方法论上,视觉生成缺乏一个系统性的框架来缩放此类架构:模型和优化方案通常针对特定规模设计,缺乏受控的模型家族来建立缩放法则,以指导扩散预训练性能如何依赖于模型大小、token预算和数据构成[50, 103]。

语言模型更早进入这一时代,并在两方面提供了有用的先例。架构上,语言模型已日益从密集注意力[81]转向稀疏注意力[14, 54, 97]、压缩键值表示[1, 52, 69]、循环或线性序列算子[29, 45, 47, 75, 94]以及稀疏激活容量[17, 25, 48]。方法论上,跨模型规模的超参数迁移[18, 93]和计算最优

1

第 2 页

模型家族 扩散架构 Chinchilla缩放

文本 稀疏MoE

. A · 代理调优 B · HeteroP迁移 MLA . 图像 . 稀疏MoE C · 扫描 D · 缩放法则 统一 KDA 模型规模 流 视频 模态感知 短卷积 小 → 大 含MoE的混合模型 在算力预算下拟合损失包络

最小 – 22M·59M 单流 NoPE 多模态 最大 – 4.02B·19.31B 模型大小 训练token数 图像–视频比例

A1A1 ·· 架构架构 A2 · 架构 S1 · 缩放 S2 · 缩放 改进的预训练计算效率 更低的峰值内存与延迟 跨规模超参数迁移 可预测的损失–算力前沿

图1 Chimera架构与缩放框架概览。Chimera将混合线性全局扩散架构(左上)与Chinchilla风格的缩放方法论(右上)相结合。下方面板展示了两方面贡献:架构提升了预训练计算效率(A1)和长序列内存/延迟效率(A2),而缩放框架实现了可靠的跨规模超参数迁移(S1),并产生了可预测的损失–算力前沿(S2)。

将模型容量、数据和训练算力关联起来的缩放法则[36, 44],已将模型缩放转变为系统化且日益可预测的过程。

然而,语言模型方案的这两个组成部分都无法直接迁移到视觉扩散训练中。在架构方面,视觉扩散必须保留二维和三维网格上的局部结构,支持异构的文本、图像和视频上下文之间的直接交互,并在去噪目标下保持有效性[8, 33, 35, 43]。在缩放方面,混合视觉骨干网络包含的张量,其功能输入维度随着名义模型宽度的增加而以不同方式增长,甚至完全不增长,因此基于单一全局缩放比的标准规则无法保持可比的优化动态[18, 93]。此外,视觉训练算力不仅取决于token数量,还取决于数据组成。因此,挑战是双重的且相互耦合的:设计一个针对视觉数据结构的高效上下文建模架构,并开发一个系统化框架来缩放它并推导其缩放法则。

我们提出Chimera,一个与原则性缩放框架协同设计的视觉扩散骨干网络,用于token密集型生成。如图1所示,Chimera将文本、图像和视频表示为统一的token序列进行建模。在序列尺度上,大多数层使用KDA (Kimi Delta Attention)[47]作为线性复杂度机制,用于内容自适应的长程状态追踪,而周期性的MLA (Multi-head Latent Attention)层[52]则通过压缩的键值表示提供直接的全局token间交互。在局部尺度上,我们提出模态感知短卷积,在每次KDA状态更新之前,沿每种模态的原生轴聚合邻域信息。因此,KDA将局部增强的特征(而非来自扁平化序列的孤立token)写入其循环状态。卷积提供的局部相对偏移线索,连同KDA因果循环中固有的顺序,使得简单的时间优先光栅扫描足够有效,并允许我们省去显式的位置编码。正交地,Chimera结合了稀疏MoE (Mixture-of-Experts)、恒等超连接(iHC)和夹心归一化,以在受控的激活计算量和稳定的信号传播下获得更大的容量。

在训练方面,为解决异构架构中超参数跨规模迁移的挑战[18, 93],我们引入了HeteroP,一种超参数迁移参数化方案,它根据每个张量的功能扇入和模型深度,为其推导出单独的缩放比。HeteroP将这些逐张量的比率转化为针对学习率、初始化和残差缩放的模块特定迁移规则,使得在小代理模型上调优的方案能够跨模型宽度和深度进行迁移。这些规则共同产生了一个持续优化且相互可比的Chimera模型家族(总参数量从59M到19.3B),无需逐规模重新调优。这

第 3 页

受控模型族支持在激活参数量和视觉训练token上拟合Chinchilla风格的计算最优缩放定律[36]。我们进一步将这些定律扩展,将图像-视频数据混合比例作为显式缩放变量,捕捉计算最优分配如何依赖于模态组成。

通过三种独立估计器——训练曲线包络、IsoFLOP剖面和参数化损失曲面拟合——我们的缩放定律一致表明,对于图像预训练,激活模型大小和训练token几乎平衡增长(图1-S2),满足Nopt ∝C^0.48–0.52;而视频预训练在更高计算预算下略微向模型容量倾斜,满足Nopt ∝C^0.53–0.56。在拟合的缩放定律指导下,我们在给定训练预算下训练了一个总参数量11B、激活参数量2B的Chimera模型。在匹配的训练计算量下(图1-A1),其训练损失达到全注意力Wan 2.1 (2B)基线[82]的水平,但FLOPs减少7.3倍。Chimera在GenEval和DPG-Bench基准上也能与强大的图像生成器如FLUX.1-dev和Z-Image-Turbo[8]竞争。值得注意的是,我们的最终模型仅训练约600 H100天,远少于先前方法:例如Z-Image-Turbo报告的总训练预算约为12.4K H100天,是我们的20倍。

除了指导最终模型分配,Chimera的架构在长序列生成方面带来具体优势。得益于其无位置编码设计,Chimera尽管仅在5秒片段上训练,却能生成30秒视频,无需长度特定的微调,将生成时长扩展6倍,而帧级FID仅增加6.5%,相比之下先前方法[82]增加超过50%。此外,与匹配的MHA/MLA全注意力对应架构相比,我们的KDA/MLA骨干在单个80 GB GPU(NVIDIA A100-SXM4-80GB)内支持超过1.68倍长的序列,并在255k token时运行速度快2.14倍(图1-A2)。这些结果共同支持在视觉生成中联合考虑架构与缩放。

我们的贡献有三方面。首先,我们提出Chimera,一种用于token密集型生成的混合单流视觉扩散骨干。它将文本、图像和视频表示为统一序列。我们的模型结合了KDA线性注意力与周期性基于MLA的全局注意力;使用模态感知因果短卷积支持单一光栅顺序扫描,无需位置编码;并采用MoE层、恒等超连接和夹心归一化以提升容量和训练稳定性。其次,据我们所知,我们开发了首个针对异构视觉扩散骨干的全面超参数迁移参数化方案(HeteroP)。HeteroP允许在小型代理模型上调优的优化超参数可靠地迁移到不同模型宽度和深度。第三,我们针对图像和视频预训练,在激活模型大小和视觉训练token上拟合了Chinchilla风格的计算最优缩放定律,并将分析扩展到图像-视频数据组成。

2 Chimera概述

我们旨在为token密集型视觉生成场景现代化扩散模型,特别是DiT[63]。这一目标涉及两个紧密耦合的子目标:设计平衡效率与容量的架构,以及理解其优势如何随模型大小、训练token数量及训练数据组成演变。因此,我们联合研究架构设计与缩放:架构定义受控模型族,而缩放分析确定在固定计算预算下如何分配模型大小、训练token和训练数据组成。第3节详述架构,第4节给出缩放方案。

模型架构。我们按从整体框架到单个模块的顺序总结Chimera的关键设计选择:

• 单流多模态骨干。Chimera将来自文本、图像和视频的多模态token连接为一个序列,并用单一共享骨干处理。与交叉注意力或双流设计[82, 87]不同,这种单流接口支持跨模态的直接token级交互。

1我们比较匹配的KDA/MLA和MHA/MLA 3:1骨干,激活参数量约2B,使用批量大小1、BF16激活、512个文本token和每个时间切片18×28个视觉token。对于roll-out-cache内存测试,我们在一次完整去噪器前向过程中分配、访问并保留设备上的缓存张量。FlashAttention不将完整的N×N注意力矩阵写入高带宽内存:它通过片上SRAM流式传输Q、K、V块,逐块计算QK⊤,并使用在线softmax累积精确输出。这消除了二次注意力工作空间,但未消除二次算术运算。因此,24个MHA层具有序列相关的BF16键值缓存内存O(NHdh) = O(ND),其中H和dh是注意力头的数量和宽度,D = Hdh。相比之下,24个KDA层保留H个固定大小的FP32循环状态,形状为dh×dh,需要O(Hd²h)内存,与N无关;当D表示每头状态宽度时,这是D×D状态内存项。两种变体保留相同的八个BF16 MLA潜在键值缓存。我们报告单块NVIDIA A100-SXM4-80GB上的峰值分配CUDA内存,并在首次内存不足输入时停止。对于速度,我们排除缓存构建,对MHA使用FlashAttention,并报告三次CUDA同步预热后前向的中位数。

第 4 页

无模态特定分支。它还简化了扩展:在单一token序列上共享堆栈,继承了语言模型的实践,如超参数迁移和算力最优扩展法则。

混合线性与全局注意力。 Chimera在大多数层中使用KDA [47]进行O(N)长序列计算,并周期性交错插入MLA层,通过压缩的键值状态恢复显式的全局token交互。两者共同平衡了长上下文效率与全局建模能力。与先前依赖复杂扫描模式进行视觉建模的工作[39, 56]不同,Chimera通过单一的时间优先光栅扫描应用线性注意力,实现简单且统一的多模态处理。

最小模态感知归纳偏置与无位置编码(NoPE)。 基于注意力的模型通常使用位置编码来编码token位置。然而,对于视觉数据,位置编码可能阻碍对训练长度之外的泛化,并且跨空间(图像)和时间轴(视频)分解它们需要特定的设计选择。KDA的状态追踪特性提供了一种简单的替代方案:通过细粒度的逐通道状态衰减和循环delta更新,KDA的行为类似于具有自适应窗口长度和因果结构的局部滑动窗口注意力,这消除了对位置编码的需求,正如最近的语言模型[47]中所观察到的。为了将此设计适配到多模态视觉数据,我们保留了一个最小的归纳偏置:模态感知短卷积,它充当“Canon Layer”[2]来捕获视觉token间的局部时空依赖性。因此,顺序和局部性来自扫描和卷积,整个骨干网络通过一次时间优先的光栅扫描处理多模态token,无需位置编码。

稀疏容量与训练稳定性。 在容量方面,Chimera采用稀疏MoE激活[25],在增加总参数量的同时控制每个token的计算量。在稳定性方面,它将恒等超连接[90](用于稳定残差流)与夹心归一化[22](用于调节子层输出的方差)配对使用。

预训练与Chinchilla扩展。 我们研究了Chimera在预训练期间(模型获取生成知识的阶段)的扩展方式。我们认为,扩散预训练损失应该是衡量此阶段知识获取的可靠指标,而其他与视觉相关的评估指标²最好被视为后训练指标而非预训练目标。这一视角使我们能够将视觉预训练类比于语言模型预训练,并拟合算力最优扩展法则。我们在下文概述了关键要素。

扩散损失作为预训练指标。 在固定的扩散目标和噪声参数化下,扩散损失提供了一个与采样器无关的指标,用于跨规模比较模型。与FID等下游生成指标不同,它不依赖于采样算法、无分类器引导尺度或后训练选择。此外,扩散可以被解释为频域中的近似自回归建模[20]:从高噪声水平到低噪声水平的去噪过程,预测了从粗粒度到细粒度的视觉信息,这与在逐渐变长的上下文下的下一个token预测类似。这促使其被用作比下游生成分数更可靠的预训练指标。

超参数迁移与公平扩展比较。 超参数迁移降低了目标规模下超参数搜索的成本,并帮助扩展研究中的每个模型达到接近最优的性能。我们基于µP风格的迁移[18, 93]跨模型规模进行构建,但Chimera带来了一个额外的挑战:其异构模块不共享单一的全局扩展乘数。因此,我们提出HeteroP,用从每个参数组的功能扇入导出的模块特定比率来替代这种全局比率近似,覆盖KDA、MLA、稀疏MoE、恒等超连接和扩散条件化。结果,用于拟合扩展曲线的数据点来自使用规模适当且接近最优的超参数训练的模型,这是先前扩展法则研究[36, 50, 86]中通常未明确控制的一个因素。

拟合Chinchilla扩展法则。 利用这个受控的模型家族,我们在激活模型参数量和训练token上拟合Chinchilla风格的法则,以预测在固定算力预算下它们的算力最优分配。我们还使用IsoFLOP分析来估计最优图像-视频混合比例如何随算力变化。

²FID、DPG [40]、GenEval [28]等

第 5 页

3 Chimera 架构

3.1 预备知识与训练目标

Chimera 遵循基于 v-预测和 v-损失的 rectified flow 框架 [51, 55]。每张图像或视频由一个冻结的 VAE [82] 编码,其时间、高度和宽度的压缩因子分别为 (4, 8, 8);随后的分块层将潜变量转换为干净的视觉 token z1。文本提示由冻结的 T5 风格编码器 [65] 单独编码,我们将得到的文本 token 序列记为 c。训练时,我们采样高斯噪声 z0 ∼N(0, I) 和时间步 τ,并在 z0 和 z1 之间进行线性插值,得到带噪视觉 token zτ = τz1 + (1 −τ)z0。速度目标为 vτ = dzτ/dτ = z1 −z0。我们通过以下损失训练去噪模型:

L = Eτ,z0,z1 ∥Chimera (c, zτ, τ; θ) −vτ∥22 , (1)

其中 θ 表示可训练参数,损失仅在视觉 token 位置计算。

+ 全局注意力 MoE 合并 Norm Linear + + + iHC MoE MLA E0 E1 E6 E54 E55 Norm c + Linear Norm Norm iHC 全局注意力 Top K

Linear Norm 1 x

+ 线性注意力 Linear iHC Norm Post + + 映射 iHC MoE Norm 注意力 (KDA/MLA) Norm KDA / FFN (Dense/MoE) +

Norm L2L2 映射恒等映射Pre

iHC 线性注意力 mShortConvmConv mShortConv 复制 Norm 调制 LinearLinear Linear N x

打包的多模态 Token 时间

图 2 Chimera 架构示意图。Chimera 是一个单流潜扩散 Transformer,其中文本 token 和带噪视觉 token 被拼接成一个统一序列并联合处理。每个块将一个稀疏的混合专家前馈网络与一个 KDA 层或一个 MLA 层相结合。在每次 KDA 更新之前,一个模态感知短卷积 (mShortConv) 会在每种模态的原生几何结构内混合局部上下文。时间步信息通过 AdaLN 调制注入。每个块应用三明治式 RMSNorm(前归一化和后归一化),而恒等超连接 (iHC) 包裹每个子层以稳定信号传播。

3.2 单流框架

Chimera 采用单流框架,其中文本和视觉 token 在一个共享的主干网络内直接交互。其输入序列为: x = [Ptext(c), Pvis(zτ)], (2)

其中 Ptext 和 Pvis 是映射到共享隐藏空间的可训练投影,并且在拼接之前从 c 中移除了填充 token。视觉 token 按时间优先的光栅顺序逐帧展平,每帧按行优先顺序遍历,如公式 12 所述。对于扩散时间步 τ,我们构建一个正弦嵌入

5

第 6 页

并将其投影到模型维度,得到时间步嵌入 eτ,该嵌入通过下文定义的调制通路对每个模块进行条件控制。

Chimera 由一堆 Transformer 风格的模块组成,每个模块包含一个注意力子层和一个前馈子层(FFN)。注意力算子根据周期性调度(第 3.3 节)在 KDA 或 MLA 之间切换。第一个和最后一个模块使用稠密 SwiGLU FFN [70],而所有中间模块使用稀疏 MoE FFN(第 3.5 节)。在每个 KDA 更新之前,模态感知短卷积(mShortConv)会注入局部结构(第 3.4 节)。两个子层均使用三明治归一化 [22],并由 M = 4 条流的恒等超连接(iHC;第 3.6 节)包裹。为方便起见,我们继续用 x 表示这种多流状态,其结构将在第 3.6 节中明确说明。时间步条件通过自适应层归一化(AdaLN)调制和残差门控注入。省略层索引,一个模块的计算过程如下:

(δA, γA, gA, gF ) = MLPmod(eτ), (3) ˜xA = iHC-ReadA(x), (4) ˆxA = RMSNormpreA (˜xA) ⊙(1 + γA) + δA, (5) a = RMSNormpostA (Attn(ˆxA)) , (6) x′ = iHC-WriteA x, gA ⊙a , (7) ˜xF = iHC-ReadF (x′), (8) f = RMSNormpostF (FFN(RMSNormpreF (˜xF ))) , (9) x′′ = iHC-WriteF x′, gF ⊙f . (10)

其中,x, x′, x′′ ∈RL×M×d 表示多流状态,而 ˜xA, ˆxA, a, ˜xF , f ∈RL×d。iHC-Read 算子将流轴从 RL×M×d 折叠为 RL×d,而 iHC-Write 将每个子层的更新分配回 M 条流。时间步条件向量 eτ, δA, γA, gA, gF ∈Rd 在 L 个 token 位置上广播。状态 x′′ 成为下一个模块的输入。公式 3 将 eτ 映射为注意力偏移 δA、注意力缩放 γA,以及两个子层的残差门控 gA 和 gF。因此,注意力输入接收时间步条件的 AdaLN 调制 [63],而两个残差更新均受时间步门控(公式 7 和 10)。在 M = 4 条并行残差流下,两个子层在流上共享相同的读取-计算-写入模式。每个子层以 iHC-Read 开始(公式 4 和 8),将 M 条流聚合为一个子层输入。对于注意力,该输入经过预归一化和时间步调制后,传递给注意力算子(公式 5 和 6)。生成的更新随后由 gA 门控,并通过 iHC-Write 写回所有 M 条流(公式 7)。FFN 子层也重复此模式(公式 8-10)。在每个子层内部,三明治归一化在算子之前(RMSNormpre)和之后(RMSNormpost)均放置 RMSNorm,以调节方差,保证训练稳定性。我们在第 3.3 节定义注意力算子 Attn(·),在第 3.5 节定义前馈算子 FFN(·),并在第 3.6 节定义 iHC 读/写算子。

在最后一个模块之后,M 条残差流被平均为一个表示(第 3.6 节),并且仅视觉 token 位置进入输出头进行 Rectified Flow 速度预测。文本 token 通过共享骨干网络中的 token 级交互来条件化这些预测,而扩散损失仅应用于视觉 token。

3.3 基于 NoPE 的混合注意力机制

Chimera 以 3:1 的 KDA 与 MLA 比例,周期性地交替使用 Kimi Delta Attention (KDA) [47] 和 Multi-head Latent Attention (MLA) [52]。对于长度为 L 的序列,每个 KDA 层仅需 O(N) 的序列复杂度,因为它携带恒定大小的循环状态,而非显式构建完整的注意力图。每个 MLA 层则保留具有压缩键值表示的全双向自注意力。因此,这两种算子是互补的:KDA 提供高效的长序列计算,而 MLA 周期性地实现无限制的双向全局交互。我们在下文详述这两种公式以及无位置编码(NoPE)设计。

( KDA(ˆxA), 线性注意力, Attn(ˆxA) = (11) MLA(ˆxA), 全局注意力.

第 7 页

单扫描模式下的KDA。我们逐帧遍历视频latent,每帧内采用行优先顺序。对于时间长度为T、高度为H、宽度为W的latent网格,这种时间优先的光栅扫描顺序为

zi,j,k 7→zm, m = i HW + j W + k, (12)

其中i、j和k分别索引时间、高度和宽度维度。图像被视为单帧latent网格。为清晰起见,下文省略时间步下标τ。

在文本token被前置到展平的视觉token之后,每个KDA头使用相同的扫描顺序处理ˆxA。循环状态更新在此顺序下是因果的:在每个视觉位置,状态汇总文本前缀和先前扫描过的视觉token。更新遵循Kimi Linear [47]的KDA公式,采用细粒度的逐通道状态衰减,而非单一的逐头标量。对于单个头,省略其索引,我们有

(Q, K, V ) = mShortConv(Wqkv(ˆxA)) , (13) St = I −βtktk⊤t Diag(αt)St−1 + βtktv⊤t , (14) [KDA(ˆxA)]t = Wo Sigmoid(Wgate(ˆxA,t)) ⊙RMSNorm(S⊤t qt) , (15)

其中qt ∈Rdq、kt ∈Rdk和vt ∈Rdv分别表示在Q、K和V中扫描位置t处的查询、键和值向量,而St ∈Rdk×dv是处理该位置后的循环状态。遗忘门αt ∈(0, 1)dk对每个键通道应用独立的衰减,而逐头标量βt ∈(0, 1)同时控制擦除和写入项。离散扫描索引范围为t = 1, . . . , L,与扩散时间步τ不同。循环状态在每个打包样本边界重置为S0 = 0。mShortConv(·)表示所提出的模态感知短卷积(第3.4节),它提供局部结构并促进上下文级信息捷径[2],同时允许循环KDA更新在跨模态时保持单一扫描顺序。

用于全局上下文建模的MLA。KDA将扫描历史压缩为恒定大小的循环状态。维护此状态效率高,但其有限的大小限制了从长视觉序列中精确回忆信息的能力。因此,我们交错使用一小部分全注意力层,以恢复所有token之间基于内容的直接交互。这种混合设计不仅仅是成本与容量的折衷。最新分析表明,在标准复杂度假设下,交替使用线性注意力和全注意力层在形式化序列任务上严格比单独使用任何一种类型更具表达能力:线性注意力贡献状态跟踪,全注意力贡献回忆能力,因此它们的组合解决了任何一方都无法单独解决的问题[57]。为使这些全局层保持内存友好,我们使用MLA实例化它们,MLA在压缩键值表示的同时保留全双向注意力:

(Q, U, Kdirect) = Wq(ˆxA), Wkvdown (ˆxA), Wkdirect (ˆxA) , (16) [Klat, V ] = W kvup (RMSNorm(U)) , (17) Ki = [Kdirect, Klati ], i = 1, . . . , nh, (18) MLA(ˆxA) = Wo(MHSA(Q, K, V )) . (19)

这里,nh表示注意力头的数量。U是压缩的键值latent。Klat和V均从U解码得到,而Kdirect直接从ˆxA投影得到并在各头间共享。这降低了键值缓存成本,同时保留了全双向注意力。与标准MLA [52]不同,我们不对Kdirect进行旋转(NoPE)。

NoPE与RoPE的对比。Chimera在KDA或MLA层中均不使用显式位置编码(NoPE)。为阐明此选择,我们首先考察位置编码对注意力的贡献。缺少显式位置调制时,注意力是一种内容匹配操作。也就是说,其logits是学习到的查询和键特征之间的内积,不直接依赖于token索引。位置编码为此内容通路添加了位置相关的归纳偏置。对于RoPE [74]——语言和视觉生成模型中的事实标准选择——这些偏置表现为三种形式:

位置选择。某些操作必须在特定的相对token偏移处激活。一个典型例子是前一个token头,它作为归纳头[23, 61]的构建块。RoPE通过以固定频率旋转每个查询-键通道对,使得训练后的头能够利用高频对进行精确的偏移选择,从而实现这种感知token索引/令牌级捷径的操作。通过对齐其最高频对的相位,注意力头可以使其logit在选定的较小偏移处达到峰值[3]。

7

第 8 页

近因衰减。邻近上下文通常应比远距离上下文获得更大权重。位置编码方案或显式引入这一偏置,如ALiBi的距离相关惩罚[64],或隐式引入,如RoPE。在常规频谱和简化假设下,RoPE的旋转可在注意力logits上产生距离衰减包络。这种长程衰减是RoPE的关键动机之一[74]。

多维编码。多模态数据天然具有多维位置:文本token具有一维索引,而视频token使用时间、高度和宽度坐标。轴向RoPE将旋转查询-键对分配给这些轴,并按各坐标旋转每个子集[82, 85, 95]。

这三种偏置均通过旋转承载内容的查询-键特征来实现,迫使位置信息和语义信息共享查询-键容量。训练后的模型通过在频谱上分离二者来缓解这种竞争[3]。低频对在相关上下文范围内几乎保持旋转不变,因此其点积主要由token内容主导,并保持距离鲁棒的语义匹配。相比之下,短程位置选择则集中在高频对上。

(弧度/token) 127个近零频率对:平坦 0.8 (含amp 490对,实现5) 0.6 (i)k 10 6 10 3 100 总和 = 注意力logit, 0.4 100 100 峰值在 =1 q(i) 0.2 10 位置64贡献 0 查询1logit 100 最高频率对(=1.0弧度/token) 幅度 0.1 0 0.0 0 8 16 24 32 0 64 127 10 5 10 3 10 1 相对偏移 = 查询位置 键位置 键位置旋转速度

(a) (b) (c)

图3 Qwen3-4B中最强前一个token注意力头的RoPE分析(第0层,头1)。(a) 每对logit贡献(深蓝色表示更快旋转)及其总和(橙色),总和恰好在δ=1处达到峰值。(b) 前128个token的注意力图(幂变换色标)。(c) 对幅度与旋转频率的关系:阴影区域内的对在上下文窗口内旋转不足一整圈,圈出的最高频率对产生了(a)中的峰值。

为刻画这种频率分工,我们首先分析一个预训练的基于RoPE的语言模型Qwen3-4B [91],其前一个token注意力头为短程位置选择提供了清晰的诊断。我们使用一个包含1024个token的自然文本窗口。由于RoPE独立旋转每个通道对,每个注意力logit可分解为每频率贡献之和,从而可直接测量每个频率的作用。具体而言,我们在窗口上平均查询和键,并对每个旋转通道对i,将查询分量旋转至+x轴,同时将两个向量范数吸收到对幅度|q(i)||k(i)|中。所得成对余弦项之和精确等于注意力logit,与直接计算值的一致性在3×10−13以内(图3a)。我们首先检查最强的前一个token注意力头(即第0层,头1),其中98.5%的查询最关注紧邻的前一个token(图3b)。在该头中,最高频率对(每token旋转约一弧度)产生的logit恰好在偏移量为1时达到峰值:其学习到的相位将余弦最大值置于δ≈1处。相比之下,最大幅度的对均位于近零频率,并在各偏移量上贡献几乎均匀(图3c)。因此,这些缓慢旋转的对主要由内容而非位置调制。最大的此类对在整个窗口内旋转不足1°,但在此示例中贡献甚微,因为其平均查询和键向量近乎正交。随后,我们在所有头中搜索那些恰好关注过去n个token的头,以注意力峰值位于该偏移量的查询比例来量化。此类头仅出现在短距离上:最佳头在n=2时达到0.56的比例,但在n=10时仅为0.07。这些结果表明,基于RoPE的位置选择几乎完全在短程内运作。

我们随后将相同分析应用于视觉生成模型FLUX.2 [4]和Wan2.2 [82],并观察到相同的分工。即,缓慢旋转的通道对保持距离鲁棒的语义匹配,而快速旋转的对则实现短程位置选择(协议和完整结果见附录C)。

由此视角,RoPE通过旋转查询-键通道实现其三种归纳偏置,同时引入若干局限。(1) 首先,位置选择消耗大量注意力容量。在上述前一个token注意力头中,单个快速旋转对固定了目标偏移量,而大幅度的慢速对仅贡献平坦的、与偏移量无关的背景。结果,整个注意力头实际上专用于固定的n-token偏移,但可靠选择仍仅限于极短范围。(2) 其次,近因衰减仅是隐式的。衰减

第 9 页

包络是叠加旋转的平均属性,而非源于显式的内容自适应衰减机制,并且可以被训练后的注意力头绕过[3]。(3) 第三,布局编码是手工设计的。通道划分必须手动指定,每增加一个模态或位置轴都会进一步分割可用通道并降低每个轴的频率分辨率,且最终的分配在设计时即固定不变。

相比之下,Chimera通过专用机制提供每种归纳偏置,且这些机制均不消耗注意力通道容量。令牌顺序由循环扫描本身提供:KDA按时间优先的光栅顺序处理序列,使其状态更新天然具有顺序感知能力。(1) 位置选择由模态感知短卷积(第3.4节)处理。深度卷积核在显式索引偏移处混合令牌,仅用少量参数即可实现索引感知操作,而无需为此分配整个注意力头。相关的卷积机制也已被用于向视觉Transformer注入位置信息[15]。由于上述分析表明基于RoPE的位置选择主要是短程的,因此一个短卷积核足以替代它。(2) 近因衰减是KDA的内在特性。通道级遗忘门αt(公式14)在每个扫描步骤衰减循环状态,通过一个学习的、内容自适应的窗口将每个令牌与其前驱令牌关联,而非通过固定的频谱包络。(3) 多维编码由卷积的结构决定。文本令牌沿令牌索引使用因果1D卷积核进行混合,而视觉令牌则在时间-高度-宽度网格上使用3D卷积核进行混合。因此,每种模态的原生布局由算子直接编码,无需跨位置轴分割通道。将这三类位置偏置分配给专用模块后,注意力便可自由执行其原生功能:内容匹配。不带RoPE的MLA对应于每个通道旋转频率均为零的极限情况,因此其logits仅依赖于内容[3]。KDA中的查询和键同样不包含位置相位。这一设计类似于近期结合NoPE全注意力和门控线性注意力的混合语言模型[47, 77]。Chimera通过模态感知卷积将其应用于多模态数据。

除了这种解耦之外,移除RoPE也避免了其对训练长度的依赖。在超出训练时观测范围的相对偏移处,非零旋转频率可能产生训练分布之外的相位配置。当在5秒片段上训练的模型被用于生成10秒或20秒视频时,这些未见过的相位配置可能导致性能下降[3, 46]。相比之下,我们的三种机制未引入与训练范围绑定的显式位置相位:卷积核具有固定支持范围,且相同的循环更新应用于每个扫描步骤。这在某种程度上消除了向更长序列进行零样本外推的一个架构障碍。

总体而言,Chimera将RoPE的三种位置功能分解为显式的专用模块:用于位置选择的短卷积、用于近因的门控状态衰减,以及用于布局编码的算子结构。每种归纳偏置都以直接且可学习的形式提供,无需为简单的位置操作消耗注意力容量、手动划分通道,或将模型与其训练长度耦合。

3.4 模态感知短卷积

短卷积在每次线性注意力更新前向令牌特征注入局部结构,这遵循了线性注意力文献中的常见做法[47]。然而,普通的单维卷积仅混合扫描顺序上相邻的令牌,因此仅沿固定顺序轴建模局部性。为恢复视觉数据的二维和三维局部性,先前的视觉模型将此类卷积与多个手工设计的扫描方向配对[37, 39, 56]。我们转而让卷积具备模态感知能力,使其匹配每种模态的原生结构并直接捕获局部时空相关性。这使得Chimera能够保留单一扫描模式。图4对比了我们的模态感知卷积(采用单一扫描模式)与传统的1D卷积加多轴扫描的配对方式。

具体而言,模态感知卷积在保持令牌在打包的单流接口中位置不变的同时,使用文本和视觉令牌的模态特定视图(图4)。文本令牌从其打包位置收集,并通过文本序列上的因果一维深度卷积进行处理。视觉令牌被重塑为其时空网格,并通过深度3D卷积进行处理,该卷积同时沿时间、高度和宽度轴建模局部相关性。图像作为时间长度为一的视频特例处理。卷积在每个模态段内独立应用,因此没有卷积核跨越文本-视觉或打包样本的边界。卷积之后,文本和视觉输出被散射回其在打包序列中的原始位置。由于卷积本身捕获了多维局部性,KDA可以保持单一的时间优先扫描,而非上述讨论的多方向扫描。

若以朴素方式实现,这种收集-卷积-散射过程会启动多个内核并物化中间结果。

第 10 页

1D 短卷积 1 2 3 4 5 1 2 3 4 5 2 3 4 5 模态感知 短卷积 6 7 8 9 10 或 6 7 8 9 10 6 7 8 9 10 KDA 扫描顺序 11 12 13 14 15 + 11 12 13 14 15 11 12 13 14 15 时序 16 17 18 19 20 16 17 18 19 20 16 17 18 19 20 视觉Token的宽度轴

高度 21 22 23 24 25 21 22 23 24 25 21 22 23 24 25 帧边界 1D-Conv 行扫描 1D-Conv 列扫描 我们的方案:模态感知卷积 单次扫描 行扫描 / 我们的方案 1 2 3 4 5 6 7 8 23 24 25 26 27 28 48 49 50 51 52 53 71 72 73 74 75 第1帧 第2帧 第3帧 列扫描 1 6 11 16 21 2 7 12 15 20 25 26 31 36 40 45 50 51 56 61 55 60 65 70 75 第1帧 第2帧 第3帧

图4 视觉模态中局部混合设计的概念对比。 传统1D短卷积与多轴扫描配对用于视觉建模,而我们的模态感知短卷积在单一扫描模式下对时空局部性进行建模。

每层的缓冲区。我们转而实现了一个融合的Triton内核,直接在打包存储上实现相同的文本和视觉卷积,避免了显式的收集和分散操作。在针对打包图像(512²和1024²)和视频(21帧)批次上,与未融合实现进行的算子级微基准测试中,融合内核实现了2.2–2.3倍的前向加速和1.5–1.8倍的前向-反向加速,同时在前向传播期间将峰值激活内存降低了最多4倍。

沿时序维度,3D卷积使用因果填充,因此每个视觉token仅与当前帧和过去帧的token混合。我们将短卷积设为时序因果的,以保持其局部混合与KDA的因果时序优先扫描一致,原因如下:

  • 与状态跟踪的一致性。 KDA算子在扫描序列时更新循环状态,这与视频生成的时序进展自然对齐。非因果的时序卷积会在每次KDA更新之前,将未来帧信息引入局部查询、键和值特征中,从而削弱这种状态跟踪的解释。因果填充使局部视觉算子与KDA扫描的因果动态保持一致。
  • 与序列生成的兼容性。 时序因果卷积也有助于将预训练骨干网络适配到下游的流式生成任务中。例如,如果模型后来被转换为自回归世界模型,那么包括其短卷积在内的KDA通路,从预训练阶段起在时间上就已经是因果的,而不是依赖于仅在训练后阶段引入的因果约束 [38, 41]。
  • 性能。 经验表明,与非因果替代方案相比,短卷积中的因果时序填充对生成质量影响甚微,因此这一设计选择带来的成本可以忽略不计。

总之,KDA遵循因果时序优先扫描,而短卷积沿时序轴是因果的。这种对齐保留了KDA的状态跟踪解释,同时卷积在单一扫描模式下提供了模态特定的局部结构。

3.5 混合专家模型 (MoE)

为了在不按比例增加每个token激活计算量的情况下提升Chimera的容量,我们将除首尾块之外的所有块中的密集FFN替换为稀疏MoE FFN [17, 25]。这一选择补充了混合KDA/MLA设计:一旦注意力成本降低,FFN计算在每token计算中占据更大份额,因此扩大密集FFN将侵蚀混合注意力带来的效率增益。稀疏激活则增加了总FFN参数量,从而提升模型容量,同时保持每token的激活计算量与密集基线相匹配。 具体来说,一个MoE FFN包含N个路由专家{Ei}Ni=1和一个路由器r(·)。对于每个token输入u ∈Rd,路由器

第 11 页

生成专家评分,选取一个小型top-K集合T(u),并仅组合这些专家的输出,

T(u) = TopK(r(u) + b, K), (20) MoE(u) = Σ gi(u)Ei(u), (21)

i∈T(u)

其中K是每个token激活的专家数量,b∈RN是仅在专家选择时应用的无梯度平衡偏置,gi(u)是专家i的路由权重。在中间块中,MoE(·)实例化公式9中的FFN(·)算子。我们采用token-choice路由:每个token独立选择其激活的专家。遵循DeepSeekMoE[17]的细粒度专家设计,每个路由专家是一个小型SwiGLU FFN,其隐藏维度为密集FFN隐藏宽度的1/K。在我们的主要配置中,每个MoE层有N=56个路由专家,每个token激活K=8个专家,对应激活比例为8/56=1/7。因此,总专家参数量大约扩大了56/8=7倍,而8个激活的专家恰好恢复密集FFN的隐藏宽度,例如,在我们的2B配置中为8×1024=8192。我们不使用共享专家,因为经验发现,在此视觉扩散设置中,仅路由专家就提供了足够的容量。MoE配置(包括专家数量和激活比例)在所有实验中固定,以保持我们的缩放研究运行直接可比。

路由器是一个轻量级的两层MLP,产生sigmoid分数。 经过top-K选择后,选中的分数被归一化并缩放√K倍,以形成权重gi(u)。为避免训练过程中的路由崩溃和专家负载不均衡,我们采用了无辅助损失的平衡策略[53, 84]:无梯度偏置b仅参与top-K选择,而权重gi(u)始终由无偏的路由器分数计算。每个训练步骤后,根据观察到的专家负载,过载专家的偏置会减少,欠载专家的偏置会增加一个小的固定步长。这在不向扩散目标添加任何辅助损失的情况下,保持了专家负载的平衡。为验证此策略在我们的视觉扩散设置中确实能平衡负载,我们遵循[84],通过其最大违规值(MaxVio)来量化MoE层的负载平衡程度:

max1≤i≤N Loadi − Load MaxVio = ——————————————————————, (22) Load

其中Loadi是训练批次中路由到专家Ei的token数量,Load是N个专家的平均负载,即完美平衡下的每专家负载。在我们的配置中,当负载完全均匀时,MaxVio为0;当所有token选择相同的K个专家时,达到N/K−1=6。图5跟踪了两次相同运行中,所有MoE层平均的批次级MaxVio。启用平衡偏置后,MaxVio几乎立即降至1以下,并在剩余训练中稳定在约0.5,即负载最重的专家也仅接收其预期token份额的约1.5倍。相反,禁用偏置则导致严重不均衡:MaxVio在最初几百步内升至5以上,并持续向崩溃边界漂移,负载最重的专家吸引了超过其预期负载6倍的token。这些结果证实,基于偏置的机制在整个训练过程中保持了均衡的专家利用率,无需向扩散目标添加负载平衡项。

3.6 恒等超连接(iHC)

深度网络依赖残差连接来保持信号在深度上的传播。超连接(HC)[104]通过将残差状态扩展为多个流,并学习每个子层如何从中读取和写回,从而泛化了这一设计。mHC[90]进一步将残差流转换约束为双随机矩阵,保留了大规模稳定优化所需的近似恒等映射。这种多流接口特别适合Chimera。KDA、MLA、模态感知短卷积和MoE执行互补计算,并产生具有不同统计特性的更新,然而标准残差块强制每个子层从同一状态读取和写入。随着这些异构更新在深度上累积,单一流可能限制算子特定

第 12 页

信息得以保留并重新组合。多个残差流提供了依赖令牌的读写路径,通过恒等路径增加了路由容量并维持了稳定的特征统计量。

我们采用恒等超连接(iHC),这是mHC的一种简化变体,它将残差流转换矩阵固定为恒等矩阵,同时保留了依赖令牌的读写映射。在去噪骨干网络的输入端,iHC通过复制将标准残差状态扩展为M个残差流R ∈RM×d,其中d是隐藏维度,R是每个令牌的多流状态。将这些状态在L个令牌位置上堆叠,得到序列级状态x ∈RL×M×d,用于公式4–10。在最后一个块之后,M个流被平均回单个流。在每个块内部,每个子层之前,一个读取向量hpre(R) ∈RM将各流聚合为子层输入,

M ˜x = X hpre,m(R)Rm, (23) m=1

这实例化了公式4和8中的iHC-Read操作。令∆∈Rd表示门控子层更新,对于注意力机制∆= gA ⊙a(公式7),对于FFN ∆= gF ⊙f(公式10)。一个写入向量hpost(R) ∈RM独立地缩放共享更新并将其加到每个残差流上,

R′m = Rm + hpost,m(R) ∆, m = 1, . . . , M, (24)

这实例化了iHC-Write操作。依赖令牌的读写向量由下式生成:

hpre(R) 1M bpre = ⊙σ αhWh RMSNorm(vec(R)) + . (25) hpost(R) 21M bpost

这里,Wh ∈R2M×Md,bpre, bpost ∈RM,αh是一个可学习的标量。1M和0M分别表示RM中的全1和全0向量,σ按元素应用。这给出了hpre(R) ∈(0, 1)M和hpost(R) ∈(0, 2)M。我们初始化bpre = logit(1/M)1M和bpost = 0M,因此抑制输入依赖项会得到hpre = M1 1M和hpost = 1M。由于αh被初始化为一个小值,且各流开始时是输入的副本,每个块开始时都接近标准残差更新。输入自适应的多流路由随后在训练过程中逐渐涌现。如第3.2节所述,这种读取-计算-写入模式分别在注意力和FFN子层周围应用,在我们的主模型中M = 4个残差流。

相对于mHC的关键简化在于残差流转换。在一般的HC/mHC公式中,写入步骤还通过残差转换矩阵Hres ∈RM×M混合流本身,即R′m = PMm′=1(Hres)mm′Rm′ + hpost,m(R) ∆,其中mHC学习一个依赖令牌的Hres,并通过Sinkhorn迭代[90]将其投影到双随机流形上。iHC则固定Hres = IM,得到公式24中的写入规则。这移除了mHC所需的每个令牌的M × M残差混合矩阵和Sinkhorn投影。除了维护、读取和写入M个残差流之外,公式25中的系数生成器每个子层需要一个RMSNorm、一个Md →2M投影和逐元素门控。对于固定的M = 4,这种路由算术随d线性缩放,而注意力和FFN的投影成本则随d呈二次方关系。因此,iHC在保留多个残差流上自适应读写映射的同时,保持了精确的恒等残差转换。

4 缩放法则

本节介绍Chimera的缩放法则。第4.1节开发了HeteroP,一种模块级超参数迁移参数化方案,可在不同宽度和深度下产生一致调优的模型家族。第4.2节随后利用该家族拟合Chinchilla风格的计算最优法则,涵盖模型大小和训练令牌,并将分析扩展到图像-视频数据比例。

4.1 超参数迁移

研究新架构的缩放行为需要训练一系列规模递增的模型。这立即引发一个实际问题:每个规模应使用哪些超参数?在每个规模上独立重新调整学习率、初始化和权重衰减成本过高。重用在小规模上调优的值虽然成本低,但往往不是最优的,因为在标准参数化下,最优学习率会随模型宽度和深度漂移[18, 93]。超参数迁移通过重新参数化模型和

12

第 13 页

优化器,使得一组基础超参数在宽度和深度上保持近似稳定。可以在小型代理模型上调优这些基础值,然后将其迁移到更大的模型中。

现有的超参数迁移方法针对互补的缩放维度。最大更新参数化(µP)提供了宽度迁移规则,并已在Transformer和ResNet上得到验证[93],而CompleteP则将迁移扩展到Transformer的深度维度[18]。最近的扩散模型专项工作进一步将µP适配到全注意力扩散Transformer上[103]。这些方法提供了我们构建的基础原则,但并未为异构视觉扩散骨干网络指定完整的参数化方案,该骨干网络需联合结合KDA线性注意力、MLA全局注意力、模态感知短卷积、稀疏MoE层、iHC、三明治归一化以及扩散时间步条件。我们将最终得到的方法称为HeteroP(异构参数化)。

为何公平缩放研究需要迁移。除了降低调优成本外,超参数迁移使缩放研究更具意义。缩放曲线通过比较不同规模模型的损失,来估计性能如何随算力提升。如果每个规模都使用与规模不匹配的超参数进行训练,测得的损失差异可能同时反映模型规模与次优调优的影响,从而掩盖规模的真正效应。例如,使用次优学习率训练的大模型甚至可能表现不如小模型,导致所得曲线无法为设计结论提供可靠依据。超参数迁移减少了这种混杂效应,使损失差异主要反映规模和架构,而非调优噪声。早期的扩散缩放研究并未通过宽度和深度迁移参数化来显式控制这一因素[50, 63]。在第5.2节中,我们验证了在我们的方案下,最优学习率在宽度和深度上保持稳定,而在标准参数化下则会发生偏移。

为何异构骨干网络需要模块级比率。同构Transformer通常通过乘以一个公共隐藏维度来加宽,因此在实例化迁移规则时,使用单一的全局宽度比率是一种合理的简写。而在Chimera中,“宽度”是一组不同维度的集合。一个投影层的输入可能是模型隐藏状态、MLA KV压缩隐变量、KDA头、MoE专家隐藏状态、路由状态或时间步条件状态。这些维度可能随模型宽度缩放、以不同速率增长或保持不变。因此,将全局模型宽度比率应用于每个张量,会导致那些更新受其他扇入控制的参数缩放错误。HeteroP通过为每个参数组,根据控制其激活和更新规模的维度,分别计算目标与代理模型的比率,来解决这一不匹配问题。其结果是一种细粒度、维度精确的参数化方案,为结构异构的骨干网络保留了预期的迁移规则。

HeteroP参数化。令M(0)表示一个调优了基础超参数的小型代理模型,令M表示要迁移到的目标模型。两个模型共享相同的架构,但宽度和深度可能不同,分别具有n(0)blk和nblk个块。对于每个目标参数组W,令W (0)表示其代理对应项。我们将迁移简洁地表示为:

¯h = σ2base, ηbase, λbase, ϵbase , (26) ! fan-in(W) nblk (mW , mL) = fan-in(W (0)), n(0)blk , (27) PW = Tρ(W ) ¯h; mW , mL . (28)

其中,σ2base、ηbase、λbase和ϵbase分别表示基础初始化方差、学习率、权重衰减和AdamW ϵ。PW汇集了W的初始化、优化器、前向传播和残差缩放设置,而ρ(W)表示其功能角色。mW是由W的扇入决定的模块特定宽度乘数,与块数无关;mL是由块数决定的全局深度乘数。在调优Chimera时,与以往采用单一全局缩放比率的工作不同,mW可能由模型隐藏宽度、MLA KV压缩秩、KDA头宽度、MoE专家宽度、路由宽度或时间步条件宽度决定。深度乘数mL是共享的,因为它由目标与代理模型的块数比率决定。我们的代理模型宽度为512,深度为4(激活参数量22M,表4),而最大模型宽度为2048,深度为32。因此,对于扇入为模型宽度的参数组,mW = 4,其他组则获得各自的比率,且mL = 8。在操作上,HeteroP (i) 在代理模型上调优一次¯h,(ii) 为每个目标张量分配角色ρ(W)并计算mW,(iii) 结合mL应用角色相关的映射Tρ(W)。公式26–28定义了这三个要素,表1给出了它们的模块级实例化。

13

第 14 页

表1 Chimera的HeteroP模块级超参数迁移规则,与标准参数化(SP)对比。我们联合控制宽度与深度:mW为目标与代理模型针对参数组W(例如,由模型宽度、MLA KV压缩秩、KDA头宽度、MoE专家宽度或路由宽度计算)分别计算的扇入比,mL为目标与代理模型深度比提升至所列幂次的值。ηbase、σ²base、λbase、ϵbase分别表示在代理模型上调优一次并迁移至所有规模的学习率、初始化方差、权重衰减和AdamW ϵ。

模块 / 超参数 | SP | HeteroP —|—|— 输入适配器(块/文本/时间步嵌入)| | 初始化方差 | σ²base | σ²base 学习率 (AdamW) | ηbase | ηbase Sandwich RMSNorm(前/后归一化增益)| | 初始化方差 | σ²base | σ²base 学习率 (AdamW) | ηbase | ηbase 隐藏权重(KDA/MLA投影、FFN及MoE专家、路由)| | 初始化方差 | σ²base | σ²base · m⁻¹W 学习率 (AdamW) | ηbase | ηbase · m⁻¹W 偏置学习率 (AdamW) | ηbase | ηbase 权重衰减 (AdamW) | λbase | λbase · mW 注意力残差(KDA, MLA; iHC)| Xl + Attn(RMSNorm(Xl)) | Xl + m⁻¹L · Attn(RMSNorm(Xl)) FFN / MoE残差 (iHC) | Zl + FFN(RMSNorm(Zl)) | Zl + m⁻¹L · FFN(RMSNorm(Zl)) 最终归一化(读出前)| | 初始化方差 | σ²base | σ²base 学习率 (AdamW) | ηbase | ηbase 扩散读出头(速度预测)| | 初始化方差 | σ²base | σ²base 学习率 (AdamW) | ηbase | ηbase 前向传播 | XLW⊤head | XLW⊤head · m⁻¹W AdamW ϵ(残差块)| ϵbase | ϵbase · m⁻¹W · m⁻¹L AdamW ϵ(输入适配器与读出)| ϵbase | ϵbase · m⁻¹W

宽度与深度迁移规则。表1中的HeteroP规则结合了跨宽度和深度的模块级超参数迁移。在宽度迁移下,隐藏矩阵乘法权重使用按m⁻¹W缩放后的初始化方差和学习率,同时权重衰减按mW缩放。这些初始化和学习率修正保持了宽度一致的激活和更新尺度,而η ∝ m⁻¹W与λ ∝ mW的配对缩放保持了ηλ不变。输入适配器、归一化增益、偏置和读出保持其基础初始化和学习率,与µP的输入/输出处理方式一致。读出在前向传播中额外乘以m⁻¹W,且AdamW ϵ按m⁻¹W缩放以跟踪收缩的梯度尺度。

HeteroP融入了CompleteP [18]的深度修正:每个注意力或FFN/MoE子层输出在相应的iHC写入前按m⁻¹L缩放,使聚合残差贡献保持在深度无关的尺度上。残差块张量对AdamW ϵ接受相同的额外m⁻¹L修正,而它们的学习率无需额外的深度修正,如表1所列。

模块级分配。将HeteroP映射到Chimera需要为每个可学习张量分配一条规则。对于每个参数组,我们识别其功能角色,并在适用时确定决定其扇入的维度。最终分配总结如下。

• 输入适配器与读出。块、文本和时间步嵌入投影是输入层,速度预测头是输出层。两者均保持基础学习率和初始化,读出额外使用m⁻¹W前向乘子。然而,公式3中的逐块时间步条件MLP遵循隐藏规则;其输入投影由eτ的宽度参数化。

• 混合注意力。所有读取隐藏状态的投影,包括KDA查询-键-值投影以及MLA查询和键-值下投影,均随模型宽度缩放。MLA键-值上投影随KV压缩秩缩放,而KDA门控及两个算子的输出投影随相应的头宽度缩放。短卷积核和KDA低秩门上投影对每个输出通道具有固定的扇入。因此它们使用mW = 1,保留基础学习率和权重衰减,同时使用残差块ϵ缩放。互补的门控下投影读取隐藏状态,因此遵循隐藏规则。

14

第 15 页

FFN 与 MoE。稠密 SwiGLU FFN 和 MoE 专家的上投影与门投影随模型宽度缩放,下投影则随各自隐藏宽度缩放。路由器输入投影同样遵循模型宽度,而路由器隐藏宽度在各尺度上保持固定。这使得路由 logits 在模型增长时保持在一致的尺度上。路由稀疏度也保持固定,如下文所述。

iHC 与 Sandwich Normalization。iHC 增益与偏置,连同 RMSNorm 增益,均为控制张量并遵循归一化处理:基础初始化、基础学习率以及隐藏 ϵ。生成 iHC 读/写向量的轻量级投影读取拼接后的残差流,其大小随模型宽度增长,因此遵循隐藏规则。这在不同宽度和深度下保持了残差稳定性。

缩放时保持固定的内容。在构建模型家族时,我们分别改变由 mW 和 mL 表示的模块特定宽度和块数量,同时保持下列结构设置固定。MoE 路由配置在各尺度上保持不变:每个模型使用 56 个路由专家,每个 token 激活 8 个,专家激活比例为 1/7(第 3.5 节)。MLA KV 压缩比(定义为压缩秩除以模型宽度)同样随宽度增长而保持恒定,因此压缩作为一个固定的架构属性而非隐藏的缩放变量。3 KDA 与 MLA 层比例、iHC 残差流数量以及分块因子也是如此。固定这些设置可防止结构选择与缩放研究纠缠,并保持所有数据点相互可比。

4.2 Chimera 的 Chinchilla 定律

HeteroP 产生了具有尺度适宜超参数且可相互比较的 Chimera 模型。利用该模型家族,我们为视觉扩散拟合了 Chinchilla 风格的计算最优缩放定律 [36]。

为何需要计算最优定律。缩放中的一个核心实际问题是分配。给定固定的训练预算 C FLOPs,模型 N 应多大,以及应处理多少 token D?训练一个过大的模型但步数过少会浪费容量,而训练一个过小的模型但时间过长则会将计算花费在已饱和的模型上。Hoffmann 等人 [36] 表明,对于语言模型,N 和 D 之间最小化损失的划分遵循一种可预测的权衡,忽略这一点会导致模型严重训练不足。对于视觉扩散,这种权衡尚未在通过 HeteroP(第 4.1 节)跨尺度控制超参数的模型家族上得到表征。因此,我们的目标是使 Chimera 的规模与数据权衡明确且可预测,以便大型目标运行的配置可以从拟合的定律中先验选择,而非通过试错。

公式化。我们采用 Hoffmann 等人 [36] 的参数化形式,将训练损失建模为模型大小 N 和训练数据量 D 的函数:

bL(N, D) = E + A/N^a + B/D^b, (29)

其中 E 表示在固定数据分布和扩散目标下的不可约损失,即数据分布上的贝叶斯最优扩散损失,两个幂律项则捕捉了有限容量和有限数据带来的有限规模惩罚。三个测量选择使此形式适应我们的设置。首先,损失 bL 是 Chimera 扩散损失,即第 3.1 节的 rectified flow v 预测目标,而非诸如 FID 的下游生成分数。在此处使用的固定目标和评估协议下,扩散损失提供了一个与采样器无关的指标,用于比较跨模型规模的预训练。其次,由于 Chimera 是稀疏激活的,N 计算的是激活参数,因此该定律反映的是每个 token 实际花费的计算量,而非总参数存储量。4 第三,D 表示累积训练数据量,以处理的视觉潜在位置数量衡量,我们通过标准核算 C ≈ 6ND 将其与计算量关联,以对应主要的矩阵乘法成本,5 这使我们能够直接用计算量来表达该定律及其最优值。

3 最优压缩比本身是否依赖于尺度是一个有趣的问题,留待未来工作。我们使用代理值。 4 专家间的负载均衡不影响计算成本,但可能影响模型质量,进而影响用于拟合的损失。因此,我们在近乎完美的负载均衡下进行此项研究,如图 5 所示。 5 此近似对混合骨干网络仍然有效。大多数层使用具有恒定每 token 成本的线性注意力,少数 MLA 层在压缩的键值状态上进行注意力计算,因此参数矩阵乘法主导了总体计算。

第 16 页

拟合与使用。所有实验采用相同的AdamW基础配置,以及预热后恒定的学习率调度(无衰减)。因此,在中间步骤测得的损失不会受到针对该训练时长定制的学习率衰减阶段的影响。单次实验即可在多个数据预算D下提供可比较的损失测量。我们进一步确保所有实验都处于无限数据状态:没有任何实验处理超过一个epoch的训练语料。给定一组覆盖不同模型规模和训练时长的实验,我们使用Hoffmann等人[36]的三种估计器来估算算力最优分配:损失-算力曲线的下包络、在固定算力预算下比较不同模型规模损失的IsoFLOP曲线,以及直接对公式29进行参数拟合,通过在初始化网格上最小化预测对数损失与观测对数损失之间的Huber损失来实现。拟合出的定律以闭式解给出了算力最优前沿Nopt(C)和Dopt(C)。我们使用该前沿来选择Chimera最大规模实验的配置,并在第5.3节中报告拟合结果及其跨估计器的一致性。

将定律扩展到图像-视频数据比例。与单模态文本数据的缩放定律不同,视觉生成训练使用的是混合图像和视频的多模态数据。两者在信息内容和每个样本贡献的token数量上存在差异,因此混合比例会同时改变学习信号和算力预算的消耗方式。标准的(N, D)定律未控制这一变量。因此,我们通过增加一个维度——图像-视频数据比例——来扩展缩放定律,并建模其最优值如何随训练预算增加而变化。

具体来说,我们推广了Hoffmann等人[36]的IsoFLOP方法。我们在多种图像-视频比例下训练多个规模的模型,并记录它们在固定算力预算下的扩散损失,分别跟踪图像损失和视频损失。在每个预算下,我们不再仅对模型规模拟合一维二次曲线,而是对每个损失在模型规模和数据比例上拟合一个二次曲面。然后,我们选取每个拟合曲面的最优点,并对这些每个预算下的最优点拟合算力最优前沿,从而得到最优模型规模和图像-视频比例作为算力的函数。第5.4节展示了拟合的曲面和由此得到的前沿。

5 实验

我们从本文发展的两个维度评估Chimera。首先验证缩放方法论:第5.2节验证了HeteroP在宽度和深度上的迁移能力,第5.3节展示了图像和视频生成的算力最优缩放定律,第5.4节将定律扩展到图像-视频数据混合。然后评估模型:第5.5节在生成质量上将Chimera与强基线模型进行比较,第5.6节展示了组件消融实验。

5.1 实现细节

所有模型均实例化第3节的架构,仅在宽度、FFN宽度和深度上有所不同。图6展示了从55M到4B激活参数的代表性配置,其具体规格列于附录B。如第4.1节所述,所有结构比例在缩放过程中保持不变,包括MoE配置、KDA与MLA的比例、残差流数量、MLA的KV压缩比以及分块因子。

冻结组件。视觉输入由一个冻结的因果3D VAE [82]编码,该VAE具有16个潜在通道,并在时间、高度和宽度轴上分别进行(4, 8, 8)的压缩。一个分辨率为H × W的4k + 1帧片段被编码为k + 1个大小为H/8 × W/8的潜在帧,单张图像是k = 0的特例。编码后的潜在表示使用VAE潜在空间的逐通道均值和标准差进行标准化,因此rectified flow目标在近似零均值、单位方差的变量上操作。然后我们应用(1, 2, 2)的分块。文本提示由一个冻结的umT5-XXL编码器[16]编码,最大长度为512个token。填充位置被丢弃,剩余的嵌入被打包成一个可变长度的序列,并通过一个单独的可训练投影层(第3.2节)前置到视觉token之前。

训练配方。所有模型均使用第3.1节的rectified flow目标进行训练,损失为速度目标上的均方误差,跨时间步不加权。每个样本抽取一个时间步,并由其所有token共享,该时间步来自一个logit-normal分布[24],该分布将监督集中在中间噪声水平。由于固定的时间步在更长的token序列中会破坏更多信息,我们随后将其向更高噪声方向偏移,公式为τ' = τ/(τ + s(1 − τ)),其中对于具有Lvis个视觉token的样本,s = √(Lvis/256),以256²的图像桶作为参考。由于s是按样本计算的,同一批次内不同尺寸的图像和视频片段会独立地进行偏移。

16

第 17 页

20B 最终版 MoE 参数扩展 架构覆盖范围 最终版 8192 5B 宽度 6144 1B 参数量 隐藏层 4096 总计 200M FFN

代理模型 2048 50M 代理模型

20M 100M 500M 1B 4B 512 1024 1536 2048 2560 3072 激活参数量 模型宽度 深度 16 深度 32 代理模型 最终模型 图 6 代表性 Chimera 模型家族。左图:总参数量与激活参数量,展示了参数扩展情况。 右图:模型宽度与 FFN 隐藏层宽度,展示了缩放研究覆盖的配置。该家族并非严格的固定长宽比缩放阶梯;相反,它在保持高层架构固定的同时,涵盖了宽度、深度和 FFN 容量的可行组合。我们主要固定深度并研究宽度的缩放。所有标记使用相同直径;色调表示深度,而同一深度内的颜色强度随激活参数量对数增长。代理模型和最终训练模型被单独高亮显示。具体配置见附录 B。

文本条件以 0.1 的概率被丢弃,以便在推理时实现无分类器引导。我们使用 AdamW 进行优化,基础学习率 ηbase = 10−3,betas 为 (0.95, 0.95) [9, 27, 62],ϵbase = 10−8,基础权重衰减 λbase = 0.01。HeteroP 根据表 1 在每个尺度上实例化参数组的学习率、初始化方差、权重衰减和 AdamW ϵ 值。基础学习率在 2000 步内从 10−6 线性预热,然后保持不变。恒定的学习率调度使得不同训练时长下的中间检查点具有可比性,这是第 5.3 节缩放研究所依赖的。

梯度被裁剪到全局范数 1.0。作为稳定性保障,我们跳过任何预裁剪梯度范数非有限或超过 10 的步骤的优化器和 EMA 更新。专家负载通过第 3.5 节的无辅助损失偏置更新来平衡,选择偏置每步调整 10−3。因此,训练目标中不添加任何负载平衡项,报告的损失正是上述流匹配损失,这对于第 5.3 节中将此损失作为主要指标的缩放研究至关重要。我们额外维护可训练参数的指数移动平均,衰减率为 0.9999,每步更新。

数据。我们在一个大规模精选视觉语料库上训练。训练使用多分辨率像素桶:早期阶段混合 256²、512² 和 1024² 桶,采样比例为 4:2:2。混合分辨率批次会产生高度可变的序列长度,因此数据序列平衡器 [99] 在设备间重新分配打包序列以平衡每 GPU 负载。宽高比高于 4:1 或低于 1:4 的样本被丢弃。在图像-视频混合训练期间,我们保留三个图像桶,并添加约 5 秒的 180p 和 360p 视频片段,数据加载器采样比例分别为 2:1:1:2:2,对应 256²、512²、1024²、180p 视频和 360p 视频。每个片段包含以 16 fps 采样的 81 帧,并根据其宽高比分配到面积保持的裁剪桶中。此外,我们在第 5.2 和 5.3 节的所有试验均使用确定性数据加载器,并在无限训练数据机制下进行。

基础设施。我们使用混合分片数据并行 (HSDP) [101] 训练 Chimera,在节点内的八个 GPU 间分片模型状态,同时在节点间复制。HSDP 以块粒度应用,以重叠参数通信与计算。参数以 bf16 格式收集,梯度以 fp32 格式规约。我们进一步对每个块应用激活检查点。主要的逐层算子直接基于打包的 token 表示,使用自定义 Triton 内核实现。这些包括融合的多模态短卷积、带有融合门控和归一化的分块 KDA,以及基于专家级 token 排序和分组矩阵乘法的 MoE 实现。

图像-视频混合训练可能产生显著的负载不均衡,因为不同 rank 可能处理计算成本差异很大的样本。因此,我们引入了两个轻量级工作负载平衡器。对于 VAE 编码,节点内的 rank 交换样本形状元数据,并根据像素数估算编码成本。样本按成本降序贪婪地分配给当前负载最轻的 rank,通过一次全交换传输,编码后的潜在表示通过第二次全交换返回到其原始 rank 和顺序。我们还在第一个 Transformer 块之前应用了一个 DiT 平衡器,遵循 [99]。它使用一个模型来估算每个打包序列的成本。

第 18 页

图7 HeteroP 可跨宽度和深度迁移学习率。上行:HeteroP;下行:标准参数化(SP)。图(a,c)在固定深度下将宽度从0.25倍变化至2.75倍(激活参数量从20M到1.12B),图(b,d)在固定宽度下将深度从4层变化至32层(激活参数量从20M到150M)。十字标记表示训练5万步后的最低点。横轴表示我们方案中的基础学习率ηbase以及SP下未缩放的学习率。采用HeteroP时,在模型规模56倍和深度8倍的变化范围内,最优学习率保持在约10⁻³。而在SP下,最优学习率随规模变化而漂移,且高学习率运行可能变得不稳定。

该策略同时考虑了KDA主导计算的线性成本与周期性MLA层的二次成本,并通过可微的全交换操作重新分配完整序列,使得输出和梯度能路由回其所有者。两种分配均在每一步重新计算,且仅在预估的每卡最大工作负载减少量超过一个小阈值时才生效。

评估协议。我们从两个层面评估Chimera。对于缩放研究,主要指标是第3.1节中的Chimera扩散训练损失。在固定的目标和噪声参数化下,该损失与采样器无关,因此可在不同模型规模、训练时长和数据混合之间进行比较,这也是第5.3节分析的基础。对于最终模型,我们额外报告下游生成质量。我们使用GenEval [28]和DPG-Bench [40]基准评估图像生成,并使用第5.5节长度外推协议下的FID和FVD评估视频生成。为保持比较可控,我们在每次比较中对测试变体固定采样配置,以确保测量到的差异反映的是模型而非采样设置。我们在相应小节中详述每个实验的具体设置。

5.2 HeteroP超参数迁移

我们首先验证缩放研究的核心前提:在HeteroP下,基于代理模型调优的基础学习率ηbase在更大规模下仍保持接近最优。

设置。我们在两个每次仅改变一个缩放维度的模型家族上,对基础学习率ηbase从5×10⁻⁵到3×10⁻³进行扫描。根据我们的方案,每个模型在每个候选ηbase下训练5万步,参数组学习率及其他缩放后的优化器数值根据表1实例化。作为对比,我们在标准参数化(SP)下重复相同的扫描,此时扫描的学习率被全局应用,而不使用HeteroP的迁移规则。宽度扫描覆盖20M到1.12B的激活参数量。深度扫描则在固定宽度下改变层数

第 19 页

图8 Chimera在256²图像预训练上的算力最优扩展。上行,训练损失包络线: (a) 扩散训练损失与累积训练FLOPs的关系;下包络线标识了每个算力预算下的最佳检查点。 (b) 从包络线获胜检查点中得出的算力最优激活模型规模Nopt(C)。(c) 相应的算力最优训练token数Dopt(C),使用每个模型记录的每步FLOPs计算得出。下行,IsoFLOP曲线: (d) 在固定算力预算下,扩散损失与激活模型规模的关系;标记的曲线最小值标识了每个预算下的最优模型。 (e) 从这些最小值推断出的算力最优激活模型规模。(f) 相应的算力最优训练token数。 虚线表示拟合的幂律,其指数标注在扩展面板中。

从4扩展到32,激活参数量覆盖20M到150M。在两组扫描中,所有其他架构和训练设置均按第5.1节的规定保持不变。

结果。图7绘制了两个模型族在50k步后的训练损失与基础学习率ηbase的关系。两个观察结果支持HeteroP迁移方案。首先,最优基础学习率在不同规模下大致稳定:每个配置在ηbase = 10⁻³附近达到最小值,在56倍的模型规模范围(图7a)和8倍的深度范围(图7b)内,扫描网格上的漂移最多为一个点,且最优值周围的损失盆地在所有规模下保持宽广平坦。其次,曲线排列清晰有序:在每个学习率下,更宽和更深的模型均实现严格更低的损失,且无交叉现象,表明该参数化方案保留了规模带来的收益,而非以稳定性为代价。综上,这些结果支持将代理模型上调优的基础学习率沿两个轴迁移,因此我们在第5.3节的扩展研究中将所有运行的ηbase固定为10⁻³。相比之下,在SP下,最优全局学习率随规模变化,且多个高学习率运行变得不稳定(图7c和7d),导致训练次优,且用于拟合扩展律的测量结果可靠性降低(稍后在5.6节讨论)。

5.3 算力最优扩展律

我们使用所有三种估计方法评估参数与训练token之间的算力最优分配:训练曲线包络线、IsoFLOP曲线,以及损失曲面的直接参数拟合(公式29)。在所有情况下,我们首先使用表4中的模型族以不同数量的token进行训练,并确保所有模型均在无限数据机制下训练。所有拟合均使用激活参数量N,因为这是决定我们稀疏MoE骨干网络每token计算量的量,并使用第3.1节定义的扩散训练损失。第5.1节中的预热后恒定基础学习率调度使我们能够将长运行中的中间检查点视为可比较的短周期运行。

具体而言,包络线估计遵循损失-FLOPs轨迹的下包络线,并记录

第 20 页

0.288

参数量4.02B 斜率=0.564 斜率=0.431 100B 0.249 1.55B

481.6M

199.8M 1B 损失 0.209 75.3M 25M 参数量 令牌数 训练 视觉 10B 0.169 激活 100M

0.13 10¹⁷ 10¹⁸ 10¹⁹ 10²⁰ 10²¹ 10¹⁸ 10¹⁹ 10²⁰ 10²¹ 10²² 10¹⁸ 10¹⁹ 10²⁰ 10²¹ 10²² FLOPs

(a) 训练损失包络。 (b) 包络最优模型大小。 (c) 包络最优训练令牌数。

0.288

斜率=0.444 斜率=0.555

100B 0.249 FLOPs5.6e+171.3e+182.9e+186.5e+181.5e+193.3e+197.4e+191.7e+208.0e+20拟合(42个预算)最小值 1B 损失 0.209 参数量 令牌数 训练 10B 0.169 激活 视觉

100M

0.13 100M 1B 10¹⁸ 10¹⁹ 10²⁰ 10²¹ 10²² 10¹⁸ 10¹⁹ 10²⁰ 10²¹ 10²² 激活参数量 FLOPs FLOPs

(d) IsoFLOP损失曲线。 (e) IsoFLOP最优模型大小。 (f) IsoFLOP最优训练令牌数。

图9 Chimera在180p视频预训练上的算力最优缩放。上行,训练损失包络:(a) 扩散训练损失与累积训练FLOPs的关系;下包络标识了每个算力预算下的最佳检查点。(b) 从包络优胜检查点得出的算力最优激活模型大小 Nopt(C)。(c) 相应的算力最优训练令牌数 Dopt(C),使用每个模型记录的每步FLOPs计算得出。下行,IsoFLOP曲线:(d) 在固定算力预算下,扩散损失与激活模型大小的关系;二次曲线最小值(或边界切片的观测最小值)标识了每个预算下的最优模型。(e) 从这些最小值推断出的算力最优激活模型大小。(f) 相应的算力最优训练令牌数。虚线表示拟合的幂律,其指数标注在缩放面板中。

在每个算力预算下达到最低损失。尽管对于固定模型,累积FLOPs随 D 增长,但相同的FLOP预算在不同模型大小下对应的视觉令牌数量不同,因为每个令牌的成本随 N 变化。因此,每个包络优胜检查点共同决定了 Nopt(C) 和 Dopt(C)。后者是与所选模型大小相关的最优训练量,而非独立的算力轴。我们使用记录的每步FLOPs将每个检查点映射到 C。IsoFLOP估计则是在固定FLOPs处对轨迹进行切片,拟合损失关于 log N 的局部二次曲线,并利用曲线最小值推断 Nopt(C) 和 Dopt(C)。然后我们对这些最优值拟合幂律。这反映了Hoffmann等人[36]中的前两种经验估计方法,同时将其适配到视觉扩散损失和激活参数量核算中。

图像生成的缩放定律。对于256²图像预训练,当前拟合使用了36次有效运行,覆盖29种激活模型大小和1.2 × 10⁵个记录的损失点。包络跨越8.6 × 10¹⁶至2.2 × 10²¹ FLOPs,而IsoFLOP曲线使用了从6.2 × 10¹⁷到1.55 × 10²⁰ FLOPs的内部预算。图8 (a-c)显示,训练曲线排列有序,且随着预算增加,下包络从较小模型移向较大模型。所得前沿接近平衡:包络拟合给出 Nopt(C) ∝C⁰·⁵⁰⁵ 和 Dopt(C) ∝C⁰·⁴⁸⁴。指数之和为0.989 ≈1,与近似算力关系 C ∝ND 一致。算力在激活模型大小和视觉令牌数量之间近乎均匀分配。

图8 (d-f)提供了同一规律的独立视角。每个固定算力切片在模型大小上形成平滑、近似凸的曲线,其最小值随算力增加而右移。拟合这些最小值得到 Nopt(C) ∝C⁰·⁴⁸¹ 和 Dopt(C) ∝C⁰·⁵¹¹。包络与IsoFLOP估计之间的一致性表明,额外的图像训练算力应近乎均匀地分配给激活参数量和视觉令牌,而非主要花费在仅扩大模型或仅延长训练上。

视频生成的缩放定律。我们在180p视频上重复了该研究,使用相同的29模型激活参数量网格进行了30次独立的从头训练运行。视频曲线在包络上覆盖1.8 × 10¹⁷至9.5 × 10²⁰ FLOPs,IsoFLOP分析使用从5.6 × 10¹⁷到3.2 × 10²⁰ FLOPs的预算,其中高算力前沿

第 21 页

以6×10²⁰和8×10²⁰ FLOPs切片为锚点。

视频前沿再次接近平衡,但目前可用的最大预算略微倾向于更大的激活模型。图9(a-c)中的完整包络拟合给出Nopt(C) ∝ C⁰·⁵⁶⁴和Dopt(C) ∝ C⁰·⁴³¹。当包含高计算量切片时,图9(d-f)中的IsoFLOP曲线给出Nopt(C) ∝ C⁰·⁵⁵⁵和Dopt(C) ∝ C⁰·⁴⁴⁴。

与图像生成相比,视频生成在两种估计方法下都始终更偏向模型规模:包络/IsoFLOP的模型规模指数从图像的0.505/0.481增加到视频的0.564/0.555,而相应的token指数从0.484/0.511下降到0.431/0.444。因此,随着计算预算的增长,计算最优的视频训练会将新增计算量中略大的一部分分配给模型容量而非训练token。对这种转变的一个合理解释是,视频生成对骨干网络提出了更广泛的表示负担。除了图像所需的外观和语义结构外,视频模型还必须捕捉帧间对应关系,包括物体动态、时序对应和相机运动。这可能降低了相对于扩大N而言扩大D的边际回报,这与观察到的视频前沿偏移一致。

参数化损失拟合。包络和IsoFLOP估计器仅使用每个预算下的最优点。作为第三种独立途径,我们遵循Hoffmann等人[36]的第三种方法,一次性将所有测量值拟合到公式29的完整损失曲面:通过最小化预测与观测对数损失之间残差的Huber损失(δ = 10⁻³),使用L-BFGS-B从4500个初始化点的网格中(视频加倍,使用以观测损失尺度为中心的第二个网格)获得五个参数{E, A, B, a, b}。对于图像,拟合使用相同36次运行的去除尖峰的训练轨迹,每个模型采样24个几何间隔的检查点(696个点,跨越3.2×10¹⁷到2.2×10²¹ FLOPs);对于视频,使用30次运行中每次的最终检查点。拟合曲面为

ˆL_image(N, D) = 0.126 + 5.28 N⁻⁰·³¹⁵ + 33.8 D⁻⁰·³³⁶, (30)

ˆL_video(N, D) = 0.124 + 8.07 N⁻⁰·³³⁰ + 145.2 D⁻⁰·³⁹⁴. (31)

两种拟合都很准确:图像曲面以R² = 0.993和中位绝对相对误差0.19%(留一模型验证下为0.22%)再现了观测对数损失,视频曲面预测留出的最终损失的中位误差为0.49%。

在约束C ≈ 6ND下最小化拟合曲面,得到图像的Nopt(C) ∝ C⁰·⁵¹⁶, Dopt(C) ∝ C⁰·⁴⁸⁴,视频的Nopt(C) ∝ C⁰·⁵⁴⁴, Dopt(C) ∝ C⁰·⁴⁵⁶。这些闭式指数与上述两种非参数估计器高度一致:所有三种途径都将图像前沿的模型规模指数置于[0.48, 0.52]区间内,视频前沿置于[0.53, 0.56]区间内。基于运行的bootstrap(对80%模型设置进行100次重采样)给出图像指数的80%区间为[0.503, 0.546];相应的视频区间更宽([0.47, 0.80]),因为最终检查点在D上仅跨越0.7个数量级,因此我们将视频拟合解读为确认了分配方向而非精确化其指数。值得注意的是,拟合的不可约损失在两种模态间几乎相同(E = 0.126对比0.124)。E的近乎相等与两种模态使用相同模型(包括去噪器和VAE)一致,因为架构变化主要倾向于平移缩放曲线的偏移量[31]。总体而言,三种估计器一致表明,图像预训练计算应在激活参数和视觉token之间近乎均等分配,而视频预训练目前倾向于将略大份额分配给模型规模。

5.4 最优图像-视频数据比例

我们将计算最优分析沿第4.2节引入的混合轴扩展,并估计最优图像-视频数据比例如何随训练预算演变。

设置。与上述单模态研究不同,这些运行联合训练图像和视频数据。我们在几种介于1:1和5:1之间的图像:视频混合比例下,训练激活参数约从50M到2B的模型,遵循第5.1节的方法,并分别记录图像和视频扩散损失。注意,这个比例搜索范围由图像和视频数据的实际数量决定,考虑两个事实:i) 视频数据通常少于图像数据;ii) 所选比例理想情况下应维持无限数据状态(较少的视频数据复用)。具体而言,我们在训练期间固定总批量大小,并平衡图像和视频样本的数量。图像和视频数据分别遵循之前的256²和180p设置。分析涵盖八个计算预算,跨越10¹⁸到10¹⁹ FLOPs。在给定预算下切片所有训练轨迹,每个预算产生39-45个测量值,每个

第 22 页

1e18 1.5e18 2e18 3e18 5 n=45rmse=0.0024 n=45rmse=0.0021 n=45rmse=0.0022 n=43rmse=0.0012

4

3 Ratio 0.23215

2 Image:Video 0.22078

0.20941 loss 1 4e18 5e18 7.5e18 1e19 training 0.19805 5 n=42rmse=0.0014 n=42rmse=0.0014 n=41rmse=0.0010 n=39rmse=0.0011 Image

4

3 0.18668 Ratio

0.17531 2 Image:Video

0.16394

1 100M 200M 300M 500M 1B 1.5B 2B 100M 200M 300M 500M 1B 1.5B 2B 100M 200M 300M 500M 1B 1.5B 2B 100M 200M 300M 500M 1B 1.5B 2B Parameters (M) Parameters (M) Parameters (M) Parameters (M)

图10 图像扩散损失在模型规模与图像:视频数据样本比上的IsoFLOP曲面。针对从10^18到10^19 FLOPs的八个计算预算,我们为跨越不同模型规模和混合比例的实验损失拟合了二次曲面。每个圆圈标记一个实验数据点,星号标记该预算下的拟合最优点。

对应一种模型规模与比例配置。遵循第4.2节扩展的IsoFLOP方法,我们在每个预算下对模型规模和混合比例上的每个损失拟合二次曲面,并将曲面最优点作为该预算下的计算最优配置。

IsoFLOP损失曲面。图10展示了拟合的图像损失曲面。二次曲面在所有预算下均紧密复现了测量值,均方根残差最高为2.4 × 10⁻³,约为测量损失的1%。曲面平滑且近似凸,其最优点(星号)位于比例范围的内部。我们观察到两个一致的模式。首先,随着预算增长,最优模型规模向更大模型偏移,这与第5.3节的计算最优前沿一致。其次,在最优点附近,损失沿模型规模轴的变化远强于沿比例轴的变化。因此,正确选择模型规模最为重要,而适度偏离最优混合比例的代价很小。

计算最优数据比例。图11追踪了每个计算预算下图像和视频损失的最优图像-视频比例,以及幂律拟合。两种损失导致了明显不同的最优值。对于图像损失,最优值在所有考察的预算下始终偏向图像,介于3:1和4:1之间。它仅随计算量增加而缓慢向视频偏移,从10^18 FLOPs时的大约4:1移动到10^19 FLOPs时的大约3:1。拟合指数为-0.08,意味着最优比例每十倍计算量下降约17%。对于视频损失,拟合最优值在所有预算下均保持在1:1,即我们搜索范围的视频偏重边界,拟合指数为0.00。由于该最优值位于边界上,我们将其解释为单边结果:在本文探索的混合比例中,视频损失随视频份额增加而单调改善。

图像损失拟合,斜率=-0.08 视频损失拟合,斜率=+0.00 5:1 比例 0.73:1 4:1 比例 0.59:1 3:1 比例 0.44:1 样本 总token 2:1 比例 0.29:1 图像:视频 最优 1:1 比例 0.15:1 最优 1e18 1.5e18 2e18 3e18 4e18 5e18 7.5e18 1e19 FLOPs

图11 计算最优图像:视频比例与训练计算量的关系。图像损失最优值从约4:1缓慢漂移至3:1(指数-0.08),而视频损失最优值保持在1:1,即拟合范围内最偏重视频的混合比例。

这些结果揭示了数据混合的一个简单原则:计算最优混合比例偏向图像,但随着训练预算增长而缓慢向视频偏移。考虑到图像和视频数据的不同角色和成本,这一行为是直观的。图像以每个样本低得多的token成本提供外观和语义监督,使得图像偏重的混合比例在低计算量区间更具计算效率。随着计算量增加,最优

22

第 23 页

混合分配将稍多的份额分配给视频,表明在模型从图像中获取足够的外观先验后,额外预算可用于学习时间上丰富且长尾的动态。较小的负斜率进一步表明这种转变是渐进而非突变的:视频的价值随规模增长而增加,但并未消除图像数据的token效率优势。

我们还将样本比例转换为包含文本token的总token比例。在此视角下,相同的最优配置在训练token方面对应着更偏重视频的分配,这反映了每个视频样本显著更高的token成本。结合第5.3节的规模-数据前沿,这些拟合结果为我们最大规模的运行指定了计算最优的模型规模、token预算和数据混合。

5.5 生成质量与对比

匹配计算量下的损失对比。 我们构建了Wan2.1 [82]和Z-Image [8]架构的2B实例,并与两个2B Chimera变体在相同数据、相同扩散目标和共享的5 × 10²⁰ FLOPs计算预算下进行训练。第一个Chimera变体Chimera-dense使用稠密FFN和标准参数化,提供了无稀疏容量或HeteroP的匹配对比。完整变体则加入了MoE、iHC和HeteroP。

图12显示Chimera具有明显的收敛优势。在0.149的共同训练损失下,Wan需要4.29 × 10²⁰ FLOPs,Z-Image需要3.75 × 10²⁰ FLOPs。Chimera-dense以2.55 × 10²⁰ FLOPs达到相同损失,计算效率比Wan高1.7倍,尽管未使用MoE或HeteroP。完整Chimera配置仅需6.27 × 10¹⁹ FLOPs即达到目标,相比Wan实现了6.8倍的计算效率提升。其曲线在整个共享计算范围内始终低于所有稠密基线。这些结果区分了两个改进来源:稠密Chimera架构本身已比匹配的全注意力基线收敛更高效,而稀疏容量、iHC和HeteroP进一步放大了这一优势。

定性结果。 图13展示了Chimera在1344 × 864分辨率下生成的文生图样本,使用的提示词涵盖从短语到详细描述。样本覆盖多种视觉风格,包括写实微距和人像摄影、影棚风格美食摄影、水彩与水墨插画以及动漫风格作品。在这些示例中,Chimera捕捉了精细结构,如花瓣和花蕊的几何形态、皮肤纹理以及液体和玻璃表面的反射,同时保持了连贯的光照、景深、物体边界和艺术风格。最后一行进一步检验了排版感知生成,每个示例将神话中的奇美拉与单词"Chimera"结合。该单词使用提示词指定的材质渲染,包括发光气泡、淋洒的酱汁和马克笔笔触,同时保持可读性并与每个场景的几何和光照视觉一致。总体而言,这些示例表明Chimera尽管主要依赖线性注意力,仍能生成具有强局部细节、全局连贯性和图文对齐的高分辨率图像。尽管仅在1K图像上训练,Chimera能够以零样本方式直接生成连贯的2K和4K图像,无需针对特定分辨率微调。

图15展示了文生视频的定性结果,显示每个81帧(5秒)视频中均匀采样的五帧。在涉及物体出现、自然和关节运动以及相机移动的多样化场景中,Chimera生成时间上一致的内容,同时保持物体身份、场景构图和光照。包含单词"Relax"和"Chimera"的示例进一步表明,渲染的文本在帧间保持可读性和几何一致性。这些结果表明Chimera随时间保持了强大的语义和视觉一致性。

零样本长度外推。 为测试KDA和我们的模态感知因果卷积是否为长度外推提供了自然机制,我们评估了一个使用5秒视频片段训练的Chimera检查点,在推理时

第 24 页

图13 Chimera的定性文本到图像生成样本。所有图像均以1344 × 864分辨率生成,采用分类器自由引导尺度4,使用的提示词涵盖从短句到长段详细描述。

我们生成了时长分别为5、10、15、20、25和30秒的视频,未进行特定时长的微调或位置插值。我们与Wan2.1-T2V-1.3B [82]和HunyuanVideo-1.5 [80]进行了比较。对于每个模型和时长,我们生成512个视频,并与从验证集中采样的512个参考视频进行评估。为了在测量质量随训练时长范围外逐步延伸的变化时保持评估窗口固定,我们仅计算每个视频最后5秒的两种指标。这为FID提供了512×81个生成帧,为FVD提供了512个生成尾部片段。我们在所有模型中使用相同的提示词、种子、分辨率、帧率和时长网格,尽管共享的448×288分辨率和16-fps设置超出了基线模型的原始配置。

图16显示,随着生成长度的增加,Chimera保持质量的能力显著更强。从5秒到30秒,其FID仅从77.1增加到82.1,相对退化6.5%,而Wan2.1为50.5%,HunyuanVideo-1.5为53.6%。其FVD从685.8增加到829.5,对应20.9%的退化,而Wan2.1和HunyuanVideo-1.5分别退化了33.9%和33.7%。在30秒时,Chimera还取得了三个模型中最低的绝对FID和FVD测量值。这些结果与我们NoPE设计的架构动机一致:KDA在训练时长范围外重复应用相同的内容自适应循环更新,而时间因果卷积通过固定支持核提供局部结构,不引入外推误差。

第 25 页

图14 零样本高分辨率生成。我们的模型以零样本方式生成4K(左图)和2K(右图)分辨率的图像。

长度相关的位置相位。由此产生的骨干网络因此展现出自然的零样本时序外推能力。

图17中的定性对比揭示了相同的趋势:Wan2.1在长时域推理中变得模糊且近乎静止,而HunyuanVideo-1.5生成的帧更清晰,但同样表现出很少的运动。相比之下,Chimera保持清晰,并在整个30秒序列中持续演化,避免了这两种失效模式。

基准评测。为定量评估Chimera的图像生成能力,我们在两个广泛使用的图像基准GenEval和DPG-Bench上对其进行评测。这两个基准共同衡量了跨属性(如物体数量、颜色和空间关系)的构图准确性,以及整体的文本-图像对齐度。表2报告了结果。

Chimera取得了0.82的GenEval总分和85.12的DPG-Bench分数。它在GenEval上与FLUX.1-dev和Z-Image-Turbo持平,同时在DPG-Bench上优于两者,并且在两项综合指标上均超越了除Seedream 3.0之外的所有其他评估基线。尽管我们有限的训练预算使Chimera无法匹敌最强大的大规模图像生成模型,但其相对于其余基线的一致性优势,证明了这一以更少算力训练的统一模型具有强大的构图理解和提示词对齐能力。

25

第 26 页

图15 Chimera 的定性文本到视频样本。每行展示一个81帧视频中均匀间隔的五帧,生成分辨率为448×288,分类器自由引导尺度为8,时间从左向右推进。

模型 60 模型 1100 模型 40 模型 120 门控Delta-Net / KDA 门控Delta-Net / KDA 门控Delta-Net / KDA 门控Delta-Net / KDA Wan2.1-T2V-1.3B Wan2.1-T2V-1.3B Wan2.1-T2V-1.3B Wan2.1-T2V-1.3B 50 HunyuanVideo-1.5 ↓ HunyuanVideo-1.5 HunyuanVideo-1.5 ↓ HunyuanVideo-1.5 1000 30 110 40 (%)s (%)s 5 5 900 100 ↓ ↓ 20 30 来自 来自 FID FVD 90 800 20 10 变化 80 变化 FID 10 700 FVD 70 0 0 600 5 10 15 20 25 30 5 10 15 20 25 30 5 10 15 20 25 30 5 10 15 20 25 30 视频时长 (秒) 视频时长 (秒) 视频时长 (秒) 视频时长 (秒)

(a) 绝对FID。 (b) 相对于5秒的FID变化。 (c) 绝对FVD。 (d) 相对于5秒的FVD变化。 图16 超越5秒训练时长的零样本视频长度外推。我们生成了5–30秒的视频,未进行特定长度的微调,并仅评估每个视频的最后5秒。KDA 指代我们的 Chimera 模型。图(a)和(c)报告了绝对FID和FVD,而图(b)和(d)报告了相对于各模型自身5秒结果的百分比变化。评估中每个模型和时长使用512个视频,FID使用512×81尾部帧,FVD使用512个尾部片段。数值越低越好,正相对变化表示性能下降。

5.6 消融研究

混合KDA–MLA注意力提升内存效率与延迟。为分离混合注意力的系统级优势,我们将KDA/MLA骨干与一个其他条件相同的MHA/MLA对应模型进行比较,两者均具有约2B激活参数。两者使用相同的3:1调度,但对应模型中的每一层都被替换为传统的多头自注意力,而周期性的MLA层及所有其他组件保持不变。我们使用批量大小为1、BF16激活,在NVIDIA A100-SXM4-80GB上运行,每个时间切片有512个文本token和18×28个视觉token,并改变总序列长度。内存实验测量分配的峰值CUDA内存:我们在一次完整的去噪器前向过程中分配、访问并保留设备上的所有缓存张量。24个MHA层存储序列- 80 79.2 GiB GPU限制 MHA 内存不足 · 152k (1.68×) 100 (GiB) 60 (2.14×) 80 (秒) 内存 40 60 延迟 缓存 GPU 40 前向 20 20 峰值 GPU前向缓存延迟内存 MHA/MLAKDA/MLA 3:13:1 0 11k(5秒) 61k(30秒) 122k(60秒) 182k(90秒) 255k(126秒) 0 总DiT token数 图18 内存和延迟随token数增长。 我们比较了具有2B激活参数的3:1 KDA/MLA和MHA/MLA骨干。

26

第 27 页

Wan2.1 HunyuanVideo-1.5

Chimera

(a) 碗从直立状态缓慢倾倒至侧翻并保持静止,米粒以稳定流束倾泻而出,向下倾泻并向前铺散在台面上,部分米粒轻微弹跳后聚成小堆;台面保持静止。

Wan2.1 HunyuanVideo-1.5

Chimera

(b) 玫瑰花瓣从中心向外逐渐舒展,呈现缓慢自然的绽放动作,背景保持固定;无其他运动发生。

图17 定性零样本视频时长外推至30秒。针对每个提示词,我们展示了由Wan2.1、HunyuanVideo-1.5和Chimera生成的视频中每隔6秒采样的六帧画面,时间从左向右推进。所有模型在每组对比中使用相同的提示词、种子、分辨率、帧率和时长。

依赖序列长度的BF16键值缓存,大小为O(NHdh) = O(ND),而24个KDA层则保留形状为H × dh × dh的固定尺寸FP32循环状态,内存开销为O(Hd2h),与N无关。两种骨干网络均保留相同的八个BF16 MLA潜键值缓存。MHA通过FlashAttention实现。关于延迟,我们仅计时去噪器前向传播,排除缓存构建,同步CUDA,并报告三次预热后运行的中位数。

图18显示,MHA/MLA骨干网络在大约152k个token时达到GPU内存上限并首次出现内存不足,而KDA/MLA骨干网络在相同GPU上完成了255k token的测试,在roll-out-cache设置下支持超过1.68倍的序列长度。尽管FlashAttention消除了二次方注意力工作空间,MHA仍会产生二次方注意力运算,因此其延迟随序列长度增长更快。在255k token时,KDA/MLA比MHA/MLA快2.14倍。因此,将大部分MHA层替换为KDA可大幅减少持久缓存增长和长序列延迟,而共享的周期性MLA层则保留了直接的全局token交互。

MoE、iHC和HeteroP提升预训练计算效率。我们从2B Chimera-dense基线出发,逐步叠加消融这三个组件。我们首先将其密集FFN替换为稀疏激活的MoE层,同时匹配激活参数量。然后加入iHC,以在多个残差流上提供自适应读写映射。最后,应用HeteroP(第4.1节),迁移接近最优的基础学习率及相关的模块级优化器设置。

图19显示,每项添加都改善了损失-计算轨迹。在0.149的共同训练损失下,Chimera-

第 28 页

表2 GenEval和DPG-Bench上的文本到图像生成结果。数值越高越好。注意,我们的Chimera仅使用600 H100天的预算进行训练。

| 模型 | 单目标 | 双目标 | 计数 | 颜色 | 位置 | 颜色属性 | 总体↑ | DPG 总体↑ | |——|——–|——–|——|——|——|———-|——–|————| | 仅生成 | | | | | | | | | | PixArt-α [12] | 0.98 | 0.50 | 0.44 | 0.80 | 0.08 | 0.07 | 0.48 | 71.11 | | SD v2.1 [67] | 0.98 | 0.51 | 0.44 | 0.85 | 0.07 | 0.17 | 0.50 | 68.09 | | DALL-E 2 [66] | 0.94 | 0.66 | 0.49 | 0.77 | 0.10 | 0.19 | 0.52 | – | | SDXL | 0.98 | 0.74 | 0.39 | 0.85 | 0.15 | 0.23 | 0.55 | 74.65 | | DALL-E 3 | 0.96 | 0.87 | 0.47 | 0.83 | 0.43 | 0.45 | 0.67 | 83.50 | | SD3-Medium [24] | 0.99 | 0.94 | 0.72 | 0.89 | 0.33 | 0.60 | 0.74 | 84.08 | | FLUX.1-dev† | 0.98 | 0.93 | 0.75 | 0.93 | 0.68 | 0.65 | 0.82 | 84.00 | | Seedream 3.0 | 0.99 | 0.96 | 0.91 | 0.93 | 0.47 | 0.80 | 0.84 | 88.27 | | Z-Image-Turbo [8] | 1.00 | 0.95 | 0.77 | 0.89 | 0.65 | 0.68 | 0.82 | 84.86 | | Chimera | 0.98 | 0.88 | 0.85 | 0.88 | 0.62 | 0.68 | 0.82 | 85.12 |

密集模型需要2.55 × 10²⁰ FLOPs。引入MoE将此需求降至1.76 × 10²⁰ FLOPs,计算效率提升约1.5倍。添加iHC进一步降至1.50 × 10²⁰ FLOPs,相比密集基线提升1.7倍。采用HeteroP的完整配置以6.27 × 10¹⁹ FLOPs达到相同损失,对应4.1倍增益。这一进展表明稀疏容量和多流残差路由提供了互补增益,而HeteroP贡献了最大的额外改进。与图7一致,HeteroP参数化使更大的基础学习率保持稳定且接近最优,在不牺牲训练稳定性的情况下加速收敛。

0.170 模型 无HeteroP时学习率迁移失败。我们首先在单次运行层面消融迁移方案。图7底行在标准参数化(SP)下重复第5.2节的宽度和深度扫描,使用相同的未缩放全局学习率数值网格但不采用我们的迁移规则。与顶行对齐的最小值相比,SP下的最优学习率在不同规模间不再一致。图7c和7d中拟合的最优值在宽度族中跨越6倍范围,从最小模型的10⁻⁴到较大模型的约6 × 10⁻⁴,并随深度增长向更小值偏移。没有单一全局学习率能同时接近整个族的最优值,因此在代理上调优的全局学习率必然在大多数其他规模上失配。

扫描进一步揭示了高学习率下的稳定性失效。在HeteroP方案下,每条曲线在ηbase = 10⁻³附近保持宽阔平坦的盆地,并平稳退化至ηbase = 3 × 10⁻³。而在SP下,一旦全局学习率仅以微小幅度超过各模型最优值,损失便急剧上升,且多次运行直接崩溃。最小宽度模型在接近4 × 10⁻⁴时已超出绘制的损失范围,中等宽度模型在10⁻³至3 × 10⁻³之间爆炸,最深模型在2 × 10⁻³处急剧飙升。这些爆炸还破坏了HeteroP在每个扫描基础学习率下保持的按规模清晰排序的损失。因此SP以两种复合方式失效:最优值漂移和高学习率发散,这使得基于代理的超参数调优不可靠。

无HeteroP时的缩放定律偏差。上述失配不仅是单次运行的麻烦:它使基于此类运行拟合的缩放定律产生偏差。为量化这一点,我们在SP下训练的匹配模型族上重复第5.3节的256²图像研究,其中每个模型重用代理调优的全局学习率,因此承受规模依赖的失配惩罚。效果在图20a中直接可见:损失轨迹比图8中的HeteroP对应项更嘈杂,且多个大模型在训练后期出现损失尖峰。

28

第 29 页

0.285 100B 参数量4.02B 斜率=0.588 斜率=0.392

0.246 1.25B 341.1M 10B 100B

100.3M 损失 0.212 25M 8.4M 参数量 1B tokens 训练 0.182 视觉 10B 激活参数量 100M 0.157

0.135 10M 1B 1015 1016 1017 1018 1019 1020 1021 1022 1017 1018 1019 1020 1021 1022 1023 1017 1018 1019 1020 1021 1022 FLOPs

(a) SP训练损失包络。 (b) 包络最优模型大小。 (c) 包络最优训练token数。

0.285

斜率=0.410 斜率=0.581

0.246 10B 100B FLOPs3.0e+177.0e+171.6e+183.9e+189.1e+182.1e+195.0e+191.2e+202.8e+201.0e+21拟合趋势(选定)最小值至 1e21 100B 损失 0.212 参数量 1B tokens 训练 0.182 视觉 10B 激活参数量 100M 0.157

0.135 10M 1B 10M 100M 1B 1017 1018 1019 1020 1021 1022 1023 1017 1018 1019 1020 1021 1022 激活参数量 FLOPs FLOPs

(d) SP IsoFLOP损失曲线。 (e) IsoFLOP最优模型大小。 (f) IsoFLOP最优训练token数。

图20 无HeteroP的计算最优缩放(256²图像预训练),与图8相比,得到的缩放方案更为保守。所有实验均使用标准参数化(SP)和代理调优的全局学习率。上行,训练损失包络:(a) 与图8b相同模型族的扩散训练损失与累积训练FLOPs的关系;轨迹噪声更大,且若干大模型在训练后期出现损失尖峰。(b) 包络最优模型大小Nopt(C),其拟合指数从HeteroP下的0.505增至0.588。(c) 对应的最优训练token数Dopt(C),其指数从0.484降至0.392。下行,IsoFLOP曲线:(d) 固定计算量下的损失曲线,突出显示了每条曲线的拟合最小值。(e) IsoFLOP最优模型大小,指数为0.581,而非图8e中迁移得到的0.481。(f) 对应的最优训练token数,指数为0.410,而非0.511。两种估计器都将分配方案推向模型过大且训练不足的方向,表明规模依赖的学习率失调会偏置拟合的缩放定律。

这种失真会传播到拟合的定律中。对SP实验的包络估计给出Nopt(C) ∝ C^0.588和Dopt(C) ∝ C^0.392(图20(a-c)),而IsoFLOP估计给出C^0.581和C^0.410(图20(d-f))。与HeteroP的拟合值(0.505和0.481)相比,两种估计器都将模型大小指数提高了约0.08–0.10,并将token指数降低了相似的幅度。由于失调惩罚随规模系统性地变化,每个计算预算下的最优点发生了偏移,而不仅仅是噪声更大,并且第5.3节中近乎平衡的分配被一种偏向参数而非数据的虚假偏好所取代。从表面上看,SP定律规定,相对于HeteroP定律,计算最优模型每增加一个数量级的计算量,其规模增长约1.2倍,当外推至拟合范围之外的三个数量级时,模型会大约偏大2倍,并相应地训练不足。因此,HeteroP并非一种可选的改进,而是获得可靠的计算最优缩放定律的先决条件。

5.7 讨论

我们讨论了几种技术,包括Muon优化器、MoE以及时间嵌入的细节。

Muon优化器。受语言模型研究的启发,我们尝试对隐藏层使用Muon优化器[42]。尽管我们在调优超参数和划分正确的参数组方面投入了足够的努力,但我们报告称,使用Muon优化器下的损失系统性地差于使用AdamW。唯一Muon表现更优的情况是在大学习率下的训练初期。这一结论在不同的模型架构、规模以及是否使用HeteroP和MoE的情况下均成立。我们假设Muon在扩散视觉生成中表现不如Adam,是因为它缺乏Adam隐式的低秩偏置。扩散训练结合了跨不同时间步和噪声水平的去噪目标,因此有用的优化信号可能集中在一小部分稳定方向上,而许多其他方向则是嘈杂或不一致的。为了验证这一点,我们比较了来自Adam和Muon模型的参数更新和已训练权重的频谱。我们发现Adam将其大部分更新和

第 30 页

权重能量集中在少得多的奇异方向上,而Muon产生的更新则显著更满秩且频谱更均匀。这支持了以下假设:Adam隐式地过滤出持久的低维去噪方向,而Muon将更新能量更均匀地分散到整个矩阵上。因此,Muon在大学习率下能改善早期训练,但后期进展较慢,因为其更新能量被稀释,偏离了对扩散优化至关重要的稳定低秩子空间。

MoE。我们观察到,在基于扩散的视觉生成中,MoE扩展带来的计算效率提升远弱于语言建模中常见的水平。在我们的实验中,增加稀疏度仅带来约1.5倍的计算效率提升,显著低于常见√sparsity启发式方法所预测的增益。这表明,单纯增加非活跃专家的数量并不能为扩散模型转化为成比例的有效容量。我们推测,这一差距源于视觉去噪提供的可被利用的专家专业化程度较低:视觉token是连续的、空间冗余且高度相关的,而扩散时间步共享一个必须被一致建模的大型公共去噪组件。与此假设一致,我们发现专家路由表现出弱专业化,并且在不同token或时间步之间往往变得更加均匀。这些结果表明,扩散模型中的MoE稀疏性受到视觉去噪内在共享结构的约束,而不仅仅是路由或实现细节的限制。

时间嵌入。我们还观察到,时间步嵌入网络是扩散训练中对模型规模敏感的组件。在我们的默认设计中,正弦时间步特征通过一个MLP映射到模型维度。然而,为此MLP使用过宽的隐藏维度可能会破坏训练稳定性;例如,对于宽度为1024的骨干网络,4096维的隐藏层是不稳定的。这表明时间步MLP不应被视为独立于模型规模的固定辅助模块。我们推测,其原因是时间步嵌入充当全局条件信号,通常控制逐层调制,如缩放、偏移或门控。如果时间步MLP相对于骨干网络过宽,它可能产生过强或过于尖锐的时间步依赖调制,放大跨噪声水平的梯度冲突,并破坏共享的去噪表示。因此,我们根据骨干网络宽度来缩放时间步MLP的隐藏维度,从而提高了训练稳定性。

6 相关工作

用于视觉生成的扩散模型。扩散模型已被反复调整以适应视觉数据的结构、规模和可控性要求,以提升视觉生成质量。早期工作采用卷积U-Net骨干网络[33, 73],改进噪声调度[60]和引导[19]以提高生成保真度。后来的系统采用了分层[66, 68]和潜空间设计[67]。结合无分类器引导[32]和强大的语言编码器[59],这些模型实现了高质量的可控生成。后续工作重新审视了去噪骨干网络和潜空间表示。DiT用Transformer架构取代了卷积U-Net,实现了更强的扩展性[12, 24, 63]。同时,潜扩散所使用的VAE潜空间已被认为是视觉质量的瓶颈,这推动了表示自编码器[10, 102]的发展,并重新激发了对像素空间或混合像素-潜空间生成的兴趣[49, 96]。

在图像生成之外,用于视频生成的扩散模型经历了几个发展阶段。早期工作主要通过添加时序建模模块,将图像扩散模型适配到视频,在重用强大图像先验的同时学习运动[5, 6, 34, 35, 71]。最近,焦点已从生成短视频片段转向长时域视频。一类工作将视频扩散重新表述为自回归或因果式展开[11, 41, 72]。另一类与Chimera更相关的工作是采用高效的Transformer变体,通过利用时空注意力模式[21, 88, 89]、采用线性注意力[13, 83]和稀疏注意力[76, 98, 100]。在本文中,我们开发了一种具有最小归纳偏置的新型混合注意力架构,能够原生联合训练图像和视频生成。我们展示了高效、稳定的训练,以及达到Chinchilla最优分配的扩展法则。

高效注意力机制。高效注意力机制根据其减少的对象可大致分类为:被关注的表示、注意力算子本身或token交互的集合。第一类方法压缩键值表示,同时保留标准的softmax注意力公式[1, 52, 69]。第二类方法移除softmax操作,提供线性时间或恒定状态推理,同时保留可并行化的训练[29, 45, 75, 94]。第三类方法通过设计注意力模式[14, 105]或使其可学习[54, 97, 103],仅计算部分token交互,从而实现注意力稀疏化。在这项工作中,我们将Kimi Linear[78]的架构适配到视觉生成,同时注入最小的时空建模归纳偏置。

第 31 页

模型缩放。模型缩放研究的是,当我们分配更多参数、数据和算力时,模型质量如何变化。早期的缩放定律表明,语言模型的损失随模型大小、数据集大小和训练算力呈现可预测的幂律趋势[44]。后来,算力最优缩放系统地研究了在固定算力预算下,数据和模型大小的最优分配[36]。这些缩放原则也已从语言建模扩展到自回归图像、视频和多模态生成[30, 50]。为了降低超参数搜索的成本,一条互补的研究路线专注于参数化和超参数迁移[18, 58, 92]。我们提出的HeteroP基于这些原则,但针对一个不同的结构性问题:异构骨干网络需要模块特定的宽度比例,而非一个全局的模型宽度比例。此外,模型缩放不仅限于密集参数增长。稀疏激活和混合专家架构在保持激活计算量相对较低的同时,扩展了总容量[25, 26, 48]。在本工作中,我们整合了这些技术,以系统性地研究当代视觉扩散模型的缩放定律。

7 未来探索与结论

结论。我们提出了Chimera,一个混合、异构、单流的扩散骨干网络,并为其设计了一套原则性的缩放方案,用于token密集型视觉生成。在架构上,Chimera结合了用于高效长上下文状态跟踪的KDA、用于全局交互的周期性MLA,以及用于局部时空结构的模态感知短卷积,从而在没有位置编码的情况下实现了统一的文本-图像-视频序列。稀疏MoE、iHC和Sandwich Normalization进一步提升了模型容量和训练稳定性。为了缩放这种异构架构,HeteroP迁移了代理调优的超参数,并产生了一个一致调优的模型家族,我们从中推导出了关于激活模型大小、视觉训练token以及图像-视频组成的算力最优定律。我们希望Chimera所体现的架构原则能为设计未来的长上下文视觉生成器提供有用的指导。更广泛地说,我们希望HeteroP和算力最优框架能提供一种可复用的方法,将低成本的代理实验转化为多模态生成器在模型、数据和算力分配上的可靠决策。

未来探索。Chimera的未来探索存在一些扩展方向。首先,我们的研究刻意隔离了宽度和深度迁移。尽管HeteroP根据功能扇入对异构模块进行了参数化,但缩放家族仍固定了若干结构轴,包括iHC残差流数量、MoE专家和Top-K路由配置(及其稀疏性),以及第4.1节详述的MLA KV压缩比。一个更完备、更灵活的参数化方案,应能从低成本的密集代理模型迁移到稀疏目标模型,并使残差流数量、专家数量、路由稀疏性以及相关结构选择依赖于缩放规模,而非预先设定。其次,虽然Chimera已能在单一流中处理文本、图像和视频token,但本研究仅评估了文生图和文生视频生成。将Chimera中成功的设计选择融入单流混合-线性-全局架构(例如,Qwen3.5 [79]、K3 [77]),是通向一个能同时进行长上下文多模态理解和生成的单一模型的有前景路径。第三,Chimera仍依赖于扩散模型特有的AdaLN调制。我们的初步实验表明,通过直接以扩散时间步为条件来调制iHC的流读取和写入映射,可以将AdaLN调制吸收进iHC中。移除独立的AdaLN调制将能进一步对齐混合语言模型和混合扩散模型架构,使其走向共享的骨干网络。

致谢。我们感谢Hongwu Peng对Muon优化器和µP的深刻讨论;感谢Bi Sai的建设性反馈;并感谢Tong Sun、Rajiv Jain、Kalyan Sunkavalli和John Yang对本项目的支持。

31

第 32 页

参考文献

[1] Joshua Ainslie, James Lee-Thorp, Michiel De Jong, Yury Zemlyanskiy, Federico Lebrón, and Sumit Sanghai. Gqa: Training generalized multi-query transformer models from multi-head checkpoints. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, pages 4895–4901, 2023.

[2] Zeyuan Allen-Zhu. Physics of language models: Part 4.1, architecture design and the magic of canon layers. Advances in Neural Information Processing Systems, 38:42349–42369, 2026.

[3] Federico Barbero, Alex Vitvitskyi, Christos Perivolaropoulos, Razvan Pascanu, and Petar Veličković. Round and round we go! what makes rotary positional encodings useful? arXiv preprint arXiv:2410.06205, 2024.

[4] Black Forest Labs. FLUX.2: Frontier Visual Intelligence. https://bfl.ai/blog/flux-2, 2025.

[5] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, et al. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127, 2023.

[6] Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, and Karsten Kreis. Align your latents: High-resolution video synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 22563–22575, 2023.

[7] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. Video generation models as world simulators, 2024. https://openai.com/research/video-generation-models-as-world-simulators.

[8] Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Xin Jin, Liangchen Li, et al. Z-image: An efficient image generation foundation model with single-stream diffusion transformer. arXiv preprint arXiv:2511.22699, 2025.

[9] Matias D Cattaneo and Boris Shigida. The effect of mini-batch noise on the implicit bias of adam. arXiv preprint arXiv:2602.01642, 2026.

[10] Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, and Kai Zhang. Aligning visual foundation encoders to tokenizers for diffusion models. In The Fourteenth International Conference on Learning Representations, 2025.

[11] Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, and Vincent Sitzmann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. Advances in Neural Information Processing Systems, 37:24081–24125, 2024.

[12] Junsong Chen, Jincheng Yu, Chongjian Ge, Lewei Yao, Enze Xie, Zhongdao Wang, James Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li. Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis. In International conference on learning representations, volume 2024, pages 57611–57640, 2024.

[13] Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, et al. Sana-video: Efficient video generation with block linear diffusion transformer. arXiv preprint arXiv:2509.24695, 2025.

[14] Rewon Child, Scott Gray, Alec Radford, and Ilya Sutskever. Generating long sequences with sparse transformers. arXiv preprint arXiv:1904.10509, 2019.

[15] Xiangxiang Chu, Zhi Tian, Bo Zhang, Xinlong Wang, and Chunhua Shen. Conditional positional encodings for vision transformers. In International Conference on Learning Representations, 2023.

[16] Hyung Won Chung, Noah Constant, Xavier Garcia, Adam Roberts, Yi Tay, Sharan Narang, and Orhan Firat. Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining. arXiv preprint arXiv:2304.09151, 2023.

[17] Damai Dai, Chengqi Deng, Chenggang Zhao, RX Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Yu Wu, et al. Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1280–1297, 2024.

[18] Nolan Dey, Bin Zhang, Lorenzo Noci, Mufan Li, Blake Bordelon, Shane Bergsma, Cengiz Pehlevan, Boris Hanin, and Joel Hestness. Don't be lazy: Completep enables compute-efficient deep transformers. Advances in Neural Information Processing Systems, 38:137707–137739, 2026.

32

第 33 页

[19] Prafulla Dhariwal and Alexander Nichol. Diffusion models beat gans on image synthesis. Advances in neural information processing systems, 34:8780–8794, 2021.

[20] Sander Dieleman. Diffusion is spectral autoregression. https://sander.ai/2024/09/02/spectral-autoregression.html, September 2024. 博客文章。

[21] Hangliang Ding, Dacheng Li, Runlong Su, Peiyuan Zhang, Zhijie Deng, Ion Stoica, and Hao Zhang. Efficient-vdit: Efficient video diffusion transformers with attention tile. arXiv preprint arXiv:2502.06155, 2025.

[22] Ming Ding, Zhuoyi Yang, Wenyi Hong, Wendi Zheng, Chang Zhou, Da Yin, Junyang Lin, Xu Zou, Zhou Shao, Hongxia Yang, and Jie Tang. Cogview: Mastering text-to-image generation via transformers. In Advances in Neural Information Processing Systems, volume 34, pages 19822–19835, 2021.

[23] Nelson Elhage, Neel Nanda, Catherine Olsson, Tom Henighan, Nicholas Joseph, Ben Mann, Amanda Askell, Yuntao Bai, Anna Chen, Tom Conerly, et al. A mathematical framework for transformer circuits. Transformer Circuits Thread, 1(1):12, 2021.

[24] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, et al. Scaling rectified flow transformers for high-resolution image synthesis. In Forty-first international conference on machine learning, 2024.

[25] William Fedus, Barret Zoph, and Noam Shazeer. Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity. Journal of Machine Learning Research, 23(120):1–39, 2022.

[26] Zhengcong Fei, Mingyuan Fan, Changqian Yu, Debang Li, and Junshi Huang. Scaling diffusion transformers to 16 billion parameters, 2024. URL https://arxiv.org/abs/2407.11633, 2024.

[27] Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I Mestre, Manuel F Dolz, and Enrique S Quintana-Ortí. Why adam works better with beta1=beta2: The missing gradient scale invariance principle. arXiv preprint arXiv:2601.21739, 2026.

[28] Dhruba Ghosh, Hannaneh Hajishirzi, and Ludwig Schmidt. Geneval: An object-focused framework for evaluating text-to-image alignment. Advances in Neural Information Processing Systems, 36:52132–52152, 2023.

[29] Albert Gu and Tri Dao. Mamba: Linear-time sequence modeling with selective state spaces. arXiv preprint arXiv:2312.00752, 2023.

[30] Tom Henighan, Jared Kaplan, Mor Katz, Mark Chen, Christopher Hesse, Jacob Jackson, Heewoo Jun, Tom B Brown, Prafulla Dhariwal, Scott Gray, et al. Scaling laws for autoregressive generative modeling. arXiv preprint arXiv:2010.14701, 2020.

[31] Joel Hestness, Sharan Narang, Newsha Ardalani, Gregory Diamos, Heewoo Jun, Hassan Kianinejad, Md Mostofa Ali Patwary, Yang Yang, and Yanqi Zhou. Deep learning scaling is predictable, empirically. arXiv preprint arXiv:1712.00409, 2017.

[32] Jonathan Ho and Tim Salimans. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598, 2022.

[33] Jonathan Ho, Ajay Jain, and Pieter Abbeel. Denoising diffusion probabilistic models. In Advances in Neural Information Processing Systems, 2020.

[34] Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, Ruiqi Gao, Alexey Gritsenko, Diederik P Kingma, Ben Poole, Mohammad Norouzi, David J Fleet, et al. Imagen video: High definition video generation with diffusion models. arXiv preprint arXiv:2210.02303, 2022.

[35] Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, and David J Fleet. Video diffusion models. Advances in neural information processing systems, 35:8633–8646, 2022.

[36] Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, DDL Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, et al. Training compute-optimal large language models. arXiv preprint arXiv:2203.15556, 10, 2022.

[37] Yicong Hong, Long Mai, Yuan Yao, and Feng Liu. Pushing the boundaries of state space models for image and video generation, 2025. https://arxiv.org/abs/2502.00972.

[38] Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, et al. Relic: Interactive video world model with long-horizon memory. arXiv preprint arXiv:2512.04040, 2025.

[39] Vincent Tao Hu, Stefan Andreas Baumann, Ming Gui, Olga Grebenkova, Pingchuan Ma, Johannes Fischer, and Björn Ommer. Zigma: A dit-style zigzag mamba diffusion model. In European conference on computer vision, pages 148–166. Springer, 2024.

[40] Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, and Gang Yu. Ella: Equip diffusion models with llm for enhanced semantic alignment. arXiv preprint arXiv:2403.05135, 2024.

33

第 34 页

[41] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion. Advances in Neural Information Processing Systems, 38:167283–167308, 2026.

[42] Keller Jordan, Yuchen Jin, Vlado Boza, You Jiacheng, Franz Cesista, Laker Newhouse, and Jeremy Bernstein. Muon: An optimizer for hidden layers in neural networks, 2024. URL https://kellerjordan. github. io/posts/muon, 6(3):4, 2024.

[43] Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, and Qiang Xu. Editverse: Unifying image and video editing and generation with in-context learning. arXiv preprint arXiv:2509.20360, 2025.

[44] Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei. Scaling laws for neural language models. arXiv preprint arXiv:2001.08361, 2020.

[45] Angelos Katharopoulos, Apoorv Vyas, Nikolaos Pappas, and Francois Fleuret. Transformers are RNNs: Fast autoregressive transformers with linear attention. In Proceedings of the International Conference on Machine Learning, 2020.

[46] Amirhossein Kazemnejad, Inkit Padhi, Karthikeyan Natesan Ramamurthy, Payel Das, and Siva Reddy. The impact of positional encoding on length generalization in transformers. Advances in Neural Information Processing Systems, 36:24892–24928, 2023.

[47] Kimi Team. Kimi linear: An expressive, efficient attention architecture. arXiv preprint arXiv:2510.26692, 2025.

[48] Dmitry Lepikhin, HyoukJoong Lee, Yuanzhong Xu, Dehao Chen, Orhan Firat, Yanping Huang, Maxim Krikun, Noam Shazeer, and Zhifeng Chen. Gshard: Scaling giant models with conditional computation and automatic sharding. arXiv preprint arXiv:2006.16668, 2020.

[49] Tianhong Li and Kaiming He. Back to basics: Let denoising generative models denoise. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 36115–36125, 2026.

[50] Zhengyang Liang, Hao He, Ceyuan Yang, and Bo Dai. Scaling laws for diffusion transformers. arXiv preprint arXiv:2410.08184, 2024.

[51] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, and Matt Le. Flow matching for generative modeling. arXiv preprint arXiv:2210.02747, 2022.

[52] Aixin Liu, Bei Feng, Bin Wang, Bingxuan Wang, Bo Liu, Chenggang Zhao, Chengqi Dengr, Chong Ruan, Damai Dai, Daya Guo, et al. Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model. arXiv preprint arXiv:2405.04434, 2024.

[53] Aixin Liu, Bei Feng, Bing Xue, Bingxuan Wang, Bochao Wu, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, et al. Deepseek-v3 technical report. arXiv preprint arXiv:2412.19437, 2024.

[54] Aixin Liu, Aoxue Mei, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, et al. Deepseek-v3. 2: Pushing the frontier of open large language models. arXiv preprint arXiv:2512.02556, 2025.

[55] Xingchao Liu, Chengyue Gong, and Qiang Liu. Flow straight and fast: Learning to generate and transfer data with rectified flow. arXiv preprint arXiv:2209.03003, 2022.

[56] Yue Liu, Yunjie Tian, Yuzhong Zhao, Hongtian Yu, Lingxi Xie, Yaowei Wang, Qixiang Ye, Jianbin Jiao, and Yunfan Liu. Vmamba: Visual state space model. Advances in neural information processing systems, 37:103031–103063, 2024.

[57] William Merrill, Yanhong Li, Tyler Romero, Anej Svete, Caia Costello, Pradeep Dasigi, Dirk Groeneveld, David Heineman, Bailey Kuehl, Nathan Lambert, et al. Olmo hybrid: From theory to practice and back. arXiv preprint arXiv:2604.03444, 2026.

[58] Bruno Mlodozeniec, Pierre Ablin, Louis Béthune, Dan Busbridge, Michal Klein, Jason Ramapuram, and Marco Cuturi. Completed hyperparameter transfer across modules, width, depth, batch and duration. arXiv preprint arXiv:2512.22382, 2025.

[59] Alex Nichol, Prafulla Dhariwal, Aditya Ramesh, Pranav Shyam, Pamela Mishkin, Bob McGrew, Ilya Sutskever, and Mark Chen. Glide: Towards photorealistic image generation and editing with text-guided diffusion models. arXiv preprint arXiv:2112.10741, 2021.

[60] Alexander Quinn Nichol and Prafulla Dhariwal. Improved denoising diffusion probabilistic models. In International conference on machine learning, pages 8162–8171. PMLR, 2021.

[61] Catherine Olsson, Nelson Elhage, Neel Nanda, Nicholas Joseph, Nova DasSarma, Tom Henighan, Ben Mann, Amanda Askell, Yuntao Bai, Anna Chen, et al. In-context learning and induction heads. arXiv preprint arXiv:2209.11895, 2022.

[62] Antonio Orvieto and Robert Gower. In search of adam’s secret sauce. Advances in Neural Information Processing Systems, 38: 63404–63442, 2026.

34

第 35 页

[63] William Peebles 和 Saining Xie. 基于Transformer的可扩展扩散模型. 发表于《IEEE/CVF国际计算机视觉会议论文集》, 2023.

[64] Ofir Press, Noah A. Smith, 和 Mike Lewis. 短训练,长测试:带线性偏置的注意力机制实现输入长度外推. 发表于《国际学习表征会议》, 2022.

[65] Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, 和 Peter J Liu. 用统一的文本到文本Transformer探索迁移学习的极限. 《机器学习研究杂志》, 21(140):1–67, 2020.

[66] Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, 和 Mark Chen. 基于CLIP隐空间的层次化文本条件图像生成. arXiv预印本 arXiv:2204.06125, 1(2):3, 2022.

[67] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer. 基于隐空间扩散模型的高分辨率图像合成. 发表于《IEEE/CVF计算机视觉与模式识别会议论文集》, 页码 10684–10695, 2022.

[68] Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L Denton, Kamyar Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, 等. 具有深度语言理解的照片级真实感文本到图像扩散模型. 《神经信息处理系统进展》, 35:36479–36494, 2022.

[69] Noam Shazeer. 快速Transformer解码:一个写头足矣. arXiv预印本 arXiv:1911.02150, 2019.

[70] Noam Shazeer. GLU变体改进Transformer. arXiv预印本 arXiv:2002.05202, 2020.

[71] Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, 等. Make-a-video:无需文本-视频数据的文本到视频生成. arXiv预印本 arXiv:2209.14792, 2022.

[72] Kiwhan Song, Boyuan Chen, Max Simchowitz, Yilun Du, Russ Tedrake, 和 Vincent Sitzmann. 历史引导的视频扩散. arXiv预印本 arXiv:2502.06764, 2025.

[73] Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, 和 Ben Poole. 通过随机微分方程的基于分数的生成建模. arXiv预印本 arXiv:2011.13456, 2020.

[74] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu. Roformer:带有旋转位置嵌入的增强型Transformer. 《神经计算》, 568:127063, 2024.

[75] Yutao Sun, Li Dong, Shaohan Huang, Shuming Ma, Yuqing Xia, Jilong Xue, Jianyong Wang, 和 Furu Wei. 保留网络:大型语言模型Transformer的继任者. arXiv预印本 arXiv:2307.08621, 2023.

[76] Xin Tan, Yuetao Chen, Yimin Jiang, Xing Chen, Kun Yan, Nan Duan, Yibo Zhu, Daxin Jiang, 和 Hong Xu. DSV:利用动态稀疏性加速大规模视频DiT训练. arXiv预印本 arXiv:2502.07590, 2025.

[77] Kimi Team. Kimi k3:开放前沿智能, 2026. https://arxiv.org/abs/2607.24653.

[78] Kimi Team, Yu Zhang, Zongyu Lin, Xingcheng Yao, Jiaxi Hu, Fanqing Meng, Chengyin Liu, Xin Men, Songlin Yang, Zhiyuan Li, 等. Kimi Linear:一种表达性强、高效的注意力架构. arXiv预印本 arXiv:2510.26692, 2025.

[79] Qwen Team. Qwen3.5-omni技术报告. arXiv预印本 arXiv:2604.15804, 2026.

[80] Tencent Hunyuan Foundation Model Team. HunyuanVideo 1.5技术报告, 2025. https://arxiv.org/abs/2511.18870.

[81] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, 和 Illia Polosukhin. 注意力即一切. 发表于《神经信息处理系统进展》, 2017.

[82] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等. Wan:开放且先进的大规模视频生成模型. arXiv预印本 arXiv:2503.20314, 2025.

[83] Hongjie Wang, Chih-Yao Ma, Yen-Cheng Liu, Ji Hou, Tao Xu, Jialiang Wang, Felix Juefei-Xu, Yaqiao Luo, Peizhao Zhang, Tingbo Hou, 等. Lingen:以线性计算复杂度实现高分辨率分钟级文本到视频生成. 发表于《计算机视觉与模式识别会议论文集》, 页码 2578–2588, 2025.

[84] Lean Wang, Huazuo Gao, Chenggang Zhao, Xu Sun, 和 Damai Dai. 混合专家模型的无辅助损失负载均衡策略. arXiv预印本 arXiv:2408.15664, 2024.

[85] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, 等. Qwen2-vl:增强视觉语言模型对任意分辨率世界的感知. arXiv预印本 arXiv:2409.12191, 2024.

35

第 36 页

[86] Lilian Weng. 深入探讨缩放法则。lilianweng.github.io,2026年6月。https://lilianweng.github.io/posts/ 2026-06-24-scaling-laws/。

[87] Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, 等。Qwen-image技术报告。arXiv预印本 arXiv:2508.02324,2025。

[88] Jianzong Wu, Liang Hou, Haotian Yang, Xin Tao, Ye Tian, Pengfei Wan, Di Zhang, 和 Yunhai Tong。Vmoba:面向视频扩散模型的块混合注意力。arXiv预印本 arXiv:2506.23858,2025。

[89] Haocheng Xi, Shuo Yang, Yilong Zhao, Chenfeng Xu, Muyang Li, Xiuyu Li, Yujun Lin, Han Cai, Jintao Zhang, Dacheng Li, 等。 Sparse videogen:利用时空稀疏性加速视频扩散Transformer。arXiv预印本 arXiv:2502.01776, 2025。

[90] Zhenda Xie, Yixuan Wei, Huanqi Cao, Chenggang Zhao, Chengqi Deng, Jiashi Li, Damai Dai, Huazuo Gao, Jiang Chang, Kuai Yu, 等。mhc:流形约束超连接。arXiv预印本 arXiv:2512.24880,2025。

[91] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, 等。Qwen3技术报告。arXiv预印本 arXiv:2505.09388,2025。

[92] Ge Yang, Edward Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, 和 Jianfeng Gao。通过零样本超参数迁移调优大型神经网络。《神经信息处理系统进展》, 34:17084–17097,2021。

[93] Greg Yang, Edward J. Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, 和 Jianfeng Gao。Tensor programs v:通过零样本超参数迁移调优大型神经网络。arXiv 预印本 arXiv:2203.03466,2022。

[94] Songlin Yang, Bailin Wang, Yu Zhang, Yikang Shen, 和 Yoon Kim。利用序列长度上的delta规则并行化线性Transformer。《神经信息处理系统进展》,37:115491–115522,2024。

[95] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等。Cogvideox:基于专家Transformer的文本到视频扩散模型。载于《国际学习表征会议》, 2025卷,页码83048–83077,2025。

[96] Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, 和 Jiebo Luo。Pixeldit:用于图像生成的像素扩散Transformer。 载于《IEEE/CVF计算机视觉与模式识别会议论文集》,页码 14273–14282,2026。

[97] Jingyang Yuan, Huazuo Gao, Damai Dai, Junyu Luo, Liang Zhao, Zhengyan Zhang, Zhenda Xie, Yuxing Wei, Lean Wang, Zhiping Xiao, 等。原生稀疏注意力:硬件对齐且可原生训练的稀疏注意力。载于《第63届计算语言学协会年会论文集(第一卷:长文)》, 页码23078–23097,2025。

[98] Chenlu Zhan, Wen Li, Chuyu Shen, Jun Zhang, Suhui Wu, 和 Hao Zhang。面向更快速视频扩散训练的双向稀疏注意力。 arXiv预印本 arXiv:2509.01085,2025。

[99] Kai Zhang, Peng Wang, Sai Bi, Jianming Zhang, 和 Yuanjun Xiong。Knapformer:一种用于高效扩散Transformer训练的在线负载均衡器。 arXiv预印本 arXiv:2508.06001,2025。

[100] Peiyuan Zhang, Yongqi Chen, Haofeng Huang, Will Lin, Zhengzhong Liu, Ion Stoica, Eric Xing, 和 Hao Zhang。利用可训练稀疏注意力实现更快的视频扩散。 《神经信息处理系统进展》,38:152509–152534,2026。

[101] Yanli Zhao, Andrew Gu, Rohan Varma, Liang Luo, Chien-Chin Huang, Min Xu, Less Wright, Hamid Shojanazeri, Myle Ott, Sam Shleifer, 等。Pytorch fsdp:扩展全分片数据并行的经验。arXiv预印本 arXiv:2304.11277,2023。

[102] Boyang Zheng, Nanye Ma, Shengbang Tong, 和 Saining Xie。基于表征自编码器的扩散Transformer。arXiv 预印本 arXiv:2510.11690,2025。

[103] Chenyu Zheng, Xinyu Zhang, Rongzhen Wang, Wei Huang, Zhi Tian, Weilin Huang, Jun Zhu, 和 Chongxuan Li。通过mup高效扩展扩散Transformer。 《神经信息处理系统进展》,38:19372–19413,2026。

[104] Defa Zhu, Hongzhi Huang, Zihao Huang, Yutao Zeng, Yunyao Mao, Banggu Wu, Qiyang Min, 和 Xun Zhou。超连接。 载于《国际学习表征会议》,2025卷,页码97183–97219,2025。

[105] Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, 等。Flare:面向混合语言模型的扩散。arXiv预印本 arXiv:2606.01774,2026。

36

第 37 页

A 符号说明

表3总结了本文中使用的主要符号。符号按组件分组,章节局部或重复使用的符号范围在表中明确说明。

表3 本文中使用的主要符号

符号 含义 符号 含义

扩散目标(第3.1节) MLA(第3.3节) z1 干净的视觉token(分块VAE潜变量) nh 注意力头数 z0 高斯噪声 U 压缩的键值潜变量 τ, zτ 扩散时间步;时间步τ处的加噪视觉token Kdirect 从MLA输入投影并在各头间共享的直接键分支 vτ Rectified Flow速度目标z1 −z0 Klat, V 从U解码得到的潜变量键和值 c 来自冻结文本编码器的文本token序列 Ki 第i个头的键[Kdirect, Klati ] θ 去噪器的可训练参数 L 在视觉token位置评估的扩散训练目标 MoE(第3.5节) u MoE FFN的token输入 序列与布局(第3.2、3.3节) N, K 局部专家数(N = 56);每个token激活的专家数(K = 8) x 打包的输入序列;经iHC扩展后重用于序列级多流状态 Ei 第i个路由专家 Ptext, Pvis 模态特定的输入投影 r(·), gi(u) 路由器;专家i的路由权重 eτ 时间步嵌入 b ∈RN 无梯度的负载均衡偏置 T, H, W 潜变量网格的时间、高度、宽度尺寸 T (u) 为token u选择的top-K专家集合 m 时间主序光栅扫描顺序的展平索引 Loadi, Load 每个专家的负载;平均专家负载;最大负载 L 序列长度 MaxVio 违规(式22) 块计算(第3.2、3.6节) RoPE分析(第3.3节,附录C) d 共享隐藏维度 θj 旋转对j的旋转频率(弧度/token) δA, γA 注意力输入的AdaLN偏移和缩放 δ token偏移量,查询位置减去键位置 gA, gF 时间步条件的残差门控 q(i), k(i) 旋转通道对i中q, k的分量 M 并行残差流数量(M = 4) ∥q(i)∥∥k(i)∥ 对i的幅值(窗口平均的q, k) R, Rm 每个token的多流状态;其第m个流 Ei 每个token位置的每对能量Eℓ∥q(i)ℓ∥∥k(i)ℓ∥(流局部索引) (区别于专家Ei)hpre(R), 依赖token的iHC读取和写入向量 局部/远距离质量 在切比雪夫距离≤1 / ≥5处的注意力分数hpost(R) αh iHC系数生成器中的可学习缩放因子 Scaling(第4、5.3节) ∆ 写入流的门控注意力或FFN更新 M(0), M 代理模型和目标模型 Hres 残差流转换矩阵(iHC中为单位矩阵) n(0)blk, nblk 代理和目标块数 KDA(第3.3节) W (0), W 对应的代理和目标参数组 t 扫描索引1, . . . , L(区别于扩散时间步τ) mW , mL 目标到代理的扇入比;目标到代理的块数比 qt, kt, vt token t的查询、键和值 ¯h 代理调优的基础超参数元组 dq, dk, dv 每头查询、键和值的维度 PW , ρ(W) W的迁移设置;其功能角色 St token t之后的循环状态(dk × dv) Tρ(W ) 角色依赖的迁移映射 αt 通道级遗忘门(状态衰减) N 缩放定律中激活的参数数量 βt 头级擦除/写入强度 D 处理的视觉潜变量位置累计数 mShortConv 模态感知短卷积(第3.4节) C 训练计算量,近似为C ≈6ND L 拟合的扩散损失曲面 b E; A, B; a, b 不可约损失;正系数;缩放指数

B 代表性模型配置

表4报告了图6中可视化的确切配置。代理模型用于超参数调优,缩放家族支持计算最优分析,最终模型被选定用于完整训练。

第 38 页

表4 实验中使用的代表性Chimera配置。所有模型均实例化第3节的架构;结构比例(MoE专家数、KDA与MLA比例、残差流数量、KV压缩比、分块化)在不同规模下保持固定(第4.1节)。我们同时报告每个token的激活参数量和去噪器总参数量,其中总参数量统计所有路由MoE专家。完整扫描包含更多中间规模。

模型 激活参数量 总参数量 宽度 FFN隐藏层 深度

Proxy 22M 59M 512 2048 4

55M 253M 384 1536 16 200M 893M 896 2432 16 291M 1.35B 1024 4096 16 393M 1.88B 1152 5120 16 482M 2.46B 896 4096 32 748M 3.58B 1280 4096 32 873M 4.41B 1280 5120 32 999M 5.25B 1280 6144 32 Scaling 1.55B 7.99B 1664 6656 32family 2.01B 9.93B 2048 6400 32 2.26B 10.33B 2432 5248 32 2.50B 11.92B 2432 6400 32 2.65B 10.79B 2944 4736 32 2.80B 14.26B 2304 9216 32 2.93B 14.25B 2560 7296 32 2.99B 15.09B 2432 9088 32 4.02B 19.31B 3072 8448 32

最终训练模型 2.22B 11.28B 2048 8192 32

C 视觉RoPE分析:协议与结果

本附录详述第3.3节总结的FLUX.2和Wan2.2分析。所有统计量均从模型自身的采样轨迹计算得出,因此探测到的激活值匹配模型运行的真实状态。图21可视化了逐对分解、频带消融以及所有注意力头的分工情况。

模型与采样。我们探测Wan2.2-T2V-A14B和FLUX.2-dev的公开权重。Wan2.2有40层,每层40个自注意力头,维度为128;轴向RoPE将每个头划分为22个时间通道对、21个高度通道对和21个宽度通道对,各轴频率为θj = 10000^{-2j/da},范围从1降至约1.5 × 10^{-4} rad/token。其两个去噪专家(分别在t=875以上和以下应用)被分别探测。FLUX.2有8个双流块和48个单流块,每块48个注意力头,维度为128;其轴向RoPE为四个轴(时间、高度、宽度、文本索引)各分配16对,基频为2000,范围从1降至约8 × 10^{-4} rad/token。图像token仅在高度和宽度轴上携带坐标,因此每个头中一半的时间轴和文本轴通道在图像token之间不进行旋转;文本token在同一序列中参与注意力并使用文本轴。我们以480×832分辨率、33帧(9×30×52 token网格,14,040个视觉token)采样Wan2.2,使用UniPC调度器、40步、无分类器引导强度4.0/3.0;以1024²分辨率(64×64网格)采样FLUX.2,使用其50步流调度器、嵌入式引导强度4.0。每个模型在涵盖人物、动物、自然、城市场景、特写和静物运动的六个共享提示词上进行探测,并在三个去噪时间步(Wan2.2为t={964, 750, 347},跨越两个专家;FLUX.2为噪声水平σ≈{0.99, 0.88, 0.46})进行,每个模型共18种设置。

捕获与注意力头统计。在每个捕获步骤,我们为每个自注意力层记录查询-键归一化后、旋转前(对于Wan2.2,在无分类器引导的条件分支上)的逐头查询和键。对于在所有层和设置间共享的512个视觉查询token的固定随机子集,我们构建完整的注意力行并逐头测量:局部注意力质量,即查询token在token网格上切比雪夫距离≤1的时空邻域内的注意力占比(不包括自身;视频为26个邻居,图像为8个);远场质量,即切比雪夫距离≥5的注意力占比;平均关注距离;以及

38

第 39 页

图21 视觉扩散Transformer中的RoPE频率使用。(a) Wan2.2最强局部头(第33层,第30头)沿宽度轴的逐对logit分解:每条曲线对应一个宽度轴旋转对(蓝色越深表示旋转越快),其总和(橙色)在偏移+1处达到峰值,即光栅顺序中的前一个token;其他轴上的对则贡献与偏移无关的常数(未显示)。(b) FLUX.2最强局部头(第46层,第33头)的相同分解,峰值出现在光栅顺序中的下一个token(δw = −1)。(c) 两个模型每个头的查询-键通道能量加权旋转速度与局部注意力质量的关系:局部头将能量集中在快速旋转上,远场头则集中在接近零的旋转上(黑色轮廓标记了(a)和(b)中的头)。(d) Wan2.2局部头在128个token光栅裁剪上的注意力,按频率子集重新计算:每个轴最快三分之一的旋转对重现了局部模式,最慢三分之一则消除了它。(e) FLUX.2局部头的相同测试;此处快速对与FLUX.2为图像token保留未旋转的轴相结合,这些轴承载了该头的内容门控。

最强非自身键是相邻键的比率。对于FLUX.2,注意力行跨越拼接的文本和图像token,我们额外记录文本键上的质量。

频率带与头部选择。在每个位置轴内,我们按旋转速度对通道对进行排序,并将其分为最快、中等和最慢的三分之一;对于FLUX.2,未旋转的时间和文本轴通道形成一个额外的静态组。带限制注意力通过从通道子集重新计算logit获得,保持1/√d的缩放,并重新应用softmax。对于每个模型,我们选择在所有18种设置下平均局部注意力质量最高的八个头;下面的消融数字在这些头和设置上取平均。

局部头与位置选择。两个模型都包含尖锐的局部头,这是前一个token头在视觉上的类似物。在Wan2.2中,第33层第30头——在两个去噪专家中处于相同位置,其前八局部头列表共享八个中的七个条目——关注光栅扫描中紧邻的前一个token:其局部注意力质量为0.99,98.1%的查询将其argmax精确置于此处。这一比率等于不开始新行的查询比例,即选择在网格边界内是精确的。在FLUX.2中,第46层第33头,一个后期的单流块,以紧邻的后一个token镜像了这一点(98.4%的查询,同样饱和了边界限制;局部注意力质量0.93)。在所有18种设置中,每个头都保持其所在层排名最高的局部头,表明局部性是一种稳定的头部属性,而非特定输入的产物。逐对分解将这种选择追溯到频谱的快速端,与Qwen3-4B中完全一致:我们对每个头在所有视觉token上的预旋转查询和键取平均,并通过其幅度∥q(i)∥∥k(i)∥、相位和频率表示每个通道对;宽度轴贡献的总和在偏移一处达到峰值(图21a和21b),其他轴上的对贡献与偏移无关的常数,且逐对总和在float64精度下与直接旋转的点积匹配,误差分别在3×10⁻¹²(Wan2.2)和3×10⁻¹⁴(FLUX.2)以内。频带

第 40 页

消融实验证实了上述归因。在Wan2.2中,仅保留每个轴最快三分之一的旋转对即可保持所选头部的局部注意力质量(低噪声专家中为0.944对比0.967;高噪声专家中为0.934对比0.957),而仅保留最慢三分之一则使其降至0.002(图21d)。在FLUX.2中,未旋转通道根据内容选择关注哪些token,而快速旋转对则将峰值置于目标偏移处:由两组共同重新计算的注意力几乎完全匹配完整头部(余弦相似度0.994;局部质量0.776对比0.926),而单独任一组均失败(仅快速旋转对为0.190,无快速旋转对时为0.051;图21e)。

远场头部与语义匹配。缓慢旋转通道扮演相反角色。利用每个模型在单一设置下的完整逐token转储,我们测量每个头部每对旋转对的能量Ei = Et ∥q(i)t ∥∥k(i)t ∥,并通过能量加权的旋转对频率几何均值来概括其频谱。注意力远在局部邻域之外的头部(远场质量>0.8;Wan2.2中平均关注距离约20个token,FLUX.2中约30个token)将其能量集中在接近零的旋转速度上:它们的中位质心在Wan2.2中为0.012 rad/token,在FLUX.2中为0.013,比局部头部(局部质量>0.5;中位数分别为0.26和0.25)慢20倍以上,因此它们的点积在关注范围内仅转动几度(图21c)。FLUX.2使这种分工显式化:其远场头部将一半能量(中位数51%,对比局部头部的13%)驻留在未旋转通道中,且仅慢速通道(最慢三分之一加上未旋转组)即可几乎精确复现其注意力(余弦相似度0.965)。

发表评论