Chimera:混合注意力+Chinchilla缩放,视觉扩散模型的长序列高效生成之道
视觉生成进入token密集型时代,全注意力机制计算成本高昂,且缺乏系统性缩放框架。Chimera提出混合KDA/MLA注意力骨干,结合模态感知短卷积实现无位置编码设计,并配套HeteroP超参数迁移方案和Chinchilla缩放定律。实验显示,在匹配算力下Chimera预训练效率比Wan2.1提升6.8倍,零样本视频长度从5秒外推至30秒时FID仅退化6.5%。缩放定律揭示了算力应近乎均匀分配给模型大小和训练token,并首次分析了算力最优的图像-视频数据配比。需要注意的是,缩放定律基于预训练损失,未直接关联下游生成质量指标。