快速导读:系统研究MLLM与DiT融合的视频生成框架,提出BiVidGen:MLLM生成离散语义视觉token,DiT通过多层交叉注意力渲染视频。
本文系统研究了多模态大语言模型(MLLM)与扩散Transformer(DiT)在视频生成中的融合方式。现有混合架构大多将MLLM当作冻结的特征编码器,仅提取隐式条件信号,未能充分利用MLLM的生成能力进行高层语义规划。作者提出BiVidGen框架,让MLLM以自回归方式生成离散语义视觉token,再由DiT通过多层交叉注意力将这些token作为显式条件注入扩散渲染过程。
论文的核心贡献不在于提出一个全新的架构名称,而在于对三个关键设计维度——中间表示形式、MLLM生成机制、DiT融合策略——进行了系统性的消融研究。实验结果表明,EMA-based tokenizer配合离散token和因果注意力,再通过多层交叉注意力注入DiT,能够在语义对齐和时序一致性上显著超越纯DiT基线。
英文题目:Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation
论文出处:arXiv 每日论文精选 · arXiv:2608.14043
原始论文:PDF / 论文页面
这篇论文解决什么问题?
DiT已经成为高保真视频生成的主流范式,但其高层语义规划能力有限。纯DiT模型依赖文本编码器提供的条件信号,在长视频生成中容易出现语义漂移、因果逻辑断裂和时序不一致的问题。图像生成领域已经证明MLLM+扩散解码器的混合架构有效,但视频生成中此类设计仍未被充分探索。
现有MLLM-DiT融合方法可以大致分为三类:prompt refinement(MLLM改写文本提示词)、latent bridging(通过可学习query和connector提取MLLM隐状态)、以及显式视觉token条件注入。前两类方法要么信息传递过于间接,要么需要大量训练数据来学习隐状态到条件空间的映射。
一个关键的研究空白是:MLLM与DiT之间的中间表示应该采用什么形式?MLLM应该以什么机制生成这些表示?DiT又应该以什么方式消费这些表示?这三个问题相互耦合,单独优化任何一个维度都可能得出误导性的结论。本文正是针对这一空白展开系统研究。
核心创新
- 系统研究MLLM-DiT融合的三个关键问题:中间表示形式、MLLM生成机制、DiT融合策略
- 发现EMA-based tokenizer相比embedding-based tokenizer具有更低量化误差和更高熵,无需梯度更新或辅助监督
- 发现离散token+因果注意力在自回归方式下能有效生成高质量中间视觉表示
- 发现显式视觉token条件注入(多层交叉注意力)优于prompt refinement和latent bridging
- 提出BiVidGen框架:MLLM语义规划+DiT渲染,冻结DiT主干仅训练新增交叉注意力模块
方法概览
BiVidGen包含三个组件:(1) EMA-based视觉tokenizer将连续视觉特征量化为离散语义token;(2) MLLM以因果自回归方式从文本prompt生成视觉token;(3) DiT通过多层交叉注意力将视觉token注入每个DiT block进行扩散渲染。三者分别训练,推理时串联。
- BiVidGen包含三个独立训练的组件:EMA-based视觉tokenizer、MLLM语义规划器、DiT渲染器。三者分别训练,推理时串联,这种模块化设计使得每个组件的贡献可以被独立评估。
- 视觉tokenizer将连续视觉特征量化为离散语义token。作者对比了四种codebook更新方式:EMA-based、gradient-based embedding、embedding+MLLM理解监督、embedding+像素重建监督。EMA-based方法无需梯度更新,通过指数移动平均维护码本条目。
- MLLM生成机制方面,作者对比了因果注意力与双向注意力、离散输入与连续输入的组合。关键发现是离散token配合因果注意力——即与文本建模相同的自回归方式——能够最有效地生成高质量中间视觉表示。
- DiT融合策略方面,作者对比了self-attention注入、cross-attention注入、多层注入、prompt refinement和latent bridging五种方案。多层交叉注意力注入在冻结DiT主干的情况下仅训练新增的交叉注意力模块,取得了最佳效果。
- 作者还探索了层级token结构,即从ViT不同层提取多粒度语义信息分别量化。但实验发现层级结构增加了MLLM的预测难度,浅层预测错误会传播影响深层,最终生成性能反而下降。
- 推理效率方面,MLLM+DiT相比DiT-only增加了约8秒延迟(50步时37秒到45秒),但峰值内存不变。减少去噪步数到30步时,延迟降至31秒,而VBench-Long总分仅从78.18降至77.27,说明语义规划带来的收益对去噪步数不敏感。
逐图理解论文
失败案例与直觉

该图将MLLM-DiT连接策略分为六类:四种显式视觉token条件注入(self-attention、cross-attention、多层注入)以及prompt refinement和latent bridging。重点对比显式token注入与隐式桥接在信息传递效率上的差异。
研究空白

该图对比了MLLM生成视觉token的四种建模策略:因果vs双向注意力、离散vs连续输入。注意因果注意力与离散token的组合如何与MLLM的文本自回归机制保持一致。
BiVidGen的贡献

BiVidGen的完整架构图,展示了三个组件的串联关系:EMA-based tokenizer量化视觉特征、MLLM自回归生成语义token、DiT通过多层交叉注意力渲染视频。注意三者分别训练、推理时串联的模块化设计。
最强结论

在VBench-Long上,BiVidGen的Total Score达到80.77,超过DiT-only基线74.88,其中Semantic维度从55.16提升至76.25。这说明语义规划带来的收益主要集中在语义对齐上,而不是视觉质量。更值得注意的是,在Wan2.1-1.3B和Wan2.2-5B两个模型规模上都验证了方法的有效性,证明这套设计原则具有跨规模的泛化能力。
意义与局限

该图展示了与基线的定性对比。MLLM的语义规划使DiT在时序一致性、因果转换和语义对齐方面表现更好,特别是在需要理解动作因果关系的长视频场景中。
实验如何设计?
- 主要评测基准为VBench-Long,覆盖长视频生成的语义对齐、时序一致性、因果转换等维度。
- 重建实验在DAVIS数据集上进行,使用PSNR、SSIM、LPIPS评估不同codebook和注入模块的DiT重建质量。
- 消融实验在VBench-Long上分别针对MLLM生成机制(注意力类型×输入表示)和DiT融合策略(codebook类型×注入模块)进行。
- 可扩展性测试在Wan2.1-1.3B和Wan2.2-5B两个模型规模上进行,验证方法跨规模的泛化能力。
- 与Sora、HunyuanVideo、Veo-3、Gen-3、Wan2.2-14B等方法的对比为contextual comparison,模型规模和训练数据不受控,仅作参考。
关键结果与论文证据
- BiVidGen在VBench-Long上Total Score达80.77,超过DiT-only基线74.88(+5.89),其中Semantic维度从55.16提升至76.25,提升幅度最大(第7页,Table 1)。
- EMA codebook的量化误差为0.130,显著低于Embedding的0.551、Embedding+Decoder的0.586和Embedding+LLM的0.938;同时熵为0.812,高于其他方案(第8页,Table 2)。低量化误差意味着离散token保留了更多视觉信息,高熵意味着码本利用率更高。
- 离散token+因果注意力的Semantic得分为48.74,优于双向注意力的46.26;连续token仅37.65/36.77(第8页,Table 3)。这说明自回归建模方式与MLLM的文本生成机制天然兼容。
- EMA codebook在DAVIS重建上PSNR 13.71/SSIM 0.358/LPIPS 0.542(self-attention),优于Embedding的12.50/0.338/0.628;EMA+cross-attention进一步达到PSNR 14.05/SSIM 0.388/LPIPS 0.528(第8页,Table 4)。
- 在Wan2.1-1.3B上,MLLM-Planning的Total Score为76.12,对比基线73.75提升2.37分(第19页,Table 10),证明方法跨模型规模有效。
- CFG=1.5时重建质量最佳(PSNR 13.71/SSIM 0.358/LPIPS 0.542);10步去噪时PSNR仅降至12.54(第19页,Table 11),说明语义token条件对去噪步数具有鲁棒性。
- 层级token在VBench-Long上Total Score最高72.54,低于单层离散token的72.79(第16页,Table 7),层级结构未能带来预期收益。
- 定性对比显示,MLLM+DiT在因果转换、时序一致性和语义对齐方面优于DiT-only基线(第9页,Figure 5;第19页,Figure 10)。
阅读时需要注意
- 训练数据和计算资源有限,未达到VBench-Long上state-of-the-art性能,与Sora、Veo-3等大规模系统在aesthetic quality和human action维度仍有差距。
- 训练分辨率较低(288×512、384×384、512×288),限制了生成质量和细节表现。
- 层级token结构增加了MLLM预测难度,生成性能反而下降,说明多粒度语义规划的设计空间仍需进一步探索。
- latent bridging性能下降归因于MLLM隐藏状态与DiT条件分布不匹配,需要大量训练数据学习connector映射,本文未深入解决这一问题。
关联工作
- MetaQuery(第3页)采用冻结MLLM+轻量query token提取条件给扩散解码器,属于latent bridging范式。本文的消融表明这种隐式桥接在视频生成中不如显式视觉token条件注入有效。
- BLIP3o-Next和X-Omni(第3页)重训练MLLM显式生成语义视觉token用于图像生成,与本文方法最接近。BiVidGen将这一思路扩展到视频生成,并系统研究了tokenizer和融合策略的设计空间。
- UniVideo、UniVid、Omni-Video(第3页)等统一视频模型冻结MLLM参数仅引入轻量adapter或query token,本文与其形成对比,证明显式token生成是更优的语义传递方式。
- Qwen3-VL作为BiVidGen的基础MLLM,其层级ViT特征设计启发了层级token探索;Wan-2.2作为DiT扩散主干。