超越文本条件:MLLM-DiT融合如何让视频生成真正理解语义 17 8 月, 2026 作者 PengChao 系统研究MLLM与DiT融合的视频生成框架,提出BiVidGen:MLLM生成离散语义视觉token,DiT通过多层交叉注意力渲染视频。