跳至内容

pchao.org

BiVidGen

超越文本条件:MLLM-DiT融合如何让视频生成真正理解语义

17 8 月, 2026 作者 PengChao
BiVidGen的贡献

系统研究MLLM与DiT融合的视频生成框架,提出BiVidGen:MLLM生成离散语义视觉token,DiT通过多层交叉注意力渲染视频。

分类 CVPR三分钟 标签 BiVidGen、 CVPR三分钟、 EMA-based、 MLLM、 人工智能、 深度学习、 计算机视觉 发表评论
© 2026 pchao.org • Built with GeneratePress