VideoRAE:冻结VFM语义特征,统一连续与离散视频生成潜在空间

VideoRAE核心架构概览

传统视频Tokenizer依赖像素级重建,导致潜在空间语义不足。VideoRAE利用冻结的视频基础模型(VFM)作为特征提取器,通过1D投影器和表示对齐(REPA)模块构建紧凑且语义丰富的潜在空间。该方法支持连续(DiT)和离散(AR)两种生成范式,在UCF-101和VBench上显著提升了重建质量并加速了下游生成模型的收敛。需注意其性能高度依赖所选VFM的预训练范式。