三分钟导读:VideoRAE利用冻结的视频基础模型(VFM)作为特征提取器,通过1D投影器和表示对齐(REPA)模块构建紧凑且语义丰富的潜在空间,支持连续和离散两种生成范式,显著提升了重建质量并加速了下游生成模型的收敛。
英文题目:VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders
论文出处:arXiv 每日论文精选 · arXiv:2607.14088
原始论文:PDF / 论文页面
对应视频标题:VideoRAE:冻结VFM语义特征,统一连续与离散视频生成潜在空间|推荐指数:★★★★★
这篇论文解决什么问题?
传统3D-VAE主要优化像素级重建,导致潜在空间语义和时空结构不足,限制了下游生成质量;同时,冻结的视频基础模型(VFM)是否能在保持语义理解能力的同时转化为紧凑、可重建且利于生成的潜在空间尚不明确。
核心创新
- 提出VideoRAE框架,首次系统性地证明冻结VFM可作为高保真视频生成的鲁棒自编码器基础。
- 设计语义驱动的1D投影器和局部-全局表示对齐(REPA)目标,无需KL正则化即可维持潜在空间的语义拓扑结构。
- 提出多码本SimVQ策略,在保持VFM高维语义完整性的同时实现高效的离散化,防止码本坍塌。
- 统一支持连续(DiT)和离散(AR)生成范式,证明语义丰富的潜在空间比像素级保真度对生成质量更重要。
方法概览
VideoRAE采用冻结的VFM提取多层级语义特征,通过轻量级1D自注意力投影器压缩为紧凑基令牌。对于连续潜在空间,使用线性投影并配合表示对齐(REPA)损失替代KL散度正则化;对于离散潜在空间,采用多码本SimVQ策略进行量化。解码器通过REPA模块与VFM教师模型进行局部和全局特征对齐。
逐图理解论文
VideoRAE核心架构概览

VideoRAE采用冻结的VFM提取多层级语义特征,通过轻量级1D自注意力投影器压缩为紧凑基令牌。对于连续潜在空间,使用线性投影并配合表示对齐损失替代KL散度正则化;对于离散潜在空间,采用多码本SimVQ策略进行量化。解码器通过REPA模块与VFM教师模型进行局部和全局特征对齐,从而维持潜在空间的语义拓扑结构。
离散重建性能评估

在UCF-101和TokenBench上进行离散和连续潜在空间的重建评估。结果显示,基于V-JEPA 2的离散重建rFVD为13,基于VideoMAEv2的为16。连续重建方面,VideoMAEv2在1024×64分辨率下rFVD为5,V-JEPA 2为7。这些指标表明,VideoRAE在保持语义完整性的同时,实现了高质量的重建效果,优于传统基线。
离散自回归生成表现

在UCF-101上进行类别条件生成评估,对比AR和DiT模型。离散AR生成中,V-JEPA 2的gFVD为40,VideoMAEv2为45。可视化结果显示,离散令牌重建在UCF-101数据集上保持了良好的语义连贯性和细节还原。这证明了多码本SimVQ策略在防止码本坍塌的同时,能够有效支持自回归生成任务。
连续扩散生成表现

连续DiT生成中,V-JEPA 2的gFVD为93,VideoMAEv2为99。虽然gFVD数值高于离散模式,但连续空间在视觉一致性上表现优异。可视化结果显示,连续空间生成结果在UCF-101数据集上具有更高的细节保真度。这表明语义丰富的潜在空间比单纯的像素级保真度对生成质量更重要,且连续空间更适合需要精细控制的生成任务。
生成模型收敛速度优势

消融实验分析量化策略、REPA模块、多尺度特征聚合及特征融合策略的影响。结果显示,AR和DiT生成模型收敛速度比基线快约5倍。训练收敛速度对比图显示,VideoRAE支持的生成模型在更少的迭代次数内达到稳定性能。这一加速效应主要得益于潜在空间的高语义密度,减少了生成模型学习复杂分布的难度。
实验与关键结果
- 在UCF-101和TokenBench上进行离散和连续潜在空间的重建评估。
- 在UCF-101上进行类别条件生成(Class-Conditional Generation)评估,对比AR和DiT模型。
- 在VBench上进行2B规模文本到视频(Text-to-Video)生成评估,替换LTX-VAE基线。
- 消融实验分析量化策略、REPA模块、多尺度特征聚合及特征融合策略的影响。
- UCF-101离散重建rFVD: 13 (V-JEPA 2), 16 (VideoMAEv2)(第 8 页)
- UCF-101连续重建rFVD: 5 (VideoMAEv2 1024×64), 7 (V-JEPA 2 1024×64)(第 9 页)
- UCF-101离散AR生成gFVD: 40 (V-JEPA 2), 45 (VideoMAEv2)(第 10 页)
- UCF-101连续DiT生成gFVD: 93 (V-JEPA 2), 99 (VideoMAEv2)(第 10 页)
- VBench文本到视频总得分: 71.26 (VideoRAE) vs 69.35 (LTX-VAE)(第 12 页)
- 收敛速度: AR和DiT生成模型收敛速度比基线快约5倍(第 11 页)
阅读时需要注意
- 依赖预训练且冻结的视频基础模型(如V-JEPA 2, VideoMAEv2),其性能受限于基础模型的质量。
- 虽然重建保真度(PSNR)与生成质量(gFVD)存在权衡,追求极致语义可能略微牺牲像素级重建精度。
- 多码本SimVQ增加了量化模块的复杂性,尽管避免了码本坍塌,但仍需仔细调整超参数。
- VideoRAE的性能高度依赖于所选VFM的预训练范式(如V-JEPA 2侧重语义,VideoMAEv2侧重像素细节),不同VFM会导致重建与生成性能的差异。
- REPA模块替代KL散度,虽然避免了分布约束带来的过平滑,但需要确保对齐损失的权重(lambda)适当,否则可能影响潜在空间的稳定性。
- 实验主要在UCF-101和VBench等特定数据集上进行,泛化到其他复杂视频分布的能力需进一步验证。
关联工作
- V-JEPA 2:作为VideoRAE的核心冻结VFM教师模型之一,提供高层语义特征。(第 3 页)
- VideoMAEv2:作为VideoRAE的另一核心冻结VFM教师模型,提供包含细粒度时空动态的特征。(第 3 页)
- LTX-VAE:作为连续潜在空间重建和文本到视频生成的主要基线模型进行对比。(第 8 页)
- SweetTok:作为离散视频Tokenizer的SOTA基线,在重建和生成指标上进行对比。(第 8 页)
- RAE:图像领域的表示自编码器工作,启发了VideoRAE利用冻结VFM特征进行生成的思路。(第 3 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
预印本
VIDEORAE:通过表示自编码器驯化视频基础模型 用于生成式建模
Zhihao Xie1,2,∗ Junfeng Wu2,∗ Xinting Hu4 Junchao Huang1,3 Li Jiang1,3,† 1 香港中文大学(深圳) 2 华中科技大学 3 深圳loop area研究所 4 中国科学技术大学
摘要
视频生成建模的快速发展主要由在3D变分自编码器(3D-VAEs)潜在空间中运行的扩散模型和自回归模型驱动。然而,传统的3D-VAEs主要针对像素级重建进行优化,这一目标往往限制了其潜在空间所捕获的语义和时空结构,从而制约了下游合成质量。与此同时,如V-JEPA 2和VideoMAEv2等视频基础模型(VFMs)展示了卓越的语义理解能力。然而,这些冻结的视频基础表示是否可以转化为紧凑、具备重建能力且对生成友好的视频潜在空间,仍 largely unexplored。在本文中,我们利用来自冻结视频基础编码器的多尺度层次特征,并采用轻量级1D自注意力投影器将其压缩为高度紧凑的潜在空间。所得潜在空间支持用于扩散Transformer(DiTs)的连续表示,以及通过多码本高维量化用于自回归模型的离散表示。在解码过程中,VideoRAE引入了与冻结VFM教师模型的对齐目标,这改善了语义保留并使得无需KL正则化即可进行训练。综合实验表明,VideoRAE在连续和离散模式下均实现了强大的重建能力。在UCF-101上,它分别使用AR和DiT生成器取得了40和93的state-of-the-art类到视频gFVDs,同时收敛速度比竞争性的自编码器基线快约5倍。在受控的2B规模文本到视频实验中,用VideoRAE替换LTX-VAE带来了更快的收敛速度和始终更好的VBench性能。这些结果验证了冻结VFM表示作为多功能且对生成友好的视频潜在空间的潜力。模型和代码将发布。
1 引言
生成建模领域见证了范式转变,从像素空间生成(Van Den Oord等人,2016;Goodfellow等人,2014)转向潜在空间生成(Rombach等人,2022;Sun等人,2024;Kingma & Welling,2014;Van Den Oord等人,2017)。对于视频合成,变分自编码器(VAEs)(Cheng & Yuan,2025;Wan等人,2025;Yang等人,2025)和离散标记器(Wang等人,2024b;Hong等人,2022)通常采用3D视觉编码器将原始视频片段压缩为紧凑的时空标记。这种方法有效地降低了计算复杂度。然而,现有的视频标记器仍然主要优化像素级重建,这可能会低估语义和长程时空结构。受像素级均方误差和对抗损失的驱动,这些视觉标记器的潜在空间偏向于优化局部外观,而不是
∗ 同等贡献。 † 通讯作者。
1
第 2 页
预印本
视频基础模型 可训练的3D编码器 1D投影器
语义贫乏的潜在空间 语义结构的潜在空间 REPA损失
解码器 解码器
(a) 以前的视频分词器 (b) VideoRAE (c) 在UCF-101数据集上的视频重建和生成
图1:传统视频分词器与VideoRAE的概念性比较。传统的3D-VAE从头开始训练,仅由像素级MSE和对抗损失驱动。相比之下,VideoRAE直接利用冻结的视频基础模型作为其核心特征提取器。VideoRAE提供了一个统一且语义丰富的潜在空间,完美支持连续和离散生成范式,实现了高保真重建和高质量生成。
捕捉高级语义或物理结构。因此,下游生成模型被迫承担学习复杂时空动态和全局语义的重任,增加了训练的难度和数据需求。
与此同时,视觉表示学习取得了实质性进展。以V-JEPA 2 (Assran et al., 2025) 和 VideoMAEv2 (Wang et al., 2023) 为代表的视频基础模型,在提取结构化且可预测的时空特征方面显示出强大的能力。在图像领域,最近的表示自编码器如RAE (Zheng et al., 2025b) 和 VFM-Tok (Zheng et al., 2025a) 表明,预训练的视觉表示可以转换为可解码且有利于生成的潜在空间。然而,将此想法扩展到视频并非易事。与图像相比,视频包含更丰富的时间动态、更强的冗余性和更严格的压缩要求,因此尚不清楚冻结的VFM特征是否可以被直接用作紧凑且与生成兼容的视频潜在变量。现有的视频生成分词器研究 (Guo et al., 2025; Zhang et al., 2025; Xiong et al., 2026) 主要将语义对齐作为辅助监督纳入传统的像素驱动VAE框架中,同时基本上保留了其原始编码器架构和潜在构建机制。因此,冻结的VFM表示是否可以转换为支持高保真重建和下游视频生成的紧凑潜在空间,仍有待深入探索。
为了解决这个问题,我们引入了VideoRAE,这是一个统一的视频自编码框架,使用冻结的VFM作为其编码器。VideoRAE聚合分层VFM特征以捕捉粗粒度语义和细粒度时空动态,并使用轻量级的1D自注意力投影器压缩这些冗余表示,以满足视频生成的严格压缩要求。在解码过程中,我们进一步应用与冻结VFM教师的局部和全局表示对齐目标,这鼓励解码器保留基础表示的语义结构,并实现无需KL正则化的稳定训练。同一框架支持两种主要的潜在生成范式:用于扩散Transformer的连续潜在变量,以及通过多码本高维量化策略用于自回归模型的离散标记,该策略在使VFM表示具有自回归可处理性的同时,保留了其容量。
我们在连续和离散潜在机制下全面评估了VideoRAE,涵盖了视频重建和下游生成建模。在UCF-101和TokenBench上,VideoRAE实现了最先进的离散重建和极具竞争力的连续重建,表明冻结的VFM表示在经过强力压缩后仍能保持重建能力。对于UCF-101上的类到视频生成,其离散AR和连续DiT变体分别实现了40和93的最先进gFVD。值得注意的是,AR变体在使用更少的标记和更小的生成器的情况下优于先前的离散分词器,并且两个AR
第 3 页
预印本
并且 DiT 生成器的收敛速度比各自的自编码器基线快约 5 倍。 我们进一步进行了受控的 2B 规模文本到视频替换研究,结果表明,在相同的训练框架和可比设置下,VideoRAE 比 LTX-VAE 基线收敛更快。综上所述,这些结果证明了 VideoRAE 的优势在潜在表示形式、生成范式以及任务复杂性方面均成立。
我们的主要贡献总结如下:
- 我们突破了将冻结的视频基础模型 (VFMs) 主要局限于理解任务的常规范式。相反,我们首次系统地证明了冻结的 VFMs 可以被释放出来,作为高保真视频生成的稳健、可直接应用的自编码器基础。
- 我们提出了 VideoRAE,其具有语义驱动的 1D 投影器和针对冻结 VFM 特征定制的局部与全局表示对齐目标。它在单一框架内统一了连续无 KL 潜在空间和离散多码本潜在空间。
- 大量实验表明,VideoRAE 不仅在重建指标上与传统 VAE 相当,还提供了结构化的语义潜在空间,显著加速了下游生成模型的收敛速度并提高了生成质量。我们的工作证实了视觉基础模型表示在视频生成任务中的巨大可行性和潜力。
2 相关工作
2.1 视频自编码器和标记器
视频变分自编码器 (VAEs) 和标记器是将高维视频数据压缩到紧凑潜在空间的关键组件,这对于实现高效的生成建模至关重要。在连续空间领域,VFRTok (Zhong et al., 2026) 试图通过可变帧率训练增强模型鲁棒性,VidTwin (Wang et al., 2025) 通过解耦结构和动态来提升重建质量,而 LeanVAE (Cheng & Yuan, 2025) 则通过轻量级网络设计和小波变换提高训练效率。在离散标记化领域,LARP (Wang et al., 2024a) 首创了 1D 标记器架构,并通过自回归先验提升了生成质量,而 SweetTok (Tan et al., 2025) 则利用双流时空码本减轻量化损失。尽管这些模型取得了成功,但它们通常完全从头开始训练,严重依赖像素级重建和对抗损失的组合。与这些像素驱动的方法不同,VideoRAE 通过直接利用冻结的 VFMs 探索了一种语义驱动的压缩范式,从而提供了一个高度结构化的潜在空间,减轻了下游生成器的学习负担。
2.2 视觉基础模型
视觉基础模型 (VFMs) (Oquab et al., 2023; Siméoni et al., 2025; Assran et al., 2025; Mur-Labadia et al., 2026; Wang et al., 2023; 2022) 旨在从大规模、多样化的数据中学习通用、可迁移的表示。在图像领域,基于图像-文本对的自监督学习和语言监督预训练赋予了 VFMs 丰富且具有语义基础的表示。扩展到视频领域,视频基础模型的训练主要基于可扩展的自监督学习,利用视频固有的时空结构。值得注意的是,VideoMAEv2 (Wang et al., 2023) 通过双重掩码策略将掩码视频自编码扩展到十亿级参数规模,迫使模型从极其稀疏的输入中发展出强大的时空推理能力。同样,V-JEPA 2 (Assran et al., 2025) 采用联合嵌入预测架构。通过让目标编码器预测掩码区域的潜在特征,V-JEPA 2 (Assran et al., 2025) 刻意丢弃低层视觉噪声,主要关注高层语义和物理运动逻辑。虽然这些 VFMs 表现出卓越的理解能力,但其高度抽象的性质历来阻碍了它们在像素级高保真重建中的直接应用,这使得人们不禁要问,这种抽象的视频表示是否可以直接用于高保真视频生成。
3
第 4 页
预印本
2.3 表示学习与生成
传统上,用于视觉理解的表示(Tschannen et al., 2025; Wang et al., 2023; Sim´eoni et al., 2025; Oquab et al., 2023)与为生成优化的表示(Sun et al., 2024; Esser et al., 2021; Podell et al., 2023; Yao et al., 2025; Kingma & Welling, 2014; Van Den Oord et al., 2017)沿着两条截然不同的轨迹发展。面向理解的表示侧重于提取高层语义,同时丢弃低层噪声;而面向生成的潜在变量则优先考虑捕捉高保真纹理。然而,随着表示对齐(Representation Alignment)的广泛采用,最近的进展正在迅速模糊这一界限。在图像领域,RAE(Zheng et al., 2025b)和 VFMTok(Zheng et al., 2025a)等工作表明,从冻结的视觉基础模型中提取的特征可以作为图像生成的高度表达性的潜在空间。此外,MAETok(Chen et al., 2025)将自监督特征与基于离散标记的生成联系起来,而 UniTok(Ma et al., 2025)等工作则试图统一生成和理解任务。这些开创性工作共享一个共同的见解:在高度语义的潜在空间中操作可以显著提高生成质量和训练效率。尽管取得了这些进展,但在视频自动编码的具体领域中,语义特征通常仍仅被 relegated 为辅助监督信号。在本文中,我们引入 VideoRAE 来证明视频基础模型的特征可以天然地作为视觉生成的卓越表示。
3 方法:VideoRAE
VideoRAE 的核心理念是摒弃从头开始训练视频标记器的传统像素驱动范式。相反,我们提出了一种直接建立在冻结的视频基础模型(Video Foundation Models, VFMs)之上的语义驱动压缩框架。给定输入视频(第 3.1 节),我们首先利用预训练且冻结的 VFM(例如 V-JEPA 2)提取从浅层到深层的层次化语义特征。接下来,我们设计了一个轻量级的一维投影器(1D projector),对这些特征进行时空融合和下采样,生成高度紧凑的标记。随后(第 3.2 节),根据下游生成任务的需求,这些标记被无缝映射到连续表示(用于扩散 Transformer)或离散表示(用于自回归模型)。最后(第 3.3 节),解码器负责从这些潜在表示中重建原始像素。在此过程中,我们引入了表示对齐(Representation Alignment, REPA)模块来指导解码器的学习。通过显式地对齐语义,我们内在地在潜在空间中保持了高质量的拓扑结构,这完全取代了传统的 KL 散度约束。
3.1 语义驱动编码器与一维投影器
给定输入视频片段 $X \in \mathbb{R}^{B \times 3 \times T \times H \times W}$,我们利用现成的冻结 VFM 作为主要特征提取器。为了同时捕捉低层时间动态和高层抽象语义,我们从 VFM 的浅层到深层提取层次化中间特征,并通过逐元素求和显式地融合它们: $$ F_{\text{VFM}} = \sum_{l \in S} f_l(X), \quad F_{\text{VFM}} \in \mathbb{R}^{B \times N_{\text{vfm}} \times D_{\text{token}}} \quad (1) $$ 其中 $S$ 表示所选层的集合,$f_l(\cdot)$ 表示第 $l$ 个 VFM 层的映射函数。这里,$N_{\text{vfm}}$ 表示 VFM 输出的展平 3D 时空标记的总数,$D_{\text{token}}$ 是嵌入维度。
尽管 $F_{\text{VFM}}$ 封装了高度表达性的层次化语义,但其广泛的序列长度($N_{\text{vfm}}$)和固有的时空冗余对下游生成建模构成了显著的计算瓶颈。为了解决这个问题,我们引入了一个基于自注意力机制的轻量级一维投影器,记为 $E_{1D}$。该模块不重复处理冗余的 3D 结构,而是对 $F_{\text{VFM}}$ 内的全局依赖关系进行建模,并将长时空序列动态压缩为高度紧凑的一维基础标记序列: $$ Z_{\text{base}} = E_{1D}(F_{\text{VFM}}), \quad Z_{\text{base}} \in \mathbb{R}^{B \times N_{\text{latent}} \times D_{\text{token}}} \quad (2) $$ 其中 $N_{\text{latent}}$ 是压缩后的一维潜在序列的长度($N_{\text{latent}} \ll N_{\text{vfm}}$),$D_{\text{token}}$ 是投影器的隐藏维度。
4
第 5 页
预印本
重建损失
离散 VideoRAE 视频基础模型 SimVQ SimVQ SimVQ H 1D 投影器 SimVQ Transformer 解码器 多码本 SimVQ 重建视频 W 连续 VideoRAE 线性 3D 令牌 投影器 潜在令牌
REPA 损失 投影器
图 2:VideoRAE 的整体架构。给定输入视频,首先从冻结的视频基础模型(VFM)中提取并融合多尺度分层特征,随后通过一个 1D 自注意力投影器将其动态压缩为紧凑的基础令牌。这些令牌随后被格式化为两种潜在空间之一:通过线性投影用于扩散 Transformer(DiTs)的连续潜在空间,或通过多码本 SimVQ 用于自回归模型的离散潜在空间。最后,在解码过程中,表示对齐模块在局部和全局尺度上显式地对齐中间解码器特征与 VFM 教师特征,从而在内在上正则化潜在流形的语义结构。
3.2 多功能生成潜在空间
为了满足各种生成架构的不同偏好,VideoRAE 被设计为将基础令牌格式化为特定的潜在空间。
用于扩散模型的连续 VideoRAE。对于扩散 Transformer(DiTs)等生成架构,平滑且连续的潜在空间更受青睐。传统的连续 3D-VAE 严重依赖 KL 散度惩罚,以将潜在空间显式正则化为标准高斯分布。然而,这种刚性约束往往限制了潜在变量的表达能力,导致视觉细节过度平滑,并引发与像素重建目标的严重优化冲突。相比之下,VideoRAE 完全避免了 KL 散度惩罚的需求。通过继承强大 VFM 编码器的高度结构化语义拓扑,并通过后续的表示对齐(REPA)模块隐式地正则化表示,潜在空间在内在上保持在表现良好的语义流形上。因此,在不施加任何人工分布假设的情况下,一个简单的线性层有效地将 $Z_{base}$ 投影到潜在空间中,产生一个具有高表达力且适合 DiT 的连续潜在变量 $Z_{cont}$。
用于自回归模型的离散 VideoRAE。自回归生成模型依赖于离散令牌序列。为了打破量化瓶颈并最大程度地保留从 VFM 继承的丰富语义,一种直接的解决方案是同时增加码本大小和潜在维度。然而,现有研究表明,简单地扩展码本会产生边际效益递减。此外,在强语义约束下,简单的向量量化容易导致训练期间大量码字未被充分利用,最终引发严重的码本崩溃。
为了解决这个问题,我们提出了多码本 SimVQ 策略,其遵循分而治之的原则。具体而言,连续潜在向量 $Z_{base}$ 首先沿通道维度均匀划分为 $K$ 个子向量:$Z_{base} = [Z_1, Z_2, \dots, Z_K]$,其中 $Z_k \in \mathbb{R}^{B \times N_{latent} \times (D_{token}/K)}$。为了稳定高维语义特征的量化,我们将 SimVQ 范式集成到每个子码本中。与直接优化码本嵌入的标准 VQ 不同,SimVQ 初始化一个冻结的基础码本 $E_k$,并通过可学习的多层感知机(MLP)将其映射到目标潜在空间。因此,有效的子码本 $C_k$ 是动态生成的,并且在训练期间仅更新 MLP 参数。对于每个块 $Z_k$,其量化表示 $\hat{Z}_k$ 是通过在映射的子码本 $C_k$ 中搜索最近邻获得的: $$C_k = \text{MLP}_k(E_k), \quad \hat{Z}_k = \arg \min_{c \in C_k} \|Z_k – c\|_2^2 \quad (3)$$
5
第 6 页
预印本
最终的离散潜在变量 $Z_{\text{disc}}$ 通过拼接这些量化后的块构建而成:$Z_{\text{disc}} = [\hat{Z}_1, \hat{Z}_2, \dots, \hat{Z}_K]$。
与传统方法相比,多码本策略有效地扩大了词汇表大小,同时保持各个码本处于易于优化的范围内。更重要的是,保持高维潜在空间对于维持视频基础模型(VFM)的语义完整性至关重要。VFM 提取的语义特征本质上复杂且高度纠缠。强制将其压缩到低维瓶颈不可避免地会丢弃关键的上下文信息和细粒度的物理动态。通过多码本机制保持较高的整体维度,量化的离散表示可以舒适地容纳 VFM 提供的丰富信息。这种设计不仅实质上防止了模型崩溃,还在 REPA 约束下为后续的解码过程提供了充足的语义指导。
图 3:UCF-101 数据集上离散标记重建的可视化对比。
3.3 解码器与表示对齐
解码器 $D_{\text{sem}}$ 负责从高度压缩的潜在表示中重建原始视频像素。具体而言,$D_{\text{sem}}$ 被设计为基于 Transformer 的架构。它接受 1D 潜在标记序列,并将其与 1024 个可学习的 3D 标记拼接。经过堆叠的自注意力块处理这些拼接后的标记后,可学习的 3D 标记被分离,并通过去分块(depatchify)操作映射回 3D 特征图,以进行后续的像素重建。
除了传统的重建损失外,我们提出了表示对齐(REPA)目标。令 $H_{\text{stu}}$ 表示解码器的浅层 3D 中间特征(即去分块操作后不久导出的空间特征)。我们将 $H_{\text{stu}}$ 投影并在 3D 网格上进行空间插值,以与 VFM 的最后一层特征 $F_{\text{target}}$ 对齐,从而得到对齐后的特征 $H_{\text{align}}$。
REPA 损失在局部和全局尺度上强制执行语义一致性:
$$ L_{\text{local}} = – \frac{1}{N_{\text{vfm}}} \sum_{i=1}^{N_{\text{vfm}}} \frac{H_{\text{align}}^{(i)} \cdot F_{\text{target}}^{(i)}}{\|H_{\text{align}}^{(i)}\| \|F_{\text{target}}^{(i)}\|} \quad (4) $$
$$ L_{\text{global}} = – \frac{\text{Pool}(H_{\text{align}}) \cdot \text{Pool}(F_{\text{target}})}{\|\text{Pool}(H_{\text{align}})\| \|\text{Pool}(F_{\text{target}})\|} \quad (5) $$
$$ L_{\text{REPA}} = L_{\text{local}} + \lambda L_{\text{global}} \quad (6) $$
6
第 7 页
预印本
其中 $\lambda$ 是全局损失的权重。关键在于,这种语义对齐隐式地正则化了潜在空间的几何结构,迫使表示位于一个行为良好的语义流形上。它迫使潜在特征遵循基础模型的高质量语义拓扑结构。这种结构保留是我们能够在 VideoRAE 中弃用传统 3D-VAE 中使用的 KL 散度损失的根本原因。
3.4 训练目标
VideoRAE 的端到端训练整合了像素级重建、对抗感知以及我们的语义对齐约束。总体损失函数定义为:
$$ L_{total} = L_{rec} + L_{adv} + \lambda_{repa}L_{REPA} (+L_{vq}) \quad (7) $$
其中重建损失 $L_{rec}$ 包含 $L1$ 和 LPIPS 感知损失,以确保基本的像素正确性。生成对抗损失 $L_{adv}$(GAN 损失)被保留,并专门用于恢复高频视觉纹理。同时,$L_{REPA}$ 注入宏观结构和物理语义。最后,$L_{vq}$ 仅在训练离散 VideoRAE 时包含,用于计算码本承诺损失。
图 4:UCF-101 数据集上连续空间重建的可视化对比。
4 实验
数据集:基于先前的工作,我们在 UCF-101 (Soomro et al., 2012) 和 Kinetics-600 数据集 (Carreira et al., 2018) 上训练 VideoRAE,使用 $16 \times 256 \times 256$ 的视频片段进行训练和评估;同时,文本到视频(T2V)生成模型专门在 VideoUFO 数据集 (Wang & Yang, 2026) 上进行训练。为了评估重建性能,我们在 UCF-101 (Soomro et al., 2012) 和 TokenBench (Agarwal et al., 2025) 数据集上进行评估。此外,我们在 UCF-101 数据集 (Soomro et al., 2012) 上评估类到视频(C2V)生成能力,并在 VBench (Huang et al., 2024) 上评估文本到视频生成性能。遵循既定的评估协议 (Wang et al., 2024a),我们采样 10,000 个案例来评估离散标记器的 C2V 生成,而对于连续 VAE 模型,我们使用 2,048 个采样案例的子集进行评估。
实现细节:对于特征提取,我们使用预训练并冻结的 V-JEPA 2 (Assran et al., 2025) 和 VideoMAEv2 (Wang et al., 2023) 作为教师模型,提取多层中间特征。预训练的视频基础模型采用 $16 \times$ 空间下采样和 $2 \times$ 时间下采样。随后,我们的 1D 自注意力投影器压缩了
7
第 8 页
将输入 3D 特征转换为高度压缩的序列,包含 512 或 1024 个潜在 token。对于连续潜在空间,通道维度通过线性投影映射到 32/64 维的瓶颈层。对于离散潜在空间,我们采用 Multi-Codebook SimVQ 策略,设置子码本数量 $K = 4$,每个子码本的词汇表大小为 $V = 4096$。为了评估结构化潜在空间的生成性能,我们在连续的 VideoRAE 上训练标准的 Diffusion Transformers (DiTs) (Peebles & Xie, 2023),并在离散的 VideoRAE 上训练基于 LLaMA 风格的 Transformer 自回归 (AR) 模型 (Sun et al., 2024)。所有模型均在 NVIDIA H100 GPU 上进行训练。
基线。为了全面评估 VideoRAE 在不同任务和架构下的性能,我们针对每个特定的实验设置选择了合适的最新 (SOTA) 基线模型。值得注意的是,为了保证公平性,我们在相同的评估协议和环境下重新复现并重新测试了所有开源基线模型:
- 视频重建。在离散表示范式下,我们将我们的方法与领先的视频 tokenizer 进行比较,包括 TATS (Ge et al., 2022)、OmniTokenizer (Wang et al., 2024b)、LARP (Wang et al., 2024a) 和 SweetTok (Tan et al., 2025)。对于连续自编码,我们不仅与 CV-VAE (Zhao et al., 2024) 和 LeanVAE (Cheng & Yuan, 2025) 进行基准比较,还与最新的强大自编码器如 LTX-VAE (HaCohen et al., 2024)、LTX2 (HaCohen et al., 2026)、CogVideoX-VAE (Yang et al., 2025) 和 WAN2.1-VAE (Wan et al., 2025) 进行比较。
- 类别条件生成。在 UCF-101 数据集上,我们仔细地将基线与下游生成框架对齐。对于在离散空间中运行的 Autoregressive (AR) 模型,我们与 CogVideo (Hong et al., 2022)、TATS (Ge et al., 2022)、VideoLaVIT (Jin et al., 2024)、OmniTokenizer (Wang et al., 2024b)、LARP (Wang et al., 2024a) 和 SweetTok (Tan et al., 2025) 进行评估对比。对于连续空间中的 Diffusion Transformers (DiT),我们的比较涵盖了 Latte (Ma et al., 2024)、WF-VAE (Li et al., 2025)、DeCo-VAE (Yin et al., 2025),以及基于 LeanVAE (Cheng & Yuan, 2025)、LTX-VAE (HaCohen et al., 2024)、CogVideoX-VAE (Yang et al., 2025) 和 WAN2.1-VAE (Wan et al., 2025) 构建的生成流水线。
- 文生视频生成。最后,对于在 VBench 套件上评估的复杂开放域 T2V 生成任务,我们将连续的 VideoRAE 直接与最先进的开源连续模型 LTX-VAE (HaCohen et al., 2024) 进行比较。
表 1:离散 tokenizer 在 UCF-101 和 TokenBench 上的重建性能。
| Method | #rToken | UCF-101 PSNR↑ | UCF-101 LPIPS↓ | UCF-101 rFVD↓ | TokenBench-256×256 PSNR↑ | TokenBench-256×256 LPIPS↓ | TokenBench-256×256 rFVD↓ | | :— | :— | :— | :— | :— | :— | :— | :— | | AR generative models with discrete video tokenizers | | | | | | | | | TATS | 1024 | – | – | 162 | – | – | – | | OmniTokenizer | 5120 | 29.25 | 0.11 | 28 | 25.55 | 0.11 | 44 | | LARP-L-Long | 1024 | 27.88 | 0.12 | 35 | 28.65 | 0.11 | 45 | | SweetTok | 1280 | 29.27 | 0.07 | 20 | – | – | – | | VideoRAE(VideoMAEv2) | 1024 | 29.94 | 0.10 | 16 | 30.69 | 0.09 | 33 | | VideoRAE(V-JEPA 2) | 1024 | 29.39 | 0.10 | 13 | 29.93 | 0.10 | 28 |
4.1 主要结果
重建质量比较。我们在 UCF-101 (Soomro et al., 2012) 和 TokenBench (Agarwal et al., 2025) 数据集上,全面评估了 VideoRAE 在离散和连续潜在范式下的重建能力。如表 1 所示,在离散 tokenizer 配置下,VideoRAE 确立了新的最先进基准。具体而言,VideoRAE(V-JEPA 2) 在 UCF-101 (Soomro et al., 2012) 上取得了优异的 rFVD 分数 13,在 TokenBench (Agarwal et al., 2025) 上取得了 28,显著优于 LARP (Wang et al., 2024a) 和 SweetTok (Tan et al., 2025) 等近期强大的基线模型。同时,VideoRAE(VideoMAEv2) 展示了优越的空间保真度,在两个数据集上均获得了最高的 PSNR。这验证了源自视频基础模型的高维语义表示的优越性。
8
第 9 页
预印本
表 2:连续自编码器在 UCF-101 和 TokenBench 上的重建性能。
| Method | Config | UCF-101 PSNR↑ | UCF-101 LPIPS↓ | UCF-101 rFVD↓ | TokenBench-256×256 PSNR↑ | TokenBench-256×256 LPIPS↓ | TokenBench-256×256 rFVD↓ | | :— | :— | :— | :— | :— | :— | :— | :— | | Diffusion generative models with continuous video tokenizers | | | | | | | | | CV-VAE | 4096×4 | 30.11 | 0.12 | 57 | 30.80 | 0.11 | 61 | | LTX-VAE | 128×128 | 32.02 | 0.10 | 35 | 33.74 | 0.08 | 32 | | LTX2 | 128×128 | 28.88 | 0.12 | 15 | 29.36 | 0.11 | 36 | | LeanVAE | 4096×4 | 30.99 | 0.11 | 10 | 31.79 | 0.10 | 23 | | VideoRAE(VideoMAEv2) | 512×32 | 31.23 | 0.08 | 13 | 32.06 | 0.08 | 25 | | VideoRAE(V-JEPA 2) | 512×32 | 30.40 | 0.09 | 14 | 31.19 | 0.09 | 25 | | CogvideoX-VAE | 4096×16 | 36.22 | 0.05 | 7 | 36.35 | 0.04 | 9 | | WAN2.1-VAE | 4096×16 | 35.70 | 0.05 | 4 | 37.02 | 0.04 | 6 | | VideoRAE(VideoMAEv2) | 1024×64 | 33.64 | 0.06 | 5 | 34.25 | 0.07 | 11 | | VideoRAE(V-JEPA 2) | 1024×64 | 32.14 | 0.07 | 7 | 32.56 | 0.08 | 13 |
图 5:UCF-101 数据集上离散令牌生成结果的可视化。
此外,它表明我们的 Multi-Codebook SimVQ 策略即使在高度压缩的离散语义空间内,也能成功重建高保真像素。
对于表 2 中展示的连续潜在空间,VideoRAE 也提供了极具竞争力的性能,在空间纹理恢复和感知质量之间表现出良好的平衡。我们观察到,虽然像 LTX-VAE (HaCohen et al., 2024) 这样的模型实现了高 PSNR,但它们在时空一致性方面表现不佳(导致 rFVD 为 35,非最优)。相反,尽管 LeanVAE (Cheng & Yuan, 2025) 实现了较低的 rFVD,但它严重依赖于巨大的潜在分辨率。相比之下,使用高度紧凑的 512×32 瓶颈,VideoRAE 提供了顶级的感知质量以及具有竞争力的 PSNR 性能。即使与工业级 VAE 相比,VideoRAE 仅使用 K600 (Carreira et al., 2018) 和 UCF-101 (Soomro et al., 2012) 数据集进行训练,也展现出了具有竞争力的性能。上述离散和连续模型的重建结果有效地验证了我们的核心假设:冻结的视频基础模型(Video Foundation Models, VFMs)的表示并不会阻碍重建。相反,它们在以卓越的感知质量和保真度重建视频方面,可以超越传统的基于像素的自编码器。
离散令牌类别条件生成。为了评估离散表示的生成能力,我们在标记化的潜在空间上训练自回归(AR)模型。如表所示,
9
第 10 页
预印本
图 6:在 UCF-101 数据集上连续空间生成结果的可视化。
表 3 显示,VideoRAE 在 UCF-101 类别条件生成任务中表现出极具竞争力的性能。值得注意的是,VideoRAE(V-JEPA 2) 取得了 40 的领先 gFVD 分数。与之前领先的方法 SweetTok (Tan et al., 2025)(使用 19 亿参数和 1280 个 token 获得 gFVD 为 65)相比,VideoRAE 在使用更少的 token 和更小的生成器规模的情况下,确立了决定性的优势。源自视觉基础模型的特征空间本质上非常适合生成任务。此外,通过我们的 Multi-Codebook SimVQ 量化和语义对齐策略获得的离散 token 有效地保留了 VFM 的丰富语义,使得下游自回归预测任务更加高效和准确。
连续空间类别条件生成。对于连续潜在空间,我们采用 Diffusion Transformers (DiT) (Rombach et al., 2022) 架构来评估生成质量。如表 4 所示,VideoRAE 展现出强大的生成能力。尽管最近先进的连续 VAE(如 LeanVAE (Cheng & Yuan, 2025) 和 LTX-VAE (HaCohen et al., 2024))分别将基线 gFVD 改进至 164 和 161,但 VideoRAE 进一步将该指标降低至 99 (VideoMAEv2) 和 93 (V-JEPA 2)。此外,我们将工业级模型(包括 WAN2.1-VAE (Wan et al., 2025) 和 CogVideoX (Yang et al., 2025))扩展应用于 UCF-101 数据集上的类别到视频生成任务。尽管它们优于 Deco-VAE (Yin et al., 2025) 等现有方法,但 VideoRAE 在生成性能上仍表现出明显的优越性,即使与这些模型相比也是如此。这一显著改进表明,VideoRAE 提供的无 KL 散度且语义对齐的连续潜在空间为扩散模型提供了一个结构合理且利于生成的流形,从而促进了高保真视频的合成。
讨论:重建保真度与生成质量。在离散和连续两种模态中,我们观察到一个发人深省的现象:配备 VideoMAEv2 的 VideoRAE 始终表现出更优的像素级重建保真度(即更高的 PSNR 和更低的 LPIPS)。然而,我们的实证结果表明,最终的细粒度重建并不严格转化为更高的生成质量。相反,VideoRAE(V-JEPA 2) 在所有生成任务中始终取得更好的 gFVD 分数。我们将这种差异归因于两个视频基础模型截然不同的预训练范式。VideoMAEv2 由掩码像素重建驱动,这迫使模型高度关注细粒度的局部运动细节。相比之下,V-JEPA 2 利用潜在空间预测机制,这一目标迫使其特征表示与高层语义和宏观时空动态更加对齐。尽管这种深层语义抽象略微牺牲了绝对的像素级重建精度,但它提供了一个显著更利于生成的潜在空间,减轻了下游生成器的建模负担。这得出了一个关键结论:为了实现高质量的视频生成,赋予潜在空间更强的语义
第 11 页
预印本
理解和视觉感知能力远比追求僵化的底层像素保真度更有价值。
表 3:UCF-101 上的类别条件生成评估(离散自回归),在 10K 个生成样本上进行评估。
| Tokenizer | #Tokens | #Params | gFVD ↓ | | :— | :— | :— | :— | | CogVideo | 6800 | 9.4B | 626 | | TATS | 4096 | 321M | 332 | | Video-LaVIT | 512 | 7B | 280 | | OmniTokenizer | 5120 | 650M | 191 | | LARP-L | 1024 | 632M | 99 | | SweetTok | 1280 | 650M | 84 | | SweetTok | 1280 | 1.9B | 65 | | VideoRAE(VideoMAEv2) | 1024 | 1.3B | 45 | | VideoRAE(V-JEPA 2) | 1024 | 1.3B | 40 |
表 4:UCF-101 上的类别条件生成评估(连续 DiT),在 2K 个生成样本上进行评估。
| Method | Configs | gFVD ↓ | | :— | :— | :— | | Latte | 4096*4 | 478 | | LeanVAE | 4096*4 | 164 | | LTX-VAE | 128*128 | 161 | | VideoRAE(VideoMAEv2) | 512*32 | 99 | | VideoRAE(V-JEPA 2) | 512*32 | 93 | | WF-VAE | 4096*16 | 371 | | LeanVAE | 4096*16 | 175 | | DeCo-VAE | 4096*16 | 166 | | CogvideoX-VAE | 4096*16 | 151 | | WAN2.1-VAE | 4096*16 | 126 | | VideoRAE(VideoMAEv2) | 1024*64 | 103 | | VideoRAE(V-JEPA 2) | 1024*64 | 94 |
图 7:自回归(左)和 DiT(右)生成建模中的训练收敛速度比较。
生成训练中的加速收敛。为了进一步说明我们语义驱动的潜在空间的效率,我们首先在离散 tokenizer 设置下比较 VideoRAE 与强基线 LARP 之间的生成训练收敛速度,每个模型评估 2,000 个生成样本。如图 7 所示,在传统像素驱动的 LARP tokenizer 上训练的自回归生成模型需要 2000 个 epoch 才能达到 gFVD 分数为 136。相比之下,在 VideoRAE 表示上训练的模型达到了相当
第 12 页
预印本
在仅 400 个 epoch 时 gFVD 为 139,显示出令人印象深刻的约 5.0 倍的训练收敛加速。同样,在连续潜在空间中,VideoRAE 在与 LTX-VAE 对比评估时表现出相当显著的加速模型收敛趋势。通过减轻生成器从头学习复杂时空动态的巨大负担,VideoRAE 使下游生成模型能够完全专注于学习高层序列转换逻辑。这从根本上验证了我们的主张:语义对齐的潜在空间对于降低生成训练成本至关重要。
语义得分 质量得分 总分
LTX VAE LTX VAE 0.72 LTX VAE 0.50 VideoRAE 0.76 VideoRAE VideoRAE 0.70 得分 得分 得分 0.45 VBench 0.40 VBench 0.74 VBench 0.680.66 0.72 0.64 200K 500K 600K 700K 800K 200K 500K 600K 700K 800K 200K 500K 600K 700K 800K 训练步数 训练步数 训练步数
图 8:VideoRAE 与 LTX-VAE 在 VBench 上的收敛性对比。
表 5:VBench 上的文本到视频生成评估。VideoRAE 实现了比 LTX-VAE 更强的整体性能,在视觉一致性和语义对齐方面均有明显提升。
方法 总分 质量分 语义分 主体 背景 成像 物体 人类 场景 ↑ 得分 ↑ 得分 ↑ 得分 ↑ 一致性 ↑ 一致性 ↑ 质量 ↑ 类别 ↑ 动作 ↑
LTX-VAE 69.35 74.03 50.67 84.14 95.51 43.54 58.51 54.50 23.29 VideoRAE (Ours) 71.26 76.09 51.92 91.27 97.02 46.02 59.07 60.80 27.57
VBench 上的文本到视频生成。为了进一步评估 VideoRAE 在复杂开放域场景中的生成能力,我们将研究扩展到文本到视频生成。我们在 OpenSora2 (Zheng et al., 2025c) 训练框架之上构建我们的 T2V 系统,并用 LTX-VAE (HaCohen et al., 2024) 或我们训练的 VideoRAE 替换其原始视频自编码器,同时保持扩散主干网络和训练配方相当。具体而言,我们训练了一个 2B 规模的 MMDiT 风格扩散 Transformer,由双流文本-视频块后跟单流多模态块组成,隐藏层大小为 2048,16 个注意力头,8 个双流块和 16 个单流块。该模型以 T5 和 CLIP 文本嵌入为条件,并训练预测每个视频分词器潜在空间中的流匹配目标。我们在 VideoUFO (Wang & Yang, 2026) 上以 256 × 256 分辨率和 12 FPS 训练这两个系统,使用 17 帧片段用于 LTX-VAE,使用 16 帧片段用于 VideoRAE,以匹配每个自编码器的原生时间接口。两个模型均使用 256 的全局批量大小训练 800K 优化步数。
在训练期间,我们在 VBench (Huang et al., 2024) 上定期评估中间检查点,并在图 8 中报告总分、质量得分和语义得分的演变情况。如图所示,基于 VideoRAE 的生成器比 LTX-VAE 对应模型收敛更快,并且在整个训练过程中始终取得更好的分数。收敛后,我们在表 5 中进一步报告了详细的 VBench 指标。这些结果与我们的 C2V 观察结果一致,表明 VideoRAE 为生成建模提供了更有效的潜在空间。通过使用视觉基础模型作为编码器,VideoRAE 产生了既语义丰富又高度紧凑的潜在变量,使扩散 Transformer 能够更高效地建模高层视频内容。这种改进的表示减少了扩散模型从低层重建潜在变量中重新发现语义结构的负担,从而实现了更快的收敛和更强的最终生成质量。
4.2 消融研究
量化策略。我们消融了四种量化方法对 VideoRAE 模型的影响:VQ、SimVQ (Zhu et al., 2025)、MCQ 和 Multi-codebook SimVQ。传统的向量量化产生了最差的重建和生成性能。我们将此归因于码本坍塌和非收敛,这是由于在处理高度语义的潜在空间时量化维度过低所致。相比之下,SimVQ 扩展了
12
第 13 页
将量化维度提升至 128,带来了显著的改进。当过渡到 MCQ 时,与单码本对应模型相比,其性能实现了大幅提升。我们认为,这种改进源于 MCQ 能够有效扩展码本容量,同时避免大码本带来的优化困难。在此基础上,Multi-codebook SimVQ 进一步将量化维度扩展至 512。这种高维量化有效地减轻了语义损失,从而提供了更优越的生成能力。
表 6:量化策略的消融研究。
| 量化方法 | PSNR↑ | SSIM↑ | LPIPS↓ | rFVD↓ | gFVD↓ | | :— | :— | :— | :— | :— | :— | | VQ | 25.50 | 0.82 | 0.14 | 35 | 95 | | SimVQ | 28.32 | 0.87 | 0.12 | 24 | 59 | | MCQ | 29.10 | 0.90 | 0.10 | 16 | 51 | | Multi-codebook SimVQ | 29.39 | 0.91 | 0.10 | 13 | 40 |
表示对齐 (REPA)。为了评估我们提出的表示对齐 (REPA) 模块的有效性,我们通过在有无 REPA 目标的情况下训练连续和离散模型来进行消融实验。如表 7 所示,在潜在空间的两种设置中,引入 REPA 都在大多数评估指标上持续带来了显著的性能提升。具体而言,在连续设置中,引入 REPA 将 gFVD 从 105 降低到 93,在离散设置中从 67 降低到 40,同时也大幅提升了感知指标。此外,我们观察到在连续设置中应用 KL 惩罚在一定程度上损害了重建和生成质量。这表明,在局部和全局尺度上将解码器的特征与 VFM 教师对齐,不仅提高了模型的感知质量,还作为一种强大的语义约束,成功地正则化了潜在空间拓扑,而无需任何 KL 惩罚,使得这种高质量的潜在分布更有利于下游生成任务。
表 7:REPA 对语义对齐影响的消融研究。
| 潜在空间 | REPA | PSNR↑ | SSIM↑ | LPIPS↓ | rFVD↓ | gFVD↓ | | :— | :— | :— | :— | :— | :— | :— | | Continuous | w/o | 30.57 | 0.91 | 0.10 | 18 | 105 | | Continuous-kl | w/o | 27.45 | 0.81 | 0.12 | 31 | 101 | | Continuous | w/ | 30.40 | 0.91 | 0.10 | 14 | 93 | | Discrete | w/o | 29.71 | 0.90 | 0.10 | 15 | 67 | | Discrete | w/ | 29.39 | 0.91 | 0.10 | 13 | 40 |
多尺度特征聚合。我们研究了聚合视觉基础模型 (VFM) 教师不同层级特征的影响。如表 8 所示,仅依赖深层会导致次优的重建结果。在感知质量指标 rFVD 方面,是否引入浅层特征并未导致显著差异。然而,由于深层特征主要捕获高层语义而丢弃细粒度空间细节,它们在恢复高频细节方面表现出能力不足,导致 PSNR 严重受损。通过逐步引入更浅的层,所有重建指标稳步提升。最终,利用多层级特征(第 8–24 层)在重建和生成性能之间实现了最佳权衡,达到了 29.39 的 PSNR 和 40 的 gFVD。这凸显了多尺度特征聚合的必要性,以同时捕获宏观语义和微观纹理细节。
特征融合策略。我们比较了四种用于聚合多层 VFM 表示的特征融合策略:逐元素相加 (Element-wise Addition)、解耦融合 (Decoupled Fusion)、门控融合 (Gated Fusion) 和 AdaLN。结果总结在表 9 中。经验上,更复杂的解耦融合策略和简单的逐元素相加在重建和生成质量方面表现相当,两者均略优于门控融合和 AdaLN。鉴于其简单性、高计算效率以及零额外参数开销的优势,我们选择逐元素相加作为默认的特征融合策略。
13
第 14 页
预印本
表 8:多尺度特征聚合的消融研究。
聚合层数 PSNR↑ SSIM↑ LPIPS↓ rFVD↓ gFVD↓
Layer 24 26.59 0.85 0.14 22 51 Layers 16–24 28.35 0.87 0.12 18 41 Layers 12–24 29.11 0.90 0.11 15 42 Layers 8–24 29.39 0.91 0.10 13 40
表 9:特征融合策略的消融研究。
融合策略 PSNR↑ SSIM↑ LPIPS↓ rFVD↓ gFVD↓
解耦融合 29.43 0.91 0.10 13 43 语义引导 AdaLN 融合 29.03 0.90 0.11 18 51 门控融合 29.10 0.90 0.11 16 49 逐元素相加( ours ) 29.39 0.91 0.10 13 40
5 结论
在本文中,我们介绍了 VideoRAE,这是一种语义驱动的视频自编码器,旨在弥合视觉理解与生成之间的差距。通过挑战“冻结的视频基础模型(Video Foundation Models, VFMs)不适合像素级重建”这一普遍假设,我们证明了 VFM 表示可以作为生成建模的高度鲁棒的潜在空间。VideoRAE 被设计为一个统一的框架,无缝支持连续和离散生成范式。通过我们的表示对齐(Representation Alignment, REPA)目标,潜在流形得到了内在的正则化,完全消除了对传统分布约束的需求。大量实验证实,VideoRAE 不仅实现了优越的重建质量,还显著加速了下游生成模型的收敛。最重要的是,我们的发现表明,对于视频生成而言,语义结构的潜在空间比僵化的像素级保真度更为关键。通过将 VFM 确立为新的默认潜在基础,VideoRAE 为统一表示学习和生成建模开辟了一条充满希望的道路。
参考文献
Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chat- topadhyay, Yongxin Chen, Yin Cui, Yifan Ding, et al. Cosmos world foundation model platform for physical ai. arXiv preprint arXiv:2501.03575, 2025.
Mahmoud Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Mojtaba Komeili, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, Sergio Ar- naud, Abha Gejji, Ada Martin, Francois Robert Hogan, Daniel Dugas, Piotr Bojanowski, Vasil Khalidov, Patrick Labatut, Francisco Massa, Marc Szafraniec, Kapil Krishnakumar, Yong Li, Xi- aodong Ma, Sarath Chandar, Franziska Meier, Yann LeCun, Michael Rabbat, and Nicolas Ballas. V-jepa 2: Self-supervised video models enable understanding, prediction and planning. arXiv preprint arXiv:2506.09985, 2025.
Joao Carreira, Eric Noland, Andras Banki-Horvath, Chloe Hillier, and Andrew Zisserman. A short note about kinetics-600. arXiv preprint arXiv:1808.01340, 2018.
Hao Chen, Yujin Han, Fangyi Chen, Xiang Li, Yidong Wang, Jindong Wang, Ze Wang, Zicheng Liu, Difan Zou, and Bhiksha Raj. Masked autoencoders are effective tokenizers for diffusion models. In Forty-second International Conference on Machine Learning, 2025.
Yu Cheng and Fajie Yuan. Leanvae: An ultra-efficient reconstruction vae for video diffusion mod- els. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 15692– 15702, 2025.
14
第 15 页
预印本
Patrick Esser, Robin Rombach, 和 Bjorn Ommer. Taming transformers for high-resolution image synthesis. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 12873–12883, 2021.
Songwei Ge, Thomas Hayes, Harry Yang, Xi Yin, Guan Pang, David Jacobs, Jia-Bin Huang, 和 Devi Parikh. Long video generation with time-agnostic vqgan and time-sensitive transformer. arXiv preprint arXiv:2204.03638, 2022.
Ian J Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, 和 Yoshua Bengio. Generative adversarial nets. Advances in neural information processing systems, 27, 2014.
Pengbo Guo, Junke Wang, Zhen Xing, Chengxu Liu, Daoguo Dong, Xueming Qian, 和 Zuxuan Wu. Dera: Decoupled representation alignment for video tokenization. arXiv preprint arXiv:2512.04483, 2025.
Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, 等人. Ltx-video: Realtime video latent diffusion. arXiv preprint arXiv:2501.00103, 2024.
Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, 等人. Ltx-2: Efficient joint audio-visual foundation model. arXiv preprint arXiv:2601.03233, 2026.
Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, 和 Jie Tang. Cogvideo: Large-scale pre-training for text-to-video generation via transformers. arXiv preprint arXiv:2205.15868, 2022.
Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, 等人. Vbench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 21807–21818, 2024.
Yang Jin, Zhicheng Sun, Kun Xu, Liwei Chen, Hao Jiang, Quzhe Huang, Chengru Song, Yuliang Liu, Di Zhang, Yang Song, 等人. Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization. arXiv preprint arXiv:2402.03161, 2024.
Diederik P. Kingma 和 Max Welling. Auto-encoding variational bayes. In International Conference on Learning Representations, 2014.
Zongjian Li, Bin Lin, Yang Ye, Liuhan Chen, Xinhua Cheng, Shenghai Yuan, 和 Li Yuan. Wf-vae: Enhancing video vae by wavelet-driven energy flow for latent video diffusion model. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 17778–17788, 2025.
Chuofan Ma, Yi Jiang, Junfeng Wu, Jihan Yang, Xin Yu, Zehuan Yuan, Bingyue Peng, 和 Xiaojuan Qi. Unitok: A unified tokenizer for visual generation and understanding. arXiv preprint arXiv:2502.20321, 2025.
Xin Ma, Yaohui Wang, Xinyuan Chen, Gengyun Jia, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, 和 Yu Qiao. Latte: Latent diffusion transformer for video generation. arXiv preprint arXiv:2401.03048, 2024.
Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mahmoud Assran, Koustuv Sinha, Michael Rabbat, Yann LeCun, Nicolas Ballas, 和 Adrien Bardes. V-jepa 2.1: Unlocking dense features in video self-supervised learning. arXiv preprint arXiv:2603.14482, 2026.
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, 等人. Dinov2: Learning robust visual features without supervision. arXiv preprint arXiv:2304.07193, 2023.
William Peebles 和 Saining Xie. Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF international conference on computer vision, pp. 4195–4205, 2023.
15
第 16 页
预印本
Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas M¨uller, Joe Penna, 和 Robin Rombach。Sdxl:改进潜在扩散模型以实现高分辨率图像合成。arXiv 预印本 arXiv:2307.01952,2023。
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Bj¨orn Ommer。使用潜在扩散模型进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 10684–10695 页,2022。
Oriane Sim´eoni, Huy V Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Micha¨el Ramamonjisoa 等人。Dinov3。arXiv 预印本 arXiv:2508.10104,2025。
Khurram Soomro, Amir Roshan Zamir, 和 Mubarak Shah。Ucf101:来自野外视频的人类动作类别数据集。arXiv 预印本 arXiv:1212.0402,2012。
Peize Sun, Yi Jiang, Shoufa Chen, Shilong Zhang, Bingyue Peng, Ping Luo, 和 Zehuan Yuan。 自回归模型胜过扩散模型:Llama 用于可扩展图像生成。arXiv 预印本 arXiv:2406.06525,2024。
Zhentao Tan, Ben Xue, Jian Jia, Junhao Wang, Wencai Ye, Shaoyun Shi, Mingjie Sun, Wenjin Wu, Quan Chen, 和 Peng Jiang。Sweettok:用于紧凑视频离散化的语义感知时空标记器。在 IEEE/CVF 国际计算机视觉会议论文集,第 23541–23550 页,2025。
Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdul- mohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa 等人。Siglip 2: 具有改进语义理解、定位和密集特征的多语言视觉-语言编码器。arXiv 预印本 arXiv:2502.14786,2025。
A¨aron Van Den Oord, Nal Kalchbrenner, 和 Koray Kavukcuoglu。像素循环神经网络。 在国际机器学习会议论文集,第 1747–1756 页。PMLR,2016。
Aaron Van Den Oord, Oriol Vinyals 等人。神经离散表示学习。神经信息处理系统进展,30,2017。
Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang 等人。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。
Hanyu Wang, Saksham Suri, Yixuan Ren, Hao Chen, 和 Abhinav Shrivastava。Larp:使用学习的自回归生成先验对视频进行标记。arXiv 预印本 arXiv:2410.21264,2024a。
Junke Wang, Yi Jiang, Zehuan Yuan, Binyue Peng, Zuxuan Wu, 和 Yu-Gang Jiang。Omnitokenizer: 用于视觉生成的联合图像-视频标记器。神经信息处理系统进展,37:28281–28295,2024b。
Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan Tong, Yinan He, Yi Wang, Yali Wang, 和 Yu Qiao。Videomae v2:通过双重掩码扩展视频掩码自编码器。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 14549–14560 页,2023。
Wenhao Wang 和 Yi Yang。Videoufo:面向文本到视频生成的百万级用户关注数据集。神经信息处理系统进展,38,2026。
Yi Wang, Kunchang Li, Yizhuo Li, Yinan He, Bingkun Huang, Zhiyu Zhao, Hongjie Zhang, Jilan Xu, Yi Liu, Zun Wang 等人。Internvideo:通过生成式和判别式学习实现通用视频基础模型。arXiv 预印本 arXiv:2212.03191,2022。
Yuchi Wang, Junliang Guo, Xinyi Xie, Tianyu He, Xu Sun, 和 Jiang Bian。Vidtwin:具有解耦结构和动态的视频 VAE。在计算机视觉与模式识别会议论文集,第 22922–22932 页,2025。
16
第 17 页
预印本
Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, 和 Xihui Liu。Evatok:用于高效视觉自回归生成的自适应长度视频标记化。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 23249–23259 页,2026 年。
Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng 等。Cogvideox:具有专家 Transformer 的文本到视频扩散模型。在国际学习表征会议 (International Conference on Learning Representations) 中,卷 2025,第 83048–83077 页,2025 年。
Jingfeng Yao, Bin Yang, 和 Xinggang Wang。重建与生成:驯服潜在扩散模型中的优化困境。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,2025 年。
Xiangchen Yin, Jiahui Yuan, Zhangchi Hu, Wenzhang Sun, Jie Chen, Xiaozhen Qiao, Hao Li, 和 Xiaoyan Sun。Deco-vae:通过解耦表示学习用于视频重建的紧凑潜在变量。arXiv 预印本 arXiv:2511.14530,2025 年。
Xiangdong Zhang, Jiaqi Liao, Shaofeng Zhang, Fanqing Meng, Xiangpeng Wan, Junchi Yan, 和 Yu Cheng。Videorepa:通过与基础模型的关系对齐学习视频生成的物理规律。arXiv 预印本 arXiv:2505.23656,2025 年。
Sijie Zhao, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Muyao Niu, Xiaoyu Li, Wenbo Hu, 和 Ying Shan。Cv-vae:用于潜在生成视频模型的兼容视频 VAE。神经信息处理系统进展 (Advances in Neural Information Processing Systems),37:12847–12871,2024 年。
Anlin Zheng, Xin Wen, Xuanyang Zhang, Chuofan Ma, Tiancai Wang, Gang Yu, Xiangyu Zhang, 和 Xiaojuan Qi。视觉基础模型作为自回归图像生成的有效视觉标记化器。arXiv 预印本 arXiv:2507.08441,2025a。
Boyang Zheng, Nanye Ma, Shengbang Tong, 和 Saining Xie。具有表示自编码器的扩散 Transformer。arXiv 预印本 arXiv:2510.11690,2025b。
Zangwei Zheng, Xiangyu Peng, Yuxuan Lou, Chenhui Shen, Tom Young, Xinying Guo, Binluo Wang, Hang Xu, Hongxin Liu, Mingyan Jiang 等。Open-sora 2.0:以 20 万美元训练商业级视频生成模型。arXiv 预印本 arXiv:2503.09642,2025c。
Tianxiong Zhong, Xingye Tian, Boyuan Jiang, Xuebo Wang, Xin Tao, Pengfei Wan, 和 Zhiwei Zhang。Vfrtok:具有持续时间比例信息假设的可变帧率视频标记化器。神经信息处理系统进展 (Advances in Neural Information Processing Systems),38:3325–3345,2026 年。
Yongxin Zhu, Bocheng Li, Yifei Xin, Zhihua Xia, 和 Linli Xu。用一个线性层解决向量量化模型中的表示崩溃问题。在 IEEE/CVF 国际计算机视觉会议 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,第 22968–22977 页,2025 年。
17