VideoRAE:冻结VFM语义特征,统一连续与离散视频生成潜在空间
传统视频Tokenizer依赖像素级重建,导致潜在空间语义不足。VideoRAE利用冻结的视频基础模型(VFM)作为特征提取器,通过1D投影器和表示对齐(REPA)模块构建紧凑且语义丰富的潜在空间。该方法支持连续(DiT)和离散(AR)两种生成范式,在UCF-101和VBench上显著提升了重建质量并加速了下游生成模型的收敛。需注意其性能高度依赖所选VFM的预训练范式。
传统视频Tokenizer依赖像素级重建,导致潜在空间语义不足。VideoRAE利用冻结的视频基础模型(VFM)作为特征提取器,通过1D投影器和表示对齐(REPA)模块构建紧凑且语义丰富的潜在空间。该方法支持连续(DiT)和离散(AR)两种生成范式,在UCF-101和VBench上显著提升了重建质量并加速了下游生成模型的收敛。需注意其性能高度依赖所选VFM的预训练范式。
本文揭示了视频扩散模型在处理长链因果推理(如多球碰撞)时存在的“串行性差距”。理论证明双向去噪无法提供可扩展的串行计算,增加去噪步数无效。实验显示,自回归生成和增加模型深度能有效缓解此问题。结果基于合成数据,自然视频应用需谨慎。
事件相机视频生成面临回归方法纹理模糊、长程预测时序漂移及插值重影等挑战。本文介绍LongE2V方法,通过微调CogVideoX并引入自回归展开、重编码对齐等创新机制,在ECD、MVSEC等数据集上实现SOTA重建与预测性能。需注意其推理速度较慢且对稀疏事件流敏感。
自回归视频生成器在长程生成中常出现误差累积、运动减弱和视觉伪影。OPSD-V通过策略内自蒸馏,利用真实长视频数据作为特权上下文,对少步生成器进行后训练。实验显示,该方法在MovieGenBench和MeiBench上显著提升了质量分数和动态程度,用户研究也证实其在运动质量和视觉质量上的优势。需注意语义匹配可能略有下降,且依赖高质量长视频数据。
现有视频生成模型缺乏针对Chain-of-Frame推理的专用训练信号,导致长程连贯性不足。本文提出OpenCoF框架,构建OpenCoF-17K数据集并在Wan2.2基座上微调得到Wan-CoF。实验显示,在MME-CoF、Gen-ViRe等基准上性能显著提升。进一步引入Visual/Textual Reasoning Tokens,通过注意力机制显式捕捉推理线索。需注意,高视觉真实感不等同于可靠推理,且Token效果依赖任务特性。
AlayaWorld面向长视界可玩视频世界,组合相机控制、3D空间缓存、压缩历史和少步蒸馏。本期重点看回路闭合、实时提示切换和跨风格结果,并区分视觉一致性、物理交互性与项目页定性展示。
面向内容创作的视频模型未必适合机器人。LingBot-Video从稀疏MoE、具身数据画像和多维奖励三方面重新设计视频预训练。本期核对长序列效率、物理合理性证据,并讨论路由开销、训练数据和奖励模型的复现边界。