快速导读:提出一种配备跨模态循环记忆的实时流式音视频生成系统Ripple,通过固定长度滑动窗口与记忆机制实现恒定成本推理,并采用三阶段训练范式,在保持长程一致性的同时达到约28 FPS的实时生成速度。
Ripple针对流式音视频生成中的核心瓶颈——不断增长的KV缓存导致推理成本随生成长度线性增加——提出了一种基于跨模态循环记忆的恒定成本推理方案。该方案用固定长度的滑动窗口注意力替代传统KV缓存,并通过可学习的记忆token在时间步之间传递历史上下文,使模型在保持长程一致性的同时实现实时推理。
论文的核心贡献在于三点:一是跨模态循环记忆机制的设计,包含模态特定的记忆构建与跨模态记忆交互;二是三阶段训练范式,将双向教师模型LTX-2.3高效转化为流式生成器;三是首次将在线扩散强化学习(基于GRPO框架)引入流式音视频生成,通过复合奖励优化感知质量。实验表明,Ripple在30秒长视频生成中实现约15倍加速,且音视频质量超越教师模型。
英文题目:Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory
论文出处:arXiv 每日论文精选 · arXiv:2607.26818
原始论文:PDF / 论文页面
对应视频标题:Ripple:用跨模态循环记忆打破流式音视频生成的KV缓存瓶颈|推荐指数:★★★★★
这篇论文解决什么问题?
离线音视频扩散模型(如LTX-2.3)虽然生成质量高,但推理延迟大,不适合实时应用。现有流式方法如OmniForcing和Hallo-Live通过因果蒸馏实现流式生成,但依赖不断增长的KV缓存来保持历史信息。随着生成长度增加,KV缓存的存储和注意力计算成本线性增长,导致长视频生成在工程上不可行。
Self-Forcing探索了将双向扩散模型蒸馏为因果模型以实现流式视频生成,OmniForcing将其扩展到音视频双流架构,但两者都未解决KV缓存增长问题。Hallo-Live虽然实现了实时流式生成,但同样受限于短时生成。Ripple的出发点正是:能否在固定计算预算下保持长程时间一致性与跨模态同步?
这一问题的难点在于,滑动窗口注意力虽然能固定计算成本,但窗口外的历史信息会丢失,导致长视频中的身份漂移、运动不连贯和音视频失同步。Ripple通过引入可学习的循环记忆token来桥接窗口间的信息流,使历史上下文得以压缩并传递。
此外,将双向教师模型转化为流式生成器并非简单的注意力掩码替换。双向模型在训练时看到完整序列,而流式模型只能看到过去。直接转换会导致严重的分布偏移。Ripple的三阶段训练范式正是为解决这一适配问题而设计。
核心创新
- 提出跨模态循环记忆机制,通过模态特定记忆构建与跨模态交互,在固定长度滑动窗口下保持长程时间一致性与跨模态同步。
- 设计三阶段训练范式:记忆增强块因果适配、记忆强制蒸馏、在线双流扩散强化后训练,有效将双向教师模型转化为流式生成器。
- 首次将在线扩散强化学习应用于流式音视频生成,通过复合奖励与渐进式奖励调度提升感知质量与跨模态对齐。
方法概览
Ripple结合固定长度滑动窗口注意力与跨模态循环记忆机制。记忆模块包含模态特定的记忆构建(通过记忆注意力与EMA更新)和跨模态记忆交互(交叉注意力交换信息)。训练采用三阶段范式:(1) 记忆增强的块因果掩码适配,使双向教师模型适应带模拟记忆的因果注意力;(2) 跨模态记忆强制蒸馏,端到端优化记忆构建与交互;(3) 在线双流扩散强化后训练,使用音视频质量、同步性和语音对齐的复合奖励进行GRPO优化。推理时采用块级因果生成与滚动缓存策略。
- 跨模态循环记忆机制(第3页,Figure 2):记忆模块包含两个子模块。一是模态特定的记忆构建:视频和音频各有独立的记忆token,通过记忆注意力从当前块中提取信息,再通过指数移动平均(EMA,α=0.9)与历史记忆状态融合。二是跨模态记忆交互:视频记忆和音频记忆通过交叉注意力交换信息后,作为额外的键值对注入Transformer层,使模型在生成时同时感知两种模态的历史上下文。
- 固定长度滑动窗口注意力(第3页):推理时,模型只对当前块内的token做注意力计算,历史信息完全由记忆token携带。窗口大小固定,因此每步推理成本恒定。块与块之间通过记忆状态传递信息,形成循环结构。
- 三阶段训练范式(第4页,Figure 3):第一阶段为记忆增强的块因果掩码适配。将双向教师模型的注意力替换为块因果注意力,并用推理rollout模拟记忆状态作为训练时的记忆初始化,使模型适应新的注意力模式和记忆依赖。第二阶段为跨模态记忆强制蒸馏。端到端训练完整模型,使用DMD(分布匹配蒸馏)目标将教师分布迁移到少步学生模型,同时优化记忆构建与交互。第三阶段为在线双流扩散强化后训练。基于GRPO框架,使用音视频质量、同步性和语音对齐的复合奖励进行优化,采用两阶段奖励调度(先优化同步性,再联合优化所有奖励)并加入KL惩罚防止策略偏离。
- 推理策略(第4页):采用块级因果生成与滚动缓存。每个块生成后,更新记忆状态,滑动窗口前移。首块使用sink缓存(可学习的静态token)作为记忆初始值,为后续块提供时间锚定。
- 记忆token数量与EMA比率(第6页,Table 5):视频记忆token数Nv=512,音频记忆token数Na=32,EMA比率α=0.9时取得最佳综合性能。过大的记忆token数增加计算开销但收益递减,过小的EMA比率使记忆更新过快、丢失长期信息。
- 归一化的重要性(第6页,Table 4):记忆机制中的归一化层对训练稳定性至关重要。去除归一化后AV Quality从0.751骤降至0.592,表明未归一化的记忆特征会导致训练不稳定和性能崩溃。
逐图理解论文
失败案例与直觉

图7对比了有无音频记忆时生成音频的RMS能量包络。有记忆时,鼓声场景的节奏能量模式在整个序列中保持稳定;无记忆时,10秒后出现明显的音色漂移和不规则能量波动,证明记忆机制有效保持长程声学一致性。
核心区分:从KV缓存到循环记忆

图2详细展示了跨模态循环记忆机制的两个子模块:(a)模态特定的记忆构建,通过记忆注意力和EMA更新将当前块信息融入历史记忆;(b)跨模态记忆交互,视频和音频记忆通过交叉注意力交换信息后注入Transformer层。
三阶段训练如何实现

图3展示了三阶段训练范式:第一阶段用模拟记忆适配块因果注意力;第二阶段端到端蒸馏优化记忆构建与交互;第三阶段用GRPO和复合奖励进行强化后训练,进一步提升感知质量。
最强结论

Ripple在30秒长视频生成上实现了对教师模型的全面超越——不仅推理加速约15倍,音视频质量和身份一致性也更高。用户偏好率接近50%,远超OmniForcing和Hallo-Live。这证明循环记忆不仅解决了效率问题,还带来了质量增益。
实验如何设计?
- 短视频基准:使用VerseBench Set3子集,对比离线方法(LTX-2.3等)和在线方法(OmniForcing、Hallo-Live),评估音视频质量(DNSMOS、IB-Score)、同步性(LSE-D、LSE-C、Synchformer)和推理延迟(第5-6页,Table 1)。
- 长视频基准:自建30秒长视频测试集,包含不同身份和语音内容,对比教师模型LTX-2.3,评估AV Quality、ID Consistency、语音对齐和同步性(第6页,Table 2)。
- 消融实验:分别消融三阶段训练策略(Table 3)、记忆机制各组件(Table 4)、关键超参数(Table 5)和强化后训练组件(第9页,Table 6)。
- 用户偏好研究:招募参与者对比Ripple与OmniForcing、Hallo-Live的感知质量,统计偏好率(第10页,Table 7)。
- 定性分析:展示短视频和长视频的生成样例,对比音视频同步性、身份一致性和语音准确度(第7页Figure 4,第12页Figure 6-9)。
关键结果与论文证据
- 短视频基准上,Ripple延迟仅5.9秒(离线方法74秒),DNSMOS达3.858,IB-Score达0.410,均达到SOTA;对比在线方法OmniForcing延迟4.2秒vs 7.7秒,多数指标更优(第6页,Table 1)。
- 30秒长视频生成中,Ripple延迟23秒(教师332秒),实现约15倍加速;AV Quality 0.751超越教师的0.736,ID Consistency 0.944超越教师的0.914(第6页,Table 2)。
- 三阶段训练消融:完整方案AV Quality 0.751,去除任一阶段均导致下降,第一阶段贡献最大(第6页,Table 3)。
- 记忆机制消融:完整记忆AV Quality 0.751,去除记忆交互降至0.734,去除归一化降至0.592,完全去除记忆降至0.684(第6页,Table 4)。
- 强化后训练消融:两阶段奖励调度+KL惩罚的完整方案AV Quality 0.751,去除两阶段降至0.723,去除KL降至0.703(第9页,Table 6)。
- 用户偏好率:Ripple 49.11%,Hallo-Live 30.53%,OmniForcing 20.36%,表明Ripple的感知质量显著优于现有在线方法(第10页,Table 7)。
- 定性分析显示,跨模态记忆交互改善了唇形同步和音素发音准确度(第12页,Figure 8);音频记忆有效保持了长序列中的节奏稳定性和音色一致性(第12页,Figure 7)。
- Ripple在开放域场景中展现出良好的泛化能力,生成质量与教师模型可比但速度显著更快(第12页,Figure 6)。
阅读时需要注意
- 长视频生成中运动多样性受限:首块sink缓存引入时间锚定效应,限制了后续块的运动幅度变化,导致长视频中运动模式趋于保守(第10页)。
- 模型可能被滥用于身份冒充、未经授权的数字表示或欺骗性媒体生成,存在深度伪造和错误信息传播风险。研究仅用于学术目的(第10页)。
- 训练数据以人物为中心,在非人物场景的泛化能力有待进一步验证。
关联工作
- Self-Forcing:探索将双向扩散模型蒸馏为因果模型以实现流式视频生成,Ripple将其扩展至音视频双流并引入记忆机制(第1页)。
- OmniForcing:将self-forcing适配到双流架构实现流式音视频生成,但依赖不断增长的KV缓存,Ripple通过记忆机制支持长视频(第2页)。
- Hallo-Live:实时流式音视频生成方法,同样受限于短时生成,Ripple在效率和长视频生成上超越它(第2页)。
- LTX-2.3:作为Ripple的双向教师模型,Ripple通过蒸馏和记忆机制实现15倍加速并保持可比质量(第5页)。
- DMD(分布匹配蒸馏):Ripple在第二阶段采用DMD目标进行记忆强制蒸馏,将教师分布迁移到少步学生模型(第4页)。
- GRPO:Ripple在第三阶段基于GRPO框架进行在线扩散强化后训练,优化复合奖励(第4页)。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
Ripple:基于跨模态循环记忆的实时流式音视频生成
Yanbo Ding1,2,4,∗, Zhizhi Guo2,†, Quanyue Song2,5,∗, Yishan He2, Zhixiang He2, Yongxiang Li2, Yali Wang1,3,‡ 1深圳市计算机视觉与模式识别重点实验室, 中国科学院深圳先进技术研究院 2中国电信人工智能技术(北京)有限公司 3上海人工智能实验室 4中国科学院大学人工智能学院 5人机混合增强智能全国重点实验室, 西安交通大学人工智能与机器人研究所
摘要 音视频生成模型实现了令人瞩目的质量,但存在高延迟问题,使其不适用于实时流式应用。尽管已有几种流式音视频生成方法被提出,它们仍然成本高昂,且无法支持长序列生成。为解决这一问题,我们提出了Ripple,一个具备跨模态循环记忆机制的实时联合音视频生成系统。为实现高效的流式推理并保留长程上下文,Ripple结合了固定长度的滑动窗口注意力与模态特定的记忆状态,这些状态持续总结音频和视频上下文。进一步引入了跨模态记忆交互以增强音视频同步性。为有效学习这一记忆增强模型,我们设计了一个三阶段训练方案:(1)将双向音视频教师模型适配到带模拟记忆的块因果注意力;(2)通过端到端蒸馏优化记忆构建与交互流程;(3)应用针对流式音视频生成定制的在线强化后训练。最终,Ripple在480P分辨率下达到约28 FPS,比教师模型快15倍以上,同时能够实现连贯的长序列生成。在短视频和长视频基准上的大量实验表明,我们的性能优于现有的离线和在线联合音视频生成方法。
引言 过去几年,视频生成技术发展迅速。Wan(Wan et al. 2025)、HunyuanVideo(Wu et al. 2025)和CogVideoX(Yang et al. 2025)等模型实现了卓越的视觉质量和强大的文本对齐能力。然而,这些方法以离线和双向方式运行,在生成任何输出之前需要完整的时序上下文。这使得它们不适用于实时场景。
为克服这一局限,近期工作如self-forcing(Huang et al. 2026)探索了将双向扩散模型蒸馏为因果对应模型,使其能够仅通过几步去噪实现流式生成。虽然这对视频有效,但这些方法完全未涉及音频模态。更近期的流式音视频方法(Su et al. 2026; Li et al. 2026)通过将self-forcing风格的因果蒸馏扩展到双流架构,填补了这一空白,如图1所示。在因果生成过程中,这些模型通过不断增长的键值缓存关注整个历史。虽然对短序列有效,但不断增加的注意力上下文导致计算成本和推理延迟不断增长,使得长序列流式生成不切实际。这引出了一个关键问题:我们如何实现更快、更高效且能生成长序列的实时联合音视频生成?
一个自然的解决方案是采用固定长度的注意力窗口以维持恒定成本的推理。然而,截断历史上下文不可避免地丢弃了长程时序和跨模态信息,使得
(a) 现有方法 教师模型 → 蒸馏 → 学生模型 流式音频 → 流式视频 双向 → 因果 高效推理? ✗ 长序列? ✗ 因果AV注意力掩码
(b) 我们的方法 教师模型 → 蒸馏+强化学习 → 学生模型 流式音频 → 记忆音频 → 流式音频 流式视频 → 记忆视频 → 流式视频 双向 → 因果 高效推理? ✓ 长序列? ✓ 改进的因果AV注意力掩码:+ sink + memory + window
图1:动机。现有的流式音视频方法依赖不断增长的键值缓存,导致推理成本不断增加。我们的Ripple将固定长度的滑动窗口与跨模态循环记忆相结合,实现恒定成本推理和长程连贯性。此外,我们为联合生成引入了强化后训练,这是与先前流式AV方法的关键训练差异。
∗工作完成于中国电信人工智能技术(北京)有限公司实习期间。 †项目负责人。 ‡通讯作者。
第 2 页
保持时间连贯性和音视频同步性。因此,一个有效的流式音视频生成器需要一种紧凑的记忆机制,能够持续总结历史多模态上下文。然而,这种用于流式音视频生成的记忆机制在很大程度上仍未被探索。
为此,我们提出了Ripple,一个配备跨模态记忆机制的实时流式音视频生成系统。具体来说,我们引入了固定长度的模态特定记忆状态,通过记忆注意力和基于EMA(指数移动平均)的更新,持续总结过去的音频和视频上下文。为了促进跨模态同步,这两个记忆状态进一步通过跨模态注意力交换信息,产生丰富的多模态表示,作为长期记忆。在生成过程中,这些记忆表示被前置到固定长度的滑动窗口键值缓存中。通过这种方式,Ripple在不牺牲效率的前提下,保持了长程一致性和跨模态同步。
为了有效训练这种记忆增强的双流模型,我们引入了一个三阶段训练范式。首先,为了弥合离线全上下文生成与在线块因果推理之间的固有差距,我们将双向注意力模式调整为因果窗口注意力,并使用从推理展开中获得的模拟记忆。这使得模型即使在记忆系统完全运作之前,也能逐步学习新的因果注意力模式。第二阶段通过记忆强制蒸馏优化完整的记忆构建和交互流程。在此阶段,模型学习有效利用累积的跨模态上下文进行时间连贯的生成。最后,为了进一步提升整体生成性能,我们应用了针对联合流式音视频生成的自适应在线强化后训练,其奖励信号针对音视频质量、同步性和语音对齐。
我们的贡献有三方面。(1)我们开发了一个三阶段训练范式,有效地将双向音视频生成教师模型转化为因果流式生成器,包括三个阶段:记忆增强的块因果适应、跨模态记忆强制蒸馏和在线双流强化后训练。(2)我们引入了一种遵循“先构建后交互”范式的跨模态循环记忆机制,在保持长程时间一致性和跨模态连贯性的同时,实现了恒定成本的流式推理。(3)我们构建了一个实时流式音视频生成系统,在单个NVIDIA H100 GPU上以480P分辨率达到约28 FPS,比教师模型快15倍以上。在VerseBench和我们30秒长视频基准上的实验证明了Ripple的卓越性能。
相关工作 离线视频生成。基于扩散的视频生成模型在视觉质量和文本对齐方面取得了实质性进展。大多数现有方法采用离线、双向范式,从早期的SVD和CogVideoX等模型,到最近的HunyuanVideo、Wan和Sora等系统。在这些视觉生成进步的基础上,统一多模态生成也迅速发展,出现了LTX、UniVerse、JavisDiT、MOVA和Seedance等联合音视频模型。尽管这些模型生成质量令人印象深刻,但它们计算成本高昂且推理延迟高,这推动了实时流式联合音视频生成的发展。
在线视频生成。为了降低延迟,人们提出了各种蒸馏技术来压缩扩散采样步骤。分布匹配蒸馏(DMD)通过最小化近似KL散度来对齐学生模型和教师模型之间的分布,而一致性模型则强制沿概率流ODE轨迹保持自一致性,以学习单步映射。尽管这些方法加速了生成,但它们建立在双向架构之上,不适合流式生成。CausVid首次通过非对称DMD将双向视频教师模型蒸馏为因果学生模型,引入了流式扩散框架。Self-Forcing通过训练模型在其自身的展开上模拟推理过程中的误差累积,进一步缓解了自回归视频生成中固有的曝光偏差。Causal-Forcing通过首先训练一个因果教师模型,以更严格的因果约束扩展了这一方向。然而,这些方法仅限于视频模态。最近,OmniForcing和Hallo-Live通过将self-forcing适配到双流,实现了实时流式音视频生成,但它们仅限于短时域(约5秒)。相比之下,Ripple通过跨模态记忆构建和交互支持长时域流式生成。
方法 概述。我们提出Ripple,一个以因果、逐块方式生成音频和视频的流式音视频生成系统。为了在流式约束下保持长期依赖,Ripple引入了一种跨模态循环记忆机制,将模态特定的记忆构建与跨模态交互相结合。基于此设计,我们进一步开发了一个三阶段训练范式。最后,我们描述了实现实时恒定成本生成的流式推理流程。
跨模态循环记忆 长时域流式生成不仅需要固定长度的上下文窗口以保证效率,还需要保留长期历史信息。因此,我们设计了一种跨模态循环记忆机制,以增强滑动窗口注意力方案。如图2所示,注意力上下文按顺序由三部分组成:(i)首块键值缓存,提供初始全局锚点;(ii)长期跨模态记忆,总结窗口之外的历史信息;以及
第 3 页
初始化长期视频记忆 ℳv 归一化 Q!"#$% K&'#"% V&'#"% 为零 ℳbℳm 长期音频记忆 ℳa Q&'#"% K!"#$% V!"#$% α ∗ℳ+ 1 −α ∗ℳout
记忆注意力 模态特定模态特定 恒等映射 指数移动平均 记忆交互 注意力 Q 记忆记忆令牌令牌 RoPE 缩放 更新 模态 ToK/VK 投影投影 ToK/VV 投影投影 K RoPE 门控 注意力 投影 视频 ℳ𝑜𝑢𝑡 视频 ℳ𝑘𝑒𝑦 音频 ℳ𝑘𝑒𝑦 被淘汰的被淘汰的键值缓存键值缓存 点积 V (短期短期记忆记忆) 音频 ℳ𝑜𝑢𝑡 视频 ℳ𝑣𝑎𝑙𝑢𝑒 音频 ℳ𝑣𝑎𝑙𝑢𝑒
(a) 模态特定循环记忆构建 (b) 跨模态记忆交互
图 2: 跨模态循环记忆机制示意图。(a) 模态特定循环记忆构建:音频和视频记忆状态独立更新,以总结历史上下文。(b) 跨模态记忆交互:两个记忆流在作为键值对注入Transformer层之前交换信息。
(iii) 前一块的键值缓存,它捕获最近的上下文。基于此公式,我们接下来描述长期记忆的构建与交互。
模态特定记忆构建。在推理展开过程中,当一块的键值表示从滑动上下文窗口中被淘汰时,它们被用于更新相应模态的记忆状态。对于每个模态 m ∈{v, a},一组 Nm 个可学习的记忆查询 Qm ∈RNm×dm 对淘汰的键值对 (Kmevict, Vmevict) 进行注意力计算,以产生记忆读出 Mmout。令 ˆQm = R(Qm + Mm, 0) 且 ˆKm = R(Kmevict, pm),其中 R(x, p) 表示在位置 p 的 RoPE (Su et al. 2024) 操作,Mm 表示模态特定的记忆状态。记忆读出公式如下:
ˆQm ˆK⊤m ! √ Mmout = softmax Vmevict, (1) dm
其中 dm 是模态 m 的注意力维度。Qm 被加到 Mm 上,使读出能够同时利用可学习令牌和历史上下文。记忆查询使用零位置 RoPE 编码,使其与位置无关。被淘汰的键 Kmevict 保留其在位置 pm 的原始模态特定 RoPE 编码,从而保留源上下文的时空结构。这种非对称设计允许记忆自由聚合信息,而不受任何特定位置的约束。
然后,通过指数移动平均 (EMA) 将 Mmout 纳入来更新记忆状态 Mm:
Mm ←norm(α Mm + (1 −α) Mmout) , (2)
其中 α ∈(0, 1) 是控制过去记忆与新上下文之间平衡的比例,norm 表示应用 L2 归一化以在长形式推理过程中稳定记忆幅度。这种循环更新允许 Nm 个记忆状态中的每一个自我演化,并在历史序列上积累压缩的上下文。
跨模态记忆交互。为了进一步增强学习到的记忆空间中的跨模态同步,我们在记忆构建之后引入了两个记忆流之间的跨模态注意力。由于视频和音频记忆位于不同的特征空间,我们首先通过可学习矩阵 WQ, WK, WV 将它们投影到共享维度 dc。令 Qm = WQmMm, Km = WKmMm, Vm = WVmMm,其中 m ∈{v, a}。然后记忆状态交换信息,如下所示:
Qv(Ka)⊤ ˜Mv = Mv + softmax Va, (3) √dc
Qa(Kv)⊤ ˜Ma = Ma + softmax √dc Vv. (4)
残差公式保留了模态特定的内容,同时允许每个记忆流纳入来自另一模态的补充信息。交互后的表示 ˜Mv 和 ˜Ma 随后通过模态特定的线性投影层,产生最终的长期记忆键值对 (Kmmem, Vmmem),这些键值对用于自注意力。这使得每个块能够关注来自两种模态的长范围历史上下文的紧凑摘要,而无需增加每步的序列长度。
渐进式训练阶段
为了有效利用我们的长期记忆,我们设计了一个三阶段训练方案,包括:(1) 记忆增强的块因果自适应,以学习新的注意力模式;(2) 记忆强制蒸馏,以在流式约束下逼近教师性能;(3) 在线双流扩散强化学习,以进一步优化感知质量和跨模态对齐。
记忆增强的块因果自适应。如图 3(a) 所示,第一阶段弥合了全上下文双向模型与局部上下文流式设置之间的差距。具体来说,我们将双向
第 4 页
图3:三阶段训练方案示意图。(1) 记忆增强的块因果掩码适配:双向教师骨干网络通过推理展开模拟的记忆,适配为逐块因果注意力,使模型学习新的因果注意力模式。(2) 跨模态记忆强制蒸馏:完整模型在蒸馏目标下端到端训练,利用累积的跨模态上下文实现时序连贯生成。(3) 在线扩散强化学习:流式模型通过音视频质量、同步性和语音对齐的复合奖励进行后训练,进一步提升感知性能和模态互对齐。
在滑动窗口下,用记忆增强的块因果注意力替代双向注意力,其中每个块关注汇标记(即首块键值缓存)、长期跨模态记忆以及紧邻的前一块键值缓存。我们通过推理模拟长期跨模态记忆:模型首先执行因果展开以获得中间键值表示,这些表示随后被重用为占位记忆输入。生成的记忆表示从计算图中分离,仅用于模拟记忆使用。这使模型接触记忆增强的因果注意力模式,并学习如何利用记忆表示。训练在扩散强制(Chen et al. 2024)框架下进行,采用流匹配目标(Lipman et al. 2022)对齐教师的常微分方程轨迹,为后续蒸馏阶段提供良好初始化。训练数据准备详见补充材料。
记忆强制训练。在适配后的骨干网络基础上,我们端到端优化完整的“构建-交互”记忆流水线,如图3(b)所示。我们使用DMD(Yin et al. 2024)目标从双向教师蒸馏一个四步学生模型。学生模型的每个生成块以首个干净块、跨模态记忆键值表示和最新生成的干净块为条件。训练期间,记忆状态持续更新(公式2),模态间信息交换产生跨模态记忆键值表示(公式4)。这种记忆强制机制缩小了因果流式推理与双向生成之间的差距,同时保持恒定成本的推理速度和长时域视觉与音色一致性。
在线扩散强化学习。尽管蒸馏成功将生成能力从教师迁移到流式模型,但并未直接优化感知质量。为进一步提升语音对齐、音视频同步和整体生成质量,我们引入在线双流扩散强化后训练阶段。据我们所知,这是首次将此类强化学习策略应用于流式音视频生成。得益于流式推理,在线展开可高效执行。我们采用基于GRPO的框架(Xue et al. 2025),每个GPU秩使用不同种子生成一个双流自强制展开,跨秩聚合奖励以计算组相对优势。对每个展开,定义复合奖励:
r = w₁r_av + w₂r_sp + w₃r_vid + w₄r_aud, (5)
其中r_av使用Synchformer(Iashin et al. 2024)衡量音视频同步性,r_sp使用基于ASR(Radford et al. 2023)的词和字符错误率(在转录语音与参考语音之间计算)衡量语音对齐,r_vid评估视频质量使用
第 5 页
HPS(Wu et al. 2023),以及通过DNSMOS(Reddy, Gopal, and Cutler 2021)评估音频质量。 从所有并行采样中收集的奖励经过归一化,以获得组相对优势:Ai = ri−µrσr,其中µr和σr分别表示采样组内奖励的均值与标准差。随后,通过最大化带优势权重的扩散转移概率并结合KL正则化来优化策略,公式如下: " # LRL = −Eτi Ai X log pθ(xt−1 | xt) + βDKL (πθ∥πref) , (6) 其中,log pθ(xt−1 | xt)表示扩散转移对数概率,πθ和πref分别表示当前策略与冻结的参考策略。β控制KL正则化的强度。KL项通过约束与预训练策略的偏差来稳定优化过程。该强化阶段作用于联合音视频生成策略。具体而言,对数概率log pθ(xt−1 | xt)计算为每个去噪步骤中音频与视频扩散转移对数概率的平均值(即每个模态各占0.5)。为平衡对齐度与感知质量,我们采用渐进式奖励调度。初期,强化学习侧重于语音对齐与音视频同步。随后,优化目标逐步转向感知音频与视频质量,同时保留少量对齐奖励。这种渐进式强化策略能够联合提升语音对齐、音视频同步及生成保真度。
流式推理 推理时,Ripple以因果、逐块的方式生成音频与视频。该设计支持增量式流式输出,每个块生成后即可立即输出。同时,它能在有界上下文下实现高效生成,在保持跨模态长程信息的同时,实现每块恒定成本生成。为生成超出训练时长的内容,我们维护固定大小的键值缓存,并采用滚动缓存策略,遵循Self-Forcing++(Cui et al. 2025)。此外,当RoPE位置超过最大训练位置时,会被裁剪至该最大值。在交互式生成中,切换提示词时,我们会重置音频与视频的记忆状态为零,以防止先前上下文的干扰。通过这种方式,Ripple能够生成长达分钟级的音频与视频,并保持长程一致性。
实验 训练细节。我们的教师模型为LTX-2.3(HaCohen et al. 2026),一个19B的开源联合音视频生成模型。训练时长为7秒,分辨率动态采样,平均宽高比约对应384×672。记忆的指数移动平均比率α设为0.9,视频记忆查询令牌数Nv = 512,音频记忆查询令牌数Na = 32。所有实验在32块NVIDIA H100 GPU上进行。更多实现细节见补充材料。
评估细节。我们采用VerseBench(Wang et al. 2025)的Set-3子集,该子集包含100个以人物为中心的案例,是用于前沿评估的标准基准。对所有方法,我们均报告其默认配置下的结果,并将随机种子固定为42以确保可复现性。由于该基准仅限于短视频,我们进一步构建了一个包含50个提示词(25个中文,25个英文)的长视频基准。关于长视频基准的更多细节见补充材料。
对比结果 我们将Ripple与离线和在线音视频生成方法进行定量与定性评估对比。结果显示,Ripple在实现实时推理效率的同时,展现出强大的性能。我们在补充材料中进行了额外的用户研究。
短视频定量结果。如表1所示,与离线方法相比,Ripple的延迟降低了15倍以上,同时保持了相当的生成质量。具体而言,Ripple取得了最佳的DNSMOS和IB-Score,并在其余多项指标上排名第二。这些结果表明,Ripple在保留双向教师模型生成质量的同时,大幅提升了推理效率。对于在线方法,我们使用其首帧并在相同设置下与OmniForcing和Hallo-Live进行公平比较。Ripple实现了更高的推理效率和更优的整体生成质量。我们将这些提升归功于我们的跨模态长程记忆,它能在固定长度的注意力窗口下实现有效的上下文建模。
长视频定量结果。在我们的长视频基准上,我们生成了30秒的视频,并将Ripple与其教师模型进行比较。我们尝试评估包括OmniForcing和Hallo-Live在内的流式方法,但它们无法生成此长度的视频。如表2所示,Ripple实现了显著更快的推理速度(23秒 vs. 332秒)。尽管仅在7秒视频上训练,Ripple却取得了更好的人物身份一致性和音视频质量,证明了所提出的记忆机制在长程生成中的有效性。我们观察到语音对齐和音视频同步性略有下降,但考虑到大幅的加速,这是可接受的。
定性对比。如图4所示,我们将Ripple与离线和在线音视频生成方法进行比较。在短视频上,Ripple取得了与离线模型相当的性能,同时实现了实时推理。此外,Ripple在语音准确度和长程生成方面始终优于现有的流式方法。在长视频上,Ripple展现出比教师模型更好的时序一致性,突显了我们记忆机制的有效性。更多可视化结果见补充材料。
消融研究 我们在长视频基准上进行消融实验,以验证所提出的三阶段训练策略、跨模态循环记忆机制以及关键超参数。
第 6 页
音频-语音 音视频 唇同步 模型 延迟↓ IS↑ CLAP↑ DNSMOS↑ AV-Align↓ IB-Score↑ LSE-D↓ LSE-C↑
Ovi-1.1 (Low, Wang, and Katyal 2025) 112s 1.062 0.221 3.480 0.193 0.231 8.816 5.296 MOVA-360P (Team et al. 2026) 656s 1.112 0.208 3.838 0.226 0.344 8.126 5.979 UniVerse-1 (Wang et al. 2025) 143s 1.039 0.182 3.485 0.232 0.255 11.347 2.433 DaVinci-Base (Chern et al. 2026) 43s 1.117 0.195 3.579 0.218 0.321 7.794 5.466 LTX-2.3 (教师模型) (HaCohen et al. 2026) 74s 1.103 0.236 3.742 0.223 0.397 6.965 6.371 Ripple (本文方法) 5.9s 1.085 0.225 3.858 0.219 0.410 7.792 6.078
OmniForcing (Su et al. 2026) 7.7s 1.210 0.147 3.590 0.275 0.181 12.868 1.419 Ripple (本文方法) 4.2s 1.036 0.209 3.809 0.260 0.393 8.701 5.727
Hallo-Live (Li et al. 2026) 5.4s 1.021 0.224 3.573 0.265 0.186 10.241 4.277 Ripple (本文方法) 3.9s 1.084 0.221 3.764 0.274 0.369 8.793 5.480
表1:短视频评估。指标在VerseBench (Wang et al. 2025) Set3子集上报告。我们的Ripple与以下方法进行比较:(1) 离线音视频生成方法:其性能与教师模型相当,在多项指标上取得SOTA结果(如DNSMOS、IB-Score);(2) 在线流式方法:Ripple在大多数指标上优于OmniForcing和Hallo-Live,且延迟更低。粗体表示最佳,下划线表示次佳。
模型 延迟↓ 音视频质量↑ 语音对齐↑ 身份一致性↑ 音视频同步↑
教师模型:LTX-2.3 (HaCohen et al. 2026) 332s 0.736 0.464 0.914 0.608 学生模型:Ripple (本文方法) 23s 0.751 0.405 0.944 0.579
表2:长视频评估。尽管仅在7秒视频上训练,我们的Ripple在30秒生成任务中,音视频质量和身份一致性均优于其教师模型LTX-2.3,同时延迟实现约15倍加速。
训练阶段 选择 组件 选择 阶段1 ✔ ✔ ✔ ✔ ✘ 记忆构建 ✔ ✔ ✔ ✘ 阶段2 ✔ ✘ ✔ ✘ ✔ 记忆交互 ✔ ✘ ✔ ✘ 阶段3 ✔ ✘ ✘ ✔ ✔ 记忆归一化 ✔ ✔ ✘ ✘
音视频质量↑ 0.751 0.641 0.738 0.651 0.576 音视频质量↑ 0.751 0.734 0.592 0.684 语音对齐↑ 0.405 0.358 0.386 0.364 0.257 语音对齐↑ 0.405 0.399 0.287 0.381 身份一致性↑ 0.944 0.905 0.939 0.907 0.887 身份一致性↑ 0.944 0.947 0.875 0.910 音视频同步↑ 0.579 0.545 0.553 0.568 0.528 音视频同步↑ 0.579 0.563 0.532 0.565
表3:训练方案消融实验。我们完整的三阶段训练方案在长视频基准的所有指标上均取得最佳性能。每个阶段都有益,其中第一阶段最为重要。
表4:记忆机制消融实验。记忆构建和交互提升了整体性能。归一化对训练稳定性至关重要。移除记忆会显著降低长视频生成性能。
设置 Nv Na α 延迟↓ 音视频质量↑ 语音对齐↑ 身份一致性↑ 音视频同步↑
#1 256 16 0.9 23.03s 0.735 0.383 0.937 0.560 #2 256 32 0.9 23.12s 0.747 0.401 0.942 0.574 #3 (本文方法) 512 32 0.9 23.35s 0.751 0.405 0.944 0.579 #4 512 32 0.5 23.35s 0.746 0.392 0.943 0.569 #5 512 32 0.1 23.35s 0.738 0.381 0.932 0.561 #6 512 32 1.0 23.35s 0.734 0.389 0.930 0.562
表5:关键超参数消融实验。我们研究了视频记忆令牌数(Nv)、音频记忆令牌数(Na)和指数移动平均比率(α)的影响。三个超参数均影响长视频生成性能。在评估的配置中,Nv = 512、Na = 32和α = 0.9在流式推理约束下取得了最佳整体性能。
记忆选择的消融实验。我们在补充材料中提供了强化学习阶段的额外消融实验。
训练阶段消融实验。如表3所示,完整的三阶段方案在所有指标上均取得最佳性能。移除任何阶段都会导致性能明显下降,证实了三个阶段都不可或缺。其中,第一阶段贡献最大,尤其在音视频质量和语音对齐方面,为后续训练阶段提供了重要基础。
第 7 页
Davinci UniVerse
在自然界中,大多数植物都与一种或多种这些有益微生物相互作用。 。
Ovi Ours
在自然界中,大多数植物都与一种或多种这些有益微生物相互作用。
内存溢出 (若 > 15秒) Ours OmniForcing 这些技能可以帮助我们成为更好的社区成员。
运行时错误 (若 > 5秒) Ours Hallo-Live 我们与食物的脱节程度如此之深,以至于对我们而言。 (LTX-2.3) 5秒 10秒 15秒 20秒 25秒 5秒 10秒 15秒 20秒 25秒 Ours 教师模型 今年收成不错。望着这片金色的稻田,我内心感到深深的平静。务农是一场与自然的博弈,春霜、夏雨、秋台风……但只要付出努力……
图4:定性比较。与现有的离线和在线流式音视频生成方法相比,Ripple在短视频上实现了高质量生成,同时支持实时流式推理。在长视频上,Ripple实现了比教师模型更好的时序一致性,证明了我们记忆机制的有效性。在转录语音中,红色表示发音错误/不正确的词,绿色表示正确的词,括号表示遗漏。
记忆机制消融。如表4所示,记忆构建对生成质量和时序一致性的贡献最大,显著提升了音视频质量和身份一致性。跨模态循环记忆交互进一步提升了音视频质量、同步性和语音对齐度。记忆归一化是稳定训练的基础。移除它会导致性能急剧下降。完全移除整个记忆机制则性能很差,证实了其必要性。完整模型实现了最佳性能。
关键超参数消融。表5研究了记忆查询令牌数量和指数移动平均记忆比率α的影响。增加记忆令牌数量略微改善了长程一致性,对延迟影响较小。我们发现512个视频记忆令牌和32个音频记忆令牌已足够。改变α也会影响生成质量,表明循环记忆更新是有效的。当α = 1.0时,记忆不再更新,导致记忆陈旧和性能下降。当α = 0.1时,记忆更新过于激进,使记忆表示不稳定且充满噪声。在我们的实验中,α = 0.9实现了最佳性能。
结论 我们提出了Ripple,一个以因果、逐块方式联合合成音频和视频的流式生成系统。其核心在于,Ripple引入了一种跨模态循环记忆机制,以保持长程时序连贯性和跨模态同步性。借助滑动窗口注意力上下文,生成计算保持恒定成本。通过涵盖因果掩码适配、记忆强制蒸馏和在线双流后训练的三阶段范式进行训练,Ripple实现了与教师模型相当的性能,同时在480P分辨率下以约28 FPS运行,速度提升超过15倍。我们希望Ripple能为推进实时多模态生成提供有价值的见解。
第 8 页
预备知识 扩散Transformer 扩散Transformer(DiT)(Peebles 和 Xie 2023)通过将去噪建模为序列建模问题,为卷积扩散骨干网络提供了一种可扩展的替代方案。遵循潜在扩散范式,预训练的VAE编码器首先将输入样本x映射为紧凑的潜在表示z = E(x)。随后,潜在变量被依赖时间步的高斯噪声扰动:zt = √αtz + √1 −αtϵ,其中ϵ ∼N(0, I)表示采样的噪声,αt控制噪声水平。 DiT的目标是学习一个参数化的去噪函数,从被破坏的潜在表示中预测噪声残差。给定条件输入c,网络ϵθ(zt, t, c)通过以下重建目标进行优化:
L = Et,zt,c,ϵ h ∥ϵθ(zt, t, c) −ϵ∥22 i . (7)
Transformer架构使DiT能够通过用基于注意力的token交互替代空间卷积来执行大规模生成建模。此外,RoPE(Su 等人 2024)提供位置相关的调制,无需固定的位置嵌入,使模型相比U-Net(Ronneberger, Fischer 和 Brox 2015)能更好地适应变化的输入配置。RoPE对每个维度对i应用以下旋转:
Ri(x, m) = cos(mθi) −sin(mθi) sin(mθi) cos(mθi) x2i x2i+1 , (8)
其中m是token位置,x表示查询或键特征。旋转频率定义为θi = 10000−2i/D,D为注意力隐藏维度。 我们采用LTX-2.3-19B(HaCohen 等人 2026)作为骨干扩散Transformer。它使用双流架构分别建模音频和视频,并配有独立的解码器。文本条件由预训练的Gemma3(Team 等人 2025)编码器编码,并通过交叉注意力注入。
分布匹配蒸馏 尽管扩散模型实现了令人印象深刻的生成质量,但其迭代去噪过程引入了相当大的推理延迟。分布匹配蒸馏(DMD)(Yin 等人 2024)通过将扩散教师模型的采样行为迁移到一个只需几步去噪即可生成样本的生成器中,解决了这一问题。 具体来说,令Gθ表示学生生成器,它将随机噪声z ∼N(0, I)映射为生成样本ˆx = Gθ(z)。DMD不直接匹配单个样本,而是鼓励学生模型沿着扩散轨迹复现教师模型不断演变的数据分布。在时间步t,教师模型和学生模型对应的含噪分布分别表示为pdata,t(xt)和pθ,t(xt)。分布对齐目标通过最小化反向KL散度来构建:
LDMD = Et [DKL(pθ,t∥pdata,t)] . (9)
在实践中,DMD通过分数差异优化此目标。梯度更新由真实分数与虚假分数之差决定:
∇θLDMD = −Et,z (sreal(xt, t) −sfake,ϕ(xt, t))T ∂Gθ(z) ∂θ . (10)
这里,sreal表示扩散教师模型提供的分数函数,而sfake,ϕ表示为生成分布训练的分数估计器。含噪状态xt通过前向扩散过程扰动生成样本得到。最终的学生生成器保留了教师分布,同时仅需少量采样步骤,从而实现高效推理。 在我们的工作中,我们基于标准DMD框架,进一步引入了跨模态循环记忆模块,从而能够在实时流式约束下实现长时音频-视频联合生成。
补充训练细节 训练配置 阶段1。我们使用AdamW优化器(Loshchilov 和 Hutter 2017)训练模型,β1 = 0.9,β2 = 0.999。学习率设为2 × 10−5,预热步数设为100。梯度累积每2步执行一次。权重衰减设为0.001。总批大小为64。总训练步数为7,000。
阶段2。生成器(即学生模型)使用AdamW优化,学习率为2 × 10−6,而记忆模块使用学习率2 × 10−5。判别器使用学习率1 × 10−7优化。所有组件均使用β1 = 0.9和β2 = 0.999。预热步数为100。梯度累积为1。判别器每更新一次生成器更新5次。总批大小为32。梯度裁剪范数设为1.0。总训练步数为5,000。
阶段3。我们采用两阶段强化学习策略。在第一阶段,模型使用语音对齐和音视频同步奖励训练200步,以改善跨模态对齐,遵循:
R1 = 0.5 · rav + 0.5 · rsp. (11)
然后,模型再训练200步,通过复合奖励联合优化音视频质量:
R2 = 0.1 · (rav + rsp) + 0.2 · raud + 0.6 · rvid. (12)
我们使用AdamW优化器,学习率为1 × 10−6,β1 = 0.9,β2 = 0.999。预热步数设为100。梯度累积设为1。组大小为32,奖励被裁剪到[0, 1],优势值被裁剪到[−5, 5]范围。应用KL惩罚系数0.1。
数据集准备 我们的数据集收集自三个来源。第一个来源包含公开可用的说话人头部数据集,包括HDTF(Zhang 等人 2021)、VFHQ(Xie 等人 2022)、
第 9 页
VoxCeleb2 (Chung, Nagrani, and Zisserman 2018)、CelebV-Text (Yu et al. 2023) 和 AVSpeech (Ephrat et al. 2018)。第二个来源是 OpenHumanVid (Li et al. 2024),它提供了从电影和电视节目中收集的多样化人物中心视频。第三个来源是我们专有的高质量中英文说话人数据集。 我们基于美学评分、运动质量、模糊检测和音频质量进行质量过滤,以剔除低质量样本。过滤后,我们获得了一个包含约 300 万个高质量片段的大规模音视频数据集。 对于第一阶段训练,我们首先使用教师模型生成 ODE 轨迹。对于每个样本,我们沿 ODE 轨迹随机选择四个时间步:1000、757、522 和 0。这里,时间步 0 对应干净数据,其余时间步代表中间噪声状态。每个训练样本由提示词和对应的首帧图像作为条件输入。由于教师模型 ODE 轨迹提取的计算成本较高,第一阶段使用约 4000 个序列的子集。对于第二阶段和第三阶段训练,我们使用完整数据集,其中每个训练样本是一个 6.5 秒的音视频片段。
组件选择 | | 两阶段奖励调度 | KL 惩罚 | |—|—|—| | 两阶段奖励调度 | ✔ | ✘ | | KL 惩罚 | ✔ | ✔ | | AV 质量↑ | 0.751 | 0.723 | | 语音对齐↑ | 0.405 | 0.382 | | ID 一致性↑ | 0.944 | 0.928 | | AV 同步↑ | 0.579 | 0.546 |
表 6:第三阶段组件的消融实验。我们将两阶段奖励调度与从一开始就组合所有奖励的单阶段基线进行对比,并消融了 KL 惩罚。两个组件对性能提升都至关重要。
长视频基准测试 为了更好地评估长时联合音视频生成,我们构建了一个包含 50 个提示词(25 个中文和 25 个英文)及由 Gemini (Comanici et al. 2025) 生成的对应参考图像的长视频基准。所有方法均以相同的提示词-图像对为条件,生成分辨率为 384 × 672 的 30 秒视频。我们在图 5 中提供了几个示例对。由于没有真实视频可用,我们采用覆盖音视频质量、同步性、语音对齐和身份一致性的无参考评估指标。这些指标共同为长时音视频生成所需的关键能力提供了全面评估。
- AV 质量。我们使用中间帧和最后一帧的平均 HPSv2 (Wu et al. 2023) 分数评估视频质量,并使用 DNSMOS (Reddy, Gopal, and Cutler 2021) 评估音频质量。最终的 AV 质量分数是视频质量分数与音频质量分数之和。分数越高表示音视频质量越好。
- 语音对齐。我们使用 Whisper (Radford et al. 2023) 转写生成的语音,并计算转写文本与参考语音之间的词错误率 (WER) 和字符错误率 (CER)。最终的语音对齐分数定义为:SpeechAlign = 1−(0.5×WER+0.5×CER)。分数越高表示语音对齐越好。
- ID 一致性。我们从滑动时间窗口中提取 DINOv2 (Oquab et al. 2023) 特征,并使用平均特征相似度及其对应的标准差(即 mean−0.5×std)计算一致性分数。分数越高表示身份保持越好。
- AV 同步。我们使用 Synchformer (Iashin et al. 2024) 评估音视频同步性,通过计算由预训练编码器提取的音频和视觉特征之间的基于窗口的余弦距离。最终的同步分数通过对该距离应用指数变换 exp(−x) 得到。分数越高表示同步性越好。
额外消融实验 为了探究强化学习阶段的有效性及其关键组件的必要性,我们从两个角度进行了消融研究:(1) 两阶段奖励调度是否必要,以及 (2) KL 惩罚对训练稳定性是否至关重要。
两阶段奖励调度的效果。在第三阶段,我们采用两阶段奖励调度:首先优化语音对齐和音视频同步 200 步,然后使用复合奖励联合优化音视频质量 200 步。为验证此设计选择,我们将两阶段策略与单阶段基线进行对比,后者从一开始就以相同权重组合所有四个奖励(语音对齐、音视频同步、音频质量和视频质量)。如表 6 所示,单阶段基线导致性能显著下降,尤其是在 AV 质量(0.723 vs. 0.751)和 AV 同步(0.546 vs. 0.579)方面。我们假设,从一开始就联合优化感知质量和对齐奖励会导致梯度冲突,使策略难以平衡多个目标。两阶段调度通过首先建立跨模态对齐,然后优化感知质量来缓解此问题,从而确保更稳定和有效的强化学习。
KL 惩罚的效果。KL 惩罚旨在约束策略更新,防止其过度偏离预训练参考模型,从而避免奖励黑客行为并确保训练稳定性。如表 6 所示,移除 KL 惩罚会导致所有指标的性能大幅下降。例如,AV 质量从 0.751 降至 0.703。这些结果表明,没有 KL 约束,模型倾向于过度优化奖励信号,导致生成质量下降和跨模态对齐不佳。这证实了在我们流式音视频生成框架下,KL 约束对于稳定的 RL 后训练至关重要。
第 10 页
女商人说:“大家请看这个模型——一座革命性的摩天大楼,已准备好进行最终评审。我们团队花了数月时间打磨这个方案,经历了多次彻底重新设计。我们将可持续能源解决方案直接整合到主体结构中,在最大化自然采光的同时,将碳排放降低了百分之四十。结构完整性已通过极端天气测试。安全性有保障,并且我们保留了每一处令人惊叹的美感。这就是城市建筑的未来,我们很自豪能引领潮流。” 科学家说:“化合物稳定了!这真是一个突破。经过数月的失败尝试和无数个深夜,分子键合终于成功了。我们测试了十几种催化剂,调整温度、压力和配比,直到找到最佳窗口。这为我们的合成过程开辟了一条全新的路径。如果我们能将其放大,我们对该领域的所有认知都将被改写。我迫不及待想与科学界分享这一成果。”
飞行员说:“所有系统正常,准备最后进近。我们正在穿越一万英尺高度,速度二百五十节。雷达显示前方晴空,侧风极小。起落架已放下,襟翼设定在三度。我们已对准跑道中心线。预计约两分钟后着陆。乘务组,请就座。乘客们,请系好安全带。接地前我会再次通报。风速稳定——应该是一次平稳着陆。”
图5:长视频基准测试示例。每个示例包含一个提示词及其对应的参考图像,提示词中包括主体名称和用于30秒联合音视频生成的语音内容。
模型偏好率(%),允许后续生成中出现更大的运动变化。 除了这一技术局限,我们还考虑了音视频生成技术相关的潜在社会影响。Ripple的能力可能被滥用于身份冒充、未经授权的数字形象生成或欺骗性媒体的制作。与其他生成模型类似,我们的方法可能面临与深度伪造和虚假信息相关的风险。本工作为学术研究目的而开发,无意助长误导性内容创作或未经授权使用个人身份。我们强调保护个人信息和获取必要同意的重要性。未来的工作应研究有效的防护措施,如检测机制和验证策略,以减轻音视频生成系统被滥用的潜在风险。
VerseBench上的评估指标
VerseBench(Wang et al. 2025)是一个广泛用于评估联合音视频生成的基准。我们采用了MOVA(Team et al. 2026)的评估代码库,该代码库提供了一个全面的评估套件,涵盖多个方面,包括音频-语音对齐、音视频对齐和唇同步。本节将介绍用于评估生成音频和视频的指标。
音频-语音指标 Inception Score (IS)。我们使用Inception Score(Salimans et al. 2016)评估生成音频的质量和多样性。具体来说,我们使用预训练的音频分类器CNN14(Kong et al. 2020)为每个音频样本提取类别概率分布。IS的计算公式为:
IS = exp(Ex[DKL(p(y|x)∥p(y))]), (13)
第 11 页
其中 p(y|x) 表示条件标签分布,p(y) 表示边缘分布。分数越高,表明音频多样性和类别可区分性越好。
CLAP。我们使用 CLAP(Elizalde et al. 2023)衡量生成音频与文本描述之间的语义对齐程度。具体而言,我们计算对应音频与文本嵌入之间的余弦相似度:
CLAP = z_a^T z_t / (||z_a|| ||z_t||), (14)
其中 z_a 和 z_t 分别表示由 CLAP 提取的音频和文本嵌入。分数越高,表明音频-文本语义对齐越强。
DNSMOS。我们使用 DNSMOS(Reddy, Gopal, and Cutler 2021)评估感知音频质量。这是一种基于主观评分的非侵入式指标,提供三个分数:OVRL(整体质量)、SIG(信号质量)和 BAK(背景噪声质量)。我们报告 OVRL 分数,其值越高表示音频质量越好。
音视频指标 AV-Align。我们使用 AV-Align(Yariv et al. 2023)通过检测音频起始峰值和基于光流的视觉运动峰值,来评估音频与视觉模态之间的时间同步性。对齐分数通过 1/fps 时间窗口内的交并比(IoU)计算。分数越高,表明同步性越好。
IB-Score。我们使用 ImageBind(Girdhar et al. 2023)评估生成音频与视频之间的语义一致性。具体而言,我们从生成样本中提取音频和视频嵌入,并计算它们的余弦相似度:
IB-Score = z_a^T z_v / (||z_a|| ||z_v||), (15)
其中 z_a 和 z_v 分别表示由 ImageBind 提取的音频和视频嵌入。分数越高,表明跨模态语义一致性越强。
唇同步指标 LSE-D 和 LSE-C。我们使用 SyncNet(Chung and Zisserman 2016)评估生成语音与面部运动之间的细粒度唇同步。具体而言,我们从生成视频中检测面部区域,并将裁剪后的面部序列与生成的音频一起输入 SyncNet。LSE-D(Prajwal et al. 2020)测量音频与视觉嵌入之间的距离,值越低表示同步性越好。LSE-C(Prajwal et al. 2020)测量同步置信度,值越高表示唇音对齐越好。
更多可视化 与基线方法的比较。如图 9 所示,我们展示了与在线和离线流式音视频生成方法的额外定性比较,其中 Ripple 在语音对齐和时间连贯性方面始终优于基线方法。除了与现有方法比较外,我们还将流式模型与双向教师模型在长视频生成上进行了比较。得益于我们的长期跨模态记忆,Ripple 实现了比教师模型更好的时间一致性,同时推理延迟显著降低。
开放域泛化。此外,我们在图 6 中提供了开放域场景的额外可视化。尽管我们的训练数据主要包含以人为中心的内容,但我们的方法能很好地泛化到多样化场景,包括动物、风景和开放世界角色,生成质量与教师模型相当,同时速度显著更快。
用于音色一致性的音频记忆。除了记忆机制的视觉优势外,我们通过图 7 中的音频波形比较,展示了其在保持音色一致性方面的作用。我们比较了有和没有跨模态记忆时,击鼓场景的生成音频。有记忆时,节奏能量模式在整个序列中保持规律和稳定;而没有记忆时,音频在后段表现出明显的音色漂移和不规则的能量波动,表明音频记忆有效地维持了长期声学连贯性。
记忆交互对唇同步的影响。为了进一步展示记忆交互的效果,我们在图 8 中提供了唇同步的定性比较。记忆交互模块在音视频同步方面带来了轻微改进,使得唇部发音更准确,例如 "/half/" 和 "/call/" 等音素的发音更清晰。这与我们的定量结果一致,即带有记忆交互的完整模型获得了更好的 AV Synchronize 分数。
第 12 页
一位身穿条纹衬衫、头戴毛线帽的男子在室内弹奏原声吉他,手指在琴弦与品丝间移动,身后是窗户和百叶窗,吉他乐声充盈整个房间。
一只斑点豹沿着铺砌的森林小径从容行走,四周树木与枯草环绕,背景中有一辆车,场景其余部分寂静无声。
一条蓝鳍红鱼躺在日落时分的沙滩上,橙粉色天空下远山绵延;随后它面露惊讶,尖叫着跃起。
一座金色穹顶的清真寺矗立于暗色水域中的小岛上;镜头推近,展现精致的建筑细节,轻柔的音乐随之响起。
With Memory Interaction (Ours) Teacher Ripple (Ours)
图6:开放域场景对比。尽管主要在人物中心数据上训练,Ripple能很好地泛化到多样场景,生成质量与教师模型相当,同时运行速度显著更快。 /half/ /call/ Without Memory Interaction With Cross-Modal Memory (Ours)
0s 10s 20s Amplitude /half/ /call/ 图8:有无时间记忆交互的定性对比。记忆交互模块略微改善了音视频同步性,使唇部动作和音素发音更加准确。 Without Cross-Modal Memory
0s 10s 20s Amplitude
Time
图7:有无跨模态记忆的音频波形对比。一段击鼓场景生成音频的RMS能量包络。有音频记忆时,节奏能量模式在整个序列中保持稳定规律。无音频记忆时,后期片段(如10秒后)出现明显的音色漂移和不规则能量波动,表明记忆机制有效保持了长程声学连贯性。
第 13 页
(a) 与离线方法对比
Image Targetthing, soSpeech:actually “Thisthink ofissomethingthe real Targetof youthSpeech:whose"Andwhereaboutsthere are thousandsare still you can write it down if you want or unknown and their families are still Ref you can just keep it in your head.” mourning for their loved ones." Universe
This is the real thing, so actually think that something you can And there are thousands of (youth) whose whereabouts are still unknown write it down if you want or you can just keep it in your head. and their families are still mourning for their loved (ones).
Davinci
This is longer. This is the real thing, so actually think of something And there are thousands of youth whose whereabouts are still unknown, are you can write it down if you want, or you can just keep in the head. still unknown. And their families are still mourning for (their) loved ones.
Ours
This is the real thing, so actually think of something you can And there are thousands of youth whose whereabouts are still unknown write it down if you want or you can just keep in your head. and their families are still mourning for their loved ones.
(b) 与在线方法对比 一位身穿蓝色西装外套、戴着眼镜的男士在正式的室内环境中讲话,背景是木质家具和摆满书的书架。安静的室内声学环境衬托出他沉稳的语调。他说:“I would also say that this election in Germany wasn’t surprising.”
Out of Memory (if > 15s) Ours OmniForcing I would also say that this election in Germany wasn't surprise Mars Inc. I would also say that this election in Germany wasn't surprising.
一位男士站在色彩斑斓的抽象背景前。他的声音充满整个空间,是场景中唯一的声音。“Now the idea of learning from history, what's sometimes called applied history, is far from new,” 他说,语气中带着沉静的笃定。
Runtime Error (if > 5s) Ours Hallo-Live Now the idea of learning from history, what's sometimes all Now, the idea of learning from history, what's sometimes called applied applied history, is far (from new). history, is far from new.
(c) 长视频对比
5s 15s 25s 5s 15s 25s Teacher Ours
Look at this beauty, pure progress. They said this scale couldn't Look at this beauty, pure progress. They said this scale couldn't be be engineered, material limits were a wall, but we smashed every engineered, material limits were a wall, but we smashed every barrier, barrier, changed the formula, redesigned the structure… changed the formula, redesigned the structure. This small thing will…
图9:定性对比。与现有离线和在线流式音视频生成方法相比,Ripple在短视频上实现了高质量生成,同时支持实时流式推理。在长视频上,Ripple比教师模型获得了更好的时序一致性,证明了我们记忆机制的有效性。在转录的语音中,红色表示发音错误/不正确的词,绿色表示正确的词,(括号)表示遗漏。
第 14 页
参考文献视频扩散。《神经信息处理系统进展》,38: 167283–167308。Blattmann, A.; Dockhorn, T.; Kulal, S.; Mendelevitch, D.; Kilian, M.; Lorenz, D.; Levi, Y.; English, Z.; Voleti, V.; Hunter, J. S. 1986. 指数加权移动平均。《质量技术期刊》,18(4): 203–210。 Letts, A.; 等. 2023. 稳定视频扩散:将潜视频扩散模型扩展到大规模数据集。arXiv 预印本 arXiv:2311.15127。 Iashin, V.; Xie, W.; Rahtu, E.; 和 Zisserman, A. 2024. Synchformer:基于稀疏线索的高效同步。见《ICASSP 2024-2024 IEEE 声学、语音与信号处理国际会议》,5325–5329。IEEE。 Chen, B.; Martí Monsó, D.; Du, Y.; Simchowitz, M.; Tedrake, R.; 和 Sitzmann, V. 2024. 扩散强制:下一token预测与全序列扩散的结合。《神经信息处理系统进展》,37: 24081–24125。 Kong, Q.; Cao, Y.; Iqbal, T.; Wang, Y.; Wang, W.; 和 Plumbley, M. D. 2020. Panns:用于音频模式识别的大规模预训练音频神经网络。《IEEE/ACM 音频、语音与语言处理汇刊》,28: 2880–2894。 Chern, E.; Teng, H.; Sun, H.; Wang, H.; Pan, H.; Jia, H.; Su, J.; Li, J.; Yu, J.; Liu, L.; 等. 2026. 以简驭速:面向快速音视频生成的单流架构基础模型。arXiv 预印本 arXiv:2603.21986。 Chung, J. S.; Nagrani, A.; 和 Zisserman, A. 2018. Voxceleb2:深度说话人识别。arXiv 预印本 arXiv:1806.05622。 Li, C.; Li, J.; Mei, R.; Xia, H.; Zhu, H.; Wang, J.; 和 Zhu, S. 2026. Hallo-Live:基于异步双流和以人为本偏好蒸馏的实时流式联合音视频化身生成。arXiv 预印本 arXiv:2604.23632。 Chung, J. S.; 和 Zisserman, A. 2016. 时间错位:野外自动唇同步。见《亚洲计算机视觉会议》,251–263。Springer。 Li, H.; Xu, M.; Zhan, Y.; Mu, S.; Li, J.; Cheng, K.; Chen, Y.; Chen, T.; Ye, M.; Wang, J.; 等. 2024. OpenHumanVid:用于增强以人为本视频生成的大规模高质量数据集。arXiv 预印本 arXiv:2412.00115。 Comanici, G.; Bieber, E.; Schaekermann, M.; Pasupat, I.; Sachdeva, N.; Dhillon, I.; Blistein, M.; Ram, O.; Zhang, D.; Rosen, E.; 等. 2025. Gemini 2.5:以前沿推理、多模态、长上下文和下一代智能体能力推动边界。arXiv 预印本 arXiv:2507.06261。 Lipman, Y.; Chen, R. T.; Ben-Hamu, H.; Nickel, M.; 和 Le, M. 2022. 用于生成建模的流匹配。arXiv 预印本 arXiv:2210.02747。 Cui, J.; Wu, J.; Li, M.; Yang, T.; Li, X.; Wang, R.; Bai, A.; Ban, Y.; 和 Hsieh, C.-J. 2025. Self-forcing++:迈向分钟级高质量视频生成。arXiv 预印本 arXiv:2510.02283。 Liu, K.; Li, W.; Chen, L.; Wu, S.; Zheng, Y.; Ji, J.; Zhou, F.; Luo, J.; Liu, Z.; Fei, H.; 等. 2025. Javisdit:具有分层时空先验同步的联合音视频扩散Transformer。arXiv 预印本 arXiv:2503.23377。 Elizalde, B.; Deshmukh, S.; Al Ismail, M.; 和 Wang, H. 2023. Clap 从自然语言监督中学习音频概念。见《ICASSP 2023-2023 IEEE 声学、语音与信号处理国际会议》,1–5。IEEE。 Liu, K.; Zheng, Y.; Wang, K.; Wu, S.; Zhang, R.; Luo, J.; Hatzinakos, D.; Liu, Z.; Fei, H.; 和 Chua, T.-S. 2026. Javisdit++:面向联合音视频生成的统一建模与优化。arXiv 预印本 arXiv:2602.19163。 Loshchilov, I.; 和 Hutter, F. 2017. 解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101。 Ephrat, A.; Mosseri, I.; Lang, O.; Dekel, T.; Wilson, K.; Hassidim, A.; Freeman, W. T.; 和 Rubinstein, M. 2018. 在鸡尾酒会中倾听:一种与说话人无关的视听语音分离模型。arXiv 预印本 arXiv:1804.03619。 Low, C.; Wang, W.; 和 Katyal, C. 2025. Ovi:用于音视频生成的双骨干跨模态融合。arXiv 预印本 arXiv:2510.01284。 OpenAI. 2024. Sora。https://openai.com/sora。 Girdhar, R.; El-Nouby, A.; Liu, Z.; Singh, M.; Alwala, K. V.; Joulin, A.; 和 Misra, I. 2023. Imagebind:一个嵌入空间绑定一切。见《IEEE/CVF 计算机视觉与模式识别会议论文集》,15180–15190。 Oquab, M.; Darcet, T.; Moutakanni, T.; Vo, H.; Szafraniec, M.; Khalidov, V.; Fernandez, P.; Haziza, D.; Massa, F.; El-Nouby, A.; 等. 2023. Dinov2:无需监督学习鲁棒视觉特征。arXiv 预印本 arXiv:2304.07193。 HaCohen, Y.; Brazowski, B.; Chiprut, N.; Bitterman, Y.; Kvochko, A.; Berkowitz, A.; Shalem, D.; Lifschitz, D.; Moshe, D.; Porat, E.; 等. 2026. LTX-2:高效的联合视听基础模型。arXiv 预印本 arXiv:2601.03233。 Peebles, W.; 和 Xie, S. 2023. 基于Transformer的可扩展扩散模型。见《IEEE/CVF 国际计算机视觉会议论文集》,4195–4205。 HaCohen, Y.; Chiprut, N.; Brazowski, B.; Shalem, D.; Moshe, D.; Richardson, E.; Levin, E.; Shiran, G.; Zabari, N.; Gordon, O.; 等. 2024. Ltx-video:实时视频潜扩散。arXiv 预印本 arXiv:2501.00103。 Prajwal, K.; Mukhopadhyay, R.; Namboodiri, V. P.; 和 Jawahar, C. 2020. 野外语音到唇部生成,只需一个唇同步专家。见《第28届ACM国际多媒体会议论文集》,484–492。 Radford, A.; Kim, J. W.; Xu, T.; Brockman, G.; McLeavey, C.; 和 Sutskever, I. 2023. 通过大规模弱监督实现鲁棒语音识别。见《国际机器学习会议》,28492–28518。PMLR。 Huang, X.; Li, Z.; He, G.; Zhou, M.; 和 Shechtman, E. 2026. 自强制:弥合自回归模型训练与测试的差距。
第 15 页
Reddy, C. K.; Gopal, V.; and Cutler, R. 2021. DNSMOS: 一种用于评估噪声抑制器的非侵入式感知客观语音质量指标。In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 6493–6497. IEEE.
Ronneberger, O.; Fischer, P.; and Brox, T. 2015. U-net: 用于生物医学图像分割的卷积网络。In International Conference on Medical image computing and computer-assisted intervention, 234–241. Springer.
Salimans, T.; Goodfellow, I.; Zaremba, W.; Cheung, V.; Radford, A.; and Chen, X. 2016. 训练GAN的改进技术。Advances in neural information processing systems, 29.
Seedance, T.; Chen, D.; Chen, L.; Chen, X.; Chen, Y.; Chen, Z.; Chen, Z.; Cheng, F.; Cheng, T.; Cheng, Y.; et al. 2026. Seedance 2.0: 面向世界复杂性的视频生成进阶。arXiv preprint arXiv:2604.14148.
Song, J.; Meng, C.; and Ermon, S. 2020. 去噪扩散隐式模型。arXiv preprint arXiv:2010.02502.
Song, Y.; Dhariwal, P.; Chen, M.; and Sutskever, I. 2023. 一致性模型。In Proceedings of the 40th International Conference on Machine Learning, 32211–32252.
Su, J.; Ahmed, M.; Lu, Y.; Pan, S.; Bo, W.; and Liu, Y. 2024. Roformer: 带有旋转位置编码的增强型Transformer。Neurocomputing, 568: 127063.
Su, Y.; Li, Y.; Xue, Z.; Huang, J.; Fu, S.; Li, H.; Li, Y.; Qian, Z.; Huang, H.; and Duan, N. 2026. Omniforcing: 通过专家拼接实现统一的音视频生成。arXiv preprint arXiv:2603.11647.
Team, G.; Kamath, A.; Ferret, J.; Pathak, S.; Vieillard, N.; Merhej, R.; Perrin, S.; Matejovicova, T.; Ramé, A.; Rivière, M.; Rouillard, L.; Mesnard, T.; Cideron, G.; bastien Grill, J.; Ramos, S.; Yvinec, E.; Casbon, M.; Pot, E.; Penchev, I.; Liu, G.; Visin, F.; Kenealy, K.; Beyer, L.; Zhai, X.; Tsitsulin, A.; Busa-Fekete, R.; Feng, A.; Sachdeva, N.; Coleman, B.; Gao, Y.; Mustafa, B.; Barr, I.; Parisotto, E.; Tian, D.; Eyal, M.; Cherry, C.; Peter, J.-T.; Sinopalnikov, D.; Bhupatiraju, S.; Agarwal, R.; Kazemi, M.; Malkin, D.; Kumar, R.; Vilar, D.; Brusilovsky, I.; Luo, J.; Steiner, A.; Friesen, A.; Sharma, A.; Sharma, A.; Gilady, A. M.; Goedeckemeyer, A.; Saade, A.; Feng, A.; Kolesnikov, A.; Bendebury, A.; Abdagic, A.; Vadi, A.; György, A.; Pinto, A. S.; Das, A.; Bapna, A.; Miech, A.; Yang, A.; Paterson, A.; Shenoy, A.; Chakrabarti, A.; Piot, B.; Wu, B.; Shahriari, B.; Petrini, B.; Chen, C.; Lan, C. L.; Choquette-Choo, C. A.; Carey, C.; Brick, C.; Deutsch, D.; Eisenbud, D.; Cattle, D.; Cheng, D.; Paparas, D.; Sreepathihalli, D. S.; Reid, D.; Tran, D.; Zelle, D.; Noland, E.; Huizenga, E.; Kharitonov, E.; Liu, F.; Amirkhanyan, G.; Cameron, G.; Hashemi, H.; Klimczak-Plucińska, H.; Singh, H.; Mehta, H.; Lehri, H. T.; Hazimeh, H.; Ballantyne, I.; Szpektor, I.; Nardini, I.; Pouget-Abadie, J.; Chan, J.; Stanton, J.; Wieting, J.; Lai, J.; Orbay, J.; Fernandez, J.; Newlan, J.; yeong Ji, J.; Singh, J.; Black, K.; Yu, K.; Hui, K.; Vodrahalli, K.; Greff, K.; Qiu, L.; Valentine, M.; Coelho, M.; Ritter, M.; Hoffman, M.; Watson, M.; Chaturvedi, M.; Moynihan, M.; Ma, M.; Babar, N.; Noy, N.; Byrd, N.; Roy, N.; Momchev, N.; Chauhan, N.; Sachdeva, N.; Bunyan, O.; Botarda, P.; Caron, P.; Rubenstein, P. K.; Culliton, P.; Schmid, P.; Sessa, P. G.; Xu, P.; Stanczyk, P.; Tafti, P.; Shivanna, R.; Wu, R.; Pan, R.; Rokni, R.; Willoughby, R.; Vallu, R.; Mullins, R.; Jerome, S.; Smoot, S.; Girgin, S.; Iqbal, S.; Reddy, S.; Sheth, S.; Põder, S.; Bhatnagar, S.; Panyam, S. R.; Eiger, S.; Zhang, S.; Liu, T.; Yacovone, T.; Liechty, T.; Kalra, U.; Evci, U.; Misra, V.; Roseberry, V.; Feinberg, V.; Kolesnikov, V.; Han, W.; Kwon, W.; Chen, X.; Chow, Y.; Zhu, Y.; Wei, Z.; Egyed, Z.; Cotruta, V.; Giang, M.; Kirk, P.; Rao, A.; Black, K.; Babar, N.; Lo, J.; Moreira, E.; Martins, L. G.; Sanseviero, O.; Gonzalez, L.; Gleicher, Z.; Warkentin, T.; Mirrokni, V.; Senter, E.; Collins, E.; Barral, J.; Ghahramani, Z.; Hadsell, R.; Matias, Y.; Sculley, D.; Petrov, S.; Fiedel, N.; Shazeer, N.; Vinyals, O.; Dean, J.; Hassabis, D.; Kavukcuoglu, K.; Farabet, C.; Buchatskaya, E.; Alayrac, J.-B.; Anil, R.; Dmitry; Lepikhin; Borgeaud, S.; Bachem, O.; Joulin, A.; Andreev, A.; Hardin, C.; Dadashi, R.; and Hussenot, L. 2025. Gemma 3 技术报告。arXiv:2503.19786.
Team, O.; Yu, D.; Chen, M.; Chen, Q.; Luo, Q.; Wu, Q.; Cheng, Q.; Li, R.; Liang, T.; Zhang, W.; et al. 2026. Mova: 迈向可扩展且同步的视频音频生成。arXiv preprint arXiv:2602.08794.
Wan, T.; Wang, A.; Ai, B.; Wen, B.; Mao, C.; Xie, C.-W.; Chen, D.; Yu, F.; Zhao, H.; Yang, J.; et al. 2025. Wan: 开放且先进的大规模视频生成模型。arXiv preprint arXiv:2503.20314.
Wang, D.; Zuo, W.; Li, A.; Chen, L.-H.; Liao, X.; Zhou, D.; Yin, Z.; Dai, X.; Jiang, D.; and Yu, G. 2025. UniVerse-1: 释放实时联合音视频生成能力。arXiv preprint arXiv:2509.06155.
Wu, B.; Zou, C.; Li, C.; Huang, D.; Yang, F.; Tan, H.; Peng, J.; Wu, J.; Xiong, J.; Jiang, J.; et al. 2025. Hunyuanvideo 1.5 技术报告。arXiv preprint arXiv:2511.18870.
Wu, X.; Hao, Y.; Sun, K.; Chen, Y.; Zhu, F.; Zhao, R.; and Li, H. 2023. Human preference score v2: 一个用于评估文本到图像合成中人类偏好的可靠基准。arXiv preprint arXiv:2306.09341.
Xie, L.; Wang, X.; Zhang, H.; Dong, C.; and Shan, Y. 2022. Vfhq: 一个用于视频人脸超分辨率的高质量数据集与基准。In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 657–666.
Xue, Z.; Wu, J.; Gao, Y.; Kong, F.; Zhu, L.; Chen, M.; Liu, Z.; Liu, W.; Guo, Q.; Huang, W.; et al. 2025. Dancegrpo: 在视觉生成中释放GRPO的潜力。arXiv preprint arXiv:2505.07818.
Yang, Z.; Teng, J.; Zheng, W.; Ding, M.; Huang, S.; Xu, J.; Yang, Y.; Hong, W.; Zhang, X.; Feng, G.; et al. 2025. Cogvideox: 基于专家Transformer的文本到视频扩散模型。In International Conference on Learning Representations, volume 2025, 83048–83077.
Yariv, G.; Gat, I.; Benaim, S.; Wolf, L.; Schwartz, I.; and Adi, Y. 2023. 通过文本到视频模型自适应实现多样化且对齐的音频到视频生成。arXiv e-prints, arXiv–2309.
Yin, T.; Gharbi, M.; Park, T.; Zhang, R.; Shechtman, E.; Durand, F.; and Freeman, W. T. 2024. 用于快速图像合成的改进分布匹配蒸馏。Advances in neural information processing systems, 37: 47455–47487.
第 16 页
Yin, T.; Zhang, Q.; Zhang, R.; Freeman, W. T.; Durand, F.; Shechtman, E.; and Huang, X. 2025. 从慢速双向到快速自回归视频扩散模型。载于《IEEE/CVF计算机视觉与模式识别会议论文集》,22963–22974。 Yu, J.; Zhu, H.; Jiang, L.; Loy, C. C.; Cai, W.; and Wu, W. 2023. Celebv-text:一个大规模面部文本-视频数据集。载于《IEEE/CVF计算机视觉与模式识别会议论文集》,14805–14814。 Zhang, Z.; Li, L.; Ding, Y.; and Fan, C. 2021. 基于流引导的高分辨率音视频数据集单次说话人脸生成。载于《IEEE/CVF计算机视觉与模式识别会议论文集》,3661–3670。 Zhu, H.; Zhao, M.; He, G.; Su, H.; Li, C.; and Zhu, J. 2026. 因果强制:正确实现自回归扩散蒸馏以用于高质量实时交互式视频生成。arXiv预印本 arXiv:2602.02214。