生成式视频编码首次实时解码!ReGenVC 如何用蒸馏与8卡并行突破时延壁垒

快速导读:这就暴露了一个关键空白:现有的扩散生成式视频编码方案,解码全是离线的,没有一个能实时。而少数能做到实时的扩散系统,又靠的是修改模型本身,比如量化或者剪枝,可能牺牲生成质量。ReGenVC 选择了一条不同的路:不改模型,改系统。核心思路就两条——先用蒸馏把扩散步数从 20 步压到 4 步,再用多卡并行把剩下的计算量分摊到 8 张 GPU 上。

生成式视频编码(generative video coding)为超低码率传输提供了一条新路径:发送端只传输紧凑的控制信号,接收端利用强生成先验重建视频。然而,现有基于扩散模型的方案虽然码率极低,解码却需要数十步采样,完全无法满足实时交互需求。ReGenVC 是首个打破这一“实时壁垒”的端到端生成式视频编码系统,在说话人头像场景下,以约 26 kB 传输 77 帧视频,并在 8 卡节点上实现 24 fps 实时解码。

ReGenVC 的核心思路不是修改模型结构,而是通过蒸馏与系统并行协同设计来压缩时延。它用 DMD2 + x0 回归蒸馏将 20 步扩散教师压缩为 4 步学生,再用 8 路统一序列并行、空间分割 VAE 和三级重叠流水线将解码时延压入 1000 ms 窗口。混合 CPU-GPU 部署进一步将单卡显存峰值从 21.1 GB 降至约 7.7 GB。这套方案证明:强扩散先验与实时性并非不可兼得,关键在于蒸馏策略与并行粒度的匹配。

英文题目:ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

论文出处:arXiv 每日论文精选 · arXiv:2607.28144

原始论文:PDF / 论文页面

这篇论文解决什么问题?

传统编码器(x264/x265)在超低码率下会因量化过粗而产生严重的块效应,画面完全不可用。生成式视频编码试图绕过像素级保真度的限制,改为传输语义级控制信号(如姿态关键点),在解码端用生成模型合成视频。这一思路在说话人头像场景中已有 FOMM、Face-vid2vid 等基于关键点 warping 的方案,它们虽然实时,但生成能力有限,难以处理遮挡和大幅运动。

近年来,扩散模型被引入生成式视频编码(如 Yi'25、M3-CVC、DiSCo、T-GVC 等),显著提升了重建质量,但代价是解码时延高达数十秒甚至分钟级。这些系统均报告离线解码性能,无法用于视频通话、直播等交互场景。StreamDiT、SANA-Streaming 等实时扩散系统虽然通过量化和稀疏化实现了实时生成,但它们修改了模型本身,可能损害生成质量。

ReGenVC 面临的核心矛盾是:扩散 Transformer 和 VAE 的计算量远超实时预算。单卡上 4 步 Transformer 前向就需要约 1475 ms,VAE 解码约 957 ms,编码约 564 ms,每一项都超过 1000 ms 的 24 fps 窗口。如何在保持模型完整的前提下,将端到端时延压缩到实时范围内,是本文要解决的关键问题。

核心创新

方法概览

这就暴露了一个关键空白:现有的扩散生成式视频编码方案,解码全是离线的,没有一个能实时。而少数能做到实时的扩散系统,又靠的是修改模型本身,比如量化或者剪枝,可能牺牲生成质量。ReGenVC 选择了一条不同的路:不改模型,改系统。核心思路就两条——先用蒸馏把扩散步数从 20 步压到 4 步,再用多卡并行把剩下的计算量分摊到 8 张 GPU 上。

  • 编码端极简设计:发送端仅传输一张神经压缩的参考帧(身份信息)、逐帧姿态关键点(运动信息)和少量元数据,77 帧总码流约 26 kB。这比 x264/x265 在高质量下的码流小约 10 倍。
  • DMD2 + x0 回归蒸馏:以 20 步 DDIM 采样作为教师,用分布匹配蒸馏(DMD2)训练 4 步学生。针对控制视频场景中出现的色彩漂移问题,额外加入 x0 回归损失,约束学生直接预测干净图像,从而稳定色彩。
  • 8 路统一序列并行(USP):将扩散 Transformer 的序列维度按 Ulysses×Ring 方式切分到 8 张 GPU,每张卡只计算部分 token,再通过 all-to-all 通信聚合。这是模型无损的并行策略,不改变任何权重。
  • 空间分割 VAE:将 VAE 的编码和解码在空间维度上切分到多卡并行执行,避免 VAE 成为新的瓶颈。编码和解码分别在不同 GPU 组上流水执行。
  • 三级重叠流水线:将系统划分为三个流水级——(i) CPU 上准备下一窗口的姿态,(ii) GPU 上执行当前窗口的扩散与 VAE 解码/编码,(iii) CPU 上拷贝和后期处理上一窗口。只有第 (ii) 级在关键路径上,第 (i) 和第 (iii) 级被隐藏。
  • 混合 CPU-GPU 部署:T5 和 CLIP 等一次性条件器只需在首帧运行,将其权重常驻 CPU,需要时调用,单卡显存峰值从 21.1 GB 降至约 7.7 GB,为 Transformer 和 VAE 腾出空间。
  • 解析时延模型:提出 Twin ≈ (wd+d) + max(v+a, we+e) 的时延公式,将扩散、VAE 解码、VAE 编码、锚帧编码等环节的依赖关系形式化,用于指导系统设计和瓶颈分析。

逐图理解论文

失败的直觉

失败的直觉
Figure 3. Qualitative comparison on a talking-head frame. Top: original, x264 crf 18, x264 crf 41. Bottom: x265 crf 18, x265 crf 40, ReGenVC (ours). At high quality x264/x265 need ∼250–280 kB (crf 18); at ultra-low bitrate (∼26 kB, crf 40/41, red boxes) they collapse into blocking, whereas ReGenVC (green box) stays sharp at the same ∼26 kB.

图 3 的定性对比直观展示超低码率下的质量差异。红框内 x264/x265 在约 26 kB 时出现严重块效应,绿框内 ReGenVC 保持清晰,验证了生成式编码在极低码率下的优势。

研究空白与核心思路

研究空白与核心思路
Table 1. Where ReGenVC sits in the landscape of talking-head/video compression and streaming diffusion. “Ultra-low bitrate” means the method operates at ≲50 kB for a ∼3 s clip with recognizable output (a traditional codec that produces blocking artifacts at that rate is marked ✗here even though the bitstream is small); “real-time” means sustained decoding at video frame rate. Only ReGenVC (last row) is a generative video codec that is simultaneously ultra-low-bitrate and real-time-decodable; the keypoint-warping line is both but has no diffusion prior, and every surveyed diffusion-based generative codec reports offline decoding. Symbols: ✓property holds, ✗does not, — not applicable.

表 1 将 ReGenVC 置于说话人头像压缩和流式扩散的整体版图中。注意只有 ReGenVC 同时满足“超低码率”和“实时解码”两个条件,所有其他扩散生成式编码方案均标记为离线解码。

方法贡献:蒸馏与并行协同

方法贡献:蒸馏与并行协同
Figure 2. Steady-state three-stage pipeline (Sec. 3.7). In every window three different windows are in flight on independent resources: stage (i) prepares the next window’s pose on the CPU (the next-window VAE encode e appears inside stage (ii)’s max path); stage (ii) runs diffusion followed by the overlapped VAE decode/encode for the current window on the main and dec stream; stage (iii) copies- out and post-processes the previous window on the decoder CPU thread. Only stage (ii) is on the wall-clock critical path: Twin ≈ (wd+d) + max(v+a, we+e); segment widths reflect measured values from Table 4.

图 2 可视化三级重叠流水线的时序。只有阶段 (ii) 的扩散和 VAE 解码/编码在关键路径上,阶段 (i) 的姿态准备和阶段 (iii) 的后期处理被隐藏。公式 Twin ≈ (wd+d) + max(v+a, we+e) 给出了解析时延模型。

实时性验证

实时性验证
Table 4. Steady-state per-window decomposition (ms) on 8×RTX 5090D, full system, reported as the mean over the steady- state phase of the tested run. Twin fits inside Trt = 1000 ms with ∼28 ms headroom; the anchor-encode a runs serially after v on dec stream, so the decode branch pays v+a; the prep term p and host post-processing cpu hide under the next window. Terms follow Sec. 4.

表 4 的稳态时延分解是实时性达成的直接证据。全系统 Twin 约 972 ms,在 1000 ms 预算内留有约 28 ms 余量,各阶段耗时与公式 (3) 的解析模型一致。

结论与局限

结论与局限
Figure 5. Reconstruction fidelity across the ∼10 s (240-frame) demo clip (Sec. 3.3). Top row: original input frames; bottom row: ReGenVC reconstructions decoded from the ∼60 kB bitstream, at six time instants spanning the sequence (timestamps on top). ReGenVC visibly preserves recognizable identity and facial detail across the tested clip.

图 5 的 240 帧重建序列展示时间维度上的保真度。6 个采样时间点的重建帧与原始帧对比,验证了身份和面部细节在约 10 秒跨度内的可辨认性。

实验如何设计?

  • 测试平台:8×RTX 5090D GPU 节点,CPU 端负责编码和条件器。
  • 测试序列:主要使用一段 77 帧说话人头像视频进行压缩对比,一段 240 帧(约 10 秒)视频进行重建保真度展示和实时解码演示。
  • 对比基线:x264 和 x265 在多个 CRF 参数下的压缩结果,覆盖高质量(CRF 18)和超低码率(CRF 40/41)两种配置。
  • 时延测量:稳态逐窗口墙钟时间分解,按公式 (3) 报告各阶段耗时(表 4,第 8 页);单卡 kernel 级时延分析(表 5,第 9 页)。
  • 定性评估:浏览器端实时推流演示(图 4,第 9 页),以及 240 帧重建帧与原始帧的并排对比(图 5,第 10 页)。

关键结果与论文证据

  • 压缩效率:ReGenVC 以约 26 kB 传输 77 帧视频,x264/x265 在同等码率下 PSNR 仅约 36 dB 且出现严重块效应,而 ReGenVC 保持清晰(表 3,第 8 页)。x264/x265 需约 250–280 kB 才能达到 PSNR 约 49 dB 的无块效应质量。
  • 实时性达成:全系统稳态每窗口墙钟时间约 972 ms,在 1000 ms 的 24 fps 预算内,留有约 28 ms 余量(表 4,第 8 页)。浏览器端演示确认可持续 24 fps 解码和推流(图 4,第 9 页)。
  • 单卡瓶颈量化:4 步 Transformer 前向 1475.2 ms,VAE 解码 957.4 ms,VAE 编码 564.2 ms,均超实时预算,验证了多卡并行的必要性(表 5,第 9 页)。
  • 显存优化效果:CPU 卸载 T5 和 CLIP 后,单卡显存峰值从 21.1 GB 降至约 7.7 GB(表 2,第 6 页),使 8 卡节点可同时容纳 Transformer 和 VAE。
  • 重建保真度:240 帧序列的 6 个时间点采样显示,ReGenVC 能保持可辨认的身份和面部细节(图 5,第 10 页)。
  • 流水线有效性:三级重叠流水线成功将条件准备和后期处理隐藏在扩散/VAE 的关键路径之后,解析模型与实测数据吻合(图 2,第 7 页)。

阅读时需要注意

  • 场景限定:仅针对单人固定镜头说话人头像视频,不适用于多人物、运动镜头或通用自然视频。
  • 评估规模有限:定量压缩对比仅在一段 77 帧视频上进行,实时解码演示仅在一段 240 帧视频上完成,缺乏基准规模评测。
  • 感知质量未量化:对传统编码器使用 PSNR,但承认 PSNR 不适合生成式重建,LPIPS/FVD 等感知指标留待后续工作。
  • 硬件成本高:实时解码需要 8 卡节点,以硬件成本换取模型无损的吞吐量。
  • 余量紧张:约 28 ms 的时延余量仅占预算的 2.8%,对窗口间抖动敏感,未进行长时间压力测试。
  • 蒸馏质量未形式化验证:4 步学生与 20 步教师的感知等价性依赖蒸馏质量,缺乏独立的用户研究或感知指标验证。

关联工作

  • FOMM 和 Face-vid2vid 代表基于关键点 warping 的生成式人脸视频编码路线,它们实时但生成能力有限。ReGenVC 在同一超低码率场景下用更强的扩散先验替代了 warping 解码器。
  • Yi'25、M3-CVC、DiSCo、T-GVC、Free-GVC、ZeroGVC 等扩散生成式视频编码方案均报告离线解码时延,ReGenVC 首次填补了实时解码的空白。
  • StreamDiT 和 SANA-Streaming 通过模型修改(量化、稀疏化)实现实时扩散,ReGenVC 则选择模型无损的多卡并行路线,两者代表了实时扩散系统的不同设计哲学。
  • DeepSpeed-Ulysses 和 Ring Attention 是序列并行技术的基础,ReGenVC 将其组合为统一序列并行(Ulysses×Ring)来切分扩散 Transformer。
  • DMD2 是分布匹配蒸馏的代表方法,ReGenVC 在其基础上增加 x0 回归损失来解决控制视频场景下的色彩漂移问题。

发表评论