LongE2V:如何用视频扩散模型解决事件相机长视界生成难题?

三分钟导读:为弥合训练与推理间的分布差异,我们引入自回归展开策略。初始阶段使用真实标签上下文帧进行收敛训练;随后激活展开机制,用模型生成的预测帧替换真实标签进行微调。这种迭代反馈循环迫使模型适应自身生成误差,从而有效缓解长视频生成中的误差累积问题。

英文题目:LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

论文出处:arXiv 每日论文精选 · arXiv:2607.08770

原始论文:PDF / 论文页面

对应视频标题:LongE2V:如何用视频扩散模型解决事件相机长视界生成难题?|推荐指数:★★★★★

这篇论文解决什么问题?

事件相机以异步方式捕捉亮度变化,具备高时间分辨率但缺乏强度信息。传统CNN或RNN方法往往导致细节模糊。尽管近期扩散模型提升了生成质量,但在长视界任务中仍面临严重的时序漂移与域间隙问题,缺乏统一的架构来同时处理重建、预测与插值。

核心创新

方法概览

为弥合训练与推理间的分布差异,我们引入自回归展开策略。初始阶段使用真实标签上下文帧进行收敛训练;随后激活展开机制,用模型生成的预测帧替换真实标签进行微调。这种迭代反馈循环迫使模型适应自身生成误差,从而有效缓解长视频生成中的误差累积问题。

逐图理解论文

方法概览

方法概览
Fig. 1. Event-based video generation. We leverage pre-trained video diffusion priors to address three distinct inverse problems within a single architecture. Depending on the input condition, our model performs: (a) Video Reconstruction, recovering high-fidelity textures from sparse event streams, (b) Video Prediction, generating long-term sequences from a single start frame with minimal drift via our autoregressive unrolling strategy, and (c) Video Frame Interpolation, achieving zero-shot adaptation to synthesize intermediate frames by leveraging event dynamics as temporal guidance.

LongE2V提出了一种基于预训练CogVideoX图像到视频模型的统一框架。它将事件体素作为条件输入,通过微调DiT骨干网络,同时支持视频重建、长程预测和零样本帧插值。该方法旨在利用强大的视频扩散先验,解决单一架构下的多任务逆问题,确保生成结果的高保真度与稳定性。

自回归展开

自回归展开
Fig. 3. Autoregressive Unrolling. To bridge the domain gap between training and inference, we employ an iterative training strategy. Initially, the model is trained with Ground Truth (GT) context frames for convergence (left). Subsequently, we activate the unrolling mechanism by performing an inference pass to generate predictions, which then replace the GT context frames for fine-tuning (right). This iterative feedback loop forces the model to adapt to its own generation errors, mitigating error accumulation during long video generation.

为弥合训练与推理间的分布差异,我们引入自回归展开策略。初始阶段使用真实标签上下文帧进行收敛训练;随后激活展开机制,用模型生成的预测帧替换真实标签进行微调。这种迭代反馈循环迫使模型适应自身生成误差,从而有效缓解长视频生成中的误差累积问题。

重编码对齐与残差校正

重编码对齐与残差校正
Fig. 5. Reencoding Alignment and Cross Residual Correction. To address temporal misalignment caused by the discrepancy between latent-space and pixel-space flipping, we propose Reencoding Alignment. The denoised latents, ˆ𝑍𝑓𝑤𝑑

针对3D VAE中潜空间与像素空间翻转不一致导致的时序错位,我们提出重编码对齐。解码后在像素空间翻转并重新编码潜变量,以解决非交换性问题。同时,交叉残差校正通过注入前后向分支的残差,恢复重编码过程中丢失的高频细节,显著提升纹理清晰度。

重建与预测结果

重建与预测结果
Table 1. Quantitative results on ECD [Mueggler et al. 2017], MVSEC [Zhu et al. 2018], and HQF [Stoffregen et al. 2020]. Comparing our method against SOTA baselines (Red: best; blue: second). In Reconstruction, we consistently achieve the best LPIPS scores, indicating superior perceptual quality compared to regression-based methods. In Prediction, our method significantly outperforms VDM-EVFI across all metrics and datasets, validating our robust long-term generation capabilities.

在ECD、MVSEC和HQF数据集上,LongE2V在重建任务中取得了最佳的LPIPS分数,分别为0.139、0.405和0.240,显著优于E2VID+等回归基线。在预测任务中,LPIPS分数进一步降低至0.110、0.359和0.229,证明了其在长视界生成中的鲁棒性与感知质量优势。

零样本插值表现

零样本插值表现
Table 2. Interpolation (31 skips) on ERGB [Tulyakov et al. 2021] and HQF [Stoffregen et al. 2020]. Comparing our zero-shot method vs. super- vised baselines (Red: best; blue: second), we excel in LPIPS and generaliza- tion. Unlike regression baselines, which blur textures to boost PSNR, our generative approach preserves high-frequency details.

在BS-ERGB和HQF数据集的零样本插值任务中,LongE2V分别取得了0.124和0.105的最佳LPIPS分数。与CBMNet-Large等基线相比,我们的方法在复杂运动下避免了重影伪影,并在细粒度文本场景中保持了结构完整性,展现了强大的泛化能力与动态捕捉精度。

实验与关键结果

  • 在ECD、MVSEC和HQF数据集上,LongE2V在重建任务中取得了最佳的LPIPS分数,分别为0.139、0.405和0.240,显著优于E2VID+等回归基线。在预测任务中,LPIPS分数进一步降低至0.110、0.359和0.229,证明了其在长视界生成中的鲁棒性与感知质量优势。
  • 消融实验表明,预训练先验对收敛至关重要。移除自回归展开会导致点状伪影和漂移,而自适应上下文切换则有效抑制了长序列中的网格伪影。在插值任务中,重编码对齐对结构保真度贡献最大,交叉残差校正则显著提升了感知质量,验证了各模块的必要性。
  • 在ECD、MVSEC和HQF数据集上,LongE2V在重建任务中取得了最佳的LPIPS分数,分别为0.139、0.405和0.240,显著优于E2VID+等回归基线。在预测任务中,LPIPS分数进一步降低至0.110、0.359和0.229,证明了其在长视界生成中的鲁棒性与感知质量优势。
  • 消融实验表明,预训练先验对收敛至关重要。移除自回归展开会导致点状伪影和漂移,而自适应上下文切换则有效抑制了长序列中的网格伪影。在插值任务中,重编码对齐对结构保真度贡献最大,交叉残差校正则显著提升了感知质量,验证了各模块的必要性。

阅读时需要注意

  • 尽管性能优越,LongE2V在稀疏或低质量事件流下仍可能出现失败案例,且对噪声敏感,可能放大‘热像素’。此外,推理速度明显慢于实时回归方法,不适合对延迟敏感的应用。微调DiT骨干需要大量计算资源,且零样本插值性能高度依赖预训练先验的质量。
  • Requires significant computational resources for fine-tuning DiT backbones.
  • Zero-shot interpolation performance depends heavily on the quality of the pre-trained prior.
  • Adaptive Context Switching threshold (tau=0.05) is empirically set.

关联工作

  • 事件相机以异步方式捕捉亮度变化,具备高时间分辨率但缺乏强度信息。传统CNN或RNN方法往往导致细节模糊。尽管近期扩散模型提升了生成质量,但在长视界任务中仍面临严重的时序漂移与域间隙问题,缺乏统一的架构来同时处理重建、预测与插值。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

LongE2V:基于视频扩散模型的长时事件视频重建、预测与帧插值

范成德,台湾阳明交通大学 涂春伟,台湾阳明交通大学 张陈伟,台湾阳明交通大学 林锦阳,台湾阳明交通大学 吴坤儒,台湾阳明交通大学 曾裕哲,台湾阳明交通大学 刘宇伦,台湾阳明交通大学

(a) 视频重建 高保真度 仅事件流2026 7月 9

事件流 + 起始帧 (b) 视频预测 最小漂移[cs.CV]

事件流 + 起始/结束帧 (c) 视频帧插值 零样本适应

图 1. 基于事件的视频生成。我们利用预训练的视频扩散先验,在单一架构内解决三个不同的逆问题。 根据输入条件,我们的模型执行:(a) 视频重建,从稀疏事件流中恢复高保真纹理;(b) 视频预测,通过我们的自回归展开策略,从单个起始帧生成具有最小漂移的长序列;以及 (c) 视频帧插值,利用事件动态作为时间引导,实现零样本适应以合成中间帧。

从稀疏事件流中恢复高质量视频是一项具有挑战性的 作者联系方式:范成德,台湾阳明交通大学, 大学,台湾,fansam39@gmail.com;涂春伟,台湾阳明交通大学,台湾,raytm9999@gmail.com;张陈伟,台湾阳明交通大学,台湾,steven891213.ii12@nycu.edu.tw;林锦阳,台湾阳明交通大学,台湾,linjohn0903@gmail.com;吴坤儒,台湾阳明交通大学,台湾,wufish@nycu.edu.tw;曾裕哲,台湾阳明交通大学,台湾,yctseng@nycu.edu.tw;刘宇伦,台湾阳明交通大学,台湾,yulunliu@cs.nycu.edu.tw。 SIGGRAPH 会议论文 '26,美国加利福尼亚州洛杉矶 © 2026 版权归所有者/作者所有。 ACM ISBN 979-8-4007-2554-8/2026/07 本作品采用知识共享署名 4.0 国际许可协议授权。 https://doi.org/10.1145/3799902.3811151

SIGGRAPH 会议论文 '26,2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 2 页

2 • Fan 等人

卓越的感知质量。我们引入自回归展开和自适应上下文切换,以缓解极长序列中的时间漂移。我们还提出了重编码对齐与交叉残差校正,以确保帧插值期间的精确双向一致性。此外,事件体素密度增强确保了在不同传感器分辨率下的鲁棒性。在真实世界基准上的大量实验表明,LongE2V 在所有三个任务上均优于最先进的方法,展现出卓越的时间连贯性和零样本泛化能力。项目页面:https://cdfan0627.github.io/LongE2V-page/

ACM 分类体系:• 计算方法 → 重建;计算摄影;神经网络;• 硬件 → 传感器和执行器。

ACM 引用格式: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, 和 Yu-Lun Liu。2026。LongE2V: 利用视频扩散模型进行长视场基于事件的视频重建、预测和帧插值。在计算机图形和交互技术特别兴趣组会议论文集 (SIGGRAPH Conference Papers ’26),2026年7月19–23日,美国加利福尼亚州洛杉矶。ACM,纽约,纽约州,美国,14页。https://doi.org/10.1145/3799902.3811151

1 引言

事件相机是受生物启发的传感器,以微秒级分辨率和高动态范围 (HDR) 捕捉异步亮度变化。与容易受到运动模糊影响的普通相机不同,事件相机在高速动态场景中表现出色。然而,其稀疏且无强度信息的输出与标准视觉算法不兼容,使得高保真视频恢复成为一个固有的不适定问题。我们通过利用视频扩散模型来解决这一问题,用于视频重建、预测和帧插值。如图 1 所示,一个鲁棒的解决方案必须同时恢复光度细节(重建)、确保长期一致性(预测)以及实现零样本中间帧生成(帧插值),从而有效地弥合神经形态感知与人类可解释视觉之间的鸿沟。

传统的基于事件的视频生成依赖于 CNN 或 RNN [Rebecq 等人 2019b; Scheerlinck 等人 2020],先驱者如 E2VID [Rebecq 等人 2019b] 和 FireNet [Scheerlinck 等人 2020] 聚合时间信息。最近的进展采用 Transformer [Weng 等人 2021] 和超网络 [Ercan 等人 2024] 来增强表示能力。随着生成式 AI 的兴起,视频扩散模型 (VDMs) [Blattmann 等人 2023a; Ho 等人 2022b] 如 VDM-EVFI [Chen 等人 2025a] 已被适配用于插值。这些方法通过将事件体积映射到帧来建立强大的基线,并且通常在合成数据集上进行训练。

尽管取得了进展,但在现实场景中仍面临挑战。基于回归的方法如 E2VID 存在“回归均值”问题,导致纹理模糊(图 2(a))。虽然扩散模型改善了生成效果,但简单应用会导致不稳定性;长期预测会遭受严重的误差累积和漂移(图 2(b))。此外,插值方法在处理快速、复杂的动态时表现不佳,产生重影伪影(图 2(c))。关键在于,许多现有方法是为单个任务量身定制的,通常需要为重建、预测和帧插值分别构建架构,从而限制了灵活性。

为了解决这些局限性,我们提出了 LongE2V,利用预训练的视频扩散模型 (CogVideoX [Yang 等人 2024]) 来处理重建、预测和帧插值。如图 4 所示,我们将这些任务表述为由事件体素驱动的条件生成。为了确保长期稳定性,我们引入了结合自适应上下文切换的自回归展开,动态调整时间依赖关系,以减轻误差累积和漂移。对于插值,我们提出了重编码对齐和交叉残差校正,以解决 3D VAE 潜在空间中的时间不对齐问题。最后,事件体素密度增强确保了在不同传感器分辨率下的鲁棒性。

我们的贡献总结如下:

  • 我们提出了 LongE2V,利用预训练的视频扩散先验,以卓越的数据效率处理基于事件的重建、预测和帧插值。
  • 我们引入了自回归展开和自适应上下文切换,以确保重建和预测的长期稳定性,并提出了重编码对齐与交叉残差校正,以确保帧插值的时间一致性。
  • 我们设计了事件体素密度增强,以实现针对不同传感器分辨率的鲁棒泛化,证明我们的方法在所有三个任务上均优于最先进 (SOTA) 基线,并实现了卓越的感知质量、稳定性和零样本泛化能力。

2 相关工作

基于事件的视频重建。从相对亮度变化重建强度是不适定的 [Gallego 等人 2020]。早期的优化方法 [Bardow 等人 2016; Munda 等人 2018; Scheerlinck 等人 2018; Zhang 等人 2022] 已被深度学习所取代。E2VID [Rebecq 等人 2019a,b] 建立了基于合成数据训练的循环 U-Net 基线 [Rebecq 等人 2018],随后出现了效率提升 [Cadena 等人 2023; Scheerlinck 等人 2020]、仿真到现实迁移 [Cadena 等人 2021; Ercan 等人 2024; Stoffregen 等人 2020] 以及包括 Transformer [Weng 等人 2021]、自监督学习 (SSL) [Paredes-Vallés 和 De Croon 2021; Wang 等人 2024b]、SNN [Zhu 等人 2020, 2022] 和 GAN [Wang 等人 2019] 在内的架构改进。最近的生成方法采用语言 [Chen 等人 2024b]、扩散 [Liang 等人 2024] 或时间残差 [Zhu 等人 2024]。相比之下,我们的方法通过高效微调处理重建、预测和帧插值。

基于事件的视频帧插值。EVFI 利用高分辨率时间合成中间帧。方法包括扭曲-合成混合方法 [Cho 等人 2024; Kim 等人 2023; Ma 等人 2024a; Sun 等人 2024, 2023; Tulyakov 等人 2022, 2021] 以及采用循环一致性 [He 等人 2022; Liu 等人 2019] 或自适应计算 [Liu 等人 2024b; Shi 等人 2023; Wu 等人 2022; Zhang 等人 2025b; Zhang 和 Yu 2022] 的光流方法。最近,EPA [Liu 等人 2025] 进一步利用细粒度事件线索来引导感知空间内的分层特征对齐。直接合成方法 [Liu 等人 2024a; Paikin 等人 2021] 最近已适配预训练的视频扩散模型 [Chen 等人 2025a]。与之前仅限于插值的工作不同,我们将扩散先验扩展到重建和预测,引入了

SIGGRAPH Conference Papers ’26, 2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 3 页

LongE2V:基于视频扩散模型的长时事件视频重建、预测与帧插值 • 3

我们认为,事件流提供了理想的结构条件,能够以微秒级分辨率编码自然场景的动态变化,而无需人工指定。

视频重建。长视频生成通过记忆或流式架构 [Bengio et al. 2015; Lamb et al. 2016; Henschel et al. 2025; Shiu et al. 2025; Yin et al. 2023; Zhao et al. 2024] 或无需训练的噪声重调度 [Chen et al. 2025c, 2023b; Kim et al. 2024; Lu et al. 2024; Qiu et al. 2023; Zhou et al. 2024] 来对抗误差累积。最近的工作直接针对训练-推理差距 [Guo et al. 2025; Huang et al. 2025; Yin et al. 2025; Yoo et al. 2023; Zhang and Agrawala 2025]。我们引入自回归展开(Autoregressive Unrolling)以在预测上进行微调 [Bengio et al. 2015; Lamb et al. 2016],并引入自适应上下文切换以动态更新上下文,从而防止时间漂移,这与固定调度方法不同。

视频预测。

(a) E2VID+ 模糊纹理 真实值 (b) VDM-EVFI 颜色时间漂移 真实值 (c) CBMNet-Large 鬼影伪影 真实值

图 2. 基于事件的视频生成中的挑战。我们突出了最先进方法中的失败案例:(a) 重建:基于回归的方法(例如,E2VID+[Stoffregen et al. 2020]) suffers from “回归均值”(regression-to-the-mean),导致纹理模糊和细节丢失。(b) 预测:直接视频扩散(例如,VDM-EVFI[Chen et al. 2025a])在长序列上 suffers from 误差累积,导致严重的颜色时间漂移。(c) 插值:现有网络(例如,CBMNet-Large [Kim et al. 2023])无法捕捉复杂的中间运动,产生显著的鬼影伪影。我们的方法利用视频扩散先验,确保所有任务的高保真度和稳定生成。

帧插值。

3 方法

3.1 预备知识

视频扩散模型。我们采用 CogVideoX I2V [Yang et al. 2024],它使用 3D VAE 将视频 $X$ 编码为潜在变量 $Z_0$,具有 4× 时间压缩和 8× 空间压缩。扩散 Transformer (DiT) $\epsilon_\theta$ 经过训练以最小化去噪目标: $L = \mathbb{E}_{Z_0, t, C, \epsilon} \|\epsilon – \epsilon_\theta(Z_t, t, C)\|_2^2$,其中 $Z_t$ 是带噪潜在变量,$C$ 表示条件信号。在推理过程中,模型迭代地对随机高斯噪声进行去噪以合成干净的潜在变量,然后将其解码回像素空间。

事件表示。事件相机捕获异步流 $\{e_i\}_{i=1}^N$,其中 $e_i = (x_i, y_i, t_i, p_i)$。为了支持基于帧的处理,我们将这些事件离散化为体素网格 $V \in \mathbb{R}^{B \times H \times W}$ [Ercan et al. 2024],方法是通过线性插值将极性 $p_i \in \{\pm 1\}$ 累积到 $B$ 个时间 bin 中: $V(t, y, x) = \sum_i p_i \max(0, 1 – |t – t^*_i|) \delta(x – x_i, y – y_i), \quad (1)$ 其中 $\delta$ 是克罗内克 delta,$t^*_i \in [0, B-1]$ 表示相对于持续时间 $\Delta T$ 的归一化时间戳。在我们的实验中,我们设置 $B=3$。

3.2 基于事件的视频生成框架

我们将当前视频帧表示为 $X = \{x_0, \dots, x_{F-1}\}$。为了将异步事件与离散帧对齐,我们将事件流划分为时间窗口。具体而言,事件体素 $v_k$ 通过在区间 $[t_{k-1}, t_k)$ 内聚合事件,对应于时间戳 $t_k$ 处的帧 $x_k$,变换如第 3.1 节所述。这产生了一个同步的事件序列 $V = \{v_1, \dots, v_{F-1}\}$。

上下文与自回归展开。朴素长视频生成通常使用前一块的最后一帧作为下一块的初始条件。然而,这种递归过程会导致误差累积和伪影传播。为了缓解这一问题,我们使用上下文帧和上下文事件体素作为历史条件。具体而言,上下文帧定义为紧接在当前块第一帧之前的连续序列,上下文事件体素是与这些帧相应的事件体素。

重编码对齐(Reencoding Alignment)和交叉残差校正(Cross Residual Correction)以解决 3D VAE 的时间不对齐问题。

视频扩散模型。扩散模型 [Chao et al. 2022; Ho et al. 2020; Song et al. 2020] 从优化注意力和效率的 U-Net 架构 [Bar-Tal et al. 2024; Blattmann et al. 2023a,b; Ho et al. 2022a,b; Singer et al. 2022] 演变为扩散 Transformer (DiTs),实现了最先进的质量 [Chen et al. 2024c; Ma et al. 2024c; Yang et al. 2024]。基础模型现在使用流匹配 [Chen et al. 2025b; Esser et al. 2024; Yin et al. 2025] 扩展到分钟级生成 [Brooks et al. 2024; Kong et al. 2024; Team 2024; Zheng et al. 2024]。扩散先验也零样本迁移到视频修复 [Yeh et al. 2024]。基于 CogVideoX [Yang et al. 2024],我们利用事件进行显式运动引导,这与文本到视频生成中的隐式运动学习不同。

可控视频生成。控制方法范围从通过适配器或注意力的空间条件控制 [Chen et al. 2026, 2023a; Guo et al. 2023; Mou et al. 2024; Wang et al. 2023; Zhang et al. 2023] 到细粒度轨迹控制 [Geng et al. 2025; He et al. 2024; Jin et al. 2025; Ma et al. 2024b; Namekata et al. 2024; Wang et al. 2024d,c; Wu et al. 2024; Zhang et al. 2025a]。结构引导方法将内容与运动分离 [Chen et al. 2024a; Esser et al. 2023; Huang et al. 2026; Niu et al. 2024; Wang et al. 2024a; Xiao et al. 2024]。

SIGGRAPH 会议论文 '26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 4 页

4 • Fan 等

密度 VAE3D F 推理 上下文 事件体素 体素 增强 VAE 事件 3D 层 LoRA 真实上下文帧 上下文帧 当前事件体素 推理 调整大小与裁剪 3D VAE F C DiT 第一帧 投影图3. 自回归展开。为了弥合训练与推理之间的领域差距,我们采用了一种迭代训练策略。最初,模型使用真实(GT)上下文帧进行训练以收敛(左图)。随后,我们通过执行一次推理传递来生成预测,然后用这些预测替换 GT 上下文帧以进行微调(右图)。这种迭代反馈循环迫使模型适应其自身的生成误差,从而减轻在长视频生成过程中的误差累积。 图4. 我们的训练流程概述。为了增强对传感器变化的鲁棒性,输入事件体素经过事件体素密度增强,第一帧、上下文帧和当前视频帧同步调整大小和裁剪以确保空间对齐。所有输入均通过冻结的 3D VAE 编码为潜在变量。这些潜在变量通过帧维度拼接和通道维度拼接进行对齐和融合。最后,我们扩展并完全微调第一投影层以适应额外的事件通道,而 DiT 主干则使用 LoRA 进行高效微调。

然而,仅仅依赖历史数据会在训练和推理之间引入领域差距,因为模型在训练时依赖真实上下文帧,而在推理时则依赖其自身的预测。为了弥合这一差距,我们提出了一种自回归展开(Autoregressive Unrolling)训练策略。最初,模型使用真实上下文帧进行训练直至收敛。随后,我们激活展开机制,其中在训练集上生成的预测被替换为后续微调的上下文帧,如图3所示。这种迭代展开重复 $T$ 次,迫使模型适应其自身的预测误差,并有效地使训练分布与推理行为对齐。

事件体素密度增强。由于传感器分辨率和场景深度的不同,事件体素的空间密度存在显著差异。为了增强鲁棒性,我们在训练期间引入了一种密度增强策略。具体而言,我们随机调整事件体素的大小,同时保持纵横比,并将其限制在动态范围 $[S_{min}, S_{max}]$ 内。下界 $S_{min}$ 设置得略大于网络输入,以利于随机裁剪,而上界 $S_{max}$ 限制为原始分辨率的 2 倍。遵循 FireNet [Scheerlinck et al. 2020] 的做法,我们基于非零值的统计信息进行归一化以保持稀疏性。最后,应用随机裁剪以匹配网络输入分辨率。为了保持空间对齐,相同的几何变换同步应用于第一帧、上下文帧和当前视频帧。

使用事件体素和上下文进行微调。在完成空间对齐后,我们在微调之前确保输入数据的时间对齐。由于提供了第一帧 $x_0$,我们将初始时间戳的当前事件体素 $V$ 进行零填充,以与后续帧 $x_{1:F-1}$ 对齐。所有输入,包括 $x_0$、填充后的 $V$ 和上下文元素,均通过冻结的 3D VAE 进行编码。注意,使用 $B=3$ 构建 $V$ 允许事件流通过 VAE 的标准 3 通道输入进行替代处理。然后,我们通过沿通道维度拼接三个时间对齐的序列来构建最终的输入潜在变量:(1) 带有零填充第一帧潜在变量 $Z_{x0}$ 的上下文潜在变量,(2) 带有噪声潜在变量 $Z_t$ 的上下文潜在变量,以及 (3) 带有当前事件潜在变量的上下文事件潜在变量。

为了适应额外的事件条件,我们扩展了 patchify 模块中的第一投影层,将权重 $W_{in} \in \mathbb{R}^{D \times 2C_{vae} \times K \times K}$ 扩展为 $W^*_{in} \in \mathbb{R}^{D \times 3C_{vae} \times K \times K}$。在训练期间,我们完全微调这个扩展层,并对 DiT 块使用 LoRA,如图4所示。损失仅针对 $Z_t$ 分量计算。此外,我们对 $Z_{x0}$ 应用 5% 的 dropout 以增强重建鲁棒性,并以 20% 的概率引入文本提示以进行文本引导生成。

3.3 基于事件的视频重建、预测和帧插值

我们将基于事件的视频重建、预测和帧插值 formulate 为基于事件的视频生成任务。通过调整输入条件,模型适应特定任务需求:

  • 视频重建:模型仅从事件中恢复光度细节。对于第一个块,起始帧和上下文为空,迫使模型从头开始重建场景(详见第 4.1 节)。对于后续块,前一个块的最后一帧作为第一帧,无缝地将任务过渡为预测范式。
  • 视频预测:给定起始帧、事件流和上下文,模型利用起始帧进行初始纹理引导、事件流提供动态信息以及上下文提供历史参考,从而生成后续视频帧。对于第一个块,上下文帧通过复制起始帧来填充时间窗口,而上下文事件体素初始化为空(详见第 4.1 节)。
  • 视频帧插值:给定起始帧和结束帧作为边界条件,模型利用前向和后向事件流合成中间帧。这些事件流充当连接边界的密集运动引导。

SIGGRAPH 会议论文 '26,2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 5 页

LongE2V:基于视频扩散模型的长时事件视频重建、预测与帧插值 • 5

自适应上下文切换。在过滤掉缺失数据的序列后,对每个块进行标准的自回归更新会导致误差累积。为了缓解这一问题,我们引入了自适应上下文切换(Adaptive Context Switch)。虽然第一个块需要强制更新,但后续更新则根据上下文的相关性动态进行。我们将去噪后的潜在变量 $\hat{Z}_0$ 重新输入到 DiT 中以提取注意力图 $A$,并计算当前 token 对上下文 token 关注的平均注意力权重 $\mu_{att}$:

$$ \mu_{att} = \frac{1}{L \times H \times N_{curr}} \sum_{l=1}^{L} \sum_{h=1}^{H} \sum_{i \in Current} \sum_{j \in Context} A(l,h)_{i,j}, \quad (2) $$

其中 $L$ 是层数,$H$ 是注意力头数,$N_{curr}$ 是当前 token 的数量。如果 $\mu_{att} \ge \tau$,则保留现有上下文以防止漂移。如果 $\mu_{att} < \tau$,表示相关性较低,我们触发上下文切换,并采用单次重试机制:丢弃当前生成结果,将上下文更新为直接的前驱块,并重新生成该块。在我们的实验中,我们将 $\tau$ 设置为 0.05。

重编码对齐。我们将时间反转融合(Time Reversal Fusion)[Feng et al. 2024] 扩展到零样本插值任务。标准方法直接翻转反向潜在变量,但由于 3D VAE [Wan et al. 2025; Yang et al. 2024] 中的时间压缩,潜在空间操作与像素空间操作不可交换:

$$ \text{Flip}_{lat}(Z_t) \neq E(\text{Flip}_{pix}(D(Z_t))), \quad (3) $$

其中 $D$、$E$ 分别为解码器和编码器,$\text{Flip}_{lat/pix}$ 表示时间翻转。这种差异会导致不对齐。我们提出重编码对齐(Reencoding Alignment)来纠正这一问题,即解码预测的干净潜在变量 $\hat{Z}_0$,在像素空间进行翻转,然后重新编码:

$$ \tilde{Z}_{fw}^0 = E(\text{Flip}_{pix}(D(\hat{Z}_{fw}^0))), \quad \tilde{Z}_{bw}^0 = E(\text{Flip}_{pix}(D(\hat{Z}_{bw}^0))). \quad (4) $$

这确保了双向分支之间的精确时间对齐(图 5)。

交叉残差校正。虽然重编码对齐解决了不对齐问题,但额外的“解码-编码”循环引入了重建损失。为了补偿这一点,我们借鉴 LookingGlass [Chang et al. 2025] 引入了交叉残差校正(Cross Residual Correction)。我们设计了一种交叉注入策略,利用前向和后向分支的互补细节来相互恢复信息。我们计算原始 $\hat{Z}_0$ 与重编码后的 $\bar{Z}_0 = E(D(\hat{Z}_0))$ 潜在变量之间的残差:

$$ \Delta \hat{Z}_{fw}^0 = \hat{Z}_{fw}^0 – \bar{Z}_{fw}^0, \quad \Delta \hat{Z}_{bw}^0 = \hat{Z}_{bw}^0 – \bar{Z}_{bw}^0. \quad (5) $$

然后,我们将相反的残差注入到对齐后的潜在变量中:

$$ Z'_{bw}^0 = \tilde{Z}_{bw}^0 + \Delta \hat{Z}_{fw}^0, \quad Z'_{fw}^0 = \tilde{Z}_{fw}^0 + \Delta \hat{Z}_{bw}^0. \quad (6) $$

这恢复了高频细节并促进了时间共识(图 5)。最后,校正后的潜在变量通过 alpha 混合进行融合,并重新去噪以用于后续循环。

4 实验

4.1 实验设置

数据集。我们仅在 BS-ERGB [Tulyakov et al. 2021] 训练集上进行训练,该数据集因其高质量的真实世界事件数据而被选中。对于重建和预测,我们遵循 EVREAL 基准 [Ercan et al. 2023],在三个真实世界事件数据集的子集上进行评估:ECD [Mueggler et al. 2017]、MVSEC [Zhu et al. 2018] 和 HQF [Stofregen et al. 2020]。关键在于,这些序列涵盖了广泛的时间跨度,从 ECD 中的短片(约 300 帧)到 MVSEC 和 HQF 中的长期序列(分别长达 2,740 和 2,430 帧),从而评估模型在长时间段内的稳定性。对于帧插值,我们在 BS-ERGB 测试集和 HQF 数据集上进行评估。

实现细节。我们采用 CogVideoX I2V 作为后端,生成 49 帧、分辨率为 720×480 的块。在训练过程中,我们对 DiT 块应用 LoRA ($r=64$),并对第一个投影层进行全微调。训练涉及 3 次自回归展开(Autoregressive Unrolling)。在训练和推理期间均保持 20 帧的上下文。具体而言,对于推理期间历史上下文不可用的第一个块,我们应用特定任务的初始化:重建任务中起始帧潜在变量和上下文潜在变量均使用零张量;预测任务中将起始帧复制 20 次以填充上下文;帧插值任务中将起始帧和结束帧各复制 10 次以形成上下文。在所有任务中,相应的上下文事件体素(Event Voxel)均一致地进行零填充。在评估过程中,受 VDM-EVFI 启发,我们上采样输入以减轻 VAE 编码带来的细节损失。具体而言,低于模型输入分辨率的输入会被上采样以匹配其分辨率,而超过其分辨率的输入则上采样约 2 倍,并使用其提出的分块去噪和融合策略进行处理。

4.2 与最先进事件基础重建和预测方法的比较

对于重建任务,我们使用 EVREAL 的预训练权重,与最先进(SOTA)的 E2V 方法进行比较,包括 E2VID、FireNet、E2VID+、FireNet+、SPADE-E2VID、SSL-E2VID、ET-Net 和 HyperE2VID。对于预测任务,我们使用其官方 13 帧预训练权重,在正向生成设置中与 VDM-EVFI 进行比较。由于事件流缺乏绝对强度信息,为了公平比较,我们将所有生成结果的全局亮度与真实序列对齐。

如图 6 所示,第 2 行展示了序列的后期阶段,现有 SOTA 模型在这两项任务中都遭受严重的误差累积。第 3 行描绘了早期阶段;在此阶段,SOTA E2V 模型由于其循环架构的初始化限制,难以重建高质量图像。值得注意的是,VDM-EVFI 即使在序列的早期部分也表现出明显的误差累积。表 1 和图 6 均表明,我们的方法在所有三个数据集上始终优于基线方法,验证了其在处理短序列和长序列方面的优越性。更多视觉比较见图 11。

4.3 与最先进事件基础视频帧插值方法的比较

尽管我们的模型仅针对重建和预测进行训练,但我们将其扩展到事件视频帧插值(EVFI),且无需任何微调。通过利用相同的权重,我们在零样本设置下将我们的方法与专用的 SOTA 方法进行了评估。

SIGGRAPH 会议论文 '26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 6 页

6 • Fan 等

3D 𝑏𝑤𝑑 3D ҧ𝑍0 VAE ҧ𝑍0𝑓𝑤𝑑- – VAE 3 1 2 2 1 321 3 123 𝐹𝑙𝑖𝑝𝑝𝑖𝑥 𝐹𝑙𝑖𝑝𝑝𝑖𝑥 𝑓𝑤𝑑 3D 3D 𝑓𝑤𝑑 𝑓𝑤𝑑 𝑏𝑤𝑑 𝑏𝑤𝑑 3D 3D 𝑏𝑤𝑑 መ𝑍0 ሖ𝑍0 ෨𝑍0 VAE VAE + መ𝑍0 VAE VAE ෨𝑍0 + ሖ𝑍0

前向帧 翻转前向帧 翻转后向帧 后向帧

图 5. 重编码对齐与交叉残差校正。为了解决潜在空间与像素空间翻转之间差异导致的时间错位问题,我们提出了重编码对齐(Reencoding Alignment)。去噪后的潜在变量 $\hat{Z}^{fwd}_0$ 和 $\hat{Z}^{bwd}_0$ 被解码到像素空间,进行时间翻转($Flip_{pix}$),然后通过 3D VAE 重新编码以得到对齐后的潜在变量 $\tilde{Z}^{fwd}_0$ 和 $\tilde{Z}^{bwd}_0$。为了减轻这种重新编码过程中固有的信息损失,我们采用了交叉残差校正(Cross Residual Correction)。我们计算原始潜在变量与重新编码后的潜在变量之间的残差差异(例如,减法节点 $\hat{Z}^{fwd}_0 – \bar{Z}^{fwd}_0$),并将这些细节信息注入到相反的分支中。具体而言,前向残差被加到后向对齐潜在变量 $\tilde{Z}^{bwd}_0$ 上以生成最终校正后的潜在变量 $Z'^{bwd}_0$,对称地,后向残差被注入到 $\tilde{Z}^{fwd}_0$ 中以获得 $Z'^{fwd}_0$。这种对称的交叉注入机制在保留细粒度细节的同时,促进了分支间的时间一致性。浅色方框表示信息损失。

表 1. ECD [Mueggler et al. 2017]、MVSEC [Zhu et al. 2018] 和 HQF [Stoffregen et al. 2020] 上的定量结果。将我们的方法与 SOTA 基线进行比较(红色:最佳;蓝色:第二)。在重建任务中,我们始终取得了最佳的 LPIPS 分数,表明与基于回归的方法相比,我们具有更优越的感知质量。在预测任务中,我们的方法在所有指标和数据集上均显著优于 VDM-EVFI,验证了我们强大的长期生成能力。

ECD [Mueggler et al. 2017] MVSEC [Zhu et al. 2018] HQF [Stoffregen et al. 2020]

Method Venue PSNR ↑ SSIM ↑ LPIPS ↓ PSNR ↑ SSIM ↑ LPIPS ↓ PSNR ↑ SSIM ↑ LPIPS ↓

Reconstruction E2VID [Rebecq et al. 2019b] TPAMI 2019 22.40 0.690 0.177 14.84 0.354 0.576 15.06 0.522 0.362 FireNet [Scheerlinck et al. 2020] WACV 2020 20.01 0.597 0.241 15.51 0.374 0.587 13.89 0.445 0.486 E2VID+ [Stoffregen et al. 2020] ECCV 2020 22.32 0.676 0.147 16.27 0.411 0.463 15.97 0.552 0.256 FireNet+ [Stoffregen et al. 2020] ECCV 2020 21.18 0.621 0.215 15.45 0.389 0.498 15.64 0.491 0.314 SPADE-E2VID [Cadena et al. 2021] TIP 2021 19.71 0.569 0.301 15.70 0.389 0.538 13.36 0.417 0.538 SSL-E2VID [Paredes-Vallés and De Croon 2021] CVPR 2021 20.00 0.615 0.278 14.36 0.353 0.633 13.51 0.446 0.474 ET-Net [Weng et al. 2021] ICCV 2021 22.26 0.675 0.159 15.97 0.409 0.435 16.17 0.542 0.263 HyperE2VID [Ercan et al. 2024] TIP 2024 22.40 0.685 0.157 16.13 0.417 0.434 16.42 0.539 0.257 Ours – 22.28 0.708 0.139 16.83 0.440 0.405 16.45 0.603 0.240

Prediction (w/ start frame) VDM-EVFI [Chen et al. 2025a] CVPR 2025 20.33 0.614 0.244 15.46 0.276 0.668 13.52 0.373 0.520 Ours – 24.40 0.771 0.110 18.18 0.502 0.359 16.67 0.619 0.229

表 2. ERGB [Tulyakov et al. 2021] 和 HQF [Stoffregen et al. 2020] 上的插值(31 次跳过)。将我们的零样本方法与监督基线进行比较(红色:最佳;蓝色:第二),我们在 LPIPS 和泛化能力方面表现出色。与通过模糊纹理来提高 PSNR 的回归基线不同,我们的生成方法保留了高频细节。该方法是唯一能够重建清晰、可读文本的方法,而 CBMNet-Large 导致严重模糊,TLXNet+ 则产生错位和重影输出。表 2 和图 7 均证实,我们提出的零样本方法超越了专门为 EVFI 设计的现有 SOTA 方法。更多视觉比较见 Fig. 12。 Training BS-ERGB HQF

Method setting PSNR ↑ SSIM ↑ LPIPS ↓ PSNR ↑ SSIM ↑ LPIPS ↓ CBMNet-Large Supervised 24.59 0.767 0.170 24.55 0.767 0.166 TLXNet+ Supervised 18.85 0.641 0.226 17.18 0.484 0.352 Ours Zero-shot 24.40 0.744 0.124 25.39 0.800 0.105

EVFI 基线(CBMNet-Large [Kim et al. 2023] 和 TLXNet+ [Ma et al. 2024a])在插值 31 帧上的表现。 视觉比较揭示了基线方法在处理真实世界数据的大帧插值时的显著局限性。如图 7 第 1 行所示,CBMNet-Large 在动态人体运动中遭受严重的重影和颜色伪影,而 TLXNet+ 未能保持结构完整性。此外,在第 2 行中,

4.4 消融研究 基于事件的视频重建消融研究。我们在图 8 和表 3 中分析了各组件的有效性。首先,预训练先验至关重要(第 1 行);在有限数据上从头训练扩散主干网络无法收敛,产生纯噪声。其次,仅依赖事件体素而缺乏上下文机制会导致严重的误差累积和伪影(第 2 行)。第三,移除自回归展开(Autoregressive Unrolling)和自适应上下文切换(Adaptive Context Switch)(第 3 行)暴露了训练-推理域差距;使用真实上下文进行训练而使用预测结果进行推理会导致漂移,这一点由点状伪影所证实。第四,仅消融自适应上下文切换(第 4 行)

SIGGRAPH Conference Papers ’26, July 19–23, 2026, Los Angeles, CA, USA.

第 7 页

LongE2V:基于视频扩散模型的长时事件视频重建、预测与帧插值 • 7

ECD MVSEC HQF

E2VID+ HyperE2VID Ours VDM-EVFI Ours Ground Truth 重建 预测

图 6. 在 ECD [Mueggler et al. 2017]、MVSEC [Zhu et al. 2018] 和 HQF [Stoffregen et al. 2020] 数据集上的定性比较。我们的 LongE2V 恢复了高频纹理,而回归基线方法(E2VID+、HyperE2VID)则出现模糊(第 1 行)。在预测任务中,我们避免了 VDM-EVFI 中出现的严重噪声累积和重影伪影(红色箭头)(第 2–3 行),保持了优越的结构保真度和时间稳定性。

w/o BS-ERGB

HQF w/

TLXNet+ CBMNet-Large Ours GT 预训练先验 上下文 自回归展开 自适应上下文切换

图 7. BS-ERGB 和 HQF 上的零样本插值。基线方法(TLXNet+、CBMNet-Large)在大运动情况下(顶部)出现结构崩溃或模糊,而我们的 LongE2V 能够捕捉准确的动态。在细微文本上(底部),我们的重编码对齐消除了基线方法中的重影,确保了可读性。

图 8. 重建的定性消融实验。顶部:消融变体;底部:完整方法。移除预训练先验会导致噪声;移除上下文会导致结构歧义;移除自回归展开会导致点状伪影(漂移);移除自适应上下文切换会导致网格伪影。我们的方法确保了稳定且高保真的结果。

表 3. HQF 数据集上重建组件的消融实验。预训练先验对于收敛至关重要(第 1 行与第 2 行对比)。引入上下文、自回归展开、自适应上下文切换能有效缓解长期漂移(第 3、4 和 5 行),使完整方法在所有指标上均取得最佳性能。

通过强制在每个块之后进行更新会导致误差累积,如网格伪影所示。这些结果证实,每个组件对于最小化误差累积和维持稳定性都至关重要。

基于事件的视频帧插值消融实验。我们通过消融重编码对齐、交叉残差校正和事件体素数据增强来验证我们的方法(表 4,图 9)。

在没有重编码对齐的情况下,直接翻转潜在变量会导致时间错位, resulting in significantly blurred dynamic figures(显著模糊的动态人物)。这证实了我们的解码-翻转-编码过程对于空间连贯性的必要性。移除交叉残差校正会导致由于 3D VAE 信息丢失而产生的重影和半透明伪影;通过交叉注入恢复此部分对于时间共识至关重要,使 LPIPS 提升了 0.037。最后,省略事件体素数据增强使模型暴露于训练与推理之间的不匹配中,即在测试时上采样输入分辨率会稀释每个体素的事件密度,导致

SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 8 页

8 • Fan 等人

事件图像 重建 文本引导着色帧 时间 无重编码对齐 无交叉残差校正 提示:“大型中央立方结构具有彩色的野石……”

事件图像 重建 文本引导着色帧 时间 真实值 无事件体素 完整方法 密度增强 提示:“两张大型儿童道路地图地毯色彩极其丰富……”

图 9. 插值的可视化消融实验。无重编码对齐会导致潜在变量未对齐引起的鬼影;无交叉残差校正会因 VAE 损失而模糊细节;无事件体素密度增强会因密度不匹配产生伪影。我们的完整方法恢复了与真实值相比清晰、连贯的细节。

表 4. BS-ERGB 数据集上插值组件的消融实验。重编码对齐对结构保真度至关重要,而交叉残差校正提升了感知质量(LPIPS)。事件体素密度增强提高了鲁棒性,完整方法取得了优越的结果。 重编码对齐 交叉残差校正 事件体素密度增强 PSNR↑ SSIM↑ LPIPS↓ ✓ 20.58 0.670 0.202 ✓ ✓ 24.14 0.734 0.161 ✓ ✓ 22.58 0.728 0.129 ✓ ✓ ✓ 24.40 0.744 0.124 由于生成不稳定,出现颜色偏差和物理伪影,例如篮球上的黑色条纹。

4.5 文本引导事件视频着色

利用我们骨干网络 CogVideoX I2V 固有的文本引导生成能力,我们在训练中以 20% 的概率引入文本提示。这一策略使模型能够适应多模态条件设置,学习基于文本提示和事件体素合成视频。如图 10 所示,当仅提供事件体素和文本提示时,模型成功从事件数据中重建了场景的结构纹理,并根据文本描述应用着色和风格化,有效地实现了事件视频着色。

5 结论

我们提出了 LongE2V,利用视频扩散先验进行基于事件的图像重建、预测和帧插值。我们通过自回归展开和自适应上下文切换来缓解时间漂移,并使用重编码对齐和交叉残差校正确保插值的一致性。实验证实,LongE2V 在感知质量和鲁棒性方面优于最先进的方法。未来的工作将集中在加速推理以及探索用于长期一致性的高效内存机制。

致谢

本研究由台湾国家科学及技术委员会资助,项目编号为 NSTC 112-2222-E-A49-004-MY2 和 113-2628-E-A49-023-。作者感谢 Google、NVIDIA 和联发科 Inc. 的慷慨捐赠。Yu-Lun Liu 感谢台湾教育部玉山青年学者计划的支持。

参考文献

Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, 等人. 2024. Lumiere: A space-time diffusion model for video generation. In SIGGRAPH Asia 2024 Conference Papers. 1–11.

Patrick Bardow, Andrew J Davison, 和 Stefan Leutenegger. 2016. Simultaneous optical flow and intensity estimation from an event camera. In Proceedings of the IEEE conference on computer vision and pattern recognition. 884–892.

Samy Bengio, Oriol Vinyals, Navdeep Jaitly, 和 Noam Shazeer. 2015. Scheduled sampling for sequence prediction with recurrent neural networks. Advances in neural information processing systems 28 (2015).

Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, 等人. 2023a. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127 (2023).

Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, 和 Karsten Kreis. 2023b. Align your latents: High-resolution video synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 22563–22575.

Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, 等人. 2024. Video generation models as world simulators. OpenAI Blog 1, 8 (2024), 1.

Pablo Rodrigo Gantier Cadena, Yeqiang Qian, Chunxiang Wang, 和 Ming Yang. 2021. Spade-e2vid: Spatially-adaptive denormalization for event-based video reconstruction. IEEE Transactions on Image Processing 30 (2021), 2488–2500.

Pablo Rodrigo Gantier Cadena, Yeqiang Qian, Chunxiang Wang, 和 Ming Yang. 2023. Sparse-e2vid: A sparse convolutional model for event-based video reconstruction trained with real event noise. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 4150–4158.

Pascal Chang, Sergio Sancho, Jingwei Tang, Markus Gross, 和 Vinicius Azevedo. 2025. LookingGlass: Generative Anamorphoses via Laplacian Pyramid Warping. In Proceedings of the Computer Vision and Pattern Recognition Conference. 24–33.

Chen-Hao Chao, Wei-Fang Sun, Bo-Wun Cheng, Yi-Chen Lo, Chia-Che Chang, Yu-Lun Liu, Yu-Lin Chang, Chia-Ping Chen, 和 Chun-Yi Lee. 2022. Denoising likelihood score matching for conditional score-based data generation. arXiv preprint arXiv:2203.14206 (2022).

Jingxi Chen, Brandon Y Feng, Haoming Cai, Tianfu Wang, Levi Burner, Dehao Yuan, Cornelia Fermuller, Christopher A Metzler, 和 Yiannis Aloimonos. 2025a. Repurposing pre-trained video diffusion models for event-based video interpolation. In Proceedings of the Computer Vision and Pattern Recognition Conference. 12456–12466.

Jingyuan Chen, Fuchen Long, Jie An, Zhaofan Qiu, Ting Yao, Jiebo Luo, 和 Tao Mei. 2025c. Ouroboros-diffusion: Exploring consistent content generation in tuning-free long video diffusion. In Proceedings of the AAAI Conference on Artificial Intelligence,

SIGGRAPH Conference Papers ’26, 2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 9 页

LongE2V:基于视频扩散模型的长时域事件视频重建、预测与帧插值 • 9

卷 39. 2079–2087. Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, Ruiqi Gao, Alexey Gritsenko, Kanghao Chen, Hangyu Li, Jiazhou Zhou, Zeyu Wang, 和 Lin Wang. 2024b. Lase-e2v: 面向语言引导的语义感知事件到视频重建. 神经信息处理系统进展 37 (2024), 70406–70430. Diederik P Kingma, Ben Poole, Mohammad Norouzi, David J Fleet, 等. 2022a. Imagen 视频:使用扩散模型的高清视频生成. arXiv 预印本 arXiv:2210.02303 (2022).

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yife Hu, 等. 2025b. Goku:基于流的视频生成基础模型. 计算机视觉与模式识别会议论文集. 23516–23527. Jonathan Ho, Ajay Jain, 和 Pieter Abbeel. 2020. 去噪扩散概率模型. 神经信息处理系统进展 33 (2020), 6840–6851.

Shoufa Chen, Mengmeng Xu, Jiawei Ren, Yuren Cong, Sen He, Yanping Xie, Animesh Sinha, Ping Luo, Tao Xiang, 和 Juan-Manuel Perez-Rua. 2024c. Gentron:用于图像和视频生成的扩散变换器. IEEE/CVF 计算机视觉与模式识别会议论文集. 6441–6451. Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, 和 David J Fleet. 2022b. 视频扩散模型. 神经信息处理系统进展 35 (2022), 8633–8646.

Ting-Hsuan Chen, Jiewen Chan, Hau-Shiang Shiu, Shih-Han Yen, Chang-Han Yeh, 和 Yu-Lun Liu. 2024a. Narcan:集成扩散先验的自然精炼规范图像用于视频编辑. 神经信息处理系统进展 37 (2024), 36097–36120. Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, 和 Eli Shechtman. 2025. 自强制:弥合自回归视频扩散的训练-测试差距. arXiv 预印本 arXiv:2506.08009 (2025).

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, 等. 2026. Pantheon360:通过 3D 感知 360 度视频扩散驯服数字孪生生成. IEEE/CVF 计算机视觉与模式识别会议论文集. 11138–11149. Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan, Ruihan Yu, Yidan Zhang, Bo Zheng, Yu-Lun Liu, Yung-Yu Chuang, 和 Kaipeng Zhang. 2026. 生成式世界渲染器. arXiv 预印本 arXiv:2604.02329 (2026).

Weifeng Chen, Yatai Ji, Jie Wu, Hefeng Wu, Pan Xie, Jiashi Li, Xin Xia, Xuefeng Xiao, 和 Liang Lin. 2023a. Control-a-video:使用扩散模型的可控文本到视频生成. arXiv e-prints (2023), arXiv–2305. Wonjoon Jin, Qi Dai, Chong Luo, Seung-Hwan Baek, 和 Sunghyun Cho. 2025. Flovd:光流遇见视频扩散模型以增强相机控制视频合成. 计算机视觉与模式识别会议论文集. 2040–2049.

Xinyuan Chen, Yaohui Wang, Lingjun Zhang, Shaobin Zhuang, Xin Ma, Jiashuo Yu, Yali Wang, Dahua Lin, Yu Qiao, 和 Ziwei Liu. 2023b. Seine:用于生成式过渡和预测的短长视频扩散模型. 第十二届国际学习表征会议论文集. Jihwan Kim, Junoh Kang, Jinyoung Choi, 和 Bohyung Han. 2024. Fifo-diffusion:无需训练从文本生成无限视频. 神经信息处理系统进展 37 (2024), 89834–89868.

Hoonhee Cho, Taewoo Kim, Yuhwan Jeong, 和 Kuk-Jin Yoon. 2024. TTA-EVF:通过可靠的像素和样本估计进行事件视频帧插值的测试时自适应. IEEE/CVF 计算机视觉与模式识别会议论文集. 25701–25711. Taewoo Kim, Yujeong Chae, Hyun-Kurl Jang, 和 Kuk-Jin Yoon. 2023. 基于事件的视频帧插值,使用跨模态非对称双向运动场. IEEE/CVF 计算机视觉与模式识别会议论文集. 18032–18042.

Burak Ercan, Onur Eker, Aykut Erdem, 和 Erkut Erdem. 2023. Evreal:面向事件视频重建的综合基准和分析套件. IEEE/CVF 计算机视觉与模式识别会议论文集. 3943–3952. Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, 等. 2024. Hunyuanvideo:大型视频生成模型的系统框架. arXiv 预印本 arXiv:2412.03603 (2024).

Burak Ercan, Onur Eker, Canberk Saglam, Aykut Erdem, 和 Erkut Erdem. 2024. Hyperi2vid:通过超网络改进基于事件的视频重建. IEEE 图像处理汇刊 33 (2024), 1826–1837. Alex M Lamb, Anirudh Goyal ALIAS PARTH GOYAL, Ying Zhang, Saizheng Zhang, Aaron C Courville, 和 Yoshua Bengio. 2016. 教授强制:一种训练循环网络的新算法. 神经信息处理系统进展 29 (2016).

Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, 和 Anastasia Germanidis. 2023. 结构和内容引导的视频合成与扩散模型. IEEE/CVF 国际计算机视觉会议论文集. 7346–7356. Jinxiu Liang, Bohan Yu, Yixin Yang, Yiming Han, 和 Boxin Shi. 2024. E2VIDiff:使用扩散先验的感知事件到视频重建. arXiv 预印本 arXiv:2407.08231 (2024).

Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, 等. 2024. 扩展整流流变换器以实现高分辨率图像合成. 第四十一届国际机器学习会议. Yuhan Liu, Yongjian Deng, Hao Chen, Bochen Xie, Youfu Li, 和 Zhen Yang. 2024b. 基于边缘引导的运动细化进行基于事件的视频帧插值. arXiv 预印本 arXiv:2404.18156 (2024).

Haiwen Feng, Zheng Ding, Zhihao Xia, Simon Niklaus, Victoria Abrevaya, Michael J Black, 和 Xuaner Zhang. 2024. 时空探索性插值. 欧洲计算机视觉会议. Springer, 378–395. Yuhan Liu, Yongjian Deng, Hao Chen, 和 Zhen Yang. 2024a. 基于事件参考的直接合成进行视频帧插值. IEEE/CVF 计算机视觉与模式识别会议论文集. 8477–8487.

Guillermo Gallego, Tobi Delbrück, Garrick Orchard, Chiara Bartolozzi, Brian Taba, Andrea Censi, Stefan Leutenegger, Andrew J Davison, Jörg Conradt, Kostas Daniilidis, 等. 2020. 事件视觉:综述. IEEE 模式分析与机器智能汇刊 44, 1 (2020), 154–180. Yuhan Liu, LingHui Fu, Zhen Yang, Hao Chen, Youfu Li, 和 Yongjian Deng. 2025. EPA:通过感知对齐学习提升基于事件的视频帧插值. 第三十九届神经信息处理系统年会. https://openreview.net/forum?id=zxZPpVoCNO

Daniel Geng, Charles Herrmann, Junhwa Hur, Forrester Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, Yusuf Aytar, Michael Rubinstein, Chen Sun, 等. 2025. 运动提示:使用运动轨迹控制视频生成. 计算机视觉与模式识别会议论文集. 1–12. Yu-Lun Liu, Yi-Tung Liao, Yen-Yu Lin, 和 Yung-Yu Chuang. 2019. 使用循环帧生成的深度视频帧插值. 人工智能会议论文集, 第 33 卷. 8794–8802.

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, 和 Dahua Lin. 2025. 通过自重采样实现自回归视频扩散的端到端训练. arXiv 预印本 arXiv:2512.15702 (2025). Yu Lu, Yuanzhi Liang, Linchao Zhu, 和 Yi Yang. 2024. Freelong:使用光谱混合时间注意力的免训练长视频生成. 神经信息处理系统进展 37 (2024), 131434–131455.

Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, 和 Bo Dai. 2023. Animatediff:无需特定微调即可动画化您的个性化文本到图像扩散模型. arXiv 预印本 arXiv:2307.04725 (2023). Wan-Duo Kurt Ma, John P Lewis, 和 W Bastiaan Kleijn. 2024b. Trailblazer:基于扩散的视频生成的轨迹控制. SIGGRAPH Asia 2024 会议论文集. 1–11.

Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, 和 Ceyuan Yang. 2024. Cameractrl:启用文本到视频生成的相机控制. arXiv 预印本 arXiv:2404.02101 (2024). Xin Ma, Yaohui Wang, Xinyuan Chen, Gengyun Jia, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, 和 Yu Qiao. 2024c. Latte:用于视频生成的潜在扩散变换器. arXiv 预印本 arXiv:2401.03048 (2024).

Weihua He, Kaichao You, Zhendong Qiao, Xu Jia, Ziyang Zhang, Wenhui Wang, Huchuan Lu, Yaoyuan Wang, 和 Jianxing Liao. 2022. Timereplayer:释放事件相机在视频插值中的潜力. IEEE/CVF 计算机视觉与模式识别会议论文集. 17804–17813. Yongrui Ma, Shi Guo, Yutian Chen, Tianfan Xue, 和 Jinwei Gu. 2024a. Timelens-xl:具有大运动量的实时基于事件的视频帧插值. 欧洲计算机视觉会议. Springer, 178–194.

Chong Mou, Xintao Wang, Liangbin Xie, Yanze Wu, Jian Zhang, Zhongang Qi, 和 Ying Shan. 2024. T2i-adapter:学习适配器以挖掘文本到图像扩散模型中更多的可控能力. 人工智能会议论文集, 第 38 卷. 4296–4304. Elias Mueggler, Henri Rebecq, Guillermo Gallego, Tobi Delbruck, 和 Davide Scaramuzza. 2017. 事件相机数据集和模拟器:用于姿态估计、视觉里程计和 SLAM 的事件数据. 国际机器人研究杂志 36, 2 (2017), 142–149.

Gottfried Munda, Christian Reinbacher, 和 Thomas Pock. 2018. 使用流形正则化的事件相机实时强度图像重建. 国际计算机视觉杂志 126, 12 (2018), 1381–1393.

Roberto Henschel, Levon Khachatryan, Hayk Poghosyan, Daniil Hayrapetyan, Vahram Koichi Namekata, Sherwin Bahmani, Ziyi Wu, Yash Kant, Igor Gilitschenski, 和 Tadevosyan, Zhangyang Wang, Shant Navasardyan, 以及 Humphrey Shi. 2025. David B Lindell. 2024. Sg-i2v: Self-guided trajectory control in image-to-video Streamingt2v: Consistent, dynamic, and extendable long video generation from text. generation. arXiv preprint arXiv:2411.04989 (2024). In Proceedings of the Computer Vision and Pattern Recognition Conference. 2568–2577.

SIGGRAPH Conference Papers ’26, July 19–23, 2026, Los Angeles, CA, USA.

第 10 页

10 • Fan 等人

Muyao Niu, Xiaodong Cun, Xintao Wang, Yong Zhang, Ying Shan, 和 Yinqiang Xiang Wang, Hangjie Yuan, Shiwei Zhang, Dayou Chen, Jiuniu Wang, Yingya Zhang, Zheng. 2024. Mofa-video: 通过生成运动场在冻结的图像到视频扩散模型中进行可控图像动画 适配。在欧洲计算机视觉会议 (European Conference on Computer Vision). Springer, 111–128。 Genady Paikin, Yotam Ater, Roy Shaul, 和 Evgeny Soloveichik. 2021. Efi-net: 融合事件与帧的视频 帧插值。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition). 1291–1301。 Federico Paredes-Vallés 和 Guido CHE De Croon. 2021. 回归事件基础:通过光度 恒常性对事件相机进行图像重建的自监督学习。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 3446–3455。 Haonan Qiu, Menghan Xia, Yong Zhang, Yingqing He, Xintao Wang, Ying Shan, 和 Ziwei Liu. 2023. Freenoise: 通过噪声重调度实现无需调参的长视频扩散。 arXiv 预印本 arXiv:2310.15169 (2023)。 Henri Rebecq, Daniel Gehrig, 和 Davide Scaramuzza. 2018. Esim: 一个开源事件 相机模拟器。在机器人学习会议 (Conference on robot learning). PMLR, 969–982。 Henri Rebecq, René Ranftl, Vladlen Koltun, 和 Davide Scaramuzza. 2019a. 事件 到视频:将现代计算机视觉引入事件相机。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 3857–3866。 Henri Rebecq, René Ranftl, Vladlen Koltun, 和 Davide Scaramuzza. 2019b. 使用事件相机进行高速 和高动态范围视频拍摄。IEEE 模式分析与机器智能汇刊 (IEEE transactions on pattern analysis and machine intelligence) 43, 6 (2019), 1964–1980。 Cedric Scheerlinck, Nick Barnes, 和 Robert Mahony. 2018. 使用事件相机进行连续时间强度 估计。在亚洲计算机视觉会议 (Asian Conference on Computer Vision). Springer, 308–324。 Cedric Scheerlinck, Henri Rebecq, Daniel Gehrig, Nick Barnes, Robert Mahony, 和 Davide Scaramuzza. 2020. 使用事件相机进行快速图像重建。在 IEEE/CVF 计算机视觉应用冬季会议论文集 (Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision). 156–163。 Chenyang Shi, Hanxiao Liu, Jing Jin, Wenzhuo Li, Yuzhen Li, Boyi Wei, 和 Yibo Zhang. 2023. IDO-VFI: 通过光流引导识别动态以实现带事件的视频帧插值。arXiv 预印本 arXiv:2305.10198 (2023)。 Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Po-Fan Yu, Yu-Chih Chen, 和 Yu-Lun Liu. 2025. Stream-DiffVSR: 通过自回归扩散实现低延迟可流式视频 超分辨率。arXiv 预印本 arXiv:2512.23709 (2025)。 Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, 等人. 2022. Make-a-video: 无需文本-视频数据 的文本到视频生成。arXiv 预印本 arXiv:2209.14792 (2022)。 Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, 和 Ben Poole. 2020. 通过随机微分方程进行基于分数的生成建模。arXiv 预印本 arXiv:2011.13456 (2020)。 Timo Stoffregen, Cedric Scheerlinck, Davide Scaramuzza, Tom Drummond, Nick Barnes, Lindsay Kleeman, 和 Robert Mahony. 2020. 缩小事件相机的仿真到现实差距。在欧洲计算机视觉会议 (European Conference on Computer Vision). Springer, 534–549。 Lei Sun, Daniel Gehrig, Christos Sakaridis, Mathias Gehrig, Jingyun Liang, Peng Sun, Zhijie Xu, Kaiwei Wang, Luc Van Gool, 和 Davide Scaramuzza. 2024. 一种统一的 框架,用于在野外进行带临时去模糊的事件帧插值。 IEEE 模式分析与机器智能汇刊 (IEEE Transactions on Pattern Analysis and Machine Intelligence) (2024)。 Lei Sun, Christos Sakaridis, Jingyun Liang, Peng Sun, Jiezhang Cao, Kai Zhang, Qi Jiang, Kaiwei Wang, 和 Luc Van Gool. 2023. 带临时去模糊的事件帧插值。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 18043–18052。 Genmo Team. 2024. Mochi 1. https://github.com/genmoai/models. Stepan Tulyakov, Alfredo Bochicchio, Daniel Gehrig, Stamatios Georgoulis, Yuanyou Li, 和 Davide Scaramuzza. 2022. Time lens++: 基于参数非线性流和多尺度融合的事件帧插值。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 17755–17764。 Stepan Tulyakov, Daniel Gehrig, Stamatios Georgoulis, Julius Erbach, Mathias Gehrig, Yuanyou Li, 和 Davide Scaramuzza. 2021. Time lens: 基于事件的视频帧 插值。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition). 16155–16164。 Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等人. 2025. Wan: 开放且先进的大规模 视频生成模型。arXiv 预印本 arXiv:2503.20314 (2025)。 Cong Wang, Jiaxi Gu, Panwen Hu, Haoyu Zhao, Yuanfan Guo, Jianhua Han, Hang Xu, 和 Xiaodan Liang. 2024a. Easycontrol: 将 ControlNet 迁移至视频扩散以实现 可控生成和插值。arXiv 预印本 arXiv:2408.13005 (2024)。 Jiawei Wang, Yuchen Zhang, Jiaxin Zou, Yan Zeng, Guoqiang Wei, Liping Yuan, 和 Hang Li. 2024d. Boximator: 为视频合成生成丰富且可控的运动。 arXiv 预印本 arXiv:2402.01566 (2024)。 Yujun Shen, Deli Zhao, 和 Jingren Zhou. 2023. Videocomposer: 组合式 视频合成,具备运动可控性。神经信息处理系统进展 (Advances in Neural Information Processing Systems) 36 (2023), 7594–7611。 Zipeng Wang, Yunfan Lu, 和 Lin Wang. 2024b. 重新审视事件生成模型: 使用隐式神经表示进行事件到视频重建的自监督学习。在欧洲计算机视觉会议 (European Conference on Computer Vision). Springer, 321–339。 Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ping Luo, 和 Ying Shan. 2024c. Motionctrl: 用于视频生成的统一且灵活的运动控制器。 在 ACM SIGGRAPH 2024 会议论文集 (ACM SIGGRAPH 2024 Conference Papers). 1–11。 Wenming Weng, Yueyi Zhang, 和 Zhiwei Xiong. 2021. 基于 Transformer 的事件视频重建。 在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision). 2563–2572。 Song Wu, Kaichao You, Weihua He, Chen Yang, Yang Tian, Yaoyuan Wang, Ziyang Zhang, 和 Jianxing Liao. 2022. 通过事件驱动的各向异性 光流调整进行视频插值。在欧洲计算机视觉会议 (European Conference on Computer Vision). Springer, 267–283。 Weijia Wu, Zhuang Li, Yuchao Gu, Rui Zhao, Yefei He, David Junhao Zhang, Mike Zheng Shou, Yan Li, Tingting Gao, 和 Di Zhang. 2024. Draganything: 使用实体表示进行 任何内容的运动控制。在欧洲计算机视觉会议 (European Conference on Computer Vision). Springer, 331–348。 Zeqi Xiao, Yifan Zhou, Shuai Yang, 和 Xingang Pan. 2024. 视频扩散模型 是无训练的运动解释器和控制器。神经信息处理系统进展 (Advances in Neural Information Processing Systems) 37 (2024), 76115–76138。 Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuan- ming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等人. 2024. Cogvideox: 具有专家 Transformer 的 文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072 (2024)。 Chang-Han Yeh, Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Ting-Hsuan Chen, 和 Yu-Lun Liu. 2024. Diffir2vr-zero: 使用基于扩散的图像恢复模型进行零样本视频恢复。arXiv 预印本 arXiv:2407.01519 (2024)。 Shengming Yin, Chenfei Wu, Huan Yang, Jianfeng Wang, Xiaodong Wang, Minheng Ni, Zhengyuan Yang, Linjie Li, Shuguang Liu, Fan Yang, 等人. 2023. Nuwa-xl: 扩散 上的扩散用于极长视频生成。在计算语言学协会第 61 届年会论文集 (Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics) (第 1 卷:长论文)。 1309–1320。 Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, 和 Xun Huang. 2025. 从缓慢的双向到快速的自回归 视频扩散模型。在计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference). 22963–22974。 Jaehoon Yoo, Semin Kim, Doyup Lee, Chiheon Kim, 和 Seunghoon Hong. 2023. 迈向 使用内存高效双向 Transformer 进行长视频端到端生成建模。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 22888–22897。 Chi Zhang, Xiang Zhang, Chenxu Jiang, Gui-Song Xia, 和 Lei Yu. 2025b. EVDI++: 基于自监督学习的事件视频去模糊与插值。arXiv 预印本 arXiv:2509.08260 (2025)。 Lvmin Zhang 和 Maneesh Agrawala. 2025. 在视频生成的下一帧预测模型中打包输入帧上下文。arXiv 预印本 arXiv:2504.12626 (2025)。 Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala. 2023. 向文本到图像扩散模型添加条件控制。在 IEEE/CVF 国际 计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision). 3836–3847。 Xiang Zhang 和 Lei Yu. 2022. 统一运动去模糊与基于事件的帧插值。 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition). 17765–17774。 Zhenghao Zhang, Junchao Liao, Menghao Li, Zuozhuo Dai, Bingxue Qiu, Siyu Zhu, Long Qin, 和 Weizhi Wang. 2025a. Tora: 用于视频生成的轨迹导向扩散 Transformer。 在计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference). 2063–2073。 Zelin Zhang, Anthony J Yezzi, 和 Guillermo Gallego. 2022. 将基于事件的 图像重建公式化为使用光流的深度正则化的线性逆问题。IEEE 模式分析与机器智能汇刊 (IEEE Transactions on Pattern Analysis and Machine Intelligence) 45, 7 (2022), 8372–8389。 Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, 和 Chunhua Shen. 2024. Moviedreamer: 用于连贯长视觉序列的分层生成。arXiv 预印本 arXiv:2407.16655 (2024)。 Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, 和 Yang You. 2024. Open-sora: 使高效 视频生产大众化。arXiv 预印本 arXiv:2412.20404 (2024)。 Shangchen Zhou, Peiqing Yang, Jianyi Wang, Yihang Luo, 和 Chen Change Loy. 2024.

Lin Wang, Yo-Sung Ho, Kuk-Jin Yoon 等. 2019. 基于条件生成式对抗网络的事件驱动高动态范围图像超分辨率与超高帧率视频生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中。10081–10090.

Upscale-a-video: Temporal-consistent diffusion model for real-world video super-resolution. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中。2535–2545.

Alex Zihao Zhu, Dinesh Thakur, Tolga Özaslan, Bernd Pfrommer, Vijay Kumar, 和 Kostas Daniilidis. 2018. 多车辆立体事件相机数据集:一个事件

SIGGRAPH 会议论文 ’26,2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 11 页

LongE2V:基于视频扩散模型的长时程事件视频重建、预测与帧插值 • 11

表 6. 3D 感知相机数据集上 VBench 主体一致性定量比较。IEEE 机器人与自动化快报 3, 3 (2018), 2032–2039. HQF 数据集。

Lin Zhu, Siwei Dong, Jianing Li, Tiejun Huang, and Yonghong Tian. 2020. Retina-like visual image reconstruction via spiking neural model. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 1438–1446.

Lin Zhu, Xiao Wang, Yi Chang, Jianing Li, Tiejun Huang, and Yonghong Tian. 2022. Event-based video reconstruction via potential-assisted spiking neural network. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 3594–3604.

Lin Zhu, Yunlong Zheng, Yijun Zhang, Xiao Wang, Lizhi Wang, and Hua Huang. 2024. Temporal Residual Guided Diffusion Framework for Event-Driven Video Reconstruction. In European Conference on Computer Vision. Springer, 411–427.

方法 | 主体一致性 ↑ —|— E2VID+ (Recon) | 0.5413 HyperE2VID (Recon) | 0.4953 Ours (Recon) | 0.7204 VDM-EVFI (Pred) | 0.6279 Ours (Pred) | 0.7187

A 局限性

当输入事件流高度稀疏或质量较差时,我们的方法难以重建高质量帧,如图 13 (a) 所示。此外,图 13 (b) 表明我们的方法对事件条件中的噪声敏感;具体而言,“热点像素”(hot pixel)经常错误地保留或放大在重建帧中。

B 不同骨干网络的消融实验

为了证明我们方法的有效性,我们将其与 Wan 2.2 5B 模型集成,并按照表 3 中的设置进行了消融研究。如表 5 所示,每个组件的增量添加都带来了持续的性能提升,证明我们的方法在不同骨干网络上均有效。

表 5. HQF 数据集上不同骨干网络的消融实验。

| 预训练先验 | 自适应上下文 | 自回归展开 | 上下文切换 | PSNR↑ | SSIM↑ | LPIPS↓ | | :— | :— | :— | :— | :— | :— | :— | | ✓ | ✓ | ✓ | | 9.29 | 0.032 | 0.687 | | ✓ | | | | 13.97 | 0.426 | 0.395 | | ✓ | ✓ | | | 15.20 | 0.534 | 0.316 | | ✓ | ✓ | ✓ | | 15.55 | 0.526 | 0.304 | | ✓ | ✓ | ✓ | ✓ | 15.50 | 0.549 | 0.286 |

C 长期时间一致性

为了验证我们的改进源于长期稳定性,而不仅仅是 DiT 骨干网络带来的图像质量提升,我们使用 VBench 评估主体一致性。如表 6 所示,我们的重建和预测变体均显著优于现有方法。值得注意的是,Ours (Recon) 取得了 0.7204 的分数,大幅领先于 VDM-EVFI。这些结果表明,我们的框架有效地在长序列中保持了身份和结构完整性,成功缓解了时间漂移。

D 更多实现细节

我们采用 CogVideoX I2V 作为骨干网络,以 720 × 480 的分辨率生成 49 帧片段,对 DiT 块应用秩为 $r=64$ 的低秩自适应(LoRA),并完全微调第一投影层。该模型在 NVIDIA RTX PRO 6000 GPU 上使用 AdamW 优化器进行训练,采用余弦学习率调度器,学习率为 0.003,权重衰减为 0.01,批量大小为 1,梯度累积步数为 4 步。我们的训练策略结合了自回归展开(Autoregressive Unrolling),从 3,000 步的真实值上下文开始,随后进行三个迭代周期,每个周期使用模型自身的先前推理结果作为上下文训练 3,000 步。

在推理过程中,我们保持 20 帧的上下文。具体而言,对于历史上下文不可用的第一个推理块,我们应用任务特定的初始化:重建任务中,起始帧潜变量和上下文潜变量均使用零张量;预测任务中,将起始帧复制 20 次以填充上下文;帧插值任务中,将起始帧和结束帧各复制 10 次以形成上下文。在所有任务中,相应的上下文事件体素(Event Voxel)均持续进行零填充。在重建和预测任务的第二个块开始,直到序列完成,前一个块的最后一帧作为当前块的第一帧。对于我们的所有重建和预测实验,自适应上下文切换(Adaptive Context Switching)阈值设置为 0.05。在帧插值任务中,我们执行 alpha 混合以融合前向和后向潜变量,使用从 1:0 到 0:1 的线性权重过渡,该过渡与距起始帧和结束帧的时间距离成正比。最后,对于 BS-ERGB 数据集上的帧插值,我们遵循 VDM-EVFI 的分块去噪与融合策略,将输入上采样至 1952 × 1264——约为原始分辨率的两倍——以保留起始帧和结束帧中的精细空间细节。虽然我们的模型本质上产生 RGB 输出,但在评估时我们将其转换为灰度,以与特定数据集的真实值格式保持一致并确保公平比较。

E 推理速度

为了评估计算效率,我们将我们方法的推理速度与 E2VID(用于重建)和 VDM-EVFI(用于预测)进行了比较。对于我们的方法和 VDM-EVFI,推理速度通过将生成单个块所需的时间除以该生成过程中产生的帧数来计算。具体而言,我们的方法每个块生成 49 帧,而 VDM-EVFI 每个块生成 13 帧。对于 E2VID,速度基于单帧生成时间进行测量。实验在 NVIDIA RTX A6000 GPU 上进行,不包括预处理和后处理时间。在此实验中,我们评估了 HQF 数据集中 bike_bay_hdr 序列的性能。为了确保稳态测量并考虑初始化开销,我们报告了我们的方法和 VDM-EVFI 的第二个块生成速度,以及 E2VID 的第二帧生成速度。如表 7 所示,虽然我们的方法表现出更高的

SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 12 页

12 • Fan 等人

ECD

ECD

ECD

MVSEC

MVSEC

MVSEC

HQF

HQF

HQF

HQF

E2VID+ HyperE2VID 本文方法 VDM-EVFI 本文方法 真实值

重建结果 预测结果

图 11. 在 ECD [Mueggler 等人 2017]、MVSEC [Zhu 等人 2018] 和 HQF 数据集 [Stoffregen 等人 2020] 上的额外定性比较。 SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 13 页

LongE2V:基于视频扩散模型的长时事件视频重建、预测与帧插值 • 13

BS-ERGB

BS-ERGB

BS-ERGB

HQF

HQF

HQF

TLXNet+ CBMNet-Large Ours GT

图 12. 在 BS-ERGB [Tulyakov et al. 2021] 和 HQF [Stoffregen et al. 2020] 数据集上的额外零样本插值结果。 SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 14 页

14 • Fan 等人

事件图像 重建结果 事件图像 重建结果 (a) 稀疏事件 (b) 热点像素

图 13. 局限性。(a) 在稀疏或低质量事件流下的失败案例。(b) 对噪声的敏感性,其中“热点像素”在重建帧中被保留或放大。

表 7. 推理速度对比。 数据集规模。

我们的模型在 BS-ERGB 训练集上进行训练,该数据集包含 方法 推理速度 (秒/帧) 7,636 帧。为了评估其在重建和预测方面的性能,我们使用了 E2VID 0.0024 EVREAL 基准测试,其中包括 ECD VDM-EVFI 5.4483 (1,855 帧)、MVSEC (11,321 帧) 和 HQF (15,499 帧) ours 3.5964 数据集。对于帧插值任务,评估是在完整的 HQF 数据集 (15,513 帧) 和 BS-ERGB 测试集 (4,546 帧) 上进行的。尽管是在相对小规模的 BS- 与基于非扩散方法的 E2VID 相比,其延迟较高,但它显著 ERGB 数据集上训练,我们的模型在这些多样化的基准测试中 优于 VDM-EVFI,证明了其在基于扩散的框架中具有更优越的效 都取得了强劲的结果,展示了其强大的泛化能力。 率。

SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

发表评论