AniGS:连接渲染与扩散先验的3D场景动画方法

三分钟导读:AniGS通过迭代数据集-模型更新策略和组合视频到视频细化,利用预训练视频扩散模型为静态3D高斯溅射(3DGS)重建添加自然的场景级环境动态,同时保持静态区域稳定。

英文题目:AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

论文出处:arXiv 每日论文精选 · arXiv:2607.18539

原始论文:PDF / 论文页面

对应视频标题:AniGS:连接渲染与扩散先验的3D场景动画方法|推荐指数:★★★★★

这篇论文解决什么问题?

现有的3D重建方法生成的场景通常是静态的,缺乏使环境具有沉浸感的环境动态(如植被运动),且现有动画方法多局限于物体中心或小区域,难以扩展到大型、杂乱、可导航的场景。

核心创新

  • 提出AniGS用于场景级3D动画,针对非物体中心、杂乱且可导航的场景。
  • 设计迭代数据集-模型更新策略,通过逐步生成和整合多视角动画监督,将3D场景动画训练扩展到大型场景。
  • 设计组合视频到视频细化方案(ComposedV2V),引导视频扩散模型仅在期望区域合成运动,同时保持静态内容不变。

方法概览

AniGS使用规范3DGS表示场景几何和外观,使用时变形场建模运动。通过迭代数据集-模型更新策略,逐步扩展视角覆盖,并利用预训练视频扩散模型生成伪监督数据。引入ComposedV2V模块,通过静态掩码将静态区域像素固定,防止扩散模型在静态区域引入伪影,仅对感兴趣区域进行动画合成。

逐图理解论文

方法概览:AniGS框架

方法概览:AniGS框架
Fig. 1. 3D Scene Animation. Given a static 3D scene (top-left) reconstructed with 3D Gaussian Splatting (3DGS), our AniGS method synthesizes an animated 3D scene consisting of ambient motion that supports novel view video rendering. For each example rendered view, we highlight regions of interest and visualize the induced dynamics using space–time slices (𝑥/𝑦–𝑡), showing natural motion in foliage.

AniGS使用规范3DGS表示几何与外观,通过变形场建模运动。核心在于迭代数据集-模型更新策略,逐步扩展视角覆盖,并利用预训练视频扩散模型生成伪监督数据,实现场景级动画。

创新二:ComposedV2V模块

创新二:ComposedV2V模块
Fig. 3. Composed Video-to-Video (ComposedV2V). Slight motion intro- duced by the video diffusion model in stationary regions can be amplified over the iterative dataset–model update process. We therefore propose ComposedV2V to re-stabilize the static region in each dataset update. Given a rendered (camera-fixed) video, we estimate the dynamic mask from the first frame, and create the composed video by copying the static pixels of the first frame to all subsequent frames (Eq. (8)). Intuitively, this enforces stability in stationary areas. Conditioning on the text prompt 𝑙and noise 𝜖, we apply the video diffusion model V to obtain the refined video.

为防止扩散模型在静态区域引入伪影,AniGS引入ComposedV2V模块。该模块通过静态掩码固定静态区域像素,仅对感兴趣区域进行动画合成,确保静态内容在时间维度上的稳定性。

实验设置:数据集与基线

实验设置:数据集与基线
Fig. 6. Qualitative comparisons. We present the novel view rendering results produced by different approaches: ours, Gaussians2life [30] and Phys- Dreamer [39]. The synthesized dynamics is shown using space-time slices.

我们在五个真实世界大型户外场景及DL3DV公开基准上进行评估。对比基线包括Gaussians2Life和PhysDreamer,后者倾向于全局场景偏移,而AniGS专注于局部植被动态等环境细节。

结果:FVD指标优势

结果:FVD指标优势
Table 1. Quantitative evaluation (FVD). We report the FVD (↓) score computed using various video diffusion models: LTX, Cosmos, and Dynami- Crafter. The best performance is in bold.

在自建场景中,AniGS的FVD-LTX平均得分为415.89,显著优于Gaussians2Life的902.03和PhysDreamer的839.46。在DL3DV场景中,AniGS得分为381.48,同样大幅领先,证明其生成视频质量更高。

结果:多视角一致性

结果:多视角一致性
Table 3. Multiview consistency of generated videos. We evaluate mul- tiview consistency by training a 3DGS from generated multiview images at a novel timestep and reporting PSNR.

通过训练3DGS并报告PSNR评估多视角一致性。在Fireplace场景中,AniGS生成的新视角重建PSNR为25.94,接近原始捕获的27.40,表明生成的视频在空间上具有良好的一致性。

实验与关键结果

  • 在五个真实世界的大型户外场景(Fireplace, Garden, Flowers, Forest, Trail)上进行评估。
  • 在DL3DV公开基准测试的户外场景上进行评估。
  • 与Gaussians2Life和PhysDreamer两种基线方法进行对比。
  • 进行用户研究,评估运动真实感和视觉质量。
  • 进行消融实验,验证数据集-模型更新、视角扩展和ComposedV2V模块的有效性。
  • 评估生成视频的多视角一致性(通过训练3DGS并报告PSNR)。
  • 在五个自建场景中,AniGS的FVD-LTX平均得分为415.89,优于Gaussians2Life (902.03) 和 PhysDreamer (839.46)。(第 7 页)
  • 在DL3DV场景中,AniGS的FVD-LTX平均得分为381.48,优于Gaussians2Life (793.26) 和 PhysDreamer (814.49)。(第 7 页)
  • 在多视角一致性评估中,AniGS生成的新视角3DGS重建PSNR接近原始捕获(例如Fireplace场景:原始27.40 vs AniGS 25.94)。(第 7 页)
  • 用户研究中,AniGS在运动真实感和视觉质量上均显著优于基线方法(例如Fireplace场景,运动真实感偏好率91.7% vs GS2Life,89.6% vs PhysDreamer)。(第 8 页)
  • 消融实验显示,移除数据集-模型更新导致FVD-LTX平均得分从415.89恶化至533.55;移除视角扩展恶化至501.42;移除ComposedV2V恶化至441.69。(第 8 页)

阅读时需要注意

  • 无法合成大型、不可逆的动态变化(如树叶掉落、树枝断裂)。
  • 难以处理引起全局外观/色调剧烈变化的强延时效果(如昼夜交替、季节变化),会导致明显伪影。
  • 依赖预训练视频扩散模型,可能引入静态区域的轻微运动伪影,需通过ComposedV2V缓解。
  • 训练时间较长(约7.3小时/场景,1 GPU)。
  • 需要高质量的静态3DGS重建作为输入。
  • ComposedV2V依赖SAM2进行静态掩码估计,掩码质量影响最终效果。

关联工作

  • Gaussians2Life:基线方法,通过扩散引导和3D高斯变形实现静态3DGS动画,但局限于物体中心或小区域。(第 3 页)
  • PhysDreamer:基线方法,将扩散预测的运动蒸馏到物理模拟参数中,倾向于全局场景偏移而非局部植被动态。(第 3 页)
  • AmbientGS:相关工作,使用时变3D表示和时变变形场建模动态场景,但需要动态观测数据。(第 2 页)
  • DreamGaussian4D:相关工作,从文本/图像生成4D内容,但通常从头生成而非动画现有静态重建。(第 3 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

AniGS:连接渲染与扩散先验以实现3D场景动画

YEN-CHI CHENG∗,美国伊利诺伊大学厄巴纳-香槟分校 CHEN GAO,Waymo,美国 CHUHAN CHEN,卡内基梅隆大学,美国 TUOTUO LI,Meta,美国 RAJVI SHAH,Meta,美国 AYUSH SARAF,Meta,美国 CHANGIL KIM,Meta,美国 LIANGYAN GUI,美国伊利诺伊大学厄巴纳-香槟分校 ALEXANDER SCHWING,美国伊利诺伊大学厄巴纳-香槟分校 JOHANNES KOPF,Meta,美国 HUNG-YU TSENG,Waymo,美国

输入:静态3D场景重建 输出:动态新视角合成 2026 y t x Jul t 20 x t t y t x y t Fig. 1. 3D场景动画。给定使用3D高斯溅射(3D Gaussian Splatting, 3DGS)重建的静态3D场景(左上角),我们的AniGS方法合成一个包含支持新视角视频渲染的环境运动的动画3D场景。对于每个渲染视图示例,我们突出显示感兴趣区域,并使用时空切片(𝑥/𝑦–𝑡)可视化由此产生的动态,展示树叶的自然运动。 ∗本文工作是在Meta实习期间完成的。 对大型且复杂的重建场景进行新视角渲染正变得日益逼真。然而,大多数重建结果仍然是静态的,缺乏使环境具有沉浸感的环境运动。我们提出 作者联系方式:Yen-Chi Cheng,美国伊利诺伊州香槟-厄巴纳,伊利诺伊大学厄巴纳-香槟分校;Chen Gao,美国华盛顿州贝尔维尤,Waymo;Chuhan Chen,美国宾夕法尼亚州匹兹堡,卡内基梅隆大学;arXiv:2607.18539v1 Tuotuo Li,美国华盛顿州贝尔维尤,Meta;Rajvi Shah,美国华盛顿州贝尔维尤,Meta;Ayush Saraf,美国华盛顿州贝尔维尤,Meta;Changil Kim,美国华盛顿州贝尔维尤,Meta;Liangyan Gui,美国伊利诺伊州香槟-厄巴纳,伊利诺伊大学厄巴纳-香槟分校;Alexander Schwing,美国伊利诺伊州香槟-厄巴纳,伊利诺伊大学厄巴纳-香槟分校;Johannes Kopf,美国华盛顿州贝尔维尤,Meta;Hung-Yu Tseng,美国华盛顿州贝尔维尤,Waymo。 © 2026 版权所有归所有者/作者。出版权授权给ACM。 ACM XXXX-XXXX/2026/7-ART 允许免费制作本作品全部或部分内容的数字或纸质副本用于个人或课堂教学使用,前提是副本不制作或分发,且副本上保留此通知并完整引用第一页。对于由作者以外的其他人拥有的本作品组件的版权,必须予以尊重。在注明出处的情况下允许摘要。否则复制、重新发布、上传至服务器或重新分发至列表,需要事先获得特定许可和/或付费。请从 permissions@acm.org 请求权限。 https://doi.org/10.1145/nnnnnnn.nnnnnnn , 第1卷,第1期,文章。出版日期:2026年7月。

第 2 页

2 • Cheng 等人

AniGS,一种用于 3D 高斯溅射 (3DGS) 重建的场景级动画方法 为了实现场景级动画,我们引入了 AniGS,这是一种从静态 3DGS 重建中生成包含环境运动的动画 3D 场景的方法。AniGS 使用规范 3DGS 来表示场景的几何结构和外观,并使用时间条件形变场 [25] 来建模合成的运动。我们利用预训练的视频扩散模型 [4] 来提供运动线索。为了克服视频扩散模型的局限性并一致地动画化整个 3D 场景,我们设计了一种迭代的数据集-模型更新方法 [5],采用增量视角扩展策略。具体而言,在每次迭代中,我们首先添加一个靠近数据集中现有视角的视角。然后,我们使用视频扩散模型,通过“渲染与细化”方法更新数据集中所有视角的相机固定视频。最后,更新后的视频被用作训练数据来优化规范 3DGS 和形变场。我们重复这一数据集-模型更新循环,直到场景被完全覆盖并实现动画化。

此外,我们观察到视频扩散模型会在静态区域引入轻微运动,这会导致最终动画场景中出现明显的伪影。我们通过组合视频到视频细化来解决这个问题,该方法将运动限制在期望的区域,同时保持场景的静态部分。

我们在五个真实世界的大规模、杂乱户外场景上评估了所提出的方法。定性和定量结果表明,AniGS 1) 在适当区域添加了自然的动态效果,2) 渲染了高质量的新视角视频。结果表明,为实现更沉浸式的观看体验提供了一条切实可行的路径。我们总结如下贡献:

  • 我们提出了 AniGS 用于场景级 3D 动画,针对非以物体为中心、杂乱且包含可通行区域的场景。
  • 我们提出了一种迭代的数据集-模型更新策略,通过逐步生成并将来自选定相机视角的多视角动画监督纳入训练,将 3D 场景动画训练扩展到大规模场景。
  • 我们设计了一种组合视频到视频细化方案,引导视频扩散模型仅在期望的区域合成运动,同时保持静态内容。

CCS 概念:• 计算方法 → 计算机视觉。

附加关键词和短语:场景动画,视频扩散模型

ACM 参考格式: Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, 和 Hung-Yu Tseng. 2026. AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation. 1, 1 (2026年7月), 12 页. https://doi.org/10.1145/nnnnnnn.nnnnnnn

1 引言

即使没有移动主体,户外环境本质上也是动态的:风和细微的材料运动导致树叶、草地和周围杂物不断移动。这种环境运动对于沉浸式的观看体验至关重要。尽管近期在 3D 高斯溅射 (3DGS) [6, 8, 13, 18, 24, 37] 方面的进展使得复杂 3D 场景的快速重建和照片级真实感新视角渲染成为可能,但大多数重建的场景仍然是静态的,缺乏让场景显得生机勃勃的环境动态。为了弥补这一差距,在动画化静态 3D 资产方面取得了快速进展,特别是以物体为中心的目标 [10, 14, 32, 33, 39]。然而,这些方法通常专注于单个主体,例如植物或玩具,无法扩展到运动分布在多个区域的大型、杂乱、可通行的 3D 场景。

这项工作旨在对 3D 高斯溅射 (3DGS) 重建进行场景级动画,以提供更逼真的观看体验,如图 1 所示。动画化整个 3D 场景具有挑战性,原因有二。首先,缺乏可靠的运动先验或监督,无法为整个场景的多视角提供时间上一致的运动。虽然视频扩散模型 [1, 4, 35] 在将图像转化为高质量视频方面表现出色,但它们并非旨在生成多视角一致的视频。因此,它们无法在整个场景中提供时间连贯的运动线索。其次,动画必须保持静态区域(如墙壁和地板)的刚性,防止其漂移。以图 1 右上角面板中(蓝色轮廓)所示的窗户视图为例:窗户应保持静态,而前面的树叶应自然摇曳。如果静态内容没有与动画区域清晰分离,观看体验会明显下降。

2 相关工作

动态场景重建。大量研究致力于时变 3D 场景(4D)的重建,通常是通过在 3D 表示中引入时间自由度并从动态观测中进行优化来实现的。最近的基于高斯溅射的方法通过学习高斯的时间条件运动或形变,将 3D 高斯溅射扩展到动态设置,从而实现动态场景的高效新视角渲染 [12, 25, 31]。除了纯粹基于重建的公式外,几项工作利用强大的视频生成器作为先验来恢复 4D 几何结构或强制多视角时间一致性:Shape-of-Motion 从单个视频中提取运动和结构到 4D 表示 [29],Geo4D 使用视频生成器来正则化几何 4D 场景重建 [11],MV-Performer 调整视频扩散模型以产生忠实且同步的多视角表演者动态 [41]。虽然在有动态观测可用时这些方法有效,但它们依赖于捕获的时变输入(或专注于受限主体)。相比之下,我们的设置从规范静态场景重建开始,并引导场景范围的动画。

, Vol. 1, No. 1, Article . 出版日期:2026年7月。

第 3 页

AniGS:连接渲染与扩散先验以实现3D场景动画 • 3

静态3D场景重建 动态场景表示 增量视角扩展 3DGS 视角 𝒬= [ ] 𝒱= [ ] 渲染 非活跃 所有活跃 时间 + + 视图 视角 𝒱 视角扩展列表 渲染 损失 (公式 13, 14, 17) 视频 ℒ 渲染 旋转 𝑞 ComposedV2V (图 3) 数据集 (后) ∆𝜇𝑡∆𝑞𝑡 替换并添加数据 三平面 (𝑥, 𝑦, 𝑧) iDCT MLP 视频 𝑡 形变 数据集 位置 𝜇 场 𝐷𝜙 系数 时间 形变 细化 (前)

图 2. 方法概述。(左) AniGS 使用规范3D高斯溅射 (3DGS) 表示场景几何和外观,并使用时间条件形变场来建模合成的运动。形变场预测离散余弦变换 (DCT) 系数,以偏移和规范3DGS中的每个高斯溅射点并使其旋转。(右) 为了对整个3D场景进行动画制作,我们设计了一种迭代式数据集-模型更新方案,并采用增量视角扩展策略。数据集更新:在每次迭代中,我们包含一个与数据集中现有视图有足够重叠的额外视角,渲染数据集中所有视图的相机固定视频,并使用提出的 ComposedV2V 方法(图 3)细化这些视频。模型更新:细化后的视频被视为优化动态场景表示的训练数据。我们重复此过程,直到场景被完全覆盖。

在没有场景级真实动态监督的情况下,通过将可渲染模型与生成式视频先验耦合,迭代式地实现这一目标。 动态渲染,并将其蒸馏到时变3D表示中。AnimateAnyMesh [32] 针对前馈、文本驱动的 4D生成。最近的工作通过结合强大的扩散先验与 网格动画,而 AKD [16] 从扩散生成的视频中提炼出关节运动学。Gaussians2Life [30] 通过生成扩散引导并将诱导的2D 显式3D表示,在生成动态3D/4D内容方面取得了快速进展。许多方法通过视频扩散 运动提升为3D高斯形变,从而对静态3DGS进行动画制作。PhysDreamer [33, 39] 则通过可微仿真,将扩散预测的运动蒸馏到具有物理基础的材料参数中。PromptVFX [14] 探索了用于在开放世界环境中对3D高斯进行动画制作的文本驱动场。尽管取得了显著成果,但这些方法大多以物体为中心或仅限于小区域/视角范围,因此未能解决大型、杂乱、可通行环境中的全局一致场景级动画问题。相比之下,AniGS 旨在通过对规范静态重建进行迭代式引导,利用视频扩散先验来实现整个场景的动画制作。 从文本/图像/视频中蒸馏视频扩散模型,生成时变几何和外观(例如 DreamGaussian4D [22]、4Dfy [2] 和 Vivid Dream [15])。更近期的方法进一步强调4D内容生成的多视图和多帧一致性,包括从单目视频进行自回归4D生成 [42]、用于单图3D/4D场景创建的解耦视频扩散管道 [27, 40]、无需分数蒸馏的显式4D对象生成 [26]、前馈视频到4D合成 [38],以及提高时空一致性的多视图视频扩散模型 [9, 34, 36]。与内容生成互补的是,DIMO 研究了任意物体的多样化3D运动生成 [19]。尽管结果令人印象深刻,但这些方法主要面向以物体为中心的内容或有界场景,并依赖于从头生成内容(或从短单目视频生成)。相比之下,我们的目标是从静态3D重建开始,对整个杂乱、可通行的真实世界场景进行动画制作。AniGS 利用生成式视频先验,迭代式地引导场景级监督,该监督可蒸馏为可渲染的3DGS动画模型。 3 方法 我们首先在3.1节描述我们的问题设置。然后在3.2节详细介绍3D高斯溅射、形变场和视频扩散 preliminaries。随后,我们在3.3节提供我们方法的概述。接着,我们在3.4节和3.5节讨论我们的迭代数据集-模型更新如何实现整个场景的动画制作。最后,我们在3.6节提供实现细节。 3.1 问题定义 动画化静态3D对象和场景。相关的一系列工作研究如何利用生成式视频先验,从现有的静态3D资产(网格、NeRF/3DGS重建)中生成运动或动画。Animate3D [10] 和 Bringing Objects to Life [20] 使用多视图/视频扩散引导来产生视图一致的、整个环境(例如树木、草地、花朵和其他植被)中合理且时间连贯的环境运动,同时保持刚性结构静止。 形式上,输出是一个时变3DGS {G𝑡}𝑇𝑡=0,它可以

第 4 页

4 • Cheng 等

从任意视角渲染。在 AniGS 中,我们并不显式预测每个时间步的一组 3D高斯溅射 (3DGS)。相反,我们使用规范静态 3D高斯溅射 (3DGS) 和形变场来表示动画场景,详见第 3.2 节。

3.2 预备知识

我们回顾 AniGS 中使用的关键组件:1) 3D高斯溅射 (3DGS) 作为规范静态 3D 场景表示;2) 用于环境运动的紧凑动态场景参数化;3) 我们用作生成先验以引入动态性的基于流的视频扩散模型。

3D高斯溅射 (3DGS)。3D高斯溅射 (3DGS) 将场景表示为 $N$ 个 3D 高斯分布 $\mathcal{G} = \{\mathcal{G}_i\}_{i=1}^N$ 的集合。每个高斯分布由中心 $\mu \in \mathbb{R}^3$ 和协方差 $\Sigma \in \mathbb{R}^{3 \times 3}$ 定义:

$$ \mathcal{G}(x | \mu; \Sigma) = \exp \left( -\frac{1}{2} (x-\mu)^T \Sigma^{-1} (x-\mu) \right), \quad (1) $$

其中 $\Sigma$ 由旋转矩阵 $R \in \mathbb{R}^{3 \times 3}$ 和对角缩放矩阵 $S \in \mathbb{R}^{3 \times 3}$ 参数化为:

$$ \Sigma = R S S^T R^T. \quad (2) $$

在实践中,$R$ 和 $S$ 通常由单位四元数 $q$ 和缩放因子 $s \in \mathbb{R}^3$ 表示。除了几何属性外,每个高斯分布还携带外观属性,如颜色 $c$ 和不透明度 $\alpha$。渲染是通过对高斯分布沿射线排序并使用标准重叠合成规则进行累积:

$$ C = \sum_{i \in \mathcal{N}} c_i \alpha_i \prod_{j=1}^{i-1} (1 – \alpha_j), \quad (3) $$

其中 $\mathcal{N}$ 表示对某个像素有贡献的高斯分布有序集合。高斯参数(位置、旋转、缩放、颜色、不透明度)通过渲染图像与真实(捕获)图像之间的光度重建损失进行优化。

在我们的系统中,3D高斯溅射 (3DGS) 作为可渲染的骨干网络。我们使用规范静态重建 $\mathcal{G}_0$ 初始化 AniGS,该重建表示时间零参考状态下的 3D 场景几何和外观。

用于环境运动的动态场景表示。为了对规范静态场景之上的时变形变进行建模以表示环境动态性,受 AmbientGS [25] 的启发,我们使用基于离散余弦变换 (DCT) 基的紧凑频域参数化来表示每个高斯分布的形变(例如,平移和旋转更新)。具体而言,时变标量形变 $v(t)$(例如,沿某一轴的 $\Delta \mu_t$)建模为:

$$ v(t) = \sqrt{\frac{2}{K+1}} \sum_{k=1}^{K} \phi_{v,k} \cos \left( \frac{\pi}{T} (2t+1)k \right), \quad (4) $$

其中 $\phi_{v,k}$ 是可学习系数,$K$ 控制基的大小。这种表示存储高效且随时间平滑泛化;在任何时间戳 $t$,我们通过逆离散余弦变换 (iDCT) 恢复 $\Delta \mu_i(t)$ 和 $\Delta r_i(t)$,并在渲染之前将其应用于规范高斯分布。

基于流的视频扩散模型。我们使用潜在空间中的基于流(整流流)视频扩散公式来提供运动线索。给定干净潜在变量 $z_0$(例如,从视频编码得到),我们在 $z_0$ 和高斯噪声 $\epsilon \sim \mathcal{N}(0, I)$ 之间进行插值:

$$ z_\tau = (1 – \tau)z_0 + \tau \epsilon, \quad \tau \in [0, 1]. \quad (5) $$

与预测 $\epsilon$ 不同,整流流训练通常预测速度 $v = \epsilon – z_0$,以平衡扩散时间步 $\tau$ 的学习难度。在推理期间,从纯噪声 $z_1$ 开始,模型使用欧拉更新积分反向时间常微分方程 (ODE):

$$ z_{\tau-\Delta \tau} = z_\tau – \Delta \tau v_\theta(z_\tau, \tau). \quad (6) $$

在实践中,目标也可以描述为将噪声潜在变量 $z_{\tau_i}$ 映射到预期的干净潜在变量 $z_0$(即,$v_\theta(z_{\tau_i}, \tau_i) \approx z_0$),其中 $z_{\tau_i}$ 如公式 (5) 所示构建。我们在 AniGS 中使用预训练的 LTX [4]。

3.3 AniGS 概述

我们现在提供所提出方法的概述(图 2)。我们的目标是从规范静态重建 $\mathcal{G}_0$(第 3.1 节)开始对整个户外场景进行动画制作。一个关键障碍是缺乏合适的真实标签监督:获取整个场景时间一致的视频是不切实际的。单个相机场景级的视野有限,无法同时观察所有区域,而捕获场景级、时间同步的运动则需要多个校准相机同时记录环境,这对于典型的随意捕获来说是不可行的。

为了解决这一障碍,AniGS 遵循一个迭代的数据集-模型更新流程,该流程结合了可渲染表示和来自预训练(基于流)视频扩散模型(第 3.2 节)的生成先验。具体而言,我们在规范高斯分布上使用时间条件形变场 $D_\phi$ 对场景运动进行参数化,生成 $\mathcal{G}_t = D_\phi(\mathcal{G}_0, t)$,并通过 $\hat{I}_{p,t} = \text{Render}(\mathcal{G}_t, p)$ 从任意视角渲染帧。我们不是从真实动态标签中学习 $D_\phi$,而是使用当前模型渲染和基于扩散的视频到视频细化定期更新训练数据集,然后使用这些更新后的视频优化 $D_\phi$。

从 $\mathcal{G}_0$ 开始,我们反复交替执行 1) 数据集更新(第 3.4 节)和 2) 模型更新(第 3.5 节)。这个循环为整个场景引导出时间连贯的监督,并产生最终的动画场景模型。

输入:组合视频 视频扩散模型 $\mathcal{V}$ 渲染视频 (公式 8) 噪声潜在变量 $z_t$ 干净潜在变量 $z_0$ $\mathcal{E}$ 反向过程 $\mathcal{D}$ SAM2 “动画化 场景…” 掩码 $M_0$ 噪声 $\epsilon$ 提示 $l$ 输出:细化视频

图 3. 组合视频到视频 (ComposedV2V)。视频扩散模型在静止区域引入的微小运动可能在迭代的数据集-模型更新过程中被放大。因此,我们提出 ComposedV2V 以在每个数据集更新中重新稳定静止区域。给定渲染的(相机固定)视频,我们从第一帧估计动态掩码,并通过将第一帧的静态像素复制到所有后续帧来创建组合视频(公式 (8))。直观地说,这确保了静止区域的稳定性。在文本提示 $l$ 和噪声 $\epsilon$ 的条件下,我们应用视频扩散模型 $\mathcal{V}$ 以获得细化视频。

, 第 1 卷, 第 1 期, 文章 . 出版日期:2026 年 7 月。

第 5 页

AniGS:连接渲染与扩散先验以实现3D场景动画 • 5

数据集更新。在第 $k$ 次迭代中,我们首先通过从候选相机视图集中添加一个视图到训练数据集中,执行增量视点扩展。请注意,这一增量过程逐渐扩展了场景覆盖范围。然后,对于训练数据集中的每个视图 $p^{(j)}$,我们使用当前可渲染表示 $G_t = D_\phi(G_{0,t})$ 渲染一个相机固定的视频 $R^{(j)}_{0:T}$:

$$ R^{(j)}_{0:T} = \{ \text{Render}(G_t, p^{(j)}) \}_{t=0}^T. \quad (7) $$

最后,我们使用预训练的视频扩散模型通过组合视频到视频细化(第3.4节)来细化视频。训练数据集中所有视图的细化视频 $\{(p^{(j)}, A^{(j)}_{0:T})\}$ 构成了下一次迭代的新的训练数据集。

模型更新。使用更新后的数据集 $\{(p^{(j)}, A^{(j)}_{0:T})\}$,我们在下一次数据集更新之前对可渲染模型进行几次迭代的优化。具体而言,我们更新时间条件变形场 $D_\phi$(以及规范3DGS中的中心参数 $\mu_{\text{in}}$),鼓励渲染视频与新更新数据集中的视频相匹配。为了稳定训练并防止漂移,我们另外规范规范空间中的动态变化,鼓励动画高斯在适当的时候与规范重建保持一致。我们在第3.5节中提供了我们公式化的细节。

通过重复多轮迭代的数据集-模型更新,AniGS 逐步扩展监督覆盖范围并学习全局一致的动画3DGS。

3.4 数据集更新

在我们的设置中,一次性学习全场景动画是不切实际的。首先,同时优化所有高斯和所有视点的变形在计算上是不可行的,并且经常导致内存溢出错误。其次,在随意捕获下,无法获得具有全场景覆盖的密集真值动态监督,因为这需要许多同步相机。为了解决这两个问题,我们通过迭代更新训练数据集来逐步引导监督(见图2)。

增量视点扩展。我们通过一次添加一个视图来扩展数据集。我们首先根据感兴趣区域(例如树木、花朵)的分割图选择 $N$ 个相机位置 $\{p^{(i)}\}_{i=1}^N$,并使用最远点采样来扩展全场景的视图。这些相机按逆时针顺序排列。对于每个位置 $p^{(i)}$,我们考虑三个观察方向 $\psi \in \{0^\circ, 90^\circ, -90^\circ\}$,并以固定的视场角(FOV=$95^\circ$)渲染每个方向,以确保相邻方向之间的重叠。

我们维护一个待添加视图的队列 $Q$(views_update_list)。从第一个相机和向前方向开始,我们将 $(p^{(1)}, 0^\circ)$ 追加到 $Q$ 中。然后我们迭代直到收敛:在每次数据集更新时,我们从 $Q$ 中弹出下一个视图 $(p, \psi)$,从当前模型在该视图渲染一个片段,并使用我们的 ComposedV2V 模块(第3.4节)为该视图生成一个细化的动画目标。处理完一个视图后,我们按照固定顺序 $0^\circ \to 90^\circ \to -90^\circ$ 将同一相机的下一个方向入队;一旦处理完 $p^{(i)}$ 的三个方向,我们就继续处理下一个相机 $p^{(i+1)}$。在实践中,我们定期更新数据集,以便使用模型的最新状态生成新添加的视图。

组合视频到视频细化。一种朴素的数据集更新策略直接在每个渲染视图上运行视频扩散模型,并使用生成的片段作为监督。在实践中,这通常由于两个原因而失败。首先,不同观察方向上独立生成的片段通常在时间上不一致(例如,在重叠区域为相同内容产生不同的运动阶段),这提供了冲突的监督并阻止动态高斯收敛。其次,数据集在整个训练过程中定期更新;如果生成的目标与可渲染模型的当前状态不对齐,监督可能会漂移并破坏优化。为了缓解这些问题,我们提出了一种组合视频到视频细化(图3),它将基于扩散的生成与当前模型渲染紧密耦合,同时明确鼓励稳定的静态区域。

给定选定的视图 $p^{(j)}$ 和时间步 $T = (0, 1, \dots, T)$,我们首先渲染当前模型以获得片段 $R^{(j)}_{0:T} = \{R^{(j)}_t\}_{t=0}^T$,其中 $R^{(j)}_t = \text{Render}(G_t, p^{(j)})$。然后,我们使用 SAM2 [21] 从第一帧 $R^{(j)}_0$ 构建渲染掩码 $M^{(j)}_0 \in \{0, 1\}^{H \times W}$。使用此掩码,我们通过从 $t=0$ 到所有帧拼接规范静态区域,形成组合条件片段 $\bar{R}^{(j)}_{0:T}$:

$$ \bar{R}^{(j)}_t = 1 – M^{(j)}_0 \odot R^{(j)}_0 + M^{(j)}_0 \odot R^{(j)}_t, \quad \forall t \in T. \quad (8) $$

直观地说,$\bar{R}^{(j)}_{0:T}$ 提供了稳定的摄像机镜头并强制执行静态地板/背景,同时留出感兴趣区域用于运动合成。

最后,我们将 $\bar{R}^{(j)}_{0:T}$ 输入到带有提示 $p^{(j)}$ 和噪声 $\boldsymbol{\epsilon}^{(j)}$ 的预训练基于流视频扩散模型中,以获得细化的动画目标片段:

$$ A^{(j)}_{0:T} = \text{ComposedV2V}(R^{(j)}_{0:T}, M_0^{(j)}, l, \boldsymbol{\epsilon}^{(j)}). \quad (9) $$

这里,ComposedV2V 封装了上述组合以及基于扩散的视频到视频细化。具体而言,我们在潜在空间中使用整流流(流匹配)公式。令 $z^{(j)}_{0:T} = \mathcal{E}(\bar{R}^{(j)}_{0:T})$ 表示由视频 VAE 编码器 $\mathcal{E}(\cdot)$ 编码的组合片段。我们在扩散时间步 $\tau \in [0, 1]$ 通过在线性插值清洁潜在变量和高斯噪声之间构造噪声潜在变量:

$$ z^{(j)}_\tau = (1 – \tau) z^{(j)}_{0:T} + \tau \boldsymbol{\epsilon}^{(j)}, \quad \boldsymbol{\epsilon}^{(j)} \sim \mathcal{N}(0, I), \quad (10) $$

并通过交叉注意力将流网络条件化于提示 $l$。模型预测整流流速度 $v_\theta(z^{(j)}_\tau, \tau, l)$,这定义了一个反向时间常微分方程(ODE)。从纯噪声 $z^{(j)}_1 = \boldsymbol{\epsilon}^{(j)}$ 开始,我们使用欧拉步积分反向过程:

$$ z^{(j)}_{\tau-\Delta\tau} = z^{(j)}_\tau – \Delta\tau v_\theta(z^{(j)}_\tau, \tau, l), \quad \tau: 1 \to 0, \quad (11) $$

以获得在 $\tau=0$ 时的细化清洁潜在变量 $\hat{z}^{(j)}_{0:T}$。最后,我们使用 VAE 解码器 $\mathcal{D}(\cdot)$ 将其解码回像素空间:

$$ A^{(j)}_{0:T} = \mathcal{D}(\hat{z}^{(j)}_{0:T}). \quad (12) $$

总之,ComposedV2V 接受组合条件片段 $\bar{R}^{(j)}_{0:T}$(由 $R^{(j)}_{0:T}$ 和 $M_0^{(j)}$ 派生),如公式 (10) 所述添加噪声,并在提示 $l$ 的条件下运行反向整流流过程,以产生时间连贯的细化视频 $A^{(j)}_{0:T}$。

第 6 页

6 • Cheng et al.

3.5 模型更新 给定由第 3.4 节所述方法生成的更新数据集,我们使用比较渲染片段和伪目标近似值的优化目标来优化可渲染表示。对于训练视角 $p_i$ 和视频时间步 $t$,我们将变形的高斯 $G_t = D_\phi(G_0, t)$ 进行光栅化以渲染帧 $R_{p_i t} = \text{Render}(G_t, p_i)$,并使用细化后的目标 $A_{p_i t}$ 通过标准光度损失对其进行监督: $$ L_{ani} = \| R_{p_i t} – A_{p_i t} \|_1 + 1 – \text{SSIM}(R_{p_i t}, A_{p_i t}). \quad (13) $$ 为了稳定优化并减少漂移伪影(例如漂浮的溅射点和模糊),我们还在规范空间中正则化模型。具体而言,我们通过比较渲染的规范帧 $R_{p_i 0}$ 与静态参考图像 $I_{p_i 0}$,强制规范渲染在 $t=0$ 时保持接近静态外观: $$ L_{cano} = \| R_{p_i 0} – I_{p_i 0} \|_1 + 1 – \text{SSIM}(R_{p_i 0}, I_{p_i 0}). \quad (14) $$ 为了进一步提高动画质量,我们额外应用了分数蒸馏采样(Score Distillation Sampling, SDS)损失。对于训练相机 $p_i$,我们采样一个起始时间步 $t$ 并渲染一个包含 $4m+1$ 帧的短片段 $R_{p_i t:t+4m} = \{R_{p_i t}, R_{p_i t+1}, \dots, R_{p_i t+4m}\}$,其中 $m$ 是整数。我们使用视频扩散模型的 VAE 编码器 $E(\cdot)$ 将该片段编码到潜在空间: $$ z_{p_i 0} = E(R_{p_i t:t+4m}). \quad (15) $$ 然后我们采样扩散时间步 $\tau \sim U(0, 1)$ 和高斯噪声 $\epsilon \sim N(0, I)$,并按照第 3.4 节中使用的相同整流流(rectified-flow)公式构建噪声潜在变量: $$ z_{p_i \tau} = (1 – \tau) z_{p_i 0} + \tau \epsilon. \quad (16) $$ 给定文本提示 $l$,预训练的 DiT 预测整流流速度 $v_\theta(z_{p_i \tau}, \tau, l)$。由于该公式下的目标速度为 $\epsilon – z_{p_i 0}$,我们将 SDS 损失定义为: $$ L_{SDS} = \mathbb{E}_{p_i, t, \tau, \epsilon} [w(\tau) \| v_\theta(z_{p_i \tau}, \tau, l) – (\epsilon – z_{p_i 0}) \|_2^2], \quad (17) $$ 其中 $w(\tau)$ 是一个依赖于时间步的加权函数。该损失鼓励渲染的动画遵循预训练视频扩散模型的运动先验,同时与我们可渲染的场景表示保持一致。在实践中,由于内存限制,我们在渲染片段的 $4m+1$ 帧中仅通过采样的其中一帧反向传播梯度。因此,我们的训练目标为 $L = L_{ani} + \lambda_{cano} L_{cano} + \lambda_{SDS} L_{SDS}$。

关于可学习参数,我们发现仅优化变形场 $D_\phi$ 而冻结所有规范高斯属性会导致次优结果。相反,我们额外微调规范位置 $\{\mu_{0i}\}$ 以更好地使几何形状与扩散细化后的目标对齐,同时保持其他属性(旋转、缩放、不透明度和颜色)固定。这种参数化提高了训练稳定性并促进了场景范围的动画。

3.6 实现细节 静态重建。我们以规范静态 3DGS $G_0$ 初始化 AniGS。我们使用 AdamW 以 $1 \times 10^{-4}$ 的学习率优化 $G_0$。我们训练 30k 次迭代,耗时约 1.6 小时以收敛。

动画训练。我们从 $G_0$ 开始,通过优化时间条件变形场 $D_\phi$ 以及规范高斯位置 $\{\mu_{0i}\}$ 来学习场景动态,同时保持其他属性(如旋转、不透明度和外观)固定。我们使用 $N=4$ 个相机位置进行迭代数据集更新。对于生成先验,我们使用 LTX-Video [4] 作为预训练视频扩散模型。我们以 8 个采样步运行扩散模型,在 1024×1408 的分辨率下生成 $T=121$ 帧。在训练期间,我们每 2500 次优化步骤通过 ComposedV2V 更新一次数据集,并总共训练 AniGS 70k 次迭代。ComposedV2V 的规范掩码是通过 SAM2 获得的。此阶段的训练时间约为 7.3 小时(使用 1 块 GPU)。

4 实验 在本节中,我们在一个由五个具有挑战性的户外场景组成的数据集上评估 AniGS,这些场景是在随意设置下拍摄的,每个场景都包含大规模、杂乱的植被和宽阔的可通行区域。我们与代表性的 3D 场景动画基线 Gaussians2Life [30] 和 PhysDreamer [39] 进行比较。我们首先在 4.1-4.2 节中描述数据集和基线。然后报告定性结果和比较(图 4-6),并在 4.5-4.6 节中使用指标和用户研究定量测量动画的真实性和质量。

4.1 数据集 我们收集了一个由五个大规模、杂乱的户外场景组成的数据集:壁炉(Fireplace)、花园(Garden)、花朵(Flowers)、森林(Forest)和小径(Trail)。这些拍摄覆盖了可通行区域内的多样化植被和杂物(例如树木、花朵、植物和灌木),因此非常适合评估场景范围的动画。每个场景包含大约 1.5k–2.0k 张单目图像,我们使用 COLMAP [23] 估计相机姿态和稀疏点云。我们还在公开基准 DL3DV [17] 上进行了评估。具体而言,我们使用粗略类别标注“Nature & Outdoors”从数据集中选择户外场景。所选场景包括凉亭(Gazebo)、庭院(Courtyard)、灌木(Bush)、游乐场(Playground)和公园(Park)。

4.2 基线 我们将 AniGS 与两种具有代表性的基于扩散的 3D 动画方法进行比较:Gaussians2Life [30] 和 PhysDreamer [39]。Gaussians2Life 通过生成多视角扩散引导并将诱导的 2D 运动通过跟踪点和深度对齐提升为 3D 来驱动高斯变形,从而对静态 3DGS 进行动画处理。PhysDreamer 则通过将扩散预测的运动蒸馏到基于物理的动力学中,优化可微模拟器(MPM)的材料参数,使得模拟渲染结果与生成的视频片段相匹配。为了公平比较,我们为每个场景提供具有相同预训练静态重建的基线,并使用其官方实现,由于其以对象为中心的设置,我们共享训练视角。

4.3 评估指标 指标。我们使用弗雷歇视频距离(Fréchet Video Distance, FVD)[28] 和弗雷歇 inception 距离(Fréchet Inception Distance, FID)[7] 来评估动画质量。我们使用 I3D 主干 [3] 计算 FVD;所有视频在特征提取前均被调整大小并中心裁剪为 256×256。由于在我们的设置中缺乏真实场景级动态视频,我们针对由预训练视频扩散模型生成的参考视频分布测量 FVD。为了公平比较并减少对特定生成器的依赖,我们使用三个扩散模型——LTX [4]、Cosmos [1] 和 DynamiCrafter [35]——来生成

, Vol. 1, No. 1, Article . Publication date: July 2026.

第 7 页

参考视频,并分别报告由此得到的 FVD-LTX、FVD-Cosmos 和 FVD-DynamiCrafter 分数。对于每种方法,我们在计算 FVD 时生成了 250 个片段。我们将扩散生成的帧在所有场景中合并视为参考分布,并计算由每种方法为每个场景渲染的帧的 FID。

用户研究。我们进一步开展用户研究以评估视觉质量和运动真实性。我们遵循双择一强制选择(2AFC)协议:对于每个问题,我们从同一视角渲染两个片段,分别展示 AniGS 和随机选择的基线方法,并排显示。左右顺序随机打乱以减轻侧向偏差。每对片段参与者需回答两个问题:(1) 哪个片段的视觉质量更好,以及 (2) 哪个片段的运动更真实。我们报告偏好每种方法的投票比例。

4.4 定性评估

我们在图 4 和图 5 中可视化了 AniGS 的定性结果。对于每个场景,我们从多个相机位置渲染动画以展示场景级覆盖范围,对于每次渲染,我们展示 1) 第一帧和 2) 突出显示区域的 $x-t/y-t$ 切片以说明时间演变。结果表明,AniGS 在杂乱的动态区域(如树叶和花朵)上产生了自然且时间连贯的运动,同时保留了建筑物和其他背景元素等结构的外观。

我们在图 6 中将 AniGS 与 Gaussians2Life 和 PhysDreamer 进行了进一步比较。AniGS 始终产生更清晰的渲染结果和更真实的运动模式(例如,类似于风驱动动力学的振荡叶片/花朵运动),且未引入明显的背景漂移。相比之下,Gaussians2Life 经常产生局限于小区域的局部或空间碎片化运动。PhysDreamer 经常产生不太真实的动力学效果,因为它导致整个场景的近全局偏移,而不是生成特定于植被的运动。这些结果突显了我们方法的优势,即在保持场景其余部分稳定规范结构的同时,在感兴趣区域产生运动。请查看补充材料中的渲染视频。

最后,我们在图 8 中展示了一个多样化的场景动画结果,其中 AniGS 对包含衣物、雨伞和塑料袋的室内场景进行动画处理。这一结果表明,AniGS 能够超越户外植被,在不同的场景中处理多样化的可动画对象。

4.5 定量评估

我们在表 1 中报告了使用 FVD [28] 在我们收集的数据集上的定量结果。我们还在表 2 中报告了 DL3DV 上的 FVD。在所有五个场景中,AniGS 在三种不同的扩散参考分布(LTX/Cosmos/DynamiCrafter)下均实现了比两个基线方法更低的 FVD,表明其运动更真实且时间连贯。如表 2 所示,AniGS 在 DL3DV 场景上的表现也优于基线方法。

我们还在表 3 中评估了动画视频的多视角一致性。我们进行了一项 3D 重建实验,以验证生成的多视角运动是否具有 3D 一致性。具体而言,我们选择一个新颖的时间步长 ($t=21$),从 50% 的训练相机渲染多视角图像,使用这些渲染图像训练 3DGS 重建,并在表 3 中对剩余验证相机评估 PSNR。我们包括一个在原始捕获数据上训练的 3DGS 作为参考。结果表明,学习到的动画具有多视角一致性。

最后,我们在表 4 中进行了用户研究。在双择一强制选择(2AFC)下,在所有场景中,参与者均偏好 AniGS 而非 Gaussians2Life 和 PhysDreamer,无论是在运动真实性还是视觉质量方面。

4.6 消融研究

我们在表 5 中验证了 AniGS 的关键组件。禁用数据集-模型更新(即仅生成一次伪训练视频)会显著降低质量,因为监督信号会迅速与不断演变的渲染器失对齐,使得优化更难收敛。移除增量视角扩展(即在训练数据集开始时拥有所有视角)会进一步使训练不稳定,因为模型失去了逐渐扩展场景覆盖范围的课程学习效应。关闭 ComposedV2V 也会损害结果,因为独立生成的片段在不同视角间时间一致性较差,并引入冲突的监督信号。最后,我们发现参数更新必须仔细控制:优化所有规范高斯属性容易导致模糊和漂移,而仅优化形变场则受到静态几何偏差的限制;允许规范位置进行微调可提供更好的规范对齐,从而使形变专注于残差时变运动。

表 1. 定量评估(FVD)。我们报告使用各种视频扩散模型计算的 FVD (↓) 分数:LTX、Cosmos 和 DynamiCrafter。最佳性能以粗体显示。

| | FVD-LTX ↓ | Fireplace | Garden | Flowers | Forest | Trail | Avg. | | :— | :— | :— | :— | :— | :— | :— | :— | | Ours | | 374.49 | 403.89 | 537.14 | 407.86 | 356.08 | 415.89 | | Gaussians2life | | 1127.78 | 876.60 | 1154.95 | 605.64 | 745.19 | 902.03 | | PhysDreamer | | 943.56 | 957.12 | 1078.05 | 550.37 | 668.20 | 839.46 | | FVD-Cosmos ↓ | | | | | | | | | Ours | | 224.03 | 254.32 | 307.70 | 183.23 | 165.68 | 226.99 | | Gaussians2life | | 739.64 | 653.49 | 899.55 | 381.19 | 476.39 | 630.05 | | PhysDreamer | | 677.38 | 531.39 | 946.43 | 496.17 | 511.22 | 632.52 | | FVD-DynamiCrafter ↓ | | | | | | | | | Ours | | 476.17 | 465.13 | 485.96 | 550.58 | 499.54 | 495.48 | | Gaussians2life | | 668.16 | 772.07 | 1044.03 | 782.01 | 854.38 | 824.13 | | PhysDreamer | | 691.74 | 855.37 | 947.86 | 1096.62 | 709.83 | 860.28 |

表 2. DL3DV 上的定量评估。我们报告 DL3DV [17] 户外场景的 FVD-LTX (↓)。最佳性能以粗体显示。

| | FVD-LTX ↓ | Gazebo | Park | Bush | Playground | Courtyard | Avg. | | :— | :— | :— | :— | :— | :— | :— | :— | | Ours | | 413.59 | 387.04 | 310.19 | 452.92 | 343.66 | 381.48 | | Gaussians2life | | 945.42 | 839.34 | 735.03 | 815.52 | 630.99 | 793.26 | | PhysDreamer | | 881.19 | 762.17 | 651.94 | 790.86 | 986.31 | 814.49 |

表 3. 生成视频的多视角一致性。我们通过在新时间步长下从生成的多视角图像训练 3DGS 并报告 PSNR 来评估多视角一致性。

| | PSNR ↑ | Fireplace | Garden | Gazebo | Courtyard | | :— | :— | :— | :— | :— | :— | | Original capture | | 27.40 | 28.77 | 26.29 | 28.35 | | Our Novel Time | | 25.94 | 27.13 | 24.41 | 26.87 |

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation • 7

, Vol. 1, No. 1, Article . Publication date: July 2026.

第 8 页

8 • Cheng 等人

表 4. 用户研究。我们报告了 AniGS 与其他方法相比的用户偏好率,评估指标包括运动真实感和视觉质量。

运动真实感 ↑ 壁炉 花园 花朵 森林 小径 我们的方法 vs GS2life 91.7 % 83.3 % 81.5 % 78.3 % 83.3 % 我们的方法 vs PhysDreamer 89.6 % 90.5 % 85.7 % 90.8 % 91.7 % 视觉质量 ↑ 我们的方法 vs GS2life 90.2 % 82.6 % 80.7 % 74.5 % 86.3 % 我们的方法 vs PhysDreamer 96.0 % 79.1 % 83.5 % 79.2 % 87.9 %

表 5. 消融研究。我们报告了使用 LTX 视频扩散模型计算的 FVD (↓) 分数。最佳性能以粗体显示。

FVD-LTX ↓ 壁炉 花园 花朵 森林 小径 平均 无数据集–模型更新 533.95 529.67 653.92 518.72 431.49 533.55 无视角扩展 511.46 498.50 597.16 489.12 410.87 501.42 无 ComposedV2V 420.77 425.20 556.29 433.17 373.02 441.69 优化所有参数 473.14 445.93 607.83 458.36 396.55 476.36 仅优化形变 450.22 439.16 610.53 449.83 402.14 470.38 我们的方法 (完整模型) 374.49 403.89 537.14 407.86 356.08 415.89

5 结论与局限性

结论。我们介绍了 AniGS,它通过将可渲染模型与预训练的视频扩散先验相结合,将场景级动态引入静态 3DGS 重建中。AniGS 学习一个时间条件形变场,无需真实动态监督,而是通过迭代的数据集–模型更新循环来实现,该循环扩展视角覆盖范围,将渲染结果细化为时间上连贯的伪训练数据,并在自由视角动画优化中引入规范正则化。

局限性。AniGS 无法合成状态变化或其他大型、不可逆的动态过程。特别是,如果扩散细化后的目标包含树叶掉落、树枝断裂或强烈的延时摄影效果(例如昼夜交替或季节变化)等事件,这些事件会引发剧烈的全局外观/色调变化,当前的基于形变的表示和训练目标难以解释此类大幅运动或全局变化。图 7 展示了强烈延时摄影效果的示例。我们将对这些内容的建模留作未来工作。

参考文献

[1] Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, 等人. 2025. World simulation with video foundation models for physical ai. arXiv 预印本 arXiv:2511.00062 (2025). [2] Sherwin Bahmani, Ivan Skorokhodov, Victor Rong, Gordon Wetzstein, Leonidas Guibas, Peter Wonka, Sergey Tulyakov, Jeong Joon Park, Andrea Tagliasacchi, 和 David B. Lindell. 2024. 4D-fy: Text-to-4D Generation Using Hybrid Score Distillation Sampling. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集. [3] Joao Carreira 和 Andrew Zisserman. 2017. Quo vadis, action recognition? a new model and the kinetics dataset. 在 IEEE 计算机视觉与模式识别会议论文集. 6299–6308. [4] Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, 等人. 2024. Ltx-video: Realtime video latent diffusion. arXiv 预印本 arXiv:2501.00103 (2024). [5] Ayaan Haque, Matthew Tancik, Alexei A Efros, Aleksander Holynski, 和 Angjoo Kanazawa. 2023. Instruct-nerf2nerf: Editing 3d scenes with instructions. 在 IEEE/CVF 国际计算机视觉会议论文集. 19740–19750. [6] Jan Held, Renaud Vandeghen, Adrien Deliege, Abdullah Hamdi, Silvio Giancola, Anthony Cioppa, Andrea Vedaldi, Bernard Ghanem, Andrea Tagliasacchi, 和 Marc Van Droogenbroeck. 2025. Triangle Splatting for Real-Time Radiance Field Rendering. arXiv 预印本 arXiv:2505.19175 (2025). [7] Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, 和 Sepp Hochreiter. 2017. Gans trained by a two time-scale update rule converge to a local nash equilibrium. 神经信息处理系统进展 30 (2017). [8] Binbin Huang, Zehao Yu, Anpei Chen, Andreas Geiger, 和 Shenghua Gao. 2024. 2d gaussian splatting for geometrically accurate radiance fields. 在 ACM SIGGRAPH 2024 会议论文集. 1–11. [9] Hanzhuo Huang, Yuan Liu, Ge Zheng, Jiepeng Wang, Zhiyang Dou, 和 Sibei Yang. 2025. MVTokenFlow: High-quality 4D Content Generation using Multiview Token Flow. 在国际学习表征会议 (ICLR). [10] Yifan Jiang 等人. 2024. Animate3D: Animating Any 3D Model with Multi-view Video Diffusion. 在神经信息处理系统进展 (NeurIPS). [11] Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, 和 Andrea Vedaldi. 2025. Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction. arXiv 预印本 arXiv:2504.07961 (2025). [12] In-Hwan Jin, Haesoo Choo, Seong-Hun Jeong, Heemoon Park, Junghwan Kim, Oh-joon Kwon, 和 Kyeongbo Kong. 2025. Optimizing 4D Gaussians for Dynamic Scene Video from Single Landscape Images. arXiv 预印本 arXiv:2504.05458 (2025). [13] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, 和 George Drettakis. 2023. 3D Gaussian splatting for real-time radiance field rendering. ACM 图形学汇刊 42, 4 (2023), 139–1. [14] Mert Kiray, Paul Uhlenbruck, 和 Benjamin Busam. 2025. PromptVFX: Text-Driven Fields for Open-World 3D Gaussian Animation. arXiv 预印本 arXiv:2506.01091 (2025). [15] Yao-Chih Lee, Yi-Ting Chen, Andrew Wang, Ting-Hsuan Liao, Brandon Y. Feng, 和 Jia-Bin Huang. 2024. VividDream: Generating 3D Scene with Ambient Dynamics. arXiv 预印本 arXiv:2405.20334 (2024). [16] Xiang Li, Xinyu Ma, 等人. 2025. Articulated Kinematics Distillation from Video Diffusion Models. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集. [17] Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu, 等人. 2024. Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision. 在 IEEE/CVF 计算机视觉与模式识别会议论文集. 22160–22169. [18] Tao Lu, Mulin Yu, Linning Xu, Yuanbo Xiangli, Limin Wang, Dahua Lin, 和 Bo Dai. 2024. Scaffold-gs: Structured 3d gaussians for view-adaptive rendering. 在 IEEE/CVF 计算机视觉与模式识别会议论文集. 20654–20664. [19] Linzhan Mou, Jiahui Lei, Chen Wang, Lingjie Liu, 和 Kostas Daniilidis. 2025. DIMO: Diverse 3D Motion Generation for Arbitrary Objects. 在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集. [20] Oded Rahamim 等人. 2024. Bringing Objects to Life: Training-Free 4D Generation from 3D Objects through View-Consistent Noise. arXiv 预印本 arXiv:2412.20422 (2024). [21] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman Rädle, Chloe Rolland, Laura Gustafson, 等人. 2024. Sam 2: Segment anything in images and videos. arXiv 预印本 arXiv:2408.00714 (2024). [22] Jiawei Ren, Liang Pan, Jiaxiang Tang, Chi Zhang, Ang Cao, Gang Zeng, 和 Ziwei Liu. 2023. DreamGaussian4D: Generative 4D Gaussian Splatting. arXiv 预印本 arXiv:2312.17142 (2023). [23] Johannes L Schonberger 和 Jan-Michael Frahm. 2016. Structure-from-motion revisited. 在 IEEE 计算机视觉与模式识别会议论文集. 4104–4113. [24] Kaifeng Sheng, Zheng Zhou, Yingliang Peng, 和 Qianwei Wang. 2025. 2D Triangle Splatting for Direct Differentiable Mesh Training. arXiv 预印本 arXiv:2506.18575 (2025). [25] Meng-Li Shih 等人. 2024. Modeling Ambient Scene Dynamics for Free-view Synthesis. arXiv 预印本 arXiv:2406.09395 (2024). [26] Qi Sun, Zhiyang Guo, Ziyu Wan, Jing Nathan Yan, Shengming Yin, Wengang Zhou, Jing Liao, 和 Houqiang Li. 2025. EG4D: Explicit Generation of 4D Object without Score Distillation. 在国际学习表征会议 (ICLR). [27] Wenqiang Sun, Shuo Chen, Fangfu Liu, Zilong Chen, Yueqi Duan, Jun Zhang, 和 Yikai Wang. 2025. DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion. 在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集. [28] Thomas Unterthiner, Sjoerd Van Steenkiste, Karol Kurach, Raphael Marinier, Marcin Michalski, 和 Sylvain Gelly. 2018. Towards accurate generative models of video: A new metric & challenges. arXiv 预印本 arXiv:1812.01717 (2018). [29] Qianqian Wang, Vickie Ye, Hang Gao, Weijia Zeng, 和 Angjoo Kanazawa. 2024. Shape of Motion: 4D Reconstruction from a Single Video. arXiv 预印本 arXiv:2407.13764 (2024). [30] Thomas Wimmer, Michael Oechsle, Michael Niemeyer, 和 Federico Tombari. 2025. Gaussians-to-Life: Text-Driven Animation of 3D Gaussian Splatting Scenes.

, 第 1 卷, 第 1 期, 文章 . 出版日期:2026 年 7 月。

第 9 页

AniGS:连接渲染与扩散先验以实现3D场景动画 • 9

在第三届3D视觉国际会议(3DV)上。958–968页。 [31] Guanjun Wu 等人。2024年。4D高斯溅射用于实时动态场景渲染。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集。 [32] Zizheng Wu 等人。2025年。AnimateAnyMesh:一种用于文本驱动通用网格动画的前馈4D基础模型。在IEEE/CVF国际计算机视觉会议(ICCV)论文集。 [33] Tianyi Xie, Zeshun Zong, Yuxing Qiu, Xuan Li, Yutao Feng, Yin Yang, 和 Chen-fanfu Jiang。2024年。Physgaussian:用于生成式动力学的物理集成3D高斯。在IEEE/CVF计算机视觉与模式识别会议论文集。4389–4398页。 [34] Yiming Xie, Chun-Han Yao, Vikram Voleti, Huaizu Jiang, 和 Varun Jampani。2025年。SV4D:具有多帧和多视图一致性的动态3D内容生成。在表示学习国际会议(ICLR)上。 [35] Jinbo Xing, Menghan Xia, Yong Zhang, Haoxin Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, 和 Tien-Tsin Wong。2024年。Dynami-crafter:利用视频扩散先验动画化开放域图像。在欧洲计算机视觉会议(ECCV)上。Springer出版,399–417页。 [36] Chun-Han Yao, Yiming Xie, Vikram Voleti, Huaizu Jiang, 和 Varun Jampani。2025年。SV4D 2.0:增强多视图视频扩散中的时空一致性以实现高质量4D生成。在IEEE/CVF国际计算机视觉会议(ICCV)论文集。 [37] Zehao Yu, Anpei Chen, Binbin Huang, Torsten Sattler, 和 Andreas Geiger。2024年。Mip-splatting:无混叠3D高斯溅射。在IEEE/CVF计算机视觉与模式识别会议论文集。19447–19456页。 [38] Bowen Zhang, Sicheng Xu, Chuxin Wang, Jiaolong Yang, Feng Zhao, Dong Chen, 和 Baining Guo。2025年。用于高保真视频到4D合成的高斯变分场扩散。arXiv预印本 arXiv:2507.23785 (2025)。此条目同时用于“视频到4D前馈”和“单视频到4D”要点。 [39] Tao Zhang 等人。2024年。PhysDreamer:通过视频生成实现基于物理的3D物体交互。在欧洲计算机视觉会议(ECCV)上。 [40] Yuan Zhao, Shih-Yang Lin, Xinhang Li, Siyu Huang, Anpei Chen 等人。2025年。GenXD:生成任意3D和4D场景。在表示学习国际会议(ICLR)上。引入了CamVid-30K数据集。 [41] Yuchen Zhi 等人。2025年。MV-Performer:驯服视频扩散模型以实现忠实且同步的多视图表演者合成。arXiv预印本 arXiv:2510.07190 (2025)。 [42] Hanxin Zhu, Tianyu He, Xiqian Yu, Junliang Guo, Zhibo Chen, 和 Jiang Bian。2025年。AR4D:从单目视频进行自回归4D生成。arXiv预印本 arXiv:2501.01722 (2025)。

第 10 页

10 • Cheng 等

壁炉 t t x y y t

花园 x x x t t t

花卉 t x t y t y

小径 x t x t y t

图 4. 定性结果。我们展示了各种场景的新视角渲染结果,并使用时空切片突出了合成的动态效果。

t x t y t y

x x t t t y

凉亭 公园 庭院 图 5. DL3DV 上的定性结果。我们展示了来自 DL3DV 的场景的新视角渲染结果,并突出了动画效果。

, 第 1 卷, 第 1 期, 文章 . 出版日期:2026 年 7 月。

第 11 页

AniGS:桥接渲染与扩散先验以实现3D场景动画 • 11

壁炉 t t t y y y

森林 t t t y y y

花园 x x x t t t

小径 t t t y y y

本文方法 Gaussians2life [29] PhysDreamer [38] 图6. 定性比较。我们展示了不同方法生成的新视角渲染结果:本文方法、Gaussians2life [30] 和 PhysDreamer [39]。合成的动态效果通过时空切片展示。

x x t t

图7. 局限性示例。AniGS 无法合成大规模、不可逆的动态效果。我们展示了一个光照变化产生强烈延时摄影效果的例子。在这种情况下,AniGS 未能对视频扩散模型产生的全局变化进行建模,并产生了明显的伪影。

t y t

图8. 多样化的动画结果。AniGS 能够泛化至植被以外的多样化对象,例如衣物、雨伞和塑料袋。

, 第1卷, 第1期, 文章. 出版日期: 2026年7月

第 12 页

12 • Cheng 等人

2007 年 2 月 2 日收到;2009 年 3 月 12 日修订;2009 年 6 月 5 日接受

, 第 1 卷,第 1 期,文章。出版日期:2026 年 7 月。

发表评论