绕过VAE,在像素空间统一3D生成与重建:PixWorld

三分钟导读:关键创新在于直接在像素空间应用Flow Matching损失。通过可微光栅化渲染3DGS,模型直接优化渲染图像与目标像素的差异。这避免了潜空间重建带来的细节丢失,使扩散过程直接感知3D几何结构,提升了生成内容的物理一致性。

英文题目:PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

论文出处:arXiv 每日论文精选 · arXiv:2607.05373

原始论文:PDF / 论文页面

对应视频标题:绕过VAE,在像素空间统一3D生成与重建:PixWorld|推荐指数:★★★★★

这篇论文解决什么问题?

当前3D场景重建与生成通常割裂,或在潜空间统一。现有方法依赖VAE或RAE,导致信息瓶颈和失真,且扩散目标与3D表示解耦。PixWorld旨在通过像素空间统一这一流程,消除自编码器开销,实现端到端优化。

核心创新

方法概览

关键创新在于直接在像素空间应用Flow Matching损失。通过可微光栅化渲染3DGS,模型直接优化渲染图像与目标像素的差异。这避免了潜空间重建带来的细节丢失,使扩散过程直接感知3D几何结构,提升了生成内容的物理一致性。

逐图理解论文

核心方法架构

核心方法架构
Figure 2: Overview of PixWorld. (a) PixWorld adopts a unified DiT-based framework that takes noisy and clean multi-view inputs, with optional text conditioning, and jointly predicts depth and 3DGS through shared transformer blocks. (b) A pixel-space flow matching loss is imposed on rendered multi-view images to directly optimize the underlying 3D representation. (c) A geometry perception loss further enforces structural consistency by aligning rendered views with ground-truth observations through a 3D foundation model.

PixWorld采用双流DiT架构,将多视图输入划分为干净(重建)和噪声(生成)子集。模型共享Transformer块,联合预测深度和3DGS属性。这种设计允许在同一框架下灵活处理纯重建、纯生成或混合输入,无需切换模型。

重建性能评估

重建性能评估
Table 1: Quantitative comparison of novel-view synthesis on RealEstate10K (Zhou et al., 2018) and DL3DV-10K (Ling et al., 2024) under 4-view and 8-view input settings. Best results are in bold; second best are underlined.

在RealEstate10K和DL3DV-10K数据集上,PixWorld在新视图合成任务中表现优异。4视图设置下,PSNR达到26.21,LPIPS为0.138,优于YoNoSplat等SOTA重建基线。这表明像素空间直接监督能有效保留高频纹理细节,减少重建伪影。

生成能力验证

生成能力验证
Table 2: Quantitative comparison on single-image 3D scene generation, averaged. Results on RealEstate10K (Zhou et al., 2018) and DL3DV-10K (Ling et al., 2024) under the 1-view setting, averaged over First Frame and Bidirectional configurations. Best in bold; second best underlined.

在单视图和双视图3D场景生成任务中,PixWorld同样领先。RealEstate10K单视图生成PSNR达18.88,AUC@5为0.614。相比Gen3R等潜空间方法,PixWorld生成的场景具有更合理的几何结构和更少的纹理扭曲,证明了统一框架的有效性。

综合基准表现

综合基准表现
Table 4: Quantitative comparison on the WorldScore benchmark (Duan et al., 2025). We report all seven official metrics together with their average. Bold and underline indicate the best and the second-best results, respectively.

在WorldScore基准测试中,PixWorld获得71.04的平均分,涵盖多样性、一致性和质量等多维度指标。这一结果证实了模型在复杂世界建模任务中的综合能力,不仅关注单帧质量,更强调多视图间的时空一致性和物理合理性。

消融实验分析

消融实验分析
Figure 5: Ablation study on the Geometry Perception loss in PixWorld. Given a single input image, our model generates the subsequent 7 frames (8 frames in total); we visualize 4 representative frames here for clarity. Pose accuracy is quantitatively evaluated by comparing the estimated camera poses against the ground-truth poses. Compared to the variant without Geometry Perception (w/o Geom.), the full model achieves more precise camera pose control and substantially mitigates the blurriness in later-view predictions, demonstrating that the global 3D perception loss is essential for maintaining both geometric consistency and visual fidelity over long generation horizons.

消融研究表明,Geometry Perception Loss至关重要。移除该损失后,后续视图的模糊度显著增加,相机姿态估计误差增大。这验证了3D基础模型提供的几何先验对于维持长序列生成的结构稳定性不可或缺,弥补了纯像素监督的不足。

实验与关键结果

  • 消融研究表明,Geometry Perception Loss至关重要。移除该损失后,后续视图的模糊度显著增加,相机姿态估计误差增大。这验证了3D基础模型提供的几何先验对于维持长序列生成的结构稳定性不可或缺,弥补了纯像素监督的不足。
  • PixWorld在A100上推理需15秒,慢于FlashWorld等蒸馏模型,主要因NFE较高(100步)。此外,训练分辨率限制(336×448)可能影响极高分辨率纹理。目前主要评估室内场景,户外泛化能力待验证。像素空间扩散计算成本高于潜空间方法,需权衡资源。
  • 消融研究表明,Geometry Perception Loss至关重要。移除该损失后,后续视图的模糊度显著增加,相机姿态估计误差增大。这验证了3D基础模型提供的几何先验对于维持长序列生成的结构稳定性不可或缺,弥补了纯像素监督的不足。
  • PixWorld在A100上推理需15秒,慢于FlashWorld等蒸馏模型,主要因NFE较高(100步)。此外,训练分辨率限制(336×448)可能影响极高分辨率纹理。目前主要评估室内场景,户外泛化能力待验证。像素空间扩散计算成本高于潜空间方法,需权衡资源。

阅读时需要注意

  • PixWorld在A100上推理需15秒,慢于FlashWorld等蒸馏模型,主要因NFE较高(100步)。此外,训练分辨率限制(336×448)可能影响极高分辨率纹理。目前主要评估室内场景,户外泛化能力待验证。像素空间扩散计算成本高于潜空间方法,需权衡资源。
  • Speed comparison is not strictly apples-to-apples due to different output resolutions and frame counts (8 key frames vs 24-121 for baselines).
  • Geometry perception loss relies on a frozen 3D foundation model (π3), which may introduce biases from its pretraining data.
  • Pixel-space diffusion requires significant computational resources for training and inference compared to latent-space methods.

关联工作

  • 当前3D场景重建与生成通常割裂,或在潜空间统一。现有方法依赖VAE或RAE,导致信息瓶颈和失真,且扩散目标与3D表示解耦。PixWorld旨在通过像素空间统一这一流程,消除自编码器开销,实现端到端优化。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

PIXWORLD:在像素空间中统一3D场景生成与重建

Sensen Gao1∗, Zhaoqing Wang2∗, Qihang Cao1, Dongdong Yu2, Changhu Wang2, Jia-Wang Bian2† 1 南洋理工大学 2 AISphere

  • 共同第一作者。 † 通讯作者。

重建输入(湖泊场景) 3D重建结果(湖泊场景) 2026 生成输入(客厅场景) 3D生成结果(客厅场景) Jul 6

现有方法

VAE/RAE DiT 3D 编码器 (潜在空间) 解码器

训练目标(潜在空间) 3DGS[cs.CV] 输入图像

PixWorld (本文)

DiT 训练目标 (像素空间) (3D表示)

输入图像 3DGS 渲染图像

图 1: PixWorld 在单个模型内统一了3D场景重建与生成。与在 VAE (Kingma & Welling, 2013) 或 RAE (Zheng et al., 2025) 的潜在空间中计算损失的先前方法不同,PixWorld 在多视图渲染图像上直接在像素空间中应用流匹配目标,从而实现对底层3D表示的端到端优化。这种设计避免了潜在表示固有的信息损失,并消除了预训练 VAE 或 RAE 的成本。

摘要arXiv:2607.05373v1

3D重建与生成通常由不同的范式处理: 基于像素的重建回归,以及基于潜在空间的扩散生成。近 期的工作尝试在潜在空间中统一这两种任务,但存在显著缺点: 扩散目标定义在潜在特征而非底层3D表示上,且两个分支都遭受由潜在 编码引入的信息损失,同时需要预训练的变分自编码器 (VAE) 或表 示自编码器 (RAE)。在本文中,我们在统一的像素空间扩散范式下重新构建 了这两项任务,并引入了 PixWorld,这是一个联合解决3D重建与生成的单 一模型。通过对渲染图像直接进行扩散监督,PixWorld 消除了上述限制,并使 优化与3D场景保真度对齐。除了仅在2D图像层面操作且缺乏3D几何意识的 光度与感知监督外,我们还进一步引入了几何感知损失,该损失在预训练3D基础 模型的几何感知特征空间中,使渲染视图与其真实值对齐,从而提供3D结构监督。PixWorld 持续优于

1

第 2 页

先前的潜在空间生成方法,并与最先进的重建方法相匹敌,证明了统一像素空间方法的优越性。

1 引言

从视觉观测中构建3D场景是计算机视觉领域的一个长期目标,对游戏、机器人、具身智能以及VR/AR(Ding等人,2025;Kong等人,2025;Ye等人,2026b;Zhang等人,2025)具有广泛影响。这一领域的进展由两个互补的方向推动:重建是从真实世界的捕获数据中恢复3D场景,而生成则是从有限甚至想象的条件中合成合理的场景(Zhang等人,2025;Wang等人,2026;Li等人,2026)。它们共同构成了为未来数字世界填充内容的技术基础。

3D场景生成和重建长期以来作为两条独立的研究线索发展。重建主要由前馈方法主导,这些方法直接从多视图图像回归3D表示(Hong等人,2023;Charatan等人,2024;Szymanowicz等人,2024;Xu等人,2025;Chen等人,2024a)。生成方法则从通过分数蒸馏利用2D先验进行单场景优化(Lin等人,2023;Poole等人,2022;Tang等人,2023;Wang等人,2023),演变为目前主流的潜在空间扩散(Yang等人,2025;Go等人,2025b;Huang等人,2026;Li等人,2025b),最近的扩展包括在预训练的3D基础模型或表示自编码器(Representation Autoencoder, RAE)的特征空间中进行扩散(Gao等人,2026;Sun等人,2026;Jang等人,2026)。最近的一项工作Gen3R(Huang等人,2026)试图通过将潜在空间生成流水线扩展以同时处理重建任务来统一这两个任务。然而,这种设计引入了明显的局限性:扩散目标定义在中间潜在特征上,而非底层3D表示上,导致无法直接优化3D输出;此外,两个分支都受到预训练变分自编码器(Variational Autoencoder, VAE)或表示自编码器(RAE)引入的信息损失的影响,而后者本身还需要额外的训练。

为了解决这些局限性,我们在像素空间扩散范式下重新 formulation 统一问题,并引入了PixWorld,这是一个同时处理3D重建和生成的单一框架。这种设计带来了两个关键优势。首先,对于生成和重建而言,消除潜在阶段去除了潜在编码引入的信息损失以及VAE/RAE的额外训练成本,这对于作为保真度约束任务的重建尤为重要。其次,对于生成而言,扩散目标通过可微渲染直接监督3D表示(见图1),使训练信号与3D场景的保真度对齐,而非与中间潜在空间中的目标对齐。基于这一像素空间框架,统一问题简化为如何将两个任务暴露给单次前向传播。我们通过将多视图输入划分为干净和噪声子集来实现这一点:干净视图驱动重建,而噪声视图则在干净视图的条件下生成,两者均产生像素对齐的3D高斯表示(3D Gaussian Splatting, 3DGS)(Kerbl等人,2023)。

尽管存在这种直接的像素空间监督,图像级的光度损失和感知损失并不能完全保证几何上忠实的3D结构。为了解决这个问题,我们引入了几何感知损失(Geometry Perception Loss),使渲染视图及其真实值(ground-truth)在预训练3D基础模型的几何感知特征空间中相互接近。由于该特征空间编码了超越2D外观的3D几何结构,该损失直接鼓励渲染场景与真实值共享相同的底层几何结构。在RealEstate10K(Zhou等人,2018)、DL3DV(Ling等人,2024)和WorldScore(Duan等人,2025)上的大量实验表明,单一的PixWorld模型实现了高保真度的3D场景生成和重建,其性能与最先进的重建方法相匹敌,同时优于先前的潜在空间生成方法。

我们的主要贡献总结如下:

  • 我们提出了PixWorld,这是一个端到端的像素空间扩散框架,通过多视图可微渲染直接监督像素对齐的3D高斯表示,无需中间VAE或RAE。这消除了潜在自编码器的信息损失和训练成本,使扩散信号与3D场景本身的保真度对齐,并自然地在单一模型中统一了3D场景生成和重建。

2

第 3 页

• 我们引入了一种几何感知损失(Geometry Perception Loss),该损失在预训练3D基础模型的几何感知特征空间中,使渲染视图与真实视图对齐,从而提供超越2D光度损失和感知损失的3D结构监督。 • 实验表明,单个PixWorld模型在3D场景生成和重建任务上均取得了优越的性能,确立了像素空间扩散作为3D场景建模的统一范式。

2 相关工作

2.1 3D场景生成

基于扩散的迭代3D场景生成。早期的3D生成方法利用预训练的2D生成模型(Rombach et al., 2022; Podell et al., 2023; Zhang et al., 2023; Peebles & Xie, 2023)作为生成先验。其中一条代表性路线采用分数蒸馏采样(Score Distillation Sampling, SDS)(Lin et al., 2023; Poole et al., 2022; Tang et al., 2023; Wang et al., 2023),通过将渲染视图与预训练的2D扩散模型对齐,来优化3D表示,如3D高斯泼溅(3D Gaussian Splatting, 3DGS)(Kerbl et al., 2023)或神经辐射场(NeRF)(Mildenhall et al., 2021)。由于缺乏显式多视图约束,这些方法存在跨视图不一致的问题,且每场景的迭代优化进一步限制了其可扩展性。

基于多视图重建的3D场景生成。第二条路线首先使用预训练的2D扩散模型合成多视图图像或视频,然后从合成视图进行3D重建(Chen et al., 2024b; Gao et al., 2024; Hao et al., 2025; Liu et al., 2024; 2023; Sargent et al., 2023; Shi et al., 2023; Sun et al., 2024; Wu et al., 2024; Zhao et al., 2024)或进行增量外绘(incremental outpainting)(Chung et al., 2023; Fridman et al., 2023; Schwarz et al., 2025; Yu et al., 2024; 2025a)。虽然这些方法避免了每场景优化,但它们依赖于没有显式3D推理的2D RGB先验,往往导致几何不一致和多视图保真度较低。

潜在空间中的3D场景生成。最近的工作将扩散过程移至压缩的潜在空间,并学习一个潜在到3D的解码器,通常针对3DGS。其中一条路线冻结预训练的图像或视频变分自编码器(VAE)(例如SD-VAE (Podell et al., 2023), Wan-VAE (Wan et al., 2025)),并训练一个解码器,将生成的潜在变量映射到3D高斯,同时在潜在空间中微调扩散主干网络(Yang et al., 2025; Go et al., 2025b; Li et al., 2024; 2025b; Dai et al., 2025; Go et al., 2025c;a; Zhou et al., 2026; Wang et al., 2025b)。随着从VAE向表示自编码器(Representation Autoencoders, RAEs)(Zheng et al., 2025; Shi et al., 2025; Chen et al., 2025a; Bi et al., 2025)的转变,最近的一条路线在预训练3D基础模型的表示空间中操作(Gao et al., 2026; Sun et al., 2026; Jang et al., 2026)。在此基础上,Gen3R(Huang et al., 2026)进一步尝试在单个潜在空间模型中统一重建和生成。

2.2 3D场景重建

3D场景重建旨在从单个或多个捕获视图中恢复3D表示。经典流水线依赖多视图立体视觉和运动恢复结构(Structure-from-Motion)来估计密集几何结构,而NeRF(Mildenhall et al., 2021)和3D高斯泼溅(3D Gaussian Splatting, 3DGS)(Kerbl et al., 2023)则普及了用于高保真新视图合成的每场景优化。为了避免昂贵的每场景拟合,最近的直通(feed-forward)方法学习在单次前向传播中直接将稀疏或密集的多视图输入映射到3D表示(Hong et al., 2023; Charatan et al., 2024; Szymanowicz et al., 2024; Chen et al., 2024a; Xu et al., 2025),其中LRM(Hong et al., 2023)回归隐式三平面(implicit triplanes),而像素对齐的高斯回归器(Charatan et al., 2024; Szymanowicz et al., 2024; Chen et al., 2024a)预测逐像素高斯。这些方法是确定性的,并且以可用观测值为条件,因此无法合成超出输入视图范围的未见内容。

2.3 像素空间生成

潜在扩散模型(Latent Diffusion Models)(Rombach et al., 2022; Podell et al., 2023; Peebles & Xie, 2023)通过在压缩的VAE潜在空间中操作,主导了大规模图像生成,这在生成目标和像素输出之间引入了间接性。另一条互补的工作路线直接在像素空间中执行扩散(Dhariwal & Nichol, 2021; Jabri et al., 2023; Hoogeboom et al., 2023; 2025; Wang et al., 2025c; Chen et al., 2025c; Yu et al., 2025b; Ma et al., 2025; Chen et al., 2025d; Li & He, 2025),表明在拥有足够容量和数据的情况下,像素空间生成可以

3

第 4 页

a) 模型概览 共享 DiT 模块 噪声视图 × � 深度头 分块 投影器 3DGS 头 干净视图 FFN 分块 3DGS 头 自注意力 交叉注意力 合并的 3DGS 文本提示 投影器 深度头 A 预热 室内 客厅 场景 带有 壁炉, 沙发, 文本 桌子, 和 滑动 玻璃 编码器 门…

b) 流匹配损失 真实干净视图 c) 几何感知损失 真实值 几何感知 真实值 特征(渲染) 速度 渲染 �� LPIPS 3D 基础 特征匹配 预测流 模型 模型 速度 噪声 �� 渲染干净视图 视图 真实值 ���� 流匹配: 几何感知 ���= Ω�1 �∈Ω� �� −�� 特征(真实值)

图 2:PixWorld 概览。(a) PixWorld 采用统一的基于 DiT 的框架,接收噪声和干净的多视图输入,并可选地接受文本条件,通过共享的 Transformer 模块联合预测深度和 3DGS。(b) 对渲染的多视图图像施加像素空间流匹配损失,以直接优化底层 3D 表示。(c) 几何感知损失通过 3D 基础模型将渲染视图与真实观测值对齐,进一步强制结构一致性。

在保真度上匹配或超越其潜在空间对应模型。我们将这一视角扩展到 3D 设置:通过在像素空间直接执行扩散,PixWorld 移除了先前潜在空间 3D 方法中的中间 VAE/RAE,并通过预测的 3DGS 的可微渲染直接监督 3D 表示。

3 方法论

我们提出 PixWorld,这是一个统一的像素空间扩散框架,在单个模型中联合解决 3D 场景重建和生成问题(图 2)。给定一组具有位姿的多视图图像,PixWorld 将它们划分为干净子集和噪声子集,通过双流扩散 Transformer 联合处理两者,并将生成的特征解码为像素对齐的 3D 高斯表示 (Kerbl et al., 2023)。预测的高斯被渲染回图像,扩散目标直接在这些图像上进行监督,使优化与 3D 场景保真度对齐,而不是与中间潜在空间中的目标对齐。为了进一步提供超越在 2D 图像级别运行的光度损失和感知损失的 3D 结构监督,我们引入了定义在预训练 3D 基础模型的几何感知特征空间中的几何感知损失。

3.1 预备知识:像素空间扩散

我们首先简要回顾标准 2D 图像设置中的扩散,并对比像素空间扩散与潜在空间扩散。在潜在扩散中,图像 $x$ 首先由预训练的图像自编码器(例如 VAE 或 RAE)映射到紧凑的潜在表示中,记为 $E_{AE} : x \mapsto z$。然后在潜在空间中执行扩散,最后由 $D_{AE} : \hat{z} \mapsto \hat{x}$ 将去噪后的潜在变量映射回 RGB 空间。这种设计降低了扩散建模的维度和计算成本,但也在扩散变量和最终图像空间监督之间插入了一个中间自编码瓶颈。

遵循 JiT (Li & He, 2025),我们转而采用像素空间中的图像预测。给定干净图像 $x \in \mathbb{R}^{H \times W \times 3}$,高斯噪声样本 $\epsilon \sim \mathcal{N}(0, I)$ 和时间步 $t \in [0, 1]$,通过线性插值构建噪声输入 $x_t = t x + (1 – t) \epsilon$。去噪器直接参数化为图像预测器,

$f_\theta : (x_t, t, c) \mapsto \hat{x}$, (1)

4

第 5 页

其中 $c$ 表示类别标签或文本嵌入等条件信息。预测图像被转换为速度场 $\hat{v} = (\hat{x} – x_t)/(1 – t)$,从而得到流匹配(Flow Matching)目标

$$ L_{FM} = \mathbb{E}_{x,\epsilon,t} \|\hat{v} – v\|_2^2 = \mathbb{E}_{x,\epsilon,t} \frac{\|\hat{x} – x\|_2^2}{(1 – t)^2}, \quad (2) $$

其中 $v = x – \epsilon$ 是真实速度。这种像素空间参数化对我们的 3D 设置特别有吸引力。潜在扩散(Latent diffusion)在编码后的潜在变量上定义其目标,使得扩散过程与渲染输出及其旨在监督的底层 3D 表示解耦。相比之下,像素空间扩散将扩散变量和渲染输出保持在相同的 RGB 域中,因此扩散目标可以直接在渲染图像上进行监督,使优化与 3D 场景保真度对齐,而不是与中间潜在空间中的目标对齐。

3.2 PIXWORLD 框架

任务定义。基于上述 2D 像素空间扩散公式,PixWorld 将图像预测扩展到具有位姿的多视图设置。给定一个包含 $N$ 个具有位姿视图的场景,我们用 $I = \{I_n\}_{n=1}^N$ 和 $T = \{T^n\}_{n=1}^N$ 分别表示 RGB 图像和相机参数,其中 $I_n \in \mathbb{R}^{H \times W \times 3}$ 是第 $n$ 个视图的 RGB 图像,$T^n$ 表示其相机参数。我们将视图索引划分为干净子集 $\Omega_c$ 和噪声子集 $\Omega_n$,使得

$$ \Omega_c \cup \Omega_n = \{1, \dots, N\}, \quad \Omega_c \cap \Omega_n = \emptyset, \quad |\Omega_c| \ge 1. \quad (3) $$

当 $\Omega_n = \emptyset$ 时,该任务简化为从干净观测值进行多视图 3D 重建。否则,PixWorld 基于干净视图预测噪声视图。可选的文本提示 $y$ 可进一步指定场景。

对于每个视图 $n$,模型输入定义为

$$ \tilde{I}_n^t = \begin{cases} I_n, & n \in \Omega_c, \\ t I_n + (1 – t)\epsilon_n, & n \in \Omega_n, \end{cases} \quad \epsilon_n \sim \mathcal{N}(0, I), \quad (4) $$

其中同一场景的所有噪声视图共享相同的时间步 $t$。我们将混合多视图输入记为 $\tilde{I}_t = \{\tilde{I}_n^t\}_{n=1}^N$。

双流扩散 Transformer。给定混合输入 $\tilde{I}_t$,PixWorld 使用双流扩散 Transformer

$$ f_\theta : (\tilde{I}_t, T, y) \mapsto (\hat{D}, \hat{G}), \quad (5) $$

其中 $\hat{D} = \{\hat{D}_n\}_{n=1}^N$ 表示预测的多视图深度图,$\hat{G}$ 表示预测的像素对齐 3D 高斯场景表示。干净视图和噪声视图通过独立的输入投影进行嵌入,并由共享的 Transformer 块联合处理。噪声流以采样的时间步 $t$ 为条件,而干净流始终接收对应于 $t = 1$ 的完全去噪时间嵌入。相机参数通过 PRoPE (Li et al., 2025a) 注入,可选的文本条件通过交叉注意力融合。

3D 高斯解码与渲染。从共享特征中,网络为每个视图预测深度图 $\hat{D}_n$ 以及定义 $\hat{G}$ 的高斯属性。我们不是直接回归 3D 中心,而是使用预测的深度和相机对每个像素进行反投影:对于第 $n$ 个视图中深度为 $\hat{d}_n^p$ 的第 $p$ 个像素,高斯中心为 $\mu_n^p = \Pi^{-1}(p, \hat{d}_n^p, T^n)$,其中 $\Pi^{-1}$ 是到世界空间的逆投影。跨所有像素和视图聚合得到场景级表示 $\hat{G}$,并通过可微渲染器 $\mathcal{R} : (\hat{G}, T^n) \mapsto \bar{I}_n$ 进行渲染,得到渲染后的多视图集合 $\bar{I} = \{\bar{I}_n\}_{n=1}^N$。

FM 渲染与深度目标。为了使渲染监督与第 3.1 节介绍的基于速度的参数化对齐,我们以相同的 FM 风格制定渲染损失。对于每个噪声视图 $n \in \Omega_n$,我们将渲染速度和真实速度定义为 $\bar{v}_n = (\bar{I}_n – \tilde{I}_n^t)/(1 – t)$ 和 $v_n = (I_n – \tilde{I}_n^t)/(1 – t)$,其中 $v_n = I_n – \epsilon_n$ 直接遵循公式 4。对于每个

第 6 页

对于干净视图 $n \in \Omega_c$,渲染图像 $\bar{I}_n$ 通过直接均方误差(MSE)项与观测值 $I_n$ 进行监督,因为干净视图作为无噪声重建锚点。随后我们定义

$$ L_{\text{render}} = \underbrace{\frac{1}{|\Omega_c|} \sum_{n \in \Omega_c} \|\bar{I}_n – I_n\|_2^2}_{L_{\text{recon}}} + \underbrace{\frac{1}{|\Omega_n|} \mathbb{1}[|\Omega_n| > 0] \sum_{n \in \Omega_n} \|\bar{v}_n – v_n\|_2^2}_{L_{\text{FM}}} + \lambda_{\text{lpips}} L_{\text{lpips}}, \quad (6) $$

其中 FM 项在图像空间中等价地写为 $\frac{1}{|\Omega_n|} \sum_{n \in \Omega_n} \frac{\|\bar{I}_n – I_n\|_2^2}{(1-t)^2}$,感知项定义为 $L_{\text{lpips}} = \mathbb{1}[t > t_{\text{th}}] \frac{1}{N} \sum_{n=1}^N L_{\text{LPIPS}}(\bar{I}_n, I_n)$。指示函数 $\mathbb{1}[|\Omega_n| > 0]$ 在纯重建情况下($\Omega_n = \emptyset$)禁用 FM 项,而 $|\Omega_c| \ge 1$ 由公式 3 保证。我们仅在 $t > t_{\text{th}}$ 时激活 LPIPS 项,因为当噪声输入过于接近纯噪声时,感知监督不可靠。我们进一步在每个迭代中采样 4–8 个新视图,并通过 MSE 和 lpips 损失对其渲染结果与真实图像进行监督,从而正则化 3D Gaussian Splatting (3DGS) 使其能从所有视角良好渲染。

我们进一步通过以下方式对预测的深度图与伪深度标签 $D^\star = \{D^\star_n\}_{n=1}^N$(源自 DA3 (Lin et al., 2025))进行监督:

$$ L_{\text{depth}} = \frac{1}{N} \sum_{n=1}^N \rho(\log \hat{D}_n – \log D^\star_n), \quad (7) $$

其中 $\rho(\cdot)$ 是逐元素应用并在像素上取平均的 Huber 损失。

3.3 几何感知损失 (Geometry Perception Loss)

动机。尽管 $L_{\text{render}}$ 强制了视图一致性,但其本质仍是光度层面的,因此未能完全约束潜在的 3D 结构。具体而言,只要投影外观得以保持,深度可能会沿观察射线发生漂移;半透明漂浮物可能会平均为合理的颜色;且视图依赖纹理可以部分补偿几何错位。这些歧义对于噪声视图尤其成问题,因为它们在输入阶段没有直接的真实图像监督。

为了用更结构化的信号补充像素级监督,我们引入了定义在冻结的 3D 基础模型 $\Psi$(例如 VGGT (Wang et al., 2025a) 或 $\pi^3$ (Wang et al., 2025d))的特征空间中的几何感知损失。

几何感知损失。给定在相同相机 $T$ 下的渲染视图集 $\bar{I}$ 和真实视图集 $I$,我们使用 $\Psi: (I, T) \mapsto H \in \mathbb{R}^{N \times C_\Psi \times H' \times W'}$ 提取多视图几何特征。对渲染图像和参考图像应用 $\Psi$ 得到:

$$ \bar{H} = \Psi(\bar{I}, T) = \{\bar{H}_n\}_{n=1}^N, \quad H^\star = \Psi(I, T) = \{H^\star_n\}_{n=1}^N, \quad (8) $$

其中 $\bar{H}_n$ 和 $H^\star_n$ 分别表示第 $n$ 个视图的渲染和参考特征图。我们仅在时间步足够大时,最小化两个特征场之间每个位置的平均余弦距离:

$$ L_{\text{geo}} = \mathbb{1}[t > t_{\text{th}}] \frac{1}{N H' W'} \sum_{n=1}^N \sum_{p} \left( 1 – \frac{\langle \bar{h}^p_n, h^{\star p}_n \rangle}{\|\bar{h}^p_n\|_2 \|h^{\star p}_n\|_2} \right), \quad (9) $$

其中 $\bar{h}^p_n$ 和 $h^{\star p}_n$ 分别是 $\bar{H}_n$ 和 $H^\star_n$ 在位置 $p$ 处的特征向量。由于 $\Psi$ 将所有视图及其相机联合处理,其特征编码了跨视图的 3D 结构,而不仅仅是单张图像的外观。因此,两个在各自图像上光度一致但在 3D 上相互不一致的渲染结果,仍会产生不同的特征图并导致较大的 $L_{\text{geo}}$。在训练过程中,我们冻结 $\Psi$,停止参考分支 $H^\star$ 的梯度,仅通过渲染分支 $\bar{H}$ 进行反向传播,从而使 $\Psi$ 纯粹充当结构判别器。我们仅在 $t > t_{\text{th}}$ 时激活此项,因为当噪声输入过于接近纯噪声时,几何特征匹配是不稳定的。

总体目标。完整的训练目标为 $L = L_{\text{render}} + \lambda_{\text{depth}} L_{\text{depth}} + \lambda_{\text{geo}} L_{\text{geo}}$。

6

第 7 页

表 1:在 4 视图和 8 视图输入设置下,RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 上新视角合成的定量比较。最佳结果以粗体显示;次佳结果以下划线标示。

RealEstate10K DL3DV-10K

4-views 8-views 4-views 8-views

Method PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓ PSNR↑ SSIM↑ LPIPS↓

MVSplat (Chen et al., 2024a) 22.58 0.762 0.264 21.64 0.719 0.301 17.11 0.501 0.410 15.75 0.432 0.491 DepthSplat (Xu et al., 2025) 25.16 0.832 0.194 27.77 0.872 0.154 20.38 0.719 0.320 19.26 0.692 0.360 AnySplat (Jiang et al., 2025) 20.07 0.731 0.286 20.52 0.752 0.262 20.11 0.671 0.318 20.02 0.664 0.327 YoNoSplat (Ye et al., 2026a) 25.86 0.841 0.143 28.35 0.889 0.107 22.89 0.710 0.228 21.92 0.678 0.262 PixWorld (Ours) 26.21 0.844 0.138 28.58 0.892 0.101 23.18 0.714 0.226 22.46 0.681 0.257

表 2:单图像 3D 场景生成的定量比较,取平均值。在 1 视图设置下,RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 上的结果,对 First Frame 和 Bidirectional 配置取平均。最佳结果以粗体显示;次佳结果以下划线标示。

Novel View Synthesis Generation Quality Camera Control

Method PSNR↑ SSIM↑ LPIPS↓ I2V Subj.↑ I2V BG↑ I.Q.↑ Aes.Q.↑ AUC@30↑ AUC@15↑ AUC@5↑

RealEstate10K LVSM (Jin et al., 2025) 17.82 0.603 0.336 0.971 0.970 0.593 0.506 0.710 0.592 0.372 GF (Wu et al., 2025) 15.63 0.553 0.454 0.931 0.941 0.504 0.475 0.596 0.478 0.290 Gen3C (Ren et al., 2025) 17.26 0.624 0.391 0.951 0.956 0.561 0.524 0.648 0.514 0.334 FlashWorld (Li et al., 2025b) 16.51 0.626 0.403 0.958 0.960 0.615 0.550 0.843 0.758 0.546 Gen3R (Huang et al., 2026) 17.59 0.631 0.382 0.974 0.971 0.552 0.536 0.633 0.433 0.147 PixWorld (Ours) 18.88 0.702 0.325 0.979 0.978 0.623 0.556 0.869 0.798 0.614

DL3DV-10K LVSM (Jin et al., 2025) 14.91 0.433 0.530 0.931 0.933 0.494 0.466 0.552 0.372 0.134 GF (Wu et al., 2025) 12.69 0.356 0.591 0.898 0.910 0.474 0.435 0.491 0.338 0.113 Gen3C (Ren et al., 2025) 15.58 0.514 0.479 0.927 0.933 0.532 0.496 0.552 0.377 0.128 FlashWorld (Li et al., 2025b) 15.42 0.473 0.461 0.942 0.950 0.619 0.558 0.769 0.674 0.420 Gen3R (Huang et al., 2026) 15.75 0.503 0.495 0.944 0.942 0.547 0.530 0.593 0.398 0.117 PixWorld (Ours) 16.50 0.527 0.449 0.952 0.956 0.631 0.567 0.793 0.706 0.485

4 实验

4.1 训练细节

PixWorld 拥有约 10.4 亿参数,并在 Re10K (Zhou et al., 2018) + DL3DV-10K (Ling et al., 2024) 混合数据集(共约 67K 个场景)上从头开始训练,并辅以来自 BLIP-3o (Chen et al., 2025b) 语料库的 1000 万张单张图像,这些图像共享扩散骨干网络作为 2D 外观先验。对于每个多视图场景,我们采样 $N \in \{4, \dots, 8\}$ 个带位姿的视图,并将它们随机划分为 $\Omega_c$ 和 $\Omega_n$,偏向较小的 $|\Omega_c|$,以便将容量用于条件生成,同时全干净情况($\Omega_n = \emptyset$)为几何头提供基础。我们使用 $\Psi=\pi^3$ (Wang et al., 2025d) 作为 $L_{geo}$ 的冻结 3D 判别器,并设置 $\lambda_{depth}=1.0$ 和 $\lambda_{lpips}=\lambda_{geo}=0.1$,感知和几何项由 $t > t_{th}=0.3$ 门控。模型使用 AdamW (Loshchilov & Hutter, 2017) 在 32 块 NVIDIA A800-SXM4-80G GPU 上以 336×448 的训练分辨率优化约 200K 步。完整的架构规范、批处理和优化器调度推迟至附录 B。

4.2 评估协议

我们在涵盖 3D 重建和 3D 场景生成的四个协议上评估 PixWorld(见图 3)。对于 RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024),我们从每个数据集中随机采样 200 个测试场景,限制为具有大相机位姿范围的片段,以便协议强调宽基线推理;对于 WorldScore (Duan et al., 2025),我们遵循官方静态划分(2000 个场景)。对于所有场景生成协议,每个基线均以相机位姿为条件,除 LVSM (Jin et al., 2025) 外的所有基线还额外接收文本条件。对于重建(表 1),模型给定 4 或 8 个带位姿的视图,并在真实位姿下渲染保留的目标,通过 PSNR、SSIM (Wang et al., 2004) 和 LPIPS (Zhang et al., 2018) 进行评估。对于 1 视图生成(表 2),每个数据集的 200 个场景被划分为 100 个 First-Frame 场景(从第一帧生成的正向轨迹)和 100 个 Bidirectional 场景(随机选择的中间帧作为条件向两端生成);2 视图生成(表 3)同样结合 100 个 Interpolation 场景(端点锚点,生成中间视图)和 100 个 Extrapolation 场景(锚点在一端,

7

第 8 页

表3:在双视图3D场景生成任务上的定量比较,取平均值。结果基于RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 数据集,在双视图设置下,对插值(Interpolation)和外推(Extrapolation)配置的结果取平均。粗体表示最佳结果;下划线表示次佳结果。

| | 新视角合成 (Novel View Synthesis) | | | 生成质量 (Generation Quality) | | | | | 相机控制 (Camera Control) | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 方法 (Method) | PSNR↑ | SSIM↑ | LPIPS↓ | I2V 主体↑ (I2V Subj.↑) | I2V 背景↑ (I2V BG↑) | 图像质量↑ (I.Q.↑) | 美学质量↑ (Aes.Q.↑) | AUC@30↑ | AUC@15↑ | AUC@5↑ | | RealEstate10K | | | | | | | | | | | | LVSM (Jin et al., 2025) | 23.61 | 0.819 | 0.215 | 0.970 | 0.964 | 0.607 | 0.516 | 0.861 | 0.788 | 0.611 | | GF (Wu et al., 2025) | 18.27 | 0.647 | 0.353 | 0.925 | 0.939 | 0.507 | 0.464 | 0.630 | 0.473 | 0.223 | | Gen3C (Ren et al., 2025) | 20.12 | 0.714 | 0.300 | 0.948 | 0.947 | 0.567 | 0.518 | 0.698 | 0.538 | 0.255 | | FlashWorld (Li et al., 2025b) | 21.48 | 0.770 | 0.257 | 0.964 | 0.962 | 0.619 | 0.547 | 0.877 | 0.811 | 0.637 | | Gen3R (Huang et al., 2026) | 21.33 | 0.724 | 0.283 | 0.970 | 0.972 | 0.550 | 0.540 | 0.728 | 0.576 | 0.258 | | PixWorld (Ours) | 23.54 | 0.815 | 0.210 | 0.974 | 0.974 | 0.628 | 0.561 | 0.880 | 0.817 | 0.649 | | DL3DV-10K | | | | | | | | | | | | LVSM (Jin et al., 2025) | 19.18 | 0.589 | 0.343 | 0.915 | 0.917 | 0.533 | 0.502 | 0.740 | 0.609 | 0.374 | | GF (Wu et al., 2025) | 15.38 | 0.459 | 0.470 | 0.897 | 0.912 | 0.479 | 0.445 | 0.563 | 0.379 | 0.147 | | Gen3C (Ren et al., 2025) | 17.62 | 0.542 | 0.412 | 0.927 | 0.934 | 0.536 | 0.502 | 0.627 | 0.433 | 0.176 | | FlashWorld (Li et al., 2025b) | 18.27 | 0.562 | 0.359 | 0.938 | 0.948 | 0.600 | 0.558 | 0.802 | 0.714 | 0.514 | | Gen3R (Huang et al., 2026) | 18.05 | 0.558 | 0.392 | 0.942 | 0.944 | 0.535 | 0.530 | 0.726 | 0.560 | 0.245 | | PixWorld (Ours) | 19.37 | 0.594 | 0.340 | 0.950 | 0.956 | 0.607 | 0.565 | 0.821 | 0.734 | 0.534 |

表4:在WorldScore基准测试 (Duan et al., 2025) 上的定量比较。我们报告了所有七个官方指标及其平均值。粗体和下划线分别表示最佳和次佳结果。

| | 相机控制 (Camera Control) | 物体控制 (Object Control) | 内容对齐 (Content Alignment) | 3D一致性 (3D Consistency) | 光度一致性 (Photometric Consistency) | 风格一致性 (Style Consistency) | 主观质量 (Subjective Quality) | 平均 (Average) | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 方法 (Method) | | | | | | | | | | Wan-2.1 (Wan et al., 2025) | 23.53 | 40.32 | 45.44 | 78.74 | 78.36 | 77.18 | 59.38 | 57.56 | | WonderJourney (Yu et al., 2024) | 84.60 | 37.10 | 35.54 | 80.60 | 79.03 | 62.82 | 66.56 | 63.75 | | LucidDreamer (Chung et al., 2023) | 88.93 | 41.18 | 75.00 | 90.37 | 90.20 | 48.10 | 58.99 | 70.40 | | FlashWorld (Li et al., 2025b) | 84.43 | 50.28 | 56.54 | 85.87 | 86.72 | 79.36 | 52.75 | 70.85 | | PixWorld (ours) | 91.08 | 46.25 | 55.27 | 91.39 | 93.84 | 67.11 | 52.36 | 71.04 |

超出其跨度范围生成的视图)。对于两种生成设置,我们报告了三组指标,每组针对3D世界模型的一项能力:针对真实目标视图的新视角合成(NVS)保真度(PSNR、SSIM、LPIPS);来自VBench (Huang et al., 2024) 的生成质量(I2V主体、I2V背景、图像质量、美学质量),用于评估无需配对参考的感知真实性;以及通过π3 (Wang et al., 2025d) 估计的从生成帧中恢复的姿态与条件轨迹之间的 AUC@{30◦, 15◦, 5◦} (Wang et al., 2025e) 来衡量相机控制精度。在WorldScore(表4)上,我们报告了所有七个官方指标及其平均值:相机控制和物体控制衡量轨迹控制保真度,内容对齐衡量对文本提示的忠实度,3D一致性和光度一致性评估跨视图的几何和外观稳定性,风格一致性捕捉视觉风格的一致性,主观质量反映整体感知质量,基线数据取自WorldScore发布版本。

4.3 3D 场景重建

表1报告了在RealEstate10K和DL3DV-10K上,使用4视图和8视图输入的新视角合成结果。需要注意的是,Gen3R (Huang et al., 2026) 虽然是一个统一的生成与重建模型,但仅支持点云重建,因此在NVS方面不可直接比较,故在此省略。我们进一步指出,YoNoSplat支持无姿态(pose-free)和有姿态(with-pose)两种模式;为了进行更充分的比较,我们采用其有姿态的结果,该结果利用真实相机姿态作为额外输入。即使面对这一更强的基线,PixWorld在所有设置下均取得了最佳的PSNR和LPIPS,并在RealEstate10K上取得了最佳的SSIM,仅在DL3DV-10K的SSIM上略低于DepthSplat。具体而言,PixWorld在RealEstate10K和DL3DV-10K(4/8视图)上均持续提高了PSNR,并在所有情况下降低了LPIPS(例如,在RealEstate10K的4视图设置中,从0.143降至0.138)。这些结果表明,我们的像素空间公式化和几何感知监督带来了更强的跨视图一致性和更准确的3D重建。

8

第 9 页

图 3:PixWorld 在不同设置下的可视化。PixWorld 灵活处理 3D 重建和生成:当所有输入视图均为干净视图时,它执行重建;当干净视图和噪声视图任意混合时,它执行生成。我们可视化了相机轨迹,其中蓝色和红色视锥分别表示干净输入视图和生成视图。

表 5:几何感知损失(Geometry Perception Loss)的消融研究。我们在 RealEstate10K (Zhou et al., 2018) 的 1-view 设置下报告结果。

变体 PSNR↑ SSIM↑ LPIPS↓ I2V Subj.↑ I2V BG↑ I.Q.↑ Aes.Q.↑ AUC@30↑ AUC@15↑ AUC@5↑

完整模型 19.12 0.717 0.310 0.972 0.975 0.619 0.561 0.886 0.813 0.642 无几何感知 17.99 0.612 0.332 0.973 0.974 0.613 0.541 0.847 0.763 0.562

4.4 3D 场景生成

我们在 RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 上,针对单张和两张图像条件设置,将 PixWorld 与五个具有代表性的基线方法进行比较:LVSM (Jin et al., 2025)、GF (Wu et al., 2025)、Gen3C (Ren et al., 2025)、FlashWorld (Li et al., 2025b) 和 Gen3R (Huang et al., 2026)。我们报告了新视图合成质量(PSNR、SSIM、LPIPS)、VBench 风格的生成质量,以及通过 π3 估计的多阈值 AUC 所衡量的位姿精度。在单图像设置(表 2)中,PixWorld 在两个数据集的第一帧(First-Frame)和双向(Bidirectional)轨迹的平均表现上均位居所有指标之首,在 RealEstate10K 上将 PSNR 提升了 +1.06 dB(18.88 对比 17.82),在 DL3DV-10K 上提升了 +0.75 dB(16.50 对比 15.75);在严格位姿阈值下,增益最为显著,AUC@5 从 0.546 提升至 0.614,从 0.420 提升至 0.485,这表明在像素空间进行扩散并通过可微渲染进行监督能够产生几何上忠实(geometrically faithful)的轨迹。在双图像条件设置(表 3)中,PixWorld 在感知、生成和位姿指标上再次领先,取得了最佳的 LPIPS(0.210/0.340)和 AUC@5(0.649/0.534);LVSM 仅在原始 PSNR/SSIM 上具有竞争力(在 RealEstate10K 上差距 < 0.07 dB),这反映了其确定性回归目标。在 WorldScore (Duan et al., 2025)(表 4)中,PixWorld 取得了最佳的总体平均分(71.04),并在相机可控性(91.08)、3D 一致性(91.39)和光度一致性(93.84)方面排名第一;见图 4。

4.5 消融研究

我们在 RealEstate10K (Zhou et al., 2018) 的 1-view 设置下(表 5)对几何感知损失进行消融研究。为了进行受控比较,我们采样了一个 10K 序列子集,并在相同设置下对两种变体训练 30K 步,仅切换几何感知损失。移除该损失一致地导致所有三个指标组下降:PSNR 下降 1.13 dB(19.12 → 17.99),SSIM 下降 0.105(0.717 → 0.612),AUC@5 下降 0.080(0.642 → 0.562,相对下降约 12.5%),而 VBench 风格的分数几乎没有变化。这种模式符合我们的动机:2D 光度损失和感知损失保持单个帧在视觉上合理,但底层 3D 几何缺乏监督,因此跨视图一致性和位姿保真度受损(见附录 D 中的图 5)。通过在预训练 3D 基础模型的几何感知特征空间中对齐渲染视图和真实视图,我们的

9

第 10 页

图 4:与基线方法的对比可视化。上方较大的视图表示输入视图,而下方两个较小的视图展示了每种方法生成的新视图。

该损失提供了 2D 目标无法提供的 3D 结构信号,验证了其作为 PixWorld 关键组件的有效性。

5 结论

我们提出了 PixWorld,这是一个端到端的像素空间扩散框架,通过将多视图输入划分为干净和噪声子集,并在一次前向传播中生成像素对齐的 3D 高斯表示,从而在单个模型中统一了 3D 场景生成与重建。消除中间 VAE/RAE 阶段避免了潜在自编码器的信息损失和额外训练成本,并使扩散目标能够通过可微渲染而非中间潜在目标直接监督 3D 表示;为了在 2D 光度损失和感知损失之外进一步强制 3D 结构一致性,几何感知损失在预训练 3D 基础模型的几何感知特征空间中对齐渲染视图和真实视图。这些结果表明,像素空间扩散通过消除潜在间接性并自然地将生成与重建统一起来,标志着向可扩展且统一的 3D 场景建模迈进的一种有前景的范式。

参考文献

Tianci Bi, Xiaoyi Zhang, Yan Lu, and Nanning Zheng. Vision foundation models can be good tokenizers for latent diffusion models. arXiv preprint arXiv:2510.18457, 2025.

David Charatan, Sizhe Lester Li, Andrea Tagliasacchi, and Vincent Sitzmann. pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 19457–19467, 2024.

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, and Kai Zhang. Aligning visual foundation encoders to tokenizers for diffusion models. arXiv preprint arXiv:2509.25162, 2025a.

Jiuhai Chen, Zhiyang Xu, Xichen Pan, Yushi Hu, Can Qin, Tom Goldstein, Lifu Huang, Tianyi Zhou, Saining Xie, Silvio Savarese, et al. Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset. arXiv preprint arXiv:2505.09568, 2025b.

Shoufa Chen, Chongjian Ge, Shilong Zhang, Peize Sun, and Ping Luo. Pixelflow: Pixel-space generative models with flow. arXiv preprint arXiv:2504.07963, 2025c.

Yuedong Chen, Haofei Xu, Chuanxia Zheng, Bohan Zhuang, Marc Pollefeys, Andreas Geiger, Tat-Jen Cham, and Jianfei Cai. Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images. In European conference on computer vision, pp. 370–386. Springer, 2024a.

10

第 11 页

Yuedong Chen, Chuanxia Zheng, Haofei Xu, Bohan Zhuang, Andrea Vedaldi, Tat-Jen Cham, 和 Jianfei Cai. Mvsplat360: 从稀疏视图进行前向传播的360场景合成. Adv. Neural Inform. Process. Syst., 37:107064–107086, 2024b.

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, 和 Ying Tai. Dip: 驯服像素空间中的扩散模型. arXiv preprint arXiv:2511.18822, 2025d.

Jaeyoung Chung, Suyoung Lee, Hyeongjin Nam, Jaerin Lee, 和 Kyoung Mu Lee. Luciddreamer: 无需领域的3D高斯泼溅场景生成. arXiv preprint arXiv:2311.13384, 2023.

Yixiang Dai, Fan Jiang, Chiyu Wang, Mu Xu, 和 Yonggang Qi. Fantasyworld: 通过统一的视频和3D预测实现几何一致的世界建模. arXiv preprint arXiv:2509.21657, 2025.

Prafulla Dhariwal 和 Alexander Nichol. 扩散模型在图像合成上优于GANs. Advances in neural information processing systems, 34:8780–8794, 2021.

Jingtao Ding, Yunke Zhang, Yu Shang, Yuheng Zhang, Zefang Zong, Jie Feng, Yuan Yuan, Hongyuan Su, Nian Li, Nicholas Sukiennik, 等. 理解世界还是预测未来?世界模型的综合综述. ACM Computing Surveys, 58(3):1–38, 2025.

Haoyi Duan, Hong-Xing Yu, Sirui Chen, Li Fei-Fei, 和 Jiajun Wu. Worldscore: 世界生成的统一评估基准. arXiv preprint arXiv:2504.00983, 2025.

Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, 等. 扩展整流流Transformer以实现高分辨率图像合成. In Int. Conf. Mach. Learn., 2024.

Rafail Fridman, Amit Abecasis, Yoni Kasten, 和 Tali Dekel. Scenescape: 文本驱动的连贯场景生成. Adv. Neural Inform. Process. Syst., 36:39897–39914, 2023.

Ruiqi Gao, Aleksander Holynski, Philipp Henzler, Arthur Brussee, Ricardo Martin-Brualla, Pratul Srinivasan, Jonathan T Barron, 和 Ben Poole. Cat3d: 使用多视图扩散模型在3D中创建任何内容. arXiv preprint arXiv:2405.10314, 2024.

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang Liu, Mingming Gong, 和 Jiawang Bian. Oneworld: 使用3D统一表示自编码器驯服场景生成. arXiv preprint arXiv:2603.16099, 2026.

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, 和 Konrad Schindler. Vist3a: 通过将多视图重建网络连接到视频生成器实现文本到3D. arXiv preprint arXiv:2510.13454, 2025a.

Hyojun Go, Byeongjun Park, Jiho Jang, Jin-Young Kim, Soonwoo Kwon, 和 Changick Kim. Splatflow: 用于3D高斯泼溅合成的多视图整流流模型. In IEEE Conf. Comput. Vis. Pattern Recog., pp. 21524–21536, 2025b.

Hyojun Go, Byeongjun Park, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, 和 Changick Kim. Videorfsplat: 具有灵活姿态和多视图联合建模的直接场景级文本到3D高斯泼溅生成. arXiv preprint arXiv:2503.15855, 2025c.

Junlin Hao, Peiheng Wang, Haoyang Wang, Xinggong Zhang, 和 Zongming Guo. Gaussvideo- dreamer: 使用视频扩散和不一致性感知高斯泼溅进行3D场景生成. arXiv preprint arXiv:2504.10001, 2025.

Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, 和 Hao Tan. Lrm: 用于单图像到3D的大型重建模型. arXiv preprint arXiv:2311.04400, 2023.

Emiel Hoogeboom, Jonathan Heek, 和 Tim Salimans. simple diffusion: 端到端高分辨率图像扩散. In International Conference on Machine Learning, pp. 13213–13232. PMLR, 2023.

11

第 12 页

Emiel Hoogeboom, Thomas Mensink, Jonathan Heek, Kay Lamerigts, Ruiqi Gao, 和 Tim Salimans。 更简单的扩散模型:在 ImageNet512 上像素空间扩散达到 1.5 FID。 在计算机视觉与模式识别会议论文集(Proceedings of the Computer Vision and Pattern Recognition Conference)中,页码 18062–18071,2025。

Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, 和 Yiyi Liao。Gen3r:3D 场景生成与前馈重建的结合。arXiv 预印本 arXiv:2601.04090,2026。

Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit 等人。Vbench:视频生成模型的全面基准测试套件。在 IEEE 计算机视觉与模式识别会议(IEEE Conf. Comput. Vis. Pattern Recog.)中,页码 21807–21818,2024。

Allan Jabri, David J Fleet, 和 Ting Chen。用于迭代生成的可扩展自适应计算。在第 40 届国际机器学习会议论文集(Proceedings of the 40th International Conference on Machine Learning)中,页码 14569–14589,2023。

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, 和 Sainan Liu。将几何基础模型重新用于多视图扩散。arXiv 预印本 arXiv:2603.22275,2026。

Lihan Jiang, Yucheng Mao, Linning Xu, Tao Lu, Kerui Ren, Yichen Jin, Xudong Xu, Mulin Yu, Jiangmiao Pang, Feng Zhao 等人。Anysplat:来自非受限视角的前馈 3D 高斯泼溅(3D Gaussian Splatting)。ACM 图形学汇刊(ACM Transactions on Graphics, TOG),44(6):1–16,2025。

Haian Jin, Hanwen Jiang, Hao Tan, Kai Zhang, Sai Bi, Tianyuan Zhang, Fujun Luan, Noah Snavely, 和 Zexiang Xu。LVSM:具有最小 3D 归纳偏置的大规模视图合成模型。在国际学习表征会议(Int. Conf. Learn. Represent.)中,2025。

Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, George Drettakis 等人。用于实时辐射场渲染的 3D 高斯泼溅(3D Gaussian Splatting)。ACM 图形学汇刊(ACM Trans. Graph.),42(4):139–1,2023。

Diederik P Kingma 和 Max Welling。自动编码变分贝叶斯。arXiv 预印本 arXiv:1312.6114,2013。

Lingdong Kong, Wesley Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia 等人。3D 和 4D 世界建模:综述。arXiv 预印本 arXiv:2509.07996,2025。

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, Jia-Wang Bian, Hang Xu, 和 Xiaodan Liang。以几何思维进行推理:用于空间推理的主动几何集成。在第 43 届国际机器学习会议(ICML)论文集(Proceedings of the 43rd International Conference on Machine Learning (ICML))中,机器学习研究论文集。PMLR,2026。

Ruilong Li, Brent Yi, Junchen Liu, Hang Gao, Yi Ma, 和 Angjoo Kanazawa。相机作为相对位置编码。神经信息处理系统进展(Advances in Neural Information Processing Systems),2025a。

Tianhong Li 和 Kaiming He。回归基础:让去噪生成模型去噪。arXiv 预印本 arXiv:2511.13720,2025。

Xinyang Li, Zhangyu Lai, Linning Xu, Yansong Qu, Liujuan Cao, Shengchuan Zhang, Bo Dai, 和 Rongrong Ji。Director3D:从文本生成真实世界相机轨迹和 3D 场景。神经信息处理系统进展(Adv. Neural Inform. Process. Syst.),37:75125–75151,2024。

Xinyang Li, Tengfei Wang, Zixiao Gu, Shengchuan Zhang, Chunchao Guo, 和 Liujuan Cao。FlashWorld:在数秒内生成高质量 3D 场景。arXiv 预印本 arXiv:2510.13678,2025b。

Xiuyu Li, Yijiang Liu, Long Lian, Huanrui Yang, Zhen Dong, Daniel Kang, Shanghang Zhang, 和 Kurt Keutzer。Q-Diffusion:量化扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集(Proceedings of the IEEE/CVF International Conference on Computer Vision)中,页码 17535–17545,2023。

Chen-Hsuan Lin, Jun Gao, Luming Tang, Towaki Takikawa, Xiaohui Zeng, Xun Huang, Karsten Kreis, Sanja Fidler, Ming-Yu Liu, 和 Tsung-Yi Lin。Magic3D:高分辨率文本到 3D 内容创建。在 IEEE 计算机视觉与模式识别会议(IEEE Conf. Comput. Vis. Pattern Recog.)中,页码 300–309,2023。

12

第 13 页

Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, Jiashi Feng, 和 Bingyi Kang. Depth anything 3: 从任意视角恢复视觉空间。arXiv 预印本 arXiv:2511.10647, 2025.

Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu, 等人。Dl3dv-10k: 一个用于基于深度学习的3D视觉的大规模场景数据集。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上,第 22160–22169 页, 2024.

Fangfu Liu, Wenqiang Sun, Hanyang Wang, Yikai Wang, Haowen Sun, Junliang Ye, Jun Zhang, 和 Yueqi Duan。Reconx: 使用视频扩散模型从稀疏视角重建任意场景。arXiv 预印本 arXiv:2408.16767, 2024.

Yuan Liu, Cheng Lin, Zijiao Zeng, Xiaoxiao Long, Lingjie Liu, Taku Komura, 和 Wenping Wang. Syncdreamer: 从单视图图像生成多视图一致的图像。arXiv 预印本 arXiv:2309.03453, 2023.

Ilya Loshchilov 和 Frank Hutter。解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101, 2017.

Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, 和 Qi Tian。Deco: 用于端到端图像生成的频率解耦像素扩散。arXiv 预印本 arXiv:2511.19365, 2025.

Ben Mildenhall, Pratul P Srinivasan, Matthew Tancik, Jonathan T Barron, Ravi Ramamoorthi, 和 Ren Ng。Nerf: 将场景表示为神经辐射场以进行视图合成。ACM 通讯, 65(1):99–106, 2021.

William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。在国际计算机视觉会议 (Int. Conf. Comput. Vis.) 上,第 4195–4205 页, 2023.

Dustin Podell, Zion English, Kyle Lacey, Andreas Blattmann, Tim Dockhorn, Jonas Müller, Joe Penna, 和 Robin Rombach。Sdxl: 改进潜在扩散模型以实现高分辨率图像合成。arXiv 预印本 arXiv:2307.01952, 2023.

Ben Poole, Ajay Jain, Jonathan T Barron, 和 Ben Mildenhall。Dreamfusion: 使用 2D 扩散进行文本到 3D 生成。arXiv 预印本 arXiv:2209.14988, 2022.

Xuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling, Yifan Lu, Merlin Nimier-David, Thomas Müller, Alexander Keller, Sanja Fidler, 和 Jun Gao。Gen3c: 具有精确相机控制的 3D 感知世界一致视频生成。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上,第 6121–6132 页, 2025.

Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer。使用潜在扩散模型进行高分辨率 图像合成。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上,第 10684–10695 页, 2022.

Kyle Sargent, Zizhang Li, Tanmay Shah, Charles Herrmann, Hong-Xing Yu, Yunzhi Zhang, Eric Ryan Chan, Dmitry Lagun, Li Fei-Fei, Deqing Sun, 等人。Zeronvs: 从单张真实图像进行零样本 360 度视图合成。arXiv 预印本 arXiv:2310.17994, 2023.

Katja Schwarz, Denis Rozumny, Samuel Rota Bulò, Lorenzo Porzi, 和 Peter Kontschieder。从单张图像生成 3D 世界的配方。在国际计算机视觉会议 (Int. Conf. Comput. Vis.) 上,第 3520–3530 页, 2025.

Yuzhang Shang, Zhihang Yuan, Bin Xie, Bingzhe Wu, 和 Yan Yan。扩散模型的训练后量化。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 上,第 1972–1981 页, 2023.

Noam Shazeer。GLU 变体改进 Transformer。arXiv 预印本 arXiv:2002.05202, 2020.

Minglei Shi, Haolin Wang, Wenzhao Zheng, Ziyang Yuan, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Jie Zhou, 和 Jiwen Lu。没有变分自编码器的潜在扩散模型。arXiv 预印本 arXiv:2510.15301, 2025.

Yichun Shi, Peng Wang, Jianglong Ye, Mai Long, Kejie Li, 和 Xiao Yang。Mvdream: 用于 3D 生成的多视图 扩散。arXiv 预印本 arXiv:2308.16512, 2023.

13

第 14 页

Wenqiang Sun, Shuo Chen, Fangfu Liu, Zilong Chen, Yueqi Duan, Jun Zhang, 和 Yikai Wang。 Dimensionx: 从单张图像创建任意 3D 和 4D 场景,具有可控的视频扩散能力。 arXiv 预印本 arXiv:2411.04928, 2024。

Xiangyu Sun, Shijie Wang, Fengyi Zhang, Lin Liu, Caiyan Jia, Ziying Song, Zi Huang, 和 Yadan Luo。Vggt-world: 将 VGGT 转化为自回归几何世界模型。arXiv 预印本 arXiv:2603.12655, 2026。

Stanislaw Szymanowicz, Chrisitian Rupprecht, 和 Andrea Vedaldi。Splatter image: 超快 单视图 3D 重建。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,页码 10208–10217, 2024。

Jiaxiang Tang, Jiawei Ren, Hang Zhou, Ziwei Liu, 和 Gang Zeng。Dreamgaussian: 用于高效 3D 内容生成的 生成式高斯泼溅。arXiv 预印本 arXiv:2309.16653, 2023。

Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, 等人。Wan: 开放且先进的规模化视频生成模型。 arXiv 预印本 arXiv:2503.20314, 2025。

Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny。Vggt: 视觉几何接地 Transformer。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 中,页码 5294–5306, 2025a。

Jiepeng Wang, Zhaoqing Wang, Hao Pan, Yuan Liu, Dongdong Yu, Changhu Wang, 和 Wenping Wang。Mmgen: 统一的多模态图像生成与理解。arXiv 预印本 arXiv:2503.20644, 2025b。

Shuai Wang, Ziteng Gao, Chenhui Zhu, Weilin Huang, 和 Limin Wang。Pixnerd: 像素神经场 扩散。arXiv 预印本 arXiv:2507.23268, 2025c。

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, 等人。前馈式 3D 场景建模: 一种问题驱动的视角。arXiv 预印本 arXiv:2604.14025, 2026。

Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, 和 Tong He。π3: 置换等变视觉几何 学习。arXiv 预印本 arXiv:2507.13347, 2025d。

Zhaoqing Wang, Xiaobo Xia, Zhuolin Bie, Jinlin Liu, Dongdong Yu, Jia-Wang Bian, 和 Changhu Wang。通过可验证的几何奖励驯服相机控制的视频生成。arXiv 预印本 arXiv:2512.02870, 2025e。

Zhengyi Wang, Cheng Lu, Yikai Wang, Fan Bao, Chongxuan Li, Hang Su, 和 Jun Zhu。Prolific- dreamer: 使用变分分数蒸馏实现高保真且多样化的文本到 3D 生成。Adv. Neural Inform. Process. Syst., 36:8406–8441, 2023。

Zhou Wang, Alan C Bovik, Hamid R Sheikh, 和 Eero P Simoncelli。图像质量评估:从 误差可见性到结构相似性。IEEE 图像处理汇刊 (IEEE transactions on image processing), 13(4):600–612, 2004。

Haoyu Wu, Diankun Wu, Tianyu He, Junliang Guo, Yang Ye, Yueqi Duan, 和 Jiang Bian。几何 强制:结合视频扩散与 3D 表示以实现一致的世界建模。arXiv 预印本 arXiv:2507.07982, 2025。

Rundi Wu, Ben Mildenhall, Philipp Henzler, Keunhong Park, Ruiqi Gao, Daniel Watson, Pratul P Srinivasan, Dor Verbin, Jonathan T Barron, Ben Poole, 等人。Reconfusion: 使用 扩散先验进行 3D 重建。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 中,页码 21551–21561, 2024。

Haofei Xu, Songyou Peng, Fangjinhua Wang, Hermann Blum, Daniel Barath, Andreas Geiger, 和 Marc Pollefeys。Depthsplat: 连接高斯泼溅与深度。在计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference) 中,页码 16453–16463, 2025。

14

第 15 页

Yuanbo Yang, Jiahao Shao, Xinyang Li, Yujun Shen, Andreas Geiger, 和 Yiyi Liao。Prometheus: 用于前馈文本到3D场景生成的3D感知潜在扩散模型。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上,第 2857–2869 页,2025。

Botao Ye, Boqi Chen, Haofei Xu, Daniel Barath, 和 Marc Pollefeys。Yonosplat: 你只需要 一个模型即可进行前馈 3D 高斯泼溅 (3D Gaussian Splatting, 3DGS)。在 国际学习表征会议 (International Conference on Learning Representations, ICLR) 上,2026a。

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang 等人。世界动作模型是零样本 策略。arXiv 预印本 arXiv:2602.15922,2026b。

Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, 和 William T Freeman。改进的分布匹配蒸馏以实现快速图像合成。神经信息处理系统进展 (Advances in neural information processing systems), 37:47455–47487,2024a。

Tianwei Yin, Michaël Gharbi, Richard Zhang, Eli Shechtman, Fredo Durand, William T Freeman, 和 Taesung Park。具有分布匹配蒸馏的一步扩散。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 上,第 6613–6623 页,2024b。

Hong-Xing Yu, Haoyi Duan, Junhwa Hur, Kyle Sargent, Michael Rubinstein, William T Freeman, Forrester Cole, Deqing Sun, Noah Snavely, Jiajun Wu 等人。Wonderjourney: 从任意地点到任意地点。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上,第 6658–6667 页,2024。

Hong-Xing Yu, Haoyi Duan, Charles Herrmann, William T Freeman, 和 Jiajun Wu。Wonderworld: 从单张图像进行交互式 3D 场景生成。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上, 第 5916–5926 页,2025a。

Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, 和 Jiebo Luo。Pixeldit: 用于图像生成的像素 扩散 Transformer (DiT)。arXiv 预印本 arXiv:2511.20645,2025b。

Jiahui Zhang, Yuelei Li, Anpei Chen, Muyu Xu, Kunhao Liu, Jianyuan Wang, Xiao-Xiao Long, Hanxue Liang, Zexiang Xu, Hao Su 等人。前馈 3D 重建与视图合成进展:综述。arXiv 预印本 arXiv:2507.14501,2025。

Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala。向文本到图像扩散模型添加条件控制。在 国际计算机视觉会议 (Int. Conf. Comput. Vis.) 上,第 3836–3847 页,2023。

Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang。深度特征作为感知度量的 不合理有效性。在 IEEE 计算机视觉与模式识别会议 (IEEE Conf. Comput. Vis. Pattern Recog.) 上, 第 586–595 页,2018。

Yuyang Zhao, Chung-Ching Lin, Kevin Lin, Zhiwen Yan, Linjie Li, Zhengyuan Yang, Jianfeng Wang, Gim Hee Lee, 和 Lijuan Wang。Genxd: 生成任意 3D 和 4D 场景。arXiv 预印本 arXiv:2411.02319,2024。

Boyang Zheng, Nanye Ma, Shengbang Tong, 和 Saining Xie。具有表示自编码器 (Representation Autoencoders, RAE) 的扩散 Transformer (DiT)。arXiv 预印本 arXiv:2510.11690,2025。

Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, 和 Noah Snavely。立体放大:使用多平面图像学习视图合成。ACM 图形学汇刊 (ACM Trans. Graph.), 37(4):1–12,2018。

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, 和 Steven L Waslander。 Drivinggen: 自动驾驶生成式视频世界模型的全面基准。arXiv 预印本 arXiv:2601.01528,2026。

15

第 16 页

A 附录概述

本附录从五个方面对正文进行补充。附录 B 详细介绍了双流 MMDiT 去噪器的架构及其各组件的参数预算,以及从头训练 PixWorld 所使用的数据、批处理和优化策略。附录 C 提供了 1 视图和 2 视图生成的细粒度定量结果,将正文中平均的配置结果分开呈现,以揭示每种方法在每种设置的较难侧与较易侧的表现。附录 D 展示了在多种视图选择下的重建和生成的额外定性可视化结果,包括 RGB 渲染图和预测的深度图。附录 E 报告了与代表性基线的推理速度对比。最后,负责任考量(附录 F)部分讨论了局限性、更广泛的影响以及大语言模型(LLM)的使用情况。

B 实现细节

架构。PixWorld 的去噪器 $f_\theta$ 是一个 24 层的 DiT (Peebles & Xie, 2023),隐藏层宽度 $d=1024$,16 个注意力头(头维度 64),SwiGLU (Shazeer, 2020) 前馈层,对 Q、K 使用 RMSNorm,并采用基于扩散时间步的条件 adaLN-Zero 调制。遵循 SD3 风格的 MMDiT (Esser et al., 2024) 设计,每个块包含两个并行流,它们共享拓扑结构但保持独立的预 LayerNorm、QKV/输出投影、MLP 和 adaLN-Zero 权重:一个干净流处理 $\Omega_c$ 中的条件视图,另一个噪声流处理 $\Omega_n$ 中的噪声视图。在注意力算子内部,每个流的 Q、K、V 张量沿 token 轴拼接(共享 q、k-RMSNorm),并在 $[\Omega_c; \Omega_n]$ 上联合计算单次全注意力,使得条件 token 和噪声 token 在每一层中进行交互;联合输出随后被拆分并路由至流特定的输出投影。两个流共享一个对文本 token 的交叉注意力和一个时间步嵌入器,后者在干净流中在 $t=1$ 时评估,在噪声流中在采样 $t$ 时评估,从而允许一个模型同时服务于仅姿态和文本条件的生成。相机参数通过 PRoPE (Li et al., 2025a) 注入。输入使用 $16 \times 16$ 的 patchify 和可学习的位置嵌入,最后一层通过流特定的多任务头输出逐像素深度和 3D-Gaussian 属性,高斯中心通过利用预测深度对每个像素进行反投影获得(第 3.2 节)。总可训练参数量为 1.044 B;表 6 报告了各组件的预算。

数据与批处理。RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 数据集共同提供了约 67K 个带姿态的多视图场景。从每个场景中,我们采样 $N \in \{4, \dots, 8\}$ 个视图,并将它们划分为 $\Omega_c/\Omega_n$,使采样器偏向较小的 $|\Omega_c|$,以便将容量用于条件生成。我们还混合了一个来自 BLIP-3o (Chen et al., 2025b) 语料库的 1000 万张单图像分支,该分支共享扩散骨干网络并增强了 2D 外观先验。在每个 GPU 上,每个优化步骤交替进行 32 张图像的单视图批次和最多 32 张图像的多视图批次(例如,4–8 个视图 $\times$ 4–8 个场景)。

优化。我们优化 $L = L_{render} + \lambda_{depth} L_{depth} + \lambda_{geo} L_{geo}$,其中 $\lambda_{depth}=1.0$ 且 $\lambda_{lpips}=\lambda_{geo}=0.1$,在 $t > t_{th}=0.3$ 时门控 $L_{lpips}$ 和 $L_{geo}$,因为当噪声输入接近纯噪声时,感知和几何监督是不可靠的。冻结的几何判别器 $\Psi$ 实例化为 $\pi_3$ (Wang et al., 2025d),并在参考分支上停止梯度。训练从头开始运行(无图像或视频模型预训练),使用 AdamW (Loshchilov & Hutter, 2017),学习率从 $1 \times 10^{-4}$ 线性衰减至 $1 \times 10^{-5}$,EMA 衰减率为 0.9995,梯度裁剪阈值为 1.0,无条件文本丢弃率为 0.2。训练在 32 块 NVIDIA A800-SXM4-80G GPU 上运行约 200K 步。

C 1 视图和 2 视图生成的详细结果

正文(表 2 和表 3)报告了在每个输入设置内平均的数值,以保持比较简洁。为了完整起见,我们在此提供按配置细分的结果。在 1 视图设置下,平均值取自两个互补配置:First Frame(第一帧),其中输入视图是视频片段的第一帧,模型沿着一个长且完全外推的轨迹生成纯前向轨迹;以及 Bidirectional(双向),其中随机选择一个中间帧

16

第 17 页

表 6:双流 DiT 去噪器 $f_\theta$ 的架构。每个块遵循 MMDiT 风格设计:干净流和噪声流保持独立的预 LayerNorm、QKV/输出投影、SwiGLU MLP 和 adaLN-Zero 权重,同时对拼接后的 $[\Omega_c; \Omega_n]$ token 计算单个全注意力,并共享 $q, k$-RMSNorm。文本交叉注意力和时间步嵌入器也在流之间共享,输出头按流复制,以便在每一个 patch 处将干净和噪声 token 解码为深度和 3D-Gaussian 属性。

| 模块 | 配置 | 参数量 | | :— | :— | :— | | (a) Tokenization & conditioning | | | | Clean-view patch embed | 16×16 patchify, 3→1024 | 0.79 M | | Noisy-view patch embed | 16×16 patchify, 3→1024 | 0.79 M | | Positional embedding | learnable, 588×1024 | 0.60 M | | Timestep embedder | sinusoidal 256 + MLP 1024→1024 | 1.31 M | | Text projection | MLP 4096→1024→1024 | 5.24 M | | (b) Two-stream MMDiT block (× 24; d=1024, h=16, dh=64) | | | | QKV projection (clean) | pre-LN + 1024→3×1024 | 3.15 M | | Output projection (clean) | 1024→1024 | 1.05 M | | SwiGLU MLP (clean) | 1024→2×2730→1024 | 8.39 M | | adaLN-Zero (clean) | t-cond. $\gamma, \beta, \alpha$ (×6) | 6.30 M | | QKV projection (noise) | pre-LN + 1024→3×1024 | 3.15 M | | Output projection (noise) | 1024→1024 | 1.05 M | | SwiGLU MLP (noise) | 1024→2×2730→1024 | 8.39 M | | adaLN-Zero (noise) | t-cond. $\gamma, \beta, \alpha$ (×6) | 6.30 M | | Joint full attention | SDPA over $[\Omega_c; \Omega_n]$ with shared $q, k$-RMSNorm | $\sim$0 | | Cross-attention to text | shared by both streams | 4.20 M | | | per-block subtotal | 41.98 M | | | trunk total (×24 blocks) | 1007.6 M | | (c) Multi-task output heads (duplicated per stream) | | | | Depth head | adaLN + linear 1024→16×16×1 | 2×2.36 M | | 3D-Gaussian head | adaLN + linear 1024→16×16×35 | 2×11.28 M | | Total trainable parameters | | 1.044 B |

条件生成向两端延伸,产生两条较短且大致对称的时间范围,从而更直接地测试输入周围的局部一致性。在 2-view 设置下,平均值是在插值(Interpolation)和外推(Extrapolation)上取的,其中插值是指两个锚点包围目标轨迹,模型填充中间视图;外推是指两个锚点都位于片段的一端,模型必须在更强的视差下生成超出其范围的视图。表 7 和表 8 中的细分结果显示了两个一致的趋势。首先,每种方法在每个设置的较难侧(1-view 的第一帧,2-view 的外推)性能下降,最大的差距出现在 LPIPS 以及 Camera Control AUC@{30◦, 15◦, 5◦} 指标上。其次,方法排名在不同配置下基本保持不变,这证实了主论文中的平均数值忠实地总结了每种方法的行为,而不是由较容易的子配置主导。PixWorld 在几乎所有列中都是表现最好的,且在较难侧的领先优势最大,表明我们的设计在竞争方法表现最差的、以外推和视差为主的场景中泛化能力最强。

D 附加可视化

我们提供了额外的定性结果,以补充主论文中的定量比较。图 6 展示了不同视图选择下的重建和生成结果:对于每个场景,我们可视化了相机轨迹,并标记了输入视图和生成的视图,同时展示了 RGB 渲染图和 PixWorld 预测的深度图。这些示例涵盖了不同的输入数量和轨迹形状,并证明无论输入视图如何排列,PixWorld 都能产生几何连贯的场景。图 7 进一步展示了从单个输入视图(显示为每个序列的第一帧)生成的场景,包括 RGB 渲染图和相应的深度图。在这些示例中,预测的深度保持清晰且结构一致。

17

第 18 页

表 7:单图像 3D 场景生成的定量比较,按配置划分。我们在 RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 上,在 1-view First Frame 和 1-view Bidirectional 设置下进行评估。最佳结果加粗;次佳结果下划线。

| | 新视角合成 | | | 生成质量 | | | | | 相机控制 | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 方法 | PSNR↑ | SSIM↑ | LPIPS↓ | I2V Subj.↑ | I2V BG↑ | I.Q.↑ | Aes.Q.↑ | AUC@30↑ | AUC@15↑ | AUC@5↑ | | RealEstate10K – 1-view First Frame | | | | | | | | | | | | LVSM (Jin et al., 2025) | 17.95 | 0.604 | 0.335 | 0.968 | 0.971 | 0.584 | 0.505 | 0.695 | 0.576 | 0.359 | | GF (Wu et al., 2025) | 15.92 | 0.575 | 0.436 | 0.942 | 0.947 | 0.514 | 0.487 | 0.609 | 0.488 | 0.301 | | Gen3C (Ren et al., 2025) | 17.12 | 0.622 | 0.394 | 0.959 | 0.961 | 0.569 | 0.530 | 0.664 | 0.521 | 0.338 | | FlashWorld (Li et al., 2025b) | 16.26 | 0.613 | 0.417 | 0.951 | 0.954 | 0.617 | 0.544 | 0.849 | 0.766 | 0.553 | | Gen3R (Huang et al., 2026) | 17.43 | 0.628 | 0.383 | 0.973 | 0.970 | 0.547 | 0.531 | 0.653 | 0.443 | 0.145 | | PixWorld (Ours) | 18.92 | 0.683 | 0.324 | 0.977 | 0.979 | 0.608 | 0.549 | 0.872 | 0.804 | 0.621 | | RealEstate10K – 1-view Bidirectional | | | | | | | | | | | | LVSM (Jin et al., 2025) | 17.70 | 0.601 | 0.337 | 0.974 | 0.969 | 0.603 | 0.506 | 0.726 | 0.608 | 0.385 | | GF (Wu et al., 2025) | 15.34 | 0.532 | 0.471 | 0.921 | 0.935 | 0.495 | 0.462 | 0.583 | 0.467 | 0.279 | | Gen3C (Ren et al., 2025) | 17.39 | 0.626 | 0.388 | 0.943 | 0.952 | 0.553 | 0.517 | 0.632 | 0.507 | 0.329 | | FlashWorld (Li et al., 2025b) | 16.75 | 0.639 | 0.390 | 0.966 | 0.967 | 0.614 | 0.555 | 0.837 | 0.751 | 0.539 | | Gen3R (Huang et al., 2026) | 17.74 | 0.633 | 0.381 | 0.975 | 0.972 | 0.557 | 0.541 | 0.612 | 0.424 | 0.150 | | PixWorld (Ours) | 18.83 | 0.721 | 0.325 | 0.981 | 0.978 | 0.639 | 0.563 | 0.865 | 0.793 | 0.607 | | DL3DV-10K – 1-view First Frame | | | | | | | | | | | | LVSM (Jin et al., 2025) | 14.85 | 0.434 | 0.533 | 0.927 | 0.932 | 0.491 | 0.463 | 0.537 | 0.354 | 0.127 | | GF (Wu et al., 2025) | 12.50 | 0.352 | 0.598 | 0.894 | 0.907 | 0.468 | 0.431 | 0.482 | 0.329 | 0.109 | | Gen3C (Ren et al., 2025) | 15.72 | 0.516 | 0.482 | 0.925 | 0.928 | 0.526 | 0.491 | 0.556 | 0.371 | 0.121 | | FlashWorld (Li et al., 2025b) | 15.31 | 0.468 | 0.463 | 0.939 | 0.950 | 0.616 | 0.558 | 0.765 | 0.667 | 0.412 | | Gen3R (Huang et al., 2026) | 15.57 | 0.499 | 0.504 | 0.941 | 0.940 | 0.543 | 0.529 | 0.614 | 0.408 | 0.102 | | PixWorld (Ours) | 16.37 | 0.521 | 0.455 | 0.947 | 0.953 | 0.624 | 0.564 | 0.789 | 0.702 | 0.477 | | DL3DV-10K – 1-view Bidirectional | | | | | | | | | | | | LVSM (Jin et al., 2025) | 14.96 | 0.432 | 0.526 | 0.934 | 0.933 | 0.497 | 0.468 | 0.568 | 0.391 | 0.141 | | GF (Wu et al., 2025) | 12.88 | 0.361 | 0.584 | 0.902 | 0.913 | 0.479 | 0.439 | 0.501 | 0.346 | 0.118 | | Gen3C (Ren et al., 2025) | 15.44 | 0.512 | 0.476 | 0.929 | 0.937 | 0.537 | 0.501 | 0.548 | 0.382 | 0.134 | | FlashWorld (Li et al., 2025b) | 15.53 | 0.478 | 0.458 | 0.944 | 0.950 | 0.621 | 0.559 | 0.773 | 0.681 | 0.428 | | Gen3R (Huang et al., 2026) | 15.94 | 0.507 | 0.487 | 0.948 | 0.944 | 0.551 | 0.532 | 0.571 | 0.389 | 0.133 | | PixWorld (Ours) | 16.63 | 0.533 | 0.443 | 0.956 | 0.958 | 0.637 | 0.571 | 0.797 | 0.709 | 0.493 |

结合渲染外观,这表明 PixWorld 中的联合深度和 3D-Gaussian 预测即使在从单个条件图像进行重度外推时,也能忠实地捕捉场景几何结构。最后,图 5 通过定性比较带有和不带有 Geometry Perception Loss 的 PixWorld,补充了我们的消融研究,其中完整模型产生了更清晰的后期视角渲染和更准确的姿态控制。除了这些页内可视化之外,我们还在补充 zip 文件中进一步提供了由不同方法生成的 3D 场景的视频比较,其中每个渲染视频的相机姿态也被额外估计,以定量评估相机控制精度。

E 推理速度比较

我们在表 9 中基于单块 NVIDIA A100-SXM4-80G GPU 对推理速度进行了基准测试,报告了每个场景的墙上时钟时间、关键帧数量以及函数评估次数 (NFE)。PixWorld 在 15 秒内生成一个场景,达到了高度优化的 FlashWorld (10 秒) 的同一数量级。我们注意到,这种比较并非完全对等:PixWorld 当前的输出分辨率低于视频扩散基线模型,这减少了每步的计算量。更根本的是,PixWorld 不依赖视频模型先验,因此不需要生成密集的帧序列:3D 表示是从少至 8 个关键帧重建的,之后通过可微光栅化高效渲染新视角。相比之下,视频扩散管道端到端地对长帧序列进行去噪,Gen3C、Gen3R 和 FlashWorld 分别每个场景生成 121、49 和 24 帧。还要注意,PixWorld 和 Gen3R 使用可比的 NFE (100),而 FlashWorld 利用蒸馏将其 NFE 降低到 4,这在很大程度上解释了其强大的运行速度。我们将蒸馏视为对我们方法的补充:上述数字针对的是未蒸馏的基础版 PixWorld,将其与蒸馏 (Yin et al., 2024b;a) 和训练后量化 (Li et al., 2023; Shang et al., 2023) 相结合是自然的下一步(见附录 F.1)。

18

第 19 页

表 8:两种视角 3D 场景生成的定量比较,按配置分类。我们在 RealEstate10K (Zhou et al., 2018) 和 DL3DV-10K (Ling et al., 2024) 上评估了两视角插值(2-view Interpolation)和两视角外推(2-view Extrapolation)任务。粗体表示最佳;下划线表示次佳。

| Method | PSNR↑ | SSIM↑ | LPIPS↓ | I2V Subj.↑ | I2V BG↑ | I.Q.↑ | Aes.Q.↑ | AUC@30↑ | AUC@15↑ | AUC@5↑ | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Novel View Synthesis | | | | Generation Quality | | | | Camera Control | | | | RealEstate10K – 2-view Interpolation | | | | | | | | | | | | LVSM (Jin et al., 2025) | 24.26 | 0.832 | 0.200 | 0.969 | 0.963 | 0.613 | 0.518 | 0.871 | 0.806 | 0.638 | | GF (Wu et al., 2025) | 18.08 | 0.621 | 0.373 | 0.936 | 0.951 | 0.525 | 0.476 | 0.642 | 0.487 | 0.236 | | Gen3C (Ren et al., 2025) | 20.17 | 0.726 | 0.298 | 0.967 | 0.949 | 0.581 | 0.527 | 0.714 | 0.553 | 0.261 | | FlashWorld (Li et al., 2025b) | 21.66 | 0.776 | 0.252 | 0.958 | 0.959 | 0.619 | 0.546 | 0.875 | 0.810 | 0.634 | | Gen3R (Huang et al., 2026) | 22.42 | 0.752 | 0.260 | 0.964 | 0.973 | 0.544 | 0.539 | 0.779 | 0.631 | 0.295 | | PixWorld (Ours) | 23.44 | 0.810 | 0.214 | 0.971 | 0.975 | 0.625 | 0.559 | 0.877 | 0.814 | 0.648 | | RealEstate10K – 2-view Extrapolation | | | | | | | | | | | | LVSM (Jin et al., 2025) | 22.95 | 0.806 | 0.230 | 0.972 | 0.965 | 0.601 | 0.514 | 0.851 | 0.771 | 0.583 | | GF (Wu et al., 2025) | 18.46 | 0.672 | 0.332 | 0.914 | 0.927 | 0.489 | 0.451 | 0.618 | 0.458 | 0.211 | | Gen3C (Ren et al., 2025) | 20.08 | 0.703 | 0.302 | 0.928 | 0.945 | 0.552 | 0.509 | 0.682 | 0.524 | 0.249 | | FlashWorld (Li et al., 2025b) | 21.30 | 0.765 | 0.261 | 0.970 | 0.965 | 0.618 | 0.548 | 0.878 | 0.813 | 0.640 | | Gen3R (Huang et al., 2026) | 20.24 | 0.695 | 0.307 | 0.976 | 0.970 | 0.556 | 0.542 | 0.677 | 0.521 | 0.220 | | PixWorld (Ours) | 23.63 | 0.819 | 0.206 | 0.978 | 0.974 | 0.631 | 0.564 | 0.883 | 0.819 | 0.651 | | DL3DV-10K – 2-view Interpolation | | | | | | | | | | | | LVSM (Jin et al., 2025) | 19.37 | 0.594 | 0.328 | 0.918 | 0.917 | 0.538 | 0.511 | 0.758 | 0.630 | 0.403 | | GF (Wu et al., 2025) | 15.16 | 0.452 | 0.480 | 0.903 | 0.918 | 0.487 | 0.452 | 0.573 | 0.395 | 0.156 | | Gen3C (Ren et al., 2025) | 17.81 | 0.546 | 0.406 | 0.931 | 0.938 | 0.541 | 0.508 | 0.641 | 0.446 | 0.183 | | FlashWorld (Li et al., 2025b) | 18.16 | 0.559 | 0.363 | 0.937 | 0.951 | 0.602 | 0.564 | 0.812 | 0.724 | 0.528 | | Gen3R (Huang et al., 2026) | 18.21 | 0.562 | 0.391 | 0.940 | 0.946 | 0.531 | 0.536 | 0.745 | 0.582 | 0.260 | | PixWorld (Ours) | 19.12 | 0.581 | 0.348 | 0.953 | 0.957 | 0.611 | 0.568 | 0.826 | 0.739 | 0.542 | | DL3DV-10K – 2-view Extrapolation | | | | | | | | | | | | LVSM (Jin et al., 2025) | 18.98 | 0.584 | 0.358 | 0.913 | 0.916 | 0.528 | 0.493 | 0.723 | 0.587 | 0.346 | | GF (Wu et al., 2025) | 15.61 | 0.466 | 0.459 | 0.891 | 0.906 | 0.471 | 0.438 | 0.553 | 0.362 | 0.137 | | Gen3C (Ren et al., 2025) | 17.42 | 0.539 | 0.418 | 0.924 | 0.930 | 0.532 | 0.496 | 0.614 | 0.421 | 0.169 | | FlashWorld (Li et al., 2025b) | 18.37 | 0.565 | 0.356 | 0.938 | 0.946 | 0.598 | 0.552 | 0.793 | 0.703 | 0.501 | | Gen3R (Huang et al., 2026) | 17.88 | 0.554 | 0.392 | 0.943 | 0.941 | 0.539 | 0.523 | 0.706 | 0.538 | 0.231 | | PixWorld (Ours) | 19.61 | 0.607 | 0.331 | 0.947 | 0.954 | 0.604 | 0.561 | 0.817 | 0.728 | 0.526 |

表 9:在单张 NVIDIA A100-SXM4-80G GPU 上的推理速度比较。我们报告了生成一个场景的墙上时钟时间(wall-clock time)、每个场景的关键帧数量以及函数评估次数(NFE)。

| Method | #Key Frames per scene | NFE | Time per scene (s) ↓ | | :— | :— | :— | :— | | Gen3C (Ren et al., 2025) | 121 | 70 | 791 | | Gen3R (Huang et al., 2026) | 49 | 100 | 882 | | FlashWorld (Li et al., 2025b) | 24 | 4 | 10 | | PixWorld (Ours) | 8 | 100 | 15 |

F 负责任考量

F.1 局限性。

PixWorld 迈出了在像素空间中统一 3D 场景重建与生成的一步,但仍有若干方向有待探索。我们的实验集中在 RealEstate10K 和 DL3DV-10K 等广泛使用的场景级数据集上;在更多样化的户外和以物体为中心的场景上进行进一步评估,将更好地表征该框架的泛化能力。具有可微渲染的像素空间扩散模型也是在有限的分辨率和计算预算下训练的,因此在细粒度纹理保真度和扩展到更高分辨率的多视角设置方面仍有改进空间。最后,我们计划通过蒸馏 (Yin et al., 2024b;a) 和量化 (Li et al., 2023; Shang et al., 2023) 加速 PixWorld 的推理,进一步降低高质量 3D 场景生成的成本。

F.2 更广泛的影响。

PixWorld 可能有利于高效 3D 重建、3D 内容创作、机器人感知、仿真以及 VR/AR 等应用。同时,改进的 3D 场景重建和生成——

19

第 20 页

AUC@5 w/o Geom.: 0.814 AUC@5 Full: 0.836 Geom. w/o

Full

AUC@5 w/o Geom.: 0.914 AUC@5 Full: 0.929 Geom. w/o

Full

AUC@5 w/o Geom.: 0.607 AUC@5 Full: 0.979 Geom. w/o

Full

GT Full w/o Geometry Perception

图 5:PixWorld 中 Geometry Perception Loss 的消融研究。给定单张输入图像,我们的模型生成后续 7 帧(共 8 帧);为清晰起见,此处可视化了 4 个代表性帧。通过估计相机位姿与真实位姿(ground-truth poses)进行比较,对位姿精度进行定量评估。与不含 Geometry Perception 的变体(w/o Geom.)相比,完整模型实现了更精确的相机位姿控制,并显著减轻了后续视角预测中的模糊现象,这表明全局 3D 感知损失对于在长生成周期内保持几何一致性和视觉保真度至关重要。

这种能力可能会引发对隐私敏感场景采集、合成或重建 3D 内容滥用以及在安全关键场景中不可靠部署的担忧。我们鼓励在现实场景中使用此类系统时,负责任地使用数据,进行仔细评估,并保留人工监督。

F.3 LLM 的使用。

本工作未将 LLM 作为核心方法中重要、原创或非标准的组件使用。任何基于 LLM 的工具的使用(如果有的话)仅限于写作、编辑或格式辅助,并未影响方法论、实验或科学结论。

20

第 21 页

图 6:在不同视角选择下重建和生成的更多可视化结果,包括标记了输入视角和生成视角的相机轨迹,以及 PixWorld 预测的相应深度图。

21

第 22 页

图7:生成场景的更多可视化结果。第一个视图为输入,我们同时展示了RGB渲染图和预测的深度图。

22

发表评论