PanoWorld:真实世界全景生成,解耦旋转与记忆增强

三分钟导读:PanoWorld提出了一种基于扩散模型的全景世界生成框架,通过解耦旋转与平移、引入DPRC动作建模和GMA记忆模块,在World360数据集上实现了高保真、物理一致且可精确控制轨迹的全景视频生成。

英文题目:PanoWorld: Real-World Panoramic Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.09661

原始论文:PDF / 论文页面

对应视频标题:PanoWorld:真实世界全景生成,解耦旋转与记忆增强|推荐指数:★★★★★

这篇论文解决什么问题?

现有全景世界模型在长程记忆中面临物理一致性(几何和光照)挑战,且传统记忆机制因透视假设导致全景数据下的记忆检索错位;现有数据集多为室内或仿真,缺乏真实世界复杂光照和空间变化的评估基准。

核心创新

  • 利用全景表示的旋转等变性解耦旋转与平移,简化运动学习空间。
  • 提出DPRC模块,基于球面射线几何建模平移视差,确保辐射一致性。
  • 提出GMA模块,通过共享几何流形和置信度门控实现长程记忆检索,消除结构漂移。
  • 构建World360大规模基准,包含70K真实无人机数据和50K AirSim360仿真数据,支持多高度轨迹评估。

方法概览

1. Motion Decoupling: 利用ERP的旋转等变性,将相机旋转视为几何变换,仅显式建模平移,通过固定航向解耦运动。2. DPRC (Dense Panoramic Ray-Conditioning): 基于球面射线反投影构建动作建模,将运动建模为动态光场演化,通过PRoPE注入扩散Transformer。3. GMA (Geometry-aware Memory Augmentation): 在共享几何流形上通过PRoPE统一查询和记忆特征,利用置信度引导的门控机制融合历史记忆,确保长程一致性。4. Three-Stage Training: 分三阶段训练:全景视频微调、视图依赖运动学习、记忆锚定一致性。

逐图理解论文

PanoWorld核心架构概述

PanoWorld核心架构概述
Figure 3: PanoWorld Network Architecture. Built on the Wan2.2 backbone, PanoWorld employs a triple-stream DiT that fuses visual self-attention, DPRC-based action modeling, and a GMA module for memory-anchored synthesis via a shared geometric manifold.

PanoWorld提出了一种基于扩散模型的全景世界生成框架,旨在实现高保真且可精确控制轨迹的视频生成。其核心在于利用全景表示的旋转等变性,将相机旋转视为隐式几何变换,仅显式建模平移运动。该方法通过Dense Panoramic Ray-Conditioning模块处理动作建模,并结合Geometry-aware Memory Augmentation模块增强长程记忆。整体架构基于Wan2.2骨干网络,通过三阶段训练策略,确保生成视频在复杂真实环境中的物理一致性。

运动解耦与数据预处理

运动解耦与数据预处理
Figure 2: The Data Curation Pipeline. The pipeline converts raw panoramic clips into high-quality sequences by: (1) Rotation Decoupling to isolate pure translation; (2) Uniform Spatial Resampling to standardize motion scales; and (3) Illumination Filtering to ensure exposure consistency.

为简化运动学习空间,PanoWorld利用等距柱状投影的旋转等变性,通过固定航向解耦旋转与平移。数据预处理流水线包含三个关键步骤:首先进行旋转解耦以隔离纯平移运动;其次进行均匀空间重采样以标准化运动尺度;最后进行光照过滤以确保曝光一致性。这一预处理流程有效消除了旋转带来的几何扭曲,为后续平移视差的精确建模奠定基础,从而提升模型对真实世界复杂运动的适应能力。

GMA几何感知记忆增强

GMA几何感知记忆增强
Figure 7: Qualitative ablation results of the GMA module. Comparison of synthesized video frames under control: (a) w/o GMA baseline exhibits significant artifacts; (b) Random Memory variant results in broken geometry; (c) Full setting with GMA maintains consistent generation.

针对长程记忆检索错位问题,PanoWorld提出Geometry-aware Memory Augmentation模块。GMA在共享几何流形上通过PRoPE统一查询和记忆特征,利用置信度引导的门控机制融合历史记忆。这一机制确保了长程一致性,消除了结构漂移。消融实验显示,移除GMA会导致显著伪影,而随机记忆变体则破坏几何结构。GMA通过显式建模记忆与当前帧的几何关系,显著提升了生成视频的连贯性。

三阶段训练策略

三阶段训练策略
Figure 4: Overview of the progressive three-stage pipeline. Stage 1 focuses on geometric adaptation for panoramic video generation; Stage 2 targets view-dependent motion learning ; and Stage 3 enables memory-anchored coherence to enforce long-term temporal consistency.

PanoWorld采用三阶段渐进式训练策略以优化模型性能。第一阶段专注于全景视频生成的几何适应,使模型学习基础的全景表示。第二阶段针对视图依赖的运动学习,强化DPRC模块对平移视差的捕捉能力。第三阶段启用记忆锚定一致性,通过GMA模块确保长程 temporal 连贯性。这种分阶段训练策略有效缓解了联合优化带来的收敛困难,使模型能够逐步掌握复杂的时空动态特性。

World360基准数据集构建

World360基准数据集构建
Table 1: Comparison of panorama datasets for world generation.

为评估全景世界生成,本文构建了World360大规模基准数据集,包含70K真实无人机数据和50K AirSim360仿真数据。该数据集支持多高度轨迹评估,填补了真实世界复杂光照和空间变化评估的空白。World360不仅包含丰富的户外场景,还涵盖了不同光照条件和动态物体,为模型提供了多样化的训练和测试样本。这一基准的建立,推动了全景生成从仿真向真实世界应用的过渡。

实验与关键结果

  • 在World360数据集上与Imagine360, Matrix-3D, OmniRoam进行对比实验。
  • 评估视觉质量(FID, FAED, NIQE, Q-Align)和轨迹控制精度(PSNR, ViPE轨迹重建)。
  • 对GMA模块进行消融研究,对比无记忆、随机记忆和完整GMA的性能。
  • 展示实时生成能力,通过因果强制蒸馏实现单卡H20上的实时全景视频生成。
  • 在World360数据集上与Imagine360, Matrix-3D, OmniRoam进行对比实验。
  • 评估视觉质量(FID, FAED, NIQE, Q-Align)和轨迹控制精度(PSNR, ViPE轨迹重建)。
  • 对GMA模块进行消融研究,对比无记忆、随机记忆和完整GMA的性能。
  • 展示实时生成能力,通过因果强制蒸馏实现单卡H20上的实时全景视频生成。

阅读时需要注意

  • 依赖高质量的相机轨迹输入进行条件控制。
  • 实时生成模式通过蒸馏实现,可能在极端复杂场景下存在细微质量折损(尽管论文称折损可忽略)。
  • 主要关注户外真实场景,室内复杂动态物体的生成能力未在主要实验中详细展开。
  • World360数据集包含真实和仿真数据,需注意仿真数据与真实数据分布的差异。
  • 对比基线方法(如Matrix-3D)在特定指标(如PSNR)上可能因实现细节(如轨迹提取噪声)而表现不同,论文强调使用统一GT轨迹以避免不公平比较。

关联工作


展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

PanoWorld:真实世界全景生成

Haoyuan Li1 Dizhe Zhang1 # ∗ Yuemei Zhou1 Xiangkai Zhang1, 2 Haoran Feng1, 3

Xiaofan Lin1 Wenjie Jiang1 Bo Du4 Ming-Hsuan Yang5 Lu Qi1,4 # 1Insta360 Research 2Institute of Automation Chinese Academy of Sciences 3Tsinghua University 4Wuhan University 5UC Merced

2026 Matrix3D OmniRoam Ours Jul 10 ❌ …❌

Figure 1: PanoWorld 是一个用于高保真且可控全景视频生成的新颖框架。 我们的方法在保持多样化真实环境中物理一致性的高保真视觉合成的同时, 实现了针对复杂运动的精确轨迹控制。[cs.CV]

摘要

在本工作中,我们旨在通过利用全向表示的旋转等变性来解决全景 世界模型中的长程记忆挑战,其中旋转可被视为一种隐式几何变换。 基于这一见解,我们提出了 PanoWorld,它通过固定航向将相机轨迹 简化为平移,用于当前动作建模和长程记忆,并通过密集全景射线条件 (Dense Panoramic Ray-Conditioning, DPRC) 和几何感知记忆增强 (Geometry-aware Memory Augmentation, GMA) 实现。随后,引入 三阶段训练流程以逐步优化各个组件。为了更好地评估在大规模空间变化 和多样化光照条件下的物理一致性,而现有数据集相对稳定,我们构建了 World360,这是一个由通过全景无人机收集的真实世界视频片段和由 AirSim360生成的高质量模拟片段组成的大规模数据集。arXiv:2607.09661v1 在 World360 上的大量实验证明了 PanoWorld 的有效性, 大幅优于其他替代方法。我们的模型、训练代码和 数据集将公开可用。更多信息请访问我们的 项目页面:https://lihaoy-ux.github.io/panoworld-page/。

∗项目负责人 # 通讯作者

预印本。

第 2 页

1 引言

近期,世界模型在建模动态环境和实现可控生成方面引起了广泛关注 [Tang et al., 2025, Team et al., 2026]。它们在自动驾驶和无人机等各种机器人应用中展现出巨大潜力 [Wu et al., 2026]。

在各种世界模型中,全景表示,特别是等距柱状投影(ERP),已成为一种主流范式,因为它能够捕获特定轨迹中每一帧的完整 360◦ 视场(FoV)[Lin et al., 2025]。尽管近期取得了进展,但对于全景世界模型而言,实现跨空间和时间的物理一致性(如几何和光照)仍然具有挑战性,而全景的全视场特性往往会放大这一问题。

大多数现有工作,包括基于 3DGS 和视频生成的范式,都采用记忆机制(例如 3D 点或 KV 缓存)来检索历史信息,以实现时空一致性 [Yang et al., 2025, Chou et al., 2025, Schwarz et al., 2025]。然而,这些解决方案继承了透视假设,忽略了全景数据的独特属性,导致在严重畸变和由旋转引起的视角变化下,记忆检索出现错位。因此,引发了一个问题:记忆机制如何更好地适应全景表示?

为了解决这一问题,我们首先分析等距柱状投影(ERP)的特性,即旋转等变性,其中旋转主要改变畸变模式,同时保留底层场景内容。这一观察启发我们将相机运动简化,将旋转视为一种几何变换,并仅显式地对平移进行建模。基于这一见解,我们提出了 PanoWorld,这是一个基于扩散的框架,结合了密集全景射线条件(Dense Panoramic Ray-Conditioning, DPRC)和几何感知记忆增强(Geometry-aware Memory Augmentation, GMA)模块,用于当前动作建模和长程记忆,并通过固定航向解耦平移和旋转。随后,我们引入了一种三阶段训练流程,以有效优化各个组件。

鉴于现有数据集主要基于室内或仿真环境,其中物理条件相对稳定,它们不太适合训练模型和评估现实世界的物理一致性。我们进一步构建了一个大规模数据集 World360,包含通过 Anti-Gravity 收集的 70K 个真实世界片段,以及来自 AirSim360 平台 [Ge et al., 2025] 的 50K 个高保真仿真数据。在 World360 上的大量实验证明了我们的方法的有效性,其性能大幅优于其他方法。

我们的贡献总结如下:

  • 我们提出了 PanoWorld,这是一种基于扩散的全景世界模型,利用全向表示的旋转等变特性来解决长程记忆问题。
  • PanoWorld 包含两个核心模块:密集全景射线条件(DPRC)和几何感知记忆增强(GMA),以及一个三阶段训练流程。DPRC 为全景运动建模提供密集的几何条件,而 GMA 增强了全景空间中的记忆检索和时空一致性。
  • 我们构建了 World360,这是一个针对现实世界物理变化下的全景世界建模的大规模基准数据集。大量实验表明,PanoWorld 始终大幅优于现有替代方案。

2 相关工作

全景视频生成。全景视觉为全球一致的场景合成提供了整体的几何视角。最近的工作,如 WorldPrompter [Zhang et al., 2025],证明了全景生成可以作为提高结构一致性的有效中间表示。早期的基础框架,包括 360DVD [Wang et al., 2024a],开创了文本到全景视频生成的流程,并引入了 WEB360 数据集用于基准测试。为了提高数据规模和生成质量,PanoWan [Xia et al., 2025] 建立在大规模沉浸式数据集 360-1M [Wallingford et al., 2024] 之上。与此同时,最近的方法,包括 4K4DGen [Xing et al., 2025] 和 DynamicScaler [Liu et al., 2025],专注于增强全景视频生成中的时空和几何一致性。然而,尽管取得了这些进展,现有的全景视频生成器在复杂户外环境中仍然面临困难,因为保持结构和辐射一致性仍然具有挑战性。

2

第 3 页

轨迹不一致与光照

过曝

I

欠曝

均匀空间 旋转解耦 重采样 原始片段 光照过滤

图 2:数据策展流水线。该流水线通过以下步骤将原始全景片段转换为高质量序列:(1) 旋转解耦以隔离纯平移运动;(2) 均匀空间重采样以标准化运动尺度;以及 (3) 光照过滤以确保曝光一致性。

相机控制的视频扩散模型。在视频生成过程中控制相机运动已成为将场景动态与场景 [Bai et al., 2025, Wang et al., 2024b, Zhang et al., 2026] 解耦的关键方向。最近的方法如 CameraCtrl [He et al., 2024] 和 ViewCrafter [Yu et al., 2024] 结合外参或基于点云的引导以实现可控生成。在全景设置中,360DVD [Wang et al., 2024a] 引入了球面运动条件,尽管准确的 3D 轨迹控制仍然具有挑战性;Matrix-3D [Yang et al., 2025] 从初始帧重建场景几何,并执行基于掩码的图像修复的 3D 到 2D 渲染,而 OmniRoam [Liu et al., 2026] 采用 ReCamMaster 风格的流水线 [Bai et al., 2025],结合真实帧和生成帧以实现一致的视图合成。然而,这些方法通常依赖于显式重建或帧拼接,这可能会引入伪影,增加计算成本,并限制可扩展性。

记忆增强的视频合成。长视界视频生成的一个基本挑战是由于缺乏持久记忆导致的场景漂移 [Song et al., 2025]。常见的基线方法如 Context-as-Memory [Yu et al., 2025] 仍局限于片段,无法捕捉长距离依赖关系。虽然像 Captain Safari [Chou et al., 2025] 这样的方法使用隐式 3D 特征来提高一致性,但它们需要全序列处理,不适合开放世界生成。对于全景视频,现有方法如 Matrix-3D [Yang et al., 2025] 依赖于昂贵的显式 3D 重建,这限制了可扩展性并阻碍了实时部署。相比之下,我们提出了一种利用全景几何固有的旋转等变性来实现长距离一致性和精确控制的框架,而无需进行详尽的全局优化。

3 数据流水线与基准

在本节中,我们详细介绍了专为大规模可控全景视频合成设计的专用数据引擎。我们首先描述我们的策展流水线,该流水线在时间、几何和光照维度上强制执行基于物理的一致性。随后,我们介绍 World360,这是一个针对现实世界场景下全景世界建模的大规模基准数据集。

数据策展 为了将场景演化直接锚定在相机运动上,我们的引擎通过三重对齐策略运行(如图 2 所示):旋转解耦通过分解相对旋转并将帧重新投影到统一航向上,从而校正全景序列。通过隔离平移作为视觉变化的主要驱动因素,这一过程简化了在全景射线条件流形内学习空间深度和运动视差的过程。均匀空间重采样随后用恒定的空间增量 ($\Delta d$) 取代传统的固定时间采样,消除速度变化,从而在所有轨迹上建立统一的几何尺度。最后,光照过滤对数据进行审计,排除光照条件不正确的序列,确保模型学习持久的辐射度表示。这些过程共同消除了几何和光度噪声,为物理一致的世界建模奠定了基础。

World360 基于上述流水线,我们构建了 World360,这是一个针对现实世界物理变化下的全景世界建模的综合基准。如表 1 所示,World360 包含 120,000 个高质量序列,统一了 70,000 个策展的真实世界片段与来自 AirSim360 [Ge et al., 2025] 的 50,000 个高保真模拟数据。与仅限于平面运动的数据集不同,World360 引入了具有精确相机姿态和深度信息的多样化多高度空中轨迹。该基准弥合了受限建模与

3

第 4 页

无约束全景合成,从而能够在复杂的 3D 路径上评估结构完整性。

表 1:用于世界生成的全景数据集对比。

| 数据集 | 来源 | 样本数 | 运动空间 | 位姿 | 深度 | 文本 | 分辨率 | 视频 | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Imagine360 [46] | 真实 | 10k | 平面 | 无 | 无 | ✓ | 混合 | ✓ | | Web360 [53] | 真实 | 2k | 平面 | 无 | 无 | ✓ | 720p | ✓ | | Argus [34] | 真实 | 283k | 平面 | 无 | 无 | 无 | 混合 | ✓ | | 360-1M [49] | 真实 | 1,076k | 平面‡ | ✓ | 无 | 无 | 混合 | ✓ | | PanoWan [56] | 真实 | 13k | 平面 | 无 | 无 | ✓ | 混合 | ✓ | | Matrix-Pano | 合成 | 116k | 3D 空间 | ✓ | ✓ | ✓ | 2K | ✓ | | World360 (Ours) | 真实 | 120k | 多高度 | ✓ | 含合成 | ✓ | 2K | ✓ |

‡ 现有的大规模真实数据集主要由平面街道级运动组成,其中高度信息模糊或固定。相比之下,World360 提供了跨越多个高度的多样化空中轨迹。

4 我们的方法

给定初始全景观测和目标相机轨迹,我们的框架首先消除旋转模糊以简化运动空间,然后将几何感知运动控制和历史记忆注入统一的扩散骨干网络,最后将融合表示解码为可控的全景视频。本节分为两部分:第 4.1 节介绍了运动控制和记忆建模背后的核心建模设计,第 4.2 节描述了用于训练整个框架的三阶段优化策略。

4.1 模型设计

本节介绍了使生成过程符合物理规律的三个核心建模设计,如图 3 所示。我们首先通过运动解耦(4.1.1)简化学习问题,然后利用 DPRC(4.1.2)对视图相关的平移进行建模,最后通过几何感知记忆建模(4.1.3)强制实现长视场场景的持久性。

4.1.1 运动解耦原理

传统模型通常联合学习平移和旋转,这会导致全景视频生成中的结构扭曲。为了保持几何一致性,我们观察到全景序列中的相机旋转与场景深度无关,因此将其隔离为精确的几何变换,使扩散模型能够专注于由平移引起的视差。为了弥合预训练透视先验与全景几何之间的差距,我们进一步使用 LoRA 在全景数据集上对骨干网络进行微调,使其能够捕获等距柱状投影(Equirectangular Projection)的固有属性,如极畸变和水平连续性,同时保留基础模型的生成质量。结合显式的运动解耦,这种适应消除了违反 360◦ 投影规则的人工伪影,并保持了相机运动过程中的结构完整性。

4.1.2 动作建模:DPRC

为了实现无约束的运动控制,同时强制执行时间、几何和辐射域之间的联合一致性,我们提出了密集全景射线条件(Dense Panoramic Ray-Conditioning, DPRC)机制。与依赖像素级光流的传统透视模型不同,DPRC 利用等距柱状投影几何,将生成过程建模为动态光场演化,使运动学先验与全景射线的物理起源保持一致。

球面射线反投影。 我们首先将潜在网格的每个像素 $(i, j)$ 映射到单位射线方向 $r_{cam} \in S^2$。给定高度 $H$ 和宽度 $W$,纬度 $\theta$ 和经度 $\phi$ 为:

$$ \theta = \frac{\pi – i + 0.5}{H} \pi, \quad \phi = \frac{j + 0.5}{W} 2\pi – \pi \quad (1) $$

遵循我们的数据集约定,所得相机空间射线定义为:

$$ r_{cam} = [-\cos \theta \cos \phi, -\cos \theta \sin \phi, -\sin \theta]^\top \quad (2) $$

4

第 5 页

输入 基础潜在自注意力 DIT 块*30 相机 … … 旋转

相机 平移 动作建模:DPRC 潜在运动 积分 球面 射线 (i,j) 运动 ե Ǟ։ 反投影 构建 ե՝֍ 流形 ǝ։ե Ɉս 值 潜在 ) ǜ։ե射线姿态 (θ,ق 键 … ε 射线 (θ, ) ق … … PRoPE编码 查询 Ɉս ։թ 噪声填充帧 射线 注意力 反补丁化 ǘ0 Ȱե՝֍։թ ǘ & 后处理 记忆库 记忆 记忆建模:GMA 检索 门控 g … …

记忆 最大得分 置信度引导 键 射线 注意力 门控与融合 … … 检索到的特征 … … PRoPE 记忆值 生成 视频 图像潜在 射线姿态 编码

图 3:PanoWorld 网络架构。基于 Wan2.2 骨干网络,PanoWorld 采用三流 DiT,通过共享几何流形融合视觉自注意力、基于 DPRC 的动作建模以及用于记忆锚定合成的 GMA 模块。

该映射确保后续的动作建模尊重场景固有的 360◦ 拓扑结构,从而减轻非均匀平面投影失真。

运动流形构建。为了在 3D 平移过程中保持辐射一致性,模型必须感知射线强度如何随相机位移而变化。由于我们采用去路由表示(其中 Rt = I),运动流形仅由平移 ct 决定。我们通过三步局部变换来构建此流形:

步骤 1:局部标准正交基。对于每条静态射线,我们构建一个右手标准正交基 Rloc = [ax, ay, zloc],其中局部 z 轴与射线方向对齐:zloc = rcam。 ay = normalize(zloc × uworld), ax = ay × zloc (3) 其中 uworld = [0, 0, −1]⊤ 是世界向上向量。

步骤 2:局部变换矩阵。我们定义一个矩阵 Tray,将全局相机运动锚定到单个射线的视角: R⊤loc −R⊤locct Tray = ∈SE(3) (4) 0⊤ 1

平移项 −R⊤locct 表示相机中心 ct 在射线局部轴上的投影。这种对平移视差的显式编码向模型提供了相机位移如何从该特定射线的视点影响观察场景的信息。

潜在运动积分。为了确保计算效率,ˆrt 通过投影位置编码(PRoPE)进行编码,并直接注入扩散 Transformer 块中。通过在降采样潜在网格上操作,模型以最小的开销保持精确的运动学控制。这种高保真集成确保了时间和辐射一致性,因为生成的视觉流受到射线场固有几何形状的约束,防止结构漂移,并确保在复杂机动过程中的视图依赖性稳定性。

4.1.3 记忆建模:GMA

为了确保在演化轨迹 across 鲁棒的时空和辐射一致性,我们提出了几何感知记忆(GMA)机制。与依赖显式 3D 基元的方法不同,GMA 通过隐式几何流形促进历史内容检索,将生成过程锚定到一个持久的 3D 世界中。

查询与记忆的统一投影。GMA 通过在共享几何坐标系中对查询潜在和记忆库进行编码,将动作条件和记忆检索统一起来。

5

第 6 页

视频生成子阶段 2.1 学习子阶段 2.2 泛化子阶段 2.3 提升原子能力性能 视频生成模型 记忆模型 合成数据与精确控制标签 线性运动数据过滤 所有真实世界数据 LORA 动作模型 所有真实世界数据 真实世界视频生成模型

步骤1 全景视频微调 步骤2 视图依赖运动学习 步骤3 记忆锚定一致性

图 4:渐进式三阶段流程概述。阶段 1 专注于全景视频生成的几何适应;阶段 2 针对视图依赖运动学习;阶段 3 启用记忆锚定一致性以强制执行长期时间一致性。

将特征 $\{x_m\}$ 映射到共同的 PRoPE 空间。记忆键和值公式化为:

$$ [K_{mem}, V_{mem}] = \text{PRoPE}(\text{Linear}(x_m), \hat{r}_m), \quad (5) $$

其中 $\hat{r}$ 是与运动控制使用的基于射线的表示相同的表示。这种对齐使得注意力机制能够基于 3D 射线对应关系检索历史特征,而不是显式的图像空间扭曲。因此,当相机重新访问位置时,检索到的特征与原始观测值保持固有的几何和辐射一致性。

置信度引导的门控与融合。为了防止在未观测区域出现内容幻觉并保持全局稳定性,我们实现了一种置信度引导的门控机制。我们基于最大注意力亲和力量化检索置信度 $c$,以识别具有高几何重叠的区域:

$$ c = \text{clamp} \left( \max_j (\text{Softmax}(Q_i K_j^\top / \sqrt{d})), 0, 1 \right) \quad (6) $$

最终特征 $F_{final}$ 是通过自适应门控将检索到的记忆 $F_{mem}$ 与基础扩散特征 $F_{base}$ 融合而成的:

$$ F_{final} = F_{base} + (g \cdot c) \cdot F_{mem} \quad (7) $$

最终特征 $F_{final}$ 是通过自适应融合生成的:$F_{base} + (g \cdot c) \cdot F_{mem}$。结果是一个持久的生成框架,强制执行长期辐射一致性。通过将合成锚定到高置信度的历史射线上,模型消除了复杂机动过程中的闪烁和结构漂移,确保环境视觉属性在整个轨迹中保持不变。

4.2 训练策略

本节介绍上述组件是如何逐步优化的,而不是一次性优化,如图 4 所示。我们首先使骨干网络适应全景几何结构,然后学习运动控制,最后激活记忆建模,这有助于稳定优化过程,并在完全集成之前帮助每个组件获得其预期角色。

阶段 1:全景视频微调。此阶段的目标是将预训练的视频模型适应全景领域。我们使用 LoRA 在全景数据集上微调骨干网络,使其学习等距柱状投影几何特征,如极畸变和水平环绕一致性。为了平衡训练,我们使用纬度感知重建损失:

$$ \mathcal{L}_{stage1} = \mathbb{E}_{\cos(\theta)} \cdot |\epsilon – \epsilon_\theta(x_t, t)|^2 \quad (8) $$

结果是一个几何感知的骨干网络,它内在尊重 360° 拓扑约束。这为几何一致性奠定了基础,防止在合成过程中出现结构撕裂和边界伪影。

阶段 2:视图依赖运动学习。在此阶段,我们冻结 LoRA 权重,并通过 DPRC 训练动作流以掌握 3D 平移控制。通过从训练轨迹中移除偏航旋转,我们迫使模型隔离依赖于深度的视差学习。DPRC 将自运动建模为全景射线的密集重索引,使生成器能够学习相对于 3D 空间坐标的强度演化。这种射线-几何对齐强制执行辐射一致性,确保在复杂机动过程中外观稳定和结构完整。

6

第 7 页

阶段 3:记忆锚定一致性。最终阶段激活 GMA 模块,通过统一的几何流形,从顺序生成过渡到基于记忆的合成。利用置信度引导门控(Confidence-Guided Gating),模型自适应地将合成过程锚定在存储的地标上。该框架通过确保在重访时先前观察到的地标保持一致,从而强制执行长期的辐射一致性。通过将合成过程锚定在高置信度的历史射线上,模型消除了闪烁和结构漂移,提供了连续且稳定的 3D 场景实现。

5 实验

5.1 实验设置

实现细节 我们通过微调 Wan2.2-5B 架构来实现 PanoWorld。为了在保留基础模型生成先验的同时高效地适配模型,我们采用基于 LoRA 的微调方法。如第 4.2 节所述,我们的训练遵循解耦的多阶段流水线,在参数冻结的情况下独立优化动作条件模块和记忆模块。

评估指标 我们使用涵盖分布保真度、视觉质量和全景特定感知能力的多维指标套件来评估我们的框架。我们报告 FID 及其区域变体(FIDpole 和 FIDequ),以评估全向流形上的结构完整性。视觉保真度和时间一致性使用 FAED 进行测量,而 NIQE 和 Q-Align 指标(QAqual. 和 QAaes.)[Wu et al., 2023] 则量化清晰度和美学一致性。为了评估轨迹可控性,我们遵循 CamPVG [Ji et al., 2025] 和 OminiRoam [Liu et al., 2026] 的方案。具体而言,所有方法均使用相同的地面真实(GT)轨迹作为条件,以避免因运动尺度不同或结构运动(structure-from-motion)提取引入噪声而导致的比较不公。我们在多个时间窗口上计算生成视频与 GT 序列之间的平均 PSNR,以量化对指定轨迹的遵循程度。较高的 PSNR 值表明更准确的相机控制和更长的时间跨度内更强的结构持久性。

基线 我们将所提出方法的性能与三种用于轨迹控制全景视频合成的最先进框架进行比较:Imagine360 [Tan et al., 2024]、Matrix-3D [Yang et al., 2025] 和 OmniRoam [Liu et al., 2026]。为了公平比较,所有模型均提供统一的输入分辨率 480p (480 × 960)、720p (720 × 1440) 以及源自同一评估数据集的去旋转相机轨迹。具体而言,由于 Imagine360 最初生成 512 × 1024 分辨率的 32 帧视频,我们将其输出下采样至 480 × 960,并应用时间插值将序列扩展至 81 帧,以确保与评估协议的一致性。

5.2 结果与比较

定性结果 图 9 展示了我们的方法与现有方法在使用真实户外序列时的定性比较。我们可视化了不同运动模式下的生成结果,以评估视觉保真度和运动一致性。

我们的方法保持了精确的轨迹遵循性和几何稳定性,并具有优越的语义清晰度。相比之下,Matrix-3D 尽管具有显式的 3D 先验,但在高度变化期间会出现严重的模糊和结构“空洞”。OmniRoam 由于其训练数据为固定高度,无法遵循垂直指令,导致出现严重的重影和伪影。这些结果证实,PanoWorld 有效地缓解了结构漂移并保持了环境持久性,在复杂的真实世界机动中优于基线方法。

视觉质量的定量分析。如表 5 所示,PanoWorld 在几乎所有视觉质量指标上均优于基线方法。在分布保真度方面,我们的方法实现了最低的 FID (27.64)、FIDpole (47.21) 和 FIDequ (26.00)。这些结果表明,我们的模型在整个 360◦ 流形上保持了优越的结构完整性,有效抑制了其他全景模型中常见的极点严重失真和赤道模糊问题。此外,我们的方法取得了领先的 QAqual. (4.0202),反映了高视觉真实感。虽然 Imagine360 显示出更高的美学得分,但它缺乏我们框架所提供的几何稳定性和物理一致性。

7

第 8 页

Imagine360 Arc Matrix-3D OmniRoam

Ours

Imagine360 Upward Matrix-3D OmniRoam

Ours

Imagine360 Backward Matrix-3D

OmniRoam

Ours

First Frame Sample Frame 1 Sample Frame 2 Sample Frame 3

图 5:真实世界户外序列的定性比较。

轨迹控制的定量分析。 我们的框架在所有时间窗口上均持续优于 Matrix-3D 和 OmniRoam。如表 3 所示,PanoWorld 实现了显著更高的 PSNR,反映出其更优的路径遵循能力。值得注意的是,在高海拔场景的复杂高程变化期间,OmniRoam 遭受了严重的结构漂移。我们进一步利用 ViPE [Huang et al., 2025] 从生成的视频中重建相机位姿,以验证轨迹保真度;我们的方法在稳定性和位姿估计指标上,均持续展现出与真实指令最紧密的对齐效果。这些结果证实了 PanoWorld 在具有挑战性的大规模环境中执行精确机动操作的鲁棒性。

8

第 9 页

表 2:全景视频生成的定量结果。最佳结果以红色标出。

| Method | Resolution | Distribution Fidelity ↓ | | | | Alignment ↓ | Panoramic Perceptual Quality | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | FID ↓ | FIDpole ↓ | FIDequ ↓ | FAED ↓ | NIQE ↓ | QAqual. ↑ | QAaes. ↑ | | Imagine360 | 480p | 81.18 | 113.95 | 60.99 | 4.50 | 3.15 | 4.0915 | 3.4657 | | Matrix-3D | 480p | 34.63 | 67.88 | 68.64 | 3.39 | 4.74 | 2.9942 | 2.1258 | | OmniRoam | 480p | 60.77 | 85.25 | 45.92 | 3.36 | 3.39 | 3.7510 | 3.0575 | | Ours | 480p | 27.64 | 47.21 | 26.00 | 2.63 | 3.85 | 4.0202 | 3.1283 | | Matrix-3D | 720p | 35.35 | 70.27 | 44.06 | 2.86 | 3.63 | 3.75 | 2.9653 | | OmniRoam | 720p | 44.89 | 89.95 | 83.24 | 3.06 | 3.74 | 4.07 | 3.5134 | | Ours | 720p | 16.93 | 35.46 | 18.86 | 1.18 | 3.24 | 4.14 | 3.3413 |

表 3:运动控制评估。最佳结果以红色标出,而“–”表示基线原始实现不支持该指标。

| Method | Resolution | PSNR20−25 | PSNR50−55 | PSNR70−75 | PSNR75−80 | | :— | :— | :— | :— | :— | :— | | Imagine360 | 480p | – | – | – | – | | Matrix-3D | 480p | 20.47 ± 2.81 | 18.80 ± 2.67 | 18.13 ± 2.68 | 18.02 ± 2.68 | | OmniRoam | 480p | 18.51 ± 4.40 | 17.59 ± 4.47 | 17.34 ± 4.01 | 17.02 ± 3.83 | | Ours | 480p | 22.83 ± 3.73 | 21.65 ± 3.70 | 21.04 ± 3.73 | 20.92 ± 3.73 | | Matrix-3D | 720p | 20.30 ± 2.99 | 18.79 ± 2.89 | 18.26 ± 2.85 | 18.16 ± 2.83 | | OmniRoam | 720p | 18.63 ± 3.78 | 17.78 ± 3.60 | 17.37 ± 3.49 | 17.30 ± 3.44 | | Ours | 720p | 22.94 ± 3.77 | 21.41 ± 3.75 | 20.83 ± 3.84 | 20.74 ± 3.87 |

5.3 消融实验

如表 4 所示,我们将完整模型与无 GMA(w/o GMA)和随机记忆(Random Memory)变体进行了对比,GMA 显著提高了几何稳定性和长期轨迹遵循能力,且性能增益随序列长度增加而扩大。

定性结果证实,GMA 保持了几何一致性和场景持久性,而无 GMA 基线则出现空间滑动和模糊。虽然随机记忆导致几何结构破碎,但我们的完整模型保持了稳定的结构,验证了其有效性。

Matrix-3D

OmniRoam

Ours

Matrix-3D Traj OmniRoam Traj Ours Traj GT Traj Traj Strat Traj End

图 6:通过 ViPE 进行的轨迹保真度定性比较评估。我们利用 ViPE 从合成视频中重建相机轨迹,并将其与真实轨迹(GT)进行比较。

9

第 10 页

无 GMA

随机 记忆

有 GMA

t t

图 7:GMA 模块的定性消融结果。在控制条件下合成的视频帧对比:(a) 无 GMA 基线表现出显著伪影;(b) 随机记忆变体导致几何结构断裂;(c) 包含 GMA 的完整设置保持了生成的一致性。

表 4:记忆模块的消融研究。我们比较了不同时间窗口下的轨迹控制稳定性(PSNR)。粗体表示最佳性能。

方法 PSNR20−25 ↑ PSNR50−55 ↑ PSNR70−75 ↑ PSNR75−80 ↑ ∆(增益)

无 GMA 21.92 ± 3.81 20.61 ± 3.75 19.98 ± 3.78 19.85 ± 3.79 – 随机记忆 15.51 ± 4.40 13.59 ± 4.47 13.34 ± 4.01 13.42 ± 3.83 –

有 GMA 22.83 ± 3.73 21.65 ± 3.70 21.04 ± 3.73 20.92 ± 3.73 +1.07

5.4 扩展

通过因果强制实现实时生成。我们通过因果强制 [Zhu et al., 2026] 将我们的框架扩展以实现实时生成,将完整模型蒸馏为轻量级的分块自回归生成器。具体而言,我们首先通过教师强制建立因果自回归框架,随后通过最小化非对称分布匹配蒸馏 (DMD) 损失,使学生生成器的分布 $\hat{p}_\theta$ 匹配该训练好的教师分布 $p_\theta$:$\mathbb{E}_{\hat{x}\sim\hat{p}_\theta, x\sim p_\theta}[D(\hat{x}_{1:T}, x_{1:T})]$。得益于这种蒸馏以及我们的滚动强制推理,我们的实时生成器仅用 8 秒即可在单个 NVIDIA H20 GPU 上生成高保真的 161 帧全景视频。与我们的完整模型(约 4 分 48 秒)相比,这实现了数量级的大幅加速,并且显著快于之前的最先进方法,如 Matrix-3D(约 16.5 分钟)和 OmniRoam(约 31 分钟),且质量损失可忽略不计。图 8 展示了在此实时设置下的生成结果。更多细节请参阅补充材料。

图 8:实时生成。左列显示初始输入帧,随后是基于指定键盘输入实时生成的连续帧。

10

第 11 页

6 结论

在本工作中,我们提出了 PanoWorld,一个用于可控全景视频生成的框架。 通过利用全向表示的旋转等变性,我们解耦了旋转以简化运动学习。基于全景射线的独特性质,我们提出的 DPRC 和 GMA 模块确保了严格的几何、辐射度及时序一致性。为了支持这项研究,我们引入了 World360,这是一个包含真实世界无人机拍摄数据和高质量模拟数据的大规模数据集。在该基准上的大量实验表明,PanoWorld 在场景持久性和结构完整性方面显著优于最先进的方法,为无约束的全景世界合成提供了稳健的解决方案。

Imagine360

Forward Upward Matrix-3D

OmniRoam

Ours

Imagine360

Loop Arc Matrix-3D OmniRoam

Ours

First Frame Sample Frame1 Sample Frame2 First Frame Sample Frame1 Sample Frame2

图 9:真实世界户外序列的更多结果。

11

第 12 页

参考文献

Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, 等. Recammaster: Camera-controlled generative rendering from a single video. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 14834–14844, 2025. 3

Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, and Junfei Xiao. Captain safari: A world engine. arXiv preprint arXiv:2511.22815, 2025. 2, 3

Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, 等. Airsim360: A panoramic simulation platform within drone view. arXiv preprint arXiv:2512.02009, 2025. 2, 3

Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, and Ceyuan Yang. Cam- eractrl: Enabling camera control for text-to-video generation. arXiv preprint arXiv:2404.02101, 2024. 3

Jiahui Huang, Qunjie Zhou, Hesam Rabeti, Aleksandr Korovko, Huan Ling, Xuanchi Ren, Tianchang Shen, Jun Gao, Dmitry Slepichev, Chen-Hsuan Lin, 等. Vipe: Video pose engine for 3d geometric perception. arXiv preprint arXiv:2508.10934, 2025. 8

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, and Cairong Zhao. Campvg: Camera-controlled panoramic video generation with epipolar-aware diffusion. In Proceedings of the SIGGRAPH Asia 2025 Conference Papers, pages 1–12, 2025. 7

Xin Lin, Xian Ge, Dizhe Zhang, Zhaoliang Wan, Xianshun Wang, Xiangtai Li, Wenjie Jiang, Bo Du, Dacheng Tao, Ming-Hsuan Yang, 等. One flight over the gap: A survey from perspective to panoramic vision. arXiv preprint arXiv:2509.04444, 2025. 2

Jinxiu Liu, Shaoheng Lin, Yinxiao Li, and Ming-Hsuan Yang. Dynamicscaler: Seamless and scalable video generation for panoramic scenes. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 6144–6153, 2025. 2

Yuheng Liu, Xin Lin, Xinke Li, Baihan Yang, Chen Wang, Kalyan Sunkavalli, Yannick Hold- Geoffroy, Hao Tan, Kai Zhang, Xiaohui Xie, 等. Omniroam: World wandering via long-horizon panoramic video generation. arXiv preprint arXiv:2603.30045, 2026. 3, 7

Katja Schwarz, Norman Mueller, and Peter Kontschieder. Generative gaussian splatting: Generating 3d scenes with video diffusion priors. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 27510–27520, 2025. 2

Kiwhan Song, Boyuan Chen, Max Simchowitz, Yilun Du, Russ Tedrake, and Vincent Sitzmann. History-guided video diffusion. arXiv preprint arXiv:2502.06764, 2025. 3

Jing Tan, Shuai Yang, Tong Wu, Jingwen He, Yuwei Guo, Ziwei Liu, and Dahua Lin. Imagine360: Immersive 360 video generation from perspective anchor. arXiv preprint arXiv:2412.03552, 2024. 7

Junshu Tang, Jiacheng Liu, Jiaqi Li, Longhuang Wu, Haoyu Yang, Penghao Zhao, Siruis Gong, Xiang Yuan, Shuai Shao, Linfeng Zhang, 等. Hunyuan-gamecraft-2: Instruction-following interactive game world model. arXiv preprint arXiv:2511.23429, 2025. 2

Robbyant Team, Zelin Gao, Qiuyu Wang, Yanhong Zeng, Jiapeng Zhu, Ka Leong Cheng, Yixuan Li, Hanlin Wang, Yinghao Xu, Shuailei Ma, 等. Advancing open-source world models. arXiv preprint arXiv:2601.20540, 2026. 2

Matthew Wallingford, Anand Bhattad, Aditya Kusupati, Vivek Ramanujan, Matt Deitke, Sham Kakade, Aniruddha Kembhavi, Roozbeh Mottaghi, Wei-Chiu Ma, and Ali Farhadi. From an image to a scene: Learning to imagine the world from a million 360 videos. Advances in Neural Information Processing Systems, 37:17743–17760, 2024. 2

Qian Wang, Weiqi Li, Chong Mou, Xinhua Cheng, and Jian Zhang. 360dvd: Controllable panorama video generation with 360-degree video diffusion model. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 6913–6923, 2024a. 2, 3

12

第 13 页

Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ping Luo, 和 Ying Shan. Motionctrl: 用于视频生成的统一且灵活的运动控制器。在 ACM SIGGRAPH 2024 会议论文集中,第 1–11 页,2024b。 3

Haoning Wu, Zicheng Zhang, Weixia Zhang, Chaofeng Chen, Liang Liao, Chunyi Li, Yixuan Gao, Annan Wang, Erli Zhang, Wenxiu Sun, 等. Q-align: 通过离散文本定义级别教授 LMMs 进行视觉评分。arXiv 预印本 arXiv:2312.17090,2023。 7

Wei Wu, Fan Lu, Yunnan Wang, Shuai Yang, Shi Liu, Fangjing Wang, Qian Zhu, He Sun, Yong Wang, Shuailei Ma, 等. A pragmatic vla foundation model。arXiv 预印本 arXiv:2601.18692, 2026。 2

Yifei Xia, Shuchen Weng, Siqi Yang, Jingqi Liu, Chengxuan Zhu, Minggui Teng, Zijian Jia, Han Jiang, 和 Boxin Shi. Panowan: 借助纬度/经度感知机制将扩散视频生成模型提升至 360 {\deg}。arXiv 预印本 arXiv:2505.22016,2025。 2

Ke Xing, Hanwen Liang, Dejia Xu, Yuyang Yin, Konstantinos N Plataniotis, Yao Zhao, 和 Yunchao Wei. Tip4gen: 文本到沉浸式全景 4D 场景生成。在第 33 届 ACM 国际多媒体会议论文集,第 9267–9276 页,2025。 2

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, 等. Matrix-3d: 全方位可探索的 3D 世界生成。arXiv 预印本 arXiv:2508.08086,2025。 2, 3, 7

Jiwen Yu, Jianhong Bai, Yiran Qin, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Xihui Liu. Context as memory: 基于记忆检索的场景一致交互式长视频生成。 在 SIGGRAPH Asia 2025 会议论文集中,第 1–11 页,2025。 3

Wangbo Yu, Jinbo Xing, Li Yuan, Wenbo Hu, Xiaoyu Li, Zhipeng Huang, Xiangjun Gao, Tien- Tsin Wong, Ying Shan, 和 Yonghong Tian. Viewcrafter: 驯服视频扩散模型以实现 高保真新视角合成。arXiv 预印本 arXiv:2409.02048,2024。 3

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Gambardella, Dinh Phung, 和 Jianfei Cai. Unified camera positional encoding for controlled video generation。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 38027–38037 页,2026。 3

Zhaoyang Zhang, Yannick Hold-Geoffroy, Miloš Hašan, Ziwen Chen, Fujun Luan, Julie Dorsey, 和 Yiwei Hu. Generating 360° video is what you need for a 3d scene。在 SIGGRAPH Asia 2025 会议论文集中,第 1–12 页,2025。 2

Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, 和 Jun Zhu. Causal forcing: Au- toregressive diffusion distillation done right for high-quality real-time interactive video generation。 arXiv 预印本 arXiv:2602.02214,2026。 10

13

第 14 页

PanoWorld:真实世界全景生成的补充材料

A 数据集预处理

我们构建了两个用于模型训练的数据集。第一个数据集是场景真实数据(简称真实世界数据),由在多种物理环境中捕获的大规模全景视频组成。该数据集使模型能够接触自然的相机自运动(ego-motion)和复杂的视觉纹理,从而增强其在真实世界场景中的泛化能力。第二个数据集是轨迹精确数据(简称合成数据),通过 AirSim360 生成。借助 AirSim360 提供的高保真仿真和完美的真值轨迹,该数据集确保模型能够实现精确的动作条件控制,并在执行轨迹期间保持高几何一致性。

A.1 场景真实真实数据

场景真实学习数据集是一个大规模同步的视频-惯性数据集,由专用全景无人机(UAV)在真实世界环境中捕获。该数据集包含 124 段长时长的 360° 全景视频,以及源自高精度 GPS 辅助惯性导航系统(INS)的对应 6 自由度(6-DoF)自运动轨迹。该数据集总计超过 600 万帧,涵盖了广泛的户外环境——包括公园、道路、人工湖和建筑群——同时包含了高度多样化、无约束的空中运动剖面。

时间对齐。为了确保高频率运动数据与全景视觉流之间的严格时间一致性,我们执行了多阶段同步过程。这是由于全景相机(59.94 FPS)与 GPS 融合系统(200 Hz)的非同步记录所必需的。主要目标是通过将视频序列准确锚定在连续的姿态流中,建立统一的时间线。

第一步,我们通过将相机的曝光开始信号与姿态序列中的相应条目进行匹配,执行初始时间戳对齐,以确定绝对参考时间 $t_0$。一旦锚定了全局起点,我们便使用恒定帧率重建后续视频帧的离散时间线:

$$ t_i = t_0 + i \cdot \text{FPS}, \quad (9) $$

其中 $t_i$ 表示第 $i$ 帧的目标时间戳。鉴于 200 Hz 的姿态数据是在独立时钟上记录的,我们通过最近邻搜索将每个计算出的 $t_i$ 与原始姿态序列进行匹配,从而同步这两种模态。为了减轻采样偏移并确保轨迹平滑,使用线性插值将离散姿态序列重采样至这些精确的视频时间戳:

$$ p(t_i) = \text{Interp}(t_i, P_{\text{raw}}), \quad (10) $$

其中 $P_{\text{raw}}$ 表示原始轨迹。最后,丢弃任何早于首个可用姿态记录的视频帧,以确保每一帧都与有效的、同步的 6-DoF 状态配对。

旋转解耦与坐标对齐。为了消除剧烈的相机自旋转,并建立视觉内容与运动状态之间几何一致的映射,我们执行了旋转解耦和坐标系对齐的数据处理程序。由于空中飞行的无约束性质,原始全景视频包含显著的自旋转(例如,剧烈的偏航和风力引起的抖动),这会扭曲底层场景运动。同时,原始 6-DoF 姿态固有地记录在地球固定的东-北-上(ENU)坐标系中,这与相机的初始观察方向不对齐。因此,我们的主要目标是稳定视觉流,并将惯性轨迹转换为统一的规范相机坐标系。

具体而言,我们首先通过将 ENU 坐标系与第一帧的相机坐标系框架对齐来定义规范方向。连续 3D 旋转矩阵 $R_t \in SO(3)$

14

第 15 页

在帧 $t$ 时,随后利用 INS 元数据将其变换为此对齐的规范帧。为了进一步细化对齐并补偿高频传感器噪声,我们使用混合视觉-惯性优化方法对 ERP 帧进行扭曲(warping)。我们通过球面映射将连续 ERP 帧中的稀疏 2D 特征对应点 $(u, v)$ 提升(lift)到单位球面 $S^2$ 上:

$$ \theta = \frac{u}{W} 2\pi, \quad \phi = \left(1 – \frac{v}{H}\right) \pi, \quad (11) $$

$$ p = \begin{bmatrix} \cos \phi \cos \theta \\ \sin \phi \\ \cos \phi \sin \theta \end{bmatrix}, \quad (12) $$

其中 $W$ 和 $H$ 分别表示 ERP 的宽度和高度。令 $\{p_i\}$ 和 $\{q_i\}$ 为匹配后的 3D 单位向量。相对旋转 $\Delta R$ 使用基于 RANSAC 的 Kabsch 对齐进行优化,并以 INS 相对方位作为初始化:

$$ \Delta R^\star = \arg \min_{\Delta R \in SO(3)} \sum_i \|\Delta R p_i – q_i\|_2^2. \quad (13) $$

在特征匮乏的环境(例如开阔水面或天空区域)中,系统自动回退到仅基于 INS 先验的偏航角估计,并结合沿经度方向的纬度加权相位相关性。计算出的旋转序列通过一维恒定速度卡尔曼滤波器进行平滑处理。最后,通过对球面采样网格应用逆旋转矩阵,并通过网格重映射将其重新投影回规范 ERP 格式,生成旋转解耦且稳定的视觉流,从而成功消除相机自旋转,同时确保处理后的 6-DoF 姿态与规范视频帧严格对齐。

姿态噪声抑制 由于室外无人机飞行期间的空气动力学湍流、电机振动以及偶尔的 GPS 多径效应,原始同步的 6-DoF 姿态不可避免地会受到显著的高频噪声和突发传感器抖动的干扰。为了减轻这些伪影并重建适合高保真世界建模的物理合理、平滑的运动学轨迹,我们部署了一种鲁棒的两阶段姿态噪声抑制策略。首先,对原始离散姿态序列应用滞后滤波器,以消除虚假的低幅度波动并稳定轨迹基线。其次,为了保证时间可微性和运动连续性,我们在时间线上应用一维高斯平滑核。考虑到垂直定位通常比水平跟踪表现出更高的方差和噪声,尺度参数被自适应配置,水平位置分量 $(x, y)$ 的标准差为 $\sigma = 0.5$,垂直分量 $(z)$ 的标准差为 $\sigma = 1.0$,从而成功获得连续且高质量的轨迹状态。

空间均匀轨迹重采样与视觉对齐 在真实世界的数据收集中,由于自动路径跟随调整、手动飞行指令以及空气动力学阻力变化,无人机不可避免地以可变速度飞行。因此,纯粹在均匀时间网格上采样的轨迹表现出严重的非均匀空间分布,其中高速段在空间上变得稀疏,而低速阶段则密集聚集。更重要的是,当无人机进入悬停或静止状态时,尽管位移为零,时间采样仍继续记录帧,引入了显著的时间冗余,这对运动条件学习毫无贡献。对于下游生成式世界模型而言,这种空间非均匀性和静止聚集会导致严重的运动不平衡,并使网络偏向静态表示。为了解决这些问题,消除静止帧,并确保每个离散数据步骤代表相同的物理位移,我们在空间弧长域而非时间域中对同步的视频和轨迹对进行重新索引和重采样,从而成功压缩了非信息的静止序列。

空间归一化和序列生成的完整工程流水线通过以下结构化步骤实现:

步骤 1:3D 累积弧长计算。为了成功将数据集映射到空间域,我们必须首先建立一个连续、单调递增的空间度量,以反映无人机 traversed 的真实总距离。由于我们的平台是全向全景无人机,它经历了复杂的 3D 空中动力学,包括沿重力轴的大量垂直爬升和下降,这意味着简化的 2D 平面距离无法捕捉到

第 16 页

垂直运动并扭曲对齐。因此,为了准确量化物理运动,我们将 z 分量显式集成到指标计算中,并从初始帧到第 i 帧计算累积三维欧几里得弧长 $s_i$,如下所示:

$$ s_i = \sum_{k=1}^{i} \Delta s_k = \sum_{k=1}^{i} \sqrt{(x_k – x_{k-1})^2 + (y_k – y_{k-1})^2 + (z_k – z_{k-1})^2}, \quad (14) $$

其中 $P_i = (x_i, y_i, z_i)^T$ 表示离散 3D 位置状态,边界条件初始化为 $s_0 = 0$。

步骤 2:均匀空间重索引与姿态插值。 在准备好连续指标后,我们的下一个目标是生成一个归一化的轨迹基准,其中运动学状态在空间上均匀分布。通过过滤掉 $\Delta s_k \approx 0$ 的时间步,这种均匀的空间网格本质上将冗余的静态段压缩为单个空间点,从而平衡整个数据集中动态运动增量的分布。为了实现这一点,我们定义一个具有固定物理间隔 $\Delta s = 0.05$ m 的目标空间网格,将离散采样点 $s'_j$ 公式化为:

$$ s'_j = j \cdot \Delta s, \quad j \in \left\{0, 1, \dots, \left\lfloor \frac{s_{\max}}{\Delta s} \right\rfloor \right\}. \quad (15) $$

然后,我们通过连续分段线性插值,将所有来自原始时间参考系的连续运动学状态变量映射到这个新定义的空间网格上:

$$ f(s'_j) = \text{Interp}(s'_j, S_{\text{raw}}, f(S_{\text{raw}})), \quad f \in \{x, y, z, \phi, \theta, \psi\}, \quad (16) $$

其中 $S_{\text{raw}} = \{s_0, s_1, \dots, s_N\}$ 表示原始非均匀空间坐标集,$(\phi, \theta, \psi)$ 表示横滚角 (Roll)、俯仰角 (Pitch) 和偏航角 (Yaw) 方向角。请注意,由于轨迹在上游阶段已经进行了旋转解耦和稳定处理,欧拉角可以直接进行插值,而不会出现相位包裹伪影。

步骤 3:图像帧微分与时间混合。 一旦从姿态流中确定了空间均匀的重采样索引和目标时间戳,相应的视觉帧必须对齐以匹配这个新的空间网格。由于目标空间采样点并不完全与原始离散视频帧的曝光时间重合,直接提取最近的原始帧会引入严重的离散化伪影和视觉抖动。为了解决这个问题并确保视觉连续性,我们基于检索到的重采样 ID 对图像序列执行微分和插值过程。我们在包围目标空间时间戳 $t$ 的两个相邻原始帧之间应用线性时间混合:

$$ I(t) = (1 – \alpha)I_{\lfloor t \rfloor} + \alpha I_{\lceil t \rceil}, \quad (17) $$

其中 $\lfloor t \rfloor$ 和 $\lceil t \rceil$ 分别表示前一个和后一个原始视频帧的索引,$\alpha = t – \lfloor t \rfloor$ 表示分数插值权重。这一步成功迫使视频流适应空间域,保证任意两个连续处理帧之间的物理距离精确保持在 0.05 m 的恒定间隔。通过为视频编码自动选择编解码器,进一步确保了跨平台部署的鲁棒性。

步骤 4:固定长度轨迹切片。 为了满足我们框架的多任务训练目标,连续的空间均匀化视频轨迹序列使用滑动窗口策略被划分为两种不同的片段长度。首先,为了训练运动条件生成模型,我们提取固定长度为 $L_1 = 81$ 帧的标准训练样本。其次,为了支持几何感知记忆模块的优化,我们提取固定长度为 $L_2 = 161$ 帧的更长序列。对于给定的目标序列长度 $L \in \{81, 161\}$ 和总重采样轨迹长度 $M$,定义标准非重叠切片为:

$$ S_k = \{P_j \mid j = kL, \dots, (k + 1)L – 1\}. \quad (18) $$

当序列末尾的剩余片段短于所需的窗口大小 $L$ 时(即 $M \pmod L \neq 0$),我们采用向后重叠策略来构建最后一个有效切片。具体而言,最终窗口是通过从序列的绝对末端向后追溯获得的,以捕获一个完整、连续的先前重采样状态块,公式化为:

$$ S_{\text{final}} = \{P_j \mid j = M – L, \dots, M – 1\}. \quad (19) $$

16

第 17 页

A.2 轨迹精确的合成数据

为了补充我们的真实世界数据集并提供纯净、无噪声的几何监督,我们从 Air360 模拟器中整理了来自 8 种不同户外环境的轨迹精确合成数据集。与受传感器噪声、时钟漂移和插值残差影响的真实世界采集流程不同,仿真平台内在保证了全景视觉帧与真实 6-DoF 位姿之间完美的硬件级时空同步。利用这种同步框架,我们开发了一种高效、高吞吐量的自动化数据采集引擎,旨在实现严格的空间均匀数据采集。

为了实现高效的 3D 轨迹规划,同时防止相机代理陷入结构破碎的空间或在无信息量的区域浪费渲染资源,我们设计了一种分层逐层过滤和体素化策略。首先,每个户外场景的连续 3D 自由空间被离散化为分辨率为 1 m × 1 m × 1 m 的统一 3D 宏观网格。由于复杂的空中轨迹自然涉及大量的海拔变化,传统无约束 3D 探索在过于杂乱或缺乏通行连续性的海拔层中效率严重下降。为了解决这个问题并最大化采集引擎的吞吐量,我们的管道预先计算了每个离散海拔层的可通行网格单元的确切数量。如果特定海拔层内有效候选网格的数量低于预定义的密度阈值,表明没有足够的空间进行有意义的空中机动,引擎将自动跳过整个海拔层。这种主动的逐层过滤迫使系统仅将计算资源分配给开阔且几何丰富的海拔层。

对于选定的有效海拔层,候选锚点填充在分辨率为 0.05 m 的密集子网格上,以确保精确的空间均匀采样。为了真实地模拟真实世界的空气动力学飞行统计并最大化轨迹多样性,引擎被编程为在三种互补的轨迹生成模式下运行:

  • 模式 1:多方向均匀机动。为了从统一的初始状态建立高度结构化的多视角光照和运动一致性,代理从固定的初始航点 $P_{start}$ 出发,沿着三个不同的方向航向执行飞行路径,探索多样化的运动剖面(包括直线、水平/垂直曲线和连续的 3D 弧线)。每个方向的飞行持续进行,直到在 1 m 网格框架内检测到环境障碍物,此时代理过渡到静止悬停状态。关键在于,为了过滤掉琐碎片段并确保学习长程动态所需的足够空间尺度,仅当沿所有三个方向分支生成的轨迹同时超过预定义的最小长度阈值 $L_{min}$ 时,多方向序列才被视为有效并记录到语料库中。
  • 模式 2:高覆盖自主探索。为了封装复杂的 3D 机动并在复杂地形上最大化环境熟悉度,代理从随机空间初始化 $P_{rand}$ 执行主动场景覆盖。利用在 1 m 宏观网格地图上优化的 3D A* 算法,代理动态计算无碰撞路径以探索环境。一旦累积可见体积覆盖了当前场景中至少 70% 的总可通行自由空间,轨迹生成过程便自动终止,从而确保巨大的空间多样性。
  • 模式 3:随机多目标导航。为了模拟无约束的点对点传输并捕获通用的 6-DoF 飞行统计,引擎在未遮挡的 3D 网格空间中随机采样初始航点 $P_{rand\_start}$ 和目标目的地 $P_{rand\_end}$。然后使用 3D A* 路径规划器生成连接这两个随机终端状态的全局最优无碰撞轨迹。

为了更好地近似真实空中飞行中观察到的平滑、连续的位姿转换,并消除速度突变,对模式 2 和模式 3 中连续锚点之间生成的分段线性边使用几何平滑过程进行修改。在每个锚点附近,相邻的线性段被替换为连续的圆弧,这些圆弧与边向量相切,并严格验证 3D 碰撞约束。由于相邻锚点的邻近球体可能重叠,每个圆弧的切向偏移量限制为相应边长的 0.3 倍,从而确保连续的速度剖面和真实的 6-DoF 角度转换。最后,沿着这些归一化轨迹,以精确的恒定空间增量 $\Delta s = 0.05$ m 直接渲染连续的全景视频序列,

17

第 18 页

底层 3D 场景表示,从而生成高保真、严格空间均匀的基准数据集,其中包含复杂的海拔变化和丰富的几何约束。

A.3 提示构建与过滤流程

为了在生成式世界模型中实现稳健的文本条件控制和多模态对齐,处理后的视频轨迹序列必须与高质量、语义密集的文本描述配对。与依赖运动中心描述(这些描述与显式的 6-DoF 轨迹输入引入跨模态冗余)不同,我们构建了一个自动化的文本监督流程,该流程仅专注于环境特征、空间布局和环境光照。该流程通过以下结构化操作,将静态场景美学与文本条件联系起来:

步骤 1:以环境为中心的場景描述。为了合成全面的文本表示,同时避免因密集帧处理带来的计算冗余,我们从每个视频片段中均匀提取 21 帧的稀疏序列。这些帧按顺序输入到视觉语言模型(Qwen3-VL)中,并附带一个定制的系统性提示,要求模型描述背景环境,同时严格省略任何关于相机自身运动或动态物体运动的描述。通过同时观察多帧序列,模型成功地将静态场景语义、结构属性、风化条件和材质纹理提炼为单一、连贯的环境叙述。

步骤 2:双层级环境粒度。为了支持不同规模的文本条件,并促进快速语义锚定和复杂的场景学习,以环境为中心的描述根据字数自适应地拆分为双层级框架。长度严格低于 35 个单词的描述被归类为简洁提示(Concise Prompts),它们捕捉基本的高级场景语义,如全局地形类型(例如,茂密的松树林、岩石峡谷)和宏观气候概况。相反,超过 35 个单词的描述被保留为详细提示(Detailed Prompts),提供关于空间几何、建筑风格、细粒度表面纹理和复杂环境光交互(例如,体积阳光束、漫射阴天阴影)的密集细节。这种多粒度设计允许下游世界模型同时优化粗粒度环境匹配和细粒度视觉-文本对应关系。

步骤 3:多维光照与曝光评估。为了防止生成网络从退化数据中学习损坏或物理上不可信的外观先验,视觉帧会根据全局像素强度统计数据的三个定量标准,经过自动光照筛选阶段:

• 曝光不足检测:为了识别严重的阴影噪声和完全无信息的黑色区域,我们计算 RGB 通道上的帧级平均像素强度 $\mu_I$。平均亮度值低于严格下限 $\mu_I < 30$(死黑)的帧会被标记。

• 低对比度追踪:为了捕捉动态范围被压缩的褪色场景,我们通过像素强度标准差评估图像对比度 $\sigma_I$。显示低对比度($\sigma_I < 20$)的序列会被标记,这通常表示在结合低平均强度时照明不良的环境。

• 过曝比率估计:为了过滤掉几何纹理完全丢失的裁剪高光,我们计算过曝像素比率 $R_{over}$。如果像素强度超过 250,则单个像素被视为饱和;如果饱和区域占据帧的很大一部分,则视频片段被标记为过曝,公式化为 $R_{over} > 40\%$。

所有未能通过这些多维光照标准中的任何一项的视频序列标识符,都会被系统地记录到曝光异常目录中。

步骤 4:感知质量评分。除了传统的像素级亮度统计外,生成模型对高频视觉伪影、模糊和压缩失真高度敏感。为了量化与人类对齐的感知质量,我们采用 Q-Align,这是一种学习到的盲图像质量评估(BIQA)模型,用于对剩余帧进行评分。该模型基于人类感知对齐,为每帧预测一个连续的审美和保真度分数 $Q \in [0, 1]$,整个视频数据集的推断分数分布被归档在评分目录中。

18

第 19 页

步骤 5:战略性双阶段过滤。为了在不同训练规模下平衡处理效率与数据集纯度,我们的流水线提供了两种替代过滤方案以生成干净子集:

  • 仅曝光过滤(快速模式): 该策略旨在通过专门剔除曝光异常目录(exposure_or_dark.txt)中记录的序列来实现快速数据吞吐。它针对需要快速扩展数据集规模同时确保基本光照一致性的场景进行了高度优化。
  • 双属性过滤(完整模式): 为了实现最大的视觉纯度,这种综合策略执行联合约束。它同时丢弃所有受曝光影响的序列,并通过执行严格的感知质量截止阈值 $Q < 0.7$ 来剪除低保真片段。这种双门控筛选成功移除了所有视觉降级内容,隔离出包含 $M$ 个纯净视频序列的最高质量核心子集。

步骤 6:数据集划分。在建立净化后的数据集后,我们的最终目标是将语料库划分为不同的训练和测试基准(train.csv 和 test.csv)。我们采用动态数据集划分策略,其中测试集被分配为干净数据集的 10% 到 20% 的动态比例,剩余的大部分分配给训练集。关键在于,测试集的选择优先级严格绑定于拥有全面、高精度真实姿态标注的视频片段,从而防止轨迹跟踪误差,并为评估阶段奠定坚实的基础。

B 实验设置

B.1 视频模型训练流水线

我们采用 WAN2.2-5B 作为基础视觉生成器,并集成秩配置为 64 的低秩自适应(LoRA)以实现参数高效微调。训练直接在 DiffSynth-Studio 框架上进行,规模涵盖 70k 个视频-轨迹样本。为了确保跨不同数据流的结构性对齐,所有视觉序列均统一调整空间分辨率为 $480 \times 960$。遵循 WAN2.2-5B 的官方实现,序列的第一帧直接沿帧维度与潜在噪声拼接,作为强大的空间条件锚点,随后在损失计算中将其排除,以便将优化梯度纯粹集中在合成内容上。为了增强模型在多模态输入下的几何鲁棒性,我们对视频流应用随机在线偏航角旋转,并在简洁和详细的环境提示之间随机切换。网络优化恰好进行 2 个 epoch,并启用经纬度损失以严格强制球面几何一致性。为了在保持稳定优化轨迹的同时适应硬件内存限制,批大小配置为 1,梯度累积步数为 4,完整的分布式训练流水线部署在 8 块 NVIDIA H20 GPU 上。

B.2 动作模型训练流水线

为了保留既有的多模态视觉表示并消除运动学对齐过程中的梯度干扰,上游视频生成模型被完全冻结,动作控制模型则独立优化。训练协议分为三个渐进阶段,每个阶段恰好执行 2 个 epoch,以确保跨不同数据分布的平衡收敛。在第一阶段,我们通过过滤后的平面线数据集训练,利用基本方向先验初始化网络;为了人工扩大空间覆盖范围并防止对特定飞行航向过拟合,我们实施结构化数据增强方案,通过将视觉帧及其对应的轨迹偏航角显式旋转固定的正交间隔 $90^\circ, -90^\circ, 180^\circ$ 和 $-180^\circ$,学习率设置为 $1 \times 10^{-4}$。在第二阶段,训练转向整个 70k 真实世界数据样本语料库,以适应复杂、无约束的物理飞行动力学,保持学习率为 $1 \times 10^{-4}$。在第三阶段,最终微调在 50k 轨迹精确的合成数据样本上执行,以保守地缩小学习率至 $5 \times 10^{-5}$,从而进一步细化 6-DoF 轨迹控制限制,防止对真实世界特征的灾难性遗忘。在第二和第三阶段期间,应用了激进的在线数据增强策略,其中视频

19

第 20 页

序列及其配对的 6-DoF 位姿均受到同步的随机旋转扰动,以最大化数据多样性和 6-DoF 角度泛化能力。在所有三个训练阶段中,批次大小(batch size)严格配置为 1,并配合 4 步梯度累积,以在遵守硬件内存限制的同时维持有效的优化批次大小。

B.3 记忆模型训练流程

为了保持已建立的视觉生成和行动控制能力的完整性,上游视频模型和行动模型均完全冻结,仅独立优化几何感知记忆模块。训练协议被构建为渐进式的两阶段方案。在第一阶段,我们执行几何预热阶段,利用从收集的 video 序列中提取的 20k 帧对及其对应的真实相机位姿。具体而言,模型接收一个完整的上下文帧和一个应用了区域掩码的后续目标帧。由两帧 6-DoF 位姿之间的相对位移驱动,记忆模块被优化以基于初始帧的上下文线索重建掩码区域内的遮蔽视觉内容。为了迫使网络学习基本的、非平凡的空间变换,而非局部插值,每对帧之间的空间位移被严格限制在 0.2 m 至 2.0 m 的范围内。

在第二阶段,我们通过分块视频数据加载过渡到全序列学习,利用长度为 161 帧的 50k 个视频片段。对于每个片段,从序列中随机采样一个起始帧。为了构建记忆条件,我们贪婪地选择空间位移严格位于 [0.2, 2.0] m 范围内的最早四帧,这些帧与采样的起始帧的距离。然后,这四帧被拼接以形成记忆锚点。在训练过程中,该记忆锚点和原始条件帧均被添加噪声,以监督后续 81 帧视频序列的预测,从而确保用于记忆引导合成的足够几何视差。在整个训练过程中,学习率保持在 1 × 10−4,批次大小为 1,梯度累积步数为 4,以确保在硬件约束内的稳定收敛。

B.4 基线方法

B.5 推理

在推理和基准测试阶段,我们从 World360 数据集中采样 90 个代表性的视频轨迹序列,作为全面的评估基线。该评估语料库涵盖了多种 3D 机动类型,包括前向、后向、侧向、垂直(上/下)平移,连续弧线以及复杂的环形轨迹。为了严格量化模型性能,我们建立了一个多维评估套件,涵盖分布保真度、全向视觉质量和 6-DoF 运动可控性:

  • 视觉与几何保真度指标:我们采用标准的 Fréchet 视频距离 (FVD) 和 Fréchet 图像距离 (FID),以及全景区域变体 (FIDpole 和 FIDequ),以准确评估全向球面流形上的结构完整性和投影一致性。为了解决等距柱状投影引入的固有几何失真,视觉清晰度和细粒度美学一致性通过自然图像质量评估器 (NIQE) 和学习的质量指标 (QAqual. 和 QAaes.,源自 Q-Align) 进行量化,这些指标通过应用纬度感知的像素权重,专门适应球面到平面的面积失真。此外,时间一致性和运动模糊伪影使用 Fréchet 音视频距离 (FAED) 的等效变体进行惩罚,建立了一个专为全景视频合成而非标准平面配置量身定制的评估框架。
  • 轨迹可控性与 6-DoF 遵循性:为了确保不同生成基线之间的确定性和公平比较,我们将所有竞争方法置于相同的真实轨迹 (GT) 条件下。这种统一的条件设置有效地消除了由不同运动尺度或传统运动恢复结构 (SfM) 管道通常产生的高频跟踪噪声引起的评估偏差。我们计算合成视频与真实序列在多个渐进时间窗口之间的平均峰值信噪比 (PSNR),以量化在显式运动约束下的结构持久性和对齐情况。

20

第 21 页

关键在于,由于像 PSNR 这样的像素级指标无法完全捕捉 3D 空间中的绝对几何漂移,我们引入了一种更严格、以轨迹为重点的验证机制,使用 ViPE,这是一种针对自运动跟踪优化的最先进的视觉姿态估计网络。我们利用 ViPE 直接从生成的全景视频帧中显式重建连续的 6-DoF 相机轨迹。然后,使用标准的机器人轨迹指标(如绝对轨迹误差 (ATE) 和相对姿态误差 (RPE))将恢复的轨迹与参考真实姿态进行对齐和比较。这种逆向几何重建提供了对模型在长视界 rollout 中动作遵循准确性和物理一致性的显式、高度敏感的衡量标准。

C 应用

C.1 通过因果强制实现实时应用

定性结果。我们展示了利用我们开发的全景 I2V 世界模型进行实时视频生成的额外定性结果。与之前因架构差距而遭受严重结构模糊或运动不一致的方法相比,我们的框架——建立在因果强制(Causal Forcing)之上,并推进到 Wan2.2-TI2V-5B 骨干网络——展示了更优越的能力。给定单个输入全景图像和一系列相机轨迹,我们的模型成功生成了时间连贯、高保真的全景场景视频。得益于分块教师强制(chunk-wise teacher forcing)和因果 ODE 蒸馏,生成的预览展现出异常稳定的场景几何、精确的透视转换,以及在扩展的时间视界内对指定相机运动的严格遵循。

技术实现 为了构建高保真、可控的交互式环境模拟器,我们调整了 Wan2.2-TI2V-5B 扩散模型,通过因果强制将其原始的双流架构转换为因果自回归框架。

我们实现了一种分块自回归策略,将 21 个潜在帧划分为 [1] + [4 × 5] 结构。初始帧作为干净的 I2V 条件锚点,不参与损失计算。剩余的 20 帧以 4 帧为块使用教师强制进行训练。为了在保持骨干网络双流特性的同时强制执行因果性,完整的真实值 (GT) 潜在序列与噪声序列连接形成输入 (cleanx),并通过 FlexAttention 构建 I2V 特定的教师强制注意力掩码。该掩码保证:(i) 条件帧的噪声 token 仅关注其自身的干净对应项,以及 (ii) 特定生成块内的噪声 token 仅关注来自先前块的干净 GT token,防止同一块内的未来信息泄漏。相机姿态沿 token 维度复制,以精确对齐这种干净/噪声双流序列结构。

我们遵循因果强制的标准三阶段流程,将自回归 Wan2.2 模型压缩为高效的实时生成器:(1) 带有教师强制的自回归扩散训练,(2) 因果 ODE 初始化以弥合架构差距,以及 (3) 非对称分布匹配蒸馏 (DMD)。在 480p 分辨率下,阶段 1 训练 3,000 步,阶段 3 DMD 优化 10,500 步,产生一个超快的 4 步生成器,其离散时间步为 {1000, 750, 500, 250}。

长视频蒸馏与滚动强制推理。为了超越 21 个潜在帧(81 个像素帧)的训练限制,我们通过滚动强制(Rolling Forcing)机制将分块 DMD 扩展到 161 像素视频(41 个潜在帧)。在训练期间,rollouts 使用滑动窗口 KV 缓存自回归生成多达 41 个因果潜在帧,同时对最后 21 帧应用 DMD 监督,以与冻结的双向评分网络兼容。我们在 1,998 个预编码的全景片段上对模型进行蒸馏。在推理时,滚动强制基于第一帧、文本和相机轨迹(合成或数据集姿态)在一次传递中生成所有 41 个潜在帧,产生具有 4 步蒸馏调度器的 161 帧视频。为了消除移动去噪窗口内干净缓存的污染,使用了 KV 缓存的前缀快照与恢复机制。此外,为了在长序列生成期间提高内存效率,实现了具有 1 个潜在帧(对应 4 个像素帧)重叠混合机制的分块 VAE 解码。

21

第 22 页

图 10:生成效率对比

定量结果。我们在表 5 中报告了全景视频生成和运动可控性的定量评估结果。如所示,我们的完整模型(Ours)显著优于现有的最先进方法,在几乎所有视觉质量(例如,FID、FAED)、感知质量(QA)和轨迹可控性(PSNR)指标上均取得了最佳分数。

在引入因果强制(causal-forcing)变体时,与我们的完整模型相比,其在视觉保真度和轨迹控制方面仅出现微小且可接受的下降。然而,这种可忽略的质量差距伴随着推理效率的数量级提升。如图 10 所示,在单张 NVIDIA H20 GPU 上,我们的完整模型需要 4 分 48 秒才能完成生成,而 Matrix-3D 和 OmniRoam 等竞争性方法则因高昂的计算成本而受阻,分别耗时近 16.5 分钟和 31 分钟。相比之下,我们的因果强制模型成功将生成时间缩短至仅仅 8 秒。这种卓越的速度提升以及图 10 中显示的清晰效率权衡,确立了因果强制作为一种用于实时生成的高实用性和强大解决方案的地位。

表 5:全景视频生成和运动可控性的定量结果。

| Method | Gen. Time | Visual Quality | | | | | Perceptual Quality | | Traj. Controllability | | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | | | FID↓ | FIDp↓ | FIDe↓ | FAED↓ | NIQE↓ | QAq↑ | QAa↑ | PSNR25↑ | PSNR55↑ | | Matrix-3D | 16m36s | 34.63 | 67.88 | 68.64 | 3.39 | 4.74 | 2.99 | 2.13 | 20.47 | 18.80 | | OmniRoam | 30m46s | 60.77 | 85.25 | 45.92 | 3.36 | 3.39 | 3.75 | 3.06 | 15.51 | 13.59 | | self-forcing | 16s | 107.32 | 153.35 | 112.98 | 3.79 | 3.73 | 2.57 | 2.26 | 15.32 | 13.62 | | Ours | 4m48s | 27.64 | 47.21 | 26.00 | 2.63 | 3.85 | 4.02 | 3.128 | 22.83 | 21.65 | | causal-forcing | 8s | 28.07 | 56.66 | 27.27 | 2.81 | 4.06 | 3.96 | 3.09 | 21.93 | 20.32 |

D 讨论

D.1 局限性

尽管具有高效性,我们当前的框架仍表现出一定的局限性。主要的瓶颈源于直接将输入图像复制为生成序列的第一帧的策略。虽然这种方法通过避免第一帧的去噪成本来加速推理,但它引入了高保真真实输入与后续模型生成帧之间明显的分布差异。因此,从第二帧开始出现明显的质量差距,这种差距随着时间推移逐渐累积,并降低长时域下的时间一致性。此外,尽管引入的记忆机制有效地缓解了这种退化,但整体合成仍然严重依赖于第一帧,这可能限制了模型处理大规模环境漂移或重大结构转换的能力。

22

第 23 页

D.2 未来工作

为了解决上述局限性,我们展望了几个有前景的未来探索方向。首先,为了弥合直接注入输入图像所导致的领域差距,我们计划研究轻量级的边界细化模块或潜在空间对齐技术。与硬复制不同,优化从真实输入到生成潜在序列的过渡,可以显著保留后续帧的视觉保真度。其次,为了减轻对初始帧的重度依赖并提高长期时间稳定性,我们旨在开发一种动态记忆管理机制。通过用新生成的高置信度帧持续更新记忆池,并引入主动遗忘策略,模型可以自适应地刷新其场景表示。这将减少误差累积,并更好地支持在高度动态的大规模环境中进行长时间跨度的导航。

23

发表评论