PE-Field 4D:用位置编码让视频扩散模型理解3D几何

三分钟导读:该论文提出了一种几何感知的视频生成框架,通过将参考内容的投影位置编码注入视频扩散Transformer的交叉注意力机制,实现了在视角变换下对场景几何结构和外观的高保真控制。

英文题目:PE-Field 4D: Video Generation Models as Canvas

论文出处:arXiv 每日论文精选 · arXiv:2607.15667

原始论文:PDF / 论文页面

对应视频标题:PE-Field 4D:用位置编码让视频扩散模型理解3D几何|推荐指数:★★★★★

这篇论文解决什么问题?

现有的视频扩散Transformer在控制视角变化下的场景几何结构和相机运动方面面临挑战,难以在生成新视角视频时保持场景的空间一致性和几何准确性。

核心创新

  • 将PE-Field范式从图像扩散扩展到视频扩散Transformer,利用扭曲的位置编码引导几何感知视频生成。
  • 设计了结合全局目标潜变量记忆和分组局部上下文记忆的几何感知交叉注意力架构。
  • 提出针对上下文Token的投影位置编码策略,结合2D重投影、深度感知消歧和帧级对应关系,解决视频潜表示中的时间压缩歧义。

方法概览

提出几何感知的交叉注意力机制,保留目标视频潜变量的原始时空位置编码,同时为参考上下文Token分配基于目标视图2D重投影和深度感知消歧的位置编码,使模型能根据位置对齐检索参考内容。

逐图理解论文

方法:几何感知交叉注意力

方法:几何感知交叉注意力
Fig. 2. Visualization of position-aligned attention in a pretrained video diffusion transformer. We insert cross-attention into the pretrained video model and assign new positional codes to the reference tokens shown in the top row. During generation, these tokens are attended by the video latent tokens according to their assigned positions, leading to the corresponding content appearing at the aligned spatial regions in the generated results shown in the bottom row.

我们提出几何感知的交叉注意力机制,保留目标视频潜变量的原始时空位置编码,同时为参考上下文Token分配基于目标视图2D重投影和深度感知消歧的位置编码,使模型能根据位置对齐检索参考内容。

架构:全局与局部记忆结合

架构:全局与局部记忆结合
Fig. 3. Overview of the proposed geometry-aware cross-attention mechanism for video diffusion transformers. Given the noisy target video latent tokens 𝑥 and the reference context tokens 𝑦, we compute queries from the target tokens and construct two key-value branches: a global self-attention memory (𝐾𝑥,𝑉𝑥) from the target video latent and a geometry-aware context memory (𝐾𝑦,𝑉𝑦) from the reference tokens. The target queries are divided into groups, while the self-attention memory is shared globally across all groups and the context memory is consumed in a grouped local manner. For each group 𝑔, attention is computed over the concatenated memory [ ˜𝐾(𝑔), ˜𝑉(𝑔) ] = [𝐾𝑥, 𝐾(𝑔)

该架构结合全局目标潜变量记忆和分组局部上下文记忆。目标查询被分组,自注意力记忆全局共享,而上下文记忆以分组局部方式消耗,从而在保持计算效率的同时实现精确的几何感知。

实验设置:DAVIS基准评估

实验设置:DAVIS基准评估
Fig. 4. Qualitative comparison on the bmx-trees video from DAVIS [Pont-Tuset et al. 2017]. Under the transformed camera trajectory, our method preserves more accurate scene geometry and fine structures, such as the bicycle frame, wheels, and thin foreground/background elements. Compared with TrajectoryCrafter, ReCamMaster, and GEN3C, our results show better geometric consistency and fewer distortions in detailed regions during viewpoint changes.

我们在DAVIS数据集上使用ReCamMaster提供的相机轨迹进行相机重轨迹任务评估,并与ReCamMaster、GEN3C、TrajectoryCrafter和ReDirector等方法进行定量和定性比较,验证几何一致性和相机精度。

结果:几何一致性显著提升

结果:几何一致性显著提升
Table 1. Quantitative evaluation on DAVIS videos using camera trajectories from ReCamMaster. We compare against representative camera-controlled video generation and retargeting methods across visual quality, geometric consistency, and camera accuracy metrics. Our method achieves the best overall performance, showing stronger preservation of appearance, more stable geometry under viewpoint changes, and more accurate adherence to the target camera motion.

定量结果显示,在DAVIS数据集上,我们的方法在Dyn-MEt3R和MEt3R几何一致性指标上优于所有对比方法,TransErr和RotErr相机精度指标也达到最优,表明其在保持细结构方面具有显著优势。

消融:深度与时间消歧验证

消融:深度与时间消歧验证
Fig. 6. Ablation study on depth and temporal disambiguation. Compared with variants without depth-aware or temporal disambiguation, our full method preserves more accurate geometry and achieves more faithful gen- eration under camera transformation.

消融实验验证了深度感知消歧和时间压缩歧义解决策略的有效性。移除这些模块会导致几何结构扭曲,证明其在处理视频潜变量中的时间压缩问题上的关键作用。

实验与关键结果

  • 在DAVIS数据集上使用ReCamMaster提供的相机轨迹进行相机重轨迹任务评估。
  • 与ReCamMaster, GEN3C, TrajectoryCrafter, ReDirector等方法进行定量和定性比较。
  • 在DL3DV数据集上进行图像到视频生成的扩展应用实验。
  • 进行消融实验以验证深度感知消歧和时间压缩歧义解决策略的有效性。
  • 在DAVIS数据集上,Ours方法在Dyn-MEt3R (0.8235)和MEt3R (0.2968)几何一致性指标上优于所有对比方法,TransErr (0.0142)和RotErr (1.887)相机精度指标也达到最优。(第 6 页)

阅读时需要注意

  • 引入额外的上下文Token增加了交叉注意力阶段的计算成本和内存消耗,可能限制其在长视频或高分辨率设置下的可扩展性。
  • 当前设计依赖于估计的几何信息(如深度和相机姿态),这些估计中的误差可能影响投影位置编码的质量,导致空间对齐不完善。
  • 方法依赖于ViPE等工具估计深度和相机参数,几何重建的准确性直接影响生成效果。
  • 虽然能容忍一定的几何重建噪声(如图10所示),但严重的几何错误仍可能导致对齐失败。

关联工作

  • PE-Field:基础工作,展示了位置编码可用于图像生成的几何引导,本文将其扩展到视频领域。(第 2 页)
  • ReCamMaster:对比方法,提供相机轨迹控制,本文在其轨迹上评估几何一致性。(第 6 页)
  • GEN3C:对比方法,3D感知的视频生成,本文在几何结构和相机跟随稳定性上优于该方法。(第 6 页)
  • TrajectoryCrafter:对比方法,用于相机轨迹重定向,本文在细结构保持和几何一致性上表现更好。(第 6 页)
  • ReDirector:对比方法,提供强相机控制,本文在几何一致性指标上进一步改进。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

PE-Field 4D:以视频生成模型为画布

白云鹏∗,美国德克萨斯大学奥斯汀分校 李浩翔,Pixocial Technology,美国 黄启兴,美国德克萨斯大学奥斯汀分校

项目

重建 Video Diffusion Transformer

2026

图 1. 我们的几何感知视频生成框架概述。给定输入图像/视频,我们重建其场景几何结构,并将参考内容投影到目标相机视角,以获得位置对齐的上下文。随后,Video Diffusion Transformer 利用这种结构化上下文合成视频,使其遵循期望的相机轨迹,同时保持场景外观和空间结构。 扩散 Transformer(Diffusion Transformers)最近在视频生成方面取得了显著性能,但在视角变化和相机运动下控制场景几何结构仍然具有挑战性。在本工作中,我们重新审视了位置编码(Positional Encoding)在视频扩散 Transformer 中的作用,并表明它为几何感知控制提供了有用的空间偏差。具体而言,如果参考 Token 根据其投影到目标视图中的位置进行编码,则去噪模型被鼓励从与位置对齐的几何感知交叉注意力(Cross-Attention)机制中检索内容,该机制使目标视频潜变量 Token 能够关注源自参考图像或帧的结构化上下文 Token。为了在参考内容与目标相机轨迹之间建立对应关系,我们赋予上下文 Token 一种投影的位置编码方案,该方案结合了目标视图的 2D 重投影与基于深度的消歧。同时,我们保留了生成视频潜变量的原始时空位置编码,从而在注入几何引导的同时,保持与视频模型原生潜变量结构的一致性。由此产生的框架为可控视频生成提供了一种简单有效的方法。它提高了视角依赖编辑任务中的空间可控性,包括相机重轨迹(camera re-trajectory)、新视角视频合成和几何感知视频编辑,同时保留了底层视频扩散模型的生成先验。代码可用地址为:https://github.com/MTLab/PE-Field. CCS 概念:• 计算方法 → 动画。 1 引言 扩散 Transformer [Peebles and Xie 2023] 最近作为视觉生成的强大基础模型崭露头角,在图像和视频合成方面均取得了优异性能。特别是,视频扩散 Transformer [Gao et al. 2025; Kong et al. 2024; Zhu et al. 2024] 继承了大规模图像生成器的强大建模能力,并将其扩展到时空数据,从而允许从文本、图像和其他条件生成日益逼真的视频。尽管取得了这些进展,但控制生成视频的空间结构仍然具有挑战性。现有的视频生成模型通常能够合成视觉上合理的运动,但在视角变化、相机运动或空间编辑下,它们仍难以忠实地保留场景几何结构。因此,对于当前的基于 Transformer 的扩散模型而言,相机重轨迹、视角一致生成和几何感知视频编辑等 4D 视频编辑任务仍然困难重重。现有的相机重轨迹方法要么将相机位姿作为生成条件 [Bai et al. 2025b],要么先进行 4D 重建,然后对重渲染结果进行修复(inpaint)[Ren et al. 2025; YU et al. 2025]。这些方法要么缺乏显式的几何结构,导致控制不准确,要么受限于重建场景的质量,并且通常难以泛化到更广泛的空间编辑任务中。

arXiv:2607.15667v1 附加关键词和短语:视频生成,扩散模型,位置编码,空间编辑 在本文中,我们在视频 Transformer 范式下研究 4D 生成式视频编辑 [Lee et al. 2025]。我们的目标是利用预训练模型中的丰富信息,同时实现高效的视频编辑。我们的方法借鉴了最近关于 PE-Field [Bai et al. 2025a] 的工作,该工作表明位置编码

∗这项工作是在 Pixocial Technology 实习期间完成的。 Authors’ addresses: Yunpeng Bai, University of Texas at Austin, USA; Haoxiang Li, Pixocial Technology, USA; Qixing Huang, University of Texas at Austin, USA.

第 2 页

2 • Bai, Li, and Huang

我们的方法提供了一种简单但有效的方式,用于基于设计位置编码字段(Positional Encoding fields)的4D生成视频。通过保留视频模型原有的去噪动力学,同时为上下文Token配备具有几何意义的位置编码,Transformer可以将参考帧用作结构化的空间上下文,而不仅仅是外观提示。这提高了相机重轨迹(camera re-trajectory)和视图一致视频合成等任务的可控性(见图1),并更广泛地表明,位置编码可以作为向基于Transformer的生成模型注入几何结构的通用接口。

将PE-Field的思想推广到视频编辑是困难的,因为与图像生成相比,视频生成要求模型对空间、时间和运动进行联合推理。此外,许多实际架构还依赖于时间压缩的潜变量表示。这些特性为基于位置编码(PE)的几何控制引入了新的挑战。首先,模型必须在整合来自参考帧的空间结构化上下文的同时保持时间连贯性。其次,PE-Field使用的图像编辑模型自然地在参考分支和生成的潜变量之间存在注意力通路,而主流视频生成和编辑模型通常不提供这种可以直接复用的结构。第三,视频VAE中的时间压缩可能会模糊潜变量Token与原始帧之间的对应关系,使得精确的位置重新分配变得模糊。

我们的起点是对PE扭曲(PE warping)为何有效的简单重新解释。我们认为,PE-Field的成功可以理解为一种注意力引导机制:当源Token被分配对应于其在目标视图中投影位置的位置编码时,注意力自然会偏向于检索位置对齐的内容。从这个角度来看,PE扭曲特别适合交叉注意力(Cross-Attention)。如果允许视频扩散Transformer查询其位置编码已经反映目标视图几何结构的参考Token,那么模型可以直接检索应在每个目标Token位置出现的源内容。这将位置编码从被动的索引方案转变为主动的几何路由信号。

受此观点的启发,我们提出了针对视频扩散Transformer的PE-Field的几何感知扩展。为了高效处理视频数据,我们的方法通过一种交叉注意力机制增强标准的视频扩散Transformer,该机制同时关注全局目标潜变量记忆和几何感知的上下文记忆。目标视频潜变量Token保留模型原有的时空位置编码,从而保留预训练的视频先验。相比之下,从参考图像或帧中提取的上下文Token根据其投影的目标视图坐标分配位置编码。为了进一步消除投影到相似2D位置的Token之间的歧义,我们引入了一种深度感知的位置编码策略,该策略将归一化的深度偏移注入到上下文编码的时间轴中。此外,为了解决视频潜变量表示中由时间压缩引起的歧义,我们修改了上下文构建过程,使得每个潜变量帧对应于单个源帧,从而实现精确的位置重新分配。

我们的贡献总结如下:

  • 我们将PE-Field范式从图像扩散扩展到视频扩散Transformer,表明扭曲的位置编码可用于指导几何感知的视频生成。
  • 我们首次将几何结构直接注入视频生成Transformer架构本身,并提出了一种几何感知的交叉注意力设计,该设计结合了全局目标潜变量记忆和分组的局部上下文记忆。
  • 我们提出了一种用于上下文Token的投影位置编码策略,该策略结合了目标视图2D重投影、深度感知消歧和帧级对应关系,解决了视频潜变量表示中的时间压缩歧义,并实现了精确的位置重新分配。
  • 实验表明,我们的方法在相机重轨迹任务上优于现有方法,并进一步推广到更广泛的4D空间编辑应用。

2 相关工作

2.1 大规模视频合成

视频生成的最新进展在很大程度上是由模型容量和视频训练数据的扩展驱动的 [Gao et al. 2025; Kong et al. 2024; Zhu et al. 2024]。将片段建模为联合时空序列的基于扩散的视频Transformer [Gao et al. 2025; Kong et al. 2024; Wan et al. 2025; Yang et al. 2024] 展示了令人印象深刻的合成质量,并已成为文本到视频和图像到视频生成的广泛采用的设计。然而,由于整个序列必须在单个去噪模型中处理,随着视频长度和分辨率的增加,内存消耗迅速增长。这使得长时间生成变得困难,并且通常需要将长视频作为单独的片段生成,其中跨片段的一致性难以保证。自回归视频生成器 [Chen et al. 2024; Gu et al. 2025a; Huang et al. 2025a; Song et al. 2025; Zhang and Agrawala 2025] 通过基于先前生成的内容生成未来片段来缓解这一问题。虽然这种策略扩展了可达到的时间跨度,但模型只能访问有限的历史窗口,因此场景早期部分的信息可能仍然会逐渐丢失。

2.2 空间记忆与相机控制

在长时间范围内保持稳定的场景表示与相机控制生成密切相关,因为两者都需要

第 3 页

PE-Field 4D: 将视频生成模型作为画布 • 3

使模型能够合成同一场景在不同视角下的一致观测结果。在长视频生成中,当可用上下文有限时,通常会观察到物体外观、布局或几何结构的漂移 [Decart et al. 2024; Kanervisto et al. 2025; Song et al. 2025]。一类方法通过从过去帧构建显式几何记忆来解决这一问题 [Wu et al. 2025]。这些方法估计点云等 3D 结构,并将其与 TSDF [Zeng et al. 2017] 等体素融合技术相结合,这有助于在后续生成中保留粗略的场景布局。然而,显式几何结构在处理开放场景时不太方便,并且在重建和融合过程中可能会丢失细节外观或细薄结构。

相机轨迹控制面临类似的对齐问题。现有方法通常要么从输入图像或视频中构建显式引导,例如基于点的渲染 [Cao et al. 2025; Feng et al. 2024; Li et al. 2025b; Ma et al. 2025; You et al. 2024; YU et al. 2025; Yu et al. 2024; Zhai et al. 2025]、跟踪对应点 [Gu et al. 2025b] 或光流 [Burgert et al. 2025];要么通过额外的可训练模块和条件表示将相机信息注入预训练视频扩散模型,包括姿态参数 [Bai et al. 2025b; Wang et al. 2024]、Plücker 射线嵌入 [Bahmani et al. 2025; He et al. 2024, 2025] 以及相对相机编码 [Zhang et al. 2025]。与这些方法不同,我们的工作侧重于生成 Token 与参考观测值之间的显式 Token 级空间对齐。我们将这种对齐用作相机控制和空间记忆的通用机制,从而基于时间感知的位置编码扭曲(warping)得出统一的公式。

Warping Generation Fig. 2. 预训练视频扩散 Transformer 中位置对齐注意力的可视化。我们将交叉注意力插入预训练视频模型,并为顶行显示的参考 Token 分配新的位置编码。在生成过程中,这些 Token 根据分配的位置被视频潜在 Token 所关注,导致相应内容出现在生成结果底部行所示的对齐空间区域中。

必须同时对空间结构、时间连贯性和相机运动进行建模。

为了验证这一假设在预训练视频 DiT 中的有效性,我们将交叉注意力机制注入预训练模型,并手动重新分配位置上下文 Token。如图 2 所示,生成的视频倾向于将参考内容放置在由这些重新分配的位置编码指定的空间位置。这提供了直接证据,表明预训练视频扩散 Transformer 已经表现出有用的空间偏差:目标潜在 Token 优先关注来自位置对齐区域的参考 Token。基于这一观察,我们使用一种感知几何的交叉注意力机制增强标准视频扩散 Transformer。目标视频潜在 Token 保留模型原有的时空位置编码,而上下文 Token 则根据其重投影的目标视图坐标和深度感知顺序分配位置编码。这使得模型能够利用参考帧作为相机重轨迹和空间感知视频生成的空间锚定上下文,同时也为解决视频建模中的记忆挑战提供了一种实用方法。

3.2 感知几何的交叉注意力

设 $x \in \mathbb{R}^{B \times N \times D}$ 表示待去噪的目标视频噪声潜在 Token,设 $y \in \mathbb{R}^{B \times M \times D}$ 表示从参考图像或帧中提取的上下文 Token。在标准视频扩散 Transformer 中,注意力仅在目标潜在 Token 之间执行,位置编码定义在三个视频轴 $(t, h, w)$ 上。我们保留目标潜在 Token 的这种编码,并仅修改上下文 Token 的编码。

我们的注意力模块通过额外的感知几何上下文分支增强原始自注意力。查询始终从目标潜在 Token $x$ 计算得出:

$Q=W_q x, \quad (1)$

同时构建两个键值分支:

$K_x=W_k x, \quad V_x=W_v x, \quad (2)$

$K_y=W_k y, \quad V_y=W_v y. \quad (3)$

其中 $K_x$ 和 $V_x$ 来自潜在目标视频 Token,而 $K_y$ 和 $V_y$ 来自潜在参考帧 Token。经过 RMS 归一化后,对 $Q$ 和 $K_x$ 应用旋转位置编码 [Su et al. 2024]。

第 4 页

4 • Bai, Li, and Huang

生成的潜变量 x 𝑄→𝑄(𝑔) ) 𝑔(𝑥) … 𝑄(𝑥) 𝑄(𝑦) … 𝑄(𝑦) 𝐷𝑆 𝑃 … 𝐾𝑥 𝐴 𝑂𝑥

( 𝑔 Layer 𝑉𝑥 𝑄 , 𝑂𝑦 𝑔 𝐾𝑦 ' Decoder … … 𝑔 𝑦 , Projection 𝑉𝑥(𝐾𝑥) →𝑉𝑥(𝐾𝑥) 𝑔(𝑥) 𝑔 … 𝑉𝑦 … 𝐾𝑥(𝑥) 𝐾𝑥(𝑦) … 𝐾𝑥(𝑦) 𝑦 𝑂𝑦

(𝑥) (𝑦) … (𝑦) 𝑉𝑥 𝑉𝑥 𝑉𝑥 𝑂𝑥 上下文令牌 y

图 3. 所提出的用于视频扩散 Transformer 的几何感知交叉注意力机制概述。给定带噪的目标视频潜变量令牌 𝑥 和参考上下文令牌 𝑦,我们从目标令牌计算查询(queries),并构建两个键值分支:来自目标视频潜变量的全局自注意力记忆 (𝐾𝑥,𝑉𝑥) 和来自参考令牌的几何感知上下文记忆 (𝐾𝑦,𝑉𝑦)。目标查询被分组,而自注意力记忆在所有组间全局共享,上下文记忆则以分组局部的方式被消耗。对于每个组 𝑔,注意力是在拼接的记忆 [ ˜𝐾(𝑔), ˜𝑉(𝑔) ] = [𝐾𝑥, 𝐾(𝑔)𝑦 ;𝑉𝑥,𝑉(𝑔)𝑦 ] 上计算的,允许每个目标令牌同时关注全局目标视频信息和位置对齐的参考内容。上下文键使用投影的目标视图位置编码进行编码,因此参考令牌是根据它们应在生成视图中出现的位置来检索的。

使用原始视频潜变量 PE,而 𝐾𝑦 使用将在第 3.3 节介绍的投影 PE 进行编码。注意力使用的最终记忆为 𝐾= [𝐾𝑥;𝐾𝑦], 𝑉= [𝑉𝑥;𝑉𝑦], (4) 其中 [·; ·] 表示沿序列维度的拼接。 这种设计将交叉注意力转变为一种几何感知的检索过程。目标带噪令牌仍然通过原始自注意力分支进行全局交互,同时查询那些位置编码已经指示其在目标视图中应出现位置的上下文令牌。因此,模型可以直接根据目标视图的位置选择参考内容,而不是仅依赖内容相似度。

全局自注意力与分组局部上下文注意力。一个实际问题是,对于长视频序列,对所有目标和上下文令牌进行密集注意力计算成本高昂。因此,我们使用一种结构化的注意力模式,其中自注意力分支保持不变,而上下文分支以分组局部的方式被消耗。 具体来说,令 𝑓 表示时间压缩后的潜变量帧数。我们将序列划分为 𝑓 个组,每组对应一个潜变量帧,包含 𝐺= 𝑁/𝑓 个令牌。我们将查询张量重塑为组, 𝑄→{𝑄(𝑔)}𝑓𝑔=1, 𝑄(𝑔) ∈R𝐵×𝐺×𝐷, (5) 自注意力记忆 (𝐾𝑥,𝑉𝑥) 被视为全局共享,而上下文记忆 (𝐾𝑦,𝑉𝑦) 被分区为 分组方式: 𝐾𝑦→{𝐾(𝑔)𝑦}𝑓𝑔=1, 𝑉𝑦→{𝑉(𝑔)𝑦 }𝑓𝑔=1. (6) 对于每个组 𝑔,注意力是在拼接的记忆上计算的 ˜𝐾(𝑔) = [𝐾𝑥;𝐾(𝑔)𝑦], ˜𝑉(𝑔) = [𝑉𝑥;𝑉(𝑔)𝑦 ]. (7) 然后组输出为 𝑂(𝑔) = SDPA 𝑄(𝑔), ˜𝐾(𝑔), ˜𝑉(𝑔) , (8) 其中 SDPA(·) 表示缩放点积注意力。通过这种方式,对上下文令牌的交叉注意力被限制在与相同潜变量帧对应的内容上。所有组的输出最终合并回原始的令牌顺序。

这种混合公式保留了通过目标潜变量令牌进行的长程全局推理,同时使几何条件上下文查找在空间上更局部且高效。重要的是,这并非独立于交叉注意力的单独模块,而是交叉注意力机制本身:每个目标查询在单个注意力算子内同时关注全局目标潜变量记忆和分组几何感知上下文记忆。

3.3 上下文令牌的投影位置编码

另一个主要设计在于上下文令牌的位置编码方式。在标准的视频扩散 Transformer 中,位置编码定义在潜变量视频网格上,并在时间和空间上进行分解。我们保持目标潜变量令牌 𝑥 的此编码不变。然而,对于上下文令牌 𝑦,我们用投影的目标视图坐标替换其原始源视图坐标。

第 5 页

PE-Field 4D: 将视频生成模型作为画布 • 5

对于每个上下文 Token,我们利用源视图几何结构计算其到目标相机平面的 2D 投影。将投影位置记为 $(\tilde{h}, \tilde{w})$。与根据 Token 在源帧中的原始位置分配位置编码不同,我们使用这个投影后的目标平面位置对其进行编码。因此,上下文 Token 根据其应在生成目标视图中出现的位置进行索引。这遵循了 PE-Field 的核心原则,现已适配至视频生成任务。通过仅改变位置编码而保持 Token 内容不变,我们将注意力偏向于将目标噪声 Token 与在目标视图中位置对齐的上下文 Token 关联起来。

这种设计还要求在交叉注意力中对齐上下文和生成潜变量的时间坐标。虽然每个生成的潜变量对应一个压缩的时间区间(例如,四个 RGB 帧),但我们重复的上下文潜变量对应于该区间内的各个源帧。因此,我们将上下文帧索引归一化到与生成 Token 相同的潜变量时间范围。例如,与一个生成潜变量步长相关联的四个源帧被分配分数时间坐标 1, 1.25, 1.5 和 1.75。这种分数索引保留了各个源帧的时间顺序,同时确保其位置编码与视频模型的压缩潜变量时间线兼容。

深度感知的位置消歧。 仅靠投影的 2D 坐标往往是不够的,因为多个 Token 可能落在相同的目标平面位置附近,但处于不同的深度。为了区分这种情况,我们将深度信息额外编码到位置编码中。我们没有引入单独的深度轴,而是通过在上下文 Token 的时间轴上添加一个依赖于深度的偏移量,将深度整合到相同的位置编码框架中。令 $t$ 表示上下文 Token 的帧索引,$d$ 为其深度。我们定义有效时间坐标为:

$$ t' = t + \Delta(d), \quad (9) $$

其中 $\Delta(d)$ 是归一化的深度偏移。在实践中,我们将深度归一化到区间 $[0, 0.1]$。因此,源自帧 $t$ 的 Token 占据时间编码范围 $[t, t+0.1]$,这在保持帧级分离的同时,引入了同一帧内 Token 的前后顺序。

因此,上下文 Token 的最终位置编码由以下构成:

$$ (t + \Delta(d), \tilde{h}, \tilde{w}). \quad (10) $$

这种设计允许模型区分在投影 2D 位置上相近但属于不同深度层的 Token,同时保持整体时间结构与原始视频 Transformer 兼容。

3.4 解决上下文潜变量中的时间压缩歧义

视频扩散模型中使用的潜变量表示带来了一个实际 complication。许多视频 VAE 会对输入序列进行时间压缩,例如将几个连续的 RGB 帧合并为一个潜变量帧。在这种情况下,每个原始帧对压缩后潜变量 Token 的确切贡献是未知的。这对我们的方法构成了问题,因为单个压缩的潜变量帧将对应于来自不同原始帧的多个投影位置编码,使得位置分配本质上具有歧义性。

为了解决这种歧义,我们修改了上下文构建过程。在将连续帧直接输入视频编码器之前,我们将每个源帧重复多次,使得每个生成的潜变量帧仅对应一个原始帧。编码后,每个潜变量帧因此只包含来自单个原始帧的信息,而不是多个帧的混合。

4 实验结果
4.1 实现细节

我们主要在 Wan2.1 T2V 模型的 14B 版本 [Wan et al. 2025] 上进行实验。为了适配新插入的 Cross-Attention 模块,我们执行 LoRA 微调。具体而言,LoRA 适配器被插入到主要的投影和前馈层中,包括 $q, k, v, o$ 和 ffn 层。所有实验的 LoRA 秩均设置为 32。模型以 $1 \times 10^{-4}$ 的学习率进行训练。

我们的训练数据主要构建于 MultiCam1 数据集 [Bai et al. 2025b] 之上,该数据集提供了适合学习视角依赖生成和相机重轨迹控制的多视角视频序列。由于该数据集不提供真值深度图,我们使用 ViPE [Huang et al. 2025b] 估计深度和相应的相机参数,并将它们作为几何条件的输入,以构建投影位置编码和几何感知的上下文 Token。

4.2 生成结果

遵循最近相机控制视频生成方法的评估协议 [Park et al. 2025b],我们基于 DAVIS 数据集中的 90 个视频构建了一个测试基准,并使用 ReCamMaster [Bai et al. 2025b] 提供的目标相机轨迹。所选视频包含多样的物体运动、场景布局和精细的几何结构,使我们能够在具有挑战性的轨迹变换下评估视觉保真度和几何感知相机控制。

对于每个输入视频,我们生成基于目标相机运动条件的新视角结果,并将我们的方法与 ReCamMaster [Bai et al. 2025b]、GEN3C [Ren et al. 2025]、TrajectoryCrafter [YU et al. 2025] 和 ReDirector [Park et al. 2025b] 进行比较。

遵循 ReDirector [Park et al. 2025b] 的评估设置,我们从三个互补的方面评估生成的视频:视觉质量、几何一致性和相机控制准确性。具体而言,我们采用 VBench [Huang et al. 2024] 指标来评估感知和时序质量,使用 Dyn-MEt3R [Park et al. 2025a] 来测量生成重定向视频的几何一致性,并计算每帧的 MEt3R [Asim et al. 2025] 以评估生成结果与输入视频之间的一致性。此外,我们还报告平移和旋转误差,分别记为 TransErr 和 RotErr,它们量化了生成视频

第 6 页

6 • Bai, Li, and Huang

本文方法

ReCamMaster

GEN3C

TrajectoryCrafter

图 4. 基于 DAVIS [Pont-Tuset et al. 2017] 中 bmx-trees 视频的定性比较。在变换后的相机轨迹下,我们的方法保留了更准确的场景几何结构和精细细节,例如自行车车架、车轮以及细长的前景/背景元素。与 TrajectoryCrafter、ReCamMaster 和 GEN3C 相比,我们的结果在视角变化期间显示出更好的几何一致性,且在细节区域的畸变更少。

视觉质量↑ 几何一致性 相机精度 方法 主体 背景 美学 成像 时间 运动 Dyn-MEt3R↑ MEt3R↓ TransErr↓ RotErr↓ 一致性 一致性 质量 质量 闪烁 平滑度

ReCamMaster 0.8983 0.9182 0.5052 0.6448 0.9543 0.9752 0.7721 0.3585 0.0301 2.412 GEN3C 0.9011 0.9202 0.5097 0.6259 0.9421 0.9673 0.7426 0.3462 0.0548 6.728 TrajectoryCrafter 0.8824 0.9146 0.5031 0.6013 0.9319 0.9605 0.7315 0.3328 0.0684 8.943 ReDirector 0.8977 0.9164 0.5078 0.6521 0.9527 0.9784 0.8041 0.3186 0.0189 2.107

无时间分布 0.8946 0.9138 0.5061 0.6417 0.9435 0.9688 0.7564 0.3479 0.0317 3.284 无深度信息 0.9069 0.9228 0.5171 0.6675 0.9661 0.9864 0.8126 0.3047 0.0161 1.982 本文方法 0.9098 0.9247 0.5196 0.6731 0.9704 0.9892 0.8235 0.2968 0.0142 1.887

表 1. 使用 ReCamMaster 的相机轨迹对 DAVIS 视频进行的定量评估。我们在视觉质量、几何一致性和相机精度指标方面与代表性的相机控制视频生成和重定向方法进行了比较。我们的方法实现了最佳的整体性能,显示出更强的外观保留能力、视角变化下更稳定的几何结构以及对目标相机运动更准确的遵循。

基于 ViPE [Huang et al. 2025b] 的相对姿态估计来遵循目标相机运动,从而减少大相机变化期间的几何畸变。与 GEN3C 相比,我们的方法产生了更稳定的场景结构和更准确的相机跟随。尽管 ReDirector 提供了强大的相机控制能力,但我们的方法进一步提高了 Dyn-MEt3R 和 MEt3R 指标,表明在生成的重摄视频中具有更好的几何保留能力。较低的平移和旋转误差也

第 7 页

PE-Field 4D:视频生成模型作为画布 • 7

输入

输出 源视图 无深度 ours

输入

源视图 无时间消歧 ours

图 6. 深度和时间消歧的消融研究。与缺乏深度感知或时间消歧的变体相比,我们的完整方法在相机变换下保留了更准确的几何结构,并实现了更忠实

的生成。

图 5. 相机轨迹变换之外的通用应用。我们的方法不仅支持可控的相机轨迹变换,还通过将生成内容与结构化几何引导对齐,自然地扩展到其他空间感知生成任务,如物体运动合成和姿态引导动画。

时间压缩歧义。我们通过直接使用原始视频 VAE 压缩来消融我们的帧重复策略,其中几个 RGB 帧被编码为一个上下文潜在帧。这会混合来自多个源帧的信息,并使投影位置分配变得模糊。如图 6 所示,该基线无法准确定位参考内容,导致几何对齐较弱。表 1 进一步显示了几何一致性和相机精度的明显下降,证实了精确帧级位置分配的重要性。

4.3 应用

除了相机轨迹变换,我们的框架自然地扩展到其他空间感知生成任务,例如将单张图像动画化为视频。关键原因在于,我们的方法不依赖于特定任务的监督,而是通过投影位置编码注入空间对齐的上下文。当输入是单张参考图像时,其视觉令牌仍可被视为几何感知上下文,允许去噪模型在生成时间连贯运动的同时,从空间对应区域检索内容。

如图 5 所示,我们的方法可以在保持参考内容的空间布局和精细结构的同时对静态图像进行动画处理。与仅由全局图像条件驱动的生成相比,所提出的位置对齐上下文提供了更明确的空间引导,帮助模型在运动合成期间保持物体身份、局部外观和场景结构。这表明我们的方法不仅限于相机控制的视频重定向,还可以作为空间接地视频生成的通用机制。

4.4 消融研究

深度感知位置消歧。我们消融了位置编码中的深度感知偏移。没有深度的情况下,令牌仅由投影的 2D 坐标区分,当目标视图中前景和背景区域重叠时,这会变得模糊。如图 6 所示,这导致几何结构不够准确,且在精细结构和遮挡边界附近出现更多失真。表 1 中的定量结果也显示,在移除深度感知消歧后,指标一致下降。

5 结论

我们提出了 PE-Field 范式从图像扩散到视频扩散 Transformer 的扩展。我们的核心思想是将扭曲的位置编码解释为几何感知注意力信号,使目标视频潜在令牌能够通过基于对齐位置的交叉注意力,从参考图像或帧中检索结构化信息。我们的结果表明,位置编码为将几何线索融入视频扩散 Transformer 提供了一种有用且轻量的接口。

局限性。我们的方法引入了额外的上下文令牌,特别是为了缓解时间压缩歧义,每个源帧被单独编码。这增加了交叉注意力期间的计算成本和内存消耗,这可能会限制其在更长视频或更高分辨率设置中的可扩展性。此外,我们当前的设计依赖于估计的几何信息,如深度和相机姿态,因此这些估计中的误差可能会影响投影位置编码的质量,导致空间对齐不完善。

未来工作。为了提高效率,一个可能的方向是探索更紧凑的上下文表示,而不是直接使用时间扩展的视频潜在变量作为上下文令牌。例如,未来的工作可以设计轻量级的几何感知上下文特征,在减少令牌数量和注意力成本的同时,保留必要的空间和外观信息。

第 8 页

8 • Bai, Li, and Huang

参考文献 具有交互式复杂相机控制功能的图像到视频生成。在 IEEE/CVF 国际计算机视觉会议论文集。28785–28796。 Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, 和 Jan Eric Baorui Ma, Huachen Gao, Haoge Deng, Zhengxiong Luo, Tiejun Huang, Lulu Tang, 和 Lenssen。2025。Met3r:测量生成图像中的多视角一致性。在 Xinlong Wang。2025。你看到它,你就得到它:在免姿态视频上进行大规模 3D 创建学习 IEEE/CVF 计算机视觉与模式识别会议论文集。 在计算机视觉与模式识别会议论文集。 6034–6044。 2016–2029。 Sherwin Bahmani, Ivan Skorokhodov, Guocheng Qian, Aliaksandr Siarohin, Willi Byeongjun Park, Hyojun Go, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, 和 Menapace, Andrea Tagliasacchi, David B Lindell, 和 Sergey Tulyakov。2025。Ac3d: Changick Kim。2025a。Steerx:使用几何引导创建任意免相机 3D 和 4D 场景。在 IEEE/CVF 国际计算机视觉会议论文集。 分析和改进视频扩散 Transformer 中的 3D 相机控制。在 计算机视觉会议论文集。27326–27337。 计算机视觉与模式识别会议论文集。22875–22889。 Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung, 和 Jong Chul Ye。2025b。ReDi- Haoji Hu, Xiang Bai, Pengfei Wan, 等。2025b。Recammaster:从单个视频进行相机控制的 rector:使用旋转相机编码创建任意长度视频重拍。arXiv 生成式渲染。arXiv 预印本 arXiv:2503.11647 (2025)。 预印本 arXiv:2511.19827 (2025)。 https://arxiv.org/abs/2511.19827 Yunpeng Bai, Haoxiang Li, 和 Qixing Huang。2025a。位置编码场。arXiv William Peebles 和 Saining Xie。2023。可扩展的基于 Transformer 的扩散模型。在 预印本 arXiv:2510.20385 (2025)。 IEEE/CVF 国际计算机视觉会议论文集。4195–4205。 Ryan Burgert, Yuancheng Xu, Wenqi Xian, Oliver Pilarski, Pascal Clausen, Mingming Jordi Pont-Tuset, Federico Perazzi, Sergi Caelles, Pablo Arbeláez, Alex Sorkine-Hornung, He, Li Ma, Yitong Deng, Lingxiao Li, Mohsen Mousavi, 等。2025。Go-with-the- 和 Luc Van Gool。2017。2017 DAVIS 视频对象分割挑战。 flow:使用实时扭曲噪声的运动可控视频扩散模型。在 arXiv 预印本 arXiv:1704.00675 (2017)。 计算机视觉与模式识别会议论文集。13–23。 Xuanchi Ren, Tianchang Shen, Jiahui Huang, Huan Ling, Yifan Lu, Merlin Nimier- Chenjie Cao, Jingkai Zhou, Shikai Li, Jingyun Liang, Chaohui Yu, Fan Wang, Xiangyang David, Thomas Müller, Alexander Keller, Sanja Fidler, 和 Jun Gao。2025。GEN3C: Xue, 和 Yanwei Fu。2025。Uni3c:统一精确的 3D 增强相机和 3D 感知的世界一致性视频生成,具有精确的相机控制。在 人体运动控制以用于视频生成。在 SIGGRAPH Asia IEEE/CVF 计算机视觉与模式识别会议论文集。 2025 会议论文集。1–12。 Kiwhan Song, Boyuan Chen, Max Simchowitz, Yilun Du, Russ Tedrake, 和 Vincent Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, 和 Vin- Sitzmann。2025。历史引导的视频扩散。arXiv 预印本 arXiv:2502.06764 cent Sitzmann。2024。扩散强制:下一个 Token 预测与全序列 (2025)。 扩散相遇。神经信息处理系统进展 37 (2024),24081–24125。 Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。2024。 Etched Decart, Quinn McIntyre, Spruce Campbell, Xinlei Chen, 和 Robert Wachen。 Roformer:带有旋转位置嵌入的增强 Transformer。神经计算 2024。Oasis:Transformer 中的宇宙。URL: https://oasis-model. github. io (2024)。 568 (2024),127063。 Wanquan Feng, Jiawei Liu, Pengqi Tu, Tianhao Qi, Mingzhen Sun, Tianxiang Ma, Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Songtao Zhao, Siyu Zhou, 和 Qian He。2024。I2vcontrol-camera:精确的视频 Yu, Haiming Zhao, Jianxiao Yang, 等。2025。Wan:开放且先进的超大规模 相机控制,具有可调运动强度。arXiv 预印本 arXiv:2411.06525 视频生成模型。arXiv 预印本 arXiv:2503.20314 (2025)。 (2024)。 Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, Tianshui Chen, Menghan Xia, Ao Gao, Jingyu Gong, Xin Tan, Zhizhong Zhang, 和 Yuan Xie。2026。GSCompleter: Ping Luo, 和 Ying Shan。2024。Motionctrl:用于视频生成的统一且灵活的运动控制器 无蒸馏插件,用于秒级指标感知 3D 高斯溅射补全。 在 ACM SIGGRAPH 2024 会议论文集。1–11。 arXiv:2604.20155 [cs.CV] https://arxiv.org/abs/2604.20155 Tong Wu, Shuai Yang, Ryan Po, Yinghao Xu, Ziwei Liu, Dahua Lin, 和 Gordon Wet- Yu Gao, Haoyuan Guo, Tuyen Hoang, Weilin Huang, Lu Jiang, Fangyuan Kong, Huixia zstein。2025。具有长期空间记忆的视频世界模型。arXiv 预印本 Li, Jiashi Li, Liang Li, Xiaojie Li, 等。2025。Seedance 1.0:探索视频生成模型的边界 arXiv:2506.05284 (2025)。 视频生成模型。arXiv 预印本 arXiv:2506.09113 (2025)。 Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, 和 Shubham Tulsiani。2026。 Yuchao Gu, Weijia Mao, 和 Mike Zheng Shou。2025a。使用下一帧预测的长上下文自回归 RayRoPE:用于多视角注意力的投影射线位置编码。arXiv 视频建模。arXiv 预印本 arXiv:2503.19325 (2025)。 预印本 arXiv:2601.15275 (2026)。 Zekai Gu, Rui Yan, Jiahao Lu, Peng Li, Zhiyang Dou, Chenyang Si, Zhen Dong, Qifeng Tianxing Xu, Zixuan Wang, Guangyuan Wang, Li Hu, Zhongyi Zhang, Peng Zhang, Liu, Cheng Lin, Ziwei Liu, 等。2025b。扩散作为着色器:用于多功能视频生成控制的 Bang Zhang, 和 Song-Hai Zhang。2026。UCM:统一相机控制 3D 感知视频扩散模型。在计算机图形学和交互技术特别兴趣组会议论文集。1–12。 和记忆,使用感知时间的位置编码扭曲以用于世界模型。 Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, 和 Ceyuan arXiv:2602.22960 [cs.CV] https://arxiv.org/abs/2602.22960 Yang。2024。Cameractrl:启用文本到视频生成的相机控制。arXiv Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuan- 预印本 arXiv:2404.02101 (2024)。 ming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, 等。2024。Cogvideox:基于 Hao He, Ceyuan Yang, Shanchuan Lin, Yinghao Xu, Meng Wei, Liangke Gui, Qi Zhao, 专家 Transformer 的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072 Gordon Wetzstein, Lu Jiang, 和 Hongsheng Li。2025。Cameractrl ii:通过 (2024)。 相机控制视频扩散模型进行动态场景探索。arXiv 预印本 Meng You, Zhiyu Zhu, Hui Liu, 和 Junhui Hou。2024。Nvs-solver:视频扩散 arXiv:2503.10592 (2025)。 模型作为零样本新视角合成器。arXiv 预印本 arXiv:2405.15364 (2024)。 Mark YU, Wenbo Hu, Jinbo Xing, 和 Ying Shan。2025。Trajectorycrafter:重定向

Jiahui Huang, Qunjie Zhou, Hesam Rabeti, Aleksandr Korovko, Huan Ling, Xuanchi Ren, Tianchang Shen, Jun Gao, Dmitry Slepichev, Chen-Hsuan Lin, et al. 2025b. Vipe: Video pose engine for 3d geometric perception. arXiv preprint arXiv:2508.10934 (2025).

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, and Animesh Garg. 2026. MosaicMem: Hybrid Spatial Memory for Controllable Video World Models. CoRR abs/2603.17117 (2026). arXiv:2603.17117 doi:10.48550/ARXIV.2603.17117

Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. 2025a. Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion. arXiv preprint arXiv:2506.08009 (2025).

Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, et al. 2024. Vbench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 21807–21818.

Andy Zeng, Shuran Song, Matthias Nießner, Matthew Fisher, Jianxiong Xiao, and Thomas A. Funkhouser. 2017. 3DMatch: Learning Local Geometric Descriptors from RGB-D Reconstructions. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21-26, 2017. IEEE Computer Society, 199–208. doi:10.1109/CVPR.2017.29

Anssi Kanervisto, Dave Bignell, Linda Yilin Wen, Martin Grayson, Raluca Georgescu, Sergio Valcarcel Macua, Shan Zheng Tan, Tabish Rashid, Tim Pearce, Yuhan Cao, et al. 2025. World and human action models towards gameplay ideation. Nature 638, 8051 (2025), 656–663.

Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang, et al. 2024. Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:2412.03603 (2024).

Yao-Chih Lee, Zhoutong Zhang, Jiahui Huang, Jui-Hsien Wang, Joon-Young Lee, Jia-Bin Huang, Eli Shechtman, and Zhengqi Li. 2025. Generative Video Motion Editing with 3D Point Tracks. arXiv preprint arXiv:2512.02015 (2025).

Ruilong Li, Brent Yi, Junchen Liu, Hang Gao, Yi Ma, and Angjoo Kanazawa. 2025a. Cameras as Relative Positional Encoding. Advances in Neural Information Processing Systems (2025).

Teng Li, Guangcong Zheng, Rui Jiang, Shuigen Zhan, Tao Wu, Yehao Lu, Yining Lin, Chuanyun Deng, Yepan Xiong, Min Chen, et al. 2025b. Realcam-i2v: Real-world

第 9 页

PE-Field 4D:视频生成模型作为画布 • 9

Zhu Zheng, Wang Xiaofeng, Zhao Wangbo, Min Chen, Li Bohan, Deng Nianchen, Dou Min, Wang Yuqi, Shi Botian, Wang Kai, 等. 2024. Sora 是世界模拟器吗?关于通用世界模型及更广泛领域的综合综述. arXiv 预印本 arXiv:2405.03520 (2024).

第 10 页

10 • Bai, Li, and Huang

扭曲

生成

图 7. 预训练视频扩散 Transformer 中位置对齐注意力的额外可视化。在将投影的位置编码分配给上下文 Token 后,每个目标潜变量根据其投影位置在目标视图中关注上下文内容。

源数据

本文方法

ReCamMaster

GEN3C

TrajectoryCrafter

图 8. 额外的定性比较。与先前方法相比,我们的方法在相机发生较大变化时能更好地保持物体结构,并产生更多位置对齐的结果。

第 11 页

PE-Field 4D: 将视频生成模型作为画布 • 11

扭曲

生成

GT

扭曲

生成

GT

图 9. 我们的方法在 DL3DV 数据集上的图像到视频生成结果。最左侧的图像是输入图像。

扭曲

生成

图 10. 此示例展示了几何重建不准确的情况。即使重建存在噪声或错误,我们的方法仍能生成合理的视频结果。

发表评论