CameraAnything:如何用任意相机参数重拍视频?

快速导读:核心差距在于内参(焦距、分辨率)与外参(姿态、轨迹)的解耦。传统方法将二者耦合,导致控制相互干扰。CameraAnything 的关键洞察是:需要一种能同时感知几何结构和分辨率变化的表示方法,而非简单的矩阵拼接。

视频编辑中的相机控制长期面临内参(如焦距、分辨率)与外参(如姿态、轨迹)解耦困难的挑战。现有方法要么依赖昂贵的3D重建,要么仅支持单一类型的参数调整,无法实现电影级的灵活重拍。

CameraAnything 提出了首个统一框架,通过 Plücker 射线表示和 3D RoPE 注入机制,在 Wan2.1 模型上实现了任意相机参数的联合控制。该方法不仅支持原生分辨率适应,还通过合成数据训练实现了高精度的几何一致性。

英文题目:CameraAnything: Refilming Videos with Arbitrary Camera Control

论文出处:arXiv 每日论文精选 · arXiv:2607.24591

原始论文:PDF / 论文页面

对应视频标题:CameraAnything:如何用任意相机参数重拍视频?|推荐指数:★★★★★

这篇论文解决什么问题?

传统视频扩散模型在控制相机运动时,往往将内参和外参耦合处理,导致调整焦距时画面内容发生非预期扭曲,或改变分辨率时依赖裁剪和外绘,损失画面完整性。

ReCamMaster 等方法仅关注外参控制,缺乏对镜头语言(如焦距变化)的支持;而 TrajectoryCrafter 依赖3D重建,计算成本高且易产生几何错误。这种局限性限制了视频编辑在专业影视制作中的应用。

此外,缺乏包含内/外参联合变化的配对真实数据,使得模型难以学习复杂的相机-内容关系。合成数据成为关键突破口,但需解决泛化到真实世界的问题。

核心创新

方法概览

核心差距在于内参(焦距、分辨率)与外参(姿态、轨迹)的解耦。传统方法将二者耦合,导致控制相互干扰。CameraAnything 的关键洞察是:需要一种能同时感知几何结构和分辨率变化的表示方法,而非简单的矩阵拼接。

  • 基于 Wan2.1-T2V-1.3B 模型,利用其 3D VAE 和 DiT 架构作为基础生成引擎。
  • 采用 Plücker 射线表示相机参数,提供每像素的 6-DoF 几何建模,比传统矩阵表示更精确。
  • 将 Plücker 射线嵌入映射为相位偏移,注入到自注意力模块的 3D RoPE 中,实现几何感知的位置编码。
  • 构建 Unreal Engine 5 合成数据集,包含单镜头和多镜头序列,覆盖固定/变化焦距及不同分辨率。
  • 采用正交训练策略,独立采样内/外参变化,避免参数耦合,提升控制精度。
  • 支持原生分辨率适应,无需裁剪或外绘,直接生成目标分辨率的视频内容。

逐图理解论文

现有局限

现有局限
Fig. 5: Qualitative comparison on real-world videos with TrajectoryCrafter [37] and ReCamMaster [2]. Given the same source video and target retake camera parameters, our method demonstrates more accurate camera trajectory following under challeng- ing scenarios, including large viewpoint changes and multi-cut shot transitions, while maintaining higher visual fidelity and geometric consistency.

真实视频定性对比,展示大视角变化和多镜头切换下的效果。关注几何一致性和视觉保真度,对比基线方法的伪影。

关键区分

关键区分
Fig. 4: Illustration of three camera representation and injection mechanisms. (a) Token-wise Addition: Pi ∈R3×4 and Ki ∈R3×3 are flattened and concatenated into ci ∈R21, then linearly encoded and added to all tokens. (b) AdaLN Injection: per-pixel camera embeddings based on the Plücker ray representation are encoded by a learnable linear layer to generate scale and shift parameters that modulate the Layer Normalization layers. (c) RoPE Injection: embedded Plücker rays are mapped to phase shifts that act as positional encodings, applied in parallel with the original 3D RoPE during self-attention computation. Red flames indicate trainable components, while snowflakes denote frozen weights.

对比三种注入机制:Token-wise Addition、AdaLN 和 RoPE。注意 RoPE 注入的相位偏移设计,这是提升几何一致性的关键。

方法贡献

方法贡献
Fig. 3: Overview of CameraAnything. CameraAnything is built upon Wan2.1- T2V-1.3B [33], which includes a 3D VAE for video latent encoding and a diffusion Transformer composed of multiple DiT blocks. Given a source video together with its camera parameters and a target camera specification, CameraAnything represents cameras using Plücker rays to provide accurate per-token geometric modeling, which is injected into the self-attention modules. With this design, CameraAnything can gen- erate videos under diverse camera edits, including novel camera poses, focal length adjustments, resolution adaptation, and multi-cut shot transitions, while also support- ing flexible combinations of these controls within a single generation process.

概述模型架构,Plücker 射线注入 3D RoPE 的过程。关注自注意力模块中的几何感知编码,理解其如何实现精确控制。

最强结论

最强结论
Table 2: Quantitative comparison on real-world DAVIS videos. We report Camera Accuracy (Cam. Acc.) and VBench [16]. Extrinsic camera control is compared with TrajectoryCrafter (Traj.) [37] and ReCamMaster (ReCam.) [2]. Resolution adaptation is compared with Follow-Your-Canvas (F-Y-C) [5] and VACE [18]. “–” indicates the method does not support this task.

真实世界 DAVIS 数据集结果,相机精度和 VBench 指标。关注 RotErr 和 TransErr 的显著降低,验证泛化能力。

意义与局限

意义与局限
Fig. 6: In-the-wild results. Our method generalizes to diverse real-world scenes despite being trained on synthetic data only.

这为电影级视频编辑提供了低成本、高精度的相机重拍方案。然而,模型仅使用合成数据训练,可能无法完全捕捉真实光学缺陷;且复杂多镜头切换仍具挑战。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 在合成数据集上评估重建质量(PSNR)、VBench 指标和视频质量,对比 TrajectoryCrafter、ReCamMaster 等基线。
  • 在真实世界 DAVIS 数据集上评估相机精度(RotErr、TransErr)和 VBench 指标,验证泛化能力。
  • 进行相机表示(Linear vs. Plücker)和注入机制(Add、AdaLN、RoPE)的消融实验,分析各组件贡献。
  • 评估训练策略(仅外参、无恒等样本)对控制独立性的影响。
  • 开展用户研究,评估真实视频编辑中的偏好率和视觉保真度。

关键结果与论文证据

  • 合成数据集上 PSNR 达 15.88,显著优于 TrajectoryCrafter (12.24) 和 ReCamMaster (12.87) [Page 12]。
  • DAVIS 数据集上 RotErr 为 2.76°,优于 ReCamMaster (5.12°) 和 TrajectoryCrafter (13.99°) [Page 13]。
  • DAVIS 数据集上 TransErr 为 0.33,优于 ReCamMaster (0.46) 和 TrajectoryCrafter (0.99) [Page 13]。
  • 用户研究中 73.3% 的偏好率选择 CameraAnything,远高于 ReCamMaster (21.0%) [Page 21]。
  • Plücker+RoPE 组合在消融实验中 PSNR 达 16.66,优于 Linear+Add (15.62) [Page 13]。
  • 多镜头切换和大视角变化场景下,视觉保真度和几何一致性显著优于基线方法。

阅读时需要注意

  • 仅使用合成数据训练,虽能泛化到真实场景,但可能无法完全捕捉真实光学缺陷。
  • ReCamMaster 在某些 VBench 指标上因保留首帧而表现更好,但 CameraAnything 合成新视角更具灵活性。
  • 复杂多镜头切换和大视角变化仍具挑战,相比简单单镜头编辑效果略逊。

关联工作

  • ReCamMaster 仅支持外参控制,缺乏内参和多镜头支持,是主要基线对比对象。
  • TrajectoryCrafter 依赖3D重建,易产生几何错误,计算成本高。
  • ReDirector 提出 RoCE,CameraAnything 在此基础上扩展为 Plücker 射线和统一控制。
  • Follow-Your-Canvas 通过外绘实现分辨率编辑,CameraAnything 采用原生适应,避免内容损失。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

CameraAnything:具有任意相机控制的视频重拍

李一轩1,2,∗,曾彦宏2,3,∗,†,程家乐2,朱家怡2,王翰林2,5,王文2,4,孟一浩2,5,欧阳浩2,王秋宇2,余悦2,5,王子栋1,张一源1,沈昱钧2,林达华1

1 香港中文大学,中国香港 liyixxxuan@gmail.com 2 蚂蚁集团,中国杭州 zengyh1900@gmail.com 3 清华大学,中国北京 4 浙江大学,中国杭州 5 香港科技大学,中国香港

∗ 共同一作。† 项目负责人。2026 https://yixuanli98.github.io/cameraanything/ Jul 来源 … ① :输入相机 ② : 目标重拍视频 [cs.CV]

来源 … 视频 arXiv:2607.24591v1 图 1:我们提出了 CameraAnything,这是首个统一的视频编辑框架,支持全面的相机控制,包括新轨迹操控、多镜头过渡、分辨率适配和焦距调整,展示了在电影级视频编辑方面的巨大潜力。

第 2 页

2 Yixuan Li 等

摘要。我们提出 CameraAnything,这是首个统一的相机控制视频编辑框架,能够同时控制内参和外参。现有方法要么依赖昂贵的 3D 重建以实现完整的相机功能,要么将编辑限制在外参操作。此外,内参和外参对视频外观的耦合影响使得解耦建模极具挑战性。为解决这一问题,我们在自注意力机制中采用逐像素 Plücker 射线注入以及分辨率感知的 3D RoPE,在目标潜在空间上构建相机条件约束和空间位置编码,从而联合控制相机位置、焦距和原生分辨率编辑,无需裁剪或外绘。为克服配对训练数据的稀缺性,我们进一步开发了一种可扩展的合成流水线,通过结构化多相机记录构建多样化的动态场景,并生成具有不同相机配置的同步视频。借助定制的正交训练策略,CameraAnything 能够在单次生成过程中实现具有任意视角控制、焦距调整、分辨率适配和多镜头过渡的表达性视频重拍,为电影级视频编辑和视频制作中的跨平台内容适配提供了重要的实用价值。

关键词:相机控制视频编辑 · 扩散模型

1 引言

控制相机是视觉叙事的基础。生成式视频模型的最新进展实现了可控的相机运动,使用户能够以新的相机运动重拍现有视频 [2,8,25]。这种能力有望通过使复杂相机效果无需专业设备或多相机设置即可实现,从而 democratize(普及)电影级视频制作。

表达性的相机语言源于对外参(相机位置和方向)和内参(例如焦距和分辨率)的联合操作,后者决定了场景投影、构图和观众注意力。尽管取得了令人瞩目的进展,最先进的相机控制视频编辑方法仅支持外参位姿控制,缺乏对内参(如焦距)的操作,限制了其重现表达性相机语言的能力 [2,8,25]。此外,许多方法假设固定的分辨率或宽高比,限制了其在不同显示平台上的适用性。

在本文中,我们提出了 CameraAnything,这是首个支持表达性相机语言的相机控制视频编辑统一框架。如图 1 所示,它实现了四种形式的相机控制:在单次生成过程中进行视角操作、焦距调整、分辨率适配和多镜头过渡。给定输入视频和目标相机参数,CameraAnything 将视频扩散 Transformer 基于相机感知的几何表示进行条件约束,以生成遵循指定配置的视频。一个关键挑战是对共同影响场景外观的相机参数进行建模,因为内参和外参通常是紧密耦合的

第 3 页

CameraAnything:使用任意相机控制重拍视频 3

在电影制作操作中。例如,希区柯克推拉变焦(dolly zoom)同时改变焦距和相机位置,以在主体表观大小保持不变的同时,极大地改变背景透视 [1]。

为解决这一问题,我们在自注意力机制中采用逐像素 Plücker 射线注入以及分辨率感知的 3D RoPE,在目标潜在表示上构建相机条件约束和空间位置编码。我们使用基于 token 的 Plücker 射线 [28] 来表示相机几何结构,该射线编码了每个像素射线的 3D 观察方向和力矩,从而唯一地表示与每个图像 token 相关联的相机射线。这种公式自然地捕捉了内参和外参。遵循旋转相机编码(RoCE)[25],我们将这些嵌入注入到 Transformer 注意力层 [30] 中的旋转位置编码(RoPE)中,以增强用于查询-键交互的位置编码。对于原生分辨率编辑,我们直接从目标分辨率的潜在网格重新计算 3D RoPE 的空间坐标,从而使 token 位置编码适应所需的输出尺寸。通过将视觉 token 锚定在相机几何结构中,同时保留 RoPE 的位置泛化能力,模型学习到的几何一致表示在各种相机配置下保持稳定。在实践中,我们通过消融实验评估了几种表示和注入变体,并采用上述配置作为统一相机控制的最有效方案。训练此类模型需要具有受控相机变化的配对视频,这在现实世界中难以收集。我们基于结构化多相机录制构建了一个可扩展的合成数据管道,为每个场景渲染具有不同外参轨迹、焦距变化和宽高比变化的同步片段。我们进一步采用正交训练策略,独立采样外参、焦距和分辨率编辑,从而支持单维度控制和复合相机指令。

大量实验表明,CameraAnything 在多个相机控制的视频编辑任务中实现了最先进的性能,实现了富有表现力的相机语言,并促进了不同显示格式之间的实用视频适配。我们的贡献总结如下:

– 我们引入了 CameraAnything,这是一个统一的相机控制视频编辑框架,能够在单个生成过程中联合操控视角、焦距、分辨率和多镜头过渡。为了实现这些功能,我们在目标潜在表示上注入逐像素 Plücker 相机嵌入以及分辨率感知的 3D RoPE,这是通过对替代表示和注入设计进行消融实验后选定的。 – 我们利用结构化多相机录制构建了一个可扩展的合成数据管道,以生成具有多样且可控相机配置的同步训练视频,并设计了一种正交训练策略,独立采样外参、焦距和分辨率编辑,以支持单维度控制和复合相机指令。 – 大量实验证明了该框架在相机控制视频编辑任务上的最先进性能,并突显了其在电影视频制作和跨平台内容适配方面的潜力。

第 4 页

4 Yixuan Li 等人

2 相关工作

相机控制的视频生成。相机控制的视频生成因其实现电影级叙事和降低个人电影制作门槛的潜力,吸引了越来越多的研究兴趣。该领域的核心挑战在于如何有效地表示并将相机参数注入视频生成模型。早期方法采用显式的相机参数化表示,如 Plücker 嵌入或外参矩阵。CameraCtrl [10] 引入了一种相机编码器,将 Plücker 嵌入 [28] 映射为多尺度特征,并将其集成到基于 U-Net 的视频模型的所有时间注意力层中。CameraCtrl-II [11] 通过构建包含丰富动态和相机标注的数据集来扩展这一方法,通过在第一个 DiT 层之前进行逐元素加法注入相机表示,以改善视角范围和运动多样性。SynCamMaster [3] 直接使用相机外参矩阵,并在虚幻引擎渲染的多相机视频上进行混合训练方案训练,以支持多相机生成。ShotDirector [35] 通过双分支设计结合这两种表示(一个外参分支和一个 Plücker 分支),实现了具有灵活镜头转换的多镜头生成。最近的工作探索了在 Transformer 架构中将 3D 几何与视觉 token 更紧密地集成,包括 token 级别的射线图编码 [9, 28]、注意力级别的相对姿态编码 [19, 24],以及具有完整视锥表示的相对投影位置编码 (PRoPE) [17, 20, 39]。

相机控制的视频编辑。虽然视频编辑在风格迁移、局部编辑和图像修复等任务中已被广泛研究 [18, 41],但旨在从新视角重新渲染现有视频的相机控制视频编辑仍处于相对探索不足的状态。一条研究路线是从参考视频重建显式的 3D 表示(如点云、网格),然后从新的相机轨迹重新渲染它们,通常随后进行质量增强以处理伪影并实现额外的可控性,如焦距和光照调整 [6, 12, 13, 22, 27, 29, 37]。然而,这些方法受限于 3D 重建的保真度,特别是在复杂或动态场景中。另一条研究路线直接训练生成模型以新的相机轨迹重新拍摄视频。ReCamMaster [2] 是该方向的一项开创性工作,它在大规模多相机合成同步视频上进行训练,并使用相机外参矩阵来条件化生成。ReDirector [25] 提出了 RoCE,通过在自注意力层中 3D-RoPE 的空间分量内的相对位置嵌入来编码相机信息。PlenopticDreamer [8] 通过在相机引导的视频检索下进行自回归生成来维持时空记忆,从而在多视角视频重新渲染中同步生成幻觉。除了静态视角变化,最近的工作进一步探索了与额外条件的联合相机控制,例如世界时间 [15, 34]、包括散景、曝光和色调在内的专业摄影参数 [31, 36, 38],或者在不要求显式相机参数的情况下从参考视频复制相机运动 [23]。然而,现有方法通常局限于重新拍摄

第 5 页

CameraAnything:使用任意相机控制重拍视频 5

视频,支持沿单一轨迹进行平滑、连续的相机外参位姿过渡,但不支持内参调整。相比之下,我们的工作提出了首个统一框架,支持在单一轨迹内进行多镜头位姿变化,并支持包括焦距和分辨率在内的内参调整,为适应不同显示设备(如移动屏幕的竖屏模式和电视广播的横屏格式)的内容提供重要的实用价值。

3 数据集

为了支持我们提出的框架——首个支持以新轨迹重拍单镜头视频、多镜头编辑和内参控制的框架——需要一个专用数据集。虽然 ReCamMaster [2] 为修改轨迹提供了基础,但它受限于静态相机内参和连续轨迹,无法支持重新对焦效果或从单一长镜头到电影化多镜头剪辑的过渡。因此,我们使用 Unreal Engine 5 [7] 开发了一个高保真合成数据集,支持对相机外参 (R, T) 和内参(包括焦距 f 和分辨率 (H, W))进行联合控制。

单镜头视频 单镜头视频及变化焦距 多镜头视频 多镜头视频及变化焦距

图 2:数据集示例。红色方框表示单镜头设置,相机外参一致,包括固定和变化的焦距。橙色和蓝色方框分别表示多镜头序列中的不同镜头。

我们构建了包含动画人物角色的多样化 3D 环境,以模拟现实世界的动态场景。为了使模型能够捕捉替代视角之间的空间相关性以及电影化剪辑之间的时间连续性,我们采用了结构化的录制协议。对于

第 6 页

6 Yixuan Li 等

对于每个场景,我们渲染 20 个同步的视频片段,这些片段在时间维度上严格对齐,但在相机和编辑配置上有所不同。每个场景的 20 个片段被组织成三个不同的组,以促进多任务学习:

– A 组(基础视角,片段 1-5):这些片段以连续的单镜头轨迹渲染,具有标准的固定焦距。它们作为提供基础视觉和运动信息的原始输入“锚点”。 – B 组(多镜头编辑变体,片段 6-10):这些片段用每视频 1-3 次瞬时相机剪辑替换平滑轨迹,其中相机经历突然的位置和方向变化以模拟电影镜头过渡。通过将 A 组的单镜头源与这些多镜头目标配对,模型学习将连续长镜头转换为具有不同镜头的编辑序列。 – C 组(重新对焦变体,片段 11–20):与保持相机内参固定的先前框架不同,我们构建此组以实现重新对焦能力。这些片段重用 A 组和 B 组的精确外参轨迹,但以不同的焦距渲染。通过将具有相同相机运动但视场 (FoV) 不同的片段配对,模型学习将几何相机运动与光学变焦效果解耦,从而在生成期间实现更灵活的焦距控制。

除了焦距外,我们还引入了一种实现原生分辨率和宽高比编辑的策略,我们将此视为相机内参的关键组成部分。我们以高分辨率正方形格式 (1:1) 渲染所有原始素材,作为多功能数据源。在训练期间,我们在这些正方形帧上执行动态参数化中心裁剪以生成训练样本。这种方法使模型能够学习如何为各种输出格式(例如 16:9、9:16)和分辨率重新构图场景,同时保持视觉保真度——这是以前固定内参框架完全不具备的能力。我们在图 2 中提供了一些案例。其他数据集细节见附录 A。

4 CameraAnything

4.1 预备知识

视频扩散 Transformer。如图 3 所示,我们基于 Wan2.1-T2V-1.3B [33] 构建,这是一个潜在视频扩散模型,它使用 3D 变分自编码器 (VAE) 将帧编码为紧凑的潜在空间,并使用扩散 Transformer (DiT) 对其进行去噪。3D-VAE 将视频 V ∈RF ×H×W ×3 压缩为潜在 z ∈RF ′×H′×W ′×C,时间步长和空间步长分别为 4 和 8。DiT 处理通过空间分块潜在获得的 N = F ′×H′×W ′ 个时空标记。每个 DiT 块在自注意力和前馈层之前应用时间步长条件自适应层归一化 (AdaLN),而 3D 旋转位置编码 (RoPE) 在注意力计算中对每个标记的时空坐标 (f, h, w) 进行编码。

对于视频到视频的生成,我们遵循 ReCamMaster [2] 的方法,将源视频标记 xs 和目标视频标记 xt 沿帧维度连接,

第 7 页

CameraAnything:使用任意相机控制重拍视频 7

姿态 + 焦距 分辨率 多镜头 定制视频 (姿态, 焦距, 分辨率, 视角, 多镜头, …) 提示词 DiT 模块 (x N) #$ #%

!$, !% #$ #% 前馈神经网络

分块 交叉注意力

3D VAE 自注意力 Plücker 射线 3D RoPE

!$, !% #$, #% $$, $% 相机 "!, "" 源 !! 带噪目标 !"

图 3:CameraAnything 概览。CameraAnything 基于 Wan2.1-T2V-1.3B [33] 构建,该模型包含用于视频潜在编码的 3D VAE 以及由多个 DiT 模块组成的扩散 Transformer。给定源视频及其相机参数和目标相机规格,CameraAnything 使用 Plücker 射线表示相机,以提供精确的逐令牌几何建模,并将其注入自注意力模块。通过这种设计,CameraAnything 能够生成具有多种相机编辑的视频,包括新的相机姿态、焦距调整、分辨率适配和多镜头切换,同时支持在单次生成过程中灵活组合这些控制。

形成长度为 2N 的联合序列作为 DiT 的输入。这种帧维度条件化使得源令牌和目标令牌之间能够通过每个自注意力层进行直接时空注意力交互,从而比通道维度或视图维度替代方案 [2] 产生更强的内容一致性。

相机参数化。第 i 帧的相机由其相机到世界 (c2w) 外参矩阵 $P_i = [R_i | t_i] \in \mathbb{R}^{3\times4}$ 和内参矩阵 $K_i \in \mathbb{R}^{3\times3}$ 描述。遵循标准针孔光学模型,我们从水平视场角推导 $K_i$:

$$f = \frac{W}{2 \tan(\text{fov}/2)}, \quad \mathbf{K}_i = \begin{pmatrix} f_x & 0 & W/2 \\ 0 & f_y & H/2 \\ 0 & 0 & 1 \end{pmatrix}. \quad (1)$$

所有相机姿态均相对于源视频的第一帧表示,

$$\hat{\mathbf{P}}_i = \mathbf{P}^{-1}_{\mathrm{src},0} \cdot \mathbf{P}_i, \quad (2)$$

使得 $\hat{P}_0 = I$,且后续姿态以与坐标系无关的方式编码视点变化。

第 8 页

8 Yixuan Li 等

前馈神经网络 前馈神经网络 前馈神经网络

交叉注意力 交叉注意力 交叉注意力

O MLP 自注意力 相机自注意力 适配器注意力 ⊕ MLP 3D RoPE 相机 MLP 3D RoPE Plücker 射线 3DRoPE Q K V Plücker 射线 𝑅 𝑥 𝑐∈𝑅!" 𝑅 𝑥 𝑐 𝑅 𝑥 𝑐

(a) Token 级加法 (b) AdaLN 注入 (c) RoPE 注入

图 4:三种相机表示与注入机制的示意图。(a) Token 级加法:Pi ∈R3×4 和 Ki ∈R3×3 被展平并拼接为 ci ∈R21,随后进行线性编码并加到所有 Token 上。(b) AdaLN 注入:基于 Plücker 射线表示的逐像素相机嵌入通过可学习的线性层编码,生成缩放和平移参数以调节层归一化层。(c) RoPE 注入:嵌入的 Plücker 射线被映射为相位偏移,作为位置编码,在自注意力计算中与原始 3D RoPE 并行应用。红色火焰表示可训练组件,雪花表示冻结权重。

4.2 相机表示与注入

一个核心设计问题是如何编码目标相机轨迹 {ˆPi, Ki}Fi=0−1 并将其注入 DiT 以引导新视角合成。我们系统地研究了两种相机表示与三种注入机制的组合(图 4),并确定了最能支持我们统一控制框架的组合。

线性相机表示。遵循 ReCamMaster [2],每帧的相机通过展平外参矩阵 Pi = [Ri | ti] ∈R3×4 和内参矩阵 Ki ∈R3×3,然后将它们拼接为 21 维向量 ci = [vec(Pi); vec(Ki)] 进行编码。可学习的线性编码器 Ecam : R21 →Rd 将 ci 投影到维度 d,并将嵌入广播到所有空间 Token。这种帧级表示虽然轻量,但缺乏逐像素的几何细节。

Plücker 射线表示。为了获得逐像素的几何细节,我们采用 Plücker 射线嵌入 [28],遵循 CameraCtrl [10] 和 BulletTime [34]。对于帧 i 中的每个像素 (u, v),世界空间射线方向和相机原点为:

\ c do t \ ha t { \mathbf{d}}_{i,uv},\quad\hat{\mathbf{d}}_{i,uv}=\left[\tfrac{uc_x}{f_x},\;\tfrac{vc_y}{f_x},\;1\right\big\|\cdot\quad\mathbf{o}_i=\mathbf{t}_i. (3) \ma t hb f {d}_{i ,uv} = \ mathbf {R}_i

逐像素嵌入 πi,uv = [oi; di,uv] ∈R6 在每个空间位置编码视角和焦距,从而生成特征图 Π ∈RF ×H×W ×6。

第 9 页

CameraAnything:使用任意相机控制重新拍摄视频 9

经过分块(patchification)后,一个可学习的投影将这些每个 token 的嵌入映射到隐藏维度 $d$,并使其可供每个 DiT 模块使用。这种表示也使分辨率编辑成为相机模型的原生功能。给定目标分辨率 $H_t \times W_t$ 和视场,内参矩阵 $K_t$ 决定了每个像素的光线方向。当分辨率改变时,光线方向、主点和光线数量也会相应改变,因此 Plücker 射线场自然地适应新的成像几何结构,而不是依赖裁剪、掩码或外绘。

Token 级加法。最简单的注入策略是在自注意力之前,将投影后的相机嵌入直接加到隐藏状态上:

$$ \tilde{\mathbf{x}} = \mathbf{x} + \mathcal{E}_\mathrm{cam}(\mathbf{c}) \quad (4) $$

其中 $\mathbf{c}$ 表示当前 token 的相机嵌入 [2, 10]。尽管这种方法简单且可零初始化,但加法注入直接修改了预训练骨干网络的隐藏状态分布,这在同时优化多个控制维度时可能会引入训练不稳定性。

AdaLN 注入。自适应层归一化(AdaLN)利用相机嵌入来预测每个 token 的缩放和平移参数 [11, 34]:

$$ \tilde{\mathbf{x}} = (1 + \boldsymbol{\gamma}) \odot \mathbf{x} + \boldsymbol{\beta}, \quad [\boldsymbol{\gamma}, \boldsymbol{\beta}] = \mathrm{MLP}\bigl(\mathcal{E}_\mathrm{cam}(\mathbf{c})\bigr) \quad (5) $$

其中 $\boldsymbol{\gamma}$ 和 $\boldsymbol{\beta}$ 初始化为零,因此注入开始时为单位变换。AdaLN 在不直接覆盖 token 内容的情况下调节特征分布,从而在保留预训练模型生成先验的同时,更平滑地融入相机信号。

RoPE 注入。一种正交设计将相机几何结构直接集成到注意力机制中。ReDirector [25] 提出了旋转相机编码(RoCE),它通过可学习的、由 Plücker 条件决定的相位偏移 $\boldsymbol{\phi}$ 来增强标准 3D RoPE 的空间分量:

$$ \bar{\mathbf{q}}' = \bar{\mathbf{q}} \circ \mathbf{R}_\mathrm{rope} \circ e^{i\boldsymbol{\phi}}, \quad \boldsymbol{\phi} = \mathrm{MLP}\bigl(\mathcal{E}_\mathrm{cam}(\mathbf{c})\bigr) \quad (6) $$

其中 $\boldsymbol{\phi}$ 由轻量级 MLP 预测并初始化为零,以实现稳定的微调。将相机信息编码为复数旋转域中的相位偏移,自然地调节了注意力相似度:共享一致视角的 token 获得增强的注意力,而几何距离较远的 token 的注意力受到抑制。原始的 3D RoPE 也具有分辨率感知能力:其空间坐标是从分块后的潜在网格 $(h', w')$ 计算得出的,其中 $h' = H_t / (s_\mathrm{vae} \cdot s_\mathrm{patch})$ 且 $w' = W_t / (s_\mathrm{vae} \cdot s_\mathrm{patch})$。改变输出分辨率会直接改变这个潜在网格,允许 RoPE 频率适应新的空间布局,而无需进行架构更改。

第 10 页

10 Yixuan Li 等

设计选择。我们的消融实验(第 5.3 节)表明,注入 RoPE 的 Plücker 射线实现了最佳的重建保真度。逐像素 Plücker 嵌入捕捉了超出 ReCamMaster 帧级 R21 编码的空间变化相机几何结构,而 RoPE 注入在不扰动预训练特征的情况下融入了多视图关系。在推理时,要在新的目标分辨率下生成视频,仅需根据期望的 (Ht, Wt, hfovt) 构建 Kt,从 Kt 和目标外参计算逐像素 Plücker 射线,并在相应的潜在网格上运行 DiT。无需重新训练、填充、掩码或后处理。

4.3 训练策略

我们将视频到视频的生成任务分解为三个正交的控制维度:(1) 相机外参(运动/剪辑),(2) 焦距,以及 (3) 宽高比。在训练期间,每个样本通过沿这三个轴独立采样构建,使模型能够学习每个控制维度及其任意组合。

具体而言,对于每个训练迭代,我们首先以 0.2、0.4、0.4 的概率从同相机、不同单镜头、单镜头到多镜头中采样外参类型。同相机模式保持条件视频和目标视频之间相同的相机轨迹,而不同单镜头从同一场景中抽取两个不同的单镜头相机,单镜头到多镜头则将单镜头条件与多镜头目标配对。随后,我们独立决定是否应用焦距变化(概率 0.5)和宽高比变化(概率 0.2)。当激活焦距变化时,目标视频是从使用不同焦距渲染的场景中抽取的,同时保持相同的相机外参,从而使模型能够解耦内参和外参。对于宽高比和分辨率编辑,目标相机射线和潜在网格是在目标输出分辨率下构建的,因此模型学习的是原生分辨率适应,而非固定分辨率裁剪或外绘。为了确保每个训练样本都携带有意义的学习信号,我们强制要求条件与目标之间至少有一个维度不同;如果采样的配置未产生变化(同相机、无焦距变化、无宽高比变化),我们将其提升为焦距变化样本。

这种正交分解产生了多达 3×2×2 = 12 种任务组合,涵盖了单维度控制(仅改变外参、焦距或宽高比)和复合控制指令(例如,同时改变相机轨迹、焦距和宽高比)。

5 实验

5.1 实验设置

实现细节。我们的模型基于 Wan2.1-T2V-1.3B [33] 构建,仅将自注意力层、相机编码器和相机适配器模块设为可训练;所有其余骨干参数保持冻结。对于

第 11 页

CameraAnything: 使用任意相机控制重拍视频 11

每个训练样本中,源视频 $V_s$ 始终从我们数据集的单镜头、固定焦距子集中抽取(第 3 节),而目标视频 $V_t$ 则根据采样的任务维度(外参变化、焦距变化或分辨率变化)进行选择,如第 4 节所述。每个样本的分辨率从预定义的桶集合 $\{480\times832, 832\times480, 384\times672, 672\times384, 512\times672, 672\times512, 384\times512, 512\times384, 640\times640, 320\times320\}$ 中抽取;当分辨率变化维度激活时,源分辨率和目标分辨率独立采样,以保证纵横比存在差异。新引入的相机模块在训练前进行零初始化。我们以 $5\times10^{-5}$ 的学习率和 32 的批量大小训练 20k 步。

基线方法。我们针对基准测试中的两类任务类别,与两组方法进行评估对比。对于外参和焦距控制,我们与 TrajectoryCrafter [37] 进行比较,该方法通过单目深度估计从输入视频重建点云表示,并在目标相机姿态下渲染新视角帧,利用视频扩散先验填充遮挡区域;以及 ReCamMaster [2],该方法使用虚幻引擎 [7] 渲染的多相机同步训练数据,将视频扩散模型置于目标相机外参矩阵条件下。对于分辨率编辑,我们与 Follow-Your-Canvas [5] 进行比较,这是一种视频外绘方法,在保持时间一致性的同时扩展视频的空间范围;以及 VACE [18],这是一个通用的视频编辑框架,在此作为基于参考的生成基线。

评估指标。我们在合成视频和真实世界视频上进行评估。对于合成评估,我们从渲染数据集中采样 50 个未见场景,并为每个场景构建 6 个测试用例,共生成 300 个测试对。每个测试用例的源视频均为来自同一场景的固定焦距、单镜头录制。六种目标配置涵盖了外参和内参控制维度的所有组合:(1) 源人像:源视频以人像分辨率(832×480)重新编码,作为分辨率变化的参考;(2) 单镜头外参:相同焦距下的不同单镜头相机轨迹;(3) 多镜头外参:相同焦距下的多镜头(剪辑)轨迹;(4) 仅焦距:源轨迹以不同焦距渲染;(5) 单镜头外参 + 焦距:不同的单镜头轨迹结合焦距变化;(6) 多镜头外参 + 焦距:多镜头轨迹结合焦距变化。我们报告 PSNR ↑、SSIM ↑ 和 LPIPS ↓[40] 以衡量相对于真实目标视频的重建保真度。感知质量使用 FVD ↓[32] 以及 VBench [16] 的六个维度进行评估:美学质量、成像质量、时间闪烁、运动平滑度、主体一致性和背景一致性。对于真实世界评估,我们从 DAVIS 数据集 [26] 中选择 50 个视频,并按照相同方案将每个视频与 6 个合成的相机轨迹配对,生成 300 个测试对。由于这些配对没有真实的目标视频,我们评估相机准确性和感知质量。对于相机准确性,我们在每个生成的视频上运行 ViPE [14] 以估计每帧的姿态,并与目标轨迹进行比较。我们报告 RotErr (◦, ↓),即在归一化两条轨迹后的平均旋转误差

第 12 页

12 Yixuan Li 等

表 1:在合成数据集上与最先进方法的定量比较。我们报告三类评估指标:重建(Recon.)、VBench [16] 和视频质量(V.Q.)。外参和焦距可控性针对 TrajectoryCrafter (Traj.) [37] 和 ReCamMaster (ReCam.) [2] 进行评估,而分辨率适配则与 Follow-Your-Canvas (F-Y-C) [5] 和 VACE [18] 进行比较。

外参/焦距 分辨率编辑 类别 指标 Traj. ReCam. ours F-Y-C VACE ours PSNR↑ 12.24 12.87 15.88 19.91 19.45 20.54 Recon. SSIM↑ 0.379 0.379 0.482 0.765 0.714 0.758 LPIPS↓ 0.654 0.607 0.179 0.206 0.194 0.174 Aesthetic↑ 0.4726 0.5338 0.5340 0.5374 0.5460 0.5462 Imaging↑ 0.5807 0.6505 0.6695 0.6346 0.6598 0.6614 Flicker↑ 0.9565 0.9717 0.9648 0.9670 0.9652 0.9655 VBench Motion↑ 0.9845 0.9910 0.9881 0.9892 0.9889 0.9903 Subject↑ 0.8619 0.9084 0.8912 0.8929 0.9014 0.9030 Background↑ 0.9131 0.9183 0.9071 0.9133 0.9225 0.9100 V.Q. FVD↓ 462.9 351.5 231.0 526.8 422.7 325.8

第 0 帧,以及 TransErr (↓),即通过弧长进行尺度对齐后的平均平移误差。感知质量通过 VBench 进行评估。

5.2 与最先进方法的比较

定量结果。定量比较总结在表 1 和表 2 中,分为外参/焦距控制和分辨率编辑,并针对特定任务基线。对于外参和焦距控制,跟随相机是主要目标,我们的方法更准确地跟随目标相机。它在合成重建方面优于 TrajectoryCrafter [37] 和 ReCamMaster [2](PSNR:15.88 对比 12.24 和 12.87),并实现了更低的真实世界相机误差(RotErr:2.76◦ 对比 ReCamMaster 的 5.12◦ 和 TrajectoryCrafter 的 13.99◦;TransErr:0.33 对比 0.46 和 0.99)。ReCamMaster 在多个 VBench 维度上得分更高,因为它保持第一帧与源图像相同,且不执行多镜头过渡,从而保留了更多输入像素并合成了更少的全新区域。相比之下,我们的方法针对更难的新视角和镜头切换设置,在两个基准测试中产生了显著更强的相机精度和更好的成像质量。表 5 进一步报告了一项用户研究,显示人类更偏好我们的相机对齐和视频质量。对于分辨率编辑,我们的方法在合成和真实世界评估中表现一致良好,在重建(PSNR/LPIPS)、视频质量(FVD)以及关键感知指标如美学、成像质量和运动平滑度方面优于 Follow-Your-Canvas [5] 和 VACE [18]。VACE 在主体和背景一致性方面得分略高,因为其扩展绘制管道保留了源裁剪区域,而我们的方法重新生成整个帧以支持原生分辨率适配。这些结果表明,在统一框架内联合建模相机几何和分辨率变化具有优势。

第 13 页

CameraAnything: 使用任意相机控制重拍视频 13

表 2:在真实世界 DAVIS 视频上的定量比较。我们报告相机精度(Cam. Acc.)和 VBench [16]。外参相机控制与 TrajectoryCrafter (Traj.) [37] 和 ReCamMaster (ReCam.) [2] 进行比较。分辨率适配与 Follow-Your-Canvas (F-Y-C) [5] 和 VACE [18] 进行比较。“–”表示该方法不支持此任务。

外参/焦距 分辨率 编辑 类别 指标 Traj. ReCam. Ours F-Y-C VACE Ours RotErr↓ 13.9916 5.11982 2.7600 – – – Cam. Acc. TransErr↓ 0.9949 0.4628 0.3309 – – – Aesthetic↑ 0.4291 0.5166 0.4752 0.5166 0.5157 0.5198 Imaging↑ 0.6004 0.6833 0.6857 0.6728 0.6644 0.6732 Flicker↑ 0.9077 0.9596 0.9463 0.9408 0.9395 0.9413 VBench Motion↑ 0.9527 0.9884 0.9809 0.9718 0.9743 0.9790 Subject↑ 0.8142 0.9094 0.8410 0.8898 0.8925 0.8908 Background↑ 0.8857 0.9110 0.8828 0.9125 0.9271 0.9127

表 3:相机表示和注入的消融实验。“Linear”表示外参和内参矩阵的帧级 21 维编码;“Plücker Ray”表示像素级 6-DoF 射线嵌入 [28]。注入方法包括逐元素加法(Add)、自适应层归一化(AdaLN)和基于 RoPE 的相位偏移(RoPE)。

表示 注入 PSNR↑ SSIM↑ LPIPS↓ Linear Addition 15.62 0.481 0.434 Plücker Ray AdaLN 16.51 0.517 0.368 Plücker Ray RoPE 16.66 0.528 0.372

定性结果。图 5 展示了在大视角变化和多重镜头重拍轨迹下的真实世界比较。TrajectoryCrafter 经常遭受几何错误和视觉伪影,而 ReCamMaster [2] 保持第一帧与源视频完全相同,并且在跟随多重镜头相机转换方面存在困难。我们的方法更准确地遵循复杂的相机控制,同时保持几何一致性和视觉质量。图 6 中的野外示例进一步证明了其泛化能力,尽管仅在合成数据上进行训练。

5.3 消融实验与分析

相机表示和注入。表 3 比较了三种表示和注入选择,其他所有设置保持不变。与线性表示和逐 token 加法(第 1 行)相比,第 2 行通过使用 Plücker 射线提供像素级几何线索,并使用 AdaLN 通过学习的缩放和偏移来调制 token 激活,而不是直接扰动其值,从而提高了所有指标。用 RoPE 注入替换 AdaLN(第 3 行)进一步提高了性能,表明通过注意力机制注入相机几何结构更为有效。

第 14 页

14 Yixuan Li 等

①:输入相机 ② ①:输入相机 ① ② ②:目标重拍 ① ②:目标重拍

源视频

轨迹 Crafter

ReCam- master

ours

图 5:在真实视频上与 TrajectoryCrafter [37] 和 ReCamMaster [2] 的定性比较。给定相同的源视频和目标重拍相机参数,我们的方法在具有挑战性的场景(包括大视角变化和多重剪辑镜头转换)下,展现出更准确的相机轨迹跟随能力,同时保持更高的视觉保真度和几何一致性。

①:输入相机 ①:输入相机

②:目标重拍 ②:目标重拍

源视频

目标视频

图 6:野外结果。尽管仅在合成数据上训练,我们的方法仍能泛化到多样化的真实世界场景。

而非特征空间调制。我们在图 7 中包含了不同注入设计的定性比较。

训练策略。表 4 通过两种变体(仅外参和不包含身份样本)对我们的联合训练策略进行了消融实验。仅外参训练禁用了焦距和分辨率的变化,但在外参任务上的表现与完整模型相当,证实了联合训练焦距和分辨率不会降低外参控制能力。在不包含身份样本的情况下,所有控制维度同时变化,且在三组任务中的性能均持续下降。这表明身份样本提供了数据驱动的监督信号,从而在联合训练期间解耦外参、焦距和分辨率控制。

第 15 页

CameraAnything:使用任意相机控制重拍视频 15

源视频

线性 & 加法

Plücker 射线 & AdaLN

Plücker 射线 & RoPE

GT 目标 视频

图 7:消融研究的视觉比较。给定相同的源视频和目标重拍相机参数,与其他变体相比,基于 RoPE 注入的 Plücker 射线表示能产生更强的几何一致性,伪影更少(由红色虚线框标出)。绿色虚线框表示真实值(Ground Truth)。

表 4:合成基准上的训练策略消融实验。仅外参(Extrinsic-only)禁用了焦距/分辨率变化;无身份样本(W/o identity samples)使所有控制维度同时变化。最佳结果加粗显示。

| 配置 | 外参任务 PSNR↑/ SSIM↑/ LPIPS↓ | 焦距任务 PSNR↑/ SSIM↑/ LPIPS↓ | 分辨率任务 PSNR↑/ SSIM↑/ LPIPS↓ | | :— | :— | :— | :— | | 完整模型 | 14.13 / 0.423 / 0.483 | 20.03 / 0.606 / 0.213 | 20.05 / 0.743 / 0.187 | | 仅外参 | 14.00 / 0.414 / 0.497 | – | – | | 无身份样本 | 13.87 / 0.406 / 0.503 | 15.94 / 0.475 / 0.399 | 14.64 / 0.456 / 0.414 |

6 结论

我们提出了 CameraAnything,这是一个统一的相机控制视频编辑框架,支持在单次生成过程中进行多镜头重拍、焦距和分辨率变化。我们将逐像素的 Plücker 射线注入到自注意力机制中分辨率感知的 3D RoPE 中。此外,我们通过结构化的多相机录制构建了可扩展的合成数据集,包含覆盖外参、焦距和分辨率变化的同步片段对。而且,我们设计了一种正交的训练策略,独立采样外参、焦距和分辨率编辑,实现了单维度控制及其组合控制。实验证明了其在基准测试中的强大性能以及在电影制作和跨平台视频适配方面的实用潜力。

致谢

本研究得到了蚂蚁集团研究实习生项目和蚂蚁集团博士后项目的支持。

第 16 页

16 Yixuan Li 等

参考文献

1. Adobe: 轨道变焦镜头:定义与示例。https://www.adobe.com/sg/creativecloud/video/production/cinematography/camera-shots-and-angles/dolly-zoom-shot.html (2026),访问日期:2026-06-30 2. Bai, J., Xia, M., Fu, X., Wang, X., Mu, L., Cao, J., Liu, Z., Hu, H., Bai, X., Wan, P., 等:Recammaster:基于单视频进行相机控制的生成式渲染。In: ICCV (2025) 3. Bai, J., Xia, M., Wang, X., Yuan, Z., Liu, Z., Hu, H., Wan, P., ZHANG, D:Syncammaster:同步多视角视频生成。In: ICLR (2025) 4. Black, M.J., Patel, P., Tesch, J., Yang, J:BEDLAM:展示详细逼真动画运动的合成人体数据集。In: CVPR. pp. 8726–8737. IEEE (2023) 5. Chen, Q., Ma, Y., Wang, H., Yuan, J., Zhao, W., Tian, Q., Wang, H., Min, S., Chen, Q., Liu, W:Infinite-canvas:通过广泛内容生成实现高分辨率视频外绘。In: Proceedings of the AAAI Conference on Artificial Intelligence. vol. 39, pp. 2150–2158 (2025) 6. Chen, Y., Ye, Z., Fang, Z., Chen, X., Zhang, X., Liu, J., Wang, N., Liu, H., Zhang, G:Postcam:基于查询共享交叉注意力的相机可控新视角视频生成。arXiv preprint arXiv:2511.17185 (2025) 7. Epic Games:虚幻引擎。https://www.unrealengine.com/ (2023),访问日期:2026-06-30 8. Fu, X., Tang, S., Shi, M., Liu, X., Gu, J., Liu, M.Y., Lin, D., Lin, C.H:光场视频生成。arXiv preprint arXiv:2601.05239 (2026) 9. Gao, R., Hołyński, A., Henzler, P., Brussee, A., Martin-Brualla, R., Srinivasan, P., Barron, J.T., Poole, B:Cat3d:使用多视角扩散模型创建任意3D对象。In: Proceedings of the 38th International Conference on Neural Information Processing Systems. pp. 75468–75494 (2024) 10. He, H., Xu, Y., Guo, Y., Wetzstein, G., Dai, B., Li, H., Yang, C:Cameractrl:为文生视频生成启用相机控制。In: ICLR (2025) 11. He, H., Yang, C., Lin, S., Xu, Y., Wei, M., Gui, L., Zhao, Q., Wetzstein, G., Jiang, L., Li, H:Cameractrl ii:通过相机控制的视频扩散模型进行动态场景探索。In: ICCV (2025) 12. Hong, Y., Lee, S., Chung, H., Ye, J.C:Inversecrafter:将视频重捕获作为潜在域逆问题高效解决。arXiv preprint arXiv:2512.05672 (2025) 13. Hu, T., Peng, H., Liu, X., Ma, Y:Ex-4d:通过深度水密网格实现极端视角4D视频合成。arXiv preprint arXiv:2506.05554 (2025) 14. Huang, J., Zhou, Q., Rabeti, H., Korovko, A., Ling, H., Ren, X., Shen, T., Gao, J., Slepichev, D., Lin, C., Ren, J., Xie, K., Biswas, J., Leal-Taixé, L., Fidler, S:Vipe:用于3D几何感知的视频姿态引擎。CoRR abs/2508.10934 (2025) 15. Huang, Z., Jeong, H., Chen, X., Gryaditskaya, Y., Wang, T.Y., Lasenby, J., Huang, C.H:Spacetimepilot:跨时空动态场景的生成式渲染。arXiv preprint arXiv:2512.25075 (2025) 16. Huang, Z., He, Y., Yu, J., Zhang, F., Si, C., Jiang, Y., Zhang, Y., Wu, T., Jin, Q., Chanpaisit, N., 等:Vbench:视频生成模型的全面基准套件。In: CVPR (2024) 17. HunyuanWorld, T:Hunyuanworld 1.0:从文本或像素生成沉浸式、可探索、可交互的3D世界。arXiv preprint (2025)

第 17 页

CameraAnything:使用任意相机控制重拍视频 17

18. Jiang, Z., Han, Z., Mao, C., Zhang, J., Pan, Y., Liu, Y.: Vace: All-in-one video creation and editing. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 17191–17202 (2025) 19. Kong, X., Liu, S., Lyu, X., Taher, M., Qi, X., Davison, A.J.: Eschernet: A generative model for scalable view synthesis. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. pp. 9503–9513 (2024) 20. Li, R., Yi, B., Liu, J., Gao, H., Ma, Y., Kanazawa, A.: Cameras as relative posi- tional encoding. Advances in Neural Information Processing Systems (2025) 21. Lin, Z., Cen, S., Jiang, D., Karhade, J., Wang, H., Mitra, C., Ling, T., Huang, Y., Liu, S., Chen, M., Zawar, R., Bai, X., Du, Y., Gan, C., Ramanan, D.: Towards understanding camera motions in any video. CoRR abs/2504.15376 (2025) 22. Liu, T., Chen, Z., Huang, Z., Xu, S., Zhang, S., Ye, C., Li, B., Cao, Z., Li, W., Zhao, H., et al.: Light-x: Generative 4d video rendering with camera and illumination control. arXiv preprint arXiv:2512.05115 (2025) 23. Luo, Y., Shi, X., Bai, J., Xia, M., Xue, T., Wang, X., Wan, P., Zhang, D., Gai, K.: Camclonemaster: Enabling reference-based camera control for video generation. In: Proceedings of the SIGGRAPH Asia 2025 Conference Papers. pp. 1–10 (2025) 24. Miyato, T., Jaeger, B., Welling, M., Geiger, A.: Gta: A geometry-aware attention mechanism for multi-view transformers. In: The Twelfth International Conference on Learning Representations (2024) 25. Park, B., Kim, B.H., Chung, H., Ye, J.C.: Redirector: Creating any-length video retakes with rotary camera encoding. arXiv preprint arXiv:2511.19827 (2025) 26. Pont-Tuset, J., Perazzi, F., Caelles, S., Arbeláez, P., Sorkine-Hornung, A., Gool, L.V.: The 2017 DAVIS challenge on video object segmentation. CoRR abs/1704.00675 (2017) 27. Seo, J., Han, J., Jung, J., Jin, S., Lee, J., Narihira, T., Fukuda, K., Shibuya, T., Ahn, D., Hu, S., et al.: Vid-camedit: Video camera trajectory editing with generative rendering from estimated geometry. arXiv preprint arXiv:2506.13697 (2025) 28. Sitzmann, V., Rezchikov, S., Freeman, B., Tenenbaum, J., Durand, F.: Light field networks: Neural scene representations with single-evaluation rendering. Advances in Neural Information Processing Systems 34, 19313–19325 (2021) 29. Song, C., Yang, Y., Zhao, T., Li, R., Zhang, C.: Worldforge: Unlocking emergent 3d/4d generation in video diffusion model via training-free guidance. arXiv preprint arXiv:2509.15130 (2025) 30. Su, J., Ahmed, M., Lu, Y., Pan, S., Bo, W., Liu, Y.: Roformer: Enhanced trans- former with rotary position embedding. Neurocomputing 568, 127063 (2024) 31. Sun, H., Shen, L., Peng, Z., Wang, K., Wu, S., Zang, Y., Liu, T., Huang, Z., Zeng, X., Cao, Z., et al.: Generative photographic control for scene-consistent video cinematic editing. arXiv preprint arXiv:2511.12921 (2025) 32. Unterthiner, T., van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M., Gelly, S.: Fvd: A new metric for video generation. arXiv preprint arXiv:1812.01717 (2019) 33. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J., et al.: Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314 (2025) 34. Wang, Y., Zhang, Q., Cai, S., Wu, T., Ackermann, J., Kuang, Z., Zheng, Y., Rajič, F., Tang, S., Wetzstein, G.: Bullettime: Decoupled control of time and camera pose for video generation. arXiv preprint arXiv:2512.05076 (2025) 35. Wu, X., Chen, X., Wang, Y., Qiao, Y.: Shotdirector: Directorially controllable multi-shot video generation with cinematographic transitions. arXiv preprint arXiv:2512.10286 (2025)

第 18 页

18 Yixuan Li 等

36. Yang, Q., Yang, Y., Zeng, Y., Hu, X., Li, B., Yue, H., Yang, J., Jiang, P.T.: Cameramaster: 摄影后期处理中统一的相机语义-参数控制。arXiv 预印本 arXiv:2511.21024 (2025) 37. Yu, M., Hu, W., Xing, J., Shan, Y.: Trajectorycrafter: 通过扩散模型重定向单目视频的相机轨迹。在:IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集。第 100–111 页 (2025 年 10 月) 38. Yuan, Y., Wang, X., Sheng, Y., Chennuri, P., Zhang, X., Chan, S.: 生成式摄影:面向逼真文本到图像合成的场景一致相机控制。在:计算机视觉与模式识别会议论文集。第 7920–7930 页 (2025) 39. Zhang, C., Li, B., Wei, M., Cao, Y.P., Gambardella, C.C., Phung, D., Cai, J.: 用于可控视频生成的统一相机位置编码。arXiv 预印本 arXiv:2512.07237 (2025) 40. Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.: 深度特征作为感知度量的不合理有效性。在:CVPR (2018) 41. Zhong, L., Li, F., Huang, Y., Liu, J., Pei, R., Song, F.: Outdreamer: 基于扩散 Transformer 的视频外绘。arXiv 预印本 arXiv:2506.22298 (2025)

第 19 页

CameraAnything: 使用任意相机控制重拍视频 19

CameraAnything: 使用任意相机控制重拍视频

补充材料

A 数据集详情

场景构建。我们的数据集使用 Unreal Engine 5 [7] 渲染,包含总共 15,000 个场景,这些场景由 150 个静态环境构建而成,涵盖了多样的室内和室外设置。对于每个场景,我们从 BEDLAM [4] 数据集中随机放置动画人物角色到环境中,并根据人物位置生成相机轨迹。整个流程中使用 Unreal Engine 内置的碰撞检测,以确保人物、场景几何体和相机之间不发生穿透。每个场景包含 20 个同步的视频片段,每个片段 81 帧,帧率为 16 fps,分辨率为 832×832。我们的数据集包含约 300,000 个视频。

数据集结构。每个场景的 20 个片段被组织成三组: – A 组(片段 1–5):具有平滑连续相机轨迹和固定焦距的单镜头视频。这些片段在训练期间可用作源或目标。 – B 组(片段 6–10):具有每个片段 1–3 次离散相机转换的多镜头视频,模拟电影镜头切换。 – C 组(片段 11–20):A 组和 B 组的重新聚焦变体,保持外参轨迹和编辑结构不变(见下文)。

对于 A 组和 B 组,每个场景使用一个固定的焦距,从 {18, 24, 35, 50} mm 等效焦距中随机选择,遵循 ReCamMaster [2] 的相机配置。

相机轨迹设计。我们遵循 CameraBench [21] 提出的分类法,将每个镜头的轨迹分解为以下两类之一:

– 相机中心:相机独立于场景内容移动。此类包括三种子类型:(i) 静态(位置和方向固定),(ii) 仅旋转(原地旋转而不平移),以及 (iii) 仅平移(平移而不改变方向)。 – 对象中心:相机围绕或跟踪目标人物。在每个镜头的起始和结束帧,我们从 [1, 7] 米的范围内随机采样相机到主体的距离,并应用相对于主体中心朝向方向的偏航和俯仰偏移,两者均从 N(0◦, 15◦) 中抽取,相机始终朝向主体。两个端点姿态通过线性插值或非均匀弧曲线插值连接。

对于 B 组,将 2–4 个这样的镜头通过瞬时相机切换连接起来,形成多镜头序列。

第 20 页

20 Yixuan Li 等

重聚焦变体。C 组将 A 组和 B 组中的每个片段与一个重聚焦对应片段配对,该对应片段在保持外参运动和镜头结构的同时改变内参。焦距覆盖 18–50 mm 等效范围,值在视场角(FOV)空间中均匀采样。重聚焦编辑遵循几种模式;对于多镜头片段,一种模式以相等概率独立分配给每个镜头:

– 固定:整个镜头内焦距恒定。 – 推近:镜头内焦距增加。 – 拉远:镜头内焦距减小。 – 呼吸:镜头内焦距先增加后减小。 – 随机:镜头内包含 2–4 个焦距关键帧,每个关键帧分配独立采样的焦距,并在关键帧之间进行插值。

这些配对片段支持学习重聚焦效果,并将光学变焦与相机运动解耦。

B 扩展评估与用户研究

本节补充主论文中的合成数据和 DAVIS 评估(表 1–2),提供关于野外相机精度、补充合成指标、人类偏好以及每种配置的重建指标的额外分析。

野外评估。我们在 15 个额外的野外视频上进行评估,使用 ViPE 估计的源相机,并在官方检查点和推荐推理设置下运行 ReCamMaster 以进行公平比较。除了 DAVIS 基线比较外,我们项目页面上的视频演示同样是从噪声估计的源相机生成的,而非真实姿态。表 5 显示,在这些视频上,CameraAnything 的 RotErr/TransErr 低于 ReCamMaster,这与主论文中的 DAVIS 结果(表 2)一致。

合成相机精度。表 5 还报告了与主论文表 1 相同基准上的合成 RotErr/TransErr,并列出了野外和用户研究结果以供参考。CameraAnything 在比较的方法中实现了最低的相机误差。

用户研究。自动指标可能无法完全反映人类对相机控制的感知。我们在 15 个真实视频上进行了包含 20 名参与者的用户研究,涉及外参/焦距编辑。每位参与者观看源视频、目标相机姿态可视化以及来自竞争方法的匿名结果,并选择源一致性、相机对齐和整体质量方面的首选输出。如表 5 总结,CameraAnything 在所有三个标准上均优于 ReCamMaster,其中相机对齐方面的优势最大(73.3% vs. 21.0%)。

第 21 页

CameraAnything: 使用任意相机控制重新拍摄视频 21

表 5:在野生视频、合成相机精度和真实用户研究上的综合评估。RotErr/TransErr 针对野生和合成设置报告;用户研究条目表示偏好率 (%)。

| Method | In-the-wild RotErr↓ | In-the-wild TransErr↓ | Synthetic RotErr↓ | Synthetic TransErr↓ | User Study Src.↑ | User Study Cam.↑ | User Study Qual.↑ | | :— | :— | :— | :— | :— | :— | :— | :— | | Traj. | – | – | 7.771 | 0.492 | 1.9 | 5.7 | 2.9 | | ReCam. | 5.110 | 0.537 | 3.969 | 0.260 | 41.0 | 21.0 | 36.2 | | Ours | 3.015 | 0.259 | 2.123 | 0.178 | 57.1 | 73.3 | 61.0 |

表 6:合成基准测试中各配置的重建细分。

| Metric | Focal Only | Src. Portr. | Single Ext. | Multi Ext. | Single Ext.+F | Multi Ext.+F | | :— | :— | :— | :— | :— | :— | :— | | PSNR↑ | 21.78 | 20.54 | 14.67 | 14.49 | 13.98 | 14.49 | | SSIM↑ | 0.680 | 0.758 | 0.447 | 0.428 | 0.416 | 0.439 | | LPIPS↓ | 0.178 | 0.174 | 0.448 | 0.460 | 0.512 | 0.465 |

各配置细分。表 6 报告了主论文中定义的六个测试配置的重建指标。仅焦距和源肖像编辑较容易,而外参和外参+焦距编辑较难,因为需要合成更大的新区域。

C 更多定性结果

大视角变化。图 8 展示了具有大相机距离、视角和分辨率变化的代表性野生结果。尽管需要合成大量未见区域,输出结果在视觉上仍然连贯,并未表现出明显的合成痕迹。

电影片段。遵循 ReCamMaster [2],图 9 展示了两个电影案例的结果,证明了我们方法在电影内容上的泛化能力。

第 22 页

22 Yixuan Li 等

源 生成结果与大幅相机变化

图 8:在大幅视角和分辨率变化下的结果。每行显示一个源视频(左)和我们的结果(右)。

目标

目标

图 9:两个电影案例的结果。每行显示一个源帧(左)和我们的编辑结果,展示了针对合成训练数据之外的电影素材的泛化能力。

发表评论