ShotPlan:基于可学习规划令牌的电影级多镜头视频生成

三分钟导读:ShotPlan通过引入带有分数时间旋转位置编码(FRoPE)的可学习规划令牌,在单一生成过程中实现了精确的多镜头视频生成及帧级转场控制。

英文题目:ShotPlan: Cinematic Video Generation with Learnable Planning Token

论文出处:arXiv 每日论文精选 · arXiv:2607.17675

原始论文:PDF / 论文页面

对应视频标题:ShotPlan:基于可学习规划令牌的电影级多镜头视频生成|推荐指数:★★★★★

这篇论文解决什么问题?

现有视频生成模型主要优化单镜头连续视频,难以在单一连贯过程中生成具有明确镜头边界、视角变化和跨镜头语义一致性的多镜头电影视频;现有方法通过修改注意力掩码或位置编码来模拟转场,往往限制了跨镜头信息交互或破坏了预训练的位置结构。

核心创新

  • 引入可学习规划令牌作为时间锚点,以隐式方式控制镜头转场,避免修改原始注意力结构。
  • 提出分数时间旋转位置编码(FRoPE),解决VAE时间压缩导致的离散潜在步长与用户指定帧级时间戳之间的粒度不匹配问题。
  • 将多镜头视频生成统一为单次连贯的生成过程,支持硬切(Hard Cut)和渐变(如Cross-fade)等多种转场类型。
  • 该方法可泛化至时间局部化的摄像机运动控制(如Circle Left)。

方法概览

提出ShotPlan框架,将镜头转场表示为插入视频令牌序列的可学习规划令牌(Learnable Planning Tokens);这些令牌作为时间锚点,通过自注意力与视觉令牌交互;引入分数时间旋转位置编码(FRoPE)为规划令牌分配精确的帧级时间坐标,从而在保持原始视频令牌预训练位置编码不变的情况下,实现帧级的转场控制。

逐图理解论文

方法概述:可学习规划令牌

方法概述:可学习规划令牌
Figure 2. Overview of the ShotPlan framework. Given an input video, a 3D VAE encodes the frames into latent representations, which are then patchified into visual tokens. Based on user-specified cut timestamps and a structured prompt, ShotPlan introduces learnable planning tokens assigned with precise temporal coordinates via Fractional Rotary Position Embedding (FRoPE). These tokens are concatenated with visual tokens and jointly processed by DiT blocks, serving as temporal anchors for shot transitions. After denoising, the planning tokens are removed, and the updated visual tokens are unpatchified and decoded to generate the final multi-shot video.

ShotPlan框架将镜头转场表示为插入视频令牌序列的可学习规划令牌。这些令牌作为时间锚点,通过自注意力与视觉令牌交互。给定用户指定的切割时间戳和结构化提示,ShotPlan引入这些规划令牌,并通过分数时间旋转位置编码为其分配精确的帧级时间坐标,从而在保持原始视频令牌预训练位置编码不变的情况下,实现帧级的转场控制。

统一生成过程与转场类型

统一生成过程与转场类型
Figure 1. ShotPlan enables controllable multi-shot video generation within a single sequence. (Top) Given user-specified timestamps, the model produces accurate hard cuts while preserving character identity and scene consistency across shots. (Middle) The same framework also supports gradual transitions (e.g., cross-fades) in a unified manner. (Bottom) As a byproduct, our approach can be extended to temporally localized camera motion control (e.g., circle-left), demonstrating its generality.

ShotPlan将多镜头视频生成统一为单次连贯的生成过程,支持硬切和交叉淡入淡出等多种转场类型。通过自注意力机制,规划令牌隐式地控制镜头边界,避免了修改原始注意力结构带来的负面影响。这种方法不仅提升了生成效率,还增强了跨镜头的语义一致性,使得不同镜头间的角色和场景保持连贯。

定量评估:多镜头基准测试

定量评估:多镜头基准测试
Table 1. Quantitative comparison across multiple metrics. Multi- shot generation is evaluated via automatic metrics, while camera movement is evaluated via a user study assessing motion type and timing accuracy.

在自建的多镜头基准测试上,ShotPlan与CineTrans、EchoShot、HoloCine和MultiShotMaster进行了定量比较。结果显示,ShotPlan在转场偏差上取得0.64的最低分,优于MultiShotMaster的1.12和HoloCine的2.71。在角色一致性上达到0.46,场景一致性达到0.37,均优于最强基线HoloCine。叙事连贯性得分0.88,亦为最高。

定性比较与可视化分析

定性比较与可视化分析
Figure 3. Qualitative comparison of multi-shot video generation with CineTrans [40], EchoShot [34], HoloCine [24], MultiShotMaster [35] across a sequence of four continuous shots (Shot 1 to Shot 4). The number in the top-left corner of each frame indicates the starting frame index of each generated shot.

定性比较显示,ShotPlan生成的多镜头视频在角色身份和场景一致性上表现更佳。注意力可视化分析表明,规划令牌对时间局部过渡具有精确的控制效果。与CineTrans和HoloCine相比,ShotPlan生成的镜头边界更清晰,跨镜头的语义转换更自然,有效避免了传统方法中常见的视觉伪影和一致性断裂问题。

摄像机运动控制能力

摄像机运动控制能力
Table 3. User Study on Camera Movement Control Accuracy.

ShotPlan的方法可泛化至时间局部化的摄像机运动控制,如圆圈左移。用户研究评估了摄像机运动控制的准确性,结果显示ShotPlan在运动类型和时机准确性上得分最高。与商业模型Kling 2.6和Seedance 1.5 Pro相比,ShotPlan的摄像机时机准确率达到97%,显著优于Kling的92%和Seedance的96%,展现了其在精细控制方面的优势。

实验与关键结果

  • 在自建的多镜头基准测试上与CineTrans, EchoShot, HoloCine, MultiShotMaster进行定量和定性比较。
  • 消融实验分析令牌类型(可学习vs静态)、注入机制(Latent Addition, AdaLN等)及位置编码策略(FRoPE vs 离散RoPE)的影响。
  • 注意力可视化分析规划令牌对时间局部过渡的控制效果。
  • 用户研究评估时间局部化摄像机运动控制的准确性,并与商业模型(Kling 2.6, Seedance 1.5 Pro)对比。
  • 使用VideoEvent数据集构建训练数据,包含硬切和软切样本。
  • Transition Deviation: 0.64 (优于MultiShotMaster的1.12和HoloCine的2.71)(第 6 页)
  • Character Consistency: 0.46 (优于最强基线HoloCine的0.39)(第 6 页)
  • Scene Consistency: 0.37 (优于最强基线HoloCine的0.32)(第 6 页)
  • Narrative Coherence: 0.88 (最高分,优于HoloCine的0.85)(第 6 页)
  • Camera Timing Accuracy: 97% (优于Kling 2.6的92%和Seedance 1.5 Pro的96%)(第 8 页)

阅读时需要注意

  • 依赖高质量的训练数据,需通过合成数据(I2V拼接)构建摄像机运动数据集,并需人工筛选以去除拼接伪影。
  • 规划令牌在训练过程中保持干净(无噪声),虽然收敛更快,但理论上与流匹配目标的同质性假设略有不同(尽管实验证明有效)。
  • FRoPE对于实现帧级精确控制至关重要,移除FRoPE会导致过渡偏差显著增加(从0.64升至2.13)。
  • 可学习令牌优于静态语义令牌,后者在字符和场景一致性上表现较差。
  • 直接添加(Latent Addition)或AdaLN注入机制在精度和结构保持上不如作为上下文令牌的拼接方式。

关联工作


展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

ShotPlan:基于可学习规划令牌的电影级视频生成

Su Guo*,1,2 Guangce Liu*,1 Haosen Yang Jiepeng Wang1 Cong Liu1 Junqi Liu1 Haibin Huang1 Hongxun YaoB,2 Chi Zhang1 Xuelong LiB,1

1 人工智能研究院(TeleAI),中国电信 2 哈尔滨工业大学

guosu0930@gmail.com h.yao@hit.edu.cn xuelong li@chinatelecom.cn

项目主页:https://pensioner-11.github.io/ShotPlan/

硬切 2026年7月20日 硬切[cs.CV]

软过渡

摄像机运动 | 向左环绕

图 1. ShotPlan 能够在单个序列中实现可控的多镜头视频生成。(顶部)给定用户指定的时间戳,该模型能够生成准确的硬切,同时保持角色身份和镜头间场景的一致性。(中部)同一框架也以统一的方式支持渐变过渡(例如交叉淡入淡出)。(底部)作为副产品,我们的方法可以扩展到时间局部化的摄像机运动控制(例如向左环绕),展示了其通用性。

摘要

当前的视频生成模型在单镜头生成方面取得了令人印象深刻的成果,但在电影级视频生成方面仍然受限,因为连贯的叙事和有效的多镜头构图需要明确的镜头规划。为了解决这一挑战,我们提出了 ShotPlan,这是一个基于视频扩散基础模型构建的显式多镜头电影级视频生成框架。我们的方法引入了可学习规划令牌,用于捕捉镜头级转场线索,并能够与原始视频生成令牌无缝集成,以控制转场时间戳。与标准的视频生成令牌不同,所提出的规划令牌配备了分数时间旋转位置编码(FRoPE),使得能够在帧级别对镜头转场进行建模。实验

第 2 页

证明了 ShotPlan 显著优于现有的电影视频生成方法,提供了更灵活的镜头管理和更强的镜头间一致性。通过将令牌与原始视频令牌集成,ShotPlan 能够在保持底层视频生成架构的同时,实现可控的转场时序。一个关键挑战在于,现代视频扩散模型在时间压缩的潜在空间中运行,其中多个物理帧对应于单个潜在时间步。因此,仅与离散潜在索引对齐的转场信号无法精确匹配用户指定的帧级时间戳。我们保留用于视频令牌的原始时间旋转位置编码(RoPE)[32, 38],并为规划令牌引入分数时间旋转位置编码(FRoPE),从而能够在帧级别对镜头转场进行建模。这避免了依赖注意力掩码或手动改变位置距离来分隔镜头,同时保持了原始的视频生成架构。因此,ShotPlan 将镜头规划表示为一系列可学习令牌,使得在单个连贯过程中实现可控的多镜头生成成为可能。

我们的贡献如下:(1) 我们引入了 ShotPlan,这是一个简单而有效的框架,将多镜头视频生成表述为单个连贯生成过程中的显式镜头规划。(2) 为了实现这一目标,我们引入了可学习规划令牌,并研究了其设计、注入策略以及分数时间旋转位置编码(FRoPE),从而在保持预训练视频生成架构的同时,实现帧级镜头转场控制。(3) 大量实验表明,ShotPlan 实现了可控且连贯的多镜头生成,并进一步显示出在更广泛的视频控制场景(如摄像机运动控制)中具有强大的泛化潜力。

2. 相关工作

文本到视频生成。基于扩散的模型已成为文本到视频生成的主导范式。早期方法通过扩展预训练的文本到图像模型,结合时间模块、运动层或时空扩散设计来合成短视频 [2, 3, 5, 6, 11, 15]。最近的进展采用基于 Transformer 的架构,特别是扩散 Transformer(DiT),以可扩展的方式对视频令牌进行建模 [22, 23, 26]。借助大规模视频-文本数据和改进的训练流程,现代基础视频模型在视觉保真度、运动真实性、文本对齐和时间连贯性方面取得了实质性进展 [27, 33, 43, 48]。这些模型为视频创作提供了强大的生成先验,并催生了广泛的 AI 辅助内容生产应用。然而,它们主要针对连续的单镜头片段进行优化,其中视觉内容在一个不间断的时间段内平滑演变。相比之下,电影制作通常需要具有显式镜头边界、不同视角和连贯跨镜头语义的结构化多镜头视频,这需要

第 3 页

现有文本到视频模型的主要挑战。为此,我们提出了分数时间旋转位置编码(FRoPE)用于这些令牌。最后,我们描述了用于多镜头训练的数据策展流程。ShotPlan 的概览如图 2 所示。

多镜头视频生成。多镜头视频生成需要在保持主体、场景和叙事一致性的同时,对不连续的镜头转场进行建模。一类工作将问题分解为关键帧或视觉计划生成,随后进行图像到视频的合成 [7, 10, 14, 41, 44, 45, 47, 49]。尽管直观,但这些流水线在很大程度上独立地生成镜头,并严重依赖稀疏关键帧的质量和覆盖范围,从而限制了去噪过程中的镜头间交互。

最近的方法则在一个统一的去噪过程中生成多镜头视频。ShotAdapter [18] 引入了可学习转场令牌以及局部注意力掩码,以控制镜头数量和持续时间。CineTrans [40] 使用注意力掩码来引导电影转场,而 HoloCine [24] 及其他基于长上下文或掩码的方法 [12, 28] 设计了结构化注意力以用于多镜头或多场景生成。这些方法改善了镜头分离,但其显式的注意力约束可能限制跨镜头的信息传播,并削弱主体或场景的一致性。

另一组方法通过时间位置编码来表示镜头结构。RoPE [32] 在基于 Transformer 的视频生成中被广泛使用,最近的工作进一步研究了面向视频的 RoPE 设计 [38]。特别是,时间位置由离散潜在步长索引,即 $t \in \{0, \dots, f-1\}$。EchoShot [34] 和 MultiShotMaster [35] 修改 RoPE 以区分镜头或引入镜头级相位偏移。然而,改变视频令牌的位置会改变它们的相对关系,并可能扰乱预训练的时间先验。此外,VAE 的时间压缩使得帧级镜头边界难以与离散潜在时间步对齐。

相比之下,我们将镜头转场表示为插入到视频令牌序列中的可学习规划令牌。与 ShotAdapter 不同,后者的转场令牌是附加的且依赖于局部注意力掩码,我们的规划令牌参与标准自注意力,而不阻碍跨镜头交互。我们进一步为它们配备了分数时间 RoPE,同时保持视频令牌的原始 RoPE 不变,从而在不破坏预训练位置结构的情况下实现帧级转场控制。

3. 方法

在本工作中,我们提出了 ShotPlan,这是一个轻量级框架,用于在多镜头视频生成中,在单个连贯的生成过程中实现显式的镜头规划。给定文本提示和用户指定的转场时间戳,我们的目标是一次性生成连贯的多镜头视频。我们首先在 3.1 节简要回顾基于扩散 Transformer (DiT) 的视频扩散模型。然后,在 3.2 节中,我们介绍可学习规划令牌,旨在捕捉和控制镜头级转场线索。接下来,3.3 节介绍分数时间旋转位置编码(FRoPE),用于精确帧级定位。最后,我们描述了用于多镜头训练的数据策展流程。ShotPlan 的概览如图 2 所示。

3.1. 预备知识

最近的视频生成模型通常建立在由扩散 Transformer (DiT) [23, 26, 33] 参数化的潜在扩散框架之上,我们的方法遵循这一范式。给定输入视频 $V \in \mathbb{R}^{T \times H \times W \times 3}$,其中 $T$ 为帧数,预训练的 3D 变分自编码器 (3D VAE) [33, 43] 用于在保持视频语义和感知内容的同时降低计算成本。视频被压缩为时空潜在表示:

$$z_0 = E(V), \quad z_0 \in \mathbb{R}^{f \times h \times w \times C}.$$

为了启用基于 Transformer 的建模,潜在张量进一步被分块化为令牌序列,并通过多头自注意力进行处理。每个令牌都与一个 3D 坐标 $(t, h, w)$ 相关联,表示其时间和空间位置。位置信息使用 3D 旋转位置编码 (RoPE) [32] 进行编码,该编码根据这些坐标对查询和键表示应用轴向上的旋转。特别是,时间位置由离散潜在步长索引,即 $t \in \{0, \dots, f-1\}$。遵循最近的视频扩散模型,我们采用整流流公式 [21]。给定干净潜在 $z_0$ 和高斯噪声 $z_1 \sim \mathcal{N}(0, I)$,定义线性概率路径为:

$$z_\tau = (1 – \tau)z_0 + \tau z_1, \quad \tau \in [0, 1]. \quad (1)$$

基于 DiT 的去噪器 $f_\theta$ 旨在通过以下目标预测目标速度:

$$\mathcal{L}_{\text{flow}} = \mathbb{E}_{\tau, z_0, z_1} \left[ \| v_\theta(z_\tau, \tau, c) – (z_1 – z_0) \|_2^2 \right], \quad (2)$$

其中 $c$ 表示条件信号。

3.2. 可学习规划令牌

视频扩散 Transformer 在分块的潜在令牌上进行去噪。给定输入视频 $V \in \mathbb{R}^{T \times H \times W \times 3}$,我们首先获得其干净潜在表示 $z_0 \in \mathbb{R}^{f \times h \times w \times C}$。然后,根据公式 (1) 从 $z_0$ 获得噪声潜在 $z_\tau$,并将其分块 [22, 23, 26] 为视觉令牌序列:

$$X_\tau = \text{Patchify}(z_\tau) \in \mathbb{R}^{N \times D}.$$

为了在不修改注意力结构或引入位置不连续性的情况下显式控制镜头转场,我们引入可学习规划令牌作为时间锚点

第 4 页

3D VAE DiT Block *N

Self-Attention Patchify Unpatchify Cross-Attention

add

Fhard cutaaaa FFN Ffade in begin 6.00 12.25 Text Encoder Fk 16.75 Global caption: Epic hyper-realistic cinematic shots , Holly- Remove wood cinematic texture, post-battle ruin environment…Shot 1: Medium shot, Spider-Man and Iron Man stand sideways fac- Concatenate Rope: Hard Cuts:21,46,64 ing each other …Shot 2: Close-up over-the-shoulder…Shot 3: Learnable Medium shot……Shot 4: Tight close-up shot…… (�= 1 + (�−1)/4,0,0)

图 2. ShotPlan 框架概览。给定输入视频,3D VAE 将帧编码为潜在表示,随后将其 patchify 为视觉令牌。基于用户指定的剪辑时间戳和结构化提示,ShotPlan 引入了可学习规划令牌,并通过分数时间旋转位置编码(FRoPE)为其分配精确的时间坐标。这些令牌与视觉令牌拼接,并由 DiT 块联合处理,作为镜头转场的时间锚点。去噪后,移除规划令牌,并将更新后的视觉令牌 unpatchify 和解码,以生成最终的多镜头视频。

在原始坐标系内。具体而言,我们定义 $F_p \in \mathbb{R}^{M \times D}$ 并将其与 patch-token 序列拼接: $$ X_{in} = [X_\tau \parallel F_p] \in \mathbb{R}^{(N+M) \times D}. \quad (3) $$ 其中 $X_{out} \in \mathbb{R}^{(N+M) \times D}$。规划令牌在所有 Transformer 块中与视觉令牌联合处理,通过自注意力机制与它们交互,并在去噪过程中充当上下文条件 [4] 信号。通过训练,$DiT_\theta$ 学习根据这些时间局部化的转场线索调整其预测。这里,$F_p$ 是根据转场类型由一组少量可学习令牌嵌入构建的。

去噪后,我们丢弃规划令牌并保留更新后的视觉令牌 $\tilde{X}_\tau \in \mathbb{R}^{N \times D}$。这些令牌随后通过 unpatchification 映射回潜在空间: $$ \hat{v} = \text{Unpatchify}(\tilde{X}_\tau), $$ 给定 $M$ 个用户指定的剪辑点,该令牌被复制 $M$ 次并与视频令牌拼接,每个副本通过 FRoPE(见第 3.3 节)分配其各自剪辑点的时间坐标,以区分其位置。这对应于用于流匹配优化的预测速度 $v_\theta(z_\tau, \tau, c)$。

对于硬切(Hard Cut),我们训练单个可学习的硬切令牌 $f_{cut} \in \mathbb{R}^D$。

对于渐变转场(例如交叉淡入淡出 Cross-fade),我们改为训练一个起始令牌和一个结束令牌,它们分别放置在转场区间的开始和结束位置。

拼接后的令牌序列由 DiT 骨干网络处理: $$ X_{out} = DiT_\theta(X_{in}, \tau, c), $$

3.3. 分数时间旋转位置编码(Fractional Temporal Rotary Position Embedding)

我们保留视觉令牌的原始时间 RoPE,并引入分数时间旋转位置编码

第 5 页

镜头 1 镜头 2 镜头 3 镜头 4 中景平视镜头:前台接待员 反向过肩镜头(OTS) 过肩镜头(来自客人视角,焦点 过肩镜头(来自接待员视角, 正在办理入住手续 (来自接待员视角): 在接待员): 焦点在客人):客人拿着 [ 0~18 ] 女客人站在前台 接待员停止工作并抬头看 [39~63] 皮革护照夹,手 resting 在柜台上 [64~80] [19~38]

CineTrans

EchoShot

HoloCine

MasterMultiShot

Ours

图 3. 多镜头视频生成的定性比较,对比对象包括 CineTrans [40]、EchoShot [34]、HoloCine [24]、MultiShotMaster [35], 跨越四个连续镜头序列(镜头 1 至镜头 4)。每个帧左上角的数字表示每个生成镜头的起始帧索引。

仅对规划令牌使用分数旋转位置编码(FRoPE)。这使得能够在保持原始视频令牌预训练位置编码的同时,实现精确的帧级转场控制。

由于 RoPE 由正弦函数参数化 [32, 38],它自然地支持连续坐标,无需进行架构更改。因此,FRoPE 使规划令牌能够在生成过程中与精确的帧级转场时间戳对齐,而不是粗略的潜在索引。由于规划令牌不对应空间图块,我们为其分配固定的空间坐标 $(h, w) = (0, 0)$。视觉令牌的 RoPE 公式保持不变。这保持了对预训练视频扩散主干网络的兼容性。

3.4. 多镜头训练的数据策展

为了构建具有连贯多镜头结构的训练数据,我们从开源数据集 VideoEvent [20] 开始构建我们的数据集,该数据集由经过编辑的视频片段组成,

第 6 页

自然的密集镜头转场和强烈的叙事连续性。

表 1. 多项指标上的定量比较。多镜头生成通过自动指标进行评估,而摄像机运动则通过评估运动类型和时间准确性的用户研究进行评估。

我们首先应用标准预处理(例如,字幕和边框去除),然后使用 TransNet V2 [31] 检测镜头边界并将每个视频分割为单独的镜头。

为了获得具有足够时间上下文的训练样本,我们在时间上连续的镜头上采用滑动窗口策略。具体而言,我们提取长度为 5 秒的固定窗口,每个窗口包含一系列连续的镜头。每个窗口至少包含两个镜头以确保存在转场事件,而每个镜头至少跨越 20 帧以保持稳定的视觉内容。候选窗口进一步使用 Gemini 2.5 [8] 进行过滤,仅保留那些对应于语义一致的事件、稳定的场景背景和主体连续性的窗口。

对于每个选定的样本,我们进一步使用 Gemini 构建分层注释。每个视频都关联一个全局描述,捕捉整体场景属性(例如,环境、主要主体、光照),以及描述细粒度细节(如主体动作、摄像机视角和运动模式)的逐镜头字幕。这种分层结构有助于在多镜头视频生成训练中同时学习跨镜头一致性和镜头特定的变化。

4. 实验

4.1. 实验设置

实现细节。 我们在 832 × 480 分辨率下,每个样本 81 帧,基于 Wan2.1-T2V-14B [33] 实现 ShotPlan。视频使用 3D VAE 进行编码,时间压缩因子为 4。我们在 8 块 NVIDIA H100 GPU 上使用 AdamW 优化器,以 1×10−5 的学习率和 1 的批次大小,对超过 7K 个硬切(Hard Cut)和 6K 个软切样本训练 3,500 步。在训练期间,规划令牌(Planning Tokens)和 DiT 层被联合优化。规划令牌从零均值高斯分布初始化,标准差为 0.02。在推理过程中,我们使用尺度为 5 的分类器自由引导(CFG)和 50 个去噪步骤。

基线。 我们将 ShotPlan 与代表性的多镜头视频合成方法进行比较,包括 CineTrans [40]、EchoShot [34]、HoloCine [24] 和 MultiShotMaster [35]。这些方法涵盖了多镜头叙事建模、以角色为中心的转场、长篇幅电影生成以及最近的多镜头合成。

评估。 我们使用 Gemini 2.5 [8] 构建了 100 个多镜头提示,涵盖角色一致性、场景一致性和长镜头场景。具体而言,60 个提示关注跨镜头角色一致性,30 个关注场景一致性,10 个关注没有转场的长镜头序列。对于每个提示,Gemini 还指定了用于评估的镜头对,例如,镜头 1 与镜头 3,从而实现对跨镜头一致性的针对性评估。为了公平比较,我们将每个提示调整为每个基线所需的输入格式。

指标。 我们从四个方面评估多镜头视频生成:(1) 转场偏差(Transition Deviation),通过 TransNet V2 [31] 检测到的转场帧与用户指定时间戳之间的帧级差距来衡量;(2) 文本对齐(Text Alignment),计算每个生成的镜头与其镜头级字幕之间的 ViCLIP [36] 相似度;(3) 跨镜头一致性(Cross-Shot Consistency),通过 Gemini 指定的镜头对之间的 DINOv2 [25] 特征相似度来衡量;以及 (4) 叙事连贯性(Narrative Coherence),遵循 MultiShotMaster [35],由 Gemini 2.5 在场景、主体、动作和空间一致性方面对采样帧和分层字幕进行评判。

4.2. 定量比较

表 1 报告了我们多镜头基准上的定量比较结果。总体而言,ShotPlan 在大多数指标上取得了最佳性能。它显著降低了转场偏差,达到 0.64,而 MultiShotMaster 为 1.12,HoloCine 为 2.71,展示了更精确的镜头边界控制。在镜头间一致性方面,ShotPlan 也表现最佳,将角色一致性从 0.39 提高到 0.46,场景一致性从 0.32 提高到 0.37,优于最强的基线。此外,我们的方法取得了 0.88 的最高叙事连贯性得分,优于 HoloCine 和 MultiShotMaster。尽管 HoloCine 获得了略高的文本对齐度,但 ShotPlan 在保持具有竞争力的对齐度的同时,在时间控制、一致性和连贯性方面提供了更好的整体平衡。

4.3. 定性比较

我们在图 3 中进一步提供了定性比较。每个帧左上角的数字表示相应生成镜头的起始帧索引。

第 7 页

表 2. 令牌类型、条件注入机制和位置编码策略的消融研究。

| | 转场偏差 ↓ | 对齐 ↑ | 角色一致性 ↑ | 场景一致性 ↑ | | :— | :—: | :—: | :—: | :—: | | 令牌设计 | | | | | | 静态语义令牌 | 0.82 | 0.21 | 0.28 | 0.29 | | 注入机制 | | | | | | 潜在层加法 (Latent Addition) | 1.76 | 0.25 | 0.42 | 0.36 | | 全局 AdaLN | 5.64 | 0.28 | 0.39 | 0.37 | | 局部 AdaLN | 4.39 | 0.26 | 0.37 | 0.36 | | 位置编码 | | | | | | 无分数 RoPE | 2.13 | 0.27 | 0.37 | 0.34 | | 本文方法 (完整 ShotPlan) | 0.64 | 0.26 | 0.46 | 0.37 |

与使用注意力掩码来控制镜头转场的 CineTrans [40] 和 HoloCine [24] 相比,ShotPlan 更好地保留了跨镜头的信息流和场景结构。例如,在第 3 行中,HoloCine 未能保留背景,楼梯在镜头 3 中消失。虽然 EchoShot [34] 和 MultiShotMaster [35] 等方法通过修改 RoPE 来建模镜头转场,但这种位置操作可能会削弱镜头间的空间连贯性。如第 4 行所示,MultiShotMaster 产生了不一致的场景,左侧的灯具在镜头 3 中消失。相比之下,ShotPlan 引入可学习规划令牌作为时间锚点,作为上下文条件信号,而无需修改注意力结构或位置编码。这使得我们的方法能够在准确遵循用户指定的转场时间戳的同时,更好地保持主体身份和场景布局 across shots。

注入机制分析。 为了证明我们上下文令牌注入策略的合理性,我们比较了三种注入可学习规划令牌的替代机制。(1) 潜在层加法 (Latent Addition) 直接将规划令牌添加到目标转场时间戳处的视觉令牌中。虽然它提供了基本控制,但会破坏与 RoPE 的交互,并将精度限制在粗略的潜在层位置。(2) 全局 AdaLN 调制 (Global AdaLN Modulation) 通过辅助 MLP 将转场位置映射到 AdaLN 调制参数。然而,它仅提供全局条件,与未控制的基线相比几乎没有改进。(3) 局部 AdaLN 调制 (Local AdaLN Modulation) 仅对目标潜在位置应用 AdaLN,提高了定位能力,但仍缺乏与 RoPE 的有效协作,因此仍局限于潜在层控制。

这些比较表明,将转场控制视为上下文令牌调制能更好地保留预训练 DiT 结构,并实现更精确的时间控制。

可学习令牌的有效性。 我们假设可学习规划令牌可以通过数据驱动的训练捕捉镜头级转场线索。为了验证这一设计,我们将它们与静态语义令牌进行比较。具体而言,我们使用 T5 编码器提取短语“scene cut”的文本嵌入,通过文本嵌入层将其投影到 DiT 令牌维度,并应用平均池化以获得冻结令牌。在 DiT 微调期间,使用该静态令牌替换我们的可学习规划令牌。如表 2 所示,不可学习的令牌导致明显的性能下降,角色一致性、场景一致性和文本对齐度均较低。这表明固定的语义令牌与预训练 DiT 的潜在特征空间兼容性较差,并迫使主干网络适应刚性的控制信号。相比之下,可学习令牌可以与模型联合优化,更好地与底层特征空间对齐,并为时间局部化的镜头控制提供更有效的条件。

分数 RoPE 的有效性。 为了评估分数 RoPE 对精确时间对齐的贡献,我们将连续分数坐标替换为标准离散潜在索引。如表 2 所示,移除分数组件会将转场控制从物理帧级别降级到更粗略的潜在级别。这证实了分数 RoPE 对于弥合由 VAE 时间压缩引入的粒度差距至关重要。

4.5. 规划令牌的注意力分析

为了分析规划令牌如何调节镜头转场,我们可视化了来自第 8 个 DiT 块的规划令牌和视频令牌之间的时间注意力响应,并对所有注意力头进行了平均。如图 4 所示,每个规划令牌在其分配的转场时间戳周围表现出明显的注意力集中,表明模型学习了时间局部化的转场控制。值得注意的是,注意力峰值与投影的分数

图 4. 注入的转场令牌的潜在时间注意力权重可视化。横轴表示潜在帧的时间进展,纵轴表示对应于不同转场(转场 1、转场 2、转场 3)的标志令牌。

第 8 页

表 3. 相机运动控制精度的用户研究。视频生成系统,包括 Kling 2.6 [19] 和 SeedDance 1.5 Pro [29],因为没有针对细粒度时间局部化相机控制的公开基线。用户研究评估两个方面:(1) 运动类型,生成的运动是否与文本指令匹配;以及 (2) 时间准确性,运动是否在指定的时间戳开始,并在没有意外漂移的情况下保持时间局部化。如表 3 所示,ShotPlan 实现了具有竞争力的运动类型准确率,并拥有最高的时间准确率,优于两个商业基线。这些结果表明,我们的可学习规划令牌与分数时间定位相结合,为离散镜头转场和连续时间控制提供了一种统一的机制。

| 模型 | 类型 ↑ | 时间 ↑ | | :— | :— | :— | | Wan 2.1 | 89% | 97% | | Kling 2.6 | 81% | 92% | | SeedDance 1.5 Pro | 86% | 96% |

提示:荒野中的一间木屋;相机在前 2 秒保持静止,然后向前移动。 Kling 2.6: 0, 32, 80 我们在开始时向前移动。 Seedance 1.5: 5, 32, 80

提示:荒野中的一间木屋。 向前移动:第 32 帧 我在第 32 帧向前移动。 ours: 32, 32, 80

图 5. 时间局部化相机运动控制的定性比较。该图比较了 ShotPlan (Ours) 与商业模型 (Kling 2.6 [19] 和 Seedance 1.5 [29]) 在执行时间局部化相机运动方面的表现。

时间戳而非离散潜在索引,验证了 FRoPE 在帧级时间对齐方面的有效性。注意力也平滑地扩散到相邻帧,表明转场是通过软时间调制实现的,而不是硬镜头分离,同时保持了镜头间的时间语义连续性。

4.6. 时间局部化相机运动

我们的方法超越了多镜头生成,可以应用于时间结构化控制任务 [1, 9, 13, 37, 42, 46]。作为一个代表性例子,我们考虑时间局部化的相机运动,如平移、缩放或圆周运动。

与瞬时镜头转场不同,相机运动随时间连续演变。在我们的公式中,这可以通过相同的令牌机制来处理:控制令牌锚定在用户指定的起始时间戳,模型学习将其影响传播到后续帧。在相应的运动语义条件下,Transformer 在预期的时间间隔内生成连贯的相机运动,而无需显式的边界令牌。如图 5 所示,ShotPlan 准确地从指定时间戳开始执行“向左画圆”运动,同时保持平滑的运动动力学。

为了进行定量评估,我们进行了一项用户研究,将 ShotPlan 与 Wan 2.1 [33] 和商业模型进行比较。

5. 结论

我们提出了 ShotPlan,这是一个轻量级框架,用于基于预训练视频扩散模型的显式多镜头电影视频生成。通过引入带有分数时间旋转位置编码 (Fractional Temporal RoPE) 的可学习规划令牌,ShotPlan 能够在不修改视频骨干网的原始注意力结构或位置编码的情况下,实现镜头转场的帧级控制。规划令牌作为时间锚点和上下文条件信号,使模型能够在保持预训练生成先验的同时管理镜头边界。大量实验表明,ShotPlan 提高了转场准确率、镜头间一致性和叙事连贯性,优于现有的多镜头视频生成方法。我们进一步证明了相同的公式可以扩展到时间局部化的相机运动,表明其作为视频生成中结构化时间控制的统一机制的潜力。

参考文献

[1] Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, et al. Recammaster: Camera-controlled generative rendering from a single video. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 14834–14844, 2025. 8

[2] Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, et al. Lumiere: A space-time diffusion model for video generation. In SIGGRAPH Asia 2024 Conference Papers, pages 1–11, 2024. 2

[3] Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, et al. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127, 2023. 2

[4] Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, and Xiangyu Yue. Videocanvas: Unified video completion from

第 9 页

通过上下文条件控制任意时空块。 [16] Jonathan Ho, Tim Salimans, Alexey Gritsenko, William arXiv 预印本 arXiv:2510.08555, 2025. 4 Chan, Mohammad Norouzi, 和 David J Fleet。视频扩散 [5] Haoxin Chen, Menghan Xia, Yingqing He, Yong Zhang, 模型。神经信息处理系统进展, 35:8633–8646, 2022. 2 Xiaodong Cun, Shaoshu Yang, Jinbo Xing, Yaofang Liu, [17] Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Qifeng Chen, Xintao Wang, 等。 Videocrafter1:用于高质量视频生成的开放 Zhu, Yuanzhi Li, Shean Wang, Lu Wang, 和 Weizhu Chen。 扩散模型。 arXiv 预印本 arXiv:2310.19512, 2023. 2 LoRA:大型语言模型的低秩自适应。在国际学习表征会议, 2022。 [6] Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, 11 Xintao Wang, Chao Weng, 和 Ying Shan。 Videocrafter2: [18] Ozgur Kara, Krishna Kumar Singh, Feng Liu, Duygu Cey- 克服数据限制以实现高质量视频扩散模型。 在 IEEE/CVF 计算机视觉 lan, James M Rehg, 和 Tobias Hinz。Shotadapter:基于扩散模型的文本到 与模式识别会议论文集, 第 7310–7320 页, 2024. 2 多镜头视频生成。在计算机视觉与模式识别会议论文集, 第 28405–28415 页, 2025. 3 [7] Xinyuan Chen, Yaohui Wang, Lingjun Zhang, Shaobin [19] 快手。 Kling 视频生成模型。 https:// Zhuang, Xin Ma, Jiashuo Yu, Yali Wang, Dahua Lin, Yu [19] Kuaishou. Kling video generation model. https:// Qiao, 和 Ziwei Liu。 Seine:用于生成式转场和预测的短长视频扩散 kling.kuaishou.com/en, 2024. 访问日期:2026-05- 模型。第十二届国际学习表征会议, 2023. 2, 3 12. 8 [8] Gheorghe Comanici, Eric Bieber, 等。 Gemini 2.5:通过先进推理、多模态、长 [20] Baoyu Liang, Qile Su, Shoutai Zhu, Yuchen Liang, 和 Chao 上下文和下一代 Agent 能力推动前沿, 2025. 6 Tong。Videvent:一个用于理解视频中动态事件演变的大型数据集, 2025. 5 [9] Daniel Geng, Charles Herrmann, Junhwa Hur, Forrester [21] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximil- Cole, Serena Zhang, Tobias Pfaff, Tatiana Lopez-Guevara, ian Nickel, 和 Matt Le。Flow matching 用于生成模型。 arXiv 预印本 arXiv:2210.02747, 2022. 3, 11 Yusuf Aytar, Michael Rubinstein, Chen Sun, 等。 Motion [22] Nanye Ma, Mark Goldstein, Michael S Albergo, Nicholas M prompting:通过运动轨迹控制视频生成。 在计算机视觉与模式识别会议论文集, 第 1–12 页, 2025. 8 Boffi, Eric Vanden-Eijnden, 和 Saining Xie。 Sit:探索基于流和扩散的生成模型与可扩展 识别会议, 第 1–12 页, 2025. 8 插值 Transformer。在欧洲计算机视觉会议, 第 23–40 页。Springer, 2024. 2, 3 [10] Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, [23] Xin Ma, Yaohui Wang, Xinyuan Chen, Gengyun Jia, Zi- Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, wei Liu, Yuan-Fang Li, Cunjian Chen, 和 Yu Qiao。Latte: Xintao Wang, Ying Shan, 等。 Talecrafter:具有多角色的交互式 潜在扩散 Transformer 用于视频生成。 arXiv 故事可视化。 arXiv 预印本 arXiv:2305.18247, 2023. 3 预印本 arXiv:2401.03048, 2024. 2, 3 [11] Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, [24] Yihao Meng, Hao Ouyang, Yue Yu, Qiuyu Wang, Wen Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, Wang, Ka Leong Cheng, Hanlin Wang, Yixuan Li, Cheng 和 Bo Dai。Animatediff:无需特定调整即可动画化您的个性化文本- Chen, Yanhong Zeng, 等。Holocine:电影级多镜头长视频叙事的整体生成。 arXiv 预印本 图像扩散模型。 arXiv 预印本 arXiv:2307.04725, 2023. 2 arXiv:2510.20822, 2025. 2, 3, 5, 6, 7 [12] Yuwei Guo, Ceyuan Yang, Ziyan Yang, Zhibei Ma, Zhijie [25] Maxime Oquab, Timoth´ee Darcet, Th´eo Moutakanni, Huy Lin, Zhenheng Yang, Dahua Lin, 和 Lu Jiang。用于视频生成的长上下文 Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, 微调。在 IEEE/CVF 国际计算机视觉会议论文集, 第 17281– Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, 等。 17291 页, 2025. 3 Dinov2:无监督学习鲁棒视觉特征。 [13] Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo arXiv 预印本 arXiv:2304.07193, 2023. 6 Dai, Hongsheng Li, 和 Ceyuan Yang。Cameractrl:启用文本到视频生成的 [26] William Peebles 和 Saining Xie。可扩展扩散模型 相机控制。 arXiv 预印本 arXiv:2404.02101, 2024. 8 与 Transformer。 在 IEEE/CVF 国际 arXiv 预印本 arXiv:2404.02101, 2024. 8 计算机视觉会议论文集, 第 4195–4205 页, [14] Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, 2023. 2, 3 Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao [27] Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Weng, Ying Shan, 等。 Animate-a-story:通过检索增强视频生成进行 Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih- 讲故事。 arXiv 预印本 arXiv:2307.06940, 2023. 3 Yao Ma, Ching-Yao Chuang, 等。Movie gen:一组媒体基础模型。 arXiv 预印本 arXiv:2410.13720, [15] Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, 2024. 2 Ruiqi Gao, Alexey Gritsenko, Diederik P Kingma, Ben [28] Tianhao Qi, Jianlong Yuan, Wanquan Feng, Shancheng Poole, Mohammad Norouzi, David J Fleet, 等。 Imagen Fang, Jiawei Liu, SiYu Zhou, Qian He, Hongtao Xie, 和 video:使用扩散模型生成高清视频。 arXiv 预印本 arXiv:2210.02303, 2022. 2 Yongdong Zhang。Maskˆ 2dit:基于双掩码的扩散 模型。 arXiv 预印本 arXiv:2210.02303, 2022. 2 Transformer 用于多场景长视频生成。在计算机视觉与模式识别会议论文集, 第 18837–18846 页, 2025. 3

9

第 10 页

[29] Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yan- Agrawala, Alan Yuille, and Lu Jiang. Captain cinema: To- fei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng wards short movie generation. In The Fourteenth Interna- Cheng, Xinqi Cheng, et al. Seedance 1.5 pro: A native audio- tional Conference on Learning Representations, 2025. 2, 3 visual joint generation foundation model. arXiv preprint [42] Shiyuan Yang, Liang Hou, Haibin Huang, Chongyang Ma, arXiv:2512.13507, 2025. 8 Pengfei Wan, Di Zhang, Xiaodong Chen, and Jing Liao. [30] Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Direct-a-video: Customized video generation with user- Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, directed camera movement and object motion. In ACM SIG- Oran Gafni, et al. Make-a-video: Text-to-video generation GRAPH 2024 Conference Papers, pages 1–12, 2024. 8 without text-video data. arXiv preprint arXiv:2209.14792, [43] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu 2022. 2 Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiao- [31] Tom´as Soucek and Jakub Lokoc. Transnet v2: An effective han Zhang, Guanyu Feng, et al. Cogvideox: Text-to-video deep network architecture for fast shot transition detection. diffusion models with an expert transformer. arXiv preprint In Proceedings of the 32nd ACM International Conference arXiv:2408.06072, 2024. 2, 3 on Multimedia, pages 11218–11221, 2024. 6 [44] Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan [32] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, and Bo, and Yunfeng Liu. Roformer: Enhanced transformer with Xingang Pan. StoryMem: Multi-shot long video storytelling rotary position embedding. Neurocomputing, 568:127063, with memory. arXiv preprint, arXiv:2512.19539, 2025. 3 2024. 2, 3, 5 [45] Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, [33] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Fan Wang, Hao Chen, Bo Zhang, and Chunhua Shen. Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Moviedreamer: Hierarchical generation for coherent long vi- Yang, et al. Wan: Open and advanced large-scale video gen- sual sequence. arXiv preprint arXiv:2407.16655, 2024. 2, 3 erative models. arXiv preprint arXiv:2503.20314, 2025. 2, [46] Rui Zhao, Yuchao Gu, Jay Zhangjie Wu, David Jun- 3, 6, 8, 11 hao Zhang, Jia-Wei Liu, Weijia Wu, Jussi Keppo, and [34] Jiahao Wang, Hualian Sheng, Sijia Cai, Weizhan Zhang, Mike Zheng Shou. Motiondirector: Motion customization Caixia Yan, Yachuang Feng, Bing Deng, and Jieping Ye. of text-to-video diffusion models. In European Conference Echoshot: Multi-shot portrait video generation. In The on Computer Vision, pages 273–290. Springer, 2024. 8 Thirty-ninth Annual Conference on Neural Information Pro- [47] Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, cessing Systems, 2025. 2, 3, 5, 6, 7 Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng [35] Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Chen, Harry Yang, et al. Videogen-of-thought: Step-by-step Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, and generating multi-shot video with minimal manual interven- Xu Jia. Multishotmaster: A controllable multi-shot video tion. arXiv preprint arXiv:2412.02259, 2024. 2, 3 generation framework. arXiv preprint arXiv:2512.03041, [48] Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, 2025. 2, 3, 5, 6, 7 Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, and Yang [36] Yi Wang, Yinan He, Yizhuo Li, Kunchang Li, Jiashuo Yu, You. Open-sora: Democratizing efficient video production Xin Ma, Xinhao Li, Guo Chen, Xinyuan Chen, Yaohui for all. arXiv preprint arXiv:2412.20404, 2024. 2 Wang, et al. Internvid: A large-scale video-text dataset for [49] Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi multimodal understanding and generation. arXiv preprint Feng, and Qibin Hou. Storydiffusion: Consistent self- arXiv:2307.06942, 2023. 6 attention for long-range image and video generation. Ad- [37] Zhouxia Wang, Ziyang Yuan, Xintao Wang, Yaowei Li, vances in Neural Information Processing Systems, 37: Tianshui Chen, Menghan Xia, Ping Luo, and Ying Shan. 110315–110340, 2024. 3 Motionctrl: A unified and flexible motion controller for video generation. In ACM SIGGRAPH 2024 Conference Pa- pers, pages 1–11, 2024. 8 [38] Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, et al. Videorope: What makes for good video rotary position embedding? arXiv preprint arXiv:2502.05173, 2025. 2, 3, 5 [39] Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, et al. Hunyuanvideo 1.5 technical report. arXiv preprint arXiv:2511.18870, 2025. 2 [40] Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, and Xinyuan Chen. Cinetrans: Learning to generate videos with cinematic transitions via masked diffusion models. arXiv preprint arXiv:2508.11484, 2025. 2, 3, 5, 6, 7 [41] Junfei Xiao, Ceyuan Yang, Lvmin Zhang, Shengqu Cai, Yang Zhao, Yuwei Guo, Gordon Wetzstein, Maneesh

10

第 11 页

ShotPlan:基于可学习规划令牌的电影级视频生成

补充材料

本补充材料提供了 ShotPlan 的更多细节和结果。第 A 节展示了多镜头电影视频的生成画廊。第 B 节详细介绍了用于时间局部化相机运动实验(主论文第 4.6 节)的相机运动数据集的构建。第 C 节提供了关于规划令牌是否应被加噪并包含在训练损失中的额外消融实验。

A. 生成画廊

图 6 和图 7 展示了由 ShotPlan 生成的多镜头电影视频的生成画廊,说明了在不同镜头之间保持主体身份和场景布局一致性的多样化场景、角色和镜头转场。

B. 相机运动数据构建

为了支持时间局部化的相机运动控制,我们需要训练视频,其中指定的相机运动从已知的中间时间戳开始,而前面的片段保持无该运动。由于自然视频很少提供此类标注,我们按以下方式合成数据。

给定一个源视频,我们首先采样一个随机截断点。截断点之前的片段保持不变,截断点处的帧作为图像到视频(I2V)模型——经过相机运动 LoRA [17] 适配器微调的 Wan2.2 [33]——的条件图像,重新生成视频的剩余部分,使其表现出六种预定义的相机运动之一:左圆、右圆、左移、右移、放大和缩小。然后将原始的前面片段和生成的片段连接起来,产生一个训练样本,其相机运动恰好从截断点开始。

然而,这种简单的连接引入了两种典型的失败模式:(1) 连接边界处可见的接缝,即最后一个原始帧与第一个生成帧之间的时间不连续;(2) 生成片段内的场景一致性下降,因为基于单帧条件的 I2V 生成并不总是保留原始场景内容。因此,我们手动筛选所有连接的视频,并丢弃表现出任一伪影的样本。过滤后,我们为每种相机运动类型获得了大约 6,000 个视频。

C. 对规划令牌加噪的消融实验

在我们的最终设计中,规划令牌在整个训练过程中保持干净:它们既不受扩散噪声的扰动,也不包含在训练损失中。一个自然的担忧是,将干净令牌插入 otherwise 加噪的令牌序列中,使得 DiT 输入不再遵循均匀的噪声分布——序列的一部分被加噪,而另一部分则没有。在实践中,这种设计与流匹配目标 [21] 兼容,因为训练损失仅应用于视频令牌,而规划令牌作为确定性条件锚点。这在概念上与图像条件视频生成 [33] 相关,其中干净的条件潜在变量可以与加噪的视频潜在变量混合。与图像潜在变量不同,我们的规划令牌是编码时间控制信号的抽象可学习令牌。

我们还探索了一种加噪变体,其中规划令牌与视频令牌一起被扰动,并使用前一次迭代的解耦值作为回归目标进行优化,学习率预热为 1,000 步。在这种训练配置下,该变体的收敛速度显著更慢,需要大约 11,000 步才能达到干净令牌设计在 3,500 步内达到的性能。因此,我们采用干净令牌设计,因其简单性和训练效率。

第 12 页

16 26 47 64

23 33 65

14 24 68

14 24 44 67

15 25 45 64

14 24 45 67

24 34 63

17 27 45 66

图 6. ShotPlan 生成画廊。每一行展示了由 ShotPlan 生成的多镜头视频,其中包含用户指定的镜头转场。

12

第 13 页

13 23 45 68

26 36 60

18 28 49 67

23 33 56

17 27 49 68

8 36 59

12 22 43 66

14 24 61 67

图 7. ShotPlan 生成画廊(续)。每一行展示了由 ShotPlan 生成的多镜头视频,其中包含用户指定的镜头转场。

13

发表评论