FilmGPT:用自回归Transformer学习电影剪辑语法

三分钟导读:本文提出FilmGPT,一种通过自回归Transformer学习电影剪辑“语法”的模型,利用显式切分标记和受素材约束的解码算法,从原始素材中自动生成符合电影惯例的连贯视频序列。

英文题目:Autoregressive Modeling of Film with Applications in Video Montage

论文出处:arXiv 每日论文精选 · arXiv:2607.14645

原始论文:PDF / 论文页面

对应视频标题:FilmGPT:用自回归Transformer学习电影剪辑语法|推荐指数:★★★★★

这篇论文解决什么问题?

将大量杂乱、不可观看的原始视频素材转化为连贯且具有电影感的剪辑序列,传统方法依赖手工规则或低层信号,难以捕捉复杂的电影编辑惯例。

核心创新

  • 将视频蒙太奇形式化为离散视频标记上的下一个标记预测问题。
  • 引入显式⟨CUT⟩标记和切分加权交叉熵损失,使模型能联合推理镜头选择和修剪。
  • 设计推理时的素材约束解码算法,确保生成的镜头是输入素材的连续子序列。
  • 利用音频条件(Audio Flamingo 3)增强剪辑节奏和时机判断。

方法概览

提出FilmGPT,一个长上下文自回归Transformer模型。将电影表示为离散视频标记和显式⟨CUT⟩标记的序列。训练时采用滑动窗口注意力、切分加权交叉熵损失以及音频条件约束。推理时使用素材约束解码算法,从输入素材库中选择并修剪片段,确保生成的序列严格来自原始素材。

逐图理解论文

方法:离散标记与自回归框架

方法:离散标记与自回归框架
Fig. 3. Audio conditioning via cross-attention. For the purposes of this visualization, each audio token corresponds to one second and each video token corresponds to 0.25 seconds. Each video token only cross-attends to the audio vectors corresponding to the past and to the current second in time. The ⟨CUT⟩token is shown with red diagonal stripes.

FilmGPT将电影表示为离散视频标记和显式⟨CUT⟩标记的序列。视频帧通过TiTok-L标记器编码为离散token。模型采用长上下文自回归Transformer,通过预测下一个标记来学习剪辑逻辑。这种形式化方法允许模型联合推理镜头选择和修剪,而非简单的检索。

推理:素材约束解码算法

推理:素材约束解码算法
Fig. 6. Samples from our video segment trimming example applica- tion. Grayed out portions on the film strips are segments not selected by our method. The model correctly assigns low probability to segments that do not look cinematic and with erratic movements. Output trimmed videos are provided in the supplementary material.

推理阶段采用素材约束解码算法,确保生成的镜头是输入素材的连续子序列。模型从输入素材库中选择并修剪片段,严格遵循原始素材内容。这一机制避免了生成不存在的画面,保证了输出视频的真实性和可用性。

实验:AVE数据集基准测试

实验:AVE数据集基准测试
Table 1. Ablations on shot sequence ordering. Previous state-of-the-art performance (UQNet [Li et al. 2025]) included for reference. Best perfor- mance in bold. “Acc@1” refers to standard accuracy and “Acc@3” (first reported in UQNet), refers to the likelihood that the correct ordering is included within the top 3 predictions of the model.

在AVE数据集上进行镜头序列排序的基准测试。FilmGPT的Acc@1达到53.9%,显著优于SOTA方法UQNet的35.3%。消融实验显示,引入⟨CUT⟩标记和切分加权损失分别提升了准确率和模型对剪辑点的识别能力。

实验:用户偏好研究

实验:用户偏好研究
Fig. 4. Samples from the three competing methods in our user study. Transcript2Video [Xiong et al. 2022] often suffers from repeated shots. Edit- Duet [Sandoval-Castañeda et al. 2025] shows high bias towards shots of people talking, and shifts between characters doing seemingly unrelated tasks. In contrast, our method sticks to a specific set of characters, and shows clear progression in the task of baking bread across the entire sequence. See the supplementary material for these video outputs. Thumbnails are copyrighted and belong to EditStock.

在EditStock纪录片素材上进行用户偏好研究。FilmGPT以83.07%的偏好率优于Transcript2Video,并显著优于EditDuet的61.49%。用户认为FilmGPT生成的序列更具连贯性和电影感,而基线方法常出现重复镜头或任务切换不连贯。

应用:Stringouts与多机位剪辑

应用:Stringouts与多机位剪辑
Fig. 7. Samples from our stringouts example application. Our method convincingly assembles short sequences of shots that respect simple movie idioms. Output stringout videos are provided in the supplementary material. Thumbnails are copyrighted and belong to EditStock.

模型展示了多种应用场景,包括Stringouts组装、多机位剪辑和人机协作。在Stringouts任务中,模型能自动生成符合电影惯例的短镜头序列。多机位剪辑示例显示,模型能根据音频源和节奏在不同摄像机流之间进行切换。

实验与关键结果

  • 在AVE数据集上进行镜头序列排序的消融实验和基准测试。
  • 在EditStock纪录片素材上进行用户偏好研究,对比Transcript2Video和EditDuet。
  • 展示视频片段修剪、Stringout组装、多机位剪辑和人机协作剪辑等应用场景。
  • AVE数据集Acc@1达到53.9%,优于SOTA方法UQNet (35.3%)(第 7 页)
  • 用户研究中,FilmGPT优于Transcript2Video (83.07%偏好率) 和 EditDuet (61.49%偏好率)(第 7 页)

阅读时需要注意

  • 受限于上下文长度(当前128k token)。
  • 可能在动作相似但内容无关的视频间进行不连贯的“动作匹配”剪辑。
  • 无法直接修改音频,因此无法实现L-cut和J-cut等音频主导的剪辑技巧。
  • 缺乏剧本、分镜等高层语义条件输入。
  • 模型可能通过省略或重新排列素材来误导性地重构语境,存在伦理风险。
  • 旨在辅助而非取代人类编辑,最终编辑意图和事实责任由用户承担。

关联工作

  • Transcript2Video:对比基线,基于文本查询检索素材,常出现重复镜头。(第 3 页)
  • EditDuet:对比基线,基于多Agent系统,偏好人物对话镜头,任务切换不连贯。(第 3 页)
  • UQNet:AVE数据集上的先前SOTA方法,依赖额外人工标注。(第 7 页)
  • TiTok-L:使用的离散图像标记器,将帧编码为32个标记。(第 4 页)
  • Audio Flamingo 3:用于提取音频特征的模型。(第 5 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

使用视频蒙太奇应用进行电影的自回归建模

MARCELO SANDOVAL-CASTAÑEDA, TTI-Chicago, 美国 FABIAN CABA HEILBRON, Adobe, 美国 SHIRY GINOSAR, TTI-Chicago, 美国 BRYAN RUSSELL, Adobe, 美国 JOSEF SIVIC, Adobe, 美国 和 捷克技术大学捷克信息学、机器人学与网络学研究所, 捷克共和国 ALEXEI EFROS, UC Berkeley, 美国 GREGORY SHAKHNAROVICH, TTI-Chicago, 美国

https://mudtriangle.com/filmgpt

输入素材 输出视频

建立序列 动作剪辑 视点镜头2026 7月 FilmGPT 16 图 1. 从原始素材到具有涌现习语的编辑视频。我们的系统以原始素材集合为输入,通常长达数百分钟。 我们的自回归模型 FilmGPT 从该集合中选择、修剪并组装视频,形成合理的镜头序列。我们发现这种方法 产生的编辑序列中,标准的电影剪辑习语,如建立序列、动作剪辑和视点镜头,自然涌现。 缩略图受版权保护,归 EditStock 所有。

这项工作介绍了 FilmGPT,这是一种自回归 Transformer,旨在解决视频蒙太奇的挑战——将一堆原始的、“不可观看”的 素材转化为连贯的电影序列。受现代大语言模型(LLMs)中语言学习的启发,我们在大型电影语料库上训练了一个长上下文自回归 Transformer。目的是直接从数据中而非从手工编码的规则中隐式地捕捉电影的“语法”。 与其他生成模型不同,FilmGPT 不生成任何新的视频帧。相反,在推理时,我们引入了一种素材约束解码 算法,根据从电影中学习到的统计模式,从输入的原始素材中选择最佳下一个镜头。我们首先通过在标准的镜头序列排序基准测试上使用 FilmGPT 自回归模型进行下一个镜头预测,直接评估这些学习到的统计信息, 从而超越之前的最先进水平。然后,我们通过用户研究在完整的电影编辑任务上评估我们的素材约束解码算法, 发现基于 FilmGPT 的编辑显著优于以前的方法。最后,我们展示了 FilmGPT 在视频蒙太奇各种应用中的适用性,从自动视频片段修剪到人在回路中的电影编辑。请参阅我们的补充材料以获取定性结果。 CCS 概念:• 应用计算 → 媒体艺术。 其他关键词和短语:视频编辑 ACM 引用格式: Marcelo Sandoval-Castañeda, Fabian Caba Heilbron, Shiry Ginosar, Bryan Russell, Josef Sivic, Alexei Efros, 和 Gregory Shakhnarovich。2026。使用视频蒙太奇应用进行电影的自回归建模。在计算机图形学和交互技术特别兴趣组会议论文集(SIGGRAPH Conference Papers ’26),2026年7月19–23日,美国加利福尼亚州洛杉矶。ACM,纽约,纽约州,美国,11页。https: //doi.org/10.1145/3799902.3811220 作者联系方式:Marcelo Sandoval-Castañeda, marcelo@ttic.edu, TTI- Chicago, 美国;Fabian Caba Heilbron, Adobe, 美国, caba@adobe.com;Shiry Ginosar, TTI-Chicago, 美国, shiry@ttic.edu;Bryan Russell, Adobe, 美国, brussell@adobe.com; Josef Sivic, Adobe, 美国;, 捷克信息学、机器人学与网络学研究所, 捷克技术大学, 捷克共和国, inr03127@adobe.com;Alexei Efros, UC Berkeley, 美国, aaefros@berkeley.edu;Gregory Shakhnarovich, TTI-Chicago, 美国, greg@ttic.edu.arXiv:2607.14645v1 1 引言 视频制作和电影制作曾经属于大型团队、 专用设备和高昂预算。在过去二十年中,这一壁垒已经崩溃。数码相机——然后是 智能手机——使拍摄变得廉价、便携且几乎毫不费力。 婚礼、生日、学校戏剧、露营旅行和日常生活

SIGGRAPH Conference Papers ’26,2026年7月19–23日,美国加利福尼亚州洛杉矶。

第 2 页

2 • Sandoval-Castañeda 等人

现在,时刻通常会被多人同时记录。结果导致原始视频空前丰富:单个事件可能拥有数小时,甚至数十小时的素材。

然而,这些素材中的绝大多数从未被观看。原因很简单,且电影制作者对此心知肚明:原始素材大多不可观看。摄像机录制时间过长,画面“漂移”,且时刻重复。剪辑——即视频蒙太奇,指镜头的选择、修剪和排序,而非像素级修改——正是将这种杂乱无章的材料转化为连贯且引人入胜内容的过程。在专业电影制作中,剪辑通常会丢弃绝大部分拍摄素材——拍摄比例通常在 1:100 左右——只留下精心编排的镜头序列。这一观察结果并非新鲜事。事实上,奥逊·威尔斯(Orson Welles)曾说道:“电影的独特魅力正是在剪辑室中构建出来的。” [Bazin 等人 1958]

重要的是,剪辑并非一种随意的或纯粹直觉的过程。它是一门拥有明确词汇表和习得“语法”的手艺。电影学校和教科书对电影剪辑习语投入了大量关注,例如连续性剪辑、动作中剪辑、镜头-反打镜头模式、匹配剪辑、节奏和视觉韵律 [Arijon 1991; Katz 1991]。这些惯例之所以被教授,是因为它们行之有效:当熟练运用时,它们使剪辑显得“无形”,在保持连贯性的同时引导观众,而不引起对剪辑行为本身的注意。同时,任何经验丰富的剪辑师都知道,这些规则是灵活的,经常会被打破,有时甚至为了素材本身而被违反。这种结构化原则与情境判断相结合,使得剪辑既强大又难以形式化。

将剪辑技术视为在多个抽象层级上运作是有用的。在最底层是镜头质量决策:移除技术上有缺陷的素材、修剪不可用的片段,并确保单个镜头符合基本的视觉标准。在中层是使序列连贯的结构决策:连续性剪辑、动作中剪辑、尊重屏幕方向、组装常见模式(如镜头-反打镜头或建立序列),以及控制节奏。在最顶层是叙事和主题决策——场景的主题、所服务的情感弧线,以及序列在整个电影中的相互关系。我们的工作集中在低层和中层抽象上。

这些抽象难以显式编码和自动化。剪辑的“语法”不是一组可以清晰编程的僵化规则:惯例经常被故意违反,情境至关重要,且可接受的剪辑并非唯一。随着素材长度的增加,可能剪辑的组合空间呈爆炸式增长,使得穷举搜索不可行。此外,许多中层技术,如对话镜头-反打镜头¹,需要在超出单个帧或短片段的时间窗口内进行推理。这种推理对于决定选择哪些镜头以及在动作的何处放置剪辑至关重要,包括识别不同镜头中的对应时刻。因此,先前的自动化编辑系统主要依赖运动或显著性等低级信号,产生的结果虽然以高光驱动为主,但往往脆弱 [Gygli 等人 2016; Xiong 等人 2019]。

我们的方法采取了一条不同的路径。我们做出了以下技术贡献:(1) 我们将计算视频蒙太奇任务框架化为离散视频标记上的下一个标记预测问题。我们提出了一种长上下文自回归模型(命名为 FilmGPT,如图 1 所示),可选择性地以音频为条件,预测对应于从原始素材库中提取的帧的标记序列。这种表述允许模型直接从数据中学习电影剪辑的“语法”,而不是通过手工编码的规则,同时严格基于现有的视觉材料进行操作。(2) 我们通过引入显式的 ⟨CUT⟩ 标记和修改后的交叉熵目标,使编辑成为视频建模中的一等公民,使模型能够联合推理镜头选择和修剪。(3) 我们设计了一种推理时的素材约束解码算法,将学习到的模型应用于将原始素材组装成遵循标准电影剪辑惯例的编辑视频序列。(4) 我们通过定性和定量评估展示了我们方法的有效性,主要关注那些剪辑惯例表达清晰且评估更受控的专业级素材。这包括一项用户研究,显示人类偏好强烈优于先前的自动化编辑方法,以及在 AVE [Argaw 等人 2022] 镜头序列排序基准上达到最先进的性能。最后,我们展示了该模型在多机位剪辑和 Stringouts 组装等专业应用中的多功能性。

2 相关工作

2.1 电影剪辑习语的计算模型

电影习语是镜头(长电影中由两个剪辑界定的视频子片段)被排序以传达意义的底层结构单元 [Metz 1992]。人们曾有许多尝试从计算角度理解和应用电影习语。早期工作显式地形式化习语:用于电影编辑的分层专家系统 [Karp 和 Feiner 1993]、用于相机控制的声明式编程语言 [Christianson 等人 1996],以及有限状态机 [He 等人 1996]。后续工作将电影编辑过程分解为一系列使用这些形式化方法迭代执行的动作 [Jhala 和 Young 2005]。电影编辑任务也可以建模为图上的路径寻找问题,其中节点是子片段,边的成本是基于习语和其他约束的手工设计函数获得的 [Lino 等人 2011]。其他方法旨在开发查询和类查询语言,用以描述单个镜头的电影摄影属性 [Ronfard 等人 2015]、风格模式和约束 [Wu 和 Christie 2016],或两者兼有 [Wu 等人 2018]。第一种直接从数据中学习电影剪辑模式的方法使用了隐马尔可夫模型(HMM),并依赖于对电影摄影数据的手动注释 [Merabti 等人 2016]。一种竞争方法表明,遵循习语列表手工设计 HMM 参数,能够在无需昂贵注释的情况下产生更高质量的剪辑 [Leake 等人 2017]。

最近,Argaw 等人 [2024] 提出了预告片生成 Transformer(TGT),这是一种用于将镜头排序到电影预告片中的编码器-解码器 Transformer。TGT 将电影表示为镜头嵌入(例如 CLIP 特征)的序列,并从精心策划的数据中学习。

¹ 对话镜头-反打镜头是一种剪辑技术,通过在人物的说话和反应镜头之间来回切换来描绘两个角色之间的对话。

SIGGRAPH 会议论文 '26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 3 页

使用电影进行自回归建模及其在视频蒙太奇中的应用 • 3

下一个Token预测训练 使用素材约束解码进行推理

… FilmGPT

素材约束解码 素材约束解码 素材约束解码 解码 解码 解码 ⟨CUT⟩ Token ⟨CUT⟩ Token AF3 TiTok-L TiTok-L TiTok-L FilmGPT

编辑后的镜头

图 2. 我们的计算视频蒙太奇框架概述。(左)在训练期间,FilmGPT 通过下一个 token 预测从电影中学习。给定一个编辑后的视频,每一帧都使用 TiTok-L [Yu et al. 2024] 单独进行 token 化,并在每个镜头的边界处添加额外的 ⟨CUT⟩ token。为了便于可视化,每一帧被 token 化为单个 token。在实际实现中,每一帧被 token 化为 32 个 token 的序列。属于同一镜头的 token 显示为相同的颜色。⟨CUT⟩ token 以红色斜线显示。然后,FilmGPT 作为自回归模型进行训练,使用下一个 token 预测,并采用交错的多头注意力层来关注由 Audio Flamingo 3 [Goel et al. 2025] 生成的音频特征。(右)在推理阶段,我们使用素材约束解码算法生成编辑后的视频序列。在每一步中,采样算法从视频集合 V 中选择并裁剪一个新的镜头,然后将其附加到原始上下文中以选择紧随其后的镜头。重复此过程,直到达到所需的镜头数量(或持续时间)。缩略图受版权保护,属于 EditStock。

电影预告片对,以自回归方式生成预告片镜头序列。我们的方法在精神上与 TGT 相似——都将编辑视为序列建模——但在目标和监督方面存在差异。我们直接将电影建模为序列,而不是组装预告片,因此不需要对齐的电影-预告片对。此外,TGT 在固定大小的镜头上运行,而我们的模型在帧级别运行,并使用显式的切分操作,采用仅解码器的自回归 (AR) Transformer 和离散图像标记器。这也让人联想到 Merabti 等人 [2016] 的工作,该工作需要手动注释。相比之下,我们的监督信号简化为镜头边界,这可以通过现成的检测器(如 TransNet V2 [Souček and Lokoč 2024])可靠地获得。

最后,我们的公式也受到经典视频纹理工作 [Schödl et al. 2000] 的启发。视频纹理解决了一个互补的问题,即从短片段合成任意长、视觉上连贯的序列。它将视频纹理表示为马尔可夫链,其中每个状态是一帧,转移概率由帧相似度推导得出。然后,通过遍历这个转移图,根据转移概率选择下一帧来进行合成。我们采用了类似的顺序生成视角,但用于编辑:FilmGPT 预测下一个离散视觉 token,并使用显式的切分 token 来决定何时切分。

然而,在第 4.1 节中,我们展示了 FilmGPT 可以包装一个语言接口,以便与先前的语言驱动编辑系统进行直接比较。给定用户请求,LLM 会从素材中提出一组候选镜头,FilmGPT 通过选择、裁剪、切分和安排最终序列的节奏,将这些镜头转化为编辑结果。这将低层和中层编辑问题隔离开来,同时保持叙事意图在语言空间中。

2.2 计算视频蒙太奇的高级方法

许多系统已被提出以解决电影编辑中的特定子任务。其中一些包括预测采访中的切分 [Berthouzoz et al. 2012] 以组装故事,编辑音乐表演 [Lee et al. 2022],从广角镜头中进行基于注视的编辑 [Moorthy et al. 2020],或确定固定并传递给模型的片段之间的转换 [Guhan et al. 2025; Shen et al. 2022]。此外,还有解决允许使用 AI 系统进行交互式视频编辑的用户界面开发的工作 [Huber et al. 2019; Huh et al. 2023; Tilekbay et al. 2024; Wang et al. 2024a,b]。

其他最近的方法利用预训练语言模型从现有素材中生成电影。这些方法的目标是通过使用自然语言实现细粒度的用户控制。例如,Transcript2Video [Xiong et al. 2022] 接收文本查询,并在联合文本-图像嵌入空间中检索与文本查询最相似的素材。TimelineAssembler [Pardo et al. 2024] 需要显式编辑操作的文本提示来执行,例如“交换前两个镜头的顺序”,并对输出结果编辑视频的语言模型进行微调。最后,EditDuet [Sandoval-Castañeda et al. 2025] 将视频编辑任务建模为两个基于 LLM 的代理之间的交互,旨在满足用自然语言表达的高级用户请求。

我们的工作针对的抽象层次与这些语言驱动的编辑系统不同。Transcript2Video、TimelineAssembler 和 EditDuet 关注高层意图和用户控制。它们使用语言来决定包含什么以及如何更改时间线。我们的 FilmGPT 不对自然语言进行推理。它建模低层和中层编辑层:选择并裁剪素材,放置切分,并根据视听线索塑造局部连贯性。

第 4 页

4 • Sandoval-Castañeda et al.

3 计算视频蒙太奇框架

我们的目标是开发一个系统,该系统给定一组原始素材即可输出视频蒙太奇。此类系统必须做出一系列剪辑决策——选择镜头、放置切分以修剪它们,并将修剪后的镜头排序为连贯的序列。我们的关键见解是,虽然原始素材是非结构化的,但电影表现出支配这些决策的重复模式。这些模式对应于常见的电影惯例 [Arijon 1991; Metz 1992]。通过在电影上训练自回归模型,我们可以从数据中学习这些模式,并利用它们将原始素材组装成连贯的视频蒙太奇。

我们通过将电影表示为帧序列和显式的切分事件来形式化这一想法,这些事件编码为离散标记,并与特殊的 ⟨CUT⟩ 标记交错。令 $x = (x_1, \dots, x_T)$ 表示该序列,其中每个 $x_t$ 取自离散词汇表。在实践中,每个视频帧被编码为一组短标记序列(在我们的实现中为 32 个),我们在镜头之间插入单个 ⟨CUT⟩ 标记。

我们建模专业编辑视频序列的联合概率分布 $p(x)$,并对其进行自回归分解:

$$ p(x) = \prod_{t=1}^{T} p(x_t | x_1, \dots, x_{t-1}). \quad (1) $$

这种公式将编辑视为帧和切分的因果下一个标记预测,直接类比于语言建模。与标准语言生成中标记序列可以是任意不同,编辑必须受限于素材集合。在我们的公式中,这意味着我们不能自由地从词汇表中生成标记。相反,我们在严格的素材约束下进行解码:在 ⟨CUT⟩ 标记之间,视觉标记必须对应于原始输入视频集合中存在的连续子序列。

因此,我们的框架由两个主要组件组成,如图 2 所示:

1. 一个自回归模型 FilmGPT,它从专业电影中学习帧和切分标记序列的联合分布 $p(x)$(第 3.1 节)。 2. 一个推理时的素材约束解码算法,它在确保每个镜头都是素材集合中的连续片段的同时,找到似然最高的编辑(第 3.2 节)。

3.1 FilmGPT:电影的自回归建模

我们现在描述用于对电影进行建模的 FilmGPT 实例化。

3.1.1 编辑视频的离散标记化

为了构建 FilmGPT,我们将电影表示为单个离散标记序列 $x = (x_1, \dots, x_T)$,其中帧标记和切分标记交错。我们使用 TiTok-L [Yu et al. 2024] 将每个帧编码为来自 4096 标记词汇表的 32 个离散标记。我们选择这种方法是因为它是一维标记序列,与其他离散标记器相比产生的序列较短,并且经验上足以提供重建质量。有关 TiTok-L 在我们数据上重建的定性示例,请参阅补充材料。由于我们的目标是建模电影制作选择,我们还用 ⟨CUT⟩ 标记显式表示每个“切分”(即从连续摄像机流切换到下一个流,在长视频中)。这使得切分放置成为模型可以学习预测的一等事件。最后,我们在序列开头和结尾添加开始和结束序列标记。

3.1.2 带长上下文的自回归 Transformer

给定上述定义的离散标记序列 $x$,FilmGPT 使用仅解码器的自回归 Transformer 参数化条件分布 $p(x_t | x_{<t})$,该 Transformer 针对下一个标记预测进行训练。由于上述标记化过程在 AVE 数据集 [Argaw et al. 2022] 的单个视频中产生平均长度为 102k 个标记,由于自注意力在序列长度上的二次复杂度,直接应用全自注意力成本高昂。同时,剪辑决策既需要时间细粒度的线索,也需要长程上下文,因此截断或下采样这种上下文将是有害的。

为了使长上下文建模可行,我们采用滑动窗口注意力 [Beltagy et al. 2020],它将自注意力成本从 $O(n^2)$ 降低到 $O(nw)$,其中 $n$ 是序列长度,$w$ 是滑动窗口大小。16k 标记的窗口大小使我们的模型能够以 128k 标记的上下文进行训练。忽略切分标记,每帧 32 个标记,这大致相当于 4000 帧,或者以每秒 24 帧计算,超过 2.5 分钟的视频。相比之下,AVE 数据集 [Argaw et al. 2022] 中的镜头序列平均长度为 2.25 分钟,而教学电影制作书籍指出场景的最大建议持续时间为 3 分钟。有关模型和训练的更多详细信息,请参阅补充材料。

3.1.3 切分加权交叉熵损失

训练序列很长且包含的切分很少:平均而言,从典型电影场景中提取的 128k 标记序列仅包含 34 个 ⟨CUT⟩ 标记。因此,使用标准交叉熵损失进行训练会鼓励模型将其大部分容量用于预测镜头内的下一个标记,而不是学习何时切分以及哪个镜头应该跟随。对于我们的任务,这些切分决策是主要的建模目标。因此,我们修改了语言建模中使用的标准交叉熵损失,引入位置相关的权重,以提高切分标记和切分后短序列的权重。形式上,$x_i$ 表示位置 $i$ 处的真实标记,$\hat{p}_i$ 表示模型对标记词汇表的预测分布,使得:

$$ \ell_i = \delta_i \cdot CE(x_i, \hat{p}_i), \quad (2) $$

其中 $CE(\cdot, \cdot)$ 是标准交叉熵损失,$w$ 是赋予切分标记的最大权重,$d_{cut_i}$ 表示从位置 $i$ 到最近的前一个 ⟨CUT⟩ 标记的距离,如果位置 $i$ 处的标记本身是切分,则为零。这确保了当目标是 ⟨CUT⟩ 标记时损失权重较大,并且在跟随的小窗口 $w$ 个标记后迅速衰减回标准交叉熵。我们经验性地设置 $w = 32$,与对应单个帧的标记数量相匹配。

3.1.4 音频条件

电影剪辑决策通常由声音线索驱动,尤其是对于节奏和切分时机。因此,我们

第 5 页

使用视频蒙太奇应用的电影自回归建模 • 5

视频标记 时间 算法 1 素材约束解码算法 输入: 模型 M, 视频集合 V, 初始序列 𝑠, 束宽 音频向量 时间感知交叉注意力 𝑘, 最大镜头数 𝑁shots, 最大标记数 𝑁tokens 输出: 编辑后的标记序列 𝑠 时间 1: 函数 GenerateVideo(M, V,𝑠,𝑘, 𝑁shots, 𝑁tokens) 2: 𝑐shots ←0 3: 当 𝑐shots < 𝑁shots 且 length(𝑠) < 𝑁tokens 时执行 // 步骤 1: 生成唯一候选项 图 3. 通过交叉注意力进行音频条件控制。出于可视化目的,每个音频标记对应一秒,每个视频 标记对应 0.25 秒。每个视频标记仅对过去和当前秒对应的音频向量进行交叉注意力。⟨CUT⟩ 标记以红色对角线条纹显示。 4: 𝐴←ConstrainedBeamSearch(M, V,𝑠,𝑘) 5: 如果 𝐴= ∅则中断 6: 𝑠best ←null, 𝐿best ←∞, 𝑣best ←null 此外,我们在训练期间还利用编辑序列的音频特征对模型进行条件控制。我们使用 // 步骤 2: 找到每个候选项的最佳长度 Audio Flamingo 3 [Goel et al. 2025] 提取音频表示,然后将其平均池化为每秒一个 7: 对于每个视频-位置对 (𝑣, 𝑝) ∈𝐴执行 特征向量以提高效率。在训练期间,我们以 0.4 的概率丢弃音频特征,以防止模型过度 8: 𝐹←ExtractTokens(V, 𝑣, 𝑝) 依赖音频。 9: 𝑠cut, 𝐿cut ←FindCut(M,𝑠, 𝐹) // 步骤 3: 确定下一个镜头 音频特征通过自注意力块与交叉注意力块交错的方式引入我们的自回归模型, 10: 如果 𝐿cut < 𝐿best 则执行 其中键和值来自音频特征 [Dong et al. 2018]。 11: 𝐿best ←𝐿cut, 𝑠best ←𝑠cut, 𝑣best ←𝑣 由于下一个镜头的音频可能会影响当前视觉内容,序列中的给定标记仅允许 12: 结束如果 关注对应于当前秒的向量以及过去所有向量的音频特征,而不能关注未来。 13: 结束循环 切分始终关注与紧接其前的标记相同的音频向量。我们的音频条件控制如图 3 14: 如果 𝑠best = null 则中断 所示。 15: 𝑠←Concat(𝑠,𝑠best) 16: 𝑐shots ←𝑐shots + 1 3.2 素材约束解码算法 17: 结束循环 给定我们训练好的自回归模型,我们旨在编辑来自任何时长的视频集合的原始 18: 返回 𝑠 素材。这项任务具有挑战性,因为从集合中选择和修剪素材存在组合可能 19: 结束函数 性。我们受到约束生成方法的启发,这些方法使用束搜索 [Hokamp and Liu 2017] 一次输出一个标记序列。然而,这些工作通常在允许的规则集之后对模型进行 20: 函数 ConstrainedBeamSearch(M, V,𝑠,𝑘) 采样,而我们需要确保所选子序列受限于视频集合,并且所选镜头用 ⟨CUT⟩ 21: 𝐵←{𝑠} // 初始化束 标记分隔。我们通过使用素材约束生成方法来解决这个问题。令 V 为原始 22: 当 并非 AllCandidatesUnique(𝐵, V) 时执行 素材的标记化视频集合,由不同长度的视频组成。我们在由集合 V 中的子序列 23: 𝐵next ←∅ 组装的可能编辑视频空间上执行束搜索。 24: 对于每个候选项 𝑐∈𝐵执行 我们从一个要扩展的标记序列 𝑠开始。在编辑选择过程的给定步骤中, 25: 𝑃←NextTokenProbabilities(M,𝑐) 我们维护一个大小为 𝑘的束,包含给定长度(例如 𝑚个标记)的候选扩展项。 26: 𝑇valid ←GetValidNextTokens(V,𝑐) 关键在于,我们强制执行严格的子序列约束:每个生成的标记前缀必须与 27: 𝑃←MaskInvalidTokens(𝑃,𝑇valid) V 中至少一个视频中的连续标记跨度匹配。算法按以下三个步骤进行(详细 28: 𝑇top_k ←GetTopK(𝑃,𝑘) 信息见补充材料)。 29: 对于每个标记 𝑡∈𝑇top_k 执行 30: 𝐵next ←𝐵next ∪{Concat(𝑐,𝑡)} 3.2.1 步骤 1:生成唯一候选项。我们从空的候选序列开始,一次扩展一个 31: 结束循环 标记,每次 32: 结束循环 33: 𝐵←PruneToTopK(𝐵next,𝑘) 34: 结束循环 35: 返回 GetVideoPositions(V, 𝐵) 36: 结束函数 37: 函数 FindCut(M,𝑠base, 𝐹) 38: 𝐼valid ←TokensPerFrame(𝐹) // TiTok-L 中每帧 32 个标记 // 计算所有有效前缀的每标记 NLL 39: 𝐿array ←PrefixCutNLL(M,𝑠base, 𝐹, 𝐼valid) 40: 𝑖opt ←arg min𝑖∈𝐼valid 𝐿array[𝑖] 41: 𝑠best_cut ←Concat(𝐹[0 : 𝑖opt], ⟨CUT⟩) 42: 返回 𝑠best_cut, 𝐿array[𝑖opt] 43: 结束函数

SIGGRAPH 会议论文 ’26,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 6 页

6 • Sandoval-Castañeda et al.

Transcript2Video [Xiong et al. 2022]

EditDuet [Sandoval-Castañeda et al. 2025]

FilmGPT (Ours)

图 4. 我们用户研究中三种竞争方法的样本。Transcript2Video [Xiong et al. 2022] 经常遭受镜头重复的问题。EditDuet [Sandoval-Castañeda et al. 2025] 显示出对人物对话镜头的高偏差,并在看似无关任务的人物之间切换。相比之下,我们的方法坚持使用特定的一组人物,并在整个序列中展示了制作面包任务的清晰进展。这些视频输出请参阅补充材料。缩略图受版权保护,属于 EditStock。

在子序列约束下保留 𝑘 个有效候选项。由于每帧由 32 个离散标记表示,短前缀(例如前 1–3 个标记)可能与视频 V 中的多个帧匹配。因此,我们继续扩展每个候选项,直到它在 V 中具有唯一的锚点,即它匹配单个帧出现(在特定视频和位置)。在实践中,这需要少于 32 个标记。

3.2.2 步骤 2:确定每个候选项的最佳长度。我们通过向关联视频集合 V 中的后续视频添加不同数量的帧来扩展每个候选项,最多 10 秒,并选择扩展后的项,该扩展项在附加切分标记后,在模型下具有最高的每标记似然值。这在 FilmGPT 中可以高效完成,为所有可能的长度并行计算似然值。

3.2.3 步骤 3:确定下一个镜头。步骤 2 产生了 𝑘 个扩展序列 𝑠 的候选镜头,这些镜头可能具有不同的长度。我们根据它们的每标记似然值成比例地采样其中一个,或者(如果进行贪婪解码)选择似然值最高的一个。在我们的实验中,我们使用贪婪解码。

请注意,可以通过例如从视频集合 V 中移除序列 𝑠 中已存在的帧序列来进一步限制该过程。我们在实验中没有这样做,并观察到模型自然地避免了此类重复选择。

此过程的每一轮都会产生新的扩展序列 𝑠,然后将其作为输入反馈给模型以进行进一步扩展,如图 2(右侧)所示。这导致我们的模型生成完整的编辑序列。该算法有多个可能的停止条件,具体取决于应用程序:序列中所需的镜头数量、序列的所需持续时间、从 V 中选择的 distinct 源视频数量等。完整伪代码见算法 1。

4 结果

我们使用来自多个来源的编辑视频序列训练 FilmGPT:AVE 数据集 [Argaw et al. 2022]、美国公有领域的电影、在线可用的苏联莫斯科电影制片厂的电影,以及具有宽松知识共享许可的长纪录片,总计 6200 小时的训练素材。AVE 数据集将场景分割为镜头。对于其他电影,我们使用现成的镜头变化检测器 [Souček and Lokoč 2024]。

4.1 用户研究:B-roll 纪录片编辑

我们使用 EditDuet [Sandoval-Castañeda et al. 2025] 提出的 EditStock [EditStock 2025] 评估设置进行了用户研究。这是一种强制选择偏好评估,我们要求参与者比较我们的模型样本与基线样本的编辑质量,这些样本使用相同的原始素材。这些样本来自纪录片,其中每个模型的任务是从固定的 A-roll 序列开始组装 B-roll 序列。A-roll 指旁白或对着镜头采访的素材,B-roll 指辅助叙事的补充视觉画面。这是纪录片制作中的标准任务,编辑首先组装 A-roll,然后处理相应的 B-roll。

遵循 EditDuet 的做法,我们向参与者展示两个视频及其相应的音轨,并询问他们“两个视频序列中哪一个编辑得更好?”以评估总体偏好。

我们将我们算法的结果与 Transcript2Video [Xiong et al. 2022] 和 EditDuet [Sandoval-Castañeda et al. 2025] 的结果进行比较。我们在 Prolific 平台上进行了这项研究,共有 83 名参与者,总计 1242 个数据点。图 4 显示了用户研究中每种方法的一个编辑视频样本。

由于我们的模型原生不支持文本指令,我们调整了我们的素材约束解码算法(第 3.2 节)并包含一个大语言模型(LLM)规划器。我们使用相同的 LLM

SIGGRAPH Conference Papers ’26, July 19–23, 2026, Los Angeles, CA, USA.

第 7 页

使用电影自回归建模进行视频蒙太奇应用 • 7

Q: 哪两个视频序列的剪辑更好? FilmGPT 其他 表 1. 镜头序列排序的消融实验。包含用于参考的先前最先进 83.07% 16.93% T2V 性能(UQNet [Li et al. 2025])。最佳性能以粗体显示。“Acc@1” 61.49% 38.51% EditDuet 指标准准确率,“Acc@3”(首次在 UQNet 中报告)指正确排序 包含在模型的前 3 个预测中的概率。 图 5. 我们用户研究中的参与者偏好结果。我们将 我们的模型与 T2V [Xiong et al. 2022] 和 EditDuet [Sandoval-Castañeda et al. 2025] 进行比较。所有结果的 𝑝< 0.001。我们的方法优于 在参与者偏好方面,我们的方法优于竞争方法。 模型 Acc@1 Δ Acc@3 Δ UQNet [Li et al. 2025] 35.3 — 69.8 —

基础 AR Transformer 25.3 — 57.1 — 正如 EditDuet (Llama-3.1-8B-Instruct [Dubey et al. 2024]) 中所示。 + ⟨CUT⟩Token 29.7 + 4.4 67.3 +10.2 LLM 接收一个 JSON 文件,其中包含原始素材中每个视频的高级描述,以及来自 EditDuet 用户研究的纯文本指令。指令是对 B-roll 序列的高级描述,以及所需的持续时间。LLM 然后将指令分解为每个 B-roll 序列的视觉组件描述,例如,“揉面的老妇人的特写镜头,穿插着她烘焙时的面部特写。以烤箱设置过程的快节奏镜头结束”变为“手部特写”、“老妇人面部”、“老妇人打开烤箱”等。然后,我们通过计算原始素材关键帧与 CLIP [Radford et al. 2021] 相似度来约束我们的视频集合,以匹配这些描述。前 50 个视频匹配成为我们的模型在编辑过程中采样的缩减视频集合。此过程是我们模型在组装这些序列时接收到的唯一形式的外部条件。 如图 5 所示,我们的方法比我们要比较的两种方法更受参与者青睐。与 Tran-script2Video 相比,用户有 83.07% 的时间更喜欢我们的方法。与 EditDuet 相比,我们的方法有 61.49% 的时间更受青睐。尽管依赖与 EditDuet 相同的 LLM 进行故事生成,但我们的方法的编辑优于 EditDuet,无需多次 LLM 调用、迭代或探索。此外,EditDuet 依赖使用 TW-FINCH [Sarfraz et al. 2021] 对视频进行预分割,而我们的方法可以隐式地执行此任务。

4.2 消融实验:镜头序列排序 我们的所有消融实验均使用固定的计算预算进行训练。基础 AR Transformer 的训练、⟨CUT⟩token 的添加、切分加权交叉熵损失的添加以及 128k 上下文,每个都消耗 131.4 EFLOPs,这些模型的推理成本为每个 token 0.07 GFLOPs。我们的音频条件模型和额外数据需要 239.7 EFLOPs 进行训练,每个 token 0.13 GFLOPs。 表 1 显示了我们在镜头序列排序上的消融实验结果。 我们从没有 ⟨CUT⟩token 且最大上下文长度为 16k token 的基础自回归 (AR) Transformer 开始,使用全注意力且无音频条件。我们仅在 AVE 上对其进行训练,准确率为 25.3%。用单个 token 显式表示每个切分带来了准确率的显著提升,达到 29.7%。接下来,使用我们的切分加权交叉熵损失训练模型,该损失迫使模型优先考虑序列中的切分部分而非其他部分,准确率提高至 34.5%。作为比较,我们评估了一个仅在每帧的最终 token 和 ⟨CUT⟩token 处计算的替代目标;然而,这产生的准确率为 19.2%,因此我们将其丢弃。下一步是使用滑动窗口注意力扩展我们自回归 Transformer 的上下文,使其上下文可扩展至 128k token。在此步骤中,我们开始将我们正在尝试排序的序列的上下文纳入输入。例如,视频 𝑠由 𝑡个镜头 𝑠0,𝑠1, . . . ,𝑠𝑡−2,𝑠𝑡−1 组成。任务是对镜头 𝑠𝑡−3,𝑠𝑡−2,𝑠𝑡−1 进行排序。我们的模型现在可以接收 𝑠0,𝑠1, . . . ,𝑠𝑡−4 作为上下文来执行此任务。这既更接近真实的编辑任务,也是一种包含先前方法无法纳入的额外信息的方式。加入这些内容后,准确率跃升至 44.5%,表明在编辑中访问更大上下文的重要性。 添加音频条件也显著提高了准确率,达到 50.5%。上下文中的音频按原样包含,而待排序序列中的音频被置换以与六种可能的视频顺序对齐。最后,我们在 AVE 之上添加我们的大型电影集合进行训练。这将准确率推高至最终的 53.9%,比先前的最先进方法 UQNet [Li et al. 2025] 提高了整整 18.6 个百分点。请注意,UQNet 利用了额外的人工标签(镜头大小、相机角度、运动、类型)。尽管不使用此类注释,我们的模型直接从数据中学习,并使用 preceding context 隐式捕捉节奏、节奏感和电影语言。我们在进行消融实验时使用标准的 AVE [Argaw et al. 2022] 镜头序列排序任务作为性能指标。任务如下:给定来自场景的三个连续镜头 𝑠0, 𝑠1 和 𝑠2,模型应确定 𝑠0, 𝑠1 和 𝑠2 的正确排序。使用我们的自回归模型,我们计算六种可能排序中每一种的概率,并返回概率最高的排序。

5 视频蒙太奇中的应用 我们的模型支持一系列现实世界的视频编辑应用。我们直接使用 FilmGPT,并在所有任务中应用相同的约束编辑算法,仅进行微小的约束调整。我们展示了四种应用,从低复杂度到中复杂度。

5.1 视频片段修剪 在拍摄电影时,视频通常以不打算用于最终产品的素材开始和结束。例如,在剧本虚构电影中,这包括电影制作过程的元素,如场记板、相机进出位置以及其他

第 8 页

8 • Sandoval-Castañeda et al.

直接从原始素材中抽取片段,然后根据需要进行进一步编辑。 我们的方法能够根据视频集合和空的初始序列生成连贯的短镜头序列(stringouts)。我们直接在整个原始素材集合上应用我们的编辑算法, 并简单地让它从任何给定的文件中抽取视频序列。由于没有现有的序列提供节奏或内容的条件信号,我们的方法默认生成高概率的序列,这些序列通常遵循电影剪辑惯例。尽管这一特性也出现在其他编辑任务中,但我们发现以这种方式组装连贯短镜头序列显著增加了可识别电影习语(film idioms)的频率和多样性。 图7和补充材料提供了使用EditStock纪录片素材的示例。示例的输入是每个项目的原始素材(每秒23.976帧,数百分钟)。我们的方法能够基于电影习语组装合理的连贯短镜头序列——如动作剪辑、建立镜头序列和视点镜头,这些是电影中广泛使用的基本构建块。

(b) 正面跟踪特写镜头。我们的方法丢弃了前几帧中几乎没有任何内容的部分,并在女性开始行走时开始序列。我们的方法在女性走出画面之前进行剪辑。

图6. 我们视频片段修剪示例应用程序的样本。胶片条带上的灰色部分是我们方法未选择的片段。模型正确地将低概率分配给看起来不具电影感且运动 erratic 的片段。输出修剪后的视频在补充材料中提供。

场景的一般设置。视频编辑中的一个低级任务是在每个视频中找到不包含此类元素的片段。 我们的编辑算法可以直接应用于此任务。在此应用中,“视频集合”就是手头的单个视频。我们希望模型识别出视频中具有最高似然值的连续令牌序列,并附加⟨CUT⟩令牌。由于我们的模型是在专业电影上训练的,开始过早或过晚的序列会产生比修剪到有用片段更差的似然值。 图6和补充材料提供了两个使用我们自己的素材的示例。我们使用跟踪镜头,其中开头和结尾的部分包含 erratic 的相机运动和视觉内容兴趣不大的部分,如地面和摄影师的鞋子。这些部分在真实电影中极不可能出现,在两个示例中,我们的方法都成功地将它们修剪掉了。

5.2 组装连贯短镜头序列 连贯短镜头序列(Stringouts)定义为在较大电影中彼此连贯的较小镜头序列。这些通常是遵循某些剪辑模式的二到四个镜头的序列,例如动作剪辑或建立镜头序列。 连贯短镜头序列通常作为编辑过程的第一步进行组装。然后它们被用作构建块来抽取,而不是直接从原始素材中抽取,然后根据需要进行进一步编辑。 我们的方法能够根据视频集合和空的初始序列生成连贯短镜头序列。我们直接在整个原始素材集合上应用我们的编辑算法, 并简单地让它从任何给定的文件中抽取视频序列。由于没有现有的序列提供节奏或内容的条件信号,我们的方法默认生成高概率的序列,这些序列通常遵循电影剪辑惯例。尽管这一特性也出现在其他编辑任务中,但我们发现以这种方式组装连贯短镜头序列显著增加了可识别电影习语(film idioms)的频率和多样性。 图7和补充材料提供了使用EditStock纪录片素材的示例。示例的输入是每个项目的原始素材(每秒23.976帧,数百分钟)。我们的方法能够基于电影习语组装合理的连贯短镜头序列——如动作剪辑、建立镜头序列和视点镜头,这些是电影中广泛使用的基本构建块。

5.3 对齐的多机位编辑 多机位设置在拍摄现场音乐表演、戏剧和其他无法承受多次拍摄(multiple takes)的现场活动时很常见。相机放置在空间中的不同位置,并通过外部设备同步以最大化对活动的覆盖。 我们的素材约束解码(footage-constrained decoding)可以直接应用于多机位原始素材,但有一个新的约束:模型不再能从任何文件中的任何帧中抽取,而只能抽取与视频集合中当前时间步相对应的帧。编辑任务因此简化为一次从一个视频流中选择一个帧,并决定何时切换视频流。 图8和补充材料展示了我们方法的一个输出示例。为此,我们使用了电影编辑网站CineStudy上的项目“Before You Accuse Me”。在素材中,一对吉他手在一个面向相机的小房间里演奏歌曲。该项目由四个同步的视频流组成:前三个是安装在三脚架上的静态相机,第四个是来自多个手持相机的对齐的B-roll连贯短镜头序列集合。在每一帧,我们的模型选择是继续在当前的视频流上,还是进行剪辑并切换到其他三个视频流之一。我们的方法根据歌曲的节奏进行适当的剪辑,并选择具有适当主要主体的素材部分。它在吉他独奏期间专注于正确的吉他,切换到唱歌的人的特写和中景镜头,并在音乐视频较平淡的部分选择更宽的镜头。在图8所示的片段中,我们的方法在其中一个吉他独奏期间保持中景-特写-中景-特写的剪辑模式,然后在该特定歌曲部分结束时打破该模式。5

5.4 人在回路的视频编辑 最后,我们表明我们的方法非常适合人在回路的视频编辑。在此应用中,任务是协助编辑人员完成完整的编辑视频。我们通过将用户研究中的LLM替换为正在组装一个

SIGGRAPH Conference Papers ’26, July 19–23, 2026, Los Angeles, CA, USA.

第 9 页

每帧的处理可能允许更长的上下文并带来更好的结果。其次,我们的方法经常在两个不相关但运动相似的影片之间进行动作匹配剪辑。这在那些预期会发生动作匹配剪辑但缺乏能形成连贯动作匹配剪辑的素材的项目中很常见。图 10 展示了这种失败模式的一个例子。第三,视频的排序和修剪只是电影后期制作工作的一部分。其他任务包括编辑音频、调色以及与剪辑不同的镜头过渡。虽然我们的当前模型以音频为条件,但它无法以任何方式直接修改音频。这一限制使得我们的模型无法触及某些电影惯例,最显著的是 L 型剪辑和 J 型剪辑 [Hockrow 2014]。最后,视频编辑任务需要多种条件信号来产生更好的结果。一些有用的条件信号示例包括剧本、分镜图或明确的风格指示。我们当前版本的模型仅通过推理算法从音频和视频收集中接收条件约束,这虽然有效但有限。我们设想未来版本的模型能够接收更复杂的条件信号和风格。

伦理问题包括对劳动力的潜在影响以及可能的恶意使用。正如拼写检查器和自动补全功能并未取代作家的角色一样,我们的目标也不是自动化人类电影剪辑师的角色。我们的模型处理视频编辑中的低层和中层任务,如节奏、连贯性和动作匹配。这使得人类剪辑师能够专注于编辑的高层方面:故事构建、情感弧线和意义表达。至于潜在的恶意使用,我们的模型仅限于使用电影质量的剪辑拼接现有素材。因此,与合成…

这些镜头的位置给人一种我们是从主角的视角看到物体(即左侧序列中的悬崖和右侧序列中的面团)的感觉。

图 7. 我们 stringouts 示例应用的样本。我们的方法令人信服地组装了尊重简单电影习语的短镜头序列。输出 stringout 视频提供在补充材料中。缩略图受版权保护,属于 EditStock。

7 结论

在本文中,我们展示了一种使用自回归序列建模进行计算视频蒙太奇的简单有效方法。我们的方法在镜头序列排序方面达到了新的最先进水平,并根据用户研究在编辑结果的质量上优于以前的方法。综上所述,我们的贡献表明,大规模序列建模提供了一种从数据中直接学习并应用电影编辑“语法”的实用且有效的方法。更广泛地说,我们将我们的工作视为图形学和视觉领域更长轨迹的一部分:正如计算摄影在没有自动化艺术意图的情况下极大地提高了日常图像的质量一样,我们的工作为让人机协作使现有视频更具可看性开辟了一条新途径。在一个视频已经饱和的世界里,挑战不在于生成更多视频,而在于从被忽视中拯救那些已经被捕捉到的内容。

6 局限性与伦理考量

我们的方法存在以下局限性。首先,FilmGPT 受限于上下文长度。我们相信,从 TiTok 标记器切换到专为视频构建且需要更少标记的标记器,可以缓解这一问题。

对于短片编辑草稿,随着用户进行编辑,我们的方法会产生继续编辑的候选序列,人类编辑可以选择并修改由我们的方法产生的序列,而不是手动搜索数百分钟的原始素材。针对此用例,我们通过文本描述保持条件约束,并根据视频元数据包括视频集合的进一步约束选项。这些选项包括通过文件名、位置、日期和文件目录进行约束。我们在图 9 和补充材料中包含了此过程针对“Cappoquin 的烤炉”的输出示例。从 288 分钟的原始素材中制作出可接受的 3.5 分钟短片,业余编辑只需几个小时,而根据 [La Rosa 2025],该任务通常需要几天时间。

参考文献

Dawit Argaw, In SoMureja Kweon, Heilbron, Fabian Lee, Joon-Young Woodson, and Markus. 2022. The Anatomy of Video Editing: A Dataset and Benchmark Suite for AI-Assisted Video Editing. In ECCV. Springer, 201–218.

SIGGRAPH Conference Papers ’26, 2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

第 10 页

10 • Sandoval-Castañeda 等人

图 8. 我们多机位编辑示例应用中的样本。胶片条中灰显的部分是我们方法未选中的片段。 素材来自项目“Before You Accuse Me”,其中一对吉他手音乐家在多台摄像机前演奏。我们的方法在聚焦于音频和节奏来源的流之间进行切换。输出编辑后的视频见补充材料。缩略图受版权保护,归 CineStudy 所有。

图 9. 我们人机交互视频编辑示例应用中的样本。胶片条中的第四帧属于 A-roll(主音频/采访画面)。注意我们的方法能够在 B-roll(补充视觉画面)序列中坚持主题交叉剪辑,其中烤箱火焰的镜头与准备面团的过程交错出现。视频输出见补充材料。缩略图受版权保护,归 EditStock 所有。

EditStock. 2025. EditStock. (2025). https://editstock.com Arushi Goel, Sreyan Ghosh, Jaehyeon Kim, Sonal Kumar, Zhifeng Kong, Sang-gil Lee, Chao-Han Huck Yang, Ramani Duraiswami, Dinesh Manocha, Rafael Valle, 等人. 2025. Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models. arXiv preprint arXiv:2507.08128 (2025). Pooja Guhan, Tsung-Wei Huang, Guan-Ming Su, Subhadra Gopalakrishnan, 和 Di- nesh Manocha. 2025. V-Trans4Style: Visual Transition Recommendation for Video Production Style Adaptation. In ECCV. Springer, 191–206. 图 10. 失败模式:在不相关的动作之间切换。由我们方法为“The Ovens of Cappoquin” 和“Built by Life”组装的序列中的连续帧。左侧,一个抓取面团的镜头切换到一个 将面团放入烤盘的镜头。面团、地点和光线明显不同,导致生硬的切换。右侧,一个 Michael Gygli, Yale Song, 和 Liangliang Cao. 2016. Video2GIF: Automatic Generation of Animated GIFs from Video. In CVPR. Li-wei He, Michael F. Cohen, 和 David H. Salesin. 1996. The Virtual Cinematographer: A Paradigm for Automatic Real-Time Camera Control and Directing. In Proceedings of the 23rd Annual Conference on Computer Graphics and Interactive Techniques (SIG- GRAPH ’96). Association for Computing Machinery, New York, NY, USA, 217–224. doi:10.1145/237170.237259 Ross Hockrow. 2014. Out of Order: Storytelling Techniques for Video and Cinema Editors. Peachpit Press, San Francisco, CA. jarring cut. 缩略图受版权保护,归 EditStock 所有。 Chris Hokamp 和 Qun Liu. 2017. Lexically Constrained Decoding for Sequence Generation Using Grid Beam Search. In Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Bernd Huber, Hijung Valentina Shin, Bryan Russell, Oliver Wang, 和 Gautham J Dawit Mureja Argaw, Mattia Soldan, Alejandro Pardo, Chen Zhao, Fabian Caba Heilbron, Mysore. 2019. B-script: Transcript-based b-roll video editing with recommendations. Joon Son Chung, 和 Bernard Ghanem. 2024. Towards Automated Movie Trailer In Proceedings of the 2019 CHI Conference on Human Factors in Computing Systems. Generation. In CVPR. 7445–7454. 1–11. Daniel Arijon. 1991. Grammar of the Film Language. Silman-James Press. Mina Huh, Saelyne Yang, Yi-Hao Peng, Xiang’Anthony’ Chen, Young-Ho Kim, 和 André Bazin, Charles Bitsch, 和 Jean Domarchi. 1958. Interview with Orson Welles. Amy Pavel. 2023. AVScript: Accessible video editing with audio-visual scripts. In Cahiers du Cinéma 84 (June 1958), 1–13. Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems. Iz Beltagy, Matthew E. Peters, 和 Arman Cohan. 2020. Longformer: The Long- 1–17. Document Transformer. arXiv:2004.05150 (2020). Arnav Jhala 和 Robert Michael Young. 2005. A Discourse Planning Approach to Floraine Berthouzoz, Wilmot Li, 和 Maneesh Agrawala. 2012. Tools for placing cuts Cinematic Camera Control for Narratives in Virtual Environments. In AAAI, Vol. 5. and transitions in interview video. ACM TOG 31, 4 (2012), 1–8. 307–312. David B Christianson, Sean E Anderson, Li-wei He, David H Salesin, Daniel S Weld, 和 Peter Karp 和 Steven Feiner. 1993. Automated Presentation Planning of Animation Michael F Cohen. 1996. Declarative Camera Control for Automatic Cinematography. Using Task Decomposition with Heuristic Reasoning. In Graphics Interface. Canadian In AAAI. 148–155. Information Processing Society, 118–118. Linhao Dong, Shuang Xu, 和 Bo Xu. 2018. Speech-transformer: a no-recurrence Steven D. Katz. 1991. Film Directing: Shot by Shot: Visualizing from Concept to Screen. sequence-to-sequence model for speech recognition. In International Conference on Michael Wiese Productions. Acoustics, Speech and Signal Processing (ICASSP). 5884–5888. Melanie La Rosa. 2025. Contemporary Post-Production: Create, Cut, Collaborate, Color, Abhimanyu Dubey, Abhinav Jauhri, 和 et. al. 2024. The Llama 3 Herd of Models. Deliver. Routledge, New York. arXiv:2407.21783 [cs.AI] https://arxiv.org/abs/2407.21783

SIGGRAPH Conference Papers ’26, July 19–23, 2026, Los Angeles, CA, USA.

第 11 页

参考文献

Mackenzie Leake, Abe Davis, Anh Truong, 和 Maneesh Agrawala。2017。《面向对话驱动场景的计算视频编辑》。ACM TOG 36, 4 (2017), 130–1。

Dawon Lee, Jung Eun Yoo, Kyungmin Cho, Bumki Kim, Gyeonghun Im, 和 Junyong Noh。2022。《PopStage:基于时空匹配的舞台交叉剪辑视频生成》。ACM TOG 41, 6 (2022), 1–13。

Yuzhi Li, Haojun Xu, 和 Feng Tian。2025。《视频编辑中的镜头序列排序:基准、指标及受电影摄影启发的计算方法》。arXiv 预印本 arXiv:2503.17975 (2025)。

Christophe Lino, Mathieu Chollet, Marc Christie, 和 Rémi Ronfard。2011。《用于交互式叙事的电影编辑计算模型》。载于《交互式叙事:第四届国际数字叙事交互式会议, ICIDS》。Springer, 305–308。

Billal Merabti, Marc Christie, 和 Kadi Bouatouch。2016。《使用隐马尔可夫模型的虚拟导演》。载于《计算机图形学论坛》, 第 35 卷。Wiley Online Library, 51–67。

Christian Metz。1992。《电影符号学的一些观点》。载于《电影理论与批评:入门读本》, Gerald Mast, Marshall Cohen, 和 Leo Braudy (编)。牛津大学出版社。

KL Bhanu Moorthy, Moneish Kumar, Ramanathan Subramanian, 和 Vineet Gandhi。2020。《视线引导的广角单目视频记录电影式编辑》。载于《2020 年 CHI 人机交互会议论文集》。1–11。

Alejandro Pardo, Jui-Hsien Wang, Bernard Ghanem, Josef Sivic, Bryan Russell, 和 Fabian Caba Heilbron。2024。《用于指令式视觉组装的生成时间线》。arXiv 预印本 arXiv:2411.12293 (2024)。

Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, 和 Ilya Sutskever。2021。《从自然语言监督中学习可迁移视觉模型》。载于 ICML。

Rémi Ronfard, Vineet Gandhi, Laurent Boiron, 和 Vaishnavi Ameya Murukutla。2015。《散文式分镜脚本语言:一种用于注释和指导电影的工具》。arXiv 预印本 arXiv:1508.07593 (2015)。

Marcelo Sandoval-Castañeda, Bryan Russell, Josef Sivic, Gregory Shakhnarovich, 和 Fabian Caba Heilbron。2025。《EditDuet:用于视频非线性编辑的多智能体系统》。载于 SIGGRAPH ’25。1–11。

Saquib Sarfraz, Naila Murray, Vivek Sharma, Ali Diba, Luc Van Gool, 和 Rainer Stiefelhagen。2021。《用于无监督动作分割的时间加权层次聚类》。载于 CVPR。

Arno Schödl, Richard Szeliski, David H. Salesin, 和 Irfan Essa。2000。《视频纹理》(SIGGRAPH ’00)。

Yaojie Shen, Libo Zhang, Kai Xu, 和 Xiaojie Jin。2022。《Autotransition:学习推荐视频转场效果》。载于 ECCV。Springer, 285–300。

Tomáš Souček 和 Jakub Lokoč。2024。《TransNet V2:一种用于快速镜头转换检测的有效深度网络架构》。载于 ACM MM。

Bekzat Tilekbay, Saelyne Yang, Michal Adam Lewkowicz, Alex Suryapranata, 和 Juho Kim。2024。《ExpressEdit:使用自然语言和草绘进行视频编辑》。载于《第 29 届国际智能用户界面会议论文集》。515–536。

David Trottier。1994。《编剧圣经:撰写、格式化和推销原创剧本的完整指南》。编剧中心。

Bryan Wang, Yuliang Li, Zhaoyang Lv, Haijun Xia, Yan Xu, 和 Raj Sodhi。2024a。《LAVE:用于视频编辑的大语言模型驱动代理辅助与语言增强》。载于《智能用户界面国际会议》。

Sitong Wang, Zheng Ning, Anh Truong, Mira Dontcheva, Dingzeyu Li, 和 Lydia B Chilton。2024b。《PodReels:人机协作创作视频播客预告片》。载于《2024 年 ACM 交互系统设计会议论文集》。958–974。

Hui-Yin Wu 和 Marc Christie。2016。《分析嵌入式约束模式下的电影摄影》。载于 WICED-Eurographics 智能电影摄影与编辑研讨会。

Hui-Yin Wu, Francesca Palù, Roberto Ranon, 和 Marc Christie。2018。《像导演一样思考:用于虚拟电影叙事的故事编辑模式》。ACM 多媒体计算、通信与应用汇刊 (TOMM) 14, 4 (2018), 1–22。

Bo Xiong, Yannis Kalantidis, Deepti Ghadiyaram, 和 Kristen Grauman。2019。《少即是多:从视频时长中学习高光检测》。载于 CVPR。

Yu Xiong, Fabian Caba Heilbron, 和 Dahua Lin。2022。《从文本到视频:高效的片段序列生成》。载于 ACM MM。

Qihang Yu, Mark Weber, Xueqing Deng, Xiaohui Shen, Daniel Cremers, 和 Liang-Chieh Chen。2024。《一张图像值得 32 个标记用于重建与生成》。NeurIPS (2024)。

SIGGRAPH 2026 会议论文,2026 年 7 月 19–23 日,美国加利福尼亚州洛杉矶。

发表评论