FilmGPT:用自回归Transformer学习电影剪辑语法
本文提出FilmGPT,一种基于自回归Transformer的电影剪辑模型。它将电影表示为离散视频标记和显式⟨CUT⟩标记的序列,通过滑动窗口注意力和音频条件约束进行训练。推理时采用素材约束解码算法,确保生成的镜头严格来自输入素材。在AVE数据集上,Acc@1达到53.9%,优于SOTA方法UQNet。用户研究显示,FilmGPT在连贯性和电影感上优于Transcript2Video和EditDuet。模型存在上下文长度限制,且无法直接处理L-cut/J-cut等音频主导技巧。