FilmWorld:通过动态电影世界建模实现 Agentic 小说到电影的生成

三分钟导读:本文提出FilmWorld,一种将小说生成电影形式化为动态电影世界建模的端到端 Agent 系统,通过解耦的构建与演化阶段及显式状态追踪,解决了长叙事中的因果一致性和视觉连贯性问题。

英文题目:FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

论文出处:arXiv 每日论文精选 · arXiv:2607.19038

原始论文:PDF / 论文页面

对应视频标题:FilmWorld:通过动态电影世界建模实现 Agentic 小说到电影的生成|推荐指数:★★★★★

这篇论文解决什么问题?

现有视频生成模型局限于短片段,无法处理长篇幅、多场景且实体状态动态演变的小说到电影(Novel-to-Film)生成任务,导致语义漂移和因果不一致。

核心创新

  • 将小说到电影生成形式化为动态电影世界建模(Dynamic Cinematic World Modeling)。
  • 提出解耦的构建-演化范式,实现世界状态轨迹的预材料化,从而支持并行渲染。
  • 设计跨镜头动态状态传播机制,结合文本端状态约束和视觉关键帧条件。
  • 引入FilmEval评估框架,包含15部难度分级的小说基准和9项自动指标。

方法概览

FilmWorld将任务分解为构建阶段(将抽象叙事转化为状态化世界实体和镜头规划)和演化阶段(基于显式世界状态进行视觉生成和跨镜头动态状态传播),并通过闭环验证确保一致性。

逐图理解论文

FilmWorld核心架构

FilmWorld核心架构
Figure 3 Overview of the FilmWorld framework. Using a simplified world-state trajectory from the novel “The Bond of Time” for illustrative clarity, FilmWorld translates raw prose into films via a decoupled paradigm. In the Construction

FilmWorld将任务分解为构建阶段和演化阶段。构建阶段将抽象叙事转化为状态化世界实体和镜头规划;演化阶段基于显式世界状态进行视觉生成和跨镜头动态状态传播。通过闭环验证确保一致性,解决长叙事中的因果一致性和视觉连贯性问题。

动态电影世界演化

动态电影世界演化
Figure 2 Schematic of the Dynamic Cinematic World evolution. At each shot step t, the world state Wt is advanced to Wt+1 via the transition function T (·, pt) conditioned on the plot event pt. The state mapping function Φ(·) maps each world state to a set of entity-level state identifiers {ϕe,t}e∈E, which are then passed to the rendering function R(·, dt) together with the shot directive dt to produce the visual shot vt.

在演化阶段,世界状态Wt通过转换函数T基于情节事件pt推进至Wt+1。状态映射函数Φ将世界状态映射为实体级状态标识符,随后与镜头指令dt一同输入渲染函数R,生成视觉镜头vt。这种显式状态追踪支持并行渲染,避免累积误差。

跨镜头动态状态传播

跨镜头动态状态传播
Figure 4 Illustration of the Cross-Shot Dynamic State Propagation mechanism. A scene-local sliding-window planner jointly synthesizes motion specifications for all target shots, enforcing cross-shot coherence via: 1) a pre-materialized textual end-state constraint, forming a continuity backbone where each shot’s opening derives from its predecessor’s terminal state; and 2) a visual conditioning channel supplying rendered keyframes as ordered multimodal inputs, constraining the perceptual realization of each transition in lighting, composition, spatial layout and so on.

FilmWorld设计跨镜头动态状态传播机制,通过场景局部滑动窗口规划器合成所有目标镜头的运动规范。该机制结合预材料化的文本端状态约束和视觉关键帧条件,确保镜头间的物理和空间连续性,维持实体姿态、空间布局和物体状态的无缝过渡。

FilmEval评估框架

FilmEval评估框架
Figure 5 Illustration of the cinematic presentation evaluation. Given a generated film, FilmEval partitions it into temporal segments and assesses each segment along three dimensions: Visual Presentation Quality (VP), Narrative Expression and Pacing (NEP), and Audio-Visual Performance Quality (AVP). For every dimension, the evaluator identifies both positive evidence and visible defects, and then assigns a fine-grained score.

引入FilmEval评估框架,包含15部难度分级的小说基准和9项自动指标。评估维度涵盖电影呈现、电影一致性和小说保真度。电影呈现评估视觉质量、叙事表达和音画表现;电影一致性评估角色、场景和物体的一致性;小说保真度评估叙事幻觉抵抗、逻辑可靠性和故事还原度。

定量结果与SOTA对比

定量结果与SOTA对比
Table 1 Overall performance comparison on FilmEval. We report three metric groups, Cinematic Presentation (CP), Film Consistency (FC), and Novel Fidelity (NF), under the Easy, Medium, and Hard difficulty tiers. The rightmost column

在FilmEval基准上,FilmWorld全面优于SOTA视频生成代理系统,特别是在叙事保真度和跨场景一致性方面提升显著。在Easy、Medium和Hard难度分级下,FilmWorld在电影呈现、电影一致性和小说保真度三个指标组上均表现最佳,且方差最小。

实验与关键结果

  • 在FilmEval基准上对比FilmWorld与SOTA视频生成 Agent 系统。
  • 进行消融实验以验证构建和演化阶段各组件的有效性。
  • 进行人类评估以验证自动指标与人类判断的一致性。
  • 分析计算效率和可扩展性。
  • 在FilmEval上全面优于SOTA,特别是在叙事保真度和跨场景一致性方面提升显著(第 15 页)
  • 并行执行(P=6)实现5.62倍加速,每镜头成本从0.61降至0.11分钟(第 19 页)
  • FilmEval自动评分与人类评分高度相关(NF维度Pearson r=0.711)(第 17 页)
  • FilmWorld生成的电影中位数时长12.9分钟,随难度显著扩展(第 37 页)

阅读时需要注意

  • 当前系统仅针对1,000-5,000字的中长篇幅小说。
  • 生成质量受限于底层生成骨干模型(如关键帧伪影、动作不自然)。
  • 复杂空间布局下可能出现实体空间锚定失效。
  • 评估指标基于MLLM自动评分,虽与人类高度相关但仍可能存在偏差。
  • 风格泛化实验仅为说明性,未进行严格的质量对比。

关联工作

  • Sora, CogVideoX, HunyuanVideo:基础视频生成模型,但局限于短片段(第 3 页)
  • OneStory, InfinityStory:通过记忆引导保持跨场景一致性,但存在语义漂移(第 3 页)
  • MovieAgent, StoryAgent:Multi-Agent 视频生成系统,但缺乏共享的全局状态追踪(第 4 页)
  • ViStoryBench, VABench:现有视频评估基准,缺乏对长叙事保真度的评估(第 12 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

FilmWorld:通过动态电影世界建模实现 Agent 驱动的小说到电影生成

左嘉龙1,2,左浩同1,张诗伟2,王翔2,李晨1,桑农1,高长信1,白翔1

1华中科技大学,2阿里集团万团队

将小说转化为电影是生成式人工智能面临的一项重大挑战,需要将抽象的文学散文转化为长篇、多场景的视觉叙事。尽管当前的视频生成模型擅长在狭窄的时间和空间范围内生成短小的单场景片段,但小说到电影的生成处于一个更为复杂的领域,要求在多样化的场景中生成持续时间长且实体状态动态演变的内容。为了解决这一问题,我们将小说到电影的生成形式化为动态电影世界建模,并将其分解为两个阶段:构建阶段,将抽象且未充分指定的文学叙事锚定到具体、有状态且持久的世界实体中;以及演化阶段,管理这些实体如何随着情节推进而动态更新,以维持跨场景的因果一致性。为了实现这一形式化定义,我们提出了 FilmWorld,这是一个端到端的 Agent 系统,其中两组专用 Agent 协作以实例化这两个阶段。构建侧 Agent 执行叙事结构化翻译、带有视觉锚定的世界实体状态建模以及状态驱动的镜头规划,逐步将文学语言投射为电影蓝图。演化侧 Agent 随后执行状态锚定的视觉生成、跨镜头动态状态传播以及闭环状态验证,以维持因果一致性和视觉连贯性。此外,为了解决长程生成中的评估差距,我们引入了 FilmEval,这是一个系统的评估框架,它将包含15部代表性小说的难度分级基准与涵盖三个维度的九项客观指标的自动化协议相结合:电影呈现、电影一致性和小说保真度。大量实验表明,FilmWorld 持续优于最先进的视频生成 Agent 系统,在叙事保真度和跨场景一致性方面尤其表现出显著的提升。

项目主页:https://filmworld-ai.github.io

1 引言

小说提供丰富的文本叙事,而电影提供高度表现力的视觉 storytelling。传统上,将小说改编为电影是一项要求极高、资源密集型的工艺,需要大量的协作努力来手动将抽象的散文转化为具体的视听内容。通过直接从小说生成电影来自动化这一过程具有巨大的价值,有望彻底改变创意产业的内容创作,同时作为推动人工智能在语言理解、视觉合成和长程叙事连贯性方面进展的前沿挑战 [5]。

现有的视频生成研究主要关注在狭窄时间范围内生成的短小单场景片段,将生成视为局部视觉合成问题 [2, 15, 32, 42]。相比之下,小说到电影的生成处于一个复杂得多的领域。它要求在动态演变的世界中生成跨越数十个不同场景的长时内容,其中所有关键实体,从角色到环境,都持续经历状态转换。此外,输入是由丰富的心理深度、非线性叙述和隐喻构成的抽象文学散文。简单地将当前模型外推到此任务不可避免地会导致无法随时间维持叙事和视觉连贯性 [3, 4, 34]。因此,这一

第 2 页

先验:镜头视频生成 先验:长视频外推 直接生成 跨镜头无共享上下文 仅局部视觉 摘要 合成 摘要 语义与视觉漂移在多场景中累积 小说文本 小说文本 加剧 有限的时间 静态场景假设 无实体/状态追踪 累积误差传播 线性延迟扩展 因果演化缺失 视野 缺失 研究挑战:维持叙事与视觉连贯性

FilmWorld(动态电影世界建模)

世界构建 角色: 世界演化 (持久化世界构建) 身份、年龄 阶段、服装 叙事 状态 镜头 解析器 锚点 规划器 电影化 地点: 视觉渲染器 连贯性规划器 状态验证器 世界 地点、天气、季节、时间 叙事结构化 世界实体 状态驱动 状态锚定 跨镜头动态 闭环 翻译 状态建模 镜头规划 道具: 视觉生成 状态传播 状态验证 物理状态

“WhiteSilkinaChillySpring”(23m50s)

摘要 小说文本

显式因果世界状态 无漂移视觉连贯性 高效并行渲染 高保真叙事还原

图 1 小说到电影生成的视频生成范式的概念比较。现有方法要么独立合成镜头而缺乏跨镜头状态追踪(左上),要么进行顺序外推,导致语义漂移在长叙事中累积(右上)。FilmWorld(底部)则基于源小说构建一个持久的电影世界,并通过情节驱动的状态转换对其进行演化,构建侧和演化侧的 Agent 组共同确保跨场景的因果一致性和视觉连贯性。

叙事级生成并非现有任务的简单扩展,而是一个根本性的新研究挑战。

我们认为,小说到电影生成的本质在于动态电影世界建模,该过程通过两个核心阶段运行。构建阶段将抽象、未充分指定的文学叙事 grounding(锚定/落地)为具体的、有状态的、持久的世界实体。演化阶段则规定该世界如何在情节推进下动态更新,同时保持跨多个场景的因果一致性。因此,最终电影中的每一个镜头仅仅是从该底层世界在特定时刻渲染出的特定视角。这一概念重构将长程生成的重点从优化孤立镜头转移到构建演化中的世界,从而将我们的方法与先前的逐镜头合成范式区分开来。

对动态电影世界的建模本质上是一个多面任务,涵盖异构能力,通过专用 Agent 协作而非单一单体模型来解决更为有效 [10, 38, 39]。因此,我们提出 FilmWorld,这是一个端到端的 Agent 系统,其中多个专用 Agent 协作完成小说到电影的流水线。在构建侧,三个 Agent 组协同工作,逐步将抽象的文学语言投影到可寻址且可复用的电影世界蓝图上:(i) 叙事结构化翻译,(ii) 带有视觉锚定的世界实体状态建模,以及 (iii) 状态驱动的镜头规划。在演化侧,三个 Agent 组共同确保跨数十个场景的因果一致性和视觉连贯性:(i) 状态锚定的视觉生成,(ii) 跨镜头动态状态传播,以及 (iii) 带校正的闭环状态验证。两侧共同形成一个统一的构建-演化机制,实例化了完整的小说到电影流水线。

从评估角度来看,现有基准主要关注短视频质量,无法胜任长程电影叙事 [11, 37, 41, 50]。为解决这一问题,我们引入了 FilmEval,这是一个系统的评估框架,包含一个由 15 部代表性源小说组成的精选基准以及自动化评估协议。我们根据叙事丰富度、结构复杂性和时间跨度,将该基准划分为三个难度等级(简单、中等和困难)。这种设计使得能够针对不同叙事复杂度的方法鲁棒性进行细粒度诊断。评估协议包含九个客观指标,沿三个维度组织:电影呈现、电影一致性和小说保真度。关键在于,这些指标系统地与动态电影世界建模的核心需求相一致,共同提供对生成电影质量的原则性且多维度的刻画。

2

第 3 页

在多样且具有挑战性的小说改编场景中进行的广泛实验表明,我们的 FilmWorld 在所有评估维度上均持续优于现有的最先进视频生成 Agent 系统 [9, 13, 38, 40, 47],在叙事保真度和跨场景一致性方面取得了尤为显著的提升。消融研究进一步验证了我们系统中各个组件的有效性,证实了所提出的构建和演化机制的必要性。

我们将贡献总结如下:

• 在问题层面,我们将小说到电影的生成形式化为动态电影世界建模,将其分解为构建阶段和演化阶段:构建阶段将抽象的文学叙事锚定到具有状态的世界实体中,而演化阶段则控制这些实体如何在场景间进行因果更新。

• 在方法层面,我们提出了 FilmWorld,这是一个端到端的 Agent 系统,其中构建侧和演化侧的 Agent 组共同实例化并维护动态电影世界,从而实现从小说到连贯且高质量长片电影的生成。

• 在评估层面,我们提出了 FilmEval,这是一个用于长片生成电影评估的系统化评估框架,包含由 15 部代表性小说组成的难度分级基准,以及涵盖三个维度的九项自动评估指标协议,为动态电影世界的质量提供了原则性强且全面的表征。

2 相关工作

2.1 长视频生成

Sora [2]、CogVideoX [42]、HunyuanVideo [15]、Wan [32] 和 Kling [16] 等基础模型能够生成高质量的单镜头片段,但仍局限于较短的时间范围。为了达到分钟级的序列,Phenaki [34] 采用自回归令牌预测,而 Self-Forcing++ [4] 和 Rolling Sink [17] 则稳定了无限视界推理。SkyReels-V2 [3] 将语言模型与结构化管道相结合以生成电影长度的视频,FilmWeaver [23] 进一步通过缓存引导的自回归扩散来稳定多镜头生成。对于多场景叙事,OneStory [1]、InfinityStory [6]、StoryMem [44] 和 EM-Vid [33] 通过记忆引导预测、显式状态跟踪和以实体为中心的内存来维持跨场景一致性。Holocine [25] 优化了整体叙事的镜头构图,ReCA [20] 则递归分配上下文以在多镜头外推期间保持锚定状态。尽管取得了这些进展,这些方法主要通过隐式隐藏状态或滑动窗口注意力来传播上下文,因此当实体发生剧烈的、由情节驱动的转换时,会遭受累积的语义漂移,这使得它们不适合小说到电影生成任务所需的长程叙事和视觉连续性。

2.2 故事可视化

故事可视化从文本叙事中生成连续图像或视频。StoryGAN [18] 和 StoryDALL-E [24] 等早期框架通过采用顺序生成网络和文本到图像的后期处理,开创了在帧间保持上下文的任务。随着扩散模型的兴起,StoryDiffusion [49] 通过跨帧自注意力强制执行角色一致性,而 TaleCrafter [7] 则结合交互式布局规划与检索增强交叉注意力来处理多角色场景。除了静态分镜,叙事视频模型捕捉复杂的时序动态:VideoDirectorGPT [19]、VideoGen-of-Thought [47] 和 StoryGPT-V [27] 利用大语言模型将文本分解为局部脚本和空间布局,VideoStudio [22] 和 ShotAdapter [14] 引入实体跟踪和时间适配器以实现平滑过渡,而最近的 STAGE [46] 则在显式分镜上锚定多镜头叙事,Narrative Weaver [43] 则通过多模态条件控制追求可控的长程视觉一致性。为了评估这些系统,已经建立了 ViStoryBench [50]、VABench [11] 和 EvalVerse [41] 等综合套件,以测量序列中的角色和场景一致性。然而,现有方法面临两个关键瓶颈。首先,它们无法弥合原始、隐喻性的文学散文与其所需的显式视觉布局输入之间的语义鸿沟。其次,它们缺乏因果世界建模,将角色视为静态视觉模板,而非其物理状态和关系随情节有机演变的动态实体。

第 4 页

2.3 Agent 视频生成

Multi-Agent 架构将复杂的视频生成分解为协调的子任务。早期的系统如 MovieAgent [38]、StoryAgent [10] 和 ScriptAgent [26] 采用分层规划 Agent 进行剧本创作、角色设计和镜头布置。对于更长的序列,MAViS [35] 和 MUSE [30] 编排闭环认知规划,而 AniME [45] 则使用面向导演的分解方法生成结构化动画。为了获得更好的连续性,VideoMemory [48] 和 MM-StoryAgent [40] 利用结构化记忆来跨镜头追踪实体,而 VideoClaw [9] 和 ViMax [13] 则提供具有依赖感知规划的用户可编辑管道。为了追求更高的制作质量,FilMaster [12] 和 Co-Director [29] 将电影制作原则融入叙事中,VISTA [21] 则通过测试时自我改进来优化生成过程。Shi 等人 [28] 和 Toonflow [8] 等并发工作进一步探索了用于戏剧生成的专用 Multi-Agent 工作流。尽管这些系统有效,但它们主要基于逐场景的剧本片段进行操作,缺乏一个共享的“单一事实来源”来追踪整部电影中的状态转换、身份和空间连续性。FilmWorld 通过集中构建和演化动态世界状态来解决这一差距,将其作为对齐所有协作 Agent 的持久锚点。

3 问题定义

3.1 任务形式化

我们将 Novel-to-Film Generation(小说到电影生成)任务定义如下。给定一部以文学散文形式书写的源小说 $N$,目标是生成一部电影 $F$,将 $N$ 的叙事内容忠实且连贯地呈现为长篇幅的视听体验。在结构上,$F$ 组织为分层、有序的场景序列 $\{S_1, S_2, \dots, S_M\}$,其中每个场景 $S_i$ 由有序镜头序列 $\{v_{i}^1, v_{i}^2, \dots, v_{i}^{K_i}\}$ 组成。每个镜头 $v_{i}^k$ 是持续数秒的视频片段,可选择性地配以同步对话音频。

为了在叙事复杂度和计算预算之间取得平衡,我们刻意校准了该任务的研究范围和执行边界。虽然 $N$ 原则上可以是任意长度并用不同语言书写,但我们专注于中等长度的文本,大约为 1,000–5,000 个中文字符,或相当于 1,000–3,000 个英文单词。在此输入规模下,理想化的电影输出 $F$ 通常持续 5–30 分钟,包含 20–50 个场景和 50–300 个镜头。

这种分层结构(小说 $\rightarrow$ 场景 $\rightarrow$ 镜头)决定了内容生成和协调的粒度。核心挑战不在于孤立地提升单个镜头的质量,而在于维持整个 $N$ 个镜头序列中的叙事连贯性和视觉一致性。

3.2 为什么需要动态世界表示

小说到电影生成的朴素方法可能是独立生成镜头 [19, 47, 49] 或在有限上下文下顺序生成 [3, 4, 34]。然而,由于存在根本性的表示差距,这种方法在数十个场景的规模上必然失败:不存在显式机制来确保镜头 $t$ 中实体的视觉状态与其在所有先前镜头中发生的情况具有因果一致性。

考虑一个在早期场景中受伤的角色。如果没有显式状态,后续场景没有可靠的方法来“知道”该角色仍然应该显示为受伤。这些信息要么必须隐式地保存在不断增长的上下文窗口中 [1, 20, 44],但随着序列变长而退化;要么必须为每个镜头从源文本中重新推断,这既容易出错又计算成本高昂。

小说到电影生成任务的两个结构特性加剧了这一问题:

1) 世界必须被构建,而非给定。与提供视觉描述作为输入的任务不同,电影世界的实体,包括其身份、视觉外观和空间配置,必须从通常隐含或指定不足的抽象文学语言中推断并实例化。

2) 世界因果演化。实体并非静止不变。角色会更换服装、变老、受伤或改变情绪状态;地点会随季节、天气和一天中的时间而变化;道具会被创建、损坏或销毁。这些转换由情节事件驱动,必须显式追踪以防止状态漂移。

这两个特性共同需要一个显式的、可寻址的且因果演化的中间表示,我们称之为动态电影世界(Dynamic Cinematic World)。

4

第 5 页

3.3 动态电影世界的形式化定义

为了在数学上操作化我们的框架,我们将动态电影世界正式定义为由以下五元组支配的系统:

W = ⟨E, X, Φ, T , R⟩ (1)

其中,每个组件以及镜头步骤 $t \in \mathbb{N}$ 的状态演化定义如下:

实体集 (E)。世界实体被定义为不相交并集 $E = E_c \cup E_l \cup E_p$,分别代表角色集 $E_c$、地点集 $E_l$ 和道具集 $E_p$。

状态空间 (X)。状态空间是专用属性空间的并集 $X = X_c \cup X_l \cup X_p$。在任何镜头步骤 $t$,全局世界状态 $W_t$ 定义为所有实体的状态分配集合:

$W_t = \{(e, s_{e,t}) \mid e \in E\}$ (2)

其中 $s_{e,t} \in X$ 表示实体 $e$ 在步骤 $t$ 的具体状态。为了记法方便,我们将 $W_t[e] = s_{e,t}$ 记为实体 $e$ 的状态查找。具体而言,对于角色 $e \in E_c$,其状态 $W_t[e] \in X_c$ 编码了年龄阶段、服装、情绪和身体状况等属性;对于地点,它跟踪天气和光照等环境因素;对于道具,它跟踪物理状态和空间位置。所有可能世界状态的配置空间记为 $\Omega \subseteq X^{|E|}$。

状态标识符 ($\Phi$)。状态映射函数 $\Phi : X \to I$ 为 $X$ 中的每个具体状态分配一个唯一的、可寻址的标识符 $id \in I$。对于步骤 $t$ 的实体 $e$,其活动的视觉身份由以下公式索引:

$\phi_{e,t} = \Phi(W_t[e])$ (3)

该标识符作为我们整个架构中的原子索引单元:所有视觉资产、参考图像和渲染约束都锚定在这些状态标识符上,而不是原始实体名称上。

转换函数 (T)。转换函数 $T : \Omega \times P \to \Omega$ 支配世界状态的演化,其中 $P$ 是情节事件空间。给定当前世界状态 $W_t$ 和从叙事散文中提取的情节事件 $p_t \in P$,转换函数产生更新后的世界状态:

$W_{t+1} = T(W_t, p_t)$ (4)

这形式化了由情节驱动的因果变化,例如角色受伤、更换服装,或地点从白天过渡到夜晚。

渲染函数 (R)。渲染函数 $R : \Omega \times D \to V$ 根据世界状态 $W_t$ 和镜头指令 $d_t \in D$ 合成视频镜头 $v_t \in V$,其中 $D$ 代表镜头参数(如构图、相机意图、参与实体和时间动态)。该过程形式化表达为:

$v_t = R(W_t, d_t)$ (5)

在合成过程中,$R$ 通过查询其对应的状态标识符 $\Phi(W_t[e])$ 来解决每个参与实体 $e$ 的视觉外观,从而在结构上保证跨镜头的视觉一致性。

3.4 小说到电影生成的重构

在这种形式化下,小说到电影的生成任务自然分解为两个子问题:

世界构建。给定源小说文本 $N$,目标是构建初始世界状态 $W_1$(即实例化实体集 $E$ 及其初始状态 $W_1[e]$),生成带有锚定视觉参考资产对应的状态标识符,并规划顺序执行叙事。形式上,此构建步骤将小说转换为初始状态和两个对齐的操作序列:

Construction $N \xrightarrow{\hspace{2cm}} W_1, \{p_1, p_2, \dots, p_N\}, \{d_1, d_2, \dots, d_N\}$ (6)

其中 $\{p_t\}$ 代表情节事件序列,$\{d_t\}$ 代表镜头指令序列。

5

第 6 页

世界状态 𝒯%, 𝑝! 𝒯%, 𝑝" 𝒯%,… 𝑝#$! 轨迹 𝑊! 𝑊" 𝑊# 𝑊(

Φ " Φ " Φ " Φ "

状态标识符 {𝜙!,#}!∈ℰ {𝜙!,&}!∈ℰ {𝜙!,'}!∈ℰ … {𝜙!,(}!∈ℰ Φ: 𝒳→ℐ ℛ", 𝑑# ℛ", 𝑑& ℛ", 𝑑' ℛ", 𝑑(

渲染镜头 𝑣! 𝑣" 𝑣# … 𝑣( 𝑣! = ℛ𝑊!, 𝑑!

ℱ= 𝑣!, 𝑣", … , 𝑣(

图 2 动态电影世界演化的示意图。在每个镜头步骤 $t$,世界状态 $W_t$ 通过转换函数 $\mathcal{T}(\cdot, p_t)$ 根据情节事件 $p_t$ 的条件推进至 $W_{t+1}$。状态映射函数 $\Phi(\cdot)$ 将每个世界状态映射为一组实体级状态标识符 $\{\phi_{e,t}\}_{e \in E}$,这些标识符随后与镜头指令 $d_t$ 一起传递给渲染函数 $\mathcal{R}(\cdot, d_t)$,以生成视觉镜头 $v_t$。

世界演化。该问题在保持动态世界一致性的同时,顺序生成每个镜头。如图 2 所示,在每个镜头步骤 $t \in \{1, 2, \dots, N\}$,系统使用当前活跃的世界状态渲染当前镜头,然后应用转换函数将状态推进以指导下一步:

$$ v_t = \mathcal{R}(W_t, d_t), \quad W_{t+1} = \mathcal{T}(W_t, p_t) \quad (7) $$

最终电影 $\mathcal{F}$ 由所有视频镜头按时间顺序拼接而成:$\mathcal{F} = [v_1, v_2, \dots, v_N]$。

这一公式明确了先前工作未明确说明的内容 [9, 13, 38]:即存在一个持久的、不断演化的世界状态,它在抽象源叙事和生成的视觉输出之间起中介作用。随后的方法部分描述了我们的提议框架 FilmWorld 如何通过协调的 Multi-Agent 协作,实例化这一理论公式中的各个组件。

4 方法论

4.1 概述

我们提出 FilmWorld,这是一个端到端的 Multi-Agent 框架,用于实例化第 3 节中形式化的动态电影世界。如图 3 所示,FilmWorld 将小说到电影的生成分解为两个阶段,反映了构建-演化范式(第 3.4 节)。构建阶段将小说 $\mathcal{N}$ 转换为世界状态轨迹 $\{W_t\}_{t=1}^N$、对齐的情节事件 $\{p_t\}_{t=1}^N$ 和镜头指令 $\{d_t\}_{t=1}^N$。演化阶段随后在明确的一致性约束下渲染每个镜头 $v_t = \mathcal{R}(W_t, d_t)$。每个阶段由三个专门的 Agent 组协调,总共协调六个不同的角色。

FilmWorld 的一个关键架构特征是状态演化与视觉渲染的解耦。虽然状态演化被递归地表述为 $W_{t+1} = \mathcal{T}(W_t, p_t)$,但 FilmWorld 完全在符号化的构建阶段内解决这一递归。通过在像素级生成之前完全实现状态轨迹 $\{W_t\}_{t=1}^N$,演化阶段中的渲染操作从顺序时间依赖中解放出来。这种设计避免了累积漂移,并实现了完全并行的镜头合成。我们将在第 4.4 节中详细阐述这种解耦的效率和调度影响。

4.2 构建阶段

构建阶段逐步将抽象的文学语言投影到一个结构化的、可寻址的、且具有视觉锚点的电影世界中。它由三个级联运行的 Agent 组组成:第一组实例化

6

第 7 页

叙事结构化翻译 世界实体状态建模 状态驱动的镜头规划

实体集: ℰ= ℰ𝒸∪ℰℓ∪ℰ𝓅 状态空间: 𝒳= 𝒳𝒸∪𝒳ℓ∪𝒳𝓅 镜头叙事 结构化场景: {𝑆₁, … , 𝑆ₘ} 𝒳𝒸 = (身份, 年龄阶段, 服装) 两阶段 构图与意图 阶段 角色: 林远 母亲 父亲 老李 … 𝒳ℓ = (地点, 季节, 天气, 时间) 由粗到细 静态描述 地点: 故乡老屋、办公室 𝒳𝓅= (名称, 身体状况) 场景 𝑆ₖ 库 ℒ 结束状态 构建 小说散文 道具: 长竹竿 藤椅 零钱 打火机… 状态映射 Φ 视觉库 ℒ= { 𝜙, 𝐈* } 状态轨迹 {𝑊ₜ}ₜ₌₁ᴺ 镜头指令 {𝑑ₜ}ₜ₌₁ᴺ

𝑊₁₋₃ = 𝒯𝑊₀, 𝑝₀ 离巢 迷失于混凝土丛林 负重前行 归根 归于平静 𝑝₁ 𝑝₂ 𝑝₃ 𝑝₄ 𝑝₅ 状态轨迹 𝑊ₜ 𝑊₁ 𝑊₂ 𝑊₃ 𝑊₄ 𝑊₅

状态锚定视觉生成 跨镜头动态传播 闭环状态验证

1 2 3 滑动窗口 诊断性验证 规划 + 阶段 6 5 4 双通道 校正性再生 演化 连续性 + 检索参考 + + 关键帧 关键帧 + 动态描述 镜头 分数门控选择

最终电影 并行执行 𝑶(𝟏) 延迟在 𝑵 内 “时光之绊”(11分8秒)

图 3 FilmWorld 框架概览。为了说明清晰起见,使用来自小说《时光之绊》的简化世界状态轨迹。FilmWorld 通过解耦范式将原始散文转化为电影。在构建阶段,我们解析叙事结构,将实体状态锚定到视觉参考,并规划状态和镜头的全局轨迹。该轨迹明确跟踪连续的情节事件如何驱动实体状态更新。在演化阶段,我们渲染状态引导的关键帧,通过滑动窗口传播动态运动,并通过闭环反馈解决差异。这种解耦实现了理论延迟为 O(1) 的并行渲染。

实体集 ℰ;第二部分定义状态空间 𝒳、映射函数 Φ 和参考库 ℒ;第三部分应用 𝒯 来具象化完整状态轨迹 {𝑊ₜ}ₜ₌₁ᴺ 和镜头指令 {𝑑ₜ}ₜ₌₁ᴺ,在渲染之前解决所有时间依赖关系。

4.2.1 叙事结构化翻译

该 Agent 组负责定义全局实体集 ℰ 并恢复文学散文通常隐含的具体物理细节。它在两个协调阶段中运行:

章节分割与实体解析。首先,输入小说 𝒩 被分割为有序章节列表。这种划分限制了下游 Agent 的上下文窗口,并为跟踪故事一致性建立了可控的范围。在这个章节序列上,实体解析 Agent 识别并聚类角色、地点和道具的指代变体。因为小说通常使用别名、尊称、代词或描述符来指代同一实体(例如,将同一角色称为“侦探”或“夏洛克”),如果不解决这些问题,下游生成器会将它们视为不同的角色,从而破坏视觉身份的一致性。此阶段为每个唯一实体分配一个规范标识符,填充全局集 ℰ = ℰ𝒸 ∪ ℰℓ ∪ ℰ𝓅,以确保整个叙事中的身份一致性。

场景结构化与电影细节恢复。接下来,每个章节进一步分割为有序的场景序列 {𝑆₁, . . . , 𝑆ₘ},其中每个场景代表特定时间和地点的自包含叙事单元。除了简单的分割之外,此阶段通过恢复散文中省略的关键电影细节,弥合抽象语言与具体意象之间的差距。例如,虽然小说可能简单地写道“她在黄昏时分回到家”,但电影必须做出明确的视觉选择:特定的暖色调

第 8 页

黄昏的光线、特定的季节、天气条件以及氛围色彩调色板。结构化 Agent 推断这些参数,并将它们作为结构化属性附加到每个场景中,为后续的视觉生成建立物理和美学基础。

4.2.2 基于视觉锚定的世界实体状态建模

该 Agent 组实例化了状态空间 $X$、状态映射函数 $\Phi$ 以及将标识符锚定到具体生成资源的视觉资产参考库 $L$。

状态空间离散化。我们将每个实体类离散化为捕捉关键叙事变化的属性。具体而言,角色沿三个维度进行参数化:身份、年龄阶段和服装,这代表了跨场景视觉变化的主要来源。位置由四个维度定义:地点、季节、天气和一天中的时间。道具由其物理状态进行参数化。对于在镜头步骤 $t$ 的每个实体 $e$,Agent 在此结构化空间中分配一个具体状态 $W_t[e] \in X$。

状态标识符实现。状态映射函数 $\Phi$ 实现为基于离散化属性元组的确定性结构化哈希。对于具有状态(身份、年龄阶段、服装)的角色 $e \in E_c$,标识符 $\phi_{e,t} = \Phi(W_t[e])$ 由该属性元组唯一确定;位置和道具也应用类似的哈希。在这种表述下,两个状态在视觉上相同当且仅当它们共享完全相同的标识符。这种唯一映射将开放式的一致性挑战转化为封闭形式的检索和匹配问题。

首次出现视觉锚定。对于在计划叙事轨迹中遇到的每个唯一状态标识符 $\phi$,在其首次出现时生成参考视觉资产 $I_\phi$ 并存储在中央库 $L = \{(\phi, I_\phi)\}$ 中。任何后续展示此相同状态的镜头都检索 $I_\phi$ 作为生成指南,而不是从头创建新资产,遵循先前故事生成工作中探索的参考引导一致性原则 [14, 33, 49]。对于音频一致性,我们应用类似的首次出现原则,但将听觉模态从仅视觉属性(如服装)中隔离出来。具体而言,持久的声音档案严格锚定在角色身份和活跃年龄阶段的组合上,确保其声音身份在跨场景中保持稳定,同时自然地反映身体老化。这种策略确保了维持多模态一致性的计算成本相对于镜头数量保持恒定,从而将长程连贯性与电影的总长度解耦。

4.2.3 状态驱动的镜头规划

该 Agent 组应用 $T$ 来具象化完整状态轨迹 $\{W_t\}_{t=1}^N$,并生成相应的镜头指令 $\{d_t\}_{t=1}^N$,以指导演化阶段。每个指令由每镜头的静态描述和定义镜头终端关键帧视觉布局的终端状态元数据组成,其中镜头 $t$ 的开启配置源自镜头 $t-1$ 的终端状态,从而在渲染之前解决所有时间依赖性。为了管理将叙事场景转化为构图良好的镜头序列的多模态复杂性,我们采用两阶段、由粗到细的规划工作流。

场景级叙事规划。对于每个场景 $S_i$,规划 Agent 根据情节功能将叙事分解为有序的镜头提议序列,这与先前的 LLM 引导的镜头规划方法一致 [19, 38, 47]。每个提议包含镜头叙事、工作标题、参与的字符和道具集合,以及证明其电影必要性的理由。该阶段以纯文本、单模态方式运行,通过有意避免低级视觉细节来实现高并发,为下一阶段产生强大的叙事骨架。

场景条件视觉实现。多模态细化 Agent 随后处理这些提议以及从 $L$ 编译的视觉条件包。对于每个参与的实体 $e$,包括位置、活跃角色和关键道具,使用活跃状态标识符 $\phi_{e,t} = \Phi(W_t[e])$ 检索其参考资产。在这些参考和场景级叙事上下文的联合条件下,Agent 输出每个镜头的最终相机构图、相机意图、静态描述和终端状态元数据。

终端状态元数据编码每个镜头的终端世界状态,从中衍生出后续镜头的开启配置,从而在渲染开始之前完全在符号层面实现 $T$ 并具象化完整状态轨迹 $\{W_t\}_{t=1}^N$。关键在于,场景内的所有镜头都已规划

8

第 9 页

全局镜头序列 滑动窗口 … 𝑠!"( 𝑠!"' 𝑠!"& 𝑠!"% 𝑠!"# 𝑠! 𝑠!$# 𝑠!$% 𝑠!$& 𝑠!$' …

终态约束(文本) 视觉条件(多模态)

end(𝑠!"#) open(𝑠!"$) end(𝑠!"$) open(𝑠!) 𝑘%"# 𝑘%"$ 𝑘% 𝑘%&$

镜头 t 在镜头 t-1 结束处开启 光照、空间布局、道具摆放、 双通道连续性条件 预生成的连续性骨干 构图框架 所有目标镜头的联合生成

语义目标 描述 动态 + 估计时长 + 分割对话 感知实现 — 运动必须到达的位置及原因 — 过渡的外观 最终镜头 𝑠!"# 视频渲染 最终镜头 𝑠!

图 4 跨镜头动态状态传播机制示意图。一个场景局部的滑动窗口规划器联合合成所有目标镜头的运动规范,通过以下方式强制执行跨镜头连贯性:1)预生成的文本终态约束,形成连续性骨干,其中每个镜头的开启状态源自其前一个镜头的终止状态;2)视觉条件通道,提供渲染的关键帧作为有序的多模态输入,约束每次过渡在光照、构图、空间布局等方面的感知实现。

同时而非孤立地进行,确保跨镜头的上下文连贯性。由于此阶段侧重于静态、关键帧级别的布局,时间运动合成被推迟到演化阶段(第 4.3.2 节)。

4.3 演化阶段

给定已生成的状态轨迹 {Wt}Nt=1 和镜头指令 {dt}Nt=1,演化阶段在明确的跨镜头一致性约束下实现渲染函数 R。它由三组 Agent 组成,在镜头序列上以协调的并行方式运行。

4.3.1 状态锚定的视觉生成

该 Agent 组渲染每个镜头的关键帧图像,实现渲染函数 R 的静态部分。对于每个镜头 t,令 Et ⊂E 表示在 dt 中指定的参与实体集合。 Agent 使用主动状态标识符 ϕe,t = Φ(Wt[e]) 从库 L 中检索相应的参考资产 {Iϕe,t}e∈Et。然后,它将这些资产与镜头的静态描述和相机指令编译成一个结构化的条件包,通过多模态生成器合成关键帧图像。该关键帧作为镜头的视觉契约,承诺实体身份、服装和空间构图,并作为后续视频合成(第 4.3.2 节)条件的空间锚点。此外,我们在每张参考图像上附加显式的实体特定属性标签,确保生成器将视觉属性正确绑定到各自的主体上。

4.3.2 跨镜头动态状态传播

该 Agent 组合成每个镜头的时间运动规范,包括动态描述和对话分割,并渲染最终视频片段 vt。由于运动无法孤立规划,姿势连续性和因果情节后果等物理属性必须在镜头边界之间无缝持续。例如,镜头 t 的开启姿势必须与镜头 t−1 的终止配置重合,且物理状态(如刚刚摔倒的角色仍在地面上)必须保持一致。我们使用场景局部的滑动窗口规划器解决这些时间依赖性,该规划器在两个预生成的连续性信号上运行:文本终态约束和视觉关键帧条件。这种设计实现了完全并行的窗口执行,绕过了窗口间的顺序依赖。

9

第 10 页

场景局部滑动窗口规划。在每个场景内,镜头序列被划分为重叠的窗口。每个窗口包含 $g$ 个连续的目标镜头,为其生成动态描述,并在两侧各填充最多 $c$ 个上下文镜头。严格从同一场景中提取上下文可防止跨场景条件泄漏。多模态规划 Agent 接收窗口中的所有镜头,包括带有显式角色标注(目标与上下文)的渲染关键帧图像以及每个镜头的元数据。随后,Agent 联合为每个目标镜头生成带时间戳的动态描述,详细阐述分段动作、估计的总时长以及结构化的对话分割。这种联合生成使 Agent 能够协调连续目标之间的节奏和运动学过渡,而周围的上下文则将这些过渡锚定在视觉上可观察的边界状态中。

双通道连续性条件约束。跨镜头一致性通过两个通道来强制实施,这两个通道共同约束运动必须达到的目标状态以及边界帧的视觉实现:

1) 末端状态约束(文本):每个镜头指令 $d_t$ 携带在上游镜头规划阶段预计算的末端状态规范,规定镜头的终端视觉和空间配置。这些末端状态通过显式的顺序链式规划进行设计,其中镜头 $t$ 的起始帧源自镜头 $t-1$ 的末端状态,从而在叙事场景中形成预实现的连续性骨干。规划 Agent 被强制要求其动态描述的终止配置与此规定的末端状态一致,从而将跨镜头连贯性从生成的涌现属性转变为强制约束。

2) 视觉条件约束(多模态):窗口中所有镜头(包括目标和上下文)的关键帧图像作为带有位置标注的有序多模态输入提供。这些图像携带空间布局和外观细节,如光照、道具放置、角色与相机的距离以及构图框架,这些是仅靠文本末端状态描述无法完全指定的。 Agent 可以直接观察窗口边界处的已实现视觉状态,并规划与周围镜头在空间和摄影上连续的运动。

这两个通道是互补的:文本通道约束每个过渡的语义目标,指定运动必须到达的位置及其原因;视觉通道约束其感知实现,定义过渡必须呈现的外观。它们的联合条件约束产生了同时在叙事上忠实且视觉上无缝的过渡,而无需在窗口之间进行任何顺序耦合。

视频渲染。最后,给定关键帧图像和规划好的动态描述,视频生成器为每个镜头合成最终视频片段 $v_t$。由于动态规划阶段在离线状态下解决了所有时间和空间依赖关系,一旦规划完成,各个片段即可完全并行渲染。

4.3.3 带校正的闭环状态验证

该 Agent 组通过反馈引导的验证循环,强制执行渲染输出与规定世界状态之间的一致性。该循环在关键帧图像和视频片段上运行,执行结构化的诊断-校正-选择周期,以系统地解决生成差异。

诊断验证。对于每个生成的关键帧,视觉语言验证器根据静态规范和参考资产评估视觉合规性,评估身份一致性、空间构图和语义对齐等核心维度。同样,对于每个视频片段 $v_t$,时间验证器根据 $d_t$ 中的动态描述和末端状态约束评估合规性,检查时间连续性、对话对齐和视觉缺陷等核心维度。两个验证器均输出包含多维质量指标和本地化错误描述的结构化诊断报告,而非简单的二元判断。

校正再生。当验证器发出再生命令时,它会发出针对性的校正指导以调节后续尝试。对于关键帧图像,验证器生成一组校正点,这些是可操作的、祈使语气的指令,与参考资产一起直接注入提示中。对于视频片段,它生成完整的修复动态描述,调整时间间隔并修正时长提示。这种针对性方法确保再生由精确的诊断循环驱动,而非随机试错。

10

第 11 页

评分门控选择。在重新生成后,新候选项会被重新评估。系统通过比较评估分数来保留更优版本,并优先考虑视频段的内容完成率。为防止质量退化,如果重新生成的输出没有显示出改进,系统将回滚到之前的最佳候选项。此循环最多重复 K 轮,每次迭代的诊断报告都会指导下一次修正尝试。

该验证过程按镜头独立执行,从而保留了进化阶段的并行效率。在结构上,这种闭环设计将个体偏差限制在验证器的容忍范围内,防止了长电影序列中困扰开环管道的累积误差传播。

4.4 通过显式状态外部化实现并行

长视频生成通常被视为一种固有的顺序过程。我们证明,这种顺序瓶颈仅仅是隐式状态表示的产物,而非任务本身的固有属性。通过将世界状态外部化为预材料化的轨迹,我们将运行时主导的进化阶段的理论延迟从 O(N) 降低至 O(1)。

隐式状态的顺序瓶颈。自回归世界模型和顺序扩散管道 [3, 4, 34] 将状态嵌入生成轨迹中:渲染镜头 t 需要镜头 t−1 的实际输出作为条件输入,从而形成全局因果链。假设每个镜头的渲染成本为 τ,总镜头数为 N:

Lseq = N · τ = O(N). (8)

显式状态外部化下的并行延迟。相比之下,我们的公式通过应用转换函数 T 对源文本进行处理,离线预材料化了世界状态轨迹 {Wt}Nt=1,无需任何渲染输出。进化阶段随后依次执行三个阶段,每个阶段内部在所有 N 个镜头上并行化:

1) 关键帧渲染:每个镜头使用其预分配的状态标识符独立查询参考库 L。所有 N 个关键帧图像并行渲染,产生恒定延迟 τimg。

2) 动态规划:大小有界的场景局部滑动窗口 w = g + 2c ≪ N 仅消耗预材料化的信号。所有 ⌈N/g⌉ 个窗口并行执行,产生规划延迟 τplan(w)。

3) 视频渲染:每个视频段 vt 由其关键帧图像及其动态描述独立合成。所有 N 个段并行渲染,产生恒定延迟 τvid。

进化阶段的总延迟受限于:

Levo = τimg + τplan(w) + τvid = O(1) in N, (9)

因为各个项均不依赖于序列长度 N。与公式 8 相比,这带来了 Θ(N) 的理论加速。在实践中,可用计算资源是有限的。给定 P 个并行工作器,批处理延迟按 O(N/P) 缩放,对于任何合理的 P,这在 N 上仍然显著低于线性。

状态解耦条件。仅当渲染器在镜头 t 消耗的信息集 It 不包含来自其他镜头的渲染输出时,这种复杂度降低才成立。顺序方法通过要求 output(t−1) ∈ It 违反了这一条件。相比之下,我们的管道保证:

It ⊆{Wt, L, dt, {kj}j∈Jt}, (10)

其中 kj 表示镜头 j 的关键帧图像,Jt 表示镜头 t 周围的滑动窗口上下文。这种解耦源于显式状态外部化;任何满足此条件的长视频生成系统,无论其底层生成模型骨干网络如何,自然都会继承相同的并行加速效果。

分析范围。我们故意将延迟分析限制在进化阶段,因为它主导了从小说到电影的端到端运行时。此阶段的每个镜头都会调用重型图像和视频生成器,其每镜头墙钟时间比构建阶段的 LLM 驱动符号操作大几个数量级,后者随源文本长度缩放,而非随远大于 N 的镜头数缩放。因此,并行化进化阶段捕获了绝大部分可实现的端到端加速,而剩余的构建延迟在实际中仅占总运行时间的极小部分。

11

第 12 页

5 评估

5.1 概述

现有的视频生成基准测试,如 MovieBench [37]、ViStoryBench [50] 和 MSAVBench [36],主要针对短片片段的质量或多镜头音频-视频一致性,但并未评估小说改编电影生成中至关重要的能力:对源文本的叙事保真度、在情节驱动演变下的长程实体状态连贯性,或在叙事复杂性方面的鲁棒性。为了弥补这些空白,我们引入了 FilmEval,它包含两个组成部分:(i) 一个难度分级的基准测试,包含 15 部源小说,根据角色数量、情节复杂度和世界观构建丰富程度划分为简单、中等和困难三个层级;(ii) 九个自动指标,涵盖三个维度,即 Cinematic Presentation(电影呈现)、Film Consistency(电影一致性)和 Novel Fidelity(小说保真度),提供了对生成电影质量的多视角评估,而 prior benchmarks 未对此进行评估。

5.2 基准数据集

FilmEval 包含一个难度分级的数据集,涵盖 15 部源小说,题材多样,包括日常生活、历史小说、革命浪漫主义和喜剧奇幻。该数据集由 6 部英文小说和 9 部中文小说组成,既选自改编的经典文学作品(如《项链》、《套中人》、《麦琪的礼物》),也选自原创的当代小说(如《时间的纽带》、《寒春里的白丝》、《华强买西瓜》),确保了广泛的叙事风格、文化背景和作者来源覆盖。为了系统地诊断方法在叙事复杂性方面的鲁棒性,数据集被划分为三个层级。简单级小说角色少、情节线性、场景具体。中级小说引入了更多的角色互动、场景转换和适度的因果依赖。困难级小说呈现复杂的世界观构建、多个角色、长程情节弧线以及密集的事件结构。这种分层允许对每种方法随着叙事复杂性增加而性能下降的情况进行细粒度分析,而不是依赖单一的聚合分数。

开始 片段 结束

… … …

… … …

视觉呈现质量 叙事表达与节奏 视听表现

风格一致,背景细节丰富且富有氛围。 清晰描绘了意外的重逢。 对话清晰且表演得当,与情绪相符。 灯光和雨效有效地营造了氛围。 正反打镜头传达了对话和情感联系。 环境雨声提供了沉浸式的背景。 角色设计在整体上始终保持稳定。 场景主要依赖对话,动作极少。 基本唇形同步与对话相符。 角色动画僵硬,依赖有限的动作。 场景严重依赖对话,动作极少。 唇形同步缺乏细微的口型变化。 视觉呈现稳定且美观, 叙事清晰,节奏支持了 音频清晰且有助于场景,尽管动画技术简单, 尽管角色动画有限并显示出轻微的 重逢的情感重量,使其易于理解。 同步性良好。得分为 84。 一致性变化。得分为 82。 得分为 86。

图 5 电影呈现评估示意图。给定一部生成的电影,FilmEval 将其划分为时间片段,并从三个维度评估每个片段:Visual Presentation Quality(VP,视觉呈现质量)、Narrative Expression and Pacing(NEP,叙事表达与节奏)和 Audio-Visual Performance Quality(AVP,视听表现质量)。对于每个维度,评估者识别正面证据和可见缺陷,然后分配细粒度分数。

5.3 评估指标

概述。FilmEval 从三个互补的维度评估生成的电影: 1) Cinematic Presentation(电影呈现)量化生成输出的电影级制作质量,包括视觉美学、镜头构图、氛围渲染和整体感知保真度。 2) Film Consistency(电影一致性)评估跨镜头和时间轴上角色、场景、动作和细粒度视觉细节的连贯性。 3) Novel Fidelity(小说保真度)衡量生成电影在角色、事件、动作和叙事结构方面对源小说的忠实程度。

所有指标均通过提示多模态大语言模型(即 Gemini 3.1 Pro [31])实现为完全自动化的评估器,并辅以精心设计的特定任务指令,共同处理源小说和生成的电影片段。更多细节见附录。

12

第 13 页

电影呈现。该维度评估生成的影片是否作为一个连贯的电影作品发挥作用,重点关注感知质量、叙事节奏以及视听表达。

1) 视觉呈现质量 (V P):V P 衡量生成帧的视觉稳定性、合理性和美学吸引力。它对显著的伪影(如模糊、解剖结构失真、面部和手部扭曲、几何结构崩溃、物体弹出、光照不一致、重影以及物理上不合理的运动)进行惩罚,并进一步验证对指定电影风格的遵循程度。

2) 叙事表达与节奏 (NEP):NEP 评估影片是否向不熟悉原著小说的观众传达了一个可理解的故事。它考察输出的内在叙事质量,包括角色关系的清晰度、场景转换的连贯性、主要情节发展的可追溯性,以及节奏的恰当性(即既不仓促、空洞,也不碎片化)。

3) 视听表演质量 (AV P):AV P 评估音频轨道的清晰度、稳定性及其对表现力的贡献,包括对话可懂度、音量稳定性、音效、环境氛围以及与视觉画面的同步性。由于许多流水线仍采用轻量级或可选的音频模块,因此 AV P 的评分标准比视觉质量更为宽松;然而,反复出现的同步故障、刺耳的削波失真、无法听清的对话,或损害叙事理解的音频内容,均会受到明确扣分。

角色一致性 帧 角色 小说先验 分析 他们进入车站附近的一家小店以躲避 检查清单 雨水。周远买了两杯热茶。 周远:他穿着一件深色风衣 手提一个旧皮箱 他们 坐在 窗边, 讨论他 的 过往 得分 身份 稳定性 他 留着 短发,肩膀宽阔。 离别, 并 邀请她 一同 去看冬天的 大海。 83 故事角色 对齐 肩膀 数量 一致性 判决 小说契合度 高 开往海城的列车开始广播。林夏 林夏:她穿着一件浅色风衣, 存在合理性 拿起雨伞,周远提起皮箱,两人 手里拿着一个纸袋。她留着长发 并肩走向站台,一同离开。 身形纤细。 一同离开。

开始 结束

… … …

场景一致性 物体一致性 帧 结构 分析 光线 店铺结构稳定,与小说线索高度吻合, 时间线 窗户 在多个镜头中可识别,且与其他场景 有明显区别。得分为 93.73。 柜子

分析 小说先验 检查清单 纸袋在视觉上保持一致, 身份 场景 名称: 车站旁 小店 形状 和 外观, 在帧间持续存在 across 帧 时间 持久性 线索: “温暖的 黄色 灯光”, “窗户

没有明显的消失,并且大多符合物理合理性。纸袋座椅”、“靠墙的柜子”。动作合理。得分为 91.27。空间布局一致性 其他场景

图 6 电影一致性评估示意图。角色一致性(CC)模块将银幕上的角色外观与源自小说的角色先验进行对比,以评估身份稳定性和故事契合度。场景一致性(SC)模块验证重复出现的场景是否保留了稳定的结构锚点,并与其他场景保持可区分性。物体一致性(OC)模块跨帧追踪显著物体,以评估其身份、时间持久性和空间连贯性。

电影一致性。该维度评估生成的电影是否在时间上维持稳定的视觉实体和环境,考察角色身份的一致性、场景的结构稳定性,以及关键物体在镜头间的时间与空间连贯性。

1) 角色一致性(CC):CC 评估角色在整个电影中是否保持可识别且忠于故事。FilmEval 从源小说中提取结构化的角色先验,包括角色身份、视觉线索、时间顺序事件、预期的银幕外观、禁止的共现情况以及数量约束。随后,根据五个子标准对每个电影片段进行评分:身份稳定性、故事角色契合度、出场合理性、数量与构成一致性以及小说依据性。闪回、回忆、时间跳跃和年龄增长不被视为身份漂移,除非角色在同一连续时间线中明显转变为另一个个体。

2) 场景一致性(SC):SC 评估同一场景在相邻镜头间是否保持可识别且结构稳定。FilmEval 从小说中提取紧凑的场景先验,包括重复出现的

13

第 14 页

或叙事上显著的场景、场景类型、视觉线索和故事位置。随后,每个电影片段沿五个子标准进行评分:场景稳定性、结构布局连续性、跨镜头场景可识别性、场景间可分离性以及小说场景对齐度。该指标以稳定的背景元素为锚点,容忍常规相机运动、缩放、部分遮挡和轻微的布景变化,同时对导致看似连续的位置看起来像不同地方的实质性变化进行惩罚。

3) 对象一致性 (OC):OC 评估叙事相关对象的稳定性,包括道具、家具、车辆和其他显著物品。每个片段沿四个子标准进行评分:对象身份稳定性、时间持久性、物理合理性和空间布局一致性。具体的对象级故障,如形状变形、闪烁、重复、物理违规和布局跳跃,会被进一步映射到分级严重性的惩罚中。

图 7 小说保真度评估示意图。叙事幻觉抵抗 (NHR) 模块将电影中的原子事实和情节事件与小说进行比较,标记缺乏支持或不一致的内容。逻辑可靠性 (LR) 模块对齐小说和电影事件链,以验证时间顺序、因果关系和角色行为归属,区分匹配、矛盾和缺失的事件。故事还原 (SR) 模块检查源自小说的细粒度清单中的细节,以量化源内容覆盖率。

小说保真度。这一维度评估生成电影对其源小说的忠实度,考察三个互补方面:电影是否捏造了缺乏支持的内容,是否保留了叙事逻辑,以及是否还原了细粒度的源细节。

1) 叙事幻觉抵抗 (NHR):NHR 衡量生成电影避免缺乏支持或叙事上不一致内容的程度。FilmEval 在两个粒度上评估幻觉:原子事实和情节级事件,每个都与源小说中的对应项进行比较。每个项目被分配四个标签之一:源支持、合理推演、不一致捏造或源冲突渲染。后两者被计为幻觉。

2) 逻辑可靠性 (LR):LR 评估生成电影是否保留了源叙事的因果、时间和关系逻辑,重点关注矛盾而非遗漏。典型故障包括颠倒因果关系、将事件置于不可能的顺序、将行为归因于错误的角色,以及产生不兼容的场景转换。

3) 故事还原 (SR):SR 量化生成电影中保留的源小说内容。FilmEval 首先将小说提炼为细粒度的改编清单,涵盖原子细节,包括情节事件、角色行为、角色关系、对话和场景设置。随后,将生成的电影转换为密集的时间顺序描述,并据此对每个清单项目进行对齐,标记为显式匹配、部分匹配、缺失或矛盾。对最初未解决的项目应用第二次基于视频的审查,以减少仅由文本重建引入的假阴性。

14

第 15 页

表 1 FilmEval 上的整体性能比较。我们报告了三个指标组:电影呈现(Cinematic Presentation, CP)、电影一致性(Film Consistency, FC)和小说保真度(Novel Fidelity, NF),分别在简单(Easy)、中等(Medium)和困难(Hard)难度层级下进行评估。最右列报告了所有九个单元格的总体平均值。粗体表示最佳结果,下划线表示第二佳结果。

| Method | Year | Easy CP | Easy FC | Easy NF | Medium CP | Medium FC | Medium NF | Hard CP | Hard FC | Hard NF | Overall | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | MM-StoryAgent [40] | 2025 | 81.53 | 84.40 | 78.49 | 77.47 | 81.22 | 74.44 | 80.47 | 87.70 | 78.88 | 80.51 | | VGoT [47] | 2025 | 83.27 | 86.93 | 76.82 | 80.33 | 87.72 | 82.37 | 80.00 | 87.99 | 72.74 | 82.02 | | MovieAgent [38] | 2025 | 77.27 | 84.28 | 85.88 | 78.93 | 87.07 | 86.62 | 81.73 | 89.43 | 84.63 | 83.98 | | ViMax [13] | 2026 | 83.13 | 87.66 | 78.48 | 76.27 | 85.94 | 78.61 | 78.73 | 87.60 | 73.55 | 81.11 | | VideoClaw [9] | 2026 | 82.27 | 86.15 | 84.22 | 81.67 | 88.34 | 82.15 | 80.53 | 88.12 | 84.28 | 84.19 | | FilmWorld (Ours) | 2026 | 84.00 | 90.93 | 92.66 | 82.47 | 91.56 | 92.91 | 82.87 | 92.95 | 94.09 | 89.38 |

6 实验

6.1 实验设置

数据集与指标。我们在 FilmEval(第 5 节)上进行评估,报告其中定义的三个指标组:电影呈现(Cinematic Presentation, CP)、电影一致性(Film Consistency, FC)和小说保真度(Novel Fidelity, NF)。所有分数均在 [0, 100] 范围内,并在简单、中等和困难层级之间均匀聚合。

基线方法。我们将 FilmWorld 与五种具有代表性的 Agent 视频生成系统进行对比:MM-StoryAgent [40]、VGoT [47]、MovieAgent [38]、ViMax [13] 和 VideoClaw [9]。长视频生成方法未纳入此比较,因为它们消耗的是分镜头提示(per-shot prompts)而非原始散文,且在架构上不适合小说到电影的生成任务。为了隔离框架层面的差异,所有方法均在统一的基础栈上部署:以 Gemini 3.1 Pro 作为多模态大语言模型,Nano Banana 2 作为图像生成器 [31],以及 Wan 2.7 作为视频生成器 [32]。对于原本未设计为直接输入原始文学散文的基线方法,我们应用了最小化的前端适配以使其兼容小说到电影任务,同时严格保留其原始的编排逻辑。

实现细节。FilmWorld 采用完全异步编排实现。关键帧以 2K 分辨率和 16:9 宽高比渲染,视频片段以 1080P 生成,每个镜头时长限制在 [1, 15] 秒内。动态状态传播使用滑动窗口,其中 $g=2$ 个目标镜头,每侧填充 $c=1$ 个上下文镜头。闭环验证器对关键帧和视频片段执行最多 3 轮修正,对参考资产执行 1 轮修正。最后,为了确保公平比较且不损失通用性,我们在所有方法中统一应用吉卜力(Ghibli)动漫风格,该风格通过直接注入提示 straightforwardly 实现,从而消除了由风格差异引入的潜在评估偏差。更多实验细节见附录。

6.2 定量分析

FilmEval 上的整体性能比较。表 1 在 FilmEval 基准上将 FilmWorld 与五种最先进的 Agent 视频生成系统进行了比较。FilmWorld 取得了 89.38 的最高总体得分,比最强的基线 VideoClaw [9] 高出 5.19 分,并在所有评估单元格中均领先。值得注意的是,在小说保真度方面,FilmWorld 在简单、中等和困难层级上分别比第二名 MovieAgent [38] 高出 +6.78、+6.29 和 +9.46 分。这一不断扩大的差距证实,将生成建立在符号状态轨迹之上能有效防止叙事遗漏和幻觉。FilmWorld 还获得了更高的电影一致性分数 90.93/91.56/92.95,验证了状态外化和视觉引用成功地将连贯性转化为强制约束。关键在于,当复杂度增加时,像 VGoT [47] 和 ViMax [13] 这样的基线方法由于累积漂移而性能下降多达 3.23 分,而 FilmWorld 的平均性能在狭窄的 0.99 分区间内(89.10 → 88.98 → 89.97)保持异常稳定。这种不变的性能特征从经验上验证了我们的解耦范式:预先实体化状态轨迹完全使下游渲染质量免受叙事深度的影响。

15

第 16 页

表 2 FilmEval 上所有三个难度层级的细粒度子指标比较。我们报告了表 1 中介绍的三个指标组的九个子指标:电影呈现(Cinematic Presentation, CP)包含 VP、NEP、AVP;电影一致性(Film Consistency, FC)包含 CC、SC、OC;小说保真度(Novel Fidelity, NF)包含 NHR、LR、SR。每种方法分别报告其三个难度行的数据;最右侧的 Avg 列是该行九个子指标的平均值。粗体和下划线分别标记同一难度层级内的最佳和次佳结果。

| Method | Year | Difficulty | Cinematic Presentation (VP, NEP, AVP) | Film Consistency (CC, SC, OC) | Novel Fidelity (NHR, LR, SR) | Avg | | :— | :— | :— | :— | :— | :— | :— | | | | | VP | NEP | AVP | CC | SC | OC | NHR | LR | SR | | | MM-StoryAgent [40] | 2025 | Easy | 82.60 | 81.00 | 81.00 | 71.75 | 85.10 | 96.35 | 83.06 | 84.40 | 68.00 | 81.47 | | | | Medium | 77.20 | 76.20 | 79.00 | 63.27 | 86.46 | 93.94 | 80.71 | 83.40 | 59.20 | 77.71 | | | | Hard | 80.60 | 80.20 | 80.60 | 75.93 | 89.50 | 97.68 | 94.45 | 81.80 | 60.40 | 82.35 | | VGoT [47] | 2025 | Easy | 84.60 | 84.00 | 81.20 | 80.30 | 86.84 | 93.67 | 80.25 | 84.80 | 65.40 | 82.34 | | | | Medium | 79.80 | 82.80 | 78.40 | 79.09 | 88.61 | 95.45 | 91.30 | 86.80 | 69.00 | 83.47 | | | | Hard | 78.80 | 80.60 | 80.60 | 78.77 | 88.19 | 97.01 | 89.23 | 78.80 | 50.20 | 80.24 | | MovieAgent [38] | 2025 | Easy | 76.00 | 78.40 | 77.40 | 72.34 | 85.56 | 94.93 | 85.83 | 93.80 | 78.00 | 82.47 | | | | Medium | 80.00 | 80.80 | 76.00 | 76.50 | 87.54 | 97.16 | 90.26 | 91.60 | 78.00 | 84.21 | | | | Hard | 81.40 | 84.20 | 79.60 | 79.22 | 90.52 | 98.56 | 90.08 | 94.60 | 69.20 | 85.26 | | ViMax [13] | 2026 | Easy | 81.80 | 82.40 | 85.20 | 82.02 | 87.02 | 93.95 | 87.65 | 80.80 | 67.00 | 83.09 | | | | Medium | 73.80 | 78.40 | 76.60 | 78.25 | 86.08 | 93.49 | 94.83 | 77.40 | 63.60 | 80.27 | | | | Hard | 74.80 | 80.20 | 81.20 | 79.91 | 88.81 | 94.08 | 90.26 | 76.60 | 53.80 | 79.96 | | VideoClaw [9] | 2026 | Easy | 81.00 | 83.20 | 82.60 | 68.28 | 94.78 | 95.38 | 88.07 | 89.80 | 74.80 | 84.21 | | | | Medium | 81.40 | 81.40 | 82.20 | 77.33 | 92.43 | 95.27 | 90.64 | 85.00 | 70.80 | 84.05 | | | | Hard | 76.80 | 81.40 | 83.40 | 74.17 | 94.52 | 95.67 | 93.84 | 90.00 | 69.00 | 84.31 | | FilmWorld (Ours) | 2026 | Easy | 81.80 | 85.80 | 84.40 | 82.90 | 92.64 | 97.22 | 96.97 | 97.00 | 84.00 | 89.19 | | | | Medium | 80.20 | 84.00 | 83.20 | 82.15 | 95.25 | 97.29 | 93.53 | 99.20 | 86.00 | 88.98 | | | | Hard | 81.00 | 84.00 | 83.60 | 84.11 | 96.04 | 98.70 | 97.27 | 98.80 | 86.20 | 89.97 |

FilmEval 上的细粒度性能比较。我们从两个互补的角度提供了细粒度的比较。表 2 分解了所有三个难度层级在子指标层面的性能。FilmWorld 在所有难度层级中均取得了最高的总体平均分,在九个子指标中的绝大多数保持了顶级性能。其优势在小说保真度(Novel Fidelity)组(例如 NHR、LR 和 SR)中最为显著,在 Hard 层级下与基线方法的差距显著扩大,验证了我们的符号状态轨迹在防止叙事遗漏和幻觉方面的有效性。相反,电影呈现(Cinematic Presentation)组在所有方法中表现出相对均匀的分数的,反映了共享基础模型主干网络的支配性影响。为了进一步评估对叙事复杂性的鲁棒性,图 8 绘制了每种方法在小说保真度–电影一致性空间中的每部小说结果。FilmWorld 的协方差椭圆占据了具有最高均值坐标的右上区域,确认了其总体优势在所有 15 部小说中都是一致的,而非由有利的外围值驱动。关键在于,FilmWorld 的椭圆比所有基线方法的椭圆都要紧凑得多,表明其小说间方差显著降低。相比之下,基线方法表现出庞大且分散的椭圆,并且从 Easy 到 Hard 的点呈现出明显的向左下方位移,揭示了它们对叙事难度增加的敏感性。

人工评估与自动-人工对齐。为了验证我们的自动指标是否忠实地反映了人类感知,我们招募了六名标注员对全部 90 部生成电影(15 部小说 × 6 个系统)在相同的三个指标组上进行 0–5 分的评分,产生了 540 个判断(表 3)。FilmWorld 获得了最高的总体评分 4.25,以显著的 +0.92 优势超越了最强的基线 VideoClaw [9](3.33),并在所有九个难度–维度单元格中排名第一;差距在小说保真度上最为明显,FilmWorld 在每个层级均超过 4.5,而所有基线均低于 3.8。关键在于,所有六个系统的人工排名与 FilmEval 诱导的排名完全相同(Spearman ρ = 1.0),表明我们的基准保持了正确的系统级排序。在更细粒度的每部电影层面,如图 9 所示,所有三个组均显示出统计上显著的正相关(CP/FC/NF 的 Pearson r 分别为 0.330/0.548/0.711,所有 p < 10−2),并且对齐程度从 CP 到 FC 到 NF 单调增强:我们的基于检查表、以小说为锚点的一致性和保真度指标达到了强一致性(r > 0.54,p < 10−7),因为它们捕捉到了可客观验证的属性,而较弱的 CP 相关性反映了美学呈现的主观性质。

16

第 17 页

图 8 FilmEval 上各小说的性能分布。每个点代表在相应难度层级下评估的单个小说,绘制在小说保真度–电影一致性空间中。阴影区域表示在所有 15 部小说上估计的 2σ 协方差椭圆。FilmWorld 位于右上角区域,拥有最紧凑的椭圆,表明与所有基线相比,其性能始终更优且小说间方差显著更低。

表 3 FilmEval 上的人类评估结果。我们招募了一组人类标注员,在简单、中等和困难三个难度层级下,按照与表 1 相同的三个指标组,对生成的电影进行 0–5 分的评分(分数越高越好)。每个单元格报告该层级内收集评分的平均值 ± 标准差。最右列报告所有九个单元格的总体平均值。粗体表示最佳结果,下划线表示第二佳结果。

简单 中等 困难 方法 总体 电影呈现 电影一致性 小说保真度 电影呈现 电影一致性 小说保真度 电影呈现 电影一致性 小说保真度

MM-StoryAgent [40] 2.47±0.78 1.73±0.87 2.53±0.73 2.60±0.72 2.30±1.12 2.83±0.87 2.47±0.78 2.03±1.03 2.80±0.61 2.42 VGoT [47] 3.00±0.83 3.17±0.70 3.63±0.72 2.83±0.75 2.87±0.82 3.17±0.70 3.00±0.64 2.73±0.78 2.83±0.75 3.03 MovieAgent [38] 2.80±0.89 3.00±1.02 3.33±0.66 3.13±0.82 3.13±1.04 3.57±0.97 2.93±0.98 2.90±0.88 3.40±0.81 3.13 ViMax [13] 2.93±0.74 3.23±0.90 3.40±0.97 2.63±0.93 2.57±0.97 3.03±0.89 2.57±0.77 2.67±0.80 2.80±0.92 2.87 VideoClaw [9] 2.87±0.78 2.83±0.75 3.73±0.64 3.40±0.89 3.27±0.87 3.70±0.95 3.23±0.73 3.37±0.89 3.57±1.38 3.33

FilmWorld (Ours) 4.00±0.45 4.20±0.61 4.57±0.50 3.83±0.59 4.27±0.83 4.60±0.72 3.90±0.80 4.20±0.66 4.67±0.76 4.25

图 9 FilmEval 自动评分与人类评分的一致性。每个面板绘制了单个电影的自动评分与平均人类评分(0–5 缩放至 [0, 100])之间的关系,针对一个指标组,包含 90 个配对点(15 部小说 × 6 个系统),并按系统着色。实线为线性拟合,阴影带为其 95% 置信区间;每个面板标注了 Pearson r、Spearman ρ 和双侧 p 值。所有三个组均呈显著正相关,且一致性从电影呈现(r = 0.330)到电影一致性(r = 0.548)再到小说保真度(r = 0.711)逐渐增强。

17

第 18 页

表 4 在三部代表性小说上的消融研究,每部小说来自一个难度层级。我们对 FilmWorld 的三个核心设计进行消融,按其架构角色分组:(i) 构建阶段的显式世界状态建模,(ii) 演化阶段的跨镜头动态状态传播,其中三个子机制进一步单独消融,以及 (iii) 闭环验证。粗体和下划线分别标记同一列中的最佳和第二佳结果。

| | 电影呈现 | | | | | | 电影一致性 | | | 小说保真度 | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | :—: | | 方法 | VP | NEP | AVP | CC | SC | OC | NHR | LR | SR | Avg | | 世界状态建模 | | | | | | | | | | | | 无显式世界状态 | 81.72 | 84.10 | 81.72 | 54.50 | 90.09 | 95.51 | 90.51 | 96.67 | 83.71 | 84.28 | | 跨镜头动态状态传播 | | | | | | | | | | | | 无跨镜头传播 | 80.42 | 83.80 | 82.76 | 78.27 | 91.23 | 97.53 | 94.96 | 97.65 | 84.99 | 87.96 | | 无滑动窗口 | 81.38 | 84.11 | 83.75 | 79.33 | 92.65 | 97.27 | 92.11 | 98.67 | 85.40 | 88.30 | | 无文本终态 | 81.07 | 82.47 | 82.75 | 76.47 | 92.59 | 97.91 | 93.65 | 98.33 | 85.35 | 87.84 | | 无视觉关键帧 | 81.04 | 82.78 | 82.47 | 79.86 | 92.43 | 96.75 | 94.75 | 98.67 | 84.71 | 88.16 | | 闭环验证 | | | | | | | | | | | | 无闭环验证器 | 81.08 | 84.45 | 82.13 | 78.67 | 91.65 | 97.57 | 95.35 | 99.33 | 84.37 | 88.29 | | FilmWorld (ours) | 82.00 | 85.33 | 85.00 | 82.12 | 94.24 | 99.17 | 97.15 | 99.67 | 86.67 | 90.15 |

6.3 消融与诊断研究

组件级消融。 鉴于完整小说到电影的生成成本高昂,为了保持消融研究的成本可控,我们在三部代表性小说上进行了研究,每部小说来自一个难度层级。表 4 报告了在子集上对 FilmWorld 三个核心设计进行消融的结果。移除显式世界状态导致最严重的性能下降(90.15 → 84.28),其中角色一致性(Character Consistency)从 82.12 暴跌至 54.50。由于缺乏可寻址的状态标识符,下游生成器在每个镜头中重新推断实体身份并发生严重漂移,这证实了显式状态建模是长程一致性的结构基础,而非可选增强。对于跨镜头动态传播,移除该机制整体使平均分降至 87.96。进一步消融其子组件表明,单独使用任一通道均不足够:移除文本终态得分为 87.84,且 CC 下降 5.65 分;而移除视觉关键帧得分为 88.16,其中 AVP 和 SR 受影响最大。这两个通道约束了互补的维度,必须联合应用。禁用闭环验证器使平均分降至 88.29。与前两者不同,其影响分散在各个指标上,这与其作为残差缺陷修正器而非一阶约束提供者的角色一致。总体而言,这三个设计解决了不同的瓶颈,移除其中任何一项都会导致电影质量的可测量下降。

计算效率与可扩展性。 第 4.4 节预测,在 P 个并行工作线程下,演化阶段的延迟为 O(N/P),而顺序渲染为 O(N)。我们在关键帧生成阶段验证了这一点,这是最易于并行化的组件,镜头间无阶段内依赖,使用了 15 部 FilmEval 小说。对于每部小说,我们在生产设置 P=6 下测量并行墙钟时间,并通过对同一运行中每个镜头的 API 持续时间求和来模拟顺序基线,从而将调度效应与方法学混淆因素隔离开来。如图 10 (a) 所示,FilmWorld 将平均每个镜头的成本从 0.61 降低至 0.11 分钟/镜头,实现了 5.62 倍的加速,即达到了理论上限 P=6 的 93.7%,剩余差距归因于 API 速率限制和调度开销。图 10 (b) 显示,这种加速在 N ∈ [69, 244] 范围内紧密集中在 5.62 × ±0.22 内,与镜头数量 N 无关,证实了预测的 O(N/P) 缩放比例:状态解耦将顺序渲染转换为与叙事长度无关的有界并行工作负载。剩余的演化阶段(动态规划、视频渲染)共享这种与镜头无关的结构,并应表现出类似的增益。

修正轮次的边际收益递减。 我们进一步考察闭环验证器中每一轮修正实际贡献了多少,以证明我们轮次预算的成本效益。图 11 报告了对于每个验证器路径和难度层级,每一轮解决的镜头比例:Pass1 表示未经修正即通过的镜头,Resolved@Rk 表示在第 k 轮新解决的边际比例。

18

第 19 页

(分钟/镜头)

(×) 墙钟时间 加速比 关键帧 每镜头

顺序执行 FilmWorld (P=1,模拟) (P=6,实测) 镜头数量 (N) (a) 每镜头关键帧生成效率 (b) 每部小说加速比与镜头数的关系

图 10 FilmWorld 在关键帧生成上的计算效率和可扩展性。(a) 效率。并行执行 (P=6) 实现了 5.62 倍的平均加速比(达到理论上限的 93.7%),将每镜头成本从 0.61 分钟/镜头降低至 0.11 分钟/镜头。绿色菱形标记均值;点表示单个小说。(b) 可扩展性。加速比在 N ∈[69, 244] 范围内保持在 5.62 × ±0.22 以内,显示出对 N 无依赖性,证实了 O(N/P) 的缩放特性。顺序基线 (P=1) 是通过累加相同运行中的每镜头 API 持续时间来模拟的。

图 11 闭环校正轮次的收益递减。对于每种验证路径(图像和视频)及难度层级,我们报告未经校正即通过的镜头比例 (Pass1),以及后续每一轮新解决的边际比例 (Resolved@R1–R3),同时展示回滚率(虚线,右轴)。边际收益在各轮次间急剧衰减(R2/R1 和 R3/R2 均低于 0.55),表明额外校正轮次的收益迅速递减,这支持我们将 K = 3 选为具有成本效益的轮次预算。

在两种路径和所有难度层级中,边际收益随每一轮次急剧且单调地衰减:R2/R1 落在 0.44–0.55 之间,R3/R2 进一步降至 0.41–0.49,这意味着每一轮额外轮次恢复的缺陷少于上一轮成就的一半。这种陡峭的收益递减曲线表明,第一轮校正已经解决了大部分可恢复的缺陷,而后续轮次越来越多地以不成比例的成本去追逐日益缩小的硬故障集合,从经验上支持我们将 K = 3 轮作为具有良好成本-质量权衡的预算,超出此范围后进一步迭代几乎不提供实际收益。我们还观察到,视频路径对叙事难度的敏感性高于图像路径,Pass1 从简单难度的 62.6% 降至困难难度的 51.7%;并且图像路径表现出比视频路径更高的回滚率(38.8–45.0% 对比 22.9–26.8%),这表明结构性关键帧缺陷比动态描述更难被可靠地校正。

19

第 20 页

MovieAgent VideoClaw FilmWorld (a) 连续镜头间角色外观一致性

VGoT MovieAgent

ViMax VideoClaw FilmWorld (b) 连续镜头间场景背景一致性

图 12 连续镜头间的短程视觉一致性对比。(a) 角色外观一致性,基于《项链》的高潮揭示场景进行评估,重点关注伯爵夫人的视觉稳定性。(b) 场景背景一致性,基于《华强买瓜》的劈西瓜场景进行评估,重点关注背景布局和空间排列。绿色对勾和红色叉号表示每个镜头是否与场景片段的主导外观在视觉上保持一致。

6.4 定性分析

跨时间尺度的视觉一致性。我们在两个互补的时间尺度上评估视觉一致性。1) 短程一致性。图 12 比较了连续镜头间的视觉一致性。对于角色外观,在《项链》的高潮揭示场景中进行评估,FilmWorld 保持了伯爵夫人的身份稳定性,而基线方法则表现出明显的外观漂移。对于场景背景,在《华强买瓜》中进行评估,FilmWorld 在镜头间保持了空间布局的一致性,而竞争方法则产生了结构不一致的背景。2) 长程一致性。图 13 考察了整个电影过程中的视觉状态追踪,针对一种更具挑战性的能力:根据叙事进展准确演变实体状态。对于《春寒白丝》中的角色状态追踪,FilmWorld 正确更新了主角在五个叙事驱动状态下的外观,而基线方法在整个过程中产生的角色外观几乎静止不变。对于《时间之绊》中的位置状态追踪,FilmWorld 忠实地反映了中心老槐树的时间演变,而基线方法要么生成静态的复制粘贴式外观,要么产生时间上不连贯的场景。这些结果证实,FilmWorld 的显式世界状态建模能够在两个时间尺度上实现连贯的实体演变,这是现有基线方法系统性地无法实现的能力。

镜头间状态连续性。图 14 展示了来自四部源小说的代表性镜头转换,每个案例都说明了 FilmWorld 在镜头边界处保持物理和空间连续性的能力。在每种情况下,前一个镜头的终端状态,包括实体姿态、物体放置和空间布局,都无缝地作为后一个镜头的初始配置延续下来。例如,林觉民在前一个镜头结束时的跪姿,在他在下一个镜头开头磕头时被精确保留。

20

第 21 页

MovieAgent VideoClaw FilmWorld (a) 贯穿整部电影的长程角色状态追踪

VGoT MovieAgent

ViMax VideoClaw FilmWorld (b) 贯穿整部电影的长程位置状态追踪

图 13 贯穿整部电影的长程视觉状态追踪对比。(a) 《寒春白绫》中角色状态的追踪。FilmWorld 正确更新了主角林觉民在五个叙事驱动状态(日常、旅行、战斗、审讯和处决着装)下的外观,而基线方法无论剧情如何推进,都几乎保持角色外观不变。(b) 《时光之绊》中位置状态的追踪。FilmWorld 保留了老槐树的身份,并忠实地反映了其时间演变,而基线方法要么产生静态的、类似复制粘贴的外观,要么产生视觉一致性极低的混乱场景。

“林觉民双膝跪地,深深叩首” —— 《寒春白绫》

“他点燃一支烟,深吸一口,目光落在街角的水果摊上” —— 《华强买西瓜》

“纸飞机再次被抛出,滑翔过树梢” —— 《时光之绊》

“他将带来的朴素披肩搭在她的肩上,那是他们平凡生活中常见的披肩” —— 《项链》

图 14 FilmWorld 展示的跨镜头状态连续性。每一行展示了来自不同源小说的代表性镜头转换,绿色箭头标记了镜头边界。左侧帧显示前一个镜头的尾部,右侧帧显示后一个镜头的头部。FilmWorld 在镜头边界处保持了无缝的物理和空间连续性,实体姿态、空间布局和物体状态自然地跨镜头延续。

21

第 22 页

1 2 别利科夫刚走到门口,科瓦连科就急躁地拽了他一把。别利科夫脚下一滑,连同他的套鞋一起滚下了楼梯。幸好他并没有受重伤,只是狼狈不堪。但就在那一刻,3瓦连卡带着两位女士回来了。当她看到别利科夫皱巴巴的大衣、歪斜的眼镜和滑稽的模样时,4她以为他只是不小心摔了一跤,不禁哈哈大笑起来。“哈哈哈!”那清脆的笑声终结了一切:它终结了大家所想象的那桩婚事,也终结了别利科夫多年来在人前维持的尊严。他没有听清瓦连卡后来说了什么。他只感觉到整个世界都在看着他、嘲笑他。5回到家后,他做的第一件事就是把瓦连卡的照片从书桌上拿走,塞进抽屉深处。 6 然后他上了床,从此再也恢复不到以前的状态。

VGoT 1 2 4 6

1 2 4 5 6 MoveiAgent

ViMax 1 2 4 6 VideoClaw 1 2 4 FilmWorld 1 2 3 4 5 6

图 15 《套中人》关键情节序列上的叙事保真度对比。源段落描述了六个按顺序排列的情节事件,编号为 1–6:科瓦连科拽别利科夫、别利科夫滚下楼梯、瓦连卡带着两位女士回来、瓦连卡大笑、别利科夫拿走她的照片、别利科夫上床睡觉。空白帧表示方法未能生成的情节事件。所有基线方法都至少遗漏了两个情节事件,而 FilmWorld 是唯一一个以正确的叙事顺序忠实还原所有六个事件的方法。

《春寒》中下一镜头的白绸,以及《项链》中披肩搭在女子肩上的动作在镜头边界处流畅无间断。这种连续性直接源于 FilmWorld 的双通道连续性条件约束:文本终态约束规定了每个镜头必须到达的精确终端配置,而视觉关键帧通道确保了边界处的感知实现在空间和摄影上是连贯的。这两个通道共同将镜头间连续性从一种尽力而为的启发式方法提升为结构性保证,使 FilmWorld 能够在镜头边界处维持物理上合理且叙事连贯的动作序列。

叙事保真度与情节还原。图 15 展示了《套中人》中一个关键情节序列的叙事保真度定性比较,该序列包含六个因果相连的情节事件。所有基线方法都未能生成至少一个事件,其中 VideoClaw [9] 遗漏了三个事件,导致严重的叙事空白,破坏了场景的因果逻辑。此外,即使基线方法生成了某些事件,其视觉内容在人物身份、空间布局或场景背景方面往往也与源文本存在偏差。相比之下,FilmWorld 以正确的叙事顺序忠实还原了所有六个情节事件,具有空间连贯的场景构图,在整个序列中营造出令人信服的连续空间感,而基线方法则产生视觉上的突兀转换,破坏了叙事沉浸感。这些结果表明,FilmWorld 基于从小说中导出的符号状态轨迹进行的显式世界状态建模,能够实现现有基线方法无法达到的系统化且细粒度的情节还原。

失败案例剖析。虽然显式世界状态建模显著提高了连贯性,但 FilmWorld 并非不会失败。图 16 考察了代表性案例。值得注意的是,在每个案例中,提供给渲染器的世界状态和镜头指令都是正确的,这表明这些失败源于底层生成骨干网络,而非世界建模公式本身。(a) 起始关键帧伪影出现

22

第 23 页

(a) 开场关键帧伪影

(b) 视频动作不自然

(c) 复杂空间不一致

图 16 FilmWorld 的失败案例。这些失败主要源于底层生成骨干网络。(a) 开场关键帧伪影:关键帧合成偶尔会产生结构上不可信的对象,或角色间不合理的空间关系和尺度。(b) 视频动作不自然:尽管运动规范准确,视频生成器有时仍会产生运动学上不可信或突兀的动作。(c) 复杂空间不一致:在布局复杂的场景中,对象可能出现空间锚定缺失,在帧间位置漂移。

当图像生成器在复杂的条件组合下产生结构上不可信的对象,或角色间不合理的空间关系和尺度时,就会出现上述问题。(b) 视频动作不自然表现为运动学上不可信或突兀的动作,尽管运动规范准确,这反映了视频生成器原生运动合成的局限性。(c) 复杂空间不一致出现在复杂的布局中,对象出现空间锚定缺失,在帧间位置或尺度发生漂移。此类缺陷往往持续存在,因为它们相对于整体构图是局部的或细微的,使得闭环验证器难以可靠地检测和纠正。总体而言,这些案例划定了显式世界状态建模所能保证的边界:FilmWorld 在符号层面强制执行一致性,但像素级保真度受限于其编排的基础生成和验证模型的感知能力。由于我们的框架对底层骨干网络的选择无关,我们预计随着基础图像、视频和视觉语言模型的不断进步,这些失败模式将得到逐步缓解。

7 结论

在本文中,我们从表征的角度重新审视了从小说到电影的生成过程,并将其形式化为动态电影世界建模,分解为一个构建阶段,将抽象的文学散文 grounding 到有状态的世界对象中,以及一个演化阶段,跨场景因果地更新这些对象。在这一形式化的指导下,我们提出了 FilmWorld,这是一个端到端的 Agent 系统,其中六个专门的 Agent 组共同实例化和演化动态电影世界,状态轨迹在符号层面完全解析,从而将渲染与序列依赖解耦,并实现恒定延迟的并行合成。为了评估长篇幅生成,我们进一步引入了 FilmEval,这是一个难度分级的基准测试,包含 15 部小说以及九个涵盖电影呈现、电影一致性和小说保真度的自动指标。广泛的实验表明,FilmWorld 在所有指标和难度层级上持续超越最先进基线,在叙事保真度和跨场景一致性方面取得了显著增益,并且随着叙事复杂度的扩展保持稳定。

23

第 24 页

参考文献

[1] Zhaochong An 等人。Onestory:具有自适应记忆的连贯多镜头视频生成。在 CVPR,2026。

[2] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, 和 Aditya Ramesh。作为世界模拟器的视频生成模型。2024。URL https://openai.com/index/video-generation-models-as-world-simulators/。OpenAI 技术报告。

[3] Guibin Chen, Dixuan Lin, Jiangping Yang 等人。Skyreels-v2:无限长度电影生成模型。arXiv 预印本 arXiv:2504.13074,2025。

[4] Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, 和 Cho-Jui Hsieh。 Self-forcing++:迈向分钟级高质量视频生成。在 ICLR,2026。

[5] Mohamed Elmoghany, Ryan Rossi, Seunghyun Yoon 等人。长视频故事生成综述:架构、一致性与电影质量。arXiv 预印本 arXiv:2507.07202,2025。

[6] Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan 等人。Infinitystory:具有世界一致性和角色感知镜头转换的无限视频生成。arXiv 预印本 arXiv:2603.03646,2026。

[7] Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, 和 Yujiu Yang。Talecrafter:具有多角色的交互式故事可视化。 在 SIGGRAPH Asia,2023。

[8] HBAI Ltd. Toonflow:AI 短剧工厂,2026。URL https://github.com/HBAI-Ltd/Toonflow-app。

[9] HITsz-TMG。Videoclaw:AI 创意视频制作 Agent,2026。URL https://github.com/HITsz-TMG/ VideoClaw。

[10] Panwen Hu, Jin Jiang, Jianqi Chen, Mingfei Han, Shengcai Liao, Xiaojun Chang, 和 Xiaodan Liang。Storyagent: 通过 Multi-Agent 协作进行定制化故事视频生成。arXiv 预印本 arXiv:2411.04925,2024。

[11] Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, 和 Wentao Zhang。Vabench:音频视频生成的综合基准。arXiv 预印本 arXiv:2512.09299, 2025。

[12] Kaiyi Huang, Yukun Huang, Xintao Wang, Zinan Lin, Xuefei Ning, Pengfei Wan, Di Zhang, Yu Wang, 和 Xihui Liu。Filmaster:弥合电影原理与生成式 AI 以用于自动化电影生成。arXiv 预印本 arXiv:2506.18899,2025。

[13] Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, 和 Chao Huang。Vimax:智能视频 生成。arXiv 预印本 arXiv:2606.07649,2026。

[14] Ozgur Kara, Krishna Kumar Singh, Feng Liu, Duygu Ceylan, James M. Rehg, 和 Tobias Hinz。Shotadapter: 基于扩散模型的文本到多镜头视频生成。在 CVPR,2025。

[15] Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang 等人。Hunyuanvideo:大型视频生成模型的系统框架。arXiv 预印本 arXiv:2412.03603,2024。

[16] 快手科技。Kling ai,2024。URL https://klingai.com/。

[17] Haodong Li, Shaoteng Liu, Zhe Lin, 和 Manmohan Chandraker。Rolling sink:弥合自回归视频扩散中有限视界训练与开放式测试之间的差距。arXiv 预印本 arXiv:2602.07775,2026。

[18] Yitong Li, Zhe Gan, Yelong Shen, Jingjing Liu, Yu Cheng, Yuexin Wu, Lawrence Carin, David Carlson, 和 Jianfeng Gao。Storygan:用于故事可视化的序列条件 GAN。在 CVPR,2019。

[19] Han Lin, Abhay Zala, Jaemin Cho, 和 Mohit Bansal。Videodirectorgpt:通过 LLM 引导规划实现一致的多场景视频生成。 在 COLM,2024。

[20] Akide Liu, Jinbo Xing, Chaojie Mao, Ye Li, Zeyu Zhang, Yefei He, Weijie Wang, Zihan Wang, Yu Liu, Gholamreza Haffari, 和 Bohan Zhuang。Reca:通过递归上下文分配进行多镜头长视频外推。arXiv 预印本 arXiv:2605.26525,2026。

24

第 25 页

[21] Do Xuan Long, Xingchen Wan, Hootan Nakhost, Chen-Yu Lee, Tomas Pfister, 和 Sercan Ö. Arık。Vista:一种具备测试时自我改进能力的视频生成 Agent 。arXiv 预印本 arXiv:2510.15831,2025。

[22] Fuchen Long, Zhaofan Qiu, Ting Yao, 和 Tao Mei。Videostudio:生成内容一致且多场景的视频。在 ECCV 上发表,2024。

[23] Xiangyang Luo, Qingyu Li, Xiaokun Liu, Wenyu Qin, Miao Yang, Meng Wang, Pengfei Wan, Di Zhang, Kun Gai, 和 Shao-Lun Huang。Filmweaver:利用缓存引导的自回归扩散模型编织多镜头一致视频。在 AAAI 上发表,2026。

[24] Adyasha Maharana, Darryl Hannan, 和 Mohit Bansal。Storydall-e:调整预训练文本到图像 Transformer 以进行故事续写。在 ECCV 上发表,2022。

[25] Yihao Meng, Hao Ouyang, Yue Yu, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Hanlin Wang, Shuailei Ma, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, 和 Huamin Qu。Holocine:电影式多镜头长视频叙事的整体生成。在 CVPR 上发表,2026。

[26] Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, 和 Linus。剧本即所需:一种用于长程对话到电影视频生成的 Agent 框架。arXiv 预印本 arXiv:2601.17737,2026。

[27] Xiaoqian Shen 和 Mohamed Elhoseiny。Storygpt-v:大型语言模型作为一致的故事可视化器。在 CVPR 上发表,2025。

[28] Yufei Shi, Weilong Yan, Naixuan Huang, Yucheng Chen, Chenyu Zhang, Tao He, Si Yong Yeo, 和 Ming Li。一句话,一部剧:通过 Multi-Agent 系统进行个性化短剧生成。arXiv 预印本 arXiv:2605.22144,2026。

[29] Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine Leon, Khanh G. LeViet, Zack Chomyn, Joe Timmons, Brett Slatkin, Scott Penberthy, 和 Tomas Pfister。Co-director:Agent 生成式视频叙事。arXiv 预印本 arXiv:2604.24842,2026。

[30] Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, 和 Wei Chen。Muse:一种通过闭环认知编排实现无约束故事设想的 Agent 框架。arXiv 预印本 arXiv:2602.03028,2026。

[31] Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican 等。Gemini:一系列高度多模态模型家族。arXiv 预印本 arXiv:2312.11805,2023。

[32] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng 等。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025。

[33] Jente Vandersanden, Matheus Gadelha, Chun-Hao P. Huang, Hyeonho Jeong, 和 Yulia Gryaditskaya。Em-vid:无需训练的主体中心记忆,用于高效且一致的多镜头视频生成。arXiv 预印本 arXiv:2605.23610,2026。

[34] Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, 和 Dumitru Erhan。Phenaki:从开放域文本描述生成变长视频。在 ICLR 上发表,2023。

[35] Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, 和 Ning Yu。Mavis:用于长序列视频叙事的 Agent 框架。在 EACL 上发表,2026。

[36] Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing 等。Msavbench:迈向全面可靠的多镜头音视频生成评估。arXiv 预印本 arXiv:2605.20183,2026。

[37] Weijia Wu, Mingyu Liu, Zeyu Zhu, Xi Xia, Haoen Feng, Wen Wang, Kevin Qinghong Lin, Chunhua Shen, 和 Mike Zheng Shou。Moviebench:用于长视频生成的分层电影级数据集。在 CVPR 上发表,2025。

[38] Weijia Wu, Zeyu Zhu, 和 Mike Zheng Shou。通过 Multi-Agent 思维链规划实现自动化电影生成。arXiv 预印本 arXiv:2503.07314,2025。

[39] Junlin Xie, Zhihong Chen, Ruifei Zhang, Xiang Wan, 和 Guanbin Li。大型多模态 Agent:综述。Visual Intelligence, 3(24), 2025。

25

第 26 页

[40] 徐学南,梅家豪,李晨亮,吴宇宁,严明,赖少鹏,张骐,吴梦月。 Mm-storyagent:基于跨文本、图像和音频的 Multi-Agent 范式的沉浸式旁白故事书视频生成。arXiv 预印本 arXiv:2503.05242,2025。

[41] 杨松林,钟浩斌,张瑞林,等。Evalverse:面向专业电影视频生成的流水线感知与专家校准基准测试。arXiv 预印本 arXiv:2605.23271,2026。

[42] 杨卓毅,滕佳言,温迪·郑,明鼎,黄诗雨,徐佳正,杨元明,翁文怡,张孝涵,冯冠宇,等。Cogvideox:具有专家变换器的文本到视频扩散模型。在 ICLR 上发表,2025。

[43] 姚正健,李永志,高鑫远,陈全,蒋鹏,陆燕野。Narrative weaver:迈向通过多模态条件控制实现长程视觉一致性。在 CVPR 上发表,2026。

[44] 张凯文 等。Storymem:基于记忆的多次拍摄长视频叙事。arXiv 预印本 arXiv:2512.19539,2025。

[45] 张立赛,徐宝涵,杨思倩,尹明宇,刘静,徐超,王四奇,吴一迪,洪雨欣,张子豪,梁彦章,蒋育东。Anime:用于长动画生成的自适应 Multi-Agent 规划。在 SIGGRAPH Asia 上发表,2025。

[46] 张沛轩,贾子健,刘凯琪,翁书辰,李思,施博新。Stage:基于故事板锚点的电影多镜头叙事生成。arXiv 预印本 arXiv:2512.12372,2025。

[47] 郑明哲,徐永奇,黄浩健,马旭然,刘叶欣,舒文杰,庞雅天,唐飞龙,陈启峰,杨哈里,Lim Ser-Nam。Videogen-of-thought:以最少的人工干预逐步生成多镜头视频。在 NeurIPS NextVid Workshop 上发表,2025。

[48] 周景松,杜一华,徐新利,王罗舟,庄子杰,张叶航,李帅博,胡晓军,苏波兰,陈颖聪。Videomemory:通过记忆整合实现一致的视频生成。arXiv 预印本 arXiv:2601.03655,2026。

[49] 周宇鹏,周大权,程明明,冯嘉士,侯启斌。Storydiffusion:用于长程图像和视频生成的一致性自注意力机制。在 NeurIPS 上发表,2024。

[50] 庄彩琳,黄爱林,胡耀琪,吴经纬,程伟,廖家奇,王宏远,廖新耀,蔡薇薇,徐恒远,张轩扬,曾宪芳,黄哲伟,余刚,张驰。Vistorybench:故事可视化的综合基准套件。在 CVPR 上发表,2026。

26

第 27 页

附录

A FilmEval 基准测试详情

本附录将第 5.2 节中关于 FilmEval 基准测试的一段描述扩展为按小说划分的、可审计的形式。附录 A.1 提供了 15 部小说的完整元数据表,附录 A.2 说明了如何访问源文本。

A.1 15 部小说数据集概览

FilmEval 包含 15 部源小说,根据角色数量、情节复杂度和世界观丰富程度分为三个难度层级。表 5 列出了每部小说的完整元数据,以用于交叉引用的规范 ID 为键。该数据集涵盖 6 部英文小说和 9 部中文小说,源自三种不同的来源:(i) 六部小说改编作品,基于现有文学作品重写;(ii) 三部影视改编作品,基于现有电影/电视作品重新小说化;(iii) 六部为本基准测试专门创作的原创当代作品。所有改编作品,无论是来自小说还是影视来源,均经过独立重写而非直接复制,以适应篇幅、结构和叙事惯例,同时保留各自原著的核心角色、场景和情节。

表 5 FilmEval 基准测试所包含的 15 部源小说的元数据。#Char.、#Loc. 和 #Events 分别表示叙事上显著的角色数量、关键地点数量和关键情节事件数量。长度对于英文源文本以英文单词计,对于中文源文本以中文字符计。来源列区分三种出处类型:改编(小说)(基于现有文学作品重写)、改编(影视)(基于现有电影/电视作品重新小说化)和原创(为本基准测试专门创作)。

ID Title Lang. Length #Char. #Loc. #Events Genre Origin Tier

C1 Slot Seven English 1,015 words 4 2 6 Slice of life Original Easy C2 The Flower Aside the Window English 1,149 words 5 2 7 Slice of life Original Easy C3 A Lamp (一盏灯) Chinese 1,633 chars 3 3 6 Warm realism Original Easy C4 Huaqiang Buying Watermelons (华强买瓜) Chinese 1,492 chars 2 1 6 Comedic satire Adapted (screen, Conquer) Easy C5 Meeting at the Station (车站相遇) Chinese 1,614 chars 2 3 6 Romance Original Easy C6 A Chameleon English 1,348 words 4 2 6 Satire Adapted (novel, Chekhov) Medium C7 The Gift of the Magi English 2,067 words 3 3 6 Romance / irony Adapted (novel, O. Henry) Medium C8 The Bond of Time (光阴的结) Chinese 2,214 chars 5 2 6 Lyrical realism Original Medium C9 Listening-to-the-Wind Courtyard (听风小院) Chinese 2,996 chars 6 2 7 Family saga Original Medium C10 Su Erqi (苏二七) Chinese 2,907 chars 4 2 6 Tragic realism Adapted (novel, Lu Xun) Medium C11 The Man in a Case English 2,334 words 5 4 8 Satire Adapted (novel, Chekhov) Hard C12 The Necklace English 2,733 words 5 5 8 Realism / irony Adapted (novel, Maupassant) Hard C13 The Irreproducible Negative (无法重写的底片) Chinese 4,829 chars 6 4 9 Time-travel drama Adapted (screen, Link Click) Hard C14 White Silk in a Chilly Spring (春寒里的白方巾) Chinese 4,334 chars 6 4 9 Historical fiction Adapted (novel, Lin Jue-min) Hard C15 I Will Take This Job (这单我接了) Chinese 4,663 chars 5 4 8 Comedic fantasy Adapted (screen, Scissor Seven) Hard

这三个计数列遵循一致的约定:#Characters 统计重复出现的角色,排除一次性背景人物;#Key Locations 统计被反复提及或叙事上显著的场景,排除短暂的过场地点;#Key Plot Events 统计故事的主要情节节点,而非每一个微动作。

关于出处,六部小说是小说改编作品:四部来自契诃夫、欧·亨利和莫泊桑的经典短篇小说(C6, C7, C11, C12),两部来自中文文学作品——苏二七(C10,源自鲁迅的《孔乙己》)和春寒里的白方巾(C14,源自林觉民的《与妻书》)。三部小说是影视改编作品,基于现有电影/电视作品重新小说化:华强买瓜(C4,源自电视剧《征服》)、无法重写的底片(C13,源自动画剧集《时光代理人》)和这单我接了(C15,源自动画剧集《刺客伍六七》)。其余六部小说(C1, C2, C3, C5, C8, C9)完全是原创的,确保至少有一半的数据集不受先前作品偏见的影响。

A.2 源文本访问

出于篇幅原因,我们嵌入了一部代表性小说的完整文本,并为其余十四部提供了访问路径。我们选择《光阴的结》(The Bond of Time, C8)作为示例,因为它是主论文图 2 中的运行示例,也是长距离位置状态跟踪案例研究(老槐树)的主题。对于其他十四部小说,请参阅我们的项目页面。

27

第 28 页

为了让读者在不查阅外部资料的情况下理解每个故事,我们在下方为每部小说提供简短摘要,随后附上 C8 的完整嵌入文本。

C1 – 第七号货道。图书管理员伊桑发现自动售货机的第七号货道总是卡在牛奶上,于是他在旁边留了一张提醒便条。很快,陌生人也开始在那里留下他们自己的便条——关于考试、天气、私人的忧虑——第七号货道逐渐变成了一个安静的情感角落。在期末考试周期间,一张写着“我今天考试不及格,不想回宿舍”的便条促使伊桑写下安慰的话语。后来,当机器终于修好时,他依然保留了那个角落,以便任何疲惫的人都能停下来,写下一行字,喘口气。

C2 – 窗外的花。玛雅在街边的一家小咖啡馆工作,每天在窗台上放一朵雏菊。每天早上,格林先生都会来喝黑咖啡,凝视着街对面的花店——那是他已故妻子曾经最喜爱的地方。玛雅想为格林先生保留窗边的座位,但被老板制止了。她走访了花店,得知格林太太生前每周只买一朵最便宜的花。于是,玛雅留下一张便条和一朵雏菊,请当天坐在窗边的人代为看看那朵花。这个窗边的座位不再属于任何特定的人,但安静的纪念行为在陌生人之间无声地传递。

C3 – 一盏灯。在一个雨夜,中学生林澈在公交车站躲雨,一位卖烤红薯的老人免费递给他一个红薯暖手,只要求他将来帮助其他有需要的人。林澈想报答他,但老人几天后便无影无踪。一周后,在一次社区志愿者活动中,他认出了老人的家——正是那个人,因腿伤卧床,无法出摊。林澈多做家务来报答这份善意,并在之后经常去看望他。老人康复后回到摊位,现在挂着一块木牌:天冷时,免费领一个红薯,并将这份善意传递给其他人。善意就像一盏灯点亮另一盏灯。

C4 – 华强买瓜。在一个炎热的夏日午后,刘华强去街角的水果摊买西瓜解暑,问摊主:“熟吗?”胖乎乎的摊主油滑且闪烁其词。在称重时,秤杆可疑地翘得很高;华强伸手到秤盘底下,掏出一块磁铁,然后一刀切开西瓜——露出苍白、未成熟的果肉。他冷静地教训摊主:秤下藏磁铁是贪婪,把生瓜当熟瓜卖是欺骗;今天骗他,明天可能就会骗一个攒零花钱的孩子。他留下钱走开了;摊主羞愧地扔掉磁铁,换掉了秤。

C5 – 车站相遇。在一个雨夜,林夏独自徘徊在一个老旧的火车站,手里拿着刚买的桂花糕,当她在人群中看到周远——那个多年前不辞而别的人——时,她停下了脚步。他们在附近的一家店里喝茶叙旧,周远为当年不辞而别、没有告别而道歉。他告诉她,多年来,虽然他去过很多地方,但他一直记得她想看一片宁静的冬日海景。他回来邀请她同行,承诺再也不悄无声息地离开。当火车进站时,这次两人并肩走向车门——走向一场迟到但尚不晚的重逢。

C6 – 变色龙。警官奥楚梅洛夫穿过集市时,金匠赫留金指控一只流浪狗咬了他的手指。起初,警官严厉坚持必须惩罚狗的主人,但就在人群猜测这只狗可能属于将军时,他立刻翻脸,指责赫留金自己挑衅了狗。随着关于“这是否是将军的狗”的谣言反复摇摆,警官的态度也随之变化,像变色龙一样忽冷忽热。最后,将军的厨师确认这只狗属于将军的弟弟,警官咧嘴一笑,放走了狗,转而嘲笑并威胁赫留金——赤裸裸地揭示了官场阿谀奉承的丑陋。

C7 – 麦琪的礼物。在平安夜,德拉只存了一美元八十七美分——不足以给她深爱的丈夫吉姆买礼物。在痛苦中,她剪下并卖掉了她珍爱的长发,为吉姆的传家宝金表买了一条精美的白金表链。但吉姆回家时神情怪异——他卖掉了手表,为德拉买了她在商店橱窗里久仰的玳瑁发梳。两份礼物瞬间变得毫无用处,但它们证明了彼此之间无尽的爱。作者指出,这两个为彼此牺牲最珍贵物品的愚蠢孩子,实际上是麦琪中最智慧的。

C8 – 光阴的结。老家后面的老槐树将林元的一生与之紧紧相连。小时候,他伸手去够槐花,母亲帮他擦去手上的粘汁;

28

第 29 页

高考结束后,父亲在他离家前往城市时,将零花钱塞进他手中。 在那里忙于谋生建业的林远,在母亲打来电话说老树即将枯死时,无法赶回家。 一个霜寒的清晨,父亲悄然离世。当林远终于归来,他将手按在树皮上——那树皮皲裂如父亲的手掌——心中充满深深的悔恨。多年后,年迈的他回到家乡定居。一个午后,他坐在树下,回答小孙子的问题——“树会疼吗?”——随后在暮春时节安详离世,一朵槐花飘落在他膝上。如同那棵老树,生命最终将骸骨归还大地。

C9 – 听风小院。老学者林某是清代举人,以“听风小院”中的紫藤闻名。他教导孙子文博,只有静坐才能真正听见风,从而洞悉世界的真相。历经半个世纪的动荡后,小院已变成拥挤破败的大院;中年机械师文博独自在深夜浇灌那棵老藤,在一本藏在砖缝里的日记中记录着半生的起伏。文博去世后,定居海外并继承房产的女儿林月,差点为了开发商的高额收购而卖掉小院——直到老藤唤起了她对父亲的记忆,她拒绝了交易。她找到了那本日记,全心投入于忠实修复小院,最终坐在藤下,领悟了跨越三代人的风的讯息。

C10 – 苏二七。在铃铛镇渡口老榕树下的酒摊,苏二七是唯一一位穿着长衫却站着喝酒的顾客。他写得一手好字,却懒惰且偶尔偷书,总是满口之乎者也,脸上常带着挨打后的新鲜淤青,成为众人嘲笑的对象。他耐心地教一个年轻的砍柴少年阿水写“茴”字,并与流浪儿童分享茴香豆。中秋过后,他因从富户家偷窃被抓,双腿被打断,失踪了很长一段时间;在一个寒冷多雾的初冬清晨,他“走”进酒摊,铺着一张破旧的草席,喝了最后一碗酒,用沾满泥污的铜板付账,随后消失——想必是被冰冷的河水吞没。

C11 – 套中人。希腊教师别里科夫是个“套中人”:即使在晴天,他也穿着雨鞋、带着雨伞;他把雨伞、怀表甚至小折刀都装在套子里;他最害怕任何不寻常的事物,口头禅是“但愿一切平安,别出什么乱子”。他的怯懦让全校乃至全镇的人多年来都畏首畏尾。当新教师柯瓦连科和他的姐姐到来时,媒人的闲言碎语让别里科夫甚至考虑结婚。但一幅漫画深深刺痛了他,当他看到兄妹俩骑自行车时,前去训斥他们,却被推下楼梯;瓦莲卡的笑声粉碎了他仅存的尊严。此后他卧床不起,一个月后去世;镇上的人短暂感到轻松,随后又恢复了旧有的压抑日常。

C12 – 项链。玛蒂尔德美丽但虚荣,嫁给一个小职员后,始终怨恨他们清贫的生活。为了参加部里的舞会,丈夫用积蓄为她买了一件礼服,她向富有的前同学福雷斯蒂埃夫人借了一条钻石项链。她在舞会上光彩照人,但在回家路上发现项链丢失了。由于不敢承认,夫妇俩借了巨额贷款,花三万六千法郎买了一条一模一样的项链来赔偿,在接下来的十年里过着艰苦的贫困生活来偿还债务。十年后,她在街上偶遇朋友并坦白了真相——却得知原来的项链是假的,最多只值五百法郎。

C13 – 无法重写的底片。在时光照相馆,人们可以潜入老照片,通过它短暂地说话。陈潇想回到十年前的一个普通日子,通过年轻的自己说出他压抑了十年的三件事。陈潇附身于年轻时的身体,帮助他赢得篮球冠军,向暗恋的女孩表白,并向母亲道歉。就在三件事即将了结时,他在电视上看到日期——2008年5月12日,汶川地震发生的那一天。他挨家挨户试图警告人们,但无人相信;只有母亲毫不犹豫地抓住他离开——然而地震在他们跨过门槛的瞬间发生,她背对着他,用身体护住他直到最后。回到现实,他明白了:死亡的时刻无法改写,但大声说出遗憾,能让所爱之人听到,哪怕只有一次。

C14 – 春寒里的白方巾。1911年春,福州三坊七巷桃花盛开。刚从日本留学归来的林觉民与怀孕七个月的妻子陈意映情深意重,但心中却因国家动荡而忧虑。他跪别年迈的父亲,准备前往广州起义,途中偷偷回家一次

29

第 30 页

还有时间去看望他的妻子,随后便离开了。在广州昏暗的灯光下,他含泪在白色丝帕上写下给妻子的诀别信。起义中受伤被俘,他在审判中言辞坚定、信念不移,最终在年仅24岁时尊严就义。听到消息后,易英昏厥并早产,两年后因悲痛过度而去世。一个世纪过去了,白帕上的墨迹依然如新,化作了今日和平年代里寻常的春风与读书声。

C15 – 这单我接了。在小鸡岛上,一家兼理发店和杀手掩护所的店铺里,倒霉的杀手阿七被中介派去执行一桩五千元悬赏的刺杀任务,目标是一个长发女孩,地点在长街。阿七在熙攘的街头屡次认错人,但在一次协助抓获小偷的事件中,他遇到了冷静干练的女孩白媛。他尾随她为生病的弟弟买退烧药,并偷偷补上了她缺少的硬币。白媛承认自己正被追杀,因为她掌握了码头走私违禁药品的账本。直到这时,阿七才意识到这桩任务从来就不干净。当追兵破门而入时,他紧握剪刀,挡在女孩身前,笑着说:这单我接了。

C8 – 光阴的结 全文。

原文中文文本如下。

老屋后头那棵老槐树,根须深扎进黄土,也悄然系住了林远一生的命脉。它是记忆的坐标,风一过,年轮便漾开一圈圈往事。

槐花开得最盛的年头,林远才刚能勉强够到藤椅的扶手。阳光穿过层层叠叠的枝叶,碎金般洒在青砖地上,随着微风明明灭灭。他踮着脚,双手死死攥住一根被汗水浸得滑腻的长竹竿,够向最高处那串垂落的洁白。“妈,你看那串,白得发亮!”他仰着脖子喊。母亲停下针,笑着嗔怪:“急什么,槐花落不了,妈给你摇下来便是。”她起身,枯瘦的手握住低处的枝干轻轻一撼,簌簌落下一阵香雨。林远张开旧褂子的下摆去接,指尖沾上黏稠的树汁,母亲便用粗布帕子替他擦拭:“傻孩子,沾了槐胶,洗都洗不掉。”他咯咯笑着躲开,却不知那抹甜香,早已渗进骨血。那时的光阴是黏稠的,慢得能看清一只蚂蚁如何驮着花瓣翻过门槛。林远以为,这样的日子会一直亮堂堂地铺展下去,仿佛只要伸出手,就能把整个夏天妥帖地揣进兜里。

蝉鸣撕扯着闷热的空气,像一把钝锯来回拉扯神经。高考放榜后的午后,林远立在树下,指尖死死捏着那张轻飘飘的录取通知书,纸边已被汗水洇出深色的折痕。墙根下,父亲蹲在阴影里,旱烟的辛辣呛得人眼眶发酸。他终于磕了磕烟袋,将一沓叠得整整齐齐的零钱塞进林远背包侧袋。“外头不比家里,”他别过脸,喉结滚动了一下,“钱揣紧,别饿着。路是自己选的,跪着也得走完。”林远鼻尖一酸,只重重“嗯”了一声。他转身跨过高高的门槛,听见身后传来父亲低哑的补白:“. . . . . . 逢年过节,打个电话。”风卷起院角的落叶,他没有回头,只在心里默念:等我出息了,接你们去城里。巷口的风推着后背,故乡与老槐在视野里急速坍缩,最终凝成地平线上一个颤动的墨点。青春原是一场蓄谋已久的远行,他贪恋着远方未名的灯火,急于挣脱这方被蝉鸣与槐香腌入味的、静得令人心慌的故土。

城市拔地而起,玻璃幕墙将天空切割成规整的几何体,也把日子切成按秒计费的碎片。林远坐在二十七层的工位上,望着脚下钢铁与玻璃交织的洪流,瞳孔里映不出一点温度。手机在桌面震动,母亲的嗓音隔着千里电流传来,轻得像怕惊碎什么:“槐树. . . . . . 怕是不行了,叶子黄了一大半。”他压低声音,手指无意识地摩挲着咖啡杯沿:“妈,怎么了?根出问题了吗?”“老毛病,烂了半边,请人看了,说是得打个木架撑住。”母亲顿了顿,声音轻下去,“你忙你的,不用挂心。”电话那头传来的咳嗽声,他心头一紧:“我周末回去一趟. . . . . . ”“别!”母亲急忙打断,语气里透着不容商量的温柔,“你张总不是催方案吗?家里都好,真没事。”他张了张嘴,视线却撞上主管催促的眼神和同事疾走的皮鞋。键盘的敲击声如潮水般涌来,将他那点微弱的归乡念头拍碎。良久,他只挤出一句:“转些钱回去,找师傅挑好木料。”挂断后,隔壁工位的老李探头递来一摞文件:“林远,客户下午要终稿,今晚还得熬。”他扯出一个笑:“好,放这儿吧。”屏幕幽光映着疲惫的脸,他摸出烟盒,打火机的火苗窜起又熄灭。辛辣的烟气钻进肺腑,呛得他眼眶发烫,却终究没落下一滴泪。他在钢筋水泥的丛林里奋力泅渡,却渐渐忘了出发的码头。那些曾以为能照亮一生的星辰,早被月供、绩效与深夜的咖啡渍,研磨成地毯上拂不去的灰。

人生行至中途,悲欢都已有了重量。父亲走在一个霜降后的清晨,没有惊动任何人,只像一片熟透的秋叶,悄无声息地归根。隔壁的王伯拄着拐杖立在院墙外,叹道:“你爸走前,还天天往树下转

30

第 31 页

“悠,说这树跟他一样,老了,得歇歇了。”林远递上一支烟,王伯摆摆手:“戒了,医生说肺不行。”他沉默着推开虚掩的院门。老槐已至暮年,树皮皲裂翻卷,沟壑纵横,竟与父亲临终前那双枯槁的手掌如出一辙。他缓缓贴上树干,粗粝的触感顺着指尖直抵心口。“爸,”他低声说,声音散在秋风里,“我回来了。”没有回音,只有落叶擦过石阶的轻响。一股钝痛无声漫开。他忽然懂了,生命原是一场无声的交接–从泥土里挣出,在风雨中挺立,终将把筋骨还给大地。他在树下的石阶上枯坐至日暮,余晖将他的影子拉得极长,长到仿佛能触到院墙那头。恍惚间,一个赤脚的小男孩正拨开花枝朝他奔来,笑声清亮,惊飞了枝头的麻雀。

褪去一身疲惫,林远循着旧梦重返小镇。老屋重漆了门窗,换了亮瓦,唯有那棵槐树,依旧沉默地立在院后。枝干已佝偻如弓,却每逢春深,依旧撑开一树如雪的繁花。“爷爷,这树多老啦?”小孙子举着纸飞机跑过来,气喘吁吁地问。林远抿了口茶,目光抚过虬结的枝干:“比你太爷爷的年纪还大哩。”“那它疼不疼?皮都裂开了。”孩子伸出小手,小心翼翼地摸了摸树皮的沟壑。林远笑了,眼角的皱纹舒展开来:“不疼。它疼过的地方,都长出新的叶子了。”纸飞机再次掷出,划过树冠。阳光穿过新叶,在地上投下与早年别无二致的光斑。风过处,花影婆娑,时光仿佛在此打了个松软的结,将祖父的凝望与孙儿的欢笑,轻轻缝进同一片年轮里。

岁月走到最后,林远的眼界已褪成一片温润的毛玻璃,万物都裹着柔光。他仍习惯坐在槐树下,一坐便是半日。风穿过疏朗的枝桠,沙沙,簌簌,像远年的私语,又像不知名的童谣。他隐约听见藤椅的吱呀声,听见“当心脚下”的轻唤,听见“往外走”的哑嗓,又听见稚嫩的童音问:“爷爷,树疼不疼?”他不再打捞过往,也不去丈量余生,心湖早已不起微澜。某个春深似海的午后,他缓缓合上双眼,唇角漾开一抹极淡的笑意。风倏然止息,一片槐花自高处旋落,不偏不倚,停在他膝头。他嘴唇微动,似有若无地吐出一句:“. . . . . . 不疼了。”洁白,轻盈,一如多年前,他第一次踮起脚尖时,抬头望见的模样。

以下提供英文翻译,供不熟悉中文的读者参考。

老屋后面有一棵老槐树,它的根深深扎进黄土之中,静静地将自己与林远整个生命的脉络捆绑在一起。它是记忆的坐标–每当风吹过,它的年轮便会随着往昔岁月的波浪向外荡漾。

在槐花开得最盛的那一年,林远 barely 够得着藤椅的扶手。阳光透过层层枝叶,像碎金般洒落在青砖地面上,随风摇曳。他踮起脚尖,双手紧紧抓住一根被汗水浸湿的长竹竿,伸向头顶最高处那一簇纯白的花朵。“妈,你看那簇–多白多亮!”他仰着头喊道。母亲停下手中的针线活,笑着轻声责备道:“急什么?槐花又跑不了。我给你摇下来。”她站起身,用瘦骨嶙峋的手轻轻摇动一根低枝,洒下一阵芬芳的花瓣雨。林远展开旧外套的下摆去接,指尖沾上了黏稠的树胶。母亲用粗布手帕替他擦去:“傻孩子,沾上槐胶可洗不掉。”他咯咯笑着躲开,却不知那甜美的香气早已渗入他的骨髓。那时的时光厚重而缓慢,慢到足以看清一只蚂蚁如何扛着一片花瓣跨过门槛。林远相信这样明亮的日子会永远延续下去,仿佛只要伸出手,就能把整个夏天整齐地装进口袋。

蝉鸣像钝锯在神经上来回拉扯,撕扯着闷热的空气。高考成绩公布的那个下午,林远站在树下,手指紧紧攥着那张轻飘飘的录取通知书,边缘已被汗水浸得发黑。墙根处,父亲蹲在阴影里,旱烟的苦涩烟雾熏得眼睛发红。终于,他磕掉烟灰,将一叠整齐折叠的钞票塞进林远背包的侧袋。“外面不像家里,”他转过头去,喉咙哽咽,“钱带在身边,别饿着。你自己选的路–跪着也要走完。”林远感到鼻头一酸,只重重地“嗯”了一声。他转身跨过高高的门槛,听见父亲沙哑的声音在身后传来:“……放假了,给我们打个电话。”风卷起院角落叶。他

第 32 页

不再回头,只在心中默默发誓:“等我有了出息,就把你们俩都接到城里去。”巷口的风推着他的后背,故乡那棵老槐树在他的视野中迅速后退、坍塌,最终凝结成地平线上一个颤抖的黑点。青春,从一开始就是一场蓄谋已久的远行。他渴望远方那些无名之光的召唤,急于挣脱这片故土——它安静得令人心慌,浸透了蝉鸣与槐花香的气息。

城市拔地而起,玻璃幕墙将天空切割成精确的几何形状,也将日子切割成以秒计费的碎片。林远坐在二十七楼的工位上,俯瞰着脚下钢铁与玻璃的洪流,他的瞳孔中没有倒映出丝毫暖意。手机在桌上震动——母亲的声音穿越千里电波传来,轻柔得仿佛生怕惊碎什么:“那棵槐树……可能撑不住了。一半的叶子都黄了。”他压低声音,手指无意识地摩挲着咖啡杯的边缘:“妈,怎么了?是根出问题了吗?”“老毛病了——一半都烂透了。请人来看过,说得用木架子撑一下。”母亲停顿了一下,声音变得更轻:“你只管专心工作,别担心。”听筒里传来一阵咳嗽声,他胸口一紧:“我这周末就回去——”“别回!”母亲迅速打断他,语气中带着不容置疑的温柔:“你不是说张总正催那个方案吗?这儿一切都好,真的。”他张了张嘴,目光却撞上主管催促的眼神和同事匆匆的脚步声。键盘的敲击声如潮水般涌来,压碎了他心中刚刚萌生的那点思乡之情。良久,他只能挤出几句:“我汇点钱回去——找个工匠,买些好木头。”挂断电话后,隔壁桌的老李拿着一叠文件凑过来:“林远,客户下午要终稿,咱们又得熬个夜。”他强挤出一丝笑容:“行,放这儿吧。”屏幕昏暗的光照亮了他疲惫的面容。他掏出一根烟;打火机火苗窜起又熄灭。刺鼻的烟雾钻入肺叶,灼得双眼发热——但最终,没有落下任何一滴眼泪。他艰难地在这片钢筋混凝土的森林中泅渡,逐渐忘记了出发的港湾。那些他曾以为能照亮整个人生的星辰,早已被房贷、绩效考核和深夜咖啡渍研磨成尘,再也无法在地板上激起涟漪。

人生行至中途,悲喜皆有了重量。父亲在一个霜染的清晨离世,未惊动任何人,宛如一片熟透的秋叶悄然归根。隔壁的老王拄着拐杖倚在院墙外叹息:“你爸走之前,每天还去那树下站会儿,说就跟他自己似的——老了,该歇歇了。”林远递给他一支烟;老王摆摆手:“戒了。医生说肺受不了。”他默默推开半掩的院门。老槐树已至暮年,树皮皲裂卷曲,沟壑纵横——与他父亲临终前枯槁的双手惊人地相似。他缓缓将手掌贴在树干上,粗糙的触感从指尖直抵心间。“爸,”他轻声说道,声音消散在秋风中,“我回来了。”没有回应,只有落叶轻拂石阶的细微沙沙声。一种钝痛在他体内无声蔓延。他忽然明白——人生从一开始就是一场无声的交接:被连根拔起,在风雨中挺立,最终将筋骨归还大地。他在树下的石阶上坐到黄昏,夕阳将他的影子拉得极长、极长,长到仿佛触到了院墙的另一端。恍惚间,他看见一个赤脚的小男孩穿过繁花似锦的枝头向他跑来,笑声清脆明亮,惊起了树梢的麻雀。

卸下多年积攒的疲惫,林远循着一个旧梦回到了小镇。老屋门窗刷了新漆,屋顶铺了新瓦——唯有后院那棵槐树依旧静默伫立,未曾改变。它的枝干弯曲如弓,但每年深春时节,依然绽放出一树如雪的花冠。“爷爷,这树多大了?”小孙子拿着纸飞机跑过来,气喘吁吁地问。林远喝了一口茶,目光掠过虬结的枝干:“比你曾祖父还老。”“它疼吗?树皮都裂了。”孩子伸出小手,小心翼翼地触摸树皮上的沟壑。林远笑了,眼角的皱纹柔和下来:“不疼。曾经疼过的地方,都长出了新叶。”

第 33 页

生长。”纸飞机再次飞出,划过头顶的树冠。阳光透过新叶洒下,在地面投下的光斑与多年前的并无二致。风经过之处,花影摇曳,时间仿佛在此处打了一个温柔的结,将祖父的目光与孙辈的笑声轻柔地缝入同一圈年轮之中。

随着岁月临近尾声,林远的视力已模糊如蒙霜的玻璃,万物皆笼罩在柔和的光晕中。他仍喜欢坐在槐树下,有时一坐就是半天。风穿过稀疏的枝桠,沙沙作响,低语呢喃,宛如来自遥远岁月的声音,或是一首无名的摇篮曲。他似乎听到了藤椅的吱呀声,听到了轻柔的“小心脚下”,听到了沙哑的声音说着“去吧,去闯荡世界”,随后又听到孩童的声音问道:“爷爷,树疼吗?”他不再翻阅过往,也不再丈量生命的剩余;他心中的湖面不再泛起涟漪。在一个深春午后的某个时刻,他缓缓闭上双眼,嘴角泛起最细微的微笑。风突然静止,一朵槐花从上方盘旋而下,恰好落在他的膝头。他的嘴唇微微翕动,仿佛在吐出 words:“……不再疼了。”纯白,轻盈——正如多年前,当他第一次踮起脚尖仰望时,它出现的样子。

B 额外的定量与定性结果

本附录补充了第 6 节的内容。我们将聚合分数细化为按小说分解的形式(B.1),证明 FilmWorld 并不局限于单一的视觉风格(B.2),通过分析生成电影的时长来表征 FilmWorld 产出的规模(B.3),并对 FilmEval 进行跨评估者分析,以验证其排名在不同裁判模型间保持稳定(B.4)。

B.1 按小说的全分表格

表 6 报告了所有 6 种方法在 15 部小说和 9 个子指标上的全分矩阵,揭示了按小说的分布情况,并为协方差椭圆分析提供了坐标。小说使用附录 A.1 中的规范 ID(C1–C15),按难度层级排序(简单 C1–C5,中等 C6–C10,困难 C11–C15);子指标遵循主论文中的分组,分为电影呈现(VP, NEP, AVP)、电影一致性(CC, SC, OC)和小说保真度(NHR, LR, SR)。

在按小说的粒度上,可以看出主论文中的两个主要发现。首先,FilmWorld 在所有 15 部小说中的总体分数保持紧密集中(约 87–91),而每种基线方法的分数分布范围要宽得多,且在较难的小说上出现明显的低分异常值。其次,FilmWorld 的最大提升在于小说保真度(NHR, LR, SR),且在困难层级并未崩溃,这证实了将生成过程建立在显式的符号状态轨迹上,可以随着复杂度的增加抑制叙事遗漏和幻觉。

B.2 风格泛化研究

主实验在所有方法中统一采用吉卜力工作室(Studio Ghibli)的动漫风格,纯粹是为了消除风格差异作为评估中的混淆因素。这一选择并不意味着 FilmWorld 依赖于特定的视觉风格。由于风格仅通过注入图像生成器的简短自然语言描述符进入流水线,且从不与符号世界状态轨迹交互,因此 FilmWorld 对渲染外观持无关态度(agnostic)。为了具体说明这一点,本节列出了五种涵盖动画和照片级真实外观的风格提示词,并展示了在每种提示词下渲染的同一镜头。

每种风格由附加在图像生成器系统提示词末尾的紧凑描述符定义。该描述符仅对渲染像素的外观进行条件约束;由镜头指令携带的实体身份、空间构图和最终状态元数据保持不变。这五种风格提示词如下:

吉卜力风格。

吉卜力工作室动画风格,柔和的水彩纹理,手绘赛璐珞着色,温暖的粉彩色调,柔和的自然光照,绘画风格的背景。

33

第 34 页

吉卜力

新海诚

犬夜叉

3D 迪士尼 照片级真实

图 17 跨五种风格提示的风格泛化。每一列是来自《华强买西瓜》(C4)的代表性关键帧,分别在每种风格提示(行)下独立渲染。每种风格描述符都忠实地施加了其预期的视觉效果,同时实体身份和叙事内容在不同风格下保持一致,证实了风格被有效控制且与底层世界状态轨迹解耦。

新海诚风格。

新海诚动漫风格,日本动漫美学,晶莹剔透的色彩,柔和的金色阳光,清新通透的氛围,明亮的天空和云朵,细腻的光影细节。

犬夜叉风格。

《犬夜叉》(动漫系列)风格,高桥留美子的艺术风格,90年代末和2000年代初的复古动漫美学,传统赛璐珞动画风格,大胆清晰的轮廓,简单、硬边的阴影,大地色调与大胆的原色混合的调色板,描绘封建日本、神秘森林和古老寺庙的绘画风格背景,带有轻微的胶片颗粒感和模拟纹理以营造怀旧感。

迪士尼3D风格。

迪士尼3D动画风格,皮克斯风格渲染,鲜艳饱和的色彩,光滑有光泽的表面,富有表现力的大眼睛,柔和的全局光照,温暖而奇幻的氛围,圆润的角色设计,电影景深,皮肤的高质量次表面散射。

照片级真实风格。

电影级照片真实风格,逼真的电影质感,自然的胶片颗粒,柔和的自然光照,真实自然的色彩而不过度饱和,哑光表面纹理,避免塑料光泽和蜡状外观,自然有机的景深,保留真实的瑕疵和细节层次,电影级调色(柯达/富士胶片色彩科学美学)。

图 17 展示了在保持输入叙事固定的情况下,仅改变风格描述符的效果。我们没有局限于单个镜头,而是从《华强买西瓜》(C4)完整渲染的影片中选取了几个代表性的关键帧位置,涵盖了不同的场景和角色配置。由于镜头指令本身是由系统自动派生而非手动指定的,因此在独立运行中,解析出的实体、构图或姿态可能会出现轻微的随机变化;尽管如此,整体叙事内容、参与的实体以及空间排列仍然高度一致。本节仅具说明性:它展示了跨风格的可迁移性,并不对风格的相对质量做出任何主张,因为那会混淆主论文中受控评估的准确性。

34

第 35 页

表 6 所有 6 种方法在 15 部小说和 9 个子指标上的每部小说得分。结果按电影呈现、电影一致性和小说保真度分组。在每个子表中,阴影行报告了各层级(简单/中等/困难)的均值和方法级总体均值;“总体”列是九个子指标的平均值。

(a) MM-StoryAgent

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 83.00 82.00 80.00 81.80 86.22 96.73 96.71 93.00 85.00 87.16 C2 84.00 84.00 84.00 81.77 87.24 97.82 90.88 88.00 86.00 87.08 C3 82.00 82.00 81.00 65.37 83.72 97.56 65.54 78.00 57.00 76.91 C4 82.00 76.00 80.00 51.86 80.54 93.67 68.35 77.00 55.00 73.82 C5 82.00 81.00 80.00 77.96 87.79 95.99 93.83 86.00 57.00 82.40 简单平均 82.60 81.00 81.00 71.75 85.10 96.35 83.06 84.40 68.00 81.47

C6 73.00 74.00 77.00 43.36 87.12 95.47 97.22 93.00 85.00 80.57 C7 78.00 78.00 84.00 77.27 89.55 93.72 98.19 91.00 79.00 85.41 C8 79.00 79.00 77.00 76.15 86.74 96.61 91.04 80.00 55.00 80.06 C9 80.00 75.00 81.00 47.36 83.49 87.82 29.83 71.00 19.00 63.83 C10 76.00 75.00 76.00 72.21 85.38 96.08 87.27 82.00 58.00 78.66 中等平均 77.20 76.20 79.00 63.27 86.46 93.94 80.71 83.40 59.20 77.71

C11 83.00 81.00 82.00 76.48 92.20 98.87 99.29 89.00 82.00 87.09 C12 82.00 83.00 85.00 79.08 87.23 98.07 99.37 83.00 69.00 85.08 C13 83.00 81.00 86.00 79.56 88.87 96.50 98.60 77.00 48.00 82.06 C14 81.00 80.00 75.00 75.02 91.15 100.00 83.28 81.00 62.00 80.94 C15 74.00 76.00 75.00 69.52 88.03 94.95 91.71 79.00 41.00 76.58 困难平均 80.60 80.20 80.60 75.93 89.50 97.68 94.45 81.80 60.40 82.35

总体 80.13 79.13 80.20 70.32 87.02 95.99 86.07 83.20 62.53 80.51

(b) VGoT

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 86.00 82.00 79.00 85.37 80.51 94.05 78.39 79.00 64.00 80.92 C2 88.00 83.00 77.00 79.86 87.65 93.64 80.33 85.00 65.00 82.16 C3 84.00 85.00 83.00 80.81 91.06 96.43 89.27 89.00 70.00 85.40 C4 85.00 86.00 81.00 75.00 88.91 90.30 93.31 81.00 68.00 83.17 C5 80.00 84.00 86.00 80.44 86.05 93.94 59.93 90.00 60.00 80.04 简单平均 84.60 84.00 81.20 80.30 86.84 93.67 80.25 84.80 65.40 82.34

C6 74.00 77.00 74.00 72.44 81.27 91.56 94.78 87.00 75.00 80.78 C7 78.00 82.00 78.00 78.73 94.36 94.23 94.83 89.00 63.00 83.57 C8 83.00 87.00 85.00 81.00 90.27 93.39 95.97 87.00 69.00 85.74 C9 85.00 86.00 72.00 83.49 88.07 98.09 93.23 86.00 68.00 84.43 C10 79.00 82.00 83.00 79.81 89.09 100.00 77.68 85.00 70.00 82.84 中等平均 79.80 82.80 78.40 79.09 88.61 95.45 91.30 86.80 69.00 83.47

C11 74.00 75.00 76.00 75.90 87.00 98.28 82.74 80.00 57.00 78.44 C12 74.00 80.00 78.00 78.92 92.72 97.12 98.43 75.00 52.00 80.69 C13 83.00 84.00 84.00 80.27 87.86 98.19 93.40 83.00 47.00 82.30 C14 81.00 82.00 81.00 84.32 88.89 98.95 84.29 77.00 51.00 80.94 C15 82.00 82.00 84.00 74.43 84.50 92.53 87.27 79.00 44.00 78.86 困难平均 78.80 80.60 80.60 78.77 88.19 97.01 89.23 78.80 50.20 80.25

总体 81.07 82.47 80.07 79.39 87.88 95.38 86.92 83.47 61.53 82.02

(c) MovieAgent

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 82.00 82.00 77.00 79.62 85.00 96.90 87.14 97.00 75.00 84.63 C2 82.00 86.00 75.00 83.23 92.44 96.16 84.30 92.00 71.00 84.68 C3 72.00 79.00 81.00 76.24 86.74 95.21 80.26 95.00 85.00 83.38 C4 67.00 64.00 75.00 43.33 77.23 92.20 87.51 92.00 76.00 74.92 C5 77.00 81.00 79.00 79.26 86.37 94.20 89.96 93.00 83.00 84.75 简单平均 76.00 78.40 77.40 72.34 85.56 94.93 85.83 93.80 78.00 82.47

C6 75.00 80.00 74.00 84.81 89.21 94.88 91.70 97.00 85.00 85.73 C7 80.00 78.00 74.00 74.90 86.72 98.27 95.09 97.00 79.00 84.78 C8 82.00 85.00 79.00 72.46 88.79 97.91 86.14 90.00 77.00 84.26 C9 83.00 82.00 77.00 81.11 91.56 98.24 91.20 93.00 79.00 86.23 C10 80.00 79.00 76.00 69.22 81.40 96.50 87.15 81.00 70.00 80.03 中等平均 80.00 80.80 76.00 76.50 87.54 97.16 90.26 91.60 78.00 84.21

C11 82.00 85.00 78.00 81.69 92.15 98.81 91.04 97.00 76.00 86.85 C12 82.00 85.00 76.00 80.68 91.22 98.42 95.33 97.00 75.00 86.74 C13 80.00 84.00 79.00 71.51 90.08 99.45 87.67 93.00 62.00 82.97 C14 84.00 85.00 80.00 83.72 92.32 97.38 89.71 95.00 78.00 87.24 C15 79.00 82.00 85.00 78.51 86.83 98.75 86.64 91.00 55.00 82.53 困难平均 81.40 84.20 79.60 79.22 90.52 98.56 90.08 94.60 69.20 85.27

总体 79.13 81.13 77.67 76.02 87.87 96.89 88.72 93.33 75.07 83.98

35

第 36 页

表 6(续)所有 6 种方法在 15 部小说和 9 个子指标上的每部小说得分。

(d) ViMax

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 82.00 78.00 85.00 88.14 81.97 97.96 75.74 72.00 56.00 79.65 C2 83.00 79.00 84.00 83.70 86.28 86.56 91.95 78.00 64.00 81.83 C3 86.00 87.00 87.00 84.00 89.33 91.33 97.75 80.00 59.00 84.60 C4 72.00 80.00 82.00 78.68 91.54 97.96 77.55 88.00 72.00 82.19 C5 86.00 88.00 88.00 75.59 85.98 95.95 95.27 86.00 84.00 87.20 简单平均 81.80 82.40 85.20 82.02 87.02 93.95 87.65 80.80 67.00 83.09

C6 66.00 74.00 65.00 84.51 83.62 94.50 93.32 81.00 68.00 78.88 C7 79.00 83.00 83.00 77.20 89.43 87.50 98.98 71.00 56.00 80.57 C8 73.00 80.00 80.00 70.47 83.57 94.91 91.21 76.00 69.00 79.80 C9 84.00 86.00 85.00 83.50 86.73 94.79 98.15 81.00 69.00 85.35 C10 67.00 69.00 70.00 75.59 87.06 95.78 92.50 78.00 56.00 76.77 中等平均 73.80 78.40 76.60 78.25 86.08 93.50 94.83 77.40 63.60 80.27

C11 86.00 87.00 87.00 80.32 87.73 95.00 98.62 71.00 55.00 83.07 C12 67.00 77.00 77.00 76.00 92.60 86.27 97.83 68.00 46.00 76.41 C13 66.00 78.00 84.00 79.40 87.77 94.47 77.78 83.00 56.00 78.49 C14 82.00 81.00 79.00 84.35 86.42 96.96 90.15 78.00 63.00 82.32 C15 73.00 78.00 79.00 79.48 89.51 97.72 86.92 83.00 49.00 79.51 困难平均 74.80 80.20 81.20 79.91 88.81 94.08 90.26 76.60 53.80 79.96

总体 76.80 80.33 81.00 80.06 87.30 93.84 90.91 78.27 61.47 81.11

(e) VideoClaw

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 77.00 79.00 78.00 83.53 91.11 91.40 84.75 81.00 64.00 81.09 C2 87.00 88.00 87.00 51.68 99.23 95.57 78.45 78.00 53.00 79.77 C3 82.00 83.00 83.00 80.18 94.82 98.17 92.33 99.00 90.00 89.17 C4 77.00 81.00 79.00 76.15 95.95 94.74 92.94 94.00 79.00 85.53 C5 82.00 85.00 86.00 49.86 92.80 97.01 91.90 97.00 88.00 85.51 简单平均 81.00 83.20 82.60 68.28 94.78 95.38 88.07 89.80 74.80 84.21

C6 75.00 69.00 70.00 71.33 78.71 88.42 81.67 68.00 52.00 72.68 C7 83.00 82.00 86.00 74.21 97.95 96.58 89.18 86.00 75.00 85.55 C8 85.00 88.00 85.00 80.05 94.98 98.47 94.28 95.00 82.00 89.20 C9 85.00 86.00 87.00 82.07 93.73 94.35 93.00 79.00 56.00 84.02 C10 79.00 82.00 83.00 78.97 96.80 98.53 95.09 97.00 89.00 88.82 中等平均 81.40 81.40 82.20 77.33 92.43 95.27 90.64 85.00 70.80 84.05

C11 64.00 72.00 81.00 79.60 92.80 97.23 97.76 80.00 56.00 80.04 C12 76.00 84.00 86.00 73.90 90.86 83.43 98.56 76.00 40.00 78.75 C13 83.00 88.00 88.00 85.38 98.81 98.96 96.90 99.00 81.00 91.01 C14 81.00 83.00 81.00 82.44 95.72 99.88 88.83 99.00 85.00 88.43 C15 80.00 80.00 81.00 49.53 94.39 98.88 87.17 96.00 83.00 83.33 困难平均 76.80 81.40 83.40 74.17 94.52 95.68 93.84 90.00 69.00 84.31

总体 79.73 82.00 82.73 73.26 93.91 95.44 90.85 88.27 71.53 84.19

(f) FilmWorld (Ours)

电影呈现 电影一致性 小说保真度

ID VP NEP AVP CC SC OC NHR LR SR 总体

C1 80.00 86.00 85.00 85.28 90.53 94.15 93.07 94.00 75.00 87.00 C2 82.00 87.00 85.00 84.47 94.38 98.06 97.69 98.00 86.00 90.29 C3 84.00 86.00 82.00 83.25 92.95 98.65 99.48 97.00 89.00 90.26 C4 78.00 82.00 84.00 78.33 91.63 100.00 98.06 99.00 87.00 88.67 C5 85.00 88.00 86.00 83.19 93.73 95.26 96.53 97.00 83.00 89.75 简单平均 81.80 85.80 84.40 82.90 92.64 97.22 96.97 97.00 84.00 89.19

C6 73.00 79.00 77.00 81.47 93.93 95.61 91.49 100.00 91.00 86.94 C7 80.00 84.00 85.00 80.78 94.76 95.55 95.75 100.00 87.00 89.20 C8 85.00 88.00 86.00 82.84 94.29 99.44 97.55 100.00 88.00 91.24 C9 84.00 88.00 85.00 84.72 94.94 97.04 92.39 97.00 83.00 89.57 C10 79.00 81.00 83.00 80.92 98.31 98.81 90.48 99.00 81.00 87.95 中等平均 80.20 84.00 83.20 82.15 95.25 97.29 93.53 99.20 86.00 88.98

C11 78.00 80.00 80.00 84.69 95.65 98.53 98.61 99.00 85.00 88.83 C12 81.00 86.00 84.00 81.74 96.10 98.08 98.85 99.00 91.00 90.64 C13 80.00 83.00 83.00 85.03 95.94 99.29 97.92 98.00 83.00 89.46 C14 83.00 86.00 85.00 85.19 96.79 98.06 95.85 100.00 85.00 90.54 C15 83.00 85.00 86.00 83.88 95.74 99.55 95.11 98.00 87.00 90.36 困难平均 81.00 84.00 83.60 84.11 96.04 98.70 97.27 98.80 86.20 89.97

总体 81.00 84.60 83.73 83.05 94.64 97.74 95.92 98.33 85.40 89.38

36

第 37 页

难度 1400 简单 中等 困难 1200 20

1000

15 (秒) 800 (分钟) 时长 600 10 电影

400

5

200

0 0 FilmWorld (Ours) MovieAgent VideoClaw MM-StoryAgent VGoT ViMax

图18 六个系统生成的视频时长分布。每个箱线图总结了由一个系统生成的15部电影的时长(每部对应一部FilmEval小说),各个数据点根据难度等级(简单/中等/困难)着色;系统按其中位数时长排序。FilmWorld不仅产生了最长的电影(中位数12.9分钟),而且跨度最广,时长从简单到困难显著增加。

表7 六个系统在15部FilmEval小说上生成的视频时长(分:秒)。每个单元格表示给定系统为给定小说生成的电影的实际时长;行按难度等级分组。最右列报告了源文本长度(C1–C2、C6–C7、C11–C12为英文单词数,其余为中文字符数)。FilmWorld根据其输出长度随叙事复杂度缩放,而固定流水线基线则产生接近恒定的时长。

ID FilmWorld VideoClaw MM-StoryAgent MovieAgent VGoT ViMax 长度

C1 4:43 2:19 3:44 4:37 2:06 1:56 1,015 C2 6:55 2:27 3:44 5:58 2:06 1:46 1,149 C3 6:43 7:04 3:16 4:12 2:06 1:56 1,633 C4 5:26 3:59 3:16 3:01 2:01 1:46 1,492 C5 6:37 5:55 3:16 3:52 2:06 2:16 1,614 C6 9:11 1:01 3:44 6:53 2:06 1:51 1,348 C7 13:07 3:07 3:16 5:12 2:06 1:26 2,067 C8 11:08 6:41 3:30 4:32 2:06 1:51 2,214 C9 12:57 2:56 3:16 4:57 2:06 1:31 2,996 C10 13:27 9:52 3:16 2:46 2:06 2:06 2,907 C11 17:30 2:46 3:30 8:04 2:06 1:10 2,334 C12 21:36 2:44 3:16 5:53 2:06 1:10 2,733 C13 20:06 11:36 3:02 5:07 2:06 2:06 4,829 C14 23:50 11:14 3:16 6:03 2:06 1:56 4,334 C15 13:07 10:00 3:16 3:32 2:06 1:56 4,663

B.3 关于生成电影的时长

时长是一个诊断信号,而非评价指标。忠实改编小说需要足够的银幕时间来呈现其场景、人物和事件;一个将4800字的故事压缩到两分钟的系统必然省略了大部分内容。因此,我们将生成的时长视为叙事覆盖范围的物理痕迹,即故事可能被呈现内容的下限,而不是作为质量指标,因为更长的电影并不天生更好。结合保真度和一致性分数进行解读,它可以诊断一个系统是处理了整个叙事,还是仅仅采样了片段。图18和表7报告了所有六个系统在15部小说上的每部电影时长。

FilmWorld根据叙事复杂度缩放时长。六个系统分为两类机制。固定流水线基线产生与源文本解耦的近乎恒定的时长:无论输入是1015字的短篇故事还是4829字符的中篇小说,VGoT都坍缩至约2.1分钟,MM-StoryAgent 都坍缩至约3.3分钟。相比之下,FilmWorld不仅产生了最长的电影(中位数12.9分钟),而且跨度最大,从简单源文本的4–7分钟增长到大多数困难源文本的17–24分钟。重要的是,这种趋势反映的是内容体量而非难度本身:我们的难度等级是由叙事结构复杂度定义的,这并不一定转化为更长的银幕时间。唯一的例外是C15,一个

37

第 38 页

故事难度为高难度的案例,其 FilmWorld 呈现版本仅持续 13.1 分钟,短于其他高难度案例,因为其复杂性主要源于密集、快节奏的对话,这些对话在语言上丰富但在视觉上紧凑,因此占据的屏幕时间很少。这种长度与内容的缩放比例正是真实叙事覆盖所预期的行为:由于我们的构建阶段在渲染之前实现了所有世界实体和情节事件的完整集合,下游镜头规划会扩展以适应故事实际所需的内容,而不是将其截断为固定预算。相比之下,基线方法的平坦曲线暴露了它们在物理上能够代表的叙事量的结构上限。

图 19 FilmEval 上的跨评估器分析。我们在五个系统上重新运行自动协议,使用三个不同的多模态大语言模型(MLLM)评估器(Gemini 3.1 Pro、Qwen3.5-Omni 和 Seed2.0-Lite)。(a)每种方法在每个评估器下的总体得分:FilmWorld 在所有三个评估器下均排名第一,且诱导出的排名几乎相同(Spearman ρ≥0.9)。(b)按维度的平均逐样本成对一致性,三个成对值以点叠加显示:相关性从电影呈现(r=0.32)增加到电影一致性(r=0.51)再到小说保真度(r=0.88)。

图 20 每个 MLLM 评估器与人类评分之间的对齐情况。对于每个评估器,我们绘制了 75 部电影中每部电影的总体得分(Y)与人类平均评分(X,0–5 缩放为 0–100)的关系图,颜色按系统区分。实线为线性拟合及其 95% 置信区间;标注了 Pearson r、Spearman ρ 和双侧 p 值。所有三个评估器与人类判断均呈显著正相关。

B.4 FilmEval 上的跨评估器分析

对于任何基于 MLLM 的协议,一个自然的担忧是其判决是否依赖于特定的评估模型。为了测试这一点,我们使用另外两个多模态模型 Qwen3.5-Omni 和 Seed2.0-Lite 重新运行整个 FilmEval 协议,并将它们的得分与我们默认的 Gemini 3.1 Pro 评估器的得分进行比较。

系统级排名具有模型不变性。如图 19(a) 所示,FilmWorld 被每个评估器均排名第一,且优势一致。诱导出的方法顺序几乎相同,Gemini 与 Qwen 之间的 Spearman 秩相关系数为 ρ = 1.0,与 Seed 的相关系数为 ρ = 0.9,唯一的区别是得分相近的 MovieAgent 和 VGoT 之间发生了一次相邻交换。因此,从 FilmEval 得出的结论,特别是 FilmWorld 的优越性,不依赖于评估器的选择。

38

第 39 页

协议遵循从客观到主观的梯度。在更细粒度的样本级别(图 19(b)),三位评委之间的平均成对相关性从电影呈现(Cinematic Presentation,r = 0.32)单调上升至电影一致性(Film Consistency,r = 0.51),再上升至小说保真度(Novel Fidelity,r = 0.88)。这一模式与自动-人类对齐情况相似:基于检查表且以小说为锚点的小说保真度和电影一致性指标评估的是客观可验证的属性,并在不同评委之间几乎完美地迁移;而电影呈现针对的是审美质量,这本质上是依赖于评委的。

每位评估者都与人类判断保持一致。除了彼此达成一致外,三位评委均追踪人类感知。图 20 绘制了每位评估者对每部影片的总体得分与 75 部影片的平均人类评分之间的关系。每位评委的评分与人类评分均呈显著正相关(Gemini、Qwen 和 Seed 的 Pearson r 分别为 0.79、0.75 和 0.47;所有 p < 10−4),且他们的 Spearman 系数始终很高(三者均为 ρ ≈ 0.74)。Seed2.0-Lite 较低的 Pearson 值反映了少数被压缩的低分异常值,而非较弱的单调趋势,因此无论使用哪种 MLLM 模型实例化 FilmEval,都能恢复生成影片的人类感知质量排序。

C 基线适配细节

我们详述了主论文中的五个基线。每个条目遵循统一的四部分结构:原生流水线、我们的适配、保留与修改的编排,以及来源。为了隔离框架级别的差异,所有基线均与 FilmWorld 共享相同的基础堆栈:文本规划使用 Gemini 3.1 Pro,图像生成使用 Nano Banana 2,视频生成使用 Wan 2.7。我们的完整复现代码在以下仓库中公开可用。

GitHub: github.com/HaoTone-monster/N2FBaseline

MM-StoryAgent 。原生流水线。MM-StoryAgent 将故事规范转换为大纲和页面序列,然后生成页面级的图像、语音、音效和音乐资产,并将其组合成视频。适配。我们输入完整的小说,并提示文本模型生成忠于源材料的大纲和有序页面集。图像模型渲染风格一致的插图,MusicGen 提供背景音乐。保留/修改的编排。我们保留从大纲到页面的层级结构和幻灯片组合,但仅保留图像和音乐分支;语音和音效分支被禁用。来源。官方公开实现:github.com/X-PLUG/MM_StoryAgent 。

VGoT (VideoGen-of-Thought)。原生流水线。VGoT 将简短提示扩展为多镜头故事线,生成角色舞台化身和镜头关键帧,并通过身份条件和潜在传播强制执行跨镜头一致性。适配。我们将每部小说转换为 25 镜头的故事线,生成化身和基于化身的关键帧,并将每个镜头视频以其对应的关键帧为条件。保留/修改的编排。我们保留动态故事线规划、五维镜头提示和化身分配。跨镜头身份改为通过显式的图像空间化身引用进行传播,取代了原始的 IP-Adapter 和相邻潜在传播。来源。官方公开实现:github.com/DuNGEOnmassster/VideoGen-of-Thought。

MovieAgent 。原生流水线。MovieAgent 将剧本层次分解为子脚本、场景和镜头,然后渲染基于角色的镜头图像和视频以供最终组装。适配。我们将小说自动转换为具有结构化角色档案的 MovieScript,生成标准角色肖像,并添加忠于源材料的动画和对话表演约束。保留/修改的编排。我们保留编剧(Screenwriter)、场景规划(Scene Planning)和镜头情节创建(Shot Plot Create)Agent 。原始的 manual input preparation 和渲染后端被替换为我们的自动小说转换和共享基础堆栈。来源。官方公开实现:github.com/showlab/MovieAgent 。

ViMax。原生流水线。ViMax 执行角色提取、多视角肖像生成、分镜设计、相机树构建、参考选择、帧生成和镜头视频组合。适配。我们使用完整的小说作为脚本输入,并移除内置的镜头数量限制。修订后的提示强调忠于源材料、无限制的镜头规划、稳定的角色身份以及一致的吉卜力风格。保留/修改的编排。我们保留相机树、参考管理、过渡生成和首/尾帧条件控制,同时将文本、图像和视频生成重定向到共享后端。来源。官方公开实现:github.com/HKUDS/ViMax。

39

第 40 页

VideoClaw。原生流水线。VideoClaw 通过剧本、角色、分镜、参考帧、视频生成和后编辑阶段处理创意概念。改编。我们将简短的创意输入替换为完整小说,并将提示词从短剧扩展修订为在一致的角色和动画约束下忠实于单集改编。保留/修改的编排。我们保留了六阶段 Agent 工作流和项目会话资产传递,同时调整了输入语义、提示词和生成后端。来源。官方公开实现:github.com/HITsz-TMG/AIGC-Claw。

图 21 呈现给标注员的人类评估评分标准。三个维度中的每一个均采用 0–5 级李克特量表进行评分,并附带具体的子标准列表和分等级锚点描述。

D 人类评估协议

本节记录了主论文中报告的人类评估分数的收集方式。人类评估通过捕捉难以在自动评估器中完全操作化的整体感知判断,补充了自动指标。

D.1 评分标准

每位标注员首先阅读源小说,然后观看匿名视频,随后从三个维度对其进行评分,即电影呈现、电影一致性和小说保真度,每个维度均采用 0–5 级李克特量表(0

40

第 41 页

图 22 用于人工评估的基于 Web 的标注界面。左侧面板显示源小说及其标题和难度等级;右侧面板展示匿名视频,并收集对电影呈现(Cinematic Presentation)、电影一致性(Film Consistency)和小说保真度(Novel Fidelity)的独立 0–5 评分,以及可选的评论。

= 完全不可接受,5 = 优秀)。这三个维度是独立评判的,因为高质量的视觉效果并不意味着忠实改编,而情节准确的视频也不一定是内部一致的。电影呈现(Cinematic Presentation)针对视频的内在感知质量,涵盖视觉美学、风格稳定性、镜头呈现和整体可看性。电影一致性(Film Consistency)针对镜头间的时间稳定性,涵盖角色、场景、物体及其空间关系的连贯性。小说保真度(Novel Fidelity)针对对源材料的忠实度,涵盖角色、情节、场景和关系的还原以及幻觉控制。提供给标注者的完整说明和各级锚点如图 21 所示。

D.2 标注界面

为了标准化评估流程并最小化认知负荷,我们开发了一个专用的基于 Web 的标注界面,如图 22 所示。该界面采用双面板布局,将源材料和视频并排显示,以便标注者在观看时交叉参考故事。左侧面板显示小说的标题、难度等级和完整可滚动文本,而右侧面板在带有播放控制的标准播放器中嵌入匿名视频。播放器下方,三个评估维度,即电影呈现(Cinematic Presentation)、电影一致性(Film Consistency)和小说保真度(Novel Fidelity),分别通过一行 0–5 按钮进行评分,每个按钮旁附有一行标准提醒,随后是一个可选的自由文本评论框。所有视频均以匿名标识符(例如,Video 000017)呈现,以防止方法身份偏差,并且其显示顺序在标注者之间是随机化的。提交的评分可以随时修改并重新提交,允许标注者在熟悉样本池后重新校准。

41

第 42 页

E 讨论

E.1 局限性与未来工作

尽管 FilmWorld 在实证表现上强劲,但它仍存在若干局限性,这些局限性划定了其当前的边界,并指明了未来工作的方向。

输入长度与分层世界记忆。我们的实验主要聚焦于约 1,000–5,000 个中文字符或 1,000–3,000 个英文单词的叙事。扩展到完整长篇小说尚未得到验证,且需要一种分层的世界记忆机制,该机制需总结章节级别的状态,并仅在每个场景中重新实例化局部相关的实体,以保持上下文和计算的可处理性。

上游世界构建错误。FilmWorld 将解析后的符号轨迹视为下游 Agent 的共享真理来源。当轨迹正确时,这种设计增强了一致性;但相同的机制也会传播来自实体解析、隐式事件恢复、时间排序或状态分配的错误,导致生成的电影在内部一致,却微妙地偏离了源文本。具备不确定性感知的状态构建,以及从每个状态分配回溯到文本的溯源链接,是极具前景的保障措施。

离散的世界状态表示。通过年龄阶段、服装、季节和天气等离散属性对实体进行编码,使得一致性能够被显式强制执行,但这也将诸如逐渐衰老、光线演变和微妙情绪变化等本质上连续的属性进行了量化。结合离散事件与连续属性和状态的混合表示是自然的下一步。

缺乏显式的 3D 空间先验。FilmWorld 中的空间关系仅锚定在文本和视觉参考层面,缺乏底层的几何场景,这可能导致实体在视觉复杂的布局中空间定位缺失。引入粗略的 3D 场景代理将增强跨镜头的空间连贯性和相机一致的渲染效果。

超越叙事忠实度的电影艺术性。FilmWorld 优先考虑叙事内容的忠实还原,但电影改编还依赖于省略、节奏、蒙太奇、象征性镜头语言以及主题重构。逐事件呈现散文内容因此可能会惩罚合法的导演再创作,且我们的自动指标仅在两种语言下的 15 个中等长度叙事、单一视觉风格上进行了验证,并未评估语调、氛围或作者风格等美学质量。更广泛的基准测试和对导演意图的显式建模留待未来工作。

渲染保真度受限于基础模型。如附录 B.3 分析所示,FilmWorld 在符号层面强制执行一致性,但像素级的保真度仍受限于底层图像和视频生成器。由于我们的框架在这些骨干网络方面是模块化的,随着基础模型的进步,残留的渲染伪影预计将减少。

E.2 滥用风险与负责任发布

作为小说到电影的转换系统,FilmWorld 继承了生成媒体常见的双重用途风险。我们在下面概述了主要关切,以及我们采取的缓解措施。

知识产权。由小说生成的电影属于衍生作品,未经授权将 FilmWorld 应用于受版权保护的文本可能会引发知识产权问题。因此,FilmEval 仅基于原创、公有领域或大幅重写的内容构建,其他用户部署该系统时,需自行负责确保其输入内容的权利。

合成媒体滥用。像任何视频生成系统一样,FilmWorld 原则上可能被滥用于制造误导性画面。我们当前设置的两个特性部分缓解了这种风险:输出采用明显的风格化、非照片写实的美学渲染,且角色身份源自虚构实体而非真实人物。这些是缓解措施而非保证,随着基础生成器变得更加照片写实,仍需保持持续警惕。

负责任发布。我们发布资源以支持可重复性和下游研究。该发布旨在用于研究目的,在禁止虚假信息和对真实人物进行非自愿描绘等有害应用的许可下分发,并鼓励明确披露输出内容为 AI 生成。FilmWorld 旨在作为辅助人类创作者的工具,而非取代编辑判断。

42

发表评论