SlotMem:解决长视频角色漂移的角色可寻址记忆框架

三分钟导读:SlotMem提出了一种角色可寻址的内部记忆框架,通过Character-Semantic Probe定位特征、Memory Encoder压缩为紧凑的角色槽位,并利用Memory Writer进行保守更新,以解决长视频生成中跨场景的角色身份一致性问题。

英文题目:SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.15772

原始论文:PDF / 论文页面

对应视频标题:SlotMem:解决长视频角色漂移的角色可寻址记忆框架|推荐指数:★★★★★

这篇论文解决什么问题?

现有长视频生成方法在保持重复出现的角色身份一致性方面存在不足,全局一致性方法检索的线索未针对角色身份优化,而基于关键帧的记忆方法将角色身份与背景、姿态等偶然视觉因素纠缠,且缺乏在有限内存容量下的连续更新机制。

核心创新

  • 提出角色可寻址的内部记忆表示,用紧凑的角色槽位替代粗粒度的帧级记忆,减少身份与背景的纠缠。
  • 设计基于Character-Semantic Probe的记忆感知机制,无需外部检测器即可从交叉注意力响应中定位角色相关token。
  • 引入Memory Writer实现记忆的动态保守更新,通过门控机制融合新观察到的特征,避免关键帧替换带来的信息丢失。
  • 采用Character-Wise Cross-Attention进行稀疏记忆注入,确保身份信息仅作用于目标角色区域。

方法概览

SlotMem基于Wan2.2-I2V-A14B,包含四个组件:1) Character-Semantic Probe:利用文本-视觉交叉注意力响应定位与特定角色相关的DiT token;2) Memory Encoder:将定位到的token压缩为紧凑的角色槽位记忆;3) Memory Writer:在生成过程中通过保守的残差修正更新槽位记忆;4) Character-Wise Cross-Attention:将记忆仅注入到当前生成块中对应角色的局部token中。

逐图理解论文

SlotMem核心架构概览

SlotMem核心架构概览
Figure 1: Overview of SlotMem. It senses and encodes role-wise memory from the source chunk through Character-Semantic Probe and Memory Encoder (top-left), injects the memory through Character-Wise Cross-Attention (bottom-left), and updates the memory across the autoregressive generation process through the Memory Writer (bottom-right).

SlotMem基于Wan2.2-I2V-A14B,包含四个核心组件。首先是Character-Semantic Probe,利用文本-视觉交叉注意力响应定位与特定角色相关的DiT token。接着Memory Encoder将定位到的token压缩为紧凑的角色槽位记忆。

Character-Semantic Probe原理

Character-Semantic Probe原理
Figure 5: Character-Semantic Probe. Given an input latent, the probe aggregates cross-attention responses to each character name, computes character-semantic responses, selects top-p character- sensitive tokens, and filters isolated noisy tokens for memory construction and sparse injection.

Character-Semantic Probe无需外部检测器,直接从交叉注意力响应中定位角色相关token。它聚合对每个角色名称的交叉注意力响应,计算角色语义响应,选择top-p敏感token,并过滤孤立噪声token,为记忆构建提供精准输入。

视觉化验证定位准确性

视觉化验证定位准确性
Figure 6: Visualization of Character-Semantic Probe Regions in Pixel Space. We remap the latent tokens selected by the Character-Semantic Probe to the original pixel space and visualize the first frame of each corresponding 8-frame patch. For visualization, the colored character token in each prompt is matched with the memory patch of the same color shown above.

通过将latent token映射回像素空间,我们可以可视化Character-Semantic Probe选中的区域。结果显示,彩色标记的角色token与提示词中的角色名称精确匹配,证明了该探针能有效从复杂背景中提取出纯粹的角色语义特征。

定量评估:基准测试表现

定量评估:基准测试表现
Table 1: Performance comparison of the baselines and SlotMem across different benchmarks. All models use Wan2.2-I2V-A14B as the backbone.

在VBench、ViStoryBench和NarraStream-Bench等基准上进行定量评估。SlotMem在VBench Human Anatomy上达到0.9480,在ViStoryBench Character Similarity上达到0.8603,在NarraStream-Bench Subject Consistency上达到0.8771,显著优于基线。

VLM敏感指标与人类偏好

VLM敏感指标与人类偏好
Table 3: VLM-sensitive metrics under different VLM judges. Prompt Alignment is from ViStory- Bench, while Conditional Adjacent, Conditional Long-range, Entity Grounding, and VLM Score are from NarraStream-Bench. SlotMem achieves the best performance on nearly all VLM metrics across different VLM judges.

在VLM敏感指标上,SlotMem在多个VLM裁判下均取得最佳性能,NarraStream-Bench VLM Score达到0.5384。在人类偏好研究中,针对主体一致性的胜率高达86.1%,远超Wan2.2基线,表明其在视觉自然性和提示对齐上的优势。

实验与关键结果

  • 在VBench, ViStoryBench, NarraStream-Bench等多个基准上进行定量评估。
  • 进行消融实验,验证Memory Encoder和Memory Writer的有效性。
  • 进行人类偏好研究,评估主体一致性、提示对齐、美学质量和物理自然性。
  • 对比基线方法:Wan2.2-I2V, StoryDiffusion, StoryMem, IAMFlow。
  • 在VBench, ViStoryBench, NarraStream-Bench等多个基准上进行定量评估。
  • 进行消融实验,验证Memory Encoder和Memory Writer的有效性。
  • 进行人类偏好研究,评估主体一致性、提示对齐、美学质量和物理自然性。
  • 对比基线方法:Wan2.2-I2V, StoryDiffusion, StoryMem, IAMFlow。

阅读时需要注意

  • 训练规模有限,未在更大规模、更多样化的训练集上进行充分评估。
  • 严重依赖提示词中的角色语义锚点,若自动标注管道生成的角色名称不一致或模糊,会影响记忆构建和注入效果。
  • 在多个视觉上相似的角色出现在同一帧时,简单的文本名称可能不足以完全解耦特征记忆。
  • 训练数据来自公开电影和视频,受版权保护,无法发布视频数据。
  • Character-Semantic Probe依赖于提示词中角色名称的一致性,若名称不统一会导致记忆检索失败。

关联工作

  • IAMFlow:基线方法,使用VLM分数选择关键帧并保留KV缓存,但存在身份纠缠和无法连续更新的问题。(第 2 页)
  • StoryDiffusion:基线方法,使用一致自注意力,但在长视频生成中角色一致性较差。(第 3 页)
  • MultiShotMaster:数据策展流程的参考来源,SlotMem借鉴其分层标注策略但移除了主体合并组件。(第 14 页)
  • Wan2.2:SlotMem使用的骨干模型。(第 2 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

SlotMem:面向叙事长视频生成的角色可寻址内部记忆

Yilai Liu1 Xin Zhang2 Shiyuan Zhang1 Hongyang Du1∗ 1香港大学 2清华大学 yilai_liu@connect.hku.hk duhy@hku.hk

摘要

在叙事长视频生成中,维持跨场景转换和长时间间隔的重复角色身份一致性是一个核心挑战。针对全局一致性的方法通常使用与角色身份保持不对齐的线索来检索记忆,而最近以角色为中心的方法变体仍然依赖于粗糙的帧级 kv 记忆,这种记忆将身份与偶然的视觉因素纠缠在一起,并且在有限的记忆容量下缺乏连续更新机制。为了解决这些局限性,我们提出了 SlotMem,这是一个用于多角色叙事长视频生成的角色可寻址内部记忆框架。具体而言,SlotMem 使用角色语义探针(Character-Semantic Probe)和记忆编码器(Memory Encoder)从交叉注意力响应中定位与角色相关的 token,并将 DiT token 压缩为紧凑的角色级槽位记忆(Slot Memory)。随着生成的进行,记忆写入器(Memory Writer)保守地用新观察结果更新每个角色的记忆,而角色级交叉注意力(Character-Wise Cross-Attention)检索角色记忆,并将其仅注入到同一角色的定位 token 中。在多个叙事长视频生成基准测试上的实验表明,SlotMem 在现有基线之上提高了长程角色一致性,同时保持了相当的视频质量。[cs.CV] 我们的代码可在 https://github.com/YilaiLiu-HKU/SlotMem 获取。

1 引言

最近的视频生成模型在生成视觉逼真的短视频方面取得了显著进展 [17, 10]。随着生成从短视频转向长叙事,关键挑战从局部视觉保真度转向长程一致性,尤其是角色一致性。当角色消失、重新出现、改变视角或在较长时间内与不同场景交互时,这变得尤其具有挑战性。在实践中,长视频生成通常被表述为自回归视频生成,其中长序列被分块生成,仅利用局部历史上下文以适应 GPU 内存限制 [7, 3, 11]。尽管这种策略提高了可扩展性,但它将模型限制在生成历史的局部视角。因此,先前观察到的特征和外观细节可能会被丢弃在局部上下文之外。当这种信息在长时间间隔后再次需要时,模型可能无法重建具有相同身份一致性的角色 [11],从而导致身份漂移。

现有方法通过基于特定任务标准的记忆检索来减少长视频生成中的不同形式的漂移,例如几何重叠、美学质量或与即将生成的块相关的语义相关性 [23, 25, 9, 2]。然而,这些标准并未明确优化以在长时间间隔内保持重复角色身份。因此,检索到的记忆可能包含有用的视觉上下文,但不能保证特定于角色的身份指导,只能间接缓解身份漂移。

∗通讯作者。

预印本。

第 2 页

图 1:SlotMem 概述。它通过角色语义探针(Character-Semantic Probe)和记忆编码器(Memory Encoder)从源片段中感知并编码角色级记忆(左上),通过角色级交叉注意力(Character-Wise Cross-Attention)注入记忆(左下),并通过记忆写入器(Memory Writer)在自回归生成过程中更新记忆(右下)。

最近的身份感知记忆方法 IAMFlow [12] 通过使用视觉语言模型(VLM)分数选择角色关键帧并将其 KV 缓存纳入生成过程,在面向角色的记忆方面迈出了重要一步。然而,帧级记忆仍然是所选关键帧的整体表示,其中角色身份与姿态、视角、背景、光照和附近的视觉元素纠缠在一起。因此,重用这些帧级特征或 KV 缓存可能会将上述偶然因素与所需的身份线索一起传输,使得当当前片段需要新的姿态、视角或交互时,记忆变得不够灵活。此外,当记忆缓冲区已满时,基于关键帧的记忆只能根据启发式标准(如低重要性分数或时间距离)丢弃帧,而不是通过新观察结果持续更新存储的角色记忆。这些问题表明,角色记忆应更好地与背景和其他角色解耦,并通过将先前记忆与新观察结果整合来动态更新。

这促使我们引入 SlotMem,这是一种用于叙事长视频生成的、可寻址角色的内部记忆框架。SlotMem 不是将选定的关键帧存储为孤立的历史观察结果,而是将每个重复出现的角色表示为从特征 token 中提取的紧凑记忆状态。在固定的记忆预算下,生成过程中观察到的新角色特征不会作为额外的帧级记忆追加,而是通过保守更新合并到现有的角色槽位中。这将记忆管理从离散的关键帧选择转变为内部记忆提取和演化。

基于 WAN2.2 [18],SlotMem 首先使用角色语义探针(Character-Semantic Probe)从交叉注意力响应中感知特定角色的相关视觉 token,然后通过记忆编码器(Memory Encoder)将其内部 DiT 特征编码为角色级槽位记忆(Slot Memory)。在随后的片段生成过程中,相应的角色记忆被检索并仅通过角色级交叉注意力(Character-Wise Cross-Attention)注入到同一角色的局部 token 中。随着生成的进行,记忆写入器(Memory Writer)在保留已学习记忆的同时,使用可靠的新观察结果更新存储的槽位。这种设计减少了角色身份与背景及共现角色等偶然视觉因素之间的纠缠,从而为叙事视频生成提供细粒度的身份引导。

主要贡献如下:

2

第 3 页

• 我们提出了 SlotMem,这是一种按角色划分的记忆框架,它使用记忆槽位而非关键帧记忆来表示每个重复出现的角色,从而减少与背景、姿态和其他角色的纠缠。 • 我们设计了一种以角色为中心的记忆感知、更新和注入机制。SlotMem 通过角色语义探针(Character-Semantic Probe)定位与角色相关的 token,通过记忆编码器(Memory Encoder)将它们压缩为槽位记忆,通过记忆写入器(Memory Writer)整合新的观测结果,并将记忆仅注入到同一角色的已定位 token 中。 • 我们在多角色叙事长视频生成任务上对 SlotMem 进行了评估,使用了通用视频质量基准和身份相似度指标,结果显示,与现有基线相比,SlotMem 在保持相当视频质量的同时,提高了角色一致性。

2 相关工作

长视频生成。长视频生成仍然具有挑战性,因为模型必须在有限的上下文长度和累积生成误差下保持时间连贯性。现有方法主要通过扩展上下文、压缩历史信息或稳定自回归展开来解决这一问题。LCT [5] 通过密集长上下文注意力扩展了预训练的 DiTs,而 StreamingT2V [6] 和 HoloCine [14] 则通过显式的时间建模支持长格式或可控生成。其他方法通过紧凑或循环上下文建模来降低历史成本,包括 FramePack [26]、PFP [27]、VideoSSM [24] 和 OneStory [1]。基于强制的方法缓解了自回归视频扩散中的训练-测试不匹配问题 [7, 3, 13, 22],而 Stable Video Infinity [11] 将这一思想扩展到跨块自回归生成,并采用误差回收微调。这些方法提高了可扩展性和时间稳定性,但主要保留了帧级、块级或展开级的连续性,导致重复出现的角色在长时间间隔后容易出现身份漂移。

基于记忆的叙事长视频生成。基于记忆的视频生成通过重用早期生成的内容来提高长程一致性。StoryDiffusion [30] 引入了恒定自注意力以改善长程视觉连贯性,Context-as-Memory [23] 检索历史帧作为场景一致生成的可重用上下文,StoryMem [25] 将多镜头叙事重新表述为基于显式视觉记忆库的条件迭代镜头合成,而 MemFlow [9] 动态检索相关历史帧,并为每个即将到来的块仅激活最有用的记忆 token。MoC [2] 进一步将长视频生成表述为内部信息检索,其中每个查询通过学习的稀疏路由选择相关的上下文块。此外,MovieAgent [20]、DreamFactory [21]、AniMaker [16] 和 VideoMemory [29] 等多智能体系统利用外部记忆和智能体工作流,基于短视频模型组织长格式生成。尽管这些方法展示了记忆对于全局视觉一致性(如背景和风格)的价值,但其检索和记忆注入并非以角色为中心。这导致目标角色的记忆与背景、场景状态和其他角色纠缠在一起。IAMFlow [12] 从选定的关键帧构建以角色为中心的记忆,但关键帧记忆仍存在两个局限性:角色身份仍然与偶然的视觉因素纠缠,且记忆只能通过替换关键帧来刷新,而不是通过新观测结果连续更新存储的角色表示。

3 方法论

SlotMem 通过存储重复出现角色的内部特征并在同一角色再次出现时重用它们,来解决自回归视频生成中的身份漂移问题。该框架由四个组件组成:(i) 使用角色语义探针(Character-Semantic Probe)进行记忆感知,以识别与角色相关的视觉 token;(ii) 使用记忆编码器(Memory Encoder)进行记忆提取,将选定的内部特征压缩为紧凑的槽位记忆;(iii) 使用记忆写入器(Memory Writer)进行记忆更新,将当前块提取的记忆与存储的记忆对齐,并通过保守的残差校正进行更新;(iv) 使用角色级交叉注意力(Character-Wise Cross-Attention)进行记忆注入,检索相应的角色记忆,并仅将其注入到由角色语义探针定位的目标 token 中。

带记忆检索的自回归视频生成。给定块提示序列 $\{p_k\}_{k=1}^K$ 和生成的视频块 $\{x_k\}_{k=1}^K$,带记忆检索的自回归视频生成可以

第 4 页

分解为 $$ p_\theta(x_{1:K} | p_{1:K}) = \prod_{k=1}^{K} p_\theta \left( x_k \mid L_k, R(M_{k-1} | q_k), p_k \right), \quad (1) $$ 其中 $L$、$M$ 和 $q$ 分别表示局部上下文、记忆和检索提示。

现有方法主要在如何定义 $M$、$q$ 和检索规则 $R$ 上有所不同。大多数方法关注全局一致性而非角色一致性,并依赖诸如时间位置、美学质量、帧相似度或提示对齐等提示 $q$ [2, 25, 9],这些都不是可针对角色寻址的。因此,检索到的记忆并未显式绑定到特定的重复出现角色。另一方面,身份感知方法如 IAMFlow [12] 按角色重要性组织记忆 $M$,但仍然检索帧作为记忆。这种粗粒度的记忆将目标角色身份与其他角色及背景纠缠在一起,导致特征纠缠。

SlotMem 使用角色语义来检索与角色相关的特征 token,将它们编码为按角色划分的槽位记忆,并存储在记忆库中。随后,仅在定位到的角色 token 处更新和注入相应的槽位。这种机制可以构建更纯净的记忆,并减少来自无关角色的干扰。

3.1 角色语义探针

为了构建可针对角色寻址的记忆,我们首先定位与每个角色相关的视觉 token。我们引入了角色语义探针(Character-Semantic Probe),它从文本到视觉的交叉注意力响应中估计目标角色的重要区域。该探针不引入额外的监督或外部检测器,生成的角色掩码仅用于指导记忆提取和注入。

对于选定的块 $x_i$,我们采样噪声 $\epsilon_i$ 并将该块前向传播至时间步 $t_s$, $$ z_i^{t_s} = q_{t_s}(x_i, \epsilon_i), \quad (2) $$ 其中 $q_{t_s}(\cdot)$ 表示由扩散调度器定义的前向加噪过程。我们将 $z_i^{t_s}$、图像条件 $I_i$ 和提示 $p_i$ 输入 Video DiT,并缓存视觉 token 与文本 token 之间的交叉注意力响应。

对于第 $i$ 个块中的每个角色 $c \in C_i$,令 $T_{ci}$ 表示提示 $p_i$ 中对应角色名称 $c$ 的文本 token 位置。令 $R_{i}^{\ell,h}(t_s) \in \mathbb{R}^{F_i \times H_p \times W_p \times |p_i|}$ 表示探针层 $\ell$ 和注意力头 $h$ 处的文本到视觉交叉注意力响应。我们定义角色语义响应为 $$ A_{ic}(t_s) = \frac{1}{|L_p| H |T_{ci}|} \sum_{\ell \in L_p} \sum_{h=1}^{H} \sum_{r \in T_{ci}} R_{i}^{\ell,h}(t_s)[\ :, \ :, \ :, r], \quad (3) $$ 因此,$A_{ic}(t_s) \in \mathbb{R}^{F_i \times H_p \times W_p}$,且 $A_{ic}(t_s; f, u, v)$ 对潜在时空块在潜在帧 $f$ 和块位置 $(u, v)$ 对角色 $c$ 的响应强度进行评分。

当同一块中出现多个角色时,语义相似的角色描述可能会产生重叠的交叉注意力响应,导致角色间的身份干扰。为了防止此类干扰,我们减去同一块中其他角色的平均响应。 $$ \hat{A}_{ic}(t_s) = \begin{cases} A_{ic}(t_s), & |C_i| = 1, \\ A_{ic}(t_s) – \frac{1}{|C_i|-1} \sum_{c' \in C_i \setminus \{c\}} A_{ic'}(t_s), & |C_i| > 1, \end{cases} \quad (4) $$ 然后,我们从归一化的差分响应中选择对角色敏感的 token。我们应用 top-p 选择,并使用局部连续性滤波器去除孤立的噪声 token。角色掩码定义为 $$ M_{ic}(t_s) = \text{Cont}_\kappa \left( \text{T}_{\text{opp}}(\hat{A}_{ic}(t_s)) \right), \quad (5) $$ 这里,$\text{T}_{\text{opp}}(\cdot)$ 保留潜在视觉 token 的 top-p 比例,而 $\text{Cont}_\kappa(\cdot)$ 使用每个潜在帧上的局部空间邻域滤波器去除孤立的选择。

生成的掩码 $M_{ic}(t_s)$ 定位了块 $i$ 中与角色 $c$ 语义最相关的 token。它为记忆提取和更新提供了特定于角色的接口,允许 SlotMem

4

第 5 页

以提取相关的内部特征,同时减少来自背景和其他视觉噪声的干扰。在记忆注入过程中,相同的掩码将检索到的记忆约束到相关 token,避免对不相关区域进行不必要的修改。

3.2 可寻址角色的记忆

给定一个目标块 $x_k$ 及其提示 $p_k$,SlotMem 从同一视频中的先前块构建可寻址角色的记忆。一个记忆块 $x_m$ 提供初始记忆,而一个更新块 $x_u$ 提供用于细化的证据。它们的提示分别记为 $p_m$、$p_u$ 和 $p_k$。

记忆提取的目标是记忆块和目标块共有的角色, $$ S_{m,k}^{ext} = C_m \cap C_k, \quad (6) $$ 其中 $C_i$ 表示提示 $p_i$ 中的角色名称。仅当更新块中也观察到相同角色时,才应用记忆更新, $$ S_{m,u,k}^{upd} = C_m \cap C_u \cap C_k. \quad (7) $$

因此,SlotMem 分两个阶段进行训练:第一阶段学习记忆提取和注入,第二阶段学习记忆更新。未出现在 $C_u$ 中的角色保持其提取的记忆不变。

3.2.1 使用 Memory Encoder 进行记忆提取

对于记忆提取,记忆块与当前去噪前向传播在同一时间步进行处理。具体而言,我们在时间步 $t_s$ 对具有提示 $p_m$ 的记忆块 $x_m$ 应用 Character-Semantic Probe,生成角色掩码 $M_{mc}(t_s)$。对于每个选定的 DiT 层 $\ell \in L_p$,我们收集特定角色的定位内部 token, $$ U_{m,\ell}^c(t_s) = h_{m\ell}(t_s)[M_{mc}(t_s)] \in \mathbb{R}^{n_{c,\ell}(t_s) \times d}. \quad (8) $$

这些 token 已经处于与目标前向传播相同的去噪阶段。我们将它们作为记忆源并输入到 Memory Encoder 中。编码器首先将定位到的 token 投影到瓶颈空间,并使用时间步嵌入对其进行调制, $$ e_{Gm,\ell}^c(t_s) = \phi_{t_s} \text{LN}(U_{m,\ell}^c(t_s)) W_{in}, \quad (9) $$ 其中 $\phi_{t_s}$ 表示标准的时间步仿射调制。随后,编码器使用 $R$ 个学习到的槽位查询(slot queries)对适配后的角色 token 进行池化, $$ P_{m,\ell}^c(t_s) = \text{softmax}\left(\frac{Q_g^{(\ell)}(e_{Gm,\ell}^c(t_s))^\top}{\sqrt{d_e}}\right) e_{Gm,\ell}^c(t_s). \quad (10) $$

FFN 将池化后的槽位投影回 DiT 特征维度,$P_{slot}$ 是一个学习到的槽位索引嵌入,用于区分不同的记忆槽位: $$ S_{m,\ell}^c(t_s) = \text{FFN}_g^{(\ell)}(P_{m,\ell}^c(t_s)) + P_{slot}. \quad (11) $$

3.2.2 使用 Memory Writer 进行记忆更新

从单个块中提取的记忆可能会遗漏对同一角色的后续观察。为了使记忆动态化,我们引入了 Memory Writer,利用来自更新块 $x_u$ 的证据来细化存储的槽位。更新是针对每个角色独立执行的,因此不同角色的记忆不会混合。

令 $s_{m,\ell,c,j}(t_s)$ 为角色 $c$ 的第 $j$ 个存储槽位,并令 $S_{u,\ell}^c(t_s)$ 表示由 Memory Encoder 从更新块 $x_u$ 中提取的新记忆。对于每个存储槽位,writer 从更新槽位中检索更新上下文, $$ c_{u,\ell,c,j}(t_s) = \text{Attn}\left(\text{LN}(s_{m,\ell,c,j}(t_s)), \text{LN}(S_{u,\ell}^c(t_s)), S_{u,\ell}^c(t_s)\right). \quad (12) $$

基于存储槽位和检索到的上下文,writer 预测一个残差修正, $$ \Delta_{\ell,c,j}(t_s) = \text{MLP}_\Delta \left[ \text{LN}(s_{m,\ell,c,j}(t_s)); \text{LN}(c_{u,\ell,c,j}(t_s)) \right]. \quad (13) $$

5

第 6 页

指标 ↑ Wan2.2-I2V +StoryDiff. +StoryMem +IAMFlow +SlotMem

VBench

背景一致性 0.8580 0.8950 0.8659 0.8929 0.8832 运动平滑度 0.9850 0.9805 0.9849 0.9908 0.9912 动态程度 0.7826 0.8696 0.9130 0.3913 0.8696 美学质量 0.5688 0.6091 0.5260 0.5628 0.5651 成像质量 0.6154 0.6620 0.5618 0.7119 0.5963 人体解剖 0.9381 0.9440 0.8892 0.9062 0.9480

ViStoryBench

风格相似度 0.7279 0.8123 0.8040 0.8649 0.8819 角色相似度 0.7701 0.8098 0.7592 0.8446 0.8603 提示词对齐 0.8299 0.7627 0.8273 0.7192 0.8733 角色匹配 0.9877 0.9879 0.9789 0.9859 0.9957 Inception Score 5.0985 6.6777 4.7509 4.8609 6.0769 美学得分 4.6121 5.3475 4.3363 4.7729 4.5278 复制粘贴(计算) 0.4789 0.4689 0.5004 0.4692 0.5631

NarraStream-Bench

主体一致性 0.8427 0.6927 0.7181 0.8524 0.8771 背景一致性 0.8135 0.8146 0.8339 0.8485 0.8444 运动平滑度 0.3442 0.3186 0.3360 0.4681 0.5166 时间闪烁 0.7523 0.6204 0.6933 0.8614 0.8181 视频时间稳定性 0.5859 0.4133 0.6272 0.7527 0.6836 边界平滑度 0.3102 0.1778 0.5231 0.4368 0.7529 条件相邻 0.3632 0.3264 0.4556 0.6131 0.6126 条件长程 0.7239 0.5880 0.6165 0.7313 0.8363 动态轨迹 0.4550 0.4935 0.5235 0.5533 0.4723 实体定位 0.6633 0.5675 0.6648 0.6029 0.6735 VLM 得分 0.4708 0.2817 0.4735 0.4607 0.5384

表 1:基线与 SlotMem 在不同基准测试上的性能比较。所有模型均使用 Wan2.2-I2V-A14B 作为骨干网络。

为了避免不可靠的更新,我们引入基于余弦相似度的门控控制,通过计算存储槽位与观察上下文之间的相似度来决定是否应用更新,并使用多层感知机(MLP)预测一个可学习的更新尺度:

$$ g_{\ell_c, j}(t_s) = \mathbb{I} \left[ h_{\cos} \left( s_{m, \ell_c, j}(t_s), c_{u, \ell_c, j}(t_s) \right) > \tau_{\text{prec}} \right] \cdot \sigma_{\text{MLP}_g} \left[ \text{LN}(s_{m, \ell_c, j}(t_s)); \text{LN}(c_{u, \ell_c, j}(t_s)) \right] \quad . \quad (14) $$

存储槽位通过门控残差校正进行更新:

$$ s_{m, \ell_c, j}^{e}(t_s) = s_{m, \ell_c, j}(t_s) + g_{\ell_c, j}(t_s) \Delta_{\ell_c, j}(t_s), \quad (15) $$

其中 $\tau_{\text{prec}}$ 是相似度阈值。没有可靠更新证据的角色保持其存储槽位不变。

3.3 基于角色级交叉注意力的记忆注入

给定时间步 $t_s$ 的记忆槽位,SlotMem 仅将身份信息注入到对应于同一角色的目标 token 中。在去噪过程中,注入位置由上一步的掩码定位。注入位置由前向传播步骤中估计的掩码给出:

$$ M_{k, \ell_c}(t_s-1) = \text{Probe}_{\ell} \left[ z_{k}^{t_s-1}, I_k, p_k, c \right] \quad . \quad (16) $$

因此,掩码滞后一步,而注入的记忆和目标特征取自当前步。

6

第 7 页

图 2:不同方法为相应片段生成的最终帧的定性比较。从左到右,每一列展示了由每个基线方法和 SlotMem 生成的同一生成片段的尾帧。红色边界框指示基线方法未能保持角色身份或产生不稳定的面部细节的区域,而绿色边界框突出了 SlotMem 在跨片段保持角色一致性方面的更强能力。

令 $\bar{S}^c_\ell(t_s) \in \mathbb{R}^{R \times d}$ 表示注入层 $\ell \in \mathcal{L}_p$ 处角色 $c$ 的当前槽位记忆。相关 token 是通过上一步的时间步掩码从步骤 $t_s$ 的隐藏状态中提取的:

$$ Q^{c,k}_{k, \ell}(t_s) = h^{k}_{\ell}(t_s) M^{c,k}_{k, \ell}(t_s-1), \quad c \in S^m_{k, \text{ext}}. \quad (17) $$

在每一层 $\ell$,SlotMem 执行角色级交叉注意力(Character-Wise Cross-Attention)。当前的角色 token 作为查询,当前的记忆槽作为键和值:

$$ \Delta Q^{c,k}_{k, \ell}(t_s) = \text{Attn}\left(Q^{c,k}_{k, \ell}(t_s)W^{\ell}_Q, \bar{S}^c_\ell(t_s)W^{\ell}_K, \bar{S}^c_\ell(t_s)W^{\ell}_V\right). \quad (18) $$

注意力后的记忆被投影回并与定位到的角色位置融合:

$$ h^{k}_{\ell}(t_s) M^{c,k}_{k, \ell}(t_s-1) = h^{k}_{\ell}(t_s) M^{c,k}_{k, \ell}(t_s-1) + \alpha_\ell(t_s) W^{\ell}_O \Delta Q^{c,k}_{k, \ell}(t_s). \quad (19) $$

这里,$\alpha_\ell(t_s)$ 是一个可学习的时间步门控,用于控制层 $\ell$ 处记忆注入的强度。这种稀疏注入使身份注入局限于相应的角色,减少了对背景和角色的干扰。

3.4 训练阶段

SlotMem 分两个阶段进行训练,以将记忆构建与记忆更新解耦。在第一阶段,每个训练样本包含一个记忆片段 $x_m$ 和一个目标片段 $x_k$。记忆片段提供特定于角色的源特征,这些特征由 Memory Encoder 编码为槽位记忆,并通过角色级交叉注意力注入到目标片段中。在此阶段,我们优化 Memory Encoder 和角色级交叉注意力,并微调 DiT 主干网络。

为了使槽位在角色间具有判别性,并与无关区域分离,我们添加了一个辅助对比损失。角色槽位来自探针选择的角色 token,而背景槽位是通过在所有角色掩码之外随机采样 token 并通过相同的 Memory Encoder 传递获得的。对于每个角色或背景类别,我们计算

7

第 8 页

将其编码槽位的平均特征作为类别原型。然后,通过将每个槽位与所有类别原型的余弦相似度进行分类。

$$ \mathcal{L}_{\text{slot}} = -\frac{1}{|J|} \sum_{j \in J} \log \frac{\exp(f_j(t_s)^\top \mu_{y_j(t_s)}(t_s) / \tau_{\text{slot}})}{\sum_{\rho} \exp(f_j(t_s)^\top \mu_{\rho}(t_s) / \tau_{\text{slot}})} \quad (20) $$

其中 $y_j$ 是槽位 $j$ 的角色/背景标签,$J$ 是编码后的角色和背景槽位集合,$\tau_{\text{slot}}$ 是温度系数。第一阶段的训练目标为

$$ \mathcal{L}_{\text{stage1}} = \mathcal{L}_{\text{diff}} + \lambda_{\text{slot}} \mathcal{L}_{\text{slot}} \quad (21) $$

这里,$\mathcal{L}_{\text{diff}}$ 表示基础视频扩散模型的标准去噪目标,在启用相应的条件输入和记忆模块时应用。

在第二阶段,我们引入一个更新块 $x_u$ 以训练动态记忆细化。Memory Encoder 和 Character-Wise Cross-Attention 模块被冻结,更新块提供了对重复出现角色的额外观测。Memory Writer 学习将存储的记忆槽位与更新槽位对齐,并预测保守的残差修正。在此阶段,我们优化 Memory Writer,并使用标准去噪目标 $\mathcal{L}_{\text{diff}}$ 进一步微调第一阶段中的模块和 DiT 骨干网络。

这种两阶段训练策略首先学习构建和注入可寻址角色的记忆,然后学习更新存储的记忆而不破坏已学习的记忆接口。完整流程如图 1 所示。

3.5 推理阶段

在推理时,SlotMem 与正常的自回归去噪过程并行运行,并不在最后一个时间步引入额外的探测前向传播。在每个 DiT 前向传播中,Character-Semantic Probe 利用中间交叉注意力响应获取角色掩码,这些掩码选择的视觉特征用于构建或更新记忆。获得的掩码指导当前块的记忆提取和更新,并作为注入掩码缓存到下一个去噪步骤。因此,记忆操作在原始生成过程中执行,无需添加额外的推理前向传播。

4 实验

4.1 实验设置
4.1.1 数据整理

我们遵循 MultiShotMaster [19] 的一般做法,整理来自在线电影评分平台的高评分公开电影和视频,后者使用分层标注策略对每组视频块进行标注。对于每组,我们首先生成一个描述主要角色和整体场景的全局描述。与 MultiShotMaster 中使用的“Subject 1”命名规则不同,我们要求标注者分配具有视觉区分度的角色名称,例如“站立的学徒”、“金发男子”或“白色汽车”。在生成每个块级提示时,明确指示标注者在相应角色出现时重用全局描述中的确切角色名称。此规则强制执行跨块的名称一致性,并使名称充当重复身份的语义锚点。

在手动过滤整理的数据后,我们从描述中构建角色映射。在训练期间,此元数据用于选择有效的记忆-目标对,其中记忆块必须位于目标块之前,并且包含至少一个也出现在目标块中的角色名称。此标准确保仅在目标块包含可以从先前上下文中检索身份的重复角色时才应用记忆注入。

4.1.2 实现细节

我们在 Wan2.2-I2V-A14B 模型 [18] 的基础上构建我们的框架。我们使用 rank-128 LoRA 微调模型,同时保持预训练骨干网络冻结。该模型在我们的整理数据上进行训练

8

第 9 页

数据集,其中每个训练样本由一个目标块(target chunk)、其图像条件、一个前置记忆块(memory chunk)和一个更新块(update chunk)组成,这些块与目标块共享至少一个角色名称。每个块包含 81 帧,对应 24 FPS 下的 3.375 秒,相邻块之间通过 5 个重叠帧构建,以保持局部时间连续性。

4.1.3 评估指标

视觉质量。我们使用 VBench [8] 来评估通用视频质量,包括背景一致性、运动平滑度、动态程度、美学质量和成像质量。由于原始 VBench 主体一致性指标在多角色视频中不可靠(其中多个身份可能异步出现和消失),我们将其替换为 VBench2 [28] 中的人体解剖学(Human Anatomy)指标,以衡量人体结构的正确性。

角色与故事一致性。我们使用 ViStoryBench [31] 和 NarraStream-Bench [12] 从互补的角度评估角色和故事的一致性。在结果表中,我们报告 $1 – \text{Copy Paste}$ 而不是 Copy Paste,以便所有显示分数均与生成质量正相关。为了保持一致的评估,我们使用 GPT-4.1 [15] 作为两个基准测试中所有基于 VLM 指标的评估器。

4.2 性能

定量结果。表 1 将 SlotMem 与基线模型在视觉质量、角色一致性和叙事连贯性方面进行了比较。Wan2.2 提供了强大的生成基线,但在与角色相关的指标上仍然有限。StoryDiffusion 在 VBench 上实现了具有竞争力的视觉质量,但在 NarraStream-Bench 上表现大幅下降。StoryMem 保留了整体视频动态,如其高动态程度(Dynamic Degree)和动态轨迹(Dynamic Trajectory)分数所示,但其主体一致性较弱。IAMFlow 提高了主体一致性和时间稳定性,但其较高的运动平滑度伴随着明显较低的 VBench 动态程度 0.3913。由于动态程度衡量视频是否包含足够大的可见运动(包括主体和相机运动),这一结果表明 IAMFlow 经常生成过于静态的视频。

相比之下,SlotMem 在 VBench 上取得了最高的人体解剖学分数(0.9480),在 ViStoryBench 上取得了最高的角色相似度(Character Similarity)分数(0.8603),在 NarraStream-Bench 上取得了最高的主体一致性(Subject Consistency)分数(0.8771)。它还获得了 VBench 运动平滑度最高分 0.9912,同时保持了具有竞争力的动态程度 0.8696。这些结果表明,SlotMem 在不抑制生成视频整体动态的情况下,提高了重复出现角色的一致性和时间稳定性。

定性结果。如图 2 所示,当角色在后续块中重新出现时,基线模型往往会丢失身份线索。红色方框突出了面部结构和头发外观的变化,以及运动下的不稳定渲染。IAMFlow 的性能受限于多角色关键帧中的身份纠缠。相比之下,SlotMem 检索角色级内部特征,并仅将其注入到局部化的角色 token 中,从而在块之间产生更稳定的身份线索,并减少由运动引起的伪影。

模型 角色相似度 提示对齐度 角色匹配 Inception

Wan2.2 0.7701 0.8299 0.9877 5.0985

SlotMem w/o M Enc. 0.7852 0.8314 0.9820 5.3210

SlotMem w/o M Upd. 0.7965 0.8439 0.9880 5.5840

SlotMem Full 0.8603 0.8733 0.9957 6.0769 表 2:SlotMem 中记忆模块的消融研究。

4.3 消融研究

我们对 Memory Encoder 和 Memory Writer 进行消融,同时保持 Character-Semantic Probe 和 Character-Wise Cross-Attention 不变。移除探针将需要密集的全上下文记忆,而移除 Character-Wise Cross-Attention 将禁用记忆注入并降低

9

第 10 页

将模型与原生 Wan2.2 基线进行对比。因此,我们评估了两个关键变体:首先,移除 Memory Encoder 并使用原始探针选择的 DiT token 作为静态记忆,这也禁用了 Memory Writer,因为没有形成槽位记忆;其次,仅移除 Memory Writer 而保留 Memory Encoder,使得模型使用来自初始观察的记忆而不进行更新。

如表 2 所示,移除任一组件均导致性能持续低于完整模型。Memory Encoder 通过将原始定位到的 token 压缩为更清晰的槽位来改善角色级记忆,而 Memory Writer 则通过用新观察更新存储的记忆,进一步加强了长距离身份保持能力。

5 结论

我们提出了 SlotMem,这是一种用于叙事长视频生成的角色可寻址内部记忆框架。SlotMem 不依赖粗粒度的帧级检索,而是用紧凑的角色级记忆来表示重复出现的角色,该记忆可以在自回归视频生成过程中进行更新,并仅注入到与角色相关的区域。在多角色叙事长视频生成实验中的结果表明,与现有基线相比,SlotMem 提高了长距离身份一致性,同时保持了相当的视频质量。

参考文献

[1] Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, and Tian Xie. Onestory: Coherent multi-shot video generation with adaptive memory, 2025. URL https://arxiv.org/abs/2512.07802.

[2] Shengqu Cai, Ceyuan Yang, Lvmin Zhang, Yuwei Guo, Junfei Xiao, Ziyan Yang, Yinghao Xu, Zhenheng Yang, Alan Yuille, Leonidas Guibas, Maneesh Agrawala, Lu Jiang, and Gordon Wetzstein. Mixture of contexts for long video generation. In ICLR, 2026.

[3] Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, and Cho-Jui Hsieh. Self-forcing++: Towards minute-scale high-quality video generation, 2025. URL https://arxiv.org/abs/2510.02283.

[4] Google DeepMind. Gemini 3 pro model card. https://deepmind.google/models/ model-cards/gemini-3-pro, May 2026. Model released in November 2025; model card updated in May 2026.

[5] Yuwei Guo, Ceyuan Yang, Ziyan Yang, Zhibei Ma, Zhijie Lin, Zhenheng Yang, Dahua Lin, and Lu Jiang. Long context tuning for video generation, 2025. URL https://arxiv.org/abs/ 2503.10589.

[6] Roberto Henschel, Levon Khachatryan, Daniil Hayrapetyan, Hayk Poghosyan, Vahram Tade- vosyan, Zhangyang Wang, Shant Navasardyan, and Humphrey Shi. Streamingt2v: Consistent, dynamic, and extendable long video generation from text. arXiv preprint arXiv:2403.14773, 2024.

[7] Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, and Eli Shechtman. Self forcing: Bridging the train-test gap in autoregressive video diffusion, 2025. URL https://arxiv. org/abs/2506.08009.

[8] Ziqi Huang, Yinan He, Jiashuo Yu, Fan Zhang, Chenyang Si, Yuming Jiang, Yuanhan Zhang, Tianxing Wu, Qingyang Jin, Nattapol Chanpaisit, Yaohui Wang, Xinyuan Chen, Limin Wang, Dahua Lin, Yu Qiao, and Ziwei Liu. VBench: Comprehensive benchmark suite for video generative models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024.

[9] Sihui Ji, Xi Chen, Shuai Yang, Xin Tao, Pengfei Wan, and Hengshuang Zhao. Memflow: Flowing adaptive memory for consistent and efficient long video narratives, 2025. URL https://arxiv.org/abs/2512.14699.

10

第 11 页

[10] Kling Team 等人。Kling-omni 技术报告,2025。URL https://arxiv.org/abs/2512. 16776。

[11] Wuyang Li, Wentao Pan, Po-Chien Luan, Yang Gao, 和 Alexandre Alahi。Stable video infinity: Infinite-length video generation with error recycling,2025。URL https://arxiv.org/abs/ 2510.09212。

[12] Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, 和 Yong Liu。Advancing narrative long video generation via training-free identity-aware memory,2026。

[13] Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, 和 Shijian Lu。Rolling forcing: Autoregressive long video diffusion in real time,2025。URL https://arxiv.org/abs/2509.25161。

[14] Yihao Meng, Hao Ouyang, Yue Yu, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Hanlin Wang, Yixuan Li, Cheng Chen, Yanhong Zeng, Yujun Shen, 和 Huamin Qu。Holocine: Holistic generation of cinematic multi-shot long video narratives,2025。URL https://arxiv.org/ abs/2510.20822。

[15] OpenAI。Introducing gpt-4.1 in the api。https://openai.com/index/gpt-4-1/,2025年4月。

[16] Haoyuan Shi, Yunxin Li, Xinyu Chen, Longyue Wang, Baotian Hu, 和 Min Zhang。Animaker: Multi-agent animated storytelling with mcts-driven clip generation,2025。URL https:// arxiv.org/abs/2506.10540。

[17] Team Seedance 等人。Seedance 2.0: Advancing video generation for world complexity,2026。

[18] Wan Team 等人。Wan: Open and advanced large-scale video generative models,2025。URL https://arxiv.org/abs/2503.20314。

[19] Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, 和 Xu Jia。Multishotmaster: A controllable multi-shot video generation framework,2025。URL https://arxiv.org/abs/2512.03041。

[20] Weijia Wu, Zeyu Zhu, 和 Mike Zheng Shou。Automated movie generation via multi-agent cot planning,2025。URL https://arxiv.org/abs/2503.07314。

[21] Zhifei Xie, Daniel Tang, Dingwei Tan, Jacques Klein, Tegawend F. Bissyand, 和 Saad Ezzini。 Dreamfactory: Pioneering multi-scene long video generation with a multi-agent framework, 2024。URL https://arxiv.org/abs/2408.11788。

[22] Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, 和 Peng Li。Sparse forcing: Native trainable sparse attention for real-time autoregressive diffusion video generation,2026。URL https://arxiv.org/abs/ 2604.21221。

[23] Jiwen Yu, Jianhong Bai, Yiran Qin, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, 和 Xihui Liu。Context as memory: Scene-consistent interactive long video generation with memory retrieval。arXiv preprint arXiv:2506.03141,2025。

[24] Yifei Yu, Xiaoshan Wu, Xinting Hu, Tao Hu, Yangtian Sun, Xiaoyang Lyu, Bo Wang, Lin Ma, Yuewen Ma, Zhongrui Wang, 和 Xiaojuan Qi。Videossm: Autoregressive long video generation with hybrid state-space memory,2025。URL https://arxiv.org/abs/2512.04519。

[25] Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, 和 Xingang Pan。Storymem: Multi-shot long video storytelling with memory,2025。URL https://arxiv.org/abs/2512.19539。

[26] Lvmin Zhang, Shengqu Cai, Muyang Li, Gordon Wetzstein, 和 Maneesh Agrawala。Frame context packing and drift prevention in next-frame-prediction video diffusion models,2025。 URL https://arxiv.org/abs/2504.12626。

11

第 12 页

[27] Lvmin Zhang, Shengqu Cai, Muyang Li, Chong Zeng, Beijia Lu, Anyi Rao, Song Han, Gordon Wetzstein, and Maneesh Agrawala. Pretraining frame preservation in autoregressive video memory compression, 2025. URL https://arxiv.org/abs/2512.23851.

[28] Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, and Ziwei Liu. VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness. arXiv preprint arXiv:2503.21755, 2025.

[29] Jinsong Zhou, Yihua Du, Xinli Xu, Luozhou Wang, Zijie Zhuang, Yehang Zhang, Shuaibo Li, Xiaojun Hu, Bolan Su, and Ying-cong Chen. Videomemory: Toward consistent video generation via memory integration, 2026. URL https://arxiv.org/abs/2601.03655.

[30] Yupeng Zhou, Daquan Zhou, Ming-Ming Cheng, Jiashi Feng, and Qibin Hou. StoryDiffusion: Consistent self-attention for long-range image and video generation. In Advances in Neural Information Processing Systems, 2024.

[31] Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, and Chi Zhang. Vistorybench: Comprehensive benchmark suite for story visualization, 2026. URL https://arxiv.org/abs/2505.24862.

12

第 13 页

A 推理阶段流程

算法 1:SlotMem 的推理 输入:分块提示词 $P = [p_1, \dots, p_K]$,初始图像条件 $I_0$,去噪时间步 $\{t_s\}_{s=1}^S$,用于探测、记忆提取和注入的选定层集合 $L_p$,层组映射 $g(\ell_p)$(其中 $\ell_p \in L_p$),组特定的记忆编码器 $\{E_g\}$,记忆写入器 Writer 输出:生成的分块 $X = [x_1, \dots, x_K]$ 1: 初始化角色级槽位记忆库 $B \leftarrow \emptyset$ 且图像条件 $I_1 \leftarrow I_0$ 2: for $k = 1$ to $K$ do 3: 从提示词 $p_k$ 中提取角色集合 $C_k$,并从 $B$ 中检索对应的层-wise 槽位 $R_k$ 4: 采样初始噪声潜在变量 $z_k^{t_1}$ 5: 初始化缓存的角色掩码 $\bar{P}_k \leftarrow \emptyset$ 和在线槽位缓冲区 $U_k \leftarrow \emptyset$ 6: for $s = 1$ to $S$ do 7: $(z_k^{t_{s+1}}, P_k^s, V_k^s) \leftarrow \text{MEMORYAWAREDITFORWARD}(z_k^{t_s}, I_k, p_k, R_k, \bar{P}_k, L_p, g, \{E_g\})$ 8: 缓存当前掩码以供下一步使用:$\bar{P}_k \leftarrow P_k^s$ 9: 累积当前在线槽位:$U_k \leftarrow U_k \cup V_k^s$ 10: end for 11: 解码 $z_k^{t_{S+1}}$ 以获得 $x_k$ 12: 根据公式 (13)–(15),使用记忆写入器将新槽位插入 $B$ 或使用 $U_k$ 更新现有槽位 13: 使用 $x_k$ 的最后一帧更新 $I_{k+1}$ 14: end for 15: return $X$

16: procedure MEMORYAWAREDITFORWARD( $z_k^{t_s}, I_k, p_k, R_k, \bar{P}_k, L_p, g, \{E_g\}$) 17: 在条件 $(I_k, p_k)$ 下对 $z_k^{t_s}$ 运行一次 DiT 去噪前向传播,并缓存层 $\ell_p \in L_p$ 处的交叉注意力响应和隐藏状态 18: if $R_k \neq \emptyset$ and $\bar{P}_k \neq \emptyset$ then 19: 在前向传播期间,根据公式 (16)–(19) 使用角色级交叉注意力在层 $\ell_p \in L_p$ 处注入检索到的槽位 20: end if 21: 预测去噪更新并获得 $z_k^{t_{s+1}}$ 22: 根据公式 (3)–(5) 使用角色语义探针计算当前角色掩码 $P_k^s$ 23: 提取层 $\ell_p \in L_p$ 处的角色 token,并根据公式 (8)–(11) 使用记忆编码器 $E_g(\ell_p)$ 对在线槽位 $V_k^s$ 进行编码 24: return $(z_k^{t_{s+1}}, P_k^s, V_k^s)$ 25: end procedure

B 其他实验设置

基线方法。我们将我们的方法与自回归视频生成设置下的基础模型 Wan2.2-I2V 以及在该基础模型上实现的三个代表性基线方法进行比较。StoryDiffusion [30] 是一个经典基线,它首先生成一致的多图像参考,然后将它们用作不同分块的初始帧条件;在我们的实现中,我们使用 Wan2.2-I2V 作为其分块生成的视频扩散骨干网络。StoryMem [25] 是一种先进的基于记忆的方法,它根据美学分数及其与现有记忆库的多样性来检索记忆帧;我们直接遵循其原始的基于 Wan2.2 的设置。IAMFlow [12] 是一种无需训练的、身份感知的记忆框架,它使用 VLM 智能体来维护持久化的实体 ID 并在提示词之间检索与身份相关的记忆帧。由于其发布的实现基于 Wan2.1-T2V,我们将其适配到 Wan2.2-I2V,同时保持其

13

第 14 页

组 组 组

TransNet v2 + 光流

精选视频 片段 片段 片段 Gemini 全局描述

年轻男子:一位留着干净胡须、深色头发梳理整齐的白人, 身穿条纹灰色囚服;老年男子:… 基于: 1. {全局描述} 2. {当前片段} Gemini 片段描述

年轻男子继续对老年男子说话, 将视线降低至游戏上,然后 带着沉思的神情再次抬头… 精选 人工筛选的描述与片段 视频组

图 3:数据策展流水线,改编自 MultiShotMaster。由于我们的任务不是主体到视频的生成,因此移除了主体合并组件。

记忆默认超参数保持不变,例如为每个角色维护的记忆帧数。

数据策展 我们使用改编自 MultiShotMaster [19] 的多阶段策展流水线构建训练数据集,如图 3 所示。源视频首先被归一化为 24 FPS,随后应用 TransNetV2 和光流来检测镜头边界。每个保留的组被划分为 81 帧的片段。Gemini 3.0 [4] 首先从每个镜头组中均匀采样的帧生成全局描述,为主要角色定义一致的标识符,并总结场景和视觉风格。基于此全局描述,模型随后为每个片段生成描述,涵盖角色动作和表情、场景背景以及摄像机运动。最后,从描述中提取角色提及,以构建片段级角色列表和跨片段关联,这些关联用于识别有效的训练样本并建立相应的核心-记忆关系。

数据集可用性与版权。我们的训练和评估数据源自公开可用的电影和在线视频。然而,公开可用性并不意味着拥有重新分发权。由于底层视频内容受版权保护,且作者不拥有重新分发处理后剪辑所需的权利,因此我们无法在研究使用许可下发布视频数据。

数据集详情 基于策展后的样本,我们根据角色构成和重现模式对数据集进行分类。具体而言,样本被分为单角色样本和多角色样本;在多角色子集中,我们进一步区分具有角色重现的样本和不具有角色重现的样本。此处,角色重现是指角色出现在较早的片段中,在一个或多个后续片段中消失,然后在较晚的片段中再次出现的情况。角色构成和数据集统计信息总结于图 4 中。

对于评估,我们从额外的视频源中随机选择 60 个样本,同时匹配训练数据集的角色构成比例。因此,测试集在单角色样本、无角色重现的多角色样本以及有角色重现的多角色样本上遵循相同的分布,同时使用与训练集不相交的视频源。

额外训练细节 我们在 NVIDIA A100 GPU 上使用 DDP 对一个 epoch 进行训练,耗时 480 GPU 小时。学习率设置为 1 × 10−4,噪声域边界比率

14

第 15 页

多角色 21% 单角色 Animation27% 角色重现 Others33% 26% 无角色重现

15,350 样本数 数据集统计 Comedy5% Drama22% 74% Romance14% 样本数量 15,350 片段数量 42,320 53% 时长 39.71 小时

2 个片段 3-5 个片段 6-10 个片段 >10 个片段

图 4:数据集统计。我们报告了测试样本的类别和片段数量分布(左图)、训练数据集的角色构成(中图),以及其图例和基本统计信息(右图)。

在 WAN2.2 中设置为 0.9。对于记忆模块,我们使用 DiT 层 0–15 进行角色 token 提取和稀疏记忆注入。这些层被分为三组:0–4、5–10 和 11–15,每组配备独立的 Memory Encoder 和 Memory Writer。稀疏角色记忆使用 8 个头,头维度为 128,RoPE 维度为 256。记忆 top-p 比率设置为 0.1,$\lambda_{slot}$ 设置为 0.02。

输入潜在变量 输出潜在变量 角色 聚合 Probe

[woman] is seen from behind while approaching a large DiT Block (L = 1) DiT Block (L = N) 连续性 Top-p illuminated metal door. Self Attention Self Attention 度量

Cross-Attention Cross-Attention png png

[woman] MLP MLP 记忆库 Char = [woman] t = n idx =

图 5:Character-Semantic Probe。给定一个输入潜在变量,Probe 聚合对每个角色名称的交叉注意力响应,计算角色语义响应,选择 top-p 个对角色敏感的 token,并过滤孤立的噪声 token,以用于记忆构建和稀疏注入。

C 像素空间中 Character-Semantic Probe 区域的可视化

尽管如图 5 所示,Character-Semantic Probe 在潜在空间中定位了对角色敏感的位置,但其有效性也可以直接在像素空间中进行检验。这是因为 VAE 不同于语义编码器,它在像素空间区域和潜在空间 token 之间保留了相对直接的空间对应关系。为了可视化,我们在推理过程中将选定的潜在 token 映射回原始像素空间,并显示每个对应的 8 帧 patch 的第一帧。

如图 6 所示,Character-Semantic Probe 在单角色和多角色场景中都定位了与角色相关的区域,并且成功区分了顶行两个示例中的不同角色。然而,当自动字幕生成管道未能捕捉到给定片段中角色的独特属性时,由此产生的提示歧义可能导致混合的 Probe 区域,正如最后一个示例中吉他手的情况所示。这种混淆随后可能会影响记忆提取和注入的质量。

15

第 16 页

秃顶男子首先站在户外的石头庭院中,低头看着,而年轻男孩们聚集在他身后。后来,他出现在一个光线昏暗的室内走廊里,从一扇玻璃门的门口直视镜头。在这些场景中,相机始终保持静止。

年轻囚犯在光线昏暗的牢房内抬头张嘴,显得痛苦且满头大汗。一名身材高大的囚犯站在牢房栏杆外的背景中,神情严肃地观察着。相机采用中景镜头,聚焦于面对镜头的年轻囚犯,捕捉到了牢房区域的粗犷氛围。

歌手在一个亲密的室内环境中,神情严肃地凝视着镜头外的人。场景切换到一个光线昏暗的卡拉OK酒吧,歌手站在舞台上,对着麦克风唱歌。吉他手在他身后弹奏电吉他。

图 6:像素空间中角色语义探针区域的可视化。我们将角色语义探针选择的潜在 token 重新映射到原始像素空间,并可视化每个相应 8 帧补丁的第一帧。为了可视化,提示中的彩色角色 token 与上方显示的相同颜色的记忆补丁相匹配。

| Metric | VLM | Wan2.2 | StoryDiffusion | StoryMem | IAMFlow | SlotMem | | :— | :— | :— | :— | :— | :— | :— | | ViStoryBench | | | | | | | | Prompt Alignment | Qwen3.5-4B | 0.9255 | 0.9035 | 0.9172 | 0.8793 | 0.9326 | | | Qwen3-VL-30B | 0.8302 | 0.8264 | 0.8288 | 0.7944 | 0.8542 | | | GPT-4.1 | 0.8299 | 0.7627 | 0.8273 | 0.7192 | 0.8733 | | NarraStream-Bench | | | | | | | | Conditional Adjacent | Qwen3.5-4B | 0.3785 | 0.3322 | 0.4525 | 0.6176 | 0.6159 | | | Qwen3-VL-30B | 0.3632 | 0.3245 | 0.4693 | 0.6376 | 0.6126 | | | GPT-4.1 | 0.3632 | 0.3264 | 0.4556 | 0.6131 | 0.6126 | | Conditional Long-range | Qwen3.5-4B | 0.7200 | 0.5800 | 0.6147 | 0.7172 | 0.8416 | | | Qwen3-VL-30B | 0.7200 | 0.5774 | 0.6158 | 0.7289 | 0.8416 | | | GPT-4.1 | 0.7239 | 0.5880 | 0.6165 | 0.7313 | 0.8363 | | Entity Grounding | Qwen3.5-4B | 0.8799 | 0.9059 | 0.9104 | 0.9027 | 0.9206 | | | Qwen3-VL-30B | 0.7993 | 0.7711 | 0.7792 | 0.7605 | 0.7504 | | | GPT-4.1 | 0.6633 | 0.5675 | 0.6648 | 0.6029 | 0.6735 | | VLM Score | Qwen3.5-4B | 0.9367 | 0.9272 | 0.7118 | 0.9174 | 0.9614 | | | Qwen3-VL-30B | 0.8198 | 0.6253 | 0.8318 | 0.7201 | 0.8291 | | | GPT-4.1 | 0.4708 | 0.2817 | 0.4735 | 0.4607 | 0.5384 |

表 3:不同 VLM 评判者下的 VLM 敏感指标。Prompt Alignment 来自 ViStoryBench,而 Conditional Adjacent、Conditional Long-range、Entity Grounding 和 VLM Score 来自 NarraStream-Bench。SlotMem 在不同 VLM 评判者的几乎所有 VLM 指标上均取得了最佳性能。

16

第 17 页

Wan22-I2V 86.1 41.1 55.0 45.0 42.2 100.0 win+StoryDiffusion 95.6 68.3 21.1 26.1 62.2 50.0 50.0 tie +StoryMem 51.1 41.7 25.0 37.2 37.8 55.0 39.4 62.8 25.0 lose

+IAMFlow 21.1 66.1 36.7 45.0 18.3 62.2 36.1 62.8 37.2 Subject Consistency Prompt Alignment Aesthetic Quality Physical Naturalness

Figure 7: Human Preference Study.

Figure 8: The interface of the Human Preference Study. D Human Preference Study

尽管标准基准测试提供了全面的自动评估,但其指标无法完全反映身份保持和自然跨镜头过渡等感知因素。因此,我们在测试样本上额外进行了人类偏好研究。对于每次比较,评估者会看到提示词和两个匿名生成的视频,一个来自 SlotMem,另一个来自基线方法,A/B 顺序经过随机打乱以减少位置偏差。评估者随后从四个维度选择 SlotMem 是优于(win)、劣于(lose)还是持平(tie)于基线方法:主体一致性(subject consistency)、提示词对齐(prompt alignment)、美学质量(aesthetic quality)和物理自然性(physical naturalness)。评估界面如图 8 所示。我们将结果汇总为 SlotMem 相对于每个基线方法的胜/平/负百分比。如图 7 所示,SlotMem 在大多数评估维度中获得了比竞争方法更高的用户偏好,特别是在主体一致性和物理自然性方面具有明显优势,这两者与角色身份保持和真实的角色动态密切相关。

E Limitations

尽管取得了这些令人鼓舞的结果,我们当前的框架仍存在若干局限性。

训练规模。由于训练规模有限,我们的模型尚未在更大、更多样化的训练策略下进行充分评估。尽管当前结果证明了我们框架的有效性,但我们预计扩大训练数据、增加风格多样性并纳入更广泛领域的视频将进一步增强其鲁棒性和泛化能力。更重要的是,这种扩展将在更真实和大规模的多镜头视频生成设置下,为我们的方法提供更强有力的验证。

17

第 18 页

表 4:在标准超参数下,基线方法与 SlotMem(使用完整记忆和条件缓冲区)的效率对比

| 方法 | GPU 显存 (GB) | 延迟 (s) | FPS | PFLOPs | | :— | :— | :— | :— | :— | | 骨干网络 | | | | | | Wan2.2 i2v | 32.89 | 993.26 | 0.0816 | 78.59 | | 免训练基线 | | | | | | StoryDiffusion | 32.89 | 1000.53 | 0.0810 | 78.86 | | IAMFlow | 32.92 | 972.73 | 0.0833 | 78.59 | | 微调方法 | | | | | | StoryMem | 78.43 | 2042.09 | 0.0392 | 99.48 | | SlotMem | 37.24 | 1786.62 | 0.0453 | 84.92 |

对 Character-Semantic Anchors 的依赖性。我们的框架依赖于块级提示中可靠的 Character-Semantic Anchors。这对自动标注流水线提出了相对严格的要求:重复出现的角色名称应保持一致,错误或不明确的角色标注可能会影响记忆构建和记忆注入,正如最后一个样本中的 [guitarist] 所示。当同一帧中出现多个视觉上相似的身份时,这一问题变得更加具有挑战性,此时简单的文本角色名称可能不足以让探针为每个角色提取完全独立的特征记忆。一个有前景的未来方向是利用具有更细粒度角色描述的标注数据,并通过用更丰富的属性级角色锚点替换简单的角色名称锚点来扩展我们的整体流水线。这种细粒度的锚点可以为记忆定位和注入提供更精确的指导,从而改善具有挑战性的多角色场景中的身份消歧。

18

第 19 页

全局字幕 片段字幕

系统提示 系统提示 你是一个多镜头视频理解专家,仅输出视频字幕。 你是一个视频理解专家,仅根据输入的故事和视频输出视频字幕。 任务概述 输入 分析多镜头视频并生成组级字幕。字幕应 组级全局字幕:{global_caption} 识别主要主体,用视觉上具有辨识度的身份特征 当前视频片段的采样帧。 描述每个主体,并总结整体场景和视觉风格。 任务概述 指令 生成单一段落的片段级字幕。字幕应描述 1.将人、车辆、动物、机动车辆、食物和其他独立对象 主体在组级全局字幕描述条件下的表情和动作、场景背景以及摄像机运动。 视为潜在主体。 字幕不应超过80个单词。 2.根据它们在视频中的重要性,描述不超过四个主要主体。 指令 3.省略仅短暂出现、太小、太远或与故事情节无关的主体。 1.识别全局字幕中哪些主体出现在当前视频片段中。 4.在多个镜头中仅描述一次同一主体。 2.使用全局字幕中定义的精确名称来指代这些主体。 5.不要使用“主体1”或“主体2”等通用名称。 3.不要为全局字幕中已存在的主要主体发明新名称。 6.为每个主体分配一个视觉上具有区分度的名称,最好是名词或 4.不要重新描述主体的外观,因为它已经在全局字幕中描述过。 形容词+名词短语,例如“站立的学徒”、“金发男子”或“白色汽车”。 5.关注表情、动作、场景背景、摄像机位置和摄像机运动。 7.如果出现多个相似主体,请包含一个区分性的状态或视觉特征, 6.首先描述面向摄像机的主体,然后描述其他主体。 例如“站立的学徒”而不是“学徒”。 7.省略仅短暂出现、与故事情节无关、太远、太小或太模糊的主体。 8.即使身份可识别,也不要使用真实姓名或角色名称。 8.不要重复全局字幕的内容。 9.每个主体描述不超过20个单词,风格描述不超过20个单词。 9.局部字幕可能包含全局字幕中未列出的其他非主要角色。 10.如果场景包含太多物体且难以确定主要主体,请描述整个 此时,分配描述性名称,如“坐着的學生”、“行走的小贩”或“骑自行车的人”, 场景,而不是列举各个主体。 并明确指出它们与主要主体不同。

预期输出 预期输出 “金发男子:一位留着金发的年轻男子,身穿浅色衬衫外搭深色夹克; “站立的学徒提着一个大塑料袋穿过茂密的森林; 黄狗:一只大嘴的黄狗;白色汽车:一辆崭新的白色汽车, 学徒紧随其后,手持小手电筒;棕色的狗跑过路径。森林中 配有明亮的前灯和优雅的曲线。整个场景发生在停车场。 长满了高大细长的树木和落叶地毯。摄像机以中景镜头从 视觉风格是现代电视制作,具有清晰的图像和自然主义表现。” 后方跟随他们,将站立的学徒置于画面中心。摄像机运动平稳流畅。”

图9:用于定制数据分层字幕标注的提示。全局字幕提示(左)用于在整个视频中构建一致的故事级描述,而片段字幕提示(右)用于为各个片段生成字幕。规则和预期输出是根据角色语义探针的需求重新设计的。

{ "global_prompt": "一个秃顶男子和几个小男孩穿过石头庭院和昏暗的走廊,气氛肃穆。", "chunks": [ { "character_list": ["秃顶男子", "小男孩们"], "content": "秃顶男子首先站在户外的石头庭院里,低头看着,而小男孩们聚集在他身后。后来,秃顶男子出现在昏暗的室内走廊里,从一扇玻璃门的门口直视摄像机。在这些场景中,摄像机保持静止。" }, { "character_list": ["秃顶男子"], "content": "秃顶男子站在门口,带着严肃的表情看向摄像机,并扶着门。然后他转过身,关上门。场景是一个昏暗的室内走廊,墙壁有纹理,采用双色粉刷方案。摄像机保持静止,以中景镜头观察秃顶男子的动作。" }, { "character_list": ["秃顶男子"], "content": "秃顶男子站在昏暗的室内走廊里,起初身体略微向右转,手靠近一扇玻璃门,然后转身直视摄像机,表情严肃。摄像机保持静止的中景镜头,捕捉他站在门前的画面,门允许一些光线透进来。" } ] }

图10:故事字幕示例。

19

发表评论