Vera:解决S2V身份漂移与多主体混淆的百万级对齐方案

三分钟导读:核心创新之一是Identity-Focal Masked Supervision。IFMS通过区域感知的训练目标,重新加权损失函数,显著强化对身份关键区域(如面部)的监督信号,同时抑制背景等无关区域的伪影干扰。这使得模型在生成过程中能更专注于保持面部特征的稳定性,而非均匀处理所有像素。

英文题目:Vera: Identity-Faithful Human Subject-to-Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.20247

原始论文:PDF / 论文页面

对应视频标题:Vera:解决S2V身份漂移与多主体混淆的百万级对齐方案|推荐指数:★★★★★

这篇论文解决什么问题?

在Subject-to-Video生成中,维持细粒度面部身份一致是核心难点。现有扩散模型虽提升了照片级真实感,但在姿态变化或遮挡下,常出现身份漂移。更严重的是,在多主体场景中,模型易发生身份-角色绑定错误,导致人物混淆或属性互换,限制了其在影视制作等场景的落地。

核心创新

方法概览

核心创新之一是Identity-Focal Masked Supervision。IFMS通过区域感知的训练目标,重新加权损失函数,显著强化对身份关键区域(如面部)的监督信号,同时抑制背景等无关区域的伪影干扰。这使得模型在生成过程中能更专注于保持面部特征的稳定性,而非均匀处理所有像素。

逐图理解论文

数据:百万级身份对齐数据集

数据:百万级身份对齐数据集
Figure 1: Data processing pipeline for identity-consistent video generation. The process includes video clipping, frame sampling, face detection and embedding extraction, intra-clip identity clustering, and diverse reference selection to build identity-aligned reference sets for single- and multi-person human S2V generation.

Vera首先解决数据瓶颈,构建了百万级身份对齐的人像图像-视频数据集。通过Person-level Cross-clip Retrieval,模型从海量视频中检索具有明确身份对应关系的片段。这种基于面部嵌入聚类的方法,避免了传统数据集中的捷径学习,为单人和多人场景提供了高质量的训练基础。

方法:IFMS身份焦点掩码监督

方法:IFMS身份焦点掩码监督
Figure 2: Overview of the Vera framework. Text prompts, reference image sets, and input videos are encoded into token sequences and processed by DiT Transformer blocks. Vera is built on a million- pair identity-aligned human image-video dataset and introduces two complementary designs: IFMS strengthens identity-aware spatial supervision, while RALA stabilizes reference-video interaction and enhances layer-aware identity readout. These designs enable identity-faithful and temporally coherent human S2V generation in both single- and multi-person scenarios.

核心创新之一是Identity-Focal Masked Supervision。IFMS通过区域感知的训练目标,重新加权损失函数,显著强化对身份关键区域(如面部)的监督信号,同时抑制背景等无关区域的伪影干扰。这使得模型在生成过程中能更专注于保持面部特征的稳定性,而非均匀处理所有像素。

实验:定量性能对比

实验:定量性能对比
Table 1: Quantitative comparison on the subject-to-video generation task. We report identity consis- tency, motion quality, naturalness, and prompt-following metrics. “↑” indicates higher is better.

在包含100个身份的S2V基准测试中,Vera表现出显著优势。FaceSim-Arc得分达到0.571,FaceSim-Cur为0.529,均大幅领先于VACE、Phantom和BindWeave等基线。NaturalScore为3.90,X-CLIP为0.340,证明其在保持身份一致性的同时,并未牺牲画面的自然度和提示词遵循能力。

实验:单人与多人生成效果

实验:单人与多人生成效果
Figure 3: Qualitative comparison on single-person subject-to-video generation. Our method better balances identity consistency, appearance fidelity, and motion naturalness in conversational scenes.

定性结果显示,Vera在单人对话场景中能平衡身份一致性与运动自然性。在多主体场景中,模型能准确区分不同人物的身份,保持正确的空间布局与交互逻辑。相比基线方法,Vera有效减少了角色混淆和属性互换现象,展现了复杂场景下的鲁棒性。

消融:模块有效性验证

消融:模块有效性验证
Table 2: Ablation study of IFMS and RALA. The full model achieves the best identity consistency, validating the contribution of each proposed component.

消融实验证实了IFMS和RALA的必要性。移除IFMS会导致面部一致性下降,而移除RALA则使身份细节模糊。Table 2显示,完整模型在身份一致性指标上达到最优,验证了区域监督与分层注意力机制的互补作用,二者共同提升了生成视频的身份保真度。

实验与关键结果

  • 在包含100个身份的S2V基准测试中,Vera表现出显著优势。FaceSim-Arc得分达到0.571,FaceSim-Cur为0.529,均大幅领先于VACE、Phantom和BindWeave等基线。NaturalScore为3.90,X-CLIP为0.340,证明其在保持身份一致性的同时,并未牺牲画面的自然度和提示词遵循能力。
  • 定性结果显示,Vera在单人对话场景中能平衡身份一致性与运动自然性。在多主体场景中,模型能准确区分不同人物的身份,保持正确的空间布局与交互逻辑。相比基线方法,Vera有效减少了角色混淆和属性互换现象,展现了复杂场景下的鲁棒性。
  • 消融实验证实了IFMS和RALA的必要性。移除IFMS会导致面部一致性下降,而移除RALA则使身份细节模糊。Table 2显示,完整模型在身份一致性指标上达到最优,验证了区域监督与分层注意力机制的互补作用,二者共同提升了生成视频的身份保真度。
  • 在包含100个身份的S2V基准测试中,Vera表现出显著优势。FaceSim-Arc得分达到0.571,FaceSim-Cur为0.529,均大幅领先于VACE、Phantom和BindWeave等基线。NaturalScore为3.90,X-CLIP为0.340,证明其在保持身份一致性的同时,并未牺牲画面的自然度和提示词遵循能力。
  • 定性结果显示,Vera在单人对话场景中能平衡身份一致性与运动自然性。在多主体场景中,模型能准确区分不同人物的身份,保持正确的空间布局与交互逻辑。相比基线方法,Vera有效减少了角色混淆和属性互换现象,展现了复杂场景下的鲁棒性。
  • 消融实验证实了IFMS和RALA的必要性。移除IFMS会导致面部一致性下降,而移除RALA则使身份细节模糊。Table 2显示,完整模型在身份一致性指标上达到最优,验证了区域监督与分层注意力机制的互补作用,二者共同提升了生成视频的身份保真度。

阅读时需要注意

  • 另一关键模块是Reference-Aware Layer-wise Attention。RALA包含两部分:浅层的Reference-Anchor Preserving Mask保护参考Token不被噪声淹没;中层的Layer-Selective Identity Residual Reinforcement增强身份信息的读出。这种分层策略在DiT骨干网络中稳定了参考视频与生成视频之间的交互,防止身份特征在深层网络中丢失。
  • 需注意,IFMS的面部权重设置敏感:过高的wface值(如2.5)会损害运动平滑性和自然度。同样,RALA中过强的身份残差强化(wmid=2.0)会降低运动灵活性。此外,在拥挤场景或身份视觉相似时,仍可能出现主体混淆,长视频生成的身份一致性仍是开放问题。
  • Over-emphasizing facial regions in IFMS (e.g., wface=2.5) degrades motion smoothness and naturalness.
  • Overly strong reference residual reinforcement in RALA (e.g., wmid=2.0) reduces motion flexibility and semantic alignment.
  • Crowded scenes or visually similar identities may still lead to subject confusion.

关联工作

  • 在Subject-to-Video生成中,维持细粒度面部身份一致是核心难点。现有扩散模型虽提升了照片级真实感,但在姿态变化或遮挡下,常出现身份漂移。更严重的是,在多主体场景中,模型易发生身份-角色绑定错误,导致人物混淆或属性互换,限制了其在影视制作等场景的落地。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

Vera:身份忠实的人体主体到视频生成

Yulong Xu1∗, Xinyue Liu1,2*, Shujuan Li1,3, Huafeng Shi1, Yan Zhou1, Jiwen Liu1, Xintao Wang1, Pengfei Wan1, Yu-Shen Liu1, Huaibo Huang2† 1快手科技 2中国科学院自动化研究所 3清华大学 xuyulong03@kuaishou.com liuxinyue2025@ia.ac.cn

摘要

主体到视频(Subject-to-Video, S2V)生成在跨不同类别保留参考主体方面取得了显著进展,然而通用的主体一致性对于以人为中心的生成任务仍显不足。视频可能在整体上一致,但关键的身份细节在帧之间、姿态变化及交互过程中仍会发生漂移。在多场景下,这一问题变得更加严重,错误的身份-角色绑定会导致主体混淆、属性交换以及对参考特定外观线索的过度复制。我们提出了 Vera,这是一个统一的人体中心 S2V 框架,适用于单人和多人生成。我们首先构建了一个百万级配对的人体身份对齐图像-视频对应数据集,通过检索提供显式的人体身份和多样化参考。基于该数据集,Vera 引入了两种互补的设计。身份聚焦掩码监督(Identity-Focal Masked Supervision, IFMS)通过空间聚焦的监督来加强身份感知学习,同时减少来自无关伪影的干扰。参考感知层注意力(Reference-Aware Layer-wise Attention, RALA)调节视频 token 在 DiT 骨干网络中与参考身份线索的交互方式,保留稳定的身份锚点并增强层感知的身份读取。大量实验表明,Vera 提高了人体身份一致性、多人主体绑定以及运动自然度,同时减少了身份混淆和对参考图像的过度复制。

1 引言

在以人为中心的视频生成中,面部身份是视觉连续性的锚点。一个人可能会移动、转身、与他人互动,或在不同的视角下出现,但观众在整个视频中仍应能识别出同一个人。这一要求对于个性化叙事、数字人创建、广告以及角色驱动的内容生成至关重要。然而,在生成式视频模型中重现这种身份持久性仍然具有挑战性。尽管最近的基于扩散模型和 Diffusion Transformer (DiT) 的视频模型在照片级真实感和时间连贯性方面取得了显著进展 Peebles and Xie [2023], Yang et al. [2024], Polyak et al. [2024],但它们通常在动态条件下难以保持人体身份。随着头部姿态、面部角度、遮挡和场景上下文的变化,生成的面部可能会逐渐偏离参考身份;在多人场景中,不同身份甚至可能相互纠缠。

主体到视频(Subject-to-Video, S2V)生成通过将模型条件化于参考图像和文本提示,为人本可控视频合成提供了一种自然的表述 Jiang et al. [2024], Liu et al. [2025], Jiang et al. [2025], Yuan et al. [2025a]。现有的 S2V 和视频个性化方法在保留通用主体(包括人类、动物、物体、服装和场景)方面展示了令人鼓舞的结果 Chen et al. [2025], Liang et al. [2025], Huang et al. [2025]。

∗同等贡献。 †通讯作者。

第 2 页

然而,以人为中心的主体到视频生成(Subject-to-Video, S2V)不仅需要通用的主体保持。保持一个人不仅仅是保留服装、发型或体型等粗略外观线索;它要求每个人的面部身份在帧、姿态、交互和视角之间保持稳定。在涵盖单人和多人生成的统一设置中,这种区别变得尤为重要,因为模型必须正确地将每个参考身份绑定到其对应的文本角色和生成轨迹。

当前的方法存在两个主要局限性。首先,它们通常优化的是主体级别的外观一致性,而非细粒度的面部身份一致性。生成的视频可能在整体上与参考主体保持一致,但决定身份的小面部区域仍会随时间退化或发生变化。身份保持视频方法通过引入专用的身份编码器或控制机制 He et al. [2024], Yuan et al. [2025b], Xue et al. [2025] 来改善面部一致性,但它们通常是在单身份假设下设计的,即一个参考身份对应一个生成的主体。相比之下,多人 S2V 不仅需要身份保持,还需要身份-角色-轨迹绑定:多个参考身份必须正确关联到多个文本角色和生成轨迹。更强的参考条件并不一定能解决这一问题。将参考图像简单地注入视频主干网络会导致模型将参考视图视为静态模板,从而导致姿态锁定、视角坍塌以及对参考特定姿态和外观线索的过度保持 Liu et al. [2025], Guo et al. [2026]。在多人场景中,这种简单的融合进一步引入了身份-角色错误绑定、主体混淆和属性交换 Huang et al. [2025]。

其次,缺乏具有显式身份对应关系的大规模以人为中心的 S2V 训练数据。最近的数据集和基准测试推动了 S2V 的大规模生成 Yuan et al. [2026],而以人为中心的数据集则探索了在多种视角和运动下的身份保持 Guo et al. [2026]。然而,通用的图像-视频对不足以学习稳定的面部身份,而从同一片段中采样的片内参考可能会鼓励捷径学习和复制粘贴。对于多人视频,数据构建问题变得更加困难:数据集必须区分片段内的不同身份,将每个身份匹配到适当的参考图像,并保持面部姿态和外观的多样性。如果没有这种身份感知的监督,模型很难在自然运动、遮挡和交互下学习鲁棒的人级别对应关系。

为了解决上述挑战,我们提出了 Vera,这是一个统一的以人为中心的 S2V 框架,用于身份忠实的人单人和多人生成。Vera 构建在一个通过人级别跨片段检索构建的百万对身份对齐的人图像-视频数据集之上。我们没有使用目标片段中的参考帧,而是从其他片段中检索身份匹配的参考,在保持面部身份的同时引入姿态、表情、光照、背景和运动的差异。这种跨片段设计鼓励超越直接帧重建的身份对应关系学习,减少了捷径学习、背景泄漏和参考诱导的特定帧参考线索的过度复制。它还为人脸身份保持和多人主体绑定提供了显式的人级别监督。

利用该数据集,Vera 引入了两种简单但有效的设计,专门针对身份保持。首先,身份聚焦掩码监督(Identity-Focal Masked Supervision, IFMS)使用区域感知掩码重新加权训练目标,强调身份关键的面部区域,同时抑制无关的字幕伪影。这在无需更改推理管道的情况下加强了细粒度的身份监督。其次,参考感知层注意力(Reference-Aware Layer-wise Attention, RALA)调节 DiT 主干网络中的参考-视频交互。它在早期层中将参考令牌保持为稳定的身份锚点,并在身份敏感层中选择性地增强视频到参考的身份读取,从而在保持灵活跨模态融合的同时改善细粒度的身份保持。

总之,我们的贡献如下:

  • 我们通过人级别跨片段检索构建了一个百万对身份对齐的人图像-视频数据集,为面部身份保持和多人主体绑定提供了显式的身份对应关系。
  • 我们提出了 Vera,结合了身份聚焦掩码监督(IFMS)和参考感知层注意力(RALA),以加强身份感知学习并稳定参考-视频交互。

2

第 3 页

• 与代表性的主体到视频(S2V)基线方法的广泛比较证明了 Vera 在保持面部身份、维持多场景中的主体-角色对应关系以及减少对参考图像的过度依赖方面的有效性。

2 相关工作

2.1 视频生成模型

扩散模型推动了高保真视频生成的快速发展。早期方法通过引入时序建模来扩展图像扩散模型,例如 Make-A-Video Singer 等人 [2022]、Stable Video Diffusion Blattmann 等人 [2023] 和 AnimateDiff Guo 等人 [2023]。最近,基于可扩展 Transformer 的架构(包括 DiT Peebles 和 Xie [2023])以及整流流(rectified-flow)公式化方法,使得诸如 CogVideoX Yang 等人 [2024]、HunyuanVideo Kong 等人 [2024]、Wan Wan 等人 [2025]、Open-Sora Zheng 等人 [2024] 和 Movie Gen Polyak 等人 [2024] 等大型视频基础模型成为可能。这些模型显著提高了视觉质量、文本-视频对齐度和运动连贯性,并已成为可控视频合成的强大骨干网络。

然而,现有的视频基础模型主要针对通用生成进行优化,而非对身份敏感的人类生成。虽然它们能够合成逼真的场景和连贯的运动,但在姿态变化、面部表情、遮挡以及多人交互的情况下,仍然难以保持特定人物的身份特征。Vera 通过引入针对面部身份保持量身定制的以人为中心的监督信号和参考条件,填补了这一空白。

2.2 主体一致性视频生成

主体一致性生成在遵循文本提示的同时合成保留参考主体的内容。图像个性化方法,从基于优化的方法如 Textual Inversion Gal 等人 [2022] 和 DreamBooth Ruiz 等人 [2023],到基于适配器的方法如 IP-Adapter Ye 等人 [2023]、InstantID Wang 等人 [2024] 和 PuLID Guo 等人 [2024],都展示了强大的基于参考的控制能力。然而,直接将其扩展到视频领域是不足的,因为视频还额外要求时序一致性、运动自然性以及视角鲁棒的身份保持。最近的 S2V 方法,包括 VideoBooth Jiang 等人 [2024]、DreamVideo Wei 等人 [2024]、Tune-A-Video Wu 等人 [2023]、PersonalVideo Li 等人 [2025a]、Phantom Liu 等人 [2025]、VACE Jiang 等人 [2025]、ConceptMaster Huang 等人 [2025]、MAGREF Deng 等人 [2025]、SkyReels-A2 Fei 等人 [2025]、MovieWeaver Liang 等人 [2025] 和 BindWeave Li 等人 [2025b],改进了单主体和多主体场景中的主体保持能力。尽管如此,它们主要针对通用的主体一致性,即外观可以保持粗略稳定,但面部身份仍然会发生漂移。以人为中心的方法,如 ID-Animator He 等人 [2024] 和 ConsisID Yuan 等人 [2025b],专注于面部身份保持,但大多局限于单人设置,或未明确建模多场景中的身份-角色绑定。Vera 通过使用身份对齐的跨剪辑数据、面部聚焦的监督信号以及参考保持的注意力机制,改进了面部身份一致性、主体绑定以及统一单人和多人 S2V 的自然运动,从而补充了这些工作。

3 方法论

在本节中,我们介绍提出的 Vera 框架。我们首先在 3.1 节中介绍身份对齐的数据流水线。接下来,我们在 3.2 节中描述身份聚焦掩码监督(IFMS),并在 3.3 节中描述参考感知层注意力(RALA)。这些设计共同实现了稳健的面部身份保持和 S2V 生成的主体绑定。图 2 提供了 Vera 架构的示意图概述。

3.1 数据流水线

为了支持以人为中心的 S2V 生成,我们构建了一个大规模的身份对齐图像-视频数据集,如图 1 所示。每个训练样本由一个目标视频片段和一个或多个参考图像组成,其中每个参考图像都明确关联到视频中出现的特定人物。这种数据格式为面部身份保持和多主体绑定提供了直接监督。

第 4 页

输入 数据处理模块 生成的参考集

原始视频 身份一致 参考图像

ID-1 (top-n)

视频片段 ID-2 (top-n)

Clip-1 Clip-2 Clip-3 ID-1 ID-2 单人/多人案例

帧集 单人片段

多人片段

过高 过低 … 参考图像按身份选择。 一个片段可能包含多个人 (从所有片段采样的帧)

图 1:身份一致视频生成的数据处理流程。该过程包括视频分段、帧采样、人脸检测与嵌入提取、片段内身份聚类,以及多样化参考选择,以构建用于单人和多人主体到视频(S2V)生成的身份对齐参考集。

我们数据构建的关键原则是跨片段身份配对。与使用从同一目标片段采样的参考帧(这可能导致通过复制姿态、背景和布局线索而产生平凡的重建)不同,我们从同一视频源的不同片段中检索身份匹配的参考图像。这保留了底层的人脸身份,同时引入了姿态、表情、光照、背景和运动方面的自然变化,鼓励模型学习超越帧级外观匹配的身份一致性。

具体而言,我们首先将原始视频分割为时间连贯的片段,并从采样的帧中提取人脸级身份信息。在每个片段内,检测到的人脸被分组为人物级身份聚类,从而使我们能够识别主要主体并移除不可靠或瞬态的人脸。然后,我们使用每个身份聚类的平均人脸嵌入作为查询,在同一视频源内进行跨片段检索。为了确保可靠且非平凡的配对,我们保留人脸相似度处于中等范围内的检索候选者,过滤掉可能对应不同身份的低相似度匹配,以及可能指示近乎重复帧的过高相似度匹配。最后,对于每个有效身份,我们从检索候选者中选择多样化的参考图像,以避免冗余样本。在多人片段中,该过程对每个身份独立执行,从而生成与目标视频中不同主体对齐的特定人物参考集。

通过此流程,我们获得了约一百万个身份对齐的人像-视频对。与通用的主体配对数据相比,我们的数据集提供了明确的人物级对应关系和多样化的跨片段参考,使得面部身份保持、身份-角色绑定以及鲁棒的 S2V 生成能够进行可扩展的训练。

3.2 身份聚焦掩码监督 (IFMS)

在以人为中心的 S2V 生成中,身份保持主要由细粒度的人脸细节决定,例如脸型、局部纹理和独特的人脸属性。然而,这些对身份至关重要的区域仅占每个视频帧的一小部分。标准的重建或流匹配目标对所有空间位置一视同仁,导致训练信号被背景、衣物和身体区域等大型非人脸区域所主导。结果,模型可能学习到全局合理的外观和运动,但在保持跨帧人物身份所必需的人脸细节上获得的监督不足。

4

第 5 页

(1) 身份聚焦掩码监督 (IFMS) 目标视频帧 加权重建

面部区域: 高权重 … … … 正常背景:权重 文本标记 参考标记 视频标记 低权重 高权重 Ȩ푰푭ȩȯ = ɍ풇풂ȹȻȨ풇풂ȹȻ + ɍ풃ȽȨ풃Ƚ

(2) 参考感知层注意力 a) 参考锚点保护掩码 (RAPA) ƻƵ

一位秃顶的黑人 穿着装饰性的 警察 制服 和一位 留着 视频标记 ƻƵ 参考标记 红棕色 头发 穿着灰色 b) 层选择性身份残差增强 (LIRR) 商务 西装的人 正 在 参考 参考 强烈 标记 残差 ɂ 对话 户外。 视频 ȮɌ 查询 ։ × خ 主要 输出 ȫɌɂ

增强 + 输出 ȫɌɂ ƹ։ = ƹ։ خ։Ƽ։

图 2: Vera 框架概述。文本提示、参考图像集和输入视频被编码为标记序列,并由 DiT Transformer 块处理。Vera 构建于百万级身份对齐的人像-视频数据集之上,并引入了两种互补的设计:IFMS 增强了身份感知的空间监督,而 RALA 稳定了参考-视频交互并增强了层感知的身份读取。这些设计使得在单人和多人场景中都能生成身份忠实且时间连贯的人体主体到视频 (S2V) 生成结果。

为了解决这种不平衡,我们引入了身份聚焦掩码监督 (IFMS),这是一种区域感知的训练目标,它将监督强度重新分配给对身份至关重要的面部区域。对于给定的训练视频,我们从检测到的面部边界框中提取面部掩码 $M_{face}$,并将其互补的非面部区域定义为背景掩码 $M_{bg}$。然后我们构建空间加权图:

$W = w_{face}M_{face} + w_{bg}M_{bg}$, (1)

其中 $w_{face}$ 和 $w_{bg}$ 控制面部和非面部区域对训练目标的相对贡献。背景权重为全局外观、运动和场景上下文提供常规监督,而面部权重增加了对身份敏感的面部细节的优化重点。当 $w_{face} = w_{bg}$ 时,IFMS 退化为标准的均匀目标;使用较大的相对面部权重鼓励模型学习更具判别性的身份线索,同时不丢弃上下文监督。

我们将此加权图集成到整流流 (rectified-flow) 训练目标中。给定噪声潜在变量 $z_t$、目标速度 $u_t$ 以及由 $c$ 条件化的模型预测 $v_\theta(z_t, t, c)$,IFMS 目标定义为: $L_{IFMS} = \frac{\sum W \odot (v_\theta(z_t, t, c) – u_t)^2}{\sum W}$, (2)

其中 $\odot$ 表示逐元素乘法。在计算损失之前,$W$ 会被下采样到潜在分辨率。通过 $\sum W$ 进行归一化,使得在不同面部尺寸和可见主体数量的视频之间,整体损失尺度保持稳定。

关键的是,对于多主体视频,$M_{face}$ 构建为所有有效面部区域的并集,从而使 IFMS 能够联合保留多个身份。与标准的均匀损失相比,IFMS 为身份关键区域提供了放大的梯度,同时为全局场景上下文保持标准监督。这种简单而有效的修改引入了零推理开销,但它有力地鼓励模型合成时间稳定的面部身份,并显著减少了以人为中心的视频生成过程中的字幕诱导伪影。

5

第 6 页

3.3 参考感知层注意力

在 DiT 主干网络中,参考令牌、视频潜在令牌以及与运动相关的条件令牌通过自注意力机制联合处理。虽然这种设计允许视频令牌从参考图像中获取身份线索,但也引入了参考-视频交互中的两个方向性问题。首先,参考查询可能会关注视频键和值,导致参考表示受到动态去噪状态、姿态变化、背景上下文和遮挡的影响。其次,视频令牌从参考令牌中读取身份信息的需求在所有层中并不均匀。这与最近对 DiT 深度的分析一致,这些分析表明不同的 DiT 块在生成中扮演不同的角色:浅层块主要定义构图和轮廓等全局结构,深层块细化细节,而中层块起中间作用 Chen et al. [2024]。我们的实验分析进一步表明,视频到参考的身份读取表现出明显的层依赖模式,主要集中在中层或特定的 DiT 层。基于这些观察,我们引入了参考感知层注意力(Reference-Aware Layer-wise Attention, RALA),它由参考侧的保护掩码和视频侧的身份读取门控组成。

参考锚点保护掩码。为了保持参考令牌作为纯净的身份锚点,我们引入了参考锚点保护掩码(Reference-Anchor Preserving Mask, RAPM)。假设视觉令牌按顺序排列为 $X = [X_v; X_r]$,其中 $X_v$ 和 $X_r$ 分别表示视频令牌和参考令牌。RAPM 仅应用于浅层: $$ M^{RAPM} = \begin{cases} \begin{bmatrix} 0 & 0 \\ -\infty & 0 \end{bmatrix}, & l \le L_s, \\ 0, & l > L_s, \end{cases} \quad (3) $$ 其中行和列遵循 $[X_v; X_r]$ 的顺序,$L_s$ 表示使用 RAPM 的浅层层数。该掩码仅阻断浅层中的参考到视频的注意力,防止参考令牌受到噪声视频状态的干扰,同时保留用于身份读取的视频到参考路径。如图 2 所示,RAPM 阻断浅层中的参考到视频注意力,保持参考令牌纯净,同时保留视频到参考的身份条件控制。

层选择性身份残差增强。除了保护参考令牌外,我们进一步引入层选择性身份残差增强(Layer-Selective Identity Residual Reinforcement, LIRR),以在视频令牌最积极吸收参考身份线索的层中加强身份读取。对于第 $l$ 个自注意力层,我们首先计算经 RAPM 掩码处理的注意力图: $$ A_l = \text{softmax}\left(\frac{QK^\top}{\sqrt{d}} + M^{RAPM}_l\right). \quad (4) $$ 从该注意力图中,我们将视频侧的输出记为 $O^l_v$,其源自参考的身份分量记为 $R^l_v$。受视频令牌主要在中层或特定的 DiT 层获取身份信息这一观察的启发 Chen et al. [2024],我们增强该身份残差如下: $$ \hat{O}^l_v = O^l_v + \beta_l R^l_v, \quad (5) $$ 其中 $\beta_l$ 控制第 $l$ 层身份残差增强的强度。我们将较大的 $\beta_l$ 分配给识别出的身份敏感中层,并保持其在浅层和深层较小或为零。这种设计在最需要身份读取的地方增强了身份读取,同时避免了在早期锚点保护或晚期细节细化过程中对参考的过度依赖。由于 LIRR 作用于注意力后的输出而非注意力 logits,它保留了令牌之间的原始注意力竞争,并且可以在不增加额外参数的情况下实现。

4 实验

4.1 实验设置

实现细节。Vera 基于 Wan-2.2-TI2V-5B Wan et al. [2025] 进行微调,这是一个基于 DiT 的基础视频生成模型。我们排除了原始 T2V 和 I2V 预训练阶段,专注于以人为中心的 S2V 微调阶段。所有训练视频均重采样至 16 fps 并调整大小为 480 × 832。在训练期间,每个样本以文本提示和相应的人脸参考图像为条件。人脸边界框和字幕掩码

6

第 7 页

表 1:主体到视频生成任务的定量比较。我们报告身份一致性、运动质量、自然度和提示遵循指标。“↑”表示越高越好。

| Method | FaceSim-Arc↑ | FaceSim-Cur↑ | MotionSmooth.↑ | NaturalScore↑ | X-CLIP↑ | | :— | :— | :— | :— | :— | :— | | VACE-1.3B Jiang et al. [2025] | 0.487 | 0.468 | 0.962 | 3.62 | 0.307 | | VACE-14B Jiang et al. [2025] | 0.531 | 0.507 | 0.945 | 3.65 | 0.311 | | BindWeave Li et al. [2025b] | 0.512 | 0.488 | 0.939 | 3.66 | 0.343 | | Phantom-1.3B Liu et al. [2025] | 0.488 | 0.461 | 0.928 | 3.71 | 0.333 | | Phantom-14B Liu et al. [2025] | 0.495 | 0.472 | 0.952 | 3.83 | 0.329 | | Ours | 0.571 | 0.529 | 0.930 | 3.90 | 0.340 |

用于构建边界框感知的掩码损失,而参考保留注意力掩码应用于早期的 Transformer 层。我们使用 Adam 优化器训练模型,学习率为 $5 \times 10^{-6}$,全局批次大小为 32。除非另有说明,所有消融实验均在相同的训练设置下进行。

基线。我们将 Vera 与强大的主体到视频基线方法进行比较,包括 VACE Jiang et al. [2025]、Phantom Liu et al. [2025] 和 BindWeave Li et al. [2025b]。对于 VACE Jiang et al. [2025] 和 Phantom Liu et al. [2025],我们报告了 1.3B 和 14B 两个变体,以评估不同模型规模下的性能。VACE Jiang et al. [2025] 提供了一个统一的参考条件视频生成框架,Phantom Liu et al. [2025] 通过跨模态文本-图像-视频对齐学习主体一致性,而 BindWeave Li et al. [2025b] 进一步利用多模态推理来建模实体、属性和交互。这些方法代表了具有竞争力的基线,用于主体一致性视频生成,使我们能够评估 Vera 在面部身份一致性、运动质量、自然度和提示遵循方面的表现。

基准与评估指标。我们在一个精心策划的以人为中心的 S2V 基准上评估 Vera,该基准包含 100 个身份。每个身份关联两个文本提示和相应的参考图像。为了获得可靠的评估,每个文本-图像对使用三个随机种子生成,总共产生 600 个视频。

我们报告涵盖身份保持、时间运动、自然度和提示遵循的指标。对于身份保持,我们使用 ArcFace Deng et al. [2019] 和 Curricular-Face Huang et al. [2020] 计算 FaceSim,分别记为 FaceSim-Arc 和 FaceSim-Cur。对于时间运动,我们遵循基于光流的评估协议 Bradski [2000] 报告 MotionSmoothness 和 MotionAmplitude。对于感知自然度,我们采用 NaturalScore。对于提示遵循,我们使用 X-CLIP Ma et al. [2022] 来测量文本-视频语义对齐。所有指标均以数值越高表示性能越好进行报告。

4.2 定量比较

我们与代表性的主体到视频生成方法进行了定量比较,包括 VACE Jiang et al. [2025]、BindWeave Li et al. [2025b] 和 Phantom Liu et al. [2025],如表 3 所示。我们从四个互补的方面评估生成的视频:身份一致性、运动平滑度、感知自然度和提示遵循。

Vera 取得了最佳的身份一致性,FaceSim-Arc 和 FaceSim-Cur 得分分别为 0.571 和 0.529。与最强的基线 VACE-14B 相比,Vera 将 FaceSim-Arc 从 0.531 提升至 0.571,将 FaceSim-Cur 从 0.507 提升至 0.529,表明在生成的帧中更可靠地保留了人类身份。此外,Vera 获得了最高的 NaturalScore 3.90 和具有竞争力的 X-CLIP 得分 0.340,同时保持了合理的时间平滑度。虽然 VACE-1.3B 取得了最高的 MotionSmoothness 得分,但其身份一致性仍显著低于 Vera。这些结果表明,Vera 在保持具有竞争力的提示对齐和时间连贯性的同时,提高了身份保持和感知质量,验证了其在身份忠实的人体 S2V 生成中的有效性。

7

第 8 页

1.3B 1.3B VACE VACE

14B 14B VACE VACE BindWeave BindWeave

14B 14B Phantom Phantom

1.3B 1.3B Phantom Phantom

ours ours

A doctor with dark hair and a short beard, wearing black scrubs and a A man with styled brown hair walks slowly on a dark street at night. He stethoscope, is having an earnest conversation with a woman in a hospital. is dressed in a red turtleneck and a light-colored vest, with a light grey The camera is positioned behind the woman, focusing on the doctor's face coat casually draped over his shoulders. A dark car is parked behind him. as he looks down and then back up at her while talking.

Figure 3: Qualitative comparison on single-person subject-to-video generation. Our method better balances identity consistency, appearance fidelity, and motion naturalness in conversational scenes.

1.3B 1.3B VACE VACE

14B 14B VACE VACE BindWeave BindWeave

14B 14B Phantom Phantom

Phantom 1.3B Phantom 1.3B

ours ours

At an indoor birthday party, a man with spiky hair in a studded leather A young woman in an elegant white wedding dress leans over and speaks jacket and sunglasses stands in the center and shouts with his mouth wide urgently to a seated woman with dark hair, while a dark-haired man sits open. To his right an older man with glasses and a red scarf smiles beside her. The seated woman looks tense and serious as the woman in the broadly. In the background, another man in a suit looks on. wedding dress gestures with her hands while talking.

Figure 4: Qualitative comparison on multi-person subject-to-video generation. Our method better preserves individual identities, spatial layouts, and interaction consistency across complex multi- character scenes.

4.3 定性比较

为了展示 Vera 的有效性,我们在图 3 和图 4 中展示了具有代表性的单人和多人主体到视频(Subject-to-Video, S2V)对比,包括 BindWeave Li et al. [2025b]、Phantom-14B Liu et al. [2025]、Phantom-1.3B Liu et al. [2025]、VACE-1.3B Jiang et al. [2025] 和 VACE-14B Jiang et al. [2025] 作为基线方法。如图 3 所示,基线方法生成的视频看似合理,但经常表现出身份漂移或提示词对齐不完整。在医生对话和夜间街道两个示例中,它们仅保留了部分外观或场景线索,而无法一致地维持参考身份、细粒度的服装细节以及提示词指定的动作。相比之下,Vera 在保持身份和外观的同时,生成了更自然且与提示词对齐的动作。图 4 进一步展示了 Vera 在多人场景中的优势。这些案例要求在保持正确角色分配、空间布局和交互的同时保留多个身份。基线方法往往只关注场景的一部分,混淆角色,或者在生日派对和婚礼示例中跨主体混合身份。相比之下,Vera 更一致地保留了每个参考人物,保持了更清晰的空间关系,并生成了与提示词更匹配交互。

8

第 9 页

一位留着黑色短发的中年亚裔男子,身穿白色T恤外搭迷彩夹克,站在户外。他手里抱着一只深色的小狗,正对着智能手机生动地交谈并面带微笑,画面为中近景镜头。

IFMS RALA w w

IFMS RALA w/o w/o

图 5:IFMS 和 RALA 的定性消融实验。IFMS 提高了整体面部一致性,而 RALA 通过稳定参考锚点进一步保留了细粒度的身份细节。

表 2:IFMS 和 RALA 的消融研究。完整模型实现了最佳的身份一致性,验证了每个提出组件的贡献。 身份一致性 提示遵循 方法 FaceSim-Arc↑ FaceSim-Cur↑ X-CLIP↑

无 IFMS 0.523 0.508 0.317 无 RALA 0.545 0.513 0.309 全部启用 0.571 0.529 0.340

总体而言,Vera 在身份一致性、外观保真度、提示对齐和运动自然度方面实现了平衡的提升,尤其在身份保持方面具有显著优势。

4.4 消融研究

表 2 报告了我们提出组件的消融结果。移除 IFMS 会导致身份一致性明显下降,FaceSim-Arc 从 0.571 降至 0.523,FaceSim-Cur 从 0.529 降至 0.508。这验证了身份感知空间监督在保留具有判别性的人类身份线索方面的重要性。移除 RALA 也会导致身份一致性和提示遵循方面的持续下降,表明层感知的参考视频交互有助于稳定身份条件。在所有组件启用的情况下,Vera 在所有指标上均取得了最佳性能,表明 IFMS 和 RALA 是互补的:IFMS 在监督层面加强了以身份为重点的学习,而 RALA 在注意力层面改进了参考条件和身份读取。如图 5 所示,IFMS 通过对身份关键区域提供更强的监督,改善了整体身份外观,从而产生更一致的脸型、肤色和面部特征。相比之下,RALA 主要有利于细粒度的身份保持。如果没有 RALA,生成的主体在视觉上仍然合理,但会失去细微的参考特定细节,如发际线、眉毛形状和皮肤纹理。有了 RALA,这些细粒度的身份细节在帧之间得到了更好的保留,表明层感知的参考锚点保护和身份残差增强有助于维持稳定和详细的身份线索。总之,IFMS 和 RALA 从整体外观一致性到细粒度身份保真度,共同改善了身份保持。

5 结论

我们介绍了 Vera,这是一个统一的以人为中心的主体到视频生成(S2V)框架,用于身份忠实且单人和多人视频生成。与主要保留粗略外观的通用主体一致方法不同,Vera 专注于在姿势、运动和交互中保持稳定的个人级身份。我们通过个人级跨片段检索构建了一个百万对身份对齐的人像-视频数据集,提供了多样化的参考和明确的身份对应关系。基于该数据集,Vera 引入了身份聚焦掩码监督(IFMS)以加强身份感知空间监督,并引入参考感知层注意力(RALA)以稳定参考-视频交互并增强细粒度身份读取。实验表明,Vera 提高了人类身份一致性、多人主体绑定和自然运动,同时减少了身份

9

第 10 页

混淆以及过度的参考图像复制。这些结果突显了身份感知监督和参考感知建模对于可控人类视频生成的重要性。

参考文献

Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, et al. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127, 2023.

Gary Bradski. The opencv library. Dr. Dobb’s Journal: Software Tools for the Professional Programmer, 25(11):120–123, 2000.

Pengtao Chen, Mingzhu Shen, Peng Ye, Jianjian Cao, Chongjun Tu, Christos-Savvas Bouganis, Yiren Zhao, and Tao Chen. ∆-DiT: A training-free acceleration method tailored for diffusion transformers. arXiv preprint arXiv:2406.01125, 2024.

Tsai-Shien Chen, Aliaksandr Siarohin, Willi Menapace, Yuwei Fang, Kwot Sin Lee, Ivan Skorokhodov, Kfir Aberman, Jun-Yan Zhu, Ming-Hsuan Yang, and Sergey Tulyakov. Multi-subject open-set personalization in video generation. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 6099–6110, 2025.

Jiankang Deng, Jia Guo, Niannan Xue, and Stefanos Zafeiriou. Arcface: Additive angular margin loss for deep face recognition. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 4690–4699, 2019.

Yufan Deng, Xun Guo, Yuanyang Yin, Jacob Zhiyuan Fang, Yiding Yang, Yizhi Wang, Shenghai Yuan, Angtian Wang, Bo Liu, Haibin Huang, et al. Magref: Masked guidance for any-reference video generation. arXiv e-prints, pages arXiv–2505, 2025.

Zhengcong Fei, Debang Li, Di Qiu, Jiahua Wang, Yikun Dou, Rui Wang, Jingtao Xu, Mingyuan Fan, Guibin Chen, Yang Li, et al. Skyreels-a2: Compose anything in video diffusion transformers. arXiv preprint arXiv:2504.02436, 2025.

Rinon Gal, Yuval Alaluf, Yuval Atzmon, Or Patashnik, Amit H Bermano, Gal Chechik, and Daniel Cohen-Or. An image is worth one word: Personalizing text-to-image generation using textual inversion. arXiv preprint arXiv:2208.01618, 2022.

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, and Dan Xu. Wildactor: Unconstrained identity-preserving video generation. arXiv preprint arXiv:2603.00586, 2026.

Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, and Bo Dai. Animatediff: Animate your personalized text-to-image diffusion models without specific tuning. arXiv preprint arXiv:2307.04725, 2023.

Zinan Guo, Yanze Wu, Zhuowei Chen, Lang Chen, Peng Zhang, and Qian He. Pulid: Pure and lightning id customization via contrastive alignment. Advances in neural information processing systems, 37:36777–36804, 2024.

Xuanhua He, Quande Liu, Shengju Qian, Xin Wang, Tao Hu, Ke Cao, Keyu Yan, and Jie Zhang. Id-animator: Zero-shot identity-preserving human video generation. arXiv preprint arXiv:2404.15275, 2024.

Yuge Huang, Yuhan Wang, Ying Tai, Xiaoming Liu, Pengcheng Shen, Shaoxin Li, Jilin Li, and Feiyue Huang. Curricularface: adaptive curriculum learning loss for deep face recognition. In proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 5901–5910, 2020.

Yuzhou Huang, Ziyang Yuan, Quande Liu, Qiulin Wang, Xintao Wang, Ruimao Zhang, Pengfei Wan, Di Zhang, and Kun Gai. Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning. arXiv preprint arXiv:2501.04698, 2025.

Yuming Jiang, Tianxing Wu, Shuai Yang, Chenyang Si, Dahua Lin, Yu Qiao, Chen Change Loy, and Ziwei Liu. Videobooth: Diffusion-based video generation with image prompts. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 6689–6700, 2024.

10

第 11 页

Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, 和 Yu Liu。Vace:一站式视频创建与编辑。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,页码 17191–17202,2025 年。

Weijie Kong, Qi Tian, Zijian Zhang, Rox Min, Zuozhuo Dai, Jin Zhou, Jiangfeng Xiong, Xin Li, Bo Wu, Jianwei Zhang 等人。Hunyuanvideo:大型视频生成模型的系统性框架。arXiv 预印本 arXiv:2412.03603,2024 年。

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, 和 Deng Cai。Personalvideo:无需动态和语义退化的高身份保真度视频定制。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,页码 19406–19416,2025a。

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, 和 Zehuan Yuan。Bindweave:通过跨模态集成实现主体一致的视频生成。arXiv 预印本 arXiv:2510.00438,2025b。

Feng Liang, Haoyu Ma, Zecheng He, Tingbo Hou, Ji Hou, Kunpeng Li, Xiaoliang Dai, Felix Juefei-Xu, Samaneh Azadi, Animesh Sinha 等人。Movie weaver:使用锚定提示进行免微调的多概念视频个性化。在计算机视觉与模式识别会议论文集 (Proceedings of the Computer Vision and Pattern Recognition Conference) 中,页码 13146–13156,2025 年。

Lijie Liu, Tianxiang Ma, Bingchuan Li, Zhuowei Chen, Jiawei Liu, Gen Li, Siyu Zhou, Qian He, 和 Xinglong Wu。Phantom:通过跨模态对齐实现主体一致的视频生成。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF International Conference on Computer Vision) 中,页码 14951–14961,2025 年。

Yiwei Ma, Guohai Xu, Xiaoshuai Sun, Ming Yan, Ji Zhang, 和 Rongrong Ji。X-clip:用于视频-文本检索的端到端多粒度对比学习。在 ACM 国际多媒体会议论文集 (Proceedings of the 30th ACM international conference on multimedia) 中,页码 638–647,2022 年。

William Peebles 和 Saining Xie。基于 Transformer 的可扩展扩散模型。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision) 中,页码 4195–4205,2023 年。

Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang 等人。Movie gen:一组媒体基础模型。arXiv 预印本 arXiv:2410.13720,2024 年。

Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, 和 Kfir Aberman。Dreambooth:针对主体驱动生成的文本到图像扩散模型微调。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF conference on computer vision and pattern recognition) 中,页码 22500–22510,2023 年。

Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni 等人。Make-a-video:无需文本-视频数据的文本到视频生成。arXiv 预印本 arXiv:2209.14792,2022 年。

Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang 等人。Wan:开放且先进的大规模视频生成模型。arXiv 预印本 arXiv:2503.20314,2025 年。

Qixun Wang, Xu Bai, Haofan Wang, Zekui Qin, Anthony Chen, Huaxia Li, Xu Tang, 和 Yao Hu。Instantid:秒级零样本身份保持生成。arXiv 预印本 arXiv:2401.07519,2024 年。

Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, 和 Hongming Shan。Dreamvideo:使用定制主体和动作组合你的梦想视频。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,页码 6537–6549,2024 年。

Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gu, Yufei Shi, Wynne Hsu, Ying Shan, Xiaohu Qie, 和 Mike Zheng Shou。Tune-a-video:针对文本到视频生成的图像扩散模型单样本微调。在 IEEE/CVF 国际计算机视觉会议论文集 (Proceedings of the IEEE/CVF international conference on computer vision) 中,页码 7623–7633,2023 年。

11

第 12 页

薛博文,段正鹏,闫启鑫,王文静,刘浩,郭春乐,李崇一, 陈立,吕静。Stand-in:一种轻量级且即插即用的视频生成身份控制方法。arXiv 预印本 arXiv:2508.07901,2025。

杨卓一,滕佳言,温迪·郑,丁明,黄世宇,徐佳正,杨元明, 文一·洪,张孝涵,冯冠宇,等。Cogvideox:具有专家变换器的文本到视频扩散模型。arXiv 预印本 arXiv:2408.06072,2024。

叶虎,张军,刘思博,韩潇,杨伟。Ip-adapter:用于文本到图像扩散模型的文本兼容图像提示适配器。arXiv 预印本 arXiv:2308.06721,2023。

袁圣海,何先义,邓宇凡,叶阳,黄金发,林斌,罗杰波,袁李。 Opens2v-nexus:主体到视频生成的详细基准和百万级数据集。arXiv 预印本 arXiv:2505.20292,2025a。

袁圣海,黄金发,何先义,葛云扬,史宇俊,陈刘汉,罗杰波, 袁李。通过频率分解实现身份保持的文本到视频生成。在计算机视觉与模式识别会议论文集,第 12978–12988 页,2025b。

袁圣海,何先义,邓宇凡,叶阳,黄金发,马重阳,罗杰波,袁李, 等。Opens2v-nexus:主体到视频生成的详细基准和百万级数据集。神经信息处理系统进展,38,2026。

郑藏伟,彭翔宇,杨天吉,沈晨辉,李圣贵,刘宏鑫,周玉坤, 李天一,杨勇。Open-sora:让所有人都能高效制作视频。arXiv 预印本 arXiv:2412.20404,2024。

12

第 13 页

附录

A 预备知识 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .13

B 数据构建流程 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14

B.1 视频分割与面部级过滤 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .14

B.2 片段内身份聚类 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15

B.3 跨片段检索与多样化参考选择 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15

C 实验设置 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16

C.1 实现细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .16

C.2 评估基准 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16

D 额外的消融实验结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .17

D.1 关于身份焦点掩码监督 (IFMS) 的消融细节 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17

D.2 关于参考感知分层注意力 (RALA) 的消融 . . . . . . . . . . . . . . . . . . . . . . . . . . . .17

E 更多定性结果 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

F 数据集统计 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

G 补充声明 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19

G.1 局限性与未来工作 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19

A 预备知识

在本节中,我们总结了潜在整流流视频生成以及以人为中心的主体到视频生成 (Subject-to-Video, S2V) 的基本公式。我们还介绍了用于描述基于 DiT 的视频生成器中文本、参考图像和视频潜在令牌之间交互的注意力符号。

潜在整流流视频生成。给定一个干净的视频 $X \in \mathbb{R}^{T \times C \times H \times W}$,预训练的视频 VAE 编码器 $E(\cdot)$ 将其映射为紧凑的潜在表示:

$$ z_1 = E(X), \quad (6) $$

其中 $z_1 \in \mathbb{R}^{T' \times C' \times H' \times W'}$ 表示干净的视频潜在变量。我们采样一个与 $z_1$ 形状相同的高斯噪声潜在变量 $z_0 \sim \mathcal{N}(0, I)$。整流流定义了噪声潜在变量与干净视频潜在变量之间的线性插值:

$$ z_t = t z_1 + (1 – t) z_0, \quad t \in [0, 1]. \quad (7) $$

相应的目标速度通过对 $z_t$ 关于 $t$ 求导获得:

$$ u_t = \frac{d z_t}{dt} = z_1 – z_0. \quad (8) $$

由参数 $\theta$ 参数化的视频生成模型被训练以预测该速度场:

$$ \mathcal{L}_{\text{RF}} = \mathbb{E}_{z_1, z_0, t, c} \left[ \| v_\theta(z_t, t, c) – u_t \|_2^2 \right], \quad (9) $$

其中 $c$ 表示条件信号,例如文本提示和参考图像。在推理期间,从噪声中积分学习到的速度场以生成视频潜在变量,然后通过 VAE 解码器将其解码回像素空间。

第 14 页

以人为中心的主体到视频生成。主体到视频生成旨在根据参考主体和文本提示合成视频。在本工作中,我们关注以人为中心的设置,其中参考主体是人,目标是在生成的帧中保持他们的身份。给定文本提示 $p$ 和一组人类参考图像 $$R = \{R_i\}_{i=1}^N, \quad (10)$$ 其中 $N$ 表示参考身份的数量,模型生成一个遵循提示同时保留每个参考人员身份的视频 $\hat{X}$。

对于多人生成,模型必须进一步在多个参考和多个生成主体之间保持人员级别的对应关系。具体而言,每个参考身份应在整个视频中与其对应的文本角色和生成主体保持一致关联。这不仅需要保留细粒度的身份线索,还需要避免在动态多人场景中出现的身份-角色错误绑定、主体混淆和属性泄漏。

Tokenized DiT 注意力。在我们的基于 DiT 的视频生成器中,文本提示被编码为文本令牌并通过交叉注意力注入,而参考图像和视频潜变量在视觉自注意力流中处理。我们将参考令牌表示为 $X_r$,视频潜变量令牌表示为 $X_v$。拼接后的视觉令牌写为: $$X = [X_r; X_v]. \quad (11)$$

对于自注意力层,令牌被投影为查询、键和值: $$Q = XW_Q, \quad K = XW_K, \quad V = XW_V. \quad (12)$$

自注意力输出计算为: $$\text{Attn}(Q, K, V) = \text{softmax}\left(\frac{QK^\top}{\sqrt{d}}\right)V. \quad (13)$$

在这种公式下,视频令牌可以通过从视频查询到参考键和值的注意力路径从参考令牌中读取身份信息。对于视频查询,注意力输出可以分解为: $$O_v = A_{v,v}V_v + A_{v,r}V_r, \quad (14)$$ 其中 $A_{v,v}$ 表示从视频查询到视频键的注意力,$A_{v,r}$ 表示从视频查询到参考键的注意力。第二项 $A_{v,r}V_r$ 代表从参考令牌中读取的身份残差。

然而,标准自注意力也允许参考令牌关注视频令牌,这可能会使参考表示暴露于噪声去噪状态、姿态变化、背景上下文和遮挡中。这激发了我们的参考感知分层注意力(Reference-Aware Layer-wise Attention, RALA),它将参考令牌保留为稳定的身份锚点,并有选择地加强视频到参考的身份读取。

B 数据构建流程

我们构建了一个身份对齐的图像-视频数据集,以支持以人为中心的主体到视频生成。关键目标是构建训练对,其中每个目标视频片段与同一人的参考图像配对,同时避免平凡的帧重建和参考特定的捷径复制。该流程包括三个阶段:视频分割和面部级别过滤、片段内身份聚类以及具有多样化参考选择的跨片段检索。

B.1 视频分割和面部级别过滤

给定一个原始视频,我们首先应用场景切割检测将其划分为时间上连贯的视频片段: $$V \to \{V_i\}_{i=1}^M, \quad (15)$$ 其中每个 $V_i$ 表示具有连贯场景内容的短片段。对于每个片段,我们均匀采样帧以形成帧集 $F_i$。然后使用预训练的面部检测器和识别模型来检测面部并从每个采样帧中提取面部嵌入。每个检测到的面部表示为: $$d_{m,i,t} = (b_{m,i,t}, e_{m,i,t}, s_{m,i,t}), \quad (16)$$

第 15 页

其中 $b_{m,i,t}$ 是人脸边界框,$e_{m,i,t}$ 是人脸嵌入,$s_{m,i,t}$ 是帧 $t$ 中第 $m$ 个人脸的检测置信度。

为了去除不可靠的样本,我们基于三个标准对片段和人脸进行过滤。首先,丢弃检测置信度低的人脸。其次,移除边界框面积相对于帧过小的人脸,因为它们提供的身份线索较弱。第三,排除过短的片段以确保足够的时序运动。此过滤阶段产生更干净的人脸检测结果集,用于后续的身份级处理。

B.2 片段内身份聚类

单个视频片段可能包含多个人、瞬态背景人脸或误检。为了获得人员级身份单元,我们根据余弦相似度对每个片段内的所有有效人脸嵌入进行聚类。对于片段 $V_i$,检测到的人脸被分组为身份簇: $$ C_i = \{C_{i,k}\}_{k=1}^{N_i}, \quad (17) $$ 其中 $C_{i,k}$ 表示第 $k$ 个身份簇,$N_i$ 是片段中有效身份的数量。对于每个簇,我们计算平均身份嵌入: $$ \mu_{i,k} = \frac{1}{|C_{i,k}|} \sum_{e \in C_{i,k}} e. \quad (18) $$

移除出现次数过少的簇,因为它们通常对应于瞬态人脸、不可靠的检测或背景人物。剩余的簇代表目标片段中出现的稳定人员身份。此步骤对于多人视频尤为重要,因为在构建参考集之前必须分离不同的身份。

B.3 跨片段检索与多样化参考选择

直接使用目标片段中的帧作为参考可能会鼓励捷径学习,即模型复制背景、姿态或帧布局,而不是学习鲁棒的身份对应关系。为了缓解这个问题,我们通过跨片段身份检索构建参考图像。对于目标片段 $V_i$ 中的每个身份簇 $C_{i,k}$,我们从同一视频源的其他片段中搜索身份匹配的候选者。给定另一个具有身份簇 $C_{j,l}$ 的片段 $V_j$,身份相似度计算为: $$ \text{sim}(C_{i,k}, C_{j,l}) = \frac{\mu_{i,k}^\top \mu_{j,l}}{\|\mu_{i,k}\|_2 \|\mu_{j,l}\|_2}. \quad (19) $$

我们保留相似度处于中等范围内的候选簇: $$ \tau_{\text{low}} < \text{sim}(C_{i,k}, C_{j,l}) < \tau_{\text{high}}. \quad (20) $$

下阈值过滤掉不匹配的身份,而上阈值移除可能导致背景泄漏或特定帧视觉线索捷径复制的近重复片段。

从检索到的候选者中,我们为每个身份选择一组多样化的参考图像。具体而言,首先根据身份相似度和检测质量对候选人脸进行排名。然后,我们使用预训练图像编码器提取的视觉特征来鼓励所选参考之间的多样性。令 $\phi(\cdot)$ 表示视觉特征提取器,$S_{i,k}$ 表示身份 $C_{i,k}$ 的选定参考集。选择倾向于身份一致且视觉上多样化的参考:

$$ S_{i,k} = \arg \max_{S \subset A_{i,k}} \left[ \frac{1}{|S|} \sum_{R \in S} \text{sim}(R, C_{i,k}) + \lambda \frac{1}{|S|^2} \sum_{R_a, R_b \in S} \|\phi(R_a) – \phi(R_b)\|^2 \right], \quad (21) $$

其中 $A_{i,k}$ 是候选参考池,$\lambda$ 平衡身份可靠性和视觉多样性。在实践中,这种选择鼓励参考集覆盖姿态、表情、光照和背景的变化。

对于多人片段,上述检索和选择过程对每个身份簇独立执行。因此,每个训练样本构建为: $$ D_i = \left( V_i, p_i, \{S_{i,k}\}_{k=1}^{N_i} \right), \quad (22) $$

15

第 16 页

其中 $V_i$ 是目标视频片段,$p_i$ 是文本提示,$S_{i,k}$ 是片段中第 $k$ 个人的参考图像集。这为单人及多人人类 S2V 生成了身份对齐的训练样本。

最后,我们通过根据身份对选定的候选参考图像进行分组,并用不同颜色标记不同身份,来执行视觉验证。这使我们能够检查目标视频中出现的每个人是否都与其对应的参考图像正确匹配。通过该流程,我们获得了身份一致、多样且非平凡的图像-视频对,从而支持面部身份保持和多人主体绑定的可扩展训练。

C 实验设置

C.1 实现细节

身份焦点损失与字幕抑制。我们在 VAE 潜在空间中应用感知边界框(bbox-aware)的掩码去噪损失,以加强身份相关的监督。面部边界框首先根据与训练视频相同的缩放和裁剪流程进行变换,然后在宽度和高度上均放大 50%,随后光栅化为潜在空间掩码。在放大的面部区域内,损失权重设为 2.0,在其他区域设为 1.0,对应于 face scale=1.0 和 face offset=1.0。此外,使用字幕边界框掩码从去噪损失中排除字幕区域,以减少与身份无关的文本伪影的影响。

分层 RALA 调度。对于参考感知注意力控制,我们在 DiT 主干网络上采用分层身份读出调度。视频侧的注意力输出被分解为视频自贡献和源自参考的身份贡献。我们在早期和晚期层保留默认的参考贡献,并在中间层以 $\gamma_l = 1.5$ 放大源自参考的身份项。这等效于在中间层添加系数为 $\beta_l = 0.5$ 的身份残差。

C.2 评估基准

现有的主体到视频基准为一般主体一致性提供了有用的评估协议,但它们通常不足以评估以人为中心的身份保持。特别是,人类 S2V 要求模型在多样的姿态、表情、运动和视角下保持细粒度的面部身份。在多人场景中,模型必须进一步将每个参考身份绑定到正确的文本角色和时间轨迹。为了提供更针对性的评估,我们构建了一个以人为中心的 S2V 基准,涵盖单身份和多人生成。

我们的基准由 100 个精心策划的主体-文本对组成,分为两个主要类别:单身份和多人案例。单身份组包含 70 个测试案例,每个案例包括对应于同一个人的一个或多个参考图像。这些案例旨在评估在多样提示下的身份保持,包括肖像运动、行走、情感表达和姿态变化。多人组包含 30 个复杂度各异的测试案例,包括两人、三人以及更复杂的群体场景。这些案例用于评估模型是否能在保持正确角色分配和交互一致性的同时,同时保持多个身份。

该基准经过精心设计,以确保对人类外观、背景设置和交互动态的广泛覆盖。我们包括了具有不同年龄、性别、发型、肤色、服装风格和面部特征的主体。提示涵盖了广泛的环境,如室内房间、医院、街道、派对、户外场景和低光环境。我们还包括了不同的交互模式,包括面对面交互、行走、坐着、做手势、注视他人以及多角色社交互动。这种多样性使得基准不仅能评估静态身份相似度,还能评估在真实运动和交互条件下的身份稳定性。

每个测试案例包含一个或多个参考图像,并与自然语言提示配对。参考图像的选择旨在提供清晰的身份线索,同时避免过于平凡的近重复视图。提示的设计旨在确保语义清晰、视觉合理以及充分的运动描述。这种受控设计使评估难度保持相对

第 17 页

表 3:IFMS 区域权重的消融研究。我们改变 $w_{face}$ 和 $w_{bg}$ 以评估面部焦点监督对身份一致性、运动平滑度、自然度和提示遵循的影响。最佳值加粗,次佳值下划线。 身份 运动 自然度 提示 $w_{face}$ $w_{bg}$ FaceSim-Arc↑FaceSim-Cur↑MotionSmooth.↑NaturalScore↑X-CLIP↑

1.5 0.5 0.546 0.508 0.936 3.79 0.331 1.5 1.0 0.558 0.517 0.933 3.85 0.337 2.0 1.0 0.571 0.529 0.930 3.90 0.340 2.5 1.0 0.561 0.520 0.924 3.82 0.332

在所有案例中保持一致,同时涵盖具有挑战性的场景,如姿态变化、部分遮挡、复杂背景以及多人身份-角色绑定。

为了进行可靠的评估,每个参考-提示对使用多个随机种子生成,并使用涵盖身份一致性、时间运动、自然度和提示遵循的指标对生成的视频进行评估。该基准为衡量以人为中心的 S2V 模型在单人和多人设置中生成身份忠实、时间连贯且语义对齐视频的能力提供了一个专注的测试平台。

D 额外的消融结果

D.1 关于身份焦点掩码监督 (IFMS) 的消融细节

表 3 研究了不同 IFMS 区域权重的影响。当面部权重相对较小时,例如 $w_{face} = 1.5$,模型实现了合理的运动平滑度但身份一致性较弱,这表明对面部的强调不足限制了对身份关键细节的学习。将面部权重增加到 $w_{face} = 2.0$ 持续改善了身份保留,分别取得了 0.571 和 0.529 的最佳 FaceSim-Arc 和 FaceSim-Cur 分数。它还获得了最佳的 NaturalScore 和 X-CLIP 分数,表明更强的面部焦点监督不仅提高了身份保真度,还有益于感知质量和提示对齐。

然而,进一步将面部权重增加到 $w_{face} = 2.5$ 导致所有指标的性能下降。这表明过度强调面部区域可能会破坏局部身份监督和全局视频重建之间的平衡,导致运动平滑度较弱且生成结果不够自然。此外,设置较低的背景权重,即 $w_{bg} = 0.5$,略微改善了运动平滑度,但降低了身份和提示遵循性能,表明背景和非面部区域仍然提供了有用的上下文监督。总体而言,$w_{face} = 2.0$ 和 $w_{bg} = 1.0$ 在身份保留、视觉自然度、提示遵循和时间连贯性之间提供了最佳权衡。

D.2 关于参考感知分层注意力 (RALA) 的消融

表 4 分析了 LIRR 中中间层身份残差权重 $w_{mid}$ 的影响。当 $w_{mid}$ 从 1.0 增加到 1.5 时,身份一致性稳步提高,FaceSim-Arc 从 0.544 增加到 0.571,FaceSim-Cur 从 0.509 增加到 0.529。这表明在身份敏感的中间层适度加强视频到参考的身份读取有助于视频 token 吸收更可靠的参考身份线索。同时,NaturalScore 也从 3.81 提高到 3.90,表明增强的身份读取可以在不引入明显伪影的情况下改善感知质量。

然而,进一步将 $w_{mid}$ 增加到 1.8 或 2.0 导致身份、运动、自然度和提示遵循指标的一致性下降。这表明过强的参考残差强化可能使生成过于依赖参考 token,降低了模型在运动合成和语义对齐方面的灵活性。特别是,随着 $w_{mid}$ 变大,MotionSmoothness 逐渐下降,表明身份强化和时间动态之间存在权衡。总体而言,$w_{mid} = 1.5$ 实现了最佳的身份一致性和自然度

17

第 18 页

表 4:层选择性身份残差强化(LIRR)中中间层身份残差权重 $w_{\text{mid}}$ 的消融研究。我们改变 $w_{\text{mid}}$ 以评估在身份敏感的中间层中,视频到参考身份读取的强度如何影响身份一致性、运动平滑度、自然度和提示遵循能力。最佳值以粗体显示,次佳值以下划线显示。

| $w_{\text{mid}}$ | 身份 (Identity) | 运动 (Motion) | 自然度 (Natural.) | 提示 (Prompt) | | :— | :— | :— | :— | :— | | | FaceSim-Arc↑ | FaceSim-Cur↑ | MotionSmooth.↑ | NaturalScore↑ | X-CLIP↑ | | 1.0 | 0.544 | 0.509 | 0.935 | 3.81 | 0.343 | | 1.3 | 0.559 | 0.518 | 0.933 | 3.86 | 0.341 | | 1.5 | 0.571 | 0.529 | 0.930 | 3.90 | 0.340 | | 1.8 | 0.562 | 0.521 | 0.926 | 3.83 | 0.335 | | 2.0 | 0.550 | 0.513 | 0.921 | 3.77 | 0.329 |

在保持具有竞争力的运动平滑度和提示遵循能力的同时,为层选择性身份残差强化提供了最佳平衡。

E 更多定性结果

我们在图 6 中提供了 Vera 的更多定性结果。这些例子进一步证明了我们的方法在多样化身份、外观、运动和交互场景下的人体中心主体到视频生成(Subject-to-Video, S2V)中的有效性。给定一张或多张人体参考图像以及一个自然语言提示,Vera 能够一致地生成时间上连贯的视频,同时保留参考主体的身份。前四行展示了具有多样化外观和运动模式的单人生成结果,包括头部运动、面部表情变化、说话、大笑和物体交互。Vera 保持了细粒度的身份线索,如脸型、发型、肤色和面部特征,同时允许生成的主体在不同的背景和光照条件下执行提示指定的动作。最后两行展示了多人生成案例,其中模型需要同时保留多个身份,并将每个人与正确的文本角色关联起来。这些结果表明,Vera 能够在户外对话等动态交互中保持人员级别的身份一致性并减少身份混淆。综上所述,这些结果表明 Vera 在不同的外观、场景上下文和运动模式下具有良好的泛化能力。该模型不仅在帧间保留了身份关键的面部细节,而且在单人和多人设置中都能遵循文本指令并保持连贯的交互。

F 数据集统计

遵循第 3.1 节中描述的数据构建流程,我们获得了 1,001,891 个身份对齐的人体图像-视频对,涵盖单人和多人场景。每对数据通过视频分割、面部级别的身份聚类和跨片段参考检索构建而成。这种设计在保留人员级别身份对应关系的同时,引入了姿态、表情、光照、背景和运动的自然变化。

图 F 总结了所得数据集的组成。在性别相关注释方面,46.2% 的样本包含男性描述,27.2% 包含女性描述,26.5% 被归类为混合或模糊。在具有明确年龄描述的样本中,中年和年轻成年主体分别占 43.6% 和 21.5%,而儿童/青少年和老年主体分别占 3.3% 和 1.5%。该数据集还包含多样化的人体中心语义,包括注视(84.0%)、说话(79.3%)、行走(78.4%)、严肃表情(66.1%)、站立(58.5%)和坐姿(35.4%)。这些语义标签是非排他的,可能在同一样本中共现。总体而言,该数据集广泛覆盖了人体外观、姿态、表情、运动和交互模式,支持在多样化条件下的身份忠实生成。

第 19 页

G 补充说明

G.1 局限性与未来工作

尽管 Vera 提升了以人类为中心的 Subject-to-Video (S2V) 生成中的身份保持能力,但仍存在若干局限性。首先,当前框架主要支持图像参考和文本提示作为生成条件。这限制了其在需要更丰富控制信号的场景中的适用性,例如视频参考、音频线索、运动轨迹或 3D 空间信息。整合这些额外的模态可以为面部表情、身体运动、与语音相关的动态以及空间交互提供更明确的指导,从而实现更具可控性和真实感的人类视频生成。

其次,虽然 Vera 改善了多人场景中的身份-角色绑定,但扩展到包含更多人的场景仍然具有挑战性。随着参考身份数量的增加,模型必须在参考图像、文本角色、空间位置和时间轨迹之间维持更复杂的对应关系。拥挤的场景或视觉上相似的身份仍可能导致主体混淆或属性泄漏。

第三,我们当前的框架主要在短视频片段上进行评估。将身份忠实生成扩展到长视频仍然是一个开放性问题,因为微小的身份误差可能会随时间累积,并且模型必须在更长的时间上下文中保持一致的身份、角色和交互。

未来的工作将探索结合视频、音频、运动和 3D 线索的多模态条件输入,针对拥挤场景的更强人员级绑定机制,以及在较长持续时间下保持身份一致性的长视频生成策略。

第 20 页

生成一段视频,其中参考图像中的女性,现在头发梳成精致的发髻并用金色饰品固定,正在进行对话。她身处室内,背景是银色窗帘。她说话时先低头,然后抬起头,带着疑问的神情看向与她对话的人。

生成一段视频,展示参考图像中的男性站在阳光明媚的码头的一艘船上。他穿着一件未扣扣子的蓝色牛仔衬衫。他开始大笑,然后将一只手插入口袋,带着轻微的 smirk(坏笑)看向镜头。

一位年长的秃顶男性,留着灰色胡须并戴着眼镜,身穿深色西装,坐在一个装修考究、带有木质护墙板的办公室里。他手持一杯装有琥珀色液体的短玻璃杯,说话,然后将杯子举到嘴边饮用。

在一个光线昏暗的办公室里,参考图像中的女性,现在穿着灰色图案西装外套和黑色高领衫,站在办公桌后。她将双手放在面前的大纸箱上,然后抬起头,脸上露出担忧的表情。

一位身穿装饰性警服的秃顶黑人男性和一位留着红棕色头发、身穿灰色商务套装的女性在户外进行激烈的对话。他们站在一座大型建筑前的华丽金属栏杆旁。女性说话时情绪激动,用手势强调观点,而男性则靠在栏杆上倾听。

生成一段视频,展示两位中年女性在户外进行对话。将头发扎起、身穿黑底粉色波点衬衫的女性,认真地对留着短卷发、戴眼镜、身穿浅蓝色翻领衬衫的女性说话。穿蓝色衬衫的女性在回应前先倾听,随后带着会心的微笑回答。

图 6:Vera 的更多定性结果。每个案例包含输入参考图像、生成的视频帧以及对应的文本提示。前四行展示了在不同姿态、表情、动作和场景上下文下的单人生成。最后两行展示了多人生成,其中 Vera 在保持正确角色分配和交互一致性的同时保留了多个身份。这些例子证明了 Vera 生成身份忠实、时间连贯且与提示对齐的人体视频的能力。

第 21 页

(a) 身份对齐数据集中人口统计学属性的分布。 (b) 代表性以人为中心的动作、姿态和表情的频率。

图 7:身份对齐的人像-视频数据集的统计信息。该数据集包含 1,001,891 个样本,通过面部级别的身份聚类和跨片段参考检索构建,涵盖单人和多人场景。

发表评论