GraphVid:用交互图取代轨迹,实现高效可控视频生成

快速导读:核心差距在于,轨迹方法将运动视为几何位移,忽略了对象间的深层交互关系,而场景图虽能提供结构化推理,却未有效整合到视频生成中。

GraphVid提出了一种全新的可控视频生成范式,旨在解决现有轨迹基线方法在多对象交互场景中的扩展性差和数据依赖重的问题。该方法通过构建有向交互场景图,将复杂的运动控制转化为关系动态的建模任务。

核心贡献在于Edge-Aware Graph Reasoning模块,它通过边感知消息传递捕捉对象间的交互语义,并通过LoRA适配器高效集成到冻结的DiT骨干网络中。实验表明,GraphVid在保持生成质量的同时,显著降低了计算成本和训练数据需求。

英文题目:GraphVid: Interactive Graph-Controllable Video Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.21580

原始论文:PDF / 论文页面

对应视频标题:GraphVid:用交互图取代轨迹,实现高效可控视频生成|推荐指数:★★★★★

这篇论文解决什么问题?

当前可控图像到视频生成主要依赖轨迹条件(如Motion-I2V、Wan-Move)或物理感知信号(如WISA)。这些方法通常将运动视为几何位移,需要密集的运动标注,且在处理遮挡或重叠时容易产生物理上不合理的运动。

随着场景复杂度的增加,轨迹方法的计算开销急剧上升,且难以捕捉对象间的深层交互关系。场景图虽然提供了结构化的关系推理能力,但尚未有效整合到冻结的视频扩散骨干网络中用于交互控制。

GraphVid旨在填补这一空白,通过引入有向交互场景图,实现对多对象交互的精确、高效控制,同时避免了对大规模运动预测模块的依赖。

核心创新

方法概览

核心差距在于,轨迹方法将运动视为几何位移,忽略了对象间的深层交互关系,而场景图虽能提供结构化推理,却未有效整合到视频生成中。

  • GraphVid首先使用视觉语言检测器(Qwen3-VL)从输入图像构建有向交互场景图,识别实体及其交互关系。
  • Edge-Aware Graph Reasoning模块利用GINEConv编码节点和边语义,通过边感知消息传递生成交互感知嵌入。
  • 这些嵌入被映射为条件令牌,并通过LoRA适配器注入冻结的LTX-Video DiT骨干网络,实现参数高效的生成引导。
  • 该方法保留了预训练模型的生成先验,同时添加了关系动态控制能力,避免了全参数微调的高昂成本。
  • GraphVid-Bench数据集包含约27K个视频,提供结构化的交互图标注,用于训练和评估。
  • 模型支持用户通过交互图像直接修改交互关系,实现直观的多对象动态控制。

逐图理解论文

轨迹方法的困境

轨迹方法的困境
Fig. 9: Qualitative comparison on multi-object interaction control. Given an input image and user-specified interaction cues (left), different methods generate video sequences over time (center). Highlighted regions indicate common failure modes in prior approaches. In the ship scenario (top), baseline methods struggle to follow the specified motion directions or introduce artifacts, whereas GraphVid produces coherent diverging trajectories consistent with the interaction cues. In the jogging scenario (bot- tom), competing methods show unstable motion (e.g., subject disappearance, walking instead of jogging, or blur), while GraphVid maintains stable identities and consistent multi-entity dynamics.

现有轨迹基线如Wan-Move,在处理复杂交互时往往产生物理不合理的运动,且计算开销随场景复杂度急剧上升。

GraphVid的解决方案

GraphVid的解决方案
Fig. 3: GraphVid Edge-Aware Graph Reasoning. Node and edge embeddings are encoded into temporal latents and processed by our proposed edge-aware GNN that injects interaction semantics directly into message passing. The resulting graph embed- dings capture relational dynamics between entities and are mapped into conditioning tokens that modulate a frozen diffusion video backbone via LoRA adapters.

详解Edge-Aware Graph Reasoning模块:节点和边嵌入编码为时间潜变量,通过边感知GNN注入交互语义,生成图嵌入映射为条件令牌。此图揭示了关系动态建模的核心机制。

效率与质量的平衡

效率与质量的平衡
Figure 5 plots inference through- put against model scale. Beyond ac- curacy, GraphVid offers strong ef- ficiency advantages, achieving the fastest inference among all compared approaches at 200 seconds, signifi- cantly faster than Wan-Move (1800s), Tora (1200s), and WISA (1000s). This efficiency stems from our lightweight interaction graph conditioning and LoRA-based integration into the pre- trained DiT backbone, which avoids the need for heavy auxiliary motion encoders or large-scale motion pre- diction modules. This confirms that explicitly modeling interaction rela- tionships through a structured scene graph provides a powerful and efficient alternative to trajectory-based motion supervision. By leveraging interaction-aware graph reasoning, GraphVid achieves strong controllability and physical plausibility while operating with substantially lower compute and data.

效率对比图:气泡大小反映模型规模,GraphVid在推理吞吐量上最快(200秒),显著优于Wan-Move(1800秒)。此图强调了计算效率优势。

结论与局限

结论与局限
Fig. 11: Failure case: semantic grounding error for small symbolic objects. The user interaction specifies a rotational transformation applied to the “Zzz” symbol, indicating sleep (left). However, the detector fails to isolate the text as an indepen- dent node during scene graph construction. Consequently, the motion transformation is incorrectly applied to the dominant object (the bear), producing severe geometric distortion and unrealistic deformation across frames. This example highlights a limita- tion of current vision-language detection when grounding small semantic elements that lack strong visual salience.

失败案例:小符号对象('Zzz')检测失败,导致运动错误应用于主导对象(熊),产生几何失真。此图揭示了视觉显著性依赖的局限性。

实验如何设计?

  • 在MoveBench交互中心子集上进行定量比较,对比Wan-Move、Motion-I2V、Tora、MagicMotion、WISA和FlashMotion等基线。
  • 评估多对象复杂交互场景下的生成质量,关注结构连贯性和物理合理性。
  • 分析推理吞吐量和模型规模,评估计算效率。
  • 进行消融研究,包括骨干网络泛化(LTX vs Wan 2.2)、图稀疏性、条件模态和LoRA秩的影响。
  • 通过用户偏好研究评估生成视频的主观质量。

关键结果与论文证据

  • GraphVid在MoveBench上取得FID 17.02(p.10),优于Motion-I2V的28.32,显示更优的生成质量。
  • FVD为99.42(p.10),低于Motion-I2V的159.32,表明更好的视频连贯性。
  • PSNR为15.98(p.10),SSIM为0.61(p.10),均优于Motion-I2V,显示更高的重建保真度。
  • 推理时间为200秒(p.12),远快于Wan-Move的1800秒,体现显著的效率优势。
  • 可训练参数仅0.6B(p.10),相比Wan-Move的14.5B大幅减少,降低训练成本。
  • EPE为2.9(p.10),优于WISA的4.1,显示更精准的运动控制。
  • 用户偏好研究中,GraphVid在多个维度上获得最高选择率(p.24)。
  • 消融实验表明,完整的图条件(含边语义)优于仅节点特征或文本条件(p.14)。

阅读时需要注意

  • 对小符号对象(如缺乏视觉显著性的文本)的语义接地存在困难,可能导致运动应用错误(p.27)。
  • 当图上下文窗口过大时,由于填充导致的注意力稀释,性能会下降(p.13)。
  • 依赖视觉语言模型准确的初始对象检测和关系提取,检测错误会传播到图构建中。
  • 尽管效率高,但绝对质量指标(FID/FVD)仍高于Wan-Move等大型基线,存在效率与保真度的权衡。

关联工作

  • Wan-Move作为轨迹基线,具有更优的绝对指标但计算成本更高(p.2)。
  • Motion-I2V是轨迹基线,在效率和重建方面被GraphVid超越(p.2)。
  • WISA是物理感知文本条件基线,在关系控制方面被GraphVid超越(p.2)。
  • Tora和FlashMotion是轨迹导向的扩散Transformer基线(p.2)。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

GraphVid:交互式图可控视频生成

Vedant Shah1, Onkar Susladkar1, Tushar Prakash2, Kiet A. Nguyen1, Tianjiao Yu1, Adheesh Juvekar1, Muntasir Wahed1, 和 Ismini Lourentzou1

1伊利诺伊大学厄巴纳-香槟分校 2索尼印度研究院

{vrshah4,onkarks2,lourent2}@illinois.edu

手机握持的人(右) (2) 用户提供的提示: 人(左)触碰 (1) (3) (1) 人低头看手机并大笑。 (2) 人向另一个人靠近。 表面 购物袋 支付 联系 (3) 人看着另一个人手中的手机并微笑。 (4) 终端 (4) 人将手机移向支付设备进行触碰。 柜台 接触面 1 输入帧 2 场景图构建 3 用户与图像交互

手机 注视 微笑的人(右) 屏幕 显示 人(左) 靠近 触碰 支付设备 支付 触碰 购物袋 终端 柜台 表面 接触面 接触面 接触 4 编辑后的场景图 5 图条件生成的视频 2026 裙子 树枝(左) 镜子 用户提供的提示: (1) 人拉扯薄纱裙面料使其向外展开并向上扬起 支撑 女舞者 穿着 地板 上衣 (1) Jul 手持

裙子 树枝(左) 23 镜子 拉扯 支撑 女舞者 穿着 地板 上衣 4 编辑后的场景图 5 图条件生成的视频

图 1:GraphVid 通过交互图实现可控的多对象图像到视频生成。从输入帧开始,GraphVid 构建表示实体及其交互的场景图。用户可以直接通过图像交互修改这些交互,以指定所需的动态。编辑后的交互图随后被转换为条件标记,以引导冻结的视频扩散主干生成连贯的视频序列。

摘要。可控视频生成仍然具有挑战性,因为使用文本提示或主要约束像素运动的运动控制输入来指定精确的多对象交互很困难。在实践中,基于轨迹的控制通常要求用户为多个对象绘制准确的轨迹,这在场景复杂度高时扩展性差,并且在遮挡或重叠情况下变得模糊。为了实现灵活且精确的多主体控制,我们引入了 GraphVid,这是一种图条件图像到视频生成模型,通过结构化交互图实现交互式控制。我们还构建了 GraphVid-Bench,这是一个大规模以交互为中心的视频数据集,具有结构化关系注释,用于训练交互感知视频生成模型。尽管使用的训练数据量和可训练参数数量远少于先前的运动控制方法,GraphVid 仍提供了强大的可控性和视频质量。与 Motion-I2V 相比,GraphVid 将 FID 降低了高达 39.9%,将 FVD 降低了 37.6%,同时将 PSNR(9.87→15.98)和 SSIM(0.38→0.61)提高了。我们的

第 2 页

V. Shah 等人

结果突显了结构化语义接口作为可控视频生成强大范式的潜力。 PLAN Lab https://plan-lab.github.io/graphvid

关键词:可控视频生成 · 场景图

1 引言

图像到视频(I2V)生成在生成建模领域吸引了越来越多的关注 [5, 34, 42, 43, 45]。给定单张图像,目标是合成在保持视觉身份的同时产生逼真运动的时序连贯视频。该任务本质上具有挑战性,因为模型必须从单个静态帧中推断出合理的时序动态,而其中的运动、交互和物理演化本质上是模糊的。因此,生成既在时序上一致又在物理上合理的视频仍然很困难。

近期关于可控 I2V 生成的工作主要集中在基于轨迹的运动控制 [8,29,42,53]。Motion Prompting [10]、Wan-Move [8]、MagicMotion [32] 和 Motion-I2V [42] 等方法使用显式运动信号(包括点轨迹、光流、分割掩码或稀疏边界框)来引导基于扩散的视频模型。这些信号被转换为密集的运动表示,并通过 ControlNet [58] 适配器、潜在特征操作或运动感知注意力等机制注入生成骨干网络,从而在保持外观的同时实现用户指定的对象和相机运动。其中,Wan-Move 通过直接修改大规模 Diffusion Transformer (DiT) [37] 模型的潜在条件特征并在数百万视频上进行训练,实现了强大的性能,提高了运动保真度和泛化能力。然而,这些方法主要将运动视为几何位移,忽视了支配对象动态的物理原因。为了解决这一问题,少数物理感知方法引入了基于力或速度场的控制信号来建模对象交互 [12,39],联合建模视觉和潜在物理动态 [41],或通过物理感知注意力注入文本描述、定性类别和定量物理属性等结构化物理知识 [49]。

尽管取得了近期进展,现有的可控视频生成方法在建模场景动态方面仍然有限:(1) 当前的物理感知方法引入了基于力、速度或结构化物理注释的控制信号 [12,39,49]。然而,这些方法通常将物理编码为低级控制场或预定义类别,这限制了它们在开放域场景中表示多个实体之间复杂交互的能力。(2) 基于低级几何线索进行条件控制的方法在多对象场景中可能使控制变得繁琐,因为用户必须为每个对象编写准确的信号,且少数控制中的微小错误会导致全局不合理的运动(例如,接触不一致、滑动、穿透或行为不同步)。(3) 此外,基于轨迹和基于物理条件的方法都严重依赖包含密集运动注释、轨迹、光流或物理标签的大规模精心策划的数据集,这些数据集的获取成本高昂

第 3 页

GraphVid:交互式图可控视频生成 3

且难以在不同环境中扩展。例如,Wan-Move [8] 在 200 万样本上训练,Motion Prompting [10] 使用 220 万样本,Motion-I2V [42] 在 1000 万样本上训练。这种依赖性限制了现有可控视频生成管道的实用性和泛化能力。

为了解决这些局限性并实现灵活的交互式多对象控制,我们引入了 GraphVid,这是一个图条件图像到视频生成框架,通过有向交互场景图来表示运动控制。从输入图像开始,GraphVid 在检测到的实体上构建场景图,其中关系边描述交互(图 1)。用户直接与图像交互以指定所需的动态,然后编辑后的交互图被转换为条件标记,以指导冻结的视频扩散主干生成连贯的视频序列。为了建模由交互驱动的动力学,我们引入了 Edge-Aware Graph Reasoning,它根据有向边属性对消息传递进行条件化,使得对象表示在映射到扩散条件之前明确反映其关系角色。通过将这种表示注入预训练的视频 DiT 模型,并在注意力层中使用 LoRA 模块,模型利用其自身的生成先验来动画化场景,同时尊重指定的交互结构,从而实现更直观和交互式的运动控制机制。为了支持训练,我们构建了 GraphVid-Bench,这是一个以交互为中心的数据集,包含约 27K 个视频片段及其对应的显式交互图。尽管参数量减少了约 24 倍且训练数据大幅减少,GraphVid 仍达到了与最先进运动控制视频生成方法相竞争的性能,显著提高了感知质量和重建保真度,与 Motion-I2V 相比,FID 降低了高达 39.9%,FVD 降低了 37.6%,同时 PSNR 从 9.87 提升至 15.98,SSIM 从 0.38 提升至 0.61。我们的贡献如下:

• 我们提出了 GraphVid,据我们所知,这是第一个通过从单张图像构建的有向交互场景图实现多对象动力学交互控制的框架。GraphVid 的图到标记条件接口使用参数高效的 LoRA 适配将交互感知表示注入冻结的视频扩散 Transformer,从而在不降低预训练生成先验的情况下实现结构化控制。

• 我们引入了 Edge-Aware Graph Reasoning 模块,该模块根据有向边属性对图消息传递进行条件化,使模型表示能够捕捉复杂的多对象关系以及跨多个实体的交互驱动运动传播。

• 我们整理了 GraphVid-Bench,这是一个高质量的以交互为中心的视频生成数据集,包含约 27K 个视频片段及其对应的结构化交互图,以支持关系视频控制的训练和评估。

• 尽管仅需 0.6B 可训练参数并实现了竞争方法中最快的推理速度,GraphVid 在感知和重建指标上均带来了显著的质量提升。与 WISA(以物理为中心的文本来输入)相比,FID 降低了 34.5%(25.98 → 17.02),FVD 降低了 7.8%(107.89 → 99.42),PSNR 提高了 5.9%(15.08 → 15.98),SSIM 提高了 15.0%(0.53 → 0.61),并优于基于轨迹的基线方法

第 4 页

4 V. Shah 等人

例如 Tora(FID −30.3%,FVD −10.0%,PSNR +41.7%,SSIM +12.9%)和 Motion-I2V(FID −39.9%,FVD −37.6%,PSNR +61.9%,SSIM +60.5%)。

2 相关工作

视频生成。生成建模领域的最新进展显著提高了视频生成系统的质量和规模 [4,48,56]。早期方法使用 U-Net 骨干网络和时序模块将图像扩散模型扩展到时序域,以捕捉运动动态 [14, 15]。随后的工作引入了潜在视频扩散和运动条件架构,以提高时序一致性和可扩展性 [22, 55]。最近,大规模扩散 Transformer(DiT)已成为高质量视频合成的主导架构。CogVideoX [56] 和 Wan [48] 等模型表明,扩展基于 Transformer 的扩散模型能够实现长程时序连贯性并提高视觉保真度。最近的工作从这些强大的预训练视频骨干网络出发,添加少量可训练参数以注入所需的控制信号,同时保留骨干网络的生成先验 [8,31,42,52]。这一趋势既反映了计算资源的限制,也反映了实证观察结果,即大规模骨干网络已经编码了丰富的外观和时序动态 [10,12,29,40,44]。GraphVid 遵循这一范式,保持视频骨干网络冻结,并学习轻量级模块,将结构化交互线索映射为生成的条件令牌。

可控视频生成。虽然通用视频生成模型可以合成逼真的视频,但控制生成内容仍然是一个重大挑战。早期的可控生成方法引入了姿态、深度或运动轨迹等条件信号来引导视频合成 [10,29, 42]。其他工作探索了基于编辑的流水线,在保持时序一致性的同时修改现有视频 [11, 28, 33]。最近的方法侧重于集成结构化条件信号或中间表示,以实现更精确的控制。例如,模型可以对空间布局 [18, 50]、运动场 [29, 42] 或对象轨迹 [53, 57] 进行条件控制,以引导生成,同时保持与预训练视频骨干网络的一致性。尽管这些方法性能强劲,但基于轨迹的方法严重依赖密集的点跟踪监督 [24],这使得它们数据密集且难以扩展到更高层级的关系推理以及对象之间的复杂交互。相比之下,我们提出了 GraphVid,它将交互表示为有向场景图,并使用边缘感知 GNN 显式地对多对象控制进行建模,以生成更合理且物理上一致的视频。

用于视觉生成的场景图。场景图提供了场景中对象及其关系的结构化表示,已被广泛用于图像理解和生成 [7, 9, 25, 30]、3D 场景理解 [1,36,47]、组合和常识推理 [20,26] 等,使模型能够推理组合结构和对象交互。最近的图到视频公式支持从以对象为中心的交互图进行组合生成 [3]。相比之下,GraphVid 针对交互式控制

第 5 页

GraphVid:交互式图可控视频生成 5

初始图构建 [ { 初始图 "src": "fairy_woman", 对象 MLLM "tgt": "left_wing", 右翼 左翼 检测器 身体 根 "rel": "body root support" 支撑 身体 根 }, 支撑 { 仙女 woman "src": "fairy_woman", 表面接触 表面支撑接触 "tgt": "right_wing", 支撑 仙女 woman 左翼 右翼 华丽珠宝 耳环 关系 "rel": "body root support" 提取 华丽珠宝 耳环 提示 }, { … Qwen3-VL 边界框 Qwen3-VL 交互式编辑 池化 MLLM 图像编码器 归一化 文本嵌入 编辑后的图 前向 深度 提示 交互 左翼推进,头部 右翼 “女人移动 旋转 身体 根 身体 支撑 根 靠近她 旋转 面向观众头部。” 支撑 仙女 woman 表面接触 “耳环摇摆 惯性摆动 支撑 跟随头部旋转 张力 特征图 耳环 动量。” 节点嵌入 Qwen3-VL 文本嵌入 边嵌入 图 2:GraphVid 概览。从输入图像中,检测对象并将其编码为节点嵌入,同时 MLLM 提取关系边以构建初始交互图。边缘感知图推理将节点和边表示转换为条件标记,以指导冻结的视频扩散 Transformer 生成符合交互一致性的视频动态。

具有交互基础的图,并学习轻量级模块,将图线索转换为与视频生成骨干网兼容的条件标记,从而在保留骨干网强大先验的同时实现结构化控制。

3 方法

我们提出 GraphVid,这是一个从单个条件图像进行可控图像到视频(I2V)生成的框架。核心思想是将用户意图表示为场景中实体的结构化交互图,并通过轻量级的图到标记适配器以及基于 LoRA 的条件机制,将该图与大型预训练视频扩散 Transformer 接口连接。通过保持骨干网冻结并仅学习小型模块,GraphVid 在保留预训练模型强大生成先验的同时,引入了结构化、以对象为中心的控制。图 2 展示了概览。 给定条件图像 $I_0$,我们的目标是生成遵循用户指定的一组对象交互的视频序列 $\{I_t\}_{t=1}^T$。为了以组合方式表达场景动态,我们构建一个带属性的有向交互图 $G = (V, E)$,其中每个节点 $v_i \in V$ 对应于在 $I_0$ 中检测到的实体,每条有向边 $e_{ij} \in E$ 编码从对象 $i$ 到对象 $j$ 的关系类型 $r_{ij} \in R$(例如,推、拉、举、持),描述实体如何相互影响,以及可选的定性物理线索(例如,粗略的方向和大小),允许用户以直观的 relational 术语描述场景动态。涉及单个实体的单向指令表示为自环边 $e_{ii}$(例如,旋转、移动、缩放)。我们旨在学习一个条件视频生成器,以建模 $p(I_{1:T} | I_0, G)$,其中 $I_{1:T} = \{I_t\}_{t=1}^T$ 表示生成的 $T$ 帧。

第 6 页

6 V. Shah 等

图条件视频生成

节点 时间 时间 节点 线性 嵌入 卷积 池化 潜在变量

GINEConv ReLU GINEConv ReLU

边 时间 时间 边 线性 嵌入 卷积 池化 潜在变量 边感知 GNN

图构建 节点嵌入 边感知 MLP 输入帧 & 编辑 边嵌入 GNN

VAE … VAE 视频帧 编码器 解码器 加噪 LTX LoRA 图 3: GraphVid 边感知图推理。节点和边嵌入被编码为时间潜在变量,并由我们提出的边感知 GNN 处理,该网络将交互语义直接注入消息传递过程。生成的图嵌入捕捉实体间的关系动态,并被映射为条件标记,通过 LoRA 适配器调节冻结的扩散视频主干网络。

节点表示。我们使用预训练的多模态检测器从输入帧 $I_0$ 中提取对象实体。对于每个检测到的对象 $v_i$,我们通过融合以下特征构建统一特征向量:(i) 视觉嵌入 $f_i^{vis} \in \mathbb{R}^{d_v}$,通过对对象边界框 $b_i$ 内的 $I_0$ 区域进行编码并池化所得特征获得;(ii) 文本嵌入 $f_i^{txt} \in \mathbb{R}^{d_t}$,用于编码对象标签。归一化的边界框坐标 $b_i \in \mathbb{R}^4$ 与这些嵌入拼接,形成表示 $x_i = [f_i^{vis} \| f_i^{txt} \| b_i]$,该表示共同捕捉对象外观、语义身份和空间定位。

边表示。每条有向边 $e_{ij}$ 由描述源实体和目标实体之间预期交互的开放词汇文本描述符表示。边使用文本嵌入模型进行编码,以获得边特征 $e_{ij} \in \mathbb{R}^{d_e}$。

3.1 边感知图推理

标准 GCN 将边视为二元连通信号,主要在图上传播节点特征 [17, 27]。然而,在物理交互建模中,对象之间的关系类型直接决定了它们的运动动态,并暗示了根本不同的运动模式和因果效应。忽略这些关系属性会将图简化为简单的空间邻接,并阻止模型推理交互如何影响对象行为。为了解决这个问题,我们采用边感知图同构网络 (GINEConv [54]),在消息传递过程中显式地融入边语义。如图 3 所示,节点和边特征首先被投影到共享隐藏空间 $h_i^{(0)} = \phi_n(x_i), a_{ij} = \phi_e(e_{ij})$,其中

第 7 页

GraphVid:交互式图可控视频生成 7

$\phi_n$ 和 $\phi_e$ 是可学习的 MLP,将节点/边特征映射到公共嵌入空间 $\mathbb{R}^{d_h}$。随后,我们应用 $L$ 层 GINEConv 以在图中传播关系信息

\begin{equation} \mathbf{h}_i^{(l+1)} = \text{MLP}^{(l)}\left(\sum_{j\in\mathcal{N}(i)}\text{ReLU}(\mathbf{h}_j^{(l)}\mathbf{a}_{ji})\right) \end{equation}

与标准 GCN 不同,GINE 公式将边属性直接注入聚合步骤,使交互语义能够影响节点更新。因此,每个节点表示不仅取决于相邻对象,还取决于支配其交互的物理关系。经过 $L$ 层后,我们获得交互感知节点嵌入 $\mathbf{h}_i \in \mathbb{R}^{d_h}$,其中编码了对象身份及其在场景中的动态关系状态。这些嵌入为下游生成模型提供了关于哪些实体应移动以及它们如何交互的结构化表示,从而实现更具物理一致性的视频生成。

3.2 图到视频适配器

在大规模视频数据集上训练的现代扩散 Transformer(DiT)为视频生成提供了强大的时空先验 [35, 56]。从头训练此类模型计算成本高昂,且可能损害从大规模数据中学到的丰富生成能力。因此,我们利用预训练的 DiT 主干 [16] 并保持其冻结,引入一个轻量级适配器,将图嵌入转换为与 Transformer 输入空间兼容的条件标记。

因此,每个交互感知节点嵌入 $\mathbf{h}_i$ 被投影到 Transformer 潜在空间作为 $\mathbf{z}_i = \text{MLP}(\mathbf{h}_i) \in \mathbb{R}^{d_l}$,其中 $d_l$ 表示预训练 DiT 的隐藏层大小。每个 $\mathbf{z}_i$ 被视为语义条件标记。由于场景包含不同数量的对象,节点序列被填充至最大长度 $N_{\max}$。生成的标记与边文本标记拼接后,作为编码器隐藏状态传递。这使得 Transformer 的自注意力能够推理实体交互,并在生成过程中将图结构转化为运动。

3.3 训练目标

由于预训练 DiT 主干保持冻结以保留其强大的生成先验,模型需要一种轻量级机制以适应新的图条件模态。因此,我们在每个 Transformer 块的 Q、K、V 和输出投影层中注入低秩自适应(LoRA)[21] 模块。调节这些注意力投影允许模型将图标记纳入注意力计算,同时仅引入少量可训练参数。这使得 Transformer 能够在不修改预训练权重的情况下关注交互感知图嵌入。

第 8 页

8 V. Shah 等

我们使用预训练扩散模型采用的流匹配目标来训练 GraphVid。给定目标视频 $x_0$,我们将其编码到潜在空间,并从对数正态分布中采样时间步 $t \sim p(t)$。然后添加噪声以获得含噪潜在变量 $x_t$。模型通过以下损失函数进行优化:

\begin{equation} \mathcal{L}_{\mathrm{CFM}}(\theta) = \mathbb{E}_{t \sim p(t)} \mathbb{E}_{\mathbf{x}_0 \sim p_{\mathrm{data}}(\cdot)} \mathbb{E}_{\mathbf{x}_1 \sim p_{\mathrm{data}}(\cdot)} \left\| \mathbf{v}_\theta(\mathbf{x}_t, t, \mathbf{c}) – (\mathbf{x}_1 – \mathbf{x}_0) \right\|^2 \tag{2} \end{equation}

其中 $x_t = (1 – t)x_0 + tx_1$。在训练过程中,仅更新 GNN 参数、Graph-to-Adapter MLP 层和 LoRA 模块(作为 $\theta$),而 VAE 和 DiT 主干网络保持冻结。这种设计使得能够从交互图端到端地学习可微的交互式/符号到潜在空间的映射以生成视频动态,同时保留预训练模型的生成能力。

4 GraphVid-Bench 数据集

当前的视频生成基准主要依赖文本提示 [23] 或低级运动线索 [8],这提供了对物体级交互的有限控制。然而,许多现实世界的动态本质上是关系性的,其中动作源于实体之间的相互作用方式(例如,人转头,物体相对于其周围环境移动)。为了实现对这类动态的结构化控制,我们引入了 GraphVid-Bench,这是一个将视频与描述实体及其有向交互线索的交互图配对的数据集。GraphVid-Bench 包含

表 1:GraphVid-Bench 统计信息 大约 27K 个精心策划的以交互为中心的视频片段。交互复杂性突显了多实体动态的普遍性。 为确保训练和评估的一致性,所有片段均标准化为 16 fps 下的 81 帧。 指标 均值 中位数 标准差 节点/图 7.76 5.0 8.03 边/图 4.85 4.0 3.46 交互复杂性 无交互 (N=0) 3881 单交互 (N=1) 10982 多交互 (N>1) 12641

每个视频都与一个有向交互图配对,其中节点表示场景实体,边编码它们之间的交互线索。节点属性包括视觉特征、语义标签和空间信息,而边捕捉影响场景动态的交互类型和方向。如表 1 所示,该数据集表现出多样化的结构复杂性,平均每张图有 7.76 个节点和 4.85 条边。总计,10,982 个样本包含单个交互,12,641 个样本包含多个交互 (N > 1)。如图 4 所示,GraphVid-Bench 涵盖了广泛的典型物理交互。共现统计进一步揭示,许多交互在同一片段中共同出现,表明现实世界的动态经常涉及多个相互作用的基元。我们还包含了 3,881 个没有显式交互 (N = 0) 的样本。这些场景包含自然的物体运动,没有直接的实体间交互,为学习通用视频动态提供了基线。由于 GraphVid 允许

第 9 页

GraphVid:交互式图可控视频生成 9

持有 40,466 持有 推 101) 32,849 推 支撑 + 拉 4,281 拉 提 2,651 提 8 压 1,251 旋转压缩 987 碰撞静止 计数 够 625 压 6 压缩 旋转 2,268 交互类别 滑 945 滑 力与操控 站 690 动 运动学 & 运动 反射 滚 561 物理接触 动 4 落 554 支撑 & 位置 够 放置 455 游 2 滚 走 437 落 碰撞 Log(共现 2,035 游 反射 813 走 0 支撑 21,864 静止 1,393 866 站 放置 581 104 105 103 持有推支撑拉提旋转碰撞压缩静止压滑站反射动够放置滚游落走 频率 (对数尺度) (a) 交互类型分类法。 (b) 共现统计。 图 4:GraphVid-Bench 数据集中的交互统计。(a) 交互原语频率,分为四类(力与操控、运动学 & 运动、物理接触、支撑 & 位置)。(b) 交互共现矩阵捕捉在同一视频序列中共同出现的交互原语。操控与运动原语的共现表明,现实世界动力学本质上具有组合性,这促使我们使用结构化交互图进行可控视频生成。

使用户能够在推理时添加交互边,此类样本有助于模型学习当引入新交互时场景行为的变化。附录 A 提供了数据集构建过程的更多细节。

5 实验

5.1 实现细节

GraphVid 利用预训练的 LTX-Video [16] Diffusion Transformer (DiT) 作为视频生成的骨干网络。在训练过程中,DiT 骨干网络和 VAE 编码器–解码器保持冻结。对象实体使用 Qwen3-VL [2] 从条件图像中提取。对于每个对象,我们通过对对象裁剪区域进行均值和最大池化获得 dv = 8192 维的视觉嵌入,获取对象标签的 dt = 2560 维文本嵌入,以及归一化的边界框坐标。这些特征拼接形成 dn = 10756 维的节点特征向量。对象之间的物理交互使用 Qwen3-Embedding [59] 进行编码,产生维度为 de = 2560 的边属性。在 Edge-Aware Graph Reasoning 过程中,节点和边特征被投影到隐藏维度 d = 512,产生感知交互的节点嵌入。节点嵌入通过 MLP 投影到 LTX 变换器的隐藏大小,将 512 维图嵌入映射到 4096 维。目标视频使用预训练的 VAE 编码到潜在空间,并在从逻辑正态分布采样的时间步注入噪声。我们采用秩为 128 的 LoRA 模块。在训练过程中,仅更新 GNN 参数、图到适配器投影层和 LoRA 权重。

第 10 页

10 V. Shah 等

表 2:在以交互为中心的 MoveBench 子集上的定量比较。GraphVid 在所有指标上均取得了具有竞争力的性能,同时使用了显著更少的参数和训练数据。最佳和第二佳结果已高亮显示。

方法 | 训练数据 | 可训练参数 (B) | 推理时间 (s)↓ | FID↓ | FVD↓ | PSNR↑ | SSIM↑ | EPE↓ —|—|—|—|—|—|—|—|— Wan-Move [8] | 2M | 14.5 | 1800 | 15.56 | 82.17 | 17.21 | 0.61 | 2.6 Motion-I2V [42] | 10M | 1.2 | 790 | 28.32 | 159.32 | 9.87 | 0.38 | 3.9 Tora [60] | 630K | 5 | 1200 | 24.45 | 110.47 | 11.27 | 0.54 | 3.3 MagicMotion [32] | 23K | 1.5 | 750 | 26.57 | 105.12 | 12.04 | 0.51 | 3.2 WISA [49] | 80K | 1 | 1000 | 25.98 | 107.89 | 15.08 | 0.53 | 4.1 FlashMotion [31] | 23K | 13 | 677 | 19.02 | 104.12 | 14.04 | 0.56 | 3.8 GraphVid (Ours) | 27K | 0.6 | 200 | 17.02 | 99.42 | 15.98 | 0.61 | 2.9

5.2 实验设置

在评估方面,我们建立了一个专注于以交互为中心场景的 MoveBench [8] 子集,作为主要评估套件。由于 GraphVid 强调基于物理的相对控制,而非显式的像素级运动监督,因此我们优先考虑评估整体视频质量、时间连贯性和结构保真度的指标。此外,我们在仅包含多对象交互场景的蒸馏 MoveBench 子集上评估性能,从而使我们能够评估 GraphVid 在需要推理多个实体之间交互的更复杂设置中的有效性。我们报告 Frechet 视频距离 (FVD) [46]、Frechet Inception 距离 (FID) [19]、峰值信噪比 (PSNR) 和结构相似性指数 (SSIM) [51] 以衡量视觉质量。我们还报告端点误差 (EPE) [10],即预测光流与真实光流之间的平均位移,该指标直接衡量生成的运动是否遵循预期的交互。更多细节见附录 B。

5.3 定量结果

表 2 在交互为中心的 MoveBench 基准子集上将 GraphVid 与现有的可控视频生成方法进行了比较,其中 GraphVid 在所有指标上均取得了具有竞争力的性能,同时所需的训练样本显著减少,可训练参数大幅减少,且推理速度更快。在现有方法中,WISA [49] 是最相关的方法,它明确地将结构化物理知识纳入视频生成过程。与 WISA 相比,GraphVid 在感知质量和重建保真度方面取得了显著改进。具体而言,GraphVid 将 FID 从 25.98 降低至 17.02,将 FVD 从 107.89 降低至 99.42,分别提升了 34.5% 和 7.8%,表明其具有显著更好的视觉真实感以及与真实视频分布的对齐能力。同样,SSIM 提升了 15.0%,PSNR 提升了 5.9%,证明了我们基于图的交互建模产生的帧既更清晰,结构上也更一致。这一优势在运动准确性方面同样成立,GraphVid 将 EPE 从 4.1 降低至 2.9,相比 WISA 提升了 29.3%,并取得了

第 11 页

GraphVid:交互式图可控视频生成 11

表 3:在以交互为中心的 MoveBench 上的多目标定量比较。与更大的基线模型相比,GraphVid 保持了强大的结构一致性。最佳和次佳结果已高亮显示。

| 方法 | 训练数据 | 可训练参数量 (B) | FID↓ | FVD↓ | PSNR↑ | SSIM↑ | EPE↓ | | :— | :— | :— | :— | :— | :— | :— | :— | | Wan-Move [8] | 2M | 14.5 | 31.29 | 252 | 16.69 | 0.61 | 2.2 | | Tora [60] | 630K | 5 | 56.04 | 369 | 14.98 | 0.52 | 3.5 | | WISA [49] | 80K | 1 | 60.12 | 341 | 13.13 | 0.55 | 3.9 | | FlashMotion [31] | 23K | 13 | 55.03 | 311 | 12.12 | 0.52 | 3.9 | | GraphVid (Ours) | 27K | 0.6 | 49.45 | 291 | 14.44 | 0.55 | 3.0 |

在所有可比规模的模型中,GraphVid 取得了最低的 EPE。由于 EPE 衡量生成光流与真实值之间的接近程度,这表明我们的图条件生成的运动最忠实地遵循了指定的交互关系。整体感知、重建和运动方面的提升表明,通过有向场景图显式建模交互关系,为可控视频生成提供了比依赖预定义文本(以物理为中心)属性更强的归纳偏置。

我们进一步与基于轨迹的控制方法(如 Motion-I2V [42]、MagicMotion [32]、FlashMotion [31] 和 Tora [60])进行了比较。这些方法严重依赖显式运动信号,如轨迹、光流或分割掩码。与 Motion-I2V 相比,GraphVid 将 FID 降低了 39.9%(28.32 → 17.02),将 FVD 降低了 37.6%(159.32 → 99.42),同时将 PSNR 从 9.87 提升至 15.98,SSIM 从 0.38 提升至 0.61,表明帧重建质量和感知保真度显著改善。与最近的基于轨迹引导的视频生成方法 FlashMotion 相比,GraphVid 将 FID 降低了 10.5%(19.02 → 17.02),同时实现了更强的重建质量,将 PSNR 从 14.04 提升至 15.98,SSIM 从 0.56 提升至 0.61。与 MagicMotion 相比,GraphVid 将 FID 降低了约 36%(26.57 → 17.02)并改善了时间一致性。值得注意的是,GraphVid 取得了比所有可比基于轨迹的方法更低的 EPE(Motion-I2V 为 3.9,FlashMotion 为 3.8,Tora 为 3.3,MagicMotion 为 3.2),在不依赖任何显式运动监督的情况下,将运动误差降低了 9.4–25.6%。这些改进突显了通过结构化交互推理来建模场景动态的有效性。

Wan-Move [8] 凭借其显著更大的规模实现了最佳绝对指标,它在约 200 万视频上进行了训练,并使用 145 亿参数的骨干网络。相比之下,GraphVid 仅使用 6 亿可训练参数,并在规模小得多的 2.7 万以交互为中心的数据集上进行训练。尽管使用的训练数据少约两个数量级,模型参数少约 24 倍,GraphVid 仍取得了具有竞争力的性能,在重建和运动准确性方面优于大多数先前的可控方法。

在表 3 中也可以观察到类似趋势,该表评估了 MoveBench 多目标子集上的性能,在这些场景中,交互推理变得尤为重要。在这些场景下,与其他轻量级基线模型相比,GraphVid 在多目标交互质量方面有所提升,表现出明显的相对优势,同时使用了显著更少的资源。当与数据量相似的模型相比时

第 12 页

12 V. Shah 等

在规模上,GraphVid 取得了最佳的 FID(49.45),比次优方法(FlashMotion,55.03)提升了 10.1%,并取得了最佳的 FVD(291),比次优方法(FlashMotion,311)提升了 6.4%;这两项指标均表明其在多实体动态中具有更好的感知真实性和时间一致性。GraphVid 还在可比规模的方法中实现了最低的 EPE,证实了其运动精度优势在更困难的多目标设置中得以延续。在重建保真度方面,GraphVid 与 Tora(最佳 PSNR)和 WISA(最佳 SSIM)保持竞争力。重要的是,这些增益是在更小规模下实现的。GraphVid 仅使用 0.6B 可训练参数(比 FlashMotion 少约 21.7 倍,比 Tora 少 8.3 倍),并在 27K 个片段上进行训练(与 FlashMotion 相当,比 Tora 少 23 倍),这强调了交互图条件提供强大的多目标连贯性,而无需庞大的模型或数据。附录 C 展示了我们在以交互为中心的 DAVIS [38] 子集上的额外结果。

5.4 效率与可扩展性分析

图 5 绘制了推理吞吐量与模型规模的关系。除了准确性,GraphVid 还提供了显著的效率优势,以 200 秒的速度实现了所有对比方法中最快的推理速度,显著快于 Wan-Move(1800 秒)、Tora(1200 秒)和 WISA(1000 秒)。这种效率源于我们轻量级的交互图条件以及基于 LoRA 集成到预训练 DiT 主干网络中,这避免了对重型辅助运动编码器或大规模运动预测模块的需求。这证实了通过结构化场景图显式建模交互关系,为基于轨迹的运动监督提供了一种强大且高效的替代方案。通过利用交互感知图推理,GraphVid 在显著降低计算和数据需求的同时,实现了强大的可控性和物理合理性。

5.5 定性分析

图 6 展示了代表性的定性结果,表明通过 GraphVid 交互图对场景动态进行建模,能够实现对复杂多实体运动的精确且可解释的控制。示例展示了多种交互类型,包括物体-物体交互、人-物体交互以及人体关节运动。在所有场景中,GraphVid 均保持了物体身份和场景外观,并产生了真实的运动轨迹

第 13 页

GraphVid:交互式图可控视频生成 13

输入图像 + 用户交互 生成的视频 交互上下文帧 1. 用户上下文:最远端的鹅 1. 向靠近树木的鹅移动。 2. 2. 用户上下文:鹅向前行走, 踩在树周围的覆盖物环上。

1. 用户上下文:人试图用腿 踢球,但险些未碰到球。 1. 与球接触。

1. 用户上下文:人蹬 2. 自行车向前移动。 1. 2. 用户上下文:人将头 转向右肩片刻。 1. 用户上下文:手将杯子 向后倾斜一点,以展示杯中的 1. 2. 液体。 2. 用户上下文:手握住 杯柄并辅助支撑倾斜动作。 图 6:GraphVid 在基于可控交互的视频生成中的定性结果。给定单张输入图像和用户指定的交互上下文, GraphVid 生成反映所需动态的时间连贯视频序列。示例包括物体间交互(鹅之间的相对移动)、 人与物体交互(踢球、拿杯子)以及关节运动(骑行)。生成的序列展示了 一致的运动、物体保持以及对用户指定交互动态的忠实执行。

以及符合交互的行为,并保持背景几何结构的稳定。 这些示例表明,交互图接口有助于模型 将运动绑定到正确的实体上,并将多个原语组合成连贯的 多步动态,而仅基于文本或轨迹的控制通常对此较为脆弱。附录 D 展示了人类偏好研究,而 附录 E 提供了 diverse 交互场景下的定性结果。

5.6 消融研究

骨干网络泛化。为了验证关系场景图作为一种 通用的条件模态,而非对 LTX 特定潜在先验的利用, 我们将 2B LTX 表 4:骨干消融。 骨干替换为 5B Wan 骨干 网络 FID↓ FVD↓ PSNR↑ SSIM↑ EPE↓ 2.2 模型 [48]。在使用此变体进行训练时,我们的边 ours + LTX 17.02 99.42 15.98 0.61 2.9 感知 GNN 和适配器成功地将拓扑图映射到 Wan 的 ours + Wan 2.2 17.29 100.01 15.70 0.60 3.1 潜在空间中,取得了具有竞争力的性能(表 4)。这表明 我们的图表示是一种骨干无关的条件信号,能够 在不同基础模型上引导场景动态。

图稀疏性与注意力 表 5:图消融。 稀释。我们评估上下文窗口大小对 DiT 的 自注意力机制的影响,通过改变 最大节点容量。如 表 5 所示,将稀疏的真实 10 17.25 102.04 15.56 0.60 世界场景图填充到过大 30 17.02 99.42 15.98 0.61 50 17.17 104.97 15.11 0.60 128 17.55 105.45 14.55 0.59 256 17.97 109.92 13.77 0.57

第 14 页

14 V. Shah et al.

上下文窗口可能会稀释注意力并降低生成质量。将图大小限制在 30 个节点始终优于更大的容量(128/256),并取得了最佳的 FVD(99.42)。这表明空间上更紧凑、更密集的节点集能产生更好的结构对齐:随着最大节点预算的增加(例如从 30 → 256),FID 恶化,这可能是因为额外的容量被零填充所主导,而非提供信息性结构。由此产生的填充 token 向注意力中注入噪声并稀释有意义的关系线索,使得 Transformer 更难集中于活跃交互。总体而言,这些结果表明平衡且密集填充的图表示提供了最强的条件信号,因此 GraphVid 在所有实验中使用 30 的最大节点容量。

条件模态与边语义。为了评估结构化条件和边语义的重要性,我们执行了一次推理时的消融实验,比较三种不同的模式。表 6 显示了 (1) 标准的 LTX 基线,它使用全局文本提示和初始图像生成视频;(2) 基于图像和仅拓扑图的 GraphVid 条件,其中用户提供交互箭头和叠加层,但省略了文本边上下文;以及 (3) 我们完整的 GraphVid 方法,利用图像和配备每个交互边显式文本上下文的完整图。虽然基于文本的基线实现了适度的视觉质量,但它难以将局部运动绑定到特定实体上(FID 20.04)。用我们的仅拓扑图替换全局文本将 FID 改善至 17.52,表明显式绘制空间边界有助于运动定位。然而,缺乏文本交互嵌入的语义丰富性,模型表现出严重的运动歧义,无法区分“推”和“拉”等相反交互。完整的图条件优于两种基线,将 FID 降低至 17.02,FVD 降低至 99.42。这些结果表明,仅图拓扑提供了有用的空间定位,而语义边标签提供了额外的交互意图,有助于消除对象关系的歧义并改善运动生成。

LoRA 秩与容量权衡。我们将低秩适配 (LoRA) 矩阵注入 Transformer 块中,以利用我们的图条件调节预训练权重。在此消融实验中,我们研究了 LoRA 秩对生成质量和重建保真度的影响。如表 7 所示,增加秩在所有指标上均一致地提升了性能。将秩从 16 增加到 128 使 FID 从 18.34 降低至 17.02(–7.2%),FVD 从 103.18 降低至 99.42(–3.6%),表明感知质量和时间连贯性更好。同时,重建

表 6:条件模态。 变体 FID↓ FVD↓ PSNR↑ SSIM↑ EPE↓ 文本 + 图像 (LTX) 20.04 109.34 11.23 0.53 3.6 图(无边文本) 17.52 101.32 16.88 0.60 3.0 图(完整) 17.02 99.42 15.98 0.61 2.9

表 7:LoRA 秩的消融。 秩 FID↓ FVD↓ PSNR↑ SSIM↑ 16 18.34 103.18 13.70 0.58 32 17.89 102.39 14.51 0.60 64 17.53 100.99 15.25 0.60 128 17.02 99.42 15.98 0.61

第 15 页

构造指标显著改善,PSNR 从 13.70 提升至 15.98(+16.6%),SSIM 从 0.58 提升至 0.61(+5.2%)。这些结果表明,更高秩的适配器提供了更强的表征能力,以捕捉复杂的运动和外观变化,从而生成更忠实且时间上连贯的视频。所有报告的实验均使用秩 128。

6 结论

我们提出了 GraphVid,这是一个可控图像到视频生成的框架,通过有向交互图来表示场景动态。与依赖密集运动信号或低级物理注释的先前方法不同,GraphVid 将运动建模为实体之间的结构化交互,从而能够直接从单张图像实现直观的多对象控制。通过将 Edge-Aware Graph Reasoning 与冻结的视频扩散 Transformer 集成,并利用参数高效的 LoRA 进行条件控制,GraphVid 在保持强大预生成先验的同时,实现了对场景动态的结构化控制。为支持这一范式,我们还构建了 GraphVid-Bench,这是一个包含 27K 个以交互为中心的视频及其显式交互图的配对数据集,为学习关系视频动态提供监督。实验表明,GraphVid 匹配或优于先前的可控视频生成方法,同时使用更少的参数和训练数据,突显了交互图作为可控视频生成的可扩展接口。

致谢

本研究部分由 Google、Google TPU 研究云(TRC)计划、NSF CAREER 奖 #2542328、美国国防部高级研究计划局(DARPA)资助 HR001125C0303 以及美国陆军合同 W5170125CA160 支持。文中的观点和结论属于作者,不应被解释为必然代表 Google、NSF、DARPA、美国陆军或美国政府的官方政策,无论是明示还是暗示。美国政府有权出于政府目的复制和分发本作品,尽管其中包含任何版权注释。本工作还使用了由美国国家超级计算应用中心通过先进网络基础设施协调生态系统:服务与支持(ACCESS [6])计划提供的 Delta GPU,分配编号为 CIS240808 和 CIS250318,该计划由 NSF 资助 #2138259、#2138286、#2138307、#2137603 和 #2138296 支持。

参考文献

1. Armeni, I., He, Z.Y., Gwak, J., Zamir, A.R., Fischer, M., Malik, J., Savarese, S.: 3d scene graph: A structure for unified semantics, 3d space, and camera. In: IEEE Conf. Comput. Vis. Pattern Recog. (2019)

第 16 页

16 V. Shah 等人

2. Bai, S., Cai, Y., Chen, R., Chen, K., Chen, X., Cheng, Z., Deng, L., Ding, W., Gao, C., Ge, C., 等: Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631 (2025) 3. Bar, A., Herzig, R., Wang, X., Rohrbach, A., Chechik, G., Darrell, T., Globerson, A.: 使用动作图进行组合视频合成。在:国际机器学习会议 (2021) 4. Bar-Tal, O., Chefer, H., Tov, O., Herrmann, C., Paiss, R., Zada, S., Ephrat, A., Hur, J., Liu, G., Raj, A., 等: Lumiere:一种用于视频生成的时空扩散模型。在:SIGGRAPH Asia 会议论文集 (2024) 5. Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y., English, Z., Voleti, V., Letts, A., 等: Stable video diffusion:将潜在视频扩散模型扩展到大规模数据集。arXiv 预印本 arXiv:2311.15127 (2023) 6. Boerner, T.J., Deems, S., Furlani, T.R., Knuth, S.L., Towns, J.: ACCESS:推进创新:NSF 高级网络基础设施协调生态系统:服务与支持。在:高级研究计算实践与经验 (PEARC) (2023) 7. Chang, X., Ren, P., Xu, P., Li, Z., Chen, X., Hauptmann, A.: 场景图生成与应用的全面综述。IEEE 模式分析与机器智能汇刊 45(1), 1–26 (2021) 8. Chu, R., He, Y., Chen, Z., Zhang, S., Xu, X., Xia, B., WANG, D., Yi, H., Liu, X., Zhao, H., 等: Wan-move:通过潜在轨迹引导实现运动可控的视频生成。在:神经信息处理系统进展 (2025) 9. Dutta, A., Mehrab, K.S., Sawhney, M., Neog, A., Khurana, M., Fatemi, S., Prad- han, A., Maruf, M., Lourentzou, I., Daw, A., 等: 使用视觉语言模型进行开放世界场景图生成。arXiv 预印本 arXiv:2506.08189 (2025) 10. Geng, D., Herrmann, C., Hur, J., Cole, F., Zhang, S., Pfaff, T., Lopez-Guevara, T., Aytar, Y., Rubinstein, M., Sun, C., 等: 运动提示:通过运动轨迹控制视频生成。在:IEEE 计算机视觉与模式识别会议 (2025) 11. Geyer, M., Bar-Tal, O., Bagon, S., Dekel, T.: Tokenflow:用于一致视频编辑的一致性扩散特征。arXiv 预印本 arXiv:2307.10373 (2023) 12. Gillman, N., Herrmann, C., Freeman, M., Aggarwal, D., Luo, E., Sun, D., Sun, C.: Force prompting:视频生成模型可以学习并泛化基于物理的控制信号。在:神经信息处理系统进展 (2025) 13. Goyal, R., Ebrahimi Kahou, S., Michalski, V., Materzynska, J., Westphal, S., Kim, H., Haenel, V., Fruend, I., Yianilos, P., Mueller-Freitag, M., 等: “something something”视频数据库:用于学习和评估视觉常识。在:IEEE 计算机视觉与模式识别会议 (2017) 14. Guo, Y., Yang, C., Rao, A., Agrawala, M., Lin, D., Dai, B.: Sparsectrl:向文生视频扩散模型添加稀疏控制。在:欧洲计算机视觉会议 (2024) 15. Guo, Y., Yang, C., Rao, A., Liang, Z., Wang, Y., Qiao, Y., Agrawala, M., Lin, D., Dai, B.: Animatediff:无需特定微调即可动画化您的个性化文生图扩散模型。国际学习表征会议 (2024) 16. HaCohen, Y., Chiprut, N., Brazowski, B., Shalem, D., Moshe, D., Richardson, E., Levin, E., Shiran, G., Zabari, N., Gordon, O., 等: Ltx-video:实时视频潜在扩散。arXiv 预印本 arXiv:2501.00103 (2024) 17. Hamilton, W., Ying, Z., Leskovec, J.: 大规模图上的归纳表示学习。神经信息处理系统进展 (2017)

第 17 页

GraphVid:交互式图可控视频生成 17

18. He, Y., Liu, Z., Chen, J., Tian, Z., Liu, H., Chi, X., Liu, R., Yuan, R., Xing, Y., Wang, W., 等:大语言模型与多模态生成及编辑:一项综述。arXiv 预印本 arXiv:2405.19334 (2024) 19. Heusel, M., Ramsauer, H., Unterthiner, T., Nessler, B., Hochreiter, S.: 通过双时间尺度更新规则训练的生成对抗网络收敛于局部纳什均衡。神经信息处理系统进展 (2017) 20. Holla, M., Lourentzou, I: 零样本自然语言视频定位的常识推理。在:AAAI (2024) 21. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W., 等:LoRA:大语言模型的低秩自适应。国际学习表征会议 (2022) 22. Hu, Y., Chen, Z., Luo, C.: Lamd:用于图像条件视频生成的潜在运动扩散。国际计算机视觉杂志 (2025) 23. Huang, Z., He, Y., Yu, J., Zhang, F., Si, C., Jiang, Y., Zhang, Y., Wu, T., Jin, Q., Chanpaisit, N., 等:Vbench:视频生成模型的全面基准套件。在:IEEE 计算机视觉与模式识别会议 (2024) 24. Karaev, N., Rocco, I., Graham, B., Neverova, N., Vedaldi, A., Rupprecht, C.: Cotracker:联合追踪更优。在:欧洲计算机视觉会议 (2024) 25. Karwande, G., Mbakwe, A.B., Wu, J.T., Celi, L.A., Moradi, M., Lourentzou, I.: Chexrelnet:一种感知解剖结构的模型,用于追踪胸部 X 光片之间的纵向关系。在:医学图像计算与计算机辅助干预国际会议 (2022) 26. Khan, M.J., Ilievski, F., Breslin, J.G., Curry, E.: 基于场景图和常识知识的神经符号视觉推理综述。神经符号人工智能 (2025) 27. Kipf, T.N., Welling, M.: 基于图卷积网络的半监督分类。arXiv 预印本 arXiv:1609.02907 (2016) 28. Ku, M., Wei, C., Ren, W., Yang, H., Chen, W.: Anyv2v:适用于任何视频到视频编辑任务的免微调框架。arXiv 预印本 arXiv:2403.14468 (2024) 29. Lei, G., Wang, C., Zhang, R., Wang, Y., Li, H., Xu, W.: Animateanything:用于视频生成的一致且可控的动画。在:IEEE 计算机视觉与模式识别会议 (2025) 30. Li, H., Zhu, G., Zhang, L., Jiang, Y., Dang, Y., Hou, H., Shen, P., Zhao, X., Shah, S.A.A., Bennamoun, M.: 场景图生成:一项全面综述。神经计算 (2024) 31. Li, Q., Xing, Z., Wang, R., Cao, H., Dai, Q., Dong, D., Wu, Z.: Flashmotion:基于轨迹引导的少步可控视频生成。在:IEEE 计算机视觉与模式识别会议 (2026) 32. Li, Q., Xing, Z., Wang, R., Zhang, H., Dai, Q., Wu, Z.: Magicmotion:基于稠密到稀疏轨迹引导的可控视频生成。在:IEEE 计算机视觉与模式识别会议 (2025) 33. Li, X., Ma, C., Yang, X., Yang, M.H.: Vidtome:用于零样本视频编辑的视频标记合并。在:IEEE 计算机视觉与模式识别会议 (2024) 34. Li, Y., Wang, X., Zhang, Z., Wang, Z., Yuan, Z., Xie, L., Shan, Y., Zou, Y.: Image conductor:交互式视频合成的精确控制。在:AAAI (2025) 35. Lin, B., Ge, Y., Cheng, X., Li, Z., Zhu, B., Wang, S., He, X., Ye, Y., Yuan, S., Chen, L., 等:Open-sora plan:开源大型视频生成模型。arXiv 预印本 arXiv:2412.00131 (2024) 36. Ogunleye, M.A., Abdelrahman, E., Lourentzou, I.: 3d-vcd:通过视觉对比解码缓解 3D 大语言模型具身智能体的幻觉。在:IEEE 计算机视觉与模式识别会议 (2026)

第 18 页

18 V. Shah 等人

37. Peebles, W., Xie, S.: 基于 Transformer 的可扩展扩散模型。在:IEEE 计算机视觉与模式识别会议 (2023) 38. Pont-Tuset, J., Perazzi, F., Caelles, S., Arbeláez, P., Sorkine-Hornung, A., Van Gool, L.: 2017 年 Davis 视频对象分割挑战赛。arXiv 预印本 arXiv:1704.00675 (2017) 39. Romero, D., Bermudez, A., Li, H., Pizzati, F., Laptev, I.: 利用视频扩散模型学习刚体交互生成。arXiv 预印本 arXiv:2510.02284 (2025) 40. Shen, Y., Liu, J., Li, X., Liu, Y., Li, B., Yang, H., Jia, W., Li, Y., Yu, T., Rehg, J.M., Cao, X., Lourentzou, I.: Egoforge:目标导向的第一人称世界模拟器。arXiv 预印本 arXiv:2603.20169 (2026) 41. Shen, Y., Xiong, J., Yu, T., Lourentzou, I.: Phantom:通过联合建模视觉与潜在物理动力学实现物理注入的视频生成。在:IEEE 计算机视觉与模式识别会议 (2026) 42. Shi, X., Huang, Z., Wang, F.Y., Bian, W., Li, D., Zhang, Y., Zhang, M., Cheung, K.C., See, S., Qin, H., 等:Motion-i2v:通过显式运动建模实现一致且可控的图像到视频生成。在:SIGGRAPH 会议论文 (2024) 43. Singer, U., Polyak, A., Hayes, T., Yin, X., An, J., Zhang, S., Hu, Q., Yang, H., Ashual, O., Gafni, O., 等:Make-a-video:无需文本-视频数据的文本到视频生成。arXiv 预印本 arXiv:2209.14792 (2022) 44. Susladkar, O., Prakash, T., Juvekar, A., Nguyen, K.A., Jang, D.H., Dhillon, I.S., Lourentzou, I.: Pyratok:用于视频理解和生成的语言对齐金字塔分词器。在:IEEE 计算机视觉与模式识别会议 (2026) 45. Susladkar, O., Sen Gupta, J., Sehgal, C., Mittal, S., Singhal, R.: Motionaura:使用离散扩散生成高质量且运动一致的视频。在:国际学习表征会议 (2025) 46. Unterthiner, T., Van Steenkiste, S., Kurach, K., Marinier, R., Michalski, M., Gelly, S.: Fvd:一种新的视频生成评估指标。国际学习表征会议 DeepGenStruct 研讨会 (2019) 47. Wald, J., Dhamo, H., Navab, N., Tombari, F.: 从 3D 室内重建中学习 3D 语义场景图。在:IEEE 计算机视觉与模式识别会议 (2020) 48. Wan, T., Wang, A., Ai, B., Wen, B., Mao, C., Xie, C.W., Chen, D., Yu, F., Zhao, H., Yang, J., 等:Wan:开放且先进的规模化视频生成模型。arXiv 预印本 arXiv:2503.20314 (2025) 49. Wang, J., Ma, A., Cao, K., Zheng, J., Feng, J., Zhang, Z., Pang, W., Liang, X.: Wisa:用于物理感知文本到视频生成的物理世界模拟器助手。在:神经信息处理系统进展 (2025) 50. Wang, X., Yuan, H., Zhang, S., Chen, D., Wang, J., Zhang, Y., Shen, Y., Zhao, D., Zhou, J.: Videocomposer:具有运动可控性的组合视频合成。神经信息处理系统进展 (2023) 51. Wang, Z., Bovik, A.C., Sheikh, H.R., Simoncelli, E.P.: 图像质量评估:从误差可见性到结构相似性。IEEE 国际图像处理会议 (2004) 52. Wei, Y., Zhang, S., Yuan, H., Gong, B., Tang, L., Wang, X., Qiu, H., Li, H., Tan, S., Zhang, Y., 等:Dreamrelation:以关系为中心的视频定制。在:IEEE 计算机视觉与模式识别会议 (2025) 53. Wu, W., Li, Z., Gu, Y., Zhao, R., He, Y., Zhang, D.J., Shou, M.Z., Li, Y., Gao, T., Zhang, D.: Draganything:使用实体表示实现任意对象的运动控制。在:欧洲计算机视觉会议 (2024)

第 19 页

GraphVid:交互式图可控视频生成 19

54. Xu, K., Hu, W., Leskovec, J., Jegelka, S.: How powerful are graph neural networks? arXiv preprint arXiv:1810.00826 (2018) 55. Yang, X., He, C., Ma, J., Zhang, L.: Motion-guided latent diffusion for temporally consistent real-world video super-resolution. In: Eur. Conf. Comput. Vis. (2024) 56. Yang, Z., Teng, J., Zheng, W., Ding, M., Huang, S., Xu, J., Yang, Y., Hong, W., Zhang, X., Feng, G., et al.: Cogvideox: Text-to-video diffusion models with an expert transformer. In: Int. Conf. Learn. Represent. (2025) 57. Yin, S., Wu, C., Liang, J., Shi, J., Li, H., Ming, G., Duan, N.: Dragnuwa: Fine- grained control in video generation by integrating text, image, and trajectory. arXiv preprint arXiv:2308.08089 (2023) 58. Zhang, L., Rao, A., Agrawala, M.: Adding conditional control to text-to-image diffusion models. In: IEEE Conf. Comput. Vis. Pattern Recog. (2023) 59. Zhang, Y., Li, M., Long, D., Zhang, X., Lin, H., Yang, B., Xie, P., Yang, A., Liu, D., Lin, J., et al.: Qwen3 embedding: Advancing text embedding and reranking through foundation models. arXiv preprint arXiv:2506.05176 (2025) 60. Zhang, Z., Liao, J., Li, M., Dai, Z., Qiu, B., Zhu, S., Qin, L., Wang, W.: Tora: Trajectory-oriented diffusion transformer for video generation. In: IEEE Conf. Comput. Vis. Pattern Recog. (2025)

第 20 页

20 V. Shah 等人

A GraphVid-Bench 详情与构建流程

数据集来源与聚合。我们从三个互补的开源数据集构建 GraphVid-Bench 训练数据,以确保动作和交互类型的广泛分布。具体而言,我们使用 WISA-80K [49] 用于刚体物理驱动的动力学,Something-Something v2 [13] 用于多样化的常识性人机交互和物体间交互,以及 Magic-Data [32] 用于复杂的真实世界前景运动和多重交互场景。对于评估,我们从 DAVIS 2017 [38] 和 MoveBench [8] 中提炼出专用的测试集,以评估在既定基准上的泛化能力。

自动化语义过滤。为了消除混淆的运动因素,我们引入了一种使用视觉语言模型(Qwen3-VL [2])的自动化语义过滤阶段。对于每个视频,提取轻量级的代理片段并提供给视觉语言模型,将主导运动源分类为相机运动、自身运动、环境动态或离散物体交互等类别。我们仅保留被分类为表现出离散物体交互的视频,并丢弃主要由相机平移、背景运动或流体/气体环境效应主导的序列。此过滤步骤确保最终数据集强调由交互驱动的场景动态,而非由相机引起的运动。

时空标准化与运动能量窗口化。为了使数据集与视频扩散骨干网络的潜在分辨率约束保持一致,并维持一致的训练输入,所有视频在空间和时间上均进行了标准化。每个视频被调整大小至固定的 512×288 分辨率。为了避免在帧边界附近截断关键交互,我们没有使用中心裁剪,而是应用动态黑边(letterboxing)以保留原始纵横比并避免交互实体的几何失真。时间维度被标准化为 16 FPS 下的 81 帧。由于许多源视频超过此时长,简单的随机裁剪可能会捕捉到交互不活跃的片段。为了解决这个问题,我们引入了滑动运动能量窗口算法。预处理流水线通过计算连续灰度帧之间的像素级绝对差值之和来计算运动能量信号。然后将一个 81 帧的窗口在该信号上滑动,并选择聚合运动能量最高的片段。这确保了提取的片段对应于交互最活跃的阶段,为训练提供更强的监督信号。在训练期间,每个批次的一个随机子集会被上采样到不同的骨干网络兼容分辨率,鼓励模型在多种输出分辨率下生成高质量视频。

A.1 测试集提炼

为了确保公平且一致的评估,测试数据集经历了上述相同的时空标准化流程。

DAVIS 2017:原始帧序列首先转换为视频张量。略短于 81 帧的序列(例如 78–79 帧)使用最后一帧进行边缘填充,以满足时间要求。更长的序列

第 21 页

GraphVid:交互式图可控视频生成 21

MoveBench 25 评估子集

20 20 20 18 18 18 18 17 17 17样本 16 16 15 15 15 14 14 13 13 13 12 12 12 12 12 12 12 11 11 11 11 11 10 10 10 10 10 10 10 10 9 9 9 9 9 9

7 7 7 6 6 6 5 5数量 5 4 4

0 玩具 超市 公园 商店 舞蹈 街道 沙漠 歌唱 肖像 产品 网球 风景 保龄球 汽车 其他 山脉 植物 飞机 采访 商场 制作 3c 场景 空气 探索 气球 滑板 猫步 动物 鸟 船 医疗 城市 昆虫 健身 配饰 办公室 其他 手工 运动 瑜伽 宠物 森林 动画 环境 徒步 烹饪 书法 表演 活动 野生动物 水 冲浪 实验 运动 冬季 模型 运动 游泳 火车 交通 活动 热 自然 水上 个人 峡谷 军事 户外 太空 卡通 其他 农业 其他 服装 工业 科学 乐器

图 7:MoveBench 数据集及其精选评估子集的类别分布。该图显示了原始 MoveBench 数据集中每个语义类别的样本数量(浅色柱)以及我们在实验中选择的用于评估的子集(深色柱)。类别按子集频率降序排列。我们精心策划的评估划分在保持广泛语义覆盖的同时,减少了样本极少的长尾类别。重要的是,该子集保留了 MoveBench 中 54 个唯一类别中的 53 个(覆盖率 98.15%),确保评估仍能代表整个数据集,同时专注于交互丰富的场景。

使用运动能量窗口处理程序进行处理,以提取最具动态性的片段。然后使用 VLM 运动分类器对生成的片段进行过滤,以去除以相机或自身运动为主的序列。 MoveBench:首先通过 VLM 对视频进行过滤,仅保留表现出离散物体级物理交互的片段。保留的视频随后被调整为 512 × 288 并标准化为 81 帧,以匹配下游模型的视觉输入要求。图 7 显示了原始 MoveBench 数据集和我们提炼子集的类别分布。

B 额外实验细节

我们使用 512 的隐藏维度训练 Edge-Aware GNN [54]。图表示通过一个 3 层 MLP 适配器投影到 LTX 2B 主干网络 [16] 的 4096 维潜在空间中,而主干网络本身在训练过程中保持冻结。为了实现参数高效适配,我们在注意力投影中插入了 LoRA 模块,即 to_q、to_k、to_v 和 to_out.0,秩 r = 128,缩放因子 α = 32。训练在 8 块 NVIDIA A100 GPU 上进行,耗时约 2.5 天,使用 bfloat16 混合精度和 Accelerate 库进行内存高效的分布式优化。我们使用 AdamW,学习率为 1 × 10−4。除非另有说明,推理在 512×288 的空间分辨率下进行,共 81 帧,16 FPS。

第 22 页

22 V. Shah 等

表 8:在 DAVIS 运动基准上的定量比较。我们评估可控视频生成质量,涵盖感知(FID、FVD)和重建(PSNR、SSIM)指标。GraphVid 在整体性能上表现强劲,同时使用了显著更少的可训练参数。高亮显示的是参数高效架构中的最佳和次佳结果。

| 方法 | 可训练参数 (B) | FID↓ | FVD↓ | PSNR↑ | SSIM↑ | EPE↓ | | :— | :— | :— | :— | :— | :— | :— | | Wan-Move [8] | 14.5 | 15.04 | 86 | 12.37 | 0.57 | 2.5 | | Tora [60] | 5.0 | 24.56 | 107 | 10.21 | 0.49 | 3.5 | | Motion-I2V [42] | 1.2 | 26.12 | 114 | 9.98 | 0.43 | 3.8 | | WISA [49] | 1.0 | 25.05 | 110 | 10.45 | 0.47 | 3.3 | | MagicMotion [32] | 1.5 | 20.11 | 100 | 11.32 | 0.49 | 3.5 | | FlashMotion [31] | 13 | 17.09 | 107 | 9.92 | 0.49 | 3.4 | | GraphVid (Ours) | 0.6 | 16.20 | 98 | 12.85 | 0.55 | 2.9 |

在采样方面,我们采用 FlowMatchEulerDiscreteScheduler 进行连续时间步采样。为了与先前方法进行公平比较,推理期间禁用了 FlashAttention。

环境影响。我们使用统一的硬件级核算协议估算 GraphVid 和 Wan-Move 的训练碳足迹。假设 NVIDIA A100 GPU 的最大热设计功耗为 400 W,我们使用 8 块 A100 GPU 进行约 2.5 天(60 小时)的训练,对应的仅 GPU 能耗为 8 × 0.4 × 60 = 192 kWh。在相同假设下,Wan-Move 使用 64 块 A100 GPU 训练 10 天(240 小时),对应能耗为 64 × 0.4 × 240 = 6144 kWh。

C 补充实验

在本节中,我们提供扩展的经验评估,以进一步验证 GraphVid 的效率、泛化能力和架构鲁棒性。

在过滤后的 DAVIS 基准上的评估。表 8 在我们要以交互为中心的 DAVIS 子集上评估 GraphVid,GraphVid 在仅使用少量可训练参数(0.6B)和训练数据(27K 视频)的情况下取得了极具竞争力的性能。与 WISA [49] 相比,GraphVid 显著提高了时间连贯性(FVD:110 → 98)和感知质量(FID:25.05 → 16.20)。这证实了通过有向场景图显式建模交互关系,比依赖预定义文本属性提供了更强的归纳偏置。此外,GraphVid 在结构保真度(PSNR:12.85,SSIM:0.55)、感知真实性和时间一致性(FVD:98)方面始终优于基于轨迹条件的方法(即 Motion-I2V [42]、Tora [60]、MagicMotion [32] 和 FlashMotion [31])。GraphVid 在整体帧重建方面表现出色,突显了结构化交互推理相对于仅几何运动线索的优势。最后,虽然重量级的 Wan-Move(14.5B 参数,2M 训练视频)确立了最佳性能,但 GraphVid 实现了最先进的感知

第 23 页

GraphVid:交互式图可控视频生成 23

表 9:训练时图表示的消融实验。我们将仅使用节点特征的图变体与我们的 GraphVid 完整模型进行比较,后者通过消息传递额外融合了语义边嵌入。

变体 节点 边 FID↓ FVD↓ PSNR↑

仅节点图编码器 ✓ ✗ 19.55 103.00 15.24 GraphVid ( ours ) ✓ ✓ 17.02 99.42 15.98

尽管模型容量和训练规模减少了一个数量级,但在所有参数高效基线中仍保持了结构和保真度。

边缘感知 GNN 训练鲁棒性。我们进行了架构消融实验,以隔离 GNN 中关系边消息传递的贡献。我们训练了一个仅利用孤立节点特征(提取的边界框和视觉对象嵌入)并省略语义边连接和消息传递层的 GraphVid 基线变体。我们将此与我们的完整 Edge-Aware GNN 实现进行比较,后者通过其显式的边路由架构内在整合了关系动态。如表 9 所述,虽然仅节点变体收敛并提供了一定程度的控制基线(FVD 103),但它未能完全解决交互实体之间复杂的物理依赖关系。在训练期间整合显式边特征显著提高了所有指标上的生成质量,将 FVD 降低至 99.42 并改善了结构重建(PSNR 15.98)。这证实了学习场景的物理因果性从根本上需要对对象之间的关系进行建模。

D 人类偏好研究

我们进行了一项人类评估研究,以评估生成的视频在多大程度上满足提示中描述的预期交互语义。该研究包括一个由 60 名参与者组成的多样化群体,他们评估了 10 种不同的交互场景。参与者会看到描述预期交互的文本提示、第一帧条件图像以及说明所需轨迹的短运动引导视频。然后向他们展示四个匿名候选视频,并要求他们回答两个独立的问题,以选择 (a) 最好满足提示语义意图和 (b) 具有最佳视觉质量的结果。对于每种场景,参与者提供偏好判断,产生 60 × 10 × 2 = 1200 次单独判断。

在图 8 中,我们观察到 GraphVid 在语义意图和视觉质量方面的胜率分别达到 60% 和 90%。图 8 还总结了在两项指标上均受偏好的模型的聚合偏好率。在 10 种多样化的评估场景中,GraphVid 在 10 个测试案例中的 6 个中赢得了语义意图和视觉质量的大多数投票,有 3 次平局,仅输掉 1 次。此外,GraphVid 获得了最高的语义偏好,占据了所有投票的 39.5%。这显著优于 Wan-Move (22.3%)、Tora (19.3%) 和 WISA (18.9%),代表了超过

第 24 页

24 V. Shah 等

胜 平 负 (a) 语义意图 (b) 视觉质量 (c) 综合

Ours 60% 40% 90% 10% 60% 30% 10%

WISA 10% 90% 100% 10% 90%

Tora 10% 90% 100% 10% 90%

Wan-Move 20% 80% 10% 90% 10% 10% 80%

0 25 50 75 100 0 25 50 75 100 0 25 50 75 100 百分比 (%) 百分比 (%) 百分比 (%) 图 8:不同维度的用户偏好研究。GraphVid 在所有基线中实现了最高的选择率(胜)。此处,“胜”表示模型在给定指标下被选为绝对最佳的比例,“平”表示多个模型被认为同等偏好的情况,“负”表示模型未被选中。

比最强基线高出 77%。对 GraphVid 的强烈偏好证实,用户认为生成的视频更好地捕捉了提示的核心意图,弥合了抽象控制信号与视觉逼真视频生成之间的差距。这些一致的结果表明,GraphVid 的语义交互表示能够在不同上下文中更忠实地实现提示,而不牺牲视觉保真度。

E 定性结果

图 9 展示了多种基线方法与 GraphVid 在多对象交互控制方面的定性比较。给定输入图像和用户指定的交互线索,先前的方法往往难以忠实地遵循预期的交互动态。在船只场景(顶部)中,基线方法要么未能分离两艘船的运动轨迹,要么在生成过程中引入视觉伪影。相比之下,GraphVid 产生了与用户指定交互一致的连贯发散轨迹。在慢跑场景(底部),竞争方法表现出不稳定的运动模式,包括主体从画面中消失、动作生成错误(走路而非慢跑)或明显的运动模糊。GraphVid 保持了稳定的主体身份,并产生了时间上一致的运动,同时正确保留了领跑者和跟随慢跑者之间的相对动态。这些例子突出了结构化交互图条件建模协调多对象动态的优势。

图 10 展示了 GraphVid 与先前可控视频生成方法的其他定性比较。给定相同的输入图像和用户指定的交互线索,基线方法往往难以在时间上保持连贯的运动动态。在握手场景中,竞争模型表现出不稳定的交互行为,包括突然终止

第 25 页

GraphVid:交互式图可控视频生成 25

输入图像 + 用户交互 生成的视频 挑战 方向仅发生 Wan-Move 轻微变化,正如预想的那样,船 没有按照用户意图移动。

幻觉伪影被 Tora 添加,船没有按照用户 意图移动。

幻觉伪影被 WISA 添加,船没有按照用户 意图移动。

GraphVid

提示:一段视频,展示两艘船在海中行驶,朝彼此相反的方向转弯。

领先的慢跑者 Wan-Move 完全消失在画面 之外。

提示要求 两名慢跑者进行慢跑, Tora 然而,他们在视频中 是在走路。

部分帧非常 模糊,且视频显示 WISA 慢跑者是在 走路而非慢跑。

GraphVid

提示:一段视频,展示一名领先的慢跑者以稳定的配速移动,紧随其后的是另一名配速较慢的慢跑者;两人的手脚都在进行有系统的摆动。

图 9:多对象交互控制的定性比较。给定输入图像和用户指定的交互线索(左侧),不同方法生成随时间变化的视频序列(中间)。高亮区域指示了先前方法中常见的失败模式。在船只场景(顶部),基线方法难以遵循指定的运动方向或引入伪影,而 GraphVid 产生了与交互线索一致的连贯发散轨迹。在慢跑场景(底部),竞争方法显示出运动不稳定(例如主体消失、走路而非慢跑或模糊),而 GraphVid 保持了稳定的身份和一致的多实体动态。

运动轨迹或模糊的手部动态,表明难以维持一致的多实体交互。相比之下,GraphVid 生成了稳定的握手序列,具有平滑的时间演化和两个主体之间一致的接触。在地铁场景中,基线方法要么过早终止运动,要么引入结构幻觉,如错误的车轮形态,反映了运动生成与物体结构之间的接地能力薄弱。GraphVid 在生成沿预定轨道的稳定向前运动的同时,保留了物体几何形状。这些例子进一步表明,交互图条件化提高了多对象视频生成的时间一致性和结构可靠性。

F 失败案例分析

虽然 GraphVid 显著提高了可控视频生成的能力,但在语义粒度和物体接地方面仍存在某些局限性。一种常见的失败模式发生在 VLM 在场景图构建期间未能隔离微小或符号化元素时。如图 11 所示,用户试图应用

第 26 页

26 V. Shah 等

输入图像 + 用户交互 生成视频 挑战 期望的运动在 Wan-Move 中突然结束

期望的运动突然结束。 Tora 期望的运动相当 模糊,且整体 WISA 生成的运动 质量较差。

GraphVid

提示:一段两个同事自信地互相握手的视频

视频没有做到 Wan-Move 在轨道末端停止。

幻觉出的类似 Tora 提示中明确指定了 地铁的巴士车轮。 视频没有做到 WISA 在轨道末端停止。

GraphVid

提示:一段地铁列车沿轨道向前平稳移动,即将在站台停车的视频 图 10:交互驱动视频生成的定性比较。 给定输入图像和用户指定的交互线索(左侧),不同模型生成随时间变化的视频序列(中间)。高亮区域标记了先前方法的常见失败模式。在握手场景(顶部),基线模型表现出运动突然终止或手部动态模糊,而 GraphVid 产生了具有平滑时间连续性的连贯握手。在地铁场景(底部),竞争方法过早停止或幻觉出结构伪影(例如,类似巴士的车轮),而 GraphVid 保持了物体结构并沿预期轨迹生成了稳定的向前运动。

对睡觉的熊上方的小“Zzz”符号进行旋转变换。 然而,VLM 未将此低显著性文本分割为独立节点。因此,交互向量被错误地关联到置信度最高的最近对象——熊本身。结果,生成模型对整个主体应用了刚体旋转,而不是预期的文本元素,导致帧间出现严重的几何失真。此示例突显了当前零样本检测管道在细粒度交互控制方面的局限性,并表明未来系统可能受益于显式节点指定或交互式分割,以确保对小语义元素的正确定位。

G 更广泛的影响

可控视频生成有望显著扩大视觉内容创作的普及性。通过允许用户通过直观的交互图而非复杂的运动注释来指定场景动态,GraphVid 可能降低生成高质量动画的技术门槛

第 27 页

GraphVid:交互式图可控视频生成 27

图 11:失败案例:小型符号对象的语义定位错误。 用户交互指定应用于“Zzz”符号的旋转变换,表示睡眠(左图)。然而,在构建场景图时,检测器未能将文本隔离为独立节点。因此,运动变换被错误地应用于主导对象(熊),导致跨帧出现严重的几何失真和不自然的形变。此示例突显了当前视觉-语言检测在定位缺乏显著视觉特征的微小语义元素时的局限性。

模拟与仿真。该能力可惠及创意媒体制作、虚拟原型设计、物理现象的教育可视化以及机器人与具身智能研究的仿真环境等应用。特别是,通过结构化交互表示动力学,可能通过使运动控制更加显式和模块化,支持生成系统可解释性的提升。 同时,可控视频合成的进步也引发了关于滥用的担忧。从少量输入生成逼真视频的能力可能有助于创建欺骗性或操纵性媒体,包括虚假信息或冒充。虽然 GraphVid 侧重于结构化交互控制而非照片级真实身份合成,但如果部署不当,类似的生成方法仍可能被滥用。我们鼓励未来工作探索水印、溯源追踪和检测方法等安全措施,以减轻有害应用。

第 28 页

28 V. Shah 等人

输入图像 生成视频

图 12:在多样化交互场景上的额外定性结果。每一行展示来自我们评估集的不同示例。第一列提供输入图像,其余列展示从生成视频中采样的帧。GraphVid 在广泛的活动范围内产生了时间连贯的运动,包括物体操作、人类动作以及如烹饪、雕塑、舞蹈、演奏乐器和动物运动等articulated motion。这些示例表明,结构化交互条件能够在保持场景外观和身份跨帧一致性的同时,实现一致的物体动力学。

第 29 页

GraphVid:交互式图可控视频生成 29

运动源分类提示词

您是运动学与视频运动分析专家。 您将获得: 1. 一段短视频片段 2. 描述该视频的字幕:“{caption}” 您的任务是隔离真实的、离散的物体间物理运动,排除由相机运动和环境运动引起的干扰。

运动类别 – discrete_object_physics(离散物体物理):固体、独立的物体(如人、汽车、球棒、球)因明确的物理力、碰撞或位移而运动。其运动可通过边界框轻松追踪。 – ambient_environmental(环境流体/气体):主要运动为流体、气体或由环境驱动。示例:火焰燃烧、水流、海浪拍岸、烟雾弥漫,或静止树木在风中摇曳。 – camera_motion(相机运动):相机进行平移、倾斜、变焦或抖动。关键指标:静态背景元素(墙壁、地面)在屏幕上均匀移动。 – ego_motion(自我运动):第一人称视角在空间中移动(例如,第一人称行走、驾驶)。 – static(静止):几乎没有或没有有意义的运动。

严格评估规则 1. 环境规则(关键):如果视频中的主导运动是火焰、水、烟雾或风,您必须将其分类为 ambient_environmental。场景图难以对流体进行建模。 2. 背景优先:首先观察静态背景元素。如果背景均匀移动,则分类为 camera_motion。 3. 追踪规则:如果相机大幅平移以追踪移动主体(导致背景模糊),则分类为 camera_motion 或 ego_motion,因为像素级运动主要由相机主导。

仅返回严格格式的 JSON。您必须遵循确切的键顺序以确保推理正确:

{ "background_and_ambient_analysis": "简要检查背景是否移动或存在流体/环境运动(火、水、风)。", "object_analysis": "简要描述正在移动的离散固体物体。", "primary_motion_source": "discrete_object_physics | ambient_environmental | camera_motion | ego_motion | static", "confidence": 0.0-1.0 }

第 30 页

30 V. Shah 等人

初始场景图生成的提示

角色 你是一名物理感知视觉语言专家。你的目标是分析静态图像及其对应的对象 JSON,以构建物理场景图。

任务 生成所提供对象之间物理交互的有向图。你的输出必须是一个严格的 JSON 对象,包含一个边列表。

交互规则(物理引擎) 1. 仅基于可见证据:不要幻觉化交互。 2. 隐式邻近性:如果对象未接触但在空间上相关(例如,球靠近球棒),推断 spatial_proximity 或 trajectory_threat 边。不要返回空列表。 3. 牛顿术语:使用基于物理的术语,如 Friction(摩擦力)、Tension(张力)、Normal Force(法向力)、Gravity(重力)、Torque(扭矩)或 Applied Force(施加力)。 4. 完整句子关系:relation_description 必须是语法完整的: [空间介词]+[源对象]+[物理交互]+[目标对象]

输出模式 仅返回有效的 JSON。无解释或额外文本。

{ "edges": [ { "source_node_id": "obj_XXX", "target_node_id": "obj_YYY", "interaction_type": "string", "relation_description": "string", "physics_attributes": { "force_vector_approx": "string", "estimated_magnitude": "string" } } ] }

第 31 页

GraphVid:交互式图可控视频生成 31

合成图更新提示(训练)

角色 你是一个交互式视频生成工具的合成用户模拟器。 你的目标是将视频的文字描述翻译为人类用户为引导该运动而执行的最小手动图编辑集。

任务 分析初始状态与目标描述及详细视频描述。确定主要的因果动作,并将其转换为图操作(插入/更新/删除)。此外,返回一个将在视频中发生动态运动(即会移动)的候选节点列表。

输入数据 1. 初始对象列表(提供的 JSON) 2. 目标描述(真实字幕) 3. 详细视频上下文描述(视频的描述性分析)

核心理念 1. 动作驱动的因果性:场景图充当控制接口。仅对运动的主要主动驱动因素建模(例如,A 推动 B)。忽略反应性、被动性或静态力,除非它们直接导致状态变化。 2. 单向因果性:严格按照动作方向创建边(例如,A 推动 B → A→B)。 3. 稀疏性约束:限制任意两个节点之间的连接不超过两条边。将多个交互合并为单个 relation_description。 4. 需要更新运动:仔细分析上下文以识别物理运动。每当发生物理移动时,输出至少一个边修改(插入/更新或删除)。 5. 操作顺序:在修改现有关系时,先发出 remove_edges 命令以删除旧边,然后再发出 upsert_edges 命令以设置新状态。 6. 将对象物理与相机自运动隔离:如果对象移动仅由相机运动(平移、缩放、跟踪)引起,则省略这些背景对象的边。仅对对象间的物理交互进行建模。 7. 节点一致性约束:你必须仅使用对象列表中提供的确切 node_id 字符串。切勿发明或幻觉出新的节点 ID(例如 surface_implied 或 ground)。如果缺少相关对象,请使用最接近的可用物理节点来描述交互。

[输出模式]

第 32 页

32 V. Shah 等人

合成图更新输出模式

输出模式 仅返回有效的 JSON。

{ "observation_notes": 字符串(最多两句。根据提供的上下文,识别活跃主体及其预期运动方式), "remove_nodes": [], "remove_edges": [ { "source_node_id": "obj_A", "target_node_id": "obj_B" } ], "upsert_edges": [ { "source_node_id": "obj_XXX", "target_node_id": "obj_YYY", "interaction_type": 字符串(选择一项:push, pull, hold, contact, support, …), "relation_description": 字符串(简明描述用户意图,例如,“男子将左手放在女子肩上”), "physics_attributes": { "force_vector_approx": 字符串(例如,向下, toward_camera, lateral), "estimated_magnitude": 字符串(例如,高, 中, 低) } } ] }

第 33 页

GraphVid:交互式图可控视频生成 33

推理时用户意图翻译提示

角色 你是一名物理感知视觉语言专家,作为可控视频生成系统的场景图编译器。你的任务是将用户的显式交互意图翻译为下游物理引擎所期望的严格 JSON 模式。

输入数据 1. 当前图状态:场景图的所有可用节点和初始边 2. 用户动作记录:用户提供的交互上下文,包括适用的向量 3. 图像证据:记录的交互以改善上下文理解

规则 1. 单向因果性:严格按照动作方向创建边(源 → 目标)。 2. 词汇约束:将 interaction_type 限制为简单的结构动词(例如 push, pull, hold, contact, support, spatial_proximity)。 3. 关系丰富化:将 relation_description 设置为用户的精确上下文,稍作丰富以描述物理力学。 4. 物理推导:推导执行运动所需的底层 physics_attributes。force_vector_approx 必须使用简单术语(例如 downward, toward_camera, lateral, upward, neutral)。estimated_magnitude 必须是 high、medium 或 low 之一。 5. 接地:绝不幻觉新的节点 ID。仅使用提供的 ID。

输出模式 仅返回有效的 JSON。

{ "observation_notes": 字符串(简要解释如何将用户意图映射到物理属性), "remove_nodes": [], "remove_edges": [], "upsert_edges": [ { "source_node_id": "obj_XXX", "target_node_id": "obj_YYY", "interaction_type": "字符串", "relation_description": "字符串", "physics_attributes": { "force_vector_approx": "字符串", "estimated_magnitude": "字符串" } } ] }

第 34 页

34 V. Shah 等人

标准视频描述提示

请用简洁自然的段落描述该视频。您的描述应遵循以下规则: 1. 主要运动焦点:主要关注视频中主要主体(如人或动物)的运动和行为。按时间顺序描述他们的动作。 2. 主体外观:简要描述主要主体的外观和数量,包括颜色、大小和方向等属性。 3. 空间关系:在相关时提及主体之间的空间关系(例如,在……前面、在……左侧、在……后面)。 4. 相机视角:在描述末尾,指定相机视角和运动,包括拍摄角度(例如,俯视、正面、侧视)和相机运动(例如,向左平移、放大、拉远、轻微晃动),特别是在它们影响感知运动时。 5. 场景背景:简要描述背景或环境,但除非对理解运动至关重要,否则应保持简洁。 6. 限制:除非对理解运动至关重要,否则不要包含文本识别、特定角色名称或风格分析(例如,写实、动画)。

输出约束 提供一个简洁流畅的段落,理想长度为 2–5 句话。

发表评论