GARFIELD:如何用概率潜变量解决场景运动预测的延迟与多模态难题

快速导读:GARFIELD 通过结构化时空潜在变量建模场景运动分布,利用稀疏目标条件实现高效轨迹采样与确定性密度解码,在开放集运动规划中实现 SOTA 性能并显著降低延迟。

GARFIELD 论文提出了一种名为 GARFIELD 的新方法,旨在解决场景运动预测中的概率表示与高效预测问题。传统视频世界模型如 CogVideoXL 和 Motion-I2V 生成像素级未来帧,计算成本高且未显式建模运动分布。GARFIELD 通过结构化时空潜变量建模场景运动分布,利用稀疏目标条件实现高效轨迹采样与确定性密度解码。

该方法的核心创新在于其结构化概率潜表示、采样免费密度估计以及稀疏时空条件控制。GARFIELD 将潜变量分解为时空局部化组件,支持对特定元素和时刻的不确定性进行局部化。确定性密度解码器通过单次前向传播直接输出非参数化运动分布,速度比蒙特卡洛采样快两个数量级。稀疏时空条件控制支持仅对少数对象和时刻指定约束,通过熵引导逐步坍缩可能性空间。

英文题目:Schrödinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics

论文出处:arXiv 每日论文精选 · arXiv:2607.25984

原始论文:PDF / 论文页面

对应视频标题:GARFIELD:如何用概率潜变量解决场景运动预测的延迟与多模态难题|推荐指数:★★★★★

这篇论文解决什么问题?

现有视频世界模型生成像素级未来帧,计算成本高且未显式建模运动分布。这些模型如 CogVideoXL 和 Motion-I2V 作为世界模拟器存在高延迟,难以满足实时应用需求。此外,它们通常预测密集光流或单一样本轨迹,缺乏对多模态未来可能性的概率表征及不确定性量化能力。

Track2Act 等方法依赖密集网格或不可用的目标图像,计算浪费在静态背景上。FPT 等方法受限于 GMM 形式且仅预测单步分布,无法处理复杂的多模态运动。需要一种能处理部分可观测性、支持稀疏条件输入并快速估计运动概率分布的方法,以应对开放集场景中的运动规划挑战。

行人轨迹预测专用模型如 Social-LSTM 和 Social-GAN 缺乏开放集泛化能力,难以适应新场景。GARFIELD 旨在填补这一空白,提供一种通用且高效的场景运动预测框架,适用于机器人规划、行人轨迹预测等多种应用。

核心创新

  • 结构化概率潜在表示:将潜在变量分解为时空局部化组件 $z_{i\tau}$,支持对特定元素和时刻的不确定性进行局部化。
  • 采样免费密度估计:确定性密度解码器 $D_d$ 通过单次前向传播直接输出非参数化运动分布,速度比蒙特卡洛采样快两个数量级。
  • 稀疏时空条件控制:支持仅对少数对象和时刻指定约束,通过熵引导的交互式条件选择逐步坍缩可能性空间。
  • 统一潜在空间:同一潜在表示同时支持联合轨迹采样(通过 $D_\theta$)和密度估计(通过 $D_d$)。

方法概览

GARFIELD 采用联合编码器将图像和稀疏时空约束编码为结构化潜在变量 $z_{i\tau}$。通过点式生成解码器 $D_p$ 训练潜在空间以捕获运动分布。引入确定性密度解码器 $D_d$ 直接输出概率热图,避免昂贵的蒙特卡洛采样。使用全解码器 $D_\theta$ 联合采样一致轨迹以解决多模态依赖问题。

  • GARFIELD 采用联合编码器将图像和稀疏时空约束编码为结构化潜变量 $z_{i\tau}$。这种结构化表示允许模型对特定元素和时刻的不确定性进行局部化,提高了预测的灵活性和准确性。
  • 通过点式生成解码器 $D_p$ 训练潜在空间以捕获运动分布。$D_p$ 能够生成单个点的运动轨迹,为后续的全解码器提供基础。
  • 引入确定性密度解码器 $D_d$ 直接输出概率热图,避免昂贵的蒙特卡洛采样。$D_d$ 通过单次前向传播即可输出非参数化运动分布,速度极快。
  • 使用全解码器 $D_\theta$ 联合采样一致轨迹以解决多模态依赖问题。$D_\theta$ 能够生成完整的运动轨迹,确保时间步之间的一致性。
  • GARFIELD 支持稀疏时空条件控制,允许用户仅对少数对象和时刻指定约束。通过熵引导的交互式条件选择,模型可以逐步坍缩可能性空间,提高预测的准确性。
  • 同一潜在表示同时支持联合轨迹采样(通过 $D_\theta$)和密度估计(通过 $D_d$),实现了统一潜在空间的优势。

逐图理解论文

核心区分

核心区分
Figure 2: GARFIELD Architecture Overview. Given a set of constraints C, namely an image I and kinematics bT, our encoder produces conditional latents {zi

图 2 详细描述了 GARFIELD 的架构。编码器生成条件潜变量,解码器包括点式生成解码器、确定性密度解码器和全解码器,分别用于不同任务。

最强结论

最强结论
Table 1: Comparison on Motion Planning. GARFIELD achieves strong motion planning performance in open-set domains with reduced latency by modeling motion only for a subset of all scene elements and using spatio-temporally sparse goal conditioning.

表 1 比较了 GARFIELD 与其他模型在运动规划上的性能。GARFIELD 在开放集领域实现强性能,同时降低延迟。

意义与局限

意义与局限
Table 3: Pedestrian trajectory prediction. Errors are reported in pixels w.r.t. the original video resolution for Stanford Drone and meters for ETH/UCY. Baseline numbers are taken from IDM [35]. GARFIELD performs competitively.

GARFIELD 为机器人规划提供实时概率反馈,意义重大。然而,行人轨迹预测在零样本设置下落后于专用模型,密度解码器依赖离散网格,存在精度与计算成本权衡。以上就是这篇论文的核心内容,感谢收听。

实验如何设计?

  • 在 OpenVid-1M 开放集运动规划任务中,GARFIELD 与视频生成模型和轨迹模型进行对比,评估 EPE, PCK, FDE 和延迟。
  • 评估不同数量条件点 $|\bar{T}|$ 对 minEPE 和 minFDE 的影响,以及基于熵的条件选择策略。
  • 在 BridgeData 和 RT1 数据集上零样本评估机械臂运动规划性能。
  • 在 ETH/UCY 和 Stanford Drone 数据集上评估零样本和微调后的行人轨迹预测性能。
  • 进行消融实验,验证潜在变量结构、维度、预训练协议及网格分辨率的影响。

关键结果与论文证据

  • GARFIELD 在 OpenVid-1M 上实现 EPE 0.013 (16 goals),延迟 0.017s,显著优于基线模型(第 6 页)。
  • GARFIELD PCK@10% 达到 0.989,PCK@1% 达到 0.666,显示其在关键点预测上的高精度(第 6 页)。
  • 密度解码器延迟仅为 0.8ms,比蒙特卡洛采样快两个数量级(第 11 页)。
  • 在机器人规划中,GARFIELD 在 BridgeData 和 RT1 上零样本 PCK AUC 分别达到 0.76 和 0.77(第 8 页)。
  • 行人轨迹预测中,GARFIELD 在 ETH 上零样本 FDE 为 1.79,微调后为 1.44(第 9 页)。
  • GARFIELD 比视频世界模型快 97 倍轨迹采样(第 1 页)。

阅读时需要注意

  • 行人轨迹预测在零样本设置下落后于专门针对该领域训练的 SOTA 方法(如 IDM, Trajectron++)。
  • 密度解码器依赖于离散网格 $g$,存在精度与计算成本之间的权衡。
  • 点式解码器在多模态不确定性下无法解决时间步之间的依赖关系,导致轨迹不连贯,必须依赖全解码器 $D_\theta$。
  • 需要 RGB 图像输入,限制了在无视觉传感器场景下的直接应用。

关联工作

  • 视频世界模型如 CogVideoXL 和 Motion-I2V 生成像素级未来,计算昂贵,未显式建模运动分布。
  • Track2Act 生成点轨迹,但依赖密集目标图像,计算浪费在静态背景。
  • FPT 预测 GMM 分布,但限于单步且分布形式受限。
  • Social-LSTM / Social-GAN 是行人轨迹预测专用模型,缺乏开放集泛化能力。

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

薛定谔的猫:潜在场景运动学的概率表示与预测

Timy Phan∗, Jannik Wiese∗, Björn Ommer CompVis @ LMU Munich, Munich Center for Machine Learning (MCML)

从部分观测中预测场景的演化需要推理多种可能的未来,而非局限于单一轨迹。现有方法要么生成以外观为主的视频预测,要么仅采样少量轨迹而未显式建模可能运动的分布。我们提出未来运动学潜在分布的目标感知表示(Goal-Aware Representations of Future kInEmatic Latent Distributions, GARFIELD),这是一种场景运动学的概率模型,它学习给定图像及可选时空稀疏约束下可能未来分布的结构化时空潜在表示。相同的潜在表示既支持所有轨迹的联合采样,又通过高效的确定性密度解码器(Density Decoder)直接访问底层运动分布。因此,对未来运动的不确定性可定位到特定的场景元素和时间步,并通过额外约束逐步细化。实验表明,该方法在运动规划性能上可与大型视频生成模型相媲美,且轨迹采样速度快 97 倍。我们的方法估计运动密度的速度比从运动生成模型中进行蒙特卡洛采样(Monte-Carlo sampling)快两个数量级,从而支持交互式探索和不确定性感知规划。

项目页面:https://compvis.github.io/schroedingers_catJul 代码:https://github.com/CompVis/schroedingers_cat 已录用至 ECCV 202628

约束条件缩小了可能性的空间:卡车会驶出环岛吗? [cs.CV]

随时间变化的可能性

机器人 行人 有意识的主体 物理 arXiv:2607.25984v1 图 1:薛定谔的猫:给定初始场景上下文(图像)以及时空稀疏约束或目标(x)集合,GARFIELD 编码了可能运动的空间。通过从该空间采样,我们的方法能够为有意识的主体和无生命物体规划合理的运动,我们在机器人和轨迹预测等应用中对此进行了评估。

*同等贡献。

1

第 2 页

1 引言

我们的世界不断展开,每一刻都承载着多种可能的未来:由于随机性、自由意志以及其他隐藏因素,给定当前状态,未来本质上是欠确定的。在这样的环境中行动需要预判场景可能发生的变化。特别是,我们需要预测场景的运动学特性——即其组成部分如何移动——估计各种可能性的概率,而不仅仅是感知和追踪已经发生的情况。用作世界模拟器的视频模型 [4, 6, 23] 将未来生成为图像序列,生成单个帧,而不是显式地建模帧之间的场景变化。它们的大部分能力都花费在建模不影响场景运动学的外观细节上,导致不必要的延迟并限制了可能性的探索。直接对运动进行建模 [10, 11, 42] 提高了效率并将能力集中在运动学上,但现有方法预测密集运动场,在静态背景上浪费计算资源,而不是针对相关的场景元素。此外,生成式运动模型采样单个实现结果,而不是预测各种潜在结果的概率、分布和不确定性。

我们受到薛定谔著名思想实验的启发:在可观测性有限的情况下,系统的状态表示为可能状态的分布,随着新观测值的获得而坍缩。类似地,Goal-Aware Representations of Future kInEmatic Latent Distributions (GARFIELD) 的核心思想是将未来表示为场景组成部分轨迹的分布,该分布可以通过结合额外的观测值或约束来逐步细化。我们的编码器接收场景图像以及可能的中间或目标位置,生成编码场景元素未来可能运动分布的潜在表示。更多的约束始终会使该分布更加尖锐,为用户提供有效的交互控制。

这种运动学分布必须定位到特定的场景元素和时间步,以便正确归因不确定性。因此,我们使用整个场景的联合运动编码器学习场景运动学的概率嵌入,该编码器产生时空局部化的潜在变量。使用生成式解码器进行训练确保表示捕获了可能运动的空间,而不是单个轨迹。通过用逐点解码器模型训练编码器,强制执行允许检查特定时间特定元素可能运动的结构化潜在空间。我们提出了高效的解码器,它们基于相同的潜在表示,能够进行 (i) 捕获相互依赖关系的联合轨迹采样,以及 (ii) 在一次 ViT 前向传播中产生概率热图的确定性密度解码。密度解码器估计密度和不确定性的速度比蒙特卡洛采样快几个数量级,这对于实时规划和快速探索不确定性至关重要。

我们考虑运动规划任务:生成满足稀疏目标并尊重场景约束的轨迹。先前的工作通常依赖于条件信号,如目标图像 [10]、时间密集轨迹 [54] 或文本提示 [22, 54, 71],这些信号要么模糊,要么难以获取。相比之下,我们实现了时空稀疏条件约束,仅对选定的对象和时间步指定约束,而将剩余的运动留给模型推断。结合快速的密度估计,这使得能够高效地探索可能的未来,并以最小的用户输入进行不确定性感知的运动规划。

贡献:我们学习 (i) 运动的结构化概率潜在表示(第 3.1 节)。相同的潜在表示支持 (ii) 联合采样相互一致的轨迹,尊重提供的约束(第 3.4 节),以及 (iii) 通过高效的密度解码器直接访问底层运动分布(第 3.2 节,图 4)。我们的模型还支持 (iv) 灵活的时空稀疏条件约束,允许用户通过稀疏约束塑造可能未来的分布(图 5)。因此,Goal-Aware Representations of Future kInEmatic Latent Distributions (GARFIELD) 实现了不确定性感知的运动规划和未来可能性的交互探索(第 3.3 节,图 3c)。我们的方法采样完整轨迹的速度比视频世界模型快 97 倍(表 1),估计运动密度的速度比运动预测方法的蒙特卡洛采样快两个数量级(图 6b)。

2 相关工作

最近,基于扩散变换器 [44] 的视频世界模型 [4, 6, 13, 22, 23, 62, 71] 已成为预测未来场景演变的实际标准方法。这些模型通常以起始图像、文本和有时动作类别为条件,生成以完整像素细节描绘未来事件的视频。它们在机器人技术 [67, 75]、自动驾驶 [7, 64, 73] 和物理模拟 [6, 13, 38] 中取得了令人印象深刻的结果,但它们将未来表示为图像序列,而不是专注于动力学。可以从生成的像素中提取和分析运动,但这种方法在已经昂贵的视频合成之上增加了额外的开销。

2

第 3 页

底层时间动态可表示为密集光流 [27, 59] 或稀疏点轨迹 [29, 74],它们在无需建模外观的情况下捕捉运动。最近的方法如 Track2Act [10] 和 What Happens Next? [11] 应用扩散 Transformer 生成用于以运动为中心的任务(例如机器人控制)的点轨迹。类似地,Motion-I2V [54] 从起始图像、文本提示和空间稀疏的条件轨迹生成光流。采样后的光流随后作为视频生成器的条件,以提高质量和控制力。然而,这些方法依赖于模糊的文本 [11, 56] 或不可用的目标状态图像 [10]。相比之下,GARFIELD 以时空稀疏的目标状态为条件。此外,这些方法在密集网格上预测运动,将计算资源浪费在大部分静态背景上,而非关注相关的场景元素。

在自动驾驶和行人预测等相对狭窄的应用领域中,Social-LSTM [1]、Social-GAN [21] 和 Trajectron++ [51] 等方法已经专注于仅预测相关场景元素的运动。这凸显了以元素为中心的建模的实际价值。然而,这些模型是针对特定领域定制的,无法泛化到基于任意场景外观的条件开放集运动预测。

轨迹和光流捕捉底层运动,但对语义和约束保持无感知。因此,最近的工作探索了更丰富的运动表示,包括使用变分自编码器 (VAEs) [14]、归一化流 [25] 或自监督表示学习 [47, 58, 65] 进行训练。Motion Diffusion Autoencoders [48] 进一步在封闭域设置中学习语义运动表示。然而,大多数方法侧重于重建或语义,并未建模未来运动的随机性。早期工作使用概率运动基元 [43]、贝塞尔曲线分布 [28] 或高斯过程 [30] 来表示这种随机性。最近的扩散模型 [9–11, 54, 56] 能够采样可能的未来,但无法直接访问底层分布,需要昂贵的蒙特卡洛采样来估计分布。Motion Modes [42] 通过引导采样改进了对该分布的探索,但仍受限于高昂的推理成本。相比之下,GARFIELD 能够在常数时间 (O(1)) 内访问未来位置的非参数分布。

Flow Poke Transformer (FPT) [8] 通过预测给定一组空间稀疏已知运动的未来位置的高斯混合模型 (GMM) 参数,在开放集、以分布为中心的运动建模方面迈出了重要一步。然而,该模型受限于其输出分布的函数形式,将输出空间限制为 GMM 所能表示的那些可能性。更重要的是,他们的方法仅预测特定未来时间步的分布,未考虑多步场景演化,也不允许指定中间目标。

我们提出 GARFIELD 以训练一个开放集运动基础模型,该模型根据外观线索和可选的稀疏已知未来目标,编码场景元素可能的未来位置。我们进一步引入解码器模型,提供对底层非参数分布的访问,而无需重复采样,并支持未来轨迹的概率采样。我们的通用模型可以零样本设置或以最少的微调应用于应用领域,凸显了可扩展开放集预训练的优势。

3 未来运动学潜在分布的目标感知表示

给定有限数量的约束或目标预测场景运动学,需要对许多可能的未来进行概率分布建模。我们将一种可能的实现表示为场景元素 i 随时间的运动,由轨迹 ti = (ti1, ti2, . . . ) 描述,其中 tiτ ∈R2 表示元素 i 在时间步 τ 的 2D 图像平面中的位置。可能未来的分布 p(T),其中 T = {tiτ}i,τ,可以通过对约束或目标进行条件化来缩小和引导。类似于“薛定谔的猫”思想实验,额外的约束或观测会将可能未来的空间坍缩至与条件匹配的轨迹。

通过起始帧 I 和稀疏位置集合 bT ⊂T(某些轨迹必须通过这些位置)提供场景上下文,通过中间目标部分控制场景运动,从而减少不确定性。因此,未来运动学潜在分布的目标感知表示 (GARFIELD) 旨在建模未知轨迹点 ¯T = T \ bT 的条件分布 p( ¯T | I, bT)。为简洁起见,我们将通过起始帧和目标位置进行的条件化总结为 C = (I, bT)。

第 4 页

DINO 阶段编码器 完整轨迹 解码器 第二冻结 联合编码器与

约束 潜在密度 密度解码器 轨迹 时间步 点 解码器 轨迹点

图 2:GARFIELD 架构概览。给定一组约束 C,即图像 I 和运动学参数 bT,我们的编码器生成条件潜在变量 {ziτ},表示对可能未来运动学的分布。这些潜在变量可以通过 Dpψ 解码为点估计 tiτ,通过 Ddω 解码为密度 p(tiτ),并通过 Dθ 解码为运动学集合 T。

3.1 学习场景运动学的分布

我们学习给定场景上下文和约束 C 的合理场景运动学分布的潜在表示。GARFIELD 的目标有两个:(i) 联合采样所有场景元素的轨迹,¯T ∼p(¯T | C),以及 (ii) 估计场景元素 i 在时间 τ 的位置的概率密度 p(tiτ | C)。对这种逐点概率密度进行建模,使得能够在时空体积内高效并行探索运动分布,并揭示 C 的变化如何影响特定时间点上的各个场景元素。

通过光学跟踪器 [29, 74] 对视频数据进行标注,我们可以利用丰富且可扩展的数据源来学习和理解场景运动学。然而,视频及其轨迹标注只是相应场景 I 的运动学 T ∼p(T) 的一种可能实现。这使得可能运动学的分布难以触及,因此对于 p(T) 没有直接的真实标签(ground truth)。生成式建模是一种通过从该数据分布的样本中学习来捕获数据分布的成熟方法,而无需直接访问其底层密度函数。

现有方法 [9–11, 54, 56] 可以使用生成模型对 T 进行采样,这证明了从视频数据中学习场景运动学的可行性。然而,能够采样 T 并不等同于能够轻松获得密度 p(tiτ|C)。理论上,可以通过绘制 T 的多个实现来进行蒙特卡洛估计来近似密度函数 p(tiτ|C)。在实践中,可靠的估计需要大量样本,而生成模型昂贵的采样过程使得这一途径不可行。

由于 ¯T ∼p( ¯T|C) 和 p(tiτ|C) 都受相同的 C 条件约束,我们提议学习一个共享的潜在表示,该表示代表 C 并指导采样和密度估计。密度估计 p(tiτ|C) 需要在时空上局部化。因此,我们将潜在变量分解为

z = ziτ i,τ (1)

分解为单独的 ziτ 组件,每个组件对应特定的逐点运动分布 p(tiτ|C)。这种表示是通过联合编码器 Eφ(生成 z)和逐点解码器 Dpψ(从逐点分布 tiτ ∼Dpψ(ziτ) ≈p(tiτ|C) 中采样轨迹位置)端到端学习的。我们联合训练 Eφ 和 Dpψ,以在 z 中强制这种逐点结构属性。

3.2 无采样密度估计

潜在组件 ziτ 表示场景元素 i 在时间 τ 的可能位置分布。使用具有 NMC 个不同初始噪声种子的逐点解码器 Dpψ,可以从逐点分布中采样 NMC 个轨迹点

4

第 5 页

因此,可以实现对结果概率的蒙特卡洛(MC)估计。然而,这带来了一个权衡:准确的估计需要大量样本,从而导致巨大的计算开销。为了规避这一权衡,我们利用 GARFIELD 提出了一种针对 $z_{i\tau}$ 的确定性密度估计器 $D_{d\omega}$。我们在规则网格 $G = \{1, \dots, g\} \times \{1, \dots, g\}$(其中 $g \in \mathbb{N}$)上定义边缘概率密度为

$p_{(u,v)\omega}(z_{i\tau}) = P(t_{i\tau} \in B_{u,v} | z_{i\tau}), \quad (2)$

该式给出了 $t_{i\tau}$ 落在对应于网格位置 $(u, v) \in G$ 的空间区域 $B_{u,v}$ 内的概率。我们将网格 $G$ 相对于条件图像 $I$ 进行解释,使得每个单元 $B_{u,v}$ 覆盖 $I$ 内的一个图块。

随后,密度估计器直接预测给定已知上下文 $C$(通过 $z_{i\tau}$ 表示)时,场景元素 $i$ 在时间步 $\tau$ 的可能未来运动的逐点非参数分布:

$D_{d\omega}(z_{i\tau}) = \{p_{(u,v)\omega}(z_{i\tau})\}_{(u,v)\in G} = p(t_{i\tau}|z_{i\tau}) \approx p(t_{i\tau}|C) \quad (3)$

我们使用网格交叉熵损失训练密度估计器 $D_{d\omega}$:

$\mathcal{L}_{\text{grid}} = – \sum_{(u,v)\in G} \mathbb{1}_{t_{i\tau} \in B_{u,v}} \log p_{(u,v)\omega}(t_{i\tau}|z_{i\tau}), \quad (4)$

其中 $\mathbb{1}_{t_{i\tau} \in B_{u,v}}$ 在 $t_{i\tau}$ 落入单元 $B_{u,v}$ 时为 1,否则为 0,从而产生一个独热目标分布。注意,密度估计器也仅接收逐点潜在变量 $z_{i\tau}$ 作为输入。因此,$D_{d\omega}$ 是解码潜在表示中编码分布的解码器,该分布是通过生成式预训练学习得到的。与通过蒙特卡洛采样估计密度不同,我们直接从潜在表示 $z_{i\tau}$ 通过单次 ViT 前向传播解码密度,耗时不到 0.8 毫秒(见表 6),从而实现了快速的不确定性估计、不确定性感知规划以及对这些运动分布的交互式探索。

3.3 可能性的交互式探索

在推理阶段,密度解码器 $D_{d\omega}$ 通过单次前向传播提供对分布 $p(t_{i\tau} | C)$ 的访问。这使得通过测量预测分布的香农熵来实现 GARFIELD 的不确定性量化成为可能:

$H(t_{i\tau}) = – \sum_{(u,v)\in G} p_{(u,v)\omega}(t_{i\tau}|z_{i\tau}) \log p_{(u,v)\omega}(t_{i\tau}|z_{i\tau}). \quad (5)$

因此,我们可以高效地评估未来运动在何处仍不确定:高熵表示存在多种可能的未来,而低熵对应于可能性空间的坍缩区域。这允许用户识别并探索可能性范围仍然多样的区域,而不是在运动分布的低方差坍缩区域浪费精力。

密度估计器使得实时交互式可视化和探索可能的未来成为可能,无需从生成模型中采样多个实现。因此,用户可以探索可能的未来,并在反馈循环中迭代修改约束 $C$,通过引导和缩小可行轨迹集来实现交互式规划。一旦用户对结果满意,就可以通过生成模型将潜在变量 $z_{i\tau}$ 解码为完整、连贯的轨迹实现。

3.4 采样连贯的实现

对于运动规划中的许多下游应用,需要具体的轨迹实现。直观上,GARFIELD 可以通过将场景运动学的分布分解,从逐点解码器推断轨迹:

$p(T | C) \approx \prod_i \prod_\tau p(t_{i\tau} | C). \quad (6)$

然而,如果可能性空间未完全坍缩且可能存在多模态未来,逐点解码器无法解析轨迹内及轨迹间点之间的相互依赖关系。因此,对于时间步 $\tau$ 的采样

5

第 6 页

可能从单一模式抽取,而下一时间步的样本 $\tau + 1$ 从另一模式抽取,导致时间上不连贯的轨迹。通过自回归更新 $C$ 来解决这些依赖关系的替代方案会带来计算开销,并因对采样点的早期贪婪承诺而导致性能下降(补充材料中的表 D.3)。

相反,我们训练一个完整的解码器 $D_\theta$ 作为联合生成模型,其条件为所有潜在变量的集合,该模型学习采样 $$ \tilde{T} \sim D_\theta(z_{i\tau})_{i,\tau} = D_\theta(z) = D_\theta(E_\phi(C)) \approx p(T | C) \quad (7) $$ 使用由冻结编码器产生的潜在变量(第 3.1 节)。通过联合采样轨迹,GARFIELD 的完整解码器正确处理了相互依赖性。

通过第 3.1 节描述的逐点生成解码器学习结构化潜在变量(公式 (1)),GARFIELD 能够通过公式 (3) 访问密度估计,并使用公式 (7) 从 $p(T | C)$ 采样连贯的轨迹。

4 实验

我们的实验评估了 GARFIELD 在目标条件运动规划中的能力,以及其预测未来运动学分布的能力。我们进一步展示了该方法作为下游任务基础的有效性。

4.1 通用设置

数据。为了训练和评估,我们使用现成的跟踪器 [74] 对视频进行标注,以获得用于监督和指标计算的伪真值。我们在包含广泛主题范围的 20M 个 $224^2$ 像素、12 FPS 的视频数据集上进行训练。比较在公共 OpenVid-1M [40] 数据集上进行,而一些消融研究则在训练数据的保留验证集上进行。我们还在特定领域的数据 [12, 31, 45, 49, 61] 上进行评估,这些数据包含人工标注的轨迹或遵循应用领域的标准实践使用 CoTracker3 [29] 的标注。

实现细节。GARFIELD 的编码器、完整解码器和密度估计器均实现为 Transformer 网络 [17, 44]。我们使用 DINOv2R-B [15, 41] 提取图像特征,并在训练期间解冻 DINO。我们使用 3D Axial RoPE [57],但为完整解码器屏蔽起始位置以避免信息泄露。我们使用 $g=20$ 的密度网格并附加一个越界 token。为了确保 $z_{i\tau}$ 的平滑性,我们在训练期间对 $z_{i\tau}$ 应用 tanh 函数并添加 $\sigma = 1e-5$ 的高斯噪声 [52]。编码器采用来自 FPT [8] 的静态相机条件。$D_{p\psi}$ 遵循 MAR [33],是一个拥有 34M 参数的 MLP。更多细节见附录 A。

训练细节。GARFIELD 编码器 $E_\phi$ 使用逐点生成解码器训练 450k 步,并在前 50k 步中将线性增加的目标稀疏性 $b_T/T$ 从 0.5 增加到 0.01。密度估计器 $D_{d\omega}$ 和完整解码器 $D_\theta$ 分别在保持编码器 $E_\phi$ 冻结的情况下训练 150k 步和 200k 步。所有训练运行均使用 256 的全局批量大小,AdamW 优化器,学习率为 1e-4(密度解码器除外,为 1e-5),以及 bfloat16 精度。我们通常对 $\tau \in \{1 \dots 32\}$ 个时间步中的 $i \in \{1 \dots 64\}$ 条轨迹进行建模。

文本 数值 PCK $\uparrow$ PCK $\uparrow$ 延迟 $\downarrow$ 方法 EPE $\downarrow$ FDE $\downarrow$ 自由目标 @10% @1% [s] 视频 CogVideoXLTX [22] [71] ✗ ✗ n/a n/a 0.027 0.025 0.952 0.960 0.466 0.464 0.032 0.033 178 39

Motion-I2V [54] ✗ 4 0.055 0.864 0.150 0.060 13.2 ✓ n/a 0.041 0.931 0.091 0.046 4.10 motion Track2Act [10] 16 0.033 0.957 0.263 0.037 FPT [8] ✓ 4 0.029 0.936 0.493 0.035 0.60 16 0.026 0.943 0.523 0.032 显式 GARFIELD (Ours) ✓ 4 0.020 0.973 0.544 0.026 0.40 16 0.013 0.989 0.666 0.017

表 1:运动规划比较。GARFIELD 通过仅对场景中所有元素的一个子集进行运动建模并使用时空稀疏的目标条件,在开放域中实现了强大的运动规划性能并降低了延迟。

6

第 7 页

0.08 0.06 运动-I2V 运动-I2V 熵 FPT FPT 0.025 EPE GARFIELD (本文) 0.06 GARFIELD (本文) 随机 0.04 0.020 0.04 minEPE minFDE minEPE 0.015 0.02 0.02 0.010

0 1 2 4 8 16 32 0 1 2 4 8 16 32 0 2 4 8 16 32 条件点数量 |T| 条件点数量 |T| 条件点数量 |T|

(a): 时间平均。(b): 最终位置误差。(c): 条件策略。

图 3: 目标条件的影响。GARFIELD 能够利用有限的条件信息推断出准确的运动,体现在 (a) minEPE 和 (b) minFDE 上。(c) 基于熵选择条件比基于预言机或随机选择能产生更快的坍缩。

指标。对于开放集评估,我们使用归一化到 [0, 1] 的位置误差来衡量运动准确性,其中 1 对应图像尺寸。我们的主要指标是端点误差 EPE = ∥¯tiτ −tiτ∥2,对所有轨迹 i 和时间步 τ 取平均。我们还报告相对于图像尺寸的关键点正确率 PCK@α = E[EPE < α],其中 α ∈{10%, 1%},以及最终距离误差 (FDE),即最终时间步的 EPE。校准评估使用能量评分 (ES),这是一种用于概率预测的严格评分规则。领域特定的评估遵循先前工作的标准协议。附录 C 节提供了更多指标细节。

4.2 开放集运动建模

运动规划。我们将 GARFIELD 完整解码器与公开 OpenVid-1M [40] 数据集上的开放集运动规划基线进行比较。模型从起始帧和稀疏的未来约束(文本、目标图像或位置,取决于方法)预测未来运动。由于多个未来可能满足约束,我们对每个模型生成五个样本并报告最佳结果。我们评估 RGB 视频模型和开放集轨迹模型。对于前者,我们使用 TI2V 模型 [22, 71],以起始帧和告知模型时间动态的 OpenVid 提示为条件。使用 TapNext [74] 从生成的视频中提取运动。Motion-I2V [54] 从空间稀疏轨迹预测光流,并对时间稀疏信号进行插值。我们通常以默认设置运行 Motion-I2V,其他配置的比较见附录 E 节。Track2Act [10] 在起始和目标的 RGB 帧条件下,在密集网格上生成轨迹。FPT [8] 预测起始和最终时间步之间变化的分布。为了获得完整轨迹,我们仅使用 GARFIELD 观察到的时空稀疏条件点,对 FPT 进行多次时间步重运行。

表 1 显示 GARFIELD 取得了最佳的 EPE、PCK 和 FDE。因此,我们与大得多且速度慢几个数量级的视频生成模型具有竞争力。我们还优于 Track2Act,后者依赖于通常在开放集运动规划中不可用的密集最终 RGB 帧。对每个时间步重运行 FPT 会产生次优结果,突显了建模时间依赖关系的重要性。Motion-I2V 接收与 GARFIELD 相同的时空稀疏点以及额外的文本提示,但表现更差且延迟更高,突显了仅对相关场景元素进行运动建模以及无需对条件进行时间插值的优势。总体而言,GARFIELD 在开放集领域提供了最先进的运动规划,我们将其归因于对相关场景元素的显式运动建模以及时空稀疏条件,这比先前视频 [22, 71] 和运动生成 [10, 54] 方法中使用的基于文本或 RGB 的条件提供了更精确的控制信号。

目标条件。图 3 显示了向条件集 C 添加更多子目标的影响。当使用非常稀疏的信息(即有限的未来位置信息)时,GARFIELD 能够执行更准确的轨迹规划。给定仅 |bT| = 4,GARFIELD 在 EPE 上匹配使用 |bT| = 16 的 Motion-I2V。此外,我们的方法在使用仅图像条件时与 FPT [8] 相当,并在使用超过 2 个目标位置时始终优于 FPT。

定性评估。我们在图 4 左侧展示了 GARFIELD 在仅已知 bT/T = 1% 轨迹点时的定性样本。给定最少的未来知识,GARFIELD 能够预测一系列对象和活动的复杂轨迹。图 G.7 在补充材料中展示了与基线的定性比较。图 4 右侧显示 ziτ 可以在给定相同约束 C 的情况下编码多个可能的未来。我们展示了从 GARFIELD 密度估计器 Ddω 获得的放大密度,以及来自 Dθ 的两个样本,针对相同的潜在表示,突显了 GARFIELD 捕捉未来结果分布的能力。

7

第 8 页

τ ≤8 τ ≤16 τ ≤24 τ ≤32

1.00 0.75 τ=8 τ=16 τ=24 τ=32 0.50scaled) 0.25(power Density

0.00

图 4:定性开放集运动与不确定性。(左)在稀疏条件(bT/T = 1%)下,GARFIELD 采样出逼真的运动。点表示预测,叉号表示条件点。(右)复杂的运动产生非坍缩的分布。

仅图像 图像 + 1 个目标 图像 + 2 个目标

τ=16

τ=24

图 5:最小条件下的分布。给定 |bT|=0,GARFIELD 假设场景是静态的。当 |bT|=1 时,模型捕捉到了运动,但产生了不准确的物体关系。当 |bT|=2 时,GARFIELD 仅对确切速度保持不确定。

图 5 从定性上证明了估计的密度反映了 GARFIELD 随着更多条件输入而改善的运动理解。当没有未来位置时,模型预测的场景主要是静态的;当只有一个条件位置时,模型未能考虑物体间的相互依赖关系;但仅使用两个条件点,它就能推断出复杂的运动分布。

分布。我们旨在验证编码的潜在变量是否捕捉到了关于场景动态的有意义的不确定性。图 6a 展示了我们逐点解码器和全解码器的能量评分(Energy Score)。与 Motion-I2V [54] 和 FPT [8] 相比,我们的方法实现了更优的能量评分。评估密度估计器 Ddω 时,我们进一步计算了离散化的能量评分(附录 C 节),发现密度估计器在实现更优离散能量评分的同时,将计算速度提高了两个数量级。此外,图 6c 显示,提供更多条件会使分布更加紧凑。我们在补充材料的 E 节中提供了进一步的校准评估。

自动化交互条件。我们考虑应如何执行干预,以用最少的外部信息(例如,提示用户提供进一步输入)将分布坍缩至真实值。使用

方法 BridgeData [61] ↑ RT1 [12]↑

Flow [69] 0.32 0.38 Track2Act [10] 0.77 0.75

GARFIELD (Ours) 0-shot 0.76 0.77

表 2:机器人规划。给定最终目标,GARFIELD 无需微调即可推断出与先前方法质量相当的机械臂运动。我们扩展了 [10] 的表格。

8

第 9 页

运动-图像到视频 FPT 0.06 GARFIELD 密集 0.025 GARFIELD FPT 1.50 GARFIELD 点 评分 0.06 GARFIELD DE GARFIELD 点 GARFIELD 完整 0.020 1.25 0.05 MC=1 GARFIELD 完整 0.04评分 0.015 标准差 1.00 能量 MC=1 熵 0.04 0.010能量 0.02 0.75 MC=10 MC=100 MC=10 MC=100 0.005 0.03 离散 0.50 0 1 2 4 8 16 32 10^1 10^2 10^3 10^4 0 1 2 4 8 16 32 0.000 条件点数 |T| 延迟 (ms) 条件点数 |T|

(a):能量评分。(b):离散化能量评分。(c):分布收紧。

图 6:分布评估。GARFIELD 实现了最佳能量评分。密度解码器 Ddω 以数量级更低的延迟实现了更优的离散化能量评分。额外的条件输入降低了熵和方差。

利用 GARFIELD 密度估计器,我们可以使用熵(公式 (5))量化模型在每个轨迹位置的不确定性。我们建议使用熵作为提供条件的位置指示器,即在给定当前约束的情况下,找到不确定性最高的轨迹点。图 3c 将我们的基于熵的条件输入与基于预言机(oracle)的变体进行了比较,后者可以访问每个轨迹点的当前 EPE,以及一个随机基线。对于自动化评估,我们在不确定性最高、误差最大或随机的轨迹点处插入真实条件输入。虽然使用误差预言机的表现甚至比随机选择更差,但我们发现基于熵的交互式条件输入表现强劲。基于熵的条件输入仅使用一半的条件信息即可达到与基于预言机的条件输入相当的效果。请注意,在部署过程中没有预言机可用,而基于熵的条件输入选择并不依赖真实信息。此外,我们在附录 F 节中评估了基于熵的条件输入对用户输入噪声的鲁棒性。

4.3 应用领域

机器人学。规划通常用于评估运动模型 [10, 42, 56, 66]。我们遵循 Track2Act [10] 的方案比较 GARFIELD,并根据起始和结束状态为机械臂采样轨迹。虽然 Track2Act 使用密集的 RGB 作为起始和结束状态,但我们使用现成的位置信息。我们遵循 Track2Act 的报告方式,计算曲线下面积 ∆= A1 PAa=1 PCK@ Sa,其中 A = 10 是以像素为单位的最高 PCK 阈值,S = 256 是像素分辨率(更多细节:附录 C 节)。表 2 突出显示了 GARFIELD 在未使用机器人数据训练的情况下,与 Track2Act 具有竞争力。相比之下,Track2Act 在 RT1 [12] 和 BridgeData [61] 的划分上进行训练。这突显了我们的模型所学习到的对运动和运动学约束的基本理解。

行人轨迹预测。行人轨迹预测对于自动驾驶至关重要,也是一个长期的基准测试。我们比较了 GARFIELD 的零样本和微调性能。由于我们需要 RGB 输入,我们仅使用了 ETH/UCY 数据集的一个子集。更多细节见附录 E 节。表 3 显示,尽管我们没有针对预测进行训练,但我们的零样本性能与 Social-LSTM [1] 等成熟方法相当。经过最小程度的微调(<15k 次迭代),GARFIELD 实现了与 Social-GAN [21] 相当的性能。虽然我们的结果不如一些更近期的领域特定方法,但我们的结果强调了我们的表示方法的实用性。

方法 ETH [45] HOTEL [45] SDD [49]

ADE ↓ FDE ↓ ADE ↓ FDE ↓ ADE ↓ FDE ↓

Social-LSTM [1] 1.09 2.35 0.79 1.76 57.00 31.20 Social-GAN [21] 0.81 1.52 0.72 1.61 27.23 41.44 Trajectron++ [51] 0.39 0.83 0.12 0.21 8.98 19.02 IDM [35] 0.41 0.62 0.15 0.25 7.46 13.83

GARFIELD (Ours) 零样本 1.09 1.79 0.41 0.71 36.77 49.86 GARFIELD (Ours) 微调 0.84 1.44 0.29 0.56 19.92 34.98

表 3:行人轨迹预测。误差以相对于原始视频分辨率的像素(针对 Stanford Drone)和米(针对 ETH/UCY)报告。基线数据取自 IDM [35]。GARFIELD 表现具有竞争力。

9

第 10 页

潜在变量 EPE ↓ EPE (OOD) ↓ EPE ↓ FDE ↓ T T 结构大小 T “ = 1% T“ = 90% 全局 0.479 0.482 16 0.012 0.009 纠缠 0.509 0.510 64 0.012 0.008 ours 0.011 0.015 256 0.012 0.019

表 4:嵌入表示。使用非解耦表示会导致性能下降。在分布外(OOD)设置中,较小的嵌入表示能实现更优性能。评估基于训练数据的保留验证集。

4.4 消融实验

纠缠表示与全局表示。表 4 左侧显示,使用合并的全局 token 或不强制结构约束来训练逐点解码器,会导致性能显著下降,且无法解码出准确的点。直观上,分解后的 $z_{i\tau}$ 编码了 $p(t_{i\tau} | C)$,并可被逐点解码器和密度估计器无缝解码。相比之下,对于非局部化的嵌入,解码器必须自行识别相关信息,这给 $D_{p\psi}$ 和 $D_{d\omega}$ 带来了显著更难的挑战。相比之下,我们解耦的 $z_{i\tau}$ 能够实现高质量的轨迹预测和逐点密度估计。

潜在维度。表 4 进一步显示,在分布内样本($\hat{T}/T = 1\%$ 条件)上的性能几乎与潜在维度无关。然而,在分布外设置中,例如当提供大量条件($\hat{T}/T = 90\%$)时,较小的潜在变量优于较大的变体,这可能是由于过度适应所致。除非另有说明,我们使用 64 的潜在维度,以在域内和域外任务上均取得强劲性能之间取得平衡。

使用其他解码器进行预训练。图 7 比较了使用逐点解码器 $D_{p\psi}$、全解码器 $D_{\theta}$ 或密度解码器 $D_{d\omega}$ 对编码器 $E_{\phi}$ 进行预训练的效果。图 7a 显示,直接使用全解码器训练与先使用逐点解码器预训练相比,运动规划性能相似。然而,在图 7b 中,当编码器使用全解码器预训练时,密度估计器无法产生高质量的不确定性估计。此外,使用密度估计器和公式 (4) 中的网格交叉熵目标对编码器进行预训练,会导致全解码器和密度解码器的性能较差。我们得出结论:(1) 密度解码器的离散化限制了编码器的学习信号;(2) 密度解码器 $D_{d\omega}$ 难以解释通过全解码器 $D_{\theta}$ 预训练编码器所学习到的纠缠潜在变量,这与表 4 类似。因此,使用我们的逐点解码器 $D_{p\psi}$ 对编码器进行预训练,既保留了使用第二阶段解码器 $D_{\theta}$ 进行强全轨迹采样的能力,又保持了 $z_{i\tau}$ 对密度解码器 $D_{d\omega}$ 的可解释性。

全解码器与逐点解码器。我们的逐点解码器 $D_{p\psi}$ 能够在给定潜在变量 $z_{i\tau}$ 的情况下推断特定时间步场景元素的位置。可以从独立的逐点估计中重建完整轨迹。然而,在多模态不确定性情况下,独立的逐点估计会失效,因为每个时间步的样本可能被分配到不同的模式。全解码器 $D_{\theta}$ 解决了这些相互依赖关系。表 5 验证了这一假设:在条件有限 $C$ 的不确定情况下,全解码器产生更高质量的估计,而当分布坍缩时,逐点模型的表现具有竞争力。

PW Gen (Ours) 0.05 0.020 Score CE Full Density Gen PW Gen (Ours) 0.04 CE Density EPE Full Gen 0.015 Energy 0.03 Disc. 0 2 8 16 0 1 2 4 8 16 条件点数量 $|T|$ 条件点数量 $|T|$

(a): 全解码器 (b): 密度估计器 图 7:训练协议比较。我们将使用逐点生成解码器 $D_{p\psi}$ (PW Gen) 的预训练方法与使用全解码器 $D_{\theta}$ (Full Gen) 或确定性密度估计器 $D_{d\omega}$ (CE Density) 训练编码器进行比较。前者实现了可比的轨迹预测性能,但在密度解码上失败;后者未能产生可用于运动规划的表示。评估基于训练数据的保留验证集。

10

第 11 页

解码器组件 |bT| 延迟 [ms] EPE ↓ FDE ↓ 逐点式 2 0.035 0.060 4 0.026 0.047 16 0.014 0.024 全采样 2 0.023 0.029 4 0.019 0.024 16 0.013 0.017

表 5:逐点式与全解码器对比。在约束有限的情况下,全解码器优于逐点式模型。 表 6:延迟。密度解码器预测热力图的速度快于任一生成解码器生成样本的速度。

网格分辨率。直观上,较高的 g 能在细粒度密度估计与计算成本之间取得平衡。图 8 从实证角度展示了这一权衡。由于 g 影响离散能量评分的值域,我们在所有其他评估中保持 g = 20 固定,并在消融实验中额外报告了归一化网格(g = 40)的结果。

直接密度与蒙特卡洛密度的对齐。密度解码器 Ddω、逐点式解码器 Dpψ 和全解码器 Dθ 解码相同的潜在变量。因此,Ddω 生成的热力图应与来自 Dθ 和 Dpψ 的蒙特卡洛密度估计对齐。图 9 证实了这一点:两个解码器相对于单热(1-hot)真实热力图或基线样本,均实现了更低的 Jensen–Shannon 散度和 Wasserstein 距离。

组件延迟。表 6 展示了我们各个组件的运行时间。密度估计器解码非参数分布的速度快于逐点式或全解码器生成单个示例的速度。

5 结论

对部分可观测和不确定环境进行推理,不仅需要建模将会发生什么,还需要建模可能发生什么。我们提出了 GARFIELD(Goal-Aware Representations of Future kInEmatic Latent Distributions),这是一种通过结构化概率潜在表示来表征可能场景运动空间模型,该表示通过联合运动编码器和逐点式扩散解码器学习得到。

在稀疏目标位置的条件下,该表示捕捉了合理未来运动的分布,并随着额外约束的可用而逐渐锐化。从相同的潜在表示中,我们通过高效的确定性密度解码器获得了连贯的轨迹样本和未来位置的概率密度。这些密度直接提供了对场景元素可能出现位置的不确定性感知,从而让用户能够识别未确定的未来区域,并通过稀疏条件进行细化。这使得在极少用户干预的情况下进行交互式探索和运动规划成为可能。

GARFIELD 学习了一种开放集运动表示,在显著更低的延迟下,其性能与大型视频模型相当。随着额外信息的提供,学习到的分布会坍缩,并迁移到机器人规划和行人轨迹预测等下游任务。更广泛地说,我们将 GARFIELD 视为迈向能够推理可能未来空间而非单一结果的模型的一步,从而实现可解释、可控且高效的场景演化概率建模。

归一化 102 网格 202 网格 302 网格 402 网格 单热 GT 均匀 FPT (100 MC) M-I2V (10 MC) GARFIELD (全) (100 MC) GARFIELD (逐点) (100 MC) 0.10 0 目标 评分散度 0.6 0.010 0.06 0 目标 0 目标 0 目标 距离 4 目标 0.4 0.05 0.005 3.6 3.8 4.0 能量 2 目标 2 目标 0.04 2 目标 2 目标 4 目标 4 目标 4 目标 0.2 离散 Jensen-Shannon Wasserstein 0.00 0.02 0.03 0.04 0.05 0.06 0 1 2 3 4 0 1 2 3 4 延迟 (ms) 条件点数量 |T| 条件点数量 |T|

图 8:网格大小消融实验。网格大小 g 在质量与延迟之间进行权衡。在训练数据的保留验证集上进行评估。 图 9:蒙特卡洛样本与密度的对齐。(左)来自 Dθ 和 Dpψ 的蒙特卡洛样本在 Jensen-Shannon 散度上与 Ddω 最匹配。(右)它们的蒙特卡洛热力图也实现了与 Ddω 最低的 Wasserstein 距离。

11

第 12 页

致谢

本项目得到了 Horizon Europe 项目 ELLIOT(项目编号 GA No. 101214398)、由联邦研究与技术部(BMFTR)资助的“GeniusRobot”项目(01IS24083)、BMWE ZIM 项目“conIDitional LoRA”(编号 KK5785001LO4)、德国联邦经济与能源部资助的“NXT GEN AI METHODS – Generative Methoden für Perzeption, Prädiktion und Planung”项目,以及 bidt 项目 KLIMA-MEMES 的支持。作者衷心感谢 Gauss 超级计算中心通过 JSC 的 JUWELS/JUPITER NIC 提供的计算资源,以及 NHR@FAU Erlangen 提供的高性能计算资源。我们要感谢 Stefan Baumann、Johannes Schusterbauer、Ming Gui 和 Ulrich Prestel 提供的有益讨论和反馈,感谢 Nick Stracke、Frank Fundel 和 Thomas Ressler-Antal 进行的初始数据工作,感谢 Stefan Baumann 创建 LATEX 模板,以及 Owen Vincent 提供的持续技术支持。

参考文献

[1] Alexandre Alahi, Kratarth Goel, Vignesh Ramanathan, Alexandre Robicquet, Li Fei-Fei, and Silvio Savarese. Social lstm: Human trajectory prediction in crowded spaces. In 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 961–971, 2016. accessed 2025-11-18.

[2] Michael Albergo, Nicholas M Boffi, and Eric Vanden-Eijnden. Stochastic interpolants: A unifying framework for flows and diffusions. Journal of Machine Learning Research, 26(209):1–80, 2025. accessed 2026-06-22.

[3] Michael Samuel Albergo and Eric Vanden-Eijnden. Building normalizing flows with stochastic interpolants. In The Eleventh International Conference on Learning Representations, 2022. accessed 2024-09-17.

[4] Eloi Alonso, Adam Jelley, Vincent Micheli, Anssi Kanervisto, Amos Storkey, Tim Pearce, and François Fleuret. Diffusion for world modeling: Visual details matter in atari. In Thirty-eighth Conference on Neural Information Processing Systems, 2024. accessed 2026-06-26.

[5] Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E. Hinton. Layer normalization, 2016. accessed 2026-03-08.

[6] Philip J. Ball, Jakob Bauer, Frank Belletti, Bethanie Brownfield, Ariel Ephrat, Shlomi Fruchter, Agrim Gupta, Kristian Holsheimer, Aleksander Holynski, Jiri Hron, Christos Kaplanis, Marjorie Limont, Matt McGill, Yanko Oliveira, Jack Parker-Holder, Frank Perbet, Guy Scully, Jeremy Shar, Stephen Spencer, Omer Tov, Ruben Villegas, Emma Wang, Jessica Yung, Cip Baetu, Jordi Berbel, David Bridson, Jake Bruce, Gavin Buttimore, Sarah Chakera, Bilva Chandra, Paul Collins, Alex Cullum, Bogdan Damoc, Vibha Dasagi, Maxime Gazeau, Charles Gbadamosi, Woohyun Han, Ed Hirst, Ashyana Kachra, Lucie Kerley, Kristian Kjems, Eva Knoepfel, Vika Koriakin, Jessica Lo, Cong Lu, Zeb Mehring, Alex Moufarek, Henna Nandwani, Valeria Oliveira, Fabio Pardo, Jane Park, Andrew Pierson, Ben Poole, Helen Ran, Tim Salimans, Manuel Sanchez, Igor Saprykin, Amy Shen, Sailesh Sidhwani, Duncan Smith, Joe Stanton, Hamish Tomlinson, Dimple Vijaykumar, Luyu Wang, Piers Wingfield, Nat Wong, Keyang Xu, Christopher Yew, Nick Young, Vadim Zubov, Douglas Eck, Dumitru Erhan, Koray Kavukcuoglu, Demis Hassabis, Zoubin Gharamani, Raia Hadsell, Aäron van den Oord, Inbar Mosseri, Adrian Bolton, Satinder Singh, and Tim Rocktäschel. Genie 3: A new frontier for world models, 2025. accessed 2026-06-26.

[7] Florent Bartoccioni, Elias Ramzi, Victor Besnier, Shashanka Venkataramanan, Tuan-Hung Vu, Yihong Xu, Loick Chambon, Spyros Gidaris, Serkan Odabas, David Hurych, Renaud Marlet, Alexandre Boulch, Mickael Chen, Eloi Zablocki, Andrei Bursuc, Eduardo Valle, and Matthieu Cord. VaViM and VaVAM: Autonomous Driving through Video Generative Modeling, 2025. accessed 2025-07-10.

[8] Stefan Andreas Baumann, Nick Stracke, Timy Phan, and Björn Ommer. What if: Understanding motion through sparse interactions. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025. accessed 2026-06-22.

[9] Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M Kalayeh, and Björn Ommer. Envisioning the future, one step at a time. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 6823–6836, 2026. accessed 2026-06-22.

[10] Homanga Bharadhwaj, Roozbeh Mottaghi, Abhinav Gupta, and Shubham Tulsiani. Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation. In European Conference on Computer Vision (ECCV), 2024. accessed 2026-06-26.

[11] Gabrijel Boduljak, Laurynas Karazija, Iro Laina, Christian Rupprecht, and Andrea Vedaldi. What happens next? anticipating future motion by generating point trajectories. In The Fourteenth International Conference on Learning Representations, 2026. accessed 2026-06-26.

12

第 13 页

[12] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alexander Herzog, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Tomas Jackson, Sally Jesmonth, Nikhil J. Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Kuang-Huei Lee, Sergey Levine, Yao Lu, Utsav Malla, Deeksha Manjunath, Igor Mordatch, Ofir Nachum, Carolina Parada, Jodilyn Peralta, Emily Perez, Karl Pertsch, Jornell Quiambao, Kanishka Rao, Michael S. Ryoo, Grecia Salazar, Pannag R. Sanketi, Kevin Sayed, Jaspiar Singh, Sumedh Sontakke, Austin Stone, Clayton Tan, Huong T. Tran, Vincent Vanhoucke, Steve Vega, Quan Vuong, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, and Brianna Zitkovich. Rt-1: Robotics transformer for real-world control at scale. In Robotics: Science and Systems, 2023. accessed 2026-06-26.

[13] Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. Video generation models as world simulators, 2024. accessed 2026-06-22.

[14] Guangyi Chen, Junlong Li, Nuoxing Zhou, Liangliang Ren, and Jiwen Lu. Personalized trajectory prediction via distribution discrimination. In 2021 IEEE/CVF International Conference on Computer Vision (ICCV), pages 15560–15569, 2021. accessed 2025-07-21.

[15] Timothée Darcet, Maxime Oquab, Julien Mairal, and Piotr Bojanowski. Vision transformers need registers, 2023.

[16] Patrick Dendorfer, Aljosa Osep, and Laura Leal-Taixé. Goal-gan: Multimodal trajectory prediction based on goal position estimation. In Proceedings of the Asian Conference on Computer Vision, 2020. accessed 2026-06-22.

[17] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. An image is worth 16×16 words: Transformers for image recognition at scale. In International Conference on Learning Representations, 2020. accessed 2024-12-13.

[18] Markus Ebke. python-billiards, 2019. accessed 2026-06-23.

[19] Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas Müller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, Dustin Podell, Tim Dockhorn, Zion English, and Robin Rombach. Scaling rectified flow transformers for high-resolution image synthesis. In Forty-first International Conference on Machine Learning, 2024. accessed 2026-06-26.

[20] Tilmann Gneiting and Adrian E. Raftery. Strictly proper scoring rules, prediction, and estimation. Journal of the American statistical Association, 102(477):359–378, 2007.

[21] Agrim Gupta, Justin Johnson, Li Fei-Fei, Silvio Savarese, and Alexandre Alahi. Social gan: Socially acceptable trajectories with generative adversarial networks. In Proceedings of the IEEE conference on computer vision and pattern recognition, pages 2255–2264, 2018. accessed 2026-06-22.

[22] Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, Poriya Panet, Sapir Weissbuch, Victor Kulikov, Yaki Bitterman, Zeev Melumian, and Ofir Bibi. Ltx-video: Realtime video latent diffusion, 2024. accessed 2026-06-26.

[23] Danijar Hafner, Wilson Yan, and Timothy Lillicrap. Training agents inside of scalable world models, 2025. accessed 2026-06-26.

[24] Dan Hendrycks and Kevin Gimpel. Gaussian error linear units (gelus), 2023. accessed 2026-03-08.

[25] Gustav Eje Henter, Simon Alexanderson, and Jonas Beskow. Moglow: Probabilistic and controllable motion synthesis using normalising flows. ACM Transactions on Graphics, 39(6):1–14, 2020. accessed 2025-09-06.

[26] Byeongho Heo, Song Park, Dongyoon Han, and Sangdoo Yun. Rotary position embedding for vision transformer. In European Conference on Computer Vision (ECCV), pages 289–305. Springer, 2024. accessed 2026-06-26.

[27] Berthold K. P. Horn and Brian G. Schunck. Determining optical flow. Artificial Intelligence, 17(1):185–203, 1981. accessed 2026-03-01.

[28] Ronny Hug, Wolfgang Hübner, and Michael Arens. Introducing probabilistic bézier curves for n-step sequence prediction. Proceedings of the AAAI Conference on Artificial Intelligence, 34(06):10162–10169, 2020. accessed 2025-09-06.

[29] Nikita Karaev, Iurii Makarov, Jianyuan Wang, Natalia Neverova, Andrea Vedaldi, and Christian Rupprecht. CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos, 2024. accessed 2025-09-07.

[30] Kihwan Kim, Dongryeol Lee, and Irfan Essa. Gaussian process regression flow for analysis of motion trajectories. In 2011 International Conference on Computer Vision, pages 1164–1171, Barcelona, Spain, 2011. IEEE. accessed 2025-09-06.

13

第 14 页

[31] Alon Lerner, Yiorgos Chrysanthou, 和 Dani Lischinski。《Crowds by Example》。《Computer Graphics Forum》,页码 655–664。Wiley Online Library,2007。访问于 2026-06-26。

[32] Jiachen Li, Hengbo Ma, 和 Masayoshi Tomizuka。《Conditional generative neural system for probabilistic trajectory prediction》。收录于 2019 IEEE/RSJ 智能机器人与系统国际会议 (IROS),页码 6150–6156。IEEE,2019。访问于 2026-06-26。

[33] Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, 和 Kaiming He。《Autoregressive image generation without vector quantization》。收录于《Advances in Neural Information Processing Systems》,页码 56424–56445,2024。访问于 2025-11-18。

[34] Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, 和 Matt Le。《Flow matching for generative modeling》,2022。访问于 2026-06-26。

[35] Chen Liu, Shibo He, Haoyu Liu, 和 Jiming Chen。《Intention-aware denoising diffusion model for trajectory prediction》。《IEEE Transactions on Intelligent Transportation Systems》,2025。访问于 2026-06-26。

[36] Xingchao Liu, Chengyue Gong, 和 Qiang Liu。《Flow straight and fast: Learning to generate and transfer data with rectified flow》,2022。访问于 2026-06-26。

[37] Ilya Loshchilov 和 Frank Hutter。《Decoupled weight decay regularization》。收录于《International Conference on Learning Representations》,2019。访问于 2026-06-26。

[38] Haoyu Lu, Guoxing Yang, Nanyi Fei, Yuqi Huo, Zhiwu Lu, Ping Luo, 和 Mingyu Ding。《VDT: General-purpose video diffusion transformers via mask modeling》。收录于《The Twelfth International Conference on Learning Representations》,2024。访问于 2026-06-26。

[39] Nanye Ma, Mark Goldstein, Michael S Albergo, Nicholas M Boffi, Eric Vanden-Eijnden, 和 Saining Xie。《Sit: Exploring flow and diffusion-based generative models with scalable interpolant transformers》。收录于《European Conference on Computer Vision》,页码 23–40。Springer,2024。访问于 2026-06-26。

[40] Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang, Zhijie Chen, Xiang Li, Jian Yang, 和 Ying Tai。《Openvid-1m: A large-scale high-quality dataset for text-to-video generation》。收录于《The Thirteenth International Conference on Learning Representations》,2025。访问于 2026-06-26。

[41] Maxime Oquab, Timothée Darcet, Theo Moutakanni, Huy V. Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Russell Howes, Po-Yao Huang, Hu Xu, Vasu Sharma, Shang-Wen Li, Wojciech Galuba, Mike Rabbat, Mido Assran, Nicolas Ballas, Gabriel Synnaeve, Ishan Misra, Herve Jegou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski。《Dinov2: Learning robust visual features without supervision》,2023。

[42] Karran Pandey, Matheus Gadelha, Yannick Hold-Geoffroy, Karan Singh, Niloy J. Mitra, 和 Paul Guerrero。《Motion modes: What could happen next?》,2024。访问于 2026-06-26。

[43] Alexandros Paraschos, Christian Daniel, Jan R Peters, 和 Gerhard Neumann。《Probabilistic movement primitives》。收录于《Advances in Neural Information Processing Systems》。Curran Associates, Inc.,2013。访问于 2026-06-26。

[44] William Peebles 和 Saining Xie。《Scalable diffusion models with transformers》。收录于《Proceedings of the IEEE/CVF international conference on computer vision》,页码 4195–4205,2023。访问于 2026-06-22。

[45] Stefano Pellegrini, Andreas Ess, Konrad Schindler, 和 Luc Van Gool。《You’ll never walk alone: Modeling social behavior for multi-target tracking》。收录于 2009 IEEE 第 12 届计算机视觉国际会议,页码 261–268。IEEE,2009。访问于 2026-06-26。

[46] Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang, David Yan, Dhruv Choudhary, Dingkang Wang, Geet Sethi, Guan Pang, Haoyu Ma, Ishan Misra, Ji Hou, Jialiang Wang, Kiran Jagadeesh, Kunpeng Li, Luxin Zhang, Mannat Singh, Mary Williamson, Matt Le, Matthew Yu, Mitesh Kumar Singh, Peizhao Zhang, Peter Vajda, Quentin Duval, Rohit Girdhar, Roshan Sumbaly, Sai Saketh Rambhatla, Sam Tsai, Samaneh Azadi, Samyak Datta, Sanyuan Chen, Sean Bell, Sharadh Ramaswamy, Shelly Sheynin, Siddharth Bhattacharya, Simran Motwani, Tao Xu, Tianhe Li, Tingbo Hou, Wei-Ning Hsu, Xi Yin, Xiaoliang Dai, Yaniv Taigman, Yaqiao Luo, Yen-Cheng Liu, Yi-Chiao Wu, Yue Zhao, Yuval Kirstain, Zecheng He, Zijian He, Albert Pumarola, Ali Thabet, Artsiom Sanakoyeu, Arun Mallya, Baishan Guo, Boris Araya, Breena Kerr, Carleigh Wood, Ce Liu, Cen Peng, Dimitry Vengertsev, Edgar Schonfeld, Elliot Blanchard, Felix Juefei-Xu, Fraylie Nord, Jeff Liang, John Hoffman, Jonas Kohler, Kaolin Fire, Karthik Sivakumar, Lawrence Chen, Licheng Yu, Luya Gao, Markos Georgopoulos, Rashel Moritz, Sara K. Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, 和 Yuming Du。《Movie gen: A cast of media foundation models》,2025。访问于 2026-06-26。

14

第 15 页

[47] Thomas Ressler-Antal, Frank Fundel, Malek Ben Alaya, Stefan Andreas Baumann, Felix Krause, Ming Gui, 和 Björn Ommer。 Dismo:用于开放世界运动迁移的解耦运动表示。在神经信息处理系统进展(Advances in Neural Information Processing Systems)中,第 158494–158534 页。Curran Associates, Inc.,2025。访问于 2026-06-26。

[48] Anthony Richardson 和 Felix Putze。运动扩散自编码器:在空手道技术演示中实现属性操控。在第 27 届多模态交互国际会议论文集(Proceedings of the 27th International Conference on Multimodal Interaction)中,第 372–380 页,2025。访问于 2026-06-26。

[49] Alexandre Robicquet, Amir Sadeghian, Alexandre Alahi, 和 Silvio Savarese。学习社交礼仪:拥挤场景中的人类轨迹预测。在欧洲计算机视觉会议(ECCV)论文集(Proceedings of the European Conference on Computer Vision)中,2016。访问于 2026-06-26。

[50] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer。使用潜在扩散模型进行高分辨率图像合成。在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中,第 10684–10695 页,2022。访问于 2024-06-05。

[51] Tim Salzmann, Boris Ivanovic, Punarjay Chakravarty, 和 Marco Pavone。Trajectron++:利用异构数据进行动态可行的轨迹预测,2021。访问于 2025-11-18。

[52] Johannes Schusterbauer, Jannik Wiese, Nick Stracke, Timy Phan, 和 Björn Ommer。使用整流流变换器进行概率性降水临近预报。在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中,第 25742–25756 页,2026。访问于 2026-06-26。

[53] Noam Shazeer。Glu 变体改进 Transformer,2020。访问于 2026-03-08。

[54] Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang, Weikang Bian, Dasong Li, Yi Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin 等人。Motion-i2v:通过显式运动建模实现一致且可控的图像到视频生成。SIGGRAPH 2024,2024。访问于 2026-06-26。

[55] Oriane Siméoni, Huy V. Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Michaël Ramamonjisoa, Francisco Massa, Daniel Haziza, Luca Wehrstedt, Jianyuan Wang, Timothée Darcet, Théo Moutakanni, Leonel Sentana, Claire Roberts, Andrea Vedaldi, Jamie Tolan, John Brandt, Camille Couprie, Julien Mairal, Hervé Jégou, Patrick Labatut, 和 Piotr Bojanowski。Dinov3,2025。访问于 2026-03-01。

[56] Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, 和 Björn Ommer。学习长期运动嵌入以实现高效的运动学生成。在 IEEE/CVF 计算机视觉与模式识别会议论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition)中,第 42581–42591 页,2026。访问于 2026-06-22。

[57] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。Roformer:增强型旋转位置嵌入 Transformer。Neurocomputing, 568:127063, 2024。访问于 2026-06-26。

[58] Didac Suris Coll-Vinent 和 Carl Vondrick。将空间轨迹表示为分布。在神经信息处理系统进展(Advances in Neural Information Processing Systems)中,第 13731–13744 页。Curran Associates, Inc.,2022。访问于 2026-06-26。

[59] Zachary Teed 和 Jia Deng。Raft:用于光流的循环全对场变换。在欧洲计算机视觉会议(European conference on computer vision)中,第 402–419 页。Springer,2020。访问于 2026-06-22。

[60] Patrick von Platen, Suraj Patil, Anton Lozhkov, Pedro Cuenca, Nathan Lambert, Kashif Rasul, Mishig Davaadorj, Dhruv Nair, Sayak Paul, William Berman, Yiyi Xu, Steven Liu, 和 Thomas Wolf。Diffusers:最先进的扩散模型。https://github.com/huggingface/diffusers,2022。访问于 2026-06-26。

[61] Homer Rich Walke, Kevin Black, Tony Z. Zhao, Quan Vuong, Chongyi Zheng, Philippe Hansen-Estruch, Andre Wang He, Vivek Myers, Moo Jin Kim, Max Du, Abraham Lee, Kuan Fang, Chelsea Finn, 和 Sergey Levine。Bridgedata v2:一个用于大规模机器人学习的数据集。在第 7 届机器人学习年度会议(7th Annual Conference on Robot Learning)中。PMLR,2023。访问于 2026-06-26。

[62] Wan 团队, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, 和 Ziyu Liu。Wan:开放且先进的大规模视频生成模型,2025。访问于 2025-11-18。

15

第 16 页

[63] Qiuheng Wang, Yukai Shi, Jiarong Ou, Rui Chen, Ke Lin, Jiahao Wang, Boyuan Jiang, Haotian Yang, Mingwu Zheng, Xin Tao, 等。Koala-36m:一个大规模视频数据集,改善细粒度条件与视频内容之间的一致性。在计算机视觉与模式识别会议论文集,页码 8428–8437,2025。访问于 2026-06-22。

[64] Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, 和 Jiwen Lu。Drivedreamer:面向自动驾驶的真实世界驾驶世界模型。在欧洲计算机视觉会议,页码 55–72。Springer,2024。访问于 2026-06-22。

[65] Yuning Wang, Pu Zhang, Lei Bai, 和 Jianru Xue。Fend:一种用于长尾轨迹预测的未来增强分布感知对比学习框架。在 IEEE/CVF 计算机视觉与模式识别会议论文集,页码 1400–1409,2023。访问于 2026-06-22。

[66] Chuan Wen, Xingyu Lin, John So, Kai Chen, Qi Dou, Yang Gao, 和 Pieter Abbeel。用于策略学习的任意点轨迹建模,2024。访问于 2025-07-02。

[67] Youpeng Wen, Junfan Lin, Yi Zhu, Jianhua Han, Hang Xu, Shen Zhao, 和 Xiaodan Liang。Vidman:利用视频扩散模型中的隐式动力学进行有效的机器人操作。在神经信息处理系统进展,页码 41051–41075。Curran Associates, Inc.,2024。访问于 2026-06-26。

[68] Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pierric Cistac, Tim Rault, Rémi Louf, Morgan Funtowicz, Joe Davison, Sam Shleifer, Patrick von Platen, Clara Ma, Yacine Jernite, Julien Plu, Canwen Xu, Teven Le Scao, Sylvain Gugger, Mariama Drame, Quentin Lhoest, 和 Alexander M. Rush。Transformers:最先进的自然语言处理。在 2020 年自然语言处理实证方法会议论文集:系统演示,页码 38–45,在线,2020。计算语言学协会。访问于 2026-06-26。

[69] Haofei Xu, Jing Zhang, Jianfei Cai, Hamid Rezatofighi, Fisher Yu, Dacheng Tao, 和 Andreas Geiger。统一光流、立体视觉和深度估计。IEEE 模式分析与机器智能汇刊,45(11):13941–13958,2023。访问于 2026-06-26。

[70] Jingjing Xu, Xu Sun, Zhiyuan Zhang, Guangxiang Zhao, 和 Junyang Lin。理解与改进层归一化。在神经信息处理系统进展。Curran Associates, Inc.,2019。访问于 2026-06-26。

[71] Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, Da Yin, Yuxuan Zhang, Weihan Wang, Yean Cheng, Bin Xu, Xiaotao Gu, Yuxiao Dong, 和 Jie Tang。 Cogvideox:具有专家 Transformer 的文生视频扩散模型。在第十三届学习表征国际会议,2025。访问于 2026-06-26。

[72] Biao Zhang 和 Rico Sennrich。均方根层归一化。在神经信息处理系统进展。Curran Associates, Inc.,2019。访问于 2026-06-26。

[73] Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiao-Xiao Long, 等。Epona:用于自动驾驶的自回归扩散世界模型。在 IEEE/CVF 国际计算机视觉会议论文集,页码 27220–27230,2025。访问于 2026-06-22。

[74] Artem Zholus, Carl Doersch, Yi Yang, Skanda Koppula, Viorica Patraucean, Xu Owen He, Ignacio Rocco, Mehdi SM Sajjadi, Sarath Chandar, 和 Ross Goroshin。Tapnext:将任意点跟踪(Tap)作为下一个令牌预测。在 IEEE/CVF 国际计算机视觉会议论文集,页码 9693–9703,2025。访问于 2026-06-22。

[75] Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, 和 Abhishek Gupta。统一世界模型:耦合视频与动作扩散以在大型机器人数据集上进行预训练。在机器人:科学与系统会议论文集,美国加利福尼亚州洛杉矶,2025。访问于 2026-06-26。

16

第 17 页

参数编码器 逐点解码器 完整解码器 密度估计器

深度 24 3 28 12 宽度 1024 1024 1152 768 归一化 RMSNorm [72] LayerNorm [5] RMSNorm [72] RMSNorm [72] FFN 扩展因子 3 n/a 3 3 激活函数 SwiGLU [53] GELU [24] SwiGLU [53] SwiGLU [53] 位置编码 3D RoPE [26, 57] n/a 3D RoPE [26, 57] 2D RoPE [26, 57] 静态场景条件 AdaLN [44, 70] n/a n/a n/a 潜在条件 n/a AdaLN [44, 70] 上下文内 上下文内 图像编码器 DINOv2R-B [15, 41] n/a n/a n/a

批次大小 256 优化器 AdamW [37] 学习率 1e −4 1e −4 1e −4 1e −5 学习率调度 线性 + 常数 学习率调度步数 300 线性预热步数 贝塔值 (0.9, 0.95) 条件稀疏度 1% 条件 稀疏度调度 从 50% 线性 + 常数 常数 稀疏度调度步数 50k 线性预热步数 n/a 训练步数 450k 200k 150k 精度 bfloat16 可训练参数 510M 34M 522M 97M

GPU 16 Nvidia H200 训练时间 4 天 1 天 1 天

数据集 开放集视频 片段数量 20M 跟踪器 TapNext [74] 跟踪器位置播种 1024 个随机位置 位置尺度 [0,1] 图像尺寸 224 × 224

表 A.1:超参数。我们在下方总结了 GARFIELD 及我们方法所有组件的训练配置。

A 实现细节

超参数。评估和定性结果中使用的所有 GARFIELD 模型的超参数总结于表 A.1。我们使用 AdamW [37] 优化器,配合 300 步的线性学习率预热和 0.0001 的最终常数学习率,对带有逐点解码器的编码器模型进行总共 450k 步的训练。所有训练运行均使用 256 的全局批次大小。在编码器训练期间,我们从 bT/T = 50% 的已知位置开始,并在前 50k 次训练迭代中线性减少未来知识的数量至 bT/T = 1%。我们发现这种关于条件稀疏度的课程学习有助于更好地遵循条件约束,而从超过 bT/T = 50% 的已知位置开始会导致训练不稳定。完整解码器和密度估计器使用冻结的编码器模型,并采用相同的批次大小、优化器和学习率进行训练。在解码器训练期间,我们保持条件稀疏度恒定,并分别对这些模型进行 150k(密度解码器)和 200k(完整解码器)次迭代训练。所有训练均使用 bfloat16 精度,并在 16 块 Nvidia H200 GPU 上并行执行以提高效率。

从具有高度多样性的 20M 视频片段开始,我们应用 TapNext [74] 获取训练数据。跟踪器以随机时空位置进行播种。在训练过程中,我们应用可见性过滤器,以确保模型观察到的所有点在第一帧 I 中可见。我们进一步利用跟踪器预测的置信度以确保高质量的轨迹用于训练。我们相对于图像尺寸对位置进行归一化,使得可见轨迹位于 [0, 1] 范围内。在从预训练的基础图像特征提取器 [55] 获取图像特征之前,起始帧被调整大小为 224 × 224 分辨率,该提取器在编码器训练期间进行微调。

对于标记化,已知的条件轨迹位置 bT 被编码为傅里叶特征,而未知的轨迹位置被替换为可学习的查询标记。对于已知位置,我们拼接来自相应位置的图像特征。此外,编码器对所有图像特征执行交叉注意力。生成的标记序列被传递到编码器中深度为 24 层、宽度为 1024 的 Transformer。编码器为所有已知和未知位置生成潜在变量。虽然我们监督所有位置,但在评估时忽略条件位置。编码器 Transformer 的标记最终被降维至固定的潜在维度 64,并应用 tanh 函数以获得最终的潜在表示。我们进一步在训练期间添加小的噪声扰动,以确保局部

17

第 18 页

平滑潜在空间 [52]。我们使用标准的 Llama 风格 Transformer,配备 RMSNorm [72]、SwiGLU [53] 激活函数和 RoPE [57] 位置嵌入。逐点解码器是一个宽度为 1024 的三层 MLP,使用 GELU [24] 激活函数和 LayerNorm [5]。逐点解码器接收采样点的噪声版本作为输入,并通过自适应归一化 [44, 70] 对扩散时间步和潜在变量进行条件控制。最后一层将隐藏维度降维至点的维度。完整的解码器实现为 DiT [44],其架构与编码器类似。它通过自适应归一化对扩散时间步进行条件控制,并通过将噪声输入与相应的潜在表示拼接,对编码器潜在变量的完整集合进行条件控制。Transformer 令牌最终被降维至数据维度。密度估计器实现为 S-sized ViT [17],深度为 12,宽度为 768。它通过对网格令牌序列前置单个潜在变量来进行条件控制。这些网格令牌初始化为傅里叶嵌入的网格位置。我们进一步添加一个可学习的查询令牌,用于处理越界位置。密度解码器的 Transformer 令牌最终被降维至每个网格单元和越界位置的维度为一,从而提供交叉熵 logits。

我们使用逐点流匹配目标(公式 (B.5))对编码器和逐点解码器进行预训练。完整解码器使用所有轨迹位置的流匹配目标进行训练。密度估计器使用网格交叉熵损失(公式 (4))进行训练。我们在编码器或解码器模型中不强制执行任何注意力掩码,从而使模型能够利用关于未来已知部分的信息以及轨迹间其他轨迹位置的相关性。

条件控制。我们以不同方式对解码器施加编码器潜在变量的条件控制。对于完整解码器 $D_\theta$,每个轨迹点 $t_{i\tau}$ 对应 DiT 中的确切一个特定处理令牌和潜在分量 $z_{i\tau}$。因此,我们通过使用上下文条件控制来强制执行这种结构,即在将令牌传递给 DiT 层之前,将噪声 DiT 输入与相应的潜在变量拼接。

对于逐点解码器 MLP $D_{p\psi}$,条件信号更强且更容易解释,因为它仅接收单个潜在变量 $z_{i\tau}$ 来去噪单个轨迹点 $t_{i\tau}$。因此,我们采用自适应归一化 [44, 70] 来实现条件控制机制。我们使用学习矩阵 $Z_{i\tau} = \text{proj}_Z(z_{i\tau})$ 对潜在变量进行线性投影,并将投影后的潜在变量添加到扩散时间步 $\kappa$ 的嵌入中。组合条件 $c = \text{proj}_c(\{Z_{i\tau}, \kappa\})$ 随后用于通过学习的线性投影计算缩放 $\gamma(c)$ 和偏移 $\beta(c)$。然后我们修改标准归一化并计算: $$ \text{AdaNorm}(x, \gamma(c), \beta(c)) = \gamma(c)\text{Norm}(x) + \beta(c). \quad (\text{A.1}) $$

我们在每个 MLP 层之前应用自适应归一化,使每个非线性投影对潜在变量进行条件控制。与逐点模型类似,密度估计器 $D_{d\omega}$ 仅处理对应于单个轨迹点 $t_{i\tau}$ 的单个潜在变量 $z_{i\tau}$。然而,与完整解码器类似,密度估计器处理令牌序列以实现更强的条件控制。但是,密度估计器不是生成式扩散模型,而是确定性网络。我们选择上下文条件控制的变体,其中潜在变量 $z_{i\tau}$ 被投影到模型维度 $Z_{i\tau} = \text{proj}_{\text{dens}}(z_{i\tau})$ 并前置到对应于网格单元的令牌序列中。因此,密度估计器可以通过自注意力利用潜在信息,而无需引入交叉注意力或自适应归一化带来的额外复杂性。

运动建模的位置嵌入。我们在 Transformer 模型中使用 3D Axial RoPE [26, 57] 进行位置嵌入。然而,我们重新利用 3D RoPE 的空间组件以减轻信息泄露并促进轨迹连贯性。因此,对于我们的编码器模型,我们使用真实时间步信息,将每个网格潜在变量锚定到特定时间点,但对于空间定位,我们仅使用第一个时间步 $\tau = 0$ 的真实位置。我们假设 $\tau = 0$ 的位置可通过观测获得,而未来位置通常未知。因此,每个令牌输入到 RoPE 的位置 $\text{pos}$ 由下式给出:

$$ \text{pos} = (x_{\tau=0}, y_{\tau=0}, \tau), \quad (\text{A.2}) $$

这向令牌提供了其空间起源和时间位置的信息。注意,场景元素 $i$ 的轨迹 $t_i$ 上的每个点 $t_{i\tau}$ 共享相同的 2D 起始位置 $(x_{\tau=0}, y_{\tau=0})$,从而使模型能够识别哪些点位于同一条轨迹上。

图像令牌使用与空间轨迹位置相同的坐标系,因此使用相同的位置嵌入进行位置嵌入,设置 $\tau = 0$。这通过对齐旋转,简化了轨迹令牌到相应图像区域的交叉注意力。

对于完整解码器,我们通过选择随机位置 $\tilde{x}_{\tau=0}, \tilde{y}_{\tau=0} \sim [0, 1]$ 来进一步防止信息泄露,而

18

第 19 页

仍使用真实的时序信息 $\tau$。因此,我们保留了通过共享空间位置推断哪些点位于同一轨迹上的能力,但真实起始位置必须从潜在变量中获取,从而防止任何信息泄露。密度估计器使用标准的 2D Axial RoPE 对网格单元的位置进行嵌入,而逐点解码器模型不需要任何位置嵌入。

静态相机条件。我们复用 FPT [8] 中的静态相机检测。因此,如果场景中运动幅度大于 $m$ 的运动比例小于 $\alpha$,我们则认为相机是静态的,

$$ \mathbf{1}_{\text{static}_{\alpha,m}} = \sum_{i=0}^{N} \sum_{\tau=0}^{H-1} \mathbb{1}_{\|\mathbf{t}_{i}^{\tau+1} – \mathbf{t}_{i}^{\tau}\|_2 > m} < \alpha (H – 1)N \quad \text{(A.3)} $$

其中,$\mathbb{1}_c = \begin{cases} 1, & \text{if } c \\ 0, & \text{otherwise} \end{cases}$

这里 $N$ 是轨迹数量,$H$ 是时间视界。我们在训练数据集上手动调整 $\alpha = 0.45$ 和 $m = 0.0002$,以最大化在带有 TapNext 标注的 100 个手动标注训练片段上正确检测的 F1 分数。然后,我们嵌入 $c = \text{emb}(\text{static})$ 并在编码器中应用式 (A.1) 中定义的自适应归一化 [44, 70],其中缩放 $\gamma(c)$ 和偏移 $\beta(c)$ 由静态相机嵌入 $c$ 的投影确定,即 $(\gamma(c), \beta(c)) = \text{proj}(c)$。这使得能够在具有移动相机和静态相机的混合数据上进行训练,同时固定相机以获得可解释的推理结果。因此,潜在嵌入编码了场景是否具有静态或移动相机的信息。

机器人规划数据处理。为了匹配 Track2Act 的密集运动预测,我们选择每个视频样本中运动幅度最高的 256 条轨迹来评估我们的方法,并将其余部分视为静态背景而丢弃。由于我们的模型是使用 $i \in \{1 \dots 64\}$ 条轨迹训练的(见第 4.1 节),我们将这 256 条轨迹分为 4 个不相交的 64 条轨迹子集,作为我们评估的地面真值(GT)。

B 一般流匹配

生成模型旨在从未知数据分布中生成样本。我们基于流匹配 [2, 3, 34, 36] 的框架,该框架在图像和视频生成等复杂领域展示了强大的模式覆盖能力和高质量的样本 [19, 39, 46, 50]。

流匹配通过将样本从简单的先验分布 $x_0 \sim p_0$ 转移到数据分布 $x_1 \sim p_1$ 的样本来从数据分布生成样本。这种变换通过连续时间依赖过程 $x_\kappa = \alpha_\kappa x_1 + \sigma_\kappa x_0$ 定义,其中 $\alpha_\kappa$ 和 $\sigma_\kappa$ 是控制扩散时间 $\kappa \in [0, 1]$ 上插值过程的函数。训练模型预测速度场

$$ v(x_\kappa, \kappa) = \frac{dx_\kappa}{d\kappa} = \dot{\alpha}_\kappa x_1 + \dot{\sigma}_\kappa x_0 \quad \text{(B.4)} $$

允许通过对扩散时间数值积分该过程来从数据分布中采样。

我们使用标准流匹配损失训练 $v_\theta(x_i, i)$:

$$ L_v(\theta) = \mathbb{E} \left[ \int \| v_\theta(x_\kappa, \kappa) – (\dot{\alpha}_\kappa x_1 + \dot{\sigma}_\kappa x_0) \|_2^2 d\kappa \right]. \quad \text{(B.5)} $$

我们使用由 $\alpha_\kappa = \kappa$ 和 $\sigma_\kappa = (1 – \kappa)$ 定义的整流流插值 [36]。

数据分布 $p_1$ 的密度可以通过蒙特卡洛(MC)采样进行估计,即从不同的先验样本开始,从模型生成 $N_{MC}$ 个样本。理论上,当 $N_{MC} \to \infty$ 时,该估计收敛于真实密度。然而,在实践中,对于大型模型而言,准确的密度估计仍然昂贵得令人望而却步。

19

第 20 页

C 指标细节

终点误差。我们测量终点误差(EPE),即预测轨迹与真实轨迹之间的平均距离。考虑一组包含 $N$ 个场景元素 $i$ 和 $H$ 个时间步 $\tau$ 的轨迹 $T = \{t_{i\tau}\}$。给定预测 $\tilde{T} = \{\tilde{t}_{i\tau}\}$,该示例的终点误差计算如下

$$ \text{EPE}(T, \tilde{T}) = \frac{1}{H \cdot N} \sum_{i=0}^{N} \sum_{\tau=0}^{H-1} d_{i\tau}, \quad (\text{C.6}) $$

其中 $$ d_{i\tau} = \|t_{i\tau} – \tilde{t}_{i\tau}\|_2^2. \quad (\text{C.7}) $$ 为了公平比较,我们仅针对预测轨迹点 $\bar{T} = T \setminus \hat{T}$ 评估 EPE,并忽略条件位置 $\hat{T}$。 由于多个未来可能与相同的约束对齐,我们计算预测集成 $\tilde{E} = \{\tilde{T}_n\}$(其中 $n \in [1, N_{MC}]$)并取最小值

$$ \min\text{EPE}(T, E) = \min_{\tilde{T} \in E} \text{EPE}(T, \tilde{T}). \quad (\text{C.8}) $$ 因此,每种方法都有机会生成一系列可能的预测。注意,$\min\text{EPE}$ 等同于常用的 $\min\text{ADE}$ 指标。除非另有说明,EPE 指的是在多个场景上平均后的 $\min\text{EPE}$,为了便于阅读简化了符号表示。对于表 3 中 ETH/UCY 上行人轨迹预测的评估,我们遵循标准做法,对观测到的智能体而非场景进行 $\min\text{ADE}$ 平均。

最终距离误差。遵循标准做法,我们额外报告最终距离误差(FDE),即预测最终位置与真实最终位置之间的 L2 距离。因此,对于包含 $N$ 个场景元素 $i$ 和 $H$ 个时间步 $\tau$ 的轨迹 $T = \{t_{i\tau}\}$,FDE 由预测轨迹 $\tilde{T} = \{\tilde{t}_{i\tau}\}$ 在最后时间步 $H-1$ 的平均误差给出:

$$ \text{FDE}(T, \tilde{T}) = \frac{1}{N} \sum_{i} \|t_{iH-1} – \tilde{t}_{iH-1}\|_2^2. \quad (\text{C.9}) $$ 与 EPE 类似,我们仅针对预测轨迹点 $\bar{T} = T \setminus \hat{T}$ 报告 FDE,并使用多个场景上平均后的预测集成中的最小 FDE。对于 ETH/UCY,我们再次遵循常见做法,对智能体而非场景进行平均。

关键点正确率。我们报告关键点正确率(PCK)作为给定预定义阈值时的轨迹预测准确性指标。给定包含 $N$ 个场景元素 $i$ 和 $H$ 个时间步 $\tau$ 的轨迹 $T = \{t_{i\tau}\}$ 以及预测 $\tilde{T} = \{\tilde{t}_{i\tau}\}$,我们首先计算每个轨迹点的距离 $D = \{d_{i\tau}\}$(见公式 (C.7))。然后,对于阈值 $\alpha$,$\text{PCK}@ \alpha$ 由下式给出

$$ \text{PCK}@ \alpha(D) = \text{PCK}@ \alpha(\{d_{i\tau}\}) = \frac{1}{H \cdot N} \sum_{\tau=0}^{H-1} \sum_{i=0}^{N} \mathbb{1}_{d_{i\tau} < \alpha} \quad (\text{C.10}) $$ 其中,$\mathbb{1}_c = \begin{cases} 1, & \text{if } c \\ 0, & \text{otherwise} \end{cases}$。

因此,$\text{PCK}@ \alpha$ 衡量的是落在距离真实值 $\alpha$ 范围内的预测比例。

我们将 $\alpha$ 定义为相对于图像尺寸的大小,并且仅针对预测点报告 $\text{PCK}@10\%$ 和 $\text{PCK}@1\%$,忽略作为条件信息提供的点。我们再次在多个场景上平均 PCK 值,并通过取 $N_{MC}$ 个样本的预测集成中的最大值来选取最佳预测。

曲线下面积。对于我们的机器人规划评估,我们遵循 Track2Act [10],报告 PCK 阈值下的曲线下面积。实际上,我们通过十个 $\alpha$ 的总和来估计 PCK(见公式 (C.10)的积分。

20

第 21 页

阈值: A A 1 a Z a ∆= X PCK@ (D) ≈ PCK@ (D) da, (C.11) A S 0 S a=1

其中 D 是轨迹点之间的 L2 距离,A = 10 是以像素为单位的最高阈值,S = 256 是像素分辨率,使得 0.39 % ≤α ≤3, 91 %。

能量评分(Energy Score, ES)。[20] (ES) 是一种用于评估多元变量概率预测的严格评分规则。给定定义在 X ∈Rd 上的预测分布 P 和观测值 y,能量评分计算如下:

ES(P, y) = EX∼P ∥X −y∥ −1 ∥X −X′∥ . (C.12) 2EX,X′∼P

第一项衡量来自分布的样本到观测值的期望距离,而第二项奖励预测分布中的多样性。因此,ES 平衡了对观测值的接近程度与内部多样性。较低的值表示更校准的预测。

如果分布 P 由 NMC 个独立样本 {x1, . . . , xNMC} 的集成表示,则期望可以通过经验近似,从而得到集成能量评分:

NMC 1 1 ES y, {xn}NMCn=1 = X ∥xn −y∥− 2 X X ∥xn −xm∥. (C.13) NMC n=1 2NMC n=1 m=1

注意,如果集成过于分散,第二项减少评分的幅度小于第一项增加评分的幅度,从而惩罚信心不足的预测。

离散能量评分(Discrete Energy Score)。为了评估网格上离散化概率分布的校准情况,我们将每个网格单元解释为一个位置,通过取归一化到全图像大小的网格单元中心,并忽略越界位置。因此,离散化概率分布被解释为定义在 g × g 个位置 su,v ∈[0, 1]2 上的分布,其中网格索引 u, v ∈{1, . . . , g}。概率 P(X = su,v) 由分配给网格单元 (u, v) 的离散概率 pu,v 给出。

基于此,该分布的多元能量评分可以精确计算(即不需要经验集成近似):

g g ES(P, y) = X X pu,v ∥su,v −y∥2 u=1 v=1 g g g g (C.14) −1 X X X X pu,vpu′,v′ ∥su,v −su′,v′∥2. 2 u=1 v=1 u′=1 v′=1

注意,与连续能量评分相比,离散化引入了不同的值范围。然而,基于集成的方法的离散能量评分可以通过计算落入网格单元区域的样本的相对频率,并对 resulting 概率进行归一化,使得 Pgu=1 Pgv=1 pu,v = 1 来计算。因此,离散化使得基于集成的方法和直接生成非参数概率热力图的方法之间的比较成为可能。

延迟(Latency)。延迟测量是在单个 Nvidia H200 GPU 上以大小为 1 的批次进行的,并且仅报告计算单个实现的时间,而非整个集成。我们在计算延迟测量之前预热模型运行,并在可能的情况下使用编译。为了公平起见,嵌入起始帧的时间也包含在延迟测量中。我们使用 diffusers [60, 68] 中的管道用于 LTX [22] 和 CogVideoX [71],并使用 Motion-I2V [54]、Track2Act [10] 和 FPT [8] 的官方仓库。注意,对于 FPT,我们使用两个自回归循环,导致延迟增加:对条件提示(conditioning pokes)进行自回归更新以实现一致的预测,以及对每个时间步进行独立采样以获得完整轨迹,而不是单步估计。

21

第 22 页

条件预测 方法 外观条件 运动条件 子目标 时空稀疏 时空密集 无采样不确定性 Track2Act [10] ✗ ✗ ✗ ✓ ✓ ✗ Motion-I2V [54]/ ✓ ✓ ✓ ✗ ✓ ✗ Motion Modes [42] FPT [8] ✓ ✓ ✗ ✓ ✗ ✓ What happens next [11] ✓ ✗ ✗ ✗ ✓ ✗ GARFIELD (Ours) ✓ ✓ ✓ ✓ ✓ ✓

表 C.2:概念性对比。与相关方法不同,我们旨在对时空上稀疏的轨迹进行密集的时间运动分布建模,同时允许通过单次 NFE 进行不确定性估计,而无需昂贵的扩散采样。

D 与先前运动模型的概念差异

为了澄清,我们详细阐述 GARFIELD 与先前开放集概率运动模型之间的概念差异。针对每个差异,我们提供论证以解释我们公式的优势。我们将预测运动的条件(即输入)与预测内容(即输出)的差异分开。表 C.2 总结了我们的对比。

D.1 条件

未来外观独立性。Track2Act [10] 等先前方法对预期结果的外观进行条件约束。它们不仅需要来自当前的起始帧,还需要来自终点的完整 RGB 细节的目标帧。我们认为 (i) 虽然外观差异包含运动规划所需的所有信息,但关于目标的信息并不能直接为运动模型所获取,(ii) 以图像形式存在的目标包含不应影响运动规划的虚假额外信息(例如光照),(iii) 系统的最终外观信息往往难以获取,而位置可以由用户更轻松地提供,以及 (iv) 虽然可以通过估计语义对应关系从起始帧和目标帧推断位置变化,但从起始帧和位置变化推断 RGB 细节并非易事,这凸显了 GARFIELD 相对于基于外观的条件约束具有更高的通用性。因此,我们选择仅基于位置信息的无外观条件约束。

局部条件约束。What happens next? [11] 使用的文本描述和目标图像 [10] 可以向模型提供关于未来的信息。然而,文本本质上粗糙且模糊,而完整图像则过于详细。因此,对于这两种输入模态,模型都需要额外的容量来提取关于哪些场景元素应移动到哪里的局部信息。相比之下,我们直接提供与特定场景元素关联的局部目标,将建模容量集中在实际的轨迹规划上,而不是目标理解上。

子目标条件约束。此外,Track2Act [10] 和 FPT [8] 等先前方法仅对最终目标位置进行条件约束。GARFIELD 还允许指定在通往最终目标的途中应经过的子目标。通过允许在空间和时间上稀疏但任意分布的未来位置条件约束,我们的条件约束具有最大灵活性。这使得用户能够提供他们拥有并感到自信的关于未来的确切信息和假设(如果有的话)。

D.2 预测

空间稀疏运动。大多数先前的开放集运动模型,如 Track2Act [10]、What happens next? [11] 和 Motion-I2V [42, 54],对场景的未来演变进行密集预测。它们预测光流 [42, 54] 或在密集网格上采样的点轨迹 [10, 11]。受封闭域轨迹预测中规范基线 [1, 21, 51] 和更近期的开放集 FPT [8] 的启发,我们认为 (i) 对空间稀疏的相关点子集进行运动建模足以获得有意义的未来估计。此外,(ii) 对空间稀疏点进行运动建模计算成本更低,因为我们专注于重要的部分,而不是浪费精力去建模静态场景元素。

22

第 23 页

方法目标 EPE ↓ 延迟 ↓

4 0.076 AR (Dpψ) 71.4 16 0.040 4 0.014 GARFIELD (Ours) Dθ 0.40 16 0.012

表 D.3:自回归(AR)与联合预测对比。联合预测在轨迹质量和延迟方面均优于 AR rollout。在训练数据的保留验证集上评估。

我们在开放场景中发现,大量轨迹是静态的,并在图 D.1 中可视化了运动直方图。此外,在类似于 What happens next? [11] 中使用的网格上进行运动采样会导致我们的模型延迟增加 10 倍。因此,专注于显著、移动且离网格的场景元素可以显著加快推理速度。

时间密集运动。FPT 模型 [8] 提供空间稀疏预测。然而,它们仅对两个离散时间点之间的运动进行建模。我们推测(i)下游任务(如机器人规划)受益于一系列小变化,而不是在相对较远的时间步之间的大变化。此外,(ii)单步模型(如 FPT)必须在内部处理所有相互依赖和交互,限制了其在复杂多物体交互场景中的性能(见表 F.11)。GARFIELD 对空间稀疏的相关物体集合预测时间密集轨迹估计。

无采样不确定性。基于生成扩散 [10, 11, 42, 54] 的概率运动模型通过重复采样提供对潜在未来运动分布的隐式访问。然而,估计未来事件的似然性和概率以及对场景中可能发生的情况量化不确定性成本高昂,因为它需要蒙特卡洛近似。相比之下,我们提出学习未来概率分布的结构化嵌入,该嵌入可以在不到一毫秒的时间内解码为概率估计,从而实现数量级更快的密度估计。此外,在我们的实验中,直接密度估计始终优于蒙特卡洛采样。

联合建模。FPT [8] 在概念上最接近我们的工作,它仅对每个时间步的每个场景元素预测边缘分布,并通过自回归(AR)保持空间一致性。将 FPT 的 AR 扩展到多步视界(类似于 MYRIAD [9])需要早期承诺,这将时空相互依赖分解为边缘分布。通过使用双向编码器,我们的潜在变量对可能的运动学联合分布进行建模,其中每个点的不确定性由整个场景告知,而无需贪婪承诺。从这些潜在变量中,我们采样完整轨迹并估计未来位置的密度。经验上,表 D.3 显示,我们的 GARFIELD 联合全解码器在样本质量和效率方面优于扩展到多步和子目标条件的基于扩散的 FPT 风格 AR 变体。

E 扩展评估

测试时可扩展性。图 E.2a 展示了更多的函数评估和更大的蒙特卡洛集成如何影响能量评分。对于大型集成,投入更多计算(以 NFE 形式)到每个个体成员中具有一致的收益。然而,对于小型集成,当 NFE 较高时,能量评分略有发散。我们将此归因于采样过程中的误差累积。图 E.2b 中可视化的离散化能量评分也呈现相同的趋势。逐点解码器需要三个数量级的更多计算才能产生接近离散模型性能的集成。总体而言,采样更多且更高质量的实现会导致更好的运动规划结果,使用户能够根据其当前需求平衡这种权衡。

离散化能量评分的扩展比较。我们在图 E.2c 中通过更昂贵的基线扩展了图 6b,以进一步强调我们提出的密度估计器 Ddω 的优势。我们的密度解码器产生的预测优于大型视频生成模型,且延迟降低了五个数量级。

额外的校准指标。为了进一步验证由 Ddω 解码的密度的校准情况,我们额外计算了真实轨迹的负对数似然(NLL)、可靠性曲线(|ˆT| = 4)以及覆盖率与名义值。

23

第 24 页

GARFIELD DE GARFIELD (1 NFE) GARFIELD (10 NFE) 0.06 0.020 GARFIELD DE GARFIELD (25 1 0.15 NMC = 5 NMC = 10 NMC = 100 Score GARFIELD MC 1 = 1 100 = NFE) Score 0.019 = = FPT MC=1 0.05 MC MC=1 MC Motion-I2V MC MCScore MC=10 10 0.018 0.10 LTX 10 Energy 10 = 100 = 100 Energy = 0.04 = = MC 0.017 MC MCEnergy 0.05 MC=1 MC=10 0.03 0.016 Discrete MC=1MC=10 MC=10 Discrete 5 10 25 50 100 101 102 103 104 105 100 101 102 103 104 105 FM Function Evaluations Latency (ms) (log) Latency (ms)

(a): Energy Score vs. NFE and MC sam- (b): Discrete Energy Score vs. NFE and (c): Discrete Energy Score vs. Latency for ples for point-wise Dpψ. MC samples. more baselines.

图 E.2:校准权衡。我们可视化了良好校准的密度估计(由较低的(离散)能量评分指示)与估计这些密度的计算延迟之间的权衡。虽然更多的 NFE 和更大的集成能改善运动预测,但它们也会引入额外的延迟。在 (b) 和 (c) 中,我们还展示了添加条件项($|b_T| \in \{0, 1, 2\}$)如何进一步降低相同模型和集成规模下的离散能量评分。

1.0 1.0 Motion-I2V Motion-I2V MC) 4 (10 Motion-I2V 4 FPT FPT GT 0.8 = 0.8 = GARFIELD (10 MC) GARFIELD (10 MC) of 10 |T| |T| GARFIELD (100 MC) GARFIELD (100 MC) 0.6 0.6 GARFIELD (10 MC) FPT GARFIELD (DE) GARFIELD (DE) NLL with with MC) (100 GARFIELD 0.4 0.4 5 0.2 Coverage 0.2 Categorical GARFIELD (DE) Accuracy 0.0 0.0 0 2 4 8 16 0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0 Number of conditioning points |T| Confidence with |T| = 4 Nominal Coverage

(a): GT 轨迹的 NLL。(b): 可靠性图。(c): 覆盖率与名义覆盖率。

图 E.3:密度校准。来自密度解码器 $D_{d\omega}$ 的密度在真实轨迹的负对数似然(NLL)方面始终优于蒙特卡洛采样,并优于强大的基线方法。在训练数据的保留验证集上进行评估。

覆盖率曲线($|\hat{T}| = 4$)。请注意,虽然(离散)能量评分和 NLL 是严格评分规则,但可靠性和覆盖率可能在方差膨胀下得到改善,因此应仅视为其他指标的补充。图 E.3a 显示,我们的密度解码器 $D_{d\omega}$ 在 NLL 方面不仅优于基线方法,也优于来自完整解码器 $D_\theta$ 和逐点解码器 $D_{p\psi}$ 的 MC 估计。这凸显了直接密度解码优于通过蒙特卡洛采样估计密度的优势。此外,图 E.3b 和图 E.3c 显示,我们的密度解码器 $D_{d\omega}$ 在可靠性和覆盖率方面与强大的基线具有竞争力,同时始终优于 MC 采样。

与 FPT 的额外比较。FPT [8] 模型旨在预测条件图像 $I$ 与未来单个时间步之间的流,这与 GARFIELD 密集地对时间进行运动建模不同。具体而言,FPT 只能接收关于其应预测的确切时间步 $\tau$ 的未来知识,而我们的方法允许在不同时间点进行条件设置和预测。由于我们考虑的是运动规划任务,我们通过使用时空稀疏条件设置重新运行 FPT 以针对不同的时间视界进行评估,以匹配我们的方法,如表 1 所示。然而,GARFIELD 也可以应用于 FPT 训练的设置中,仅对单个时间步进行条件设置并预测该步骤的其余点。表 E.4 证明了 GARFIELD 在这种设置中具有竞争力。虽然 FPT 实现了略优的性能,但我们的方法无需针对此类运动插值任务进行训练即可实现相似的性能。

与 Motion-I2V 的额外比较。Motion-I2V [54] 预测光流以根据文本提示和拖拽(对应于我们的目标)动画化图像。然而,Motion-I2V 旨在接受随时间变化的完整轨迹作为输入,这与我们时空稀疏的条件设置本质上不同。为了使基线具有可比性,我们遵循 Motion-I2V 论文 [54] 中概述的稀疏条件设置协议,并将稀疏已知目标线性插值为完整轨迹以进行表 1 中的比较。然而,Motion-I2V 在其使用完整轨迹作为条件的原生设置中表现明显更好(见表 E.5),但这需要密集地知道场景元素在每个时间步的位置。

24

第 25 页

带有 | bT| 终点目标的 FDE 方法 0 1 2 4 8 16

FPT [8] 0.017 0.017 0.015 0.014 0.013 0.009 GARFIELD (Ours) 0.022 0.020 0.019 0.018 0.014 0.013

表 E.4:终点运动插值。我们比较了模型在给定场景中其他元素的终点时,推断场景中元素最终位置的能力。在训练数据的保留验证集上进行评估。

此外,Motion-I2V 仓库建议在推理时使用 cfg 尺度为 7.0,我们在主要评估对齐中一直使用此设置。然而,我们发现使用 cfg 2.0 时性能有所提升,我们将其归因于更高的方差预测导致对搜索空间的更好探索。表 E.5 显示,在稀疏条件情况下,我们的方法在所有指标上仍保持优势。然而,结合密集条件与 cfg 扫描的见解,Motion-I2V 达到了接近我们运动规划的质量。

关于行人轨迹预测的更多细节。我们在表 3 中扩展了对行人轨迹预测的评估。我们报告了零样本性能以及经过最小微调后的性能。对于微调结果,我们使用逐点解码器模型对编码器进行 4k 次迭代训练,批量大小为 128。我们修改了掩码策略,始终提供初始八个位置作为条件,并训练模型预测接下来的十二个位置,且不利用未来知识,以匹配推理设置。我们进一步对损失进行掩码,仅监督预测部分。然后,通过替换微调后的编码器,并在相同的预测设置下对完整解码器进行 4k 次迭代训练,从而微调完整解码器。对于 Stanford Drones 数据集 [49],我们使用官方的训练-测试划分,而对于 ETH/UCY [31, 45] 场景,我们使用留一法微调。由于 GARFIELD 需要 RGB 输入,我们仅使用 ETH、Hotel、Univ、Zara01 和 Zara02 场景进行微调和评估,这与 IDM [35] 执行的评估相匹配。

表 E.7 显示了 Stanford Drones 数据集 (SDD) [49] 上更多基线的结果。无需针对预测进行训练,GARFIELD 实现了与 Social-LSTM [1] 相当的零样本性能。微调后,GARFIELD 优于 Social-GAN [21],并与 CGNS [32] 和 Goal-GAN [16] 具有竞争力。尽管我们没有超越最近的领域特定方法,但这一结果突显了 GARFIELD 学到的通用世界知识。

类似地,表 E.6 显示了 ETH/UCY 数据集的更多基线和更多子集的结果。同样,GARFIELD 的零样本性能(从未针对预测进行训练)与既定方法相匹配。虽然即使是我们微调后的模型也没有超越最近的最先进基线,但 GARFIELD 的 ADE 仍低于 1 米,为自动驾驶等下游应用提供有用的信息。

请注意,我们在表 E.7 和表 E.6 中比较的方法专门针对行人轨迹预测设计,无法预测场景中其他元素的运动。因此,与 GARFIELD 对运动学的通用理解相比,这些方法在实际应用中的有用性有限。

公共数据上的替代训练。在主论文中,我们展示了一个在多样化内部数据集上训练的模型。为了确保可复现性,我们还使用相同的配置在公共 Koala-36M [63] 数据集的子集上训练 GARFIELD。表 E.8 将我们的主模型与在公共数据上训练的模型进行了比较。我们发现差异可忽略不计。

数量 PCK ↑ PCK ↑ 方法 CFG EPE ↓ FDE ↓ 目标 @10% @1%

4 7.0 0.055 0.864 0.150 0.060 16 7.0 0.033 0.957 0.263 0.037 Motion-I2V [54] 4 2.0 0.022 0.982 0.428 0.029 16 2.0 0.016 0.992 0.577 0.030 4 × H 7.0 0.051 0.886 0.166 0.053 16 × H 7.0 0.027 0.981 0.312 0.030 4 × H 2.0 0.021 0.986 0.447 0.026 16 × H 2.0 0.013 0.996 0.602 0.016

4 1.0 0.020 0.973 0.544 0.026 GARFIELD (Ours) 16 1.0 0.013 0.989 0.666 0.017

表 E.5:与 Motion-I2V [54] 的扩展比较。当输入完整轨迹且视界为 H 时,Motion-I2V 在运动规划方面表现明显更好。

25

第 26 页

方法 ETH Hotel Univ Zara1 Zara2

ADE FDE ADE FDE ADE FDE ADE FDE ADE FDE

Social-LSTM 1.09 2.35 0.79 1.76 0.67 1.40 0.47 1.00 0.56 1.17 Social-STGCN 0.64 1.11 0.49 0.85 0.44 0.79 0.34 0.53 0.30 0.48 Causal-STGCN 0.64 1.00 0.38 0.45 0.49 0.81 0.34 0.53 0.32 0.49 STAR 0.36 0.65 0.17 0.36 0.31 0.62 0.26 0.55 0.22 0.46 Expert-GMM 0.37 0.65 0.11 0.15 0.20 0.44 0.15 0.31 0.12 0.26 PCCSNET 0.28 0.54 0.11 0.19 0.29 0.60 0.21 0.44 0.15 0.34 Social-GAN 0.81 1.52 0.72 1.61 0.60 1.26 0.34 0.69 0.42 0.84 Goal-GAN 0.59 1.18 0.19 0.35 0.60 1.19 0.43 0.87 0.32 0.65 Social-BiGAT 0.69 1.29 0.49 1.01 0.55 1.32 0.30 0.62 0.36 0.75 MG-GAN 0.47 0.91 0.14 0.24 0.54 1.07 0.36 0.73 0.29 0.60 CGNS 0.62 1.40 0.70 0.93 0.48 1.22 0.32 0.59 0.35 0.71 PECNET 0.54 0.87 0.18 0.24 0.35 0.60 0.22 0.39 0.17 0.30 Trajectron++ 0.39 0.83 0.12 0.21 0.20 0.44 0.15 0.33 0.11 0.25 LB-EBM 0.30 0.52 0.13 0.20 0.27 0.52 0.20 0.37 0.15 0.29 MID 0.39 0.66 0.13 0.22 0.22 0.45 0.17 0.30 0.13 0.27 IDM 0.41 0.62 0.15 0.25 0.20 0.42 0.17 0.28 0.12 0.25

GARFIELD (Ours) 0-shot 1.09 1.79 0.41 0.71 0.60 1.12 0.72 1.37 0.55 1.05 GARFIELD (Ours) FT 0.84 1.44 0.29 0.56 0.58 1.19 0.33 0.65 0.33 0.67

表 E.6:ETH/UCY 行人预测。我们展示了表 3 的扩展变体,包含 ETH/UCY [31, 45] 中的所有场景以及更多基线方法。误差单位为米。我们的方法实现了具有竞争力的性能,同时支持开放集运动建模。

0.006 Motion-I2V GARFIELD (Ours) 0.005 minEPE 0.004

0.003 Recon

0.002 0 1 2 4 8 16 条件点数量

图 F.4:重建误差。GARFIELD 能够准确重建条件点,展示了其作为给定点的表示能力,超越了单纯的规划方法。

性能。我们提供了在内部数据上训练的模型的检查点和结果,因为我们希望多样化的训练数据能引入更通用的世界知识,作为下游领域的基础。

F 扩展消融实验

重建质量。图 F.4 展示了将作为 C 一部分提供的点 $\hat{T}$ 输入编码器时的重建质量。我们发现,在整个条件密度范围内,GARFIELD 都能实现近乎完美的重建(EPE < 0.003;在 256² 图像上 < 1 像素)。因此,GARFIELD 不仅是一种强大的运动规划方法,还能够以最小的信息损失编码给定轨迹,这是 Motion-I2V [54] 等先前方法无法做到的。

超越跟踪器伪影的性能。GARFIELD 是使用在视频数据上运行的现成点跟踪器 TapNext [74] 获得的伪真值进行训练和评估的。表 2 和表 3 中使用人工标注数据 [31, 45, 49] 和 CoTracker3 [29] 的实验部分表明,我们的模型能够泛化到其原始训练设置之外。然而,监督和评估目标中的跟踪器伪影可能会阻碍对真实运动理解的评估。因此,我们通过测试在 TapNext [74] 标注上训练的模型在 TapNext 以及 OpenVid-1M 中由 CoTracker3 [29] 标注的开放集片段上的表现,对 GARFIELD 的运动理解进行消融实验,结果见表 F.9a。我们发现,无论使用哪种跟踪器作为预测目标,GARFIELD 的表现都同样出色。此外,当给定相同的视频并使用相同的跟踪查询进行初始化时,TapNext 和 CoTracker3 估计出相似的轨迹(见表 F.9b)。虽然我们未进一步检查每种跟踪方法的偏差,但这一结果验证了我们的模型学习了

26

第 27 页

方法 minADE-20 minFDE-20

Social-LSTM 57.00 31.20 Expert+GMM 10.67 14.38 SimAug 10.27 19.71 PCCSNET 8.62 16.16 Y-Net 8.97 14.61 Social-GAN 27.23 41.44 Goal-GAN 12.20 22.10 MG-GAN 13.60 25.80 CGNS 15.60 28.20 Trajectron++ 8.98 19.02 PECNET 9.96 15.88 LB-EBM 8.87 15.61 MID 7.61 14.30 IDM 7.46 13.83

GARFIELD (Ours) 0-shot 36.77 49.86 GARFIELD (Ours) FT 19.92 34.98

表 E.7:斯坦福无人机数据集。我们展示了表 3 针对斯坦福无人机数据集 [49] 的扩展变体。误差相对于原始视频分辨率以像素为单位。我们的方法在无需领域特定适配的情况下实现了相当的性能。

(a) 逐点 Dpψ (b) 完整 Dθ |ˆT| EPE ↓ FDE ↓ |ˆT| EPE ↓ FDE ↓

Ours Koala Ours Koala Ours Koala Ours Koala

0 0.017 0.015 0.023 0.020 0 0.017 0.016 0.022 0.021 4 0.013 0.012 0.017 0.016 4 0.014 0.014 0.018 0.018 8 0.011 0.012 0.015 0.015 8 0.013 0.013 0.016 0.016 16 0.011 0.011 0.015 0.015 16 0.012 0.012 0.015 0.015

表 E.8:公开与私有数据集。我们比较了使用两个不同视频数据集训练我们模型的效果:一个内部数据集和 Koala-36M [63] 的子集。在公开可用数据上训练实现了相当的性能,确保了结果的可复现性。在 OpenVid-1M [40] 数据的子集上进行评估。

超越单一跟踪方法产生的伪影的运动概念。

密度估计器目标。我们使用网格交叉熵损失公式 (4) 训练密度估计器。或者,我们可以通过对逐点解码器进行蒙特卡洛采样,构建热力图,并使用均方误差损失训练密度估计器以回归热力图,从而将逐点解码器学到的分布蒸馏到确定性模型中。通过这种方式,密度估计器的替代损失变为

1 Laltω = X ∥p(u,v)ω (tiτ | ziτ) −p(u,v)ψ,MC(tiτ | ziτ)∥22, (F.15) g2 (u,v)∈G

其中 p(u,v)ω (tiτ | ziτ) 是密度估计器 Ddω 对网格单元 (u, v) 的预测概率,而 p(u,v)ψ,MC(tiτ | ziτ) 是通过对条件为潜在变量 ziτ 的逐点解码器 Dpψ 进行 NMC 次采样,并计算逐点样本落入网格单元 (u, v) 的相对频率获得的。 使用此目标进行训练在准确的目标 p(u,v)ψ,MC(tiτ | ziτ) 和采样 NMC 次实现所需的时间之间引入了根本性的权衡,因为当 NMC −→∞ 时,p(u,v)ψ,MC(tiτ | ziτ) −→p(u,v)。此外,表 F.10 显示,蒸馏后的密度估计器实现了显著更差的校准,导致离散能量评分恶化增加。我们得出结论,当 NMC 太小时,蒸馏后的密度估计器会过拟合逐点解码器产生的伪影,而交叉熵变体在真实位置方面具有更稳定的监督目标。

基于熵的条件信号的鲁棒性。我们评估使用熵作为提供额外条件的位置信号的鲁棒性。为此,我们用随机噪声扰动提供的额外条件,模拟人类标注者对正确约束的不确定性。图 F.5 揭示了基于熵的条件是

27

第 28 页

(a): 推理性能 |ˆT| EPE ↓ FDE ↓ PCK@1% ↑ (b): 跟踪器一致性 TN CT TN CT TN CT EPE ↓ 0.003 0 0.017 0.017 0.022 0.022 0.731 0.725 PCK@10% ↑ 0.995 2 0.015 0.015 0.018 0.019 0.786 0.771 PCK@1% ↑ 0.942 8 0.013 0.013 0.016 0.016 0.807 0.799 16 0.012 0.012 0.015 0.015 0.821 0.812

表 F.9: 替代跟踪器伪真值。我们在 TapNext (TN) [74] 和 CoTracker (CT) [29] 标注的数据上评估了 TapNext 训练模型的性能,发现性能相似。我们进一步发现 TapNext 和 CoTracker 之间具有高度一致性。因此,我们的模型泛化能力超越了特定跟踪器的伪影,学习了有用的运动表示。在 OpenVid [40] 评估数据子集上进行评估。

离散能量评分 ↓ |ˆT| 交叉熵蒸馏

0 0.061 0.202 2 0.043 0.199 8 0.030 0.198 16 0.026 0.197

表 F.10: 使用交叉熵 (CE) 目标(公式 (4))训练密度估计器目标,相比使用蒸馏目标(公式 (F.15))训练,在任何数量的条件点 |ˆT| 下均能获得更低的离散能量评分 (dES; 公式 (C.14))。在训练数据的保留验证集上进行评估。

比基于 EPE 预言机的条件设置具有显著更强的鲁棒性。我们的条件变体不仅在相同的扰动水平下实现了一致更好的性能,而且在更强的扰动下发散速度更慢。

多物体交互。为了测试超越运动学的力驱动动力学,我们在合成台球模拟 [18] 的数据上训练我们的模型和 FPT [8],并比较多达 16 个球的预测精度。我们选择一秒的时间视界(40 步,∆t = 0.025 秒),因为我们发现该视界足以容纳多个球与球之间的交互。请注意,这要求 FPT 在内部对多球交互进行建模,而 GARFIELD 能够逐步推理交互过程。表 F.11 展示了 GARFIELD 在引入更多球并因此迫使更多球交互发生时,实现了相对稳定的性能。虽然从两个球增加到八个球时性能略有下降,但在增加到 16 个交互场景元素时性能保持稳定。相比之下,FPT 在整个球数范围内实现了显著更差的性能。

图 G.13 定性展示了给定起始速度和终点条件时随时间变化的台球交互。GARFIELD 能够正确推断中间时间步的交互。这突显了 GARFIELD 理解和推理多个交互实体的能力。

样本与密度的对齐。作为对 Dθ 和 Dpψ 采样轨迹与 Ddω 解码分布之间对齐的额外验证,我们计算了 Ddω 分布下样本的负对数似然 (NLL)。图 F.6 显示,与真实轨迹或替代模型(Motion-I2V [54])的轨迹相比,来自 Dθ 或 Dpψ 的样本在 Ddω 下更有可能出现。这进一步加强了解码相同潜在可能性空间的模型之间对齐的证据。

单次性能。仅给定部分未来知识时,多种结果可能同样合理。因此,

EPE ↓ 方法 2 个球 4 个球 8 个球 16 个球

FPT [8] 0.260 0.237 0.225 0.218 GARFIELD (Ours) 0.140 0.182 0.196 0.186

表 F.11: 多物体交互。GARFIELD 随着球数增加表现出一致的性能,突显了其建模多个物体间交互的能力。

28

第 29 页

0.12 0.10 = 0.050 =0.025 0.08 =0.010 EPE 0.06 == 0.0000.050 =0.025 0.04 entropy = 0.010 epe = 0.000 0.02 0 2 8 16 条件点数量 |T|

图 F.5:基于熵的条件鲁棒性。与基于 EPE 的条件相比,基于熵选择条件对扰动条件更具鲁棒性。在训练数据的保留验证集上进行评估。

6.61 6.37 5.90 3.45 3.16 2.87 DE3

2.25 2.20 1.92 1.88 1.86 under2 1.67 NLL 1 cat. 0 0 4 16 条件点数量 |T| 图 F.6:解码密度下样本的 NLL。与真实轨迹或替代模型(Motion-I2V [54])的样本相比,来自 Dθ 或 Dpψ 的样本在 Ddω 下更有可能。这加强了我们所有解码器解码共享可能性空间的假设。

轨迹预测性能通常在“N 选 1”设置下进行评估(参见 [1, 9, 11, 21, 51])。然而,在实际应用场景中,选择最佳轨迹可能是不可能的。然而,表 F.12 强调 GARFIELD 在单次生成设置中仍然具有高度竞争力。

G 附加定性样本

对于动画定性示例,请参阅附件中的视频样本,汇总于 video_samples/index.html。

我们在图 G.7 中将我们的模型与开放集基线进行定性比较,对表 1 进行定性补充。对于 TI2V 模型,我们展示了使用 TapNext [74] 从生成视频中提取的轨迹,这些轨迹匹配运动规划评估设置。CogVideoX [71]、LTX [22] 预测出逼真的运动,但由于缺乏适当的条件,其样本被不必要的相机运动所主导,并且未能匹配真实的速度和方向。FPT [8] 由于仅对两个时间点之间的光流进行建模,无法预测一致的轨迹,因此需要为每个时间范围独立重新运行模型。Motion-I2V [54] 和 Track2Act [10] 倾向于预测较低的运动幅度,限制了它们在复杂运动样本中的适用性。GARFIELD 能够采样与目标最接近对齐的运动,仅需 |bT| = 4 个已知位置。

此外,我们在图 G.10、图 G.9 和图 G.8 中展示了 GARFIELD 使用 Ddω 进行密度估计的示例。当 τ 接近 0(当前时刻)和/或提供更多条件 bT 时,GARFIELD 变得更加确定。即使

方法 目标 EPE↓

CogVideoX [71] n/a 0.020 Motion-I2V [54] 4 0.036 FPT [8] 4 0.123 GARFIELD (Ours) 4 0.015

表 F.12:单次生成性能。GARFIELD 在单次生成设置中与基线保持竞争力。在 OpenVid [40] 完整验证数据的一个子集上进行评估。

29

第 30 页

未提供未来信息时,真实轨迹位于或靠近 GARFIELD 认为可能的区域;当提供更多信息时,GARFIELD 对正确区域的置信度会提高。

在图 G.11 和图 G.12 中,我们可视化了机器人与行人的预测轨迹。在机器人设置中,仅给定每条轨迹的最终目标位置时,GARFIELD 无需任何领域特定训练即可规划合理的机器人运动。对 GARFIELD 进行微调后,它能够预测交通场景中行人的真实轨迹。

GARFIELD 能够处理并预测动力学,例如图 G.13 所示的台球模拟中的多物体交互。它能够基于每个球的最终位置和初始速度预测并解决多次碰撞,这展示了其对物理动力学的理解。

30

第 31 页

GARFIELD 输入 CVX LTX MI2V (16) T2A FPT (16) 本文方法 (4) 本文方法 (16) 真实值

图 G.7:在 OpenVid-1M [40] 上的定性比较。我们选取运动幅度较大的样本,并忽略静态和近乎静态的点以进行可视化。与表 1 类似,我们将 CogVideoX [71] (CVX)、LTX [22]、Motion-I2V [54](带 16 个条件点,即 MI2V (16))、Track2Act [10] (T2A) 以及带 16 个条件点的 Flow Poke Transformer [8](即 FPT (16))与 GARFIELD 进行比较。

31

第 32 页

τ = 0 τ = 8 τ = 16 τ = 24 τ = 32 + GT

0.8

0.6 scaled) 0.4 0.2 (power Probability

0.0

0.35 0.30 0.25 0.20 scaled) 0.15

0.10 (power 0.05 Probability

0.00 0.6 0.5 0.4 0.3 scaled)

0.2 0.1 (power Probability

0.0

图 G.8:在条件为 |bT| = 4 个未来位置时的密度样本。GARFIELD 在接近真实值(Ground-Truth)时始终预测出高置信度,但对于确切速度仍保持合理的 uncertainty。

Input τ = 0 τ = 8 τ = 16 τ = 24 τ = 32 + GT

0.6 0.5 0.4 0.3 scaled)

0.2 (power 0.1 Probability

0.0

0.20

0.15 0.10 scaled) 0.05 (power Probability

0.00

0.35 0.30 0.25 0.20 scaled) 0.15

0.10 (power 0.05 Probability

0.00

图 G.9:在条件为 |bT| = 2 个未来位置时的密度样本。虽然 GARFIELD 在时空体积的某些点上仍保持不确定性,但运动趋势倾向于与观测到的方向一致。

32

第 33 页

τ = 0 τ = 8 τ = 16 τ = 24 τ = 32 + GT 0.6 0.5 0.4 0.3 scaled)

0.2 0.1 (power Probability

0.0

0.8

0.6 0.4 scaled) 0.2 (power Probability

0.0

0.175 0.150 0.125 0.100 scaled) 0.075

0.050 (power 0.025 Probability

0.000

图 G.10:无未来条件约束的密度样本。在没有未来知识的情况下,GARFIELD 对确切发生的运动仍保持不确定性,但能够基于其通用世界知识估计出正确的区域。

图 G.11:定性机器人规划。来自 GARFIELD 在 RT1 [12](前三例)和 BridgeData [61](后三例)数据集中的样本。我们仅展示超过运动阈值的轨迹,并在必要时进一步对轨迹进行子采样,以实现可解释的可视化。

图 G.12:定性行人轨迹预测。使用 GARFIELD 预测的 ETH/UCY [31, 45](第一行)和 SDD [49] 的轨迹。叉号 (×) 表示给定位置,点 (·) 表示预测位置。轨迹经过子选择,仅保留在第一帧和最后一帧中可见的轨迹,以确保适当的可视化效果。

33

第 34 页

τ ≤16 τ ≤24 τ ≤32 τ ≤40 τ ≤48 τ ≤56 τ ≤64

真实轨迹

预测轨迹

真实轨迹

预测轨迹

图 G.13:多物体交互。GARFIELD 能够在给定最终位置和初始速度的条件下,解析多个物体碰撞的动力学过程。

34

第 35 页

H 版权

本文采用的样式改编自 arXiv 预印本《Discrete Flow Matching》(Gat 等人,2024),该预印本遵循 CC BY 4.0 许可协议。在全文及图表中,我们使用 Fira Sans 字体(遵循 OFL v1.1 许可)用于粗体文本。

35

发表评论