MotionForesight:复用视频模型进行未来3D场景流预测

三分钟导读:MotionForesight通过掩蔽未来帧并利用轻量级适配器,将预训练的3D跟踪模型TrackCraft3R转化为未来3D轨迹预测器,仅使用40K人类交互视频即可实现无需语言或动作标签的物体运动预测。

英文题目:MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

论文出处:arXiv 每日论文精选 · arXiv:2607.16192

原始论文:PDF / 论文页面

对应视频标题:MotionForesight:复用视频模型进行未来3D场景流预测|推荐指数:★★★★★

这篇论文解决什么问题?

从被动单目视频中预测被操作物体的未来3D运动(3D scene flow),无需刚性假设或类别特定的运动参数化。

核心创新

  • 将回顾性3D跟踪模型重构为前瞻性预测模型,通过掩蔽未来输入实现。
  • 提出参考锚定的3D轨迹场表示,统一描述刚性、关节和非刚性运动。
  • 无需语言或动作标签,仅凭视觉上下文即可泛化到分布外场景。
  • 证明预训练视频模型中的时间先验可直接重定向用于几何运动预测。

方法概览

基于TrackCraft3R架构,保留冻结的视频DiT和跟踪解码器;将未来时间步的RGB和几何潜在变量替换为学习的掩码潜在变量;仅训练一个轻量级LoRA适配器和输出头,以伪地面真值进行监督。

逐图理解论文

方法概述与架构

方法概述与架构
Figure 3: Architecture. We preserve TrackCraft3R’s dual-latent construction. Observed frames produce standard RGB and pointmap geometry latents. Future geometry slots are filled by learned mask latents. The frame-0 track/query latent is repeated across all timestamps, and temporal RoPE assigns the target future time. A frozen video DiT with a small fresh LoRA predicts future residual-track latents, which the frozen track decoder converts into future tracking pointmaps.

MotionForesight基于TrackCraft3R架构,保留冻结的视频DiT和跟踪解码器。其核心创新在于将未来时间步的RGB和几何潜在变量替换为学习的掩码潜在变量。模型仅训练一个轻量级LoRA适配器和输出头,以伪地面真值进行监督。这种设计使得模型能够利用预训练视频模型中的时间先验,直接重定向用于几何运动预测,实现了从回顾性跟踪到前瞻性预测的转变。

参考锚定3D轨迹场

参考锚定3D轨迹场
Figure 2: MotionForesight predicts future reference-anchored 3D tracks from passive human video. Given observed RGB frames and pointmaps obtained through estimated monocular depth, for the first T1 frames, the model forecasts the future motion of the manipulated object for the next T2 steps. The output is an explicit 3D trajectory field over points on the manipulated object and does not require a rigid-body or category-specific motion parameterization.

该方法提出参考锚定的3D轨迹场表示,统一描述刚性、关节和非刚性运动。给定观察到的RGB帧和通过估计单目深度获得的点图,模型对前T1帧进行观察,并预测接下来T2步的未来运动。输出是操作物体上点的显式3D轨迹场,无需刚性体或类别特定的运动参数化。这种表示方法使得模型能够灵活处理各种复杂的物体交互场景。

训练策略与数据

训练策略与数据
Table 3: Scaling with human-interaction videos. We evaluate models trained on increasingly large, action- stratified subsets of SSv2 while holding all other settings fixed.

MotionForesight仅使用40K人类交互视频进行训练,无需语言或动作标签。模型通过伪地面真值进行监督,这些真值来源于单目深度估计和跟踪结果。这种数据高效的训练策略使得模型能够在有限的标注数据下实现良好的性能。与依赖1M训练数据和语言指令的MolmoMotion相比,MotionForesight展示了在数据稀缺场景下的优势。

SSv2与OOD实验结果

SSv2与OOD实验结果
Table 1: Comparison on SSv2 and OOD phone videos. All methods use the same observed interval and prediction horizon. Rows below the horizontal rule receive a ground-truth action description and therefore use more test-time information than MotionForesight. Note that MolmoMotion is trained with 1M videos from diverse sources. MotionForesight is trained with 40k RGB videos from SSv2.

在SSv2未见视频上,MotionForesight的ADE为4.47cm,FDE为6.23cm,PWT@5cm为76%。在OOD手机视频上,ADE为9.31cm,FDE为14.88cm,PWT@5cm为54%。这些结果表明,尽管数据量较小,MotionForesight在标准数据集和分布外场景下均表现出强大的预测能力。与视频生成基线相比,其几何一致性显著更优。

长上下文泛化能力

长上下文泛化能力
Table 2: Long-context evaluation on OOD phone videos. The first 50% of each video is observed and the remaining 50% is forecast. All methods share the same split and evaluation inputs; the language- conditioned MolmoMotion variant and the Video generation model additionally receive the ground-truth action description in language where specified.

在长上下文OOD视频评估中,前50%视频作为观察,后50%作为预测。MotionForesight的ADE为10.20cm,优于MolmoMotion的11.90cm(无语言)和12.57cm(有语言)。这一优势表明,强几何 grounding 在将更丰富的观察上下文转化为度量一致的未来运动方面尤为有用。即使MolmoMotion拥有更大、语言配对的训练语料库,MotionForesight仍表现出更强的泛化能力。

实验与关键结果

  • 在SSv2未见视频和OOD手机视频上与MolmoMotion及视频生成基线对比。
  • 评估不同训练数据规模(1K, 10K, 40K)对性能的影响。
  • 使用TVO, VVO, MoveF1, DQS等运动条件指标评估动力学一致性。
  • 长上下文(50%观察,50%预测)下的泛化能力测试。
  • SSv2未见视频ADE: 4.47 cm, FDE: 6.23 cm, PWT@5cm: 76%(第 9 页)
  • OOD手机视频ADE: 9.31 cm, FDE: 14.88 cm, PWT@5cm: 54%(第 9 页)
  • 长上下文OOD视频ADE: 10.20 cm (优于MolmoMotion的11.90 cm无语言和12.57 cm有语言)(第 9 页)
  • 运动条件指标TVO: 0.231, DQS: 0.326 (40K模型)(第 11 页)

阅读时需要注意

  • 确定性预测,无法表示多模态未来。
  • 监督信号为伪地面真值,依赖单目深度和跟踪的准确性。
  • 运动幅度校准不足(平均运动比率r=0.72,存在欠预测)。
  • 训练数据仅限于40K SSv2剪辑,未涵盖头部佩戴视角或长时交互。
  • ADE/FDE指标仅与单一记录的未来轨迹比较,可能低估物理上合理但不同的预测。
  • OOD评估中的伪地面真值本身存在估计误差。

关联工作

  • MolmoMotion:并发工作,预测稀疏3D轨迹,但依赖语言指令和1M训练数据。(第 4 页)
  • TrackCraft3R:基础模型,提供冻结的视频DiT和3D跟踪接口。(第 3 页)
  • Wan2.1:预训练视频DiT骨干网络。(第 6 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

MotionForesight 大脑、机器人与行为实验室

MotionForesight

重新利用视频模型进行未来3D场景流预测

Homanga Bharadhwaj∗ Yash Jangir∗ (∗作者贡献相同)

约翰斯·霍普金斯大学计算机科学系 hbharad2@jhu.edu yjangir@jhu.edu

2026 7月 17 [cs.CV]

图 1: MotionForesight 预测多样化日常操作场景中的合理运动

摘要。人类可以通过被动观察推断物体可能的运动方式:杯子可能会被抬起,抽屉可能会滑动,盖子可能会旋转关闭。此类预测揭示了在现实世界中行动所需的交互物理后果。我们研究如何从普通的人类-物体交互单目视频中学习这种预判能力。给定一个短小的观察视频上下文,MotionForesight 预测被操作物体上点的未来 3D 轨迹。这将交互预测转化为无需对物体属性做任何假设的以物体为中心的 3D 运动预测。我们的关键见解是,视频预测模型已经编码了关于物体在人类交互过程中如何运动的丰富先验知识。我们将这些先验知识从像素预测重定向至未来 3D 场景流。我们从一个基于预训练视频模型的密集 3D 跟踪器开始,从完整片段生成伪真值轨迹,并仅使用观察到的帧来训练预测器。我们用学习到的掩码潜在变量替换未来的 RGB 和几何信息,并训练一个轻量级适配器,将回溯性跟踪表示转化为前向预测器,同时冻结大型视频和跟踪组件。仅使用 40K 个人类视频,且无需语言等辅助输入,MotionForesight 能够在分布外(OOD)的多样化物体、环境、视角和交互中泛化。它还优于使用超过一百万个训练视频的大得多的模型。这些结果表明,我们可以高效地将视频先验知识重新利用为具身智能的显式几何预测。motionforesight.github.io

1

第 2 页

MotionForesight 大脑、机器人与行为实验室

1 引言

“思维最基本的特性之一,在于其预测事件的能力。” —肯尼斯·克雷克,《解释的本质》

具身智能的一个核心组成部分不仅是识别已经发生的事情,还要预判接下来会发生什么。当人们看到一只手靠近杯子、一把刀压入水果或一个柜门开始移动时,他们往往会在运动完成之前就推断出物体可能的未来构型。这种能力超越了视觉预测,反映了对物体功能、接触、约束和目标的理解。认知科学的研究长期以来强调,知觉与行动可能性紧密相关[1],运动支持结构化的场景解释[2],并且人类经常通过心理模拟物理未来来进行推理[3]。Gergely等人[4]的经典理性模仿结果进一步表明,婴儿不仅仅是模仿我们的行为,而是根据目标和约束来解释观察到的动作。因此,建模交互效应至关重要:对于观察学习而言,重要的是在特定情境下物体会如何移动,而不是产生该移动的具体手部动作。 在本文中,我们解决从日常单目人类视频中预测被操作物体未来3D场景流的问题。3D场景流提供了一种通用的场景运动推断表示:它不局限于刚性姿态等特定类别的状态,而是描述3D场景中的点随时间如何移动。我们的设定与相关方向在两个主要方面有所不同:用于指定未来的信息以及用于描述运动的表示。一些方法依赖语言或动作接地来预测稀疏的3D点轨迹[5]或刚性6自由度物体操作轨迹[6]。其他方法直接从视觉观测中预测未来的刚性6自由度物体姿态[7]。虽然姿态表示对于刚性物体来说非常紧凑,但它无法自然地描述关节部件、可变形表面或局部非刚性运动。一些先前的工作预测机器人操作的未来2D点轨迹[8–10],而我们的目标是显式的未来度量3D运动,而不是下游控制设置中的图像平面轨迹。我们专注于稠密的、参考锚定的3D场景流,因为它为交互动力学提供了一个通用接口:它是度量而非图像平面的,以物体为中心而非以具身为中心的,并且不限于单一的刚性姿态参数化。原则上,相同的表示可以描述刚性物体、关节部件、可变形表面和局部物体运动。因此,从日常视频中学习这种预测是一个引人入胜的问题:日常视频充满噪声且不受约束,但它们包含了关于人们如何使用物体时物体如何移动的广泛证据。 我们的关键见解是,日常人类视频已经描述了我们想要预测的常见物体的运动,而现代视频模型可能编码了关于此类运动如何展开的有用先验。在大型视频语料库上训练的模型必须表示时间规律性,如接触、功能、物体持久性和合理的短视域动力学,即使其原生输出是未来的图像或视频潜在表示。我们询问这些先验是否可以重定向到更明确的几何目标。MotionForesight不生成未来像素然后再恢复运动,而是直接预测附着在物体上的点的未来3D轨迹场。该模型利用观察到的上下文来推断交互的可能演变,但其输出保持为一个紧凑的度量运动表示,可以被下游规划或具身推理系统所消费。这种直接的几何预测对于动态机器人操作也具有计算吸引力:它避免了花费推理时间来渲染未来的RGB帧,然后运行单独的跟踪或重建管道来恢复机器人实际需要的运动。通过直接预测未来3D运动,该模型暴露了一个可操作的表示,其开销低于生成后跟踪的替代方案。

2

第 3 页

MotionForesight 大脑、机器人与行为实验室

A. 离线人类数据整理 B. 未来运动预测任务

完整视频成为伪 观测上下文 $I_{0:T_1-1} \rightarrow$ $T_2$ 步未来 3D 轨迹 真值 3D 运动

完整交互视频

观测前缀 未来槽位

$t=T_1,\dots,T_1+T_2-1$

开始 接触 掉落 冻结视频 RGB 隐藏 先验 $t=0, \dots, T_1+T_2-1$ + $t=0$ $\cdots$ $t=T_1-1$ 小未来 点图 适配器 隐藏 帧-0 对象查询 可训练 未来 3D 轨迹 RGB 帧 + 估计点图

真实帧-0 对象 完整片段伪真值 1 观测上下文 2 掩码未来 3 预测未来 3D 运动 掩码 轨迹

仅用于训练监督的未来帧 不对刚体/可变形物体做假设 · 无需语言/动作标签

图 2: MotionForesight 从被动人类视频中预测未来的参考锚定 3D 轨迹。给定观测到的 RGB 帧和通过估计的单目深度获得的点图,对于前 $T_1$ 帧,模型预测被操作物体接下来 $T_2$ 步的未来运动。输出是被操作物体上点的显式 3D 轨迹场,不需要刚体或特定类别的运动参数化。

具体而言,MotionForesight 重新利用了 TrackCraft3R [11],这是一个基于视频 DiT [12] 构建的前馈密集 3D 跟踪器。TrackCraft3R 是回顾性的:它观测所有帧,将 RGB 帧和重建的点图编码为几何潜在变量,跨时间重复第一帧查询潜在变量,并预测参考锚定的跟踪点图。我们通过隐藏未来帧将此跟踪器转换为预测模型。对于观测前缀之后的时间戳,不可用的 RGB 和点图潜在变量由学习到的掩码潜在变量替换,同时保留帧-0 查询潜在变量和时间 RoPE 接口。因此,Transformer 接收观测到的 3D 上下文、参考帧对象查询和未来时间索引,并预测解码为未来 3D 轨迹的残差轨迹潜在变量。我们保持基础视频模型、原始 TrackCraft3R 适配器和 VAE 编码器/解码器冻结,仅训练一个新的低秩适配器、I/O 投影、预测头和掩码潜在变量。伪真值未来轨迹是通过在完整的人类交互片段上运行密集 3D 跟踪生成的,然后在训练过程中移除这些未来观测。

关键点。MotionForesight 使用被动单目人类视频来学习以物体为中心的未来 3D 运动。 这种表述通过关注被操作物体上的点可能如何移动,抽象掉了人类的运动指令和未来像素的外观。

总之,我们提出三项贡献。首先,我们将从随意 RGB 交互视频中进行未来 3D 场景流预测形式化为参考锚定的跟踪点图预测任务。其次,我们提出了一种数据整理流水线,利用密集 3D 跟踪和对象掩码将人类视频转换为伪真值未来轨迹,同时在训练时掩码未来帧。第三,我们对 TrackCraft3R [11] 进行了最小修改,将其从点轨迹提取模型重新用于未来点轨迹预测模型。我们表明,这种简单且计算高效的配方,仅在 40k 个 RGB 人类视频上训练,即可在通用真实世界场景中取得引人注目的运动预测结果。

3

第 4 页

MotionForesight 大脑、机器人与行为实验室

2 相关工作

视觉预测与世界模型。构建视觉世界演化模型一直是计算机视觉和机器人领域的核心问题。先前的工作预测未来的像素或潜在状态,以用于规划、控制和表示学习 [13–16]。最近的方法通过视频扩散、预测性视觉表示和学习的潜在动作模型扩展了这一思想 [17–23]。这些方法捕捉了有用的时间规律,但其预测通常表示为 RGB 帧、视频特征或动作条件的潜在状态,缺乏显式的对象级几何信息。我们的工作建立在视频模型所学的时间先验之上,但在输出表示上有所不同。MotionForesight 不生成未来像素或抽象特征,而是预测被操作对象上点的未来度量 3D 运动。

从人类视频中推断交互线索。诸如 Something-Something [24]、YouCook [25]、EPIC-Kitchens [26]、EGTEA [27] 和 Ego4D [28] 等大规模数据集使模型能够直接从视频中学习人机交互先验。一条研究路线预测未来的动作标签、活跃对象、接触区域、手部轨迹和交互热点 [29–36]。其他工作利用大规模活动和接触观察来学习人们如何与物体交互 [37, 38]。最近的方法预测语言或上下文条件的手部轨迹 [39, 40],而机器人学习方法预测 2D 点轨迹、掩码或视觉标记,作为与具身无关的计划 [8, 9, 41]。这些方法从人类视频中提取可操作的线索,但其预测主要仍停留在语义层面、以手部为中心或局限于图像平面。相反,MotionForesight 预测场景中点的连续 3D 轨迹,直接表示交互的物理后果,而无需语言/动作标签。

3D 几何提取与预测。另一条研究路线通过显式几何对交互进行建模。早期方法从视觉观察中估计 3D 手部和物体姿态 [42–46],或从 RGB 和 RGB-D 输入中恢复 6-DoF 物体姿态 [47–50]。最近的系统为视频分割和单目图像 3D 重建提供了互补工具:SAM 2 [51] 通过视频传播掩码,而 TRELLIS [52] 和 SAM 3D [53] 从图像中重建 3D 几何。未来几何预测也在自动驾驶和移动机器人场景中的激光雷达、点云和智能体轨迹预测方面得到了研究 [54–56]。更接近操作的任务中,方法预测语言条件的 6-DoF 轨迹 [6],将人类轨迹迁移到机器人具身 [57],或在语言、目标、RGB-D 或机器人动作条件下预测物体姿态、点运动和场景流 [7, 58, 59]。相比之下,MotionForesight 从单目 RGB 视频中预测稠密的、参考锚定的稠密 3D 轨迹,使得同一表示能够描述刚性、关节和可变形运动。与我们的工作同时进行的 MolmoMotion 预测了密切相关的输出:未来度量 3D 轨迹,但它基于短 RGB 历史和预期动作的语言描述来制定目标条件预测,并仅预测物体上 8 个点的运动 [5]。它在 MolmoMotion-1M 上训练,这是一个由 116 万个多样化视频构建的动作描述、物体接地语料库,而 MotionForesight 在 4 万个单目 SSv2 人类交互视频上训练,且不接收语言或动作输入。因此,这两项工作共享点轨迹输出表示,但研究了不同的监督范式:基于广泛视频语料库的稀疏点的语言接地意图, versus 基于观察到的交互的稠密 3D 流预测的被动视觉预期。

场景流与点跟踪。场景流和点跟踪提供了我们方法背后的运动表示。经典和学习的场景流方法估计观测帧之间的稠密 3D 运动,而最近的跟踪器通过相机运动、遮挡和非刚性变形恢复长距离对应关系 [11, 60–65]。这些方法主要是回顾性的:

4

第 5 页

MotionForesight 大脑、机器人与行为实验室

它们在观察相关帧后估计点的移动位置。我们利用这一能力来构建伪真值监督信号,并定义模型的输出接口。随后,我们通过隐藏未来观测数据,并让经过跟踪适配的视频骨干网络预测参考帧中的物体点在那些帧可用之前将移动到的位置,从而将回溯性跟踪转化为预测任务。

3 MotionForesight

MotionForesight 旨在从简短的视频上下文中预测场景中正在被操作的物体的未来运动。为实现这一目标,我们将视频预测问题表述为一个几何版本。我们不预测未来的图像,而是预测在观察到的交互过程中已经可见的物体点的未来运动。这一选择受具身智能场景的启发,在这些场景中,预测模型必须比捕捉纹理或外观的变化更精确地捕捉场景几何的变化。交互的物理后果通常通过物体在 3D 空间中的移动位置来表征,这比后续 RGB 帧的外观更能准确反映实际情况。 具体而言,给定 $T_1$ 个观测到的 RGB 帧,我们预测被操作物体上的点在接下来 $T_2$ 个时间步的未来 3D 轨迹。在推理阶段,我们仅观察到视频前缀 $I_{0:T_1-1}$。我们为每个观测帧估计一个点图 $P_t \in \mathbb{R}^{H \times W \times 3}$,并从参考帧 $a=0$ 中的物体掩码中采样查询点 $Q$。我们的目标是预测这些参考帧点的未来 3D 位置:

$\hat{X}_t(q) \in \mathbb{R}^3, \quad q \in Q, \quad t = T_1, \dots, T_1 + T_2 – 1.$ (1)

在训练期间,我们可以访问长度为 $T = T_1 + T_2$ 的视频。我们仅在离线阶段使用完整视频来提取伪真值 3D 轨迹;预测模型本身仅接收前 $T_1$ 个 RGB 帧及其估计的几何信息。我们将观测几何信息和未来轨迹表示在最后一个观测到的相机帧 $t = T_1 – 1$ 中,以减少由相机运动引起的视在运动。我们的默认设置使用 $T_1 = 7$,$T_2 = 15$,且 $T = 22$。模型不接收语言指令或动作标签等辅助输入。

3.1 数据整理:从 RGB 人类视频到 3D 物体轨迹

我们从 Something-Something V2 数据集中约 40K 个人机交互视频中构建伪真值监督信号。由于这些视频不提供度量 3D 轨迹或时间一致的物体掩码,我们使用离线分割、重建和跟踪流水线处理每个片段。 被操作的物体在第一帧中并不总是可见的,因此我们选择一个中间锚定帧,在该帧中物体足够清晰。我们使用数据集标注中的物体名称作为掩码提取的线索,在锚定帧上初始化 Segment-Anything [66],并将生成的掩码向前和向后传播通过整个片段。查询点在物体掩码内密集采样,并在存在有效物体支撑的地方保留。 我们使用 DepthAnything3 [67] 估计每帧的单目深度,恢复相机运动,并结合这两种估计来构建时间对齐的点图。然后,我们在完整片段上运行 TrackCraft3R [11],以获得采样物体点的参考锚定 3D 轨迹。生成的轨迹被转换到最后一个观测到的相机坐标系中,并与有效性掩码一起存储。完整片段仅用于离线伪标签生成;在训练期间,从不向预测模型提供未来的 RGB 帧和点图。

5

第 6 页

MotionForesight 大脑、机器人与行为实验室

新的 rank-32 预测 LoRA

观测到的输入 时间对齐的潜在槽位 残差 t=0,…,T₁−1 t=T₁,…,T₁+T₂−1 轨迹 冻结的视频 DiT 先验 潜在变量 RGB+PM RGB+PM RGB+PM MASK MASK + 冻结的 rank-1024 冻结的轨迹 跟踪 LoRA 解码器

q₀ q₀ q₀ q₀ q₀ I₀:T₁−1 RGB 帧 时间 RoPE: 0,…,T₁+T₂−1 P₀:T₁−1 点图 未来 3D 轨迹 q₀ 在所有 T₁+T₂ 个槽位中重复;未来 T₂ 预测步数 RGB 和几何结构使用学习到的掩码 来自第 0 帧的 q₀ 训练好的 patch 嵌入 + 预测头

解码坐标目标 L_dec = 0.25 L_observed + 1.0 L_future 蓝色 = 冻结 绿色 = 训练 金色 = 时间/残差

伪真实轨迹仅监督有效点;梯度通过冻结的解码器传递到绿色组件中。

图 3:架构。我们保留了 TrackCraft3R 的双潜在结构。观测到的帧生成标准的 RGB 和点图几何潜在变量。未来几何槽位由学习到的掩码潜在变量填充。第 0 帧的轨迹/查询潜在变量在所有时间戳中重复,时间 RoPE 分配目标未来时间。一个带有小型新 LoRA 的冻结视频 DiT 预测未来残差轨迹潜在变量,冻结的轨迹解码器将其转换为未来的跟踪点图。

3.2 观测到的视觉-几何上下文

第一个建模步骤是将观测到的视频前缀转换为视频 Transformer 消耗的潜在序列。对于每个观测到的帧 $I_t$,我们将 RGB 图像与其估计的点图 $P_t$ 配对。RGB 和几何流分别编码并连接成一个视觉-几何潜在变量, h i c_t = E_{rgb}(I_t); E_{pm}(P_t) , t < T_1. (2)

这里,$E_{rgb}$ 是 RGB VAE 编码器,$E_{pm}$ 是点图 VAE 编码器。点图归一化统计量仅使用观测前缀计算,因为在推理时未来几何结构不可用。 这两个流为模型提供了互补的证据。RGB 流捕捉外观、接触和人体-物体交互线索,而点图流提供度量场景结构和观测到的 3D 运动。结合起来,它们允许 Transformer 推理哪个物体在移动、它受到何种约束,以及其可见运动在未来可能如何继续。

3.3 用于视频先验的点-轨迹接口

预训练的视频模型包含有用的时间先验,但其原生输出不是度量 3D 轨迹。因此,我们从 TrackCraft3R [11] 开始,这是一个建立在视频 DiT Wan2.1 [12] 之上的密集 3D 跟踪模型。TrackCraft3R 提供了视频潜在变量与参考锚定 3D 点轨迹之间已学习到的接口。 对于完全观测到的跟踪片段,TrackCraft3R 使用两个时间对齐的潜在流。第一个是上述上下文流 $c_t$(第 3.2 节),它随每个视频帧变化。第二个是参考或查询流,它在每个时间戳重复参考帧的状态:

h i r_t = E_{rgb}(I_a); E_{pm}(P_a) , a = 0, t = 0, . . . , T −1. (3)

重复查询流使每个时间输出槽位成为相同的几何问题:参考帧中的每个点在时间 $t$ 处在哪里?视频 Transformer 接收上下文和查询潜在变量以及时间 RoPE,并预测残差轨迹潜在变量 $\hat{z}_{\Delta t}$。冻结的轨迹

第 7 页

MotionForesight 大脑、机器人与行为实验室

解码器将此潜在变量映射为3D残差,并将其加到参考点上:

ˆXt(q) = X0(q) + Dtrack(ˆz∆t )(q). (4)

因此,每个输出在几何上具有直接的解释意义,即参考帧中物体点的预测3D位置。点图 Pt 是通过将每帧的深度反投影,并将生成的3D点变换到参考相机坐标系中获得的。因此,所有几何输入共享一个共同的帧——这一关键属性使得模型能够生成参考锚定3D轨迹。TrackCraft3R 将视频 DiT 用作固定回归时间步长下的单步潜在回归器,而非迭代扩散采样器;MotionForesight 在将跟踪转换为未来预测时继承了这种确定性的单次通过接口。

3.4 将跟踪转化为预测

原始跟踪模型是回顾性的:它观察完整的视频并解释参考点移动到了哪里。我们通过隐藏所有未来的观测值,将其转化为预测模型。对于已观测的时间戳,上下文流包含实际的视觉-几何潜在变量,

h i ˜ct = Ergb(It); Epm(Pt) , t < T1. (5)

对于未来的时间戳,没有 RGB 图像或点图可用。因此,我们用学习到的掩码潜在变量替换未来上下文流的两个组成部分,

˜ct = h mrgb; mpmi , t ≥T1. (6)

RGB 掩码潜在变量 mrgb 和点图掩码潜在变量 mpm 在所有未来时间戳之间共享,并在空间上进行广播。它们不编码特定的未来外观或几何形状。相反,它们指示相应的时间槽未被观测到。时间旋转位置编码(RoPE)[68, 69] 为每个时间槽分配一个独特的时间索引,使得 Transformer 能够区分近期和长视距预测,尽管学习到的未知令牌内容是共享的。 我们将参考查询流在所有 T 个时间戳上重复。因此,模型接收已观测的视觉-几何上下文、每个时间戳相同的参考对象查询,以及每个请求的未来时间戳的时间索引。然后,它必须推断相应的物体点将移动到哪里。这种表述直接暴露了未来的3D场景流,而无需先生成 RGB 帧,然后再应用单独的重建或跟踪管道。

3.5 预测监督与目标

精心策划的完整片段轨迹提供了伪真实目标 Xt(q),但预测模型仅接收观测前缀、参考查询和掩码的未来时间槽。未来 RGB 帧和未来点图从未包含在模型输入中。 实现支持密集点图监督和稀疏查询点监督。我们使用通用的查询点接口来表达这两种监督。对于密集片段,物体点是从传播的参考帧掩码中采样的,其目标从密集跟踪点图中读取。对于稀疏片段,我们使用原生跟踪点及其关联的有效性值。令 vtq 表示点 q 在时间戳 t 是否具有有效的监督。 默认目标是解码坐标空间损失,

2 2 P t<T1 Pq vtq ˆXt(q) −Xt(q) Pt≥T1 Pq vtq ˆXt(q) −Xt(q) Ldec = λobs 2 + λfut 2 . (7) P t<T1 Pq vtq + ϵ Pt≥T1 Pq vtq + ϵ

7

第 8 页

MotionForesight 大脑、机器人与行为实验室

视频 手机 分布外

视频 未见 SSv2

图 4:未来 3D 轨迹预测的定性结果。仅根据观察到的视频前缀,MotionForesight 预测出合理的物体运动,包括抬起、平移、旋转、受限滑动和局部非刚性运动。可视化内容包括第一帧和最后一帧观察到的帧的点图,以及叠加在最后一帧观察到的帧上的未来预测 3D 轨迹。详细视频见 motionforesight.github.io

我们对未来预测的权重高于观察帧的重建。观察项主要用于稳定继承的跟踪接口,而未来项则训练模型在现有证据之外外推物体运动。损失通过冻结的轨迹解码器反向传播,但解码器参数本身不更新。

4 实验

我们围绕四个研究问题组织实验: 1. 重新利用视频先验:预训练的视频主干网络能否有效适应未来 3D 轨迹预测? 2. 随人类视频扩展:随着更多(数量和多样性)人类交互视频的加入,预测性能如何提升? 3. 分布外泛化:学习到的预测配方在微调分布之外表现如何? 4. 辅助监督的作用:与使用此类信息的方法相比,我们无需语言或动作标签训练的方法表现如何?

4.1 数据集与基线

我们在 Something-Something V2 (SSv2) [24] 的 40K 个人机交互视频上训练 MotionForesight。在训练和推理过程中,模型不接收 SSv2 的动作标签、语言指令或辅助动作标注。文本仅由离线预处理流水线在需要时使用,以识别被操作的物体。

8

第 9 页

MotionForesight 大脑、机器人与行为实验室

表 1:在 SSv2 和分布外 (OOD) 手机视频上的对比。所有方法均使用相同的观测区间和预测视界。水平线以下的行接收真实动作描述,因此比 MotionForesight 使用了更多的测试时信息。请注意,MolmoMotion 使用来自不同来源的 100 万个视频进行训练。MotionForesight 使用来自 SSv2 的 4 万个 RGB 视频进行训练。

SSv2 未见片段 (150) OOD 手机视频 (50)

方法 额外输入 ADE ↓ FDE ↓ PWT ↑ ADE ↓ FDE ↓ PWT ↑

MotionForesight ( ours) 无 4.47 6.23 76 9.31 14.88 54 MolmoMotion, 无语言 空动作字段 5.66 8.90 70 9.50 16.05 53 视频生成 + 轨迹 无 11.20 12.58 40 13.82 17.65 32

MolmoMotion, 有语言 动作描述 5.93 9.38 68 9.94 17.16 51 视频生成 + 轨迹 动作描述 11.99 13.57 44 13.63 16.71 29

我们在 150 个保留的 SSv2 视频和 50 个独立录制的手机视频上进行评估。家庭和办公场景中的手机视频包含以前未见过的物体、环境、视角和拍摄条件,提供了分布外 (OOD) 评估。完整的片段仅用于离线构建伪真实轨迹;每种预测方法均观测前 $T_1$ 帧并预测随后的 $T_2$ 帧。 所有方法均使用相同的对象查询点、未来时间戳、有效性掩码和坐标系进行评估。由于 MolmoMotion 一次仅允许预测 8 个点,因此我们对其进行了多次传递。遵循先前的轨迹预测工作 [5, 7, 40, 70],我们报告平均位移误差 (ADE)、最终位移误差 (FDE) 以及预测值在固定距离阈值内的百分比 (PWT)。ADE 和 FDE 以厘米为单位报告;较低的 ADE/FDE 和较高的 PWT(@5cm) 表示更好的性能。

4.2 与基线方法的对比

我们将 MotionForesight 与后续跟随我们 3D 轨迹提取管道(受先前工作 [17, 71, 72] 启发)的未来视频生成(使用 Wan-VACE)以及并发工作 MolmoMotion [5] 进行比较。我们评估这两种基线方法在“无语言”(即类似于 MotionForesight 的设置)和“有真实动作描述”(即比 MotionForesight 使用了更多特权信息)两种情况下的表现。对于 SSv2,我们使用提供的语言注释;对于手机视频,语言描述是手动编写的。 表 1 显示,尽管 MotionFore- 表 2:在 OOD 手机视频上的长上下文评估。每个视频的前 50% 被观测,剩余 50% 被预测。 sight 在每一项 SSv2 所有方法共享相同的划分和评估输入;语言- 和 OOD 指标上表现最佳,尽管它既没有使用语言,也没有使用动作标签。在表 2 中更长的观测上下文下,MotionForesight 显著优于 MolmoMotion:其 ADE 为 10.20 厘米,而无语言时为 11.90 厘米,有语言时为 12.57 厘米,FDE 和 PWT@5cm 也相应提升。这一优势——尽管 MolmoMotion 拥有规模大得多的语言配对训练语料库 [5]——表明强大的几何基础对于将更丰富的观测上下文转化为度量一致的未来运动特别有用。视频生成后接轨迹提取的方法表现明显差于任何一种感知几何的方法。这支持了我们核心的

9

第 10 页

MotionForesight 大脑、机器人与行为实验室

表 3:与人类交互视频一起扩展规模。我们在保持所有其他设置不变的情况下,评估在 SSv2 上训练的使用越来越多、按动作分层的子集进行训练模型。

SSv2 验证集 分布外 (OOD) 手机视频

训练视频数量 ADE ↓ FDE ↓ PWT ↑ ADE ↓ FDE ↓ PWT ↑

1K 4.81 6.57 74 9.48 14.74 53 10K 4.72 6.38 73 8.97 14.63 52 40K 4.47 6.23 76 9.31 14.88 54

动机:预训练的视频生成器包含有用的时间先验,但视觉上合理的未来像素并不一定保持点对应关系或度量 3D 运动。在显式预测几何的方法中,MotionForesight 受益于对观测到的 RGB、重建的点图以及经过跟踪适配的视频表示进行联合推理,在利用骨干网络运动先验的同时保持场景结构。 请注意,ADE、FDE 和 PWT 将预测结果与一个实现的未来进行比较,但交互预测本质上是多模态的,可能存在多个合理的未来轨迹。因此,预测结果可能与记录的 ground truth 不一致,但在物理和语义上仍然是合理的。因此,我们将这些指标视为互补而非穷尽,并在附录图 5 和网站中提供并列的定性比较。

4.3 与人类交互视频一起扩展规模

我们在包含 1K、10K 和 40K 个 SSv2 视频的嵌套、动作模板分层子集上训练相同的模型。架构、初始化、优化和评估集保持不变;仅微调数据的数量和多样性发生变化。定量上,40K 模型整体表现最强:它在所有三个 SSv2 指标上表现最佳,并实现了最高的 OOD PWT,而 10K 模型的 OOD ADE 和 FDE 略低。然而,定性上,40K 模型几乎总是更好,与较小数据变体相比,它产生了更连贯且与物体对齐的未来运动。这种不匹配对于多模态任务是预期的:即使另一个预测更合理,位移到单个记录的未来可能会偏向保守轨迹。总体而言,结果表明更大的数据多样性提高了学习到的运动先验,尽管这种增益并不总是通过这些指标单调反映。因此,我们在第 4.5 节中进行了额外分析,并在项目网站 motionforesight.github.io 上定性可视化了结果。

4.4 定性结果

图 4 显示,MotionForesight 根据观测到的交互预测平滑、空间连贯的运动。该模型捕捉了提升、平移、旋转、受限滑动、方向变化以及局部非刚性运动,而不仅仅是外推瞬时速度。尽管物体、环境、视角和捕获条件存在差异,它也能在独立记录的手机视频上产生合理的预测。这种迁移表明,适应预训练的视频和跟踪表示保留了超出 SSv2 微调分布的有用运动先验。正如预期的那样,当观测到的上下文允许多个合理未来时,确定性预测仍然具有挑战性;与基线的比较见附录图 5。请访问网站 motionforesight.github.io 查看更多不同场景下的详细定性结果。

10

第 11 页

MotionForesight 大脑、机器人与行为实验室

表 4:在 SSv2 未见片段上的运动条件评估。我们使用 $\tau = 2$ cm 和三个帧的平滑窗口。深蓝色和浅蓝色分别表示每个指标的最佳和第二佳学习结果。TVO/VVO/DQS 在至少包含五个真实运动点的 108 个片段上进行评估。

方法 TVO ↑ VVO ↑ MoveF1 ↑ MoveIoU ↑ DQS ↑ $\bar{r}$

MotionForesight (40K) 0.231 0.175 0.618 0.448 0.326 0.72 MotionForesight (10K) 0.167 0.127 0.582 0.388 0.237 0.57 MotionForesight (1K) 0.150 0.112 0.487 0.370 0.186 0.50

MolmoMotion (无语言) 0.101 0.078 0.585 0.258 0.195 1.27 MolmoMotion (有语言) 0.122 0.089 0.586 0.269 0.225 1.46

视频生成 + 轨迹 (无语言) 0.165 0.138 0.568 0.435 0.228 0.52 视频生成 + 轨迹 (有语言) 0.157 0.137 0.613 0.415 0.256 0.90

4.5 运动条件动力学分析

诸如 ADE、FDE 和 PWT 等标准指标对于与先前工作的比较仍然有用,但它们仅将确定性预测与一个已实现的未来进行比较。当观察到的交互允许多种合理的结果时,它们可能会偏向于靠近起始位置的保守预测。因此,我们增加了运动条件诊断,以明确评估预测的运动动力学是否与已实现的交互一致。 轨迹向量重叠 (TVO) 比较每个未来帧的预测位移向量和真实位移向量。只有当点以正确的方向、正确的幅度和正确的时间移动时,它才会给予高分;延迟、缺失或过度的运动都会受到惩罚。速度向量重叠 (VVO) 将相同的重叠应用于帧间速度。它通过更强烈地响应局部变化(如加速、转弯、停止和反转)来补充 TVO。MoveF1 询问模型是否将正确的物体点移动超过一个小运动阈值。其无阈值的配套指标 MoveIoU 比较每个点的峰值预测和真实偏移量,因此也反映了运动幅度。DQS 通过 TVO 和 MoveF1 的几何平均数结合轨迹保真度和运动位置。最后,运动比率 $\bar{r}$ 诊断幅度校准:低于 1 的值表示运动过于谨慎,而高于 1 的值表示过度预测。完整的数学定义见附录 B。 表 4 显示,MotionForesight (40K) 在所有五项运动质量指标中领先,并且其 TVO 和 DQS 从 1K 到 40K 训练视频单调改善。视频生成后接轨迹跟踪获得了相对较强的运动位置,但 TVO 和 DQS 较低,表明它可以识别哪些点应该移动,但不能像那样准确地保留其度量轨迹。40K 模型仍然低估了总运动 ($\bar{r} = 0.72$),使得幅度校准成为重要的改进方向。项目网站上显示的预测定性结果进一步支持了这些定量分析 motionforesight.github.io。

5 讨论、局限性与结论

在这项工作中,我们研究了从人类-物体交互的短单目视频中进行未来 3D 场景流预测。我们表明,通过掩蔽未来观测并仅训练轻量级适配器,可以将经过跟踪适应的视频模型从回顾性重建转换为前瞻性预测,同时保留预训练的视频和跟踪组件。由此产生的参考锚定 3D 轨迹揭示了物理推理所需的度量变量,而不将物体限制为单个刚性 6-DoF 姿态,允许一个表示来描述平移、旋转、关节运动和局部变形。我们的定量、运动条件和定性结果表明,预测模型捕捉到了有意义的交互动力学,并且随着

第 12 页

MotionForesight 大脑、机器人与行为实验室

结合额外的人类视频,并迁移至家庭和办公场景的手机拍摄数据。 仍面临若干挑战。当前模型是确定性的,仅预测单一未来,尽管短交互前缀可能支持多种物理上合理的结果;常规位移指标以及我们的运动条件诊断方法仍将这一预测与单一记录轨迹进行比较。监督信号也是伪真值,因此单目深度、相机估计、分割和跟踪中的误差可能会传播到训练和评估中,同时推理过程对估计的观测点图误差依然敏感。最后,训练仅限于 40K 个 SSv2 操作片段。尽管分布外(OOD)的手机实验证明了跨物体、环境和视角的迁移能力,但并未建立对显著不同场景的鲁棒性,例如头戴式第一人称视频、极大相机运动、更长时域的交互或非操作动力学。 这些局限性指出了未来工作的明确方向。多假设或概率预测可以表示替代结果并揭示校准后的不确定性,配合能够衡量多种有效未来中的合理性和覆盖率的评估协议。更准确或联合学习的几何、分割和跟踪可以减少对固定伪标签流水线的依赖,而更广泛的数据集可以涵盖第一人称视角、更强的相机运动、更长的交互以及更多样化的物理过程。下一步是将预测的 3D 轨迹连接到下游规划和控制,测试从被动人类视频中学习的以物体为中心的运动先验是否能改善具身决策。总体而言,MotionForesight 提供了证据,表明大型视频先验可以高效地从渲染未来外观重定向至预测显式、可操作的 3D 动力学,且无需语言或动作监督。

参考文献

[1] James J. Gibson. The Ecological Approach to Visual Perception. Houghton Mifflin, Boston, 1979. ISBN 9780395270493.

[2] Shimon Ullman. The Interpretation of Visual Motion. MIT Press, Cambridge, MA, 1979. ISBN 9780262210072.

[3] Peter W. Battaglia, Jessica B. Hamrick, and Joshua B. Tenenbaum. Simulation as an engine of physical scene understanding. Proceedings of the National Academy of Sciences, 110(45): 18327–18332, 2013. doi: 10.1073/pnas.1306572110.

[4] György Gergely, Harold Bekkering, and Ildikó Király. Rational imitation in preverbal infants. Nature, 415(6873):755, 2002. doi: 10.1038/415755a.

[5] Jianing Zhang, Chenhao Zheng, Yajun Yang, Max Argus, Rustin Soraki, Winson Han, Taira Anderson, Chun-Liang Li, Shuo Liu, Jiafei Duan, Zhongzheng Ren, Jieyu Zhang, and Ranjay Krishna. MolmoMotion: Forecasting point trajectories in 3d with language instruction. arXiv preprint arXiv:2606.18558, 2026. doi: 10.48550/arXiv:2606.18558.

[6] Tomoya Yoshida, Shuhei Kurita, Taichi Nishimura, and Shinsuke Mori. Generating 6dof object manipulation trajectories from action description in egocentric vision. arXiv preprint arXiv:2506.03605, 2025. doi: 10.48550/arXiv:2506.03605.

[7] Rustin Soraki, Homanga Bharadhwaj, Ali Farhadi, and Roozbeh Mottaghi. ObjectForesight: Predicting future 3d object trajectories from human videos. arXiv preprint arXiv:2601.05237, 2026. doi: 10.48550/arXiv:2601.05237.

12

第 13 页

MotionForesight 大脑、机器人与行为实验室

[8] Homanga Bharadhwaj, Roozbeh Mottaghi, Abhinav Gupta, 和 Shubham Tulsiani. Track2Act: 从互联网视频中预测点轨迹可实现泛化的机器人操作。在 Computer Vision – ECCV 2024, Lecture Notes in Computer Science 第 15134 卷, 第 306–324 页。Springer, 2024. doi: 10.1007/978-3-031-73116-7_18.

[9] Chuan Wen, Xingyu Lin, John Ian Reyes So, Kai Chen, Qi Dou, Yang Gao, 和 Pieter Abbeel. 用于策略学习的任意点轨迹建模。在 Robotics: Science and Systems (RSS), 2024. doi: 10.15607/RSS.2024.XX.092.

[10] Juntao Ren, Priya Sundaresan, Dorsa Sadigh, Sanjiban Choudhury, 和 Jeannette Bohg. 运动轨迹:一种用于少样本模仿学习中人机迁移的统一表示。 在 2025 IEEE 国际机器人与自动化会议 (ICRA), 第 8802–8810 页。 IEEE, 2025.

[11] Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, 和 Seungryong Kim. TrackCraft3R: 重新利用视频扩散 Transformer 进行密集 3D 跟踪。arXiv 预印本 arXiv:2605.12587, 2026. doi: 10.48550/arXiv.2605.12587.

[12] Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, 等. Wan: 开放且先进的规模化视频生成模型。arXiv 预印本 arXiv:2503.20314, 2025. doi: 10.48550/arXiv:2503.20314.

[13] David Ha 和 Jürgen Schmidhuber. World models. arXiv 预印本 arXiv:1803.10122, 2018. doi: 10.48550/arXiv:1803.10122.

[14] Chelsea Finn 和 Sergey Levine. Deep visual foresight for planning robot motion. 在 2017 IEEE 国际机器人与自动化会议 (ICRA), 第 2786–2793 页。IEEE, 2017. doi: 10.1109/ICRA.2017.7989324.

[15] Ruben Villegas, Jimei Yang, Seunghoon Hong, Xunyu Lin, 和 Honglak Lee. Decomposing motion and content for natural video sequence prediction. 在 International Conference on Learning Representations (ICLR), 2017.

[16] Jacob Walker, Carl Doersch, Abhinav Gupta, 和 Martial Hebert. An uncertain future: Forecasting from static images using variational autoencoders. 在 Proceedings of the European Conference on Computer Vision (ECCV), 2016.

[17] Homanga Bharadhwaj, Debidatta Dwibedi, Abhinav Gupta, Shubham Tulsiani, Carl Doersch, Ted Xiao, Dhruv Shah, Fei Xia, Dorsa Sadigh, 和 Sean Kirmani. Gen2Act: Human video generation in novel scenarios enables generalizable robot manipulation. 在 Joseph Lim, Shuran Song, 和 Hae-Won Park, 编辑, Proceedings of The 9th Conference on Robot Learning, Proceedings of Machine Learning Research 第 305 卷, 第 3936–3951 页。PMLR, 2025 年 9 月 27–30 日。URL https://proceedings.mlr.press/v305/bharadhwaj25a.html.

[18] Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, 和 Jianyu Chen. Video prediction policy: A generalist robot policy with predictive visual representations. 在 Aarti Singh, Maryam Fazel, Daniel Hsu, Simon Lacoste-Julien, Felix Berkenkamp, Tegan Maharaj, Kiri Wagstaff, 和 Jerry Zhu, 编辑, Proceedings of the 42nd International Conference on Machine Learning, Proceedings of Machine Learning Research 第 267 卷, 第 24328–24346 页。PMLR, 2025 年 7 月 13–19 日。URL https://proceedings.mlr.press/v267/hu25g.html.

13

第 14 页

MotionForesight 大脑、机器人与行为实验室

[19] Junbang Liang, Pavel Tokmakov, Ruoshi Liu, Sruthi Sudhakar, Paarth Shah, Rares Ambrus, 和 Carl Vondrick. 视频生成器即机器人策略. arXiv 预印本 arXiv:2508.00795, 2025. doi: 10.48550/arXiv:2508.00795.

[20] Quentin Garrido, Tushar Nagarajan, Basile Terver, Nicolas Ballas, Yann LeCun, 和 Michael Rabbat. 在野外学习潜在动作世界模型. arXiv 预印本 arXiv:2601.05230, 2026. doi: 10.48550/arXiv:2601.05230.

[21] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Mojtaba Komeili, 等. V-JEPA 2:自监督视频模型实现理解、预测和规划. arXiv 预印本 arXiv:2506.09985, 2025. doi: 10.48550/arXiv:2506.09985.

[22] Danijar Hafner, Timothy Lillicrap, Jimmy Ba, 和 Mohammad Norouzi. 梦想控制:通过潜在想象学习行为. 在 国际学习表征会议 (ICLR), 2020.

[23] Thomas Kipf, Elise van der Pol, 和 Max Welling. 结构化世界模型的对比学习. 在 国际学习表征会议 (ICLR), 2020.

[24] Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, Florian Hoppe, Christian Thurau, Ingo Bax, 和 Roland Memisevic. “Something Something” 视频数据库用于学习和评估视觉常识. 在 IEEE 国际计算机视觉会议 (ICCV) 论文集, 第 5843–5851 页, 2017.

[25] Pradipto Das, Chenliang Xu, Richard F. Doell, 和 Jason J. Corso. 寥寥数语千帧视频:通过潜在主题和稀疏对象拼接对视频进行语言描述. 在 IEEE 计算机视觉与模式识别会议 (CVPR) 论文集, 2013.

[26] Dima Damen, Hazel Doughty, Giovanni Maria Farinella, Sanja Fidler, Antonino Furnari, Evangelos Kazakos, Davide Moltisanti, Jonathan Munro, Toby Perrett, Will Price, 和 Michael Wray. 扩展第一人称视觉:EPIC-KITCHENS 数据集. 在 欧洲计算机视觉会议 (ECCV) 论文集, 2018.

[27] Yin Li, Miao Liu, 和 James M. Rehg. 旁观者之眼:联合学习第一人称视频中的视线和 动作. 在 欧洲计算机视觉会议 (ECCV) 论文集, 2018.

[28] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, 等. Ego4D:3000 小时第一人称视频环游世界. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 18995–19012 页, 2022.

[29] Miao Liu, Siyu Tang, Yin Li, 和 James M. Rehg. 预测人机交互: 联合预测第一人称视频中的运动注意力和动作. 在 计算机视觉 – ECCV 2020, 计算机科学讲座笔记, 第 704–721 页. Springer, 2020. doi: 10.1007/ 978-3-030-58452-8_41.

[30] Zhifan Ni, Esteve Valls Mascaró, Hyemin Ahn, 和 Dongheui Lee. 通过视线跟随预测视频中的 人机交互. 计算机视觉与图像理解, 233: 103741, 2023. ISSN 1077-3142. doi: 10.1016/j.cviu.2023.103741.

14

第 15 页

MotionForesight 大脑、机器人与行为实验室

[31] Samarth Brahmbhatt, Ankur Handa, James Hays, 和 Dieter Fox. ContactGrasp: 基于接触的功能性多指抓取合成. 在 IEEE/RSJ 智能机器人与系统国际会议 (IROS), 2019.

[32] Mohit Goyal, Sahil Modi, Rishabh Goyal, 和 Saurabh Gupta. 人手作为交互式物体理解的探针. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2022.

[33] Shaowei Liu, Subarna Tripathi, Somdeb Majumdar, 和 Xiaolong Wang. 从第一人称视频联合预测手部运动和交互热点. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2022.

[34] Kaichun Mo, Leonidas J. Guibas, Mustafa Mukadam, Abhinav Gupta, 和 Shubham Tulsiani. Where2Act: 从像素到动作用于可 articulated 3D 物体. 在 IEEE/CVF 国际计算机视觉会议论文集 (ICCV), 2021.

[35] Roozbeh Mottaghi, Hessam Bagherinezhad, Mohammad Rastegari, 和 Ali Farhadi. 牛顿式图像理解:展开静态图像中物体的动力学. 在 IEEE 计算机视觉与模式识别会议论文集 (CVPR), 2016.

[36] Tushar Nagarajan, Christoph Feichtenhofer, 和 Kristen Grauman. 来自视频的地面真实人机交互热点. 在 IEEE/CVF 国际计算机视觉会议论文集 (ICCV), 第 8688–8697 页, 2019.

[37] Dandan Shan, Jiaqi Geng, Michelle Shu, 和 David F. Fouhey. 理解互联网规模下接触中的人手. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2020.

[38] Fernando De la Torre, Jessica Hodgins, Adam Bargteil, Xavier Martin, Justin Macey, Alex Collado, 和 Pep Beltran. 卡内基梅隆大学多模态活动 (CMU-MMAC) 数据库指南. 技术报告, 卡内基梅隆大学, 2008.

[39] Chen Bao, Jiarui Xu, Xiaolong Wang, Abhinav Gupta, 和 Homanga Bharadhwaj. HandsOnVLM: 用于手物交互预测的视觉-语言模型. arXiv 预印本 arXiv:2412.13187, 2024. doi: 10.48550/arXiv.2412.13187.

[40] Mingfei Chen, Yifan Wang, Zhengqin Li, Homanga Bharadhwaj, Yujin Chen, Chuan Qin, Ziyi Kou, Yuan Tian, Eric Whitmire, Rajinder Sodhi, Hrvoje Benko, Eli Shlizerman, 和 Yue Liu. 从推理到运动:从第一人称人类交互视频学习 3D 手部轨迹预测. arXiv 预印本 arXiv:2512.16907, 2025. doi: 10.48550/arXiv.2512.16907.

[41] Junbo Zhang 和 Kaisheng Ma. Mask2Act: 预测性多目标跟踪作为机器人操作的视频预训练. 在第 36 届英国机器视觉会议 2025, BMVC 2025. BMVA, 2025. URL https://bmvc2025.bmva.org/proceedings/124/.

[42] Liuhao Ge, Zhou Ren, Yuncheng Li, Zehao Xue, Yingying Wang, Jianfei Cai, 和 Junsong Yuan. 从单张 RGB 图像进行 3D 手部形状和姿态估计. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2019.

[43] Yana Hasson, Gül Varol, Dimitrios Tzionas, Igor Kalevatykh, Michael J. Black, Ivan Laptev, 和 Cordelia Schmid. 学习手部和操作物体的联合重建. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR), 2019.

15

第 16 页

MotionForesight 大脑、机器人与行为实验室

[44] Umar Iqbal, Pavlo Molchanov, Thomas Breuel, Juergen Gall, 和 Jan Kautz。通过潜在 2.5d 热图回归进行手部姿态估计。在《欧洲计算机视觉会议论文集》(ECCV) 中,2018 年。

[45] Yu Rong, Takaaki Shiratori, 和 Hanbyul Joo。FrankMocap:通过回归和集成实现快速单目 3d 手部和身体动作捕捉。arXiv 预印本 arXiv:2008.08324,2020 年。doi: 10.48550/arXiv.2008.08324。

[46] Christian Zimmermann 和 Thomas Brox。从单张 RGB 图像学习估计 3d 手部姿态。在《IEEE 国际计算机视觉会议论文集》(ICCV) 中,2017 年。

[47] Yisheng He, Wei Sun, Haibin Huang, Jianran Liu, Haoqiang Fan, 和 Jian Sun。PVN3D:一种用于 6dof 姿态估计的深度逐点 3d 关键点投票网络。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR) 中,2020 年。

[48] Yinlin Hu, Joachim Hugonot, Pascal Fua, 和 Mathieu Salzmann。分割驱动的 6d 物体姿态估计。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR) 中,2019 年。

[49] Wadim Kehl, Fabian Manhardt, Federico Tombari, Slobodan Ilic, 和 Nassir Navab。SSD-6D:使基于 RGB 的 3d 检测和 6d 姿态估计再次伟大。在《IEEE 国际计算机视觉会议论文集》(ICCV) 中,2017 年。

[50] Yu Xiang, Tanner Schmidt, Venkatraman Narayanan, 和 Dieter Fox。PoseCNN:一种用于杂乱场景中 6d 物体姿态估计的卷积神经网络。在《机器人学:科学与系统》会议论文集 (Robotics: Science and Systems) 中,2018 年。doi: 10.15607/RSS.2018.XIV.019。

[51] Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, 等。SAM 2:在图像和视频中进行任意分割。在《国际学习表征会议》(ICLR) 中,2025 年。

[52] Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, 和 Jiaolong Yang。结构化 3d 潜在变量用于可扩展且通用的 3d 生成。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR) 中,2025 年。

[53] SAM 3D Team, Xingyu Chen, Fu-Jen Chu, Pierre Gleize, Kevin J. Liang, Alexander Sax, 等。SAM 3D:将图像中的任何事物 3d 化。arXiv 预印本 arXiv:2511.16624,2025 年。doi: 10.48550/arXiv:2511.16624。

[54] Benedikt Mersch, Xieyuanli Chen, Jens Behley, 和 Cyrill Stachniss。使用 3d 时空卷积网络进行自监督点云预测。在 Aleksandra Faust, David Hsu, 和 Gerhard Neumann 编辑的《第五届机器人学习会议论文集》(Proceedings of the 5th Conference on Robot Learning) 中,机器学习研究论文集第 164 卷,页码 1444–1454。PMLR,2022 年 11 月 08–11 日。URL https://proceedings.mlr.press/v164/mersch22a.html。

[55] Zetong Yang, Li Chen, Yanan Sun, 和 Hongyang Li。视觉点云预测可实现可扩展的自动驾驶。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR) 中,页码 14673–14684,2024 年 6 月。

16

第 17 页

MotionForesight 大脑、机器人与行为实验室

[56] Junru Gu, Chenxu Hu, Tianyuan Zhang, Xuanyao Chen, Yilun Wang, Yue Wang, 和 Hang Zhao. ViP3D: 通过3D智能体查询进行端到端视觉轨迹预测. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 2023.

[57] Kailin Li, Puhao Li, Tengyu Liu, Yuyang Li, 和 Siyuan Huang. ManipTrans: 通过残差学习实现 高效灵巧双臂操作迁移. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 6991–7003 页, 2025.

[58] Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, 和 Fei-Fei Li. PointWorld: 扩展野外机器人操作的3D世界模型. 在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 20765–20779 页, 2026年6月.

[59] Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, 和 Yann LeCun. 用于从人类视频中学习灵巧手-物交互的世界模型. arXiv 预印本 arXiv:2512.13644, 2025. doi: 10.48550/arXiv.2512.13644.

[60] Xingyu Liu, Charles R. Qi, 和 Leonidas J. Guibas. FlowNet3D: 学习3D点云中的场景流. 在 IEEE/CVF 计算机视觉与模式识别 会议 (CVPR) 论文集, 第 529–537 页, 2019年6月. doi: 10.1109/CVPR.2019.00062.

[61] Carl Doersch, Yi Yang, Mel Vecerik, Dilara Gokay, Ankush Gupta, Yusuf Aytar, Joao Carreira, 和 Andrew Zisserman. TAPIR: 通过逐帧初始化和时间细化跟踪任意点. 在 IEEE/CVF 国际计算机视觉 会议 (ICCV) 论文集, 第 10061–10072 页, 2023. doi: 10.1109/ICCV51070.2023.00923.

[62] Adam W. Harley, Yang You, Xinglong Sun, Yang Zheng, Nikhil Raghuraman, Yunqi Gu, Sheldon Liang, Wen-Hsuan Chu, Achal Dave, Suya You, Rares Ambrus, Katerina Fragkiadaki, 和 Leonidas J. Guibas. AllTracker: 高效的高分辨率密集点跟踪. 在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 5253–5262 页, 2025.

[63] Nikita Karaev, Ignacio Rocco, Benjamin Graham, Natalia Neverova, Andrea Vedaldi, 和 Christian Rupprecht. CoTracker: 联合跟踪更好. 在计算机视觉 – ECCV 2024, Lecture Notes in Computer Science 第 15120 卷, 第 18–35 页. Springer, 2024. doi: 10.1007/978-3-031-73033-7_2.

[64] Tuan Duc Ngo, Peiye Zhuang, Chuang Gan, Evangelos Kalogerakis, Sergey Tulyakov, Hsin-Ying Lee, 和 Chaoyang Wang. DELTA: 适用于任何视频的高效密集长程3D跟踪. 在 国际学习表征会议 (ICLR), 2025. doi: 10.48550/arXiv.2410. 24211.

[65] Yuxi Xiao, Jianyuan Wang, Nan Xue, Nikita Karaev, Yuri Makarov, Bingyi Kang, Xing Zhu, Hujun Bao, Yujun Shen, 和 Xiaowei Zhou. SpatialTrackerV2: 通过显式相机运动推进3D点跟踪. 在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 6726–6737 页, 2025.

[66] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, 和 Ross Girshick. Segment anything. 在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 4015–4026 页, 2023. doi: 10.1109/ICCV51070.2023.00371.

17

第 18 页

MotionForesight 大脑、机器人与行为实验室

[67] Haotong Lin, Sili Chen, Junhao Liew, Donny Y. Chen, Zhenyu Li, Guang Shi, Jiashi Feng, and Bingyi Kang. Depth anything 3: Recovering the visual space from any views. arXiv preprint arXiv:2511.10647, 2025. doi: 10.48550/arXiv:2511.10647.

[68] Byeongho Heo, Song Park, Dongyoon Han, and Sangdoo Yun. Rotary position embedding for vision transformer. In Computer Vision – ECCV 2024, pages 289–305. Springer, 2024.

[69] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, and Yunfeng Liu. RoFormer: Enhanced transformer with rotary position embedding. Neurocomputing, 568:127063, 2024. doi: 10.1016/j.neucom.2023.127063.

[70] Neerja Thakkar, Shiry Ginosar, Jacob Walker, Jitendra Malik, Joao Carreira, and Carl Doersch. Forecasting motion in the wild. arXiv preprint arXiv:2604.01015, 2026.

[71] Hongyu Li, Lingfeng Sun, Yafei Hu, Duy Ta, Jennifer Barry, George Konidaris, and Jiahui Fu. Novaflow: Zero-shot manipulation via actionable flow from generated videos. arXiv preprint arXiv:2510.08568, 2025.

[72] Yuxuan Kuang, Sungjae Park, Katerina Fragkiadaki, and Shubham Tulsiani. Dex4d: Task-agnostic point track policy for sim-to-real dexterous manipulation. arXiv preprint arXiv:2602.15828, 2026

18

第 19 页

MotionForesight 大脑、机器人与行为实验室

A 实现细节

在此,我们讨论方法的实现细节,以及实验设置的补充信息。我们还展示额外的结果,以帮助理解我们的方法和基线方法。

A.1 默认模型配置

表 5:默认模型配置。该方法从一个预训练的视频 DiT 开始,使用学习到的点轨迹潜在接口作为几何输出表示,并仅训练一个小型的未来适配器。语言保持为空上下文,不作为输入。

组件 设置

输入视界 7 个观测帧,15 个预测未来帧,共 22 帧 输入信号 RGB 上下文帧加上估计的观测点图;无语言、动作、机器人 状态或未来帧输入 参考点 从第 0 帧的对象掩码中采样的对象查询点 坐标系 默认相机减除模型的最后观测相机帧;参考对象 点仍源自第 0 帧 视频骨干网 Wan2.1 T2V DiT,带有时间 RoPE;用作单步潜在回归器 轨迹接口 经过轨迹适配的点轨迹潜在接口,由 TrackCraft3R 编码器- 解码器实例化,并冻结秩为 1024 的追踪 LoRA 冻结组件 基础视频 DiT、发布的追踪 LoRA、RGB VAE、点图 VAE、轨迹解码器、 可见性解码器和空文本上下文 可训练适配器 在自注意力投影(q, k, v, o)上全新的秩为 32 的 LoRA 其他可训练参数 未来 RGB 掩码潜在、未来点图掩码潜在、补丁嵌入和输出 头 可训练参数量 12.19M 分辨率 320 × 576 训练损失 查询点处的解码坐标空间 MSE,实现中放大了 10 倍;未来 权重 1.0,观测权重 0.25

A.2 数据和伪标签生成

主要训练语料库由人机交互视频构建。对于每个原始视频,预处理选择一个以交互为中心的 22 帧片段。该流程搜索可见的手-物交互,推进到接近接触的锚定帧,分割被操作的对象,并写入固定长度的片段。然后计算该片段的单目深度和相机估计,生成点图和相机变换。最后,在整个片段上运行密集 3D 跟踪堆栈,以生成伪真值未来轨迹。 标签构建与预测器输入之间的区别很重要。完整的片段用于离线获取监督信号,但预测模型从未将未来帧作为输入接收。在训练和推理期间,对于 t < K 的上下文槽包含观测到的 RGB 和点图潜在变量,而对于 t ≥K 的未来槽仅包含学习到的掩码潜在变量。 加载器通过通用的查询点接口提供密集和稀疏监督。密集跟踪输出转换为来自参考掩码的采样对象查询点。稀疏跟踪输出使用其原生的有效查询点。在这两种情况下,损失仅在具有有效伪真值监督的查询点处进行评估。

A.3 坐标系和归一化

默认模型在最后一张观测图像 t = T1 −1 的相机坐标系中表示点图和轨迹目标。令 ¯Pt 表示其原始相机坐标系中的点图,和

19

第 20 页

MotionForesight 大脑、机器人与行为实验室

令 $G_{t \to T_{1-1}}$ 表示估计的变换,将其映射到最后一个被观测到的相机帧。模型使用

$P_t = G_{t \to T_{1-1}} \bar{P}_t$. (8)

对于被观测到的帧,此变换在点图编码之前应用。对于未来帧,变换后的轨迹仅用作训练目标。在推理时,没有可用的未来几何信息。 这种坐标选择消除了预测问题中相机运动的大部分。模型仍然预测参考帧中物体点的未来 3D 位置,但坐标是相对于最后一个被观测到的相机而非原始的第 0 帧相机来表示的。早期的仅密集变体使用第 0 帧坐标;默认使用最后一个被观测到的相机帧,因为它使目标更以物体运动为中心。 点图归一化统计量仅从被观测到的点图计算。这保持了训练与推理的一致性,在推理期间,模型无法访问任何未来点图。相同的观测前缀统计量用于归一化被观测到的点图潜在变量,并定义解码坐标损失的尺度。

A.4 训练目标细节

默认训练目标是公式 7 中的解码坐标空间损失。我们使用

$\lambda_{obs} = 0.25, \quad \lambda_{fut} = 1.0$.

坐标均方误差在实现中乘以 10。未来项是主要目标,而被观测项使适配后的模型与继承的跟踪接口保持一致。 轨迹解码器被冻结,但梯度允许通过它传递到可训练的未来适配器、补丁嵌入、输出头和掩码潜在变量中。为了在 $320 \times 576$ 分辨率下拟合解码损失,实现中一次解码一帧并使用梯度检查点。这使得解码度量损失可行,而无需更新大型视频或跟踪组件。

A.5 预测过程

在推理时,模型仅接收观测前缀。前向传播过程如下:

1. 从 RGB 上下文帧中估计观测到的点图 $P_{0:K-1}$。

2. 将观测到的点图变换到最后一个被观测到的相机帧。

3. 将被观测到的 RGB 帧和点图编码为视觉-几何潜在变量。

4. 用学习的掩码潜在变量替换所有未来的 RGB 和点图上下文潜在变量。

5. 在所有 $T$ 个时间步上重复参考帧查询潜在变量。

6. 运行冻结的视频 DiT,配合冻结的跟踪适配器和训练好的未来适配器。

7. 使用冻结的轨迹解码器解码残差轨迹潜在变量。

8. 将解码后的残差添加到参考点位置,以获得未来 3D 轨迹。

20

第 21 页

MotionForesight 大脑、机器人与行为实验室

A.6 评估指标

对于具有伪真实轨迹(pseudo-ground-truth tracks)的保留验证片段,我们在有效的对象查询点上评估未来平均位移误差(average displacement error)和最终位移误差(final displacement error)。令 $T_{fut} = \{K, \dots, T-1\}$。未来 ADE 为 $$ \text{ADE} = \frac{\sum_{t \in T_{fut}} \sum_q v_t^q \|\hat{X}_t^{(q)} – X_t^{(q)}\|_2^2}{\sum_{t \in T_{fut}} \sum_q v_t^q + \epsilon} \quad (9) $$ 未来 FDE 在最终预测帧处计算:

$$ \text{FDE} = \frac{\sum_q v_{T-1,q} \|\hat{X}_{T-1}^{(q)} – X_{T-1}^{(q)}\|_2^2}{\sum_q v_{T-1,q} + \epsilon} \quad (10) $$

这两个指标均在 3D 度量空间中报告。对于分布外(OOD)的手机视频,我们针对从每个完整片段中提取的伪真实轨迹进行评估,并辅以定性比较来补充指标。由于每个片段仅记录多种可能未来中的一种,ADE 和 FDE 不应被解释为预测质量的完整度量:预测结果可能与记录的轨迹不同,但仍保持物理合理性并与观察到的交互一致。

B 运动条件动态指标

以下诊断指标衡量相对于最后一帧观测值的预测运动,而非绝对位置。令 $O = T_1$ 为观测帧数,令 $p_{t,i}, \hat{p}_{t,i} \in \mathbb{R}^3$ 分别表示点 $i$ 的真实位置和预测位置。我们定义独立锚定位移

$$ \Delta_{t,i} = p_{t,i} – p_{O-1,i}, \quad \hat{\Delta}_{t,i} = \hat{p}_{t,i} – \hat{p}_{O-1,i}, \quad t \ge O. \quad (11) $$

这消除了预测边界处的常数偏移,并隔离了随后的动态变化。为了减少单目伪真实轨迹中的一帧噪声,两个序列均使用中心三帧移动平均进行平滑处理:$g_{t,i} = \text{sm}(\Delta)_{t,i}$ 和 $h_{t,i} = \text{sm}(\hat{\Delta})_{t,i}$。

移动点。如果某点相对于锚点的最大偏移量超过 $\tau$,则视为移动点:

$$ e_i = \max_{t \ge O} \|g_{t,i}\|_2, \quad \hat{e}_i = \max_{t \ge O} \|h_{t,i}\|_2, \quad M = \{i : e_i \ge \tau\}, \quad \hat{M} = \{i : \hat{e}_i \ge \tau\}. \quad (12) $$

最大偏移量计算的是后来回到起始位置的运动。我们使用 $\tau = 2$ cm,该值高于平滑后的伪轨迹抖动下限,同时保留了 150 个有效 SSv2 片段中的 108 个用于保真度评估;结果也在 $\tau \in \{1, 5, 10\}$ cm 时进行了检查。当 $|M| \ge 5$ 时,片段符合保真度评估资格。

轨迹向量重叠(TVO)。对于每个真实移动点,TVO 衡量帧对齐的方向和幅度一致性:

$$ \text{TVO}_i = \frac{\sum_{t \ge O} [\cos(h_{t,i}, g_{t,i})]_+ \min(\|h_{t,i}\|_2, \|g_{t,i}\|_2)}{\sum_{t \ge O} \max(\|h_{t,i}\|_2, \|g_{t,i}\|_2) + \epsilon} \quad (13) $$

其中 $[x]_+ = \max(x, 0)$,如果任一向量的范数为零,则余弦项定义为零。缺失、延迟、过度或方向错误的运动会在分母中留下未匹配的量。我们对每个合格片段内的移动点进行平均,然后对所有片段进行等权平均。

21

第 22 页

MotionForesight 大脑、机器人与行为实验室

速度向量重叠.. TVO 比较来自锚点的位移弦,这些弦在弯曲路径上可能会缓慢变化。VVO 将相同的重叠度量应用于平滑的时间速度,

vt,i = gt,i −gt−1,i, ˆvt,i = ht,i −ht−1,i, gO−1,i = hO−1,i = 0, (14)

并使用 TVO 公式进行聚合,其中 (h, g) 被替换为 (ˆv, v)。因此,它强调预测是否在正确的时间转弯、反向、加速或停止。

运动放置与幅度.. MoveF1 是 Mˆ 与 M 之间的点集 F1 分数。如果两个集合都不包含移动点,则分数为一;如果恰好有一个集合为空,则分数为零。其无阈值的配套指标比较所有点的峰值偏移:

Pi min(ˆei, ei) MoveIoU = (15) Pi max(ˆei, ei) + ϵ.

我们还报告片段平均运动比率

Pi,t≥O ∥ht,i∥2 1 rc = ¯r = X rc, (16) Pi,t≥O ∥gt,i∥2 + ϵ, |C| c∈C

其中 ¯r = 1 表示校准的总运动,低于 1 的值表示预测不足,高于 1 的值表示预测过度。为了提供紧凑的摘要,我们在每个符合保真度要求的片段上计算 DQSc = √TVOc MoveF1c,然后进行平均。我们将 TVO 和 MoveF1 视为主要组成部分,因为复合指标可能会掩盖错误是来自轨迹保真度还是运动放置。

这些诊断指标仍然与一个实现的未来进行比较,因此补充了对合理替代结果的定性评估。

22

第 23 页

MotionForesight 大脑、机器人与行为实验室

第1个上下文 帧

最后一个上下文 帧

真实标签

MotionForesight

MolmoMotion

无语言

Wan–VACE

无语言

图5:与基线方法的定性比较。我们展示了观测到的上下文、记录的未来轨迹,以及来自MotionForesight、MolmoMotion和视频生成后跟踪的预测结果。这些示例通过揭示运动连贯性和合理的替代未来,补充了单一真实轨迹指标。

23

发表评论