快速导读:现有强监督模型如VGGT依赖密集3D标注,而自监督方法缺乏结构。研究缺口在于:如何在无密集标签下,从冻结图像特征中提取结构化、可解释的动态表示?
视频理解的核心难点在于区分‘谁在动’:是相机在平移,还是物体在移动?传统方法往往将二者纠缠在单一特征中。本文提出的Structured Dynamics Model (SDM) 尝试解决这一根本问题,它不训练庞大的视频骨干网,而是站在DINOv2等冻结图像特征的肩膀上,通过自监督学习提取结构化的动态令牌。
SDM的核心贡献在于其‘主-残差’分解机制。它首先用主运动令牌(primary token)补偿全局相机运动,再用残差令牌(residual token)捕捉局部物体动态。这种设计不仅提升了动态表示的可解释性,还在新提出的ProbeMotion基准上展现了超越强监督模型(如VGGT)的潜力,为无密集标注的视频分析提供了新路径。
英文题目:Self-Supervised Learning of Structured Dynamics from Videos
论文出处:arXiv 每日论文精选 · arXiv:2607.21576
原始论文:PDF / 论文页面
对应视频标题:SDM:如何从冻结特征中解耦相机与物体运动|推荐指数:★★★★★
这篇论文解决什么问题?
现有的视频模型面临两难:要么使用单一纠缠的潜在空间,导致相机运动和物体运动难以分离;要么依赖昂贵的3D几何监督(如VGGT所需的深度或相机参数)。对于大多数真实世界视频,密集标注是不可得的。
虽然DINOv2等预训练图像骨干网提供了丰富的语义和几何特征,但它们缺乏显式的时间结构。直接计算帧间差异(如DeltaTok)往往无法区分全局视差和局部运动,导致动态表示模糊。
因此,研究的关键缺口在于:如何在没有密集几何标签的情况下,从冻结的图像特征中解耦出结构化、可解释的动态表示?
核心创新
方法概览
现有强监督模型如VGGT依赖密集3D标注,而自监督方法缺乏结构。研究缺口在于:如何在无密集标签下,从冻结图像特征中提取结构化、可解释的动态表示?
- SDM采用两阶段顺序提取:首先,主阶段从特征对中提取循环令牌p_t,用于补偿主导变化(通常是相机运动);其次,残差阶段提取r_t,用于细化剩余动态(通常是物体运动)。
- 训练目标为自监督的未来特征预测:模型需利用p_t和r_t将前一帧特征f_{t-1}变换为当前帧f_t。这种预测任务迫使模型学习有效的运动补偿。
- 引入弱场景级监督:在合成Kubric数据上,利用‘静态相机/动态场景’或‘动态相机/静态场景’的标签,辅助模型解耦运动源,无需像素级光流或深度图。
- 冻结特征策略:SDM不更新图像编码器,仅训练轻量级的动态模块,这使得模型能复用强大的预训练语义知识,同时保持计算效率。
逐图理解论文
SDM方法:主残差分解

详解两阶段补偿过程:主阶段用p_t补偿全局变化,残差阶段用r_t细化局部动态,最终预测目标特征图。
核心结论:结构化优势

实验证明,主令牌专精相机运动,残差令牌专精物体运动。在ProbeMotion基准上,SDM超越DeltaTok并接近VGGT,证明结构化分解提升了动态表示的判别力与泛化性。
价值与局限

运动外推演示:短时内物体特征跟随真实运动,但长时后出现漂移,揭示局部动态模型的局限性。
实验如何设计?
- 评估基准:使用新提出的ProbeMotion套件,涵盖Kubric(合成)、DL3DV、CameraBench、DAVIS2017、YouTubeVOS和SSv2-110k(真实)数据集。
- 对比基线:包括冻结骨干基线(CLS、AVG-pool)、自监督DeltaTok,以及强监督模型VGGT、Depth Anything 3和Pi3X。
- 任务类型:包括相机运动回归、物体运动分类、动作分类等线性探测任务,以评估动态令牌的泛化能力。
关键结果与论文证据
- SDM在SSv2-110k动作分类上达到23.1%准确率,显著优于DeltaTok(13.5%)和VGGT(15.5%)(第7页)。
- 在Kubric相机运动回归上,SDM的MSE为0.16,优于DeltaTok(0.29),接近VGGT(0.03-0.09)(第7页)。
- 主令牌p在相机运动任务上表现更优(Kubric cam MSE 0.16 vs residual 0.28),而残差令牌r在物体运动任务上更优(Kubric obj MSE 0.19 vs primary 0.21)(第8页)。
- SDM性能随时间上下文增加单调提升,在SSv2-110k上从T=2的16.7%提升至T=7的23.1%(第8页)。
阅读时需要注意
- 长程外推漂移:运动令牌仅捕捉局部动态,长时间预测后误差累积,缺乏长程可靠性。
- 静态场景变异性:在静态相机场景(如DAVIS2017)中,残差令牌的表现波动较大,解耦可靠性下降。
- 非几何重建:SDM不重建完整3D几何,其动态表示是特征空间的补偿,而非物理世界的精确运动。
关联工作
- VGGT:强监督3D几何模型,SDM在部分运动探测任务上超越其线性探测表现,证明自监督结构化动态的有效性。
- DeltaTok:自监督基线,使用单一delta令牌,SDM通过结构化分解显著优于其表现。
- DINOv2:作为冻结特征提取器,为SDM提供丰富的语义先验。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
结构化动态模型 的视频自监督学习
Lukas Knobel Andrew Zisserman Yuki M. Asano Fundamental AI Lab, UTN VGG, University of Oxford Fundamental AI Lab, UTN lukas.knobel@utn.de az@robots.ox.ac.uk yuki.asano@utn.de
摘要
理解视频中的运动是视觉学习的一项基本挑战,因为帧间变化纠缠了两种动态来源:相机运动和物体运动。这种分解在表示学习中仍未得到充分探索,部分原因是这些因素在自然视频中紧密耦合,难以单独进行监督。然而,恢复这种结构对于学习鲁棒的运动表示至关重要,这些表示能够将有意义的物体动态与由相机引起的变化区分开来。我们研究了是否可以从预训练图像视觉变换器的冻结特征中恢复此类结构化运动表示。我们提出了结构化动态模型 (SDM),它通过未来特征预测显式地将主要的时序变化源与残差动态分离开来,而不是用单个纠缠的潜在变量或非结构化的空间密集转换令牌来表示视频变化。训练结合了真实视频上的自监督学习和合成 Kubric 数据上场景动态的弱监督。我们在 ProbeMotion 上评估 SDM,这是一个涵盖具有相机运动、物体运动和组合动态的合成与真实视频的新评估套件。SDM 优于使用全局 CLS 或平均池化特征的主干基线,并在多个探测任务中与强监督表示(如 VGGT)表现相当,尽管使用的监督信号显著更弱。这些结果表明,预训练图像模型可以轻易地重新用于结构化视频动态表示,为学习和分析潜在视频动态提供了有用的归纳偏置。1
1 引言
计算机视觉领域的最新进展产生了强大的自监督图像主干网络,能够从大规模图像数据中捕捉丰富的语义和几何结构 [5, 11, 25, 29, 32, 40, 43]。这些表示正越来越多地用作 3D 感知和重建系统的基础。然而,尽管建立在自监督主干之上,许多成功的方法在适应阶段仍然依赖大量的监督信号,例如通过 3D 注释、来自运动恢复结构 (SfM) 流程的伪真值或其他几何标签 [20, 23, 35, 38, 39]。例如,VGGT 在 17 个注释数据集上进行训练 [35]。这限制了可扩展性,并留下了一个问题:在不依赖密集监督的情况下,可以从通用预训练视觉特征中恢复多少场景动态。
视频为此问题提供了自然的监督来源。然而,帧间变化纠缠了两种动态来源:相机运动和物体运动。因此,标准的自监督预测目标可以对聚合变化进行建模,而无需分离其根本原因。恢复这种结构对于学习围绕可解释物理因素组织的运动表示至关重要,但在表示学习中仍未得到充分探索。特别是,许多
1项目页面:https://lukasknobel.github.io/projects/StructuredDynamics
预印本。
第 2 页
𝐎𝐮𝐫 𝐏𝐫𝐨𝐛𝐞𝐌𝐨𝐭𝐢𝐨𝐧 𝐛𝐞𝐧𝐜𝐡𝐦𝐚𝐫𝐤 时间 𝐌𝐨𝐭𝐢𝐨𝐧 回归 𝐌𝐨𝐭𝐢𝐨𝐧 分类 MSE ↓ 准确率 ↑
Kubric 相机 DL3DV SSv2-110k 主运动 1.2 1.1 11.0 23 1.0 15 14 14 0.3 0.7 0.2 0.6 2 编码器 0.0 0.5
𝐬𝐞𝐥𝐟-𝐬𝐮𝐩𝐞𝐫𝐯𝐢𝐬𝐞𝐝 p-token Kubric 物体 DINOv2r CLS token 0.9 DINOv2r AVG 特征 SDM SDM . . . SDM 0.8 DeltaTok 0.4 我们的 p-token 0.4 我们的 r-token r-token 0.2 𝐬𝐭𝐫𝐨𝐧𝐠𝐥𝐲 𝐬𝐮𝐩𝐞𝐫𝐯𝐢𝐬𝐞𝐝 ℒSSL ℒSSL 残差运动 VGGT 相机 token
图 1:结构化动态模型 (SDM) 将冻结的图像特征重构为结构化的运动令牌。左侧:冻结的图像编码器提取帧特征,并通过自监督的未来特征预测对循环 SDM 进行训练。SDM 将时间变化结构化为主运动令牌 p(用于主导变化源)和残差运动令牌 r(用于剩余动态)。右侧:在 ProbeMotion 上的线性探测表明,这些结构化的运动令牌优于直接的冻结骨干描述符(如 CLS 和平均池化特征),甚至在 3/7 的任务上超越了 VGGT 的探测性能(见表 2),同时在对运动相关的语义动作分类中表现出更强的泛化能力。
潜在动作或世界模型使用单个潜在令牌总结场景变化 [12, 19],将主导的全局变化与以对象为中心的残差动态混合在一起。
与端到端训练视频模型不同,我们探讨预训练的图像骨干网络是否已包含足够的信息,以支持对场景动态的显式结构化。为此,我们在冻结的骨干特征之上构建结构化动态模型 (SDM),并通过未来特征预测对其进行训练。我们发现,当结合仅指示相机或场景是否静止的合成数据上的弱监督时,SDM 将时间变化组织为主运动和残差运动分量,从而适应每个视频中主导的变化源。
我们在涵盖具有相机运动、物体运动和组合动态的合成与真实视频的评价基准套件上评估了这一设置。我们将此集体评价称为 ProbeMotion。在这些设置中,SDM 始终优于基于全局 CLS 或平均池化特征的朴素基线,甚至在 7 个基准中的 3 个上超越了基于 VGGT 的探测。这些结果表明,预训练的图像表示可以通过仅使用弱合成监督和未标记真实视频上的自监督学习,被重构为强大的结构化视频动态表示。
我们的贡献如下:
• 我们研究了是否可以从冻结的预训练图像特征中提取结构化运动表示。
• 我们引入了结构化动态模型 (SDM),这是一种建立在自监督图像骨干网络之上的简单架构,它通过未来特征预测学习这种结构,优于朴素的全局特征基线,并在多个运动探测任务中与强监督的 3D 表示具有竞争力。
• 我们开发了 ProbeMotion,这是一个涵盖合成与真实视频的评价套件,涵盖相机运动、物体运动和组合动态。
2 方法
我们通过预测冻结的视觉特征随时间的变化来学习结构化运动表示。与训练视频编码器不同,我们探讨在预训练图像骨干网络之上的简单模型 SDM 是否能够将时间变化组织为主运动和残差运动分量,从而解释场景变化的主导来源和剩余动态。概述如图 2 所示。
2
第 3 页
2.1 冻结视觉特征
令 $\mathcal{E}$ 表示一个冻结的视觉 Transformer。对于每一帧 $x_t$,我们提取空间特征图: $f_t = \mathcal{E}(x_t) \in \mathbb{R}^{H \times W \times D}$, (1)
其中 $H, W$ 为空间维度,$D$ 为特征维度。SDM 在冻结特征空间中从 $f_{t-1}$ 预测目标特征图 $f_t$。该模型在循环运动令牌上是自回归的,但在因果性上是非因果的,因为 $f_t$ 可用于提取用于从 $f_{t-1}$ 预测 $f_t$ 的转换令牌。
条件特征预测需要关于目标转换的信息。CroCo 和 SiamMAE 使用跨视图条件 [15, 40],而潜在动作模型使用紧凑的转换令牌进行未来预测 [12, 19]。单个转换令牌必须解释所有变化来源,从依赖于外观的特征变化到低维运动因素(如相机平移或物体方向)。相反,我们遵循这样的直觉:视频中的大部分时间变化是由作用于高维视觉特征的较低维动态所支配。这促使我们构建一个结构化预测模型,将时间变化组织为主运动令牌和残差运动令牌。
2.2 结构化动态模型
主运动 残差运动
冻结视觉特征 提取 补偿 提取 补偿
$p_{t-1}$ $r_{t-1}$ MSE 损失 $\mathcal{E}$ $f_{t-1}$ $\psi_p$ $f_t^>$ $\psi_r$ $f_t^{\gg}$ $x_{t-1}$ $\phi_p$ $\phi_r$ $\mathcal{L}_{pred} = \| f_t^{\gg} – f_t \|_2^2$
$\mathcal{E}$ $f_t^>$ $p_t$ $r_t$ $\gg$ $\psi_p$ $f_{t+1}$ $\psi_r$ $f_{t+1}$ $x_t$ $\phi_p$ $\phi_r$ $\mathcal{L}_{pred} = \| f_{t+1}^{\gg} – f_{t+1} \|_2^2$
$\mathcal{E}$ $f_{t+1}$ 下游: $x_{t+1}$ $p_{t+1}$ 运动探测 $r_{t+1}$
图 2:展示了 $T=3$ 时的结构化动态模型 (SDM) 概览。对于每次转换,SDM 通过两个顺序补偿阶段,从先前的特征图 $f_{t-1}$ 预测目标冻结特征图 $f_t$。主阶段从特征对 $(f_{t-1}, f_t)$ 中提取循环运动令牌 $p_t$,并利用它生成主补偿特征图 $f_t^>$,以解释主要变化。残差阶段从 $f_t^>$ 与 $f_t$ 之间的不匹配中提取 $r_t$,并将 $f_t^>$ 细化为最终预测 $f_t^{\gg}$。运动令牌在时间上是自回归的,但在因果性上是非因果的,允许时间信息累积。
图 2 给出了 SDM 的概览。给定连续的特征图 $(f_{t-1}, f_t)$,SDM 通过两个顺序阶段预测 $f_t$。主阶段由运动提取器 $\phi_p$ 和特征预测器 $\psi_p$ 组成。提取器读取当前特征对 $(f_{t-1}, f_t)$ 并更新先前的主令牌 $p_{t-1}$,得到 $p_t$。随后,预测器使用 $p_t$ 补偿源特征图 $f_{t-1}$,产生中间预测 $f_t^>$,读作“f modified once”。残差阶段具有相同的结构,包含模块 $\phi_r$ 和 $\psi_r$。它从 $f_t^>$ 与 $f_t$ 之间剩余的不匹配中估计残差令牌 $r_t$,并利用该令牌将 $f_t^>$ 细化为最终预测 $f_t^{\gg}$,读作“f modified twice”。
主运动提取。主提取器通过关注当前帧对来更新循环运动令牌 $p_t \in \mathbb{R}^D$:
$p_t = \phi_p(p_{t-1}; f_{t-1}, f_t)$, (2)
其中 $p_0$ 是可学习的。这种递归允许模型随时间整合运动信息,而每次更新仅比较相邻帧。生成的令牌随后用于补偿源特征图。
3
第 4 页
主运动补偿。预测器 $\psi_p$ 使用 $p_t$ 补偿源特征图:
$f_t^> = \psi_p(f_{t-1}; p_t)$. (3)
我们将 $f_t^>$ 解释为主运动补偿后的中间表示,作为残差阶段的输入。其训练目标是解释从 $f_{t-1}$ 到 $f_t$ 的转换中可由场景变化的主要来源捕捉到的部分。
残差运动提取。给定 $f_t^>$,与 $f_t$ 的剩余差异对应于未被主要分量解释的动态。我们通过第二个潜在令牌 $r_t \in \mathbb{R}^D$ 捕捉这一点:
$r_t = \phi_r(r_{t-1}; f_t^>, f_t)$, (4)
其中 $r_0$ 是可学习的。以 $f_t^>$ 为条件鼓励 $r_t$ 仅表示在主要分量被考虑后剩余的残差动态。
残差运动补偿。残差预测器细化中间表示:
$f_t^{\gg} = \psi_r(f_t^>; r_t)$. (5)
因此,最终预测 $f_t^{\gg}$ 是通过首先补偿主要动态然后补偿残差动态获得的。对 $(p_t, r_t)$ 形成了本文使用的结构化运动表示。
超出帧对的扩展。SDM 自然扩展到更长的片段。我们在每个时间步应用相同的更新,并将 $p_{t-1}$ 和 $r_{t-1}$ 向前传递。因此,时间上下文累积在循环运动令牌中。
2.3 训练目标
SDM 通过在冻结编码器空间中的特征预测进行训练。为了将架构分解与主运动和残差运动的预期语义对齐,我们使用两个弱场景级注释:静态场景和静态相机,并选择性应用损失。
无标签或动态视频。对于无标签视频以及同时具有相机和场景动态的样本,我们仅监督最终预测:$L = L_{MSE}(f_t^{\gg}, f_t)$,其中 $L_{MSE}(x, y) = \frac{1}{HW D} \|x – y\|_2^2$。
静态场景。对于静态场景样本,主要分量应解释整个转换,因此我们绕过残差阶段,直接监督主补偿的输出: $L = L_{MSE}(f_t^>, f_t)$。
静态相机。如果样本被注释为具有静态相机,则没有由相机引起的全局变化需要补偿。因此,主阶段被正则化为保持源表示不变,而残差阶段捕捉场景动态:$L = L_{MSE}(f_t^{\gg}, f_t) + \lambda_{reg}L_{MSE}(f_t^>, f_{t-1})$。
2.4 实现细节
视觉特征。我们使用带有寄存器 [8] 的冻结 DINOv2-B/14 作为 $E$,并提取所有 12 个块的补丁特征。遵循 Mur-Labadia 等人 [24] 的做法,我们将这些中间特征在通道维度上拼接,并通过两层 MLP 投影到 $D=768$,以匹配一个主干块的隐藏维度,然后再应用 SDM。模型的预测随后被线性投影回拼接的多层特征空间,然后再应用损失。
运动提取器 $\phi$。$\phi_p$ 和 $\phi_r$ 均为具有 $n_{reg} = 4$ 个可学习寄存器 [8] 的 4 块 Transformer 解码器。运动令牌和寄存器自我注意并交叉注意帧特征,使用 RoPE [1, 30] 的 3D 扩展来处理空间和位置,基数为 100 [17]。初始的主运动和残差运动令牌是可学习参数,从 $N(0, 0.02^2)$ 初始化。
预测器 $\psi$。我们将 $\psi_p$ 和 $\psi_r$ 参数化为浅层 2 块解码器,它们交叉注意相应的运动令牌。我们使用 2D RoPE 处理空间位置 [17]。
4
第 5 页
表 1:ProbeMotion 评估数据集。线性探测数据集的摘要。针对源视频给出的数字是指经过片段长度过滤后,从相应公开或生成数据集中采样的样本数。短划线表示源数据集未提供适合 ProbeMotion 的划分。对于这些数据集,我们创建了专用的探测划分。括号表示 SSv2 中相机运动的局部动态特性(见附录 B.1)。更多细节,包括这些数据集的划分创建方法,见附录 A.3。
| | DAVIS2017 | YouTubeVOS Bench | Kubric | DL3DV | SSv2-110k | | :— | :—: | :—: | :—: | :—: | :—: | | Source train videos | 15k | 3.5k | 60 | 3.5k | – | 110k | | Source test videos | 5k | – | 30 | – | 1k | 20k | | Moving camera | ✓ | ✓ | ✗ | ✗ | ✓ | (✗) | | Dynamic scene | ✓ | ✗ | ✓ | ✓ | ✓ | ✓ | | Num. frames per clip | 4 | 5 | 4 | 4 | 5 | 7 | | Probing target | cam.+obj. motion | cam. motion | obj. motion | obj. displacement | cam. motion | action class |
3 实验
3.1 数据集
我们在合成视频和真实视频的混合数据上进行训练:Kubric [14]、SSv2 [13] 和 DL3DV [22]。Kubric 提供弱场景级标签,指示相机或场景是否静止,而 SSv2 和 DL3DV 则无标签使用。我们生成了 18 万个 Kubric 序列,在静态场景和动态场景视频之间平均分配。静态场景视频使用移动相机,而动态场景视频进一步在移动相机和静止相机设置之间平均分配(详见附录 A.1)。真实视频训练使用了约 17 万个 SSv2 片段和 4 千个 DL3DV 片段。
在评估方面,我们引入了 ProbeMotion,这是一个用于探测 Kubric、DL3DV、CameraBench [21]、DAVIS2017 [26] 和 YouTubeVOS [41, 42] 的静止相机子集以及标记为 SSv2-110k 的 SSv2 子集中的结构化运动表示的多样化基准套件。表 1 总结了这些数据集。划分和采样细节见附录 A.3。
Kubric 评估受控的合成相机和物体运动,具有不相交的 train/test 物体和背景以及随机采样的运动。DL3DV 和 CameraBench 评估真实相机运动,而静态 DAVIS2017 和静态 YouTubeVOS 评估在近似静止相机下的 2D 物体运动。我们通过使用 VGGT 估计的相机运动过滤片段,并从掩码质心位移标记 2D 物体运动来构建静止相机子集(详见附录 A.2)。SSv2-110k 评估运动密集的动作语义。
3.2 训练和评估细节
训练细节。小批量混合了 Kubric、SSv2 和 DL3DV,固定比例为 0.5/0.25/0.25。Kubric 样本来自上述三种受控设置:移动相机/静态场景、静止相机/动态场景和移动相机/动态场景。因此,每个小批量的 1/4 接收静态场景监督,1/8 接收静止相机监督,剩余的 5/8 仅使用标准的最终预测目标进行训练。这一组由移动相机/动态场景的 Kubric 样本和所有无标签的真实视频样本组成,对于这些样本,我们不强加分解的额外结构。我们以 2 fps 采样 5 帧,并将输入调整为 224×224,不进行额外的数据增强。我们使用 AdamW 训练所有组件 20 万次迭代,批量大小为 128,学习率为 6.25×10−5,预热 1k 次,权重衰减为 0.05,并将正则化权重设置为 λreg=0.5。在 4 块 H100 GPU 上,一次运行大约需要 11 小时。
评估协议。我们在冻结的 SDM 运动令牌上使用线性探针评估 ProbeMotion。除非另有说明,我们在 Kubric、DL3DV 和 CameraBench 中探测 p 以获取相机运动,在静态 DAVIS2017/YouTubeVOS 中探测 p 以获取物体运动,其中物体运动是变化的主要来源。基于 VGGT 的分析表明 SSv2-110k 中的帧间相机运动较低(见附录 B.1),因此我们遵循相同的推理逻辑,探测 p 以进行动作识别。对于动态相机场景中 Kubric 的物体运动,我们探测 r,并在第 3.4 节中研究令牌交换。我们报告最终时间步的性能以及 3 个随机种子的标准差。我们使用线性分类器进行离散
第 6 页
连续运动目标的标签和线性回归器。Kubric 和 DL3DV 对 6-DoF 相机运动采用归一化均方误差(MSE)回归,由于模拟物体不发生旋转,Kubric 物体运动被评估为 3D 平移。静态 DAVIS2017 和 YouTubeVOS 使用基于掩码质心运动的 2D 物体位移回归。CameraBench 和 SSv2-110k 使用 top-1 分类准确率。完整的任务定义见附录中的表 6。所有探针均为在冻结特征上训练的单层线性网络。分类集通过下采样实现类别平衡,回归集使用运动幅度子采样以减少低运动样本的数量。所有方法均采用相同的协议,并报告探针训练过程中最佳保留指标,以降低对探针优化超参数的敏感性(见附录 A)。
3.3 与基线方法的比较
基线方法。由于图像主干网络产生帧级表示,我们使用拼接或特征差分将连续帧特征转换为运动描述符。我们与直接从冻结主干网络派生的运动描述符进行比较,这些描述符源自 CLS 令牌或平均池化补丁特征。基于描述符消融实验(见附录 B.2),我们对 CLS 特征使用拼接,对 AVG 池化特征使用特征差分。多帧变体在时间上平均这些帧对描述符,以匹配结构化动态模型(SDM)的时间上下文。我们还评估了自监督方法 DeltaTok [19],它使用单个差分令牌表示帧间变化。与 SDM 相比,DeltaTok 的训练迭代次数多 8 倍,且使用更高分辨率的输入,因此它是一个强有力的基线(见附录 A.7)。我们还与强监督的 3D 和几何模型进行比较:VGGT-1B、Depth Anything 3 (DA3) [20] 和 Pi3X [39]。对于每个模型,我们分别报告源自平均池化特征图和相机令牌的描述符的结果,并根据附录 B.2 为每个基准测试选择拼接和特征差分中表现较好者。由于 Pi3X 不提供相机令牌,我们使用平均注册令牌作为相应的描述符。这些模型比 SDM 大得多(每个模型约 10 亿参数,而 SDM 为 2.15 亿参数,其中包括一个 8700 万参数的冻结主干网络),并且使用显式几何监督进行训练,如相机位姿、深度或点云,因此将其纳入以在强得多的监督条件下对性能进行 contextualize(语境化/参照)。
SDM 优于直接冻结主干网络描述符。在 ProbeMotion 上,除静态 DAVIS2017 外,SDM 在所有任务上均优于 CLS 和 AVG 池化基线,而在静态 DAVIS2017 上,AVG 池化在 2D 物体位移回归中表现最佳。这一例外可能反映了静态 DAVIS2017 的小规模和精心策划的特性,以及图像平面位移预测的相对简单性。直接基线在 Kubric 和 DL3DV 等 3D 运动探针上仍然明显较弱,这表明性能提升源于结构化未来特征预测,而非仅靠强大的冻结特征。即使直接基线能够访问来自所有 12 个块的 DINOv2 多层特征(见表 9),这一结论依然成立。这种改进也转移到了未用于无标签 SDM 训练的数据集之外,例如,静态 YouTubeVOS 通过减少 0.2 的 MSE 优于 AVG 池化。
尽管训练预算较小,SDM 在大多数探针上优于 DeltaTok。SDM 在 ProbeMotion 的七项任务中的五项上优于 DeltaTok,其中在 Kubric 物体运动(MSE 降低 0.16)和 SSv2-110k(准确率提高 9.6 个百分点)上提升最大。DeltaTok 在静态 DAVIS2017 和 CameraBench 上表现更好。总体而言,这些结果表明结构化潜在变量在广泛的运动和动作探针中提供了强大的性能。
SDM 在 ProbeMotion 上与监督 3D 表示具有竞争力。尽管使用的监督信号较弱且参数量少于监督 3D 和几何基线,SDM 在 DL3DV 探针中接近监督模型的性能,并在 CameraBench 上表现相似。此外,SDM 在三项物体运动探针中的两项上表现最佳,在 Kubric 物体运动上比最强监督基线降低 0.13 MSE,在静态 YouTubeVOS 上降低 0.04 MSE。在静态 DAVIS2017 上,SDM 与 DA3 持平,尽管 VGGT 和 Pi3X 表现更好。这表明结构化特征预测恢复了监督描述符未能完全捕捉的运动相关信息。
主运动令牌泛化到以物体为中心的动作预测。在 SSv2-110k 上,SDM 分别比 CLS 和 AVG 池化提高 8.2 和 20.8 个百分点,超过 DeltaTok 9.6 个百分点,并且即使特征拼接使线性探针的输入维度比 SDM 探针大一倍,SDM 仍比最佳监督描述符 Pi3X 平均特征拼接高出 3.3 个百分点。
6
第 7 页
表 2:ProbeMotion 上的线性探测结果。我们将 SDM 与带有寄存器(registers)的 DINOv2 直接冻结骨干描述符、自监督 DeltaTok 模型 [19] 以及强监督 3D/几何模型进行比较。对于直接 DINOv2 基线,我们对 CLS 特征使用拼接,对 AVG-pooled 特征使用特征差。对于监督模型,我们分别报告平均池化特征图描述符和相机令牌(camera-token)描述符的行。每个条目根据第 B.2 节,在该行和基准测试中为拼接和特征差选择更好的一个。对于不提供相机令牌的 Pi3X,第二行使用平均寄存器令牌。对于 DeltaTok,我们直接探测其 delta 令牌。SDM 在大多数相机运动、物体运动和动作探测中优于直接冻结骨干描述符,并在七项任务中的五项上优于 DeltaTok,尽管使用了显著更弱的监督信号和更少的参数,但仍与强监督表示保持竞争力。我们在标准化回归目标上报告均方误差(MSE),在分类任务上报告百分比准确率。在无需显式几何监督的方法中,最佳和次佳结果分别以粗体和下划线突出显示。
回归 (MSE ↓) 分类 (准确率 ↑) 方法 Kubric 静态 静态 相机 SSv2-110k DL3DV cam obj DAVIS2017 YouTubeVOS Bench (动作预测)
强监督 VGGT avg. feat. 0.09±0.0 0.32±0.0 0.56±0.0 0.78±0.1 0.79±0.0 82.9±0.0 15.5±0.1 VGGT cam. token 0.03±0.0 0.43±0.0 0.53±0.0 0.71±0.0 0.81±0.0 88.7±0.7 13.5±0.1 DA3 avg. feat. 0.11±0.0 0.40±0.0 0.55±0.0 0.87±0.1 0.89±0.0 83.3±0.4 14.0±0.1 DA3 cam. token 0.04±0.0 0.58±0.0 0.53±0.0 0.87±0.0 0.91±0.0 84.4±1.3 12.2±0.4 Pi3X avg. feat. 0.07±0.0 0.38±0.0 0.52±0.0 0.52±0.0 0.75±0.0 87.9±0.7 19.8±0.1 Pi3X avg. regs. 0.08±0.0 0.45±0.0 0.53±0.0 0.61±0.0 0.77±0.0 85.7±0.4 12.7±0.3
基线 DeltaTok 0.29±0.0 0.35±0.0 0.65±0.0 0.69±0.0 0.75±0.0 89.6±0.9 13.5±0.2 AVG-pool 0.96±0.0 0.93±0.0 1.04±0.0 0.78±0.0 0.91±0.0 67.0±1.2 2.3±0.0 CLS 1.16±0.0 0.78±0.0 1.09±0.0 0.90±0.1 1.05±0.0 68.6±0.8 14.9±0.2
SDM 0.16±0.0 0.19±0.0 0.59±0.0 0.87±0.1 0.71±0.0 85.3±1.7 23.1±1.3
3.4 SDM 分析
利用时间上下文。表 3 评估了 SDM 在预测最终时间步时是否能利用更长的时间上下文。在时间连贯的基准测试中,SDM 从额外的上下文中受益。在 Kubric 上,相机和物体运动是线性的,将上下文从 T = 2 增加到 T = 4 使相机运动的 MSE 从 0.26 降至 0.16,物体运动从 0.22 降至 0.19。CameraBench 的相机运动标签是片段级别的,准确率从 84.7% 提升至 85.3%。这种效果在 SSv2-110k 上尤为显著,准确率从 T = 2 时的 16.7% 单调增加到 T = 7 时的 23.1%,超出了 T = 5 的训练范围。基于 AVG-pooled 特征差的多帧基线也从额外的上下文中受益,表明额外的帧包含有用的运动信号。然而,它仍然远低于 SDM。具有最大时间上下文的基线在所有展示的数据集上均低于仅使用单帧对(T = 2)的 SDM。因此,SDM 的收益不能仅由访问额外帧来解释。第 B.3 节的额外结果表明,在具有更复杂运动的数据集上,收益的单调性较弱。
结构化运动。SDM 的一个关键目标是生成结构化运动潜在变量,其专业化遵循主导运动模式。我们通过交换每个探测任务使用的令牌来测试这一点,发现学习到的角色支持主/残差解释。结果见表 5。在动态相机数据集上,p 在相机运动预测方面显著优于 r,而 r 在 Kubric 物体运动中表现最佳,捕捉了由主分量未解释的动力学。在近似静态相机的情况下,物体运动成为主导,p 在静态 YouTubeVOS 上表现最佳。同样,在 SSv2-110k 上,我们的相机运动分析表明帧间相机运动较低,p 在动作识别中表现最佳。静态 DAVIS2017 是一个例外,残差令牌在不同种子间变异性较高(0.8 ± 0.15,见第 B.4 节)。拼接两个令牌会导致相似的性能,表明任务相关信息主要编码在两个令牌之一中。一个显著的例外是 Kubric 物体运动,其中预测世界坐标系中的物体平移可以从残差物体运动信号和主相机运动分量中受益。
7
第 8 页
表3:SDM 利用时间上下文聚合运动信息。我们将单帧对(T = 2)与 Kubric 和 CameraBench 的最大上下文进行对比,并在长于训练范围 T = 5 的 SSv2-110k 序列上进行评估。基线是 AVG-pooled 特征差描述符,即对帧对取平均。我们报告 Kubric 上标准化帧间姿态差回归的 MSE,以及 CameraBench 和 SSv2-110k 上的准确率(%)。
表4:SDM 适用于多种骨干网络。我们报告 DL3DV 上标准化帧间姿态差回归的 MSE,以及 CameraBench / SSv2-110k 上的准确率(%)。MAE [16]、SigLIP [44] 和 DINOv3 [29] 使用基础变体,补丁大小为 16。带寄存器(registers)的 DINOv2 [8](DINOv2r)使用补丁大小 14。
Kubric cam. ↓ Kubric obj. ↓ CameraBench ↑ Camera SSv2 method backbone DL3DV↓ T=2 T=4 T=2 T=4 T=2 T=5 Bench ↑110k↑
baseline 0.96 0.87 -0.09 0.93 0.72 -0.21 67.1 69.2 +2.1 MAE 0.61 87.6 14.1 SDM 0.26 0.16 -0.10 0.22 0.19 -0.03 84.7 85.3 +0.6 SigLIP 0.64 85.1 11.6 DINOv3 0.58 86.8 27.0 SSv2-110k ↑ DINOv2r 0.59 85.3 23.1 method T=2 T=3 T=4 T=5 T=6 T=7
baseline 2.4 5.9 +3.5 8.4 +2.5 10.9 +2.5 11.7 +0.8 13.3 +1.6 SDM 16.7 18.6 +1.9 20.4 +1.8 21.6 +1.2 22.5 +0.9 23.1 +0.6
表5:SDM 产生结构化运动表示,当特征用于线性回归或分类运动或动作时,p 和 r 分别专用于主运动和残差运动。我们报告标准化回归目标的 MSE 和分类任务的准确率(%)。在单个令牌中,最佳结果以粗体显示。匹配的表示和目标以绿色高亮显示。最后一行报告使用拼接令牌 [p, r] 的上界探测。
回归 (MSE ↓) 分类 (准确率 ↑) token Kubric Kubric Static Static Camera DL3DV SSv2-110k camera object DAVIS2017 YouTubeVOS Bench
primary p 0.16 0.21 0.59 0.87 0.71 85.3 23.1 residual r 0.28 0.19 0.62 0.80 0.79 81.1 12.0
concat. [p, r] 0.16 0.14 0.56 0.81 0.71 88.0 22.1
3.5 分析与消融研究
我们在下文总结主要的消融发现,完整组件表见附录表13,骨干网络消融见表4。
弱锚点和顺序提取促进专业化。移除任一弱场景级约束都会削弱主/残差结构,而联合提取会使两个令牌编码更多重叠的运动。
中间特征和真实数据提升性能。中间编码器特征优于仅使用最终层特征,且未标记的真实视频提升了超越合成训练泛化能力。MSE 显著改善了 Kubric 物体运动探测,而 L1 在某些真实视频探测上略强。
静态相机正则化平衡探测。变化 λreg 揭示了 Kubric 物体运动探测与 SSv2-110k 动作识别之间的权衡。我们使用 λreg = 0.5 作为平衡默认值。
SDM 适用于预训练骨干网络。表4显示 SDM 可应用于多种图像编码器。基于 DINOv2/3 的骨干网络整体表现最佳。
3.6 定性评估
我们通过在不同测试样本上进行定性分析来补充探测,可视化两个预测阶段是否解释了互补的变化,以及运动令牌是否可以在观察到的转换之外重用。
8
第 9 页
无误差,误差之后,误差之后 任何修正 𝐩𝐫𝐢𝐦𝐚𝐫𝐲 𝐦𝐨𝐭𝐢𝐨𝐧 𝐫𝐞𝐬𝐢𝐝𝐮𝐚𝐥 𝐦𝐨𝐭𝐢𝐨𝐧
源帧 > ≫ 目标帧 𝑓t 𝑓𝑡−1 𝑓t 𝑓t 𝑓t 𝑓t t −1 t
图 3:分阶段结构化特征预测。我们在 DAVIS2017 的样本上,可视化主运动和残差补偿后到目标帧的特征图误差。误差以红色高亮显示。主阶段校正了主导的全局变化,包括由相机运动引起的轨道边缘移动。值得注意的是,主运动补偿增加了围绕独立移动车辆的误差。残差阶段减少了这种局部误差。
分阶段特征补偿。图 3 显示,主阶段解释了主导的全局变换,而残差补偿减少了围绕独立移动物体的局部误差。
运动外推。重复应用最后观察到的运动令牌可产生合理的短视界特征外推(图 4),但预测在长视界下会发生漂移。这表明该令牌稳定地捕捉了局部时间动态,但在没有新观测的情况下,不支持可靠的大范围外推。
观察
使用 SDM 提取运动令牌
重复应用最终运动令牌帧 外推
最后观察到的物体位置 映射 特征
时间
图 4:运动外推。我们重复应用观察帧中的最后一个运动令牌,以预测 DAVIS2017 测试集样本的未来特征图。可视化是在归一化后通过 PCA 投影到 RGB 完成的。黑色方框标记了最后观察到的真实物体位置,该位置在扩展的特征图中被重复。在短视界下,扩展的物体特征遵循物体在其最后观察位置之外的运动,而在长视界下会发生漂移。
潜在运动交换。将源剪辑的运动令牌应用于具有不同物体的目标剪辑,会诱导一致的短视界特征空间运动(图 5)。这表明学习的令牌可以对视频中的局部和可泛化变换进行参数化,尽管质量在长视界下会下降。
4 相关工作
自监督图像编码器。自监督图像编码器(如 DINOv2 [25]、AIM [10] 和 MAE [16])提供了强大的冻结视觉特征。尽管这些图像特征包含有用的 3D 线索 [9] 并支持最近的重建系统 [20, 23, 35, 39],但它们并未直接暴露时间或运动结构。
自监督视频编码器。自监督视频编码器直接从无标签视频中学习时空表示,通常通过掩码视频建模 [7, 31, 36, 47] 或潜在
9
第 10 页
迁移运动令牌
应用运动令牌
初始位置 预测特征帧 使用 SDM 提取运动令牌 目标 clip . . . 特征 源 目标
图 5:潜在运动交换。我们将来自源 clip 的运动令牌应用于具有不同对象的目标 clip 的特征图,两者均来自 Kubric 测试集,并通过归一化后的 PCA 投影到 RGB 来可视化 resulting 特征。黑框标记了初始对象位置。目标特征图在短时间范围内遵循迁移的运动,而在长时间范围内发生漂移。
预测目标 [1, 3, 24, 34]。这些方法学习通用的视频表示,而 SDM 保持图像主干冻结,并在其上方学习显式的主/残差运动令牌。
在视频上训练图像编码器。几项工作利用视频数据调整预训练的图像模型,例如通过时间特征一致性 [27, 28] 或 SiamMAE [15] 中的对应学习。其他研究表明,长且未经筛选的视频可以从头开始训练出强大的图像编码器 [33]。相反,我们保持图像主干冻结,并在其上方学习结构化运动令牌。
3D 重建模型。DUSt3R [38]、VGGT [35] 和 CUT3R [37] 等模型专为 3D 重建而设计,从强 3D 监督中估计相机姿态、深度、点图和相关的几何结构。最近的扩展针对动态场景和 4D 重建 [18, 45]。相比之下,SDM 不重建完整的 3D 几何结构,而是使用更弱的监督将冻结的图像特征重新建模为主/残差运动令牌。
潜在动作与世界模型。潜在动作和世界模型通过预测未来帧或预训练的特征表示从视频进行学习,避免了密集注释,并且在特征空间方法中避免了像素级生成 [2, 12, 19]。先前的工作通常使用空间未来令牌或紧凑的潜在动作来表示时间变化 [2, 4, 12, 19, 46]。SDM 最接近特征空间的未来预测,但它将运动显式地结构化为主要和残差组件,而不是将变化编码在单个潜在动作中。
5 结论
我们研究了是否可以从冻结的预训练图像主干中提取结构化运动表示,并提出了结构化动态模型 (SDM)。SDM 通过未来特征预测学习结构化的主/残差运动潜在变量,在合成视频上使用弱场景级监督以及未标记的真实数据。我们的结果表明,冻结的图像主干可以被重新建模为结构化的视频动力学表示,从而在无需完整视频预训练的情况下使可解释的时间抽象得以涌现,同时与显著更大的监督几何模型保持竞争力。
学习的令牌根据场景动力学进行专业化。主令牌在动态相机视频中捕捉相机运动,在静态相机视频中捕捉对象运动,而残差令牌在主运动解释了由相机引起的变化时,捕捉剩余的对象中心动力学。这与其他领域中的迭代由粗到细的细化方法的有效性相呼应,从光流估计到扩散模型,并说明了残差补偿是一种有用的归纳偏置。
10
第 11 页
致谢与资金披露
LK 感谢 ELLIS 博士项目的支持。作者衷心感谢埃尔朗根-纽伦堡弗里德里希-亚历山大大学(FAU)埃尔朗根国家高性能计算中心(NHR@FAU)在 BayernKI 项目 v115be 下提供的科学支持和超算资源。BayernKI 的资金由巴伐利亚州当局提供。本研究还得到了英国工程与物理科学研究委员会(EPSRC)VisualAI 项目 grants (EP/T028572/1) 以及皇家学会研究教授职位 (RSRP\R\241003) 的支持。
参考文献
[1] Mido Assran, Adrien Bardes, David Fan, Quentin Garrido, Russell Howes, Matthew Muckley, Ammar Rizvi, Claire Roberts, Koustuv Sinha, Artem Zholus, 等。V-jepa 2:自监督视频模型实现理解、预测和规划。arXiv 预印本 arXiv:2506.09985,2025。4, 10
[2] Federico Baldassarre, Marc Szaffraniec, Basile Terver, Vasil Khalidov, Francisco Massa, Yann LeCun, Patrick Labatut, Maximilian Seitzer, 和 Piotr Bojanowski。回归特征:Dino 作为视频世界模型的基础。arXiv 预印本 arXiv:2507.19468,2025。10
[3] Adrien Bardes, Quentin Garrido, Jean Ponce, Xinlei Chen, Michael Rabbat, Yann LeCun, Mido Assran, 和 Nicolas Ballas。重新审视特征预测以从视频中学习视觉表示。机器学习研究汇刊,2024。10
[4] Gabrijel Boduljak, Yushi Lan, Christian Rupprecht, 和 Andrea Vedaldi。VFMF:通过预测视觉基础模型特征进行世界建模。arXiv 预印本 arXiv:2512.11225,2025。10
[5] Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, 等。TIPSv2:通过增强的块-文本对齐推进视觉-语言预训练。arXiv 预印本 arXiv:2604.12012,2026。1
[6] Joao Carreira, Eric Noland, Chloe Hillier, 和 Andrew Zisserman。关于 kinetics-700 人体动作数据集的简短说明。arXiv 预印本 arXiv:1907.06987,2019。18
[7] João Carreira, Dilara Gokay, Michael King, Chuhan Zhang, Ignacio Rocco, Aravindh Mahendran, Thomas Albert Keck, Joseph Heyward, Skanda Koppula, Etienne Pot, 等。扩展 4D 表示。arXiv 预印本 arXiv:2412.15212,2024。9
[8] Timothée Darcet, Maxime Oquab, Julien Mairal, 和 Piotr Bojanowski。视觉变换器需要寄存器。在第十二届国际学习表征会议,2024。4, 8, 18, 24
[9] Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis, Abhishek Kar, Yuanzhen Li, Michael Rubinstein, Deqing Sun, Leonidas Guibas, Justin Johnson, 和 Varun Jampani。探测视觉基础模型的 3D 感知能力。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 21795–21806 页,2024。9
[10] Alaaeldin El-Nouby, Michal Klein, Shuangfei Zhai, Miguel Ángel Bautista, Vaishaal Shankar, Alexander T Toshev, Joshua M Susskind, 和 Armand Joulin。大规模自回归图像模型的可扩展预训练。在国际机器学习会议,第 12371–12384 页,2024。9
[11] Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor G Turrisi da Costa, Louis Béthune, Zhe Gan, 等。大型视觉编码器的多模态自回归预训练。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 9641–9654 页,2025。1
[12] Quentin Garrido, Tushar Nagarajan, Basile Terver, Nicolas Ballas, Yann LeCun, 和 Michael Rabbat。在野外学习潜在动作世界模型。arXiv 预印本 arXiv:2601.05230,2026。2, 3, 10
11
第 12 页
[13] Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, 等。“Something Something”视频数据库:用于学习和评估视觉常识。在 IEEE 国际计算机视觉会议论文集,第 5842– 5850 页,2017。5, 24
[14] Klaus Greff, Francois Belletti, Lucas Beyer, Carl Doersch, Yilun Du, Daniel Duckworth, David J Fleet, Dan Gnanapragasam, Florian Golemo, Charles Herrmann, Thomas Kipf, Abhijit Kundu, Dmitry Lagun, Issam Laradji, Hsueh-Ti (Derek) Liu, Henning Meyer, Yishu Miao, Derek Nowrouzezahrai, Cengiz Oztireli, Etienne Pot, Noha Radwan, Daniel Rebain, Sara Sabour, Mehdi S. M. Sajjadi, Matan Sela, Vincent Sitzmann, Austin Stone, Deqing Sun, Suhani Vora, Ziyu Wang, Tianhao Wu, Kwang Moo Yi, Fangcheng Zhong, 和 Andrea Tagliasacchi。Kubric: 一个可扩展的数据集生成器。在 IEEE 计算机视觉与模式识别会议 (CVPR) 论文集,2022。5, 15, 24
[15] Agrim Gupta, Jiajun Wu, Jia Deng, 和 Fei-Fei Li。孪生掩码自编码器。神经信息处理系统进展,36:40676–40693,2023。3, 10
[16] Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, 和 Ross Girshick。掩码自编码器是可扩展的视觉学习者。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 16000–16009 页,2022。8, 9, 24
[17] Byeongho Heo, Song Park, Dongyoon Han, 和 Sangdoo Yun。视觉变换器的旋转位置嵌入。在欧洲计算机视觉会议,第 289–305 页。Springer, 2024。4
[18] Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, 和 Hao Wang。VGGT4D:在视觉几何变换器中挖掘运动线索以进行 4D 场景重建。arXiv 预印本 arXiv:2511.19971,2025。10
[19] Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbel- man, 和 Liang-Chieh Chen。一帧值一令牌:使用增量令牌进行高效的生成式世界建模。arXiv 预印本 arXiv:2604.04913,2026。2, 3, 6, 7, 10, 18, 24
[20] Haotong Lin, Sili Chen, Junhao Liew, Donny Y Chen, Zhenyu Li, Guang Shi, Jiashi Feng, 和 Bingyi Kang。Depth Anything 3:从任意视角恢复视觉空间。arXiv 预印本 arXiv:2511.10647,2025。1, 6, 9, 24
[21] Zhiqiu Lin, Siyuan Cen, Daniel Jiang, Jay Karhade, Hewei Wang, Chancharik Mitra, Tiffany Ling, Yuhan Huang, Sifan Liu, Mingyu Chen, 等。迈向理解任何视频中的相机运动。arXiv 预印本 arXiv:2504.15376,2025。5, 24
[22] Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu, 等。DL3DV-10k:用于基于深度学习的 3D 视觉的大规模场景数据集。在 IEEE/CVF 计算机视觉与模式识别 会议论文集,第 22160–22169 页,2024。5, 24
[23] Yihang Luo, Shangchen Zhou, Yushi Lan, Xingang Pan, 和 Chen Change Loy。4RC:通过条件查询实现随时随地 4D 重 建。arXiv 预印本 arXiv:2602.10094, 2026。1, 9
[24] Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha, Mike Rabbat, Yann LeCun, Nicolas Ballas, 和 Adrien Bardes。V-JEPA 2.1:解锁视频自监督学习中的密集特征。arXiv 预印本 arXiv:2603.14482,2026。4, 10
[25] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy V Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel HAZIZA, Francisco Massa, Alaaeldin El-Nouby, 等。 DINOv2:在无监督情况下学习鲁棒的视觉特征。机器学习研究汇刊,2023。1, 9, 17
[26] Jordi Pont-Tuset, Federico Perazzi, Sergi Caelles, Pablo Arbeláez, Alexander Sorkine-Hornung, 和 Luc Van Gool。2017 年 davis 视频对象分割挑战。arXiv:1704.00675, 2017。5, 24
12
第 13 页
[27] Mohammadreza Salehi, Efstratios Gavves, Cees GM Snoek, 和 Yuki M Asano。时间会说话:密集图像表示的自监督时间调优。在 IEEE/CVF 国际计算机视觉会议论文集,第 16536–16547 页,2023。10
[28] Mohammadreza Salehi, Shashanka Venkataramanan, Ioana Simion, Efstratios Gavves, Cees GM Snoek, 和 Yuki M Asano。MoSiC:用于密集自监督学习的最佳传输运动轨迹。在 IEEE/CVF 国际计算机视觉会议论文集,第 6541–6551 页,2025。10
[29] Oriane Siméoni, Huy V Vo, Maximilian Seitzer, Federico Baldassarre, Maxime Oquab, Cijo Jose, Vasil Khalidov, Marc Szafraniec, Seungeun Yi, Michaël Ramamonjisoa 等。DINOv3。arXiv 预印本 arXiv:2508.10104,2025。1, 8, 18, 24
[30] Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, 和 Yunfeng Liu。Roformer:增强型旋转位置嵌入 Transformer。Neurocomputing, 568:127063, 2024。4
[31] Zhan Tong, Yibing Song, Jue Wang, 和 Limin Wang。VideoMAE:掩码自编码器是自监督视频预训练的高效数据学习者。神经信息处理系统进展,35:10078–10093, 2022。9
[32] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Al-abdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa 等。SigLIP 2:具有改进语义理解、定位和密集特征的多语言视觉-语言编码器。arXiv 预印本 arXiv:2502.14786, 2025。1
[33] Shashanka Venkataramanan, Mamshad Nayeem Rizve, Joao Carreira, Yuki M Asano, 和 Yannis Avrithis。ImageNet 值得一个视频吗?从 1 个长无标签视频中学习强大的图像编码器。在第十二届国际学习表征会议,2024。10
[34] Alex N Wang, Christopher Hoang, Yuwen Xiong, Yann LeCun, 和 Mengye Ren。PooDLe:来自自然视频的池化和密集自监督学习。在第十三届国际学习表征会议,2025。10
[35] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny。VG GT:视觉几何接地 Transformer。在计算机视觉与模式识别会议论文集,第 5294–5306 页,2025。1, 9, 10, 19, 24
[36] Limin Wang, Bingkun Huang, Zhiyu Zhao, Zhan Tong, Yinan He, Yi Wang, Yali Wang, 和 Yu Qiao。VideoMAE v2:通过双重掩码扩展视频掩码自编码器。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 14549–14560 页,2023。9
[37] Qianqian Wang, Yifei Zhang, Aleksander Holynski, Alexei A Efros, 和 Angjoo Kanazawa。具有持久状态的连续 3D 感知模型。在计算机视觉与模式识别会议论文集,第 10510–10522 页,2025。10
[38] Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris Chidlovskii, 和 Jerome Revaud。DUSt3R:让几何 3D 视觉变得简单。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 20697–20709 页,2024。1, 10
[39] Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, 和 Tong He。pi3:置换等变视觉几何学习。arXiv 预印本 arXiv:2507.13347, 2025。1, 6, 9, 24
[40] Philippe Weinzaepfel, Vincent Leroy, Thomas Lucas, Romain Brégier, Yohann Cabon, Vaibhav Arora, Leonid Antsfeld, Boris Chidlovskii, Gabriela Csurka, 和 Jérôme Revaud。CroCo:通过跨视图补全进行 3D 视觉任务的自监督预训练。神经信息处理系统进展,35:3502–3516, 2022。1, 3
[41] Ning Xu, Linjie Yang, Yuchen Fan, Jianchao Yang, Dingcheng Yue, Yuchen Liang, Brian Price, Scott Cohen, 和 Thomas Huang。YouTube-VOS:序列到序列的视频对象分割。在欧洲计算机视觉会议 (ECCV) 论文集,第 585–601 页,2018。5, 24
13
第 14 页
[42] Ning Xu, Linjie Yang, Yuchen Fan, Dingcheng Yue, Yuchen Liang, Jianchao Yang, 和 Thomas Huang。YouTube-VOS:一个大规模视频对象分割基准。arXiv 预印本 arXiv:1809.03327,2018。5, 24
[43] Lihe Yang, Shang-Wen Li, Yang Li, Xinjie Lei, Dong Wang, Abdelrahman Mohamed, Heng-shuang Zhao, 和 Hu Xu。追求视觉预训练的像素级监督。arXiv 预印本 arXiv:2512.15715,2025。1
[44] Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, 和 Lucas Beyer。用于语言图像预训练的 Sigmoid 损失。在 IEEE/CVF 国际计算机视觉会议论文集,第 11975–11986 页,2023。8, 24
[45] Junyi Zhang, Charles Herrmann, Junhwa Hur, Varun Jampani, Trevor Darrell, Forrester Cole, Deqing Sun, 和 Ming-Hsuan Yang。MonST3R:一种在存在运动的情况下估计几何结构的简单方法。在第十三届国际学习表征会议,2025。10
[46] Gaoyue Zhou, Hengkai Pan, Yann Lecun, 和 Lerrel Pinto。DINO-WM:基于预训练视觉特征的世界模型实现零样本规划。在国际机器学习会议,第 79115–79135 页。PMLR,2025。10
[47] Daniel Zoran, Nikhil Parthasarathy, Yi Yang, Drew A Hudson, João Carreira, 和 Andrew Zisserman。循环视频掩码自编码器。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 17744–17755 页,2026。9
14
第 15 页
数据集与评估细节
表 6:评估任务。各评估数据集所用探测任务的摘要。
Kubric DL3DV CameraBench
任务 目标相机/物体运动 相机运动 相机运动类别 目标格式 6-DoF 位姿 / 3D 平移 6-DoF 位姿 离散运动标签 探测类型 回归 回归 分类 指标 归一化 MSE 归一化 MSE top-1 准确率
表示 探测令牌 p / r p p 时间目标 帧对运动 帧对运动 片段级运动
划分与采样 划分 生成 训练/测试 视频级 70/30 视频级 70/30 训练序列/视频 1 3 1 测试序列/视频 1 3 1 平衡 运动幅度下采样 运动幅度下采样 类别下采样
静态 DAVIS2017 静态 YouTubeVOS SSv2-110k
任务 目标物体位移 物体位移 动作类别 目标格式 2D 位移 2D 位移 动作标签 探测类型 回归 回归 分类 指标 归一化 MSE 归一化 MSE top-1 准确率
表示 探测令牌 p p p 时间目标 帧对运动 帧对运动 片段标签
划分与采样 划分 官方 训练/测试 视频级 70/30 官方 训练/验证 训练序列/视频 3 3 1 测试序列/视频 3 3 1 平衡 运动幅度下采样 运动幅度下采样 类别下采样
对于回归任务,运动幅度平衡是指如 A.3 节所述,保留高运动样本并对低运动样本进行下采样。
A.1 Kubric 生成
我们使用 Kubric [14] 生成合成训练和评估数据,从 MOVi-E 设置开始2。每个样本均从唯一的随机种子生成。此外,训练和评估样本使用不相交的对象和背景子集。我们以 2 fps 的帧率和 224 × 224 的分辨率渲染 10 帧的短片段。我们使用三种场景配置:相机移动的静态场景、相机静态的动态场景,以及相机和物体均移动的动态场景。静态场景不包含前景物体,而动态场景包含单个移动物体。
对于动态场景,我们禁用重力并为物体分配随机采样的初始速度。这产生了大致无偏的物体运动,不受下落轨迹的主导。对于相机动态场景,相机沿线性轨迹移动,同时持续注视世界原点上方的一点。这在保持场景中心大致在视野内的同时,产生了受控的自运动。
我们应用了几项预渲染有效性检查,以确保动态物体具有足够的可见性。首先,我们要求所选物体具有至少一个模拟器单位的最小尺寸,测量为其 3D 边界框的最短边。如果采样的物体太小,我们重新采样物体。如果在 100 次尝试后未找到有效物体,则拒绝该样本。其次,对于所有帧,我们要求物体投影的 2D 边界框中至少有 50% 位于图像内部。第三,
2https://github.com/google-research/kubric/tree/main/challenges/movi
15
第 16 页
(a) 移动相机,静态场景。
(b) 静态相机,动态场景。
(c) 移动相机,动态场景。
图 6:Kubric 示例。来自我们生成的 Kubric 训练数据的示例序列。这三个子集提供了用于解耦主运动和残差运动的弱场景级监督:移动相机/静态场景序列仅包含由相机引起的运动,静态相机/动态场景序列仅包含物体运动,而移动相机/动态场景序列结合了这两种运动源。示例以 1 fps 显示。
我们拒绝物体位于相机后面的样本,即当其最大深度满足 $z_{max} < 0$ 时。为了提高效率,这些检查在渲染之前进行。无效样本被丢弃,并使用新种子重新生成。
由于分辨率较低,生成过程无需 GPU 即可进行,每个有效样本大约需要 12 秒。由于预渲染检查,无效样本仅需 0.3 秒。大约 90% 包含动态物体的样本通过了有效性检查。
A.2 静态相机物体运动基准
输入。我们基于 DAVIS2017 和 YouTubeVOS 构建了一个近似静态相机的真实世界物体运动基准。我们从同时包含 RGB 帧和物体注释的视频开始,仅保留两种模态均可用的时间戳。对于每个场景,我们通过记录每帧可见物体面积和图像平面质心来总结注释掩码。
相机运动过滤。为了识别近似静态相机的片段,我们使用基于 VGGT 的相机姿态预测从采样的视频帧中估计相机运动,该预测提供每个区间的相机旋转和平移估计。然后,我们构建长度为 $T=4$、帧率为 2 fps 的候选窗口,并仅保留那些连续帧对之间的最大局部相机运动保持在固定平移和旋转阈值以下的窗口。具体而言,我们要求连续帧之间的最大相对旋转低于 $2^\circ$,且相机中心之间的最大平移低于 0.05。
物体过滤。在近似静态窗口中,我们进一步仅保留包含足够大物体的样本,要求物体跨度超过 15 像素,且在归一化质心位移中移动至少 0.05。
16
第 17 页
运动目标。对于每个保留的窗口,我们从选定对象的掩码序列计算连续的对象运动。我们在每一帧中提取对象质心,并将运动定义为图像坐标系中帧间质心的位移。这些位移通过图像宽度和高度进行归一化,从而得到相对图像平面单位中的连续水平和垂直运动分量。
A.3 数据集划分与采样
数据集特定的探测划分。SSv2 使用官方训练/验证划分,并过滤掉因视频过短而无法进行所需片段采样的视频。CameraBench 是一个评估基准,不提供单独的训练划分。因此,我们首先平衡每个选定的类别组,然后形成具有 70/30 训练/测试比例的伪划分。对于 DL3DV,我们使用 1K 到 7K 子集,并在视频级别形成划分以避免数据泄露,将 70% 的视频分配给训练,30% 分配给测试。我们不使用官方测试划分,因为它对于我们的探测设置来说太小了。为了进一步增加探测样本的数量,我们在训练和测试中每个视频采样三个序列。探测测试划分中的视频被排除在未标记的 SDM 训练之外。对于静态 YouTubeVOS,我们也使用视频级别的伪划分,因为官方测试划分未在足够的时间分辨率下提供对象分割。与 DL3DV 类似,我们对每个训练和测试视频采样三个序列。对于静态 DAVIS2017,我们使用官方的训练/测试划分,并对每个视频采样三个序列。对于静态相机对象运动探测,我们在组合的静态 DAVIS2017 和静态 YouTubeVOS 训练集上进行训练以增加探测训练数据,同时在每个基准上分别报告评估结果。Kubric 为移动相机/动态场景设置使用预定义的训练和测试集。实际的探测划分进一步通过回归箱进行平衡,箱边缘在训练划分上计算并在测试划分上重用。
平衡。所有分类探测数据集均通过将每个类别下采样到最小类别计数来实现类别平衡。对于回归探测,我们通过构建尾部感知子集来下采样低运动样本。我们保留运动幅度在第 75 百分位数以上的所有样本,并随机下采样其余较低运动的样本至相同数量。这产生了相等数量的高运动和较低运动样本,并防止回归探测被接近静态的样本所主导。
A.4 探测目标
回归任务。对于回归,我们为每个探测设置训练一个线性探测,其中每个探测联合预测该设置的完整目标向量。相机运动回归预测 6D 向量 $[v_x, v_y, v_z, \text{yaw}, \text{pitch}, \text{roll}]$。这用于 DL3DV 和 Kubric 的相机运动评估。Kubric 对象运动回归预测 3D 平移向量 $[v_x, v_y, v_z]$,因为在我们 Kubric 设置中对象不旋转。相对姿态是在帧 $t+1$ 和帧 $t$ 之间计算的,以帧 $t+1$ 的坐标系表示。静态 DAVIS2017 和静态 YouTubeVOS 对象运动回归预测归一化图像坐标中的 2D 图像平面质心位移 $[\Delta x, \Delta y]$。
分类任务。对于分类,我们为每个选定的标签集训练一个线性探测。SSv2-110k 使用全类别动作识别。CameraBench 为八个相机运动组使用单独的探测:速度(慢速、常规、快速)、推拉(进、出)、升降(上、下)、平移(左、右)、摇摄(左、右)、俯仰(上、下)、翻滚(顺时针、逆时针)和变焦(进、出)。
A.5 探测训练
我们的评估使用在冻结运动表示上训练的线性探测。每个探测由位于相应运动令牌之上的单个线性层组成,并使用 SGD、动量 0.9、余弦学习率衰减进行 100 个 epoch 的训练,并在每个 epoch 后进行评估。遵循先前的工作 [25],我们并行使用多个学习率训练探测。具体而言,我们使用:
$\text{lr} \in \{1, 2, 5\} \times 10^{\{-5, -4, -3, -2, -1\}} \cup \{3 \times 10^{-1}\}, \quad (6)$
这对应于 DINOv2 论文及其官方实现中使用的学习率的并集。我们将这些学习率从参考批次大小 256 线性缩放到 CameraBench 的批次大小 16 以及所有其他数据集的批次大小 64。对于回归探测,我们 additionally 应用范数为 5 的梯度裁剪以提高优化稳定性。根据任务的不同,我们
17
第 18 页
探测主运动令牌 $p$ 或残差运动令牌 $r$。具体选择见对应结果表。
由于训练大量探针,我们通过不使用输入增强并在训练线性探针前预计算运动特征来提高探针训练效率。
A.6 指标与探针选择
对于分类任务,我们报告不同子任务上的平均 top-1 准确率。对于回归任务,我们报告在训练集均值和标准差归一化后的目标上的均方误差。总体而言,我们报告探针训练及并行学习率扫描过程中的最佳保留指标,而非单个探针最后一个 epoch 的指标。这降低了在跨数据集、目标和表示比较多个探针时对确切探针优化超参数的敏感性。所有方法和基线均使用相同协议。
A.7 DeltaTok 评估
我们使用发布的 Kinetics-700 [6] ViT-B 模型及与 SDM 相同的评估协议,将 DeltaTok [19] 作为强大的自监督基线进行评估。我们遵循其推理协议,将帧调整为 512×512,并提取每个 clip 的最终 delta 令牌作为其运动描述符。
DeltaTok 和 SDM 并非在匹配的算力或输入分辨率预算下训练。DeltaTok 使用 512×512 输入、DINOv3 [29] 特征,并以 1024 的有效批量大小训练 1.6M 次迭代。相比之下,SDM 默认使用 224×224 输入、DINOv2-with-registers [8] 特征,并以 128 的批量大小训练 200k 次迭代。因此,DeltaTok 使用了 8 倍更多的优化迭代次数和 8 倍更大的有效批量大小,此外还在显著更高的空间分辨率下运行。
A.8 监督模型评估
我们将监督式 3D 和几何导向模型作为冻结特征提取器进行评估。对于每个模型,我们使用其默认推理预处理,在与探测数据集相同的帧序列上运行推理,并使用与 SDM 相同的协议训练线性探针。我们使用与冻结图像特征相同的时序拼接或差分基线,从连续帧中推导运动描述符。
对于 VGGT,我们使用 VGGT-1B。帧转换为 RGB,在保持纵横比的情况下调整宽度至 518,高度四舍五入至能被 14 整除的数值,中心裁剪为 518×518,并缩放到 [0, 1]。我们使用相机令牌或最终聚合令牌图上的均值池化 patch 令牌。对于 Depth Anything 3,我们使用 DA3-GIANT-1.1 及官方推理管线,并从最终骨干网络输出中提取相机令牌或均值池化 patch 令牌特征。对于 Pi3X,我们将保持纵横比的 RGB 输入调整大小至面积不超过 255,000 像素且尺寸能被 14 整除的最大分辨率,并提取解码器的输出特征。最终描述符通过平均 patch 令牌的特征获得,或者由于 Pi3X 没有专用的相机令牌,通过平均 5 个寄存器获得。
A.9 样本可视化细节
对于定性样本可视化,我们使用样本特定的 PCA 将密集特征图投影到 RGB。对于给定样本,我们收集被比较序列中所有帧的特征令牌,将其展平为单个特征矩阵并进行归一化。PCA 在所有提取的特征图上联合拟合。
我们保留前三个主成分并将其映射到三个 RGB 通道。投影后,每个分量使用在 PCA 拟合集上计算的 1st 和 99th 百分位数独立缩放到 [0, 1],并将生成的令牌网格重塑为空间特征图布局,并双线性上采样至图像分辨率以进行显示。
逐像素误差图是预测特征图与真实特征图在投影空间中的 L2 距离。这些距离使用所有比较图共享的 99th 百分位数尺度进行归一化,转换为热力图,并叠加在相应的 RGB 视频帧上。
18
第 19 页
B 补充结果
B.1 SSv2 相机运动分析
为了阐明在 SSv2-110k 动作识别探测中选择令牌的依据,我们分析了 SSv2 片段中的相机运动量。我们随机采样 5k 个 SSv2 片段,使用 VGGT [35] 估计帧间相机运动,并计算每步的平均相机旋转和平移。为了对这些值进行上下文解释,我们对 CameraBench 数据集应用相同的程序,并分别汇总标注为慢速、常规速度或快速运动的样本的相机运动。慢速子集不仅包含相机运动较少的片段,还包含所有相机静止的样本。
表 7:SSv2 和 CameraBench 的相机运动统计。我们报告使用 VGGT 估计的平均帧间相机运动。旋转以每秒度数为单位报告,平移以 VGGT 的归一化场景尺度单位每秒为单位报告。SSv2 的相机运动低于常规速度和快速运动的 CameraBench 片段,且在旋转方面更接近慢速子集。
CameraBench SSv2 慢速 常规速度 快速运动
旋转 3.89 1.57 7.77 32.89 平移 0.08 0.03 0.13 0.62
SSv2 的相机运动位于慢速和常规速度的 CameraBench 子集之间,且在旋转方面更接近慢速子集。这表明许多 SSv2 片段包含有限的帧间相机运动。因此,我们遵循与静态相机 DAVIS2017 和 YouTubeVOS 物体运动基准类似的推理(见第 3.2 节)。当由相机引起的变化较小时,与动作相关的物体动力学预计是时间变化的主要来源,因此我们探测主令牌 p 以进行 SSv2 动作识别。
B.2 基线结果
我们在表 8 和表 9 中比较了从强监督模型和基线模型推导运动描述符的不同方法。我们使用这些消融实验来为直接特征基线和主论文中报告监督模型描述符选择拼接和特征差。对于单层 DINOv2 特征,最佳描述符取决于池化策略和任务。AVG 池化特征的特征差在整体表现最佳,特别是在回归任务上,而拼接连续帧的 CLS 令牌在分类任务上表现最佳。对于监督模型,特征差描述符在所有基准上倾向于表现最佳,除了 SSv2-110k。在这个动作识别基准上,所有三个监督模型都显示出相同的模式。特征差表现不佳,最高准确率仅为 6.2%,而基于拼接的描述符在 12.2% 到 19.8% 之间。一种可能的解释是,与其他基准不同,SSv2-110k 使用动作标签而不是运动目标,这些标签可能依赖于在减去特征时被减少的语义信息。最后,表 9 显示,让直接 CLS 和 AVG 池基线访问所有 12 个 DINOv2 块提高了这些基线,但并未缩小与 SDM 的差距。因此,SDM 的提升不能仅由访问中间特征来解释,而是通过使用结构化递归预测将这些特征转化为运动表示。
B.3 时间上下文
表 10 和表 11 提供了带有标准差的完整时间上下文结果。SDM 在时间连贯的基准上从更长的上下文中受益最多,例如线性 Kubric 运动和 SSv2-110k,其中性能甚至在使用超过训练期间使用的最长上下文 5 帧后仍单调提升。基于平均池化特征差的多帧基线也呈现相同的趋势,尽管即使使用更长的上下文,其性能仍低于 SDM。相比之下,SDM 在运动约束较少的数据集上保持稳定,例如 DL3DV、静态 YouTubeVOS 和静态 DAVIS2017,其中基线的性能随着时间上下文的增加甚至显著恶化。总体而言,当运动连贯时,额外的上下文是有用的,但对于不受约束的真实世界视频并非普遍有益。
19
第 20 页
表 8:基线描述符消融实验。我们比较了冻结的 DINOv2-with-registers 表示和强监督表示的描述符选择。对于带寄存器(registers)的 DINOv2,我们评估了 CLS 令牌和平均池化补丁特征,使用连续帧之间的拼接或特征差异。多帧变体在时间上平均帧对描述符。对于 VGGT 和 Depth Anything 3,我们比较了平均池化特征图和相机令牌,使用连续帧之间的拼接或差异。由于 Pi3X 没有相机令牌,我们使用其寄存器的平均值作为替代,并遵循相同的设置。我们报告标准化回归目标上的均方误差(MSE)和分类任务上的准确率(%)。每个模型和基线类型的最佳结果以粗体显示。
回归 (MSE ↓) 分类 (准确率 ↑) 方法 Kubric 静态 静态 相机 DL3DV SSv2-110k cam obj DAVIS2017 YouTubeVOS Bench
DINOv2 with registers 基线 AVG-pool concat 1.05±0.0 0.73±0.0 1.06±0.0 0.96±0.03 0.97±0.0 68.4±1.3 14.1±0.1 AVG-pool concat, multi-frame 0.97±0.0 0.69±0.0 1.07±0.0 0.96±0.02 0.95±0.01 67.5±1.2 14.0±0.1 AVG-pool diff 0.96±0.0 0.93±0.0 1.04±0.0 0.78±0.02 0.91±0.0 67.0±1.2 2.3±0.0 AVG-pool diff, multi-frame 0.87±0.0 0.72±0.0 1.05±0.0 1.02±0.00 0.92±0.0 69.2±0.9 13.3±0.0
CLS concat 1.16±0.0 0.78±0.0 1.09±0.0 0.90±0.10 1.05±0.01 68.6±0.8 14.9±0.2 CLS concat, multi-frame 1.05±0.0 0.77±0.0 1.09±0.0 0.92±0.02 0.98±0.0 68.7±1.1 15.5±0.1 CLS diff 1.09±0.0 0.96±0.0 1.09±0.0 0.90±0.01 0.93±0.0 67.1±1.0 3.0±0.0 CLS diff, multi-frame 0.96±0.0 0.80±0.0 1.07±0.0 1.01±0.01 0.93±0.0 67.3±0.6 12.5±0.1
强监督 VGGT AVG feat. map concat 0.18±0.0 0.42±0.0 0.59±0.0 0.99±0.06 0.95±0.0 82.9±0.0 15.5±0.1 VGGT AVG feat. map diff 0.09±0.0 0.32±0.0 0.56±0.0 0.78±0.10 0.79±0.0 82.4±0.3 5.6±0.0 VGGT cam. token concat 0.05±0.0 0.43±0.0 0.53±0.0 0.97±0.07 0.98±0.0 87.5±0.3 13.5±0.1 VGGT cam. token diff 0.03±0.0 0.44±0.0 0.53±0.0 0.71±0.04 0.81±0.0 88.7±0.7 4.8±0.0
DA3 AVG feat. map concat 0.28±0.0 0.52±0.01 0.66±0.01 1.89±0.20 1.65±0.02 83.3±0.4 14.0±0.1 DA3 AVG feat. map diff 0.11±0.0 0.40±0.0 0.55±0.0 0.87±0.11 0.89±0.01 82.9±1.1 5.2±0.1 DA3 cam. token concat 0.18±0.0 0.72±0.01 0.62±0.0 3.53±1.04 1.66±0.06 81.5±0.2 12.2±0.4 DA3 cam. token diff 0.04±0.0 0.58±0.0 0.53±0.0 0.87±0.04 0.91±0.02 84.4±1.3 4.6±0.1
Pi3X AVG feat. map concat 0.10±0.0 0.44±0.0 0.54±0.0 0.71±0.01 0.86±0.0 87.9±0.7 19.8±0.1 Pi3X AVG feat. map diff 0.07±0.0 0.38±0.00 0.52±0.0 0.52±0.00 0.75±0.0 86.8±0.8 6.2±0.1 Pi3X avg. registers concat 0.33±0.0 0.77±0.0 0.65±0.0 0.95±0.03 0.94±0.0 79.8±1.6 12.7±0.3 Pi3X avg. registers diff 0.08±0.0 0.45±0.0 0.53±0.0 0.61±0.01 0.77±0.0 85.7±0.4 5.7±0.1
SDM 0.16±0.0 0.19±0.0 0.59±0.0 0.87±0.1 0.71±0.0 85.3±1.7 23.1±1.3
B.4 结构化运动
表 12 报告了带有标准差的全结构化运动结果。主令牌和残差令牌根据主导运动源进行专业化。主令牌在动态相机视频中的相机运动、近似静态相机视频中的物体运动以及 SSv2-110k 动作预测中表现最佳,而残差令牌在 Kubric 物体运动中更强。一个例外是静态 DAVIS2017,其中残差令牌优于主令牌。该结果在不同种子间变化很大,因此可靠性较低。基于拼接的 p 和 r 令牌的上界探测器的性能在大多数基准上与单个令牌的最佳性能保持接近。这表明大多数任务相关信息编码在单个令牌中。在 Kubric 物体运动中出现了显著增益,其中预测世界坐标系中的物体平移可以从残差物体运动信号和主相机运动分量中受益。
B.5 消融实验
表 13 提供了第 3.5 节中总结的详细组件消融实验。
弱监督和顺序提取导致专业化。在 Kubric 上,SDM 产生了预期的专业化:p 在相机运动中表现更好(0.16 vs. 0.28),而 r 在物体运动中表现更好(0.19 vs. 0.21)。移除静态场景监督削弱了这种结构,使得残差令牌预测相机运动的能力几乎与主令牌相当(0.21 vs. 0.18)。移除
20
第 21 页
表9:多层直接特征基线。为了控制对中间 DINOv2 特征的利用,我们评估了从所有 12 个主干块中提取的直接 CLS 和平均池化补丁描述符。描述符在层间取平均,并通过拼接或特征差在相邻帧间组合。即使拥有多层特征,直接描述符在除静态 DAVIS2017 外的所有数据集上仍显著低于 SDM,这与不使用多层特征时获得的结果一致(见表 2)。这表明增益并非仅由中间特征聚合所解释。我们报告标准化回归目标上的均方误差 (MSE) 和分类任务的准确率 (%)。最佳结果以粗体显示。
回归 (MSE ↓) 分类 (准确率 ↑) 方法 Kubric 静态 Kubric 相机 DAVIS2017 静态 YouTubeVOS 静态 DL3DV 相机 Bench
DINOv2 带寄存器,多层基线 AVG-pool 拼接 0.94±0.0 0.66±0.0 1.02±0.0 0.81±0.01 0.94±0.0 67.0±1.7 10.6±0.2 AVG-pool 拼接,多帧 0.91±0.0 0.70±0.0 1.04±0.0 0.89±0.02 0.95±0.0 66.8±0.9 12.6±0.1 AVG-pool 差 0.88±0.0 0.83±0.0 1.04±0.0 0.65±0.02 0.83±0.0 65.5±0.9 1.9±0.0 AVG-pool 差,多帧 0.82±0.0 0.60±0.0 1.06±0.0 1.01±0.01 0.91±0.0 70.0±0.6 6.9±0.0
CLS 拼接 1.05±0.0 0.72±0.0 1.05±0.0 0.93±0.02 0.94±0.01 68.1±0.5 13.6±0.3 CLS 拼接,多帧 1.01±0.0 0.77±0.0 1.06±0.0 0.94±0.0 0.94±0.0 67.9±0.9 14.5±0.4 CLS 差 0.98±0.0 0.91±0.0 1.04±0.0 1.00±0.01 0.92±0.0 65.8±3.3 2.0±0.1 CLS 差,多帧 0.88±0.0 0.68±0.0 1.05±0.0 1.02±0.0 0.93±0.0 68.6±2.0 7.5±0.0
SDM 0.16±0.0 0.19±0.0 0.59±0.0 0.87±0.1 0.71±0.0 85.3±1.7 23.1±1.3
表10:其他时间上下文结果。在具有时间一致性的 Kubric 和 CameraBench 基准上,SDM 和基线通常从额外的帧中受益。在时间一致性较弱的基准上,我们的方法随着时间上下文的增加保持稳定,而帧对基线可能会退化。我们报告标准化回归目标上的均方误差 (MSE) 和分类任务的准确率 (%)。
Kubric 相机 ↓ Kubric 物体 ↓ DL3DV ↓ 方法 T=2 T=4 T=2 T=4 T=2 T=5
基线 0.96±0.0 0.87±0.0 -0.09 0.93±0.0 0.72±0.0 -0.21 1.04±0.0 1.05±0.0 +0.01 SDM 0.26±0.03 0.16±0.01 -0.10 0.22±0.01 0.19±0.01 -0.03 0.59±0.0 0.59±0.0 ±0.0
静态 DAVIS2017 ↓ 静态 YouTubeVOS ↓ CameraBench ↑ 方法 T=2 T=4 T=2 T=4 T=2 T=5
基线 0.78±0.03 1.02±0.0 +0.24 0.91±0.0 0.92±0.0 +0.01 67.1±2.2 69.2±0.9 +2.1 SDM 0.87±0.07 0.87±0.05 ±0.0 0.70±0.01 0.71±0.02 +0.01 84.7±1.1 85.3±1.7 +0.6
静态相机监督对物体运动的影响更强。p 比 r 更具预测性 (0.14 vs. 0.38),表明静态相机约束对于防止物体运动被吸收到主令牌中非常重要。联合提取 p 和 r 也削弱了专业化,使得 p 对物体运动比相机运动更具预测性。
中间输入特征有助于跨基准测试。使用所有编码器层而不仅仅是最终层特征,提高了所有基准测试的性能,包括 Kubric 相机误差从 0.50 降至 0.16,DL3DV 误差从 0.89 降至 0.59,以及 SSv2-110k 准确率从 13.6% 提升至 23.1%。尽管原始特征维度增加了 12 倍,但融合预测空间保持了训练效率,训练时间仅增加了 1.2 倍。
未标记的真实数据提高了泛化能力。添加未标记的真实视频在所有评估的真实基准上优于仅合成数据的训练:DL3DV 误差从 0.91 降至 0.59,而 CameraBench 和 SSv2-110k 准确率分别从 76.6% 提升至 85.3%,从 10.7% 提升至 23.1%。
MSE 改善了 Kubric 物体探测。与 L1 相比,MSE 将 Kubric 物体运动误差从 0.30 改善至 0.19,将 Kubric 相机运动误差从 0.18 改善至 0.16。相比之下,L1 在 DL3DV (0.57 vs. 0.59)、CameraBench (87.4% vs. 85.3%) 和 SSv2-110k (24.4% vs. 23.1%) 上表现略好。我们使用 MSE,因为它显著改善了 Kubric 物体运动性能。
21
第 22 页
表11:SSv2-110k上的额外时序上下文结果。随着输入帧数的增加,结构化动态模型(SDM)的性能单调提升,即使超过训练时使用的T = 5序列长度也是如此。虽然帧对基线也随着时序上下文的增加而提升,但即使使用最大数量的T = 7帧,其性能仍低于单帧对的SDM。准确率以%报告。
SSv2-110k 方法 T=2 T=3 T=4 T=5 T=6 T=7
基线 2.4±0.2 +3.5 5.9±0.0 +2.5 8.4±0.0 +2.5 10.9±0.2 +0.8 11.7±0.0 +1.6 13.3±0.0 SDM 16.7±0.7 +1.9 18.6±0.8 +1.8 20.4±1.1 +1.2 21.6±1.2 +0.9 22.5±1.7 +0.6 23.1±1.3
表12:额外的结构化运动结果。带有标准差的完整结果显示结构化动态模型(SDM)学习了专门的主运动令牌和残差运动令牌。主令牌捕获主导运动源,而残差令牌捕获剩余动态。唯一的例外是静态DAVIS2017,其中残差令牌优于主令牌。然而,该结果的高变异性使其可靠性较低。我们报告标准化回归目标上的均方误差(MSE)和分类任务的准确率(%)。在单个令牌中,最佳结果以粗体显示。匹配的表示和目标以绿色高亮显示。最后一行报告了使用拼接令牌[p, r]的上界探测。
回归 (MSE ↓) 分类 (准确率 ↑) 令牌 Kubric Kubric 静态 静态 相机 DL3DV SSv2-110k 相机 物体 DAVIS2017 YouTubeVOS 基准
主 0.16±0.01 0.21±0.03 0.59±0.0 0.87±0.05 0.71±0.02 85.3±1.7 23.1±1.3 残差 0.28±0.04 0.19±0.01 0.62±0.0 0.80±0.15 0.79±0.01 81.1±1.9 12.0±0.9
拼接 [p, r] 0.16±0.01 0.14±0.01 0.56±0.0 0.81±0.05 0.71±0.00 88.0±0.3 22.1±1.2
静态相机正则化平衡了物体运动和动作预测。我们变化λreg,即静态相机正则化项的权重。较小的值产生更强的SSv2-110k性能,而较大的值改善Kubric物体运动探测。我们使用λreg = 0.5作为折衷方案,保留了强大的Kubric物体运动性能(0.19)和SSv2-110k准确率(23.1%)。
B.6 额外可视化
图7显示了预测特征图与真实特征图之间误差的额外可视化。
无校正误差 主运动校正后误差 残差运动校正后误差
源帧 > ≫ 目标帧 ft ft-1 ft ft ft ft t -1 t
图7:结构化特征预测。我们可视化了CameraBench样本在主运动和残差补偿后到目标特征图的误差。误差以红色高亮显示。与没有任何补偿的误差相比,主运动补偿特征图显著减少了由相机运动引起的差异的误差,特别是在背景中。残差补偿进一步降低了残差误差,并补偿了由场景动态引入的误差。
22
第 23 页
表13:详细的组件消融实验。我们对弱场景级监督、顺序主/残差提取、中间编码器特征、无标签真实视频训练、特征预测损失以及正则化强度进行了消融。我们报告了标准化回归目标上的均方误差(MSE)以及分类任务的准确率(%)。蓝色表示SDM所使用的设置。每个指标的最佳性能以粗体高亮显示。
(a) 弱监督和顺序提取提高了令牌的特化能力。匹配的令牌-目标对以绿色高亮显示。
SDM | 无静态场景监督 | 无静态相机监督 | 联合运动提取 —|—|—|— 令牌 | Kubric相机↓ 物体↓ | Kubric相机↓ 物体↓ | Kubric相机↓ 物体↓ 主运动令牌 | 0.16 0.21 | 0.18 0.22 | 0.20 0.14 残差运动令牌 | 0.28 0.19 | 0.21 0.20 | 0.44 0.38 | | | | 0.19 0.16 | | | | 0.23 0.15
(b) 中间特征提升了性能。(c) 无标签真实数据促进了真实视频泛化。
Kubric↓ | DL3DV↓ | 相机 | SSv2- —|—|—|— 相机 | 物体 | Bench↑ | 110k↑ 仅最终特征 | 0.50 | 0.22 | 0.89 | 76.3 多个特征 | 0.16 | 0.19 | 0.59 | 85.3
无真实数据 | 0.17 | 0.11 | 0.91 | 76.6 合成&真实数据 | 0.16 | 0.19 | 0.59 | 85.3
(e) 中等静态相机正则化平衡了物体运动和动作预测。 (d) MSE损失提升了Kubric物体探测。
Kubric↓ | SSv2- | Kubric↓ | DL3DV↓ | 相机 | DL3DV↓ | 相机 —|—|—|—|—|—|— 相机 | 物体 | Bench↑ | 110k↑ | 相机 | 物体 | Bench↑ | 110k↑ λreg = 0.1 | 0.16 | 0.41 | 0.56 | 86.3 | 25.1 L1 | 0.18 | 0.30 | 0.57 | 87.4 | 24.4 λreg = 0.25 | 0.17 | 0.35 | 0.56 | 87.0 | 24.3 MSE | 0.16 | 0.19 | 0.59 | 85.3 | 23.1 λreg = 0.5 | 0.16 | 0.19 | 0.59 | 85.3 | 23.1 λreg = 1.0 | 0.20 | 0.14 | 0.59 | 86.7 | 17.7
C 局限性
虽然我们训练的大部分是完全自监督的,但分解部分也依赖于合成数据上的弱场景级监督。将其替换为完全自监督约束将提高可扩展性。最后,ProbeMotion依赖于估计的相机运动来构建静态DAVIS2017和YouTubeVOS,这可能会引入过滤噪声,且线性探针仅能测量线性可解码的信息。
D 所用资产信息
表14列出了所用预训练模型和数据集的更详细信息。
E 硬件资源
实验在本地集群上进行,使用一个包含4块NVIDIA H100 GPU和128个CPU核心的节点。在该节点上,一次SDM训练运行大约需要11小时,每个GPU最多使用75GB RAM和25GB VRAM。ProbeMotion上的评估大约需要25分钟。
报告的主要结果使用了三个随机种子,总计约11h×4×3 = 132 GPU小时,其中4是每个节点的GPU数量。9次消融运行大约需要396 GPU小时。
23
第 24 页
表 14:现有资产。本文使用的现有数据集和预训练模型的摘要。
| 资产 | 本文中的用途 | 版本/许可/条款 | 引用 | | :— | :— | :— | :— | | 预训练模型 | | | | | DINOv2-reg-B/14 | 主冻结图像编码器检查点 | 公开 Apache License 2.0 | [8] | | MAE-B/16 | 主干消融冻结编码器检查点 | 公开 Apache License 2.0 | [16] | | SigLIP-B/16 | 主干消融冻结编码器检查点 | 公开 Apache License 2.0 | [44] | | DINOv3-B/16 | 主干消融冻结编码器检查点 | 公开 DINOv3 许可 | [29] | | DeltaTok | 自监督基线预训练检查点 | 发布 Apache License 2.0 | [19] | | VGGT-1B | 监督式 3D 表示基线检查点,用于静态相机基准测试中的相机运动过滤 | 公开 CC BY-NC 4.0 | [35] | | Depth Anything 3 (GIANT-1.1) | 监督式 3D 表示基线检查点 | 公开 CC BY-NC 4.0 | [20] | | Pi3X | 监督式 3D 表示基线检查点 | 公开 CC BY-NC 4.0 | [39] | | 数据集 | | | | | Kubric / MOVi-E | 基于 MOVi-E 设置生成用于训练和评估的剪辑 | 自定义 Apache License 2.0 | [14] | | Something-Something v2 | 用于训练和评估的过滤后的训练/验证集 | 过滤后的许可 | [13] | | DL3DV | 用于训练和评估的 1K–7K 子集 | DL3DV-10K 条款 | [22] | | CameraBench | 用于评估的选定相机运动类别组 | 公开 CC-BY-4.0 | [21] | | DAVIS2017 | 过滤后的官方训练/测试集用于评估 | BSD 3-Clause 许可 | [26] | | YouTubeVOS | 视频级注释/过滤后的非伪商业研究用途拆分用于评估 | CC BY 4.0 (注释) / 仅限非伪商业研究用途 (数据) | [41, 42] |
24