SDM:如何从冻结特征中解耦相机与物体运动

SDM方法:主残差分解

视频帧间变化常混淆相机运动与物体运动。本文提出SDM,通过主/残差令牌结构化解耦动态。在ProbeMotion基准上,其表现优于DeltaTok并接近VGGT。注意:长程外推存在漂移,且依赖合成数据弱监督。

UniD:来自不相关数据的统一视频密集预测

方法概览:从专家到统一的蒸馏

本文介绍UniD模型,解决统一密集预测需共标注数据的痛点。通过训练Task Specialist并利用Latent Projector蒸馏至Unified Backbone,UniD从Disjoint Data中学习深度、法线、语义等八种任务。实验显示,UniD在NYUv2深度估计AbsRel达0.059,超越DINOv3-H;视频时序一致性超越DICEPTION。需注意分割任务需轻量级微调,且时序性能依赖视频训练数据。

ConsiSpace:几何一致性记忆与自监督强化学习提升视频空间推理

方法概览:ConsiSpace框架

本文提出ConsiSpace框架,针对多模态大模型在视频空间推理中缺乏几何建模、冗余证据多及跨视角不稳定等问题,设计了几何一致性记忆(GCM)和统一一致性自监督强化学习(UC-SSRL)。GCM通过门控写入和融合减少冗余,UC-SSRL利用自监督奖励提升稳定性。实验显示在VSI-Bench和OSI-Bench上显著超越基线,且在长视频场景下显存占用和推理时间大幅降低。需注意GCM依赖几何基础模型准确性,噪声输入可能影响性能。