TARS:无3D重建的视频重拍,时间步感知如何让数据规模化?

方法:时间步感知的数据规模化

视频重拍摄想让镜头动起来,但3D重建又慢又容易崩,配对数据又太少。TARS发现了一个关键洞察:扩散模型去噪时,高噪声步管全局结构和视角,低噪声步管纹理细节。于是它用单视频切两段做自监督学习,大规模训练重拍先验,再只在最关键的高噪声步用少量配对数据微调。结果在相机精度和视角控制上大幅超越3D方法和配对学习方法。当然,极端动态场景下的表现和MLLM生成描述的精度仍是潜在瓶颈。

SDM:如何从冻结特征中解耦相机与物体运动

SDM方法:主残差分解

视频帧间变化常混淆相机运动与物体运动。本文提出SDM,通过主/残差令牌结构化解耦动态。在ProbeMotion基准上,其表现优于DeltaTok并接近VGGT。注意:长程外推存在漂移,且依赖合成数据弱监督。