TARS:无3D重建的视频重拍,时间步感知如何让数据规模化?

方法:时间步感知的数据规模化

视频重拍摄想让镜头动起来,但3D重建又慢又容易崩,配对数据又太少。TARS发现了一个关键洞察:扩散模型去噪时,高噪声步管全局结构和视角,低噪声步管纹理细节。于是它用单视频切两段做自监督学习,大规模训练重拍先验,再只在最关键的高噪声步用少量配对数据微调。结果在相机精度和视角控制上大幅超越3D方法和配对学习方法。当然,极端动态场景下的表现和MLLM生成描述的精度仍是潜在瓶颈。