UniD:来自不相关数据的统一视频密集预测

方法概览:从专家到统一的蒸馏

本文介绍UniD模型,解决统一密集预测需共标注数据的痛点。通过训练Task Specialist并利用Latent Projector蒸馏至Unified Backbone,UniD从Disjoint Data中学习深度、法线、语义等八种任务。实验显示,UniD在NYUv2深度估计AbsRel达0.059,超越DINOv3-H;视频时序一致性超越DICEPTION。需注意分割任务需轻量级微调,且时序性能依赖视频训练数据。