UniD:来自不相关数据的统一视频密集预测

三分钟导读:UniD通过利用预训练扩散模型的视觉先验和轻量级任务投影器,从互不重叠的数据集中联合学习深度、法线、语义等八种密集预测任务,实现了无需伪标签或共标注数据的高效统一视频理解。

英文题目:Unified Video Dense Prediction from Disjoint Data

论文出处:arXiv 每日论文精选 · arXiv:2607.21592

原始论文:PDF / 论文页面

对应视频标题:UniD:来自不相关数据的统一视频密集预测|推荐指数:★★★★★

这篇论文解决什么问题?

现有的统一密集预测模型通常要求所有任务在相同图像上具有共标注数据(co-annotated data),或者依赖昂贵且扩展性差的大规模伪标签生成,难以处理现实中碎片化、领域特定的数据集。

核心创新

  • 提出从互不相关(Disjoint)数据集中训练统一视频模型的方法,无需共标注数据或伪标签。
  • 利用预训练扩散模型(Diffusion Model)的强视觉先验来弥合不同领域数据之间的差距,增强OOD泛化能力。
  • 采用潜在空间蒸馏(Latent Distillation)而非像素级伪标签,显著降低训练内存占用并避免梯度传播通过解码器的计算瓶颈。
  • 引入扩展自注意力(Extended Self-Attention, ESA)和时序梯度匹配(Temporal Gradient Matching, TGM)损失,使无视频标注的任务也能获得时序一致性。

方法概览

UniD首先训练每个任务的专家模型(Specialist)以学习泛化能力强的任务特定潜在空间;随后,通过蒸馏步骤,利用轻量级潜在投影器(Latent Projectors)将专家模型的潜在表示蒸馏到共享的统一骨干网络(Unified Backbone)中,实现单前向传播的多任务预测。

逐图理解论文

方法概览:从专家到统一的蒸馏

方法概览:从专家到统一的蒸馏
Fig. 2: Overview of UniD. (a) Task specialist training. For each task k, a specialist backbone Fk

UniD首先训练每个任务的专家模型以学习泛化能力强的任务特定潜在空间。随后,通过蒸馏步骤,利用轻量级潜在投影器将专家模型的潜在表示蒸馏到共享的统一骨干网络中。这种方法实现了单前向传播的多任务预测,避免了多次前向传播的计算开销。

实验结果:深度估计性能

实验结果:深度估计性能
Table 2: Monocular Depth Estimation Performance on NYUv2, KITTI, ETH3D, Scan- Net, and DIODE. Best performance among unified methods is bolded.

在NYUv2上,UniD的AbsRel为0.059,优于DINOv3-H的0.092和4M-21-XL的0.068。在ScanNet视频深度估计中,AbsRel为0.103,优于DICEPTION的0.123和DINOv3-H的0.120,展示了其在几何预测任务上的强大竞争力。

实验结果:法线与内禀属性

实验结果:法线与内禀属性
Table 3: Surface Normal Estimation Performance on NYUv2, ScanNet, iBims-1, and Sintel. Best performance among unified methods is bolded.

在ScanNet上,表面法线mean error为14.6度,优于DINOv3-H的16.0度。在IIW上,Albedo WHDR为0.207,优于DINOv3-H的0.289。在SAW上,Shading P@0.7为94.6%,优于DINOv3-H的87.8%,证明其在外观属性预测上的优势。

实验结果:视频时序一致性

实验结果:视频时序一致性
Table 6: Temporal Consistency performance on video prediction tasks. Best perfor- mance among unified methods is bolded. Extended Self-Attention [43] is additionally added to image models with 16-frame memory dequeued at every frame (+ESA[16,1]).

在InteriorNet视频法线估计中,mVC-4为84.7,优于DINOv3-H的78.2和DICEPTION的68.0。UniD在视频基准测试上评估时序一致性,其流式处理模型在深度和法线任务上均超越基线,甚至在法线任务上超越使用视频扩散骨干的NormalCrafter。

实验结果:分割任务与微调

实验结果:分割任务与微调
Table 5: Semantic, Material, and Human Part Segmentation Performance.

在Cityscapes上,语义分割mIoU为37.8,经轻量级微调后提升至58.4。对于分类任务,仅使用L1潜在重建损失无法完全匹配专家模型性能,需要额外的轻量级微调步骤,这揭示了潜在重建目标可能抑制高频结构信息的局限性。

实验与关键结果

  • 在NYUv2, KITTI, ScanNet, DIODE等数据集上评估单目深度估计性能。
  • 在NYUv2, ScanNet, iBims-1, Sintel上评估表面法线估计性能。
  • 在Hypersim, IIW, SAW, COCO, Mapillary上评估Albedo, Shading和Instance Boundary估计性能。
  • 在Cityscapes, VIPSeg, ADE20K, DMS, DensePose上评估分割任务性能。
  • 在视频基准测试上评估时序一致性(Temporal Consistency)。
  • 评估跨任务一致性(Cross-Task Consistency),如深度与法线、人体部分与语义的一致性。
  • 分析推理效率及不同记忆模块大小的影响。
  • 在NYUv2上AbsRel为0.059,优于DINOv3-H (0.092)和4M-21-XL (0.068)(第 11 页)
  • 在ScanNet上表面法线mean error为14.6°,优于DINOv3-H (16.0°)和StableMTL (20.0°)(第 12 页)
  • 在IIW上Albedo WHDR为0.207,优于DINOv3-H (0.289)(第 12 页)
  • 在SAW上Shading P@0.7为94.6%,优于DINOv3-H (87.8%)(第 12 页)
  • 在ScanNet视频深度估计中,AbsRel为0.103,优于DICEPTION (0.123)和DINOv3-H (0.120)(第 13 页)
  • 在InteriorNet视频法线估计中,mVC-4为84.7,优于DINOv3-H (78.2)和DICEPTION (68.0)(第 13 页)
  • 在Cityscapes上语义分割mIoU为37.8,经轻量级微调(FT)后提升至58.4(第 12 页)
  • UniD (Gϕ)在M=16时推理速度为1.56 FPS,比专家集成UniD (Fkθ)快3.5倍以上(第 14 页)

阅读时需要注意

  • 对于分类任务(如语义分割),仅使用L1潜在重建损失无法完全匹配专家模型性能,需要额外的轻量级微调步骤。
  • 潜在重建目标可能抑制分类专家编码的高频结构信息。
  • UniD在分割任务上的初始性能低于专家模型,需进行仅更新投影器的微调以恢复性能。
  • 时序一致性依赖于视频训练数据和推理时的记忆模块,若训练时仅使用图像数据,时序性能会下降。

关联工作

  • 4M-21:基线方法,需要大规模伪标签和离散tokenization,UniD无需共标注且支持灵活的任务特定目标。(第 4 页)
  • DICEPTION:基线方法,通过映射到RGB空间统一任务,需多次前向传播,UniD通过潜在投影实现单步预测。(第 4 页)
  • StableMTL:基线方法,仅在合成数据上训练,UniD使用真实和合成混合数据且泛化性更强。(第 4 页)
  • DINOv3-H:作为直接可比基线,冻结骨干网络并训练任务特定解码器,UniD通过联合训练和扩散先验获得更好的OOD泛化。(第 9 页)
  • Video Depth Anything:视频深度专家模型,UniD在流式处理下与其性能相当或略低,但UniD支持多任务。(第 13 页)
  • NormalCrafter:视频法线专家模型,UniD在法线时序一致性上超越该模型。(第 13 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

来自不相关数据的统一视频密集预测

Yihong Sun1,2,∗, Seoung Wug Oh1, Jiahui Huang1, Bharath Hariharan2, 和 Joon-Young Lee1

1 Adobe Research 2康奈尔大学

摘要。场景理解需要同时对几何、外观和语义进行预测。然而,现有的任务特定标注分散在不兼容的、领域特定的数据集中。当前的统一系统通过限制训练数据为完全共同标注的数据,或者承担伪标注带来的巨大计算成本来规避这一问题。为了缓解这一问题,我们引入了 UniD,这是一个统一的视频模型,能够从互不重叠的、领域特定的数据集中联合学习预测八种密集场景属性——深度、表面法线、语义分割、边界、人体部位、反照率、阴影和材质。我们提出了一种简单而有效的蒸馏步骤,其中每个任务的专家通过轻量级的任务投影器监督统一的主干网络,从而消除了对标注重叠或伪标注的需求。我们的关键见解是,预训练扩散模型的强大视觉先验足以弥合由不相关训练源引入的领域差距,从而实现对训练期间从未见过的场景-任务组合的鲁棒泛化。UniD 在性能上具有竞争力,能够与单任务专家和多任务基线相媲美,并且在分布外场景中表现出强大的泛化能力,同时增强了时序和跨任务的一致性。代码和视频结果可在 https://unid-video.github.io 获取。[cs.CV]

1 引言

为了理解一个场景,视觉系统必须同时回答许多问题:可见物体有多远?它们由什么材料制成?光线如何与它们的表面相互作用?这些问题对应于不同的密集预测任务——深度、材质分割、内禀分解——每个任务都催生了其专用的模型、学习框架和数据集。然而,现实世界是所有这些属性的组合,并且不断变化:一个在场景中导航或操作的具身Agent需要同时且连续地获取所有这些线索。

这促使了最近统一密集预测模型 [13,45,80,82–84,90] 的发展,这些模型联合输出多任务预测。然而,几乎所有现有方法都假设所有任务都在同一图像上进行了共同标注——这一假设在实际收集任务特定数据时是不现实的。几何标注(如深度和法线)可以通过立体视觉或 RGB-D 相机大规模获取,但通常是在

⋆ 在 Adobe Research 实习期间完成的工作。

第 2 页

2 Sun 等人

单目深度 表面法线 反射率 阴影 UniD

输入视频

实例边界 人体部位分割 语义分割 材质分割

图 1: UniD 的统一视频密集预测。

语义多样性有限的环境,例如建筑景观。语义标注需要在多样化的场景集上进行人工标注,从而产生丰富的类别多样性,但很少与几何真值配对。最后,内在分解 [5,53] 在现实世界中测量成本过高,且主要局限于合成领域。受这些根本差异的驱动,将这些碎片化的数据集强制合并为单个共同标注的训练集既不可行,也需要大规模伪标注,而这是不可扩展的:每个新任务都需要重新标注整个数据集。 在此基础上,扩展到视频领域需要大量的标注视频。虽然对于几何任务(例如 RGB-D 视频采集)是可行的,但对于语义和内在任务来说,这变得成本过高。因此,现有的支持视频的方法要么局限于自动驾驶领域 [30],要么主要关注低级几何估计 [3]。 这些约束引出了一个自然的问题:我们能否从互不重叠、特定领域的数据集中学习图像和视频的统一密集预测?我们提出了 UniD,这是一个统一视频模型,从互不重叠、特定领域的数据中学习,联合估计八种密集场景属性——深度、表面法线、语义分割、边界、人体部位、反照率、阴影和材质(图 1)。为了弥合来自互不重叠训练源产生的领域差距,我们首先学习一个对未见样本具有强泛化能力的特定任务潜在空间。我们通过利用在因特网规模数据上预训练的扩散模型的视觉先验 [60] 来实现这种泛化。然后,我们训练一个统一模型,通过轻量级的每任务潜在投影器将共享骨干网络表示映射到每个任务的潜在空间中,从而重建任何输入的所有特定任务潜在嵌入。通过即时计算特定任务嵌入,统一训练不需要共同标注数据或伪标签。 UniD 提供了几个关键优势。首先,它实现了增强的泛化能力和时间稳定性。通过联合利用跨越不同分布的异构来源——例如合成与现实世界、室内与室外,以及静态图像与动态视频——该模型避免了过拟合,并表现出对分布外 (OOD) 场景的显著鲁棒性。关键在于,没有视频监督的任务从其他以视频为中心的任务中继承时间连贯性,确保随时间推移的稳定且一致的预测。 其次,共享骨干网络提供的统一表示确保了跨任务一致性和高推理效率。通过预测单个

第 3 页

来自不相关数据的统一视频稠密预测 3

统一特征流形,我们的模型在不同任务之间强制执行强结构对齐。这导致了不同任务之间的空间一致预测——例如一致的边界 delineations——而在独立的特定任务模型中,这些预测往往是对不齐的。此外,这种共享架构显著降低了计算成本,因为骨干特征仅计算一次以支持多个特定任务的投影器,从而产生最小的每任务开销。

为了证明这些优势,我们在所有任务上进行了广泛的实验,其中 UniD 与现有的特定任务模型相比具有竞争力的性能。此外,UniD 表现出优于现有统一模型和利用冻结 DINOv3-H 骨干的多任务基线的分布外 (OOD) 泛化能力、时间稳定性和跨任务一致性,证明了其在复杂现实世界视频稠密预测中的有效性。

2 相关工作

多任务稠密预测。在单个模型中统一稠密预测任务可以提高效率并促进跨任务互补性 [88]。自然地,许多现有工作 [44, 45, 48, 73, 74, 79, 82–84, 86] 通过要求每张训练图像对每个任务进行标注来获取多任务能力。为了放宽这一约束,最近的工作 [41, 85] 也研究了使用部分每图像标注进行学习以提高标签效率。然而,它仍然假设每张图像包含来自之前相同的共标注分布的子集标注任务。此外,少样本通用模型 [35,36,71] 通过元学习和情景训练减少每任务的标注需求。然而,它们仍然依赖于跨任务的共享元数据集,并未充分利用大规模特定任务数据集。

与此同时,几项工作采用伪标签来强制执行大规模标注共现 [1, 2, 30, 76, 90]。虽然有效,但伪标签成本高昂,当添加新任务或数据集时,必须重新运行整个标注流程。值得注意的是,4M-21 [1] 进一步要求对所有任务输出进行离散标记化,其掩码建模目标将所有任务耦合为统一的标记预测问题,排除了特定任务的优化目标。相比之下,UniD 在不相关、特定任务的数据集上进行训练,同时允许灵活的特定学习任务目标,无需标注共现。

用于稠密预测的扩散模型。扩散模型 [21,27,60,66] 展示了令人印象深刻的图像生成能力。它们从大规模预训练中学到的丰富视觉先验已经启发了许多应用,包括条件生成 [28,52,87,89]、编辑 [10,33,55] 和视频生成 [8,26,29,38]。

在此基础上,最近的方法 [25, 34, 67, 72, 81, 93] 提出利用生成先验来学习超越有限训练数据的稠密预测(例如深度和表面法线)。除了这些特定任务专家外,还提出了使用扩散模型进行直接多任务训练,分别使用完全标注的数据 [80]、伪标签 [90] 或仅合成监督 [13]。值得注意的是,DICEPTION [90] 通过将多任务映射到 RGB 空间来统一多任务

第 4 页

4 Sun 等人

带有条件任务提示(例如“image2depth”)。然而,RGB 统一无法直接表示具有高维输出的任务(例如语义分割),且文本条件生成需要 K 次单独的前向传播才能获得所有 K 个预测结果,从而无法实现同时的多任务推理。 UniD 转而利用扩散模型来学习特定于任务的潜在空间,从而实现逐像素、特定于任务的优化目标,同时利用扩散主干的生成先验来弥合来自不相关训练来源的域间差距。在架构上,UniD 并未采用迭代去噪,而是采用具有共享主干和轻量级每任务潜在投影器的单步扩散,在一次前向传播中同时生成所有任务预测结果。

视频稠密预测。稠密预测在视频领域已得到广泛研究,包括视频深度估计 [15, 62, 75]、表面法线估计 [7] 和语义分割 [31,51,63]。自然地,将稠密预测扩展到视频领域引入了额外的标注稀缺性挑战。这一限制导致现有的统一视频预测方法仅限于自动驾驶领域 [30],主要面向视频生成 [76],或局限于低级几何任务 [3]。相比之下,UniD 不受任何领域的限制,处理超出低级几何的高级语义和内在任务,并通过一个轻量级的无参数模块实现时间一致性,而无需特定于任务的视频标注。

3 方法

任务形式化。我们考虑视频的稠密场景理解问题,其中所需的系统必须从输入视频流中同时预测 K 个任务。形式上,给定一个包含 T 个输入帧 $x_i \in \mathbb{R}^{H \times W \times 3}$ 的输入视频 $v = \{x_1, …, x_T\}$,目标是生成稠密预测图 $\{y^k_1, …, y^k_T\}_{k=1}^K$,其中 $y^k_i \in \mathbb{R}^{H \times W \times C_k}$ 是第 k 个任务在第 i 帧的预测结果。根据任务的不同,输出维度 $C_k$ 可以从标量深度图的 1 到语义分割的类别数不等。此外,每个任务 k 都与标注数据 $D_k$ 相关联,这些数据可能完全互不重叠。 我们首先学习超越每个任务有限训练域和模态的特定于任务的嵌入空间(第 3.1 节),然后将所有任务嵌入蒸馏到一个统一的视频模型中(第 3.2 节)。

3.1 学习特定于任务的嵌入

统一一组多样化的任务通常需要从互不重叠数据中学习,因为不同的任务通常需要不同的标签收集方式(例如,几何任务使用室内 RGB-D 扫描,而语义任务使用互联网图像的手动标注)。为了弥合这些域间差距,我们利用在大规模互联网数据上预训练的扩散模型的丰富生成先验 [60]。

第 5 页

来自不相关数据的统一视频稠密预测 5

基于扩散模型的稠密预测。我们基于预训练的潜在扩散模型(LDM)[60],该模型包含变分自编码器(VAE)编码器 $E$、解码器 $D$ 以及 U-Net 骨干网络 $F_\theta$。给定输入图像 $x_i \in \mathbb{R}^{H \times W \times 3}$,编码器将其映射为紧凑的潜在代码 $z_i = E(x_i) \in \mathbb{R}^{h \times w \times d}$,而解码器则尝试从 $z_i$ 重构图像 $x_i$,即 $D(z_i) \in \mathbb{R}^{H \times W \times 3}$。

一个关键的设计选择是如何将网络与任务输出空间进行接口连接。我们采用像素解码策略:U-Net 预测任务潜在特征 $l_i = F_\theta(z_i) \in \mathbb{R}^{h \times w \times d}$,该特征由预训练的 VAE 解码器 $D$ 解码至其最后一个卷积层,我们将其记为 $D'(l_i) \in \mathbb{R}^{H \times W \times d'}$。随后,我们通过一个轻量级的任务特定像素投影器 $P$,将 $D'(l_i)$ 投影到任务 $k$ 的目标维度 $C_k$。

对于每个任务 $k$,最终预测 $\hat{y}$ 计算如下:

$$ \hat{y}_i^k = P\left(D'\left(F_\theta(E(x_i))\right)\right) \in \mathbb{R}^{H \times W \times C_k} \quad (1) $$

其中,任务潜在特征 $l_i^k$ 通过 $P(D'(\cdot))$ 解码为 $\hat{y}_i^k \in \mathbb{R}^{H \times W \times C_k}$。

像素解码策略(i)支持任意任务的任意 $C_k$ 维输出,(ii)使得针对像素预测的任务特定优化成为可能,以及(iii)隐式地学习了潜在空间与预测空间之间的投影。

具有时序关联的视频预测。将统一稠密预测扩展到视频领域仍然具有挑战性,因为不同任务之间的标注存在不对称性(几何任务的 RGB-D 视频比语义或内在任务的标注更容易获取)。因此,时序机制应保持与没有时序标注的任务兼容。

我们采用扩展自注意力 [43],它在 U-Net 骨干网络 $F_\theta$ 的每个自注意力层中引入了来自过去帧的特征。在帧 $t$,查询(queries)同时关注来自当前帧和存储在内存库中的一组 $M$ 个历史帧 $M_t \subseteq \{1, \dots, t-1\}$ 的键(keys)和值(values):

$$ \text{Attention}\left(\mathbf{Q}_t, \left[\mathbf{K}_s\right]_{s \in M_t \cup \{t\}}, \left[\mathbf{V}_s\right]_{s \in M_t \cup \{t\}}\right) \quad (2) $$

其中 $[\cdot]$ 表示拼接。直观地说,即使没有在视频上进行训练,相邻帧也会共享丰富的对应关系 [67],当帧 $t$ 的查询关注历史键和值时,这可以鼓励时序平滑。

设置 $M=0$ 自然会回退到单帧预测,使其在没有时序标注的训练中保持兼容。内存队列长度 $M$ 以及入队/出队频率可以在推理时选择,从而在不重新训练的情况下,灵活调整时序平滑的程度和内存使用量。

现在,输入视频 $v = \{x_1, \dots, x_T\}$ 通过 $F_\theta$ 处理每个 $z_i = E(x_i)$ 并建立时序关联,投影到任务特定的嵌入 $l = [F_\theta(z_1), \dots, F_\theta(z_T)] \in \mathbb{R}^{T \times h \times w \times d}$,从而产生具有时序感知的表示。

训练任务专家。如图 2(a) 所示,我们为每个任务 $k$ 训练一个专用的专家 $(F_\theta^k, P^k)$,以学习泛化的任务特定嵌入

第 6 页

6 Sun 等人

… … … … … …

(a) (b)

ESA 第 i 层 qi xi ki ki-1 … k0 点积缩放

… v0 … vi vi-1 注意力

… … …

(c)

图 2: UniD 概述。(a) 任务专家训练。对于每个任务 k,专家骨干网络 Fkθ 和像素投影器 Pk 在其任务特定数据集 Dk 上以损失 Lk 进行微调。注意,在训练过程中,编码器 E 和解码器 D′(灰色部分)均被冻结。(b) 统一模型训练。统一骨干网络 Gϕ 随后与 K 个潜在投影器 {Ψ k}Kk=1 一起训练,以重建由冻结的专家 {Fkθ }Kk=1(灰色部分)预测的潜在变量 {lki }。(c) 流式视频推理。在推理过程中,Gϕ 通过扩展自注意力(ESA)处理输入视频,然后通过每个 Ψ k、D′ 和 Pk 解码统一表示 ui,从而同时生成所有 K 个任务的时间一致预测。

在不相关、领域特定的数据上。与像素解码框架一致,我们也采用单步扩散:U-Net 不进行迭代去噪,而是执行一次前向传播以直接预测潜在变量 lki 。单步扩散不仅降低了推理时的延迟,还通过简化原始去噪目标 [25] 提高了训练效率。 形式上,对于每个任务 k,我们通过最小化任务特定数据集 Dk 上的任务特定目标 Lk 来获得任务专家 (Fkθ , Pk):

\ e ft ( \F ^k, xProj ^k\ r igh t ) \; =\; \argmin _ {\F\PixProj\mathbb\sim\;\Big^k\!\Big(\PixProj)\right)\right)\right\Big\Big (3) l \, \ Pi

由于大规模预训练和生成先验,学习到的 Fkθ 可以在统一训练期间嵌入未见数据时桥接不相关数据集。

3.2 统一视频密集预测

使用潜在投影器学习统一模型。手头已有 K 个任务专家 {(Fkθ , Pk)}Kk=1,一种选择是用每个专家对大型共享数据集进行伪标注,并在计算出的标签上进行训练。虽然可行,但为每帧计算/存储 K 个全分辨率标签图 {RH×W ×Ck}Kk=1 既耗时又占用内存,且这两项成本均随 K 线性增长——这甚至是在统一训练开始之前。

第 7 页

来自不相关数据的统一视频稠密预测 7

相反,我们直接在潜在空间中蒸馏任务嵌入。这使得我们能够完全避免伪标签,跳过通过解码器 $D$ 的梯度传播,并将每个任务的学习目标统一为潜在重建。

对于未标记视频 $x = \{x_1, \dots, x_T\}$,我们首先通过每个冻结的专业骨干网络 $F_{k\theta}$ 即时计算具有时序连接的目标任务潜在变量 $l^k_i$,其中 $l^k_i = F_{k\theta}(z_i) \in \mathbb{R}^{h \times w \times d}$,$z_i = E(x_i)$,$i = 1, \dots, T$。然后,我们将统一模型构建为 U-Net 骨干网络 $G_\phi$,其初始化和时序记忆与 $F_{k\theta}$ 相同,并采用 $K$ 个轻量级任务特定的潜在投影器 $\{\Psi^k\}_{k=1}^K$ 将统一表示投影到任务特定的嵌入中。给定输入潜在变量 $z_i$,统一模型同时预测所有任务的潜在变量:

$$ \hat{l}^k_i = \text{LatProj}^k(z_i) \in \mathbb{R}^{h \times w \times d}, \quad k=1,\dots,K. \quad (4) $$

如图 2(b) 所示,统一模型 $(G_\phi, \{\Psi^k\}_{k=1}^K)$ 通过最小化潜在重建目标 $\mathcal{L}_{\text{rec}}$ 进行训练,如下所示:

$$ (G_\phi, \{\Psi^k\}_{k=1}^K) := \arg\min_{G_\phi, \{\Psi^k\}_{k=1}^K} \mathcal{L}_{\text{rec}} \quad (5) $$

其中 $\hat{l}^k$ 和 $l^k$ 均通过在潜在代码 $z_i$(从 $i=1$ 到 $i=T$)上运行 $\Psi^k(G_\phi(\cdot))$ 和 $F_{k\theta}(\cdot)$ 并加入时序连接来计算。

时序潜在稳定化。如果 $\mathcal{L}_{\text{rec}}$ 仅包含逐帧重建损失,统一骨干网络 $G_\phi$ 在统一训练期间不会获得足够的时序正则化。为了解决这个问题,我们将最初为视频深度估计提出的时序梯度匹配 [15] 扩展到一般的潜在公式。给定预测潜在变量 $\hat{l}^k \in \mathbb{R}^{t \times h \times w \times d}$ 和目标潜在变量 $l^k \in \mathbb{R}^{t \times h \times w \times d}$,我们强制预测的时序梯度在每个空间位置与目标的时序梯度匹配:

$$ \mathcal{L}_{\text{TGM}}(\hat{l}, l) = \sum_{i=1}^{T-1} \left\| \mathbb{I}[\cdot] \odot (\hat{l}_{i+1} – \hat{l}_i – (l_{i+1} – l_i)) \right\|_2 \quad (6) $$

其中掩码 $\mathbb{I}[\cdot]$ 抑制在时序正则化不可靠的快速变化区域的学习。最终统一训练目标结合了逐帧 $\ell_1$ 潜在重建与时序梯度匹配损失:$\mathcal{L}_{\text{rec}}(\hat{l}^k, l^k) = \|\hat{l}^k_i – l^k_i\|_1 + \lambda \mathcal{L}_{\text{TGM}}(\hat{l}^k, l^k)$,其中 $\lambda$ 平衡这两项。

推理与可扩展性。在推理阶段,对于所有任务的全分辨率预测,输入 $x \in \mathbb{R}^{T \times H \times W \times 3}$ 的计算方式如下:

$$ u_i = G_\phi(\text{Enc}(x_i)), \quad \hat{y}^k_i = \text{PixProj}^k(\text{Dec}'(\text{LatProj}^k(u_i))) \in \mathbb{R}^{H \times W \times C^k}, \quad i=1,\dots,T \quad (7) $$

该框架具有天然的可扩展性:添加新任务 $K+1$ 仅需在其各自的标记数据上训练一个新的专家 $(F_{K+1\theta}, P_{K+1})$ 并引入一个新的潜在投影器 $\Psi^{K+1}$,无需更改统一骨干网络 $G_\phi$ 的架构,也无需重新标记现有数据。

第 8 页

8 Sun 等人

3.3 实现细节

任务专家。我们使用 Stable Diffusion v2 [60] 作为预训练的潜在扩散模型(LDM)骨干网络。K = 8 个专家中的每一个都使用 AdamW 优化器 [47](衰减率为 10−2),以 3 × 10−5 的学习率对 U-Net 骨干网络以及任务特定的像素投影器 Pk(单个 3 × 3 卷积层)进行微调,直至收敛。

统一模型。统一骨干网络 Gϕ 从相同的预训练 U-Net 初始化。每个潜在投影器 Ψ k 是一个 DPT 头,它将 Gϕ 的 3 个中间表示与融合维度为 256 的最终输出特征进行融合。统一骨干网络 Gϕ 和潜在投影器 Ψ k 使用所有任务的所有标记数据的并集进行训练,其中图像数据和视频数据的采样权重相等。整个统一模型训练 50k 次迭代,批量大小为 32,学习率为 3 × 10−5。有关每个任务的训练数据集、学习目标及其他实现细节,请参阅附录。

4 实验

数据集与指标。训练数据、评估数据、任务特定的输出维度 Ck 以及指标详见表 1。 在评估方面,我们至少选择一个域外数据集(训练期间未见过的数据)来评估 UniD 的泛化能力。对于深度估计和表面法线估计,我们分别遵循 Marigold [34] 和 DSINE [4] 的评估协议。对于反照率和阴影估计,我们分别报告加权人类不一致率(WHDR)[6] 和 70% 召回率下的精确率(P@0.7)[39]。对于实例边界,我们报告最优数据集规模的 F 分数(odsF)[82]。对于分割任务,我们报告平均 IoU 和类别频率加权 IoU(fwIoU)。 为了衡量时间一致性,我们将最初为视频语义分割提出的视频一致性(mVC-t)[51] 扩展,以同时衡量视频法线、反照率、阴影和实例边界的时间一致性。有关评估基准和指标的详细信息,请参阅附录。

基线。我们将 UniD 与任务专家以及统一的多任务基线进行比较。在统一基线中,我们包括 4M-21-XL [1] 和 DI-CEPTION [90],两者都需要大规模伪标签标注。值得注意的是,DICEPTION [90] 需要任务特定的文本描述作为输入,因此需要 K 次前向传播才能获得所有统一预测。我们还包括了 StableMTL [13],它仅在合成数据上训练,并且在推理期间同样按顺序预测任务。作为我们最直接可比的基线,我们扩展了一个冻结的 DINOv3-H [65] 骨干网络,并添加了任务特定的 DPT 头,这些头在完全相同的数据集上,使用相同的损失函数训练了 20k 次迭代。为了公平比较,选择的 DINOv3-H 骨干网络具有与我们统一骨干网络 Gϕ 相同的容量。DINOv3-H 模拟了另一种设计:冻结强大的图像表示,并从互不重叠的数据源中学习每任务解码器,而无需任何任务特定的联合训练或时间模块。

第 9 页

来自不相关数据的统一视频密集预测 9

输入帧 深度 法线 反照率 光照 实例边界 人体部分分割 材质分割 语义分割

DINOv3-H

ours

DINOv3-H

ours

DINOv3-H

ours

图 3: UniD 与 DINOv3-H 的定性结果。1

4.1 各任务性能

分布外泛化。UniD 的主要主张是,预训练扩散主干的生成先验足以弥合由不相关训练源引入的域差异,从而能够泛化到从未见过标注的场景-任务组合。为了评估这一点,表 4 和表 5 中以灰色显示的是分布内基准,而所有其余列均为分布外评估,其中未见标注训练数据。 在所有几何和内在属性任务中,尽管训练数据集相同,UniD (Gϕ) 在 OOD 基准上始终优于 DINOv3-H。

1 视觉示例取自 SA-V [58] 和网络视频 [56]。

第 10 页

10 Sun 等人

表 1:各任务输出维度 $C_k$、训练数据集(含帧数)、评估数据集及指标的总结。大多数训练数据集在不同任务领域间互不重叠,域内评估数据集以灰色显示。

任务 $C_k$ 训练数据集 #帧数 评估数据集 指标

图像: Hypersim [59], VKITTI2 [12] 80.8k NYUv2 [64], KITTI [23], ETH3D [61], AbsRel↓, δ1 ↑ 深度 1 视频:PointOdyssey [91], Spring [49], 361.0k ScanNet [20], DIODE [69] TartanAir [70]

表面法线 3 图像:Hypersim [59], VKITTI2 [12] 80.8k NYUv2 [64], ScanNet [20], iBims-1 [37], Sintel [11] Mean↓, 11.25°↑

反照率 3 图像:Hypersim [59] 59.5k Hypersim [59] , IIW [6] PSNR↑, WHDR15% ↓

阴影 3 图像:Hypersim [59] 59.5k Hypersim [59] , SAW [39] PSNR↑, P@0.7/AP↑ 实例边界 1 图像:视频:VIPSegCOCO [46],[50] Cityscapes [19] 121.3k66.8k COCO [46] , YT-VIS [78], Mapillary [54] odsF↑ 语义分割 (C/CS/VS)201/35/125 图像:视频:VIPSegCOCO [46],[50] Cityscapes [19] 121.3k66.8k Cityscapes [19] , VIPSeg [50] , ADE20K [92] mIoU↑, fwIoU↑

材质分割 57 图像:DMS [68] 22.0k DMS [68] , ADE20K [92] mIoU↑, fwIoU↑

人体部件分割 16 图像:DensePose [24] 26.4k DensePose [24] , Pascal-Human-Part [17] mIoU↑, fwIoU↑

深度(表 2),UniD ($G_\phi$) 在 NYUv2、ScanNet 和 DIODE 上的所有统一方法中取得了最佳的 AbsRel 指标,而 DINOv3-H 在所有五个数据集上的表现均存在一致的差距。对于表面法线(表 3),UniD ($G_\phi$) 在除一项分布外 (OOD) 基准指标外,在所有统一方法中取得了最先进的性能。对于内禀属性和边界(表 4),UniD ($G_\phi$) 在域内表现上与 DINOv3-H 持平,而在每一项分布外基准上均大幅超越它:将反照率 WHDR 从 0.289 提升至 0.207,阴影 P@0.7 从 87.8 提升至 94.6,边界 odsF 从 55.0 提升至 57.2。 这种在域内持平且在域外具有明显优势的趋势,验证了扩散先验在迁移到未见场景时的有效性。为了隔离扩散先验的影响,我们对 Hypersim val [59] 应用了颜色抖动,发现专家模型 UniD ($F_{k\theta}$) 在深度(AbsRel 偏差:0.011 vs. 0.034)和表面法线(平均误差偏差:2.2° vs. 5.8°)上的预测比 DINOv3-H 稳定得多——尽管训练数据相同,其鲁棒性提高了约 3 倍。这表明判别性特征容易过拟合训练数据中的外观-几何相关性,而在大规模网络数据上的生成式预训练编码了更多外观不变的几何信息。图 3 进一步证实了这一点,其中 DINOv3-H 对未见场景的预测明显退化,而 UniD ($G_\phi$) 在所有任务中保持连贯。

统一模型与任务专家。在几何和内禀任务中,UniD ($G_\phi$) 取得了与任务专家 $F_{k\theta}$ 相似的性能。这证明了潜在蒸馏的有效性,即使在将所有八个任务统一到一个共享骨干网络后,它也能忠实地保留专家级别的表示。对于表面法线,统一模型 $G_\phi$ 在 NYUv2、ScanNet 和 Sintel 上实际上优于其自身的专家模型 $F_{N\theta}$,这一增益可归因于来自深度的跨任务正则化,因为深度共享相同的几何训练领域,并在统一骨干网络内共同强化表面几何估计。此外,对于阴影和实例边界(表 4),UniD ($G_\phi$) 在域内评估中与专家 $F_{k\theta}$ 持平,而在域外评估中则略有提升。

第 11 页

来自不相关数据的统一视频密集预测 11

表 2:在 NYUv2、KITTI、ETH3D、ScanNet 和 DIODE 上的单目深度估计性能。统一方法中的最佳性能已加粗。

NYUv2 KITTI ETH3D ScanNet DIODE 方法 AbsRel ↓δ1↑ AbsRel ↓δ1↑ AbsRel ↓δ1↑ AbsRel ↓δ1↑ AbsRel ↓δ1↑

DAv2 [77] 0.043 98.1 0.076 94.7 0.127 88.2 0.043 98.1 0.260 75.9 Depth Pro [9] 0.042 97.7 0.055 97.4 0.043 97.4 0.041 97.8 0.217 76.4 Marigold [34] 0.055 96.4 0.099 91.6 0.065 95.9 0.064 95.2 0.308 77.3 Genpercept [72] 0.091 93.2 0.094 92.3 0.066 95.7 0.056 96.5 0.302 76.7 GeoWizard [22] 0.052 96.6 0.097 92.1 0.064 96.1 0.061 95.3 0.297 79.2 专家模型 Lotus [25] 0.051 97.2 0.081 93.1 0.061 97.0 0.055 96.5 0.228 73.8 UniD (FθD ) 0.059 96.0 0.102 90.9 0.070 95.4 0.069 95.0 0.299 77.4

4M-21-XL [1] 0.068 95.1 0.105 89.6 0.070 95.3 0.065 95.5 0.331 73.4 DICEPTION [90] 0.060 96.3 0.085 91.8 0.070 96.6 0.071 94.8 0.304 72.2 StableMTL [13] 0.090 92.4 0.150 79.8 0.116 87.9 0.105 89.5 0.330 73.8 统一 DINOv3-H [65] 0.092 92.9 0.121 86.5 0.087 93.7 0.089 93.6 0.314 77.5 UniD (Gϕ) 0.059 96.3 0.110 89.5 0.073 95.5 0.063 96.2 0.301 77.3

表 3:在 NYUv2、ScanNet、iBims-1 和 Sintel 上的表面法线估计性能。统一方法中的最佳性能已加粗。

NYUv2 ScanNet iBims-1 Sintel 方法 mean ↓11.25◦↑ mean ↓11.25◦↑ mean ↓11.25◦↑ mean ↓11.25◦↑

OASIS [16] 29.2 23.8 32.8 15.4 32.6 23.5 43.1 7.0 Omnidata v2 [32] 17.2 55.5 16.2 60.2 18.2 63.9 40.5 14.7 DSINE [4] 16.4 59.6 16.2 61.0 17.1 67.4 34.9 21.5 GeoWizard [22] 18.9 50.7 17.4 53.8 19.3 63.0 40.3 12.3 StableNormal [81] 18.6 53.5 17.1 57.4 18.2 65.0 36.7 14.1 专家模型 Lotus [25] 16.2 59.8 14.7 64.0 17.1 66.4 32.3 22.4 UniD (FθN ) 16.7 59.9 15.4 63.7 16.3 69.0 34.3 22.2

4M-21-XL [1] 18.4 49.8 17.4 48.9 18.6 61.4 41.6 12.4 DICEPTION [90] 19.7 51.4 19.3 54.5 17.8 66.2 37.2 19.6 StableMTL [13] 19.6 48.9 20.0 45.8 19.6 58.1 40.5 11.0 统一 DINOv3-H [65] 16.8 57.0 16.0 58.7 16.7 66.8 32.3 18.9 UniD (Gϕ) 16.2 59.9 14.6 65.1 16.6 67.4 33.0 21.4

分割与轻量级微调。相比之下,表 5 揭示了 UniD (Gϕ) 与分类任务的每任务专家模型之间存在系统性差距。我们发现,通过 ℓ1 损失进行重建不足以完全匹配在交叉熵 (CE) 而非基于回归的目标下学习的专家模型,即使当 K=1(即仅蒸馏单个分割专家模型)时,这种性能下降依然存在,这表明该局限性源于潜在重建目标的内在限制。我们将此归因于投影器与主干网络之间的错位:CE 任务专家模型的潜在表示表现出比回归任务潜在表示高得多的空间拉普拉斯范数(2.52 对比 1.40),这表明 ℓ1 蒸馏可能会抑制 CE 专家模型所编码的高频结构。为了解决这个问题,我们执行了一个轻量级微调步骤,仅更新任务特定的投影器 (Ψ k, Pk),同时保持 Gϕ 完全冻结。这种针对性微调(报告为 UniD (Gϕ) + FT)显著缩小了与专家模型的差距,恢复了

第 12 页

12 Sun 等人

表 4:反照率、光照和实例边界估计性能。统一方法中的最佳性能以粗体显示。

反照率 光照 边界 方法 Hypersim IIW Hypersim SAW COCO Mapillary

PSNR ↑WHDR15% ↓ PSNR ↑P@0.7/AP% ↑ odsF ↑ odsF ↑

ColorfulShading [14] 17.2 0.175 14.7 81.3 / 79.4 – – Mask2Former [18] – – – – 67.7 35.6 专用 UniD (Fkθ ) 17.8 0.201 20.3 93.5 / 91.5 79.8 56.3

DINOv3-H [65] 17.8 0.289 19.5 87.8 / 88.0 81.4 55.0 StableMTL [13] – 0.190 – 82.7 / 63.7 – – 统一 UniD (Gϕ) 17.6 0.207 20.2 94.6 / 92.6 80.8 57.2

表 5:语义、材质和人体部件分割性能。

语义 材质 人体部件 方法 Cityscapes VIPSeg ADE20K DMS ADE20K DensePose Pascal-Human-Part

mIoU / fwIoU mIoU / fwIoU mIoU / fwIoU mIoU / fwIoU mIoU / fwIoU mIoU / fwIoU mIoU / fwIoU 专用 UniD (Fkθ ) 64.1 / 85.3 45.8 / 67.2 47.6 / 71.6 47.1 / 74.1 67.2 / 76.2 68.2 / 93.3 66.9 / 88.4

StableMTL [13] 55.8 / – -/- -/- -/- -/- -/- -/- 统一 DINOv3-HUniD (Gϕ) [65] 65.637.8 // 83.879.7 52.846.1 // 66.867.1 62.435.7 // 74.866.2 50.640.6 // 75.172.1 69.144.1 // 75.781.4 67.764.3 // 93.092.9 69.065.9 // 89.188.3 UniD (Gϕ) + FT 58.4 / 83.3 47.0 / 67.0 44.8 / 68.9 47.3 / 73.6 66.0 / 76.0 66.1 / 92.9 65.4 / 88.0

Cityscapes 的 mIoU 从 37.8 提升至 58.4,ADE20K 的 mIoU 从 35.7 提升至 44.8。仅微调投影器后的快速恢复证实,骨干网络 Gϕ 在 ℓ1 蒸馏下确实学习了语义丰富的表示,并在所有任务中保持了统一表示。

4.2 时序一致性

表 6 评估了视频基准上深度、法线、反照率、光照、边界和语义分割的时序一致性。UniD (Gϕ) 在所有任务上均优于所有统一基线,并且值得注意的是,它与为各个任务专门训练的视频专用专家模型具有竞争力。在深度估计方面,我们的流式模型优于 DICEPTION 和 DINOv3-H,而在基于块方式处理视频的 Video Depth Anything 面前略逊一筹。对于表面法线,UniD (Gϕ) 大幅优于 DINOv3-H,甚至超越了利用视频扩散骨干网络的 NormalCrafter [7]。 为了验证相对于统一基线的优势并非仅仅源于基线缺乏时序模块,我们额外为 DINOv3-H 和 DICEPTION 配备了相同的扩展自注意力(ESA)模块以进行公平比较。我们发现,ESA 为两个基线带来了微小但不一致的改进,而 UniD (Gϕ) 在所有任务上仍然优于所有变体。这表明时序稳定性并非仅源于无参数的 ESA 模块,而是源于其与视频数据统一训练的结合,这两者共同在所有任务中同时传播时序平滑性,而无需任务特定的视频标注。

第 13 页

不相关数据下的统一视频稠密预测 13

表 6:视频预测任务上的时序一致性性能。统一方法中的最佳性能已加粗。扩展自注意力 [43] 额外添加至图像模型中,每帧出队 16 帧内存 (+ESA[16,1])。

深度 法线 反照率 光照 边界 语义 方法 ScanNet InteriorNet InteriorNet InteriorNet YT-VIS VIPSeg

AbsRel ↓δ1↑ mVC-4/16 ↑ mVC-4/16 ↑ mVC-4/16 ↑ mVC-4 ↑ mVC-4 ↑

Video Depth Anything [15] 0.063 96.8 -/- -/- -/- – – Spec. NormalCrafterColorfulShading[7][14] — — 84.6- // 70.9- 78.9 -/-/ 55.1 73.5-/-/ 41.5 — — UniD (Fkθ ) 0.101 91.2 85.9 / 76.4 86.9 / 70.1 92.5 / 81.9 93.6 93.8

DICEPTION [90] 0.123 85.7 68.0 / 47.1 -/- -/- – – DINOv3-H [65] 0.120 86.9 78.2 / 62.2 77.8 / 53.4 90.2 / 77.6 92.0 87.8 DICEPTION [90] + ESA[16,1] 0.118 85.9 66.0 / 48.6 -/- -/- – – Unified DINOv3-H [65] + ESA[16,1] 0.150 79.8 79.0 / 63.6 76.4 / 54.1 92.4 / 82.7 92.4 89.7 UniD (Gϕ) 0.103 91.0 84.7 / 75.8 88.8 / 73.7 94.5 / 85.2 93.7 90.3

表 7:跨任务一致性评估。统一方法中的最佳性能已加粗。

深度↔法线 部分↔语义 反照率↔光照 方法 ScanNet COCO HyperSim mean ↓11.25◦↑ % inclusion ↑ PSNR ↑ LPIPS ↓ Spec. ColorfulShadingUniD (Fkθ ) [14] 23.9- 39.0- 97.6- 24.620.8 0.220.27

4M-21-XL [1] 23.4 37.2 – – – DICEPTION [90] 27.3 27.4 – – – DINOv3-H [65] 36.0 14.1 98.1 23.9 0.26 Unified UniD (Gϕ) 22.6 39.0 98.3 24.3 0.24

4.3 跨任务一致性

表 7 评估了相关任务预测对之间的几何、语义和光度一致性。 为了测量深度和法线之间的一致性,我们计算由深度预测导出的表面法线与直接法线预测之间的误差。UniD (Gϕ) 在所有方法中在 ScanNet 上实现了最佳的一致性,大幅优于 DICEPTION 和 DINOv3-H,并超越了独立专家集成 UniD (Fkθ ) 。对于人体部分和语义分割之间的一致性,我们测量预测的人体部分像素包含在人体语义类别中的百分比。在此,统一模型略微优于 DINOv3-H 和专家集成,证实了共享主干网络鼓励语义预测彼此保持连贯。最后,为了测量内在一致性,我们直接测量预测反照率和光照的漫反射重建的重建性能。同样,UniD (Gϕ) 与专家集成保持竞争力,同时仍优于 DINOv3-H。 这表明联合潜在蒸馏目标——其中统一主干网络同时由所有任务专家监督——隐式地鼓励了跨任务的几何和语义连贯性,这是独立专家或冻结主干基线无法实现的。

第 14 页

14 Sun 等人

表 8:在单张 A100 GPU 上,针对 432×768 分辨率,在不同数量的历史帧 M 存入内存时的逐组件推理分析。UniD (Fkθ) 表示专家集成模型(K=8 次顺序 U-Net 前向传播);UniD (Gϕ) 表示统一模型(一次共享 U-Net 前向传播,带有 K 个 DPT 连接器 Ψ k)。

方法 M E (ms) U-Net (ms) Ψ k (ms) D (ms) Pk (ms) 总计 (s) FPS

StableMTL [13] 0 – – – – – 0.03 + 0.58 × K 0.21 4M-21-XL [1] 0 – – – – – 0.29 + 0.43 × K 0.27 DICEPTION [90] 0 – – – – – 0.07 + 4.15 × K 0.03 DINOv3-H [65] 0 – – – – – 0.21 + 0.02 × K 2.67 UniD (Fkθ ) 0 35.9 58.6 × K – 42.3 × K 1.1 × K 0.04 + 0.10 × K 1.17 UniD (Gϕ) 0 35.9 58.6 3.1 × K 42.3 × K 1.1 × K 0.09 + 0.05 × K 2.14

DICEPTION [90] + ESA 16 – – – – – 0.07 + 5.05 × K 0.02 DINOv3-H [65] + ESA 16 – – – – – 1.30 + 0.02 × K 0.69 UniD (Fkθ ) 16 36.5 235.0 × K – 42.2 × K 1.1 × K 0.04 + 0.28 × K 0.44 UniD (Gϕ) 16 36.5 235.0 3.0 × K 42.2 × K 1.1 × K 0.27 + 0.05 × K 1.56

表 9:视频预测任务中时序一致性性能的消融研究。如果“使用视频训练”设置为 ✗,则所有视频均被视为独立图像。

深度 法线 反照率 光照 边界 语义 使用视频 推理 ScanNet InteriorNet InteriorNet InteriorNet YT-VIS VIPSeg 训练 内存 AbsRel ↓δ1↑ mVC-4/16 ↑ mVC-4/16 ↑ mVC-4/16 ↑ mVC-4 ↑ mVC-4 ↑ ✗ ∅ 0.121 87.1 79.0 / 65.6 84.4 / 65.0 92.7 / 81.5 92.9 85.9 ✗ [16, 1] 0.115 88.1 82.9 / 72.7 87.3 / 70.7 93.6 / 82.9 93.0 89.1 ✓ ∅ 0.109 90.0 80.9 / 68.5 86.0 / 67.1 93.7 / 83.5 93.6 86.5 ✓ [16, 1] 0.103 91.0 84.7 / 75.8 88.8 / 73.7 94.5 / 85.2 93.7 90.3

4.4 效率分析与消融研究

效率分析。如表 8 所示,UniD (Gϕ) 在所有内存设置下均表现出高效性,在 M=0 时与判别式模型 DINOv3-H [65] 保持竞争力,而在 M=16 时则大幅超越所有基线方法。StableMTL [13]、DICEPTION [90] 和 4M-21-XL [1] 由于每任务成本过高而表现不佳,而 UniD (Gϕ) 即使在拥有 16 帧内存库的情况下仍能维持 1.56 FPS 的帧率。 这种效率的关键在于几乎所有计算都在任务间共享。与需要 K 次顺序 U-Net 前向传播并带有内存注意力的专家集成模型 UniD (Fkθ) 相比,UniD (Gϕ) 一次性处理所有任务的统一历史特征,在 M=0 时实现了 1.8 倍的速度提升,并且随着时序上下文的增加,在 M=16 时速度提升超过 3.5 倍。

潜在蒸馏与逐像素蒸馏。与我们提出的潜在蒸馏相比,一种自然的替代方案是直接通过预计算的伪标签或实时生成的标签,对统一模型进行逐像素预测的监督。然而,由于在统一训练期间逐像素反向传播的高昂代价,这些方法在大规模应用时并不可行。在训练步骤中,通过每个任务的解码器 D′ 计算梯度需要同时在 GPU 内存中保留 K 个独立的解码器激活图,这导致内存消耗随 K 线性增长,使得在标准硬件上进行联合训练变得不可行。潜在蒸馏

第 15 页

来自不相关数据的统一视频密集预测 15

这种方法绕过了这一瓶颈:潜在目标 $l_{ki} = F_{k\theta}(z_i) \in \mathbb{R}^{h \times w \times d}$ 计算成本低、存储体积小,并且避免了与解码器 $D$ 的任何计算。因此,在相同的训练设置下,切换到潜在蒸馏(Latent Distillation)后,每个设备的峰值内存使用量可从估计的 650GB 降低至 78GB。

视频训练和推理时内存的影响。如表 9 所示,当所有视频在训练期间被视为独立图像时,所有基准测试中的时序一致性都会下降。这直接消融了时序梯度匹配(Temporal Gradient Matching, TGM)损失,因为静态图像训练消除了所有跨帧监督。这表明,仅在使用包含视频注释的深度和语义分割数据时,统一训练将时序一致性传播到所有任务,即使那些没有特定任务视频注释的任务也是如此。

值得注意的是,即使在没有推理内存($\emptyset$)的情况下:仅视频训练就能在所有任务上产生更稳定的表示,在任何推理时内存模块引入之前。在推理时启用扩展自注意力(Extended Self-Attention)内存库([16, 1],每帧出队一个包含 16 帧的队列)进一步提高了所有任务的时序一致性,无论是否使用了视频训练。有趣的是,即使没有视频训练,推理时内存也能在没有视频注释的任务上提供显著的提升,这表明在统一训练期间蒸馏任务专家 $F_{k\theta}$ 时,内存机制可以弥补时序训练信号的缺失。

虽然视频训练推动了时序一致性,但它并不是我们要优于统一图像基线的每任务准确率优势的原因。如附录所示,将视频视为独立图像产生的每任务性能几乎相同,这证实了相对于基线的提升源于统一架构和潜在蒸馏,而非视频监督。

5 结论

现实世界的数据在互不兼容的领域之间本质上是碎片化的。在本工作中,我们提出了 UniD,从这些不相关来源中学习统一的视频密集预测。它首先在不相关数据集上学习特定任务的嵌入,然后通过每任务潜在投影器(Latent Projector)将它们蒸馏到统一的主干网络中。为了弥合这些领域差距,我们利用互联网规模预训练中的扩散先验,以实现对未见过的场景-任务组合的泛化。UniD 达到了与特定任务专家相媲美的性能,并在具有优越时序和跨任务一致性的分布外(Out-of-Distribution, OOD)场景中优于统一基线。

局限性。潜在重建对分类任务的效果较差,需要额外的微调才能恢复分割性能;未来的工作可以探索能更好地保留分类表示的目标函数。

致谢。这项工作部分是在 Adobe Research 实习期间完成的,并部分得到了 NSF(IIS-2144117)的支持。Yihong Sun 获得了 NSF 研究生研究奖学金的支持。我们要感谢 Yao-Chih Lee、Wei-Hong Li、Youming Deng 和 Ashley P. Tsang 提供的宝贵反馈。

第 16 页

16 Sun 等人

参考文献

1. Bachmann, R., Kar, O.F., Mizrahi, D., Garjani, A., Gao, M., Griffiths, D., Hu, J., Dehghan, A., Zamir, A.: 4m-21: 面向数十项任务和模态的任意到任意视觉模型。神经信息处理系统进展 37, 61872–61911 (2024) 2. Bachmann, R., Mizrahi, D., Atanov, A., Zamir, A.: Multimae: 多模态多任务掩码自编码器。在:欧洲计算机视觉会议。页码 348– 367。Springer (2022) 3. Badki, A., Su, H., Wen, B., Gallo, O.: L4p: 迈向统一的低级 4D 视觉感知。arXiv 预印本 arXiv:2502.13078 (2025) 4. Bae, G., Davison, A.J.: 重新思考表面法线估计的归纳偏置。 在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 9535–9545 (2024) 5. Barron, J.T., Malik, J.: 从阴影中恢复形状、光照和反射率。IEEE 模式分析与机器智能汇刊 37(8), 1670–1687 (2014) 6. Bell, S., Bala, K., Snavely, N.: 真实场景中的本征图像。ACM 图形学汇刊 (SIGGRAPH) 33(4) (2014) 7. Bin, Y., Hu, W., Wang, H., Chen, X., Wang, B.: Normalcrafter: 从视频扩散先验中学习时序一致的法线。在: IEEE/CVF 国际计算机视觉会议论文集。页码 8330–8339 (2025) 8. Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y., English, Z., Voleti, V., Letts, A., 等: Stable video diffusion: 将潜在视频扩散模型扩展至大规模数据集。arXiv 预印本 arXiv:2311.15127 (2023) 9. Bochkovskii, A., Delaunoy, A., Germain, H., Santos, M., Zhou, Y., Richter, S.R., Koltun, V.: Depth pro: 不到一秒钟的单目度量深度。arXiv 预印本 arXiv:2410.02073 (2024) 10. Brooks, T., Holynski, A., Efros, A.A.: Instructpix2pix: 学习遵循图像编辑指令。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 18392–18402 (2023) 11. Butler, D.J., Wulff, J., Stanley, G.B., Black, M.J.: 用于光流评估的自然主义开源电影。在:欧洲计算机视觉会议。页码 611– 625。Springer (2012) 12. Cabon, Y., Murray, N., Humenberger, M.: Virtual kitti 2。arXiv 预印本 arXiv:2001.10773 (2020) 13. Cao, A.Q., Lopes, I., de Charette, R.: Stablemtl: 重新利用潜在扩散模型进行部分标注的合成数据集的多任务学习。在:IEEE/CVF 计算机视觉与模式识别会议论文集 (2026) 14. Careaga, C., Aksoy, Y.: 真实场景中的彩色漫反射本征图像分解。 ACM 图形学汇刊 (TOG) 43(6), 1–12 (2024) 15. Chen, S., Guo, H., Zhu, S., Zhang, F., Huang, Z., Feng, J., Kang, B.: Video depth anything: 超长视频的一致性深度估计。在: 计算机视觉与模式识别会议论文集。页码 22831–22840 (2025) 16. Chen, W., Qian, S., Fan, D., Kojima, N., Hamilton, M., Deng, J.: Oasis: 真实场景单图像 3D 的大规模数据集。在:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 679–688 (2020) 17. Chen, X., Mottaghi, R., Liu, X., Fidler, S., Urtasun, R., Yuille, A.: Detect what you can: 使用整体模型和身体部位检测和表示对象。在:

第 17 页

来自不相关数据的统一视频密集预测 17

IEEE计算机视觉与模式识别会议论文集。 第1971–1978页 (2014) 18. Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., Girdhar, R.: 用于通用图像分割的掩码注意力掩码变换器 (Masked-attention mask transformer)。在:IEEE/CVF计算机视觉与模式识别会议论文集。第1290–1299页 (2022) 19. Cordts, M., Omran, M., Ramos, S., Rehfeld, T., Enzweiler, M., Benenson, R., Franke, U., Roth, S., Schiele, B: 用于语义城市场景理解的Cityscapes数据集。在:IEEE计算机视觉与模式识别会议论文集。第3213–3223页 (2016) 20. Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nießner, M.: Scannet:富含注释的室内场景3D重建。在:IEEE计算机视觉与模式识别会议论文集。第5828–5839页 (2017) 21. Esser, P., Kulal, S., Blattmann, A., Entezari, R., Müller, J., Saini, H., Levi, Y., Lorenz, D., Sauer, A., Boesel, F., 等:扩展整流流变换器以实现高分辨率图像合成。在:第四十一届国际机器学习会议 (2024) 22. Fu, X., Yin, W., Hu, M., Wang, K., Ma, Y., Tan, P., Shen, S., Lin, D., Long, X.: Geowizard:释放扩散先验以从单张图像进行3D几何估计。在:欧洲计算机视觉会议。第241–258页。Springer (2024) 23. Geiger, A., Lenz, P., Urtasun, R.: 我们准备好自动驾驶了吗?Kitti视觉基准套件。在:2012 IEEE计算机视觉与模式识别会议。第3354–3361页。IEEE (2012) 24. Güler, R.A., Neverova, N., Kokkinos, I.: Densepose:野外密集人体姿态估计。在:IEEE计算机视觉与模式识别会议论文集。第7297–7306页 (2018) 25. He, J., Li, H., Yin, W., Liang, Y., Li, L., Zhou, K., Zhang, H., Liu, B., Chen, Y.C.: Lotus:基于扩散的高质量密集预测视觉基础模型。arXiv预印本 arXiv:2409.18124 (2024) 26. Ho, J., Chan, W., Saharia, C., Whang, J., Gao, R., Gritsenko, A., Kingma, D.P., Poole, B., Norouzi, M., Fleet, D.J., 等:Imagen video:使用扩散模型进行高清视频生成。arXiv预印本 arXiv:2210.02303 (2022) 27. Ho, J., Jain, A., Abbeel, P.: 去噪扩散概率模型。神经信息处理系统进展 33, 6840–6851 (2020) 28. Ho, J., Salimans, T.: 无分类器扩散引导 (Classifier-free diffusion guidance)。arXiv预印本 arXiv:2207.12598 (2022) 29. Ho, J., Salimans, T., Gritsenko, A., Chan, W., Norouzi, M., Fleet, D.J.: 视频扩散模型。神经信息处理系统进展 35, 8633–8646 (2022) 30. Huang, T.E., Liu, Y., Van Gool, L., Yu, F.: 视频任务十项全能:统一自动驾驶中的图像和视频任务。在:IEEE/CVF国际计算机视觉会议论文集。第8647–8657页 (2023) 31. Jain, S., Wang, X., Gonzalez, J.E.: Accel:用于视频高效语义分割的校正融合网络。在:IEEE/CVF计算机视觉与模式识别会议论文集。第8866–8875页 (2019) 32. Kar, O.F., Yeo, T., Atanov, A., Zamir, A.: 3D常见损坏与数据增强。在:IEEE/CVF计算机视觉与模式识别会议论文集。第18963–18974页 (2022)

第 18 页

18 Sun 等人

33. Kawar, B., Zada, S., Lang, O., Tov, O., Chang, H., Dekel, T., Mosseri, I., Irani, M.: Imagic: 基于文本的真实图像编辑与扩散模型。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 6007–6017 (2023) 34. Ke, B., Obukhov, A., Huang, S., Metzger, N., Daudt, R.C., Schindler, K.: 将基于扩散的图像生成器重新用于单目深度估计。在: IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 9492–9502 (2024) 35. Kim, D., Cho, S., Kim, S., Luo, C., Hong, S.: Chameleon: 一种数据高效的全能模型,用于野外密集视觉预测。在:欧洲计算机视觉会议。pp. 422–441. Springer (2024) 36. Kim, D., Kim, J., Cho, S., Luo, C., Hong, S.: 通过视觉标记匹配实现密集预测任务的通用少样本学习。arXiv 预印本 arXiv:2303.14969 (2023) 37. Koch, T., Liebel, L., Fraundorfer, F., Korner, M.: 基于 CNN 的单图像深度估计方法评估。在:欧洲计算机视觉会议 (ECCV) 研讨会论文集。pp. 0–0 (2018) 38. Kondratyuk, D., Yu, L., Gu, X., Lezama, J., Huang, J., Schindler, G., Hornung, R., Birodkar, V., Yan, J., Chiu, M.C., 等:Videopoet: 用于零样本视频生成的大型语言模型。arXiv 预印本 arXiv:2312.14125 (2023) 39. Kovacs, B., Bell, S., Snavely, N., Bala, K.: 野外场景的着色标注。计算机视觉与模式识别 (CVPR) (2017) 40. Lambert, J., Liu, Z., Sener, O., Hays, J., Koltun, V.: Mseg: 用于多域语义分割的组合数据集。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 2879–2888 (2020) 41. Li, W.H., Liu, X., Bilen, H.: 从部分标注数据中学习多个密集预测任务。在:IEEE/CVF 计算机视觉与模式识别会议论文集。pp. 18879–18889 (2022) 42. Li, W., Saeedi, S., McCormac, J., Clark, R., Tzoumanikas, D., Ye, Q., Huang, Y., Tang, R., Leutenegger, S.: Interiornet: 大规模多传感器照片级真实室内场景数据集。arXiv 预印本 arXiv:1809.00716 (2018) 43. Liang, F., Kodaira, A., Xu, C., Tomizuka, M., Keutzer, K., Marculescu, D.: 向后看:使用特征库进行流式视频到视频转换。arXiv 预印本 arXiv:2405.15757 (2024) 44. Lin, B., Jiang, W., Chen, P., Liu, S., Chen, Y.C.: Mtmamba++: 通过基于 Mamba 的解码器增强多任务密集场景理解。IEEE 模式分析与机器智能汇刊 (2025) 45. Lin, B., Jiang, W., Chen, P., Zhang, Y., Liu, S., Chen, Y.C.: Mtmamba: 通过基于 Mamba 的解码器增强多任务密集场景理解。在:欧洲 计算机视觉会议。pp. 314–330. Springer (2024) 46. Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollár, P., Zitnick, C.L.: Microsoft coco: 上下文中的常见对象。在:欧洲计算机视觉会议。pp. 740–755. Springer (2014) 47. Loshchilov, I., Hutter, F.: 解耦权重衰减正则化。arXiv 预印本 arXiv:1711.05101 (2017) 48. Lu, Y., Sirejiding, S., Ding, Y., Wang, C., Lu, H.: 用于多任务密集预测的提示引导 Transformer。IEEE 多媒体汇刊 26, 6375–6385 (2024) 49. Mehl, L., Schmalfuss, J., Jahedi, A., Nalivayko, Y., Bruhn, A.: Spring: 一个高分辨率、高细节的场景流、光流和立体视觉数据集与基准。

第 19 页

从互不重叠数据统一进行视频密集预测 19

收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 4981–4991 (2023) 50. Miao, J., Wang, X., Wu, Y., Li, W., Zhang, X., Wei, Y., Yang, Y.: 野外大规模视频全景分割:一项基准测试。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 21033– 21043 (2022) 51. Miao, J., Wei, Y., Wu, Y., Liang, C., Li, G., Yang, Y.: Vspw:用于野外视频场景解析的大规模数据集。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 4133–4143 (2021) 52. Mou, C., Wang, X., Xie, L., Wu, Y., Zhang, J., Qi, Z., Shan, Y.: T2i-adapter:学习适配器以挖掘文本到图像扩散模型中更多的可控能力。收录于:AAAI 人工智能会议论文集。卷 38,页码 4296–4304 (2024) 53. Narihira, T., Maire, M., Yu, S.X.: Direct intrinsics:通过卷积回归学习反照率-阴影分解。收录于:IEEE 国际计算机视觉会议论文集 (2015) 54. Neuhold, G., Ollmann, T., Rota Bulo, S., Kontschieder, P.: Mapillary Vistas 数据集:用于街道场景语义理解。收录于:IEEE 国际计算机视觉会议论文集。页码 4990–4999 (2017) 55. Nichol, A., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., McGrew, B., Sutskever, I., Chen, M.: Glide:迈向基于文本引导的扩散模型的逼真图像生成与编辑。arXiv 预印本 arXiv:2112.10741 (2021) 56. Pexels 网站:Pexels — 随处可用的免费库存照片和视频。 https://www.pexels.com/ 57. Ranftl, R., Bochkovskiy, A., Koltun, V.: 用于密集预测的视觉变换器。 收录于:IEEE/CVF 国际计算机视觉会议论文集。 页码 12179–12188 (2021) 58. Ravi, N., Gabeur, V., Hu, Y.T., Hu, R., Ryali, C., Ma, T., Khedr, H., Rädle, R., Rolland, C., Gustafson, L., 等:Sam 2:在图像和视频中进行分割。 arXiv 预印本 arXiv:2408.00714 (2024) 59. Roberts, M., Ramapuram, J., Ranjan, A., Kumar, A., Bautista, M.A., Paczan, N., Webb, R., Susskind, J.M.: Hypersim:用于整体室内场景理解的逼真合成数据集。收录于:IEEE/CVF 国际计算机视觉会议论文集。页码 10912–10922 (2021) 60. Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: 使用潜在扩散模型进行高分辨率图像合成。收录于:IEEE/CVF 计算机视觉与模式识别会议论文集。页码 10684–10695 (2022) 61. Schops, T., Schonberger, J.L., Galliani, S., Sattler, T., Schindler, K., Pollefeys, M., Geiger, A.: 一个具有高分辨率图像和多相机视频的多视图立体基准测试。收录于:IEEE 计算机视觉与模式识别会议论文集。页码 3260–3269 (2017) 62. Shao, J., Yang, Y., Zhou, H., Zhang, Y., Shen, Y., Guizilini, V., Wang, Y., Poggi, M., Liao, Y.: 从视频扩散先验中学习时序一致的视频深度。收录于:计算机视觉与模式识别会议论文集。 页码 22841–22852 (2025) 63. Shin, I., Kim, D., Yu, Q., Xie, J., Kim, H.S., Green, B., Kweon, I.S., Yoon, K.J., Chen, L.C.: Video-kmax:一种用于在线和近在线视频全景分割的简单统一方法。收录于:IEEE/CVF 计算机视觉应用冬季会议论文集。页码 229–239 (2024)

第 20 页

20 Sun 等人

64. Silberman, N., Hoiem, D., Kohli, P., Fergus, R.: Indoor segmentation and support inference from rgbd images. In: European conference on computer vision. pp. 746– 760. Springer (2012) 65. Siméoni, O., Vo, H.V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khali- dov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., et al.: Dinov3. arXiv preprint arXiv:2508.10104 (2025) 66. Song, Y., Sohl-Dickstein, J., Kingma, D.P., Kumar, A., Ermon, S., Poole, B.: Score- based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456 (2020) 67. Tang, L., Jia, M., Wang, Q., Phoo, C.P., Hariharan, B.: Emergent correspondence from image diffusion. Advances in neural information processing systems 36, 1363– 1389 (2023) 68. Upchurch, P., Niu, R.: A dense material segmentation dataset for indoor and out- door scene parsing. In: European conference on computer vision. pp. 450–466. Springer (2022) 69. Vasiljevic, I., Kolkin, N., Zhang, S., Luo, R., Wang, H., Dai, F.Z., Daniele, A.F., Mostajabi, M., Basart, S., Walter, M.R., et al.: Diode: A dense indoor and outdoor depth dataset. arXiv preprint arXiv:1908.00463 (2019) 70. Wang, W., Zhu, D., Wang, X., Hu, Y., Qiu, Y., Wang, C., Hu, Y., Kapoor, A., Scherer, S.: Tartanair: A dataset to push the limits of visual slam. In: 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). pp. 4909–4916. IEEE (2020) 71. Xia, C., Jia, C., Dang, Z., Luo, M., Li, Z., Chang, X.: From ideal to real: Uni- fied and data-efficient dense prediction for real-world scenarios. arXiv preprint arXiv:2506.20279 (2025) 72. Xu, G., Ge, Y., Liu, M., Fan, C., Xie, K., Zhao, Z., Chen, H., Shen, C.: What matters when repurposing diffusion models for general dense perception tasks? arXiv preprint arXiv:2403.06090 (2024) 73. Xu, Y., Li, X., Yuan, H., Yang, Y., Zhang, L.: Multi-task learning with multi-query transformer for dense prediction. IEEE Transactions on Circuits and Systems for Video Technology 34(2), 1228–1240 (2023) 74. Xu, Y., Yang, Y., Zhang, L.: Demt: Deformable mixer transformer for multi-task learning of dense prediction. In: Proceedings of the AAAI conference on artificial intelligence. vol. 37, pp. 3072–3080 (2023) 75. Yang, H., Huang, D., Yin, W., Shen, C., Liu, H., He, X., Lin, B., Ouyang, W., He, T.: Depth any video with scalable synthetic data. arXiv preprint arXiv:2410.10815 (2024) 76. Yang, L., Qi, L., Li, X., Li, S., Jampani, V., Yang, M.H.: Unified dense prediction of video diffusion. In: Proceedings of the Computer Vision and Pattern Recognition Conference. pp. 28963–28973 (2025) 77. Yang, L., Kang, B., Huang, Z., Zhao, Z., Xu, X., Feng, J., Zhao, H.: Depth anything v2. Advances in Neural Information Processing Systems 37, 21875–21911 (2024) 78. Yang, L., Fan, Y., Xu, N.: Video instance segmentation. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 5188–5197 (2019) 79. Yang, Y., Jiang, P.T., Hou, Q., Zhang, H., Chen, J., Li, B.: Multi-task dense prediction via mixture of low-rank experts. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 27927–27937 (2024) 80. Yang, Y., Jiang, P.T., Hou, Q., Zhang, H., Chen, J., Li, B.: Multi-task dense predictions via unleashing the power of diffusion. In: The Thirteenth International Conference on Learning Representations (2025)

第 21 页

不相关数据上的统一视频密集预测 21

81. Ye, C., Qiu, L., Gu, X., Zuo, Q., Wu, Y., Dong, Z., Bo, L., Xiu, Y., Han, X.: Sta- blenormal: Reducing diffusion variance for stable and sharp normal. ACM Trans- actions on Graphics (ToG) 43(6), 1–18 (2024) 82. Ye, H., Xu, D.: Inverted pyramid multi-task transformer for dense scene under- standing. In: European Conference on Computer Vision. pp. 514–530. Springer (2022) 83. Ye, H., Xu, D.: Taskexpert: Dynamically assembling multi-task representations with memorial mixture-of-experts. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 21828–21837 (2023) 84. Ye, H., Xu, D.: Taskprompter: Spatial-channel multi-task prompting for dense scene understanding. In: The Eleventh International Conference on Learning Rep- resentations (2023) 85. Ye, H., Xu, D.: Diffusionmtl: Learning multi-task denoising diffusion model from partially annotated data. In: Proceedings of the IEEE/CVF Conference on Com- puter Vision and Pattern Recognition. pp. 27960–27969 (2024) 86. Ye, H., Xu, D.: Invpt++: Inverted pyramid multi-task transformer for visual scene understanding. IEEE transactions on pattern analysis and machine intelligence 46(12), 7493–7508 (2024) 87. Ye, H., Zhang, J., Liu, S., Han, X., Yang, W.: Ip-adapter: Text compati- ble image prompt adapter for text-to-image diffusion models. arXiv preprint arXiv:2308.06721 (2023) 88. Zamir, A.R., Sax, A., Shen, W., Guibas, L.J., Malik, J., Savarese, S.: Taskonomy: Disentangling task transfer learning. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 3712–3722 (2018) 89. Zhang, L., Rao, A., Agrawala, M.: Adding conditional control to text-to-image diffusion models. In: Proceedings of the IEEE/CVF international conference on computer vision. pp. 3836–3847 (2023) 90. Zhao, C., Sun, Y., Liu, M., Zheng, H., Zhu, M., Zhao, Z., Chen, H., He, T., Shen, C.: Diception: A generalist diffusion model for visual perceptual tasks. arXiv preprint arXiv:2502.17157 (2025) 91. Zheng, Y., Harley, A.W., Shen, B., Wetzstein, G., Guibas, L.J.: Pointodyssey: A large-scale synthetic dataset for long-term point tracking. In: Proceedings of the IEEE/CVF International Conference on Computer Vision. pp. 19855–19865 (2023) 92. Zhou, B., Zhao, H., Puig, X., Fidler, S., Barriuso, A., Torralba, A.: Scene parsing through ade20k dataset. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 633–641 (2017) 93. Zhu, M., Liu, Y., Luo, Z., Jing, C., Chen, H., Xu, G., Wang, X., Shen, C.: Un- leashing the potential of the diffusion model in few-shot semantic segmentation. Advances in Neural Information Processing Systems 37, 42672–42695 (2024)

第 22 页

22 Sun 等人

A 实现细节

VAE 编码器和解码器。VAE 编码器 $E$ 将输入图像 $x_i \in \mathbb{R}^{H \times W \times 3}$ 映射为紧凑的潜在代码 $z_i = E(x_i) \in \mathbb{R}^{h \times w \times d}$,其中空间下采样因子为 8(即 $h = H/8, w = W/8$),潜在通道维度为 $d = 4$。在所有训练阶段,$E$ 和 $D$ 均保持冻结。

U-Net 主干网络。对预训练的 U-Net 未进行任何架构更改。作为 U-Net 的输入,干净图像 $x_i$ 与固定的文本提示("video_dense_pixel_prediction")一起传入。

像素投影器 $P_k$。像素投影器 $P_k$ 将解码后的特征图 $D'(l_{ki}) \in \mathbb{R}^{H \times W \times d'}$ 映射到特定于任务的输出 $\hat{y}_{ki} \in \mathbb{R}^{H \times W \times C_k}$,其中 $d'$ 是 VAE 解码器 $D$ 的最终卷积层的输入通道数。对于所有任务,$P_k$ 是一个轻量级的单个 $3 \times 3$ 卷积层,直接将 $d'$ 通道映射到 $C_k$ 个输出。所有投影器权重均使用 Xavier 均匀初始化,并在专家训练期间从头开始训练。有关每个任务的 $C_k$,请参阅表 1。

潜在投影器 $\Psi_k$(DPT 头)。每个潜在投影器 $\Psi_k$ 是一个 DPT 风格的头 [57],它融合最终输出特征与 3 个中间特征,如下所示,来自统一主干网络 $G_\phi$ 并预测特定于任务的潜在表示 $\hat{l}_{ki} \in \mathbb{R}^{h \times w \times d}$。

– mid_block.attentions.0.transformer_blocks.0 – up_blocks.1.attentions.2.transformer_blocks.0 – up_blocks.2.attentions.2.transformer_blocks.0

这四个特征图首先通过 $3 \times 3$ 卷积投影到共同的融合维度 256,然后以由粗到细的方式逐步融合。最终的预测头投影到输出潜在维度 $d = 4$。

扩展自注意力模块。当记忆库中存在过去帧时,U-Net 中的所有自注意力块均执行扩展自注意力 [43]。在训练期间,记忆库永远不会出队,而在推理期间则相应地进行入队/出队。我们进一步添加了一个时序位置嵌入,以区分当前帧和过去帧。由于它们直接加到过去帧特征上,对于没有视频训练数据任务,初始化为零的时序位置嵌入在训练期间不会更新。在推理期间,在不学习的情况下,位置嵌入实际上被关闭,并恢复为原始的扩展自注意力 [43]。

第 23 页

来自不相关数据的统一视频密集预测 23

B 训练细节

B.1 专家训练

任务特定损失函数。每个专家 $(F_{k\theta}, P_k)$ 使用任务特定的损失 $L_k$ 进行端到端训练,该损失在真实值 $y_{ki}$ 和预测值 $\hat{y}_{ki} = P_k(D'(F_{k\theta}(E(x_i))))$ 之间计算,如下所示:

1. 深度:$L_{Depth}$ 包含 (1) 应用于图像和视频的尺度与平移不变 (SSI) 损失,权重为 1.0;(2) 时序梯度匹配 (TGM) 损失 [15],权重为 1.0;以及 (3) 对远平面之外无效像素施加远平面正则化,权重为 3.0。

$$ L_{Depth} = L_{Depth}^{SSI} + L_{Depth}^{TGM} + 3.0 L_{Depth}^{far} $$

2. 法线:$L_{Normal}$ 包含 (1) 应用于图像的角损失 [4],权重为 1.0;以及 (2) 对远平面之外无效像素施加的远平面正则化,权重为 3.0。

$$ L_{Normal} = L_{Normal}^{ang} + 3.0 L_{Normal}^{far} $$

3. 反照率:$L_{Albedo}$ 包含对 RGB 输出的均方误差 (MSE) 损失,权重为 1.0。

$$ L_{Albedo} = L_{Albedo}^{MSE} $$

4. 阴影:$L_{Shading}$ 包含对 RGB 输出的均方误差 (MSE) 损失,权重为 1.0。

$$ L_{Shading} = L_{Shading}^{MSE} $$

5. 边界:$L_{Boundary}$ 包含对正(边界)和负(非边界)像素的独立均方误差 (MSE) 损失。正像素 MSE 的权重为 1.0,负像素 MSE 的权重为 20.0,从而增强稀疏的边界信号。

$$ L_{Boundary} = L_{Boundary}^{pos-MSE} + 20.0 L_{Boundary}^{neg-MSE} $$

6. 语义分割:$L_{SemSeg}$ 包含 (1) 针对逐像素类别对数几率的交叉熵损失,权重为 1.0;以及 (2) 针对视频对数几率预测的 TGM 损失,权重为 3.0。

$$ L_{SemSeg} = L_{SemSeg}^{CE} + 3.0 L_{SemSeg}^{TGM} $$

7. 材质分割:$L_{MatSeg}$ 包含权重为 1.0 的交叉熵损失。

$$ L_{MatSeg} = L_{MatSeg}^{CE} $$

8. 人体部件分割:$L_{PartSeg}$ 包含 (1) 权重为 1.0 的交叉熵损失(忽略索引 15);以及 (2) 非空正则化项,权重为 1.0,以应对 DensePose [24] 中缺失的人体部件标注。

$$ L_{PartSeg} = L_{PartSeg}^{CE} + L_{PartSeg}^{reg} $$

第 24 页

24 Sun 等人

训练细节。所有模型均使用 AdamW [47] 进行训练,参数设置为 $\beta_1=0.9$、$\beta_2=0.999$、权重衰减 $10^{-2}$、$\epsilon=10^{-8}$,并采用最大范数 1.0 的梯度裁剪。学习率为 $3\times10^{-5}$,在前 1000 个步骤中进行线性预热,随后在整个训练期间进行线性衰减。除语义分割和材质分割外,所有专家模型均训练 30,000 次迭代,有效批量大小为 16,时间裁剪长度 $T=4$。由于输出类别数量较多以及采用交叉熵分类目标,语义分割和材质分割专家模型训练 80,000 次迭代。在八块 NVIDIA A100 GPU 上,专家训练每 10,000 次迭代大约需要 9.3 小时。

B.2 统一模型训练

统一骨干网络 $G_\phi$ 和潜在投影器 $\{\Psi_k\}$ 使用表 1 中所有标记数据的并集进行训练,图像和视频数据以相等权重采样。在实际操作中,我们将潜在时序梯度匹配的阈值 $\epsilon$ 设为 2.0,并将 TGM 权重 $\lambda$ 设为相对于每帧 $\ell_1$ 重建损失的 5.0。统一训练在 16 块 NVIDIA A100 GPU 上进行,有效批量大小为 32,时间裁剪长度 $T=4$,每 10,000 次迭代大约需要 15 小时。

B.3 分割微调

统一训练之后,我们对语义、材质和人体部位分割任务执行轻量级微调步骤,该步骤仅更新任务特定的投影器 $(\Psi_k, P_k)$,同时保持 $G_\phi$ 完全冻结。微调使用与专家训练相同的任务特定数据集、损失函数和优化器设置,仅 $(\Psi_k, P_k)$ 可训练。微调运行 30,000 次迭代,在八块 NVIDIA A100 GPU 上每 10,000 次迭代大约需要 6.2 小时。

C 评估细节

C.1 评估数据集和指标

对于分布外 (OOD) 评估,我们列出以下评估设置。

1. 深度。我们遵循 Marigold [34] 的评估协议,应用最小二乘缩放和平移对齐,并计算 AbsRel 和 $\delta_1$。 2. 表面法线。我们遵循 DSINE [4] 的评估协议,对预测进行 $\ell_2$ 归一化,并计算平均角度误差和 11.25° 准确率。 3. 反照率。我们遵循 IIW [6] 的评估协议,报告 15% 阈值下的加权人类不一致率 (WHDR)。WHDR 越低越好。 4. 阴影。我们遵循 SAW [39] 的评估协议,报告 70% 召回率时的精确率 (P@0.7) 和平均精确率 (AP)。 5. 边界。我们从 YT-VIS [78] 和 Mapillary [54] 的实例标注中派生实例边界图,并遵循 InvPT [82] 使用最优数据集尺度的 F 分数 (odsF) 进行评估。

第 25 页

从互不重叠数据统一进行视频密集预测 25

6. 语义分割。我们在 ADE20K [92] 上使用 MSeg [40] 中现有的 COCO 到 ADE20K 标签映射进行评估,报告 mIoU 和 fwIoU。 7. 材质分割。我们通过将材质均一的语义类别进行映射(例如,湖泊 → 水,窗帘 → 织物),为 ADE20K [92] 构建材质标签,并在映射后的类别内评估 mIoU 和 fwIoU。 8. 人体部件分割。我们将预测的 14 个人体部件标签重新映射到 Pascal-Human-Part [17] 的 6 个粗粒度类别(即头部、躯干、上臂、前臂、大腿、小腿),忽略背景和忽略标签,并报告 mIoU 和 fwIoU。

此外,语义和材质分割预测仅为了可视化目的使用条件随机场(CRF)进行后处理;所有定量评估均在原始模型输出上进行。

C.2 时序一致性

评估指标:mVC-t。我们将最初为视频语义分割提出的视频一致性(mVC-t)[51] 扩展,以同时测量法线、反照率、阴影和实例边界的时序一致性。在原始公式中,如果在一个 t 帧窗口内所有 t 帧对同一类别标签达成一致,则该像素是“稳定”的;mVC-t 随后测量在预测中也保持稳定的真值稳定像素的比例。我们将此定义适应于非语义任务,如下所示。对于实例边界,我们在应用标准 mVC-t 之前,首先在固定阈值下对预测进行二值化。对于连续值回归任务,我们使用任务特定的阈值定义连续帧之间的成对稳定性:

– 表面法线:如果连续帧之间的角度差 <11.25◦/2,则像素是稳定的。 – 反照率和阴影:如果连续帧之间跨通道的平均 ℓ1 差异 <0.1,且值归一化到 [0, 1],则像素是稳定的。

评估数据集。深度在 ScanNet [20] 视频评估指标(AbsRel, δ1)上进行评估。表面法线、反照率和阴影在 InteriorNet [42] 视频序列上进行评估,我们从其中随机采样 120 个视频,每个视频包含 100 帧。实例边界在 YT-VIS [78] 上进行评估。语义分割在 VIPSeg [50] 上进行评估。

C.3 跨任务一致性指标

深度 ↔ 法线。为了测量深度和法线之间的一致性,我们计算由深度预测导出的表面法线与直接预测的表面法线之间的误差。具体而言,我们使用相机内参计算高斯平滑(σ=3.0)深度表面相对于像素坐标的梯度。然后,我们在 ScanNet [20] 上计算由深度导出的法线与预测表面法线之间的平均角度误差和 11.25◦ 准确率。

第 26 页

26 Sun 等人

表 10:多任务性能。最佳结果已加粗。

深度法线 反照率 阴影边界 语义 材质 部件

方法 NYUv2 NYUv2 IIW SAW Map CS ADE Pascal AbsRel ↓mean ↓WHDR ↓AP% ↑ odsF ↑ mIoU ↑ mIoU ↑mIoU ↑

UniD-Image 0.060 16.0 0.210 92.5 61.6 58.9 67.1 66.0 UniD 0.059 16.2 0.207 92.6 57.2 58.4 66.0 65.4

表 11:在 InteriorNet [42] 和 YT-VIS [78] 上对表面法线和实例边界的域内评估

法线 边界 方法 InteriorNet YT-VIS mean ↓11.25◦↑ odsF ↑ Spec. NormalCrafterUniD (Fkθ ) [7] 14.912.1 76.463.8 78.5-

DICEPTION [90] 17.3 70.3 – DINOv3-H [65] 11.7 76.5 79.4 Unified UniD (Gϕ) 15.1 63.7 78.3

人体部件 ↔ 语义。为了保持人体部件与语义分割之间的一致性,我们测量预测的人体部件像素包含在预测的人体语义类别中的百分比。令 H={p : partseg(p)>0} 表示被预测为任何人体部件标签的像素集合,S={p : semseg(p)=cperson} 表示被预测为“person”类的像素集合。我们报告包含率 % inclusion = |H ∩ S|/|H|,该指标在具有人体部件标注的 COCO 验证图像上进行评估。

反照率 ↔ 阴影。为了测量内在一致性,我们直接测量从预测的反照率和阴影重建漫反射图像的性能。具体而言,我们计算乘积 ˆx = ˆa⊙ˆs(预测反照率 × 预测阴影,裁剪至 [0, 1])重建真实漫反射图像的效果,使用 Hypersim [59] 上的 PSNR 和 LPIPS 进行评估。

C.4 其他结果

不进行视频训练时的单任务性能。为了隔离 UniD 相对于统一图像基线在单任务精度优势上的来源,我们完全禁用了视频训练和推理,将所有视频视为独立图像(记为 UniD-Image)。如表 10 所示,UniD-Image 在所有八个任务上的单任务性能与完整的 UniD 相当,大多数任务上的差异在评估噪声范围内。这证实了相对于基线的提升源于统一架构和潜在蒸馏,而视频训练则驱动了时间一致性,正如主论文中所分析的那样。

第 27 页

来自不相关数据的统一视频密集预测 27

InteriorNet 和 YT-VIS 上的性能结果 为完整起见,请参阅表 11 中 InteriorNet [42] 和 YT-VIS [78] 上的性能结果,其中时序一致性已在主论文(表 6)中报告。此外,InteriorNet [42] 上的定性结果可在 https://unid-video.github.io 的可视化中找到,位于“In-Domain Data”(域内数据)部分。 在域内基准测试上表现相似的情况下,UniD 在分布外(OOD)条件下显著优于 DINOv3-H [65],如主论文中的表 6 所示。

发表评论