一个模型统一检测、分割和3D几何?SenseNova-Vision解读

三分钟导读:SenseNova-Vision 将计算机视觉任务统一为单一 Unified Multimodal Model (UMM) 的原生文本和图像生成,无需任务特定头,在结构化理解、密集几何预测、分割和多视图几何中均达到竞争性性能。

英文题目:Vision as Unified Multimodal Generation

论文出处:arXiv 每日论文精选 · arXiv:2607.06560

原始论文:PDF / 论文页面

对应视频标题:一个模型统一检测、分割和3D几何?SenseNova-Vision解读|推荐指数:★★★★★★

这篇论文解决什么问题?

传统计算机视觉系统针对特定任务家族(如检测、分割、几何)设计专用架构和损失函数,导致视觉监督难以跨任务共享、重用和组合,且缺乏统一的输出空间。

核心创新

  • 提出将计算机视觉统一为多模态生成的新范式,消除任务特定架构。
  • 构建 SenseNova-Vision Corpus,将异构标注转换为原生文本、图像及混合生成目标。
  • 实现单一模型覆盖检测、OCR、关键点、分割、深度、法线、点云及相机位姿估计。
  • 支持语言定义的任务变体,结合类别、颜色、区域等视觉线索。

方法概览

提出 SenseNova-Vision,基于预训练 UMM Bagel,将异构视觉标注转换为指令-响应示例(SenseNova-Vision Corpus)。结构化理解输出为文本,密集几何和分割输出为图像或混合文本-图像,通过联合训练实现无任务特定头的统一生成。

逐图理解论文

方法概述

方法概述
Figure 3 Overview of SenseNova-Vision: heterogeneous computer vision annotations are converted into native text, image, and mixed text-image generation targets for joint training in a single UMM, without task-specific heads.

SenseNova-Vision 基于预训练 UMM Bagel,将异构视觉标注转换为指令-响应示例(SenseNova-Vision Corpus)。结构化理解输出为文本,密集几何和分割输出为图像或混合文本-图像,通过联合训练实现无任务特定头的统一生成。

数据构建与语料库

数据构建与语料库
Figure 4 Representative SN-VC examples under the data protocol. Source annotations from structured visual understanding, dense geometric prediction, segmentation, and multi-view visual geometry are converted into instruction-conditioned text, image, or mixed text-image targets.

构建 SenseNova-Vision Corpus (SN-VC),包含文本、图像和混合目标的计算机视觉指令-响应数据集。源标注来自结构化视觉理解、密集几何预测、分割和多视图视觉几何,转换为指令条件的文本、图像或混合文本-图像目标。

结构化视觉理解结果

结构化视觉理解结果
Table 1 Quantitative comparison of structured visual understanding. Performance is assessed using F1@mIoU for box-based detection, referring, and OCR localization tasks, F1@Point for VisDrone point localization, click accuracy for GUI grounding, and F1@mOKS for keypoint localization. Higher values indicate better performance for all metrics.

在结构化视觉理解任务中,SenseNova-Vision 在 F1@mIoU 等指标上领先或接近最强基线。性能评估涵盖基于框的检测、指代、OCR 定位、VisDrone 点定位、GUI 接地和关键点定位任务。

密集几何预测结果

密集几何预测结果
Table 2 Quantitative comparison of dense geometric prediction. The upper block reports geometry-specialized models, while the lower block compares generation-based methods. Methods denoted with an asterisk (∗) have been re-evaluated to ensure a direct and consistent comparison with our method.

在密集几何预测(深度、法线)中,性能接近最强专用模型。与几何专用模型和生成式方法相比,SenseNova-Vision 在深度和法线估计任务上表现出竞争力,部分基线方法已重新评估以确保直接比较。

分割任务结果

分割任务结果
Table 3 Quantitative comparison of segmentation. For Gen. Seg., we report PQ for panoptic segmentation (Pan.) and mIoU for semantic segmentation (Sem.). For Ref. Seg., we report cIoU, defined as the ratio of total true positives to total union. For Rea. Seg., we report gIoU; for GCG Seg. and Inter. Seg., we report mIoU. Higher values indicate better performance for all metrics.

在分割任务中,PQ 和 mIoU 指标具有竞争力。对于全景分割和语义分割,报告 PQ 和 mIoU;对于指代分割、推理分割、GCG 分割和交互分割,分别报告 cIoU、gIoU 和 mIoU。

实验与关键结果

  • 在结构化视觉理解、密集几何预测、分割和多视图视觉几何四大任务家族上进行定量比较。
  • 与任务专用系统(如 Rex-Omni, Lotus-2, VGGT)及通用视觉模型(如 Vision Banana)进行对比。
  • 展示模型遵循语言指令生成不同输出格式(文本记录、密集图像、混合响应)的能力。
  • 分析训练过程中的收敛趋势及不同 Classifier-Free Guidance (CFG) 设置下的定性结果。
  • 在结构化视觉理解任务中,SenseNova-Vision 在 F1@mIoU 等指标上领先或接近最强基线,如图 1 所示。(第 1 页)
  • 在密集几何预测(深度、法线)中,性能接近最强专用模型,如图 1 和 Table 2 所示。(第 10 页)
  • 在分割任务中,PQ 和 mIoU 指标具有竞争力,如图 1 和 Table 3 所示。(第 10 页)
  • 在多视图几何(重建、相机位姿)中,接近领先专用系统,如图 1 和 Table 4 所示。(第 11 页)

阅读时需要注意

  • 在复杂场景(如视觉错觉、透明或反射表面)中,深度或法线预测可能跟随误导性外观线索或变得模糊。
  • 在密集实例分割中,若生成的文本描述实例颜色槽位不足,密集对象可能在掩码输出中合并。
  • 十六进制颜色分割中,生成的掩码可能在确切 RGB 值上偏离请求的颜色或分配错误颜色。
  • 模型可能输出检测风格记录而非实例颜色代码,或过度预测文本实例。
  • Vision Banana 的深度分数在绝对深度协议下报告,而 SenseNova-Vision 使用仿射不变深度评估,仅作为参考比较。
  • 部分基线方法(如 Vision Banana 的 ReasonSeg)使用了 Gemini 辅助,需注意比较的公平性。
  • 定性结果中,手动修复实例列表或颜色条目可改善掩码输出的准确性,表明结构化文本对掩码生成的关键作用。

关联工作

  • Pix2Seq, Unified-IO, Florence-2:序列格式统一,依赖共享序列格式和任务特定编码规则,对密集地图支持不自然。(第 3 页)
  • SAM, VGGT, Depth Anything:视觉基础模型泛化,在视觉连贯任务家族内泛化强,但缺乏统一输出空间和语言控制。(第 4 页)
  • Marigold, Lotus-2, Vision Banana:图像生成模型用于密集感知,统一主要限于图像侧,无法覆盖符号和混合输出。(第 4 页)
  • LISA, X-SAM, G2VLM:MLLM 基于感知,附加任务特定模块,输出空间碎片化。(第 4 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视觉作为统一多模态生成

韩晓阳∗,1, 李建华∗,1, 邓科旺∗,1, 陈祖凯∗,1, 施宣科∗,1, 王思涵∗,1 李博轩∗,1, 王林燕∗,1, 谢思怡1,4, 游欣1,5, 全金生1,6, 蔡中刚1 刁海文2, 刘知微B,2, 杨磊B,1, 林达华B,1,3, 王权∗,B,1 ∗核心贡献者, B 通讯作者 1商汤科技研究院, 2南洋理工大学, 3香港中文大学 4北京大学, 5上海交通大学, 6浙江大学

摘要

我们将计算机视觉表述为统一多模态生成,其中异构视觉任务通过统一多模态模型(Unified Multimodal Model, UMM)原生的文本和图像生成空间来表达,无需特定任务的架构。通过这种表述,单一模型 SenseNova-Vision 在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面,与领先的特定任务系统相匹配。自然语言指令和可选的视觉提示指定任务、目标区域或视图以及解码约定。响应随后作为文本生成用于符号记录,作为图像生成用于密集空间目标,或作为混合输出用于组合任务。为了实现大规模训练,我们将异构计算机视觉注释转换为与这些原生生成空间兼容的指令-响应示例。这种转换产生了 SenseNova-Vision 语料库(SenseNova-Vision Corpus, SN-VC),这是一个涵盖文本、图像和混合文本-图像目标的计算机视觉指令-响应语料库。从现成的预训练 UMM 开始,SenseNova-Vision 主要在 SenseNova-Vision 语料库上进行训练,使用辅助多模态数据作为能力保持的混合数据,并且不需要特定任务的预测头或架构更改。所得模型涵盖检测、OCR、关键点、分割、深度、表面法线、点图和相机姿态估计,并且可以遵循结合类别、颜色、区域和其他视觉线索的语言定义变体。这些结果表明,统一多模态生成是将计算机视觉集成到通用基础模型中的可扩展途径。SenseNova-Vision 模型和 SenseNova-Vision 语料库已公开可用。

代码库: https://github.com/OpenSenseNova/SenseNova-Vision 模型和数据集: https://huggingface.co/collections/sensenova/sensenova-vision

SenseNova-Vision Rex-Omni LocateAnything Lotus-2 MoGe-2 LISA X-SAM G2VLM VGGT 结构化感知 密集几何 分割 多视图 3D 100 93.2 92.6 95.0 87.9 88.4 84.3 80 78.7 69.2 66.8 66.0 66.9 65.4 67.0 62.0 61.9 59.2 56.6 58.3 58.7 57.2 (%) 60 53.5 52.9 54.7 50.1arXiv:2607.06560v1 40 分数 20

0 通用检测 密集检测 深度 法线 ReaSeg GCGSeg 重建 相机姿态 F1@mIoU F1@mIoU Mean δ1 室内 11.25 ∘ mIoU mIoU F1 分数 AUC@30 图 1 代表性计算机视觉任务家族的基准概览。尽管使用单一的统一多模态生成接口且没有特定任务的头,SenseNova-Vision 在异构输出格式(包括文本序列化记录、密集图像输出、混合文本-掩码响应和多视图几何预测)方面实现了具有竞争力的性能。

1

第 2 页

视觉提示 指代点 推理分割 全景分割

-6 灯 -3 墙壁 餐具盘 -0 柜子 -0 瓶子 -5 灯 -0 瓶子 -16

bottle -10 Lamp -1 bottle -11 bottle -6 object1 inputobject1object1object1

bottle -7 bottle-16 -13-15 bottle -1 bottlebottlebottle-17 -4bottle-12bottle

水果 绿色酒瓶 瓶子书籍 -6 -6水果 瓶子 -14 水槽 -0 烤箱 -0 台面 -0 台面 -1

椅子 -1 书籍 -3 书籍书籍书籍 -1-0-2 椅子 -0 纸张-0 桌子 -0 Q: 绿色酒瓶 Q: 记录用品 椅子椅子-2 -4 椅子地板-3 目标检测图片 图片 图片 图片 图片 关键点检测 OCR 表面法线 图片 图片 图片 图片 人

交互式分割 指代分割 GCG

分割 深度

照片 -1 绘画照片-0 -3

照片 -0 -0盆栽植物 -0混凝土墙 -2

书 -8 盆栽植物 -1 盆栽植物 -3 夹子盆栽植物-1 书 -4

书 -11 家具 -0

-8 笔记本电脑 -0 书 -10 女人 -0 书 照片-15 书 -5

书 -6 背包 -0 地板 -0 书 -14 椅子 -1 书 -13 椅子 -0 3D 重建 书 -1 地毯 -0 与相机 位姿估计 Q: 墙上的照片 书 -0 书 -3

书 -2

图 2 SenseNova-Vision 将多种计算机视觉任务整合到一个统一多模态模型(UMM)中,通过统一的多模态生成,输出结构化视觉理解、密集几何预测、分割以及多视图视觉几何的结果。

1 引言

大型语言模型 [12] 表明,通过提示和生成可以将多种语言任务整合起来,而统一多模态模型(UMMs)[18, 33, 35, 184, 191] 进一步将这一范式扩展到文本和图像生成。我们考虑是否可以在单个 UMM 中,无需任务特定的头部(task-specific heads),将经典计算机视觉的整个谱系——从检测到多视图 3D——表达为统一的多模态生成。计算机视觉通过针对各个任务家族定制的专业系统 [17, 59, 86, 160, 171, 197] 取得了显著进展。它们的输出范围从边界框和掩码到运动场、密集图和 3D 几何,每种输出通常都配有任务特定的架构、损失函数、解码规则和评估协议。这种任务特定的组织方式使得视觉监督难以在任务间共享、重用和组合,从而促使人们寻求一种共享且可扩展的计算机视觉表述方式。

先前的工作以互补的方式接近这一目标:序列格式的统一方法 [22, 118, 175] 将多种注释带入共享的模型接口,但不同的输出类型仍然需要序列化和解析约定;以表示为中心的模型 [86, 171, 182, 197] 在视觉上连贯的任务家族内进行泛化,但没有提供统一的输出空间,且语言控制有限。与此同时,生成式基础模型提供了不同的基础:扩散模型和图像生成模型 [64, 139] 为空间对齐的输出提供了视觉生成先验,而多模态大型语言模型(MLLMs)[4, 110] 将语言指令和推理引入视觉感知。最近的感知工作仅部分采用了这些优势:图像生成方法 [42, 56, 221] 处理密集图,但在处理符号记录方面存在困难,而基于 MLLM 的系统 [94, 170, 185] 增加了语言和推理,但仍然通过任务特定的解码器路由密集输出。在这些路径中,符号记录、密集空间目标和混合输出仍未在一个原生的多模态生成框架内得到表达。

为了解决这一差距,我们引入了 SenseNova-Vision,其基于一个简单的表述:异构的计算机视觉任务可以转化为统一的多模态生成。自然语言指令指定任务、目标、输出模式和解码约定,而文本生成则表达符号化的视觉答案,如类别、空间引用、OCR 字符串和相机参数。图像生成对于密集预测来说是自然的,因为掩码、深度图、表面法线和点图与输入图像在空间上对齐,并且可以在同一网格上表示。文本和图像生成共同提供了互补的响应空间,可以表达广泛的计算机视觉任务。对于视觉感知而言,这种表述类似于 GPT [12] 在 NLP 任务中所做的:将异构的专业监督整合到一个单一的生成接口中。

使这种表述能够大规模训练,需要将异构的计算机视觉注释转换为指令-响应示例。因此,我们构建了 SenseNova-Vision 语料库(SenseNova-Vision Corpus),涵盖结构化视觉理解、

第 3 页

使用 UMM 统一多样化的计算机视觉任务 训练设计 🅐 通用/结构化文本输出 🅑 交错文本与视觉输出 🅒 视觉输出的统一表示 ① 检测 ② 指点 ③ 指代 ⑦ 全景分割 ⑨ 深度 ⑩ 法线 ⑪ 指代分割 异构 数据 199, 255)</color></p>37)</color></p> 109)</color></p> 统一 视觉 + 37, 28,160)</color></p> 80, 254)</color></p> 通用 UMM 数据 62, 72)</color></p> 141, 98)</color></p> <p>sky<color>(255,<p>road<color>(235,<p>house<color>(202,<p>tree<color>(164,<p>pavement<color>(126,<p>grass<color>(87,<p>stop<p>truck-0<color>(11,sign-0<color>(50,255, 172, 61)</color></p>

指代风格 分辨率 ⑫ 分割 交互 分割(零样本) ⑬ 点图 高 255, 255)</color></p> 语义 编码器 980 站立 在 上 250, 166)</color></p> 潜在 编码器 1024 一个 海滩。 <p>kite<color>(178, 44, 4)</color></p> 飞翔 在 上 沙子上。 <p>sky<color>(126, 80, 254)</color></p> 可见 在 14, 55)</color></p>, 沙子, 和 一个 43)</color></p>. 多视图 ④ 关键点 ⑤ OCR ⑥ 相机位姿 ⑧GCG<p>person-1<color>(255,is<p>sand<color>(221,ofAisTheis<p>person-2<color>(79,the<p>rock<color>(40,And 的 分割 41,掩码 是 2 到 10 个视图 文本输出 视觉输出 点图与位姿

统一解码器 SenseNova-Vision 无联合任务特定监督头 用于结构化 2D、分割、密集几何和多视图 3D 的统一模型 混合任务联合训练, 标准交叉熵损失 & 整流流目标

图像嵌入 文本嵌入 视觉嵌入 交错 V+L 图像/多视图输入 指令输入 原生交错文本 & 视觉输出

‣ 视觉指令模板 “识别并输出每个对象的类别及其 ①边界框 / ②点 / ④关键点…” 在 整个 图像上…” “执行 全面的 文本 行级 ⑤OCR 保留 通用 “生成 分割 掩码 / 深度 ⑦交错 ⑨灰度 / ⑩表面法线…” 能力 “定位 <p>最右侧的猫</p> 并 生成 一个 掩码…” ⑪分割 ⑦ ⑨ ⑩ ⑧ ⑪ ⑫ ⑥ ⑬ “生成”估计 ⑬点a ⑫二值图分割/ ⑥相机位姿掩码对于每个对象视图在<point>[0.116,输入帧…”0.733]</point>…” 通用图像合成问答、VQA、 ‣ 用于问答、VQA、图像生成等的通用指令

图 3 SenseNova-Vision 概览:异构的计算机视觉标注被转换为原生文本、图像以及混合文本-图像生成目标,以便在单个统一多模态模型(UMM)中进行联合训练,无需任务特定的头部。

密集几何预测、分割以及多视图视觉几何,其可解码的文本、图像和混合目标可以恢复为边界框、掩码、深度图、表面法线、点图或相机姿态。SenseNova-Vision 基于现成的统一多模态模型 Bagel [33] 构建,在该语料库上进行训练,以通过图 3 所示的统一多模态生成接口来表达多样化的视觉任务输出。图 2 和图 1 分别展示了四个感知类别中具有代表性的定性输出和定量结果。在定量评估中,SenseNova-Vision 在结构化视觉理解方面处于领先地位,在密集几何预测和分割方面与最强的基线方法接近,并在多视图视觉几何方面接近领先的专用模型。这种灵活性还允许同一模型遵循在训练语料库中未明确枚举的语言定义的任务变体,结合类别、颜色、区域和其他视觉线索。

SenseNova-Vision 基于一个简单的假设:计算机视觉可以成为统一基础模型的原生生成能力,超越一系列孤立的特定任务系统。首先,我们提出了一种统一的多模态生成公式,将异构的视觉任务转化为统一多模态模型(UMM)的原生输入-输出空间。其次,我们构建了 SenseNova-Vision 语料库(SN-VC),这是一个大规模的计算机视觉指令-响应语料库,包含可解码的文本、图像和混合目标。第三,我们训练了 SenseNova-Vision,在四个感知类别中展示了强劲的结果,并支持训练集之外的语言定义的任务变体。综上所述,这项工作指向了计算机视觉的一个新时代,其中感知不再是逐个任务工程化的,而是成为统一基础模型的可编程、生成式和可扩展的能力,为未来的研究提供可重用的基础。

2 相关工作

2.1 早期统一视觉模型与接口

早期的统一视觉模型探索了如何通过共享的任务格式来表达多样化的视觉和视觉-语言任务。这一方向始于将结构化视觉预测表示为序列,例如用于目标检测的 Pix2Seq [21],随后扩展到 Pix2Seq v2 [22] 和 UniTAB [203] 中更广泛的任务家族以及文本-框生成。OFA [175] 和 Uni-Perceiver [96, 228] 进一步将这一思想扩展到跨模态和通用视觉-语言建模。Unified-IO [117] 和 Unified-IO 2 [118] 通过在共同的令牌空间中表示异构的输入和输出来拓宽这一方向,而 Florence-2 [189] 将基于提示的序列生成扩展到广泛的视觉任务。然而,它们的统一仍然严重依赖于共享的序列格式和特定任务的编码规则,使得接口不够

第 4 页

自然适用于密集地图和结构多样的视觉输出。

2.2 基于视觉基础模型的任务族泛化

另一类工作致力于利用视觉基础模型和预训练视觉表示来实现泛化。代表性的预训练方法如 MAE [60] 和 DINOv2 [123] 为识别、密集预测和几何迁移提供了可复用的视觉特征。SAM [86] 表明,可提示的分割可以涵盖广泛的掩码预测任务族,而 Painter [181] 和 SegGPT [182] 则利用视觉上下文示例来指定不同的图像到图像感知任务。在几何领域,Depth Anything [197] 利用强大的视觉表示和大规模数据扩展了深度预测,VGGT [171] 将前馈视觉建模扩展到相机、点云图、重建和点跟踪。这些工作在视觉连贯的任务族内表现出强大的泛化能力,但由于缺乏统一的输出空间,其统一性是不完整的。此外,它们对理解复杂、组合式或开放式语言指令的支持也有限。

2.3 用于密集感知的图像生成模型

扩散模型和图像生成模型通过生成空间对齐的视觉输出,为传统的密集预测提供了一种生成式替代方案。Marigold [84] 将扩散先验适配于单目深度估计,而 Lotus、Lotus-2 和 FE2E [55, 56, 173] 则将强大的图像生成或编辑模型适配于深度和法线估计等几何密集预测任务。DICEPTION [221] 将多种感知任务转化为共享 RGB 输出空间中的条件图像生成,Visual Bridge [44] 研究了生成式视觉感知表示。Vision Banana [42] 通过更强的图像生成基础模型和轻量级指令微调进一步扩展了这一方向,在保留生成能力的同时实现了更丰富的语言条件视觉预测。这些方法使密集目标与生成模型的 native 图像空间兼容,但其统一性主要局限于图像侧。由于符号记录、任务模式、相机参数和解码规则本质上是文本的,仅靠图像生成无法覆盖许多任务所需的符号和混合输出。

2.4 基于 MLLM 的感知与任务模块

作为整合语言和视觉的强大基础模型,MLLMs 为视觉感知带来了新的机遇。一条路线是将 MLLMs 扩展到结构化视觉定位:Kosmos-2 [124]、Shikra [20] 和 Ferret [206] 将语言生成与边界框、坐标和区域联系起来,而 Rex-Omni [75] 通过下一点预测拓宽了这一方向。另一条路线通过离散 token 或 logit 空间表示密集空间输出,如 Text4Seg [95] 和 DenseMLLM [101],但保留精细的空间细节需要精心设计的 tokenization 和解码方案。基于解码器的系统则将特定任务的模块附加到 MLLMs 上:LISA [94]、PixelLM [134] 和 X-SAM [170] 将语言推理连接到分割或掩码解码器,而 G2VLM [67] 和 VisionLLM v2 [185] 为几何和更广泛的感知任务引入了下游模块或连接。这保留了有用的归纳偏置,但输出空间在不同任务特定的组件之间仍然是碎片化的。

最近的 Unified Multimodal Model (UMM) [18, 33, 35, 184, 191] 将多模态基础模型从以理解为中心的 MLLMs 扩展到原生支持文本和图像生成的模型。它们通常在共享或耦合的生成空间中对语言和视觉内容进行建模,允许单个模型理解指令、生成文本并合成图像。这使得重新审视计算机视觉任务的统一性变得适时:异构的视觉监督可以表达为 UMM 相同 native 空间中的可解码目标。SenseNova-Vision 遵循这一路线,将符号记录、密集空间目标和混合响应与 UMM 的 native 文本和图像输入输出空间对齐,将它们转化为单个模型的可解码训练目标。

与此类工作互补的是,SenseNova-SI [16] 研究了精心策划的空间智能监督如何扩展包括 UMM 骨干在内的多模态基础模型的空间推理能力。我们的工作建立在相同的更广泛观点之上,即空间和几何能力可以在基础模型中培养,但关注一个不同的问题:如何将异构的计算机视觉注释转换为 native 文本、图像和混合生成目标,以用于基准可解码的感知输出。

第 5 页

3 数据

在统一计算机视觉任务上训练统一多模态模型(Unified Multimodal Model, UMM),需要将异构标注转换为模型原生的文本和图像生成空间。因此,我们将每个源标注转换为一个指令-响应示例,包含一个或多个视觉输入、一个语言指令以及一个可解码的目标响应。这种转换通过涵盖四个计算机视觉家族的数据协议来组织:结构化视觉理解、密集几何预测、分割和多视图视觉几何。第 3.1 节详细介绍了每个家族的协议。

遵循此协议,我们构建了 SenseNova-Vision 语料库(SenseNova-Vision Corpus, SN-VC),这是一个基于公共图像构建的大规模计算机视觉语料库,其源组成总结于图 5a。在可能的情况下,可用的公共标注被直接转换,并生成或策划额外的目标以处理不完整的监督,同时提高数据多样性。我们将生成和策划的子集作为 SN-VC-50M 发布,这是一个包含 5000 万个转换后的计算机视觉监督示例的集合,并提供源列表、提示模板、转换规则和示例,以复现 SN-VC 的其余公共源部分,如第 3.2 节所述。

3.1 数据协议

该协议定义了 UMM 训练的通用样本模式:一个或多个视觉输入、一个自然语言指令以及一个可解码的目标响应。指令指定任务意图、输出模式和解码约定,而响应表示为文本、图像或混合文本-图像输出,可恢复为与基准兼容的标签、坐标、掩码、密集图或相机参数。图 4 说明了该协议在四个家族中产生的代表性示例。我们对结构化和分割响应使用轻量级文本标记,对相机姿态记录使用保留的特殊令牌;附录表 8、14 和 17 总结了这些约定。

结构化视觉理解。该家族涵盖结构化视觉理解任务,其输出可解码为稀疏符号记录,包括检测、指代、指向、关键点定位、OCR、布局理解和 GUI 定位 [75]。我们将这些标注表示为文本生成目标:标签、转录本和特定任务的属性保持为普通文本,而空间字段写为归一化的图像坐标。轻量级标记如 <p>、<bbox> 和 <point> 限定短语和坐标字段。生成的响应被解析回类型化的基准记录,因此检测、定位、OCR、指向、关键点、布局和 GUI 任务共享相同的文本生成空间,同时通过语言指令和文本模式进行分离。

密集几何预测。该家族涵盖密集的、像素对齐的几何目标,包括深度图和表面法线。这些目标与输入图像共享空间布局,使得条件图像生成成为一种自然的表示。指令指定请求的几何量和解码约定,而响应图像以确定性视觉编码存储相应的密集信号。对于深度,有效的度量值被转换为逆深度并渲染为归一化的灰度图像;表面法线被渲染为 RGB 图,其通道编码法线分量。生成的图像随后可解码回与度量兼容的深度或法线图以进行评估。

分割。遵循 X-SAM [170] 的任务分类法,该家族涵盖单目标和多区域分割。分割结合语义区域选择与像素级空间预测,我们根据指令是请求一个目标还是多个区域来选择响应格式。对于单目标任务,如指代、推理和交互式分割,指令识别目标区域,响应是一个具有固定前景和背景颜色的二值掩码图像。交互式分割还提供视觉提示,如点、框、涂鸦或掩码,与输入图像一起。对于多区域任务,如通用分割(语义和全景分割),我们使用混合文本-图像响应:文本组件列出区域,并使用 <color> 标记在提示或生成的图例中指定 RGB 调色板值,而图像组件渲染相应的彩色编码掩码。接地对话生成(GCG)分割进一步练习此格式:给定一个开放式指令,模型首先生成区域描述和颜色分配,然后根据生成的图例渲染掩码。这种设计让语言处理类别名称、指代表达、推理衍生的区域和生成的区域描述,而图像通道保留密集的像素级监督。

多视图视觉几何。该家族遵循前馈视觉几何设置,如 VGGT [171],并使用有序图像集作为视觉输入。指令指定视图顺序、参考坐标系和

第 6 页

目标检测(框) 目标检测(点) OCR GUI 定位 Q: 识别以下对象:<p>Skateboard Q: 从这些类别中检测对象: Q: 对整个图像执行文本行级 OCR。 Q: 从以下类别中查找并分类对象: </p>, <p>Person</p>。结果为带有边界 <p>Hat</p>。结果为带有坐标点的文本。 结果为带有边界框坐标的文本。 <p>Arab Country Club 1995 mi Arab, AL</p>。结果 框坐标的文本。 为带有边界框坐标的文本。 输入 输出 输入 输出 输入 输出 输入 输出

<p>For a great <p>Skateboard</p> vacation</p> <p>hat</p><point>[0. <bbox>[0.143,0.861, <p>Arab Country Club <bbox>[0.292, 0.076, 375, 0.700]</point> 0.980,0.980]</bbox> 1995 mi Arab, 0.666,0.099]</bbox>, <point>[0.965,0.561] <p>Person</p> AL</p><bbox>[0.000, <p>Pacific </point><point>[0.05 <bbox>[0.033,0.028, 0.909, 0.999, Northwest</p> 2, 0.734]</point> 0.848,0.900]</bbox> 0.999]</bbox>. <bbox>[0.055, 0.101, … … 0.898,0.150]</bbox>, …

关键点检测 指代检测 视觉提示 布局定位

Given visual prompts for <p>object1</p><bbox>[0.527, 0.423, Detect all instances of <p>It kind of looks like a Q: Q: Predict the nose, left eye, right eye, left ear, right Q: Identify objects from the following categories: 0.611, 0.538]</bbox>, detect all corresponding instances in the Q: flower it's at the bottom of the edifice.</p> in the ear … for all instances of <p>person</p>. <p>Header</p>, <p>Title</p>, <p>Figure</p>. image. image. 输入 输出 输入 输出 输入 输出 输入 输出 <p>person</p><ins> <p>Header</p> nose<kpt>[0.347,0.63 <p>It kind of looks <p>object1</p> <bbox>[0.083,0.085, 1]</kpt> like a flower it's <bbox>[0.038, 0.496, 0.178,0.099]</bbox> left_eye<kpt>[0.336, at the bottom of 0.166, 0.774]</bbox> <p>Title</p> 0.652]</kpt> the edifice.</p> <bbox>[0.211, 0.476, <bbox>[0.519,0.542, right_eye<kpt>[0.318 <bbox>[0.312, 0.347, 0.770]</bbox> 0.667,0.553]</bbox> ,0.616]</kpt> 0.708, 0.726, <bbox>[0.284, 0.439, <p>Footer</p> left_ear<kpt>[0.357, 0.974]</bbox>. 0.344, 0.540]</bbox> <bbox>[0.032,0.975, 0.656]</kpt> … 0.214,0.989]</bbox> right_ear<kpt> … …</ins>

推理

分割任务示例 指代分割示例 交互式分割示例 问:<p>图片中哪个物体可以用来提供自然光线并照亮房间?</p> 请描述您进行分割的依据并输出掩码。 输入 输出 输入 输出 输入 I 输入 II 输出

掩码 掩码

通用分割示例 GCG 分割示例 问:请基于以下类别为此图像提供全景分割掩码:<p>碎石</p>, 问:能否请您简要描述一下这张图片?请回答并穿插对应部分的分割掩码。 <p>天空</p>, <p>树</p>, <p>窗户</p>, <p>河流</p>, <p>花卉</p>, <p>大海</p>, <p>雨伞</p>, <p>手提包</p>, <p>行人</p>, <p>水果</p>… 输入 输出 I 输出 II 输入 输出 I 输出 II

<p>天空<color>(255, 255, 255) <p>一辆红色肌肉车<color>(255, </color></p>, <p>树<color>(221, 255, 255)</color></p> 停放在 250, 166)</color></p>, <p> 河流 <p>一片草地<color>(202, <color>(178, 44, 4) </color> 28,109)</color></p> 上,旁边有 <p>其他 车辆<color>(126,80,254)</color></ </p>, <p>大海<color> (126, 80, p>,可能是在车展或 254)</color></p>, <p>雨伞- 集会上。<p> 远处可以看到 <p>树木 <color> 0<color>(79, 14, 55) </color> (50,141,98) </color></p>。 </p>, <p>行人-0 <color>(40, 41, 43)</color></p>

深度估计 表面法线估计 3D 重建 相机位姿估计 问:估计图像中每个像素的相对深度,较近的物体显得更亮, 问:推断图像中每个点的几何表面方向。 问:使用同一场景的几张 RGB 图像,估计每个像素的 3D 位置,并为每张图像输出 较远的物体显得更暗。 XYZ 点图。 输入 输出 输入 输出 输入 输出 输入 输出 <frame><quat><- 28><168><18><985></ quat><offset><- 943><-195><266> </offset><scale><88 ></scale></frame><f rame><quat><- 10><249><70><966></ quat><offset><- 421><-40><906> </offset><scale><26 6></scale></frame>

结构化 2D 分割 密集几何 多视图 3D

图 4 数据协议下的代表性 SN-VC 示例。来自结构化视觉理解、密集几何预测、分割和多视角视觉几何的源标注被转换为指令条件的文本、图像或混合文本-图像目标。

第 7 页

布局 1.44% 1.50% 深度 GUI OCR 7.63% 多视图 3D 46.7M 5.13% 法线 1.41% 关键点 点图 24.9M / 相机位姿 21.8M 生成分割 5.74% 密集 几何 10.29% 结构化 检测 14.47% 感知 结构化感知 32.3M 指代分割 5.38% 分割 26.46% 检测 24.7M / OCR 3.6M / GUI 3.1M / 布局 0.7M / 关键点 0.2M GCG分割 1.92% 15.21% 交互分割 1.63% 指令 3D 原始 遵循 密集几何 22.6M 推理分割 0.54% 多视图 19.31% 多模态 数据 5.70% 相机位姿 28.74% 法线 11.4M / 深度 11.2M 相机 11.89% 11.50% 生成 分割 3.1M 点图 7.42% 指代分割 1.1M / 生成分割 1.0M / 交互分割 0.6M / GCG分割 0.3M / 推理分割 0.1M 11.54% 理解

0 10 20 30 40 50 配置示例

(a) SN-VC 源组成。 (b) 训练混合组成。

图 5 SN-VC 源组成和训练混合。左侧:按转换后的类别和子类型配置的源示例数量;右侧:训练期间实现的样本类型比例。

请求的输出类型。密集场景几何以每视图密集 XYZ 点图形式的图像输出表示;每个点图在其 RGB 通道中存储对齐且归一化的 3D 坐标。相机位姿输出表示为结构化序列。每个目标视图相对于参考帧编码为四元数旋转、平移方向和比例,并使用保留标记如 <frame>、<quat>、<offset> 和 <scale> 来分隔视图条目和位姿字段的边界。这种混合响应格式将密集点图重建保留在图像空间中,而将离散几何元数据保留在文本空间中。

3.2 语料库构建

遵循上述协议,我们通过将公共计算机视觉数据集转换为指令-响应示例来构建 SN-VC。SN-VC 旨在作为完整可复现的语料库:图像来自公共来源,当现有注释已经匹配可解码的目标格式时,直接进行转换。当监督信息不完整、不可用或对于目标类别而言多样性不足时,我们自行生成或策划额外的目标。SN-VC-50M 表示包含这些生成和策划目标的已发布的 5000 万示例子集,而 SN-VC 的其余部分可以通过发布的源列表、提示模板、转换规则和示例进行复现。对于与我们评估基准重叠的数据集,我们保留官方基准划分,并从训练中排除相应的评估图像和注释。

语料库组织。我们根据提供的转换监督将 SN-VC 组织为四个源类别。图 5a 总结了源示例的配置数量和子类型。结构化视觉理解源涵盖以检测为中心的注释以及 GUI、OCR、布局和关键点监督。密集几何预测源提供深度和表面法线监督。分割源涵盖以掩码为中心的任务,包括指代、通用、交互、接地对话生成 (GCG) 和推理分割。多视图视觉几何源贡献重建目标和相机位姿注释。附录 A 列出了每个源类别的所有数据集和构建细节。当同一源图像出现在多个任务中时,我们将相应的转换示例保留为独立样本,因为每个任务都由其自己的指令和目标响应定义。

指令-响应转换。每个源注释通过任务模板转换为指令-响应训练样本。视觉输入根据任务上下文选择:标准图像任务使用单张图像,交互任务使用带有辅助视觉提示的图像,或多视图任务使用有序图像集。指令陈述任务目标和预期输出约定,我们为每个任务实例化多个指令变体以提高提示的鲁棒性。目标响应由源注释确定性地生成:面向文本的

第 8 页

任务使用规范化模式,面向图像的任务渲染掩码或几何图,混合任务则按固定顺序排列文本和图像组件。代表性的提示-响应示例如图 4 所示。

SN-VC-50M 目标筛选。某些公开来源包含不完整监督或标注,无法直接用作可解码的多模态目标,因此我们针对这些情况额外生成或筛选目标。对于结构化视觉理解,我们借鉴 Rex-Omni [75] 的数据构建流程来构建部分检测和 OCR 数据。对于密集几何预测,我们使用 MoGe-2 [177] 对不完整的监督进行密集化,并通过生成额外的深度和法线目标来扩展数据多样性,随后进行有效性和场景内容过滤。对于分割任务,我们筛选混合文本-图像目标,例如接地对话生成分割,其中区域描述和颜色图例必须与掩码图像对齐。对于多视角视觉几何,我们使用 LingBot-Depth [159] 补全稀疏深度,并过滤包含无效深度、缺失相机信息或不一致视角元数据的样本。这些生成和筛选的样本构成了 SN-VC-50M,而其余 SN-VC 样本可以使用发布的源列表、模板和转换脚本从公开数据集中重建。附录表 19 总结了发布的 SN-VC-50M 任务族和帧数。

4 训练

我们通过将 Bagel-7B-MoT [33] 适配到第 3.2 节构建的统一视觉任务语料库来训练 SenseNova-Vision。我们旨在赋予现有 UMM 与基准兼容的计算机视觉能力,同时减轻其开放域能力(包括图像理解、指令遵循和图像生成)的退化,而不是从头开始训练多模态模型。本节介绍混合任务微调策略、高分辨率和多视角训练设置以及训练超参数。

混合任务微调。我们在 SenseNova-Vision 语料库上,结合涵盖视觉问答 (VQA)、文生图和图生图任务的通用多模态数据,从 Bagel 检查点执行监督微调。在统一的理解和生成框架中,这种数据混合使我们的模型能够学习结构化视觉理解、密集几何预测、分割和多视角视觉几何的可基准读取输出的表示,同时减轻基础 UMM 广泛能力的退化。

我们采用联合采样策略,从转换后的计算机视觉样本和辅助多模态样本的加权混合中抽取小批量;实际实现的训练混合如图 5b 所示。每个小批量可能包含来自多个任务类别的样本,因此产生文本和视觉监督目标的混合。在训练过程中,尽管文本和视觉目标具有不同的优化目标,但它们在相同的优化过程中交错进行。文本形式输出,包括检测框、OCR 字符串、关键点和相机参数,被分词并在下一个词元预测范式下使用标准交叉熵 (CE) 损失进行优化。视觉输出,包括掩码、深度图、法线图和点图,被编码到 VAE 潜在空间,并使用从 Bagel 继承的整流流训练目标进行优化。通过这种方式,异构的计算机视觉目标通过基础模型的原生文本和图像解码器进行学习,而无需引入特定任务的预测头。

混合任务联合训练策略使模型能够学习交错任务格式和输出模态之间的共享参数,从而可能提高其对零样本任务变体的泛化能力。第 5.6.3 节给出了进一步分析。

高分辨率和多视角训练。与 VAE 路径相比,SigLIP2 [163] 为输入图像提供更强的语义条件,这有利于语言引导和区域级感知。对于需要精细空间条件的图像输入任务,尤其是分割任务,我们将 SigLIP2 的输入分辨率保持在 980 像素,用于理解和图像条件生成。这保留了高分辨率条件,只要生成依赖于输入图像,而 Bagel 在生成侧使用较低的 SigLIP2 条件限制。

对于多视角视觉几何,每个数据样本对应一个多视角场景。由于内存限制,每个训练样本是通过从相应场景中随机选择最多 10 个视角形成的。对于点图重建,所选视角与第一个视角对齐,进行中心归一化,并将无效像素映射到远处的天空盒。对于相机位姿估计,我们保留基础模型的最后 2,009 个词汇表条目,并将它们重新用作一组专用的特殊词元。在这些词元中,2,001 个编码量化位姿参数,包括基于四元数的旋转、单位平移向量和缩放,其余 8 个作为结构占位符,详见附录表 17。这些特殊词元专用于相机位姿估计,而其他结构化输出仍使用普通文本词元进行序列化。

第 9 页

目标检测 OCR GUI 关键点 方法 COCO-Com. HR/RefCOCOg V/T LVIS Dense200 VisDrone HierText ICDAR15 ScreenSpot-V2 COCO-Kpt.

bbox bbox bbox bbox bbox point bbox bbox bbox point

Grounding DINO-Swin-T [111] 56.6 25.2 / 45.9 / 46.8 38.8 33.1 38.5 – – – – – Bagel [33] 50.2 74.6 / 76.4 / 77.8 46.8 42.4 23.0 36.9 7.1 15.8 81.1 – Qwen3-VL-8B-Instruct [10] 46.6 70.4 / 72.3 / 72.6 43.2 13.5 28.7 35.7 22.4 25.4 90.5 – Qwen3.5-9B [128] 49.3 71.7 / 72.1 / 72.6 43.2 27.5 26.8 41.7 19.6 11.4 92.2 – LocateAnything [178] 54.7 78.7 / 76.7 / 77.6 50.7 58.7 39.9 60.4 29.1 26.4 85.5 – Rex-Omni [75] 52.9 79.9 / 73.6 / 74.3 46.9 58.3 35.8 58.9 28.0 28.1 88.4 32.6 SenseNova-Vision 56.6 80.2 / 79.6 / 80.5 54.8 66.8 43.3 62.9 31.2 49.5 85.9 34.6

表 1 结构化视觉理解的定量比较。基于框的检测、指代和 OCR 定位任务使用 F1@mIoU 进行评估,VisDrone 点定位使用 F1@Point,GUI 定位使用点击准确率,关键点定位使用 F1@mOKS。所有指标值越高表示性能越好。

训练设置。我们对 VAE 视觉编码器进行冻结,同时允许更新所有其他模块和连接器。我们使用 AdamW 优化器,学习率为 2.5 × 10−5,且无权重衰减。我们遵循 Bagel 中使用的 mini-batch 打包方法,每个 rank 包含 32K–36K 个 token,每个样本的最大上下文窗口为 32K。文本、ViT 和 VAE 输入 token 的 dropout 率分别设置为 0.05、0.1 和 0.1。模型训练 50K 步,包括 500 步预热,EMA 比率为 0.995;评估时使用 EMA 检查点。其他所有配置均与 Bagel 的 SFT 阶段相同。

5 实验

我们评估 SenseNova-Vision 是否能够通过统一多模态生成覆盖广泛的计算机视觉任务。评估分为四个任务族:结构化视觉理解、密集几何预测、分割和多视角视觉几何。我们进一步将 SenseNova-Vision 与最近的通用视觉模型进行比较,并评估多模态理解和图像生成,以评估在计算机视觉任务上的训练是否保留了基础模型的通用能力。最后,我们提供了对收敛行为、定性结果以及超出标准基准设置的语言定义任务变体的额外分析。

所有任务均使用自然语言指令进行表述。文本输出被解析为特定于基准的结构化格式,如框、点、识别文本、关键点和相机参数。图像输出通过确定性转换规则解码为掩码、深度图、法线图或 3D 点图。此协议允许在生成后通过特定于任务的基准指标对异构计算机视觉任务进行评估。

5.1 结构化视觉理解

结构化视觉理解评估那些输出可以表示为结构化文本预测的任务,例如边界框、点、识别文本和关键点坐标。如表 1 所示,评估涵盖了在 COCO-Common [106]、HumanRef [214]、RefCOCOg val/test [82, 211]、LVIS [52]、Dense200 [75] 和 VisDrone [37] 上的基于框和点的定位与定位,在 HierText [115, 116] 和 ICDAR15 [81] 上的 OCR 定位,在 ScreenSpot-V2 [187] 上的 GUI 定位,以及在 COCO-Kpt. [106] 上的关键点检测。

这些任务测试模型是否能够通过统一的文本生成接口产生与基准兼容的坐标级预测。由于密集场景需要长对象列表、稳定的顺序和精确的坐标,这些任务对于序列化生成具有挑战性。SenseNova-Vision 取得了强大的整体性能,特别是在密集、长尾、小目标、指代和 OCR 定位基准上。

5.2 密集几何预测

密集几何预测评估像素对齐的几何输出,包括单目深度估计和表面法线估计。深度图从生成的深度图像中解码,并使用仿射不变深度指标进行评估,而表面法线图从彩色图像中恢复,并通过角度误差进行评估。如表 2 所示,我们报告了 NYUv2 [152]、KITTI [47]、ETH3D [141]、ScanNet [30] 和 DIODE [169] 上的深度结果,以及 ScanNet、iBims-1 [89] 和 NYUv2 上的法线估计结果。

9

第 10 页

深度 法线 方法 abs rel. ↓/ δ1 ↑ mean err. ↓/ δ11.25 ↑

NYUv2 KITTI ETH3D ScanNet DIODE ScanNet iBims-1 NYUv2

DSINE [9] – – – – – 16.2 / 61.0 17.1 / 67.4 16.4 / 59.6 DepthAnything [197] 4.3 / 98.1 7.6 / 94.7 12.7 / 88.2 4.3 / 98.1 26.0 / 75.9 – – – DepthAnything V2 [198] 4.5 / 97.9 7.4 / 94.6 13.1 / 86.5 4.2 / 97.8 26.5 / 73.4 – – – ∗MoGe-2 [177] 3.5 / 98.0 5.5 / 97.7 3.4 / 98.8 3.4 / 98.3 23.0 / 82.3 12.8 / 68.4 14.7 / 70.4 14.7 / 62.3

Marigold [84] 5.5 / 96.4 9.9 / 91.6 6.5 / 95.9 6.4 / 95.2 30.8 / 77.3 21.3 / 45.6 18.5 / 64.7 20.9 / 50.5 DICEPTION [221] 6.1 / 96.0 6.9 / 94.9 5.0 / 97.5 7.2 / 94.4 28.9 / 72.2 18.8 / 53.6 – 18.3 / 52.9 FE2E [173] 4.1 / 97.7 6.6 / 96.0 3.8 / 98.7 4.4 / 97.5 22.8 / 81.2 13.8 / 67.2 15.1 / 70.6 16.2 / 59.6 Lotus-2 [55] 4.1 / 97.6 6.7 / 94.5 4.6 / 98.1 4.2 / 97.6 22.1 / 75.2 14.2 / 66.8 15.4 / 70.4 16.9 / 59.0 SenseNova-Vision 4.0 / 98.1 5.9 / 95.9 4.3 / 97.4 3.9 / 98.0 20.6 / 76.4 12.8 / 68.9 15.4 / 69.1 14.4 / 62.7

表 2 密集几何预测的定量比较。上半部分报告了专门针对几何任务的模型,下半部分比较了基于生成的方法。带有星号(∗)标记的方法已重新评估,以确保与我们的方法进行直接且一致的比较。

生成分割 指代分割 推理分割 GCG分割 交互分割 方法 全景/语义 RefCOCO / + / g 验证/测试 验证/测试 点/框

LISA-7B [94] – 74.9 / 65.1 / 67.9 52.9 / 47.3 62.0 / 61.7 – PSALM [219] 55.9 / 66.6 83.6 / 72.9 / 73.8 – – 64.3 / 67.3 Text4Seg [95] – 79.2 / 72.8 / 74.0 59.1 / 57.1 – – LENS [226] – 84.2 / 79.4 / 81.2 62.1 / 57.2 – – ConverSeg [140] – 79.4 / 74.3 / 74.9 61.9 / 57.0 – – X-SAM [170] 54.7 / 66.5 85.1 / 78.0 / 83.8 56.6 / 57.8 69.4 / 69.0 65.4 / 70.0 SenseNova-Vision 48.8 / 64.0 81.3 / 76.0 / 80.3 63.2 / 60.7 65.7 / 66.2 60.9 / 73.9

表 3 分割的定量比较。对于生成分割(Gen. Seg.),我们报告全景分割(Pan.)的 PQ 和语义分割(Sem.)的 mIoU。对于指代分割(Ref. Seg.),我们报告 cIoU,定义为总真阳性与总并集之比。对于推理分割(Rea. Seg.),我们报告 gIoU;对于 GCG 分割和交互分割(Inter. Seg.),我们报告 mIoU。所有指标值越高表示性能越好。

这些任务测试是否可以在没有特定任务的深度或法线预测头的情况下,将密集几何图作为图像输出产生。SenseNova-Vision 在深度和法线估计方面均取得了强劲的性能,在多个基准测试中优于最近的基于生成的基线方法,并与专门针对几何任务的模型保持竞争力。

5.3 分割

分割评估在语义、指代、推理、接地和交互引导下的掩码预测。生成的分割图像使用每个指令定义的颜色调色板、视觉提示或目标规范解码为基准掩码。如表 3 所示,我们使用相应的基准指标报告了通用、指代、推理、接地对话生成(GCG)[132] 和交互分割的结果。

这些任务测试两种能力:选择预期的语言条件目标以及生成与基准兼容的掩码。SenseNova-Vision 在统一分割和多模态基线中取得了具有竞争力的整体性能,在推理和 GCG 分割方面表现强劲。专门的分割模型在几个通用和指代分割指标上仍然更强,其中专门针对分割的预训练掩码模型(如 SAM [86] 或 Mask2Former [26])可以提供强大的掩码先验。

5.4 多视图视觉几何

多视图视觉几何评估从多个输入图像进行的几何预测。我们关注多视图点图重建和相机位姿估计,两项任务的结果均在表 4 中报告。对于 7Scenes [149] 和 ETH3D [141] 上的重建,我们遵循 VGGT [171] 报告精度和完整性,以及 F1 分数

10

第 11 页

多视图重建 相机位姿 方法 精度↓/ 计算↓/ F1↑ RRA@30↑/ RTA@30↑/ AUC@30↑

7Scenes ETH3D Re10K CO3Dv2

DUSt3R [179] 0.026 / 0.034 / 87.1 0.359 / 0.531 / 66.6 99.8 / 84.9 / 67.6 97.7 / 93.4 / 78.3 DepthAnything3 [104] 0.020 / 0.026 / 90.5 0.228 / 0.212 / 76.6 100.0 / 96.4 / 89.6 99.3 / 98.0 / 91.8 VGGT [171] 0.023 / 0.032 / 88.4 0.177 / 0.155 / 80.9 100.0 / 93.5 / 79.3 98.3 / 96.6 / 89.2 MoRe [38] 0.038 / 0.039 / 77.1 0.348 / 0.318 / 62.7 100.0 / 94.0 / 79.1 98.4 / 96.3 / 83.0

MapAnything [85] 0.027 / 0.029 / 87.8 0.400 / 0.524 / 67.0 100.0 / 93.5 / 80.7 95.5 / 91.6 / 70.9 G2VLM [67] 0.084 / 0.056 / 59.2 0.784 / 0.553 / 36.7 99.8 / 77.5 / 51.8 96.3 / 92.0 / 55.2 SenseNova-Vision 0.028 / 0.026 / 87.9 0.301 / 0.175 / 72.2 99.8 / 94.2 / 77.3 97.4 / 95.4 / 80.1

表 4 多视图点云图重建和相机位姿估计的定量比较。我们评估了前馈几何模型(上半部分)与通用几何方法(下半部分)。MapAnything 被归类为后者,因为它接受带有可选几何输入的图片,并通过多视图 Transformer 融合编码特征。

使用 Depth Anything 3 [104] 中的阈值;对于 RealEstate10K (Re10K) [223] 和 CO3Dv2 [133] 上的相机位姿估计,我们报告 30 度阈值下的相对旋转精度 (RRA)、相对平移精度 (RTA) 和 AUC。所有方法均经过重新评估,以确保与 SenseNova-Vision 进行公平且直接的比较。

这些任务测试模型是否能够在多个视图之间对齐信息,并为重建和相机位姿估计生成视图特定的几何输出。SenseNova-Vision 在通用几何方法中取得了强劲的结果,特别是在 ETH3D 重建和相机位姿估计方面。与 VGGT 和 Depth Anything 3 等前馈几何模型相比,在某些指标上仍存在性能差距,这凸显了专注于几何的训练和几何归纳偏置的持续益处。

5.5 与通用视觉模型的比较

前几节主要将 SenseNova-Vision 与每个视觉任务家族中强大的任务专用系统进行对比。我们进一步将其与近期涵盖多种视觉能力的通用视觉模型进行比较,如表 5 所示。该比较评估了单一模型在统一多模态生成下,超越在单个基准测试中表现优异,能够广泛覆盖异构视觉任务的能力。

我们选择 Youtu-VL [207] 和 Vision Banana [42] 作为代表性的近期通用视觉模型,因为它们从互补的方向扩展了视觉任务覆盖范围。Youtu-VL 代表了视觉-语言理解路线,因此我们在与结构和语义感知对齐的基准上进行比较,包括检测、指代分割、语义分割和深度。Vision Banana 代表了以图像生成为中心的路线,因此我们在与图像空间预测对齐的基准上进行比较,包括分割、深度和表面法线。

比较结果显示,近期的通用视觉模型已经超越了单一任务专用化,但其覆盖范围仍受其原生输出模态的影响。SenseNova-Vision 在结构、语义和深度基准上对 Youtu-VL 表现出强劲的性能,并在图像空间分割和密集预测基准上与 Vision Banana 保持竞争力。这种更广泛的覆盖范围源于对文本、图像和混合输出的统一多模态生成,这更好地匹配了计算机视觉任务所需的异构输出形式。

除了与其他通用视觉模型的比较外,我们还进一步评估了 SenseNova-Vision 在混合任务微调后是否保留了预训练 UMM 的通用多模态能力。对于多模态理解,SenseNova-Vision 在 MMVP [161] 上获得 79.0 分,而 Bagel [33] 为 83.3 分。对于文生图生成,SenseNova-Vision 在 GenEval [48] 上获得 0.85 分,而 Bagel 为 0.82 分。总体而言,SenseNova-Vision 在扩展至广泛视觉任务的同时,保留了核心多模态能力。

5.6 定性结果与额外分析

除了标准基准指标外,我们进一步分析了 SenseNova-Vision 的训练动态和定性行为,包括收敛趋势、聚焦的指代风格交互式分割变体,以及更广泛的自由形式语言到掩码探测。

11

第 12 页

(a) 与 Youtu-VL 的对比

| Method | Detection mAP ↑ | Sem. Seg. mIoU ↑ | Ref. Seg. cIoU ↑ | Depth δ1 ↑ | | :— | :— | :— | :— | :— | | | COCO | Cityscapes | RefCOCO / + / g | NYUv2 | | Youtu-VL | 47.1 | 70.4 | 80.7 / 76.2 / 76.5 | 90.4 | | SenseNova-Vision | 53.7 | 71.2 | 81.3 / 76.0 / 80.3 | 98.1 |

(b) 与 Vision Banana 的对比

| Method | Sem. Seg. mIoU ↑ | Ref. Seg. cIoU ↑ | Rea. Seg. gIoU ↑ | Depth δ1 ↑ | Normal mean err. ↓ | | :— | :— | :— | :— | :— | :— | | | Cityscapes | RefCOCOg | ReasonSeg | KITTI | NYUv2 | DIODE | ETH3D | NYUv2 | ScanNet | DIODE | | Vision Banana | 69.9 | 73.8 | 79.3† | 91.5‡ | 94.8‡ | 91.7‡ | 93.5‡ | 17.8 | 15.1 | 13.8 | | SenseNova-Vision | 71.2 | 80.3 | 63.2 | 95.9 | 98.1 | 76.4 | 97.4 | 14.4 | 12.8 | 15.3 |

表 5 与近期通用视觉模型在原始论文报告的指标下的定量对比。对于 Vision Banana,† 表示由 Gemini 辅助生成的 ReasonSeg 结果,‡ 标记了在绝对深度协议下报告的深度分数,而 SenseNova-Vision 使用的是仿射不变深度评估;这些条目仅作为参考对比。

5.6.1 收敛性分析

图 6 可视化了训练过程中归一化的指标曲线,以比较不同计算机视觉任务的学习进度和收敛速度。深度和表面法线估计收敛最快,可能是因为其目标与输入图像在空间上对齐,且可能接近预训练期间已见过的图像生成或编辑模式。多视图重建在空间上与深度预测相似,但需要在多个视图之间进行对齐,导致收敛速度较为适中。相机位姿估计收敛较慢,因为它需要跨视图对齐、新引入的位姿 token 以及对几何结构的更深层次的跨模态理解。常见的检测和通用分割表现出中间的收敛速度,因为两者都依赖于语义识别和空间对齐;检测进展稍快,可能是因为目标定位已经部分涵盖了预训练模型的视觉-语言经验。指代分割比通用分割收敛更慢,因为它对语言条件化的语义 grounding 提出了更高的要求。密集检测是最慢的任务,这表明在必须序列化许多区域时,拥挤的小目标定位需要精确的跨模态判别和详细的图像理解。总体而言,这些趋势表明视觉能力并非均匀收敛,而是遵循阶段性学习模式,对需要细粒度视觉证据、语言意图和空间结构之间更深层次对齐的任务收敛较晚。

5.6.2 整体定性结果

图 7 展示了 SenseNova-Vision 支持的视觉任务家族中的定性示例。在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面,模型遵循请求的任务提示,并生成可解析或解码为相应任务表示的输出。

这些示例展示了在拥挤、小目标和类文档场景中的完整结构化预测。对于密集

第 13 页

目标检测(通用) 目标检测(点) 目标检测(密集) 目标检测(微小)

指代检测 视觉提示 OCR(文本行) OCR(单词)

关键点检测(人体) 关键点检测(动物) GUI 定位 布局定位

深度 表面法线

全景分割 语义分割 指代分割 推理分割

GCG 分割 交互式分割(点) 交互式分割(涂鸦) 交互式分割(边界框)

3D 重建 相机位姿估计

结构化 2D 密集几何 分割 多视图 3D

图 7 SenseNova-Vision 在代表性计算机视觉任务上的定性结果。所有示例均通过相同的语言条件多模态生成接口生成。

13

第 14 页

提示样本 指代式交互式分割结果

Q: 请根据指定的归一化点坐标,为这张图像提供二值 分割掩码:<p><point>[0.488, 0.294]</point></p>? 坐标遵循 [x, y] 顺序。 请回复分割掩码。

点: [0.794, 0.601] 点: [0.380, 0.600] 点: [0.116, 0.733] 点: [0.614, 0.722]

图 8 使用文本编码点提示的指代式交互式分割的定性示例。SenseNova-Vision 解析嵌入在指代跨度中的归一化坐标,并为指示的目标生成二值掩码。

以及空间输出,生成的深度图和法线图保留了主要的场景结构,预测的掩码与请求的目标在语义上对齐,且多视图输出显示出合理的跨视图几何一致性。这些示例表明,SenseNova-Vision 能够在统一生成框架内的异构视觉任务中保持特定任务的输出结构。

5.6.3 指代式交互式分割

交互式分割通常以视觉提示为条件,如渲染的点、框、涂鸦或掩码。然而,对于文本和图像生成接口而言,稀疏的点提示可以更紧凑地表示为文本:归一化坐标直接指定位置,而图像提示则通过包含大量冗余信息的完整视觉条件来编码相同的点。因此,我们考察一种指代式交互式分割任务,其中模型接收文本编码的点坐标并生成相应的二值掩码。该任务结合了三个训练领域:图像条件的交互式分割提供了掩码生成目标,指代分割提供了用于指定目标的文本跨度接口,而检测、定位和指点等结构化视觉理解任务则提供了坐标级定位知识。

具体而言,标准指代分割使用 <p>指代表达式</p> 通过语言指定目标区域。我们保留这种指代式跨度,但将语义表达替换为归一化坐标提示,写作 <p><point>[0.xxx, 0.xxx]</point></p>。这种基于精确坐标的分割提示并未包含在分割训练协议中,但其组成部分来自不同领域: <p> 跨度遵循指代分割,归一化坐标遵循结构化定位标注。与已经与输入图像空间对齐的图像提示不同,文本编码的点需要模型在生成掩码之前将数值坐标转换为图像空间位置。图 8 展示了这种组合提示格式的定性示例。在显示的案例中,SenseNova-Vision 准确地遵循文本指定的点,在附近或同类目标中选择预期的目标,并为小区域生成二值掩码。

这些结果表明,从结构化预测中学到的坐标理解可以通过统一的文本和图像接口插值到掩码生成中。这种行为是语言定义的任务变体的具体示例,超出了显式训练协议,指向了统一多模态模型重新组合来自不同计算机视觉领域监督信号的潜力。

5.6.4 自由形式语言到掩码生成

除了上述聚焦的坐标到掩码变体外,我们使用分割作为更广泛的自由形式多模态生成的试验台。密集几何预测任务和多视图视觉几何任务主要受确定性几何目标的约束,而结构化视觉理解产生的文本输出可能已经受益于

14

第 15 页

问:生成该图像的实例分割可视化结果。每条 <p>鱼</p> 使用不同的颜色。首先,列出请求中提到的每个可见 <p>鱼</p> 实例,并为每条 <p>鱼</p> 分配不同的纯色。按照 EXACT 格式重新格式化它们:<p>鱼-no<color>(R,G,B)</color></p>。然后,使用这些实例标签和颜色输出交错的实例分割掩码。 标题输出:<p>鱼<color>(255, 255, 255)</color></p>, <p>鱼<color>(255, 150, 4)</color></p>, <p>鱼<color>(255, 13, 156)</color></p>, <p>鱼<color>(255, 7, 200)</color></p>,… 原始标注 X-SAM SenseNova-Vision (标注了134个实例) (分割了1个实例) (分割了84个实例)

(a) 来自 Dense200 的紧凑对象拥挤场景。

问:生成该图像的实例分割可视化结果。每辆 <p>汽车</p> 使用不同的颜色。首先,列出请求中提到的每个可见 <p>汽车</p> 实例,并为每辆 <p>汽车</p> 分配不同的纯色。按照 EXACT 格式重新格式化它们:<p>汽车-no<color>(R,G,B)</color></p>。然后,使用这些实例标签和颜色输出交错的实例分割掩码。 标题输出:<p>汽车-0<color>(255, 255, 255)</color></p>, <p>汽车-1<color>(255, 13, 156)</color></p>, <p>汽车-2<color>(254, 255, 111)</color></p>, <p>汽车-3<color>(254, 91, 109)</color></p>,… 原始标注 X-SAM SenseNova-Vision (标注了46个实例) (分割了33个实例) (分割了65个实例)

(b) 来自 VisDrone 的包含微小对象的航拍场景。

图 9 使用适配的检测任务指令进行密集实例分割。提示要求模型枚举目标类别的可见实例,并用不同的颜色渲染不同的实例。(a) 尽管拥挤场景中存在严重的重叠和遮挡,SenseNova-Vision 仍能分离出大量独立实例,并为相邻的同类别对象分配不同的区域。(b) 在杂乱的夜间航拍场景中,模型恢复了大量微小对象,同时区分了汽车和卡车等类别。为各个目标分配了不同的颜色,从而能够从生成的掩码图像中进行实例级解码。为了进行比较,X-SAM 的可视化结果是通过回填预测掩码以获得更易于视觉检查的效果。

得益于预训练统一多模态模型(UMM)的语言灵活性。分割任务介于这些情况之间:它需要密集的时空输出,但目标类型、区域分组、实例组织以及掩码表示协议都可以通过语言灵活指定。然而,在训练过程中,分割监督仍然遵循预定义的任务域和固定的标注协议,就像传统的分割数据集一样。

这种设置不同于传统的开放词汇分割,后者主要扩展了分割目标类别的词汇表。在这里,探针改变了数据分布、任务定义、掩码表示协议和目标类型。我们通过将来自检测、指代、分割和 OCR 的任务指令适配为非标准的掩码生成提示来构建这些探针。这些探针测试掩码生成是否能够突破固定的分割协议,并重组从其他任务域中学到的能力。

第一个探针专注于使用适配为请求实例级掩码输出的检测任务指令进行密集实例分割。密集和小目标场景在检测数据中很常见,但使用实例级掩码进行标注的成本仍然很高。在 Dense200 [75] 和 VisDrone [37] 上,SenseNova-Vision 能够从密集和航拍场景中提取多达近一百个紧凑或微小对象,并为每个实例分配不同的颜色,从而能够单独解码各个目标,如图 9 所示。这些例子表明,统一训练可以将掩码生成的数据分布扩展到包括密集和小目标情况,而这些情况在检测数据中得到了更好的覆盖。

另一个探针遵循视觉提示指代的设置,但使用文本指定的参考线索进行视觉指代分割(Visual Grounded, VGD)[170]。以文本坐标形式书写的参考点或框指示一个实例,模型必须推断相应的视觉匹配并分割图像中其他同类目标。如图 10 所示,SenseNova-Vision 使用文本指定的点或框来识别参考实例,并为相应的同类目标生成掩码。这通过将附近的指代监督适配为新任务,扩展了任务定义。

15

第 16 页

问:识别所有与视觉提供的 <p>object1</p><point>[0.389, 0.406]</point> 属于同一类别的对象。生成实例分割可视化结果,并将每个识别出的类别 <p>object1</p> 着以不同的颜色。首先,枚举请求中提到的每个可见 <p>object1</p> 实例并分配各…

Caption output: <p>object1<color>(255, 255, 255)</color></p>, <p>object1<color>(255, 150, 4)</color></p>,…

问:识别所有与视觉提供的 <p>object1</p><bbox>[0.673, 0.521, 0.754, 0.760]</bbox> 属于同一类别的对象。生成实例分割可视化结果,并将每个识别出的类别 <p>object1</p> 着以不同的颜色。首先,枚举请求中提到的每个可见 <p>object1</p> 实例…

Caption output: <p>object1<color>(255, 255, 255)</color></p>, <p>object1<color>(253, 118, 60)</color></p>,…

原始 SenseNova-Vision 语料库 (SN-VC) 原始 SenseNova-Vision 语料库 (SN-VC)

(a) 使用点参考提示的 VGD 分割。 (b) 使用框参考提示的 VGD 分割。 图 10 视觉接地 (VGD) 分割,带有文本指定的参考提示。提示通过文本坐标指定一个参考实例(点或框),并要求模型分割其他同类实例。(a) 点提示选中一个瓶子,SenseNova-Vision 分割不同形状和大小的匹配瓶子。(b) 在一个大象上使用框提示,尽管存在重叠和遮挡,模型仍能分离出附近的同类实例。

问:一张分割掩码图像。对应于 cat 的区域渲染为纯绿色;对应于 suitcase-1 的区域渲染为纯蓝色;对应于 suitcase-2 的区域渲染为纯黄色;对应于 wall 的区域渲染为纯橙色。其余部分渲染为黑色。

问:一张分割掩码图像。对应于 person 的区域渲染为纯灰色;对应于 skateboard 的区域渲染为纯浅灰色;对应于 pavement 的区域渲染为纯深绿色;对应于 car 的区域渲染为纯金色。其余部分渲染为黑色。

原始 SenseNova-Vision 语料库 (SN-VC) 原始 SenseNova-Vision 语料库 (SN-VC)

图 11 自由形式彩色编码掩码生成。提示以自然语言描述区域-颜色对应关系,不依赖于训练数据中使用的固定类别-颜色标签或精确 RGB 值。两个示例均显示了掩码状输出,其区域大致遵循请求的颜色分配,说明了语言对掩码表示协议的控制能力。

分割任务在训练数据中并未明确枚举。

自由形式彩色编码掩码生成探测语言是否能够自行定义掩码表示协议。在此,颜色分配通过自由形式语言给出,这测试了模型在训练使用固定类别-颜色标签和精确 RGB 值后,能否处理用户描述的调色板。如图 11 所示,SenseNova-Vision 生成掩码状输出,其区域大致遵循请求的颜色分配,尽管颜色和边界并不总是精确的。这表明语言可以控制掩码表示协议,而不仅仅是控制要分割的目标区域。

文本分割将文本内容(如单词或字符)视为空间掩码目标,并在场景文本分割 [193, 209] 中进行了研究。尽管 SenseNova-Vision 未使用文本分割掩码进行训练,但 OCR 定位监督可以与掩码生成重新组合以产生文本形状的区域。如图 12 所示,模型分割了查询的单词 “coke”,并且还可以为单个可见字母生成掩码。因此,分割的目标类型从传统的对象或材质区域扩展到词汇单元,包括需要联合识别、定位和掩码渲染的细粒度或不连续区域。

总体而言,这些定性探测表明,自由形式语言到掩码的生成可以在多个维度上扩展分割:数据分布、任务定义、掩码表示协议和目标类型。尽管这些行为仍然是定性的且不完美,但它们表明新的掩码生成任务可以通过重新组合识别、定位、接地、OCR 和渲染能力而涌现。

更重要的是,即使监督信号来自不同的任务领域,在我们公式下的联合训练加强了跨模态对应关系,使得相同的底层信息能够以灵活的方式在不同模态中表示和使用。指代式交互式分割和 VGD 分割表明,空间位置可以通过文本或图像提示指定,并与掩码输出对齐。OCR 定位和文本分割以互补的形式表示文本-空间信息:带有位置的符号文本和基于网格的视觉掩码。

16

第 17 页

问:在整个图像中对单词“coke”执行单词级文本分割。 问:对所有字母执行字母级文本分割。 原始图像 SenseNova-Vision 原始图像 SenseNova-Vision

(a) 单词级文本分割。 (b) 字母级文本分割。

图 12 来自自由形式语言提示的文本分割。(a) 单词级提示要求模型将查询的单词“coke”分割为文本形状的区域。(b) 字母级提示要求模型分割所有可见的字母,这需要更细粒度的文本区域定位和分解。在这两种情况下,生成的掩码都与请求的文本目标对齐。

自由形式的彩色编码掩码生成表明,模型能够从 RGB 指定的掩码协议泛化到自然语言颜色描述,同时将两者连接到彩色编码掩码输出,反映了其理解和利用不同颜色表达方式的能力。这些跨模态对应关系共同指向统一多模态生成,作为一种在一个模型内联合组织视觉、语言和空间信息的方法。

6 结论

在本工作中,我们将统一多模态生成提出为计算机视觉的一种表述,类似于 GPT 风格生成建模在自然语言处理(NLP)中的作用。我们通过将异构计算机视觉注释转化为文本、图像以及混合文本和图像生成目标,提出了 SenseNova-Vision 语料库(SenseNova-Vision Corpus),并在相同的表述下训练 SenseNova-Vision。这种转换使得在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面,无需任务特定头部即可对单一统一多模态模型(UMM)进行大规模训练。 resulting 模型达到了领先的任务专用系统的水平,并支持由语言定义的任务变体,这表明将计算机视觉监督吸收进通用基础模型具有可扩展的路径。对多样化 2D 和 3D 感知任务的生成建模可能会进一步培养隐式的空间理解,使这一范式自然地与迅速兴起的物理智能前沿领域相连接。

这种表述为未来工作开辟了若干方向。首先,更强的上下文学习(in-context learning)可以进一步缩小任务领域之间的界限,使得新的视觉任务可以通过示例、提示或超出预定义数据集的混合演示来指定。其次,将统一多模态生成从图像扩展到视频,将为基座模型训练带来时间动态性和网络规模的视频监督。最后,扩大语料库和模型容量,并与最强的语言模型进行更深入的集成,可能使通用基础模型能够从计算机视觉中吸收更丰富的视觉和空间知识,迈向能够感知、推理并与物理世界交互的世界模型。

17

第 18 页

参考文献

[1] 51WORLD. Dataone-synthetic-v1.0-sample, 2025. URL https://huggingface.co/datasets/51WORLD/ DataOne-synthetic-v1.0-sample. 访问日期:2026-06-19.

[2] Rabab Abdelfattah, Xiaofeng Wang, 和 Song Wang. Ttpla: 用于输电塔和电力线检测与分割的航拍图像数据集. 在亚洲计算机视觉会议论文集 (Proceedings of the Asian Conference on Computer Vision) 中, 2020.

[3] AISegment. 抠图人体数据集. GitHub 仓库, 2019. URL https://github.com/aisegmentcn/matting_ human_datasets. 访问日期:2026-06-18.

[4] Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Bi´nkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, 和 Karen Simonyan. Flamingo: 用于少样本学习的视觉语言模型. 在神经信息处理系统进展 (Advances in Neural Information Processing Systems) 中, 第 35 卷, 页码 23716–23736, 2022.

[5] Emanuele Alberti, Antonio Tavera, Carlo Masone, 和 Barbara Caputo. IDDA: 用于自动驾驶的大规模多域数据集. IEEE 机器人与自动化快报 (IEEE Robotics and Automation Letters), 5(4):5526–5533, 2020. doi: 10.1109/LRA.2020.3009075.

[6] Niki Amini-Naieni, Kiana Amini-Naieni, Tengda Han, 和 Andrew Zisserman. 开放世界文本指定物体计数, 2023. arXiv 预印本 arXiv:2306.01851.

[7] Mykhaylo Andriluka, Leonid Pishchulin, Peter Gehler, 和 Bernt Schiele. 2D 人体姿态估计:新基准与 现状分析. 在 2014 IEEE 计算机视觉与模式识别会议 (2014 IEEE Conference on Computer Vision and Pattern Recognition) 中, 页码 3686–3693, 2014. doi: 10.1109/CVPR.2014.471.

[8] Armen Avetisyan, Christopher Xie, Henry Howard-Jenkins, Tsun-Yi Yang, Samir Aroudj, Suvam Patra, Fuyang Zhang, Duncan Frost, Luke Holland, Campbell Orme, Jakob Engel, Edward Miller, Richard Newcombe, 和 Vasileios Balntas. Scenescript: 使用自回归结构化语言模型重建场景, 2024. arXiv 预印本 arXiv:2403.13064.

[9] Gwangbin Bae 和 Andrew J. Davison. 重新思考表面法线估计的归纳偏置. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)) 中, 页码 9535–9545, 2024.

[10] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, 和 Ke Zhu. Qwen3-VL 技术报告. arXiv 预印本 arXiv:2511.21631, 2025.

[11] Dina Bashkirova, Mohamed Abdelfattah, Ziliang Zhu, James Akl, Fadi Alladkani, Ping Hu, Vitaly Ablavsky, Berk Calli, Sarah Adel Bargal, 和 Kate Saenko. Zerowaste 数据集:面向杂乱场景中可变形物体分割. 在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)) 中, 页码 19134–19143, 2022 年 6 月.

[12] Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D. Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, Sandhini Agarwal, Ariel Herbert-Voss, Gretchen Krueger, Tom Henighan, Rewon Child, Aditya Ramesh, Daniel Ziegler, Jeffrey Wu, Clemens Winter, Chris Hesse, Mark Chen, Eric Sigler, Mateusz Litwin, Scott Gray, Benjamin Chess, Jack Clark, Christopher Berner, Sam McCandlish, Alec Radford, Ilya Sutskever, 和 Dario Amodei. 语言模型是少样本学习者. 在 H. Larochelle, M. Ranzato, R. Hadsell, M. F. Balcan, 和 H. Lin 编辑的神经信息处理系统进展 (Advances in Neural Information Processing Systems) 中, 第 33 卷, 页码 1877–1901. Curran Associates, Inc., 2020.

[13] buptlihang. CDLA: 中文文档布局分析数据集. GitHub 仓库, 2021. URL https://github.com/ buptlihang/CDLA. GitHub 仓库, 访问日期:2026 年 6 月 18 日.

[14] Sergi Caelles, Jordi Pont-Tuset, Federico Perazzi, Alberto Montes, Kevis-Kokitsi Maninis, 和 Luc Van Gool. 2019 davis 视频对象分割挑战:无监督多物体分割. arXiv, 2019.

[15] Yuanqiang Cai, Longyin Wen, Libo Zhang, Dawei Du, 和 Weiqiang Wang. 重新思考零售店中的物体检测. 在 第 35 届人工智能会议 (The 35th AAAI Conference on Artificial Intelligence (AAAI 2021)) 中, 2021.

18

第 19 页

[16] Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Tongxi Zhou, 等。使用多模态基础模型扩展空间智能。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 7879–7890 页,2026 年。

[17] Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, 和 Sergey Zagoruyko。基于 Transformer 的端到端 目标检测。在欧洲计算机视觉会议 (European Conference on Computer Vision) 中,第 213–229 页。Springer,2020 年。doi: 10.1007/978-3-030-58452-8 13。

[18] Chameleon Team。Chameleon:混合模态早期融合基础模型。arXiv 预印本 arXiv:2405.09818,2024 年。doi: 10.48550/arXiv.2405.09818。

[19] Chappieut。Industrial-site-safety-detection-v1-dataset。Hugging Face 数据集,2026 年。URL https://huggingface.co/ datasets/Chappieut/Industrial-Site-Safety-Detection-v1-DATASET。MIT 许可证。访问日期:2026-06-18。

[20] Keqin Chen, Zhao Zhang, Weili Zeng, Richong Zhang, Feng Zhu, 和 Rui Zhao。Shikra:释放多模态 LLM 的 指代对话魔力。arXiv 预印本 arXiv:2306.15195,2023 年。

[21] Ting Chen, Saurabh Saxena, Lala Li, David J. Fleet, 和 Geoffrey Hinton。Pix2Seq:一种用于 目标检测的语言建模框架。在国际学习表征会议 (International Conference on Learning Representations) 中,2022 年。

[22] Ting Chen, Saurabh Saxena, Lala Li, Tsung-Yi Lin, David Fleet, 和 Geoffrey E. Hinton。用于 视觉任务的统一序列接口。在 S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, 和 A. Oh 编辑的,神经信息处理系统进展 (Advances in Neural Information Processing Systems) 中,第 35 卷,第 31333–31346 页。Curran Associates, Inc.,2022 年。

[23] Yu Chen, Yao Wang, Peng Lu, Yisong Chen, 和 Guoping Wang。具有航拍图像语义约束的大规模运动恢复结构。 在中国模式识别与计算机视觉会议 (Chinese Conference on Pattern Recognition and Computer Vision (PRCV)) 中,第 347–359 页。Springer, 2018 年。

[24] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Zhong Muyan, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, 和 Jifeng Dai。Intern vl:扩展视觉基础模型并针对 通用视觉-语言任务进行对齐。2024 IEEE/CVF 计算机视觉与模式识别会议 (CVPR),第 24185–24198 页,2023 年。

[25] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, 等。Internvl:扩展视觉基础模型并针对通用视觉-语言任务进行对齐。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition) 中,第 24185–24198 页,2024 年。

[26] Bowen Cheng, Ishan Misra, Alexander G. Schwing, Alexander Kirillov, 和 Rohit Girdhar。用于通用图像分割的 掩码注意力掩码 Transformer。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,第 1290–1299 页,2022 年。

[27] Luca Ciampi., Carlos Santiago., Joao Paulo Costeira., Claudio Gennaro., 和 Giuseppe Amato。用于 交通密度估计的域自适应。 在第 16 届计算机视觉、成像和计算机图形学理论与应用国际联合会议论文集 – 第 5 卷:VISAPP 中,第 185–195 页。INSTICC, SciTePress,2021 年。ISBN 978-989-758-488-6。doi: 10.5220/0010303401850195。

[28] Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Scharw¨achter, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, 和 Bernt Schiele。Cityscapes 数据集。在 CVPR 数据集在视觉中的未来研讨会 (CVPR Workshop on The Future of Datasets in Vision) 中,2015 年。

[29] Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Rehfeld, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, 和 Bernt Schiele。用于语义城市场景理解的 Cityscapes 数据集。在 IEEE 计算机视觉与模式识别会议论文集 (Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)) 中,2016 年。

[30] Angela Dai, Angel X. Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, 和 Matthias Nießner。Scannet:丰富的 室内场景 3D 重建,2017 年。arXiv 预印本 arXiv:1702.04405。

[31] Matt Deitke, Dustin Schwenk, Jordi Salvador, Luca Weihs, Oscar Michel, Eli VanderBilt, Ludwig Schmidt, Kiana Ehsani, Aniruddha Kembhavi, 和 Ali Farhadi。Objaverse:一个带注释的 3D 对象宇宙,2022 年。arXiv 预印本 arXiv:2212.08051。

[32] Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Christopher Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Christopher Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hanna Hajishirzi, Ross Girshick, Ali Farhadi, 和 Aniruddha Kembhavi。Molmo 和 pixmo:开放权重和开放数据用于

19

第 20 页

最先进的视觉-语言模型。2025 IEEE/CVF 计算机视觉与模式识别会议 (CVPR), 页码 91–104,2024。

[33] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, 和 Haoqi Fan. 统一多模态预训练中的涌现特性。arXiv 预印本 arXiv:2505.14683, 2025。

[34] Xueqing Deng, Qihang Yu, Peng Wang, Xiaohui Shen, 和 Liang-Chieh Chen. Coconut:现代化 coco 分割。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,2024。

[35] Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, 等. SenseNova-U1:使用 NEO-unify 架构统一多模态理解 与生成。arXiv 预印本 arXiv:2605.12500,2026。

[36] Jian Ding, Nan Xue, Gui-Song Xia, Xiang Bai, Wen Yang, Michael Ying Yang, Serge Belongie, Jiebo Luo, Mihai Datcu, Marcello Pelillo, 和 Liangpei Zhang. 航拍图像中的目标检测:大规模基准与挑战。IEEE 模式分析与机器智能汇刊, 44(11):7778–7796, 2022年11月. ISSN 1939-3539. doi: 10.1109/ tpami.2021.3117983.

[37] Dawei Du, Pengfei Zhu, Longyin Wen, Xiao Bian, Haibin Lin, Qinghua Hu, Tao Peng, Jiayu Zheng, Xinyao Wang, Yue Zhang, Liefeng Bo, Hailin Shi, Rui Zhu, Aashish Kumar, Aijin Li, Almaz Zinollayev, Anuar Askergaliyev, Arne Schumann, Binjie Mao, Byeongwon Lee, Chang Liu, Changrui Chen, Chunhong Pan, Chunlei Huo, Da Yu, DeChun Cong, Dening Zeng, Dheeraj Reddy Pailla, Di Li, Dong Wang, Donghyeon Cho, Dongyu Zhang, Furui Bai, George Jose, Guangyu Gao, Guizhong Liu, Haitao Xiong, Hao Qi, Haoran Wang, Heqian Qiu, HongLiang Li, Huchuan Lu, Ildoo Kim, Jaekyum Kim, Jane Shen, Jihoon Lee, Jing Ge, Jingjing Xu, Jingkai Zhou, Jonas Meier, Jun Won Choi, Junhao Hu, Junyi Zhang, Junying Huang, Kaiqi Huang, Keyang Wang, Lars Sommer, Lei Jin, 和 Lei Zhang. Visdrone-det2019:图像挑战中视觉与无人机目标检测的结果。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 研讨会论文集 (ICCV) 中, 2019年10月。

[38] Juntong Fang, Zequn Chen, Weiqi Zhang, Donglin Di, Xuancheng Zhang, Chengmin Yang, 和 Yu-Shen Liu. MoRe: 运动感知的前馈 4d 重建 Transformer。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集 (CVPR) 中,页码 28914–28924,2026年6月。

[39] Patrick Follmann, Tobias B¨ottger, Philipp H¨artinger, Rebecca K¨onig, 和 Markus Ulrich. Mvtec d2s:密集分割的 超市数据集。在计算机视觉 – ECCV 2018:第 15 届欧洲会议,德国慕尼黑,2018年9月8-14日, 论文集,第 X 部分,页码 581–597,柏林,海德堡,2018。Springer-Verlag。ISBN 978-3-030-01248-9。 doi: 10.1007/978-3-030-01249-6 35。

[40] Whye Kit Fong, Rohit Mohan, Juana Valeria Hurtado, Lubing Zhou, Holger Caesar, Oscar Beijbom, 和 Abhinav Valada。 Panoptic nuscenes:用于激光雷达全景分割和跟踪的大规模基准。arXiv 预印本 arXiv:2109.03805, 2021。

[41] Whye Kit Fong, Venice Erin Liong, Kok Seang Tan, 和 Holger Caesar。nuscenes 重访:自动驾驶中的进展与挑战。ArXiv, abs/2512.02448, 2025。

[42] Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, 和 Radu Soricut。图像生成器是通用视觉学习者。arXiv 预印本 arXiv:2604.20329,2026。

[43] Adrien Gaidon, Qiao Wang, Yohann Cabon, 和 Eleonora Vig。虚拟世界作为多目标跟踪分析的代理, 2016。arXiv 预印本 arXiv:1605.06457。

[44] Yilin Gao, Shuguang Dou, Junzhou Li, Zhiheng Yu, Yin Li, Dongsheng Jiang, 和 Shugong Xu。Visual bridge:通用 视觉感知表示生成。在 AAAI 人工智能会议论文集 (AAAI) 中,第 40 卷, 页码 21234–21242,2026。doi: 10.1609/aaai.v40i25.39268。

[45] Sparsh Garg 和 Abhishek Aich。Mapillary vistas 细粒度交通标志验证:揭示视觉- 语言模型局限性的基准,2025。arXiv 预印本 arXiv:2508.02047。

[46] Yuying Ge, Ruimao Zhang, Lingyun Wu, Xiaogang Wang, Xiaoou Tang, 和 Ping Luo。一个多功能基准,用于检测、 姿态估计、分割和服装图像的重识别。CVPR,2019。

[47] Andreas Geiger, Philip Lenz, Christoph Stiller, 和 Raquel Urtasun。视觉与机器人:KITTI 数据集。 国际机器人研究杂志, 32(11):1231–1237, 2013。

20

第 21 页

[48] Dhruba Ghosh, Hannaneh Hajishirzi, 和 Ludwig Schmidt。GenEval:一个面向对象评估的文本到图像对齐框架。在《神经信息处理系统进展》(Advances in Neural Information Processing Systems),第 36 卷,第 52132–52152 页,2023 年。

[49] Eran Goldman, Roei Herzig, Aviv Eisenschtat, Jacob Goldberger, 和 Tal Hassner。密集场景中的精确检测。在《计算机视觉与模式识别会议论文集》(Proc. Conf. Comput. Vision Pattern Recognition (CVPR)),2019 年。

[50] Ke Gong, Xiaodan Liang, Dongyu Zhang, Xiaohui Shen, 和 Liang Lin。审视人体:自监督结构敏感学习与人体解析新基准。在《IEEE 计算机视觉与模式识别会议》(The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)),2017 年 7 月。

[51] Ke Gong, Xiaodan Liang, Yicheng Li, Yulong Chen, Ming Yang, 和 Liang Lin。通过部件分组网络进行实例级人体解析。在《欧洲计算机视觉会议论文集》(Proceedings of the European conference on computer vision (ECCV)),第 770–785 页,2018 年。

[52] Agrim Gupta, Piotr Dollar, 和 Ross Girshick。LVIS:一个用于大词汇量实例分割的数据集。在《IEEE 计算机视觉与模式识别会议论文集》(Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition),2019 年。

[53] Ankush Gupta, Andrea Vedaldi, 和 Andrew Zisserman。自然图像中文本定位的合成数据。在《IEEE 计算机视觉与模式识别会议》(IEEE Conference on Computer Vision and Pattern Recognition),2016 年。

[54] Nicolai Hani, Pravakar Roy, 和 Volkan Isler。Minneapple:一个用于苹果检测和分割的基准数据集。《IEEE 机器人与自动化快报》(IEEE Robotics and Automation Letters),5(2):852–858,2020 年 4 月。ISSN 2377-3774。doi: 10.1109/lra.2020.2965061。

[55] Jing He, Haodong Li, Mingzhi Sheng, 和 Ying-Cong Chen。Lotus-2:利用强大的图像生成模型推进几何密集预测。arXiv 预印本 arXiv:2512.01030,2025 年。

[56] Jing He, Haodong Li, Wei Yin, Yixun Liang, Leheng Li, Kaiqiang Zhou, Hongbo Zhang, Bingbing Liu, 和 Ying-Cong Chen。Lotus:基于扩散的高质量密集预测视觉基础模型。在《国际学习表征会议》(International Conference on Learning Representations),2025 年。

[57] Ju He, Shuo Yang, Shaokang Yang, Adam Kortylewski, Xiaoding Yuan, Jie-Neng Chen, Shuai Liu, Cheng Yang, 和 Alan Yuille。Partimagenet:一个大型高质量部件数据集。arXiv 预印本 arXiv:2112.00933,2021 年。

[58] Ju He, Shuai Yang, Shaobo Yang, Hengyi Zhao, Yuxin Chen, Xiaodong Li, Xingyu Qi, Yu Shen, Wei Zhang, Jing Dong 等人。Partimagenet:一个大型高质量部件数据集。在《欧洲计算机视觉会议论文集》(Proceedings of the European Conference on Computer Vision (ECCV)),第 128–145 页,2022 年。

[59] Kaiming He, Georgia Gkioxari, Piotr Doll´ar, 和 Ross Girshick。Mask R-CNN。在《IEEE 国际计算机视觉会议论文集》(Proceedings of the IEEE International Conference on Computer Vision (ICCV)),第 2961–2969 页,2017 年。

[60] Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Doll´ar, 和 Ross Girshick。掩码自编码器是可扩展的视觉学习者。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)),第 16000–16009 页,2022 年。

[61] Mengchao He, Yuliang Liu, Zhibo Yang, Sheng Zhang, Canjie Luo, Feiyu Gao, Qi Zheng, Yongpan Wang, Xin Zhang, 和 Lianwen Jin。icpr2018 多类型网页图像鲁棒阅读竞赛。在《第 24 届国际模式识别会议》(2018 24th International Conference on Pattern Recognition (ICPR)),第 7–12 页,2018 年。doi: 10.1109/ICPR.2018.8546143。

[62] Dan Hendrycks, Steven Basart, Mantas Mazeika, Andy Zou, Joe Kwon, Mohammadreza Mostajabi, Jacob Steinhardt, 和 Dawn Song。扩展真实场景下的分布外检测。《国际机器学习会议》(ICML),2022 年。

[63] Henning Heyen。LVIS 水果和蔬菜。Hugging Face 数据集,2026 年 6 月。URL https://huggingface.co/datasets/henningheyen/LVIS_Fruits_And_Vegetables。访问日期:2026-06-18。

[64] Jonathan Ho, Ajay Jain, 和 Pieter Abbeel。去噪扩散概率模型。在《神经信息处理系统进展》(Advances in Neural Information Processing Systems),第 33 卷,第 6840–6851 页,2020 年。

[65] Jungseok Hong, Michael Fulton, 和 Junaed Sattar。Trashcan:迈向海洋垃圾视觉检测的语义分割数据集,2020 年。arXiv 预印本 arXiv:2007.08097。

[66] Meng-Ru Hsieh, Yen-Liang Lin, 和 Winston H. Hsu。通过空间正则化区域提议网络进行无人机目标计数。在《IEEE 国际计算机视觉会议》(The IEEE International Conference on Computer Vision (ICCV))。IEEE,2017 年。

[67] Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, 和 Jiangmiao Pang。G2VLM:具有统一 3D 重建和空间推理的几何 grounded 视觉语言模型。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)),第 9535–9546 页,2026 年 6 月。

21

第 22 页

[68] Po-Han Huang, Kevin Matzen, Johannes Kopf, Narendra Ahuja, 和 Jia-Bin Huang。DeepMVS:学习多视图立体视觉。 在 IEEE 计算机视觉与模式识别会议 (CVPR) 上,2018。

[69] Zheng Huang, Kai Chen, Jianhua He, Xiang Bai, Dimosthenis Karatzas, Shijian Lu, 和 C. V. Jawahar。ICDAR2019 扫描收据 OCR 与信息提取竞赛。在 2019 国际文档分析与识别会议 (ICDAR) 上,第 1516–1520 页,2019。doi: 10.1109/ICDAR.2019.00244。

[70] Md Jahidul Islam, Chelsey Edge, Yuyang Xiao, Peigen Luo, Muntaqim Mehtaz, Christopher Morse, Sadman Sakib Enan, 和 Junaed Sattar。水下图像语义分割:数据集与基准。在 IEEE/RSJ 智能机器人与系统国际会议 (IROS) 上。IEEE/RSJ,2020。

[71] Koteswar Rao Jerripothula, Jianfei Cai, Jiangbo Lu, 和 Junsong Yuan。具有共分割的对象共骨架化。在 2017 IEEE 计算机视觉与模式识别会议 (CVPR) 上,第 3881–3889 页,2017。doi: 10.1109/CVPR.2017.413。

[72] Menglin Jia, Mengyun Shi, Mikhail Sirotenko, Yin Cui, Claire Cardie, Bharath Hariharan, Hartwig Adam, 和 Serge Belongie。Fashionpedia:本体、分割及属性定位数据集。在计算机视觉 – ECCV 2020 上,第 316–332 页。Springer,2020。doi: 10.1007/978-3-030-58452-8_19。

[73] Hanwen Jiang, Zexiang Xu, Desai Xie, Ziwen Chen, Haian Jin, Fujun Luan, Zhixin Shu, Kai Zhang, Sai Bi, Xin Sun, Jiuxiang Gu, Qixing Huang, Georgios Pavlakos, 和 Hao Tan。MegaSynth:利用合成数据扩展 3D 场景重建,2025。arXiv 预印本 arXiv:2412.14166。

[74] Qing Jiang, Gen Luo, Yuqin Yang, Yuda Xiong, Yihao Chen, Zhaoyang Zeng, Tianhe Ren, 和 Lei Zhang。ChatRex:驯化多模态大语言模型以进行联合感知与理解,2024。arXiv 预印本 arXiv:2411.18363。

[75] Qing Jiang, Junan Huo, Xingyu Chen, Yuda Xiong, Zhaoyang Zeng, Yihao Chen, Tianhe Ren, Junzhi Yu, 和 Lei Zhang。通过下一点预测检测任意对象。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上,第 25472–25483 页,2026 年 6 月。

[76] Jiongchao Jin, Arezou Fatemi, Wallace Lira, Fenggen Yu, Biao Leng, Rui Ma, Ali Mahdavi-Amiri, 和 Hao Zhang。Raidar:一个丰富的雨夜街道场景标注图像数据集,2021。arXiv 预印本 arXiv:2104.04606。

[77] Glenn Jocher 和 Muhammad Rizwan。Ultralytics 数据集:药丸检测数据集,2024 年 12 月。URL https://docs.ultralytics.com/datasets/detect/medical-pills/。

[78] Glenn Jocher 和 Muhammad Rizwan。Ultralytics 数据集:HomeObjects-3k 检测数据集,2025 年 5 月。URL https://docs.ultralytics.com/datasets/detect/homeobjects-3k/。

[79] Xuan Ju, Ailing Zeng, Jianan Wang, Qiang Xu, 和 Lei Zhang。Human-Art:一个连接自然场景与人工场景的多功能以人为中心的数据集。在 IEEE/CVF 计算机视觉与模式识别会议论文集上,2023。

[80] Dimosthenis Karatzas, Faisal Shafait, Seiichi Uchida, Masakazu Iwamura, Lluis Gomez i Bigorda, Sergi Robles Mestre, Joan Mas, David Fernandez Mota, Jon Almazán Almazán, 和 Lluís Pere de las Heras。ICDAR 2013 鲁棒阅读竞赛。在 2013 年第 12 届国际文档分析与识别会议上,第 1484–1493 页,2013。doi: 10.1109/ICDAR.2013.221。

[81] Dimosthenis Karatzas, Lluis Gomez-Bigorda, Anguelos Nicolaou, Suman Ghosh, Andrew Bagdanov, Masakazu Iwamura, Jiri Matas, Lukas Neumann, Vijay Ramaseshan Chandrasekhar, Shijian Lu, Faisal Shafait, Seiichi Uchida, 和 Ernest Valveny。ICDAR 2015 鲁棒阅读竞赛。在 2015 年第 13 届国际文档分析与识别会议 (ICDAR) 上,第 1156–1160 页,2015。doi: 10.1109/ICDAR.2015.7333942。

[82] Sahar Kazemzadeh, Vicente Ordonez, Mark Matten, 和 Tamara Berg。ReferItGame:在自然场景照片中指代对象。在 Alessandro Moschitti, Bo Pang, 和 Walter Daelemans 编辑的 2014 年自然语言处理实证方法会议 (EMNLP) 论文集上,第 787–798 页,卡塔尔多哈,2014 年 10 月。计算语言学协会。doi: 10.3115/v1/D14-1086。

[83] Sahar Kazemzadeh, Vicente Ordonez, Mark Matten, 和 Tamara L. Berg。ReferIt Game:在自然场景照片中指代对象。在 EMNLP 上,2014。

[84] Bingxin Ke, Anton Obukhov, Shengyu Huang, Nando Metzger, Rodrigo Caye Daudt, 和 Konrad Schindler。将基于扩散的图像生成器重新用于单目深度估计。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集上,第 9492–9502 页,2024。

[85] Nikhil Keetha, Norman Müller, Johannes Schönberger, Lorenzo Porzi, Yuchen Zhang, Tobias Fischer, Arno Knapitsch, Duncan Zauss, Ethan Weber, Nelson Antunes, Jonathon Luiten, Manuel Lopez-Antequera, Samuel Rota Bulo, Christian Richardt,

22

第 23 页

Deva Ramanan, Sebastian Scherer, 和 Peter Kontschieder。MapAnything: 通用的前馈式度量 3D 重建。 在 3D 视觉国际会议 (3DV) 上。IEEE, 2026。

[86] Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Doll´ar, 和 Ross Girshick。Segment anything。在 IEEE/CVF 计算机视觉国际会议 (ICCV) 论文集, 第 4015–4026 页, 2023。

[87] kkk2026。Waterovs。Hugging Face 数据集, 2026。URL https://huggingface.co/datasets/kkk2026/WaterOVS。 Hugging Face 数据集。访问日期:2026-06-18。

[88] Marcus Klasson, Cheng Zhang, 和 Hedvig Kjellstr¨om。具有视觉和语义标签的分层杂货店图像数据集。在 IEEE 计算机视觉应用冬季会议 (WACV) 上, 2019。

[89] Tobias Koch, Lukas Liebel, Friedrich Fraundorfer, 和 Marco K¨orner。基于 CNN 的单图像深度估计方法评估。在欧洲计算机视觉会议研讨会, 第 331–348 页, 2018。

[90] Nishtha Kukreti。shoe-dataset。Kaggle 数据集, 2021。URL https://www.kaggle.com/datasets/nishthakukreti/ shoedataset。鞋子检测数据集。访问日期:2026-06-18。

[91] Fatih Can Kurnaz, Burak Hocaoglu, Mert Kaan Yılmaz, ˙Idil S¨ulo, 和 Sinan Kalkan。Alet (设备和工具的自动标注):用于工具检测和人类工人安全检测的数据集。在计算机视觉与机器人辅助研讨会欧洲计算机视觉会议, 第 371–386 页。Springer, 2020。

[92] Alina Kuznetsova, Hassan Rom, Neil Alldrin, Jasper Uijlings, Ivan Krasin, Jordi Pont-Tuset, Shahab Kamali, Stefan Popov, Matteo Malloci, Alexander Kolesnikov, Tom Duerig, 和 Vittorio Ferrari。Open Images 数据集 v4:大规模统一的图像分类、目标检测和视觉关系检测。IJCV, 2020。

[93] Rollyn Labuguen, Jumpei Matsumoto, Salvador Blanco Negrete, Hiroshi Nishimaru, Hisao Nishijo, Masahiko Takada, Yasuhiro Go, Ken-ichi Inoue, 和 Tomohiro Shibata。MacaquePose:一种新颖的“野外”猕猴姿态数据集,用于无标记运动捕捉。行为神经科学前沿, 14:581154, 2021。doi: 10.3389/fnbeh.2020.581154。

[94] Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, 和 Jiaya Jia。LISA:通过大语言模型进行推理分割。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 9579–9589 页, 2024。

[95] Mengcheng Lan, Chaofeng Chen, Yue Zhou, Jiaxing Xu, Yiping Ke, Xinjiang Wang, Litong Feng, 和 Wayne Zhang。Text4Seg:重新构想图像分割为文本生成。在国际学习表征会议 (ICLR) 上, 2025。

[96] Hao Li, Jinguo Zhu, Xiaohu Jiang, Xizhou Zhu, Hongsheng Li, Chun Yuan, Xiaohua Wang, Yu Qiao, Xiaogang Wang, Wenhai Wang, 和 Jifeng Dai。Uni-Perceiver v2:用于大规模视觉和视觉-语言任务的通用模型。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 2691–2700 页, 2023。

[97] Jiefeng Li, Can Wang, Hao Zhu, Yihuan Mao, Hao-Shu Fang, 和 Cewu Lu。Crowdpose:拥挤场景的高效姿态估计及新基准。arXiv 预印本 arXiv:1812.00324, 2018。

[98] Minghao Li, Lei Cui, Shaohan Huang, Furu Wei, Ming Zhou, 和 Zhoujun Li。Tablebank:表格检测和识别的基准数据集, 2019。

[99] Xiang Li, Tianhan Wei, Yau Pun Chen, Yu-Wing Tai, 和 Chi-Keung Tang。Fss-1000:一个用于少样本分割的 1000 类数据集。在 2020 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 上, 第 2866–2875 页。IEEE, 2020 年 6 月。doi: 10.1109/cvpr42600.2020.00294。

[100] Xiaojie Li, Lu Yang, Qing Song, 和 Fuqiang Zhou。Detector-in-detector:人体部位的多级分析。在亚洲计算机视觉会议论文集, 第 228–240 页。Springer, 2019。

[101] Yi Li, Hongze Shen, Lexiang Tang, Xin Li, Xinpeng Ding, Yinsong Liu, Deqiang Jiang, Xing Sun, 和 Xiaomeng Li。 DenseMLLM:标准多模态大语言模型是内在的密集预测器, 2026。arXiv 预印本 arXiv:2602.14134。

[102] Xiaodan Liang, Chunyan Xu, Xiaohui Shen, Jianchao Yang, Si Liu, Jinhui Tang, Liang Lin, 和 Shuicheng Yan。具有上下文卷积神经网络的人体解析。在 IEEE 计算机视觉国际会议 (ICCV) 论文集, 第 1386–1394 页, 2015。

[103] Yue Liao, Si Liu, Guanbin Li, Fei Wang, Yanjie Chen, Chen Qian, 和 Bo Li。一种用于指代表达理解的实时跨模态相关滤波方法, 2020。arXiv 预印本 arXiv:1909.07072。

23

第 24 页

[104] Haotong Lin, Sili Chen, Jun Hao Liew, Donny Y. Chen, Zhenyu Li, Yang Zhao, Sida Peng, Hengkai Guo, Xiaowei Zhou, Guang Shi, Jiashi Feng, and Bingyi Kang. Depth anything 3: Recovering the visual space from any views. In International Conference on Learning Representations, 2026.

[105] Kevin Qinghong Lin, Linjie Li, Difei Gao, Zhengyuan Yang, Shiwei Wu, Zechen Bai, Weixian Lei, Lijuan Wang, and Mike Zheng Shou. Showui: One vision-language-action model for gui visual agent, 2024. arXiv preprint arXiv:2411.17465.

[106] Tsung-Yi Lin, Michael Maire, Serge Belongie, Lubomir Bourdev, Ross Girshick, James Hays, Pietro Perona, Deva Ramanan, C. Lawrence Zitnick, and Piotr Doll’ar. Microsoft COCO: Common objects in context. In Computer Vision–ECCV 2014, pages 740–755. Springer, 2014.

[107] Tsung-Yi Lin, Michael Maire, Serge Belongie, Lubomir Bourdev, Ross Girshick, James Hays, Pietro Perona, Deva Ramanan, C. Lawrence Zitnick, and Piotr Doll´ar. Microsoft coco: Common objects in context, 2015. arXiv preprint arXiv:1405.0312.

[108] Lu Ling, Yichen Sheng, Zhi Tu, Wentian Zhao, Cheng Xin, Kun Wan, Lantao Yu, Qianyu Guo, Zixun Yu, Yawen Lu, Xuanmao Li, Xingpeng Sun, Rohan Ashok, Aniruddha Mukherjee, Hao Kang, Xiangrui Kong, Gang Hua, Tianyi Zhang, Bedrich Benes, and Aniket Bera. Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision, 2023. arXiv preprint arXiv:2312.16256.

[109] Chang Liu, Henghui Ding, and Xudong Jiang. GRES: Generalized referring expression segmentation. In CVPR, 2023.

[110] Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. Visual instruction tuning. In Advances in Neural Information Processing Systems, volume 36, 2023.

[111] Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, and Lei Zhang. Grounding DINO: Marrying dino with grounded pre-training for open-set object detection. In Proceedings of the European Conference on Computer Vision (ECCV), pages 38–55, 2024. doi: 10.1007/978-3-031-72970-6 3.

[112] Si Liu, Zitian Wang, Yulu Gao, Lejian Ren, Yue Liao, Guanghui Ren, Bo Li, and Shuicheng Yan. Human-centric relation segmentation: Dataset and solution. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(9):4987–5001, 2022. doi: 10.1109/TPAMI.2021.3075846.

[113] Yinglu Liu, Hailin Shi, Hao Shen, Yue Si, Xiaobo Wang, and Tao Mei. A new dataset and boundary-attention semantic segmentation for face parsing. In AAAI, pages 11637–11644, 2020.

[114] Ziwei Liu, Ping Luo, Shi Qiu, Xiaogang Wang, and Xiaoou Tang. Deepfashion: Powering robust clothes recognition and retrieval with rich annotations. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (CVPR), June 2016.

[115] Shangbang Long, Siyang Qin, Dmitry Panteleev, Alessandro Bissacco, Yasuhisa Fujii, and Michalis Raptis. Towards end-to- end unified scene text detection and layout analysis. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022.

[116] Shangbang Long, Siyang Qin, Dmitry Panteleev, Alessandro Bissacco, Yasuhisa Fujii, and Michalis Raptis. Icdar 2023 competition on hierarchical text detection and recognition. arXiv preprint arXiv:2305.09750, 2023.

[117] Jiasen Lu, Christopher Clark, Rowan Zellers, Roozbeh Mottaghi, and Aniruddha Kembhavi. Unified-IO: A unified model for vision, language, and multi-modal tasks. In International Conference on Learning Representations, 2023.

[118] Jiasen Lu, Christopher Clark, Sangho Lee, Zichen Zhang, Savya Khosla, Ryan Marten, Derek Hoiem, and Aniruddha Kembhavi. Unified-IO 2: Scaling autoregressive multimodal models with vision, language, audio, and action. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 26439–26455, 2024.

[119] John McCormac, Ankur Handa, Stefan Leutenegger, and Andrew J. Davison. Scenenet rgb-d: 5m photorealistic images of synthetic indoor trajectories with ground truth, 2017. arXiv preprint arXiv:1612.05079.

[120] Kai A. Metzger, Peter Mortimer, and Hans-Joachim Wuensche. A fine-grained dataset and its efficient semantic segmentation for unstructured driving scenarios, 2021. arXiv preprint arXiv:2103.13109.

[121] Jiaxu Miao, Yunchao Wei, Yu Wu, Chen Liang, Guangrui Li, and Yi Yang. Vspw: A large-scale dataset for video scene parsing in the wild. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 4133–4143, 2021.

[122] Nibal Nayef, Yash Patel, Michal Busta, Pinaki Nath Chowdhury, Dimosthenis Karatzas, Wafa Khlif, Jiri Matas, Umapada Pal, Jean-Christophe Burie, Cheng-Lin Liu, and Jean-Marc Ogier. ICDAR2019 robust reading challenge on multi-lingual scene

24

第 25 页

文本检测与识别——RRC-MLT-2019。在2019年文档分析与识别国际会议(2019 International Conference on Document Analysis and Recognition)中,页码1582–1587。IEEE,2019。doi: 10.1109/ICDAR.2019.00254。

[123] Maxime Oquab, Timoth´ee Darcet, Th´eo Moutakanni, Huy V. Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mido Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Herv´e J´egou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski。DINOv2:在无监督情况下学习鲁棒的视觉特征。机器学习研究汇刊(Transactions on Machine Learning Research),2024。ISSN 2835-8856。

[124] Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, 和 Furu Wei。Kosmos-2:将多模态大语言模型锚定到现实世界。arXiv 预印本 arXiv:2306.14824,2023。

[125] Birgit Pfitzmann, Christoph Auer, Michele Dolfi, Ahmed S. Nassar, 和 Peter W. J. Staar。DocLayNet:用于文档布局分割的大型人工标注数据集。在ACM SIGKDD知识发现与数据挖掘第28次会议论文集(Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining)中,页码3743–3751。计算机协会(Association for Computing Machinery),2022。doi: 10.1145/3534678.3539043。

[126] Bryan A Plummer, Liwei Wang, Chris M Cervantes, Juan C Caicedo, Julia Hockenmaier, 和 Svetlana Lazebnik。Flickr30k entities:收集区域到短语的对应关系以构建更丰富的图像到句子模型。在IEEE国际计算机视觉会议(ICCV)论文集(Proceedings of the IEEE International Conference on Computer Vision (ICCV))中,页码2641–2649,2015。

[127] Lu Qi, Jason Kuen, Tiancheng Shen, Jiuxiang Gu, Weidong Guo, Jiaya Jia, Zhe Lin, 和 Ming-Hsuan Yang。高质量实体分割。在计算机视觉国际会议(ICCV)中,2023年10月。

[128] Qwen Team。Qwen3.5:迈向原生多模态智能体,2026年2月。URL https://qwen.ai/blog?id=qwen3.5。

[129] Vignesh Ramanathan, Anmol Kalia, Vladan Petrovic, Yi Wen, Baixue Zheng, Baishan Guo, Rui Wang, Aaron Marquez, Rama Kovvuri, Abhishek Kadian, Amir Mousavi, Yiwen Song, Abhimanyu Dubey, 和 Dhruv Mahajan。PACO:常见物体的部件与属性。在arXiv预印本 arXiv:2301.01795中,2023。

[130] Jo˜ao Ramˆoa, Vasco Lopes, Lu´ıs Alexandre, 和 Sandra Mogo。低功耗设备上的实时2D–3D门检测与状态分类。SN Applied Sciences,3,2021年5月。doi: 10.1007/s42452-021-04588-3。

[131] Hanoona Rasheed, Muhammad Maaz, Sahal Shaji, Abdelrahman Shaker, Salman Khan, Hisham Cholakkal, Rao M. Anwer, Eric Xing, Ming-Hsuan Yang, 和 Fahad S. Khan。Glamm:像素级锚定的大型多模态模型。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR))中,页码13009–13018,2024年6月。

[132] Hanoona Rasheed, Muhammad Maaz, Sahal Shaji, Abdelrahman Shaker, Salman Khan, Hisham Cholakkal, Rao M. Anwer, Eric Xing, Ming-Hsuan Yang, 和 Fahad S. Khan。Glamm:像素级锚定的大型多模态模型。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR))中,页码13009–13018,2024年6月。

[133] Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler, Luca Sbordone, Patrick Labatut, 和 David Novotny。Common objects in 3d:大规模学习与评估真实生活中的3D类别重建,2021。arXiv预印本 arXiv:2109.00512。

[134] Zhongwei Ren, Zhizhong Huang, Yunchao Wei, Yao Zhao, Dongmei Fu, Jiashi Feng, 和 Xiaojie Jin。PixelLM:使用大型多模态模型进行像素推理。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR))中,页码26374–26383,2024。

[135] Riis。空中绵羊数据集。Roboflow数据集,2022年6月。URL https://universe.roboflow.com/riis/aerial-sheep。访问于2023-01-02。

[136] Mike Roberts, Jason Ramapuram, Anurag Ranjan, Atulit Kumar, Miguel Angel Bautista, Nathan Paczan, Russ Webb, 和 Joshua M. Susskind。Hypersim:用于整体室内场景理解的 photorealistic 合成数据集,2021。arXiv预印本 arXiv:2011.02523。

[137] Mike Roberts, Jason Ramapuram, Anurag Ranjan, Atulit Kumar, Miguel Angel Bautista, Nathan Paczan, Russ Webb, 和 Joshua M. Susskind。Hypersim:用于整体室内场景理解的 photorealistic 合成数据集。在计算机视觉国际会议(ICCV)2021中,2021。

[138] Team Roboflow。血细胞检测数据集。Roboflow数据集,2022年11月。URL https://universe.roboflow.com/ team-roboflow/blood-cell-detection-1ekwu。访问于2023-01-18。

[139] Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Bj¨orn Ommer。使用潜在扩散模型进行高分辨率图像合成。在IEEE/CVF计算机视觉与模式识别会议(CVPR)论文集(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR))中,页码10684–10695,2022。

25

第 26 页

[140] Aadarsh Sahoo 和 Georgia Gkioxari。对话式图像分割:通过可扩展监督对抽象概念进行定位。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 39476–39485 页,2026 年 6 月。

[141] Thomas Sch¨ops, Johannes L. Sch¨onberger, Silvano Galliani, Torsten Sattler, Konrad Schindler, Marc Pollefeys 和 Andreas Geiger。具有高分辨率图像和多相机视频的多视角立体基准测试。在 IEEE 计算机视觉与模式识别会议论文集,第 3260–3269 页,2017 年。

[142] Seerave Foundation。Aicrowd 食物识别挑战赛。AIcrowd 挑战赛,2026。URL https://www.aicrowd.com/challenges/food-recognition-challenge。访问日期:2026-06-18。

[143] Shuai Shao, Zijian Zhao, Boxun Li, Tete Xiao, Gang Yu, Xiangyu Zhang 和 Jian Sun。Crowdhuman:人群中人检测基准,2018。arXiv 预印本 arXiv:1805.00123。

[144] Shuai Shao, Zeming Li, Tianyuan Zhang, Chao Peng, Gang Yu, Xiangyu Zhang, Jing Li 和 Jian Sun。Objects365:用于目标检测的大规模高质量数据集。在 IEEE/CVF 国际计算机视觉会议论文集,第 8430–8439 页,2019 年。

[145] Baoguang Shi, Cong Yao, Minghui Liao, Mingkun Yang, Pei Xu, Linyan Cui, Serge Belongie, Shijian Lu 和 Xiang Bai。ICDAR2017 野外中文文本阅读竞赛(RCTW-17)。在 2017 年第 14 届 IAPR 国际文档分析与识别会议(ICDAR)论文集,第 1429–1434 页,2017 年。doi: 10.1109/ICDAR.2017.233。

[146] Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang 和 Dahua Lin。Consistcompose:用于图像合成的统一多模态布局控制。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 495–505 页,2026 年 6 月。

[147] Shreyas S. Shivakumar, Neil Rodrigues, Alex Zhou, Ian D. Miller, Vijay Kumar 和 Camillo J. Taylor。Pst900:RGB-热校准、数据集和分割网络,2019。

[148] Shreyas S. Shivakumar, Neil Rodrigues, Alex Zhou, Ian D. Miller, Vijay R. Kumar 和 Camillo Jose Taylor。Pst900:RGB-热校准、数据集和分割网络。2020 IEEE 机器人与自动化国际会议(ICRA),第 9441–9447 页,2019 年。

[149] Jamie Shotton, Ben Glocker, Christopher Zach, Shahram Izadi, Antonio Criminisi 和 Andrew Fitzgibbon。用于 RGB-D 图像中相机重定位的场景坐标回归森林。在 IEEE 计算机视觉与模式识别会议论文集,第 2930–2937 页,2013 年。

[150] shubh303。开放世界密集目标检测数据集,2025。URL https://huggingface.co/datasets/shubh303/open-world-dense-object-detection。

[151] shubh303。密集目标检测数据集(FiftyOne 格式)。Hugging Face 数据集,2026。URL https://huggingface.co/datasets/shubh303/dense_object_detection_FiftyOne。访问日期:2026-06-18。

[152] Nathan Silberman, Derek Hoiem, Pushmeet Kohli 和 Rob Fergus。来自 RGBD 图像的室内分割和支持推断。在欧洲计算机视觉会议论文集,第 746–760 页,2012 年。

[153] Amanpreet Singh, Guan Pang, Mandy Toh, Jing Huang, Wojciech Galuba 和 Tal Hassner。TextOCR:迈向任意形状场景文本的大规模端到端推理。在 IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 8802–8812 页,2021 年。

[154] Jacob Solawetz。鱼类数据集。Roboflow 数据集,2020 年 7 月。URL https://public.roboflow.com/object-detection/fish。公共领域。访问日期:2026-06-18。

[155] Augmented Startups。足球运动员检测数据集。Roboflow 数据集,2022 年 11 月。URL https://universe.roboflow.com/augmented-startups/football-player-detection-kucab。访问日期:2022-12-29。

[156] Hongbin Sun, Zhanghui Kuang, Xiaoyu Yue, Chenhao Lin 和 Wayne Zhang。用于关键信息提取的空间双模态图推理。arXiv 预印本 arXiv:2103.14470,2021 年。

[157] Xian Sun, Peijin Wang, Zhiyuan Yan, Feng Xu, Ruiping Wang, Wenhui Diao, Jin Chen, Jihao Li, Yingchao Feng, Tao Xu, Martin Weinmann, Stefan Hinz, Cheng Wang 和 Kun Fu。Fair1m:高分辨率遥感图像细粒度目标识别基准数据集。ISPRS 摄影测量与遥感杂志,184:116–130,2022。ISSN 0924-2716。doi: 10.1016/j.isprsjprs.2021.12.004。

[158] Yipeng Sun, Zihan Ni, Chee-Kheng Chng, Yuliang Liu, Canjie Luo, Chun Chet Ng, Junyu Han, Errui Ding, Jingtuo Liu, Dimosthenis Karatzas, Chee Seng Chan 和 Lianwen Jin。ICDAR 2019 大规模街景文本竞赛

第 27 页

部分标注——RRC-LSVT。在《文档分析与识别国际会议》(International Conference on Document Analysis and Recognition),页码 1557–1562。IEEE,2019。doi: 10.1109/ICDAR.2019.00250。

[159] Bin Tan, Changjiang Sun, Xiage Qin, Hanat Adai, Zelin Fu, Tianxiang Zhou, Han Zhang, Yinghao Xu, Xing Zhu, Yujun Shen, 和 Nan Xue。Masked depth modeling for spatial perception。arXiv 预印本 arXiv:2601.17895,2026。

[160] Zachary Teed 和 Jia Deng。RAFT: Recurrent all-pairs field transforms for optical flow。在《欧洲计算机视觉会议》(European Conference on Computer Vision),页码 402–419。Springer,2020。

[161] Shengbang Tong, Zhuang Liu, Yuexiang Zhai, Yi Ma, Yann LeCun, 和 Saining Xie。Eyes wide shut? exploring the visual shortcomings of multimodal llms。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition),页码 9568–9578,2024。

[162] Jonathan Tremblay, Thang To, 和 Stan Birchfield。Falling things: A synthetic dataset for 3d object detection and pose estimation。在《IEEE 计算机视觉与模式识别会议研讨会论文集》(Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops),页码 2038–2041,2018。doi: 10.1109/CVPRW.2018.00275。

[163] Michael Tschannen, Alexey Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier H´enaff, Jeremiah Harmsen, Andreas Steiner, 和 Xiaohua Zhai。SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features。arXiv 预印本 arXiv:2502.14786,2025。

[164] Yu-Yun Tseng, Alexander Bell, 和 Danna Gurari。Vizwiz-fewshot: Locating objects in images taken by people with visual impairments,2022。arXiv 预印本 arXiv:2207.11810。

[165] Georgios Tziafas, XU Yucheng, Arushi Goel, Mohammadreza Kasaei, Zhibin Li, 和 Hamidreza Kasaei。Language-guided robot grasping: Clip-based referring grasp synthesis in clutter。在《第 7 届机器人学习年会》(7th Annual Conference on Robot Learning),2023。

[166] Benjamin Ummenhofer, Huizhong Zhou, Jonas Uhrig, Nikolaus Mayer, Eddy Ilg, Alexey Dosovitskiy, 和 Thomas Brox。Demon: Depth and motion network for learning monocular stereo。在《2017 IEEE 计算机视觉与模式识别会议》(CVPR),页码 5622–5631,2017。doi: 10.1109/CVPR.2017.596。

[167] Aisha Urooj 和 Ali Borji。Analysis of hand segmentation in the wild。在《IEEE 计算机视觉与模式识别会议论文集》(CVPR),页码 4710–4719,2018。

[168] Girish Varma, Anbumani Subramanian, Anoop Namboodiri, Manmohan Chandraker, 和 C. V. Jawahar。Idd: A dataset for exploring problems of autonomous navigation in unconstrained environments。在《IEEE 计算机视觉应用冬季会议论文集》(WACV),页码 1743–1751,2019。doi: 10.1109/WACV.2019.00190。

[169] Igor Vasiljevic, Nicholas Kolkin, Shanyi Zhang, Ruotian Luo, Haochen Wang, Falong Dai, Andrea F. Daniele, Mohammadreza Mostajabi, Steven Basart, Matthew R. Walter, 和 Gregory Shakhnarovich。DIODE: A dense indoor and outdoor DEpth dataset,2019。arXiv 预印本 arXiv:1908.00463。

[170] Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, 和 Xiaodan Liang。X-SAM: From segment anything to any segmentation。在《AAAI 人工智能会议论文集》(Proceedings of the AAAI Conference on Artificial Intelligence),第 40 卷,页码 26187–26196,2026。doi: 10.1609/aaai.v40i31.39822。

[171] Jianyuan Wang, Minghao Chen, Nikita Karaev, Andrea Vedaldi, Christian Rupprecht, 和 David Novotny。VGGT: Visual geometry grounded transformer。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR),页码 5294–5306,2025。

[172] Jiaqi Wang, Pan Zhang, Tao Chu, Yuhang Cao, Yujie Zhou, Tong Wu, Bin Wang, Conghui He, 和 Dahua Lin。V3det: Vast vocabulary visual detection dataset。在《IEEE 国际计算机视觉会议》(ICCV),2023 年 10 月。

[173] JiYuan Wang, Chunyu Lin, Lei Sun, Rongying Liu, Lang Nie, Mingxing Li, Kang Liao, Xiangxiang Chu, 和 Yao Zhao。From editor to dense geometry estimator。arXiv 预印本 arXiv:2509.04338,2025。

[174] Junjue Wang, Zhuo Zheng, Ailong Ma, Xiaoyan Lu, 和 Yanfei Zhong。Loveda: A remote sensing land-cover dataset for domain adaptation semantic segmentation。在《神经信息处理系统数据集与基准研讨会》(Neural Information Processing Systems Track on Datasets and Benchmarks),2021。

[175] Peng Wang, An Yang, Rui Men, Junyang Lin, Shuai Bai, Zhikang Li, Jianxin Ma, Chang Zhou, Jingren Zhou, 和 Hongxia Yang。OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework。在 Kamalika Chaudhuri, Stefanie Jegelka, Le Song, Csaba Szepesvari, Gang Niu, 和 Sivan Sabato 编辑的《第 39 届国际机器学习会议论文集》(Proceedings of the 39th International Conference on Machine Learning),机器学习研究论文集(Proceedings of Machine Learning Research)第 162 卷,页码 23318–23340。PMLR,2022 年 7 月 17–23 日。

27

第 28 页

[176] Qiang Wang, Shizhen Zheng, Qingsong Yan, Fei Deng, Kaiyong Zhao, and Xiaowen Chu. Irs: A large naturalistic indoor robotics stereo dataset to train deep models for disparity and surface normal estimation, 2021. arXiv preprint arXiv:1912.09678.

[177] Ruicheng Wang, Sicheng Xu, Yue Dong, Yu Deng, Jianfeng Xiang, Zelong Lv, Guangzhong Sun, Xin Tong, and Jiaolong Yang. MoGe-2: Accurate monocular geometry with metric scale and sharp details. In D. Belgrave, C. Zhang, H. Lin, R. Pascanu, P. Koniusz, M. Ghassemi, and N. Chen, editors, Advances in Neural Information Processing Systems, volume 38, pages 35928–35959. Curran Associates, Inc., 2025.

[178] Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, and Zhiding Yu. LocateAnything: Fast and high-quality vision-language grounding with parallel box decoding, 2026. arXiv preprint arXiv:2605.27365.

[179] Shuzhe Wang, Vincent Leroy, Yohann Cabon, Boris Chidlovskii, and Jerome Revaud. DUSt3R: Geometric 3D vision made easy. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 20697–20709, 2024.

[180] Wenshan Wang, Delong Zhu, Xiangwei Wang, Yaoyu Hu, Yuheng Qiu, Chen Wang, Yafei Hu, Ashish Kapoor, and Sebastian Scherer. Tartanair: A dataset to push the limits of visual slam, 2020. arXiv preprint arXiv:2003.14338.

[181] Xinlong Wang, Wen Wang, Yue Cao, Chunhua Shen, and Tiejun Huang. Images speak in images: A generalist painter for in-context visual learning. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 6830–6839, June 2023.

[182] Xinlong Wang, Xiaosong Zhang, Yue Cao, Wen Wang, Chunhua Shen, and Tiejun Huang. SegGPT: Towards segmenting everything in context. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), pages 1130– 1140, October 2023.

[183] Mark Weber, Jun Xie, Maxwell Collins, Yukun Zhu, Paul Voigtlaender, Hartwig Adam, Bradley Green, Andreas Geiger, Bastian Leibe, Daniel Cremers, Aljoˇsa Oˇsep, Laura Leal-Taix´e, and Liang-Chieh Chen. STEP: Segmenting and tracking every pixel. Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks, 2021.

[184] Chengyue Wu, Xiaokang Chen, Zhiyu Wu, Yiyang Ma, Xingchao Liu, Zizheng Pan, Wen Liu, Zhenda Xie, Xingkai Yu, Chong Ruan, and Ping Luo. Janus: Decoupling visual encoding for unified multimodal understanding and generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 12966–12977, 2025.

[185] Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, and Jifeng Dai. VisionLLM v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks. In A. Globerson, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. Tomczak, and C. Zhang, editors, Advances in Neural Information Processing Systems, volume 37, pages 69925–69975. Curran Associates, Inc., 2024. doi: 10.52202/079017-2235.

[186] Tong Wu, Jiarui Zhang, Xiao Fu, Yuxin Wang, Jiawei Ren, Liang Pan, Wayne Wu, Lei Yang, Jiaqi Wang, Chen Qian, Dahua Lin, and Ziwei Liu. Omniobject3d: Large-vocabulary 3d object dataset for realistic perception, reconstruction and generation, 2023. arXiv preprint arXiv:2301.07525.

[187] Zhiyong Wu, Zhenyu Wu, Fangzhi Xu, Yian Wang, Qiushi Sun, Chengyou Jia, Kanzhi Cheng, Zichen Ding, Liheng Chen, Paul Pu Liang, et al. Os-atlas: A foundation action model for generalist gui agents. arXiv preprint arXiv:2410.23218, 2024.

[188] Hongchi Xia, Yang Fu, Sifei Liu, and Xiaolong Wang. Rgbd objects in the wild: Scaling real-world 3d object learning from rgb-d videos, 2024. arXiv preprint arXiv:2401.12592.

[189] Bin Xiao, Haiping Wu, Weijian Xu, Xiyang Dai, Houdong Hu, Yumao Lu, Michael Zeng, Ce Liu, and Lu Yuan. Florence-2: Advancing a unified representation for a variety of vision tasks. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 4818–4829, 2024.

[190] Enze Xie, Wenjia Wang, Wenhai Wang, Mingyu Ding, Chunhua Shen, and Ping Luo. Segmenting transparent objects in the wild, 2020. arXiv preprint arXiv:2003.13948.

[191] Jinheng Xie, Weijia Mao, Zechen Bai, David Junhao Zhang, Weihao Wang, Kevin Qinghong Lin, Yuchao Gu, Zhijie Chen, Zhenheng Yang, and Mike Zheng Shou. Show-o: One single transformer to unify multimodal understanding and generation. In International Conference on Learning Representations, 2025.

[192] Ning Xu, Linjie Yang, Yuchen Fan, Dingcheng Yue, Yuchen Liang, Jianchao Yang, and Thomas Huang. Youtube-vos: A large-scale video object segmentation benchmark, 2018. arXiv preprint arXiv:1809.03327.

28

第 29 页

[193] Xingqian Xu, Zhifei Zhang, Zhaowen Wang, Brian Price, Zhonghao Wang, 和 Humphrey Shi. 重新思考文本分割:一个新数据集及文本特定的细化方法。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,第 12045–12055 页,2021.

[194] Le Xue, Manli Shu, Anas Awadalla, Jun Wang, An Yan, Senthil Purushwalkam, Honglu Zhou, Viraj Prabhu, Yutong Dai, Michael S. Ryoo, Shrikant Kendre, Jieyu Zhang, Can Qin, Shu Fang Zhang, Chia-Chih Chen, Ning Yu, Juntao Tan, Tulika Manoj Awalgaonkar, Shelby Heinecke, Huan Wang, Yejin Choi, Ludwig Schmidt, Zeyuan Chen, Silvio Savarese, Juan Carlos Niebles, Caiming Xiong, 和 Ran Xu. Blip-3:一系列开源大型多模态模型。2024 IEEE/CVF 国际计算机视觉研讨会 (ICCVW),第 6183–6194 页,2024.

[195] Fan Yang, Lei Hu, Xinwu Liu, Shuangping Huang, 和 Zhenghui Gu. 面向野外端到端表格识别的大规模数据集。Scientific Data, 10(1):110, 2023.

[196] Jingkang Yang, Yi Zhe Ang, Zujin Guo, Kaiyang Zhou, Wayne Zhang, 和 Ziwei Liu. 全景场景图生成。在 ECCV 中,2022.

[197] Lihe Yang, Bingyi Kang, Zilong Huang, Xiaogang Xu, Jiashi Feng, 和 Hengshuang Zhao. Depth Anything:释放大规模无标签数据的潜力。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,第 10371–10381 页,2024.

[198] Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, 和 Hengshuang Zhao. Depth Anything v2。在 A. Globerson, L. Mackey, D. Belgrave, A. Fan, U. Paquet, J. Tomczak, 和 C. Zhang 编辑的《神经信息处理系统进展》(Advances in Neural Information Processing Systems) 第 37 卷中,第 21875–21911 页。Curran Associates, Inc., 2024. doi: 10.52202/079017-0688.

[199] Senqiao Yang, Tianyuan Qu, Xin Lai, Zhuotao Tian, Bohao Peng, Shu Liu, 和 Jiaya Jia. 改进基于大语言模型的推理分割基线。arXiv 预印本 arXiv:2312.17240, 2023.

[200] Xue Yang, Junchi Yan, Wenlong Liao, Xiaokang Yang, Jin Tang, 和 Tao He. Scrdet++:通过实例级特征去噪和旋转损失平滑检测小尺寸、杂乱和旋转物体。IEEE 模式分析与机器智能汇刊, 2022.

[201] Yuxiang Yang, Junjie Yang, Yufei Xu, Jing Zhang, Long Lan, 和 Dacheng Tao. Apt-36k:用于动物姿态估计和跟踪的大规模基准。神经信息处理系统进展, 35:17301–17313, 2022.

[202] Yuxiang Yang, Yingqi Deng, Yufei Xu, 和 Jing Zhang. Aptv2:利用大规模数据集及超越基准测试动物姿态估计和跟踪, 2023. arXiv 预印本 arXiv:2312.15612.

[203] Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Faisal Ahmed, Zicheng Liu, Yumao Lu, 和 Lijuan Wang. UniTAB:统一文本和边界框输出以支持接地视觉-语言建模。在欧洲计算机视觉会议中,第 521–539 页。Springer, 2022.

[204] Yao Yao, Zixin Luo, Shiwei Li, Jingyang Zhang, Yufan Ren, Lei Zhou, Tian Fang, 和 Long Quan. Blendedmvs:用于通用多视图立体网络的大规模数据集, 2020. arXiv 预印本 arXiv:1911.10127.

[205] Chandan Yeshwanth, Yueh-Cheng Liu, Matthias Nießner, 和 Angela Dai. Scannet++:高保真度 3D 室内场景数据集, 2023. arXiv 预印本 arXiv:2308.11417.

[206] Haoxuan You, Haotian Zhang, Zhe Gan, Xianzhi Du, Bowen Zhang, Zirui Wang, Liangliang Cao, Shih-Fu Chang, 和 Yinfei Yang. Ferret:在任何粒度下指代并接地任何物体。arXiv 预印本 arXiv:2310.07704, 2023.

[207] Youtu-VL Team. Youtu-VL:通过统一的视觉-语言监督释放视觉潜力, 2026. arXiv 预印本 arXiv:2601.19798.

[208] Fisher Yu, Haofeng Chen, Xin Wang, Wenqi Xian, Yingying Chen, Fangchen Liu, Vashisht Madhavan, 和 Trevor Darrell. BDD100K:用于异构多任务学习的多样化驾驶数据集, 2020. arXiv 预印本 arXiv:1805.04687.

[209] Haiyang Yu, Teng Fu, Bin Li, 和 Xiangyang Xue. EAFormer:具有边缘感知 Transformer 的场景文本分割。在欧洲计算机视觉会议中,第 307–325 页。Springer, 2024.

[210] Hang Yu, Yufei Xu, Jing Zhang, Wei Zhao, Ziyu Guan, 和 Dacheng Tao. Ap-10k:野外动物姿态估计基准。在第三十五届神经信息处理系统数据集与基准测试轨道(第二轮)中,2021.

[211] Licheng Yu, Patrick Poirson, Shan Yang, Alexander C. Berg, 和 Tamara L. Berg. 建模指代表达中的上下文。在欧洲计算机视觉会议中,第 69–85 页,2016.

第 30 页

[212] Xuehui Yu, Yuqi Gong, Nan Jiang, Qixiang Ye, 和 Zhenjun Han. Scale match for tiny person detection. In The IEEE Winter Conference on Applications of Computer Vision, pages 1257–1265, 2020.

[213] Amir Zamir, Alexander Sax, William Shen, Leonidas Guibas, Jitendra Malik, 和 Silvio Savarese. Taskonomy: Disentangling task transfer learning, 2018. arXiv preprint arXiv:1804.08328.

[214] Jingbo Zhang, Xiaoyu Li, Qi Zhang, Yanpei Cao, Ying Shan, 和 Jing Liao. Humanref: Single image to 3d human generation via reference-guided diffusion. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 1844–1854, 2024.

[215] Libo Zhang, Lutao Jiang, Ruyi Ji, 和 Heng Fan. Pidray: A large-scale x-ray benchmark for real-world prohibited item detection, 2022. arXiv preprint arXiv:2211.10763.

[216] Rui Zhang, Yongsheng Zhou, Qianyi Jiang, Qi Song, Nan Li, Kai Zhou, Lei Wang, Dong Wang, Minghui Liao, Mingkun Yang, Xiang Bai, Baoguang Shi, Dimosthenis Karatzas, Shijian Lu, 和 C. V. Jawahar. Icdar 2019 robust reading challenge on reading chinese text on signboard. In 2019 International Conference on Document Analysis and Recognition (ICDAR), pages 1577–1581, 2019. doi: 10.1109/ICDAR.2019.00253.

[217] Shifeng Zhang, Yiliang Xie, Jun Wan, Hansheng Xia, Stan Z. Li, 和 Guodong Guo. Widerperson: A diverse dataset for dense pedestrian detection in the wild. IEEE Transactions on Multimedia (TMM), 2019.

[218] Song-Hai Zhang, Ruilong Li, Xin Dong, Paul Rosin, Zixi Cai, Xi Han, Dingcheng Yang, Haozhi Huang, 和 Shi-Min Hu. Pose2seg: Detection free human instance segmentation. In 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 889–898, 2019. doi: 10.1109/CVPR.2019.00098.

[219] Zheng Zhang, YeYao Ma, Enming Zhang, 和 Xiang Bai. PSALM: Pixelwise segmentation with large multi-modal model. In Proceedings of the European Conference on Computer Vision (ECCV), pages 74–91, 2024. doi: 10.1007/978-3-031-72754-2 5.

[220] Zheng Zhang, Yeyao Ma, Enming Zhang, 和 Xiang Bai. Psalm: Pixelwise segmentation with large multi-modal model. In European Conference on Computer Vision, pages 74–91. Springer, 2025.

[221] Canyu Zhao, Yanlong Sun, Mingyu Liu, Huanyi Zheng, Muzhi Zhu, Zhiyue Zhao, Hao Chen, Tong He, 和 Chunhua Shen. DICEPTION: A generalist diffusion model for visual perceptual tasks. In D. Belgrave, C. Zhang, H. Lin, R. Pascanu, P. Koniusz, M. Ghassemi, 和 N. Chen, editors, Advances in Neural Information Processing Systems, volume 38, pages 40108–40155. Curran Associates, Inc., 2025.

[222] Xu Zhong, Jianbin Tang, 和 Antonio Jimeno Yepes. Publaynet: largest dataset ever for document layout analysis. In 2019 International Conference on Document Analysis and Recognition (ICDAR), pages 1015–1022. IEEE, Sep. 2019. doi: 10.1109/ICDAR.2019.00166.

[223] Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, 和 Noah Snavely. Stereo magnification: Learning view synthesis using multiplane images. ACM Transactions on Graphics, 37(4):65:1–65:12, 2018.

[224] Chenchen Zhu, Fanyi Xiao, Andr´es Alvarado, Yasmine Babaei, Jiabo Hu, Hichem El-Mohri, Sean Chang, Roshan Sumbaly, 和 Zhicheng Yan. Egoobjects: A large-scale egocentric dataset for fine-grained object understanding. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2023.

[225] Jingsen Zhu, Fujun Luan, Yuchi Huo, Zihao Lin, Zhihua Zhong, Dianbing Xi, Jiaxiang Zheng, Rui Tang, Hujun Bao, 和 Rui Wang. Learning-based inverse rendering of complex indoor scenes with differentiable monte carlo raytracing, 2022. arXiv preprint arXiv:2211.03017.

[226] Lianghui Zhu, Bin Ouyang, Yuxuan Zhang, Tianheng Cheng, Rui Hu, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Li Yu, Wenyu Liu, 和 Xinggang Wang. LENS: Learning to segment anything with unified reinforced reasoning. In Proceedings of the Fortieth AAAI Conference on Artificial Intelligence (AAAI), volume 40, pages 13952–13960, 2026. doi: 10.1609/aaai. v40i16.38405.

[227] Pengfei Zhu, Longyin Wen, Dawei Du, Xiao Bian, Heng Fan, Qinghua Hu, 和 Haibin Ling. Detection and tracking meet drones challenge. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11):7380–7399, 2021.

[228] Xizhou Zhu, Jinguo Zhu, Hao Li, Xiaoshi Wu, Hongsheng Li, Xiaohua Wang, 和 Jifeng Dai. Uni-Perceiver: Pre-training unified architecture for generic perception for zero-shot and few-shot tasks. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 16804–16815, 2022.

30

第 31 页

附录

A SenseNova-Vision 语料库构建细节

本附录记录了 SenseNova-Vision 语料库的构建细节,并扩展了第 3 节中的数据协议。每个训练示例由一个或多个视觉输入、自然语言指令以及表示为文本、图像或混合文本-图像输出的目标响应组成。随后详细介绍了每个任务族的数据构成、处理流程、提示词设计及发布资源。

A.1 结构化视觉理解

数据构成 结构化视觉理解包括边界框检测、点检测、视觉提示检测、指代检测、OCR 定位、布局分析、GUI 接地和关键点检测。由于边界框、点和视觉提示检测共享密切相关的源标注,我们在表 6 中总结了它们的集成数据集。其他结构化任务,包括 OCR、布局分析、GUI 接地、关键点检测和指代检测,则是从专用数据集构建的,如表 7 所示。相应的处理流程和数据引擎描述如下。

| 数据集 | 任务 | 帧数 | 来源 | | :— | :— | :— | :— | | APTv2 [202] | BBox/Point | 28.0K/14.7K | Public/B2PC | | BDD100K [208] | BBox/Point/Visual | 70.0K/68.0K / 44.1K | Public/B2PC/Public | | Blood Cell [138] | BBox/Visual | 0.2K/0.1K | Public/Public | | CARPK [66] | BBox/Visual | 1.0K/0.6K | Public/Public | | CrowdHuman [143] | BBox/Visual | 3.4K/2.1K | Public/Public | | DOTAv2 [36] | BBox/Point/Visual | 1.8K/1.7K/1.1K | Public/B2PC/Public | | DeepFashion [114] | BBox/Point | 191.0K/112.6K | Public/B2PC | | EgoObjects [224] | BBox/Point | 78.0K/49.9K | Public/B2PC | | FAIR1M [157] | BBox/Point/Visual | 16.0K/16.0K/10.1K | Public/B2PC/Public | | FSC147 [6] | BBox/Point/Visual | 1.8K/3.6K/1.1K | GDE/Public/GDE | | FiftyOne [151] | BBox/Visual | 8.0K/5.0K | Public/Public | | Fish [154] | Visual | 0.4K | Public | | Football [155] | BBox/Visual | 0.8K/0.5K | Public/Public | | GroceryStore [88] | BBox/Visual | 1.8K/1.1K | GDE/GDE | | HomeObjects-3k [78] | BBox/Visual | 2.2K/1.4K | Public/Public | | HumanParts [100] | BBox/Point | 12.0K/7.0K | Public/B2PC | | ImageNetPart [58] | BBox/Point | 16.0K/10.2K | Public/B2PC | | Industrial Site Safety [19] | BBox/Visual | 0.3K/0.2K | Public/Public | | LVIS Fruits & Vegetables [63] | BBox/Visual | 6.7K/6.9K | Public/Public | | Locount [15] | BBox/Visual | 34.0K/21.4K | Public/Public | | METU-ALET [91] | BBox/Visual | 2.0K/1.3K | Public/Public | | NuImages [41] | BBox/Point | 60.0K/55.0K | Public/B2PC | | OWOD [150] | BBox/Visual | 8.0K/5.0K | Public/Public | | Objects365 [144] | BBox/Point/Visual | 1742.0K/1077.1K/1428.8K | Public/B2PC/Public | | PACO-LVIS [129] | BBox/Point | 45.0K/26.9K | Public/B2PC | | PixMo-Points [32] | BBox/Point | 0.1K/1090.6K | GDE/Public | | S2TLD [200] | BBox/Visual | 5.0K/3.2K | Public/Public | | SA-1B [86] | BBox/Point/Visual | 3119.0K/1949.4K/3116.6K | GDE/B2PC/GDE | | SKU110K [49] | BBox/Visual | 28.0K/17.6K | Public/Public | | Shoes [90] | BBox | 0.1K | Public | | TinyPerson [212] | BBox/Visual | 1.5K/0.4K | Public/Public | | V3Det-OVD [172] | BBox/Point | 116.0K/60.8K | Public/B2PC | | VisDrone [227] | BBox/Point/Visual | 6.4K/6.4K/4.0K | Public/B2PC/Public | | WiderPerson [217] | BBox/Visual | 9.0K/5.7K | Public/Public | | Pill [77] | BBox/Visual | 0.1K/0.1K | Public/Public | | Sheep [135] | BBox/Visual | 3.6K/2.3K | Public/Public |

表 6 边界框、点和视觉提示检测的数据集。帧数和来源遵循任务的顺序。“GDE”表示来自我们接地数据引擎的标注;“B2PC”表示通过我们的流程从边界框转换的点。

数据处理 我们使用相对图像坐标用于所有与检测相关的任务,并根据图像宽度和高度进行归一化。每个坐标四舍五入到小数点后三位,超出图像边界的值会被裁剪,例如

第 32 页

任务:指代 / OCR 任务:关键点 / 布局 / GUI

数据集 任务 帧数 来源 数据集 任务 帧数 来源

HumanRef [214] 指代 64.0K 公开 AP-10K [210] 关键点 9.7K 公开 Objects365 [144] 指代 3589.0K RGDE APT36K [201] 关键点 35.0K 公开 OpenImages [92] 指代 4034.0K RGDE COCO2017 [106] 关键点 56.0K 公开 RefCOCO/+/g [82, 211] 指代 579.0K 公开 CrowdPose [97] 关键点 10.0K 公开 RexVerse [74] 指代 1632.0K 公开 Human-Art [79] 关键点 33.0K 公开 BLIP3-OCR-200M [194] OCR 1582.0K OCRE MPII [7] 关键点 17.0K 公开 HierText [115, 116] OCR 32.8K 公开 MacaquePose V1 [93] 关键点 1.3K 公开 ICDAR2013 [80] OCR 0.2K 公开 OCHuman [218] 关键点 3.2K 公开 ICDAR2015 [81] OCR 1.8K 公开 CDLA [13] 布局 5.0K 公开 ICDAR2019 [122] OCR 11.0K 公开 DocLayNet Core [125] 布局 69.0K 公开 LSVT2019 [158] OCR 116.0K 公开 PubLayNet [222] 布局 335.0K 公开 MTWI [61] OCR 40.0K 公开 TabRecSet [195] 布局 32.0K 公开 RCTW [145] OCR 16.0K 公开 TableBank [98] 布局 260.0K 公开 ReCTS [216] OCR 76.0K 公开 OS-Atlas [187] GUI 3101.6K 公开 SROIE [69] OCR 1.2K 公开 ShowUI Desktop [105] GUI 1.5K 公开 SynthText [53] OCR 1716.0K 公开 TextOCR [153] OCR 42.0K 公开 WildReceipt [156] OCR 2.4K 公开

表 7 涵盖指代检测、OCR 定位、关键点检测、文档布局分析和 GUI 理解的数据集。 “RGDE”和“OCRE”分别指代我们指代定位和 OCR 数据引擎生成的输出。

最终坐标保持在 [0.000, 0.999] 范围内。这种统一表示法应用于边界框、点和关键点,减少了由不同图像分辨率和标注格式引起的差异。为了增强训练数据的多样性和质量,特别是针对具有挑战性的场景和多任务学习,我们开发了多个数据引擎,用于生成大规模、高质量的标注,并促进视觉-空间对应关系的学习。整体流程如图 13 所示。

提示设计 遵循 InternVL [24] 的提示构建范式,每个样本组织为以下字典结构模板。 { "id": Sample_id , "image ": [ Input_image ], " conversations ": [ {" from ": "human", "value ": "<image > Instruction "}, {" from ": "gpt", "value ": "Target_text "} ] }

样本 ID 唯一标识每个训练样本,而输入图像记录输入 RGB 图像的路径。占位符 <image> 标记数据加载器插入相应视觉输入的位置,Instruction 指定任务及所需的输出格式。Target text 表示包含任务特定语义标签和空间标注(如边界框、点、多边形或关键点)的文本结果。对于与 OCR 相关的样本,它们还包含与每个定位区域相关联的识别文本。为了更好地说明 Instruction 中的任务类型并标准化 Target text 格式,我们采用了一些轻量级标记作为辅助表示,如表 8 所示。

对于 Instruction 字段,在数据集构建期间从相应的任务特定池中随机选择一个模板。我们为每个不同的任务选择一个模板,完整集合总结在表 9 中。

发布的数据集 由于结构化视觉理解的大多数源数据集是公开可用的,我们发布了由数据引擎生成或转换的训练示例。

A.2 密集几何预测

数据组成 公共深度和法线数据集通常共享相同的底层数据源。本任务中采用的所有数据集总结在表 10 中。我们的方法需要密集监督,这由合成数据集原生提供。由于 LiDAR 数据集通常包含稀疏且不完善的标注,我们使用 MoGe-2 [177] 来生成

32

第 33 页

标记 字段 功能

<p>…</p> 短语或标签 物体类别、指代表达式、OCR 文本、区域描述, 或生成的字幕片段。

<bbox>…</bbox> 边界框 归一化的边界框坐标。

<point>…</point> 点 归一化的点坐标。

<kpt>…</kpt> 关键点 命名关键点的坐标。

<ins>…</ins> 实例 不同的个体身份。

<polygon>…</polygon> 多边形 基于多边形的 OCR 结果表示。

表 8 结构化指令和目标响应中使用的代表性分隔符。

任务 指令

边界框检测 从类别中识别物体:<p>类别</p>。以文本形式输出检测结果,每条记录包含类别 和边界框坐标。此格式不同于深度/分割图像输出。

点检测 从类别中检测物体:<p>类别</p>。不返回深度图或分割掩码等视觉输出, 而是返回带有标签和点坐标的文本检测列表。

指代检测 检测图像中所有的 <p>表达式</p>。不返回修改后的图像输出,而是返回结构化文本, 包含每个目标的类别标签和边界框坐标。

视觉提示检测 给定参考物体 <p>物体1</p><bbox>[x0,y0,x1,y1]</bbox>,检测所有匹配实例。 输出带有类别标签和边界框 [x0, y0, x1, y1] 的结构化文本。

OCR 对整个图像执行全文本行级 OCR。输出结构化列表,包含每行文本的边界框 和提取的文本内容。

布局分析 从类别中检测物体:<p>类别</p>。返回带有标签和边界框坐标的文本检测列表, 无视觉掩码/深度输出。

GUI 定位 检测所有 <p>类别</p> 实例。输出带有物体类别和精确位置坐标的结构化文本, 区别于图像格式的视觉输出。

关键点检测 预测所有 <p>类别</p> 实例的 <关键点名称>。输出带有类别和 关键点坐标 [x, y] 的结构化列表。

表 9 结构化视觉理解任务的指令模板。

密集伪标签。还引入了来自相关领域的额外公共数据集,以增强泛化能力和 现实世界性能,密集标签由 MoGe-2 一致生成。

标注 数据集 任务 领域 帧数 来源

Hypersim [136] 深度/法线 室内 61K/73K 合成 Virtual KITTI [43] 深度 室外 17K 合成 InteriorVerse [225] 法线 室内 27K 合成 密集 IRS [176] 深度/法线 室内 74K/103K 合成 TartanAir [180] 深度/法线 室外 118K/118K 合成 SceneNet RGB-D [119] 深度/法线 室内 2273K/2380K 合成

Taskonomy [213] 深度/法线 室内 2000K/2000K LiDAR 稀疏 ScanNet++ [205] 深度/法线 室内 813K/813K LiDAR

COCO 2017 [107] 深度/法线 自然场景 78K/79K – 无 SA-1B [86] 深度/法线 自然场景 4442K/4462K – Objects365 [144] 深度/法线 自然场景 1317K/1317K –

表 10 用于深度和法线估计任务的数据集总结。

数据处理 对于深度数据处理,我们将有效范围设置为 0.1 米至 80 米。包含超过 1% 无效像素的密集注释将被丢弃,而对于 由 MoGe-2 [177] 生成的伪标签,则采用 10% 的阈值。我们使用逆深度图作为监督信号,并将所有数据转换为标准化的三通道 RGB 图像以进行深度估计。对于表面法线数据,我们仅对 MoGe-2 伪标签进行过滤,

33

第 34 页

接地数据引擎

原始图像 -> 图像描述 -> 短语过滤 -> 空间标注 -> 接地数据 短边 ≥386 -> Rex-Omni -> 名词短语 -> 可选主体 -> 对齐数据 -> Qwen2.5-VL -> 7B -> 移除 -> (短语, bbox/点)

指代数据引擎

图像+GT -> 表达式 -> 验证 -> 质量过滤 -> 指代数据 短边 ≥386 -> GT采样+Qwen2.5-VL生成 -> Rex-Omni预测+IoU基于GT匹配 -> 空间完整性、语义一致性 -> 对齐数据 (图像, 表达式)

边界框-点转换

边界框+图像 -> 边界框转点 -> 掩码生成 -> 质量过滤 -> 点数据 带边界框标签的图像 -> 使用边界框中心作为候选点 -> SAM从边界框生成掩码 -> 短语级验证,掩码内所有点 -> 对齐点标注

OCR数据引擎

原始图像 -> 重新标注 -> 质量过滤 -> 词与文本行多边形数据 -> 词与文本行边界框数据 BLIP OCR图像 -> PaddleOCR + RapidOCR工具包 -> 移除低置信度结果 -> (短语, 多边形) -> (短语, 边界框)

图13 提出的数据构建流程概览,包括接地数据引擎、指代接地数据引擎、边界框到点的数据转换以及用于生成大规模高质量空间标注的OCR数据引擎。

排除天空覆盖率超过10%的图像。有效法向量的X、Y和Z分量被分配给相应的RGB通道,以形成最终的训练数据。

提示设计 密集几何预测被表述为图像到图像的任务,遵循InternVL [25] 的提示构建范式。 { "id": Sample_id , "image ": [Input_image , Output_image ], " conversations ": [ {" from ": "human", "value ": "<image > Instruction "}, {" from ": "gpt", "value ": "<image >"} ] }

与结构化视觉理解不同,密集几何预测使用图像响应作为目标输出。输出图像指的是编码后的深度或表面法线目标图像的路径。表11列出了几个模板指令的示例。

任务 指令

深度 估计图像中每个像素的相对深度。较近的物体应显得更亮,较远的物体更暗。输出是一个灰度图像,像素值范围为0到255。

法线 估计表面法线并将其编码为RGB图像。R、G和B通道分别对应X、Y和Z方向的分量。

表11 密集几何预测的指令模板。

已发布数据集 由于密集标注数据集可以通过我们提供的处理流程轻松转换,我们仅发布由MoGe-2 [177] 生成的训练示例,包括表10中带有稀疏标注或无标注的数据集。

A.3 分割

数据组成 我们根据输出表示格式将分割数据集分为两组。如表12所示,第一组涵盖指代分割、推理分割和交互分割

34

第 35 页

任务,其输出包含每个图像中单个前景目标区域的二值掩码。第二组任务总结在表 13 中,包括通用分割(语义分割和全景分割)以及接地对话生成(GCG)分割。这些任务生成全面的全景掩码,为整个图像中的所有空间区域分配密集的语义和实例标签。

| 数据集 | 任务 | 帧数 | 数据集 | 任务 | 帧数 | | :— | :— | :— | :— | :— | :— | | RefCOCO/+/g [83] | 指代 | 545.7K | CIHP [51] | 指代 | 15.0K | | RefClef [103] | 指代 | 220.7K | ATR [102] | 指代 | 11.3K | | GRefCOCO [109] | 指代 | 353.3K | LIP [50] | 指代 | 14.3K | | DOORS [130] | 指代 | 6.5K | FAT-single/mixed [162] | 指代 | 19.5K | | NDISPark [27] | 指代 | 0.1K | Fashionpedia [72] | 指代 | 13.3K | | MinneApple [54] | 指代 | 0.5K | PartImageNet/Whole [57] | 指代 | 34.8K | | EYTH [167] | 指代 | 0.3K | WaterOVS [87] | 指代 | 2.8K | | PST900 [147] | 指代 | 0.3K | RaidaR-rainy/sunny [76] | 指代 | 2.4K | | PSTRGB [148] | 指代 | 1.4K | FSS-1000 [99] | 指代 | 3.7K | | SUIM [70] | 指代 | 2.5K | DAVIS 2017 [14] | 指代 | 2.4K | | MyFood [142] | 指代 | 1.0K | OCID-VLG [165] | 指代 | 3.0K | | CO-SKEL [71] | 指代 | 0.3K | PIC [112] | 指代 | 8.7K | | YouTube VOS 2022 [192] | 指代 | 11.7K | LaPa [113] | 指代 | 8.1K | | MVTec D2S [39] | 指代 | 2.5K | DeepFashion2 [46] | 指代 | 20.8K | | VizWiz-FewShot [164] | 指代 | 3.0K | MattingHumanHalf [3] | 指代 | 6.9K | | Trans10K [190] | 指代 | 2.7K | ReaSeg [94, 199] | 推理 | 132.6K | | Coco interactive psalm [220] | 交互 | 400.0K | | | |

表 12 用于训练的二值掩码分割数据集。

| 数据集 | 任务 | 帧数 | 数据集 | 任务 | 帧数 | | :— | :— | :— | :— | :— | :— | | COCONut-XL [34] | 通用 | 587.3K | IDD-1/2 [168] | 通用 | 14.0K | | Cityscapes [28, 29] | 通用/GCG | 3.0K/2.1K | IDDAv3 [5] | 通用/GCG | 6.2K/1.1K | | Hypersim [137] | 通用/GCG | 46.8K/30.4K | Mapillary Vistas [45] | 通用 | 18.0K | | EntityV2 [127] | 通用/GCG | 31.7K/6.1K | NuScenes [40] | 通用 | 65.5K | | Trashcan [65] | 通用 | 5.9K | 51WORLD [1] | 通用/GCG | 11.6K/3.5K | | Pidray [215] | 通用 | 29.5K | StreetHazards [62] | 通用/GCG | 6.2K/1.0K | | ZeroWaste-f [11] | 通用 | 2.9K | KITTI [183] | 通用/GCG | 5.0K/3.5K | | LVIS [52] | 通用 | 56.7K | TAS500 [120] | 通用/GCG | 0.4K/0.3K | | UDD5/6 [23] | 通用/GCG | 0.2K/0.1K | TTPLA [2] | 通用 | 1.2K | | LoveDA [174] | 通用/GCG | 2.5K/1.6K | VIPSeg [121] | 通用/GCG | 66.8K/59.5K | | GranDf [131] | GCG | 1.0K | RefCOCOg [82] | GCG | 19.3K | | PSG [196] | GCG | 27.8K | Flickr30k [126] | GCG | 148.2K |

表 13 用于训练的通用和 GCG 分割数据集。

数据处理 对于表 12 中展示的所有数据集,我们将所有分割注释标准化为二值掩码。在这些标准化的二值掩码中,像素值 (255, 255, 255) 表示前景目标区域,而像素值 (0, 0, 0) 对应于图像背景区域。对于表 13 中总结的数据集,我们首先解析每张图像内的实例级分割注释,以生成所有现有对象实例的单独掩码。然后,根据预定义的采样策略为每个实例分配唯一的 RGB 颜色。最后,将所有彩色实例掩码混合到纯黑色背景上,以构建最终的全景分割掩码。具体而言,我们使用贪婪最远点采样在离散 RGB 立方体 $[0, 255]^3$ 中预定义 200 个颜色锚点,该采样方法迭代地最大化每个新锚点与先前选定锚点之间的最小欧几里得距离,从而提高实例颜色之间的视觉可区分性。生成的锚点按其 RGB 值排序并分配连续索引。对于具有 K 个标注实例的图像,我们从有序调色板中确定性地采样 K + 1 个大致均匀分布的颜色,将前 K 个颜色按处理顺序分配给实例,并保留最后的黑色 (0, 0, 0) 用于背景。

提示设计 对于二值掩码分割任务,包括指代分割和推理分割,我们采用下面详述的提示模板。与之前的任务不同,我们采用 Binary mask 来存储二值掩码的文件路径。

35

第 36 页

{ "image ": 输入图像 , "seg ": 二值掩码 , " conversations ": [ {" from ": "human", "value ": "<image >指令 "}, {" from ": "gpt", "value ": "好的 , <SEG >.", } ] }

对于二值掩码组中的交互式分割,我们通过添加额外的视觉提示图像来扩展提示模板。Prompt image 表示视觉提示图像的文件路径,Prompt type 指定其类别,其中 <prompt type> 充当相应的符号标记。 { "image ": [输入图像 , 提示图像 ], "seg ": 二值掩码 , " visual_prompt_type ": 提示类型 , " conversations ": [ {" from ": "human", "value ": "<image >指令 <prompt_type ><image >"}, {" from ": "gpt", "value ": "好的 , <SEG >.", } ] }

对于通用分割和 GCG 分割,我们采用如下所述的独特提示模板。 { "id": 样本 ID , "image ": 输入图像 , "caption ": 描述 , "seg ": 全景掩码 , " num_instances ": 实例数量 , (仅适用于通用分割) " conversations ": [ {" from ": "human", "value ": "<image >指令 "}, {" from ": "gpt", "value ": "目标文本 <SEG >",} ] }

全景掩码表示带颜色编码的目标掩码的文件路径。可选的实例数量记录掩码中的实例数量。描述捕获输入图像的描述性文本内容。目标文本包含目标文本输出,其中枚举了所有单独的实例及其分配的特定颜色。受 ConsistCompose [146] 的启发,我们采用颜色-实例绑定格式,其中每个实例都明确配对一个唯一的颜色。具体而言,我们使用轻量级标记来标准化输入和输出格式,如表 14 所示。

标记 字段 功能

<p>…</p> 短语或标签 实例类别。

<box> 提示类型 边界框视觉提示类型。

<point> 提示类型 点视觉提示类型。

<mask> 提示类型 掩码视觉提示类型。

<scribble> 提示类型 涂鸦视觉提示类型。

<color>…</color> 颜色 实例特定的 RGB 颜色值。

表 14 分割任务中使用的代表性分隔符。

分割任务通过指定分割目标、输出格式以及(在需要时)交互方式的特定任务指令来构建。对于每种不同的分割任务,我们从其相应的指令池中提取一个代表性样本进行说明,如表 15 所示。

已发布数据集 由于二值掩码数据集可以使用我们的转换流程从公共注释中重建,因此我们发布了用于通用分割和 GCG 分割的生成和整理资源。

36

第 37 页

任务 指令

通用分割 为类别 <p>person</p>, …, <p>rug</p> 生成全景分割掩码。定位所有实例, 严格按照 <p>instance-no<color>(R,G,B)</color></p> 分配颜色,输出全景掩码。

GCGSeg 简要描述图像内容,返回与描述各部分匹配的交错分割掩码。

RefSeg 可视化图像中 <p>standing person</p> 的二值分割。

ReaSeg 输出 <p>the ball that can only be hit into the hole at last</p> 的分割掩码。

InterSeg 根据参考区域 <point><image></point> 生成分割掩码。

表 15 分割任务的指令模板。

A.4 多视角视觉几何

数据组成 多视角重建和相机位姿估计建立在紧密相关的多视角几何数据源之上。所有采用的数据集总结于表 16。与深度和表面法线预测类似,多视角重建需要密集的几何监督。我们利用 LingBot-Depth [159] 补全稀疏深度数据并生成密集点图。

标注类型 数据集 任务 领域 帧数 来源

Hypersim [136] 重建/相机位姿 室内 44K/44K 合成 IRS [176] 重建/相机位姿 室内 66K/66K 合成 TartanAir [180] 重建/相机位姿 室外 246K/246K 合成 SceneNet RGB-D [119] 重建/相机位姿 室内 5058K/5058K 合成 AriaSyntheticENV [8] 重建 室内 5919K 合成 BlendedMVG [204] 重建 室外 115K 合成 密集型 MegaSynth [73] 重建/相机位姿 室外 323K/323K 合成 MvsSynth [68] 重建 / 相机位姿 室外 12K/12K 合成 OmniObject3D [186] 重建/相机位姿 以物体为中心 595K/595K 合成 Objaverse [31] 相机位姿 室内 1400K 合成 CO3Dv2 [133] 相机位姿 以物体为中心 1500K Colmap DeMoN-MVE [166] 相机位姿 室外 20K 合成

ScanNetV2 [30] 重建/相机位姿 室内 241K/241K LiDAR ScanNet++ [205] 重建/相机位姿 室内 813K/813K LiDAR 稀疏型 DL3DV [108] 重建/相机位姿 真实场景 3462K/3462K Colmap WildRGB-D [188] 重建/相机位姿 真实场景 8026K/8026K LiDAR

表 16 用于重建和相机位姿估计任务的多视角视觉几何数据集总结。

数据处理 对于多视角重建,我们在场景级别构建数据样本。每个场景由一系列视图组成,这些视图以可转换为共享坐标系中点图的格式存储,包括 RGB 图像、深度图和相机轨迹。为了提供适合监督且无需依赖掩码策略的数据,我们确保所有输入视图都具有密集深度图。具体而言,我们首先过滤掉深度图中包含超过三分之二无效像素的视图。然后,我们使用 LingBot-Depth [159] 补全和细化稀疏深度图。此外,超过数据集特定阈值的深度值被视为无效,该阈值根据源数据集的不同在 30 到 80 米之间。对于相机位姿估计,我们预测相对于初始参考帧的所有后续帧的相机到世界外参。这些参数被解耦为旋转和平移分量。具体而言,旋转通过四元数表示,而平移被表述为由单位方向向量和尺度大小组成的混合表示。此外,我们采用保留的数值令牌,范围从 <1000> 到 <1000>,覆盖 -1000 到 1000 的数值范围。遵循此设计,所有四元数分量和单位方向向量元素均乘以因子 1000。对于尺度项,我们将其有效物理范围限制在 [0.01 m, 10 m],并定义令牌 <1> 对应实际长度 1 cm。

提示设计 与其他视觉任务不同,多视角重建以在线方式生成训练样本。因此,我们将场景级别的数据集元数据嵌入到提示中,其详细结构阐述如下。

场景 ID 表示每个场景的唯一标识符,而图像序列存储该场景中的所有图像路径。对于

37

第 38 页

{ "id": Scene_id , "image ": [ Image_sequence ], "depth ": [ Depth_sequence ], " trajectory ": [ Camera_trajectory ], " conversations ": [ {" from ": "human", "value ": "Instruction "}, {" from ": "human", "value ": "Instruction "}, … ] }

配对几何信息,其中 Depth sequence 保存与每个图像条目匹配的深度图路径,Camera-trajectory 提供逐帧对应的相机参数。

作为多图像理解任务,相机位姿估计通过以下提示模板定义。 { "id": Sample_id , "image ": [ Image_sequence ], " conversations ": [ {" from ": "human", "value ": "<image >… < image > Instruction "}, {" from ": "gpt", "value ": "<camerapose_sequence >"} ] }

Image sequence 保存输入图像序列中所有帧的完整图像路径集合。<image>…<image> 中 <image> 占位符的重复次数与 Image sequence 的长度一致。Camerapose-sequence 包含从第二帧到最后一帧的相对相机位姿,且所有条目均遵循以下相同格式。 <frame ><quat ><x><y><z><w></quat ><offset ><x><y><z></offset ><scale ><value ></scale ></frame >

为了提高格式一致性和数值精度,我们根据表 17 中指定的规则,使用保留标记对相机位姿记录进行编码。

我们在表 18 中展示了用于多视图视觉几何的部分指令。

标记 字段 功能

<-1000>…<1000> 数值 这些专用的特殊标记编码范围在 [−1000, 1000] 内的所有标量值。

<frame>…</frame> 视图条目 在多视图视觉几何任务中分隔每个视图相机位姿记录的特殊标记。

<quat>…</quat> 旋转 分隔相机位姿四元数旋转参数的特殊标记。

<offset>…</offset> 平移 分隔相机平移或偏移参数的特殊标记。

<scale>…</scale> 缩放 分隔用于解码相机位姿或几何的缩放元数据的特殊标记。

表 17 用于相机位姿编码的保留标记。

已发布数据集 相机位姿示例可以直接从具有相机轨迹的公共多视图数据集中组装。对于重建任务,我们公开发布了使用 LingBot-Depth [159] 预处理的稀疏标注数据集,而密集标注数据集可以通过发布的转换管道进行重建。

A.5 SN-VC-50M 发布摘要

我们在表 19 中总结了已发布的 SN-VC-50M 资源。发布内容涵盖四个任务家族,包括 10 种任务类型下的 73 个数据集-任务条目。具体而言,发布的数据包括 1890 万帧结构化视觉理解数据、130 万帧分割数据、1730 万帧密集几何预测数据以及 1250 万帧多视图视觉几何数据。为了避免重复分发公共数据集中的原始 RGB 图像,已发布的训练示例保留了图像文件路径,而非重新分发原始图像。

38

第 39 页

任务 指令

相机位姿 使用第一帧作为参考帧,并按照原始输入顺序,输出所有后续帧相对于它的相对位姿。旋转以四元数格式 <quat>[x,y,z,w]</quat> 表示。平移方向以单位向量格式 <offset>[x,y,z]</offset> 表示,该格式仅编码方向信息,无绝对物理含义。平移尺度以数值格式 <scale>value</scale> 表示。每个目标帧的结果均用 <frame>…</frame> 标签包裹,标签外不得包含任何额外字符、空格或换行符。

多视图重建 从多张输入图像中重建场景,并为每个视图输出一个稠密 3D 坐标图,所有视图均对齐至第一个相机的视角。

从 RGB 图像中重建 3D 场景,并生成在共享坐标系中对齐的 XYZ 点图。

表 18 多视图视觉几何的指令模板。

数据集 任务 帧数 数据集 任务 帧数

结构化视觉理解 分割

APTv2 [202] 点 14.7K COCONut-XL [34] 通用 587.3K BDD100K [208] 点 68.0K Cityscapes [28, 29] 通用/全局上下文 3.0K/2.1K DOTAv2 [36] 点 1.7K Hypersim [137] 通用/全局上下文 46.8K/30.4K DeepFashion [114] 点 112.6K EntityV2 [127] 通用/全局上下文 31.7K/6.1K EgoObjects [224] 点 49.9K Trashcan [65] 通用 5.9K FAIR1M [157] 点 16.0K Pidray [215] 通用 29.5K FSC147 [6] 边界框/视觉 1.8K/1.1K ZeroWaste-f [11] 通用 2.9K GroceryStore [88] 边界框/视觉 1.8K/1.1K LVIS [52] 通用 56.7K HumanParts [100] 点 7.0K IDD-1/2 [168] 通用 14.0K ImageNetPart [58] 点 10.2K IDDAv3 [5] 通用/全局上下文 6.2K/1.1K NuImages [41] 点 55.0K Mapillary Vistas [45] 通用 18.0K Objects365 [144] 点/指代 1077.1K/3589.0K NuScenes [40] 通用 65.5K PACO-LVIS [129] 点 26.9K 51WORLD [1] 通用/全局上下文 11.6K/3.5K PixMo-Points [32] 边界框 0.1K StreetHazards [62] 通用/全局上下文 6.2K/1.0K SA-1B [86] 边界框/点/ 3119.0K/1949.4K/ KITTI [183] 通用/全局上下文 5.0K/3.5K 视觉 3116.6K TAS500 [120] 通用/全局上下文 0.4K/0.3K V3Det-OVD [172] 点 60.8K UDD5/6 [23] 通用/全局上下文 0.2K/0.1K VisDrone [227] 点 6.4K TTPLA [2] 通用 1.2K OpenImages [92] 指代 4034.0K LoveDA [174] 通用/全局上下文 2.5K/1.6K BLIP3-OCR [194] OCR 1582.0K VIPSeg [121] 通用/全局上下文 66.8K/59.5K GranDf [131] 全局上下文 1.0K RefCOCOg [82] 全局上下文 19.3K PSG [196] 全局上下文 27.8K Flickr30k [126] 全局上下文 148.2K

密集几何预测 多视图视觉几何

Taskonomy [213] 深度/法线 2000.0K/2000.0K ScanNetV2 [30] 重建 241.0K ScanNet++ [205] 深度/法线 813.0K/813.0K ScanNet++ [205] 重建 813.0K COCO2017 [107] 深度/法线 78.0K/79.0K DL3DV [108] 重建 3462.0K SA-1B [86] 深度/法线 4442.0K/4462.0K WildRGB-D [188] 重建 8026.0K Objects365 [144] 深度/法线 1317.0K/1317.0K

表 19 SN-VC-50M 语料库开源发布概览。数据集按任务族分组,每项报告发布的任务类型和帧数。

B 其他定性结果

本节提供了补充主要定量评估的其他定性示例。这些示例旨在展示 SenseNova-Vision 在文本、图像以及混合文本-图像任务(包括结构化视觉理解、密集几何预测、分割和多视图视觉几何)方面的广泛能力。它们还说明了同一模型如何在遵循不同任务指令的同时,确保输出符合附录 A 中描述的协议且可解码。

39

第 40 页

对象

指代

指向

提示

视觉

关键点

OCR

布局 与 GUI

图 14 结构化视觉理解任务的额外定性结果。

40

第 41 页

图 15 密集几何预测任务的额外定性结果。

41

第 42 页

天花板 天花板 墙-砖 墙 树 墙

墙-砖 天花板 墙 盆栽植物-0书-1 墙-木 柜子

窗帘 灯 书-0架子 灯 镜子 草 墙-瓷砖 椅子-1 椅子-0 椅子-2 墙 微波炉-0 人-0 冰箱-0 笔记本电脑-0 长颈鹿-1长颈鹿-2 长颈鹿-0 人-1 柜台 沙发-0 桌子

门 瓶子-0瓶子-1瓶子-2 人-0 树 岩石 墙-瓷砖 水槽-1 柜子柜台 水槽-0 全景分割

刀-0 泥土 毛巾 烤箱-0 手提包-0 蛋糕-0 地板-木 地毯 餐桌-0 长颈鹿-3 水 地板 地毯 地板 桌子

人 椅子 天空 天空 地板 建筑 栅栏 墙 树 餐桌 树

建筑 人 墙 草

披萨 人 汽车 公交车 消防栓 背包 人 纸 杯子 语义 道路 人行道 网球拍

人行道 地板 网

天空-0 天空-0 天空-0 天空-0

电线-0 路灯-0 房子-0 旗帜-6 电线杆-0

Electricpole-3 Tree -0 High-rise-0 sculputre-0 Electricpole-2 sculputre-3 electricpole-0 bus-0 sculputre-1 flag-0 Flag-3 Flag-1 flag-4 tree-0 house-0 Train -0 flag-2 stone-0 Flag-0 Person-2 flag-5 flag-1 shrub-0 paper-0 Car-0 bus-0 Grass-0 sculputre-0 car-0GCG sculputre-0 sculputre-33 sculputre-6 man-0 sculputre-8 person-3 sculputre-10 person-0 sculputre-7 sculputre-14sculputre-16sculputre-9 Shrub-0 sculputre-11 soil-0 sculputre-15 Railroad-0 bicycle-0 sculputre-4 sunkfence-0sunkfence-0 sculputre-12 Shrub-0 gravel-0 Fence-0 streetlight-0 road-0

When sailing on water, adjusting In a music class. Which musical sails is necessary for

控制图片中的哪个物体可以被利用来…… 在较冷的季节,这件被一位女士穿着的物体可以为正式着装增添优雅,并作为配饰提供保暖,抵御恶劣天气…… 视频编辑……

主要中心人物:年长男性 左侧女孩 中央斑马:可以看到大部分 左侧长颈鹿 指代 涂鸦 框 框 交互式 点

图 16 分割任务的额外定性结果。

42

第 43 页

输入视图 重建输出 输入视图 重建输出

室内

室外

以物体为中心

(OOD) 环境 游戏

图 17 多视图重建的其他定性结果。

C 具有挑战性及语言定义视觉任务的探索性结果

本节展示了在具有挑战性的案例和语言定义的视觉任务上的探索性定性结果。在我们的框架中,视觉任务由语言指令指定,这些指令定义了任务目标和预期的输出格式。这里的示例是超出主要定量评估的探索性测试,涵盖了组合式密集预测、专用掩码格式、细粒度分割以及具有挑战性的密集几何预测。

图 18 展示了在不同无分类器引导(CFG)设置下的组合深度和法线预测。图 19 和图 20 展示了具有更专用输出要求的示例,包括十六进制颜色分割和带有结构化文本掩码输出的密集实例分割。图 21 展示了在细粒度物体查询下的 VGD 分割结果。图 22 展示了在具有挑战性的场景上的密集几何预测结果,包括视觉上模糊的模式以及透明或折射表面。

43

第 44 页

CFG_text 1 2 4 8 指代深度估计

提示:请仅估计 <p>左侧的鸟<p> 的深度。输出为灰度图像,像素值范围为 0-255。将非目标像素设置为黑色。

2 CFG_image

4

CFG_text 1 2 4 8 指代深度估计

提示:请仅估计 <p>右下角跪着的男孩<p> 的深度。 输出为灰度图像, 像素值范围为 0-255。将非 目标像素设置为黑色。

2 CFG_image

4

CFG_text 1 2 4 8 交互式法线估计

提示:估计 </point>[0.6, 0.4]</point> 周围的局部法线,并将法线平滑传播到相应区域,同时将不相关的像素抑制为黑色。输出应显示连续的颜色变化,没有离散区域,这与分割结果不同。

2 CFG_image

4

CFG_text 1 2 4 8 交互式法线估计

提示:估计 </point>[0.6, 0.4]</point> 周围的局部法线,并将法线平滑传播到相应区域,同时将不相关的像素抑制为黑色。输出应显示连续的颜色变化,没有离散区域,这与分割结果不同。

2 CFG_image

4

图 18 不同 CFG 强度下组合密集预测的定性结果。在输入图像和指令固定的情况下,某些文本-图像 CFG 配置产生的输出与组合视觉任务一致,而其他配置则使结果偏向于深度图、法线图或分割图预测。

44

第 45 页

问:生成输入的语义分割可视化。桌子上方和左下角的木板区域为 #E6194B。背景为 #3CB44B。

原始图像 预期色彩映射 SenseNova-Vision

问:生成输入的语义分割可视化。杯子为 #3CB44B。刀具为 #4363D8。餐桌为 #FFE119。背景为 #F58231。

原始图像 预期色彩映射 SenseNova-Vision

问:生成输入的语义分割可视化。人物为 #FFFFFF。冲浪板为 #E6194B。背景为 #3CB44B。

原始图像 预期色彩映射 SenseNova-Vision

图 19 十六进制色彩分割的定性结果。这些示例测试模型是否能够同时满足语义分割和语言指定的色彩格式要求。尽管大多数目标区域被正确定位,但生成的掩码在精确 RGB 值上可能与请求的十六进制色彩存在偏差,或者为某些区域分配了错误的色彩。

45

第 46 页

问:生成该图像的实例分割可视化结果。每个<p>番茄</p>应着不同颜色。首先,列出请求中提到的每个可见<p>番茄</p>实例,并为每个<p>番茄</p>分配不同的纯色。按以下确切格式重新格式化它们:<p>tomato-no<color>(R,G,B)</color></p>。然后,使用这些实例标签和颜色输出交错的实例分割掩码。 标题输出:<p>tomato</p><bbox>[0.229, 0.000, 0.363, 0.026]</bbox><bbox>[0.575, 0.000, 0.631, 0.034]</bbox><bbox>[0.944, 0.153, 0.999, 0.282]</bbox><bbox>[0.976, 0.326, 0.999, 0.377]</bbox><bbox>[0.353, 0.394, 0.520, 0.550]</bbox><bbox>[0.355, 0.000, 0.454, 0.075]</bbox><bbox>[0.436, 0.506, 0.612, 0.634]</bbox><bbox>[0.768, 0.000, 0.892, 0.086]</bbox><bbox>[0.448, 0.000, 0.592, 0.098]</bbox><bbox>[0.244, 0.016, 0.379, 0.117]</bbox><bbox>[0.000, 0.356, 0.074, 0.440]</bbox><bbox>[0.000, 0.471, 0.067, 0.590]</bbox><bbox>[0.044, 0.515, 0.219, 0.648]</bbox><bbox>[0.000, 0.620, 0.046, 0.736]</bbox><bbox>[0.000, 0.783, 0.177, 0.945]</bbox><bbox>[0.000, 0.100, 0.103, 0.216]</bbox><bbox>[0.646, 0.107, 0.779, 0.212]</bbox><bbox>[0.353, 0.812, 0.493, 0.930]</bbox><bbox>[0.182, 0.218, 0.338, 0.314]</bbox><bbox>[0.000, 0.026, 0.108,…

原始图像 检测标注 SenseNova-Vision (标注了56个实例) (分割了0个实例)

问:生成该图像的实例分割可视化结果。每个<p>路锥</p>应着不同颜色。首先,列出请求中提到的每个可见<p>路锥</p>实例,并为每个<p>路锥</p>分配不同的纯色。按以下确切格式重新格式化它们:<p>cone-no<color>(R,G,B)</color></p>。然后,使用这些实例标签和颜色输出交错的实例分割掩码。 标题输出:<p>cone-0<color>(255, 255, 255)</color></p>, <p>cone-1<color>(255, 13, 156)</color></p>, <p>cone-2<color>(254, 255, 111)</color></p>, <p>cone-3<color>(254, 91, 109)</color></p>, <p>cone-4<color>(253, 252, 203)</color></p>, <p>cone-5<color>(253, 118, 60)</color></p>, <p>cone-6<color>(252, 169, 180)</color></p>, <p>cone-7<color>(250, 164, 59)</color></p>, <p>cone-8<color>(235, 199, 37)</color></p>, <p>cone-9<color>(227, 91, 21)</color></p>, <p>cone-10<color>(223, 54, 75)</color></p>, <p>cone-11<color>(221, 250, 166)</color></p>, <p>cone-12<color>(214, 102, 75)</color></p>, <p>cone-13<color>(211, 109, 136)</color></p>, <p>cone-14<color>(206, 145, 60)</color></p>, <p>cone-15<color>(205, 22, 197)</color></p>, <p>cone-16<color>(202, 67, 131)</color></p>, <p>cone-17<color>(199, 65, 41)</color></p>, <p>cone-18<color>(192, 198, 133)</color></p>, <p>cone-19<color>(187, 109,…

原始图像 检测标注 SenseNova-Vision (标注了57个实例) (分割了65个实例)

手动修复后的标题

使用检测标注中的路锥重写标题。 仅路锥实例接收颜色;排除人物区域。

<p>cone-0<color>(255, 255, 255)</color></p>, <p>cone-1<color>(255, 13, 156)</color></p>, <p>cone-2<color>(254, 255, 111)</color></p>, <p>cone-3<color>(254, 43, 232)</color></p>, <p>cone-4<color>(253, 248, 53)</color></p>, <p>cone-5<color>(252, 212, 150)</color></p>, <p>cone-6<color>(251, 60, 171)</color></p>, <p>cone-7<color>(235, 199, 37)</color></p>, <p>cone-8<color>(227, 91, 21)</color></p>, <p>cone-9<color>(222, 62, 206)</color></p>, <p>cone-10<color>(218, 133, 209)</color></p>, <p>cone-11<color>(212, 56, 249)</color></p>, <p>cone-12<color>(206, 227, 221)</color></p>, <p>cone-13<color>(205, 22, 197)</color></p>, … <p>cone-56<color>(0, 197, 154)</color></p> 共57个条目

修复后的提示词移除了多余的颜色槽位,并将分割重点集中在路锥上。

图20 密集实例分割的定性结果。这些示例要求模型在结构化文本中枚举每个实例及其颜色代码,然后渲染相应的颜色编码掩码。结果表明,结构化文本对于掩码生成至关重要:模型可能会输出检测风格的记录而非实例颜色代码,或者过度预测文本实例并在掩码中包含非目标区域;在手动修复实例列表以仅包含标注的目标实例后,掩码输出变得更加集中和准确。

46

第 47 页

问:识别所有与视觉提供的 <p>object1</p><bbox>[0.305, 0.693, 0.461, 0.826]</bbox> 属于同一类别的对象。生成分割可视化,并为每个识别出的类别 <p>object1</p> 分配不同的颜色。首先,枚举请求中提到的每个可见 <p>object1</p> 实例,并为每个 <p>object1</p> 分配不同的颜色。然后按以下确切格式重新格式化:<p>object1<color>(R,G,B)</color></p>。接着以交错方式响应…… Caption 输出:<p>object1<color>(255, 255, 255)</color></p>, <p>object1<color>(255, 13, 156)</color></p>, <p>object1<color>(254, 255, 111)</color></p>, <p>object1<color>(254, 91, 109)</color></p>, <p>object1<color>(253, 252, 203)</color></p>, <p>object1<color>(253, 118, 60)</color></p>, <p>object1<color>(252, 169, 180)</color></p>, <p>object1<color>(250, 164, 59)</color></p>, <p>object1<color>(235, 199, 37)</color></p>, <p>object1<color>(227, 91, 21)</color></p>, <p>object1<color>(223, 54, 75)</color></p>, <p>object1<color>(221, 250, 166)</color></p>, <p>object1<color>(214, 102, 75)</color></p>, <p>object1<color>(211, 109, 136)</color></p>, <p>object1<color>(206, 145, 60)</color></p>, <p>object1<color>(205, 22, 197)</color></p>, <p>object1<color>(202, 67, 131)</color></p>, <p>object1<color>(199, 65, 41)</color></p>, <p>object1<color>(192, 198, 133)</color></p>, <p>object1<color>(187, 109,…

原始数据 检测标注 SenseNova-Vision (标注了 118 个实例) (分割了 65 个实例)

手动修复后的 Caption 使用检测标注中的实例重写 Caption。 每个检测到的绵羊被分配一个独特的颜色。

<p>object1<color>(255, 255, 255)</color></p>, <p>object1<color>(255, 13, 156)</color></p>, <p>object1<color>(254, 255, 111)</color></p>, <p>object1<color>(254, 91, 109)</color></p>, <p>object1<color>(253, 252, 203)</color></p>, <p>object1<color>(253, 118, 60)</color></p>, <p>object1<color>(252, 169, 180)</color></p>, <p>object1<color>(250, 164, 59)</color></p>, <p>object1<color>(235, 199, 37)</color></p>, <p>object1<color>(227, 91, 21)</color></p>, <p>object1<color>(223, 54, 75)</color></p>, <p>object1<color>(221, 250, 166)</color></p>, <p>object1<color>(214, 102, 75)</color></p>, <p>object1<color>(211, 109, 136)</color></p>, … <p>object1<color>(158, 124, 2)</color></p> 共 118 条记录

修复后的提示提供了足够的颜色槽位,以分离密集的绵羊实例。

图 21 视觉接地(VGD)分割的定性结果。视觉提示指定了目标类别,模型被期望分割所有同类别的实例。当生成的 Caption 提供的实例颜色槽位过少时,密集对象可能在掩码输出中合并;使用足够颜色条目的 Caption 进行手动修复可改善实例级别的分离效果。

47

第 48 页

图 22 密集几何预测的定性结果。这些示例涵盖了视觉错觉模式以及透明或反射表面,在这些场景中,纹理线索、反射和物理几何结构之间可能存在冲突。这些案例表明,深度或法线预测可能会遵循具有误导性的外观线索,或者在反射层和扭曲图案周围变得模糊不清。

48

发表评论