三分钟导读:该论文提出RINO框架,将视觉输入和输出统一为RGB格式,利用冻结的通用图像编辑器以零样本方式处理深度估计、分割、姿态估计及条件生成等20多种视觉任务。
英文题目:Let RGB Be the Language of Vision
论文出处:arXiv 每日论文精选 · arXiv:2607.12450
原始论文:PDF / 论文页面
对应视频标题:RINO:让RGB成为视觉的统一语言|推荐指数:★★★★
这篇论文解决什么问题?
传统视觉模型需要为不同任务(如深度、分割、姿态)设计特定的表示格式、编码器、解码器和适配器,导致模型难以像语言模型那样通过统一接口灵活迁移和交互。
核心创新
- 提出统一的RGB视觉接口,将理解(RGB输出)和生成(RGB输入)任务统一为RGB-to-RGB编辑问题。
- 无需任务特定模块(编码器/解码器/适配器),仅通过参数-free的RGB转换和文本提示实现零样本迁移。
- 在条件生成任务中,将结构化条件(如深度图、语义图、姿态骨架)直接作为普通RGB图像输入,替代传统的ControlNet类适配器。
方法概览
提出RINO(RGB In and RGB Out)范式,将所有视觉信号(深度、法线、掩码、姿态等)编码为RGB图像作为输入或输出。使用冻结的通用图像编辑器(如Qwen-Image-Edit, FireRed, LongCat)作为黑盒,通过任务特定的文本提示驱动,无需任何任务特定的微调或额外参数。
逐图理解论文
深度估计的零样本表现

在深度估计任务中,RINO在DIODE-indoor上达到δ1=0.938,AbsRel=0.076。评估采用仿射不变协议,与直接输出度量深度的模型不可直接比较。定性结果显示,模型能恢复场景几何结构,但精度受限于基础编辑器的视觉先验。
表面法线与语义分割

表面法线估计在DIODE-indoor上Mean误差为17.25度。语义分割在Pascal VOC上mIoU达44.69,Cityscapes上为24.30。RINO将分割视为RGB生成任务,无需专用编码器,仅通过提示词引导编辑器输出语义掩码,性能接近零样本专家模型。
检测与全景分割

在COCO上,RINO实现零样本检测,box AP50为16.3,mask AP50为13.9。全景分割在COCO上SQ达74.3,但RQ较低。这表明模型擅长空间分割,但在实例关联与识别上弱于专用模型。检测任务使用Oracle-class设置,未评估开放集识别能力。
姿态估计与指代表达

人体姿态估计在COCO上PA PCK@0.2为0.795,能恢复连贯的人体结构。指代表达理解在RefCOCOg上Prec@0.5为51.8。RINO将骨架和文本描述统一为RGB输入,编辑器直接生成对应掩码,无需姿态头或特定训练,展示了跨模态理解的潜力。
开放词汇与条件生成

开放词汇实例分割在SA-Co/Gold上表现接近专家模型。条件生成方面,深度条件生成RMSE-255为33.83,FID为19.44。语义图条件生成在ADE20K上mIoU为46.24。RINO将结构化条件作为普通RGB图像输入,替代ControlNet适配器,实现零样本生成。
实验与关键结果
- 深度估计:在NYUv2, KITTI, DIODE-indoor上进行零样本单目深度估计。
- 表面法线估计:在NYUv2, iBims-1, DIODE-indoor上进行零样本法线估计。
- 语义分割:在Cityscapes, Pascal VOC, ADE20K上进行零样本语义分割。
- 目标检测与实例分割:在COCO上进行零样本检测与实例分割。
- 全景分割:在Cityscapes, ADE20K, COCO上进行零样本全景分割。
- 人体姿态估计:在COCO val2017上进行零样本2D姿态估计。
- 指代表达理解与分割:在RefCOCOg上进行零样本REC和RES。
- 开放词汇实例分割:在SA-Co/Gold上进行零样本实例分割。
- 条件生成:在MultiGen-20M, ADE20K, COCOStuff, Human-Art上进行深度、语义图、姿态、实例图及Canny边缘条件生成。
- 深度估计:在NYUv2, KITTI, DIODE-indoor上进行零样本单目深度估计。
- 表面法线估计:在NYUv2, iBims-1, DIODE-indoor上进行零样本法线估计。
- 语义分割:在Cityscapes, Pascal VOC, ADE20K上进行零样本语义分割。
- 目标检测与实例分割:在COCO上进行零样本检测与实例分割。
- 全景分割:在Cityscapes, ADE20K, COCO上进行零样本全景分割。
- 人体姿态估计:在COCO val2017上进行零样本2D姿态估计。
- 指代表达理解与分割:在RefCOCOg上进行零样本REC和RES。
- 开放词汇实例分割:在SA-Co/Gold上进行零样本实例分割。
- 条件生成:在MultiGen-20M, ADE20K, COCOStuff, Human-Art上进行深度、语义图、姿态、实例图及Canny边缘条件生成。
阅读时需要注意
- 零样本性能受限于基础编辑器的视觉先验,与领域专家模型仍有差距。
- 开放词汇分割中缺乏显式的存在检测器,导致IL_MCC较低。
- 全景分割中识别和实例关联能力(RQ)弱于空间分割质量(SQ)。
- Canny边缘控制的零样本性能显著低于专门训练的控制器。
- 深度估计评估采用仿射不变协议,与直接输出度量深度的模型(如Vision Banana)不可直接比较。
- 生成任务中编辑器输出分辨率(1024px)与基线(512px)不同,需注意分辨率对FID等指标的影响。
- 检测/分割任务使用Oracle-class和Oracle-count设置,未评估开放集识别能力。
关联工作
- Vision Banana:提出将理解任务转化为RGB生成的概念,但基于专有模型;RINO在开源编辑器上验证并统一输入输出。(第 1 页)
- ControlNet++:作为条件生成任务的训练基线,用于对比RINO零样本生成的可控性和质量。(第 12 页)
- Depth Anything:作为深度估计领域的专家模型基线。(第 4 页)
- Mask2Former:作为语义分割和实例分割的专家模型基线。(第 7 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
让 RGB 成为视觉的语言
Timing Yang1, Jinrui Yang2, Xinlong Li1∗, Yuhan Wang2, Haoran Li3, Yanqing Liu2, Guoyizhe Wei1, Jixuan Ying1∗, Chen Wei4, Rama Chellappa1, Yuyin Zhou2, Cihang Xie2, Alan Yuille1, Feng Wang1†
1约翰斯·霍普金斯大学, 2加州大学圣克鲁兹分校, 3卡内基梅隆大学, 4莱斯大学 †项目负责人, ∗访问学生
本文提出了一种视觉模型的统一公式化方法,其中除自然图像之外的各种形式的视觉信息(如掩码、深度图和其他结构化视觉信号)均表示为 RGB 图像,而通用视觉任务可转换为常见的 RGB 到 RGB 图像编辑问题。在此范式下,不同类型的视觉信息在内部与自然图像共享相同的编码和解码架构及参数,使得单个模型能够通过统一的视觉接口跨任务迁移,其方式类似于语言模型在文本上的运作方式。我们将这种公式化称为 RGB 输入与 RGB 输出(RINO)。RINO 建立在通用的图像编辑骨干网络之上,无需任务特定的微调,在密集理解任务(如分割和深度估计,我们将输出统一为 RGB)和密集条件生成任务(如姿态到图像生成,我们将输入统一为 RGB)上均展现出鲁棒且具有竞争力的零样本性能。我们希望本研究能为通用统一的视觉-语言系统提供有益见解,其中多样化的视觉任务可以通过共享的视觉语言来表达、解释和解决。代码可在 https://github.com/yangtiming/RINO 获取。 2026年7月14日 日期:2026年7月12日
1 引言 [cs.CV] 在大型语言模型(LLMs)中,文本作为几乎所有任务的通用输入和输出格式,使得经过良好训练的语言模型能够灵活支持多样化的下游应用。然而,在视觉领域,这种程度的统一仍远未实现。不同类型的视觉信息通常需要其特定的表示形式,例如自然图像使用 RGB,分割使用独热掩码,深度使用连续几何地图。这种表示形式的多样性带来了直接挑战:对于每种格式,我们通常需要设计专用的编码器和解码器,以及额外的适配器组件来连接它们。模型结构和信息表示方面的这些障碍使得视觉模型难以像语言模型那样支持自由形式的交互,并往往限制了其超越单个任务有效泛化的能力,使得大多数视觉基础模型仍更接近于特定任务的专家,而非真正通用的视觉学习者 (Kirillov et al., 2023; Yang et al., 2024a; Rombach et al., 2022; Radford et al., 2021; Oquab et al., 2024)。
这自然引出一个问题:是否存在一种方式,使视觉信息在统一形式下能够像文本一样自由交流?换句话说,视觉能否发展出自己的通用接口?有趣的是,最近的研究提供了有用的见解。Vision Banana (Gabeur et al., 2026) 提出使用生成模型来解决分割、深度估计和表面法线估计等理解问题;例如,它不是以传统格式预测分割掩码,而是基于输入图像在 RGB 空间中生成掩码。这种生成式理解范式已在开源图像模型上得到进一步验证,并显示出强大的鲁棒性 (Liu et al., 2026)。受这些观察结果的启发,我们询问是否可以使用 RGB 来统一视觉信息的输入和输出形式,发挥类似于 LLM 中文本的作用,并形成一种人类可以自然交互的通用“视觉语言”。
为此,我们提出了 RGB 输入与 RGB 输出(RINO),这是一种统一的视觉表示学习范式,将所有视觉输入和输出信号表示为 RGB 格式。与仅在特定任务上评估的 Vision Banana 不同,
arXiv:2607.12450v1
1
第 2 页
传统视觉 RINO
不同的表示 → 不同的架构 一切转换为 RGB RGB 输入(条件) RGB 输出(结果) 估计(理解) 深度 法线 深度 深度 法 估计 图像 头 头 … 编码器 实例 全景 实例 头 头 分割
实例 & 检测 全景 全景 分割 图像编辑器
分割 深度 生成(合成) 物体 检测 掩码 深度 编码器 编码器 图像 … 边界框 姿态 解码器 人类 编码器 编码器 姿态
检测 姿态 … … 任务特定提示 任务特定提示
图 1 RINO 在单一 RGB 接口下统一视觉。左侧:传统视觉将每个任务与其自身的表示和架构绑定,使用任务特定的编码器和头或生成器。右侧:RINO 将所有输入和输出渲染为 RGB,因此一个冻结的图像编辑器由任务特定提示驱动,处理估计(深度、法线、分割、检测、姿态、指代)以及相应的条件生成,无需任何任务特定模块。
对于理解任务,我们旨在研究这一范式的泛化能力有多广泛:我们在涵盖多个领域的 20 多个视觉任务/基准上评估 RINO,包括密集理解、3D 估计和条件生成,其中所有视觉输入和输出均以 RGB 格式表示,并与自然图像共享相同的编码/解码系统。我们在预训练的图像编辑模型(如 Qwen-Image-Edit (Wu et al., 2025))之上构建 RINO,且不引入任何辅助参数。对于超出自然图像类型的每种视觉信息,我们仅采用轻量级、无参数的数据转换模块,在 RGB 与其他格式(如分割掩码和深度图)之间转换信号,而在模型内部,所有这些视觉信息都被纯粹地解释或生成为图像。
通过构建这一标准的 RGB/文本到 RGB/文本框架,我们惊讶地发现 RINO 能够以零样本方式广泛处理所有测试的理解和生成任务。它稳定地产生具有视觉意义的结果,并在不同应用中取得了与领域专家模型相当的定量性能。例如,在深度估计方面,RINO 达到了 0.938 的 δ1 分数,接近专门针对深度估计训练的专家模型 Depth Anything (Yang et al., 2024a)。我们进一步发现,对于传统上依赖具有输入特定编码器和适配器的 ControlNet-like (Zhang et al., 2023) 方法的条件图像生成,RINO 在现有评估协议下建立了新的零样本最先进状态。从视觉上看,RINO 的理解和生成结果在人类偏好研究中也获得了高分,表明基于 RGB 的统一在人类交互方面具有巨大潜力,并可能作为视觉的可迁移“语言”。
总体而言,这项工作为 RGB 作为视觉统一接口的可行性提供了有力证据。我们提出了构建大规模、多任务统一视觉-语言系统的初步尝试,并观察到在单一基于 RGB 的公式下具有广泛任务迁移的高度积极迹象。在此阶段,我们的 RINO 模型仍存在局限性:其强大的迁移能力依赖于通用的图像编辑骨干网络,如 Qwen-Image-Edit (Wu et al., 2025) 和 FireRed (FireRed Team, 2025),这些模型的网页规模预训练数据可能已经包含多样化的视觉信号,如分割掩码和深度图。然而,这些信号在预训练分布中可能只占非常小的一部分,这可能导致 RINO 在某些特定应用上与领域专家模型之间存在性能差距。我们将当前的完全零样本版本称为 RINO-Zero。在未来的工作中,我们将使用标准图像编辑数据混合一定比例的 RGB 格式的非自然视觉数据(如分割掩码和深度图)对现有的图像编辑模型进行指令微调,以便在更广泛的任务范围内引入 RINO 框架。我们希望这项工作能为未来的统一视觉-语言系统提供有益的见解,并帮助将该范式扩展到更广泛的视觉领域,包括 3D 视觉、视频和世界模型。
2
第 3 页
2 方法:面向视觉的统一 RGB 接口
我们在统一的 RGB/文本到 RGB/文本范式下,构建通用的视觉-语言理解与生成任务。给定输入图像 $x_{img}$ 和输入文本提示 $x_{text}$,多模态图像编辑模型 $F$ 生成输出图像 $y_{img}$ 以及可选的输出文本响应 $y_{text}$:
$$ y_{img}, y_{text} = F(x_{img}, x_{text}), \quad (1) $$
其中 $F$ 是通用的预训练图像编辑模型,例如 Qwen-Image-Edit (Wu et al., 2025)。在我们的框架中,我们不引入任务特定的头(heads)、编码器、解码器或适配器参数。相反,所有视觉信息均以 RGB 格式表示,并由 $F$ 内部的同一图像编码器和解码器进行处理。这使得自然图像、分割掩码、深度图、姿态图、边缘图以及其他结构化视觉信号能够共享相同的视觉接口。我们在图 1 中展示了我们的整体框架。
对于视觉理解任务,输入 $x_{img}$ 是自然图像,输入 $x_{text}$ 指定要执行的任务。输出图像 $y_{img}$ 是目标结构化视觉信息的 RGB 表示。例如,在语义分割中,$y_{img}$ 是 RGB 分割掩码;在深度估计中,$y_{img}$ 是 RGB 格式的 depth map。可选的文本输出 $y_{text}$ 可用于解释预测结果或描述生成的视觉结果。在评估 $y_{img}$ 时,我们使用无参数转换器将 RGB 输出转换为相应的任务特定格式。例如,RGB 分割图可以通过预定义的颜色映射转换为类别标签,RGB 深度可视化可以通过预定义的解码规则转换为深度图。这些转换器仅用于模型推理之前或之后。所有视觉推理均通过统一的 RGB 接口在基础模型 $F$ 内部完成。
对于视觉生成任务,输入 $x_{img}$ 可以是 RGB 格式的视觉条件,如语义布局、姿态骨架、深度图、边缘图或掩码。文本提示 $x_{text}$ 描述所需的生成或编辑行为。模型随后生成输出图像 $y_{img}$,通常是一个遵循给定视觉条件和文本指令的自然图像。这种公式化将条件生成视为视觉理解的对偶问题。在理解中,模型将自然图像映射为 RGB 格式的结构化预测。在生成中,模型将 RGB 格式的结构化条件映射回自然图像。例如,如果语义分割可以公式化为图像到 RGB-掩码的预测,那么分割条件图像生成可以公式化为 RGB-掩码到图像的生成。类似地,姿态估计可以视为图像到 RGB-姿态的预测,而姿态引导生成可以视为 RGB-姿态到图像的生成。
基础模型。我们在三个开源图像编辑器上运行 RINO-Zero:Qwen-Image-Edit (Wu et al., 2025)、LongCat-Image-Edit (Ma et al., 2025) 和 FireRed-Image-Edit (FireRed Team, 2025)。Qwen-Image-Edit 基于 Qwen-Image,这是一个 200 亿参数的多模态扩散 Transformer (MMDiT),它将 Qwen2.5-VL 视觉语言模型与用于图像 token 的 VAE 耦合。LongCat-Image-Edit 是美团推出的紧凑型 60 亿参数双语(中-英)编辑器,基于混合 MMDiT / 单流 DiT 设计,配有 Qwen2.5-VL 文本编码器,并在较小规模下针对效率进行了调整。FireRed-Image-Edit 来自 FireRed 团队,通过双流多模态扩散设计扩展了开源文本到图像基础模型,以实现高保真、遵循指令的编辑。对于这三个模型,我们使用发布的权重作为黑盒 RGB 到 RGB 编辑器,不添加、移除或微调任何层。
3 实验
3.1 理解任务:将输出统一为 RGB
深度估计。对于深度估计,我们提示图像编辑器将输入图像重绘为灰度深度可视化,其中近处表面更亮,远处表面更暗。然后,我们从生成图像的逐像素亮度恢复稠密相对深度图。在此任务中,我们在零样本设置下使用固定的采样配置,利用 Qwen-Image-Edit (Wu et al., 2025) 和 LongCat-Image-Edit (Ma et al., 2025) 进行评估。由于生成式编辑器产生具有未知尺度和偏移的相对深度,我们遵循标准的仿射不变评估协议。对于每张图片,我们在计算 $\delta_1$ 和 AbsRel 之前,通过最小二乘法对真实深度拟合尺度和偏移。表 1 遵循视差空间,或
第 4 页
表 1 在视差空间仿射不变协议下的零样本单目深度估计。专家模型分数引用自 Yang 等人 (2024b)(ViT-L);$\delta_1 \uparrow$ / AbsRel$\downarrow$。粗体:各指标最佳。
NYUv2 KITTI DIODE-indoor
Method $\delta_1$ AbsRel $\delta_1$ AbsRel $\delta_1$ AbsRel
相对深度专家模型 MiDaS V3.1 (Birkl et al., 2023) 0.980 0.048 0.850 0.127 0.942 0.075 Depth Anything V1 (Yang et al., 2024a) 0.981 0.043 0.947 0.076 0.952 0.066 Depth Anything V2 (Yang et al., 2024b) 0.979 0.045 0.946 0.074 0.952 0.066
生成式图像编辑模型 Qwen-Image-Edit 0.927 0.086 0.901 0.093 0.938 0.076 LongCat-Image-Edit 0.840 0.130 0.849 0.130 0.849 0.129
表 2 在 Liu 等人 (2026) 的线性深度空间仿射不变协议下(基于真值深度的逐图像最小二乘缩放+平移)的相同编辑模型。†Vision Banana (Gabeur et al., 2026) 报告的是无对齐的原始度量深度,仅作为参考,不具直接可比性。$\delta_1 \uparrow$ / AbsRel$\downarrow$。粗体:各指标最佳编辑模型。
NYUv2 KITTI DIODE-indoor iBims-1
Method $\delta_1$ AbsRel $\delta_1$ AbsRel $\delta_1$ AbsRel $\delta_1$ AbsRel
度量参考(指令微调) Vision Banana† 0.948 0.081 0.915 0.107 0.917 0.108 0.934 0.078
生成式图像编辑模型(线性仿射不变) Qwen-Image-Edit 0.792 0.156 0.413 0.329 0.872 0.122 0.824 0.133 LongCat-Image-Edit 0.832 0.135 0.454 0.325 0.825 0.146 0.843 0.129
图像 真值 Qwen LongCat Depth Anything V2
图 2 DIODE-indoor(顶部)和 KITTI(底部)上的定性零样本深度估计。
逆深度是 MiDaS 和 Depth Anything (Ranftl et al., 2022; Yang et al., 2024a) 使用的约定,而表 2 遵循 Marigold (Ke et al., 2024) 使用的线性深度空间约定。
表 1 在视差空间中比较了两种编辑模型与三个相对深度专家模型:MiDaS V3.1 (Birkl et al., 2023)、Depth Anything V1 (Yang et al., 2024a) 和 Depth Anything V2 (Yang et al., 2024b),专家模型结果引用自 Yang 等人 (2024b)。尽管这两种编辑模型均未针对深度估计进行训练,也未配备任何深度特定参数,但 Qwen-Image-Edit 的表现令人惊讶地接近专用模型。在 DIODE-indoor (Vasiljevic et al., 2019) 上,它与专家模型仅相差几个 $\delta_1$ 点(0.938 对比 0.952),而在 NYUv2 (Silberman et al., 2012) 和 KITTI (Geiger et al., 2012) 上则显示出大约五个点的差距。表 2 报告了线性深度空间中的相同比较,其中在 KITTI 和 iBims-1 (Koch et al., 2018) 等宽范围场景上的性能有所下降。我们在该表中包含 Vision Banana (Gabeur et al., 2026) 作为参考,因为它预测的是无逐图像对齐的原始度量深度,因此与仿射不变编辑模型的输出不具直接可比性。定性可视化结果如图 2 所示。我们观察到,RINO(RGB In and RGB Out,统一视觉接口范式)的预测能够清晰地反映输入图像的深度布局。
4
第 5 页
表 3 在 NYUv2、iBims-1 和 DIODE-indoor 上的零样本表面法线估计。我们报告平均误差(Mean↓)和中位数误差(Median↓)(单位:度)。加粗表示:按指标划分的最佳编辑模型。
NYUv2 iBims-1 DIODE-indoor
Method Mean Median Mean Median Mean Median
表面法线专家模型(引用值;参见图注) DSINE (Bae and Davison, 2024) 16.4 8.4 17.1 6.1 18.45 13.87 Marigold (Ke et al., 2024) 20.86 11.13 18.46 8.44 16.67 12.08 StableNormal (Ye et al., 2024) 19.71 10.53 17.25 8.06 13.70 9.46 Lotus-2 (He et al., 2025) 16.9 — 15.4 — 18.58 — Vision Banana (Gabeur et al., 2026) 17.78 8.88 — — 13.82 11.56
生成式图像编辑模型( ours,零样本,RGB→RGB) Qwen-Image-Edit 20.21 13.46 20.66 12.03 21.99 18.14 FireRed-Image-Edit 17.73 10.99 18.62 10.38 17.25 13.64
图像 真实值 (GT) Qwen FireRed Lotus-2
图 3 NYUv2(顶部)和 iBims-1(底部)上的定性零样本表面法线估计结果。
表面法线估计。表面法线估计遵循与深度估计相同的 RGB 到 RGB 范式。我们提示编辑模型将输入场景重绘为标准法线图,其中表面方向由颜色编码,并将生成的 RGB 图像解码回逐像素单位法线。我们在零样本设置下评估 Qwen-Image-Edit 和 FireRed-Image-Edit。图像编辑模型输出的法线采用未知的坐标系约定,我们遵循 Liu et al. (2026) 的方法进行一次解析,并报告标准的平均和中位数角度误差(度)。DSINE (Bae and Davison, 2024) 通过相同的管道作为专家参考模型进行评分。表 3 报告了 NYUv2、iBims-1 和 DIODE-indoor 上的表面法线估计结果。FireRed 是一个通用的图像编辑模型,没有针对法线的特定训练或参数,它在所有三个数据集上都是最强的编辑模型。它在平均角度误差上仅略逊于 DSINE 专家模型,尽管 DSINE 在像素级别上仍然更清晰,如其较低的中位数误差所反映的那样。这些结果表明,零样本图像编辑模型在平均表面方向预测方面可以接近专用的法线估计模型,但在局部精度方面仍有改进空间。定性可视化结果如图 3 所示。
语义分割。我们遵循 Liu et al. (2026) 的方法,仅在提示中包含当前图像真实标签中存在的类别。为了减轻常见的生成伪影,如颜色抖动和噪声像素,我们在颜色解码后应用一个轻量级的无参数精炼阶段,包括局部多数滤波和小连通分量去除。为了处理 ADE20K 的大标签空间,我们引入了一种分层分割策略:模型首先预测 10 个超类的掩码,然后在相应区域内生成细粒度类别。除非另有说明,所有图像编辑骨干网络均使用 12 个去噪步骤,CFG = 5.0,以及相同的精炼管道。LongCat-Image-Edit 由于生成稳定性较低,采用 50 个去噪步骤。我们使用三个标准
5
第 6 页
表 4 Cityscapes 和 Pascal VOC 上的语义分割结果。加粗和下划线表示在生成式图像编辑器中最佳和第二佳的结果。
Pascal VOC Cityscapes
Method mIoU ↑ mAcc ↑ aAcc ↑ mIoU ↑ mAcc ↑ aAcc ↑
Zero-shot Segmentation FC-CLIP (Yu et al., 2023) — — — 56.29 65.42 78.46 MaskCLIP (Dong et al., 2023; Barsellotti et al., 2024) 38.85 45.21 71.63 — — — GroupViT (Xu et al., 2022a) 52.37 56.97 79.28 — — — OVSegmentor (Xu et al., 2023) 53.82 58.36 80.51 — — —
Generative image editors (zero-shot, RGB→RGB) Vision Banana (Gabeur et al., 2026) — — — 69.90 — — Direct Editing Baseline (Liu et al., 2026) — — — 23.02 42.63 64.14 Ours (Qwen-Image-Edit) 44.69 48.00 85.17 24.30 44.38 66.59 Ours (FireRed-Image-Edit) 45.17 61.47 80.82 21.11 42.70 58.00 Ours (LongCat-Image-Edit) 49.68 66.90 83.53 13.42 26.72 49.23
表 5 ADE20K 在 10 类粗粒度和标准 150 类别设置下的语义分割结果。加粗和下划线表示在生成式图像编辑器中最佳和第二佳的结果。
ADE20K (10 classes) ADE20K (150 categories)
Method mIoU ↑ mAcc ↑ aAcc ↑ mIoU ↑ mAcc ↑ aAcc ↑
Zero-shot Segmentation MaskCLIP (Dong et al., 2023) 39.26 50.52 65.66 23.78 31.54 50.27 FC-CLIP (Yu et al., 2023) 42.17 53.11 67.05 34.13 40.86 59.62
Generative image editors (ours, zero-shot, RGB→RGB) Qwen-Image-Edit 40.37 53.51 67.35 12.57 20.93 44.85 FireRed-Image-Edit 34.76 46.79 54.77 13.61 22.80 38.95 LongCat-Image-Edit 19.33 30.02 26.37 7.43 14.60 26.79
图像 真实标签 Qwen LongCat FireRed SAM 3
图 4 Cityscapes(顶部)、Pascal VOC(中部)和 ADE20K(底部)上的零样本语义分割。
分割指标:平均交并比(mIoU)、平均类别准确率(mAcc)和全像素准确率(aAcc)。定量结果报告在 Cityscapes (Cordts et al., 2016)、Pascal VOC (Everingham et al., 2010) 和 ADE20K (Zhou et al., 2017) 的验证集上。
表 4 显示 RINO 实现了与零样本专家模型相当的语义分割性能
6
第 7 页
表 6 COCO 上的目标检测和实例分割(框和掩码 AP,%)。编辑器的运行方式为我们零样本在每类轮廓的 oracle-class(真实类别)、oracle-count(真实数量)协议下进行,相同的色块同时生成框和掩码(所有点 AP,在 80 个类别上宏平均)。粗体:最佳编辑器。
| | box AP | | | mask AP | | | :— | :—: | :—: | :—: | :—: | :—: | | Method | AP50 | AP | AP50 | AP | | Supervised detect + segment models (AP quoted from their papers) | | | | | | Mask DINO (Li et al., 2023a) | — | 50.5 | — | 46.0 | | Cascade Mask R-CNN (Cai and Vasconcelos, 2021) | 61.7 | 43.3 | 58.6 | 37.1 | | Mask R-CNN (He et al., 2017) | 63.5 | 42.8 | 60.5 | 38.3 | | Mask2Former (Cheng et al., 2022) | 69.4 | 49.3 | 69.4 | 46.1 | | Generative image editors (ours, zero-shot, RGB→RGB) | | | | | | Qwen-Image-Edit | 16.3 | 9.4 | 13.9 | 7.2 | | FireRed-Image-Edit | 14.9 | 8.9 | 12.9 | 6.9 | | LongCat-Image-Edit | 6.3 | 3.2 | 4.9 | 2.4 |
| Image | GT | Qwen | LongCat | FireRed | Mask2Former | | :—: | :—: | :—: | :—: | :—: | :—: | | | | | | | |
图 5 COCO val2017 上的目标检测和实例分割定性结果。
模型,其 mAcc 和 aAcc 甚至在 PASCAL VOC 上超越了分割专家。表 5 进一步在 ADE20K 上评估了粗粒度和细粒度分割。我们观察到,在 10 类的粗粒度设置下,RINO 甚至优于语义分割专家 MaskCLIP。这些结果表明 RINO 在密集预测方面具有巨大潜力:该模型已经捕捉到了丰富的图像语义,但可能需要更多的领域特定知识,以便更好地将其预测与细粒度类别名称(如 ADE20K 中的 150 个类别)对齐。可视化结果如图 4 所示。
目标检测与实例分割。目标检测和实例分割是具有挑战性的视觉任务,因为它们不仅需要识别每个像素的语义,还需要区分同一类别内的不同实例。因此,开放词汇零样本模型在包含 80 个物体类别的 COCO 等数据集上往往表现不佳。在 RINO 中,我们通过每类轮廓绘制来执行这两项任务。对于每个存在的类别,我们提示编辑器在黑色背景上将其实例绘制为实心白色色块,同时指定预期的实例数量。然后我们对输出进行阈值处理,并使用形态学开运算分离接触的色块。每个连通分量被视为一个实例:色块定义其掩码,其紧密边界框定义检测。因此,单个预测可以同时用于目标检测和实例分割的评估。查询的类别和实例数量取自真实标签,即 oracle-class(真实类别)和 oracle-count(真实数量)设置,以将定位能力与开放集识别隔离开来。我们以零样本方式在 COCO val2017 上评估了 Qwen-Image-Edit (Wu et al., 2025)、FireRed-Image-Edit (FireRed Team, 2025) 和 LongCat-Image-Edit (Ma et al., 2025)。
如表 6 和图 5 所示,尽管这些任务对零样本模型来说极具挑战性,但 RINO 仍能产生具有视觉意义的预测,达到 16.3% 的 box AP50 和 13.9% 的 mask AP50。这些结果仍低于域内专家模型(例如 box AP50 为 63.5% 的 Mask R-CNN),但它们表明零样本图像编辑模型已经能够达到非平凡水平的定位和实例级
第 8 页
表 7 在 Cityscapes、ADE20K 和 COCO 验证集上的零样本全景分割结果。监督专家模型报告其论文中的全景质量 (PQ, %);编辑单元格报告分割质量 (SQ, %) 并额外在括号中给出 (PQ/RQ)(我们的测量值)。粗体:最佳 SQ 结果。
| Method | Cityscapes | ADE20K | COCO | | :— | :— | :— | :— | | Supervised specialists | | | | | EoMT (Kerssies et al., 2025) | — | 51.7 | 58.3 | | ViT-P (Shahabodini et al., 2025) | 70.8 | 51.9 | 58.0 | | OneFormer (Jain et al., 2023) | 67.2 | 49.8 | 57.9 | | Mask2Former (Cheng et al., 2022) | 66.6 | 48.1 | 57.8 | | Generative image editors | | | | | Qwen-Image-Edit | 64.8 (13.6/17.4) | 71.5 (12.3/15.9) | 74.3 (11.9/15.5) | | FireRed-Image-Edit | 55.9 ( 8.7/11.2) | 67.2 ( 9.4/12.5) | 70.7 ( 9.1/12.1) | | LongCat-Image-Edit | 55.4 ( 1.0/ 1.4) | 67.6 ( 6.7/ 8.4) | 75.2 ( 6.9/ 8.8) |
图像 | GT | Qwen | LongCat | FireRed | Mask2former
图 6 COCO(顶部)和 ADE20K(底部)上的定性零样本全景分割结果。
在 COCO 上的预测。图 5 进一步表明,相对较低的定量分数通常是由特定于任务的失败模式引起的,例如过度检测或过度分割,正如在 Qwen 和 FireRed 示例中观察到的那样。我们相信,通过少量特定于任务的微调,这些问题可以得到显著缓解,并期望 RINO 的未来版本能够匹配专家模型的性能。
全景分割。我们提示编辑器用纯色绘制每个区域,每个类别使用一种命名颜色,背景使用黑色。然后我们通过最近颜色匹配来解码输出:stuff 类别被视为单个分割,而 thing 类别被分割为连通分量。遵循零样本真值类别协议,提示中仅指定每个图像中存在的类别。我们评估了 Qwen-Image-Edit (Wu et al., 2025)、FireRed-Image-Edit (FireRed Team, 2025) 和 LongCat-Image-Edit (Ma et al., 2025)。我们报告全景质量 (PQ) 及其两个组成部分:分割质量 (SQ) 和识别质量 (RQ),其中 PQ = SQ × RQ。PQ 是全景分割的标准指标:SQ 衡量匹配区域的掩码质量,而 RQ 衡量识别和匹配质量。
表 7 报告了 Cityscapes (Cordts et al., 2016)、ADE20K (Zhou et al., 2017) 和 COCO (Lin et al., 2014) 上的结果。在编辑器中,Qwen-Image-Edit 表现最佳,其次是 FireRed 和 LongCat。值得注意的是,尽管没有进行全景特定的训练,这些编辑器已经显示出强大的零样本空间分割能力。它们的预测掩码通常与对象和区域边界很好地对齐,从而获得较高的 SQ 分数(Qwen SQ 65–74)。主要的局限性在于识别和实例关联,这反映在较低的 RQ 分数上(Qwen RQ 15–17)。在许多情况下,连贯的区域被正确分离但被分配了错误的语义类别,或者由于特定于任务的解码歧义而被分割成多个部分。这个问题在 thing 类别中最为明显,相邻的实例和小物体经常被合并或遗漏;在 Cityscapes 上,Qwen 在 stuff 上达到 22.4 PQ,但在 things 上仅为 1.5 PQ。这些结果表明,RINO 已经能够零样本地产生具有结构意义的全景预测,而剩余的差距主要由特定于任务的识别和实例匹配因素驱动,而非空间分割质量。这也得到了图 6 中可视化的支持。
8
第 9 页
表 8 COCO val2017 单人裁剪图像上的零样本 2D 人体姿态估计。PCK 基于边界框归一化,并以绝对图像坐标(raw)和经过每图像相似性对齐(PA)两种形式报告,后者通过去除缩放和平移来隔离姿态结构。专用的姿态估计器在相同的自上而下(top-down)协议下进行评估,以便直接比较。
| Method | raw PCK@0.05 | PA PCK@0.05 | PA PCK@0.2 | | :— | :— | :— | :— | | 2D-pose specialists (run under our protocol) | | | | | ViTPose (Xu et al., 2022b) | 0.868 | 0.889 | 0.984 | | Keypoint R-CNN (He et al., 2017) | 0.732 | 0.765 | 0.919 | | YOLO-pose (Maji et al., 2022) | 0.730 | 0.782 | 0.953 | | Mesh-recovery specialist | | | | | SAM 3D Body (Yang et al., 2026b) | 0.868 | — | — | | Generative image editors | | | | | LongCat-Image-Edit | 0.233 | 0.282 | 0.767 | | Qwen-Image-Edit | 0.060 | 0.235 | 0.774 | | FireRed-Image-Edit | 0.047 | 0.243 | 0.795 |
GT ViTPose FireRed raw FireRed decoded LongCat raw LongCat decoded Qwen raw Qwen decoded
图 7 定性零样本 2D 人体姿态估计。
人体姿态估计。遵循自上而下(top-down)协议,使用真实边界框对每个人进行裁剪,并填充至固定画布。我们提示编辑器在黑色背景上将裁剪区域重绘为 OpenPose 风格(Cao et al., 2021)的彩色骨架,然后从输出中解码 COCO-17 关键点。由于图像编辑器不能可靠地复现固定的调色板,我们使用与颜色无关的解码器:关节候选点作为前景距离变换的峰值提取,并通过与标准直立骨架模板匹配进行标记。未引入任何关键点头或辅助参数。我们以零样本方式在 COCO val2017 单人裁剪图像上评估 Qwen-Image-Edit (Wu et al., 2025)、FireRed-Image-Edit (FireRed Team, 2025) 和 LongCat-Image-Edit (Ma et al., 2025)。由于生成式编辑器可能预测出具有未知相似性变换的姿态,我们以两种协议报告基于边界框归一化的 PCK@τ:raw,遵循专用估计器使用绝对图像坐标;以及 PA,在每图像缩放和平移拟合到真实值之后,从而隔离姿态结构。
表 8 报告了 COCO val2017 上的结果。这些编辑器已经产生了非平凡的零样本姿态预测,通常能恢复连贯的人体布局和合理的肢体结构。尽管精确的关键点定位仍然具有挑战性,但生成的骨架在视觉上具有意义,并且无需任何特定于姿态的头或训练即可解码为 COCO-17 关键点。在相似性变换下的性能提升
第 10 页
表 9 在 RefCOCOg (UMD split) 验证集上的指代表达式理解 (REC) 和分割 (RES) 结果。REC:框 Prec@0.5;RES:cIoU/mIoU。加粗:每项指标下表现最佳的编辑器。
REC RES
Method Prec@0.5 cIoU mIoU
Supervised grounding specialists LAVT (Yang et al., 2022) — 61.2 — UNINEXT (Yan et al., 2023) 88.7 74.7 — OneRef (Xiao et al., 2024) 88.1 — 73.2
Generative image models Vision Banana (Gabeur et al., 2026) — 73.8 — Qwen-Image-Edit 51.8 40.3 45.3 LongCat-Image-Edit 47.7 35.0 38.7 FireRed-Image-Edit 47.6 35.7 41.6
图像 真实标签 (GT) Qwen LongCat FireRed LAVT
表达式:“站在两只大象右侧的一只大象”
表达式:“黄色的马桶”
表达式:“一辆后斗抬起的橙色自卸卡车”
图 8 RefCOCOg 上的定性指代表达式理解和分割结果。
对齐进一步表明,这些模型捕捉到了人体姿态的粗略结构,即使绝对定位并不完美。这些结果表明,在 RINO 框架下,RGB 骨架预测是姿态估计的一种可行接口。通过轻量级的任务特定微调,我们预计这种能力将显著增强并更加可靠。定性可视化结果如图 7 所示。
指代表达式理解与分割。我们通过图像编辑实现语言接地(language grounding)。对于每个指代表达式,我们提示编辑器将所指对象覆盖为实心红色,同时保持所有其他像素不变。然后,我们计算编辑输出与输入图像之间的差异,并保留最大的变化连通分量作为预测:其像素定义分割掩码,其紧密边界框定义理解结果。编辑器仅接收图像和表达式,无法访问边界框、类别或实例数量,且未引入接地头(grounding head)。我们在 RefCOCOg UMD 验证集上(Mao et al., 2016; Nagaraja et al., 2016)零样本评估了 Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit。我们报告了两个子任务的标准指标:指代表达式理解 (REC) 的框 Prec@0.5,如果预测框的 IoU 至少为 0.5,则预测正确;指代表达式分割 (RES) 的累积 IoU (cIoU),计算方式为数据集池化
10
第 11 页
表 10 SA-Co/Gold 属性子集上的开放词汇实例分割(cgF1 = 100·pmF1·IL_MCC)
请注意,pmF1 是门控无关的,我们获得了与专家模型相当的结果。SAM 3 是监督学习的;Vision Banana 添加了 MLLM 存在门。粗体:最佳编辑结果。
| Method | pmF1 | IL_MCC | cgF1 | | :— | :— | :— | :— | | 监督专家模型(引用值,非零样本迁移) | | | | | SAM 3 (Carion et al., 2025) | 72.0 | 0.76 | 54.9 | | 零样本迁移 | | | | | gDino-T (Liu et al., 2024) | 47.3 | 0.29 | 13.8 | | Vision Banana + Gemini (Gabeur et al., 2026) | 68.7 | 0.86 | 58.8 | | 生成式图像编辑器( ours,零样本,RGB→RGB) | | | | | Qwen-Image-Edit | 39.8 | 0.04 | 1.7 | | FireRed-Image-Edit | 30.9 | 0.01 | 0.2 | | LongCat-Image-Edit | 17.3 | 0.09 | 1.6 |
| Image | GT | Qwen | LongCat | FireRed | SAM3 | | :— | :— | :— | :— | :— | :— | | | | | | | | | expr: “quartz countertop” | | | | | | | expr: “stainless steel stove” | | | | | | | expr: “transmission tower” | | | | | |
图 9 SA-Co/Gold 上的定性开放词汇实例分割。
交并比(intersection-over-union)。未预测到的目标得分为零。
如表 9 所示,开源编辑器实现了从自由形式语言到图像区域的有意义的零样本定位。尽管它们的分割精度仍低于 Vision Banana (Gabeur et al., 2026),后者的 cIoU 与 UNINEXT 和 OneRef 等监督定位器相当,但它们已经能够在没有任何特定定位头、边界框监督或任务特定微调的情况下,定位并分割所指对象。这比 oracle-class 分割设置要困难得多,因为模型必须联合解析指代表达式,识别目标实例,并将定位区域表示为 RGB 编辑。结果表明,通用图像编辑器已经具备通过 RGB 编辑接口将语言与像素级视觉定位联系起来的不平凡能力。图 8 中的定性示例进一步表明,许多预测在视觉上可解释且空间结构良好,这表明在 RINO 框架下改进指代理解是一个有前景的方向。
开放词汇实例分割(SA-Co)。对于每个查询,我们提示编辑器一次以重绘图像为二值掩码:所有匹配该短语的实例被涂成纯黑色,所有其他区域被涂成纯白色,如果短语不存在,输出应为全白。我们将黑色像素视为前景,并使用连通分量将其分割为实例,丢弃小的连通分量,并按面积对每个实例进行评分。模型未提供类别列表或实例数量;查询是一个单一的自由形式名词短语,该短语可能出现也可能不出现于图像中,要求编辑器同时执行概念定位
第 12 页
以及存在检测。未引入任何任务特定的头部(head)。我们在 SA-Co/Gold (Carion et al., 2025) 的属性划分(attributes split)上对 Qwen-Image-Edit (Wu et al., 2025)、FireRed-Image-Edit (FireRed Team, 2025) 和 LongCat-Image-Edit (Ma et al., 2025) 进行零样本(Zero-shot)评估。我们报告了 SA-Co 的三个官方指标:pmF1,即在 IoU 阈值从 0.5 到 0.95 范围内平均的正向微掩码 F1(positive-only micro mask-F1);IL_MCC,即针对每个查询的存在/不存在预测的 Matthews 相关系数;以及 cgF1 = 100 · pmF1 · IL_MCC,这是结合分割质量和存在检测的总评分(headline score)。我们以百分比形式报告 pmF1 和 cgF1。
表 10 报告了属性子集上的结果。在各类编辑器中,Qwen-Image-Edit 表现最佳,其次是 FireRed 和 LongCat。虽然这些编辑器的 pmF1 尚未达到专用开放词汇分割模型的水平,但它们无需任何类别列表、检测器或分割头部,即可为自由形式的视觉概念生成连贯的零样本掩码。主要弱点在于开放集存在检测:由于编辑器倾向于在查询短语不存在时仍绘制掩码,IL_MCC 保持在接近零的水平,进而抑制了总评分 cgF1。这一局限性反映了缺乏显式的存在分类器,而非 RGB 空间分割的完全失败;事实上,Vision Banana 也依赖外部多模态大语言模型(MLLM)门控机制才能获得有意义的 IL_MCC。这些结果表明,通用图像编辑器可以通过 RGB 编辑接口定位命名概念,但可靠的“不存在”情况拒绝(absent-case rejection)仍是未来改进的重要方向。定性可视化结果如图 9 所示。
3.2 生成任务:统一输入为 RGB
表 11 MultiGen-20M 深度验证划分上的深度条件图像生成。外部行是来自 ControlNet++ 和 ControlAR 的论文报告锚点;我们的编辑器行是在共享提示词、种子 0、步数 steps=8 和 CFG=2.5 条件下进行的零样本 RGB 输入/RGB 输出编辑运行。RMSE-255↓ 衡量 DPT-Large 深度一致性,FID↓ 衡量图像质量,CLIPScore↑ 衡量文本对齐度。
| Method | N | RMSE-255↓ | FID↓ | CLIPScore↑ | | :— | :— | :— | :— | :— | | 训练好的可控生成模型 | | | | | | ControlNet++ (Li et al., 2024a) | 5000 | 28.32 | 16.66 | 32.09 | | ControlAR (Li et al., 2024b) | 5000 | 29.01 | 14.61 | – | | ControlNet (SD1.5) (Zhang et al., 2023) | 5000 | 35.90 | 17.76 | 32.45 | | GLIGEN (Li et al., 2023b) | 5000 | 38.83 | 18.36 | 31.75 | | T2I-Adapter (Mou et al., 2023) | 5000 | 48.40 | 22.52 | 31.46 | | Uni-ControlNet (Zhao et al., 2023) | 5000 | 40.65 | 20.27 | 31.66 | | UniControl (Qin et al., 2023) | 5000 | 39.18 | 18.66 | 32.45 | | 生成式图像编辑器( ours,零样本,RGB 深度输入) | | | | | | Qwen-Image-Edit | 5000 | 33.83 | 19.44 | 30.15 | | FireRed-Image-Edit | 5000 | 37.55 | 21.43 | 30.34 | | LongCat-Image-Edit | 5000 | 36.50 | 27.18 | 28.09 |
深度条件图像生成。 我们将深度到图像的生成作为 RGB 输入/RGB 输出可控生成的直接测试。遵循 MultiGen-20M 深度协议,每个验证样本提供一个 RGB 深度图和文本描述。RINO 将深度图作为普通图像条件传递给图像编辑器,并指示其合成相应的自然图像。未添加深度编码器、ControlNet 分支、适配器或任务特定的解码器;模型仅看到 RGB 条件图像和自然语言指令。对于主论文对比,我们在相同的 5,000 张图像验证划分上,使用相同的提示词、种子和推理设置(steps=8, CFG=2.5 以及共享的简短质量提示词),对 Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit 进行评估。我们遵循 ControlNet++ 的深度条件生成评估协议 (Li et al., 2024a)。条件保真度通过从生成的 RGB 图像中提取深度(使用 DPT-Large (Ranftl et al., 2021))并计算与输入条件在 0–255 深度空间中的 RMSE 来衡量。图像质量通过相对于真实验证图像的 FID 来衡量,文本对齐度通过 CLIPScore 来衡量。RMSE 和 FID 越低越好;CLIPScore 越高越好。外部行是论文报告的锚点,而非本地重新评分的输出。我们还注意到一个分辨率方面的注意事项:我们管道中的编辑器输出是从 512 像素的 MultiGen 控制图以其原生 1024 像素分辨率生成的,而公开的深度控制基线报告的是 512 像素。下采样至 512 像素的健全性检查保持了相同的定性结论,但最直接对齐的跨方法指标是
12
第 13 页
输入 真实标签(GT) Qwen LongCat FireRed ControlNet++
图 10 MultiGen-20M 上的定性深度条件生成结果。向所有三个零样本编辑器提供相同的 RGB 深度图和文本提示。这三个示例表明,RGB 输入/RGB 输出的接口能够保留粗略的场景几何结构,而不同编辑器骨干网络在纹理真实感、语义保真度和布局漂移方面存在差异。
DPT-Large RMSE-255 条件得分。
表 11 比较了零样本 RINO 与经过训练的可控生成系统。在零样本编辑器中,Qwen 给出了最佳平衡结果:RMSE-255 为 33.83,FID 为 19.44,CLIPScore 为 30.15。FireRed 的 CLIPScore 略高(30.34),但深度保真度较差,而 LongCat 保持了合理的 RMSE,但在 FID 和 CLIPScore 方面落后。Qwen 仍落后于最强的训练控制模型,如 ControlNet++ 和 ControlAR,它们使用专用的条件机制。然而,在仅使用零样本 RGB 编辑接口的情况下,Qwen 在深度保真度方面与几个经过训练的适配器/控制基线具有竞争力。这支持了 RINO 的核心假设:空间控制可以作为图像被消费,而无需为每种条件类型引入单独的编码器或适配器。图 10 中的定性示例表明,编辑器通常尊重粗略的深度布局,但在纹理真实感和语义忠实度方面存在差异。
语义分割图条件生成。遵循 ControlNet++ 协议 (Li et al., 2024a),每个验证样本提供一个 RGB 语义分割图和一段文本描述。RINO 将分割图视为普通的 RGB 条件图像,并指示编辑器合成一幅自然图像,其语义布局遵循每个区域的类别颜色。未添加任何分割编码器、ControlNet 分支、适配器或任务特定的解码器:模型仅看到 RGB 条件图像和自然语言指令。由于我们观察到提示的丰富程度对图像质量和条件保真度有巨大影响,我们使用开源 VLM 对每个验证图像重新生成一次描述,并将生成的描述作为所有编辑器的文本提示。我们在 ADE20K (Zhou et al., 2017) 和 COCOStuff (Lin et al., 2014) 的验证集上,以原生输入分辨率评估 Qwen-Image-Edit (Wu et al., 2025)、FireRed-Image-Edit-1.1 (FireRed Team, 2025) 和 LongCat-Image-Edit (Ma et al., 2025)。每个编辑器使用其推荐的采样配置:Qwen-Image-Edit 使用 steps=40 和 CFG=4.0,FireRed-Image-Edit-1.1 使用 steps=40 和 CFG=4.0,LongCat-Image-Edit 使用 steps=50 和 CFG=4.5。我们遵循 ControlNet++ 的分割条件生成评估协议 (Li et al., 2024a)。条件保真度通过 Mask2Former (Cheng et al., 2022) 分割器从每张生成的图像中重新提取语义分割图,并将其与输入条件进行比较来测量;我们报告平均交并比 (mIoU)、平均类别准确率 (mAcc) 和全像素准确率 (aAcc)。图像质量通过相对于真实验证图像的 FID 来测量,文本对齐度通过相对于重新生成描述的 CLIPScore 来测量。FID 越低越好;mIoU、mAcc、aAcc 和 CLIPScore 越高越好。
13
第 14 页
表 12 在 ADE20K 和 COCOStuff 上基于语义分割图的图像生成结果。ControlNet++ 作为任务训练的接地生成(grounded generation)参考基线被纳入比较。图像编辑器行由我们使用 RGB 分割图和 VLM 重描述提示词(VLM-recaptioned prompts)以原生输入分辨率进行零样本(Zero-shot)运行。
ADE20K COCOStuff
Method mIoU ↑ mAcc ↑ aAcc ↑ FID ↓ CLIP ↑ mIoU ↑ mAcc ↑ aAcc ↑ FID ↓ CLIP ↑
ControlNet 32.55 – – 33.28 31.53 27.46 – – 21.33 13.31 ControlNet++ 43.64 – – 29.49 31.96 34.56 – – 19.29 13.13
生成式图像编辑器( ours,零样本,RGB→RGB) Qwen-Image-Edit 46.24 61.92 79.13 32.05 32.62 37.40 50.64 63.50 15.54 34.14 FireRed-Image-Edit 45.82 62.82 78.14 31.70 32.67 37.55 51.20 63.25 15.94 34.07 LongCat-Image-Edit 46.37 61.62 78.91 36.08 32.50 36.38 48.93 61.46 20.95 33.89
表 12 在 ADE20K 和 COCOStuff 上将三种零样本编辑器与作为任务训练接地生成参考基线的 ControlNet++ 进行了比较。所有三种编辑器均提供了强大的条件保真度:在 ADE20K 上,它们紧密聚集在 46 mIoU 左右(Qwen 46.24,FireRed 45.82,LongCat 46.37),在 COCOStuff 上聚集在 37 mIoU 左右(FireRed 37.55,Qwen 37.40,LongCat 36.38)。图像质量遵循编辑器骨干网络(backbone),而非条件接口:Qwen 和 FireRed 在两个数据集上基本持平(ADE20K 上 FID 为 31.70–32.05,COCOStuff 上为 15.54–15.94),而 LongCat 明显落后(FID 分别为 36.08 和 20.95)。CLIPScore 也在各编辑器之间紧密聚集,表明重描述提示词得到了相当程度的遵循。总体而言,通用图像编辑器将语义分割图视为普通的 RGB 条件输入,并以零样本方式尊重每个区域的类别布局,其图像质量受限于编辑器骨干网络,而非缺乏分割适配器。可视化结果见图 11。
输入 真实标签(GT) Qwen FireRed LongCat ControlNet++
图 11 ADE20K 上基于语义分割图的定性生成结果。RINO 接口保留了输入的语义布局,而编辑器骨干网络在纹理真实感和小区域保真度方面存在差异。
基于人体姿态的条件生成。我们在 Human-Art (Ju et al., 2023a) 验证集上采用了 HumanSD (Ju et al., 2023b) 和 Stable-Pose (Wang et al., 2024a) 的姿态引导文本到图像协议。对于每个样本,将真实 COCO-17 关键点渲染为 OpenPose 风格的彩色骨架(黑色画布上的 16 个肢体段)。编辑器仅接收此 RGB 骨架和关联的文本描述,并被指示将每个身体部位与相应的彩色骨骼对齐,同时在合成图像中省略骨架叠加层。未引入姿态编码器、ControlNet 分支或可训练适配器。我们
14
第 15 页
表 13 Human-Art 验证集上基于人体姿态条件的图像生成。基线方法的数据引用自 Stable-Pose; ∗ 表示已发布的检查点。我们的编辑器行均为零样本(Zero-shot)。加粗:每列中表现最佳的基线。
姿态准确率 图像质量 文本-图像对齐
方法 CAP↑ PCE↓ FID↓ KID↓ CLIP-score↑
训练好的姿态引导生成模型 SD∗(Rombach et al., 2022) 55.71 2.30 11.53 3.36 33.33 T2I-Adapter (Mou et al., 2023) 65.65 1.75 11.92 2.73 33.27 ControlNet (Zhang et al., 2023) 69.19 1.54 11.01 2.23 32.65 Uni-ControlNet (Zhao et al., 2023) 69.32 1.48 14.63 2.30 32.51 GLIGEN (Li et al., 2023b) 69.15 1.46 – – 32.52 HumanSD (Ju et al., 2023b) 69.68 1.37 10.03 2.70 32.24 Stable-Pose (Wang et al., 2024a) 70.83 1.50 11.12 2.35 32.60
生成式图像编辑器 Qwen-Image-Edit 65.97 1.76 36.01 5.83 32.96 FireRed-Image-Edit 68.09 1.82 10.66 5.23 34.24 LongCat-Image-Edit 55.54 2.02 7.91 6.25 32.22
骨架(输入) 真实图像(GT) Qwen LongCat FireRed ControlNet-OpenPose
提示词:“舞蹈 — 一位身穿白色连衣裙表演芭蕾舞的女性”
提示词:“水墨画 — 一位站在窗前、晾衣绳上挂着衣服的女性”
提示词:“浮雕 — 墙上男孩和女孩的雕像”
图 12 跨风格的零样本人体姿态条件生成:输入骨架、真实图像(GT)、我们的编辑器(Qwen/LongCat/FireRed)以及 ControlNet-OpenPose。
遵循 HumanSD/Stable-Pose 的评估协议。姿态保真度通过 HigherHRNet (Cheng et al., 2020) 重新估计每张生成图像的姿态,并通过 COCOevalSimilarity 将其与条件骨架进行比较得出,从而产生基于余弦相似度的平均精度(CAP)和人数误差(PCE)。图像质量通过相对于真实 Human-Art 图像的 FID 和 KID 进行测量,文本对齐度通过 CLIP-Score 进行测量。编辑器的输出使用报告基线数值时所使用的公开评估代码进行评分。
表 13 和图 12 表明,RINO 在人体姿态条件图像生成方面实现了极具竞争力的零样本性能。尽管我们的编辑器并未针对此任务进行训练,但其结果已经
第 16 页
表 14 COCO2017 验证集上的实例图条件图像生成结果。InstanceDiffusion 作为任务训练的接地生成(grounded generation)参考被纳入比较。图像编辑器行由我们使用 RGB 实例图和 VLM 重描述提示词(VLM-recaptioned prompts)在原生输入分辨率下以零样本(Zero-shot)方式运行。
| Method | AP↑ | AP50 ↑ | Average Recall↑ | FID↓ | | :— | :— | :— | :— | :— | | Reported task-trained grounded generation result | | | | | | InstanceDiffusion (Wang et al., 2024b) | 27.1 | 50.0 | 38.1 | 25.5 | | Generative image editors (ours, zero-shot, RGB instance map input) | | | | | | Qwen-Image-Edit (Wu et al., 2025) | 25.4 | 44.3 | 40.8 | 15.3 | | FireRed-Image-Edit (FireRed Team, 2025) | 23.2 | 42.3 | 37.4 | 16.0 | | LongCat-Image-Edit (Ma et al., 2025) | 28.0 | 46.3 | 44.2 | 18.5 |
| Input | GT | Qwen | FireRed | LongCat | InstanceDiffusion | | :— | :— | :— | :— | :— | :— |
图 13 COCO2017 验证集上的实例图条件生成定性结果。所有三个零样本编辑器接收相同的 RGB 实例图和重新描述的提示词。示例表明,RGB-in/RGB-out 接口在不使用实例编码器的情况下保留了每个实例的位置,而编辑器的骨干网络在纹理真实感和小实例保真度方面存在差异。
与域内姿态引导生成模型相当,表明通用图像编辑器可以有效地将 RGB 骨架输入解释为空间生成条件。定性来看,RINO 生成的图像通常比基于 ControlNet 的基线更好地遵循输入姿态,特别是在涉及异常身体配置或多样化艺术风格的情况下。生成的图像也保持了强大的文本-图像对齐和视觉真实感,表明 RGB-in/RGB-out 接口为条件生成提供了一种有效且灵活的替代方案,以取代任务特定的姿态编码器。
实例图条件生成。遵循 InstanceDiffusion 协议 (Wang et al., 2024b),每个验证样本提供每实例图(per-instance map)以及文本描述。与语义分割图不同,此条件区分同一类别的单个对象实例,而不仅仅是每类别的区域。RINO 将实例图渲染为普通的 RGB 条件图像,并指示编辑器合成一个自然图像,使其对象实例遵循输入布局。未引入实例编码器、接地模块、检测头或可训练适配器。与分割图设置一样,我们使用开源 VLM 对每个验证图像进行一次重新描述,并使用该描述作为所有编辑器的提示词,因为我们发现描述的丰富程度显著影响图像质量和生成实例的可识别性。我们在以下方面评估了 Qwen-Image-Edit、FireRed-Image-Edit 和 LongCat-Image-Edit:
16
第 17 页
COCO2017 (Wang et al., 2024b) 验证集在原始输入分辨率下。每个编辑器使用其推荐的采样配置:Qwen-Image-Edit 使用 steps=40 和 CFG=4.0,FireRed-Image-Edit 使用 steps=40 和 CFG=4.0,LongCat-Image-Edit 使用 steps=50 和 CFG=4.5。我们遵循 InstanceDiffusion 的评估协议 (Wang et al., 2024b)。条件保真度通过在生成图像上运行预训练的 YOLOv8m-Seg (Jocher et al., 2023) 检测器,并使用 COCO 的官方评估指标将检测到的实例掩码与输入条件进行比较来测量。我们报告掩码 AP (IoU 0.5:0.05:0.95)、AP50 (IoU ≥0.5) 和平均召回率 (AR),它们共同衡量请求实例的定位精度和召回率。图像质量通过相对于真实 COCO2017 验证图像的 FID 来测量。AP、AP50 和 AR 越高越好;FID 越低越好。
表 14 将三种零样本编辑器与作为任务训练的地面生成参考的 InstanceDiffusion 进行了比较。这些编辑器紧密遵循每个实例的布局:LongCat 达到了最高的 AP (28.0) 和 AR (44.2),在两项指标上均超越了经过训练的 InstanceDiffusion 参考,而 Qwen (25.4 AP, 44.3 AP50, 40.8 AR) 和 FireRed (23.2 AP, 42.3 AP50, 37.4 AR) 则与其相差无几。在更严格的 AP50 阈值下,经过训练的参考仍然领先 (50.0 对比编辑器的 42–46),这表明精确的实例边界比粗略的实例位置更难恢复。所有编辑器的图像质量始终优于经过训练的参考 (FID 15.3–18.5 对比 25.5),这反映了现代编辑器骨干网络的优势。总体而言,通用图像编辑器可以零样本地消费每个实例的 RGB 布局,并生成尊重各个实例位置且视觉质量高于任务训练基线的图像。可视化结果如图 13 所示。
表 15 MultiGen-20M 验证集上的 Canny 条件生成(5000 张图像,512×512,每张条件生成 4 个样本)。边缘可控性是 F1 (cv2.Canny(100,200),×100);图像质量是 FID;文本对齐是 CLIP-Score (CLIP ViT-B/16) —— 均遵循 ControlNet++ 协议,FID 和 CLIP 在生成的 4 组图像上取平均。我们的 Qwen-Image-Edit 行是零样本的;经过训练的行是来自 ControlNet++ (Li et al., 2024a) 的论文报告锚点。粗体:每列最佳零样本结果。
方法 F1 ↑ FID ↓ CLIPScore ↑
零样本( ours 和基线) 仅原始文本描述 6.75 71.61 27.78 原始文本描述 + Canny 文本描述 7.79 59.39 23.98 Qwen-Image-Edit (canny + 文本描述) 14.90 58.30 27.31
针对 Canny 条件训练 (Li et al., 2024a) T2I-Adapter (Mou et al., 2023) 23.65 15.96 31.71 GLIGEN (Li et al., 2023b) 26.94 18.89 31.77 Uni-ControlNet (Zhao et al., 2023) 27.32 17.14 31.84 UniControl (Qin et al., 2023) 30.82 19.94 31.97 ControlNet (SD1.5) (Zhang et al., 2023) 34.65 14.73 32.15 ControlNet++ (SD1.5) (Li et al., 2024a) 37.04 18.23 31.87
Canny 条件图像生成。遵循 MultiGen-20M 协议 (Li et al., 2024a),每个样本由 Canny 边缘图(黑色背景上的白色边缘)和文本描述组成。RINO 将边缘图视为普通的 RGB 条件图像,并指示编辑器合成一个自然图像,其对象边界和空间布局符合边缘,不添加边缘编码器、ControlNet 分支、适配器或任务特定的解码器。我们在 512×512 分辨率下,在 5,000 张图像的验证集上评估 Qwen-Image-Edit (Wu et al., 2025),在每个条件下抽取 4 个样本,使用 steps=30 和 CFG=4.0,并在共享指令提示下进行。所有报告的数据均为每张图像 4 个样本的平均值;不使用 best-of-N 选择。我们遵循 ControlNet++ 协议进行 Canny 条件 (Li et al., 2024a)。条件保真度通过从每张生成图像中重新提取 Canny 边缘图,并将其与输入条件进行比较来测量;由于 Canny 是硬(二值)边缘,可控性指标是像素级边缘 F1 分数,使用 OpenCV cv2.Canny(100,200) 提取以完全匹配协议。我们还报告相对于真实验证图像的 FID 作为图像质量,以及使用 CLIP ViT-B/16 的 CLIP-Score 作为文本对齐,两者均在生成的 4 组图像上取平均,并使用与 ControlNet++ 相同的实现计算;重新提取的边缘图不包含在 FID 图像集中。
17
第 18 页
GT Canny GT ControlNet ControlNet++ Qwen Qwen Canny
图 14 MultiGen-20M 上的定性 Canny 条件生成结果。
表 15 报告了所有三项指标。在可控性方面,零样本 Qwen-Image-Edit 达到了 14.90 的 Canny F1 分数,仅为专门训练的 ControlNet++(37.04)的约 0.40 倍,且低于所有经过训练的基线模型(23–37)。在图像质量和文本对齐方面也存在同样的差距:其 FID 为 59.4,CLIP-Score 为 27.3,落后于经过训练的控制器(FID 15–20,CLIP ≈32)。因此,零样本 Canny 生成在所有三个维度上——边缘可控性、分布真实性和提示对齐——都落后于专门训练的控制器,这符合预期,因为通用指令编辑器没有经过边缘条件训练,也没有专用的条件分支。然而,这一结果在更困难的二值边缘场景中支持了 RINO 的核心假设:空间控制可以被当作普通图像来消费,无需任何任务特定的适配器,即可实现高于随机水平的可控性。
为了验证这种可控性确实来自 Canny 图像而非文本描述,我们在固定编辑器的情况下对条件进行了消融实验(表 15 的顶部块)。移除边缘图仅保留文本描述(Raw Caption-only)使保真度降至 6.75;而先用视觉语言模型(Qwen2.5-VL-7B)将边缘图描述为文字,再用该文本替代图像输入(Raw Caption + Canny Caption)仅达到 7.79——两者都远低于直接使用边缘图像得到的 14.90。这表明 Canny 图像携带了语言瓶颈无法替代的像素级空间信息。质量指标提供了更细致的见解:提供结构信息(Canny 图像或其 VLM 描述)相比仅使用文本描述提高了 FID(71.6 → 58–59),即空间先验能生成更真实的图像,但通过冗长的 VLM 描述路由会降低 CLIP-Score(27.8 → 24.0),因为附加的布局文本与文本描述在提示对齐上产生了竞争。可视化结果如图 14 所示。
4 相关工作
视觉估计模型。估计任务将自然图像映射为结构化信号,我们研究的每个任务都有成熟的专用模型系列,它们定义了性能上限并作为我们的参考。单目深度估计从混合数据集以实现尺度和平移不变的相对深度(Ranftl 等,2022;Birkl 等,2023;Bhat 等,2023),发展到大规模数据驱动和度量感知系统(Yang 等,2024a,b;Lin 等,2025;Wang 等,2025;Piccinelli 等,2025),而预训练的扩散生成器本身也被微调为强大的深度和法线估计器(Ke 等,2024;Ye 等,2024;He 等,2025;Bae 和 Davison,2024)。分割收敛于掩码分类视角,其中 Transformer 预测一组带标签的掩码,以同时覆盖语义、实例和全景分割(Cheng 等,
18
第 19 页
2021, 2022; Jain 等人, 2023; Kerssies 等人, 2025; Shahabodini 等人, 2025; Li 等人, 2023a; Xie 等人, 2021),并包含一个通过语言嵌入命名新类别的开放词汇分支(Xu 等人, 2022a; Dong 等人, 2023; Yu 等人, 2023; Barsellotti 等人, 2024; Xu 等人, 2023)。其余任务遵循相同的专用架构模式:姿态估计(Xu 等人, 2022b; Maji 等人, 2022; Yang 等人, 2026b,a),带有文本接地开放集变体的检测与实例分割(He 等人, 2017; Cai 和 Vasconcelos, 2021; Li 等人, 2023a; Liu 等人, 2024),以及指代分割(Yang 等人, 2022; Yan 等人, 2023; Xiao 等人, 2024),许多模型构建于通用骨干网络之上(Radford 等人, 2021; Oquab 等人, 2024; Kirillov 等人, 2023),但仍通过任务特定的头部进行读取。此处的统一仍局限于同一家族内部,每个模型保留其各自的编码器、解码器和损失函数。
可控图像生成。生成任务朝相反方向演进,即从结构化条件(如 Canny 边缘、深度、语义或实例图、边界框或姿态)合成自然图像。ControlNet(Zhang 等人, 2023)通过附加一个可训练的编码器副本将控制信号注入文本到图像的骨干网络中,后续工作提高了保真度或将其扩展至自回归骨干网络(Li 等人, 2024a,b);适配器方法则学习针对每种条件的小型侧边网络(Mou 等人, 2023),而统一框架通过共享模块路由多种条件类型(Zhao 等人, 2023; Qin 等人, 2023)。布局和实例接地的生成(Li 等人, 2023b; Wang 等人, 2024b; Süleyman 和 Biricik, 2025)以及姿态引导的合成(Wang 等人, 2024a; Ju 等人, 2023b)遵循相同的配方。反复出现的要素是用于注入每种新信号的每条件编码器或适配器。因此,估计与生成几乎是镜像关系——一个从图像中读取结构化信号,另一个则写入信号——但传统上两者使用不同的架构和输出空间,且从未在共享接口下实现统一。
迈向估计与生成的统一模型。Vision Banana(Gabeur 等人, 2026)是首个弥合这两个方向差异的工作:将视觉任务的输出空间参数化为 RGB 图像,将感知重构为图像生成,并对单个生成器进行指令微调,使其在与 Segment Anything(Carion 等人, 2025)和 Depth Anything 系列(Yang 等人, 2024a,b; Lin 等人, 2025)等零样本专家模型竞争时表现相当,开源编辑器也显示出类似的行为(Liu 等人, 2026)。这将 RGB 视为读写图像的候选通用接口,类似于语言模型中的文本。然而,Vision Banana 建立在专有骨干网络之上,留下了这一接口在开放、公开发布的模型中泛化程度的疑问。RINO 共享其“RGB 作为接口”的前提,并将其推进至该设置:我们将开源图像编辑器视为冻结的黑盒,仅添加无参数的 RGB 转换,并在 25 个任务下将估计和条件生成置于统一的 RGB 到 RGB 公式中,衡量这一完全零样本系统接近上述专家模型的程度。
5 结论
RINO 表明,RGB 可以作为感知和生成的通用接口:将所有视觉输入和输出表示为 RGB,使得单个冻结的图像编辑器无需任何任务特定的编码器、解码器、适配器或辅助参数即可处理广泛的任务。RINO-Zero 完全零样本且无需任何训练,在涵盖密集估计、3D 几何和条件生成的 25 个任务中接近域内专家模型,并为基于适配器的可控生成提供了零样本替代方案。其精度受限于编辑骨干网络的视觉先验和无参数 RGB 读取,导致在某些任务上与专家模型存在差距;通过在 RGB 格式的视觉信号上对编辑器进行轻量级指令微调,使 RINO 接口在训练期间存在,是弥补这一差距的自然方式。这些发现指向 RGB 作为视觉的共享接口,并邀请将其扩展至 3D 视觉、视频和世界模型。
参考文献
Gwangbin Bae 和 Andrew J. Davison. Rethinking inductive biases for surface normal estimation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 9535–9545, 2024.
Luca Barsellotti, Roberto Amoroso, Marcella Cornia, Lorenzo Baraldi, 和 Rita Cucchiara. Training-free open-vocabulary segmentation with offline diffusion-augmented prototype generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 3689–3698, 2024.
19
第 20 页
Shariq Farooq Bhat, Reiner Birkl, Diana Wofk, Peter Wonka, 和 Matthias Müller。Zoedepth: 通过结合相对深度与度量深度实现零样本迁移。arXiv 预印本 arXiv:2302.12288, 2023。
Reiner Birkl, Diana Wofk, 和 Matthias Müller。Midas v3.1 – 用于鲁棒单目相对深度估计的模型库。arXiv 预印本 arXiv:2307.14460, 2023。
Zhaowei Cai 和 Nuno Vasconcelos。Cascade r-cnn: 高质量的目标检测与实例分割。IEEE 模式分析与机器智能汇刊 (TPAMI), 2021。
Zhe Cao, Gines Hidalgo, Tomas Simon, Shih-En Wei, 和 Yaser Sheikh。OpenPose: 使用部分亲和场进行实时多人 2D 姿态估计。IEEE 模式分析与机器智能汇刊, 43(1):172–186, 2021。
Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang 等。Sam 3: 使用概念分割万物。arXiv 预印本 arXiv:2511.16719, 2025。
Bowen Cheng, Bin Xiao, Jingdong Wang, Honghui Shi, Thomas S. Huang, 和 Lei Zhang。Higherhrnet: 面向自底向上人体姿态估计的尺度感知表示学习。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 5386–5395 页, 2020。
Bowen Cheng, Alex Schwing, 和 Alexander Kirillov。逐像素分类并非语义分割的全部需求。神经信息处理系统进展, 34:17864–17875, 2021。
Bowen Cheng, Ishan Misra, Alexander G. Schwing, Alexander Kirillov, 和 Rohit Girdhar。掩码注意力掩码变换器用于通用图像分割。在 CVPR, 2022。
Marius Cordts, Mohamed Omran, Sebastian Ramos, Timo Rehfeld, Markus Enzweiler, Rodrigo Benenson, Uwe Franke, Stefan Roth, 和 Bernt Schiele。Cityscapes 数据集:用于语义城市场景理解。在 IEEE 计算机视觉与模式识别会议 (CVPR) 论文集, 第 3213–3223 页, 2016。
Xiaoyi Dong, Jianmin Bao, Yinglin Zheng, Ting Zhang, Dongdong Chen, Hao Yang, Ming Zeng, Weiming Zhang, Lu Yuan, Dong Chen 等。Maskclip: 掩码自蒸馏推进对比式语言-图像预训练。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 10995–11005 页, 2023。
Mark Everingham, Luc Van Gool, Christopher K. I. Williams, John Winn, 和 Andrew Zisserman。Pascal 视觉物体类别 (VOC) 挑战赛。国际计算机视觉杂志, 88(2):303–338, 2010。
FireRed Team。FireRed-Image-Edit-1.0。Hugging Face 模型, FireRedTeam/FireRed-Image-Edit-1.0, 2025。
Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, 和 Radu Soricut。图像生成器是通用视觉学习者。arXiv 预印本 arXiv:2604.20329, 2026。
Andreas Geiger, Philip Lenz, 和 Raquel Urtasun。我们准备好自动驾驶了吗?KITTI 视觉基准套件。在 IEEE 计算机视觉与模式识别会议 (CVPR), 第 3354–3361 页, 2012。
Jing He, Haodong Li, Mingzhi Sheng, 和 Ying-Cong Chen。Lotus-2: 借助强大的图像生成模型推进几何密集预测。arXiv 预印本 arXiv:2512.01030, 2025。
Kaiming He, Georgia Gkioxari, Piotr Dollár, 和 Ross Girshick。Mask r-cnn。在 ICCV, 2017。
Jitesh Jain, Jiachen Li, Mang Tik Chiu, Ali Hassani, Nikita Orlov, 和 Humphrey Shi。Oneformer: 一个变换器统治通用图像分割。在 CVPR, 2023。
Glenn Jocher, Ayush Chaurasia, 和 Jing Qiu。YOLO by Ultralytics, 2023。URL https://github.com/ultralytics/ultralytics。
Xuan Ju, Ailing Zeng, Jianan Wang, Qiang Xu, 和 Lei Zhang。Human-art: 一个连接自然与人工场景的通用以人为中心的数据集。在 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集, 第 618–629 页, 2023a。
Xuan Ju, Ailing Zeng, Chenchen Zhao, Jianan Wang, Lei Zhang, 和 Qiang Xu。HumanSD: 一种原生骨架引导的扩散模型用于人体图像生成。在 ICCV, 2023b。
Bingxin Ke, Anton Obukhov, Shengyu Huang, Nando Metzger, Rodrigo Caye Daudt, 和 Konrad Schindler。将基于扩散的图像生成器重新用于单目深度估计。在 CVPR, 2024。
20
第 21 页
Tommie Kerssies, Niccolò Cavagnero, Alexander Hermans, Narges Norouzi, Giuseppe Averta, Bastian Leibe, Gijs Dubbelman, 和 Daan de Geus。《Your vit is secretly an image segmentation model》。发表于 CVPR,2025 年。
Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, 和 Ross Girshick。《Segment anything》。发表于 ICCV,2023 年。
Tobias Koch, Lukas Liebel, Friedrich Fraundorfer, 和 Marco Körner。《Evaluation of CNN-based single-image depth estimation methods》。发表于欧洲计算机视觉会议 (ECCV) 研讨会,第 331–348 页。Springer, 2018 年。
Feng Li, Hao Zhang, Huaizhe Xu, Shilong Liu, Lei Zhang, Lionel M. Ni, 和 Heung-Yeung Shum。《Mask DINO: Towards a unified transformer-based framework for object detection and segmentation》。发表于 CVPR,2023a。
Ming Li, Taojiannan Yang, Huafeng Kuang, Jie Wu, Zhaoning Wang, Xuefeng Xiao, 和 Chen Chen。《Controlnet++: Improving conditional controls with efficient consistency feedback》。arXiv 预印本 arXiv:2404.07987,2024a。
Yuheng Li, Haotian Liu, Qingyang Wu, Fangzhou Mu, Jianwei Yang, Jianfeng Gao, Chunyuan Li, 和 Yong Jae Lee。 《Gligen: Open-set grounded text-to-image generation》。发表于 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22511–22521 页,2023b。
Zongming Li, Tianheng Cheng, Shoufa Chen, Peize Sun, Haocheng Shen, Longjin Ran, Xiaoxin Chen, Wenyu Liu, 和 Xinggang Wang。《Controlar: Controllable image generation with autoregressive models》。arXiv 预印本 arXiv:2410.02705,2024b。
Haotong Lin, Sili Chen, Jun Hao Liew, Donny Y. Chen, Zhenyu Li, Guang Shi, Jiashi Feng, 和 Bingyi Kang。《Depth anything 3: Recovering the visual space from any views》。arXiv 预印本 arXiv:2511.10647,2025 年。
Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, 和 C. Lawrence Zitnick。《Microsoft COCO: Common objects in context》。发表于欧洲计算机视觉会议 (ECCV), 第 740–755 页。Springer,2014 年。
Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, 和 Lei Zhang。《Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection》。发表于 ECCV,2024 年。
Wei Liu, Jiaxin Lin, 和 Rui Chen。《Open-source image editing models are zero-shot vision learners》。arXiv 预印本 arXiv:2605.04566,2026 年。
Hanghang Ma, Haoxian Tan, Jiale Huang, Junqiang Wu, Jun-Yan He, Lishuai Gao, Songlin Xiao, Xiaoming Wei, Xiaoqi Ma, Xunliang Cai, Yayong Guan, 和 Jie Hu。《Longcat-image technical report》。arXiv 预印本 arXiv:2512.07584, 2025 年。
Debapriya Maji, Soyeb Nagori, Manu Mathew, 和 Deepak Poddar。《Yolo-pose: Enhancing yolo for multi person pose estimation using object keypoint similarity loss》。发表于 CVPR 研讨会 (CVPRW),2022 年。
Junhua Mao, Jonathan Huang, Alexander Toshev, Oana Camburu, Alan L. Yuille, 和 Kevin Murphy。《Generation and comprehension of unambiguous object descriptions》。发表于 IEEE 计算机视觉与模式识别会议论文集 (CVPR),第 11–20 页,2016 年。
Chong Mou, Xintao Wang, Liangbin Xie, Yanze Wu, Jian Zhang, Zhongang Qi, Ying Shan, 和 Xiaohu Qie。《T2i- adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models》。arXiv 预印本 arXiv:2302.08453,2023 年。
Varun K. Nagaraja, Vlad I. Morariu, 和 Larry S. Davis。《Modeling context between objects for referring expression understanding》。发表于欧洲计算机视觉会议 (ECCV),第 792–807 页。Springer,2016 年。
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jégou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski。《Dinov2: Learning robust visual features without supervision》。机器学习研究汇刊 (Transactions on Machine Learning Research),2024 年。
Luigi Piccinelli, Christos Sakaridis, Mattia Segu, Yung-Hsu Yang, Siyuan Li, Wim Abbeloos, 和 Luc Van Gool。 《Unik3d: Universal camera monocular 3d estimation》。发表于 CVPR,2025 年。
Can Qin, Shu Zhang, Ning Yu, Yihao Feng, Xinyi Yang, Yingbo Zhou, Huan Wang, Juan Carlos Niebles, Caiming Xiong, Silvio Savarese, Stefano Ermon, Yun Fu, 和 Ran Xu。《Unicontrol: A unified diffusion model for controllable visual generation in the wild》。arXiv 预印本 arXiv:2305.11147,2023 年。
21
第 22 页
Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, 和 Ilya Sutskever。从自然语言监督中学习可迁移的视觉模型。在 ICML, 2021.
René Ranftl, Alexey Bochkovskiy, 和 Vladlen Koltun。用于密集预测的视觉变换器。在 IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集, 第 12179–12188 页, 2021.
René Ranftl, Katrin Lasinger, David Hafner, Konrad Schindler, 和 Vladlen Koltun。迈向鲁棒的单目深度估计:混合数据集以实现零样本跨数据集迁移。IEEE 模式分析与机器智能汇刊 (TPAMI), 2022.
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, 和 Björn Ommer。使用潜在扩散模型进行高分辨率图像合成。在 CVPR, 2022.
Sajjad Shahabodini, Mobina Mansoori, Farnoush Bayatmakou, Jamshid Abouei, Konstantinos N. Plataniotis, 和 Arash Mohammadi。通用图像分割中视觉变换器缺失的要点。arXiv 预印本 arXiv:2505.19795, 2025.
Nathan Silberman, Derek Hoiem, Pushmeet Kohli, 和 Rob Fergus。来自 RGBD 图像的室内分割和支持推理。在欧洲计算机视觉会议 (ECCV) 上, 第 746–760 页。Springer, 2012.
Ahmad Süleyman 和 Göksel Biricik。为受控高质量图像生成而接地文本到图像扩散模型。arXiv 预印本 arXiv:2501.09194, 2025.
Igor Vasiljevic, Nick Kolkin, Shanyi Zhang, Ruotian Luo, Haochen Wang, Falcon Z. Dai, Andrea F. Daniele, Mohammadreza Mostajabi, Steven Basart, Matthew R. Walter, 和 Gregory Shakhnarovich。DIODE:一个密集室内和室外深度数据集。arXiv 预印本 arXiv:1908.00463, 2019.
Jiajun Wang, Morteza Ghahremani, Yitong Li, Björn Ommer, 和 Christian Wachinger。Stable-pose:利用变换器进行姿态引导的文本到图像生成。在 NeurIPS, 2024a.
Ruicheng Wang, Sicheng Xu, Yue Dong, Yu Deng, Jianfeng Xiang, Zelong Lv, Guangzhong Sun, Xin Tong, 和 Jiaolong Yang。Moge-2:具有度量尺度和清晰细节的准确单目几何。arXiv 预印本 arXiv:2507.02546, 2025.
Xudong Wang, Trevor Darrell, Sai Saketh Rambhatla, Rohit Girdhar, 和 Ishan Misra。Instancediffusion:图像生成的实例级控制。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 6232–6242 页, 2024b.
Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Shengming Yin, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhengyi Wang, An Yang, Bowen Yu, Chen Cheng, Dayiheng Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Yi Wang, Yichang Zhang, Yongqiang Zhu, Yujia Wu, Yuxuan Cai, 和 Zenan Liu。Qwen-image 技术报告。arXiv 预印本 arXiv:2508.02324, 2025.
Linhui Xiao, Xiaoshan Yang, Fang Peng, Yaowei Wang, 和 Changsheng Xu。OneRef:使用掩码指代表征建模统一单塔表达接地与分割。在 NeurIPS, 2024.
Enze Xie, Wenhai Wang, Zhiding Yu, Anima Anandkumar, Jose M Alvarez, 和 Ping Luo。Segformer:用于语义分割的简单高效变换器设计。神经信息处理系统进展, 34: 12077–12090, 2021.
Jiarui Xu, Shalini De Mello, Sifei Liu, Wonmin Byeon, Thomas Breuel, Jan Kautz, 和 Xiaolong Wang。Groupvit:语义分割从文本监督中涌现。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 18134–18144 页, 2022a.
Jilan Xu, Junlin Hou, Yuejie Zhang, Rui Feng, Yi Wang, Yu Qiao, 和 Weidi Xie。从自然语言监督中学习开放词汇语义分割模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 第 2935–2944 页, 2023.
Yufei Xu, Jing Zhang, Qiming Zhang, 和 Dacheng Tao。Vitpose:用于人体姿态估计的简单视觉变换器基线。在 NeurIPS, 2022b.
Bin Yan, Yi Jiang, Jiannan Wu, Dong Wang, Ping Luo, Zehuan Yuan, 和 Huchuan Lu。通用实例感知作为对象发现与检索。在 CVPR, 2023.
Lihe Yang, Bingyi Kang, Zilong Huang, Xiaogang Xu, Jiashi Feng, 和 Hengshuang Zhao。Depth anything:释放大规模无标签数据的潜力。在 CVPR, 2024a.
22
第 23 页
Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, 和 Hengshuang Zhao。Depth anything v2. 神经信息处理系统进展 (NeurIPS), 37:21875–21911, 2024b.
Timing Yang, Sicheng He, Hongyi Jing, Jiawei Yang, Zhijian Liu, Chuhang Zou, 和 Yue Wang。Fast sam 3d body: 加速 sam 3d body 以实现实时全身人体网格重建, 2026a. URL https://arxiv.org/abs/2603. 15603.
Xitong Yang, Devansh Kukreja, Don Pinkus, Anushka Sagar, Taosha Fan, Jinhyung Park, Soyong Shin, Jinkun Cao, Jiawei Liu, Nicolas Ugrinovic, Matt Feiszli, Jitendra Malik, Piotr Dollár, 和 Kris Kitani。Sam 3d body: 鲁棒 全身人体网格重建。arXiv 预印本 arXiv:2602.15989, 2026b.
Zhao Yang, Jiaqi Wang, Yansong Tang, Kai Chen, Hengshuang Zhao, 和 Philip HS Torr。Lavt: 用于指代图像分割的语言感知 视觉变换器。在 IEEE/CVF 计算机视觉与模式识别会议论文集, 页码 18155–18165, 2022.
Chongjie Ye, Lingteng Qiu, Xiaodong Gu, Qi Zuo, Yushuang Wu, Zilong Dong, Liefeng Bo, Yuliang Xiu, 和 Xiaoguang Han。Stablenormal: 降低扩散方差以实现稳定且清晰的法线估计。ACM 图形学汇刊 (TOG), 43(6):1–18, 2024.
Qihang Yu, Ju He, Xueqing Deng, Xiaohui Shen, 和 Liang-Chieh Chen。卷积难死:使用单个冻结的卷积 CLIP 进行开放词汇 分割。神经信息处理系统进展, 36: 32215–32234, 2023.
Lvmin Zhang, Anyi Rao, 和 Maneesh Agrawala。向文生图扩散模型添加条件控制。在 ICCV, 2023.
Shihao Zhao, Dongdong Chen, Yen-Chun Chen, Jianmin Bao, Shaozhe Hao, Lu Yuan, 和 Kwan-Yee K. Wong. Uni-controlnet: 面向文生图扩散模型的一体化控制。arXiv 预印本 arXiv:2305.16322, 2023.
Bolei Zhou, Hang Zhao, Xavier Puig, Sanja Fidler, Adela Barriuso, 和 Antonio Torralba。通过 ADE20K 数据集进行场景解析。在 CVPR, 2017.
23