视觉相似性的多重维度:一种文本提示的图像感知度量

三分钟导读:本文提出TPIPS,通过微调VLM并构建大规模人类标注数据集,实现基于自由文本提示的细粒度、多面视觉相似性度量,显著缩小了模型与人类感知之间的差距。

英文题目:The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

论文出处:arXiv 每日论文精选 · arXiv:2607.18237

原始论文:PDF / 论文页面

对应视频标题:视觉相似性的多重维度:一种文本提示的图像感知度量|推荐指数:★★★★★

这篇论文解决什么问题?

现有视觉相似性度量(如L2, SSIM, LPIPS, DreamSim)将相似性坍缩为单一标量,无法根据特定视觉方面(如颜色、姿态、纹理)进行条件化,导致在细粒度感知判断中产生歧义和不一致。

核心创新

  • 构建大规模文本条件化感知相似性数据集,包含自由形式的语义方面标注。
  • 提出TPIPS模型,通过微调VLM实现基于文本提示的多面相似性度量。
  • 系统比较并优化Late/Mid/Early fusion架构在感知相似性任务中的表现。
  • 展示TPIPS在条件化检索、组合检索及生成模型评估中的新能力。

方法概览

提出Text-Prompted Image Perceptual Similarity (TPIPS)。收集包含25K图像三元组、260K三元组-方面组合的大规模数据集,采用Odd-one-out和2AFC协议进行人类标注。微调VLM(基于Qwen3-VL-8B-Emb),探索Late fusion, Mid fusion, Early fusion三种架构,使用交叉熵损失优化模型预测与人类投票的一致性。

逐图理解论文

大规模人类标注数据集

大规模人类标注数据集
Figure 2: Datasets. (left) We ask users which image within the triplet is the odd-one-out (OOO). The images are synthetically generated using variations of text-to-image models, using it to train our text-conditioned similarity model. (right) We test the generalization using outputs of algorithms on different vision and graphics tasks. We ask users which is more similar to a reference image, between two algorithm outputs, in a two-alternative forced choice (2AFC) setup.

TPIPS的训练依赖于一个大规模的人类标注数据集。我们收集了25K图像三元组,并构建了260K三元组-方面组合。标注过程采用Odd-one-out和2AFC协议。在Odd-one-out任务中,标注者从三元组中选出最不同的图像;在2AFC任务中,标注者判断哪张图像与参考图像更相似。这些数据为模型提供了丰富的细粒度感知信号。

模型架构与训练

模型架构与训练
Figure 3: (left) Learning similarity from odd-one-out data. Users judge which image is the odd-one-out of the triplet, on a given condition (x1 in this case). We predict the text-conditioned pairwise similarity between all pairs in the triplet using fθ. Intuitively, the similarity between the non-chosen images, shown as s23 should be the greatest. The odd-one-out is predicted with a softmax (with temperature τ) on the similarities, with the embeddings trained with a cross-entropy loss. (right) Architecture choices for fθ: (a) Late fusion embeds the images separately and only compares the final activation; (b) Mid-fusion uses internal feature activations between separately-embedded images; (c) Early fusion embeds both images into the VLM directly.

TPIPS基于Qwen3-VL-8B-Emb进行微调。我们探索了三种融合架构:Late fusion、Mid fusion和Early fusion。Late fusion分别编码图像后比较最终激活;Mid fusion比较内部特征激活;Early fusion将两幅图像直接输入VLM进行联合注意力。模型使用交叉熵损失优化,以预测与人类投票的一致性。

域内评估结果

域内评估结果
Figure 5: How well do models agree with human perceptual judgement? We report model-human agreement rate across recent vision language models and text-image embedding methods, categorized as classic, early fusion, mid fusion, and late fusion. On the left, we show results on our synthetic dataset D. On the right, we show our held-out distribution Dext. Error bar denotes 2-standard error. We find that our method (red bars) consistently outperforms baselines in both in-domain odd-one-out tests and out-of-domain 2AFC tests. Our early fusion model has a marginally better model-human- agreement than the other two variants. The dotted line denotes the human-human agreement rate, serving as the performance ceiling. Extended comparisons are detailed in Table 3.

在合成的Odd-one-out数据集上进行域内评估。结果显示,TPIPS将模型与人类的一致性差距从9.1%缩小至2.8%,达到了最高水平。这表明TPIPS能够准确地捕捉人类在特定视觉方面上的相似性判断,显著优于基线模型。

解耦与通用性评估

解耦与通用性评估
Table 5: Generalization to QARE-Bench (Synthetic) [48] dataset. The benchmark measures disentanglement on objects, background, and style on a small set of 48 images. Our method is competitive with the provided benchmarks from QARE, with the highest mAP among 8B models and close to the 12B model.

在QARE-Bench上,TPIPS在8B模型中取得最高mAP,接近12B模型,展示了其在解耦评估中的竞争力。在BAPPS和NIGHTS上,微调后的Late fusion模型显示出一致的改进,证明了其在通用感知相似性任务上的泛化能力,无需针对这些数据集进行专门训练。

条件化与组合检索

条件化与组合检索
Figure 8: Compositional retrieval. Each query is specified with different aspects, and we directly sum up similarity scores from two queries to rank the data. For example, combining (1) the painting of two sitting people conditioned on subject matter and (2) Monet’s painting conditioned on brush work yields Impressionist paintings of two sitting people. When we swap out the second query to be color-palette specific, we can retrieve portraits of two people in the same pink and blue color tone.

TPIPS在OpenImages和WikiArt上进行了条件化检索和组合检索演示。通过组合不同方面的相似度分数,可以实现复杂的检索查询。例如,结合“主体内容”和“笔触风格”可以检索出特定风格的绘画。这展示了TPIPS在细粒度图像检索中的强大能力。

实验与关键结果

  • 在合成的Odd-one-out数据集上进行域内评估。
  • 在包含图像编辑、合成、新视图合成、3D生成的2AFC数据集上进行域外泛化评估。
  • 与经典度量(LPIPS, DreamSim)、晚期融合嵌入模型、早期融合VLM及中期融合模型进行对比。
  • 在OpenImages和WikiArt上进行条件化检索和组合检索演示。
  • 在QARE-Bench上进行解耦评估。
  • 在BAPPS和NIGHTS上进行通用感知相似性泛化测试。
  • Odd-one-out任务上,TPIPS将模型-人类一致性差距从9.1%缩小至2.8%,达到最高水平。(第 8 页)
  • 2AFC域外任务上,TPIPS将误差从15.8%降低至10.0%,优于所有基线。(第 8 页)
  • Early fusion模型在模型-人类一致性上略优于其他变体。(第 8 页)
  • 在QARE-Bench上,TPIPS在8B模型中取得最高mAP,接近12B模型。(第 23 页)
  • 在BAPPS和NIGHTS上,微调后的Late fusion模型显示出一致的改进。(第 22 页)

阅读时需要注意

  • 计算成本高于LPIPS或DreamSim。
  • 基于嵌入的检索需要为每个方面条件单独编码和索引。
  • 标注者群体不能代表所有观众,存在感知偏差。
  • 训练数据多样性受限,主要源自FLUX-Reason-6M,可能遗漏VLM无法捕捉的方面。
  • 学习到的度量未完全从原始内容解耦(如相似内容倾向于获得更高的天气相似性分数)。
  • Early fusion虽性能略优,但Late fusion支持预计算嵌入,检索效率更高。
  • 检索结果中使用了相似度调整(减去整体相似性的分数)以鼓励多样性,未调整结果见附录。
  • 2AFC评估中剔除了平局样本。

关联工作

  • LPIPS:经典感知度量,作为基线对比,但缺乏条件化能力。(第 2 页)
  • DreamSim:经典感知度量,作为基线对比,但缺乏条件化能力。(第 2 页)
  • GeneCIS:相关条件相似性工作,从现有VLM数据集挖掘三元组,本文指出其未能直接捕获人类细粒度相对差异。(第 3 页)
  • TF-QARE:相关条件表示工作,通过提示生成描述并平均嵌入,本文认为其不如直接的人类标注对齐。(第 3 页)
  • Qwen3-VL:作为TPIPS的基础骨干模型(Backbone)。(第 7 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

视觉相似性的多重含义: 一种文本提示的图像感知度量

Sheng-Yu Wang1 Yotam Nitzan2 Aaron Hertzmann2 Jun-Yan Zhu1 Eli Shechtman2 Alexei A. Efros3 Richard Zhang2 1卡内基梅隆大学 2 Adobe Research 3 加州大学伯克利分校

摘要

人类视觉相似性判断具有情境依赖性。例如,两张图像可能在形状上相似,但在颜色上截然不同。然而,现有的感知相似性度量将这些细微差别压缩为单一标量值,缺乏针对特定方面进行条件控制的能力。为了弥补这一空白,我们构建了一个大规模的人类相似性判断数据集,涵盖图像三元组,其中每个三元组都针对多个自由形式的语义相似性方面进行了标注。对广泛的前沿视觉-语言模型(VLMs)的基准测试显示,其性能与人类标注者的共识之间存在显著差距。利用我们的数据,我们微调了一个 VLM 以生成针对指定文本提示的文本提示图像感知相似性(Text-Prompted Image Perceptual Similarity, TPIPS)度量。我们证明,TPIPS 根据视觉相似性的不同方面更紧密地与人感知对齐,并且在训练分布之外也能可靠地泛化。最后,我们展示了 TPIPS 在文本引导检索、组合搜索以及生成模型细粒度评估方面解锁了新的能力。我们的代码、数据和训练好的模型位于 https://peterwang512.github.io/TPIPS。[cs.CV]

1 引言

大量心理学研究已确立人类相似性判断具有情境依赖性 [4, 5]。图像也是如此:视觉相似性有许多含义,取决于正在比较的方面(如颜色、纹理、光照、语义、风格等)。考虑图 1:给定参考的牛雕像图像(左侧),目前尚不清楚右侧四张候选图像中哪一张在整体上与参考图像最相似。然而,如果相似性判断是基于特定的视觉方面(如牛的颜色、姿势或图像背景)进行条件控制的,答案就变得清晰了。

图像处理与计算机视觉社区几十年来一直在致力于捕捉人类感知相似性,从手工设计的距离度量(如 SSIM 等)[1, 6, 7] 到基于标注的人类相似性判断训练的度量(如 LPIPS [2] 或 DreamSim [3])。然而,这些方法将相似性建模为单一的标量量,而未对比较的方面进行条件控制。虽然之前的方法通过利用视觉-语言模型 [8, 9, 10] 引入了条件控制的概念,但据我们所知,目前不存在基于人类感知相似性判断收集的数据集作为验证基准。

为了填补这一空白,我们收集了一个包含 25K 个图像三元组的一百万个人类相似性判断的大规模数据集。遵循感知相似性研究中标准的基于三元组的协议 [2, 3, 11],标注者通过比较三张图像并提供相对感知判断,指出哪张图像最相似或最不相似。与以往工作不同,我们将此协议扩展到针对各种视觉方面的条件感知判断。我们收集了 260K 个三元组-方面条件组合,其中每个三元组都针对多个自由形式的视觉方面进行了标注,每个方面产生一组独立的相似性判断。这些三元组是使用文生图模型生成的,

预印本。

第 2 页

参考图像 哪张图像与参考图像更相似?

先前方法 LPIPS [2], DreamSim [3] SSIM [1] L2 (未选择) (无条件相似性)

本文方法:文本提示的图像感知相似性 (TPIPS) 主体颜色

牛雕像姿态

地面材质 旗帜图案

图 1:相似性的多种维度。给定一张参考图像(左上角),四张候选图像(右上角)以不同方式与参考图像相似,例如主体颜色、姿态、地面材质或纹理。然而,现有的视觉相似性度量方法(L2、SSIM [1]、LPIPS [2]、Dreamsim [3])将相似性坍缩为单一标量,从而产生模糊且不一致的结果。我们的文本提示的图像感知相似性 (TPIPS) 可以针对特定的相似性维度(方面)进行条件控制,并通过自由文本进行提示。通过条件控制,该视觉相似性问题不再模糊,我们的方法能够选出与人类感知判断一致的最相似图像。

设计旨在具有挑战性。如果候选图像之间的差异过于细微,人类无法可靠地判断相似性;如果差异过于粗糙,任务就会退化为判断整体相似性,而当前模型已经能够处理此类任务。我们瞄准中间地带,使用沿多个方面同时存在差异的图像——通过颜色、光照和纹理等属性的细粒度变化来实现。

我们利用这个合成数据集构建基准,并评估一系列基线方法,包括最近的开源和专有 VLM [12, 13, 14, 15] 以及最先进的多模态嵌入模型 [16, 17],结果显示仍有改进空间。我们发现,即使是最强的当前 VLM 系统,在指定方面上往往也与人类的相似性判断不一致。我们仔细提出并分析了将 VLM 调整为我们收集的感知数据上的方面条件感知度量的不同架构选择。我们的模型,文本提示的图像感知相似性 (TPIPS),显著缩小了性能差距。为了评估我们的度量在超出合成训练分布的情况下是否仍然可靠,我们收集了第二组人类相似性判断,针对由外部算法生成的输出,这些算法针对四种不同的视觉和图形任务设计,涵盖生成式和非生成式流水线。在这种设置下,我们的模型也优于基线方法,表明它可以作为方面条件评估的通用感知度量。

我们展示了几个下游应用:生成式视觉模型的评估,其中输出与参考图像的相似性沿指定的视觉轴进行测量;最近邻检索,其中同一查询图像在不同方面下返回不同的邻居;以及组合检索,其中多个查询图像(每个都针对不同的视觉方面进行条件控制)可以组合起来,以查找符合标准的图像。我们的代码、数据和训练好的模型位于 https://peterwang512.github.io/TPIPS。

2 相关工作

感知相似性与偏好。比较两张图像是视觉领域的一个基本问题,早期方法依赖于手工设计的、基于补丁的度量 [1, 6, 7]。随着深度图像识别的进步 [18, 19, 20, 21, 22, 23],人们发现学习到的深度特征比手工设计的描述符能提供更有效的相似性信号 [2, 24, 25, 26, 27]。LPIPS [2]、PieAPP [28] 和 DISTS [29] 直接优化深度特征,以更好地与人类对低级失真的判断保持一致。DreamSim [3] 学习人类对具有高级变化的合成图像的感知判断。Muttenthaler 等人 [30] 研究了跨对象类别的感知判断

2

第 3 页

与 THINGS [11]。其他工作提高了指标对空间偏移 [31]、对抗扰动 [32] 和任意变换 [33] 的鲁棒性。替代性指标隔离了特定的属性,如风格 [34, 35] 或视觉元素之间的关系 [36]。虽然这些方法预测单一相似度分数,但相似度本质上是多维度的 [4]。我们通过引入一个针对人类相似度判断的基准和模型来解决这一问题,该模型以各种视觉方面为条件。另一条独立但相邻的研究路线利用生成或编辑图像上的成对人类比较,来学习单个图像的标量质量分数 [37, 38, 39, 40]。相比之下,我们从三元组判断中学习,以建模以视觉方面为条件的成对相似度。

条件表示。各种研究研究了学习以不同方面为条件的输入表示。一条研究路线探索在给定显式方面时学习条件表示,但假设条件是固定且有限的词汇表 [41, 42, 43, 44, 45]。最近的工作将条件输入泛化为自由形式文本,包括通过视觉语言模型 [46, 47, 48] 的免训练方法,以及策划条件监督的训练方法。GeneCIS [8] 和 FocalLens [9] 从现有的视觉语言数据集中挖掘属性差异三元组,而 Omni-Attribute [10] 从 VLM 生成的标签中引导监督,TF-QARE [48] 提示图像的对象、背景或风格,并对 resulting 描述的嵌入进行平均。另一条平行的研究路线研究了上下文条件分类 [49, 50],组合图像检索 [51, 52, 53, 54] 接受图像文本输入,但使用文本来指定检索到的图像应与查询图像有何不同。与先前的条件相似度工作不同,我们在每个方面条件下直接收集人类相似度判断。这捕捉到了图像描述和 VLM 输出中不可靠存在的细粒度相对差异,使我们的方法比先前的免训练方法、训练方法以及最先进的 VLM 更好地与人类判断保持一致。

视觉语言模型。早期的视觉语言模型针对少量任务:双编码器对比模型 [22, 55, 56] 如 CLIP [22] 对齐图像和文本表示以用于检索和分类,而编码器-解码器模型如 BLIP [57, 58] 增加了图像描述和视觉问答功能。现代指令微调的多模态模型,包括 Qwen-VL 系列 [59, 60, 14, 61] 和其他模型 [62, 63, 15, 64],以及前沿专有系统如 Gemini [13] 和 GPT [12],是在更广泛的任务混合体上训练的 [63, 60, 15],在某些情况下还包括相似度基准,如 NIGHTS [3] 和 GeneCIS [8]。另一条通用的多模态嵌入器研究路线,如 VLM2Vec [16, 65] 和 Qwen3-VL-Embedding [17],将这些骨干网络重新用于指令条件检索。虽然 VLM 可以解决各种视觉任务,但我们发现 VLM 在生成以指定方面为条件的人类对齐成对相似度判断方面仍存在性能差距。我们的基准和模型有助于缩小这一差距。

3 数据集收集

我们的目标是收集一个相似度判断数据集 D,以便用于训练和评估文本条件相似度算法。人类感知相似度本质上是相对的:给定一组候选项(例如 3 张图像),人们可以可靠地识别出在光照、物体姿态或背景等视觉方面最不同的项,或者更近的一对 [4]。为此,如图 2 所示,我们收集了两个数据集:(1) 一个关于 Odd-one-out 判断的大型合成数据集,用于训练;(2) 一个较小的其他视觉和图形算法数据集,用于验证我们的算法在现实世界应用中的泛化能力。

3.1 Odd-one-out 数据集

给定一对图像,人类无法可靠地直接提供相似度分数,这导致先前的工作通过询问两个图像变体中哪一个更接近给定参考 [2, 3],或者哪张图像最不同 [11],从图像三元组中收集相对比较。在这种设置下,我们采用 Odd-one-out 任务 [11],并将其扩展到以各种视觉方面为条件的感知判断。也就是说,给定一个三元组 $X = \{x_1, x_2, x_3\}$,我们要求标注者在文本引导 $c$ 下挑选出看起来最不同的一个,将其记录为结果 $y$。接下来,我们描述生成三元组 $X$ 和文本条件 $c$ 的过程。

三元组生成。为了构建我们的数据集,我们策划了一个多样化但受控的图像变体集合。核心挑战在于确定最佳难度范围:三元组既不能太简单,即差异过大,也不能无信息量,即差异可忽略不计。此外,

第 4 页

图像 0

A 参考图像 B

选择图像 (A 或 B),其中 <aspect> 与参考图像看起来最相似

场景主体描绘,后院花园环境, 图像 1 图像 2 灰色石板露台板,木栅栏背景,绿色草坪前景…

选择 <aspect> 看起来最不同的图像

图像 图像 新颖 视角 相机 距离, 花朵 调色板, 光照 图像到3D 合成 合成 暖色调, 桌布 图案, 茶壶 把手 方向… 编辑

参考: 输入图像 前景或背景图像 输入图像 真实视图 合成图像 文本到图像 A/B: 编辑图像 合成图像 渲染视图 渲染视图 三元组变体 算法输出

(a) 文本到图像三元组(找不同) (b) 其他视觉算法(2AFC)

图 2:数据集。(左)我们要求用户在三元组中选出最不同的图像(Odd-one-out, OOO)。 图像是使用文本到图像模型的变体合成的,用于训练我们的文本条件相似性模型。(右)我们使用不同视觉和图形任务算法的输出测试泛化能力。 我们要求用户在两种算法输出中,哪一个与参考图像更相似,采用二选一强制选择(2AFC)设置。

表 1:数据集统计。我们报告图像三元组的数量、三元组-方面组合的数量以及总的人类投票数。每个三元组-方面组合获得 5 票;标注者也可以选择“无法判断”,此时该票将被丢弃。为了捕捉整体相似性,“整体”被包含在训练和评估的找不同数据集中作为其中一个方面,而 2AFC 评估仅针对方面条件。详见附录 A。

(a) 找不同数据集。 (b) 2AFC 分布外数据集。

划分 三元组 三元组-方面 人类投票 来源 三元组 三元组-方面 人类投票

训练集 22,157 234,662 938,960 图像编辑 256 1,633 4,838 验证集 185 1,947 7,496 图像合成 294 839 2,947 测试集 2,000 20,782 98,039 新视图合成 180 650 2,444 图像到3D 397 1,649 6,020 总计 24,342 257,391 1,044,495 总计 1,127 4,771 16,249

单个三元组内的图像必须在多个独立的文本条件方面表现出变化,以 necessitate 多面推理。从大规模图像数据集中随机采样或对视频数据集进行子采样通常会生成退化三元组,其中一张图像在所有方面都是异常值,或者图像之间的视觉距离过大,无法进行有意义的比较。

受 Fu 等人 [3] 的启发,我们利用文本到图像(T2I)、语言(LLM)和视觉-语言(VLM)模型来大规模提出候选三元组和文本条件。我们通过从 FLUX-Reason-6M [66] 采样提示词来生成候选三元组。一种直接的方法是从相同的提示词中采样图像,但这通常无法产生足够多样的变体。因此,我们在渲染三元组之前,使用语言模型生成给定提示词的变体。这产生了一个受控但多样化的候选集,同时允许人类判断哪些由文本引起的变体实际上反映在图像中。

文本引导提议与细化。对于每个生成的三元组,我们首先构建提示词候选集。在提示词变体生成过程中,我们还提示 LLM 识别图像中预期发生变化的方面。如果图像完全由输入文本提示词描述,这就足够了。然而,由于提示词与图像之间的映射不是一一对应的,图像可能与提示词有差异,或显示出额外的未指定属性。因此,

4

第 5 页

我们将三元组和候选列表输入视觉-语言模型(VLM)进行细化,移除不相关的选项,并添加提示中未明确说明的视觉变化因素(例如姿态或物体大小)。

生成的方面列表是故意过度完备的,并且不保证与人类描述(或关注)三元组中差异的方式一致。因此,我们将这些视为提议并进行剪枝。对于每个三元组,我们邀请 5 名标注员进行判断。我们提供额外的“无法判断”选项,如果该选项被 3 名或更多用户标记,则从列表中移除该属性。从剩余的三元组中,我们移除“无法判断”的投票并归一化,以获得概率分布 $y = (y_1, y_2, y_3) \in \Delta^3$。我们还询问整体相似度,记录在“overall”条件下。我们的最终数据集为 $D = \{(X^{(n)}, c^{(n)}, y^{(n)})\}_n$,其中每个数据点是一个三元组图像 $X^{(n)} = \{x^{(n)}_1, x^{(n)}_2, x^{(n)}_3\}$、方面条件 $c^{(n)}$ 和人类投票分布 $y^{(n)}$ 的元组。我们将数据集划分为训练集、验证集和测试集,如表 1 所示。

3.2 分布外 2AFC 数据集

为了测试对不同图像变化和内容的泛化能力,我们从其他计算机视觉算法的输出中整理了一个额外的分布外评估集。这一选择受到我们框架的实际用例——评估和比较视觉系统——的驱动,同时也因为算法输出提供了结构化且具有感知意义的变化。

与我们的主要数据集不同,此设置本质上是基于参考的:每个查询都附带一个参考图像(要么是算法输入,要么是真实目标)和多个候选输出。因此,我们采用二选一强制选择(2AFC)协议:给定一个方面 $c$,标注员会看到参考图像 $x_{ref}$ 和两个随机采样的输出 $(x_0, x_1)$,并选择在方面 $c$ 下哪个输出与参考图像更相似,通过平均多个标注员的投票得到 $y \in [0, 1]$。与找不同数据集类似,我们收集 5 名标注员的投票,并移除那些拥有 $\ge 3$ 个“无法判断”投票的数据点。我们还移除存在平局的数据点,因为它们对评估没有用处。

这产生了一个评估数据集 $D_{ext} = \{(x_{ref}, x_0, x_1, c, y)\}$。该分布外集中使用的外部算法和领域与训练数据不同;数据集统计信息的概述见表 1。更多细节见附录 A。

4 学习文本引导的感知相似性

4.1 目标

我们学习文本提示的相似度 $f_\theta(x_1, x_2 | c)$,使其与找不同数据集 $D$ 中标注员的选择保持一致。我们在图 3 中展示了该目标。假设对于某个三元组,所有标注员都选择 $x_k$ 为找不同的图像。这意味着其他两张图像之间的相似度 $f_\theta(x_i, x_j | c)$,其中 $\{i, j\} = \{1, 2, 3\} \setminus \{k\}$,应比任何涉及 $x_k$ 的图像对更相似。形式上,我们希望 $f_\theta$ 具有以下性质:

$$ f_\theta(x_i, x_j | c) > f_\theta(x_k, x_l | c) \quad \forall l \in \{i, j\}. \quad (1) $$

为了鼓励这种行为,我们遵循先前三元组找不同嵌入中使用的 softmax 选择模型 [30]。定义 $\bar{s}_k = s_{ij} = f_\theta(x_i, x_j | c)$ 和温度 $\tau > 0$,我们建模选择 $k$ 的预测似然,并使用标准交叉熵损失将其与人类投票 $y$ 进行比较。

$$ \hat{y}_k = p_\theta(k | X, c) = \frac{\exp \bar{s}_k/\tau}{\sum_{m=1}^3 \exp \bar{s}_m/\tau}, \quad L(\theta) = -\mathbb{E}_{(X, c, y) \sim D} \sum_{k=1}^3 y_k \log \hat{y}_k. \quad (2) $$

4.2 架构

视觉-语言模型(VLMs)是一个自然的起点,因为可以通过提示 VLM 来评估两张图像在给定文本条件下的相似度。然而,我们发现当前 VLM 的零样本判断与人类感知选择之间存在显著差距(第 5 节),这促使我们进行任务特定的微调。如图 3(右侧)所示,我们探索了三种架构,它们在如何

第 6 页

哪幅图像在光照方面最 不同? 𝑥! 𝑓! VLM 𝑐 “lighting”

𝑥! Text-conditioned 𝑓! pairwise similarity 𝑥" Cos 𝑠!" 𝑓! 𝑠!" VLM 𝑥! Human 𝑐 “lighting” judgements 𝑐 “lighting” VLM 𝑦 Cross- (a) Late fusion (Embedding) 𝑥" 𝑓! 𝑠!# 𝜏 𝑦$ Entropy Avg activation Δ 𝑠!" Softmax 𝑓! 𝑥! Predicted 𝑥" odd-one-out VLM 𝑓! 𝑠"# 𝑐 “lighting” = 𝑓$(𝑠", 𝑠#|𝑐) 𝑥" 𝑥# VLM (b) Mid-fusion 𝑐 “lighting” (Activation Difference) 𝑟! Cos 𝑠!" 𝑟" Learning Similarity from Odd-one-out Data (c) Early fusion

图 3:(左)从 Odd-one-out 数据中学习相似性。用户判断三元组中哪幅图像是 Odd-one-out,基于给定的条件(此处为 x1)。我们使用 fθ 预测三元组中所有图像对的文本条件成对相似性。直观上,未被选中的图像之间的相似性(如 s23)应最大。Odd-one-out 是通过在相似性上应用 softmax(带温度参数 τ)预测得到的,嵌入向量则通过交叉熵损失进行训练。(右)fθ 的架构选择:(a) Late fusion 分别对图像进行嵌入,仅在最后比较激活;(b) Mid-fusion 使用分别嵌入的图像之间的内部特征激活;(c) Early fusion 将两幅图像直接输入 VLM 进行联合嵌入。

两幅图像在网络中交互的早晚,从无交互(Late fusion)到完全联合注意力(Early fusion)。这三种方法均使用我们的损失函数(公式 2)进行端到端训练。

Late fusion (embeddings)。我们借鉴近期关于指令微调 VLM 检索器的研究 [67, 68],将 VLM 重新用作文本引导的嵌入模型。给定图像 x 和方面 c,我们构建提示语“Represent the similarity of the image based on <c> ”(根据 <c> 表示图像的相似性),并将其与 x 一起输入 VLM,取最后一个 token 的最终归一化隐藏状态作为嵌入 z = bgθ(x, c)。成对相似性即为两个嵌入的余弦相似度:fθ(x1, x2 | c) = bgθ(x1, c)⊤bgθ(x2, c)。这在推理时非常高效,因为嵌入可以预先计算并缓存。由于两幅图像在网络内部从未交互,模型必须独立地做出文本引导的总结。

Mid fusion (activation distances)。遵循 LPIPS [2] 的做法,我们可以改为比较来自 LLM 解码器层的 VLM 内部激活。我们将图像-提示对输入 VLM,对于选定的 L 个 transformer 层中的每一层,提取长度为 T 的图像 token,沿通道维度 d 进行单位归一化,以获得每层的特征 ϕℓ(x, c) ∈RT ×d。相似性定义为两幅图像每层特征之间负加权 ℓ2 距离,在图像 token 上平均,并在层间求和:

L T 1 2 fθ(x1, x2 | c) = − X X wℓ(c) ⊙ ϕℓ(x1, c)t −ϕℓ(x2, c)t 2. (3) T ℓ=1 t=1 与在冻结骨干网络上调整固定通道权重的 LPIPS 不同,我们的通道权重 wℓ(c) ∈Rd 是每层每通道的文本条件权重,由一个 MLP 参数化,该 MLP 接收同一层中平均文本 token 嵌入。我们 additionally 使用 LoRA [69] 适配器对 VLM 本身进行微调。与 Late fusion 类似,该架构独立处理每幅图像,仅在比较阶段进行融合。附录 B.2 更详细地分析了这些设计变更。

Early fusion 允许两幅图像在整个网络中交互。两幅图像和提示语“Measure the similarity between the two images based on <c> ”(根据 <c> 测量两幅图像之间的相似性)被打包成单个输入序列,

[ c tokens ∥x1 patches ∥x2 patches ∥r1 ∥r2 ], 使得 x1 的每个 patch 可以在每一层 attend 到 x2 的每个 patch,从而实现直接的 patch 级对应。两个可学习的 register token r1, r2 充当两幅图像的文本条件读出。它们的最终隐藏状态 h1, h2 产生相似性得分:fθ(x1, x2 | c) = h⊤1 h2 / (∥h1∥∥h2∥)。

6

第 7 页

Gemini-3.1-Pro GPT-5.4 Qwen3-VL-Embedding-8B Ours Human

图像 1 背景天际线 引擎盖 显著性 位置 A 参考 B

𝑥!

𝑥# 𝑥"

光照 街道表面 3D 形状 暖色调 反射 表面纹理

色调

相机姿态

图像 2 图像 3 (a) 找不同感知判断 (b) 2AFC 感知判断

图 4:人类是否与模型的选择一致?我们比较了 VLM、我们的模型和人类在不同点颜色和图案表示下的方面条件相似性。(左)找不同:点的位置表示每种方法针对该方面选择的最不同图像。(右)2AFC:点的位置表示被选为与参考更相似的图像。注意,我们的方法(黑色)与人类判断一致,而 VLM 通常不一致。

重要的是,通过精心设计注意力掩码和位置编码(详见附录 C.2),我们无需任何辅助损失即可通过构造满足两个理想属性:对称性,$f_\theta(x_1, x_2 | c) = f_\theta(x_2, x_1 | c)$,以及恒等性,对于任意 $x$,$f_\theta(x, x | c) = 1$。我们在附录 C 中详细说明了超参数、训练过程、提示词和骨干网络。

5 实验

我们在找不同和分布外 2AFC 测试集上进行评估。我们的数据集提升了 VLM 在其他感知相似性基准上的表现。我们讨论了我们的方法的应用,例如方面条件检索和组合检索,并展示了定性示例。

指标。对于三元组中的每个方面,我们报告模型与人类的一致性 [2],衡量随机评分者同意模型首选结果的频率。对于具有人类投票分布 $y = (y_1, y_2, y_3)$ 的找不同三元组和模型预测 $\hat{k} = \arg \max_k \hat{y}_k$,一致性为 $\hat{y}_{\hat{k}}$——即人类投票与模型预测相同的概率。对测试集上所有方面条件取平均,得到预期的评分者-模型一致性。2AFC 的类似物在两个选项上以相同方式定义。

为了对绝对一致性数值进行背景化,我们计算人类共识。它定义为 $y_1^2 + y_2^2 + y_3^2$,即每个方面条件下评分者内部的一致性期望,在测试集上平均。这种人类共识反映了可实现的最佳一致性;我们将它与所有一致性数值一起报告。同样,2AFC 的类似物在两个选项上以相同方式定义。

基线方法如下:

• 经典方法:LPIPS [2],DreamSim [3]。无论查询的方面如何,都应用相同的相似度分数。 • 晚期融合(嵌入):文本-图像嵌入模型,包括文本条件编码器(SteerViT [70])、文本和图像嵌入的晚期混合(GeneCIS [8])、VLM 微调嵌入模型(VLM2Vec-2.0 [65],Qwen3-VL-Embedding [17])以及专有模型(Gemini-2-Embedding [13])。 • 早期融合:VLM,包括开源权重模型(Qwen3-VL [14],InternVL3.5 [71] 和 LLaVA-OneVision [63])以及专有模型(GPT-5.4 和 Gemini 3.1 Pro)。每个模型都被提供两幅图像和文本提示,并要求返回 [0, 10] 范围内的标量值。 • 中期融合(激活差异):我们发现 Qwen3-VL 系列是晚期融合和早期融合中表现最好的开源权重骨干网络,并专注于该家族进行中期融合分析。

基线的更多实现细节见附录 C.3。

我们在图 5 中展示了主要结果。在我们的找不同任务中,人类共识(67.5%,随机机会为 33.3%)与基线模型预测之间存在显著差距,跨越了

7

第 8 页

找不同(分布内) 2AFC(分布外) 准确率 经典方法 早期融合 中期融合 晚期融合 经典方法 早期融合 中期融合 晚期融合

79.3 80% 71.9 75.9 71.2 70.8 74.0 72.2 73.5 77.9 69.5 72.9 73.7 70.7 人类 共识: 67.5% 64.7 64.2 65.2 64.1 63.8 59.2 58.3 54.5 53.5 60% 54.1 53.0 51.4 50.5 55.5 58.4 50.0一致性100% 人类共识:89.3% 46.2 44.9 44.5 44.0 人类 40%20% 33.3 模型 0%随机LPIPS DreamSimGemini-3.1-ProGPT-5.4InternVL3.5LLAVA-OVQwen3-VL8B 7B 8BOurs 8BOursVLM2Vecv2.0SteerViTGeneCIS 8BOurs随机LPIPSDreamSimGemini-3.1-ProGPT-5.4InternVL3.5LLAVA-OVQwen3-VL8B 7B 8BOurs 8BOursVLM2Vecv2.0SteerViTGeneCIS 8BOurs Qwen3-VL-Emb Qwen3-VL-Emb Qwen3-VL-Emb Qwen3-VL-Emb Gemini-2-Embedding Gemini-2-Embedding

图 5:模型与人类感知判断的一致性如何?我们报告了近期视觉语言模型和文本-图像嵌入方法中与人类的一致性率,分类为经典方法、早期融合、中期融合和晚期融合。左侧展示了我们在合成数据集 D 上的结果。右侧展示了我们的保留分布 Dext。误差棒表示 2 倍标准误。我们发现我们的方法(红色柱状图)在域内找不同测试和域外 2AFC 测试中均持续优于基线。我们的早期融合模型与其他两种变体相比,具有略微更好的模型-人类一致性。虚线表示人类-人类一致性率,作为性能上限。扩展比较详见表 3。

0 帧 到 相似度

(参考) 0 32 64 96 128

图 6:视频示例。视频帧与初始帧之间的相似度。虽然整体相似度主要由主要因素(相机角度以及阳光)主导,但该指标可以引导至不同的属性,例如杯把手的位置。

任务。LPIPS (46.2%) 和 DreamSim (50.5%) 是方面无关的,仅提供整体相似度判断是不够的。在基线模型中,Gemini-3.1-Pro 在找不同任务中实现了最高的模型-人类一致性,达到 58.4%。在开源权重模型中,基于嵌入的 Qwen3-VL-Embed 在两项任务中表现最佳,因此我们将其作为我们方法的骨干网络。在我们的数据上进行微调显著缩小了与人类共识的差距,将找不同任务中的差距从 9.1% 降低到 2.8%。值得注意的是,这些增益也转化到了保留的 2AFC 分布中,将误差从 15.8% 降低到 10.0%,优于基线。与域内找不同测试集相比,较大的差距留下了更多的改进空间。图 4 展示了定性示例。

早期、中期和晚期融合。在基线模型中,没有单一的融合策略能始终占据主导地位。由于这些模型是在各种设置下训练的,因此比较并非直接可比。中期融合在现成基线中表现相对较差,因为此类模型并非旨在直接产生信息丰富的中期特征。在我们使用相同基础模型对所有模型类型进行微调的控制设置中,早期融合始终优于中期和晚期融合,尽管优势幅度 modest。这表明,允许模型从最早层开始与两幅图像交互,有利于感知相似度判断。另一方面,晚期融合模型实现了相似的性能,但通过预计算嵌入实现了高效的检索。除非另有说明,我们将主要展示晚期融合模型的结果。我们在附录 B.2 中更详细地分析了数据集规模和模型大小的影响。

8

第 9 页

相机视角

物体颜色

背景

构图

季节

背景

TPIPS (本文方法) Qwen3-VL-Embed 查询 检索图像(相似方面,整体不同) 图 7:基于方面的图像检索。给定左侧的查询,我们的方法针对不同的视觉方面检索图像。每一行代表一个方面。与基础模型(Qwen-VL-8B-Embedding)相比,我们微调的晚期融合模型始终能检索到与指定方面更匹配的图像。为了鼓励检索多样性,我们通过从方面相似度中减去整体相似度的一部分来调整排名分数。我们在附录 B.1 中也包含了未经此调整的检索结果。

光线暖度

物体视角

背景

笔触

主题内容

调色板

组合查询 检索图像 图 8:组合检索。每个查询都指定了不同的方面,我们直接将两个查询的相似度得分相加以对数据进行排序。例如,结合 (1) 基于主题内容条件化的两个坐着的人的绘画,以及 (2) 基于笔触条件化的莫奈的绘画,可以得到两个坐着的人的印象派绘画。当我们将第二个查询替换为特定于调色板的查询时,我们可以检索到具有相同粉色和蓝色色调的两个人物肖像。

9

第 10 页

定性视频示例。在图 6 中,我们展示了一个相机围绕茶杯旋转的合成视频,并计算每一帧与初始帧之间的指标。变化的主要因素是“相机角度”,以及视频中间出现的“阳光”。因此,“整体”相似性反映了这两个主要因素。然而,该指标可以通过提示针对完全不同的因素。由于杯子数量几乎保持不变,而当勺子被杯子遮挡消失时,勺子数量会下降。更显著的是,提示“杯把手位置”会导致较大的扰动,因为把手从右侧移动到了左侧。

方面条件检索。图 7 说明了在给定相同查询的情况下,我们的方法如何在不同的方面条件下检索感知相似图像。我们对 OpenImages [72] 训练集(170 万张图像)建立索引,并针对每个方面独立检索最近邻。我们通过调整相似度分数为 $f_\theta(x_1, x_2 | c_{\text{aspect}}) – 0.3 * f_\theta(x_1, x_2 | c_{\text{overall}})$,鼓励每个方面的检索结果包含外观差异更大的图像,其中 $c_{\text{aspect}}$ 和 $c_{\text{overall}}$ 分别代表方面条件和整体条件。结果清楚地表明,感知相似性是依赖于上下文的。相同的查询会根据方面条件的不同产生意义不同的最近邻。我们在附录 B.1 中提供了未经相似度调整检索结果。

组合检索。我们的方法支持通过线性组合针对不同方面条件条件下的多个查询的相似度分数来实现组合查询。我们再次在 OpenImages 上对此进行了验证,并展示了在 WikiArt 数据集 [73](80 万张图像)上的结果,在该数据集中,主题内容、笔触和调色板等方面捕捉了视觉相似性中独立且有意义的维度。如图 8 所示,跨不同方面组合查询会产生同时满足所有指定条件的检索结果,而交换单个查询组件会导致可解释性不同的结果。我们在附录 B.1 中提供了更多定性结果。

6 讨论、更广泛的影响与局限性

除了将我们的指标用作人类细粒度、方面条件的评判者之外,它还可以作为改进这些模型的反馈信号,因为最近的工作利用 VLM 反馈来训练图像编辑 [74, 75] 和生成 [37, 76] 模型。我们的方法还可以辅助可解释性系统,这些系统自动发现并表征神经特征 [77, 78]。我们的指标提供了与人类对齐的测量方法,以评估所发现的特征编码了哪些细粒度视觉属性。随着生成式和感知视觉系统的更广泛部署,可解释性对于公众监督、问责制和知情监管变得至关重要。

我们的基于 VLM 的指标在计算上比 LPIPS 或 DreamSim 昂贵得多。此外,我们当前的基于嵌入的检索需要针对每个方面条件分别进行特征编码和索引。另外,我们的标注者池并不能代表所有观众;感知因人而异,我们的指标继承了这种偏差。我们的方法还受到训练数据多样性的限制。我们的提示来源于 FLUX-Reason-6M [66],其中包含更多经过美学筛选的图像。我们的方面建议是由 VLM 生成的,我们可能会系统地遗漏 VLM 无法捕捉的方面。由于我们的三元组通常具有相似的语义内容,我们学习的指标并未完全从原始内容中解耦(例如,阳光明媚的海滩图像在其他类似的海滩图像上的天气相似性得分会高于阳光明媚的森林图像)。数据相关问题可以通过未来工作中更多样化的图像来源和人工标注的方面来解决。话虽如此,随着 VLM 的不断进步,我们的流程自然会受益——我们将人类感知数据视为构建更多与人类对齐模型的互补信号,为收集细粒度的人类感知判断提供了新的角度。

致谢。我们感谢 Nupur Kumari、Kangle Deng 和 Antonio Torralba 对草稿提供的有益讨论和反馈。Sheng-Yu Wang 获得了 Google 博士奖学金的支持。该项目部分由 Adobe Inc.、Packard 奖学金、韩国政府资助的信息与通信技术规划与评估研究所 (IITP) 资助 (No. RS-2024-00457882,国家 AI 研究实验室项目)、NSF IIS-2239076、NSF ISS-2403303 和 NSF IIS-2403305 资助。

参考文献

[1] Zhou Wang, Alan C Bovik, Hamid R Sheikh, and Eero P Simoncelli. Image quality assessment: from error visibility to structural similarity. IEEE Transactions on Image Processing, 13(4):600–612, 2004.

10

第 11 页

[2] Richard Zhang, Phillip Isola, Alexei A Efros, Eli Shechtman, 和 Oliver Wang. 深度特征作为感知度量的不合理有效性。在 IEEE 计算机视觉与模式识别会议论文集 (CVPR) 中,第 586–595 页,2018 年。

[3] Stephanie Fu, Netanel Y Tamir, Shobhita Sundaram, Lucy Chai, Richard Zhang, Tali Dekel, 和 Phillip Isola. DreamSim:使用合成数据学习人类视觉相似性的新维度。在神经信息处理系统进展 (NeurIPS) 中,2023 年。

[4] Amos Tversky. 相似性的特征。《心理评论》,84(4):327–352,1977 年。

[5] Douglas L Medin, Robert L Goldstone, 和 Dedre Gentner. 对相似性的尊重。《心理评论》,100(2):254–278,1993 年。

[6] Lin Zhang, Lei Zhang, Xuanqin Mou, 和 David Zhang. FSIM:一种用于图像质量评估的特征相似性指数。《IEEE 图像处理汇刊》,20(8):2378–2386,2011 年。

[7] Rafat Mantiuk, Kil Joong Kim, Allan G Rempel, 和 Wolfgang Heidrich. HDR-VDP-2:一种在所有亮度条件下预测可见性和质量的校准视觉度量。《ACM 图形学汇刊》(SIGGRAPH 会议论文集),30(4):40:1–40:14,2011 年。

[8] Sagar Vaze, Nicolas Carion, 和 Ishan Misra. GeneCIS:通用条件图像相似性基准。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,第 6862–6872 页,2023 年。

[9] Cheng-Yu Hsieh, Pavan Kumar Anasosalu Vasu, Fartash Faghri, Raviteja Vemulapalli, Chun-Liang Li, Ranjay Krishna, Oncel Tuzel, 和 Hadi Pouransari. Focallens:指令微调实现零样本条件图像表示。arXiv 预印本 arXiv:2504.08368,2025 年。

[10] Tsai-Shien Chen, Aliaksandr Siarohin, Guocheng Gordon Qian, Kuan-Chieh Jackson Wang, Egor Nemchinov, Moayed Haji-Ali, Riza Alp Guler, Willi Menapace, Ivan Skorokhodov, Anil Kag 等人。Omni-attribute:用于视觉概念个性化的开放词汇属性编码器。arXiv 预印本 arXiv:2512.10955,2025 年。

[11] Martin N Hebart, Adam H Dickter, Alexis Kidder, Wan Y Kwok, Anna Corriveau, Caitlin Van Wicklin, 和 Chris I Baker. THINGS:包含 1,854 个物体概念和超过 26,000 张自然物体图像的数据库。《PLOS ONE》,14(10):e0223792,2019 年。

[12] OpenAI。GPT-4V(ision) 系统卡片。OpenAI 技术报告,2023 年。

[13] Gemini Team, Google。Gemini:一系列高度多模态模型。arXiv 预印本 arXiv:2312.11805,2023 年。

[14] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge 等人。Qwen3-vl 技术报告。arXiv 预印本 arXiv:2511.21631,2025 年。

[15] Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu 等人。Internvl:扩展视觉基础模型并针对通用视觉-语言任务进行对齐。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 中,第 24185–24198 页,2024 年。

[16] Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, 和 Wenhu Chen。VLM2Vec:为大规模多模态嵌入任务训练视觉-语言模型。在国际学习表征会议 (ICLR) 中,2025 年。

[17] Mingxin Li, Yanzhao Zhang, Dingkun Long, Keqin Chen, Sibo Song, Shuai Bai, Zhibo Yang, Pengjun Xie, An Yang, Dayiheng Liu, Jingren Zhou, 和 Junyang Lin。Qwen3-VL-Embedding 和 Qwen3-VL-Reranker:用于最先进的多模态检索和排序的统一框架。arXiv 预印本,2026 年。

[18] Alex Krizhevsky, Ilya Sutskever, 和 Geoffrey E Hinton. 使用深度卷积神经网络进行 ImageNet 分类。在神经信息处理系统进展 (NeurIPS) 中,2012 年。

[19] Karen Simonyan 和 Andrew Zisserman. 用于大规模图像识别的非常深的卷积网络。在国际学习表征会议 (ICLR) 中,2015 年。

[20] Kaiming He, Xiangyu Zhang, Shaoqing Ren, 和 Jian Sun. 用于图像识别的深度残差学习。在 IEEE 计算机视觉与模式识别会议论文集 (CVPR) 中,第 770–778 页,2016 年。

[21] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, 和 Neil Houlsby. 一张图片值 16×16 个词:用于大规模图像识别的 Transformer。在国际学习表征会议 (ICLR) 中,2021 年。

11

第 12 页

[22] Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, 等。从自然语言监督中学习可迁移的视觉模型。在 国际机器学习会议 (ICML) 上,第 8748–8763 页。PmLR, 2021。

[23] Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jégou, Julien Mairal, Patrick Labatut, Armand Joulin, 和 Piotr Bojanowski。DINOv2:无监督学习鲁棒的视觉特征。机器学习研究汇刊 (TMLR),2024。

[24] Justin Johnson, Alexandre Alahi, 和 Li Fei-Fei。用于实时风格迁移和超分辨率的感知损失。在 欧洲计算机视觉会议 (ECCV) 上,第 694–711 页。Springer,2016。

[25] Leon A Gatys, Alexander S Ecker, 和 Matthias Bethge。使用卷积神经网络进行图像风格迁移。在 IEEE 计算机视觉与模式识别会议论文集 (CVPR) 上, 第 2414–2423 页,2016。

[26] Dan Amir 和 Yair Weiss。理解并简化感知距离。在 IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR) 上,第 12226–12235 页,2021。

[27] Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, 和 Jason Y Zhang。Vlic:作为人类对齐图像压缩感知裁判的视觉-语言模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集上, 2026。

[28] Ekta Prashnani, Hong Cai, Yasamin Mostofi, 和 Pradeep Sen。PieAPP:通过成对偏好进行感知图像误差评估。在 IEEE 计算机视觉与 模式识别会议论文集 (CVPR) 上,第 1808–1817 页,2018。

[29] Keyan Ding, Kede Ma, Shiqi Wang, 和 Eero P Simoncelli。图像质量评估:统一结构和纹理相似性。IEEE 模式分析与机器智能汇刊 (TPAMI), 44(5):2567–2581,2020。

[30] Lukas Muttenthaler, Jonas Dippel, Lorenz Linhardt, Robert A Vandermeulen, 和 Simon Kornblith。 神经网络表示的人类对齐。在国际学习表征会议 (ICLR) 上,2023。

[31] Abhijay Ghildyal 和 Feng Liu。平移容忍的感知相似性度量。在欧洲计算机视觉会议 (ECCV) 上,第 91–107 页。Springer,2022。

[32] Sara Ghazanfari, Alexandre Araujo, Prashanth Krishnamurthy, Farshad Khorrami, 和 Siddharth Garg。 LipSim:一种可证明鲁棒的感知相似性度量。在 国际学习表征会议 (ICLR) 上,2024。

[33] Markus Kettunen, Erik Härkönen, 和 Jaakko Lehtinen。E-LPIPS:通过随机变换集成实现鲁棒的感知图像相似性。arXiv 预印本 arXiv:1906.03973,2019。

[34] Elena Garces, Aseem Agarwala, Diego Gutierrez, 和 Aaron Hertzmann。插画风格的相似性度量。2014。

[35] Gowthami Somepalli, Anubhav Gupta, Kamal Gupta, Shramay Palta, Micah Goldblum, Jonas Geiping, Abhinav Shrivastava, 和 Tom Goldstein。测量扩散模型中的风格相似性。在欧洲 计算机视觉会议 (ECCV) 上,2024。

[36] Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, 和 Yuheng Li。关系视觉相似性。在 IEEE/CVF 计算机视觉与 模式识别会议论文集上,2026。

[37] Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, 和 Yuxiao Dong。 ImageReward:学习和评估文本到图像生成的人类偏好。arXiv 预印本 arXiv:2304.05977,2023。

[38] Yuval Kirstain, Adam Polyak, Uriel Singer, Shahbuland Matiana, Joe Penna, 和 Omer Levy。Pick-a-pic: 一个用于文本到图像生成用户偏好的开放数据集。在神经信息处理系统 (NeurIPS) 上,2023。

[39] Xiaoshi Wu, Yiming Hao, Keqiang Sun, Yixiong Chen, Feng Zhu, Rui Zhao, 和 Hongsheng Li。人类 偏好评分 v2:评估文本到图像合成人类偏好的坚实基准。 arXiv 预印本 arXiv:2306.09341,2023。

[40] Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, 和 Wenhu Chen。Editreward:一种用于指令引导图像编辑的 人类对齐奖励模型。在 国际学习表征会议 (ICLR) 上,2026。

12

第 13 页

[41] Ehsan Amid 和 Antti Ukkonen。多视图三元组嵌入:在多张地图中学习属性。在《国际机器学习会议》(ICML)中,第 1472–1480 页。PMLR,2015 年。

[42] Andreas Veit、Serge Belongie 和 Theofanis Karaletsos。条件相似性网络。在《IEEE 计算机视觉与模式识别会议论文集》(CVPR)中,第 830–838 页,2017 年。

[43] Mariya I Vasileva、Bryan A Plummer、Krishna Dusad、Shreya Rajpal、Ranjitha Kumar 和 David Forsyth。学习类型感知的时尚兼容性嵌入。在《欧洲计算机视觉会议》(ECCV)中,第 390–405 页,2018 年。

[44] William Thong、Cees GM Snoek 和 Arnold WM Smeulders。用于实例、属性和类别检索的合作嵌入。arXiv 预印本 arXiv:1904.01421,2019 年。

[45] Reuben Tan、Mariya I Vasileva、Kate Saenko 和 Bryan A Plummer。无需显式监督学习相似性条件。在《IEEE/CVF 国际计算机视觉会议论文集》(ICCV)中,第 10373–10382 页,2019 年。

[46] Masayuki Kawarada、Kosuke Yamada、Antonio Tejero-de Pablos 和 Naoto Inoue。利用大型视觉语言模型免训练的条件图像嵌入框架。在《IEEE/CVF 计算机视觉应用冬季会议论文集》中,第 7636–7646 页,2026 年。

[47] Siting Li、Xiang Gao 和 Simon Shaolei Du。突出关键点:用于属性聚焦图像检索的可提示嵌入。在《神经信息处理系统进展》(NeurIPS)中,2025 年。

[48] Yibing Wei、Sudeep Katakol、Manuel Brack、Jinhong Lin、Haoyue Bai、Yu-Teng Li、Richard Zhang、Eli Shechtman、Hareesh Ravi 和 Ajinkya Kale。迈向文本引导的属性解耦多模态表示学习。在 CVPR 中,2026 年。

[49] Zilin Wang、Sangwoo Mo、Stella X Yu、Sima Behpour 和 Liu Ren。具有上下文特征学习的开放即席分类。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR)中,2025 年。

[50] Sehyun Kwon、Jaeseung Park、Minkyu Kim、Jaewoong Cho、Ernest K Ryu 和 Kangwook Lee。基于文本条件的图像聚类。在《国际表征学习会议》(ICLR)中,2024 年。

[51] Nam Vo、Lu Jiang、Chen Sun、Kevin Murphy、Li-Jia Li、Li Fei-Fei 和 James Hays。组合文本与图像进行图像检索——一次经验探索。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR)中,第 6439–6448 页,2019 年。

[52] Zheyuan Liu、Cristian Rodriguez-Opazo、Damien Teney 和 Stephen Gould。使用预训练视觉-语言模型在真实图像上进行图像检索。在《IEEE/CVF 国际计算机视觉会议论文集》(ICCV)中,第 2125–2134 页,2021 年。

[53] Kuniaki Saito、Kihyuk Sohn、Xiang Zhang、Chun-Liang Li、Chen-Yu Lee、Kate Saenko 和 Tomas Pfister。Pic2Word:将图片映射到单词以实现零样本组合图像检索。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR)中,第 19305–19314 页,2023 年。

[54] Alberto Baldrati、Lorenzo Agnolucci、Marco Bertini 和 Alberto Del Bimbo。使用文本反转进行零样本组合图像检索。在《IEEE/CVF 国际计算机视觉会议论文集》(ICCV)中,第 15338–15347 页,2023 年。

[55] Xiaohua Zhai、Basil Mustafa、Alexander Kolesnikov 和 Lucas Beyer。用于语言图像预训练的 Sigmoid 损失。在《IEEE/CVF 国际计算机视觉会议论文集》(ICCV)中,第 11975–11986 页,2023 年。

[56] Mehdi Cherti、Romain Beaumont、Ross Wightman、Mitchell Wortsamen、Gabriel Ilharco、Cade Gordon、Christoph Schuhmann、Ludwig Schmidt 和 Jenia Jitsev。对比语言-图像学习的可复现缩放定律。在《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR)中,第 2818–2829 页,2023 年。

[57] Junnan Li、Dongxu Li、Caiming Xiong 和 Steven Hoi。BLIP:通过引导语言-图像预训练实现统一的视觉-语言理解与生成。在《国际机器学习会议》(ICML)中,第 12888–12900 页。PMLR,2022 年。

[58] Junnan Li、Dongxu Li、Silvio Savarese 和 Steven Hoi。BLIP-2:通过冻结图像编码器和大型语言模型引导语言-图像预训练。在《国际机器学习会议》(ICML)中,2023 年。

[59] Jinze Bai、Shuai Bai、Shusheng Yang、Shijie Wang、Sinan Tan、Peng Wang、Junyang Lin、Chang Zhou 和 Jingren Zhou。Qwen-VL:一种多功能的视觉语言模型,用于理解、定位、文本阅读及更多。arXiv 预印本 arXiv:2308.12966,2023 年。

[60] Peng Wang、Shuai Bai、Sinan Tan、Shijie Wang、Zhihao Fan、Jinze Bai、Keqin Chen、Xuejing Liu、Jialin Wang、Wenbin Ge 等人。Qwen2-VL:增强视觉语言模型在任何分辨率下对世界的感知。arXiv 预印本 arXiv:2409.12191,2024 年。

13

第 14 页

[61] Qwen Team。Qwen3.5:基于早期融合多模态训练的统一视觉-语言基础模型。 https://github.com/QwenLM/Qwen3.5, 2026。技术博客文章。

[62] Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Serkan Cabi, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Jacob Menick, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, 和 Karen Simonyan。Flamingo:用于少样本学习的视觉语言模型。在 Alice H. Oh, Alekh Agarwal, Danielle Belgrave, 和 Kyunghyun Cho 编辑的《神经信息处理系统进展》中,2022。

[63] Bo Li, Yuanhan Zhang, Dong Guo, Renrui Zhang, Feng Li, Hao Zhang, Kaichen Zhang, Yanwei Li, Ziwei Liu, 和 Chunyuan Li。LLaVA-OneVision:轻松的视觉任务迁移。arXiv 预印本 arXiv:2408.03326, 2024。

[64] Zhiyu Wu, Xiaokang Chen, Zizheng Pan, Xingchao Liu, Wen Liu, Damai Dai, Huazuo Gao, Yiyang Ma, Chengyue Wu, Bingxuan Wang, Zhenda Xie, Yu Wu, Kai Hu, Jiawei Wang, Yaofeng Sun, Yukun Li, Yishi Piao, Kang Guan, Aixin Liu, Xin Xie, Yuxiang You, Kai Dong, Xingkai Yu, Haowei Zhang, Liang Zhao, Yisong Wang, 和 Chong Ruan。Deepseek-vl2:用于高级多模态理解的混合专家视觉语言模型,2024。

[65] Rui Meng, Ziyan Jiang, Ye Liu, Mingyi Su, Xinyi Yang, Yuepeng Fu, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, 等人。VLM2Vec-V2:推进视频、图像和视觉文档的多模态嵌入。arXiv 预印本 arXiv:2507.04590, 2025。

[66] Rongyao Fang, Aldrich Yu, Chengqi Duan, Linjiang Huang, Shuai Bai, Yuxuan Cai, Kun Wang, Si Liu, Xihui Liu, 和 Hongsheng Li。Flux-reason-6m & prism-bench:百万级文本到图像推理数据集与综合基准。arXiv 预印本 arXiv:2509.09680, 2025。

[67] Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, 和 Wenhu Chen。VLM2Vec:训练用于大规模多模态嵌入任务的视觉语言模型。在《学习表征国际会议》(ICLR) 中,2025。

[68] Chankyu Lee, Rajarshi Roy, Mengyao Xu, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, 和 Wei Ping。NV-Embed:训练大语言模型作为通用嵌入模型的改进技术。在《学习表征国际会议》(ICLR) 中,2025。

[69] Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, 和 Weizhu Chen。LoRA:大语言模型的低秩自适应。在《学习表征国际会议》(ICLR) 中,2022。

[70] Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, 和 Yuki M Asano。可操控的视觉表示。arXiv 预印本 arXiv:2604.02327, 2026。

[71] Weiyun Wang, Zhangwei Gao, Lixin Gu, Hengjun Pu, Long Cui, Xingguang Wei, Zhaoyang Liu, Linglin Jing, Shenglong Ye, Jie Shao, 等人。Internvl3.5:在通用性、推理能力和效率方面推进开源多模态模型。arXiv 预印本 arXiv:2508.18265, 2025。

[72] Alina Kuznetsova, Hassan Rom, Neil Alldrin, Jasper Uijlings, Ivan Krasin, Jordi Pont-Tuset, Shahab Kamali, Stefan Popov, Matteo Malloci, Alexander Kolesnikov, Tom Duerig, 和 Vittorio Ferrari。 Open Images Dataset V4:大规模统一的图像分类、目标检测和视觉关系检测。《国际计算机视觉杂志》(IJCV), 2020。

[73] Wei Ren Tan, Chee Seng Chan, Hernan Aguirre, 和 Kiyoshi Tanaka。改进的 artgan 用于自然图像和艺术作品的条件合成。《IEEE图像处理汇刊》, 28(1):394–409, 2019。

[74] Nupur Kumari, Sheng-Yu Wang, Nanxuan Zhao, Yotam Nitzan, Yuheng Li, Krishna Kumar Singh, Richard Zhang, Eli Shechtman, Jun-Yan Zhu, 和 Xun Huang。无需图像编辑对学习图像编辑模型。在 ICLR 中,2026。

[75] Grace Luo, Jonathan Granskog, Aleksander Holynski, 和 Trevor Darrell。双过程图像生成。 arXiv 预印本 arXiv:2506.01955, 2025。

[76] Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang, 和 Ping Luo。DanceGRPO:释放 GRPO 在视觉生成中的潜力。arXiv 预印本 arXiv:2505.07818, 2025。

[77] Tamar Rott Shaham, Sarah Schwettmann, Franklin Wang, Achyuta Rajaram, Evan Hernandez, Jacob Andreas, 和 Antonio Torralba。一种多模态自动可解释性智能体。在 ICML 中,2024。

[78] Viacheslav Surkov, Chris Wendler, Antonio Mari, Mikhail Terekhov, Justin Deschenaux, Robert West, Caglar Gulcehre, 和 David Bau。一步足矣:用于文本到图像扩散模型的稀疏自编码器。arXiv 预印本 arXiv:2410.22366, 2024。

[79] An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, 等人。Qwen3 技术报告。arXiv 预印本 arXiv:2505.09388, 2025。

14

第 15 页

[80] Black Forest Labs. FLUX.1: Open-weight rectified flow transformers for text-to-image generation. https://blackforestlabs.ai/announcing-black-forest-labs/, 2024. [81] Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, and Bihan Wen. Geditbench v2: A human-aligned benchmark for general image editing. arXiv preprint arXiv:2603.28547, 2026. [82] Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, et al. Emerging properties in unified multimodal pretraining. arXiv preprint arXiv:2505.14683, 2025. [83] Black Forest Labs. FLUX.2: Frontier visual intelligence. https://bfl.ai/blog/flux-2, 2025. [84] Meituan LongCat Team. LongCat-Image technical report. arXiv preprint arXiv:2512.07584, 2025. [85] Chenyuan Wu et al. OmniGen2: Towards instruction-aligned multimodal generation. arXiv preprint arXiv:2506.18871, 2025. [86] Qwen Team. Qwen-Image-Edit: Image editing with higher quality and efficiency. https://qwenlm. github.io/blog/qwen-image-edit, 2025. [87] Step1X-Image Team. Step1X-Edit: A practical framework for general image editing. arXiv preprint arXiv:2504.17761, 2025. [88] Lvmin Zhang, Anyi Rao, and Maneesh Agrawala. Scaling in-the-wild training for diffusion-based illumination harmonization and editing by imposing consistent light transport. In International Conference on Learning Representations (ICLR), 2025. [89] Yong Liu, Wenpeng Xiao, Qianqian Wang, et al. DreamLight: Towards harmonious and consistent image relighting. arXiv preprint arXiv:2506.14549, 2025. [90] Jianqi Chen, Yilan Zhang, Zhengxia Zou, Keyan Chen, and Zhenwei Shi. Zero-shot image harmonization with generative model prior. IEEE Transactions on Multimedia, 27:4494–4507, 2025. [91] Jonathan T. Barron, Ben Mildenhall, Dor Verbin, Pratul P. Srinivasan, and Peter Hedman. Mip-NeRF 360: Unbounded anti-aliased neural radiance fields. In Conference on Computer Vision and Pattern Recognition (CVPR), 2022. [92] Matthew Tancik, Ethan Weber, Evonne Ng, Ruilong Li, Brent Yi, Justin Kerr, Terrance Wang, Alexander Kristoffersen, Jake Austin, Kamyar Salahi, Abhik Ahuja, David McAllister, and Angjoo Kanazawa. Nerfstudio: A modular framework for neural radiance field development. In ACM SIGGRAPH Conference Proceedings, 2023. [93] Bernhard Kerbl, Georgios Kopanas, Thomas Leimkühler, and George Drettakis. 3D Gaussian splatting for real-time radiance field rendering. ACM Transactions on Graphics (SIGGRAPH), 2023. [94] Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron, Ravi Ramamoorthi, and Ren Ng. Nerf: Representing scenes as neural radiance fields for view synthesis. In ECCV, 2020. [95] Thomas Müller, Alex Evans, Christoph Schied, and Alexander Keller. Instant neural graphics primitives with a multiresolution hash encoding. ACM Transactions on Graphics (SIGGRAPH), 2022. [96] Jianfeng Xiang, Zelong Lv, Sicheng Xu, Yu Deng, Ruicheng Wang, Bowen Zhang, Dong Chen, Xin Tong, and Jiaolong Yang. Structured 3d latents for scalable and versatile 3d generation. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 21469–21480, 2025. [97] Jiale Xu, Weihao Cheng, Yiming Gao, Xintao Wang, Shenghua Gao, and Ying Shan. InstantMesh: Efficient 3D mesh generation from a single image with sparse-view large reconstruction models. arXiv preprint arXiv:2404.07191, 2024. [98] Tencent Hunyuan3D Team. Hunyuan3D 2.1: From images to high-fidelity 3D assets with production- ready PBR material. arXiv preprint arXiv:2506.15442, 2025. [99] StepFun Step1X-3D Team. Step1X-3D: Towards high-fidelity and controllable generation of textured 3D assets. arXiv preprint arXiv:2505.07747, 2025. [100] Ilya Loshchilov and Frank Hutter. SGDR: Stochastic gradient descent with warm restarts. In International Conference on Learning Representations (ICLR), 2017. [101] Zihao Zhao, Eric Wallace, Shi Feng, Dan Klein, and Sameer Singh. Calibrate before use: Improving few-shot performance of language models. In International conference on machine learning, pages 12697–12706. Pmlr, 2021. [102] Chujie Zheng, Hao Zhou, Fandong Meng, Jie Zhou, and Minlie Huang. Large language models are not robust multiple choice selectors. In International Conference on Learning Representations (ICLR), 2024. [103] Peiyi Wang, Lei Li, Liang Chen, Zefan Cai, Dawei Zhu, Binghuai Lin, Yunbo Cao, Lingpeng Kong, Qi Liu, Tianyu Liu, et al. Large language models are not fair evaluators. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 9440–9450, 2024.

15

第 16 页

[104] Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, and Veselin Stoyanov. RoBERTa: A robustly optimized BERT pretraining approach. arXiv preprint arXiv:1907.11692, 2019.

[105] Dan Hendrycks, Steven Basart, Norman Mu, Saurav Kadavath, Frank Wang, Evan Dorundo, Rahul Desai, Tyler Zhu, Samyak Parajuli, Mike Guo, Dawn Song, Jacob Steinhardt, and Justin Gilmer. The many faces of robustness: A critical analysis of out-of-distribution generalization. ICCV, 2021.

A 数据集收集与策展

我们扩展第3节,提供用于训练和分布内评估的合成 Odd-one-out 数据集背后的完整策展流程(A.1节),以及用于分布外评估的视觉算法 2AFC 数据集(A.2节)。全文中,我们使用“方面”(aspect)一词指代文本条件 $c$(例如,光照、色调、场景几何)。

众包标注。我们在 Amazon Mechanical Turk 和 Prolific 上收集标注。每项任务的奖励设定为每小时有效工资率 10 美元。对每个会话应用哨兵检查。哨兵三元组是通过复制真实三元组中的一张图像构建的,使得正确的 Odd-one-out 在视觉上显而易见。未能通过哨兵检查的会话将被退回,相应的响应将被排除。

按方面的“无法判断”过滤器。为了处理视觉方面条件模糊的情况,我们的标注界面除了图像选项外,还包括一个“无法判断”选项。我们对每个三元组收集 5 次标注,丢弃“无法判断”的投票,仅基于图像投票进行训练和测试。为了确保测试集中所有视觉方面有足够的投票,如果测试集中有 3 名或更多标注者标记“无法判断”,则丢弃该方面。该过滤器按方面独立应用。一个三元组可能保留某些方面而丢失其他方面,仅当没有任何方面剩余时才丢弃该三元组。

A.1 Odd-one-out 数据集

图像生成。我们使用 FLUX-Reason-6M [66] 的提示词池作为基础提示词。对于每个基础提示词,一个指令微调的大语言模型(Qwen3-4B-Instruct-2507 [79])沿着少量预定义的轴(例如,颜色、光照、构图)生成三个受控的提示词变体,使得三元组内的三个提示词至少在其中一个轴上存在刻意差异。随后,FLUX.1-dev [80] 使用共享的随机种子、50 个采样步长和 4.0 的引导尺度渲染这三个提示词。生成提示词变体的指令如下:

系统提示

你是生成 Odd-one-out 感知研究感知变体的专家。

任务:给定一个基础文本提示词,生成三个清晰可区分的文生图提示词(0, 1, 2),以形成一个有趣的 Odd-one-out 三元组。

目标:这些图像将展示给人类,人类必须识别哪张图像与其他图像“最不同”。对于你改变的每个视觉因素,两张图像应相似,一张图像应为“Odd”(明显不同)。

关键设计原则: 1. 在三元组中改变 5-7 个视觉因素 2. 对于每个因素:两张图像共享相似的值,一张图像明显不同 3. 将“Odd”角色分布在图像中——不要让一张图像在所有因素上都成为“Odd”!

4. 这创造了一个有趣的感知谜题,其中每张图像在某些方面是“Odd”,而在其他方面是“相似”

  • 示例:图像 0 可能在“光照”和“姿态”上是 Odd
  • 图像 1 可能在“背景”和“纹理”上是 Odd
  • 图像 2 可能在“相机角度”和“颜色”上是 Odd

要改变的视觉因素(使用上下文名称,而非类别名称):

16

第 17 页

  • 色彩与光照 → “光照暖度”、“阴影方向”、“亮度水平”
  • 材质与纹理 → “沙发面料”、“表面光泽度”、“木纹”
  • 几何、形状与姿态 → “猫的姿态”、“花卉布置”、“建筑高度”
  • 背景与环境 → “天空状况”、“房间杂乱程度”、“天气”
  • 构图与空间排列 → “物体间距”、“取景紧凑度”
  • 相机 → “相机距离”、“视角”、“景深”
  • 摄影风格 → “色彩饱和度”、“胶片颗粒感”、“对比度水平”

要求: 1. 所有三个图像必须描述相同的主体或场景 2. 使用生动、具体的描述符——避免使用“略微”或“有点” 3. 每个提示词应生成一眼即可区分的图像 4. 因素名称必须具有上下文相关性:使用“猫的姿态”而非“几何与形状” 5. 保持因素名称简短,且非专家也能理解

“公园里的金毛寻回犬”的示例: { "metadata": { "num_variations": 3, "factors": [ {"name": "dog pose", "odd_image": 0, "similar_value": "sitting upright", "odd_value": "lying down"}, {"name": "lighting", "odd_image": 1, "similar_value": "bright sunny", "odd_value": "overcast diffuse"}, {"name": "background trees", "odd_image": 2, "similar_value": "lush green", "odd_value": "autumn orange"}, {"name": "grass length", "odd_image": 0, "similar_value": "short manicured", "odd_value": "tall wild"}, {"name": "camera angle", "odd_image": 1, "similar_value": "eye level", "odd_value": "low angle looking up"}, {"name": "depth of field", "odd_image": 2, "similar_value": "sharp throughout", "odd_value": "blurred background"} ] }, "triplets": [ {"id": 0, "prompt_or_edit_or_video_instruction": "A golden retriever lying down in tall wild grass in a sunny park with lush green trees, eye level shot, sharp focus throughout, bright natural lighting"}, {"id": 1, "prompt_or_edit_or_video_instruction": "A golden retriever sitting upright in short manicured grass in a park under overcast diffuse light, low angle looking up, lush green trees, sharp focus throughout"}, {"id": 2, "prompt_or_edit_or_video_instruction": "A golden retriever sitting upright in short manicured grass in a sunny park with autumn orange trees, eye level shot, blurred background, bright natural lighting"} ] }

输出格式:仅返回上述结构的有效 JSON。 记住:让每个图像在大约 2-3 个因素上成为“异常值”,从而创造一个有趣的感知谜题!

方面提议与细化。每个三元组继承其提示词变异步骤中提出的方面。由于提示词到图像的映射并不忠实,我们将渲染后的三元组及其候选方面列表传递给 GPT-5.2 [12],要求它删除在三张图像中未明显变化的方面,并添加提示词未指定但视觉上显著的方面。细化指令如下:

系统提示词

您正在分析三张水平拼接的图像(左、中、右)。

17

第 18 页

初始变化轴: <此处插入方面列表>

任务:根据图像细化初始轴。保留大多数轴,仅移除不相关的轴,并添加任何实际存在的视觉差异的新轴。

规则(必须严格遵守): 1. 每个轴必须是单个、简洁的名词短语。 2. 轴中不得使用“and”、“or”、“not”、括号、星号、逗号或任何其他符号。 3. 始终根据主题对轴进行上下文命名(例如,“猫的姿势”、“天空亮度”、“桌子材质”)。 4. 如果主题存在差异,始终包含姿势、方向、几何形状、大小或视角的轴。 5. 如果相关,包含颜色、光照、材质、纹理、背景、构图、相机或摄影风格的轴。 6. 仅输出图像之间实际存在差异的轴。 7. 不要虚构视觉上不明显不存在的轴。 8. 提供5-10个按重要性排序的轴,最重要的排在前面。

输出格式:编号列表 1. [最重要的轴] 2. [第二个轴] 3. …

输出是一个过度完备的细化方面列表,随后通过来自人工标注的“无法判断”过滤器进行修剪。

标注界面。标注者看到三个呈三角形排列的图像以及一个呈现为可拖拽芯片的细化方面列表。对于每个方面,他们将芯片拖拽到他们认为最不同的图像上,或拖拽到“无法判断” bin 中(图9)。每个三元组由5名工人进行标注;经过“无法判断”过滤器后,剩余的投票形成关于三个图像位置的多项分布 $y \in \Delta_3$。我们还在每个三元组中包含一个“总体”方面,通过询问无条件问题“哪张图像在总体上看起来最不同?”。我们在训练和评估中将“总体”视为常规方面条件。

Odd-One-Out (Overall) Odd-One-Out (Aspects)

图9:找不同标注界面。标注者被展示三张图像。(左)标注者点击在总体上看起来最不同的图像。(右)标注者获得一个作为可拖拽芯片的方面列表,并将每个方面分配给他们感知为最不同的图像,或分配给“无法判断”。

18

第 19 页

表 2:2AFC 集合中使用的算法和方面。我们报告了用于构建 2AFC 集合的算法,以及每种算法出现的三元组数量,并列出了所使用的方面列表。

| 来源 | 算法(出现的三元组数量) | 方面列表 | | :— | :— | :— | | 图像编辑 | BAGEL (67), FLUX2-dev (83), LongCat-Image-Edit (72), OmniGen2 (92), Qwen-Image-Edit (64), Qwen-Image-Edit-2511 (69), Step1X-Edit v1.2 (65) | 每个样本由 GPT-5.2 预测 6–10 个方面的目标方面,并经人工修剪 | | 图像合成 | IC-Light (197), DreamLight (195), Diff-Harmonization (196) | (fg-ref) 面部特征、头发纹理、服装细节;(bg-ref) 光照方向、光照暖度、色调、照明 | | 新视角合成 | Splatfacto (120), Nerfacto (120), Instant-NGP (120) | 场景几何、场景清晰度、纹理细节、色调、光照亮度 | | 单图 3D | TRELLIS.2-4B (197), InstantMesh (199), Hunyuan3D-2.1 (199), Step1X-3D (199) | 3D 形状、表面纹理、材质、色调、相机位姿、物体大小 |

图 10:2AFC 标注界面。标注者看到一张参考图像(居中)和两侧的候选图像,针对每个方面,选择与参考图像更相似的候选图像,或选择“无法判断”。

A.2 2AFC 分布外评估集

2AFC 集合是从真实视觉算法在四个来源上的输出中精心构建的:图像编辑、图像合成、新视角合成(NVS)和单图 3D。每个来源提供一张参考图像 $x_{ref}$ 和来自多个算法的输出;一个三元组将 $x_{ref}$ 与来自不同算法的两个输出配对,标注者针对每个方面选择与 $x_{ref}$ 更相似的那个输出。各来源的算法和方面列表总结在表 2 中。

图像编辑。来源选自 GEditBench v2 [81],其中包含 16 种方法。我们保留了 7 种方法:BAGEL [82]、FLUX2-dev [83]、LongCat-Image-Edit [84]、OmniGen2 [85]、Qwen-Image-Edit [86]、Qwen-Image-Edit-2511 [86]、Step1X-Edit v1.2 [87])。其余方法被剔除,要么是因为它们在至少部分样本上对输入进行了裁剪或调整大小,要么是因为它们是已保留模型的近乎重复的中间版本。我们进一步从 GEditBench v2 中剔除了四个编辑类别(图表编辑、图像内文本翻译、文本编辑和线条到图像),因为它们包含我们不感兴趣的视觉内容(例如文本渲染、图表、线条草图)。对于每个样本,GPT-5.2 命名编辑指令明确改变的目标方面(例如,对于指令“将背景替换为现代办公室”,目标方面为背景设置)以及 6–10 个应保持与参考图像一致的保留方面;这两个列表随后都经过人工修剪。目标方面和

第 20 页

保留的方面被保留在注释列表中。每个三元组将源照片与两种来自不同随机选择方法的编辑配对,这些方法遵循相同的指令。我们丢弃那些人类多数投票在所有方面都指向同一图像的三元组,因为这些三元组通常由一种几乎未修改输入的方法主导。

图像合成。我们使用 10 张肖像前景图像与 30 张背景参考照片进行组合,并在每对图像上运行三种方法:IC-Light(基于文本-前景-背景条件的模型)[88]、DreamLight [89] 和零样本 Diff-Harmonization [90]。每个前景-背景对产生两种参考模式:前景参考(前景是 $x_{ref}$,方面描述主体保留)和背景参考(背景照片是 $x_{ref}$,方面描述背景保留)。我们从该数据集中随机抽取子集,以确保数据集大小与其他任务相匹配。

新视角合成。我们使用来自 Mip-NeRF 360 [91] 的 6 个场景和 3 种 nerfstudio 方法 [92]:Splatfacto(3D 高斯泼溅 [93])、Nerfacto [94] 和 Instant-NGP [95]。所有方法接收相同的训练视图并渲染相同的保留测试姿态;参考图像是测试姿态下的保留真实照片。

单图像 3D。我们使用来自 3D Arena 的输入和 4 种方法:TRELLIS.2 [96]、InstantMesh [97]、Hunyuan3D-2.1 [98] 和 Step1X-3D [99]。每种方法的网格在 Blender 中以每个对象 4 个间隔方位角重新渲染;参考图像是源照片。由于每种方法没有一致的规范视图,每种方法的相机姿态与参考图像随机不同。因此,我们在此设置中也注释并评估相机姿态相似性。

注释界面。每个三元组呈现为 $[x_{cand}^A | x_{ref} | x_{cand}^B]$,参考图像位于中间。对于每个三元组,注释者会看到方面列表,并为每个方面选择哪个候选图像与参考图像更相似,或者选择“无法判断”(图 10)。每个(三元组,方面)由 5 名工作人员进行注释,我们应用之前的“无法判断”过滤器。遵循第 3.2 节,我们还丢弃过滤后投票完全平局的方面。与找不同(Odd-one-out)评估不同,2AFC 评估不包含“总体”方面:每个比较都明确基于视觉方面进行条件化。

B 附加结果

扩展第 5 节,我们在 B.1 节提供额外的分析和基准评估,并在 B.2 节包含额外的消融实验。

B.1 额外分析和基准

表 3 包含了来自更多模型的分析,通过它们与人类的一致性进行测量。

三元组预言机。第 5 节报告了对成对指标的评估。我们的目标是创建一个算法,能够判断成对距离,使用找不同(Odd-one-out)三元组任务作为预训练信号。在这里,虽然找不同任务不是主要任务,但作为一个优势“预言机”,我们将所有 3 张图像提供给 VLM,并观察我们的成对算法(每次仅看到 2 张图像)与之相比的接近程度。为此,我们询问模型:“在 <方面> 方面,哪张图像在三者中最不同?”,这与人类注释者的回答方式相同。这使得即使未经训练的 VLM 在三元组提示下也能成为强大的基线。虽然 Gemini-3.1-Pro 在找不同任务上达到 62.0%,GPT-5.4 在 2AFC 上总得分达到 77.9%,但我们的早期融合方法即使没有结构优势也表现更好。

此外,我们验证了直接通过三元组微调生成式 VLM 以解决找不同任务能产生最强结果(见 Ours-Triplet)。然而,此类模型仅产生三元组决策而非成对分数,因此无法迁移到 2AFC 评估和检索。成对设计使得该指标在这些所有设置中均可用。

模型大小的影响。正如预期的那样,对于大多数模型系列,随着骨干网络大小的增加,人类在分布内找不同测试和 2AFC 总分上的一致性均有所提高。例如,在早期融合基线中,InternVL3.5 从 1B 到 14B 从 45.4% 提升至 54.2%,Qwen3-VL 从 2B 到 8B 从 51.0% 提升至 54.5%。在我们的消融研究(第 B.2 节)中,我们还发现我们方法的性能随模型大小提升(表 6)。

20

第 21 页

表 3:各模型家族和规模下与人类的一致性。我们以粗体显示每个任务类型的最佳结果,下划线表示次佳结果;灰色值为测试集上的标准差。对于三元组任务,我们的方法变体明确地在找不同(Odd-one-out)任务上进行训练,因此不适用于 2AFC 测试。

| | Odd-One-Out | 2AFC (out-of-distribution) | | | | | | :— | :—: | :—: | :—: | :—: | :—: | :—: | | Type | Family | Size | (in-distribution) | Editing | Composite | NVS | Im-to-3D | Total | | | LPIPS | 62M | 46.2±0.2 | 62.2±1.0 | 69.4±1.3 | 96.9±0.5 | 65.9±1.0 | 69.5±0.6 | | Classic | DreamSim | 258M | 50.5±0.2 | 63.7±1.0 | 67.0±1.4 | 96.6±0.5 | 75.8±0.9 | 72.9±0.5 | | | GPT-5.4 | – | 57.6±0.2 | 69.4±1.0 | 78.6±1.1 | 96.6±0.5 | 78.5±0.8 | 77.9±0.5 | | | Gemini-3.1-Pro | – | 62.0±0.2 | 70.6±0.9 | 74.6±1.2 | 96.1±0.6 | 74.4±0.9 | 76.1±0.5 | | | | 1B | 38.9±0.2 | 50.6±1.1 | 50.8±1.5 | 54.5±1.9 | 51.0±1.1 | 51.3±0.6 | | | | 2B | 40.0±0.2 | 52.7±1.1 | 63.0±1.4 | 66.2±1.8 | 56.7±1.1 | 57.7±0.6 | | InternVL3.5 | | 4B | 53.9±0.2 | 60.4±1.0 | 63.6±1.4 | 77.1±1.6 | 71.5±0.9 | 67.1±0.6 | | | | 8B | 53.3±0.2 | 61.9±1.0 | 69.3±1.3 | 92.4±0.9 | 68.2±1.0 | 69.6±0.6 | | Triplet | | 14B | 56.0±0.2 | 63.3±1.0 | 71.5±1.3 | 86.5±1.2 | 76.6±0.9 | 72.5±0.6 | | | | 0.5B | 45.2±0.2 | 53.7±1.1 | 51.3±1.5 | 68.5±1.8 | 51.1±1.1 | 54.4±0.6 | | LLAVA-OV | | 7B | 53.9±0.2 | 62.7±1.0 | 69.7±1.3 | 86.9±1.2 | 77.1±0.9 | 72.2±0.6 | | | | 2B | 47.8±0.2 | 58.4±1.1 | 64.1±1.4 | 91.5±1.0 | 68.3±1.0 | 67.3±0.5 | | Qwen3-VL | | 4B | 56.1±0.2 | 64.0±1.0 | 67.1±1.4 | 95.4±0.7 | 77.3±0.9 | 73.4±0.5 | | | | 8B | 57.1±0.2 | 63.8±1.0 | 68.1±1.3 | 95.1±0.7 | 78.6±0.8 | 73.9±0.5 | | Ours | | 8B | 65.0±0.2 | – | – | – | – | – | | | GPT-5.4 | – | 55.5±0.2 | 67.0±1.0 | 73.8±1.2 | 96.8±0.5 | 71.3±1.0 | 73.7±0.5 | | | Gemini-3.1-Pro | – | 58.4±0.2 | 65.5±1.0 | 66.5±1.4 | 90.8±1.0 | 70.1±1.0 | 70.7±0.6 | | | | 1B | 45.4±0.2 | 57.2±1.1 | 69.8±1.3 | 88.7±1.1 | 63.2±1.0 | 65.8±0.6 | | | | 2B | 46.3±0.2 | 61.5±1.0 | 70.7±1.3 | 82.3±1.4 | 72.6±0.9 | 69.8±0.6 | | InternVL3.5 | | 4B | 53.1±0.2 | 57.9±1.1 | 71.1±1.3 | 25.2±1.6 | 74.5±0.9 | 61.5±0.6 | | | | 8B | 53.5±0.2 | 60.2±1.0 | 64.6±1.4 | 45.4±1.9 | 75.4±0.9 | 64.2±0.6 | | Early Fusion | | 14B | 54.2±0.2 | 55.5±1.1 | 53.9±1.5 | 23.6±1.6 | 73.2±0.9 | 57.0±0.6 | | | | 0.5B | 30.1±0.2 | 51.0±1.1 | 51.1±1.5 | 65.7±1.8 | 35.7±1.0 | 47.7±0.6 | | LLAVA-OV | | 7B | 44.5±0.2 | 57.7±1.1 | 62.0±1.4 | 69.4±1.7 | 72.7±0.9 | 65.2±0.6 | | | | 2B | 51.0±0.2 | 60.4±1.0 | 68.7±1.3 | 93.1±0.9 | 74.3±0.9 | 71.1±0.6 | | Qwen3-VL | | 4B | 55.1±0.2 | 61.1±1.0 | 70.4±1.3 | 88.5±1.2 | 76.1±0.9 | 71.6±0.6 | | | | 8B | 54.5±0.2 | 55.4±1.1 | 56.5±1.5 | 47.3±1.9 | 69.0±1.0 | 59.2±0.6 | | Ours | | 8B | 64.7±0.2 | 72.5±0.9 | 75.6±1.2 | 96.6±0.5 | 81.2±0.8 | 79.3±0.5 | | | | 2B | 43.9±0.2 | 61.4±1.0 | 72.0±1.3 | 96.6±0.5 | 69.9±1.0 | 71.0±0.6 | | Qwen3-VL-Emb | | 8B | 44.0±0.2 | 61.5±1.0 | 71.3±1.3 | 96.7±0.5 | 72.7±0.9 | 71.9±0.6 | | Mid-Fusion | Ours | 8B | 63.8±0.2 | 71.2±0.9 | 64.2±1.4 | 96.8±0.5 | 78.1±0.8 | 75.9±0.5 | | | Gemini-2-Embedding | – | 54.1±0.2 | 61.5±1.0 | 61.5±1.4 | 95.8±0.6 | 75.9±0.9 | 71.2±0.6 | | | VLM2Vec v2.0 | 2B | 53.0±0.2 | 62.3±1.0 | 66.6±1.4 | 90.9±1.0 | 73.5±0.9 | 70.8±0.6 | | | SteerViT | 86M | 51.4±0.2 | 67.9±1.0 | 66.0±1.4 | 96.6±0.5 | 75.2±0.9 | 74.0±0.6 | | Late Fusion | GeneCIS | 150M | 44.9±0.2 | 62.4±1.0 | 71.8±1.3 | 96.3±0.6 | 72.7±0.9 | 72.2±0.6 | | | | 2B | 56.7±0.2 | 64.4±1.0 | 70.0±1.3 | 92.7±0.9 | 77.9±0.8 | 73.9±0.6 | | Qwen3-VL-Emb | | 8B | 58.3±0.2 | 62.9±1.0 | 68.6±1.3 | 94.5±0.7 | 78.1±0.8 | 73.5±0.5 | | Ours | | 8B | 64.1±0.2 | 71.2±0.9 | 72.1±1.3 | 96.6±0.5 | 80.0±0.8 | 77.9±0.5 |

人类置信度与模型和人类的一致性。由于感知任务是主观的,人类通常不会在给定示例上达成 100% 的一致。在图 11 中,我们绘制了模型性能与 $\tau$ 的关系,$\tau$ 表示人类与其首选选择达成一致的比例。回顾一下,每个方面使用 5 名标注者,如果某些标注者选择“无法判断”,则将其移除。因此,$\tau$ 在某些特定值处增加(例如 35, 45, 34 等)。正如预期的那样,在高置信度水平 $\tau$ 下,所有方法的性能均单调上升,因为低置信度的预测被过滤掉了。在整个阈值范围内,方法排名保持一致。我们的模型在每个 $\tau$ 下都保持了与人类-人类一致性最小的差距,表明其优势对阈值不敏感。

在其他基准上的泛化能力。我们提出的方法将图像相似性扩展到了方面条件化。在这里,我们测试该方法在先前感知相似性数据集上的通用图像相似性性能如何。在表 4 中,我们报告了在 BAPPS [2] 和 NIGHTS [3] 上的结果,这是两个成熟的感知相似性基准,分别旨在训练和评估 LPIPS [2] 和 DreamSim [3]。与我们的设置不同,这些基准不进行方面条件化,仅收集整体感知相似性。值得注意的是,仅在我们的数据集上进行训练并使用“整体”条件进行推理,在这两个基准上都带来了相对于基础 VLM 的一致改进,缩小了与在域内训练的方法之间的差距。这表明我们的数据集捕获的感知结构可以迁移到其他领域。

我们还在表 5 中与之前的数据集可查询属性表示提取(Queryable Attribute Representation Extraction, QARE)[48] 进行了比较,该数据集创建了一个包含 4 种不同对象的小型合成数据集,这些对象渲染在 4 种背景和 3 种艺术风格上,具有已知的变化, resulting in 48 张图像。该基准查询这 3

第 22 页

模型-人类一致率

早期融合 中期融合 晚期融合 三元组 100%

80%

60%

40%找不同(分布内) 20%

0%

100%

80% 二选一 60% 40% (分布外) 20%

0% 0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0 人类置信度阈值 人类置信度阈值 人类置信度阈值 人类置信度阈值 GPT-5.4 Qwen3-VL 8B Qwen3-VL-Emb 8B Gemini-2-Embedding Qwen3-VL-Emb 8B GPT-5.4 LLAVA-OV 7B Gemini-3.1-Pro Ours Ours VLM2Vec v2.0 Ours Gemini-3.1-Pro Qwen3-VL 8B InternVL3.5 8B 人-人一致 人-人一致 SteerViT 人-人一致 InternVL3.5 8B 人-人一致 LLAVA-OV 7B GeneCIS

图 11:模型与人类的一致性随置信度阈值的变化。我们按人类置信度阈值(x 轴)进行过滤,并报告在保留数据上的模型性能(y 轴)。

表 4:泛化到通用感知相似性:分别在低层和中期相似性上的 BAPPS [2] 和 NIGHTS [3]。标准误以灰色显示。最佳结果加粗,次优结果下划线。Ours 是基于 Qwen3-VL-8B-Emb. 微调的晚期融合模型,即使没有直接在任一数据集上进行训练,也显示出一致的改进。我们仅报告整体条件的数据集子集以供比较。 数据集 方法 BAPPS NIGHTS 我们-整体

LPIPS 68.4±0.2 76.4±1.0 53.9±0.8 DreamSim 68.3±0.2 96.2±0.5 65.1±0.7 Qwen3-VL-8B-Emb. 65.2±0.2 87.9±0.8 60.1±0.7 Ours 67.3±0.2 94.0±0.6 66.5±0.7

属性,并衡量 mAP 中的召回率和 AIS 中嵌入的紧密程度。尽管该方法并非为此数据集设计,但其表现与提供的基线具有竞争力。

更多定性结果。为了扩展第 5 节,我们在下面展示了额外的定性结果。图 12 和图 13 说明了方面条件化相似性的范围。图 14 扩展了分布内找不同和分布外二选一的结果。图 15 扩展了图 7,并在没有相似性调整的情况下提供了 OpenImages [72] 上的最近邻检索。对同一查询在不同方面进行条件化会返回明显不同的邻居集合,并且在这种设置下,我们的方法在定性上仍然明显优于基础模型。图 16 扩展了图 8,并提供了更多关于多查询检索的结果。

B.2 额外的消融实验

表 6 报告了消融实验结果。

骨干网络规模。2B 晚期融合模型在找不同(63.7% vs. 64.1%)和二选一(77.4% vs. 77.9%)任务上仅比 8B 版本落后微小的差距,提供了一种具有竞争力性能的更高效替代方案。

数据扩展。性能早期饱和。找不同指标在 60% 的训练数据时达到平台期(64.0%),而二选一在仅 40% 的数据时就达到了 78.0%,与全数据结果相当。这表明在我们当前数据集中,额外数据带来的增益有限,指向需要更多样化的数据或更具数据吸收能力的架构。

22

第 23 页

后训练/查询驱动 模型 mAP (↑) AIS (↓) 零样本 可查询 方法 骨干网络 参数量 obj sty bg all

CLIP – 9.4 13.1 8.8 4.5 1.00 零样本 ✗ 视觉 SigLIP – 10.0 11.0 10.1 4.4 1.00 编码器 DINOv2 – 13.5 6.8 10.0 4.2 1.00 DINOv3 – 12.1 7.1 11.2 4.1 1.00

Qwen2-VL 2B 8.7 20.5 37.1 22.1 0.63 Qwen2-VL 7B 69.7 73.9 91.7 78.4 0.68 Qwen2.5-VL 3B 38.7 45.6 91.5 58.6 0.78 Qwen2.5-VL 7B 83.9 56.9 90.1 77.0 0.73 Qwen2.5-VL 32B 79.0 55.2 91.7 75.3 0.81 零样本 ✓ TF-QARE [48] InternVL3 1B 47.8 23.5 65.6 45.6 0.74 InternVL3 2B 46.9 58.0 90.2 65.0 0.75 InternVL3 8B 78.0 56.8 91.7 75.5 0.55 InternVL3 14B 85.8 55.4 91.7 77.6 0.78 Gemma3 4B 55.6 70.4 83.9 70.0 0.88 Gemma3 12B 82.9 75.4 91.7 83.3 0.88

VLM2VecV1 [67] Qwen2-VL 7B 8.9 29.6 11.6 16.7 0.97 后训练 ✓ VLM2VecV2 [65] Qwen2-VL 2B 7.9 27.0 11.2 15.4 0.82 ours Qwen3-VL-Emb 8B 78.6 75.1 91.6 81.7 0.67

表 5:在 QARE-Bench (Synthetic) [48] 数据集上的泛化能力。该基准测试在 48 张图像的集合上衡量对象、背景和风格的解耦能力。我们的方法与 QARE 提供的基准具有竞争力,在 8B 模型中拥有最高的 mAP,并接近 12B 模型的性能。

表 6:额外的消融实验。每一行翻转我们默认模型的一个参数。默认行(8B 和 100%)是默认的晚期融合模型。“中期融合默认”是默认的中期融合模型。

消融实验 系列 变体 OOO 测试 (%) 2AFC 总计 (%)

2B 63.7±0.2 77.4±0.5 骨干网络规模 晚期融合 8B (默认) 64.1±0.2 77.9±0.5

20% 62.8±0.2 76.6±0.5 40% 63.7±0.2 78.0±0.5 训练数据比例 晚期融合 60% 64.0±0.2 77.4±0.5 80% 64.0±0.2 77.5±0.5 100% (默认) 64.1±0.2 77.9±0.5

冻结骨干网络 45.6±0.2 72.9±0.5 中期融合头 中期融合 通道权重无方面条件约束 59.8±0.2 75.1±0.5 默认 63.8±0.2 75.9±0.5

中期融合架构。冻结骨干网络会导致找不同和 2AFC 性能大幅下降(默认值为 63.8% / 75.9%,冻结骨干网络为 45.6% / 72.9%),这证实了仅在冻结的 VLM 上学习通道权重是不够的。从通道权重中移除方面条件约束也会导致两项指标下降(59.8% / 75.1%),这表明最优的逐层权重是依赖于方面的,不能在不同条件下共享。

C 实现细节

在本节中,我们包含训练和超参数细节(C.1 节)、早期融合模型的架构细节(C.2 节)以及基线细节(C.3 节)。

C.1 训练与超参数选择

骨干网络。我们模型的晚期融合、中期融合和早期融合变体均使用 Qwen3-VL-Embedding-8B [17] 作为骨干网络。三元组生成变体使用 Qwen3-VL-8B-Instruct [14]。

23

第 24 页

表 7:各方法超参数搜索空间。大多数超参数从离散选项中进行采样,学习率从连续的对数均匀分布中采样。

| 超参数 | 晚期融合 (Late fusion) | 早期融合 (Early fusion) | 三元组头 (Triplet head) | 中期融合 (Mid fusion) | | :— | :— | :— | :— | :— | | 骨干网络 (Backbone) | Qwen3-VL-Emb-8B | Qwen3-VL-Emb-8B | Qwen3-VL-8B-Instruct | Qwen3-VL-Emb-8B | | LoRA 秩 $r$ | $\{8, 16, 32, 64\}$ | $\{8, 16, 32, 64\}$ | $\{8, 16, 32, 64\}$ | $\{8, 16, 32, 64\}$ | | 学习率 (对数均匀) | $[10^{-5}, 5 \times 10^{-4}]$ | $[10^{-5}, 5 \times 10^{-4}]$ | $[10^{-5}, 5 \times 10^{-4}]$ | $[10^{-5}, 5 \times 10^{-4}]$ | | 有效批次大小 (Effective batch size) | $\{32, 64, 128, 256\}$ | $\{32, 64, 128, 256\}$ | $\{32, 64, 128, 256\}$ | $\{32, 64, 128, 256\}$ | | 相似度温度 $\tau$ | $\{0.05, 0.1, 0.2\}$ | $\{0.05, 0.1, 0.2\}$ | — | 对数均匀 $[10^{-3}, 1.0]$ | | 探针层数 (# probe layers) | — | — | — | $\{3, 5, 8, 10, 14, 20\}$ |

表 8:所有报告数值使用的最终超参数。

| 超参数 | 晚期融合 | 早期融合 | 三元组头 | 中期融合 | | :— | :— | :— | :— | :— | | LoRA 秩 $r$ | 16 | 16 | 16 | 16 | | 学习率 | $5 \times 10^{-5}$ | $1 \times 10^{-4}$ | $3 \times 10^{-5}$ | $1 \times 10^{-4}$ | | 有效批次大小 | 128 | 128 | 32 | 32 | | 相似度温度 $\tau$ | 0.05 | 0.05 | — | 0.0025 | | 探针层数 | — | — | — | 20 | | 轮数 (Epochs) | 1 | 1 | 1 | 1 |

适配 (Adaptation)。我们将 LoRA [69] 应用于语言塔,设置 $lora\_alpha = 2 \cdot lora\_r$ 和 dropout 0.05。对于所有报告的模型,视觉塔均被冻结,因为我们发现调整视觉塔并不能提升性能。

优化器与调度 (Optimizer and schedule)。我们使用 AdamW 进行优化(权重衰减 0.01,梯度裁剪 1.0)。学习率调度策略为:在前 3% 的总步数中进行线性预热,随后余弦衰减至零 [100]。三元组变体使用两个参数组:骨干网络的 LoRA 使用上述列出的学习率,分类头使用 5 倍于该率的学习率。

数据与每步批次 (Data and per-step batching)。所有四个模型均在未过滤的训练集(22,157 个三元组)上训练一个 epoch。三元组中的每个方面 (aspect) 被视为一个训练样本,因此一个标注了 $k$ 个方面的三元组在每个 epoch 中贡献 $k$ 个优化样本。每设备批次大小 (Per-device batch size) 为 1;有效批次大小等于每设备批次大小乘以梯度累积步数再乘以 8 个 GPU,因为我们的训练是在 8-GPU 节点上进行的。

三元组模型的排列增强 (Permutation augmentation for triplet models)。为了缓解视觉语言模型的位置偏差 [101, 102, 103],在训练三元组模型时,每个批次项中的三元组的三张图像会进行随机排列。在推理时,我们对所有六种排列取平均,并将概率映射回原始位置。

模型提示词 (Model prompts)。方面字符串 $c$ 插入到以下提示词中。对于晚期融合和中期融合(每次前向传播处理一张图像):

“Represent the similarity of the image based on $\langle c \rangle$.”

对于早期融合(每次前向传播处理两张图像):

“Measure the similarity between the two images based on $\langle c \rangle$.”

“整体 (overall)”方面会省略“based on $\langle c \rangle$”后缀。

超参数扫描 (Hyperparameter sweep)。我们对每个方法族运行独立的贝叶斯搜索,以验证集上的人类一致性 (human agreement) 为目标。搜索空间和所选配置分别报告在表 7 和表 8 中。

C.2 早期融合架构

我们描述了使早期融合架构(第 4.2 节)在构造上保持对称性和恒等性 (identity-preserving) 的注意力掩码和位置编码方案。

24

第 25 页

输入布局。输入序列由四个连续段组成,其中方面提示(aspect prompt)位于最前面,以便图像补丁能够以标准 VLM 的方式对其产生注意力:

$$ \underbrace{t_1, \dots, t_M}_{\text{aspect } \{z_t\}_{\text{tokens}}} \parallel \underbrace{p^{(1)}_1, \dots, p^{(1)}_N}_{\text{image } x_1 \{z_p\}_{\text{patches}}} \parallel \underbrace{p^{(2)}_1, \dots, p^{(2)}_N}_{\text{image } x_2 \{z_p\}_{\text{patches}}} \parallel \underbrace{r_1, r_2}_{\text{registers}} $$

其中 $t_m$ 是方面文本 token 嵌入,$p^{(k)}_n$ 表示图像 $x_k$ 的第 $n$ 个补丁嵌入(我们假设两幅图像具有相同数量的补丁 $N$),$r_1, r_2$ 是跨所有示例共享参数的可学习寄存器向量。

位置编码。我们使用 M-RoPE [60],它为每个 token 分配三维位置 $(t, h, w)$。对于视觉 token,我们覆盖骨干网络的默认设置,使得两幅图像共享相同的时间索引,并在对应的网格位置匹配空间索引:

$$ \text{pos}_{p^{(1)}_{h,w}} = \text{pos}_{p^{(2)}_{h,w}} = (0, h, w), $$

其中 $(h, w)$ 遵循预处理后每幅图像的补丁网格。因此,两幅图像仅通过 token 内容和注意力掩码区分,而不是通过图像顺序区分。

方面文本按顺序被分配连续的时间位置 $t = 1, 2, \dots$,且 $(h, w) = (0, 0)$,同时为所有视觉补丁保留 $t = 0$——这与默认的两幅图像预处理不同,在默认预处理中,第二幅图像通常获得更大的时间索引。

寄存器。两个寄存器使用相同的可学习嵌入向量和相同的 M-RoPE 坐标 $(t_{\text{reg}}, 0, 0)$,其中 $t_{\text{reg}}$ 设置为紧接在所有 preceding tokens 的最大时间索引之后。因此,它们不因位置编码而区分;只有它们的注意力区域不同,如下所示。

注意力掩码。注意力掩码由以下规则定义:

1. 方面 token 彼此之间是因果的,因此不关注任何图像补丁或寄存器,从而保留 VLM 预训练的纯文本行为。 2. 图像补丁关注所有方面 token 以及两幅图像的所有图像补丁,鼓励两组图像特征之间的比较。它们不关注寄存器。 3. 寄存器受到限制:$r_k$ 仅关注方面 token 和图像 $x_k$ 的补丁。这鼓励 $r_k$ 输出特定于图像的表示。

掩码的图像-图像块是对称的,寄存器块以类似方式对称:$r_1$ 对 $x_1$ 的访问模式镜像 $r_2$ 对 $x_2$ 的访问模式。

对称性属性。两个寄存器 $r_1, r_2$ 共享相同的学习嵌入和相同的位置编码,且注意力掩码对称地处理两个图像槽。因此,如果我们交换 $x_1$ 和 $x_2$,在每个注意力层中,$r_1$ 现在从 $x_2$ 进行池化,正如 $r_2$ 之前所做的那样(反之亦然);两个寄存器隐藏状态只是被交换。由于余弦相似度在其参数中是对称的,

$$ f_\theta(x_1, x_2, c) = f_\theta(x_2, x_1, c). $$

恒等性属性。当 $x_1 = x_2 = x$ 时,输入序列的两个图像段在 token 级别完全相同,且注意力掩码是对称的,因此这两个段在每个 Transformer 层产生相同的隐藏状态。由于 $r_1$ 和 $r_2$ 是绑定的,并通过结构相同的掩码关注相同的上下文,因此 $h_1 = h_2$。因此

$$ f_\theta(x, x, c) = \frac{h_1^\top h_1}{\|h_1\|^2} = 1. $$

C.3 基线

我们提供第 5 节中报告的基线的更多细节。我们根据两幅图像的交互方式组织基线,外加一个单独消耗三个拼接图像的三元组家族。所有基线均使用贪婪解码(温度 0)。为了避免 VLM 的位置偏差 [101, 102, 103],对于三元组和成对评分基线,我们应用排列平均——Odd-one-out 有 6 种排列,2AFC 有 2 种排列——并将结果映射回原始位置。嵌入基线不需要排列平均,因为余弦相似度是对称的。

25

第 26 页

三元组基线。将三张输入图像水平拼接,并要求模型指出哪一侧是“找不同”(Odd-one-out)图像。我们使用的提示词为:

“我提供三张水平拼接的图像(左、中、右)。在⟨c⟩方面,这三张图像中哪一张最不同?你需要选择:左、中、右。 答案:”

对于 2AFC,三个位置分别变为参考图像(中间)和两个候选图像(左、右):

“我提供三张水平拼接的图像。中间图像为参考图像。在⟨c⟩方面,哪个候选图像(左或右)与参考图像更相似?请用一个词回答:左或右。答案:”

当方面条件为“overall”时,我们从这些提示词中移除“in terms of ⟨c ⟩”。

对于开源权重模型,我们在答案位置读取三个(或两个)目标 token 的 logits 并进行 softmax 计算。涉及的模型包括 InternVL3.5 [71]、Qwen3-VL [14] 和 LLaVA-OneVision [63]。API 模型(GPT-5.4 [12]、Gemini 3.1 Pro [13])则使用文本解析。

成对 0–10 分基线。相同的 VLM 也以成对模式进行评估,其中每对图像在 0(完全不同)到 10(完全相同)的整数尺度上被评定相似度。提示词为:

“我向你展示两张并排放置的图像(左和右)。请根据⟨c⟩方面,在 0 到 10 的尺度上评价这两张图像的相似程度,其中 0 表示完全不同,10 表示完全相同。请用 0 到 10 之间的单个数字回答。答案:”

当方面为“overall”时,我们将提示词中的“in terms of ⟨c ⟩”替换为“overall”。我们将响应转换为软评分,方法为 $E[d] = \sum_{d=0}^{10} d \cdot P(d)$,其中 $P(d)$ 为数字 token 的对数概率。对于仅能获取生成文本的 API 调用,每个文本响应被转换为关于选项的单热 delta 分布。每个三元组的三个成对评分通过互补对评分的 softmax 转换为 3 路“找不同”分布(即两张图像之间的相似度最高意味着第三张是“找不同”图像);对于 2AFC,我们对两个参考-候选评分进行 softmax 计算。

晚期融合(embedding)基线。每张图像独立嵌入,可选择性地以简短的方面提示为条件;成对相似度为两个嵌入向量的余弦相似度。3 路“找不同”和 2AFC 分布通过成对评分基线中相同的 softmax 聚合方式形成。

Qwen3-VL-Embedding [17](2B 和 8B)。Qwen3-VL 的原生多模态编码器版本,采用最后 token 池化和 L2 归一化输出。我们使用的提示词为“Represent the visual similarity of this image in terms of ⟨c ⟩.”。

VLM2Vec v2.0 [16, 65]。基于 Qwen2-VL-2B-Instruct [60] 的 LoRA 适配器,按发布版本使用。我们使用与 Qwen3-VL-Embedding 相同的提示词,并对最后一个非填充隐藏状态进行池化。

SteerViT [70]。一种基于 DINOv2 的 ViT [23],增强了可转向交叉注意力机制,可接收简短的方面字符串。SteerViT 的文本编码器是 RoBERTa [104] 而非指令微调的大语言模型,因此上述冗长的嵌入提示词被缩短为仅方面 token(例如,“lighting”)。对于“overall”方面,我们不传入任何文本,从而回退到无条件 DINOv2 主干网络。

GeneCIS [8]。一种在从现有视觉-语言数据集中挖掘的条件图像相似度三元组上微调的 CLIP ViT-B/16 [22]。与 SteerViT 类似,CLIP 的文本编码器更适合短文本而非指令微调,因此我们直接输入方面 token(例如,“lighting”)。

Gemini Embedding 2 [13]。原生多模态嵌入模型,通过官方 API 使用。我们将方面文本和图像字节交错放置在单个内容对象中,以使嵌入受方面条件约束。

中期融合基线。为完整起见,我们报告了在 LPIPS 风格中期融合配置中使用的冻结 Qwen3-VL-Embedding(2B 和 8B):成对相似度是所选语言塔层上负方面条件 $\ell_2$ 距离(公式 3)。这与我们训练的中期融合变体属于相同的架构类别,但没有训练的通道权重头,从而隔离了训练的贡献。

26

第 27 页

D 补充细节

D.1 计算成本

本文报告的所有训练和推理均在八台 NVIDIA A100 80GB 节点上运行。下文描述运行时间成本。

数据集构建。构建 Odd-one-out 数据集耗时约 24 GPU 天用于 FLUX 图像生成,约 8 GPU 天用于 Qwen3 文本提示变体。构建 2AFC 数据集耗时约 20 GPU 小时用于图像合成,5 GPU 小时用于 NVS,30 GPU 小时用于图像到 3D。我们直接从 GEditBench v2 [87] 下载了图像编辑结果。

最终模型训练。在八台 A100 上的单次运行挂钟时间:Late fusion 4.5 小时,Mid fusion 9 小时,Early fusion 8 小时,Triplet head 7 小时。

D.2 许可证

下文列出本项目所使用的代码、数据和模型的许可证。

• Qwen3-VL 和 Qwen3-VL-Embedding:Apache 2.0。 • InternVL3.5:Apache 2.0。 • LLaVA-OneVision:Apache 2.0。 • VLM2Vec v2.0:Apache 2.0。 • SteerViT:MIT。 • GeneCIS:CC BY-NC 4.0。 • FLUX.1-dev:FLUX.1 [dev] Non-Commercial License v1.1.1。 • FLUX-Reason-6M:Apache 2.0。 • GEditBench v2:MIT。 • Mip-NeRF 360:Apache 2.0。 • NerfStudio:Apache 2.0。 • IC-Light:Apache 2.0。 • DreamLight:CC BY 4.0。 • Diff-Harmonization:Apache 2.0。 • TRELLIS.2:MIT。 • InstantMesh:Apache 2.0。 • Hunyuan3D-2.1:腾讯混元 3D 2.1 社区许可证。 • Step1X-3D:Apache 2.0。

第 28 页

更相似 .84 .84 .71 .70 .66 .60 .35 …

LPIPS* Dream … 面向相机距离 卡片方向 Sim* 整体车顶汽车风格汽车颜色 更相似 .82 .82 .66 .53 .56 .58 .34 …

LPIPS* Dream 颜色 尺寸 颜色 … 叶子 Sim* 整体葡萄 葡萄 背景 这些图像看起来有多相似? 现有感知度量 我们的方法 sim(𝑥!, 𝑥") sim(𝑥!, 𝑥"|𝑐) 图 12:文本条件相似性分数的示例。给定两幅图像,现有的感知度量仅提供粗略的整体相似性度量。我们的方法通过以相似性感知(由文本提示 c 表示)为条件,揭示了问题的一个关键方面。(顶部)例如,汽车的颜色更相似,拍摄时的相机距离也相似,而它们的朝向和车顶风格则大不相同。(底部)葡萄的颜色不同,而葡萄的大小和叶子的颜色相同。∗ 我们展示 1-LPIPS [2] 和 1-DreamSim [3] 以转换距离,使得更高的分数代表更高的相似性。

图 13:使用我们的度量探索相似性感知。左侧(寿司):锚点是寿司卷的特写镜头。提示可以优先考虑构图相似性(特写与远景)或寿司类型,从而区分相似的寿司卷和不相似的生鱼片。中间(蘑菇):锚点显示两朵白色蘑菇。基于颜色的查询将项目从白色排序到棕色,而基于计数的查询则根据存在的蘑菇数量重新排序它们。右侧(马):相似性要么关注主体的物理姿势,要么关注地面的特定纹理和颜色。相似性报告为余弦相似性,范围从 -1 到 1。

28

第 29 页

Gemini-3.1-Pro GPT-5.4 Qwen3-VL-Embedding-8B Ours Human

图像 1 玻璃 边缘 形状轮廓 涂层 A 参考 B

𝑥!

𝑥# 𝑥"

前景 装饰 硬币堆叠顺序 道具存在 排列 三枚硬币排列

左上角柔和光照

细微的硬币阴影

图像 2 图像 3 图像 1 背景 相机 墙壁颜色 距离 A 参考 B

𝑥!

𝑥# 𝑥"

颜色 夹克 饱和度 材质 面部特征

头发纹理

服装细节

图像 2 图像 3 图像 1 草莓 背景 放置位置 场景 A 参考 B

𝑥!

𝑥# 𝑥"

叉子 颜色 场景清晰度 可见度 饱和度 纹理细节

色调

光照亮度

图像 2 图像 3 图像 1 椅子 海浪 放置位置 可见度 A 参考 B

𝑥!

𝑥# 𝑥"

门廊柱 门廊 厚度 深度 3D 形状

色调

相机姿态

物体大小

图像 2 图像 3

(a) 找不同感知判断 (b) 2AFC 感知判断

图 14: 额外的定性结果。我们扩展了图 4,并提供了更多针对我们的找不同和 2AFC 测试用例的结果。

29

第 30 页

构图

天气状况

相机距离

构图

背景

物体大小

构图

天气状况

色调

相机距离

背景

物体数量

TPIPS (Ours) Qwen3-VL-Embed 查询 检索图像

图 15:无相似度调整的方面条件检索结果。我们扩展了图 7 的结果,并展示了无相似度调整的检索结果。对于每个查询(左侧),对不同的方面进行条件约束也会返回不同的最近邻。左侧展示了使用我们训练的晚期融合模型在 OpenImages [72] 上的检索结果,与右侧基础模型的检索结果相比,其检索图像明显具有更好的对齐效果。

30

第 31 页

笔触质量

表现媒介

色彩调色板

笔触质量

物体类别

表现媒介

色彩调色板

构图 布局

笔触技法

写实程度

场景设定

绘画媒介

合成查询 检索图像

图 16:额外的组合检索结果。我们扩展了图 8 的结果。前两行是来自 ImageNet-R [105] 的组合检索结果,后两行是来自 WikiArt [73] 的结果。

31

发表评论