视觉相似性的多重维度:一种文本提示的图像感知度量

模型架构与训练

现有视觉相似性度量(如LPIPS, DreamSim)将相似性坍缩为单一标量,无法根据特定视觉方面(如颜色、姿态)进行条件化。本文提出TPIPS,通过微调Qwen3-VL-8B-Emb并构建包含25K图像三元组的大规模数据集,实现基于自由文本提示的细粒度、多面视觉相似性度量。实验显示,TPIPS在Odd-one-out任务上将模型-人类一致性差距从9.1%缩小至2.8%,在2AFC域外任务上将误差从15.8%降低至10.0%。该方法在条件化检索和生成模型评估中展现出新能力,但计算成本高于传统度量。