快速导读:现有评估仅关注答案准确率,无法区分视觉推理与文本依赖。更严重的是,针对病理领域的微调往往导致‘领域训练幻觉’:模型变得更擅长‘猜答案’,却削弱了从图像中提取证据的能力。注意力可视化显示,模型对病理实体的关注往往弥散且缺乏特异性,无法精确定位关键病灶。
病理视觉语言模型(VLM)在辅助诊断中展现出巨大潜力,但现有评估体系存在根本性缺陷。大多数基准仅关注答案准确率,忽略了模型是否真正‘看’懂了图像。本文指出,许多高性能模型实际上是在利用文本先验进行‘盲猜’,而非进行视觉推理。
为了解决这一问题,作者提出了PathBind基准,并通过对比实验揭示了‘领域训练幻觉’(Domain Training Illusion):即针对病理领域的微调往往提升了答案准确率,却导致视觉定位能力(Visual Grounding)下降。这一发现挑战了当前‘微调即优化’的普遍假设。
英文题目:Do Pathology Vision-Language Models Truly See Pathology?
论文出处:arXiv 每日论文精选 · arXiv:2607.21065
原始论文:PDF / 论文页面
对应视频标题:病理VLM真的看懂图像了吗?PathBind基准揭示领域训练幻觉|推荐指数:★★★★★
这篇论文解决什么问题?
在PathMMU等现有基准上,VLMs取得了令人印象深刻的准确率。然而,当移除图像输入或替换为空白图像时,许多模型仍能给出相同答案。这表明模型可能仅依赖问题中的医学术语或选项关联进行推理,而非分析组织切片特征。
这种‘文本捷径’(Textual Shortcut)导致评估结果虚高。更严重的是,现有的注意力可视化方法显示,模型对病理实体的关注往往弥散且缺乏特异性,无法精确定位关键病灶。因此,我们需要一种能强制视觉依赖并评估实体级定位的新基准。
此外,领域微调(Domain Tuning)通常被认为能增强模型的视觉理解能力。但本文发现,这种训练往往使模型更擅长记忆文本模式,反而削弱了其从图像中提取证据的能力,形成了‘领域训练幻觉’。
核心创新
- 实验结果显示,Patho-R1-7B相比基座模型准确率提升11.5点,但Multimodal Gain下降5.8点,Attention IoU下降3.7点。在PathBind-Grounding上,基座模型的IoU优于微调模型。这证实了‘领域训练幻觉’:微调使模型更依赖文本模式,反而削弱了视觉定位能力。
方法概览
现有评估仅关注答案准确率,无法区分视觉推理与文本依赖。更严重的是,针对病理领域的微调往往导致‘领域训练幻觉’:模型变得更擅长‘猜答案’,却削弱了从图像中提取证据的能力。注意力可视化显示,模型对病理实体的关注往往弥散且缺乏特异性,无法精确定位关键病灶。
- PathBind基准由三部分组成:PathBind-VQA(1500个经过自动过滤和专家审核的问题)、PathBind-PTA(600个来自私人教学图谱的问题)和PathBind-Grounding(500个专家标注的区域级样本)。
- 评估策略包括对比VLM(含图像)与VLM-text(仅文本)的准确率,计算Multimodal Gain(模态增益)以衡量图像的实际贡献。
- 引入Attention IoU和Recall作为视觉定位指标,量化模型注意力图与真实病灶区域的匹配程度。
- 通过空白图像和错误图像消融实验,验证模型对视觉输入的依赖性。
- 对比通用基座模型与病理微调模型(如Patho-R1, Quilt-LLaVA)在各项指标上的表现差异。
逐图理解论文
失败案例:文本捷径的陷阱

在PathMMU基准上,许多模型即使面对空白图像或错误图像,也能给出与正常输入相同的答案。这表明它们并未真正‘看’懂组织切片,而是利用了问题中的医学术语或选项关联进行推理。这种‘文本捷径’导致评估结果虚高,掩盖了模型视觉能力的缺失。
研究缺口:领域训练幻觉

图2(a)对比了准确率与Multimodal Gain的背离,(b)显示注意力高度弥散,(c)显示不同查询的注意力高度相关,缺乏特异性。
解决方案:PathBind基准

图3详解PathBind构建流程,强调自动过滤与专家审核结合,确保样本的视觉依赖性。
核心发现:微调损害定位

表3展示了PathBind-Grounding结果,基座模型在IoU上优于微调模型,直接证明微调损害了视觉定位能力。
结论与局限

图4用红绿线直观展示多组模型对:微调后Multimodal Gain和Grounding指标普遍下降(红线),证实幻觉的普遍性。
实验如何设计?
- 在5个公开病理VQA基准和PathBind上评估18个VLMs。
- 使用PathVG和PathBind-Grounding分析注意力图的弥散程度(Effective Attention Support Ratio)和跨查询相关性。
- 对比基座模型与微调模型在Multimodal Gain和Grounding指标上的变化。
关键结果与论文证据
- Gemini-3-Pro在无视觉输入下仍能达到53.5%的平均准确率(Page 1),证明文本先验的强大干扰。
- Patho-R1-7B相比基座模型准确率提升11.5点,但Multimodal Gain下降5.8点,Attention IoU下降3.7点(Page 4)。
- 实体Token的注意力支持率超过90%,表明注意力高度弥散,缺乏精准定位(Page 4)。
- 在PathBind-Grounding上,基座模型Qwen2.5-VL-7B的IoU(23.3%)优于微调模型Patho-R1-7B(17.4%)(Page 6)。
- 微调模型在Grounding Recall上平均下降15.4点,证实‘领域训练幻觉’的存在(Page 7)。
阅读时需要注意
- 基准主要关注Patch级和区域级定位,未完全覆盖全切片图像(WSI)级任务。
- 即使经过过滤,文本先验仍难以完全消除,导致VLM-text基线非零。
- 专家审核仅由3位病理学家完成,可能存在主观偏差。
关联工作
- PathMMU和PathVG作为现有基准,被用于对比和数据来源。
- Quilt-LLaVA和Patho-R1作为典型微调模型,展示了领域训练的负面影响。
- CONCH作为早期病理VLM,其局限性在本研究中被进一步揭示。
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
病理视觉语言模型真的能“看见”病理特征吗?
张成阳1,2,张文创2,李博3,刘新宇1,杨佳明1,李梦然4, 邓陈迅5,陈杰2,张阳3,居伟1,易宇航1,2∗,步宏2,吕建成1 1 四川大学计算机学院 2 四川大学华西医院病理科及临床病理研究所 3 新加坡国立大学计算机学院 4 中山大学智能系统工程学院 5 中国科学院自动化研究所 yuhaoyi@scu.edu.cn
摘要 图像中的哪种组织学特征提示了对肿瘤的活跃局部免疫反应? 样本来源: 肿瘤细胞岛相邻的坏死区域。病理视觉语言模型(VLMs)近期进展迅速,通常通过在病理视觉问答(VQA)基准测试上的回答准确率进行评估。然而,我们深入分析了当前的评估方法,并发现了三个被忽视的问题:1)视觉证据并非总是必要的。例如,Gemini-3-Pro 在没有任何视觉输入的情况下,在 5 个 VQA 基准测试上平均准确率达到 53.5%。2)领域训练可以在不带来成比例视觉绑定增益的情况下提高准确率。与 Qwen2.5-VL-7B 相比,Patho-R1-7B 的 Multimodal Gain(模态增益)低 5.8 个百分点,Attention IoU(注意力交并比)低 3.7 个百分点。3)实体级别的注意力分散且与查询特异性弱相关。在 PathVG 上,针对不同实体查询的注意力图保持高度相关。这些问题可能导致对病理 VLM 实际多模态能力的严重误判。为此,我们提出了 PathBind,这是一个包含 2,600 个样本的基准测试:PathBind-VQA 包含跨越六个维度的 1,500 个问题,PathBind-PTA 包含来自私有病理教学图谱的 600 个问题,以及 PathBind-Grounding 包含 500 个由专家策展的区域级 [cs.CV] 样本。每个组件都经过任务特定的自动过滤和专家审查,以减少文本捷径并改善实体-区域对应关系。我们在 PathBind 的 VQA 样本和五个现有病理 VQA 基准测试上评估了 18 个代表性 VLM,并在 PathBind-Grounding 和 PathVG 上进一步评估了 10 个 VLM。结果表明,当前的病理 VLM 在回答侧性能与视觉-语义绑定之间仍存在巨大差距。VLM 真的能看见病理特征,还是主要成为了更好的病理回答者?
1 引言 病理视觉语言模型(VLMs)通过病理特定的预训练或后训练迅速进步,在病理视觉问答(VQA)基准测试上取得了强劲的性能(Sun et al. 2024a; He et al. 2020; Zuo et al. 2025; Ikezogwo et al. 2023; Hu et al. 2024)。因此,回答准确率已成为病理理解的标准指标。然而,仅凭准确率无法揭示模型是利用组织病理图像、依赖病理特定的语言先验,还是结合领域知识进行推理。与文本捷径和领域知识相混淆,基准测试准确率可能将真正的视觉推理与文本捷径和领域知识混为一谈。这引出了一个根本性问题:病理 VLM 真的能看见病理特征,还是主要成为了更好的病理回答者?
我们认为,病理理解不仅仅需要选择正确答案。病理学家通过定位和解释视觉证据来证明结论,包括腺体结构、淋巴细胞浸润、肿瘤巢以及其他细胞或组织层面的模式。对于依赖于局部微观证据的问题,病理 VLM 不仅应预测正确答案,还应将查询到的病理概念与支持性的图像区域关联起来。如果不评估这一证据链,基准测试准确率可能会将真正的视觉推理与文本捷径和领域知识混为一谈。这引出了一个根本性问题:病理 VLM 真的能看见病理特征,还是主要成为了更好的病理回答者?
图 1 说明了这一差距。在一个代表性的 PathMMU 示例中,当输入分别为原始图像、无图像、空白图像或错误图像时,Patho-R1-7B 均选择了相同的正确选项。
(a) Patho-R1-7B 在相同问题的输入图像改变时正确识别答案。 输入:带图像 输入:仅文本 输入:空白图像 输入:错误图像 选择:B 选择:B 选择:B 选择:B 带图像准确率 仅文本准确率 带图像准确率 仅文本准确率 Patho-R1-7B 75.0% 75.0% Qwen2.5-VL-7B 63.1% 61.5% Quilt-LLaVA 47.9% 51.0% 51.6% LLaVA-1.5-7B 50.0% 42.0% 41.8% Patho-R1-7B 50.0% Qwen2.5-VL-7B 37.0% 35.3% Quilt-LLaVA 31.7% 30.5% 30.4% LLaVA-1.5-7B 14.9% 18.6% 25.0% Patho-R1-7B 10.1% 13.2% Qwen2.5-VL-7B 25.0% Quilt-LLaVA 0.0% 0.0% LLaVA-1.5-7B
(b) 病理微调 VLM 与其基础模型在 PathBind 上的回答准确率 (Acc) 和 PathVG 上的注意力指标 (Attention) 对比。
图 1:(a) 病理微调 VLM 在仅文本、空白图像或错误图像条件下正确回答问题。(b) 病理特定训练提高了回答准确率,但并未成比例地提高 Multimodal Gain(模态增益)或 Visual Grounding(视觉定位)。
arXiv:2607.21065v1
第 2 页
相关图像,表明该预测可能由非视觉线索主导。这种行为不仅限于个别案例。与 Qwen2.5-VL-7B 相比,Patho-R1-7B 实现了更高的图像条件准确率,但其纯文本准确率提升更大,导致 Multimodal Gain(模态增益)降低且基于注意力的 Visual Grounding(视觉定位)更弱。Quilt-LLaVA 相对于 LLaVA-1.5-7B 也呈现出类似模式。我们将这种差异称为 Domain Training Illusion(领域训练幻觉):病理特异性训练提高了答案准确率,但未带来成比例的视觉绑定增益。
现有的病理 VQA 协议并未旨在暴露这种差异。它们通常提供图像-问题对,推断答案并报告准确率,而不测试图像是否必要、预测是否对视觉扰动敏感,或实体令牌注意力是否与标注的病理区域对齐。因此,模型可能通过利用问题-选项关联和病理语言先验获得更高分数,而在微观证据上保持微弱的视觉定位。因此,更忠实的评价应区分三种互补能力:视觉依赖性、由领域特异性训练引入的 Multimodal Gain(模态增益),以及实体级 Visual Grounding(视觉定位)。
为了支持此类评估,我们引入了 PathBind,这是一个旨在评估视觉-语义绑定的基准。PathBind 由三个互补组件组成。PathBind-VQA 包含 1,500 个问题,通过纯文本过滤和专家审查从五个公共病理基准中提炼而来。PathBind-PTA 包含 600 个问题,源自私人病理教学图谱,而 PathBind-Grounding 提供 500 个专家策展的区域级样本。我们在 VQA 样本上评估了 18 个代表性 VLM,并对具有可访问注意力权重的 10 个 VLM 进行了基于注意力的视觉定位分析。实验结果表明,答案正确性与实体级视觉定位之间存在巨大差距。总之,我们的贡献有三方面: • 我们确定了当前病理 VLM 评估中的三个问题:(1) 现有基准中视觉证据并非总是必要的;(2) 领域特异性训练提高了答案准确率,但未带来成比例的视觉绑定增益;(3) 实体级注意力仍然弥散且与查询特异性关联较弱。 • 我们构建了 PathBind,这是一个包含 2,600 个样本的诊断基准,涵盖三个组件:PathBind-VQA、PathBind-PTA 和 PathBind-Grounding。每个部分均经过自动化流程和专家审查的过滤。这种忽视可能导致对病理理解的高估,以及对领域特异性多模态训练所实现的真实视觉定位增益的误判。 • 我们基准测试了 18 个代表性 VLM,并表明强大的答案侧性能并不意味着相应强大的视觉-语义绑定。
2 相关工作 病理视觉语言模型。随着大型视觉-语言模型的不断进步,越来越多的工作将视觉-语言学习适应于计算病理学。这一方向的核心是早期病理视觉语言基础模型,它们将对比图像-文本对齐迁移至组织病理学,例如 CONCH 等,这些模型从大规模图像-文本对和标题中建立病理特定的视觉-语言表示 (Lu et al. 2024)。建立在这些模态对齐基础和通用 LVLM 架构之上,最近的病理 VLM 通过领域特定预训练、指令微调、多分辨率建模、全切片建模以及面向推理的后训练,进一步将病理图像编码器与语言模型连接起来 (Seyfioglu et al. 2024; Sun et al. 2025c,a; Ding et al. 2025; Sun et al. 2024b; Zhang et al. 2026b; Wu et al. 2025; Chen et al. 2024c)。例如,Quilt-LLaVA (Seyfioglu et al. 2024) 和 PathGen-LLaVA (Sun et al. 2025c) 代表了经过指令微调的病理助手,CPath-Omni (Sun et al. 2025a) 将多模态建模扩展至 WSI 级分析,而 Patho-R1 (Zhang et al. 2026b) 探索了基于强化学习的病理推理。近期工作 (Jiang et al. 2026; Ghezloo et al. 2025; Chen et al. 2025; Sun et al. 2026; Zhang et al. 2026a; Lyu et al. 2026) 进一步提高了多模态数据质量,并将单 VLM 系统扩展至代理推理,从而实现更灵活和强大的诊断工作流。
病理 VLM 的评估。为了探测病理 VLM 的能力,社区开发了病理特定的 VQA 数据集、专家级多模态基准、模型评估套件和视觉定位数据集 (Sun et al. 2024a; He et al. 2020; Zuo et al. 2025; Ikezogwo et al. 2023; Hu et al. 2024; Gilal et al. 2025; Sun et al. 2025b; Chen et al. 2026; Majzoub et al. 2025)。早期病理 VQA 数据集评估模型能否回答关于病理图像的问题,而最近的基准将评估扩展至跨多种病理来源和子领域的多模态推理。例如,PathMMU (Sun et al. 2024a) 包含超过 33K 个多模态多项选择题和 24K 张病理图像。同时,病理视觉定位基准如 PathVG (Zhong et al. 2025) 进一步将评估从问题回答扩展至区域定位,实现了病理表达的区域级评估。然而,现有的病理 VLM 评估忽视了几个关键问题。一方面,它们不能保证所有评估样本都需要视觉证据才能正确回答,这为模型利用文本先验或数据集特定捷径留下了空间。另一方面,当前评估主要遵循在固定基准上进行推断并报告答案准确率的标准化协议,而不检查病理训练是否改善了病理概念与微观区域之间的视觉-语义绑定。
3 诊断病理 VLM:三个被忽视的问题 在本节中,我们考察当前病理 VLM 评估中被忽视的三个问题。我们展示现有病理基准和定位数据上的详细实验结果,以证实我们的观察。
第 3 页
PathMMU YorN MedXpert OmniMed 模型 策略 平均 Test-tiny Test-all Quilt-VQA Path-VQA Path Bright
基线
随机选择 – 23.4 24.2 50.0 50.0 21.3 24.2 32.2
闭源视觉语言模型 VLM 70.8↑25.1 68.6↑21.6 68.2↑25.7 71.1↑23.4 68.9↑14.4 61.2↑17.2 68.1↑21.2 GPT-5.4 VLM-text 45.7 47.0 42.5 47.7 54.5 44.0 46.9 VLM 77.8↑26.5 75.6↑25.1 73.5↑24.8 77.5↑17.8 80.0↑25.6 71.8↑15.7 76.0↑22.5 Gemini-3-Pro VLM-text 51.3 50.5 48.7 59.7 54.4 56.1 53.5
开源通用视觉语言模型及病理视觉语言模型 VLM 37.0↑5.3 36.1↑5.4 56.6↑14.6 49.5↑9.9 22.2↑7.8 46.5↑12.3 41.3↑9.2 LLaVA-1.5-7B VLM-text 31.7 30.7 42.0 39.6 14.4 34.2 32.1 VLM 42.0↑6.7 42.2↑5.4 64.3↑10.3 57.3↑1.1 21.1↑4.4 49.8↑10.6 46.1↑6.4 Quilt-LLaVA VLM-text 35.3 36.8 54.0 56.2 16.7 39.2 39.7 VLM 36.3↑4.2 37.2↑5.1 58.3↑14.1 60.8↑13.4 18.9↑4.6 45.2↑11.9 42.8↑8.9 LLaVA-1.5-13B VLM-text 32.1 32.1 44.2 47.4 14.3 33.3 33.9 VLM 62.6↑11.4 60.4↑11.3 62.3↑13.7 63.1↑4.9 30.0↑6.7 68.5↑11.2 57.8↑9.8 PathGen-LLaVA VLM-text 51.2 49.1 48.6 58.2 23.3 57.3 48.0 VLM 48.6↑13.5 47.0↑12.3 52.6↑14.3 60.6↑14.1 18.9↑5.6 51.9↑9.0 46.6↑11.5 Qwen2-VL-7B VLM-text 35.1 34.7 38.3 46.5 13.3 42.9 35.1 VLM 57.5↑11.8 56.1↑12.0 62.6↑15.4 60.2↑10.7 20.0↑2.2 44.9↑7.1 50.2↑9.8 HuatuoGPT-Vision-7B VLM-text 45.7 44.1 47.2 49.5 17.8 37.8 40.4 VLM 51.6↑21.1 48.7↑17.7 54.2↑14.1 59.5↑11.7 13.3↑1.1 54.6↑9.9 47.0↑12.6 Qwen2.5-VL-7B VLM-text 30.5 31.0 40.1 47.8 12.2 44.7 34.4 VLM 63.1↑15.3 62.9↑18.3 64.4↑11.6 55.3↑12.3 16.7↑0.9 69.9↑11.3 55.4↑11.6 Patho-R1-7B VLM-text 47.8 44.6 52.8 43.0 15.8 58.6 43.8
表1:各种视觉语言模型在五个流行的病理视觉问答基准上的评估结果。对于“策略”列,“VLM”表示使用图像进行评估,而“VLM-text”表示在没有图像的情况下进行评估。我们报告了2个闭源视觉语言模型和4个经过病理微调的视觉语言模型及其基础模型的结果。有关其他开源视觉语言模型和完整的模型列表,请参阅附录A.1。“VLM”和“VLM-text”设置中跨模型的最高结果以粗体和下划线突出显示。带有箭头的数字表示“VLM”相对于“VLM-text”的提升幅度。
3.1 第一个问题:视觉证据并非总是必要的
一个合格的病理视觉问答样本应要求模型检查并推理组织病理学图像。否则,评估可能会退化为测试语言骨干模型的文本和领域先验能力。为了检查这个问题,我们在现有的病理视觉问答基准上,以两种设置评估病理视觉语言模型、其基础模型以及代表性的通用视觉语言模型:标准视觉语言模型设置(提供图像)和视觉语言模型文本设置(模型在没有视觉输入的情况下回答相同的问题)。
如表1所示,许多模型在没有图像的情况下仍保持显著的准确率。闭源视觉语言模型实现了强大的纯文本性能,GPT-5.4和Gemini-3-Pro的平均VLM-text准确率分别达到46.9%和53.5%。经过病理微调的开源模型显示出类似的模式。PathGen-LLaVA在没有图像的情况下获得了48.0%的平均准确率,Patho-R1达到了43.8%。这些分数远高于随机选择基线,表明相当一部分病理视觉问答性能可以通过问题-选项先验和病理领域语言知识来解释。
图像条件与纯文本准确率之间的差距因模型和数据集而异。例如,加入图像后,Quilt-LLaVA平均提高了6.4分,PathGen-LLaVA提高了9.8分。即使对于更强的模型,高图像条件准确率往往也伴随着高纯文本准确率。这些观察结果并不意味着图像对病理视觉问答无用,而是表明答案准确率包含大量的文本先验。因此,仅凭准确率无法真实衡量病理视觉语言模型是否依赖视觉证据。
3.2 第二个问题:领域训练可以在不改善视觉定位的情况下提高准确率
针对病理学的特定训练旨在改善视觉病理推理,而不仅仅是文本合理性。然而
第 4 页
Patho-R1-7B
17.3 20.0 11.5 10.0 5.0 3.6 1.4 0.0 行为比较揭示了模型是否依赖图像,但并未完全解释模型是否将病理概念与视觉区域绑定。因此,我们检查 PathVG 上的实体令牌注意力,其中病理表达与区域注释配对。一个良好的视觉定位模型应将注意力集中在目标实体上,并在查询实体改变时调整其注意力。我们使用有效注意力支持率 Neff/N 来衡量注意力的弥散程度,其中 Neff = exp(H(p)) 是图像块上注意力分布的困惑度。较高的值表示更弥散的注意力,而接近 1 的值对应于近乎均匀的注意力。 (a) Patho-R1-7B 与 Qwen2.5-VL-7B,以及 Quilt-LLaVA 与 LLaVA-1.5-7B 的增量条形图。 如图 2 (b) 所示,实体令牌注意力在各模型间高度弥散:对于所有评估的 VLM,等效注意力的熵支持超过可用图像块的 90%,表明注意力分布接近均匀。这表明模型在处理病理实体查询时空间集中度较弱。图 2 (c) 进一步显示注意力图具有弱查询特异性。对于每张图像,我们比较由其真实实体查询和从其他示例采样的两个替代实体查询引发的注意力图,并报告其成对平均相关性。大多数模型的跨查询注意力相关性仍然很高,表明不同的病理实体查询通常引发相似的注意力模式。 PathVG-testA PathVG-testB 100.0% 94.8% 95.1% 95.0% 93.6% 93.9% 94.4% 93.4% 94.5% 92.4% 92.5% 92.2% 93.3% 91.7% 90.0% LLaVA-1.5-7B Quilt-LLaVA LLaVA-1.5-13B PathGen-LLaVA Qwen2.5-VL-7B Patho-R1-7B (b) PathVG 上的有效注意力支持率。 PathVG-testA PathVG-testB 100.0% 92.9% 86.8% 82.8% 76.4% 75.9% 78.7% 76.4% 72.9% 70.0% 75.0% 64.3% 60.6% 54.3% 50.0% LLaVA-1.5-7B Quilt-LLaVA LLaVA-1.5-13B PathGen-LLaVA Qwen2.5-VL-7B Patho-R1-7B (c) PathVG 上各模型的跨查询注意力相关性。 图 2:(a) PathMMU-test-tiny 上的答案准确率和 Multimodal Gain 的配对增量,以及 PathVG-testA 上的注意力交并比和召回率。(b) 实体令牌注意力在 PathVG 上表现出近乎完全的等效熵支持。(c) 不同病理实体查询的注意力图保持高相关性。 然而,病理微调模型与其基础模型之间的配对比较揭示了答案改进与接地改进之间的不匹配。我们将这种不匹配称为领域训练幻觉:领域特定训练提高了基准准确率,但并未伴随视觉绑定(包括行为视觉依赖性和实体级接地)的成比例改进。 图 2 (a) 提供了两个具有代表性的比较。Patho-R1 在图像条件准确率上比 Qwen2.5-VL 提高了 11.5 分,在纯文本准确率上提高了 17.3 分。然而,其 Multimodal Gain 下降了 5.8 分,其注意力交并比和注意力召回率分别下降了 3.7 分和 10.5 点。LLaVA 家族中也出现了类似模式:Quilt-LLaVA 在图像条件和纯文本准确率上优于 LLaVA-1.5-7B,但其注意力交并比和注意力召回率均下降。这些配对结果表明,病理微调可以使模型成为更好的回答者,而不使其成为更好的视觉接地者。PathVG 上的完整注意力接地结果见附录 A.3。 这一发现改变了如何解释病理 VLM 改进。如果领域训练真正加强了视觉-语义绑定,那么更高的答案准确率应与更大的 Multimodal Gain 和对病理证据更好的定位相一致。相反,病理微调模型往往提高了预测合理答案的能力,同时显示出较弱或停滞的接地指标。因此,核心风险不在于病理训练未能提高准确率,而在于准确率提升可能夸大了训练带来的真实 Multimodal Gain。接地 4 PathBind 4.1 数据策展流程 数据策展标准。PathBind 根据三个标准构建:(1) 强视觉依赖性,要求模型检查组织病理学图像,而不是仅从文本先验推断答案;(2) 实体级视觉语义接地,要求病理概念对应可识别的微观证据;以及 (3) 跨互补病理推理技能的广泛能力覆盖。 数据过滤器。如图 3 所示,PathBind 整合了公共病理 VQA 基准、PathVG 和私有病理教学图谱。对于 PathBind-VQA,我们从 PathMMU、Path-VQA、OmniMed-Bright、Quilt-VQA 和 MedXpert-Path 收集了 13,139 个问题,移除无效或重复样本,并应用两阶段纯文本过滤。在第一阶段,移除由两个闭源 LLM (OpenAI 2026; Google DeepMind 2025) 均正确回答的样本;剩余样本由另外五个 LLM (Qwen Team 2026; GLM-5 Team et al. 2026; Moonshot AI 2026; DeepSeek-AI 2026; Meta AI 2025) 进一步过滤,移除由至少三个模型正确回答的样本。这产生了 6,356 个候选样本。对于 PathBind-接地,我们从 3,048 个 PathVG 样本开始并保留
- Qwen2.5-VL-7B Quilt-LLaVA – LLaVA-1.5-7B 3.3 第三问题:实体级注意力弥散且弱查询特定
第 5 页
1. 来源/候选集 2. 过滤 3. 人工审核 4. 最终样本
PathBind-VQA VQA 组件 两阶段 纯文本过滤 专家审核(3位病理学家) 1,500 个样本
5 个公共 VQA 基准 阶段 1: 阶段 2: • 低信息量图像 闭源大语言模型 额外大语言模型 • 图像-问题不匹配 6 个维度 PathMMU Path-VQA • 问题定义不明确 250 ×每个
• 冗余模板 OmniMed-Bright Quilt-VQA Gemini-3-Pro GPT-5.4 3.6-MaxQwen- DeepSeek-V4-Pro GLM-5 Kimi-K2.6 4-MaverickLlama- • 图像中的文本泄露 粗略组织/器官识别 若两者均正确 若 5 个中 ≥3 个正确 • 多面板合成 D1D2 细胞形态 MedXpert-Path 正确 正确 D3 细胞-间质相互作用 按临床真实性排名 D4D5 空间诊断定位推理 总计:13,139 个候选 保留 6,356 个候选 及图像质量 D6 染色及免疫组化 (IHC) 解读
病理图像数据库 图像过滤与 VQA 生成 专家审核(3位病理学家) PathBind-PTA 600 个样本
D1 生成 900 个高 D2 私人病理教学图谱 质量 D3 样本 5 个维度× 样本 GPT-5.4 VQA 文本泄露 添加必要 平衡 120 个每个 D4 总计:3,289 个候选 保留 900 个候选 去除 上下文 维度 D5
定位组件 表达特异性过滤 专家审核(3位病理学家) PathBind-Grounding 500 个样本
具体 模糊 • 空间描述不准确 测试 A 测试 B A:380(保留) (去除) 测试 A Gemini-3-Pro GPT-5.4 • 内容描述不准确 测试 测试 B 测试 B:120 总计:3,048 个候选 保留 2,467 个候选 • 边界框不准确
PathBind 的最终构成
PathBind-VQA 1,500 个样本 PathBind-PTA 600 个样本 PathBind-Grounding 500 个样本 经过自动 总计候选:19,476(6 个维度)(5 个维度)(测试 A,测试 B) 过滤后:9,723
图 3:PathBind 数据策展流程概览。PathBind 整合了三个组件:经过过滤的 VQA 集、私人病理 VQA 集以及区域级定位集。每个组件均经过自动过滤,随后由专家审核以移除非视觉、模糊或低质量的样本。
2,467 个描述特定、可定位病理实体或视觉模式的表达。对于 PathBind-PTA,从教学图谱中选取高质量图像,并由 GPT-5.4 协助生成 900 个多项选择候选样本。更多过滤细节见附录 B.1-B.3。
人工审核。自动过滤后,所有候选样本由两位主治医师病理学家独立审核。分歧通过与高级顾问病理学家联合讨论解决,并达成最终共识决定。对于 PathBind-VQA,审核者排除了图像信息量低、图像与问题不匹配、问题定义不明确、模板冗余、图像内文本泄露或多面板合成图像的样本。保留的样本按临床真实性和图像质量排名,从而在每个诊断维度上平衡生成 1,500 个问题。对于 PathBind-Grounding,审核者评估了保留的 PathVG 候选样本的表达特异性、表达与边界框的一致性以及边界框准确性。排除了空间描述、内容描述或边界框不准确的样本,最终得到 500 个样本,其中 380 个来自测试 A,120 个来自测试 B。对于 PathBind-PTA,审核者评估了生成的候选样本,移除了模糊案例和存在文本泄露的样本,平衡了诊断维度和答案选项,并在诊断否则将定义不明确时添加了必要的解剖或系统上下文,最终得到 600 个问题。
4.2 诊断维度
我们定义了六个诊断维度,用于评估病理视觉语言模型 (VLMs) 在不同视觉推理水平上的表现:粗略组织或器官识别、细胞形态、细胞-间质相互作用、空间定位、诊断推理以及染色或免疫组化 (IHC) 解读。如图 3 所示,PathBind-VQA 包含 1,500 个样本,均匀分布在六个维度上;而 PathBind-PTA 在排除染色和 IHC 后,包含前五个维度的 600 个样本。每个诊断维度的详细定义见附录 B.4。
4.3 评估协议
对于 VQA 评估,PathBind 报告图像条件准确率和纯文本准确率。从纯文本到图像条件推理的提升直接在表格中显示,并标注为 Multimodal Gain(模态增益),以表明视觉证据带来的收益。对于定位评估,PathBind 报告模型生成的定位区域与标注病理区域之间的 IoU(交并比)、精确率和召回率,详细定义见附录 C.2。
第 6 页
PathBind-VQA (1,500) PathBind-PTA (600) 模型 策略 平均 D1 D2 D3 D4 D5 D6 D1 D2 D3 D4 D5
基线
随机选择 – 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0
闭源视觉语言模型 VLM 73.2↑23.6 75.2↑27.6 76.8↑24.0 69.2↑16.8 70.0↑24.4 71.2↑20.4 53.3↑21.6 83.3↑19.1 87.5↑24.2 85.0↑24.2 70.0↑39.2 74.1↑24.1 GPT-5.4 VLM-text 49.6 47.6 52.8 52.4 45.6 50.8 31.7 64.2 63.3 60.8 30.8 50.0 VLM 80.0↑21.2 74.8↑19.2 71.6↑17.6 75.2↑20.8 67.2↑16.0 72.0↑15.2 68.3↑20.0 82.5↑29.2 85.8↑21.6 85.0↑21.7 79.2↑42.5 76.5↑22.3 Gemini-3-Pro VLM-text 58.8 55.6 54.0 54.4 51.2 56.8 48.3 53.3 64.2 63.3 36.7 54.2
开源通用视觉语言模型与病理视觉语言模型 VLM 40.4↑5.2 40.8↑4.8 48.8↑8.8 41.2↑9.6 35.2↑8.8 34.0↑12.4 38.3↑4.1 60.0↑8.3 67.5↑28.3 71.7↑13.4 29.2↑6.7 46.1↑10.0 LLaVA-1.5-7B VLM-text 35.2 36.0 40.0 31.6 26.4 21.6 34.2 51.7 39.2 58.3 22.5 36.1 VLM 46.4↑8.8 49.6↑6.4 42.4↑4.0 49.2↑9.2 34.0↑7.2 34.8↑10.0 32.5↑1.7 57.5↑9.2 70.8↑21.6 71.7↑14.2 34.2↑3.4 47.6↑8.7 Quilt-LLaVA VLM-text 37.6 43.2 38.4 40.0 26.8 24.8 30.8 48.3 49.2 57.5 30.8 38.9 VLM 42.0↑16.4 45.6↑11.2 44.0↑10.0 42.0↑14.4 37.6↑11.2 37.6↑11.2 48.3↑10.8 63.3↑10.0 71.7↑18.4 74.2↑15.0 35.8↑11.6 49.3↑12.8 LLaVA-1.5-13B VLM-text 25.6 34.4 34.0 27.6 26.4 26.4 37.5 53.3 53.3 59.2 24.2 36.5 VLM 55.6↑18.8 53.2↑15.6 56.0↑13.6 58.8↑16.4 54.8↑15.2 60.8↑17.2 55.8↑19.1 80.0↑13.3 80.0↑17.5 78.3↑16.6 57.5↑22.5 62.8↑16.9 PathGen-LLaVA VLM-text 36.8 37.6 42.4 42.4 39.6 43.6 36.7 66.7 62.5 61.7 35.0 45.9 VLM 40.0↑14.8 38.4↑13.6 40.4↑15.6 41.2↑17.2 30.8↑10.0 40.4↑18.8 51.7↑16.7 75.8↑10.0 63.3↑12.5 77.5↑22.5 47.5↑15.0 49.7↑15.1 Qwen2-VL-7B VLM-text 25.2 24.8 24.8 24.0 20.8 21.6 35.0 65.8 50.8 55.0 32.5 34.6 VLM 46.4↑16.0 49.6↑23.2 48.8↑20.0 46.8↑17.6 31.6↑10.4 40.8↑10.4 49.2↑17.5 69.2↑17.5 75.0↑26.7 70.0↑15.8 52.5↑23.3 52.7↑18.0 HuatuoGPT-Vision-7B VLM-text 30.4 26.4 28.8 29.2 21.2 30.4 31.7 51.7 48.3 54.2 29.2 34.7 VLM 44.0↑22.8 43.2↑14.8 42.4↑16.4 44.4↑25.2 42.4↑20.8 44.0↑24.8 56.7↑20.9 75.0↑12.5 75.8↑10.8 81.7↑18.4 41.7↑16.7 53.8↑18.6 Qwen2.5-VL-7B VLM-text 21.2 28.4 26.0 19.2 21.6 19.2 35.8 62.5 65.0 63.3 25.0 35.2 VLM 60.4↑21.6 52.8↑17.6 52.8↑18.8 55.2↑19.6 60.0↑21.6 59.6↑23.6 62.5↑22.5 78.3↑15.0 81.7↑11.7 75.0↑6.7 60.8↑19.1 63.6↑18.0 Patho-R1-7B VLM-text 38.8 35.2 34.0 35.6 38.4 36.0 40.0 63.3 70.0 68.3 41.7 45.6
表2:各种视觉语言模型在PathBind-VQA和PathBind-PTA across diagnostic dimensions上的评估。“VLM”表示使用图像进行评估,“VLM-text”表示不使用图像进行评估。PathBind-VQA涵盖六个维度(D1-D6);PathBind-PTA涵盖前五个(D1-D5)。每列中“VLM”和“VLM-text”的最高结果以粗体和下划线突出显示。带箭头的数字表示“VLM”相对于“VLM-text”的提升幅度。
5 实验 模型 测试A (380) 测试B (120) IoU 精确率 召回率 IoU 精确率 召回率 InternVL3-8B 10.0 13.3 32.4 3.9 4.0 40.5 Qwen3-VL-8B 21.6 27.2 68.6 9.9 10.1 80.3 LLaVA-1.5-7B 17.6 23.7 51.6 3.0 3.1 26.7 Quilt-LLaVA 12.4 18.3 35.7 4.0 4.2 32.3 LLaVA-1.5-13B 16.4 22.2 49.6 6.2 6.4 48.8 PathGen-LLaVA 17.5 24.3 53.9 7.9 8.0 56.3 Qwen2-VL-7B 14.9 19.7 48.8 5.4 5.5 57.2 HuatuoGPT-Vision-7B 16.8 22.4 51.9 5.9 6.1 55.3 Qwen2.5-VL-7B 23.3 29.4 71.6 8.2 8.4 77.9 Patho-R1-7B 17.4 23.1 55.9 7.2 7.5 63.3
表3:PathBind-Grounding上的注意力定位结果。我们报告了病理表达实体的token注意力图与真实边界框之间的交并比(IoU)、精确率(Precision)和召回率(Recall),样本来自通过专家审核的380个测试A和120个测试B。最佳结果以粗体突出显示。
5 实验 模型测试A (380) 测试B (120) 在本节中,我们对PathBind进行了系统评估。在整个研究中,我们评估了18个闭源、通用和病理微调的视觉语言模型。主要的PathBind评估报告了10个代表性模型的结果。完整结果和实验细节见附录A-E。
5.1 PathBind结果分析 我们在表2中展示了PathBind-VQA和PathBind-PTA上的VQA结果,并在表3中报告了PathBind-Grounding上的定位结果。我们总结如下主要观察结果。
来自VQA性能的观察。闭源视觉语言模型实现了最强的答案侧性能。Gemini-3-Pro获得了76.5%的最高平均准确率,其次是GPT-5.4的74.1%。在开源模型中,Patho-R1和PathGen-LLaVA分别取得了63.6%和62.8%的最佳平均准确率,显著优于其余开源模型。
性能在不同诊断维度上也存在差异。在粗粒度组织识别上表现良好的模型,并不一定在细胞形态、空间定位或诊断推理上保持同样的优势。这种差异支持了按维度报告结果而非仅依赖单一聚合分数的必要性。PathBind-PTA通常产生更高的图像条件准确率,高于PathBind-VQA,特别是在细胞形态和空间定位方面,而几个模型在诊断推理方面仍然较弱。这表明受控的教学图谱图像有助于视觉识别,但并不能消除将视觉证据整合到诊断决策中的难度。
第 7 页
(a) 五个公共基准上的模态增益 (b) PathBind (VQA + PTA) 上的模态增益 (c) PathBind-Grounding 上的交并比 (d) PathBind-Grounding 上的召回率
LLaVA-1.5-7B Δ=−2.8 Δ=−1.3 Δ=−3.7 Δ=−10.7 ↓ 6.4 9.2 8.7 10.0 10.4 14.1 34.9 45.6 Quilt-LLaVA LLaVA-1.5-13B Δ=+0.9 Δ=+4.1 Δ=+1.2 Δ=+5.1 ↓ 8.9 9.8 12.8 16.9 14.0 15.2 49.4 54.5 PathGen-LLaVA Qwen2-VL-7B Δ=−1.7 Δ=+2.9 Δ=+1.6 Δ=+1.9 ↓ 9.8 11.5 15.1 18.0 12.6 14.2 50.8 52.7 HuatuoGPT-Vision-7B Qwen2.5-VL-7B Δ=−1.0 Δ=−0.6 Δ=−4.7 Δ=−15.4 ↓ 11.6 12.6 18.0 18.6 15.0 19.7 57.7 73.1 Patho-R1-7B
5 10 15 5 10 15 20 0 5 10 15 20 20 30 40 50 60 70 80 模态增益 (%) 模态增益 (%) 交并比 (%) 召回率 (%)
通用基础视觉语言模型 病理微调视觉语言模型 指标提升 ↑ 指标下降 ↓
图 4:跨四个指标的通用视觉语言模型到病理微调模型的配对。对于每对模型,我们比较 (a) 五个原始公共基准上的模态增益;(b) PathBind 上的模态增益;(c) 和 (d) PathBind-Grounding 上的交并比和召回率。绿色/红色线条标记微调模型得分高于/低于其通用模型的对。
视觉依赖性的观察。尽管 PathBind 移除了那些无需图像即可被多个视觉语言模型一致解决的样本,但模型仍保留了非平凡的纯文本性能。Gemini-3-Pro 和 GPT-5.4 的纯文本平均准确率分别为 54.2% 和 50.0%,而最强的病理微调开源模型也超过了 45%。这是预期的,因为即使在没有图像的情况下无法可靠地回答问题,病理术语和答案选项仍能提供部分语义线索。更重要的是,与原始公共基准相比,PathBind 上的图像带来了显著更大的增益。如图 4 所示,所有八个模型在 PathBind 上获得的模态增益均高于五个原始公共基准。例如,PathGen-LLaVA 在现有基准上的模态增益从 9.8 个百分点提升至 PathBind 上的 16.9 个百分点,而 HuatuoGPT-Vision-7B 则从 9.8 提升至 18.0 个百分点。这些结果表明,尽管无法消除病理语言先验,但过滤和专家审查流程增加了视觉依赖性。
在五个公共基准上,三个微调模型的模态增益低于其通用模型,仅 PathGen-LLaVA 略有提升,增加了 0.9 分。PathBind 产生了更多积极的结果:PathGen-LLaVA 和 HuatuoGPT-Vision 的模态增益分别提高了 4.1 分和 2.9 分,而 Quilt-LLaVA 和 Patho-R1 则分别低于其通用模型 1.3 分和 0.6 分。因此,病理训练可以增强某些模型家族对图像的使用,但更高的答案准确率并不一定意味着视觉证据的贡献更大。
接地性能观察。接地结果揭示了与视觉问答结果截然不同的模型排名。在 testA 上,Qwen2.5-VL-7B 实现了最高的 23.3% 交并比和 29.4% 的精确率,而 Qwen3-VL-8B 在 testB 上取得了最强结果,交并比为 9.9%,召回率为 80.3%。值得注意的是,通用视觉语言模型在区域级接地方面与病理微调模型具有竞争力,且往往优于后者。在所有模型中,尽管召回率相对较高,但交并比和精确率仍然很低。例如,Qwen3-VL-8B 在 testB 上达到了 80.3% 的召回率,但其交并比和精确率仅为 9.9% 和 10.1%。这种差异表明,注意力图经常触及标注的病理区域,但也扩散到广泛的无关区域。因此,高召回率不应被解释为精确的实体接地。这些结果与第 3.3 节中确定的弥散且弱查询特定的注意力模式一致。
5.2 领域训练效应分析
病理特定训练提高了所有四个模型配对的图像条件准确率,但其对视觉依赖性的影响仍不一致。如图 4 所示,在五个公共基准上,三个微调模型的模态增益低于其通用模型,仅 PathGen-LLaVA 略有提升,增加了 0.9 分。PathBind 产生了更多积极的结果:PathGen-LLaVA 和 HuatuoGPT-Vision 的模态增益分别提高了 4.1 分和 2.9 分,而 Quilt-LLaVA 和 Patho-R1 则分别低于其通用模型 1.3 分和 0.6 分。因此,病理训练可以增强某些模型家族对图像的使用,但更高的答案准确率并不一定意味着视觉证据的贡献更大。
接地比较显示出同样混合的模式。PathGen-LLaVA 在交并比上比 LLaVA-1.5-13B 提高了 1.2 分,在召回率上提高了 5.1 分,而 HuatuoGPT-Vision 相比 Qwen2-VL-7B 也提供了 1.6 分和 1.9 分的小幅增益。相比之下,Quilt-LLaVA 在交并比上下降了 3.7 分,在召回率上下降了 10.7 分,而 Patho-R1 显示出最大的倒退,与 Qwen2.5-VL-7B 相比,交并比和召回率分别下降了 4.7 分和 15.4 分。总体而言,病理特定训练在提高答案预测方面比提高视觉依赖性更一致。这些结果支持领域训练幻觉:答案侧的改进可能会夸大领域特定训练引入的模态增益。
6 结论
我们通过区分答案正确性与视觉依赖性和实体级接地,重新审视了病理视觉语言模型的评估。我们的分析揭示了当前评估的三个问题:大量的纯文本可解性、病理特定训练带来的不一致模态增益,以及弱查询特定的实体注意力。为了解决这些问题,我们引入了 PathBind,这是一个诊断基准,结合了过滤后的公共视觉问答问题、教学图谱视觉问答和专家策划的区域级接地样本。实验表明,强大的答案表现并不能始终转化为精确的视觉接地,而病理微调模型在视觉依赖性上并不总是优于其通用模型。这些发现表明,仅凭答案准确率不足以评估病理理解,并促使我们采用联合测量答案正确性、图像依赖性和局部视觉证据的评估协议。
第 8 页
参考文献
Ikezogwo, W.; Seyfioglu, S.; Ghezloo, F.; Geva, D.; Sheikh Mohammed, F.; Anand, P. K.; Krishna, R.; and Chen, J. 2023. Quilt-1m: One million image-text pairs for histopathology. Advances in Neural Information Processing Systems, 36: 37995–38017.
Jiang, S.; Wang, Z.; Huang, Y.; Jiang, S.; Huang, Shapiro, L. 2023. Quilt-1m: One million image-text pairs for histopathology. Advances in Neural Information Processing Systems, 36: 37995–38017. [注:此处原文排版似乎有重复或错位,按原文转录]
Cai, L.; Wang, Z.; Huang, Y.; Jiang, S.; Huang, Shapiro, L. 2023. Quilt-1m: One million image-text pairs for histopathology. Advances in Neural Information Processing Systems, 36: 37995–38017. [注:同上,原文结构混乱,保留原文]
实际上,根据提供的文本片段,参考文献列表存在严重的排版错乱(如作者名与标题混杂,同一文献多次出现但作者列表不同)。我将严格按照提供的文本字符串进行翻译和格式化,保留其原始结构,尽管其逻辑可能因OCR或复制错误而受损。
Ikezogwo, W.; Seyfioglu, S.; Ghezloo, F.; Geva, D.; Sheikh Mohammed, F.; Anand, P. K.; Krishna, R.; and Chen, J.; Cai, L.; Wang, Z.; Huang, Y.; Jiang, S.; Huang, Shapiro, L. 2023. Quilt-1m: One million image-text pairs for histopathology. Advances in Neural Information Processing Systems, 36: 37995–38017.
Jiang, S.; Liu, F.; Wang, Z.; Cai, L.; and Zhang, Y. 2026. PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization. arXiv preprint arXiv:2601.21617.
Chen, J.; Gui, C.; Ouyang, R.; Gao, A.; Chen, S.; Chen, G. H.; Wang, X.; Cai, Z.; Ji, K.; Wan, X.; et al. 2024a. Towards injecting medical visual knowledge into multimodal llms at scale. In Proceedings of the Conference on Empirical Methods in Natural Language Processing, 7346–7370.
Chen, K.; Wei, L.; Rui, S.; Yuan, Y.; Zhang, X.; Du, Z.; He, P.; Wang, Y.; Liu, M.; Zhou, M.; et al. 2026. Omni- PathoVQA: Benchmarking Pathology Vision-Language Models with Encyclopedia-Scale Knowledge. Medical Image Analysis, 104196.
Chen, L.; Li, J.; Dong, X.; Zhang, P.; Zang, Y.; Chen, Z.; Duan, H.; Wang, J.; Qiao, Y.; Lin, D.; et al. 2024b. Are we on the right way for evaluating large vision-language mod- els? Advances in Neural Information Processing Systems, 37: 27056–27087.
Chen, P.; Zhu, C.; Zheng, S.; Li, H.; and Yang, L. 2024c. Wsi-vqa: Interpreting whole slide images by generative vi- sual question answering. In Proceedings of the European Conference on Computer Vision, 401–417. Springer.
DeepSeek-AI. 2026. DeepSeek-V4-Pro. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro.
Majzoub, R. A.; Malik, H.; Naseer, M.; Zaheer, Z.; Mah- mood, T.; Khan, S.; and Khan, F. 2025. How good is my histopathology vision-language foundation model? a holistic benchmark. arXiv preprint arXiv:2503.12990.
Meta AI. 2025. The Llama 4 Herd: The Beginning of a New Era of Natively Multimodal AI Innovation. https://ai.meta.com/blog/llama-4-multimodal-intelligence/.
Gilal, N. U.; Zegour, R.; Al-Thelaya, K.; Özer, E.; Agus, M.; Schneider, J.; and Boughorbel, S. 2025. PathVLM-Eval: Evaluation of open vision language models in histopathology. Journal of Pathology Informatics, 18: 100455.
GLM-5 Team; Zeng, A.; Lv, X.; Hou, Z.; Du, Z.; Zheng, Q.; Chen, B.; Yin, D.; Ge, C.; Xie, C.; et al. 2026. GLM-5: From Vibe Coding to Agentic Engineering. arXiv preprint arXiv:2602.15763.
Google DeepMind. 2025. Gemini 3: A New Era of Intelligence. https://blog.google/products-and- platforms/products/gemini/gemini-3/.
He, X.; Zhang, Y.; Mou, L.; Xing, E.; and Xie, P. 2020. Pathvqa: 30000+ questions for medical visual question an- swering. arXiv preprint arXiv:2003.10286.
Hu, Y.; Li, T.; Lu, Q.; Shao, W.; He, J.; Qiao, Y.; and Luo, P. 2024. Omnimedvqa: A new large-scale comprehensive evaluation benchmark for medical lvlm. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 22170–22183.
Liu, H.; Li, C.; Li, Y.; and Lee, Y. J. 2024. Improved baselines with visual instruction tuning. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 26296–26306.
Liu, X.; Hu, Y.; Zou, Y.; Wu, L.; Xu, J.; and Zheng, B. 2025. HiDe: Rethinking The Zoom-IN method in High Resolu- tion MLLMs via Hierarchical Decoupling. arXiv preprint arXiv:2510.00054.
Lu, M. Y.; Chen, B.; Williamson, D. F.; Chen, R. J.; Liang, I.; Ding, T.; Jaume, G.; Odintsov, I.; Le, L. P.; Gerber, G.; et al. 2024. A visual-language foundation model for computational pathology. Nature Medicine, 30(3): 863–874.
Lyu, X.; Liang, Y.; Chen, W.; Ding, M.; Yang, J.; Huang, G.; Zhang, D.; He, X.; and Shen, L. 2026. WSI-Agents: A Col- laborative Multi-agent System for Multi-modal Whole Slide Image Analysis. In Proceedings of the Conference on Med- ical Image Computing and Computer Assisted Intervention, 680–690. Springer.
Ding, T.; Wagner, S. J.; Song, A. H.; Chen, R. J.; Lu, M. Y.; Zhang, A.; Vaidya, A. J.; Jaume, G.; Shaban, M.; Kim, A.; et al. 2025. A multimodal whole-slide foundation model for pathology. Nature Medicine, 1–13.
Ghezloo, F.; Seyfioglu, M. S.; Soraki, R.; Ikezogwo, W. O.; Li, B.; Vivekanandan, T.; Elmore, J. G.; Krishna, R.; and Shapiro, L. 2025. Pathfinder: A multi-modal multi-agent system for medical diagnostic decision-making applied to histopathology. In Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision, 23431–23441.
Moonshot AI. 2026. Kimi K2.6: An Open- Source Native Multimodal Agentic Model. https://huggingface.co/moonshotai/Kimi-K2.6.
OpenAI. 2026. GPT-5.4. https://openai.com/index/introducing-gpt-5-4/.
Qwen Team. 2025. Qwen3-Max: Just Scale. https://qwen.ai/blog?id=qwen3-max.
Qwen Team. 2026. Qwen3.6-Max-Preview: Smarter, Sharper, Still Evolving. https://qwen.ai/blog?id=qwen3.6- max-preview.
Qwen Team, A. G. 2025. Qwen2.5-VL Technical Report. arXiv preprint arXiv:2502.13923.
Seyfioglu, M. S.; Ikezogwo, W. O.; Ghezloo, F.; Krishna, R.; and Shapiro, L. 2024. Quilt-llava: Visual instruction tuning by extracting localized narratives from open-source histopathology videos. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 13183–13192.
Sun, Y.; Si, Y.; Zhu, C.; Gong, X.; Zhang, K.; Chen, P.; Zhang, Y.; Shui, Z.; Lin, T.; and Yang, L. 2025a. Cpath- omni: A unified multimodal foundation model for patch and whole slide image analysis in computational pathology. In
第 9 页
IEEE/CVF 计算机视觉与模式识别会议论文集,10360–10371。 Sun, Y.; Si, Y.; Zhu, C.; Zhang, K.; Shui, Z.; Ding, B.; Lin T.; 和 Yang, L. 2026。CPathAgent:一种基于代理的基础模型,用于模仿病理学家诊断逻辑的可解释高分辨率病理 图像分析。神经信息处理系统进展,38: 101673–101731。 Sun, Y.; Wu, H.; Zhu, C.; Si, Y.; Chen, Q.; Zhang, Y.; Zhang, K.; Li, J.; Cai, J.; Wang, Y.; 等。2025b。PathBench:推进大 多模态模型在病理图像理解方面的基准,涵盖补丁和全切片 级别。IEEE 医学成像汇刊。 Sun, Y.; Wu, H.; Zhu, C.; Zheng, S.; Chen, Q.; Zhang, K.; Zhang, Y.; Wan, D.; Lan, X.; Zheng, M.; 等。2024a。Path- mmu:一个大规模多模态专家级基准,用于病理学中的理解 和推理。在欧洲计算机视觉会议论文集,56–73。 Springer。 Sun, Y.; Zhang, Y.; Si, Y.; Zhu, C.; Zhang, K.; Shui, Z.; Li, J.; Gong, X.; Lyu, X.; Lin, T.; 等。2025c。Pathgen- 1.6 m:通过多代理协作生成 160 万对病理图像-文本。在 国际学习表征会议论文集,卷 2025,94611–94653。 Sun, Y.; Zhu, C.; Zheng, S.; Zhang, K.; Sun, L.; Shui, Z.; Zhang, Y.; Li, H.; 和 Yang, L. 2024b。Pathasst:一种生成式 基础 AI 助手,迈向病理学的人工智能通用智能。在 AAAI 人工智能会议论文集,卷 38,5034–5042。 Wang, P.; Bai, S.; Tan, S.; Wang, S.; Fan, Z.; Bai, J.; Chen, K.; Liu, X.; Wang, J.; Ge, W.; 等。2024。Qwen2-vl:增强 视觉语言模型在任何分辨率下对世界的感知。arXiv 预印本 arXiv:2409.12191。 Wu, J.; Yang, H.; Zeng, X.; He, G.; Chen, Z.; Li, Z.; Zhang, X.; Ma, Y.; Fang, R.; 和 Liu, Y. 2025。Pathvlm-r1:一种 由强化学习驱动的推理模型,用于病理学 视觉-语言任务。arXiv 预印本 arXiv:2504.09258。 Zafar, A.; Murali, L. K.; 和 Vashist, A. 2026。超越 准确性:评估多模态医学推理中的视觉定位。arXiv 预印本 arXiv:2603.03437。 Zhang, W.; Guo, J.; Zhang, H.; Zhang, P.; Chen, J.; Zhang, S.; Zhang, Z.; Yi, Y.; 和 Bu, H. 2026a。Patho-AgenticRAG: 通过强化学习迈向多模态代理检索增强生成 用于病理学 VLMs。在 AAAI 人工智能会议论文集, 卷 40,29921–29929。 Zhang, W.; Zhang, P.; Guo, J.; Cheng, T.; Chen, J.; Zhang, S.; Zhang, Z.; Yi, Y.; 和 Bu, H. 2026b。Patho-r1:一种多 模态基于强化学习的病理学专家理 解器。在 AAAI 人工智能会议论文集, 卷 40,28418–28426。 Zhong, C.; Hao, S.; Wu, J.; Chang, X.; Jiang, J.; Nie, X.; Tang, H.; 和 Bai, X. 2025。PathVG:一个新的病理学视觉定位 基准和数据集。在 医学图像计算与计算机辅助干预会议论文集,454–463。Springer。
第 10 页
A 补充实验结果与分析 在本节中,我们提供补充实验结果与分析,以完善主论文中的发现。具体而言,我们报告(1)在额外视觉语言模型(VLMs)上的扩展评估结果,(2)用于考察视觉依赖性的图像消融实验,以及(3)PathVG 上的完整定位结果,以支持第 3 节中的观察。
A.1 病理 VQA 基准与 PathBind 的更多结果 五个病理 VQA 基准上的完整评估结果。表 A.1 通过纳入额外的通用 VLMs,扩展了主论文中的表 1。遵循相同的协议,我们在多个病理 VQA 基准上对每个模型在图像条件设置和纯文本设置下进行评估。
图 A.1:在 PathMMU-test-tiny 上逐步图像模糊下的准确率热力图。在强模糊下保持稳定的准确率表明对细粒度组织病理学细节的敏感性有限。
与主论文中的观察一致,许多模型在没有视觉输入的情况下仍能保持显著的性能。这一现象在闭源和开源模型中均被观察到,并且在扩展评估模型集后保持一致。这些观察表明,基准准确率可能部分反映了文本捷径和领域知识,而非真正的视觉理解。因此,仅凭答案准确率可能无法准确估计病理视觉-语义能力。
表 A.3 进一步报告了在空白图像和图像替换设置下的结果。几种经过病理微调的模型即使在原始图像被移除或替换的情况下,仍能保持显著的准确率。例如,Patho-R1 在空白图像下的准确率为 47.8%,且在相同子集和跨子集图像替换下均保持在 43.0% 以上。PathGen-LLaVA 表现出更强的效应,在三种消融设置下的平均准确率为 55.0%。这些结果表明,某些病理 VLM 即使在视觉证据缺失或语义不匹配时,也能保留许多预测。
PathBind 的完整评估结果。表 A.2 通过报告所有 18 种 VLM 在 PathBind-VQA 和 PathBind-PTA 上针对不同诊断维度的评估,扩展了表 2 中的主要结果。遵循相同的评估协议,我们报告了图像条件和纯文本下的准确率,以及视觉输入带来的相应提升。
与主要观察结果一致,闭源 VLM 在答案侧性能最强,而病理专用模型并未始终表现出比其通用模型更大的 Multimodal Gain(模态增益)。跨诊断维度的结果进一步表明,性能根据所需的病理推理能力存在显著差异。这些发现支持了以下结论:仅凭高答案准确率并不一定意味着更强的视觉-语义绑定。
A.2 图像扰动实验 为了进一步考察病理 VLM 是否依赖输入图像的视觉内容,我们在 PathMMU-test-tiny 上进行了图像扰动实验。我们考虑两种干预措施。首先,我们逐步模糊输入图像以削弱细粒度组织病理学细节。其次,我们将原始图像替换为空白图像、从同一子集采样的图像或从不同子集采样的图像,同时保持问题和答案选项不变。
图 A.1 显示了模型在不同程度图像模糊下的准确率。如果模型强烈依赖微观视觉证据,随着图像细节的逐渐退化,其准确率应下降。然而,几种模型在中等甚至强模糊下保持相对稳定,表明对细粒度视觉证据的敏感性有限。这一趋势补充了表 A.1 中的纯文本结果,表明即使视觉信号减弱,基准性能仍可能保持较高水平。
表 A.3 进一步报告了在空白图像和图像替换设置下的结果。几种经过病理微调的模型即使在原始图像被移除或替换的情况下,仍能保持显著的准确率。例如,Patho-R1 在空白图像下的准确率为 47.8%,且在相同子集和跨子集图像替换下均保持在 43.0% 以上。PathGen-LLaVA 表现出更强的效应,在三种消融设置下的平均准确率为 55.0%。这些结果表明,某些病理 VLM 即使在视觉证据缺失或语义不匹配时,也能保留许多预测。
总之,模糊和替换实验提供了视觉依赖性较弱的互补证据。模糊测试考察模型是否对图像细节的退化敏感,而空白图像和图像替换设置则测试模型是否完全依赖正确的视觉证据。结果表明,病理专用微调并不一定使模型对视觉扰动更敏感,这加强了基准准确率可能高估真实视觉理解的担忧。
A.3 PathVG 上的完整定位结果 为了补充主论文中的定位分析,我们在表 A.4 中报告了完整的 PathVG 结果。对于每个模型,我们使用 IoU(交并比)、Precision(精确率)和 Recall(召回率)计算实体 token 注意力图与真实边界框之间的重叠。结果在 Test A 和 Test B 上分别报告。详细的注意力提取和指标定义见附录 C。
总体而言,各模型的定位性能仍然有限。尽管几种模型实现了合理的召回率,但其 Attention IoU(注意力交并比)和精确率始终较低,表明
第 11 页
PathMMU YorN MedXpert OmniMed 模型 策略 平均 Test-tiny Test-all Quilt-VQA Path-VQA Path Bright
基线
随机选择 – 23.4 24.2 50.0 50.0 21.3 24.2 32.2
闭源视觉语言模型 VLM 70.8↑25.1 68.6↑21.6 68.2↑25.7 71.1↑23.4 68.9↑14.4 61.2↑17.2 68.1↑21.2 GPT-5.4 VLM-text 45.7 47.0 42.5 47.7 54.5 44.0 46.9 VLM 77.8↑26.5 75.6↑25.1 73.5↑24.8 77.5↑17.8 80.0↑25.6 71.8↑15.7 76.0↑22.5 Gemini-3-Pro VLM-text 51.3 50.5 48.7 59.7 54.4 56.1 53.5
开源通用视觉语言模型及病理视觉语言模型 VLM 37.0↑5.3 36.1↑5.4 56.6↑14.6 49.5↑9.9 22.2↑7.8 46.5↑12.3 41.3↑9.2 LLaVA-1.5-7B VLM-text 31.7 30.7 42.0 39.6 14.4 34.2 32.1 VLM 42.0↑6.7 42.2↑5.4 64.3↑10.3 57.3↑1.1 21.1↑4.4 49.8↑10.6 46.1↑6.4 Quilt-LLaVA VLM-text 35.3 36.8 54.0 56.2 16.7 39.2 39.7 VLM 36.3↑4.2 37.2↑5.1 58.3↑14.1 60.8↑13.4 18.9↑4.6 45.2↑11.9 42.8↑8.9 LLaVA-1.5-13B VLM-text 32.1 32.1 44.2 47.4 14.3 33.3 33.9 VLM 62.6↑11.4 60.4↑11.3 62.3↑13.7 63.1↑4.9 30.0↑6.7 68.5↑11.2 57.8↑9.8 PathGen-LLaVA VLM-text 51.2 49.1 48.6 58.2 23.3 57.3 48.0 VLM 48.6↑13.5 47.0↑12.3 52.6↑14.3 60.6↑14.1 18.9↑5.6 51.9↑9.0 46.6↑11.5 Qwen2-VL-7B VLM-text 35.1 34.7 38.3 46.5 13.3 42.9 35.1 VLM 57.5↑11.8 56.1↑12.0 62.6↑15.4 60.2↑10.7 20.0↑2.2 44.9↑7.1 50.2↑9.8 HuatuoGPT-Vision-7B VLM-text 45.7 44.1 47.2 49.5 17.8 37.8 40.4 VLM 51.6↑21.1 48.7↑17.7 54.2↑14.1 59.5↑11.7 13.3↑1.1 54.6↑9.9 47.0↑12.6 Qwen2.5-VL-7B VLM-text 30.5 31.0 40.1 47.8 12.2 44.7 34.4 VLM 63.1↑15.3 62.9↑18.3 64.4↑11.6 55.3↑12.3 16.7↑0.9 69.9↑11.3 55.4↑11.6 Patho-R1-7B VLM-text 47.8 44.6 52.8 43.0 15.8 58.6 43.8 VLM 59.7↑16.0 58.5↑17.9 62.3↑22.1 63.6↑11.7 30.0↑10.4 52.6↑8.8 54.5↑14.5 Lingshu-7B VLM-text 43.7 40.6 40.2 51.9 19.6 43.8 40.0
更多开源通用视觉语言模型 VLM 54.3↑23.7 53.3↑19.6 60.6↑18.5 62.7↑13.2 26.7↑6.7 54.5↑3.9 52.0↑14.2 Qwen3-VL-8B VLM-text 30.6 33.7 42.1 49.5 20.0 50.6 37.8 VLM 51.4↑18.4 52.5↑18.1 60.3↑18.7 61.4↑10.5 24.4↑3.3 60.3↑10.6 51.7↑13.2 InternVL3-8B VLM-text 33.0 34.4 41.6 50.9 21.1 49.7 38.5 VLM 49.5↑17.7 48.4↑16.0 53.4↑16.0 60.5↑11.7 16.7↑3.3 54.5↑1.7 47.2↑11.1 Llama-3.2-11B VLM-text 31.8 32.4 37.4 48.8 13.4 52.8 36.1 VLM 51.2↑18.4 49.4↑16.8 64.1↑10.8 63.4↑1.2 16.7↑2.2 47.3↑1.8 48.7↑8.5 Gemma-3-12B VLM-text 32.8 32.6 53.3 62.2 14.5 45.5 40.2 VLM 56.4↑15.1 55.6↑21.2 69.4↑8.7 65.0↑1.8 27.8↑4.4 46.7↑1.9 53.5↑8.9 Gemma-3-27B VLM-text 41.3 34.4 60.7 63.2 23.4 44.8 44.6 VLM 62.6↑20.7 60.4↑20.1 58.6↑21.0 68.8↑18.9 28.7↑19.5 58.7↑9.4 56.3↑18.3 Qwen3-VL-32B VLM-text 41.9 40.3 37.6 49.9 9.2 49.3 38.0 VLM 55.9↑19.2 54.8↑17.7 63.0↑23.0 71.8↑18.9 24.7↑4.3 48.1↑10.4 53.1↑15.6 InternVL3-38B VLM-text 36.7 37.1 40.0 52.9 20.4 37.7 37.5
表 A.1:18 个视觉语言模型在五个流行病理视觉问答基准上的完整评估结果。在“策略”列中,“VLM”表示使用图像进行评估,而“VLM-text”表示不使用图像进行评估。我们报告了 2 个闭源视觉语言模型、5 个经过病理微调的视觉语言模型及其基础模型,以及 7 个开源通用视觉语言模型的结果。“VLM”和“VLM-text”设置下各模型的最高结果分别以粗体和下划线突出显示。带箭头的数字表示“VLM”相对于“VLM-text”的提升幅度。
第 12 页
PathBind-VQA (1,500) PathBind-PTA (600) 模型 策略 平均 D1 D2 D3 D4 D5 D6 D1 D2 D3 D4 D5
基线
随机选择 – 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0 25.0
闭源视觉语言模型 VLM 73.2↑23.6 75.2↑27.6 76.8↑24.0 69.2↑16.8 70.0↑24.4 71.2↑20.4 53.3↑21.6 83.3↑19.1 87.5↑24.2 85.0↑24.2 70.0↑39.2 74.1↑24.1 GPT-5.4 VLM-text 49.6 47.6 52.8 52.4 45.6 50.8 31.7 64.2 63.3 60.8 30.8 50.0 VLM 80.0↑21.2 74.8↑19.2 71.6↑17.6 75.2↑20.8 67.2↑16.0 72.0↑15.2 68.3↑20.0 82.5↑29.2 85.8↑21.6 85.0↑21.7 79.2↑42.5 76.5↑22.3 Gemini-3-Pro VLM-text 58.8 55.6 54.0 54.4 51.2 56.8 48.3 53.3 64.2 63.3 36.7 54.2
开源通用视觉语言模型及病理视觉语言模型 VLM 40.4↑5.2 40.8↑4.8 48.8↑8.8 41.2↑9.6 35.2↑8.8 34.0↑12.4 38.3↑4.1 60.0↑8.3 67.5↑28.3 71.7↑13.4 29.2↑6.7 46.1↑10.0 LLaVA-1.5-7B VLM-text 35.2 36.0 40.0 31.6 26.4 21.6 34.2 51.7 39.2 58.3 22.5 36.1 VLM 46.4↑8.8 49.6↑6.4 42.4↑4.0 49.2↑9.2 34.0↑7.2 34.8↑10.0 32.5↑1.7 57.5↑9.2 70.8↑21.6 71.7↑14.2 34.2↑3.4 47.6↑8.7 Quilt-LLaVA VLM-text 37.6 43.2 38.4 40.0 26.8 24.8 30.8 48.3 49.2 57.5 30.8 38.9 VLM 42.0↑16.4 45.6↑11.2 44.0↑10.0 42.0↑14.4 37.6↑11.2 37.6↑11.2 48.3↑10.8 63.3↑10.0 71.7↑18.4 74.2↑15.0 35.8↑11.6 49.3↑12.8 LLaVA-1.5-13B VLM-text 25.6 34.4 34.0 27.6 26.4 26.4 37.5 53.3 53.3 59.2 24.2 36.5 VLM 55.6↑18.8 53.2↑15.6 56.0↑13.6 58.8↑16.4 54.8↑15.2 60.8↑17.2 55.8↑19.1 80.0↑13.3 80.0↑17.5 78.3↑16.6 57.5↑22.5 62.8↑16.9 PathGen-LLaVA VLM-text 36.8 37.6 42.4 42.4 39.6 43.6 36.7 66.7 62.5 61.7 35.0 45.9 VLM 40.0↑14.8 38.4↑13.6 40.4↑15.6 41.2↑17.2 30.8↑10.0 40.4↑18.8 51.7↑16.7 75.8↑10.0 63.3↑12.5 77.5↑22.5 47.5↑15.0 49.7↑15.1 Qwen2-VL-7B VLM-text 25.2 24.8 24.8 24.0 20.8 21.6 35.0 65.8 50.8 55.0 32.5 34.6 VLM 46.4↑16.0 49.6↑23.2 48.8↑20.0 46.8↑17.6 31.6↑10.4 40.8↑10.4 49.2↑17.5 69.2↑17.5 75.0↑26.7 70.0↑15.8 52.5↑23.3 52.7↑18.0 HuatuoGPT-Vision-7B VLM-text 30.4 26.4 28.8 29.2 21.2 30.4 31.7 51.7 48.3 54.2 29.2 34.7 VLM 44.0↑22.8 43.2↑14.8 42.4↑16.4 44.4↑25.2 42.4↑20.8 44.0↑24.8 56.7↑20.9 75.0↑12.5 75.8↑10.8 81.7↑18.4 41.7↑16.7 53.8↑18.6 Qwen2.5-VL-7B VLM-text 21.2 28.4 26.0 19.2 21.6 19.2 35.8 62.5 65.0 63.3 25.0 35.2 VLM 60.4↑21.6 52.8↑17.6 52.8↑18.8 55.2↑19.6 60.0↑21.6 59.6↑23.6 62.5↑22.5 78.3↑15.0 81.7↑11.7 75.0↑6.7 60.8↑19.1 63.6↑18.0 Patho-R1-7B VLM-text 38.8 35.2 34.0 35.6 38.4 36.0 40.0 63.3 70.0 68.3 41.7 45.6 VLM 61.2↑21.6 53.2↑17.2 50.8↑18.8 55.6↑19.6 59.2↑20.0 59.6↑24.4 57.5↑13.3 74.2↑21.7 86.7↑21.7 82.5↑16.7 64.2↑17.5 64.1↑19.4 Lingshu-7B VLM-text 39.6 36.0 32.0 36.0 39.2 35.2 44.2 52.5 65.0 65.8 46.7 44.7
更多开源通用视觉语言模型 VLM 45.2↑23.6 44.0↑16.8 42.4↑21.6 45.6↑22.8 36.8↑14.8 40.8↑20.4 55.8↑22.5 74.2↑25.0 80.8↑26.6 84.2↑24.2 55.8↑25.0 55.1↑22.2 Qwen3-VL-8B VLM-text 21.6 27.2 20.8 22.8 22.0 20.4 33.3 49.2 54.2 60.0 30.8 32.9 VLM 47.2↑23.2 45.6↑15.2 44.4↑18.8 44.8↑23.2 36.4↑9.6 41.6↑19.6 50.8↑17.5 71.7↑21.7 72.5↑20.8 81.7↑15.9 47.5↑12.5 53.1↑18.0 InternVL3-8B
VLM-text 24.0 30.4 25.6 21.6 26.8 22.0 33.3 50.0 51.7 65.8 35.0 35.1 VLM 47.6↑26.4 44.0↑16.0 38.0↑14.4 45.2↑23.2 33.2↑8.4 40.0↑20.8 52.5↑13.3 74.2↑16.7 76.7↑21.7 80.8↑20.8 55.0↑24.2 53.4↑18.7 Llama-3.2-11B VLM-text 21.2 28.0 23.6 22.0 24.8 19.2 39.2 57.5 55.0 60.0 30.8 34.7 VLM 43.6↑18.4 42.8↑20.0 46.0↑16.8 44.8↑22.4 42.4↑15.2 43.6↑23.2 56.7↑18.4 76.7↑15.0 73.3↑18.3 82.5↑23.3 53.3↑24.1 55.1↑19.6 Gemma-3-12B VLM-text 25.2 22.8 29.2 22.4 27.2 20.4 38.3 61.7 55.0 59.2 29.2 35.5 VLM 47.6↑20.8 46.8↑24.8 47.2↑20.8 50.4↑24.8 36.8↑13.6 44.4↑25.2 57.5↑19.2 72.5↑23.3 81.7↑30.0 82.5↑20.8 57.5↑25.0 56.8↑22.6 Gemma-3-27B VLM-text 26.8 22.0 26.4 25.6 23.2 19.2 38.3 49.2 51.7 61.7 32.5 34.2 VLM 54.0↑33.2 50.4↑26.8 48.4↑25.2 52.0↑30.0 39.6↑19.6 56.0↑33.6 61.7↑23.4 82.5↑22.5 82.5↑27.5 83.3↑22.5 56.7↑20.9 60.6↑25.9 Qwen3-VL-32B VLM-text 20.8 23.6 23.2 22.0 20.0 22.4 38.3 60.0 55.0 60.8 35.8 34.7 VLM 50.4↑30.0 48.0↑18.0 40.4↑15.6 49.2↑27.2 30.8↑8.8 45.2↑24.0 50.0↑13.3 84.2↑17.5 71.7↑10.9 84.2↑17.5 50.8↑21.6 55.0↑18.6 InternVL3-38B VLM-text 20.4 30.0 24.8 22.0 22.0 21.2 36.7 66.7 60.8 66.7 29.2 36.4
表 A.2:18 个 VLM 在 PathBind-VQA 和 PathBind-PTA across 诊断维度上的完整评估。“VLM”表示使用图像进行评估,“VLM-text”表示不使用图像进行评估。PathBind-VQA 涵盖六个维度(D1–D6);PathBind-PTA 涵盖前五个(D1–D5)。每列中“VLM”和“VLM-text”的最高结果分别以粗体和下划线突出显示。带箭头的数字表示“VLM”相对于“VLM-text”的提升幅度。
注意力往往扩散到标注的病理结果区域之外。例如,Qwen2.5-VL 在 Test A 上获得了最高的 IoU,尽管其召回率为 61.5%,但 IoU 仅为 18.6%。在 Test B 上,所有模型的 IoU 和精确度均显著降低,表明在更困难的定位场景下,实体级定位仍然具有挑战性。结果还显示,针对病理学的微调并不能始终改善定位。Patho-R1 在主实验中实现了强大的 VQA 准确率,但其 PathVG IoU 在 Test A 和 Test B 上均低于 Qwen2.5-VL。同样,Quilt-LLaVA 在 Test A 上表现不如 LLaVA-1.5-7B,尽管它在 Test B 上显示出小幅提升。这些结果支持主论文中的结论,即领域训练可以在没有成比例增强实体级视觉-语义绑定的情况下提高答案预测能力。
B 基准构建细节 PathBind 的三个组成部分,包括 PathBind-PTA,均通过 Hugging Face 的受限访问权限公开发布。
B.1 VQA 样本过滤详情 为了构建 PathBind 中视觉依赖性丰富的 VQA 组件,我们使用两步纯文本探测流程过滤现有的病理 VQA 样本。目标是
第 13 页
模型 同子集 跨子集 平均 第2步中,当五个大语言模型(LLM)中的至少三个正确回答时,会移除额外的样本。 LLaVA-1.5-7B 32.6 33.1 32.6 32.8 Quilt-LLaVA 35.6 34.0 34.6 34.7 这种两步过滤策略是有意保守的。第一步移除那些对强大的闭源大语言模型来说容易解决的样本,而第二步移除那些被多个额外大语言模型一致可解的样本。 LLaVA-1.5-13B 30.9 33.1 33.3 32.4 PathGen-LLaVA 51.4 57.4 56.3 55.0 通过结合强模型过滤和大语言模型共识过滤,PathBind 减少了仅文本捷径的影响,同时保留了足够大且多样化的视觉问答(VQA)数据集用于评估。 Qwen2-VL-7B 9.0 34.2 36.6 26.6 HuatuoGPT-Vision-7B 41.5 42.7 44.1 42.8 Qwen2.5-VL-7B 30.4 34.5 34.2 33.0 Patho-R1-7B 47.8 44.6 43.6 45.3
表 A.3:四种病理视觉语言模型(VLM)及其对应基础模型在 PathMMU-test-tiny 上的图像消融实验。考虑三种实验设置:空白图像、来自同一子集的图像以及来自不同子集的图像。在这些设置下的高准确率表明对原始视觉证据的敏感性较弱。
测试 A 测试 B 模型 交并比 (IoU) 精确率 (Pre) 召回率 (Rec) 交并比 (IoU) 精确率 (Pre) 召回率 (Rec) InternVL3-8B 7.2 10.1 25.5 3.0 3.2 29.3 Qwen3-VL-8B 15.8 20.6 55.4 5.9 6.3 59.6 LLaVA-1.5-7B 13.2 18.2 41.8 2.4 2.6 23.2 Quilt-LLaVA 10.1 15.1 30.4 2.8 3.1 26.1 LLaVA-1.5-13B 12.4 17.2 41.5 3.6 3.8 34.1 PathGen-LLaVA 15.2 20.1 50.5 4.5 4.8 42.5 HuatuoGPT-Vision-7B 14.0 18.7 43.9 4.4 4.7 41.4 Qwen2-VL-7B 11.3 15.4 40.2 3.8 4.1 37.4 Qwen2.5-VL-7B 18.6 23.9 61.5 5.3 5.7 55.3 Patho-R1-7B 14.9 19.9 51.0 5.1 5.5 52.1
表 A.4:PathVG 上的完整注意力-定位结果。我们报告实体令牌注意力图与病理表达的真实边界框之间的交并比 (IoU)、精确率和召回率。最佳结果以粗体显示。
B.2 定位样本过滤详情
为了构建 PathBind 的定位组件,我们从完整的 PathVG testA 和 testB 分割开始,总共包含 3,048 个表达,其中 testA 包含 1,342 个表达,testB 包含 1,706 个表达。由于某些表达过于通用,无法在组织学图像中唯一标识一个有界区域,因此在将其纳入 PathBind 之前,我们应用特异性过滤步骤。
我们使用 GPT-5.4 和 Gemini 来判断每个表达是否足够具体以进行区域级定位。如果一个表达能够识别出可与一个有界区域关联的局部病理实体或视觉模式,则保留该表达;否则,将其作为模糊表达移除。
两个模型将 2,467 个表达分类为“具体”(Specific),包括来自 testA 的 1,047 个和来自 testB 的 1,420 个,并将 581 个表达分类为“模糊”(Vague)。 resulting 保留率为 80.9%。这一比率高于 VQA 过滤阶段的保留率,这是预期的,因为 PathVG 中的定位表达通常比 VQA 问题具有更高的视觉特异性。
B.3 PathBind-PTA VQA 构建
PathBind 的私有组件是从病理教学图谱中构建的,以提供额外的专家导向评估样本。与专注于从现有基准中移除文本可解捷径的公共 VQA 组件不同,私有集旨在通过精心控制的病理概念和图像-问题对来补充公共数据。
我们首先从教学图谱中选择覆盖多种诊断场景的高质量病理图像。然后使用 GPT-5.4 基于视觉内容生成初始多项选择题,每个问题与一个预定义的病理推理维度相关联。此过程产生了 900 个候选图像-问题对。
病理专家随后审查所有生成的候选项,以移除模糊案例、文本泄漏样本以及答案无法得到视觉证据充分支持的问题。专家还平衡诊断维度和答案选项的分布,并在原始问题规定不足时添加必要的解剖学或临床背景。
专家细化后,我们获得了 PathBind-PTA,由 600 个多项选择题组成,均匀分布在五个诊断维度上:粗略组织/器官识别、细胞形态、细胞-基质相互作用、空间定位和诊断推理。免疫组化(IHC)和染色
第 14 页
解释因教学图谱无法提供该类别足够的受控样本而被排除。两位主治病理医师分别拥有 6 年和 9 年的诊断病理学经验,而高级顾问病理医师拥有 21 年经验。对于所有三个 PathBind 组件,两位主治病理医师使用预定义的特定任务标准独立审查每个候选样本。评审人员对模型身份、模型预测、注意力图及下游评估结果均处于盲态。初始决定存在分歧的案例,会与高级顾问病理医师共同讨论,直至达成最终共识决定。
B.4 诊断维度定义
PathBind 将 VQA 样本组织为六个诊断维度。这些维度旨在反映不同层次的病理视觉推理,从全局组织识别到细粒度诊断解释。详细解释列于表 B.7。
B.5 人工审查详情
评审员资质与审查协议。专家小组由两位主治病理医师和一位高级顾问病理医师组成。对于所有三个 PathBind 组件,两位主治病理医师使用预定义的特定任务标准独立审查每个候选样本。评审人员对模型身份、模型预测、注意力图及下游评估结果均处于盲态。初始决定存在分歧的案例,会与高级顾问病理医师共同讨论,直至达成最终共识决定。
评审员间一致性。为评估专家策展的可靠性,根据两位主治病理医师初始的独立保留/排除决定计算了评审员间一致性。
第 15 页
维度 名称 定义
D1 粗略组织/器官识别 从全局视觉模式识别广泛的组织类型、器官背景或一般组织学类别。 D2 细胞形态 识别细胞级特征,如核异型性、胞质外观、有丝分裂象、坏死或细胞形状。 D3 细胞-间质相互作用 解释细胞与周围间质的关系,包括浸润模式、炎症分布、促纤维增生反应和肿瘤微环境相互作用。 D4 空间定位 推理病理结构在图像内的空间位置、排列或分布。 D5 诊断推理 整合视觉证据以支持诊断、鉴别诊断、分级、分期或临床导向的解释。 D6 染色和免疫组化解释 解释染色模式、免疫组化阳性、强度、分布或定量染色相关信息。
表 B.7:PathBind 中使用的六个诊断维度的定义。
如表 B.8 总结,PathBind-VQA 的一致性百分比为 94.18%,PathBind-Grounding 为 92.91%,PathBind-PTA 为 96.44%,相应的 Cohen’s κ 值分别为 0.851、0.858 和 0.912。这些结果表明,在三个策展任务中,评分者间的一致性始终很高。
PathBind-Grounding 审查。对于接地组件,两位主治病理学家独立审查了经过表达特异性过滤后从初始 3,048 个 PathVG 样本中保留的 2,467 个候选样本。在手动审查的第一阶段,每个表达-边界框三元组均被评估其空间描述准确性、内容描述准确性以及对所推荐病理区域的边界框覆盖情况。审查排除了 210 个空间描述不准确的样本、60 个内容描述不准确的样本以及 970 个边界框不准确的样本,留下 1,227 个符合条件的候选样本。在第二阶段,根据图像清晰度、表达特异性、表达区域对应性、边界框准确性以及病理发现的代表性,对剩余候选样本进行比较评估。分歧通过与高级顾问病理学家进行共识讨论解决。最终基准样本大小是在解决共识后确定的,并在适用时进行后续的质量排名和分布平衡。
PathBind-VQA 审查。对于公共 VQA 组件,两位主治病理学家独立审查了经过两阶段纯文本过滤后保留的 6,356 个候选样本。在手动审查的第一阶段,如果样本包含低信息图像、图像-问题不匹配、问题定义不足、冗余模板、图像内文本泄露或多面板合成,则将其排除。具体而言,移除了 40 个低信息样本、15 个图像-问题不匹配样本、126 个定义不足的样本、2,125 个冗余或近乎重复的模板、130 个存在文本泄露的样本以及 129 个多面板合成样本,留下 3,791 个符合条件的候选样本。在第二阶段,根据图像清晰度、问题特异性、临床相关性以及答案选项的合理性和区分质量,在每个诊断维度内对剩余候选样本进行比较评估。分歧通过与高级顾问病理学家进行共识讨论解决。然后在保持平衡覆盖范围的同时选择最高质量的样本,从而在六个诊断维度和答案选项中产生 1,500 个 VQA 样本,每个维度 250 个样本。
PathBind-PTA 审查。对于私有教学图集组件,两位主治病理学家独立审查了生成的 900 个 VQA 候选样本。审查移除了模糊问题、文本泄露候选样本以及答案未得到图像充分支持的问题。当诊断否则将定义不足时,专家还会添加必要的解剖或系统背景。由于染色和免疫组化问题更可能依赖于文本标签或外部染色方案,因此该维度被排除在私有集之外。最终的 PathBind-PTA 组件包含前五个诊断维度上的 600 道多项选择题,每个维度 120 个样本。我们还平衡了答案选项,导致选项 A-D 各有 150 个样本。在所有三个组件中,关于排除理由的分歧保留/排除决定和争议均与高级顾问病理学家讨论,最终确定注释。
我们提供 PathBind 构建中使用的专家审查过程的更多细节。专家审查应用于 PathBind 所有三个组件的自动过滤之后,但审查标准根据数据类型而有所不同:VQA 样本审查视觉依赖性和问题质量,接地样本审查表达-边界框一致性,私有教学图集样本审查视觉支持和答案有效性。
第 16 页
组件 两者均保留 两者均排除 R1保留/R2排除 R1排除/R2保留 一致性 (%) Cohen’s κ
PathBind-VQA 6,356 1,510 4,476 185 185 94.18 0.851 PathBind-Grounding 2,467 1,146 1,146 87 88 92.91 0.858 PathBind-PTA 900 630 238 15 17 96.44 0.912
表 B.8:三位 PathBind 组件专家审查的审查者间一致性。一致性是根据两位参与审查的病理科医生在共识讨论前的初始独立保留/排除决定计算的。
通过共识确定。模型 浅层三分之一 中层三分之一 深层三分之一 所有层 LLaVA-1.5-7B 5.8 14.1 10.9 10.2 C 基于注意力的定位指标 Quilt-LLaVAInternVL3-8B 5.6 4.4 10.4 8.5 10.4 8.6 8.1 8.0 C.1 注意力提取 Qwen3-VL-8B 7.2 18.8 11.9 15.7 Qwen2.5-VL-7B 7.3 19.7 16.5 17.7 我们遵循受 HiDe (Liu et al. 2025) 启发的逐 token 注意力提取策略,该策略利用信息性文本 token 的注意力权重来识别其对应的视觉区域。在我们的设置中,信息性文本 token 是病理实体表达的 token。给定一张图像和一个实体短语,我们从实体 token 到图像 patch 提取注意力,跨 heads、layers 和实体 token 聚合注意力图,并将生成的热力图转换为二值化关注区域。 Patho-R1-7B 7.8 15.0 10.9 12.5 表 C.9:PathBind-Grounding 的层聚合合理性检查。四种层聚合策略下的平均 IoU (%)。每行最佳值加粗显示。
为了排除领域或架构迁移失败导致默认设置失效的情况,我们对 PathBind-Grounding 上的六种代表性模型进行了合理性检查,这些模型涵盖了 LLaVA-1.5、InternVL3 和 Qwen 系列。使用主表运行期间保存的逐层实体最大图,表 C.9 比较了四种聚合策略下的平均 IoU:浅层三分之一、中层三分之一(默认)、深层三分之一和所有层均值。中层聚合在六种模型中的五种上表现最佳,且没有病理微调模型将其峰值定位层相对于其通用基线移至中层三分之一之外。InternVL3-8B 是唯一的例外,深层聚合实现了略高的 IoU(+1.9 分);我们保留中层作为全文默认值,以保持聚合协议与架构无关。 对于每个实体 token k,我们随后对选定层中的 head-pooled 注意力向量求平均:
H 1 mk = X aℓ,k. (3) aℓ,k = X Attnℓ,h [k, simg : eimg] ∈RNimg, (1) |Lmid| 其中 H 是注意力 heads 的数量。这为每个实体 token 和层生成了一个 patch 级注意力向量。 ℓ∈Lmid 当一个实体短语包含多个 token 时,我们使用逐元素最大值聚合它们的图: 生成的向量随后根据模型特定的视觉 token 布局重塑为大小为 Hp × Wp 的二维 patch 网格。 M(i, j) = max mk(i, j). (4) k∈K L L 2L Lmid = , + 1, . . . , −1 , (2) 3 3 3 我们使用最大池化而非平均池化,以便强局部化的 token 能够贡献到最终的实体图中,而不会被短语中的其他 token 稀释。 其中 L 是语言解码器的层数。这一选择受到 HiDe 的经验观察的启发,HiDe 扫描了 Qwen2.5-VL 和 InternVL3 每个解码器层上真实区域跨 token 的平均语义注意力,并显示中层解码器提供了最强的区域信号。HiDe 的公开代码为每种架构选择一个峰值层;这两个峰值层都位于各自架构的中层三分之一内,因此我们的中层平均包含了 HiDe 选择的每个层作为成员。 Patch 级图 M 随后使用 σ = 3 的高斯核进行平滑,进行 min-max 归一化至 [0, 1],并双线性上采样至原始图像分辨率。我们将最终图像分辨率的热力图记为 M。 为了获得二值化关注区域,我们按注意力值选择前 20% 的像素: θq = Quantile(cM, 1 −q), Mask(u) = ⊮[cM(u) ≥θq]. (5)
第 17 页
模型 IoUq=0.05 IoUq=0.1 IoUq=0.2 IoUq=0.3 IoUq=0.4 AP 算法 1:实体令牌注意力提取 LLaVA-1.5-7B 11.8 13.7 14.1 13.4 12.6 28.4 需要:输入图像 I,提示 q,实体短语 e,模型 f Quilt-LLaVA 6.8 8.8 10.4 10.9 11.0 20.7 确保:二元关注区域 Mask InternVL3-8B 6.2 7.7 8.5 9.1 9.6 19.2 1:启用注意力输出进行前向传播。 Qwen3-VL-8B 20.8 21.3 18.8 16.5 14.6 41.5 2:识别图像令牌跨度 [simg, eimg)。 Qwen2.5-VL-7B 21.1 23.0 19.7 16.6 14.7 42.5 3:定位对应于短语 e 的实体令牌位置 K。 Patho-R1-7B 15.8 16.1 15.0 14.1 13.2 34.1 4:选择中间三分之二的解码器层 Lmid。 表 C.10:PathBind- 阈值敏感性 + 像素级 AP。 5:for k ∈K do Grounding。每个阈值下的平均 IoU (%) 和像素级 6:for ℓ∈Lmid do 平均精度 (AP, %) 通过中间层聚合计算。六列之间 7:从令牌 k 提取到图像令牌的注意力。 的所有成对 Kendall’s τ 值均为 1.00,即模型排名在 8:对头进行注意力平均以获得 aℓ,k。 所有阈值和 AP 上均相同。每列的最佳值以粗体显示。 9:end for 10:对层 Lmid 中的 {aℓ,k}ℓ∈Lmid 进行平均以获得 mk。 这种阈值策略固定了跨模型和样本的关注区域比率, 11:将 mk 重塑为大小为 Hp × Wp 的补丁网格。 使区域重叠指标直接可比。 12:end for 选择 q = 0.2。与 HiDe 对归一化热图应用固定值阈值 13:通过对实体令牌图进行逐元素最大值聚合 α ∈[0, 1] 不同,后者产生的每模型关注区域大小差异巨大, 以获得 M。 取决于每个模型注意力分布的尖锐程度。使用保留区域 14:使用高斯核 σ = 3 平滑 M。 分数 q,我们的分位数公式将所有模型的关注区域比率固定 15:对 M 进行最小-最大归一化并上采样至原始 为 q,确保 IoU、 图像分辨率,得到 M。 Precision 和 Recall 在架构间直接可比。 16:在顶部 20% 像素处对 M 进行阈值处理以获得 Mask。 我们设置 q = 0.2 以大致匹配 PathBind-Grounding 中 17:返回 Mask 真实边界框面积分布的第 90 百分位 (中位数 = 4.8%,第 90 百分位 = 20.2%),为 Recall 提供足够的预算,同时避免 Precision 低于绝对差异不可解释的水平。经验上,得分最高的四个 模型(LLaVA-1.5-7B、Qwen3-VL-8B、Qwen2.5- VL-7B、Patho-R1-7B)的最高 IoU 位于 q ∈[0.1, 0.2](表 C.10); 其余两个(Quilt-LLaVA 和 InternVL3-8B)在 q = 0.4 之前 几乎单调增加,但差异较小。因此,q = 0.2 对于最强模型 处于峰值,且对于其他所有模型,峰值差距在 1.1 分以内, 在注意力分布之间提供了一个公平的操作点。
敏感性消融。为了验证由此选择引起的模型排名 不是任何特定阈值的伪影,我们扫描 q ∈{0.05, 0.1, 0.2, 0.3, 0.4},并额外 报告无阈值像素级平均精度 (AP), 即精度-召回曲线下的面积,其中每个 图像像素由其注意力值评分,并由 真实边界框标记。层聚合遵循 默认的中间三分之一均值。表 C.10 报告了 PathBind-Grounding 上六个代表性模型的这些值。 五个基于阈值的排名与无阈值 AP 排名之间的 每对 Kendall’s τ 等于 1.0,表明六个评估模型 的排序在测试的阈值范围内保持不变。
整个过程总结在算法 1 中。除非另有说明,我们使用 默认超参数:中间三分之一层聚合, 高斯平滑 σ = 3,以及顶部 20% 阈值处理。
C.2 区域重叠指标
在从实体令牌注意力热图获得二元关注区域 Mask 后, 我们将其与相应病理表达的真实边界框进行比较。 真实边界框被转换为原始图像分辨率下的 二元区域掩码 GT,其中标注框内的像素被分配 1, 所有其他像素被分配 0。
令 A = |Mask ∩GT|,U = |Mask ∪GT|,M = |Mask|,G = |GT|。这里,A 表示关注区域与 真实区域之间的交集面积, U 表示它们的并集面积,M 表示关注区域面积, G 表示真实区域面积。然后我们计算三个 区域重叠指标:
A A A IoU = U , Precision = M , Recall = G. (6)
IoU 衡量注意力派生区域与真实区域之间的整体空间一致性。 Precision 衡量关注区域中有多少落在真实框内, 反映模型是否专门关注标注的病理实体。Recall 测 量真实框中有多少被关注区域覆盖, 反映模型是否接触到目标实体。
这些指标捕捉了视觉定位(Visual Grounding)的互补方面。 Recall 高但 Precision 或 IoU 低的模型可能关注正确区域, 但也广泛地分散注意力。相比之下,高 Precision 表示更 选择性的注意力,而高 IoU 要求对目标区域有足够 的覆盖,且目标外的注意力泄漏有限。因此,我们在 表 A.4 中报告所有三个指标,以区分松散的注意力重叠与精确的 实体级视觉定位(Visual Grounding)。
第 18 页
C.3 使用不同病理实体查询在同一图像上的有效注意力支持相关性
除了区域重叠指标外,我们还量化实体令牌注意力在图像补丁上的扩散程度。对于每个样本,我们构建 $K=3$ 个实体查询:当前样本的真实实体表达,以及从同一划分中的其他示例采样的两个替代实体表达。替代表达被约束为与当前实体表达不同。对于每个查询,我们使用上述过程在同一图像上提取注意力热力图。这产生了 $K$ 个热力图,记为 $\text{heat}_1, \dots, \text{heat}_K$。
我们计算每对热力图之间的皮尔逊相关系数并取平均值:
$$ B2(\text{sample}) = \frac{1}{K} \sum_{a<b} \text{Pearson}(\text{heat}_a, \text{heat}_b). \quad (10) $$
我们将有效注意力支持大小定义为
$$ N_{\text{eff}} = \exp(H(p)). \quad (8) $$
其中 $p = (p_1, \dots, p_N)$ 是 $N = H_p \times W_p$ 个图像补丁上的归一化注意力分布,满足 $\sum p_i = 1$。分布的香农熵为
$$ H(p) = – \sum_{i=1}^{N} p_i \log p_i. \quad (7) $$
等效地,如果 $\tilde{H} = H(p)/\log N$ 是归一化熵,那么
$$ N_{\text{eff}} = N^{\tilde{H}}. \quad (9) $$
数量 $N_{\text{eff}}$ 可以解释为具有与观察到的注意力分布相同熵的均匀分布中的补丁数量。例如,如果所有注意力质量集中在一个补丁上,则 $H(p)=0$ 且 $N_{\text{eff}}=1$。如果注意力均匀分布在所有补丁上,则 $H(p)=\log N$ 且 $N_{\text{eff}}=N$。中间值表示部分集中。
我们在实验中 $K=3$,因此每个样本包含三个成对比较。
我们报告跨样本平均的归一化比率 $N_{\text{eff}}/N$。接近 1 的值表示观察到的注意力分布的熵接近所有图像补丁上的均匀分布的熵,而较小的值表示更强的集中。重要的是,$N_{\text{eff}}$ 是一个熵等效支持大小,并不暗示恰好有 $N_{\text{eff}}$ 个补丁接收相同的注意力权重。图 2 (b) 显示了模型间近乎完整的有效支持,表明实体令牌注意力的空间集中度较弱。
标准缩放点积注意力的一个众所周知的特性是,softmax 自然地将概率质量分散到相关的视觉特征上。因此,我们并不将 $N_{\text{eff}}/N$ 解释为接地失败的绝对度量;单独的高值并不暗示模型缺乏视觉接地。相反,我们仅通过同一 PathBind-Grounding 样本上的跨模型对比来解释 $N_{\text{eff}}/N$:(i) 它在所有评估的病理视觉语言模型 (VLM) 中均匀偏高,表明在我们的基准测试中,没有模型产生紧凑的实体特异性注意力峰值;(ii) 病理微调并未在任意一对模型中显著收紧 $N_{\text{eff}}/N$;(iii) 因此,我们的结论是关于病理微调在锐化实体选择性方面的相对失败,而不是关于注意力在绝对意义上的扩散。
高跨查询注意力相关性表明,不同的病理实体查询在同一图像上产生相似的注意力模式。这表明模型的视觉证据对查询实体的条件依赖性较弱。相比之下,较低的相关性表明,当目标实体改变时,注意力发生更实质性的变化,表明更强的查询特异性接地。
为了确保跨模型的可比性,每个样本的替代实体查询使用固定种子采样,并在模型间保持一致。我们在图 2 (c) 中报告了跨样本的平均跨查询注意力相关性。
C.4 跨查询注意力相关性
有效注意力支持衡量实体令牌注意力是否在空间上集中,但它并不测试注意力图是否根据查询的实体而变化。为了评估查询特异性,我们计算跨查询注意力相关性。
C.5 定性注意力可视化
图 C.2-C.4 提供了 PathVG 上实体令牌注意力接地的定性示例。我们将示例分为三个代表性类别:成功定位、部分定位和失败定位。这些可视化补充了表 A.4 中的定量结果,并说明了跨模型观察到的不同形式的注意力接地行为。
在图 C.2 所示的成功案例中,注意力热力图与标注的病理区域显著重叠。在图 C.3 所示的部分案例中,注意力可能接触到目标区域,但在空间上仍然扩散、偏移或与附近结构混合。在图 C.4 所示的失败案例中,注意力与真实边界框 largely 不对齐,或专注于无关区域。
这些例子有助于解释为什么召回率可能相对较高,而交并比 (IoU) 和精确率仍然较低。许多模型部分覆盖了正确区域,但也将注意力分散到广泛的无关区域。这支持了我们的观察,即病理 VLM 可能松散地关注相关的视觉内容,而没有形成精确的实体接地。
在图 C.2-C.4 中,一些注意力图强调边界区域,而不是标注病理结构的语义核心。这种模式可能源于共同的提取选择和架构特定的视觉令牌化。首先,算法 1 中的高斯平滑(应用于所有模型)将来自实体核心的注意力响应扩散到相邻补丁,特别是当标注区域相对于平滑核较小时。其次,
第 19 页
对于 Qwen-VL 模型,解码前的空间 token 合并会产生一个更粗糙的补丁网格,其结构在最近邻上采样过程中得以保留。因此,这些边界效应无需在模型族之间共享相同的来源。表 C.10 中的阈值扫描保留了六个评估模型的排名,表明这些效应并未驱动该子集的基于排名的比较。
C.6 关于解释绝对和成对差异 IoU
几个评估模型,尤其是 Qwen2.5-VL、Qwen3-VL 和 InternVL3,采用了显式的边界框和空间定位目标进行预训练,而 LLaVA-1.5 系列和 Quilt-LLaVA 主要基于图像-文本对进行训练,缺乏空间监督。这种不对称性赋予空间监督模型在任何区域级注意力指标上的结构优势,我们并不声称缺乏空间监督的模型应在绝对 IoU 上与空间监督模型相匹配;表 3 中的绝对行仅为完整性提供。
我们的核心主张实际上是图 4 中的成对差异分析。在每一对中,两个模型都继承了相同的基础空间监督,因此 $\Delta$IoU 和 $\Delta$Recall 隔离了与病理特定微调相关的额外视觉定位效应。
D 提示模板
本节提供了我们实验中使用的提示模板。我们为多项选择 VQA、是/否 VQA、实体注意力提取和定位表达式过滤使用单独的提示。多项选择和是/否提示用于涉及相应数据集的所有实验,包括主论文中的 VQA 评估、附录中的扩展纯文本评估、图像扰动实验以及 PathBind 构建中的 VQA 过滤阶段。对于非思维模型,我们移除要求模型在标签内输出推理的指令,仅保留结构化的最终答案格式。
D.1 VQA 评估提示
对于多项选择数据集,包括 PathMMU、MedXpert-Path 和 OmniMed-Bright,我们使用图 D.5 所示的提示模板。该提示指示模型检查组织学视觉证据,对问题进行推理,并以结构化字段输出最终选项。固定的答案格式允许跨模型和评估设置进行一致解析。
对于是/否数据集,包括 Quilt-VQA 和 Path-VQA,我们使用图 D.6 所示的提示模板。该提示遵循与多项选择提示相同的设计原则,但将最终答案限制为“是”或“否”。在纯文本实验和 VQA 过滤中,移除图像输入,同时保留相同的问题提示和答案格式。
D.2 实体注意力提取提示
对于基于注意力的定位分析,我们使用最小化定位提示:Look at the image and locate: {entity},其中 {entity} 替换为与真实区域相关的病理表达。此提示不用于评估答案正确性。相反,它旨在暴露输入序列中的实体短语,以便我们可以从相应的实体 token 中提取图像补丁的注意力。提取的注意力图随后用于附录 C 中描述的定位指标。
D.3 定位表达式过滤提示
为了构建 PathBind 的定位组件,我们根据定位表达式是否足以在组织学图像中定位一个有界区域来过滤定位表达式。提示模板如图 D.7 所示。模型被要求将每个表达式分类为 Specific(具体)或 Vague(模糊)。分类为 Specific 的表达式被保留,而 Vague 表达式被移除。
D.4 私有 VQA 生成提示
为了构建 PathBind 的私有 VQA 组件,我们使用 GPT-5.4 从选定的病理教学图谱图像生成初始多项选择病理 VQA 样本。用于基于图像的问题生成的提示模板如图 D.8 所示。生成的样本随后由病理专家审查,以消除模糊案例、文本泄漏样本以及缺乏足够视觉证据的问题。
E 实现细节
除非另有说明,所有实验均在固定的推理配置下进行。闭源模型,包括 GPT-5.4 和 Gemini-3-Pro,通过官方 API 服务进行评估。相同的基于 API 的推理协议用于 PathBind-VQA 自动过滤阶段涉及的 LLM/VLM 模型。
所有开源模型均在配备八块 NVIDIA RTX 4090 GPU 的工作站上本地评估,使用公开发布的检查点。对于所有 VQA 实验,我们在模型间使用一致的提示和答案解析程序。在纯文本设置中,仅移除图像输入,而保持指令、问题和输出格式不变。模型输出使用固定的解码配置生成。
对于基于注意力的定位分析,我们仅评估具有公开可用注意力权重的模型。实体 token 注意力图跨层和头进行提取和聚合,随后执行附录 C.1-C.3 中描述的定位指标计算。
第 20 页
图 C.2:PathVG 上实体令牌注意力定位的成功示例。
图 C.3:PathVG 上实体令牌注意力定位的部分示例。
第 21 页
图 C.4:PathVG 上实体令牌注意力定位的失败示例。
多项选择题提示
[系统] 你是一位病理学专家。你的任务是逐步回答多项选择题。仔细观察提供的病理图像中的组织学特征,回忆相关的病理学知识,并推理得出答案。 在推理过程中,明确描述你在图像中看到的内容——细胞、组织、结构、染色模式、空间排列以及任何注释(箭头、标签、比例尺)。不要使用“提及”、“上下文”、“描述”、“给出”或“提供”等短语——将信息称为“在图像中”。 严格按照以下格式输出你的回答: 〈think〉 你的逐步推理。首先描述图像中可观察到的视觉内容,然后将其与病理学知识联系起来。 〈/think〉 〈answer〉X〈/answer〉 其中 X 是正确选项的单个字母(A、B、C、D…)。
[用户] {question_with_options} 选择最佳答案。仅在〈answer〉…〈/answer〉内放置字母。 〈think〉…〈/think〉内的推理应引用你在图像中观察到的具体视觉特征。
图 D.5:用于多项选择题数据集的提示模板,包括 PathMMU、MedXpert-Path 和 OmniMed-Bright。
第 22 页
术语指导:[{"english": "Multimodal Gain", "chinese_or_explanation": "Multimodal Gain (模态增益): 与仅使用文本输入相比,使用图像时准确率的提升。", "keep_english": true}, {"english": "Visual Grounding", "chinese_or_explanation": "Visual Grounding (视觉定位/接地): 将文本概念与图像中特定区域关联的能力。", "keep_english": true}, {"english": "Domain Training Illusion", "chinese_or_explanation": "Domain Training Illusion (领域训练幻觉): 领域特定训练提高了答案准确率,但未带来成比例的视觉绑定增益的现象。", "keep_english": true}, {"english": "Attention IoU", "chinese_or_explanation": "Attention IoU (注意力交并比): 注意力图与真实边界框之间的交并比。", "keep_english": true}, {"english": "Effective Attention Support Ratio", "chinese_or_explanation": "Effective Attention Support Ratio (有效注意力支持率): 基于熵的注意力弥散度指标。", "keep_english": true}]
翻译PDF第22页,第1部分。保留标题和段落结构。源字符数:1991。
YorN 提示词
[系统] 你是一位病理学专家。你的任务是逐步回答是/否问题。 仔细观察提供的病理图像中的组织学特征,回忆相关的病理学知识,并推理得出答案。 在推理过程中,明确描述你在图像中看到的内容——细胞、组织、结构、染色模式、空间排列以及任何注释(箭头、标签、比例尺)。不要使用“提及”、“上下文”、“描述”、“给出”或“提供”等短语——将信息称为“在图像中”。 严格按照以下格式输出你的回答: 〈think〉 你的逐步推理过程。首先描述图像中可观察到的内容,然后将其与病理学知识联系起来。 〈/think〉 〈answer〉是〈/answer〉 或 〈answer〉否〈/answer〉
[用户] {问题} 用“是”或“否”回答。仅在〈answer〉…〈/answer〉内放置“是”或“否”。你〈think〉…〈/think〉内的推理应引用你在图像中观察到的具体视觉特征。
图 D.6:用于是/否数据集(包括 Quilt-VQA 和 Path-VQA)的提示词模板。
PathVG 过滤提示词
[系统] 你是一位专家病理学家,负责判断自然语言短语是否足够具体,以在组织学图像中唯一地定位一个有界区域,或者是否过于笼统而无法指向单个区域。 决策标准:
输出格式(先决策,后简短理由): 〈answer〉具体〈/answer〉 或 〈answer〉模糊〈/answer〉 <reason>一句话简短理由</reason>
- 具体 (SPECIFIC):该短语识别了 (a) 特定的形态学特征 AND (b) 空间线索(位置/簇/模式),使得专家可以绘制一个匹配该短语的区域。
- 模糊 (VAGUE):该短语命名了一个常见特征(例如“肿瘤细胞”、“炎症”)但没有空间约束;许多区域都可能匹配。
[用户] 表达式:{expr} 首先输出你的〈answer〉…〈/answer〉,然后是 <reason>…</reason>。
图 D.7:用于过滤 PathVG 数据集的提示词模板。
第 23 页
多项选择题生成提示
[系统] 你是一位专家级病理学家,正在为严格基于图像的病理学基准测试创建多项选择题。你将看到一张组织病理学图像以及元数据(器官系统 + 可能诊断,作为提示)。生成一道多项选择题,只有具备专业知识的病理学家通过观察图像才能回答。
严格规则: 1. 问题必须询问图像中可见的特征、位置、模式或属性(不能仅从疾病名称推导得出)。 2. 所有 4 个选项在纯文本形式下都必须具有合理性——图像是它们之间唯一的判别依据。 3. 不要在问题或选项中包含疾病名称。不要在文本中引用元数据。 4. 正确答案必须对应你实际观察到的内容。 5. 自我检查:病理学家能否在不看图像的情况下回答此问题?如果是,请修改。如果无法使其成为必须依赖图像的问题,请设置 visual_grounded=false。
输出严格遵循以下键的 JSON: { "visible_features": "描述实际可见内容的 2-3 个句子", "question": "英文多项选择题题干", "options": {"A":"…","B":"…","C":"…","D":"…"}, "correct": "A"|"B"|"C"|"D", "visual_grounded": true|false, "grounding_reason": "为什么回答此问题需要图像" } JSON 之外不得有任何正文。
图 D.8:用于 PathBind-PTA 生成的提示模板。