全切片图像多模态基准测试中的数据泄露审计:记忆化还是推理?

三分钟导读:该论文对全切片图像(WSI)视觉语言模型(VLM)的基准测试进行了系统性审计,揭示了因TCGA数据源重叠导致的严重患者级和机构级数据泄露,证明当前报告的高准确率主要源于对记忆化特征的检索而非真正的多模态推理。

英文题目:AUDITING DATA LEAKAGE IN WHOLE-SLIDE IMAGE MULTIMODAL BENCHMARKS

论文出处:arXiv 每日论文精选 · arXiv:2607.12278

原始论文:PDF / 论文页面

对应视频标题:全切片图像多模态基准测试中的数据泄露审计:记忆化还是推理?|推荐指数:★★★★★

这篇论文解决什么问题?

现有的WSI VLM基准测试存在严重的训练-测试数据重叠(数据泄露),导致模型性能评估失真,无法区分真实的多模态推理能力与对训练数据中患者身份或机构批次效应的记忆化检索。

核心创新

  • 提出了针对WSI VLM的两级数据泄露分类法(患者级和机构级/TSS级)。
  • 构建了跨TCGA衍生基准测试和训练语料库的重叠矩阵,量化了极端的重叠情况。
  • 证明了即使经过患者级去重,机构级泄露(TSS重叠)依然存在且可被线性解码。
  • 通过同一基准测试内的分层分析,直接量化了数据泄露对准确率的通胀效应(3-8 pp)。

方法概览

1. 通过追踪TCGA的病例、幻灯片和TSS(组织来源站点)标识符,计算案例级重叠率(ρcase)和机构级重叠率(ρTSS)。2. 在CONCH-v1和TITAN两种编码器上,通过成对余弦相似度和线性探测(TSS检测、患者ReID)验证特征空间中的泄露信号。3. 对WSI-LLaVA在SlideBench-VQA-TCGA上进行分层分析,比较泄露样本与审计清洁样本的准确率差异。

逐图理解论文

背景:TCGA依赖与结构性重叠

背景:TCGA依赖与结构性重叠
Figure 1: Two-level data leakage in pathology vision-language models. (a) Hierarchical organization of TCGA whole- slide images. (b) Three partitioning regimes considered in this work. (c) The evaluation-time shortcut induced by either form of leakage.

WSI VLM通常采用离线编码器范式,视觉编码器在指令微调前冻结。由于TCGA是少数满足多模态指令微调需求的公共资源,大多数训练语料库和基准测试都源自同一数据池。这种结构性的数据重叠,使得模型极易通过记忆而非推理来回答问题。

实验:跨数据集重叠审计

实验:跨数据集重叠审计
Figure 2: Two-panel train-test overlap matrix across pathology VLM training corpora (rows) and four TCGA-derived evaluation benchmarks (columns). (a) Case-level overlap ρcase (%). (b) TSS-level overlap ρTSS (%). TCGA-derived benchmarks are heavily contaminated at both levels. TSS-level overlap is uniformly higher than case-level overlap, revealing institutional contamination even where case-level deduplication appears successful. Non-TCGA benchmarks (BCNB, CPTAC, HistAI) trivially maintain 0% at both levels and are omitted.

我们计算了8个训练语料库与4个TCGA衍生基准测试之间的ρcase和ρTSS。结果显示,TCGA衍生基准测试的案例级重叠率ρcase为92.3%至100%。例如,WSI-VQA-test与WSI-Bench-train的案例级重叠率高达100%。这表明基准测试与训练数据之间存在极端的重叠。

实验:特征空间泄露证据

实验:特征空间泄露证据
Figure 4: Linear probing on frozen slide embeddings for two encoders, on the shared 6,756-slide population. (a) TSS detection macro AUROC. (b) Patient ReID top-1 accuracy as a multiple of the chance baseline (absolute accuracy in parentheses). Both confounders are recoverable far above chance for both encoders, and the natively slide-level encoder (TITAN) yields the stronger leakage signal on both tasks.

在6,756张共享幻灯片上,使用CONCH-v1和TITAN编码器进行成对相似度分析和线性探测。TITAN编码器在患者ReID任务上的准确率为20.3%,是机会基线的65.0倍。TSS检测的宏观AUROC为0.980。这表明特征空间中存在强烈的泄露信号,且原生幻灯片级编码器TITAN的泄露信号更强。

实验:跨论文元分析

实验:跨论文元分析
Table 1: Published accuracy (%) on three WSI VQA benchmarks alongside audit-verified case-level leakage (%).

我们对比了多个已发表WSI VLM在含泄露基准上的准确率与审计验证的重叠率。Table 1显示,最高报告的准确率与严重污染(ρcase > 90%) consistently co-occur。例如,MLLM-HWSI在SlideBench-VQA-TCGA上报告了89.6%的准确率,但该基准存在严重的数据泄露。

实验:基准测试内分层分析

实验:基准测试内分层分析
Table 2: WSI-LLaVA accuracy on SlideBench-VQA-TCGA, stratified by audit-verified leakage status across cancer type and question category. Leaked accuracy exceeds clean accuracy by 3 to 8 pp across all well-powered subsets.

在SlideBench-VQA-TCGA上,我们比较了WSI-LLaVA在泄露样本与审计清洁样本上的准确率。Table 2显示,泄露样本上的准确率比清洁样本高3至8个百分点。例如,显微镜问题准确率提升7.5 pp,诊断问题提升3.4 pp。这直接量化了数据泄露对准确率的通胀效应。

实验与关键结果

  • 跨数据集重叠审计:计算8个训练语料库与4个TCGA衍生基准测试之间的ρcase和ρTSS。
  • 特征空间泄露证据:在6,756张共享幻灯片上,使用CONCH-v1和TITAN编码器进行成对相似度分析和线性探测。
  • 跨论文元分析:对比多个已发表WSI VLM在含泄露基准上的准确率与审计验证的重叠率。
  • 基准测试内分层:在SlideBench-VQA-TCGA上,对比WSI-LLaVA在泄露样本和清洁样本上的准确率。
  • TCGA衍生基准测试的案例级重叠率(ρcase)为92.3%至100%。(第 5 页)
  • WSI-VQA-test与WSI-Bench-train的案例级重叠率为100%。(第 5 页)
  • TITAN编码器在患者ReID任务上的准确率为20.3%(是机会基线的65.0倍),TSS检测的宏观AUROC为0.980。(第 7 页)
  • WSI-LLaVA在泄露样本上的准确率比清洁样本高3至8个百分点(例如,显微镜问题+7.5 pp,诊断问题+3.4 pp)。(第 8 页)

阅读时需要注意

  • 审计仅涵盖指令微调阶段,上游视觉编码器预训练数据集中的泄露未量化(尽管线性探测提供了黑盒信号)。
  • 基准测试内分层分析中,清洁样本量较小,导致准确率差距的幅度估计不精确,但方向一致。
  • 审计依赖于完整的TCGA元数据,若条形码被剥离或重新标记,则可能低估真实泄露程度。
  • 当前WSI VQA评估无法区分真正的多模态推理与基于记忆化患者和机构特征的最近邻检索。
  • 仅进行患者级去重不足以消除泄露,机构级(TSS)泄露同样会导致模型利用实验室特定的批次效应作为捷径。
  • 报告的高准确率主要集中在污染最严重的基准测试上,这可能误导对模型泛化能力的评估。

关联工作

  • Howard et al. [16]:建立了TSS身份可从H&E特征中恢复(AUROC高达0.998),并提出了保留站点交叉验证作为补救措施。(第 3 页)
  • Bussola et al. [3]:展示了当同一患者的图块出现在训练和验证折叠中时,准确率可膨胀高达41个百分点。(第 3 页)
  • Oner et al. [27]:重新分析了一个著名的TCGA-LUAD模型,显示一旦强制执行患者级拆分,其表观性能崩溃。(第 3 页)
  • SlideChat [7]:承认与WSI-VQA-test存在重叠,并构建了过滤子集,但未报告过滤前的准确率且后续工作未复现此过滤步骤。(第 8 页)

展开:论文全文中文翻译

以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。

第 1 页

审查全切片图像多模态基准测试中的数据泄露

Wenhao Zhang Zhongliang Zhou University of Virginia Merck & Co., Inc. bdu8us@virginia.edu zhongliang.zhou@merck.com

John Kang Sheng Li Merck & Co., Inc. University of Virginia jia.kang@merck.com vga8uf@virginia.edu

2026年7月15日

2026 摘要

最近,用于计算病理学的视觉语言模型 (VLM) 在全切片图像 (WSI) 视觉问答 (VQA) 基准测试中报告了引人注目的零样本性能。我们审查了这些声明,发现它们因两个层级水平上的数据泄露而受到根本性损害:患者级泄露,即来自同一案例的切片同时出现在训练和测试折叠中;以及机构级泄露,即不同的案例尽管来源不同,却通过共同的组织来源站点 (TSS) 共享染色批次和扫描仪特征。通过追踪主要公共资源中的标准切片、案例和 TSS 标识符,我们记录了基于 TCGA 的基准测试中案例级训练-测试重叠率为 92.3–100%,以及近乎完全的 TSS 重叠。我们进一步证明,这两个层级的泄露都可以从基础模型特征空间中进行线性解码,它们在一个已发布的检查点上导致泄露案例与审计干净案例之间出现可测量的准确率差距,并且在多个已发布的 WSI VLM 中,报告的峰值准确率集中在污染最严重的基准测试上。因此,当前的 WSI VQA 评估无法区分真正的多模态推理与对记忆中的机构和患者特定伪影的最近邻检索。最后,我们概述了无污染评估的具体建议。通过解决基准测试构建、来源披露和自动化重叠审计问题,我们旨在引导未来的研究走向可验证的进步声明。

1 引言

大型标注数据集对于视觉语言模型 (VLM) 在计算病理学领域的成功至关重要,推动了全切片图像 (WSI) 描述、视觉问答 (VQA) 和诊断亚型分类等任务的快速进展。[30] 最近的研究通常在名义上的零样本评估协议下,在标准 WSI 基准测试中报告最先进性能,这些数字被直接视为真正分布外泛化的证据。[6, 23] 然而,这些模型背后的训练数据集是通过积极抓取同一个庞大的公共资源库构建的:癌症基因组图谱 (TCGA),而评估基准测试也是独立地从该库中衍生出来的。训练数据和测试数据存在大量重叠的可能性尚未得到系统的关注。

这种重叠构成了由两个不同层级的泄露驱动的根本性方法论缺陷。在患者层面,在以前看过的切片上进行评估会将零样本泛化简化为单纯的记忆检索。在机构层面,共享的组织来源站点 (TSS) 使模型能够利用实验室特定的批次效应(例如染色和扫描仪伪影)作为预测捷径,而不是学习真正的病理学特征。这两种形式的污染都保证了当这些系统部署在现实世界的分布外临床环境中时,会出现无声的泛化失败。

第 2 页

A PREPRINT – JULY 15, 2026

图 1:病理视觉语言模型中的两级数据泄露。(a) TCGA 全切片图像 (WSI) 的层次结构。(b) 本工作中考虑的三种划分方案。(c) 由任一形式泄露引起的评估时捷径。

我们首次对公共 WSI 视觉语言生态系统中训练-测试污染进行了系统性审计。通过追踪指令微调语料库和公共评估基准中的标准 TCGA 病例和切片条形码,我们构建了一个跨污染矩阵,以量化切片级、病例级和机构级的重叠情况。结果令人震惊:在基于 TCGA 的基准测试中,病例级的训练-测试重叠率高达 92.3% 至 100%,机构级(组织来源站点,Tissue Source Site, TSS)的重叠也几乎完全一致。作为引用最广泛的评估集之一的 WSI-VQA-test,其病例与 WSI-Bench-train 的病例重合度为 100%。图 1 展示了导致这种污染的层次结构以及我们考虑的三种划分方案。

总之,我们的贡献如下:

1. 提出了针对 WSI 视觉语言建模的两级数据泄露分类法,将患者级与机构级(TSS 级)污染区分开来,并构建了一个基于标准 TCGA 病例、切片和 TSS 标识符的可复现审计流程。

2. 提供了实证证据,表明这两种形式的泄露在线性编码于基础模型的特征空间中,它们会在已发布的检查点(checkpoint)上产生可测量的基准内准确率差距,并且这种模式在涵盖多个已发布 WSI VLM 的跨论文元分析中得到了复现。

3. 提供了方法论指南,包括严格的切片级、患者级和 TSS 级去重,强制披露这些层面的训练-测试样本重叠情况,以及采用独立维护的多中心保留集作为在 WSI VQA 领域做出可信进展声明的前提条件。

2 相关工作

2.1 WSI 多模态基准与模型

病理学多模态文献由紧密耦合的训练语料库、基准和模型组成。该生态系统的两个结构性事实为我们的审计提供了动机。

首先,切片级监督数据在两年内增长了约两个数量级。早期的工作如 ARCH [13] 从教科书中挖掘了 7.6K 个图像-标题对。随后出现了包括 OpenPath [17]、Quilt-1M [18] 和 CONCH [26] 在内的网页级补丁语料库,接着是 PathGen-1.6M [32] 以及切片级指令微调资源,如 WSI-VQA [8]、SlideInstruction [7]、WSI-Bench [23] 和 TITAN [12],同时还有报告生成语料库 WsiCaption [5] 和 HistGen [15]。在这一发展轨迹中,TCGA 占据了主导地位,成为主要的来源池,而 BCNB 和 CPTAC 是唯一广泛使用的替代方案,因为同时满足诊断级 WSI、免费重新分发以及配对报告这三个条件的来源无可比拟。由此产生的结构性收敛,即许多语料库从相同的病例池中抽取数据,随后又被重新发布为训练集和评估集,正是我们在第 4.1 节中量化的污染现象的前提条件。我们排除了如 OpenPath 和 Quilt-1M 等补丁级语料库

2

第 3 页

A PREPRINT – JULY 15, 2026

来自审计,因为它们的图块不携带规范的患者或切片标识符,也不是切片级视觉问答(VQA)的载体。

其次,消费这些语料的视觉语言模型(VLM)几乎完全在由这些语料衍生出的基准测试上进行评估。从 LLaVA-Med [22] 分支出来,病理学专用系统跨越了三个设计轴。在输入尺度轴上,基于补丁的系统如 PathAsst [37]、Quilt-LLaVA [31] 和 PathChat [25] 与基于切片的系统如 SlideChat [7]、WSI-LLaVA [23] 和 TITAN [12] 并存,其中后者是在 8,192 × 8,192 的区域上原生预训练的。在统一轴上,CPath-Omni [33] 在单个 150 亿参数的 LMM 中整合了补丁级和切片级任务。在推理和代理轴上,Patho-R1 [37] 和 PathReasoner-R1 [20] 采用类似强化学习的后训练方法,而 CPathAgent [34] 和 PathAgent [4] 则模拟病理学家的缩放和平移工作流程。每个系统都在基于 TCGA 的测试集上报告了领先的最新性能指标,但均未报告案例级或机构级(TSS)的训练-测试重叠情况。正如第 4.3 节所示,污染最严重的基准测试报告了最强的性能提升,这使得目前的准确性是反映多模态推理还是对记忆报告的检索变得不明确。

2.2 医学影像和数字病理学中的数据泄露

泄露是医学影像中已记录的捷径危害。DeGrave 等人 [9] 表明,COVID-19 胸部 X 光模型依赖于医院特定的标记,而不是肺部发现。Roberts 等人 [28] 报告称,在审查的 415 项研究中,没有一项达到临床使用的足够质量,并指出患者重复和外部验证不足是最常见的失败模式。

在病理学中,先前的发现形成了一个粒度层次结构,我们的审计直接扩展了这一层次结构。在切片内的补丁级别,Bussola 等人 [3] 证明,当来自单个患者的图块同时出现在训练和验证折叠中时,性能指标会膨胀多达 41 个百分点。在患者内的切片级别,Oner 等人 [27] 重新分析了一个著名的 TCGA-LUAD 模型,并表明一旦强制执行患者级拆分,其表观性能就会崩溃。在机构内的患者级别,Howard 等人 [16] 确立可以从 H&E 特征中恢复 TSS 身份,AUROC 高达 0.998,并提出了保留站点交叉验证作为补救措施。de Jong 等人 [21] 的后续工作表明,相同的 TSS 签名存在于当前的病理学基础模型中,表明随着现代编码器的应用,这种危害不仅没有减轻,反而扩大了。

这些先前的审计有两个局限性,我们的工作解决了这些问题。首先,所有审计都局限于单模态 CNN 或自监督基础模型,以及分类或表示探测;没有一项审计多模态 VLM 语料。其次,每个泄露级别都是孤立研究的。我们提供了多模态 WSI VLM 生态系统中患者级和机构级泄露的首次联合审计。在这种设置下,泄露表面更广泛,因为每个受污染的案例携带整个指令微调记录,而不仅仅是单个标签,且下游后果更严重,因为受污染的基准测试无法区分多模态推理和对记忆报告的文本检索。

3 形式化病理学 VLM 中的数据泄露

与自然图像基准测试中数据泄露通常表现为精确图像重复不同,全切片图像(WSI)允许一种层次结构的污染形式。本节首先描述 WSI VLM 的架构范式,该范式促使在编码器特征级别进行审计,然后形式化层次结构污染结构,定义两个级别的泄露,并指定审计中使用的指标。

3.1 WSI VLM 的离线编码器范式

WSI VLM 生态系统的一个定义特征是,视觉表示学习和指令微调被解耦为两个严格连续的阶段,遵循 LLaVA 风格的配方 [24, 22]。在第 1 阶段,每个 WSI 通过预训练视觉编码器处理一次,以生成固定的切片级或补丁包表示。在第 2 阶段,在缓存的这些特征与遵循指令的文本配对的基础上,训练轻量级投影器和大型语言模型。视觉编码器本身在指令微调过程中保持冻结。

在这个通用范式中,当前的 WSI VLM 在如何获取其冻结编码器方面有所不同,我们区分两个类别。第一个类别采用现成的病理学基础模型,无需进一步修改。代表性示例包括 SlideChat [7],它由基于补丁的编码器 CONCH [26] 和基于 LongNet 的切片级编码器 [11] 组成,以及 WSI-LLaVA [23],它使用构建在预训练组件上的双尺度补丁和切片编码器。第二个类别为 VLM 专门预训练病理学领域的 CLIP 变体。代表性示例包括 Quilt-LLaVA [31],它使用在 Quilt-1M [18] 上预训练的 Quilt-CLIP,以及 PathGen-LLaVA,它使用在 PathGen-1.6M [32] 上预训练的 PathGen-CLIP-L。这两个类别在来源方面有所不同

3

第 4 页

A PREPRINT – JULY 15, 2026

以及对其编码器的监督,但在对我们审计至关重要的一点上,它们是相同的:在这两种情况下,编码器在指令微调开始之前是固定的,并且在微调过程中不会更新。

这种共同的设计并非风格选择,而是计算上的必然。单个诊断性全切片图像 (WSI) 通常包含数以万计的 224 × 224 补丁,因此在指令微调期间通过编码器进行端到端反向传播在规模上是不可行的。作为直接后果,WSI 视觉语言模型 (VLM) 所操作的视觉表示由其选择的编码器固定。编码器嵌入到特征空间中的任何患者或机构信号都成为投影器和大型语言模型 (LLM) 的永久输入。下游参数只能重新加权编码器已经编码的内容;它们无法移除已经存在的混杂因素。这一观察结果激发了第 4.2 节中采用的审计策略,我们在其中探测来自这两个类别的代表性编码器。探测冻结编码器的特征空间在方法论上等同于探测基于该编码器的每个 VLM 的视觉输入,同时避免了由下游投影器和 LLM 隐藏状态引入的混杂因素。

3.2 层次结构与两个级别的泄漏

我们从 WSI 数据层次结构开始。TCGA 存储库中的每个诊断性 WSI 都由一个编码三级嵌套的条形码标识 [29]: TCGA-BH – A0BS – 01Z-00-DX1 −→{ p1, p2, . . . , pN }Patches. (1) | TSS{z } |{z}Case | Slide{z } 首先,组织来源站点 (TSS) 标识贡献机构。其次,病例标识符与患者一一对应。第三,幻灯片后缀 (DX1, DX2, . . .) 区分来自同一病例的组织切片。我们用 case(s) 表示幻灯片 s 所属的病例,用 tss(c) 表示病例 c 所属的 TSS。来自单个病例的兄弟幻灯片共享患者表型、染色批次和扫描仪校准,而来自单个 TSS 的病例共享实验室级别的染色和扫描特征。

给定训练数据集 Dtrain 和评估基准 Dtest,两者均由一组幻灯片组成,我们定义两种污染条件。首先,如果测试幻灯片 s ∈Dtest 存在来自同一病例的训练幻灯片 s′ ∈Dtrain,则该测试幻灯片发生患者泄漏: Lpatient = s ∈Dtest | ∃s′ ∈Dtrain : (2) case(s) = case(s′) .

其次,如果测试幻灯片未发生患者泄漏但与某些训练幻灯片共享 TSS,则该测试幻灯片发生机构泄漏: LTSS = s ∈Dtest \ Lpatient | ∃s′ ∈Dtrain : (3) tss case(s) = tss case(s′) .

不属于这两个集合的测试幻灯片是审计清洁的。这三个集合完全划分了测试基准, Dtest = Lpatient ∪LTSS ∪Dclean, (4) 只有当 Dclean = Dtest 时,基准才被视为有效的零样本评估。为了量化污染,我们报告案例级和 TSS 级重叠率, | Ctest ∩Ctrain | | Ttest ∩Ttrain | ρcase = , ρTSS = , (5) | Ctest | | Ttest | 其中 C 和 T 表示相应幻灯片集合背后的病例和 TSS 集合。具有 ρcase = 1 的基准已在患者层面完全被包含,而 ρTSS = 1 表明不再存在机构泛化能力。

有必要澄清两个范围。首先,我们将此审计限制在 VLM 管道的指令微调阶段,在此阶段,结构化的 TCGA 元数据使得通过公式 (5) 计算 ρcase 和 ρTSS 成为可能。虽然承认通过视觉编码器预训练语料库的上游泄漏,但这超出了我们的范围,因为此类语料库通常不可公开获取。其次,我们排除像 OpenPath [17] 和 Quilt-1M [18] 这样的感兴趣区域 (ROI) 级别和图块级别数据集,这些数据集缺乏标准的患者或幻灯片标识符,且 case(·) 和 tss(·) 函数未定义。WSI 语料库中出现如此高重叠的结构原因是,TCGA 是唯一满足多模态指令微调先决条件的公共存储库,这迫使所有主要的训练数据集和基准测试都从同一池中抽取。

4 实验

本节提供了四条证据,表明第 3 节形式化的污染是普遍且后果严重的。我们首先量化公共 WSI VLM 生态系统中的训练-测试重叠情况 (§4.1)。然后验证两个级别

4

第 5 页

A PREPRINT – JULY 15, 2026

图 2:病理学视觉语言模型 (VLM) 训练语料库(行)与四个基于 TCGA 的评估基准(列)之间的双面板训练-测试重叠矩阵。(a) 案例级重叠率 ρcase (%)。(b) 机构级重叠率 ρTSS (%)。基于 TCGA 的基准在这两个层面上都受到严重污染。机构级重叠率普遍高于案例级重叠率,揭示了即使在案例级去重看似成功的情况下,仍存在机构层面的污染。非 TCGA 基准(BCNB、CPTAC、HistAI)在这两个层面上均保持 0% 的重叠,因此被省略。

数据泄露在基础模型特征空间中留下可检测的痕迹(§4.2),我们使用两个结构不同的编码器来证明这种效应并非任何单一表示的伪影。最后,我们证明了这些痕迹转化为多个已发布模型(§4.3)中可测量的基准性能膨胀。

4.1 跨数据集重叠审计

对于每一对训练语料库和评估基准,我们通过匹配标准的 TCGA 案例和 tissue-source-site (TSS) 标识符来计算 ρcase 和 ρTSS(公式 5)。图 2 报告了涵盖八个指令微调语料库和四个基于 TCGA 的测试基准的结果双面板重叠矩阵。我们的审计涵盖了最广泛使用的公共全切片图像 (WSI) 数据集,包括 SlideBench [6]、WSI-Bench [23]、WSI-VQA [8]、HistGen [15] 和 PathGen-1.6M [32]。得出三个发现:

首先,在大多数训练语料库中,基于 TCGA 的基准的案例级重叠率极高。WSI-Bench-train 与 SlideBench-VQA-TCGA、SlideBench-Cap-TCGA、WSI-VQA-test 和 WSI-Bench-test 的案例重叠率分别为 92.3%、90.2%、100% 和 83.1%。PathGen-1.6M 显示出相当程度的污染,重叠率分别为 94.3%、94.1%、90.7% 和 70.8%。WSI-VQA-test 完全被 WSI-Bench-train 包含,ρcase = 100%,这意味着每个测试患者都在训练期间见过。一个特别引人注目的案例存在于单个基准内部:WSI-Bench-train 和 WSI-Bench-test 本身共享 83.1% 的案例,这表明基准策展人自己的数据划分并未在两个部分之间分离患者。

其次,机构级重叠率普遍高于案例级重叠率,揭示了仅靠案例级审计无法发现的机构层面污染。两对数据特别清楚地说明了这一点。WSI-VQA-train 和 WSI-VQA-test 表现出 0% 的案例重叠,表明 WSI-VQA 的作者正确地执行了患者级去重,但其 TSS 重叠率为 100%。每位测试患者都来自训练集中已存在的机构。SlideInstruction++ 与 SlideBench-VQA-TCGA 的案例重叠率为 0%,但 TSS 重叠率为 85.5%;与 WSI-VQA-test 的案例重叠率为 66.3%,但 TSS 重叠率为 94.7%。这种模式表明,虽然患者级去重是必要的,但它使训练集和测试集保留了相同的染色、扫描和实验室批次效应,满足了 LTSS 泄露(公式 3)的形式定义。

第三,案例级的去污染尝试是可行的,但在 TSS 层面仍不完整。SlideInstruction+ 是我们审计的唯一一个在所有四个基于 TCGA 的测试基准上实现 ρcase = 0% 的训练语料库。即便如此,它与 SlideBench-VQA-TCGA 的 TSS 重叠率仍为 11.0%,与 SlideBench-Cap-TCGA 为 10.1%,与 WSI-Bench-test 为 11.3%。消除患者级重叠可以通过元数据过滤来实现,但消除机构级重叠需要从任何主要公共训练语料库中未代表的组织来源站点 (Tissue Source Sites) 获取测试数据,而基于 TCGA 的基准在结构上无法提供这一点。这就是为什么在当前生态系统中,真正的零样本评估仅在独立策展的非 TCGA 队列中可行。

5

第 6 页

A PREPRINT – JULY 15, 2026

图 3:在共享的 6,756 张切片集合上,各编码器相对于其自身跨 TSS 基线的超额切片级余弦相似度。对于两种编码器,相似度均随层级邻近度单调增加(跨 TSS < 同 TSS < 同患者),且对于原生切片级编码器 TITAN,这种增加幅度显著更陡。绝对基线相似度分别为 0.664(CONCH-v1)和 0.233(TITAN)。

4.2 泄漏的特征空间证据

上述记录的重叠是在元数据标识符层面定义的。一个自然的问题是,这种标识符层面的重叠是否转化为 VLM 实际消耗的已学习特征表示中可测量的冗余。我们通过两项互补实验来解决这个问题:成对相似度分析和线性探测研究,并在两种结构不同的切片编码器上运行这两项实验。第一种是 CONCH-v1 [26],这是一种基于补丁的对比编码器,我们通过对其 ℓ2 归一化的补丁特征进行平均池化来获得其切片表示。第二种是 TITAN [12],这是一种原生的切片级预训练编码器。如果泄漏仅仅是基于补丁的平均池化的伪影,那么它不会在 TITAN 的原生切片嵌入中幸存。两项实验均在两种编码器特征均可用的 6,756 张切片上计算,因此两种编码器始终在相同的切片群体上进行比较。

成对相似度。对于每种编码器,我们计算三种层级邻近度配置下的切片嵌入之间的余弦相似度:(i) 同患者对(来自同一案例的兄弟切片),(ii) 同 TSS、跨患者对(来自同一组织来源站点的不同患者),以及 (iii) 跨 TSS 对(来自不同机构的切片,采样了 n=20,000 对)。两种编码器占据具有不同内在尺度的特征空间。TITAN 的跨 TSS 基线相似度为 0.233,而 CONCH-v1 的为 0.664。因此,绝对相似度值在编码器之间不可直接比较。我们报告每组相对于其自身编码器跨 TSS 基线的相对值,从而隔离出归因于共享患者或机构身份的超额相似度。

图 3 揭示了两种编码器在三个组别之间的单调分离。对于 CONCH-v1,同 TSS 对位于跨 TSS 基线之上 +0.183,同患者对位于其之上 +0.272。对于 TITAN,相同的顺序成立,且差距显著更大,同 TSS 对为 +0.506,同患者对为 +0.669。所有四个过渡在统计上均显著(Mann-Whitney U 检验,p < 10−200)。由此得出两个结论:首先,单调结构(跨 TSS < 同 TSS < 同患者)在具有完全不同预训练目标和输入粒度的两种编码器中重现。这确立了该效应是病理切片内容的属性,而非任何单一表示的属性。其次,原生切片级编码器并未减弱该效应。TITAN 的同患者超额相似度(+0.669)是 CONCH-v1(+0.272)的两倍多,表明切片级预训练集中而非稀释了患者识别信号。这两种配置直接映射到泄漏级别。同患者邻近度实现了 Lpatient,同 TSS 邻近度实现了 LTSS。

用于潜在混淆因子的线性探测。如果患者和机构签名被编码在特征空间中,线性分类器应能恢复它们。我们在每种编码器的冻结切片嵌入上制定两项探测任务:限于多案例患者的患者重新识别(ReID)和 TSS 检测。对于每项任务,我们仅保留类别

6

第 7 页

A PREPRINT – JULY 15, 2026

图 4:在共享的 6,756 张幻灯片群体上,对冻结的幻灯片嵌入进行线性探测,针对两种编码器。(a) TSS 检测的宏平均 AUROC。(b) 患者 ReID 的 top-1 准确率,表示为机会基线(括号内为绝对准确率)的倍数。对于两种编码器,这两个混淆因子均可被恢复,且远高于机会水平;原生幻灯片级编码器(TITAN)在这两项任务上产生了更强的泄漏信号。

表 1:三个 WSI VQA 基准测试上的已发布准确率 (%) 以及经过审计验证的案例级泄漏率 (%)。红色标记 ρcase > 80%。橙色标记 20% 至 80%。白色单元格为审计清洁(0%)。⋄:源自 MLLM-HWSI 表 3 [2] 的复现结果。*:SlideChat 过滤后的子集(过滤标准未指定)。†:与未过滤的 SlideInstruct 有 80.2% 的案例重叠。

准确率 (%) ρcase (%)模型 会议/期刊 训练数据 SB-TCGA WSI-VQA SB-TCGA WSI-VQA

Quilt-LLaVA [31] CVPR ’24 Quilt-1M (patch) 40.2⋄ 35.4⋄ 0 – WSI-VQA [8] ECCV ’24 WSI-VQA-train 27.6⋄ 46.9⋄ 10.4 internal SlideChat [7] CVPR ’25 SlideInstruct 81.2 60.1* 0 80.2† PathGen-LLaVA [32] ICLR ’25 PathGen-1.6M 46.5 33.1⋄ 94.3 90.7 WSI-LLaVA [23] arXiv ’24/12 WSI-Bench-train 82.5⋄ 54.6⋄ 92.3 100.0 MLLM-HWSI [2] arXiv ’26/03 WSI-Bench+ 89.6 69.2 92.3 100.0

对于至少包含两张幻灯片的病例,使用分层 70/30 训练-测试集划分,并拟合逻辑回归探测器。ReID 的评分基于相对于机会率 1/(#patients) 的 top-1 准确率。TSS 检测的评分基于一对一其余(one-versus-rest)宏平均 AUROC。

图 4 证实,两种编码器中的这两个混淆因子在特征空间中都是线性可分的。患者 ReID 在 CONCH-v1 上达到 14.0%,在 TITAN 上达到 20.3%,分别对应其各自机会基线的 44.9 倍和 65.0 倍。TSS 检测产生的宏平均 AUROC 分别为 0.955 和 0.980。有两点值得强调。首先,Howard 等人 [16] 在 2021 年报告称,ResNet-50 特征可以以 AUROC > 0.95 检测 TSS。四年后,经过两代病理基础模型的发展,机构混淆因子并未得到缓解,反而更加尖锐。其次,两项任务上一致的排序 TITAN > CONCH-v1 与成对相似性发现相吻合。专为幻灯片级表示设计的编码器最明确地编码了患者和机构身份。因此,任何消费这些特征的下游 VLM 都会继承患者身份泄漏和机构批次效应泄漏。随着幻灯片级 VLM 越来越多地采用此类编码器,这一关切日益相关。

4.3 跨论文元分析

前面的实验确立了重叠的存在(§4.1)以及它产生了可检测的特征空间冗余(§4.2)。剩下的问题是,这种冗余是否夸大了已发表文献中报告的性能指标。

表 1 揭示了两种模式。首先,在 SlideBench-VQA-TCGA 和 WSI-VQA-test 上报告的最高准确率始终与严重的污染(ρcase > 90%,红色单元格)同时出现。MLLM-HWSI 报告在

7

第 8 页

A PREPRINT – JULY 15, 2026

表 2:WSI-LLaVA 在 SlideBench-VQA-TCGA 上的准确率,按审计验证的泄漏状态在癌症类型和问题类别上进行分层。在所有统计功效充足的子集中,泄漏数据的准确率比干净数据高出 3 到 8 个百分点。

子集 泄漏数据 干净数据 差距

显微镜问题 71.8% (n=78) 64.3% (n=14) +7.5 UCEC 层 67.4% (n=190) 61.1% (n=36) +6.3 UCEC+COAD 池 65.9% (n=325) 62.1% (n=58) +3.8 诊断问题 64.8% (n=233) 61.4% (n=44) +3.4

SlideBench-VQA-TCGA 的案例重叠率为 92.3%。WSI-LLaVA 报告的重叠率为 82.5%。两者均在 WSI-VQA-test 上报告结果,该测试集案例重叠率为 100%。其次,训练数据非 TCGA 或基于补丁的模型(LLaVA-Med、Quilt-LLaVA、TITAN)在我们的基于标识符的审计中未检测到任何案例级重叠。我们强调,这是一个下限,而非清洁度的证明:这些模型的预训练来源要么未公开,要么由不携带规范案例或切片标识符的基于补丁的网络来源组成,因此 case(·) 和 tss(·) 函数在其训练数据上未定义,公式 5 无法解析可能存在的任何重叠。表中的水平线将无可检测案例级污染的模型(上方)与至少存在一个受污染(模型,基准)对的模型(下方)分开。

一个值得注意的发现涉及社区对该问题的部分认知。SlideChat [7](CVPR 2025)明确承认与 WSI-VQA-test 存在重叠,并构建了一个过滤后的子集(WSI-VQA*),在该子集上报告了 60.1% 的准确率。然而,过滤标准未指定,过滤前的准确率未报告,且没有后续的 SOTA 论文复现此过滤步骤。在 SlideChat 之后发布的五个模型,即 WSI-LLaVA、PathGen-LLaVA、CPath-Omni 和 MLLM-HWSI,在未过滤、完全受污染的 WSI-VQA-test 上报告了零样本外部验证结果,且未加说明。

这些观察结果与受污染的基准测试会夸大报告准确率这一假设一致。然而,跨基准比较会将泄漏与内在任务难度混淆。下一个实验控制了这种混淆。

4.4 基准内分层

为了控制任务难度,我们利用 SlideBench-VQA-TCGA 在同一测试集中既包含泄漏患者也包含审计干净患者这一事实。我们的审计在其总共 1,292 个样本中识别出了泄漏切片和审计干净切片。我们使用发布的 WSI-LLaVA 检查点运行推理,并按泄漏状态在癌症类型和问题类别上对准确率进行分层。

表 2 报告了结果。在所有统计功效充足的子集中,泄漏数据的准确率均高于干净数据。差距从诊断问题上的 +3.4 个百分点到显微镜问题上的 +7.5 个百分点不等,后者是最依赖细粒度视觉识别的类别。在所有四个独立子集中,差距方向均为正。在癌症类型和问题类别独立变化的四个子集中,差距的一致性构成了可靠的信号。这一结果完善了证据链。重叠审计(§4.1)确立了污染的普遍性。特征空间分析(§4.2)确立了它在两种结构不同的编码器上产生了可检测的记忆。元分析(§4.3)确立了最高发表准确率与最严重污染同时出现。此处展示的基准内分层隔离了这种影响。在相同的基准、相同的模型、相同的癌症类型和相同的问题类别下,训练期间见过的患者得分比未见过的患者高出 3 到 8 个百分点。

5 讨论

5.1 考虑的异议

第一个异议认为,在与 TCGA 重叠的测试集上表现强劲仍然证明了临床能力,因为 TCGA 广泛采样了全球肿瘤学分布。这错误地识别了部署障碍。临床转化中的挑战并非在已知实验室中诊断熟悉的临床表现,而是在部署保证的域偏移下保持可靠性,包括新的扫描仪硬件、改变的染色协议和未见过的患者人口统计特征 [21, 28]。检索记忆中的批次伪影而非基于形态进行推理的模型将在新机构中无声失败,这是站点特定捷径在医学成像中产生的失败模式 [9, 16]。因此,在严格保留的队列上进行评估并非人为苛刻,而是证伪泛化主张的最低条件。第二个异议认为,彻底的重复数据删除

8

第 9 页

A PREPRINT – JULY 15, 2026

在数百万个多模态对上进行去重计算上不可行,且认为一定程度的数据泄露是扩展规模的合理代价。这种观点混淆了两种截然不同的操作。去重训练数据集成本高昂,但审查训练-测试边界既廉价又不可妥协,正如第 4 节所示,基于标准 TCGA 标识符(公式 5)可以闭式判定其是否存在。这一前提在病理学领域尤其不成立。在自然图像领域,规模扩展吸收了多样化的视觉概念;而在病理学中,未经筛选的规模扩展通常从同一患者和同一机构摄入几乎冗余的相同表型切片,因此规模放大了我们记录的批次混淆因素,而非稀释它们。如果基准测试本身受到污染,那么无论训练集规模如何扩展,都无法验证其进展。

5.2 迈向无污染评估

我们概述了三个相互强化的方向,它们共同构成了可信评估的协议:

第一个杠杆是基准测试构建。一个可信的替代基准测试必须独立于所有公开指令微调语料库来抽取其测试队列。由于 TCGA 是满足诊断级全切片图像 (WSI)、免费重新分发以及配对报告这一联合要求的最大公共存储库,去除机构重叠需要从所有主要训练数据集中缺失的组织来源站点 (TSS) 获取评估数据,而基于 TCGA 的数据集在结构上无法提供这一点。因此,我们建议采用独立策展的多中心保留队列,并在保留站点的交叉验证下进行划分,以确保没有任何一个组织来源站点 (TSS) 被拆分到训练-测试边界两侧 [16]。每个基准测试都应公布其标准的切片、病例和 TSS 标识符,保留一份从未发布的私有评估部分,并逐渐迁移到基于提交的架构,即模型上传至隔离服务器,而不是将测试数据分发给作者 [36]。具有速率限制提交的公共和私有划分,作为防止排行榜过拟合的标准防御措施 [36, 35],能够遏制即使是在保留基准测试中也会遭受的缓慢测试集记忆现象。

第二个杠杆是来源披露。目前数据泄露是不可见的,因为论文仅报告一个 headline 零样本准确率,而未披露模型所见过的内容。遵循数据集数据表和数据来源倡议 (Data Provenance Initiative) [14] 的文档规范,我们建议对于任何零样本泛化声明,必须披露三项内容:模型所消耗的训练、指令微调和视觉编码器预训练语料库的完整列表;通过发布的审计管道计算得出的每个披露数据集与基准测试之间的案例级和 TSS 级重叠率 $\rho_{case}$ 和 $\rho_{TSS}$,以及在重叠非零时审计干净子集和审计污染子集上的分层准确率。将这些字段作为机器可读元数据 [1] 发出,将使审查者能够自动验证来源,而非通过手动交叉引用。

第三个杠杆是自动化重叠审计。持续的污染清除需要社区工具支持,而非仅靠单篇论文的 diligence。标识符级匹配是我们审计的基础,它是精确的,但前提是元数据完整,并且应与内容级检测相辅相成,以抵御重新导出和重新标记的影响,例如全切片图像的感知哈希和数字指纹技术 [19],这与语言模型评估中现在标准的 n-gram 和金丝雀污染检测 [35, 10] 类似。对于标识符匹配无法触及的上游编码器语料库,线性探测策略提供了一种黑盒测试:从冻结特征中恢复患者或 TSS 身份的能力本身就是一种污染信号,即使预训练数据是专有的。作为持续维护的开放管道发布,任何新的语料库或检查点均可据此进行检查,此类工具会将污染审计从一次性工作转变为常设的社区资源。

5.3 局限性

三个范围条件限定了我们的发现。首先,审计仅涵盖指令微调阶段,在该阶段,结构化的 TCGA 元数据使得 $\rho_{case}$ 和 $\rho_{TSS}$ 可以闭式计算;通过专有视觉编码器预训练数据集传播的泄露(通常未公开)未被量化,尽管线性探测为此上游通道提供了黑盒信号。其次,基准测试内的分层是在单个污染检查点上计算的,方法是将同一基准测试内的测试集划分为审计干净和审计污染的切片;由于审计干净的部分相对较小,+3 到 +8 个百分点的差距在四个独立变化的子集中方向一致,但在幅度上估计不精确。第三,我们的审计通过 TCGA 标识符检测重叠,因此假设来源元数据完整,并得出真实污染的下界:条形码被剥离、重新导出或重新标记的切片会逃避标识符匹配,需要我们在第 5.2 节中推荐的内容级检测。尽管存在这些条件,我们的核心结果通过精确的标识符匹配在两种不同的编码器上仍然稳健。这些边界仅仅标记了量化结束和我们提出的替代基准测试开始的地方。

9

第 10 页

A PREPRINT – JULY 15, 2026

6 结论

我们首次对公共 WSI 视觉语言生态系统中训练-测试数据污染进行了系统性审计。 通过追踪指令微调数据集和 TCGA 衍生基准测试中的 TCGA 案例、幻灯片和 TSS 条形码, 我们记录了 92.3% 到 100% 的案例级重叠。我们表明,两种结构不同的基础编码器的特征空间中, 两种泄漏水平均可被线性解码。值得注意的是,原生幻灯片级编码器集中而非稀释了患者识别信号, 导致泄漏幻灯片与干净幻灯片之间出现一致的准确率差距。因此,WSI VLM 报告的最高准确率集中在污染最严重的基准测试上。 这些发现并未削弱近期病理 VLM 的工程成就, 但确立了当前零样本泛化声明不可靠:现有基准测试无法区分真正的多模态推理与对记忆中的机构和患者特定伪影的最近邻检索。 补救措施是评估实践的严格改变。在社区强制执行幻灯片、患者和 TSS 级别的去重,披露队列重叠,并在独立整理的多中心保留集上进行评估之前, WSI 视觉语言建模中报告的增益无法与记忆伪影区分开来。

参考文献

[1] Akhtar, M., Benjelloun, O., Conforti, C., Foschini, L., Gijsbers, P., Giner-Miguelez, J., Goswami, S., Jain, N., Karamousadakis, M., Krishna, S., et al.: Croissant: A metadata format for ml-ready datasets. Advances in Neural Information Processing Systems 37, 82133–82148 (2024) 9 [2] Alawode, B., Mahmood, A., Al-Radi, M.K., Albastaki, S., Khan, A., Bilal, M., Abdalla, M.A., Bennamoun, M., Javed, S.: MLLM-HWSI: A multimodal large language model for hierarchical whole slide image understanding. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2026), arXiv:2603.23067 7 [3] Bussola, N., Marcolini, A., Maggio, V., Jurman, G., Furlanello, C.: Ai slipping on tiles: data leakage in digital pathology. In: International Conference on Pattern Recognition. pp. 167–182. Springer (2021) 3 [4] Chen, o.: PathAgent: An agent-based system for whole-slide image analysis. arXiv preprint (2025) 3 [5] Chen, P., Li, H., Zhu, C., Zheng, S., Shui, Z., Yang, L.: Wsicaption: Multiple instance generation of pathology reports for gigapixel whole-slide images (2024), https://arxiv.org/abs/2311.16480 2 [6] Chen, Y., Wang, G., Ji, Y., Li, Y., Ye, J., Li, T., Hu, M., Yu, R., Qiao, Y., He, J.: Slidechat: A large vision-language assistant for whole-slide pathology image understanding (2025), https://arxiv.org/abs/2410.11761 1, 5 [7] Chen, Y., Zhao, G., Li, X., Gao, J., Peng, H., et al.: SlideChat: A large vision-language assistant for whole-slide pathology image understanding. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025) 2, 3, 7, 8 [8] Chen, Y., et al.: WSI-VQA: Interpreting whole slide images by generative visual question answering. In: Pro- ceedings of the European Conference on Computer Vision (ECCV) (2024) 2, 5, 7 [9] DeGrave, A.J., Janizek, J.D., Lee, S.I.: Ai for radiographic covid-19 detection selects shortcuts over signal. Nature Machine Intelligence 3(7), 610–619 (2021) 3, 8 [10] Deng, C., Zhao, Y., Tang, X., Gerstein, M., Cohan, A.: Investigating data contamination in modern benchmarks for large language models. In: Proceedings of the 2024 Conference of the North American Chapter of the Asso- ciation for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers). pp. 8706–8719 (2024) 9 [11] Ding, J., Ma, S., Dong, L., Zhang, X., Huang, S., Wang, W., Wei, F.: Longnet: Scaling transformers to 1,000,000,000 tokens. In: Proceedings of the 10th International Conference on Learning Representations (2023) 3 [12] Ding, T., et al.: TITAN: A clinically-grounded pathology foundation model for slide-level analysis. Nature Medicine (2025) 2, 3, 6 [13] Gamper, J., Rajpoot, N.: Multiple instance captioning: Learning representations from histopathology textbooks and articles. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. pp. 16549–16559 (2021) 2 [14] Gebru, T., Morgenstern, J., Vecchione, B., Vaughan, J.W., Wallach, H., Iii, H.D., Crawford, K.: Datasheets for datasets. Communications of the ACM 64(12), 86–92 (2021) 9 [15] Guo, Z., et al.: HistGen: Histopathology report generation via local-global feature encoding and cross-modal context interaction. arXiv preprint arXiv:2403.05396 (2024) 2, 5

10

第 11 页

A PREPRINT – JULY 15, 2026

[16] Howard, F.M., Dolezal, J., Kochanny, S., Schulte, J., Chen, H., Heij, L., Huo, D., Nanda, R., Olopade, O.I., Kather, J.N., Cipriani, N., Grossman, R.L., Pearson, A.T.: The impact of site-specific digital histology signatures on deep learning model accuracy and bias. Nature Communications 12(1), 4423 (2021) 3, 7, 8, 9 [17] Huang, Z., Bianchi, F., Yuksekgonul, M., Montine, T.J., Zou, J.: A visual–language foundation model for pathol- ogy image analysis using medical Twitter. Nature Medicine 29(9), 2307–2316 (2023) 2, 4 [18] Ikezogwo, W.O., Seyfioglu, M.S., Ghezloo, F., Geva, D.S.C., Mohammed, F.S., Anand, P.K., Krishna, R., Shapiro, L.: Quilt-1M: One million image-text pairs for histopathology. In: Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track (2023) 2, 3, 4 [19] Jakhar, Y., Borah, M.D.: Effective near-duplicate image detection using perceptual hashing and deep learning. Information Processing & Management 62(4), 104086 (2025) 9 [20] Jiang, o.: PathReasoner-R1: Reasoning-enhanced pathology vision-language model. arXiv preprint (2026) 3 [21] de Jong, E.D., Marcus, E., Teuwen, J.: Current pathology foundation models are unrobust to medical center differences. arXiv preprint arXiv:2501.18055 (2025) 3, 8 [22] Li, C., Wong, C., Zhang, S., Usuyama, N., Liu, H., Yang, J., Naumann, T., Poon, H., Gao, J.: LLaVA-Med: Training a large language-and-vision assistant for biomedicine in one day. In: Advances in Neural Information Processing Systems (NeurIPS), Datasets and Benchmarks Track (2024) 3 [23] Liang, Y., Lyu, X., Chen, W., Ding, M., Zhang, J., He, X., Wu, S., Xing, X., Yang, S., Wang, X., Shen, L.: Wsi- llava: A multimodal large language model for whole slide image (2025), https://arxiv.org/abs/2412. 02141 1, 2, 3, 5, 7 [24] Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning (2023), https://arxiv.org/abs/2304.08485 3 [25] Lu, M.Y., Chen, B., Williamson, D.F., Chen, R.J., Zhao, M., Chow, A.K., Ikemura, K., Kim, A., Pouli, D., Patel, A., et al.: A multimodal generative ai copilot for human pathology. Nature 634(8033), 466–473 (2024) 3 [26] Lu, M.Y., Chen, B., Zhang, A., Williamson, D.F.K., Chen, R.J., Ding, T., Le, L.P., Chuang, Y.S., Mahmood, F.: Visual language pretrained multiple instance zero-shot transfer for histopathology images. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 19764–19775 (June 2023) 2, 3, 6 [27] Oner, M.U., Cheng, Y.C., Lee, H.K., Sung, W.K.: Training machine learning models on patient level data segre- gation is crucial in practical clinical applications. medRxiv pp. 2020–04 (2020) 3 [28] Roberts, M., Driggs, D., Thorpe, M., Gilbey, J., Yeung, M., Ursprung, S., Aviles-Rivero, A.I., Etmann, C., McCague, C., Beer, L., et al.: Common pitfalls and recommendations for using machine learning to detect and prognosticate for covid-19 using chest radiographs and ct scans. Nature Machine Intelligence 3(3), 199–217 (2021) 3, 8 [29] Saltz, J., Gupta, R., Hou, L., Kurc, T., Singh, P., Nguyen, V., Samaras, D., Shroyer, K.R., Zhao, T., Batiste, R., Van Arnam, J., The Cancer Genome Atlas Research Network, Shmulevich, I., Rao, A.U.K., Lazar, A.J., Sharma, A., Thorsson, V.: Spatial organization and molecular correlation of tumor-infiltrating lymphocytes using deep learning on pathology images. Cell Reports 23(1), 181–193.e7 (2018) 4 [30] Seyfioglu, M.S., Ikezogwo, W.O., Ghezloo, F., Krishna, R., Shapiro, L.: Quilt-llava: Visual instruction tuning by extracting localized narratives from open-source histopathology videos (2025), https://arxiv.org/abs/ 2312.04746 1 [31] Seyfioglu, M.S., Ikezogwo, W.O., Ghezloo, F., Krishna, R., Shapiro, L.: Quilt-LLaVA: Visual instruction tuning by extracting localized narratives from open-source histopathology videos. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024), arXiv:2312.04746 3, 7 [32] Sun, Y., Zhang, Y., Si, Y., Zhu, C., Shui, Z., Zhang, K., Li, J., Lyu, X., Lin, T., Yang, L.: PathGen-1.6M: 1.6 mil- lion pathology image-text pairs generation through multi-agent collaboration. arXiv preprint arXiv:2407.00203 (2024), accepted at ICLR 2025 2, 3, 5, 7 [33] Sun, Y., Zhang, Y., Zhu, C., Li, J., Shui, Z., et al.: CPath-Omni: A unified multimodal foundation model for patch and slide level computational pathology. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025) 3 [34] Sun, Y., et al.: CPathAgent: An agent-based framework for computational pathology. arXiv preprint (2025) 3 [35] Xu, C., Guan, S., Greene, D., Kechadi, M., et al.: Benchmark data contamination of large language models: A survey. arXiv preprint arXiv:2406.04244 (2024) 9 [36] Xu, Z., Escalera, S., Pavão, A., Richard, M., Tu, W.W., Yao, Q., Zhao, H., Guyon, I.: Codabench: Flexible, easy-to-use, and reproducible meta-benchmark platform. Patterns 3(7) (2022) 9

11

第 12 页

A PREPRINT – JULY 15, 2026

[37] Zhang, W., Zhang, P., Guo, J., Cheng, T., Chen, J., Zhang, S., Zhang, Z., Yi, Y., Bu, H.: Patho-r1: A multimodal reinforcement learning-based pathology expert reasoner (2025), https://arxiv.org/abs/2505.11404 3

12

发表评论