三分钟导读:本文审计了27篇息肉分割论文,发现普遍存在指标缺失(如HD95、Recall)、数据划分不兼容及缺乏统计显著性测试等问题,并通过重新评估证明单一Dice指标掩盖了严重的边界和漏检失败,提出了Polyp Segmentation Reporting Checklist (PSRC)。
英文题目:Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks
论文出处:arXiv 每日论文精选 · arXiv:2607.08203
原始论文:PDF / 论文页面
对应视频标题:指标还是幻象?结肠镜息肉分割评估审计与PSRC规范|推荐指数:★★★★★
这篇论文解决什么问题?
当前结肠镜息肉分割领域依赖单一的Dice/IoU指标和固定的PraNet数据划分,导致评估结果不可比、临床关键失败模式(漏检、边界不准)被掩盖,且缺乏统计严谨性和外部泛化验证。
核心创新
- 揭示了27篇论文中25篇缺失HD95边界指标,25篇缺失Recall临床安全指标,26篇缺失统计显著性测试。
- 证明了不同数据划分协议(如PraNet固定vs随机)导致的Dice差异(>1%)超过许多SOTA声称的改进幅度。
- 发现二次综述表格中存在转录错误,如G-CASCADE在CVC-ClinicDB上的误差达0.011。
- 提出了Polyp Segmentation Reporting Checklist (PSRC),包含5项报告规范。
方法概览
1. 文献审计:系统审查2015-2026年间27篇代表性论文在指标、划分、泛化和统计严谨性四个维度的实践。2. 重新评估:在统一评估器下,对5个代表性模型(PraNet, Polyp-PVT, SANet, PVT-CASCADE, G-CASCADE)进行三种协议测试:P1(固定划分,未见数据集),P2(随机80/20划分,3种子),P3(PolypGen外部OOD测试)。3. 引入缺失指标:HD95, NSD, Recall, Lesion-level F1。
逐图理解论文
评估实践审计

我们审计了2015至2026年间的27篇代表性论文。结果显示,25篇缺失HD95边界指标,25篇缺失Recall召回率指标,26篇缺乏统计显著性测试。这种系统性缺失导致评估结果不可比且临床意义不明。
数据划分与转录错误

不同论文使用不兼容的数据划分协议,如PraNet固定划分与随机划分,导致Dice差异超过1%,远超许多SOTA声称的改进。此外,二次综述表格中存在转录错误,如G-CASCADE在CVC-ClinicDB上的误差达0.011。
重新评估协议

我们在统一评估器下对5个模型进行三种协议测试:P1固定划分未见数据集,P2随机80/20划分多种子,P3使用PolypGen进行外部OOD测试。引入HD95、NSD、Recall和病灶级F1以全面评估性能。
P1:边界误差暴露

在P1协议中,HD95暴露了Dice掩盖的巨大边界误差。例如,PraNet在ETIS数据集上的HD95为230像素,是Polyp-PVT的两倍。尽管Dice分数相近,但边界精度差异显著,直接影响临床切除安全性。
P2:划分敏感性

P2随机划分测试显示,模型排名极不稳定。PraNet与Polyp-PVT的优劣随随机种子翻转,Dice方差在±0.005至0.007之间。这表明许多声称的SOTA改进可能仅是统计噪声,缺乏稳健性。
实验与关键结果
- P1协议:在CVC-ColonDB, ETIS, CVC-300上测试,发现HD95暴露了Dice掩盖的巨大边界误差(如PraNet在ETIS上HD95为230px,是Polyp-PVT的两倍)。
- P2协议:随机划分下,模型排名不稳定,PraNet与Polyp-PVT的优劣随种子翻转,差异在统计噪声范围内。
- P3协议:在PolypGen六个未见中心上,所有模型性能急剧下降(Dice 0.71-0.76),但粗略排名保持。
- 病灶级检测:基于连通分量匹配,发现像素级Dice排名与病灶级F1排名不同,G-CASCADE精度最高,Polyp-PVT灵敏度最高。
- P1协议:在CVC-ColonDB, ETIS, CVC-300上测试,发现HD95暴露了Dice掩盖的巨大边界误差(如PraNet在ETIS上HD95为230px,是Polyp-PVT的两倍)。
- P2协议:随机划分下,模型排名不稳定,PraNet与Polyp-PVT的优劣随种子翻转,差异在统计噪声范围内。
- P3协议:在PolypGen六个未见中心上,所有模型性能急剧下降(Dice 0.71-0.76),但粗略排名保持。
- 病灶级检测:基于连通分量匹配,发现像素级Dice排名与病灶级F1排名不同,G-CASCADE精度最高,Polyp-PVT灵敏度最高。
阅读时需要注意
- 审计仅限于静态图像结肠镜息肉分割,未涵盖视频分割或弱监督方法。
- 部分模型(PVT-CASCADE, G-CASCADE)使用自训练权重,尽管复现了分布内Dice,但绝对分数可能受训练细节影响。
- HD95实现差异(medpy vs MetricsReloaded)可达16px,绝对值比较需谨慎。
- 未对PolypGen OOD中心与训练集进行SSIM泄漏审计,存在残留低风险。
- 不要直接比较使用不同数据划分协议(如PraNet固定vs随机)的Dice分数。
- 单一Dice指标无法反映临床关键的漏检(Recall)和边界精度(HD95)。
- 近似的Dice差异(<0.01)若无统计显著性支持,不应视为SOTA改进。
- 二次综述表格中的数据可能存在转录错误,应核对原始论文。
关联工作
- Metrics Reloaded [14]:提供了问题指纹框架,推荐HD95/NSD作为边界敏感任务的补充指标,本文据此进行审计。(第 4 页)
- PraNet [6]:确立了当前领域默认的评估模板(固定划分,6指标),本文审计其路径依赖问题。(第 6 页)
- Fitzgerald et al. [7]:证明了Kvasir-SEG随机划分的Dice差异>1%,本文扩展至多模型重新评估。(第 4 页)
- PolypGen [1]:提供多中心数据用于OOD评估,本文将其作为P3协议的数据源。(第 5 页)
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
指标还是海市蜃楼?对结肠镜息肉分割基准评估不一致性的审计
Aisha Urooj1, Zain Ul Abdien2, 和 Neelu Madan3
1 Lunit, 韩国 2 RPTU Kaiserslautern, 德国 3 Aalborg University & Pioneer Center, 丹麦
摘要。结肠镜息肉分割的进展通常通过在少量公共基准上的排行榜比较来常规报告。我们认为,这种看似显著的进展难以验证:对2015年至2026年间发表的27篇论文进行的系统审计揭示了社区评估模型的三个结构性问题。首先,27篇论文中有25篇省略了豪斯多夫距离(Hausdorff Distance (HD95))。豪斯多夫距离是一种具有直接临床相关性的边界精度指标,用于检测扁平或小息肉,也是放射治疗分割中的标准指标。其次,在报告相同两个数据集(Kvasir-SEG 和 CVC-ClinicDB)结果的论文中,至少存在五种不兼容的训练/测试划分协议,这使得即使发表的 Dice 分数出现在同一个排行榜列中,它们也是不可比的。第三,27篇论文中有26篇在未进行任何统计显著性检验的情况下做出了性能声明。引人注目的是,在 Metrics Reloaded 框架 [14](Maier-Hein 等人,《自然·方法》2024)发布之后发表的四篇论文仍然延续着同样的问题,这表明通用指标指导尚未触及结肠镜子社区。为了证明这些问题不仅仅是表面现象,我们在单一统一评分器下,使用三种受控协议重新评估了五个代表性模型,发现报告的指标掩盖了巨大的边界和召回率失败,“最佳”模型随指标变化,且接近并列的排名在随机划分下发生反转。我们提出了五点息肉分割报告清单(Polyp Segmentation Reporting Checklist (PSRC))作为一种轻量级、领域适应的纠正措施。
关键词:评估指标 · 息肉分割 · 可重复性 · 基准审计 · 临床指标
1 引言
结直肠癌是全球第三大常见癌症,结肠镜检查仍然是主要的筛查手段 [6]。然而,人工检查极易出现人为错误,由于视觉疲劳或细微的病灶形态,在常规程序中高达 20-25% 的癌前息肉会被漏诊 [20,31]。由于早期检测和切除这些腺瘤能显著降低死亡率,自动息肉分割可以通过高亮显示
第 2 页
2 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
图 1. 任务。二值息肉分割通过带有深度监督的编码器-解码器网络,将结肠镜帧映射为逐像素的息肉掩码。两种具有临床决定性意义的失败模式恰恰是区域重叠指标所低估的:漏检息肉意味着漏诊癌症(召回率),而边界不准确则意味着错误的切除边缘(HD95/NSD)。
实时病变。因此,过去五年见证了深度学习模型的快速更迭,每个模型都声称在标准基准上达到了最先进(SOTA)的性能。
然而,仔细审视 SOTA 的评估方式揭示了一个令人不安的模式。该领域围绕 PraNet [6] 在 2020 年引入的单一评估模板形成了共识,该模板使用固定的训练/测试划分,在五个数据集上报告六个指标。该模板中使用的指标包括:平均 Dice 系数、平均 IoU、加权 F 分数、结构相似性指数、平均绝对误差和增强对齐度量。该模板中使用的数据集包括:Kvasir-SEG [8]、CVC-ClinicDB/CVC-612 [2]、CVC-ColonDB [25]、ETIS-LaribPolypDB [23]、EndoScene [28]。随后,这一模板被十余篇后续论文(例如 ColonFormer [5]、Polyp-PVT [4]、SA-Net [29])直接复制,有时甚至逐字照搬,而未质疑这六个指标是否足以充分捕捉临床上的关键要素。
从临床角度来看,像平均 Dice 系数和平均 IoU 这样的像素级重叠指标本质上与胃肠病学家的核心诊断目标脱节。在实时内镜检查中,模型的实际效用由其病灶级敏感性(避免灾难性的假阴性)以及对分布外(OOD)现实世界偏移的鲁棒性决定。标准的评估模板完全未能捕捉架构如何处理常规临床实践中典型的协变量偏移,例如相机传感器的变化、局部光照伪影、肠道准备不佳或隐蔽的黏膜碎屑。
与此同时,一般医学图像分析领域的一项平行工作记录了指标选择远非中立的观点。Metrics Reloaded 框架 [14] 表明“所选的性能指标往往不能反映领域兴趣”,并指出当边界准确性具有临床相关性时,豪斯多夫距离(HD95)是重叠指标的关键补充。对于息肉分割而言,漏检平坦或亚厘米级的病变可能危及生命
第 3 页
因标题过长而省略标题 3
图 2. 各指标在单次预测(Dice 0.75)上的测量结果:召回率面板显示漏掉了约 36% 的息肉,HD95 存在 118 像素的边界误差——仅凭 Dice 无法察觉这些缺陷。
鉴于后果的严重性,这一差距不仅仅是学术问题。本文做出以下四项贡献:
1. 对 27 篇息肉分割论文(2015–2026 年)进行了系统审计,从四个维度表征其评估实践,即:指标概况(Metric Profile)、数据划分(Data Partitioning)、泛化范围(Generalization Scope)和统计严谨性(Statistical Rigor)。 2. 我们通过实证研究表明,不兼容的划分协议使得大多数已发表作品之间的直接数值比较无效。 3. 在三种协议(固定划分、随机划分和分布外 Out-of-Distribution (OOD))下对五个代表性模型进行了受控重评估,报告了被遗漏的指标(边界、召回率、病灶级检测 Lesion-level detection),并提供了逐图像显著性分析,表明接近并列的排名并不稳健,且指标选择会改变获胜者。 4. 息肉分割报告清单(Polyp Segmentation Reporting Checklist (PSRC)),这是一项为未来论文制定的五项领域适配标准。
2 相关工作
息肉分割架构。深度息肉分割跨越了两个主要时代:基于卷积神经网络(CNN)的注意力网络和基于 Transformer 的多尺度解码器。CNN 时代以 PraNet [6] 为基石,其引入了用于边界细化的并行反向注意力机制。随后的 CNN 针对特定的边缘情况:背景偏差 [29]、边界不确定性 [11]、小病灶 [13] 以及伪装目标 [24]。随着向金字塔视觉 Transformer(Pyramid Vision Transformer (PVT))编码器的转变,创新重心转向多尺度解码器工程。这包括混合 CNN-Transformer 融合 [30,4]、全局-局部聚合 [26,33]、特征
第 4 页
4 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
图 3. 所研究工作的架构全景。尽管报告的指标稳步提升,但这些模型共享一种编码器-解码器骨架,仅在两个轴线上存在差异:编码器主干(CNN Res2Net/HarDNet 与 Transformer PVTv2/MiT)以及解码器/特征聚合模式。关键在于,它们还共享其评估方法:相同的尺度训练、边界感知结构损失、深度监督、固定划分以及五数据集区域重叠协议。
减法单元 [32],以及先进的注意力或图解码头 [17,18]。尽管这些架构报告了稳步提升的平均 Dice 系数,但其评估仍局限于历史协议,导致临床鲁棒性未被检验。
指标选择与验证。生物医学界反复警告,仅凭重叠指标是不够的。Metrics Reloaded [14] 引入了一个“问题指纹”框架,建议针对特定任务采用一套原则性的指标集(例如,对于边界敏感的分割任务,将重叠指标与归一化表面距离(Normalized Surface Distance, NSD)配对;当涉及对象级恢复时,使用检测指标);其配套目录列举了常见的指标陷阱 [19]。在医学领域之外,受控的重新评估如“指标学习现实检查”(A Metric Learning Reality Check)[16] 表明,在统一协议下,所报告的进展可能会消失。我们的工作将这种审计逻辑应用于息肉分割:我们采纳 Metrics Reloaded 的建议,针对其参考代码验证我们的实现,并量化该领域的实践与其偏离的程度。
基准可重复性与划分协议。多项工作指出,评估选择而非仅仅是架构,决定了报告的数值。Fitzgerald 等人 [7] 证明,仅 Kvasir-SEG 数据集的随机 80/20 划分就会导致 Dice 系数变化超过 1%,且很少有足够的细节报告随机种子和数据加载器以便复现;然而,不兼容的划分协议(PraNet 固定划分与随机划分)继续在共享排行榜上进行比较。我们从单模型
第 5 页
因标题过长而省略标题 5
观察结果转化为受控的多模型重新评估,并进一步表明,即使指标实现本身也存在分歧(HD95 在广泛使用的库之间差异高达 16 像素),且次要对比表中存在超过所声称改进幅度的转录错误。
分布外与多中心评估。由于分布内测试集通过反复基准测试逐渐变为伪训练信号,因此需要真正独立的多中心数据来评估泛化能力。PolypGen [1] 为此提供了六中心数据,TransNetR [9] 是最早进行分布外评估的研究之一。我们将 PolypGen 作为专用的 OOD 协议(P3)纳入,并报告各中心的表现,结果显示,尽管粗略的排名基本保持不变,但所有模型的绝对性能均出现显著下降。
3 技术预备知识
问题定义。我们研究二值息肉分割任务:给定结肠镜图像帧,任务是从背景黏膜中预测像素级掩码以 delineate 息肉组织。设 $x \in \mathbb{R}^{3 \times H \times W}$ 为 RGB 图像帧,$y \in \{0, 1\}^{H \times W}$ 为其专家标注的二值真值掩码,其中若像素 $(i, j)$ 包含息肉组织,则 $y_{ij} = 1$(见图 1)。分割网络 $f_\theta$ 将调整大小后的输入图像(标准化为 $352 \times 352$)映射为 logits 图 $\hat{s} = f_\theta(x)$。通过 sigmoid 激活函数获得连续预测概率 $\hat{p} = \sigma(\hat{s})$,并使用阈值 $t = 0.5$ 将其转换为硬二值掩码 $\hat{y} = \mathbb{I}[\hat{p} \ge t]$。在指标评估之前,$\hat{y}$ 通过双线性插值上采样回图像帧的原始分辨率($H \times W$)。所研究的架构共享编码器-解码器拓扑结构(较旧的基线使用 Res2Net CNN 骨干网络;现代迭代使用 PVTv2 变换器),并采用深度监督机制,输出一组中间解码器侧输出 $\{\hat{s}^{(k)}\}_{k=1}^K$。
训练目标。大多数基于 Res2Net 和 PVT 的基线模型使用边界加权结构损失($L_{str}$)进行优化,该损失结合了加权二元交叉熵($L_{wbce}$)和加权交并比($L_{wiou}$)项。为了鼓励锐利的轮廓,首先基于真值目标掩码 $y$ 计算像素级权重图 $w$,以严厉惩罚边界和小结构上的误差(最高可达 6 倍的缩放因子):
$$ w = 1 + 5 \cdot \text{avgpool}_{3 \times 1}(y) – y \quad (1) $$
利用该权重图,各个损失分量将原始网络 logits 图 $\hat{s}$ 和 sigmoid 激活后的概率图 $\hat{p} = \sigma(\hat{s})$ 与目标掩码 $y$ 进行平衡:
$$ L_{wbce} = \frac{\sum w \cdot \text{BCE}(\hat{s}, y)}{\sum w}, \quad (2) $$
$$ L_{wiou} = 1 – \frac{\sum w (\hat{p} \cdot y) + 1}{\sum w (\hat{p} + y – \hat{p} \cdot y) + 1}. \quad (3) $$
第 6 页
6 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
总体结构损失随后被表述为这两个分量的总和:
Lstr = Lwbce + Lwiou (4)
在深度监督下,最终训练目标 L 聚合了所有解码器侧输出尺度 k 的 logit 图 ˆs(k):
L = X Lstr(ˆs(k), y) (5)
k
这通常是在多尺度训练计划 s ∈{0.75, 1.0, 1.25} 上进行的优化。同时,像 SANet [29] 这样的架构用标准的交叉熵加 Dice 目标耦合测试时概率校正步骤来替代这种结构损失。关键在于,虽然这些主导的训练目标被明确设计为对边界敏感(w)和对区域敏感(Lwiou),但下游文献 heavily favors 仅报告区域重叠(Dice/IoU)。这种优化特性与评估标准之间的鲜明不对称性直接激发了我们基于边界和召回率的审计。
评估指标。监督掩码由临床专家密集手工标注 [8,2,25,23,28]。遵循历史基准实践,主要区域重叠性能通过平均 Dice 和平均交并比(mIoU)来量化,其中 ˆy 表示预测的硬二值掩码,y 表示专家标注的真实目标:
2|ˆy ∩y| |ˆy ∩y| Dice = IoU = (6) |ˆy| + |y|, |ˆy ∪y|
为了将评估与 Metrics Reloaded 框架 [14] 定义的问题指纹对齐,我们补充了这些区域指标,使用归一化表面距离(NSD@τ)来捕捉边界级精度,并利用 95% 分位数豪斯多夫距离(HD95)作为额外的边界指标。我们进一步报告像素级召回率(敏感度)以及通过连通分量匹配确定的病灶级检测指标。非息肉(空掩码)帧被显式处理:预测的空掩码与真实掩码之间的完全一致得分为完美,而基于距离的指标(NSD、HD95)对于空目标是未定义的,并系统地从相应的平均值中排除。
4 审计方法论与元数据集
PraNet 基线模板。为了审计该领域的现状,我们首先形式化了由 PraNet [6] 建立的评估框架,该框架已成为整个子领域的实际基准测试标准。该模板规定在 900 张 Kvasir-SEG [8] 和 550 张 CVC-ClinicDB [2] 图像的合并集上进行训练(共 1,450 张)。然后在来自这两个数据集的剩余图像以及三个完全保留的集合 CVC-ColonDB [25]、ETIS-LaribPolypDB [23] 和 CVC-300 [28] 上对模型进行评估。
第 7 页
因标题过长而省略标题 7
该模板下的性能传统上被浓缩为一份包含六个指标的表格,报告内容包括:平均Dice系数(mDice)、平均IoU(mIoU)、加权F度量(F βw )、S度量(Sα)、E度量(Eϕ)以及平均绝对误差(MAE)。几乎所有后续架构,包括SANet [29]、UACANet [11]、C2FNet [24]、Polyp-PVT [4]、CaraNet [13]、HSNet [30]、DuAT [26]、ESFPNet [3]、CFA-Net [33]、M2SNet [32] 和 G-CASCADE [18],均以最小修改采用了这一模板。这造成了一种跨共享排行榜直接可比的假象,而我们的审计对此进行了系统性压力测试。 元数据集编译与论文资格。为了表征这一时间跨度内的基准测试和报告实践,我们汇编了一个由27篇深度全监督息肉分割论文组成的代表性队列。候选论文最初源自两个关键社区参考来源:Mei等人 [15] 的综合综述以及精心策划的Awesome-Polyp-Segmentation仓库。通过Kvasir-SEG [8]/CVC-ClinicDB [2] 的PapersWithCode排行榜,以及对近期CVPR、MICCAI、WACV和MIDL会议论文集的手动检索,扩展了该列表,以确保充分代表2024–2026年的最新文献。如果一篇工作满足以下三个严格的纳入标准,则被认为符合我们审计的纳入资格:(a) 它引入了一种新颖的全监督深度架构,专门针对静态图像结肠镜息肉分割进行优化;(b) 它在PraNet模板管理的五个核心历史基准数据集之一的至少一个上报告了明确的定量性能值;(c) 它于2015年1月至2026年6月期间在主要预印本服务器上发布、被接受或公开托管。 为了隔离主流模型设计文献的评估习惯,我们明确执行以下排除标准:(i) 其验证协议完全依赖于顺序视频数据集的视频息肉分割模型(例如SUN-SEG [10]、CVC-VideoClinicDB [27]);(ii) 侧重于学习算法而非任务特定架构设计的弱监督、半监督或无监督分割框架;(iii) 未引入原始架构解码器的一般基础模型适配(例如零样本或微调SAM管道 [12]);(iv) 仅在非标准、孤立数据集(例如BKAI-IGH [22]、PICCOLO [21]、PolypGen [1])上进行验证的工作,这些工作不与标准基准测试模板对接。由于方法论异常在最终的27篇论文样本中普遍存在(表1),我们随后的发现描述了整个子领域的结构化报告模式。
审计维度。对于每篇被审计的论文,我们系统地提取并记录四个不同评估维度的结构化元数据:D1(指标概况):报告的评估指标的确切选择,捕捉工作是否仅依赖区域重叠,还是包括对边界敏感(F βw , Sα, Eϕ, MAE, HD95, NSD)或临床安全(Recall)参数;D2(数据划分):使用的确切训练/测试划分协议,注意固定历史划分(例如PraNet-fixed)与随机随机划分之间的任何混合;D3(泛化范围):是否存在专用的分布外(OOD)或多中心外部验证集以评估域
第 8 页
8 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
移位鲁棒性;D4(统计严谨性):在报告绝对性能差距的同时,报告统计显著性检验结果(例如,p 值、置信区间)。
表 1. 27 篇息肉分割论文(2015–2026 年)中评估实践的审计。 ✓ = 已报告,× = 缺失,∼ = 部分 / 仅在可见数据集上进行分布外(OOD)评估。分割代码:P = PraNet 固定(1450 个训练样本),R = 随机百分比,K = 仅 Kvasir,C = 自定义,V = 视频。
论文 会议/期刊 (年份) Dice HD95 Rec. S-m wFm E-m MAE 分割 扩展 显著性
U-Net MICCAI (2015) ✓ × × × × × × C × × SFA MICCAI (2019) ✓ × × × × × × C × ×
PraNet MICCAI (2020) ✓ × × ✓ ✓ ✓ ✓ P ∼ × ACSNet MICCAI (2020) ✓ × × ✓ ✓ ✓ ✓ P ∼ × HarDNet-MSEG arXiv (2021) ✓ × × ✓ ✓ ✓ ✓ P ∼ × SANet MICCAI (2021) ✓ × × ✓ ✓ ✓ ✓ P ∼ × MSNet MICCAI (2021) ✓ × × ✓ × ✓ ✓ P ∼ × UACANet ACM MM (2021) ✓ × × ✓ ✓ ✓ ✓ P ∼ × C2FNet IEEE TMI (2021) ✓ × × ✓ ✓ ✓ ✓ P ∼ × PNS-Net MICCAI (2021) ✓ × × × × × × V × ×
Polyp-PVT CAAI AIR (2023) ✓ × × ✓ ✓ ✓ ✓ P ∼ × HSNet CBM (2022) ✓ × × ✓ ✓ ✓ ✓ P ∼ × CaraNet SPIE MI (2022) ✓ × × ✓ ✓ ✓ ✓ P ∼ × DCRNet ISBI (2022) ✓ × × ✓ ✓ ✓ ✓ P ∼ × LAPFormer arXiv (2022) ✓ × × × × × × P ∼ × DuAT PRCV (2023) ✓ × × ✓ ✓ ✓ ✓ P ∼ × ESFPNet MIA (2023) ✓ × × ✓ ✓ ✓ ✓ P ∼ × CFA-Net PR (2023) ✓ × × ✓ ✓ ✓ ✓ P ∼ × M2SNet TPAMI (2024) ✓ × × ✓ ✓ ✓ ✓ P ∼ × TransNetR MIDL (2023) ✓ × ✓ × × × × K ✓ × FLDNet arXiv (2023) ✓ × × ✓ ✓ ✓ ✓ P ∼ × IBoxCLA arXiv (2023) ✓ × ✓ × × × × C × ×
G-CASCADE WACV (2024) ✓ × × ✓ ✓ ✓ ✓ P ∼ × CFFormer ESWA (2025) ✓ ✓ × × × × × R ∼ × Polyp-DiFoM arXiv (2024) ✓ × × × × × × P ∼ × HSSAM-Net Sci.Rep. (2025) ✓ ✓ × × × × ✓ C × × PolyMamba-Net Front. (2026) ✓ × × × × × × R ∼ ✓
5 文献审计发现
指标遗漏及 Metrics-Reloaded 之后的演变。表 1 总结了我们对 2015 年至 2026 年间所有 27 篇代表性论文的评估审计发现。主要数据揭示出该子领域在关键评估指标上存在明显且系统的遗漏:(i) 边界盲区:27 篇论文中有 25 篇完全遗漏了 HD95 或任何表面距离变体,令人惊讶的是,这其中包括那些主要声称贡献在于增强边界 delineation 或边缘感知细化(例如,SANet [29],CaraNet [13])的架构;(ii) 临床安全失败:27 篇论文中有 25 篇未报告召回率(灵敏度),鉴于诊断筛查应用中假阴性具有最高的临床成本,这代表了临床验证报告的根本性缺失;以及 (iii) 缺乏统计严谨性:27 篇论文中有 26 篇未报告任何统计显著性检验,唯一的例外是 PolyMamba-Net (2026),它提供了 Wilcoxon 符号秩检验 p 值以支持其性能主张。
第 9 页
因标题过长而省略标题 9
仔细观察时间线,可以发现指标碎片化和性能倒退的趋势令人担忧。遵循国际共识指南,后续研究本应朝着更丰富、更严格的指标集收敛,但后来的论文(例如 LAP-Former、Polyp-DiFoM)却悄无声息地弃用了历史摘要指标,仅报告基本的 Dice 和 IoU 分数。这一现象在 Maier-Hein 等人 [14] 于 2024 年 1 月发布里程碑式的 Metrics Reloaded 框架之后发表的论文中尤为严重,即 G-CASCADE (WACV 2024)、CFFormer (ESWA 2024)、Polyp-DiFoM (arXiv 2024) 和 HSSAM-Net (Sci. Reports 2025):这些论文均未将 HD95 或 Recall 作为主要评估指标,而 Polyp-DiFoM 甚至倒退至仅使用基线 Dice/IoU。这一实证时间线表明,通用生物医学指标指南未能渗透或影响该子社区的本地基准测试惯性。
拆分协议不兼容。我们发现了五种同时活跃使用的不同训练/测试协议:PraNet 固定拆分(1,450 张图像,被 19 篇论文使用);80/10/10 随机拆分(CFFormer 2024,PolyMamba-Net 2026);仅使用 Kvasir-SEG(TransNetR 2023:880/120);带有额外训练数据的自定义拆分(IBoxCLA 2023 将 LDPolypVideo 加入训练);以及视频拆分(PNS-Net 2021,这是一个不可比较的任务)。值得注意的是,CFFormer (2024) 和 G-CASCADE (2024) 均在 Kvasir-SEG 和 CVC-ClinicDB 上报告了 Dice 分数,但 CFFormer 使用的是 80/10/10 随机拆分,而 G-CASCADE 使用的是 PraNet 固定拆分——文献中的比较表中同时列出了这两个数据,且没有任何标记。仅因拆分选择导致的 Dice 数值差异可能超过 3 个百分点 [15],这大于许多声称的 SOTA 论文的改进幅度。
外部验证。在 27 篇论文中,仅有一篇(TransNetR [9])在来自未见中心的数据上进行了真正的外部验证,在 PolypGen(六个中心)和 BKAI-IGH 这两个真正未见的数据集上进行测试。另有 21 篇论文仅报告了五个基准数据集中子集的结果,这些数据集已公开多年,并可能通过反复基准测试而影响设计,其余五篇论文则完全未进行跨数据集评估。
原始来源验证与转录错误。为了验证二手综述表中出现的数字,我们直接从原始论文 PDF 中检索了在 PraNet 固定拆分上评估的四个代表性模型的 Dice 分数(表 2);在四篇论文中有两篇存在差异。SANet [29] 在其原始表 1 中报告的 ColonDB mDice 为 0.753,而综述 [15] 将其抄录为 0.752。更重要的是,G-CASCADE [18] 在其补充材料 B 节中报告的 Kvasir-SEG mDice 为 0.9274,CVC-ClinicDB mDice 为 0.9468——这是息肉结果出现的唯一位置,因为主论文侧重于多器官分割,但二手表分别将这些值报告为 0.929 和 0.936,CVC-ClinicDB 上的误差为 0.011,超过了多篇已发表 SOTA 比较中声称的改进幅度。我们进一步指出,G-CASCADE 的息肉结果仅限于补充材料,使得独立验证变得非平凡,即存在独立于数值差异本身的透明度问题。
第 10 页
10 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
表 2. 二次调查表中发现的转录错误与原始 PDF 源文件的对比。G-CASCADE 在 CVC-ClinicDB 数据集上的误差为 0.011,超过了已发表的一些 SOTA 对比所声称的提升幅度。
论文 数据集 二次调查 原始源文件 误差
SANet [29] ColonDB 0.752 0.753 0.001 G-CASCADE [18] Kvasir-SEG 0.929 0.9274 0.002 G-CASCADE [18] CVC-ClinicDB 0.936 0.9468 0.011
在 PraNet 固定划分下,Kvasir-SEG 上声称的四年 SOTA 进展从 PraNet (0.898) 开始,经过 SANet (0.904) 和 Polyp-PVT (0.917),最终达到 G-CASCADE (0.9274),总增益为 2.94%。Fitzgerald 等人 [7] 通过实证表明,仅 Kvasir-SEG 的不同随机划分就会产生超过 1% 的 Dice 差异,这意味着划分选择可能解释了整个声称的四年进展中的约三分之一。
6 经验重新评估
6.1 框架
我们在单一统一评估器下重新评估了五个代表性的息肉分割模型:PraNet [6]、Polyp-PVT [4]、SANet [29](发布权重)、PVT-CASCADE [17] 和 G-CASCADE [18](在 1450 个 PraNet 划分上自训练,因为没有发布息肉检查点)。HSNet 还参与了划分敏感性研究 (P2)。所有预测均由一个实现进行评分,该实现除了报告的平均 Dice/IoU 外,还计算了遗漏的边界指标 NSD@3px(经官方 MetricsReloaded 包精确验证),并以 HD95 作为补充,以及召回率,加上用于显著性检验的每图像分数和病灶级检测指标。我们在三种协议下进行评估:P1(PraNet 固定划分,在未见的 CVC-ColonDB [25]、ETIS [23]、CVC-300 [28] 上测试);P2(同一池子的随机 80/20 划分,3 个随机种子);以及 P3(PolypGen 的六个未见中心上的分布外 (OOD) 数据)。发布权重的模型在约 1% 的范围内复现了发表的 Dice 分数;自训练的 PVT-CASCADE [17] 和 G-CASCADE [18] 分别在 0.011 和 0.018–0.035 的范围内复现了其发表的分布内 Dice 分数,证实了训练的真实性,因此它们在未见数据集上的较低分数是真实的泛化能力体现。指标已通过 medpy 和官方 MetricsReloaded 包(Dice/IoU/Recall/NSD 精确匹配)进行了验证,并且通过感知哈希→SSIM 审计确认了训练集/测试集的独立性(无数据泄露;最大跨集 SSIM 为 0.66)。P2 模型在固定的计算预算下训练,并报告最终检查点,从而消除了几个公开训练脚本中存在的基于测试集的检查点选择机制。
6.2 结果
P1:区域指标掩盖了边界和召回率的失败。有以下三个观察结果(见表 3)。(i) 边界失败被掩盖。在 ETIS [23] 上,PraNet 的
第 11 页
因标题过长而省略标题 11
图 4. CVC-ColonDB 上的定性案例分类。各列分别显示真实标签(ground truth)和各模型名称;第 1-5 列每张图片下方均报告 Dice、召回率(Rec)和 HD95。叠加层标记真阳性(绿色)、假阳性(红色)和假阴性(蓝色);蓝色上边框标记 Dice 最佳模型,橙色下边框标记 HD95 最佳模型。各行:(1) 所有模型均准确——指标一致;(2) 所有模型均失败;(3) Dice 高估召回率(遗漏组织);(4) Dice 高估 HD95(虚假的远距离假阳性);(5) Dice 最佳模型并非 HD95 最佳模型。
HD95 (230 px) 几乎是 Polyp-PVT (127 px) 的两倍,这一差距远大于 0.15 的 Dice 差异所暗示的程度。其召回率 (0.67) 表明有三分之一的息肉组织被遗漏。(ii) 排名依赖于数据集:SANet [29] 在 CVC-300 [28] 上排名第二,但在 CVC-ColonDB [2] 和 ETIS [23] 上排名第三,而 PVT-CASCADE [17] 在 CVC-300 [28] 上排名垫底,却在更困难的数据集上排名第二。(iii) 在较小的 CVC-300 [28] 数据集 (n=60) 上,在经 FDR 校正的 Wilcoxon 检验下,顶级模型之间的成对差异不具有统计学意义 (p > 0.1);显著性仅出现在较大的 CVC-ColonDB/ETIS 数据集上。
P2:排名对数据划分不稳健。在随机划分下(表 4),这三个模型在统计学上几乎无法区分(Dice 差异 ±0.005–0.007),且 PraNet 与 Polyp-PVT 的排名在不同随机种子之间发生反转。因此,单一的固定划分排行榜并不能确立稳健的排序——这从实证角度证实了我们在审计中提出的关于划分方差的担忧。
第 12 页
12 Aisha Urooj, Zain Ul Abdien, 和 Neelu Madan
表 3. 在三个未见数据集上的 P1(固定划分)结果。Dice 是原文报告的指标;HD95 (px, ↓) 和 Recall (↑) 由原文省略。模型排名在不同数据集间发生重排,且 HD95 暴露出的失败程度远大于 Dice 差距所暗示的程度。
CVC-300 CVC-ColonDB ETIS
Model Dice Rec HD95 Dice Rec HD95 Dice Rec HD95
PraNet .877 .942 32.5 .715 .730 83.2 .637 .673 230.1 Polyp-PVT .904 .947 20.8 .811 .821 54.8 .790 .868 126.8 SANet .899 .966 23.9 .758 .798 70.4 .763 .893 141.8 PVT-CASCADE .876 .955 28.4 .801 .843 59.8 .771 .883 140.5 G-CASCADE .869 .922 23.8 .703 .705 59.5 .725 .765 130.1
表 4. P2:在三个随机 80/20 划分下重新训练的结果(跨种子的均值±标准差)。模型彼此间差异在约 1 个标准差范围内,且 PraNet/Polyp-PVT 的排名在不同划分间发生翻转(seed-1 与 seed-0/2 相比)。
Model mDice mHD95 (px)
HSNet 0.930 ± 0.005 25.2 ± 2.5 Polyp-PVT 0.923 ± 0.005 27.9 ± 1.5 PraNet 0.919 ± 0.007 28.9 ± 1.9
病灶级检测:一种不同的、基于临床的排名。Pixel-Dice 奖励重叠,但忽略了临床问题——我们是否检测到了每个病灶且没有误报?表 5 对模型进行了重新排名:PVT-CASCADE [17] 在所有标准下均获得最佳的病灶 F1 分数,G-CASCADE [18] 获得最佳的精确率(最少的误报病灶),Polyp-PVT [4] 获得最高的敏感度。该结论对匹配阈值(IoU 0.1–0.75)具有鲁棒性。
P3:分布外(OOD)测试导致所有模型性能下降。在 PolypGen 的六个未见中心,每个模型的 Dice 均降至 0.71–0.76,HD95 为 145–162 px(表 6),且各中心的 Dice 范围从 0.45(中心 4)到 0.89(中心 3)。粗略排名基本保持不变,因此分布外因素并非导致排名重排,而是造成了一种均匀且巨大的绝对性能下降,这种下降在分布内排行榜中是不可见的,这强调了至少需要一个外部测试集的必要性。
定性分析。图 4 显示,附加指标在一致的情况下与 Dice 相符(第 1–2 行;它们不是噪声),但在其他情况下揭示了 Dice 所隐藏的失败(第 3–5 行)。图 2 在一个具体案例中使这些指标具象化。
7 息肉分割报告清单 (PSRC)
基于审计发现和 Metrics Reloaded 框架 [14],我们提出以下五点清单供未来工作参考。
C1. 报告 HD95 以及 Dice。对于任何边界准确性具有临床相关性的分割任务(如病灶大小测量、切除边缘规划),必须报告 HD95。仅报告 Dice 是不够的。
第 13 页
标题因过长被抑制 13
表 5. 病灶级检测(连通分量匹配),在 P1 未见数据集上汇总,基于三种标准。F1 值加粗显示。排名对标准具有鲁棒性,且与像素级 Dice 排名不同:G-CASCADE 具有最高的精确率(假阳性病灶最少),Polyp-PVT 具有最高的召回率,PVT-CASCADE 具有最佳的 F1 值;PraNet 始终表现最差。
任意重叠 质心在 GT 内 IoU≥0.5
模型 召回 精确 F1 召回 精确 F1 召回 精确 F1
PraNet .806 .615 .698 .757 .581 .658 .662 .501 .571 Polyp-PVT .898 .754 .820 .855 .720 .782 .792 .640 .708 SANet .874 .802 .836 .833 .766 .798 .739 .666 .701 PVT-CASCADE .888 .849 .868 .832 .802 .817 .782 .748 .765 G-CASCADE .819 .891 .854 .792 .870 .829 .689 .741 .714
表 6. P3(分布外 OOD):在 PolypGen 的六个未见中心上汇总(n=1537)。 所有模型在绝对数值上均显著下降;粗略排名基本保持不变(Polyp-PVT 最佳,PraNet 最差)。每列最佳值加粗显示。
模型 Dice 召回 HD95 NSD
Polyp-PVT 0.760 0.877 146.5 0.339 PVT-CASCADE 0.758 0.894 153.7 0.326 SANet 0.750 0.856 144.9 0.260 G-CASCADE 0.747 0.846 152.9 0.276 PraNet 0.713 0.846 162.3 0.290
C2. 报告召回率/灵敏度。在筛查应用中,假阴性的临床代价高于假阳性。召回率必须作为主要指标,而非可选的补充指标。 C3. 精确指定划分协议并论证可比性。论文必须声明其使用的是 PraNet 固定划分、随机划分还是数据集官方划分。使用非 PraNet 划分的论文不得将其数值放入隐含地与 PraNet 划分结果进行比较的列中。 C4. 包含至少一个来自未见中心的外部或 OOD 测试集。需要 PolypGen、BKAI-IGH 或私有临床数据集上的结果来支持泛化性声明。 C5. 报告统计显著性。基于每幅图像分数分布的 Wilcoxon 符号秩检验或 Friedman 检验即已足够。表格中 Dice 比较若小数点后不足两位的差异,在 p < 0.05 的情况下不应被标记为 SOTA。
8 讨论与局限性
有效性威胁。我们的结论基于几个经过验证的假设。自训练的 PVT-CASCADE [17] 和 G-CASCADE [18] 分别在其发布的分布内 Dice 值上下 0.011 和 0.018–0.035 范围内复现了结果,证实了训练过程的忠实性,因此它们在未见数据集上的较低分数反映了真实的泛化能力,而非
第 14 页
14 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
欠拟合;尽管如此,我们尽可能基于已发布权重的模型来锚定我们的指标分歧发现。P1 自训练结果是单种子(single-seed),但我们自己的 P2 实验直接量化了训练种子方差(Dice 系数 ±0.005–0.007),我们将此纳入对近乎并列排名的解读中。HD95 报告遵循 medpy 惯例,与 Metrics-Reloaded 的有向最大值惯例在相同掩码上相差高达约 16 像素,这本身就是一个可复现性发现。因此,绝对 HD95 值仅应在固定实现中进行比较。最后,感知哈希→SSIM 审计确认 P1 的训练/测试集是互斥的(最大跨集 SSIM 为 0.66);我们没有对独立机构的 PolypGen OOD 中心与训练池进行额外的 SSIM 审计,我们将其视为残留的低风险。扩展繁殖数、分裂依赖性澄清以及病灶匹配鲁棒性检查在补充材料中提供。
讨论。尽管该领域在架构上侧重于边缘细化,却未能采用 HD95 等表面距离指标,这源于基准测试的路径依赖。2020 年为快速基线比较而建立的 PraNet 模板,早于 2021–2022 年以边界为中心的架构浪潮。由于后续论文复制了这些确切的表格布局以保持直接排行榜的可比性,评估标准被人为地冻结,而底层的科学问题却已演变。
我们的审计发现代表了这些报告脆弱性的保守下界,因为我们严格依赖已发布文本的主要实验部分,而非隐藏的附录或外部存储库。此外,本审计仅限于静态图像结肠镜息肉分割;将此元评估框架扩展到皮肤病变分割等平行领域仍是未来工作的方向。
9 结论
我们系统地审计并实证压力测试了结肠镜息肉分割领域十年的评估实践。我们对 27 篇论文的元评估显示,该子领域依赖于脆弱的基准测试惯例,其特征是广泛的指标遗漏、不兼容的数据集划分混合、缺乏统计严谨性以及普遍的转录错误。通过在三种受控协议下统一重新评估五个代表性模型,我们证明了标准的区域重叠指标会无声地掩盖严重的边界和假阴性失败,且报告的排行榜排名在随机改变训练划分时会崩溃。为了纠正这种路径依赖,我们引入了息肉分割报告清单(PSRC)以及一个开源评估工具包。最终,我们的发现作为对医学成像社区的一个更广泛的警告:基准测试协议而非仅仅是架构创新,决定了所报告的进展;发布的工具包为实现标准化、稳健且临床可问责的评估提供了一条即时路径。
第 15 页
标题因过长被抑制 15
参考文献
1. Ali, S., Jha, D., Ghatwary, N., Realdon, S., Cannizzaro, R., Salem, O.E., Lamarque, D., Daul, C., Riegler, M.A., Anonsen, K.V., 等:A multi-centre polyp detection and segmentation dataset for generalisability assessment. Scientific Data 10(1), 75 (2023) 2. Bernal, J., Sánchez, F.J., Fernández-Esparrach, G., Gil, D., Rodríguez, C., Vilariño, F.: WM-DOVA maps for accurate polyp highlighting in colonoscopy: Validation vs. saliency maps from physicians. Computerized Medical Imaging and Graphics 43, 99–111 (2015) 3. Chang, Q., Ahmad, D., Toth, J., Bascom, R., Higgins, W.E.: ESFPNet: Efficient deep learning architecture for real-time lesion segmentation in autofluorescence bronchoscopic video. In: SPIE Medical Imaging 2023: Image Processing (2023), arXiv:2207.07759 4. Dong, B., Wang, W., Fan, D.P., Li, J., Fu, H., Shao, L.: Polyp-PVT: Polyp seg- mentation with pyramid vision transformers. CAAI Artificial Intelligence Research 2, 9150015 (2023) 5. Duc, N.T., Oanh, N.T., Thuy, N.T., Triet, T.M., Dinh, V.S.: ColonFormer: An efficient transformer based method for colon polyp segmentation. IEEE Access 10, 80575–80586 (2022) 6. Fan, D.P., Ji, G.P., Zhou, T., Chen, G., Fu, H., Shen, J., Shao, L.: PraNet: Parallel reverse attention network for polyp segmentation. In: Medical Image Computing and Computer Assisted Intervention (MICCAI). LNCS, vol. 12266, pp. 263–273. Springer (2020) 7. Fitzgerald, K., Bernal, J., Histace, A., Matuszewski, B.J.: Polyp segmentation with the FCB-SwinV2 transformer. IEEE Access 12 (2024), published version of arXiv:2302.01027; DOI 10.1109/ACCESS.2024.3376228 8. Jha, D., Smedsrud, P.H., Riegler, M.A., Halvorsen, P., de Lange, T., Johansen, D., Johansen, H.D.: Kvasir-SEG: A segmented polyp dataset. In: International Conference on Multimedia Modeling (MMM). pp. 451–462 (2020) 9. Jha, D., Tomar, N.K., Sharma, V., Bagci, U., Ali, S.: TransNetR: Transformer- based residual network for polyp segmentation with multi-center out-of-distribution testing. In: Medical Imaging with Deep Learning (MIDL) (2023), arXiv:2303.07428 10. Ji, G.P., Xiao, G., Chou, Y.C., Fan, D.P., Zhao, K., Chen, G., Van Gool, L.: Video polyp segmentation: A deep learning perspective. Machine Intelligence Research 19(6), 531–549 (2022) 11. Kim, T., Lee, H., Kim, D.: UACANet: Uncertainty augmented context attention for polyp segmentation. In: Proceedings of the 29th ACM International Conference on Multimedia (ACM MM). pp. 2167–2175 (2021) 12. Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., Dollar, P., Girshick, R.: Segment anything. In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). pp. 4015–4026 (2023) 13. Lou, A., Guan, S., Ko, H., Loew, M.: CaraNet: Context axial reverse attention network for segmentation of small medical objects. In: SPIE Medical Imaging 2022: Image Processing. pp. 81–92 (2022) 14. Maier-Hein, L., Reinke, A., Godau, P., 等:Metrics reloaded: recommendations for image analysis validation. Nature Methods 21(2), 195–212 (2024) 15. Mei, J., Zhou, T., Huang, K., Zhang, Y., Zhou, Y., Wu, Y., Fu, H.: A survey on deep learning for polyp segmentation: Techniques, challenges and future trends. Visual Intelligence 2(1), 1 (2025)
第 16 页
16 Aisha Urooj, Zain Ul Abdien, and Neelu Madan
16. Musgrave, K., Belongie, S., Lim, S.N.: A metric learning reality check. In: European Conference on Computer Vision (ECCV). pp. 681–699 (2020) 17. Rahman, M.M., Marculescu, R.: Medical image segmentation via cascaded attention decoding. In: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). pp. 6222–6231 (2023) 18. Rahman, M.M., Marculescu, R.: G-CASCADE: Efficient cascaded graph convo- lutional decoding for 2d medical image segmentation. In: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). pp. 7728–7737 (2024) 19. Reinke, A., Tizabi, M.D., et al.: Understanding metric-related pitfalls in image analysis validation. Nature Methods 21(2), 182–194 (2024) 20. Rex, D.K., Cutler, C.S., Lemmel, G.T., et al.: Colonoscopic miss rates of adenomas determined by back-to-back colonoscopies. Gastroenterology 112(1), 24–28 (1997) 21. Sánchez-Peralta, L.F., Pagador, J.B., Picón, A., Calderón, Á.J., Polo, F., Andraka, N., Bilbao, R., Glover, B., Saratxaga, C.L., Sánchez-Margallo, F.M.: PICCOLO White-Light and Narrow-Band Imaging Colonoscopic Dataset: A Performance Comparative of Models and Datasets. Applied Sciences 10(23), 8501 (2020). https://doi.org/10.3390/app10238501 22. Sang, D.: Bkai-igh neopolyp. https://kaggle.com/competitions/ bkai-igh-neopolyp (2021), kaggle 23. Silva, J., Histace, A., Romain, O., Dray, X., Granado, B.: Toward embedded detec- tion of polyps in WCE images for early diagnosis of colorectal cancer. International Journal of Computer Assisted Radiology and Surgery 9(2), 283–293 (2014) 24. Sun, Y., Chen, G., Zhou, T., Zhang, Y., Liu, N.: Context-aware cross-level fusion network for camouflaged object detection. In: International Joint Conference on Artificial Intelligence (IJCAI). pp. 1025–1031 (2021) 25. Tajbakhsh, N., Gurudu, S.R., Liang, J.: Automated polyp detection in colonoscopy videos using shape and context information. IEEE Transactions on Medical Imaging 35(2), 630–644 (2016) 26. Tang, F., Xu, Z., Huang, Q., Wang, J., Hou, X., Su, J., Liu, J.: DuAT: Dual- aggregation transformer network for medical image segmentation. In: Chinese Conference on Pattern Recognition and Computer Vision (PRCV). pp. 343–356. LNCS, Springer (2023) 27. Tudela, Y., Majó, M., de la Fuente, N., Galdran, A., Krenzer, A., Puppe, F., Yamlahi, A., Tran, T.N., Matuszewski, B.J., Fitzgerald, K., Bian, C., Pan, J., Liu, S., Fernández-Esparrach, G., Histace, A., Bernal, J.: A complete benchmark for polyp detection, segmentation and classification in colonoscopy images. Frontiers in Oncology Volume 14 – 2024 (2024) 28. Vázquez, D., Bernal, J., Sánchez, F.J., Fernández-Esparrach, G., López, A.M., Romero, A., Drozdzal, M., Courville, A.: A benchmark for endoluminal scene segmentation of colonoscopy images. Journal of Healthcare Engineering 2017, 4037190 (2017) 29. Wei, J., Hu, Y., Zhang, R., Li, Z., Zhou, S.K., Cui, S.: Shallow attention network for polyp segmentation. In: Medical Image Computing and Computer Assisted Intervention (MICCAI). LNCS, vol. 12901, pp. 699–708. Springer (2021) 30. Zhang, W., Fu, C., Zheng, Y., Zhang, F., Zhao, Y., Sham, C.W.: HSNet: A hybrid semantic network for polyp segmentation. Computers in Biology and Medicine 150, 106173 (2022) 31. Zhao, S., Wang, S., Pan, P., Xia, T., Chang, X., Yang, X., et al.: Magnitude, risk factors, and factors associated with adenoma miss rate of tandem colonoscopy: A systematic review and meta-analysis. Gastroenterology 156(6), 1661–1674 (2019)
第 17 页
标题因过长而被省略 17
32. Zhao, X., Jia, H., Pang, Y., Lv, L., Tian, F., Zhang, L., Sun, W., Lu, H.: M2SNet: 用于医学图像分割的多尺度内多尺度减法网络。 arXiv 预印本 arXiv:2303.10894 (2023) 33. Zhou, T., Zhou, Y., He, K., Gong, C., Yang, J., Fu, H., Shen, D.: 用于息肉分割的跨层级特征 聚合网络。Pattern Recognition 140, 109555 (2023)
第 18 页
18 Aisha Urooj, Zain Ul Abdien, 和 Neelu Madan
10 额外结果
图 5. P2 训练曲线(行:模型;列:随机划分):训练损失(红色)和保留集 Dice(蓝色)。保留集 Dice 在约 5 个 epoch 时趋于平稳,而训练损失持续下降(轻微的记忆效应,无性能退化);不同随机种子的曲线几乎相同。
训练动态(P2)。保留集 Dice 在约 5 个 epoch 内收敛并趋于平稳,而训练损失继续下降,这表明收益递减而非有害的过拟合(图 5)。值得注意的是,Transformer 模型 HSNet 保持了较高的训练损失(0.13),却取得了最佳的保留集 Dice(0.93);相比之下,CNN 模型 PraNet 对训练数据的拟合程度最高(0.07),但泛化能力略差,且这些动态在不同随机划分下保持稳定。
11 有效性威胁
发布权重与自训练权重。PraNet [6]、Polyp-PVT [4] 和 SANet [29] 使用作者发布的检查点进行评估;PVT-CASCADE [17] 和 G-CASCADE [18] 没有发布的息肉权重,是在标准的 1450 张图像划分上自训练的。为了证明这不会混淆我们的结论,我们在保留的 Kvasir-SEG [8] 和 CVC-ClinicDB [2] 测试集上验证了分布内复现:PVT-CASCADE [17] 的 Dice 分数几乎与其发表的
第 19 页
因标题过长而省略标题 19
完全一致(Kvasir 0.917 vs. 0.917;ClinicDB 0.932 vs. 0.943),且 G-CASCADE 的复现结果在 0.02–0.035 范围内(Kvasir 0.893 vs. 0.927;ClinicDB 0.929 vs. 0.947)。 因此,自训练模型是可靠的,它们在未见数据集上得分较低反映了真实的泛化行为,而非欠训练。尽管如此,我们尽可能在发布的权重模型基础上锚定指标不一致性的发现,并将自训练的绝对得分视为次要参考。 什么是(以及什么不是)协议依赖的。我们刻意保持精确:固定划分(P1)和分布外(P3)的排名实际上大体一致(Polyp-PVT 最佳,PraNet 最差,两者均如此),而 P3 的贡献在于显示在未见中心上的绝对均匀下降(Dice 0.71–0.76,HD95 145–162 px),而非重新排序。我们记录的这种不稳定性范围更窄且有更好的支持:(i) 在三个随机 80/20 划分(P2)下,相邻且得分接近的模型发生重排(PraNet↔Polyp-PVT),以及 (ii) 指标选择会改变前三名排名(G-CASCADE 在 Dice 上排名第 4,但在病灶精度上排名第 1)。因此,我们声称,基于单一指标、单一划分的排行榜上得分接近的模型之间的差距并不稳健——并非说架构排名是任意的。 单种子训练与统计功效。自训练的 P1 模型是单次运行;我们自己的 P2 量化了训练种子的方差(Dice ±0.005–0.007),我们将其纳入解释中。在小基准测试上的显著性检验相应地功效较低(CVC-300,n=60);因此,我们报告了 Bootstrap 置信区间和秩双样本效应量, alongside FDR 校正的 p 值,并将结果表述为“噪声范围内的差距”而非已证明的等价性。 指标实现范围。我们的 Dice、IoU、recall 和 NSD 与官方 MetricsReloaded 参考匹配至 ≤10−11(NSD 完全一致)。HD95 按照 medpy 惯例报告,与 Metrics-Reloaded 的有向最大值惯例在相同掩码上相差高达约 16 px——这本身是一个可复现性的发现,但这意味着绝对 HD95 值仅应在固定实现内进行对比。我们采用的 Metrics-Reloaded 建议遵循已发布的问题指纹;通过交互式工具包确认它被留作报告步骤。 病灶检测稳健性。连通分量匹配当前不应用最小尺寸过滤器,因此单个像素的假阳性斑点可算作误报病灶。我们在三种匹配标准(任何重叠、质心在 GT 内、IoU≥0.5)以及 IoU 阈值 0.1–0.75 范围内报告该指标;模型排序在所有这些情况下均保持稳定。建议在实际部署中添加小型(例如 ≥0.1% 面积)组件过滤器,但这不会改变排名。 数据泄露。感知哈希→SSIM 审计确认 P1 训练/测试划分是不相交的(最大跨集 SSIM 0.66)。PolypGen OOD 中心来自独立机构;我们没有额外对 PolypGen 与训练池进行 SSIM 审计,我们将其注记为残留的(低)风险。