快速导读:这正是当前医学基础模型评估体系的一个盲区。我们习惯用下游任务的分数来衡量模型好坏——分割Dice高就认为模型可靠。但下游性能是一个“终端过滤器”,它可能掩盖表示空间内部的剧烈变化。一个模型可以在伪影图像上输出看似合理的分割结果,但其底层特征已经发生了根本性偏移。当这个模型被迁移到新任务时,这种隐性脆弱性就可能突然暴露。目前,没有任何系统性研究告诉我们:不同的预训练策略、架构选择和领域专用化程度,究竟如何影响表示空间对MRI伪影的耐受能力。
当我们将预训练的3D医学图像编码器作为通用特征提取器部署到临床场景时,一个关键问题常被忽视:这些模型在面对MRI采集过程中不可避免的伪影时,其内部表示空间究竟有多稳定?本文作者构建了一个受控扰动基准,系统评估了五种近期提出的自监督3D编码器在七类MRI伪影下的表示鲁棒性,覆盖T1、T1ce、T2和FLAIR四种模态。
研究的核心发现令人警醒:伪影可以在不引发维度坍缩的情况下,显著改变表示空间的几何结构。这意味着即使下游任务指标看似稳定,模型内部对同一病例的理解可能已经发生了根本性偏移。其中3DINO表现出最一致的鲁棒性,而BrainIAC则对频域伪影极度敏感,其Linear CKA值在严重扰动下趋近于零。
英文题目:Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness
论文出处:arXiv 每日论文精选 · arXiv:2608.06613
原始论文:PDF / 论文页面
这篇论文解决什么问题?
自监督预训练的3D编码器正迅速成为医学影像分析的基础设施。无论是用于分割、分类还是异常检测,这些模型提供的冻结特征被广泛复用。然而,现有评估几乎完全聚焦于下游任务性能,忽略了一个更根本的问题:当输入图像受到噪声、运动伪影或重建伪影污染时,模型生成的表示向量本身是否保持稳定?
临床MRI采集环境远比受控研究复杂。设备场强差异、患者运动、扫描参数选择等因素会引入多种伪影,包括k空间尖峰、周期性鬼影、Gibbs ringing、Rician噪声、高斯模糊、偏置场和伽马对比度变化。这些伪影在真实临床数据中普遍存在,但它们在表示层面的影响从未被系统量化。
一个更深层的担忧是:表示空间的几何漂移可能被下游任务的鲁棒性所掩盖。例如,一个分割模型可能在伪影图像上仍输出合理的Dice分数,但其底层特征表示已经发生了剧烈变化。这种“隐性脆弱性”在模型被迁移到新任务时可能突然暴露,造成难以预料的失败。
此外,不同编码器在架构、预训练目标、领域专用性和数据规模上差异显著。ViT与CNN、对比学习与自蒸馏、通用医学影像与脑部专用数据——这些设计选择如何影响表示鲁棒性,此前并无系统研究。本文正是为了填补这一空白。
核心创新
方法概览
这正是当前医学基础模型评估体系的一个盲区。我们习惯用下游任务的分数来衡量模型好坏——分割Dice高就认为模型可靠。但下游性能是一个“终端过滤器”,它可能掩盖表示空间内部的剧烈变化。一个模型可以在伪影图像上输出看似合理的分割结果,但其底层特征已经发生了根本性偏移。当这个模型被迁移到新任务时,这种隐性脆弱性就可能突然暴露。目前,没有任何系统性研究告诉我们:不同的预训练策略、架构选择和领域专用化程度,究竟如何影响表示空间对MRI伪影的耐受能力。
- 数据基础:使用BraTS-Africa数据集的95例胶质瘤病例,包含T1、T1ce、T2和FLAIR四种标准序列。该数据集来自尼日利亚的多中心1.5T扫描,本身已具备一定的采集多样性。
- 伪影模拟:在图像域和频域共设计七类伪影,每类设定五个预定义严重等级(L1至L5)。频域伪影包括k空间尖峰、周期性鬼影和Gibbs ringing;图像域伪影包括Rician噪声、高斯模糊、偏置场和伽马对比度变化。具体参数详见论文表2(第8页)。需注意伽马对比度的五个等级跨越了恒等变换两侧,不构成单调严重性序列。
- 编码器选择:评估五种冻结的预训练3D编码器——3DINO(多器官自蒸馏ViT)、BrainIAC(脑部MRI专用SimCLR ViT)、BrainFM(脑部多任务U-Net风格架构)、NeuroVFM(大规模临床神经影像Vol-JEPA ViT)和Neuro-SimCLR(脑部MRI SimCLR 3D ResNet-18)。各模型的特征维度从128到768不等,预训练策略和领域覆盖差异显著。
- 表示鲁棒性度量:采用Linear CKA衡量干净表示与伪影表示之间的几何相似性,捕捉表示空间关系的整体偏移。同时使用RankMe评估表示的谱分散程度,检测是否存在维度坍缩。两者结合可区分“几何漂移”和“信息坍缩”两种不同的失效模式。
- 定性可视化:对每个编码器和伪影组合,将干净样本与伪影样本的表示联合嵌入UMAP空间,观察伪影是否导致样本簇的系统性偏移或分散。UMAP仅用于定性检查,不提供定量结论。
- 任务层参考分析:使用独立的TumorSynth分割模型,计算干净输入与伪影输入下预测结果的Dice相似系数。该分析不构成对评估编码器的下游验证,而是提供一个任务层面的参考基准,观察伪影对自动化分割流程的相对影响。
- 实验规模:覆盖5个编码器×7类伪影×4种模态×5个严重等级的全组合,加上T1模态的完整UMAP可视化和TumorSynth分割一致性分析。附录提供了其余三种模态的完整结果。
- 评估框架的独特之处在于其“表示优先”的视角:不关心模型在下游任务上的分数,只关心输入扰动是否改变了模型对图像内容的内部编码方式。这使得研究能够揭示那些被任务指标掩盖的脆弱性。
逐图理解论文
一个令人警醒的案例

图2展示了T1模态下频域伪影的结果。BrainIAC的CKA在周期性鬼影和k空间尖峰下急剧下降至接近零,这是全文最显著的表示脆弱性证据。同时RankMe保持稳定,完美展示了CKA-RankMe解耦现象。
研究空白:下游性能掩盖了表示层的脆弱性

表1列出了五种评估编码器的架构、预训练目标、领域、数据规模和提取的表示维度。对比这些属性有助于理解鲁棒性差异的可能来源。注意各模型的特征维度从128到768不等,这会影响RankMe的绝对值。
论文的贡献:受控基准与双重度量

表2给出了七类伪影在五个严重等级下的具体参数值。例如,周期性鬼影的位移像素数随等级增加而增大,Gibbs ringing的截断半径随等级增加而减小。伽马值跨越1.0两侧,提示该伪影的等级不代表单调严重性。
结论与意义

图3的UMAP投影提供了表示空间的直观视图。可观察干净样本(通常为蓝色)与伪影样本(其他颜色)之间的系统性偏移。某些伪影导致整个簇的平移,另一些则导致簇内分散增加。
实验如何设计?
- 所有编码器以冻结权重模式运行,仅提取指定层的表示向量,不做任何微调。特征提取层遵循各原始论文的推荐配置。
- 伪影模拟在3D体积上逐切片执行,确保扰动在空间上一致。频域伪影通过k空间操作实现,图像域伪影直接在空间域施加。
- Linear CKA计算使用线性核,在干净表示矩阵与伪影表示矩阵之间进行。RankMe基于奇异值谱的熵计算有效秩。两者均按模态和严重等级分别计算。
- UMAP投影将干净样本与对应伪影样本的表示拼接后进行联合降维,使用默认超参数,仅用于可视化模式识别。
- TumorSynth分割一致性分析对18个解剖和肿瘤标签分别计算Dice,然后取平均。该模型独立于五个评估编码器,使用不同的架构和训练数据。
- 所有实验在单一GPU上可复现,代码和预处理流程已在论文附录中详细说明。
关键结果与论文证据
- 3DINO在所有伪影类型和模态上表现出最一致的表示鲁棒性,其Linear CKA在严重扰动下仍保持较高水平(第11页)。这可能与其多器官预训练带来的泛化能力有关。
- BrainIAC是五个编码器中对伪影最敏感的模型。在频域扰动(尤其是周期性鬼影和k空间尖峰)下,其Linear CKA趋近于零,表示空间几乎完全重组(第11页)。
- 一个关键发现是CKA与RankMe的解耦:在许多模型-伪影组合中,CKA显著下降而RankMe几乎不变(第13页)。这表明伪影可以大幅改变表示的几何结构,却不减少表示的维度分散程度——这是一种此前未被描述的失效模式。
- 周期性鬼影对分割一致性的影响最大:TumorSynth的Dice从L1的0.79降至L5的0.69(第14页)。这为频域伪影的临床影响提供了任务层面的量化参考。
- 表示鲁棒性与任务鲁棒性仅部分对齐。某些伪影在表示层面造成显著漂移,但TumorSynth的分割结果相对稳定;反之亦然。这意味着仅靠下游指标评估模型鲁棒性可能产生误导。
- 不同MRI模态对伪影的敏感度存在差异。T1ce和FLAIR在某些伪影下表现出与T1不同的鲁棒性模式,完整结果见附录图5至图10(第20-25页)。
- UMAP可视化(第14页及附录)直观展示了伪影如何导致样本簇的整体平移或分散。值得注意的是,即使Linear CKA较高,UMAP仍可能显示伪影相关的系统性偏移,提示CKA和UMAP捕捉的是表示空间的不同特性。
- 架构选择似乎比预训练规模更能预测鲁棒性。基于ViT的模型(3DINO、BrainIAC、NeuroVFM)表现出截然不同的鲁棒性特征,说明架构本身不是决定性因素,预训练策略和领域匹配度可能更为关键。
阅读时需要注意
- 五个编码器在架构、预训练目标、领域和数据规模上同时变化,无法将鲁棒性差异归因于单一设计因素。这是模型选择固有的混淆问题。
- 伪影严重等级通过视觉检查设定,不代表经过校准的临床图像质量分级。实际临床场景中的伪影强度和组合可能更为复杂。
- RankMe的绝对值受特征维度和样本量影响,不同模型之间的RankMe数值不宜直接比较。应关注同一模型在不同条件下的相对变化。
- TumorSynth分割分析仅使用单一独立模型,不能代表所有可能的下游任务行为,也不构成对评估编码器的下游验证。
- 伽马对比度的五个等级不构成单调严重性序列,对该伪影的“严重性趋势”解读需格外谨慎。
关联工作
- 3DINO基于DINO自蒸馏框架在多器官CT和MRI数据上预训练,是五个模型中领域覆盖最广的编码器,其鲁棒性优势可能源于这种多样性。
- BrainIAC专门为脑部MRI设计,使用SimCLR对比学习目标。其极端的伪影敏感性提示,高度领域专用的预训练可能以牺牲表示稳定性为代价。
- NeuroVFM采用Volumetric JEPA目标在大规模临床神经影像上预训练,代表了预测性自监督学习路线。其鲁棒性介于3DINO和BrainIAC之间。
- TumorSynth作为独立的分割模型,提供了与表示评估正交的任务层视角。其架构和训练数据与五个编码器完全不同,因此其行为反映的是伪影对分割任务的一般影响,而非特定编码器的特性。
- BraTS-Africa数据集的非洲人群胶质瘤病例为评估提供了地理和人口学上的多样性,有助于检验鲁棒性结论的泛化性。