基础模型真的能看懂MRI里的疾病进展吗?

快速导读:提出首个时间感知多视图MRI基准,系统评估16个视觉语言模型在纵向疾病进展推理中的时空能力。

本文提出Time-Aware Multi-View MRI Benchmark,首次将多视图解剖输入、纵向时间推理与结构化定位引导统一到同一个评估框架中。该基准整合7个纵向MRI队列,构建3,920个经双放射科医生验证的QA对,覆盖时间推理、疾病进展、结构化定位、时序排序和变化定位五类任务。

核心发现是:现有视觉语言模型在静态空间定位上表现尚可,但一旦涉及跨时间点的变化方向判断和体积量化,几乎所有模型都系统性失败。论文用TAC复合指标揭示了最终准确率与时间推理一致性之间的深层脱节,为后续模型设计指明了方向。

英文题目:How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

论文出处:arXiv 每日论文精选 · arXiv:2608.13309

原始论文:PDF / 论文页面

这篇论文解决什么问题?

放射科临床实践的核心工作之一是纵向对比解读:医生需要跨多个时间点、跨轴位冠状位矢状位三个解剖平面,判断病灶是增大、缩小还是稳定。然而现有医学视觉语言基准几乎全部局限于单时间点、单视图的静态解读。OmniMedVQA和PMC-VQA等大规模基准将每张图像独立处理,完全忽略了时间维度。

已有时间推理工作如MedAtlas提供了部分时间覆盖,但缺乏多视图能力;OmniMRI涉及疾病进展但无时间推理;NOVA专注脑MRI异常定位却完全没有时间维度。这种割裂意味着没有任何现有基准能够回答一个基本问题:模型是否真正理解了疾病随时间的演变。

更关键的是,准确率这一传统指标无法区分'猜对了答案'和'真正理解了变化过程'。一个模型可能因为记住了静态影像特征而答对最终诊断,却在变化方向判断上完全错误。这种能力与表现的脱节,正是本文试图系统量化的核心问题。

核心创新

  • 首个统一多视图解剖输入、纵向时间推理与结构化定位引导的MRI评估框架
  • 提出TAC(Time-Aware Composite)复合指标,整合TEDS、Trend-F1、Sign Accuracy和Coverage四个时间推理维度
  • 构建3,920个专家验证QA对,覆盖5类互补任务(时间推理、疾病进展、结构化定位、时序排序、变化定位)
  • 通过Resident-Attending代理工作流消融实验揭示多视图输入对空间定位与时间推理的差异化影响

方法概览

整合7个纵向MRI队列(胶质母细胞瘤、脑转移、神经退行、前庭神经鞘瘤),经ANTs配准、RAS+重定向、肿瘤感知切片提取和序列特异性强度归一化后,提取多视图多序列图像(每时间点9-12张,每患者3-4个时间点),采用GPT-5生成+双认证放射科医生验证的混合标注流程构建3,920个QA对,覆盖5类任务,并以TAC复合指标评估。

  • 数据整合:从7个纵向MRI队列中选取胶质母细胞瘤、脑转移、神经退行性疾病和前庭神经鞘瘤四类病理,每患者包含3-4个时间点。
  • 预处理管线:采用ANTs进行跨时间点配准,执行RAS+方向重定向,通过肿瘤感知切片提取和序列特异性强度归一化,确保不同时间点的图像在空间上可比。
  • 多视图提取:每个时间点提取9-12张图像,覆盖轴位、冠状位、矢状位三个解剖平面,以2D切片近似3D体积信息。
  • 标注流程:采用GPT-5生成问题后经双认证放射科医生独立验证的混合标注流程,最终接受率为72%,构建3,920个QA对。
  • 任务设计:五类任务形成互补——时间推理要求判断变化序列,疾病进展要求诊断结论,结构化定位要求给出边界、影像特征和混淆因素,时序排序要求排列事件顺序,变化定位要求识别变化区域。
  • TAC复合指标:整合TEDS(时间事件依赖评分)、Trend-F1(趋势F1)、Sign Accuracy(方向准确率)和Coverage(覆盖度)四个维度,权重分别为0.5、0.2、0.2、0.1,旨在捕捉最终准确率无法反映的时间推理一致性。

逐图理解论文

研究空白

研究空白
Fig. 1: Comparison of reasoning dimension coverage across MRI benchmarks. Time-Aware Multi-View MRI benchmark achieves full coverage across all five tasks. MedAtlas [27] and OmniMRI [12] offer partial coverage (p∗) on Tem- poral Reasoning and Disease Progression, respectively. Remaining benchmarks, NOVA [5], DrVD-Bench [32], OmniMedVQA [14], RadVUQA [18], and Med- FrameQA [29] provide no coverage across any dimension.

该图对比了各MRI基准在五个推理维度上的覆盖情况。Time-Aware Multi-View MRI基准是唯一实现全维度覆盖的基准,MedAtlas和OmniMRI仅提供部分覆盖,其余基准完全缺乏时间或多视图能力。观察此图可以直观理解本文填补的研究空白。

论文的贡献与检验

论文的贡献与检验
Table 1: Model performance on the Time-Aware Multi-View MRI Benchmark across final accuracy, Reasoning Score (RS), and Time-Aware Composite (TAC) metric. Higher TAC indicates stronger temporal consistency and reasoning fi- delity. Bold: best per column.

该表对比了16个模型在最终准确率、Reasoning Score和TAC上的表现。重点观察准确率相近的模型之间TAC的巨大差异,这揭示了准确率指标的局限性。

消融实验的启示

消融实验的启示
Table 2: Agentic workflow accuracy (%) on UCSF-GBM subset across four clin- ical tasks. Multi-view inputs improve spatial localization but reveal persistent limitations in volumetric reasoning. Bold: best per column.

该表展示了Resident-Attending工作流在UCSF-GBM子集上的消融结果。多视图输入对空间定位有正向作用,但在体积推理上仍存在持续局限,说明信息过载是紧凑架构的瓶颈。

实验如何设计?

  • 模型选择:16个视觉语言模型,包括7个闭源模型和9个开源模型,覆盖不同架构规模和训练策略。
  • 评估方式:零样本评估,模型直接接收多视图多时间点图像输入,输出结构化答案。
  • 消融实验:在UCSF-GBM子集(1,192样本)上采用Resident-Attending代理工作流,对比多视图输入与仅轴位输入的性能差异。
  • 指标计算:除最终准确率外,还计算Reasoning Score(RS)和TAC,后者联合评估推理一致性、时间对齐和事实准确性。

关键结果与论文证据

  • InternVL3.5-Inst取得最高TAC 0.80和最终准确率35.15%,但这一准确率在临床场景下仍然偏低(第7页)。
  • Gemini-3-Pro最终准确率35.10%与第一名几乎持平,但TAC仅0.590,说明高准确率并不保证时间推理一致性(第7页)。
  • 所有模型的Trend-F1范围在0.192-0.631之间,Sign Accuracy范围在0.421-0.740之间,变化方向判断是普遍薄弱环节(第7页)。
  • 变化分割与量化任务准确率均低于16%,而进展定位最高可达97.3%,说明模型能定位变化区域但无法判断变化方向或量化变化幅度(第8页)。
  • 多视图输入使进展定位平均提升6.2个百分点,但Qwen3-VL-8B在时间排序任务上下降8.0个百分点,紧凑架构存在信息过载问题(第8页)。
  • MedGemma系列TAC(0.572-0.602)低于通用VLM,领域专业化训练并未带来时间推理优势(第7页)。

阅读时需要注意

  • 所有模型在变化方向识别和体积量化上系统性失败,准确率低于16%,这是当前VLM的根本性能力缺陷。
  • 紧凑架构在多视图输入下出现时间推理退化,说明简单增加视图数量并非有效策略。
  • 当前VLM缺乏3D几何先验,无法完成协议依从的RANO测量,与真实临床体积解读仍有差距。
  • 基准仅覆盖脑部MRI,未涉及其他解剖部位,结论的泛化性有待验证。
  • TAC指标权重为主观设定,未报告敏感性分析,指标本身的稳健性需要进一步检验。

关联工作

  • MedAtlas提供了部分时间推理覆盖,但缺乏多视图和疾病进展能力,无法评估空间与时间的联合推理。
  • OmniMRI涉及疾病进展但无时间推理维度,两者形成互补但均不完整。
  • MAIRA-2结合视角与时间上下文进行2D放射影像报告生成,但无法处理轴冠矢三平面的立体输入。
  • LlamaV-o1提供了Reasoning Score的计算方法,本文在此基础上扩展为时间感知的TAC指标。

发表评论