快速导读:ScaFE将LLM的临床知识转化为可本地执行、有证据支撑的特征程序,在跨院区瘢痕分类任务中以10%的数据量领先最强基线11.8个百分点。
ScaFE提出了一种全新的医学图像分析范式:不让大语言模型直接看图像,而是让它生成可本地执行的特征测量程序。这些程序从临床照片中提取结构化特征,再由一个固定的随机森林分类器进行诊断。整个过程LLM不接触原始图像,既保护了数据隐私,又使每个决策都有可溯源的证据支撑。
在三个医院共600张瘢痕照片的留一站点外评估中,ScaFE达到了81.0%的站点宏观平衡准确率,比最强基线BiomedCLIP高出10个百分点。更令人印象深刻的是,仅使用10%的开发数据时,ScaFE仍保持72.0%的准确率,领先优势扩大到11.8个百分点。这一结果表明,将LLM的临床知识外化为可解释的测量代码,比直接使用视觉模型进行端到端学习更加数据高效。
英文题目:ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature Programs
论文出处:arXiv 每日论文精选 · arXiv:2607.28538
原始论文:PDF / 论文页面
这篇论文解决什么问题?
瘢痕疙瘩和增生性瘢痕是两种外观相似但治疗方案截然不同的病理性瘢痕。临床上,医生通过视觉评估颜色、厚度、表面纹理等多个维度进行鉴别,但这一过程依赖专家经验,且不同医院的采集设备和光照条件差异很大。
现有方法面临三重困境:手工设计特征需要大量领域知识且泛化性差;端到端深度模型依赖海量标注数据,在医学领域难以满足;直接调用视觉语言模型诊断需要上传患者图像,存在隐私风险且决策过程难以复现和审计。
ScaFE的出发点是一个关键洞察:LLM虽然不能直接处理图像,但它拥有丰富的临床知识,知道医生诊断时关注哪些视觉特征。如果能将这些知识转化为可执行的测量代码,就能在不暴露原始数据的前提下,利用LLM的医学知识辅助诊断。
这一思路与概念瓶颈模型有本质区别:后者从少量图像数据中学习命名中间概念,而ScaFE的特征程序由LLM从临床文献和知识中生成,每个特征都有明确的证据来源和可验证的测量逻辑。
核心创新
- 提出将LLM辅助医学图像学习形式化为基于证据的特征程序搜索,而非直接图像预测。
- 设计了一个仅使用聚合反馈的验证引导迭代优化循环,提升程序可执行性和特征效用,同时保留每个特征的可溯源证据记录。
- 在三个医院的患者级留一站点外评估中验证了方法,并审计了可执行性、证据基础、特征忠实度和跨LLM稳定性。
方法概览
ScaFE通过三个步骤实现:1) LLM检索在线临床证据并生成候选特征程序;2) 程序在本地受限环境中执行,仅将聚合验证统计量(如BAcc、SHAP重要性)反馈给LLM进行迭代修复;3) 最终选择最优程序并用随机森林(RF)在全部开发集上训练,冻结后评估。整个过程LLM不接触原始图像。
- 特征程序生成:LLM首先检索在线临床证据(如PubMed文献),然后生成候选特征程序。每个程序是一个确定性的Python函数,输入为局部图像,输出为一个可解释的标量特征值,例如"瘢痕红色程度"或"边缘不规则性"。
- 本地受限执行:生成的程序在本地沙箱环境中执行,处理开发集图像。LLM不接触原始图像,仅接收聚合验证统计量作为反馈,包括平衡准确率和SHAP特征重要性。
- 迭代修复循环:基于聚合反馈,LLM对程序进行修复和优化。实验显示,经过迭代修复,程序可执行率从66.7%提升至95.0%,候选证据通过率从70.0%提升至91.7%。
- 最终选择与冻结:从所有迭代轮次中选择最优程序集,使用随机森林在全部开发集上训练,冻结后进行评估。整个过程LLM仅参与程序生成和修复,不参与最终推理。
- 证据溯源机制:每个特征程序都附带其生成的临床证据来源,使最终决策的每个维度都可追溯到具体的医学文献或临床指南。
- 跨LLM稳定性:方法设计为与LLM无关,可使用不同的LLM生成特征程序,实验验证了跨模型的预测一致性。
逐图理解论文
现实困境与直觉

图1展示了ScaFE的整体流程:LLM从临床证据生成特征程序,程序在本地处理图像提取特征,随机森林评估候选程序,仅聚合诊断统计量反馈给LLM进行迭代修复。最终选出的程序和随机森林被冻结用于预测,原始图像从未进入LLM上下文。这一架构设计是方法的核心创新。
方法贡献与验证

表1展示了患者级留一站点外评估的主要结果。三个站点列分别显示各医院作为测试集时的平衡准确率,平均值反映整体性能。ScaFE在三个站点均表现优异,且未出现某一站点严重退化的情况,验证了跨院区泛化能力。
核心结论与意义

图3展示了不同开发数据比例下的数据效率。随着数据比例从10%增加到100%,ScaFE始终领先于BiomedCLIP,且优势在数据稀缺时更加明显。阴影区域标注了ScaFE相对于最强基线的增益幅度,直观展示了方法的数据高效特性。
实验如何设计?
- 数据集:三个医院各200张瘢痕照片,共600张,二分类任务(瘢痕疙瘩 vs 增生性瘢痕)。
- 评估协议:患者级留一站点外评估,即每次将一个医院的全部患者作为测试集,其余两个医院的数据用于开发。
- 基线模型:包括手工特征+随机森林、ResNet-18、EfficientNet-B0、DINOv3、Derm Foundation、BiomedCLIP和本地VLM直接推理。
- 消融实验:分别移除在线文献检索、预测反馈和SHAP特征重要性反馈,分析各组件贡献。
- 数据效率实验:在10%到100%的开发数据子集上评估性能,验证方法在数据稀缺场景下的优势。
- 鲁棒性测试:在亮度、对比度、JPEG压缩和模糊等采集偏移条件下评估性能退化程度。
关键结果与论文证据
- 主要结果(第6页):ScaFE达到81.0%的站点宏观平衡准确率,超过最强基线BiomedCLIP(71.0%)达10.0个百分点。
- 数据效率(第7页):仅使用10%开发数据时,ScaFE保持72.0%平衡准确率,领先BiomedCLIP达11.8个百分点,优势随数据减少而扩大。
- 迭代修复效果(第7页):程序可执行率从66.7%提升至95.0%,证据通过率从70.0%提升至91.7%,验证了反馈循环的有效性。
- 消融分析(第7页):移除在线文献检索导致性能下降4.9个百分点,移除预测反馈下降6.6个百分点,移除SHAP反馈下降2.8个百分点,表明各组件均有贡献。
- 跨站点泛化:三个医院站点的性能差异在可接受范围内,未出现某一站点严重退化的情况,表明方法具有一定的跨院区泛化能力。
- 采集偏移鲁棒性:在亮度、对比度、JPEG压缩和模糊等偏移下,ScaFE的相对退化程度与基线相当,未声称单独的鲁棒性优势。
- 特征忠实度审计:通过SHAP删除实验验证了所选特征对模型决策的实际贡献,确保特征程序不是虚假关联。
- 计算成本:LLM仅参与程序生成和修复阶段,最终推理仅需执行特征程序和随机森林,计算开销远低于大型视觉模型。
阅读时需要注意
- ScaFE仅支持而非替代临床诊断,最终决策仍需医生综合判断,需前瞻性临床验证。
- 研究为回顾性、二分类、三医院设计,未纳入触诊等非视觉临床发现,限制了结论的泛化范围。
- 实际部署需要固定所有工件、维护沙箱执行环境和建立治理措施,工程复杂度较高。
- 仅三个医院站点的评估无法代表更广泛的医院群体不确定性,需要更大规模的多中心验证。
关联工作
- 临床瘢痕评估量表VSS和POSAS启发了ScaFE的结构化特征表示,将视觉可评估的临床概念转化为可测量的程序。
- BiomedCLIP作为最强的视觉语言基线,在跨站点评估中达到71.0%的平衡准确率,但其决策过程缺乏可解释性和证据溯源。
- 概念瓶颈模型学习命名中间概念,但ScaFE的特征程序由LLM从临床知识生成,而非从少量图像数据中学习,知识来源和可解释性更强。
- 本地VLM直接推理基线(MedGemma-1.5-4B-IT)在相同任务上表现不佳,验证了直接使用VLM诊断的局限性。