ScaFE:不直接看图的LLM,如何用临床知识程序超越视觉模型?

现实困境与直觉

从临床照片区分瘢痕疙瘩和增生性瘢痕,面临专家标注稀缺和跨医院采集差异大的双重挑战。ScaFE提出了一种新思路:不让大语言模型直接看图诊断,而是让它检索临床证据,生成可本地执行的特征测量程序。这些程序在本地处理图像,仅将聚合验证统计量反馈给LLM进行迭代修复,最终选出的程序用随机森林分类。在三个医院的留一站点外评估中,ScaFE以10%的数据量领先最强基线BiomedCLIP达11.8个百分点。该方法不依赖海量标注,保护数据隐私,且每个特征都有可溯源的证据记录。但研究为回顾性、二分类设计,需前瞻性临床验证。

ConsiSpace:几何一致性记忆与自监督强化学习提升视频空间推理

方法概览:ConsiSpace框架

本文提出ConsiSpace框架,针对多模态大模型在视频空间推理中缺乏几何建模、冗余证据多及跨视角不稳定等问题,设计了几何一致性记忆(GCM)和统一一致性自监督强化学习(UC-SSRL)。GCM通过门控写入和融合减少冗余,UC-SSRL利用自监督奖励提升稳定性。实验显示在VSI-Bench和OSI-Bench上显著超越基线,且在长视频场景下显存占用和推理时间大幅降低。需注意GCM依赖几何基础模型准确性,噪声输入可能影响性能。

MoD-VLLM:模块化动态粒度长视频理解,突破Token预算与多事件定位瓶颈

MoD-VLLM框架概览

本文提出MoD-VLLM框架,旨在解决长视频理解中Token预算有限与多事件细节捕捉之间的矛盾。现有方法如Token剪枝或关键帧选择易导致细节丢失或错误传播。MoD-VLLM通过正负视频片段定位模块识别相关片段,并利用模块化动态粒度反射模块,对正片段进行细粒度编码以捕捉细节,对负片段进行粗粒度编码以保留全局上下文。结合DPO优化与反事实验证,该框架实现了迭代式自我修正。实验显示,在VideoMME和MEventBench等基准上,MoD-VLLM显著优于LLaVA-Video和Qwen2.5-VL等基线模型。