
这项由耶鲁大学、韩国高丽大学、圣路易斯华盛顿大学、昆士兰大学、德克萨斯大学健康科学中心、华盛顿大学以及微软研究院联合开展的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.07673v1,有兴趣深入了解的读者可通过该编号查询完整论文。
当一位医生坐在诊室里翻看病人的检查结果时,他脑子里同时在处理X光片、CT扫描图像、皮肤照片、病理切片、血液检验报告……这种"多管齐下"的信息处理方式,是几乎所有临床诊断的日常状态。然而,让计算机学会像医生一样"同时看图又读字",一直是医疗人工智能领域最棘手的挑战之一。困难并不在于算法本身的设计,而在于——哪里能找到足够多、足够好、足够干净的医学图片配合文字描述的训练数据?
这个问题的核心矛盾在于,真正来自医院的临床数据受到隐私保护、机构审批、版权限制等重重壁垒,根本无法大规模流通共享。于是研究者们把目光转向了另一个公开资源:PubMed Central,简称PMC——一个存放了数百万篇医学学术论文的公开数据库。这些论文里有大量医生和科学家亲手标注过的图片,配上详细的文字说明,从理论上讲,简直是训练医疗AI的天然宝库。
然而,天然宝库并不等于可以直接使用的精炼原料。研究团队在深入研究现有的PMC数据集时发现了一个令人头疼的问题:一个包含2400万图文对的现有数据集里,高达80.3%的图片根本不是医学图像——它们是统计柱状图、流程图、分子结构示意图、实验设计草图……这些东西对训练一个能识别肺炎的AI毫无用处,甚至会起到干扰作用。此外,医学论文里大量存在"拼图式"图片——一张大图里塞了十几个小图,配一段笼统的说明文字,根本无法知道哪段文字在描述哪个小图。这就好比你买了一本有图有说明的食谱,但所有菜的图片都拼在一页纸上,所有文字说明也堆在一起,完全对不上号。
正是为了解决这些问题,耶鲁大学等机构的研究团队开发了MedPMC——一个专门用来"清洗和提炼"医学图文数据的自动化流水线系统。这个系统的目标不是做一个一次性的数据集,而是搭建一套可以持续运转、不断更新、像工厂一样稳定产出高质量医学图文数据的基础设施。
---
一、流水线的五道工序:从"乱石堆"到"精炼矿"
要理解MedPMC的运作方式,不妨把它比作一条食品加工厂的流水线。原材料是从PMC数据库里收集来的海量图片和文字,最终产品是经过层层筛选、清洗、分装的高质量医学图文配对数据。整条流水线共分五个工序,每道工序各司其职。
第一道工序叫"初步筛选"。在把图片真正下载到服务器之前,系统先阅读每张图片对应的文字描述——包括图注和论文正文中提及该图的相关句子——然后用一个专门训练的文本分类器来判断:这张图片可能是医学相关的吗?这个设计非常聪明,因为下载数百万张图片既耗时又耗存储空间,如果能在下载之前就把明显不相关的内容过滤掉,可以节省大量资源。这个文本分类器以PubMedBERT为基础(一种专门在医学文献上预训练的语言理解模型),同时输入图注文字和论文正文中的引用语句,比单独使用图注的效果要好得多。系统从610多万篇PMC开放获取论文中——其中约510万篇持有允许再分发的开放许可证——筛选出了370万个候选图文对,F1分数达到93.2,而之前同类方法使用关键词匹配的F1分数只有61.7,差距相当悬殊。
候选图片下载完成后,进入第二道工序:"拼图检测"。这道工序要解决的问题是:这张图片是一张完整的单图,还是把多张小图拼合在一起的"拼盘"?如果是前者,可以直接进入后续流程;如果是后者,就需要先把它拆开。系统训练了一个图像分类器来做这个判断,最终识别出310万张拼合图,以及60万张单独图片,F1分数达到96.5。
第三道工序是"拆图"。对于被认定为拼合图的310万张图片,系统要精确地找到每个子图的边界,把它们一一切割出来。这个工作类似于把一张大拼图照片上的每一块小拼图单独截取下来,需要精确定位每块的边框位置。研究团队训练了一个基于YOLOv10的目标检测模型来完成这项任务,平均每张拼合图被分解出9.2个子图,310万张拼合图最终产生了2900万个子图,mAP(检测精度指标)达到89.8。
第四道工序可能是整条流水线中技术含量最高的一步:"文字对齐"。拆图之后,每个子图有了,但对应的文字说明在哪里?原始图注通常是一段连续的文字,比如"A:患者术前MRI图像。B:手术切除标本的大体外观。C和D:显微镜下的病理切片,分别显示肿瘤细胞的浸润情况。"——这段文字需要被切分成若干段,然后每段分别对应回A、B、C、D四个子图。这个任务被称为"caption separation and alignment"(图注分割与对齐)。研究团队创新性地将这一步骤交给了一个多模态大语言模型(InternVL-2.5-4B)来完成,而不是像以前的方法那样先切分文字再用规则匹配。这个模型同时看到整张拼合图、所有子图和完整图注,然后直接输出每个子图对应的文字说明,这样可以更好地理解图文之间的语义关系。最终F1分数81.4、ROUGE-L分数85.3,大幅超越了之前最好的方法(F1仅48.5),甚至比GPT-4直接做这个任务的表现(F1为75.2)还要好。经过这道工序,获得了1250万个子图-子图注配对。
第五道工序是"最终医学鉴定"。经过拆图和文字对齐的子图中,仍然可能混有流程图、示意图、实验装置图等非医学内容。于是系统再用一个图像分类器逐一判断每张子图是否属于医学图像,最终保留了730万张符合要求的医学子图-子图注配对,F1分数同样达到96.5。
加上前面保留的310万张拼合图-图注对(作为整体保留)和60万张单独图片-图注对,MedPMC最终产出约1100万个医学图文配对数据,涵盖放射科、眼科、病理科、皮肤科、内镜、显微镜等多个临床领域,以及裂隙灯照片、皮肤照片、大体病理照片、血管造影、PET/SPECT、功能性MRI等在公开AI数据集中相对少见的影像类型。
---
二、数据质量验证:让五位评审员"挑刺"
光靠机器指标说话还不够,研究团队还请来了五位人工评审员——其中两位是住院医师,一位是即将毕业的医学生——对最终数据集的质量进行人工抽查。为了对比,他们同时抽查了BIOMEDICA数据集(目前同类数据集中规模最大的之一,共2400万图文对)。
结果差异相当显著。在BIOMEDICA随机抽取的样本中,80.3%的图片属于非医学内容,其中光是统计图表就占了42%。而在MedPMC的抽查样本中,非医学图片只占4.7%,也就是说95.3%的图片是真正医学相关的内容。这个对比很能说明问题:MedPMC虽然在数量上不如BIOMEDICA(1100万 vs 2400万),但在"每张图片有多大用处"这件事上,胜出幅度相当明显。
更细化的分析显示,MedPMC中占比最多的类别依次是:非病理性显微镜图像(31.9%)、病理图像(26.6%)、放射科图像(25.6%),以及各类临床摄影(6.2%)和眼科图像(2.3%)。放射科图像中,MRI占31.7%,CT占23.4%,X光片占15.1%,其余包括超声、PET/SPECT、功能性MRI、血管造影和乳腺X线摄影。这种分布基本反映了医学文献中各类图像的实际比例。
从时间维度来看,MedPMC的另一个重要特点是"可持续生长"。研究团队统计了从2014年到2023年间,每年从PMC论文中能识别出的图文对数量。数字从2014年的不到50万对,稳步增长到2021年的超过120万对,再到2022年的近135万对。自2020年起,这套流水线每年能从新发表的论文中额外识别出超过100万个医学图文对,这意味着数据集不会因为时间流逝而过时,而是会随着医学文献的增长持续扩充。团队计划每六个月发布一次更新版本,与PMC数据库的更新节奏保持同步。
---
三、把数据喂给AI:训练一个"医疗眼"
有了高质量的数据,下一步是验证它能不能真正帮助AI学习医学知识。研究团队用MedPMC训练了一个叫做MedPMC-CLIP的模型——CLIP是一种能够同时理解图像和文字的模型架构,可以学会"把图片和对应的文字描述配成一对"。
为了保证对比的公平性,研究团队做了一个非常关键的设计决定:他们使用与对比基准模型BMC-CLIP完全一样的模型架构、初始权重、训练配置和超参数,唯一的变量就是把BMC-CLIP使用的BIOMEDICA 2400万数据换成MedPMC的1100万数据。这就像用同一套模具、同一位厨师、同样的烘烤时间,只是换了面粉原料,然后比较烤出来的蛋糕口感有没有差异。
测试结果在26个公开医学基准数据集上展开,覆盖11个医学专科,包括肺炎检测、糖尿病性视网膜病变分级、淋巴结转移检测、结肠癌检测、皮肤病分类、心衰分类等一系列临床实际任务。评估结果用三个指标衡量:准确率(答对了多少)、F1分数(综合考虑漏报和误报的综合精度)、AUC(区分阳性和阴性的能力,满分100)。
MedPMC-CLIP在全部26个基准上的平均表现均超越了所有对比模型。与最直接的对比对象BMC-CLIP相比,MedPMC-CLIP的专科宏平均准确率提升了7.1个百分点(95%置信区间6.0到8.2),F1分数提升了10.5个百分点(95%置信区间9.2到11.6),AUC提升了7.1个百分点(95%置信区间6.3到8.0)。这些差距是通过10000次自助法重抽样统计得出的,具有很强的统计可靠性。从专科分布来看,MedPMC-CLIP在11个专科中的10个都超过了BMC-CLIP,说明这种提升不是某一个领域的偶然现象,而是跨领域的系统性改进。而这一切都是用不到一半的训练数据量实现的。
在与其他医学AI模型的比较中,MedPMC-CLIP同样表现出色,超越了PMC-CLIP、BiomedCLIP、MedSigLIP、OpenCLIP和CoCa等多种架构的基准模型。
---
四、给"大脑"换个更好的"眼睛":多模态语言模型实验
CLIP类模型主要负责"看图识字",但医疗AI的终极目标往往更复杂——不只是识别图片,还要回答关于图片的问题,做出诊断判断,生成描述报告。这类任务需要更强大的多模态大语言模型(MLLM)。
研究团队在这方面也做了一个受控实验。他们采用了LLaVA-Med这套医疗多模态大语言模型的训练框架,这个框架连接了一个视觉编码器(负责"看图"的部分)和一个语言模型(负责"说话和推理"的部分)。实验设计同样严格控制变量:保持语言模型、训练数据、训练流程完全不变,只是把原来的视觉编码器替换成MedPMC-CLIP,然后测试这个替换能不能让整个系统在医疗问答任务上表现得更好。
测试在两个广泛使用的医疗视觉问答基准上进行。MMMU(医学子集)是一个涵盖30个领域的综合性题目集,提问方式往往需要综合临床知识和图像理解,研究中使用了其中314道包含单张图片的临床医学题目。OmniMedVQA则是一个更专注于图像视觉理解的数据集,最终评测使用了来自38个开放数据集的3593道题目。
换上MedPMC-CLIP之后,OmniMedVQA上的准确率从36.2%跃升到53.1%,提升了16.9个百分点(95%置信区间14.9到18.7),这是一个非常显著的进步。MMMU(医学子集)上也有1.9个百分点的提升,但置信区间包含零,说明这部分提升在统计上尚不确定。
进一步分析OmniMedVQA中各类问题的表现,可以更清楚地看出改进从哪里来。影像模态识别(比如判断一张图是X光还是CT)的准确率从46.9%提升到75.2%,提升了28.3个百分点;解剖结构识别从34.7%提升到57.0%,提升了22.3个百分点;疾病诊断与病变分级从34.2%提升到45.4%,提升了11.1个百分点。这说明,更好的"眼睛"(视觉编码器)确实能让整个AI系统在需要视觉理解的任务上表现更好,而对于MMMU里那种需要大量临床推理知识的题目,光换眼睛还不够,还需要更好的语言理解能力和更强的推理训练。
---
五、走出实验室:在真实患者数据上的检验
论文里最打动人的部分,或许不是那些亮眼的基准数字,而是研究团队拿真实患者数据进行的临床验证实验。
研究团队与耶鲁-纽黑文医疗系统(YNHHS)合作,获取了来自多个医院皮肤科门诊的10524张患者皮肤照片(经过伦理委员会审批)。他们设计了一个模拟临床决策支持场景的检索任务:给定一段描述皮肤形态特征的文字(比如"紫癜性丘疹汇聚成斑块"),让AI从这10524张患者照片中检索出视觉上最相似的图片。这种"以文搜图"的场景在皮肤科有很强的临床价值——医生在遇到不熟悉的皮损时,如果能快速找到形态相似的已知案例,对诊断有一定参考意义。
为了让评估更贴近临床实际,研究团队还做了一个细致的处理:原始的皮损文字描述来自临床记录,用词往往不统一。他们用一个大语言模型将这些描述统一映射到SkinCon皮肤病标准分类体系的标准术语(比如丘疹、斑块、斑疹、红斑等),然后以"检索到的图片是否包含与查询词对应的皮损特征"作为正确答案的判定标准。这个设计允许多张图片同时作为正确答案,比单一精确匹配更合理。
结果显示,MedPMC-CLIP在Recall@1(检索结果第一位就是正确答案的比例)上比BMC-CLIP提升了3.4个百分点,Recall@5(前五位中有正确答案)提升了11.7个百分点,Recall@10提升了10.7个百分点。11.7个百分点的提升对于一个检索系统来说相当可观——这意味着平均每100次查询中,有约12次原本找不到合适参考图片的情况,现在能找到了。
更有意思的是研究团队对这个结果的深层分析。他们想弄清楚:来自学术论文的MedPMC皮肤病图片,和真实临床环境中拍摄的患者皮肤照片,在视觉特征上到底有多接近?他们用一个叫DINOv2的视觉特征提取模型,分别计算了MedPMC皮肤病图片、Fitzpatrick17k数据集、SCIN数据集和DermNet数据集与YNHHS临床照片之间的视觉距离。
结果出乎意料:MedPMC皮肤病图片与真实临床照片的视觉距离最近,中位余弦距离为0.239,而Fitzpatrick17k为0.262,SCIN为0.270,DermNet为0.299。在将每张临床照片与四个外部数据集中所有图片的最近邻进行比较时,有51.5%的临床照片的最近邻来自MedPMC,而Fitzpatrick17k仅占21.2%,SCIN占20.7%,DermNet只占6.5%。UMAP降维可视化进一步显示,YNHHS临床照片的视觉分布空间广泛,MedPMC皮肤图片能广泛覆盖这个空间,而其他三个专门的皮肤病数据集却存在明显的覆盖空白。这个发现给出了一个有趣的解释:医学文献中包含了丰富多样的真实皮肤状态记录,其视觉多样性甚至超过了一些专门构建的皮肤病图片数据集。
---
六、研究的局限与未来方向
任何严谨的研究都不会回避自身的局限性,这项研究也不例外,而且研究团队对此的讨论相当坦诚。
首先,MedPMC目前只处理图片和文字两种信息类型,而真实临床场景还涉及结构化的实验室数值、心电图波形、纵向随访记录等多种数据形式。虽然部分数据类型(如表格)理论上可以用类似方法从文献中提取,但纵向患者记录这类数据在公开文献中几乎无法获取,需要另寻出路。
其次,来自医学文献的图片和真正的临床常规图片之间存在系统性差异。发表在论文里的图片往往是精心挑选的典型案例,可能过度代表了"好看"的、"有教学价值"的、"结果阳性"的情况,而低估了临床常见的模糊、复杂、非典型情况。此外,文献图片的采集设备、拍摄角度、后期处理方式也与日常临床摄影有所不同。这些偏差会在一定程度上影响模型在实际部署中的泛化能力。
再者,尽管研究团队在选择评估基准时尽量避免了直接来自PMC文献的数据集,并在临床评估中使用了完全独立的YNHHS患者数据,但大规模预训练数据与公开评估基准之间的潜在重叠问题在当前整个AI评估领域都是未解难题,这项研究也无法完全规避。
研究团队还明确指出,临床验证的结果并不意味着MedPMC-CLIP已经可以直接部署到医院。皮肤病图像检索实验是一种"表征学习质量"的探针,而不是一个完整的临床工具评估。从预训练模型到真正临床可用的系统,中间还需要经过目标机构数据的微调、临床医师参与的评估循环和严格的医疗器械审批程序。
---
归根结底,MedPMC解决的是一个"数据基础设施"问题,而不仅仅是一个数据集发布问题。研究团队把整个处理流水线的代码、每个阶段的训练模型、各阶段的评估基准都一并公开发布,这意味着其他研究者可以完整地重现、审查、改进甚至替换其中的任何一个环节。随着新的医学文献不断涌现,这套流水线会持续运转,预计每年额外产生超过100万个新的医学图文配对,让数据集保持与时俱进。
医疗AI的发展从来不只是算法的竞赛,更是数据质量的竞赛。一个能做到95%医学相关率的1100万图文对,在很多下游任务上击败了一个只有约20%医学相关率的2400万图文对——这个事实清楚地说明,"少而精"在这个领域有时候比"多而杂"更管用。当然,这并不是说数量不重要,而是说当数据质量低到一定程度时,继续堆量只是在放大噪音。
对于普通人来说,这项研究最直接的意义在于:它为医疗AI系统的开发提供了更坚实的数据地基。一个皮肤科AI助手能更准确地识别你皮肤上的异常;一个放射科AI在读取你的CT片时能更可靠地标注可疑区域;一个多模态医疗助手在回答你的健康问题时能更好地结合图像证据——这些都需要从高质量的训练数据开始。MedPMC想做的,就是让这个起点更稳固一些。有兴趣深入探索技术细节的读者,可以通过arXiv编号2607.07673查阅完整论文,研究团队发布的数据和代码也可以通过耶鲁大学陈实验室的GitHub主页找到。
---
Q&A
Q1:MedPMC和BIOMEDICA这类已有的医学图文数据集相比,优势到底在哪里?
A:核心差距在于数据质量,尤其是"医学相关率"。人工抽查显示BIOMEDICA里约80%的图片是图表、流程图、分子结构式等非医学内容,而MedPMC经过五道过滤工序后,医学相关图片占比达到95.3%。此外MedPMC还专门处理了拼合图——把多张小图合并成一张的情况——将图片和对应文字说明精确匹配到子图级别,大幅改善了图文对的对应质量。数量上MedPMC虽然少于BIOMEDICA,但在多个下游任务上用不到一半的数据取得了更好的效果。
Q2:MedPMC-CLIP和LLaVA-Med分别是什么,两者有什么关系?
A:MedPMC-CLIP是一种视觉-语言对齐模型,通过对比学习让图片表示和文字描述在特征空间中彼此靠近,主要擅长图像分类和图文检索。LLaVA-Med是一种多模态大语言模型,能够接收图片和问题然后生成文字回答,更擅长医学视觉问答。两者的关系是:MedPMC-CLIP训练出的视觉编码器可以作为LLaVA-Med的"眼睛"部分,研究发现换用更好的视觉编码器后,LLaVA-Med在视觉理解相关的医学问答任务上提升了最高16.9个百分点。
Q3:MedPMC的皮肤病图像检索实验说明了什么临床价值?
A:这个实验模拟的是医生在遇到不熟悉的皮损时,通过描述皮损特征来检索相似病例照片的场景,在辅助诊断和医学教学中有实际应用价值。实验结果显示,MedPMC-CLIP在从约一万张真实患者皮肤照片中检索正确案例时,前五名命中率比对比模型提升了11.7个百分点。更有趣的是,来自学术论文的MedPMC皮肤图片在视觉上比三个专门的皮肤病公开数据集都更接近真实临床照片,说明医学文献图片蕴含着超出预期的临床视觉多样性。
好文章,需要你的鼓励
这项联合研究发现,将Muon优化器应用于强化学习智能体训练时,搭配合适的步骤级信用分配机制,可使任务成功率提升88%,揭示了优化器与评分机制需协同设计的新方向。
本文介绍了CPO方法,通过让AI将自身回答与参考答案对比,在词级别识别推理对错,从而提供比熵更精准的强化学习训练信号,数学推理性能提升高达8.5%。
RAGU是一个多步骤知识图谱增强生成系统,配套7B参数的Meno-Lite-0.1模型,通过两段式抽取和去重整合构建高质量知识图谱,在综合推理任务上超越HippoRAG 2,成本仅为商业API的百分之一。