由美国国立卫生研究院 (NIH) 资助的一个研究团队开发了一种多功能机器学习模型,该模型未来有望极大地扩展医学扫描对疾病的诊断能力。科学家们利用名为 Merlin 的工具评估了三维腹部计算机断层扫描 (CT)图像,其任务范围从识别解剖特征等简单任务到提前数年预测疾病发作等复杂任务均能胜任。尽管 Merlin 最初是作为通用 CT 模型开发的,但在专门设计的任务中,它却超越了众多类似的自动化工具。
由美国国立卫生研究院 (NIH) 资助的一个研究团队开发了一种多功能机器学习模型,该模型未来有望极大研究团队利用斯坦福大学医学院收集的一组独特的患者CT扫描数据训练模型,这些数据与放射学报告和医疗诊断代码相关联。研究人员指出,这是迄今为止规模最大的腹部CT数据集。
“像这样丰富的数据集对于拓展人工智能模型在医学领域的应用极限至关重要,”美国国立卫生研究院(NIH)下属国家生物医学影像与生物工程研究所(NIBIB)所长布鲁斯·特罗姆伯格博士表示,“这项工作充分展现了精心构建的训练数据如何能够带来卓越的洞见,从而显著简化工作流程并辅助临床决策。”
CT扫描是一种常见的医学影像检查方法,通常在医疗评估的早期阶段进行。为了做出诊断,放射科医生必须解读结果,而且通常还需要进行其他检查和临床评估。这一过程本身就比较耗时,而考虑到美国医生日益短缺的问题,情况就更加复杂了。
“有了 Merlin,你就可以超越传统的放射学,直接从影像诊断得出可能的诊断结果。而这仅仅是其中一个潜在用途,”共同第一作者路易斯·布兰克迈尔博士说道,他在斯坦福大学攻读研究生期间完成了这项研究。
Merlin 代表了一类新的模型,通常被称为基础模型,它们使用大规模的、未标记的数据集进行训练,这些数据集涵盖多种类型的信息。
在这项新研究中,研究人员对 Merlin 进行了六大类活动的测试,涵盖了 750 多项涉及诊断、预后和质量评估的独立任务。
为了让 Merlin 能够胜任各种任务,研究人员首先利用其临床数据宝库对其进行训练。该宝库包含超过 15,000 张 3D 腹部 CT 扫描图像及其对应的放射学报告,以及近百万个诊断代码。Merlin 利用这些信息作为学习材料,掌握了视觉数据和文字数据之间的关系。
研究人员随后对 Merlin 进行了测试,测试对象是来自四家不同医院的 50,000 多张以前从未见过的腹部 CT 扫描图像,以了解他们的模型与人类对每张扫描图像得出的结论的吻合程度。
“Merlin 能够直接处理一些任务,例如预测诊断代码,而其他更复杂的任务,例如从头开始起草放射学报告或在 3D 空间中识别和勾勒器官,则需要额外的训练,”共同第一作者、斯坦福大学研究生 Ashwin Kumar 说。
该团队还部署了针对每种任务类型的最先进模型,作为比较点。
在平均 692 个不同的诊断代码中,Merlin 预测两个扫描结果中哪一个更有可能与特定代码关联的准确率超过 81%,优于其他两个模型的几种变体。对于 102 个代码的子集,Merlin 的准确率提升至 90%。
在另一个类别中,该团队让 Merlin 仅根据 CT 扫描来预测健康患者慢性疾病(如糖尿病、骨质疏松症和心脏病)的发生。
研究作者发现,在比较不同受试者的扫描结果时,Merlin模型能够以75%的准确率识别出未来五年内罹患特定疾病风险较高的患者,而其他模型的准确率仅为68%。布兰克迈尔解释说,这些发现表明该模型能够检测到人眼可能忽略的扫描关键特征,这意味着该工具可能有助于识别新的疾病生物标志物。
研究人员进一步增加了难度,让 Merlin 解读胸部 CT 扫描图像——胸部完全不在其 CT 研究对象之列。Merlin 识别疾病普遍特征的独特能力使其表现与仅接受胸部扫描图像训练的模型相当甚至更优。
尽管Merlin功能全面,但在所有任务中,它的表现都超越或媲美了专业模型。作者将Merlin的卓越性能归功于其架构和训练数据,使其能够处理复杂的3D扫描数据,并在视觉信息和文字信息之间建立关联。
研究人员对他们的方法寄予厚望,希望它能利用先前的先例,很快获得监管部门的批准,用于更简单的任务,但他们也计划改进 Merlin,以更好地应对更复杂的挑战,例如撰写报告。
虽然该工具本身功能强大,但他们鼓励用户使用自己的数据对模型进行微调,以满足其特定需求。
“我们的模型和数据将为学术界提供一个强大的基础架构,”资深作者、斯坦福大学放射学和生物医学数据科学教授阿克谢·乔杜里博士说。“从这里出发,未来发展潜力无限。”
参考文献
Merlin: A Computed Tomography Vision Language Foundation Model and Dataset