
这不是"AI辅助影像"的老故事
过去我们谈AI在核医学的应用,大多停留在:
这篇研究的颠覆性在于:
ChatGPT没有看图像,仅凭文字描述的PET/CT发现+临床病史,就能给出与专家高度一致的诊断结论。
近期,一篇聚焦核医学与大语言模型交叉应用的研究正式发表,引发影像与AI领域关注。该研究比较了 ChatGPT-4o、ChatGPT-5 与核医学专家在脑 [¹⁸F]FDG-PET/CT 神经变性疾病解读 中的诊断一致性。结果显示,在仅提供临床信息 + 报告中的影像文字描述、不提供原始图像的前提下,ChatGPT-4o 与 ChatGPT-5 对主诊断的识别率分别达到 86% 和89%。这意味着,围绕核医学文本报告的AI辅助解释,已经从概念讨论进入可量化比较阶段。
研究设计方面,作者回顾性纳入100例 因疑似神经变性疾病接受脑 [¹⁸F]FDG-PET/CT 的病例,将 ChatGPT-4o 与 ChatGPT-5 基于 文本化临床信息和影像描述 所生成的结论,与核医学专家最终报告进行比较。评分采用预设的五级一致性量表,从1.0(完全一致) 到0.0(完全不一致)。
研究还评估了可重复性。在每个模型随机抽取的
20例重复测试子集中,使用相同提示词、清空会话历史后重新输入病例。结果显示:
作者解释称,ChatGPT-5 虽然“完全一致率”更低,但较高的 κ 值提示其多数差异仅为 一个等级的轻度波动,而非明显失稳。但是需要注意的是:ChatGPT-5虽然整体表现更好,但同一病例重新输入,结果不一致的概率高达45%。
临床意义:如果AI今天说"阿尔茨海默病可能",明天说"路易体痴呆待排",医师和患者如何应对?
此外,研究指出,两个模型在 代谢模式较典型 的病例中表现更好,例如阿尔茨海默病常见的后扣带和顶叶低代谢模式;而在 代谢模式不典型、混合、重叠或差异诊断范围较广 的复杂病例中,表现明显下降。
这还只是"裸奔"的通用模型。如果针对核医学专科微调,结果会更好。
89%的一致性,是AI的及格线,却是核医学专家的警示线。
当通用大模型未经专业训练就能接近人类专家水平时,真正的竞争不是"人 vs AI",而是"会用AI的人 vs 不会用AI的人"。
核医学的未来,不属于最会读图的医师,而属于最懂得整合AI能力与临床智慧的决策者。
https://www.ejrai.com/article/S3050-5771(26)00032-0/fulltext

精彩推荐:
↓↓ 欢迎进入鼎湖学堂