讨论机器学习算法(MLA)是否可以在基底神经节区出血(BGH)后7天内实现有效的死亡风险分层。
脑出血(ICH)是一种致死性的神经外科急症,其中基底神经节是最常见的部位,占50-70%。不到50%的患者在出血后30天内死亡,30%的幸存者有不同程度的残疾,只有12-39%的患者能够在手术后独立生活6个月。风险分层是医疗实践的核心,医疗服务提供者需要进行风险分层和识别高危患者。到目前为止,准确的决策通常是耗时的,而快速的决策往往是不准确的。缩短决策过程的时间最终意味着挽救生命和改善预后的干预措施可以比历史上看到的更快地满足需求。基于大数据的机器学习算法(MLA)被越来越多地应用于预测模型的开发、疾病诊断和危险因素的识别。像其他传统的临床模块,神经学家开发了一些传统的评分系统根据脑出血患者的基本特征,如ICH评分,急性生理和慢性健康评估(APACHE),甚至格拉斯哥昏迷量表(GCS)评分评估患者院内死亡率。但评分结果需要由有经验的放射科医生和/或神经学家进行评估,因此,他们会受到医生的临床经验的影响。在半个多世纪以来基于数据挖掘和MLA的预测一直是焦点。各种机器学习(ML)模型已被应用于脑血管疾病、神经退行性疾病、癫痫发作、癌症转移和COVID-19预测。目前,大量研究利用MLA构建和验证疾病预测模型,证明MLA在临床疾病管理和决策中起着积极的辅助作用。然而,通过使用MLA检查临床特征来分层BGH患者的预后的文献却较少。评估早期死亡的风险是决定治疗方案和判断预后的第一步。对于现有的临床决策,我们的研究旨在开发保守治疗模型和手术治疗模型,对BGH患者7天内死亡风险进行分层,与临床实践中其他评分系统相比,提供一种有前途的早期预测方法。
我们提出了一个针对BGH风险分层问题的分析框架(图3)。它包括三个步骤:数据预处理、模型构建和可解释性分析。数据清理、向量编码和数据重采样是应用于原始数据的基本方法。我们使用预处理后的平衡数据作为模型构建训练输入。将数据集按7:3分为训练集和测试集。我们使用Boosting和Bagging方法建立的标准ML模型,及与标准ML模型集成的融合ML模型,以提高风险分层的性能,并提供有效的临床指导。最后,我们选择了两种性能较好的模型来进行风险分层的可解释性分析。

共纳入1383例BGH患者,分为保守治疗组(CTG)和手术治疗组(STG)。在CTG中,Stack模型的灵敏度最高(78.5%)。在STG中,Wight-Stack模型达到58.6%灵敏度和85.1%特异度,XGBoost达到61.4%的灵敏度和82.4%的特异度。SHAP算法显示,CTG的预测首选特征是意识、出血量、院前时间、向脑室破裂、脑疝、术中失血量。XGBoost、Stack和Wight-Stack模型结合可以对BGH患者进行高性能的风险分层。这些ML分类器可以帮助临床医生和家庭在紧急入院和获取医疗护理和护理信息时及时识别风险状态。
通过观察所有符合纳入标准的患者的生存时间,我们发现在发生BGH后的第5天和第7天,死亡率突然下降(图1)。

图1:基底节出血患者死亡时间分布。右上角显示了研究对象后30天内的死亡情况。我们使用BGH后的生存时间是否大于7天作为低风险和高风险的标准(图2)。

图2:研究纳入和排除的流程图。
表1显示了CTG和STG中所有模型的AUC/ROC和AUC/PR。在测试结果中,对于STG的风险分层,模型(AUC/ROC:0.696-0.820,AUC/PR:0.231-0.361)的风险分层性能普遍低于CTG(AUC/ROC:0.906-0.925,AUC/PR:0.576-0.662)(表1)。

表2给出了CTG和STG风险分层的模型性能及95%可信区间(CI)。为了保证模型的整体准确性,我们打算进一步阐明高危样本,特别是错误分类的高危样本。在检测高危患者的能力方面,CTG中的Stack模型的敏感性最高,为78.5%。在STG中,尽管我们需要关注高危样本,LR比XGBoost(61.4%)具有较高的灵敏度(69.1%),但与XGBoost(特异度82.4%,准确率80.5%)相比特异度(48.4%)和准确率(50%)更低。


群体层面分析。图5a和图b提供了使用XGBoost和Stack模型报告的CTG风险分层特征的详细视图。在人群水平上,两种模型都发现入院时患者意识差、ABC/2法血肿体积大、从发病到入院时间短、血肿破入脑室、存在脑疝是决定高危分层的最重要特征(图5a和b)。年龄、hsCPR、脉搏和血压等特征是风险分层中相对较弱的因素(图5a)。对于手术治疗组,图5c和d显示了部分不同的观点。首先,XGBoost和Stack模型考虑高术中失血量、高hsCRP、意识水平差和高血压是预测风险增加的最重要特征,而术中输液量、脑疝和ABC/2法血肿量也发挥重要作用(图5d)。值得注意的是,肺部感染组存在低风险分层的趋势(图5b,d),这取决于与其他特征的结合。

图5. XGBoost和Stack模型风险分层的总体SHAP解释。XGBoost使用树形模型解释方法,Stack模型使用Kernel解释方法。(a,c):对所有特征按重要程度进行排序,并显示前20个特征。(b,d):分别显示特征与风险分层结果的相关性。每个点都是一个样本,红点代表该特征高值,蓝点代表该特征低值,SHAP负值表示风险概率降低,正值表示风险概率增加。
个体层面分析。在整体的基础上,我们也可以为个体层面的风险分层提供解释。例如,在CTG的高风险例子中,血肿体积增大和入院时意识昏迷显著增加了预测的风险,即使血红蛋白水平正常和无脑疝也不能阻止这一趋势(图6a)。相比之下,在STG的高风险病例中,血肿破入脑室、高血压和术中失血量的增加增加了7天内的死亡风险(图6b)。这允许对个别患者的风险预测进行临床解释。

图6. 基于个体患者预测评分的SHAP力图。(a) CTG中的低风险和高风险实例。(b) STG中的低风险和高风险实例。基值为模型预测的平均Shap值,红色和蓝色方向条分别表示危险和安全特征;条的长度表示特征的重要性,它们共同驱动预测从基值到终值。图中显示的Shap值是真实预测概率的对数。
研究结论:
这些ML分类器可以帮助临床医生和家庭在紧急入院和获取医疗护理信息时及时识别风险状态。

识别二维码,前往徐如祥 教授学术主页
查看更多精彩内容
教授,博士生导师
上海交通大学计算机系硕士,香港理工大学电子计算学系博士,后在美国密歇根州立大学从事博士后研究,2012年回国加入四川大学,2019年8月起援藏担任西藏大学信息科学技术学院副院长、学科带头人
长期从事生物特征识别和计算机视觉领域的研究,近期的研究兴趣主要包括三维建模与识别及其在刑事科学、视频监控、医疗保健、人机交互等领域的应用,目标检测与识别及其在生态调查、动物保护、群体分析等方面的应用
已发表学术会议及期刊论文80余篇,包括CVPR、ECCV、AAAI、ICB、PR、IEEE TPAMI、IEEE TIFS等,出版计算机视觉相关专著和译著2部,已获授权美国专利一项、中国专利五项
长期担任领域内知名期刊及会议的审稿人,如IEEE TPAMI、IEEE TIFS、PR、PRL、ICCV、CVPR、ECCV、AAAI、ICIP和ICPR等