Py学习  »  机器学习算法

5.9/Q1,利用深度学习、机器学习和统计方法进行生存建模:对住院后死亡率预测的比较分析

Med-MIMIC • 2 月前 • 148 次点击  

欢迎扫码

关注我们

关注我们

01

引言

"你是否想过,医院里每一声心跳、每一次呼吸、每一份病历,都可能隐藏着拯救生命的密码?今天,我们要揭秘一个‘医疗界的宝藏数据库’——MIMIC!它收录了全球数万重症患者的真实临床数据,从心电图到用药记录,从实验室指标到影像报告,堪称医学研究的‘金矿’。


无论是医生、科研人员,还是对医疗大数据感兴趣的你,MIMIC都可能成为突破瓶颈的关键。但如何从海量数据中提取价值?如何避开常见‘坑’?这篇文章,我们将带你从零开始探索MIMIC,揭开它的神秘面纱,甚至分享一个‘小白也能上手’的分析技巧!


02

文献解读

标题利用深度学习、机器学习和统计方法进行生存建模:对住院后死亡率预测的比较分析

发表期刊Health Data Sci

发表日期:2026年4月20日

影响因子5.9/Q1


03

研究背景

生存分析对于研究事件发生时间结果和动态理解事件发生概率至关重要。从传统统计模型到最先进的机器学习算法,各种生存分析技术支持医疗干预和政策决策。然而,关于它们的比较性能仍有持续讨论。


04

研究方法

我们对多种生存分析方法进行了比较研究,包括加速失效时间、Cox比例风险(CoxPH)、逐步CoxPH、弹性网惩罚Cox模型、随机生存森林、梯度提升机器学习、AutoScore-Survival、DeepSurv、基于神经网络的时间依赖Cox模型以及DeepHit生存神经网络。我们应用了一致性指数(C-index)进行模型辨别,采用集成Brier评分(IBSs)进行校准,并考虑了模型的可解释性。预测表现独立评估了2017年至2019年新加坡总医院(SGH)住院数据集及MIMIC-IV临床数据库(MIMIC-IV)中的亚洲患者。结果是基于患者人口统计学、临床病理特征和历史数据预测90天的全因死亡率。


05

研究结果


01

患者特征

我们对研究队列的基线特征进行了统计描述,帮助识别可能影响90天全因死亡率预测的关键因素,从而提高模型的预测准确性。本研究纳入了SGH中60个变量,这些变量通常适用于急诊入院患者,包括43个连续变量和17个类别变量(见表S1)。最终纳入了124,873例住院发作,其中训练队列87,412例,验证队列12,487例,测试队列24,974例。整体人群的Kaplan–Meier曲线如图所示。2. 纳入的发作中,112,118例(89.8%)在指定90天观察期结束时被审查后存活超过90天。相比之下,12,755例(10.2%)发作在90天内发生死亡事件,中位死亡时间为28天[四分位区间(IQR):11至53]),平均死亡时间为34天(标准差:25.7)。表S2总结了不同事件状态下的候选变量。连续变量以均值和标准差或中位数与IQR的形式呈现。学生t检验用于检验遵循正态分布的连续变量,而Mann–Whitney U检验用于非正态连续变量。类别变量以计数和百分比表示,并使用卡方检验或Fisher精确检验进行检验。不同事件状态之间的特征存在统计学上显著差异。不失一般性,我们主要报告SGH数据的结果,对应的MIMIC-IV结果包含在表S3和S5及图1中。S1。

02

变量选择与重要性

我们报告变量选择结果,并提供了变量重要性以探讨模型的可解释性。表2展示了Cox模型对所有变量的单变量和多变量分析结果。通过单变量分析,观察到嗜碱性粒细胞绝对计数、总血细胞计数、风湿病、瘫痪和无慢性并发症的糖尿病在0.001水平时未表现出统计显著性。除上述变量外,所有变量均可视为住院患者的风险因素。因此,仅基于以下条件选择简约模型。价值具有挑战性。基于AFT模型的效应如图所示。S2。

03

性能比较

为了比较SGH和MIMIC-IV数据集上所有预测算法的性能,我们在表3中报告了所有使用完全隔离训练队列的同一测试队列算法的C指数和IBS的平均值、标准误差(SE)和95%置信区间(CI)。此外,表S8总结了每个模型的次要属性,以指导现实世界应用中的模型选择。

04

模型可视化

为评估不同模型表现的统计显著性,我们进一步对C指数和IBS指标进行了最佳多重比较(MCB)检验[41]。MCB图旨在实现模型的可视化,为选择合适模型增添了极高的临床应用价值。如图所示。基于SGH和图3。基于MIMIC-IV的4,面板(A)和(B)对应使用所有变量的模型,面板(C)和(D)对应具有变量选择的模型。我们为每种方法模拟20个具有特定均值和置信区间的观测值。该非参数检验计算性能指标的平均排名和临界距离。对于使用所有变量的模型,MCB结果显示DeepSurv在C指数和IBS指标方面表现最佳,无论是在SGH还是MIMIC-IV中。对于使用变量选择的模型,见图。基于SGH的3显示GBM表现出最佳的判别能力,而RSF则展现出稳健校准。然而,在图中。基于MIMIC-IV的4,观察到AutoScore-Survival展现出最佳的辨别和校准能力。表现最佳模型的关键区域(阴影区域)代表测试的参考值。具有关键区域与参考值重叠的模型不会表现出统计学上显著的性能差异,而关键区域高于该值的模型则明显低于表现最佳的模型。例如,在图中。3C,GBM模型与逐步CoxPH模型之间的显著重叠表明,尽管名义排名存在差异,判别能力没有统计学上显著差异。这一发现强调了更简单且易于解释的统计模型可以与复杂的机器学习模型保持竞争力。

06

文章小结

所有生存模型在预测住院后死亡率方面均表现令人满意。本研究基于不同模型的特性提出了选择建议。


END

往期推荐



6/Q1,强化学习以优化有创机械通气患者呼吸机设置


5.4/Q1,动态列线图预测急性肝功能衰竭患者的脓毒症风险

5.3/Q1,老年脓毒症患者乳酸与 28 天死亡率之间的关联

5.1/Q1,基于MIMIC-IV数据库的回顾性队列研究




Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/195498