我们对研究队列的基线特征进行了统计描述,帮助识别可能影响90天全因死亡率预测的关键因素,从而提高模型的预测准确性。本研究纳入了SGH中60个变量,这些变量通常适用于急诊入院患者,包括43个连续变量和17个类别变量(见表S1)。最终纳入了124,873例住院发作,其中训练队列87,412例,验证队列12,487例,测试队列24,974例。整体人群的Kaplan–Meier曲线如图所示。2. 纳入的发作中,112,118例(89.8%)在指定90天观察期结束时被审查后存活超过90天。相比之下,12,755例(10.2%)发作在90天内发生死亡事件,中位死亡时间为28天[四分位区间(IQR):11至53]),平均死亡时间为34天(标准差:25.7)。表S2总结了不同事件状态下的候选变量。连续变量以均值和标准差或中位数与IQR的形式呈现。学生t检验用于检验遵循正态分布的连续变量,而Mann–Whitney U检验用于非正态连续变量。类别变量以计数和百分比表示,并使用卡方检验或Fisher精确检验进行检验。不同事件状态之间的特征存在统计学上显著差异。不失一般性,我们主要报告SGH数据的结果,对应的MIMIC-IV结果包含在表S3和S5及图1中。S1。
我们报告变量选择结果,并提供了变量重要性以探讨模型的可解释性。表2展示了Cox模型对所有变量的单变量和多变量分析结果。通过单变量分析,观察到嗜碱性粒细胞绝对计数、总血细胞计数、风湿病、瘫痪和无慢性并发症的糖尿病在0.001水平时未表现出统计显著性。除上述变量外,所有变量均可视为住院患者的风险因素。因此,仅基于以下条件选择简约模型。价值具有挑战性。基于AFT模型的效应如图所示。S2。
为了比较SGH和MIMIC-IV数据集上所有预测算法的性能,我们在表3中报告了所有使用完全隔离训练队列的同一测试队列算法的C指数和IBS的平均值、标准误差(SE)和95%置信区间(CI)。此外,表S8总结了每个模型的次要属性,以指导现实世界应用中的模型选择。
为评估不同模型表现的统计显著性,我们进一步对C指数和IBS指标进行了最佳多重比较(MCB)检验[41]。MCB图旨在实现模型的可视化,为选择合适模型增添了极高的临床应用价值。如图所示。基于SGH和图3。基于MIMIC-IV的4,面板(A)和(B)对应使用所有变量的模型,面板(C)和(D)对应具有变量选择的模型。我们为每种方法模拟20个具有特定均值和置信区间的观测值。该非参数检验计算性能指标的平均排名和临界距离。对于使用所有变量的模型,MCB结果显示DeepSurv在C指数和IBS指标方面表现最佳,无论是在SGH还是MIMIC-IV中。对于使用变量选择的模型,见图。基于SGH的3显示GBM表现出最佳的判别能力,而RSF则展现出稳健校准。然而,在图中。基于MIMIC-IV的4,观察到AutoScore-Survival展现出最佳的辨别和校准能力。表现最佳模型的关键区域(阴影区域)代表测试的参考值。具有关键区域与参考值重叠的模型不会表现出统计学上显著的性能差异,而关键区域高于该值的模型则明显低于表现最佳的模型。例如,在图中。3C,GBM模型与逐步CoxPH模型之间的显著重叠表明,尽管名义排名存在差异,判别能力没有统计学上显著差异。这一发现强调了更简单且易于解释的统计模型可以与复杂的机器学习模型保持竞争力。