Py学习  »  机器学习算法

IF4.9!国产数据库再添力作!CHARLS+CLHLS 数据库助力,8 种机器学习解锁中老年抑郁人群 MCI 筛查新路径

生信Othopadics • 8 月前 • 293 次点击  

点击蓝字 关注我们




引言

今天睿因生物给大家推荐的文章由成都中医药大学的学者CHARLS+CLHLS 数据库,在期刊J Affect DisordIF=4.9)的题为:A machine learning-based discriminative framework for mild cognitive impairment risk in middle-aged and elderly Chinese patients with depression: evidence from CHARLS and CLHLS的研究论文。

中文标题:基于机器学习的中老年人抑郁症患者轻度认知障碍风险判别框架:来自CHARLS和CLHLS的证据

发表期J Affect Disord

发表时间:2025年11月

主要数据库:CHARLS+CLHLS据库

想通过挖掘临床公共数据库来完成KPI的朋友,或者手头有资源但没时间整合的朋友,速速联系小编吧!

研究背景

中老年群体中,抑郁症并非单纯情绪问题,认知功能损伤是其核心特征之一——急性发作期认知症状发生率达76.9%-94%,缓解期仍有32.4%-44%患者存在认知残留症状。抑郁症与MCI(正常衰老与痴呆的过渡阶段)存在双向关联,二者共病会降低患者生活质量、加重照护负担、加速认知衰退,还可能提升死亡率和自杀风险。但目前临床缺乏有效筛查手段,传统方法要么成本高难在基层推广,要么未针对抑郁症患者设计专属工具,因此开发低成本、易操作、高精准的MCI风险判别工具对改善患者预后至关重要。


研究设计

本研究基于2018年中国健康与退休纵向研究(CHARLS)的数据,数据分为7:3的培训集和内部测试集。此外,还选取了中国纵向健康生活调查(CLHLS)队列的数据进行外部验证。采用八种机器学习方法,构建中老年人抑郁症患者的MCI判别模型。采用五重交叉验证以确认模型的稳健性。决策曲线分析(DCA)被用于量化预测模型在阈值概率下的临床净收益。判别结果的重要贡献通过SHapley加法解释(SHAP)值得以阐明。

研究结果

01

基线特征

本研究选取两大队列数据:1964名CHARLS参与者(1473例非MCI、491例MCI)与6782名CLHLS患者(5636例非MCI、1146例MCI)。

          02

          LASSO 回归与变量选择


          研究先通过LASSO回归(十重交叉验证确定最优λ值0.028)初步筛查协变量,筛除五个变量;再经DT分析验证,其排名前15的特征与LASSO回归所选特征大致重叠,证实了特征选择的一致性与所选协变量的稳定性。结合临床知识和以往研究纳入糖尿病、高血压、运动三个变量后,最终确定教育、户籍、孤独、IADL、糖尿病、高血压、运动共八个判别变量。

            03

            模型构造与判别能力

            基于选定判别变量开发了8个机器学习模型,训练集中RF模型AUC最高(0.826,95%CI:0.809–0.843),其余算法AUC在0.683-0.796之间;验证集中RF仍表现最优(0.801,95%CI:0.760–0.841),XGBoost和SVM与之相当,KNN AUC最低(0.665,95%CI:0.613–0.716),且除KNN外,其余模型验证集AUC均超0.7。

            Delong测试显示,训练集中RF模型的ROC曲线表现与其他所有模型均有显著差异;验证集中,其仅与DT和KNN存在显著差异。验证集上,RF、XGBoost和SVM性能相近,其中SVM准确率最高(0.778),XGBoost回忆率最高(0.757),RF表现居中。

            04

            临床效用评估

              训练集与验证集的DCA分析显示,RF模型在特定阈值范围内(验证集为0至0.28)的临床净收益显著高于其他模型及极端策略,临床适用性突出;加之其在测试集中AUC最高,因此被认定为具有强临床适用性的模型。

                05

                外部验证

                采用CLHLS队列进行外部验证时,RF模型的AUC为0.653(95%CI:0.636–0.670),未及验证组水平,仅展现中等辨别能力,但在0.07至0.20的预测概率阈值范围内,其静态优势仍优于两种极端策略。

                06

                变量重要性与可解释性分析

                研究先通过RF算法内置函数得出区分抑郁人群MCI的五大重要变量:教育程度、孤独感、户籍、IADL、异常血脂;再经SHAP分析验证,前五大重要变量一致(仅血脂异常排名提升),且明确变量影响方向——高等教育、城市户籍、异常血脂、无孤独感、无IADL残疾均倾向预测非MCI,其中教育程度影响最显著。此外,SHAP力图直观展示了各特征对单个病例MCI判别的贡献,低教育、IADL残疾等会增加MCI风险,高教育、城市户籍等则降低风险。

                            文章小结

                            研究首次针对中老年抑郁症患者群体,构建了基于机器学习的 MCI 风险判别框架,不仅实现了 MCI 风险的精准识别,还揭示了其核心影响因素,为临床早期干预提供了科学依据。随着该工具的推广应用,有望显著降低抑郁症相关认知衰退的危害,为老龄化社会的认知健康保障提供有力支撑。

                            看完是不是已经心动不已,想立刻借助CHARLS+CLHLS数据库资源,为科研成果添砖加瓦?别再犹豫!陕西睿因生物专业团队随时待命,无论是想紧跟数据库最新动态,还是定制专属科研数据方案,我们都能满足你!快点联系小编,解锁科研新可能,让我们携手,在科研征途上一路狂飙,收获亮眼成果!


                            Python社区是高质量的Python/Django开发社区
                            本文地址:http://www.python88.com/topic/190161