社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

双一区10.6分!双重机器学习筛选+多模型验证,西安交大附一院CHARLS研究已确立CTI的核心预测地位

统计之光科研时间 • 5 月前 • 123 次点击  

说到预防中风,大家的第一反应往往是“要控制好血压”。这没错,高血压是头号风险因素。但在医学上,事情往往没那么简单。

越来越多的研究发现,身体里悄无声息的“炎症”和“代谢紊乱”(比如胰岛素抵抗),也在血管损伤和血栓形成的过程中推波助澜,最终可能和高血压“联手”导致中风。

2026年1月24日,西安交通大学第一附属医院团队在期刊《Cardiovascular Diabetology》(IF=10.6/双一区Top)发表研究论文,

这篇文章投稿仅2个月左右接收!方法学上有诸多亮点,我们一起来学习一下。

文献简介


文献标题:心血管-肾代谢综合征0-3期人群中,C反应蛋白-甘油三酯葡萄糖指数与长期中风伴高血压的关联:一项全国性前瞻性队列研究

💡  PMID:41580679

需要获取文献原文的朋友,关注公众号并在后台回复【PDF】即可领取文献原文PDF!

研究概览

研究背景:

中风是心血管-肾-代谢综合征(CKM)进展至晚期的主要结局之一。高血压、系统性炎症和胰岛素抵抗均是中风的独立危险因素,但三者在CKM早期人群(0-3期)中的联合作用及其对长期中风风险的预测价值,尚未在大规模前瞻性队列中得到系统评估。

核心方法:

基于CHARLS 2011-2020年的数据,纳入9,082名45岁及以上、处于CKM 0-3期的参与者,采用前瞻性队列设计,运用Cox比例风险模型、机器学习特征筛选、加权分位数和回归等方法,系统评估了C反应蛋白-甘油三酯葡萄糖指数(CTI)与高血压对长期中风风险的独立与联合预测作用。

核心发现:

① 剂量-反应关系明确:CTI与高血压的联合暴露与中风风险呈显著梯度相关。与既无高血压又低CTI的组别相比,同时具备高血压与高CTI的组别中风风险升高至3.19倍。

 联合预测优势显著:CTI与高血压结合的预测模型(AUC=0.672)优于单一高血压模型(AUC=0.661)或单一CTI模型(AUC=0.651)。

核心贡献因子识别:通过加权分位数和回归分析,发现C反应蛋白(炎症标志物,权重38.8%)和高血压(权重31.7%)是预测中风风险最主要的两个贡献因素。

④ 结果稳健普适:上述关联在不同亚组(如年龄、性别、糖尿病状态等)中均保持一致,且经过多项敏感性分析验证结果稳健。

方法学价值及应用

方法学价值:

这篇文章的方法学亮点在于多层次、多模型的整合验证思路——它既用了传统生存分析与模型比较,又引入了机器学习进行特征筛选,还通过加权分位数回归分解风险贡献,最后用竞争风险模型和大量敏感性分析夯实结论。

这种“机器学习筛选+传统统计建模+多重稳健性检验”的组合拳,让它在方法上显得既现代又严谨。

核心方法学应用:

机器学习特征选择(Boruta + LASSO):与传统单变量筛选或基于P值的方法不同,这里先用Boruta算法(基于随机森林)初筛,再用LASSO回归收缩冗余变量,能更稳定地选出与中风最相关的预测因子,避免过拟合。

加权分位数和回归(WQS):这是一种用于评估混合暴露中各成分权重的回归方法,比传统回归更能识别“谁在主导风险”,尤其适合CTI这种复合指标。

竞争风险模型(Fine-Gray模型):在随访中有死亡事件的情况下,直接用Cox模型可能高估中风风险。竞争风险模型将死亡视为竞争事件,使风险估计更贴近临床实际。

时间依赖AUC(tAUC):不像普通AUC只给一个截面的判别力,tAUC能展示模型预测能力随时间的变化,更动态地评估预测性能。

研究步骤

01

研究人群确定与基线数据准备

作者从CHARLS 2011-2012基线调查的17,708名参与者中,根据预先设定的纳入排除标准(如年龄≥45岁、处于CKM 0-3期、关键变量无缺失等),筛选出最终纳入分析的9,082人。绘制了研究对象筛选流程图。

▲ CHARLS队列参与者选择流程图

02

关键变量定义与分组

在这一步,作者计算了每个参与者的CTI值,依据血压等信息定义高血压,然后根据CTI的拐点值(8.65)和高血压状态。

将所有人分为4组:Class 1(低CTI无高血压)、Class 2(高CTI无高血压)、Class 3(低CTI有高血压)、Class 4(高CTI有高血压)。

将连续变量(CTI)根据生物学拐点转化为分类变量,并与高血压状态交叉组合,可以直观地比较不同风险暴露组合下的结局差异,便于临床理解和风险分层。

03

初步关联可视化与检验

接下来,使用Kaplan-Meier生存曲线比较四组人群的中风发生率差异,并用Log-rank检验判断差异是否具有统计学意义。

04

风险效应量化与多因素校正

然后,建立Cox比例风险回归模型。依次建立未校正模型(Model 1)、校正年龄性别模型(Model 2)、及进一步校正多种混杂因素的全校正模型(Model 3),计算四组相对于Class 1的风险比及其置信区间。

因为Cox回归是处理随访时间数据的标准模型,可以在控制其他混杂因素的前提下,量化暴露因素(这里是不同分组)对事件发生风险(中风)的影响大小(HR值)。

▲ CTI 与高血压与长期中风的关联

05

预测性能评估与比较

接下来,开始绘制受试者工作特征曲线,并计算曲线下面积(AUC),比较“仅高血压”、“仅CTI”、“CTI+高血压”以及基线模型的预测区分能力。同时作者还计算了净重分类改善指数等指标。

06

稳健性验证

最后,作者应用加权分位数和回归分析CTI各成分及高血压的权重。其次,进行广泛的亚组分析和敏感性分析(如更换高血压定义、排除特定人群等),检验主结论在不同条件下的稳定性。

▲ CTI与长期卒中高血压的关联(无插补)

WQS回答了“联合指标中谁在起作用”的机制性好奇。而层层递进的敏感性分析如同对研究结论进行“压力测试”,是证明结论可靠、排除偶然或偏倚影响的关键步骤,能极大增强研究的说服力。

统计学难点与挑战

1️⃣竞争风险处理:简单地将死亡视为删失会高估中风风险。该研究应用Fine-Gray模型妥善处理了这一难题。

2️⃣高维变量筛选:如何客观、自动化地筛选出与中风最相关的核心预测因子,避免过度拟合或主观选择,是一大挑战。该研究结合Boruta和LASSO两种机器学习方法,提供了稳健的解决方案。

3️⃣复合指标的构建与解释:CTI是一个由三个连续变量(CRP、TG、FPG)通过公式构建的新指数,作者通过限制性立方样条找拐点、通过WQS回归分解权重,系统地应对了这些挑战。

4️⃣交互作用检验的把握度:检验CTI与高血压之间是否存在相乘或相加交互作用,通常需要较大的样本量。该研究未发现显著交互作用,但也坦诚这可能受到样本量的限制,体现了分析的严谨性。

临床价值与方法学启示

临床科研价值:

  • 临床层面:提供了一个可操作的、整合式的风险分层工具。证明了在常规血压测量之外,增加一项基于常见血检指标(CRP、TG、FPG)的简单计算(CTI),就能显著提升对普通CKM人群中风风险的识别能力,有助于早期精准干预。

  • 科研层面:展示了从“关联”到“贡献”再到“应用”的完整方法学链条。不仅证实了CTI与高血压的联合关联,更利用WQS明确了炎症的核心驱动角色,并通过机器学习、模型比较(AUC, NRI)等一系列手段,量化了这种联合评估的增量价值,为同类生物标志物研究提供了方法范本。

方法学启示:

✔在选题上,与其一味追寻全新的昂贵生物标志物,不如思考如何将现有、易得的临床指标进行有生理意义的整合,解决单一指标预测能力不足的痛点。

✔“机器学习筛选+传统统计建模”双阶段模式,非常适合处理现代队列研究中常见的多变量数据,既能充分利用数据信息,又能保证结果的可解释性。

✔要重视“稳健性”的证据链,通过竞争风险模型、多种敏感性分析、亚组一致性检验构建坚固的结论防线。

✔要关注预测性能的量化比较。在证明关联显著之后,进一步用AUC、NRI、IDI等指标回答“好多少”的问题,使研究的应用导向更加明确。

总 结

这项研究先用机器学习算法,从一堆可能的影响因素里,锁定高血压和新组合指数(CTI)最关键;接着,不仅证明了两个指标一起预测中风更准,还进行了加权分位数和,拆解出主要是“炎症”和“高血压”本身的原因。

我们在分析大数据时,也向这篇文章学习,先用机器学习高效初筛,再用传统统计模型深入验证和解释。

👉如果你想快速学会CHARLS数据库挖掘的方法,发表一篇SCI,自己不知道怎么下手,不妨来【统计之光临床研究一对一全流程指导】看看,我们将为您安排一位专业的老师👨‍🎓,从0开始指导你学习,带你将一个全新的课题落地,结课即投稿!效率拉满🚀

统计之光可以指导的临床研究:

数据库:NHANES数据库、MIMIC数据库、SEER数据库、CHARLS数据库、GBD数据库的挖掘研究。

研究方法:队列研究,横断面研究,随机对照试验、回顾性研究(预测模型)等等。

国内老牌的医学科研一对一培训平台,提供多种类型的科研与统计方法一对一指导,坚持授人以渔,助力医护工作者科研成长!

已指导1000+医学人掌握方法、成功发表SCI!

Meta分析一对一指导

临床研究一对一指导

生信分析一对一指导

为什么可以选择统计之光

扫码联系业务 咨询详情👆

往期精彩

1

为什么中国学者扎堆用CHARLS发一区?最新5篇《Cardiovasc Diabetol》给出答案

2

10.6/双一区!南京中医药大学团队用CHARLS复合评分TyG-CVAI找到预测心血管代谢多病的“最强王者”!

3

本科生0基础,10个月斩获10.3分Top刊!这篇网状Meta是如何一步步发表的?

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/192492