Py学习  »  机器学习算法

IF=8.1,单细胞、多组学、纯生信!公共数据+机器学习+孟德尔随机化,如何思路迁移?

挑圈联靠 • 9 月前 • 260 次点击  

欢迎来看雪球讲发文套路!转录组+单细胞,是整合多组学数据时比较方便的一条路径。在此之上,可以添加孟德尔随机化,给出因果证据;或者添加空间转录组数据,绘制空间图谱。今天要介绍的1个月前发表的文章就是结合了孟德尔,0实验发表。一起看看如何用基本功拿下高分SCI吧!

这篇文章的生信分析兼顾转录组、单细胞多组学,

适合参考学习,迁移至自己的课题

用孟德尔随机化的因果证据代替了实验验证,

在2025下半年还能纯生信发表!

Multi-omics nominates VDAC2 as a candidate protective locus in sepsis-associated cholesterol dysregulation

多组学将VDAC2列为脓毒症相关胆固醇失调的候选保护基因座


期刊:Apoptosis

IF:8.1

发布时间:2025/10/18


 技术路线 


数据获取

从 GEO 下载 GSE65682(主队列)、GSE69528、GSE95233(验证)及 GSE217906(scRNA-seq)

经背景校正、分位数标准化后共 2805 个差异基因(|log2FC|>0.585,FDR<0.05)。


WGCNA 共表达网络

软阈值 β=10 构建无尺度网络, turquoise 模块与疾病状态相关性最强(r=-0.55,P=5×10⁻⁶⁴)。


CMGs 提取与交集分析

从 KEGG hsa04979 提取 156 个胆固醇代谢基因(CMGs),与 DEGs 及 turquoise 模块取交集,得到 4 个候选基因:VDAC1、VDAC2、LDLRAP1、LIPA。


机器学习筛选 Hub 基因

SVM-RFE + LASSO 双算法交叉验证。

最终保留 了3 个基因(VDAC1/VDAC2/LDLRAP1),多队列 ROC-AUC 达 0.972(内部)与 0.868/0.984(外部),SHAP 显示各基因贡献均衡。


单基因 GSEA & 免疫浸润

解析 Hub 基因相关通路及免疫微环境变化。

VDAC1/2 高表达富集核糖体、TCA 循环等代谢通路;LDLRAP1 与肠道免疫、Th17 分化相关;三基因均与多种免疫细胞浸润水平显著相关。


NMF 分子分型

依据 CMGs 表达将脓毒症患者分层,探索预后差异。

k=2 最优,分为 Cluster1(免疫抑制+代谢重编程)与 Cluster2;Cluster1 28 天生存显著差(log-rank P=0.014)。


机器学习预后模型

利用分型差异基因预测 28 天死亡风险。

集成 101 种算法,StepCox[both]+plsRcox 最优。

训练集 C-index=0.86,测试集=0.70;高低风险组生存曲线显著分离。


单细胞转录组分析

定位 Hub 基因表达及关键细胞亚群。

63 637 个细胞→25 群→10 大类;CD14⁺CD163⁺ 单核细胞在脓毒症显著扩增,伪时间分析处于终末分化位置,胆固醇代谢通路显著激活(NES=1.69,P=0.01)。


CellChat 细胞通讯

解析 CD14⁺CD163⁺ 亚群如何重塑免疫微环境。

该亚群与 T 细胞间通讯强度在脓毒症显著增强,主要配体-受体对涉及炎症与代谢调控。


SMR 孟德尔随机化

从eQTLGen数据库和GWAS数据库中获取基因组数据,检验 Hub 基因表达与脓毒症发病的因果性及药物靶点潜力。

仅 VDAC2 显著(β=-0.222,P=0.042,HEIDI=0.715),提示其高表达降低发病风险;无多效性证据,PheWAS 未见显著副表型,安全性良好。


统计与可视化

确保结果稳健可重复。

R 4.4.3 完成,双侧 P<0.05 为显著;多队列、多算法交叉验证降低过拟合风险。


 研究结果 



正文共7图1表,纯生信

获取并预处理数据后,按照差异表达+共表达网络分析→CMGs筛选→机器学习筛选枢纽基因→构建诊断模型→分子分型和预后分析→单细胞转录组验证→孟德尔随机化验证的顺序进行。

0实验范式:

整合多组学数据→机器学习挖掘→单细胞验证→遗传学因果推断 


Fig 1 识别与脓毒症发病机制相关的关键 CMG 基因

A 主成分分析揭示样本分布特征

B 火山图显示HC和SS组间基因表达差异

C 热图显示HC和SS组中30个最显著上调和下调的基因

D 基于表达相似度构建样本聚类树

E 网络拓扑分析显示出无尺度网络特性

F 基因模块簇树显示共表达模块的分裂

G 模块-表型相关性热图

H 散点图显示模块成员关系(MM)与基因显著性(GS)之间的相关性

I 基因集的多维韦恩图分析


Fig 2 机器学习模型构建与基因功能富集

A SVM-RFE 交叉验证准确性

B LASSO 回归系数路径

C LASSO 特征基因筛选

D 基于多基因特征构建列线图预测模型

E 基于列线图的每队列的ROC曲线

F 训练队列中VDAC1基因的ROC曲线分析

G 训练队列中VDAC2基因的ROC曲线分析

H训练队列中LDLRAP1基因的ROC曲线分析

I SHAP特征重要性(横向显示每个特征对模型输出的平均贡献)

J VDAC1富集分析脊图,显示显著富集前10个通路

K VDAC2富集分析脊图,显示显著富集前10个通路

L LDLRAP1富集分析脊图,显示显著富集前10个通路


Fig 3 基于CMGs的免疫浸润和脓毒症亚型

A 热土显示枢纽基因与免疫细胞间的相关性

B 免疫细胞类型互作矩阵显示不同免疫细胞类型之间的相互作用

C 非负矩阵分解(NMF)基于 CMG 表达谱的共识聚类矩阵

D 两种分子亚型的 28 天生存曲线

E 前50名差异基因网络的互定位

F GO/KEGG功能富集条形图

G 基于 KEGG 通路的上调 GSEA 富集曲线

H 基于 KEGG 通路的下调 GSEA 富集曲线

I 分子亚型免疫细胞表达热图


Fig 4 整合机器学习模型预测脓毒症患者的28天生存期

A 模型特征组合性能评估矩阵

B 训练集与测试集的C指数比较

C 训练集风险分层生存曲线

D 验证集风险分层生存曲线


Fig 5 单细胞免疫图谱和基因表达分析

A 免疫细胞聚类UMAP图

B 细胞类型特征基因表达点图

C 堆叠条形图,比较SS和HC各免疫细胞类型比例的差异

D-F VDAC1、VDAC2 LDLRAP1 基因表达的 UMAP 图谱

G-I VDAC1、VDAC2 LDLRAP1 的平均表达式直方图

J 单核细胞/巨噬细胞亚组的 t-SNE 聚类与比例分析


Fig 6 在脓毒症发病机制中 CD14+CD163+ 单核细胞的表征

A CD14 和 CD163 基因表达图谱

B 单核细胞/巨噬细胞分化轨迹分析

C 集群 1,HC 组的蜂窝通信网络

D 集群 1,SS 组的蜂窝通信网络

E 集群1 细胞差异基因功能富集分析棒棒糖图

F HC/SS信号通路活性与热图

G 集群1 胆固醇代谢通路GSEA富集分析


Fig 7 SMR分析鉴定VDAC2为脓毒症保护基因

A VDAC2基因的SMR基因座定位

B SMR效应相关性

C VDAC2表型组关联


Table 1 VDAC1、VDCA2和LDLRAP1的SMR分析


 文章进阶方法 


文章升级秘籍📕

向高分文献设计看齐,提升发文成功率


遗传学因果证据

本文使用的基于汇总数据的孟德尔随机化(SMR)常用于辅助生信分析/基础实验验证/药靶孟德尔随机化。


机器学习模型优化

引入SHAP、LIME等模型解释方法,直观展示各个特征对模型的贡献;优化算法与模型,纳入临床动态指标后构建时间序列预测模型;在其它疾病中验证模型的泛化能力。


生信技术是飞快发展的,转录组+单细胞组合,让孟德尔随机化/空间组学/其它组学......来当“外援”的发文案例越来越多。把握发文趋势,找到适合你的课题设计吧!



思路迁移 | 课题设计 | 分析交付

添加雪球,回复“个性化”1v1了解详情






技术不断进步,很多“虚拟xx”的名词;但应用更前沿的技术、更全面的课题设计,达成SCI发表,握在自己手里的成果,一定是真实的。


如果你也想发表更高影响因子上限的文章;

如果你也想加速获取可靠的、高置信度的科研成果;

如果你也想冲刺升学/升职/评优等多种场景,增加科研竞争力,

👇来找雪球,添加后回复“个性化”开始咨询吧!


添加后回复“个性化”咨询

 雪球的生信套路 每周周中讲解 

平台改版,记得星标⭐

才不会错过更新哦

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/189619