早筛网讯:近日,由埃及贝尼苏夫科技大学等机构的研究人员联合完成的一项最新研究发表于国际权威期刊《Scientific Reports》上。研究提出了一种创新的混合深度学习模型,通过分析基因数据实现乳腺癌的高精度诊断。该模型在独立验证数据集上达到了99.30%的准确率和100%的召回率,为精准医学诊断提供了新的技术路径。乳腺癌是全球女性最常见的恶性肿瘤,早期诊断对改善乳腺癌患者生存率至关重要。遗传信息在乳腺癌的发生发展中扮演着关键角色,BRCA1、BRCA2等基因突变会显著增加乳腺癌风险。随着基因检测技术的发展,研究者能够获得海量的基因表达数据,但如何从数万个基因中准确识别出与疾病相关的信号,一直是医学信息学领域的挑战。现有研究方法往往依赖文献中已报道的特定基因集,可能遗漏新的生物标志物。同时,传统机器学习模型难以充分捕捉基因之间复杂的相互作用关系。针对这些问题,研究团队构建了多阶段特征筛选与混合深度学习结合的技术框架。- TCGA-BRCA(癌症基因组图谱计划-乳腺癌数据集):包含590个样本,其中529个为肿瘤样本,61个为正常组织样本。每个样本包含17814个基因的表达数据。
-
METABRIC(乳腺癌分子分类学国际联盟数据集):包含1904个样本,用于独立验证模型的泛化能力。
第一步:多阶段特征选择
在特征筛选阶段,研究人员设计了两个阶段的特征筛选流程:
首先,使用随机森林(Random Forest)进行筛选。随机森林是一种集成学习算法,通过构建多棵决策树并综合其结果来提高预测准确性。本研究使用随机森林评估每个基因在分类中的重要性,从17814个基因中筛选出436个重要性较高的基因。
随后,引入关联规则挖掘(Association Rule Mining)中的FP-Growth算法,对基因之间的共现关系进行分析,通过设置最小支持度为0.3、最小置信度为0.8,筛选出具有显著协同表达模式的基因组合。最终从436个基因中精选出332个具有生物学相关性的标志物。
这一阶段筛选出的基因涉及细胞周期调控、DNA损伤修复、肿瘤微环境改变等乳腺癌相关通路,具有明确的生物学意义。
第二步:混合深度学习模型构建
在模型构建方面,研究团队设计了一个混合深度学习架构。该模型首先利用卷积神经网络(CNN)提取基因序列中的局部特征模式。考虑到基因之间的相互影响并非局限于相邻位置,模型进一步引入了
双向长短期记忆网络层(BiLSTM),其能够从正向和反向两个方向处理基因序列,有效捕捉相距较远的基因之间的依赖关系。
两个子网络提取的特征被整合后,经过全连接层,最终通过Sigmoid激活函数输出样本属于癌症类别的概率。Sigmoid函数将任意实数映射到0到1之间,适合二分类任务。
混合CNN-BiLSTM模型整体架构图
第三步:数据平衡与优化
为了防止模型过拟合并提高其在不同数据来源下的稳定性,研究团队在训练过程中加入了多种增强手段。一是采用合成少数类过采样技术(SMOTE),通过生成合成样本来平衡训练集中癌症阳性与阴性样本的比例。二是在训练数据中添加5%的高斯噪声,使模型能够适应真实场景中可能存在的检测误差或批次效应。模型超参数通过贝叶斯优化方法自动调优,最终确定学习率为0.0005,丢弃率为0.05。
实验结果显示,
该模型在TCGA-BRCA测试集上取得了97.46%的分类准确率,AUC值达到0.995。为检验模型泛化能力,研究团队在完全独立的METABRIC数据集上进行验证。结果显示,模型实现了99.30%的准确率,并且对癌症患者的召回率达到100%和0.999的曲线下面积。这意味着在验证数据集中,所有实际患癌的个体均被模型正确识别,未出现漏诊情况。
研究还通过一系列对照实验验证了各核心组件的有效性。当移除关联规则挖掘层后,模型泛化能力显著下降,表明该步骤对高维基因数据的梯度稳定至关重要。移除随机森林筛选、使用全部17814个基因训练时,过拟合风险明显增加。单独使用卷积神经网络或双向长短期记忆网络,性能均不如两者结合,说明两种架构具有协同优势。

与传统的机器学习方法以及多种常见的深度学习模型相比,该混合模型在准确率、召回率、F1分数和AUC等多项指标上均表现更优。尤其在混淆矩阵分析中,该模型的假阴性病例数最少,这一特点对于癌症诊断工具而言具有重要临床意义,因为漏诊可能直接延误患者的治疗时机。
尽管研究取得了显著成果,团队也指出了当前模型存在的局限性。首先,训练和验证所使用的主要数据来自西方人群,模型在其他种族和地域人群中的表现尚需进一步验证。其次,当前模型仅实现了良恶性的二分类诊断,未能对乳腺癌的不同分子亚型进行区分,这在一定程度上限制了个体化治疗指导的能力。最后,模型的可解释性仍有待加强,临床医生需要了解模型作出判断的依据,模型的计算资源需求较高,在医疗资源相对匮乏的地区部署可能面临挑战。
该研究通过创新的特征筛选策略与混合深度学习架构,实现了乳腺癌基因诊断精度与泛化能力的双重突破,跨数据集99.30%的准确率和100%的召回率为临床早期诊断提供了可靠工具。332个核心生物标志物的发现不仅深化了对乳腺癌分子机制的理解,更为潜在治疗靶点的开发提供了线索。随着技术的进一步优化和临床验证的推进,该模型有望成为乳腺癌风险分层和早期干预的重要辅助工具,为精准医疗在肿瘤领域的应用提供新范式。
进群、合作、投稿请扫码:



