机器学习赋能因素挖掘,系统性梳理前列腺癌风险识别的研究图景。 尽管前列腺癌(PCa)的早期筛查已普及,但其作为全球男性第二大常见恶性肿瘤的地位仍未改变,且是癌症死亡的第五大主因[1],但学界对其发病和进展的病因学因素仍缺乏全面的理解。临床上面临的挑战不仅在于治疗,更在于前端的预防和筛查。一方面,年龄、种族和遗传等已知风险因素是不可改变的;另一方面,饮食、肥胖和环境暴露等可变因素与PCa发生之间的关系错综复杂,难以理清。随着医疗数字化进程,海量高维度的临床、实验室和登记数据被不断积累,然而,如何从这些庞杂的数据中提取有价值的隐藏知识,识别出真正影响疾病发生的关键因素,已成为公共卫生和预防医学的瓶颈[2]。因此,迫切需要新的计算方法来系统性地梳理和评估众多潜在风险因素,从而为制定有效的预防策略和筛查指南提供依据。 在Asian Pacific Journal of Cancer Prevention上发表的一篇前沿综述,系统性地梳理了近十年间机器学习(ML)在探究PCa病因学因素方面的应用[3]。文章的核心贡献在于绘制了一幅该领域的“技术图谱”:它不仅归纳了被ML模型验证的关键风险指标,也剖析了研究中偏好使用的计算方法与主要的数据来源。该文旨在厘清过去十年中该交叉学科的研究基石,为后续研究者在模型选择、数据利用和因素聚焦方面提供了宝贵的参照基准。本文特对该综述的核心发现进行提炼与解读,以飨读者。
研究设计
本篇研究是一篇系统性综述,聚焦于利用ML技术识别前列腺癌的关键影响因素。本文的核心方法是遵循PRISMA指南对四大主流数据库(PubMed, Scopus, Web of Science, IEEE)进行系统性检索与回顾,最终纳入23篇研究进行描述性分析,重点阐明了包括年龄、PSA水平、fPSA(游离PSA)及PSAD(PSA密度)在内的最高频风险因素,以及随机森林、支持向量机和逻辑回归等主流ML算法。研究的重点在于归纳分析了当前研究中采用的计算工具(如R和Python软件)、数据来源(如医院记录和SEER、PLCO等公共登记库)以及普遍存在的局限性(如小样本量、回顾性设计等)。在意义上,该文献通过提炼该交叉学科的研究现状与方法学全景,为后续研究者优化模型选择、利用公共数据源以及改进研究设计提供了系统的基线参考与实践指南。 图1 文献检索与研究选择流程图
[1] Bray F, Laversanne M, Sung H, et al. Global cancer statistics 2022: GLOBOCAN estimates of incidence and mortality worldwide for 36 cancers in 185 countries[J]. CA Cancer J Clin. 2024;74:229–63.[2] Hermanns T, Wettstein MS, Kaufmann B, et al. BioPrev-C - development and validation of a contemporary prostate cancer risk calculator[J]. Front Oncol. 2024;14:1343999.[3] Mohammadi S, Imani B, Saeedi S, Amirzargar MA. Identification of Factors Affecting Prostate Cancer Using Machine Learning Methods: A Systematic Review[J]. Asian Pac J Cancer Prev, 2025, 26(5): 1519-1528.