
利用质谱的非靶向代谢组学分析提供了全面的代谢谱分析,但其医学应用面临着复杂的数据处理、高批间变异性和未知代谢物的挑战。2024年8月20日,中山大学李伟忠、黄蓬及胡寓旻共同通讯在Nature Communications 在线发表题为“An end-to-end deep learning method for mass spectrometry data analysis to reveal disease-specific metabolic profiles”的研究论文,该研究提出了DeepMSProfiler,这是一种可解释的基于深度学习的方法,能够对原始代谢信号进行端到端分析,并具有高精度和可靠性的输出。DeepMSProfiler使用859份来自肺腺癌、良性肺结节和健康个体的跨医院血清样本,成功区分了不同组的代谢组学特征(AUC 0.99),并检测出早期肺腺癌(准确率0.961)。模型流动和消融实验表明,DeepMSProfiler克服了医院间的变异性和未知代谢物信号的影响。集成策略消除了多分类深度学习模型中的背景类别现象,新的可解释性使人们能够直接访问与疾病相关的代谢蛋白网络。进一步应用于脂质代谢组学数据揭示了重要代谢物和蛋白质的相关性。DeepMSProfiler为疾病诊断和机制发现提供了一种直接可靠的方法,增强了其广泛的适用性。
代谢组学提供了生物系统中小分子浓度的全面视图,并在发现用于诊断目的的疾病生物标志物方面起着关键作用。液相色谱-质谱(LC-MS)是全球代谢组学研究中广泛应用的实验技术。高灵敏度、稳定性、重复性和检测通量是非靶向LC-MS的独特优势。尽管LC-MS能够测量数千个离子峰,但传统的代谢组学研究仍然是一项具有挑战性的任务,因为它需要费力的数据处理,如峰选取和比对,通过与认证数据库进行比较的代谢物注释,以及在大规模研究中控制不必要的变异性的数据归一化。代谢组学在精准医学中的广泛应用可能会受到数据处理复杂、批次间差异大、代谢物鉴定繁琐等障碍的阻碍。
非靶向代谢组学已在各种人体生物液体(包括血清和血浆)上进行,用于发现肝癌、胰腺癌、前列腺癌和肺癌等癌症的生物标志物。然而,这种利用代谢组学的生物标志物发现研究面临着可重复性方面的重大挑战,这可能是由于跨批或跨平台分析中的信号漂移以及来自不同实验室样本的数据整合有限。此外,在将检测到的特征与经过认证的数据库进行比较时,排除了未知的代谢物,这可能会阻碍发现与疾病相关的新生物标志物。之前的一些研究将机器学习与LC-MS结合起来进行体外疾病诊断,提高了LC-MS数据分析的效率。然而,这些研究仍然面临着代谢组学中批次效应和未知代谢物等挑战。因此,迫切需要一种新的分析方法来克服实验瓶颈,揭示由LC-MS峰衍生的已识别和未知成分组成的疾病相关谱。

DeepMSProfiler概述(图源自Nature Communications )
深度学习已广泛应用于各种组学数据分析,有望解决代谢组学数据的复杂性。深度学习的编码和建模能力为克服上述处理复杂和高维数据的瓶颈提供了一个潜在的解决方案,减轻了机器学习算法中的偏见。然而,深度学习需要高质量的数据和足够数量的样本,否则会导致维数诅咒和预测模型过拟合等问题。此外,整合从多家医院收集的大型数据集可能会带来显著的变化。此外,由于深度学习方法通常被视为“黑箱”过程,在生物医学研究的背景下,模型可解释性对预测的重要性日益得到认可。因此,深度学习模型既具有生物可靠性的可解释性,又具有减轻批量效应的能力,这对于提高用于诊断目的的大规模代谢组学分析的可靠性是非常可取的。
研究开发了一种集成的端到端深度学习方法,称为基于深度学习的质谱分析器(DeepMSProfiler),用于非靶向代谢组学数据分析。首先利用来自三家不同医院的859份血清样本,将该方法应用于区分健康个体和良性肺结节或肺腺癌患者,然后对来自928个细胞系的脂质代谢组学数据进行扩展分析,以揭示与多种癌症类型相关的代谢物和蛋白质。没有传统机器学习方法的峰提取和识别过程以及潜在的错误,研究直接将原始LC-MS数据转换为输出,说明每个类别特定的关键代谢物信号的热图,以及影响预测类别的代谢网络。
DeepMSProfiler有效地消除了不同医院之间的不良批次效应和差异,并推断出与特定分类相关的未注释代谢物。此外,它利用集成模型策略,从多个单独的模型中优化特征归因。DeepMSProfiler在独立测试数据集中的受试者工作特征曲线下面积(AUC)得分为0.99,检测早期肺腺癌的准确率为96.1%。结果可以通过定位相关的生物成分作为预测的贡献因子来解释。研究为代谢组学在疾病诊断和机制发现中的应用提供了一种简单可靠的方法。
https://www.nature.com/articles/s41467-024-51433-3