中文标题:机器学习在微生物溯源中的应用
英文标题:Applications of Machine Learning in Microbial Source Tracking
第一作者:李佳盈
通讯作者:邓晔,冯凯
其他作者:王乐,胡秋龙,伍绍龙
作者单位:中国科学院生态环境研究中心;中国科学院大学资源与环境学院;公安部鉴定中心;湖南农业大学;湖南省烟草公司
期刊:Trends in Microbiology
发表时间:2026年8月
文章链接:https://doi.org/10.1016/j.tim.2026.07.010
文章类型:综述型
微生物溯源(Microbial Source Tracking, MST)已成为环境生态学、食品安全以及法医学研究中的重要技术体系。随着微生物组学技术的发展,MST已经从早期依赖单一指标微生物的分析方法,逐渐转向基于整个微生物群落结构的来源推断模式,这也对更加高效和强大的分析框架提出了需求。目前,机器学习(Machine Learning, ML)已成为处理大规模微生物组数据和解析微生物群落与其来源之间复杂关系的重要工具。本综述系统总结了MST领域中应用的主要机器学习方法、代表性分析工具,以及其在污染来源追踪、地理来源解析、食品安全和法医学等领域中的应用进展。现有研究表明,机器学习方法能够显著提高微生物来源追踪的预测准确性、空间分辨率以及大规模应用能力。然而,该领域仍面临一些关键挑战,包括模型解释性不足、微生物群落生态动态变化的影响,以及缺乏具有明确真实来源信息(ground truth)和统一评价标准的基准数据集。此外,本文进一步探讨了下一代人工智能技术,尤其是深度学习方法,在构建更加稳定、高效和智能化的微生物来源追踪体系中的潜在应用前景。
MST的发展经历了从单一指标检测到群落水平解析的技术演变过程。早期MST主要依赖培养(Culture-based)方法,通过分离具有诊断意义的微生物类群判断潜在来源。例如,粪便指示菌以及粪便大肠菌群与粪便链球菌比例曾被广泛用于水环境污染监测。然而,由于环境中微生物的生长状态、存活能力以及来源特异性存在差异,这类方法往往难以实现精确的来源区分。随后,研究者开始利用微生物表型特征(Phenotype-based)开展来源识别,包括抗生素抗性指纹、碳源利用模式以及磷脂脂肪酸分析等方法。这些策略能够提供来源相关信息,但通常依赖复杂实验流程和完善的参考数据库,同时容易受到水平基因转移等生态过程的影响。随着分子生物学技术的发展,基于基因型特征(Genotype-based)的MST方法逐渐成为研究重点。研究人员利用核糖分型、PFGE、AFLP、MLST以及宿主特异性分子标记等方法,从遗传层面寻找具有来源区分能力的微生物信号。例如,人源特异性Bacteroides遗传标记和动物源特异性微生物标记的发现,为污染来源识别提供了更加精准的分子工具。然而,这些方法仍受到目标序列丰度、环境稳定性以及参考数据库完整性的限制。
目前,不同机器学习驱动的MST方法针对不同应用需求发展出了各自的特点。其中,随机森林(Random Forest, RF)主要用于来源分类任务,通过学习不同来源样品之间的微生物特征差异,实现未知样品来源类别的预测。由于其能够处理高维数据、非线性关系以及复杂微生物特征,因此被广泛应用于环境来源识别和食品安全分析等研究中。
与来源分类不同,实际环境应用中往往需要进一步回答“不同来源分别贡献多少比例”的问题。针对这一需求,SourceTracker、FEAST和STENSL等方法被开发用于来源贡献比例估计。其中,SourceTracker利用贝叶斯混合模型,通过比较来源群落与目标群落之间的关系,估算不同来源对目标样品的贡献;FEAST进一步利用期望最大化算法提高计算效率,使其更加适用于大规模微生物数据分析;STENSL则通过引入稀疏优化策略,在多个候选来源中自动筛选主要贡献来源,从而减少无关来源带来的预测干扰。
近年来,深度学习方法进一步推动了MST向大规模智能化方向发展。例如,Ontology-aware Neural Network for Microbial Source Tracking(ONN4MST)通过整合微生物分类层级信息和深度神经网络模型,实现了对超大规模、多来源微生物数据的层级化预测。相比传统方法,深度学习能够捕获更加复杂的微生物群落模式,并提高模型在复杂生态体系中的应用潜力。
MST是一种基于微生物组成特征推断未知样品来源的技术体系,最初主要应用于环境污染溯源领域,尤其用于识别水体中不同类型的粪便污染来源。其核心思想是利用不同来源微生物群落之间存在的组成差异,建立来源样品(source)与未知样品(sink)之间的关联,从而实现污染来源识别、传播路径解析以及生态风险评估。随着微生物组学和人工智能技术的发展,MST已经逐渐从传统的单一指标检测方法,发展为基于群落结构和机器学习模型的综合分析框架。早期MST方法主要依赖于培养技术和宿主相关微生物指标(方框1)。例如,粪便指示菌(fecal indicator bacteria, FIB)曾被广泛用于评价水环境中的粪便污染。然而,由于这些指标菌在不同环境中可能发生迁移、增殖或衰减,并且部分指标菌缺乏明确的宿主特异性,因此难以实现对污染来源的精确区分。随后,研究者进一步发展了基于表型特征和基因标记的方法,包括抗生素抗性指纹、脂肪酸谱分析以及宿主特异性分子标记等。这些方法提高了来源识别的分辨率,但仍受到参考数据库覆盖范围、目标标记丰度以及环境稳定性的限制。
高通量测序技术的快速发展推动了MST研究范式的重要转变。传统方法通常关注某一个或少数几个具有指示意义的微生物,而微生物组学研究表明,复杂生态系统中的来源信息往往并非储存在单个分类单元中,而是编码于整个微生物群落的组合结构之中。不同环境来源由于受到长期生态选择、地理隔离、宿主特征以及环境条件的共同影响,会形成具有一定稳定性的微生物群落组装模式。这些群落特征可以被视为来源环境形成的“微生物生态指纹”,为更加精确的来源追踪提供了新的理论基础。
然而,微生物群落数据具有典型的高维度、非线性和复杂交互特征。一个环境样品通常包含大量微生物分类单元,而不同微生物之间的共存关系、生态互作以及环境响应过程进一步增加了来源解析的复杂性。传统统计方法往往难以充分捕获这些隐藏于群落结构中的信息,因此限制了其在大规模微生物数据分析中的应用。
机器学习(Machine Learning, ML)的引入为解决这一问题提供了新的技术路径。不同于依赖预设假设的传统分析方法,机器学习能够通过训练数据自动识别微生物群落中特征性模式,并建立微生物组成与来源类别之间的预测关系。例如,随机森林(Random Forest, RF)等监督学习方法可以从大量微生物特征中筛选具有区分能力的关键特征,而SourceTracker、FEAST等模型则能够进一步估算未知样品中不同来源的贡献比例(方框2)。
因此,MST的发展经历了从“寻找特定指标微生物”到“解析整体微生物群落模式”的重要转变。随着机器学习算法与微生物生态学理论的进一步融合,基于微生物群落的智能化来源追踪体系正在成为环境监测、食品安全、地理溯源以及法医学领域的重要研究方向。
随着高通量测序技术和机器学习方法的发展,MST的应用范围已经从传统的环境污染监测逐渐拓展到地理来源解析、食品安全以及法医学等多个领域。相比传统依赖单一指标微生物的方法,机器学习能够从复杂微生物群落数据中识别稳定的来源特征,使微生物群落成为解析环境过程和追踪来源信息的重要工具(图1)。

图1. 基于机器学习的微生物溯源概念框架
环境污染溯源是机器学习辅助MST应用最成熟的领域之一。在水体、沉积物以及污水处理系统中,微生物群落结构往往携带不同污染来源的信息。通过分析目标样品与潜在来源样品之间的微生物组成差异,机器学习模型能够识别污染贡献来源,并估算不同来源对环境样品的相对贡献。例如,在河流污染研究中,SourceTracker等方法已经被用于解析农业活动、城市输入以及养殖排放等不同来源对水体微生物组成的贡献比例。在污水处理系统中,基于机器学习的溯源方法还能够帮助识别潜在污染排放来源,为污染控制和环境管理提供依据。
然而,环境体系中的微生物群落具有明显的动态变化特征。微生物进入新的环境后,会受到环境筛选、生长繁殖、竞争作用以及随机过程的影响,因此目标环境中的微生物组成并不一定完全保留原始来源的信息。这意味着未来的污染溯源研究需要进一步结合时间动态信息和生态过程,提高模型预测的可靠性。
不同地理区域由于气候条件、生态环境、人类活动以及长期环境选择的差异,会形成具有地域特征的微生物群落。因此,微生物群落不仅能够反映生态环境状态,也能够作为判断样品地理来源的重要信息。近年来,机器学习模型已经被应用于城市、区域乃至全球尺度的微生物地理定位。例如,MetaSUB项目通过收集全球多个城市公共交通环境中的宏基因组数据,利用机器学习模型建立城市微生物指纹,实现了对未知样品来源城市的预测。这些研究表明,城市环境中的微生物群落具有稳定的空间特异性,可以作为一种新的地理信息来源。除城市尺度外,地理微生物溯源还可以用于研究微生物在不同环境之间的迁移过程。例如,在热泉等具有明显环境梯度的生态系统中,溯源方法能够揭示微生物沿环境梯度传播和组装的过程,为理解微生物扩散和环境筛选机制提供新的视角。
全球食品供应链的复杂化增加了食品污染传播和来源鉴定的难度。机器学习驱动的微生物溯源为食品安全提供了一种新的技术手段。在食源性病原微生物监测中,机器学习模型可以利用病原菌基因组信息或微生物群落特征,判断污染来源并辅助疫情溯源。例如,针对食品中常见的致病菌单核细胞增生李斯特菌(Listeria monocytogenes),研究人员利用机器学习模型分析不同食品来源菌株之间的差异,实现了感染病例与潜在食品来源之间的关联分析。此外,微生物群落还能够作为食品产地鉴定的新型生物标记。例如,通过分析食品中的细菌和真菌群落特征,机器学习模型已经被用于海产品、农产品等食品的地理来源识别,为食品真实性检测和贸易监管提供新的技术支持。
近年来,微生物溯源逐渐进入法医学领域。与传统DNA证据不同,人体、衣物、鞋底以及环境表面携带的微生物群落能够记录个体与环境之间的接触信息,因此具有潜在的身份识别和地理溯源价值。研究发现,鞋底和灰尘中的微生物组成能够反映个体曾经接触过的环境特征。基于深度学习的方法已经能够利用灰尘微生物数据预测样品的地理来源,为环境微生物证据在法医学中的应用提供了新的可能。此外,人体皮肤微生物中的个体特异性信息,也正在被探索用于个人身份识别。
不过,与实验条件下的高预测准确率相比,真实法医学场景更加复杂。环境暴露、样品混合、微生物转移以及时间变化都可能影响微生物信号的稳定性。因此,目前微生物法医学仍处于发展阶段,需要更多大规模、多条件验证数据支持。
尽管机器学习显著拓展了微生物溯源的应用边界,并在污染溯源、地理定位、食品安全和法医学等领域展现出较高的预测能力,但目前该领域仍面临多个关键挑战。未来,微生物溯源的发展不仅需要提高模型预测性能,更需要增强模型解释能力、考虑微生物生态动态过程,并建立更加可靠的标准化评价体系,从而推动MST从数据驱动预测走向生态机制驱动的精准推断。
机器学习模型,尤其是复杂的集成学习和深度学习方法,通常具有较强的预测能力,但其内部决策过程往往难以直接解释,即所谓的“黑箱问题”。在微生物溯源中,仅仅获得较高的预测准确率并不足以满足实际应用需求。研究人员不仅希望知道“样品来自哪里”,还希望进一步理解:哪些微生物特征驱动了模型判断?这些特征是否具有真实的生态意义?缺乏解释性的模型可能会依赖于数据中的偶然关联,例如测序批次差异、环境背景差异或其他非生物因素,而不是来源本身的微生物信号。这不仅限制了模型在不同区域和场景中的推广,也降低了其作为科学分析工具的价值。
因此,未来MST研究需要进一步结合可解释人工智能(Explainable Artificial Intelligence, XAI)方法。例如,通过特征重要性分析、SHAP(Shapley Additive Explanations)、LIME(Local Interpretable Model-agnostic Explanations)等方法,可以识别影响模型预测的关键微生物类群,并帮助研究人员验证这些特征是否符合已有生态学认知。
当前许多微生物溯源模型隐含假设:目标样品中的微生物组成可以近似看作不同来源群落的混合结果。然而,在真实生态环境中,微生物进入新的环境后并不会保持静态状态,而是会经历复杂的生态过程(图2)。例如,来源微生物进入新的环境后,可能受到环境筛选、资源限制、种间竞争、互利关系以及随机扩散过程的影响,从而导致群落结构发生改变。因此,最终检测到的微生物群落并不一定完全代表最初的来源组成,而可能是来源信号与生态演替共同作用后的结果。这一问题对于来源贡献比例估计尤为重要。如果模型忽略微生物进入目标环境后的生态变化,可能导致来源比例预测出现偏差。因此,未来的MST模型需要从传统的静态来源—目标关系,进一步发展为考虑时间尺度、环境变化和群落动态过程的时空预测框架。此外,将生态学知识融入机器学习模型也是未来的重要方向。例如,将微生物扩散限制、环境筛选、群落演替以及种间互作等生态过程作为模型约束条件,可能帮助人工智能系统获得更加符合生态规律的预测能力。

图2. 源库关系的静态假设和动态微生物群落过程的概念比较
3.3建立标准化数据体系:提升模型可靠性和可比较性
目前,机器学习驱动MST发展的另一个重要限制是缺乏具有明确真实来源信息(ground truth)的标准化基准数据集。在许多实际环境中,研究人员并不知道样品真实来源以及不同来源的实际贡献比例,因此难以准确评价模型预测结果是否符合真实生态过程。同时,不同研究之间在样品采集、测序技术、生物信息分析流程以及模型评价指标方面存在差异,也限制了不同方法之间的直接比较。
未来,需要建立更加系统的基准数据体系。例如,通过构建来源比例已知的人工混合实验,可以测试模型对来源贡献比例估计的准确性;通过长期生态监测和受控微生物群落实验,则可以评估模型在动态环境中的稳定性和泛化能力。
随着微生物组数据规模不断扩大,深度学习为未来MST的发展提供了新的可能。相比传统机器学习方法,深度学习能够从更加复杂的数据结构中学习潜在表示,并适用于大规模、多来源以及弱标签微生物数据分析。未来,图神经网络(Graph Neural Networks, GNN)等方法有望用于模拟微生物之间的相互作用网络和传播过程;Transformer等基础模型则可能帮助构建具有跨数据集迁移能力的微生物表征体系。这些新兴人工智能技术将推动MST从基于微生物丰度匹配的预测模式,进一步发展为融合生态机制、空间信息和时间动态的智能推断框架。
总体而言,机器学习已经显著提升了微生物溯源处理复杂微生物组数据的能力,但未来的发展重点将不再只是追求更高的预测准确率,而是构建更加透明、可靠并符合生态规律的人工智能体系。通过结合可解释机器学习、生态过程模型以及新一代深度学习技术,MST有望从“预测来源”进一步发展为理解微生物传播、组装和生态过程的重要研究工具。