Py学习  »  机器学习算法

ESP 论文精读:基于机器学习和深度学习的通用酶-小分子底物预测模型

生信宝典 • 1 周前 • 98 次点击  

ESP 论文精读:基于机器学习和深度学习的通用酶-小分子底物预测模型

论文:A general model to predict small molecule substrates of enzymes based on machine and deep learning
作者:Alexander Kroll, Sahasra Ranjan, Martin K. M. Engqvist, Martin J. Lercher
期刊:Nature Communications, 2023, 14:2787
DOI:https://doi.org/10.1038/s41467-023-38347-2
PubMed:https://pubmed.ncbi.nlm.nih.gov/37188731/
代码与数据:https://github.com/AlexanderKroll/ESP  

文章中文题目

基于机器学习和深度学习预测酶的小分子底物范围的通用模型

文章一句话总结

ESP 是早期通用酶-底物配对预测模型的代表工作:它用 GO/UniProt 中的实验证据构建正样本,用相似小分子采样构建困难负样本,再用任务特异 ESM-1b 酶表示、GNN 小分子表示和 XGBoost 判断酶-小分子是否配对;模型在原始独立测试集上表现强,但主要适用于训练集中已有或相近的小分子化学空间。

摘要全文翻译

对于大多数被注释为酶的蛋白,人们并不知道它们催化哪些主要反应或次级反应。实验表征潜在底物耗时且成本高。机器学习预测可以提供一种有效替代方案,但该方向受到非底物信息缺乏的限制,因为可用训练数据主要由正样本组成。本文提出 ESP,这是一个用于预测酶-底物配对的通用机器学习模型,在独立且多样的测试数据上准确率超过 91%。ESP 可应用于差异很大的酶和训练数据中包含的广泛代谢物,并且优于针对个别、研究充分的酶家族所设计的模型。ESP 通过一个改造后的 Transformer 模型表示酶,并使用随机采样的小分子作为非底物来扩充训练数据。通过便捷地进行潜在底物的计算测试,ESP Web server 可支持基础研究和应用研究。

文章解决的主要问题

该领域此前存在什么关键瓶颈?

酶功能数据库中正样本远多于可靠负样本。大量蛋白可以被注释为酶或酶家族成员,但具体底物范围、兼性底物和非底物边界通常没有系统实验测量。没有负样本时,监督式二分类模型难以学习“某个相似小分子不是该酶底物”的边界。

另一个瓶颈是模型适用范围。早期底物预测模型多针对单个酶、单个酶家族或 EC 类别,依赖密集实验矩阵、活性位点结构或人工特征。它们可以在小范围内表现良好,但不适合大规模酶序列与多种代谢物之间的通用配对筛选。

该文章的具体科学问题或技术问题?

文章提出的问题是:能否建立一个只依赖酶氨基酸序列和小分子结构、跨多种酶家族预测具体酶-底物配对的通用模型?围绕这个问题,作者必须同时解决三个技术环节:如何构建可用的正负样本集,如何把酶序列压缩为与底物预测相关的表示,如何把小分子结构表示为适合配对判别的向量。

为什么关注该问题?

酶-底物关系是代谢网络补全、酶功能注释、天然产物生物合成、生物催化路线设计和代谢工程的基础。若模型能在候选底物集合中排序或排除明显不可能的配对,就能降低实验筛选规模。ESP 的定位不是直接给出动力学参数或反应机理,而是作为早期候选筛选层,把实验资源集中到更可能成立的酶-小分子组合。

既往研究做到哪一步?

此前已有模型用于细菌 nitrilase、植物 glycosyltransferase 等特定家族的底物预测,也有模型尝试把底物映射到 EC 类别。但这些方法往往不能区分同一 EC 类中不同酶的底物范围,或需要几乎完整的酶-小分子实验矩阵。ESP 将问题推进到“具体酶序列—具体小分子”的通用二分类任务。

作者提出的新思路是如何自然引出的?

作者将数据库中确认的酶-底物关系作为正样本,并认为在一组有限的生物代谢物中,多数与真实底物结构相似的小分子仍不是该酶底物,因此可以作为困难负样本近似。随后,作者用 ESM-1b 改造出任务特异的酶表示,用 GNN 学习任务特异小分子表示,再用梯度提升树完成配对判别。

核心方法与技术路线

数据来源或研究对象

研究对象是酶-小分子底物二分类配对。作者从 GO annotation database 中提取催化 GO term,利用 Rhea reaction ID 或 GO term 定义中的文本信息获得反应底物,再映射到 KEGG、ChEBI 或 PubChem 标识符。最终用于主模型训练和测试的实验证据正样本包括 18,351 个酶-底物配对,覆盖 12,156 个唯一酶和 1,379 个唯一底物。

作者还提取了 274,030 个系统发育推断证据的酶-底物配对。这部分证据层级低于直接实验,不用于最终 XGBoost 主分类器训练,而是用于预训练/微调任务特异 ESM-1b 酶表示

负样本构造

公共数据库很少记录明确的非底物。ESP 的核心数据工程是负样本构造:对每个真实酶-底物配对,作者为同一个酶随机采样 3 个小分子作为负样本。这些小分子来自整个数据集中已出现过的代谢物,并尽量与真实底物结构相似,默认 RDKit 指纹相似度约 0.7-0.95;如果候选不足则逐步放宽下限。

这个设计使负样本不是过于容易区分的随机小分子,而是更接近“相似但未标注为底物”的困难负样本。它的风险也很明确:其中可能混入尚未被数据库记录的真实底物,尤其是在底物谱宽或研究不足的酶家族中。

数据集划分

最终数据集包含 69,365 个条目,按 80% 训练、20% 测试划分。为了避免近同源蛋白泄漏,作者使用 CD-HIT 进行序列聚类,确保测试集中任一酶与训练集中任一酶的序列同一性不超过 80%。此外,作者把测试集按酶与训练集最大序列同一性进一步分为 0-40%、40-60%、60-80% 三组,以评价远缘酶上的性能。

该划分比普通随机划分更严格,但仍不是完整的 ligand-cold、scaffold-cold 或 double-cold 评估。作者后来也在结果中明确显示:模型对训练集中未出现的小分子表现显著下降。

酶表示:任务特异 ESM-1bts

作者使用 ESM-1b 作为酶序列表征基础。普通 ESM-1b 通常通过对最后一层残基表示求均值得到蛋白级向量,这可能丢失与具体任务相关的信息。ESP 对 ESM-1b 架构做了一个关键修改:加入一个额外的 1280 维“whole-enzyme token”,让该 token 在 Transformer 更新过程中汇聚全酶信息。

训练时,作者把这个 whole-enzyme token 与小分子 ECFP 向量拼接,通过全连接网络预测酶-小分子是否配对。训练完成后,提取该 token 的 1280 维向量作为任务特异酶表示,称为 ESM-1bts。为了获得足够训练信号,作者把实验证据和系统发育推断证据合并,形成约 287,000 个配对用于该表示学习阶段。

小分子表示:ECFP 与任务特异 GNN 指纹

作者比较了两类小分子表示。第一类是 1024 维 ECFP,使用 RDKit 根据小分子图结构计算。第二类是 GNN 学习到的 100 维任务特异小分子指纹。GNN 采用 directed message passing neural network 思路,把原子和键特征作为输入,经过消息传递和池化得到分子向量。

GNN 还先在 KM 预测任务上进行预训练,再微调用于酶-底物二分类任务。这个预训练被证明能提升最终配对预测性能。相较 ECFP,GNN 指纹也减少了不同小分子映射为完全相同表示的情况。

主分类器

最终 ESP 模型把 1280 维 ESM-1bts 酶向量和 100 维 GNN 小分子向量拼接,输入 XGBoost 梯度提升树进行二分类。作者对学习率、树深度、正则化、迭代次数和负样本权重等超参数进行 5 折交叉验证,并确保同一酶不会跨验证折出现。

核心发现

发现 1:任务特异酶表示和任务特异小分子表示共同提升性能

四种表示组合的独立测试集结果如下:ESM-1b + ECFP 的 ROC-AUC 为 0.937、准确率 87.2%、MCC 0.69;ESM-1bts + ECFP 为 0.950、90.5%、0.75;ESM-1b + GNN 为 0.940、88.8%、0.72;ESM-1bts + GNN 为 0.956、91.5%、0.78。

这说明性能提升不是来自单一模块。对酶侧,whole-enzyme token 任务微调优于普通均值池化 ESM-1b对小分子侧,GNN 任务指纹优于 ECFP。二者结合形成 ESP 的最佳版本。

发现 2:ESP 对未见酶有一定泛化,但性能仍随序列相似性增加

在测试酶与训练酶最大序列同一性为 60-80% 时,ESP 准确率 95%、ROC-AUC 0.99、MCC 0.88;在 40-60% 时,准确率 93%、ROC-AUC 0.97、MCC 0.83;在 0-40% 时,准确率仍有 89%、ROC-AUC 0.93、MCC 0.72。

这个结果是 ESP 的重要贡献:它证明序列 PLM 表示可以支持跨酶家族或低同源区域的配对预测。但这里的“未见酶”仍应理解为蛋白侧低同一性,而不是蛋白和小分子双侧同时完全外推。

发现 3:未见小分子是 ESP 的主要短板

当小分子没有出现在训练集中时,模型性能明显下降。对未见小分子且酶与训练集同一性仅 0-40% 的配对,准确率为 71%、ROC-AUC 0.59、MCC 0.15。即便酶侧有 60-80% 同一性,未见小分子子集 MCC 也只有 0.27。

作者据此明确建议 ESP 主要用于训练集中已有小分子或训练集覆盖的小分子范围。Web server 也会报告输入代谢物在训练集中作为真实底物出现的次数,以提示适用域。

发现 4:训练数据规模仍是主要性能驱动因素

作者用 30%-100% 不同比例的训练集训练模型,发现准确率和 ROC-AUC 随训练数据增加而上升。作者进一步指出,新增更多非重叠数据库中的底物数据,尤其是为新小分子补充少量正样本,可能显著改善性能。

这个结论对当前酶-底物模型开发仍然重要:模型结构改进有价值,但真正限制新化学空间外推的仍是底物覆盖、负样本语义和冷启动评估。

发现 5:预测分数可作为不确定性线索

ESP 输出 0-1 之间的预测分数。作者发现正确预测多集中在接近 0 或 1 的区域,错误预测更均匀分布;约 4% 测试数据分数落在 0.4-0.6,该区间预测准确率只有 59%、ROC-AUC 0.60、MCC 0.17。作者建议实际应用时不要把 0.4-0.6 的预测直接判为正或负,而应视为不确定。

发现 6:ESP 优于两个家族特异模型,但比较边界要清楚

作者将 ESP 与 bacterial nitrilase 底物模型和 plant glycosyltransferase 的 GT-Predict 比较。加入对应训练数据后,ESP 在 nitrilase 测试集上准确率 87.5%、ROC-AUC 0.94、MCC 0.75,优于原模型的 82% 准确率和 0.90 ROC-AUC。在植物 glycosyltransferase 两个测试集上,ESP 准确率与 GT-Predict 相近,但 MCC 更高。

这说明通用模型可以在特定家族中达到或超过专用模型。但当不加入这些家族训练数据时,由于测试小分子多数未出现在 ESP 原训练集中,ESP 性能较差。因此该比较支持“数据覆盖后通用模型可迁移”,而不支持“零样本新底物空间已解决”。

原文图导读

图 1:模型总览

图 1 展示 ESP 的整体流程:实验确认的酶-底物正样本和采样构造的负样本分别被编码为酶向量和小分子向量;两个向量拼接后输入梯度提升模型;训练完成后可对候选酶-小分子组合输出预测分数。该图的核心信息是:ESP 是一个 pair-level classifier,不是单独的酶注释器或小分子分类器。

图 2:任务特异 ESM-1b 表示

图 2 比较普通 ESM-1b 和改造后的 ESM-1bts。普通 ESM-1b 通过残基表示均值池化得到蛋白向量;ESM-1bts 加入 whole-enzyme token,并在酶-底物二分类任务中端到端训练,使该 token 专门存储与底物预测相关的全酶信息。该图是 ESP 方法创新的关键。

图 3:四种表示组合的性能

图 3 展示交叉验证准确率和测试集 ROC 曲线。最佳组合是 ESM-1bts + GNN,说明酶侧和小分子侧的任务特异表示均有贡献。

图 4:按酶序列同一性和小分子是否已见分层的泛化

图 4 是理解 ESP 适用边界的核心图。对已见小分子,低同一性酶仍表现不错;对未见小分子,模型明显失效。该图把 ESP 的优势和短板同时展示出来。

图 5:训练集规模效应

图 5 显示训练集比例越高,准确率和 ROC-AUC 越好。该结果支持后续通过 BRENDA、SABIO-RK、UniProt 等数据库扩充底物覆盖的方向。

图 6:预测分数与不确定性

图 6 显示预测分数接近 0 或 1 时更可靠,接近 0.5 时错误率高。该图为实验筛选提供了一个实用规则:中间分数段应进入人工复核或补充证据,而不是直接作为强阳性或强阴性。

文章创新点

  1. 数据工程创新:在缺少系统非底物测量的情况下,提出相似小分子负样本构造策略,使模型学习相似底物之间的边界。该策略后来也成为酶-底物模型争议的核心,因为它既提供了训练信号,也引入潜在 hidden positives。

  2. 表示学习创新:将 ESM-1b 改造为任务特异酶表示模型,通过 whole-enzyme token 捕获与下游配对任务相关的信息,而不是简单均值池化残基表示。

  3. 模型系统创新:把任务特异酶表示、GNN 小分子表示和 XGBoost 组合成一个跨酶家族的通用酶-底物配对框架,是后续 ProSmith、FusionESP、VIPER、MESI/OmniESI 等工作的直接基线或数据来源之一。

  4. 适用域报告创新:作者主动报告未见小分子上的性能下降,并在 Web server 中提示小分子在训练集中出现次数。这种适用域意识比单纯报告整体准确率更有价值。

对后续研究的启发

对 Enzyme 项目的定位

ESP 应作为酶-底物配对预测的基础源头工作和轻量预筛层,而不是机制验证层。它回答“这个酶是否可能接受这个训练化学空间内的小分子”这一问题,不能直接回答产物是什么、反应中心在哪里、kcat/Km 多高、突变后是否增强、是否存在催化构象。

对模型开发的启发

后续模型不应只比较总体 ACC/AUC,而应分层报告:蛋白同一性、底物是否已见、底物 scaffold 是否已见、反应类别是否已见、双冷启动组合、负样本来源和预测分数校准。ESP 的未见小分子结果说明,提升小分子侧外推能力比继续优化普通随机/弱冷测试集更关键。

对数据建设的启发

应系统记录三类标签:实验阳性、实验阴性、未测未知。缺少真实阴性时,可以使用相似小分子负采样,但必须标记其构造规则,并通过后续数据库更新或高通量实验估计假阴性比例。对天然产物和中药酶挖掘尤其如此,因为许多底物和兼性反应尚未被数据库收录。

对实验设计的启发

ESP 适合把候选底物从几百个降到几十个,但需要把高分、低分和 0.4-0.6 不确定区间样本都纳入少量实验,以评估模型在目标酶家族上的校准情况。若目标底物没有出现在训练集中,应优先补充 1-2 个同类小分子的实验阳性样本或建立家族内小规模 seed screen。

文章局限性与可改进方向

数据集是否充分?

相对于早期酶-底物模型,18,351 个实验证据配对已经较大;但相对于酶和化学空间,它仍非常稀疏。1,379 个底物不能覆盖真实生物代谢物和天然产物化学空间。系统发育证据虽然增加了酶侧训练信号,但其证据等级低于直接实验。

负样本是否可靠?

负样本来自“相似但未标注为底物”的小分子,不等于实验测得无活性。该策略适合作为训练近似,但容易把未注释兼性底物标为负样本。后续工作需要 measured inactive panels、positive-unlabeled learning、temporal label audit 或 family-specific assays 来评估这一风险。

对照是否严格?

作者使用了蛋白序列同一性控制,避免了最明显的近同源蛋白泄漏。但缺少严格 ligand-similarity split、scaffold split、reaction split 和 double-cold split。后续 DataSAIL 风格研究显示,ESP 类模型在 ligand-cold 和 double-cold 场景下可能显著降分。因此,ESP 的 91.5% 准确率应限定在原文数据划分和训练化学空间内理解。

方法是否存在适用边界?

ESP 只输入序列和 2D 小分子结构,不显式输入蛋白结构、口袋、辅因子、底物构象、反应中心或实验条件。它适合做候选配对筛选,不适合做催化机制解释、产物预测、动力学参数预测或突变效应预测。

后续需要哪些验证?

需要构建真实实验阴性数据,进行 ligand-cold、scaffold-cold、reaction-cold 和 double-cold benchmark;需要加入反应中心、辅因子和活性位点结构;需要做概率校准和适用域检测;需要用目标酶家族的 prospective wet-lab screen 检验高分候选是否真正富集。

适合快速传播的问答式总结

Q1:ESP 研究什么?
A:ESP 预测一个具体酶和一个小分子是否构成底物关系,是酶-底物配对二分类模型。

Q2:它为什么重要?
A:实验测底物范围成本高,而酶数据库缺少大量具体底物和非底物信息。ESP 提供了一个可以大规模筛选候选底物的计算入口。

Q3:它怎么构建训练数据?
A:正样本来自 GO/UniProt 中有实验证据的酶-底物关系;负样本通过为同一酶采样与真实底物结构相似但未标注为底物的小分子构造。

Q4:模型结构是什么?
A:酶侧使用改造后的 ESM-1bts 生成 1280 维任务特异向量;底物侧使用 GNN 生成 100 维任务特异指纹;二者拼接后输入 XGBoost 分类器。

Q5:表现如何?
A:最佳模型在原始独立测试集上达到 91.5% 准确率、0.956 ROC-AUC 和 0.78 MCC。

Q6:最关键的创新是什么?
A:一是相似小分子困难负样本构造,二是 whole-enzyme token 任务特异微调 ESM-1b,三是把酶序列和小分子图表示结合成通用配对模型。

Q7:最大短板是什么?
A:未见小分子。训练集中没有出现的小分子会导致模型性能大幅下降,尤其是在酶侧也低同源时。

Q8:能不能用于新天然产物底物?
A:可以作为初筛参考,但如果新底物 scaffold 不在训练集中,模型分数可靠性有限。应结合结构、反应中心、同源酶证据和小规模实验校准。

Q9:预测分数怎么用?
A:接近 0 或 1 的分数相对可靠;0.4-0.6 应视为不确定,不宜直接作为阳性或阴性结论。

最全1000+植物核基因组数据库IMP (点击图片直达)

高颜值免费 SCI 在线绘图(点击图片直达)


往期精品(点击图片直达文字对应教程)

Linux      Python  

R绘图   NGS基础   GEO高级

 生信自学   生信书籍    系列教程   心得体会
转录组经典   宏基因组   蛋白质组   单细胞系列   测序发展史
    免费在线画图   色彩搭配   图形排版   图形解读   
       ChIP-seq     TCGA     GSEA     WGCNA       

     海哥组学     傻瓜系列    文章写作 

 Cytoscape   Excel  PPT

机器学习



公众号投稿联系:陈同 (chentong_biology@163.com)




Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198735