DeepEnzyme 文献分析
文章中文题目
DeepEnzyme:利用蛋白三维结构特征改进酶转换数 kcat 预测的稳健深度学习模型
- 英文题目:DeepEnzyme: a robust deep learning model for improved enzyme turnover number prediction by utilizing features of protein 3D-structures
- 作者:Tong Wang, Guangming Xiang, Siwei He, Liyun Su, Yuguang Wang, Xuefeng Yan, Hongzhong Lu
- 期刊:Briefings in Bioinformatics, 2024, 25(5), bbae409
- DOI:https://doi.org/10.1093/bib/bbae409
文章一句话总结
DeepEnzyme 将蛋白序列 Transformer、蛋白三维结构 contact-map GCN 和底物分子图 GCN 融合,用于预测酶 kcat,其主要价值是用结构信息缓解低序列相似度条件下的动力学预测退化,并提供突变效应和关键残基权重的辅助解释。
图形摘要

![]()
该图概括 DeepEnzyme 的三类输入、三类编码器和三个输出层面:kcat 数值预测、低同源稳健性、突变效应/活性位点权重提示。图中数值来自论文正文:ColabFold 结构平均 pLDDT 为 92.67,测试集 PCC 约 0.77,R2 约 0.58–0.60。
摘要全文翻译
转换数 kcat 表征酶的催化效率,在蛋白工程和合成生物学等领域具有广泛应用。实验测定酶的 kcat 通常耗时。近年来,基于深度学习的 kcat 预测模型在一定程度上缓解了这一问题。然而,kcat 预测的准确性和稳健性仍需显著提高,尤其是在测试酶与训练集酶序列相似度较低时。本文提出 DeepEnzyme,这是一种结合最新 Transformer 和图卷积网络(GCN)的深度学习模型,用于同时捕获蛋白序列和三维结构信息。为提升预测准确性,DeepEnzyme 利用序列和三维结构的集成特征进行训练。结果显示,借助高质量蛋白三维结构提供的额外信息,DeepEnzyme 在处理与训练集低序列相似的酶时表现出较强稳健性。DeepEnzyme 还能够评估点突变对酶催化活性的影响,有助于识别对催化功能重要的残基位点。总体而言,DeepEnzyme 是利用蛋白三维结构改进酶 kcat 预测的一项尝试,在准确性和稳健性上优于若干既有算法,并有助于理解不同物种中酶功能及其进化模式。
文章解决的主要问题
该研究针对的是酶动力学参数预测中的 kcat 预测问题。kcat 是酶在底物饱和条件下单位时间内转化底物分子的最大数目,直接影响酶工程、酶约束代谢模型和合成生物学路径设计。
已有模型如 DLKcat、TurNuP、DLTKcat 主要依赖蛋白序列、底物和/或产物信息。它们能够进行大规模预测,但在测试酶与训练酶序列相似度较低时容易出现性能下降。作者认为,蛋白三维结构相对于氨基酸序列更保守,更接近活性位点可及性、底物结合位点、折叠稳定性和催化功能,因此应作为 kcat 预测的重要输入。
因此,DeepEnzyme 的核心问题不是“能否预测任意酶-底物是否反应”,而是“当酶-底物组合已给定时,能否利用蛋白三维结构改进 kcat 数值预测,尤其是在低序列同源性条件下保持稳健”。
核心方法与技术路线
DeepEnzyme 的输入包括三部分:蛋白一级序列、蛋白三维结构和底物 SMILES。
蛋白序列部分采用 Transformer。与 DLKcat 类似,蛋白序列被切分为氨基酸 n-gram 片段,经嵌入层、位置编码和 Transformer encoder 提取序列特征。
蛋白三维结构部分先用 ColabFold 预测结构。论文报告所有预测结构的平均 pLDDT 为 92.67,说明结构整体质量较高。随后作者按 Cα-Cα < 10 Å 的阈值将蛋白结构转换为 contact map,其中残基是节点,空间距离小于阈值的残基对形成边。该残基图输入 GCN,用于提取结构特征。
底物部分使用 RDKit 从 SMILES 中生成 molecular fingerprints 和 adjacency matrix,再输入 GCN 提取底物图特征。
模型融合时,将底物图特征、蛋白结构图特征和蛋白序列 Transformer 特征合并为综合 embedding,并通过后续网络预测 kcat。论文正文称最终使用 neural attention mechanism 捕获不同残基位点权重;代码核查显示,公开仓库中的 DeepEnzyme.py 将三类特征均值池化后拼接,经线性层输出预测值。残基权重解释部分主要来自结构特征权重的归一化分析。
数据方面,作者从 DLKcat 数据集中下载原始记录,并用 MMseqs2 评估序列相似度。为降低训练、验证和测试之间高序列相似性带来的过拟合,作者对具有相同底物且序列相似度大于 90% 的酶-底物对,只保留最长酶序列对应记录。最终数据集包含 11,927 个不同酶-底物组合,并按 80%、10%、10% 随机划分训练、验证和测试集。
评价指标包括 R2、RMSE 和 Pearson 相关系数(PCC)。对比模型包括 DLKcat、TurNuP 和 DLTKcat。低序列相似度稳健性通过 MMseqs2 将测试集按与训练集的序列相似度分为 0–50%、50–90%、90–100% 三组后评估。
主要结果
第一,DeepEnzyme 在测试集上取得较好的 kcat 预测性能。论文报告测试集 PCC 接近 0.77,整体 R2 约 0.6。五轮训练的平均测试 R2 约为 0.58。作者认为结构信息是性能提升的重要来源。
第二,模型在不同酶类别中的性能不均衡。突变酶的 PCC 为 0.84,高于野生型酶的 PCC 0.67。按 EC 一级分类看,EC 1 和 EC 2 的表现更好,这与数据集中 EC 1、EC 2 记录占比更高有关。该结果提示 DeepEnzyme 仍存在数据分布依赖。
第三,结构信息提高了低序列相似度条件下的稳健性。作者将测试酶按与训练酶的序列相似度分层后发现,DeepEnzyme 在 0–50% 序列相似度区间仍保持较稳定 R2,而 DLKcat 和 DLTKcat 的 R2 变化更明显。论文用两个 EC 号均为 1.3.3.4 的酶作为示例:来自 Myxococcus xanthus 和 Bacillus subtilis 的两个蛋白序列相似度仅 27%,但结构 TM-score 达 0.8762,说明结构保守性可以补充序列相似度不足。
第四,DeepEnzyme 可用于突变效应的定性排序。作者在 CYP2C9 大规模变体数据集中比较 missense variants 和 nonsense variants,预测 kcat 中位数分别约为 1.97 s-1 和 1.60 s-1,差异显著,与实验中 nonsense variants 活性较低一致。作者还在 PafA 饱和突变数据集中比较高 kcat 突变和低 kcat 突变,预测高 kcat 突变的中位 kcat 比低 kcat 突变高约 15%,P 值为 0.0033。
第五,DeepEnzyme 的结构权重可提示功能位点。作者在 PafA 和人 EMP pathway 中的 P00558 上分析结构权重,发现 binding/active sites 的权重显著高于一般位点;高权重位点与已知活性/结合位点在结构空间上相邻或部分重叠。该结果说明模型的结构特征可能捕捉到与催化相关的局部区域,但这仍是解释性相关证据,不等同于机制因果证明。
第六,作者展示了 genome-scale metabolic models 中的 kcat 批量预测应用。DeepEnzyme 被用于预测 E. coli、Mus musculus、Saccharomyces cerevisiae、Homo sapiens 等代谢模型中的酶催化反应 kcat 分布,说明其可作为 GEM 参数补全工具。
代码与数据核查
GitHub 仓库结构包括 Code、Data、Results、README.md 和 requirements.txt。Code/Model/DeepEnzyme.py 中模型主体包括 substrate fingerprint embedding、protein word embedding、protein Transformer、GCN、dropout、线性输出层等。GCN.py 中实际启用的路径较简化,许多多层 GCN 和 attention 代码被注释,当前 forward 主要调用 layer4。protein_transformer.py 实现位置编码和 PyTorch TransformerEncoder。train.py 包含数据加载、AdamW 优化、MSE loss、R2/RMSE/MAE 评估逻辑。Code/Example/example.py 展示从 SMILES、蛋白序列和 PDB 结构构造输入并预测的流程。
该代码核查支持“模型代码可公开获取”的说法,但复现边界也较明确:README 较短,模型依赖的训练大文件在 figshare,输入预处理、结构文件准备、GPU 环境和数据版本对复现影响较大。公开代码能够支撑方法理解和示例预测,但仍需要进一步运行验证才能确认完整训练结果可复现。
文章创新点
第一,DeepEnzyme 将蛋白三维结构作为 kcat 预测的一等输入。相比只使用序列或底物/产物表示的模型,它明确利用 contact map GCN 提取残基空间接触信息。
第二,DeepEnzyme 关注低序列相似度泛化。作者不仅给出随机测试集性能,也按测试酶与训练酶的序列相似度分层比较模型表现,这比单一随机划分更接近实际应用中的远缘酶预测问题。
第三,模型尝试把 kcat 预测与突变效应解释连接起来。CYP2C9 和 PafA 的分析说明,DeepEnzyme 不只是给一个绝对数值,还可以用于变体相对趋势判断和活性相关残基提示。
第四,文章展示了在 genome-scale metabolic models 中进行大规模 kcat 补全的可能性,适合与酶约束代谢模型结合。
文章局限性与可改进方向
第一,数据规模仍小。预处理后只有 11,927 个酶-底物组合,且 EC 类别、野生型/突变体比例不均衡。模型在数据丰富类别中表现更好,说明泛化仍受数据分布限制。
第二,缺少实验条件输入。kcat 强烈依赖 pH、温度、缓冲体系、底物浓度、辅因子和测定方法。DeepEnzyme 未纳入这些变量,因此预测的是跨条件混合后的近似值。
第三,结构表示较粗。整体 contact map 能描述残基空间接触,但没有显式聚焦催化口袋、底物结合 pose、反应中心、辅因子和过渡态。模型能找到高权重残基,并不说明已经学到催化机制。
第四,突变效应验证主要是定性分组比较。CYP2C9 和 PafA 结果支持模型能区分部分高低活性趋势,但尚不足以证明模型可以高精度预测所有单点突变或组合突变的定量 kcat。
第五,复现证据仍需进一步加强。代码公开,但文档较短,完整训练依赖 figshare 大文件和预处理流程。若作为后续基线,需要本地复现实验确认数据切分、模型参数、训练轮数和性能指标。
原文图导读
图 1:DeepEnzyme 框架

![]()
图 1 展示 DeepEnzyme 的三输入三编码器结构。蛋白序列由 Transformer 提取特征;蛋白三维结构先转为 Cα contact map,再由 GCN 提取结构特征;底物 SMILES 由 RDKit 转为指纹和邻接矩阵,再由 GCN 提取分子图特征。三类特征融合后预测 kcat。该图支撑文章的核心方法定位:DeepEnzyme 是结构增强的动力学参数预测模型。
图 2:测试集性能与输入类型消融

![]()
图 2 比较 DeepEnzyme 在测试集、野生型/突变体、不同 EC 类别以及不同输入组合下的表现。主要结论是 DeepEnzyme 在测试集 PCC 接近 0.77,突变体预测优于野生型,EC 1 和 EC 2 表现更好,结构+序列+底物的完整输入优于只用结构或只用序列的模型。
图 3:与既有模型对比及低序列相似度稳健性

![]()
图 3 比较 DeepEnzyme、TurNuP、DLKcat、DLTKcat 的 R2 和 RMSE,并按测试酶与训练酶序列相似度分组。DeepEnzyme 在 0–50% 低相似度区间保持较好性能,是全文最关键的证据之一。图 3d/e 的例子说明,序列相似度低的酶仍可保持高结构相似度,这支持作者引入结构信息的动机。
图 4:饱和突变数据集验证

![]()
图 4 使用 CYP2C9 和 PafA 的大规模突变实验数据验证 DeepEnzyme 的突变效应判断能力。CYP2C9 中 nonsense variants 的预测 kcat 低于 missense variants;PafA 中实验高 kcat 突变的预测 kcat 高于实验低 kcat 突变。该图支持 DeepEnzyme 可用于变体初筛,但不是高精度突变动力学预测的充分证明。
图 5:残基权重与活性/结合位点

![]()
图 5 比较 PafA 和 P00558 中模型高权重位点与 UniProt 注释的 binding/active sites。高权重位点与已知功能位点在结构上接近或重叠,说明模型的结构特征具有一定功能相关性。该图更适合作为突变位点提示证据,而不是催化机制证明。
图 6:代谢模型中的 genome-scale kcat 预测

![]()
图 6 展示 DeepEnzyme 对多个 GEM 中酶催化反应的 kcat 分布预测,包括 Homo sapiens、Mus musculus、Saccharomyces cerevisiae、E. coli 和 Geobacter metallireducens。该图说明 DeepEnzyme 可被用于大规模代谢模型参数补全。
最全1000+植物核基因组数据库IMP (点击图片直达)

高颜值免费 SCI 在线绘图(点击图片直达)

往期精品(点击图片直达文字对应教程)
Cytoscape Excel PPT

公众号投稿联系:陈同 (chentong_biology@163.com)