一、研究背景与现存瓶颈
酶是支撑生物代谢、医药合成、生物能源、塑料降解等领域的核心生物催化剂,但天然酶普遍难以满足工业场景对催化效率、稳定性的需求,定向进化、酶筛选成为改造挖掘高活性酶的主流手段。kcat(催化转换数)、Km(米氏常数) 是评判酶催化性能的核心动力学参数,然而传统实验测定通量低、人力成本高,机器学习预测模型成为替代实验、加速酶工程的关键工具。
现有酶动力学预测模型分为两类:早期模型依赖人工提取特征,泛化能力差;近年主流大语言模型(LLM)仅依靠蛋白、底物序列编码特征,完全忽略底物与催化口袋的三维相互作用这一决定催化活性与底物选择性的核心信息。少量尝试融合序列与结构多模态特征的模型仅采用简单特征拼接策略,无法有效对齐催化口袋局部拓扑与全局序列特征,在训练集与测试酶序列同源性低的场景下预测精度大幅下滑。同时现有模型未系统整合 pH、温度、宿主来源等环境变量对动力学参数的调控作用,难以还原真实催化条件下酶的动力学行为。
针对上述缺陷,本文开发GraphKcat多模态几何深度学习框架,显式融合酶 - 底物三维催化口袋结构信息、蛋白 / 底物大模型序列表征、环境条件特征,实现 logkcat 与 logKm 联合预测,为理性酶工程提供结构导向计算工具。
二、GraphKcat 方法体系构建
2.1 数据集构建与预处理
研究采用 MPEK 数据集作为基础数据源,原始数据包含 17893 条 kcat、24585 条 Km 记录,每条样本由蛋白序列、底物 SMILES、生物来源、pH、温度五元组唯一定义;对相同输入条件下存在冲突的动力学数据,统一保留最优催化性能对应数值,剔除重复、缺失条目。采用 Chai-1 v0.5.1 共折叠模型批量生成酶 - 底物复合物构象,选取置信度最高结合姿态,经 Rosetta FastRelax 消除原子碰撞,剔除结构预测失败、底物远离结合口袋的无效样本,最终得到 21999 条训练样本、2774 条测试样本。借助 MMseqs2 将序列按 40%/60%/80%/99% 同源度聚类划分测试集,用于评估模型在低同源、跨家族酶场景下的泛化能力。
2.2 催化口袋多尺度图编码器设计
【图 1 GraphKcat 酶 - 底物活性位点表征与动力学预测图编码器架构及推理流程】
模型核心创新为原子 - 粗粒度双尺度图神经网络,分层提取催化口袋三维相互作用信息:
复合物结构预处理:输入蛋白序列与底物 SMILES,经 Chai-1 预测结合构象、Rosetta 能量松弛后提取催化口袋;全原子图编码:以蛋白、底物重原子为节点,原子间距构建边,采用 SE (3) 等变图神经网络(EGNN)捕捉原子级残基 - 底物相互作用;粗粒度(CG)图聚合:将全原子特征通过 GATv2Conv 层聚合至氨基酸 / 底物分子片段级粗粒度节点,分三类专用 GATv2Conv 层分别建模底物分子内、口袋残基分子内、酶 - 底物分子间相互作用;该分层架构兼顾精细原子作用与催化口袋整体拓扑,在 PDBbind、CASF-16 标准基准集上对比现有图模型,验证了结构提取模块的有效性。2.3 多模态交叉注意力融合模块(MMCAF)
【图 2 GraphKcat 模型整体架构概览】
GraphKcat 整合四类输入特征:催化口袋粗粒度结构图表征、蛋白预训练语言模型(ESM2)序列嵌入、底物 Uni-Mol2 分子嵌入、环境元数据(物种、pH、温度)。为解决多模态特征空间不兼容问题,设计含 6 层参数共享的多模态交叉注意力融合模块(MMCAF)
,每层执行成对双向跨注意力交互,依次完成口袋结构、底物结构、蛋白序列、分子序列特征的迭代对齐,通过残差连接保留各模态原始信息,避免全连接注意力稀释催化口袋局部信号,融合后特征接入两层线性层同时输出 logkcat、logKm 预测值。训练过程冻结预训练大模型权重,仅微调图编码器与融合模块参数。
2.4 分子动力学模拟配套分析流程
为解析高活性候选酶的结构机制,研究搭建标准化分子动力学(MD)分析流程:以 AlphaFold 预测蛋白结构为初始体系,PROPKA、H++ 修正残基质子化状态,AMBER ff19SB 蛋白力场、GAFF 底物力场构建体系;GROMACS 完成能量最小化、NVT/NPT 平衡、3 组 200 ns 复制生产模拟;通过 RMSD、聚类、相互作用能分解、活性位点电场定量计算,解析残基 - 底物结合强度与催化静电环境差异。
三、模型基准测试与消融实验结果
3.1 与主流动力学预测模型横向对比
【图 3 模型预测性能对比及输入结构置信度对预测效果的影响】
选取 DLKcat、UniKP、MPEK 三类代表性基线模型,在统一数据集下完成对比:
无同源过滤标准数据集:kcat 预测 PCC:DLKcat (0.789)、UniKP (0.825)、MPEK (0.805)、GraphKcat (0.822);Km 预测 PCC:DLKcat (0.651)、UniKP (0.782)、MPEK (0.777)、GraphKcat (0.792),GraphKcat 整体表现最优;严苛低同源场景(训练 / 测试酶序列同源≤40%):GraphKcat 优势显著,kcat 预测 PCC 达 0.544,显著高于 UniKP (0.406)、MPEK (0.478)、DLKcat (0.282);Km 预测 PCC 为 0.680,优于其余基线。序列同源度越低,仅依靠序列大模型的基线性能衰减越明显,证明显式催化口袋结构特征是跨家族酶预测的关键补充信息。模型对输入结构预测置信度(pLDDT)具备鲁棒性:蛋白、底物 pLDDT 与预测误差无显著相关性,对底物姿态施加 0.5 Å 随机扰动后,模型仍保持稳定预测精度(kcat PCC=0.818,Km PCC=0.775),说明模型依赖口袋粗粒度拓扑而非精确原子坐标。3.2 消融实验验证各模块贡献
【图 4 不同序列同源阈值下 GraphKcat 及其变体消融实验性能对比】
设置四类模型变体拆解各模块贡献:
移除口袋交互图模块:低同源条件下 kcat PCC 由 0.544 降至 0.532,Km PCC 由 0.680 降至 0.672,催化口袋三维相互作用信息可有效区分进化距离较远酶的功能差异;移除环境特征:kcat 预测性能大幅下降(PCC 0.544→0.466),Km 预测几乎不受影响,证明催化转换效率 kcat 对温度、pH 等环境条件高度敏感,底物亲和力 Km 受环境调控较弱;仅使用 ESM2/SaProt 序列嵌入基线:低同源场景预测性能衰减最严重,单独序列表征无法捕捉局部催化微环境差异。3.3 注意力可视化验证模型生物学可解释性
【图 5 深度学习模型在酶序列筛选与突变活性预测任务中的基准测试】
【图 6 蛋白 - 底物交叉注意力热力图定性可视化结果】
对羧酸酯酶、β- 半乳糖苷酶开展注意力权重分析,模型高注意力权重残基完全匹配已知催化关键位点:羧酸酯酶催化三联体 Ser144-His295-Asp266、底物疏水相互作用 Tyr72;β- 半乳糖苷酶催化亲核残基 Glu201、糖结合口袋 Arg109/Asn200 等保守残基均被高亮。注意力热力图证明 GraphKcat 自主学习到具备生物学意义的残基 - 底物相互作用模式,并非单纯拟合数据分布,具备可靠的机理解释能力。
四、实际酶筛选案例实验验证
【图 7 GraphKcat 辅助谷氨酰胺酶与覆盆子姜酮合酶候选酶优先级排序流程与实验筛选结果】
搭建完整计算筛选流程:ProTrek 蛋白检索工具从大型序列库初筛功能同源序列,过滤序列同源<35%、TM-score<0.85 的远源序列,经 Chai-1 构建复合物后由 GraphKcat 预测动力学参数并排序,选取前 17 名候选开展体内异源表达活性验证,选取两类工业高价值酶完成验证。
L - 谷氨酰胺酶筛选:17 株候选酶全部成功表达,13 株催化活性优于枯草芽孢杆菌原始酶 BSGlnAse;最优变体 GA15 催化活性提升 22 倍;对比 DLKcat、CataPro 序列模型,GA15 在 GraphKcat 中排名 15,在 DLKcat、CataPro 中仅排 70、271 位,结构信息可精准挖掘序列相似度低但口袋功能优异的突变体;覆盆子姜酮合酶(RZS)筛选:7 株候选酶活性高于原始 RiRZS,最优变体 RZS6 活性提升 2.7 倍;两类候选酶与训练集最近同源蛋白序列相似度仅 44.8%、53.3%,证明模型不依赖近源序列匹配,可实现远源高活性酶挖掘。五、高活性变体分子动力学机制解析
【图 8 分子动力学轨迹揭示谷氨酰胺底物在原始酶与优化酶中的结合模式、相互作用能分解及电场分析】
以最优谷氨酰胺酶 GA15 为对象,通过 MD 模拟解析活性提升分子机制:
底物结合稳定性:原始酶模拟中出现底物脱离口袋现象,GA15 复合物全程稳定;总相互作用能 GA15(-153.8 kcal/mol)显著优于原始酶(-145.9 kcal/mol),静电相互作用是结合能提升核心来源;关键相互作用:GA15 中 Arg192 与底物羧基形成额外盐桥,解离该相互作用的 R192A 虚拟突变可使 log (kcat/Km) 由 2.17 降至 - 0.76,大幅削弱催化效率;活性位点电场效应:GA15 底物羰基 C=O 键方向存在更有利的静电场,可稳定亲核进攻过程中羰基氧生成的负电荷过渡态,降低反应能垒,从静电层面解释催化效率提升。六、研究结论与未来展望
6.1 核心结论
本文提出GraphKcat多尺度几何深度学习框架,首次将完整酶 - 底物催化口袋三维结构、多模态序列表征、环境变量融合用于 kcat、Km 联合预测;依靠双尺度等变图网络与 MMCAF 交叉注意力模块,解决多模态特征融合难题;基准测试证明 GraphKcat 在常规数据集性能持平最优序列模型,低序列同源场景下泛化能力显著超越所有仅基于序列的基线模型,且对结构预测中等误差具备鲁棒性;注意力可视化、虚拟突变、分子动力学分析证实模型真实捕捉残基 - 底物功能相互作用,具备生物学可解释性;工业酶筛选实测试验证明 GraphKcat 可嵌入酶挖掘流水线,高效富集跨家族高活性候选酶,为理性酶改造提供可靠定量排序工具;MD 模拟阐明高活性变体依靠更强静电结合、更优催化口袋电场实现性能提升。6.2 现有局限与后续改进方向
数据集缺陷:现有动力学数据缺少金属辅因子、辅酶信息,模型无法完整描述辅因子依赖型酶催化机制;口袋表征局限:固定 8 Å 配体中心子图仅覆盖正构结合口袋,难以建模别构位点与远距离催化网络;静态结构缺陷:模型仅采用单一静态酶 - 底物复合物,无法体现催化过程构象动态变化;优化方向:后续可引入自适应口袋提取策略、多序列比对进化特征、动态构象采样模块,进一步拓展模型适用范围。七、研究资源说明
原文链接:https://doi.org/10.1021/acscatal.6c03874
GraphKcat 代码托管于https://github.com/ld139/GraphKcat;预处理训练数据集存储于 Zenodo;TAL、DpADA 测试数据集引用公开文献;全部分子模拟、模型训练参数、补充实验结果详见文章补充信息。