社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

Uppsala/中南/华科 Adv. Mater.:机器学习加速仿生 NRR 催化剂设计,从 SMILES 到 TOF/TON

AI-电化学家 • 2 周前 • 69 次点击  

一句话概括:本文将量子化学描述符、实验条件变量和 27 类机器学习模型整合到仿生分子 NRR 催化剂设计流程中,实现对 TOF、TON、反应性和稳定性的预测,并进一步给出可解释的结构-性能设计原则。

题目:Machine Learning Accelerated Computational Design of Bio-Inspired Catalysts in the Nitrogen Reduction Reaction

DOI:10.1002/adma.73603

通讯作者:Shaoqi Zhan

01

研究亮点

RESEARCH

· · ·

仿生分子 NRR 催化剂能够在温和条件下活化 N2,但其性能同时受到金属中心、配体几何、电子结构、酸/还原剂、溶剂和反应时间等因素影响,传统 DFT 或经验筛选很难直接面向实验 TOF/TON 进行设计。本文构建了量子化学计算与机器学习耦合的分子催化剂预测框架,基于约 524 条实验数据训练分类和回归模型,并将催化剂按结构家族拆分建模。模型在 family 1 和 family 2 中分别实现高精度 TOF/TON 预测,部分任务 R2 达到 0.91、0.88、0.96 和 0.99。通过 SHAP 与 PDP 分析,作者进一步揭示高自旋金属中心、第一配位层空间排斥、配体电荷、酸等量、酸 pKa、还原剂电势和反应时间等因素如何共同决定 NRR 性能。该工作的重要性在于,模型不是只预测单一结构活性,而是把真实实验条件纳入可解释设计流程,并可从 SMILES 输入快速输出候选催化剂性能

02

图文解析

RESEARCH

· · ·

图1 | 面向分子 NRR 催化剂的机器学习-量子化学闭环流程

图1展示全文的整体工作流。图1左侧为 development 阶段,作者从实验数据和 SMILES 输入出发,结合量子化学计算提取分子结构、电子结构和反应条件描述符,并训练神经网络、树模型和集成模型。中间 analysis 部分包括模型评估、混淆矩阵、回归散点图以及 SHAP/PDP 解释,用于判断模型可靠性和关键特征。右侧 applications 部分则将模型用于新分子预测、候选结构筛选和迁移学习。

这张图确立了本文不是单点计算研究,而是以实验数据库为核心的预测平台。其关键思路是把催化剂结构和实验条件共同编码,使模型直接学习可观测的 TOF、TON 和选择性指标

图2 | 不同催化剂家族的特征筛选与相关性分析

图2展示 family 1 和 family 2 催化剂的主成分分析及相关性矩阵。图2a,d分别给出 PCA 结果,用于判断多少主成分可以覆盖数据集主要方差。图2b,e展示筛选后描述符之间的 Pearson 相关性,帮助剔除冗余变量。图2c,f进一步比较描述符与催化目标之间的相关性,显示不同结构家族中控制 TOF、TON 和选择性的变量并不相同。

该图说明,NRR 分子催化剂不能用单一通用描述符解释。family 1 更依赖酸等量、配位角和局域电荷等因素,而 family 2 中还原剂电势、酸 pKa、反应时间和金属局域电子结构具有更强影响

图3 | 分类模型对反应性、稳定性和选择性的预测表现

图3通过混淆矩阵展示最佳分类模型的测试集表现。图3a,b分别对应 family 1 的反应性和稳定性分类,RF 与 AdaBoost 模型能够正确区分高/低活性和高/低稳定性样本。图3c-e展示 family 2 中反应性、稳定性和选择性分类,其中反应性和稳定性模型同样表现较好,选择性任务则出现少量误分类。

该图强调了分类任务的工程意义。在早期筛选阶段,先用模型判断候选是否具备足够反应性和稳定性,可以显著减少后续高成本计算与实验验证负担

图4 | 回归模型对 TOF 和 TON 的定量预测

图4给出不同回归模型在训练集和测试集上的表现,以及最佳模型的预测-实验对比。图4a,b分别对应 family 1 中 TOF 和 TON 的预测,ET 模型和 AdaBoost 模型分别达到较高测试 R2图4c,d对应 family 2 中 TOF 和 TON 的预测,ET 和 GBDT 模型表现更优,测试 R2  分别达到 0.96 和 0.99。

这组结果说明,树模型和集成模型更适合处理 NRR 实验数据中的非线性结构-条件耦合。模型能够跨越较宽 TOF/TON 范围给出定量预测,为候选分子排序和反应条件优化提供直接依据

图5 | family 1 催化剂的 SHAP 解释与最优特征画像

图5解析 family 1 催化剂中关键特征如何影响模型输出。图5a-d分别展示反应性、稳定性、TOF 和 TON 模型的 SHAP 重要性分布。图5e总结最优特征组合,包括较高自旋态、较小配位层空间排斥、合适的配位角和强酸/合适还原剂组合。图5f-j以一个 Fe 基催化剂为例,用 waterfall 图展示各特征如何逐步推高或降低最终预测值。

该图将机器学习从预测工具推进到设计规则提取。对于 family 1,酸等量、金属自旋、配体几何和第一配位层电荷共同决定 NRR 活性,而强酸和强还原剂也可能同时带来 HER 竞争风险

图6 | family 2 催化剂的关键特征和代表性 Mo 催化剂解释

图6对应 family 2 催化剂的模型解释。图6a-e展示反应性、稳定性、选择性、TOF 和 TON 模型中的特征贡献。图6f总结最优 family 2 催化剂特征,指向单核八面体构型、高自旋金属中心、合适的单齿/三齿配体电荷分布和实验条件组合。图6g-l以 Mo 催化剂为例,说明不同特征如何共同驱动预测反应性、稳定性、选择性以及 TOF/TON。

与 family 1 相比,family 2 的设计窗口更强烈依赖实验条件和配体场。这提示分子催化剂的机器学习不能只比较金属和配体骨架,还必须把酸、还原剂、溶剂和反应时间纳入统一描述

图7 | 结构外推与 family 3 催化剂迁移学习验证

图7考察模型对结构差异明显催化剂的外推能力。图7a比较 family 1 最优模型迁移到 family 3 催化剂后的 TOF 和 TON 预测,TON 预测 R2 达到 0.86,TOF 预测 R2 为 0.65。图7b用 SHAP waterfall 图解析代表性 family 3 催化剂,说明虽然结构拓扑不同,但局域电荷、配位角、空间排斥和酸等量仍能解释预测趋势。

该图是模型实用性的关键验证。模型能够在未参与训练的分子骨架上保留一定预测能力,说明其学习到的不是简单记忆结构,而是部分可迁移的催化设计规律

图8 | 从 SMILES 输入到 NRR 性能输出的自动化工作流

图8展示作者开发的 NRR 催化剂评价流程。用户可以输入配体 SMILES、金属、氧化态、溶剂和实验条件,程序自动生成配合物结构并进行多层级几何优化和单点计算。随后,脚本提取 HOMO/LUMO、偶极矩、局域电荷、d 电子数等描述符,并调用训练好的 ML 模型输出 TOF、TON、选择性和反应性预测。

这张图将论文从模型评估推进到可操作工具链。以 SMILES 为入口的流程降低了新催化剂建模门槛,也为未来接入开放数据库、图神经网络和自动化实验闭环留下接口

03

对我们的启发

INSIGHT

· · ·

对我们而言,这篇文章最值得借鉴的是把实验条件作为材料/分子设计变量,而不是噪声项。作者明确把酸 pKa、酸等量、还原剂电势和反应时间纳入模型,使预测对象更接近真实实验指标。后续我们做催化数据挖掘时,也应避免只用结构描述符解释活性,而要将电解液、反应气氛、浓度、时间和测试协议一起结构化。

第二点启发是,可解释性不是模型训练后的装饰,而应直接服务候选设计。本文通过 SHAP/PDP 把黑箱预测拆解为可讨论的配位角、电荷、自旋和实验条件贡献,再回到 SMILES 工作流筛选新分子。对于我们后续建立 AI 辅助催化剂筛选流程,模型预测、特征解释和可执行输入格式需要同步设计。

04

结论与展望

OUTLOOK

· · ·

本文解决的核心问题是:如何在复杂实验条件下预测和设计仿生分子 NRR 催化剂。作者整合量子化学计算、结构特征工程、实验条件变量和机器学习模型,实现对反应性、稳定性、选择性、TOF 和 TON 的多任务预测。该工作证明,实验数据库驱动的可解释模型可以从分子结构中提炼催化设计原则,并用于新催化剂快速筛选。

后续值得关注的方向包括:扩大失败样本和低活性样本比例,提升跨文献实验条件的一致性;将深度学习模型与量子化学描述符结合,降低高通量计算成本;并把模型预测接入自动化合成和实验反馈。对于 AI 催化剂设计,从单次预测走向可更新、可解释、可实验闭环的工作流将比单纯追求更高 R2 更重要。

版权:推送内容仅供学习交流分享使用,版权归论文作者和单位所有,文章内容仅代表本公众号观点,欢迎批评指正,如有侵权请联系后台删除或修改,感谢支持!

投稿:非常欢迎各位老师在公众号上介绍课题组最新或经典研究成果!后台联系即可。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198430