光催化反应是现代有机合成与可持续能源转化的重要前沿,其核心在于光催化剂对电子的高效捕获与释放。铱(III)配合物因具有优异的光吸收与电荷转移特性,被广泛应用于光氧化还原催化循环中。然而,光催化剂的基态与激发态氧化还原电位精确预测一直是该领域的关键难题。实验测定复杂且昂贵,传统量子化学方法又难以兼顾计算效率与准确性,成为制约光催化剂理性设计的“瓶颈”。
近年来,东北师范大学化学学院关威教授/朱博副教授团队围绕光氧化还原催化体系,持续开展系统的理论研究与方法创新。团队基于多年在多循环协同金属光催化机理研究的积累,首次构建了一套将密度泛函理论(DFT)计算与机器学习深度融合的预测框架,实现了对铱(III)光催化剂基态与激发态氧化还原电位的快速、精准预测。该模型在确保高精度的同时,大幅降低了计算成本,并通过可解释性分析揭示了关键的结构–活性关系(SAR),为高性能光催化剂的智能设计提供了理论依据与计算工具。更为重要的是,团队进一步将该模型拓展至锇(Os)体系,实现了小样本条件下的跨金属迁移预测,展示了方法的普适性与强大潜力。
这一研究成果为光催化剂的高通量筛选与定向设计开辟了新路径,也为光氧化还原催化、太阳能燃料转化及绿色能源化学的发展提供了重要的理论支撑。
在光催化领域,如光解水和二氧化碳还原等反应中,光催化剂的氧化还原电位是决定其性能的核心参数,直接影响其在光激发后获取或传递电子的能力,从而决定反应的驱动力与选择性。
然而,传统研究手段存在明显局限:实验测量耗时高、成本大,难以满足高通量筛选需求;而理论计算虽能揭示机理,却计算量庞大、激发态预测精度有限。如何在准确性与效率之间取得平衡,成为光催化剂设计的关键挑战。
因近年来,机器学习为这一难题提供了新路径。通过融合高精度量子化学计算与数据驱动算法,研究者得以在保证精度的同时显著降低计算成本,实现光催化剂关键性质的快速预测与筛选。
在此背景下,本文以铱(III)光催化剂为模型体系,建立了DFT与机器学习相结合的统一预测框架,可高效准确地预测基态与激发态氧化还原电位。该研究揭示了控制氧化还原行为的关键结构–性质关系(SAR),并展示了模型在其他金属体系(如锇)中的良好可迁移性,为光催化剂的智能设计与加速发现提供了新思路。
本研究的工作流程如方案1所示,是一个系统化的三步走策略:
方案1. 用于筛选 PC-Ir氧化还原电势的强大工作流程
模块一:高质量数据集构建
研究人员从超过500篇文献中手动提取了519个结构多样的Ir(III)配合物,形成了一个全面的数据库。为了确保数据的一致性和可靠性,他们对所有结构进行了统一的DFT计算,获得了四种关键的氧化还原电位:基态氧化电位(Gox),基态还原电位(Gred),激发态氧化电位(Eox),激发态还原电位(Ered)。
模块二:分子描述符提取
从DFT计算结果中,提取了两大类分子描述符作为机器学习的输入特征:
1、常规2D描述符:如MACCS指纹、摩根指纹、RDKit物理化学参数。这些描述符计算快捷,能有效捕捉分子整体结构信息。
2、物理有机描述符:专门设计用于捕捉与氧化还原过程密切相关的电子特性,如前沿分子轨道能量、静电势、局域电离能等。这些描述符计算成本较高,但能提供更深入的机理信息。
模块三:回归、分析与预测平台
这是研究的核心,采用了两种互补的建模策略:
1、独立模型:为Gox、Gred、Eox、Ered分别建立四个独立的预测模型,侧重于模型的可解释性和深入的SAR分析。
2、组合模型:将氧化和还原过程合并,建立两个统一的模型:
① 模型G:同时预测基态的Gox和Gred。
② 模型E:同时预测激发态的Eox和Ered。
此策略侧重于计算效率和高通量筛选。
图1 展示了数据集中配体的多样性,包括单齿、双齿、三齿和四齿配体,其中包括各类配体的代表性化学结构,确保了模型能够在广阔的化学空间中进行学习和预测。
图 2. PC-Ir的电势综合图:还原电位(上)和氧化电位(下)
图 2 直观的展示了所选代表性催化剂的氧化还原电位分布,范围从-3.5 V到3.0 V,涵盖了满足多数光催化反应所需的宽广电位范围。图中每种催化剂的结构都清晰标注,揭示了细微的结构变化如何导致电化学性质的显著差异,为理解构效关系提供了可视化参考。
模型训练遵循示意图2所示流程,包括数据划分、特征筛选、模型训练与验证。
a) 数据集按结构多样性划分为训练集(70%)、样本外集 OOS(20%)和分布边缘集 EOD(10%),用于评估模型的泛化与外推能力。
b) 采用 10 折交叉验证进行模型选择,结合递归特征消除(RFECV)优化特征,并通过 SHAP 分析实现特征排序与可解释性评估,确保模型的稳健与可靠。
图3. 对 PC-Ir氧化还原电势的机器学习SAR分析
此图全面评估了独立模型的性能和可解释性:
1、高性能预测
如图 3a-d 所示,所有四个独立模型都表现出优异的预测精度,大多数预测值与DFT计算参考值之间的误差在 ±0.3 V 以内,证明了模型的可靠性。
2、可解释性分析——SHAP的威力
① 特征重要性排序:图 3e 比较了不同模型中各类特征的相对重要性。一个关键发现是,不仅初始态(如 Ir(III))的特征重要,最终态(如氧化后的 Ir(IV)或还原后的 Ir(II))的特征也对预测电位有同等重要的贡献。这挑战了传统设计中仅关注初始态的习惯。
② 关键描述符识别:图 3f-i 的 shap 图清晰地展示了各个关键描述符如何影响电位预测。
例如,对于 Gox,Ir(IV) 物种的 β-LUMO 能量越高,越有利于氧化反应的发生(即降低氧化电位);对于 Gred,Ir(II)物种的静电势平均值越低,其还原能力越强(即还原电位越高)。
3、个案深度解读
图 3j-m 的 SHAP 力图针对具有极端电位(最低氧化或最高还原电位)的具体催化剂进行解读,直观展示了是哪些特征及其贡献方向共同导致了该催化剂卓越的活性。
为了解决独立模型计算冗余、不利于高通量应用的问题,关威教授/朱博副教授团队开发了组合模型。
模型G(基态):
通过筛选,最终确定 ExtraTrees 算法 + RDKit 描述符 为最优组合。
a) 热图比较了不同算法与特征集的性能;
b) 柱状图显示 ET/RDKit 在高精度与低计算成本间实现最佳平衡;
c) 模型 G 在交叉验证、OOS 与 EOD 测试中均表现优异(R² > 0.92),仅依赖易得的 2D 分子结构,即可快速准确预测基态电位。
图 5. 针对 PC-Ir 激发态势能预测的性能优化
模型E(激发态):
激发态预测更具挑战。研究者通过三阶段优化(图5a),构建了创新性的 RDKit-Rx 特征集,将易于计算的 RDKit 描述符与少量来自氧化/还原态 DFT 计算的关键物理有机特征相结合。最终模型 E(ExtraTrees/RDKit-Rx) 在图5c 中表现出卓越性能,在 R² > 0.86 的高精度下,成功避免了耗时的激发态几何优化,实现了效率与精度的兼顾。
图 6. 使用 Ir训练的基本模型(灰色)和残差迁移模型(红色)预测的 Os光催化剂 的电势:a)G-T 模型;b)E-T 模型。
直接迁移的局限:
将 Ir 模型直接用于 Os 配合物时,预测效果较差,激发态模型出现明显系统误差(图6b,灰色散点)。
残差迁移学习的成功:
研究者利用少量特征相似的 Os 数据对 Ir 模型进行微调校正。
显著提升:
校正后的模型 G-T 与 E-T(图6a,b,红色散点)大幅提升预测精度,表现与使用完整 Os 数据训练的模型相当,展现出小样本条件下的高效跨金属迁移能力。
本研究的成功之处在于:
1. 构建高效预测框架:结合高精度 DFT 与可扩展机器学习,建立了统一的模型体系(G 与 E),实现光催化剂氧化还原电位的高通量、低成本预测,为催化剂虚拟筛选提供了高效工具。
2. 揭示结构–性质机理:通过 SHAP 等可解释性分析,定量揭示了分子电子结构对氧化还原性质的调控规律,使催化剂设计从“经验试错”走向“理性设计”。
3. 展现优异迁移能力:跨金属迁移学习验证了模型的泛化性,证明该框架可推广至钌、铜、铁等其他过渡金属体系。
展望未来:通过引入更多金属中心、更复杂配体及物理信息神经网络,该框架有望进一步拓展应用范围,助力光催化在清洁能源转化与绿色合成中的突破性发展。
关威,现任东北师范大学化学学院教授,博士研究生导师。研究方向主要针对惰性化学键活化和转化的催化科学,开展理论计算与模拟驱动精准化学合成研究,以第一作者/通讯作者在J. Am. Chem. Soc., Angew. Chem. Int. Ed., Nature Commun.等杂志发表论文60余篇。先后主持国家自然科学基金、教育部产学合作协同育人项目及其它省部级科研和教改项目多项。
朱博,现任东北师范大学化学学院副教授,硕士研究生导师。研究工作围绕光-多金属协同催化与限域催化两个方向,重点突破惰性化学键的高效活化与转化。同时,将机器学习方法应用于光催化剂性质的研究与预测,以期为新型高效催化体系的设计提供辅助和指导。作为第一作者在J. Am. Chem. Soc., Angew. Chem. Int. Ed., ACS Catal.等杂志发表学术论文30余篇。
李雪涛,现为东北师范大学物理化学系博士研究生。2020年获得山西师范大学学士学位。其研究主要利用机器学习手段,结合DFT计算开展材料预测与设计,并拓展至光酶催化领域的研究。
文章题目:
Machine Learning-Assisted Prediction of Ground- and Excited-State Redox Potentials in Iridium(III) Photocatalysts
全文链接:
https://doi.org/10.1002/ange.202517393