通讯作者:袁申富
通讯单位:云南大学化学科学与工程学院、国际河流与生态安全研究院
论文DOI:10.1016/j.apenergy.2026.128913(点击文末「阅读原文」,直达链接)
全文速览机器学习正在推动CO2甲烷化催化剂研发从经验试错向数据驱动设计转变,但模型决策过程难以解释、虚拟候选空间与真实实验数据分布严重不匹配,限制了其在催化剂筛选和优化中的可靠性。针对这两项挑战,该工作构建了融合注意力机制与生成对抗网络的可解释生成式机器学习框架EA-GAN,形成催化性能预测、候选生成、虚拟筛选和实验验证的闭环工作流程。EA-GAN在CO2甲烷化任务中表现出出色的预测性能(R2=0.9049、MAE=0.0613),并构建了包含20,000个候选催化剂的虚拟库;随后对九种代表性催化剂进行的实验验证表明理论预测和实验性能之间具有高度一致性。进一步研究发现,反应温度对催化性能的影响呈现边际收益递减特征,主要载体类型是调节这一趋势的重要因素。基于以上分析,提出了低温CO2甲烷化的双重优化思路:协同提升催化剂本征活性与调控氢气分压。这项研究为数据驱动的催化剂设计提供了新的研究路径。
背景介绍CO2甲烷化能够将CO2与氢气转化为甲烷,这不仅有助于缓解全球环境危机,还提供了一种高效的储能手段。催化剂的活性、选择性以及反应条件共同决定着这一过程的效率。然而,催化剂组成、制备参数和操作条件之间存在复杂的非线性关系,传统依赖经验的逐项筛选往往需要大量实验,难以高效探索广阔的设计空间。机器学习(ML)已成为加速催化剂发现的强大工具。尽管近年来ML模型在准确预测催化性能方面表现出巨大的潜力,并为实验设计提供了宝贵的指导。但它们的广泛采用仍然面临着两个主要挑战。(i)复杂ML模型的有限解释性,尽管许多先进的ML模型具有出色的预测能力,但其决策过程仍然高度不透明。它们固有的复杂性,通常涉及数百万个参数,使得很难追踪输入特征和输出预测之间的关系。(ii)分布偏差,这种偏差源于传统模型能力的局限性:由于它们仅作为孤立的、被动的预测模块运行,缺乏主动设计新候选催化剂的能力,研究人员被迫依赖化学直觉或组合方法来构建虚拟数据集。因此,机器学习框架EA-GAN围绕以上两个问题,将注意力机制的特征归因能力与GAN的数据生成能力结合,建立从计算预测走向实验验证的研究流程。
图1. EA-GAN用于CO2甲烷化催化剂发现的整体框架。
本文亮点1.构建一个可解释的生成式机器学习框架加速CO2甲烷化催化剂发现。
2.注意机制确保了催化性能预测的高准确性和特征可解释性。
3.生成了包含20,000个虚拟催化剂数据库。
图文解析1、从性能预测到候选生成的协同框架
该工作基于公开的CO2甲烷化数据集开展,包含1993个样本和29个特征,涵盖催化剂组成、制备条件、反应条件与性能指标。模型以催化剂组成及制备、反应参数为输入,预测CO2转化率、CH4选择性和CH4产率。EA-GAN包括三个核心模块。性能预测模块在神经网络中引入自注意力机制;生成模块学习真实数据的分布,提出含催化剂组成、制备参数与反应条件组合的虚拟数据库。随后,协同工作模块集成了反应输入的生成模型与催化剂性能预测模型,加速发现新型催化剂。
2、注意力机制提升催化性能预测能力

图2. 四种模型对CO2转化率、CH4选择性和CH4产率的预测结果。(a–c)EA-GAN预测模型,(d–f)ANN,(g–i)XGBoost,(j–l)RF。
为了评估EA-GAN中的预测模型,选择了三个代表性基准模型(ANN、XGBoost和RF)进行比较分析。对于CO2转化率,EA-GAN预测模型的R2达到0.9049,高于ANN的0.8844与RF的0.7688;EA-GAN的MAE为0.0613,低于ANN的0.0647与RF的0.1152。对于CH4产率,加入注意力机制后,R
2由0.8763提升至0.8997。预测值与实验值的散点分布表明,EA-GAN预测模型能够较好地捕捉催化体系中的非线性关系。此外,还进一步研究EA-GAN预测模型的稳定性,监测并分析了随着训练周期的变化,三个预测任务(CO2转化率、CH4选择性和CH4产率)的训练和测试数据集之间的MSE变化趋势,观察到MSE随训练逐步下降并趋于稳定。这表明该模型的预测表现出高重现性,且不易出现随机或不可预测的波动,这对于获得可靠和最佳的催化性能预测至关重要。
3、生成20,000个候选催化剂的虚拟库并检验分布一致性

图3. 生成数据与真实数据的统计分布比较。(a)Wasserstein距离,(b)特征均值雷达图,(c)PCA。
经过数据归一化和5000次迭代训练后,生成模型成功生成了包含20,000个候选催化剂的虚拟库。特征均值在生成的数据集和真实数据集之间表现出高度一致性,这表明生成模型已经准确地捕捉到了原始数据分布的中心趋势。t-SNE可视化分析证实真实数据和生成数据集的分布呈现出极高的重叠度,表明生成的数据具有很高的保真度。这一结果有力地证明了我们的生成模型可以有效地捕捉和重建真实数据背后的复杂非线性结构。19个标准化连续特征的平均Wasserstein距离(WD)为0.0594,多数特征的WD低于0.1;两组数据的特征均值之间R2达到0.9831。主成分分析进一步显示,真实数据和生成数据均需要13个主成分达到95%的累计解释方差,说明生成模型较好地保留了数据的整体结构。
4、分析温度边际效应与载体作用

图4. 三项预测任务及整体任务中各输入特征的平均注意力权重。(a)CO2转化率,(b)CH4选择性,(c)CH4产率,(d)所有预测任务。
利用注意力权重分析输入特征对预测结果的影响,并通过SHAP进行交叉比较。两种方法均将反应温度、煅烧温度和活性组分含量识别为重要参数。为了进一步阐明催化性能的决定因素,对比前10%的高性能子集和后10%的低性能子集,发现低性能组中反应温度的注意力权重较高,而高性能组对温度的依赖明显减弱。这表明当催化体系已经具备较高活性时,继续升温带来的影响可能逐步降低。偏依赖图(PDP)进一步分析了这一趋势:模型预测的平均CO2转化率随温度升高先增加,随后增幅减小;在约360℃以上,升温带来的边际贡献趋于平缓。此外,还对原始数据中仅改变反应温度的实验进行分析,观察到多个催化体系在约350℃附近出现转化率增长放缓或下降的趋势。在不同组成因素的比较中,主要载体类型对高温区CO2
转化率变化趋势的影响尤为突出。模型分析显示,Al2O3、CeO2和La2O3载体对应的体系在高温区保持较稳定的预测转化率,而部分其它载体体系出现明显下降。

图5. 反应温度和平均CO2转化率之间的关系:(a)活性金属含量,(b)还原气氛中氢气含量,(c)促进剂含量,(d)主要载体含量,(e)反应压力,(f)煅烧温度,(g)反应气氛中惰性组分的含量,(h)还原温度,(i)还原时间。
5、探讨影响CO2低温转化的关键因素
为了阐明低温条件下控制CO2转化率的关键参数,将原始数据集分为两个不同的子集:高活性组(CO2转化率> 0.7)和低活性组(CO2转化率< 0.3)并进行了统计分析。在所考察的数据中,ZrO2载体体系在高活性组中更为集中,而SiO2载体体系更多分布于低活性组,表明载体选择与低温性能密切相关。除催化剂本身外,原料中惰性组分含量和H2/CO2比也是区分两组性能的重要反应参数。惰性组分增加会稀释反应物,而提高H2/CO2比有助于维持氢气供给,促进表面中间体的加氢。因此,提出低温性能优化应同时关注催化剂的本征活性与反应气氛:通过载体及其与活性金属组成改善CO2活化能力,并通过进料组成调节氢气分压,从而提升催化剂的低温CO2转化率。

图6. 高活性组与低活性组的参数比较。(a)平均值,(b)差异值,(c)标准差。高活性组与低活性组离散数据的分析:(d)活性金属,(e)主要载体类型,(f)载体2类型和(g)促进剂。
总结与展望该工作将具有注意力机制的性能预测模型与GAN生成模型结合,建立了面向CO2甲烷化催化剂发现的EA-GAN框架。EA-GAN不依赖事后归因方法,而是结合注意力机制来生成内在归因信号。与此同时,基于GAN的生成模块成功拓展了化学空间探索的边界,实验验证证实了模型的预测准确性。此外,还系统地阐明了温度的边际效应。分析表明,温度对催化性能的影响遵循边际收益递减规律:对于低活性催化剂,温度是决定性因素;相反,对于高活性催化剂,其重要性显着降低到可忽略的水平。进一步的机制分析表明,主要载体类型的热稳定性及其与活性金属的相互作用强度是决定高温稳定性和边际效应的关键描述符。最后,该研究提出了在低温下实现高CO2转化率的双重优化策略:同时提高催化剂的本征活性和调节氢分压条件。这一综合框架为开发高效的CO2甲烷化催化剂提供了理论基础。
未来,该框架仍需在更广泛的催化剂体系和更大规模的实验数据上检验泛化能力。注意力机制虽然提供了模型内部归因信号,但其结果主要反映统计关联,尚不等同于完整的反应机理解释。结合原位表征、概念解释或因果推断方法,有望进一步分析结构与性能之间的关系,这将有助于推动高效低温CO2甲烷化催化剂的理性设计。
作者介绍
袁申富
,中国科学院大学工学博士,云南大学教授,博士生导师。现为云南大学能源化学工程中试平台(省级平台)主任,云南大学化学工程与工艺(本科)专业负责人及化学工程(硕士)学位点负责人。长期从事煤和生物质热解、催化热解、气化、煤焦油制芳烃、低碳催化和氢化工及工业固体废弃物资源化综合利用等领域的研究工作。建成了自主知识产权的云南大学能源化工中试平台(流化床+固定床热解气化装置-油品常减压+催化裂化精制装置),形成煤和生物质热解气化制燃料及化学品的关键技术。
业务介绍
研理云,研之成理旗下专门针对科学计算领域的高性能计算解决方案提供者。我们提供服务器硬件销售与集群系统搭建与维护服务。 ● 配置多样(单台塔式、两台塔式、多台机架式),按需定制,质量可靠,性价比高。
● 目前已经为全国 100 多个课题组提供过服务器软硬件服务(可提供相同高校或临近高校往期案例咨询)。
● 公司服务器应用工程师具有量子化学、第一性原理、分子动力学等相关学科研究背景。 ● 公司与多位化学、材料领域理论计算方向专家长期合作,一起探索最优服务器软硬件配置和部署。 ● 定制化硬件配置:提供售前实例测试,为您提供最合适的硬件配置方案。 ● 一体化软件服务:根据需求,发货前,完成系统、环境、队列、计算软件等所有内容的安装与配置,让您实现开机即用。 ● 完善的售后服务:为每位客户建立专属服务群,遇到问题及时解决。大大降低使用学生使用门槛和缓解老师压力。三年硬件质保 + 三年免费软件技术支持。 ● 已购买客户咨询:我们已有超过100位已购买客户,可以给您提供相同城市或者临近城市已购买客户的联系方式,以提供真实案例咨询。 ● 赠送课程学习机会:可选课程包括量子化学(Gaussian),第一性原理,(Vasp),分子动力学模拟(Lammps、Grommacs),钙钛矿计算模拟(Vasp)等。具体赠送方案以沟通结果为准。
更多科研作图、软件使用、表征分析、SCI 写作、名师介绍等干货知识请进入后台自主查询。