社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

中科大江俊、刘道彬、黄炎团队【AI4C】从光谱读懂材料:无需晶体结构,机器学习直接预测物性并推断晶体结构

AIChemLab • 1 月前 • 70 次点击  



本文总计5421字    预计阅读26分钟



01

一、论文基本信息

  1. 标题(Title): Spectroscopy-informed XANES–PXRD framework for multi-property prediction and structure inference
  2. 通讯作者 / 团队(Corresponding Author / Group): 刘道彬、黄焱、江俊(中国科学技术大学精准与智能化学全国重点实验室)
  3. 期刊(Journal): Chemical Science(Royal Society of Chemistry)
  4. 年份 / 接收日期(Year / Accepted): 2026年,接收于2026年5月18日,在线发表于2026年5月20日
  5. DOI: 10.1039/d6sc00651e
  6. 数据/代码开源地址: https://github.com/WangyLab/XANES-XRD_WorkFlow

02

二、研究背景与意义

材料科学的核心挑战之一,是如何在浩如烟海的化学空间中高效筛选出具有特定功能的材料。目前主流的计算筛选方法,无论是基于密度泛函理论(DFT)的第一性原理计算,还是以晶体图神经网络(CGNN)为代表的机器学习模型,几乎无一例外地依赖精确的晶体结构作为输入。这就造成了一个根本性的循环悖论:要预测新材料的性质,必须先知道它的结构;而对于尚未被表征的新材料,结构信息恰恰是缺失的。

实验表征手段中,X射线吸收近边结构谱(XANES)和粉末X射线衍射(PXRD)是最常用的两种技术。XANES对元素的局域电子态(氧化态、配位环境)极为敏感,而PXRD则直接反映材料的长程晶体对称性和相组成。二者在信息层次上天然互补,前者聚焦"局部",后者把握"全局",但迄今为止,极少有机器学习工作将二者深度融合,用于同时实现多性质预测与结构推断。

本研究正是针对这一痛点,提出了一个以光谱为驱动核心的统一框架:无需任何先验晶体结构知识,仅凭XANES与PXRD谱图,即可预测带隙、磁性、形成能、费米能级、密度等关键物性,并推断氧化态、配位数和晶系,最终实现完整晶体结构的推断。这一思路将光谱从"诊断工具"升级为"预测引擎",具有重要的方法论意义。

03

三、核心研究内容

3.1 大规模数据集构建

研究团队从Materials Project数据库中筛选了34,929个含2至5种元素的无机化合物,利用FEFF10软件模拟生成了逾10万条过渡金属K边XANES谱,覆盖氧化物、硫化物及混合阴离子体系。每条谱图被预处理为以吸收边为中心、覆盖56 eV能量窗口内的200个均匀强度点。

【Figure 2a:过渡金属元素在数据集中的分布频次柱状图】

数据集涵盖化学式从二元到五元的广泛体系,其中以ABC₂型三元化合物最为多见(1674条),组成分布较为均衡,为模型的泛化训练提供了充分保障。

3.2 SpecFusionNet模型架构

核心预测模型SpecFusionNet由两个并行模块组成:

多尺度卷积提取器:采用核尺寸为3、5、7的三路卷积分支,分别捕获XANES谱的前边(pre-edge)、主边(main-edge)和近边(near-edge)精细结构,三路输出拼接后经自适应池化与线性层输出谱特征。

【Figure 2b:SpecFusionNet整体架构图,包含多尺度提取器、元素特征处理器与多头注意力模块;SI Figure S4,多尺度卷积提取器示意图;SI Figure S5,元素特征处理器示意图】

元素特征编码器:对过渡金属(TM)和非过渡金属(non-TM)元素分别构建嵌入分支,编码原子序数(Z)、电负性(χ)、原子半径(r_atom)、逐级电离能(IE₁–IE₃)及元素类型(Type)等原子描述符,通过多头注意力机制将谱特征与成分特征自适应融合,生成最终预测。

值得注意的是,模型专门设计了掩码机制(masking),对零填充的变长输入不计入梯度更新,使不同元素数量的化合物可统一处理。

3.3 多任务物性预测性能

模型在8个预测任务上进行评估:4个分类任务(是否存在带隙BandGap、直接/间接带隙isGapDirect、是否磁性isMagnetic、磁序类型MagneticOrder)和4个回归任务(形成能E_f、费米能级E_fermi、带隙E_g、密度Density)。

【Figure 2c:四个分类任务的准确率与F1分数柱状图;Figure 2d–g,四个回归任务预测值vs实际值散点图,标注MAE和R²】

分类任务:所有任务的准确率和宏平均F1分数均超过0.82,其中带隙存在性(BandGap)分类准确率高达0.91,磁序(MagneticOrder)分类F1达0.82。

回归任务:形成能MAE仅0.15 eV(R²=0.95),密度MAE为0.48 g·cm⁻³(R²=0.93),展现了优秀的定量预测精度。

3.4 组成感知的部分测量策略

实验中测量所有元素的XANES谱成本高昂。研究发现,仅使用过渡金属边的"部分谱"策略与使用全元素谱的基线模型相比,带隙预测MAE仅增加0.05 eV,分类F1分数波动不超过6%。

【Figure 2h:全元素模型与部分测量策略的MAE和F1分数对比图】

这一结果在碱土金属体系和5d过渡金属/镧系元素的L₂,₃边XANES数据集上同样得到验证(SI Figure S9–S12),证明该策略具有良好的迁移性,可显著降低实验负担。

3.5 可解释性分析

消融实验:分别屏蔽TM融合矩阵和non-TM融合矩阵,两种情况均导致预测精度显著下降,说明过渡金属与非过渡金属特征对物性编码具有协同作用,缺一不可。

【Figure 3a:屏蔽不同元素融合矩阵的回归任务MAE对比消融柱状图;SI Figure S13,四个分类任务的消融准确率对比】

原子描述符贡献分析:原子序数Z的移除对所有任务影响最大;元素类型Type对密度预测的影响最为突出;电离能IE₁–IE₃对能带相关量(带隙、费米能级)贡献显著。

【Figure 3b、3c:TM与non-TM元素各原子描述符移除后ΔMAE柱状图;SI Figure S14,分类任务中描述符移除后ΔF1柱状图】

Grad-CAM可视化:对最后一层卷积层应用梯度加权类激活映射,揭示不同预测任务关注的谱区差异。以Y₂TiO₅(mp-17559)为例,预测形成能和费米能级时,Ti的前边与主边区域激活最强;预测密度时,Y的K边几乎主导了模型注意力,体现了Y³⁺大离子半径对晶格堆积的决定性作用。

【Figure 3d、3e:Ti和Y K边XANES的Grad-CAM热图,不同颜色标注不同预测任务的敏感能区;Figure 3f,Y₂TiO₅晶体结构球棍图】

3.6 PXRD晶系分类

为捕获长程对称性信息,研究者构建了CNN-Transformer混合架构对PXRD进行晶系分类。模拟PXRD谱经Voigt函数展宽处理后叠加高斯白噪声以模拟真实实验条件。

【Figure 4c:七种晶系在数据集中的数量分布;Figure 4d,PXRD晶系分类混淆矩阵,整体准确率0.81】

整体准确率达0.81,其中立方晶系准确率高达0.97,六方0.90,而单斜、三斜等低对称性晶系因衍射峰重叠严重,准确率在0.76–0.78之间。对比实验证明,单独PXRD(0.81)优于XANES(0.48)和融合输入(0.66),说明晶系分类信息主要编码于衍射谱的长程对称特征,混入局域XANES反而引入干扰。

3.7 氧化态与配位数预测

在XANES的局域结构描述能力方面,研究对所有过渡金属元素的氧化态和配位数分类进行了逐元素评估。

【Figure 4a:元素周期表形式展示各元素氧化态分类macro-F1分数;Figure 4b,各元素配位数分类macro-F1分数】

绝大多数过渡金属在两项任务上的macro-F1均超过0.90,体现了近边结构对d轨道占据数和配位场几何的高度敏感性。主族阳离子虽无d态,但系统性边移依然支持对其配位环境的可靠识别。

3.8 结构推断模块

框架的结构推断模块以XANES预测的氧化态、配位数和PXRD预测的晶系为约束,通过以下流程实现晶体结构推断:

  1. 依据整数价态规则,枚举满足电荷平衡的化学计量式候选集
  2. 从Materials Project全库中检索符合预测成分类型与对称性约束的晶体结构模板
  3. 依据配位环境相似性和离子半径相容性进行元素替换
  4. 对候选结构进行DFT几何优化
  5. 对比模拟谱(PXRD由VASP计算,XANES由FEFF10计算)与实验谱,以R_PXRD > 0.50为阈值选取最优结构

【Figure 5a,结构推断模块工作流程示意图;Figure 5b,从二元到五元体系的经验式预测、晶系分类和综合Top-1准确率随元素数量变化曲线】

在二元到五元体系中,经验式预测与晶系分类的联合Top-1准确率均超过0.80,以Ca₂MnAlO₅为例,框架成功从CaMnAlO₄和Ca₂MnAlO₅两个候选中,通过谱图一致性正确识别出目标结构。

3.9 实验验证

单相化合物验证:对七种实验合成的化合物(TiFe₂O₅、MnS、ZnFe₂O₄、CoFe₂O₄、V₂O₅、Co₂O₃、Co₃O₄)进行实验谱测量,与理论谱的对比显示边位置、峰强和精细结构振荡高度吻合。

【Figure 5c、5d:TiFe₂O₅的Fe K边和Ti K边实验谱、参考箔谱与FEFF模拟谱对比】

在结构分类任务上,七种样品的晶系预测准确率达100%,6/7样品氧化态与配位数完全一致(Co₃O₄因混合价态特殊性出现部分不一致)。在定量物性预测上,形成能绝对误差均低于0.24 eV,带隙误差0.39–1.27 eV,密度误差0.16–1.47 g·cm⁻³。

混合相复合物验证:以Cu₂O/TiO₂异质结光催化复合材料为例,仅输入Cu K边和Ti K边XANES谱,模型成功识别出TiO₂宽带隙组分的电子主导特征,预测带隙3.67 eV与紫外可见实验测定值高度吻合,验证了框架对复杂多组分体系的适用性。

【Figure 6a:Cu₂O/TiO₂复合物Cu K边和Ti K边实验XANES谱;Figure 6b,Cu₂O、TiO₂和Cu₂O/TiO₂三者的预测带隙与实验值对比柱状图】

3.10 核心亮点

① 打破"结构先验"依赖:首次实现无需任何晶体结构知识,仅凭光谱输入同时完成多物性预测与晶体结构推断,从根本上破解了材料计算筛选的循环悖论。

② XANES+PXRD的互补融合策略:将局域电子态信息(XANES)与全局晶体对称性(PXRD)在各自最擅长的任务上独立编码,而非简单混合,显著优于单一谱图输入的方案。

③ 组成感知的部分测量策略:仅测过渡金属边即可匹敌全元素模型,极大降低实验负担,具有直接的实践价值。

④ 物理可解释性突出:Grad-CAM和消融实验定量揭示了"哪段谱区驱动哪种预测",使模型决策具有明确的化学物理对应关系,而非黑箱。

⑤ 混合相体系的鲁棒性:在Cu₂O/TiO₂复合物中展现出从卷积光谱信号中解耦主导电子特征的能力,突破了单相材料的应用局限。

⑥ 完整的闭环工作流:从谱图输入到物性预测、再到结构推断,构成完整可操作的端到端流程,并配备开源代码,具备较强的推广复现性。

04

四、技术路径

  1. 问题定义与假设 材料计算筛选存在"结构先验悖论",新材料无已知结构。假设:光谱(XANES+PXRD)作为材料指纹,包含足够预测多维物性并推断结构的信息。
  2. 数据准备 从Materials Project筛选34,929个无机化合物;FEFF10计算超过10万条过渡金属K边XANES谱;VASP计算PXRD谱,叠加Voigt展宽与高斯白噪声模拟实验条件;谱图统一预处理为标准格式,数据集按70%/15%/15%划分训练/验证/测试集。
  3. 模型设计 XANES端:SpecFusionNet,多尺度卷积提取器(核尺寸3/5/7)捕获精细结构,元素特征编码器分别处理TM和non-TM原子描述符,多头注意力机制融合谱特征与成分特征,掩码机制处理变长输入。PXRD端:CNN-Transformer架构,捕获衍射峰局部相关与长程对称信息,专门用于晶系七分类。
  4. 模型训练与评估 采用Adam优化器,初始学习率10⁻³,L1损失函数,最多300轮训练,验证损失20轮不下降提前停止;五次随机种子独立运行取均值;分类任务用准确率/F1评估,回归任务用MAE/R²评估。
  5. 结构推断模块 以预测的氧化态、配位数、晶系为三层约束条件,依次枚举电荷平衡化学计量式、检索数据库晶体模板、执行元素替换、DFT几何优化,最后通过模拟谱与实验谱一致性(R_PXRD阈值)筛选最优结构候选。
  6. 性能评估与对比 全元素模型vs部分测量策略;XANES-only vs PXRD-only vs 融合输入的晶系分类对比;消融实验定量各模块/描述符贡献;Grad-CAM可视化解释模型决策。
  7. 实验验证与推广 七种单相实验样品(XANES+PXRD+UV-vis+磁测量)多维度验证;Cu₂O/TiO₂混合相复合物的泛化性验证;训练集外三种化合物的结构推断测试确认无过拟合;代码和数据开源供社区复现。
  8. 局限与展望 当前框架对低对称性晶系(单斜、三斜)分类准确率较低;混合价态多位点体系(如Co₃O₄)局域结构解析存在挑战;未实现de novo结构搜索(遗传算法等),仅依赖数据库模板检索;未来可引入随机搜索或模块化组装方法拓展对全新晶型材料的适用性。

05

五、编者按

创新性与影响力

这项工作在方法论层面具有相当的原创性。将光谱从"事后表征"提升为"事前预测驱动",并构建XANES-PXRD联合推断框架,思路清晰,自洽性强。34,929个化合物、超10万条模拟谱的数据规模在该领域处于较高水平;多任务预测涵盖分类与回归,物性类型多样;最终落地到实验验证(含混合相体系),论文的完整度较高。在材料加速设计的背景下,该工作提供了一条绕过晶体结构瓶颈的可行路径,预期在无机材料筛选、废弃物相鉴定、工业样品快速分析等场景具有实际应用潜力。

技术路线的合理性

XANES与PXRD在信息层次上的互补关系是本工作的物理基础,作者明智地选择了"专职分工"而非强行融合:晶系分类交给PXRD-only编码器,物性与局域结构预测交给XANES-dominant的SpecFusionNet,这一设计决策有Figure S21的对比实验为支撑,逻辑自洽。Grad-CAM的分析也表明模型确实学到了有物理意义的谱特征,而非单纯拟合统计相关性。DFT松弛加模拟谱验证的闭环设计,也使结构推断模块有较强的可信度。

潜在问题与隐含假设

有几点值得深入思考。其一,训练数据全部来自Materials Project的DFT计算谱,而FEFF10计算与真实实验谱之间存在系统性偏差(如核空穴效应的处理、多体效应等),实验验证部分也坦承了这一"domain shift"带来的误差放大。其二,结构推断模块的成功高度依赖于目标材料在已有数据库中存在类似模板,对于全新晶型或高熵材料,当前方法的适用性尚不明确,作者也坦诚指出de novo搜索仍是未来工作。其三,带隙的实验验证采用了Tauc图拟合,本身就存在拟合主观性和方法误差,与DFT计算带隙在定义上并不完全等价,直接对比时需审慎解读。其四,在混合相复合材料中,当两相信号强度相近(而非一相主导时),框架的鲁棒性有待进一步检验

后续扩展方向

几个值得期待的延伸方向:将XANES模拟精度提升(引入核空穴修正、TD-DFT等),以缩小模拟与实验谱的系统偏差;引入生成式方法(扩散模型、变分自编码器)实现de novo结构生成,摆脱数据库模板依赖;将框架推广至原位/操作态谱学(in situ/operando),在反应过程中实时追踪结构演化;以及面向工业级复杂样品(如催化剂失活相、电池循环后材料等)的实用化应用。总体而言,这是一项扎实且具有前瞻性的工作,其开源代码的发布也将有助于社区在更广泛的材料体系上加以验证与拓展。

声明

  1. 版权:推送内容仅供学习交流分享使用,版权归论文作者和单位所有,文章内容仅代表本公众号观点,欢迎批评指正,如有侵权请联系后台删除或修改,感谢各位同仁支持。

  2. 投稿:欢迎各位老师在公众号上介绍课题组最新或经典研究成果,后台联系即可。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/197657