一、论文基本信息(Basic Information)
- 标题(Title): Integrating machine learning interatomic potentials with batched optimization for crystal structure prediction
- 通讯作者 / 团队(Corresponding Author / Group): Chengxi Zhao、En Shao、Guangming Tan、Jun Jiang、Linjiang Chen;中国科学技术大学、中国科学院计算技术研究所、英国伯明翰大学联合团队
- 期刊(Journal): Digital Discovery(Royal Society of Chemistry)
- 年份 / 页码(Year / Pages): 2026年,第5卷,第1913–1924页
- 项目/数据开源地址: https://github.com/pic-ai-robotic-chemistry/BOMLIP-CSP;Zenodo存档:https://doi.org/10.5281/zenodo.19343560
二、研究背景与意义(Background & Significance)
分子晶体的结构决定着药物的溶解性、稳定性,以及有机半导体、多孔材料的功能特性。从化学组成出发"预测"一个分子会以何种方式堆积成晶体,即晶体结构预测(Crystal Structure Prediction,CSP),是材料计算领域长期以来的核心挑战之一。这项工作的难度在于两点的同时兼顾:一方面,候选结构的构象空间极其庞大,需要穷举搜索;另一方面,不同候选结构之间的能量差往往只有区区1至几个kJ/mol,对计算精度要求极高。两者相互矛盾,形成了效率与精度之间长期存在的瓶颈。
近年来,机器学习原子间势(Machine Learning Interatomic Potentials,MLIPs)的兴起为这一问题带来了曙光。MLIPs能以接近第一性原理计算的精度,在远低于密度泛函理论(DFT)的计算代价下完成能量和力的评估,天然适合CSP这种"又要快又要准"的场景。以MACE、SevenNet为代表的基础原子模型(foundation models)更进一步消除了对大量专属训练数据的依赖,使MLIPs在CSP中的应用变得更加普适。
然而,当前领域仍缺乏一个开源、易用、专门针对MLIP特点优化的CSP软件框架。现有CSP软件大多依赖商业授权,极大地限制了学术界的可及性和可重复性。此外,不同MLIPs在CSP任务中究竟如何影响预测结果,尤其是在初始结构远离局部极小值的真实预测场景下,学界也缺乏系统性的基准评测。本文正是为填补这两个空白而生。
三、核心研究内容(Main Contributions)
3.1 研究目标:构建面向CSP的MLIP开源框架
作者开发了BOMLIP-CSP(Batched Optimization with Machine Learning Interatomic Potentials Crystal Structure Prediction),一个开源Python框架,目标是让不同背景的研究者都能以极低的上手成本开展分子晶体结构预测。框架整体流程分为三步:构象搜索 → 试验晶体结构生成 → 结构优化与能量排序。
【Figure 1:BOMLIP-CSP的整体工作流程图,含三重半径验证方案示意及批处理优化与传统并行优化的时间对比示意图】
3.2 关键技术细节
试验结构生成:三重半径验证方案
框架采用Sobol序列(一种低差异性准随机采样方法)生成大量试验晶体结构。为保证生成质量,所有结构须通过三重验证:
- 扩展球形半径(×1.5范德华)剔除无物理意义的片状排列,同时保留可能存在的多孔结构。
这一设计的亮点在于,它在过滤无效结构的同时,不会误删像T2分子这类多孔性实验晶体,避免了传统密度优先生成策略的采样偏差。
批处理加速:细粒度并行的准牛顿优化
这是本文最核心的技术创新。传统CSP采用多进程并行,即对每个候选结构独立开启一个进程,GPU利用率参差不齐。BOMLIP-CSP改为将多个候选结构打包成一个计算批次,使邻居列表更新、准牛顿(BFGS)优化步骤和能量/力评估同时在所有候选结构上执行,充分发挥GPU的张量并行能力。
框架还引入了"连续批次调度策略":某些结构提前收敛后,调度器立即向批次中补充新的未处理结构,保持GPU持续满载。
在T2分子(46至368原子)的基准测试中,批处理方法相比基线实现了1.95–2.15×的加速,混合数据集的综合加速比达到约2.08×。在更广泛的空间群和原子数测试中,加速范围扩展至1.78–2.57×,平均为2.31×。
原子数 | 晶体数 | 基线耗时(s) | 批处理耗时(s) | 加速比 |
92 | 1000 | 550.71 | 259.01 | 2.13× |
184 | 3500 | 3786.80 | 1764.76 | 2.15× |
368 | 1000 | 3355.27 | 1723.71 | 1.95× |
混合 | 5500 | 7976.74 | 3835.32 | 2.08× |
基准评测:34个实验晶体结构的系统对比
测试集涵盖CCDC历史上六次CSP盲测的全部26个目标分子,加上多晶型体,共34个实验晶体结构。所有MLIPs从完全相同的初始试验结构数据库出发进行优化,确保结果可直接横向比较。
评测维度包含四项:实验结构稳定性、预测命中次数、实验结构相对格子能量、以及能量排名。
主要结果:
- 两种基础模型(MACE-OFF-small和SevenNet-0-D3)均能稳定超过85%的实验晶体结构(分别为29/34和30/34);
- 在正确空间群和Z'值已知的前提下,两个模型各自的命中率均超过50%(19/34和18/34);
- 至少被一个模型成功预测的实验结构达到24个(超过70%);
- 几乎所有实验结构的相对格子能量均在全局最低能量结构的25 kJ/mol以内。
【Figure 2:26个目标分子的化学结构示意图】
【Figure 3:四项评测任务的综合基准结果:稳定性测试、预测命中、相对格子能量与能量排名分布】
3.3 深入案例分析
System VI(简单案例): 两个模型均成功预测实验结构,能量排名均在前三,SOAP空间分布高度一致,结构共识度高。
System VII(丙烷分子,复杂案例): 尽管实验结构对两个模型均为全局能量最低点,MACE-OFF-small命中10次,而SevenNet-0-D3完全未命中。原因在于SevenNet-0-D3反复找到一种丙烷构象翻转的近似结构,形成局部极小值陷阱。这揭示了一个重要现象:能量精度相近的MLIPs,由于势能面结构不同,可能产生截然不同的CSP结果。
【Figure 4:System VI和VII的SOAP空间UMAP降维投影,直观展示两种模型探索的结构空间差异】
System XIII(卤素键主导的挑战体系): 分子含丰富的溴、氯原子,静电势面上存在明显的σ空穴,导致各向异性的分子间相互作用。较大的模型(Eqnorm、ORB、MatRIS)在此体系上表现显著优于MACE-OFF-small,实验结构能量排名分别为第1、第1、第2位。
System XXI(多晶型水合物): MACE-OFF-small虽然是唯一在5000个试验结构内预测出全部三个实验多晶型的模型,但其能量排序与DFT参考结果相悖;MatRIS模型尽管命中数少,但多晶型能量排序与DFT高度吻合,说明命中率与能量排序准确性是两个相对独立的维度。
【Figure 5:System XIII和XXI的多模型CSP结果分析,含UMAP投影、静电势面和多晶型相对能量对比】
3.4 核心亮点
- 首个专为MLIP设计的开源CSP框架,打破商业软件垄断,显著降低了领域的门槛
- 细粒度批处理加速策略,通过GPU张量并行实现约2.1–2.3×加速,且不牺牲精度
- 系统性揭示"能量精度≠预测成功率",首次在同等条件下量化不同MLIPs对CSP结果的独立影响
- 三重半径验证方案兼顾结构质量过滤与多孔晶体保留,体现对CSP物理直觉的深刻理解
- 连续批次调度器保持GPU持续满载,工程设计细节体现对大规模计算效率的极致追求
- 开源+模块化设计,框架的三个步骤相互独立,任意替换MLIP后端,扩展性强
四、技术路径(Technical Workflow)
- 问题定义 分子晶体结构预测需要在巨大的堆积空间中搜索局部能量极小值,能量分辨率要求在kJ/mol量级,同时须在合理计算时间内完成数万次结构优化。现有开源工具不足,MLIPs的最优使用策略不明确。
- 框架设计 设计BOMLIP-CSP三阶段流程:构象搜索(基于RDKit的ETKDG方法)、试验结构生成(Sobol序列采样+三重验证过滤)、批处理优化与能量排序。框架预配置MACE-OFF-small和SevenNet-0-D3两个基础模型,支持灵活替换。
- 试验结构生成 对每个目标分子选取最低能量的4个构象,在实验空间群和Z'约束下,每个构象生成2500个试验晶体,合计最多10000个初始结构。通过三重半径验证方案过滤无效结构。
- 批处理结构优化 将多个候选结构打包送入GPU批处理流水线,通过改写准牛顿BFGS算法、实现支持周期性边界条件的批量邻居列表更新、以及连续批次调度三项关键技术,将GPU利用率最大化。优化分两轮:先施加0.1 GPa压强优化(避免平坦势能面漫游),再零压优化收尾。
- 性能评估 以34个实验晶体结构为基准,在稳定性、命中率、相对能量、能量排名四个维度评估MACE-OFF-small和SevenNet-0-D3,并对挑战性体系额外测试Eqnorm、ORB、MatRIS等更大模型。
- 结果解读与关键洞见 能量精度相近的MLIPs可产生截然不同的CSP结果,势能面的全局形貌(而非局部极小值附近的精度)对预测成功率有独立且重要的影响。较大模型并不总是更好,参数量更多的模型可能产生更崎岖的势能面,反而需要更多试验结构才能充分采样。
- 应用与展望 BOMLIP-CSP生成的低能量结构数据库可直接对接DFT精排,在分层策略(粗筛+精排)中发挥关键作用;框架的模块化设计使其能够适配未来更强的基础原子模型,推动AI辅助材料发现走向更自主化的方向。
五、编者按(Editor's Note)
创新性与影响力
这篇工作的贡献是双重的:一是工程层面,一是科学层面。工程上,BOMLIP-CSP填补了CSP开源工具的空白,批处理加速策略设计精巧、效果实在,2倍以上的加速对于动辄需要评估数十万结构的CSP任务意义重大。科学上,"能量精度≠预测成功率"这一发现颇具启发性,它提示社区不应仅凭MLIP在平衡态附近的基准表现来选择CSP模型,势能面的全局拓扑同样值得关注。这两点对领域的实际推动作用都是切实的。
技术路线的合理性
Sobol序列作为低差异性采样方法在CSP中已有较好的先例,选择是合理的。批处理BFGS优化的设计思路清晰,连续调度策略有效解决了不同结构收敛速度不一致的问题(这是传统并行策略的主要痛点)。两阶段优化(加压+释压)的设计虽略显启发式,但作者有实验支撑,且明确说明了其避免多孔结构被错误压缩的意图,逻辑自洽。
潜在问题与隐含假设
本工作最大的隐含前提是:空间群和Z'已知。在真实预测任务中,这些信息是未知的,需要对所有常见空间群展开搜索,计算量会成倍增加。这一条件的限制在论文中有所提及,但对于公众读者而言值得特别强调,当前50%~70%的成功率是在"已知空间群"的较理想场景下取得的,实际盲测难度更高。
此外,34个测试体系的规模仍然有限,尤其对于共晶、盐和含金属有机分子的代表性不足。论文对两个模型失败案例(含硼的System III和无氢的System XXII)的分析较为简略,这些边界情况背后的物理机制值得深入探讨。
后续可扩展方向
最自然的延伸是发展MLIP选择策略,如何在不做全面CSP的前提下,预判某个MLIP对特定分子体系是否适用?另一个方向是将BOMLIP-CSP与主动学习框架结合,对预测失败的体系自动微调MLIP,形成闭环。更长远地看,将框架与高通量实验(如机器人化学实验室)对接,构建"计算预测—实验验证—模型迭代"的自主材料发现流程,是该工作所指向的真正愿景。
版权:推送内容仅供学习交流分享使用,版权归论文作者和单位所有,文章内容仅代表本公众号观点,欢迎批评指正,如有侵权请联系后台删除或修改,感谢各位同仁支持。
投稿:欢迎各位老师在公众号上介绍课题组最新或经典研究成果,后台联系即可。