分子动力学模拟是研究化学、材料与生物体系微观机制和宏观性质的重要工具。从头算分子动力学虽然精度高,但难以承担大尺度、长时间模拟;传统经验力场虽计算高效,却在复杂有机体系中常常精度不足。机器学习力场通过数据驱动方式逼近真实势能面,兼顾了量子化学方法的精度与经典经验力场的计算效率,因而成为衔接高精度电子结构计算与大尺度经典分子模拟的重要技术路径。
然而,MLFF 在有机体系中的应用仍面临显著挑战。有机分子同时包含以共价键作用为主的分子内相互作用,以及以范德华作用为主的分子间相互作用;若无法同时对这两类相互作用进行准确刻画,模型便容易在模拟稳定性与宏观物性预测方面受限,导致模拟失败。具体而言,针对分子内相互作用,当训练数据对高能化学键区域覆盖不足时,模型在长时间模拟过程中可能出现化学键断裂、原子碰撞等非物理的结构崩溃现象;针对分子间相互作用,即使模型在能量、原子力及结构特征等微观指标上已经表现良好,也未必能够准确预测密度与黏度等宏观物性。
因此,单纯依赖数据驱动的 MLFF 往往难以同时兼顾分子内结构稳定性与分子间宏观物性预测精度。基于前期研究基础(CCS Chem, 2025, 7(3): 716-730),本文进一步提出了物理嵌入思想。一方面,将经验力场拓扑文件中蕴含的物理知识引入数据采样过程;另一方面,将具有明确物理意义的等式以自上而下的方式嵌入MLFF模型,对分子间相互作用进行定向修正,从而系统提升模型的预测精度、稳定性与可解释性。

![]()
图1. 物理嵌入机器学习力场总体工作流程示意:包括高阶等变模型、物理知识引导的自适应键长采样方法,以及基于物理等式嵌入的自上而下的模型修正方法。本文的第一项核心贡献在于提出了基于物理知识引导的自适应键长采样方法。该方法通过读取经验力场拓扑文件中的相关信息,实现对不同化学环境下原子类型与化学键类型的精细区分,并结合拓扑文件给出的键力常数,进一步确定复杂有机分子中各类化学键的采样范围及其对应的采样概率。相较于采用统一拉伸因子的传统做法,该策略能够更加精准地覆盖易引发模拟崩溃的高能键长区域,在实现自适应采样的同时,有效避免因化学键过度拉伸而导致的 SCF 不收敛及异常受力等问题。
在含氟工程流体、丙氨酸三肽与对乙酰氨基酚等三类代表性有机分子中,作者仅使用 50 份单分子样本进行训练与验证,即可显著改善模型的模拟稳定性。原始 MACE 模型在三类体系中的结构崩溃概率分别高达 59%、22% 和 77%;在引入自适应键长采样增强后,模型顺利通过 100 组独立的 100ps 高温分子动力学稳定性测试,表明该方法在小样本条件下即可大幅提高 MLFF 的长时间模拟稳定性。

![]()
图2. 物理知识引导的自适应键长采样策略示意:基于经验力场拓扑文件中包含的原子类型、化学键类型及键力常数等信息,自适应确定复杂有机分子中各类化学键的采样范围与采样概率。
本文的第二项核心贡献,是提出了基于物理等式嵌入的自上而下模型修正策略。作者指出,MLFF 的训练过程往往优先拟合对势能贡献更高的分子内相互作用,而对分子间相互作用的刻画相对不足。因此,MLFF即便在多种拟合误差与径向分布函数等微观指标方面已表现良好,仍可能在密度与黏度等宏观物性的计算精度上存在显著偏差。

![]()
图3. 随着训练过程推进,模型在能量、原子力和应力等微观拟合指标上逐渐收敛,径向分布函数和键角分布等结构特征也与第一性原理分子动力学结果高度一致。然而,作为宏观物性的密度并未同步收敛,且相对于实验值仍存在明显偏差。
为解决这一问题,作者引入具有明确物理意义的 DFT-CSO 色散等式对模型进行修正。该方法仅通过一个可调阻尼参数对分子间相互作用进行增强或削弱,并以实验密度为优化目标,对已训练完成的模型进行分子间相互作用修正。由于该策略直接以实验宏观物性为导向,因此不仅能够缓解模型对参考量子化学方法拟合不足所带来的误差,也能够在一定程度上修正参考量子化学方法相对于实验结果的系统性偏差。此外,得益于所嵌入等式具有清晰的物理含义,该方法还具有流程简洁、数据需求极低、计算成本可控且易于集成到现有 MLFF 框架中等优势。
在典型电池电解液溶剂体系,即碳酸乙烯酯(EC)与碳酸甲乙酯(EMC)混合溶剂及纯 EMC 体系中,该方法都表现出很高的数据效率与应用潜力。作者指出,物理等式可调参数的扫描过程计算开销较低,仅需数小时即可完成最优参数的确定。经修正后,MACE-EC/EMC 与 MACE-OFF23(S) 模型在不同温度、不同混合比例以及新分子体系上的泛化测试中,密度预测误差分别下降 78% 和 88%,达到0.006g/cm³ 和 0.012g/cm³;黏度预测偏差也分别下降 38% 和 77%,最终相对实验偏差分别为 18.4% 和 12.9%。这些结果表明,该方法能够以较低的数据与计算成本显著改善宏观物性的计算精度,并取得与更复杂修正方案相当的效果。

![]()
图4. 基于物理等式嵌入的自上而下的模型修正方法:通过少量参数扫描即可完成密度校准,实现模型的分子间相互作用的定向修正,并显著改善不同温度、不同混合比例以及新分子体系的密度和黏度的计算精度。
在可解释性方面,刚性体积扫描结果显示,修正前后势能极小点的位置发生变化,表明物理等式嵌入能够定向增强或削弱分子间相互作用,具有明确的物理意义。同时,原子力的 RMSE 变化小于 0.8 meV/Å
,显著低于模型自身的拟合误差上限。这表明,一方面,原子力层面的细微变化即可引发宏观物性的显著改变;另一方面,仅依赖数据驱动的模型训练往往难以准确刻画分子间相互作用,从而进一步凸显了物理等式嵌入方法的必要性。此外,反映微观结构特征的径向分布函数在修正前后基本保持一致,进一步证实该修正方法几乎不影响模型原有的分子内相互作用。

![]()
图5. 修正前后微观一致性对比:在刚性体积扫描与结构统计测试中,修正策略引发势能极小值位置的变化,从而定向增强或削弱模型的分子间相互作用,同时基本保持分子内相互作用不变。
总体来看,本文从“数据采样”与“模型后处理”两个关键阶段出发,提出了两类互补的物理嵌入策略,有效克服了纯数据驱动方法带来的瓶颈问题。其中,自适应键长采样主要解决分子内高能化学键区域覆盖不足导致的分子结构崩溃问题;基于物理等式的自上而下模型修正方法则主要面向分子间相互作用刻画不足以及参考量子化学方法本身系统误差所引发的宏观物性预测失效问题。两种方法为构建高精度、高鲁棒性与高可转移性的分子模拟工具奠定了坚实基础。
不同于通过扩大数据规模或提升模型复杂度来改善性能的常见技术路径,本文更强调以低成本、高可解释性与高可迁移性的方式,将物理知识与物理等式嵌入 MLFF 的开发流程。这一思路不仅增强了模型在工程流体、多肽、药物分子及有机溶剂等体系中的适用性,也为通用基础模型在下游微调阶段的快速校准提供了新的方向。未来,该框架仍可进一步扩展,例如引入更多可调物理参数,并发展面向黏度等动力学性质的高效低成本修正方法。
上述工作以Research Article的形式发表在CCS Chemistry,中国科学院化学研究所江剑研究员为通讯作者,博士研究生胡俊宝为第一作者。该工作得到了国家自然科学基金与中国科学院先导项目的支持。