Py学习  »  机器学习算法

【联盟十周年·论坛速记】胡小康|在AI赋能动力电池全链路创新论坛上的发言——基于机器学习的ToF—SIMS空间谱图解析与电池SEI物种识别

中国汽车动力电池产业创新联盟 • 2 周前 • 68 次点击  

基于机器学习的ToF—SIMS空间谱图解析与电池SEI物种识别

清华大学邱新平团队博士胡小康

尊敬的各位老师、到场各位嘉宾,以及电池联盟领导大家好!首先在这里祝贺电池联盟成立十周年,同时也感谢电池联盟为我提供向大家做报告的机会,我是来自清华大学化学系邱新平老师博士生胡小康,今天跟大家报告题目是基于机器学习的ToF—SIMS空间谱图解析与电池SEI物种识别

首先介绍一下本研究的对象,也就是固体电解质界面简称SEISEI是电解液也在负极表面发生还原分解形成一类纳米级的界面层,好的SEI需要起到离子传输、电极阻碍、界面稳定的功能,因此它与动力电池性能密切相关,但是SEI的表征非常困难,主要是因为SEI对于环境的敏感性,表面不均匀,而且厚度10100纳米之间,而且其内部组分或者碎片成分比较复杂,而ToF—SIMS会在纳米界面中同时读取化学碎片和空间位置、以及深度演化信息是SEI成分与解构解析最有效的表征之一。

ToF—SIMS也就是飞行时间二次离子质谱,它使用一次离子数攻击样品表面,使其建设成二次离子,不同质谱比二次离子到达分析器时间不同,因此可以反推出物种M比对信息,ToF—SIMS主要有三种工作模式,分别是高分辨质谱模式、二维成像、深度剖析和3D模式,需要强调是根据信号方程,ToF—SIMS二次离子强度和物种浓度相关,但是建设产率和电力效率会随着化学环境变化而变化,这就是所谓的机理效率,因此对于复杂的SEI更适合输出化学证据图而不是绝对的浓度变量,ToF—SIMS数据本质上是象素乘MDZ乘深度高维空间谱图矩阵,也是一般机器学习输入形式。

如图所示是最典型的电极表面ToF—SIMS质谱图,传统分析方法是人工筛选单一离子片段,比较不同片段关系,这种方法主要有两个问题,第一以少数片段规律代表总体规律,因此会丢失较多整体信息,第二依赖人工经验费时费力,而且人为选择带来人为偏差会比较大,因此MV方法广泛应用ToF—SIMS数据处理中,其中PCAMCR是常用的分析方法,依据变量之间的相关性,对数据矩阵进行降维计算,给出反映样品组分变化规律的特征矩阵。

PCA也就是主成分分析方法,主要应用高维数据提取主要的变化方向,PCA将原始离子信息降到五少数M主成分,从而快速获得体征成分信息,优势在于计算速度快,帮助我们解决样品中可能存在多少成分,但是PCA有一定的局限性,首先采用正交约束,而真实的化学组分之间不一定是正交的,其次结果可能出现负值,因此它的结果并不具备直接的化学意义,一般PCA之后进一步采用MCR方法对样品进一步进行表征,MCR将测得混合谱图矩阵分解成三个主要部分,分别是空间的分布矩阵C,端元光谱矩阵S和误差矩阵E从数学意义来说,MCR将混合的谱解释若干多元谱,以及空间分布的线性组合,并同时输出空间分布图以及载量图,MCR优势在于可以施加飞速约束,因此更容易与真实化学对应,适用SEI表面研究。

我们组前期分析石墨负极SEI,并且揭示锂离子对SEI离子交换机制,首先对于基准石墨SEI样本,我们对三维 ToF—SIMS数据进行PCAMCR分析,确定主要存在四类成分,通过三维分析图可以看到不同画像组分有明显的深度特征,也是通常我们认为SEI的层状结构,在进一步研究污染电解液的时候,相关碎片主要存在组分三中,也就是有机SEI相关端元里,同时有机碎片增加,在进一步全电池测试中,我们观察到镍相关峰进入到同一类的端元中,同时锂离子相关碎片显著减弱,说明正极溶出镍离子可能进入石墨负极SEI中,并且和有机SEI组分发生离子交换反应,从而影响SEI稳定性锂离子传输,这一工作说明MCR非常有效揭示SEI空间结构和界面反应机制,但是MCR化学身份依赖人工解释,也是本研究引入机器学习的出发点。

ToF—SIMS数据具有几个典型特征,首先高维稀疏性,其次空间信息和辅助信息处于耦合状态,同时它的离子碎裂过程和机理效应都具有非线性,因此PCAMCR面对这些问题存在局限性,PCA受到线性和正交约束,而MCR方法需要预先设定组分数和初始数,且MCR得到混合谱,化学身分依赖人工解释,因此利用机器学习是目前ToF—SIMS谱图分析的趋势,首先利用非线性编码器学习非线性机理效应,其次可以利用空间信息编码将空间信息和谱图信息耦合,此外根据已知谱图信息跨样本进行化学解释,进而输出物种概率以及目标物种的证据图。

为了解决线性降维方法不足,研究中已经出现一系列非线性模型,第一类SOM,也就是自组织影射网络,它可以将相似的相似图影射到二维神经网络格中,同时不同化学域和空间分区,第二类ANN,由多层权重学习增强组合与样本类别之间的非线性关系,因此适合已知道类别和复杂组份分类,第三个SAE,在自编码器基础上加入稀疏性的约束,要求只激活隐藏层的少量的神经元完成任务,来捕获最主要的表特征模式,仍然属于结构或类别发现,需要进一步引入已知谱库和混合物标签解决化学身份的问题。

CAANE将二维空间邻域引入谱图自编码解混中,输入不再是单个象素谱图,而是包含相邻象素局部区块,这种模型优势是它通常得到更连续的端元分布,比单象素模型更抑制噪声,因此CNNAE非常适合二维成像或者深度图像解析,但是它提取特征仍然需要可视化方法转化端元,而且编码空间信息必然引入更多的空间变化,而非化学区分导致的结构。最后CNNAE对于训练域以及训练大小尺寸非常敏感,这个模型其实说明空间信息能够改善和解混图像的质量,但是端元是否等于真实物种,仍然需要参考后续标签和身份识别进行约束。

对于物种身份可解释物种识别想法,另一种思路直接利用已知纯物种的谱库进行监督学习,训练逻辑回归、随机森林等可解释性的模型,逻辑回归优势直接特征峰作为特征,因此具有很强的可解释性,而且适合小样本的验证,已有工作证明这类模型能够利用峰组差异区分化合物,给出相对清晰的特征解释,首先逻辑回归本质是线性模型,对于复杂的机理效应和非线性碎裂模式表达能力有限,其次传统样本分类没法输出像素级空间分布,对于特征高度重叠的物种用简单的模型容易出现误判,因此本研究希望保留已知谱图可解释性,同时引入非线性编码器编码非线性机理效应,并结合易混淆的正负样本弱监督混合物,输出像素性的概率图。

以上机器学习辅助解析方法其实暴露以下两个主要的问题,首先一个或者一组碎片特征峰及其线性组合,难以区分易混淆的物种。以LiF为例,过去研究通常使用锂负离子或者LiF负离子等一系列离子峰作为氟化锂的证据,问题在于含氟磷酸锂、LiF,然后二氟磷酸锂以及其他的含氟物种在ToF—SIMS的碎裂过程中都会产生部分甚至全部类似的锂氟系列片段,因此,单一的碎片峰并不一定等于氟化锂。与此同时,机器学习方法和MCR得到的端元谱也可能同时包括氟化锂系列峰以及FSI等盐类的特征峰,这意味着端元谱进行解混之后的谱图仍然可能是混合谱。

基于前面的挑战,本研究提出了从谱图表征到空间物种证据图的整体设计路线,输入数据分三个层级:纯参考物种、受控混合物、真实SEI深度谱,我们使用规范化数据预处理方式,并以SAE作为模型核心进行谱图表征学习。在特征空间的基础上设置两个主要的任务,其一是对化学类别的多标签识别,其二是对于氟化锂物种的抗干扰能力识别,用于区分氟化锂和含氟干扰物种,最终输出可解释的空间谱图解析

首先我们在这里介绍实验挑战和数据预处理流程,所有样本经过M6测试,在氟离子模型下,整体来说所有样本都实现测试条件严格控制,为后续数据库构建以及模型学习提供基础。本研究建立从纯物质到受控混合物,再到真实SEI闭环数据库,第一17类纯数据参考,包括有机锂盐、无机盐类、氟源干扰物以及金属锂等背景组分,这些物种用于建立参考特征峰组以及背景机理信息,第二33种受控混合物库,包括类内混合、类间混合、以及硬氟样本,第三部分真实SEI表征域,它包括金属锂和不同电解液形成的化学SEI,以及真实循环条件下的电化学SEI,目前数据库包括180组二维表面或者预见峰,总计 2400张二维切片库,数据库意义在于首次构建锂离子空间谱图解析到真实SIE解析闭环的数据库,对于SIE化学类别识别模型,首先构建识别边界,从原始谱空间来看,类别边界受到强度和机理效应拉伸,不同类别间重叠非常明显,经过SAE模型表征学习之后,模型学到更稳定的碎片组合模式,使纯物质和混合物之间,更容易特征空间接近相应的化学类别,当前定义五种化学类别:分别是有机锂盐类、聚合物LiDCHLipdfLiF类,这个模型建立了上述五种类别的清晰谱图特征空间边界,从而为真实象素输出物种概率。

此外,我们进一步对比相同测试样本条件下,化学类别模型与MCR空间解析的成果,测试样本包含七种组分,对于复杂的混合物,MCR给出高空间分辨端元图,显示不同端元空间分布结构,但是MCR端元不一定是纯物种端元,它的化学身份意义是缺失的,我们采用机器学习对MCR对应,说明SEI化学类别模型能够为MCR结果提供化学解释以及化学身份的软约束,对于高概率区间可以进一步对MCR端元进行化学标注,对于低限度区域保留未知或者混合物的区域,此外我们对于所关心的目标物种,可以进一步通过专项识别模型来进行区分。

对于LiF物种识别模型,这里展示不同机理下表现,首先是有机和无机背景中,模型在复杂的机理情况下保留LiF样本,但是误识别程度相比于直接用氟化锂分组特征和MCR结果明显降低的。最后对于低比例强干扰物种的识别情况,在这种情况下LiF信号非常容易受到六氟磷酸锂碎片的干扰,因此结果之间可能存在明显差异,我们需要进一步检查多元氟化锂模型输出的证据谱,判断是否真正抑制磷酸干扰,这部分结果说明氟化锂模型并不是简单的碎片模型,而是试图在含氟盐复杂机理中输出更可靠存在证明的模型。

LiFLiPF按照1:9比例混合困难样本,首先从空间分布来看,MCR和机器学习氟化锂概率率都提供一定的空间结构信息,但是观察MCR端元谱可以发现,其中除了氟化锂系列碎片之外,还存在明显六氟磷酸根的相关峰以及二氟磷酸根的相关峰,说明MCR得到的端元谱仍然是混合谱,相比情况下我们用LiF模型证据谱中,它的反证据峰也就是六氟磷酸锂相关峰明显得到压制,LiF峰组判决得到保留,说明LiF身份证据更强,而且对MCR结果进行指导,对于后续研究可以建立MCR提供高分辨空间结构,身份识别模型提供化学身份与反证据峰筛选框架,从而实现氟化锂物种准确识别,对于SEI物种识别非常有意义的

最后对本项研究总结,本研究围绕ToF—SIMS空间谱图解析与物种识别的目标,构建了一个由模型与数据解析共同闭环框架,最终形成空间结构到化学身份到解释证据模式联合解析模式。下一步研究主要有四个方向,首先是进一步扩展真实样本体系,其次建立更加严格的可信度验证体系,第三类别概率和不确定性转化MCR鲜艳条件,来增强MCR效果,第四可以将模型用于追踪LiF,其余有机、无机中我们关注对象身份信息精确识别的模型,以及它空间分布和深度演化信息,从而反馈例如FEC锂盐界面反应机理、界面调控机制的研究情况,最终目标是形成可以牵引、可以量化置信度、可以服务电解液和界面设计的ToF—SIMS智能解析的工具链,我汇报结束,谢谢各位专家和领导!

——本文根据中国汽车动力电池产业创新联盟2026年度论坛暨电池联盟成立十周年大会论坛嘉宾报告速记整理,未经本人审核。


图片


关注我们


图片

扫描二维码即可关注

秘书处联系人|王老师

邮箱|lianmeng@glabat.com

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199429