社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

重庆大学|刘秀玥,宋朝阳,董立春,等:基于双阶段双通道深度学习的化工故障分类模型

化工学报 • 1 月前 • 51 次点击  

基于双阶段双通道深度学习的化工故障分类模型

刘秀玥 1 张佳鑫 2宋朝阳 1董立春 1 

1. 重庆大学化学化工学院,重庆 400044; 2. 河北科技师范学院化学工程学院,河北 秦皇岛 066000 )

DOI:10.11949/0438-1157.20251320


摘 要 深度学习模型在化工故障诊断中具备较好的特征提取能力,但在非线性高维工况下,单一网络难以同时捕捉长短期时序依赖,易产生信息缺失和特征冗余。本文提出双阶段双通道多头自注意力故障分类模型。第一阶段采用GRU-LSTM双通道并行提取互补时序表征:LSTM捕获长期时序依赖特征,GRU捕获短期时序依赖特征,并通过多头自注意力完成融合与赋权,突出关键特征并抑制冗余。随后依据故障混淆值将故障划分为E类和H类,H类故障进入第二阶段,利用动态核PCA计算T²与SPE统计值并构建增强特征矩阵,提升模型对微弱偏移、渐变退化和传播型异常的灵敏度。田纳西-伊斯曼过程实验表明,该模型在检测和诊断精度、鲁棒性和泛化性方面明显优于对比方法。
关键词 深度学习故障诊断多头自注意力机制双通道结构双阶段诊断

引用本文: 刘秀玥, 张佳鑫, 宋朝阳, 董立春. 基于双阶段双通道深度学习的化工故障分类模型[J]. 化工学报, 2026, 77(5): 2717-2730 (LIU Xiuyue, ZHANG Jiaxin, SONG Chaoyang, DONG Lichun. A two-stage dual-channel deep learning model for chemical fault classification[J]. CIESC Journal, 2026, 77(5): 2717-2730)


引 言

随着工业技术的发展,化工过程变得越来越复杂,需要实时监测和精确控制的过程变量大幅增加[1]。在此背景下,及时的故障检测和诊断(fault detection and diagnosis,FDD)对于保障化工过程的稳定性和安全性的重要性急剧增加[2]。现有的FDD方法大致可以分为三类:基于知识、基于模型和基于数据驱动的方法[3-6]。近年来,随着分布式控制系统在化工过程中的广泛应用,大量历史运行数据的积累推动了数据驱动方法的发展[7-8]。特别是基于人工智能(artificial intelligence, AI)的FDD方法,能够从实时过程数据中学习,以实现更准确的故障诊断[9]。在各种基于AI的FDD方法中,基于深度学习(deep learning,DL) 的方法,包括自动编码器(auto-encoder,AE)[10]、深度信念网络(deep belief network,DBN)[11]、循环神经网络(recurrent neural network,RNN)[12]、卷积神经网络(convolutional neural network,CNN)[13]、门控循环单元(gated recurrent unit,GRU)[14]和长短期记忆网络(long short-term memory,LSTM)[15],由于出色的从高维、非线性的过程数据中提取特征的能力,受到了广泛关注。Zhang等[16]提出了一种结合阶梯自动编码器(ladder auto-encoder,LAE)和LSTM模型的半监督框架,该框架通过有效挖掘未标记数据不仅提升了故障诊断性能,也增强了对故障相关过程变量的可解释性识别。Wang等[17]提出的扩展深度信念网络(extended deep belief network,EDBN)模型,通过堆叠多个扩展受限玻尔兹曼机(extended restricted Boltzmann machines,ERBM)从过程数据中逐步提取分层特征,在田纳西-伊斯曼(Tennessee Eastman,TE)过程中显示出优异的故障分类性能。
上述研究尽管推动了深度学习方法在化工过程故障诊断中的应用,但面临以下关键挑战:化工过程数据天然具有时间依赖性,同时包含短期(低阶)和长期(高阶)相关性,而传统的单一结构DL网络难以在保证诊断精度的同时充分捕获数据的复杂时间相关性[18]。据此,本研究提出了一种新颖的双阶段双通道多头自注意力(bi-stage multichannel multi-head self-attention,Bi-MCMHSA)模型,该模型旨在有效捕获过程数据中的多层次时间依赖关系,从而提升其在复杂化工过程的故障分类性能。模型的第一阶段采用LSTM和GRU并行的双通道结构分别捕捉长期和短期的时间依赖关系,其中LSTM专注于提取高阶(长期时间依赖关系)特征,GRU专注于提取低阶(短期时间依赖关系)特征。随后采用多头自注意力(multi-head self-attention,MHSA)机制为来自LSTM和GRU通道的时间特征动态分配自适应注意力权重,注意力权重能够反映每个特征的相关性和重要性,在尽量减少冗余的同时选择性地捕获重要的诊断信息,从而有利于多时间尺度的关键诊断特征的准确识别和集成。最后计算各故障的混淆率(confusion rate,CR)值,并根据该数值将故障分为H类(难诊断)和E类(易诊断),E类故障直接输出结果,H类故障则转换到第二阶段进行深入分析。模型的第二阶段采用动态核主成分分析(dynamic kernel principal component analysis,DKPCA)方法计算H类故障的T 2和平方预测误差(squared prediction error,SPE)统计量,以构建增广特征矩阵。该增广特征矩阵随后被输入到另一个双通道多头自注意力(multichannel multi-head self-attention,MCMHSA)模型进行深度分析。该构架可有效提升模型对H类故障细微特征的敏感性,进而强化其精确故障分类的能力。最后,所提出的Bi-MCMHSA模型通过TE过程进行了实例验证。

1 方法

1.1 双通道模型

1.1.1 门控循环单元
GRU是传统RNN的变体,旨在减轻梯度消失和计算复杂度过大等问题[19]。通过引入包含更新门zt和重置门rt两种门控机制的简化架构,GRU可以有效减少可训练参数的数量,同时保留其捕获数据中短期时间依赖关系的能力。
图1所示,GRU的核心功能在于它能够通过两个门结构调节信息的流动。

图1   GRU网络结构图Fig.1   Schematic network structure of GRU
重置门的输出决定了前一个隐藏状态对候选隐藏状态计算的贡献程度。具体来说,rt值趋近0表明以前隐藏的信息在很大程度上被忽略,而接近1的值允许与历史信息充分结合。该机制使得GRU能够自适应地控制信息存储,增强了对短期时间依赖关系的提取能力,如式(1)所示。

(1)
式中,Wrbr分别表示与重置门rt相关的可学习权重矩阵和偏置向量;函数σ(⋅)表示Sigmoid激活函数,以非线性方式将输入值映射到[0,1]范围内;⊗表示Hadamard(元素级)积。
与重置门相反,更新门zt用于调节保留历史信息,并决定前一个隐藏状态被记录到当前状态的比例,其计算如式(2)所示。

(2)
式中,bzWz分别表示与zt相关的偏置向量和可学习的权重矩阵。
候选隐藏状态表示在时间步t的临时存储信息,它是根据当前输入xt和重置门rt的门控影响计算得到的。隐藏状态 ht作为当前时间步t的输出,由前一个隐藏状态ht-1和候选隐藏状态加权计算得到,其权重由更新门zt确定。候选隐藏状态和最终隐藏状态对应的更新如式(3)式(4)所示。

(3)

(4)
式中,bhWh分别表示与候选隐藏状态相关联的偏置向量和可学习权重矩阵;函数tanh(·)为双曲正切激活函数,主要用于生成候选隐藏状态,将输入值非线性映射到范围[-1,1],从而引入有界激活,增强网络的非线性表达能力,缓解梯度消失问题。
GRU网络具有计算效率高、参数少的优点,但其在处理长期时间依赖问题上存在固有局限,这制约了其在某些复杂时序建模任务中的应用。
1.1.2 长短期记忆网络
LSTM网络是一种先进的RNN变体[20]。不同于传统RNN,LSTM通过其内部的存储单元和门控机制,可以在更长的时间间隔上选择性地保留和更新信息[21],能够有效学习过程数据中的长期时间依赖关系。如图2所示,每个LSTM单元由输出门Ot、遗忘门ft和输入门it三部分组成,这些门控单元协同工作,通过精细调节信息的输入和输出决定历史信息的保留程度、新信息的更新比例以及内部状态对最终输出的贡献度。

图2   LSTM网络结构示意图Fig.2   Schematic network structure of LSTM
遗忘门通过调节历史信息的留存比例在LSTM的记忆管理中起着核心作用。在每一个时间步t,它接收前一个隐藏状态ht-1和当前输入xt并激活ft,生成一个值域为[0,1]的向量,其中接近1的值表示完全保留对应的记忆成分,接近0的值表示完全遗忘。遗忘门的计算如式(5)所示,其中bfWf 分别表示遗忘门中的偏置向量和权重矩阵。

(5)
输入门负责调节新信息记入存储单元的程度。其中,前一个隐藏状态ht-1和当前输入xt激活it,调节候选信息记入存储单元状态Ct的程度。同时,模型基于相同的输入生成候选细胞状态t,该状态可以选择性地保留新的相关信息,然后结合遗忘门ft和前一个细胞状态Ct-1计算出当前时间步tCt。具体过程如式(6)~式(8)所示。

(6)

(7)

(8)
式中,biWi分别表示相关的偏置向量和可学习的权重矩阵;Wcbc表示计算t的相应参数。
最后,输出门根据ht-1xt计算输出门激活Ot,从而确定当前细胞状态对LSTM单元ht的贡献程度。ht Ot的计算如式(9)式(10)所示,其中boWo分别表示与输出门Ot相关的偏置向量和可学习权重矩阵。

(9)

(10)
1.1.3 双通道网络
尽管LSTM常被视为门控循环结构的扩展形式,但二者在信息“保留—更新”的内在动力学上具有不同的归纳偏置:LSTM通过显式细胞状态提供相对独立且更稳定的记忆通道,其门控更容易在一定时间跨度内维持历史信息的持续累积和缓慢遗忘,因此更适合表征缓慢漂移、退化演化等长期依赖;而GRU将记忆与隐藏状态耦合,更新门对当前输入变化更敏感,状态更新通常更快、更强调对短时扰动和快速动态的响应,因此更倾向于捕捉高频波动和瞬态特征。因为这种“长时稳态保留”与“短时快速响应”的动力学差异,LSTM和GRU的并行融合在理论上具备互补基础。然而,若两通道在训练中接收完全相同的输入且缺乏约束,当故障模式与长期记忆相关性较弱时,优化过程会驱动两者共同聚焦更易拟合的短期波动,从而造成隐含表示的相关性升高、拼接特征出现冗余。
据此,本研究设计了融合LSTM和GRU的双通道结构,并为了从机制上降低特征冗余的风险在双通道结构中引入时间尺度分解输入,使两通道在输入端显式关注不同频带的信息:GRU通道输入原始序列以保留高频动态,LSTM通道输入经时间尺度变换后的序列以突出低频趋势和长期演化,其中为时间尺度变换算子,  表示变换后的序列长度。由此两通道输出分别记为:

(11)
式中,表示GRU通道的低阶/短期动态表示;表示LSTM通道的高阶/长期依赖表示。
双通道集成特征拼接通过式(12)得到:

(12)
式中,为并行融合后的集成特征表示;表示向量拼接操作。
进一步地,为抑制“拼接后冗余”,本研究在训练目标中加入通道多样性正则项,显式降低两通道隐含表示的线性相关性。设一个mini-batch的样本数为,两通道在该批内的特征矩阵分别为 ,其按列(特征维)均值中心化后的矩阵分别为,其中为全1向量,为批内均值向量。跨通道协方差矩阵如式(13)所示。

(13)
式中,衡量两通道表示的线性相关结构。
据此通过式(14)构造多样性正则项。

(14)
式中,表示Frobenius范数,越小表示两通道特征越低相关、冗余越低。
最终训练目标写为式(15)

(15)
式中,为故障诊断任务损失函数(例如分类交叉熵或加权交叉熵);为正则化权重系数,用于平衡诊断性能和通道去冗余程度。
图3所示,通过“输入端时间尺度分解”和“表示端多样性约束”的协同设计,GRU和LSTM两通道被分别引导关注短期动态与长期演化信息,并在优化过程中主动降低特征相关性,从而在理论上和实现上同时保证并行融合的互补性与低冗余性,提高集成特征在噪声扰动、工况切换和故障早期弱特征场景下的稳定性与鲁棒性,为后续故障识别和诊断分析提供更可靠的特征基础。

图3   由GRU和LSTM组成的并行双通道网络结构Fig.3   A parallel two-channel network incorporating both GRU and LSTM

1.2 多头自注意力机制

尽管GRU和LSTM构成的并行网络能够有效提取过程数据中的短期局部特征与长期时序依赖,但若将其输出直接输入全连接(fully connected, FC)层,则可能因该层固有的密集连接特性引发参数冗余和特征重叠。而且,FC层缺乏卷积或注意力机制所具有的稀疏性和结构化特征选择能力,会影响特征表达效率并最终影响模型的分类性能。为此,在提出模型的FC层之前引入MHSA机制,该机制通过多个注意力头对特征进行加权建模,能够根据不同时间尺度和信息重要性自适应调整特征贡献,从而能够突出关键特征并抑制冗余信息[22]
图4所示,MHSA机制由多个并行的注意力头组成,能够同时学习多样化的特征关系,从而增强其处理长序列的能力,提高故障诊断任务中的故障分类能力[23]

图4   多头自注意力机制结构示意图Fig.4   Schematic architecture of MHSA
在MHSA中,输入特征矩阵θ=[θ1, θ2, …, θn]∈Rn×m,经过3个不同的线性变换层初步处理,生成当前位置信息检索意图的查询向量q、捕获上下文信息的键向量k和包含相应特征表示的值向量v。该过程可以用式(16)表示。

(16)
式中,WqWkWv分别表示查询向量、键向量、值向量的可学习权重矩阵。
通过查询向量与所有键向量之间的缩放点积运算计算注意力分数。随后,通过式(17)给每个特征分配相对注意力权重进行量化。

(17)
式中,ij表示时间步长,dk表示尺度因子。
注意力输出bi由归一化注意力权重和值向量通过式(18)加权线性组合计算。

(18)
通过采用多个并行注意力头,MHSA使模型能够同时学习不同子空间中的不同特征,从而有利于关键特征的提取。如图4所示,输入的特征计算查询向量、键向量和值向量被划分成h个独立的头,每个头在各自的子空间内执行并行的注意力计算,使得模型能够捕获特征的各个方面,然后将所有注意力头的输出进行串联,并通过一个最终的线性变换层,从而实现多尺度特征的集成。这种并行和融合机制增强了MHSA的整体分类性能,其详细的计算过程如式(19)~式(21)所示。

(19)

(20)

(21)
式中,bh表示第h个头的注意力输出;Bn表示将所有头的输出串联后使用权重矩阵Wo进行线性投影得到的最终MHSA输出; 矩阵分别对应从输入特征矩阵θ生成查询向量qh、键向量kh、值向量vh的可学习权重矩阵。
MHSA机制通过其多头的并行计算,使模型能够从不同子空间动态评估输入特征的重要性。这种动态权重分配机制不仅让模型能甄别出对故障分类至关重要的关键变量,还能有效过滤冗余信息。同时,多头注意力的分工降低了模型对个别主导特征的依赖,从而减轻过拟合风险,最终显著提升模型的泛化能力。

1.3 Bi-MCMHSA模型

图5所示,本研究提出的Bi-MCMHSA分类模型由两个阶段构成:第一阶段根据CR值将故障初步划分为H型和E型,对于E型故障可直接给出分类结果,对于H型故障输入第二阶段进一步分析;第二阶段采用DKPCA模型计算各类H型故障的SPE与T²统计量,据此构建增广特征矩阵,再次输入至MCMHSA模型,以实现更高精度的故障识别。通过这种分级诊断策略可有效提升对复杂故障模式的识别能力和诊断可靠性。


图5   双级故障诊断模型步骤Fig.5   Fault diagnosis process of Bi-MCMHSA model
模型首先利用LSTM和GRU层并行处理输入的过程数据,以提取互补的时间特征。随后将二者的输出进行串联拼接,形成集成的双通道特征表示。该特征图随后输入至MHSA层,由其多个注意力头在不同子空间内并行计算注意力分布。最终如表1所示,模型根据式(22)计算的CR值将故障区分为E类和H类。

(22)

表1   混淆矩阵Table 1   Confusion matrix


式(22)中,FN、FP、TP和TN根据表1的混淆矩阵进行定义,TP是指真值和模型预测都为正的样本,FN是指真值和模型预测都为负的样本,FP是指真值为负但被模型错误预测为正的样本,TN是指真值为正但被模型错误预测为负的样本。CR值可用于定量表征故障的诊断复杂度和错误分类概率。通常,较高的CR值表明诊断更为复杂,对应将故障归为H类;E类故障则与之相反,表现为较低的故障检测率和较低的CR值。在本研究中,CR的阈值设置为0.15,若故障的CR值超过该阈值则被判定为H类故障,并随后在第二阶段进一步进行故障识别和分类。
为了进一步精确分析H类故障,在第二阶段使用DKPCA方法计算H类故障的SPE统计量和T2统计量。T2统计量对过程变量在主元方向上的变化尤为敏感,能有效监测变量间相关性的改变,可作为这一变化过程的有效监测指标。与T2统计量相比,SPE统计量能够检测残差子空间中的变化,对存在细微偏差和微小波动的过程变量具有更强的敏感性[24]。通过同时使用T2和SPE统计量对原始数据进行增广,可以构建增广特征矩阵,从而显著提高故障分类精度。
首先,H类故障的数据矩阵xRn×(其中n代表样本量,m表示过程变量数量)根据式(23)转换为包含时滞变量的动态矩阵xdynamic,其中d代表时间滞后阶数,取值选择d=20。

(23)
然后,通过核函数将输入数据非线性映射到高维特征空间F,同时隐式计算对应的核矩阵KRn×n,并利用式(24)式(25)对其进行中心化处理。

(24)

(25)
式中,矩阵Kc代表中心化后的核矩阵,1n表示所有元素均为1/nn×n归一化矩阵。
核函数选择式(26)所示的高斯核函数。

(26)
这里代表控制高斯函数宽度的核带宽参数,从而决定了特征空间映射的局部化程度。
接着,中心化核矩阵Kc通过式(27)进行特征值分解,其中α代表与核空间主成分方向对应的特征向量矩阵,λ为表示各方向方差贡献的特征值对角矩阵。

(27)
最后,选取前p个最大的特征值对应的特征向量,依据进行归一化处理。通过式(28)计算动态矩阵xdynamic在主成分子空间上的投影。

(28)
式中,ti表示输入样本在核函数计算的特征空间中投影至第i个主成分的投影得分。
T2统计量与SPE统计量可通过式(29)式(30)计算,式中Λ为对角矩阵,其对角元素对应核矩阵分解得到的前p个最大特征值。

(29)

(30)
对故障数据的T2统计量和SPE统计量计算完成后,将其与原始过程变量进行拼接,构建增广特征矩阵。将与H类故障对应的增广特征样本划分为训练集和测试集,将其输入到第二阶段的MCMHSA模型,完成模型的综合训练和性能评估。

2 案例分析

本研究选取田纳西-伊斯曼(TE)过程作为案例,评估所提出的Bi-MCMHSA模型的故障分类性能。

2.1 过程描述

TE过程由Downs和Vogel开发[25],作为评价故障诊断模型性能的基准化工过程。
图6所示,TE过程包括5个主要操作单元:①用于化学反应的连续搅拌釜式反应器;②用于产品蒸汽冷凝的冷凝器;③气液分离器;④用于气体循环的压缩机;⑤用于产品纯化的汽提器。该基准系统包括52个过程变量和20个故障(表2)。此外,TE过程具有典型且显著的时序动态特性:各单元在物料守恒和能量守恒约束下呈现连续时间演化;受设备滞留量、热惯性和相平衡/反应动力学影响,过程变量普遍存在惯性、时滞与多变量强耦合;闭环控制回路与回流结构(如气体循环)会引入反馈调节和扰动传播效应,使故障往往表现为“初期弱扰动—中期耦合扩散—后期稳态偏移或振荡”的时间演化轨迹。特别是对阶跃扰动、渐变退化以及跨单元传播型故障,异常信息需要在一定时间窗口内累积并通过多变量序列关联才能可靠辨识,因此采用基于时序特征的建模和诊断策略更符合TE过程的动态本质,也更有利于提升早期弱故障和传播型故障的识别能力。


图6   田纳西-伊斯曼(TE)过程流程图Fig.6   Flow chart of TE process

表2   TE过程故障说明Table 2   Faults in TE process


该过程在25 h的正常运行条件下进行模拟,采样间隔为3 min,并在随机初始条件下进行20次独立重复模拟,得到一个包含10000个正常运行样本的综合数据集。对于有故障的过程模拟,在引入特定故障之前过程先在正常条件下运行8 h,然后进入40 h的运行周期,其中数据仅在故障条件下收集。对于每个故障,在随机的初始参数下进行10次独立重复相应的过程。最终,将数据集按照8∶2的比例划分为训练集和测试集,训练集包含128000个故障样本和8000个正常样本,测试集包含32000个故障样本和2000个正常样本,进行综合评估。

2.2 故障分类结果

表3所示,为了对比各个部分在模型中的效果,搭建了基础的LSTM模型、GRU模型和两个同源模型。MC (multichannel) 模型(同源模型1)和MCMHSA (multichannel multi-head self-attention)模型(同源模型2)均采用由LSTM层和GRU层构成的并行结构进行数据预处理和特征提取。其中,MC模型在此结构后直接输出结果;MCMHSA模型则进一步引入多头自注意力,对提取的特征进行融合,从而增强了模型的学习能力。两个同源模型中LSTM层和GRU层的层数都为1。在各个模型中使用的LSTM网络的隐藏单元数量为32,GRU网络的隐藏单元数量为64。MCMHSA模型的多头自注意力头数为6,通道数为36;Bi-MCMHSA模型在第一阶段保留了同源模型2的参数,在第二阶段的MCMHSA模型中的多头自注意力头数为4,通道数为24。

表3   各个同源模型网络参数表Table 3   Network parameters table for each homologous model


所有模型的训练和测试阶段均在一台运行Windows 10的64位计算机上执行,计算机配置为Intel Core i5处理器,主频2.40 GHz,内存8 GB。如表4所示,所有模型经过训练和统计参数后,基础模型LSTM模型和GRU模型的参数数量分别为11500个和8800个,同源模型MC模型和MCMHSA模型的参数数量分别为41000个和55000个。所提出的Bi-MCMHSA模型的参数数量达到109000个。这些模型对应的训练时间也随模型的复杂度增加,从基础模型的370 s和259 s的训练时间分别增加到1032 s和1056 s。所提出的Bi-MCMHSA模型的训练时间为1341 s,但是测试时间的增加在合理范围内。34000个测试样本在Bi-MCMHSA模型中的测试时间为6.01 s,在工业上存在实时应用的可能性。

表4   各个模型训练和测试时间及可学习参数表Table 4   Training and testing time and learnable parameters table for each model


本研究将故障检测率(fault detection rate,FDR) [式(31)]作为评价各种模型诊断性能的主要指标。Bi-MCMHSA和其他几种对比模型关于TE过程中20种故障的FDR值见表5

(31)

表5   不同故障诊断模型的FDRTable 5   FDR of different fault diagnosis models


单一结构LSTM模型和GRU模型的平均FDR值分别为72.93%和75.28%,而且在故障3、9、15这3个难检故障中的表现极差,FDR值分别只能达到13.38%、0.44%、0.69%和22.44%、0.21%、0.69%。并行网络结构显著提升了MC模型的性能,平均FDR增长为82.08%,3个难检故障对应的FDR分别提升至25.19%、1.06%、10.50%。MCMHSA模型的性能进一步增强,平均FDR为87.82%,3个难检故障的FDR分别为78.13%、22.94%、35.69%。本研究提出的Bi-MCMHSA模型的故障分类准确率相对其他模型都显著提高,平均FDR值高达90.19%,3个难检故障的FDR分别增至71.56%、30.56%、63.56%。
图7所示,前32个特征为LSTM层提取的高阶特征,从第33个开始是GRU层提取的低阶特征,对多头自注意力机制中的6个头共36个通道进行了权重可视化,其中较深的蓝色表示对应特征的权重越大越接近1,较深的黄色表示对应特征的权重越小越接近0。每个通道都是一个独立的子空间,进行注意力计算时是相互独立的,可以从不同角度关注不同特征的重要性。例如第一个通道中,在高阶特征中仅有第21个特征贡献较大,其余贡献较大的特征均存在于低阶特征中。多头自注意力机制中存在的36个通道从不同的角度关注不同的特征,确保消除冗余特征,保证有效特征在训练过程中对于故障分类均有贡献。

图7   高阶特征(LSTM)和低阶特征(GRU)输出权重可视化 Fig.7   Visualization of output weights for high-order features (LSTM) and low-order features (GRU)
图8显示了使用所提出模型在第一阶段的故障分类结果,其中黄点代表正确分类,红点代表误报。第一阶段MCMHSA模型的误分类主要发生在3、9、15这3个难检故障,具体来说,28.75%的故障9被误判为故障3,17.81%的故障9被误判为故障15;13.31%的故障15被误判为故障3,6.75%的故障15被误判为故障9。此外,尽管模型对故障8(88.06%)、故障16(90.25%)和故障19(86.94%)取得了相对较高的FDR值,但混淆矩阵表明这些故障也经常被误分类为故障3、故障9或故障15。值得注意的是,很多正常类型被误报为故障8、故障9、故障15、故障16和故障19。这是因为这些故障本身蕴藏的特征与正常工况下的特征类似,经过多次迭代后模型容易学习到错误的特征,因此与这些故障类型容易混淆。为了进一步区分正常类型和部分难检故障类型,通过搭建第二阶段的MCMSHA模型进行故障分类。


图8   MCMHSA模型的故障诊断结果混淆矩阵图Fig.8   Confusion matrix diagram of fault diagnosis results of MCMHSA model
所有20种故障类型的CR值如图9所示,显示故障9、故障3、故障15的CR值分别为0.6842、0.6312、0.6181,明显超过阈值0.15。此外,故障19、故障8、故障16的CR值分别为0.2000、0.1563、0.1551,也超过了阈值。因此,将故障3、故障8、故障9、故障15、故障16和故障19确定为H类故障,并在模型第二阶段进一步分析。

图9   20种故障类型的CR值Fig.9   CR values of all 20 faults
第二阶段,利用t-分布随机邻域嵌入(t-distributed stochastic neighbor embedding,t -SNE)技术对H类故障进行降维分析和可视化。如图10所示,在第二阶段MCMHSA建模前不同故障对应的数据点显示出较明显的重叠。特别是故障9完全嵌入在周围的故障类型中,表明与其他故障高度混合。相比之下,经过第二阶段MCMHSA模型处理后,故障8、故障16和故障19的可视化特征变得更加紧凑且分离良好,具有清晰的边界,表明新模型对这些难检故障的区分能力显著增强。然而,故障3、故障9和故障15的可视化特征之间仍然存在部分重叠,特别是故障9与故障3和故障15之间存在相当大的交叉。已有研究表明[26-28],故障3、故障9和故障15由微小波动引发,通常导致故障诊断性能表现不佳。经过分析,故障3属于阶跃型故障,故障引起的主要原因是进入反应器的D物料流(气相组分)的温度发生了一个阶跃性的微小变化,D物料流在进入反应器与其他大量物料(包括循环气体)混合后对整个反应器温度的影响非常微弱。故障9属于随机扰动型故障,故障引起的主要原因是D物料流的温度不再保持恒定,而是引入了随机波动(通常建模为服从特定分布的白噪声或随机游走)。故障15属于黏滞型故障,故障引起的主要原因是产品冷凝器的冷却水阀门出现卡滞。在后续优化中,可以结合慢特征分析 (slow feature analysis, SFA)提取该类故障的缓慢变化特征,与提取的时序数据共同输入到分类器中进行故障分类。

图10   t-SNE可视化特征分布Fig.10   t-SNE visualization of feature distributions
为进一步验证所提双阶段模型的诊断效果,选取6种代表性模型进行对比,包括多元统计方法与深度学习模型:①DPCA-DR模型,采用动态主成分分析(dynamic principal component analysis, DPCA)对残差进行解相关处理,以降低自相关性并提升监测稳定性[29];②KPCA-KICA模型,结合核主成分分析(kernel principal component analysis, KPCA)提取高斯特征和核独立成分分析(kernel independent component analysis, KICA)提取非高斯特征,构建非线性动态监测框架[30];③KPLS-OPM模型,引入最优偏好矩阵(optimal preference matrix, OPM)调整变量分布,通过优化核偏最小二乘法(kernel partial least squares, KPLS) 的协方差结构提升诊断精度[31];④DCNN模型,采用由卷积层、池化层、Dropout机制和全连接层构成的深度卷积神经网络架构,实现分层特征学习[32];⑤GRU-EDCNN模型,由Zhang等[33]提出,通过GRU与深度卷积神经网络的融合增强时序特征提取和故障分类性能;⑥时空特征融合网络(spatiotemporal feature integration network, SFIN)模型,由Guo等[34]提出,通过图注意力网络(graph attention network, GAT)和双向长短期记忆网络(bidirec­tional long short-term memory, Bi-LSTM) 并行提取化工过程数据的时空特征,并利用多通道CNN进行故障诊断。
表6 所示,在多元统计方法中,KPCA-KICA模型整体表现最差,平均FDR仅为74.75%,特别是对故障3、故障9、故障15的FDR分别低至8.00%、6.00%、6.00%;DPCA-DR模型在处理复杂故障时同样表现不佳,其对故障3和故障9的FDR分别降至2.10%和2.00%,整体平均FDR为84.99%;KPLS-OPM模型在这些挑战性故障中表现最优,对故障3、故障9、故障15的FDR分别达到76.36%、85.14%、80.50%。相比之下,基于深度学习的模型展现出显著提升:DCNN模型和GRU-EDCNN模型的整体FDR分别为88.20%和89.69%;Bi-MCMHSA模型进一步提升了综合分类性能,平均FDR达到90.19%,其对故障15和故障16的FDR相比DCNN模型的28.00%和44.20%与GRU-EDCNN模型的51.63%和47.19%分别提升至63.56%和93.56%,但该模型并非对所有故障都优于深度学习模型,其对故障3和故障9的FDR分别为71.56%和30.56%,低于GRU-EDCNN模型的92.25%和50.16%。以上深度学习模型均没有考虑空间特征,而SFIN模型在加入了空间特征提取模块后平均FDR达到94.84%,甚至故障1、故障2、故障4、故障6和故障7的FDR均达到了100%。

表6   不同FDD模型在TE过程中的FDR对比Table 6   FDR of different FDD models in TE process


3 结论与展望

基于深度学习的数据驱动方法由于其强大的特征提取能力,已迅速成为提升化工过程运行可靠性和安全性的有效故障检测与诊断方法。然而,传统的深度学习方法在处理具有复杂时间相关性的过程数据时存在局限。为此,本研究开发了一种新的双阶段MCMHSA模型,通过多尺度时间特征提取和注意力驱动的特征融合策略提升检测与诊断性能。在第一阶段,模型采用双通道并行结构以提取多尺度时序特征,其中LSTM层负责捕获长期时间依赖关系,GRU层负责提取短期时间依赖关系。随后,通过MHSA层对两通道提取的特征进行融合。MHSA机制能够根据各特征的诊断重要性自适应地分配权重,有效抑制冗余信息并增强诊断相关信息。为了进一步提升对具有微小变化特征的H类故障的分类精度,在模型的第二阶段利用DKPCA方法计算H类故障的T²和SPE统计量,构造增广特征矩阵,借助SPE统计量对微小变化的敏感性进一步增强模型在复杂故障场景下的识别性能。
通过在TE过程中的应用,验证了所提出的双阶段MCMHSA模型的高分类精度,模型的平均FDR达到90.19%,相对MC和MCMHSA两个同源模型的分类精度明显提高。此外,所提出的模型对H类故障表现出更好的分类性能。
尽管所提出的模型具有明显的优势,但由于工业环境中可靠标记数据的稀缺性,所提出的模型严重依赖大量精确标记的训练数据。此外,深度学习架构固有的不透明性使模型的可解释性变得复杂,特别是在阐明故障的根本原因和提供透明的诊断解释方面。因此,未来的工作将优先考虑开发半监督深度学习方法,以有效地利用大量未标记数据。此外,通过结合可解释的方法,如因果图模型(causal graphical models,CGMs),有望在不损害其诊断性能的前提下增强模型的可解释性。

A two-stage dual-channel deep learning model for chemical fault classification

LIU Xiuyue 1 ZHANG Jiaxin 2SONG Chaoyang 1DONG Lichun 1 

1. School of Chemistry and Chemical Engineering, Chongqing University, Chongqing 400044, China;  2. College of Chemical Engineering, Hebei Normal University of Science and Technology, Qinhuangdao 066000, Hebei, China )

Abstract Deep learning models exhibit strong feature extraction capability for chemical-process fault diagnosis. However, under nonlinear and high-dimensional operating conditions, a single network often fails to capture both long- and short-term temporal dependencies simultaneously, leading to information loss and feature redundancy. To address this issue, this paper proposes a two-stage, dual-channel, multi-head self-attention fault classification model. The first stage employs a GRU-LSTM dual-channel parallel extraction of complementary temporal representations: LSTM captures long-term temporal dependency features, while GRU captures short-term temporal dependency features; fusion and weighting are achieved through multi-head self-attention, highlighting key features and suppressing redundancy. Subsequently, based on fault confusion values, faults are divided into E-type and H-type categories. H-type faults are further processed in the second stage, where dynamic kernel PCA is applied to compute the Hotelling's (T2) and SPE statistics and construct an augmented feature matrix, thereby improving sensitivity to weak shifts, gradual degradation, and propagation-related anomalies. Experiments on the Tennessee Eastman process demonstrate that the proposed model outperforms representative baseline methods in detection and diagnosis accuracy, robustness, and generalization capability.
Keywords deep learningfault diagnosismulti-head self-attention mechanismdual-channel structuretwo-stage fault diagnosis

第一作者:刘秀玥(2001—),女,硕士研究生,202418021066@stu.cqu.edu.cn

通讯作者:董立春(1972—),男,博士,教授,lcdong72@cqu.edu.cn


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/198666