Research Unit
of Machine Learning Application
标题:《DHDM: An interpretable masked deep-learning model for hail potential forecasting》
作者:Xinyi Zeng(曾馨仪)、Wencong Cheng(程文聪)、Na Liu(刘娜)、Qi Liu(刘祺)、Chen Qi(齐晨)、Miaobo Wang(王淼波)、Tianye Li(李田野)、Junzhe Ren(任俊哲)、Yi Fang(方艺)、Deming Zhao(赵得明) 和 Jiangjiang Xia(夏江江,通讯作者)。作者团队来自中国科学院大气物理研究所、中国科学院大学、北京航空气象研究所、中国气象局国家气象信息中心、北京市气象服务中心等单位。所有作者均对本研究有贡献。
发表时间:该文章已于2026年6月发表于《Quarterly Journal of the Royal Meteorological Society》期刊。该期刊为英国皇家气象学会旗下的国际同行评议期刊,由Wiley出版,是气象学和大气科学领域历史悠久的学术期刊。
核心发现:
本研究提出的DHDM模型融合卷积神经网络、残差模块和掩码机制,在样本数量有限的条件下提升了冰雹潜势识别能力。最佳模型DHDM-25在测试集上取得0.807的冰雹命中率和0.825的准确率,表明适当的掩码有助于深度学习模型学习更稳健的天气形势特征,降低对固定信息的依赖。
可解释性分析表明,模型主要关注地面气压以及 850hPa、500hPa、200hPa等关键层次的位势高度场。这些变量可以与冰雹天气形成中的低层触发、中层动力支持和高层辐散过程对应,说明模型判断与气象物理认识较为一致。
研究背景与目标:
冰雹天气是强对流天气中破坏性较强的灾害类型,对农业、交通、电力、光伏设施和城市运行造成显著影响。冰雹事件突发性强、空间尺度小、持续时间短,观测样本也相对有限。传统的冰雹天气潜势预报方法依赖预报员对多种冰雹形成条件的综合判断,客观性和自动化能力仍需提高。
本文基于再分析资料和观测冰雹记录建立深度学习冰雹诊断模型。该模型可与数值天气预报产品衔接,用于生成冰雹潜势预报;可解释性分析则用于检验模型决策是否符合气象物理认识。
数据来源:
1. 冰雹观测样本:使用中国气象局地面气象观测网络记录的冰雹样本。研究期为2012-2018年,研究区域为[18.55°N-40.0°N, 97.133°E-124.15°E]的中国大陆地区,共包含6,941条冰雹正样本。
2. 非冰雹样本:以冰雹样本的时间和位置为参考,随机选取冰雹发生前后5天内未发生冰雹的时空点,控制正负样本比例为1:4,构建25,964个非冰雹样本。
3. 再分析数据:使用ECMWF ERA5再分析资料,将观测时间由北京时间统一转换为UTC,并匹配对应的整点ERA5场。
4. 输入变量:选取 与冰雹天气相关的53个气象特征作为模型输入,涵盖单层变量以及200、500、700、850、925、1000hPa等多个气压层变量。
5. 空间范围:每个样本构建7 x 7 x 53的三维输入数组,中心为冰雹事件邻近格点,空间范围约对应中纬度地区78km x 78km。论文选取这一范围,是为了覆盖对流系统发生发展所需的中尺度环境;冰雹相关对流系统通常受几十至数百公里尺度的大气条件影响,该窗口能够在保留局地信息的同时纳入周边动力、热力和水汽背景。
表 1 DHDM输入的53个气象特征。特征包括10m/100m风场、2m温度和露点、CAPE、零度层高度、整层水汽、地面气压,以及200、500、700、850、925、1000hPa等气压层上的位势高度、相对湿度、比湿、温度、风和垂直速度等变量。
研究方案:
DHDM的技术路线包括空间卷积、残差学习、随机掩码和不平衡学习。
1. 空间卷积:模型使用卷积神经网络从7 x 7气象要素场中提取空间结构特征,用于识别有利于冰雹发生的环境条件。
2. 残差模块:模型引入ResBlock残差模块,以缓解深层网络训练中的梯度退化问题,保证信息在网络层间有效传递。
3. 掩码机制:模型将7 x 7空间网格中的每一个格点视为一个patch,即一个包含53个气象变量的局地空间单元。训练时,模型会随机打乱49个patch,并按设定比例遮挡其中一部分,仅保留剩余patch参与后续卷积计算。例如,当掩码比例为0.25时,49个patch中约保留36个可见patch。这样的训练方式相当于对同一气象场构造不同的可见子集,迫使模型不能依赖某几个固定格点或局地信号,而是学习更分布式、更稳健的天气形势表达。论文将该机制解释为一种特征级数据增强和正则化策略,用于降低有限冰雹样本条件下的过拟合风险。
4. 不平衡学习:冰雹属于小概率极端天气事件,正负样本天然不平衡。本研究采用加权二元交叉熵损失函数,提高模型对冰雹样本的识别权重,以降低漏报风险。
图 1 DHDM模型结构及掩码机制示意。左侧为7 x 7 x 53输入特征;中部为patch-based masking过程,即将7 x 7空间网格展平为49个 patch,随机打乱后按设定比例遮挡,仅保留可见patch;右侧为含ResBlock的CNN分类器。原文同时给出了不含ResBlock和掩码机制的基线CNN结构用于对照。
研究结果:
实验比较了0、0.2、0.25、0.3、0.4、0.5、0.6和 0.75等不同掩码比例,并设置基线模型进行对照。基线模型为不含ResBlock和掩码机制的普通CNN,采用与DHDM相同的超参数和早停策略。结果显示,掩码比例为0.25的DHDM-25在准确率、命中率、威胁评分等指标上表现最优。
表 2 不同掩码比例下DHDM与基线CNN在测试集上的性能。掩码比例表示训练时随机遮挡的空间patch占比;DHDM-00表示不使用掩码的DHDM,DHDM-25 表示掩码比例为0.25的模型,Baseline为不含ResBlock和掩码机制的普通CNN。指标包括准确率(ACC)、命中率(POD)、误报率(FAR)、漏报率(FNR)、威胁评分(TS)、公平威胁评分(ETS)和Heidke技巧评分(HSS)。
相较于不使用掩码的DHDM-00,DHDM-25的命中率(POD)由0.782提升至0.807,误报率(FAR)由 0.532降至0.509。相较于不含残差模块和掩码机制的基线CNN,DHDM-25 在各项评估指标上也整体表现更优,说明适度掩码有助于提高深度学习模型对冰雹天气的识别能力。
论文还进一步比较了DHDM-00与DHDM-25的预测概率分布和概率校准表现。概率密度分析显示,进行0.25 比例的掩码后,模型在冰雹和非冰雹样本上的概率分布更加平滑,极端概率区分能力有所增强。具体而言,DHDM-25在冰雹样本上的密度峰度由1.93 降至1.04,在非冰雹样本上由4.82 降至3.75,说明模型输出不再过度集中于少数概率区间,预测分布更稳定。同时,DHDM-25对冰雹样本给出高概率预警、对非冰雹样本给出低概率排除的能力更强,有助于减少模糊判断区间。
图 2 DHDM-00与DHDM-25的预测概率密度曲线。左图为冰雹样本(Label=1),右图为非冰雹样本(Label=0);曲线比较两种模型对两类样本输出概率的分布差异,并给出密度峰度和原始峰度,用于评估模型概率分布的集中程度和极端概率区分能力。
校准分析表明,两个模型的原始概率都存在一定过度自信,尤其在高预测概率区间更明显。但相比DHDM-00,DHDM-25在高概率冰雹预警区间与实际发生频率更加接近,Brier Score也由0.1605降至0.1494,说明其概率预报质量有所改善。论文进一步使用Platt scaling和isotonic regression进行后校准,结果显示两种方法均可改善概率校准表现,且DHDM-25在校准后仍保持更低的Brier Score,表明掩码机制不仅提升了分类识别能力,也改善了模型概率输出的稳定性。
图 3 DHDM-00与 DHDM-25的后校准结果。图 (a) 为Platt scaling校准前后对比,图 (b) 为isotonic regression校准前后对比;虚线表示理想校准线,BrS为Brier Score,数值越低表示概率预报误差越小。
ROC曲线分析进一步验证了DHDM-25的判别能力。两个模型的AUC均高于0.8,说明都具备较好的冰雹与非冰雹样本区分能力;其中DHDM-25的AUC为 0.8727,高于DHDM-00的0.8359,且其ROC曲线整体位于DHDM-00左上方。这表明在不同判别阈值下,DHDM-25通常能够取得更高的命中率和更低的误报水平,进一步支持掩码机制对模型判别性能的提升作用。
图 4 DHDM-00与DHDM-25在测试集上的ROC曲线。曲线比较两种模型在不同判别阈值下的真阳性率(TPR/POD)与假阳性率(FPR);图中圆点标示阈值为0.5时的性能,虚线为随机分类器基准。
但掩码比例并非越高越好。论文认为,0.25的掩码比例取得最佳效果,主要与气象场本身的物理属性和模型规模有关。与普通图像或自然信号不同,气象变量之间具有较强的空间连续性和物理耦合关系。过高的掩码比例会移除过多空间信息,破坏天气系统的连续结构,使模型难以学习完整的环流形势。另一方面,过低的掩码比例难以提供足够的正则化约束。DHDM本身规模较小,参数量约为224万,模型大小约7.56 MB,过强的掩码还可能影响收敛过程。综合来看,0.25的掩码比例在信息保留和正则化之间取得了较好平衡:既保留了足够的气象场结构信息,又通过随机遮挡降低过拟合风险,从而提高了模型在有限冰雹样本条件下的稳健性。
可解释性分析:
为评估模型结果是否可靠,本文使用DeepLIFT方法分析输入特征对模型输出的贡献,检验模型是否提取了与冰雹形成相关的气象特征。
图 5 DHDM-00与 DHDM-25的DeepLIFT 特征重要性。柱状图展示地面气压及各气压层位势高度等输入特征对模型输出的归因贡献;数值为特征在全局重要性中的占比,用于比较掩码机制对模型关注层次的影响。
结果显示,地面气压在两个模型中均具有最高重要性。DHDM-25进一步强调850 hPa和 500hPa位势高度,分别对应低层热湿结构、中层槽脊系统和动力抬升条件。这与冰雹潜势诊断中对低层触发、中层动力支持和垂直结构的关注层次一致。
图 6 冰雹潜势预报流程示意。图中展示由多层位势高度场和地面气压识别环流型,再结合CAPE、垂直风、相对湿度、零度层高度等冰雹形成条件,最终形成冰雹潜势判断的流程。
上述结果表明,DHDM-25能够从多层气象特征中提取与冰雹天气相关的环流结构。其特征重要性排序与传统基于环流分型和物理因子组合的冰雹预报思路相互印证。
局限性:
1. 概率校准仍需改进:在1:4类别不平衡设置下,模型预测概率在高值区仍存在一定过度自信。若用于严格概率预报,可进一步结合Platt scaling或isotonic regression等后处理校准方法。
2. 业务应用仍需检验:DHDM当前主要基于 ERA5再分析资料训练,本质上仍是冰雹诊断模型。进入业务预报前,仍需与实时NWP预报场进一步耦合并开展独立检验。
创新点:
1. 引入面向样本稀缺的掩码机制:本文将掩码机制作为特征级数据增强和正则化策略,用于提升有限样本条件下的冰雹识别稳健性。
2. 兼顾模型性能与物理解释:研究通过DeepLIFT分析模型关注的关键变量和层次,增强深度学习结果的气象物理可信度。
3. 构建可扩展的冰雹潜势预报框架:DHDM可作为连接NWP预报产品的诊断模块,为强对流天气智能预报提供参考。
结论与展望:
本研究表明,DHDM通过卷积神经网络、残差结构和适度随机掩码机制,提升了有限样本条件下的冰雹潜势识别能力。最佳模型DHDM-25在测试集上取得0.807的命中率和0.8727的AUC,表明模型能够较好地区分冰雹天气与非冰雹天气。从可解释性角度看,模型重点关注地面气压、850hPa和500hPa位势高度等关键环流特征,与传统冰雹预报中的物理认识一致。该研究说明,面向强对流天气预报的人工智能模型应同时重视预测性能和物理可解释性。
未来,DHDM可进一步与数值天气预报资料结合,在实时预报场景下检验稳定性;同时可面向不同的强对流天气类型开展进一步研究,拓展深度学习在灾害性天气预报中的应用范围。
文章链接:DOI 10.1002/qj.70236