Py学习  »  机器学习算法

大连理工大学EST|全国地表水中PFAS超标风险精准制图:机器学习驱动的源解析与风险评估研究

生态环境科学 • 2 月前 • 119 次点击  

我国作为全球含氟化学品主要生产与消费国,地表水环境面临 PFAS 持续性污染的严峻压力。受监测数据稀疏、污染源空间信息缺失等瓶颈制约,全国尺度 PFAS 污染风险评估长期难以精准开展。本研究整合超 28 万个潜在 PFAS 污染源空间清单,创新构建地理加权随机森林(GWR‑RF)模型,绘制 1 公里分辨率全国地表水 PFAS 超标风险空间图谱,量化高风险区人口暴露规模,解析核心驱动因子与污染源影响范围,填补了数据受限区域大尺度 PFAS 风险精准评估的研究空白,为靶向污染防控与人群健康保护提供科学依据。

1 科学问题

  1. 如何在监测数据稀疏条件下,构建全国尺度空间显性 PFAS 污染源清单,突破数据缺失瓶颈?
  2. 何种机器学习框架能高效融合污染源、气候、地理与社会经济变量,精准预测地表水 PFAS 超标风险?
  3. 我国地表水 PFAS 污染高风险区如何分布?受影响人口规模与核心驱动因子是什么?
  4. 不同类型 PFAS 污染源对地表水污染的空间影响范围与贡献差异如何量化?

2 研究方案

数据整合与预处理:系统梳理 2010‑2024 年文献数据,获取 1618 个地表水 PFAS 监测样本;整合天眼查、环境管理清单等多源数据,识别 15275 个已知 PFAS 使用源与 265882 个潜在污染源;筛选年降水量、距污染源距离、GDP 等 22 个预测变量,消除多重共线性。

模型构建与优化:对比 6 种机器学习算法,优选 GWR‑RF 模型;采用 SMOTE‑Tomek Links 混合采样解决样本不平衡问题,以欧盟 100ng/L 总 PFAS 限值为阈值进行二分类建模。

风险评估与归因:模型预测全国 1 公里网格 PFAS 超标概率,结合人口数据估算暴露人口;通过特征重要性与 SHAP 值解析驱动因素,量化不同污染源的空间影响衰减规律。

3 结论

模型性能:GWR‑RF 模型预测精度达 0.83,ROC‑AUC 为 0.91,具备优异的空间异质性拟合能力。

污染风险分布:全国约 3.34% 地表水存在 PFAS 超标风险,高风险区集中于东部沿海平原与内陆工业大省,长三角、中原地区形成连片高风险带。

人口暴露规模:约 8000‑9000 万人居住于 PFAS 超标高风险区域,超 80% 暴露人口集中于东部沿海省市。

核心驱动因素:年降水量、距已知 PFAS 使用源距离为首要预测因子;GDP、土壤质地等显著影响风险分布;金属处理、日用化学品、集成电路为主要工业排放源。

污染源影响范围:工业与已知污染源影响集中于 20 公里内,污水处理厂、消防训练站可达 40 公里,垃圾处理场延伸至 60 公里,机场无明显空间衰减规律。

研究不足

  1. 监测数据源于文献,存在发表与采样偏差,缺乏时间动态归一化。
  2. 污染源清单存在部分信息缺失,未量化企业级排放强度。
  3. 以总 PFAS 为评估对象,未区分 PFOA、PFOS 等单体风险。

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/195709