社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  机器学习算法

AAPG|准噶尔永进油源对比(机器学习-单体同位素等)

石油地质学 • 2 天前 • 33 次点击  

1. 文献基本信息

  • 标题:Unveiling genetic affinity between highly mature source rocks and crude oils: A machine learning approach driven by geochemical data

  • 作者:Tianjiao Liu, Xiangchun Chang, Bingbing Shi, Guanlong Zhang, Chenyu Wang, Youde Xu, Junjian Zhang, Zhuanghao Peng

  • 期刊:AAPG Bulletin,Ahead of Print

  • 在线日期:2026 年 6 月 30 日

  • DOI:10.1306/05012625009

  • 通讯作者:Xiangchun Chang(xcchang@sina.com; xcchang@sdust.edu.cn)

  • 资助:国家自然科学基金 42372160、42072172;山东省自然科学基金 ZR2023QD043;中石化胜利油田公司。

  • 代码:Python,Spyder/Anaconda3;GitHub 链接:https://github.com/tianjiaoliu96/Quantitative-Characterization-of-Source-Mixing-Proportions-via-CMF


2. 摘要核心内容

永进地区是准噶尔盆地中部重要产烃区,周围多个生烃凹陷。研究目标是准确关联上侏罗统齐古组 J3q

作者提出:单体碳同位素曲线的形状/模式仍可指示沉积环境;无机地球化学参数(主量、微量元素、稀土元素)对热改造更稳定。因此,将有机同位素曲线形状特征与稳定无机地球化学比值结合,可匹配原油与高成熟源岩。

方法上采用:约束矩阵分解(CMF)+ 多目标粒子群优化(MOPSO) 的混合机器学习流程。结论认为:


3. 研究背景与科学问题


邻区沙湾凹陷、盆1井西 凹陷的二叠系源岩普遍高成熟。随成熟度增加:

  • 倍半萜、甾烷、萜烷等生物标志物分布趋于均一化,浓度降低;

  • 生物标志物比值失去诊断价值;

  • 烷基萘、烷基菲、烷基二苯并噻吩等成熟度参数存在争议;

  • 碳同位素随成熟度变重,绝对碳同位素值难以区分不同时代源岩。

因此,传统生物标志物和绝对碳同位素油源对比结论非唯一。作者提出三个缺口:

  1. 对比特征的成熟度稳健性;

  2. 混源前客观端元定义;

  3. 带不确定性的定量贡献分配,而非定性交会图。

研究引入物理约束到 CMF 中,并用 MOPSO 避免局部极小,提高源贡献估算精度。



4. 地质背景

准噶尔盆地是中国西部大型含油气盆地,分为五个一级构造带:中央坳陷、陆梁隆起、乌伦古坳陷、南天山山前冲断带、东部隆起、西部隆起等。永进地区位于中央坳陷。


5. 样品与实验方法

  • 样品:32 个原油/油砂提取物,42 个源岩样品,覆盖侏罗系
    。

  • 实验:

    • 单体碳同位素:GC-IRMS;

    • 生物标志物:SIM GC-MS;

    • 主量氧化物:XRF;

    • 微量/稀土元素:ICP-MS;

    • QA/QC:平行样、空白、标样。


6. 方法流程

整体流程:有效参数筛选 → 曲线相似性定性分析 → MOPSO 优化 CMF 定量计算。

6.1 有效参数筛选

  • 初选 >50 个氧化还原、古气候、古盐度、古水深等指标。

  • 用 ANOVA F 检验筛选源岩端元间有判别力的参数,保留 p<0.4 的参数。

  • 对稀土元素做 PCA 降维,用 LDA 验证分类效果。

  • 目标:找到高成熟条件下仍有效的参数。

6.2 基于曲线相似性的定性油源对比

引入改进的离散弗雷歇距离 DFD,比较曲线整体形状、趋势、峰谷,而非绝对数值。相比欧氏距离,DFD 对顺序和形态更敏感。

融合多维度特征:

  1. 离散弗雷歇距离:整体形状差异;

  2. 曲率:局部弯曲程度;

  3. 包络线距离:整体波动范围;

  4. 局部波动性:一阶导数绝对值+滑窗平滑;

  5. 峰谷特征:局部峰谷差值。


6.3 MOPSO 优化 CMF 定量混源比例。

步骤:

  1. 异常值处理:0.025 和 0.975 分位裁剪;

  2. 标准化到 [0,1];

  3. CMF 分解;

  4. NNDSVDa 初始化;

  5. MOPSO 迭代求解 W 和 H;

  6. Chord 图可视化混合比例。


7. 主要结果

7.1 生物标志物参数失效

7.3 RI 反转指数


7.4 无机元素参数筛选与验证

    7.5 DFD 聚类与油分组

    层次聚类对比:

    • 欧氏距离聚类区分差;

    • DFD 聚类更准确,与地质端元分类一致。

    同端元内 DFD 小,不同端元间 DFD 大。Table 5 平均 DFD 显示各自端元自比最小,例如:


    适用性

    • 适用于全球高成熟源岩、混源叠加盆地,如塔里木、四川、鄂尔多斯盆地等。

    • 不依赖传统生物标志物或绝对同位素值。

    • 数据灵活:有机数据有限时可仅用无机参数。

    • 支持 2–5 个源端元:二元混源可简化为 2 端元;多源系统用 MOPSO 平衡多目标约束。

    • 新盆地应用建议:校准 ANOVA F 检验 p 阈值;用地质证据验证端元合理性。

    局限

    • 结论依赖源岩样品地球化学代表性;

    • 样品是复杂地质系统中的离散点;

    • 高维数据、样本量有限,可能过拟合;

    • 端元稳定性假设无机指标受成岩叠加有限;

    • 未来需更多样品、更多凹陷和层位,扩展到四川盆地、Anadarko 盆地、车排子凸起、墨西哥东南部等。


    10. 结论

    12. 总体贡献与创新点

    • 针对高成熟源岩传统油源对比失效问题,提出同位素曲线形态 + 无机元素 + 机器学习的综合方案。

    • 用 DFD 等多维曲线相似性替代绝对数值比较,抗成熟改造。

    • 用 MOPSO 优化 CMF,实现混源比例定量、非负、和为一、稀疏约束,并用 Chord 图可视化。


    Python社区是高质量的Python/Django开发社区
    本文地址:http://www.python88.com/topic/201572