一个数字:23,000。 这是斯坦福 REAP 团队在构建 CoPaper.AI 过程中,从 GitHub、社区和学术圈整理出的 AI Agent Skills 总数。
但在这 23,000 个 Skills 中,真正能够开箱即用、代码可复现、持续更新的因果推断方向项目,**不到 1%**。
💡 为什么这份清单值得你花时间
过去三个月,我们团队做了一件“笨功夫”的事。
我们逐一排查了 GitHub 上所有标记为 causal-inference、causal-machine-learning、causal-discovery 的仓库,逐个克隆、安装、跑通 demo,淘汰了超过 80% 的候选项目——有的是三年没更新的僵尸仓库,有的是 README 写得天花乱坠但一跑就报错的“PPT 项目”,还有的干脆只挂了 Agent Skill 的名头,底层逻辑跟因果推断毫无关系。
最终留下的这 10 个,是真正能帮你把“相关”变成“因果”的生产力工具。
这不是一份简单的 Awesome 列表搬运。每一个项目的 Star 数都经过交叉验证,每一个 Skill 的可用性都经过实际安装测试。你在这篇文章里省下的筛选时间,可能就是一篇论文的实验时间。
🏆 排行榜总览
排名依据:
按 GitHub Stars 从高到低排序;Stars 接近时,优先看可用性、维护活跃度和 Agent 集成度。所有项目均实测可跑;新项目不参与数值排名。数据截至 2026-09-15。
| | | |
|---|
| DoWhy | 7.9k | 因果推断“三步走”范式定义者,Identify → Estimate → Refute |
| Uber CausalML | 5.9k | 大厂出品,Uplift Modeling 事实标准 |
| EconML | 4.7k | |
| ml-causal | 3.7k | Agent Skill 形态,因果森林 / DML 即调即用 |
| CausalNex | 2.5k | 麦肯锡出品,贝叶斯网络与 What-if 分析首选 |
| causal-learn | 1.6k | PyWhy 生态因果发现引擎,PC / FCI / GES 全支持 |
| PyWhy-LLM | 314 | |
|
StatsPAI | 297 | Agent-native 计量经济学工具包,390+ 函数 |
| CausalAgent | 新项目 | |
|
Causal Panopticon MCP | 新项目 | |
⚠️ 说明:DoWhy 存在多个 Stars 数据源差异(7,775–8,027),我们取 GitHub API 最新同步值约 7.9k;CausalML 取 5.9k;EconML 取 4.7k。CausalAgent 和 Causal Panopticon MCP 属于新项目,Stars 仍在快速增长中,暂不参与数值排名。
📦 项目深度介绍
🥇 DoWhy
项目用途:因果推断领域的“教科书级”框架,首创 Identify → Estimate → Refute 三步工作流。它不只是一个估计工具,更是一套因果思维的系统化实现——先画 DAG,再判断可识别性,最后用安慰剂检验、随机共变量检验等手段验证估计的稳健性。DoWhy 基于因果推断的统一语言,结合了因果图形模型和潜在结果框架。
项目地址:https://github.com/py-why/dowhy
🥈 Uber CausalML
项目用途:Uplift Modeling 和因果推断的机器学习工具包,覆盖 Meta-Learner(T/S/X/R)、Causal Forest、TMLE 等主流方法。如果你在做营销增益建模、用户分层干预,这是目前工业界最成熟的 Python 方案。活跃开发自 2019 年,月下载量超过 90,000 次。
项目地址:https://github.com/uber/causalml
🥉 EconML
项目用途:微软研究院 ALICE 项目核心组件,专注于异质性处理效应(CATE)估计。实现了 Double Machine Learning、Causal Forest、DragonNet 等前沿方法,适合需要回答“谁受益最多”的策略优化场景。
项目地址:https://github.com/py-why/EconML
4️⃣ ml-causal
项目用途:这不是一个传统 Python 库,而是一个 Agent Skill——以 SKILL.md 形式封装,可以被 Codex、Claude Code 等 AI 编程助手直接调用。当你输入“帮我跑一个因果森林”或“做双重机器学习”时,它会自动激活并执行完整的因果 ML 分析流程。覆盖
Causal Forests(GRF)、Double/Debiased Machine Learning(DML)、LASSO 变量选择等现代因果 ML 方法。
项目地址:https://github.com/brycewang-stanford/Auto-Empirical-Research-Skills
5️⃣ CausalNex
项目用途:麦肯锡开源的贝叶斯网络因果推断库。它的独特价值在于 “What-if”分析——给定一个因果网络,你可以直接查询“如果把 X 调到某个值,Y 的分布会怎样变化”,非常适合商业决策场景中的反事实推演。
项目地址:https://github.com/mckinsey/causalnex
6️⃣ causal-learn
项目用途:PyWhy 生态的因果发现引擎,实现了 PC、FCI、GES 等经典因果结构学习算法。如果你面对的是一个“不知道变量之间是什么关系”的数据集,causal-learn 可以从数据中自动学习因果图,而不是要求你先给出 DAG。
项目地址:https://github.com/py-why/causal-learn
7️⃣ PyWhy-LLM
项目用途:DoWhy 社区官方推出的 LLM 增强因果分析库。它用大语言模型来辅助因果图中的变量关系推断、混淆因子建议和 DAG 验证——解决了一个长期痛点:因果图应该由领域知识驱动,但大多数人并不知道该画哪些边。PyWhy-LLM 让 LLM 成为你的“领域专家替身”,并与 DoWhy 和 causal-learn 等 PyWhy 生态库深度集成。
项目地址:
https://github.com/py-why/pywhyllm
8️⃣ StatsPAI
项目用途:第一个专为 LLM 工作流设计的计量经济学工具包。390+ 函数、一个 import statspai as sp 覆盖 OLS/IV/DID/RDD/PSM/DML/Causal Forest 等全部主流方法。最关键的差异化在于自描述 API——每个函数都返回带 schema 的结构化结果对象,Agent 不需要查文档就能理解和调用。已发表于 JOSS(Journal of Open Source Software),MIT 开源,Monte Carlo 覆盖率验证全部达标。
项目地址:https://github.com/brycewang-stanford/StatsPAI
9️⃣ CausalAgent
项目用途:基于 LangGraph 的对话式多智能体因果分析系统。你只需要上传数据集,用自然语言描述你的因果问题,CausalAgent 就会自动完成数据预处理、因果分析算法选择、可交互因果图谱生成和专业报告输出。它把因果推断的门槛从“会写代码”降到了“会提问”。采用 MCP 架构解耦核心逻辑与工具,内置 RAG 知识库确保报告学术性与严谨性并存。
项目地址:https://github.com/Heyflyingpig/CausalAgent
🔟 Causal Panopticon MCP
项目用途:一个通过
MCP(Model Context Protocol) 暴露给 AI Agent 的跨域因果发现引擎。它并行调度 18 个异构数据源(FRED、WHO、SEC EDGAR、PubMed、IMF、BLS 等),应用 8 种同行评审的因果算法,在一次 Agent 工具调用中完成从数据采集到 DAG 结构推断的全流程。对于需要跨数据源做因果发现的研究者来说,这是目前唯一一个做到 “一个 MCP 连接搞定一切” 的方案。
项目地址:https://github.com/apifyforge/causal-panopticon-mcp
🎯 如何使用这份清单
如果你是企业数据科学家:从 CausalML 和 EconML 入手,它们是工业级 Uplift 建模和 CATE 估计的标配。
如果你是学术研究者:DoWhy + causal-learn 组合是你的因果推断“基础设施”——前者教你严谨的因果推理流程,后者帮你从数据中发现因果结构。如果你在用 Claude Code 或 Cursor,把 ml-causal 和 StatsPAI 装进你的 Skill 库。
如果你是 AI Agent 开发者:重点研究 CausalAgent 的 LangGraph 多智能体架构和 Causal Panopticon 的 MCP 协议设计模式——它们代表了因果推断与 Agent 技术融合的两个前沿方向。
如果你是刚入门的新手:从 CausalNex 的贝叶斯网络开始。它的 What-if 分析界面直观,不需要你一开始就理解 Double Machine Learning 的数学细节。
因果推断和 Agent 的结合,正在从“研究玩具”变成“生产力工具”。这份清单里的项目,今天就能装、明天就能用。收藏这篇文章,也别忘了给这些项目点个 Star ⭐——开源生态的活力,来自每一个使用者的反馈。