Py学习  »  Python

AI Agent+Python+Stata 文本分析与多模态数据实战特训营

学术严选 • 昨天 • 23 次点击  
授课形式:线上直播 + 课后回放 + 课程资料 + 答疑
核心工具:Claude Code、Python(Transformers、EconML、多模态API)、Stata(文本分析辅助)
课程定位:面向经管类研究者,系统讲授如何利用AI Agent从文本(年报、MD&A、政策文件)、PDF(表格与章节)、图片(CEO面部表情、产品图片)等多模态数据中自动提取和构建实证变量,并以顶刊发表标准输出结构化数据集。

【课程核心亮点】

  • 顶刊方法全覆盖:戚聿东等(2021,《会计研究》)文本分析构建核心竞争力、Ni等(2024,Management Science)LLM从MD&A构建服务化变量、Momtaz(2021,SMJ)人工智能情绪识别
  • AI Agent全流程驱动:从“手动编码”到“Agent自动提取”,用Claude Code + Python多模态流水线完成数据采集→变量构建→质量验证
  • 多模态数据融合:覆盖PDF表格与文本提取、MD&A语义分析、图片情感识别三种非结构化数据类型
  • 可复现实操:每个模块配套完整代码和Agent Skill,学完即用

【课程大纲】

第一天:文本数据采集与LLM增强分析(6小时)

课时一:文本分析在经管研究中的崛起(1.5小时)

1. 为什么文本数据是实证研究的新“石油”

· 传统财务数据已“开采殆尽”,文本数据蕴含丰富的“软信息”

· 文本分析在经管研究中的典型应用矩阵:企业竞争力、制造业服务化、管理层情绪、企业战略、风险信息披露

2. 文本分析的技术演进:从词袋到LLM

· 第一代:词典法(LIWC、Hownet)——预设词典统计词频

· 第二代:机器学习法(SVM、随机森林)——人工标注+训练分类器

· 第三代:词嵌入(Word2Vec、BERT)——理解语义相似性

· 第四代:LLM增强(GPT、Claude)——理解语境、推理隐含信息、零样本分类

3. AI Agent在文本分析中的角色定位

· 传统模式:研究者设计词典 → 人工/半自动编码 → 手动整理

· Agent模式:研究者设计Prompt → Agent自动提取 → 结构化输出

· 从“统计词频”到“理解语义”,从“人工设计词典”到“模型自动推理”

课时二:LLM文本分析的Prompt工程与质量控制(1.5小时)

1. RTCE框架在文本分析中的应用

· R(角色):领域专家身份设定

· T(任务):明确的提取目标和输出格式

· C(约束):证据要求、置信度、质量门槛

· E(示例):顶刊论文的编码标准参考

2. 文本预处理——让LLM“读懂”你的文本

· 文本清洗:去除噪音、统一编码

· 段落分割与章节识别(MD&A子结构定位)

· 长度控制与分块策略(处理超长文本)

3. 质量控制与稳健性考量

· Prompt敏感性测试:同一文本多个Prompt版本对比

· 模型交叉验证:GPT-4 vs Claude vs Qwen结果一致性

· 人工抽样验证:边界案例的准确率评估

· 置信度评分机制:让Agent“知道自己的不确定”

课时三:实操1——Agent自动提取核心竞争力(1.5小时)

1. 案例论文精读

· 戚聿东、孙昌玲、王化成(2021):企业核心竞争力能够降低权益资本成本吗——基于文本分析的经验证据

· 核心方法:从年报“核心竞争力分析”章节通过文本分析法构建度量指标

2. Agent任务设计

· 自动定位“核心竞争力分析”章节

· 提取核心竞争力完整描述

· 提取3-5个核心关键词

· 识别优势类型:技术/品牌/人才/成本/规模/渠道

3. RTCE提示词设计与执行

· 完整Prompt设计与迭代优化

· Agent自动运行与结果输出

· 多公司批量处理与数据集构建

课时四:实操2——Agent从MD&A构建服务化变量(1.5小时)

1. 案例论文精读

· Ni, Wu, Jiang, Jiang(2024):The Bullwhip Effect in Servitized Manufacturers

· 核心创新:用GPT识别10-K报告中企业服务化信息,提供可操作的LLM变量构造方案

2. 制造业服务化的识别标准

· 信号一:产品+服务组合(解决方案、系统集成、全生命周期服务)

· 信号二:服务收入占比

· 信号三:客户关系深化(增值服务、定制化)

· 信号四:组织架构调整(服务部门、服务事业部)

· 信号五:战略陈述(服务化转型、从制造到服务)

3. 服务化得分构建

· 0-10分制评分标准设计

· 关键证据提取与置信度标注

· 批量处理与数据集输出

第二天:PDF解析、多模态数据与顶刊复现(6小时)

课时五:PDF数据解析——从年报中提取结构化信息(1.5小时)

1. PDF解析的技术挑战与技术方案

· 挑战:PDF是“显示格式”非“数据格式”、表格结构复杂、多模态内容混合、扫描版需OCR

· 方案一:OCR + 版面分析 + LLM理解(pdfplumber、Camelot、PyMuPDF)

· 方案二:多模态大模型直接理解(GPT-4V、Qwen-VL)

2. 年报PDF的典型提取任务

· “核心竞争力分析”章节提取

· “主营业务分析”表格提取(主要产品名称)

· “管理层讨论与分析”(MD&A)全文提取

3. PDF解析工具对比与选型

· pdfplumber:精确提取文本和表格

· Camelot:专门提取复杂表格

· PyMuPDF:大规模文本提取

· MinerU:PDF转Markdown

课时六:实操3——Agent从年报PDF提取产品与核心竞争力(1.5小时)

1. Agent任务设计

· 从PDF自动定位“核心竞争力分析”和“主营业务分析”章节

· 提取核心竞争力完整描述、关键词、优势类型

· 提取主要产品名称列表(处理表格和文本两种格式)

2. 多模态PDF解析实战

· 文本型PDF:pdfplumber直接提取

· 扫描型PDF:OCR预处理

· 表格提取:Camelot处理合并单元格和跨页表格

3. 结构化输出与数据质量控制

· JSON/CSV格式输出

· 来源页码标注(可追溯性)

· 置信度评分与异常标记

课时七:实操4——Agent图片数据提取与CEO表情识别(1.5小时)

1. 案例论文精读

· Momtaz(2021):CEO Emotions and Firm Valuation in Initial Coin Offerings

· 核心方法:人工智能情感智能(Artificial Emotional Intelligence)识别CEO面部表情

2. 多模态大模型的面部表情识别能力

· Ekman六种基本情绪:喜悦、惊讶、愤怒、悲伤、恐惧、厌恶

· 情绪强度量化(0-10分)

· 置信度评估与低质量图片处理

3. Agent任务设计

· CEO图片加载与质量检查

· 多模态大模型情绪识别

· 情绪类型 + 强度 + 关键面部特征描述

· 批量处理与数据集构建

课时八:顶刊复现——多模态数据变量构建全流程(1.5小时)

1. 三种非结构化数据 → 三种变量构建方法的对比与整合

案例一:PDF文本提取(戚聿东等,2021,《会计研究》)

· 数据来源:年报PDF“核心竞争力分析”章节

· 核心技术:PDF解析 + LLM语义理解

· 输出变量:核心竞争力描述、关键词、优势类型

案例二:MD&A文本分析(Ni等,2024,Management Science)

· 数据来源:10-K报告MD&A章节

· 核心技术:LLM文本理解 + 零样本分类

· 输出变量:制造业服务化得分(0-10分)

案例三:CEO图片分析(Momtaz,2021,SMJ)

· 数据来源:CEO公开图片

· 核心技术:多模态大模型情绪识别

· 输出变量:情绪类型、情绪强度

2. 从非结构化数据到实证变量的完整价值链

· 原始数据(PDF/文本/图片)→ 信息提取(AI Agent)→ 变量构建(研究者设计)→ 实证分析(DID/DDML等)

3. Agent Skill封装与复用

· 将每个提取流程封装为可复用的Agent Skill

· 批量处理与数据集自动化构建

3.课程总结与答疑(30分钟)

· 两天课程核心要点回顾

· Q&A自由提问

· 配套Skill宝典发布(10+文本与多模态分析Skill)

· 后续学习路径建议

【课程配套资源】

  • 课程录播(1年回看)
  • 完整代码与数据(Python + Stata)
  • 10+文本与多模态分析Agent Skill
  • 三篇顶刊论文的复现材料包

【适合人群】

  • 希望用AI Agent从文本、PDF、图片中自动提取和构建变量的经管类研究者
  • 希望将LLM和多模态方法引入自己研究领域的硕博研究生和高校教师
  • 有志于掌握“非结构化数据→结构化变量”全流程技能的科研人员

【授课形式】

  • 小鹅通线上直播
  • 每天6小时(含休息),共12小时
  • 课后长期回放 + 课程资料 + 答疑群

【讲师介绍】

何老师,211大学经济学院副教授,香港浸会大学工商管理学院博士,主要从事评价理论与方法、生产效率分析、资源与环境管理等方向的研究;主讲《高级微观经济学》《高级计量经济学》《农业经济与政策》《经济学原理》等课程;在《Operations Research》《Energy Economics》《China Economic Review》《Transport Policy》《Growth and Change》《计量经济学报》《产业经济评论》等期刊发表论文数篇。主持国家自然科学基金1项。教育部学位中心评审专家;“双法”气候金融研究分会理事。曾获“黄山优秀青年”称号、论文获得《产业经济评论》2023年度优秀论文。

授课时间:暂定10月中下旬,两个周末各一天

课程价格:

单课价格:优惠价799元(原价999元)

组合价格:1999元,即购买《掌握半小时复现一篇论文:用Claude Code 复现顶刊、自动化科研论文训练营》赠送本课程!!!

报名:倘若您对课程感兴趣,扫描下方右侧二维码可直接购买,扫描下方左侧二维码可添加陈老师微信询问课程详情及发票事宜(可开培训费、技术服务费、资料费、数据采集费等)

图片      

课程咨询二维码           课程购买二维码

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200137