社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Python

【开学预售】AI Agent+Python+Stata 文本分析与多模态数据实战特训营

学术严选 • 3 周前 • 97 次点击  
授课形式:线上直播 + 课后回放 + 课程资料 + 答疑
核心工具:Claude Code、Python(Transformers、EconML、多模态API)、Stata(文本分析辅助)
课程定位:面向经管类研究者,系统讲授如何利用AI Agent从文本(年报、MD&A、政策文件)、PDF(表格与章节)、图片(CEO面部表情、产品图片)等多模态数据中自动提取和构建实证变量,并以顶刊发表标准输出结构化数据集。

【课程核心亮点】

  • 顶刊方法全覆盖:戚聿东等(2021,《会计研究》)文本分析构建核心竞争力、Ni等(2024,Management Science)LLM从MD&A构建服务化变量、Momtaz(2021,SMJ)人工智能情绪识别
  • AI Agent全流程驱动:从“手动编码”到“Agent自动提取”,用Claude Code + Python多模态流水线完成数据采集→变量构建→质量验证
  • 多模态数据融合:覆盖PDF表格与文本提取、MD&A语义分析、图片情感识别三种非结构化数据类型
  • 可复现实操:每个模块配套完整代码和Agent Skill,学完即用

【课程大纲】

第一天:文本数据采集与LLM增强分析(6小时)

课时一:文本分析在经管研究中的崛起(1.5小时)

1. 为什么文本数据是实证研究的新“石油”

· 传统财务数据已“开采殆尽”,文本数据蕴含丰富的“软信息”

· 文本分析在经管研究中的典型应用矩阵:企业竞争力、制造业服务化、管理层情绪、企业战略、风险信息披露

2. 文本分析的技术演进:从词袋到LLM

· 第一代:词典法(LIWC、Hownet)——预设词典统计词频

· 第二代:机器学习法(SVM、随机森林)——人工标注+训练分类器

· 第三代:词嵌入(Word2Vec、BERT)——理解语义相似性

· 第四代:LLM增强(GPT、Claude)——理解语境、推理隐含信息、零样本分类

3. AI Agent在文本分析中的角色定位

· 传统模式:研究者设计词典 → 人工/半自动编码 → 手动整理

· Agent模式:研究者设计Prompt → Agent自动提取 → 结构化输出

· 从“统计词频”到“理解语义”,从“人工设计词典”到“模型自动推理”

课时二:LLM文本分析的Prompt工程与质量控制(1.5小时)

1. RTCE框架在文本分析中的应用

· R(角色):领域专家身份设定

· T(任务):明确的提取目标和输出格式

· C(约束):证据要求、置信度、质量门槛

· E(示例):顶刊论文的编码标准参考

2. 文本预处理——让LLM“读懂”你的文本

· 文本清洗:去除噪音、统一编码

· 段落分割与章节识别(MD&A子结构定位)

· 长度控制与分块策略(处理超长文本)

3. 质量控制与稳健性考量

· Prompt敏感性测试:同一文本多个Prompt版本对比

· 模型交叉验证:GPT-4 vs Claude vs Qwen结果一致性

· 人工抽样验证:边界案例的准确率评估

· 置信度评分机制:让Agent“知道自己的不确定”

课时三:实操1——Agent自动提取核心竞争力(1.5小时)

1. 案例论文精读

· 戚聿东、孙昌玲、王化成(2021):企业核心竞争力能够降低权益资本成本吗——基于文本分析的经验证据

· 核心方法:从年报“核心竞争力分析”章节通过文本分析法构建度量指标

2. Agent任务设计

· 自动定位“核心竞争力分析”章节

· 提取核心竞争力完整描述

· 提取3-5个核心关键词

· 识别优势类型:技术/品牌/人才/成本/规模/渠道

3. RTCE提示词设计与执行

· 完整Prompt设计与迭代优化

· Agent自动运行与结果输出

· 多公司批量处理与数据集构建

课时四:实操2——Agent从MD&A构建服务化变量(1.5小时)

1. 案例论文精读

· Ni, Wu, Jiang, Jiang(2024):The Bullwhip Effect in Servitized Manufacturers

· 核心创新:用GPT识别10-K报告中企业服务化信息,提供可操作的LLM变量构造方案

2. 制造业服务化的识别标准

· 信号一:产品+服务组合(解决方案、系统集成、全生命周期服务)

· 信号二:服务收入占比

· 信号三:客户关系深化(增值服务、定制化)

· 信号四:组织架构调整(服务部门、服务事业部)

· 信号五:战略陈述(服务化转型、从制造到服务)

3. 服务化得分构建

· 0-10分制评分标准设计

· 关键证据提取与置信度标注

· 批量处理与数据集输出

第二天:PDF解析、多模态数据与顶刊复现(6小时)

课时五:PDF数据解析——从年报中提取结构化信息(1.5小时)

1. PDF解析的技术挑战与技术方案

· 挑战:PDF是“显示格式”非“数据格式”、表格结构复杂、多模态内容混合、扫描版需OCR

· 方案一:OCR + 版面分析 + LLM理解(pdfplumber、Camelot、PyMuPDF)

· 方案二:多模态大模型直接理解(GPT-4V、Qwen-VL)

2. 年报PDF的典型提取任务

· “核心竞争力分析”章节提取

· “主营业务分析”表格提取(主要产品名称)

· “管理层讨论与分析”(MD&A)全文提取

3. PDF解析工具对比与选型

· pdfplumber:精确提取文本和表格

· Camelot:专门提取复杂表格

· PyMuPDF:大规模文本提取

· MinerU:PDF转Markdown

课时六:实操3——Agent从年报PDF提取产品与核心竞争力(1.5小时)

1. Agent任务设计

· 从PDF自动定位“核心竞争力分析”和“主营业务分析”章节

· 提取核心竞争力完整描述、关键词、优势类型

· 提取主要产品名称列表(处理表格和文本两种格式)

2. 多模态PDF解析实战

· 文本型PDF:pdfplumber直接提取

· 扫描型PDF:OCR预处理

· 表格提取:Camelot处理合并单元格和跨页表格

3. 结构化输出与数据质量控制

· JSON/CSV格式输出

· 来源页码标注(可追溯性)

· 置信度评分与异常标记

课时七:实操4——Agent图片数据提取与CEO表情识别(1.5小时)

1. 案例论文精读

· Momtaz(2021):CEO Emotions and Firm Valuation in Initial Coin Offerings

· 核心方法:人工智能情感智能(Artificial Emotional Intelligence)识别CEO面部表情

2. 多模态大模型的面部表情识别能力

· Ekman六种基本情绪:喜悦、惊讶、愤怒、悲伤、恐惧、厌恶

· 情绪强度量化(0-10分)

· 置信度评估与低质量图片处理

3. Agent任务设计

· CEO图片加载与质量检查

· 多模态大模型情绪识别

· 情绪类型 + 强度 + 关键面部特征描述

· 批量处理与数据集构建

课时八:顶刊复现——多模态数据变量构建全流程(1.5小时)

1. 三种非结构化数据 → 三种变量构建方法的对比与整合

案例一:PDF文本提取(戚聿东等,2021,《会计研究》)

· 数据来源:年报PDF“核心竞争力分析”章节

· 核心技术:PDF解析 + LLM语义理解

· 输出变量:核心竞争力描述、关键词、优势类型

案例二:MD&A文本分析(Ni等,2024,Management Science)

· 数据来源:10-K报告MD&A章节

· 核心技术:LLM文本理解 + 零样本分类

· 输出变量:制造业服务化得分(0-10分)

案例三:CEO图片分析(Momtaz,2021,SMJ)

· 数据来源:CEO公开图片

· 核心技术:多模态大模型情绪识别

· 输出变量:情绪类型、情绪强度

2. 从非结构化数据到实证变量的完整价值链

· 原始数据(PDF/文本/图片)→ 信息提取(AI Agent)→ 变量构建(研究者设计)→ 实证分析(DID/DDML等)

3. Agent Skill封装与复用

· 将每个提取流程封装为可复用的Agent Skill

· 批量处理与数据集自动化构建

3.课程总结与答疑(30分钟)

· 两天课程核心要点回顾

· Q&A自由提问

· 配套Skill宝典发布(10+文本与多模态分析Skill)

· 后续学习路径建议

【课程配套资源】

  • 课程录播(1年回看)
  • 完整代码与数据(Python + Stata)
  • 10+文本与多模态分析Agent Skill
  • 三篇顶刊论文的复现材料包

【适合人群】

  • 希望用AI Agent从文本、PDF、图片中自动提取和构建变量的经管类研究者
  • 希望将LLM和多模态方法引入自己研究领域的硕博研究生和高校教师
  • 有志于掌握“非结构化数据→结构化变量”全流程技能的科研人员

【授课形式】

  • 小鹅通线上直播
  • 每天6小时(含休息),共12小时
  • 课后长期回放 + 课程资料 + 答疑群

【讲师介绍】

何老师,211大学经济学院副教授,香港浸会大学工商管理学院博士,主要从事评价理论与方法、生产效率分析、资源与环境管理等方向的研究;主讲《高级微观经济学》《高级计量经济学》《农业经济与政策》《经济学原理》等课程;在《Operations Research》《Energy Economics》《China Economic Review》《Transport Policy》《Growth and Change》《计量经济学报》《产业经济评论》等期刊发表论文数篇。主持国家自然科学基金1项。教育部学位中心评审专家;“双法”气候金融研究分会理事。曾获“黄山优秀青年”称号、论文获得《产业经济评论》2023年度优秀论文。

授课时间:暂定10月中下旬,两个周末各一天

课程价格:

单课价格:优惠价799元(原价999元)

组合价格:1999元,即购买《掌握半小时复现一篇论文:用Claude Code 复现顶刊、自动化科研论文训练营》赠送本课程!!!

报名:倘若您对课程感兴趣,扫描下方右侧二维码可直接购买,扫描下方左侧二维码可添加陈老师微信询问课程详情及发票事宜(可开培训费、技术服务费、资料费、数据采集费等)

图片      

课程咨询二维码           课程购买二维码

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/200097