第一天:文本数据采集与LLM增强分析(6小时) 课时一:文本分析在经管研究中的崛起(1.5小时) 1. 为什么文本数据是实证研究的新“石油” · 传统财务数据已“开采殆尽”,文本数据蕴含丰富的“软信息” · 文本分析在经管研究中的典型应用矩阵:企业竞争力、制造业服务化、管理层情绪、企业战略、风险信息披露 2. 文本分析的技术演进:从词袋到LLM · 第一代:词典法(LIWC、Hownet)——预设词典统计词频 · 第二代:机器学习法(SVM、随机森林)——人工标注+训练分类器 · 第三代:词嵌入(Word2Vec、BERT)——理解语义相似性 · 第四代:LLM增强(GPT、Claude)——理解语境、推理隐含信息、零样本分类 3. AI Agent在文本分析中的角色定位 · 传统模式:研究者设计词典 → 人工/半自动编码 → 手动整理 · Agent模式:研究者设计Prompt → Agent自动提取 → 结构化输出 · 从“统计词频”到“理解语义”,从“人工设计词典”到“模型自动推理” 课时二:LLM文本分析的Prompt工程与质量控制(1.5小时) 1. RTCE框架在文本分析中的应用 · R(角色):领域专家身份设定 · T(任务):明确的提取目标和输出格式 · C(约束):证据要求、置信度、质量门槛 · E(示例):顶刊论文的编码标准参考 2. 文本预处理——让LLM“读懂”你的文本 · 文本清洗:去除噪音、统一编码 · 段落分割与章节识别(MD&A子结构定位) · 长度控制与分块策略(处理超长文本) 3. 质量控制与稳健性考量 · Prompt敏感性测试:同一文本多个Prompt版本对比 · 模型交叉验证:GPT-4 vs Claude vs Qwen结果一致性 · 人工抽样验证:边界案例的准确率评估 · 置信度评分机制:让Agent“知道自己的不确定” 课时三:实操1——Agent自动提取核心竞争力(1.5小时) 1. 案例论文精读 · 戚聿东、孙昌玲、王化成(2021):企业核心竞争力能够降低权益资本成本吗——基于文本分析的经验证据 · 核心方法:从年报“核心竞争力分析”章节通过文本分析法构建度量指标 2. Agent任务设计
· 自动定位“核心竞争力分析”章节 · 提取核心竞争力完整描述 · 提取3-5个核心关键词 · 识别优势类型:技术/品牌/人才/成本/规模/渠道 3. RTCE提示词设计与执行 · 完整Prompt设计与迭代优化 · Agent自动运行与结果输出 · 多公司批量处理与数据集构建 课时四:实操2——Agent从MD&A构建服务化变量(1.5小时) 1. 案例论文精读 · Ni, Wu, Jiang, Jiang(2024):The Bullwhip Effect in Servitized Manufacturers · 核心创新:用GPT识别10-K报告中企业服务化信息,提供可操作的LLM变量构造方案 2. 制造业服务化的识别标准 · 信号一:产品+服务组合(解决方案、系统集成、全生命周期服务) · 信号二:服务收入占比 · 信号三:客户关系深化(增值服务、定制化) · 信号四:组织架构调整(服务部门、服务事业部) · 信号五:战略陈述(服务化转型、从制造到服务) 3. 服务化得分构建 · 0-10分制评分标准设计 · 关键证据提取与置信度标注 · 批量处理与数据集输出 |