“政策、年报、评论、图片、视频这么多数据,到底怎么变成论文里的变量?知识图谱看起来很复杂,社科生真的能自己做出来吗?”
这门课不讲空泛概念,只带你做三件事:
用 AI+Python 挖掘文本、图片、视频数据
用大模型快速抽取实体关系、构建知识图谱
把中心度、结构洞、网络密度等指标真正变成论文变量
从数据获取、清洗、变量构建,到知识图谱可视化与论文落地,2小时带你跑通一套完整的研究流程。
本课程由深港产学研基地博士后、华中科技大学工学博士授课,研究方向涵盖自然语言处理、RAG、智能体应用与知识图谱表示学习,结合真实科研案例进行实战讲解。
前沿方法入门:多模态社科数据挖掘与知识图谱构建实战(AI+Python版)
本课程优势:
零基础也能上手:AI 辅助代码生成与报错排查,降低 Python 和知识图谱入门门槛。
案例驱动,强调实操:围绕文本、图片、视频等真实社科数据,边讲边做,快速跑通完整流程。
直接服务论文研究:从数据挖掘到变量构建、图谱指标提取,最终落到可用于实证分析和论文写作的研究成果。
金老师,华中科技大学工学博士
主持项目:中国博士后科学基金面上项目;存有学科教育数据集,数据管理超过100万条,形成知识产权共计4项
参与项目:国家重点研发计划项目(形成智能化数据管理、数字运维系统2个、管理数据量级超1亿条、团体标准2项、软件著作权2项)、国家自然科学基金、省科技攻关等项目;
科研成果:在IEEE Trans、WWW、COLING、IJCNN、CCKS、北大学报等国际著名会议及顶刊发表论文8篇,授权国际发明专利2项、申请国内专利3项。
1.1 什么是多模态与知识图谱?
1.2 零基础环境搭建
AI辅助技巧:直接把报错信息发给大模型或智能体(GLM/DeepSeek/通义千问),让它指引你顺利跑通代码。
本地下载并部署工具anaconda。可参考教程https://zhuanlan.zhihu.com/p/476403161在课前自行安装
必备Python库速查:pandas(数据处理)、jieba(分词)、networkx(图谱构建)、transformers(AI模型调用)。
2.1 文本数据挖掘与变量化
数据获取:用AI生成爬虫脚本,批量抓取政策文本、企业年报或社交媒体评论。
文本清洗与分词:jieba 分词、去停用词、构建社科专属词库。
文本变量构建(论文可用):
实战演示:给40条上市公司的ESG报告文本,用AI+Python自动输出“环境关注度”得分。
2.2 图片与视频数据挖掘
实战演示:给短视频数据,自动提取视频标题+语音转写文本,计算情绪得分。
图片挖掘:提取图片元数据(时间、地点)、用AI视觉模型(如CLIP)识别图片内容(如识别企业年报中的图表类型、识别短视频封面场景)。
视频数据挖掘
:提取视频封面、批量语音转文字(ASR技术)、提取视频弹幕或评论。
多模态融合逻辑:如何把文本得分、图片特征、视频转写文本合并成一个面板数据集,直接用于回归。
3.1 实体抽取与关系构建
实操演示:给一段政策文本,用大模型直接抽取出“发文机构-政策主题-受影响行业”的三元组。
核心概念:实体(如政策、企业、人物)、关系(如“发布”、“合作”、“投资”)、属性。
AI大模型抽取法(无需训练):用Prompt指令,让大模型直接把一段文本输出为标准的JSON格式(包含实体和关系)。这是目前最适合社科学生的方法。
3.2 图谱可视化与论文指标提取
实战演练:用刚才抽取的实体关系数据,跑出一个知识图谱图,并输出一张“网络中心度”描述性统计表,直接可放论文附录。
工具:networkx 构建网络 + pyecharts/Gephi 绘制炫酷的关系网络图。
从图谱到论文变量:提取网络中心度(Centrality)、结构洞(Structural Hole)、网络密度等指标,作为论文的核心自变量或因变量。
4.1 顶刊论文拆解
- 拆解《管理世界》与 JPE 顶刊论文:数据从哪来、变量怎么建、图谱指标怎么写进论文。
随即附赠课件、多模态数据挖掘相关代码、debug指令、提示词等相关资料
在课程未开始前,接受“7天无理由退款”,由于是知识付费,一旦直播课开始后,不接受退款。退款请联系客服。