社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Python

前沿方法入门:多模态社科数据挖掘与知识图谱构建实战(AI+Python版)

学术AI大模型 • 1 周前 • 81 次点击  

“政策、年报、评论、图片、视频这么多数据,到底怎么变成论文里的变量?知识图谱看起来很复杂,社科生真的能自己做出来吗?”

这门课不讲空泛概念,只带你做三件事:

  • 用 AI+Python 挖掘文本、图片、视频数据

  • 用大模型快速抽取实体关系、构建知识图谱

  • 把中心度、结构洞、网络密度等指标真正变成论文变量

从数据获取、清洗、变量构建,到知识图谱可视化与论文落地,2小时带你跑通一套完整的研究流程。

本课程由深港产学研基地博士后、华中科技大学工学博士授课,研究方向涵盖自然语言处理、RAG、智能体应用与知识图谱表示学习,结合真实科研案例进行实战讲解。



1. 课程概览


课程名称:

前沿方法入门:多模态社科数据挖掘与知识图谱构建实战(AI+Python版)

授课形式:

腾讯会议线上直播+课后回放+课程资料+答疑

报名方式:

扫码


报名

本课程优势:

  • 零基础也能上手:AI 辅助代码生成与报错排查,降低 Python 和知识图谱入门门槛。

  • 案例驱动,强调实操:围绕文本、图片、视频等真实社科数据,边讲边做,快速跑通完整流程。

  • 直接服务论文研究:从数据挖掘到变量构建、图谱指标提取,最终落到可用于实证分析和论文写作的研究成果。



2. 授课团队

金老师,华中科技大学工学博士

  • 主持项目:中国博士后科学基金面上项目;存有学科教育数据集,数据管理超过100万条,形成知识产权共计4项

  • 参与项目:国家重点研发计划项目(形成智能化数据管理、数字运维系统2个、管理数据量级超1亿条、团体标准2项、软件著作权2项)、国家自然科学基金、省科技攻关等项目;

  • 科研成果:在IEEE Trans、WWW、COLING、IJCNN、CCKS、北大学报等国际著名会议及顶刊发表论文8篇,授权国际发明专利2项、申请国内专利3项。


3. 课程大纲

模块一:认知破冰与工具准备

1.1 什么是多模态与知识图谱?

  • 直观理解:文本(政策/年报/评论)、图片(图表/海报/照片)、视频(短视频/访谈)如何变成论文里的数据。

  • 知识图谱在社科中的应用:技术演进图、政策主体关系网、舆情传播链、企业高管关联网络。


1.2 零基础环境搭建

  • AI辅助技巧:直接把报错信息发给大模型或智能体(GLM/DeepSeek/通义千问),让它指引你顺利跑通代码。

  • 本地下载并部署工具anaconda。可参考教程https://zhuanlan.zhihu.com/p/476403161在课前自行安装

  • 必备Python库速查:pandas(数据处理)、jieba(分词)、networkx(图谱构建)、transformers(AI模型调用)。

模块二:多模态社科数据挖掘(文本与图片为主)

2.1 文本数据挖掘与变量化

  • 数据获取:用AI生成爬虫脚本,批量抓取政策文本、企业年报或社交媒体评论。

  • 文本清洗与分词:jieba 分词、去停用词、构建社科专属词库。

  • 文本变量构建(论文可用):

    • 词频统计与TF-IDF:找出核心议题。

    • 情感分析:用大模型API批量判断文本情感倾向(正面/负面/中性),生成情感得分变量。

    • 主题模型(LDA):让AI自动归纳文本主题。

  • 实战演示:给40条上市公司的ESG报告文本,用AI+Python自动输出“环境关注度”得分。


2.2 图片与视频数据挖掘

  • 实战演示:给短视频数据,自动提取视频标题+语音转写文本,计算情绪得分。

  • 图片挖掘:提取图片元数据(时间、地点)、用AI视觉模型(如CLIP)识别图片内容(如识别企业年报中的图表类型、识别短视频封面场景)。

  • 视频数据挖掘 :提取视频封面、批量语音转文字(ASR技术)、提取视频弹幕或评论。

  • 多模态融合逻辑:如何把文本得分、图片特征、视频转写文本合并成一个面板数据集,直接用于回归。

模块三:知识图谱构建与可视化

3.1 实体抽取与关系构建

  • 实操演示:给一段政策文本,用大模型直接抽取出“发文机构-政策主题-受影响行业”的三元组。

  • 核心概念:实体(如政策、企业、人物)、关系(如“发布”、“合作”、“投资”)、属性。

  • AI大模型抽取法(无需训练):用Prompt指令,让大模型直接把一段文本输出为标准的JSON格式(包含实体和关系)。这是目前最适合社科学生的方法。

3.2 图谱可视化与论文指标提取

  • 实战演练:用刚才抽取的实体关系数据,跑出一个知识图谱图,并输出一张“网络中心度”描述性统计表,直接可放论文附录。

  • 工具:networkx 构建网络 + pyecharts/Gephi 绘制炫酷的关系网络图。

  • 从图谱到论文变量:提取网络中心度(Centrality)、结构洞(Structural Hole)、网络密度等指标,作为论文的核心自变量或因变量。

模块四:论文落地与案例拆解

4.1 顶刊论文拆解

  • 拆解《管理世界》与 JPE 顶刊论文:数据从哪来、变量怎么建、图谱指标怎么写进论文。


4. 课程赠品

随即附赠课件、多模态数据挖掘相关代码、debug指令、提示词等相关资料


5.课程售后

课程退款

在课程未开始前,接受“7天无理由退款”,由于是知识付费,一旦直播课开始后,不接受退款。退款请联系客服。


Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/201338