Py学习  »  Python

爬虫实战 | 用Python爬取指定关键词的微博~

Python绿色通道 • 5 年前 • 823 次点击  
↑ 关注 + 星标 ,每天学Python新技能

后台回复【大礼包】送你Python自学大礼包


前几天学校一个老师在做微博的舆情分析找我帮她搞一个用关键字爬取微博的爬虫,再加上最近很多读者问志斌微博爬虫的问题,今天志斌来跟大家分享一下。


01

分析页面


我们此次选择的是从移动端来对微博进行爬取。移动端的反爬就是信息校验反爬虫的cookie反爬虫,所以我们首先要登陆获取cookie。



登陆过后我们就可以获取到自己的cookie了,有不懂的小伙伴可以看这篇文章学会Cookie,解决登录爬取的困扰!。然后我们来观察用户是如何搜索微博内容的。


平时我们都是在这个地方输入关键字,来进行搜索微博。



我通过在开发者模式下对这个页面观察发现,它每次对关键字发起请求后,就会返回一个XHR响应。



我们现在已经找到数据真实存在的页面了,那就可以进行爬虫的常规操作了。


02

数据采集


在上面我们已经找到了数据存储的真实网页,现在我们只需对该网页发起请求,然后提取数据即可。


01

 发起请求


通过对请求头进行观察,我们不难构造出请求代码。



代码如下:

key = input("请输入爬取关键字:")
for page in range(1,10):
params = (
('containerid', f'100103type=1&q={key}'),
('page_type', 'searchall'),
('page', str(page)),
)

response = requests.get('https://m.weibo.cn/api/container/getIndex', headers=headers, params=params)


02

 提取数据


从上面我们观察发现这个数据可以转化成字典来进行爬取,但是经过我实际测试发现,用正则来提取是最为简单方便的,所以这里展示的是正则提取的方式,有兴趣的读者可以尝试用字典方式来提取数据。代码如下:

r = response.text
title = re.findall('"page_title":"(.*?)"',r)
comments_count = re.findall('"comments_count":(.*?),',r)
attitudes_count = re.findall('"attitudes_count":(.*?),',r)
for i in range(len(title)):
print(eval(f"'{title[i]}'"),comments_count[i],attitudes_count[i])


在这里有一个小问题要注意,微博的标题是用Unicode编码的,如果直接爬取存储,将存储的是Unicode编码,在这里要感谢大佬—小明哥的帮助,志斌在网上搜了好多解决方法都没有成功,最后小明哥一个简单的函数就给解决了,实在是佩服!


解决方案:用eval()来输出标题,就可以将Unicode转换成汉字了。


03

小结


1. 本文详细介绍了如何用Python指定关键字爬取微博,有兴趣的读者可以尝试自己动手练习一下。

2. 本文仅供读者学习使用,不做其他用途!


如果你觉得文章还不错,请大家 点赞、分享、留言 下,因为这将是我持续输出更多优质文章的最强动力!


Python自学超级硬核资料


最后送大家一份Python学习大礼包,从Python基础,爬虫,数据分析Web开发等全套资料,吃透资料,你可以扔掉其他资料,这些资料都是视频,学起来非常友好 


Ps:都是视频学习资料,非常适合基础不好或者零基础的同学




推荐阅读

  1. 终于有人把Python进阶讲明白了

  2. 华为败诉,“鸿蒙”商标申请被驳回

  3. 学好C++,一个项目就够

  4. 全球最大的成人网站P站,碰到对手了...

  5. ResNet告诉我,我是不是世界上最美的人?

  6. 微信新功能上线,网友们都玩疯了


看完记得关注@Python绿色通道
及时收看更多好文
↓↓↓


点个在看你最好看

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/115267