Python爬虫实战之爬取携程评论

文章目录[隐藏]

目录
一、分析数据源
二、分析数据包
三、采集全部评论

一、分析数据源

这里的数据源是指html网页？还是Aajx异步。对于爬虫初学者来说，可能不知道怎么判断，这里辰哥也手把手过一遍。

提示：以下操作均不需要登录（当然登录也可以）

咱们先在浏览器里面搜索携程，然后在携程里面任意搜索一个景点：长隆野生动物世界，这里就以长隆野生动物世界为例，讲解如何去爬取携程评论数据。

页面下方则是评论数据

从上面两张图可以看出，点击评论下一页，浏览器的链接没有变化，说明数据是Ajax异步请求。因此我们就找到了数据是异步加载过来的，这时候需要去network里面是查看数据包。

二、分析数据包

在network中找到下面这个数据包

查看Preview里面的内容（请求返回内容）

可以看到数据已经请求到了，下面看一下数据是否是正确的（和网页内容一致）。

ok，没问题之后，下面开始编写Python程序去请求数据。

1.请求地址

可以获取到请求链接和请求方式。

这里请求不用添加请求头header也是可以的。其中postUrl是请求链接，data_1是请求参数。

2.请求参数

在network里可以看到请求参数

在程序中的构建如下：

其中需要关注的是arg中的pageIndex（页数），pageSize（每页条数）。

最终结果如下：

该景点的评论就可以成功爬取下来了。

三、采集全部评论

上面只是采集了第一页的评论数据，通过改变arg中的pageIndex（页数），就可以遍历爬取全部的评论。

比如这个景点一共是300页。现在把循环给加上

最终的完整代码如下：

到此这篇关于Python爬虫实战之爬取携程评论的文章就介绍到这了,更多相关Python爬取携程评论内容请搜索华域联盟以前的文章或继续浏览下面的相关文章希望大家以后多多支持华域联盟！

您可能感兴趣的文章:

本文由华域联盟原创撰写：华域联盟 » Python爬虫实战之爬取携程评论

转载请保留出处和原文链接：https://www.cnhackhy.com/26539.htm

Python爬虫实战之爬取携程评论

目录

一、分析数据源

二、分析数据包

三、采集全部评论

相关文章

作者: sterben

发表回复取消回复

wordpress内链优化插件WP Keyword Link

.Net的GC垃圾回收原理及实现

.Net Core导入千万级数据至Mysql数据库的实现方法

IIS部署ASP.NET5的实现步骤

重磅！博彦科技正式发布鸿蒙HarmonyOS移动金融技术平台

重磅！博彦科技正式发布鸿蒙HarmonyOS移动金融技术平台

HarmonyOS 4.2正式版华丽登场！22款设备今日即享

鸿蒙生态使能- HarmonyOS官网

禁止摇一摇广告跳转升级HarmonyOS 4.2用户操作更放心

HarmonyOS 4.2亮点特性已官宣多款设备升级整装待发！

联系我们

微信扫一扫关注我们

目录

一、分析数据源

二、分析数据包

三、采集全部评论

相关文章

作者: sterben

PyTorch 编写代码遇到的问题及解决方案

关于Numpy之repeat、tile的用法总结

相关推荐

发表回复 取消回复

联系我们

微信扫一扫关注我们

发表回复取消回复