栏目分类:
子分类:
返回
名师互学网用户登录
快速导航关闭
当前搜索
当前分类
子分类
实用工具
热门搜索
名师互学网 > 资讯 > 高等教育 > 院校资讯

网络爬虫百科

网络爬虫百科

作者:徐浩来源:人工智能学习圈

3.2.1目标

目的地地址:file/tupian/20220517/top250 start = 0

任务:爬上豆瓣书的TOP250和它的四个数据:书名、出版信息、评分、评价人数。

3.2.2分析URL

首先,打开目标地址来分析url

观察第一页的豆瓣书如下:

preview

豆瓣书籍第2页如下:

豆瓣书籍最后一页如下:

我们可以发现url的结构是如何变化的。每次翻页都会改变start参数的值,因此我们可以构造URL:

请求一个网页

我们看到其中有response.encoding = 'utf-8 '。这可以通过分析标签中的信息得到,也可以改成response . encoding = response . apparent _ encoding。

这意味着响应结果的html源代码的编码格式被设置为utf-8。否则,如果提取的数据中有中文,显示会出现乱码。

数据分析

将鼠标悬停在目标元素上,右键单击-check,我们看到第一本书所需的所有详细信息都在其中,

所以我们需要提取这个页面的所有标签:

infos = html.xpath

返回的是一个列表,列表的每个标签循环一遍,从中提取相应的数据。其实不需要提取数据的xpath路径,也不需要看路径是什么样子。可以复制,但是需要修改。

我们以书名提取为例,右键勾选书名,如下图,复制xpath路径。

粘贴代码://*[@ id = " content "]/p/p[1]/p/table[1]/tbody/tr/TD[2]/p[1]/a

我们观察已经提取的tr标签'//tr[@]',在look上找到tr,并将其作为断点。先前的删除更改为:

name = info.xpath')[0]

因为我们提取了一个包含我们需要的数据的大标签tr,再从中提取数据,所以我们删除了前面多余的标签,也删除了tr,因为是从中提取的。

另外,数据是相同的,所以代码可以写成:

提取后需要用replace去掉多余的字符,最后打印。

拿起这里完成数据的提取。

3.2.5摘要

完整的代码如下:

运行结果如下:

欢迎加入人工智能圈参与交流。

原文链接:file/tupian/20220517/p

转载请注明:文章转载自 www.mshxw.com
本文地址:https://www.mshxw.com/news/1637071.html
我们一直用心在做
关于我们 文章归档 网站地图 联系我们

版权所有 (c)2021-2022 MSHXW.COM

ICP备案号:晋ICP备2021003244-6号