栏目分类:
子分类:
返回
名师互学网用户登录
快速导航关闭
当前搜索
当前分类
子分类
实用工具
热门搜索
名师互学网 > IT > 软件开发 > 后端开发 > Python

面对python反爬虫如何进行ip切换?

Python 更新时间: 发布时间: IT归档 最新发布 模块sitemap 名妆网 法律咨询 聚返吧 英语巴士网 伯小乐 网商动力

面对python反爬虫如何进行ip切换?

在面对网页的阻拦后,如果我们想继续收集一些数据的话,比较常见的办法是改变我们请求访问的地址,这就涉及到了地址的切换。对于刚入门的python新手来说,如何切换ip有一定的难度,毕竟很多人都没有学习中都没有尝试过。所以小编整理了有关面对python反爬虫的切换方法,具体内容在接下来的内容中进行展示,想要学习的小伙伴可以跟着一起看看。


调试开多少个线程,多长时间拨号切换IP一次最优。每个网站对短时间内访问次数的屏蔽策略不一样,这需要实际测试,找出抓取效率最大化的时间点。先开一个线程,一直抓取到IP被屏蔽,记录下抓取耗时,总抓取次数,和成功抓取次数。 再开2个线程,重复上面步骤,记录抓取耗时,总的和成功的抓取次数。再开4个线程,重复上面步骤。整理成一个表格如下,下图是我抓天眼查时,统计抓取极限和细节调优的表格

 

从上图比较可以看出,当有6个线程时,是比较好的情况。耗时6秒,成功抓取80-110次。

开多少个线程调试出来了,那多久拨号一次呢?

从上面的图片看到,貌似每隔6秒拨号是一个不错的选择。可以这样做,但是我选了另一个度量单位,就是每总抓取120次就重新拨号。为什么这样选呢?从上图也能看到,基本抓到120次左右就会被屏蔽,每隔6秒拨号其实误差比较大,因为网络延迟等各种问题,导致6秒内可能抓100次,也可能抓120次。

相信看完这篇文章,小伙伴们已经对于ip的切换有了初步的认识,有点不太会的小伙伴一定要亲手尝试,这样才知道哪个环节没弄清楚。更多Python学习指路:PyThon学习网教学中心。

转载请注明:文章转载自 www.mshxw.com
本文地址:https://www.mshxw.com/it/11737.html
我们一直用心在做
关于我们 文章归档 网站地图 联系我们

版权所有 (c)2021-2022 MSHXW.COM

ICP备案号:晋ICP备2021003244-6号