栏目分类:
子分类:
返回
名师互学网用户登录
快速导航关闭
当前搜索
当前分类
子分类
实用工具
热门搜索
名师互学网 > IT > 软件开发 > 后端开发 > Python

Python爬虫实现验证码登录代码实例

Python 更新时间: 发布时间: IT归档 最新发布 模块sitemap 名妆网 法律咨询 聚返吧 英语巴士网 伯小乐 网商动力

Python爬虫实现验证码登录代码实例

很多网站为了避免被恶意访问,需要设置验证码登录,避免非人类的访问,Python爬虫实现验证码登录的原理则是先到登录页面将生成的验证码保存下来,然后人为输入后,包装后再POST给服务器,实现验证,这里还涉及到了cookie,其实cookie保存在本地主机上,避免用户重复输入用户名和密码,在连接服务器的时候将访问连接和cookie组装起来POST给服务器。

这里涉及到了两次向服务器POST,一次是cookie,这里还自行设计想要cookie的内容,由于是要登录,cookie中存放的则是用户名和密码。第二次POST则是向服务器提交验证。

这里用到Python3,主要用到的包是re  urllib.request   http.cookiejar

上代码,借鉴了别人的代码~~~

import re
import urllib.request
import http.cookiejar
#from http.comkie import cookieJar 上面那句和这句等同
 
loginurl='https://www.douban.com/accounts/login'
cookie = http.cookiejar.cookieJar()
opener = urllib.request.build_opener(urllib.request.HTTPcookieProcessor)#在已存的cookie下建立连接
 
params={}
params['form_email']='用户名'
params['form_password']='密码'#这里写上已有的用户名和密码
params['source']='http://www.douban.com/accounts/login'
 
#从首页提交登陆
response = opener.open(loginurl,urllib.parse.urlencode(params).encode('utf-8'))#urllib.parse.urlencode(params).encode('utf-8')这个是向服务
#器POST的内容,可以打印一下response.geturl()请求的连接看一下
#print(response.geturl()[0:33])
#验证成功跳转至登陆页
if response.geturl()[0:33]=='https://accounts.douban.com/login':
    html = response.read().decode('utf-8')
    #print(html),可以先打印一下文件内容,为了看到网页元素更方便的写正则,可以复制下来,在需要获取的地方用(.+?)表示,然后用group()元组来取得,
    #验证图片地址
    imgurl=re.search('',html)
    if imgurl:
url=imgurl.group(1)
#print(url)
#将验证码以v.jpg保存在本地,在输入验证码的时候可以手工输入
res=urllib.request.urlretrieve(url,'v.jpg')
captcha = re.search('',html)
#print(captcha.group(1))
if captcha:
    vcode=input('请输入图片上的验证码:')
    params["captcha-solution"] = vcode
    params["captcha-id"] = captcha.group(1)#这个是动态生成的,需要从网页中获得
    params["user_login"] = "登录"
    #提交验证码验证
    response = opener.open(loginurl,urllib.parse.urlencode(params).encode('utf-8'))
    if response.geturl()=="https://www.douban.com/":
print("login sucess")

以上所述是小编给大家介绍的Python爬虫实现验证码登录详解整合,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对考高分网网站的支持!

转载请注明:文章转载自 www.mshxw.com
本文地址:https://www.mshxw.com/it/26476.html
我们一直用心在做
关于我们 文章归档 网站地图 联系我们

版权所有 (c)2021-2022 MSHXW.COM

ICP备案号:晋ICP备2021003244-6号