栏目分类:
子分类:
返回
名师互学网用户登录
快速导航关闭
当前搜索
当前分类
子分类
实用工具
热门搜索
名师互学网 > IT > 软件开发 > 后端开发 > Python

为了追求女神,我利用python下载了她看过的所有电影

Python 更新时间: 发布时间: IT归档 最新发布 模块sitemap 名妆网 法律咨询 聚返吧 英语巴士网 伯小乐 网商动力

为了追求女神,我利用python下载了她看过的所有电影

这些天工作室来了几位女生,想起在误杀中主人公曾说过“当你看过一千部以上的电影后,什么事情都不再离奇”,为了解他们我决定从此方面入手,通过电影来分析他们的性格。
首先,我通过一些手段找到了他的豆瓣账号(别问是怎么找到的。。。。。)

大致浏览一下发现她比较喜欢悬疑和恐怖类型的电影(共同话题有了),接下来我们通过python爬取这些电影名称,这里有观察到页面链接存在一个start的参数,有名字显然可知该参数用来控制页面,每个页面步长15.于是可写出如下代码

import requests
from lxml import etree
import re
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.96 Safari/537.36 Edg/88.0.705.50'
}
for i in range(0,210,15):
    god_url='https://movie.douban.com/peoplecollect?start=%d&sort=time&rating=all&filter=all&mode=grid'
    movie_list=requests.get(url=format(my_url%i),headers=headers).text
    movie_list_tree=etree.HTML(movie_list)
    movie_name_list=movie_list_tree.xpath('/collect?start=%d&sort=time&rating=all&filter=all&mode=grid'
    movie_list=requests.get(url=format(my_url%i),headers=headers).text
    movie_list_tree=etree.HTML(movie_list)
    movie_name_list=movie_list_tree.xpath('//*[@id="content"]/div[2]/div[1]/div[2]/div')
    for j in movie_name_list:
        movie_name=j.xpath('./div[2]/ul/li[1]/a/em/text()')[0]
        movie_name=movie_name.split(' ',1)[0] if(movie_name.find('/')) else movie_name
        print(movie_name)
        mange_index_url='https://www.jsr9.com/?s='+movie_name
        mange_html=requests.get(url=mange_index_url,headers=headers).text
        try:
            mange_list_tree=etree.HTML(mange_html)
            mange_second_url=mange_list_tree.xpath('/html/body/div[2]/div[1]/div[2]/div[1]/p[1]/a/@href')[0]
            print(mange_second_url)     
        except Exception as e:
            falid_movie_name.append(movie_name)
        mange_text=requests.get(url=mange_second_url,headers=headers).text
        mange_end_html=etree.HTML(mange_text)
        if len(mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div')) >1:
            for x in mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div'):
                movie_radio=x.xpath('./a/p/text()[1]')[0]
                if movie_radio.find('1080p'):
                    mange_url=x.xpath('./ul/li[2]/span/a/@href')[0]
                    movie_name_url=x.xpath('./ul/li[3]/span/text()')[0].split(' ',1)[0]
                    print(movie_radio)
                    print(mange_url)
                    break
        mange_url=mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div[1]/a/@href')[0] if(mange_url!='') else mange_url
        
        movie_name_url=mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div[1]/ul/li[3]/span/text()')[0].split(' ',1)[0] if(movie_name_url!='') else movie_name_url
        thunder.AddTask(mange_url, movie_name_url, r"H:电影")
        thunder.CommitTasks()
        time.sleep(5)
        pyautogui.click(x=846, y=867)
        print("任务已建立,开始下载:{}....".format(movie_name))
        time.sleep(3)
        

print('失败的电影有'+str(falid_movie_name))    


转载请注明:文章转载自 www.mshxw.com
本文地址:https://www.mshxw.com/it/293494.html
我们一直用心在做
关于我们 文章归档 网站地图 联系我们

版权所有 (c)2021-2022 MSHXW.COM

ICP备案号:晋ICP备2021003244-6号