这些天工作室来了几位女生,想起在误杀中主人公曾说过“当你看过一千部以上的电影后,什么事情都不再离奇”,为了解他们我决定从此方面入手,通过电影来分析他们的性格。
首先,我通过一些手段找到了他的豆瓣账号(别问是怎么找到的。。。。。)
大致浏览一下发现她比较喜欢悬疑和恐怖类型的电影(共同话题有了),接下来我们通过python爬取这些电影名称,这里有观察到页面链接存在一个start的参数,有名字显然可知该参数用来控制页面,每个页面步长15.于是可写出如下代码
import requests
from lxml import etree
import re
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.96 Safari/537.36 Edg/88.0.705.50'
}
for i in range(0,210,15):
god_url='https://movie.douban.com/peoplecollect?start=%d&sort=time&rating=all&filter=all&mode=grid'
movie_list=requests.get(url=format(my_url%i),headers=headers).text
movie_list_tree=etree.HTML(movie_list)
movie_name_list=movie_list_tree.xpath('/collect?start=%d&sort=time&rating=all&filter=all&mode=grid'
movie_list=requests.get(url=format(my_url%i),headers=headers).text
movie_list_tree=etree.HTML(movie_list)
movie_name_list=movie_list_tree.xpath('//*[@id="content"]/div[2]/div[1]/div[2]/div')
for j in movie_name_list:
movie_name=j.xpath('./div[2]/ul/li[1]/a/em/text()')[0]
movie_name=movie_name.split(' ',1)[0] if(movie_name.find('/')) else movie_name
print(movie_name)
mange_index_url='https://www.jsr9.com/?s='+movie_name
mange_html=requests.get(url=mange_index_url,headers=headers).text
try:
mange_list_tree=etree.HTML(mange_html)
mange_second_url=mange_list_tree.xpath('/html/body/div[2]/div[1]/div[2]/div[1]/p[1]/a/@href')[0]
print(mange_second_url)
except Exception as e:
falid_movie_name.append(movie_name)
mange_text=requests.get(url=mange_second_url,headers=headers).text
mange_end_html=etree.HTML(mange_text)
if len(mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div')) >1:
for x in mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div'):
movie_radio=x.xpath('./a/p/text()[1]')[0]
if movie_radio.find('1080p'):
mange_url=x.xpath('./ul/li[2]/span/a/@href')[0]
movie_name_url=x.xpath('./ul/li[3]/span/text()')[0].split(' ',1)[0]
print(movie_radio)
print(mange_url)
break
mange_url=mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div[1]/a/@href')[0] if(mange_url!='') else mange_url
movie_name_url=mange_end_html.xpath('/html/body/div[2]/div[1]/div[2]/div[3]/div[1]/ul/li[3]/span/text()')[0].split(' ',1)[0] if(movie_name_url!='') else movie_name_url
thunder.AddTask(mange_url, movie_name_url, r"H:电影")
thunder.CommitTasks()
time.sleep(5)
pyautogui.click(x=846, y=867)
print("任务已建立,开始下载:{}....".format(movie_name))
time.sleep(3)
print('失败的电影有'+str(falid_movie_name))



