使用scrapy爬取豆瓣top250并导出

Python 更新时间：2026-05-21 19:08:00 发布时间：1645天前 IT归档最新发布模块sitemap 名妆网法律咨询聚返吧英语巴士网伯小乐网商动力

import scrapy

class DoubanSpider(scrapy.Spider):
    name = 'douban'
    allowed_domains = ['douban.com']
    start_urls = [f'https://movie.douban.com/top250?start=0']
    def parse(self, response):
        title=response.xpath('//a/span[@][1]/text()').getall()
        start=response.xpath('//span[@]/text()').getall()
        #使用原生的Python写法 写入txt文档
        # with open('moive.txt','w',encoding='utf-8') as f:
        #     for t,s in zip(title,start):
        #         #print(f'{t}{s}')
        #         f.write(f'{t},{s}n')
        #
        #导出的另一种格式写法
# FEED_EXPORT_ENCODING = 'utf-8' 导出格式json使用
        for t,s in zip(title,start):
            yield {
                'title':t,
                'star':s
            }
#scrapy crawl douban -o wen.csv  保存csv格式的文件 也就是excel
#scrapy crawl douban -o wen.json 保存json格式的文件 
#scrapy crawl douban -o wen.txt  以文本方式保存
#打开设置
#打开pipelines 添加open close
# ITEM_PIPELINES = {
#    'scrapy01.pipelines.Scrapy01Pipeline': 300,
# }

转载请注明：文章转载自 www.mshxw.com

本文地址：https://www.mshxw.com/it/530119.html

上一篇 Python---生成器

下一篇分享如何免费采集网站数据方法经验

Python相关栏目本月热门文章

关于我们文章归档网站地图联系我们