python爬虫框架-scrapy简介

本博客内容来自于拓海的博客
1、框架简介
python爬虫框架-scrapy简介_第1张图片
组件
Engine: 引擎负责控制数据流在系统中所有组件中流动,并在相应动作发生时触发事件。
Scheduler: 调度器从引擎接受Request并将他们入队,以便之后引擎请求他们时提供给引擎。
Downloader: 下载器负责获取页面数据并提供给引擎,而后提供给Spider。
Spiders: Spider是Scrapy用户编写的用于分析Response并提取Item或提取更多需要下载的URL的类。 每个Spider负责处理特定网站。
Item Pipeline: 负责处理被Spider提取出来的Item。典型的功能有清洗、 验证及持久化操作。
Downloader middlewares: 下载器中间件是在Engine及Downloader之间的特定钩子(specific hooks),处理Downloader传递给Engine的Response。 其提供了一个简便的机制,通过插入自定义代码来扩展Scrapy功能。
Spider middlewares: 是在Engine及Spider之间的特定钩子(specific hook),处理Spider的输入(Response)和输出(Items及Requests)。 其提供了一个简便的机制,通过插入自定义代码来扩展Scrapy功能。

数据流
Scrapy中的数据流由执行引擎控制,其过程如下:
Engine从Spider获取第一个需要爬取URL(s)。
Engine用Scheduler调度Requests,并向Scheduler请求下一个要爬取的URL。
Scheduler返回下一个要爬取的URL给Engine。
Engine将URL通过Downloader middlewares转发给Downloader。
一旦页面下载完毕,下载器生成一个该页面的Response,并将其通过Downloader middlewares发送给Engine。
引擎从Downloader中接收到Response并通过Spider middlewares发送给Spider处理。
Spider处理Response并返回爬取到的Item及新的Request给Engine。
Engine将爬取到的Item给Item Pipeline,然后将Request给Scheduler。
从第一步开始重复这个流程,直到Scheduler中没有更多的URLs。

你可能感兴趣的:(python)