Python网络爬虫专业级框架_scrapy

首先感慨下当今的互联网,08年刚来北京工作的时候什么也没有、出去面试全凭一张纸质的北京地图跟一张嘴、学习还停留在看书的阶段(天天上下班的公交车上看书看到睡着,哈哈)。
通过这段时间的学习,初步掌握了如下的几个技术点:Request库(自动抓取html页面)、网络爬虫标准(robots)、Beautiful Soup库(解析html页面)、Re(python自带的正则表达式库)、Scrapy(专业爬虫框架)。
Python网络爬虫专业级框架_scrapy_第1张图片

scrapy介绍:

Scrapy,Python开发的一个快速,高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据。Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试。
Scrapy吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类,如BaseSpider、sitemap爬虫等,最新版本又提供了web2.0爬虫的支持。
Python网络爬虫专业级框架_scrapy_第2张图片
Python网络爬虫专业级框架_scrapy_第3张图片
Python网络爬虫专业级框架_scrapy_第4张图片
Python网络爬虫专业级框架_scrapy_第5张图片
Python网络爬虫专业级框架_scrapy_第6张图片
Python网络爬虫专业级框架_scrapy_第7张图片
Python网络爬虫专业级框架_scrapy_第8张图片
Python网络爬虫专业级框架_scrapy_第9张图片

scrapy框架的安装:

Python网络爬虫专业级框架_scrapy_第10张图片
这里写图片描述

Scrapy初步使用记录:

创建一个Scrapy爬虫工程:

Python网络爬虫专业级框架_scrapy_第11张图片

在工程中产生一个Scrapy爬虫:

Python网络爬虫专业级框架_scrapy_第12张图片

配置产生的spider爬虫:

修改上一步产生的demo.py内的代码。

运行爬虫获取网页:

第一次运行失败,错误如下截图:
这里写图片描述
接下来处理掉这个错误:下载pywin32:
Python网络爬虫专业级框架_scrapy_第13张图片
Python网络爬虫专业级框架_scrapy_第14张图片
下载完双击安装即可,安装过程中它会自动跟我们本机的python安装程序对应起来。
再次运行,成功抓取了互联网网页内容:
Python网络爬虫专业级框架_scrapy_第15张图片

Scrapy使用步骤总结:

第一步:创建工程;
第二步:编写Spider;
第二步:编写Item Pipeline;
第四步:优化配置策略;
由衷的感谢MOOC平台下的嵩天老师,分享了很多全面又实用的课程,大家可以参加试试:Python网络爬虫与信息提取课程。

你可能感兴趣的:(python,网络爬虫,Python,把python带回家)