常用Python爬虫库汇总

Python爬虫,全称Python网络爬虫,是一种按照一定的规则,自动地抓取万维网信息的程序或脚本,主要用于抓取证券交易数据、天气数据、网站用户数据和图片数据等,Python为支持网络爬虫正常功能实现,内置了大量的库,主要有以下类型:

一、Python爬虫网络库

Python爬虫网络库主要包括:urllib、requests、grab、pycurl、urllib3、httplib2、RoboBrowser 、MechanicalSoup、mechanize、socket、Unirest for Python、hyper、PySocks、treq以及aiohttp等。

二、Python网络爬虫框架

Python网络爬虫框架主要包括:grab、scrapy、pyspider、cola、portia、restkit以及demiurge等。

三、HTML/XML解析器

lxml:C语言编写高效HTML/ XML处理库,支持XPath;

cssselect:解析DOM树和CSS选择器;

pyquery:解析DOM树和jQuery选择器;

BeautifulSoup:低效HTML/ XML处理

你可能感兴趣的:(python培训,Python爬虫库)