我们先来解决一下前置知识,本爬虫会用到以下库
爬取淘宝商品的信息,数据主要用于分析市场趋势,从而制定一系列营销方案。实现功能如下:
功能实现依次体现了爬虫的开发流程:爬虫规则->数据清洗->数据存储。
使用谷歌浏览器进入淘宝网站,利用搜索的功能输入‘四件套’关键字,
使用浏览器的调试功能捕捉信息,如果在响应的HTML中找不到数据,
那么可能数据是通过Ajax请求后台的,再通过前端渲染到页面上去的,
单击XHR,发送一个请求,查看数据请求信息如下图所示
接下来,我们单击Preview查看该URL的响应数据格式,
发现数据是JSON格式的,商品的标题,价格,销量,店铺名称和店铺所在地点
分别对应的数据为raw_title,view_price,view_sales,nick,item_loc
我们把它的请求链接拿出来研究一下
https://s.taobao.com/api?_ksTS=1540176287763_226&callback=jsonp227&