爬取淘宝商品信息

我们先来解决一下前置知识,本爬虫会用到以下库

  1. requests 是一个很实用Python的一个很实用的HTTP客户端,可以满足如今爬虫的需要
  2. json 用于数据的处理
  3. csv 用于数据的储存

分析说明

爬取淘宝商品的信息,数据主要用于分析市场趋势,从而制定一系列营销方案。实现功能如下:

  1. 使用者提供关键字,利用淘宝搜索功能获取搜索后的数据
  2. 获取商品信息:标题,价格,销量,店铺所在区域
  3. 数据以文件格式存储

功能实现依次体现了爬虫的开发流程:爬虫规则->数据清洗->数据存储。

使用谷歌浏览器进入淘宝网站,利用搜索的功能输入‘四件套’关键字,
使用浏览器的调试功能捕捉信息,如果在响应的HTML中找不到数据,
那么可能数据是通过Ajax请求后台的,再通过前端渲染到页面上去的,
单击XHR,发送一个请求,查看数据请求信息如下图所示

爬取淘宝商品信息_第1张图片

接下来,我们单击Preview查看该URL的响应数据格式,
发现数据是JSON格式的,商品的标题,价格,销量,店铺名称和店铺所在地点
分别对应的数据为raw_title,view_price,view_sales,nick,item_loc

爬取淘宝商品信息_第2张图片

我们把它的请求链接拿出来研究一下

https://s.taobao.com/api?_ksTS=1540176287763_226&callback=jsonp227&

你可能感兴趣的:(Python)