java爬取闲鱼商品信息(三)

这一篇距离前两篇更新的时间有点久了,最近忙着刷题- -。

好了,上次说到没办法获取到动态加载的部分。

我用了phantomjs尝试了一下,多获取到的部分是复杂的js代码,代码量太大了,没找到我们需要的信息。

也可能是我使用的方式不对,要是有可以获得的方法欢迎大家在评论介绍一下,我去试试看。

好了,最后我还是弄到了动态加载的数据,当然不是用的phantomjs。

既然找不到数据,那为什么不问问神奇的fiddler呢。

我们打开fiddler,然后访问闲鱼闲置广场的3C数码。

再看看突然多出来的数据包。

java爬取闲鱼商品信息(三)_第1张图片

看。我们发现了什么,没错,翻下去我们发现了很多在闲鱼倒卖小米MIX2S的老黄牛。。。。。

更重要的是,发现了需要动态加载出来的数据。。当然这是json格式的数据,被我们拦截下来了。。

然后看看这些个数据的网址。

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

然后用浏览器打开。

java爬取闲鱼商品信息(三)_第2张图片

可以看到,是json格式的数据,那这个网址又和我们要的数据有什么关系呢?

https://s.2.taobao.com/list/waterfall/waterfall.htm?wp=3&_ksTS=1523262257881_271&callback=jsonp272&stype=1&catid=57544002&oon=10&st_trust=1&ist=1

再次仔细看一下,这两个参数是我们需要的,catid可以控制商品类型(结合第一篇),而ist则是第几页的动态数据。

接下来的事情就水到渠成了,下载这个页面,正则提取,然后和上一篇的处理方法封装在一起,就变成了一个获取完整的网页的方法。

接下篇,下篇刷阵题更新,不过剩下的都是简单的事情了。

欢迎大家探讨获取网页的其他方法,我这个效率好像还可以但是有些取巧,也没有普适性。

你可能感兴趣的:(爬虫,java爬虫,闲鱼爬虫,网络爬虫)