Scrapy 爬虫框架四 —— 动态网页及其 Splash 渲染

一、前言

动态页面:HTML文档中的部分是由客户端运行JS脚本生成的,即服务器生成部分HTML文档内容,其余的再由客户端生成

静态页面:整个HTML文档是在服务器端生成的,即服务器生成好了,再发送给我们客户端

二、问题分析

scrapy爬虫框架没有提供页面 js 渲染服务,所以我们获取不到信息,所以我们需要一个渲染引擎来为我们提供渲染服务---这就是Splash渲染引擎(大侠出场了)

1、Splash渲染引擎简介

Splash是为Scrapy爬虫框架提供渲染javascript代码的引擎,它有如下功能:

(1)为用户返回渲染好的html页面                              (2)并发渲染多个页面

(3)关闭图片加载,加速渲染                                      (4)执行用户自定义的js代码

(5)执行用户自定义的lua脚步,类似于无界面浏览器phantomjs

2、Splash渲染引擎工作原理:(类比例子如下)

假定有三个小伙伴:(1--懒惰的我 , 2 --提供外卖服务的小哥,3---本人喜欢吃的家味道餐饮点)

今天正好天气不好,1呆在宿舍睡了一早上起来,发现肚子饿了,它就想

你可能感兴趣的:(#,网络爬虫技术锦集,爬虫,python,scrapy,splash)