从零开始写Python爬虫 --- 导言

从零开始写Python爬虫 --- 导言



我是一名努力想做 coder 的小伙,目前自学Python有大半年了,期间也写过一些小的爬虫。说起来当时想成为程序员就是因为无意间了解到 爬虫 这个神奇的东西。这里会记录自己 重新梳理 学习Python爬虫的路线。也希望能成为一篇不错的入门爬虫教程,总之,希望自己能坚持把这个系列专栏写完。

学习之前需要哪些准备?

  1. 一颗热爱学习,不屈不挠的心
  2. 一台有键盘的电脑(什么系统都行。我用的os x,所以例子会以这个为准)
  3. html相关的一些前段知识。不需要精通,能懂一点就够!
  4. Python的基础语法知识 。

如果我一点编程基础都没有怎么办?

现在开始学!Python是一门非常适合做入门学习的语言。如果你没有任何其他编程语言的基础,那么就来学Python吧。

我自己目前同时在学java和Python,就我自己的感觉来说,Python的语法简直太美妙了 不是有句话叫 Life is short, Use Python

有什么推荐的入门教材么?

  • 笨办法学Python>我看的这本书入门的,非常有趣,网上有翻译的版本,当然有条件的同学还是去看英文原著会更好。
  • 廖大的Python3教程
  • 自强学堂的教程
  • 菜鸟学习资
  • html入门学习
  • 看看知乎大V们是如何回答这个问题的?

具体的学习路线是什么?

总体分为三个大方面:

一: 简单的定向脚本爬虫(request --- bs4 --- re)

二: 大型框架式爬虫(Scrapy框架为主)

三:浏览器模拟爬虫 (Mechanize模拟 和 Selenium 模拟)

具体的步骤:

一:Beautiful Soup 爬虫

  • requests库的安装与使用
  • 安装beautiful soup 爬虫环境
  • beautiful soup 的解析器
  • bs4 爬虫实践: 获取百度贴吧的内容
  • bs4 爬虫实践: 获取双色球中奖信息
  • bs4 爬虫实践: 获取起点小说信息
  • bs4 爬虫实践: 获取电影信息
  • bs4 爬虫实践: 获取悦音台榜单

二: Scrapy 爬虫框架

  • 安装Scrapy
  • Scrapy中的选择器 Xpath和CSS
  • Scrapy 爬虫实践:今日影视
  • Scrapy 爬虫实践:天气预报
  • Scrapy 爬虫实践:获取代理
  • Scrapy 爬虫实践:糗事百科
  • Scrapy 爬虫实践: 爬虫相关攻防(代理池相关)

三: 浏览器模拟爬虫

  • Mechanize模块的安装与使用
  • 利用Mechanize获取乐音台公告
  • Selenium模块的安装与使用
  • 浏览器的选择 PhantomJS
  • Selenium & PhantomJS 实践: 获取代理
  • Selenium & PhantomJS 实践: 漫画爬虫

每天的学习记录都会 同步更新到: 微信公众号: findyourownway 知乎专栏:https://zhuanlan.zhihu.com/Ehco-python blog : www.ehcoblog.ml

你可能感兴趣的:(python,爬虫,教程)