爬虫之非结构化数据与结构化数据提取

页面解析和数据提取

  • 一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。
    • 非结构化数据:先有数据,再有结构,
    • 结构化数据:先有结构、再有数据
    • 不同类型的数据,我们需要采用不同的方式来处理。

非结构化的数据处理

  • 文本、电话号码、邮箱地址

    • 正则表达式
    • HTML 文件
  • 正则表达式

    • XPath
    • CSS选择器

结构化的数据处理

  • JSON 文件

    • JSON Path
    • 转化成Python类型进行操作(json类)
    • XML 文件
  • 转化成Python类型(xmltodict)

    • XPath
    • CSS选择器
    • 正则表达式

你可能感兴趣的:(爬虫之非结构化数据与结构化数据提取)