java爬虫xpath_Xpath语法-网络爬虫基础

java爬虫xpath_Xpath语法-网络爬虫基础_第1张图片

前言

这一章节主要讲解Xpath的基础语法,学习如何通过Xpath获取网页中我们想要的内容;为我们的后面学习Java网络爬虫基础准备工作。

备注:此章节为基础核心章节,未来会在网络爬虫的数据解析环节经常使用,学会Xpath解析语法,可为未来爬虫解析省去很多麻烦。

Xpath简介

XPath即为XML路径语言,它是一种用来确定XML(标准通用标记语言的子集)文档中某部分位置的语言。XPath基于XML的树状结构,有不同类型的节点,包括元素节点,属性节点和文本节点,提供在数据结构树中找寻节点的能力。起初 XPath 的提出的初衷是将其作为一个通用的、介于XPointer与XSLT间的语法模型。但是 XPath 很快的被开发者采用来当作小型查询语言。

简单来说我们通过Xpath可以获取XML中的指定元素和指定节点的值。在网络爬虫中我们通过会把爬虫获取的HTML数据转换成XML结构,然后通过XPath解析,获取我们想要的结果。

接下来为大家分享以下xpath的表达式以及用法。

一.选取节点

Xpath使用路径表达式在XML文档中选取节点。节点是通过沿着路径来选取的,通过路径可以找到我们想要的节点或者节点范围。

java爬虫xpath_Xpath语法-网络爬虫基础_第2张图片

二.谓语(Predicates)

谓语用来查找某个特定的节点或者包含某个指定的值的节点。谓语被嵌在方括号中。

java爬虫xpath_Xpath语法-网络爬虫基础_第3张图片

三.通配符

XPath 通配符可用来选取未知的 XML 元素,通配指定节点。

java爬虫xpath_Xpath语法-网络爬虫基础_第4张图片

四.多路径选择

通过在路径表达式中使用“|”运算符,您可以选取若干个路径。

java爬虫xpath_Xpath语法-网络爬虫基础_第5张图片

五.XPath 轴

轴可定义相对于当前节点的节点集。

java爬虫xpath_Xpath语法-网络爬虫基础_第6张图片

六.XPath 运算符

java爬虫xpath_Xpath语法-网络爬虫基础_第7张图片

七.常用的功能函数

使用功能函数能够更好的进行模糊搜索

java爬虫xpath_Xpath语法-网络爬虫基础_第8张图片

总结

本文章向您介绍了为什么要学习Xpath、Xpath简介以及Xpath的基础语法;接下来您可以尝试通过编写代码来熟悉使用xpath表达式;同时我将会在下一章节(ID:DT数据技术博文)为大家介绍,如何通过Xpath表达式来解析我们的爬虫数据。

(ID:DT数据技术博文)

你可能感兴趣的:(java爬虫xpath)