使用JSOUP处理HTML文档

一、 JSOUP简介

在以往用java来处理解析HTML文档或者片段时，我们通常会采用htmlparser（http://htmlparser.sourceforge.net/）这个开源类库。现在我们有了JSOUP，以后的处理HTML的内容只需要使用JSOUP就已经足够了，JSOUP有更快的更新，更方便的API等。

jsoup 是一款 Java 的HTML 解析器，可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于jQuery的操作方法来取出和操作数据，可以看作是java版的jQuery。

jsoup的主要功能如下：

从一个URL，文件或字符串中解析HTML；
使用DOM或CSS选择器来查找、取出数据；
可操作HTML元素、属性、文本；

jsoup是基于MIT协议发布的，可放心使用于商业项目。官方网站：http://jsoup.org/

二、解析遍历HTML文档

Jsoup处理HTML文件是，是将用户输入的HTML文档，解析转换成一个Document对象进行处理。Jsoup一般支持以下几种来源内容的转换。

解析一个html字符串
解析一个body片段
根据一个url地址加载Document对象
根据一个文件加载Document对象

(一)解析一个html字符串

在处理一个html字符串。我们可能需要对其进行解析，并提取其内容，或校验其格式是否完整，或者想修改它。Jsoup可以帮助我们轻松的解决这些问题。

在Jsoup中有一个这样的静态方法Jsoup.parse(String html)，可以将我们的html片段转换成Document对象。示例如下：

 
        String html = 
        "<div><p align=\"center\"><img alt=\"\" width=\"660\" height=\"852\" src=\"/erp/UserFiles/Image/51.jpg\" />这是P元素的内容</p>"
        ;
       
        Document document = Jsoup.parse(html);

使用上面的方法，就可以将html字符串，转换成Document对象，一旦有了Document对象，我们就可以使用其中适当的方法根据需求处理问题。我们可以看到这里转换的html片段并不是一个合法的html片段，里面的div标签没有闭合。这对于Jsoup来说不是问题，它可以很好的处理这类问题。

(二) 解析body片段

假如我们现在有一个HTML片断 (比如. 一个 div 包含一对 p 标签; 一个不完整的HTML文档) 想对它进行解析。这个HTML片断可以是用户提交的一条评论或在一个CMS页面中编辑body部分。我们可以使用使用Jsoup.parseBodyFragment(String html)方法。

示例如下：

 
        String html = 
        "<div><p align=\"center\"><img alt=\"\" width=\"660\" height=\"852\" src=\"/erp/UserFiles/Image/51.jpg\" />这是P元素的内容</p>"
        ;
       
        Document document = Jsoup.parseBodyFragment(html);

看到这里可能会有疑问，这个和上面的html片段是一样的嘛。没错是一样的，parseBodyFragment 方法创建一个空壳的文档，并插入解析过的HTML到body元素中。假如使用正常的 Jsoup.parse(String html) 方法，通常也可以得到相同的结果，但是明确将用户输入作为 body片段处理，以确保用户所提供的任何糟糕的HTML都将被解析成body元素。

Document.body() 方法能够取得文档body元素的所有子元素，与doc.getElementsByTag("body")相同。

(三) 根据一个URL地址加载Document对象

有时候我们可能希望通过一个url地址，然后提取里面的内容，转换成document对象。我们以前可能是使用http client等模拟一个请求，然后取得返回内容等，使用Jsoup方便简单的解决这个问题。示例如下：

        Document document = Jsoup.connect(
        "http://www.baidu.com"
        ).get();
       
        String title = document.title();
       
        String text = document.text();

connect(String url) 方法创建一个新的 Connection, 和 get() 取得和解析一个HTML文件。如果从该URL获取HTML时发生错误，便会抛出 IOException，应适当处理。

Connection 接口还提供一个方法链来解决特殊请求，具体如下：

1	`Document doc = Jsoup.connect(` `"http://test.com"` `).data(` `"query"` `,` `"Java"` `).userAgent(` `"Mozilla"` `).cookie(` `"auth"` `,` `"token"` `).timeout(` `3000` `).post();`

可以向链接地址post参数，设置userAgent，cookie，timeout等，而且这里是采用的链接操作很方便（熟悉jQuery的应该很熟悉这样的链接操作）。

(四)根据文件加载document

有时候我们要处理的html内容，可能是存在硬盘上的某个文件里面，我们需要从中提取或者解析某些内容出来，我们可以通过Jsoup来这样处理。示例代码如下：

1 2	`File input =` `new` `File(` `"d:/input.html"` `);` `Document doc = Jsoup.parse(input,` `"UTF-8"` `,` `"http://test.com/"` `);`

看到这里可能有一个疑问，第一个参数是文件，第二是编码，第三个是什么呢?第三个参数是baseUrl，使用他我们可以方便的处理相对路径问题，如果不需要可以不传，这是一个多态方法，在前面的三个部分里面，都可以再加一个这样的baseUrl，后面会详细讲述。

三、数据抽取

(一) 使用Dom方法遍历文档

通过第二章我们可以获取一个document的对象，我们可以通过这个对象来遍历文档，如：

        Document doc = Jsoup.parse(input, 
        "UTF-8"
        , 
        "http://test.com/"
        );
       
        Element content = doc.getElementById(
        "content"
        );
       
        Elements links = content.getElementsByTag(
        "a"
        );
       
        for
        (Element link : links) {
       
        String linkHref = link.attr(
        "href"
        );
       
        String linkText = link.text();
       
        }

这里我们可以方便的使用Doument对象的方法来获取内容。常用方法如下：

查找元素

getElementById(String id)
getElementsByTag(String tag)
getElementsByClass(String className)
getElementsByAttribute(String key) (and related methods)
Element siblings: siblingElements(), firstElementSibling(), lastElementSibling();nextElementSibling(), previousElementSibling()
Graph: parent(), children(), child(int index)

元素数据

attr(String key)获取属性attr(String key, String value)设置属性
attributes()获取所有属性
id(), className() and classNames()
text()获取文本内容text(String value) 设置文本内容
html()获取元素内HTMLhtml(String value)设置元素内的HTML内容
outerHtml()获取元素外HTML内容
data()获取数据内容（例如：script和style标签)
tag() and tagName()

操作HTML和文本

(二) 使用选择器来查找元素

使用jQuery时，我们无不为其强大的选择器叹服，jsoup有同样的强大的选择器，可以方便我们的对文档进行处理。示例代码如下：

 
        Elements links = doc.select(
        "a[href]"
        ); 
        //带有<span style="text-decoration: underline;">href</span>属性的a元素
       
        Elements pngs = doc.select(
        "img[src$=.png]"
        );
       
        //扩展名为.<span style="text-decoration: underline;">png</span>的图片
       
        Element masthead = doc.select(
        "div.masthead"
        ).first();
       
        //class等于<span style="text-decoration: underline;">masthead</span>的<span style="text-decoration: underline;">div</span>标签
       
        Elements resultLinks = doc.select(
        "h3.r > a"
        ); 
        //在h3元素之后的a元素

jsoup elements对象支持类似于CSS (或jquery)的选择器语法，来实现非常强大和灵活的查找功能。.

这个select 方法在Document, Element,或Elements对象中都可以使用。且是上下文相关的，因此可实现指定元素的过滤，或者链式选择访问。

Select方法将返回一个Elements集合，并提供一组方法来抽取和处理结果。

(三) 从元素中抽取属性和文档

使用Jsoup抽取属性，一般方法如下：

要取得一个属性的值，可以使用Node.attr(String key) 方法
对于一个元素中的文本，可以使用Element.text()方法
对于要取得元素或属性中的HTML内容，可以使用Element.html(), 或 Node.outerHtml()方法

示例如下：

        String html = 
        "<p>An <a href='http://example.com/'><b>example</b></a> link.</p>"
        ;
       
        Document doc = Jsoup.parse(html);
        //解析HTML字符串返回一个Document实现
       
        Element link = doc.select(
        "a"
        ).first();
        //查找第一个a元素</pre>
       
        String text = doc.body().text(); 
        // "An example link"//取得字符串中的文本
       
        String linkHref = link.attr(
        "href"
        ); 
        // "http://example.com/"//取得链接地址
       
        String linkText = link.text(); 
        // "example""//取得链接地址中的文本</pre>
       
        String linkOuterH = link.outerHtml();
       
        // "<a href="http://example.com"><b>example</b></a>"
       
        String linkInnerH = link.html(); 
        // "<b>example</b>"//取得链接内的html内容

(四) URL处理

我们在处理HTML内容时，可能经常会遇到这种问题，需要将html页面里面的链接地址从相对地址转换成绝对地址，jsoup有一个方法用来解决此问题。我们前面对到的baseurl，就是用来解决此问题的。示例代码如下：

        Document doc = Jsoup.connect(
        "http://www.baidu.com/"
        ).get();
       

        Element link = doc.select(
        "a"
        ).first();
       

        String relHref = link.attr(
        "href"
        ); 
        // == "/"
       

        String absHref = link.attr(
        "abs:href"
        );
       

        // "http://www.baidu.com/gaoji/preferences.html"
       

在HTML元素中，URLs经常写成相对于文档位置的相对路径： <a href="/download">...</a>. 当你使用 Node.attr(String key) 方法来取得a元素的href属性时，它将直接返回在HTML源码中指定定的值。

假如你需要取得一个绝对路径，需要在属性名前加 abs: 前缀。这样就可以返回包含根路径的URL地址attr("abs:href")

因此，在解析HTML文档时，定义base URI非常重要。如果你不想使用abs: 前缀，还有一个方法能够实现同样的功能 Node.absUrl(String key)。

四、数据修改

(一) 设置属性值

在处理html时，我们有时候可能需要修改里面的属性值，如图片地址、class名称等各种属性。

可以使用属性设置方法 Element.attr(String key, String value), 和 Elements.attr(String key, String value).

假如你需要修改一个元素的 class 属性，可以使用 Element.addClass(String className) 和Element.removeClass(String className) 方法。

Elements 提供了批量操作元素属性和class的方法，比如：要为div中的每一个a元素都添加一个rel="nofollow"
可以使用如下方法：

 
        doc.select(
        "div.comments a"
        ).attr(
        "rel"
        , 
        "nofollow"
        );

这里的jsoup方法同样支持链接操作，如下：

 
        doc.select(
        "div.masthead"
        ).attr(
        "title"
        , 
        "jsoup"
        ).addClass(
        "round-box"
        );

(二) 设置元素的html内容

我们需要向html里面添加html片段等内容时可以如下操作：

        Element div = doc.select(
        "div"
        ).first(); 
        // <div></div>
       

        div.html(
        "<p>lorem ipsum</p>"
        ); 
        // <div><p>lorem ipsum</p></div>
       

        div.prepend(
        "<p>First</p>"
        );
        //在div前添加html内容
       

        div.append(
        "<p>Last</p>"
        );
        //在div之后添加html内容
       

        // 添完后的结果: <div><p>First</p><p>lorem ipsum</p><p>Last</p></div>
       

        Element span = doc.select(
        "span"
        ).first(); 
        // <span>One</span>
       

        span.wrap(
        "<li><a href='http://example.com/'></a></li>"
        );
       

        //对元素包裹一个外部HTML内容添完后的结果:
       

        //<li><a href="http://example.com"><span>One</span></a></li>
       

(三) 设置元素的文本内容

如果我们需要修改元素内的文本内容，可以如下操作：

 
        Element div = doc.select(
        "div"
        ).first(); 
        // <div></div>
       
        div.text(
        "five > four"
        ); 
        // <div>five &gt; four</div>
       
        div.prepend(
        "First "
        );
       
        div.append(
        " Last"
        );
       
        // now: <div>First five &gt; four Last</div>

说明

文本设置方法与 HTML setter 方法一样：

Element.text(String text) 将清除一个元素中的内部HTML内容，然后提供的文本进行代替

Element.prepend(String first) 和 Element.append(String last) 将分别在元素的内部html前后添加文本节点。

对于传入的文本如果含有像 <, > 等这样的字符，将以文本处理，而非HTML。

你可能感兴趣的:(JSoup)

00. 这里整理了最全的爬虫框架（Java + Python）有一只柴犬爬虫系列爬虫 java python
目录1、前言2、什么是网络爬虫3、常见的爬虫框架3.1、java框架3.1.1、WebMagic3.1.2、Jsoup3.1.3、HttpClient3.1.4、Crawler4j3.1.5、HtmlUnit3.1.6、Selenium3.2、Python框架3.2.1、Scrapy3.2.2、BeautifulSoup+Requests3.2.3、Selenium3.2.4、PyQuery3.2
2024年Java爬虫利器：Jsoup详细介绍与用法_java jsoup(1) 2401_84562143 程序员 java 爬虫开发语言
.method(Connection.Method.GET).execute();DocumentloginDoc=loginForm.parse();Elementform=loginDoc.select(“form”).first();//填充表单字段form.select(“input[name=username]”).val(“username”);form.select(“input[n
Java爬虫开发：Jsoup库在图片URL提取中的实战应用小白学大数据 python java 爬虫开发语言测试工具前端 javascript
在当今的互联网时代，数据的获取和处理变得尤为重要。对于网站内容的自动化抓取，爬虫技术扮演着不可或缺的角色。Java作为一种广泛使用的编程语言，拥有丰富的库支持网络爬虫的开发。其中，Jsoup库以其简洁、高效的特点，成为处理HTML内容和提取数据的优选工具。本文将详细介绍如何使用Jsoup库开发Java爬虫，以实现图片URL的提取。Jsoup库简介Jsoup是一个用于解析HTML文档的Java库，它
不通过修改代码可以调用不同方法的三种方式山间清泉1111
Stringpath=JsoupDemo1.class.getClassLoader().getResource("com/mujiachao/xml/dtd/student.xml").getPath();Documentdocument=Jsoup.parse(newFile(path),"utf-8");Elementsname=document.getElementsByTag("name
webmagic高级:(四) 沙漏如心
本篇呢，本来打算写一下，pipeline里面的ResultItems对象，但是呢，简单看了一下，里面东西不是很多。所以呢，我这次说，这个selectable对象，也就是节点对象，就想jsoup里面element对象.不过呢，这个对象内容较多所以，我们就只看一下他的接口，而不去看他的很多个实现类了！selectable前面呢，我们说过webmagic呢，是一个集成了jquery选择器，css选择器，
大数据相关技术 ssttIsme
1数据获取方式爬虫:分布式爬虫java的jsoup(操作方式基于选择器)，pythoon,八爪鱼日志收集:log4j(可以控制级别和放置的位置)(可以输出数据到flume)(可以输出到mq),flume(分布式日志收集系统)(收集用户ip，访问了哪个方法)(例如三大运营商的日志分析能根据用户71个字段，拿到谁在什么时间什么地点用什么手机什么浏览器哪个版本访问了什么网站访问了多长时间网站内容是什么)
2021最新版 ElasticSearch 7.6.1 教程详解爬虫jsoup+es模拟京东搜索（狂神说） Super_Song_ 中间件 elasticsearch 搜索引擎 java nosql
文章目录一、ElasticSearch简介1.了解创始人DougCutting2.Lucene简介3.ElasticSearch简介4.ElasticSearch和Solr的区别5.了解ELK二、软件安装1.ElasticSearch2.ElasticSearchHead3.Kibana三、ElasticSearch使用详解1.ES核心概念文档索引倒排索引ik分词器2.命令模式的使用Rest风格说
JAVA爬虫三种方法 weixin_40298650
文章目录前言一、JDK二、HttpClient三、Jsoup总结前言记录JAVA爬虫三种方式一、JDK使用JDK自带的URLConnection实现网络爬虫。publicvoidtestGet()throwsException{//1.确定要访问/爬取的URLURLurl=newURL("https://blog.csdn.net/weixin_40298650/article/details/1
[含完整代码]Java实现导出word文档【超详细】 Java患者· java word c#
前言：个人博客：www.wdcdbd.comjava实现导出word文档是项目中很常见的操作，但又是很棘手的操作，这篇文章，带大家从0到1超详细的完整的操作一遍java实现导出word文档。一定要认真看这篇文章，超详细。话不多说直接上代码。〇、实现导出word文档前准备使用的依赖：org.jsoupjsoup1.11.3cn.hutoolhutool-all5.8.16org.apache.com
如何使用工具获取动态HTML页面内容 CodingCode
如何使用工具获取动态HTML页面内容我们知道jsoup可以用来获取HTML页面并且分析读取页面内容。例如：importjava.io.IOException;importorg.jsoup.Jsoup;importorg.jsoup.nodes.Document;importorg.jsoup.nodes.Element;importorg.jsoup.select.Elements;public
Jsoup使用示例大灰狼zz
查看网页源码和对应标签使用QQ浏览器搜狗引擎搜索奥迪image.png在浏览器中按F12可以查看网页源码image.png点击源码左上角的按钮image.png再把鼠标移动到坐标任意位置，在源代码中会高亮对应的标签image.png网页爬虫示例在gradle中引入Jsoupdependencies{//爬虫api'org.jsoup:jsoup:1.11.3'相关代码@Overridepublic
ElasticSearch-ElasticSearch实战-仿京东商城搜索（高亮） 666-LBJ-666 ES elasticsearch 全文检索 spring boot
注：此为笔者学习狂神说ElasticSearch的实战笔记，其中包含个人的笔记和理解，仅做学习笔记之用，更多详细资讯请出门左拐B站：狂神说!!!七、ElasticSearch实战仿京东商城搜索（高亮）1、工程创建（springboot）目录结构2、基本编码①导入依赖1.8UTF-8UTF-82.3.7.RELEASEorg.jsoupjsoup1.10.2com.alibabafastjson1.
实践：读取html文本提取相应内容按照格式导出到excel中酱学编程 html excel
最近在做一个需求，需要将html文本中的内容提取出来，然后导出到excel里面，实现交代情景，html文本中存在许多标签，且很乱，因此需要之间将标签里面的文本提取出来，再进行处理。............Stringtext=Jsoup.parse(content).wholeText();//解析字符串并将数据添加到表格String[]dataArray=text.split("\n");//创
Java 数据抓取踏遍三十六岸 java项目中高效开发 java 后端数据
大家好我是苏麟,今天聊聊数据抓取.大家合理使用注意，爬虫技术不能滥用，干万不要给别人的系统造成压力、不要侵犯他人权益!数据抓取实质上就是java程序模拟浏览器进行目标网站的访问，无论是请求目标服务器的接口还是请求目标网页内容，都是要在java程序中对数据进行解析。最简单的抓取方式有httpclient请求目标服务器接口，jsoup请求目标页面内容，把请求的数据进行解析然后入库。另外要做好爬取的实时
2018-01-05 大黄2333
主要工作选取首页中的超链接，利用布隆容器去重，将最终需要的网页选取出来，用前几节课学习的方法将需要的信息抓取出来并且存放到数据库中。具体工作1、初始页面在myeclipse中输入选取的首页2、用jsoup模拟浏览器代码如下：网页的头请求用jsoup模拟浏览器3、初始化三个容器作用：1、布隆容器去重，检测网页的唯一性。2、list容器存放中间页面。3、存放最终页面。代码如下：publicstatic
高效 Java 程序员不能错过的 10+ 个最佳库！ Java架构学习者
举些例子，最常用的官方库有java.lang、java.util、java.io、java.sql、java.net等；而至于目前最流行的第三方库，就有Junit、SLF4J、GoogleGuava、XStream、JSoup、Gson、JodaTime等，可以说是不胜枚举。我到底需要用到哪些Java库呢？某些库再热门也好，你的项目也未必适用。然而即便如此，大部分项目实际上都还是需要进行单元测试、
使用Jenkins执行TestNg+Selenium+Jsoup自动化测试和生成ExtentReport测试报告 penngo java 持续交付 jenkins selenium 运维自动化测试
文章目录1、Jenkins1.1下载安装jenkins1.2安装HTMLPublisher插件2、使用Jenkins创建流水线任务2.1创建流水线2.2构建2.3测试报告上一篇已经介绍Maven整合TestNG、ExtentReports、Selenium、Jsoup测试项目工程的建立，本文介绍使用Jenkins执行自动化测试代码。1、Jenkins1.1下载安装jenkins下载jenkins：
go实现生成html文件和html文件浏览服务 penngo Go golang html gin
文章目录本文章是为了解决使用Jenkins执行TestNg+Selenium+Jsoup自动化测试和生成ExtentReport测试报告生成的测试报告，只能在jenkins里面访问，为了方便项目组内所有人员都能查看测试报，可以在jenkins构建时，把测试报告的html推送到其它http服务，再让该http服务提供访问。为了实现上边的功能，需要编写两个HTTP接口：1、upload接口，接收发送的
Java爬虫批量爬取图片 zxy199288 java java 爬虫 python
Java爬取图片现在开始学习爬虫，对于爬虫的入门来说，图片相对来说是比较容易获取的，因为大部分图片都不是敏感数据，所以不会遇到什么反爬措施，对于入门爬虫来说是比较合适的。使用技术：Java基础知识、HttpClient4.x、Jsoup学习目标：下载静态资源图片。爬取思路对于这种图片的获取，其实本质上就是就是文件的下载（HttpClient）。但是因为不只是获取一张图片，所以还会有一个页面解析的处
JAVA爬虫案例——JSOUP爬取图片并使用v-viewer实现图片预览北溟溟 JAVA java 爬虫
前言网络爬虫是大数据时代收集数据的一种有效手段，合理合法的运用技术手段获取网络数据，实现数据的再利用也是程序员的一项重要技能。本节我们使用java环境下的jsoup实现网络数据的爬取，主要是图片数据的异步爬取，并实现网络图片的下载及图片的预览功能，预览功能使用具有丰富功能的v-viewer实现。正文引入爬虫pom工具包org.apache.httpcomponentshttpclient4.5.6
SpringBoot-Jsoup做java简单-爬虫番茄好困爬虫 java
使用SpringBoot+Jsoup做java简单’爬虫’Jsoup简介Jsoup是一款java的Html解析器，可以直接解析Html。针对网页提供了相关Api，可以通过Dom、Css、Jquery等属性来操作和解析网页。主要类介绍：Jsoup类提供了连接，清理和解析HTML文档的方法Document获取HTML文档Element获取、操作HTML节点实战（爬京东网页数据）1.创建Maven项目2
java中用jsoup抓取网页源码，并批量下载图片平凡的华仔 java爬虫工具jsoup jsoup 网页解析爬虫批量下载图片
一、导入jsoup的核心jar包jsoup-xxx.jarjar包下载：jsoup-1.8.2.jar中文API：http://www.open-open.com/jsoup/parsing-a-document.htm二、java中用jsoup抓取网页源码，并批量下载图片packagecom.dgh.test;importjava.io.File;importjava.io.FileOutput
Jsoup - 【Java爬虫】- 批量下载指定网站图片 QX_Java_Learner Java java
简介Jsoup是一款Java的HTML解析器，可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于JQuery的操作方法来取出和操作数据。Jsoup对多线程、连接池、代理等等的支持并不是很好，所以一般把Jsoup仅仅作为HTML解析工具使用。功能从一个URL、文件或字符串中解析HTML使用DOM或CSS选择器来查找、取出数据可操作HTML元素、属
WebMagic爬虫Demo 我是一颗小虎牙_
前言WebMagic介绍Java的可伸缩Web搜寻器框架。官方网站：http://webmagic.io/一款爬虫框架是WebMagic，其底层使用的HttpClient和Jsoup。WebMagic项目代码分为核心和扩展两部分。核心部分(webmagic-core)是一个精简的、模块化的爬虫实现，而扩展部分则包括一些便利的、实用性的功能。WebMagic的设计目标是尽量的模块化，并体现爬虫的功能
pom.xml文件配置来之前不会起名字 Java java maven
1.中央仓库查看jar文件2.添加项目依赖com.mysqlmysql-connector-j8.1.0org.jsoupjsoup1.16.1org.projectlomboklombok1.18.28provided3.配置本地项目jdk修改idea项目模块,jdk依赖修改maven项目的pom.xml配置文件4.0.0org.examplem11.0-SNAPSHOT1717UTF-8com
【Java】使用Java实现爬虫 Do_GH Java java 爬虫
文章目录使用Java实现爬虫一、HttpClient实现模拟HTTP访问1.1HttpClient1.2引入依赖1.3创建简单的请求操作1.3.1创建实例1.3.2Jsoup应用1.4爬取过程中可能出现的问题1.4.1JS异步加载问题1.4.2反爬技术的影响1.5爬取需要登录的页面1.5.1在header中直接携带Cookie1.5.2模拟登录自动获取Cookie二、HtmlUtil实现JS异步加
如何检查项目中用到的License xxzblog java java
检查项目中用到的Licenseorg.jsoupjsoup1.11.3org.apache.commonscommons-lang33.12.0执行命令生成依赖报告./mvnwproject-info-reports:dependencies直接上代码packagejsbxyyx;importorg.apache.commons.lang3.StringUtils;importorg.jsoup.
【Java 代码实例 7】jsoup解析html 哪吒 Java基础教程系列 java jquery html
Java学习路线：搬砖工逆袭Java架构师简介：Java领域优质创作者、CSDN哪吒公众号作者✌、Java架构师奋斗者扫描主页左侧二维码，加入群聊，一起学习、一起进步欢迎点赞收藏⭐留言一、Jsoup简介Jsoup是一款Java的HTML解析器，可直接解析某个URL地址、HTML文本内容。它提供了一套非常省力的API，可通过DOM，CSS以及类似于jQuery的操作方法来取出和操作数据。二、Jsou
【数据爬取】Jsoup爬取数据的使用 script-pro java 爬虫开发语言 java Jsoup
目录1.Jsoup介绍2.导入依赖3.爬虫示例1.Jsoup介绍Jsoup是一个用于解析、提取和操作HTML文档的Java库。它提供了简单且易于使用的API，能够轻松地从HTML页面中提取数据。2.导入依赖org.jsoupjsoup1.14.33.爬虫示例示范了一个爬取微博网数据的示例：importorg.jsoup.Jsoup;importorg.jsoup.nodes.Document;im
【Java-随笔】常用依赖 SUNxRUN java 开发语言
Jsouphttps://mvnrepository.com/artifact/org.jsoup/jsouporg.jsoupjsoup1.15.3HttpClienthttps://mvnrepository.com/artifact/org.apache.httpcomponents/httpclientorg.apache.httpcomponentshttpclient4.5.13Myb
java解析APK 3213213333332132 java apk linux 解析APK
解析apk有两种方法 1、结合安卓提供apktool工具，用java执行cmd解析命令获取apk信息 2、利用相关jar包里的集成方法解析apk 这里只给出第二种方法，因为第一种方法在linux服务器下会出现不在控制范围之内的结果。 public class ApkUtil { /** * 日志对象 */ private static Logger
nginx自定义ip访问N种方法 ronin47 nginx 禁止ip访问
　　　因业务需要，禁止一部分内网访问接口，　由于前端架了F5，直接用deny或allow是不行的，这是因为直接获取的前端Ｆ５的地址。　　　所以开始思考有哪些主案可以实现这样的需求，目前可实施的是三种：　　　一：把ip段放在redis里，写一段lua 二：利用geo传递变量，写一段
mysql timestamp类型字段的CURRENT_TIMESTAMP与ON UPDATE CURRENT_TIMESTAMP属性 dcj3sjt126com mysql
timestamp有两个属性，分别是CURRENT_TIMESTAMP 和ON UPDATE CURRENT_TIMESTAMP两种，使用情况分别如下： 1. CURRENT_TIMESTAMP 当要向数据库执行insert操作时，如果有个timestamp字段属性设为 CURRENT_TIMESTAMP，则无论这
struts2+spring+hibernate分页显示 171815164 Hibernate
分页显示一直是web开发中一大烦琐的难题，传统的网页设计只在一个JSP或者ASP页面中书写所有关于数据库操作的代码，那样做分页可能简单一点，但当把网站分层开发后，分页就比较困难了，下面是我做Spring+Hibernate+Struts2项目时设计的分页代码，与大家分享交流。　　1、DAO层接口的设计，在MemberDao接口中定义了如下两个方法： public in
构建自己的Wrapper应用 g21121 rap
我们已经了解Wrapper的目录结构，下面可是正式利用Wrapper来包装我们自己的应用，这里假设Wrapper的安装目录为:/usr/local/wrapper。首先，创建项目应用 &nb
[简单]工作记录_多线程相关 53873039oycg 多线程
最近遇到多线程的问题,原来使用异步请求多个接口(n*3次请求) 方案一使用多线程一次返回数据,最开始是使用5个线程,一个线程顺序请求3个接口,超时终止返回缺点测试发现必须3个接
调试jdk中的源码，查看jdk局部变量程序员是怎么炼成的 jdk 源码
转自：http://www.douban.com/note/211369821/ 学习jdk源码时使用-- 学习java最好的办法就是看jdk源代码，面对浩瀚的jdk（光源码就有40M多，比一个大型网站的源码都多）从何入手呢，要是能单步调试跟进到jdk源码里并且能查看其中的局部变量最好了。可惜的是sun提供的jdk并不能查看运行中的局部变量
Oracle RAC Failover 详解 aijuans oracle
Oracle RAC 同时具备HA(High Availiablity) 和LB(LoadBalance). 而其高可用性的基础就是Failover(故障转移). 它指集群中任何一个节点的故障都不会影响用户的使用，连接到故障节点的用户会被自动转移到健康节点，从用户感受而言，是感觉不到这种切换。 Oracle 10g RAC 的Failover 可以分为3种： 1. Client-Si
form表单提交数据编码方式及tomcat的接受编码方式 antonyup_2006 JavaScript tomcat 浏览器互联网 servlet
原帖地址：http://www.iteye.com/topic/266705 form有2中方法把数据提交给服务器，get和post,分别说下吧。（一）get提交 1.首先说下客户端（浏览器）的form表单用get方法是如何将数据编码后提交给服务器端的吧。对于get方法来说，都是把数据串联在请求的url后面作为参数，如：http://localhost:
JS初学者必知的基础百合不是茶 js函数 js入门基础
JavaScript是网页的交互语言,实现网页的各种效果, JavaScript 是世界上最流行的脚本语言。 JavaScript 是属于 web 的语言，它适用于 PC、笔记本电脑、平板电脑和移动电话。 JavaScript 被设计为向 HTML 页面增加交互性。许多 HTML 开发者都不是程序员，但是 JavaScript 却拥有非常简单的语法。几乎每个人都有能力将小的
iBatis的分页分析与详解 bijian1013 java ibatis
分页是操作数据库型系统常遇到的问题。分页实现方法很多，但效率的差异就很大了。iBatis是通过什么方式来实现这个分页的了。查看它的实现部分，发现返回的PaginatedList实际上是个接口，实现这个接口的是PaginatedDataList类的对象，查看PaginatedDataList类发现，每次翻页的时候最
精通Oracle10编程SQL(15)使用对象类型 bijian1013 oracle 数据库 plsql
/* *使用对象类型 */ --建立和使用简单对象类型 --对象类型包括对象类型规范和对象类型体两部分。 --建立和使用不包含任何方法的对象类型 CREATE OR REPLACE TYPE person_typ1 as OBJECT( name varchar2(10),gender varchar2(4),birthdate date ); drop type p
【Linux命令二】文本处理命令awk bit1129 linux命令
awk是Linux用来进行文本处理的命令，在日常工作中，广泛应用于日志分析。awk是一门解释型编程语言，包含变量，数组，循环控制结构，条件控制结构等。它的语法采用类C语言的语法。 awk命令用来做什么？ 1.awk适用于具有一定结构的文本行，对其中的列进行提取信息 2.awk可以把当前正在处理的文本行提交给Linux的其它命令处理，然后把直接结构返回给awk 3.awk实际工
JAVA(ssh2框架)+Flex实现权限控制方案分析白糖_ java
目前项目使用的是Struts2+Hibernate+Spring的架构模式，目前已经有一套针对SSH2的权限系统，运行良好。但是项目有了新需求：在目前系统的基础上使用Flex逐步取代JSP，在取代JSP过程中可能存在Flex与JSP并存的情况，所以权限系统需要进行修改。【SSH2权限系统的实现机制】权限控制分为页面和后台两块：不同类型用户的帐号分配的访问权限是不同的，用户使
angular.forEach boyitech AngularJS AngularJS API angular.forEach
angular.forEach 描述: 循环对obj对象的每个元素调用iterator, obj对象可以是一个Object或一个Array. Iterator函数调用方法: iterator(value, key, obj), 其中obj是被迭代对象，key是obj的property key或者是数组的index，value就是相应的值啦. (此函数不能够迭代继承的属性.)
java-谷歌面试题-给定一个排序数组，如何构造一个二叉排序树 bylijinnan 二叉排序树
import java.util.LinkedList; public class CreateBSTfromSortedArray { /** * 题目:给定一个排序数组，如何构造一个二叉排序树 * 递归 */ public static void main(String[] args) { int[] data = { 1, 2, 3, 4,
action执行2次 Chen.H JavaScript jsp XHTML css Webwork
xwork 写道 <action name="userTypeAction" class="com.ekangcount.website.system.view.action.UserTypeAction"> <result name="ssss" type="dispatcher">
[时空与能量]逆转时空需要消耗大量能源 comsci 能源
无论如何,人类始终都想摆脱时间和空间的限制....但是受到质量与能量关系的限制,我们人类在目前和今后很长一段时间内,都无法获得大量廉价的能源来进行时空跨越..... 在进行时空穿梭的实验中,消耗超大规模的能源是必然
oracle的正则表达式(regular expression)详细介绍 daizj oracle 正则表达式
正则表达式是很多编程语言中都有的。可惜oracle8i、oracle9i中一直迟迟不肯加入，好在oracle10g中终于增加了期盼已久的正则表达式功能。你可以在oracle10g中使用正则表达式肆意地匹配你想匹配的任何字符串了。正则表达式中常用到的元数据(metacharacter)如下： ^ 匹配字符串的开头位置。 $ 匹配支付传的结尾位置。 *
报表工具与报表性能的关系 datamachine 报表工具 birt 报表性能润乾报表
在选择报表工具时，性能一直是用户关心的指标，但是，报表工具的性能和整个报表系统的性能有多大关系呢？要回答这个问题，首先要分析一下报表的处理过程包含哪些环节，哪些环节容易出现性能瓶颈，如何优化这些环节。一、报表处理的一般过程分析 1、用户选择报表输入参数后，报表引擎会根据报表模板和输入参数来解析报表，并将数据计算和读取请求以SQL的方式发送给数据库。 2、
初一上学期难记忆单词背诵第一课 dcj3sjt126com word english
what 什么 your 你 name 名字 my 我的 am 是 one 一 two 二 three 三 four 四 five 五 class 班级，课 six 六 seven 七 eight 八 nince 九 ten 十 zero 零 how 怎样 old 老的 eleven 十一 twelve 十二 thirteen
我学过和准备学的各种技术 dcj3sjt126com 技术
语言VB https://msdn.microsoft.com/zh-cn/library/2x7h1hfk.aspxJava http://docs.oracle.com/javase/8/C# https://msdn.microsoft.com/library/vstudioPHP http://php.net/manual/en/Html
struts2中token防止重复提交表单蕃薯耀重复提交表单 struts2中token
struts2中token防止重复提交表单 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年7月12日 11:52:32 星期日 ht
线性查找二维数组 hao3100590 二维数组
1.算法描述有序（行有序，列有序，且每行从左至右递增，列从上至下递增）二维数组查找，要求复杂度O(n) 2.使用到的相关知识：结构体定义和使用，二维数组传递（http://blog.csdn.net/yzhhmhm/article/details/2045816） 3.使用数组名传递这个的不便之处很明显，一旦确定就是不能设置列值 //使
spring security 3中推荐使用BCrypt算法加密密码 jackyrong Spring Security
spring security 3中推荐使用BCrypt算法加密密码了，以前使用的是md5， Md5PasswordEncoder 和 ShaPasswordEncoder，现在不推荐了，推荐用bcrpt Bcrpt中的salt可以是随机的，比如： int i = 0; while (i < 10) { String password = "1234
学习编程并不难,做到以下几点即可! lampcy java html 编程语言
不论你是想自己设计游戏，还是开发iPhone或安卓手机上的应用，还是仅仅为了娱乐，学习编程语言都是一条必经之路。编程语言种类繁多，用途各异，然而一旦掌握其中之一，其他的也就迎刃而解。作为初学者，你可能要先从Java或HTML开始学，一旦掌握了一门编程语言，你就发挥无穷的想象，开发各种神奇的软件啦。 1、确定目标学习编程语言既充满乐趣，又充满挑战。有些花费多年时间学习一门编程语言的大学生到
架构师之mysql----------------用group+inner join,left join ,right join 查重复数据（替代in) nannan408 right join
1.前言。如题。 2.代码 (1)单表查重复数据,根据a分组 SELECT m.a,m.b, INNER JOIN （select a,b,COUNT(*) AS rank FROM test.`A` A GROUP BY a HAVING rank>1 )k ON m.a=k.a （2）多表查询，使用改为le
jQuery选择器小结 VS 节点查找（附css的一些东西） Everyday都不同 jquery css name选择器追加元素查找节点
最近做前端页面，频繁用到一些jQuery的选择器，所以特意来总结一下：测试页面： <html> <head> <script src="jquery-1.7.2.min.js"></script> <script> /*$(function() { $(documen
关于EXT tntxia ext
ExtJS是一个很不错的Ajax框架，可以用来开发带有华丽外观的富客户端应用，使得我们的b/s应用更加具有活力及生命力。ExtJS是一个用 javascript编写，与后台技术无关的前端ajax框架。因此，可以把ExtJS用在.Net、Java、Php等各种开发语言开发的应用中。 ExtJs最开始基于YUI技术，由开发人员Jack
一个MIT计算机博士对数学的思考 xjnine Math
在过去的一年中，我一直在数学的海洋中游荡，research进展不多，对于数学世界的阅历算是有了一些长进。为什么要深入数学的世界？作为计算机的学生，我没有任何企图要成为一个数学家。我学习数学的目的，是要想爬上巨人的肩膀，希望站在更高的高度，能把我自己研究的东西看得更深广一些。说起来，我在刚来这个学校的时候，并没有预料到我将会有一个深入数学的旅程。我的导师最初希望我去做的题目，是对appe