HTMLParser 解析html字符串,提取纯文本

今天在群里问别人怎么提取文本,也没有具体告诉我用什么,只是说用htmlParser就可提取,查了查API,发现有个类很不错,两句话搞定哈。

 

 import org.htmlparser.Parser;
import org.htmlparser.visitors.TextExtractingVisitor;

public class Test {
 public static void main(String[] args) throws Exception {

String sss = "<div class='title'>商品详细说明:</div><p style='word-break: break-all'>ESTEE LAUDER     Perfectly Clean Splash Away Foaming Cleanser<br />为中性/混合性肌肤度身订制的清洁产品。 <br />";
  Parser parser = new Parser(sss);
  TextExtractingVisitor visitor = new TextExtractingVisitor();
  parser.visitAllNodesWith(visitor);
  System.out.println(visitor.getExtractedText());

 }
}

 

如果解析出现问题,可以在文件之间加入div标签。如:<div>+sss+</div>

根据测试,此方式必须得有div标签才不会报错,可以先添加然后解析的时候自动就没了。

 

大家还有其它方式解析,可以一起讨论:

 

具体可参考:www.gegeyigui.com 就有相关应用。

你可能感兴趣的:(html,bbs)