Nutch爬虫工作流程及文件格式详细分析

Nutch爬虫工作流程及文件格式详细分析
来源: 作者:
时间:2009-05-10 Tag:Nutch   爬虫   工作流程   文件格式   详细分析   点击: 23
Nutch主要分为两个部分:爬虫crawler和查询searcher。Crawler主要用于从网络上抓取网页并为这些网页建立索引。 Searcher主要利用这些索引检索用户的查找关键词来产生查找结果。两者之间的接口是索引,所以除去索引部分,两者之间的耦合度很低。
http://www.josdoc.com/html/sousuo/Nutch/shenruyanjiu/200905/10-733.html

你可能感兴趣的:(html,工作)