nutch配置过程.docVIP

  • 6
  • 0
  • 约6.55千字
  • 约 8页
  • 2017-08-12 发布于河南
  • 举报
Nutch搜索引擎数据获取 1 基本原理: 1.1 体系结构设计: 网络蜘蛛一般都具有3模块:HTTP下载模块,链接分析模块,下载控制模块。 HTTP下载模块利用http网络协议下载,获取并存储内容。 链接分析模块能提取网页中的超链接,用来获得后续页面入口。 下载控制模块控制页面访问次序、更新策略、访问队列调度等工作。 工作流程: 访问URL数据库,读取URL入口地址,生成内存访问队列。 寻找空闲的HTTP下载模块,分配URL,启动下载任务。 HTTP下载模块访问互联网,得到的网页内容放入结果队列。 定期保存到网页数据库,为后续索引做准备。 链接分析模块提取页面内的新连接,存入URL数据库等待下载。 重复上述过程直到全部下载完成,等待新的任务。 1.2 访问策略与算法: 网络蜘蛛访问一个网站,一般入口页面为网站的首页或者sitemap页面。从这个页面通过链接分析,寻找并访问后续页面地址。 网络蜘蛛对网站的访问有深度限制,一般在3~5层,遍历策略一般采用广度优先算法和深度优先算法。 从应用角度看,广度优先能尽可能的比较平均的获取不同网站的内容,比较适合于大型搜索引擎系统初期网页库的建立;深度优先在设计师比较容易,对垂直搜索或者站内搜索比较合适。 2 Nutch网络蜘蛛 2.1 概述 Nutch系统包含一个功能强大的网络蜘蛛。这个网络蜘蛛的核心是Crawl工具。这个工具根据

文档评论(0)

1亿VIP精品文档

相关文档