网络爬虫技术分析.docVIP

  • 79
  • 0
  • 约3.52千字
  • 约 5页
  • 2017-08-15 发布于重庆
  • 举报
网络爬虫技术分析.doc

网络爬虫技术分析与研究 搜索引擎 1.概念: 从网络上获得网站网页资料,能够建立数据库并提供查询的系统它们是Web独自运行的软件程序,它们不断地筛选数据,做出自己的 决定Web获取文本或者进行搜索查询,按部就班地完成各自的任务。按照一定的规则自动提取网页搜索引擎使用网络爬虫寻找网络内容,网络上的HTML文档使用超链接连接了起来,就像织成了一张网,网络爬虫也叫网络蜘蛛,顺着这张网爬行,每到一个网页就用抓取程序将这个网页抓下来,将内容抽取出来,同时抽取超链接,作为进一步爬行的线索。网络爬虫总是要从某个起点开始爬,这个起点叫做种子,你可以告诉它,也可以到一些网址列表网站上获取爬行的范围是受控的被爬虫抓取的网页将会被系统存贮,进行一定的分析、过滤,并建立索引,以便之后的查询和检索过程所得到的分析结果还可能对以后的抓取过程给出反馈和指导不同领域、不同背景的用户有不同的检索目的和需求,通用搜索引擎所返回的结果包含大量用户不关心的网页信息含量密集且具有一定结构的数据现有聚焦爬虫对抓取目标的描述可分为基于目标网页特征、基于目标数据模式和基于领域概念3种。 基于目标网页特征的爬虫所抓取、存储并索引的对象一般为网站或网页。根据种子样本获取方式可分为: (1)预先给定的初始抓取种子样本; (2)预先给定的网页分类目录和与分类目录对应的种子样本,如Yahoo!分类结构等; (3)通过用户行为确定的抓取目标

文档评论(0)

1亿VIP精品文档

相关文档