信息检索专业论文-网页数据抓取的初步探讨.docVIP

  • 3
  • 0
  • 约7.03千字
  • 约 6页
  • 2018-11-19 发布于浙江
  • 举报

信息检索专业论文-网页数据抓取的初步探讨.doc

网页数据抓取的初步探讨 摘要 随着Web上信息的爆炸性增长,人们无法直接而准确地定位感兴趣的资源,越来越多地依赖搜索引擎。然而,由于Web的规模巨大,任何一个网络爬虫均无法获取Web上的所有网页。既然不能抓取到全部网页,那么就需要网络爬虫在有限的时间内尽可能多地抓取较为重要的网页。网页抓取策略就是研究以怎样的顺序来访问Web上的网页以使得网络爬虫能够优先获取Web上的重要页面。 关键字 网页数据抓取 网络爬虫 安全性 获取信息技术 1 引言 近年来,伴随着互联网信息的爆炸性增长,万维网(Wbrld Wide Web,简记为W曲)技术得到广泛应用,它的开放性和其上信息传输的迅速性极大地方便了人们获取信息。由于Web具有海量信息的特点,人们无法快速准确直接地定位感兴趣的资源,因此越来越多地依赖于搜索引擎。然而,传统的通用搜索引擎如Google、百度等正面临着巨大的挑战。在这些挑战中,一方面是由于Web信息资源的快速增长,使得搜索引擎无法索引到全部网页;另一方面是由于Web信息资源的动态变化,使得搜索引擎无法保证对其索引信息的及时更新。 既然搜索引擎不能够获取Web中的全部网页,那么优先获取Web中一些重要网页就显得十分有必要。搜索引擎依靠网络爬虫来获取被其索引的网页。网络爬虫通过一定的策略在Web上搜集网页,源源不断地提供给搜索引擎,进而为用户提供检索服务。然而网络爬虫不可能抓取到W

文档评论(0)

1亿VIP精品文档

相关文档