信息检索专业论文-网络数据抓取.docVIP

  • 9
  • 0
  • 约5.58千字
  • 约 5页
  • 2018-11-19 发布于浙江
  • 举报
PAGE \* MERGEFORMAT PAGE \* MERGEFORMAT 1 网络数据抓取 摘要 网络数据抓取的研究对于大学生来说,是一个重点难点,却是近年来网络学习的焦点之一。针对个人兴趣和在网络书本等地方寻求资料等方式,按照网络数据抓取所采用的方法,本文重点对网页数据采集、网络蜘蛛算法进行了分析。同时对未来的研究方向进行了展望,给出了若干值得研究的问题。 关键词:网络数据抓取;网络蜘蛛;网络数据采集 引言 在网络信息的时代,大量信息如同大海般没有边际。甚至我们获取信息的方法已经发生改变:从传统的到图书馆需找资料,变成通过搜索引擎进行检索。我们从信息匮乏的时代一下子走到了信息极大丰富今天。在今天,困扰我们的问题不是信息太少,而是太多,多得让你无从分辨,无从选择。因此,能够在互联网上抓取数据,并自动分拣、分析,对于我们来说有非常重要的意义。我们通过传统的搜索引擎所获得的信息,通常是通过网页的形式所展现的,这样的信息人工阅读起来自然亲切,但计算机却很难进行加工和再利用。而且检索到的信息量太大,我们很难在大量的检索结果中抽取出我们最需要的信息。 同时我们要确保系统的准确性。从互联网络这个巨大的信息海洋里获取信息,如何保证其所抓取的信息的准确性、有效性,是关键。因此,我们除了需要对抓取的信息进行分拣、分析外,当目标网站的内容、格式发生变化时,能够智能感知,并及时的通报、

文档评论(0)

1亿VIP精品文档

相关文档