信息检索专业论文-浅谈网页数据抓取.docVIP

  • 19
  • 0
  • 约5.8千字
  • 约 5页
  • 2018-11-19 发布于浙江
  • 举报

信息检索专业论文-浅谈网页数据抓取.doc

浅谈网页数据抓取 摘要 网页数据抓取是一种基于搜索引擎的手机网页信息的工具,本文对网页数据抓取进行了简单的介绍并分析了网页爬虫的原理,最后对基于JAVA技术的网页内容抓取和基于python技术的网页内容抓取页面进行了简单的介绍 关键词:搜索引擎 爬虫 基本原理 步骤 策略 1 引言 在互联网络的时代,信息如同大海般没有边际。甚至我们获取信息的方法已经发生改变:从传统的翻书查字典,继而变成通过搜索引擎进行检索。我们从信息匮乏的时代一下子走到了信息极大丰富今天。 在今天,困扰我们的问题不是信息太少,而是太多,多得让你无从分辨,无从选择。因此,提供一个能够自动在互联网上抓取数据,并自动分拣、分析的工具有非常重要的意义[1]。 我们通过传统的搜索引擎所获得的信息,通常是通过网页的形式所展现的,这样的信息人工阅读起来自然亲切,但计算机却很难进行加工和再利用。而且检索到的信息量太大,我们很难在大量的检索结果中抽取出我们最需要的信息。采用自动识别关键词技术,将你需要的信息从海量的信息中筛选出来。就是数据抓取 2 搜索引擎的三个基本原理 1.利用爬虫系统程序,自动访问互联网,并沿着任何HYPERLINK /view/828.htm网页中的所有HYPERLINK /view/1496.htmURL爬到其它网页,重复这过程,并把爬过的所有网页收集回来。    2.由

文档评论(0)

1亿VIP精品文档

相关文档