信息检索专业论文-基于PowerBuilder的网页数据抓取.docVIP

  • 3
  • 0
  • 约6.66千字
  • 约 7页
  • 2018-11-11 发布于浙江
  • 举报

信息检索专业论文-基于PowerBuilder的网页数据抓取.doc

基于PowerBuilder的网页数据抓取 摘要 互联网飞速发展,WEB已经成为一个巨大的信息资源库,各行各业的信息均可以在互联网上找到。及时准确的获得、存贮、分析、利用这些信息是非常重要的。利用PowerBuilder和MicroSoft SQLServer数据库,提出了一种对网页的数据抓取的方法。用户首先选定样本页面,其次在样本中预先定义抓取模式,然后对样本网页和其中的样本进行标记,形成信息的抓取规则,进行数据抓取,并存入数据库。最后利用数据库对信息进行分类,抽取出所需的信息,达到分析准确、抓取速度快的目的。 关键词 HTML模式数据抓取抓取器数据挖掘 1 引 言 随着Internet/Intranet的迅速发展,WEB已经成为一个巨大的资源库,并且数据量仍在快速的增长,成为全球传播与共享科研、教育、商业、社会信息等最重要和最具有潜力价值的信息资源。如何快速有效的利用这些信息,是一件非常有意义的事情。但是由于WEB数据(尤其是HTML网页)没有明显的信息结构?。在以前的数据抓取的过程中,一般采用人工的抓取方法,这样的工作效率低下。本文采用了添加模式和抽取关键信息的方法,大大提高数据抓取、分析、利用的效率。 2 抓取概述 需要抓取WEB站点的信息显示特点一般是:同一WEB站点的同类数据信息表示的HTML结构是相似的,尤其是对于大量的信息发布,通常都是采用相同

文档评论(0)

1亿VIP精品文档

相关文档