Internet上的信息提取.pdfVIP

  • 11
  • 0
  • 约2.38万字
  • 约 31页
  • 2019-06-20 发布于安徽
  • 举报
1IIternet上的信息提取 前言 自从六十年代出现网络互联,到现在发展成全球性的Internet,计算机网 络在儿十年来迅猛发展,并在无形中改变了我们工作和生活的方式。在这个网络 时代,符种各样的信息正在以爆炸性的速度增长,作为信息时代的载体一 Internet,互联网页上的信息更是浩如烟海。 信息扩张的速度是如此之快,大量信息在给人们带来方便的同时也带来了一 大堆问题:第一是信息过量,难以消化;第二是信息真假难以辨识;第三是信息 安全难以保证;第四是信息形式不一致,难以统一处理。人们开始提出一个新的 口号:”要学会抛弃信息’。人们开始考虑:’如何才能不被信息淹没,而是从中 及时发现有用的知识、提高信息利用率?”。这样web数据挖掘技术应运而生, 面对海量的网络信息,它专门研究如何从网络上提取出有用的信息, 网页上的大部分信息都是以HT虬的格式来发布的,而HTML语言的设计是让 人们浏览用的,所以几乎所有的数据都是无规则的放置在格式标签里面,很难用 于自动处理。半结构化或者无结构化的网页布局加大了数据分析的难度。 为了更好的利用和处理网络上的信息,当前信息产业的技术产生了两个发展 方向,一个是语

文档评论(0)

1亿VIP精品文档

相关文档