面向主题的万维网信息挖掘.pdfVIP

  • 9
  • 0
  • 约5.3万字
  • 约 60页
  • 2016-03-18 发布于河北
  • 举报
面向主题的万维网信息挖掘.pdf

摘 要 万维网自二十世纪九十年代初有了第一个真正意义上的网页以后,其 信息量与日俱增,人们因此庆幸摆脱了信息匾乏的困境。然而,万维网信 息的海量性、复杂性、分布性以及非结构性,使人们在利用它来搜寻和获 取有用信息的时候常常不能如意。 面对这样的问题,人们一直在探寻各种各样的解决方法。这些解决方 法可以大致分为两个角度: 一个角度是从万维网信息的表示出发,通过研究和制定有效的万维网 表示规范来促进信息的规范表示,从而方便人们在此基础上开发有效的信 息搜索服务,例如,使用HTML语言让人们可以生动地阅读万维网信息, 开发XML语言让计算机可以自动处理网页所含的信息,发展资源描述框 架 (RDF),以便提供一个通用的万维网资源描述规范,等等。 另一个角度是从研究现有的万维网信息特性出发,通过开发特有的搜 索技术,来为人们提供信息搜索服务。例如,人们熟知的搜索引擎,另外 还有万维网信息挖掘,等等。 以上解决方法和技术都有各自的优缺点。现在的通用搜索引擎可以快 速地为人们提供感兴趣的网页,但它缺少对目的网页的语义分析,只能简 单地提供一组相关的网页,人们还要通过浏览这些网页获得进一步的知识. 万维网挖掘技术包含各种不同的技术,不同技术在

文档评论(0)

1亿VIP精品文档

相关文档