- 9
- 0
- 约5.3万字
- 约 60页
- 2016-03-18 发布于河北
- 举报
面向主题的万维网信息挖掘.pdf
摘 要
万维网自二十世纪九十年代初有了第一个真正意义上的网页以后,其
信息量与日俱增,人们因此庆幸摆脱了信息匾乏的困境。然而,万维网信
息的海量性、复杂性、分布性以及非结构性,使人们在利用它来搜寻和获
取有用信息的时候常常不能如意。
面对这样的问题,人们一直在探寻各种各样的解决方法。这些解决方
法可以大致分为两个角度:
一个角度是从万维网信息的表示出发,通过研究和制定有效的万维网
表示规范来促进信息的规范表示,从而方便人们在此基础上开发有效的信
息搜索服务,例如,使用HTML语言让人们可以生动地阅读万维网信息,
开发XML语言让计算机可以自动处理网页所含的信息,发展资源描述框
架 (RDF),以便提供一个通用的万维网资源描述规范,等等。
另一个角度是从研究现有的万维网信息特性出发,通过开发特有的搜
索技术,来为人们提供信息搜索服务。例如,人们熟知的搜索引擎,另外
还有万维网信息挖掘,等等。
以上解决方法和技术都有各自的优缺点。现在的通用搜索引擎可以快
速地为人们提供感兴趣的网页,但它缺少对目的网页的语义分析,只能简
单地提供一组相关的网页,人们还要通过浏览这些网页获得进一步的知识.
万维网挖掘技术包含各种不同的技术,不同技术在
原创力文档

文档评论(0)