搜索引擎的相关性排序研究.pdf

第1章绪论 第1章 绪论 1.1选题研究背景 随着计算机系统性能的提高和网络技术的不断进步,万维网得到了蓬勃发 展,成为全球最大的信息资源库。据发表在《科学》杂志1999年7月的文章 《万维网信息的可访问性》估计,万维网上的网页超过8亿,有效数据约15T, 并且仍以每4个月翻一番的速度增长。调查显示2008年初,全球可索引的网页 已高达156亿。用户要在如此庞大杂乱的万维网资源中查找所需要的信息,就 像大海捞针一样,搜索引擎的诞生为用户检索如此庞大的信息资源提供了可能。 搜索引擎是基于万维网平台,提供网络信息检索服务的工具。搜索引擎首先对 万维网的数据进行搜集并建立索引数据库,当用户给出关键词进行查询时,搜 索引擎分析用户查询需求,并计算该查询与其索引文档的相关性,最终按照相 关程度返回检索结果给用户,帮助用户拒绝和忽略大量无关信息,从而起到信 息导航的作用。 一般来说,评价一个搜索引擎性能的主要指标【1】是:查全率、查准率、检 索速度、检索系统的易用性和检索费用。目前搜索引擎的查全率、检索速度、 检索系统的易用性和检索费用基本能满足用户需求,然而用户对查准率并不满 意。如图1.1,用户在Google中输入

文档评论(0)

1亿VIP精品文档

相关文档