第二章-互联网信息资源检索概论.ppt

自动归类对网页的处理方法:首先对网页进行自动标引,对网页中的词语根据它们的词频和网页中出现的位置赋予权重。然后将处理后得到的语词集合与系统预定义的分类表中的每一个款目进行比较。从一级类目开始比较,直到出现比较显著的匹配值为止,此时再将网页归入此类。 * 自动聚类:从待分类网页中提取出特征,然后将提出的特征进行比较,再根据一定的原则或需要,将具有相同或相近特征的对象定义为一类,这个类目未必是事先拟定好的。 * 自动聚类,由于类别是根据检索结果自动生成的,所以系统处理起来容易一些,至少计算机可以把判断为无法归入已知类别的网页单独聚成一类。 * 2.2.4元数据 元数据被重视的原因:在过滤信息使用检索工具时,所得到的检索结果太多,无法一一浏览过滤,并且有时排在前面的搜索结果又不是用户真正需要的。因此如何制定一套数据描述格式来有效率的描述网上的数字化信息资源成为一个重要课题,这正是元数据日渐受到重视的原因。 * 元数据的定义 元数据的英文定义是“data about data”,就其本义和功能而言,可说是电子目录。编制目录的目的在于描述数据的内容或特色,进而达成辅助信息检索的目的。 * Dublin Core的十五项广义的元数据 1、名称(title)分配给资源的名称 2、创作、制作者(Creator)制作资源内容的主要责任实体。 3、主题及关键词(Subject and Keywor

文档评论(0)

1亿VIP精品文档

相关文档