尚文清 相似度计算方法 计算机应用.docVIP

  • 3
  • 0
  • 约7.24千字
  • 约 10页
  • 2019-06-20 发布于江西
  • 举报
常见相似度计算方法的区别 查询q和第j个文档的向量表示分别为q={w 1,q,w2,q,…wn,q}和dj={w1,j,w2,j,…wn,j},其中n为索引项的总个数。 一、内积表示 文档D 和查询式Q 可以通过内积进行计算:[1] wkq是查询q地k个索引项的权重,wkj是文档j的第k个索引项的权重,在内积表示法中,向量空间模型直接根据文档向量与查询向量的内积的大小对文档进行排序,内积越大,文档与查询的相关度越高。对于二值向量,即wkj和wkq均为二值变量时,内积是查询式中的索引项和文档中的索引项相互匹配的数量;对于加权向量,即wkj和wkq为根据一定规格加权后的非二值变量时,内积是查询式和文档中相互匹配的索引项的权重乘积之和 内积的特点: 内积值没有界限:不象概率值,要在(0,1) 之间 对长文档有利 内积用于衡量有多少词项匹配成功,而不计算有多少词项匹配失败长文档包含大量独立词项,每个词项均多次出现,因此一般而言,和查询式中的词项匹配成功的可能性就会比短文档大。 ? 二、余弦向量度量法 用内积法表示查询向量和文档的相似度时,由于内积值没有界限,因此给相似度的表示和排序带来了一定的麻烦,并这样会导致在计算相似点是,长文档比短文档具有优势,而实际上文档的长短与其是否和查询相关是没有必然联系的,为了尽可能减小文档长度这个与相似度无关的因素对相似度数据的影响,人们利用向量长度对内

文档评论(0)

1亿VIP精品文档

相关文档