《文本特征选择及相似度计算方法概述》1200字.docx

《文本特征选择及相似度计算方法概述》1200字.docx

文本特征选择及相似度计算方法概述

1.1文本特征选择

所谓特征选择,是指在不改变原有分析结果的前提下,将所有的特征项按照一定的规则进行筛选,选择一部分具有代表性的特征项,降低计算分析的复杂度。目前常见的文本特征选择方法主要分为TF-IDF和TextRank等无监督方法和卡方统计、信息增益、互信息等[43]有监督方法。下面主要介绍TF-IDF和TextRank两种方法。

(1)TF-IDF方法

TF-IDF是一种基于统计学的简单有效的特征选择算法[44]。TF-IDF采用统计词频的思想,来衡量一个字或词语对于一个语料库中某个文件或一个文件集的重要性。具体计算公式如(2-1)~(2-3)所示:

文档评论(0)

1亿VIP精品文档

相关文档