文本特征提取;主要内容;文本表示;文本表示及文本预处理;向量空间模型[G.Salton,1971];VSM示意图—数据结构化一般思路;VSM示意图;文本表示注解;文本表示注解;文本表示注解;;特征权重;常用的权重计算方法;TF-IDF 例子 ( Salton et al.,1983 );TF-IDF 应用举例;特征权重注解;;特征提取的意义;特征提取思路;文档频率(Document Frequency,DF);文档频率;文档频率;熵;熵/ 平均熵;信息增益(Information Gain, IG);信息增益;信息增益;χ2 统计量;;χ2 统计量;χ2 统计量;低频词缺陷;互信息法(Mutual Information, MI);互信息特点;潜在语义分析 (Latent Semantic Analysis,LSA);特征值/特征向量;具体步骤为 ;
这样共可得到m个两两正交的单位特征向量;由;
已知矩阵A,寻找行空间的一组标准正交基记为V,通过A作用到行空间的这组标准正交基上AV ,得到列空间的一组基向量,记为B,把B标准化后得U,这里就可以得到
用分量的形式表示:
; 对于 ,方程两边同乘 ,可以得到 ,
原创力文档

文档评论(0)