- 4
- 0
- 约小于1千字
- 约 22页
- 2019-09-30 发布于湖北
- 举报
潜在语义模型 LSI(Latent Semantic Index);特征值基础知识;矩阵与特征向量的几何意义;矩阵与特征向量的几何意义;小结;奇异值分解;奇异值分解;奇异值分解;低秩逼近;低秩逼近;低秩逼近;低秩逼近;LSI;LSI;LSI;LSI 实例;LSI 实例;LSI 结论;LSI 结论;疑问;左奇异向量表示词的一些特性,右奇异向量表示文档的一些特性,中间的奇异值矩阵表示左奇异向量的一行与右奇异向量的一列的重要程序,数字越大越重要。
继续看这个矩阵还可以发现一些有意思的东西,首先,左奇异向量的第一列表示每一个词的出现频繁程度,虽然不是线性的,但是可以认为是一个大概的描述,比如book是0.15对应文档中出现的2次,investing是0.74对应了文档中出现了9次,rich是0.36对应文档中出现了3次;
其次,右奇异向量中一的第一行表示每一篇文档中的出现词的个数的近似,比如说,T6是0.49,出现了5个词,T2是0.22,出现了2个词。
然后我们反过头来看,我们可以将左奇异向量和右奇异向量都取后2维(之前是3维的矩阵),投影到一个平面上,可以得到:
原创力文档

文档评论(0)