- 11
- 0
- 约9.12千字
- 约 38页
- 2019-10-17 发布于湖北
- 举报
微博情感词典组成图 4.2 微博领域情感词典 4.2.1 领域情感词典构建重要性 由于基础情感词典囊括的情感词是有限的,而中文的表达是变化万千的。特别是在微博中,口语化的表达常常带来很多新的情感词汇,通过已有的情感词典是无法辨别的,但是这些词汇在分析情感倾向时非常重要。比如:微博中经常出现一个名词“临时工”,这个词本身是不具有感情色彩的,可是发现用户在微博中所用到这个词时,往往是表达负面情感。这种例子还有很多,为了能识别这些新情感词,提高情感分类的准确性,可以构建一个面向微博的领域情感词典。 4.2.2 SO-PMI 算法 互信息是非常重要的信息度量,其相关理论已在前面作了介绍。在实际情况中,应用最为广泛的通常是点间互信息(PMI),主要用于计算词语间的语义相似度,基本思想是统计两个词语在文本中同时出现的概率,如果概率越大,其相关性就越紧密,关联度越高。 基于点间互信息SO-PMI算法的基本思想是:首先分别选用一组褒义词跟一组贬义词作为基准词,假设分别用Pwords 与Nwords 来表示这两组词语。这些情感词必须是倾向性非常明显,而且极具领域代表性的词语。若把一个词语word1跟Pwords的点间互信息减去word1跟Nwords的点间互信息会得到一个差值,就可以根据该差值判断词语word1的情感倾向。其计算公式如下所示: 通常情况下,将0 作为S
原创力文档

文档评论(0)