基于语义的中文文本关键词提取算法及紧抓消费升级机遇-构建特色服务体系——第三届消费金融业务发展研讨会综述.docVIP

  • 5
  • 0
  • 约1.13万字
  • 约 21页
  • 2021-07-12 发布于安徽
  • 举报

基于语义的中文文本关键词提取算法及紧抓消费升级机遇-构建特色服务体系——第三届消费金融业务发展研讨会综述.doc

基于语义的中文文本关键词提取算法 该方法核心关键是:在基于传统统计词频的基础上,参考了不同词之间是否为同义关系。判断同义关系的基础是结合了代汉语较常用的一部类义词典——哈工大的《同义词词林》扩展版。 本文根据《同义词词林》中词关系之间的定义,定义了词语词之间的近似度。因此对于一篇文章中的不同词,词之间根据近似度数值关系可以组成网络(词语语义相似度网络)。然后分析该网络中节点(词)的居间度,即聚集程度。 词语与主题越相关,词语的居间度密度越大。该方法出于作者认为:聚集文档围绕主题构建,与主题越相关,词语越密集,即与主题最相关的词语占的比例较大。并且主题相关词语与主题有语义相关性,所以他们彼此也有一定的语义相似度。最终关键词的提取同时参考了词语的居间度与词频。 附算法示意图: 文中提出算法示例结果:《我爱逛农贸市场》关键词提取结果为: SKE 算法提取的关键词为农贸市场、爱、鱼、乌骨鸡、羊肉、花生; 基于统计特征的算法提取的关键词为农贸市场、逛、爱、变化、美、生活。 个人对算法示例结果评价:具体某些场合可能会好于传统算法,该例子也并不表明该算法明显优秀,例如个人觉得关键字《逛》很重要。 附《我爱逛农贸市场》 我/r 爱/v 逛/v 农贸市场/n 07-008-002/m 董/nr 其中/nr 07-008-003/m 近些年/t

文档评论(0)

1亿VIP精品文档

相关文档