文本分类技术的研究.pdfVIP

  • 6
  • 0
  • 约6.41万字
  • 约 66页
  • 2015-08-05 发布于河南
  • 举报
文本分类技术的研究.pdf

摘要 摘要 文本分类是文本挖掘的重要分支,在当今的信息时代文本自动分类已成为一 项具有较大实用价值的关键技术,是组织和管理数据的有力手段,已经被应用于 抽取符号知识、新闻分发、排序电子邮件、学习用户兴趣以及信息过滤等许多方 面。 首先,本文着重介绍了自动文本分类技术中常用的基于向量空间模型的特征 选取方法和分类模型。基于对这些技术的分析,本文提出了一种基于正负权重的 M1分类方法,该方法采用MI特征选取方法以局部特征选取方式进行特征选取, 每一个类别得到不同的特征子集,并利用得到的特征互信息值构造特征的正、负 权重并形成类别的正、负原型向量。这种方法训练效率高,实验结果也表明该方 法也有比较好的分类性能。 另外,利用自动文本分类系统中已经实现了多种分类模型的特点,本文对多 分类器的组合问题进行了研究,并实现了利用贝叶斯理论进行组合的多分类器, 将之应用于自动文本分类。从实验结果来看,这种多分类器在

文档评论(0)

1亿VIP精品文档

相关文档