基于机器学习的文本分类方法.pdfVIP

  • 29
  • 0
  • 约9.13千字
  • 约 7页
  • 2020-08-27 发布于浙江
  • 举报
程伟 基于机器学习算法的文本分类方法综述 摘要:文本分类是机器学习领域新的研究热点。基于机器学习算法的文本分类方法比传 统的文本分类方法优势明显。本文综述了现有的基于机器学习的文本分类方法,讨论了各种 方法的优缺点,并指出了文本分类方法未来可能的发展趋势。 1.引言 随着计算机技术、数据库技术,网络技术的飞速发展,Internet 的广泛应用,信息交换 越来越方便,各个领域都不断产生海量数据,使得互联网数据及资源呈现海量特征,尤其是 海量的文本数据。如何利用海量数据挖掘出有用的信息和知识,方便人们的查阅和应用,已 经成为一个日趋重要的问题。因此,基于文本内容的信息检索和数据挖掘逐渐成为备受关注 的领域。文本分类(text categorization,TC)技术是信息检索和文本挖掘的重要基础技术,其 作用是根据文本的某些特征,在预先给定的类别标记(label)集合下,根据文本内容判定它的 类别。传统的文本分类模式是基于知识工程和专家系统的,在灵活性和分类效果上都有很大 的缺陷。例如卡内基集团为路透社开发的Construe 专家系统就是采用知识工程方法构造的 一个著名的文本分类系统,但该系统的开发工作量达到了10 个人年,当需要进行信息更新 时,维

文档评论(0)

1亿VIP精品文档

相关文档