- 29
- 0
- 约9.13千字
- 约 7页
- 2020-08-27 发布于浙江
- 举报
程伟
基于机器学习算法的文本分类方法综述
摘要:文本分类是机器学习领域新的研究热点。基于机器学习算法的文本分类方法比传
统的文本分类方法优势明显。本文综述了现有的基于机器学习的文本分类方法,讨论了各种
方法的优缺点,并指出了文本分类方法未来可能的发展趋势。
1.引言
随着计算机技术、数据库技术,网络技术的飞速发展,Internet 的广泛应用,信息交换
越来越方便,各个领域都不断产生海量数据,使得互联网数据及资源呈现海量特征,尤其是
海量的文本数据。如何利用海量数据挖掘出有用的信息和知识,方便人们的查阅和应用,已
经成为一个日趋重要的问题。因此,基于文本内容的信息检索和数据挖掘逐渐成为备受关注
的领域。文本分类(text categorization,TC)技术是信息检索和文本挖掘的重要基础技术,其
作用是根据文本的某些特征,在预先给定的类别标记(label)集合下,根据文本内容判定它的
类别。传统的文本分类模式是基于知识工程和专家系统的,在灵活性和分类效果上都有很大
的缺陷。例如卡内基集团为路透社开发的Construe 专家系统就是采用知识工程方法构造的
一个著名的文本分类系统,但该系统的开发工作量达到了10 个人年,当需要进行信息更新
时,维
原创力文档

文档评论(0)