基于随机森林文本分类探究.docxVIP

  • 1
  • 0
  • 约2.17千字
  • 约 5页
  • 2019-07-17 发布于广东
  • 举报
基于随机森林文本分类探究 摘要:文本分类是处理和组织大量文本数据的关键 技术,它一直是信息检索领域中的一个研究热点。文本分类 旨在将大量文本划分到若干子类,使得各文本子类代表不同 的概念主题。文章采用了一种基于随机森林的文本分类方 法。该方法来源于基于决策树的机器学习,依据文本内容的 分词结果进行机器学习,将文本中信息量高的词汇提取出来 作为学习维度,可以准确地对文本进行分类。由于随机森林 算法[1]具有高并发,快速收敛的优点,非常适合海量数据 的处理。 关键词:决策树分类;机器学习;森林 1问题分析和算法描述 随机森林可以看成是Bagging和随机子空间的结合。随 机森林是由一系列的分类器组合在一起进行决策[2],期望 得到一个最“公平”的学习方法。如图1所示,构造每一个 分类器需要从原数据集中随机抽取出一部分样本作为样本 子空间,然后再从样本子空间中随机的选取一个新的特征子 空间[4],在这个新空间中建立决策树作为分类器,最后通 过投票的方法得到最终决(如图1)。 图1 1. 1构建单棵决策树 (1) 对于训练集S,如果训练集数据都属于一个类标签 C,或S足够纯净(85%以上的数据都属于类标签C时),否 则创建叶子节点,表明类标签C。 (2) 否则, ?选择“最具有信息”的属性A: ?依据A来划分训练集S; ?递归的划分训练集来构造子树。 1.2构建随机森林 ?从原始数据中产

文档评论(0)

1亿VIP精品文档

相关文档