数据挖掘十大经典算法教程.docx

数据挖掘十大经典算法教程

数据挖掘十大经典算法 ?一、 C4.5?? C4.5算法是机器学习算法中的一种分类决策树算法,其核心算法是ID3 算法. ? C4.5算法继承了ID3算法的优点,并在以下几方面对ID3算法进行了改进:?? 1) 用信息增益率来选择属性,克服了用信息增益选择属性时偏向选择取值多的属性的不足;?? 2) 在树构造过程中进行剪枝;?? 3) 能够完成对连续属性的离散化处理;?? 4) 能够对不完整数据进行处理。?? C4.5算法有如下优点:产生的分类规则易于理解,准确率较高。其缺点是:在构造树的过程中,需要对数据集进行多次的顺序扫描和排序,因而导致算法的低效。 1、机器学习中,决策树是一个预测模型;他代表的是对象属性与对象值之间的一种映射关系。树中每个节点表示某个对象,而每个分叉路径则代表的某个可能的属性值,而每个叶结点则? 对应从根节点到该叶节点所经历的路径所表示的对象的值。决策树仅有单一输出,若欲有复数输出,可以建立独立的决策树以处理不同输出。?? 2、 从数据产生决策树的机器学习技术叫做决策树学习, ?通俗说就是决策树。?? 3、决策树学习也是数据挖掘中一个普通的方法。在这里,每个决策树都表述了一种树型结构,他由他的分支来对该类型的对象依靠属性进行分类。每个决策树可以依靠对源数据库的分割? 进行数据测试。这个过程可以递归式的对树进行修剪。当不能再进行分割或一个单独的类可以被应用于某

文档评论(0)

1亿VIP精品文档

相关文档