第七章决策树.pptxVIP

  • 5
  • 0
  • 约5.6千字
  • 约 37页
  • 2021-06-04 发布于河北
  • 举报
第七章 决策树和决策规则;决策树和决策规则是解决实际应用中分类问题的数据挖掘方法。 一般来说,分类是把数据项映射到其中一个事先定义的类中的这样一个学习函数的过程。由一组输入的属性值向量(也叫属性向量)和相应的类,用基于归纳学习算法得出分类。 学习的目标是构建一个分类模型,通常也叫分类器。它可以根据有效的属性输入值预测一些实体(所给样本)的类。是一个在样本其他属性已知的情况下预测另外一个属性(样本的类)的模型(分类的结果)。;7.1 决策树;图7-2是一个简单的决策树。该问题有两个属性X,Y。所有属性值X1和YB的样本属于类2。不论属性Y的值是多少,值X 1的样本都属于类1。;对于树中的非叶节点,可以沿着分枝继续分区样本,每一个节点得到它相应的样本子集。 生成决策树的一个著名的算法是Quinlan的ID3算法,C4.5是它改进版。;ID3算法的基本思路: 从树的根节点处的所有训练样本开始,选取一个属性来划分这些样本。对属性的每一个值产生一分枝。分枝属性值的相应样本子集被移到新生成的子节点上。 这个算法递归地应用于每个子节点,直到一个节点上的所有样本都分区到某个类中。 到达决策树的叶节点的每条路径表示一个分类规则。;该算法的关键性决策是对节点属性值的选择。ID3和C4.5算法的属性选择的基础是基于使节点所含的信息熵最小化。 基于信息论的方法坚持对数据库中一个样本进行分类时所做检验的数量

文档评论(0)

1亿VIP精品文档

相关文档