2-dtree-决策树.pptVIP

  • 5
  • 0
  • 约8.96千字
  • 约 71页
  • 2016-10-21 发布于贵州
  • 举报
2-dtree-决策树

* Guilin * 举例说明(用分类误差计算概率) 计算训练数据集合的不纯度的第三个方法是采用分类误差(classification error) 已知p(Bus) = 0.4, p(Car) = 0.3和p(Train) = 0.3,分类误差值的计算如下: Classification_Error = 1 – Max{0.4, 0.3, 0.3} = 1 - 0.4 = 0.60 * Guilin * 分类误差的性质 与熵和Gini索引一样,一个纯的训练数据集合(只有一个类)的分类误差值是0,这是因为概率1的分类误差值是1-max(1) = 0 分类误差值总是在0和1之间 对于给定类的个数, Gini索引的最大值总是与分类误差的最大值相等 设每个类的概率为p=1/n,Gini索引的最大值是1-n*(1/n)^2 = 1-1/n,而分类误差的最大值也是1-max{1/n} =1-1/n * Guilin * 决策树算法的运行方式 这里解释决策树算法的运行方式 设一个训练数据集合D有多个属性和一个类属性 对于D,取出每个属性和类属性形成一个子集合 如果有m个属性,我们就从D构造出m个子集合 设第i个属性的子集合为Si 这里,D 是Si的父亲 * Guilin * 举例说明(训练数据) Attributes Classes Gender Car ownership Tra

文档评论(0)

1亿VIP精品文档

相关文档