决策树算法解析与应用实战.pptVIP

  • 2
  • 0
  • 约3.43千字
  • 约 43页
  • 2026-07-30 发布于江苏
  • 举报

第二章决议树;为处理上述问题必须进行分类

分类是数据挖掘中的一种主要分析手段

分类的任务是对数据集进行学习并结构一种拥有预测功效的分类模型,用于预测未知样本的类标号,如:

依据瓦斯状态、开采技术条件、煤层赋存情况等对危险进行分类评估

依据核磁共振的成果辨别肿瘤是恶性还是良性的

依据星系的形状对它们进行分类

划分出交易是合法或欺诈

将新闻分类金融、天气、娱乐体育等

;举例说明分类任务;有房;婚姻情况;有房;有房;有房;有房;有房;有房;;有房;婚姻情况;;有房;申请模型到测试数据;有房;有房;有房;有房;举例说明分类任务;决议树在构建过程中需重点处理2个问题:

(1)怎样选择合适的属性作为决议树的节点去划分训练样本;

(2)怎样在合适位置停止划分过程,从而得到大小合适的决议树。

虽然能够采用任何一种属性对数据集进行划分,但最后形成的决议树会差别很大。需要寻找合适的属性选择方法。

属性选择是决议树算法中主要的环节,常见的属性选择标准涉及信息增益(informationgain)和Gini系数。

信息增益是决议树常用的分枝准则,在树的每个结点上选择含有最高信息增益的属性作为目前结点的划分属性。

Gini系数是一种不纯度函数,用来度量数据集的数据关于类的纯度。;二、DI3分类算法;熵(entropy,也称信息熵)用来

文档评论(0)

1亿VIP精品文档

相关文档