第三讲(数据预处理).pptVIP

  • 26
  • 0
  • 约9.05千字
  • 约 39页
  • 2018-07-12 发布于上海
  • 举报
选样——聚类/分层选样 原始数据 聚类/分层选样 离散化与概念分层生成 (数据规约中重要的方法之一) 数据离散化 三种类型的属性值可以离散化: 名称型——e.g. 无序集合中的值 序数——e.g. 有序集合中的值 连续值——e.g. 实数 离散化(使数据有限或者数目减少) 将连续属性的范围划分为区间从而减少所必须处理的数据量 应用举例:有效的规约数据 基于判定树的分类挖掘(离散化的有效应用) 离散化的数值用于进一步分析 离散化和概念分层 离散化 通过将属性域划分为区间,减少给定连续属性值的个数。区间的标号可以代替实际的数据值。 概念分层 通过使用高层的概念(比如:青年、中年、老年)来替代底层的属性值(比如:实际的年龄数据值)来规约数据 注意:离散化后数据细节会丢失,然而越概化越高层的数据越有助于数据挖掘,对人的理解越有意义。 数据数值的离散化和概念分层生成 分箱(binning) 分箱技术递归的用于结果划分,可以产生概念分层。 直方图分析(histogram) 直方图分析方法递归的应用于每一部分,可以自动产生多级概念分层。 聚类分析 将数据划分成簇,每个簇形成同一个概念层上的一个节点,每个簇可再分成多个子簇,形成子节点。 基于熵的离散化(统计学角度) 通过自然划分分段 通过自然划分分段 将数值区域划分为相对一致的、易于阅读的、看上去更直观或自然的区间。 自然划分的3-4-5规则

文档评论(0)

1亿VIP精品文档

相关文档