第三讲(数据预处理).pptVIP

  1. 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
  2. 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  3. 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  4. 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  5. 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  6. 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  7. 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
选样——聚类/分层选样 原始数据 聚类/分层选样 离散化与概念分层生成 (数据规约中重要的方法之一) 数据离散化 三种类型的属性值可以离散化: 名称型——e.g. 无序集合中的值 序数——e.g. 有序集合中的值 连续值——e.g. 实数 离散化(使数据有限或者数目减少) 将连续属性的范围划分为区间从而减少所必须处理的数据量 应用举例:有效的规约数据 基于判定树的分类挖掘(离散化的有效应用) 离散化的数值用于进一步分析 离散化和概念分层 离散化 通过将属性域划分为区间,减少给定连续属性值的个数。区间的标号可以代替实际的数据值。 概念分层 通过使用高层的概念(比如:青年、中年、老年)来替代底层的属性值(比如:实际的年龄数据值)来规约数据 注意:离散化后数据细节会丢失,然而越概化越高层的数据越有助于数据挖掘,对人的理解越有意义。 数据数值的离散化和概念分层生成 分箱(binning) 分箱技术递归的用于结果划分,可以产生概念分层。 直方图分析(histogram) 直方图分析方法递归的应用于每一部分,可以自动产生多级概念分层。 聚类分析 将数据划分成簇,每个簇形成同一个概念层上的一个节点,每个簇可再分成多个子簇,形成子节点。 基于熵的离散化(统计学角度) 通过自然划分分段 通过自然划分分段 将数值区域划分为相对一致的、易于阅读的、看上去更直观或自然的区间。 自然划分的3-4-5规则: 如果一个区间最高有效位上包含3,6,7或9个不同的值,就将该区间划分为3个等宽子区间(将7划分为?); 如果一个区间最高有效位上包含2,4,或8个不同的值,就将该区间划分为4个等宽子区间(将2划分为?); 如果一个区间最高有效位上包含1,5,或10个不同的值,就将该区间划分为5个等宽子区间(将1划分为?); 将该规则递归的应用于每个子区间 对于数据集中出现的最大值和最小值的极端分布,为了避免上述方法出现的结果扭曲,可以在顶层分段时,选用一个大部分的概率空间,仅在该大概率空间进行自然划分。e.g. 5%-95% 3-4-5规则——例子 (-$400,$5,000) (-$400 ,0) (-$400 - -$300) (-$300 - -$200) (-$200 - -$100) (-$100 - 0) (0 ,$1,000) (0 - $200) ($200 - $400) ($400 - $600) ($600 - $800) ($800 - $1,000) ($2,000 ,$5, 000) ($2,000 - $3,000) ($3,000 - $4,000) ($4,000 - $5,000) ($1,000 ,$2, 000) ($1,000 - $1,200) ($1,200 - $1,400) ($1,400 - $1,600) ($1,600 - $1,800) ($1,800 - $2,000) msd=1,000 Low=-$1,000 High=$2,000 第二步 第四步 第一步 -$351 -$159 profit $1,838 $4,700 Min Low (i.e, 5%-tile) High(i.e, 95%-0 tile) Max count (-$1,000 ,$2,000) (-$1,000 , 0) (0 ,$ 1,000) 第三步 ($1,000 , $2,000) 分类数据的概念分层生成 分类数据是指无序的离散数据,它有有限个值(可能很多个)。 分类数据的概念分层生成方法: 由用户或专家在模式级显式的说明属性的部分序。 通过显示数据分组说明分层结构的一部分。 说明属性集,但不说明它们的偏序(属性间包含关系),然后系统根据算法自动产生属性的序,构造有意义的概念分层。 对只说明部分属性集的情况,则可根据数据库模式中的数据语义定义对属性的捆绑信息,强制要求其他属性伴随出现,以此来恢复相关的属性。 如:streetcityprovincecountry 属性集的规格 根据在给定属性集中,每个属性所包含的不同值的个数,可以自动的生成概念分成。 依据:不同值个数最多的属性将被放在概念分层的最底层。 country province city street 5个不同值 65 个不同值 3567 个不同值 674,339 个不同值 * 数据挖掘的实践中,使用离散化进行数据规约主要是适用于以下三类属性值…,连续值(比如实数),如果不使用离散化

文档评论(0)

ma982890 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档