第四章数据预处理.ppt

第四章 数据预处理;*;数据挖掘: 数据库中的知识挖掘(KDD); 第 4 章;*;1)杂乱性:如命名规则的不同 如性别: A数据库 male=1 , female=2 B数据库 male=‘男’ ,female=‘女’ C数据库 male=‘M’ , female=‘F’;2)重复性:同一客观事物在数据库中存在两个以上相同的物理描述。 假设某周刊有100000个订户,邮件列表中0.1%的记录是重复的,主要是因为同一个客户的名字可能有不同的写法,如:Jon Doe和John Doe。 因此,每周需要印刷和邮寄100份额外的刊物,假设每份刊物每周的邮寄和印刷费用是两美元,公司每年将至少浪费1万美元以上。 ;3)不完整性:由于实际系统设计时存在的缺陷以及使用过程中的一些人为因素,数据记录可能会出现数据值的丢失或不确定。 原因可能有: (1)有些属性的内容有时没有 (家庭收入,参与销售事务数据中的顾客信息) (2)有些数据当时被认为是不必要的 (3)由于误解或检测设备失灵导致相关数据没有记录下来 (4)与其它记录内容不一致而被删除

文档评论(0)

1亿VIP精品文档

相关文档