数据挖掘原理与应用——以石油勘探开发为例 课件 3.2 数据预处理概述.pptxVIP

  • 1
  • 0
  • 约1.35千字
  • 约 9页
  • 2026-07-17 发布于山东
  • 举报

数据挖掘原理与应用——以石油勘探开发为例 课件 3.2 数据预处理概述.pptx

3.2预处理概述

预处理概述一、预处理的必要性现实世界的数据是“脏的”不完整(incomplete)缺少数据值;缺乏某些重要属性;仅包含汇总数据有噪声(noisy)包含错误或者孤立点(outliers)数据不一致(inconsistent)e.g.,在编码或者命名上存在差异e.g.,Age=“42”Birthday=“03/07/1976”冗余(Redundant)太多数据或数据太多特征

预处理概述1.数据不一致如性别:A数据库male=1,female=2B数据库male=‘男’,female=‘女’C数据库male=‘M’,female=‘F’

预处理概述2.重复性(DuplicateData)-冗余的一种同一客观事物在数据库中存在两个以上的不同描述。假设某周刊有100000个订户,邮件列表中0.1%的记录是重复的,主要是一个名字有不同的写法:JonDoe和JohnDoe因此,每周需要印刷和邮寄100份额外的刊物,假设每周的邮寄和印刷费用是两元,公司每年将浪费10000元以上。

预处理概述3.不完整性

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档