第2章数据挖掘 课件.pptVIP

  • 12
  • 0
  • 约8.88千字
  • 约 63页
  • 2017-09-05 发布于江苏
  • 举报
上次课的内容: 绪论 什么是数据挖掘? 什么激发了数据挖掘? 数据库查询与数据挖掘查询的区别 数据库中知识发现与数据挖掘的关系? 数据挖掘的主要问题 数据挖掘的主要功能 概念/类描述:特征化和区分 关联分析 分类和预测 聚类分析 孤立点分析 演变分析 5.数据预处理 为什么要预处理数据? 数据清理 数据集成 数据变换 数据归约 数据离散化 为什么要预处理数据? 现实世界的数据是“肮脏的”——数据多了,什么问题都会出现 不完整的:有些感兴趣的属性缺少属性值,或仅包含聚集数据 含噪声的:包含错误或者“孤立点” 不一致的:在编码或者命名上存在差异 没有高质量的数据,就没有高质量的挖掘结果 高质量的决策必须依赖高质量的数据 数据仓库需要对高质量的数据进行一致地集成 数据质量的多维度量 一个广为认可的多维度量观点: 精确度 完整度 一致性 可信度 附加价值 可访问性 …… 跟数据本身的含义相关的 内在的、上下文的、表象的 数据预处理的主要任务 数据清理 填写空缺的值,平滑噪声数据,识别、删除孤立点,解决不一致性 数据集成 集成多个数据库、数据立方体或文件 数据变换 规范化和聚集 数据归约 得到数据集的压缩表示,它小得多,但可以得到相同或相近的结果 数据离散化 数据归约的一部分,通过概念分层和数据的离散化来规约数据,对数字型数据特别重要 数据预处理 为什么要预处理数据?

文档评论(0)

1亿VIP精品文档

相关文档