- 11
- 0
- 约 19页
- 2017-06-02 发布于湖北
- 举报
数据的预处理和后处理 第五章 5.1 数据预处理的内涵 数据集的准备和变换是数据挖掘过程最重要的步骤之一; 原始数据很难直接用于数据挖掘; 文献中通常不被重视; 应用中需花费大量时间和精力; 可看做是与挖掘相独立的过程; 数据收集 预处理 挖掘 后处理 结果解释 5.2 数据预处理的步骤 对象表示 属性:对象的形式化描述 分类 离散型(符号的、标称的、分类的) 连续型(连续的) 结构型(复合的) 对象收集和映射 确定属性的名称和取值范围 5.2 数据预处理的步骤 缩放大型数据集 处理大型数据库 算法仅假定数据均存在主存中 调度方法: 窗口式(顺序) 批量式(按某一属性提取) 增量式(减轻模型建立的负担) 5.2 数据预处理的步骤 噪声和错误 外部错误:随机错误和噪声(干扰) 内部错误:算法精度和实用性 未知属性值 未知或缺失的属性值 来源: 收集过程中被遗忘或丢失 不适当的或不存在的(混合类型的对象,煤、天然气) 不相关属性(研究问题的不同,喜好、支出情况) 数据库设计缺陷(未对某属性进行设定) 5.2 数据预处理的步骤 数据离散化 某些算法仅处理分类数据:将数据划分成几个类 处理连续值 某些算法仅能处理离散值:划分 属性值分类:划分 属性选择和定序:剔除无关属性 属性变换:简化数据量和便于计算 检验:一致性、合理性 5.3 离散化方法 离散化:将连续变量划分成不同类别 划分方
原创力文档

文档评论(0)