数据挖掘第一与第二章.ppt

2020 年 4 月 5 日星期日 数据挖掘导论 63 特征构造 ? 原始数据集的特征具有必要的信息,但其形式 不适合数据挖掘算法 ? 由原特征构造的新特征可能比原特征更有用 ? 例 : 文物数据库 – 每件文物的特征包括 : 体积和质量,以及其他信息 – 文物材质 ( 类 ): 木材、陶土、青铜、黄金 – 原特征不适合分类 – 构造新特征 : 密度 = 质量 / 体积 2020 年 4 月 5 日星期日 数据挖掘导论 64 离散化和二元化 ? 为什么要离散化 / 二元化 – 减少属性值个数,便于挖掘,结果使知识表达更简 洁、更易于理解、更易使用 – 离散化产生概念分层结构,可以在不同抽象层进行 挖掘 – 有些算法需要离散属性 – 有些算法需要二元属性 ? 非监督 vs 监督离散化 – 差别:是否使用类信息 2020 年 4 月 5 日星期日 数据挖掘导论 65 离散属性二元化 1 ? 方法 1 – 如果属性具有 m 个值,则将每个原始值唯一地映射到区 间 [0, m ? 1] 中的一个整数 ( 保序 ) – 把 m 个整数都变换成一个二进制数 ? 需要 n = ? log2 m ? 个二进位表示这些整数 – 用 n 个二元属性表示这些二进制数 – 例 : 5 个值 { awful , poor , OK , good , great } 的分类变量需要 三个二

文档评论(0)

1亿VIP精品文档

相关文档