(数据挖掘原理、算法及应用)第4章分类和预测.ppt

(数据挖掘原理、算法及应用)第4章分类和预测.ppt

4.1 分类和预测的基本概念和步骤   银行贷款员需要分析数据,搞清楚哪些贷款申请者是“安全的”,银行的“风险”是什么。AllElectronics的市场经理需要数据分析,以便帮助他猜测具有某些特征的顾客是否会购买一台新的计算机。医学研究者希望分析乳腺癌数据,预测病人应当接受三种具体治疗方案中的哪一种。   数据分类是一个两步过程,如图4-1所示的贷款应用数据,第一步,建立描述预先定义的数据类或概念集的分类器。    图4-1 数据分类过程   由于提供了每个训练元组的类标号,这一步也称做监督学习(Supervised Learning),即分类器的学习在被告知每个训练元组属于哪个类的“监督”下进行。它不同于无监督学习 (Unsupervised Learning)(或称聚类),每个训练元组的类标号是未知的,并且要学习的类的个数或集合也可能事先不知道。   在第二步(如图4-1(b)所示),使用模型进行分类。首先评估分类器的预测准确率。如果使用训练集来测量分类器的准确率,则评估可能是乐观的,因为分类器趋向于过分拟合(overfit)该数据(即在学习期间,它可能并入了训练数据中的某些特殊的异常点,这些异常点不在一般数据集中出现)。    4.2 基于相似性的分类算法   基于相似性的分类算法的思路比较简单直观。假定数据库中的每个元组ti为数值向量,每个类用一

文档评论(0)

1亿VIP精品文档

相关文档