数据挖掘常用算法概述.pptVIP

  • 1
  • 0
  • 约1.12万字
  • 约 94页
  • 2022-09-21 发布于广东
  • 举报
其它分类方法 贝叶斯(Bayesian)分类 k-临近分类 基于案例的推理 遗传算法 粗糙集理论 模糊集方法 第62页,共94页。 分类的准确性:评估错误率 数据分区:训练-测试数据 将一个数据集合分成两个独立的数据集。例如:训练数据 (2/3), 测试数据(1/3) 通常应用于大量数据样本的数据集 交叉验证 将一个数据集合分成若干个子样本集 用k-1个子样本作为训练数据,1个子样本作为测试数据 每一个数据集合具有合适的宽度 第63页,共94页。 分类的准确性:混淆矩阵 混淆矩阵(confusion matrix )用来作为分类规则特征的表示,它包括了每一类的样本个数,包括正确的和错误的分类。 主对角线给出了每一类正确分类的样本的个数,非对角线上的元素则表示未被正确分类的样本个数 实际的类 预 测 的 类 A类 B类 C类 总计 A类 45 2 3 50 B类 10 38 2 50 C类 4 6 40 50 总计 59 46 45 150 3个类的混淆矩阵 第64页,共94页。 分类的准确性:收益图 ●查全率分析图: X轴:按离网倾向评分从大到小排序后的客户占目标客户人数的百分比; Y轴:前x%的客户中被准确预测为离网的客户占目标客户中离网总人数的百分比,即查全率。 ●Lift分析图: X轴:按离网倾向评分从大到小排序后的客户占目标客户人数的百分比; Y轴:命中

文档评论(0)

1亿VIP精品文档

相关文档