数学建模的数据挖掘方法.pptVIP

  • 47
  • 0
  • 约1.28万字
  • 约 94页
  • 2019-06-30 发布于安徽
  • 举报
对于待分类样本: 分别计算以下两个概率: =0.333*0.22*0.33*0.3*0.643=0.0053 =0.4*0.4*0.8*0.6*0.357=0.0274 ,因此 为第二类,即不适合比赛。 情形2. 第j个属性Aj为连续型 的情况 tid 有房 婚姻状况 年收入 拖欠贷款 1 是 单身 125 否 2 否 已婚 100 否 3 否 但是 70 否 4 是 已婚 120 否 5 否 离婚 95 是 6 否 已婚 60 否 7 是 离婚 220 否 8 否 单身 85 是 9 否 已婚 75 否 10 否 单身 90 是 考虑如下的训练样本集,如何判别样本 的类别? 属性“年收入”为连续型数据类型,此时如果再用公式 来估计条件概率已不合适,例如,若新样本的“年收入”为110K,则 类似的新样本将无法判别。 有两种策略可以用了估计连续型属性的条件概率: 1.把连续属性离散化;2.用概率分布来估计条件概率 1.把连续属性离散化 如前面构造决策树的Gini Index或信息增益方法,把连续属性划分成几个区间,即连续属性离散化。按前面所述,如果把“年收入”划分成两个区间,则最佳的候选划分点为97K,对应区间为 (0,97)和[97,10000)。通过计算类 Ci中属性“年收入”落入对应区间的比例来估计条件概率 即把训练数据集修改为下表 tid 有

文档评论(0)

1亿VIP精品文档

相关文档