- 18
- 0
- 约5.77千字
- 约 6页
- 2021-01-29 发布于天津
- 举报
foreign workers
数据挖掘实例
数据挖掘实例
目的:
给定某些属性,判断某贷款顾客的可信性 ( 即 good/bad 状况 ) 。
简单思路:该数据包含了 666 条贷款顾客的历史数据和 21 个属性。但是我们认为,这 21 个属性不都能够有效地帮助我们判断顾客的可行性,所以我们首先把一些比较不相关的属性去掉。接下来,我们再用聚类方法帮助我们把带有
连续变量的属性离散化。做完预处理后我们再从中找出对有参考价值的关联规则。
基本步骤:
去掉多余属性
关联规则的随机性该数据里有一布尔属性 foreign workers ,取值为 yes
或 no。我们发现,其中取值为 yes 的元组占了所有元组的 96%。置信度其实代表了一种条件概率,它无法判断两个属性之间是否带有随机性。因此,带有
的关联规则无法提供我们更多可以参考的信息。
χ2 依赖性检验首先,我们利用 χ2- 检验试探各属性 (Duration in
months,Credit Amount 及 Age in years 除外 ) 与good/bad 属性之间是否
存有依赖性。
以下以 Credit History 为例描述算法:
Credit HistoryBadGood All Paid Duly 171027 Bank Paid Duly 181735 CriticalDelay 1740
原创力文档

文档评论(0)