第3章关联规则挖掘理论和算法(new)浅析.ppt

基本概念与解决方法 经典的频繁项目集生成算法分析 Apriori算法的性能瓶颈问题 Apriori的改进算法 对项目集格空间理论的发展 关联规则挖掘中的一些更深入的问题 ;关联规则挖掘是数据挖掘研究的基础;事务数据库 ;支持度、频繁项目集、可信度、强关联规则 ;定义(规则的可信度) 一个定义在I和D上的形如 I1?I2 的关联规则通过满足一定的可信度(Confidence)来给出。所谓规则的可信度是指包含 I1 和I2的事务与包含 I1 的事务之比: Confidence(I1?I2)=|| Support(I1∪I2) / Support(I1) 其中I1 ,I2 ?I ; I1∩I2=? 定义(强关联规则)。D 在 I 上满足最小支持度和最小可信度的关联规则称为强关联规则。 通常所说的关联规则一般指上面定义的强关联规则。;关联规则挖掘基本过程;项目集格空间理论 ;经典的发现频繁项目集算法;Apriori-gen过程;;Apriori算法例子;关联规则的生成问题;算法-递归测试一个频集中的关联规则;Rule-generate算法例子;Apriori作为经典的频繁项目集生成算法,在数据挖掘中具有里程碑的作用。 Apriori算法有两个致命的性能瓶颈: 1.多次扫描事务数据库,需要很大的I/O负载 对每次k循环,侯选集Ck中的每个元素都必须

文档评论(0)

1亿VIP精品文档

相关文档