(数据挖掘原理、算法及应用)第3章关联规则挖掘.ppt

(数据挖掘原理、算法及应用)第3章关联规则挖掘.ppt

3.1 基 本 概 念   交易数据库又称为事务数据库, 尽管它们的英文名词一样, 但是事务数据库更具有普遍性。例如,病人的看病记录、基因符号等用事务数据库更贴切。因此,下面的叙述更多使用事务数据库这一名词,而不用交易数据库这个名词。 3.2 关联规则挖掘算法 3.2.1 项目集空间理论   Agrawal等人建立了用于事务数据库挖掘的项目集空间理论。理论的核心为:频繁项目集的子集仍是频繁项目集; 非频繁项目集的超集是非频繁项目集。 这个理论一直作为经典的数据挖掘理论被应用。 3.3 Apriori改进算法 3.3.1 Apriori算法的瓶颈   Apriori作为经典的频繁项目集生成算法, 在数据挖掘中具有里程碑的作用。 但是随着研究的深入, 它的缺点也暴露出来。 Apriori算法有两个致命的性能瓶颈。   (1) 多次扫描事务数据库,需要很大的I/O负载。对每次k循环,候选集Ck中的每个元素都必须通过扫描一次数据库来验证其是否加入Lk。假如一个频繁大项目集包含10个项, 那么就至少需要扫描事务数据库10遍。 3.4 不候选产生挖掘频繁项集   频繁模式增长(FrequentPattern Growth),或简称FP增长,试图设计一种方法,挖掘全部频繁项集而不产生候选。 它采取如下分治策略: 首先, 将提供频繁项的数据库压缩到一棵频繁模式树(或FP树

文档评论(0)

1亿VIP精品文档

相关文档