关于Weka的数据关联规则分析实验.docVIP

  • 221
  • 0
  • 约2.76千字
  • 约 3页
  • 2020-11-27 发布于浙江
  • 举报
关于Weka的数据关联规则分析实验 班级 市场091 姓名 杨超 学号 200916012106 实验基本原理及目的 关联规则的定义   假设I是项的集合。给定一个交易数据库,其中每个事务(Transaction)t是I的非空子集,即,每一个交易都与一个唯一的 标识符TID(Transaction ID)对应。关联规则在D中的支持度(support)是D中事务同时包含X、Y的百分比,即 概率;置信度(confidence)是包含X的事务中同时又包含Y的百分比,即 条件概率。关联规则是有趣的,如果满足最小支持度阈值和最小置信度阈值。这些阈值是根据挖掘需要人为设定。 在本实验中,我们对前面的““bank-data-final.arff””作关联规则分析,使用Apriori算法。下面我们简单描述一下Apriori算法的步骤。 这个算法先把数据库从逻辑上分成几个互不相交的块,每次单独考虑一个分块并对它生成所有的频集,然后把产生的频集合并,用来生成所有可能的频集,最后计算这些项集的支持度。这里分块的大小选择要使得每个分块可以被放入主存,每个阶段只需被扫描一次。而算法的正确性是由每一个可能的频集至少在某一个分块中是频集保证的。该算法是可以高度并行的,可以把每一分块分别分配给某一个处理器生成频集。产生频集的每一个循环结束后,处理器之间进行通信来产生全局的候选k-项集。 本次实验

文档评论(0)

1亿VIP精品文档

相关文档