基于改进聚类算法的数据挖掘系统的研究与实现-计算机技术专业论文.docxVIP

  • 11
  • 0
  • 约6.27万字
  • 约 85页
  • 2019-02-20 发布于上海
  • 举报

基于改进聚类算法的数据挖掘系统的研究与实现-计算机技术专业论文.docx

万方数据 万方数据 摘 要 摘 要 聚类之于数据挖掘就是对数据集中的数据应用某种方法进行分组,把具有相 似性质的事情区分加以分类。聚类算法在数据挖掘算法中占有重要的一席之地, 它被广泛的应用于各个领域,例如模式识别,模糊控制等等,因此越来越多的聚 类方式被提出和深入研究。聚类算法通常被分为 5 类,有基于层次的聚类,基于 划分的聚类,基于密度的聚类,基于模糊的聚类。 模糊 K-Means 聚类算法于 1981 年由 Beadek 提出,它是一个基于划分的聚类 算法,因为其效率高,可扩展性强,收敛速度快,被广泛的应用在数据挖掘中。 但是算法中也存在一些问题:聚类中心的选择,和假定各维特征权值相同。 在本文中,提出了一种改进的模糊 K-Means 算法。初始聚类中心的选择基于 平均距离,算法主体加入了权重的思想,权重代表不同维度对划分的贡献不同, 它考虑到整个数据集,数据的一个维度(属性值)的权值可以被当做对分类的贡 献大小,贡献大的属性权值较大,反之较小。权重可以加快聚类过程,并得到更 好的聚类结果。 BIRCH 算法是一种基于层次的聚类算法。它利用聚类特征(Clustering Feature, CF),和聚类特征树(CF Tree)两个概念来描述算法过程。文章里分析了 BIRCH 算 法的存在的一些问题,提出了基于密度和动态阈值的任意形状的聚类算法。算法 将密度和阈值综合考虑,并

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档