数据挖掘经典算法大全.pptx

智慧IT数据挖掘经典算法大全技术创新,变革未来PCA降维朴素贝叶斯分类 K-近邻算法234数据挖掘经典算法逻辑回归1EM算法7支持向量机8K均值聚类5决策树6K-均值聚类-简介 从无标签数据中组织数据的结构,从而对样本进行分组,是无监督学习的一种常用聚类方法。聚类示例将无标签的数据集分成两组????输入数据不含任何标签将相似的样本划分为一个组K-均值聚类-简介原始数据集划分为4个簇划分为2个簇K-均值聚类-原理 K-means聚类算法流程可以分为四个步骤,需要注意几点:距离度量:欧氏距离、余弦相似度等质心计算:样本均值第1步. 从数据中随机选择K个对象作为初始聚类中心;第2步.计算每个聚类对象到聚类中心的距离来划分K个簇;第3步.计算每个簇的质心作为新的聚类中心;第4步.重复步骤2、3,直到达到最大迭代次数,最后所有样本被分为K个簇。K-均值聚类-原理 K如何选择?K的选择一般是按照实际需求进行决定,或在实现算法时直接给定K值 。 距离度量给定样本 ,常用的距离与度量有以下三种:闵可夫斯基距离(Minkowski distance):欧氏距离(Euclidean distance):即当 p=2 时的闵可夫斯基距离曼哈顿距离(Manhattan distance):即当 p=1 时的闵可夫斯基距离 更新“簇中心”对于划分好的各个簇,计算各个簇中的样本点均值,将其均值作为新的簇中心。

文档评论(0)

1亿VIP精品文档

相关文档