BIRCH算法精选.pptVIP

  • 9
  • 0
  • 约1.66千字
  • 约 14页
  • 2016-12-02 发布于湖北
  • 举报
BIRCH An Efficient Data Clustering Method for Very Large Databases 一种对大型数据库有效的 聚类方法 主讲人:常贺 * 基本概念 聚类分析 是一个把数据对象(或观测)划分成子集的过程 簇 每个子集就是一个簇 聚类 由聚类分析产生的簇的集合称作一个聚类 层次聚类方法 将数据对象组成层次结构或簇的“树” 聚类特征 CF-树 * 聚类特征 聚类特征(Clusting Feature)是一个3维向量。对一个聚类中的所有d维数据对象 聚类的聚类特征的向量值定义为一个三元组的形式: CF=(n,LS,SS) 其中n为聚类中数据对象的数目。 LS为n个数据对象的线性和。 SS为n个数据对象的平方和。 * CF树 * * CF累加性定理 假设 和 为个不相交的聚类的CF向量。 合并这两个聚类为一个聚类是,那么新聚类的CF向量值为: * CF-树的创建过程 CF树的构造过程实际是一个数据对象的插入过程, 步骤: (1)找到恰当的叶子节点:从根结点开始递归往下,计算当前节点实体与要插入的数据对象之间的距离 ,寻找距离最小的那个路径,

文档评论(0)

1亿VIP精品文档

相关文档