基于信息理论的聚类.pptxVIP

  • 5
  • 0
  • 约3.67千字
  • 约 23页
  • 2019-08-27 发布于福建
  • 举报
基于信息理论的协同聚类江南大学-许鹏江南大学-数字媒体技术学院-软件工程摘要1. 基于信息理论的聚类原理2. 用于此算法的文本数据集3. 用于此算法的图像数据集4. 图像SIFT特征描述子构造1. 基于信息理论的聚类原理BoW 文本数据BoW 图像数据超市购物篮数据共现矩阵数据二维列联表数据co-clustering:simultaneous clustering of the rows and columns当面对这样的数据时:可以将归一化的非负数据矩阵看作是两个随机变量的经验联合概率分布,然后把聚类问题看作是信息论里面的一个优化问题,即最小化聚类前后的互信息损失,这个算法对于高维,稀疏数据尤其有效。1. 基于信息理论的聚类原理??random variable: ??random variable:?????1. 基于信息理论的聚类原理?这里其实就是行和列聚类的划分函数随机变量包含随机变量信息量的最常用的度量方式就是互信息。这里通过如下的方式来判断协同聚类的质量。?co_clustering??minimize?1. 基于信息理论的聚类原理??按这种方式聚类以后互信息的损失值为0.0957,任何其他聚类方式的互信息损失都要比当前方式大。2. 文本数据集-bag of wordsA bag of words is a sparse, high dimensional vecto

文档评论(0)

1亿VIP精品文档

相关文档