信息检索专业论文-聚类算法研究2.docVIP

  • 5
  • 0
  • 约3.14千字
  • 约 4页
  • 2018-11-19 发布于浙江
  • 举报
聚类算法研究 摘要 文本聚类分析又称群分析,它是研究(样品或指标)分类问题的一种统计分析方法。聚类分析内容非常丰富,有系统聚类法、有序样品聚类法、动态聚类法、模糊聚类法、图论聚类法、聚类预报法等。本文主要介绍。本文主要简单介绍聚类算法的应用方面。 关键词 文本聚类分析 算法 1 引 言 聚类(Cluster)分析是由若干模式(Pattern)组成的,通常,模式是一个度量(Measurement)的向量,或者是多维空间中的一个点。聚类分析以相似性为基础,在一个聚类中的模式之间比不在同一聚类中的模式之间具有更多的相似性。 本文主要分析文本聚类分析的算法的介绍,以及一些的简单应用。 2.?传统的文本聚类算法 ??传统的文本聚类算法分为以下几种 2.1?分割方法(partitioning?methods) 2.1.1?K-MEANS算法: 工作原理: 首先从n个数据对象任意选择?k?个对象作为初始聚类中心;而对于所剩下其它对象,则根据它们与这些聚类中心的相似度(距离),分别将它们分配给与其最相似的(聚类中心所代表的)聚类;然后再计算每个所获新聚类的聚类中心(该聚类中所有对象的均值);不断重复这一过程直到标准测度函数开始收敛为止。一般都采用均方差作为标准测度函数.?k个聚类具有以下特点:各聚类本身尽可能的紧凑,而各聚类之间尽可能的分开。? ?? 具体过程:   (1)选取k个对象作为

文档评论(0)

1亿VIP精品文档

相关文档