信息检索专业论文-聚类算法研究.docVIP

  • 5
  • 0
  • 约7.45千字
  • 约 7页
  • 2018-11-11 发布于浙江
  • 举报
聚类算法研究 摘要 聚类分析源于许多研究领域,包括数据挖掘、统计学、机器学习、模式识别等。作为一个数据挖掘中的一个功能,聚类分析能作为一个独立的工具来获得数据分布的情况,并且概括出每个簇的特点,或者集中注意力对特定的某些簇做进一步地分析。一个好的聚类方法要能产生高质量的聚类结果——簇,这些簇要具备以下两个特点:高的簇内相似性和低的簇间相似性。聚类结果的好坏不仅取决于该聚类方法采用的相似性评估方法以及该方法的具体实现,还取决于该方法是否能发现某些还是所有的隐含模式。 关键词 聚类分析 数据挖掘 孤立点 聚类 算法 1 引 言 聚类[1]是人类一项最基本的认识活动。通过适当聚类,事物才便于研究,事物的内部规律才可能为人类所掌握。所谓聚类就是按照事物的某些属性,把事物聚集成类,使类间的相似性尽可能小,类内相似性尽可能大。聚类是一个无监督的学习过程,它同分类的根本区别在于:分类是需要事先知道所依据的数据特征,而聚类是要找到这个数据特征,因此,在很多应用中,聚类分析作为一种数据预处理过程,是进一步分析和处理数据的基础。例如在商务中,聚类分析能够帮助市场分析人员从客户基本库中发现不同的客户群,并且用购买模式来刻画不同的客户群的特征。在生物学中,聚类分析能用于推导植物和动物的分类,对基因进行分析,获得对种群中固有结构的认识。聚类分析也可以用于在泥土观测数据库中对相似地区的区分,也可以根

文档评论(0)

1亿VIP精品文档

相关文档