基于mapreduce的k_means聚类算法 研究-集成电路工程专业论文.docxVIP

  • 10
  • 0
  • 约4.95万字
  • 约 59页
  • 2018-12-21 发布于上海
  • 举报

基于mapreduce的k_means聚类算法 研究-集成电路工程专业论文.docx

基于mapreduce的k_means聚类算法 研究-集成电路工程专业论文

万方数据 万方数据 上海师范大学硕士学位论文 摘要 摘要 随着互联网应用的飞速发展,数据量的积累也越来越多。如何更高效快捷地 从海量数据中得到有价值的信息并将其应用到相关领域中,成为当前范围内急需 解决的前沿问题。为了解决这一难题,研究人员提出了越来越多的聚类分析算法。 目前,聚类分析已经在很多领域被广泛应用,例如:金融、军事、医疗、管理等。 K_means 聚类算法是聚类分析中使用较为广泛的一种,其思想简单且易操作. 但是该算法随机选择初始化中心使聚类结果不稳定且易出现局部最优解,此外, 当数据集中存在孤立点时聚类结果也会受到影响。随着聚类数据日渐增多, K_means 算法迭代次数增加且耗时严重,传统的单机运行模式已经不能满足实际 需要。MapReduce 是基于 Hadoop 平台的一种分布式计算模型且是当前运用较为 广泛的一种分布式计算框架,HDFS 也实现了对文件的分布式存储,所以将单机 上的聚类分析算法移植到 Hadoop 平台上可进行分布式聚类任务。针对上述 K_means 算法的不足,文章中提出了一种对 K_means 算法进行优化的算法且对 其实现了并行化。 首先,本文梳理了聚类分析的研究背景及国内外研究现状并列举了论文的主 要工作及创新点。其次介绍了聚类分析技术中的度量和聚类算法的划分等,并通 过 HDFS 分布式文件系统及 MapReduce 编程模型两方面

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档