第10章-大数据分析算法并行化技术及案例分析.pptxVIP

  • 5
  • 0
  • 约小于1千字
  • 约 52页
  • 2019-06-09 发布于四川
  • 举报

第10章-大数据分析算法并行化技术及案例分析.pptx

《大数据挖掘及应用》 第10章 大数据分析算法的并行化;目录;并行算法设计基础;并行算法设计基础;并行算法设计基础;并行算法设计基础;并行算法编程模型;并行算法编程模型;并行算法编程模型;MPI;MPI程序的执行;并行计算模型;并行算法设计的策略和技术;并行算法设计的策略和技术;典型数据挖掘算法并行化案例;典型数据挖掘算法并行化案例;MR-KMeans;令 k = 2,欲生成 cluster-0 和 cluster-1 随机选取A(1,1)作为cluster-0的中心,C(3,4)作为cluster-1的中心 假定将所有数据分布到2个节点 node-0 和 node-1 上,即 node-0 :A(1,1)和C(3,4) node-1 :B(2,1)和D(5,5);计算各个数据点到各个cluster的距离 ;Map的输出(即Combiner的输入): Combiner的输出 键 – 聚簇ID 值 – [包含的点数,mean] ;由于map阶段emit的key是cluster-id,所以每个 cluster的全部数据将被发送同一个reducer,包括: 该cluster 的id 该cluster??数据点的均值,及对应于该均值的数据点的个数 然后经计算后输出 当前的迭代计数 cluster id cluster center 属于该cluster center的数据点的个数

文档评论(0)

1亿VIP精品文档

相关文档