《大数据挖掘及应用》第10章 大数据分析算法的并行化;目录;并行算法设计基础;并行算法设计基础;并行算法设计基础;并行算法设计基础;并行算法编程模型;并行算法编程模型;并行算法编程模型;MPI;MPI程序的执行;并行计算模型;并行算法设计的策略和技术;并行算法设计的策略和技术;典型数据挖掘算法并行化案例;典型数据挖掘算法并行化案例;MR-KMeans;令 k = 2,欲生成 cluster-0 和 cluster-1
随机选取A(1,1)作为cluster-0的中心,C(3,4)作为cluster-1的中心
假定将所有数据分布到2个节点 node-0 和 node-1 上,即
node-0 :A(1,1)和C(3,4)
node-1 :B(2,1)和D(5,5);计算各个数据点到各个cluster的距离
;Map的输出(即Combiner的输入):
Combiner的输出
键 – 聚簇ID
值 – [包含的点数,mean]
;由于map阶段emit的key是cluster-id,所以每个 cluster的全部数据将被发送同一个reducer,包括:
该cluster 的id
该cluster的数据点的均值,及对应于该均值的数据点的个数
然后经计算后输出
当前的迭代计数
cluster id
cluster center
属于该cluster center的数据点的个数
您可能关注的文档
最近下载
- 应用MAPGIS制作地球化学图单元素异常图及综合异常图.pdf VIP
- 自动扶梯调试手册YSTS-0001-C.docx VIP
- 五自由度无轴承异步电机的非线性解耦控制:理论、算法与实践.docx VIP
- DBJ33∕T 1366-2026 历史文化街区与历史建筑防火技术标准.docx VIP
- 2022骨质疏松症的药物治疗管理.pptx VIP
- 骨质疏松症药物治疗与管理.pptx VIP
- 宣鼎和他的《粉铎图咏》.pdf VIP
- (高清版)DB4401∕T 109-2021 《历史保护建筑防火技术规程》.pdf VIP
- 《圆运动的古中医学》.pdf VIP
- 软件项目开发甘特图完整流程图.pdf VIP
原创力文档

文档评论(0)