Hadoop上的PageRank算法优化.pdfVIP

  • 8
  • 0
  • 约4.89万字
  • 约 49页
  • 2019-06-16 发布于中国
  • 举报
摘要 近年来随着社交网络和语义网络的兴起,海量数据挖掘成为学术界和工业界 关注的焦点问题。在大规模数据的分析计算中,单台服务器的存储和计算能力已 无法满足其对数据量和计算复杂度的需求。Apache基金会开发的开源项目 Hadoop作为一种流行的分布式计算平台,在很多涉及海量数据挖掘的产品和应 用中发挥着重大作用。 在传统的单机数据挖掘算法的实现中,数据集中存储在本地硬盘上,在计算 时读入内存中相应的数据结构里,辅以一些高效的索引。在算法执行过程中程序 反复的读取内存中的数据进行计算,最终输出结果到本地硬盘,控制台或远程客 户端。对于单机算法来说,我们只需考虑算法的有效性,时间空问复杂度,数据 结构的选择和结果的展示。 随着数据量的增加,单台服务器的硬盘无法存储全部的输入输出数据,内存 也无法容纳下计算中所产生的中问数据,这时一种行之有效的方法是将单机算法 改造成分布式算法,利用多台机器进行分布式并行计算。在算法的分布式移植过 程中需要考虑很多问题,例如数据的分布,计算的分布,结果的收集,各节点之 间的网络传输,集群节点的故障恢复等等。而ltadoo

文档评论(0)

1亿VIP精品文档

相关文档