Hadoop平台优化综述二.docxVIP

  • 7
  • 0
  • 约7.43千字
  • 约 7页
  • 2019-06-20 发布于广东
  • 举报
Hadoop平台优化综述二 从系统实现角度进行优化 4. 1在可移植性和性能之间进行权衡 论文[16]主要针对HDFS进行了优化,它分析了 HDFS性能低下的两个原 因:调度延迟和可移植性假设。 调度延迟 Hadoop采用的是动态调度算法,即:当某个tasktracker上出现空slot 时,它会通过HEARBEAT(默认时间间隔为3s,当集群变大时,会适当调大)告 诉jobtracker,之后job tracker采用某种调度策略从待选task中选择一 个,再通过HEARBEAT告诉tasktrackero从整个过程看,HDFS在获取下一个 taskZ前,一直处于等待状态,这造成了资源利用率不高。此外,由于 tasktracker获取新task后,其数据读取过程是完全串行化的,即: tasktracker获取task后,依次连接namenode,连接datanode并读取数据, 处理数据。在此过程中,当tasktracker连接namenode和datanode时,HDFS 仍在处于等待状态。 为了解决调度延迟问题,可以考虑的解决方案有:重叠I/O和CPU阶段 (pipelining), task 预取(task prefetching),数据预取(data prefetching) 等 可移植性假设 为了增加Hadoop的可移植性,它采用java语言编写,这实际上也潜在 的造

文档评论(0)

1亿VIP精品文档

相关文档