- 4
- 0
- 约1.32千字
- 约 5页
- 2022-07-04 发布于湖南
- 举报
Uber 是如何提高 HDFS I/O 利用率的
人们可能在很多与分布式系统相关的文章和论文的标题中看到过 CAP 定理,它指出:全都性、可用性和分区容忍度,这三个中只能选两个!
下一代数据基础设备应用的规律类似于 CAP 定理——基础设备只能供应所需的3个特性中的2个,即:成本效率、可用性和功能。
成本效率是 Uber 的首要任务之一,而 HDFS 是优步必不行少的数据服务,必需达到 99.9+% 的可用性,这两个特点我们都不能妥协。那么问题就变成了:我们能否必需牺牲 HDFS 功能(尤其是 IO 功能)来换取成本效率和可用性?
在接下来的章节中,我们试图分析当前 HDFS 磁盘 IO 利用率,以评估当多个数据服务在我们的下一代、行业领先的高密度硬件上运转时,我们能否会遇到 IO 瓶颈。
硬盘有多忙?
考虑到这个问题,我们转向使用目标来分析 HDFS 集群中全部 134,000 个硬盘的 IO 利用率。我们得到的数据令人震惊:
?好的地方:约 90% 的磁盘的平均 IO 利用率低于 6%。
?坏的地方:?部分硬盘 IO 利用率可高达15%以上,是平均硬盘 IO 利用率的5倍以上。虽然这些磁盘只是整个磁盘池的一小部分,但这也有数千个驱动器。
这些繁忙的磁盘如何分布在全部 HDFS 主机中:均匀分布在大量主机中,还是集中在一小群主机中? 假如答案是后者,那么这可能会给即将推出的运转多
原创力文档

文档评论(0)