HDFS优缺点;了解hdfs的优缺点;
高容错和恢复机制
HDFS的设计是将数据自动保存多个副本,分别存储到不同的DataNode中,因此,当某个DataNode的副本丢失后,可以从其他机器上拷贝过来,自动恢复。
;
适合批处理
HDFS的设计建立在“一次写入、多次读写”任务的基础上。这意味着一个数据集一旦由数据源生成,就会被复制分发到不同的存储节点中,然后响应各种各样的数据分析任务请求。在多数情况下,分析任务都会涉及数据集中的大部分数据,也就是说,对HDFS来说,请求读取整个数据集要比读取一条记录更加高效。
;
适合大数据处理
超大文件:“超大文件”在这里指具有几百MB、几百GB甚至几百TB大小的文件。目前已经有存储PB级数据的Hadoop集群了。
;
可构建在廉价机器上 ?
Hadoop不需要运行在昂贵且高可靠的硬件上,它是设计运行在商用廉价硬件的集群上的,因此,至少对于庞大的集群来说,节点故障的可能性还是非常高的。HDFS遇到上述故障时,通过提供多个副本提高数据可靠性。
;
不适合低延迟数据访问
如果要处理一些用户要求时间比较短的低延迟应用请求,则HDFS不适合。HDFS是为了处理大型数据集分析任务的,主要是为达到高的数据吞吐量而设计的,这就可能要求以高延迟作为代价。
;无法高效存储大量的小文件
因为NameNode把文件系统的元数据放置在内存中,所有文件系统
原创力文档

文档评论(0)