好程序员大数据高频面试题及详细答案(实战口语版).docxVIP

  • 0
  • 0
  • 约6.11千字
  • 约 8页
  • 2026-08-05 发布于河北
  • 举报

好程序员大数据高频面试题及详细答案(实战口语版).docx

好程序员大数据高频面试题及详细答案(实战口语版)

一、Hadoop核心面试题(高频基础)

1、简单说下Hadoop三大组件及各自作用?

Hadoop核心是HDFS、YARN、MapReduce,分工非常明确:

第一,HDFS是分布式文件系统,专门负责海量数据存储。采用主从架构,NameNode管理元数据、文件目录、块映射,不存真实数据;DataNode负责存储实际的数据块,默认128M一块,副本数3,保证数据不丢失。

第二,YARN是资源调度框架,负责集群资源管理和任务调度。ResourceManager是全局老大,负责分配资源、接收任务、调度队列;NodeManager是每个节点的资源管理者,负责监控本节点CPU、内存,启动和管理容器运行任务。

第三,MapReduce是分布式计算框架,负责离线海量数据计算。分Map阶段分片处理数据、Reduce阶段聚合汇总数据,主打高可靠、高容错,适合离线批处理。

2、HDFS副本机制为什么默认3副本?可以改吗?生产注意什么?

3副本是兼顾容错性、带宽开销、存储空间的最优方案,不是固定死的。

副本存放策略:第一个副本存当前节点,第二个存同机架不同节点,第三个存不同机架节点。这样就算单节点、单机架挂掉,数据都不会丢。

生产可以改副本数,临时测试环境可以改成1节省空间,核心生产数据保持3副本。绝对不能低于2副本,一旦节点故障,会直接丢数据、引发

文档评论(0)

1亿VIP精品文档

相关文档