- 0
- 0
- 约6.11千字
- 约 8页
- 2026-08-05 发布于河北
- 举报
好程序员大数据高频面试题及详细答案(实战口语版)
一、Hadoop核心面试题(高频基础)
1、简单说下Hadoop三大组件及各自作用?
Hadoop核心是HDFS、YARN、MapReduce,分工非常明确:
第一,HDFS是分布式文件系统,专门负责海量数据存储。采用主从架构,NameNode管理元数据、文件目录、块映射,不存真实数据;DataNode负责存储实际的数据块,默认128M一块,副本数3,保证数据不丢失。
第二,YARN是资源调度框架,负责集群资源管理和任务调度。ResourceManager是全局老大,负责分配资源、接收任务、调度队列;NodeManager是每个节点的资源管理者,负责监控本节点CPU、内存,启动和管理容器运行任务。
第三,MapReduce是分布式计算框架,负责离线海量数据计算。分Map阶段分片处理数据、Reduce阶段聚合汇总数据,主打高可靠、高容错,适合离线批处理。
2、HDFS副本机制为什么默认3副本?可以改吗?生产注意什么?
3副本是兼顾容错性、带宽开销、存储空间的最优方案,不是固定死的。
副本存放策略:第一个副本存当前节点,第二个存同机架不同节点,第三个存不同机架节点。这样就算单节点、单机架挂掉,数据都不会丢。
生产可以改副本数,临时测试环境可以改成1节省空间,核心生产数据保持3副本。绝对不能低于2副本,一旦节点故障,会直接丢数据、引发
原创力文档

文档评论(0)