- 1
- 0
- 约5.92千字
- 约 8页
- 2026-09-03 发布于河北
- 举报
大数据集群面试题(含详细落地答案)
一、大数据集群基础核心面试题
1、简单说下大数据集群的核心组成,生产环境必备组件有哪些?
详细答案:
生产大数据集群核心分三层,存储、资源调度、计算,再加辅助组件。
存储层核心是HDFS,负责所有离线数据的持久化存储;资源调度层是YARN,统一管理集群CPU、内存资源,分配给各类计算任务;计算层主要是MapReduce、Spark、Flink,分别跑离线批量任务、交互式离线任务、实时任务。
辅助必备组件:Hive做数仓建模和SQL解析、HBase做实时KV存储、Zookeeper做集群协调和选举、Kafka做消息队列、Sqoop/DataX做数据同步。
小规模集群可以精简,但HDFS、YARN、Zookeeper、Hive、Spark是生产最基础的必备组件。
2、集群高可用(HA)原理是什么?为什么生产必须开HA?
详细答案:
高可用核心就是主备切换+故障自动转移,避免单点故障。
以HDFS为例,默认单NameNode是单点,挂了整个集群就不可用。开HA之后配置两个NameNode,一个活跃主节点,一个备用备节点。平时主节点处理所有读写请求,同时把操作日志同步到JournalNode,备节点实时拉取日志同步元数据,保证主备数据完全一致。
Zookeeper负责监控主节点状态,一旦主节点宕机、进程挂掉、网络断连,ZK会触发自动选举,备节点立刻切换
原创力文档

文档评论(0)