知乎大数据高频面试题库(真实落地版+详细口语化答案).docxVIP

  • 1
  • 0
  • 约5.2千字
  • 约 6页
  • 2026-09-13 发布于河北
  • 举报

知乎大数据高频面试题库(真实落地版+详细口语化答案).docx

知乎大数据高频面试题库(真实落地版+详细口语化答案)

一、Hadoop基础核心高频题

1、简单说下Hadoop三大核心组件及各自作用?

参考答案:Hadoop核心是HDFS、YARN、MapReduce,分工很清晰。第一HDFS,分布式文件系统,专门存海量离线数据,通过分块存储+副本机制保证数据可靠,解决单机硬盘存不下、容易丢数据的问题。第二YARN,集群资源调度框架,相当于集群的“管家”,负责管理所有服务器的CPU、内存资源,分配、调度、监控各类计算任务,比如Spark、MapReduce任务都靠YARN调度。第三MapReduce,原生离线计算框架,基于分而治之的思想,通过Map分片处理、Reduce聚合汇总,实现海量数据的分布式离线计算。

2、HDFS的副本机制默认是多少?存放规则是什么?为什么这么放?

参考答案:默认3副本。官方标准存放规则:第一个副本存客户端写入的当前节点,第二个副本存同机架的其他节点,第三个副本存不同机架的节点。这么设计主要是平衡容错和性能:同机架节点网络传输快,能减少读写延迟;跨机架存放可以规避机架整体断电、故障的风险,不会因为一个机架挂了导致数据全部丢失,兼顾了可靠性和传输效率。

3、NameNode和DataNode的核心职责、故障场景?

参考答案:NameNode是HDFS的主节点,核心存元数据,包括文件目录、文件分块位置、副本信息,不存真实

文档评论(0)

1亿VIP精品文档

相关文档