(2025年)大数据面试题及答案.docxVIP

  • 2
  • 0
  • 约5.19千字
  • 约 12页
  • 2026-05-15 发布于四川
  • 举报

(2025年)大数据面试题及答案

1.请简述HDFS的架构设计及NameNode元数据管理机制。

HDFS采用主从架构,核心组件包括NameNode(主节点)、DataNode(从节点)和客户端。NameNode负责管理文件系统命名空间、控制客户端访问、协调DataNode的块管理;DataNode负责存储实际数据块(默认128MB),并定期向NameNode汇报块信息及心跳。

NameNode元数据管理的核心是内存存储与持久化结合:

内存中维护FsImage(文件系统元数据快照,如文件目录结构、块映射关系)和EditLog(操作日志,记录所有修改操作)。

持久化通过FsImage和EditLog文件存储在本地磁盘,启动时合并二者恢复元数据。

为避免EditLog过大,SecondaryNameNode(或CheckpointNode、JournalNode,视HA方案而定)定期触发检查点(Checkpoint),将EditLog合并到FsImage,提供新的FsImage和空EditLog。

2.Spark中RDD、DataFrame、Dataset的核心区别是什么?生产环境中如何选择?

RDD(弹性分布式数据集)是Spark1.x的核心抽象,提供不可变、可分区的分布式数据集合,支持转换(Transform)和行动(Action)操作,优势是灵活性高

文档评论(0)

1亿VIP精品文档

相关文档