大数据p7面试题及答案.docxVIP

  • 1
  • 0
  • 约4.42千字
  • 约 11页
  • 2026-08-16 发布于河南
  • 举报

大数据p7面试题及答案

一、选择题(共50分)

1.在Kafka中,如果一个Topic有3个分区,有2个消费者组,那么该Topic的数据会被如何分配?

A.3个消费者组各自消费全部3个分区的数据

B.2个消费者组各自消费1个分区的数据

C.3个分区分别被2个消费者组中的消费者轮询消费

D.2个消费者组中的消费者随机抢占分区

答案:A

2.HDFS中,NameNode内存主要存储了什么信息?

A.数据块的物理位置

B.文件系统的元数据(包括文件名、目录结构、文件与Block的映射关系、Block与DataNode的映射关系)

C.实际的数据内容

D.用户的访问权限列表

答案:B

3.在Spark中,RDD的依赖关系分为窄依赖和宽依赖,以下哪种情况属于宽依赖?

A.父RDD的一个分区被子RDD的多个分区使用

B.父RDD的一个分区被子RDD的一个分区使用

C.父RDD的多个分区被子RDD的一个分区使用

D.父RDD和子RDD的分区数量相同

答案:A

4.Flink中,Watermark的作用是什么?

A.用于触发窗口的计算

B.用于处理乱序数据,允许数据迟到

C.用于控制数据的并发度

D.用于Checkpoint的恢复

答案:B

5.Hive中,关于分区和分桶,以下说法正确的是?

A.分区是物理上的划分,分桶是逻辑上的划分

B.分区是逻辑上

文档评论(0)

1亿VIP精品文档

相关文档