Spark 面试题及详细答案(企业真实版).docxVIP

  • 1
  • 0
  • 约5.92千字
  • 约 7页
  • 2026-08-24 发布于河北
  • 举报

Spark 面试题及详细答案(企业真实版).docx

Spark面试题及详细答案(企业真实版)

一、Spark基础核心面试题

1、简单说说Spark和MapReduce的区别?

这是大数据面试高频基础题,核心差异集中在性能、执行流程、迭代计算和资源开销上。

第一,计算机制不同。MapReduce是基于磁盘的计算,每一轮Map、Reduce任务结束后,结果都会落地磁盘,读写开销极大;Spark核心是基于内存计算,中间计算结果优先缓存到内存,只有内存不足时才会落地磁盘,大幅减少IO消耗。

第二,迭代计算能力不同。大数据场景下的机器学习、图计算、多维统计都是多轮迭代任务,MapReduce每一次迭代都要重新提交任务、读写磁盘,效率极低;Spark可以将中间数据集缓存,迭代时直接读取内存数据,速度提升数十倍。

第三,执行模型不同。MapReduce只有Map和Reduce两种固定算子,复杂业务需要编写多个MR任务串联;Spark提供了上百种丰富算子,转换、聚合、过滤、分区操作灵活,业务代码更简洁。

第四,资源调度和容错不同。MapReduce资源调度固定,任务启动开销大;Spark支持动态资源调度,且基于RDD血缘容错,无需全部重算,只需要重算出错的分区任务。

劣势方面,Spark对内存依赖高,集群内存资源不足时,性能会大幅下降,而MapReduce稳定性更强,适合超大规模离线海量数据处理。

2

最近下载

文档评论(0)

1亿VIP精品文档

相关文档