Spark 高频面试题及详细答案(职场实战版).docxVIP

  • 1
  • 0
  • 约6.11千字
  • 约 7页
  • 2026-08-24 发布于河北
  • 举报

Spark 高频面试题及详细答案(职场实战版).docx

Spark高频面试题及详细答案(职场实战版)

一、Spark核心基础面试题

1、简述Spark和MapReduce的核心区别?

这是大数据基础必考题,核心差异集中在运行机制、性能、迭代计算和开销上,实际工作中体感非常明显:

第一,计算机制不同。MapReduce是基于磁盘的计算,每一个Map、Reduce阶段结束后都会强制落地磁盘,读写开销极大;Spark核心是基于内存计算,中间结果优先缓存到内存,只有内存不足时才会溢写磁盘,大幅减少IO消耗。

第二,迭代计算能力不同。MapReduce不擅长迭代场景,做机器学习、图计算、多次聚合迭代任务时,需要多次提交MR任务,启停开销极高;Spark原生支持迭代计算,缓存中间RDD,非常适合迭代类任务。

第三,任务调度和延迟不同。MapReduce任务启动、调度开销大,延迟高,只适合离线批量任务;Spark调度轻量化,既支持离线大批量计算,也支持实时流式计算。

第四,功能丰富度不同。MapReduce只有Map、Reduce两种核心算子;Spark提供大量丰富的转换、行动算子,同时内置SQL、流式计算、图计算、机器学习全套组件,生态更完整。

补充:MapReduce优势是稳定性极强、容错性高,适合超大规模超低频离线任务;Spark性能更强,但对内存资源要求更高。

2、什么是RDD?RDD

最近下载

文档评论(0)

1亿VIP精品文档

相关文档