Spark 面试题及详细答案(实战完整版).docxVIP

  • 1
  • 0
  • 约5.85千字
  • 约 7页
  • 2026-08-24 发布于河北
  • 举报

Spark 面试题及详细答案(实战完整版).docx

Spark面试题及详细答案(实战完整版)

一、Spark基础核心面试题

1、简单说说Spark和MapReduce的核心区别?

这是大数据面试高频基础题,核心差异集中在运行效率、计算模型、容错和使用场景上:

第一,计算模型不同。MapReduce是基于磁盘的离线计算,每一个Map、Reduce阶段结束后都会强制落地磁盘,IO开销极大;Spark是基于内存的分布式计算引擎,默认优先内存缓存数据,中间计算结果不需要频繁落盘,迭代计算效率提升非常明显。

第二,任务调度机制不同。MapReduce是硬性的两阶段模型,只能按照Map→Reduce流程执行,复杂任务需要编写多个Job串联;Spark基于DAG有向无环图调度,能自动拆分宽窄依赖,优化任务执行链路,支持复杂迭代计算。

第三,容错机制不同。MapReduce靠磁盘数据容错,失败后重新读取磁盘数据重试;Spark基于RDD血缘容错,只需要重算出错的分区任务,不需要全量重跑。

第四,场景适配不同。MapReduce只适合简单的海量离线批处理;Spark兼顾离线批处理、实时计算、交互式查询、机器学习等多种场景。

2、什么是RDD?RDD的五大特性是什么?

RDD是Spark的核心抽象,全称弹性分布式数据集,是一个只读、可分区、可并行计算的数据集合,也是Spark所有计算的基

文档评论(0)

1亿VIP精品文档

相关文档