《大数据离线分析技术》课件——SparkShuffle解析.pptxVIP

  • 1
  • 0
  • 约1.76千字
  • 约 13页
  • 2026-07-29 发布于福建
  • 举报

《大数据离线分析技术》课件——SparkShuffle解析.pptx

SparkShuffle解析

ShuffleMapStage与ResultStageShuffle中的任务个数reduce端数据的读取

/01基本介绍

ShuffleMapStage与ResultStage

ShuffleMapStage与ResultStage在划分stage时,最后一个stage称为finalStage,它本质上是一个ResultStage对象,前面的所有stage被称为ShuffleMapStage。ShuffleMapStage的结束伴随着shuffle文件的写磁盘。ResultStage基本上对应代码中的action算子,即将一个函数应用在RDD的各个partition的数据集上,意味着一个job的运行结束。

/02基本介绍

Shuffle中的任务个数

Shuffle中的任务个数(一)SparkShuffle分为map阶段和reduce阶段,或者称之为ShuffleRead阶段和ShuffleWrite阶段,那么对于一次Shuffle,map过程和reduce过程都会由若干个task来执行,那么maptask和reducetask的数量是如何确定的呢?假设Spark任务从HDFS中读取数据,那么初始RDD分区个数由该文件的split个数决定,也就是一个split对应生成的RDD的一个partition,我们假设

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档