《大数据离线分析技术》课件——SortShuffle解析.pptxVIP

  • 0
  • 0
  • 约小于1千字
  • 约 14页
  • 2026-07-29 发布于福建
  • 举报

《大数据离线分析技术》课件——SortShuffle解析.pptx

;SortShuffle介绍;SortShuffle介绍;在Spark1.2版本之后,出现了SortShuffle,这种方式以更少的中间磁盘文件产生而远远优于HashShuffle。

SortShuffle的运行机制主要分为两种。一种为普通机制,另一种为bypass机制。

bypass机制的启动条件为,当shufflereadtask的数量小于等于spark.shuffle.sort.bypassMergeThreshold参数的值时(默认为200),就会启用bypass机制。即当readtask不是那么多的时候,采用bypass机制是更好的选择。;普通运行机制;在普通运行机制模式下,数据会先写入一个数据结构,聚合算子写入Map,一边通过Map局部聚合,一遍写入内存。Join算子写入ArrayList直接写入内存中。然后需要判断是否达到阈值,如果达到就会将内存数据结构的数据写入到磁盘,清空内存数据结构。

;在溢写磁盘前,先根据key进行排序,排序过后的数据,会分批写入到磁盘文件中。默认批次为10000条,数据会以每批一万条写入到磁盘文件。写入磁盘文件通过缓冲区溢写的方式,每次溢写都会产生一个磁盘文件。

;最后在每个task中,将所有的临时文件合并,这就是merge过程,此过程将所有临时文件读取出来,一次写入

文档评论(0)

1亿VIP精品文档

相关文档