《大数据离线分析技术》课件——窄依赖.pptxVIP

  • 2
  • 0
  • 约小于1千字
  • 约 11页
  • 2026-07-30 发布于福建
  • 举报

《大数据离线分析技术》课件——窄依赖.pptx

;窄依赖介绍;窄依赖介绍;窄依赖是指1个父RDD分区对应1个子RDD的分区。换句话说,一个父RDD的分区对应于一个子RDD的分区,或者多个父RDD的分区对应于一个子RDD的分区。

;窄依赖分为两种情况:

1个子RDD的分区对应于1个父RDD的分区,比如map,filter,union等算子。

1个子RDD的分区对应于N个父RDD的分区,比如co-partionedjoin。;

窄依赖可以支持在同一个集群Executor上,以pipeline管道形式顺序执行多条命令,例如在执行了map后,紧接着执行filter。分区内的计算收敛,不需要依赖所有分区的数据,可以并行地在不同节点进行计算。所以它的失败回复也更有效,因为它只需要重新计算丢失的parentpartition即可;窄依赖对优化的优势;1.依赖往往对应着Shuffle操作,需要在运行过程中将同一个父RDD的分区传入到不同的子RDD分区中,中间可能涉及多个节点之间的数据传输;而窄依赖的每个父RDD的分区只会传入到一个子RDD分区中,通常可以在一个节点内完成转换。

2.当RDD分区丢失时(某个节点故障),Spark会对数据进行重算;3.对于窄依赖,由于父RDD的一个分区只对应一个子RDD分区,这样只需要重算和子RDD分区对应的父RDD分区即可,所以这个

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档