《大数据离线分析技术》课件——Spark调优方案:过滤少数导致倾斜的key.pptxVIP

  • 2
  • 0
  • 约1.08千字
  • 约 12页
  • 2026-07-29 发布于福建
  • 举报

《大数据离线分析技术》课件——Spark调优方案:过滤少数导致倾斜的key.pptx

过滤少数导致倾斜的key

调优概述数据倾斜发生时的现象过滤少数导致倾斜的key

/01基本介绍

调优概述

调优概述有的时候,我们可能会遇到大数据计算中一个最棘手的问题——数据倾斜,此时Spark作业的性能会比期望差很多。数据倾斜调优,就是使用各种技术方案解决不同类型的数据倾斜问题,以保证Spark作业的性能。

/02基本介绍

数据倾斜发生时的现象

数据倾斜发生时的现象绝大多数task执行得都非常快,但个别task执行极慢。比如,总共有1000个task,997个task都在1分钟之内执行完了,但是剩余两三个task却要一两个小时。这种情况很常见。原本能够正常执行的Spark作业,某天突然报出OOM(内存溢出)异常,观察异常栈,是我们写的业务代码造成的。这种情况比较少见。

/03基本介绍

过滤少数导致倾斜的key

过滤少数导致倾斜的key(一)方案实现思路:如果我们判断那少数几个数据量特别多的key,对作业的执行和计算结果不是特别重要的话,那么干脆就直接过滤掉那少数几个key。比如,在SparkSQL中可以使用where子句过滤掉这些key或者在SparkCore中对RDD执行filter算子过滤掉这些key。如果需要每次作业执行时,动态判定哪些key的数据量最多然后再进行过滤,那么可以使用sample算子对RDD进行采样,然后计算出每个

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档