Spark核心原理与高级特性详解.pdfVIP

  • 0
  • 0
  • 约1.99万字
  • 约 26页
  • 2026-10-08 发布于北京
  • 举报

Spark阶段知识回顾

一、基础

1、Spark概述

Spark的发展历程、特点、内置模块与适用场景

问题:Spark不适用的场景?

细粒度过高时

2、Spark安装部署

本地模式、yarn、独立集群、mesos、云平台

安装、启停服务、提交作业

3、RDD

1*

‑

分区列表2*

‑

用于计算每个分片的函数3*

‑

对其他RDD的依赖关系列表4

*

‑

(可选)键值RDD的分区器(例如表明RDD是哈希分区的)5*

‑

(可选)计算每

个分片的优选位置列表(例如HDFS文件的块位置)

问题:如果RDD持有某种类型的分区器,这意味着什么?

换个问法:如果RDD没有持有任何分区器,这意味着什么?

RDD1=

Some(HashPartitioner1)

=RDD1的数据必定按照HashPartitioner进行了分区

rdd1.groupByKey(HashPartitioner2)

=必定是窄依赖

RDD2=None

=

RDD2的数据(可能)未按任何方式对数据进行分区

Spark阶段知识回顾

一、基础

1、Spark概述

Spark的发展、特点、内置模块、使用场景

问题:Spark不适合的场景?

细粒度更

文档评论(0)

1亿VIP精品文档

相关文档