Spark核心机制与分布式计算原理剖析.pdfVIP

  • 1
  • 0
  • 约9.34千字
  • 约 16页
  • 2026-09-10 发布于北京
  • 举报

表格

{

边框‑折叠:

折叠;

}

表格,

th,

td

{

边框:

1px

实线

#000;

}

Spark

•RDD(弹性分布式数据集)

五大特性:

分区列表

计算每个分区的函数

对其他RDD的依赖关系列表

–(可选)用于键值对RDD的分区器

•shuffle时

(可选)用于计算每个分片的首选位置列表

•task计算的数据本地化

血统

·每个看做一个RDD

table{border-collapse:collapse;}table,th,td{border:1pxsolid#000;}

Spark内核

•RDD(ResilientDistributedDataset)

五大特性:

–Alistofpartitions

–Afunctionforcomputingeachpartition

–AlistofdependenciesonotherRDDs

–Optionally,aPartitionerforkey-valueRDDs

•shuffle的时候

–Optionally,alistofpreferredlocationstocomputeeachspliton

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档