《大数据离线分析技术》课件——RDD的CheckPoint.pptxVIP

  • 0
  • 0
  • 约小于1千字
  • 约 11页
  • 2026-07-29 发布于福建
  • 举报

《大数据离线分析技术》课件——RDD的CheckPoint.pptx

;CheckPoint介绍;CheckPoint介绍;检查点是为了通过lineage(血统)做容错的辅助,lineage过长会造成容错成本过高,这样就不如在中间阶段做检查点容错,如果之后有节点出现问题而丢失分区,从做检查点的RDD开始重做Lineage,就会减少开销。

;在设置检查点之后,该RDD之前的有依赖关系的父RDD都会被销毁,下次调用的时候直接从检查点开始计算。

checkPoint和cache一样,都是通过调用一个Action类的算子才能运行。;

RDD的检查点(checkpoint)机制;RDD的缓存能够在第一次计算完成后,将计算结果保存到内存、本地文件系统或者Tachyon中。通过缓存,Spark避免了RDD上的重复计算,能够极大地提升计算速度。但是,如果缓存丢失了,则需要重新计算。如果计算特别复杂或者计算耗时特别多,那么缓存丢失对于整个Job的影响是不容忽视的。

为了避免缓存丢失重新计算带来的开销,Spark又引入了检查点(checkpoint)机制。;缓存是在计算结束后,直接将计算结果通过用户定义的存储级别(存储级别定义了缓存存储的介质,现在支持内存、本地文件系统和Tachyon)写入不同的介质。

而检查点不同,它是在计算完成后,重新建立一个Job来计算。

文档评论(0)

1亿VIP精品文档

相关文档