《大数据离线分析技术》课件——RDD的缓存.pptxVIP

  • 2
  • 0
  • 约小于1千字
  • 约 11页
  • 2026-07-29 发布于福建
  • 举报

《大数据离线分析技术》课件——RDD的缓存.pptx

;RDD的缓存机制;RDD的缓存机制;默认情况下,RDD只使用一次,用完即扔,再次使用时需要重新计算得到,而持久化操作避免了这里的重复计算,实际测试也显示持久化对性能提升明显。

;假设首先进行了RDD0→RDD1→RDD2的计算作业,那么计算结束时,RDD1就已经缓存在系统中了。在进行RDD0→RDD1→RDD3的计算作业时,由于RDD1已经缓存在系统中,因此RDD0→RDD1的转换不会重复进行。

;计算作业只须进行RDD1→RDD3的计算就可以了,因此计算速度可以得到很大提升。

;使用缓存;使用如下代码使用缓存:

scalaimportorg.apache.spark.storage._

scalavalrdd1=sc.makeRDD(1to5)

scalardd1.cache//cache只有一种默认的缓存级别,即MEMORY_ONLY

scalardd1.persist(StorageLevel.MEMORY_ONLY);

Spark会自动监控每个节点上的缓存数据,然后使用least-recently-used(LRU)机制来处理旧的缓存数据。如果想手动清理这些缓存的RDD数据而不是去等待它们被自动清理掉,使用RDD.unpersist()

文档评论(0)

1亿VIP精品文档

相关文档