《大数据离线分析技术》课件——系统累加器.pptxVIP

  • 1
  • 0
  • 约小于1千字
  • 约 12页
  • 2026-07-30 发布于福建
  • 举报

《大数据离线分析技术》课件——系统累加器.pptx

;累加器介绍;累加器介绍;累加器用来对信息进行聚合,通常在向Spark传递函数时,比如使用map()函数或者用filter()传条件时,可以使用驱动器程序中定义的变量,但是集群中运行的每个任务都会得到这些变量的一份新的副本,更新这些副本的值也不会影响驱动器中的对应变量。;累加器用法;通过在驱动器中调用SparkContext.accumulator(initialValue)方法,创建出存有初始值的累加器。返回值为org.apache.spark.Accumulator[T]对象,其中T是初始值initialValue的类型。Spark闭包里的执行器代码可以使用累加器的+=方法(在Java中是add)增加累加器的值。

驱动器程序可以调用累加器的value属性(在Java中使用value()或setValue())来访问累加器的值。;对于要在行动操作中使用的累加器,Spark只会把每个任务对各累加器的修改应用一次。

因此,如果想要一个无论在失败还是重复计算时都绝对可靠的累加器,必须把它放在foreach()这样的行动操作中。转化操作中累加器可能会发生不止一次更新。;自定义累加器;自定义累加器类型的功能在1.X版本中就已经提供了,但是使用起来比较麻烦

文档评论(0)

1亿VIP精品文档

相关文档