Flink数据分区与交换机制.pdfVIP

  • 0
  • 0
  • 约小于1千字
  • 约 2页
  • 2026-08-27 发布于北京
  • 举报

《035_基于ResultSubPartition的数据shuffle》

数据交换的模式

task0的实例1需要将实时计算出的数据写入某个ResultSubPartition,下游task的实例数

量通常决定了数据分区的数量

若task1有3个实例,则task0的实例1需要3个数据分区(Partition)。每次计算完成后

需选择写入哪个分区——如何决定将处理好的数据写入下游哪个task实例对应的分区?

哈希、随机、广播

在Flink开发作业时,若使用group

by算子对数据分组聚合(例如按orderid字段分组),

则相同orderid的数据会交由下游同一个task实例处理,从而实现对该orderid数据的统一

逻辑处理

《035_基于ResultSubPartition的数据shuffle》

数据交换的模式

task0的实例1,他要把实时计算出来的数据,写到某个ResultSubPartition,下游的task有

多少个实例,一般来说就有多少个数据分区

task1有3个实例,task0的实例1就需要有3个数据分区(Partition),他每次计算完毕的

数据就需要选择写入到哪个数据分区里去,如何决定计算好的数据写入到哪个下游task实

例的数据分区里去呢?

hash、random、broadcast

你在f

文档评论(0)

1亿VIP精品文档

相关文档