唯品会大数据岗位面试题及详细答案(实战版).docxVIP

  • 2
  • 0
  • 约4.99千字
  • 约 6页
  • 2026-08-03 发布于河北
  • 举报

唯品会大数据岗位面试题及详细答案(实战版).docx

唯品会大数据岗位面试题及详细答案(实战版)

适用岗位:唯品会大数据开发、数据研发、数仓工程师

题库特点:贴合唯品会电商真实业务(商品、订单、用户、营销、库存),摒弃模板化话术,答案贴合一线工作实操,适配校招、社招面试场景

一、基础框架核心面试题(高频必问)

1、说说Spark中groupByKey和reduceByKey的区别,工作中怎么选型?

详细答案:两者核心差异在shuffle阶段数据处理逻辑,也是实际工作最核心的选型依据。

第一,执行逻辑不同。reduceByKey会先在map端做局部聚合,把同一个key的数据先在分区内合并,再把聚合后的少量数据发送到reduce端全局聚合;而groupByKey不会做预聚合,直接把所有相同key的原始数据全部shuffle传输到下游。

第二,性能差距大。电商场景数据量极大,比如唯品会每日千万级订单、SKU数据,groupByKey会产生海量shuffle数据,磁盘IO、网络传输压力剧增,极易出现数据倾斜、任务卡顿;reduceByKey能大幅减少shuffle数据量,性能远高于前者。

第三,选型规则。只要是聚合计算(求和、计数、求最大最小值、累加),一律用reduceByKey;只有单纯需要分组归集数据、无法提前聚合的场景,才用groupByKey。唯品会日常订单统计、商品销量汇

文档评论(0)

1亿VIP精品文档

相关文档