- 2
- 0
- 约4.99千字
- 约 6页
- 2026-08-03 发布于河北
- 举报
唯品会大数据岗位面试题及详细答案(实战版)
适用岗位:唯品会大数据开发、数据研发、数仓工程师
题库特点:贴合唯品会电商真实业务(商品、订单、用户、营销、库存),摒弃模板化话术,答案贴合一线工作实操,适配校招、社招面试场景
一、基础框架核心面试题(高频必问)
1、说说Spark中groupByKey和reduceByKey的区别,工作中怎么选型?
详细答案:两者核心差异在shuffle阶段数据处理逻辑,也是实际工作最核心的选型依据。
第一,执行逻辑不同。reduceByKey会先在map端做局部聚合,把同一个key的数据先在分区内合并,再把聚合后的少量数据发送到reduce端全局聚合;而groupByKey不会做预聚合,直接把所有相同key的原始数据全部shuffle传输到下游。
第二,性能差距大。电商场景数据量极大,比如唯品会每日千万级订单、SKU数据,groupByKey会产生海量shuffle数据,磁盘IO、网络传输压力剧增,极易出现数据倾斜、任务卡顿;reduceByKey能大幅减少shuffle数据量,性能远高于前者。
第三,选型规则。只要是聚合计算(求和、计数、求最大最小值、累加),一律用reduceByKey;只有单纯需要分组归集数据、无法提前聚合的场景,才用groupByKey。唯品会日常订单统计、商品销量汇
原创力文档

文档评论(0)