顺丰大数据挖掘岗2026真实面试题+接地气详解(一二面完整版).docxVIP

  • 1
  • 0
  • 约5.7千字
  • 约 8页
  • 2026-09-19 发布于河北
  • 举报

顺丰大数据挖掘岗2026真实面试题+接地气详解(一二面完整版).docx

顺丰大数据挖掘岗2026真实面试题+接地气详解(一二面完整版)

一、SQL大数据基础(一面必考,物流海量数据专项,8题)

1、顺丰订单表量级百亿级,如何优化路由订单统计SQL?手写优化思路

参考答案:顺丰订单ods表单日增量千万级,全表不可直接聚合,实操优化如下:

1)分区必用:按运单创建日期dt分区,业务查询永远限定dt范围,禁止跨年月全表扫描;

2)索引优化:常用组合索引(网点id、转运中心id、运单状态、dt),物流业务多维度筛选,单列索引效率极低;

3)提前聚合:离线数仓分层,ODS原始订单→DWD明细订单→DWS网点日汇总宽表,业务直接查宽表,不重复计算;

4)规避痛点:禁止select*、禁止groupby超长运单号字符串、大表不和小表随意join,小表做广播join;

5)特殊点:顺丰Hive集群默认开启数据倾斜优化,遇到同城网点订单倾斜,手动拆分热点网点单独计算再合并。

2、物流场景常见数据倾斜场景,以及你实操解决办法?

参考答案(顺丰高频倾斜场景,非通用答案):

1)热点倾斜:深圳宝安、义乌集散中心单量全国最高,groupby转运中心id直接倾斜;解决:加盐打散热点key,聚合后二次合并;

2)空值倾斜:退货无收件网点、作废运单网点id为null,null扎堆聚合;解决:null赋随机值打散,不直接剔除(作废运单属于风控数据,不能删);

3)join倾斜:

文档评论(0)

1亿VIP精品文档

相关文档