- 1
- 0
- 约5.7千字
- 约 8页
- 2026-09-19 发布于河北
- 举报
顺丰大数据挖掘岗2026真实面试题+接地气详解(一二面完整版)
一、SQL大数据基础(一面必考,物流海量数据专项,8题)
1、顺丰订单表量级百亿级,如何优化路由订单统计SQL?手写优化思路
参考答案:顺丰订单ods表单日增量千万级,全表不可直接聚合,实操优化如下:
1)分区必用:按运单创建日期dt分区,业务查询永远限定dt范围,禁止跨年月全表扫描;
2)索引优化:常用组合索引(网点id、转运中心id、运单状态、dt),物流业务多维度筛选,单列索引效率极低;
3)提前聚合:离线数仓分层,ODS原始订单→DWD明细订单→DWS网点日汇总宽表,业务直接查宽表,不重复计算;
4)规避痛点:禁止select*、禁止groupby超长运单号字符串、大表不和小表随意join,小表做广播join;
5)特殊点:顺丰Hive集群默认开启数据倾斜优化,遇到同城网点订单倾斜,手动拆分热点网点单独计算再合并。
2、物流场景常见数据倾斜场景,以及你实操解决办法?
参考答案(顺丰高频倾斜场景,非通用答案):
1)热点倾斜:深圳宝安、义乌集散中心单量全国最高,groupby转运中心id直接倾斜;解决:加盐打散热点key,聚合后二次合并;
2)空值倾斜:退货无收件网点、作废运单网点id为null,null扎堆聚合;解决:null赋随机值打散,不直接剔除(作废运单属于风控数据,不能删);
3)join倾斜:
原创力文档

文档评论(0)