- 2
- 0
- 约4.26千字
- 约 6页
- 2026-08-01 发布于河北
- 举报
北京数据挖掘工程师高频面试题(真实面试版·详细答案)
一、数据挖掘基础流程(必考)
1.说说你理解的数据挖掘完整流程,每一步核心做什么?
答:我日常做项目的完整流程一共6步,都是落地实操的步骤,不是书本理论:
第一是业务理解,先明确需求是分类、回归、聚类还是异常检测,确定评价指标,比如用户留存预测看AUC、营收预测看MAE,避免做一堆无效建模。
第二是数据采集与接入,从数仓、日志表、业务库取数,关联用户、行为、商品、时间维度数据,初步筛选可用字段。
第三是数据清洗,这是最耗时的一步。主要处理缺失值、异常值、重复数据、脏数据,比如行为日志的无效点击、极值营收、用户空信息,保证数据基础质量。
第四是特征工程,包括特征筛选、特征构造、特征转换。剔除冗余、高相关、无区分度特征,构造统计特征、时间序列特征,做归一化、离散化等处理。
第五是模型训练与调优,根据场景选模型,划分训练、验证、测试集,训练后调参,解决过拟合、欠拟合问题,对比多模型效果。
第六是模型评估与落地复盘,用业务指标+模型指标双重评估,上线后监控效果衰减,定期迭代优化。
2.数据清洗中,缺失值、异常值你怎么处理?说实操方法
答:不统一无脑填充或删除,分场景判断,是工作里的标准做法:
缺失值处理:缺失率超80%直接删字段;缺失率20%-80%,数值型用中位数(抗极值)、类别型用众数;关键业务字段用模型预测填充,比如用户消费
原创力文档

文档评论(0)