DS(数据科学家)面试题及详细答案.docxVIP

  • 12
  • 0
  • 约1.46万字
  • 约 15页
  • 2026-04-26 发布于河北
  • 举报

DS(数据科学家)面试题及详细答案.docx

DS(数据科学家)面试题及详细答案

一、基础理论题(入门必问,考察基本功)

1.请解释什么是过拟合、欠拟合,以及实际工作中你是如何避免过拟合的?

答案:首先说核心定义,不绕专业术语。过拟合就是模型“学太细”,把训练数据里的噪声、偶然规律都当成了通用规律,导致训练集效果极好,但测试集、新数据效果很差;欠拟合则是模型“学不会”,连训练数据里的核心规律都没捕捉到,训练集和测试集效果都不好。

实际工作中避免过拟合,我常用这几种方法,都是落地性强的,不是纯理论:

1.数据层面:增加样本量,比如补充相似场景的数据,或者用简单的数据增强(比如时间序列的滑动窗口扩充、分类数据的轻微扰动),减少噪声影响;

2.模型层面:优先用简单模型(比如先试逻辑回归、决策树,再用复杂的XGBoost、LSTM),复杂模型必做正则化——L1正则化(Lasso)可以做特征筛选,去掉冗余特征,L2正则化(Ridge)可以压制系数过大的特征,避免个别特征过度影响模型;

3.验证层面:用交叉验证(比如5折、10折),不是只看单一训练/测试集,通过多次拆分数据,确保模型在不同数据子集上都稳定;另外早停(EarlyStopping)也常用,比如训练神经网络、梯度提升树时,当验证集指标不再提升,就停止训练,避免继续训练导致过拟合。

补充:欠拟合的解决方法相对简单,要么增加模型复杂度(比如决策树加深、增加神经网络

文档评论(0)

1亿VIP精品文档

相关文档