Python大数据分析与挖掘实战课件 5-7.缺失值处理.pptxVIP

  • 4
  • 0
  • 约3.9千字
  • 约 12页
  • 2025-06-18 发布于山东
  • 举报

Python大数据分析与挖掘实战课件 5-7.缺失值处理.pptx

第5章数据预处理与特征工程单变量插值填充多变量插值填充K最近邻填充

单变量插值填充第5章在数据处理过程中,缺失值是常见的,需要对其进行处理。Pandas包中的fillna()函数并没有充分利用数据集中的信息。这里介绍scikit-learn包中能充分利用数据信息的3种常用填充方法,即均值填充、中位数填充和最频繁值填充。注意填充方式主要是按列填充均值填充:对某列中的所有缺失值用该列中非缺失部分的值的平均值来表示;中位数填充:取某列中非缺失部分的值的中位数来表示缺失值。最频繁值填充:取某列中非缺失部分的值出现频次最多的值来表示缺失值。(常用于分类型或离散型变量)

单变量插值填充第5章(1)导入数据预处理中的填充模块SimpleImputerfromsklearn.imputeimportSimpleImputer(2)利用SimpleImputer创建填充对象impimp=SimpleImputer(missing_values=np.nan,strategy=mean)参数说明如下:strategy:均值(mean)、中位数(median)、最频繁值(most_frequent)(3)调用填充对象imp中的fit()拟合方法,对待填充数据进行拟合训练。imp.fit(Data)#Data为待填充数据集变量(4)调用填充

文档评论(0)

1亿VIP精品文档

相关文档