2026年数据清洗与预处理技巧题库.docxVIP

  • 0
  • 0
  • 约6.96千字
  • 约 14页
  • 2026-09-20 发布于山东
  • 举报

2026年数据清洗与预处理技巧题库

一、单选题(本大题共10小题,每小题2分,共20分)

1.在数据预处理阶段,对于缺失值处理方法中,以下哪项技术通常适用于具有明显业务逻辑关联的多维数据集?(每题2分)

A.简单删除法(listwisedeletion)

B.基于均值/中位数/众数的全局填充

C.埔松回归模型填充

D.基于K最近邻算法的插补

解析:本题考查多维数据集缺失值处理技术。选项A的简单删除法会导致数据量显著减少,尤其当缺失比例较高时;选项B的均值/中位数/众数填充忽略了变量间关系;选项C的泊松回归适用于计数数据但未考虑业务逻辑;选项D的KNN算法通过保留数据点间业务相似性实现插补,特别适用于多维数据集。根据《2026年数据清洗与预处理技巧题库》第3章多维数据预处理部分,KNN算法通过计算欧氏距离保留变量间业务关联性,适用于复杂业务场景的缺失值处理。

2.在处理异常值时,以下哪种方法最适用于检测具有高维特征的连续型数值数据集?(每题2分)

A.基于箱线图的IQR方法

B.基于主成分分析(PCA)的异常值检测

C.基于局部异常因子(LOF)的密度聚类方法

D.基于Z分数的标准化检测

解析:本题考查高维数据异常值检测技术。选项A的IQR方法适用于一维或二维数据;选项B的PCA方法主要用于降维而非异常值检测;选项

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档