2026年数据清洗与预处理技巧专项训练题库.docxVIP

  • 0
  • 0
  • 约6.38千字
  • 约 22页
  • 2026-08-14 发布于广东
  • 举报

2026年数据清洗与预处理技巧专项训练题库.docx

2026年数据清洗与预处理技巧专项训练题库

一、单项选择题(本大题共10小题,每小题2分,共20分)

1.在数据清洗过程中,以下哪种方法最适合处理缺失值比例较高(超过30%)的连续型特征?()

A.使用均值或中位数填充

B.直接删除含有缺失值的样本

C.采用KNN算法进行插补

D.将缺失值标记为特殊类别后进行独热编码

解析:当缺失值比例超过30%时,均值或中位数填充可能导致数据分布严重偏移,删除样本会损失大量信息,KNN插补虽然能保留数据结构但计算成本高。特殊类别编码适用于分类特征,不适用于连续型特征。正确做法是考虑使用多重插补(MultipleImputation)或基于模型预测的插补方法。

2.对于包含异常值的数值型特征,以下哪种标准化方法最稳健?()

A.Z-score标准化

B.Min-Max标准化

C.Robust标准化

D.MaxAbs标准化

解析:Z-score标准化对异常值敏感,Min-Max标准化受异常值影响大,MaxAbs标准化在处理稀疏数据时效果不佳。Robust标准化使用中位数和四分位距,对异常值具有天然的抗干扰能力,公式为:(x-Q1)/(Q3-Q1)。

3.在处理文本数据时,以下哪种方法最适合去除停用词?()

A.词性标注

B.词频

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档