2026年数据清洗与预处理技巧习题集.docxVIP

  • 1
  • 0
  • 约1.28万字
  • 约 38页
  • 2026-10-04 发布于广东
  • 举报

2026年数据清洗与预处理技巧习题集

一、单项选择题(本大题共10小题,每小题2分,共20分)

1.在数据预处理阶段,缺失值处理方法中,删除含有缺失值的行适用于以下哪种情况?(每题2分)

A.缺失值占比低于5%且数据量足够大

B.缺失值主要集中在少数几个特征上

C.缺失值呈现随机缺失且特征重要度低

D.缺失值存在系统缺失模式

解析:本题考查缺失值处理策略的适用场景。选项A正确,当缺失值占比低于5%且数据量足够大时,删除含有缺失值的行不会显著影响整体样本量,且能保持数据完整性。选项B错误,此时应考虑多重插补等高级方法。选项C错误,随机缺失应采用均值/中位数填充。选项D错误,系统缺失需先识别模式再处理。该知识点出自《2026年数据清洗与预处理技巧习题集》第3章缺失值处理中删除策略适用条件部分,强调需结合数据特征和业务场景综合判断。

2.对于包含异常值的连续型特征,以下哪种标准化方法最合适?(每题2分)

A.Min-Max标准化

B.Z-score标准化

C.MaxAbs标准化

D.Robust标准化

解析:本题考查异常值处理与特征标准化结合。选项B正确,Z-score标准化对异常值不敏感,适用于数据分布接近正态的情况。选项A错误,Min-Max易受异常值影响。选项C错误,MaxAbs不适用于负值数据。选项D错误,Rob

文档评论(0)

1亿VIP精品文档

相关文档