2026年数据清洗与预处理技术专项训练题库.docxVIP

  • 1
  • 0
  • 约1.34万字
  • 约 36页
  • 2026-10-02 发布于广东
  • 举报

2026年数据清洗与预处理技术专项训练题库.docx

2026年数据清洗与预处理技术专项训练题库

一、单项选择题(本大题共10小题,每小题2分,共20分)

1.在数据预处理阶段,缺失值处理方法中,删除含有缺失值的行适用于以下哪种情况?(每题2分)

A.缺失值占比低于5%且数据量足够大

B.缺失值主要集中在特定类别中

C.缺失值呈现随机分布且不影响主要分析目标

D.缺失值与目标变量存在强相关性

解析:本题考查缺失值处理策略的适用场景。选项A正确,当缺失值占比低于5%且数据量足够大时,删除含有缺失值的行不会显著影响整体样本代表性。选项B错误,此时应考虑插补方法。选项C错误,随机缺失值应优先考虑插补而非删除。选项D错误,此时应考虑使用基于模型的插补方法。该知识点源自《2026年数据清洗与预处理技术专项训练题库》第3章缺失值处理中的典型场景分析,强调删除方法需满足数据完整性要求。

2.对于包含异常值的连续型数值特征,以下哪种标准化方法最适用于保留异常值信息?(每题2分)

A.Min-Max标准化

B.Z-score标准化

C.Robust标准化

D.L1标准化

解析:本题考查异常值处理与特征工程结合的标准化方法选择。Robust标准化基于中位数和四分位距,对异常值不敏感,适用于包含异常值的数据集。Min-Max标准化易受异常值影响,Z-score标准化会显著降低异常值权重,L

文档评论(0)

1亿VIP精品文档

相关文档