2026年数据分析与数据挖掘试题库.docxVIP

  • 1
  • 0
  • 约4.15千字
  • 约 14页
  • 2026-08-16 发布于福建
  • 举报

第PAGE页共NUMPAGES页

2026年数据分析与数据挖掘试题库

一、单选题(每题2分,共20题)

1.在处理缺失值时,以下哪种方法最适用于大规模数据集且能较好保留数据分布特征?

A.删除含有缺失值的样本

B.使用均值/中位数/众数填充

C.K最近邻(KNN)填充

D.回归填充

2.以下哪个指标最适合评估分类模型的泛化能力?

A.准确率(Accuracy)

B.过拟合率

C.AUC(AreaUndertheCurve)

D.F1分数

3.在数据预处理中,特征缩放的主要目的是什么?

A.提高模型训练速度

B.消除特征间的量纲差异

C.减少数据噪声

D.增加模型的复杂度

4.假设某电商平台的用户购买行为数据中,用户ID为连续型特征,以下哪种编码方式最合适?

A.One-Hot编码

B.LabelEncoding

C.二进制编码

D.Hash编码

5.在时间序列预测中,ARIMA模型的适用场景是什么?

A.具有强季节性的数据

B.线性关系不明显的数据

C.需要捕捉长期依赖关系的复杂数据

D.空间分布型的数据

6.以下哪种算法属于无监督学习?

A.逻辑回归

B.决策树分类

C.K-means聚类

D.神经网络

7.在处理文本数据时,TF-IDF向量化主要解决什么问题?

A.降低维度

B.去除停用词

文档评论(0)

1亿VIP精品文档

相关文档