- 1
- 0
- 约4.15千字
- 约 14页
- 2026-08-16 发布于福建
- 举报
第PAGE页共NUMPAGES页
2026年数据分析与数据挖掘试题库
一、单选题(每题2分,共20题)
1.在处理缺失值时,以下哪种方法最适用于大规模数据集且能较好保留数据分布特征?
A.删除含有缺失值的样本
B.使用均值/中位数/众数填充
C.K最近邻(KNN)填充
D.回归填充
2.以下哪个指标最适合评估分类模型的泛化能力?
A.准确率(Accuracy)
B.过拟合率
C.AUC(AreaUndertheCurve)
D.F1分数
3.在数据预处理中,特征缩放的主要目的是什么?
A.提高模型训练速度
B.消除特征间的量纲差异
C.减少数据噪声
D.增加模型的复杂度
4.假设某电商平台的用户购买行为数据中,用户ID为连续型特征,以下哪种编码方式最合适?
A.One-Hot编码
B.LabelEncoding
C.二进制编码
D.Hash编码
5.在时间序列预测中,ARIMA模型的适用场景是什么?
A.具有强季节性的数据
B.线性关系不明显的数据
C.需要捕捉长期依赖关系的复杂数据
D.空间分布型的数据
6.以下哪种算法属于无监督学习?
A.逻辑回归
B.决策树分类
C.K-means聚类
D.神经网络
7.在处理文本数据时,TF-IDF向量化主要解决什么问题?
A.降低维度
B.去除停用词
原创力文档

文档评论(0)