- 1
- 0
- 约1.47万字
- 约 33页
- 2026-09-17 发布于上海
- 举报
2026年大数据数据挖掘试卷及详解
一、单项选择题(共10题,每题1分,共10分)
在数据预处理过程中,用于检测并处理数据集中重复记录的技术通常被称为?
A.数据变换
B.数据集成
C.数据归约
D.数据清洗
答案:D
解析:数据清洗是数据预处理的一个重要环节,其主要任务包括处理缺失值、平滑噪声数据、识别并处理离群点以及检测并消除重复记录(也称为重复数据删除)。数据变换(A)侧重于将数据转换为适合挖掘的形式,如规范化、离散化等。数据集成(B)是将来自多个数据源的数据合并成一致的数据存储。数据归约(C)则是通过技术手段减少数据量,但保持数据集的完整性。
以下哪个算法不属于经典的关联规则挖掘算法?
A.Apriori算法
B.FP-Growth算法
C.K-Means算法
D.Eclat算法
答案:C
解析:K-Means算法是一种经典的聚类分析算法,用于将数据点划分为K个簇,不属于关联规则挖掘范畴。Apriori算法(A)、FP-Growth算法(B)和Eclat算法(D)都是用于从大规模数据集中发现项之间有趣关系的关联规则挖掘算法。
在分类模型的评估中,真正例(TP)是指?
A.模型预测为负,实际也为负的样本数
B.模型预测为正,实际也为正的样本数
C.模型预测为正,实际为负的样本数
D.模型预测为负,实际为正的样本数
答案:B
解析:真正例(TruePo
原创力文档

文档评论(0)