数据科学题库及分析.docxVIP

  • 2
  • 0
  • 约1.26万字
  • 约 30页
  • 2026-07-18 发布于上海
  • 举报

数据科学题库及分析

一、单项选择题(共10题,每题1分,共10分)

在数据科学项目中,以下哪项通常被认为是数据预处理的首要步骤?

A.特征选择

B.数据可视化

C.数据清洗

D.模型训练

答案:C

解析:数据预处理的首要步骤通常是数据清洗。数据清洗旨在处理数据集中存在的缺失值、异常值、重复值和不一致性问题,为后续的特征工程、建模和分析提供干净、可靠的数据基础。如果直接进行特征选择(A)或模型训练(D),而未处理脏数据,可能导致模型偏差和性能下降。数据可视化(B)是探索性数据分析的一部分,通常用于理解数据分布和发现潜在模式,但并非首要的、强制性的预处理步骤。

关于“过拟合”现象的描述,以下哪项最准确?

A.模型在训练集和测试集上表现都很好

B.模型在训练集上表现差,在测试集上表现好

C.模型在训练集上表现好,但在测试集上表现差

D.模型在训练集和测试集上表现都差

答案:C

解析:过拟合是指机器学习模型过度学习了训练数据中的细节和噪声,导致其在训练集上表现优异(例如,准确率很高),但在未见过的测试集或新数据上表现泛化能力差,预测精度显著下降。选项A描述的是理想情况或欠拟合得到改善后的状态。选项B描述的情况较为罕见,可能表明数据划分有问题。选项D描述的是典型的欠拟合现象,即模型未能充分学习数据中的基本模式。

在评估分类模型的性能时,以下哪个指标对类别不平衡的数据集最为敏感

文档评论(0)

1亿VIP精品文档

相关文档