2026年数据科学试题及详解.docxVIP

  • 0
  • 0
  • 约1.21万字
  • 约 29页
  • 2026-08-10 发布于上海
  • 举报

2026年数据科学试题及详解

一、单项选择题(共10题,每题1分,共10分)

在数据科学项目中,下列哪一项通常被认为是数据预处理流程中最先进行的步骤?

A.数据清洗(如处理缺失值、异常值)

B.数据集成(合并多个数据源)

C.数据归约(降维、数据压缩)

D.数据变换(如规范化、离散化)

答案:B

解析:数据预处理的流程通常遵循一个逻辑顺序。数据集成是将来自不同来源的数据合并到一个统一的数据存储中的过程,这是后续所有处理步骤(如清洗、归约、变换)的基础。如果数据尚未集成,其他步骤将无法在统一的数据集上进行。因此,数据集成通常是第一步。

关于“过拟合”现象,以下描述最准确的是?

A.模型在训练集和测试集上表现均不佳

B.模型在训练集上表现完美,但在未见过的测试集上表现很差

C.模型过于简单,无法捕捉数据中的潜在模式

D.模型训练过程中损失函数不再下降

答案:B

解析:过拟合是指机器学习模型在训练数据上表现过于优秀,甚至学习了训练数据中的噪声和随机波动,导致其泛化能力下降,在未见过的测试数据或新数据上表现显著变差。选项A描述的是欠拟合,选项C描述的也是欠拟合,选项D描述的可能是在训练后期损失函数收敛的情况,不一定是过拟合。

在逻辑回归模型中,我们通常使用哪种函数将线性回归的输出映射到(0,1)区间,以表示概率?

A.ReLU函数

B.Sigmoid函数

C.Tanh

文档评论(0)

1亿VIP精品文档

相关文档