2026年大学统计与大数据分析(数据整理)期末测试卷及答案.docxVIP

  • 10
  • 0
  • 约5.69千字
  • 约 16页
  • 2026-04-12 发布于四川
  • 举报

2026年大学统计与大数据分析(数据整理)期末测试卷及答案.docx

2026年大学统计与大数据分析(数据整理)期末测试卷及答案

1.单选题(每题2分,共20分)

1.1在数据清洗过程中,若某数值型变量存在“-999”表示缺失,下列哪种处理方式最符合统计保守原则?

A.直接删除含“-999”的记录

B.用全局均值替换“-999”

C.用该变量在同类分层下的均值替换“-999”

D.将“-999”视为真值纳入模型

答案:C

1.2对高维分类变量进行独热编码(One-HotEncoding)后,若原变量有k个水平,则新生成的哑变量矩阵的秩为:

A.k

B.k-1

C.k+1

D.与样本量n无关,恒为k

答案:B

1.3使用pandas读取CSV时,参数dtype={id:str}的作用是:

A.把id列缺失值设为空字符串

B.强制id列以字符串类型加载,避免前导零丢失

C.把id列设为索引

D.启用C引擎加速读取

答案:B

1.4在R语言中,函数cut(x,breaks=5,labels=FALSE)默认使用的分箱方法是:

A.等频

B.等宽

C.基于聚类

D.基于决策树

答案:B

1.5对右偏连续变量做Box-Cox变换后,最优λ的估计通常采用:

A.矩估计

B.最大似然

C.中位数回归

D.贝叶斯后验众数

答案:B

1.6在SQL的窗口函数中,ROW_NUMBER()OVER(PARTITI

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档