- 5
- 0
- 约1.03万字
- 约 23页
- 2026-04-23 发布于四川
- 举报
大数据分析师考试题及答案
一、单项选择题(每题2分,共30分)
1.在数据预处理阶段,处理缺失值时,以下哪种方法通常被认为是最不可取的?
A.使用该特征的均值或中位数进行填充
B.使用机器学习模型预测缺失值
C.直接删除包含缺失值的记录
D.使用众数或一个特定的常量(如“未知”)进行填充
2.关于Hadoop生态系统中HDFS的描述,以下哪项是正确的?
A.HDFS适合存储大量小文件
B.HDFS采用主从(Master/Slave)架构,其中NameNode负责存储实际数据块
C.HDFS默认的数据块大小是64MB
D.HDFS具有高容错性,通过数据多副本机制实现
3.在A/B测试中,为了判断实验组和对照组之间的差异是否具有统计显著性,最常用的检验方法是?
A.卡方检验
B.T检验
C.F检验
D.Z检验
4.以下关于数据仓库“星型模型”和“雪花型模型”的比较,错误的是?
A.星型模型查询性能通常优于雪花型模型
B.雪花型模型规范化程度更高,减少了数据冗余
C.星型模型的事实表直接连接多个维度表,维度表没有进一步规范化
D.雪花型模型的事实表通过多层维度表连接,结构更复杂,但维护更简单
5.对于一个高度偏态(右偏)的数值型数据分布,在描述其集中趋势时,以下哪个指标最为稳健?
A.算术平均数
B.几何平均数
C.中位数
D.众数
6.在逻辑回归
原创力文档

文档评论(0)