2026年1+X大数据应用与分析模拟考试题及答案.docxVIP

  • 1
  • 0
  • 约3.64千字
  • 约 9页
  • 2026-08-28 发布于四川
  • 举报

2026年1+X大数据应用与分析模拟考试题及答案.docx

2026年1+X大数据应用与分析模拟考试题及答案

1.单项选择题

1.在大数据采集阶段,针对电商平台用户埋点数据,以下哪种采集方式最适合获取用户点击、滑动等行为时序数据?

A.日志采集B.网络爬虫C.数据库同步D.API接口获取

答案:A

解析:日志采集是采集用户行为数据的主流方式,埋点产生的用户点击、滑动等行为时序数据一般通过前端或后端日志采集获取,网络爬虫多用于爬取公开网页内容,数据库同步多用于业务系统数据迁移,API获取多用于获取平台开放的结构化数据,因此选A。

2.在大数据清洗流程中,处理电商用户年龄字段中出现“200”这种超出合理范围数值的问题属于以下哪类清洗操作?

A.缺失值处理B.异常值处理C.重复值处理D.不一致性处理

答案:B

解析:异常值是指超出合理取值范围、不符合业务逻辑的数据,“200岁”明显不符合人类年龄的合理范围,属于异常值,对应异常值处理,因此选B。

3.以下哪种聚类算法需要预先指定聚类数量K?

A.DBSCANB.层次聚类C.K-MeansD.谱聚类

答案:C

解析:K-Means算法的核心步骤第一步就是预先设定聚类数量K,随机初始化K个聚类中心,后续迭代优化,DBSCAN不需要预先指定聚类数量,基于密度聚类,层次聚类是生成聚类树后按需裁剪,谱聚类也不需要提前指定K,因此选C。

4.在大数据可视化中,适合展示不同分类数据占总体比例关

文档评论(0)

1亿VIP精品文档

相关文档