- 0
- 0
- 约4.52千字
- 约 14页
- 2026-08-13 发布于福建
- 举报
第PAGE页共NUMPAGES页
2026年数据科学进阶模拟试题含大数据分析处理
一、单选题(共10题,每题2分,合计20分)
1.在大数据处理中,Hadoop生态系统中负责数据存储的核心组件是?
A.MapReduce
B.Hive
C.HDFS
D.YARN
2.在分布式计算框架中,Spark的RDD(弹性分布式数据集)与Hadoop的MapReduce任务相比,主要优势在于?
A.更高的容错性
B.更低的延迟
C.更强的数据共享能力
D.以上都是
3.以下哪种算法适用于大规模稀疏数据的协同过滤推荐?
A.线性回归
B.梯度提升树(GBDT)
C.基于矩阵分解的SVD
D.K-means聚类
4.在自然语言处理中,BERT模型预训练时主要使用的任务包括?
A.命名实体识别
B.机器翻译
C.文本分类与掩码语言模型
D.关系抽取
5.大数据实时处理中,Kafka与Flume的主要区别在于?
A.数据持久化方式
B.分布式架构设计
C.高吞吐量与低延迟特性
D.数据加密能力
6.在数据仓库设计中,星型模式与雪花模式的主要区别在于?
A.数据冗余程度
B.维度表结构
C.查询效率
D.以上都是
7.以下哪种技术可以有效解决大规模数据集的梯度消失问题?
A.Dropout
B.BatchNormaliza
原创力文档

文档评论(0)