- 2
- 0
- 约6.65千字
- 约 14页
- 2026-07-21 发布于辽宁
- 举报
2026年50大数据面试题及答案
一、填空题(每题2分,共20分)
1.数据仓库中的星型模型通常包含一个中心事实表和多个维度表。
2.在Hadoop生态系统中,HDFS是分布式文件系统,而MapReduce是计算框架。
3.机器学习中的过拟合现象是指模型在训练数据上表现很好,但在测试数据上表现较差。
4.数据挖掘中的关联规则挖掘通常使用Apriori算法。
5.大数据技术中的NoSQL数据库包括MongoDB、Cassandra和Redis。
6.在数据预处理中,缺失值处理的方法包括删除、填充和插值。
7.数据可视化中常用的图表类型包括折线图、柱状图和饼图。
8.机器学习中的集成学习方法包括随机森林和梯度提升树。
9.数据仓库中的ETL过程包括抽取、转换和加载。
10.大数据平台中的Spark框架支持内存计算,提高了数据处理效率。
二、判断题(每题2分,共20分)
1.数据湖是集中存储结构化、半结构化和非结构化数据的存储系统。(正确)
2.数据挖掘中的聚类分析是一种无监督学习方法。(正确)
3.Hadoop的YARN框架是资源管理器,MRv1是MapReduce的调度器。(错误)
4.机器学习中的交叉验证是一种模型评估方法。(正确)
5.数据仓库中的雪花模型比星型模型更加复杂。(正确)
6.NoSQL数据库通常不支持事务处理。(错误)
7.数据
原创力文档

文档评论(0)