一点资讯大数据岗位面试题库及详细答案(真实职场版).docxVIP

  • 1
  • 0
  • 约5.25千字
  • 约 7页
  • 2026-08-24 发布于河北
  • 举报

一点资讯大数据岗位面试题库及详细答案(真实职场版).docx

一点资讯大数据岗位面试题库及详细答案(真实职场版)

一、大数据基础高频面试题(必问)

1、说说Hadoop三大核心组件及各自作用,结合资讯行业场景说明

答案:Hadoop核心是HDFS、YARN、MapReduce,我在一点资讯的业务场景中经常用到,三者分工很明确:

第一,HDFS是分布式文件存储,主要存海量的原始日志、用户行为数据、文章内容素材。一点资讯每天会产生TB级的用户点击、浏览、停留、点赞、转发日志,还有海量图文、短视频素材,本地磁盘存不下,HDFS多副本机制能保证数据不丢失,支撑离线数据长期存储。

第二,YARN是资源调度框架,相当于集群的“管家”。Spark、Hive、MapReduce的任务都由它分配CPU、内存资源,避免任务抢占资源、集群拥堵。资讯平台定时的离线统计任务、用户画像计算任务,都是靠YARN调度执行。

第三,MapReduce是离线计算引擎,基于分而治之的思想处理海量数据。日常用来做简单的日志清洗、UV统计、文章曝光量统计,虽然现在主流用Spark,但很多老旧离线任务还在依赖MR,稳定性很强。

2、HDFS的读写流程简述,日常工作中遇到的HDFS问题有哪些?

答案:

读流程:客户端先请求NameNode获取文件的块存储节点位置,然后直接和DataNode建立连接,读取对应数据块,优先读取本地、同机架节点数据,提升速度。

写流程:客户端上传文件先请求N

文档评论(0)

1亿VIP精品文档

相关文档