大数据工程师-数据处理与分析-Apache Hadoop_Hadoop生态系统:Spark大数据处理引擎.docxVIP

  • 6
  • 0
  • 约2.27万字
  • 约 28页
  • 2024-10-19 发布于辽宁
  • 举报

大数据工程师-数据处理与分析-Apache Hadoop_Hadoop生态系统:Spark大数据处理引擎.docx

PAGE1

PAGE1

Hadoop基础

1Hadoop概述

Hadoop是一个开源软件框架,用于分布式存储和处理大规模数据集。它由Apache软件基金会开发,主要设计用于在集群上运行,能够处理PB级别的数据。Hadoop的核心是HDFS(HadoopDistributedFileSystem)和MapReduce,它们分别负责数据的存储和处理。

2Hadoop历史与发展

Hadoop的起源可以追溯到Google的两篇论文:《Google文件系统》和《MapReduce:简化大规模数据处理》。2006年,DougCutting和MikeCafarella开始在Nu

文档评论(0)

1亿VIP精品文档

相关文档