- 1
- 0
- 约3.76千字
- 约 8页
- 2019-06-07 发布于北京
- 举报
Hadoop生态圈背后隐藏的“凶险”
伴随互联网的高速发展,大数据成为炙手可热的时髦产物。随之而来的是关于大数据的存储与计算问题。作为能够对大量数据进行分布式处理的软件框架Hadoop目前已经发展成为分析大数据的领先平台,它能够以一种可靠、高效、可伸缩的方式进行数据处理。
一、Hadoop生态圈的形成
大数据是个宽泛的问题,而Hadoop生态圈是最佳的大数据的解决方案。Hadoop生态圈的所有内容基本都是为了处理超过单机范畴的数据而产生的。
HDFSMapReduce
在最开始阶段Hadoop只包含HDFS(Hadoop Distributed FileSystem)和MapReduce两个组件。HDFS的设计本质是为解决大量数据分别存储于成百上千台机器上的问题,让客户看到的是一个文件系统而非很多文件系统,屏蔽复杂的底层调用。好比用户想要取/liusicheng/home/test1下的数据,只需要得到准确的路径即可获得数据,至于数据实际上被存放在不同的机器上这点用户根本不需要关心。HDFS帮助客户管理分散在不同机器上的PG级数据。这些数据如果都放在一台机器上处理,一定会导致恐怖的等待时间。于是,客户选择使用很多台机器处理数据。
Hadoop的第二个重要组件MapReduce被设计用来解决对多台机器实现工作分配
您可能关注的文档
- 10个“天南地北”的小故事 反思大数据 .doc
- 10个必须收藏的PHP代码样例 .doc
- 10大行业大数据应用痛点及解决策略 .doc
- 10步带你认识大数据和云计算,走出懵逼圈 .doc
- 12个顶级大数据工具 .doc
- 13张图看6年来数据科学概念之争 .doc
- 16个用于数据科学和机器学习的顶级平台 .doc
- 19个让你得到真正回报的大数据认证 .doc
- 2011年LSI紧抓SAS力战固态存储 .doc
- 2017全球TOP10数据科学公司榜单出炉 .doc
- 2026年历史知识竞赛中国古代史纲要题目集.docx
- DB32/T 5403-2026省级陆生野生动物收容救护中心建设规范.pdf
- DB32/T 5422-2026粳稻产量品质效率协同提升机械化栽培技术规程.pdf
- DB51T3379-2026淫羊藿林下种植技术规程.pdf
- DB51T3376-2026基层气象防灾减灾地图编绘规范.pdf
- DB32/T 5426-2026稻麦体系收获季土壤火焰高温灭活技术规程.pdf
- DB51T3378-2026四川省水利江河湖泊类对象编码规范.pdf
- DB32/T 5416-2026水中病毒的富集浓缩方法.pdf
- DB34T3144-2026长输天然气管道交流杂散电流干扰检测.pdf
- DB51T511-2026山羊人工授精技术规范.pdf
原创力文档

文档评论(0)