- 1、本文档共72页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
MapReduce应用场景、原理、基本架构及使用方法
MapReduce应用场景、
原理、基本架构及使用
方法
主要内容
1 MapReduce概述
2 MapReduce编程模型
3 MapReduce基本架构和原理
4 MapReduce程序设计
主要内容
1 MapReduce概述
2 MapReduce编程模型
3 MapReduce基本架构和原理
4 MapReduce程序设计
MapReduce概述
Ø 源自于Google的MapReduce论文
ü 发表于2004年12月
ü Hadoop MapReduce是Google MapReduce克隆版
Ø MapReduce特点
ü 易于编程
ü 良好的扩展性
ü 高容错性
ü 适合PB级以上海量数据的离线处理
4
MapReduce的特色—不擅长的方面
Ø 实时计算
ü 像MySQL一样,在毫秒级或者秒级内返回结果
Ø 流式计算
ü MapReduce的输入数据集是静态的,不能动态变化
ü MapReduce 自身的设计特点决定了数据源必须是静
态的
Ø DAG计算
ü 多个应用程序存在依赖关系,后一个应用程序的
输入为前一个的输出
5
主要内容
1 MapReduce概述
2 MapReduce编程模型
3 MapReduce基本架构和原理
4 MapReduce程序设计
MapReduce的实例—Wordcount
Ø 场景:有大量文件,里面存储了单词,
且一个单词占一行
Ø 任务:如何统计每个单词出现的次数?
Ø 类似应用场景:
ü 搜索引擎中,统计最流行的K个搜索词;
ü 统计搜索词频率,帮助优化搜索词提示
7
MapReduce的实例—Wordcount
Ø Case 1:整个文件可以加载到内存中;
ü sort datafile | uniq -c
Ø Case 2:文件太大不能加载到内存中,但
word, count可以存放到内存中;
Ø Case 3:文件太大无法加载到内存中,且
word, count也不行
8
MapReduce的实例—Wordcount
Ø 将问题范化为:有一批文件(规模为TB级或
者 PB级),如何统计这些文件中所有单词出
现的次数;
Ø 方案:首先,分别统计每个文件中单词出现
次数,然后累加不同文件中同一个单词出现
次数;
Ø 典型的MapReduce过程。
9
MapReduce编程模型—WordCount
10
MapReduce编程模型—WordCo
您可能关注的文档
- MB英汉互译.pdf
- MBA组织行为学第二章 文化理论与组织行为学.pdf
- mc9s12xs128模块讲解.pdf
- mcpcb流程简介.pdf
- MCGS触摸屏与电脑之间的Modbus协议.pdf
- MC9S12XS128驱动工具箱详细设计说明书(完整).pdf
- Matlab 数据输入与输出2015-323-413.pdf
- MB+网络模板用户手册.pdf
- MCTC-CTW-A1轿顶一体箱用户手册.pdf
- MCX501简体版.pdf
- 2024至2030年D-葡萄糖酸钠项目投资价值分析报告.docx
- 2024至2030年抓痒刷项目投资价值分析报告.docx
- 2024年GPS导航系统项目可行性研究报告.docx
- 2024至2030年中国钢塑复合反应釜行业投资前景及策略咨询研究报告.docx
- 2024年塑料仪器项目可行性研究报告.docx
- 2024年束腰带项目可行性研究报告.docx
- 2024至2030年中国气动异型玻璃切割机行业投资前景及策略咨询研究报告.docx
- 2024至2030年翘角四方盘项目投资价值分析报告.docx
- 2024至2030年中国户外式电力稳压器数据监测研究报告.docx
- 2024至2030年中国高纯超细碳酸钡行业投资前景及策略咨询研究报告.docx
文档评论(0)