- 2
- 0
- 约小于1千字
- 约 66页
- 2019-01-02 发布于湖北
- 举报
数据分析技术与方法;2;;体量Volume;;分析技术:
统计和分析:A/B test; top N排行榜;地域占比;文本情感分析
数据挖掘:关联规则分析;分类;聚类
模型预测:预测模型;机器学习;建模仿真
;数据处理与分析框架;8;9;Hadoop 生态系统;11;12;13;14;15;16;17;18;Storm——Topology;Storm应用程序执行过程;Hadoop与Storm概念对比;Hadoop在2003年从Nutch发展到Lucene,在Yahoo成长,进入Apache孵化,2008年获得大量使用。但一直存在MR算法少、每次Reduce都需要磁盘读写、MR需要成对出现、Master节点调度慢、单节点等等问题。
Spark2007年在Yahoo起步,用于改善MR算法。2009年独立为一个项目,2010年开源,2013年进入Apache孵化。被称为以下一代计算平台。
Berkeley大学成为大数据技术中心,Berkeley Data Analysis Stack(BDAS)逐步形成大数据平台。;Spark和MapReduce比较;安装配置与简介;从实例开始, 漫游Spark内核;Your application;Hadoop+Storm -Spark;;29;30;数据整理:ETL;32;33;34;35;36;构建数据仓库五步法;38;39;40;DW模型架构介绍
原创力文档

文档评论(0)