- 1、本文档共59页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
大数据存储分析
大数据量。“小分析学”。此处的目标是对极大量的数据集使用SQL。对大数据集,没有人会用“Select *”来查询因为其返回太子节(terabyte)的数据使接收者无法应付。替代方案,则是对海量数据把注意力放在SQL的分析功能上,如count、sum、max、min、avg等,可辅之以group_by。我将此称作“小分析学”,以便把这个用例(use case)区别于下面的场合。 对大量数据使用大分析学。“大分析学”在此的含义是:对海量数据施用数据聚类(clustering)、回归分析、机器学习、以及其他更为复杂的分析手段。目前,用户倾向于采用统计学软件包如R、SPSS、SAS等来实现。其他方案是使用线性代数软件包,例如:ScalaPack或Arpack。最后,也有大量自行开发的代码在使用中。 大速度。其含义是:对电子交易、实时网页广告投放、实时客户针对营销、移动社交网络等应用,能够吸收并处理“灭火水龙带”式的数据涌入。此用例在大型网站公司和华尔街盛行,二者都倾向于自行开发。 大多样性。许多企业面临整合日益扩大的多种数据源,而数据格式千差万别,例如:电子表格、网页、XML、传统的关系型数据库等。许多企业认为这是最头疼的问题。从历史上来说,萃取、转置、加载(ETL)供应商在此市场上对有限的数据源曾提供服务。 * 大数据量。“小分析学”。此处的目标是对极大量的数据集使用SQL。对大数据集,没有人会用“Select *”来查询因为其返回太子节(terabyte)的数据使接收者无法应付。替代方案,则是对海量数据把注意力放在SQL的分析功能上,如count、sum、max、min、avg等,可辅之以group_by。我将此称作“小分析学”,以便把这个用例(use case)区别于下面的场合。 对大量数据使用大分析学。“大分析学”在此的含义是:对海量数据施用数据聚类(clustering)、回归分析、机器学习、以及其他更为复杂的分析手段。目前,用户倾向于采用统计学软件包如R、SPSS、SAS等来实现。其他方案是使用线性代数软件包,例如:ScalaPack或Arpack。最后,也有大量自行开发的代码在使用中。 大速度。其含义是:对电子交易、实时网页广告投放、实时客户针对营销、移动社交网络等应用,能够吸收并处理“灭火水龙带”式的数据涌入。此用例在大型网站公司和华尔街盛行,二者都倾向于自行开发。 大多样性。许多企业面临整合日益扩大的多种数据源,而数据格式千差万别,例如:电子表格、网页、XML、传统的关系型数据库等。许多企业认为这是最头疼的问题。从历史上来说,萃取、转置、加载(ETL)供应商在此市场上对有限的数据源曾提供服务。 * 大数据量。“小分析学”。此处的目标是对极大量的数据集使用SQL。对大数据集,没有人会用“Select *”来查询因为其返回太子节(terabyte)的数据使接收者无法应付。替代方案,则是对海量数据把注意力放在SQL的分析功能上,如count、sum、max、min、avg等,可辅之以group_by。我将此称作“小分析学”,以便把这个用例(use case)区别于下面的场合。 对大量数据使用大分析学。“大分析学”在此的含义是:对海量数据施用数据聚类(clustering)、回归分析、机器学习、以及其他更为复杂的分析手段。目前,用户倾向于采用统计学软件包如R、SPSS、SAS等来实现。其他方案是使用线性代数软件包,例如:ScalaPack或Arpack。最后,也有大量自行开发的代码在使用中。 大速度。其含义是:对电子交易、实时网页广告投放、实时客户针对营销、移动社交网络等应用,能够吸收并处理“灭火水龙带”式的数据涌入。此用例在大型网站公司和华尔街盛行,二者都倾向于自行开发。 大多样性。许多企业面临整合日益扩大的多种数据源,而数据格式千差万别,例如:电子表格、网页、XML、传统的关系型数据库等。许多企业认为这是最头疼的问题。从历史上来说,萃取、转置、加载(ETL)供应商在此市场上对有限的数据源曾提供服务。 * 大数据量。“小分析学”。此处的目标是对极大量的数据集使用SQL。对大数据集,没有人会用“Select *”来查询因为其返回太子节(terabyte)的数据使接收者无法应付。替代方案,则是对海量数据把注意力放在SQL的分析功能上,如count、sum、max、min、avg等,可辅之以group_by。我将此称作“小分析学”,以便把这个用例(use case)区别于下面的场合。 对大量数据使用大分析学。“大分析学”在此的含义是:对海量数据施用数据聚类(clustering)、回归分析、机器学习、以及其他更为复杂的分析手段。目前,用户倾向于采用统计学软件包如R、SPSS、SAS等来实现。其他方案是使
您可能关注的文档
- 如果想引用不同工作簿中某一个单元格区域格式应该是怎样的解析.doc
- 大工-编译原理课程总复习----贾棋靠谱~~分析.ppt
- 大学语文行政公文概述分析.ppt
- 大小嶝一日游分析.ppt
- 妇产科介入手术治疗解析.ppt
- 如皋中学2013-2014学年高二下学期4月阶段练习政治试题解析.doc
- 妇产科完整病历1解析.doc
- 大数据--学习笔记分析.doc
- 大拇指汤拇分析.ppt
- 妇女创业小额担保贷款管理实施细则(试行)解析.doc
- 原电池电动势的测定实验报告.pdf
- 与业主、设计、总包、监理和他承包人的配合措施.pdf
- 公司管理流程.pptx
- 2024_2025学年新教材高中地理第1章地球的运动素养综合训练新人教版选择性必修1.doc
- 2024_2025学年新教材高中地理第3章大气的运动第1节常见天气系统第1课时锋与天气分层作业新人教版选择性必修1.doc
- 2024_2025学年新教材高中地理第1章地球的运动第2节地球运动的地理意义第4课时正午太阳高度的变化四季更替和五带划分分层作业课件新人教版选择性必修1.pptx
- 2024_2025学年新教材高中地理第2章地表形态的塑造第2节构造地貌的形成第1课时地质构造与地貌课件新人教版选择性必修1.pptx
- 2024_2025学年新教材高中地理第1章地球的运动问题研究人类是否需要人造月亮课件新人教版选择性必修1.pptx
- 五片小雪花课件.pdf
- 2024_2025学年新教材高中地理第3章大气的运动第2节气压带和风带第1课时气压带和风带的形成分层作业课件新人教版选择性必修1.pptx
文档评论(0)