- 1、本文档共21页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
Newland Enterprise Solutions
Copyright @Newland corporation 2011 All Right Reserved
大数据时代
*
不知道BIG DATA? 你out了!
反对派认为,我们现在处在一个盲目的大数据崇拜时代
*
目录
*
21世纪是数据信息大发展的时代,移动互联、社交网络、电子商务等极大拓展了互联网的边界和应用范围,各种数据正在迅速膨胀并变大。
互联网(社交、搜索、电商)、移动互联网(微博)、物联网(传感器,智慧地球)、车联网、GPS、医学影像、安全监控、金融(银行、股市、保险)、电信(通话、短信)都在疯狂产生着数据。
“大数据”的诞生:
半个世纪以来,随着计算机技术全面融入社会生活,信息爆炸已经积累到了一个开始引发变革的程度。它不仅使世界充斥着比以往更多的信息,而且其增长速度也在加快。信息爆炸的学科如天文学和基因学,创造出了“大数据”这个概念*。如今,这个概念几乎应用到了所有人类智力与发展的领域中。
大数据时代的背景
*
想驾驭这庞大的数据,我们必须了解大数据的特征。
地球上至今总共的数据量:
在2006 年,个人用户才刚刚迈进TB时代,全球一共新产生了约180EB的数据;
在2011 年,这个数字达到了1.8ZB。
而有市场研究机构预测:
到2020 年,整个世界的数据总量将会增长44 倍,达到35.2ZB(1ZB=10 亿TB)!
1PB = 2^50字节
1EB = 2^60字节
1ZB = 2^70字节
大数据时代的爆炸增长
*
目录
*
1、密不可分的大数据与云计算
商业模式驱动
应用需求驱动
云计算本身也是大数据的一种业务模式
大数据是落地的云
云计算的模式是业务模式,本质是数据处理技术。
数据是资产,云为数据资产提供存储、访问和计算。
当前云计算更偏重海量存储和计算,以及提供的云服务,运行云应用,但是缺乏盘活数据资产的能力,挖掘价值性信息和预测性分析,为国家、企业、个人提供决策和服务,是大数据核心议题,也是云计算的最终方向。
*
2、大数据不仅仅是“大”
多大?
至少PB 级
比大更重要的是数据的复杂性,有时甚至大数据中的小数据如一条微博就具有颠覆性的价值
*
3、软件是大数据的引擎
和数据中心(Data Center) 一样,软件是大数据的驱动力,软件改变世界
*
大数据生态:软件是引擎
*
4、大数据的应用不仅仅是精准营销
通过用户行为分析实现精准营销是大数据的典型应用,但是大数据在各行各业特别是公共服务领域具有广阔的应用前景
消费行业
金融服务
食品安全
医疗卫生
军事
交通环保
电子商务
气象
*
5、管理大数据“易”理解大数据“难”
虽然大数据是一个重大问题,真正的问题是让大数据更有意义
目前大数据管理多从架构和并行等方面考虑,解决高并发数据存取的性能要求及数据存储的横向扩展,但对非结构化数据的内容理解仍缺乏实质性的突破和进展,这是实现大数据资源化、知识化、普适化的核心
非结构化海量信息的智能化处理:自然语言理解、多媒体内容理解、机器学习等
*
目录
*
分析技术:
数据处理:自然语言处理技术
统计和分析:A/B test; top N排行榜;地域占比;文本情感分析
数据挖掘:关联规则分析;分类;聚类
模型预测:预测模型;机器学习;建模仿真
大数据技术:
数据采集:ETL工具
数据存取:关系数据库;NoSQL;SQL等
基础架构支持:云存储;分布式文件系统等
计算结果展现:云计算;标签云;关系图等
存储
结构化数据:
海量数据的查询、统计、更新等操作效率低
非结构化数据
图片、视频、word、pdf、ppt等文件存储
不利于检索、查询和存储
半结构化数据
转换为结构化存储
按照非结构化存储
解决方案:
Hadoop(MapReduce技术)
流计算(twitter的storm和yahoo!的S4)
一些相关技术
*
行业拓展者,打造大数据行业基石:
IBM:
IBM大数据提供的服务包括数据分析,文本分析,蓝色云杉(混搭供电合作的网络平台);业务事件处理;IBM Mashup Center的计量,监测,和商业化服务(MMMS)
IBM的大数据产品组合中的最新系列产品的InfoSphere bigInsights,基于Apache Hadoop。
该产品组合包括:
打包的Apache Hadoop的软件和服务,代号是bigInsights核心,用于开始大数据分析
软件被称为bigsheet,软件目的是帮助从大量数据中轻松、简单、直观的提取、批注相关信息
为金融,风险管理,媒体和娱乐等行业量身定做的行业解决方案
微软:
2011年1月与惠普(具体而言是HP数据库综合应用部门) 合作目标是开发了一系列能够提升生产
您可能关注的文档
- 大客户销售管理手册.pptx
- 大客户销售策略管理培训.pptx
- 大客户销售谋略培训张斌.pptx
- 大客户销售谋略(英文PPT159.pptx
- 大客户顾问式销售与管理教材.pptx
- 大富豪购物广场整合营销推广策略.pptx
- 大家顾问_商业街培训.pptx
- 大屿山旅游热東涌綫客量舖租升.pptx
- 大屏幕彩色电视机.pptx
- 大屏幕多媒体会议室系统基础知识.pptx
- (中考考试易错题)易错类型10 物质检验 鉴别 除杂 分离“五大”易错防范(解析版).pdf
- (中考考试易错题)易错点11 利用滑轮组提升重物的做功及效率问题(原卷版).pdf
- (中考考试易错题)易错点14 欧姆定律有关概念及相关应用问题(解析版).pdf
- (中考考试易错题)易错点06 不规则物体对应的压强大小问题(原卷版).docx
- (中考考试易错题)易错点07 被动语态(原卷版).docx
- (中考考试易错题)易错点14 易混形容词和副词辨析(原卷版).pdf
- (中考考试易错题)易错点03 弹性形变与拉力大小关系类问题(原卷版).pdf
- (中考考试易错题)易错点01 机械运动-备战2024年中考物理考试易错题(原卷版).pdf
- (中考考试易错题)易错点09 不做功情况分析及功、功率、能量辨识问题(解析版).docx
- (中考考试易错题)易错点08 浮沉条件辅助判定浮力大小的问题(解析版).pdf
文档评论(0)