大数据信息整理.docx

  1. 1、本文档共11页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
大数据信息整理

1.什么是大数据对于“大数据”(Big data)研究机构Gartner给出了这样的定义。“大数据”是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力来适应海量、高增长率和多样化的信息资产。麦肯锡全球研究所给出的定义是:一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合,具有海量的数据规模、快速的数据流转、多样的数据类型和价值密度低四大特征。大数据技术的战略意义不在于掌握庞大的数据信息,而在于对这些含有意义的数据进行专业化处理。换而言之,如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。从技术上看,大数据与云计算的关系就像一枚硬币的正反面一样密不可分。大数据必然无法用单台的计算机进行处理,必须采用分布式架构。它的特色在于对海量数据进行分布式数据挖掘。但它必须依托云计算的分布式处理、分布式数据库和云存储、虚拟化技术。随着云时代的来临,大数据(Big data)也吸引了越来越多的关注。《著云台》的分析师团队认为,大数据(Big data)通常用来形容一个公司创造的大量非结构化数据和半结构化数据,这些数据在下载到关系型数据库用于分析时会花费过多时间和金钱。大数据分析常和云计算联系到一起,因为实时的大型数据集分析需要像MapReduce一样的框架来向数十、数百或甚至数千的电脑分配工作。大数据需要特殊的技术,以有效地处理大量的容忍经过时间内的数据。适用于大数据的技术,包括大规模并行处理(MPP)数据库、数据挖掘电网、分布式文件系统、分布式数据库、云计算平台、互联网和可扩展的存储系统。最小的基本单位是bit,按顺序给出所有单位:bit、Byte、KB、MB、GB、TB、PB、EB、ZB、YB、BB、NB、DB。它们按照进率1024(2的十次方)来计算:1 Byte =8 bit1?KB?= 1,024 Bytes = 8192 bit1?MB?= 1,024 KB = 1,048,576 Bytes1?GB?= 1,024 MB = 1,048,576 KB1?TB?= 1,024 GB = 1,048,576 MB1?PB?= 1,024 TB = 1,048,576 GB1?EB?= 1,024 PB = 1,048,576 TB1?ZB?= 1,024 EB = 1,048,576 PB1?YB?= 1,024 ZB = 1,048,576 EB1?BB?= 1,024 YB = 1,048,576 ZB1?NB?= 1,024 BB = 1,048,576 YB1?DB?= 1,024 NB = 1,048,576 BB全称:1?Bit(比特) =Binary Digit8Bits?= 1 Byte(字节)1,000 Bytes = 1 Kilobyte1,000Kilobytes = 1 Megabyte1,000 Megabytes = 1 Gigabyte1,000 Gigabytes = 1Terabyte1,000 Terabytes = 1 Petabyte1,000 Petabytes = 1 Exabyte1,000Exabytes = 1 Zettabyte1,000 Zettabytes = 1 Yottabyte1,000 Yottabytes = 1Brontobyte1,000 Brontobytes = 1 Geopbyte2.大数据和普通数据的区别第一,现在的大数据分析,跟传统意义的分析有一个本质区别,就是传统的分析是基于结构化、关系性的数据。而且往往是取一个很小的数据集,来对整个数据进行预测和判断。但现在是大数据时代,理念已经完全改变了,现在的大数据分析,是对整个数据全集直接进行存储和管理分析。第二,以前的分析是小样本分析,所以往往要用小样本来预测整个数据全集的特性,这就决定了所采集的小样本必须是高品质的,否则预测出来的结果就会出现很大偏差。现在的大数据分析,是对数据全集的分析,所以要对数据的一些噪音有一定的包容性。大数据不是样本思维,它是一个完整的全面的系统。在现在的互联网时代,我们要的是尽可能全面的数据,而不是数据的某一个样本或抽样。因而也有人将大数据称为全数据。第三,原先传统的数据分析,是根据小样本数据的分析对全局数据进行分析和预测。所以在整个预测分析过程中往往采用因果关系的推理过程。现在的大数据分析,因果关系并不是关注点,而是基于对整个数据全集的分析。对企业来说需要了解的是,关联性的分析和规律性的特性。比如啤酒往往跟尿布的销售同步上升,那么在大数据的分析下,我们不需要了解为什么啤酒和尿布的销售量会同步增长,只需要知道尿布和啤酒是同步上升就可以了,基于这个结果,就可以制定很多商业策

您可能关注的文档

文档评论(0)

haihang2017 + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档