- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
大数据自动挖掘“ ”才是现在这些大数据的真正意义
现在大数据火得不行,几乎人人都在说大数据,但到底什么是大数据,恐怕没有多少人知道,
鱼目混珠的人太多。
大数据不是指很多很多数据。
所以不是存储了很多数据就是在搞大数据了,因为 大数据“ ”只是个简称,说全一点应是 大数据“
挖掘 ”,没经过挖掘的大数据只是没有开采出来的原油,一点用处都没有。
大数据也不是指一般意义上的数据挖掘。
有很多人以前是搞数据分析或数据挖掘的,当《大数据时代》这本书一问世、大数据开始火的
时候,他们摇身一变就成了搞大数据的专家了。如果真是这样,就根本没必要提大数据这事儿,因
为它本来就一直存在着,只不过换个说法。就好像我们没必要今天突然提出个说法 饮“H2O ”来代替 “
喝水 ”。嗯,对,那叫玩概念。
大数据挖掘“ ”其实还没有说全,再说完整点,应该是 大数据自动挖掘“ ”。
以前的数据分析或挖掘,是指人通过数据去进行分析,挖掘出一些规律性的东西以供以后使用
。
但面对大数据,由于不光是数据量太大,而且往往包括数据的维度也很多,人已不可能去处理
这样海量的数据,甚至是如何处理都不知道,这时必须用电脑来自动处理,挖掘出数据中的规律。
但是目前电脑还不能像人那样进行严密、复杂的逻辑思维,因此它们也无法用我们人的思维模
式去分析数据,人可能只要较少的数据就能分析出其中的规律,数据多了反而没有办法,所以我们
人类都是采用抽样分析。
电脑则正好相反,无法根据少量数据去分析出规律,但它有一个优势,那就是运算速度非常快
,因此有可能处理海量数据以后找出其中的规律。
由于电脑还不能进行复杂的逻辑思维,所以它的处理方法很简单,就是进行简单的统计运算,
也就是 硬算“ ”,统计出在什么情况会出什么样的结果,然后当类似的情况再出现时,它就会告诉我们
可能会出现某种结果了。
由这里也可看大数据的另一个特点, 即大数据主要是进行预测,告诉你未来将会出现什么样的
结果。而不是只分析出过去的走势和现状,未来还是要由人去判断。
为什么这种简单的方法会有效呢?这就回到 大数据“ ”这个词上来了,那就是因为数据量非常大,
统计出来的结果就往往是正确的。
大家一定都知道这个例子,扔硬币来统计正、反面出现的机率,如果只扔 10次,也许正面出现
9次,以此来得出结论肯定是错的;但如果你扔 10 万次、 100 万次,甚至更多,那你统计出来的结果
基本是正确的,正、反面出现的机率一定是各 50% 。
是的, 大数据自动挖掘就是依据这一原理。
这里没有严密的因果分析,不是通过数据分析出原因再推导出结果;而是通过统计知道有这样
的情况,一般就会有这样的结果,也即现象与结果的相关性。所以大数据就有一个显著的特点,只
关心相关性,不关心因果;用更通俗的话说就是 只知道结果,不知道原因“ ”。
这实际是 人们根据电脑的优势,找出了一个全新的数据分析、挖掘方式,与传统的方式完全
不同,所以传统那些搞数据分析或挖掘的专家并不能称作为搞大数据的。
不过你一定要小心,冷不防你就会碰上一个这样的专家,他们甚至可能是来自某名牌大学的知
名教授之类。进到书店你也会看到许多讲大数据的书,封面无一例外都有很大的 大数据“ ”三个字,但
其实都是在讲传统、人工的数据分析方式,和大数据一点边都不沾。当然,这里不包括《大数据
时代》这本书。
另外,传统搞神经网络、深度学习等人工智能的,也基本不算大数据,因为这里面还是很多人
为因素,包括建模型、对程序进行训练等,这里人仍需要对所分析的业务逻辑非常熟悉才能做,目
前这种方法也难以达到实用的效果。而大数据只是让电脑根据一些简单却巧妙的算法,去进行大量
数据的统计,找出连人都想不到的规律。大数据在这里基本是与业务逻辑无关的,人不需要知道这
是什么业务,比如分析移动互联网行业的数据,他不需要知道这个行业的来龙去脉、当前状况等,
他只需要对大量历史数据进行统计,就能够找出其未来的走势。
说到这,你一定很想问,那就找不到一个真
文档评论(0)