- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
知识发现与数据挖掘
内容提要:本文介绍了知识发现及其数据挖掘的发展历史,数据挖掘常用技术及应
用。
【关键词】知识发现,数据挖掘
1、引言
随着数据库技术的成熟和数据应用的普及,人类积累的数据量正在以指数速度迅
速增长。进入九十年代,伴随着因特网(Internet)的出现和发展,以及随之而来的
企业内部网(Intranet)和企业外部网(Extranet)以及虚拟私有网
(VPNVirtualPrivatenetrk)的产生和应用,将整个世界联成一个小小的地球村,人
们可以跨越时空地在网上交换数据信息和协同工作。这样,展现在人们面前的已不是
局限于本部门,本单位和本行业的庞大数据库,而是浩瀚无垠的信息海洋,数据洪水
正向人们滚滚涌来。当数据量极度增长时,如果没有有效的方法,由计算机及信息技
术来提取有用信息和知识,人们也会感到面对信息海洋像大海捞针一样束手无策。据
估计,一个大型企业数据库中数据,只有百分之七得到很好应用。这样,相对于“数
据过剩”和“信息爆炸”,人们又感到“信息贫乏”(Infratinpr)和“数据关在牢
笼中”(datainjail),奈斯伯特(JhnNaisbett)惊呼“earedrningininfratin,
butstarvingfrknledge”(人类正被数据淹没,却饥渴于知识)。
面临浩渺无际的数据,人们呼唤从数据汪洋中来一个去粗存精、去伪存真的技术。
从数据库中发现知识(KDD)及其核心技术——数据采掘(D)便应运而生了。
2、知识发现过程
知识发现(KDD)是从数据中发现有用知识的整个过程;数据开采(D)是KDD过
程中的一个特定步骤,它用专门算法从数据中抽取模式(patterns)。1996年,
Fayyad、PiatetskyShapirr和Syth将KDD过程定义为:从数据中鉴别出有效模式的
非平凡过程,该模式是新的、可能有用的和最终可理解的。
KDD过程是多个步骤相互连接、反复进行人机交互的过程。具体包括:
①学习某个应用领域:包括应用中的预先知识和目标。
②建立目标数据集:选择一个数据集或在多数据集的子集上聚焦。
③数据预处理:去除噪声或无关数据,去除空白数据域,考虑时间顺序和数据变
化等。
④数据转换:找到数据的特征表示,用维变换或转换方法减少有效变量的数目或
找到数据的不变式。
⑤选定数据挖掘功能:决定数据挖掘的目的。
⑥选定数据挖掘算法:用KDD过程中的准则,选择某个特定数据挖掘算法(如汇
总、分类、回归、聚类等)用于搜索数据中的模式。
⑦数据挖掘:搜索或产生一个特定的感兴趣的模式或一个特定的数据集。
⑧解释:解释某个发现的模式,去掉多余的不切题意的模式,转换某个有用的模
式,以使用户明白。
⑨发现知识:把这些知识结合到运行系统中,获得这些知识的作用或证明这些知
识。用预先、可信的知识检查和解决知识中可能的矛盾。
3、知识发现的核心――数据挖掘
所谓数据挖掘,就是从数据库中抽取隐含的、以前未知的、具有潜在应用价值的
信息的过程。数据挖掘是KDD最核心的部分。数据挖掘与传统分析工具不同的是数据
挖掘使用的是基于发现的方法,运用模式匹配和其它算法决定数据之间的重要联系。
数据挖掘算法的好坏将直接影响到所发现知识的好坏。目前大多数的研究都集中
在数据挖掘算法和应用上。需要说明的是,有的学者认为,数据开采和知识发现含义
相同,表示成KDD/D.它是一个反复的过程,通常包含多个相互联系的步骤:预处理、
提出假设、选取算法、提取规则、评价和解释结果、将模式构成知识,最后是应用。
在实际,人们往往不严格区分数据挖掘和数据库中的知识发现,把两者混淆使用。一
般在科研领域中称为KDD,而在工程领域则称为数据挖掘。
4、数据挖掘中常用技术
目前市面数据挖掘应用方面有着种类繁多的商品工具和软件,大致可以归纳为下
列主要类型:
[1]传统主观导向系统:这是针对专业领域应用的系统。如基于技术分析方法对金
融市场进行分析。采用的方法从简单的走向分析直到基于高深数学基础的分形理论和
谱分析。这种技术需要有经验模型为前提。属于这类商品有美国的etastak,
Superharts,andlestikFreaster和allStreetney等[2]传统统计分析:这类技术包
括相关分析、回归分析及因子分析等。
文档评论(0)