- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
数据挖掘的案例:“啤酒”和“尿布” 一则广为流传的案例:啤酒和尿布的故事 美国加州某个超市连锁店发现: 在下班后前来购买婴儿尿布的顾客多数是男性,他们往往也同时购买啤酒。 处理:重新布置了货架,啤酒类商品、婴儿尿布、土豆片之类的佐酒小食品、男士们日常生活用品就近布置。 结果:上述几种商品的销量几乎马上成倍增长。 什么是数据挖掘? 数据挖掘的定义非常模糊,对它的定义取决于定义者的观点和背景。如下是一些DM文献中的定义: 数据挖掘是一个从数据集中识别出有效的、新颖的、潜在有用的,以及最终可理解的模式的非平凡过程。 --Fayyad. 数据挖掘是一个从大型数据库中提取以前未知的,可理解的,可执行的信息并用它来进行关键的商业决策的过程。 --Zekulin. 数据挖掘是用在知识发现过程,来辩识存在于数据中的未知关系和模式的一些方法。 --Ferruzza 数据挖掘是发现数据中有益模式的过程。 --Jonn 数据挖掘是我们为那些未知的信息模式而研究大型数据集的一个决策支持过程。 --Parsaye 什么是数据挖掘? 从数据集中识别出有效的、新颖的、潜在有用的,以及最终可理解的模式的非平凡过程。 非平凡(的过程):有一定的智能性、自动性(仅仅给出所有数据之和不能算做一个发现过程)。 有效性:所发现的模式对新的数据仍保持一定的可信度。 新颖性:所发现的模式应该是新的。 潜在有用性:所发现的模式将来有实际的效用。 最终可理解性:能被用户理解,如:简洁性 有趣性:有效性、新颖性、潜在有用性、最终可理解性的综合。 数据挖掘: 多个学科的融合 数据挖掘 数据库系统 统计学 其他学科 算法 机器学习 可视化 数据挖掘相关领域 知识发现领域充分体现了各种方法论的相互交叉、渗透和协作。相关的理论和技术可以分类如下: 按挖掘任务分类:包括概念/类描述、特征化和区分关联分析、分类和预测 、聚类分析 、孤立点分析、演变分析等。 按挖掘对象分类:包括关系数据库、面向对象数据库、空间数据库、时态数据库、文本数据库、多媒体数据库、异构数据库、数据仓库、Web数据库等。 按挖掘方法分类:包括统计方法,机器学习方法,神经网络方法和数据库方法等。 数据挖掘的称谓 数据挖掘涉及多学科领域,有多个术语名称(可能其内容的侧重点略有差异)。 数据挖掘(data mining) 数据库中的知识发现(KDD, knowledge discovery in databases) 知识抽取(knowledge extraction) 信息发现(information discovery) 智能数据分析(intelligent data analysis) 探索式数据分析(exploratory data analysis) 信息收获 (information harvesting) 数据考古(data archeology) ?“数据挖掘”流行于 统计界、数据库、数据分析、管理信息系统界 数据挖掘的步骤 观点:数据挖掘是数据库中的知识发现(KDD)的一个步骤。 ? 粗略理解三部曲: 数据准备(data preparation)、 数据挖掘(data mining) 结果的解释评估(interpretation and evaluation) 数据挖掘的步骤 数据准备? 数据选择:目标数据 数据预处理:消除噪声、不一致、冗余等 数据变换:连续数据离散化、数据转化 数据归约:特征选择或抽取 数据挖掘时,需要 明确任务如数据总结、分类、聚类、关联规则发现、序列模式发现等。 考虑用户的知识需求(得到描述性的知识、预测型的知识)。 根据具体的数据集合,选取有效的挖掘算法。 数据挖掘的步骤 结果的解释评估(interpretation and evaluation) 对挖掘出来的结果(模式),经用户或机器评价,剔除冗余或无关的模式。 模式不满足用户需求时,返回到某一步,重新挖掘。如:重新选择数据、采用新的变换方法、设定新的数据挖掘参数,或者换一种挖掘算法(如分类方法,不同的方法对不同的数据有不同的效果)。 挖掘的结果是面向用户的,对挖掘结果进行可视化或者转化为用户易于理解的形式表示。 ?评注 影响挖掘结果质量的因素:采用的算法、数据本身的质量与数量 数据挖掘的过程是一个不断反馈的过程 可视化在数据挖掘过
您可能关注的文档
最近下载
- 疾病康复学课程标准(2020整理).pdf VIP
- 好书推荐《我胆小如鼠》导读阅读分享读后感PPT课件.pptx VIP
- 骨外科三基题库.pdf VIP
- 2023_昆仑技创_用户手册_TPC1071Ni_V1.1_0705.pdf VIP
- 造价人生:专访某建设单位造价人员赵工(真实).pdf VIP
- 大学生职业生涯发展展示.pptx VIP
- wiscontrol变频器说明书 .pdf VIP
- 500强企业绩效考核指标汇总(非常实用的)(精品).doc VIP
- 中图版(新教材2019版)高中地理 选择性必修1地理知识点总结.pdf VIP
- 《大学生职业生涯规划与就业指导》 项目七 不忘初心,怀梦笃行.pptx
原创力文档


文档评论(0)