数据挖掘概念与技术原书第3版(范明 、孟小峰绎)第一章课后习题.docVIP

数据挖掘概念与技术原书第3版(范明 、孟小峰绎)第一章课后习题.doc

  1. 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
  2. 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  3. 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  4. 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  5. 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  6. 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  7. 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
数据挖掘概念与技术原书第3版(范明 、孟小峰绎)第一章课后习题.doc

1.9习题 1.1 什么是数据挖掘?在你的回答中,强调以下问题: 它是又一种广告宣传吗? (b)它是一种从数据库、统计学、机器学习和模式识别发展而来的技术的简单转换或应用吗? (c)我们提出了一种观点,说数据挖掘是数据库技术进化的结果。你认为数据挖掘也是机器学习研究进化的结果吗?你能基于该学科的发展历史提出这一观点吗?针对统计学和模式识别领域,做相同的事。 (d)当把数据挖掘看做知识发现过程时,描述数据挖掘所涉及的步骤。 答:简单地说,数据挖掘其实就是从大量的数据中发现有用的信息,它是从大量数据中挖掘有趣模式和知识的过程。数据挖掘不是一种广告宣传,而是身处在信息时代数据如此庞大的今天,我们对由海量的数据转化为有用信息的迫切需要,所以它是信息技术自然进化的结果,而不是一种广告宣传。 数据挖掘也不是一种从数据库、统计学、机器学习和模式识别发展而来的技术的简单转换或应用,它涉及到了很多领域的技术,比如统计学、机器学习、模式识别、数据库和数据仓库、信息检索、可视化、神经网络、高性能计算、算法以及许多应用领域的大量技术。 数据挖掘起始于20世纪下半叶,是在当时多个学科发展的基础上发展起来的。随着数据库技术的发展应用,数据的积累不断膨胀,导致简单的查询和统计已经无法满足企业的商业需求,所以急需一种新型的技术去获取有用的信息,当时计算机领域的人工智能也取得了巨大进展,进入了机器学习的阶段,人们就将两者结合起来,用数据库管理系统存储数据,用计算机分析数据,这两者的结合就促就以这一门新兴的学科,所以数据挖掘不是机器学习研究进化的结果,而是结合了机器学。 数据挖掘的步骤包括:(1)数据收集;(2)数据清洗、脱敏;(3)数据存储;(4)数据分析;(5)数据可视化。 1.2数据仓库与数据库有何不同?他们有哪相似之处? 答:数据库是按照数据结构来组织、 HYPERLINK /doc/4223154-4424731.html \t /doc/_blank 存储和管理数据的仓库,它是以一定方式储存在一起、能为多个用户共享、具有尽可能小的 HYPERLINK /doc/6508061-6721783.html \t /doc/_blank 冗余度的特点、是与应用程序彼此独立的数据集合。 数据仓库,是为企业所有级别的决策制定过程,提供所有类型数据支持的战略集合。它是单个数据 HYPERLINK /doc/4223154-4424731.html \t /doc/_blank 存储,出于分析性报告和决策支持目的而创建。 不同处:(1)数据库是面向事务的设计,数据仓库是面向主题设计的。?????????? (2)数据库一般存储在线交易数据,数据仓库存储的一般是历史数据。??????????? (3)数据库设计是尽量避免冗余,数据仓库在设计是有意引入冗余。??????????? (4)数据库是为捕获数据而设计,数据仓库是为分析数据而设计。 相似处:两者都是数据的集合。 1.3定义下列数据挖掘功能:特征化、区分、关联和相关性分析、分类、回归、聚类、离群点分析。使用你熟悉的现实生活中的数据库,给出每种数据挖掘功能的例子 答:特征化:目标类数据的一般特性或特征的汇总。例如:汇总某年级学生的基本特征,结果可能会高分段成绩信息,是否挂科等信息。 区分:将目标类数据对象的一般特性与一个或多个对比类对象的一般特性进行比较。 例如:购买化妆品的顾客70%在20~40岁之间,受过大学教育,而不经常购买化妆品的顾客60%要么年龄太小要么年龄太大,没有受过大学教育。 关联和相关性:两个变量之间的相关性,从给定的数据集中发现频繁出现的频繁模式知识。例如:超市将啤酒和尿不湿放到一起。 分类:找出和区分数据类或概念地模型,以便能够使用模型预测类标号未知的对象的类标号。例如:学生的成绩分为高等、中等、低等。 回归:用来预测缺失或难以获得的数值数据值,而不是离散的类标号。例如:商品质量与用户满意度之间的因果关系。 聚类:将观测组织成类分层结构,把类似的事件组织在一起。例如:将一些特征相似的症状结合起来可能预示一种特定的疾病。 离群点分析:数据集中可能包含一些数据对象,它们与数据的一般行为或模型不一致,这些数据对象是离群点,离群点数据的分析就是离群点分析。例如:将正常的付款数额与一个消费数额极大的账号进行离群点分析,可能发现信用卡诈骗。 1.4给出一个例子,其中数据挖掘对于工商企业的成功是至关重要的。该工商企业需要什么数据挖掘功能(例如,考虑可以挖掘何种类型的模式)?这种模式能够通过简单的查询处理或统计分析得到吗? 答:如淘宝网,需要根据消费者的性别、年龄、职业、收入水平、兴趣爱好等进行关联性分析,给不同的消费者推荐不同类型,不同类别的商品

文档评论(0)

pengyou2017 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档