- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
12/13 年第 2学期《数据挖掘与知识发现》期末考试试卷及答案
一、 什么是数据挖掘?什么是数据仓库?并简述数据挖掘的步骤。 (20分)
数据挖掘是从大量数据中提取或发现(挖掘)知识的过程.
数据仓库是面向主题的、集成的、稳定的、不同时间的数据集合,用于支持
经营管理中的决策制定过程。
步骤:
1)数据清理 (消除噪声或不一致数据)
2) 数据集成 (多种数据源可以组合在一起)
3 ) 数据选择 (从数据库中检索与分析任务相关的数据)
4 ) 数据变换 (数据变换或统一成适合挖掘的形式,如通过汇总或聚集操作)
5) 数据挖掘 (基本步骤,使用智能方法提取数据模式)
6) 模式评估 (根据某种兴趣度度量,识别表示知识的真正有趣的模式;)
7) 知识表示 (使用可视化和知识表示技术,向用户提供挖掘的知识)
二、元数据的定义是什么?元数据包括哪些内容?(20 分)
元数据是关于数据的数据。在数据仓库中, 元数据是定义仓库对象的数据.
元数据包括 :
数据仓库结构的描述,包括仓库模式、视图、维、分层结构、导出数据的定
义, 以及数据集市的位置和内容。
操作元数据,包括数据血统(移植数据的历史和它所使用的变换序列)、数据
流通 (主动的、档案的或净化的)、管理信息(仓库使用统计量、错误报告和审计
跟踪)。
汇总算法,包括度量和维定义算法, 数据所处粒度、划分、主题领域、聚集、
汇总、预定义的查询和报告 。
由操作环境到数据仓库的映射,包括源数据库和它们的内容,网间连接程序
描述, 数据划分, 数据提取、清理、转换规则和缺省值, 数据刷新和净化规则,
安全 (用户授权和存取控制)。
关于系统性能的数据,刷新、更新定时和调度的规则与更新周期,改善数据存
取和检索性能的索引和配置。
商务元数据,包括商务术语和定义, 数据拥有者信息和收费策略.
三、在 O L A P 中,如何使用概念分层? 请解释多维数据模型中的 OLAP 上卷
下钻切片切块和转轴操作。(20 分)
在多维数据模型中,数据组织成多维,每维包含由概念分层定义的多个抽象
层。这种组织为用户从不同角度观察数据提供了灵活性。有一些 O L A P 数据
立方体操作用来物化这些不同视图,允许交互查询和分析手头数据.因此 , O L
A P 为交互数据分析提供了友好的环境。
上卷 :上卷操作通过一个维的概念分层向上攀升或者通过维归约 ,在数据立方
体上进行聚集。
下钻:下钻是上卷的逆操作,它由不太详细的数据到更详细的数据.下钻可以通过
沿维的概念分层向下或引入新的维来实现。
切片:在给定的数据立方体的一个维上进行选择,导致一个子方。
切块:通过对两个或多个维执行选择,定义子方。
转轴: 转轴是一种目视操作,它转动数据的视角,提供数据的替代表示。
四、什么是数据变换?数据变换涉及的内容有哪些? (20 分)
数据变换是将数据转换成适合于挖掘的形式.数据变换可能涉及如下内容 :
1).平滑 :去掉数据中的噪声。这种技术包括分箱、聚类和回归。
2)。聚集 :对数据进行汇总和聚集。例如,可以聚集日销售数据,计算月和年
销售额。通常,这一步用来为多粒度数据分析构造数据立方体。
3)。数据概化 :使用概念分层,用高层次概念替换低层次“原始”数据。例如,
分类的属性,如 s t re e t ,可以概化为较高层的概念,如 c i t y 或 c o u
n t ry 。类似地,数值属性,如 a g e ,可以映射到较高层概念,如 youn ,
middle-age 和 s e n i o r 。
4)。规范化 :将属性数据按比例缩放,使之落入一个小的特定区间,如- 1 。 0
到 1 。 0 或 0 . 0 到 1 . 0 。
5)。属性构造 (或特征构造 ):可以构造新的属性并添加到属性集中,以帮
助挖掘过程.
五
您可能关注的文档
- 提升质量演讲稿.pdf
- 提升门施工方案.pdf
- 提升泵房施工方案.pdf
- 提高全员质量意识 提升质量管理水平.pdf
- 提成奖惩及岗位说明方案.pdf
- 提高幼儿园招生成功率的妙招.pdf
- 提高二次结构植筋施工质量一次合格率.pdf
- 提高小鹅成活率的管理措施.pdf
- 提高幼儿教师能力方案措施.pdf
- 提升项目综合管理水平,努力做好信用评价工作.pdf
- 2025年演出经纪人演出数据跨境流动法律问题专题试卷及解析.pdf
- 2025年信息系统安全专家物联网安全日志分析专题试卷及解析.pdf
- 2025年信息系统安全专家云环境持续安全监控专题试卷及解析.pdf
- 2025年信息系统安全专家ISMS内部审核流程与技巧专题试卷及解析.pdf
- 2025年演出经纪人艺人定位与数据化运营策略专题试卷及解析.pdf
- 2025年演出经纪人商务谈判中的僵局处理与冲突化解专题试卷及解析.pdf
- 2025年演出经纪人国际演出合同纠纷解决机制专题试卷及解析.pdf
- 2025年注册项目管理师蒙特卡洛模拟在敏捷项目迭代周期估算中的应用专题试卷及解析.pdf
- 2025年AWS认证子网与AWSSimSpaceWeaver仿真网络专题试卷及解析.pdf
- 2025年AWS认证SQS与EMR集群任务调度专题试卷及解析.pdf
最近下载
- VMMORE微秒控制ISD300-GSD300-MSD300系220V伺服驱动器用户手册V2.3.pdf
- 颈动脉灌注机制济南脑科医院课件.pptx VIP
- 暖通空调的设计手册.pdf VIP
- 《教育心理学》课件——第七章 学习策略.pptx VIP
- 2025年毒品预防教育试题及答案.docx VIP
- 暖通空调毕业设计.doc VIP
- 西方音乐史(上)(中央音乐学院) 中国大学MOOC 慕课 章节测验答案.pdf VIP
- 颈动脉灌注机制.pptx VIP
- 2025年毒品预防教育知识竞赛试题及答案.docx VIP
- CHINSC深川S160A变频器参数设置调试故障代码资料V1.2-2023.pdf
原创力文档


文档评论(0)