- 1、本文档共59页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
数据挖掘概念与技术原书第2版第3章数据仓库与olap技术概述课件
数据仓库与OLAP技术概述;什么是数据仓库
多维数据模型
数据仓库的体系结构
数据仓库实现
从数据仓库到数据挖掘;数据仓库的定义很多,但却很难有一种严格的定义
数据仓库是一个数据库,它与公司的操作数据库分开维护。
允许将各种应用系统集成在一起,为统一的历史数据分析提供坚实的平台,对信息处理提供支持
数据仓库区别于其他数据存储系统
“数据仓库是一个面向主题的、集成的、随时间而变化的、不容易丢失的数据集合,支持管理部门的决策过程.”—W. H. Inmon;面向主题,是数据仓库显著区别于关系数据库系统的一个特征
围绕一些主题,如顾客、供应商、产品等
关注决策者的数据建模与分析,而不是集中于组织机构的日常操作和事务处理。
排除对于决策无用的数据,提供特定主题的简明视图。;一个数据仓库是通过集成多个异种数据源来构造的。
关系数据库,一般文件,联机事务处理记录
使用数据清理和数据集成技术。
确保命名约定、编码结构、属性度量等的一致性。
当数据被移到数据仓库时,它们要经过转化。
;数据仓库是从历史的角度提供信息
数据仓库的时间范围比操作数据库系统要长的多。
操作数据库系统: 主要保存当前数据。
数据仓库:从历史的角度提供信息(比如过去 5-10 年)
数据仓库中的每一个关键结构都隐式或显式地包含时间元素,而操作数据库中的关键结构可能就不包括时间元素。;尽管数据仓库中的数据来自于操作数据库,但他们却是在物理上分离保存的。
操作数据库的更新操作不会出现在数据仓库环境下
不需要事务处理,恢复,和并发控制等机制
只需要两种数据访问:
数据的初始转载和数据访问(读操作)
;异种数据库的集成方法
传统的异种数据库集成:(查询驱动)
在多个异种数据库上建立包装程序(wrappers)和中介程序(mediators )
查询驱动方法——当从客户端传过来一个查询时,首先使用元数据字典将查询转换成相应异种数据库上的查询;然后,将这些查询映射和发送到局部查询处理器
数据仓库: (更新驱动)
将来自多个异种源的信息预先集成,并存储在数据仓库中,供直接查询和分析;查询驱动的方法
需要负???的信息过滤和集成处理
与局部数据源上的处理竞争资源
对于频繁的查询,尤其是涉及聚集(汇总)操作的查询,开销很大(决策支持中常见的查询形式)
更新驱动的方法(带来高性能)
数据经预处理后单独存储,对聚集操作提供良好支持
不影响局部数据源上的处理
集成历史信息,支持负责的多维查询;操作数据库系统的主要任务是联机事务处理OLTP
日常操作: 购买,库存,银行,制造,工资,注册,记帐等
数据仓库的主要任务是联机分析处理OLAP
数据分析和决策支持,支持以不同的形式显示数据以满足不同的用户需要;用户和系统的面向性
面向顾客(事务) VS. 面向市场(分析)
数据内容
当前的、详细的数据 VS. 历史的、汇总的数据
数据库设计
实体-联系模型(ER)和面向应用的数据库设计 VS. 星型/雪花模型和面向主题的数据库设计;数据视图
当前的、企业内部的数据 VS. 经过演化的、集成的数据
访问模式
事务操作 VS. 只读查询(但很多是复杂的查询)
任务单位
简短的事务 VS. 复杂的查询
访问数据量
数十个 VS. 数百万个;用户数
数千个 VS. 数百个
数据库规模
100M-数GB VS. 100GB-数TB
设计优先性
高性能、高可用性 VS. 高灵活性、端点用户自治
度量
事务吞吐量 VS. 查询吞吐量、响应时间;提高两个系统的性能
DBMS是为OLTP而设计的:存储方式,索引, 并发控制, 恢复
数据仓库是为OLAP而设计:复杂的 OLAP查询, 多维视图,汇总
不同的功能和不同的数据:
历史数据: 决策支持需要历史数据,而这些数据在操作数据库中一般不会去维护
数据汇总:决策支持需要将来自异种源的数据统一(如聚集和汇总)
数据质量: 不同的源使用不一致的数据表示、编码和格式,对这些数据进行有效的分析需要将他们转化后进行集成;什么是数据仓库
多维数据模型
数据仓库的体系结构
数据仓库实现
从数据仓库到数据挖掘;数据仓库和OLAP工具基于多维数据模型
在多维数据模型中,数据以数据立方体(data cube)的形式存在
数据立方体允许以多维数据建模和观察。它由维和事实定义
维是关于一个组织想要记录的视角或观点。每个维都有一个表与之相关联,称为维表。
多维数据模型围绕中心主题组织,该主题用事实表表示
事实表包括事实的名称或度量以及每个相关维表的关键字
事实指的是一些数字度量; ;在数据仓库中,数据立方体是n-D的(n维)
(关系表和电子表格是几维的?)
示例
AllElectronics的销售数据按维time, item的2-D视图 (P71, 表3-2)
AllElectronics
您可能关注的文档
- 广东省2015中考地理冲刺复习ppt课件专题五天气与气候.ppt
- 广东省2013年中考化学复习专题四图像题ppt课件.ppt
- 广东省三水实验学校九年级语文上册《第24课出师表》ppt课件.ppt
- 广东省2017年中考政治总复习专题三友好交往享受网络做诚信的公民(第2课时)ppt课件.ppt
- 广东省2017中考英语第二节常考话题专项训练(五)饮食健康ppt课件 人教新目标版.ppt
- 广东省2017年中考政治总复习专题三友好交往享受网络做诚信的公民(第1课时)ppt课件.ppt
- 广东省东莞市东城高级中学高中政治必修三ppt课件32文化在交流中传播.ppt
- 广东省2017年中考政治总复习专题三友好交往享受网络做诚信的公民(第3课时)ppt课件.ppt
- 广东省东莞市东城高级中学高中政治必修四ppt课件31真正的哲学都是自己时代的精神上的精华.ppt
- 广东省中大附中三水实验学校九年级语文上册《第24课出师表》ppt课件 新人教版.ppt
- 2025年分红险:低利率环境下产品体系重构.pdf
- 大学生职业规划大赛《应用物理学专业》生涯发展展示PPT.pptx
- 大学生职业规划大赛《新媒体技术专业》生涯发展展示PPT.pptx
- 七年级上册英语同步备课(人教2024)Unit 3 课时2 Section A(2a-2f)(同步课件).pdf
- 七年级上册英语同步备课(人教2024)Unit 2 课时4 Section B(1a-1d)(同步课件).pdf
- 七年级上册英语同步备课(人教2024)Unit 3课时6 project(课件).pdf
- 2025年港口行业报告:从财务指标出发看港口分红提升潜力.pdf
- 2023年北京市海淀区初一(七年级)下学期期末考试数学试卷(含答案).pdf
- 2026年高考化学一轮复习第7周氯及其化合物、硫及其化合物.docx
- 2023年北京市西城区北京四中初一(七年级)下学期期中考试数学试卷(含答案).pdf
文档评论(0)