- 14
- 0
- 约 22页
- 2017-05-21 发布于湖北
- 举报
数据挖掘原理与SPSS Clementine应用宝典 元昌安 主编 邓 松 李文敬 刘海涛 编著 电子工业出版社 3.1 数据挖掘的体系结构 数据挖掘系统由各类数据库、挖掘前处理模块、挖掘操作模块、模式评估模块、知识输出模块组成,这些模块的有机组成就构成了数据挖掘系统的体系结构。 3.1 数据挖掘的体系结构 数据库管理模块,负责对系统内数据库、数据仓库、挖掘知识库的维护与管理。这些数据库、数据仓库是对外部数据库进行转换、清理、净化得到,它是数据挖掘的基础。 挖掘前处理模块,对所收集到的数据进行清理、集成、选择、转换,生成数据仓库或数据挖掘库。其中:清理,主要清除噪音;集成,将多种数据源组合在一起;选择,选择与问题相关的数据;转换,将选择数据转换成可挖掘形式。 3.1 数据挖掘的体系结构 模式评估模块,对数据挖掘结果进行评估。由于所挖掘出的模式可能有许多,需要将用户的兴趣度与这些模式进行分析对比,评估模式价值,分析不足原因,如果挖掘出的模式与用户兴趣度相差大,需返回相应的过程(如,挖掘前处理或挖掘操作)重新执行。 知识输出模块,完成对数据挖掘出的模式进行翻译、解释,以人们易于理解的方式提供给真正渴望知识的决策者使用。 3.1 数据挖掘的体系结构 挖掘操作模块,利用各种数据挖掘算法针对数据库、数据仓库、数据挖掘库,并借助挖掘知识库中的规则、方法、经验和事实数据等,挖掘和发现知识。。 3.2 数据挖掘的过程模型 Fayyad数据挖掘模型将数据库中的知识发现看作是一个多阶段的处理过程,它从数据集中识别出以模式来表示的知识,在整个知识发现的过程中包括很多处理步骤,各步骤之间相互影响,反复调整,形成一种螺旋式的上升过程。 3.2.1 Fayyad模型 Fayyad处理过程共分为9个处理阶段,分别是 : 数据准备:了解KDD相关领域的有关情况,熟悉有关的背景知识,并弄清楚用户的要求。 数据选择:根据用户的要求从数据库中提取与KDD相关的数据,KDD将主要从这些数据中进行知识提取,在此过程中,会利用一些数据库操作对数据进行处理。 3.2.1 Fayyad模型 数据清洗和预处理:对数据进行再加工,检查数据的完整性及数据的一致性,对其中的噪音数据进行处理,对丢失的数据可以利用统计方法进行填补。 数据降维/转换:对经过预处理的数据,根据知识发现的任务对数据进行再处理,主要通过投影或数据库中的其它操作减少数据量。 确定KDD的目标 根据用户的要求:确定KDD是发现何种类型的知识,因为对KDD的不同要求会在具体的知识发现过程中采用不同的知识发现算法。 3.2.1 Fayyad模型 确定知识发现算法: 根据阶段5所确定的任务,选择合适的知识发现算法,这包括选取合适的模型和参数,并使得知识发现算法与整个KDD的评判标准相一致。 数据挖掘(Data Mining) :运用选定的知识发现算法,从数据中提取出用户所感兴趣的知识,并以一定的方式表示出来。 模式解释: 对发现的模式(知识)进行解释,在此过程中,为了取得更为有效的知识。 3.2.1 Fayyad模型 知识评价: 将发现的知识以用户能了解的方式呈现给用户。这期间也包含对知识的一致性检查,以确信本次发现的知识不与以前发现的知识相抵触。 3.2.1 Fayyad模型 Fayyad过程模型是一个偏技术的模型,该模型在实际应用中存在以下两个问题: 为什么选择这些数据?Fayyad过程模型忽略了具体业务问题的确定。这也是确定选择哪些数据的关键所在。 模型怎样使用?数据挖掘是分析型环境中的一门技术,如果数据挖掘是一种数据分析技术,那么数据挖掘应该在分析型环境中使用。但是,挖掘出的模型需要返回到操作型环境中进行应用。因此,需要构成一个从操作型环境到分析型环境再到操作型环境的封闭的信息流。 3.2.2 CRISP-DM模型 CRISP-DM(Cross-Industry Standard Process for Data Mining,跨行业数据挖掘标准流程)注重数据挖掘技术的应用,解决了Fayyad模型存在的两个问题。 CRISP-DM过程模型从商业的角度给出对数据挖掘方法的理解。目前数据挖掘系统的研制和开发大都遵循CRISP-DM标准,将典型的挖掘和模型的部署紧密结合。 3.2.2 CRISP-DM模型 CRISP-DM模型过程的基本步骤包括:业务理解、数据理解、数据准备、建立模型、模型评价、模型实施
您可能关注的文档
- 直线与平面及两平面相对位置.ppt
- 指导书P16就你了解某一社会现象或社会事物.doc
- 智慧树大学生心理健康期末考试-吉林大学.docx
- 智力障碍儿童教育与教学复习重点.doc
- 注意之反应选择模型和知觉选择模型.ppt
- 柱体、椎体、台体、球体体积和球表面积.ppt
- 最经典霍尔效应与范德堡测试方法.doc
- 最全VAR模型理论基础及其Eviews实现.ppt
- 最全面一级语法.doc
- 最全气象类网址.doc
- 2025-2026学年天津市和平区高三(上)期末数学试卷(含解析).pdf
- 2025-2026学年云南省楚雄州高三(上)期末数学试卷(含答案).pdf
- 2025-2026学年甘肃省天水市张家川实验中学高三(上)期末数学试卷(含答案).docx
- 2025-2026学年福建省厦门市松柏中学高二(上)期末数学试卷(含答案).docx
- 2025-2026学年广西钦州市高一(上)期末物理试卷(含答案).docx
- 2025-2026学年河北省邯郸市临漳县九年级(上)期末化学试卷(含答案).docx
- 2025-2026学年河北省石家庄二十三中七年级(上)期末历史试卷(含答案).docx
- 2025-2026学年海南省五指山市九年级(上)期末化学试卷(含答案).docx
- 2025-2026学年河北省唐山市玉田县九年级(上)期末化学试卷(含答案).docx
- 2025-2026学年河北省邢台市市区九年级(上)期末化学试卷(含答案).docx
最近下载
- 时速160公里动力集中动车组动力车(177页).pptx VIP
- 全国李氏家族字辈.pdf VIP
- 2025储能场站运营的价值定位、运营模式和收益示例-202508v3.pdf VIP
- 小学科学《斜面》优质课件.docx VIP
- 串联型感应加热电源的自动负载匹配技术.pdf VIP
- 2025年新课标《义务教育数学课程标准(2022年版)》测试题及答案.docx VIP
- 老年人谵妄中西医结合诊疗专家共识.pdf VIP
- 膨胀土基坑复合土钉墙试验研究.pdf VIP
- 2021年江苏省无锡市天一高级中学高二物理下学期期末试卷含解析.docx VIP
- 《贵州省公路工程施工监理电子招标文件示范文本(试行)》2025.docx VIP
原创力文档

文档评论(0)