- 1
- 0
- 约1.01万字
- 约 35页
- 2017-03-15 发布于江苏
- 举报
数据挖掘原语、语言和系统结构 为什么要数据挖掘原语和语言? 一个完全自动(不需要人为干预或指导)的数据挖掘机器只可能是“一只疯了的怪兽”。 会产生大量模式(重新把知识淹没) 会涵盖所有数据,使得挖掘效率低下 大部分有价值的模式集可能被忽略 挖掘出的模式可能难以理解,缺乏有效性、新颖性和实用性——令人不感兴趣。 没有精确的指令和规则,数据挖掘系统就没法使用。 用数据挖掘原语和语言来指导数据挖掘。 数据挖掘原语的组成部分 数据挖掘原语应该包括以下部分: 说明数据库的部分或用户感兴趣的数据集 要挖掘的知识类型 用于指导挖掘的背景知识 模式评估、兴趣度量 如何显示发现的知识 数据挖掘原语用于用户和数据挖掘系统通信,让用户能从不同的角度和深度审查和发现结果,并指导挖掘过程。 说明数据挖掘任务的原语 任务相关的数据 数据库(仓库)名、数据立方体、选择条件、相关属性、分组条件 挖掘的知识类型 特征化、区分、关联、分类/预测、聚类 背景知识 概念分层,关联的确信度 模式兴趣度度量 简单性、确定性、实用性、新颖性 发现模式的可视化 规则、表、图表、图、判定树… 任务相关的数据 用户感兴趣的只是数据库或数据仓库的一个子集。 相关的操作:DB-选择、投影、连接、聚集等;DW-切片、切块 初始数据关系 数据子集选择过程产生的新的数据关系 可挖掘的视图 用于数据挖掘相关任务的数据集 任务相关的数据——例子 挖掘加拿大顾客和他们常在AllElectronics购买的商品间的关联规则 数据库(仓库)名 (e.g. AllElectronics_db) 包含相关数据的表或数据立方体名(e.g. item, customer, purchases, item_sold) 选择相关数据的条件(今年、加拿大) 相关的属性或维(item表的name和price,customer表的income和age) 要挖掘的知识类型 要挖掘的知识类型将决定使用什么数据挖掘功能。 概念描述(特征化和区分),关联规则,分类/预测,聚类和演化分析等 模式模板 又称元模式或元规则,用来指定所发现模式所必须匹配的条件,用于指导挖掘过程。 关联规则元模式——例子 研究AllElectronics的顾客购买习惯,使用如下关联规则: P X: customer, W ∧ Q X, Y buys X, Z X---customer表的关键字 P,Q---谓词变量 W, Y, Z---对象变量 模板具体化 age X, “30…39” ∧ income X, “40k…49k” buys X, “VCR” [2.2%, 60%] occupation x, “student” ∧ age X, “20…29” buys X, “computer” [1.4%, 70%] 背景知识:概念分层 背景知识是关于挖掘领域的知识 概念分层是背景知识的一种,它允许在多个抽象层上发现知识。 概念分层以树形结构的节点集来表示,其中每个节点本身代表一个概念,根节点称为all,而叶节点则对应于维的原始数据值。 概念分层中,自顶向底进行层的标识,即all为0层,向下依次为1,2,3等层 概念分层 ——上卷和下钻 在概念分层中应用上卷操作(概化),使得用户可以使用较高层次概念替代较低层次概念 可以在更有意义,更高、更抽象的层次观察数据,从而使发现的模式更加容易理解。 上卷操作使得数据得到压缩,在这个压缩的数据集上进行挖掘可以减少I/O操作,使得挖掘的效率提高。 概念分层的下钻操作使用较低层概念代替较高层概念,从而使用户能够对过于一般化的数据做更详细分析。 上卷和下钻操作让用户以不同视图观察数据,洞察隐藏的数据联系。 概念分层的自动生成。 在同一个维上,可能根据用户的观点不同,存在多个概念分层。 概念分层的类型 四种常用的概念分层类型 模式分层 E.g., street city province country 集合分组分层 E.g., 20-39 young, 40-59 middle_aged 操作导出的分层 Email:abc@cs.zju.edu.cn 基于规则的分层 low_profit_margin X price X, P1 and cost X, P2 and P1 - P2 $50 high_profit_margin X price X, P1 and cost X, P2 and P1 - P2 $250 兴趣度度量 没有兴趣度度量,挖掘出来的有用模式,很可能会给淹没在用户不感兴趣的模式中。 兴趣度的客观度量方法:根据模式的结构和统计,用一个临界值来判断某个模式是不是用户感兴趣的。 常用的四种兴趣度的客观度量:
您可能关注的文档
- 第5章Windows应用程序开发课程.ppt
- 半导体制造工艺流程课程.ppt
- 成本会计第二讲课程.ppt
- 第8章刨削加工课程.ppt
- 第一节,材料的性能课程.ppt
- adl_1027_新FMEA课程.ppt
- CPK-制程能力分析课程.ppt
- !企业教育训练课程.ppt
- NO.8五金常见不良原因对策培训教材课程.ppt
- 5s推动工厂改善的摇篮[教材]课程.ppt
- 2025年全国演出经纪人员资格认定考试试卷带答案(研优卷).docx
- 2025年全国演出经纪人员资格认定考试试卷完整版.docx
- 2025年全国演出经纪人员资格认定考试试题库及完整答案.docx
- 2025年全国演出经纪人员资格认定考试试卷完美版.docx
- 2025年全国演出经纪人员资格认定考试试卷含答案(实用).docx
- 2025年全国演出经纪人员资格认定考试试卷及答案(各地真题).docx
- 2025年下半年内江市部分事业单位公开考试招聘工作人员(240人)备考题库附答案.docx
- 2025年全国演出经纪人员资格认定考试试卷及答案1套.docx
- 2025年下半年四川成都市郫都区面向社会引进公共类事业单位人员2人备考题库最新.docx
- 2025年下半年内江市部分事业单位公开考试招聘工作人员(240人)备考题库附答案.docx
原创力文档

文档评论(0)