- 1、本文档共72页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
粗糙集连续属性散化方法研究
摘 要
传统的粗糙集理论只能对数据库中的离散属性进行处理,所以对
存在连续属性的数据库必须进行离散化处理。连续属性离散化是机器
学习和数据挖掘领域中的一个重要问题,对后继阶段的机器学习或数
据挖掘过程具有非常重要的意义。离散化是否合理决定着表达和提取
相关信息的准确性。其中,Chi2系列算法和类.属性相互依赖(CAI)
的相关算法分别是基于概率统计理论和基于信息理论的连续属性离散
化重要方法。连续属性离散化方法在人工智能、机器学习等很多方面
具有重要应用。
首先,经过研究Chi2系列算法,本文提出一种新的基于属性重要
性的连续属性离散化方法——Imp.Chi2算法,该算法依据属性重要性
程度对属性离散化的顺序进行了合理的调整,能够更准确的对连续属
性进行离散化。并且,在实验过程中,提出了一种训练集类比例抽取
方法,很好的避免了训练集随机抽取的不均匀性。
其次,本文对Chi2相关算法进行了深入分析,指出了其中的不足,
提出一种新的连续属性离散化方法:RectifiedChi2算法。新算法给出
了一种新的区间合并依据,能够更合理更有效地对连续属性进行离散
化。在此基础上,考虑仅以最大差异为区间合并标准存在不合理性,
提出~种基于差异序列为标准的区间合并方法,该方法可以大大提高
Chi2系列算法的离散化效果。最后,对x2统计量中占。取值不精确方面
进行了分析,并且提出了两种改进方案。
再次,本文对Chi2相关算法(尤其是ExtendedChi2算法)进行了深
入研究,指出了其中存在的问题,提出一种新的基于区问相似性度量
的连续属性离散化算法。新算法定义了一个区间相似度函数,用该区
间相似度函数作为离散化过程的新的合并标准。同时,在函数中给出
了两个重要参数:条件参数仅和微调参数c,分别体现了离散化过程中
的均衡性和相邻两区间数目的相差程度;并且在算法内部给出了两个
重要规定。新算法不仅继承了z2统计合理的方面,同时也解决了Chi2
相关算法中存在的问题,实现了公平的标准,能够更合理更有效地对
连续属性进行离散化。
最后,在系统地分析基于类一属性相互依赖(CAI)的相关算法基
础上,提出了一个新的离散化标准(NCAIC),该标准考虑了数据的
分布和所有类与连续属性之间的相互依赖,并且引入了粗糙集上近似
概念作为离散化标准中的重要组成部分。基于新的标准提出了一种基
于粗糙集和互信息的CAI连续属性离散化的最新算法。新算法利用类
与属性间的互信息自动控制和调整连续属性离散化的程度,使得连续
属性能够更合理更有效地对进行离散化。
关键词: 连续属性离散化;粗糙集:Chi2算法;属性重要性;训练集
类比例抽取;差异序列;区间相1以性度量;互信息;类一属性相互依赖
(CAI)
Abstract
Thetraditionalset can dealwiththediscrete
roughtheoryonly
theconsistent
attributeina itis todealwith
database,SO
necessary
ina database.The
attributewhentheconsistentattributesexist
ofcontinuousfeaturevaluesisaneffective to
discretization technique
dealwithcontinuousattributesformachine anddata and
learning mining
with tothefollowed ofmachine
文档评论(0)