面向朴素贝叶斯算法的离散化方法研究-计算机应用技术专业毕业论文.docxVIP

  • 18
  • 0
  • 约8.1万字
  • 约 78页
  • 2019-05-11 发布于上海
  • 举报

面向朴素贝叶斯算法的离散化方法研究-计算机应用技术专业毕业论文.docx

摘要摘要 摘要 摘要 在数据挖掘领域中,有很多算法只能处理定性属性.朴素贝叶斯分类算法在 处理定量属性时作了正态分布的假设.然而,这一假设与实际常常是相违背的, 从而严重制约了朴素贝叶斯算法的分类性能.因此,在运用分类算法之前,通常 需要离散化.离散化是数据挖掘领域的一个重要方面,它是一个从定量数据到定 性数据的转化过程,它不仅能够有效地提高分类器的分类精度及效率,也能够使 更多的数据挖掘算法应用于含有定量属性的数据集中,具有重要的现实意义及研 究价值. 首先,本文对数据的分类与度量进行了分析.然后,阐述了数据挖掘和分类 的相关理论,介绍了朴素贝叶斯算法及其定量属性的处理方法.接着分析了离散 化的研究现状,重点指出了离散化对朴素贝叶斯算法的有效性.在深入研究熵最 小离散化方法(EMD)和MDL准则的基础上,分析了EMD方法的缺陷,提出了 一种基于MDL的多元离散化方法Multi.EMD.该方法借鉴了EMD方法中寻找切 点的方法,在评价切点时使用了一种多元的MDL准则,该准则综合考虑了数据集 中所有数值型属性的作用,从而对切点的评价更可靠.本文还深入研究了比例离 散化方法(PKI),将EMD方法与PKI方法相结合,使用熵最小方法来寻找切点, 使用PKI方法计算离散化区间数量,提出了比例熵最小离散化方法PEMD.最后, 介绍了数据挖掘平台Weka系统的概况及其架构,在此平台上实现了Mu

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档