一种基于特征选择的不平衡数据分类算法.docVIP

  • 29
  • 0
  • 约2.49千字
  • 约 4页
  • 2019-08-18 发布于北京
  • 举报

一种基于特征选择的不平衡数据分类算法.doc

一种基于特征选择的不平衡数据分类算法.doc

2016 年 1 月 集成技术 一种基于特征选择的不平衡数据分类算法 肖 鹰,吴哲夫,张 彤,王中友 引言 分类算法是目前机器学习的一个热点内容,当数据不平衡时,分类器的分类往往偏 向于多数类的类别,造成少数类无法被正确识别。而在许多实际应用中,少数类的判别往往比多数类的判别更具有价值,例如银行欺诈用户识别、医学疾病识别和网络黑客入侵等。 未处理非均衡数据,近年来诸多学者提出的研究方案可分为两个方面:数据层面处理和算法层面处理。 1)数据层面 数据层面处理是指通过改变数据的原始分布使数据达到平衡状态,常用方法有欠采样和过采样。欠采样的基本思想是删除部分多数类样本使数据达到平衡状态,但这种方式会导致原始数据信息的大量丢失;过采样的基本思想是不断复制少数类样本,扩大其规模使数据达到平衡状态,这种方式的优点是能使原始数据信息得到较好的保留。 一些改进的过采样算法主要包括:Chawla等提出的少数类过采样技术(Synthetic Minority Over-sampling Technique,SMOTE),这是一种通过在少数类样本之间进行线性插值的技术来实现增加少数类样本的方法,在一定程度上克服了分类器过度拟合的问题。此外,为了避免产生噪声和边际样

文档评论(0)

1亿VIP精品文档

相关文档