基于邻域信息的不平衡数据过采样方法研究.pdfVIP

  • 8
  • 0
  • 约9.89万字
  • 约 52页
  • 2023-02-09 发布于江苏
  • 举报

基于邻域信息的不平衡数据过采样方法研究.pdf

基于邻域信息的不平衡数据过采样方法研究 摘 要 不平衡数据指的是某一类或某几类数据的样本数量在样本总量中占得比例较 少,即不同类别之间的样本数量差距较大。在解决不平衡数据识别分类的问题上, 传统的机器学习分类算法,如决策树、支持向量机、神经网络等,所表现出来的性 能往往不能满足人们的要求。当前,对于不平衡数据分类的解决办法,从数据集层 面总的来说,是通过一些方法机制改善不平衡数据集本身,从而获得具有均衡数据 分布的平衡数据集,以提高机器学习分类算法的识别分类准确率。常见的策略有欠 采样技术和过采样技术,由于欠采样技术容易造成模型泛化能力下降,因此,近来 研究人员更倾向于使用过采样技术,并提出了很多不会导致多数类样本减少的过采 样方法,来解决类不平衡问题。其中随机过采样技术(Random Oversampling ,ROS), Synthetic Minority Oversampling Technique SMOTE 以及合成少数类过采样技术 ( , ) 都是解决此类问题的经典代表性方法。然而

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档