人工智能技术导论课件 第3章-人工智能安全相关数据处理.pptxVIP

  • 0
  • 0
  • 约1.63千字
  • 约 99页
  • 2026-09-08 发布于山东
  • 举报

人工智能技术导论课件 第3章-人工智能安全相关数据处理.pptx

;2;;;数据不平衡现象;通常认为,一个数据集中,样本数量最少的类别与样本数量最多的类别,如果它们的样本数量之比小于20%,就认为存在不平衡问题。当然,这也不是绝对的规定,只要差距较大就可以尝试使用不平衡数据处理方法来改善分类器的性能。;对于机器学习的影响——降低了少数类的分类准确性;不平衡数据分类方法;(1)数据预处理层面;数据过采样方法;基本的SMOTE算法同等看待所有的少数类样本,没有考虑到分类边界的样本是导致分类器性能下降的主要原因。BorderlineSMOTE将边界信息融入SMOTE算法中,在生成新样本点时只考虑边界附近的少数类样本点。;?;13;随机欠采样

从多数类中进行随机选择,选中每个样本的概率相同。因此,可能会导致某些关键样本丢失。;NM是一类基于距离的欠采样方法,其目标是保留少数类样本附近的多数类样本。NM有三个不同版本:;NearMissv1:针对每个多数类样本计算与其最近的三个少数类样本的平均距离。从中选择距离最近的Top-k个多数类样本,k应与整个数据集中的少数类数量相近。NMv1偏向在比较集中的少数类附近找到更多的多数类样本,减少了可能存在的决策边界附近的多数类样本,有助于提高分类器对少数类的关注度。;Tomeklinks方法;混合采样方法;首先,使用Smote对原始数据集(a)进行过采样(b);

然后识别Tomeklinks

文档评论(0)

1亿VIP精品文档

相关文档