- 0
- 0
- 约1.63千字
- 约 99页
- 2026-09-08 发布于山东
- 举报
;2;;;数据不平衡现象;通常认为,一个数据集中,样本数量最少的类别与样本数量最多的类别,如果它们的样本数量之比小于20%,就认为存在不平衡问题。当然,这也不是绝对的规定,只要差距较大就可以尝试使用不平衡数据处理方法来改善分类器的性能。;对于机器学习的影响——降低了少数类的分类准确性;不平衡数据分类方法;(1)数据预处理层面;数据过采样方法;基本的SMOTE算法同等看待所有的少数类样本,没有考虑到分类边界的样本是导致分类器性能下降的主要原因。BorderlineSMOTE将边界信息融入SMOTE算法中,在生成新样本点时只考虑边界附近的少数类样本点。;?;13;随机欠采样
从多数类中进行随机选择,选中每个样本的概率相同。因此,可能会导致某些关键样本丢失。;NM是一类基于距离的欠采样方法,其目标是保留少数类样本附近的多数类样本。NM有三个不同版本:;NearMissv1:针对每个多数类样本计算与其最近的三个少数类样本的平均距离。从中选择距离最近的Top-k个多数类样本,k应与整个数据集中的少数类数量相近。NMv1偏向在比较集中的少数类附近找到更多的多数类样本,减少了可能存在的决策边界附近的多数类样本,有助于提高分类器对少数类的关注度。;Tomeklinks方法;混合采样方法;首先,使用Smote对原始数据集(a)进行过采样(b);
然后识别Tomeklinks
您可能关注的文档
最近下载
- 法国食品接触材料法规DM-4B-COM-002-V01 法.pdf VIP
- 《GB_T 3836.4-2021爆炸性环境 第4部分:由本质安全型“i”保护的设备》专题研究报告.pptx VIP
- 《打扫校园卫生》 (课件)中年级劳动湘教版.pptx VIP
- 夏洛特的网中英文对照台词.doc VIP
- 【课件】第一课 百年大党风华正茂 2026-2027学年统编版道德与法治九年级上册.pptx VIP
- 2025年金融风险管理师信用衍生品集中度风险计量专题试卷及解析.pdf VIP
- 2025年信息系统安全专家强制访问控制策略配置与验证专题试卷及解析.pdf VIP
- 2025年房地产经纪人大数据应用与客户画像的合规性风险防范专题试卷及解析.pdf VIP
- 2025年拍卖师成交确认的法律性质与法律后果专题试卷及解析.pdf VIP
- 人工智能训练师3级实操试题及答案.docx VIP
原创力文档

文档评论(0)