- 1
- 0
- 约5.03千字
- 约 6页
- 2026-09-30 发布于江苏
- 举报
基于自步学习的噪声标签鲁棒学习研究综述
一、噪声标签问题背景与研究意义
在深度学习模型训练过程中,大规模高质量标注数据集是支撑模型泛化能力的核心基础。然而实际场景中,数据集标注往往受到标注人员专业能力差异、标注成本限制、类别边界模糊等因素影响,不可避免地存在标注错误,即“噪声标签”。相关统计显示,主流公开数据集中噪声标签占比普遍在8%~38%区间,而医疗、金融、自动驾驶等垂直领域的数据集噪声占比甚至可达50%以上。噪声标签的存在会直接导致模型过度拟合错误标注信息,出现训练精度震荡、泛化能力骤降、推理结果偏离实际需求等问题,严重阻碍深度学习技术在高风险领域的落地应用。
传统噪声标签鲁棒学习方法主要分为三类:一是基于标签清洗的方法,通过人工校验或规则识别修正错误标签,但这类方法依赖领域先验知识,大规模应用成本极高;二是基于损失函数改进的方法,通过设计对噪声不敏感的损失函数降低错误标签的梯度贡献,代表性工作包括平均绝对误差(MAE)损失、广义交叉熵损失等,但这类方法对噪声类型和噪声率较为敏感,在高噪声场景下效果会显著下降;三是基于半监督学习的方法,将部分置信度高的样本作为干净集进行联合训练,但其性能高度依赖初始干净集的筛选精度,容易出现误差累积问题。
自步学习(Self-PacedLearning,SPL)作为一种模拟人类学习过程的训练范式,核心思想是按照样本难易程度动态调整训练顺序
原创力文档

文档评论(0)