- 27
- 0
- 约1.61千字
- 约 24页
- 2021-11-23 发布于江西
- 举报
数据挖掘技术与应用;;真实值与预测值;误差:模型输出与样本真实值之间的差异
错误率:分类错误样本数占总样本数比例
精度:1-错误率
训练误差:模型在训练集上的误差
泛化误差:模型在新样本上的误差;目标:得到泛化误差小的模型/学习器
实际:新样本未知
以经验误差代表泛化误差
模型从训练样本中学得适用于所有潜在样本的“普遍规律”;过拟合:用力过猛
欠拟合:用力不足;;目标:对于模型/学习器的泛化误差进行评估
专家样本:训练集+测试集
训练集:训练误差
测试集:测试误差
独立同分布互斥
用测试误差近似表示泛化误差
;留出法
交叉验证
自助法;训练集+测试集:互斥互补
训练集训练模型,测试集测试模型
合理划分、保持比例
单次留出与多次留出
多次留出法:如对专家样本随机进行100次训练集/测试集划分,评估结果取平均
;K折交叉验证:将专家样本等份划分为K个数据集,轮流用K-1个用于训练,1个用于测试
P次K折交叉验证
;留出法与交叉验证法的训练集数据少于样本数据
给定m个样本的数据集D,从D中有放回随机取m次数据,形成训练集D’
用D中不包含D’的样本作为测试集
D中某个样本不被抽到的概率:
测试集数据量:
缺点:改变了初始数据集的分布
;;回归任务的评价标准:均方误差
;错误率:分类错误样本数占总样本数比例
精度:1-错误率,分类正确样本数占总样本数比例
;犯错的代价:
2004年12
原创力文档

文档评论(0)