数据挖掘技术与应用:模型评估与选择.pptxVIP

  • 27
  • 0
  • 约1.61千字
  • 约 24页
  • 2021-11-23 发布于江西
  • 举报

数据挖掘技术与应用:模型评估与选择.pptx

数据挖掘技术与应用;;真实值与预测值;误差:模型输出与样本真实值之间的差异 错误率:分类错误样本数占总样本数比例 精度:1-错误率 训练误差:模型在训练集上的误差 泛化误差:模型在新样本上的误差;目标:得到泛化误差小的模型/学习器 实际:新样本未知 以经验误差代表泛化误差 模型从训练样本中学得适用于所有潜在样本的“普遍规律”;过拟合:用力过猛 欠拟合:用力不足;;目标:对于模型/学习器的泛化误差进行评估 专家样本:训练集+测试集 训练集:训练误差 测试集:测试误差 独立同分布互斥 用测试误差近似表示泛化误差 ;留出法 交叉验证 自助法;训练集+测试集:互斥互补 训练集训练模型,测试集测试模型 合理划分、保持比例 单次留出与多次留出 多次留出法:如对专家样本随机进行100次训练集/测试集划分,评估结果取平均 ;K折交叉验证:将专家样本等份划分为K个数据集,轮流用K-1个用于训练,1个用于测试 P次K折交叉验证 ;留出法与交叉验证法的训练集数据少于样本数据 给定m个样本的数据集D,从D中有放回随机取m次数据,形成训练集D’ 用D中不包含D’的样本作为测试集 D中某个样本不被抽到的概率: 测试集数据量: 缺点:改变了初始数据集的分布 ;;回归任务的评价标准:均方误差 ;错误率:分类错误样本数占总样本数比例 精度:1-错误率,分类正确样本数占总样本数比例 ;犯错的代价: 2004年12

文档评论(0)

1亿VIP精品文档

相关文档