数据挖掘技术与应用:机器学习绪论.pptxVIP

  • 3
  • 0
  • 约小于1千字
  • 约 19页
  • 2021-11-24 发布于江西
  • 举报

数据挖掘技术与应用:机器学习绪论.pptx

数据挖掘技术与应用;;引言;请分别讨论下列各组数据的内部关系,并填空。;下列鸢尾花分别属于哪一类:setosa、versicolor、virginica;引言;致力于研究如何通过计算的手段,利用经验(历史数据)来改善系统自身的性能[机器学习]。 从数据中产生模型的算法,即“学习算法”。;;基本术语;学习(训练):从数据中学得模型的过程 训练集:参与模型训练的样本集合 测试:学得模型后,使用其样本进行预测的过程 测试集:被预测的样本集合 假设:学得模型对应的关于数据的某种潜在规律 分类:输出???果是离散值 回归:输出结果是连续值 监督学习:训练样本有标记 无监督学习:训练样本无标记 泛化能力:学得模型适用于新样本的能力 独立同分布:样本空间的全体样本都服从一个未知的分布,且相互独立;;归纳: 从特殊到一般的“泛化”:从样例(训练样本)中学习。 演绎: 从一般到特殊的“特化”:从数学公理推导出定理。;根据已知数据集总结满足何种条件的西瓜是好瓜 色泽乌黑、根蒂蜷缩、敲声浊响的就是好瓜? 色泽乌黑、根蒂稍蜷、敲声沉闷的就不是好瓜?;若色泽、根蒂、敲声皆有3种取值,加上某种属性什么都不取和没有好瓜这个概念,则假设空间共有 4 X 4 X 4 + 1 =65种假设(规则);与训练集一致的假设的集合称为“版本空间” 右侧数据集好瓜的版本空间如下:;;新西瓜:(色泽=青绿:根蒂=蜷缩;敲声=沉闷

文档评论(0)

1亿VIP精品文档

相关文档