机器学习与数据挖掘复习.docVIP

  • 2
  • 0
  • 约1.5千字
  • 约 5页
  • 2020-04-15 发布于湖北
  • 举报
类器进行投票。他适用于不稳定的学习过程,即数据集的一个小变动会产生大的差别,例如 决策树、多层感知器。 6. Boosting 方法:它能提高弱分类器的性能。它是带权值的抽样,改变数据对象的权值,分 类好的数据给与小权值, 分类不好的数据给与大权值, 最终集成分类结果用加权投票的方法。 7. 一些经验: a 如果分类器不稳定用 bagging。 b 如果分类器稳定且简单用 boosting。 c 如果分类器稳定且复杂用随机注入。 d 如果数据有很多类,但是分类器只能处理两个类时,用错误纠正编码。 8. 为什么集成学习有效: a 从统计学角度来说当假设空间很大时, 有可能有一些假设有着相同的精度, 单一的 学习器只能找出他们中的一个假设。 然而集成多个假设就有可能找到最可能的假设。 b 从计算角度来讲, 很多单一学习算法都只能找到一个局部最优假设, 当数据集很大 时,可能很难找到一个最优假设,集成学习可以从多个起始点去局部逼近,这样就 有可能得到一个全局最优的假设。 c 从表示角度来说, 很多情况下最好的假设并不存在于假设空间中, 当用集成方法对 多个假设空间加权集成时就有可能突破假设空间找到最符合的假设。 第十一章 聚类分析 1. 什么叫聚类分析:从给定对象中找出一些簇,使在同一簇中的对象要相似,类与类之间 的对象要不相似。我们希望类内部越紧越好,类之间界限要越明显越好。 2.

文档评论(0)

1亿VIP精品文档

相关文档