第10章-聚类与集成算法-图文.pptxVIP

  • 3
  • 0
  • 约4.25千字
  • 约 23页
  • 2023-09-07 发布于湖北
  • 举报
10.聚类与集成算法 聚类(Clustering)在“无监督学习”任务中研究最多、应用最广目标:将数据样本划分为若干个通常不相交的“簇” (cluster) 既可以作为一个单独过程(用于找寻数据内在的分布结构) 也可作为分类等其他学习任务的前驱过程 性能度量聚类性能度量,亦称聚类“有效性指标” (validity index)?外部指标 (external index)将聚类结果与某个“参考模型”(reference model) 进行比较如 Jaccard 系数, FM 指数,Rand 指数?内部指标 (internal index)直接考察聚类结果而不用任何参考模型如 DB 指数, Dunn 指数等基本想法:? “簇内相似度” (intra-cluster similarity)高,且? “簇间相似度” (inter-cluster similarity)低 距离计算距离度量 (distance metric) 需满足的基本性质:常用距离形式:闵可夫斯基距离 (Minkowski distance)p = 2: 欧氏距离(Euclidean distance)p = 1: 曼哈顿距离(Manhattan distance) 距离计算 (续)? 对 无序 (non-ordinal)属性 ,可使用 VDM(Value Difference Metric)令表示属性 u 上取

文档评论(0)

1亿VIP精品文档

相关文档