大数据下的聚类与分类技术应用解析.pptVIP

  • 0
  • 0
  • 约7.37千字
  • 约 10页
  • 2026-08-20 发布于江苏
  • 举报

大数据下的聚类与分类技术应用解析.ppt

聚类分析和鉴别分析

第1页

聚类分析

引言

相似性度量

系统聚类

K-均值聚类

聚类分析的SPSS实现

第2页

引言

物以类聚,人以群分。

例:中国的民族分成若干类,上市企业分类,等等

对于一种数据集,人们既能够对变量(指标)进行分类(称为R型聚类),也能够对观测值(个案,样品)来分类(称为Q型聚类)。这两种聚类在数学上是对称的,没有什么不同。

第3页

例:哪些少数民族的生存情况更接近?

民族

原始数据

标化死亡率(‰)

出生时期望寿命(岁)

满族

5.80

70.59

朝鲜族

7.44

67.14

蒙古族

8.11

65.48

维吾尔族

10.21

58.88

藏族

9.51

59.24

哈萨克族

9.81

60.47

*标化死亡率是依据相似的人口年纪结构(标准组)计算的,因而更具可比性。

第4页

聚类分析需要处理的一种问题

怎样衡量样本点之间的距离或相似程度?

距离,主要用于样品(观测)间相似性度量

相似系数,主要用于变量间相似性度量

第5页

常用的距离的计算方法

设每个样品有p个指标(变量)。把n个样品看成p维空间中的n个点,则两个样品间相似程度就可用p维空间中的两点距离公式来度量。

两点距离公式能够从不同角度进行定义。

当变量的测量值相差悬殊时,要先进行标准化,以消除计量单位对计算成果的影响。

第6页

常用的距离的计算方法

欧氏距离(Euclidean

文档评论(0)

1亿VIP精品文档

相关文档