- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
SPSS 聚类分析 _详解
SPSS聚类分析 —— 一个案例演示聚类分析全过程
案例数据源:
有20 种 12 盎司啤酒成分和价格的数据, 变量包括啤酒名称、 热量、钠含量、 酒精含量、 价格。数据来自 《SPSS
for Windows 统计分析》 data11-03 。点击下载
【一】问题一:选择那些变量进行聚类? —— 采用 “R 型聚类 ”
1 、现在我们有 4个变量用来对啤酒分类,是否有必要将 4个变量都纳入作为分类变量呢?热量、钠含量、
酒精含量这 3 个指标是要通过化验员的辛苦努力来测定, 而且还有花费不少成本, 如果都纳入分析的话, 岂
不太麻烦太浪费?所以,有必要对 4 个变量进行降维处理,这里采用 spss R 型聚类(变量聚类) ,对 4 个变
量进行降维处理。输出 “相似性矩阵 ”有助于我们理解降维的过程。
2 、4个分类变量量纲各自不同,这一次我们先确定用相似性来测度,度量标准选用 pearson 系数,聚类方
法选最远元素,此时,涉及到相关, 4 个变量可不用标准化处理,将来的相似性矩阵里的数字为相关系数。
若果有某两个变量的相关系数接近 1或 -1 ,说明两个变量可互相替代。
3 、只输出 “树状图 ”就可以了,个人觉得冰柱图很复杂,看起来没有树状图清晰明了。从 proximity matrix
表中可以看出热量和酒精含量两个变量相关系数 0.903 ,最大,二者选其一即可, 没有必要都作为聚类变量,
导致成本增加。至于热量和酒精含量选择哪一个作为典型指标来代替原来的两个变量,可以根据专业知识
或测定的难易程度决定。 (与因子分析不同,是完全踢掉其中一个变量以达到降维的目的。 )这里选用酒精
含量,至此,确定出用于聚类的变量为:酒精含量,钠含量,价格。
【二】问题二: 20 中啤酒能分为几类? —— 采用 “Q 型聚类 ”
1 、现在开始对 20 中啤酒进行聚类。开始不确定应该分为几类,暂时用一个 3-5 类范围来试探。 Q 型聚类要
求量纲相同,所以我们需要对数据标准化,这一回用欧式距离平方进行测度。
2 、主要通过树状图和冰柱图来理解类别。最终是分为 4类还是 3 类,这是个复杂的过程,需要专业知识和
最初的目的来识别。我这里试着确定分为 4 类。选择 “保存 ”,则在数据区域内会自动生成聚类结果。
【三】问题三:用于聚类的变量对聚类过程、结果又贡献么,有用么? —— 采用 “单因素方差分析 ”
1 、聚类分析除了对类别的确定需讨论外, 还有一个比较关键的问题就是分类变量到底对聚类有没有作用有
没有贡献,如果有个别变量对分类没有作用的话,应该剔除。
2 、这个过程一般用单因素方差分析来判断。注意此时,因子变量选择聚为 4 类的结果,而将三个聚类变量
作为因变量处理。方差分析结果显示,三个聚类变量 sig 值均极显著,我们用于分类的 3 个变量对分类有作
用,可以使用,作为聚类变量是比较合理的。
【四】问题四:聚类结果的解释? —— 采用 ”均值比较描述统计 “
1 、聚类分析最后一步,也是最为困难的就是对分出的各类进行定义解释,描述各类的特征,即各类别特征
描述。这需要专业知识作为基础并结合分析目的才能得出。
2 、我们可以采用 spss 的 means 均值比较过程,或者 excel 的透视表功能对各类的各个指标进行描述。
其中, report 报表用于描述聚类结果。对各类指标的比较来初步定义类别,主要根据专业知识来判定。这
里到此为止。
以上过程涉及到 spss 层次聚类中的 Q 型聚类和 R 型聚类,单因素方差分析, means 过程等,是一个很不
错的多种分析方法联合使用的案例。数据源和部分介绍均摘自《 SPSS for Win
原创力文档


文档评论(0)