第8章 主成分分析与子分析第8章 主成分分析与因子分析.pptVIP

第8章 主成分分析与子分析第8章 主成分分析与因子分析.ppt

  1. 1、本文档共71页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  5. 5、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  6. 6、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  7. 7、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  8. 8、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
zf zf 第8章 主成分分析 与因子分析 基本思想 为尽可能完整描述一个事物,往往要收集它的许多指标(如企业评价、投资环境评价) 多指标产生的问题: 计算处理麻烦 信息重叠 从众多的指标中剔除一些指标又会造成信息丢失 基本出发点 将原始指标综合成较少的指标,这些指标能够反映原始指标的绝大部分信息(方差) 这些综合指标之间没有相关性 8.1 主成分分析的基本思想 一项十分著名的工作是美国的统计学家斯通(stone)在1947年关于国民经济的研究。他曾利用美国1929一1938年各年的数据,得到了17个反映国民收入与支出的变量要素,例如雇主补贴、消费资料和生产资料、纯公共支出、净增库存、股息、利息外贸平衡等等。 在进行主成分分析后,竟以97.4%的精度,用三新变量就取代了原17个变量。 主成分分析:将原来较多的指标简化为少数几个新的综合指标的多元统计方法。 主成分:由原始指标综合形成的几个新指标。依据主成分所含信息量的大小成为第一主成分,第二主成分等等。 数学模型与几何解释——几何解释 为了方便,我们在二维空间中讨论主成分的几何意义: 设有n个样品,每个样品有两个观测变量xl和x2,在由变量xl和x2 所确定的二维平面中,n个样本点所散布的情况如椭圆状。由图可以看出这n个样本点无论是沿着xl 轴方向或x2轴方向都具有较大的离散性,其离散的程度可以分别用观测变量xl 的方差和x2 的方差定量地表示。显然,如果只考虑xl和x2 中的任何一个,那么包含在原始数据中的经济信息将会有较大的损失。 如果我们将xl 轴和x2按逆时针方向旋转?角度,得到新坐标轴yl和y2。yl和y2是两个新变量。 旋转坐标轴 根据旋转变换的公式: 坐标轴变换的目的:为了使得n个样品点在yl轴方向上的离散程度最大,即yl的方差最大。 (变量yl代表了原始数据的绝大部分信息,在研究某经济问题时,即使不考虑变量y2也无损大局)。经过上述旋转变换原始数据的大部分信息集中到yl轴上,对数据中包含的信息起到了浓缩作用。 yl,y2除了可以对包含在Xl,X2中的信息起着浓缩作用之外,还具有不相关的性质,这就使得在研究复杂的问题时避免了信息重叠所带来的虚假性。二维平面上的个点的方差大部分都归结在yl轴上,而y2轴上的方差很小。yl和y2称为原始变量x1和x2的综合变量。y简化了系统结构,抓住了主要矛盾。 由此可概括出主成分分析的几何意义: 主成分分析的过程也就是坐标旋转的过程,各主成分表达式就是新坐标系与原坐标系的转换关系,新坐标系中各坐标轴的方向就是原始数据方差最大的方向。 数学模型与几何解释——数学模型 假设我们所讨论的实际问题中,有p个指标,我们把这p个指标看作p个随机变量,记为X1,X2,…,Xp,主成分分析就是要把这p个指标的问题,转变为讨论p个指标的线性组合的问题,而这些新的指标y1,y2,…,yk(k≤p),按照保留主要信息量的原则充分反映原指标的信息,并且相互独立。 这种由讨论多个指标降为少数几个综合指标的过程在数学上就叫做降维。主成分分析通常的做法是,寻求原指标的线性组合yi。 8.2 因子分析的基本理论 1、什么是因子分析? 因子分析是主成分分析的推广,它对问题的研究更为深入,是将具有错综复杂关系的多个变量综合为少数几个因子,以再现原始变量与因子之间的相互关系,探讨多个能够直接测量,并且具有一定相关性的实测指标是如何受少数几个内在的独立因子所支配的,同时根据不同因子还可以对变量进行分类,属于多元统计分析中处理降维的一种统计方法。 2、因子分析的基本思想 把每个研究变量分解为几个影响因素变量,将每个原始变量分解成两部分因素,一部分是由所有变量共同具有的少数几个公共因子组成的,另一部分是每个变量独自具有的因素,即特殊因子。 例:在研究高中学生的学习能力时,通过6门课程(数学、物理、化学、语文、历史、英语)的成绩来研究,现分析评价100个学生的学习能力。 高中学生的学习能力主要分为两个方面,即文科和理科。因子分析方法可以通过6个变量(课程),找出反映文科、理科的两个潜在的因子,对这100个学生进行评价。而这两个公共因子可以表示为: 称 是不可观测的潜在因子,称为公共因子。6个变量共享这两个因子,但是每个变量又有自己的个性,不被包含的部分 ,称为特殊因子。 100个学生的数学、物理、化学、语文、历史、英语的成绩如下表(部分)。 3、因子分析的数学模型 (1) (2) (3) 4、主成分分析与因子分析的联系和差异: 联系:(1)因子分析是主成分分析的推广。(2)二者都是以“降维”为目的,都是从协方差矩阵或相关系数矩阵出

文档评论(0)

cduutang + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档