- 1、本文档共14页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
主成分分析法(PCA)
在实际问题中,我们经常会遇到研究多个变量的问题,而且在多数情况下,多个变量之间常常存在一定的相关性。由于变量个数较多再加上变量之间的相关性,势必增加了分析问题的复杂性。如何从多个变量中综合为少数几个代表性变量,既能够代表原始变量的绝大多数信息,又互不相关,并且在新的综合变量基础上,可以进一步的统计分析,这时就需要进行主成分分析。
主成分分析法(PCA)模型
主成分分析的基本思想
主成分分析是采取一种数学降维的方法,找出几个综合变量来代替原来众多的变量,使这些综合变量能尽可能地代表原来变量的信息量,而且彼此之间互不相关。这种将把多个变量化为少数几个互相无关的综合变量的统计分析方法就叫做主成分分析或主分量分析。
主成分分析所要做的就是设法将原来众多具有一定相关性的变量,重新组合为一组新的相互无关的综合变量来代替原来变量。通常,数学上的处理方法就是将原来的变量做线性组合,作为新的综合变量,但是这种组合如果不加以限制,则可以有很多,应该如何选择呢?如果将选取的第一个线性组合即第一个综合变量记为F1,自然希望它尽可能多地反映原来
变量的信息,这里“信息”用方差来测量,即希望Var(F)越大,表示F包含的信息越多。
TOC\o1-5\h\z1 1
因此在所有的线性组合中所选取的F1应该是方差最大的,故称F1为第一主成分。如果第一主成分不足以代表原来P个变量的信息,再考虑选取乌即第二个线性组合,为了有效地反映原来信息,F1已有的信息就不需要再出现在F2中,用数学语言表达就是要求
Cov(F,F)=0,称F为第二主成分,依此类推可以构造出第三、四……第P个主成分。1 2 2
主成分分析的数学模型
对于一个样本资料,观测P个变量X,X,…x,n个样品的数据资料阵为:
1 2p
(x x
11 12
\oCurrentDocumentX X
X= 21 22
Ixx*n1 n2
1J
X
其中:X=?, J=1,2,…〃
j:
主成分分析就是将〃个观测变量综合成为〃个新的变量(综合变量),即
TOC\o1-5\h\zF=ax+ax ax
1 11 1 12 2 Ipp
F=ax+ax ax
2 21 1 22 2 2p p
F=ax+ax ax
p pl 1 p2 2 pp p
简写为:
F—otx+ax+?,,+otx
j八1j22 jpp
j=l,2,…,〃
要求模型满足以下条件:
①互不相关(i手j,i,j=l,2,—,p)
lj
②尸的方差大于尸-的方差大于尸3的方差,依次类推
k=12…@a2+a2 a
k=12…
klk2 kp
于是,称七为第-主成分,七为第二主成分,依此类推,有第〃个主成分。主成分又叫主分量。这里我们称为主成分系数。
上述模型可用矩阵表示为:
F=AX,i
F=AX,
i
F
2
其中
(X)
1
X
2
¥
a
a
???
a
a
11
12
i。
i
a
a
??.
a
a
21
22
——
2
?
?
?
?
?
a
a
???
a
a
pi
〃2
PP
A称为主成分系数矩阵。
(三)主成分分析的几何解释
假设有n个样品,每个样品有二个变量,即在二维空间中讨论主成分的几何意义。设n
个样品在二维空间中的分布大致为一个椭园,如下图所示:
将坐标系进行正交旋转一个角度9,使其椭圆长轴方向取坐标
将坐标系进行正交旋转一个角度9
,使其椭圆长轴方向取坐标y1,在椭圆短轴方向取
y1j
y=x2j写成矩阵形式为:Y
y1j
y=x
2j
写成矩阵形式为:Y=
cos9
-sin9
其中u为坐标旋转变换矩阵
*2
sin9
cos9
y
1n
y
2n
\oCurrentDocumentx x
11 12
x x
21 22
x
1n
x
2n」
它是正交矩阵,即有
U=U-1,UU=I,即满足
坐标〉2,旋转公式为
=xcos9+xsin9
(-sin9)+xcos9
1j
j=1,2…n
sin29+cos29=1。
经过旋转变换后,
经过旋转变换后,
图2主成分几何解释图
新坐标y1-y2有如下性质:
n个点的坐标y1和y2的相关几乎为零。
二维平面上的n个点的方差大部分都归结为y1轴上,而y2轴上的方差较小。
y和y称为原始变量x和x的综合变量。由于n个点在y轴上的方差最大,因而将1 2 1 2 1
二维空间的点用在yi轴上的一维综合变量来
文档评论(0)