(试验设计与统计分析SAS实践)第11单元聚类分析.ppt

(试验设计与统计分析SAS实践)第11单元聚类分析.ppt

  (1) 将表11-7所示二值数据样本创建为SAS数据表sasuser.julei03。   (2) 定义匹配系数。每个品系(种)的一行二值观测是它的一种基因表达,亲缘相近者其基因表达亦相近。采用匹配系数SC?=?m/n度量基因表达的相似程度,其中n是同一引物PCR扩增DNA带位点总个数,m是两样品匹配位点的个数,所谓匹配,是指两样品在同一位点上的观察值相同,即(0,0)和(1,1)称做匹配,(0,1)或(1,0)称做不匹配。匹配系数愈大,样品愈相似,而距离愈小,样品愈不相似,匹配系数和距离的数值大小在表达相似性上正相反。   (3) 匹配系数变换为距离型数据。因SAS的cluster过程只能处理距离型数据或坐标型数据,故匹配系数需转换为距离型数据。数据表sasuser.julei03需进行两步预处理才能进行聚类,第一步计算匹配阵(SC),第二步计算广义的距离阵1-SC。距离是规范化数据,故聚类时属性变量不需标准化。   (4) 采用iml过程将二值数据表sasuser.julei03变换为距离阵数据表distancetable,采用cluster过程调用数据表distancetable进行系统聚类,采用tree过程绘制聚类谱系图,一些语句的含义详见程序中的注释文本。SAS程序如下:   (5) 程序输出的主要结果如表11-8、表11-9和图11-4所示。   (6) 相关阵的前

文档评论(0)

1亿VIP精品文档

相关文档