第四节 基因表达数的聚类分析.docVIP

  • 12
  • 0
  • 约3.27万字
  • 约 24页
  • 2017-08-22 发布于贵州
  • 举报
第四节 基因表达数据的聚类分析 基因表达数据主要来自于两个方面,一是基因芯片,这是最主要的表达数据来源,利用基因芯片技术可以大规模并行获取基因转录结果mRNA的数据(Schena Eet al,1995)。表达系列分析SAGE和差异显示(Kozian and Kirschbaum,1999)、蛋白质芯片等是快速检测蛋白质及其含量的另一类技术。 聚类分析是模式识别中一种非常有吸引力的方法,特别适用于模式分类数不知道的情况。从机器学习的角度来看,有两种基本的聚类分析(Kaufman 1990),即所谓有教师聚类和无教师聚类。在有师聚类中,对于每一类有一个参考模式,对于一个未分类的向量,通过计算选择一个最接近的参考模式,并将该向量归入该参考模式所对应的类,这实际上是一个分类问题。而真正的聚类分析是一种无师学习(或无监督学习),没有关于聚类的先验知识,需要聚类算法根据样本之间的距离或者相似程度进行自动分类(傅京孙,1990;李介谷等,1986)。 基因表达数据聚类分析一般包括以下几个步骤:(1)确定基因表达的数据;(2)计算相似性矩阵,各个矩阵元素代表两个基因的表达是否相似;(3)选择算法进行聚类分析;(4)显示分析结果。以下着重讨论对表达型基因芯片实验数据的处理和分析。 在一种基因芯片上往往含有成百上千个基因探针,一次可以同时检测大量基因的表达。利用同一种芯片在不同条件下(不同时间,不

文档评论(0)

1亿VIP精品文档

相关文档