生物信息数据库简介.pptVIP

  • 3
  • 0
  • 约1.15万字
  • 约 43页
  • 2016-12-05 发布于重庆
  • 举报
生物信息数据库简介

不同数据库的序列格式 在运行序列分析软件中遇到的首要问题就是如何通过不同的程序使用不同的序列格式。这些格式都是标准ASCII码文件,但在显示各种信息或序列本身的某些字符或字有所不同。下面将讨论几种常用的序列格式。 1. GenBank中DNA序列格式 GenBank中数据库(包括NCBI核酸和蛋白质序列数据库)中条目格式如下:给出描述每一个序列的信息,包括文献参考、序列的功能信息、mRNA和编码区域的位置,以及重要突变的位置。这些序列信息以字段的形式进行组织,每一行最前端都有一个标识符。在某些条目中,标识符可能缩写成两个字母(例如RF代表reference),某些字段可能还有次级字段。计算机程序中的序列条目位于标识符“ORIGIN”和“//”之间。这些字段提供的信息可以参见网页/Sitemap/samplerecord.html 序列每行前面标有数字,以显示片断位置。序列计数或序列校检求和的值可被计算机程序用来鉴定序列成分,所以除非程序本身也改变计数,序列计数是不能被改变的。 GenBank序列格式通常需要改变以适应序列分析软件。 2 EMBL序列格式 The European Molecular Biology Laboratory(EMBL)序列条目与GenBank类似,通过大量信息来描述每个序列。该信息组织成一个个字段,每个字段有一个标识符。这些标识符缩写成两个字母,某些字

文档评论(0)

1亿VIP精品文档

相关文档