- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
第四章 生物分子数据库;第一节 引言;生物分子数据库应满足5个方面的主要需求
(1)时间性
(2)注释
(3)支撑数据
(4)数据质量
(5)集成性 ;生物分子数据库
一级数据库
数据库中的数据直接来源于实验获得的原始数据,只经过简单的归类整理和注释
二级数据库
对原始生物分子数据进行整理、分类的结果,是在一级数据库、实验数据和理论分析的基础上针对特定的应用目标而建立的 。;生物分子数据库几个明显的特征:;第二节 核酸序列数据库;核酸序列数据的增长趋势
(纵轴代表总的核酸序列长度,单位:百万bp);;;;“ID”为序列的标识符行,包括登录号、类型,分子的长度 ;提交数据;;EMBL提供一些与序列相关的检索操作(基于3W服务器);例如:
登录号为J00231的核酸序列具有这样一个交叉索引行:;2、基因组数据库(GDB) ;与染色体相关的信息;;3、人类基因组数据库Ensembl;Ensembl 数据库结构图 ;Ensembl提供多种查询方式
通过关键字查询
用BLAST进行相似序列的搜索
另一种更直观的方式是显示各染色体
用户可以在染色体水平上选择感兴趣的位点, 逐层放大
浏览整个基因组;;人的第9号染色体及大鼠对应的染色体片段;4、表达序列标记数据库dbEST;5、序列标记位点数据库dbSTS;6、面向基因聚类数据库UniGene;第三节 蛋白质序列数据库;除了蛋白质序列数据之外,PIR还包含以下信息:
(1)蛋白质名称、蛋白质的分类、蛋白质的来源;
(2)关于原始数据的参考文献;
(3)蛋白质功能和蛋白质的一般特征,包括基因表达、翻译后处理、活化等;
(4)序列中相关的位点、功能区域。;PIR提供三种类型的检索服务:
一是基于文本的交互式查询,
用户通过关键字进行数据查询。
二是标准的序列相似性搜索,
包括BLAST、FastA等。
三是结合序列相似性、注释信息
和蛋白质家族信息的高级搜索,
包括按注释分类的相似性搜索、
结构域搜索等。;三个子数据库;2、SWISS-PROT ; (1)注释
在SWISS-PROT中,数据分为核心数据和注释两大类。
核心数据包括:
序列数据、参考文献、分类信息(蛋白质生物来源的描述??
注释包括:
(A)蛋白质的功能描述;
(B)翻译后修饰;
(C)域和功能位点,如钙结合区域、ATP结合位点等;
(D)蛋白质的二级结构;
(E)蛋白质的四级结构,如同构二聚体、异构三聚体等;
(F)与其它蛋白质的相似性;
(G)由于缺乏该蛋白质而引起的疾病;
(H)序列的矛盾、变化等。;(2)最小冗余;;3、TrEMBL;
包括:
Swiss-Prot
TrEMBL
PIR
用户可以通过文本查询数据库,可以利用BLAST程序搜索数据库,也可以直接通过FTP 下载数据。;
UniProt包含3个部分:
(1)UniProt Knowledgebase(UniProt)
蛋白质序列、功能、分类、交叉引用等信息存取中心
(2)UniProt Non-redundant Reference(UniRef)数据库
将密切相关的蛋白质序列组合到一条记录中
以便提高搜索速度;
(3)UniProt Archive(UniParc)
资源库,记录所有蛋白质序列的历史。
;第四节 生物大分子结构数据库;一种是显式序列信息(explicit sequence)
在PDB文件中,以关键字SEQRES作为显式序列标记,以该关键字打头的每一行都是关于序列的信息。
一种是隐式序列信息(implicit sequence)
PDB的隐式序列即为立体化学数据,包括每个原子的名称和原子的三维坐标。 ;;HEADER HYDROLASE 19-FEB-97 1ADZ
TITLE THE SOLUTION STRUCTURE OF THE SECOND KUNITZ DOMAIN OF
TITLE 2 TISSUE FACTOR PATHWAY INHIBITOR, NMR, 30 STRUCTURES
COMPND MOL_ID: 1;
文档评论(0)