- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
二、Elman神经网络应用示例—内含子与外显子识别 第七节 支持向量机 一、SVM分类 二、SVM回归 三、SVM训练算法 (一)块算法 (二)固定工作样本集方法 四、SVM的优缺点 优点: 非线性、适用小样本、泛化推广能力优异、避免局部极值、避免“维数灾难” 缺点: 可解释性差、对大训练样本计算复杂度高、核函数的选择缺乏先验的理论指导 五、基于Python的LIBSVM简介 第八节 MATLAB的应用实例 一、数据获取 NCBI EF221854 二、序列分析 (一)绘制密度图 ntdensity(seq) (二)计算核苷酸数目 basecount(seq) (三)显示核苷酸互补链 seqrcomplement(seq) (四)计算二聚体个数 dimercount(mitochondria,chart,bar) (五)计算密码子使用频率 codoncount(ntseq) (六)ORF分析 f=seqshoworfs(ntseq) (七)序列翻译 ND2AASeq=nt2aa(ND2Seq) (八)序列比对 三、系统发生分析 (一)首先建立MATLAB结构,将要分析的各物种的信息输入 (二)准备序列 (三)计算各序列之间的距离 Distance = seqpdist(Seqs) (四)对序列比对的距离进行构树 Tree=seqlinkage(Dist,Method,Names) (五)画出系统发育树 h=plot(tree) 四、芯片数据分析 第十章:统计学习与推理 普通高等教育 “十二五”规划教材 生物信息学 Bioinformatics 第一节 统计学习与推理基础 一、fisher经典参数统计理论 fisher把判别分析、回归分析和密度估计问题等表达为特定参数化模型的参数估计问题,并提出了估计所有模型未知参数的方法——最大似然法。 二、经典非线性法 ANN(artificial neural network) 三、小样本统计学习理论 (一)VC维 (二)推广性的界 对各种类型的函数集,统计学习理论系统地研究了其经验风险与期望风险之间的关系,即推广性的界。 (三)结构风险最小 (四)小样本与转导推理 四、基于概率的方法 基于概率的方法主要包括贝叶斯(Bayes)推理及隐马尔可夫模型(hidden Markov model,HMM),其中贝叶斯推理需利用来源于经验和历史资料的先验信息。 第二节 统计模型与参数推断 一、参数估计量的评选标准 (一)无偏性 参数估计量的期望值与参数真值是相等的,这种性质称为无偏性。具有无偏性的估计量称为无偏估计量。 (二)有效性 (三)相合性 (四)充分性与完备性 二、最小二乘估计 三、最大似然估计 (一)似然函数 对于离散型随机变量,似然函数是多个独立事件的概率函数的乘积,该乘积是概率函数值,它是关于总体参数的函数。 例:一只大口袋里有红、白、黑3种球,采用复置抽50次,得到红、白、黑3种球的个数分别为12、24、14,根据多项式的理论建立似然函。 (二)最大似然估计 所谓最大似然估计就是指使似然函数值为最大以获得总体参数估计的方法。 例:求红、白、黑球实例中 的最大似然估计值。 第三节 聚类分析、主成分分析与Fisher判别 一、聚类分析 (一)数据变换 (二)亲疏程度测度 (三)系统聚类 方法: 最短距离法、最长距离法、中间距离法、重心距离法、类平均法、可变类平均法、可变法、离差平方和法。 二、主成分分析 (一)基本原理 主成分分析(PCA)是把多个指标化为少数几个综合指标的一种统计分析方法。 (二)分析步骤 1)原始数据的标准化 2)样本矩阵的相关系数矩阵 3)特征向量 4)选择主成分 三、Fisher判别 基于Fisher准则,判别的结果应使两组间别最大,使每组内的离散性最小。确定线性判别函数 为待求判别函数的系数。 其中, 第四节 贝叶斯推理 一、贝叶斯定理 二、朴素贝叶斯分类器 三、贝叶斯应用示例 第五节 隐马尔可夫模型 一、马尔可夫及隐马尔可夫模型 二、隐马尔可夫模型的数学描述 三、隐马尔可夫模型的三个基本问题及解决方案 1、评估问题及前向、后向算法 2、解码问题及Viterbi算法 3、学习问题及Baum-Welch算法 四、基于HMM的基因识别程序及HMM的优缺点 VEIL、HMMgene、GeneMark.hmm、Geneie、GENSCAN 缺点: 1)训练所用的样本数有限 2)HMM是一个线性模型,不能描述蛋白质序列中的高阶相关性。 3)只有当事件独立时,模型产生一个序列的概率才是产生各个独立氨基酸的概率的乘积。 第六节 动态神经网络 一、基于MATL
文档评论(0)