- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
多元统计分析第一页,共四十六页,2022年,8月28日
1.问题引入2.思路点拨3.判别分析方法4.DNA序列分类问题的求解5. 参考文献目 录第二页,共四十六页,2022年,8月28日
首先,我们来考虑一下2000年“网易杯”全国大学生数学建模竞赛的A题是关于“DNA序列分类”的问题 1.问题引入第三页,共四十六页,2022年,8月28日
人类基因组中的DNA全序列是由4个碱基A,T,C,G按一定顺序排成的长约30亿的序列,毫无疑问,这是一本记录着人类自身生老病死及遗传进化的全部信息的“天书”。但是,除了这四种碱基外,人们对它所包含的内容知之甚少,如何破译这部“天书”是二十一世纪最重要的任务之一。在这个目标中,研究DNA全序列具有什么结构,由这4个字符排成的看似随机的序列中隐藏着什么规律,又是解读这部天书的基础,是生物信息学(Bioinformatics)最重要的课题之一。 第四页,共四十六页,2022年,8月28日
虽然人类对这部“天书”知之甚少,但也发现了DNA序列中的一些规律性和结构。例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这4个字符组成的64种不同的3字符串,其中大多数用于编码构成蛋白质的20种氨基酸。又例如,在不用于编码蛋白质的序列片段中,A和T的含量特别多些,于是以某些碱基特别丰富作为特征去研究DNA序列的结构也取得了一些结果。此外,利用统计的方法还发现序列的某些片段之间具有相关性,等等。这些发现让人们相信,DNA序列中存在着局部的和全局性的结构,充分发掘序列的结构对理解DNA全序列是十分有意义的。 第五页,共四十六页,2022年,8月28日
作为研究DNA序列的结构的尝试,试对以下序列进行分类:问题一:下面有20个已知类别的人工制造的序列(见附件1),其中序列标号1—10 为A类,11-20为B类。请从中提取特征,构造分类方法,并用这些已知类别的序列,衡量你的方法是否足够好。然后用你认为满意的方法,对另外20个未标明类别的人工序列(标号21—40)进行分类,把结果用序号(按从小到大的顺序)标明它们的类别(无法分类的不写入): A类 ; B类 。第六页,共四十六页,2022年,8月28日
问题二:请对 182个自然DNA序列()进行分类。它们都较长。用你的分类方法对它们进行分类,并给出分类结果。 看了这道题,我们应当从何处入手呢,我们应该怎样进行分析呢……第七页,共四十六页,2022年,8月28日
2.思路点拨细读全题对未知事物进行分类 问题的本 质对另外20个未标明类别的DNA序列进行分类 根据所给的20个已知类别的DNA序列所提供的信息 对182个自然DNA序列进行分类 第八页,共四十六页,2022年,8月28日
如果将每一个DNA序列都看作样本,那么该问题就进一步提炼成一个纯粹的数学问题:设有两个总体(类) 和 ,其分布特征(来自各个总体的样本)已知,对给定的新品 ,我们需要判断其属于哪个总体(类)。 对于上面的数学问题,可以用很多成熟的方法来解决,例如: (1)BP神经网络; (2)聚类分析;(3)判别分析;等等。 第九页,共四十六页,2022年,8月28日
如何选取方法是建模过程中需要解决的另外一个问题:BP神经网络是人工神经网络的一种,它通过对训练样本的学习,提取样本的隐含信息,进而对新样本的类别进行预测。BP神经网络可以用以解决上面的DNA序列分类问题,但是,如何提取特征、如何提高网络的训练效率、如何提高网络的容错能力、如何建立网络结构是能否成功解决DNA序列分类问题的关键所在;聚类分析和判别分析都是多元统计分析中的经典方法,都可以用来将对象(或观测值)分成不同的集合或类别,但是,聚类分析更侧重于“探索”对象(或观测值)的自然分组方式,而判别分析则侧重于将未知类别的对象(或观测值)“归结”(或者说,分配)到已知类别中。显然,判别分析更适合用来解决上面的DNA序列分类问题。第十页,共四十六页,2022年,8月28日
3.判别分析方法 判别分析是用于判别样品所属类别的一种多元统计分析方法。判别分析问题都可以这样描述:设有 个 维的总体 ,其分布特征已知(如已知分布函数分别为 或者已知来自各个总体的样本),对给定的一个新样品 ,我们需要判断其属于哪个总体。一般来说,根据判别规则的不同,可以得到不同的判别方法 ,例如,距离判别、贝叶斯(Bayes
您可能关注的文档
- 专题二教育功能与教育目的.ppt
- 班级管理学第一章.ppt
- 第四章会谈及会谈技巧.ppt
- 二年四班敬老爱老主题班会.ppt
- 抽样调查教案.ppt
- 高中化学阿氏常数的常见险境和对策.ppt
- 脑中风的神经康复幻灯片.ppt
- 复变函数第二章解析函数.ppt
- 利用基本法推动队伍发展.ppt
- 浅谈心电图诊断与分析.ppt
- 2025至2030中国钢轨用轻质复合材料行业调研及市场前景预测评估报告.docx
- 2025至2030中国对薄荷3,8二醇(PMD)行业细分市场及应用领域与趋势展望研究报告.docx
- 2025至2030中国弹道头盔行业细分市场及应用领域与趋势展望研究报告.docx
- 2025至2030中国2,6二羧基吡啶市场前景规划及未来运营现状分析报告.docx
- 2025至2030中国玻璃温度计行业市场深度研究与战略咨询分析报告.docx
- 2025至2030中国地形感知和警告系统(TAWS)行业调研及市场前景预测评估报告.docx
- 2025至2030中国发电技术行业调研及市场前景预测评估报告.docx
- 2025至2030中国多离子束显微镜行业细分市场及应用领域与趋势展望研究报告.docx
- 2025至2030中国储能技术行业市场占有率及有效策略与实施路径评估报告.docx
- 2025至2030中国丙酸氟替卡松吸入器行业市场占有率及有效策略与实施路径评估报告.docx
原创力文档


文档评论(0)