- 7
- 0
- 约8.72千字
- 约 16页
- 2016-03-13 发布于安徽
- 举报
数据挖掘中所需的概率论及数理统计知识.doc
前言
? ??一个月余前,在微博上感慨道,不知日后是否有无机会搞DM,微博上的朋友@只看不发的围脖评论道:算法研究领域,那里要的是数学,你可以深入学习数学,将算法普及当兴趣。想想,甚合我意。自此,便从友人@rickjin写的“正态分布的前世今生”开始研习数学。
? ? 如之前所说,“今年5月接触DM,循序学习决策树.贝叶斯,SVM.KNN,感数学功底不足,遂补数学,从‘正态分布的前后今生’中感到数学史有趣,故买本微积分概念发展史读,在叹服前人伟大的创造之余,感微积分概念模糊,复习高等数学上册,完后学概率论与数理统计,感概道:微积分是概数统计基础,概数统计则是DMML之必修课。”包括读者相信也已经感觉到,我在写这个系列的时候,其中涉及到诸多的数学概念与基础知识(例如此篇SVM文章内诸多max.s.t.对偶.KKT条件.拉格朗日.松弛因子等问题则皆属最优化理论与算法范畴内),特别是概率论与数理统计部分。更进一步,在写上一篇文章的时候,看到机器学习中那么多距离度量的表示法,发现连最起码的期望,方差,标准差等基本概念都甚感模糊,于此,便深感数学之重要性。
? ? 很快,我便买了一本高等教育出版社出版的概率论与数理统计一书,此书“从0-1分布、到二项分布、正态分布,概率密度函数,从期望到方差、标准差、协方差,中心极限定理,样本和抽样,从最大似然估计量到各种置信区间,从方差分析到回归分析,bootstrap方法,最后到马尔可夫链,以前在学校没开概率论与数理统计这门课,现在有的学有的看了”。且人类发明计算机,是为了辅助人类解决现实生活中遇到的问题,然计算机科学毕竟只发展了数十年,可在数学.统计学中,诸多现实生活问题已经思考了数百年甚至上千年,故,计算机若想更好的服务人类解决问题,须有效借鉴或参考数学.统计学。世间万事万物,究其本质乃数学,于变化莫测中寻其规律谓之统计学。
? ? 话休絮烦。本文结合概率论与数理统计一书(此文亦可看作此书的读书笔记)与wikipedia,对数据挖掘中所需的概率论与数理统计相关知识概念作个科普,方便你我随时查看复习相关概念,而欲深入学习研究的课后还需参看相关专业书籍.资料。同时,本文篇幅会比较长,简单来说,本文第一部分概念:关于随机变量及其分布;第二部分讲历史:从历史中窥探正态分布的前后由来;第三部分继续讲概念:关于数学期望.方差等。三部分起承转合,彼此依托。且在第一、三部分中,会出现诸多并不友好的大量各种公式,但基本的概念.定理是任何复杂问题的根基,所以,你我都有必要硬着头皮好好细细阅读。最后,本文若有任何问题或错误,恳请广大读者朋友们不吝批评指正,谢谢。
第一节、离散.连续.多维随机变量及其分布
1.1、几个基本概念点
(一)样本空间
? ? ? ? ?定义:随机试验E的所有结果构成的集合称为E的 样本空间,记为S={e},? ? ? ? 称S中的元素e为样本点,一个元素的单点集称为基本事件.
(二)条件概率
条件概率就是事件A在另外一个事件B已经发生条件下的发生概率。条件概率表示为P(A|B),读作“在B条件下A的概率”。
联合概率表示两个事件共同发生的概率。A与B的联合概率表示为或者。
边缘概率是某个事件发生的概率。边缘概率是这样得到的:在联合概率中,把最终结果中不需要的那些事件合并成其事件的全概率而消失(对离散随机变量用求和得全概率,对连续随机变量用积分得全概率)。这称为边缘化(marginalization)。A的边缘概率表示为P(A),B的边缘概率表示为P(B)。?
?在同一个样本空间Ω中的事件或者子集A与B,如果随机从Ω中选出的一个元素属于B,那么这个随机选择的元素还属于A的概率就定义为在B的前提下A的条件概率。从这个定义中,我们可以得出P(A|B)?=?|A∩B|/|B|分子、分母都除以|Ω|得到
? ? 有时候也称为后验概率。
? ? 同时,P(A|B)与P(B|A)的关系如下所示:
? ? 。?
(三)全概率公式和贝叶斯公式
? ? 1、全概率公式
? ? 假设{?Bn?:?n?=?1,?2,?3,?...?}?是一个概率空间的有限或者可数无限的分割,且每个集合Bn是一个可测集合,则对任意事件A有全概率公式:
? ? 又因为
? ? 所以,此处Pr(A?|?B)是B发生后A的条件概率,所以全概率公式又可写作:
? ? ?在离散情况下,上述公式等于下面这个公式:。但后者在连续情况下仍然成立:此处N是任意随机变量。这个公式还可以表达为:A的先验概率等于A的后验概率的先验期望值。?
? ? 2、贝叶斯公式
? ??贝叶斯定理(Bayes theorem),是概率论中的一个结果,它跟随机变量的条件概率以及边缘概率分布有关。在有些关于概率的解说中,贝叶斯定理(贝叶斯更新)能够告知我们如何利用新证据修
您可能关注的文档
最近下载
- 网约车辆火灾防控应急预案.docx VIP
- 工程施工旁站监理措施(3).docx VIP
- 2025年河北省人体解剖学(专升本)考试真题及参考答案.docx VIP
- 人民大2024产业经济学(第六版)课件第11章 产业结构政策.pptx VIP
- 河道冬雨季施工方案.docx VIP
- 电动垂直起降(eVTOL)2025年适航认证案例分析:安全性与可靠性评估.docx
- 2026部编版小学数学二年级上册期末考试卷(3套含答案解析).docx
- 公司消防安全第一责任人职责模板范本.docx VIP
- 为自己点赞主题班会课件.pptx VIP
- 精品解析:2024年山东省淄博市张店区中考一模数学模拟试题(原卷版).docx VIP
原创力文档

文档评论(0)