- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
- 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
- 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们。
- 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
- 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
第三章 统计案例 3.2 独立性检验的基本思想及其初步应用
3.2 独立性检验的基本思想及其初步应用 1.了解独立性检验(只要求2×2列联表)的基本思想、方法及其简单应用. 2.了解假设检验的基本思想、方法及其简单应用. 1.分类变量和列联表 (1)分类变量 变量的不同“值”表示个体所属的 ,像这样的变量称为分类变量. (2)列联表 ①定义:列出的两个分类变量的 ,称为列联表. ②2×2列联表 一般地,假设两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其样本频数列联表(称2×2列联表)为 思考1 分类变量中的“变量”和“值 ”与定理中的变量和值有什么不同? 分类变量中所说的“变量”和“值”不一定取具体的数值.例如:对于性别变量,取值有男和女两种情况,那么这里的变量指的是性别,同样这里的值是“男”或“女”.在现实生活中,分类变量是大量存在的. 思考2 列联表中|ad-bc|的值与两个分类变量之间关系的强弱有什么关系? 在列联表中,如果两个分类变量没有关系,则应满足ad-bc≈0,因此|ad-bc|越小,说明两个分类变量之间关系越弱;|ad-bc|越大,说明两个分类变量之间关系越强. 2.等高条形图 等高条形图与表格相比,更能直观地反映出两个分类变量间是否 ,常用等高条形图展示列联表数据的 . 3.独立性检验 思考3 如果有95%的把握认为X和Y有关系,那么k的值应不小于多少? 如果k>3.841,就有95%的把握认为X和Y有关系.故k的值不小于3.841. 思考4 若没有充分的证据显示“X与Y有关系”,则k的取值有什么特点? k≤2.706. 1.分类变量的不同取值表示个体所属的不同类别,它也称为属性变量或定性变量.分类变量的取值是离散的,且其不同的取值仅表示个体所属的不同类别,如性别变量只取“男”、“女”两个值. 2.分类变量与定量变量不同,定量变量的取值一定是实数,它的取值有特定的含义,它的运算和统计量,如均值、方差等都有实际意义,例如:身高、体重等;而分类变量则无直接的数值意义,虽然有时也用数字来表示分类变量的不同取值,但这时的数字除了分类别无其它意义. 3.2×2列联表是传统的调查研究中最常用的方法之一,它用于研究两个变量之间是相互独立的还是存在某种关联性,它适用于分析两个分类变量之间的关系. 4.2×2列联表是将两个分类变量的频数进行汇总统计的表格,列出2×2列联表是进行独立性检验的前提,分清类别,准确计算是做出2×2列联表的关键. 5.利用2×2列联表进行独立性检验时,要求表中的4个数据都要大于5,因此在选取样本时一定要注意这一点. 要判断两个分类变量有关系,首先假设该结论不成立,即假设“两个分类变量没有关系”成立,在该假设下我们所构造的随机变量K2应该很小,如果由观测数据计算得到的K2的观测值k很大,则在一定程度上说明假设不合理,即认为“两个分类变量有关系”;如果观测值k很小,则说明在样本数据中没有发现足够证据拒绝“两个分类变量没有关系”. 要判断K2的观测值k的大小,首先需确定一个判断规则的临界值k0(k0>0),当k≥k0时就认为K2的观测值k大,此时相应于k0的判断规则为:如果k≥k0,就认为“两个分类变量有关系”;否则就认为“两个分类变量没有关系”.按照上述规则,把“两个分类变量没有关系”错误地判断为“两个分类变量有关系”的概率为P(K2≥k0). (1)根据实际问题的需要确定容许推断“两个分类变量有关系”犯错误概率的上界α,然后查下表确定临界值k0. 下表是某地区的一种传染病与饮用水的调查表: (1)这种传染病是否与饮用水的卫生程度有关,请说明理由; (2)若饮用干净水得病5人,不得病50人,饮用不干净水得病9人,不得病22人.按此样本数据分析这种疾病是否与饮用水有关,并比较两种样本在反映总体时的差异. 【分析】 (1)根据表中的信息计算K2的观测值,并根据临界值表来分析相关性的大小,对于(2)要列出2×2列联表,方法同(1). (2)依题意得2×2列联表: 所以我们有97.5%的把握认为该种疾病与饮用不干净水有关. 两个样本都能统计得到传染病与饮用不干净水有关这一相同结论,但(1)中我们有99.9%的把握肯定结论的正确性,(2)中我们只有97.5%的把握肯定. 打鼾不仅影响别人休息,而且可能与患某种疾病有关.下表是一次调查所得的数据: 根据列联表的独立性检验,能否在犯错误的概率不超过0.001的前提下认为每一晚都打鼾与患心脏病有关系? 为了调查某生产线上,某质量监督员甲对产品质量好坏有无影响,现统计数据如下:质量监督员在现场时,990件产品中合格品为982件,次品数为8件,甲不在现场时,510件产品中合格品为493件,次品数为17件,试分别用列联
文档评论(0)