77范文网 - 专业文章范例文档资料分享平台

卡方检验

来源:网络收集 时间:2018-12-10 下载这篇文档 手机版
说明:文章内容仅供预览,部分内容可能不全,需要完整文档或者需要复制内容,请下载word后使用。下载word有问题请添加微信号:或QQ: 处理(尽可能给您提供完整文档),感谢您的支持与谅解。点击这里给我发消息

第16章 无序分类变量的统计推断——卡方检验

通过前面的介绍可以知道,变量可以被分为连续性变量(定距、定比)和分类变量,后者又被细分为有序、无序变量两种。对于各组所在总体的定量变量(即连续性变量)的平均水平,可以使用t检验和方差分析方法进行比较,秩和检验则用于比较各组所在总体为有序分类变量的 分布情况是否相同。这里将要介绍的卡方检验主要用于无序分类变量的统计推断,是在应用的程度上可以和t检验相媲美的另一种常用检验方法。

连续变量 两组 t检验

多组 方差分析

分类变量 有序 秩和检验 无序 卡方检验

16.1 卡方检验概述

16.1.1 卡方检验的基本原理 1. 卡方检验的基本思想

卡方检验是以χ2分布为基础的一种常用假设检验方法, 它的无效假设为H0是:观察频数与期望频数没有差异。

卡方检验的基本思想是:首先假设H0成立,基于此前提计算出χ2值,它表示观察值与理论值之间的偏离程度。根据χ2分布及自由度可以确H0假设成立的情况下获得当前统计量及更极端情况的概率P。如果P值很小,说明观察值与理论值偏离程度太大,应当拒绝原假设,表示比较资料之间有显著差异;否则不能拒绝无效假设,尚不能认为样本所代表的实际情况和理论假设有差别。

2.卡方值的计算与意义

见复印资料 柯惠新等人编著《调查研究中的统计分析法》

卡方统计量,由于它最初是由英国统计学家Karl Pearson 在1900年首次提出的,因此也称之为Pearson χ2。

由卡方的计算公式可知,当观察频数与期望频数完全一致时,χ2值为0;观察频数与期望频数越接近,两者之间的差异越小,χ2值越小;反之,观察频数与期望频数差别越大,两者之间的差异越大,χ2值越大。换言之,大的χ2值表明观察频数远离期望频数,即表明远离假设。

3.卡方检验的样本量要求

一般认为,对于卡方检验中的每一个单元格,要求其最小期望频数均大于1,且至少有4/5的单元格期望频数大于5,此时使用卡方分布计算出的概率值才是准确的。

16.1.2 卡方检验的用途

卡方检验最常间的用途就是考察无序分类变量各水平在两组或多组之间的分布是否一致。实

1

际上,除了这个用途之外,卡方检验还有更广泛的应用。具体而言,其用途主要包括以下几个方面。

(1)检验某个连续变量的分布是否与某种理论分布相一致。如是否符合正态分布、是否服从均匀分布、是否服从Poisson分布等。

(2)检验某个分类变量出现的概率是否等于指定概率。如在36选7的彩票抽奖中,每个数字出现的概率是否各为1/36;掷硬币时,正反两面出现的概率是否均为0.5。

(3)检验某两个分类变量是否相互独立。如吸烟(二分类变量:是、否)是否与呼吸道疾病(二分类变量:是、否)有关;产品原料种类(多分类变量)是否与产品合格(二分类变量)有关。

(4)检验控制某种或某几种分类因素的作用以后,另两个分类变量是否相互独立。如在上例中,控制性别、年龄因素影响以后,吸烟是否和呼吸道疾病有关;控制产品加工工艺的影响后,产品原料类别是否与产品合格有关。

(5)检验某两种方法的结果是否一致。如采用两种诊断方法对同一批人进行诊断,其诊断结果是否一致;采用两种方法对客户进行价值类别预测,预测结果是否一致。

16.1.3 SPSS中的相应功能

1. 非参数分布检验中的卡方检验

准确地说,这里提供的就是检验某个分类变量各类的出现概率是否等于指定概率的分布检验。

2. 交叉表过程

主要用于针对两个/多个分类变量的交叉表进行其关联程度的卡方检验,并可进一步计算出关联程度指标等,上面提到的卡方检验用途中的后三项都可以在该过程中实现,而人们一般所说的卡方检验也就是指该过程中的相应功能。

--单样本案例:考察抽样数据的性别分布

--两样本案例:不同收入级别家庭的轿车拥有率比较 --两分类变量间的关联程度的度量 --一致性检验与配对卡方检验 --分层卡方检验

16.2 单样本案例:考察抽样数据的性别分布

从已知的样本数据出发,来判断总体各取值水平出现的概率是否与已知概率相符,即该样本是否的确来自已知总体的分布。这就是本节所说的单样本概率与总体率的比较,也有人称它为拟合问题,在统计学中可以利用(单样本)卡方检验来回答此问题。

在实践工作中,有许多单样本率与总体率进行比较的例子。如骰子是否公平,检验各面出现的概率是否各等于1/6;检验彩票中奖号码的分布是否均匀分布,以检验彩票开奖是否作弊;国家人口老龄化问题是否更严重了;某产品的市场占有份额是否较以前更大;某病的发病率是否较前降低等。

2

16.2.1 案例分析

例16.1 以卡方检验考察2007年4月的性别分布是否均衡。 “分析”——“非参数检验”——“卡方”菜单项

卡方检验

S2. 性别 男 女 总数 观察数 165 135 300 检验统计量 期望数 150.0 150.0 残差 15.0 -15.0 152/150+(-15)2/150=3 卡方 df 渐近显著性 S2. 性别 3.000 1 .083 a显著性P值为0.083,大于0.05,不显著,不能拒绝原假设。尚不能认为CCSS抽样数据的性别分布有差异。 a. 0 个单元 (.0%) 具有小于 5 的期望频率。单元最小期望频率为 150.0。 思考:自由度(df)=1是怎么计算得来的?

16.3 两样本案例:不同收入级别家庭的轿车拥有率比较

例16.2 在CCSS的分析报告中,所有受访家庭会按照家庭年收入被分为低收入家庭和中高收入家庭两类,现希望考察不同收入级别的家庭其轿车拥有率是否相同。

操作说明及结果解释

“分析”——“描述统计”——“交叉表”菜单项 行:家庭收入两级Ts9 列:是否拥有家庭轿车O1 单元显示:行百分比 统计量:卡方 确定

3

交叉表

家庭收入2级* O1. 是否拥有家用轿车 交叉制表 家庭收入2级 Below 48,000 计数 家庭收入2级 中的 % O1. 是否拥有家用轿车 有 32 9.6% 225 34.4% 257 26.0% 没有 303 90.4% 429 65.6% 732 74.0% 合计 335 100.0% 654 100.0% 989 100.0% Over 48,000 计数 家庭收入2级 中的 % 合计 计数 家庭收入2级 中的 % 家庭收入2级* O1. 是否拥有家用轿车 交叉制表 家庭收入2级 Below 48,000 计数 期望的计数 家庭收入2级 中的 % O1. 是否拥有家用轿车 有 32 87.1 9.6% 225 169.9 34.4% 257 257.0 26.0% 没有 303 247.9 90.4% 429 484.1 65.6% 732 732.0 74.0% 合计 335 335.0 100.0% 654 654.0 100.0% 989 989.0 100.0% Over 48,000 计数 期望的计数 家庭收入2级 中的 % 合计 计数 期望的计数 家庭收入2级 中的 %

首先给出的是家庭收入级别和轿车拥有情况的交叉表,可见低收入家庭中只有10%拥有轿车,而中高收入家庭中有34%拥有轿车,样本数据的差异很明显,但该差异是否具有统计学意义尚需进行检验。

4

卡方检验 Pearson 卡方 连续校正 似然比 Fisher 的精确检验 线性和线性组合 有效案例中的 N b值 71.134 69.848 80.146 adf 1 1 1 渐进 Sig. (双侧) 精确 Sig.(双侧) 精确 Sig.(单侧) .000 .000 .000 .000 .000 71.062 989 1 .000 a. 0 单元格(.0%) 的期望计数少于 5。最小期望计数为 87.05。 b. 仅对 2x2 表计算

上表为卡方检验结果表。最下方的脚注内容:在该4格表中,没有单元格(0%)的期望频数小于5,其中期望频数最少的那个单元格的期望频数为87.05。该脚注充分说明,本样本的样本量(及其单元格分布)完全满足Pearson卡方的要求,因此可以放心地阅读最常用的Pearson卡方的检验结果。

对表中呈现的其他几种统计值不做掌握要求。

16.4 两分类变量间关联程度的度量

卡方检验可以从定性的角度告诉用户两个变量是否存在关联,当拒绝H0时,在统计上有把握认为两个变量存在关联。但接下来的问题是,如果变量之间存在相关性,它们之间的关联强度有多大,有没有什么指标可以客观表示其大小?

16.4.1 相对危险度与优势比 在实际应用中,卡方值的大小可以粗略地反映两变量联系的强弱,但是这很难有更贴近实际的解释,只从从它的大小上获得一个关联强弱的印象。但是如果有一个指标能够告诉研究者:男性购买该产品的可能性是女性的3倍,这就非常容易理解。

相对危险度(Relative Risk, RR)和优势比(Odds Ratio, OR,也可翻译成比数比)就可以满足这一要求。它们与其他关联测量参数的最大不同之处在于,RR值和OR值关心的是,行变量某一水平和列变量某一水平相对于基础水平的关联程度,即不同水平间的比较,而上述的关联测量参数关心的则是行变量各水平和列变量各水平的关联程度。

1. 相对危险度

RR值是一个概率的比值,是指实验组人群反应阳性概率与对照组人群反应阳性概率的比值。用公式表示为:RR=Pt/ Pc = a/nt / c/nc

其中,Pt为实验组人群反应阳性概率,Pc为对照组人群反应阳性概率,nt为实验组总人数,a为实验组反应阳性人数,nc为对照组总人数,c为对照组反应阳性人数。RR值用于反映实验因素与反应阳性的关联程度。取值范围从0到无限大。数值为1时,表明实验因素与反应阳性无关联;小于1时,表明实验因素导致反应阳性的发生率降低;大于1时,表明实验因素导致反应阳性的发生率增加。

5

百度搜索“77cn”或“免费范文网”即可找到本站免费阅读全部范文。收藏本站方便下次阅读,免费范文网,提供经典小说综合文库卡方检验在线全文阅读。

卡方检验.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印 下载失败或者文档不完整,请联系客服人员解决!
本文链接:https://www.77cn.com.cn/wenku/zonghe/357334.html(转载请注明文章来源)
Copyright © 2008-2022 免费范文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ: 邮箱:tiandhx2@hotmail.com
苏ICP备16052595号-18
× 注册会员免费下载(下载后可以自由复制和排版)
注册会员下载
全站内容免费自由复制
注册会员下载
全站内容免费自由复制
注:下载文档有可能“只有目录或者内容不全”等情况,请下载之前注意辨别,如果您已付费且无法下载或内容有问题,请联系我们协助你处理。
微信: QQ: