如何解读你的卡方检验结果
下表列出了常见自由度在常规 α = 0.05 显著性水平下的标准卡方临界值。若观测到的 χ² 统计量超过表中数值,表明与期望分布存在具有统计学显著性的偏离。
| 自由度(df) | α = 0.05 时的临界 χ² |
|---|---|
| 1 | 3.841 |
| 2 | 5.991 |
| 3 | 7.815 |
| 4 | 9.488 |
| 5 | 11.070 |
| 6 | 12.592 |
| 8 | 15.507 |
| 10 | 18.307 |
- 一条广泛使用的经验法则(标准统计学教材中都有记载)是:当每个期望计数都至少为 5 时,卡方近似是可靠的;期望计数较小时,精确检验会更合适。
- 本计算器只执行拟合优度检验——即单个分类变量与假设分布的比较——而不是两个分类变量之间的卡方独立性检验,后者采用不同的(按行列计算)期望计数方法。
- 观测列表和期望列表长度必须相同,至少包含 2 个类别,且每个期望计数都必须严格大于零。
- 具有统计学显著性的结果表明各类别与假设比例存在差异;但它本身并不能说明是哪个类别有差异,也不能说明实际差异有多大。
什么是卡方拟合优度检验?
卡方拟合优度检验把一组类别中的观测计数,与假设分布下应有的期望计数进行比较,衡量二者的偏离程度。本计算器只执行拟合优度这一种检验——针对单个分类变量与期望比例进行比较——而不是相关的卡方独立性检验,后者用于检验列联表中两个分类变量之间的关联。
该检验统计量把每个类别中观测值与期望值之差的平方(经过缩放)在所有类别上求和:相对于期望计数而言差异越大,χ² 值就越大,反对假设分布的证据也就越强。
由于 χ² 恒为零或正值,该检验本质上是单向的:只有异常大的 χ² 值(相对于具有相应自由度的卡方分布而言)才被视为拟合不佳的证据——不存在与之对应的“负向”检验方向。
如何使用本卡方检验计算器
- 以分号分隔的形式输入每个类别的观测计数,例如 30; 25; 22; 23。
- 按相同顺序,以分号分隔的形式输入这些类别对应的期望计数,例如 25; 25; 25; 25。
- 确保两个列表长度相同(至少 2 个类别),且每个期望计数都大于零。
- 查看 χ² 统计量、自由度(类别数减 1)和 p 值,并把 p 值与你选定的显著性水平(通常为 α = 0.05)进行比较。
卡方拟合优度检验背后的公式
卡方统计量为 χ² = Σ (Oᵢ − Eᵢ)² / Eᵢ,在全部 k 个类别上求和,其中 Oᵢ 是类别 i 的观测计数,Eᵢ 是类别 i 的期望计数。自由度等于 k − 1,即类别数减 1。
p 值是指:若假设的(期望)分布为真,在具有给定自由度的卡方分布下,观测到至少与所算出的 χ² 统计量一样大的概率。
算例:观测计数 30、25、22、23,对应的期望计数各为 25。χ² = (30−25)²/25 + (25−25)²/25 + (22−25)²/25 + (23−25)²/25 = 1 + 0 + 0.36 + 0.16 = 1.52,df = 4 − 1 = 3。这远低于自由度为 3 时 α = 0.05 对应的临界值 7.815,因此该结果不具有统计学显著性。
常见错误
- 在真正想研究两个分类变量及其关联时,使用了这种拟合优度检验——那种情况需要用带期望计数列联表的卡方独立性检验,而不是单一的观测值—期望值列表。
- 违反期望计数的经验准则:当期望计数较小(通常一个或多个类别低于 5)时,卡方近似会变得不可靠,此时精确检验更合适。
- 输入的观测列表和期望列表长度不同,或两个列表中类别的顺序不一致,导致比较错位。
- 输入了为零的期望计数,会使该类别的 (O − E)² / E 项无定义。
- 把具有统计学显著性的 χ² 当作大或重要差异的证据——显著性只表明该偏差不太可能是偶然造成的,并不代表实际差异很大。
常见问题
卡方拟合优度检验用来做什么?
它用于检验一组类别中的观测计数,是否与假设分布的期望计数相符——例如检验骰子各点数的观测出现频率是否符合预期的均匀分布,或调查问卷的回答比例是否符合假设的比例。
卡方统计量是怎么计算的?
χ² = Σ (观测值 − 期望值)² / 期望值,在所有类别上求和。观测值与期望值之间的差异越大——尤其是相对期望值而言——χ² 值就越大。
拟合优度检验中的自由度是多少?
自由度等于类别数减 1(df = k − 1)。本页算例中有 4 个类别,因此 df = 3。
为什么期望计数需要至少为 5?
只有当期望计数不太小时,卡方检验统计量的分布才能被卡方分布很好地近似。一条常被引用的经验法则要求每个期望计数都至少为 5;低于这个值时,卡方近似给出的 p 值可能不准确,此时精确检验更为可取。
这和卡方独立性检验是一回事吗?
不是。本计算器执行的是拟合优度检验,把一个分类变量的观测计数与假设分布进行比较。独立性检验研究的是两个分类变量之间是否存在关联,使用的是根据行、列合计计算期望计数的列联表——这是不同的计算方法。
参考文献
- Pearson K. On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling. Philosophical Magazine Series 5, 1900; 50(302): 157-175.
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — chi-square goodness-of-fit test. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (chi-square goodness-of-fit test and expected-count guidelines).
- Snedecor GW, Cochran WG. Statistical Methods. Iowa State University Press (chi-square goodness-of-fit test).
- Agresti A. Categorical Data Analysis. Wiley (chi-square goodness-of-fit and independence tests).