如何理解你的置信区间
区间的宽度反映了估计的精确程度。下表展示了示例(均值 50、标准差 8、n = 100)的区间如何随置信水平变化。
| 置信水平 | z 值 | 误差范围 | 区间 |
|---|---|---|---|
| 90% | 1.6449 | 1.316 | 48.684 - 51.316 |
| 95% | 1.96 | 1.568 | 48.432 - 51.568 |
| 99% | 2.5758 | 2.061 | 47.939 - 52.061 |
- 置信水平越高,区间就越宽:确定性是以精确度为代价换来的。
- 这是一个基于 z 分布的区间。对于标准差是由数据估计得到的小样本(n 大致小于 30),学生 t 分布会给出更准确、也略宽的区间。
- 该区间假设样本是简单随机样本;对于小样本,还假设底层数据近似服从正态分布。有偏抽样会使区间失效,无论其宽度如何。
- 样本量变为原来的四倍,区间宽度会减半,因为标准误与 1 / √n 成比例。
什么是置信区间?
置信区间是根据样本数据计算出的一个范围,其设计目的是以给定的长期成功率包含真实的总体参数——这里指的是总体均值。95% 置信水平意味着,如果同样的抽样过程重复多次,用这种方法构造出的区间大约有 95% 会包含真实均值。
该区间以样本均值为中心,向两侧各扩展一个误差范围。误差范围等于临界值(z)乘以均值的标准误,而标准误等于标准差除以样本量的平方根。样本量越大,标准误——进而区间宽度——就会按 n 的平方根成比例缩小:样本量变为原来的四倍,区间宽度就会减半。
对 95% 区间的正确理解是针对方法本身的陈述,而不是针对某一个具体区间:严格来说,不能说「真实均值落在这个特定区间内的概率是 95%」——真实均值是一个固定值,每一个算出来的区间要么包含它,要么不包含它。95% 指的是这种方法在重复抽样中成功的频率。
如何使用这个置信区间计算器
- 输入样本均值——你测得数值的平均数。
- 输入标准差。使用从你的数据算出的样本标准差(n − 1 形式),如果总体标准差已知,也可以使用该值。
- 输入样本量 n(至少为 2),并选择置信水平:90%、95% 或 99%。
- 查看区间、误差范围和标准误。需要注意的是,对于总体标准差未知的小样本(通常 n 小于 30),基于 t 分布的区间会略宽一些,也更加准确。
置信区间公式
均值的 z 置信区间是:样本均值加减 z 乘以(标准差 / √n)。z 临界值分别是:90% 对应 1.6449,95% 对应 1.96,99% 对应 2.5758——这些是标准正态分布中使两侧尾部概率之和等于对应值的点。
演示:均值 50,标准差 8,n = 100,95% 置信水平。第一步——标准误:8 / √100 = 8 / 10 = 0.8。第二步——误差范围:1.96 × 0.8 = 1.568。第三步——区间:50 − 1.568 = 48.432,50 + 1.568 = 51.568,因此 95% 置信区间是 48.432 到 51.568。
本计算器使用标准正态(z)分布,适用于总体标准差已知或样本量足够大的情形。当样本较小(通常 n 小于 30)且总体标准差是从样本估计出来的时,自由度为 n − 1 的学生 t 分布会给出略宽、也更准确的区间;随着 n 增大,这种差异会逐渐消失。
常见错误
- 把 95% 区间解读为「95% 的数据落在这个范围内」——该区间描述的是对均值的不确定性,而不是单个观测值的离散程度。
- 声称「真实均值落在这个具体区间内的概率是 95%」;95% 描述的是这种方法在重复抽样中成功的长期比例。
- 对标准差是估计值的小样本使用 z 区间,而这种情形应该选用 t 分布。
- 把标准误当作标准差输入——计算器本身已经会除以 √n。
常见问题
怎样计算 95% 置信区间?
先算出标准误(标准差除以样本量的平方根),乘以 1.96 得到误差范围,再用样本均值加减这个误差范围。例如:均值 50,标准差 8,n = 100,得到标准误 0.8,误差范围 1.568,区间是 48.432 到 51.568。
95% 置信水平到底是什么意思?
它描述的是这种方法的长期表现:如果你反复抽取相同大小的样本,并对每个样本都构造一个区间,大约 95% 的这些区间会包含真实的总体均值。任何单个区间要么包含真实均值,要么不包含——95% 是这种方法本身的性质,而不是某一个区间的性质。
什么时候应该用 t 分布而不是 z 分布?
当样本较小(常见经验法则是 n 小于 30)且总体标准差未知、是由样本估计得到时,应使用学生 t 分布。t 分布的尾部更厚,能给出略宽的区间,正确地体现出额外的不确定性;样本量增大后,t 区间和 z 区间在实际上会趋于一致。
怎样才能让置信区间变窄?
有三种方法:增大样本量(宽度按 1 / √n 成比例缩小,因此 n 变为四倍,宽度就会减半);接受较低的置信水平(90% 区间比 99% 区间窄);或者降低测量的变异性,使标准差本身变小。
标准误和标准差有什么区别?
标准差衡量的是各个观测值围绕均值的离散程度。标准误衡量的是样本均值本身的不确定性,等于标准差除以 √n。随着样本量增大,标准差会稳定在其总体值附近,而标准误则会不断向零缩小。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.1: Confidence intervals. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (confidence intervals for a mean; z vs t procedures).
- Student (Gosset WS). The probable error of a mean. Biometrika 1908; 6(1): 1-25 (origin of the t-distribution).