什么是置信区间
置信区间是根据一组样本数据,为某个未知的总体参数——最常见的是总体均值或总体比例——计算出的一系列合理取值范围。它是围绕一个点估计值(例如样本均值)构建的,并向两个方向各延伸一个误差范围,使得整个区间在设计上能够在同样的抽样和计算过程被反复重复多次时,以某个特定比例捕捉到真实但未知的总体值。
所选定的这个比例被称为置信水平,最常见的是90%、95%或99%。区间越宽,捕捉到真实值的信心就越大,但代价是精确度下降;区间越窄,精确度越高,但置信水平会随之降低,或者需要更大的样本量才能维持同样的置信水平。这种精确度与置信度之间的权衡是不可避免的,也是正确解读任何已发布区间的核心所在。
对“95%置信”的常见误解
把95%置信区间理解为“真实的总体值落在这一具体、已经算出的区间内的概率是95%”,是一种常见且已被充分记录的误解。这种理解在技术上并不正确:一旦从某个具体样本计算出某个具体区间,真实的总体值要么落在其中,要么不落在其中——对于这一个已经确定的区间而言,已经没有剩余的随机性可以附加概率。95%描述的是构建该区间所用方法在许多假设性重复抽样中的长期成功率,而不是事后对某一个区间的概率陈述。
Hoekstra及其同事(2014年)在《心理学公报与评论》(Psychonomic Bulletin and Review)上发表的研究记录了这一区别被广泛误解的现象,包括许多研究人员和统计学学生在内,不少人都把95%置信区间直接理解为真实值落在该具体区间内的概率。技术上正确的理解涉及的是该方法在重复抽样中的可靠性,而不是对某一个已经观测到的结果的概率陈述。
误差范围:置信区间的构建基石
误差范围是置信区间在点估计值两侧延伸的距离,其计算方法是用一个临界值(对于基于正态分布的区间,即z值)乘以该估计值的标准误。对于均值而言,标准误等于标准差除以样本量的平方根:标准误 = 标准差 / sqrt(n)。样本量越大,标准误就越小,进而误差范围和整个区间的宽度也会相应缩小,其缩小幅度与n的平方根成比例。
临界值z取决于所选的置信水平:90%置信对应1.6449,95%置信对应1.96,99%置信对应2.5758,每个数值都代表标准正态分布上使两侧尾部概率之和等于对应比例的那个点。置信水平越高,所需的临界值就越大,这会使误差范围随之扩大,进而使最终区间变宽,其他条件不变。
实例演算:构建均值的95%置信区间
假设一个n = 100的样本,均值为50,标准差为8,需要求出总体均值的95%置信区间。第1步:计算标准误,8 / sqrt(100) = 8 / 10 = 0.8。第2步:用95%的临界值计算误差范围,1.96 x 0.8 = 1.568。第3步:用样本均值加减误差范围:50 - 1.568 = 48.432,50 + 1.568 = 51.568。
由此得到的95%置信区间为48.432到51.568。正确的理解是:如果对来自同一总体的新样本(每次同样n = 100)反复重复同样的抽样和计算过程,用这种方式构建出的区间中大约95%会包含真实的总体均值——而不是说真实均值恰好落在48.432到51.568之间的概率是95%。
置信水平和样本量如何改变区间
在样本固定不变的情况下(均值50,标准差8,n = 100),下表展示了仅因所选置信水平不同,同一组基础数据会产生怎样不同的区间宽度。置信水平越高,区间总是越宽,因为一种在重复抽样中需要更频繁成功的方法,按其构建方式,必然要覆盖更广的合理取值范围。
| 置信水平 | z临界值 | 误差范围 | 所得区间 |
|---|---|---|---|
| 90% | 1.6449 | 1.316 | 48.684到51.316 |
| 95% | 1.96 | 1.568 | 48.432到51.568 |
| 99% | 2.5758 | 2.061 | 47.939到52.061 |
常见问题
95%置信区间到底是什么意思?
它的意思是,如果反复重复同样的抽样和计算过程,由此构建出的区间中大约95%会包含真实的总体值。它并不意味着真实值恰好落在这一具体、已经算出的区间内的概率是95%——Hoekstra及其同事(2014年)在《心理学公报与评论》上记录了这是一种普遍存在的误解。
如何计算均值的95%置信区间?
先计算标准误(标准差除以样本量的平方根),再乘以95%的临界值1.96得到误差范围,然后用样本均值加减这个误差范围。对于均值为50、标准差为8、n = 100的样本:标准误 = 0.8,误差范围 = 1.568,区间为48.432到51.568。
什么是误差范围?
误差范围是加在点估计值(例如样本均值)两侧、用以构建置信区间的数值。它的计算方法是用一个取决于所选置信水平的临界值,乘以该估计值的标准误。误差范围越大,得到的区间越宽、越不精确;误差范围越小,得到的区间越窄、越精确。
为什么说“真实值落在这个区间内的概率是95%”这种说法是错误的?
因为一旦从某个具体样本计算出某个具体区间,真实的总体值要么在其中,要么不在其中——已经没有剩余的随机性可以附加概率。95%是构建该区间所用方法本身的一个属性,描述的是它在许多假设性重复抽样中成功的频率,而不是对已经计算出的某一个区间的概率陈述。
样本量越大,置信区间是否会变窄?
是的。标准误的计算方法是用标准差除以样本量的平方根,因此误差范围和整个区间的宽度也是如此。由于样本量是在平方根之下起作用的,样本量增至四倍会使区间宽度减半,而样本量较小则会在同样的置信水平下,产生比例上更宽、更不精确的区间。
为什么置信水平越高,区间越宽?
更高的置信水平,例如99%而不是95%,需要更大的临界值(2.5758对1.96),这会增大误差范围,从而使所得区间变宽。这反映了一种不可避免的权衡:一种需要在重复抽样中更频繁成功的方法,必须覆盖更广的合理取值范围才能做到这一点。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.1: Confidence intervals. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (confidence intervals for a mean; z vs t procedures).
- Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.