置信区间到底意味着什么
置信区间是根据样本数据计算出的一个数值范围,其构造方法被认为在重复抽样中有指定比例——最常见为95%——的情况下能够涵盖真实的总体参数。95%置信区间并不意味着真实的总体值有95%的概率落在这一个具体计算出的区间之内;真实值要么落在任何一个给定区间之内,要么不在其中,概率所描述的是该方法在反复抽样过程中的长期表现,而不是对一个已经计算出来的固定区间的概率陈述。
Hoekstra及其同事(2014年)发表在《心理学通报与评论》(Psychonomic Bulletin and Review)上的研究记录了这一点:这一区别被广泛误解,即便在研究人员和统计学学生当中也是如此,许多人将95%置信区间直接解读为真实值落在该具体区间内的概率。技术上正确的理解,应是对构造该区间所用方法在众多假设性重复抽样中可靠性的一种陈述,而不是对一个已经观测得到的区间所作的概率陈述。
决定置信区间宽度的因素是什么?
置信区间的宽度主要由三个因素决定:期望的置信水平(常见的有90%、95%或99%)、基础数据的变异程度(通常用标准差衡量,若是比例数据则用p,即估计比例来衡量),以及样本量。提高置信水平会使区间变宽,因为要在重复抽样中更可靠地涵盖真实值,就需要更宽的范围。增加样本量会使区间变窄,因为更大的样本能对总体值提供更精确的估计。
对于比例数据而言,置信区间的误差范围计算公式为z x sqrt[p(1-p)/n],其中z是与期望置信水平相对应的z分数(95%置信水平对应1.96),p是估计比例(若真实比例未知,则使用0.5,因为它会产生最大、最保守的误差范围),n是样本量。由于样本量在该公式中位于平方根之下,要将误差范围缩小一半,大约需要将样本量扩大到四倍,而不是简单地翻倍。
用于估算样本量的Cochran公式
Cochran公式由统计学家William Cochran在《抽样技术》(Sampling Techniques)一书中提出,提供了一种估算调查或研究所需最小样本量的方法,计算公式为n0 = (z^2 x p(1-p)) / e^2,其中z是对应期望置信水平的z分数,p是估计比例(若未知则取0.5),e是以小数表示的期望误差范围。在95%置信水平(z = 1.96)、5%误差范围(e = 0.05)且方差取最大值(p = 0.5)的情况下,该公式得出n0 = (1.96^2 x 0.5 x 0.5) / 0.05^2 = 384.16,向上取整为385名受访者。
当抽样对象来自一个已知的有限总体,而非近似无限的总体时,Cochran公式包含一个有限总体修正项:n = n0 / (1 + (n0 - 1) / N),其中N是总体规模。例如,将该修正应用于一个2,000人的总体,所需样本量会从385减少到大约323,因为总体规模较小时,要达到同样的误差范围,所需的受访者比例会相应减少。
样本量、置信水平与误差范围的实例对照
下表展示了在p = 0.5、针对较大或近似无限总体、使用Cochran公式的情况下,所需样本量随期望置信水平和误差范围变化而变化的情况。更高的置信水平和更小的误差范围都会增加所需的样本量,其中误差范围的影响尤为显著,因为它在公式分母中是以平方形式出现的。
| 置信水平 | 误差范围 | z分数 | 所需样本量(p = 0.5) |
|---|---|---|---|
| 90% | 5% | 1.645 | 271 |
| 95% | 5% | 1.96 | 385 |
| 95% | 3% | 1.96 | 1,068 |
| 99% | 5% | 2.576 | 664 |
对「95%置信度」的常见误读
除了上文所述的核心概率误解之外,在研究报告和公众传播中还经常出现其他几种与置信区间相关的误读。一种常见错误,是把95%置信区间理解为样本中95%的个别数据点都落在该范围之内;而置信区间描述的是对某个总体参数(如均值或比例)的不确定性,而不是个别观测值的离散程度,后者应由标准差或预测区间来描述。
另一种常见错误,是在不考虑效应量或实际意义的情况下,直接假定置信区间越窄,结论就越重要或越可靠;一个非常大的样本可能会围绕一个在统计上很精确、但在实际意义上微不足道的效应产生一个很窄的置信区间。第三种常见错误,是比较两个存在重叠的置信区间,并据此认为二者的真实数值没有显著差异,或者认为两个不重叠的区间就一定能证实存在显著差异;要对两个估计值之间的差异进行正式检验,通常需要专门的统计检验方法,而不能仅凭区间重叠情况的直观比较来判断。
选择样本量的实用指南
研究人员和调查设计者通常会先根据数据将用于支持的决策所需的精确程度,确定目标置信水平和误差范围,然后在数据收集开始之前,使用诸如Cochran公式这样的方法来计算相应的最小样本量。在调查研究和民意测验中,95%置信水平配合5%误差范围是一种常见的默认设定,可以在获得相当精确的估计与保持样本量切实可行之间取得平衡。
当估计比例(p)事先未知时,使用p = 0.5会得出最保守、样本量最大的估算结果,因为p(1-p)在p = 0.5时取得最大值;如果能从既往研究或试点调查中获得更具体的p估计值,并且真实比例预期会远离50%,那么使用该估计值可以减少所需的样本量。美国民意研究协会(American Association for Public Opinion Research)等机构针对研究人员设计新研究时的样本量规划与方法学报告发布了详细指南。
常见问题
95%置信区间到底意味着什么?
95%置信区间意味着,如果反复重复同样的抽样与计算过程,得到的众多区间中大约有95%会包含真实的总体值。它并不意味着真实值有95%的概率落在这一个已经计算出来的具体区间之内。Hoekstra及其同事(2014年)在《心理学通报与评论》上的研究记录了这一点,指出这是一种广泛存在的误解,也是研究和公众传播中对置信区间最常见的误读之一。
要达到95%的置信水平,我需要调查多少人?
使用Cochran公式,在95%置信水平(z = 1.96)、5%误差范围、且方差取最大值(p = 0.5)的情况下,对于一个较大或近似无限的总体,所需样本量约为385名受访者。如果抽样对象来自一个已知的较小总体,有限总体修正会减少这一数字;例如,一个2,000人的总体在同样的置信水平和误差范围下,所需受访者约为323人。
样本量翻倍,误差范围就会减半吗?
不会。由于样本量在误差范围公式z x sqrt[p(1-p)/n]中位于平方根之下,要将误差范围缩小一半,大约需要将样本量扩大到四倍,而不是简单翻倍。这种收益递减的关系意味着,一旦研究已经拥有相当大的样本量,想要进一步小幅提升精度,就需要样本量大幅增加。
Cochran公式有什么用途?
Cochran公式出自William Cochran所著的《抽样技术》,用于估算在估计总体比例时,达到期望置信水平和误差范围所需的最小样本量。其计算公式为n0 = (z^2 x p(1-p)) / e^2,广泛应用于调查研究、市场研究和公共卫生研究,用来确定在数据收集开始之前需要多少名受访者或参与者。
置信区间越窄,是否意味着结果越重要?
不一定。较窄的置信区间表明统计精度更高,这通常是通过更大的样本量实现的,但精度并不等同于实际意义。一项规模非常大的研究,可能围绕一个小到不具备实际意义的效应,得出一个很窄、在统计上很精确的置信区间,而一项规模较小的研究,也可能围绕一个大且具有实际重要性的效应,得出一个较宽的区间。解读置信区间时,既要考虑其宽度,也要考虑其所围绕的估计值本身的大小。
参考文献
- Cochran WG. Sampling Techniques. 3rd ed. Wiley, 1977.
- Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.
- Kalton G. Introduction to Survey Sampling. Sage Publications, 1983.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. 9th ed. W.H. Freeman, 2017.
- American Association for Public Opinion Research. "Best Practices for Survey Research." AAPOR.org.