两个公式,一处关键但微小的差异
两种标准差公式的前几步完全相同:先计算数据的均值,用每个数值减去均值,将每个差值平方,再把所有平方值相加。两者的区别出现在最后一步的除法上。总体标准差用希腊字母σ表示,将平方差之和除以n(数据总个数),再开平方根。样本标准差用s表示,将同样的平方和除以n-1,再开平方根——这一改动被称为贝塞尔校正。
由于当n大于1时,n-1总是比n更小的除数,所以用同一组数据计算出的样本标准差总是略大于总体标准差。这两个公式并非针对同一个问题的两种竞争方法,而是分别回答关于同一数据的两个不同问题,选错公式会对你真正想问的那个问题产生系统性偏差的答案。
实例演算:同样八个数字,两个答案
以数据集2、4、4、4、5、5、7、9为例(n=8)。第1步:均值为(2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5。第2步:各数值与均值的差分别为-3、-1、-1、-1、0、0、2、4,平方后得到9、1、1、1、0、0、4、16,求和为32。从这同一个平方差之和出发,两个公式仅在最后一步除法上产生分歧。
总体标准差:将32除以n = 8,得到总体方差为4,4的平方根恰好为2。样本标准差:将同样的32除以n - 1 = 7,得到样本方差为32 / 7 = 4.571429(保留六位小数),4.571429的平方根约为2.13809。下表将两种计算方式并列展示,均从同一个平方和出发。
| 步骤 | 总体形式(除以n) | 样本形式(除以n - 1) |
|---|---|---|
| 平方差之和 | 32 | 32 |
| 除数 | n = 8 | n - 1 = 7 |
| 方差 | 32 / 8 = 4 | 32 / 7 = 4.571429 |
| 标准差 | sqrt(4) = 2 | sqrt(4.571429) = 2.13809 |
为什么要除以n - 1?贝塞尔校正详解
用于计算差值的样本均值本身就是从同一组数据算出的,而且从数学上可以证明,它正是使该样本平方差之和达到最小的那个值。这意味着围绕样本均值测得的平方差,平均而言会比围绕真实但未知的总体均值测得的平方差略小——因此仅仅除以n,会在基于样本估计总体方差时产生系统性的低估。
改为除以n - 1而非n,恰好能将结果放大到足以纠正这种向下的偏差,从而使样本方差在重复抽样中成为总体方差的无偏估计量。这一校正以19世纪天文学家兼数学家弗里德里希·贝塞尔(Friedrich Bessel)的名字命名。它的影响在小样本中最为显著——当n = 8时,除数8和7相差12.5%——并随着n增长到成百上千而趋于可忽略不计,因为n与n - 1会按比例趋近。
你的数据是总体还是样本?
只有当你的数据集就是你所关心的全部对象、且不打算据此推广到更大范围时,才使用总体标准差(除以n)——例如,某支特定运动队全体队员的年龄,或某个特定班级全体学生的考试成绩,前提是研究问题只涉及这支队伍或这个班级本身,而不涉及更广泛的范围。
只要你的数据是从更大总体中抽取的子集、或用来代表某个你想据此得出结论的更大总体,就应使用样本标准差(除以n - 1)——例如,用500名顾客的调查结果来估计所有顾客的满意度,用临床试验的参与者来估计更广泛患者群体中的疗效,或用一批质量控制测量数据来刻画整条生产线的特征。这是应用统计中远更常见的情形,这也是为什么大多数统计软件在未特别指定的情况下默认采用样本(n - 1)公式。
这个选择究竟有多重要?
对于非常小的样本,两个公式之间的差距在比例上较大,选错公式可能会明显扭曲下游结果,包括直接建立在标准差之上的置信区间和z分数。在上文n = 8的例子中,样本值(2.13809)比总体值(2)大约高6.9%,这个差距足以使置信区间的宽度产生类似幅度的变化。
随着样本量增大,n与n - 1在比例上会越来越接近,两种标准差也随之趋同:对于样本量为1000的情形,除以999而非1000,结果只会改变约0.05%。在大样本情形下,这一选择很少会改变实际结论,但正确的惯例仍应被遵循,这既是为了与标准统计实践保持一致,也是因为差异最重要的小样本情形,恰恰是把这件事做对最关键的时候。
常见问题
样本标准差与总体标准差有什么区别?
总体标准差将与均值的平方差之和除以n(数值个数),适用于数据集就是所关心的全部总体的情形。样本标准差则将同样的平方和除以n - 1,适用于数据是用来估计更大总体的样本的情形。对于相同的数据,样本值总是略大于总体值,因为它除以的是一个更小的数。
为什么样本要除以n - 1?
因为样本均值是从用来测量离散程度的同一组数据计算出来的,从数学上讲它正是使该样本平方差之和最小的那个值,这使得这些差值系统性地比围绕真实总体均值测得的差值略小。除以n - 1而非n——这一校正被称为贝塞尔校正——弥补了这一偏差,使样本方差成为总体方差的无偏估计量。
调查或实验应该用哪一个?
只要你的数据是用来代表更大总体的子集——这涵盖了绝大多数调查、实验和质量控制样本——就应使用样本标准差(n - 1)。只有当你的数据集就是你所研究的完整群体、且不打算推广到其他任何范围时,才使用总体标准差(n)。
两个答案在实践中差异有多大?
在上文的实例中(2、4、4、4、5、5、7、9;n = 8),总体标准差恰好为2,样本标准差约为2.13809,相差约6.9%。这一差距会随样本量增大而缩小:对于n = 1000的情形,除以999而非1000,结果只改变约0.05%,这使得样本量大时这一选择的影响要小得多。
n - 1校正是否也会影响均值?
不会。均值始终是数值之和除以个数n,无论数据代表的是样本还是总体,这一点都不受影响;贝塞尔校正只适用于标准差和方差的计算,并不适用于均值本身。
参考文献
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
- Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.