Две формулы, одно небольшое, но важное различие
Обе формулы стандартного отклонения начинаются одинаково: вычисляется среднее значение данных, из каждого значения вычитается среднее, каждое отклонение возводится в квадрат, а квадраты складываются. Расходятся формулы только на последнем шаге -- делении. Генеральное стандартное отклонение, обозначаемое греческой буквой сигма, делит эту сумму квадратов отклонений на n, общее количество значений, а затем извлекает квадратный корень. Выборочное стандартное отклонение, обозначаемое s, делит ту же сумму на n - 1, а затем также извлекает квадратный корень -- это изменение известно как поправка Бесселя.
Поскольку n - 1 всегда меньше, чем n (при n больше 1), выборочное стандартное отклонение всегда чуть больше генерального стандартного отклонения, рассчитанного по тем же самым числам. Эти две формулы -- не конкурирующие способы ответить на один и тот же вопрос; они отвечают на два разных вопроса об одних и тех же данных, и выбор неверной формулы даёт систематически смещённый ответ на тот вопрос, который на самом деле требовалось решить.
Разбор примера: одни и те же восемь чисел, два ответа
Возьмём набор данных 2, 4, 4, 4, 5, 5, 7, 9 (n = 8). Шаг 1: среднее равно (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5. Шаг 2: отклонения от среднего равны -3, -1, -1, -1, 0, 0, 2, 4, а их квадраты -- 9, 1, 1, 1, 0, 0, 4, 16, что в сумме даёт 32. Начиная с этой единственной суммы квадратов отклонений, обе формулы расходятся только на последнем шаге деления.
Генеральное стандартное отклонение: делим 32 на n = 8, получаем генеральную дисперсию 4, а квадратный корень из 4 равен ровно 2. Выборочное стандартное отклонение: делим те же 32 на n - 1 = 7, получаем выборочную дисперсию 32 / 7 = 4,571429 (округлено до шести знаков), а квадратный корень из 4,571429 составляет примерно 2,13809. В таблице ниже оба расчёта показаны рядом, исходя из одной и той же начальной суммы.
| Шаг | Генеральная форма (деление на n) | Выборочная форма (деление на n - 1) |
|---|---|---|
| Сумма квадратов отклонений | 32 | 32 |
| Делитель | n = 8 | n - 1 = 7 |
| Дисперсия | 32 / 8 = 4 | 32 / 7 = 4,571429 |
| Стандартное отклонение | sqrt(4) = 2 | sqrt(4,571429) = 2,13809 |
Почему делят на n - 1? Поправка Бесселя простыми словами
Выборочное среднее, используемое при расчёте отклонений, само вычисляется по тем же данным, разброс которых измеряется, и математически гарантировано, что именно это значение минимизирует сумму квадратов отклонений для данной конкретной выборки. Это означает, что квадраты отклонений, измеренные вокруг выборочного среднего, в среднем немного меньше, чем квадраты отклонений, которые были бы измерены вокруг истинного, неизвестного генерального среднего, -- поэтому простое деление на n систематически занижает генеральную дисперсию при работе с выборкой.
Деление на n - 1 вместо n увеличивает результат ровно настолько, чтобы в среднем скомпенсировать это смещение вниз, делая выборочную дисперсию несмещённой оценкой генеральной дисперсии при повторных выборках. Поправка названа в честь астронома и математика XIX века Фридриха Бесселя. Её эффект наиболее заметен для малых выборок -- при n = 8 делители 8 и 7 отличаются на 12,5% -- и становится почти незаметным по мере роста n до сотен и тысяч, поскольку n и n - 1 сближаются пропорционально.
У вас генеральная совокупность или выборка?
Используйте генеральное стандартное отклонение (деление на n) только тогда, когда ваш набор данных -- это вся группа, которая вас интересует, без намерения распространять выводы за её пределы -- например, возраст всех игроков конкретной спортивной команды или результаты экзамена всех учеников конкретного класса, когда вопрос касается только этой команды или этого класса и ничего более широкого.
Используйте выборочное стандартное отклонение (деление на n - 1) всякий раз, когда ваши данные -- это подмножество, взятое из более широкой генеральной совокупности или предназначенное её представлять, о которой вы хотите сделать выводы -- например, опрос 500 клиентов, используемый для оценки удовлетворённости всех клиентов, участники клинического испытания, используемые для оценки эффекта в более широкой популяции пациентов, или партия измерений контроля качества, используемая для характеристики всей производственной линии. Это гораздо более распространённая ситуация в прикладной статистике, поэтому большинство статистических программ по умолчанию используют выборочную формулу (n - 1), если не указано иное.
Насколько сильно на самом деле влияет выбор формулы?
Для очень малых выборок разрыв между двумя формулами пропорционально велик, и неверный выбор может заметно исказить последующие расчёты, включая доверительные интервалы и Z-оценки, которые строятся непосредственно на основе стандартного отклонения. В примере с n = 8 выше выборочное значение (2,13809) примерно на 6,9% больше генерального значения (2) -- разрыв, достаточный, чтобы сдвинуть ширину доверительного интервала на сопоставимую величину.
По мере роста размера выборки n и n - 1 пропорционально сближаются, и оба стандартных отклонения сходятся: для выборки из 1000 наблюдений деление на 999 вместо 1000 меняет результат лишь примерно на 0,05%. При больших выборках выбор формулы редко меняет практические выводы, но правильную формулу всё равно следует применять -- и ради соответствия стандартной статистической практике, и потому что именно случаи малых выборок, где разница наиболее ощутима, -- это как раз те случаи, когда правильный выбор особенно важен.
Часто задаваемые вопросы
В чём разница между выборочным и генеральным стандартным отклонением?
Генеральное стандартное отклонение делит сумму квадратов отклонений от среднего на n (количество значений) и верно, когда набор данных представляет собой всю интересующую генеральную совокупность. Выборочное стандартное отклонение делит ту же сумму на n - 1 и верно, когда данные являются выборкой, используемой для оценки более широкой генеральной совокупности. Для одних и тех же данных выборочное значение всегда немного больше генерального, поскольку делится на меньшее число.
Почему для выборки делят на n - 1?
Поскольку выборочное среднее вычисляется по тем же данным, разброс которых измеряется, оно математически является значением, минимизирующим сумму квадратов отклонений для этой выборки, из-за чего эти отклонения систематически немного меньше отклонений вокруг истинного генерального среднего. Деление на n - 1 вместо n -- поправка, известная как поправка Бесселя, -- компенсирует это и делает выборочную дисперсию несмещённой оценкой генеральной дисперсии.
Какую формулу использовать для опроса или эксперимента?
Используйте выборочное стандартное отклонение (n - 1) всякий раз, когда ваши данные -- это подмножество, предназначенное представлять более широкую генеральную совокупность, -- а это подавляющее большинство опросов, экспериментов и выборок контроля качества. Используйте генеральное стандартное отклонение (n) только тогда, когда ваш набор данных -- это полная группа, которую вы изучаете, без намерения распространять выводы на что-либо более широкое.
Насколько сильно два ответа отличаются на практике?
В разобранном примере (2, 4, 4, 4, 5, 5, 7, 9; n = 8) генеральное стандартное отклонение равно ровно 2, а выборочное составляет примерно 2,13809 -- разница около 6,9%. Разрыв сокращается по мере роста размера выборки: при n = 1000 деление на 999 вместо 1000 меняет результат примерно на 0,05%, поэтому для больших выборок выбор формулы гораздо менее значим.
Влияет ли поправка n - 1 также и на среднее значение?
Нет. Среднее значение всегда представляет собой простую сумму значений, делённую на их количество n, независимо от того, являются ли данные выборкой или генеральной совокупностью; поправка Бесселя применяется только к расчёту стандартного отклонения и дисперсии, но не к самому среднему.
Источники
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
- Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.