CCalculate.Studio
education · 7 min · Последняя проверка: 2026-07-07

Выборочное и генеральное стандартное отклонение: когда какое использовать

TL;DRГенеральное стандартное отклонение делит сумму квадратов отклонений на n, тогда как выборочное стандартное отклонение делит её на n - 1 -- поправка, компенсирующая то, что выборочное среднее занижает разброс вокруг истинного генерального среднего. Для набора данных 2, 4, 4, 4, 5, 5, 7, 9 генеральное стандартное отклонение равно ровно 2, а выборочное стандартное отклонение составляет примерно 2,13809 -- одни и те же числа дают два разных ответа в зависимости от того, что представляют данные. Выборочная форма (n - 1) верна всегда, когда данные являются подмножеством, используемым для оценки более широкой генеральной совокупности, а именно такова ситуация в подавляющем большинстве реальных статистических задач.

Две формулы, одно небольшое, но важное различие

Обе формулы стандартного отклонения начинаются одинаково: вычисляется среднее значение данных, из каждого значения вычитается среднее, каждое отклонение возводится в квадрат, а квадраты складываются. Расходятся формулы только на последнем шаге -- делении. Генеральное стандартное отклонение, обозначаемое греческой буквой сигма, делит эту сумму квадратов отклонений на n, общее количество значений, а затем извлекает квадратный корень. Выборочное стандартное отклонение, обозначаемое s, делит ту же сумму на n - 1, а затем также извлекает квадратный корень -- это изменение известно как поправка Бесселя.

Поскольку n - 1 всегда меньше, чем n (при n больше 1), выборочное стандартное отклонение всегда чуть больше генерального стандартного отклонения, рассчитанного по тем же самым числам. Эти две формулы -- не конкурирующие способы ответить на один и тот же вопрос; они отвечают на два разных вопроса об одних и тех же данных, и выбор неверной формулы даёт систематически смещённый ответ на тот вопрос, который на самом деле требовалось решить.

Разбор примера: одни и те же восемь чисел, два ответа

Возьмём набор данных 2, 4, 4, 4, 5, 5, 7, 9 (n = 8). Шаг 1: среднее равно (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5. Шаг 2: отклонения от среднего равны -3, -1, -1, -1, 0, 0, 2, 4, а их квадраты -- 9, 1, 1, 1, 0, 0, 4, 16, что в сумме даёт 32. Начиная с этой единственной суммы квадратов отклонений, обе формулы расходятся только на последнем шаге деления.

Генеральное стандартное отклонение: делим 32 на n = 8, получаем генеральную дисперсию 4, а квадратный корень из 4 равен ровно 2. Выборочное стандартное отклонение: делим те же 32 на n - 1 = 7, получаем выборочную дисперсию 32 / 7 = 4,571429 (округлено до шести знаков), а квадратный корень из 4,571429 составляет примерно 2,13809. В таблице ниже оба расчёта показаны рядом, исходя из одной и той же начальной суммы.

ШагГенеральная форма (деление на n)Выборочная форма (деление на n - 1)
Сумма квадратов отклонений3232
Делительn = 8n - 1 = 7
Дисперсия32 / 8 = 432 / 7 = 4,571429
Стандартное отклонениеsqrt(4) = 2sqrt(4,571429) = 2,13809

Почему делят на n - 1? Поправка Бесселя простыми словами

Выборочное среднее, используемое при расчёте отклонений, само вычисляется по тем же данным, разброс которых измеряется, и математически гарантировано, что именно это значение минимизирует сумму квадратов отклонений для данной конкретной выборки. Это означает, что квадраты отклонений, измеренные вокруг выборочного среднего, в среднем немного меньше, чем квадраты отклонений, которые были бы измерены вокруг истинного, неизвестного генерального среднего, -- поэтому простое деление на n систематически занижает генеральную дисперсию при работе с выборкой.

Деление на n - 1 вместо n увеличивает результат ровно настолько, чтобы в среднем скомпенсировать это смещение вниз, делая выборочную дисперсию несмещённой оценкой генеральной дисперсии при повторных выборках. Поправка названа в честь астронома и математика XIX века Фридриха Бесселя. Её эффект наиболее заметен для малых выборок -- при n = 8 делители 8 и 7 отличаются на 12,5% -- и становится почти незаметным по мере роста n до сотен и тысяч, поскольку n и n - 1 сближаются пропорционально.

У вас генеральная совокупность или выборка?

Используйте генеральное стандартное отклонение (деление на n) только тогда, когда ваш набор данных -- это вся группа, которая вас интересует, без намерения распространять выводы за её пределы -- например, возраст всех игроков конкретной спортивной команды или результаты экзамена всех учеников конкретного класса, когда вопрос касается только этой команды или этого класса и ничего более широкого.

Используйте выборочное стандартное отклонение (деление на n - 1) всякий раз, когда ваши данные -- это подмножество, взятое из более широкой генеральной совокупности или предназначенное её представлять, о которой вы хотите сделать выводы -- например, опрос 500 клиентов, используемый для оценки удовлетворённости всех клиентов, участники клинического испытания, используемые для оценки эффекта в более широкой популяции пациентов, или партия измерений контроля качества, используемая для характеристики всей производственной линии. Это гораздо более распространённая ситуация в прикладной статистике, поэтому большинство статистических программ по умолчанию используют выборочную формулу (n - 1), если не указано иное.

Насколько сильно на самом деле влияет выбор формулы?

Для очень малых выборок разрыв между двумя формулами пропорционально велик, и неверный выбор может заметно исказить последующие расчёты, включая доверительные интервалы и Z-оценки, которые строятся непосредственно на основе стандартного отклонения. В примере с n = 8 выше выборочное значение (2,13809) примерно на 6,9% больше генерального значения (2) -- разрыв, достаточный, чтобы сдвинуть ширину доверительного интервала на сопоставимую величину.

По мере роста размера выборки n и n - 1 пропорционально сближаются, и оба стандартных отклонения сходятся: для выборки из 1000 наблюдений деление на 999 вместо 1000 меняет результат лишь примерно на 0,05%. При больших выборках выбор формулы редко меняет практические выводы, но правильную формулу всё равно следует применять -- и ради соответствия стандартной статистической практике, и потому что именно случаи малых выборок, где разница наиболее ощутима, -- это как раз те случаи, когда правильный выбор особенно важен.

Часто задаваемые вопросы

В чём разница между выборочным и генеральным стандартным отклонением?

Генеральное стандартное отклонение делит сумму квадратов отклонений от среднего на n (количество значений) и верно, когда набор данных представляет собой всю интересующую генеральную совокупность. Выборочное стандартное отклонение делит ту же сумму на n - 1 и верно, когда данные являются выборкой, используемой для оценки более широкой генеральной совокупности. Для одних и тех же данных выборочное значение всегда немного больше генерального, поскольку делится на меньшее число.

Почему для выборки делят на n - 1?

Поскольку выборочное среднее вычисляется по тем же данным, разброс которых измеряется, оно математически является значением, минимизирующим сумму квадратов отклонений для этой выборки, из-за чего эти отклонения систематически немного меньше отклонений вокруг истинного генерального среднего. Деление на n - 1 вместо n -- поправка, известная как поправка Бесселя, -- компенсирует это и делает выборочную дисперсию несмещённой оценкой генеральной дисперсии.

Какую формулу использовать для опроса или эксперимента?

Используйте выборочное стандартное отклонение (n - 1) всякий раз, когда ваши данные -- это подмножество, предназначенное представлять более широкую генеральную совокупность, -- а это подавляющее большинство опросов, экспериментов и выборок контроля качества. Используйте генеральное стандартное отклонение (n) только тогда, когда ваш набор данных -- это полная группа, которую вы изучаете, без намерения распространять выводы на что-либо более широкое.

Насколько сильно два ответа отличаются на практике?

В разобранном примере (2, 4, 4, 4, 5, 5, 7, 9; n = 8) генеральное стандартное отклонение равно ровно 2, а выборочное составляет примерно 2,13809 -- разница около 6,9%. Разрыв сокращается по мере роста размера выборки: при n = 1000 деление на 999 вместо 1000 меняет результат примерно на 0,05%, поэтому для больших выборок выбор формулы гораздо менее значим.

Влияет ли поправка n - 1 также и на среднее значение?

Нет. Среднее значение всегда представляет собой простую сумму значений, делённую на их количество n, независимо от того, являются ли данные выборкой или генеральной совокупностью; поправка Бесселя применяется только к расчёту стандартного отклонения и дисперсии, но не к самому среднему.

Источники

  1. National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
  2. Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
  3. Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.

Похожие калькуляторы

🧩 Добавьте калькулятор на свой сайт — бесплатно. Widgets →