Как понимать результат расчёта нормального распределения
В таблице ниже приведена накопленная вероятность Φ(z) стандартного нормального распределения при целых значениях z-оценки — в соответствии со стандартными статистическими таблицами.
| Z-оценка | Φ(z) — накопленная вероятность ниже z |
|---|---|
| −3 | 0,13 % |
| −2 | 2,28 % |
| −1 | 15,87 % |
| 0 | 50,00 % |
| +1 | 84,13 % |
| +2 | 97,72 % |
| +3 | 99,87 % |
- Правило трёх сигм: около 68,27 % нормального распределения лежит в пределах ±1 стандартного отклонения от среднего, около 95,45 % — в пределах ±2 стандартных отклонений и около 99,73 % — в пределах ±3.
- В режиме «между» верхняя граница b должна быть больше или равна x; если b меньше x, калькулятор не выдаёт результата.
- Так как нормальное распределение непрерывно, вероятность любого отдельно взятого точного значения равна 0 — ненулевую вероятность имеют только интервалы (ниже, выше, между).
- Расчёты исходят из того, что величина действительно распределена нормально. Скошенные, ограниченные или тяжелохвостые данные могут существенно отклоняться от этих вероятностей, даже если z-оценку для них формально вычислить можно.
Что такое нормальное распределение?
Нормальное распределение (распределение Гаусса) — это непрерывное симметричное колоколообразное распределение вероятностей, которое полностью задаётся двумя параметрами: средним (μ), определяющим положение центра, и стандартным отклонением (σ), определяющим разброс. Многие природные и измеряемые величины — рост человека, погрешности измерений, результаты стандартизованных тестов — распределены приблизительно нормально, поэтому это распределение занимает центральное место в статистической теории и практике.
Поскольку непрерывное распределение приписывает вероятность интервалам, а не отдельным точкам, калькулятор отвечает на вопросы вида «какая доля значений лежит ниже x», «выше x» или «между x и b», но не «какова вероятность ровно x»: для непрерывного распределения она всегда равна 0.
Любое нормальное распределение приводится к стандартному нормальному (со средним 0 и стандартным отклонением 1) через вычисление z-оценки: z = (x − μ) / σ. Вероятность для интервала значений x затем берётся из функции распределения стандартной нормальной величины (CDF), которую обычно обозначают Φ(z): она даёт долю распределения, лежащую не выше z.
Правило трёх сигм (его также называют правилом 68-95-99,7) описывает разброс стандартного нормального распределения: около 68,27 % значений лежат в пределах одного стандартного отклонения от среднего, около 95,45 % — в пределах двух, а около 99,73 % — в пределах трёх.
Как пользоваться калькулятором нормального распределения
- Введите среднее (μ) и стандартное отклонение (σ) распределения. Стандартное отклонение должно быть больше нуля.
- Выберите режим расчёта: ниже значения, выше значения или между двумя значениями.
- Введите значение x. В режиме «между» дополнительно укажите верхнюю границу b, которая должна быть больше или равна x.
- Прочитайте вероятность (в процентах и в виде доли от 0 до 1), а также соответствующую значению x z-оценку.
Формула вероятности нормального распределения
Любой расчёт начинается со стандартизации значения x, то есть с перехода к z-оценке: z = (x − μ) / σ. Затем вероятность берётся из функции распределения стандартной нормальной величины Φ(z), которая не выражается через элементарные функции и вычисляется численно.
Режим «ниже»: P(X < x) = Φ(z). Режим «выше»: P(X > x) = 1 − Φ(z). Режим «между»: P(x < X < b) = Φ(zᵦ) − Φ(zₓ), где zᵦ — z-оценка верхней границы b.
Разбор примера (режим «ниже»): среднее = 100, стандартное отклонение = 15, x = 120. z = (120 − 100) / 15 = 1,3333. Значение Φ(1,3333) по таблице стандартного нормального распределения составляет примерно 0,9088, то есть P(X < 120) ≈ 90,88 %.
Разбор примера (режим «между», стандартное нормальное распределение): среднее = 0, стандартное отклонение = 1, интервал от −1 до +1. Нижняя z-оценка = −1, верхняя = +1. Φ(1) − Φ(−1) = 0,8413 − 0,1587 = 0,6827, то есть P(−1 < X < 1) ≈ 68,27 % — первая ступень правила трёх сигм.
Частые ошибки
- Выбор неподходящего режима: «ниже», «выше» и «между» дают разные вероятности для одного и того же x, и их путаница — распространённый источник ошибок.
- Ввод верхней границы b, меньшей чем x, в режиме «между» — такой интервал калькулятором не принимается.
- Попытка придать смысл вероятности одного точного значения: для непрерывного распределения, каким является нормальное, P(X = x) всегда равна 0.
- Предположение о нормальности выборки без проверки — приведённые вероятности верны, только если исходная величина распределена приблизительно нормально.
- Смешение стандартного отклонения и дисперсии: калькулятор запрашивает стандартное отклонение (σ), а не его квадрат.
Часто задаваемые вопросы
Как рассчитать вероятность для нормального распределения?
Переведите значение в z-оценку по формуле z = (x − среднее) / стандартное отклонение, а затем найдите соответствующую накопленную вероятность стандартного нормального распределения. Для значения ниже x берите Φ(z) напрямую; для значения выше x — 1 − Φ(z); для интервала между x и b вычтите одну накопленную вероятность из другой.
Что такое правило трёх сигм?
Правило трёх сигм (правило 68-95-99,7) гласит, что при нормальном распределении около 68,27 % значений попадают в пределы одного стандартного отклонения от среднего, около 95,45 % — в пределы двух и около 99,73 % — в пределы трёх.
Что такое z-оценка?
Z-оценка показывает, на сколько стандартных отклонений значение удалено от среднего, и вычисляется как z = (x − среднее) / стандартное отклонение. Это промежуточный шаг, с помощью которого калькулятор находит вероятность по стандартному нормальному распределению.
Почему вероятность точного значения всегда равна нулю?
Нормальное распределение непрерывно, поэтому вероятность определена только для интервалов, а не для отдельных точек. Величина P(X = 120) строго равна 0; осмысленные вопросы — это P(X < 120), P(X > 120) или P(a < X < b).
Подходит ли этот калькулятор для любых данных?
Только если исходная величина распределена приблизительно нормально. Многие реальные показатели близки к нормальным, но скошенные, ограниченные (например, счётные данные или доли) либо тяжелохвостые данные при таком подходе дадут вводящие в заблуждение вероятности.
Чем режим «ниже» отличается от режима «между»?
«Ниже» возвращает накопленную вероятность вплоть до одного значения x, то есть P(X < x). «Между» возвращает вероятность попадания в интервал, P(x < X < b): это разность двух накопленных вероятностей, и для неё нужны и нижнее значение x, и верхняя граница b.
Источники
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.6.6.1: Normal distribution. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (the normal distribution and standardized values).
- Abramowitz M, Stegun IA (eds). Handbook of Mathematical Functions. National Bureau of Standards, Applied Mathematics Series 55, 1964 (standard normal distribution tables).
- Casella G, Berger RL. Statistical Inference (2nd ed). Duxbury, 2002 (the normal distribution and its properties).