Формула Z-оценки: как стандартизировать значение
Z-оценка, также называемая стандартизированным значением, переводит исходное значение в меру того, насколько далеко это значение отстоит от среднего своего распределения, выраженную в единицах стандартного отклонения, а не в исходных единицах измерения. Формула: z = (x - среднее) / стандартное отклонение, где x -- стандартизируемое значение. Z-оценка 0 означает, что значение в точности равно среднему; положительная Z-оценка означает, что значение выше среднего; отрицательная Z-оценка означает, что значение ниже среднего.
Такая стандартизация позволяет сравнивать показатели, полученные по разным шкалам или из разных распределений, -- например, сравнивать результаты студента по двум разным тестам с разными средними и разбросом, или сравнивать отдельный результат лабораторного анализа с референсным диапазоном. Поскольку Z-оценка избавляется как от исходных единиц измерения, так и от исходной шкалы, значение +1 всегда означает одно и то же в относительном смысле (одно стандартное отклонение выше среднего того распределения, из которого оно получено), независимо от того, что именно измеряется.
Что значит «на два стандартных отклонения выше среднего»?
Сказать, что значение находится на два стандартных отклонения выше среднего, -- это просто другой способ сказать, что его Z-оценка равна +2: значение отстоит от среднего дальше, чем типичное наблюдение, на величину, равную удвоенному стандартному отклонению распределения. Поскольку стандартное отклонение измеряет типичный разброс данных, Z-оценка 2 и выше (или -2 и ниже) традиционно считается необычной, поскольку в приблизительно нормальном распределении относительно немного наблюдений оказываются так далеко от центра.
Эта формулировка лишь описывает положение внутри распределения -- сама по себе она не говорит, хорошо это, плохо или нейтрально -- находиться на два стандартных отклонения выше среднего. Z-оценка +2 в распределении баллов теста обычно указывает на сильный результат, тогда как Z-оценка +2 в распределении показателей артериального давления обычно указывает на значение существенно выше типичного, заслуживающее клинического внимания. Z-оценка сообщает расстояние от среднего; то, что означает это расстояние, всегда зависит от того, что именно измеряется.
Стандартное нормальное распределение и процентили
Когда исходные данные приблизительно нормальны (имеют форму колокола), Z-оценку можно перевести в процентиль с помощью стандартной нормальной функции распределения, которая показывает долю распределения, лежащую ниже данной Z-оценки. Именно этот перевод позволяет переформулировать Z-оценку как «это значение выше примерно X% распределения». В таблице ниже приведены стандартные, хорошо известные процентили для целых Z-оценок от -2 до +3.
| Z-оценка | Процентиль (доля распределения ниже) | Доля выше |
|---|---|---|
| -2 | 2,28% | 97,72% |
| -1 | 15,87% | 84,13% |
| 0 | 50,00% | 50,00% |
| +1 | 84,13% | 15,87% |
| +2 | 97,72% | 2,28% |
| +3 | 99,87% | 0,13% |
Разбор примера: перевод исходного значения в процентиль
Рассмотрим значение x = 130 из распределения со средним 100 и стандартным отклонением 15 (классическая шкала, используемая для показателей IQ). Шаг 1: вычисляем Z-оценку, z = (130 - 100) / 15 = 30 / 15 = 2. Шаг 2: находим z = 2 в стандартном нормальном распределении, что соответствует 97,72-му процентилю, то есть примерно 97,72% распределения находится на уровне 130 или ниже, а примерно 2,28% -- выше него.
Второй пример по той же шкале: значение x = 85 даёт z = (85 - 100) / 15 = -15 / 15 = -1, что соответствует 15,87-му процентилю -- то есть это значение лежит ниже примерно 84,13% распределения и выше примерно 15,87% его. В обоих случаях весь расчёт сводится к двум шагам: стандартизировать значение в Z-оценку, а затем найти соответствующий процентиль по стандартному нормальному распределению.
Эмпирическое правило 68-95-99,7
Для приблизительно нормальных данных эмпирическое правило (иногда называемое правилом 68-95-99,7) даёт быстрый способ оценить, насколько необычна Z-оценка, без полного поиска процентиля: около 68% значений попадает в пределах одного стандартного отклонения от среднего (z от -1 до +1), около 95% -- в пределах двух стандартных отклонений (z от -2 до +2), а около 99,7% -- в пределах трёх стандартных отклонений (z от -3 до +3).
Это правило напрямую следует из приведённой выше таблицы процентилей: доля между z = -1 и z = +1 составляет 84,13% - 15,87% = 68,26%, доля между z = -2 и z = +2 составляет 97,72% - 2,28% = 95,44%, а доля между z = -3 и z = +3 составляет 99,87% - 0,13% = 99,74% -- всё это согласуется с часто приводимыми приближениями 68%, 95% и 99,7%. Правило применимо только тогда, когда исходное распределение приблизительно нормально; скошенные или тяжелохвостые данные могут существенно отклоняться от этих долей, хотя Z-оценки для них по-прежнему можно рассчитать.
Часто задаваемые вопросы
Как рассчитать Z-оценку?
Нужно вычесть среднее из значения, а затем разделить на стандартное отклонение: z = (x - mean) / sd. Например, значение 130 по шкале со средним 100 и стандартным отклонением 15 даёт z = (130 - 100) / 15 = 2, то есть значение находится на два стандартных отклонения выше среднего.
Какому процентилю соответствует Z-оценка 2?
Примерно 97,72-му процентилю. Стандартное нормальное распределение помещает около 97,72% значений на уровне Z-оценки 2 или ниже, то есть значение с такой Z-оценкой выше примерно 97,72% распределения и ниже примерно 2,28% его, при условии, что исходные данные приблизительно нормальны.
Что значит находиться на два стандартных отклонения выше среднего?
Это означает, что Z-оценка значения равна +2: оно превышает среднее сильнее, чем типичное наблюдение, на величину, равную удвоенному стандартному отклонению распределения. Для приблизительно нормальных данных примерно 97,72% распределения находится на этом уровне или ниже, что делает такой результат относительно редким -- хотя желателен он или нет, полностью зависит от того, что именно измеряется.
Обязательно ли данные должны быть нормально распределены для расчёта Z-оценок?
Сам расчёт Z-оценки, z = (x - mean) / sd, определён для любого распределения и не требует нормальности. Однако перевод Z-оценки в процентиль с помощью стандартного нормального распределения -- как в примерах выше -- точен только тогда, когда исходные данные приблизительно нормальны (имеют форму колокола); для скошенных или тяжелохвостых данных процентили следует определять непосредственно по самим данным.
Что такое правило 68-95-99,7?
Это краткое правило о том, какая доля приблизительно нормального распределения попадает в пределах одного, двух и трёх стандартных отклонений от среднего: около 68% -- в пределах одного стандартного отклонения (z от -1 до +1), около 95% -- в пределах двух (z от -2 до +2), и около 99,7% -- в пределах трёх (z от -3 до +3). Оно даёт быстрый способ оценить, насколько необычно значение, без полного поиска процентиля.
Источники
- Abramowitz M, Stegun IA (eds). Handbook of Mathematical Functions. National Bureau of Standards, Applied Mathematics Series 55, 1964 (normal CDF approximation 26.2.17).
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.6.6.1: Normal distribution. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (standardized values and the normal distribution).