Что такое доверительный интервал
Доверительный интервал -- это диапазон правдоподобных значений для неизвестного параметра генеральной совокупности -- чаще всего среднего или доли генеральной совокупности, -- рассчитанный по выборке данных. Он строится вокруг точечной оценки, такой как выборочное среднее, и расширяется в обе стороны на величину предела погрешности, так что интервал в целом спроектирован так, чтобы охватывать истинное, неизвестное значение генеральной совокупности заданную долю времени, если ту же процедуру выборки и расчёта повторить много раз.
Выбранная доля, называемая уровнем доверия, чаще всего составляет 90%, 95% или 99%. Более широкий интервал даёт больше уверенности в том, что он охватывает истинное значение, но за счёт точности; более узкий интервал точнее, но имеет более низкий уровень доверия либо требует большей выборки для сохранения того же уровня доверия. Этот компромисс между точностью и доверием неизбежен и играет центральную роль в правильной интерпретации любого приведённого интервала.
Распространённая ошибка в трактовке «95%-й доверительности»
Распространённая и хорошо задокументированная ошибка -- трактовать 95%-й доверительный интервал так, будто существует 95%-я вероятность того, что истинное значение генеральной совокупности лежит именно в этом конкретном, уже рассчитанном интервале. Технически такая трактовка неверна: как только конкретный интервал рассчитан по конкретной выборке, истинное значение генеральной совокупности либо лежит в нём, либо нет -- никакой оставшейся случайности, к которой можно было бы привязать вероятность для этого единственного интервала, уже не существует. 95% описывают долгосрочную долю успеха метода, использованного для построения интервала, при множестве гипотетических повторных выборок, а не вероятностное утверждение об одном конкретном уже рассчитанном интервале.
Хукстра (Hoekstra) с коллегами (2014), опубликовав статью в журнале Psychonomic Bulletin and Review, задокументировали, что это различие широко непонимается, в том числе среди исследователей и студентов, изучающих статистику, многие из которых трактовали 95%-й доверительный интервал как напрямую описывающий вероятность того, что истинное значение лежит именно в этом интервале. Технически корректная трактовка касается надёжности метода при повторных выборках, а не вероятностного утверждения об одном уже полученном результате.
Предел погрешности: базовый элемент доверительного интервала
Предел погрешности -- это расстояние, на которое доверительный интервал расширяется в каждую сторону от точечной оценки, и рассчитывается как критическое значение (z -- для интервала на основе нормального распределения), умноженное на стандартную ошибку оценки. Для среднего стандартная ошибка -- это стандартное отклонение, делённое на квадратный корень из размера выборки: стандартная ошибка = стандартное отклонение / sqrt(n). Увеличение выборки уменьшает стандартную ошибку, а вместе с ней предел погрешности и общую ширину интервала, пропорционально квадратному корню из n.
Критическое значение z зависит от выбранного уровня доверия: 1,6449 для 90%-го доверия, 1,96 для 95%-го доверия и 2,5758 для 99%-го доверия, каждое из которых представляет точку стандартного нормального распределения, оставляющую соответствующую суммарную вероятность в двух хвостах. Более высокий уровень доверия требует большего критического значения, что увеличивает предел погрешности и, следовательно, итоговый интервал, при прочих равных условиях.
Разбор примера: построение 95%-го доверительного интервала для среднего
Предположим, что выборка из n = 100 наблюдений имеет среднее 50 и стандартное отклонение 8, и требуется 95%-й доверительный интервал для среднего генеральной совокупности. Шаг 1: рассчитываем стандартную ошибку, 8 / sqrt(100) = 8 / 10 = 0,8. Шаг 2: рассчитываем предел погрешности, используя критическое значение для 95%, 1,96 x 0,8 = 1,568. Шаг 3: прибавляем и вычитаем предел погрешности из выборочного среднего: 50 - 1,568 = 48,432 и 50 + 1,568 = 51,568.
Полученный 95%-й доверительный интервал составляет от 48,432 до 51,568. Правильная трактовка такова: если эту же процедуру выборки и расчёта повторить много раз на новых выборках по 100 наблюдений из той же генеральной совокупности, примерно 95% построенных таким образом интервалов будут содержать истинное среднее генеральной совокупности -- а не то, что существует 95%-я вероятность того, что истинное среднее лежит именно между 48,432 и 51,568 в этом конкретном случае.
Как уровень доверия и размер выборки меняют интервал
При фиксированной выборке (среднее 50, стандартное отклонение 8, n = 100) таблица ниже показывает, как одни и те же исходные данные дают разную ширину интервала в зависимости исключительно от выбранного уровня доверия. Более высокий уровень доверия всегда расширяет интервал, поскольку более надёжный метод (который успешен чаще при повторных выборках) по своей конструкции должен охватывать более широкий диапазон правдоподобных значений.
| Уровень доверия | Критическое значение z | Предел погрешности | Итоговый интервал |
|---|---|---|---|
| 90% | 1,6449 | 1,316 | от 48,684 до 51,316 |
| 95% | 1,96 | 1,568 | от 48,432 до 51,568 |
| 99% | 2,5758 | 2,061 | от 47,939 до 52,061 |
Часто задаваемые вопросы
Что на самом деле означает 95%-й доверительный интервал?
Это означает, что если ту же процедуру выборки и расчёта повторить много раз, примерно 95% полученных интервалов будут содержать истинное значение генеральной совокупности. Это не означает, что существует 95%-я вероятность того, что истинное значение лежит именно в этом конкретном, уже рассчитанном интервале, -- это различие задокументировано как широко распространённое недопонимание Хукстрой (Hoekstra) с коллегами (2014) в журнале Psychonomic Bulletin and Review.
Как рассчитать 95%-й доверительный интервал для среднего?
Нужно рассчитать стандартную ошибку (стандартное отклонение, делённое на квадратный корень из размера выборки), умножить её на критическое значение для 95%, равное 1,96, чтобы получить предел погрешности, а затем прибавить и вычесть этот предел из выборочного среднего. Для выборки со средним 50, стандартным отклонением 8 и n = 100: стандартная ошибка = 0,8, предел погрешности = 1,568, а интервал составляет от 48,432 до 51,568.
Что такое предел погрешности?
Предел погрешности -- это величина, которая прибавляется к точечной оценке (например, к выборочному среднему) и вычитается из неё для построения доверительного интервала. Он рассчитывается как критическое значение (зависящее от выбранного уровня доверия), умноженное на стандартную ошибку оценки. Больший предел погрешности даёт более широкий, менее точный интервал; меньший предел погрешности даёт более узкий, более точный интервал.
Почему неверно говорить, что существует 95%-я вероятность того, что истинное значение находится в этом интервале?
Потому что как только конкретный интервал рассчитан по конкретной выборке, истинное значение генеральной совокупности либо находится внутри него, либо нет -- никакой оставшейся случайности, которой можно было бы приписать вероятность, уже не существует. 95% -- это свойство метода, использованного для построения интервала, описывающее, насколько часто он успешен при множестве гипотетических повторных выборок, а не вероятностное утверждение об одном конкретном уже рассчитанном интервале.
Делает ли больший размер выборки доверительный интервал уже?
Да. Стандартная ошибка, а вместе с ней предел погрешности и общая ширина интервала, рассчитывается делением стандартного отклонения на квадратный корень из размера выборки. Поскольку размер выборки входит под знаком квадратного корня, увеличение выборки в четыре раза уменьшает ширину интервала вдвое, тогда как меньшая выборка даёт пропорционально более широкий, менее точный интервал при том же уровне доверия.
Почему более высокий уровень доверия даёт более широкий интервал?
Более высокий уровень доверия, например 99% вместо 95%, требует большего критического значения (2,5758 против 1,96), что увеличивает предел погрешности и расширяет итоговый интервал. Это отражает неизбежный компромисс: метод, который должен быть успешным чаще при повторных выборках, для этого обязан охватывать более широкий диапазон правдоподобных значений.
Источники
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.1: Confidence intervals. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (confidence intervals for a mean; z vs t procedures).
- Hoekstra R, Morey RD, Rouder JN, Wagenmakers EJ. "Robust misinterpretation of confidence intervals." Psychonomic Bulletin and Review, 2014;21(5):1157-1164.