Как понимать результат t-критерия
Калькулятор использует общепринятый двусторонний порог значимости α = 0,05 — наиболее распространённое значение по умолчанию в научных исследованиях.
| Двусторонний p-уровень | Вывод при α = 0,05 |
|---|---|
| p < 0.05 | Статистически значимо — нулевая гипотеза об отсутствии различия отвергается |
| p ≥ 0.05 | Статистически незначимо — оснований отвергнуть нулевую гипотезу нет |
- Статистическая значимость и практическая важность — не одно и то же: при достаточно большом объёме выборки даже мизерная, практически бессмысленная разность может дать p-уровень ниже 0,05.
- Для двух выборок здесь используется t-критерий Уэлча, не предполагающий равенства дисперсий в группах; результаты могут слегка отличаться от инструментов, применяющих классический критерий Стьюдента с объединённой дисперсией.
- T-критерий предполагает, что наблюдения независимы, а выборочное распределение среднего приблизительно нормально — это выполняется либо при примерно нормальных исходных данных, либо при достаточно большом объёме выборки в силу центральной предельной теоремы.
- Это калькулятор по сводным статистикам: он принимает уже рассчитанные вами среднее, стандартное отклонение и объём выборки, а не список исходных наблюдений.
Что такое t-критерий?
T-критерий — это статистическая проверка гипотезы, позволяющая понять, превышает ли наблюдаемая разность средних тот разброс, который можно объяснить одной лишь случайностью выборки. Калькулятор поддерживает две его формы: одновыборочный t-критерий, сравнивающий среднее выборки с фиксированным гипотетическим значением, и двухвыборочный t-критерий, сравнивающий средние двух независимых выборок.
Для случая двух выборок здесь применяется t-критерий Уэлча, который не предполагает равенства дисперсий в группах. Он оценивает скорректированное (и часто нецелое) число степеней свободы по формуле Уэлча — Саттертуэйта, что обычно даёт более надёжный результат, чем классический критерий Стьюдента с объединённой дисперсией, когда стандартные отклонения выборок различаются.
Обе формы выдают двусторонний p-уровень: он оценивает свидетельства в пользу различия в любую сторону — как в большую, так и в меньшую, — и сопоставляется с общепринятым порогом значимости α = 0,05. Значения p ниже 0,05 обычно называют статистически значимыми, а значения 0,05 и выше — нет.
Как пользоваться калькулятором t-критерия
- Выберите тип критерия: одновыборочный (сравнение среднего выборки с фиксированным значением) или двухвыборочный (сравнение средних двух независимых выборок).
- Для одновыборочного критерия введите среднее, стандартное отклонение и объём выборки, а также гипотетическое среднее генеральной совокупности (μ₀), с которым идёт сравнение.
- Для двухвыборочного критерия введите среднее, стандартное отклонение и объём каждой из двух выборок.
- Прочитайте t-статистику, число степеней свободы и двусторонний p-уровень, после чего сравните p-уровень с выбранным уровнем значимости (обычно α = 0,05).
Формула t-критерия
Одновыборочная t-статистика: t = (x̄ − μ₀) / (s / √n) при числе степеней свободы df = n − 1, где x̄ — среднее выборки, s — выборочное стандартное отклонение, μ₀ — гипотетическое среднее генеральной совокупности.
Двухвыборочная t-статистика Уэлча: t = (x̄₁ − x̄₂) / √(s₁² / n₁ + s₂² / n₂). Число степеней свободы оценивается по формуле Уэлча — Саттертуэйта: df = (s₁²/n₁ + s₂²/n₂)² / [ (s₁²/n₁)² / (n₁ − 1) + (s₂²/n₂)² / (n₂ − 1) ], которая не требует равенства дисперсий генеральных совокупностей.
Двусторонний p-уровень равен p = 2 × (1 − T(|t|, df)), где T — функция распределения Стьюдента с рассчитанным числом степеней свободы.
Разбор примера (одна выборка): среднее = 52,1, стандартное отклонение = 4,5, n = 30, гипотетическое среднее μ₀ = 50. t = (52,1 − 50) / (4,5 / √30) ≈ 2,556, df = 29, двусторонний p-уровень меньше 0,05, поэтому разность статистически значима на 5-процентном уровне.
Частые ошибки
- Приравнивание статистической значимости к практической важности: очень маленький p-уровень говорит лишь о том, что разность вряд ли случайна, но не о том, что она велика или практически значима.
- Предположение, будто калькулятор объединяет дисперсии двух выборок: он применяет критерий Уэлча, допускающий разные дисперсии, поэтому его степени свободы и p-уровень могут отличаться от расчёта с объединённой дисперсией.
- Сравнение двустороннего p-уровня с односторонним правилом принятия решения: это фактически вдвое снижает задуманный порог значимости и завышает видимую значимость.
- Применение критерия для независимых выборок к парным данным или повторным измерениям (например, «до и после» на одних и тех же испытуемых), где нужен парный t-критерий.
- Многократное применение t-критерия к одним и тем же данным без поправки порога значимости: это поднимает вероятность хотя бы одного ложноположительного результата заметно выше 5 %.
Часто задаваемые вопросы
Чем одновыборочный t-критерий отличается от двухвыборочного?
Одновыборочный t-критерий сравнивает среднее одной выборки с фиксированным гипотетическим значением (μ₀). Двухвыборочный t-критерий сравнивает средние двух независимых выборок между собой и проверяет, больше ли их разность, чем можно ожидать от одной лишь случайной изменчивости.
Почему калькулятор использует критерий Уэлча, а не критерий Стьюдента?
Критерий Уэлча не предполагает равенства дисперсий двух выборок, поэтому он устойчивее, когда выборочные стандартные отклонения различаются, — а на практике это встречается часто. Он вычисляет скорректированное, нередко нецелое число степеней свободы по формуле Уэлча — Саттертуэйта вместо простого n₁ + n₂ − 2 из классического критерия с объединённой дисперсией.
Что означает p-уровень ниже 0,05?
Это значит, что при верной нулевой гипотезе об отсутствии реального различия разность такого или большего размера возникала бы из-за случайной изменчивости менее чем в 5 % случаев. По общепринятому порогу α = 0,05 такой результат называют статистически значимым, хотя он ничего не говорит о величине или практической важности различия.
Значит ли статистическая значимость практическую важность?
Нет. Статистически значимый результат (p < 0,05) указывает лишь на то, что наблюдаемая разность вряд ли объясняется случайностью. При достаточно большом объёме выборки даже совсем небольшая, практически несущественная разность окажется статистически значимой, поэтому наряду с p-уровнем всегда следует приводить и учитывать размер эффекта.
Почему число степеней свободы в двухвыборочном критерии не целое?
Критерий Уэлча рассчитывает степени свободы по формуле Уэлча — Саттертуэйта, которая объединяет дисперсии и объёмы двух выборок так, что результат, как правило, получается нецелым. Именно эта поправка позволяет критерию оставаться точным при неравных дисперсиях в группах.
Какие объёмы выборок нужны для этого t-критерия?
В каждой выборке должно быть не менее 2 наблюдений, иначе стандартное отклонение и число степеней свободы не определены. На практике критерий работает лучше всего при примерно нормальных данных либо — благодаря центральной предельной теореме — при достаточно большом объёме выборки (в качестве грубого ориентира обычно называют n от 30 в группе), даже если исходные данные несколько отклоняются от нормальности.
Источники
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — two-sample t-test for equal means. nist.gov.
- Welch BL. The generalization of 'Student's' problem when several different population variances are involved. Biometrika 1947; 34(1-2): 28-35.
- Satterthwaite FE. An approximate distribution of estimates of variance components. Biometrics Bulletin 1946; 2(6): 110-114.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (one- and two-sample t procedures).
- Student (Gosset WS). The probable error of a mean. Biometrika 1908; 6(1): 1-25 (origin of the t-distribution).