Как понимать необходимый объём выборки
В таблице ниже приведены необходимые объёмы выборки (неограниченная совокупность, p = 0.5) для распространённых уровней доверия и предельных ошибок, рассчитанные по формуле Кокрана.
| Уровень доверия | Предельная ошибка 5 % | Предельная ошибка 3 % |
|---|---|---|
| 90 % (z = 1.6449) | 271 | 752 |
| 95 % (z = 1.96) | 385 | 1068 |
| 99 % (z = 2.5758) | 664 | 1843 |
- Эти значения предполагают простую случайную выборку и консервативное p = 0.5. Если есть надёжная предварительная оценка доли, необходимая выборка может быть меньше.
- Расчёт учитывает только ошибку выборки. Смещение из-за отказов от участия, неудачные формулировки вопросов и нерепрезентативная основа выборки большим объёмом не исправляются.
- Уменьшение предельной ошибки вдвое примерно вчетверо увеличивает необходимый объём выборки, поскольку e входит в формулу в квадрате.
- Для очень малых совокупностей поправка на конечную совокупность может существенно снизить требуемый объём; в пределе выборка приближается к сплошному обследованию всей совокупности (переписи).
Что такое расчёт объёма выборки?
Расчёт объёма выборки отвечает на вопрос: сколько людей (или объектов) нужно измерить, чтобы выборочная статистика — обычно доля, например доля довольных клиентов — оценивала значение по генеральной совокупности с заявленной предельной ошибкой и заявленным уровнем доверия. Опрашивать больше необходимого — расточительство; опросить меньше — получить слишком неточные и потому бесполезные оценки.
Предельная ошибка — это половина ширины доверительного интервала вокруг оценки: ошибка 5 % означает, что истинная доля в генеральной совокупности, как ожидается, отличается от выборочной оценки не более чем на 5 процентных пунктов. Уровень доверия (обычно 90 %, 95 % или 99 %) показывает, как часто построенные таким способом интервалы накрывают истинное значение при многократном повторении выборки. И более высокий уровень доверия, и меньшая предельная ошибка требуют большей выборки.
Калькулятор использует формулу из книги Уильяма Г. Кокрана «Методы выборочного исследования» (3-е издание, 1977) при p = 0.5 — значении доли, которое максимизирует необходимый объём выборки. Выбор p = 0.5 — стандартное консервативное решение, когда истинная доля неизвестна: полученная выборка будет достаточной при любом её фактическом значении. Если совокупность конечна и её размер известен, поправка на конечную совокупность уменьшает требуемый объём, поскольку при опросе заметной доли небольшой совокупности каждый респондент даёт больше информации.
Как пользоваться калькулятором объёма выборки
- Введите размер генеральной совокупности — общее число людей или объектов, которые вы изучаете. Введите 0, если совокупность практически неограниченна или неизвестна.
- Выберите уровень доверия: 90 %, 95 % или 99 %. В опросных исследованиях чаще всего берут 95 %.
- Введите предельную ошибку в процентах, обычно 5 % или 3 %. Меньшая ошибка требует существенно большей выборки.
- Прочитайте необходимый объём выборки (с поправкой на конечную совокупность, если её размер был указан) и значение без поправки для неограниченной совокупности. Заложите запас на набор респондентов, чтобы компенсировать ожидаемые отказы от участия.
Формула Кокрана и поправка на конечную совокупность
Формула Кокрана для оценки доли: n0 = z^2 x p(1 - p) / e^2, где z — критическое значение стандартного нормального распределения для выбранного уровня доверия (1.6449 для 90 %, 1.96 для 95 %, 2.5758 для 99 %), p — предполагаемая доля в совокупности, а e — предельная ошибка в долях единицы. При консервативном выборе p = 0.5 член p(1 - p) принимает своё максимальное значение 0.25.
Разобранный пример при уровне доверия 95 % и предельной ошибке 5 %: n0 = (1.96^2 x 0.25) / 0.05^2 = (3.8416 x 0.25) / 0.0025 = 0.9604 / 0.0025 = 384.16, что при округлении вверх даёт 385 респондентов для неограниченной совокупности.
Для конечной совокупности размера N поправка имеет вид n = n0 / (1 + (n0 - 1) / N). Продолжая пример при N = 10 000: n = 384.16 / (1 + 383.16 / 10000) = 384.16 / 1.0383 = 369.98, то есть 370 респондентов после округления вверх. Объём выборки всегда округляется вверх, поскольку опросить дробную часть респондента невозможно.
Частые ошибки
- Путать предельную ошибку с уровнем доверия: ошибка (например, 5 %) — это половина ширины интервала, а уровень доверия (например, 95 %) показывает, как часто такие интервалы накрывают истинное значение.
- Считать, что необходимый объём выборки растёт пропорционально размеру совокупности: для больших совокупностей он почти не меняется — именно поэтому 385 респондентов достаточно при 95 %/5 % и для 100 000, и для 100 миллионов человек.
- Не учитывать отказы от участия: формула даёт число завершённых ответов, поэтому набор нужно вести с запасом на ожидаемую долю неответов.
- Ожидать, что большая выборка устранит смещение: объём выборки контролирует случайную ошибку выборки, а не систематическое смещение из-за нерепрезентативности.
Часто задаваемые вопросы
Сколько респондентов нужно при уровне доверия 95 % и предельной ошибке 5 %?
Для большой или неограниченной совокупности — 385 респондентов. Формула Кокрана даёт n0 = (1.96^2 x 0.25) / 0.05^2 = 384.16, что округляется вверх до 385. Если совокупность меньше — скажем, 10 000 человек, — поправка на конечную совокупность снижает это число до 370.
Что такое предельная ошибка?
Предельная ошибка — это половина ширины доверительного интервала вокруг выборочной оценки. Ошибка 5 % означает, что истинное значение по совокупности, как ожидается, отличается от выборочной оценки не более чем на 5 процентных пунктов при заявленном уровне доверия. Меньшая ошибка требует большей выборки: уменьшение ошибки вдвое примерно вчетверо увеличивает объём.
Почему калькулятор принимает p = 0.5?
Необходимый объём выборки зависит от неизвестной доли p через член p(1 - p), который максимален при p = 0.5. Использование 0.5 — стандартное консервативное соглашение из работы Кокрана (1977): полученная выборка окажется достаточно большой при любом фактическом значении доли. Если есть заслуживающая доверия предварительная оценка p, может хватить и меньшей выборки.
Нужна ли для большей совокупности намного большая выборка?
Нет — это распространённое заблуждение. Объём выборки без поправки вообще не зависит от размера совокупности; поправка на конечную совокупность уменьшает выборку только тогда, когда совокупность мала относительно неё. При уровне доверия 95 % и предельной ошибке 5 % примерно 385 респондентов достаточно для любой большой совокупности — и в 100 тысяч, и в 100 миллионов человек.
Что такое поправка на конечную совокупность?
Когда совокупность N конечна, выборка без возвращения даёт немного больше информации на одно наблюдение, поэтому респондентов нужно меньше. Поправка имеет вид n = n0 / (1 + (n0 - 1) / N), где n0 — объём выборки без поправки. При N = 10 000 и параметрах 95 %/5 % она снижает требование с 385 до 370; для очень больших N поправка пренебрежимо мала.
Учитывает ли этот расчёт отказы от участия?
Нет. Формула даёт число завершённых ответов. Если вы ожидаете, например, отклик 40 %, приглашать нужно примерно n / 0.4 человек, чтобы получить n завершённых анкет. Учтите также, что отказы могут вносить смещение, которое не устраняется никаким увеличением выборки.
Источники
- Cochran WG. Sampling Techniques, 3rd edition. Wiley, 1977 (sample size for estimating proportions; finite population correction).
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.2.2: Sample sizes required. nist.gov.
- Kish L. Survey Sampling. Wiley, 1965 (design effects and practical survey sampling).