Comprendre la taille d'échantillon requise
Le tableau ci-dessous donne les tailles d'échantillon requises (population illimitée, p = 0,5) pour les niveaux de confiance et les marges d'erreur les plus courants, d'après la formule de Cochran.
| Niveau de confiance | Marge d'erreur de 5% | Marge d'erreur de 3% |
|---|---|---|
| 90% (z = 1,6449) | 271 | 752 |
| 95% (z = 1,96) | 385 | 1 068 |
| 99% (z = 2,5758) | 664 | 1 843 |
- Ces chiffres supposent un sondage aléatoire simple et la valeur prudente p = 0,5. Si vous disposez d'une estimation préalable fiable de la proportion, l'échantillon requis peut être réduit.
- Le calcul ne traite que l'erreur d'échantillonnage. Le biais de non-réponse, des questions mal formulées ou une base de sondage non représentative ne se corrigent pas en agrandissant l'échantillon.
- Diviser la marge d'erreur par deux quadruple à peu près la taille d'échantillon requise, puisque e intervient au carré dans la formule.
- Pour de très petites populations, la correction pour population finie peut réduire fortement l'effectif nécessaire ; à la limite, l'échantillon rejoint la population entière, soit un recensement.
Qu'est-ce qu'un calcul de taille d'échantillon ?
Un calcul de taille d'échantillon répond à une question précise : combien de personnes (ou d'unités) faut-il mesurer pour qu'une statistique d'échantillon — le plus souvent une proportion, comme la part de clients satisfaits — estime la valeur de population à une marge d'erreur donnée, avec un niveau de confiance donné. Interroger plus de monde que nécessaire gaspille des ressources ; en interroger trop peu produit des estimations trop imprécises pour être exploitables.
La marge d'erreur correspond à la demi-largeur de l'intervalle de confiance autour de l'estimation : une marge de 5% signifie que la vraie proportion de population devrait se situer à moins de 5 points de pourcentage de l'estimation obtenue. Le niveau de confiance, généralement 90%, 95% ou 99%, décrit la fréquence à laquelle des intervalles construits de cette façon captureraient la vraie valeur au fil d'échantillonnages répétés. Relever la confiance ou resserrer la marge exige, dans les deux cas, un échantillon plus grand.
Ce calculateur reprend la formule publiée dans Sampling Techniques de William G. Cochran (3e édition, 1977) avec p = 0,5, valeur de la proportion de population qui maximise la taille d'échantillon requise. Retenir p = 0,5 constitue le choix prudent standard lorsque la vraie proportion est inconnue : l'échantillon obtenu suffira quelle que soit cette proportion. Lorsque la population est finie et connue, la correction pour population finie réduit l'effectif nécessaire, puisque interroger une fraction appréciable d'une petite population apporte davantage d'information par répondant.
Comment utiliser ce calculateur de taille d'échantillon
- Saisissez la taille de la population, c'est-à-dire le nombre total de personnes ou d'unités étudiées. Indiquez 0 si la population est de fait illimitée ou inconnue.
- Choisissez le niveau de confiance : 90%, 95% ou 99%. La recherche par sondage retient le plus souvent 95%.
- Saisissez la marge d'erreur en pourcentage, couramment 5% ou 3%. Une marge plus étroite réclame un échantillon nettement plus important.
- Lisez la taille d'échantillon requise (correction pour population finie appliquée si une population a été renseignée) ainsi que le chiffre non corrigé pour une population illimitée. Prévoyez un recrutement excédentaire afin de compenser la non-réponse attendue.
Formule de Cochran et correction pour population finie
La formule de Cochran pour l'estimation d'une proportion s'écrit n0 = z^2 x p(1 - p) / e^2, où z désigne la valeur critique de la loi normale centrée réduite associée au niveau de confiance (1,6449 pour 90%, 1,96 pour 95%, 2,5758 pour 99%), p la proportion de population supposée, et e la marge d'erreur exprimée en décimale. Avec le choix prudent p = 0,5, le terme p(1 - p) atteint son maximum, soit 0,25.
Exemple détaillé à 95% de confiance et 5% de marge : n0 = (1,96^2 x 0,25) / 0,05^2 = (3,8416 x 0,25) / 0,0025 = 0,9604 / 0,0025 = 384,16, arrondi au supérieur à 385 répondants pour une population illimitée.
Pour une population finie de taille N, la correction s'écrit n = n0 / (1 + (n0 - 1) / N). En prolongeant l'exemple avec N = 10 000 : n = 384,16 / (1 + 383,16 / 10000) = 384,16 / 1,0383 = 369,98, soit 370 répondants après arrondi au supérieur. Une taille d'échantillon s'arrondit toujours vers le haut, puisqu'on ne saurait interroger une fraction de répondant.
Erreurs fréquentes
- Confondre la marge d'erreur et le niveau de confiance : la marge (5%, par exemple) est la demi-largeur de l'intervalle, tandis que le niveau de confiance (95%, par exemple) indique à quelle fréquence de tels intervalles capturent la vraie valeur.
- Croire que l'échantillon requis suit la taille de la population : pour de grandes populations, il ne bouge quasiment pas, raison pour laquelle 385 répondants suffisent à 95%/5% que la population compte 100 000 ou 100 millions de personnes.
- Négliger la non-réponse : la formule donne le nombre de réponses complètes nécessaires, si bien que le recrutement doit le dépasser du taux de non-réponse attendu.
- Attendre d'un échantillon plus grand qu'il corrige un biais : la taille d'échantillon maîtrise l'erreur aléatoire d'échantillonnage, non le biais systématique d'un échantillon non représentatif.
Questions fréquentes
Combien de répondants faut-il pour un niveau de confiance de 95% et une marge d'erreur de 5% ?
Pour une population vaste ou illimitée, 385 répondants. La formule de Cochran donne n0 = (1,96^2 x 0,25) / 0,05^2 = 384,16, arrondi au supérieur à 385. Si la population est plus réduite — disons 10 000 personnes — la correction pour population finie ramène ce chiffre à 370.
Qu'est-ce que la marge d'erreur ?
La marge d'erreur est la demi-largeur de l'intervalle de confiance entourant une estimation d'enquête. Une marge de 5% signifie que la vraie valeur de population devrait se situer à moins de 5 points de pourcentage de l'estimation obtenue, au niveau de confiance annoncé. Des marges plus étroites exigent des échantillons plus grands : diviser la marge par deux quadruple à peu près l'effectif.
Pourquoi le calculateur suppose-t-il p = 0,5 ?
La taille d'échantillon requise dépend de la proportion de population inconnue p à travers le terme p(1 - p), qui atteint son maximum lorsque p = 0,5. Retenir 0,5 relève de la convention prudente issue de Cochran (1977) : l'échantillon obtenu reste suffisant quelle que soit la vraie proportion. Si vous disposez d'une estimation préalable fiable de p, un échantillon plus modeste peut suffire.
Une population plus grande exige-t-elle un échantillon beaucoup plus grand ?
Non, et c'est une idée reçue tenace. La taille d'échantillon non corrigée ne dépend nullement de la taille de la population ; la correction pour population finie ne la réduit que lorsque la population est petite au regard de l'échantillon. À 95% de confiance et 5% de marge, environ 385 répondants suffisent pour toute population vaste, qu'elle compte 100 000 ou 100 millions d'individus.
En quoi consiste la correction pour population finie ?
Lorsque la population N est finie, un tirage sans remise apporte un peu plus d'information par observation, ce qui réduit le nombre de répondants nécessaires. La correction s'écrit n = n0 / (1 + (n0 - 1) / N), où n0 désigne la taille non corrigée. Pour N = 10 000 à 95%/5%, elle fait passer l'exigence de 385 à 370 ; pour un N très grand, la correction devient négligeable.
Ce calcul tient-il compte de la non-réponse ?
Non. La formule donne le nombre de réponses complètes requises. Si vous anticipez par exemple un taux de réponse de 40%, il vous faudra solliciter environ n / 0,4 personnes pour obtenir n questionnaires complets. Notez en outre que la non-réponse peut introduire un biais qu'aucune augmentation d'effectif ne corrige.
Références
- Cochran WG. Sampling Techniques, 3rd edition. Wiley, 1977 (sample size for estimating proportions; finite population correction).
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 7.2.2: Sample sizes required. nist.gov.
- Kish L. Survey Sampling. Wiley, 1965 (design effects and practical survey sampling).