CCalculate.Studio
education · 7 min · Dernière vérification: 2026-07-07

Écart-type d'échantillon vs de population : lequel utiliser ?

TL;DRL'écart-type de population divise la somme des écarts au carré par n, tandis que l'écart-type d'échantillon divise par n - 1, une correction qui compense le fait que la moyenne d'échantillon sous-estime la dispersion autour de la vraie moyenne de population. Pour le jeu de données 2, 4, 4, 4, 5, 5, 7, 9, l'écart-type de population est exactement 2 et l'écart-type d'échantillon est d'environ 2,13809 — les mêmes nombres, deux réponses différentes selon ce que représentent les données. La forme échantillon (n - 1) est correcte chaque fois que les données sont un sous-ensemble utilisé pour estimer une population plus large, ce qui correspond à la grande majorité des travaux statistiques réels.

Deux formules, une différence petite mais importante

Les deux formules d'écart-type commencent de façon identique : calculer la moyenne des données, la soustraire de chaque valeur, élever chaque écart au carré, puis additionner les carrés. Elles divergent à l'étape finale de division. L'écart-type de population, noté avec la lettre grecque sigma, divise cette somme des écarts au carré par n, le nombre total de valeurs, puis prend la racine carrée. L'écart-type d'échantillon, noté s, divise la même somme par n - 1 à la place, puis prend la racine carrée — un ajustement connu sous le nom de correction de Bessel.

Comme n - 1 est toujours un diviseur plus petit que n (pour n supérieur à 1), l'écart-type d'échantillon est toujours légèrement plus grand que l'écart-type de population calculé à partir des mêmes nombres exacts. Les deux formules ne sont pas des méthodes concurrentes pour la même question ; elles répondent à deux questions différentes sur les mêmes données, et choisir la mauvaise produit une réponse systématiquement biaisée à la question que vous vouliez réellement poser.

Exemple chiffré : les huit mêmes nombres, deux réponses

Prenons le jeu de données 2, 4, 4, 4, 5, 5, 7, 9 (n = 8). Étape 1 : la moyenne est (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5. Étape 2 : les écarts à la moyenne sont -3, -1, -1, -1, 0, 0, 2, 4, et leur mise au carré donne 9, 1, 1, 1, 0, 0, 4, 16, dont la somme est 32. À partir de cette seule somme des écarts au carré, les deux formules ne divergent qu'à la division finale.

Écart-type de population : diviser 32 par n = 8, ce qui donne une variance de population de 4, et la racine carrée de 4 est exactement 2. Écart-type d'échantillon : diviser la même valeur 32 par n - 1 = 7, ce qui donne une variance d'échantillon de 32 / 7 = 4,571429 (arrondi à six décimales), et la racine carrée de 4,571429 est d'environ 2,13809. Le tableau ci-dessous présente les deux calculs côte à côte à partir de la même somme de départ.

ÉtapeForme population (diviser par n)Forme échantillon (diviser par n - 1)
Somme des écarts au carré3232
Diviseurn = 8n - 1 = 7
Variance32 / 8 = 432 / 7 = 4,571429
Écart-type√4 = 2√4,571429 = 2,13809

Pourquoi diviser par n - 1 ? La correction de Bessel expliquée

La moyenne d'échantillon utilisée dans le calcul des écarts est elle-même calculée à partir des mêmes données dont on mesure la dispersion, et elle est mathématiquement garantie d'être la valeur qui minimise la somme des écarts au carré pour cet échantillon précis. Cela signifie que les écarts au carré mesurés autour d'une moyenne d'échantillon sont, en moyenne, légèrement plus petits que les écarts au carré qui seraient mesurés autour de la vraie moyenne de population inconnue — de sorte que diviser par n seul sous-estime systématiquement la variance de population lorsqu'on travaille à partir d'un échantillon.

Diviser par n - 1 plutôt que par n gonfle le résultat juste assez pour corriger ce biais à la baisse en moyenne, rendant la variance d'échantillon un estimateur non biaisé de la variance de population à travers des échantillonnages répétés. Cette correction porte le nom de correction de Bessel, d'après l'astronome et mathématicien du XIXe siècle Friedrich Bessel. Son effet est le plus marqué pour les petits échantillons — pour n = 8, les diviseurs 8 et 7 diffèrent de 12,5 % — et s'atténue jusqu'à devenir négligeable à mesure que n atteint des centaines ou des milliers, car n et n - 1 convergent proportionnellement.

Avez-vous une population ou un échantillon ?

Utilisez l'écart-type de population (diviser par n) uniquement lorsque votre jeu de données constitue l'intégralité du groupe qui vous intéresse, sans intention de généraliser au-delà — par exemple, les âges de tous les joueurs actuellement dans une équipe sportive donnée, ou les notes d'examen de tous les élèves d'une classe donnée, lorsque la question ne porte que sur cette équipe ou cette classe et rien de plus large.

Utilisez l'écart-type d'échantillon (diviser par n - 1) chaque fois que vos données sont un sous-ensemble tiré d'une population plus large, ou destiné à la représenter, sur laquelle vous voulez tirer des conclusions — par exemple, une enquête auprès de 500 clients utilisée pour estimer la satisfaction de l'ensemble de la clientèle, les participants d'un essai clinique utilisés pour estimer un effet dans la population de patients plus large, ou un lot de mesures de contrôle qualité utilisé pour caractériser une chaîne de production entière. C'est la situation de loin la plus courante en statistique appliquée, ce qui explique pourquoi la plupart des logiciels statistiques utilisent par défaut la formule d'échantillon (n - 1) sauf indication contraire.

Quelle est l'importance réelle de ce choix ?

Pour de très petits échantillons, l'écart entre les deux formules est proportionnellement important et un mauvais choix peut significativement fausser les résultats en aval, y compris les intervalles de confiance et les cotes Z construits directement à partir de l'écart-type. Pour l'exemple à n = 8 ci-dessus, la valeur d'échantillon (2,13809) est environ 6,9 % plus grande que la valeur de population (2), un écart suffisant pour modifier la largeur d'un intervalle de confiance d'une marge similaire.

À mesure que la taille de l'échantillon augmente, n et n - 1 se rapprochent proportionnellement, et les deux écarts-types convergent : pour un échantillon de 1 000, diviser par 999 plutôt que par 1 000 ne change le résultat que d'environ 0,05 %. Dans les contextes de grands échantillons, le choix modifie rarement les conclusions pratiques, mais la convention correcte doit néanmoins être appliquée, à la fois par cohérence avec la pratique statistique standard et parce que les cas de petits échantillons — où la différence compte le plus — sont précisément ceux où bien faire les choses importe.

Questions fréquentes

Quelle est la différence entre écart-type d'échantillon et de population ?

L'écart-type de population divise la somme des écarts au carré par rapport à la moyenne par n (le nombre de valeurs) et est correct lorsque le jeu de données constitue l'intégralité de la population d'intérêt. L'écart-type d'échantillon divise la même somme par n - 1 et est correct lorsque les données sont un échantillon utilisé pour estimer une population plus large. Pour des données identiques, la valeur d'échantillon est toujours légèrement plus grande que la valeur de population, car elle divise par un nombre plus petit.

Pourquoi divise-t-on par n - 1 pour un échantillon ?

Parce que la moyenne d'échantillon est calculée à partir des mêmes données utilisées pour mesurer la dispersion, elle est mathématiquement la valeur qui minimise la somme des écarts au carré pour cet échantillon, rendant ces écarts systématiquement un peu plus petits que les écarts autour de la vraie moyenne de population. Diviser par n - 1 plutôt que par n, une correction connue sous le nom de correction de Bessel, compense ce biais et rend la variance d'échantillon un estimateur non biaisé de la variance de population.

Lequel utiliser pour une enquête ou une expérience ?

Utilisez l'écart-type d'échantillon (n - 1) chaque fois que vos données sont un sous-ensemble destiné à représenter une population plus large — ce qui couvre la grande majorité des enquêtes, expériences et échantillons de contrôle qualité. Utilisez l'écart-type de population (n) uniquement lorsque votre jeu de données constitue le groupe complet que vous étudiez, sans intention de généraliser au-delà.

Quelle est l'ampleur de la différence entre les deux réponses en pratique ?

Pour l'exemple chiffré (2, 4, 4, 4, 5, 5, 7, 9 ; n = 8), l'écart-type de population est exactement 2 et l'écart-type d'échantillon est d'environ 2,13809, une différence d'environ 6,9 %. L'écart se réduit à mesure que la taille de l'échantillon augmente : pour n = 1 000, diviser par 999 plutôt que par 1 000 modifie le résultat d'environ 0,05 %, rendant le choix bien moins déterminant pour les grands échantillons.

La correction n - 1 affecte-t-elle aussi la moyenne ?

Non. La moyenne est toujours la simple somme des valeurs divisée par leur nombre, n, que les données représentent un échantillon ou une population ; la correction de Bessel s'applique uniquement aux calculs d'écart-type et de variance, pas à la moyenne elle-même.

Références

  1. National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
  2. Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
  3. Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.

Calculateurs associés

🧩 Ajoutez une calculatrice à votre site — gratuit. Widgets →