표준편차 해석하기
근사적으로 정규분포를 따르는 (종 모양) 데이터의 경우, 경험적 규칙은 평균으로부터 주어진 표준편차 배수 이내에 데이터가 얼마나 들어오는지를 설명합니다.
| 평균 주위의 구간 | 데이터의 대략적인 비율 (정규분포) |
|---|---|
| 표준편차 1배 이내 | 약 68% |
| 표준편차 2배 이내 | 약 95% |
| 표준편차 3배 이내 | 약 99.7% |
- 68-95-99.7 경험적 규칙은 근사적으로 정규분포를 따르는 분포에 적용됩니다. 심하게 치우쳤거나 꼬리가 두꺼운 데이터는 이 백분율에서 크게 벗어날 수 있습니다.
- 데이터가 더 큰 모집단을 추론하기 위한 표본이라면 표본 형태 (n - 1)를 사용하고, 데이터 집합이 관심 대상 모집단 전체인 경우에만 모집단 형태 (n)를 사용하십시오.
- 편차를 제곱하기 때문에 표준편차는 이상치에 민감합니다. 극단값 하나가 표준편차를 크게 부풀릴 수 있습니다.
- 관측값 하나만으로는 산포를 추정할 수 없으므로 이 계산기는 최소 두 개의 값을 요구합니다.
표준편차란 무엇입니까?
표준편차는 데이터 값이 평균으로부터 떨어져 있는 전형적인 거리를 수치화합니다. 표준편차가 작으면 값들이 평균 주위에 촘촘히 모여 있고, 크면 넓게 흩어져 있음을 뜻합니다. 데이터와 같은 단위로 표현되므로 그 제곱인 분산보다 해석하기 쉽습니다.
핵심적인 학습 요점은 표본 형태와 모집단 형태의 구분입니다. 모집단 표준편차 (sigma)는 편차 제곱의 합을 n으로 나누며, 데이터 집합이 관심 대상 모집단 전체일 때에만 올바릅니다. 예를 들어 특정 학급 전체 학생의 시험 점수가 그러합니다. 표본 표준편차 (s)는 대신 n - 1로 나누며, 데이터가 더 큰 모집단의 산포를 추정하는 데 사용되는 표본일 때 올바릅니다.
n - 1로 나누는 것을 베셀 보정 (Bessel's correction)이라고 합니다. 표본평균이 같은 데이터로부터 계산되기 때문에 표본평균 주위의 편차는 참인 (알려지지 않은) 모평균 주위의 편차보다 체계적으로 조금 작습니다. n 대신 n - 1로 나누면 이를 보정하여 표본분산이 모분산의 불편추정량이 됩니다. 이 보정은 작은 표본에서 가장 중요하며, n이 커질수록 무시할 수 있을 정도가 됩니다.
이 표준편차 계산기 사용 방법
- 세미콜론으로 구분하여 최소 두 개의 숫자를 입력합니다. 예: 10; 12; 23; 23; 16; 23; 21; 16.
- 데이터가 더 큰 모집단에서 추출한 표본이라면 표본 표준편차 (s)를 확인합니다. 설문조사, 실험, 품질 검사에서 일반적인 경우입니다.
- 데이터가 관심 대상 모집단 전체라면 모집단 표준편차 (sigma)를 확인합니다.
- 평균, 표본분산, 개수를 이용해 계산을 검증하거나 신뢰구간, z 점수와 같은 후속 분석으로 이어 갑니다.
표준편차 공식
두 형태는 시작이 동일합니다. 평균을 구하고, 각 값에서 평균을 뺀 뒤, 각 편차를 제곱하고, 제곱값을 모두 더합니다. 모집단 형태는 그 합을 n으로 나눈 뒤 제곱근을 취하고, 표본 형태는 n - 1로 나눈 뒤 제곱근을 취합니다.
계산 예시: 값 2, 4, 4, 4, 5, 5, 7, 9. 1단계 — 평균: (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5. 2단계 — 편차 제곱: 9, 1, 1, 1, 0, 0, 4, 16이며 합은 32입니다. 3단계 (모집단) — 32 / 8 = 4, sqrt(4) = 2. 4단계 (표본) — 32 / 7 = 4.571429 (표본분산), sqrt(4.571429) = 2.13809 (반올림).
같은 데이터에 대해 표본 값은 더 작은 수로 나누기 때문에 항상 모집단 값보다 약간 큽니다. 다만 모든 값이 동일한 경우는 예외이며, 이때는 두 값 모두 0입니다. 표본이 커질수록 그 차이는 줄어듭니다.
흔한 실수
- 표본 데이터에 모집단 공식 (n으로 나눔)을 사용하는 것 — 이는 표본이 추출된 모집단의 산포를 체계적으로 과소평가합니다. 표본에는 n - 1로 나누십시오.
- 분산과 표준편차를 혼동하는 것: 분산은 표준편차의 제곱이며 제곱 단위로 표현됩니다.
- 명백히 치우쳤거나 꼬리가 두꺼워 규칙이 성립하지 않는 데이터에 68-95-99.7 규칙을 적용하는 것.
- 서로 다른 단위나 매우 다른 척도로 측정된 데이터 집합의 표준편차를 표준화 없이 비교하는 것 (상대적 산포에는 평균으로 나눈 변동계수를 사용합니다).
자주 묻는 질문
표본 표준편차와 모집단 표준편차의 차이는 무엇입니까?
모집단 표준편차는 편차 제곱의 합을 n으로 나누며 데이터가 모집단 전체일 때 올바릅니다. 표본 표준편차는 n - 1로 나누며 (베셀 보정), 데이터가 더 큰 모집단의 산포를 추정하는 데 쓰이는 표본일 때 올바릅니다. 같은 데이터에 대해 표본 값은 항상 약간 더 큽니다 (모든 값이 동일하면 둘 다 0입니다). 표본 크기가 커질수록 그 차이는 사라집니다.
왜 n이 아니라 n - 1로 나눕니까?
표본평균이 같은 데이터로부터 계산되기 때문에 표본평균 주위에서 관측되는 편차는 참인 모평균 주위의 편차보다 체계적으로 조금 작습니다. n 대신 n - 1로 나누면 이 편향이 보정되어 표본분산이 모분산의 불편추정량이 됩니다. 이 조정을 베셀 보정이라고 합니다.
표준편차를 손으로 계산하려면 어떻게 합니까?
먼저 평균을 구합니다. 그다음 각 값에서 평균을 빼고 각 결과를 제곱한 뒤 제곱값을 모두 더합니다. 표본이라면 이 합을 n - 1로, 모집단이라면 n으로 나눕니다. 마지막으로 제곱근을 취합니다. 예를 들어 2, 4, 4, 4, 5, 5, 7, 9의 평균은 5이고 편차 제곱의 합은 32이며 표본 표준편차는 sqrt(32 / 7) = 2.138 (반올림)입니다.
표준편차가 0이면 무엇을 의미합니까?
데이터 집합의 모든 값이 동일하여 산포가 전혀 없음을 의미합니다. 표준편차가 클수록 값들이 평균으로부터 전형적으로 더 많이 벗어납니다. 표준편차는 결코 음수가 될 수 없습니다.
68-95-99.7 규칙이란 무엇입니까?
근사적으로 정규분포를 따르는 (종 모양) 데이터에서는 약 68%의 값이 평균으로부터 표준편차 1배 이내에, 약 95%가 2배 이내에, 약 99.7%가 3배 이내에 위치합니다. 이 규칙은 어떤 관측값이 이례적인지 빠르게 판단하는 방법이지만, 분포가 대략 정규일 때에만 신뢰할 수 있습니다.
분산과 표준편차는 같은 것입니까?
아닙니다. 분산은 평균으로부터의 편차 제곱의 평균이고, 표준편차는 그 제곱근입니다. 분산은 제곱 단위로 표현되므로 (예: cm 단위 데이터의 경우 cm^2), 산포를 설명할 때는 원래 단위를 갖는 표준편차를 보통 인용합니다.
참고 자료
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.6: Measures of Scale. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (sample vs population standard deviation).
- Weisstein, Eric W. "Standard Deviation" and "Bessel's Correction." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.