정규분포 결과 이해하기
아래 표는 정수 z 점수에서의 표준정규 누적확률 Φ(z)를 표준정규분포표와 일치하는 값으로 정리한 것입니다.
| Z 점수 | Φ(z) — z 이하의 누적확률 |
|---|---|
| −3 | 0.13% |
| −2 | 2.28% |
| −1 | 15.87% |
| 0 | 50.00% |
| +1 | 84.13% |
| +2 | 97.72% |
| +3 | 99.87% |
- 경험적 규칙: 정규분포의 약 68.27%가 평균에서 ±1 표준편차 이내에, 약 95.45%가 ±2 표준편차 이내에, 약 99.73%가 ±3 표준편차 이내에 놓입니다.
- "두 값 사이" 방식에서 상한 b는 x보다 크거나 같아야 합니다. b가 x보다 작으면 계산기는 결과를 반환하지 않습니다.
- 정규분포는 연속분포이므로 하나의 정확한 값이 나올 확률은 0입니다. 구간(작을, 클, 사이)만 0이 아닌 확률을 가집니다.
- 이 계산은 변수가 실제로 정규분포를 따른다는 전제 위에 있습니다. 치우쳤거나 범위가 제한되었거나 꼬리가 두꺼운 데이터는 z 점수를 계산할 수는 있어도 이 확률에서 상당히 벗어날 수 있습니다.
정규분포란 무엇인가요?
정규분포(가우스 분포)는 연속적이고 좌우 대칭인 종 모양의 확률분포로, 두 개의 모수만으로 완전히 결정됩니다. 중심을 정하는 평균(μ)과 퍼짐 정도를 정하는 표준편차(σ)입니다. 키, 측정 오차, 표준화 시험 점수 등 자연적으로 나타나거나 측정되는 많은 양이 근사적으로 정규분포를 따르며, 그래서 이 분포는 통계 이론과 실무의 중심에 있습니다.
연속분포는 하나의 점이 아니라 구간에 확률을 부여하므로, 이 계산기는 '값의 몇 퍼센트가 x보다 작은가', 'x보다 큰가', 'x와 b 사이에 있는가' 형태의 질문에 답합니다. '정확히 x일 확률은 얼마인가'라는 질문에는 답하지 않으며, 연속분포에서 그 값은 언제나 0입니다.
모든 정규분포는 z 점수 z = (x − μ) / σ를 계산해 표준정규분포(평균 0, 표준편차 1)로 변환할 수 있습니다. 그러면 x 값 구간에 대응하는 확률을 표준정규 누적분포함수(CDF)에서 읽을 수 있으며, 이 함수는 흔히 Φ(z)로 표기하고 z 이하에 놓인 분포의 비율을 나타냅니다.
경험적 규칙(68-95-99.7 규칙)은 표준정규분포의 퍼짐을 요약합니다. 값의 약 68.27%가 평균에서 표준편차 1 이내에, 약 95.45%가 표준편차 2 이내에, 약 99.73%가 표준편차 3 이내에 놓입니다.
이 정규분포 계산기 사용법
- 분포의 평균(μ)과 표준편차(σ)를 입력합니다. 표준편차는 0보다 커야 합니다.
- 계산 방식을 선택합니다. 특정 값보다 작을 확률, 클 확률, 또는 두 값 사이에 있을 확률입니다.
- 값 x를 입력합니다. "두 값 사이" 방식에서는 상한 b도 입력해야 하며, b는 x보다 크거나 같아야 합니다.
- 확률(백분율과 0에서 1 사이의 비율)과 x에 대응하는 z 점수를 확인합니다.
정규분포 확률 계산 공식
모든 계산은 x를 z 점수로 표준화하는 것으로 시작합니다. z = (x − μ) / σ입니다. 그런 다음 표준정규 CDF인 Φ(z)에서 확률을 읽습니다. 이 함수는 간단한 닫힌 형태의 식이 없어 수치적으로 계산합니다.
작을 확률 방식: P(X < x) = Φ(z). 클 확률 방식: P(X > x) = 1 − Φ(z). 두 값 사이 방식: P(x < X < b) = Φ(zᵦ) − Φ(zₓ)이며, 여기서 zᵦ는 상한 b의 z 점수입니다.
계산 예시(작을 확률 방식): 평균 = 100, 표준편차 = 15, x = 120. z = (120 − 100) / 15 = 1.3333입니다. 표준정규분포에서 Φ(1.3333)을 찾으면 약 0.9088이므로 P(X < 120) ≈ 90.88%입니다.
계산 예시(두 값 사이 방식, 표준정규): 평균 = 0, 표준편차 = 1, −1과 +1 사이입니다. 하한 z = −1, 상한 z = +1이므로 Φ(1) − Φ(−1) = 0.8413 − 0.1587 = 0.6827, 즉 P(−1 < X < 1) ≈ 68.27%이며 이는 경험적 규칙의 첫 단계입니다.
흔한 실수
- 잘못된 방식을 선택하는 것. 같은 x라도 "작을", "클", "사이" 방식은 서로 다른 확률을 주며, 이를 혼동하는 일이 자주 있습니다.
- "두 값 사이" 방식에서 상한 b를 x보다 작게 입력하는 것. 이 계산기에서 유효한 구간이 아닙니다.
- 하나의 정확한 값에 대한 확률을 의미 있게 다루는 것. 정규분포 같은 연속분포에서 P(X = x)는 언제나 0입니다.
- 확인 없이 데이터가 정규분포라고 가정하는 것. 여기서 나오는 확률은 기저 변수가 근사적으로 정규분포일 때만 정확합니다.
- 표준편차와 분산을 혼동하는 것. 이 계산기는 표준편차(σ)를 요구하며 그 제곱을 요구하지 않습니다.
자주 묻는 질문
정규분포 확률은 어떻게 계산하나요?
z = (x − 평균) / 표준편차로 값을 z 점수로 변환한 뒤, 표준정규분포에서 대응하는 누적확률을 찾습니다. x보다 작을 확률은 Φ(z)를 그대로 쓰고, x보다 클 확률은 1 − Φ(z)를 쓰며, x와 b 사이 구간은 두 누적확률을 빼서 구합니다.
경험적 규칙이란 무엇인가요?
경험적 규칙(68-95-99.7 규칙)은 정규분포에서 값의 약 68.27%가 평균에서 표준편차 1 이내에, 약 95.45%가 표준편차 2 이내에, 약 99.73%가 표준편차 3 이내에 놓인다는 것을 뜻합니다.
z 점수란 무엇인가요?
z 점수는 어떤 값이 평균에서 표준편차 몇 개만큼 떨어져 있는지를 나타내며 z = (x − 평균) / 표준편차로 계산합니다. 이 계산기가 표준정규분포에서 확률을 찾기 위해 거치는 중간 단계입니다.
왜 정확한 값 하나의 확률은 언제나 0인가요?
정규분포는 연속분포이므로 확률은 점이 아니라 구간에서만 정의됩니다. P(X = 120)을 정확히 묻는다면 수학적으로 0이며, 의미 있는 질문은 P(X < 120), P(X > 120), P(a < X < b)입니다.
이 계산기는 어떤 데이터에나 쓸 수 있나요?
기저 변수가 근사적으로 정규분포를 따를 때만 그렇습니다. 실제 변수 중 상당수가 근사적으로 정규분포를 따르지만, 치우쳤거나 범위가 제한된(예: 개수나 비율) 데이터, 꼬리가 두꺼운 데이터를 이 틀에 억지로 넣으면 오해를 부르는 확률이 나올 수 있습니다.
'작을 확률' 방식과 '두 값 사이' 방식은 어떻게 다른가요?
"작을 확률"은 하나의 값 x까지의 누적확률 P(X < x)를 보고합니다. "두 값 사이"는 구간에 들어갈 확률 P(x < X < b)를 보고하며, 이는 두 누적확률의 차이이므로 하한 값 x와 상한 b가 모두 필요합니다.
참고 자료
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.6.6.1: Normal distribution. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (the normal distribution and standardized values).
- Abramowitz M, Stegun IA (eds). Handbook of Mathematical Functions. National Bureau of Standards, Applied Mathematics Series 55, 1964 (standard normal distribution tables).
- Casella G, Berger RL. Statistical Inference (2nd ed). Duxbury, 2002 (the normal distribution and its properties).