z점수 공식: 값을 표준화하기
표준점수라고도 하는 z점수는 원래의 값을 원래 단위가 아니라 표준편차 단위로 측정하여, 그 값이 분포의 평균에서 얼마나 떨어져 있는지를 나타내는 값으로 변환합니다. 공식은 z = (x - 평균) / 표준편차이며, 여기서 x는 표준화하려는 값입니다. z점수가 0이면 그 값이 평균과 정확히 같다는 뜻이고, 양수이면 값이 평균보다 위에 있다는 뜻이며, 음수이면 값이 평균보다 아래에 있다는 뜻입니다.
이렇게 값을 표준화하면 서로 다른 척도나 서로 다른 분포에서 나온 측정값을 비교할 수 있게 됩니다 -- 예를 들어 평균과 산포가 서로 다른 두 시험에서의 학생 성적을 비교하거나, 개별 검사 결과를 기준 범위와 비교하는 경우입니다. z점수는 원래의 단위와 원래의 척도를 모두 제거하기 때문에, z점수 +1은 무엇을 측정하든 관계없이 항상 같은 상대적 의미(그 값이 나온 분포의 평균보다 표준편차 하나만큼 위)를 갖습니다.
「평균보다 두 표준편차 위」란 무슨 뜻인가?
어떤 값이 평균보다 두 표준편차 위에 있다고 말하는 것은 단순히 그 값의 z점수가 +2라는 것을 다르게 표현한 것입니다: 그 값은 전형적인 관측값보다 분포의 표준편차의 두 배만큼 더 평균에서 멀리 떨어져 있습니다. 표준편차는 데이터의 전형적인 산포를 측정하기 때문에, 대략 정규분포에서는 중심에서 그만큼 멀리 떨어진 관측값이 상대적으로 적으므로 z점수가 2 이상(또는 -2 이하)이면 관례적으로 이례적인 것으로 간주됩니다.
이 표현은 순전히 분포 내 위치를 서술하는 것일 뿐이며, 평균보다 두 표준편차 위에 있다는 것 자체가 좋은지, 나쁜지, 중립적인지를 말해주지는 않습니다. 시험 점수 분포에서 z점수 +2는 일반적으로 우수한 결과를 나타내지만, 혈압 분포에서 z점수 +2는 일반적으로 전형적인 수치보다 상당히 높아 임상적으로 주의가 필요한 수치를 나타냅니다. z점수는 평균으로부터의 거리를 알려줄 뿐이며, 그 거리가 무엇을 의미하는지는 항상 무엇을 측정하고 있는지에 달려 있습니다.
표준정규분포와 백분위수
기저 데이터가 대략 정규분포(종 모양)일 때, z점수는 특정 z점수보다 아래에 있는 분포의 비율을 알려주는 표준정규 누적분포함수를 이용해 백분위수로 변환할 수 있습니다. 이 변환 덕분에 z점수를 「이 값은 분포의 약 X%보다 높다」는 식으로 다시 표현할 수 있습니다. 아래 표는 -2부터 +3까지 정수 z점수에 대한 표준적이고 확립된 백분위수를 정리한 것입니다.
| Z점수 | 백분위수 (아래에 있는 분포의 비율) | 위에 있는 비율 |
|---|---|---|
| -2 | 2.28% | 97.72% |
| -1 | 15.87% | 84.13% |
| 0 | 50.00% | 50.00% |
| +1 | 84.13% | 15.87% |
| +2 | 97.72% | 2.28% |
| +3 | 99.87% | 0.13% |
예제 풀이: 원점수를 백분위수로 변환하기
평균 100, 표준편차 15인 분포(IQ 점수에 흔히 쓰이는 전형적인 척도)에서 나온 값 x = 130을 생각해 봅시다. 1단계: z점수를 계산합니다, z = (130 - 100) / 15 = 30 / 15 = 2. 2단계: 표준정규분포에서 z = 2를 찾으면 97.72번째 백분위수에 해당하며, 이는 분포의 약 97.72%가 130 이하의 값이고 약 2.28%가 그 위에 있다는 뜻입니다.
같은 척도를 사용한 두 번째 예: x = 85라는 값은 z = (85 - 100) / 15 = -15 / 15 = -1이 되며, 이는 15.87번째 백분위수에 해당합니다 -- 즉 이 값은 분포의 약 84.13%보다 아래에 있고 약 15.87%보다 위에 있다는 뜻입니다. 두 경우 모두 전체 계산은 두 단계로 요약됩니다: 값을 z점수로 표준화한 다음, 표준정규분포에서 해당하는 백분위수를 읽습니다.
68-95-99.7 경험칙
대략 정규분포를 따르는 데이터에서는 경험칙(68-95-99.7 규칙이라고도 함)을 이용하면 전체 백분위수를 조회하지 않고도 z점수가 얼마나 이례적인지 빠르게 판단할 수 있습니다: 값의 약 68%는 평균으로부터 표준편차 하나 이내(z가 -1에서 +1 사이)에 있고, 약 95%는 표준편차 둘 이내(z가 -2에서 +2 사이)에, 약 99.7%는 표준편차 셋 이내(z가 -3에서 +3 사이)에 있습니다.
이 규칙은 위의 백분위수 표에서 직접 도출됩니다: z = -1과 z = +1 사이의 비율은 84.13% - 15.87% = 68.26%이고, z = -2와 z = +2 사이의 비율은 97.72% - 2.28% = 95.44%이며, z = -3과 z = +3 사이의 비율은 99.87% - 0.13% = 99.74%로 -- 모두 흔히 인용되는 68%, 95%, 99.7%라는 근사치와 일치합니다. 이 규칙은 기저 분포가 대략 정규분포일 때만 적용되며, 왜곡되거나 두꺼운 꼬리를 가진 데이터는 z점수를 여전히 계산할 수 있더라도 이 비율에서 상당히 벗어날 수 있습니다.
자주 묻는 질문
z점수는 어떻게 계산하나요?
값에서 평균을 빼고 표준편차로 나눕니다: z = (x - 평균) / 표준편차. 예를 들어 평균 100, 표준편차 15인 척도에서 값 130은 z = (130 - 100) / 15 = 2가 되며, 이는 그 값이 평균보다 두 표준편차 위에 있다는 뜻입니다.
z점수 2는 어느 백분위수에 해당하나요?
약 97.72번째 백분위수입니다. 표준정규분포에서는 z점수 2 이하에 값의 약 97.72%가 위치하므로, 이 z점수를 갖는 값은 분포의 약 97.72%보다 높고 약 2.28%보다 낮습니다(기저 데이터가 대략 정규분포라고 가정할 때).
평균보다 두 표준편차 위에 있다는 것은 무슨 뜻인가요?
z점수가 +2라는 뜻입니다: 그 값은 전형적인 관측값보다 분포의 표준편차의 두 배만큼 평균 위로 더 멀리 떨어져 있습니다. 대략 정규분포를 따르는 데이터에서는 이 값 이하에 분포의 약 97.72%가 위치하므로 상대적으로 흔치 않은 결과이지만, 이것이 바람직한지는 전적으로 무엇을 측정하는지에 달려 있습니다.
z점수는 데이터가 정규분포를 따라야만 계산할 수 있나요?
z점수 계산 자체, z = (x - 평균) / 표준편차는 어떤 분포에 대해서도 정의되며 정규성을 요구하지 않습니다. 다만 위 예제처럼 z점수를 표준정규분포를 이용해 백분위수로 변환하는 것은 기저 데이터가 대략 정규분포(종 모양)일 때만 정확하며, 왜곡되거나 두꺼운 꼬리를 가진 데이터에서는 백분위수를 데이터에서 직접 읽어야 합니다.
68-95-99.7 규칙이란 무엇인가요?
대략 정규분포를 따르는 분포에서 평균으로부터 표준편차 하나, 둘, 셋 이내에 얼마나 많은 값이 분포하는지를 나타내는 약식 표현입니다: 표준편차 하나 이내(z가 -1에서 +1 사이)에 약 68%, 둘 이내(z가 -2에서 +2 사이)에 약 95%, 셋 이내(z가 -3에서 +3 사이)에 약 99.7%가 있습니다. 이는 전체 백분위수를 조회하지 않고도 어떤 값이 얼마나 이례적인지 빠르게 판단하는 방법을 제공합니다.
참고 자료
- Abramowitz M, Stegun IA (eds). Handbook of Mathematical Functions. National Bureau of Standards, Applied Mathematics Series 55, 1964 (normal CDF approximation 26.2.17).
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.6.6.1: Normal distribution. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (standardized values and the normal distribution).