중앙값, 최빈값, 범위 이해하기
각 통계량은 데이터의 서로 다른 측면을 설명합니다. 아래 표는 각각이 무엇을 알려 주는지 정리한 것입니다.
| 통계량 | 설명하는 내용 | 이상치에 대한 민감도 |
|---|---|---|
| 중앙값 | 정렬된 데이터의 한가운데. 값의 50%가 그 이하에 위치 | 낮음 — 값의 순서에만 의존 |
| 최빈값 | 가장 자주 나타나는 값. 분포의 봉우리 | 낮음 — 극단값의 영향을 받지 않음 |
| 범위 | 최솟값부터 최댓값까지의 전체 산포 | 높음 — 양 극단값에 의해 전적으로 결정 |
- 평균이 중앙값보다 뚜렷하게 크면 일반적으로 데이터가 오른쪽으로 치우쳐 있습니다 (소득처럼 큰 값의 꼬리가 있는 경우). 평균이 중앙값보다 작으면 왼쪽으로 치우쳐 있음을 시사합니다.
- 데이터 집합은 최빈값이 없을 수도 (모든 값이 서로 다름), 하나일 수도, 여러 개일 수도 있습니다. 이 계산기는 최고 빈도로 동률인 모든 값을 나열합니다.
- 표본의 중앙값은 모집단의 중앙값을 추정합니다. 모든 표본 통계량과 마찬가지로 표본 변동의 영향을 받습니다.
중앙값, 최빈값, 범위란 무엇입니까?
중앙값은 정렬된 데이터 집합을 반으로 나누는 값입니다. 값을 작은 것부터 큰 것 순으로 정렬한 뒤, 값의 개수가 홀수이면 가운데 하나의 값이 중앙값이고, 짝수이면 가운데 두 값의 산술평균이 중앙값입니다. 중앙값은 극단값의 크기가 아니라 데이터의 순서에만 의존하므로 이상치에 강건합니다.
최빈값은 데이터에서 가장 자주 나타나는 값 또는 값들입니다. 데이터 집합은 최빈값이 하나일 수도, 여러 개일 수도 있으며 (예: 봉우리가 두 개인 이봉형 데이터), 모든 값이 정확히 한 번씩만 나타나면 최빈값이 존재하지 않습니다. 최빈값은 범주형 데이터에도 적용할 수 있는 유일한 중심 경향 측도입니다.
범위는 가장 큰 값과 가장 작은 값의 차이입니다. 가장 단순한 산포 측도이지만 양 극단의 두 관측값만 사용하므로 이상치에 매우 민감합니다. 표준편차나 사분위 범위가 산포를 더 강건하게 설명합니다.
이 중앙값 계산기 사용 방법
- 숫자를 세미콜론으로 구분하여 입력합니다. 예: 7; 12; 3; 9; 21; 14. 계산기가 자동으로 정렬합니다.
- 중앙값을 확인합니다. 값의 개수가 짝수인 경우 정렬된 목록의 가운데 두 값의 평균입니다.
- 최빈값을 확인합니다. 가장 자주 나타나는 값 또는 값들입니다. 반복되는 값이 없으면 대시가 표시되며, 이는 데이터에 최빈값이 없음을 의미합니다.
- 범위, 즉 최댓값에서 최솟값을 뺀 값을 확인합니다. 데이터가 얼마나 퍼져 있는지를 빠르게 보여 줍니다.
중앙값, 최빈값, 범위의 계산 방법
중앙값: n개의 값을 정렬합니다. n이 홀수이면 중앙값은 (n + 1) / 2 번째 위치의 값입니다. n이 짝수이면 중앙값은 n/2 번째와 n/2 + 1 번째 값의 평균입니다.
계산 예시: 값 7, 12, 3, 9, 21, 14. 정렬하면 3, 7, 9, 12, 14, 21입니다. 값의 개수가 n = 6 (짝수)이므로 중앙값은 3번째와 4번째 값의 평균인 (9 + 12) / 2 = 10.5입니다. 반복되는 값이 없으므로 최빈값은 없습니다. 범위는 21 - 3 = 18입니다.
최빈값이 있는 두 번째 예시: 2, 4, 4, 7, 9. 정렬했을 때 가운데 (3번째) 값이 4이므로 중앙값은 4입니다. 값 4는 두 번 나타나고 다른 값은 각각 한 번씩만 나타나므로 최빈값은 4입니다. 범위는 9 - 2 = 7입니다.
흔한 실수
- 가운데 값을 찾기 전에 데이터를 정렬하지 않는 것 — 중앙값은 정렬된 목록에서 정의됩니다.
- 값의 개수가 짝수일 때 가운데 두 값의 평균 대신 둘 중 하나를 택하는 것: 3, 7, 9, 12, 14, 21의 중앙값은 10.5이며 9나 12가 아닙니다.
- 모든 데이터 집합에 최빈값이 있다고 가정하는 것 — 반복되는 값이 없으면 최빈값은 존재하지 않습니다.
- 범위를 강건한 산포 측도로 사용하는 것. 범위는 가장 극단적인 두 값에만 의존하며 그 사이의 모든 값을 무시합니다.
자주 묻는 질문
데이터 집합의 중앙값은 어떻게 구합니까?
값을 작은 것부터 큰 것 순으로 정렬합니다. 개수가 홀수이면 가운데 값이 중앙값입니다. 개수가 짝수이면 가운데 두 값의 평균이 중앙값입니다. 예를 들어 7, 12, 3, 9, 21, 14를 정렬하면 3, 7, 9, 12, 14, 21이고 중앙값은 (9 + 12) / 2 = 10.5입니다.
중앙값이 평균보다 나은 경우는 언제입니까?
데이터가 치우쳐 있거나 이상치를 포함할 때입니다. 중앙값은 값의 순서에만 의존하므로 극단적인 관측값 하나가 있어도 거의 움직이지 않는 반면, 평균은 크게 이동할 수 있습니다. 소득과 주택 가격을 보통 중앙값으로 요약하는 이유가 여기에 있습니다.
데이터 집합에 최빈값이 두 개 이상 있을 수 있습니까?
있습니다. 둘 이상의 값이 최고 빈도로 동률이면 그 데이터 집합은 다봉형이며 동률인 모든 값이 최빈값입니다. 예를 들어 1, 2, 2, 5, 7, 7, 9에서는 2와 7이 각각 두 번 나타나므로 최빈값이 2와 7인 이봉형 데이터입니다. 반복되는 값이 없으면 최빈값은 존재하지 않습니다.
범위는 무엇을 알려 줍니까?
범위는 최댓값에서 최솟값을 뺀 값으로, 데이터의 전체 폭입니다. 계산이 빠르고 해석하기 쉽지만 가장 극단적인 두 값만 사용하므로 이상치 하나가 범위를 크게 부풀릴 수 있습니다. 산포를 더 온전하게 파악하려면 표준편차나 사분위 범위를 사용하십시오.
중앙값은 항상 실제 데이터 값입니까?
항상 그렇지는 않습니다. 값의 개수가 홀수이면 중앙값은 관측된 값 중 하나입니다. 짝수이면 가운데 두 값의 평균이므로 데이터에 나타나지 않을 수 있습니다. 예를 들어 3, 7, 9, 12, 14, 21의 중앙값 10.5는 여섯 개의 관측값 중 어느 것도 아닙니다.
참고 자료
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods, Section 1.3.5.1: Measures of Location. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (median, mode and resistant measures).
- Weisstein, Eric W. "Statistical Median." MathWorld — A Wolfram Web Resource. mathworld.wolfram.com.