카이제곱 결과 이해하기
아래 표는 흔히 쓰이는 자유도에 대해 관례적인 유의수준 α = 0.05에서의 표준 카이제곱 임계값을 정리한 것입니다. 관측된 χ² 통계량이 표에 제시된 값을 넘으면 기대 분포에서 통계적으로 유의하게 벗어났음을 뜻합니다.
| 자유도 (df) | α = 0.05에서의 임계 χ² |
|---|---|
| 1 | 3.841 |
| 2 | 5.991 |
| 3 | 7.815 |
| 4 | 9.488 |
| 5 | 11.070 |
| 6 | 12.592 |
| 8 | 15.507 |
| 10 | 18.307 |
- 표준 통계학 교재에서 널리 쓰이는 경험 법칙에 따르면, 모든 기대 빈도가 5 이상일 때 카이제곱 근사가 신뢰할 만합니다. 기대 빈도가 그보다 작으면 정확검정이 더 적절합니다.
- 이 계산기는 적합도 검정만 수행합니다. 즉 하나의 범주형 변수를 가정된 분포와 비교할 뿐이며, 행과 열 기준의 다른 기대 빈도 계산을 사용하는 두 범주형 변수 간 카이제곱 독립성 검정은 수행하지 않습니다.
- 관측 목록과 기대 목록은 길이가 같아야 하고, 범주가 2개 이상이며, 모든 기대 빈도가 0보다 커야 합니다.
- 통계적으로 유의한 결과는 범주들이 가정된 비율과 다르다는 것을 나타낼 뿐, 어느 범주가 다른지 또는 실질적인 차이가 얼마나 큰지를 그 자체로 알려 주지는 않습니다.
카이제곱 적합도 검정이란 무엇입니까?
카이제곱 적합도 검정은 여러 범주의 관측 빈도를 가정된 분포에서 기대되는 빈도와 비교하여 둘이 얼마나 벗어나는지를 측정합니다. 이 계산기는 적합도 검정만 수행합니다. 즉 하나의 범주형 변수를 기대 비율과 대조하는 방식이며, 분할표에서 두 범주형 변수의 연관성을 살펴보는 카이제곱 독립성 검정은 수행하지 않습니다.
검정 통계량은 모든 범주에 걸쳐 관측 빈도와 기대 빈도의 차이를 제곱한 뒤 기대 빈도로 나눈 값을 합산합니다. 기대 빈도에 비해 차이가 클수록 χ² 값이 커지고, 가정된 분포에 반하는 증거가 강해집니다.
χ²는 항상 0 이상이므로 이 검정은 본질적으로 한쪽 방향입니다. 해당 자유도의 카이제곱 분포에 비추어 비정상적으로 큰 χ² 값만이 적합도가 나쁘다는 증거로 취급되며, 검정할 '음의 방향'에 해당하는 개념은 없습니다.
카이제곱 검정 계산기 사용 방법
- 각 범주의 관측 빈도를 세미콜론으로 구분한 목록으로 입력합니다. 예: 30; 25; 22; 23.
- 동일한 범주에 대한 기대 빈도를 같은 순서로, 세미콜론으로 구분한 목록으로 입력합니다. 예: 25; 25; 25; 25.
- 두 목록의 길이가 같은지(범주 2개 이상), 그리고 모든 기대 빈도가 0보다 큰지 확인합니다.
- χ² 통계량, 자유도(범주 수에서 1을 뺀 값), p 값을 확인하고, p 값을 선택한 유의수준(일반적으로 α = 0.05)과 비교합니다.
카이제곱 적합도 검정의 계산 공식
카이제곱 통계량은 χ² = Σ (Oᵢ − Eᵢ)² / Eᵢ이며, k개 범주 전체에 대해 합산합니다. 여기서 Oᵢ는 범주 i의 관측 빈도, Eᵢ는 기대 빈도입니다. 자유도는 범주 수보다 하나 적은 k − 1입니다.
p 값은 가정된(기대) 분포가 참일 때, 주어진 자유도의 카이제곱 분포에서 계산된 값 이상으로 큰 χ² 통계량이 관측될 확률입니다.
계산 예시: 관측 빈도 30, 25, 22, 23을 각각 25인 기대 빈도와 비교합니다. χ² = (30−25)²/25 + (25−25)²/25 + (22−25)²/25 + (23−25)²/25 = 1 + 0 + 0.36 + 0.16 = 1.52이고, df = 4 − 1 = 3입니다. 이는 자유도 3, α = 0.05에서의 임계값 7.815보다 훨씬 작으므로 결과는 통계적으로 유의하지 않습니다.
흔한 실수
- 실제 관심사가 두 범주형 변수와 그 연관성인데 이 적합도 검정을 사용하는 경우 — 그 경우에는 관측 대 기대 목록 하나가 아니라, 기대 빈도 분할표를 사용하는 카이제곱 독립성 검정이 필요합니다.
- 기대 빈도 지침을 위배하는 경우: 하나 이상의 범주에서 기대 빈도가 작으면(흔히 5 미만) 카이제곱 근사가 신뢰하기 어려워지므로 정확검정이 더 적절합니다.
- 관측 목록과 기대 목록의 길이를 다르게 입력하거나, 두 목록에서 범주 순서를 다르게 나열하여 비교가 어긋나는 경우.
- 기대 빈도를 0으로 입력하는 경우. 해당 범주의 (O − E)² / E 항이 정의되지 않습니다.
- 통계적으로 유의한 χ²를 큰 차이나 중요한 차이의 증거로 받아들이는 경우 — 유의성은 편차가 우연 때문일 가능성이 낮다는 뜻이지, 그 차이가 실질적으로 크다는 뜻은 아닙니다.
자주 묻는 질문
카이제곱 적합도 검정은 어디에 사용합니까?
여러 범주의 관측 빈도가 가정된 분포의 기대 빈도와 일치하는지를 검정합니다. 예를 들어 주사위의 관측된 눈금 빈도가 기대되는 균등분포와 맞는지, 또는 설문 응답이 가정한 비율과 일치하는지를 확인할 때 사용합니다.
카이제곱 통계량은 어떻게 계산합니까?
χ² = Σ (관측 − 기대)² / 기대를 모든 범주에 걸쳐 합산합니다. 관측 빈도와 기대 빈도의 차이가 클수록, 특히 기대 빈도에 비해 클수록 χ² 값이 커집니다.
적합도 검정의 자유도는 얼마입니까?
자유도는 범주 수에서 1을 뺀 값입니다(df = k − 1). 이 페이지의 계산 예시처럼 범주가 4개이면 df = 3입니다.
기대 빈도가 5 이상이어야 하는 이유는 무엇입니까?
카이제곱 검정 통계량의 분포는 기대 빈도가 지나치게 작지 않을 때에만 카이제곱 분포로 잘 근사됩니다. 널리 인용되는 경험 법칙은 모든 기대 빈도가 5 이상일 것을 요구하며, 그보다 작으면 카이제곱 근사에서 나온 p 값이 부정확할 수 있어 정확검정이 선호됩니다.
이것은 카이제곱 독립성 검정과 같습니까?
아닙니다. 이 계산기는 하나의 범주형 변수의 관측 빈도를 가정된 분포와 비교하는 적합도 검정을 수행합니다. 독립성 검정은 두 범주형 변수가 연관되어 있는지를 살펴보며, 행 합계와 열 합계로 기대 빈도를 계산하는 분할표를 사용하는 다른 계산입니다.
참고 자료
- Pearson K. On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling. Philosophical Magazine Series 5, 1900; 50(302): 157-175.
- National Institute of Standards and Technology (NIST). NIST/SEMATECH e-Handbook of Statistical Methods — chi-square goodness-of-fit test. nist.gov.
- Moore DS, McCabe GP, Craig BA. Introduction to the Practice of Statistics. W. H. Freeman (chi-square goodness-of-fit test and expected-count guidelines).
- Snedecor GW, Cochran WG. Statistical Methods. Iowa State University Press (chi-square goodness-of-fit test).
- Agresti A. Categorical Data Analysis. Wiley (chi-square goodness-of-fit and independence tests).