logo

비율의 비교

카이제곱 분포

  • 정규분포 을 따르는 확률변수 를 표준화하면
  • 이때 의 개수 를 자유도(degree of freedom)라고 부름
  • 를 모두 제곱하여 더한 은 자유도가 인 카이제곱분포를 따름
  • 는 그리스 문자 "카이"

자유도에 따른 카이제곱 분포

기대빈도와 관찰빈도

  • 범주형 자료에서 기대빈도가 이면 관찰빈도 는 대략 정규분포 를 따름
  • 이를 표준화하면
  • 각 범주의 표준화된 차이를 제곱하여 더하면 카이제곱 통계량을 얻음
  • 이 통계량을 이용해 관찰빈도가 기대빈도에서 얼마나 벗어났는지 검정할 수 있음

카이제곱 적합도 검정

  • 카이제곱 적합도 검정(chi-square test for goodness of fit)은 표본에서 얻은 분포가 귀무가설에서 가정하는 모집단 분포와 잘 맞는지 알아보기 위해 사용
  • 귀무가설: 모집단의 비율은 기대빈도의 비율과 같음
  • 예: 브랜드 선호도
    • 50명을 설문했을 때 A 브랜드 31명(62%), B 브랜드 19명(38%)이면 A 브랜드의 선호도가 통계적으로 유의하게 높은가?
    • 100명을 설문했을 때 A 브랜드 62명(62%), B 브랜드 38명(38%)이면 A 브랜드의 선호도가 통계적으로 유의하게 높은가?

Python 카이제곱 적합도 검정

from scipy.stats import chisquare

chisquare([31, 19], [25, 25])
  • 귀무가설: 모집단에서 두 브랜드의 선호도는 50%:50%로 같음
  • chisquare에 관찰빈도와 기대빈도 순으로 입력
  • 결과로 카이제곱값과 p-value가 출력됨

분할표

  • 분할표(contingency table)는 행과 열이 서로 다른 범주형 변수의 값을 나타내는 표
  • 교차표(cross table) 또는 피봇 테이블(pivot table)이라고도 함
  • 표의 각 칸에는 사례 수를 표기
import pandas as pd

hr = pd.read_excel("hr.xlsx")
hr.pivot_table(index="marriage", columns="department", aggfunc="size")
marriageEngineeringFinanceSales
married46236209
single49927237

카이제곱 독립성 검정

  • 카이제곱 독립성 검정(chi-square test for independence)은 두 범주형 변수 사이에 관계가 있는지 알아보기 위해 사용
  • 귀무가설: 두 변수가 독립적임, 즉 관계가 없음
  • 예시
    • 남녀 간의 브랜드 선호도 차이
    • 지역별 정당 지지율 차이
    • 혈액형과 성격유형의 관계
  • 데이터가 적으면 p-value가 부정확할 수 있음
    • 모든 기대빈도가 5 이상이어야 함
  • Cramér's V는 두 변수의 관계를 0부터 1까지로 표시
    • 0: 전혀 관련이 없음
    • 1: 완전히 일치

카이제곱 검정 순서도

Python 카이제곱 독립성 검정

import pingouin as pg

expected, observed, stats = pg.chi2_independence(
    x="marriage",
    y="department",
    data=hr,
)
stats
testlambdachi2dofpvalcramerpower
pearson1.0000002.3381802.00.3106500.0398820.257948
cressie-read0.6666672.3375862.00.3107420.0398770.257891
log-likelihood0.0000002.3401882.00.3103380.0398990.258141
freeman-tukey-0.5000002.3454752.00.3095180.0399440.258649
mod-log-likelihood-1.0000002.3536532.00.3082550.0400140.259435
neyman-2.0000002.3788382.00.3043980.0402280.261856
  • Pearson 행의 pval이 0.310650으로 0.05보다 크므로 귀무가설을 기각하지 않음
  • cramer가 약 0.04이므로 두 변수의 관계도 매우 약함
Previous
대응 표본