logo

상관과 인과

상관계수 가설 검정

  • 귀무가설: 상관관계가 없다()
  • 대립가설: 상관관계가 있다()
  • 일반적으로 p-value가 0.05보다 작으면 통계적으로 유의미한 상관관계가 있다고 판단
  • p-value가 0.05 이상이면 표집 오차일 가능성을 고려하여 유의미한 상관관계를 발견하지 못했다고 판단

상관계수 행렬과 히트맵

  • 여러 변수 간의 상관계수를 한 번에 계산하여 행렬 형태로 나타낼 수 있음
  • 데이터의 주요 특징과 변수 간 다중공선성(Multicollinearity) 가능성을 파악하는 데 유용
  • 히트맵(Heatmap)을 이용해 상관계수의 크기를 색상으로 시각화하면 가독성이 높아짐
# 관심 있는 변수만 선택
cols = ["length", "beam", "weight", "speed"]
df_corr = df_ship[cols].corr()

# 상관계수 행렬 시각화
sns.heatmap(df_corr, annot=True, cmap="coolwarm", vmin=-1, vmax=1)

상관계수 행렬 히트맵

상관관계는 인과관계가 아님

  • 상관관계가 높다고 해서 반드시 원인과 결과, 즉 인과관계를 의미하지 않음
  • 우연한 상관(Spurious Correlation)
    • 논리적인 연관성이 전혀 없음에도 통계적으로 높은 상관계수가 나오는 현상
  • 제3의 변수(Confounding Variable)
    • 두 변수에 모두 영향을 미치는 숨겨진 변수 때문에 상관관계가 나타날 수 있음
  • 이질적인 집단들의 합
    • 심슨의 역설, 벅슨의 역설
  • 극단치(outliers)
  • 인과관계를 입증하려면 논리적 근거, 실험 설계, 혹은 도메인 지식이 추가로 필요

마가린 소비량과 메인주 이혼율의 우연한 상관 예시

제3의 변인

  • 도시 내 범죄 발생 건수와 종교 시설의 수는 양의 상관관계가 있음
  • 이 상관관계만 보면 다음과 같은 잘못된 인과 해석을 할 수 있음
    • 범죄가 많아서 사람들이 종교에 의존하는가?
    • 종교가 범죄를 부추기는가?
  • 실제로는 인구가 많아지면 범죄도 늘고 종교 시설도 많아질 수 있음
  • 이때 인구는 범죄 발생 건수와 종교 시설 수에 모두 영향을 미치는 제3의 변인

심슨의 역설

  • 각 집단별 상관관계와 전체 총합의 상관관계는 다를 수 있음
  • 상관분석 결과가 예상과 다를 경우, 이질적인 하위집단들이 존재하는지 살펴봐야 할 수 있음
  • 집단 내부에서는 겨울이 추울수록 사망자가 증가하지만, 국가 간 비교에서는 겨울이 따뜻한 국가에서 사망자 증가율이 높게 보일 수 있음

심슨의 역설 예시와 빨간 주석

벅슨의 역설

  • 벅슨의 역설(Berkson's Paradox)은 A-B가 모두 있는 사람이나 모두 없는 사람이 데이터에서 배제되어 나타나는 현상
    • 외모와 성격이 모두 마음에 들지 않는 사람과는 처음부터 만나지 않음
    • 외모와 성격이 독립적이라도, 만난 사람 중에서는 음의 상관관계가 관찰될 수 있음
  • 표본이 어떤 기준으로 선택되었는지에 따라 실제 관계와 다른 상관관계가 나타날 수 있음

벅슨의 역설 도식

극단치

  • 극단치(outlier)는 자료 안에서 다른 값들과 크게 떨어져 있는 관측값
  • 자료 내에 극단치가 있을 때 상관관계 해석이 왜곡될 수 있음
  • 나타날 수 있는 문제
    • 존재하지 않는 상관관계가 나타나는 경우
    • 존재하는 상관관계가 포착되지 못하는 경우
  • 상관분석 전 산점도와 기초 통계를 함께 확인해야 함
Previous
상관 분석