표집 오차
표집 오차
- 표집 오차(Sampling Error): 모집단 전체가 아닌 표본만 관찰하기 때문에 표본에서 계산한 통계량과 모집단의 모수 사이에 생기는 차이
- 표집 오차는 다음과 같이 나타낼 수 있음
표집 오차 = 통계량 - 모수- 예:
표본평균 - 모평균,표본비율 - 모비율
- 무작위로 표본을 추출하더라도 어떤 관측치가 뽑히느냐에 따라 통계량이 달라지므로 표집 오차가 발생함
- 표집 오차는 조사 실수나 표본 추출의 편향과는 다른 개념
표본 크기와 표집 오차
- 표본의 크기가 커질수록 통계량의 표집분포는 일반적으로 좁아짐
- 따라서 큰 표본에서는 큰 표집 오차가 발생할 가능성이 작아지는 경향이 있음
- 다만 표본 크기를 키워도 표집 오차를 완전히 없앨 수는 없음
- 표본의 크기가 크더라도 추출 방법이 편향되어 있으면 모집단을 제대로 대표하지 못할 수 있음
표집 오차의 예시
- 6면체 주사위 눈의 모집단 평균은 3.5
- 주사위를 10번 굴려 눈의 합이 26이었다면 표본평균은 2.6
- 이 표본평균의 표집 오차는 다음과 같음
- 음의 표집 오차는 표본에서 계산한 값이 모수보다 작게 나왔다는 뜻

비표집 오차
- 비표집 오차(Non-sampling Error): 표본 추출의 무작위성 이외에 조사 설계, 자료 수집, 처리, 분석 단계에서 발생하는 오류
- 주요 원인
- 조사 설계: 편향된 질문, 모호한 개념 정의
- 자료 수집: 무응답, 부정확한 응답, 조사자의 유도
- 자료 처리: 데이터 입력 실수, 부적절한 분석 방법
- 비표집 오차는 표본 크기를 키운다고 자동으로 줄어들지 않음
- 전수 조사에서도 측정이나 입력 과정에 문제가 있으면 비표집 오차가 발생할 수 있음
표집 오차와 비표집 오차 비교
| 구분 | 표집 오차 | 비표집 오차 |
|---|---|---|
| 발생 원인 | 모집단의 일부만 무작위로 관찰 | 설계, 측정, 응답, 처리, 분석의 문제 |
| 표본 크기의 영향 | 커질수록 일반적으로 감소 | 커진다고 자동으로 감소하지 않음 |
| 전수 조사에서 발생 여부 | 발생하지 않음 | 발생할 수 있음 |
| 예 | 표본평균과 모평균의 우연한 차이 | 유도 질문, 무응답, 입력 오류 |
시뮬레이션: 표본 추출과 표집 오차 확인
import numpy as np
# 모집단의 평균과 표준편차 (모수)
pop_mean = 170
pop_sd = 10
# 같은 코드를 실행할 때 같은 난수가 생성되도록 설정
rng = np.random.default_rng(2026)
# 모집단 분포에서 100건을 무작위 추출 (표본)
sample = rng.normal(loc=pop_mean, scale=pop_sd, size=100)
# 표본평균 (통계량)과 표집 오차
sample_mean = sample.mean()
sampling_error = sample_mean - pop_mean
sample_mean, sampling_error
- 난수 시드를 바꾸거나 시드 설정을 제거하고 코드를 다시 실행하면 표본과 표집 오차가 달라질 수 있음
size를 크게 바꾸어 여러 번 실행하면 표본 크기와 표집 오차의 관계를 확인할 수 있음