logo

지도학습의 원리: 회귀와 분류

정답이 있는 데이터에서 입력과 결과의 관계를 학습하고 회귀와 분류를 구분하는 원리

지도학습

  • 지도학습(supervised learning): 입력과 정답이 짝지어진 과거 데이터에서 예측 규칙을 학습하는 방식
  • 목표: 아직 결과를 모르는 새로운 사례의 결과 예측
  • 예측(prediction)은 시간적으로 미래를 가리키기보다, 아직 관찰되지 않은 결과를 추측하는 것을 가리킴
    • 예: 기기의 고장 여부를 예측한다고 하면, 꼭 앞으로 고장난다는 뜻이 아니라 현재 고장 여부를 진단하는 것을 포함

입력과 정답

  • 특성(feature) : 예측에 사용하는 정보(독립변수)
  • 타깃(target) : 예측하려는 정답(종속변수)
  • 모델(model): 의 관계를 학습한 예측 규칙

아파트 거주자의 자료를 예:

거주자월세(만원)통학 시간(분)소음 수준주거 만족도재계약 여부
A5520낮음82재계약
B7510보통76재계약
C4555높음48미재계약
D6535보통62미재계약
  • 입력 : 월세, 통학 시간, 소음 수준
  • 타깃 : 주거 만족도 또는 재계약 여부
  • 어떤 열을 로 정하는지에 따라 서로 다른 예측 문제

학습과 예측

  1. 과거 사례에서 입력 와 정답 를 준비
  2. 모델이 의 관계를 학습
  3. 결과를 모르는 새로운 사례의 를 모델에 입력
  4. 모델이 새로운 사례의 결과를 예측
  5. 실제 결과가 확인되면 예측과 비교

회귀

  • 회귀(regression): 연속적인 숫자를 예측하는 지도학습 문제
  • 평가의 핵심: 실제값과 예측값의 차이
  • 차이를 최소화 하는 방향으로 학습

예시:

  • 주거 조건으로 만족도 점수 예측
  • 공부 시간과 출석 기록으로 시험 점수 예측
  • 주택 특성으로 가격 예측
  • 기온과 이용자 수로 전력 사용량 예측

분류

  • 분류(classification): 미리 정한 범주 중 하나를 예측하는 지도학습 문제
  • 평가의 핵심: 실제 범주와 예측한 범주의 일치 여부
  • 범주를 0이나 1처럼 숫자로 표시하더라도, 범주를 예측하는 문제이면 분류

예시:

  • 장치 상태 특징을 바탕으로 정상/고장 예측
  • 학습 기록으로 강의 완주/포기 예측
  • 고객 행동으로 선호 상품 유형 예측
  • 이메일 내용으로 스팸 여부 예측
Previous
결측치 처리