logo

지도 학습과 강화 학습의 차이

지도 학습

  • X에서 Y를 예측하는 문제.
  • X와 Y가 모두 있는 데이터가 필요
  • Y에 대한 예측 오차를 줄이는 것이 목표
  • 바둑) 현재 상황(X)에서 프로 기사들의 다음 수(Y)를 학습
  • 투자) 기업의 정보(X)에서 주가(Y)를 학습

강화 학습

  • 데이터 대신 직접 시행 착오
  • 행동으로 인한 보상을 최대화하는 것이 목표
  • 바둑) 현재 상황(S)에서 다음 수(A)를 시행착오를 통해 학습
  • 투자) 기업의 정보(X)에서 매수/매도/보유(A)를 시행착오를 통해 학습

학습에 주어지는 정보량

자기지도학습, 지도학습, 강화학습에 주어지는 정보량을 케이크에 비유한 그림

  • 자기지도학습(self-supervised learning): 입력의 일부로 다른 부분을 예측
    • 대규모 데이터 자체에서 풍부한 학습 신호 생성
  • 지도학습(supervised learning): 입력마다 사람이 제공한 정답
    • 분류 라벨이나 목표값을 직접 비교
  • 강화학습(reinforcement learning): 일부 시점에 주어지는 보상
    • 지도학습이나 자기지도학습보다 적고 늦게 주어짐
    • 신용 할당: 어떤 행동이 나중의 보상에 기여했는지 판단해야 하는 문제
    • 탐색: 보상을 얻을 행동을 직접 찾아야 하는 문제

퀴즈

문제 1 / 3맞음: 0힌트: 0틀림: 0채점중: 0남음: 3

지도 학습과 비교할 때 강화 학습의 특징은 무엇입니까?

  • ○행동을 직접 시도하고 보상을 받으며 학습한다.
  • ○입력마다 주어진 정답을 보고 학습한다.
  • ○정답과 예측값의 오차만 줄이며 학습한다.
  • ○행동을 시도하지 않고 정답을 예측하며 학습한다.

퀴즈를 풀려면 대화형 기능을 불러와야 합니다.

Previous
강화학습이란 무엇인가