지도 학습과 강화 학습의 차이
지도 학습
- X에서 Y를 예측하는 문제.
- X와 Y가 모두 있는 데이터가 필요
- Y에 대한 예측 오차를 줄이는 것이 목표
- 바둑) 현재 상황(X)에서 프로 기사들의 다음 수(Y)를 학습
- 투자) 기업의 정보(X)에서 주가(Y)를 학습
강화 학습
- 데이터 대신 직접 시행 착오
- 행동으로 인한 보상을 최대화하는 것이 목표
- 바둑) 현재 상황(S)에서 다음 수(A)를 시행착오를 통해 학습
- 투자) 기업의 정보(X)에서 매수/매도/보유(A)를 시행착오를 통해 학습
학습에 주어지는 정보량

- 자기지도학습(self-supervised learning): 입력의 일부로 다른 부분을 예측
- 대규모 데이터 자체에서 풍부한 학습 신호 생성
- 지도학습(supervised learning): 입력마다 사람이 제공한 정답
- 분류 라벨이나 목표값을 직접 비교
- 강화학습(reinforcement learning): 일부 시점에 주어지는 보상
- 지도학습이나 자기지도학습보다 적고 늦게 주어짐
- 신용 할당: 어떤 행동이 나중의 보상에 기여했는지 판단해야 하는 문제
- 탐색: 보상을 얻을 행동을 직접 찾아야 하는 문제
퀴즈
지도 학습과 비교할 때 강화 학습의 특징은 무엇입니까?
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.