강화 학습 Reinforcement Learning
- 행위자는 환경과 상호작용
- 행위자의 행동(A)에 따라 보상이 주어짐
- 수익(G): 보상을 장기간에 걸쳐 누적한 것
- 행위자는 현재 상태(S)에서 앞으로 수익이 가장 큰 행동을 내는 정책(π)을 찾아야 함
π(S)=argAmaxE[G∣S,A]

강화 학습 예시
- 게임 인공지능: 게임 환경에서 스스로 학습하여 최적의 전략을 수행(예: AlphaGo)
- 로봇 제어: 로봇이 다양한 환경에서 최적의 행동을 학습
- 자율 주행: 자율 주행 차량이 주행 상황에 맞춰 최적의 경로를 선택

지도 학습과 강화 학습의 차이
지도 학습
- X에서 Y를 예측하는 문제.
- X와 Y가 모두 있는 데이터가 필요
- Y에 대한 예측 오차를 줄이는 것이 목표
- 바둑) 현재 상황(X)에서 프로 기사들의 다음 수(Y)를 학습
- 투자) 기업의 정보(X)에서 주가(Y)를 학습
강화 학습
- 데이터 대신 직접 시행 착오
- 행동으로 인한 보상을 최대화하는 것이 목표
- 바둑) 현재 상황(S)에서 다음 수(A)를 시행착오를 통해 학습
- 투자) 기업의 정보(X)에서 매수/매도/보유(A)를 시행착오를 통해 학습
강화학습의 짧은 역사
- 학습 심리학: 동물의 시행 착오와 보상-처벌을 통한 학습에 "강화"라는 용어를 사용
- 인공지능: 지도학습과 강화학습의 혼동 -> 점차 심리학적 의미의 강화학습을 구분
- 최적 제어: Richard Bellman의 벨만 방정식, MDP -> 학습X
- 시간차 학습을 중심으로 위의 세 가지 분야가 융합
- 1990년대부터 인공신경망을 강화학습에 사용
- 2010년대 심층강화학습이 컴퓨터 게임, 바둑 등에서 성과
- 2020년대 심층강화학습이 챗GPT의 개발 등에 활용
강화학습에 대한 높아지는 관심


강화 학습의 인접 분야

컴퓨터 게임


다양한 활용 분야
에너지

로봇

협동

강화학습을 이용한 반도체 설계


- 더 많은 데이터로 더 오래 학습시키면 성능이 향상됨(낮을 수록 높은 성능)
강화학습을 통한 핵융합 플라즈마 제어

코로나 19 테스트

ChatGPT

강화 학습 실패 사례