logo

강화학습이란 무엇인가

강화 학습 Reinforcement Learning

  • 행위자는 환경과 상호작용
  • 행위자의 행동()에 따라 보상이 주어짐
  • 수익(): 보상을 장기간에 걸쳐 누적한 것
  • 행위자는 현재 상태()에서 앞으로 수익이 가장 큰 행동을 내는 정책()을 찾아야 함

행위자와 환경의 상호작용 다이어그램

강화 학습 예시

  • 게임 인공지능: 게임 환경에서 스스로 학습하여 최적의 전략을 수행(예: AlphaGo)
  • 로봇 제어: 로봇이 다양한 환경에서 최적의 행동을 학습
  • 자율 주행: 자율 주행 차량이 주행 상황에 맞춰 최적의 경로를 선택

알파고 경기 장면

지도 학습과 강화 학습의 차이

지도 학습

  • X에서 Y를 예측하는 문제.
  • X와 Y가 모두 있는 데이터가 필요
  • Y에 대한 예측 오차를 줄이는 것이 목표
  • 바둑) 현재 상황(X)에서 프로 기사들의 다음 수(Y)를 학습
  • 투자) 기업의 정보(X)에서 주가(Y)를 학습

강화 학습

  • 데이터 대신 직접 시행 착오
  • 행동으로 인한 보상을 최대화하는 것이 목표
  • 바둑) 현재 상황(S)에서 다음 수(A)를 시행착오를 통해 학습
  • 투자) 기업의 정보(X)에서 매수/매도/보유(A)를 시행착오를 통해 학습

강화학습의 짧은 역사

  • 학습 심리학: 동물의 시행 착오와 보상-처벌을 통한 학습에 "강화"라는 용어를 사용
  • 인공지능: 지도학습과 강화학습의 혼동 -> 점차 심리학적 의미의 강화학습을 구분
  • 최적 제어: Richard Bellman의 벨만 방정식, MDP -> 학습X
  • 시간차 학습을 중심으로 위의 세 가지 분야가 융합
  • 1990년대부터 인공신경망을 강화학습에 사용
  • 2010년대 심층강화학습이 컴퓨터 게임, 바둑 등에서 성과
  • 2020년대 심층강화학습이 챗GPT의 개발 등에 활용

강화학습에 대한 높아지는 관심

NeurIPS 2025 논문 임베딩 지도에서 보이는 강화학습 연구 관심

How Much Information is the Machine Given during Learning?

기계학습 방식별 제공 정보량 비교

강화 학습의 인접 분야

최적 제어, 운영 과학, 강화학습의 인접 분야 다이어그램

컴퓨터 게임

컴퓨터 게임 강화학습 성능 비교 차트

아타리 게임 화면

다양한 활용 분야

에너지

에너지 분야 강화학습 활용 예시

로봇

로봇 분야 강화학습 활용 예시

협동

협동 환경 강화학습 활용 예시

강화학습을 이용한 반도체 설계

강화학습 에이전트가 칩 블록 배치를 수행하는 과정

반도체 설계에서 강화학습 성능 비교 차트

  • 더 많은 데이터로 더 오래 학습시키면 성능이 향상됨(낮을 수록 높은 성능)

강화학습을 통한 핵융합 플라즈마 제어

강화학습을 통한 핵융합 플라즈마 제어 결과

코로나 19 테스트

코로나 19 테스트 의사결정 흐름

ChatGPT

ChatGPT 개발 과정에서의 강화학습 활용 흐름

강화 학습 실패 사례

Previous
시작하기