강화학습
문서
실습 및 Q&A
1일차 - 기본 개념
시작하기
강화학습이란 무엇인가
에이전트
기본 용어
환경
gymnasium
할인
가치
2일차 - 추정과 탐색
동적 계획법
부트스트랩
가치 반복과 정책 반복
MAB
입실론 탐욕법
몬테카를로
3일차 - 제어와 딥러닝
시간차 학습
제어 문제
Q 학습
딥러닝
4일차 - 심층 강화학습
가치 기반 강화 학습
경험 리플레이
정책 경사
Actor-Critic
5일차 - 최근 동향
[사례] 선박 제어
PPO
GRPO
off-policy 정책 경사
알파고
다른 방법들
챗봇
문제점
강화학습의 적용 분야 예시
강화학습
시작하기
시작하기
Previous
실습 및 Q&A
Next
강화학습이란 무엇인가