강화학습
섹션
6개
강의
32개
커리큘럼
6개 섹션, 32개 강의
1
문서
1.1
실습 및 Q&A
2
1일차 - 기본 개념
2.1
시작하기
2.2
강화학습이란 무엇인가
2.3
에이전트
2.4
기본 용어
2.5
환경
2.6
gymnasium
2.7
할인
2.8
가치
3
2일차 - 추정과 탐색
3.1
동적 계획법
3.2
부트스트랩
3.3
가치 반복과 정책 반복
3.4
MAB
3.5
입실론 탐욕법
3.6
몬테카를로
4
3일차 - 제어와 딥러닝
4.1
시간차 학습
4.2
제어 문제
4.3
Q 학습
4.4
딥러닝
5
4일차 - 심층 강화학습
5.1
가치 기반 강화 학습
5.2
경험 리플레이
5.3
정책 경사
5.4
Actor-Critic
6
5일차 - 최근 동향
6.1
[사례] 선박 제어
6.2
PPO
6.3
GRPO
6.4
off-policy 정책 경사
6.5
알파고
6.6
다른 방법들
6.7
챗봇
6.8
문제점
6.9
강화학습의 적용 분야 예시