환경
- 행위자를 둘러싼 모든 것
- 문제와 관련된 변수들의 집합을 가짐
- 상태 공간(state space): 변수들의 모든 값의 조합
- 관찰: 행위자가 특정 시점에 얻을 수 있는 변수들의 집합
- 관찰 공간: 관찰할 수 있는 변수들의 모든 값의 조합
- 행동 공간: 행위자가 취할 수 있는 모든 행동의 집합
환경의 구조
- 전이
- 상태
- 보상
- 다음 상태
- 행동
- 관찰, 보상
- 환경
- 행위자가 행동을 선택
- 현재 환경의 상태와 행위자의 행동이 다음 상태와 보상에 영향
- 다음 상태로 전이
- 새로운 상태와 보상 중 일부가 행위자로 전달
- 행위자가 새로운 상태의 일부를 관찰하고 보상을 받음

전이 함수 transition function
- 행동에 대한 반응으로 상태의 변화를 나타내는 함수
- 결정론적(deterministic) 전이 함수: 같은 상태에 같은 행동을 하면 항상 같은 다음 상태로 전이
- 확률론적(stochastic) 전이 함수: 같은 상태에 같은 행동을 하면 일정한 확률에 따라 다음 상태로 전이
- 결정론적 전이 함수는 각 상태-행동 쌍에서 특정 다음 상태의 전이 확률이 1인 확률론적 전이 함수로 볼 수 있음
마코프 결정과정
- 강화학습에서는 환경이 마코프 특성을 가지는 것으로 가정
- 현재 상태와 행동이 주어졌을 때, 전이 확률은 이전 상태들에 독립
- 기억이 없음(memoryless)
P(St+1∣St,At)=P(St+1∣St,At,St−1,At−1,…)
- 현실에서는 성립하지 않을 수도 있지만, 단순성을 위한 가정
- 마코프 결정 과정(Markov Decision Process, MDP)로 모델링
- (상태, 행동, 전이확률, 보상, 할인)으로 정의된 과정
- POMDP(Partially Observable MDP): 일부 변수만 관찰할 수 있는 경우
보상 함수 reward function
- 행동에 대한 반응으로 주어지는 보상에 대한 함수
- 모델: 전이 함수와 보상 함수에 대한 집합
- 강화학습에서는 전이 함수와 보상 함수가 불변하는 것으로 가정
상태의 종류
- 시작(starting) 상태/초기(initial) 상태:
- 흡수(absorbing)/종료(terminal) 상태
- 종료 상태는 항상 종료 상태로만 전이
- 종료 상태에서 종료 상태로 전이에는 보상이 없음
상호작용
- 타임 스텝(time step): 행위자와 환경의 상호작용 시간 간격(예: 1초, 1턴, 1일 등)
- 경험 튜플(experience tuple): 타임 스텝마다 (관찰, 행동, 보상, 새로운 관찰)의 순서쌍
- 에피소드(episode): 시작부터 끝까지 타임 스텝
- 수익(return): 에피소드에서 얻어진 보상의 합계
계획 지평 planning horizon
- 행위자가 계획을 세우는 범위
- 유한 지평: 행위자가 유한한 스텝 안에 종료된다는 전제로 계획을 하는 경우
- 탐욕(greedy) 지평: 행위자가 1 스텝 후에 종료되는 걸로 전제하는 경우
- 무한 지평: 시행이 무한히 계속된다는 전제로 계획을 하는 경우