logo

환경

환경

  • 행위자를 둘러싼 모든 것
  • 문제와 관련된 변수들의 집합을 가짐
  • 상태 공간(state space): 변수들의 모든 값의 조합
  • 관찰: 행위자가 특정 시점에 얻을 수 있는 변수들의 집합
  • 관찰 공간: 관찰할 수 있는 변수들의 모든 값의 조합
  • 행동 공간: 행위자가 취할 수 있는 모든 행동의 집합

환경의 구조

  • 전이
  • 상태
  • 보상
  • 다음 상태
  • 행동
  • 관찰, 보상
  • 환경
  • 행위자가 행동을 선택
  • 현재 환경의 상태와 행위자의 행동이 다음 상태와 보상에 영향
  • 다음 상태로 전이
  • 새로운 상태와 보상 중 일부가 행위자로 전달
  • 행위자가 새로운 상태의 일부를 관찰하고 보상을 받음

행위자의 행동에 따라 환경이 다음 상태와 보상으로 전이되는 구조

전이 함수 transition function

  • 행동에 대한 반응으로 상태의 변화를 나타내는 함수
  • 결정론적(deterministic) 전이 함수: 같은 상태에 같은 행동을 하면 항상 같은 다음 상태로 전이
  • 확률론적(stochastic) 전이 함수: 같은 상태에 같은 행동을 하면 일정한 확률에 따라 다음 상태로 전이
  • 결정론적 전이 함수는 각 상태-행동 쌍에서 특정 다음 상태의 전이 확률이 1인 확률론적 전이 함수로 볼 수 있음

마코프 결정과정

  • 강화학습에서는 환경이 마코프 특성을 가지는 것으로 가정
  • 현재 상태와 행동이 주어졌을 때, 전이 확률은 이전 상태들에 독립
  • 기억이 없음(memoryless)
  • 현실에서는 성립하지 않을 수도 있지만, 단순성을 위한 가정
  • 마코프 결정 과정(Markov Decision Process, MDP)로 모델링
    • (상태, 행동, 전이확률, 보상, 할인)으로 정의된 과정
  • POMDP(Partially Observable MDP): 일부 변수만 관찰할 수 있는 경우

보상 함수 reward function

  • 행동에 대한 반응으로 주어지는 보상에 대한 함수
  • 모델: 전이 함수와 보상 함수에 대한 집합
  • 강화학습에서는 전이 함수와 보상 함수가 불변하는 것으로 가정

상태의 종류

  • 시작(starting) 상태/초기(initial) 상태:
    • 행위자가 한 시행에서 처음에 갖는 상태들
  • 흡수(absorbing)/종료(terminal) 상태
    • 한 시행의 마지막 상태
  • 종료 상태는 항상 종료 상태로만 전이
  • 종료 상태에서 종료 상태로 전이에는 보상이 없음

상호작용

  • 타임 스텝(time step): 행위자와 환경의 상호작용 시간 간격(예: 1초, 1턴, 1일 등)
  • 경험 튜플(experience tuple): 타임 스텝마다 (관찰, 행동, 보상, 새로운 관찰)의 순서쌍
  • 에피소드(episode): 시작부터 끝까지 타임 스텝
  • 수익(return): 에피소드에서 얻어진 보상의 합계

계획 지평 planning horizon

  • 행위자가 계획을 세우는 범위
  • 유한 지평: 행위자가 유한한 스텝 안에 종료된다는 전제로 계획을 하는 경우
    • 탐욕(greedy) 지평: 행위자가 1 스텝 후에 종료되는 걸로 전제하는 경우
  • 무한 지평: 시행이 무한히 계속된다는 전제로 계획을 하는 경우
    • 실제로는 유한 스텝 후에 종료될 수도 있음
Previous
기본 용어