강화학습의 시간 구조
상태의 종류
- 미로 예시: 로봇이 출발 칸에서 목표 칸을 찾아가는 과제
- 성공: 목표 칸에 도착
- 실패: 구멍에 빠짐
- 시작 상태(starting/initial state): 한 시행을 시작하는 상태
- 미로 예시: 로봇이 놓인 출발 칸
- 시작 조건: 항상 같은 칸에서 시작하거나, 정해진 범위에서 출발 칸을 무작위로 선택
- 흡수 상태(absorbing state): 도달한 뒤 자기 자신으로만 전이하는 상태
- 종료 상태(terminal state): 도달하면 한 시행이 끝나는 상태
- 흡수 상태로 표현될 수 있음
- 미로 예시: 목표 칸과 구멍
- 종료 의미: 성공과 실패 모두 종료 가능
상호작용
- 타임 스텝(time step): 행위자가 행동하고, 환경에서 다음 관찰과 보상을 받는 한 번의 상호작용
- 시간 단위: 과제에 따라 한 번의 이동, 한 턴, 1초, 1일 등으로 정의
- 미로 예시: 로봇이 이동 방향을 한 번 선택하고 결과를 확인하는 과정
- 경험 튜플(experience tuple): 한 타임 스텝의 관찰, 행동, 보상, 새로운 관찰을 묶은 것
- 구성: 현재 관찰 → 행동 → 보상과 다음 관찰
- 용도: 어떤 상황에서 어떤 행동을 했고, 어떤 결과를 얻었는지 기록
- 에피소드(episode): 시작 상태부터 종료 상태까지 이어지는 상호작용
- 미로 예시: 출발 칸에서 시작해 목표 칸에 도착하거나 구멍에 빠질 때까지의 진행
- 반복: 다음 에피소드에서는 시작 상태를 새로 정하고 다시 진행
한 에피소드의 예
- 관찰 조건: 로봇이 현재 위치를 정확히 확인 가능
- 보상 규칙: 목표 칸에 도착하면 +5, 그 외의 이동에는 −1
- 이동 비용: 돌아다니는 스텝 수가 늘수록 누적 비용 증가
| 스텝 | 현재 관찰 | 행동 | 보상 | 다음 관찰 |
|---|---|---|---|---|
| 1 | 출발 칸 | 오른쪽 이동 | −1 | 복도 |
| 2 | 복도 | 위쪽 이동 | −1 | 목표 앞 |
| 3 | 목표 앞 | 오른쪽 이동 | +5 | 목표 칸: 종료 |
- 타임 스텝: 표의 한 행에 해당하는 상호작용
- 경험 튜플: 각 행의 현재 관찰, 행동, 보상, 다음 관찰
- 에피소드: 세 스텝을 모두 묶은 한 번의 미로 진행
- 보상과 수익의 차이:
- 보상: 각 스텝에서 받은 −1, −1, +5
- 수익(return): 한 시점부터 이후에 받을 보상의 누적합
- 예시의 수익: 할인 없이 시작부터 종료까지 합산하면 −1−1+5=3
계속되는 과제
- 계속되는 과제: 상호작용에 자연스러운 종료가 없는 과제
- 냉방 예시: 쾌적한 온도에 도달한 뒤에도 계속 온도를 유지
- 에피소드형 과제와의 차이: 목표에 한 번 도달했다고 전체 과제가 끝나지는 않음
계획 지평
- 계획 지평(planning horizon): 행위자가 얼마나 먼 미래까지 고려하는지 나타내는 범위
- 유한 지평: 정해진 스텝 수까지의 결과를 고려
- 예: 앞으로 10스텝 동안 받을 보상을 고려해 현재 행동 선택
- 1스텝 지평: 다음 행동으로 바로 받을 보상만 고려
- 무한 지평: 정해진 마지막 스텝 없이 미래의 결과를 고려
- 냉방 예시: 온도 유지와 전력 비용을 계속 고려하는 제어
- 종료 상태가 있는 경우: 실제 시행은 끝나고, 그 이후는 보상 0인 흡수 상태로 표현 가능
지평에 따른 선택
- 갈림길 예시: 바로 보너스를 받는 막다른 길과, 당장 보너스는 없지만 목표로 이어지는 길 중 선택
- 1스텝 지평: 당장의 보너스만 보고 막다른 길을 선택할 가능성
- 긴 지평: 막다른 길에서 되돌아오는 이동 비용과 목표 도착 보상까지 고려
- 지평의 효과: 지금 행동이 나중에 가져올 이익과 비용을 어디까지 반영할지 결정
에피소드 길이와 지평
- 에피소드 길이: 실제로 종료까지 진행한 스텝 수
- 계획 지평: 행동을 선택할 때 고려하는 미래의 범위
- 미로 예시: 앞으로 10스텝을 고려하더라도, 3스텝 만에 목표에 도착하면 에피소드는 종료
- 구분: 계획에서 고려한 스텝 수와 실제로 진행한 스텝 수는 다를 수 있음
퀴즈
종료 상태는 무엇입니까?
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.