RLHF
언어 모델 정렬
- 인간 피드백을 이용한 강화학습(Reinforcement Learning from Human Feedback, RLHF): 언어 모델의 출력을 사람의 선호에 맞추는 방법

- 지도 미세 조정: 사람이 작성한 시범 답변으로 초기 정책을 학습
- 보상 모델 학습: 여러 답변에 대한 사람의 선호 순위로 보상 모델을 학습
- 정책 최적화: 보상 모델의 점수가 높아지도록 근접 정책 최적화(Proximal Policy Optimization, PPO)로 언어 모델을 갱신
- 행동: 한 번에 고르는 버튼이 아니라 순서대로 생성하는 토큰
- 보상 모델: 완벽한 정답 판정기가 아니라 수집된 사람의 선호를 근사한 모델
퀴즈
RLHF에서 보상 모델을 학습하는 데 사용하는 정보는 무엇입니까?
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.