logo

RLHF

언어 모델 정렬

  • 인간 피드백을 이용한 강화학습(Reinforcement Learning from Human Feedback, RLHF): 언어 모델의 출력을 사람의 선호에 맞추는 방법

시범 답변 수집, 보상 모델 학습, PPO 정책 최적화로 이어지는 RLHF 학습 과정

  1. 지도 미세 조정: 사람이 작성한 시범 답변으로 초기 정책을 학습
  2. 보상 모델 학습: 여러 답변에 대한 사람의 선호 순위로 보상 모델을 학습
  3. 정책 최적화: 보상 모델의 점수가 높아지도록 근접 정책 최적화(Proximal Policy Optimization, PPO)로 언어 모델을 갱신
  • 행동: 한 번에 고르는 버튼이 아니라 순서대로 생성하는 토큰
  • 보상 모델: 완벽한 정답 판정기가 아니라 수집된 사람의 선호를 근사한 모델

퀴즈

문제 1 / 1맞음: 0힌트: 0틀림: 0채점중: 0남음: 1

RLHF에서 보상 모델을 학습하는 데 사용하는 정보는 무엇입니까?

  • ○여러 답변에 대한 사람의 선호 순위
  • ○모든 질문의 유일한 정답
  • ○언어 모델이 생성한 토큰의 개수만
  • ○컴퓨터 게임의 점수

퀴즈를 풀려면 대화형 기능을 불러와야 합니다.

Previous
다른 방법들