logo

ChatGPT의 학습 과정

강화 학습 Reinforcement Learning

  • 행위자는 환경과 상호작용
  • 행위자의 행동()에 따라 보상이 주어짐
  • 수익(): 보상을 장기간에 걸쳐 누적한 것
  • 행위자는 현재 상태()에서 앞으로 수익이 가장 큰 행동을 내는 정책()을 찾아야 함
  • ① 관찰
  • ② 행동
  • ③ 보상

자연어 생성에서 강화학습의 필요성

  • 언어 모형은 확률이 높은 단어를 예측하는 방식
  • 확률이 높은 문장을 생성할 경우 생기는 문제
  • 사람의 말은 확률이 높은 문장과 낮은 문장이 섞여 있음
  • 비슷한 말을 반복하는 경향
  • 사용자의 선호를 반영하지 못함
  • 기존 데이터와 비슷한 문장만을 생성
  • 강화 학습으로 위의 문제들을 해결할 수 있음

ChatGPT 훈련 1단계: SFT 모델

  • 1만3천개의 지시 프롬프트
  • 인간 작업자가 무작위로 추출된 지시 프롬프트에 대해 답변
  • 인간 답변 데이터를 GPT에 미세 조정
  • SFT (supervised fine-tuning) 모델

ChatGPT 훈련 2단계: 보상 모델

  • SFT 모델을 이용해 동일한 프롬프트에 대해 다양한 답변을 생성
  • 생성된 답변에 대해 사람이 선호도를 표시
  • 사람의 선호도 데이터를 바탕으로, 선호도를 예측하는 보상 모델을 학습

ChatGPT 훈련 3단계: 강화학습

  • 새로운 프롬프트를 GPT에 제시
  • GPT가 생성한 답변을 보상 모델로 평가
  • GPT를 업데이트할 때마다 생성하는 답변이 달라지므로, 사람이 매번 평가하면 GPT를 빨리 업데이트할 수 없음
  • 보상이 높아지는 방향(=사람들이 선호할 것으로 예측되는 방향)으로 GPT를 강화학습

Human Feedback의 한계

  • AlphaGo: 실제 게임 승리라는 명확한 보상 함수로 학습
  • RLHF: 인간의 주관적인 평가에 기반한 보상 모델 사용
  • 부정확한 보상 신호: 실제 목표가 아닌 인간의 주관적인 평가를 프록시로 사용, "vibe check"에 불과
  • 보상 모델의 취약성: 모델이 보상 모델의 취약점을 악용하는 방향으로 최적화됨
  • 학습 데이터 분포를 벗어난 이상한 출력으로 높은 보상을 얻을 수 있음
  • RLHF가 여전히 유용한 이유:
  • 생성자-판별자 격차 활용: 인간이 답을 직접 작성하는 것보다 여러 답안 중 선택하는 것이 더 쉬움
  • 환각(hallucination) 완화에 도움: 보상 모델이 사실과 다른 내용을 낮은 점수로 평가

여러 가지 벤치마크

  • AIME / FrontierMath / HMMT: 대학 수준을 넘어서는 최고난도 수학 경시 대회 문제 해결 능력
  • CharXiv-Reasoning: 과학/기술 논문(arXiv)의 복잡한 도표를 이해하고 추론하는 능력
  • GPQA: 전문가도 검색 없이는 풀기 어려운 최상위 '구글 방지(Google-Proof)' 질문에 답하는 능력
  • HealthBench: 의료 및 헬스케어 분야의 전문 지식과 임상 추론
  • Humanity's Last Exam 다학제적이고 매우 어려운 종합 시험
  • MMMU 이미지, 도표, 텍스트를 동시에 이해하고 여러 학문 분야에 걸쳐 질문에 답하는 멀티모달 능력
  • SWE-bench Verified: 실제 깃허브(GitHub) 저장소의 이슈를 자율적으로 해결하는 실용적 소프트웨어 엔지니어링 능력
  • Aider Polyglot 여러 프로그래밍 언어를 넘나들며 복합적인 코딩 작업을 수행하는 능력
  • COLLIE: 지시에 따라 작문하는 능력

Humanity's Last Exam 예시

  • 다음은 원래 묘비에서 발견된 로마 비문을 나타낸 것입니다. 팔미라 문자의 번역을 제공해 주십시오.
  • 본문의 음역은 다음과 같습니다: RGYNᵓ BT ḤRY BR ᶜTᵓ ḤBL

AI가 수행할 수 있는 작업의 길이

  • 인간이 수행하는데 걸리는 시간 기준, 같은 작업을 50% 성공률로 달성할 수 있는지
  • 평균 7개월마다 2배씩 길어지고 있음
  • 해당 추세가 계속될 경우 2~4년 내에 1주일치 작업을 수행할 수 있게 될 것