강화 학습 Reinforcement Learning
- 행위자는 환경과 상호작용
- 행위자의 행동(A)에 따라 보상이 주어짐
- 수익(G): 보상을 장기간에 걸쳐 누적한 것
- 행위자는 현재 상태(S)에서 앞으로 수익이 가장 큰 행동을 내는 정책(π)을 찾아야 함
- A=maxπ(S)
- ① 관찰
- ② 행동
- ③ 보상
자연어 생성에서 강화학습의 필요성
- 언어 모형은 확률이 높은 단어를 예측하는 방식
- 확률이 높은 문장을 생성할 경우 생기는 문제
- 사람의 말은 확률이 높은 문장과 낮은 문장이 섞여 있음
- 비슷한 말을 반복하는 경향
- 사용자의 선호를 반영하지 못함
- 기존 데이터와 비슷한 문장만을 생성
- 강화 학습으로 위의 문제들을 해결할 수 있음
ChatGPT 훈련 1단계: SFT 모델
- 1만3천개의 지시 프롬프트
- 인간 작업자가 무작위로 추출된 지시 프롬프트에 대해 답변
- 인간 답변 데이터를 GPT에 미세 조정
- SFT (supervised fine-tuning) 모델
ChatGPT 훈련 2단계: 보상 모델
- SFT 모델을 이용해 동일한 프롬프트에 대해 다양한 답변을 생성
- 생성된 답변에 대해 사람이 선호도를 표시
- 사람의 선호도 데이터를 바탕으로, 선호도를 예측하는 보상 모델을 학습
ChatGPT 훈련 3단계: 강화학습
- 새로운 프롬프트를 GPT에 제시
- GPT가 생성한 답변을 보상 모델로 평가
- GPT를 업데이트할 때마다 생성하는 답변이 달라지므로, 사람이 매번 평가하면 GPT를 빨리 업데이트할 수 없음
- 보상이 높아지는 방향(=사람들이 선호할 것으로 예측되는 방향)으로 GPT를 강화학습
Human Feedback의 한계
- AlphaGo: 실제 게임 승리라는 명확한 보상 함수로 학습
- RLHF: 인간의 주관적인 평가에 기반한 보상 모델 사용
- 부정확한 보상 신호: 실제 목표가 아닌 인간의 주관적인 평가를 프록시로 사용, "vibe check"에 불과
- 보상 모델의 취약성: 모델이 보상 모델의 취약점을 악용하는 방향으로 최적화됨
- 학습 데이터 분포를 벗어난 이상한 출력으로 높은 보상을 얻을 수 있음
- RLHF가 여전히 유용한 이유:
- 생성자-판별자 격차 활용: 인간이 답을 직접 작성하는 것보다 여러 답안 중 선택하는 것이 더 쉬움
- 환각(hallucination) 완화에 도움: 보상 모델이 사실과 다른 내용을 낮은 점수로 평가
여러 가지 벤치마크
- AIME / FrontierMath / HMMT: 대학 수준을 넘어서는 최고난도 수학 경시 대회 문제 해결 능력
- CharXiv-Reasoning: 과학/기술 논문(arXiv)의 복잡한 도표를 이해하고 추론하는 능력
- GPQA: 전문가도 검색 없이는 풀기 어려운 최상위 '구글 방지(Google-Proof)' 질문에 답하는 능력
- HealthBench: 의료 및 헬스케어 분야의 전문 지식과 임상 추론
- Humanity's Last Exam 다학제적이고 매우 어려운 종합 시험
- MMMU 이미지, 도표, 텍스트를 동시에 이해하고 여러 학문 분야에 걸쳐 질문에 답하는 멀티모달 능력
- SWE-bench Verified: 실제 깃허브(GitHub) 저장소의 이슈를 자율적으로 해결하는 실용적 소프트웨어 엔지니어링 능력
- Aider Polyglot 여러 프로그래밍 언어를 넘나들며 복합적인 코딩 작업을 수행하는 능력
- COLLIE: 지시에 따라 작문하는 능력
Humanity's Last Exam 예시
- 다음은 원래 묘비에서 발견된 로마 비문을 나타낸 것입니다. 팔미라 문자의 번역을 제공해 주십시오.
- 본문의 음역은 다음과 같습니다: RGYNᵓ BT ḤRY BR ᶜTᵓ ḤBL
AI가 수행할 수 있는 작업의 길이
- 인간이 수행하는데 걸리는 시간 기준, 같은 작업을 50% 성공률로 달성할 수 있는지
- 평균 7개월마다 2배씩 길어지고 있음
- 해당 추세가 계속될 경우 2~4년 내에 1주일치 작업을 수행할 수 있게 될 것