언어 모형 language models
- GPT는 대형 언어 모형(Large Language Model, 약칭 LLM)
- 언어 모형: 문장의 확률을 계산하기 위한 모형
- P(x1,x2,⋯,xn)
- 예) 밥을 먹었다 vs. 밥을 마셨다
- 한국어를 모국어로 하는 사람이라면 전자가 "자연스럽다"라고 느낌
- 이것을 수치(=확률)로 계산하는 것이 언어 모형
확률의 연쇄규칙
- 결합 확률(joint probability): x1과 x2이 동시에 발생할 확률
- P(x1,x2)
- 예: 한 문장이 "밥"과 "먹다"로 구성될 확률
- 조건부 확률(conditional probability): x1이 주어졌을 때, x2가 발생할 확률
- P(x2∣x1)
- 예: "밥"이라는 단어로 시작한 문장에서, 그 다음에 "먹다"가 나올 확률
- 연쇄 규칙(chain rule): 결합확률은 조건부 확률의 곱으로 분해할 수 있음
- P(x1,x2)=P(x1)P(x2∣x1)
- 예: "밥"이라는 단어로 시작할 확률 × "밥" 다음에 "먹다"가 나올 확률
인과적 언어 모형 causal language models
- 결합 확률 대신 조건부 확률 형태의 언어 모형
- P(xn∣x1,x2,⋯xn−1)
- 일정한 텍스트(x1,x2,⋯xn−1)가 주어졌을 때, 다음에 나올 단어(xn)의 확률을 계산하는 모형
- 일반적으로 "언어 모형"이라고 하면, 이것을 가리킴
- 인공신경망 등의 모형으로 구현하기 쉬움
- 문장에 이어질 단어를 예측 → 단어를 순서대로 생성할 수 있음
언어 모형은 어떻게 텍스트를 생성하는가?
- 이전의 문장을 바탕으로 다음에 나올 토큰(token)을 예측
- 토큰: 처리의 단위(보통 자주 나오는 글자들을 묶은 준단어를 사용)
- 예: AI is ____
- GPT-2로 다음에 나올 토큰과 확률을 예측하면:
- a (9.7%) / the (5.6%) / not (3.6%) / an (2.5%) / also (2.4%) / …
- 디코딩: 언어 모형을 이용해 텍스트를 생성하는 방법
- 결정론적 디코딩: 가장 확률이 높은 텍스트를 생성(예: AI is a …)
- 확률적 디코딩: 확률에 따라 텍스트를 생성
- (예: 0~1 사이에서 난수를 하나 추출 → 0.099가 추출되면 → AI is the …)