logo

LLM이란 무엇인가

언어 모형 language models

  • GPT는 대형 언어 모형(Large Language Model, 약칭 LLM)
  • 언어 모형: 문장의 확률을 계산하기 위한 모형
  • 예) 밥을 먹었다 vs. 밥을 마셨다
  • 한국어를 모국어로 하는 사람이라면 전자가 "자연스럽다"라고 느낌
  • 이것을 수치(=확률)로 계산하는 것이 언어 모형

확률의 연쇄규칙

  • 결합 확률(joint probability): 이 동시에 발생할 확률
  • 예: 한 문장이 "밥"과 "먹다"로 구성될 확률
  • 조건부 확률(conditional probability): 이 주어졌을 때, 가 발생할 확률
  • 예: "밥"이라는 단어로 시작한 문장에서, 그 다음에 "먹다"가 나올 확률
  • 연쇄 규칙(chain rule): 결합확률은 조건부 확률의 곱으로 분해할 수 있음
  • 예: "밥"이라는 단어로 시작할 확률 × "밥" 다음에 "먹다"가 나올 확률

인과적 언어 모형 causal language models

  • 결합 확률 대신 조건부 확률 형태의 언어 모형
  • 일정한 텍스트()가 주어졌을 때, 다음에 나올 단어()의 확률을 계산하는 모형
  • 일반적으로 "언어 모형"이라고 하면, 이것을 가리킴
  • 인공신경망 등의 모형으로 구현하기 쉬움
  • 문장에 이어질 단어를 예측 → 단어를 순서대로 생성할 수 있음

언어 모형은 어떻게 텍스트를 생성하는가?

  • 이전의 문장을 바탕으로 다음에 나올 토큰(token)을 예측
  • 토큰: 처리의 단위(보통 자주 나오는 글자들을 묶은 준단어를 사용)
  • 예: AI is ____
  • GPT-2로 다음에 나올 토큰과 확률을 예측하면:
  • a (9.7%) / the (5.6%) / not (3.6%) / an (2.5%) / also (2.4%) / …
  • 디코딩: 언어 모형을 이용해 텍스트를 생성하는 방법
  • 결정론적 디코딩: 가장 확률이 높은 텍스트를 생성(예: AI is a …)
  • 확률적 디코딩: 확률에 따라 텍스트를 생성
  • (예: 0~1 사이에서 난수를 하나 추출 → 0.099가 추출되면 → AI is the …)