logo

언어 모델

언어 모형

  • 언어 모형: 문장의 확률을 계산하기 위한 모형
  • 예) 밥을 먹었다 vs. 밥을 마셨다
    • 한국어를 모국어로 하는 사람이라면 전자가 "자연스럽다"라고 느낌
    • 이것을 수치(=확률)로 계산하는 것이 언어 모형
  • 좀 더 단순하게는 주어진 문장의 다음에 나올 단어를 예측하는 형태로 만들 수 있음

slide_08_image_01 그림 출처: https://writings.stephenwolfram.com/2023/02/what-is-chatgpt-doing-and-why-does-it-work/

토큰 Token

  • 토큰(Token): 언어 모형이 입력/출력을 처리하는 단위
  • 단어보다 작은 단위의 준단어(subword)를 토큰으로 사용
    • LLM이 글자 수 세기를 잘 못하는 이유 token

LLM vs. 검색

  • LLM이 하는 일: 언어 자료에서 패턴을 학습
  • 검색이 하는 일: 특정 자료를 찾아낸다 llm-retrieval

모형과 파라미터

  • 모형(model): 데이터의 패턴을 나타내는 수식이나 프로그램
    • 예시: 2차 함수
  • 파라미터(parameter): 모형의 구체적 형태를 결정하는 수치
    • 파라미터가 많을 수록 더 복잡한 패턴을 나타낼 수 있음

근사 approximation

  • 언어적 패턴의 구체적인 수식으로 만드는 것은 어려움
  • 아이디어:
    • 단순한 수식을 여러 번 겹쳐서(=deep learning)
    • 어떤 수식이든지 비슷하게 만들 수 있게 한다(=universal approximator)
  • 파라미터가 많을 수록 더 복잡한 패턴을 비슷하게 만들 수 있음
  • 언어 모델의 학습: 대량의 언어 데이터로부터 그 패턴을 비슷하게 만들 수 있는 파라미터를 추정하는 것

AI 모델의 파라미터

slide_13_image_01 그림 출처: Artificial Intelligence Index Report 2026

AI 모델의 데이터셋 크기

slide_14_image_01 그림 출처: Artificial Intelligence Index Report 2026

Previous
생성형 AI