logo

주의 메커니즘

대규모 언어모델의 기본 구조

transformer-slide31-architecture

  • 트랜스포머(Transformer): 주의 메커니즘만을 사용한 Seq2Seq 모형

    • 문장 내에 주의 메커니즘 적용
    • 문장 간에도 주의 메커니즘 적용
  • GPT는 트랜스포머에서 자연어 생성을 담당하는 디코더만을 사용한 모형

    • BERT는 자연어 이해를 담당하는 인코더만 사용

토큰, 임베딩, 어텐션

  • 토큰을 벡터로 표현한 것
  • 벡터 = 공간 상의 좌표
    • 의미가 비슷한 토큰은 공간에서 가까운 벡터로 배치되는 경향
  • 어텐션(attention): 주의 메커니즘. 현재 토큰과 비슷한 토큰에 가중치를 주어 처리

transformer-slide32-embedding

주의 메커니즘 attention mechanism

  • 번역의 예: I am a student → 나는 학생입니다
  • 각 처리 단계에서 필요한 정보는 제한적
    • 영어가 "I"로 시작하면, 한국어는 "나"로 시작
  • 주의 메커니즘의 처리 방식:
    • 이전의 모든 단계의 출력과 현재의 처리 단계에 값을 비교
    • 비슷한 정도에 따라 주의 가중치를 계산
    • 이전 단계의 출력 × 주의 가중치 → 현재 처리 단계에 반영
    • 현재 처리 단계에 필요한 이전 단계의 출력 값이 많이 반영됨

transformer-slide33-attention-mechanism

트랜스포머의 주의 메커니즘

transformer-slide34-attention-detail

Previous
디코딩