주의 메커니즘
대규모 언어모델의 기본 구조

-
트랜스포머(Transformer): 주의 메커니즘만을 사용한 Seq2Seq 모형
- 문장 내에 주의 메커니즘 적용
- 문장 간에도 주의 메커니즘 적용
-
GPT는 트랜스포머에서 자연어 생성을 담당하는 디코더만을 사용한 모형
- BERT는 자연어 이해를 담당하는 인코더만 사용
토큰, 임베딩, 어텐션
- 토큰을 벡터로 표현한 것
- 벡터 = 공간 상의 좌표
- 의미가 비슷한 토큰은 공간에서 가까운 벡터로 배치되는 경향
- 어텐션(attention): 주의 메커니즘. 현재 토큰과 비슷한 토큰에 가중치를 주어 처리

주의 메커니즘 attention mechanism
- 번역의 예: I am a student → 나는 학생입니다
- 각 처리 단계에서 필요한 정보는 제한적
- 영어가 "I"로 시작하면, 한국어는 "나"로 시작
- 주의 메커니즘의 처리 방식:
- 이전의 모든 단계의 출력과 현재의 처리 단계에 값을 비교
- 비슷한 정도에 따라 주의 가중치를 계산
- 이전 단계의 출력 × 주의 가중치 → 현재 처리 단계에 반영
- 현재 처리 단계에 필요한 이전 단계의 출력 값이 많이 반영됨

트랜스포머의 주의 메커니즘
