
AI
수식없이 GPT(트랜스포머) 이해하기. 1편
두줄요약
GPT의 핵심 구조인 트랜스포머 디코더와 Self Attention 흐름을 수식 없이 설명했습니다. 입력 벡터화부터 다음 단어 예측까지의 과정을 단계별로 정리했습니다.
핵심 내용
- GPT의 근간인 트랜스포머 디코더 구조를 수식 없이 설명
- 입력 텍스트가 임베딩과 위치 인코딩을 거쳐 Self Attention Block으로 들어가는 흐름 정리
- Masked Multi-Head Self Attention, Concat, Feed Forward Layer를 통해 크기 유지와 다음 단어 예측 과정 설명
구조와 흐름
- Text & Position Embedding으로 단어를 벡터화
- Query, Key, Value로 투영한 뒤 마스크드 어텐션으로 단어 간 관계 계산
- 여러 헤드를 결합하고 Feed Forward Layer를 거쳐 최종 출력 생성
주의할 점
- Self Attention 블록의 입출력 차원 동일성에 초점
- 마스크 처리로 미래 단어 정보를 가리는 점
- Feed Forward Layer는 비선형성과 가중치 추가를 위한 구성으로 설명
