
AI
쉽게이해하는 GPT. 1편(다음단어 예측기. Base모델)
두줄요약
GPT를 다음 단어를 예측하는 모델로 쉽게 풀어 설명했습니다. Transformer 디코더만 사용하는 구조와 LLaMA 예시를 통해 Base Model 개념을 소개했습니다.
핵심 내용
- GPT를 이전 문맥으로 다음 단어를 예측하는 모델로 설명
- Transformer의 Decoder Only 구조를 통해 입력 문장을 바로 다음 토큰 예측에 활용하는 흐름 정리
- LLaMA 예시의 의사코드로 임베딩, 디코더 층, lm_head 구성과 Base Model 개념 소개
- 방대한 인터넷 텍스트로 사전학습된 LLM이 Base Model로 불린다는 점 정리
