
AI
AI 학습을 위한 LLM 스터디 - 배치 전략 및 어텐션 개선 방안
두줄요약
LLM 추론 효율을 높이기 위한 배치 전략과 어텐션 개선 방법을 정리한 글입니다. FlashAttention, 페이지 어텐션, 추측 디코딩의 개념과 장점을 설명했습니다.
핵심 내용
- LLM 추론 효율을 높이기 위한 배치 전략, 어텐션 최적화, 디코딩 개선 방법 정리
- 일반배치, 동적배치, 인-플라이트 배칭의 차이와 처리 방식 비교
- FlashAttention, RoPE, 커널 퓨전, 페이지 어텐션, 추측 디코딩의 개념과 장점 설명
적용해볼 점
- 긴 시퀀스와 작은 배치에서 메모리·처리량 병목을 줄이는 기법 검토
- KV 캐시 절감과 GPU 자원 활용 개선에 페이지 어텐션과 플래시어텐션 적용 가능성 확인
- 디코딩 속도 개선이 필요한 LLM 서비스에서 추측 디코딩 도입 가능성 검토
