목록 보기
AI 학습을 위한 LLM 스터디 - 배치 전략 및 어텐션 개선 방안
AI

AI 학습을 위한 LLM 스터디 - 배치 전략 및 어텐션 개선 방안

데보션
데보션
2025년 2월 7일

두줄요약

LLM 추론 효율을 높이기 위한 배치 전략과 어텐션 개선 방법을 정리한 글입니다. FlashAttention, 페이지 어텐션, 추측 디코딩의 개념과 장점을 설명했습니다.

핵심 내용

  • LLM 추론 효율을 높이기 위한 배치 전략, 어텐션 최적화, 디코딩 개선 방법 정리
  • 일반배치, 동적배치, 인-플라이트 배칭의 차이와 처리 방식 비교
  • FlashAttention, RoPE, 커널 퓨전, 페이지 어텐션, 추측 디코딩의 개념과 장점 설명

적용해볼 점

  • 긴 시퀀스와 작은 배치에서 메모리·처리량 병목을 줄이는 기법 검토
  • KV 캐시 절감과 GPU 자원 활용 개선에 페이지 어텐션과 플래시어텐션 적용 가능성 확인
  • 디코딩 속도 개선이 필요한 LLM 서비스에서 추측 디코딩 도입 가능성 검토

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...