목록 보기
LLM 쉽고 빠르게 서빙하기
데브옵스

LLM 쉽고 빠르게 서빙하기

토스
토스
2024년 11월 26일

두줄요약

LLM을 서비스에 적용할 때의 속도와 서빙 복잡도를 줄이는 방법을 소개했습니다. vllm, Triton, Kserve를 활용해 쉽게 배포하고 운영하는 흐름을 정리했습니다.

핵심 내용

  • LLM 학습 이후 실제 서비스 적용 단계의 병목 정리
  • 추론 속도 개선을 위한 KV cache, paged KV cache, kernel fusion 등 활용
  • vllm과 Triton Inference Server 선택 기준으로 정량 지표, 사용성, 모델 지원 범위 비교
  • K8s 기반 배포 복잡도를 줄이기 위한 공용 Docker 이미지, Kserve, 단일 YAML 서빙 흐름 구축

적용해볼 점

  • TPS, TTFT 중심의 런타임 비교 기준 수립
  • 모델·배포 지식이 적어도 서빙 가능한 공통화된 인프라 구성
  • 로그·대시보드 기반 운영으로 신규 모델 테스트와 벤치마크 환경 확보

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...