
데브옵스
LLM 쉽고 빠르게 서빙하기
두줄요약
LLM을 서비스에 적용할 때의 속도와 서빙 복잡도를 줄이는 방법을 소개했습니다. vllm, Triton, Kserve를 활용해 쉽게 배포하고 운영하는 흐름을 정리했습니다.
핵심 내용
- LLM 학습 이후 실제 서비스 적용 단계의 병목 정리
- 추론 속도 개선을 위한 KV cache, paged KV cache, kernel fusion 등 활용
- vllm과 Triton Inference Server 선택 기준으로 정량 지표, 사용성, 모델 지원 범위 비교
- K8s 기반 배포 복잡도를 줄이기 위한 공용 Docker 이미지, Kserve, 단일 YAML 서빙 흐름 구축
적용해볼 점
- TPS, TTFT 중심의 런타임 비교 기준 수립
- 모델·배포 지식이 적어도 서빙 가능한 공통화된 인프라 구성
- 로그·대시보드 기반 운영으로 신규 모델 테스트와 벤치마크 환경 확보