
AI
Amazon EKS에서vLLM Deep Learning Container를 사용하여LLM 배포하기
두줄요약
Amazon EKS에 vLLM DLC를 적용해 DeepSeek 모델을 배포하는 과정을 설명했습니다. EFA와 FSx for Lustre를 활용해 고성능 추론 환경을 구성했습니다.
핵심 내용
- Amazon EKS에서 vLLM Deep Learning Container를 사용해 DeepSeek-R1-Distill-Qwen-32B LLM 배포
- GPU 지원 P4d 인스턴스, EFA 네트워킹, FSx for Lustre 조합으로 고성능 추론 구성
- 사전 구성된 AWS DLC로 환경 설정, 종속성 관리, 성능 튜닝 복잡성 완화
구조와 흐름
- EKS 클러스터 생성 후 EFA 지원 노드 그룹 구성
- FSx for Lustre 파일 시스템과 CSI 드라이버로 모델 가중치 저장소 연결
- AWS Load Balancer Controller와 LeaderWorkerSet으로 vLLM 서버 외부 노출 및 분산 배포
성능/운영 포인트
- EFA로 노드 간 통신 지연 감소와 처리량 향상
- FSx for Lustre로 모델 로딩 속도 개선과 공유 저장소 제공
- ALB로 외부 접근, 라우팅, 인증, 로그 수집 등 운영 편의성 확보
