AI
SageMaker AI로 해보는 GPT-OSS 추론 성능 테스트와 용량 산정
두줄요약
SageMaker AI에서 GPT-OSS 120B 추론 성능 테스트와 GPU 용량 산정 방법을 다뤘습니다. vLLM과 SGLang을 비교하며 워크로드별 성능 지표와 최적화 포인트를 정리했습니다.
핵심 내용
- SageMaker AI에서 GPT-OSS 120B의 추론 성능 테스트와 GPU 용량 산정 방법 정리
- LLM 추론의 프리필·디코드 구조, KV 캐시, 연속 배치, 페이지드 어텐션 등 최적화 기법 설명
- vLLM과 SGLang을 SageMaker 인스턴스에서 구동해 워크로드별 성능을 비교
- 모델 파라미터, KV 캐시, 활성화 메모리 기반의 GPU 메모리 산정 예시 제시
적용해볼 점
- 서비스 요구에 맞는 입력·출력 토큰 수와 동시 사용자 수를 기준으로 벤치마크 설계
- 프레임워크와 인스턴스 조합별 TTFT, ITL, TPS, Goodput 등 지표 비교
- 긴 입력과 대규모 모델 환경에서 청크드 프리필, 배치 크기 조정으로 성능 튜닝
