
AI
LLM 기반 서비스의 부하테스트
두줄요약
LLM 서비스는 TTFT, ITL, 토큰 처리량 같은 지표로 부하테스트해야 합니다.\nvLLM 예제를 통해 병목과 네트워크 문제를 점검하고 사용자 체감 성능을 개선할 수 있습니다.
핵심 내용
- LLM 기반 서비스는 기존 웹 서비스와 달리 TTFT, ITL, 토큰 처리량, 요청 처리량 같은 지표로 부하테스트 필요
- vLLM의 benchmark_serving.py로 동시 요청 수와 데이터셋을 지정해 성능 측정 가능
- 평균값, P99, TTFT와 ITL 차이를 함께 보며 네트워크·시스템 병목 점검 필요
- 사용자 체감 성능 최적화를 위해 스트리밍 응답 특성에 맞춘 해석 중요
적용해볼 점
- 평균 100토큰 응답 기준 TTFT와 ITL로 최종 응답 시간 추정
- P99 급증 시 시스템 구성과 네트워크 환경 추가 확인
- 서비스 운영 전 LLM 전용 Metric 기반 부하테스트 습관화
