생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙
AI
생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙
두줄요약
대규모 검색 재순위화를 위해 LLM 서빙 프레임워크와 최적화 방법을 비교하고, TRT-LLM과 Triton 조합을 채택했습니다. 양자화, 배치 조절, OpenTelemetry와 대시보드로 성능과 운영 가시성을 함께 확보했습니다.
문제 상황
- 대규모 트래픽의 통합검색에서 재순위화용 LLM을 안정적으로 서빙해야 하는 요구
- 제한된 GPU 리소스 안에서 품질, 응답 속도, 처리량, SLO를 함께 만족해야 하는 상황
원인 분석
- 기존 일반 서빙 프레임워크만으로는 GPU 추론 최적화와 운영 안정성 확보가 어려움
- 모델 자체 성능뿐 아니라 서빙 프레임워크, 배치 방식, 관측성까지 함께 맞춰야 하는 구조
해결 방법
- GPU 서빙에 최적화된 프레임워크를 비교한 뒤 TRT-LLM과 Triton 조합을 채택
- 양자화와 배치 크기 조절로 처리량 개선, 동적 배치는 초기 성능 저하 가능성 때문에 제외
- 처리량, p99 응답 속도, GPU 사용률을 중심으로 모니터링하고 OpenTelemetry와 대시보드를 구성
성능/운영 포인트
- Triton의 배치 관련 지표와 pod 단위 관측으로 이상 동작 탐지
- GPU 사용률을 최대 가용량 기준으로 관리하고 Too Many Requests로 과부하를 제한
- 반복 작업 자동화를 위한 Kubeflow 파이프라인과 LLM 기반 자동 평가 도입 검토
