목록 보기
생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙
AI

생성형 AI 기반 실시간 검색 결과 재순위화 2편 - LLM 서빙

네이버 D2
네이버 D2
2024년 9월 24일

두줄요약

대규모 검색 재순위화를 위해 LLM 서빙 프레임워크와 최적화 방법을 비교하고, TRT-LLM과 Triton 조합을 채택했습니다. 양자화, 배치 조절, OpenTelemetry와 대시보드로 성능과 운영 가시성을 함께 확보했습니다.

문제 상황

  • 대규모 트래픽의 통합검색에서 재순위화용 LLM을 안정적으로 서빙해야 하는 요구
  • 제한된 GPU 리소스 안에서 품질, 응답 속도, 처리량, SLO를 함께 만족해야 하는 상황

원인 분석

  • 기존 일반 서빙 프레임워크만으로는 GPU 추론 최적화와 운영 안정성 확보가 어려움
  • 모델 자체 성능뿐 아니라 서빙 프레임워크, 배치 방식, 관측성까지 함께 맞춰야 하는 구조

해결 방법

  • GPU 서빙에 최적화된 프레임워크를 비교한 뒤 TRT-LLM과 Triton 조합을 채택
  • 양자화와 배치 크기 조절로 처리량 개선, 동적 배치는 초기 성능 저하 가능성 때문에 제외
  • 처리량, p99 응답 속도, GPU 사용률을 중심으로 모니터링하고 OpenTelemetry와 대시보드를 구성

성능/운영 포인트

  • Triton의 배치 관련 지표와 pod 단위 관측으로 이상 동작 탐지
  • GPU 사용률을 최대 가용량 기준으로 관리하고 Too Many Requests로 과부하를 제한
  • 반복 작업 자동화를 위한 Kubeflow 파이프라인과 LLM 기반 자동 평가 도입 검토

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...