
AI
연간 LLM 호출 비용 25% 절감, 인턴이 도전한 시맨틱 캐싱 도입 기록
두줄요약
시맨틱 캐싱을 도입해 채팅 AI 메시지 추천의 LLM 호출 비용을 크게 줄인 사례를 소개했습니다. 오프라인과 온라인 검증을 통해 약 25% HIT 비율과 연간 2억 원대 절감 효과를 확인했습니다.
문제 상황
- 채팅 AI 메시지 추천 기능에서 LLM 호출 트래픽과 비용이 과도하게 높아 연간 약 8~9억 원 수준의 부담 발생
- 중고거래 채팅처럼 반복되지만 표현이 다른 문장이 많아 단순 문자열 캐싱만으로는 비용 절감 한계
원인 분석
- 동일 문장 일치 기반 캐시는 의미는 같지만 표현이 다른 요청을 재사용하지 못함
- 실시간 채팅 트래픽 특성상 LLM 호출이 빈번해 임베딩 생성과 유사도 판별 구조가 필요
해결 방법
- 문장 의미 유사도를 코사인 유사도 등으로 판단하는 시맨틱 캐싱 도입
- 메인 서버와 분리된 add-on 서버를 gRPC로 연결하고, 임베디드 벡터 DB와 수평 확장 구조 적용
- 채팅 발화 데이터를 전처리해 PCA, DBSCAN으로 대표 문장 군집을 만들고 캐싱 셋 구성
성능/운영 포인트
- 오프라인 테스트에서 유사도 임계값 0.65 기준 캐시 HIT 비율 29.55% 확인
- 온라인 테스트에서 약 25% HIT 비율과 연간 약 2.16억 원 절감 효과 확인
- 임베딩 생성 병목은 Kubernetes Replica 확장으로 완화