목록 보기
연간 LLM 호출 비용 25% 절감, 인턴이 도전한 시맨틱 캐싱 도입 기록
AI

연간 LLM 호출 비용 25% 절감, 인턴이 도전한 시맨틱 캐싱 도입 기록

당근마켓
당근마켓
2025년 7월 3일

두줄요약

시맨틱 캐싱을 도입해 채팅 AI 메시지 추천의 LLM 호출 비용을 크게 줄인 사례를 소개했습니다. 오프라인과 온라인 검증을 통해 약 25% HIT 비율과 연간 2억 원대 절감 효과를 확인했습니다.

문제 상황

  • 채팅 AI 메시지 추천 기능에서 LLM 호출 트래픽과 비용이 과도하게 높아 연간 약 8~9억 원 수준의 부담 발생
  • 중고거래 채팅처럼 반복되지만 표현이 다른 문장이 많아 단순 문자열 캐싱만으로는 비용 절감 한계

원인 분석

  • 동일 문장 일치 기반 캐시는 의미는 같지만 표현이 다른 요청을 재사용하지 못함
  • 실시간 채팅 트래픽 특성상 LLM 호출이 빈번해 임베딩 생성과 유사도 판별 구조가 필요

해결 방법

  • 문장 의미 유사도를 코사인 유사도 등으로 판단하는 시맨틱 캐싱 도입
  • 메인 서버와 분리된 add-on 서버를 gRPC로 연결하고, 임베디드 벡터 DB와 수평 확장 구조 적용
  • 채팅 발화 데이터를 전처리해 PCA, DBSCAN으로 대표 문장 군집을 만들고 캐싱 셋 구성

성능/운영 포인트

  • 오프라인 테스트에서 유사도 임계값 0.65 기준 캐시 HIT 비율 29.55% 확인
  • 온라인 테스트에서 약 25% HIT 비율과 연간 약 2.16억 원 절감 효과 확인
  • 임베딩 생성 병목은 Kubernetes Replica 확장으로 완화

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...