생성형 AI 기반 실시간 검색 결과 재순위화 1편 - 서빙 시스템 아키텍처
AI
생성형 AI 기반 실시간 검색 결과 재순위화 1편 - 서빙 시스템 아키텍처
두줄요약
네이버 통합검색의 LLM 기반 실시간 재순위화 서빙 아키텍처와 고부하 대응 방법을 정리했습니다. 원격 캐시, 비동기 호출, 스로틀링으로 검색 서버 보호와 응답 시간 최적화를 다뤘습니다.
핵심 내용
- 네이버 통합검색의 대규모 트래픽에서 LLM 기반 실시간 재순위화 서빙 시스템 아키텍처 설계 경험 공유
- 검색 서버 부하 전이, 응답 지연, 고부하 보호를 핵심 문제로 보고 캐시와 비동기 병렬 호출, 스로틀링 전략을 적용
- 원격 캐시 Nxcache와 Cache-Control 헤더를 활용해 중복 검색 요청을 줄이고, 재순위화 서버의 추가 트래픽을 흡수
- OpenTelemetry로 서버별 지연을 가시화하고, 캐시 만료 시간과 디그레이데이션·스로틀링 모드로 운영 안정성 확보
