목록 보기
RAG 없이 20만 대 자동차와 실시간으로 대화하기 (2)
AI

RAG 없이 20만 대 자동차와 실시간으로 대화하기 (2)

엔카닷컴
엔카닷컴
2025년 11월 24일

두줄요약

RAG 대신 내부 API를 직접 활용해 실시간 차량 정보를 전달하는 API 증강 생성 아키텍처를 소개했습니다. 병렬 호출, 캐싱, SSE 스트리밍으로 실시간성과 비용 효율을 함께 개선했습니다.

문제 상황

  • 실시간 대규모 차량 정형 데이터에서 RAG 적용 시 유령 매물, 정보 누락, 비용 효율성 한계 발생
  • 고객이 보고 있는 차량의 현재 정보를 가장 정확하게 전달해야 하는 요구와 벡터DB 기반 동기화 구조의 불일치

구조와 흐름

  • 백엔드가 내부 API를 직접 호출해 정보를 수집하고 LLM에 주입하는 API 증강 생성 아키텍처 채택
  • 질문 → 병렬 API 호출 → 프롬프트 조합 → LLM 답변의 단일 파이프라인 구성
  • 정적 프롬프트와 차량별 동적 프롬프트를 분리해 운용

선택 이유

  • 벡터DB 동기화 없이 운영 DB의 최신 데이터를 바로 사용해 실시간성 확보
  • 차량 한 대의 전체 정보를 통째로 제공해 문맥 손실 방지
  • 복잡한 인덱싱과 동기화 비용 감소로 유지보수성 향상

성능/운영 포인트

  • asyncio.gather 기반 병렬 API 호출로 약 20개 내부 API 수집 지연 최소화
  • 데이터 캐시와 LLM 프롬프트 캐싱으로 반복 호출 비용 절감
  • SSE 스트리밍으로 첫 토큰을 즉시 전송해 체감 지연 감소

주의할 점

  • 팩트 질문에는 차량 상세정보를 단일 진실 स्रोत으로 두고 추론 금지 원칙 적용
  • 일반 조언 질문은 LLM 사전 지식을 활용하되 선택 책임을 사용자에게 분리

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...