
AI
SK하이닉스의 RAG 플랫폼 구축 및 성능 평가/분석 연구 사례
두줄요약
SK하이닉스가 AWS 환경에서 RAG 플랫폼을 구축하고 성능을 평가한 사례를 소개했습니다. 데이터셋 크기와 인덱스 메모리가 검색 지연과 TTFT에 미치는 영향을 분석했습니다.
핵심 내용
- SK하이닉스 MSR의 AWS 기반 RAG 플랫폼 구축 사례와 성능 평가/분석 연구
- On-Premise 한계를 보완하기 위해 Cloud 환경에서 RAG를 구성하고, 메모리·스토리지 상호작용을 중심으로 인퍼런스 성능을 검증
- 기본 RAG 흐름, AWS 구성요소, HNSW 기반 벡터 검색 특성, 데이터셋 크기와 메모리 요구량의 관계를 함께 검토
구조와 흐름
- Query 입력 후 Lambda 호출, Embedding 처리, OpenSearch 벡터 검색, LLM 응답 생성의 순차 흐름
- Data Ingestion과 Inference로 나뉘는 RAG 기본 구조
- Inference 단계에서 임베딩·검색·LLM이 응답 지연에 미치는 영향 분석
성능/운영 포인트
- 사용자 증가에 따라 QPS는 증가 후 수렴하고, 응답 시간은 상승
- 임베딩보다 지식 검색과 LLM이 응답 지연의 주요 비중을 차지
- 데이터셋 증가 시 검색 시간과 TTFT가 함께 증가하며, 인덱스 메모리 요구량도 커짐
