AI
“이 옷 뭐지?” 스냅 이미지를 AI로 검색해 본 6주간의 여정
두줄요약
스냅 이미지를 검색어로 활용하는 이미지·자연어 검색 PoC를 6주간 검증했습니다. 객체 탐지, 임베딩, 벡터 검색으로 유사 상품 추천과 스타일 검색 가능성을 확인했습니다.
문제 상황
- 스냅 콘텐츠가 많아도 상품 태그가 부정확하거나 비어 있어 이미지 속 아이템 탐색이 어려움
- 사용자가 “이 옷 뭐지?”처럼 궁금해해도 비슷한 상품이나 스타일을 찾기 힘든 탐색 공백 존재
해결 방법
- 스냅 이미지에서 객체 탐지로 아이템 영역을 찾고, 임베딩과 벡터 검색으로 유사 상품 추천 파이프라인 구성
- LLM으로 스타일 설명문 생성 및 쿼리 재작성 후 텍스트 임베딩과 OpenSearch 벡터 검색으로 자연어 검색 구현
성능/운영 포인트
- YOLOS, FashionCLIP, Claude 3 Sonnet, Titan Text Embedding, OpenSearch, HNSW를 조합해 End-to-End PoC 검증
- Precision@5 0.81, MRR 0.76을 기록했고, 운영 비용은 SageMaker 엔드포인트와 Bedrock 호출 비중이 큼
주의할 점
- 단색 아이템, 가려진 부위, 특이한 촬영 구도, 잘못된 크롭에서 매칭 품질 저하
- 실시간 서빙과 LLM 호출이 비용의 큰 비중을 차지해 캐싱과 처리량 관리 필요