
AI
리디 추천 시스템, MLOps Platform에 올라탈 결심
두줄요약
리디는 추천 시스템을 SageMaker 기반 MLOps 플랫폼으로 재구성해 운영 복잡도를 줄였습니다. 모델 버전 관리, 롤백 자동화, 실시간 추론으로 더 동적인 추천 경험을 준비했습니다.
핵심 내용
- 리디 추천 시스템을 관리형 MLOps 플랫폼인 AWS SageMaker로 옮겨 개발 도구와 운영 구조를 단순화한 사례
- 모델 버전 관리, 가시성 확보, 학습·추론 분리, 롤백 자동화, 실시간 추론 도입을 통해 동적 추천 경험을 강화하려는 방향
- SageMaker Training, Model Registry, Real-time inference, Tritonserver, TensorRT를 단계적으로 검토·적용한 과정
선택 이유
- 기존 배치 중심 추천 구조가 비용, 운영 복잡도, 사용자 경험 측면에서 한계를 드러냄
- 제한된 개발 리소스를 비즈니스 가치가 큰 작업에 집중하기 위한 기술 스택 간소화 필요
장단점
- 장점: 실험 도구 축소, 모델 버전 중앙 관리, 승인 기반 롤백, 독립적 추론 실행
- 한계: TorchServe로는 기대한 처리량·지연시간 확보 실패, Neuron 1.x 연산자 지원 제약
적용해볼 점
- 모델 등록과 승인 절차를 파이프라인에 넣어 배포 안정성 강화
- 배치 추론과 실시간 추론을 구분해 서비스 특성에 맞는 서빙 전략 검토
