
AI
왓챠 추천 서비스 MLOps 적용기 Part2
두줄요약
왓챠는 추천 서비스의 Monolithic 추론 구조를 분리된 TorchServe 기반 서버로 개선했습니다. CPU 최적화와 모델 경량화, Datadog 모니터링으로 성능과 안정성을 함께 높였습니다.
핵심 내용
- 왓챠 추천 서비스의 기존 Monolithic 추론 구조 문제와 독립적인 추론 서버 도입 배경 정리
- TorchServe를 후보 비교 끝에 선택하고, CPU 최적화·동적 배치·캐싱·직렬화·모델 경량화로 성능과 안정성 개선
- Datadog과 Looker Studio로 서버 지표와 온라인 추천 지표를 함께 모니터링하는 체계 구축
- 추론 서버 분리로 JNI 의존성 제거, 모델 문제의 서비스 전이 방지, 전후처리 핸들러의 획일화
적용해볼 점
- 모델 서빙과 API 서비스를 분리해 장애 전파 범위 축소
- CPU 추론 환경에서 워커 수, 배치 크기, 캐싱, 경량화 기법을 함께 튜닝
- 서버 메트릭과 추천 품질 지표를 분리해 지속적으로 관찰