목록 보기
왓챠 추천 서비스 MLOps 적용기 Part2
AI

왓챠 추천 서비스 MLOps 적용기 Part2

watcha
watcha
2024년 3월 6일

두줄요약

왓챠는 추천 서비스의 Monolithic 추론 구조를 분리된 TorchServe 기반 서버로 개선했습니다. CPU 최적화와 모델 경량화, Datadog 모니터링으로 성능과 안정성을 함께 높였습니다.

핵심 내용

  • 왓챠 추천 서비스의 기존 Monolithic 추론 구조 문제와 독립적인 추론 서버 도입 배경 정리
  • TorchServe를 후보 비교 끝에 선택하고, CPU 최적화·동적 배치·캐싱·직렬화·모델 경량화로 성능과 안정성 개선
  • Datadog과 Looker Studio로 서버 지표와 온라인 추천 지표를 함께 모니터링하는 체계 구축
  • 추론 서버 분리로 JNI 의존성 제거, 모델 문제의 서비스 전이 방지, 전후처리 핸들러의 획일화

적용해볼 점

  • 모델 서빙과 API 서비스를 분리해 장애 전파 범위 축소
  • CPU 추론 환경에서 워커 수, 배치 크기, 캐싱, 경량화 기법을 함께 튜닝
  • 서버 메트릭과 추천 품질 지표를 분리해 지속적으로 관찰

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...