목록 보기
왓챠 추천 서비스 MLOps 적용기 Part1
AI

왓챠 추천 서비스 MLOps 적용기 Part1

watcha
watcha
2024년 2월 28일

두줄요약

왓챠 추천 서비스에 MLOps를 적용한 배경과 기존 EC2 기반 파이프라인의 문제를 정리했습니다. 도커·쿠버네티스, 온프레미스 GPU, S2S VPN으로 학습 환경과 운영 안정성을 개선했습니다.

문제 상황

  • 추천 모델과 데이터 증가로 분산된 데이터 통합, 학습 과정 최적화, 모델 반영과 모니터링이 필요한 MLOps 도입 필요성 대두
  • 기존 EC2 기반 메인 워커·원격 워커 구조에서 리소스 비효율, 실행 환경 관리 어려움, GPU 인스턴스 할당 불안정, 실험 환경 운영 불편 발생

해결 방법

  • 도커와 쿠버네티스로 파이프라인 작업을 독립 실행 환경으로 분리하고, 리소스와 우선순위, 데이터 전달, 권한 관리를 오브젝트로 정리
  • 상시 가용한 온프레미스 GPU 서버를 도입하고, AWS VPC 연동에는 S2S VPN을 선택해 안정성과 비용을 균형 있게 확보
  • 쿠버네티스 API로 클러스터 가용 자원을 확인해 GPU 클러스터와 AWS EC2 사이에서 작업 실행 경로를 분기하는 백업 플랜 구성

성능/운영 포인트

  • GPU가 필요 없는 작업까지 값비싼 GPU EC2에서 돌리던 비효율 해소
  • 장시간 통신 안정성 확보와 네트워크 비용 최적화를 함께 고려
  • 클러스터 자원 활용도를 높이면서 파이프라인 중단 위험을 줄이는 운영 구조 마련

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...