
AI
왓챠 추천 서비스 MLOps 적용기 Part1
두줄요약
왓챠 추천 서비스에 MLOps를 적용한 배경과 기존 EC2 기반 파이프라인의 문제를 정리했습니다. 도커·쿠버네티스, 온프레미스 GPU, S2S VPN으로 학습 환경과 운영 안정성을 개선했습니다.
문제 상황
- 추천 모델과 데이터 증가로 분산된 데이터 통합, 학습 과정 최적화, 모델 반영과 모니터링이 필요한 MLOps 도입 필요성 대두
- 기존 EC2 기반 메인 워커·원격 워커 구조에서 리소스 비효율, 실행 환경 관리 어려움, GPU 인스턴스 할당 불안정, 실험 환경 운영 불편 발생
해결 방법
- 도커와 쿠버네티스로 파이프라인 작업을 독립 실행 환경으로 분리하고, 리소스와 우선순위, 데이터 전달, 권한 관리를 오브젝트로 정리
- 상시 가용한 온프레미스 GPU 서버를 도입하고, AWS VPC 연동에는 S2S VPN을 선택해 안정성과 비용을 균형 있게 확보
- 쿠버네티스 API로 클러스터 가용 자원을 확인해 GPU 클러스터와 AWS EC2 사이에서 작업 실행 경로를 분기하는 백업 플랜 구성
성능/운영 포인트
- GPU가 필요 없는 작업까지 값비싼 GPU EC2에서 돌리던 비효율 해소
- 장시간 통신 안정성 확보와 네트워크 비용 최적화를 함께 고려
- 클러스터 자원 활용도를 높이면서 파이프라인 중단 위험을 줄이는 운영 구조 마련