
데브옵스
신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례
두줄요약
OBS 플랫폼에 SLI/SLO를 도입해 공용 미디어 플랫폼의 신뢰성을 측정하고 운영에 활용한 사례를 공유했습니다. 로그 기반 메트릭 수집과 Recording Rules로 대시보드 성능을 개선하고 알람 체계를 구성했습니다.
문제 상황
- 서비스가 아닌 플랫폼 OBS에 신뢰성 지표를 별도로 정의할 필요
- 다양한 서비스에서 공용으로 쓰여 문제 영향 범위가 넓은 구조
- API 사용 방식이 제각각이라 CUJ 설정과 메트릭 수집이 까다로운 상황
원인 분석
- 미디어 유형과 크기 편차로 처리량 기준의 일관성 확보 어려움
- 엔드포인트에서 직접 메트릭 수집이 어려워 로그 기반 수집 필요
- 높은 카디널리티와 복잡한 PromQL로 대시보드 조회 성능 저하
해결 방법
- 주요 API를 CUJ로 정의하고 DOWNLOAD, UPLOAD, OBJECT_INFO별 SLI 선정
- Kafka, Vector, Prometheus, Grafana로 로그 기반 메트릭 수집 파이프라인 구성
- Recording Rules로 자주 쓰는 SLO 계산식을 사전 집계해 쿼리 성능 개선
성능/운영 포인트
- 하루 약 350TB 로그 처리를 위해 Vector 클러스터 증설 및 역할 분리
- Slack 연동 알람과 패널 캡처로 장애 상황을 빠르게 공유
- 오류 예산 상태를 기준으로 대응 우선순위와 운영 피로도 조절