목록 보기
신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례
데브옵스

신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례

라인
라인
2025년 2월 28일

두줄요약

OBS 플랫폼에 SLI/SLO를 도입해 공용 미디어 플랫폼의 신뢰성을 측정하고 운영에 활용한 사례를 공유했습니다. 로그 기반 메트릭 수집과 Recording Rules로 대시보드 성능을 개선하고 알람 체계를 구성했습니다.

문제 상황

  • 서비스가 아닌 플랫폼 OBS에 신뢰성 지표를 별도로 정의할 필요
  • 다양한 서비스에서 공용으로 쓰여 문제 영향 범위가 넓은 구조
  • API 사용 방식이 제각각이라 CUJ 설정과 메트릭 수집이 까다로운 상황

원인 분석

  • 미디어 유형과 크기 편차로 처리량 기준의 일관성 확보 어려움
  • 엔드포인트에서 직접 메트릭 수집이 어려워 로그 기반 수집 필요
  • 높은 카디널리티와 복잡한 PromQL로 대시보드 조회 성능 저하

해결 방법

  • 주요 API를 CUJ로 정의하고 DOWNLOAD, UPLOAD, OBJECT_INFO별 SLI 선정
  • Kafka, Vector, Prometheus, Grafana로 로그 기반 메트릭 수집 파이프라인 구성
  • Recording Rules로 자주 쓰는 SLO 계산식을 사전 집계해 쿼리 성능 개선

성능/운영 포인트

  • 하루 약 350TB 로그 처리를 위해 Vector 클러스터 증설 및 역할 분리
  • Slack 연동 알람과 패널 캡처로 장애 상황을 빠르게 공유
  • 오류 예산 상태를 기준으로 대응 우선순위와 운영 피로도 조절

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...