우아한형제들이 장애를 놓치지 않고 탐지하는 방법
데브옵스
우아한형제들이 장애를 놓치지 않고 탐지하는 방법
두줄요약
기존 시스템 지표 모니터링의 한계를 보완하기 위해 서비스 이상 탐지 시스템을 도입했습니다. 중앙값 기반 탐지와 대응 자동화로 정밀도와 탐지율을 높이고 전파 시간을 크게 줄였습니다.
문제 상황
- 배달 서비스 특성상 고객 주문 시점의 장애가 곧바로 사용자 피해로 이어지는 상황
- 기존 시스템 지표 중심 모니터링은 모든 이상 징후를 빠짐없이 잡기 어려운 한계
원인 분석
- 서비스 변화와 운영 실수로 인한 장애 발생이 불가피한 구조
- CPU, 메모리 같은 시스템 지표만으로는 사용자 영향까지 충분히 반영하기 어려움
- 오탐 가능성과 원인 파악 어려움 때문에 단순 임계치 경보만으로는 대응 한계
해결 방법
- 실시간에 가까운 서비스 이상 탐지 시스템 도입
- 주문 수, 결제 성공률 같은 서비스 지표를 과거 패턴과 비교해 이상 여부 판단
- 중앙값 기반 예측과 임계 도달 횟수 관리로 정확도와 탐지 속도 균형 조정
- Slack 경보, Opsgenie 호출, 장애 채널 자동 생성까지 대응 프로세스 자동화
성능/운영 포인트
- 경보 정밀도 약 11배 향상
- 장애 탐지율 약 70% 향상
- 장애 전파 시간 약 74% 단축
- 여러 서비스팀의 지표 모니터링을 SRE 관점에서 통합 관리
