목록 보기
“서버가 죽었어요”에서 시작된 이야기, Grafana OnCall과 Amazon Connect로 완성한 실전형 온콜 시스템
데브옵스

“서버가 죽었어요”에서 시작된 이야기, Grafana OnCall과 Amazon Connect로 완성한 실전형 온콜 시스템

여기어때
여기어때
2025년 12월 16일

두줄요약

Grafana OnCall과 Amazon Connect를 연동해 Target Group 비정상 상태를 자동 감지하고 전화 알림까지 연결한 온콜 시스템 구축 사례입니다. 비용을 줄이면서도 담당자 식별, 알림 제어, 에스컬레이션을 하나의 흐름으로 묶었습니다.

문제 상황

  • 새벽 장애 알림과 야간 호출로 인한 대응 부담
  • 누가 즉시 대응할지, 어떻게 전화로 알릴지, 비용을 어떻게 줄일지에 대한 운영 문제
  • 단순 알람 도구만으로는 장애 감지부터 연락, 제어까지 이어지는 흐름 부재

원인 분석

  • 관측 도구와 인시던트 대응 체계가 분리된 상태
  • Alertmanager, Slack Bot 등 알림 정책이 흩어져 유지보수 복잡
  • 전화·SMS형 상용 솔루션은 비용 부담이 큼

해결 방법

  • Grafana OnCall을 LGTM Stack에 통합해 장애 탐지와 대응 흐름 일원화
  • Grafana OnCall DB를 MySQL RDS로 전환하고 Slack OAuth, LDAP 연동으로 온콜 스케줄 자동화
  • ELBv2 API로 Target Group unhealthy 상태를 감지하고 Amazon Connect로 자동 전화 발신, Slack 버튼으로 중지·확인 제어

성능/운영 포인트

  • 비동기 처리로 빠른 상태 확인과 알림 전송
  • acked 상태 기록으로 중복 전화·알림 차단
  • 야간/주말 전용 전화, 팀 태그 기반 라우팅, 에스컬레이션 정책으로 알림 노이즈 최소화

적용해볼 점

  • 헬스체크 외에도 EC2, RDS, EKS, ALB 지표에 동일한 온콜 흐름 적용 가능
  • 오픈소스와 AWS 기본 서비스 조합으로 비용 최적화된 대응 체계 구축 가능

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...