
데브옵스
DevOps LGTM 스택 도입기
두줄요약
AWS EKS 기반 MSA 환경에서 LGTM 스택을 도입해 관측 체계를 통합했습니다. 메트릭, 로그, 트레이스를 연결해 장애 파악과 운영 효율을 개선했습니다.
문제 상황
- AWS EKS 기반 MSA 환경에서 서비스 수 증가로 통신 구조 복잡도 상승
- 여러 관측 도구와 대시보드를 오가며 상태를 확인해야 하는 운영 비효율
- 환경별 반복 설정, Prometheus 리소스 증가, 로그·트레이스 분산 관리 문제
원인 분석
- Observability가 Metrics, Logs, Traces로 분산된 상태에서 도구가 통합되지 않음
- 서비스 증가에 따라 장애 지점 파악과 트러블슈팅 시간이 늘어나는 구조
- 기존 스택은 환경별 형상 차이와 운영 비용 증가를 유발
해결 방법
- LGTM 스택으로 로그, 메트릭, 트레이스를 통합 관측 체계로 전환
- 메트릭은 Prometheus에서 Mimir로 전환해 수평 확장, 멀티 테넌시, Object Storage 활용
- 로그는 EFK에서 Loki로 전환하고, 트레이스는 Tempo와 OpenTelemetry Collector로 수집
