목록 보기
백패커의 Amazon EKS 운영 최적화 여정 2부: 운영 심화 및 장애 대응 사례
데브옵스

백패커의 Amazon EKS 운영 최적화 여정 2부: 운영 심화 및 장애 대응 사례

AWS
AWS
2025년 5월 8일

두줄요약

백패커의 Amazon EKS 운영 중 발생한 Spot 인스턴스 종료와 트래픽 급증 장애 사례를 정리했습니다. AZ Rebalance 조정, Custom Scheduler, nf_conntrack 튜닝과 모니터링 강화로 안정성을 높였습니다.

문제 상황

  • 백패커의 Amazon EKS 운영 중 Spot 인스턴스 리밸런스, AZ Rebalance, 트래픽 급증으로 인한 부분 장애와 전면 장애 발생
  • 블루/그린 배포와 스팟 종료가 겹치며 Pod 축출, SIGTERM, 503 에러, ingressGateway 병목이 발생

원인 분석

  • ASG AZ Rebalance로 노드가 과도하게 종료되며 남은 Pod에 트래픽 집중
  • Spot 인스턴스 동시 종료와 할당 지연, 낮은 Replica 수로 서비스 가용성 저하
  • istio Node의 nf_conntrack 테이블 초과와 네트워크 성능 한계가 전면 장애의 근본 원인

해결 방법

  • ASG의 AZ Rebalance 비활성화로 불필요한 노드 종료 방지
  • Custom Scheduler로 On-Demand에 최소 Pod를 고정 배치해 Spot 종료 위험 완화
  • nf_conntrack_max 상향, Mesh 직접 통신 설정, 고성능 인스턴스 적용, 모니터링 강화

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...