
백엔드
5월 트래픽 폭증을 대비한 데이터베이스 관리 전략
두줄요약
5월 트래픽 폭증에 대비해 RDS 모니터링과 자원 분리 전략을 강화했습니다. 커밋 지연 원인을 찾아 파라미터를 조정해 처리량을 개선했습니다.
문제 상황
- 5월 종합소득세 시즌에 트래픽이 폭증하며 데이터베이스 부하와 지연이 커지는 상황
- MSA 전환 이후 모니터링 지점과 운영 포인트가 늘어나 통합 관제가 필요해진 상황
해결 방법
- OpenSearch와 Logstash JDBC 플러그인으로 RDS 데이터를 수집·시각화하는 통합 모니터링 체계 구축
- Multi Source Replication으로 분석용 부하를 분리하고, 운영 인스턴스의 자원 사용을 애플리케이션 중심으로 재배치
- Performance Insight로 커밋 지연 원인을 확인한 뒤
innodb_flush_log_at_trx_commit조정과 일부 인스턴스의 Binary Log 비활성화 적용
성능/운영 포인트
aurora_redo_log_flush,MYSQL_BIN_LOG대기 이벤트를 지표로 커밋 병목과 복제 오버헤드 식별- 비동기 설정과 로그 비활성화로 처리량 개선, 일부 구간에서 Network 및 DML 처리량 30% 이상 증가
- 데이터 내구성과 성능 사이의 트레이드오프를 명확히 인지한 상태에서 신중한 운영 필요
