목록 보기
리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 1부: S3 Tables에 CDC 데이터 레이크 구축하기
데브옵스

리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 1부: S3 Tables에 CDC 데이터 레이크 구축하기

AWS
AWS
2025년 10월 29일

두줄요약

리멤버앤컴퍼니가 Aurora MySQL의 분석 부하를 줄이기 위해 S3 Tables 기반 CDC 데이터 레이크를 구축한 과정을 다뤘습니다. 기존 데이터 이관, Debezium·MSK·Iceberg Kafka Connect 설정과 운영상 주의점을 정리했습니다.

문제 상황

  • Aurora MySQL 운영 DB와 분석 워크로드가 결합되어 Reader 인스턴스 부하와 응답 지연 발생
  • 매일 Full Refresh로 수십억 건을 반복 적재해 S3, EMR, Aurora I/O 비용과 운영 부담 증가
  • 실시간 분석이 필요할 때 직접 조회 방식으로 운영 안정성과 분석 성능을 동시에 확보하기 어려움

해결 방법

  • 변경분만 반영하는 CDC 기반 데이터 레이크로 전환하고 Amazon S3 Tables(Iceberg) 도입
  • Debezium MySQL Connector와 Amazon MSK를 CDC 허브로 두고, S3 Tables에 Incremental Update 반영
  • AWS Glue(PySpark)로 기존 데이터 이관 후, Iceberg Kafka Connector와 ECS Kafka Connect로 실시간 적재 구성

성능/운영 포인트

  • Full Load는 전용 Replica와 동적 JDBC 파티셔닝으로 병렬 처리해 운영 DB 영향 최소화
  • Iceberg commit 주기와 스키마 진화, Upsert, PK 정합성, Debezium Transform 설정이 운영 핵심
  • Athena 조회용 별도 S3 Tables 카탈로그로 기존 Glue Iceberg와 분리 운영

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...