
아키텍처
리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 2부: S3 Tables를 프로덕션 환경에서 운영하기
두줄요약
S3 Tables의 운영 전략과 StarRocks 도입 과정을 정리했습니다. Compaction, Snapshot, 모니터링, 캐시 TTL 설정의 실무 포인트를 다뤘습니다.
핵심 내용
- Amazon S3 Tables의 프로덕션 운영 전략 정리
- Compaction, Snapshot 관리, Unreferenced File 제거, 모니터링 체계 구성
- 실시간 분석 엔진으로 StarRocks를 EKS 상 Shared-data 방식으로 도입
성능/운영 포인트
- Small File 증가를 막기 위한 자동 Compaction과 targetFileSizeMB 512MB 운영
- 테이블 용도별 Snapshot 보존 정책 차등 적용과 메타데이터 증가 관리
- PyIceberg 기반 메타데이터 수집, 파일 수·크기·평균 크기 지표화
적용해볼 점
- S3 Tables REST Endpoint와 PyIceberg로 파일 단위 관찰 가능
- Iceberg 메타데이터 캐시 TTL은 CDC Commit 주기보다 짧게 설정 필요
- 분석 엔진 선택 시 저지연, 비용, 운영 편의성 함께 검토
