백엔드
입수는 Datalake로! (feat. Iceberg)
두줄요약
Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.
문제 상황
- Kafka·CDC 기반 기존 파이프라인의 높은 운영 비용과 배치 지연
- Kudu·Parquet 환경의 스키마 변경, 파티션 관리, 쿼리 성능 한계
- 수동 파이프라인 운영으로 인한 모니터링·정리·복구 부담
해결 방법
- DataLake에 Iceberg 포맷 도입으로 데이터와 메타데이터 분리 관리
- Spark·Kafka Connect·Airflow 기반 자동 입수와 정기 유지보수 자동화
- 스냅샷 정리, manifest 최적화, rewrite_data_files, remove_orphan_files 활용
성능/운영 포인트
- 준실시간 조회·수정, 비용 절감, 스키마 에볼루션 단순화
- 파티션 프루닝, write.distribution-mode 조정으로 읽기·쓰기 성능 개선
- 메타데이터 지표 모니터링과 Slack 알림으로 장애 대응 속도 향상