목록 보기
입수는 Datalake로! (feat. Iceberg)
백엔드

입수는 Datalake로! (feat. Iceberg)

토스
토스
2024년 10월 29일

두줄요약

Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.

문제 상황

  • Kafka·CDC 기반 기존 파이프라인의 높은 운영 비용과 배치 지연
  • Kudu·Parquet 환경의 스키마 변경, 파티션 관리, 쿼리 성능 한계
  • 수동 파이프라인 운영으로 인한 모니터링·정리·복구 부담

해결 방법

  • DataLake에 Iceberg 포맷 도입으로 데이터와 메타데이터 분리 관리
  • Spark·Kafka Connect·Airflow 기반 자동 입수와 정기 유지보수 자동화
  • 스냅샷 정리, manifest 최적화, rewrite_data_files, remove_orphan_files 활용

성능/운영 포인트

  • 준실시간 조회·수정, 비용 절감, 스키마 에볼루션 단순화
  • 파티션 프루닝, write.distribution-mode 조정으로 읽기·쓰기 성능 개선
  • 메타데이터 지표 모니터링과 Slack 알림으로 장애 대응 속도 향상

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...