입수는 Datalake로! (feat. Iceberg)
Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.
Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.

하루 6천 개가 넘는 Spark Job을 자동으로 점검하기 위해 Spark Analyzer를 개발했습니다.\nHistory Server 메트릭과 임계치 기반 규칙으로 성능 문제를 탐지하고 알림으로 연결했습니다.


통신사 마케팅을 위해 요금제 변경 예측과 추천을 결합한 하이브리드 ML 모델을 소개했습니다.\nARPU와 고객 만족도의 균형을 고려해 다운그레이드 방어와 업셀 전략에 활용했습니다.


쿠팡이 LLM을 활용해 이미지·텍스트 이해, 약한 라벨 생성, 상품 분류를 개선하는 사례를 소개했습니다. 또한 CJK 언어 특성과 ICL·RAG·SFT·CPT, Kubernetes 기반 훈련 흐름을 함께 설명했습니다.


Pandas와 Spark 사이의 대체제로 Polars를 검토한 실무 적용 경험을 소개했습니다. Lazy API와 streaming으로 메모리와 실행 시간을 크게 줄인 사례를 공유했습니다.

실시간 광고 사용자 ID 매핑 시스템과 그 설계 과정을 다룬 발표 세션을 공개했습니다. gRPC, Spark Structured Streaming, Kafka를 활용한 마이크로서비스 구성과 그래프 기반 매핑 방식을 소개했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

무신사 테크가 Databricks Data+AI Summit 2023 참석 후기를 공유했습니다. 생성형 AI, 데이터 플랫폼, 재해복구 등 실무 인사이트를 정리했습니다.

이력성 데이터 증가로 MySQL 부담이 커져 S3와 Athena로 저장·조회 구조를 옮긴 사례를 다뤘습니다. Spark bucketing으로 필요한 데이터만 읽도록 최적화하는 흐름을 소개했습니다.

분석 데이터를 프로덕션에서 쉽게 쓰기 위한 데이터서빙 서비스 구축 과정을 소개합니다. 분석 테이블을 API로 제공하기 위해 S3, Airflow, Spark 등을 활용했습니다.


쿠키런: 킹덤 출시 직후 발생한 대규모 장애를 신입 입사자의 시점에서 회고한 글입니다. 데이터 이주와 정합성 검증을 통해 서비스를 복구한 과정을 담았습니다.

EMR, YARN 기반 Spark를 Self-hosted Kubernetes로 전환하는 내용을 소개했습니다. 데이터 분석환경 컴퓨팅을 Kubernetes 중심으로 재구성하는 방향을 다뤘습니다.


런칭 직후 Ballast 파일 경로 오류로 CockroachDB 클러스터가 전역 장애를 겪었습니다. SST 파일 복원과 데이터 재구성을 통해 서비스를 다시 열고, 이후 재발 방지 프로세스도 강화했습니다.