

Kafka에서 S3로 실시간 데이터 수집 파이프라인 설계와 구축기
Kafka 소비 결과를 Parquet으로 변환해 S3에 적재하는 실시간 수집 파이프라인을 설계하고 구축했습니다. 또한 Flush, 커밋, 모니터링 체계를 통해 누락 없이 안정적으로 운영하는 방법을 정리했습니다.


Kafka 소비 결과를 Parquet으로 변환해 S3에 적재하는 실시간 수집 파이프라인을 설계하고 구축했습니다. 또한 Flush, 커밋, 모니터링 체계를 통해 누락 없이 안정적으로 운영하는 방법을 정리했습니다.


스타트업 서비스 설계에서는 구현보다 지속 가능성을 먼저 고민해야 한다고 말씀했습니다.\n기술 부채와 운영 요소를 함께 보고, 장기적으로 연결되는 구조를 설계하는 시야가 중요하다고 강조했습니다.

버즈베네핏 백엔드 팀이 데이터 중심 설계와 확장 가능한 파이프라인, 모니터링 체계를 어떻게 구축했는지 소개했습니다. Feature Flag와 실험 지원으로 제품 검증 속도를 높인 사례도 함께 다뤘습니다.


리멤버앤컴퍼니가 Aurora MySQL의 분석 부하를 줄이기 위해 S3 Tables 기반 CDC 데이터 레이크를 구축한 과정을 다뤘습니다. 기존 데이터 이관, Debezium·MSK·Iceberg Kafka Connect 설정과 운영상 주의점을 정리했습니다.

MQTT 기반 알림의 제약을 해결하기 위해 AWS IoT와 SSE를 도입했습니다. 정형화된 메시지, 재전송, 수신 확인으로 실시간성과 안정성을 높였습니다.


당근은 AWS 기반 피처 플랫폼의 수집 계층을 스트림과 배치로 나누어 구성했습니다. 대규모 이벤트와 배치 작업을 안정적으로 처리하며 운영상의 개선점도 함께 정리했습니다.

PostgreSQL 데이터를 Elasticsearch로 동기화하는 Kafka Connect CDC 파이프라인 구성 글입니다. 10년 넘게 운영한 레거시 시스템의 검색 연동 맥락을 소개합니다.


AWS 관리형 서비스로 뉴스와 주가를 실시간 결합해 분석하는 스트리밍 아키텍처를 소개했습니다. Flink, Bedrock, MSK, S3를 연동해 감정 분석과 시계열 분석 흐름을 구성했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


Amazon MSK의 KRaft 모드가 Zookeeper 의존성을 어떻게 줄이는지 설명했습니다. 또한 지원 버전, 마이그레이션 방법, 모니터링 포인트까지 정리했습니다.
Kafka Broker request log와 METADATA API를 활용해 서비스와 Topic 연결을 실시간으로 추적하는 방법을 소개했습니다. ClickHouse, conntrack, Lag metric 조인으로 소스 수정 없이 MSA 관측성을 높였습니다.


검색서비스팀의 SCAR 모니터링 시스템 고도화와 전체 구조를 소개했습니다. 기존 로그 기반 방식의 한계를 짚고, 수집·집계·시각화 분리와 품질 지표 확장을 다뤘습니다.
Iceberg CDC에서 발생하는 정합성 이슈와 원인을 정리하고, Position Delete 중심의 처리 원칙을 설명했습니다. Kafka key 설정, Commit Timeout, Schema Evolution 대응으로 중복 문제를 해결한 사례를 공유했습니다.