
백엔드
로그 파이프라인 개선기 - 기존 파이프라인 문제 정의 및 해결 방안 적용
두줄요약
기존 로그 배치 파이프라인의 분류 비효율, 낮은 신선도, 스키마 관리 부재를 정리하고 개선 방향을 설명했습니다. MSK와 Kafka Consumer, Protobuf, Schema Registry를 활용한 준실시간 구조로 전환한 과정을 소개했습니다.
핵심 내용
- 서버 로그를 BigQuery에 적재하는 기존 배치 파이프라인의 문제를 정리하고, 데이터 컨트랙트 기반의 개선 방향을 제시
- S3와 GCS 중복 저장, 타입 전체 분류로 인한 비효율, Airflow 배치로 인한 낮은 신선도, 스키마 변경 관리 부재를 주요 문제로 식별
- MSK, 커스텀 Kafka Consumer, GCS, BigQuery External Table과 View Table을 활용한 준실시간 스트리밍 구조로 전환
- Protobuf, Buf, Schema Registry로 스키마를 중앙 관리하고, 생산자·소비자 간 일관성과 호환성 검증을 강화
적용해볼 점
- 로그 타입 분류와 적재를 배치에서 스트리밍으로 옮겨 처리 지연을 줄이는 구조 검토
- 스키마 변경 이력을 코드와 검증 절차로 관리하는 데이터 컨트랙트 도입 검토
- 중간 저장소 중복을 줄이고 단일 원본 흐름을 유지하는 파이프라인 설계 검토
