
백엔드
효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기
두줄요약
Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.
핵심 내용
- 하둡 플랫폼의 Hive 사용량을 통계로 수집해 데이터 활용 현황과 운영 비효율을 파악하는 리포트 개발기
- 초기에는 Cloudera Navigator 화면을 Selenium으로 크롤링했으나 성능과 의존성 한계가 있어 Hive 로그 분석 방식으로 전환
- 로그 수집은 Filebeat, Logstash, Kafka와 Spark streaming을 조합해 실시간 처리 구조로 개선
- Iceberg 도입 시에는 잦은 스냅샷과 작은 파일 문제를 줄이기 위해 parquet 중간 적재 후 시간 단위로 취합해 기록
적용해볼 점
- 쿼리 이력과 계정 정보를 기반으로 사용 패턴을 분석해 불필요한 저장과 ETL 비용을 줄이는 운영 지표화
- 외부 UI 크롤링보다 REST API, 로그 기반 수집, 스트리밍 처리 같은 더 안정적인 데이터 수집 경로 우선 검토
- 작은 파일과 메타데이터 증가가 있는 저장 포맷에서는 쓰기 주기와 적재 단계를 분리해 운영 부담 완화
