목록 보기
효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기
백엔드

효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기

네이버 플레이스
네이버 플레이스
2022년 11월 18일

두줄요약

Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.

핵심 내용

  • 하둡 플랫폼의 Hive 사용량을 통계로 수집해 데이터 활용 현황과 운영 비효율을 파악하는 리포트 개발기
  • 초기에는 Cloudera Navigator 화면을 Selenium으로 크롤링했으나 성능과 의존성 한계가 있어 Hive 로그 분석 방식으로 전환
  • 로그 수집은 Filebeat, Logstash, Kafka와 Spark streaming을 조합해 실시간 처리 구조로 개선
  • Iceberg 도입 시에는 잦은 스냅샷과 작은 파일 문제를 줄이기 위해 parquet 중간 적재 후 시간 단위로 취합해 기록

적용해볼 점

  • 쿼리 이력과 계정 정보를 기반으로 사용 패턴을 분석해 불필요한 저장과 ETL 비용을 줄이는 운영 지표화
  • 외부 UI 크롤링보다 REST API, 로그 기반 수집, 스트리밍 처리 같은 더 안정적인 데이터 수집 경로 우선 검토
  • 작은 파일과 메타데이터 증가가 있는 저장 포맷에서는 쓰기 주기와 적재 단계를 분리해 운영 부담 완화

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...