
백엔드
데이터카탈로그에서 DataHub를 이용하는 방법
두줄요약
DataHub를 그대로 노출하지 않고 OpenSearch와 DB를 직접 활용해 데이터카탈로그에 맞는 검색·리니지·BI 통합 기능을 구현했습니다. 또한 버전업과 수집 성능 문제를 개선해 운영 적합성을 높였습니다.
핵심 내용
- 사내 데이터 디스커버리 도구 데이터카탈로그를 DataHub 기반으로 구축한 배경과 구성 소개
- DataHub API 대신 OpenSearch와 DB를 직접 활용해 컬럼 검색, 리니지, BI 통합 기능을 데이터카탈로그에 맞게 구현
- DataHub 버전업과 Spark 리니지, DB 네이밍, Redash 수집 성능 문제를 개선하며 운영 적합성 확보
구조와 흐름
- DataHub의 메타데이터 저장소, 검색 인덱스, Metadata Service, Frontend Server 구성 설명
- 검색 결과를 컬럼 단위로 변환하고, 리니지를 degree 단위로 재귀 조회하는 방식 정리
- BI 도구 수집은 활성 대시보드와 핵심 차트 중심으로 축소하고 SQL 파서 교체로 처리 시간 단축
선택 이유
- 사용자 친화적 UI/UX와 데이터 탐색 경험을 위해 DataHub를 그대로 노출하지 않는 방향 채택
- API 우회보다 DB·OpenSearch 직접 접근이 성능과 응답 형식 제어에 유리하다고 판단
- 버전별 기능 차이와 사용자 혼란을 줄이기 위해 인덱스 설정을 유지한 채 업그레이드 조정
성능/운영 포인트
- OpenSearch 느린 쿼리 로그를 활용해 실제 인덱스 쿼리 파악
- Spark 3.4 호환성 문제는 버전별 메소드 차이를 반영한 분기 로직으로 해결
- Redash 수집은 대상 축소와 파서 교체로 2시간 이상에서 40분 내외로 단축
