목록 보기
LINE 서비스의 대규모 광고 데이터를 처리하기 위한 Spark on Kubernetes 적용기
데브옵스

LINE 서비스의 대규모 광고 데이터를 처리하기 위한 Spark on Kubernetes 적용기

라인
라인
2026년 3월 31일

두줄요약

LINE Ads의 대규모 광고 데이터를 처리하기 위해 Spark on Kubernetes를 도입한 사례입니다. 성능 향상, 비용 절감, 버전 유연성을 함께 확보했습니다.

문제 상황

  • LINE Ads의 대규모 광고 이벤트·리포트 데이터를 실시간으로 처리해야 하는 파이프라인 요구
  • 피처 증가로 연산량과 테이블 크기가 커지면서 기존 Spark on YARN에서 성능 저하, 자원 경합, 운영 비용 증가, 버전 제약 발생
  • Hadoop 노드 종속 구조로 인한 인프라 독립성 부족과 확장성 한계

해결 방법

  • Hadoop 의존을 줄이고 Kubernetes 위에서 Spark 드라이버와 익스큐터를 파드로 실행하는 Spark on Kubernetes 도입
  • 클러스터 모드와 Spark Operator, Apache YuniKorn, GitHub Actions, ArgoCD, 모니터링 스택을 결합해 배포·운영 체계 구성
  • 메모리 오버헤드 상향, 노드·파드 실패 시 볼륨 종류별 동작 검토 등 운영 이슈를 트러블슈팅

성능/운영 포인트

  • Hadoop 병행 작업이 사라져 스트리밍 잡 처리 성능이 약 226% 향상
  • 컴퓨팅 자원을 Spark에 집중하고 컴퓨팅 최적화 노드를 사용해 연간 컴퓨팅 비용 40% 이상 절감
  • 다양한 Spark 버전과 의존성 환경을 유연하게 운영할 수 있는 기반 확보

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...